78178 lines
2.1 MiB
78178 lines
2.1 MiB
{
|
|
"best_global_step": null,
|
|
"best_metric": null,
|
|
"best_model_checkpoint": null,
|
|
"epoch": 3.034312390585489,
|
|
"eval_steps": 3000,
|
|
"global_step": 39000,
|
|
"is_hyper_param_search": false,
|
|
"is_local_process_zero": true,
|
|
"is_world_process_zero": true,
|
|
"log_history": [
|
|
{
|
|
"entropy": 10.692063236236573,
|
|
"epoch": 0.00038902937171756465,
|
|
"grad_norm": 13.75,
|
|
"learning_rate": 2e-06,
|
|
"loss": 10.8016,
|
|
"mean_token_accuracy": 0.0,
|
|
"num_tokens": 8755.0,
|
|
"step": 5
|
|
},
|
|
{
|
|
"entropy": 10.691958236694337,
|
|
"epoch": 0.0007780587434351293,
|
|
"grad_norm": 14.0625,
|
|
"learning_rate": 4.5e-06,
|
|
"loss": 10.7404,
|
|
"mean_token_accuracy": 0.000141643057577312,
|
|
"num_tokens": 17641.0,
|
|
"step": 10
|
|
},
|
|
{
|
|
"entropy": 10.690918159484863,
|
|
"epoch": 0.001167088115152694,
|
|
"grad_norm": 10.3125,
|
|
"learning_rate": 7e-06,
|
|
"loss": 10.4828,
|
|
"mean_token_accuracy": 0.025441211403813214,
|
|
"num_tokens": 26293.0,
|
|
"step": 15
|
|
},
|
|
{
|
|
"entropy": 10.67647647857666,
|
|
"epoch": 0.0015561174868702586,
|
|
"grad_norm": 6.5,
|
|
"learning_rate": 9.5e-06,
|
|
"loss": 10.2109,
|
|
"mean_token_accuracy": 0.040661663934588435,
|
|
"num_tokens": 35627.0,
|
|
"step": 20
|
|
},
|
|
{
|
|
"entropy": 10.60925121307373,
|
|
"epoch": 0.0019451468585878235,
|
|
"grad_norm": 4.28125,
|
|
"learning_rate": 1.2e-05,
|
|
"loss": 9.8983,
|
|
"mean_token_accuracy": 0.04408857449889183,
|
|
"num_tokens": 43861.0,
|
|
"step": 25
|
|
},
|
|
{
|
|
"entropy": 10.547060012817383,
|
|
"epoch": 0.002334176230305388,
|
|
"grad_norm": 3.625,
|
|
"learning_rate": 1.4500000000000002e-05,
|
|
"loss": 9.7771,
|
|
"mean_token_accuracy": 0.04438098855316639,
|
|
"num_tokens": 52816.0,
|
|
"step": 30
|
|
},
|
|
{
|
|
"entropy": 10.550695419311523,
|
|
"epoch": 0.0027232056020229526,
|
|
"grad_norm": 3.046875,
|
|
"learning_rate": 1.7000000000000003e-05,
|
|
"loss": 9.716,
|
|
"mean_token_accuracy": 0.044043789803981784,
|
|
"num_tokens": 61370.0,
|
|
"step": 35
|
|
},
|
|
{
|
|
"entropy": 10.541547393798828,
|
|
"epoch": 0.0031122349737405172,
|
|
"grad_norm": 2.84375,
|
|
"learning_rate": 1.95e-05,
|
|
"loss": 9.6407,
|
|
"mean_token_accuracy": 0.04505775421857834,
|
|
"num_tokens": 69444.0,
|
|
"step": 40
|
|
},
|
|
{
|
|
"entropy": 10.531424808502198,
|
|
"epoch": 0.003501264345458082,
|
|
"grad_norm": 2.6875,
|
|
"learning_rate": 2.2e-05,
|
|
"loss": 9.591,
|
|
"mean_token_accuracy": 0.04762658141553402,
|
|
"num_tokens": 77892.0,
|
|
"step": 45
|
|
},
|
|
{
|
|
"entropy": 10.512275695800781,
|
|
"epoch": 0.003890293717175647,
|
|
"grad_norm": 2.53125,
|
|
"learning_rate": 2.4500000000000003e-05,
|
|
"loss": 9.5439,
|
|
"mean_token_accuracy": 0.061067067086696625,
|
|
"num_tokens": 86154.0,
|
|
"step": 50
|
|
},
|
|
{
|
|
"entropy": 10.401442527770996,
|
|
"epoch": 0.004279323088893211,
|
|
"grad_norm": 2.3125,
|
|
"learning_rate": 2.7e-05,
|
|
"loss": 9.4981,
|
|
"mean_token_accuracy": 0.06119193881750107,
|
|
"num_tokens": 95589.0,
|
|
"step": 55
|
|
},
|
|
{
|
|
"entropy": 10.321024227142335,
|
|
"epoch": 0.004668352460610776,
|
|
"grad_norm": 2.296875,
|
|
"learning_rate": 2.95e-05,
|
|
"loss": 9.4607,
|
|
"mean_token_accuracy": 0.06384341418743134,
|
|
"num_tokens": 105268.0,
|
|
"step": 60
|
|
},
|
|
{
|
|
"entropy": 10.332015323638917,
|
|
"epoch": 0.0050573818323283405,
|
|
"grad_norm": 2.0,
|
|
"learning_rate": 3.2e-05,
|
|
"loss": 9.2989,
|
|
"mean_token_accuracy": 0.06944983527064323,
|
|
"num_tokens": 113347.0,
|
|
"step": 65
|
|
},
|
|
{
|
|
"entropy": 10.328180885314941,
|
|
"epoch": 0.005446411204045905,
|
|
"grad_norm": 2.390625,
|
|
"learning_rate": 3.4500000000000005e-05,
|
|
"loss": 9.2579,
|
|
"mean_token_accuracy": 0.06596625149250031,
|
|
"num_tokens": 121235.0,
|
|
"step": 70
|
|
},
|
|
{
|
|
"entropy": 10.303812599182129,
|
|
"epoch": 0.00583544057576347,
|
|
"grad_norm": 1.9296875,
|
|
"learning_rate": 3.7e-05,
|
|
"loss": 9.152,
|
|
"mean_token_accuracy": 0.06924093440175057,
|
|
"num_tokens": 129529.0,
|
|
"step": 75
|
|
},
|
|
{
|
|
"entropy": 10.268609428405762,
|
|
"epoch": 0.0062244699474810344,
|
|
"grad_norm": 1.9375,
|
|
"learning_rate": 3.95e-05,
|
|
"loss": 9.0909,
|
|
"mean_token_accuracy": 0.06597104258835315,
|
|
"num_tokens": 137918.0,
|
|
"step": 80
|
|
},
|
|
{
|
|
"entropy": 10.261999797821044,
|
|
"epoch": 0.006613499319198599,
|
|
"grad_norm": 2.078125,
|
|
"learning_rate": 4.2000000000000004e-05,
|
|
"loss": 8.9463,
|
|
"mean_token_accuracy": 0.06913249380886555,
|
|
"num_tokens": 146445.0,
|
|
"step": 85
|
|
},
|
|
{
|
|
"entropy": 10.207746601104736,
|
|
"epoch": 0.007002528690916164,
|
|
"grad_norm": 1.9921875,
|
|
"learning_rate": 4.45e-05,
|
|
"loss": 8.9607,
|
|
"mean_token_accuracy": 0.0626212403178215,
|
|
"num_tokens": 155904.0,
|
|
"step": 90
|
|
},
|
|
{
|
|
"entropy": 10.237759494781494,
|
|
"epoch": 0.007391558062633729,
|
|
"grad_norm": 1.8828125,
|
|
"learning_rate": 4.7000000000000004e-05,
|
|
"loss": 8.8494,
|
|
"mean_token_accuracy": 0.06117668002843857,
|
|
"num_tokens": 164436.0,
|
|
"step": 95
|
|
},
|
|
{
|
|
"entropy": 10.121377658843993,
|
|
"epoch": 0.007780587434351294,
|
|
"grad_norm": 1.6171875,
|
|
"learning_rate": 4.9500000000000004e-05,
|
|
"loss": 8.7265,
|
|
"mean_token_accuracy": 0.06574496850371361,
|
|
"num_tokens": 172985.0,
|
|
"step": 100
|
|
},
|
|
{
|
|
"entropy": 10.09178113937378,
|
|
"epoch": 0.008169616806068859,
|
|
"grad_norm": 1.625,
|
|
"learning_rate": 5.2e-05,
|
|
"loss": 8.5893,
|
|
"mean_token_accuracy": 0.0671191781759262,
|
|
"num_tokens": 182084.0,
|
|
"step": 105
|
|
},
|
|
{
|
|
"entropy": 10.011064624786377,
|
|
"epoch": 0.008558646177786422,
|
|
"grad_norm": 1.609375,
|
|
"learning_rate": 5.45e-05,
|
|
"loss": 8.4644,
|
|
"mean_token_accuracy": 0.07035542875528336,
|
|
"num_tokens": 190742.0,
|
|
"step": 110
|
|
},
|
|
{
|
|
"entropy": 9.856452560424804,
|
|
"epoch": 0.008947675549503988,
|
|
"grad_norm": 1.609375,
|
|
"learning_rate": 5.7e-05,
|
|
"loss": 8.3796,
|
|
"mean_token_accuracy": 0.06666092537343501,
|
|
"num_tokens": 199600.0,
|
|
"step": 115
|
|
},
|
|
{
|
|
"entropy": 9.79461441040039,
|
|
"epoch": 0.009336704921221552,
|
|
"grad_norm": 1.7578125,
|
|
"learning_rate": 5.9499999999999996e-05,
|
|
"loss": 8.2817,
|
|
"mean_token_accuracy": 0.06714933924376965,
|
|
"num_tokens": 207883.0,
|
|
"step": 120
|
|
},
|
|
{
|
|
"entropy": 9.610589599609375,
|
|
"epoch": 0.009725734292939117,
|
|
"grad_norm": 1.9453125,
|
|
"learning_rate": 6.2e-05,
|
|
"loss": 8.2106,
|
|
"mean_token_accuracy": 0.06839943863451481,
|
|
"num_tokens": 216216.0,
|
|
"step": 125
|
|
},
|
|
{
|
|
"entropy": 9.441116333007812,
|
|
"epoch": 0.010114763664656681,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 6.450000000000001e-05,
|
|
"loss": 8.0674,
|
|
"mean_token_accuracy": 0.06686468720436096,
|
|
"num_tokens": 225250.0,
|
|
"step": 130
|
|
},
|
|
{
|
|
"entropy": 9.317984580993652,
|
|
"epoch": 0.010503793036374246,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 6.7e-05,
|
|
"loss": 7.9861,
|
|
"mean_token_accuracy": 0.06643427908420563,
|
|
"num_tokens": 233748.0,
|
|
"step": 135
|
|
},
|
|
{
|
|
"entropy": 9.106039714813232,
|
|
"epoch": 0.01089282240809181,
|
|
"grad_norm": 1.578125,
|
|
"learning_rate": 6.950000000000001e-05,
|
|
"loss": 7.9137,
|
|
"mean_token_accuracy": 0.06834710240364075,
|
|
"num_tokens": 242629.0,
|
|
"step": 140
|
|
},
|
|
{
|
|
"entropy": 9.014894771575928,
|
|
"epoch": 0.011281851779809376,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 7.2e-05,
|
|
"loss": 7.825,
|
|
"mean_token_accuracy": 0.06285446509718895,
|
|
"num_tokens": 251458.0,
|
|
"step": 145
|
|
},
|
|
{
|
|
"entropy": 8.738780689239501,
|
|
"epoch": 0.01167088115152694,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 7.45e-05,
|
|
"loss": 7.7458,
|
|
"mean_token_accuracy": 0.07414877340197563,
|
|
"num_tokens": 260557.0,
|
|
"step": 150
|
|
},
|
|
{
|
|
"entropy": 8.657924938201905,
|
|
"epoch": 0.012059910523244505,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 7.7e-05,
|
|
"loss": 7.7607,
|
|
"mean_token_accuracy": 0.06932397484779358,
|
|
"num_tokens": 269262.0,
|
|
"step": 155
|
|
},
|
|
{
|
|
"entropy": 8.543195724487305,
|
|
"epoch": 0.012448939894962069,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 7.950000000000001e-05,
|
|
"loss": 7.662,
|
|
"mean_token_accuracy": 0.07255172692239284,
|
|
"num_tokens": 277804.0,
|
|
"step": 160
|
|
},
|
|
{
|
|
"entropy": 8.427197933197021,
|
|
"epoch": 0.012837969266679634,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 8.2e-05,
|
|
"loss": 7.6187,
|
|
"mean_token_accuracy": 0.0732395388185978,
|
|
"num_tokens": 287450.0,
|
|
"step": 165
|
|
},
|
|
{
|
|
"entropy": 8.372405529022217,
|
|
"epoch": 0.013226998638397198,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 8.450000000000001e-05,
|
|
"loss": 7.6324,
|
|
"mean_token_accuracy": 0.07173264883458615,
|
|
"num_tokens": 296497.0,
|
|
"step": 170
|
|
},
|
|
{
|
|
"entropy": 8.20972490310669,
|
|
"epoch": 0.013616028010114764,
|
|
"grad_norm": 1.546875,
|
|
"learning_rate": 8.7e-05,
|
|
"loss": 7.5358,
|
|
"mean_token_accuracy": 0.07566781267523766,
|
|
"num_tokens": 305414.0,
|
|
"step": 175
|
|
},
|
|
{
|
|
"entropy": 8.156252384185791,
|
|
"epoch": 0.014005057381832327,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 8.95e-05,
|
|
"loss": 7.5503,
|
|
"mean_token_accuracy": 0.07218287587165832,
|
|
"num_tokens": 313639.0,
|
|
"step": 180
|
|
},
|
|
{
|
|
"entropy": 8.146188354492187,
|
|
"epoch": 0.014394086753549893,
|
|
"grad_norm": 1.5,
|
|
"learning_rate": 9.2e-05,
|
|
"loss": 7.5511,
|
|
"mean_token_accuracy": 0.07190043628215789,
|
|
"num_tokens": 322855.0,
|
|
"step": 185
|
|
},
|
|
{
|
|
"entropy": 8.109641361236573,
|
|
"epoch": 0.014783116125267459,
|
|
"grad_norm": 1.7109375,
|
|
"learning_rate": 9.45e-05,
|
|
"loss": 7.6463,
|
|
"mean_token_accuracy": 0.07696216627955436,
|
|
"num_tokens": 332071.0,
|
|
"step": 190
|
|
},
|
|
{
|
|
"entropy": 8.094918823242187,
|
|
"epoch": 0.015172145496985022,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 9.7e-05,
|
|
"loss": 7.4403,
|
|
"mean_token_accuracy": 0.077825241163373,
|
|
"num_tokens": 339990.0,
|
|
"step": 195
|
|
},
|
|
{
|
|
"entropy": 7.986162710189819,
|
|
"epoch": 0.015561174868702588,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 9.95e-05,
|
|
"loss": 7.489,
|
|
"mean_token_accuracy": 0.0800612710416317,
|
|
"num_tokens": 348581.0,
|
|
"step": 200
|
|
},
|
|
{
|
|
"entropy": 8.061878490447999,
|
|
"epoch": 0.01595020424042015,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.000102,
|
|
"loss": 7.4901,
|
|
"mean_token_accuracy": 0.07649841569364071,
|
|
"num_tokens": 357032.0,
|
|
"step": 205
|
|
},
|
|
{
|
|
"entropy": 7.995882654190064,
|
|
"epoch": 0.016339233612137717,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.00010449999999999999,
|
|
"loss": 7.4516,
|
|
"mean_token_accuracy": 0.0756280355155468,
|
|
"num_tokens": 366562.0,
|
|
"step": 210
|
|
},
|
|
{
|
|
"entropy": 7.987649202346802,
|
|
"epoch": 0.016728262983855283,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.000107,
|
|
"loss": 7.4428,
|
|
"mean_token_accuracy": 0.07756799235939979,
|
|
"num_tokens": 374555.0,
|
|
"step": 215
|
|
},
|
|
{
|
|
"entropy": 7.977654266357422,
|
|
"epoch": 0.017117292355572845,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.0001095,
|
|
"loss": 7.4725,
|
|
"mean_token_accuracy": 0.07444248832762242,
|
|
"num_tokens": 383583.0,
|
|
"step": 220
|
|
},
|
|
{
|
|
"entropy": 7.902964973449707,
|
|
"epoch": 0.01750632172729041,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.000112,
|
|
"loss": 7.4967,
|
|
"mean_token_accuracy": 0.07443738169968128,
|
|
"num_tokens": 392932.0,
|
|
"step": 225
|
|
},
|
|
{
|
|
"entropy": 7.966854381561279,
|
|
"epoch": 0.017895351099007976,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.0001145,
|
|
"loss": 7.3305,
|
|
"mean_token_accuracy": 0.07826850302517414,
|
|
"num_tokens": 401653.0,
|
|
"step": 230
|
|
},
|
|
{
|
|
"entropy": 7.823260259628296,
|
|
"epoch": 0.01828438047072554,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.00011700000000000001,
|
|
"loss": 7.4224,
|
|
"mean_token_accuracy": 0.08165781088173389,
|
|
"num_tokens": 410432.0,
|
|
"step": 235
|
|
},
|
|
{
|
|
"entropy": 7.791707134246826,
|
|
"epoch": 0.018673409842443103,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00011949999999999999,
|
|
"loss": 7.3874,
|
|
"mean_token_accuracy": 0.07677992731332779,
|
|
"num_tokens": 419380.0,
|
|
"step": 240
|
|
},
|
|
{
|
|
"entropy": 7.91221809387207,
|
|
"epoch": 0.01906243921416067,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.000122,
|
|
"loss": 7.2983,
|
|
"mean_token_accuracy": 0.08029103949666024,
|
|
"num_tokens": 427682.0,
|
|
"step": 245
|
|
},
|
|
{
|
|
"entropy": 7.782497692108154,
|
|
"epoch": 0.019451468585878234,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0001245,
|
|
"loss": 7.3944,
|
|
"mean_token_accuracy": 0.07596049457788467,
|
|
"num_tokens": 437708.0,
|
|
"step": 250
|
|
},
|
|
{
|
|
"entropy": 7.839935350418091,
|
|
"epoch": 0.0198404979575958,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.000127,
|
|
"loss": 7.3625,
|
|
"mean_token_accuracy": 0.08329648077487946,
|
|
"num_tokens": 446480.0,
|
|
"step": 255
|
|
},
|
|
{
|
|
"entropy": 7.786860942840576,
|
|
"epoch": 0.020229527329313362,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.0001295,
|
|
"loss": 7.3896,
|
|
"mean_token_accuracy": 0.0760398305952549,
|
|
"num_tokens": 455273.0,
|
|
"step": 260
|
|
},
|
|
{
|
|
"entropy": 7.816596269607544,
|
|
"epoch": 0.020618556701030927,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.000132,
|
|
"loss": 7.308,
|
|
"mean_token_accuracy": 0.08219457417726517,
|
|
"num_tokens": 464306.0,
|
|
"step": 265
|
|
},
|
|
{
|
|
"entropy": 7.677759218215942,
|
|
"epoch": 0.021007586072748493,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00013450000000000002,
|
|
"loss": 7.3139,
|
|
"mean_token_accuracy": 0.0749464474618435,
|
|
"num_tokens": 472812.0,
|
|
"step": 270
|
|
},
|
|
{
|
|
"entropy": 7.768700742721558,
|
|
"epoch": 0.02139661544446606,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.00013700000000000002,
|
|
"loss": 7.2851,
|
|
"mean_token_accuracy": 0.08093390390276908,
|
|
"num_tokens": 481326.0,
|
|
"step": 275
|
|
},
|
|
{
|
|
"entropy": 7.76422529220581,
|
|
"epoch": 0.02178564481618362,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.0001395,
|
|
"loss": 7.2397,
|
|
"mean_token_accuracy": 0.08092119097709656,
|
|
"num_tokens": 489147.0,
|
|
"step": 280
|
|
},
|
|
{
|
|
"entropy": 7.733962726593018,
|
|
"epoch": 0.022174674187901186,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.00014199999999999998,
|
|
"loss": 7.2303,
|
|
"mean_token_accuracy": 0.08891455829143524,
|
|
"num_tokens": 497455.0,
|
|
"step": 285
|
|
},
|
|
{
|
|
"entropy": 7.637256097793579,
|
|
"epoch": 0.02256370355961875,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.0001445,
|
|
"loss": 7.1567,
|
|
"mean_token_accuracy": 0.08741839975118637,
|
|
"num_tokens": 506735.0,
|
|
"step": 290
|
|
},
|
|
{
|
|
"entropy": 7.682271909713745,
|
|
"epoch": 0.022952732931336317,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.000147,
|
|
"loss": 7.2384,
|
|
"mean_token_accuracy": 0.08303680419921874,
|
|
"num_tokens": 515976.0,
|
|
"step": 295
|
|
},
|
|
{
|
|
"entropy": 7.649052429199219,
|
|
"epoch": 0.02334176230305388,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0001495,
|
|
"loss": 7.2294,
|
|
"mean_token_accuracy": 0.08583831116557121,
|
|
"num_tokens": 524986.0,
|
|
"step": 300
|
|
},
|
|
{
|
|
"entropy": 7.687331056594848,
|
|
"epoch": 0.023730791674771445,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.000152,
|
|
"loss": 7.2415,
|
|
"mean_token_accuracy": 0.09258508980274201,
|
|
"num_tokens": 533146.0,
|
|
"step": 305
|
|
},
|
|
{
|
|
"entropy": 7.660231113433838,
|
|
"epoch": 0.02411982104648901,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.00015450000000000001,
|
|
"loss": 7.1305,
|
|
"mean_token_accuracy": 0.09208664670586586,
|
|
"num_tokens": 541704.0,
|
|
"step": 310
|
|
},
|
|
{
|
|
"entropy": 7.569728803634644,
|
|
"epoch": 0.024508850418206576,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.000157,
|
|
"loss": 7.1132,
|
|
"mean_token_accuracy": 0.09219249933958054,
|
|
"num_tokens": 550088.0,
|
|
"step": 315
|
|
},
|
|
{
|
|
"entropy": 7.553810167312622,
|
|
"epoch": 0.024897879789924138,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.0001595,
|
|
"loss": 7.1116,
|
|
"mean_token_accuracy": 0.08964145854115486,
|
|
"num_tokens": 558763.0,
|
|
"step": 320
|
|
},
|
|
{
|
|
"entropy": 7.644041442871094,
|
|
"epoch": 0.025286909161641703,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.000162,
|
|
"loss": 7.2054,
|
|
"mean_token_accuracy": 0.08601472824811936,
|
|
"num_tokens": 567538.0,
|
|
"step": 325
|
|
},
|
|
{
|
|
"entropy": 7.581082773208618,
|
|
"epoch": 0.02567593853335927,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00016450000000000001,
|
|
"loss": 7.2187,
|
|
"mean_token_accuracy": 0.0808300495147705,
|
|
"num_tokens": 577626.0,
|
|
"step": 330
|
|
},
|
|
{
|
|
"entropy": 7.481959867477417,
|
|
"epoch": 0.026064967905076834,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.00016700000000000002,
|
|
"loss": 7.1528,
|
|
"mean_token_accuracy": 0.08528566733002663,
|
|
"num_tokens": 587163.0,
|
|
"step": 335
|
|
},
|
|
{
|
|
"entropy": 7.5628759384155275,
|
|
"epoch": 0.026453997276794396,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00016950000000000003,
|
|
"loss": 7.1352,
|
|
"mean_token_accuracy": 0.08886056169867515,
|
|
"num_tokens": 595896.0,
|
|
"step": 340
|
|
},
|
|
{
|
|
"entropy": 7.6669008255004885,
|
|
"epoch": 0.026843026648511962,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.00017199999999999998,
|
|
"loss": 7.1495,
|
|
"mean_token_accuracy": 0.08720074668526649,
|
|
"num_tokens": 603815.0,
|
|
"step": 345
|
|
},
|
|
{
|
|
"entropy": 7.511917448043823,
|
|
"epoch": 0.027232056020229527,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.00017449999999999999,
|
|
"loss": 7.1631,
|
|
"mean_token_accuracy": 0.09270136058330536,
|
|
"num_tokens": 612208.0,
|
|
"step": 350
|
|
},
|
|
{
|
|
"entropy": 7.517125844955444,
|
|
"epoch": 0.027621085391947093,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.000177,
|
|
"loss": 7.1271,
|
|
"mean_token_accuracy": 0.09068955928087234,
|
|
"num_tokens": 621840.0,
|
|
"step": 355
|
|
},
|
|
{
|
|
"entropy": 7.542174816131592,
|
|
"epoch": 0.028010114763664655,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0001795,
|
|
"loss": 7.1365,
|
|
"mean_token_accuracy": 0.0883019782602787,
|
|
"num_tokens": 630770.0,
|
|
"step": 360
|
|
},
|
|
{
|
|
"entropy": 7.5013352394104,
|
|
"epoch": 0.02839914413538222,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.000182,
|
|
"loss": 7.1354,
|
|
"mean_token_accuracy": 0.08821968138217925,
|
|
"num_tokens": 640313.0,
|
|
"step": 365
|
|
},
|
|
{
|
|
"entropy": 7.581635475158691,
|
|
"epoch": 0.028788173507099786,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.0001845,
|
|
"loss": 7.1571,
|
|
"mean_token_accuracy": 0.09343784376978874,
|
|
"num_tokens": 648594.0,
|
|
"step": 370
|
|
},
|
|
{
|
|
"entropy": 7.465378761291504,
|
|
"epoch": 0.02917720287881735,
|
|
"grad_norm": 1.5078125,
|
|
"learning_rate": 0.000187,
|
|
"loss": 7.1645,
|
|
"mean_token_accuracy": 0.09112582504749298,
|
|
"num_tokens": 656478.0,
|
|
"step": 375
|
|
},
|
|
{
|
|
"entropy": 7.526745271682739,
|
|
"epoch": 0.029566232250534917,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0001895,
|
|
"loss": 7.1162,
|
|
"mean_token_accuracy": 0.09759116843342781,
|
|
"num_tokens": 665405.0,
|
|
"step": 380
|
|
},
|
|
{
|
|
"entropy": 7.474437618255616,
|
|
"epoch": 0.02995526162225248,
|
|
"grad_norm": 1.4921875,
|
|
"learning_rate": 0.000192,
|
|
"loss": 7.1315,
|
|
"mean_token_accuracy": 0.09043080434203148,
|
|
"num_tokens": 674301.0,
|
|
"step": 385
|
|
},
|
|
{
|
|
"entropy": 7.500934886932373,
|
|
"epoch": 0.030344290993970045,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0001945,
|
|
"loss": 7.1395,
|
|
"mean_token_accuracy": 0.09345336705446243,
|
|
"num_tokens": 683159.0,
|
|
"step": 390
|
|
},
|
|
{
|
|
"entropy": 7.383391237258911,
|
|
"epoch": 0.03073332036568761,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.00019700000000000002,
|
|
"loss": 6.9546,
|
|
"mean_token_accuracy": 0.09936677888035775,
|
|
"num_tokens": 690992.0,
|
|
"step": 395
|
|
},
|
|
{
|
|
"entropy": 7.346968412399292,
|
|
"epoch": 0.031122349737405176,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.00019950000000000002,
|
|
"loss": 7.0703,
|
|
"mean_token_accuracy": 0.09284654334187507,
|
|
"num_tokens": 699934.0,
|
|
"step": 400
|
|
},
|
|
{
|
|
"entropy": 7.553390264511108,
|
|
"epoch": 0.03151137910912274,
|
|
"grad_norm": 1.578125,
|
|
"learning_rate": 0.000202,
|
|
"loss": 7.1035,
|
|
"mean_token_accuracy": 0.09367862120270729,
|
|
"num_tokens": 708844.0,
|
|
"step": 405
|
|
},
|
|
{
|
|
"entropy": 7.4107770919799805,
|
|
"epoch": 0.0319004084808403,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00020449999999999998,
|
|
"loss": 7.1629,
|
|
"mean_token_accuracy": 0.08833086043596268,
|
|
"num_tokens": 718148.0,
|
|
"step": 410
|
|
},
|
|
{
|
|
"entropy": 7.559677696228027,
|
|
"epoch": 0.03228943785255787,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.000207,
|
|
"loss": 7.0958,
|
|
"mean_token_accuracy": 0.08757410496473313,
|
|
"num_tokens": 726859.0,
|
|
"step": 415
|
|
},
|
|
{
|
|
"entropy": 7.36133918762207,
|
|
"epoch": 0.032678467224275434,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.0002095,
|
|
"loss": 7.1026,
|
|
"mean_token_accuracy": 0.09037772119045258,
|
|
"num_tokens": 735045.0,
|
|
"step": 420
|
|
},
|
|
{
|
|
"entropy": 7.265546607971191,
|
|
"epoch": 0.033067496595993,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.000212,
|
|
"loss": 6.9826,
|
|
"mean_token_accuracy": 0.0958486907184124,
|
|
"num_tokens": 743538.0,
|
|
"step": 425
|
|
},
|
|
{
|
|
"entropy": 7.454471921920776,
|
|
"epoch": 0.033456525967710565,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0002145,
|
|
"loss": 7.017,
|
|
"mean_token_accuracy": 0.09482243955135346,
|
|
"num_tokens": 752518.0,
|
|
"step": 430
|
|
},
|
|
{
|
|
"entropy": 7.29300708770752,
|
|
"epoch": 0.033845555339428124,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.00021700000000000002,
|
|
"loss": 7.0525,
|
|
"mean_token_accuracy": 0.09259525015950203,
|
|
"num_tokens": 760354.0,
|
|
"step": 435
|
|
},
|
|
{
|
|
"entropy": 7.4215178966522215,
|
|
"epoch": 0.03423458471114569,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.0002195,
|
|
"loss": 7.1053,
|
|
"mean_token_accuracy": 0.09021464213728905,
|
|
"num_tokens": 769522.0,
|
|
"step": 440
|
|
},
|
|
{
|
|
"entropy": 7.375669765472412,
|
|
"epoch": 0.034623614082863255,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.000222,
|
|
"loss": 7.023,
|
|
"mean_token_accuracy": 0.09649827480316162,
|
|
"num_tokens": 778548.0,
|
|
"step": 445
|
|
},
|
|
{
|
|
"entropy": 7.265977478027343,
|
|
"epoch": 0.03501264345458082,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0002245,
|
|
"loss": 7.0381,
|
|
"mean_token_accuracy": 0.09258587285876274,
|
|
"num_tokens": 787666.0,
|
|
"step": 450
|
|
},
|
|
{
|
|
"entropy": 7.404888343811035,
|
|
"epoch": 0.035401672826298386,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.00022700000000000002,
|
|
"loss": 6.9548,
|
|
"mean_token_accuracy": 0.09554951265454292,
|
|
"num_tokens": 796550.0,
|
|
"step": 455
|
|
},
|
|
{
|
|
"entropy": 7.379618072509766,
|
|
"epoch": 0.03579070219801595,
|
|
"grad_norm": 1.5859375,
|
|
"learning_rate": 0.00022950000000000002,
|
|
"loss": 7.0295,
|
|
"mean_token_accuracy": 0.09436309635639191,
|
|
"num_tokens": 804549.0,
|
|
"step": 460
|
|
},
|
|
{
|
|
"entropy": 7.194296884536743,
|
|
"epoch": 0.03617973156973352,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00023200000000000003,
|
|
"loss": 7.0004,
|
|
"mean_token_accuracy": 0.09524615257978439,
|
|
"num_tokens": 813328.0,
|
|
"step": 465
|
|
},
|
|
{
|
|
"entropy": 7.384324455261231,
|
|
"epoch": 0.03656876094145108,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00023449999999999998,
|
|
"loss": 7.0326,
|
|
"mean_token_accuracy": 0.09230693653225899,
|
|
"num_tokens": 821733.0,
|
|
"step": 470
|
|
},
|
|
{
|
|
"entropy": 7.3139783382415775,
|
|
"epoch": 0.03695779031316864,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.000237,
|
|
"loss": 6.9669,
|
|
"mean_token_accuracy": 0.09483846426010131,
|
|
"num_tokens": 830243.0,
|
|
"step": 475
|
|
},
|
|
{
|
|
"entropy": 7.309220647811889,
|
|
"epoch": 0.03734681968488621,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0002395,
|
|
"loss": 6.9553,
|
|
"mean_token_accuracy": 0.09212375655770302,
|
|
"num_tokens": 839059.0,
|
|
"step": 480
|
|
},
|
|
{
|
|
"entropy": 7.19914059638977,
|
|
"epoch": 0.03773584905660377,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.000242,
|
|
"loss": 6.8376,
|
|
"mean_token_accuracy": 0.10036729499697686,
|
|
"num_tokens": 846932.0,
|
|
"step": 485
|
|
},
|
|
{
|
|
"entropy": 7.361199140548706,
|
|
"epoch": 0.03812487842832134,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0002445,
|
|
"loss": 7.0514,
|
|
"mean_token_accuracy": 0.08944635763764382,
|
|
"num_tokens": 855333.0,
|
|
"step": 490
|
|
},
|
|
{
|
|
"entropy": 7.1707884788513185,
|
|
"epoch": 0.0385139078000389,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.000247,
|
|
"loss": 6.809,
|
|
"mean_token_accuracy": 0.09626470431685448,
|
|
"num_tokens": 863571.0,
|
|
"step": 495
|
|
},
|
|
{
|
|
"entropy": 7.152101230621338,
|
|
"epoch": 0.03890293717175647,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0002495,
|
|
"loss": 6.8996,
|
|
"mean_token_accuracy": 0.10517843365669251,
|
|
"num_tokens": 872145.0,
|
|
"step": 500
|
|
},
|
|
{
|
|
"entropy": 7.187833833694458,
|
|
"epoch": 0.039291966543474034,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.000252,
|
|
"loss": 6.9394,
|
|
"mean_token_accuracy": 0.09892025515437126,
|
|
"num_tokens": 880634.0,
|
|
"step": 505
|
|
},
|
|
{
|
|
"entropy": 7.235556554794312,
|
|
"epoch": 0.0396809959151916,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.0002545,
|
|
"loss": 6.8712,
|
|
"mean_token_accuracy": 0.09984394237399101,
|
|
"num_tokens": 889178.0,
|
|
"step": 510
|
|
},
|
|
{
|
|
"entropy": 7.149497556686401,
|
|
"epoch": 0.04007002528690916,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.000257,
|
|
"loss": 6.885,
|
|
"mean_token_accuracy": 0.09859361201524734,
|
|
"num_tokens": 898255.0,
|
|
"step": 515
|
|
},
|
|
{
|
|
"entropy": 7.130793571472168,
|
|
"epoch": 0.040459054658626724,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 0.0002595,
|
|
"loss": 6.9412,
|
|
"mean_token_accuracy": 0.08988485783338547,
|
|
"num_tokens": 907369.0,
|
|
"step": 520
|
|
},
|
|
{
|
|
"entropy": 7.193523645401001,
|
|
"epoch": 0.04084808403034429,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.000262,
|
|
"loss": 6.8381,
|
|
"mean_token_accuracy": 0.0956579439342022,
|
|
"num_tokens": 915946.0,
|
|
"step": 525
|
|
},
|
|
{
|
|
"entropy": 7.214367437362671,
|
|
"epoch": 0.041237113402061855,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00026450000000000003,
|
|
"loss": 6.8968,
|
|
"mean_token_accuracy": 0.09464456140995026,
|
|
"num_tokens": 925579.0,
|
|
"step": 530
|
|
},
|
|
{
|
|
"entropy": 7.194347190856933,
|
|
"epoch": 0.04162614277377942,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00026700000000000004,
|
|
"loss": 6.8929,
|
|
"mean_token_accuracy": 0.09103822857141494,
|
|
"num_tokens": 934732.0,
|
|
"step": 535
|
|
},
|
|
{
|
|
"entropy": 7.1877021312713625,
|
|
"epoch": 0.042015172145496986,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.00026950000000000005,
|
|
"loss": 6.9548,
|
|
"mean_token_accuracy": 0.09189340770244599,
|
|
"num_tokens": 943371.0,
|
|
"step": 540
|
|
},
|
|
{
|
|
"entropy": 7.129611682891846,
|
|
"epoch": 0.04240420151721455,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.00027200000000000005,
|
|
"loss": 6.7935,
|
|
"mean_token_accuracy": 0.09684587121009827,
|
|
"num_tokens": 951977.0,
|
|
"step": 545
|
|
},
|
|
{
|
|
"entropy": 7.075324392318725,
|
|
"epoch": 0.04279323088893212,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0002745,
|
|
"loss": 6.7956,
|
|
"mean_token_accuracy": 0.09852224737405776,
|
|
"num_tokens": 960474.0,
|
|
"step": 550
|
|
},
|
|
{
|
|
"entropy": 7.242029809951783,
|
|
"epoch": 0.04318226026064968,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.000277,
|
|
"loss": 6.921,
|
|
"mean_token_accuracy": 0.09615759328007698,
|
|
"num_tokens": 969823.0,
|
|
"step": 555
|
|
},
|
|
{
|
|
"entropy": 7.148642349243164,
|
|
"epoch": 0.04357128963236724,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.0002795,
|
|
"loss": 6.8541,
|
|
"mean_token_accuracy": 0.10372538045048714,
|
|
"num_tokens": 977417.0,
|
|
"step": 560
|
|
},
|
|
{
|
|
"entropy": 7.050511121749878,
|
|
"epoch": 0.04396031900408481,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.00028199999999999997,
|
|
"loss": 6.8525,
|
|
"mean_token_accuracy": 0.10765723884105682,
|
|
"num_tokens": 985519.0,
|
|
"step": 565
|
|
},
|
|
{
|
|
"entropy": 7.106280851364136,
|
|
"epoch": 0.04434934837580237,
|
|
"grad_norm": 1.546875,
|
|
"learning_rate": 0.0002845,
|
|
"loss": 6.8486,
|
|
"mean_token_accuracy": 0.10191520527005196,
|
|
"num_tokens": 994136.0,
|
|
"step": 570
|
|
},
|
|
{
|
|
"entropy": 7.03365535736084,
|
|
"epoch": 0.04473837774751994,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.000287,
|
|
"loss": 6.8207,
|
|
"mean_token_accuracy": 0.09769327566027641,
|
|
"num_tokens": 1002896.0,
|
|
"step": 575
|
|
},
|
|
{
|
|
"entropy": 7.198338603973388,
|
|
"epoch": 0.0451274071192375,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.0002895,
|
|
"loss": 6.9061,
|
|
"mean_token_accuracy": 0.10421423837542534,
|
|
"num_tokens": 1011032.0,
|
|
"step": 580
|
|
},
|
|
{
|
|
"entropy": 7.051746559143067,
|
|
"epoch": 0.04551643649095507,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.000292,
|
|
"loss": 6.8708,
|
|
"mean_token_accuracy": 0.09394787698984146,
|
|
"num_tokens": 1019901.0,
|
|
"step": 585
|
|
},
|
|
{
|
|
"entropy": 7.067822074890136,
|
|
"epoch": 0.045905465862672634,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0002945,
|
|
"loss": 6.8482,
|
|
"mean_token_accuracy": 0.09919805154204368,
|
|
"num_tokens": 1029049.0,
|
|
"step": 590
|
|
},
|
|
{
|
|
"entropy": 6.9990034103393555,
|
|
"epoch": 0.0462944952343902,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.000297,
|
|
"loss": 6.8086,
|
|
"mean_token_accuracy": 0.10822348445653915,
|
|
"num_tokens": 1037580.0,
|
|
"step": 595
|
|
},
|
|
{
|
|
"entropy": 7.196728610992432,
|
|
"epoch": 0.04668352460610776,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0002995,
|
|
"loss": 6.8679,
|
|
"mean_token_accuracy": 0.10288131684064865,
|
|
"num_tokens": 1045804.0,
|
|
"step": 600
|
|
},
|
|
{
|
|
"entropy": 7.0782746315002445,
|
|
"epoch": 0.047072553977825324,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.000302,
|
|
"loss": 6.8362,
|
|
"mean_token_accuracy": 0.09710147231817245,
|
|
"num_tokens": 1054719.0,
|
|
"step": 605
|
|
},
|
|
{
|
|
"entropy": 7.09404673576355,
|
|
"epoch": 0.04746158334954289,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0003045,
|
|
"loss": 6.8149,
|
|
"mean_token_accuracy": 0.1012077234685421,
|
|
"num_tokens": 1063373.0,
|
|
"step": 610
|
|
},
|
|
{
|
|
"entropy": 6.984814739227295,
|
|
"epoch": 0.047850612721260455,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.000307,
|
|
"loss": 6.8058,
|
|
"mean_token_accuracy": 0.10036636292934417,
|
|
"num_tokens": 1073021.0,
|
|
"step": 615
|
|
},
|
|
{
|
|
"entropy": 7.0786560535430905,
|
|
"epoch": 0.04823964209297802,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0003095,
|
|
"loss": 6.8696,
|
|
"mean_token_accuracy": 0.09600509628653527,
|
|
"num_tokens": 1081547.0,
|
|
"step": 620
|
|
},
|
|
{
|
|
"entropy": 7.0220740795135494,
|
|
"epoch": 0.048628671464695586,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.000312,
|
|
"loss": 6.8233,
|
|
"mean_token_accuracy": 0.09918136522173882,
|
|
"num_tokens": 1090695.0,
|
|
"step": 625
|
|
},
|
|
{
|
|
"entropy": 6.9606041431427,
|
|
"epoch": 0.04901770083641315,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0003145,
|
|
"loss": 6.7198,
|
|
"mean_token_accuracy": 0.10607226341962814,
|
|
"num_tokens": 1099563.0,
|
|
"step": 630
|
|
},
|
|
{
|
|
"entropy": 7.042634630203247,
|
|
"epoch": 0.04940673020813072,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.000317,
|
|
"loss": 6.8025,
|
|
"mean_token_accuracy": 0.09708617925643921,
|
|
"num_tokens": 1109021.0,
|
|
"step": 635
|
|
},
|
|
{
|
|
"entropy": 7.036008024215699,
|
|
"epoch": 0.049795759579848276,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0003195,
|
|
"loss": 6.7915,
|
|
"mean_token_accuracy": 0.10409486815333366,
|
|
"num_tokens": 1118281.0,
|
|
"step": 640
|
|
},
|
|
{
|
|
"entropy": 7.0259270668029785,
|
|
"epoch": 0.05018478895156584,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.000322,
|
|
"loss": 6.8364,
|
|
"mean_token_accuracy": 0.09575799703598023,
|
|
"num_tokens": 1127513.0,
|
|
"step": 645
|
|
},
|
|
{
|
|
"entropy": 6.843554496765137,
|
|
"epoch": 0.05057381832328341,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.00032450000000000003,
|
|
"loss": 6.7179,
|
|
"mean_token_accuracy": 0.10220488980412483,
|
|
"num_tokens": 1136140.0,
|
|
"step": 650
|
|
},
|
|
{
|
|
"entropy": 7.010839796066284,
|
|
"epoch": 0.05096284769500097,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00032700000000000003,
|
|
"loss": 6.7449,
|
|
"mean_token_accuracy": 0.10034143850207329,
|
|
"num_tokens": 1144297.0,
|
|
"step": 655
|
|
},
|
|
{
|
|
"entropy": 7.005735111236572,
|
|
"epoch": 0.05135187706671854,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.00032950000000000004,
|
|
"loss": 6.8315,
|
|
"mean_token_accuracy": 0.09598958343267441,
|
|
"num_tokens": 1153639.0,
|
|
"step": 660
|
|
},
|
|
{
|
|
"entropy": 7.042137622833252,
|
|
"epoch": 0.0517409064384361,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00033200000000000005,
|
|
"loss": 6.8044,
|
|
"mean_token_accuracy": 0.09692039787769317,
|
|
"num_tokens": 1162825.0,
|
|
"step": 665
|
|
},
|
|
{
|
|
"entropy": 6.893413639068603,
|
|
"epoch": 0.05212993581015367,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.00033450000000000005,
|
|
"loss": 6.8242,
|
|
"mean_token_accuracy": 0.10342787951231003,
|
|
"num_tokens": 1171887.0,
|
|
"step": 670
|
|
},
|
|
{
|
|
"entropy": 6.990288639068604,
|
|
"epoch": 0.052518965181871234,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.000337,
|
|
"loss": 6.723,
|
|
"mean_token_accuracy": 0.10218419954180717,
|
|
"num_tokens": 1179963.0,
|
|
"step": 675
|
|
},
|
|
{
|
|
"entropy": 6.915320777893067,
|
|
"epoch": 0.05290799455358879,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0003395,
|
|
"loss": 6.6987,
|
|
"mean_token_accuracy": 0.10984139442443848,
|
|
"num_tokens": 1188408.0,
|
|
"step": 680
|
|
},
|
|
{
|
|
"entropy": 6.944253206253052,
|
|
"epoch": 0.05329702392530636,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.000342,
|
|
"loss": 6.7404,
|
|
"mean_token_accuracy": 0.09963250234723091,
|
|
"num_tokens": 1197751.0,
|
|
"step": 685
|
|
},
|
|
{
|
|
"entropy": 6.910943222045899,
|
|
"epoch": 0.053686053297023924,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00034449999999999997,
|
|
"loss": 6.8019,
|
|
"mean_token_accuracy": 0.10173860564827919,
|
|
"num_tokens": 1207101.0,
|
|
"step": 690
|
|
},
|
|
{
|
|
"entropy": 6.96247820854187,
|
|
"epoch": 0.05407508266874149,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.000347,
|
|
"loss": 6.7768,
|
|
"mean_token_accuracy": 0.10386782586574554,
|
|
"num_tokens": 1216395.0,
|
|
"step": 695
|
|
},
|
|
{
|
|
"entropy": 6.914447498321533,
|
|
"epoch": 0.054464112040459055,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0003495,
|
|
"loss": 6.7579,
|
|
"mean_token_accuracy": 0.10488244742155076,
|
|
"num_tokens": 1225496.0,
|
|
"step": 700
|
|
},
|
|
{
|
|
"entropy": 6.9863011837005615,
|
|
"epoch": 0.05485314141217662,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.000352,
|
|
"loss": 6.8255,
|
|
"mean_token_accuracy": 0.10280769392848015,
|
|
"num_tokens": 1233934.0,
|
|
"step": 705
|
|
},
|
|
{
|
|
"entropy": 6.947722387313843,
|
|
"epoch": 0.055242170783894186,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.0003545,
|
|
"loss": 6.6909,
|
|
"mean_token_accuracy": 0.10623404085636139,
|
|
"num_tokens": 1242165.0,
|
|
"step": 710
|
|
},
|
|
{
|
|
"entropy": 6.864742231369019,
|
|
"epoch": 0.05563120015561175,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.000357,
|
|
"loss": 6.7451,
|
|
"mean_token_accuracy": 0.10805843472480774,
|
|
"num_tokens": 1250021.0,
|
|
"step": 715
|
|
},
|
|
{
|
|
"entropy": 6.967834186553955,
|
|
"epoch": 0.05602022952732931,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0003595,
|
|
"loss": 6.7789,
|
|
"mean_token_accuracy": 0.1014004610478878,
|
|
"num_tokens": 1258397.0,
|
|
"step": 720
|
|
},
|
|
{
|
|
"entropy": 6.895936393737793,
|
|
"epoch": 0.056409258899046875,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.000362,
|
|
"loss": 6.7594,
|
|
"mean_token_accuracy": 0.10026679039001465,
|
|
"num_tokens": 1266764.0,
|
|
"step": 725
|
|
},
|
|
{
|
|
"entropy": 6.976710271835327,
|
|
"epoch": 0.05679828827076444,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0003645,
|
|
"loss": 6.7604,
|
|
"mean_token_accuracy": 0.10308134779334069,
|
|
"num_tokens": 1275643.0,
|
|
"step": 730
|
|
},
|
|
{
|
|
"entropy": 6.854802751541138,
|
|
"epoch": 0.057187317642482006,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.000367,
|
|
"loss": 6.7414,
|
|
"mean_token_accuracy": 0.10123410001397133,
|
|
"num_tokens": 1284379.0,
|
|
"step": 735
|
|
},
|
|
{
|
|
"entropy": 6.858791494369507,
|
|
"epoch": 0.05757634701419957,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0003695,
|
|
"loss": 6.5942,
|
|
"mean_token_accuracy": 0.10925214067101478,
|
|
"num_tokens": 1293115.0,
|
|
"step": 740
|
|
},
|
|
{
|
|
"entropy": 6.892751264572143,
|
|
"epoch": 0.05796537638591714,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.000372,
|
|
"loss": 6.796,
|
|
"mean_token_accuracy": 0.09836092367768287,
|
|
"num_tokens": 1301583.0,
|
|
"step": 745
|
|
},
|
|
{
|
|
"entropy": 6.954816818237305,
|
|
"epoch": 0.0583544057576347,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0003745,
|
|
"loss": 6.7001,
|
|
"mean_token_accuracy": 0.10808140113949775,
|
|
"num_tokens": 1310721.0,
|
|
"step": 750
|
|
},
|
|
{
|
|
"entropy": 6.923498821258545,
|
|
"epoch": 0.05874343512935227,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.000377,
|
|
"loss": 6.8595,
|
|
"mean_token_accuracy": 0.09595380201935769,
|
|
"num_tokens": 1319056.0,
|
|
"step": 755
|
|
},
|
|
{
|
|
"entropy": 6.839234256744385,
|
|
"epoch": 0.059132464501069834,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0003795,
|
|
"loss": 6.7416,
|
|
"mean_token_accuracy": 0.10261751636862755,
|
|
"num_tokens": 1327259.0,
|
|
"step": 760
|
|
},
|
|
{
|
|
"entropy": 6.819512987136841,
|
|
"epoch": 0.05952149387278739,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.000382,
|
|
"loss": 6.6414,
|
|
"mean_token_accuracy": 0.10097026452422142,
|
|
"num_tokens": 1335906.0,
|
|
"step": 765
|
|
},
|
|
{
|
|
"entropy": 6.879472923278809,
|
|
"epoch": 0.05991052324450496,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0003845,
|
|
"loss": 6.6938,
|
|
"mean_token_accuracy": 0.09806213229894638,
|
|
"num_tokens": 1344743.0,
|
|
"step": 770
|
|
},
|
|
{
|
|
"entropy": 6.840222930908203,
|
|
"epoch": 0.060299552616222524,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.00038700000000000003,
|
|
"loss": 6.6834,
|
|
"mean_token_accuracy": 0.10951419249176979,
|
|
"num_tokens": 1353211.0,
|
|
"step": 775
|
|
},
|
|
{
|
|
"entropy": 6.946290063858032,
|
|
"epoch": 0.06068858198794009,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00038950000000000003,
|
|
"loss": 6.812,
|
|
"mean_token_accuracy": 0.10016649737954139,
|
|
"num_tokens": 1361849.0,
|
|
"step": 780
|
|
},
|
|
{
|
|
"entropy": 6.8946840286254885,
|
|
"epoch": 0.061077611359657655,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.00039200000000000004,
|
|
"loss": 6.7945,
|
|
"mean_token_accuracy": 0.10707032829523086,
|
|
"num_tokens": 1369804.0,
|
|
"step": 785
|
|
},
|
|
{
|
|
"entropy": 6.7396095275878904,
|
|
"epoch": 0.06146664073137522,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00039450000000000005,
|
|
"loss": 6.5766,
|
|
"mean_token_accuracy": 0.10397438257932663,
|
|
"num_tokens": 1378478.0,
|
|
"step": 790
|
|
},
|
|
{
|
|
"entropy": 6.9116943359375,
|
|
"epoch": 0.061855670103092786,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.00039700000000000005,
|
|
"loss": 6.6789,
|
|
"mean_token_accuracy": 0.10764730274677277,
|
|
"num_tokens": 1387225.0,
|
|
"step": 795
|
|
},
|
|
{
|
|
"entropy": 6.7650645732879635,
|
|
"epoch": 0.06224469947481035,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0003995,
|
|
"loss": 6.6492,
|
|
"mean_token_accuracy": 0.10592131912708283,
|
|
"num_tokens": 1395338.0,
|
|
"step": 800
|
|
},
|
|
{
|
|
"entropy": 6.821805953979492,
|
|
"epoch": 0.06263372884652792,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.000402,
|
|
"loss": 6.63,
|
|
"mean_token_accuracy": 0.10603216290473938,
|
|
"num_tokens": 1403794.0,
|
|
"step": 805
|
|
},
|
|
{
|
|
"entropy": 6.708382701873779,
|
|
"epoch": 0.06302275821824548,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004045,
|
|
"loss": 6.7133,
|
|
"mean_token_accuracy": 0.10304158627986908,
|
|
"num_tokens": 1412522.0,
|
|
"step": 810
|
|
},
|
|
{
|
|
"entropy": 6.788723707199097,
|
|
"epoch": 0.06341178758996305,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00040699999999999997,
|
|
"loss": 6.6937,
|
|
"mean_token_accuracy": 0.10893446058034897,
|
|
"num_tokens": 1421347.0,
|
|
"step": 815
|
|
},
|
|
{
|
|
"entropy": 6.8365006923675535,
|
|
"epoch": 0.0638008169616806,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0004095,
|
|
"loss": 6.6695,
|
|
"mean_token_accuracy": 0.11350144445896149,
|
|
"num_tokens": 1429788.0,
|
|
"step": 820
|
|
},
|
|
{
|
|
"entropy": 6.760780572891235,
|
|
"epoch": 0.06418984633339817,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.000412,
|
|
"loss": 6.6727,
|
|
"mean_token_accuracy": 0.10774989053606987,
|
|
"num_tokens": 1437442.0,
|
|
"step": 825
|
|
},
|
|
{
|
|
"entropy": 6.757859325408935,
|
|
"epoch": 0.06457887570511574,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004145,
|
|
"loss": 6.5954,
|
|
"mean_token_accuracy": 0.10944118574261666,
|
|
"num_tokens": 1445604.0,
|
|
"step": 830
|
|
},
|
|
{
|
|
"entropy": 6.786571073532104,
|
|
"epoch": 0.0649679050768333,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.000417,
|
|
"loss": 6.6634,
|
|
"mean_token_accuracy": 0.1089187815785408,
|
|
"num_tokens": 1454342.0,
|
|
"step": 835
|
|
},
|
|
{
|
|
"entropy": 6.77791576385498,
|
|
"epoch": 0.06535693444855087,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004195,
|
|
"loss": 6.661,
|
|
"mean_token_accuracy": 0.11053230538964272,
|
|
"num_tokens": 1463189.0,
|
|
"step": 840
|
|
},
|
|
{
|
|
"entropy": 6.787366485595703,
|
|
"epoch": 0.06574596382026843,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.000422,
|
|
"loss": 6.7166,
|
|
"mean_token_accuracy": 0.10734177976846696,
|
|
"num_tokens": 1471608.0,
|
|
"step": 845
|
|
},
|
|
{
|
|
"entropy": 6.799466276168824,
|
|
"epoch": 0.066134993191986,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0004245,
|
|
"loss": 6.7296,
|
|
"mean_token_accuracy": 0.10613490417599677,
|
|
"num_tokens": 1480452.0,
|
|
"step": 850
|
|
},
|
|
{
|
|
"entropy": 6.822136163711548,
|
|
"epoch": 0.06652402256370356,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.000427,
|
|
"loss": 6.6437,
|
|
"mean_token_accuracy": 0.10718747153878212,
|
|
"num_tokens": 1489118.0,
|
|
"step": 855
|
|
},
|
|
{
|
|
"entropy": 6.686193990707397,
|
|
"epoch": 0.06691305193542113,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0004295,
|
|
"loss": 6.6342,
|
|
"mean_token_accuracy": 0.10919305682182312,
|
|
"num_tokens": 1498961.0,
|
|
"step": 860
|
|
},
|
|
{
|
|
"entropy": 6.819766521453857,
|
|
"epoch": 0.06730208130713869,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.000432,
|
|
"loss": 6.6401,
|
|
"mean_token_accuracy": 0.11007228568196296,
|
|
"num_tokens": 1506772.0,
|
|
"step": 865
|
|
},
|
|
{
|
|
"entropy": 6.681567525863647,
|
|
"epoch": 0.06769111067885625,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0004345,
|
|
"loss": 6.5275,
|
|
"mean_token_accuracy": 0.11715472564101219,
|
|
"num_tokens": 1515095.0,
|
|
"step": 870
|
|
},
|
|
{
|
|
"entropy": 6.6687061309814455,
|
|
"epoch": 0.06808014005057382,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.000437,
|
|
"loss": 6.5653,
|
|
"mean_token_accuracy": 0.11424972265958785,
|
|
"num_tokens": 1523477.0,
|
|
"step": 875
|
|
},
|
|
{
|
|
"entropy": 6.689616775512695,
|
|
"epoch": 0.06846916942229138,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004395,
|
|
"loss": 6.6037,
|
|
"mean_token_accuracy": 0.10498946905136108,
|
|
"num_tokens": 1531786.0,
|
|
"step": 880
|
|
},
|
|
{
|
|
"entropy": 6.736538553237915,
|
|
"epoch": 0.06885819879400895,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.000442,
|
|
"loss": 6.7016,
|
|
"mean_token_accuracy": 0.10352547094225883,
|
|
"num_tokens": 1540737.0,
|
|
"step": 885
|
|
},
|
|
{
|
|
"entropy": 6.637676811218261,
|
|
"epoch": 0.06924722816572651,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004445,
|
|
"loss": 6.5418,
|
|
"mean_token_accuracy": 0.1120985560119152,
|
|
"num_tokens": 1548923.0,
|
|
"step": 890
|
|
},
|
|
{
|
|
"entropy": 6.724155473709106,
|
|
"epoch": 0.06963625753744408,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.000447,
|
|
"loss": 6.5185,
|
|
"mean_token_accuracy": 0.11639119386672973,
|
|
"num_tokens": 1557043.0,
|
|
"step": 895
|
|
},
|
|
{
|
|
"entropy": 6.5780919075012205,
|
|
"epoch": 0.07002528690916164,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.00044950000000000003,
|
|
"loss": 6.5535,
|
|
"mean_token_accuracy": 0.11611853837966919,
|
|
"num_tokens": 1564994.0,
|
|
"step": 900
|
|
},
|
|
{
|
|
"entropy": 6.693197536468506,
|
|
"epoch": 0.0704143162808792,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00045200000000000004,
|
|
"loss": 6.5559,
|
|
"mean_token_accuracy": 0.11024467647075653,
|
|
"num_tokens": 1573859.0,
|
|
"step": 905
|
|
},
|
|
{
|
|
"entropy": 6.661924743652344,
|
|
"epoch": 0.07080334565259677,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00045450000000000004,
|
|
"loss": 6.5138,
|
|
"mean_token_accuracy": 0.10926207825541497,
|
|
"num_tokens": 1581947.0,
|
|
"step": 910
|
|
},
|
|
{
|
|
"entropy": 6.66906771659851,
|
|
"epoch": 0.07119237502431433,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00045700000000000005,
|
|
"loss": 6.4995,
|
|
"mean_token_accuracy": 0.11228668987751007,
|
|
"num_tokens": 1589971.0,
|
|
"step": 915
|
|
},
|
|
{
|
|
"entropy": 6.555896234512329,
|
|
"epoch": 0.0715814043960319,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00045950000000000006,
|
|
"loss": 6.4518,
|
|
"mean_token_accuracy": 0.11207407787442207,
|
|
"num_tokens": 1598612.0,
|
|
"step": 920
|
|
},
|
|
{
|
|
"entropy": 6.718100690841675,
|
|
"epoch": 0.07197043376774946,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.000462,
|
|
"loss": 6.6111,
|
|
"mean_token_accuracy": 0.10551391988992691,
|
|
"num_tokens": 1607378.0,
|
|
"step": 925
|
|
},
|
|
{
|
|
"entropy": 6.653341817855835,
|
|
"epoch": 0.07235946313946703,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004645,
|
|
"loss": 6.6081,
|
|
"mean_token_accuracy": 0.11038231924176216,
|
|
"num_tokens": 1615987.0,
|
|
"step": 930
|
|
},
|
|
{
|
|
"entropy": 6.486403131484986,
|
|
"epoch": 0.07274849251118459,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.000467,
|
|
"loss": 6.4005,
|
|
"mean_token_accuracy": 0.11754591017961502,
|
|
"num_tokens": 1625366.0,
|
|
"step": 935
|
|
},
|
|
{
|
|
"entropy": 6.682313919067383,
|
|
"epoch": 0.07313752188290217,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004695,
|
|
"loss": 6.5758,
|
|
"mean_token_accuracy": 0.11200849413871765,
|
|
"num_tokens": 1633020.0,
|
|
"step": 940
|
|
},
|
|
{
|
|
"entropy": 6.592645740509033,
|
|
"epoch": 0.07352655125461972,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.000472,
|
|
"loss": 6.4715,
|
|
"mean_token_accuracy": 0.11014393791556358,
|
|
"num_tokens": 1641518.0,
|
|
"step": 945
|
|
},
|
|
{
|
|
"entropy": 6.5744109630584715,
|
|
"epoch": 0.07391558062633728,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004745,
|
|
"loss": 6.5601,
|
|
"mean_token_accuracy": 0.1099576011300087,
|
|
"num_tokens": 1650472.0,
|
|
"step": 950
|
|
},
|
|
{
|
|
"entropy": 6.645666933059692,
|
|
"epoch": 0.07430460999805485,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.000477,
|
|
"loss": 6.5753,
|
|
"mean_token_accuracy": 0.11195494011044502,
|
|
"num_tokens": 1659037.0,
|
|
"step": 955
|
|
},
|
|
{
|
|
"entropy": 6.697547388076782,
|
|
"epoch": 0.07469363936977241,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004795,
|
|
"loss": 6.6649,
|
|
"mean_token_accuracy": 0.11236765310168266,
|
|
"num_tokens": 1667897.0,
|
|
"step": 960
|
|
},
|
|
{
|
|
"entropy": 6.552785778045655,
|
|
"epoch": 0.07508266874148999,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.000482,
|
|
"loss": 6.5075,
|
|
"mean_token_accuracy": 0.10858357399702072,
|
|
"num_tokens": 1676535.0,
|
|
"step": 965
|
|
},
|
|
{
|
|
"entropy": 6.665571069717407,
|
|
"epoch": 0.07547169811320754,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004845,
|
|
"loss": 6.5258,
|
|
"mean_token_accuracy": 0.11193247660994529,
|
|
"num_tokens": 1684415.0,
|
|
"step": 970
|
|
},
|
|
{
|
|
"entropy": 6.619773483276367,
|
|
"epoch": 0.07586072748492512,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.000487,
|
|
"loss": 6.4873,
|
|
"mean_token_accuracy": 0.1161974124610424,
|
|
"num_tokens": 1692443.0,
|
|
"step": 975
|
|
},
|
|
{
|
|
"entropy": 6.469988203048706,
|
|
"epoch": 0.07624975685664268,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004895,
|
|
"loss": 6.4908,
|
|
"mean_token_accuracy": 0.11075597926974297,
|
|
"num_tokens": 1700814.0,
|
|
"step": 980
|
|
},
|
|
{
|
|
"entropy": 6.469910621643066,
|
|
"epoch": 0.07663878622836025,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.000492,
|
|
"loss": 6.3349,
|
|
"mean_token_accuracy": 0.1179271623492241,
|
|
"num_tokens": 1709591.0,
|
|
"step": 985
|
|
},
|
|
{
|
|
"entropy": 6.605605697631836,
|
|
"epoch": 0.0770278156000778,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0004945,
|
|
"loss": 6.5879,
|
|
"mean_token_accuracy": 0.10372007116675377,
|
|
"num_tokens": 1718951.0,
|
|
"step": 990
|
|
},
|
|
{
|
|
"entropy": 6.66983380317688,
|
|
"epoch": 0.07741684497179536,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.000497,
|
|
"loss": 6.5431,
|
|
"mean_token_accuracy": 0.11147809475660324,
|
|
"num_tokens": 1727481.0,
|
|
"step": 995
|
|
},
|
|
{
|
|
"entropy": 6.5515549659729,
|
|
"epoch": 0.07780587434351294,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004995,
|
|
"loss": 6.5418,
|
|
"mean_token_accuracy": 0.11638221740722657,
|
|
"num_tokens": 1736985.0,
|
|
"step": 1000
|
|
},
|
|
{
|
|
"entropy": 6.616484832763672,
|
|
"epoch": 0.0781949037152305,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004999999989075146,
|
|
"loss": 6.5945,
|
|
"mean_token_accuracy": 0.10921485722064972,
|
|
"num_tokens": 1745470.0,
|
|
"step": 1005
|
|
},
|
|
{
|
|
"entropy": 6.620965623855591,
|
|
"epoch": 0.07858393308694807,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0004999999944692927,
|
|
"loss": 6.5176,
|
|
"mean_token_accuracy": 0.11291603669524193,
|
|
"num_tokens": 1754185.0,
|
|
"step": 1010
|
|
},
|
|
{
|
|
"entropy": 6.570215940475464,
|
|
"epoch": 0.07897296245866563,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.000499999986617054,
|
|
"loss": 6.5153,
|
|
"mean_token_accuracy": 0.11022635996341705,
|
|
"num_tokens": 1762100.0,
|
|
"step": 1015
|
|
},
|
|
{
|
|
"entropy": 6.5821075439453125,
|
|
"epoch": 0.0793619918303832,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004999999753507986,
|
|
"loss": 6.5529,
|
|
"mean_token_accuracy": 0.11068348959088326,
|
|
"num_tokens": 1771070.0,
|
|
"step": 1020
|
|
},
|
|
{
|
|
"entropy": 6.546429920196533,
|
|
"epoch": 0.07975102120210076,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004999999606705267,
|
|
"loss": 6.5267,
|
|
"mean_token_accuracy": 0.11509618312120437,
|
|
"num_tokens": 1780085.0,
|
|
"step": 1025
|
|
},
|
|
{
|
|
"entropy": 6.625613689422607,
|
|
"epoch": 0.08014005057381832,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004999999425762385,
|
|
"loss": 6.5244,
|
|
"mean_token_accuracy": 0.11561840996146203,
|
|
"num_tokens": 1789316.0,
|
|
"step": 1030
|
|
},
|
|
{
|
|
"entropy": 6.537080764770508,
|
|
"epoch": 0.08052907994553589,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004999999210679344,
|
|
"loss": 6.4437,
|
|
"mean_token_accuracy": 0.1176496423780918,
|
|
"num_tokens": 1797975.0,
|
|
"step": 1035
|
|
},
|
|
{
|
|
"entropy": 6.498772668838501,
|
|
"epoch": 0.08091810931725345,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004999998961456145,
|
|
"loss": 6.5537,
|
|
"mean_token_accuracy": 0.11998764723539353,
|
|
"num_tokens": 1806129.0,
|
|
"step": 1040
|
|
},
|
|
{
|
|
"entropy": 6.631723117828369,
|
|
"epoch": 0.08130713868897102,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004999998678092794,
|
|
"loss": 6.5327,
|
|
"mean_token_accuracy": 0.11050191894173622,
|
|
"num_tokens": 1813956.0,
|
|
"step": 1045
|
|
},
|
|
{
|
|
"entropy": 6.599989175796509,
|
|
"epoch": 0.08169616806068858,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004999998360589293,
|
|
"loss": 6.5657,
|
|
"mean_token_accuracy": 0.11095986440777779,
|
|
"num_tokens": 1822572.0,
|
|
"step": 1050
|
|
},
|
|
{
|
|
"entropy": 6.480882072448731,
|
|
"epoch": 0.08208519743240615,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.000499999800894565,
|
|
"loss": 6.4681,
|
|
"mean_token_accuracy": 0.11177131086587906,
|
|
"num_tokens": 1831870.0,
|
|
"step": 1055
|
|
},
|
|
{
|
|
"entropy": 6.47617883682251,
|
|
"epoch": 0.08247422680412371,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004999997623161866,
|
|
"loss": 6.5107,
|
|
"mean_token_accuracy": 0.1112887792289257,
|
|
"num_tokens": 1840414.0,
|
|
"step": 1060
|
|
},
|
|
{
|
|
"entropy": 6.575576829910278,
|
|
"epoch": 0.08286325617584128,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004999997203237951,
|
|
"loss": 6.527,
|
|
"mean_token_accuracy": 0.1100434735417366,
|
|
"num_tokens": 1850385.0,
|
|
"step": 1065
|
|
},
|
|
{
|
|
"entropy": 6.428466129302978,
|
|
"epoch": 0.08325228554755884,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.000499999674917391,
|
|
"loss": 6.4336,
|
|
"mean_token_accuracy": 0.12001706510782242,
|
|
"num_tokens": 1858479.0,
|
|
"step": 1070
|
|
},
|
|
{
|
|
"entropy": 6.507694816589355,
|
|
"epoch": 0.0836413149192764,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0004999996260969748,
|
|
"loss": 6.4857,
|
|
"mean_token_accuracy": 0.11208872050046921,
|
|
"num_tokens": 1867357.0,
|
|
"step": 1075
|
|
},
|
|
{
|
|
"entropy": 6.512378454208374,
|
|
"epoch": 0.08403034429099397,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004999995738625475,
|
|
"loss": 6.4521,
|
|
"mean_token_accuracy": 0.1077382005751133,
|
|
"num_tokens": 1876211.0,
|
|
"step": 1080
|
|
},
|
|
{
|
|
"entropy": 6.390499639511108,
|
|
"epoch": 0.08441937366271153,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004999995182141099,
|
|
"loss": 6.3633,
|
|
"mean_token_accuracy": 0.1128227360546589,
|
|
"num_tokens": 1884301.0,
|
|
"step": 1085
|
|
},
|
|
{
|
|
"entropy": 6.635722494125366,
|
|
"epoch": 0.0848084030344291,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004999994591516626,
|
|
"loss": 6.5416,
|
|
"mean_token_accuracy": 0.11540148556232452,
|
|
"num_tokens": 1893191.0,
|
|
"step": 1090
|
|
},
|
|
{
|
|
"entropy": 6.37746410369873,
|
|
"epoch": 0.08519743240614666,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004999993966752066,
|
|
"loss": 6.4131,
|
|
"mean_token_accuracy": 0.11306635513901711,
|
|
"num_tokens": 1901434.0,
|
|
"step": 1095
|
|
},
|
|
{
|
|
"entropy": 6.484576797485351,
|
|
"epoch": 0.08558646177786423,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.000499999330784743,
|
|
"loss": 6.3908,
|
|
"mean_token_accuracy": 0.12002351284027099,
|
|
"num_tokens": 1910054.0,
|
|
"step": 1100
|
|
},
|
|
{
|
|
"entropy": 6.490119457244873,
|
|
"epoch": 0.08597549114958179,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004999992614802725,
|
|
"loss": 6.5397,
|
|
"mean_token_accuracy": 0.11540758833289147,
|
|
"num_tokens": 1918607.0,
|
|
"step": 1105
|
|
},
|
|
{
|
|
"entropy": 6.551545763015747,
|
|
"epoch": 0.08636452052129936,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004999991887617966,
|
|
"loss": 6.4828,
|
|
"mean_token_accuracy": 0.11358762234449386,
|
|
"num_tokens": 1927610.0,
|
|
"step": 1110
|
|
},
|
|
{
|
|
"entropy": 6.389538955688477,
|
|
"epoch": 0.08675354989301692,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004999991126293158,
|
|
"loss": 6.4366,
|
|
"mean_token_accuracy": 0.11365601867437362,
|
|
"num_tokens": 1936174.0,
|
|
"step": 1115
|
|
},
|
|
{
|
|
"entropy": 6.459973239898682,
|
|
"epoch": 0.08714257926473448,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004999990330828318,
|
|
"loss": 6.3439,
|
|
"mean_token_accuracy": 0.12333748191595077,
|
|
"num_tokens": 1944228.0,
|
|
"step": 1120
|
|
},
|
|
{
|
|
"entropy": 6.483522081375122,
|
|
"epoch": 0.08753160863645205,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004999989501223456,
|
|
"loss": 6.4502,
|
|
"mean_token_accuracy": 0.11555779352784157,
|
|
"num_tokens": 1953144.0,
|
|
"step": 1125
|
|
},
|
|
{
|
|
"entropy": 6.46024751663208,
|
|
"epoch": 0.08792063800816961,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004999988637478584,
|
|
"loss": 6.5161,
|
|
"mean_token_accuracy": 0.1126246102154255,
|
|
"num_tokens": 1961947.0,
|
|
"step": 1130
|
|
},
|
|
{
|
|
"entropy": 6.5634512424469,
|
|
"epoch": 0.08830966737988719,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004999987739593716,
|
|
"loss": 6.4809,
|
|
"mean_token_accuracy": 0.11571738943457603,
|
|
"num_tokens": 1970674.0,
|
|
"step": 1135
|
|
},
|
|
{
|
|
"entropy": 6.490915060043335,
|
|
"epoch": 0.08869869675160474,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004999986807568865,
|
|
"loss": 6.4496,
|
|
"mean_token_accuracy": 0.11765117347240447,
|
|
"num_tokens": 1979173.0,
|
|
"step": 1140
|
|
},
|
|
{
|
|
"entropy": 6.474772596359253,
|
|
"epoch": 0.08908772612332232,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004999985841404045,
|
|
"loss": 6.4392,
|
|
"mean_token_accuracy": 0.11643676534295082,
|
|
"num_tokens": 1988134.0,
|
|
"step": 1145
|
|
},
|
|
{
|
|
"entropy": 6.441124773025512,
|
|
"epoch": 0.08947675549503988,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004999984841099271,
|
|
"loss": 6.3768,
|
|
"mean_token_accuracy": 0.12014681100845337,
|
|
"num_tokens": 1996977.0,
|
|
"step": 1150
|
|
},
|
|
{
|
|
"entropy": 6.50206184387207,
|
|
"epoch": 0.08986578486675743,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.000499998380665456,
|
|
"loss": 6.4588,
|
|
"mean_token_accuracy": 0.1176146350800991,
|
|
"num_tokens": 2005946.0,
|
|
"step": 1155
|
|
},
|
|
{
|
|
"entropy": 6.388955450057983,
|
|
"epoch": 0.090254814238475,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0004999982738069924,
|
|
"loss": 6.2831,
|
|
"mean_token_accuracy": 0.12113617286086083,
|
|
"num_tokens": 2014882.0,
|
|
"step": 1160
|
|
},
|
|
{
|
|
"entropy": 6.391384267807007,
|
|
"epoch": 0.09064384361019256,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004999981635345382,
|
|
"loss": 6.4771,
|
|
"mean_token_accuracy": 0.1094152309000492,
|
|
"num_tokens": 2024858.0,
|
|
"step": 1165
|
|
},
|
|
{
|
|
"entropy": 6.371677255630493,
|
|
"epoch": 0.09103287298191014,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0004999980498480949,
|
|
"loss": 6.3701,
|
|
"mean_token_accuracy": 0.11717021316289902,
|
|
"num_tokens": 2034072.0,
|
|
"step": 1170
|
|
},
|
|
{
|
|
"entropy": 6.45729169845581,
|
|
"epoch": 0.0914219023536277,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004999979327476644,
|
|
"loss": 6.3869,
|
|
"mean_token_accuracy": 0.11678455844521522,
|
|
"num_tokens": 2042649.0,
|
|
"step": 1175
|
|
},
|
|
{
|
|
"entropy": 6.433530855178833,
|
|
"epoch": 0.09181093172534527,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004999978122332485,
|
|
"loss": 6.4431,
|
|
"mean_token_accuracy": 0.1181255742907524,
|
|
"num_tokens": 2050866.0,
|
|
"step": 1180
|
|
},
|
|
{
|
|
"entropy": 6.4381969451904295,
|
|
"epoch": 0.09219996109706283,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004999976883048487,
|
|
"loss": 6.4242,
|
|
"mean_token_accuracy": 0.11656152158975601,
|
|
"num_tokens": 2058914.0,
|
|
"step": 1185
|
|
},
|
|
{
|
|
"entropy": 6.419391775131226,
|
|
"epoch": 0.0925889904687804,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004999975609624673,
|
|
"loss": 6.362,
|
|
"mean_token_accuracy": 0.11579015702009202,
|
|
"num_tokens": 2068098.0,
|
|
"step": 1190
|
|
},
|
|
{
|
|
"entropy": 6.418846511840821,
|
|
"epoch": 0.09297801984049796,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004999974302061059,
|
|
"loss": 6.3645,
|
|
"mean_token_accuracy": 0.11124148517847061,
|
|
"num_tokens": 2077299.0,
|
|
"step": 1195
|
|
},
|
|
{
|
|
"entropy": 6.40845251083374,
|
|
"epoch": 0.09336704921221552,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0004999972960357666,
|
|
"loss": 6.4689,
|
|
"mean_token_accuracy": 0.11288349330425262,
|
|
"num_tokens": 2087868.0,
|
|
"step": 1200
|
|
},
|
|
{
|
|
"entropy": 6.447312068939209,
|
|
"epoch": 0.09375607858393309,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004999971584514516,
|
|
"loss": 6.3783,
|
|
"mean_token_accuracy": 0.123850879073143,
|
|
"num_tokens": 2096553.0,
|
|
"step": 1205
|
|
},
|
|
{
|
|
"entropy": 6.458125257492066,
|
|
"epoch": 0.09414510795565065,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004999970174531627,
|
|
"loss": 6.3609,
|
|
"mean_token_accuracy": 0.11663044691085815,
|
|
"num_tokens": 2104809.0,
|
|
"step": 1210
|
|
},
|
|
{
|
|
"entropy": 6.294647073745727,
|
|
"epoch": 0.09453413732736822,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004999968730409022,
|
|
"loss": 6.3464,
|
|
"mean_token_accuracy": 0.11563503369688988,
|
|
"num_tokens": 2113869.0,
|
|
"step": 1215
|
|
},
|
|
{
|
|
"entropy": 6.34133825302124,
|
|
"epoch": 0.09492316669908578,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004999967252146723,
|
|
"loss": 6.1603,
|
|
"mean_token_accuracy": 0.11609101369976997,
|
|
"num_tokens": 2121749.0,
|
|
"step": 1220
|
|
},
|
|
{
|
|
"entropy": 6.341687250137329,
|
|
"epoch": 0.09531219607080335,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004999965739744752,
|
|
"loss": 6.3824,
|
|
"mean_token_accuracy": 0.11490623876452447,
|
|
"num_tokens": 2130828.0,
|
|
"step": 1225
|
|
},
|
|
{
|
|
"entropy": 6.462488079071045,
|
|
"epoch": 0.09570122544252091,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004999964193203132,
|
|
"loss": 6.35,
|
|
"mean_token_accuracy": 0.11846289187669753,
|
|
"num_tokens": 2138928.0,
|
|
"step": 1230
|
|
},
|
|
{
|
|
"entropy": 6.407934045791626,
|
|
"epoch": 0.09609025481423847,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004999962612521888,
|
|
"loss": 6.3864,
|
|
"mean_token_accuracy": 0.11911074891686439,
|
|
"num_tokens": 2147643.0,
|
|
"step": 1235
|
|
},
|
|
{
|
|
"entropy": 6.398451328277588,
|
|
"epoch": 0.09647928418595604,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004999960997701041,
|
|
"loss": 6.3112,
|
|
"mean_token_accuracy": 0.12286981865763665,
|
|
"num_tokens": 2156766.0,
|
|
"step": 1240
|
|
},
|
|
{
|
|
"entropy": 6.415870094299317,
|
|
"epoch": 0.0968683135576736,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004999959348740618,
|
|
"loss": 6.3735,
|
|
"mean_token_accuracy": 0.11572954803705215,
|
|
"num_tokens": 2165517.0,
|
|
"step": 1245
|
|
},
|
|
{
|
|
"entropy": 6.276720762252808,
|
|
"epoch": 0.09725734292939117,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004999957665640641,
|
|
"loss": 6.2391,
|
|
"mean_token_accuracy": 0.12221750989556313,
|
|
"num_tokens": 2174812.0,
|
|
"step": 1250
|
|
},
|
|
{
|
|
"entropy": 6.389494466781616,
|
|
"epoch": 0.09764637230110873,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.000499995594840114,
|
|
"loss": 6.3961,
|
|
"mean_token_accuracy": 0.1142569437623024,
|
|
"num_tokens": 2183968.0,
|
|
"step": 1255
|
|
},
|
|
{
|
|
"entropy": 6.395362615585327,
|
|
"epoch": 0.0980354016728263,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004999954197022138,
|
|
"loss": 6.4207,
|
|
"mean_token_accuracy": 0.12095934301614761,
|
|
"num_tokens": 2191947.0,
|
|
"step": 1260
|
|
},
|
|
{
|
|
"entropy": 6.362047100067139,
|
|
"epoch": 0.09842443104454386,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004999952411503661,
|
|
"loss": 6.2524,
|
|
"mean_token_accuracy": 0.12708474695682526,
|
|
"num_tokens": 2199951.0,
|
|
"step": 1265
|
|
},
|
|
{
|
|
"entropy": 6.345381879806519,
|
|
"epoch": 0.09881346041626143,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004999950591845738,
|
|
"loss": 6.4025,
|
|
"mean_token_accuracy": 0.11825087368488311,
|
|
"num_tokens": 2208714.0,
|
|
"step": 1270
|
|
},
|
|
{
|
|
"entropy": 6.296407985687256,
|
|
"epoch": 0.09920248978797899,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004999948738048397,
|
|
"loss": 6.2605,
|
|
"mean_token_accuracy": 0.12081179469823837,
|
|
"num_tokens": 2217250.0,
|
|
"step": 1275
|
|
},
|
|
{
|
|
"entropy": 6.371564292907715,
|
|
"epoch": 0.09959151915969655,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004999946850111663,
|
|
"loss": 6.329,
|
|
"mean_token_accuracy": 0.12220223546028137,
|
|
"num_tokens": 2225468.0,
|
|
"step": 1280
|
|
},
|
|
{
|
|
"entropy": 6.248642206192017,
|
|
"epoch": 0.09998054853141412,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004999944928035569,
|
|
"loss": 6.2729,
|
|
"mean_token_accuracy": 0.12882675752043724,
|
|
"num_tokens": 2233893.0,
|
|
"step": 1285
|
|
},
|
|
{
|
|
"entropy": 6.485666704177857,
|
|
"epoch": 0.10036957790313168,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.000499994297182014,
|
|
"loss": 6.3387,
|
|
"mean_token_accuracy": 0.11729943826794624,
|
|
"num_tokens": 2242487.0,
|
|
"step": 1290
|
|
},
|
|
{
|
|
"entropy": 6.232321691513062,
|
|
"epoch": 0.10075860727484925,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004999940981465408,
|
|
"loss": 6.1769,
|
|
"mean_token_accuracy": 0.12584130242466926,
|
|
"num_tokens": 2250518.0,
|
|
"step": 1295
|
|
},
|
|
{
|
|
"entropy": 6.359662485122681,
|
|
"epoch": 0.10114763664656681,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004999938956971404,
|
|
"loss": 6.35,
|
|
"mean_token_accuracy": 0.11376101300120353,
|
|
"num_tokens": 2259024.0,
|
|
"step": 1300
|
|
},
|
|
{
|
|
"entropy": 6.315293645858764,
|
|
"epoch": 0.10153666601828439,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004999936898338156,
|
|
"loss": 6.406,
|
|
"mean_token_accuracy": 0.11127450317144394,
|
|
"num_tokens": 2267832.0,
|
|
"step": 1305
|
|
},
|
|
{
|
|
"entropy": 6.441192197799682,
|
|
"epoch": 0.10192569539000194,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004999934805565698,
|
|
"loss": 6.4422,
|
|
"mean_token_accuracy": 0.11080272123217583,
|
|
"num_tokens": 2276834.0,
|
|
"step": 1310
|
|
},
|
|
{
|
|
"entropy": 6.482887125015258,
|
|
"epoch": 0.10231472476171952,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.000499993267865406,
|
|
"loss": 6.3746,
|
|
"mean_token_accuracy": 0.11520213186740876,
|
|
"num_tokens": 2285736.0,
|
|
"step": 1315
|
|
},
|
|
{
|
|
"entropy": 6.384394311904908,
|
|
"epoch": 0.10270375413343708,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.0004999930517603275,
|
|
"loss": 6.3234,
|
|
"mean_token_accuracy": 0.1279608964920044,
|
|
"num_tokens": 2294177.0,
|
|
"step": 1320
|
|
},
|
|
{
|
|
"entropy": 6.272417211532593,
|
|
"epoch": 0.10309278350515463,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004999928322413374,
|
|
"loss": 6.1152,
|
|
"mean_token_accuracy": 0.13164947628974916,
|
|
"num_tokens": 2302784.0,
|
|
"step": 1325
|
|
},
|
|
{
|
|
"entropy": 6.1753613471984865,
|
|
"epoch": 0.1034818128768722,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004999926093084394,
|
|
"loss": 6.2247,
|
|
"mean_token_accuracy": 0.1209910273551941,
|
|
"num_tokens": 2311650.0,
|
|
"step": 1330
|
|
},
|
|
{
|
|
"entropy": 6.426689910888672,
|
|
"epoch": 0.10387084224858976,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004999923829616365,
|
|
"loss": 6.3461,
|
|
"mean_token_accuracy": 0.12103552594780922,
|
|
"num_tokens": 2319828.0,
|
|
"step": 1335
|
|
},
|
|
{
|
|
"entropy": 6.360848712921142,
|
|
"epoch": 0.10425987162030734,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004999921532009323,
|
|
"loss": 6.3423,
|
|
"mean_token_accuracy": 0.11625662669539452,
|
|
"num_tokens": 2328636.0,
|
|
"step": 1340
|
|
},
|
|
{
|
|
"entropy": 6.244861602783203,
|
|
"epoch": 0.1046489009920249,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004999919200263304,
|
|
"loss": 6.2352,
|
|
"mean_token_accuracy": 0.1234541155397892,
|
|
"num_tokens": 2336771.0,
|
|
"step": 1345
|
|
},
|
|
{
|
|
"entropy": 6.352584886550903,
|
|
"epoch": 0.10503793036374247,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0004999916834378342,
|
|
"loss": 6.3854,
|
|
"mean_token_accuracy": 0.11652181446552276,
|
|
"num_tokens": 2346106.0,
|
|
"step": 1350
|
|
},
|
|
{
|
|
"entropy": 6.42938871383667,
|
|
"epoch": 0.10542695973546003,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004999914434354472,
|
|
"loss": 6.3661,
|
|
"mean_token_accuracy": 0.11678783521056176,
|
|
"num_tokens": 2354943.0,
|
|
"step": 1355
|
|
},
|
|
{
|
|
"entropy": 6.208476591110229,
|
|
"epoch": 0.10581598910717759,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004999912000191733,
|
|
"loss": 6.2707,
|
|
"mean_token_accuracy": 0.12307048067450524,
|
|
"num_tokens": 2363699.0,
|
|
"step": 1360
|
|
},
|
|
{
|
|
"entropy": 6.340670251846314,
|
|
"epoch": 0.10620501847889516,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.000499990953189016,
|
|
"loss": 6.4154,
|
|
"mean_token_accuracy": 0.11648116931319237,
|
|
"num_tokens": 2373316.0,
|
|
"step": 1365
|
|
},
|
|
{
|
|
"entropy": 6.536358499526978,
|
|
"epoch": 0.10659404785061272,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004999907029449791,
|
|
"loss": 6.4774,
|
|
"mean_token_accuracy": 0.1135114923119545,
|
|
"num_tokens": 2381550.0,
|
|
"step": 1370
|
|
},
|
|
{
|
|
"entropy": 6.30794472694397,
|
|
"epoch": 0.10698307722233029,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004999904492870663,
|
|
"loss": 6.2883,
|
|
"mean_token_accuracy": 0.12282988801598549,
|
|
"num_tokens": 2389546.0,
|
|
"step": 1375
|
|
},
|
|
{
|
|
"entropy": 6.380693864822388,
|
|
"epoch": 0.10737210659404785,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004999901922152816,
|
|
"loss": 6.244,
|
|
"mean_token_accuracy": 0.12719449624419213,
|
|
"num_tokens": 2398852.0,
|
|
"step": 1380
|
|
},
|
|
{
|
|
"entropy": 6.272253751754761,
|
|
"epoch": 0.10776113596576542,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004999899317296288,
|
|
"loss": 6.3308,
|
|
"mean_token_accuracy": 0.12012203708291054,
|
|
"num_tokens": 2407815.0,
|
|
"step": 1385
|
|
},
|
|
{
|
|
"entropy": 6.317573165893554,
|
|
"epoch": 0.10815016533748298,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0004999896678301121,
|
|
"loss": 6.1922,
|
|
"mean_token_accuracy": 0.12548744305968285,
|
|
"num_tokens": 2417300.0,
|
|
"step": 1390
|
|
},
|
|
{
|
|
"entropy": 6.297150897979736,
|
|
"epoch": 0.10853919470920055,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004999894005167352,
|
|
"loss": 6.3578,
|
|
"mean_token_accuracy": 0.11943556964397431,
|
|
"num_tokens": 2426257.0,
|
|
"step": 1395
|
|
},
|
|
{
|
|
"entropy": 6.4665430068969725,
|
|
"epoch": 0.10892822408091811,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.000499989129789502,
|
|
"loss": 6.3817,
|
|
"mean_token_accuracy": 0.12104496955871583,
|
|
"num_tokens": 2434595.0,
|
|
"step": 1400
|
|
},
|
|
{
|
|
"entropy": 6.406263446807861,
|
|
"epoch": 0.10931725345263567,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004999888556484172,
|
|
"loss": 6.39,
|
|
"mean_token_accuracy": 0.11528819128870964,
|
|
"num_tokens": 2443945.0,
|
|
"step": 1405
|
|
},
|
|
{
|
|
"entropy": 6.226689291000366,
|
|
"epoch": 0.10970628282435324,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004999885780934845,
|
|
"loss": 6.2536,
|
|
"mean_token_accuracy": 0.12194890603423118,
|
|
"num_tokens": 2453141.0,
|
|
"step": 1410
|
|
},
|
|
{
|
|
"entropy": 6.352630996704102,
|
|
"epoch": 0.1100953121960708,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004999882971247081,
|
|
"loss": 6.3336,
|
|
"mean_token_accuracy": 0.122190822660923,
|
|
"num_tokens": 2461873.0,
|
|
"step": 1415
|
|
},
|
|
{
|
|
"entropy": 6.317797040939331,
|
|
"epoch": 0.11048434156778837,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004999880127420926,
|
|
"loss": 6.3632,
|
|
"mean_token_accuracy": 0.11227262541651725,
|
|
"num_tokens": 2471238.0,
|
|
"step": 1420
|
|
},
|
|
{
|
|
"entropy": 6.334433937072754,
|
|
"epoch": 0.11087337093950593,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004999877249456421,
|
|
"loss": 6.2408,
|
|
"mean_token_accuracy": 0.1272654689848423,
|
|
"num_tokens": 2479412.0,
|
|
"step": 1425
|
|
},
|
|
{
|
|
"entropy": 6.188841533660889,
|
|
"epoch": 0.1112624003112235,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004999874337353609,
|
|
"loss": 6.1292,
|
|
"mean_token_accuracy": 0.12458490431308747,
|
|
"num_tokens": 2488150.0,
|
|
"step": 1430
|
|
},
|
|
{
|
|
"entropy": 6.280575132369995,
|
|
"epoch": 0.11165142968294106,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0004999871391112535,
|
|
"loss": 6.309,
|
|
"mean_token_accuracy": 0.12516588494181632,
|
|
"num_tokens": 2498103.0,
|
|
"step": 1435
|
|
},
|
|
{
|
|
"entropy": 6.1986839294433596,
|
|
"epoch": 0.11204045905465862,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004999868410733244,
|
|
"loss": 6.1695,
|
|
"mean_token_accuracy": 0.125221885740757,
|
|
"num_tokens": 2506211.0,
|
|
"step": 1440
|
|
},
|
|
{
|
|
"entropy": 6.172796535491943,
|
|
"epoch": 0.11242948842637619,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.000499986539621578,
|
|
"loss": 6.2162,
|
|
"mean_token_accuracy": 0.12384542673826218,
|
|
"num_tokens": 2514743.0,
|
|
"step": 1445
|
|
},
|
|
{
|
|
"entropy": 6.167073822021484,
|
|
"epoch": 0.11281851779809375,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004999862347560191,
|
|
"loss": 6.2027,
|
|
"mean_token_accuracy": 0.12268847003579139,
|
|
"num_tokens": 2523824.0,
|
|
"step": 1450
|
|
},
|
|
{
|
|
"entropy": 6.387971639633179,
|
|
"epoch": 0.11320754716981132,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004999859264766521,
|
|
"loss": 6.2719,
|
|
"mean_token_accuracy": 0.12253661304712296,
|
|
"num_tokens": 2532360.0,
|
|
"step": 1455
|
|
},
|
|
{
|
|
"entropy": 6.257190561294555,
|
|
"epoch": 0.11359657654152888,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004999856147834817,
|
|
"loss": 6.2217,
|
|
"mean_token_accuracy": 0.1282711908221245,
|
|
"num_tokens": 2540547.0,
|
|
"step": 1460
|
|
},
|
|
{
|
|
"entropy": 6.174588632583618,
|
|
"epoch": 0.11398560591324645,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004999852996765129,
|
|
"loss": 6.2459,
|
|
"mean_token_accuracy": 0.12327087596058846,
|
|
"num_tokens": 2549193.0,
|
|
"step": 1465
|
|
},
|
|
{
|
|
"entropy": 6.317156839370727,
|
|
"epoch": 0.11437463528496401,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004999849811557502,
|
|
"loss": 6.254,
|
|
"mean_token_accuracy": 0.12232557386159897,
|
|
"num_tokens": 2557553.0,
|
|
"step": 1470
|
|
},
|
|
{
|
|
"entropy": 6.374777555465698,
|
|
"epoch": 0.11476366465668159,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004999846592211984,
|
|
"loss": 6.3602,
|
|
"mean_token_accuracy": 0.11835889741778374,
|
|
"num_tokens": 2565945.0,
|
|
"step": 1475
|
|
},
|
|
{
|
|
"entropy": 6.324231147766113,
|
|
"epoch": 0.11515269402839914,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004999843338728626,
|
|
"loss": 6.2285,
|
|
"mean_token_accuracy": 0.11772384941577911,
|
|
"num_tokens": 2574364.0,
|
|
"step": 1480
|
|
},
|
|
{
|
|
"entropy": 6.176779270172119,
|
|
"epoch": 0.1155417234001167,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004999840051107476,
|
|
"loss": 6.1531,
|
|
"mean_token_accuracy": 0.1252761095762253,
|
|
"num_tokens": 2582825.0,
|
|
"step": 1485
|
|
},
|
|
{
|
|
"entropy": 6.367834663391113,
|
|
"epoch": 0.11593075277183428,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004999836729348584,
|
|
"loss": 6.2943,
|
|
"mean_token_accuracy": 0.12382682561874389,
|
|
"num_tokens": 2591628.0,
|
|
"step": 1490
|
|
},
|
|
{
|
|
"entropy": 6.331791353225708,
|
|
"epoch": 0.11631978214355183,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004999833373452,
|
|
"loss": 6.2892,
|
|
"mean_token_accuracy": 0.1190582662820816,
|
|
"num_tokens": 2600436.0,
|
|
"step": 1495
|
|
},
|
|
{
|
|
"entropy": 6.217423963546753,
|
|
"epoch": 0.1167088115152694,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004999829983417778,
|
|
"loss": 6.2596,
|
|
"mean_token_accuracy": 0.12188921868801117,
|
|
"num_tokens": 2609709.0,
|
|
"step": 1500
|
|
},
|
|
{
|
|
"entropy": 6.359324789047241,
|
|
"epoch": 0.11709784088698696,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004999826559245965,
|
|
"loss": 6.2586,
|
|
"mean_token_accuracy": 0.12367889285087585,
|
|
"num_tokens": 2617992.0,
|
|
"step": 1505
|
|
},
|
|
{
|
|
"entropy": 6.17459282875061,
|
|
"epoch": 0.11748687025870454,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004999823100936615,
|
|
"loss": 6.1695,
|
|
"mean_token_accuracy": 0.12516930997371672,
|
|
"num_tokens": 2626706.0,
|
|
"step": 1510
|
|
},
|
|
{
|
|
"entropy": 6.3931690692901615,
|
|
"epoch": 0.1178758996304221,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004999819608489781,
|
|
"loss": 6.2359,
|
|
"mean_token_accuracy": 0.13169281259179116,
|
|
"num_tokens": 2634642.0,
|
|
"step": 1515
|
|
},
|
|
{
|
|
"entropy": 6.271792840957642,
|
|
"epoch": 0.11826492900213967,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004999816081905515,
|
|
"loss": 6.2722,
|
|
"mean_token_accuracy": 0.11658980697393417,
|
|
"num_tokens": 2644160.0,
|
|
"step": 1520
|
|
},
|
|
{
|
|
"entropy": 6.214734745025635,
|
|
"epoch": 0.11865395837385723,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004999812521183872,
|
|
"loss": 6.2285,
|
|
"mean_token_accuracy": 0.1217222385108471,
|
|
"num_tokens": 2653390.0,
|
|
"step": 1525
|
|
},
|
|
{
|
|
"entropy": 6.356004905700684,
|
|
"epoch": 0.11904298774557479,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004999808926324903,
|
|
"loss": 6.2785,
|
|
"mean_token_accuracy": 0.12192253395915031,
|
|
"num_tokens": 2662561.0,
|
|
"step": 1530
|
|
},
|
|
{
|
|
"entropy": 6.280083322525025,
|
|
"epoch": 0.11943201711729236,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004999805297328665,
|
|
"loss": 6.2453,
|
|
"mean_token_accuracy": 0.12399770319461823,
|
|
"num_tokens": 2670694.0,
|
|
"step": 1535
|
|
},
|
|
{
|
|
"entropy": 6.214053916931152,
|
|
"epoch": 0.11982104648900992,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004999801634195214,
|
|
"loss": 6.1408,
|
|
"mean_token_accuracy": 0.12651772275567055,
|
|
"num_tokens": 2679583.0,
|
|
"step": 1540
|
|
},
|
|
{
|
|
"entropy": 6.181328582763672,
|
|
"epoch": 0.12021007586072749,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004999797936924603,
|
|
"loss": 6.1127,
|
|
"mean_token_accuracy": 0.12723355293273925,
|
|
"num_tokens": 2688429.0,
|
|
"step": 1545
|
|
},
|
|
{
|
|
"entropy": 6.365040397644043,
|
|
"epoch": 0.12059910523244505,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.000499979420551689,
|
|
"loss": 6.2115,
|
|
"mean_token_accuracy": 0.12122456356883049,
|
|
"num_tokens": 2697134.0,
|
|
"step": 1550
|
|
},
|
|
{
|
|
"entropy": 6.182654905319214,
|
|
"epoch": 0.12098813460416262,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.000499979043997213,
|
|
"loss": 6.3483,
|
|
"mean_token_accuracy": 0.11888098418712616,
|
|
"num_tokens": 2705641.0,
|
|
"step": 1555
|
|
},
|
|
{
|
|
"entropy": 6.314460563659668,
|
|
"epoch": 0.12137716397588018,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004999786640290381,
|
|
"loss": 6.2908,
|
|
"mean_token_accuracy": 0.12467942461371422,
|
|
"num_tokens": 2714977.0,
|
|
"step": 1560
|
|
},
|
|
{
|
|
"entropy": 6.2193540096282955,
|
|
"epoch": 0.12176619334759774,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004999782806471701,
|
|
"loss": 6.1337,
|
|
"mean_token_accuracy": 0.1347135454416275,
|
|
"num_tokens": 2723120.0,
|
|
"step": 1565
|
|
},
|
|
{
|
|
"entropy": 6.0879443168640135,
|
|
"epoch": 0.12215522271931531,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004999778938516147,
|
|
"loss": 6.1317,
|
|
"mean_token_accuracy": 0.13238951042294503,
|
|
"num_tokens": 2731964.0,
|
|
"step": 1570
|
|
},
|
|
{
|
|
"entropy": 6.39334282875061,
|
|
"epoch": 0.12254425209103287,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.000499977503642378,
|
|
"loss": 6.1931,
|
|
"mean_token_accuracy": 0.127005735039711,
|
|
"num_tokens": 2741537.0,
|
|
"step": 1575
|
|
},
|
|
{
|
|
"entropy": 6.138741397857666,
|
|
"epoch": 0.12293328146275044,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004999771100194656,
|
|
"loss": 6.3277,
|
|
"mean_token_accuracy": 0.1212069720029831,
|
|
"num_tokens": 2751522.0,
|
|
"step": 1580
|
|
},
|
|
{
|
|
"entropy": 6.3773661136627195,
|
|
"epoch": 0.123322310834468,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004999767129828837,
|
|
"loss": 6.3125,
|
|
"mean_token_accuracy": 0.11907947659492493,
|
|
"num_tokens": 2761100.0,
|
|
"step": 1585
|
|
},
|
|
{
|
|
"entropy": 6.22048397064209,
|
|
"epoch": 0.12371134020618557,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004999763125326383,
|
|
"loss": 6.2478,
|
|
"mean_token_accuracy": 0.12256922721862792,
|
|
"num_tokens": 2769171.0,
|
|
"step": 1590
|
|
},
|
|
{
|
|
"entropy": 6.243303442001343,
|
|
"epoch": 0.12410036957790313,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004999759086687355,
|
|
"loss": 6.1867,
|
|
"mean_token_accuracy": 0.12792484536767007,
|
|
"num_tokens": 2778021.0,
|
|
"step": 1595
|
|
},
|
|
{
|
|
"entropy": 6.166972827911377,
|
|
"epoch": 0.1244893989496207,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004999755013911813,
|
|
"loss": 6.1195,
|
|
"mean_token_accuracy": 0.13010439202189444,
|
|
"num_tokens": 2787206.0,
|
|
"step": 1600
|
|
},
|
|
{
|
|
"entropy": 6.148937082290649,
|
|
"epoch": 0.12487842832133826,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.000499975090699982,
|
|
"loss": 6.1981,
|
|
"mean_token_accuracy": 0.1204142227768898,
|
|
"num_tokens": 2796051.0,
|
|
"step": 1605
|
|
},
|
|
{
|
|
"entropy": 6.247499084472656,
|
|
"epoch": 0.12526745769305583,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004999746765951438,
|
|
"loss": 6.144,
|
|
"mean_token_accuracy": 0.12628112062811853,
|
|
"num_tokens": 2804961.0,
|
|
"step": 1610
|
|
},
|
|
{
|
|
"entropy": 6.156633281707764,
|
|
"epoch": 0.1256564870647734,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004999742590766729,
|
|
"loss": 6.0863,
|
|
"mean_token_accuracy": 0.13187484741210936,
|
|
"num_tokens": 2813691.0,
|
|
"step": 1615
|
|
},
|
|
{
|
|
"entropy": 6.225268125534058,
|
|
"epoch": 0.12604551643649095,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004999738381445757,
|
|
"loss": 6.248,
|
|
"mean_token_accuracy": 0.12675216943025588,
|
|
"num_tokens": 2822248.0,
|
|
"step": 1620
|
|
},
|
|
{
|
|
"entropy": 6.251285171508789,
|
|
"epoch": 0.1264345458082085,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004999734137988586,
|
|
"loss": 6.1923,
|
|
"mean_token_accuracy": 0.12956587076187134,
|
|
"num_tokens": 2830826.0,
|
|
"step": 1625
|
|
},
|
|
{
|
|
"entropy": 6.216675090789795,
|
|
"epoch": 0.1268235751799261,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.000499972986039528,
|
|
"loss": 6.1839,
|
|
"mean_token_accuracy": 0.12593767046928406,
|
|
"num_tokens": 2839766.0,
|
|
"step": 1630
|
|
},
|
|
{
|
|
"entropy": 6.123473691940307,
|
|
"epoch": 0.12721260455164365,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004999725548665904,
|
|
"loss": 6.1228,
|
|
"mean_token_accuracy": 0.13010624870657922,
|
|
"num_tokens": 2848728.0,
|
|
"step": 1635
|
|
},
|
|
{
|
|
"entropy": 6.1722784519195555,
|
|
"epoch": 0.1276016339233612,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004999721202800524,
|
|
"loss": 6.1396,
|
|
"mean_token_accuracy": 0.13079047277569772,
|
|
"num_tokens": 2857221.0,
|
|
"step": 1640
|
|
},
|
|
{
|
|
"entropy": 6.263162755966187,
|
|
"epoch": 0.12799066329507877,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004999716822799206,
|
|
"loss": 6.2131,
|
|
"mean_token_accuracy": 0.12727918699383736,
|
|
"num_tokens": 2865314.0,
|
|
"step": 1645
|
|
},
|
|
{
|
|
"entropy": 6.1169415473937985,
|
|
"epoch": 0.12837969266679633,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004999712408662016,
|
|
"loss": 6.088,
|
|
"mean_token_accuracy": 0.12827678620815278,
|
|
"num_tokens": 2873654.0,
|
|
"step": 1650
|
|
},
|
|
{
|
|
"entropy": 6.114794111251831,
|
|
"epoch": 0.12876872203851392,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004999707960389021,
|
|
"loss": 5.9976,
|
|
"mean_token_accuracy": 0.1390816293656826,
|
|
"num_tokens": 2881604.0,
|
|
"step": 1655
|
|
},
|
|
{
|
|
"entropy": 6.175813865661621,
|
|
"epoch": 0.12915775141023147,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004999703477980288,
|
|
"loss": 6.1899,
|
|
"mean_token_accuracy": 0.12590051293373108,
|
|
"num_tokens": 2890427.0,
|
|
"step": 1660
|
|
},
|
|
{
|
|
"entropy": 6.176800918579102,
|
|
"epoch": 0.12954678078194903,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004999698961435885,
|
|
"loss": 6.1608,
|
|
"mean_token_accuracy": 0.1278068646788597,
|
|
"num_tokens": 2899206.0,
|
|
"step": 1665
|
|
},
|
|
{
|
|
"entropy": 6.1610307693481445,
|
|
"epoch": 0.1299358101536666,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004999694410755882,
|
|
"loss": 6.0803,
|
|
"mean_token_accuracy": 0.1307940810918808,
|
|
"num_tokens": 2907738.0,
|
|
"step": 1670
|
|
},
|
|
{
|
|
"entropy": 6.264579439163208,
|
|
"epoch": 0.13032483952538418,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004999689825940347,
|
|
"loss": 6.3124,
|
|
"mean_token_accuracy": 0.12490758523344994,
|
|
"num_tokens": 2916881.0,
|
|
"step": 1675
|
|
},
|
|
{
|
|
"entropy": 6.203776741027832,
|
|
"epoch": 0.13071386889710174,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004999685206989349,
|
|
"loss": 6.2506,
|
|
"mean_token_accuracy": 0.12321256548166275,
|
|
"num_tokens": 2926467.0,
|
|
"step": 1680
|
|
},
|
|
{
|
|
"entropy": 6.266940355300903,
|
|
"epoch": 0.1311028982688193,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004999680553902959,
|
|
"loss": 6.1586,
|
|
"mean_token_accuracy": 0.12849143967032434,
|
|
"num_tokens": 2934671.0,
|
|
"step": 1685
|
|
},
|
|
{
|
|
"entropy": 6.153891229629517,
|
|
"epoch": 0.13149192764053685,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004999675866681247,
|
|
"loss": 6.1937,
|
|
"mean_token_accuracy": 0.12307270169258118,
|
|
"num_tokens": 2943925.0,
|
|
"step": 1690
|
|
},
|
|
{
|
|
"entropy": 6.251479959487915,
|
|
"epoch": 0.1318809570122544,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004999671145324286,
|
|
"loss": 6.2351,
|
|
"mean_token_accuracy": 0.12551012486219407,
|
|
"num_tokens": 2952118.0,
|
|
"step": 1695
|
|
},
|
|
{
|
|
"entropy": 6.142472887039185,
|
|
"epoch": 0.132269986383972,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004999666389832144,
|
|
"loss": 6.2185,
|
|
"mean_token_accuracy": 0.12478951662778855,
|
|
"num_tokens": 2961110.0,
|
|
"step": 1700
|
|
},
|
|
{
|
|
"entropy": 6.258459663391113,
|
|
"epoch": 0.13265901575568956,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004999661600204897,
|
|
"loss": 6.1492,
|
|
"mean_token_accuracy": 0.1310803025960922,
|
|
"num_tokens": 2968877.0,
|
|
"step": 1705
|
|
},
|
|
{
|
|
"entropy": 6.205829286575318,
|
|
"epoch": 0.13304804512740712,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004999656776442615,
|
|
"loss": 6.2062,
|
|
"mean_token_accuracy": 0.12969572320580483,
|
|
"num_tokens": 2977346.0,
|
|
"step": 1710
|
|
},
|
|
{
|
|
"entropy": 6.306067752838135,
|
|
"epoch": 0.13343707449912467,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004999651918545372,
|
|
"loss": 6.2403,
|
|
"mean_token_accuracy": 0.12232028320431709,
|
|
"num_tokens": 2987494.0,
|
|
"step": 1715
|
|
},
|
|
{
|
|
"entropy": 6.168236112594604,
|
|
"epoch": 0.13382610387084226,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004999647026513243,
|
|
"loss": 6.167,
|
|
"mean_token_accuracy": 0.12709078639745713,
|
|
"num_tokens": 2996728.0,
|
|
"step": 1720
|
|
},
|
|
{
|
|
"entropy": 6.16880464553833,
|
|
"epoch": 0.13421513324255982,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00049996421003463,
|
|
"loss": 6.1947,
|
|
"mean_token_accuracy": 0.12163503617048263,
|
|
"num_tokens": 3005810.0,
|
|
"step": 1725
|
|
},
|
|
{
|
|
"entropy": 6.225845766067505,
|
|
"epoch": 0.13460416261427738,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004999637140044619,
|
|
"loss": 6.2057,
|
|
"mean_token_accuracy": 0.12583187147974967,
|
|
"num_tokens": 3014603.0,
|
|
"step": 1730
|
|
},
|
|
{
|
|
"entropy": 6.286410093307495,
|
|
"epoch": 0.13499319198599494,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004999632145608275,
|
|
"loss": 6.2073,
|
|
"mean_token_accuracy": 0.12976924255490302,
|
|
"num_tokens": 3023170.0,
|
|
"step": 1735
|
|
},
|
|
{
|
|
"entropy": 6.047111463546753,
|
|
"epoch": 0.1353822213577125,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004999627117037343,
|
|
"loss": 5.952,
|
|
"mean_token_accuracy": 0.13934574648737907,
|
|
"num_tokens": 3030565.0,
|
|
"step": 1740
|
|
},
|
|
{
|
|
"entropy": 6.201064538955689,
|
|
"epoch": 0.13577125072943008,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00049996220543319,
|
|
"loss": 6.2296,
|
|
"mean_token_accuracy": 0.1313652738928795,
|
|
"num_tokens": 3040124.0,
|
|
"step": 1745
|
|
},
|
|
{
|
|
"entropy": 6.118889284133911,
|
|
"epoch": 0.13616028010114764,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004999616957492025,
|
|
"loss": 6.0833,
|
|
"mean_token_accuracy": 0.1335503078997135,
|
|
"num_tokens": 3048458.0,
|
|
"step": 1750
|
|
},
|
|
{
|
|
"entropy": 6.115156173706055,
|
|
"epoch": 0.1365493094728652,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004999611826517793,
|
|
"loss": 6.0529,
|
|
"mean_token_accuracy": 0.12220517992973327,
|
|
"num_tokens": 3057926.0,
|
|
"step": 1755
|
|
},
|
|
{
|
|
"entropy": 6.074193906784058,
|
|
"epoch": 0.13693833884458276,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004999606661409281,
|
|
"loss": 6.0902,
|
|
"mean_token_accuracy": 0.12791807651519777,
|
|
"num_tokens": 3066683.0,
|
|
"step": 1760
|
|
},
|
|
{
|
|
"entropy": 6.162175607681275,
|
|
"epoch": 0.13732736821630034,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004999601462166569,
|
|
"loss": 6.1736,
|
|
"mean_token_accuracy": 0.12800901383161545,
|
|
"num_tokens": 3075117.0,
|
|
"step": 1765
|
|
},
|
|
{
|
|
"entropy": 6.291727209091187,
|
|
"epoch": 0.1377163975880179,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004999596228789736,
|
|
"loss": 6.2362,
|
|
"mean_token_accuracy": 0.12387871071696281,
|
|
"num_tokens": 3084399.0,
|
|
"step": 1770
|
|
},
|
|
{
|
|
"entropy": 6.073335409164429,
|
|
"epoch": 0.13810542695973546,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0004999590961278859,
|
|
"loss": 6.0154,
|
|
"mean_token_accuracy": 0.13292096480727195,
|
|
"num_tokens": 3093030.0,
|
|
"step": 1775
|
|
},
|
|
{
|
|
"entropy": 6.19185700416565,
|
|
"epoch": 0.13849445633145302,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004999585659634021,
|
|
"loss": 6.0716,
|
|
"mean_token_accuracy": 0.13075146377086638,
|
|
"num_tokens": 3101670.0,
|
|
"step": 1780
|
|
},
|
|
{
|
|
"entropy": 6.05259747505188,
|
|
"epoch": 0.13888348570317058,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004999580323855301,
|
|
"loss": 6.0614,
|
|
"mean_token_accuracy": 0.13134398460388183,
|
|
"num_tokens": 3109703.0,
|
|
"step": 1785
|
|
},
|
|
{
|
|
"entropy": 6.102718019485474,
|
|
"epoch": 0.13927251507488816,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004999574953942781,
|
|
"loss": 6.0242,
|
|
"mean_token_accuracy": 0.13451038673520088,
|
|
"num_tokens": 3118388.0,
|
|
"step": 1790
|
|
},
|
|
{
|
|
"entropy": 6.110586404800415,
|
|
"epoch": 0.13966154444660572,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004999569549896541,
|
|
"loss": 6.0341,
|
|
"mean_token_accuracy": 0.13156714141368867,
|
|
"num_tokens": 3126466.0,
|
|
"step": 1795
|
|
},
|
|
{
|
|
"entropy": 6.112448740005493,
|
|
"epoch": 0.14005057381832328,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004999564111716665,
|
|
"loss": 6.0781,
|
|
"mean_token_accuracy": 0.1335633009672165,
|
|
"num_tokens": 3135322.0,
|
|
"step": 1800
|
|
},
|
|
{
|
|
"entropy": 6.108473491668701,
|
|
"epoch": 0.14043960319004084,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004999558639403232,
|
|
"loss": 6.0755,
|
|
"mean_token_accuracy": 0.13613163232803344,
|
|
"num_tokens": 3144498.0,
|
|
"step": 1805
|
|
},
|
|
{
|
|
"entropy": 6.045802354812622,
|
|
"epoch": 0.1408286325617584,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004999553132956328,
|
|
"loss": 6.0512,
|
|
"mean_token_accuracy": 0.12877680659294127,
|
|
"num_tokens": 3153573.0,
|
|
"step": 1810
|
|
},
|
|
{
|
|
"entropy": 6.046996307373047,
|
|
"epoch": 0.14121766193347599,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004999547592376035,
|
|
"loss": 5.9939,
|
|
"mean_token_accuracy": 0.1377910055220127,
|
|
"num_tokens": 3161705.0,
|
|
"step": 1815
|
|
},
|
|
{
|
|
"entropy": 6.138423156738281,
|
|
"epoch": 0.14160669130519354,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004999542017662438,
|
|
"loss": 6.1474,
|
|
"mean_token_accuracy": 0.13016104623675345,
|
|
"num_tokens": 3170068.0,
|
|
"step": 1820
|
|
},
|
|
{
|
|
"entropy": 6.134330701828003,
|
|
"epoch": 0.1419957206769111,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004999536408815623,
|
|
"loss": 6.152,
|
|
"mean_token_accuracy": 0.12710127755999565,
|
|
"num_tokens": 3178140.0,
|
|
"step": 1825
|
|
},
|
|
{
|
|
"entropy": 6.159389972686768,
|
|
"epoch": 0.14238475004862866,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004999530765835672,
|
|
"loss": 6.117,
|
|
"mean_token_accuracy": 0.1319376789033413,
|
|
"num_tokens": 3186518.0,
|
|
"step": 1830
|
|
},
|
|
{
|
|
"entropy": 6.114027595520019,
|
|
"epoch": 0.14277377942034625,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004999525088722673,
|
|
"loss": 6.1086,
|
|
"mean_token_accuracy": 0.126016952842474,
|
|
"num_tokens": 3195246.0,
|
|
"step": 1835
|
|
},
|
|
{
|
|
"entropy": 6.2064361572265625,
|
|
"epoch": 0.1431628087920638,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004999519377476711,
|
|
"loss": 6.1239,
|
|
"mean_token_accuracy": 0.12959307059645653,
|
|
"num_tokens": 3203946.0,
|
|
"step": 1840
|
|
},
|
|
{
|
|
"entropy": 6.125613784790039,
|
|
"epoch": 0.14355183816378136,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004999513632097872,
|
|
"loss": 6.1511,
|
|
"mean_token_accuracy": 0.12730584666132927,
|
|
"num_tokens": 3212208.0,
|
|
"step": 1845
|
|
},
|
|
{
|
|
"entropy": 6.112041807174682,
|
|
"epoch": 0.14394086753549892,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004999507852586245,
|
|
"loss": 6.078,
|
|
"mean_token_accuracy": 0.12968963086605073,
|
|
"num_tokens": 3221572.0,
|
|
"step": 1850
|
|
},
|
|
{
|
|
"entropy": 6.241564416885376,
|
|
"epoch": 0.14432989690721648,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004999502038941917,
|
|
"loss": 6.2186,
|
|
"mean_token_accuracy": 0.11879752650856971,
|
|
"num_tokens": 3230898.0,
|
|
"step": 1855
|
|
},
|
|
{
|
|
"entropy": 6.053813362121582,
|
|
"epoch": 0.14471892627893407,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0004999496191164975,
|
|
"loss": 6.1755,
|
|
"mean_token_accuracy": 0.12418220117688179,
|
|
"num_tokens": 3240524.0,
|
|
"step": 1860
|
|
},
|
|
{
|
|
"entropy": 6.186307144165039,
|
|
"epoch": 0.14510795565065163,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.000499949030925551,
|
|
"loss": 5.9339,
|
|
"mean_token_accuracy": 0.1323039062321186,
|
|
"num_tokens": 3248864.0,
|
|
"step": 1865
|
|
},
|
|
{
|
|
"entropy": 6.05433611869812,
|
|
"epoch": 0.14549698502236919,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004999484393213609,
|
|
"loss": 6.1267,
|
|
"mean_token_accuracy": 0.12983283996582032,
|
|
"num_tokens": 3256823.0,
|
|
"step": 1870
|
|
},
|
|
{
|
|
"entropy": 6.093509531021118,
|
|
"epoch": 0.14588601439408674,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004999478443039363,
|
|
"loss": 6.0317,
|
|
"mean_token_accuracy": 0.13464081212878226,
|
|
"num_tokens": 3265621.0,
|
|
"step": 1875
|
|
},
|
|
{
|
|
"entropy": 6.031926536560059,
|
|
"epoch": 0.14627504376580433,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004999472458732862,
|
|
"loss": 6.0619,
|
|
"mean_token_accuracy": 0.13131768479943276,
|
|
"num_tokens": 3273515.0,
|
|
"step": 1880
|
|
},
|
|
{
|
|
"entropy": 6.207943487167358,
|
|
"epoch": 0.1466640731375219,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004999466440294198,
|
|
"loss": 6.131,
|
|
"mean_token_accuracy": 0.12989283427596093,
|
|
"num_tokens": 3282283.0,
|
|
"step": 1885
|
|
},
|
|
{
|
|
"entropy": 6.049416828155517,
|
|
"epoch": 0.14705310250923945,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.000499946038772346,
|
|
"loss": 6.1341,
|
|
"mean_token_accuracy": 0.13318516165018082,
|
|
"num_tokens": 3290792.0,
|
|
"step": 1890
|
|
},
|
|
{
|
|
"entropy": 6.044079065322876,
|
|
"epoch": 0.147442131880957,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004999454301020741,
|
|
"loss": 5.9918,
|
|
"mean_token_accuracy": 0.13286386504769326,
|
|
"num_tokens": 3299430.0,
|
|
"step": 1895
|
|
},
|
|
{
|
|
"entropy": 6.067660093307495,
|
|
"epoch": 0.14783116125267456,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004999448180186133,
|
|
"loss": 6.0334,
|
|
"mean_token_accuracy": 0.13755829334259034,
|
|
"num_tokens": 3307949.0,
|
|
"step": 1900
|
|
},
|
|
{
|
|
"entropy": 6.091364002227783,
|
|
"epoch": 0.14822019062439215,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.000499944202521973,
|
|
"loss": 6.098,
|
|
"mean_token_accuracy": 0.13308693766593932,
|
|
"num_tokens": 3316900.0,
|
|
"step": 1905
|
|
},
|
|
{
|
|
"entropy": 6.114401006698609,
|
|
"epoch": 0.1486092199961097,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004999435836121624,
|
|
"loss": 6.0263,
|
|
"mean_token_accuracy": 0.1365790992975235,
|
|
"num_tokens": 3325656.0,
|
|
"step": 1910
|
|
},
|
|
{
|
|
"entropy": 6.054609870910644,
|
|
"epoch": 0.14899824936782727,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.000499942961289191,
|
|
"loss": 6.2408,
|
|
"mean_token_accuracy": 0.11948857307434083,
|
|
"num_tokens": 3334219.0,
|
|
"step": 1915
|
|
},
|
|
{
|
|
"entropy": 6.100892877578735,
|
|
"epoch": 0.14938727873954483,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004999423355530683,
|
|
"loss": 5.987,
|
|
"mean_token_accuracy": 0.1356291465461254,
|
|
"num_tokens": 3343637.0,
|
|
"step": 1920
|
|
},
|
|
{
|
|
"entropy": 6.047068405151367,
|
|
"epoch": 0.1497763081112624,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004999417064038035,
|
|
"loss": 6.1349,
|
|
"mean_token_accuracy": 0.1278958112001419,
|
|
"num_tokens": 3352624.0,
|
|
"step": 1925
|
|
},
|
|
{
|
|
"entropy": 6.089813709259033,
|
|
"epoch": 0.15016533748297997,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004999410738414065,
|
|
"loss": 6.0577,
|
|
"mean_token_accuracy": 0.13661672845482825,
|
|
"num_tokens": 3361394.0,
|
|
"step": 1930
|
|
},
|
|
{
|
|
"entropy": 6.1655097007751465,
|
|
"epoch": 0.15055436685469753,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004999404378658866,
|
|
"loss": 6.1106,
|
|
"mean_token_accuracy": 0.13267300873994828,
|
|
"num_tokens": 3369406.0,
|
|
"step": 1935
|
|
},
|
|
{
|
|
"entropy": 6.093273782730103,
|
|
"epoch": 0.1509433962264151,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004999397984772536,
|
|
"loss": 6.0514,
|
|
"mean_token_accuracy": 0.1275075666606426,
|
|
"num_tokens": 3377737.0,
|
|
"step": 1940
|
|
},
|
|
{
|
|
"entropy": 6.077555751800537,
|
|
"epoch": 0.15133242559813265,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004999391556755172,
|
|
"loss": 6.1175,
|
|
"mean_token_accuracy": 0.12663735300302506,
|
|
"num_tokens": 3385514.0,
|
|
"step": 1945
|
|
},
|
|
{
|
|
"entropy": 6.144791460037231,
|
|
"epoch": 0.15172145496985023,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004999385094606872,
|
|
"loss": 6.0261,
|
|
"mean_token_accuracy": 0.13351787775754928,
|
|
"num_tokens": 3394500.0,
|
|
"step": 1950
|
|
},
|
|
{
|
|
"entropy": 6.004178762435913,
|
|
"epoch": 0.1521104843415678,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004999378598327733,
|
|
"loss": 6.0057,
|
|
"mean_token_accuracy": 0.13412315174937248,
|
|
"num_tokens": 3403289.0,
|
|
"step": 1955
|
|
},
|
|
{
|
|
"entropy": 6.04636549949646,
|
|
"epoch": 0.15249951371328535,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004999372067917854,
|
|
"loss": 5.9441,
|
|
"mean_token_accuracy": 0.14245061874389647,
|
|
"num_tokens": 3410892.0,
|
|
"step": 1960
|
|
},
|
|
{
|
|
"entropy": 5.918894290924072,
|
|
"epoch": 0.1528885430850029,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004999365503377335,
|
|
"loss": 6.0281,
|
|
"mean_token_accuracy": 0.13515010178089143,
|
|
"num_tokens": 3420329.0,
|
|
"step": 1965
|
|
},
|
|
{
|
|
"entropy": 6.066119909286499,
|
|
"epoch": 0.1532775724567205,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004999358904706273,
|
|
"loss": 6.0257,
|
|
"mean_token_accuracy": 0.13282209038734435,
|
|
"num_tokens": 3429429.0,
|
|
"step": 1970
|
|
},
|
|
{
|
|
"entropy": 6.137219715118408,
|
|
"epoch": 0.15366660182843805,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004999352271904771,
|
|
"loss": 6.1381,
|
|
"mean_token_accuracy": 0.12859977707266806,
|
|
"num_tokens": 3438198.0,
|
|
"step": 1975
|
|
},
|
|
{
|
|
"entropy": 6.2691608428955075,
|
|
"epoch": 0.1540556312001556,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004999345604972928,
|
|
"loss": 6.2676,
|
|
"mean_token_accuracy": 0.129219963401556,
|
|
"num_tokens": 3447732.0,
|
|
"step": 1980
|
|
},
|
|
{
|
|
"entropy": 6.048369979858398,
|
|
"epoch": 0.15444466057187317,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004999338903910846,
|
|
"loss": 6.0545,
|
|
"mean_token_accuracy": 0.13279973939061165,
|
|
"num_tokens": 3456392.0,
|
|
"step": 1985
|
|
},
|
|
{
|
|
"entropy": 6.084347772598266,
|
|
"epoch": 0.15483368994359073,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004999332168718626,
|
|
"loss": 6.0832,
|
|
"mean_token_accuracy": 0.1306935466825962,
|
|
"num_tokens": 3464473.0,
|
|
"step": 1990
|
|
},
|
|
{
|
|
"entropy": 6.114197492599487,
|
|
"epoch": 0.15522271931530832,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004999325399396371,
|
|
"loss": 6.0531,
|
|
"mean_token_accuracy": 0.1318880908191204,
|
|
"num_tokens": 3473740.0,
|
|
"step": 1995
|
|
},
|
|
{
|
|
"entropy": 5.95880823135376,
|
|
"epoch": 0.15561174868702587,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004999318595944183,
|
|
"loss": 5.9461,
|
|
"mean_token_accuracy": 0.13854984045028687,
|
|
"num_tokens": 3482249.0,
|
|
"step": 2000
|
|
},
|
|
{
|
|
"entropy": 6.20720682144165,
|
|
"epoch": 0.15600077805874343,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004999311758362166,
|
|
"loss": 6.194,
|
|
"mean_token_accuracy": 0.1284084811806679,
|
|
"num_tokens": 3490753.0,
|
|
"step": 2005
|
|
},
|
|
{
|
|
"entropy": 6.1580390453338625,
|
|
"epoch": 0.156389807430461,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004999304886650422,
|
|
"loss": 6.1388,
|
|
"mean_token_accuracy": 0.13328585550189018,
|
|
"num_tokens": 3499373.0,
|
|
"step": 2010
|
|
},
|
|
{
|
|
"entropy": 6.130110073089599,
|
|
"epoch": 0.15677883680217858,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004999297980809058,
|
|
"loss": 6.0894,
|
|
"mean_token_accuracy": 0.12947576269507408,
|
|
"num_tokens": 3508344.0,
|
|
"step": 2015
|
|
},
|
|
{
|
|
"entropy": 6.102607488632202,
|
|
"epoch": 0.15716786617389614,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004999291040838176,
|
|
"loss": 6.0589,
|
|
"mean_token_accuracy": 0.12978120669722557,
|
|
"num_tokens": 3517009.0,
|
|
"step": 2020
|
|
},
|
|
{
|
|
"entropy": 6.054499006271362,
|
|
"epoch": 0.1575568955456137,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004999284066737884,
|
|
"loss": 6.11,
|
|
"mean_token_accuracy": 0.12718966975808144,
|
|
"num_tokens": 3525989.0,
|
|
"step": 2025
|
|
},
|
|
{
|
|
"entropy": 6.133045625686646,
|
|
"epoch": 0.15794592491733125,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0004999277058508285,
|
|
"loss": 5.9964,
|
|
"mean_token_accuracy": 0.13161147758364677,
|
|
"num_tokens": 3533947.0,
|
|
"step": 2030
|
|
},
|
|
{
|
|
"entropy": 6.014222860336304,
|
|
"epoch": 0.1583349542890488,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004999270016149486,
|
|
"loss": 6.0552,
|
|
"mean_token_accuracy": 0.135345246642828,
|
|
"num_tokens": 3541974.0,
|
|
"step": 2035
|
|
},
|
|
{
|
|
"entropy": 6.0979108810424805,
|
|
"epoch": 0.1587239836607664,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0004999262939661596,
|
|
"loss": 6.0053,
|
|
"mean_token_accuracy": 0.14074506014585494,
|
|
"num_tokens": 3550436.0,
|
|
"step": 2040
|
|
},
|
|
{
|
|
"entropy": 6.0076916217803955,
|
|
"epoch": 0.15911301303248396,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004999255829044721,
|
|
"loss": 5.9924,
|
|
"mean_token_accuracy": 0.13720230460166932,
|
|
"num_tokens": 3558283.0,
|
|
"step": 2045
|
|
},
|
|
{
|
|
"entropy": 5.98124508857727,
|
|
"epoch": 0.15950204240420152,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004999248684298968,
|
|
"loss": 5.9144,
|
|
"mean_token_accuracy": 0.13598482608795165,
|
|
"num_tokens": 3566968.0,
|
|
"step": 2050
|
|
},
|
|
{
|
|
"entropy": 6.084092378616333,
|
|
"epoch": 0.15989107177591907,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004999241505424447,
|
|
"loss": 6.0515,
|
|
"mean_token_accuracy": 0.13149691969156266,
|
|
"num_tokens": 3575580.0,
|
|
"step": 2055
|
|
},
|
|
{
|
|
"entropy": 6.089936590194702,
|
|
"epoch": 0.16028010114763663,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004999234292421265,
|
|
"loss": 6.1059,
|
|
"mean_token_accuracy": 0.13127018511295319,
|
|
"num_tokens": 3584389.0,
|
|
"step": 2060
|
|
},
|
|
{
|
|
"entropy": 6.056532669067383,
|
|
"epoch": 0.16066913051935422,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004999227045289535,
|
|
"loss": 5.9472,
|
|
"mean_token_accuracy": 0.13698288649320603,
|
|
"num_tokens": 3593009.0,
|
|
"step": 2065
|
|
},
|
|
{
|
|
"entropy": 5.953234529495239,
|
|
"epoch": 0.16105815989107178,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004999219764029363,
|
|
"loss": 5.9771,
|
|
"mean_token_accuracy": 0.13605064973235131,
|
|
"num_tokens": 3601914.0,
|
|
"step": 2070
|
|
},
|
|
{
|
|
"entropy": 5.964067173004151,
|
|
"epoch": 0.16144718926278934,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004999212448640861,
|
|
"loss": 5.9458,
|
|
"mean_token_accuracy": 0.1372133381664753,
|
|
"num_tokens": 3609883.0,
|
|
"step": 2075
|
|
},
|
|
{
|
|
"entropy": 5.984559869766235,
|
|
"epoch": 0.1618362186345069,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004999205099124141,
|
|
"loss": 5.8776,
|
|
"mean_token_accuracy": 0.14128663763403893,
|
|
"num_tokens": 3618103.0,
|
|
"step": 2080
|
|
},
|
|
{
|
|
"entropy": 6.163353109359742,
|
|
"epoch": 0.16222524800622448,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004999197715479313,
|
|
"loss": 6.1465,
|
|
"mean_token_accuracy": 0.13133149743080139,
|
|
"num_tokens": 3625861.0,
|
|
"step": 2085
|
|
},
|
|
{
|
|
"entropy": 5.983381605148315,
|
|
"epoch": 0.16261427737794204,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004999190297706489,
|
|
"loss": 5.9377,
|
|
"mean_token_accuracy": 0.13726572021842004,
|
|
"num_tokens": 3634498.0,
|
|
"step": 2090
|
|
},
|
|
{
|
|
"entropy": 5.900870990753174,
|
|
"epoch": 0.1630033067496596,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004999182845805783,
|
|
"loss": 5.903,
|
|
"mean_token_accuracy": 0.13446398749947547,
|
|
"num_tokens": 3644186.0,
|
|
"step": 2095
|
|
},
|
|
{
|
|
"entropy": 5.978477811813354,
|
|
"epoch": 0.16339233612137716,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004999175359777306,
|
|
"loss": 6.0346,
|
|
"mean_token_accuracy": 0.13290069103240967,
|
|
"num_tokens": 3652831.0,
|
|
"step": 2100
|
|
},
|
|
{
|
|
"entropy": 6.1047296047210695,
|
|
"epoch": 0.16378136549309472,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004999167839621174,
|
|
"loss": 5.9013,
|
|
"mean_token_accuracy": 0.13871957510709762,
|
|
"num_tokens": 3661230.0,
|
|
"step": 2105
|
|
},
|
|
{
|
|
"entropy": 6.000889015197754,
|
|
"epoch": 0.1641703948648123,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004999160285337501,
|
|
"loss": 6.0459,
|
|
"mean_token_accuracy": 0.1324700802564621,
|
|
"num_tokens": 3669250.0,
|
|
"step": 2110
|
|
},
|
|
{
|
|
"entropy": 6.074883890151978,
|
|
"epoch": 0.16455942423652986,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004999152696926399,
|
|
"loss": 6.0221,
|
|
"mean_token_accuracy": 0.1307499475777149,
|
|
"num_tokens": 3677568.0,
|
|
"step": 2115
|
|
},
|
|
{
|
|
"entropy": 6.026207399368286,
|
|
"epoch": 0.16494845360824742,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004999145074387985,
|
|
"loss": 6.0186,
|
|
"mean_token_accuracy": 0.14040926843881607,
|
|
"num_tokens": 3685488.0,
|
|
"step": 2120
|
|
},
|
|
{
|
|
"entropy": 5.997472858428955,
|
|
"epoch": 0.16533748297996498,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004999137417722374,
|
|
"loss": 5.9989,
|
|
"mean_token_accuracy": 0.13259485363960266,
|
|
"num_tokens": 3694357.0,
|
|
"step": 2125
|
|
},
|
|
{
|
|
"entropy": 6.097675323486328,
|
|
"epoch": 0.16572651235168256,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004999129726929684,
|
|
"loss": 6.0534,
|
|
"mean_token_accuracy": 0.1371625356376171,
|
|
"num_tokens": 3703173.0,
|
|
"step": 2130
|
|
},
|
|
{
|
|
"entropy": 6.020848321914673,
|
|
"epoch": 0.16611554172340012,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004999122002010029,
|
|
"loss": 6.0185,
|
|
"mean_token_accuracy": 0.13592875599861146,
|
|
"num_tokens": 3712070.0,
|
|
"step": 2135
|
|
},
|
|
{
|
|
"entropy": 6.032235813140869,
|
|
"epoch": 0.16650457109511768,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0004999114242963527,
|
|
"loss": 5.9062,
|
|
"mean_token_accuracy": 0.14077977910637857,
|
|
"num_tokens": 3720245.0,
|
|
"step": 2140
|
|
},
|
|
{
|
|
"entropy": 5.971114015579223,
|
|
"epoch": 0.16689360046683524,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004999106449790298,
|
|
"loss": 6.0256,
|
|
"mean_token_accuracy": 0.1356363706290722,
|
|
"num_tokens": 3730064.0,
|
|
"step": 2145
|
|
},
|
|
{
|
|
"entropy": 6.012196159362793,
|
|
"epoch": 0.1672826298385528,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004999098622490458,
|
|
"loss": 5.9673,
|
|
"mean_token_accuracy": 0.13840274810791015,
|
|
"num_tokens": 3738741.0,
|
|
"step": 2150
|
|
},
|
|
{
|
|
"entropy": 6.0317319393157955,
|
|
"epoch": 0.16767165921027039,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004999090761064125,
|
|
"loss": 6.0445,
|
|
"mean_token_accuracy": 0.13798771649599076,
|
|
"num_tokens": 3747472.0,
|
|
"step": 2155
|
|
},
|
|
{
|
|
"entropy": 6.042453670501709,
|
|
"epoch": 0.16806068858198794,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.000499908286551142,
|
|
"loss": 6.0614,
|
|
"mean_token_accuracy": 0.1325035110116005,
|
|
"num_tokens": 3756643.0,
|
|
"step": 2160
|
|
},
|
|
{
|
|
"entropy": 6.098313522338867,
|
|
"epoch": 0.1684497179537055,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004999074935832463,
|
|
"loss": 6.1743,
|
|
"mean_token_accuracy": 0.1302264779806137,
|
|
"num_tokens": 3765490.0,
|
|
"step": 2165
|
|
},
|
|
{
|
|
"entropy": 6.109912395477295,
|
|
"epoch": 0.16883874732542306,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004999066972027373,
|
|
"loss": 5.9293,
|
|
"mean_token_accuracy": 0.13885341733694076,
|
|
"num_tokens": 3773063.0,
|
|
"step": 2170
|
|
},
|
|
{
|
|
"entropy": 6.057087755203247,
|
|
"epoch": 0.16922777669714065,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004999058974096271,
|
|
"loss": 6.081,
|
|
"mean_token_accuracy": 0.12848760411143303,
|
|
"num_tokens": 3781763.0,
|
|
"step": 2175
|
|
},
|
|
{
|
|
"entropy": 6.050684452056885,
|
|
"epoch": 0.1696168060688582,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.000499905094203928,
|
|
"loss": 6.0706,
|
|
"mean_token_accuracy": 0.13044458702206613,
|
|
"num_tokens": 3790582.0,
|
|
"step": 2180
|
|
},
|
|
{
|
|
"entropy": 5.997987556457519,
|
|
"epoch": 0.17000583544057576,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.000499904287585652,
|
|
"loss": 5.8916,
|
|
"mean_token_accuracy": 0.13762697726488113,
|
|
"num_tokens": 3798745.0,
|
|
"step": 2185
|
|
},
|
|
{
|
|
"entropy": 5.99886155128479,
|
|
"epoch": 0.17039486481229332,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004999034775548113,
|
|
"loss": 5.9924,
|
|
"mean_token_accuracy": 0.13636661395430566,
|
|
"num_tokens": 3806901.0,
|
|
"step": 2190
|
|
},
|
|
{
|
|
"entropy": 6.0307700634002686,
|
|
"epoch": 0.17078389418401088,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0004999026641114185,
|
|
"loss": 5.9387,
|
|
"mean_token_accuracy": 0.14335163310170174,
|
|
"num_tokens": 3815742.0,
|
|
"step": 2195
|
|
},
|
|
{
|
|
"entropy": 5.951791095733642,
|
|
"epoch": 0.17117292355572847,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004999018472554857,
|
|
"loss": 6.0196,
|
|
"mean_token_accuracy": 0.13228272050619125,
|
|
"num_tokens": 3824468.0,
|
|
"step": 2200
|
|
},
|
|
{
|
|
"entropy": 6.030127143859863,
|
|
"epoch": 0.17156195292744603,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004999010269870253,
|
|
"loss": 5.9848,
|
|
"mean_token_accuracy": 0.14022162035107613,
|
|
"num_tokens": 3832834.0,
|
|
"step": 2205
|
|
},
|
|
{
|
|
"entropy": 6.018565368652344,
|
|
"epoch": 0.17195098229916359,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004999002033060498,
|
|
"loss": 6.0239,
|
|
"mean_token_accuracy": 0.14021265134215355,
|
|
"num_tokens": 3841780.0,
|
|
"step": 2210
|
|
},
|
|
{
|
|
"entropy": 6.101462125778198,
|
|
"epoch": 0.17234001167088114,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004998993762125716,
|
|
"loss": 6.1403,
|
|
"mean_token_accuracy": 0.1279483050107956,
|
|
"num_tokens": 3849840.0,
|
|
"step": 2215
|
|
},
|
|
{
|
|
"entropy": 6.102045392990112,
|
|
"epoch": 0.17272904104259873,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004998985457066034,
|
|
"loss": 6.0699,
|
|
"mean_token_accuracy": 0.12550090849399567,
|
|
"num_tokens": 3858204.0,
|
|
"step": 2220
|
|
},
|
|
{
|
|
"entropy": 6.012039756774902,
|
|
"epoch": 0.1731180704143163,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004998977117881576,
|
|
"loss": 6.0052,
|
|
"mean_token_accuracy": 0.13568017780780792,
|
|
"num_tokens": 3866615.0,
|
|
"step": 2225
|
|
},
|
|
{
|
|
"entropy": 6.037418842315674,
|
|
"epoch": 0.17350709978603385,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.0004998968744572472,
|
|
"loss": 6.0343,
|
|
"mean_token_accuracy": 0.13920788690447808,
|
|
"num_tokens": 3876003.0,
|
|
"step": 2230
|
|
},
|
|
{
|
|
"entropy": 6.0176434993743895,
|
|
"epoch": 0.1738961291577514,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004998960337138845,
|
|
"loss": 5.9605,
|
|
"mean_token_accuracy": 0.1377207651734352,
|
|
"num_tokens": 3884362.0,
|
|
"step": 2235
|
|
},
|
|
{
|
|
"entropy": 5.990269565582276,
|
|
"epoch": 0.17428515852946896,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004998951895580826,
|
|
"loss": 5.9158,
|
|
"mean_token_accuracy": 0.13989226818084716,
|
|
"num_tokens": 3893177.0,
|
|
"step": 2240
|
|
},
|
|
{
|
|
"entropy": 6.01600284576416,
|
|
"epoch": 0.17467418790118655,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004998943419898542,
|
|
"loss": 5.9773,
|
|
"mean_token_accuracy": 0.1380767658352852,
|
|
"num_tokens": 3903006.0,
|
|
"step": 2245
|
|
},
|
|
{
|
|
"entropy": 5.9797093868255615,
|
|
"epoch": 0.1750632172729041,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004998934910092119,
|
|
"loss": 5.8372,
|
|
"mean_token_accuracy": 0.13846131414175034,
|
|
"num_tokens": 3912256.0,
|
|
"step": 2250
|
|
},
|
|
{
|
|
"entropy": 5.916180229187011,
|
|
"epoch": 0.17545224664462167,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004998926366161689,
|
|
"loss": 5.9986,
|
|
"mean_token_accuracy": 0.13596335276961327,
|
|
"num_tokens": 3921121.0,
|
|
"step": 2255
|
|
},
|
|
{
|
|
"entropy": 6.018570613861084,
|
|
"epoch": 0.17584127601633923,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004998917788107383,
|
|
"loss": 5.9479,
|
|
"mean_token_accuracy": 0.139829271286726,
|
|
"num_tokens": 3929348.0,
|
|
"step": 2260
|
|
},
|
|
{
|
|
"entropy": 6.029901313781738,
|
|
"epoch": 0.17623030538805678,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004998909175929326,
|
|
"loss": 6.1262,
|
|
"mean_token_accuracy": 0.13413718938827515,
|
|
"num_tokens": 3938073.0,
|
|
"step": 2265
|
|
},
|
|
{
|
|
"entropy": 6.116082048416137,
|
|
"epoch": 0.17661933475977437,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004998900529627653,
|
|
"loss": 6.1048,
|
|
"mean_token_accuracy": 0.13597819358110427,
|
|
"num_tokens": 3946641.0,
|
|
"step": 2270
|
|
},
|
|
{
|
|
"entropy": 6.074714040756225,
|
|
"epoch": 0.17700836413149193,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004998891849202495,
|
|
"loss": 5.9587,
|
|
"mean_token_accuracy": 0.14048855975270272,
|
|
"num_tokens": 3954586.0,
|
|
"step": 2275
|
|
},
|
|
{
|
|
"entropy": 6.009363508224487,
|
|
"epoch": 0.1773973935032095,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.000499888313465398,
|
|
"loss": 6.0295,
|
|
"mean_token_accuracy": 0.13712368234992028,
|
|
"num_tokens": 3963745.0,
|
|
"step": 2280
|
|
},
|
|
{
|
|
"entropy": 5.937222337722778,
|
|
"epoch": 0.17778642287492705,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004998874385982247,
|
|
"loss": 5.8522,
|
|
"mean_token_accuracy": 0.1412455268204212,
|
|
"num_tokens": 3972452.0,
|
|
"step": 2285
|
|
},
|
|
{
|
|
"entropy": 5.94044041633606,
|
|
"epoch": 0.17817545224664463,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004998865603187421,
|
|
"loss": 5.9574,
|
|
"mean_token_accuracy": 0.13704333379864692,
|
|
"num_tokens": 3980770.0,
|
|
"step": 2290
|
|
},
|
|
{
|
|
"entropy": 6.060723733901978,
|
|
"epoch": 0.1785644816183622,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.000499885678626964,
|
|
"loss": 5.9805,
|
|
"mean_token_accuracy": 0.13396030068397521,
|
|
"num_tokens": 3989545.0,
|
|
"step": 2295
|
|
},
|
|
{
|
|
"entropy": 6.062776803970337,
|
|
"epoch": 0.17895351099007975,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004998847935229038,
|
|
"loss": 5.9424,
|
|
"mean_token_accuracy": 0.13457537293434144,
|
|
"num_tokens": 3998034.0,
|
|
"step": 2300
|
|
},
|
|
{
|
|
"entropy": 5.905241298675537,
|
|
"epoch": 0.1793425403617973,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004998839050065746,
|
|
"loss": 5.9822,
|
|
"mean_token_accuracy": 0.14144275784492494,
|
|
"num_tokens": 4007110.0,
|
|
"step": 2305
|
|
},
|
|
{
|
|
"entropy": 6.042173862457275,
|
|
"epoch": 0.17973156973351487,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004998830130779902,
|
|
"loss": 6.0362,
|
|
"mean_token_accuracy": 0.12785631343722342,
|
|
"num_tokens": 4015930.0,
|
|
"step": 2310
|
|
},
|
|
{
|
|
"entropy": 5.92177267074585,
|
|
"epoch": 0.18012059910523245,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.000499882117737164,
|
|
"loss": 5.8567,
|
|
"mean_token_accuracy": 0.13938324376940728,
|
|
"num_tokens": 4024510.0,
|
|
"step": 2315
|
|
},
|
|
{
|
|
"entropy": 5.9428199291229244,
|
|
"epoch": 0.18050962847695,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004998812189841096,
|
|
"loss": 5.9629,
|
|
"mean_token_accuracy": 0.13904105722904206,
|
|
"num_tokens": 4033714.0,
|
|
"step": 2320
|
|
},
|
|
{
|
|
"entropy": 6.135042381286621,
|
|
"epoch": 0.18089865784866757,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004998803168188407,
|
|
"loss": 6.1461,
|
|
"mean_token_accuracy": 0.12715203911066056,
|
|
"num_tokens": 4042376.0,
|
|
"step": 2325
|
|
},
|
|
{
|
|
"entropy": 6.03497052192688,
|
|
"epoch": 0.18128768722038513,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004998794112413708,
|
|
"loss": 5.9316,
|
|
"mean_token_accuracy": 0.1389988273382187,
|
|
"num_tokens": 4050521.0,
|
|
"step": 2330
|
|
},
|
|
{
|
|
"entropy": 6.097191667556762,
|
|
"epoch": 0.18167671659210272,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004998785022517137,
|
|
"loss": 6.0873,
|
|
"mean_token_accuracy": 0.13467619195580482,
|
|
"num_tokens": 4059384.0,
|
|
"step": 2335
|
|
},
|
|
{
|
|
"entropy": 5.945719146728516,
|
|
"epoch": 0.18206574596382027,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004998775898498835,
|
|
"loss": 5.947,
|
|
"mean_token_accuracy": 0.1388249836862087,
|
|
"num_tokens": 4067655.0,
|
|
"step": 2340
|
|
},
|
|
{
|
|
"entropy": 6.028331184387207,
|
|
"epoch": 0.18245477533553783,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004998766740358936,
|
|
"loss": 5.9342,
|
|
"mean_token_accuracy": 0.1423063322901726,
|
|
"num_tokens": 4075828.0,
|
|
"step": 2345
|
|
},
|
|
{
|
|
"entropy": 6.014834260940551,
|
|
"epoch": 0.1828438047072554,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004998757548097582,
|
|
"loss": 5.9053,
|
|
"mean_token_accuracy": 0.14048654288053514,
|
|
"num_tokens": 4083796.0,
|
|
"step": 2350
|
|
},
|
|
{
|
|
"entropy": 5.980800151824951,
|
|
"epoch": 0.18323283407897295,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004998748321714911,
|
|
"loss": 6.0421,
|
|
"mean_token_accuracy": 0.13735400661826133,
|
|
"num_tokens": 4092981.0,
|
|
"step": 2355
|
|
},
|
|
{
|
|
"entropy": 6.020400857925415,
|
|
"epoch": 0.18362186345069054,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004998739061211065,
|
|
"loss": 5.8484,
|
|
"mean_token_accuracy": 0.14194852709770203,
|
|
"num_tokens": 4101363.0,
|
|
"step": 2360
|
|
},
|
|
{
|
|
"entropy": 5.96309461593628,
|
|
"epoch": 0.1840108928224081,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004998729766586181,
|
|
"loss": 5.9272,
|
|
"mean_token_accuracy": 0.1333435907959938,
|
|
"num_tokens": 4110164.0,
|
|
"step": 2365
|
|
},
|
|
{
|
|
"entropy": 6.044630527496338,
|
|
"epoch": 0.18439992219412565,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004998720437840403,
|
|
"loss": 6.0444,
|
|
"mean_token_accuracy": 0.13811287730932237,
|
|
"num_tokens": 4119098.0,
|
|
"step": 2370
|
|
},
|
|
{
|
|
"entropy": 5.991950607299804,
|
|
"epoch": 0.1847889515658432,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0004998711074973871,
|
|
"loss": 5.9532,
|
|
"mean_token_accuracy": 0.13917487487196922,
|
|
"num_tokens": 4127522.0,
|
|
"step": 2375
|
|
},
|
|
{
|
|
"entropy": 6.0055859088897705,
|
|
"epoch": 0.1851779809375608,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004998701677986728,
|
|
"loss": 5.9803,
|
|
"mean_token_accuracy": 0.14277126044034957,
|
|
"num_tokens": 4136311.0,
|
|
"step": 2380
|
|
},
|
|
{
|
|
"entropy": 5.935305976867676,
|
|
"epoch": 0.18556701030927836,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004998692246879116,
|
|
"loss": 5.9124,
|
|
"mean_token_accuracy": 0.13691533505916595,
|
|
"num_tokens": 4145160.0,
|
|
"step": 2385
|
|
},
|
|
{
|
|
"entropy": 6.005577945709229,
|
|
"epoch": 0.18595603968099592,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004998682781651178,
|
|
"loss": 5.886,
|
|
"mean_token_accuracy": 0.14444762617349624,
|
|
"num_tokens": 4153921.0,
|
|
"step": 2390
|
|
},
|
|
{
|
|
"entropy": 5.912683391571045,
|
|
"epoch": 0.18634506905271347,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004998673282303059,
|
|
"loss": 5.9582,
|
|
"mean_token_accuracy": 0.13400443345308305,
|
|
"num_tokens": 4162580.0,
|
|
"step": 2395
|
|
},
|
|
{
|
|
"entropy": 5.9940591812133786,
|
|
"epoch": 0.18673409842443103,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004998663748834901,
|
|
"loss": 5.9552,
|
|
"mean_token_accuracy": 0.14112788587808608,
|
|
"num_tokens": 4170623.0,
|
|
"step": 2400
|
|
},
|
|
{
|
|
"entropy": 5.947180700302124,
|
|
"epoch": 0.18712312779614862,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004998654181246851,
|
|
"loss": 5.9519,
|
|
"mean_token_accuracy": 0.14752146303653718,
|
|
"num_tokens": 4178724.0,
|
|
"step": 2405
|
|
},
|
|
{
|
|
"entropy": 5.964427280426025,
|
|
"epoch": 0.18751215716786618,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004998644579539052,
|
|
"loss": 5.963,
|
|
"mean_token_accuracy": 0.13656028136610984,
|
|
"num_tokens": 4187773.0,
|
|
"step": 2410
|
|
},
|
|
{
|
|
"entropy": 6.009492588043213,
|
|
"epoch": 0.18790118653958374,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.000499863494371165,
|
|
"loss": 5.9618,
|
|
"mean_token_accuracy": 0.13550449684262275,
|
|
"num_tokens": 4196628.0,
|
|
"step": 2415
|
|
},
|
|
{
|
|
"entropy": 5.984348201751709,
|
|
"epoch": 0.1882902159113013,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004998625273764793,
|
|
"loss": 5.9827,
|
|
"mean_token_accuracy": 0.13410525098443032,
|
|
"num_tokens": 4205090.0,
|
|
"step": 2420
|
|
},
|
|
{
|
|
"entropy": 5.990939712524414,
|
|
"epoch": 0.18867924528301888,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004998615569698626,
|
|
"loss": 5.8965,
|
|
"mean_token_accuracy": 0.1415567897260189,
|
|
"num_tokens": 4212757.0,
|
|
"step": 2425
|
|
},
|
|
{
|
|
"entropy": 5.883493232727051,
|
|
"epoch": 0.18906827465473644,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004998605831513296,
|
|
"loss": 5.9637,
|
|
"mean_token_accuracy": 0.14001091420650483,
|
|
"num_tokens": 4221556.0,
|
|
"step": 2430
|
|
},
|
|
{
|
|
"entropy": 5.936648797988892,
|
|
"epoch": 0.189457304026454,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004998596059208953,
|
|
"loss": 5.9587,
|
|
"mean_token_accuracy": 0.13833684399724006,
|
|
"num_tokens": 4231524.0,
|
|
"step": 2435
|
|
},
|
|
{
|
|
"entropy": 6.036439371109009,
|
|
"epoch": 0.18984633339817156,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004998586252785743,
|
|
"loss": 5.9826,
|
|
"mean_token_accuracy": 0.1431053563952446,
|
|
"num_tokens": 4240229.0,
|
|
"step": 2440
|
|
},
|
|
{
|
|
"entropy": 5.956485605239868,
|
|
"epoch": 0.19023536276988912,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004998576412243816,
|
|
"loss": 5.8587,
|
|
"mean_token_accuracy": 0.14437367022037506,
|
|
"num_tokens": 4248053.0,
|
|
"step": 2445
|
|
},
|
|
{
|
|
"entropy": 5.988489770889283,
|
|
"epoch": 0.1906243921416067,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004998566537583321,
|
|
"loss": 5.9007,
|
|
"mean_token_accuracy": 0.13747418969869613,
|
|
"num_tokens": 4256019.0,
|
|
"step": 2450
|
|
},
|
|
{
|
|
"entropy": 5.89534101486206,
|
|
"epoch": 0.19101342151332426,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004998556628804408,
|
|
"loss": 5.8917,
|
|
"mean_token_accuracy": 0.14226853474974632,
|
|
"num_tokens": 4263805.0,
|
|
"step": 2455
|
|
},
|
|
{
|
|
"entropy": 5.958291482925415,
|
|
"epoch": 0.19140245088504182,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004998546685907225,
|
|
"loss": 5.9534,
|
|
"mean_token_accuracy": 0.13563379049301147,
|
|
"num_tokens": 4272712.0,
|
|
"step": 2460
|
|
},
|
|
{
|
|
"entropy": 6.066695690155029,
|
|
"epoch": 0.19179148025675938,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004998536708891927,
|
|
"loss": 5.8824,
|
|
"mean_token_accuracy": 0.14191587790846824,
|
|
"num_tokens": 4281222.0,
|
|
"step": 2465
|
|
},
|
|
{
|
|
"entropy": 5.9650391101837155,
|
|
"epoch": 0.19218050962847694,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004998526697758663,
|
|
"loss": 6.0121,
|
|
"mean_token_accuracy": 0.13257578536868095,
|
|
"num_tokens": 4290558.0,
|
|
"step": 2470
|
|
},
|
|
{
|
|
"entropy": 6.109343481063843,
|
|
"epoch": 0.19256953900019452,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004998516652507585,
|
|
"loss": 6.0253,
|
|
"mean_token_accuracy": 0.13303112387657165,
|
|
"num_tokens": 4299684.0,
|
|
"step": 2475
|
|
},
|
|
{
|
|
"entropy": 5.899087524414062,
|
|
"epoch": 0.19295856837191208,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004998506573138846,
|
|
"loss": 5.9633,
|
|
"mean_token_accuracy": 0.14104458689689636,
|
|
"num_tokens": 4308938.0,
|
|
"step": 2480
|
|
},
|
|
{
|
|
"entropy": 5.9440470218658445,
|
|
"epoch": 0.19334759774362964,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004998496459652598,
|
|
"loss": 5.8208,
|
|
"mean_token_accuracy": 0.14647359624505044,
|
|
"num_tokens": 4317646.0,
|
|
"step": 2485
|
|
},
|
|
{
|
|
"entropy": 5.964761638641358,
|
|
"epoch": 0.1937366271153472,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004998486312048995,
|
|
"loss": 5.9621,
|
|
"mean_token_accuracy": 0.13583191409707068,
|
|
"num_tokens": 4326876.0,
|
|
"step": 2490
|
|
},
|
|
{
|
|
"entropy": 5.967274475097656,
|
|
"epoch": 0.19412565648706478,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004998476130328193,
|
|
"loss": 5.931,
|
|
"mean_token_accuracy": 0.13568915724754332,
|
|
"num_tokens": 4335391.0,
|
|
"step": 2495
|
|
},
|
|
{
|
|
"entropy": 6.055395555496216,
|
|
"epoch": 0.19451468585878234,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004998465914490343,
|
|
"loss": 5.9052,
|
|
"mean_token_accuracy": 0.1406179554760456,
|
|
"num_tokens": 4343253.0,
|
|
"step": 2500
|
|
},
|
|
{
|
|
"entropy": 5.760255670547485,
|
|
"epoch": 0.1949037152304999,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00049984556645356,
|
|
"loss": 5.8742,
|
|
"mean_token_accuracy": 0.14200342074036598,
|
|
"num_tokens": 4352161.0,
|
|
"step": 2505
|
|
},
|
|
{
|
|
"entropy": 5.938892364501953,
|
|
"epoch": 0.19529274460221746,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004998445380464124,
|
|
"loss": 5.8385,
|
|
"mean_token_accuracy": 0.1466829337179661,
|
|
"num_tokens": 4360414.0,
|
|
"step": 2510
|
|
},
|
|
{
|
|
"entropy": 5.896971416473389,
|
|
"epoch": 0.19568177397393502,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004998435062276066,
|
|
"loss": 5.8228,
|
|
"mean_token_accuracy": 0.14513540267944336,
|
|
"num_tokens": 4369375.0,
|
|
"step": 2515
|
|
},
|
|
{
|
|
"entropy": 5.903877830505371,
|
|
"epoch": 0.1960708033456526,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004998424709971586,
|
|
"loss": 5.8483,
|
|
"mean_token_accuracy": 0.14223146587610244,
|
|
"num_tokens": 4378638.0,
|
|
"step": 2520
|
|
},
|
|
{
|
|
"entropy": 5.983705711364746,
|
|
"epoch": 0.19645983271737016,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004998414323550839,
|
|
"loss": 5.8616,
|
|
"mean_token_accuracy": 0.14103932306170464,
|
|
"num_tokens": 4388262.0,
|
|
"step": 2525
|
|
},
|
|
{
|
|
"entropy": 5.874213314056396,
|
|
"epoch": 0.19684886208908772,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004998403903013984,
|
|
"loss": 5.8501,
|
|
"mean_token_accuracy": 0.1444000080227852,
|
|
"num_tokens": 4396894.0,
|
|
"step": 2530
|
|
},
|
|
{
|
|
"entropy": 5.949297761917114,
|
|
"epoch": 0.19723789146080528,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004998393448361179,
|
|
"loss": 6.0004,
|
|
"mean_token_accuracy": 0.1377578116953373,
|
|
"num_tokens": 4405455.0,
|
|
"step": 2535
|
|
},
|
|
{
|
|
"entropy": 5.937081432342529,
|
|
"epoch": 0.19762692083252287,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.000499838295959258,
|
|
"loss": 5.8999,
|
|
"mean_token_accuracy": 0.13834612667560578,
|
|
"num_tokens": 4414355.0,
|
|
"step": 2540
|
|
},
|
|
{
|
|
"entropy": 5.8034745216369625,
|
|
"epoch": 0.19801595020424043,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.000499837243670835,
|
|
"loss": 5.7847,
|
|
"mean_token_accuracy": 0.14933302402496337,
|
|
"num_tokens": 4422305.0,
|
|
"step": 2545
|
|
},
|
|
{
|
|
"entropy": 5.9695093631744385,
|
|
"epoch": 0.19840497957595798,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004998361879708646,
|
|
"loss": 5.9185,
|
|
"mean_token_accuracy": 0.13912818506360053,
|
|
"num_tokens": 4430813.0,
|
|
"step": 2550
|
|
},
|
|
{
|
|
"entropy": 5.963333559036255,
|
|
"epoch": 0.19879400894767554,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.000499835128859363,
|
|
"loss": 5.8774,
|
|
"mean_token_accuracy": 0.14088211506605147,
|
|
"num_tokens": 4440229.0,
|
|
"step": 2555
|
|
},
|
|
{
|
|
"entropy": 5.8513782024383545,
|
|
"epoch": 0.1991830383193931,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004998340663363461,
|
|
"loss": 5.9025,
|
|
"mean_token_accuracy": 0.13724920377135277,
|
|
"num_tokens": 4449417.0,
|
|
"step": 2560
|
|
},
|
|
{
|
|
"entropy": 5.9853545188903805,
|
|
"epoch": 0.1995720676911107,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004998330004018301,
|
|
"loss": 5.944,
|
|
"mean_token_accuracy": 0.13790054023265838,
|
|
"num_tokens": 4457377.0,
|
|
"step": 2565
|
|
},
|
|
{
|
|
"entropy": 5.990766906738282,
|
|
"epoch": 0.19996109706282825,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004998319310558312,
|
|
"loss": 5.8617,
|
|
"mean_token_accuracy": 0.14069739058613778,
|
|
"num_tokens": 4466839.0,
|
|
"step": 2570
|
|
},
|
|
{
|
|
"entropy": 5.904648494720459,
|
|
"epoch": 0.2003501264345458,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004998308582983657,
|
|
"loss": 5.9051,
|
|
"mean_token_accuracy": 0.14068260937929153,
|
|
"num_tokens": 4476369.0,
|
|
"step": 2575
|
|
},
|
|
{
|
|
"entropy": 5.9384589195251465,
|
|
"epoch": 0.20073915580626336,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004998297821294497,
|
|
"loss": 5.9575,
|
|
"mean_token_accuracy": 0.13891851380467415,
|
|
"num_tokens": 4485609.0,
|
|
"step": 2580
|
|
},
|
|
{
|
|
"entropy": 5.939151048660278,
|
|
"epoch": 0.20112818517798095,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004998287025490995,
|
|
"loss": 5.9092,
|
|
"mean_token_accuracy": 0.1407192036509514,
|
|
"num_tokens": 4494535.0,
|
|
"step": 2585
|
|
},
|
|
{
|
|
"entropy": 5.945156764984131,
|
|
"epoch": 0.2015172145496985,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004998276195573317,
|
|
"loss": 5.8844,
|
|
"mean_token_accuracy": 0.1363791175186634,
|
|
"num_tokens": 4503133.0,
|
|
"step": 2590
|
|
},
|
|
{
|
|
"entropy": 5.885627603530883,
|
|
"epoch": 0.20190624392141607,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004998265331541627,
|
|
"loss": 5.7876,
|
|
"mean_token_accuracy": 0.15038875490427017,
|
|
"num_tokens": 4511465.0,
|
|
"step": 2595
|
|
},
|
|
{
|
|
"entropy": 5.883782386779785,
|
|
"epoch": 0.20229527329313363,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004998254433396088,
|
|
"loss": 5.8499,
|
|
"mean_token_accuracy": 0.14612346962094308,
|
|
"num_tokens": 4520177.0,
|
|
"step": 2600
|
|
},
|
|
{
|
|
"entropy": 5.947019147872925,
|
|
"epoch": 0.20268430266485118,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004998243501136867,
|
|
"loss": 6.0221,
|
|
"mean_token_accuracy": 0.13749735280871392,
|
|
"num_tokens": 4528370.0,
|
|
"step": 2605
|
|
},
|
|
{
|
|
"entropy": 6.0327956199646,
|
|
"epoch": 0.20307333203656877,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004998232534764129,
|
|
"loss": 6.0424,
|
|
"mean_token_accuracy": 0.13159574791789055,
|
|
"num_tokens": 4538258.0,
|
|
"step": 2610
|
|
},
|
|
{
|
|
"entropy": 5.933379316329956,
|
|
"epoch": 0.20346236140828633,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004998221534278041,
|
|
"loss": 5.9334,
|
|
"mean_token_accuracy": 0.13688500002026557,
|
|
"num_tokens": 4547300.0,
|
|
"step": 2615
|
|
},
|
|
{
|
|
"entropy": 6.0140650272369385,
|
|
"epoch": 0.2038513907800039,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004998210499678769,
|
|
"loss": 5.9854,
|
|
"mean_token_accuracy": 0.1308668576180935,
|
|
"num_tokens": 4556877.0,
|
|
"step": 2620
|
|
},
|
|
{
|
|
"entropy": 5.907776832580566,
|
|
"epoch": 0.20424042015172145,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004998199430966481,
|
|
"loss": 5.8302,
|
|
"mean_token_accuracy": 0.14112840071320534,
|
|
"num_tokens": 4565999.0,
|
|
"step": 2625
|
|
},
|
|
{
|
|
"entropy": 5.913699102401734,
|
|
"epoch": 0.20462944952343903,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004998188328141346,
|
|
"loss": 5.8793,
|
|
"mean_token_accuracy": 0.13416805639863014,
|
|
"num_tokens": 4574027.0,
|
|
"step": 2630
|
|
},
|
|
{
|
|
"entropy": 5.887786960601806,
|
|
"epoch": 0.2050184788951566,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004998177191203531,
|
|
"loss": 5.8994,
|
|
"mean_token_accuracy": 0.1329669289290905,
|
|
"num_tokens": 4582402.0,
|
|
"step": 2635
|
|
},
|
|
{
|
|
"entropy": 5.92496690750122,
|
|
"epoch": 0.20540750826687415,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0004998166020153204,
|
|
"loss": 5.8358,
|
|
"mean_token_accuracy": 0.14105968326330184,
|
|
"num_tokens": 4590381.0,
|
|
"step": 2640
|
|
},
|
|
{
|
|
"entropy": 5.917643356323242,
|
|
"epoch": 0.2057965376385917,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0004998154814990538,
|
|
"loss": 5.885,
|
|
"mean_token_accuracy": 0.14099830090999604,
|
|
"num_tokens": 4598910.0,
|
|
"step": 2645
|
|
},
|
|
{
|
|
"entropy": 6.011348581314087,
|
|
"epoch": 0.20618556701030927,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00049981435757157,
|
|
"loss": 6.015,
|
|
"mean_token_accuracy": 0.13125852718949318,
|
|
"num_tokens": 4607400.0,
|
|
"step": 2650
|
|
},
|
|
{
|
|
"entropy": 5.917462635040283,
|
|
"epoch": 0.20657459638202685,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004998132302328862,
|
|
"loss": 5.9403,
|
|
"mean_token_accuracy": 0.14050790518522263,
|
|
"num_tokens": 4616510.0,
|
|
"step": 2655
|
|
},
|
|
{
|
|
"entropy": 6.007234954833985,
|
|
"epoch": 0.2069636257537444,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004998120994830195,
|
|
"loss": 5.9072,
|
|
"mean_token_accuracy": 0.14376826882362365,
|
|
"num_tokens": 4624529.0,
|
|
"step": 2660
|
|
},
|
|
{
|
|
"entropy": 5.918785476684571,
|
|
"epoch": 0.20735265512546197,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.000499810965321987,
|
|
"loss": 5.8346,
|
|
"mean_token_accuracy": 0.14414578527212143,
|
|
"num_tokens": 4632141.0,
|
|
"step": 2665
|
|
},
|
|
{
|
|
"entropy": 5.9577617168426515,
|
|
"epoch": 0.20774168449717953,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0004998098277498059,
|
|
"loss": 6.0381,
|
|
"mean_token_accuracy": 0.1350015841424465,
|
|
"num_tokens": 4640378.0,
|
|
"step": 2670
|
|
},
|
|
{
|
|
"entropy": 5.925170755386352,
|
|
"epoch": 0.2081307138688971,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004998086867664934,
|
|
"loss": 5.8409,
|
|
"mean_token_accuracy": 0.1414250299334526,
|
|
"num_tokens": 4649313.0,
|
|
"step": 2675
|
|
},
|
|
{
|
|
"entropy": 5.9586829662323,
|
|
"epoch": 0.20851974324061467,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.000499807542372067,
|
|
"loss": 5.9164,
|
|
"mean_token_accuracy": 0.14138886630535125,
|
|
"num_tokens": 4658272.0,
|
|
"step": 2680
|
|
},
|
|
{
|
|
"entropy": 5.856334686279297,
|
|
"epoch": 0.20890877261233223,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004998063945665439,
|
|
"loss": 5.7767,
|
|
"mean_token_accuracy": 0.14743116796016692,
|
|
"num_tokens": 4665970.0,
|
|
"step": 2685
|
|
},
|
|
{
|
|
"entropy": 5.974782228469849,
|
|
"epoch": 0.2092978019840498,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004998052433499416,
|
|
"loss": 6.0326,
|
|
"mean_token_accuracy": 0.13459649160504342,
|
|
"num_tokens": 4675308.0,
|
|
"step": 2690
|
|
},
|
|
{
|
|
"entropy": 5.90858154296875,
|
|
"epoch": 0.20968683135576735,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004998040887222776,
|
|
"loss": 5.8772,
|
|
"mean_token_accuracy": 0.14054309129714965,
|
|
"num_tokens": 4684316.0,
|
|
"step": 2695
|
|
},
|
|
{
|
|
"entropy": 5.852538108825684,
|
|
"epoch": 0.21007586072748494,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0004998029306835693,
|
|
"loss": 5.7932,
|
|
"mean_token_accuracy": 0.1447305828332901,
|
|
"num_tokens": 4693029.0,
|
|
"step": 2700
|
|
},
|
|
{
|
|
"entropy": 5.91006441116333,
|
|
"epoch": 0.2104648900992025,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004998017692338344,
|
|
"loss": 5.9919,
|
|
"mean_token_accuracy": 0.1333250030875206,
|
|
"num_tokens": 4702404.0,
|
|
"step": 2705
|
|
},
|
|
{
|
|
"entropy": 5.972537851333618,
|
|
"epoch": 0.21085391947092005,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004998006043730905,
|
|
"loss": 5.9484,
|
|
"mean_token_accuracy": 0.13651543334126473,
|
|
"num_tokens": 4711126.0,
|
|
"step": 2710
|
|
},
|
|
{
|
|
"entropy": 5.994960069656372,
|
|
"epoch": 0.2112429488426376,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004997994361013551,
|
|
"loss": 5.9405,
|
|
"mean_token_accuracy": 0.14613958448171616,
|
|
"num_tokens": 4719816.0,
|
|
"step": 2715
|
|
},
|
|
{
|
|
"entropy": 5.966370105743408,
|
|
"epoch": 0.21163197821435517,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004997982644186461,
|
|
"loss": 5.8798,
|
|
"mean_token_accuracy": 0.13973141759634017,
|
|
"num_tokens": 4728294.0,
|
|
"step": 2720
|
|
},
|
|
{
|
|
"entropy": 5.888756990432739,
|
|
"epoch": 0.21202100758607276,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004997970893249813,
|
|
"loss": 5.8275,
|
|
"mean_token_accuracy": 0.1435457229614258,
|
|
"num_tokens": 4736708.0,
|
|
"step": 2725
|
|
},
|
|
{
|
|
"entropy": 5.873240041732788,
|
|
"epoch": 0.21241003695779032,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004997959108203785,
|
|
"loss": 6.0039,
|
|
"mean_token_accuracy": 0.13070807754993438,
|
|
"num_tokens": 4744893.0,
|
|
"step": 2730
|
|
},
|
|
{
|
|
"entropy": 6.096560430526734,
|
|
"epoch": 0.21279906632950787,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004997947289048554,
|
|
"loss": 5.9623,
|
|
"mean_token_accuracy": 0.13920049890875816,
|
|
"num_tokens": 4753246.0,
|
|
"step": 2735
|
|
},
|
|
{
|
|
"entropy": 5.931299209594727,
|
|
"epoch": 0.21318809570122543,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004997935435784302,
|
|
"loss": 5.8833,
|
|
"mean_token_accuracy": 0.13352058157324792,
|
|
"num_tokens": 4762229.0,
|
|
"step": 2740
|
|
},
|
|
{
|
|
"entropy": 5.805833244323731,
|
|
"epoch": 0.21357712507294302,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004997923548411208,
|
|
"loss": 5.8366,
|
|
"mean_token_accuracy": 0.14200862497091293,
|
|
"num_tokens": 4771315.0,
|
|
"step": 2745
|
|
},
|
|
{
|
|
"entropy": 5.755913734436035,
|
|
"epoch": 0.21396615444466058,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.000499791162692945,
|
|
"loss": 5.7604,
|
|
"mean_token_accuracy": 0.15337736159563065,
|
|
"num_tokens": 4779848.0,
|
|
"step": 2750
|
|
},
|
|
{
|
|
"entropy": 5.984225654602051,
|
|
"epoch": 0.21435518381637814,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004997899671339214,
|
|
"loss": 6.0054,
|
|
"mean_token_accuracy": 0.14065569192171096,
|
|
"num_tokens": 4788939.0,
|
|
"step": 2755
|
|
},
|
|
{
|
|
"entropy": 5.942894124984742,
|
|
"epoch": 0.2147442131880957,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004997887681640675,
|
|
"loss": 5.906,
|
|
"mean_token_accuracy": 0.13755589798092843,
|
|
"num_tokens": 4797719.0,
|
|
"step": 2760
|
|
},
|
|
{
|
|
"entropy": 5.928773069381714,
|
|
"epoch": 0.21513324255981325,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004997875657834021,
|
|
"loss": 5.9602,
|
|
"mean_token_accuracy": 0.1399763911962509,
|
|
"num_tokens": 4805601.0,
|
|
"step": 2765
|
|
},
|
|
{
|
|
"entropy": 6.0012726306915285,
|
|
"epoch": 0.21552227193153084,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004997863599919432,
|
|
"loss": 5.9298,
|
|
"mean_token_accuracy": 0.13780287876725197,
|
|
"num_tokens": 4814993.0,
|
|
"step": 2770
|
|
},
|
|
{
|
|
"entropy": 5.983278465270996,
|
|
"epoch": 0.2159113013032484,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004997851507897089,
|
|
"loss": 5.8699,
|
|
"mean_token_accuracy": 0.14026867374777793,
|
|
"num_tokens": 4824156.0,
|
|
"step": 2775
|
|
},
|
|
{
|
|
"entropy": 5.871163606643677,
|
|
"epoch": 0.21630033067496596,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004997839381767178,
|
|
"loss": 5.9559,
|
|
"mean_token_accuracy": 0.13493574261665345,
|
|
"num_tokens": 4833827.0,
|
|
"step": 2780
|
|
},
|
|
{
|
|
"entropy": 5.923353576660157,
|
|
"epoch": 0.21668936004668352,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004997827221529882,
|
|
"loss": 5.9086,
|
|
"mean_token_accuracy": 0.14079293385148048,
|
|
"num_tokens": 4842801.0,
|
|
"step": 2785
|
|
},
|
|
{
|
|
"entropy": 5.858642721176148,
|
|
"epoch": 0.2170783894184011,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004997815027185386,
|
|
"loss": 5.7611,
|
|
"mean_token_accuracy": 0.14427610188722612,
|
|
"num_tokens": 4850928.0,
|
|
"step": 2790
|
|
},
|
|
{
|
|
"entropy": 5.874434089660644,
|
|
"epoch": 0.21746741879011866,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004997802798733874,
|
|
"loss": 5.8683,
|
|
"mean_token_accuracy": 0.14393499940633775,
|
|
"num_tokens": 4859510.0,
|
|
"step": 2795
|
|
},
|
|
{
|
|
"entropy": 5.975643491744995,
|
|
"epoch": 0.21785644816183622,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004997790536175534,
|
|
"loss": 5.9173,
|
|
"mean_token_accuracy": 0.14145495295524596,
|
|
"num_tokens": 4868201.0,
|
|
"step": 2800
|
|
},
|
|
{
|
|
"entropy": 5.86905689239502,
|
|
"epoch": 0.21824547753355378,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004997778239510548,
|
|
"loss": 5.8335,
|
|
"mean_token_accuracy": 0.14240052700042724,
|
|
"num_tokens": 4876896.0,
|
|
"step": 2805
|
|
},
|
|
{
|
|
"entropy": 5.826552057266236,
|
|
"epoch": 0.21863450690527134,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004997765908739106,
|
|
"loss": 5.7898,
|
|
"mean_token_accuracy": 0.15225823372602462,
|
|
"num_tokens": 4885136.0,
|
|
"step": 2810
|
|
},
|
|
{
|
|
"entropy": 5.826451778411865,
|
|
"epoch": 0.21902353627698892,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004997753543861395,
|
|
"loss": 5.8053,
|
|
"mean_token_accuracy": 0.1449057564139366,
|
|
"num_tokens": 4893277.0,
|
|
"step": 2815
|
|
},
|
|
{
|
|
"entropy": 5.87442626953125,
|
|
"epoch": 0.21941256564870648,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00049977411448776,
|
|
"loss": 5.962,
|
|
"mean_token_accuracy": 0.1370394378900528,
|
|
"num_tokens": 4901977.0,
|
|
"step": 2820
|
|
},
|
|
{
|
|
"entropy": 6.066293048858642,
|
|
"epoch": 0.21980159502042404,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004997728711787912,
|
|
"loss": 5.9498,
|
|
"mean_token_accuracy": 0.13320593908429146,
|
|
"num_tokens": 4910888.0,
|
|
"step": 2825
|
|
},
|
|
{
|
|
"entropy": 5.899124479293823,
|
|
"epoch": 0.2201906243921416,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004997716244592518,
|
|
"loss": 5.9556,
|
|
"mean_token_accuracy": 0.13331344723701477,
|
|
"num_tokens": 4920369.0,
|
|
"step": 2830
|
|
},
|
|
{
|
|
"entropy": 5.970640707015991,
|
|
"epoch": 0.22057965376385918,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0004997703743291607,
|
|
"loss": 5.9372,
|
|
"mean_token_accuracy": 0.13818638548254966,
|
|
"num_tokens": 4928799.0,
|
|
"step": 2835
|
|
},
|
|
{
|
|
"entropy": 5.959006452560425,
|
|
"epoch": 0.22096868313557674,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.000499769120788537,
|
|
"loss": 5.8186,
|
|
"mean_token_accuracy": 0.14796194583177566,
|
|
"num_tokens": 4937194.0,
|
|
"step": 2840
|
|
},
|
|
{
|
|
"entropy": 5.892886638641357,
|
|
"epoch": 0.2213577125072943,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004997678638373995,
|
|
"loss": 5.9246,
|
|
"mean_token_accuracy": 0.13645815178751947,
|
|
"num_tokens": 4946174.0,
|
|
"step": 2845
|
|
},
|
|
{
|
|
"entropy": 5.890604877471924,
|
|
"epoch": 0.22174674187901186,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004997666034757676,
|
|
"loss": 5.8636,
|
|
"mean_token_accuracy": 0.1371280185878277,
|
|
"num_tokens": 4955376.0,
|
|
"step": 2850
|
|
},
|
|
{
|
|
"entropy": 5.896667575836181,
|
|
"epoch": 0.22213577125072942,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004997653397036603,
|
|
"loss": 5.8672,
|
|
"mean_token_accuracy": 0.14396676495671273,
|
|
"num_tokens": 4964138.0,
|
|
"step": 2855
|
|
},
|
|
{
|
|
"entropy": 5.889484786987305,
|
|
"epoch": 0.222524800622447,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004997640725210965,
|
|
"loss": 5.9614,
|
|
"mean_token_accuracy": 0.13742173463106155,
|
|
"num_tokens": 4973868.0,
|
|
"step": 2860
|
|
},
|
|
{
|
|
"entropy": 5.917964696884155,
|
|
"epoch": 0.22291382999416456,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0004997628019280958,
|
|
"loss": 5.8382,
|
|
"mean_token_accuracy": 0.1428116887807846,
|
|
"num_tokens": 4982687.0,
|
|
"step": 2865
|
|
},
|
|
{
|
|
"entropy": 5.931079006195068,
|
|
"epoch": 0.22330285936588212,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004997615279246773,
|
|
"loss": 5.8865,
|
|
"mean_token_accuracy": 0.13743261098861695,
|
|
"num_tokens": 4992072.0,
|
|
"step": 2870
|
|
},
|
|
{
|
|
"entropy": 5.911539316177368,
|
|
"epoch": 0.22369188873759968,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004997602505108603,
|
|
"loss": 5.8446,
|
|
"mean_token_accuracy": 0.1401855692267418,
|
|
"num_tokens": 5000551.0,
|
|
"step": 2875
|
|
},
|
|
{
|
|
"entropy": 5.937168121337891,
|
|
"epoch": 0.22408091810931724,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004997589696866644,
|
|
"loss": 5.9994,
|
|
"mean_token_accuracy": 0.13774950057268143,
|
|
"num_tokens": 5009292.0,
|
|
"step": 2880
|
|
},
|
|
{
|
|
"entropy": 5.91554889678955,
|
|
"epoch": 0.22446994748103483,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004997576854521088,
|
|
"loss": 5.8535,
|
|
"mean_token_accuracy": 0.13967245817184448,
|
|
"num_tokens": 5018407.0,
|
|
"step": 2885
|
|
},
|
|
{
|
|
"entropy": 5.8885914325714115,
|
|
"epoch": 0.22485897685275238,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.000499756397807213,
|
|
"loss": 5.9008,
|
|
"mean_token_accuracy": 0.1394205868244171,
|
|
"num_tokens": 5027353.0,
|
|
"step": 2890
|
|
},
|
|
{
|
|
"entropy": 6.03417592048645,
|
|
"epoch": 0.22524800622446994,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004997551067519966,
|
|
"loss": 5.9215,
|
|
"mean_token_accuracy": 0.13638510555028915,
|
|
"num_tokens": 5036476.0,
|
|
"step": 2895
|
|
},
|
|
{
|
|
"entropy": 5.861401844024658,
|
|
"epoch": 0.2256370355961875,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004997538122864792,
|
|
"loss": 5.8525,
|
|
"mean_token_accuracy": 0.13833182156085969,
|
|
"num_tokens": 5045132.0,
|
|
"step": 2900
|
|
},
|
|
{
|
|
"entropy": 5.916049289703369,
|
|
"epoch": 0.2260260649679051,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004997525144106804,
|
|
"loss": 5.872,
|
|
"mean_token_accuracy": 0.14037140905857087,
|
|
"num_tokens": 5053665.0,
|
|
"step": 2905
|
|
},
|
|
{
|
|
"entropy": 5.922544813156128,
|
|
"epoch": 0.22641509433962265,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00049975121312462,
|
|
"loss": 5.8271,
|
|
"mean_token_accuracy": 0.14556183218955993,
|
|
"num_tokens": 5062516.0,
|
|
"step": 2910
|
|
},
|
|
{
|
|
"entropy": 5.899590253829956,
|
|
"epoch": 0.2268041237113402,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004997499084283177,
|
|
"loss": 5.8772,
|
|
"mean_token_accuracy": 0.13606662452220916,
|
|
"num_tokens": 5071260.0,
|
|
"step": 2915
|
|
},
|
|
{
|
|
"entropy": 5.827817678451538,
|
|
"epoch": 0.22719315308305776,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004997486003217932,
|
|
"loss": 5.8196,
|
|
"mean_token_accuracy": 0.1497701920568943,
|
|
"num_tokens": 5079215.0,
|
|
"step": 2920
|
|
},
|
|
{
|
|
"entropy": 5.8816290378570555,
|
|
"epoch": 0.22758218245477532,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004997472888050664,
|
|
"loss": 5.8938,
|
|
"mean_token_accuracy": 0.14027459546923637,
|
|
"num_tokens": 5088404.0,
|
|
"step": 2925
|
|
},
|
|
{
|
|
"entropy": 5.900744438171387,
|
|
"epoch": 0.2279712118264929,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004997459738781573,
|
|
"loss": 5.8239,
|
|
"mean_token_accuracy": 0.1431146442890167,
|
|
"num_tokens": 5096756.0,
|
|
"step": 2930
|
|
},
|
|
{
|
|
"entropy": 5.979656934738159,
|
|
"epoch": 0.22836024119821047,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004997446555410857,
|
|
"loss": 5.9904,
|
|
"mean_token_accuracy": 0.13891934603452682,
|
|
"num_tokens": 5106160.0,
|
|
"step": 2935
|
|
},
|
|
{
|
|
"entropy": 5.7854640007019045,
|
|
"epoch": 0.22874927056992803,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004997433337938716,
|
|
"loss": 5.9235,
|
|
"mean_token_accuracy": 0.14122586995363234,
|
|
"num_tokens": 5114915.0,
|
|
"step": 2940
|
|
},
|
|
{
|
|
"entropy": 5.964998531341553,
|
|
"epoch": 0.22913829994164558,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004997420086365351,
|
|
"loss": 5.8379,
|
|
"mean_token_accuracy": 0.1387510970234871,
|
|
"num_tokens": 5123249.0,
|
|
"step": 2945
|
|
},
|
|
{
|
|
"entropy": 5.894250869750977,
|
|
"epoch": 0.22952732931336317,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004997406800690966,
|
|
"loss": 5.8134,
|
|
"mean_token_accuracy": 0.138453159481287,
|
|
"num_tokens": 5131906.0,
|
|
"step": 2950
|
|
},
|
|
{
|
|
"entropy": 5.863798522949219,
|
|
"epoch": 0.22991635868508073,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004997393480915758,
|
|
"loss": 5.8003,
|
|
"mean_token_accuracy": 0.146034524589777,
|
|
"num_tokens": 5140740.0,
|
|
"step": 2955
|
|
},
|
|
{
|
|
"entropy": 5.900701189041138,
|
|
"epoch": 0.2303053880567983,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004997380127039931,
|
|
"loss": 5.9917,
|
|
"mean_token_accuracy": 0.13965021297335625,
|
|
"num_tokens": 5149748.0,
|
|
"step": 2960
|
|
},
|
|
{
|
|
"entropy": 5.876333379745484,
|
|
"epoch": 0.23069441742851585,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004997366739063688,
|
|
"loss": 5.719,
|
|
"mean_token_accuracy": 0.14996112510561943,
|
|
"num_tokens": 5158475.0,
|
|
"step": 2965
|
|
},
|
|
{
|
|
"entropy": 5.8662495613098145,
|
|
"epoch": 0.2310834468002334,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004997353316987231,
|
|
"loss": 5.913,
|
|
"mean_token_accuracy": 0.13812702000141144,
|
|
"num_tokens": 5166593.0,
|
|
"step": 2970
|
|
},
|
|
{
|
|
"entropy": 5.93091893196106,
|
|
"epoch": 0.231472476171951,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004997339860810765,
|
|
"loss": 5.8913,
|
|
"mean_token_accuracy": 0.14304886758327484,
|
|
"num_tokens": 5175557.0,
|
|
"step": 2975
|
|
},
|
|
{
|
|
"entropy": 5.873473691940307,
|
|
"epoch": 0.23186150554366855,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004997326370534495,
|
|
"loss": 5.7973,
|
|
"mean_token_accuracy": 0.14339174702763557,
|
|
"num_tokens": 5184140.0,
|
|
"step": 2980
|
|
},
|
|
{
|
|
"entropy": 5.962021112442017,
|
|
"epoch": 0.2322505349153861,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004997312846158622,
|
|
"loss": 5.8895,
|
|
"mean_token_accuracy": 0.13540481626987458,
|
|
"num_tokens": 5192347.0,
|
|
"step": 2985
|
|
},
|
|
{
|
|
"entropy": 5.857995939254761,
|
|
"epoch": 0.23263956428710367,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004997299287683355,
|
|
"loss": 5.8516,
|
|
"mean_token_accuracy": 0.1456963911652565,
|
|
"num_tokens": 5201327.0,
|
|
"step": 2990
|
|
},
|
|
{
|
|
"entropy": 5.914484262466431,
|
|
"epoch": 0.23302859365882125,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0004997285695108898,
|
|
"loss": 5.9333,
|
|
"mean_token_accuracy": 0.14006564170122146,
|
|
"num_tokens": 5209873.0,
|
|
"step": 2995
|
|
},
|
|
{
|
|
"entropy": 5.987733602523804,
|
|
"epoch": 0.2334176230305388,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0004997272068435458,
|
|
"loss": 5.8368,
|
|
"mean_token_accuracy": 0.14314770549535752,
|
|
"num_tokens": 5219176.0,
|
|
"step": 3000
|
|
},
|
|
{
|
|
"epoch": 0.2334176230305388,
|
|
"eval_entropy": 5.733757502672417,
|
|
"eval_loss": 5.909061431884766,
|
|
"eval_mean_token_accuracy": 0.1476683286819123,
|
|
"eval_num_tokens": 5219176.0,
|
|
"eval_runtime": 28.6428,
|
|
"eval_samples_per_second": 1450.906,
|
|
"eval_steps_per_second": 181.372,
|
|
"step": 3000
|
|
},
|
|
{
|
|
"entropy": 5.831014919281006,
|
|
"epoch": 0.23380665240225637,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.000499725840766324,
|
|
"loss": 5.781,
|
|
"mean_token_accuracy": 0.15310309678316117,
|
|
"num_tokens": 5227310.0,
|
|
"step": 3005
|
|
},
|
|
{
|
|
"entropy": 5.916271114349366,
|
|
"epoch": 0.23419568177397393,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0004997244712792453,
|
|
"loss": 5.871,
|
|
"mean_token_accuracy": 0.13849457129836082,
|
|
"num_tokens": 5235882.0,
|
|
"step": 3010
|
|
},
|
|
{
|
|
"entropy": 5.8643897533416744,
|
|
"epoch": 0.2345847111456915,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004997230983823305,
|
|
"loss": 5.7895,
|
|
"mean_token_accuracy": 0.14129805639386178,
|
|
"num_tokens": 5244149.0,
|
|
"step": 3015
|
|
},
|
|
{
|
|
"entropy": 5.725203800201416,
|
|
"epoch": 0.23497374051740907,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004997217220756003,
|
|
"loss": 5.6533,
|
|
"mean_token_accuracy": 0.14943938702344894,
|
|
"num_tokens": 5252473.0,
|
|
"step": 3020
|
|
},
|
|
{
|
|
"entropy": 5.831255388259888,
|
|
"epoch": 0.23536276988912663,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004997203423590757,
|
|
"loss": 5.8125,
|
|
"mean_token_accuracy": 0.14606485813856124,
|
|
"num_tokens": 5260972.0,
|
|
"step": 3025
|
|
},
|
|
{
|
|
"entropy": 5.885420131683349,
|
|
"epoch": 0.2357517992608442,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004997189592327775,
|
|
"loss": 5.8225,
|
|
"mean_token_accuracy": 0.13927970007061957,
|
|
"num_tokens": 5270513.0,
|
|
"step": 3030
|
|
},
|
|
{
|
|
"entropy": 5.882440185546875,
|
|
"epoch": 0.23614082863256175,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004997175726967268,
|
|
"loss": 5.803,
|
|
"mean_token_accuracy": 0.1392829418182373,
|
|
"num_tokens": 5278433.0,
|
|
"step": 3035
|
|
},
|
|
{
|
|
"entropy": 5.83907732963562,
|
|
"epoch": 0.23652985800427934,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0004997161827509447,
|
|
"loss": 5.7977,
|
|
"mean_token_accuracy": 0.13926001712679864,
|
|
"num_tokens": 5287389.0,
|
|
"step": 3040
|
|
},
|
|
{
|
|
"entropy": 5.8517955303192135,
|
|
"epoch": 0.2369188873759969,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004997147893954521,
|
|
"loss": 5.9115,
|
|
"mean_token_accuracy": 0.1402236580848694,
|
|
"num_tokens": 5296220.0,
|
|
"step": 3045
|
|
},
|
|
{
|
|
"entropy": 5.955138111114502,
|
|
"epoch": 0.23730791674771445,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004997133926302702,
|
|
"loss": 5.8328,
|
|
"mean_token_accuracy": 0.14494856148958207,
|
|
"num_tokens": 5304152.0,
|
|
"step": 3050
|
|
},
|
|
{
|
|
"entropy": 5.933644962310791,
|
|
"epoch": 0.237696946119432,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004997119924554204,
|
|
"loss": 5.8697,
|
|
"mean_token_accuracy": 0.14269917458295822,
|
|
"num_tokens": 5312374.0,
|
|
"step": 3055
|
|
},
|
|
{
|
|
"entropy": 5.800216960906982,
|
|
"epoch": 0.23808597549114957,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004997105888709236,
|
|
"loss": 5.7876,
|
|
"mean_token_accuracy": 0.14500768929719926,
|
|
"num_tokens": 5320696.0,
|
|
"step": 3060
|
|
},
|
|
{
|
|
"entropy": 5.906084728240967,
|
|
"epoch": 0.23847500486286716,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0004997091818768015,
|
|
"loss": 5.927,
|
|
"mean_token_accuracy": 0.13957108333706855,
|
|
"num_tokens": 5328754.0,
|
|
"step": 3065
|
|
},
|
|
{
|
|
"entropy": 5.924434232711792,
|
|
"epoch": 0.23886403423458472,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.000499707771473075,
|
|
"loss": 5.878,
|
|
"mean_token_accuracy": 0.1405944973230362,
|
|
"num_tokens": 5337553.0,
|
|
"step": 3070
|
|
},
|
|
{
|
|
"entropy": 5.905769205093383,
|
|
"epoch": 0.23925306360630227,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0004997063576597659,
|
|
"loss": 5.809,
|
|
"mean_token_accuracy": 0.14863870143890381,
|
|
"num_tokens": 5346063.0,
|
|
"step": 3075
|
|
},
|
|
{
|
|
"entropy": 5.871305704116821,
|
|
"epoch": 0.23964209297801983,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0004997049404368954,
|
|
"loss": 5.8745,
|
|
"mean_token_accuracy": 0.14547610208392142,
|
|
"num_tokens": 5354187.0,
|
|
"step": 3080
|
|
},
|
|
{
|
|
"entropy": 5.925069046020508,
|
|
"epoch": 0.2400311223497374,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.000499703519804485,
|
|
"loss": 5.9096,
|
|
"mean_token_accuracy": 0.1328617438673973,
|
|
"num_tokens": 5362819.0,
|
|
"step": 3085
|
|
},
|
|
{
|
|
"entropy": 5.897925138473511,
|
|
"epoch": 0.24042015172145498,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004997020957625564,
|
|
"loss": 5.7919,
|
|
"mean_token_accuracy": 0.15332378596067428,
|
|
"num_tokens": 5371249.0,
|
|
"step": 3090
|
|
},
|
|
{
|
|
"entropy": 5.877030849456787,
|
|
"epoch": 0.24080918109317254,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004997006683111312,
|
|
"loss": 5.7994,
|
|
"mean_token_accuracy": 0.1433065228164196,
|
|
"num_tokens": 5379284.0,
|
|
"step": 3095
|
|
},
|
|
{
|
|
"entropy": 5.884299421310425,
|
|
"epoch": 0.2411982104648901,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.000499699237450231,
|
|
"loss": 5.8996,
|
|
"mean_token_accuracy": 0.14278156086802482,
|
|
"num_tokens": 5388541.0,
|
|
"step": 3100
|
|
},
|
|
{
|
|
"entropy": 5.94818902015686,
|
|
"epoch": 0.24158723983660765,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004996978031798774,
|
|
"loss": 5.9485,
|
|
"mean_token_accuracy": 0.13989101499319076,
|
|
"num_tokens": 5397226.0,
|
|
"step": 3105
|
|
},
|
|
{
|
|
"entropy": 5.939749002456665,
|
|
"epoch": 0.24197626920832524,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004996963655000924,
|
|
"loss": 5.8573,
|
|
"mean_token_accuracy": 0.1397051528096199,
|
|
"num_tokens": 5405579.0,
|
|
"step": 3110
|
|
},
|
|
{
|
|
"entropy": 5.892177295684815,
|
|
"epoch": 0.2423652985800428,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004996949244108977,
|
|
"loss": 5.9838,
|
|
"mean_token_accuracy": 0.12947663366794587,
|
|
"num_tokens": 5414529.0,
|
|
"step": 3115
|
|
},
|
|
{
|
|
"entropy": 5.9776526927948,
|
|
"epoch": 0.24275432795176036,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.000499693479912315,
|
|
"loss": 5.9389,
|
|
"mean_token_accuracy": 0.14825934171676636,
|
|
"num_tokens": 5423641.0,
|
|
"step": 3120
|
|
},
|
|
{
|
|
"entropy": 5.853601503372192,
|
|
"epoch": 0.24314335732347792,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004996920320043666,
|
|
"loss": 5.8381,
|
|
"mean_token_accuracy": 0.1416511431336403,
|
|
"num_tokens": 5432558.0,
|
|
"step": 3125
|
|
},
|
|
{
|
|
"entropy": 5.866245222091675,
|
|
"epoch": 0.24353238669519547,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004996905806870742,
|
|
"loss": 5.7816,
|
|
"mean_token_accuracy": 0.14246323853731155,
|
|
"num_tokens": 5441449.0,
|
|
"step": 3130
|
|
},
|
|
{
|
|
"entropy": 5.867586135864258,
|
|
"epoch": 0.24392141606691306,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004996891259604598,
|
|
"loss": 5.7997,
|
|
"mean_token_accuracy": 0.14338409453630446,
|
|
"num_tokens": 5451142.0,
|
|
"step": 3135
|
|
},
|
|
{
|
|
"entropy": 5.896688175201416,
|
|
"epoch": 0.24431044543863062,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004996876678245455,
|
|
"loss": 5.7613,
|
|
"mean_token_accuracy": 0.14048081785440444,
|
|
"num_tokens": 5459290.0,
|
|
"step": 3140
|
|
},
|
|
{
|
|
"entropy": 5.798839139938354,
|
|
"epoch": 0.24469947481034818,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0004996862062793536,
|
|
"loss": 5.7811,
|
|
"mean_token_accuracy": 0.1482220396399498,
|
|
"num_tokens": 5467776.0,
|
|
"step": 3145
|
|
},
|
|
{
|
|
"entropy": 5.7967747211456295,
|
|
"epoch": 0.24508850418206574,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004996847413249061,
|
|
"loss": 5.6617,
|
|
"mean_token_accuracy": 0.14994954615831374,
|
|
"num_tokens": 5476005.0,
|
|
"step": 3150
|
|
},
|
|
{
|
|
"entropy": 5.8860608577728275,
|
|
"epoch": 0.24547753355378332,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004996832729612252,
|
|
"loss": 5.8461,
|
|
"mean_token_accuracy": 0.14408416971564292,
|
|
"num_tokens": 5484225.0,
|
|
"step": 3155
|
|
},
|
|
{
|
|
"entropy": 5.765978288650513,
|
|
"epoch": 0.24586656292550088,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004996818011883333,
|
|
"loss": 5.7774,
|
|
"mean_token_accuracy": 0.14943447411060334,
|
|
"num_tokens": 5493111.0,
|
|
"step": 3160
|
|
},
|
|
{
|
|
"entropy": 5.831310415267945,
|
|
"epoch": 0.24625559229721844,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004996803260062527,
|
|
"loss": 5.7948,
|
|
"mean_token_accuracy": 0.14830601513385772,
|
|
"num_tokens": 5501574.0,
|
|
"step": 3165
|
|
},
|
|
{
|
|
"entropy": 5.875056219100952,
|
|
"epoch": 0.246644621668936,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0004996788474150057,
|
|
"loss": 5.8249,
|
|
"mean_token_accuracy": 0.1414250537753105,
|
|
"num_tokens": 5511136.0,
|
|
"step": 3170
|
|
},
|
|
{
|
|
"entropy": 5.807733631134033,
|
|
"epoch": 0.24703365104065356,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004996773654146149,
|
|
"loss": 5.8168,
|
|
"mean_token_accuracy": 0.14713762253522872,
|
|
"num_tokens": 5520324.0,
|
|
"step": 3175
|
|
},
|
|
{
|
|
"entropy": 5.874153709411621,
|
|
"epoch": 0.24742268041237114,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004996758800051026,
|
|
"loss": 5.7661,
|
|
"mean_token_accuracy": 0.14694686979055405,
|
|
"num_tokens": 5528960.0,
|
|
"step": 3180
|
|
},
|
|
{
|
|
"entropy": 5.865899896621704,
|
|
"epoch": 0.2478117097840887,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.0004996743911864916,
|
|
"loss": 5.926,
|
|
"mean_token_accuracy": 0.14135217815637588,
|
|
"num_tokens": 5537391.0,
|
|
"step": 3185
|
|
},
|
|
{
|
|
"entropy": 5.90128002166748,
|
|
"epoch": 0.24820073915580626,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004996728989588041,
|
|
"loss": 5.8662,
|
|
"mean_token_accuracy": 0.13981591016054154,
|
|
"num_tokens": 5546577.0,
|
|
"step": 3190
|
|
},
|
|
{
|
|
"entropy": 5.93365888595581,
|
|
"epoch": 0.24858976852752382,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004996714033220632,
|
|
"loss": 5.8035,
|
|
"mean_token_accuracy": 0.1451164186000824,
|
|
"num_tokens": 5555247.0,
|
|
"step": 3195
|
|
},
|
|
{
|
|
"entropy": 5.79735369682312,
|
|
"epoch": 0.2489787978992414,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0004996699042762911,
|
|
"loss": 5.7679,
|
|
"mean_token_accuracy": 0.14924910962581633,
|
|
"num_tokens": 5563598.0,
|
|
"step": 3200
|
|
},
|
|
{
|
|
"entropy": 5.854664468765259,
|
|
"epoch": 0.24936782727095896,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0004996684018215111,
|
|
"loss": 5.7983,
|
|
"mean_token_accuracy": 0.14165054261684418,
|
|
"num_tokens": 5572734.0,
|
|
"step": 3205
|
|
},
|
|
{
|
|
"entropy": 5.876973295211792,
|
|
"epoch": 0.24975685664267652,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004996668959577453,
|
|
"loss": 5.9106,
|
|
"mean_token_accuracy": 0.1385761357843876,
|
|
"num_tokens": 5581224.0,
|
|
"step": 3210
|
|
},
|
|
{
|
|
"entropy": 5.934681081771851,
|
|
"epoch": 0.2501458860143941,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004996653866850173,
|
|
"loss": 5.9043,
|
|
"mean_token_accuracy": 0.13491922244429588,
|
|
"num_tokens": 5590138.0,
|
|
"step": 3215
|
|
},
|
|
{
|
|
"entropy": 5.842910432815552,
|
|
"epoch": 0.25053491538611167,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0004996638740033495,
|
|
"loss": 5.837,
|
|
"mean_token_accuracy": 0.149862140417099,
|
|
"num_tokens": 5598654.0,
|
|
"step": 3220
|
|
},
|
|
{
|
|
"entropy": 5.754105043411255,
|
|
"epoch": 0.2509239447578292,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0004996623579127651,
|
|
"loss": 5.7791,
|
|
"mean_token_accuracy": 0.14800113886594773,
|
|
"num_tokens": 5607404.0,
|
|
"step": 3225
|
|
},
|
|
{
|
|
"entropy": 5.850812196731567,
|
|
"epoch": 0.2513129741295468,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.0004996608384132868,
|
|
"loss": 5.8029,
|
|
"mean_token_accuracy": 0.13932496458292007,
|
|
"num_tokens": 5617133.0,
|
|
"step": 3230
|
|
},
|
|
{
|
|
"entropy": 5.841469144821167,
|
|
"epoch": 0.25170200350126437,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.000499659315504938,
|
|
"loss": 5.8294,
|
|
"mean_token_accuracy": 0.13994766473770143,
|
|
"num_tokens": 5625389.0,
|
|
"step": 3235
|
|
},
|
|
{
|
|
"entropy": 5.826369094848633,
|
|
"epoch": 0.2520910328729819,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004996577891877417,
|
|
"loss": 5.7015,
|
|
"mean_token_accuracy": 0.15945661962032318,
|
|
"num_tokens": 5633985.0,
|
|
"step": 3240
|
|
},
|
|
{
|
|
"entropy": 5.821769857406617,
|
|
"epoch": 0.2524800622446995,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0004996562594617209,
|
|
"loss": 5.8316,
|
|
"mean_token_accuracy": 0.13962800428271294,
|
|
"num_tokens": 5642524.0,
|
|
"step": 3245
|
|
},
|
|
{
|
|
"entropy": 5.852222156524658,
|
|
"epoch": 0.252869091616417,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.0004996547263268991,
|
|
"loss": 5.7793,
|
|
"mean_token_accuracy": 0.1448754347860813,
|
|
"num_tokens": 5651788.0,
|
|
"step": 3250
|
|
},
|
|
{
|
|
"entropy": 5.821958208084107,
|
|
"epoch": 0.2532581209881346,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004996531897832993,
|
|
"loss": 5.8159,
|
|
"mean_token_accuracy": 0.1427738018333912,
|
|
"num_tokens": 5660757.0,
|
|
"step": 3255
|
|
},
|
|
{
|
|
"entropy": 5.984094285964966,
|
|
"epoch": 0.2536471503598522,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.000499651649830945,
|
|
"loss": 5.9304,
|
|
"mean_token_accuracy": 0.14311277642846107,
|
|
"num_tokens": 5669760.0,
|
|
"step": 3260
|
|
},
|
|
{
|
|
"entropy": 5.813133239746094,
|
|
"epoch": 0.2540361797315697,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004996501064698593,
|
|
"loss": 5.8492,
|
|
"mean_token_accuracy": 0.14234110862016677,
|
|
"num_tokens": 5678313.0,
|
|
"step": 3265
|
|
},
|
|
{
|
|
"entropy": 5.870118856430054,
|
|
"epoch": 0.2544252091032873,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.000499648559700066,
|
|
"loss": 5.7668,
|
|
"mean_token_accuracy": 0.15043241605162622,
|
|
"num_tokens": 5686942.0,
|
|
"step": 3270
|
|
},
|
|
{
|
|
"entropy": 5.792041444778443,
|
|
"epoch": 0.25481423847500484,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004996470095215884,
|
|
"loss": 5.7555,
|
|
"mean_token_accuracy": 0.14962123110890388,
|
|
"num_tokens": 5695612.0,
|
|
"step": 3275
|
|
},
|
|
{
|
|
"entropy": 5.900144004821778,
|
|
"epoch": 0.2552032678467224,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004996454559344498,
|
|
"loss": 5.9529,
|
|
"mean_token_accuracy": 0.13228990584611894,
|
|
"num_tokens": 5705067.0,
|
|
"step": 3280
|
|
},
|
|
{
|
|
"entropy": 5.906079196929932,
|
|
"epoch": 0.25559229721844,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004996438989386741,
|
|
"loss": 5.8355,
|
|
"mean_token_accuracy": 0.14319185838103293,
|
|
"num_tokens": 5714092.0,
|
|
"step": 3285
|
|
},
|
|
{
|
|
"entropy": 5.8403573513031,
|
|
"epoch": 0.25598132659015754,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004996423385342847,
|
|
"loss": 5.8028,
|
|
"mean_token_accuracy": 0.14620732218027116,
|
|
"num_tokens": 5722638.0,
|
|
"step": 3290
|
|
},
|
|
{
|
|
"entropy": 5.824834823608398,
|
|
"epoch": 0.25637035596187513,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004996407747213055,
|
|
"loss": 5.804,
|
|
"mean_token_accuracy": 0.14224600344896315,
|
|
"num_tokens": 5731511.0,
|
|
"step": 3295
|
|
},
|
|
{
|
|
"entropy": 5.861731052398682,
|
|
"epoch": 0.25675938533359266,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00049963920749976,
|
|
"loss": 5.8202,
|
|
"mean_token_accuracy": 0.14186736792325974,
|
|
"num_tokens": 5740950.0,
|
|
"step": 3300
|
|
},
|
|
{
|
|
"entropy": 5.807591533660888,
|
|
"epoch": 0.25714841470531025,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004996376368696721,
|
|
"loss": 5.7591,
|
|
"mean_token_accuracy": 0.14281872063875198,
|
|
"num_tokens": 5749163.0,
|
|
"step": 3305
|
|
},
|
|
{
|
|
"entropy": 5.8925347328186035,
|
|
"epoch": 0.25753744407702783,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004996360628310656,
|
|
"loss": 5.8173,
|
|
"mean_token_accuracy": 0.14276841878890992,
|
|
"num_tokens": 5758321.0,
|
|
"step": 3310
|
|
},
|
|
{
|
|
"entropy": 5.9321657657623295,
|
|
"epoch": 0.25792647344874536,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004996344853839644,
|
|
"loss": 5.8682,
|
|
"mean_token_accuracy": 0.14533354043960572,
|
|
"num_tokens": 5767277.0,
|
|
"step": 3315
|
|
},
|
|
{
|
|
"entropy": 5.820040512084961,
|
|
"epoch": 0.25831550282046295,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004996329045283924,
|
|
"loss": 5.7605,
|
|
"mean_token_accuracy": 0.150101937353611,
|
|
"num_tokens": 5775694.0,
|
|
"step": 3320
|
|
},
|
|
{
|
|
"entropy": 5.734701347351074,
|
|
"epoch": 0.25870453219218054,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004996313202643737,
|
|
"loss": 5.6773,
|
|
"mean_token_accuracy": 0.15130480825901033,
|
|
"num_tokens": 5783932.0,
|
|
"step": 3325
|
|
},
|
|
{
|
|
"entropy": 5.83421835899353,
|
|
"epoch": 0.25909356156389807,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004996297325919321,
|
|
"loss": 5.8049,
|
|
"mean_token_accuracy": 0.14608783572912215,
|
|
"num_tokens": 5792100.0,
|
|
"step": 3330
|
|
},
|
|
{
|
|
"entropy": 5.818102645874023,
|
|
"epoch": 0.25948259093561565,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004996281415110919,
|
|
"loss": 5.7919,
|
|
"mean_token_accuracy": 0.1446779452264309,
|
|
"num_tokens": 5801481.0,
|
|
"step": 3335
|
|
},
|
|
{
|
|
"entropy": 5.843531894683838,
|
|
"epoch": 0.2598716203073332,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004996265470218773,
|
|
"loss": 5.8885,
|
|
"mean_token_accuracy": 0.13893020674586296,
|
|
"num_tokens": 5810053.0,
|
|
"step": 3340
|
|
},
|
|
{
|
|
"entropy": 5.82769284248352,
|
|
"epoch": 0.26026064967905077,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004996249491243122,
|
|
"loss": 5.6783,
|
|
"mean_token_accuracy": 0.15309639424085617,
|
|
"num_tokens": 5818454.0,
|
|
"step": 3345
|
|
},
|
|
{
|
|
"entropy": 5.812572193145752,
|
|
"epoch": 0.26064967905076836,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004996233478184211,
|
|
"loss": 5.8512,
|
|
"mean_token_accuracy": 0.13824255466461183,
|
|
"num_tokens": 5827013.0,
|
|
"step": 3350
|
|
},
|
|
{
|
|
"entropy": 5.805325746536255,
|
|
"epoch": 0.2610387084224859,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004996217431042282,
|
|
"loss": 5.8482,
|
|
"mean_token_accuracy": 0.1430810771882534,
|
|
"num_tokens": 5835862.0,
|
|
"step": 3355
|
|
},
|
|
{
|
|
"entropy": 5.7693298816680905,
|
|
"epoch": 0.2614277377942035,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.000499620134981758,
|
|
"loss": 5.6191,
|
|
"mean_token_accuracy": 0.15031312257051468,
|
|
"num_tokens": 5843827.0,
|
|
"step": 3360
|
|
},
|
|
{
|
|
"entropy": 5.80864987373352,
|
|
"epoch": 0.261816767165921,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004996185234510346,
|
|
"loss": 5.8272,
|
|
"mean_token_accuracy": 0.13573512434959412,
|
|
"num_tokens": 5852677.0,
|
|
"step": 3365
|
|
},
|
|
{
|
|
"entropy": 5.898306369781494,
|
|
"epoch": 0.2622057965376386,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004996169085120828,
|
|
"loss": 5.7732,
|
|
"mean_token_accuracy": 0.1503363937139511,
|
|
"num_tokens": 5861686.0,
|
|
"step": 3370
|
|
},
|
|
{
|
|
"entropy": 5.7120969772338865,
|
|
"epoch": 0.2625948259093562,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004996152901649268,
|
|
"loss": 5.7407,
|
|
"mean_token_accuracy": 0.14560485854744912,
|
|
"num_tokens": 5870690.0,
|
|
"step": 3375
|
|
},
|
|
{
|
|
"entropy": 5.79764723777771,
|
|
"epoch": 0.2629838552810737,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004996136684095913,
|
|
"loss": 5.8249,
|
|
"mean_token_accuracy": 0.14097655266523362,
|
|
"num_tokens": 5879804.0,
|
|
"step": 3380
|
|
},
|
|
{
|
|
"entropy": 5.94910888671875,
|
|
"epoch": 0.2633728846527913,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0004996120432461009,
|
|
"loss": 5.8967,
|
|
"mean_token_accuracy": 0.13631573617458342,
|
|
"num_tokens": 5888781.0,
|
|
"step": 3385
|
|
},
|
|
{
|
|
"entropy": 5.912099456787109,
|
|
"epoch": 0.2637619140245088,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004996104146744804,
|
|
"loss": 5.808,
|
|
"mean_token_accuracy": 0.14571621865034104,
|
|
"num_tokens": 5897439.0,
|
|
"step": 3390
|
|
},
|
|
{
|
|
"entropy": 5.829486560821533,
|
|
"epoch": 0.2641509433962264,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0004996087826947541,
|
|
"loss": 5.7533,
|
|
"mean_token_accuracy": 0.1568281203508377,
|
|
"num_tokens": 5905471.0,
|
|
"step": 3395
|
|
},
|
|
{
|
|
"entropy": 5.755701017379761,
|
|
"epoch": 0.264539972767944,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0004996071473069471,
|
|
"loss": 5.8004,
|
|
"mean_token_accuracy": 0.14211232513189315,
|
|
"num_tokens": 5913795.0,
|
|
"step": 3400
|
|
},
|
|
{
|
|
"entropy": 5.936715173721313,
|
|
"epoch": 0.26492900213966153,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0004996055085110842,
|
|
"loss": 5.8668,
|
|
"mean_token_accuracy": 0.1416642837226391,
|
|
"num_tokens": 5922119.0,
|
|
"step": 3405
|
|
},
|
|
{
|
|
"entropy": 5.782314729690552,
|
|
"epoch": 0.2653180315113791,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0004996038663071902,
|
|
"loss": 5.7469,
|
|
"mean_token_accuracy": 0.14390047043561935,
|
|
"num_tokens": 5930759.0,
|
|
"step": 3410
|
|
},
|
|
{
|
|
"entropy": 5.816781759262085,
|
|
"epoch": 0.26570706088309665,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004996022206952901,
|
|
"loss": 5.7809,
|
|
"mean_token_accuracy": 0.1507711961865425,
|
|
"num_tokens": 5939830.0,
|
|
"step": 3415
|
|
},
|
|
{
|
|
"entropy": 5.91773362159729,
|
|
"epoch": 0.26609609025481423,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004996005716754086,
|
|
"loss": 5.7921,
|
|
"mean_token_accuracy": 0.143372742831707,
|
|
"num_tokens": 5947737.0,
|
|
"step": 3420
|
|
},
|
|
{
|
|
"entropy": 5.702203607559204,
|
|
"epoch": 0.2664851196265318,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.000499598919247571,
|
|
"loss": 5.7436,
|
|
"mean_token_accuracy": 0.1547391414642334,
|
|
"num_tokens": 5955905.0,
|
|
"step": 3425
|
|
},
|
|
{
|
|
"entropy": 5.761687517166138,
|
|
"epoch": 0.26687414899824935,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0004995972634118023,
|
|
"loss": 5.7991,
|
|
"mean_token_accuracy": 0.14444849416613578,
|
|
"num_tokens": 5965223.0,
|
|
"step": 3430
|
|
},
|
|
{
|
|
"entropy": 5.886661386489868,
|
|
"epoch": 0.26726317836996694,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004995956041681277,
|
|
"loss": 5.8049,
|
|
"mean_token_accuracy": 0.1485450528562069,
|
|
"num_tokens": 5973615.0,
|
|
"step": 3435
|
|
},
|
|
{
|
|
"entropy": 5.813414812088013,
|
|
"epoch": 0.2676522077416845,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004995939415165722,
|
|
"loss": 5.7458,
|
|
"mean_token_accuracy": 0.15244108885526658,
|
|
"num_tokens": 5981600.0,
|
|
"step": 3440
|
|
},
|
|
{
|
|
"entropy": 5.789648532867432,
|
|
"epoch": 0.26804123711340205,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004995922754571611,
|
|
"loss": 5.7446,
|
|
"mean_token_accuracy": 0.1445736438035965,
|
|
"num_tokens": 5989928.0,
|
|
"step": 3445
|
|
},
|
|
{
|
|
"entropy": 5.745592164993286,
|
|
"epoch": 0.26843026648511964,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004995906059899197,
|
|
"loss": 5.8116,
|
|
"mean_token_accuracy": 0.14425835460424424,
|
|
"num_tokens": 5998704.0,
|
|
"step": 3450
|
|
},
|
|
{
|
|
"entropy": 5.887583017349243,
|
|
"epoch": 0.26881929585683717,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004995889331148733,
|
|
"loss": 5.7879,
|
|
"mean_token_accuracy": 0.14587609022855758,
|
|
"num_tokens": 6007476.0,
|
|
"step": 3455
|
|
},
|
|
{
|
|
"entropy": 5.881060028076172,
|
|
"epoch": 0.26920832522855476,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004995872568320474,
|
|
"loss": 5.8628,
|
|
"mean_token_accuracy": 0.14118837639689447,
|
|
"num_tokens": 6016324.0,
|
|
"step": 3460
|
|
},
|
|
{
|
|
"entropy": 5.846192836761475,
|
|
"epoch": 0.26959735460027234,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0004995855771414673,
|
|
"loss": 5.7784,
|
|
"mean_token_accuracy": 0.14671637415885924,
|
|
"num_tokens": 6024709.0,
|
|
"step": 3465
|
|
},
|
|
{
|
|
"entropy": 5.764834785461426,
|
|
"epoch": 0.2699863839719899,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004995838940431585,
|
|
"loss": 5.6378,
|
|
"mean_token_accuracy": 0.1520429238677025,
|
|
"num_tokens": 6033131.0,
|
|
"step": 3470
|
|
},
|
|
{
|
|
"entropy": 5.751634168624878,
|
|
"epoch": 0.27037541334370746,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004995822075371466,
|
|
"loss": 5.8405,
|
|
"mean_token_accuracy": 0.14594754576683044,
|
|
"num_tokens": 6042310.0,
|
|
"step": 3475
|
|
},
|
|
{
|
|
"entropy": 5.842454528808593,
|
|
"epoch": 0.270764442715425,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004995805176234571,
|
|
"loss": 5.6754,
|
|
"mean_token_accuracy": 0.15385707169771196,
|
|
"num_tokens": 6050617.0,
|
|
"step": 3480
|
|
},
|
|
{
|
|
"entropy": 5.82150673866272,
|
|
"epoch": 0.2711534720871426,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004995788243021158,
|
|
"loss": 5.8341,
|
|
"mean_token_accuracy": 0.14465887770056723,
|
|
"num_tokens": 6060090.0,
|
|
"step": 3485
|
|
},
|
|
{
|
|
"entropy": 5.870070219039917,
|
|
"epoch": 0.27154250145886016,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004995771275731483,
|
|
"loss": 5.7816,
|
|
"mean_token_accuracy": 0.14922453165054322,
|
|
"num_tokens": 6068646.0,
|
|
"step": 3490
|
|
},
|
|
{
|
|
"entropy": 5.840321493148804,
|
|
"epoch": 0.2719315308305777,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.0004995754274365802,
|
|
"loss": 5.8403,
|
|
"mean_token_accuracy": 0.14855221211910247,
|
|
"num_tokens": 6077896.0,
|
|
"step": 3495
|
|
},
|
|
{
|
|
"entropy": 5.796200132369995,
|
|
"epoch": 0.2723205602022953,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004995737238924376,
|
|
"loss": 5.7522,
|
|
"mean_token_accuracy": 0.14376320838928222,
|
|
"num_tokens": 6087189.0,
|
|
"step": 3500
|
|
},
|
|
{
|
|
"entropy": 5.823796129226684,
|
|
"epoch": 0.2727095895740128,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004995720169407461,
|
|
"loss": 5.7489,
|
|
"mean_token_accuracy": 0.1495093137025833,
|
|
"num_tokens": 6095394.0,
|
|
"step": 3505
|
|
},
|
|
{
|
|
"entropy": 5.836558055877686,
|
|
"epoch": 0.2730986189457304,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0004995703065815317,
|
|
"loss": 5.7164,
|
|
"mean_token_accuracy": 0.1526440754532814,
|
|
"num_tokens": 6104135.0,
|
|
"step": 3510
|
|
},
|
|
{
|
|
"entropy": 5.823418998718262,
|
|
"epoch": 0.273487648317448,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0004995685928148203,
|
|
"loss": 5.8308,
|
|
"mean_token_accuracy": 0.1389838382601738,
|
|
"num_tokens": 6112160.0,
|
|
"step": 3515
|
|
},
|
|
{
|
|
"entropy": 5.857429122924804,
|
|
"epoch": 0.2738766776891655,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.000499566875640638,
|
|
"loss": 5.8379,
|
|
"mean_token_accuracy": 0.15000538304448127,
|
|
"num_tokens": 6120575.0,
|
|
"step": 3520
|
|
},
|
|
{
|
|
"entropy": 5.860440254211426,
|
|
"epoch": 0.2742657070608831,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004995651550590108,
|
|
"loss": 5.8404,
|
|
"mean_token_accuracy": 0.1447710335254669,
|
|
"num_tokens": 6129367.0,
|
|
"step": 3525
|
|
},
|
|
{
|
|
"entropy": 5.855791473388672,
|
|
"epoch": 0.2746547364326007,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0004995634310699647,
|
|
"loss": 5.8259,
|
|
"mean_token_accuracy": 0.14781430512666702,
|
|
"num_tokens": 6137440.0,
|
|
"step": 3530
|
|
},
|
|
{
|
|
"entropy": 5.7965374946594235,
|
|
"epoch": 0.2750437658043182,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004995617036735261,
|
|
"loss": 5.7402,
|
|
"mean_token_accuracy": 0.14770583286881447,
|
|
"num_tokens": 6146770.0,
|
|
"step": 3535
|
|
},
|
|
{
|
|
"entropy": 5.904029750823975,
|
|
"epoch": 0.2754327951760358,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004995599728697211,
|
|
"loss": 5.8318,
|
|
"mean_token_accuracy": 0.14512663930654526,
|
|
"num_tokens": 6155994.0,
|
|
"step": 3540
|
|
},
|
|
{
|
|
"entropy": 5.800452709197998,
|
|
"epoch": 0.27582182454775334,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004995582386585759,
|
|
"loss": 5.7515,
|
|
"mean_token_accuracy": 0.14241246953606607,
|
|
"num_tokens": 6163941.0,
|
|
"step": 3545
|
|
},
|
|
{
|
|
"entropy": 5.767463302612304,
|
|
"epoch": 0.2762108539194709,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0004995565010401167,
|
|
"loss": 5.7941,
|
|
"mean_token_accuracy": 0.14686818718910216,
|
|
"num_tokens": 6172681.0,
|
|
"step": 3550
|
|
},
|
|
{
|
|
"entropy": 5.897072124481201,
|
|
"epoch": 0.2765998832911885,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004995547600143702,
|
|
"loss": 5.7758,
|
|
"mean_token_accuracy": 0.1455358862876892,
|
|
"num_tokens": 6181449.0,
|
|
"step": 3555
|
|
},
|
|
{
|
|
"entropy": 5.82000322341919,
|
|
"epoch": 0.27698891266290604,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004995530155813625,
|
|
"loss": 5.7555,
|
|
"mean_token_accuracy": 0.1465877875685692,
|
|
"num_tokens": 6190275.0,
|
|
"step": 3560
|
|
},
|
|
{
|
|
"entropy": 5.805966186523437,
|
|
"epoch": 0.2773779420346236,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004995512677411203,
|
|
"loss": 5.7792,
|
|
"mean_token_accuracy": 0.14627898782491683,
|
|
"num_tokens": 6198521.0,
|
|
"step": 3565
|
|
},
|
|
{
|
|
"entropy": 5.8195501327514645,
|
|
"epoch": 0.27776697140634116,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004995495164936698,
|
|
"loss": 5.8445,
|
|
"mean_token_accuracy": 0.1397809185087681,
|
|
"num_tokens": 6207318.0,
|
|
"step": 3570
|
|
},
|
|
{
|
|
"entropy": 5.87066617012024,
|
|
"epoch": 0.27815600077805874,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004995477618390381,
|
|
"loss": 5.7298,
|
|
"mean_token_accuracy": 0.14824186712503434,
|
|
"num_tokens": 6216693.0,
|
|
"step": 3575
|
|
},
|
|
{
|
|
"entropy": 5.805923700332642,
|
|
"epoch": 0.27854503014977633,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0004995460037772513,
|
|
"loss": 5.7919,
|
|
"mean_token_accuracy": 0.14640319496393203,
|
|
"num_tokens": 6225207.0,
|
|
"step": 3580
|
|
},
|
|
{
|
|
"entropy": 5.809096050262451,
|
|
"epoch": 0.27893405952149386,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0004995442423083365,
|
|
"loss": 5.7325,
|
|
"mean_token_accuracy": 0.15586716383695604,
|
|
"num_tokens": 6232653.0,
|
|
"step": 3585
|
|
},
|
|
{
|
|
"entropy": 5.748783349990845,
|
|
"epoch": 0.27932308889321145,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004995424774323201,
|
|
"loss": 5.7295,
|
|
"mean_token_accuracy": 0.14759937971830367,
|
|
"num_tokens": 6241093.0,
|
|
"step": 3590
|
|
},
|
|
{
|
|
"entropy": 5.7409566879272464,
|
|
"epoch": 0.279712118264929,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.000499540709149229,
|
|
"loss": 5.6149,
|
|
"mean_token_accuracy": 0.15389250069856644,
|
|
"num_tokens": 6249144.0,
|
|
"step": 3595
|
|
},
|
|
{
|
|
"entropy": 5.788210344314575,
|
|
"epoch": 0.28010114763664656,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004995389374590901,
|
|
"loss": 5.7058,
|
|
"mean_token_accuracy": 0.14813510403037072,
|
|
"num_tokens": 6257622.0,
|
|
"step": 3600
|
|
},
|
|
{
|
|
"entropy": 5.778064393997193,
|
|
"epoch": 0.28049017700836415,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004995371623619301,
|
|
"loss": 5.7337,
|
|
"mean_token_accuracy": 0.14399215206503868,
|
|
"num_tokens": 6266435.0,
|
|
"step": 3605
|
|
},
|
|
{
|
|
"entropy": 5.855746650695801,
|
|
"epoch": 0.2808792063800817,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.000499535383857776,
|
|
"loss": 5.8548,
|
|
"mean_token_accuracy": 0.14212341010570526,
|
|
"num_tokens": 6275053.0,
|
|
"step": 3610
|
|
},
|
|
{
|
|
"entropy": 5.812265682220459,
|
|
"epoch": 0.28126823575179927,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.000499533601946655,
|
|
"loss": 5.7463,
|
|
"mean_token_accuracy": 0.1406642623245716,
|
|
"num_tokens": 6283240.0,
|
|
"step": 3615
|
|
},
|
|
{
|
|
"entropy": 5.72180495262146,
|
|
"epoch": 0.2816572651235168,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0004995318166285938,
|
|
"loss": 5.6995,
|
|
"mean_token_accuracy": 0.15216349810361862,
|
|
"num_tokens": 6292133.0,
|
|
"step": 3620
|
|
},
|
|
{
|
|
"entropy": 5.851174068450928,
|
|
"epoch": 0.2820462944952344,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004995300279036199,
|
|
"loss": 5.8047,
|
|
"mean_token_accuracy": 0.14933415353298188,
|
|
"num_tokens": 6300954.0,
|
|
"step": 3625
|
|
},
|
|
{
|
|
"entropy": 5.751334381103516,
|
|
"epoch": 0.28243532386695197,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.00049952823577176,
|
|
"loss": 5.6909,
|
|
"mean_token_accuracy": 0.15321999713778495,
|
|
"num_tokens": 6309637.0,
|
|
"step": 3630
|
|
},
|
|
{
|
|
"entropy": 5.790732383728027,
|
|
"epoch": 0.2828243532386695,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0004995264402330416,
|
|
"loss": 5.7623,
|
|
"mean_token_accuracy": 0.15102692544460297,
|
|
"num_tokens": 6318539.0,
|
|
"step": 3635
|
|
},
|
|
{
|
|
"entropy": 5.823702001571656,
|
|
"epoch": 0.2832133826103871,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0004995246412874919,
|
|
"loss": 5.686,
|
|
"mean_token_accuracy": 0.1494807243347168,
|
|
"num_tokens": 6327109.0,
|
|
"step": 3640
|
|
},
|
|
{
|
|
"entropy": 5.704149532318115,
|
|
"epoch": 0.2836024119821047,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.000499522838935138,
|
|
"loss": 5.6806,
|
|
"mean_token_accuracy": 0.1496465563774109,
|
|
"num_tokens": 6335555.0,
|
|
"step": 3645
|
|
},
|
|
{
|
|
"entropy": 5.860112619400025,
|
|
"epoch": 0.2839914413538222,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004995210331760074,
|
|
"loss": 5.8385,
|
|
"mean_token_accuracy": 0.1461038865149021,
|
|
"num_tokens": 6344716.0,
|
|
"step": 3650
|
|
},
|
|
{
|
|
"entropy": 5.746112537384033,
|
|
"epoch": 0.2843804707255398,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0004995192240101275,
|
|
"loss": 5.7075,
|
|
"mean_token_accuracy": 0.15382865816354752,
|
|
"num_tokens": 6353618.0,
|
|
"step": 3655
|
|
},
|
|
{
|
|
"entropy": 5.873103380203247,
|
|
"epoch": 0.2847695000972573,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004995174114375258,
|
|
"loss": 5.8181,
|
|
"mean_token_accuracy": 0.14162709265947343,
|
|
"num_tokens": 6362039.0,
|
|
"step": 3660
|
|
},
|
|
{
|
|
"entropy": 5.856787061691284,
|
|
"epoch": 0.2851585294689749,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004995155954582297,
|
|
"loss": 5.7471,
|
|
"mean_token_accuracy": 0.14587011486291884,
|
|
"num_tokens": 6370331.0,
|
|
"step": 3665
|
|
},
|
|
{
|
|
"entropy": 5.742863416671753,
|
|
"epoch": 0.2855475588406925,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004995137760722668,
|
|
"loss": 5.7323,
|
|
"mean_token_accuracy": 0.14978418201208116,
|
|
"num_tokens": 6378943.0,
|
|
"step": 3670
|
|
},
|
|
{
|
|
"entropy": 5.848138999938965,
|
|
"epoch": 0.28593658821241,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004995119532796646,
|
|
"loss": 5.7812,
|
|
"mean_token_accuracy": 0.13732778877019883,
|
|
"num_tokens": 6387745.0,
|
|
"step": 3675
|
|
},
|
|
{
|
|
"entropy": 5.648930788040161,
|
|
"epoch": 0.2863256175841276,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.000499510127080451,
|
|
"loss": 5.6492,
|
|
"mean_token_accuracy": 0.14844874367117883,
|
|
"num_tokens": 6396915.0,
|
|
"step": 3680
|
|
},
|
|
{
|
|
"entropy": 5.686594676971436,
|
|
"epoch": 0.28671464695584514,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004995082974746535,
|
|
"loss": 5.6944,
|
|
"mean_token_accuracy": 0.15163496807217597,
|
|
"num_tokens": 6405453.0,
|
|
"step": 3685
|
|
},
|
|
{
|
|
"entropy": 5.84037594795227,
|
|
"epoch": 0.28710367632756273,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0004995064644622999,
|
|
"loss": 5.7669,
|
|
"mean_token_accuracy": 0.14520054906606675,
|
|
"num_tokens": 6413693.0,
|
|
"step": 3690
|
|
},
|
|
{
|
|
"entropy": 5.780052042007446,
|
|
"epoch": 0.2874927056992803,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0004995046280434181,
|
|
"loss": 5.7341,
|
|
"mean_token_accuracy": 0.14460751190781593,
|
|
"num_tokens": 6422738.0,
|
|
"step": 3695
|
|
},
|
|
{
|
|
"entropy": 5.742298173904419,
|
|
"epoch": 0.28788173507099785,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0004995027882180358,
|
|
"loss": 5.6937,
|
|
"mean_token_accuracy": 0.15133106857538223,
|
|
"num_tokens": 6431743.0,
|
|
"step": 3700
|
|
},
|
|
{
|
|
"entropy": 5.809255313873291,
|
|
"epoch": 0.28827076444271543,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004995009449861812,
|
|
"loss": 5.7476,
|
|
"mean_token_accuracy": 0.1464826263487339,
|
|
"num_tokens": 6440586.0,
|
|
"step": 3705
|
|
},
|
|
{
|
|
"entropy": 5.792600870132446,
|
|
"epoch": 0.28865979381443296,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.000499499098347882,
|
|
"loss": 5.7945,
|
|
"mean_token_accuracy": 0.14538254216313362,
|
|
"num_tokens": 6449644.0,
|
|
"step": 3710
|
|
},
|
|
{
|
|
"entropy": 5.732555389404297,
|
|
"epoch": 0.28904882318615055,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004994972483031662,
|
|
"loss": 5.6924,
|
|
"mean_token_accuracy": 0.15000784248113633,
|
|
"num_tokens": 6458752.0,
|
|
"step": 3715
|
|
},
|
|
{
|
|
"entropy": 5.722676849365234,
|
|
"epoch": 0.28943785255786814,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.000499495394852062,
|
|
"loss": 5.7457,
|
|
"mean_token_accuracy": 0.15378984808921814,
|
|
"num_tokens": 6468333.0,
|
|
"step": 3720
|
|
},
|
|
{
|
|
"entropy": 5.651209449768066,
|
|
"epoch": 0.28982688192958567,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0004994935379945977,
|
|
"loss": 5.6043,
|
|
"mean_token_accuracy": 0.15003781169652938,
|
|
"num_tokens": 6477406.0,
|
|
"step": 3725
|
|
},
|
|
{
|
|
"entropy": 5.86032395362854,
|
|
"epoch": 0.29021591130130325,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.0004994916777308012,
|
|
"loss": 5.768,
|
|
"mean_token_accuracy": 0.14514341950416565,
|
|
"num_tokens": 6486399.0,
|
|
"step": 3730
|
|
},
|
|
{
|
|
"entropy": 5.791876649856567,
|
|
"epoch": 0.29060494067302084,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004994898140607007,
|
|
"loss": 5.6616,
|
|
"mean_token_accuracy": 0.14688180163502693,
|
|
"num_tokens": 6494853.0,
|
|
"step": 3735
|
|
},
|
|
{
|
|
"entropy": 5.795904016494751,
|
|
"epoch": 0.29099397004473837,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0004994879469843247,
|
|
"loss": 5.8281,
|
|
"mean_token_accuracy": 0.14508696421980857,
|
|
"num_tokens": 6503301.0,
|
|
"step": 3740
|
|
},
|
|
{
|
|
"entropy": 5.770627212524414,
|
|
"epoch": 0.29138299941645596,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004994860765017013,
|
|
"loss": 5.7042,
|
|
"mean_token_accuracy": 0.14785689413547515,
|
|
"num_tokens": 6512685.0,
|
|
"step": 3745
|
|
},
|
|
{
|
|
"entropy": 5.811524724960327,
|
|
"epoch": 0.2917720287881735,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.000499484202612859,
|
|
"loss": 5.83,
|
|
"mean_token_accuracy": 0.13926837593317032,
|
|
"num_tokens": 6520673.0,
|
|
"step": 3750
|
|
},
|
|
{
|
|
"entropy": 5.8250175476074215,
|
|
"epoch": 0.2921610581598911,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004994823253178264,
|
|
"loss": 5.7345,
|
|
"mean_token_accuracy": 0.1433857038617134,
|
|
"num_tokens": 6529039.0,
|
|
"step": 3755
|
|
},
|
|
{
|
|
"entropy": 5.804865884780884,
|
|
"epoch": 0.29255008753160866,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004994804446166317,
|
|
"loss": 5.8056,
|
|
"mean_token_accuracy": 0.139020137488842,
|
|
"num_tokens": 6537932.0,
|
|
"step": 3760
|
|
},
|
|
{
|
|
"entropy": 5.811407566070557,
|
|
"epoch": 0.2929391169033262,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0004994785605093035,
|
|
"loss": 5.6878,
|
|
"mean_token_accuracy": 0.14702240973711014,
|
|
"num_tokens": 6546278.0,
|
|
"step": 3765
|
|
},
|
|
{
|
|
"entropy": 5.779412078857422,
|
|
"epoch": 0.2933281462750438,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004994766729958705,
|
|
"loss": 5.749,
|
|
"mean_token_accuracy": 0.15017975717782975,
|
|
"num_tokens": 6554449.0,
|
|
"step": 3770
|
|
},
|
|
{
|
|
"entropy": 5.7709815979003904,
|
|
"epoch": 0.2937171756467613,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004994747820763612,
|
|
"loss": 5.74,
|
|
"mean_token_accuracy": 0.14958301335573196,
|
|
"num_tokens": 6563272.0,
|
|
"step": 3775
|
|
},
|
|
{
|
|
"entropy": 5.8512287616729735,
|
|
"epoch": 0.2941062050184789,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0004994728877508046,
|
|
"loss": 5.7479,
|
|
"mean_token_accuracy": 0.14908050000667572,
|
|
"num_tokens": 6571864.0,
|
|
"step": 3780
|
|
},
|
|
{
|
|
"entropy": 5.808426761627198,
|
|
"epoch": 0.2944952343901965,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0004994709900192289,
|
|
"loss": 5.7548,
|
|
"mean_token_accuracy": 0.15123838260769845,
|
|
"num_tokens": 6580435.0,
|
|
"step": 3785
|
|
},
|
|
{
|
|
"entropy": 5.829617738723755,
|
|
"epoch": 0.294884263761914,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0004994690888816635,
|
|
"loss": 5.7405,
|
|
"mean_token_accuracy": 0.15302761197090148,
|
|
"num_tokens": 6589261.0,
|
|
"step": 3790
|
|
},
|
|
{
|
|
"entropy": 5.815215587615967,
|
|
"epoch": 0.2952732931336316,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004994671843381367,
|
|
"loss": 5.833,
|
|
"mean_token_accuracy": 0.14754071235656738,
|
|
"num_tokens": 6598057.0,
|
|
"step": 3795
|
|
},
|
|
{
|
|
"entropy": 5.89307165145874,
|
|
"epoch": 0.29566232250534913,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004994652763886778,
|
|
"loss": 5.7819,
|
|
"mean_token_accuracy": 0.14495566934347154,
|
|
"num_tokens": 6606439.0,
|
|
"step": 3800
|
|
},
|
|
{
|
|
"entropy": 5.779307746887207,
|
|
"epoch": 0.2960513518770667,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0004994633650333155,
|
|
"loss": 5.7972,
|
|
"mean_token_accuracy": 0.150536447763443,
|
|
"num_tokens": 6615350.0,
|
|
"step": 3805
|
|
},
|
|
{
|
|
"entropy": 5.839250755310059,
|
|
"epoch": 0.2964403812487843,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0004994614502720792,
|
|
"loss": 5.8374,
|
|
"mean_token_accuracy": 0.14464310929179192,
|
|
"num_tokens": 6624258.0,
|
|
"step": 3810
|
|
},
|
|
{
|
|
"entropy": 5.925694417953491,
|
|
"epoch": 0.29682941062050183,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0004994595321049974,
|
|
"loss": 5.8396,
|
|
"mean_token_accuracy": 0.14261462390422822,
|
|
"num_tokens": 6632382.0,
|
|
"step": 3815
|
|
},
|
|
{
|
|
"entropy": 5.749386548995972,
|
|
"epoch": 0.2972184399922194,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004994576105320994,
|
|
"loss": 5.7459,
|
|
"mean_token_accuracy": 0.14289859756827356,
|
|
"num_tokens": 6640482.0,
|
|
"step": 3820
|
|
},
|
|
{
|
|
"entropy": 5.77762246131897,
|
|
"epoch": 0.29760746936393695,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004994556855534146,
|
|
"loss": 5.7249,
|
|
"mean_token_accuracy": 0.14987960308790207,
|
|
"num_tokens": 6648912.0,
|
|
"step": 3825
|
|
},
|
|
{
|
|
"entropy": 5.764063549041748,
|
|
"epoch": 0.29799649873565454,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004994537571689719,
|
|
"loss": 5.6934,
|
|
"mean_token_accuracy": 0.15349327325820922,
|
|
"num_tokens": 6656912.0,
|
|
"step": 3830
|
|
},
|
|
{
|
|
"entropy": 5.654044771194458,
|
|
"epoch": 0.2983855281073721,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004994518253788007,
|
|
"loss": 5.7261,
|
|
"mean_token_accuracy": 0.1497397929430008,
|
|
"num_tokens": 6665900.0,
|
|
"step": 3835
|
|
},
|
|
{
|
|
"entropy": 5.794566822052002,
|
|
"epoch": 0.29877455747908965,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004994498901829304,
|
|
"loss": 5.7605,
|
|
"mean_token_accuracy": 0.1491077497601509,
|
|
"num_tokens": 6674426.0,
|
|
"step": 3840
|
|
},
|
|
{
|
|
"entropy": 5.859363174438476,
|
|
"epoch": 0.29916358685080724,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004994479515813903,
|
|
"loss": 5.7241,
|
|
"mean_token_accuracy": 0.15072896480560302,
|
|
"num_tokens": 6683566.0,
|
|
"step": 3845
|
|
},
|
|
{
|
|
"entropy": 5.8193401336669925,
|
|
"epoch": 0.2995526162225248,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.0004994460095742096,
|
|
"loss": 5.7437,
|
|
"mean_token_accuracy": 0.14816814959049224,
|
|
"num_tokens": 6693341.0,
|
|
"step": 3850
|
|
},
|
|
{
|
|
"entropy": 5.744719791412353,
|
|
"epoch": 0.29994164559424236,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.000499444064161418,
|
|
"loss": 5.6457,
|
|
"mean_token_accuracy": 0.14331029802560807,
|
|
"num_tokens": 6701734.0,
|
|
"step": 3855
|
|
},
|
|
{
|
|
"entropy": 5.705294227600097,
|
|
"epoch": 0.30033067496595994,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.000499442115343045,
|
|
"loss": 5.6967,
|
|
"mean_token_accuracy": 0.14783288091421126,
|
|
"num_tokens": 6710572.0,
|
|
"step": 3860
|
|
},
|
|
{
|
|
"entropy": 5.857030296325684,
|
|
"epoch": 0.3007197043376775,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004994401631191202,
|
|
"loss": 5.7977,
|
|
"mean_token_accuracy": 0.14748454242944717,
|
|
"num_tokens": 6719355.0,
|
|
"step": 3865
|
|
},
|
|
{
|
|
"entropy": 5.939599275588989,
|
|
"epoch": 0.30110873370939506,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004994382074896731,
|
|
"loss": 5.8436,
|
|
"mean_token_accuracy": 0.14460212513804435,
|
|
"num_tokens": 6729279.0,
|
|
"step": 3870
|
|
},
|
|
{
|
|
"entropy": 5.743366622924805,
|
|
"epoch": 0.30149776308111265,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0004994362484547335,
|
|
"loss": 5.661,
|
|
"mean_token_accuracy": 0.1506835326552391,
|
|
"num_tokens": 6737318.0,
|
|
"step": 3875
|
|
},
|
|
{
|
|
"entropy": 5.726180648803711,
|
|
"epoch": 0.3018867924528302,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004994342860143309,
|
|
"loss": 5.7294,
|
|
"mean_token_accuracy": 0.15141772627830505,
|
|
"num_tokens": 6746520.0,
|
|
"step": 3880
|
|
},
|
|
{
|
|
"entropy": 5.796295690536499,
|
|
"epoch": 0.30227582182454776,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004994323201684953,
|
|
"loss": 5.6717,
|
|
"mean_token_accuracy": 0.15030458867549895,
|
|
"num_tokens": 6755685.0,
|
|
"step": 3885
|
|
},
|
|
{
|
|
"entropy": 5.838547277450561,
|
|
"epoch": 0.3026648511962653,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.0004994303509172566,
|
|
"loss": 5.8235,
|
|
"mean_token_accuracy": 0.1489374205470085,
|
|
"num_tokens": 6764347.0,
|
|
"step": 3890
|
|
},
|
|
{
|
|
"entropy": 5.891355895996094,
|
|
"epoch": 0.3030538805679829,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.0004994283782606444,
|
|
"loss": 5.7928,
|
|
"mean_token_accuracy": 0.14623976349830628,
|
|
"num_tokens": 6772887.0,
|
|
"step": 3895
|
|
},
|
|
{
|
|
"entropy": 5.719379234313965,
|
|
"epoch": 0.30344290993970047,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0004994264021986888,
|
|
"loss": 5.752,
|
|
"mean_token_accuracy": 0.14479378163814544,
|
|
"num_tokens": 6780860.0,
|
|
"step": 3900
|
|
},
|
|
{
|
|
"entropy": 5.743838214874268,
|
|
"epoch": 0.303831939311418,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0004994244227314197,
|
|
"loss": 5.7788,
|
|
"mean_token_accuracy": 0.14853150248527527,
|
|
"num_tokens": 6789491.0,
|
|
"step": 3905
|
|
},
|
|
{
|
|
"entropy": 5.849668788909912,
|
|
"epoch": 0.3042209686831356,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0004994224398588672,
|
|
"loss": 5.6878,
|
|
"mean_token_accuracy": 0.15083892196416854,
|
|
"num_tokens": 6797128.0,
|
|
"step": 3910
|
|
},
|
|
{
|
|
"entropy": 5.765138626098633,
|
|
"epoch": 0.3046099980548531,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.0004994204535810615,
|
|
"loss": 5.7392,
|
|
"mean_token_accuracy": 0.14893354028463363,
|
|
"num_tokens": 6805235.0,
|
|
"step": 3915
|
|
},
|
|
{
|
|
"entropy": 5.7339215755462645,
|
|
"epoch": 0.3049990274265707,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0004994184638980326,
|
|
"loss": 5.6542,
|
|
"mean_token_accuracy": 0.14677734673023224,
|
|
"num_tokens": 6813863.0,
|
|
"step": 3920
|
|
},
|
|
{
|
|
"entropy": 5.850627326965332,
|
|
"epoch": 0.3053880567982883,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004994164708098107,
|
|
"loss": 5.7091,
|
|
"mean_token_accuracy": 0.1484633207321167,
|
|
"num_tokens": 6822015.0,
|
|
"step": 3925
|
|
},
|
|
{
|
|
"entropy": 5.8042628288269045,
|
|
"epoch": 0.3057770861700058,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.000499414474316426,
|
|
"loss": 5.776,
|
|
"mean_token_accuracy": 0.14575532376766204,
|
|
"num_tokens": 6830598.0,
|
|
"step": 3930
|
|
},
|
|
{
|
|
"entropy": 5.816047525405883,
|
|
"epoch": 0.3061661155417234,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0004994124744179088,
|
|
"loss": 5.7568,
|
|
"mean_token_accuracy": 0.15651062354445458,
|
|
"num_tokens": 6839129.0,
|
|
"step": 3935
|
|
},
|
|
{
|
|
"entropy": 5.819494342803955,
|
|
"epoch": 0.306555144913441,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0004994104711142896,
|
|
"loss": 5.7294,
|
|
"mean_token_accuracy": 0.14562334567308427,
|
|
"num_tokens": 6848199.0,
|
|
"step": 3940
|
|
},
|
|
{
|
|
"entropy": 5.744944715499878,
|
|
"epoch": 0.3069441742851585,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0004994084644055986,
|
|
"loss": 5.7293,
|
|
"mean_token_accuracy": 0.1494791552424431,
|
|
"num_tokens": 6857340.0,
|
|
"step": 3945
|
|
},
|
|
{
|
|
"entropy": 5.801846694946289,
|
|
"epoch": 0.3073332036568761,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004994064542918664,
|
|
"loss": 5.7679,
|
|
"mean_token_accuracy": 0.14427911713719369,
|
|
"num_tokens": 6865830.0,
|
|
"step": 3950
|
|
},
|
|
{
|
|
"entropy": 5.841561651229858,
|
|
"epoch": 0.30772223302859364,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004994044407731235,
|
|
"loss": 5.8153,
|
|
"mean_token_accuracy": 0.14207547903060913,
|
|
"num_tokens": 6874318.0,
|
|
"step": 3955
|
|
},
|
|
{
|
|
"entropy": 5.854608154296875,
|
|
"epoch": 0.3081112624003112,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0004994024238494002,
|
|
"loss": 5.8195,
|
|
"mean_token_accuracy": 0.1442083813250065,
|
|
"num_tokens": 6882008.0,
|
|
"step": 3960
|
|
},
|
|
{
|
|
"entropy": 5.7925008773803714,
|
|
"epoch": 0.3085002917720288,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004994004035207274,
|
|
"loss": 5.6894,
|
|
"mean_token_accuracy": 0.1514485001564026,
|
|
"num_tokens": 6890411.0,
|
|
"step": 3965
|
|
},
|
|
{
|
|
"entropy": 5.758844566345215,
|
|
"epoch": 0.30888932114374634,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004993983797871356,
|
|
"loss": 5.7275,
|
|
"mean_token_accuracy": 0.14202559366822243,
|
|
"num_tokens": 6899201.0,
|
|
"step": 3970
|
|
},
|
|
{
|
|
"entropy": 5.741217756271363,
|
|
"epoch": 0.30927835051546393,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0004993963526486555,
|
|
"loss": 5.7072,
|
|
"mean_token_accuracy": 0.14819234013557434,
|
|
"num_tokens": 6907470.0,
|
|
"step": 3975
|
|
},
|
|
{
|
|
"entropy": 5.758135032653809,
|
|
"epoch": 0.30966737988718146,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.000499394322105318,
|
|
"loss": 5.7705,
|
|
"mean_token_accuracy": 0.14505221620202063,
|
|
"num_tokens": 6916542.0,
|
|
"step": 3980
|
|
},
|
|
{
|
|
"entropy": 5.811226224899292,
|
|
"epoch": 0.31005640925889905,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004993922881571538,
|
|
"loss": 5.7622,
|
|
"mean_token_accuracy": 0.14597265869379045,
|
|
"num_tokens": 6925974.0,
|
|
"step": 3985
|
|
},
|
|
{
|
|
"entropy": 5.864097452163696,
|
|
"epoch": 0.31044543863061663,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004993902508041939,
|
|
"loss": 5.7823,
|
|
"mean_token_accuracy": 0.14232797771692277,
|
|
"num_tokens": 6934987.0,
|
|
"step": 3990
|
|
},
|
|
{
|
|
"entropy": 5.724343395233154,
|
|
"epoch": 0.31083446800233416,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.000499388210046469,
|
|
"loss": 5.6578,
|
|
"mean_token_accuracy": 0.1503308668732643,
|
|
"num_tokens": 6944497.0,
|
|
"step": 3995
|
|
},
|
|
{
|
|
"entropy": 5.767210245132446,
|
|
"epoch": 0.31122349737405175,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0004993861658840102,
|
|
"loss": 5.8084,
|
|
"mean_token_accuracy": 0.14419659674167634,
|
|
"num_tokens": 6953394.0,
|
|
"step": 4000
|
|
},
|
|
{
|
|
"entropy": 5.857591390609741,
|
|
"epoch": 0.3116125267457693,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.0004993841183168484,
|
|
"loss": 5.72,
|
|
"mean_token_accuracy": 0.14840124249458314,
|
|
"num_tokens": 6961715.0,
|
|
"step": 4005
|
|
},
|
|
{
|
|
"entropy": 5.778973197937011,
|
|
"epoch": 0.31200155611748687,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004993820673450148,
|
|
"loss": 5.711,
|
|
"mean_token_accuracy": 0.15171929597854614,
|
|
"num_tokens": 6970041.0,
|
|
"step": 4010
|
|
},
|
|
{
|
|
"entropy": 5.807648229598999,
|
|
"epoch": 0.31239058548920445,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004993800129685404,
|
|
"loss": 5.8432,
|
|
"mean_token_accuracy": 0.13994109630584717,
|
|
"num_tokens": 6979522.0,
|
|
"step": 4015
|
|
},
|
|
{
|
|
"entropy": 5.856877374649048,
|
|
"epoch": 0.312779614860922,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0004993779551874565,
|
|
"loss": 5.8043,
|
|
"mean_token_accuracy": 0.14071302264928817,
|
|
"num_tokens": 6988470.0,
|
|
"step": 4020
|
|
},
|
|
{
|
|
"entropy": 5.85621976852417,
|
|
"epoch": 0.31316864423263957,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0004993758940017943,
|
|
"loss": 5.8328,
|
|
"mean_token_accuracy": 0.1494374841451645,
|
|
"num_tokens": 6996696.0,
|
|
"step": 4025
|
|
},
|
|
{
|
|
"entropy": 5.837846803665161,
|
|
"epoch": 0.31355767360435716,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.000499373829411585,
|
|
"loss": 5.6987,
|
|
"mean_token_accuracy": 0.14920781552791595,
|
|
"num_tokens": 7005297.0,
|
|
"step": 4030
|
|
},
|
|
{
|
|
"entropy": 5.746081399917602,
|
|
"epoch": 0.3139467029760747,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.00049937176141686,
|
|
"loss": 5.706,
|
|
"mean_token_accuracy": 0.14789552241563797,
|
|
"num_tokens": 7013569.0,
|
|
"step": 4035
|
|
},
|
|
{
|
|
"entropy": 5.712790489196777,
|
|
"epoch": 0.3143357323477923,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0004993696900176506,
|
|
"loss": 5.6654,
|
|
"mean_token_accuracy": 0.15430878922343255,
|
|
"num_tokens": 7021449.0,
|
|
"step": 4040
|
|
},
|
|
{
|
|
"entropy": 5.807843160629273,
|
|
"epoch": 0.3147247617195098,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.0004993676152139883,
|
|
"loss": 5.7744,
|
|
"mean_token_accuracy": 0.14702282547950746,
|
|
"num_tokens": 7029663.0,
|
|
"step": 4045
|
|
},
|
|
{
|
|
"entropy": 5.8004063129425045,
|
|
"epoch": 0.3151137910912274,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004993655370059046,
|
|
"loss": 5.7596,
|
|
"mean_token_accuracy": 0.14937672913074493,
|
|
"num_tokens": 7039038.0,
|
|
"step": 4050
|
|
},
|
|
{
|
|
"entropy": 5.813193845748901,
|
|
"epoch": 0.315502820462945,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004993634553934309,
|
|
"loss": 5.7187,
|
|
"mean_token_accuracy": 0.14714134261012077,
|
|
"num_tokens": 7047595.0,
|
|
"step": 4055
|
|
},
|
|
{
|
|
"entropy": 5.806483888626099,
|
|
"epoch": 0.3158918498346625,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0004993613703765989,
|
|
"loss": 5.7476,
|
|
"mean_token_accuracy": 0.1446899317204952,
|
|
"num_tokens": 7055711.0,
|
|
"step": 4060
|
|
},
|
|
{
|
|
"entropy": 5.83050012588501,
|
|
"epoch": 0.3162808792063801,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004993592819554402,
|
|
"loss": 5.7053,
|
|
"mean_token_accuracy": 0.15050461292266845,
|
|
"num_tokens": 7064100.0,
|
|
"step": 4065
|
|
},
|
|
{
|
|
"entropy": 5.730781698226929,
|
|
"epoch": 0.3166699085780976,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0004993571901299866,
|
|
"loss": 5.6671,
|
|
"mean_token_accuracy": 0.15151382014155387,
|
|
"num_tokens": 7073040.0,
|
|
"step": 4070
|
|
},
|
|
{
|
|
"entropy": 5.802879333496094,
|
|
"epoch": 0.3170589379498152,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.0004993550949002697,
|
|
"loss": 5.7897,
|
|
"mean_token_accuracy": 0.14686385542154312,
|
|
"num_tokens": 7081513.0,
|
|
"step": 4075
|
|
},
|
|
{
|
|
"entropy": 5.71605954170227,
|
|
"epoch": 0.3174479673215328,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0004993529962663213,
|
|
"loss": 5.6664,
|
|
"mean_token_accuracy": 0.1578037440776825,
|
|
"num_tokens": 7090704.0,
|
|
"step": 4080
|
|
},
|
|
{
|
|
"entropy": 5.719445323944091,
|
|
"epoch": 0.31783699669325033,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004993508942281732,
|
|
"loss": 5.8339,
|
|
"mean_token_accuracy": 0.14239503517746926,
|
|
"num_tokens": 7099692.0,
|
|
"step": 4085
|
|
},
|
|
{
|
|
"entropy": 5.829551744461059,
|
|
"epoch": 0.3182260260649679,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0004993487887858575,
|
|
"loss": 5.6674,
|
|
"mean_token_accuracy": 0.14845634177327155,
|
|
"num_tokens": 7108021.0,
|
|
"step": 4090
|
|
},
|
|
{
|
|
"entropy": 5.787135601043701,
|
|
"epoch": 0.31861505543668545,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.000499346679939406,
|
|
"loss": 5.7383,
|
|
"mean_token_accuracy": 0.15348986834287642,
|
|
"num_tokens": 7116689.0,
|
|
"step": 4095
|
|
},
|
|
{
|
|
"entropy": 5.830695724487304,
|
|
"epoch": 0.31900408480840303,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.0004993445676888507,
|
|
"loss": 5.8181,
|
|
"mean_token_accuracy": 0.14692653194069863,
|
|
"num_tokens": 7125453.0,
|
|
"step": 4100
|
|
},
|
|
{
|
|
"entropy": 5.901071310043335,
|
|
"epoch": 0.3193931141801206,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0004993424520342236,
|
|
"loss": 5.8614,
|
|
"mean_token_accuracy": 0.14383067488670348,
|
|
"num_tokens": 7133692.0,
|
|
"step": 4105
|
|
},
|
|
{
|
|
"entropy": 5.799852418899536,
|
|
"epoch": 0.31978214355183815,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0004993403329755569,
|
|
"loss": 5.6846,
|
|
"mean_token_accuracy": 0.15570786744356155,
|
|
"num_tokens": 7142362.0,
|
|
"step": 4110
|
|
},
|
|
{
|
|
"entropy": 5.69540696144104,
|
|
"epoch": 0.32017117292355574,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0004993382105128828,
|
|
"loss": 5.694,
|
|
"mean_token_accuracy": 0.1470162481069565,
|
|
"num_tokens": 7151020.0,
|
|
"step": 4115
|
|
},
|
|
{
|
|
"entropy": 5.802663040161133,
|
|
"epoch": 0.32056020229527327,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0004993360846462333,
|
|
"loss": 5.6156,
|
|
"mean_token_accuracy": 0.15607071816921234,
|
|
"num_tokens": 7159453.0,
|
|
"step": 4120
|
|
},
|
|
{
|
|
"entropy": 5.836108446121216,
|
|
"epoch": 0.32094923166699085,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0004993339553756408,
|
|
"loss": 5.8734,
|
|
"mean_token_accuracy": 0.14251873642206192,
|
|
"num_tokens": 7168758.0,
|
|
"step": 4125
|
|
},
|
|
{
|
|
"entropy": 5.747575998306274,
|
|
"epoch": 0.32133826103870844,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0004993318227011378,
|
|
"loss": 5.6809,
|
|
"mean_token_accuracy": 0.14836385846138,
|
|
"num_tokens": 7177835.0,
|
|
"step": 4130
|
|
},
|
|
{
|
|
"entropy": 5.791856718063355,
|
|
"epoch": 0.32172729041042597,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0004993296866227562,
|
|
"loss": 5.7434,
|
|
"mean_token_accuracy": 0.15285915583372117,
|
|
"num_tokens": 7186424.0,
|
|
"step": 4135
|
|
},
|
|
{
|
|
"entropy": 5.785421514511109,
|
|
"epoch": 0.32211631978214356,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004993275471405288,
|
|
"loss": 5.7097,
|
|
"mean_token_accuracy": 0.15487945079803467,
|
|
"num_tokens": 7194800.0,
|
|
"step": 4140
|
|
},
|
|
{
|
|
"entropy": 5.753833484649658,
|
|
"epoch": 0.32250534915386114,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004993254042544879,
|
|
"loss": 5.624,
|
|
"mean_token_accuracy": 0.15332144722342492,
|
|
"num_tokens": 7203820.0,
|
|
"step": 4145
|
|
},
|
|
{
|
|
"entropy": 5.73719220161438,
|
|
"epoch": 0.3228943785255787,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.000499323257964666,
|
|
"loss": 5.6277,
|
|
"mean_token_accuracy": 0.1526389017701149,
|
|
"num_tokens": 7211793.0,
|
|
"step": 4150
|
|
},
|
|
{
|
|
"entropy": 5.769924783706665,
|
|
"epoch": 0.32328340789729626,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004993211082710957,
|
|
"loss": 5.6852,
|
|
"mean_token_accuracy": 0.15136036276817322,
|
|
"num_tokens": 7220471.0,
|
|
"step": 4155
|
|
},
|
|
{
|
|
"entropy": 5.725868844985962,
|
|
"epoch": 0.3236724372690138,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0004993189551738097,
|
|
"loss": 5.7308,
|
|
"mean_token_accuracy": 0.14761384800076485,
|
|
"num_tokens": 7228788.0,
|
|
"step": 4160
|
|
},
|
|
{
|
|
"entropy": 5.8348915576934814,
|
|
"epoch": 0.3240614666407314,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0004993167986728405,
|
|
"loss": 5.8991,
|
|
"mean_token_accuracy": 0.14883753657341003,
|
|
"num_tokens": 7237707.0,
|
|
"step": 4165
|
|
},
|
|
{
|
|
"entropy": 5.892117071151733,
|
|
"epoch": 0.32445049601244896,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.000499314638768221,
|
|
"loss": 5.6602,
|
|
"mean_token_accuracy": 0.15464966297149657,
|
|
"num_tokens": 7246296.0,
|
|
"step": 4170
|
|
},
|
|
{
|
|
"entropy": 5.67684326171875,
|
|
"epoch": 0.3248395253841665,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004993124754599839,
|
|
"loss": 5.5873,
|
|
"mean_token_accuracy": 0.1556680306792259,
|
|
"num_tokens": 7255076.0,
|
|
"step": 4175
|
|
},
|
|
{
|
|
"entropy": 5.574007749557495,
|
|
"epoch": 0.3252285547558841,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0004993103087481619,
|
|
"loss": 5.6898,
|
|
"mean_token_accuracy": 0.14951695650815963,
|
|
"num_tokens": 7263169.0,
|
|
"step": 4180
|
|
},
|
|
{
|
|
"entropy": 5.827068758010864,
|
|
"epoch": 0.3256175841276016,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004993081386327881,
|
|
"loss": 5.7499,
|
|
"mean_token_accuracy": 0.15402725636959075,
|
|
"num_tokens": 7271748.0,
|
|
"step": 4185
|
|
},
|
|
{
|
|
"entropy": 5.725684070587159,
|
|
"epoch": 0.3260066134993192,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004993059651138953,
|
|
"loss": 5.5602,
|
|
"mean_token_accuracy": 0.1556816130876541,
|
|
"num_tokens": 7280291.0,
|
|
"step": 4190
|
|
},
|
|
{
|
|
"entropy": 5.69296875,
|
|
"epoch": 0.3263956428710368,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004993037881915165,
|
|
"loss": 5.7556,
|
|
"mean_token_accuracy": 0.14534951150417327,
|
|
"num_tokens": 7290307.0,
|
|
"step": 4195
|
|
},
|
|
{
|
|
"entropy": 5.911472511291504,
|
|
"epoch": 0.3267846722427543,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0004993016078656847,
|
|
"loss": 5.8196,
|
|
"mean_token_accuracy": 0.14084672108292579,
|
|
"num_tokens": 7297942.0,
|
|
"step": 4200
|
|
},
|
|
{
|
|
"entropy": 5.713421821594238,
|
|
"epoch": 0.3271737016144719,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.000499299424136433,
|
|
"loss": 5.703,
|
|
"mean_token_accuracy": 0.14439374804496766,
|
|
"num_tokens": 7307378.0,
|
|
"step": 4205
|
|
},
|
|
{
|
|
"entropy": 5.755586624145508,
|
|
"epoch": 0.32756273098618943,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0004992972370037946,
|
|
"loss": 5.6635,
|
|
"mean_token_accuracy": 0.1554426446557045,
|
|
"num_tokens": 7315985.0,
|
|
"step": 4210
|
|
},
|
|
{
|
|
"entropy": 5.809132528305054,
|
|
"epoch": 0.327951760357907,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0004992950464678026,
|
|
"loss": 5.7924,
|
|
"mean_token_accuracy": 0.14466845989227295,
|
|
"num_tokens": 7324142.0,
|
|
"step": 4215
|
|
},
|
|
{
|
|
"entropy": 5.739095306396484,
|
|
"epoch": 0.3283407897296246,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0004992928525284903,
|
|
"loss": 5.6415,
|
|
"mean_token_accuracy": 0.14974627569317817,
|
|
"num_tokens": 7333012.0,
|
|
"step": 4220
|
|
},
|
|
{
|
|
"entropy": 5.764504671096802,
|
|
"epoch": 0.32872981910134214,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.000499290655185891,
|
|
"loss": 5.6733,
|
|
"mean_token_accuracy": 0.1509619578719139,
|
|
"num_tokens": 7341838.0,
|
|
"step": 4225
|
|
},
|
|
{
|
|
"entropy": 5.677153444290161,
|
|
"epoch": 0.3291188484730597,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.000499288454440038,
|
|
"loss": 5.6118,
|
|
"mean_token_accuracy": 0.16084043234586715,
|
|
"num_tokens": 7349986.0,
|
|
"step": 4230
|
|
},
|
|
{
|
|
"entropy": 5.832826709747314,
|
|
"epoch": 0.3295078778447773,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0004992862502909645,
|
|
"loss": 5.8509,
|
|
"mean_token_accuracy": 0.14144516214728356,
|
|
"num_tokens": 7359428.0,
|
|
"step": 4235
|
|
},
|
|
{
|
|
"entropy": 5.873200845718384,
|
|
"epoch": 0.32989690721649484,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0004992840427387043,
|
|
"loss": 5.7791,
|
|
"mean_token_accuracy": 0.14769574701786042,
|
|
"num_tokens": 7368524.0,
|
|
"step": 4240
|
|
},
|
|
{
|
|
"entropy": 5.753816413879394,
|
|
"epoch": 0.3302859365882124,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004992818317832908,
|
|
"loss": 5.6531,
|
|
"mean_token_accuracy": 0.1480708360671997,
|
|
"num_tokens": 7377979.0,
|
|
"step": 4245
|
|
},
|
|
{
|
|
"entropy": 5.716938257217407,
|
|
"epoch": 0.33067496595992996,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0004992796174247574,
|
|
"loss": 5.5792,
|
|
"mean_token_accuracy": 0.15270080417394638,
|
|
"num_tokens": 7386283.0,
|
|
"step": 4250
|
|
},
|
|
{
|
|
"entropy": 5.703174495697022,
|
|
"epoch": 0.33106399533164754,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004992773996631378,
|
|
"loss": 5.7083,
|
|
"mean_token_accuracy": 0.14178377091884614,
|
|
"num_tokens": 7395409.0,
|
|
"step": 4255
|
|
},
|
|
{
|
|
"entropy": 5.793183040618897,
|
|
"epoch": 0.33145302470336513,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0004992751784984656,
|
|
"loss": 5.7763,
|
|
"mean_token_accuracy": 0.14899417757987976,
|
|
"num_tokens": 7403389.0,
|
|
"step": 4260
|
|
},
|
|
{
|
|
"entropy": 5.7782896041870115,
|
|
"epoch": 0.33184205407508266,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004992729539307745,
|
|
"loss": 5.703,
|
|
"mean_token_accuracy": 0.15201039761304855,
|
|
"num_tokens": 7411506.0,
|
|
"step": 4265
|
|
},
|
|
{
|
|
"entropy": 5.812991285324097,
|
|
"epoch": 0.33223108344680025,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0004992707259600984,
|
|
"loss": 5.7846,
|
|
"mean_token_accuracy": 0.14998362809419633,
|
|
"num_tokens": 7420219.0,
|
|
"step": 4270
|
|
},
|
|
{
|
|
"entropy": 5.757145166397095,
|
|
"epoch": 0.3326201128185178,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0004992684945864709,
|
|
"loss": 5.7129,
|
|
"mean_token_accuracy": 0.15293968468904495,
|
|
"num_tokens": 7428442.0,
|
|
"step": 4275
|
|
},
|
|
{
|
|
"entropy": 5.798875713348389,
|
|
"epoch": 0.33300914219023536,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004992662598099261,
|
|
"loss": 5.6653,
|
|
"mean_token_accuracy": 0.1510924369096756,
|
|
"num_tokens": 7436364.0,
|
|
"step": 4280
|
|
},
|
|
{
|
|
"entropy": 5.772172117233277,
|
|
"epoch": 0.33339817156195295,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0004992640216304975,
|
|
"loss": 5.7325,
|
|
"mean_token_accuracy": 0.14351431503891945,
|
|
"num_tokens": 7444122.0,
|
|
"step": 4285
|
|
},
|
|
{
|
|
"entropy": 5.835605764389038,
|
|
"epoch": 0.3337872009336705,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0004992617800482196,
|
|
"loss": 5.7413,
|
|
"mean_token_accuracy": 0.14694980010390282,
|
|
"num_tokens": 7454122.0,
|
|
"step": 4290
|
|
},
|
|
{
|
|
"entropy": 5.806734895706176,
|
|
"epoch": 0.33417623030538807,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.000499259535063126,
|
|
"loss": 5.752,
|
|
"mean_token_accuracy": 0.15015026181936264,
|
|
"num_tokens": 7463057.0,
|
|
"step": 4295
|
|
},
|
|
{
|
|
"entropy": 5.819530391693116,
|
|
"epoch": 0.3345652596771056,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.000499257286675251,
|
|
"loss": 5.7053,
|
|
"mean_token_accuracy": 0.14335729479789733,
|
|
"num_tokens": 7471675.0,
|
|
"step": 4300
|
|
},
|
|
{
|
|
"entropy": 5.699312400817871,
|
|
"epoch": 0.3349542890488232,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004992550348846285,
|
|
"loss": 5.6546,
|
|
"mean_token_accuracy": 0.1525387153029442,
|
|
"num_tokens": 7479870.0,
|
|
"step": 4305
|
|
},
|
|
{
|
|
"entropy": 5.7911989212036135,
|
|
"epoch": 0.33534331842054077,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004992527796912928,
|
|
"loss": 5.7359,
|
|
"mean_token_accuracy": 0.14847930446267127,
|
|
"num_tokens": 7489830.0,
|
|
"step": 4310
|
|
},
|
|
{
|
|
"entropy": 5.775819587707519,
|
|
"epoch": 0.3357323477922583,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0004992505210952782,
|
|
"loss": 5.6581,
|
|
"mean_token_accuracy": 0.1594860151410103,
|
|
"num_tokens": 7497852.0,
|
|
"step": 4315
|
|
},
|
|
{
|
|
"entropy": 5.789813709259033,
|
|
"epoch": 0.3361213771639759,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0004992482590966188,
|
|
"loss": 5.8037,
|
|
"mean_token_accuracy": 0.14984895661473274,
|
|
"num_tokens": 7506419.0,
|
|
"step": 4320
|
|
},
|
|
{
|
|
"entropy": 5.7952008724212645,
|
|
"epoch": 0.3365104065356934,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004992459936953489,
|
|
"loss": 5.6975,
|
|
"mean_token_accuracy": 0.15465806424617767,
|
|
"num_tokens": 7514757.0,
|
|
"step": 4325
|
|
},
|
|
{
|
|
"entropy": 5.809590005874634,
|
|
"epoch": 0.336899435907411,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004992437248915032,
|
|
"loss": 5.7543,
|
|
"mean_token_accuracy": 0.14698707759380342,
|
|
"num_tokens": 7523912.0,
|
|
"step": 4330
|
|
},
|
|
{
|
|
"entropy": 5.772178649902344,
|
|
"epoch": 0.3372884652791286,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004992414526851157,
|
|
"loss": 5.6248,
|
|
"mean_token_accuracy": 0.15759740620851517,
|
|
"num_tokens": 7532401.0,
|
|
"step": 4335
|
|
},
|
|
{
|
|
"entropy": 5.6291059970855715,
|
|
"epoch": 0.3376774946508461,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.0004992391770762212,
|
|
"loss": 5.599,
|
|
"mean_token_accuracy": 0.15522923022508622,
|
|
"num_tokens": 7541257.0,
|
|
"step": 4340
|
|
},
|
|
{
|
|
"entropy": 5.672086715698242,
|
|
"epoch": 0.3380665240225637,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.000499236898064854,
|
|
"loss": 5.5396,
|
|
"mean_token_accuracy": 0.1525227814912796,
|
|
"num_tokens": 7549812.0,
|
|
"step": 4345
|
|
},
|
|
{
|
|
"entropy": 5.688179683685303,
|
|
"epoch": 0.3384555533942813,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004992346156510488,
|
|
"loss": 5.6406,
|
|
"mean_token_accuracy": 0.15223049223423005,
|
|
"num_tokens": 7559319.0,
|
|
"step": 4350
|
|
},
|
|
{
|
|
"entropy": 5.756983423233033,
|
|
"epoch": 0.3388445827659988,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004992323298348403,
|
|
"loss": 5.7759,
|
|
"mean_token_accuracy": 0.14724590629339218,
|
|
"num_tokens": 7567900.0,
|
|
"step": 4355
|
|
},
|
|
{
|
|
"entropy": 5.881202983856201,
|
|
"epoch": 0.3392336121377164,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.000499230040616263,
|
|
"loss": 5.7154,
|
|
"mean_token_accuracy": 0.1452577978372574,
|
|
"num_tokens": 7576163.0,
|
|
"step": 4360
|
|
},
|
|
{
|
|
"entropy": 5.70105996131897,
|
|
"epoch": 0.33962264150943394,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0004992277479953518,
|
|
"loss": 5.6286,
|
|
"mean_token_accuracy": 0.15342977792024612,
|
|
"num_tokens": 7584221.0,
|
|
"step": 4365
|
|
},
|
|
{
|
|
"entropy": 5.741499710083008,
|
|
"epoch": 0.34001167088115153,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0004992254519721414,
|
|
"loss": 5.6279,
|
|
"mean_token_accuracy": 0.1542896419763565,
|
|
"num_tokens": 7593569.0,
|
|
"step": 4370
|
|
},
|
|
{
|
|
"entropy": 5.776559448242187,
|
|
"epoch": 0.3404007002528691,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0004992231525466666,
|
|
"loss": 5.6975,
|
|
"mean_token_accuracy": 0.15335093662142754,
|
|
"num_tokens": 7602666.0,
|
|
"step": 4375
|
|
},
|
|
{
|
|
"entropy": 5.710270786285401,
|
|
"epoch": 0.34078972962458665,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0004992208497189624,
|
|
"loss": 5.7656,
|
|
"mean_token_accuracy": 0.14594510644674302,
|
|
"num_tokens": 7611874.0,
|
|
"step": 4380
|
|
},
|
|
{
|
|
"entropy": 5.758926343917847,
|
|
"epoch": 0.34117875899630423,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0004992185434890637,
|
|
"loss": 5.7198,
|
|
"mean_token_accuracy": 0.15153981149196624,
|
|
"num_tokens": 7620385.0,
|
|
"step": 4385
|
|
},
|
|
{
|
|
"entropy": 5.837249088287353,
|
|
"epoch": 0.34156778836802176,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0004992162338570055,
|
|
"loss": 5.7949,
|
|
"mean_token_accuracy": 0.13906663209199904,
|
|
"num_tokens": 7628786.0,
|
|
"step": 4390
|
|
},
|
|
{
|
|
"entropy": 5.7165384769439695,
|
|
"epoch": 0.34195681773973935,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004992139208228227,
|
|
"loss": 5.5799,
|
|
"mean_token_accuracy": 0.1546400859951973,
|
|
"num_tokens": 7637389.0,
|
|
"step": 4395
|
|
},
|
|
{
|
|
"entropy": 5.71855788230896,
|
|
"epoch": 0.34234584711145694,
|
|
"grad_norm": 1.515625,
|
|
"learning_rate": 0.0004992116043865506,
|
|
"loss": 5.7634,
|
|
"mean_token_accuracy": 0.14998725801706314,
|
|
"num_tokens": 7645793.0,
|
|
"step": 4400
|
|
},
|
|
{
|
|
"entropy": 5.859033393859863,
|
|
"epoch": 0.34273487648317447,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0004992092845482244,
|
|
"loss": 5.6981,
|
|
"mean_token_accuracy": 0.15337317287921906,
|
|
"num_tokens": 7653951.0,
|
|
"step": 4405
|
|
},
|
|
{
|
|
"entropy": 5.665503597259521,
|
|
"epoch": 0.34312390585489205,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004992069613078791,
|
|
"loss": 5.5882,
|
|
"mean_token_accuracy": 0.1616547703742981,
|
|
"num_tokens": 7662753.0,
|
|
"step": 4410
|
|
},
|
|
{
|
|
"entropy": 5.646042823791504,
|
|
"epoch": 0.3435129352266096,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.0004992046346655499,
|
|
"loss": 5.5503,
|
|
"mean_token_accuracy": 0.15094086453318595,
|
|
"num_tokens": 7671832.0,
|
|
"step": 4415
|
|
},
|
|
{
|
|
"entropy": 5.803126287460327,
|
|
"epoch": 0.34390196459832717,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0004992023046212723,
|
|
"loss": 5.7209,
|
|
"mean_token_accuracy": 0.14602495953440667,
|
|
"num_tokens": 7680969.0,
|
|
"step": 4420
|
|
},
|
|
{
|
|
"entropy": 5.8474115371704105,
|
|
"epoch": 0.34429099397004476,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0004991999711750816,
|
|
"loss": 5.7295,
|
|
"mean_token_accuracy": 0.14345005601644517,
|
|
"num_tokens": 7689277.0,
|
|
"step": 4425
|
|
},
|
|
{
|
|
"entropy": 5.678358888626098,
|
|
"epoch": 0.3446800233417623,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0004991976343270133,
|
|
"loss": 5.6502,
|
|
"mean_token_accuracy": 0.15776083916425704,
|
|
"num_tokens": 7697373.0,
|
|
"step": 4430
|
|
},
|
|
{
|
|
"entropy": 5.839732694625854,
|
|
"epoch": 0.3450690527134799,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0004991952940771026,
|
|
"loss": 5.73,
|
|
"mean_token_accuracy": 0.1477728880941868,
|
|
"num_tokens": 7705767.0,
|
|
"step": 4435
|
|
},
|
|
{
|
|
"entropy": 5.745546770095825,
|
|
"epoch": 0.34545808208519746,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.0004991929504253852,
|
|
"loss": 5.5992,
|
|
"mean_token_accuracy": 0.1563803017139435,
|
|
"num_tokens": 7713746.0,
|
|
"step": 4440
|
|
},
|
|
{
|
|
"entropy": 5.654825639724732,
|
|
"epoch": 0.345847111456915,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0004991906033718966,
|
|
"loss": 5.7396,
|
|
"mean_token_accuracy": 0.14519762098789216,
|
|
"num_tokens": 7721829.0,
|
|
"step": 4445
|
|
},
|
|
{
|
|
"entropy": 5.703803396224975,
|
|
"epoch": 0.3462361408286326,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0004991882529166724,
|
|
"loss": 5.6408,
|
|
"mean_token_accuracy": 0.15357706546783448,
|
|
"num_tokens": 7730479.0,
|
|
"step": 4450
|
|
},
|
|
{
|
|
"entropy": 5.735348558425903,
|
|
"epoch": 0.3466251702003501,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0004991858990597483,
|
|
"loss": 5.5983,
|
|
"mean_token_accuracy": 0.1547751769423485,
|
|
"num_tokens": 7738659.0,
|
|
"step": 4455
|
|
},
|
|
{
|
|
"entropy": 5.813489246368408,
|
|
"epoch": 0.3470141995720677,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0004991835418011601,
|
|
"loss": 5.8591,
|
|
"mean_token_accuracy": 0.14898139089345933,
|
|
"num_tokens": 7747597.0,
|
|
"step": 4460
|
|
},
|
|
{
|
|
"entropy": 5.801498508453369,
|
|
"epoch": 0.3474032289437853,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0004991811811409434,
|
|
"loss": 5.7076,
|
|
"mean_token_accuracy": 0.14893003180623055,
|
|
"num_tokens": 7756666.0,
|
|
"step": 4465
|
|
},
|
|
{
|
|
"entropy": 5.805731916427613,
|
|
"epoch": 0.3477922583155028,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004991788170791341,
|
|
"loss": 5.7394,
|
|
"mean_token_accuracy": 0.14709567725658418,
|
|
"num_tokens": 7765621.0,
|
|
"step": 4470
|
|
},
|
|
{
|
|
"entropy": 5.706645917892456,
|
|
"epoch": 0.3481812876872204,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0004991764496157682,
|
|
"loss": 5.633,
|
|
"mean_token_accuracy": 0.149008846282959,
|
|
"num_tokens": 7774137.0,
|
|
"step": 4475
|
|
},
|
|
{
|
|
"entropy": 5.792159605026245,
|
|
"epoch": 0.34857031705893793,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004991740787508814,
|
|
"loss": 5.7491,
|
|
"mean_token_accuracy": 0.14444359689950942,
|
|
"num_tokens": 7783144.0,
|
|
"step": 4480
|
|
},
|
|
{
|
|
"entropy": 5.792681503295898,
|
|
"epoch": 0.3489593464306555,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0004991717044845097,
|
|
"loss": 5.7591,
|
|
"mean_token_accuracy": 0.14241152629256248,
|
|
"num_tokens": 7791530.0,
|
|
"step": 4485
|
|
},
|
|
{
|
|
"entropy": 5.733056831359863,
|
|
"epoch": 0.3493483758023731,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004991693268166892,
|
|
"loss": 5.6294,
|
|
"mean_token_accuracy": 0.15588642954826354,
|
|
"num_tokens": 7800869.0,
|
|
"step": 4490
|
|
},
|
|
{
|
|
"entropy": 5.743151617050171,
|
|
"epoch": 0.34973740517409063,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0004991669457474559,
|
|
"loss": 5.702,
|
|
"mean_token_accuracy": 0.15250983089208603,
|
|
"num_tokens": 7810201.0,
|
|
"step": 4495
|
|
},
|
|
{
|
|
"entropy": 5.70795955657959,
|
|
"epoch": 0.3501264345458082,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004991645612768461,
|
|
"loss": 5.6051,
|
|
"mean_token_accuracy": 0.15941296368837357,
|
|
"num_tokens": 7818529.0,
|
|
"step": 4500
|
|
},
|
|
{
|
|
"entropy": 5.727574253082276,
|
|
"epoch": 0.35051546391752575,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0004991621734048958,
|
|
"loss": 5.6513,
|
|
"mean_token_accuracy": 0.15623073428869247,
|
|
"num_tokens": 7827254.0,
|
|
"step": 4505
|
|
},
|
|
{
|
|
"entropy": 5.767280435562133,
|
|
"epoch": 0.35090449328924334,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004991597821316415,
|
|
"loss": 5.6719,
|
|
"mean_token_accuracy": 0.15514668226242065,
|
|
"num_tokens": 7836437.0,
|
|
"step": 4510
|
|
},
|
|
{
|
|
"entropy": 5.724820709228515,
|
|
"epoch": 0.3512935226609609,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004991573874571192,
|
|
"loss": 5.6718,
|
|
"mean_token_accuracy": 0.1533803641796112,
|
|
"num_tokens": 7844939.0,
|
|
"step": 4515
|
|
},
|
|
{
|
|
"entropy": 5.74892292022705,
|
|
"epoch": 0.35168255203267845,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0004991549893813653,
|
|
"loss": 5.6687,
|
|
"mean_token_accuracy": 0.15008964389562607,
|
|
"num_tokens": 7852889.0,
|
|
"step": 4520
|
|
},
|
|
{
|
|
"entropy": 5.7785228252410885,
|
|
"epoch": 0.35207158140439604,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0004991525879044162,
|
|
"loss": 5.7899,
|
|
"mean_token_accuracy": 0.14683696180582045,
|
|
"num_tokens": 7861867.0,
|
|
"step": 4525
|
|
},
|
|
{
|
|
"entropy": 5.77210807800293,
|
|
"epoch": 0.35246061077611357,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0004991501830263084,
|
|
"loss": 5.6071,
|
|
"mean_token_accuracy": 0.15673087388277054,
|
|
"num_tokens": 7869343.0,
|
|
"step": 4530
|
|
},
|
|
{
|
|
"entropy": 5.753970432281494,
|
|
"epoch": 0.35284964014783116,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0004991477747470783,
|
|
"loss": 5.636,
|
|
"mean_token_accuracy": 0.15080263912677766,
|
|
"num_tokens": 7877142.0,
|
|
"step": 4535
|
|
},
|
|
{
|
|
"entropy": 5.708729314804077,
|
|
"epoch": 0.35323866951954874,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.0004991453630667625,
|
|
"loss": 5.6686,
|
|
"mean_token_accuracy": 0.15797902941703795,
|
|
"num_tokens": 7885183.0,
|
|
"step": 4540
|
|
},
|
|
{
|
|
"entropy": 5.585329294204712,
|
|
"epoch": 0.3536276988912663,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.0004991429479853976,
|
|
"loss": 5.4989,
|
|
"mean_token_accuracy": 0.16130374521017074,
|
|
"num_tokens": 7893848.0,
|
|
"step": 4545
|
|
},
|
|
{
|
|
"entropy": 5.697960329055786,
|
|
"epoch": 0.35401672826298386,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0004991405295030202,
|
|
"loss": 5.6698,
|
|
"mean_token_accuracy": 0.15179314315319062,
|
|
"num_tokens": 7902438.0,
|
|
"step": 4550
|
|
},
|
|
{
|
|
"entropy": 5.731406307220459,
|
|
"epoch": 0.35440575763470145,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.0004991381076196671,
|
|
"loss": 5.6484,
|
|
"mean_token_accuracy": 0.15274685472249985,
|
|
"num_tokens": 7910951.0,
|
|
"step": 4555
|
|
},
|
|
{
|
|
"entropy": 5.7294269561767575,
|
|
"epoch": 0.354794787006419,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0004991356823353748,
|
|
"loss": 5.7549,
|
|
"mean_token_accuracy": 0.1446766048669815,
|
|
"num_tokens": 7920375.0,
|
|
"step": 4560
|
|
},
|
|
{
|
|
"entropy": 5.696258449554444,
|
|
"epoch": 0.35518381637813656,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0004991332536501804,
|
|
"loss": 5.6084,
|
|
"mean_token_accuracy": 0.159688700735569,
|
|
"num_tokens": 7928656.0,
|
|
"step": 4565
|
|
},
|
|
{
|
|
"entropy": 5.8622143268585205,
|
|
"epoch": 0.3555728457498541,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0004991308215641205,
|
|
"loss": 5.8611,
|
|
"mean_token_accuracy": 0.14252166226506233,
|
|
"num_tokens": 7936929.0,
|
|
"step": 4570
|
|
},
|
|
{
|
|
"entropy": 5.791495895385742,
|
|
"epoch": 0.3559618751215717,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0004991283860772323,
|
|
"loss": 5.6697,
|
|
"mean_token_accuracy": 0.14830510020256044,
|
|
"num_tokens": 7945592.0,
|
|
"step": 4575
|
|
},
|
|
{
|
|
"entropy": 5.7066380977630615,
|
|
"epoch": 0.35635090449328927,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.0004991259471895525,
|
|
"loss": 5.6207,
|
|
"mean_token_accuracy": 0.16197174191474914,
|
|
"num_tokens": 7953656.0,
|
|
"step": 4580
|
|
},
|
|
{
|
|
"entropy": 5.781188344955444,
|
|
"epoch": 0.3567399338650068,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.0004991235049011182,
|
|
"loss": 5.6767,
|
|
"mean_token_accuracy": 0.15540962666273117,
|
|
"num_tokens": 7962038.0,
|
|
"step": 4585
|
|
},
|
|
{
|
|
"entropy": 5.787206315994263,
|
|
"epoch": 0.3571289632367244,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0004991210592119663,
|
|
"loss": 5.7694,
|
|
"mean_token_accuracy": 0.14897529482841493,
|
|
"num_tokens": 7970338.0,
|
|
"step": 4590
|
|
},
|
|
{
|
|
"entropy": 5.7750184535980225,
|
|
"epoch": 0.3575179926084419,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0004991186101221342,
|
|
"loss": 5.6861,
|
|
"mean_token_accuracy": 0.15258906185626983,
|
|
"num_tokens": 7979173.0,
|
|
"step": 4595
|
|
},
|
|
{
|
|
"entropy": 5.662876081466675,
|
|
"epoch": 0.3579070219801595,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 0.000499116157631659,
|
|
"loss": 5.5678,
|
|
"mean_token_accuracy": 0.1568956859409809,
|
|
"num_tokens": 7987245.0,
|
|
"step": 4600
|
|
},
|
|
{
|
|
"entropy": 5.838749551773072,
|
|
"epoch": 0.3582960513518771,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 0.0004991137017405777,
|
|
"loss": 5.7822,
|
|
"mean_token_accuracy": 0.1373494178056717,
|
|
"num_tokens": 7995551.0,
|
|
"step": 4605
|
|
},
|
|
{
|
|
"entropy": 5.741954660415649,
|
|
"epoch": 0.3586850807235946,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0004991112424489277,
|
|
"loss": 5.5894,
|
|
"mean_token_accuracy": 0.1502602607011795,
|
|
"num_tokens": 8004069.0,
|
|
"step": 4610
|
|
},
|
|
{
|
|
"entropy": 5.668931388854981,
|
|
"epoch": 0.3590741100953122,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.0004991087797567462,
|
|
"loss": 5.6494,
|
|
"mean_token_accuracy": 0.15510962158441544,
|
|
"num_tokens": 8012537.0,
|
|
"step": 4615
|
|
},
|
|
{
|
|
"entropy": 5.768225383758545,
|
|
"epoch": 0.35946313946702974,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0004991063136640709,
|
|
"loss": 5.6506,
|
|
"mean_token_accuracy": 0.15651883333921432,
|
|
"num_tokens": 8021387.0,
|
|
"step": 4620
|
|
},
|
|
{
|
|
"entropy": 5.744030857086182,
|
|
"epoch": 0.3598521688387473,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.0004991038441709388,
|
|
"loss": 5.6207,
|
|
"mean_token_accuracy": 0.15271022394299508,
|
|
"num_tokens": 8030261.0,
|
|
"step": 4625
|
|
},
|
|
{
|
|
"entropy": 5.757571983337402,
|
|
"epoch": 0.3602411982104649,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0004991013712773877,
|
|
"loss": 5.6527,
|
|
"mean_token_accuracy": 0.15131479799747466,
|
|
"num_tokens": 8038161.0,
|
|
"step": 4630
|
|
},
|
|
{
|
|
"entropy": 5.704322004318238,
|
|
"epoch": 0.36063022758218244,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.0004990988949834549,
|
|
"loss": 5.7469,
|
|
"mean_token_accuracy": 0.15158456489443778,
|
|
"num_tokens": 8046340.0,
|
|
"step": 4635
|
|
},
|
|
{
|
|
"entropy": 5.742067337036133,
|
|
"epoch": 0.3610192569539,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.000499096415289178,
|
|
"loss": 5.6773,
|
|
"mean_token_accuracy": 0.15533811300992967,
|
|
"num_tokens": 8054997.0,
|
|
"step": 4640
|
|
},
|
|
{
|
|
"entropy": 5.707707309722901,
|
|
"epoch": 0.3614082863256176,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004990939321945948,
|
|
"loss": 5.6061,
|
|
"mean_token_accuracy": 0.16247581839561462,
|
|
"num_tokens": 8063686.0,
|
|
"step": 4645
|
|
},
|
|
{
|
|
"entropy": 5.7515209197998045,
|
|
"epoch": 0.36179731569733514,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0004990914456997427,
|
|
"loss": 5.7188,
|
|
"mean_token_accuracy": 0.14975331276655196,
|
|
"num_tokens": 8072999.0,
|
|
"step": 4650
|
|
},
|
|
{
|
|
"entropy": 5.686860656738281,
|
|
"epoch": 0.36218634506905273,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0004990889558046598,
|
|
"loss": 5.5856,
|
|
"mean_token_accuracy": 0.1535652443766594,
|
|
"num_tokens": 8081596.0,
|
|
"step": 4655
|
|
},
|
|
{
|
|
"entropy": 5.735697031021118,
|
|
"epoch": 0.36257537444077026,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0004990864625093836,
|
|
"loss": 5.8266,
|
|
"mean_token_accuracy": 0.14313812404870987,
|
|
"num_tokens": 8090948.0,
|
|
"step": 4660
|
|
},
|
|
{
|
|
"entropy": 5.772059965133667,
|
|
"epoch": 0.36296440381248785,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.0004990839658139519,
|
|
"loss": 5.8067,
|
|
"mean_token_accuracy": 0.14405996352434158,
|
|
"num_tokens": 8099445.0,
|
|
"step": 4665
|
|
},
|
|
{
|
|
"entropy": 5.783945560455322,
|
|
"epoch": 0.36335343318420543,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004990814657184028,
|
|
"loss": 5.6526,
|
|
"mean_token_accuracy": 0.14939153492450713,
|
|
"num_tokens": 8108119.0,
|
|
"step": 4670
|
|
},
|
|
{
|
|
"entropy": 5.717726993560791,
|
|
"epoch": 0.36374246255592296,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004990789622227741,
|
|
"loss": 5.6631,
|
|
"mean_token_accuracy": 0.15249117463827133,
|
|
"num_tokens": 8117060.0,
|
|
"step": 4675
|
|
},
|
|
{
|
|
"entropy": 5.716911125183105,
|
|
"epoch": 0.36413149192764055,
|
|
"grad_norm": 1.6875,
|
|
"learning_rate": 0.0004990764553271038,
|
|
"loss": 5.6576,
|
|
"mean_token_accuracy": 0.15026922672986984,
|
|
"num_tokens": 8126229.0,
|
|
"step": 4680
|
|
},
|
|
{
|
|
"entropy": 5.766642808914185,
|
|
"epoch": 0.3645205212993581,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0004990739450314299,
|
|
"loss": 5.6014,
|
|
"mean_token_accuracy": 0.16554867178201677,
|
|
"num_tokens": 8134694.0,
|
|
"step": 4685
|
|
},
|
|
{
|
|
"entropy": 5.680392742156982,
|
|
"epoch": 0.36490955067107567,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0004990714313357906,
|
|
"loss": 5.6781,
|
|
"mean_token_accuracy": 0.1550322487950325,
|
|
"num_tokens": 8143329.0,
|
|
"step": 4690
|
|
},
|
|
{
|
|
"entropy": 5.740098524093628,
|
|
"epoch": 0.36529858004279325,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.000499068914240224,
|
|
"loss": 5.6661,
|
|
"mean_token_accuracy": 0.1539440505206585,
|
|
"num_tokens": 8151432.0,
|
|
"step": 4695
|
|
},
|
|
{
|
|
"entropy": 5.751394510269165,
|
|
"epoch": 0.3656876094145108,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0004990663937447682,
|
|
"loss": 5.6257,
|
|
"mean_token_accuracy": 0.14900294989347457,
|
|
"num_tokens": 8159677.0,
|
|
"step": 4700
|
|
},
|
|
{
|
|
"entropy": 5.672762489318847,
|
|
"epoch": 0.36607663878622837,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0004990638698494615,
|
|
"loss": 5.7057,
|
|
"mean_token_accuracy": 0.15114860534667968,
|
|
"num_tokens": 8168710.0,
|
|
"step": 4705
|
|
},
|
|
{
|
|
"entropy": 5.734380531311035,
|
|
"epoch": 0.3664656681579459,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004990613425543423,
|
|
"loss": 5.6783,
|
|
"mean_token_accuracy": 0.15022775977849961,
|
|
"num_tokens": 8177501.0,
|
|
"step": 4710
|
|
},
|
|
{
|
|
"entropy": 5.835424184799194,
|
|
"epoch": 0.3668546975296635,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0004990588118594487,
|
|
"loss": 5.7708,
|
|
"mean_token_accuracy": 0.14951381012797355,
|
|
"num_tokens": 8185791.0,
|
|
"step": 4715
|
|
},
|
|
{
|
|
"entropy": 5.801257944107055,
|
|
"epoch": 0.3672437269013811,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.0004990562777648194,
|
|
"loss": 5.7882,
|
|
"mean_token_accuracy": 0.14626498967409135,
|
|
"num_tokens": 8195020.0,
|
|
"step": 4720
|
|
},
|
|
{
|
|
"entropy": 5.712733125686645,
|
|
"epoch": 0.3676327562730986,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0004990537402704928,
|
|
"loss": 5.652,
|
|
"mean_token_accuracy": 0.1529953584074974,
|
|
"num_tokens": 8203540.0,
|
|
"step": 4725
|
|
},
|
|
{
|
|
"entropy": 5.784476709365845,
|
|
"epoch": 0.3680217856448162,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004990511993765071,
|
|
"loss": 5.6471,
|
|
"mean_token_accuracy": 0.14924908876419068,
|
|
"num_tokens": 8211985.0,
|
|
"step": 4730
|
|
},
|
|
{
|
|
"entropy": 5.748035717010498,
|
|
"epoch": 0.3684108150165337,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0004990486550829011,
|
|
"loss": 5.7379,
|
|
"mean_token_accuracy": 0.15286693423986436,
|
|
"num_tokens": 8220289.0,
|
|
"step": 4735
|
|
},
|
|
{
|
|
"entropy": 5.825424718856811,
|
|
"epoch": 0.3687998443882513,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004990461073897134,
|
|
"loss": 5.7497,
|
|
"mean_token_accuracy": 0.14440721794962882,
|
|
"num_tokens": 8229652.0,
|
|
"step": 4740
|
|
},
|
|
{
|
|
"entropy": 5.832679271697998,
|
|
"epoch": 0.3691888737599689,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0004990435562969827,
|
|
"loss": 5.7509,
|
|
"mean_token_accuracy": 0.14374158829450606,
|
|
"num_tokens": 8237728.0,
|
|
"step": 4745
|
|
},
|
|
{
|
|
"entropy": 5.732454919815064,
|
|
"epoch": 0.3695779031316864,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0004990410018047475,
|
|
"loss": 5.6361,
|
|
"mean_token_accuracy": 0.15370055437088012,
|
|
"num_tokens": 8246393.0,
|
|
"step": 4750
|
|
},
|
|
{
|
|
"entropy": 5.723031377792358,
|
|
"epoch": 0.369966932503404,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004990384439130467,
|
|
"loss": 5.6098,
|
|
"mean_token_accuracy": 0.1546899065375328,
|
|
"num_tokens": 8256736.0,
|
|
"step": 4755
|
|
},
|
|
{
|
|
"entropy": 5.770855712890625,
|
|
"epoch": 0.3703559618751216,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004990358826219192,
|
|
"loss": 5.6885,
|
|
"mean_token_accuracy": 0.15330916792154312,
|
|
"num_tokens": 8265126.0,
|
|
"step": 4760
|
|
},
|
|
{
|
|
"entropy": 5.6247711181640625,
|
|
"epoch": 0.37074499124683913,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0004990333179314038,
|
|
"loss": 5.5857,
|
|
"mean_token_accuracy": 0.1569363385438919,
|
|
"num_tokens": 8273136.0,
|
|
"step": 4765
|
|
},
|
|
{
|
|
"entropy": 5.641842555999756,
|
|
"epoch": 0.3711340206185567,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0004990307498415393,
|
|
"loss": 5.5334,
|
|
"mean_token_accuracy": 0.15607051327824592,
|
|
"num_tokens": 8281697.0,
|
|
"step": 4770
|
|
},
|
|
{
|
|
"entropy": 5.676371383666992,
|
|
"epoch": 0.37152304999027425,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0004990281783523648,
|
|
"loss": 5.6734,
|
|
"mean_token_accuracy": 0.15302693992853164,
|
|
"num_tokens": 8290765.0,
|
|
"step": 4775
|
|
},
|
|
{
|
|
"entropy": 5.817877292633057,
|
|
"epoch": 0.37191207936199183,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0004990256034639192,
|
|
"loss": 5.7627,
|
|
"mean_token_accuracy": 0.14589882269501686,
|
|
"num_tokens": 8299875.0,
|
|
"step": 4780
|
|
},
|
|
{
|
|
"entropy": 5.781397914886474,
|
|
"epoch": 0.3723011087337094,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.0004990230251762418,
|
|
"loss": 5.6234,
|
|
"mean_token_accuracy": 0.15602398663759232,
|
|
"num_tokens": 8308515.0,
|
|
"step": 4785
|
|
},
|
|
{
|
|
"entropy": 5.635280561447144,
|
|
"epoch": 0.37269013810542695,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004990204434893713,
|
|
"loss": 5.5632,
|
|
"mean_token_accuracy": 0.16311416923999786,
|
|
"num_tokens": 8317260.0,
|
|
"step": 4790
|
|
},
|
|
{
|
|
"entropy": 5.789914894104004,
|
|
"epoch": 0.37307916747714454,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004990178584033474,
|
|
"loss": 5.7111,
|
|
"mean_token_accuracy": 0.14300042688846587,
|
|
"num_tokens": 8325887.0,
|
|
"step": 4795
|
|
},
|
|
{
|
|
"entropy": 5.82746148109436,
|
|
"epoch": 0.37346819684886207,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0004990152699182089,
|
|
"loss": 5.7261,
|
|
"mean_token_accuracy": 0.13842646032571793,
|
|
"num_tokens": 8333974.0,
|
|
"step": 4800
|
|
},
|
|
{
|
|
"entropy": 5.683282423019409,
|
|
"epoch": 0.37385722622057965,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.0004990126780339953,
|
|
"loss": 5.6969,
|
|
"mean_token_accuracy": 0.1456607311964035,
|
|
"num_tokens": 8343199.0,
|
|
"step": 4805
|
|
},
|
|
{
|
|
"entropy": 5.660903835296631,
|
|
"epoch": 0.37424625559229724,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0004990100827507459,
|
|
"loss": 5.4878,
|
|
"mean_token_accuracy": 0.15968211442232133,
|
|
"num_tokens": 8351202.0,
|
|
"step": 4810
|
|
},
|
|
{
|
|
"entropy": 5.794419288635254,
|
|
"epoch": 0.37463528496401477,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004990074840684999,
|
|
"loss": 5.8265,
|
|
"mean_token_accuracy": 0.14525216594338416,
|
|
"num_tokens": 8360011.0,
|
|
"step": 4815
|
|
},
|
|
{
|
|
"entropy": 5.72889552116394,
|
|
"epoch": 0.37502431433573236,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0004990048819872969,
|
|
"loss": 5.6967,
|
|
"mean_token_accuracy": 0.15121547728776932,
|
|
"num_tokens": 8367874.0,
|
|
"step": 4820
|
|
},
|
|
{
|
|
"entropy": 5.736692285537719,
|
|
"epoch": 0.3754133437074499,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0004990022765071765,
|
|
"loss": 5.6471,
|
|
"mean_token_accuracy": 0.15181145966053008,
|
|
"num_tokens": 8376708.0,
|
|
"step": 4825
|
|
},
|
|
{
|
|
"entropy": 5.776809597015381,
|
|
"epoch": 0.3758023730791675,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.000498999667628178,
|
|
"loss": 5.6923,
|
|
"mean_token_accuracy": 0.15238475576043128,
|
|
"num_tokens": 8385467.0,
|
|
"step": 4830
|
|
},
|
|
{
|
|
"entropy": 5.693451023101806,
|
|
"epoch": 0.37619140245088506,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0004989970553503411,
|
|
"loss": 5.6671,
|
|
"mean_token_accuracy": 0.15169030725955962,
|
|
"num_tokens": 8393574.0,
|
|
"step": 4835
|
|
},
|
|
{
|
|
"entropy": 5.698660659790039,
|
|
"epoch": 0.3765804318226026,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004989944396737054,
|
|
"loss": 5.7057,
|
|
"mean_token_accuracy": 0.15399083346128464,
|
|
"num_tokens": 8402857.0,
|
|
"step": 4840
|
|
},
|
|
{
|
|
"entropy": 5.71474986076355,
|
|
"epoch": 0.3769694611943202,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0004989918205983106,
|
|
"loss": 5.6966,
|
|
"mean_token_accuracy": 0.16057430803775788,
|
|
"num_tokens": 8411728.0,
|
|
"step": 4845
|
|
},
|
|
{
|
|
"entropy": 5.776951026916504,
|
|
"epoch": 0.37735849056603776,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0004989891981241964,
|
|
"loss": 5.6816,
|
|
"mean_token_accuracy": 0.15508509129285813,
|
|
"num_tokens": 8420307.0,
|
|
"step": 4850
|
|
},
|
|
{
|
|
"entropy": 5.795963382720947,
|
|
"epoch": 0.3777475199377553,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0004989865722514027,
|
|
"loss": 5.6859,
|
|
"mean_token_accuracy": 0.14701005667448044,
|
|
"num_tokens": 8429442.0,
|
|
"step": 4855
|
|
},
|
|
{
|
|
"entropy": 5.692721891403198,
|
|
"epoch": 0.3781365493094729,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004989839429799692,
|
|
"loss": 5.5925,
|
|
"mean_token_accuracy": 0.15444754511117936,
|
|
"num_tokens": 8437945.0,
|
|
"step": 4860
|
|
},
|
|
{
|
|
"entropy": 5.69090576171875,
|
|
"epoch": 0.3785255786811904,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.000498981310309936,
|
|
"loss": 5.5799,
|
|
"mean_token_accuracy": 0.1519486203789711,
|
|
"num_tokens": 8445743.0,
|
|
"step": 4865
|
|
},
|
|
{
|
|
"entropy": 5.673541116714477,
|
|
"epoch": 0.378914608052908,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0004989786742413428,
|
|
"loss": 5.6679,
|
|
"mean_token_accuracy": 0.14914161562919617,
|
|
"num_tokens": 8454091.0,
|
|
"step": 4870
|
|
},
|
|
{
|
|
"entropy": 5.828792095184326,
|
|
"epoch": 0.3793036374246256,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004989760347742298,
|
|
"loss": 5.6642,
|
|
"mean_token_accuracy": 0.148113676905632,
|
|
"num_tokens": 8461992.0,
|
|
"step": 4875
|
|
},
|
|
{
|
|
"entropy": 5.695930051803589,
|
|
"epoch": 0.3796926667963431,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004989733919086369,
|
|
"loss": 5.608,
|
|
"mean_token_accuracy": 0.1540228471159935,
|
|
"num_tokens": 8470730.0,
|
|
"step": 4880
|
|
},
|
|
{
|
|
"entropy": 5.694664525985718,
|
|
"epoch": 0.3800816961680607,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0004989707456446043,
|
|
"loss": 5.6546,
|
|
"mean_token_accuracy": 0.15131904631853105,
|
|
"num_tokens": 8479947.0,
|
|
"step": 4885
|
|
},
|
|
{
|
|
"entropy": 5.857856941223145,
|
|
"epoch": 0.38047072553977823,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0004989680959821721,
|
|
"loss": 5.7356,
|
|
"mean_token_accuracy": 0.15022482126951217,
|
|
"num_tokens": 8488237.0,
|
|
"step": 4890
|
|
},
|
|
{
|
|
"entropy": 5.756908416748047,
|
|
"epoch": 0.3808597549114958,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004989654429213805,
|
|
"loss": 5.5988,
|
|
"mean_token_accuracy": 0.15564934015274048,
|
|
"num_tokens": 8497146.0,
|
|
"step": 4895
|
|
},
|
|
{
|
|
"entropy": 5.723071098327637,
|
|
"epoch": 0.3812487842832134,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004989627864622699,
|
|
"loss": 5.6833,
|
|
"mean_token_accuracy": 0.15712068229913712,
|
|
"num_tokens": 8505736.0,
|
|
"step": 4900
|
|
},
|
|
{
|
|
"entropy": 5.77219820022583,
|
|
"epoch": 0.38163781365493094,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0004989601266048804,
|
|
"loss": 5.6944,
|
|
"mean_token_accuracy": 0.15084800571203233,
|
|
"num_tokens": 8515368.0,
|
|
"step": 4905
|
|
},
|
|
{
|
|
"entropy": 5.703309774398804,
|
|
"epoch": 0.3820268430266485,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0004989574633492525,
|
|
"loss": 5.6671,
|
|
"mean_token_accuracy": 0.15129629224538804,
|
|
"num_tokens": 8524141.0,
|
|
"step": 4910
|
|
},
|
|
{
|
|
"entropy": 5.736749649047852,
|
|
"epoch": 0.38241587239836605,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0004989547966954266,
|
|
"loss": 5.5902,
|
|
"mean_token_accuracy": 0.15632274895906448,
|
|
"num_tokens": 8533116.0,
|
|
"step": 4915
|
|
},
|
|
{
|
|
"entropy": 5.701038837432861,
|
|
"epoch": 0.38280490177008364,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.000498952126643443,
|
|
"loss": 5.7171,
|
|
"mean_token_accuracy": 0.1558266080915928,
|
|
"num_tokens": 8541919.0,
|
|
"step": 4920
|
|
},
|
|
{
|
|
"entropy": 5.668884658813477,
|
|
"epoch": 0.3831939311418012,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0004989494531933424,
|
|
"loss": 5.6009,
|
|
"mean_token_accuracy": 0.15845879167318344,
|
|
"num_tokens": 8550372.0,
|
|
"step": 4925
|
|
},
|
|
{
|
|
"entropy": 5.705226564407349,
|
|
"epoch": 0.38358296051351876,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0004989467763451652,
|
|
"loss": 5.6912,
|
|
"mean_token_accuracy": 0.15215400755405425,
|
|
"num_tokens": 8559246.0,
|
|
"step": 4930
|
|
},
|
|
{
|
|
"entropy": 5.691767168045044,
|
|
"epoch": 0.38397198988523634,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.0004989440960989523,
|
|
"loss": 5.4685,
|
|
"mean_token_accuracy": 0.16003949642181398,
|
|
"num_tokens": 8567005.0,
|
|
"step": 4935
|
|
},
|
|
{
|
|
"entropy": 5.635836219787597,
|
|
"epoch": 0.3843610192569539,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.000498941412454744,
|
|
"loss": 5.6521,
|
|
"mean_token_accuracy": 0.1453227147459984,
|
|
"num_tokens": 8575399.0,
|
|
"step": 4940
|
|
},
|
|
{
|
|
"entropy": 5.811139011383057,
|
|
"epoch": 0.38475004862867146,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0004989387254125813,
|
|
"loss": 5.7291,
|
|
"mean_token_accuracy": 0.14650810956954957,
|
|
"num_tokens": 8583994.0,
|
|
"step": 4945
|
|
},
|
|
{
|
|
"entropy": 5.760225105285644,
|
|
"epoch": 0.38513907800038905,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0004989360349725049,
|
|
"loss": 5.6496,
|
|
"mean_token_accuracy": 0.15658905506134033,
|
|
"num_tokens": 8593446.0,
|
|
"step": 4950
|
|
},
|
|
{
|
|
"entropy": 5.70222282409668,
|
|
"epoch": 0.3855281073721066,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0004989333411345555,
|
|
"loss": 5.6596,
|
|
"mean_token_accuracy": 0.15538214892148972,
|
|
"num_tokens": 8602821.0,
|
|
"step": 4955
|
|
},
|
|
{
|
|
"entropy": 5.706765222549438,
|
|
"epoch": 0.38591713674382416,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0004989306438987742,
|
|
"loss": 5.7363,
|
|
"mean_token_accuracy": 0.15210612267255783,
|
|
"num_tokens": 8611831.0,
|
|
"step": 4960
|
|
},
|
|
{
|
|
"entropy": 5.772955226898193,
|
|
"epoch": 0.38630616611554175,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.0004989279432652018,
|
|
"loss": 5.6422,
|
|
"mean_token_accuracy": 0.1529601663351059,
|
|
"num_tokens": 8620986.0,
|
|
"step": 4965
|
|
},
|
|
{
|
|
"entropy": 5.727062749862671,
|
|
"epoch": 0.3866951954872593,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0004989252392338791,
|
|
"loss": 5.5982,
|
|
"mean_token_accuracy": 0.15300055742263793,
|
|
"num_tokens": 8629822.0,
|
|
"step": 4970
|
|
},
|
|
{
|
|
"entropy": 5.673508405685425,
|
|
"epoch": 0.38708422485897687,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0004989225318048475,
|
|
"loss": 5.6862,
|
|
"mean_token_accuracy": 0.1478674292564392,
|
|
"num_tokens": 8637679.0,
|
|
"step": 4975
|
|
},
|
|
{
|
|
"entropy": 5.793036079406738,
|
|
"epoch": 0.3874732542306944,
|
|
"grad_norm": 1.609375,
|
|
"learning_rate": 0.0004989198209781478,
|
|
"loss": 5.721,
|
|
"mean_token_accuracy": 0.14822040498256683,
|
|
"num_tokens": 8646705.0,
|
|
"step": 4980
|
|
},
|
|
{
|
|
"entropy": 5.799608898162842,
|
|
"epoch": 0.387862283602412,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0004989171067538211,
|
|
"loss": 5.6281,
|
|
"mean_token_accuracy": 0.15128099098801612,
|
|
"num_tokens": 8655599.0,
|
|
"step": 4985
|
|
},
|
|
{
|
|
"entropy": 5.635348701477051,
|
|
"epoch": 0.38825131297412957,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.000498914389131909,
|
|
"loss": 5.6514,
|
|
"mean_token_accuracy": 0.15804774016141893,
|
|
"num_tokens": 8665025.0,
|
|
"step": 4990
|
|
},
|
|
{
|
|
"entropy": 5.719934034347534,
|
|
"epoch": 0.3886403423458471,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.0004989116681124523,
|
|
"loss": 5.5337,
|
|
"mean_token_accuracy": 0.15749720931053163,
|
|
"num_tokens": 8672994.0,
|
|
"step": 4995
|
|
},
|
|
{
|
|
"entropy": 5.669281339645385,
|
|
"epoch": 0.3890293717175647,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0004989089436954924,
|
|
"loss": 5.6883,
|
|
"mean_token_accuracy": 0.15234919488430024,
|
|
"num_tokens": 8682457.0,
|
|
"step": 5000
|
|
},
|
|
{
|
|
"entropy": 5.705449628829956,
|
|
"epoch": 0.3894184010892822,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0004989062158810706,
|
|
"loss": 5.662,
|
|
"mean_token_accuracy": 0.15314388871192933,
|
|
"num_tokens": 8690888.0,
|
|
"step": 5005
|
|
},
|
|
{
|
|
"entropy": 5.873299598693848,
|
|
"epoch": 0.3898074304609998,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0004989034846692284,
|
|
"loss": 5.7437,
|
|
"mean_token_accuracy": 0.15064525082707406,
|
|
"num_tokens": 8699632.0,
|
|
"step": 5010
|
|
},
|
|
{
|
|
"entropy": 5.6710282325744625,
|
|
"epoch": 0.3901964598327174,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0004989007500600073,
|
|
"loss": 5.5879,
|
|
"mean_token_accuracy": 0.1571871817111969,
|
|
"num_tokens": 8707955.0,
|
|
"step": 5015
|
|
},
|
|
{
|
|
"entropy": 5.7133081436157225,
|
|
"epoch": 0.3905854892044349,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.0004988980120534486,
|
|
"loss": 5.737,
|
|
"mean_token_accuracy": 0.15538298040628434,
|
|
"num_tokens": 8716103.0,
|
|
"step": 5020
|
|
},
|
|
{
|
|
"entropy": 5.751881408691406,
|
|
"epoch": 0.3909745185761525,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.000498895270649594,
|
|
"loss": 5.5882,
|
|
"mean_token_accuracy": 0.16275588870048524,
|
|
"num_tokens": 8724499.0,
|
|
"step": 5025
|
|
},
|
|
{
|
|
"entropy": 5.674628114700317,
|
|
"epoch": 0.39136354794787004,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.000498892525848485,
|
|
"loss": 5.6015,
|
|
"mean_token_accuracy": 0.15894443094730376,
|
|
"num_tokens": 8732829.0,
|
|
"step": 5030
|
|
},
|
|
{
|
|
"entropy": 5.611494064331055,
|
|
"epoch": 0.3917525773195876,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0004988897776501633,
|
|
"loss": 5.465,
|
|
"mean_token_accuracy": 0.15986961871385574,
|
|
"num_tokens": 8741617.0,
|
|
"step": 5035
|
|
},
|
|
{
|
|
"entropy": 5.659196472167968,
|
|
"epoch": 0.3921416066913052,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004988870260546705,
|
|
"loss": 5.467,
|
|
"mean_token_accuracy": 0.16652076989412307,
|
|
"num_tokens": 8750146.0,
|
|
"step": 5040
|
|
},
|
|
{
|
|
"entropy": 5.657342576980591,
|
|
"epoch": 0.39253063606302274,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0004988842710620486,
|
|
"loss": 5.6448,
|
|
"mean_token_accuracy": 0.15352269858121873,
|
|
"num_tokens": 8758744.0,
|
|
"step": 5045
|
|
},
|
|
{
|
|
"entropy": 5.6410760402679445,
|
|
"epoch": 0.39291966543474033,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004988815126723391,
|
|
"loss": 5.6622,
|
|
"mean_token_accuracy": 0.15248211920261384,
|
|
"num_tokens": 8768219.0,
|
|
"step": 5050
|
|
},
|
|
{
|
|
"entropy": 5.785637426376343,
|
|
"epoch": 0.3933086948064579,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0004988787508855841,
|
|
"loss": 5.6576,
|
|
"mean_token_accuracy": 0.1519287884235382,
|
|
"num_tokens": 8777047.0,
|
|
"step": 5055
|
|
},
|
|
{
|
|
"entropy": 5.642466020584107,
|
|
"epoch": 0.39369772417817545,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0004988759857018253,
|
|
"loss": 5.5433,
|
|
"mean_token_accuracy": 0.15469427406787872,
|
|
"num_tokens": 8785918.0,
|
|
"step": 5060
|
|
},
|
|
{
|
|
"entropy": 5.631013011932373,
|
|
"epoch": 0.39408675354989303,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.0004988732171211048,
|
|
"loss": 5.6233,
|
|
"mean_token_accuracy": 0.14678166359663009,
|
|
"num_tokens": 8794253.0,
|
|
"step": 5065
|
|
},
|
|
{
|
|
"entropy": 5.76476469039917,
|
|
"epoch": 0.39447578292161056,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0004988704451434644,
|
|
"loss": 5.6719,
|
|
"mean_token_accuracy": 0.16016739159822463,
|
|
"num_tokens": 8802352.0,
|
|
"step": 5070
|
|
},
|
|
{
|
|
"entropy": 5.78267993927002,
|
|
"epoch": 0.39486481229332815,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.0004988676697689465,
|
|
"loss": 5.6242,
|
|
"mean_token_accuracy": 0.15009063333272935,
|
|
"num_tokens": 8810956.0,
|
|
"step": 5075
|
|
},
|
|
{
|
|
"entropy": 5.654299974441528,
|
|
"epoch": 0.39525384166504574,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.000498864890997593,
|
|
"loss": 5.5622,
|
|
"mean_token_accuracy": 0.1525967687368393,
|
|
"num_tokens": 8819062.0,
|
|
"step": 5080
|
|
},
|
|
{
|
|
"entropy": 5.7077337265014645,
|
|
"epoch": 0.39564287103676327,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.0004988621088294461,
|
|
"loss": 5.6572,
|
|
"mean_token_accuracy": 0.1502836376428604,
|
|
"num_tokens": 8827470.0,
|
|
"step": 5085
|
|
},
|
|
{
|
|
"entropy": 5.721915864944458,
|
|
"epoch": 0.39603190040848085,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.000498859323264548,
|
|
"loss": 5.6916,
|
|
"mean_token_accuracy": 0.15031601786613463,
|
|
"num_tokens": 8837003.0,
|
|
"step": 5090
|
|
},
|
|
{
|
|
"entropy": 5.713486862182617,
|
|
"epoch": 0.3964209297801984,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.000498856534302941,
|
|
"loss": 5.697,
|
|
"mean_token_accuracy": 0.14879803881049156,
|
|
"num_tokens": 8846605.0,
|
|
"step": 5095
|
|
},
|
|
{
|
|
"entropy": 5.79709038734436,
|
|
"epoch": 0.39680995915191597,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.0004988537419446673,
|
|
"loss": 5.7335,
|
|
"mean_token_accuracy": 0.14815959110856056,
|
|
"num_tokens": 8855232.0,
|
|
"step": 5100
|
|
},
|
|
{
|
|
"entropy": 5.755407381057739,
|
|
"epoch": 0.39719898852363356,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0004988509461897694,
|
|
"loss": 5.6102,
|
|
"mean_token_accuracy": 0.16033030301332474,
|
|
"num_tokens": 8864176.0,
|
|
"step": 5105
|
|
},
|
|
{
|
|
"entropy": 5.733327960968017,
|
|
"epoch": 0.3975880178953511,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0004988481470382897,
|
|
"loss": 5.6897,
|
|
"mean_token_accuracy": 0.156675386428833,
|
|
"num_tokens": 8872671.0,
|
|
"step": 5110
|
|
},
|
|
{
|
|
"entropy": 5.610649251937867,
|
|
"epoch": 0.3979770472670687,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0004988453444902708,
|
|
"loss": 5.6034,
|
|
"mean_token_accuracy": 0.1590520143508911,
|
|
"num_tokens": 8881316.0,
|
|
"step": 5115
|
|
},
|
|
{
|
|
"entropy": 5.760883426666259,
|
|
"epoch": 0.3983660766387862,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.0004988425385457549,
|
|
"loss": 5.719,
|
|
"mean_token_accuracy": 0.15436383709311485,
|
|
"num_tokens": 8890114.0,
|
|
"step": 5120
|
|
},
|
|
{
|
|
"entropy": 5.7600020408630375,
|
|
"epoch": 0.3987551060105038,
|
|
"grad_norm": 1.6171875,
|
|
"learning_rate": 0.0004988397292047848,
|
|
"loss": 5.6282,
|
|
"mean_token_accuracy": 0.15803250372409822,
|
|
"num_tokens": 8899598.0,
|
|
"step": 5125
|
|
},
|
|
{
|
|
"entropy": 5.609093189239502,
|
|
"epoch": 0.3991441353822214,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.0004988369164674032,
|
|
"loss": 5.5068,
|
|
"mean_token_accuracy": 0.15966605246067048,
|
|
"num_tokens": 8908244.0,
|
|
"step": 5130
|
|
},
|
|
{
|
|
"entropy": 5.688562393188477,
|
|
"epoch": 0.3995331647539389,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0004988341003336526,
|
|
"loss": 5.5515,
|
|
"mean_token_accuracy": 0.1559025228023529,
|
|
"num_tokens": 8916280.0,
|
|
"step": 5135
|
|
},
|
|
{
|
|
"entropy": 5.735493183135986,
|
|
"epoch": 0.3999221941256565,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.0004988312808035757,
|
|
"loss": 5.5901,
|
|
"mean_token_accuracy": 0.15177929475903512,
|
|
"num_tokens": 8923947.0,
|
|
"step": 5140
|
|
},
|
|
{
|
|
"entropy": 5.653040266036987,
|
|
"epoch": 0.400311223497374,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.0004988284578772155,
|
|
"loss": 5.6619,
|
|
"mean_token_accuracy": 0.14781947880983354,
|
|
"num_tokens": 8933374.0,
|
|
"step": 5145
|
|
},
|
|
{
|
|
"entropy": 5.672594928741455,
|
|
"epoch": 0.4007002528690916,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0004988256315546146,
|
|
"loss": 5.5607,
|
|
"mean_token_accuracy": 0.15781172960996628,
|
|
"num_tokens": 8941757.0,
|
|
"step": 5150
|
|
},
|
|
{
|
|
"entropy": 5.663328552246094,
|
|
"epoch": 0.4010892822408092,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0004988228018358161,
|
|
"loss": 5.4872,
|
|
"mean_token_accuracy": 0.15782520771026612,
|
|
"num_tokens": 8950128.0,
|
|
"step": 5155
|
|
},
|
|
{
|
|
"entropy": 5.73198447227478,
|
|
"epoch": 0.40147831161252673,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.0004988199687208628,
|
|
"loss": 5.6454,
|
|
"mean_token_accuracy": 0.14845688492059708,
|
|
"num_tokens": 8958939.0,
|
|
"step": 5160
|
|
},
|
|
{
|
|
"entropy": 5.774505949020385,
|
|
"epoch": 0.4018673409842443,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004988171322097977,
|
|
"loss": 5.604,
|
|
"mean_token_accuracy": 0.15679994523525237,
|
|
"num_tokens": 8967519.0,
|
|
"step": 5165
|
|
},
|
|
{
|
|
"entropy": 5.595438528060913,
|
|
"epoch": 0.4022563703559619,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0004988142923026638,
|
|
"loss": 5.4646,
|
|
"mean_token_accuracy": 0.1620745465159416,
|
|
"num_tokens": 8976215.0,
|
|
"step": 5170
|
|
},
|
|
{
|
|
"entropy": 5.698001861572266,
|
|
"epoch": 0.40264539972767943,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.0004988114489995044,
|
|
"loss": 5.7052,
|
|
"mean_token_accuracy": 0.14649326354265213,
|
|
"num_tokens": 8984060.0,
|
|
"step": 5175
|
|
},
|
|
{
|
|
"entropy": 5.712637948989868,
|
|
"epoch": 0.403034429099397,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0004988086023003624,
|
|
"loss": 5.6301,
|
|
"mean_token_accuracy": 0.15002061128616334,
|
|
"num_tokens": 8992301.0,
|
|
"step": 5180
|
|
},
|
|
{
|
|
"entropy": 5.742618560791016,
|
|
"epoch": 0.40342345847111455,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 0.0004988057522052811,
|
|
"loss": 5.6659,
|
|
"mean_token_accuracy": 0.15351343005895615,
|
|
"num_tokens": 9000517.0,
|
|
"step": 5185
|
|
},
|
|
{
|
|
"entropy": 5.68753137588501,
|
|
"epoch": 0.40381248784283214,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.0004988028987143037,
|
|
"loss": 5.6106,
|
|
"mean_token_accuracy": 0.15389739722013474,
|
|
"num_tokens": 9008826.0,
|
|
"step": 5190
|
|
},
|
|
{
|
|
"entropy": 5.725468111038208,
|
|
"epoch": 0.4042015172145497,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0004988000418274736,
|
|
"loss": 5.6164,
|
|
"mean_token_accuracy": 0.14825106114149095,
|
|
"num_tokens": 9017952.0,
|
|
"step": 5195
|
|
},
|
|
{
|
|
"entropy": 5.672607660293579,
|
|
"epoch": 0.40459054658626725,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0004987971815448341,
|
|
"loss": 5.6115,
|
|
"mean_token_accuracy": 0.15911526530981063,
|
|
"num_tokens": 9026688.0,
|
|
"step": 5200
|
|
},
|
|
{
|
|
"entropy": 5.678609228134155,
|
|
"epoch": 0.40497957595798484,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.0004987943178664285,
|
|
"loss": 5.5947,
|
|
"mean_token_accuracy": 0.1578623317182064,
|
|
"num_tokens": 9035761.0,
|
|
"step": 5205
|
|
},
|
|
{
|
|
"entropy": 5.737362957000732,
|
|
"epoch": 0.40536860532970237,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0004987914507923004,
|
|
"loss": 5.7061,
|
|
"mean_token_accuracy": 0.1476090058684349,
|
|
"num_tokens": 9044510.0,
|
|
"step": 5210
|
|
},
|
|
{
|
|
"entropy": 5.624804878234864,
|
|
"epoch": 0.40575763470141996,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0004987885803224931,
|
|
"loss": 5.5507,
|
|
"mean_token_accuracy": 0.1544179081916809,
|
|
"num_tokens": 9053031.0,
|
|
"step": 5215
|
|
},
|
|
{
|
|
"entropy": 5.6066936492919925,
|
|
"epoch": 0.40614666407313754,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.0004987857064570505,
|
|
"loss": 5.5451,
|
|
"mean_token_accuracy": 0.16021619886159896,
|
|
"num_tokens": 9061580.0,
|
|
"step": 5220
|
|
},
|
|
{
|
|
"entropy": 5.718929815292358,
|
|
"epoch": 0.4065356934448551,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0004987828291960158,
|
|
"loss": 5.6634,
|
|
"mean_token_accuracy": 0.1563795655965805,
|
|
"num_tokens": 9069741.0,
|
|
"step": 5225
|
|
},
|
|
{
|
|
"entropy": 5.811468648910522,
|
|
"epoch": 0.40692472281657266,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.000498779948539433,
|
|
"loss": 5.6813,
|
|
"mean_token_accuracy": 0.143922408670187,
|
|
"num_tokens": 9079214.0,
|
|
"step": 5230
|
|
},
|
|
{
|
|
"entropy": 5.773811149597168,
|
|
"epoch": 0.4073137521882902,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004987770644873455,
|
|
"loss": 5.6583,
|
|
"mean_token_accuracy": 0.15696950107812882,
|
|
"num_tokens": 9088201.0,
|
|
"step": 5235
|
|
},
|
|
{
|
|
"entropy": 5.716661548614502,
|
|
"epoch": 0.4077027815600078,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.0004987741770397974,
|
|
"loss": 5.6668,
|
|
"mean_token_accuracy": 0.14920853078365326,
|
|
"num_tokens": 9096829.0,
|
|
"step": 5240
|
|
},
|
|
{
|
|
"entropy": 5.703339910507202,
|
|
"epoch": 0.40809181093172536,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.0004987712861968323,
|
|
"loss": 5.6269,
|
|
"mean_token_accuracy": 0.15427666306495666,
|
|
"num_tokens": 9105515.0,
|
|
"step": 5245
|
|
},
|
|
{
|
|
"entropy": 5.777084398269653,
|
|
"epoch": 0.4084808403034429,
|
|
"grad_norm": 1.4921875,
|
|
"learning_rate": 0.000498768391958494,
|
|
"loss": 5.6073,
|
|
"mean_token_accuracy": 0.15668865889310837,
|
|
"num_tokens": 9113614.0,
|
|
"step": 5250
|
|
},
|
|
{
|
|
"entropy": 5.712219905853272,
|
|
"epoch": 0.4088698696751605,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0004987654943248266,
|
|
"loss": 5.697,
|
|
"mean_token_accuracy": 0.14341746270656586,
|
|
"num_tokens": 9122337.0,
|
|
"step": 5255
|
|
},
|
|
{
|
|
"entropy": 5.630028343200683,
|
|
"epoch": 0.40925889904687807,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.0004987625932958739,
|
|
"loss": 5.5779,
|
|
"mean_token_accuracy": 0.15674022287130357,
|
|
"num_tokens": 9130417.0,
|
|
"step": 5260
|
|
},
|
|
{
|
|
"entropy": 5.7025354385375975,
|
|
"epoch": 0.4096479284185956,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004987596888716801,
|
|
"loss": 5.6483,
|
|
"mean_token_accuracy": 0.14859899282455444,
|
|
"num_tokens": 9139317.0,
|
|
"step": 5265
|
|
},
|
|
{
|
|
"entropy": 5.726134777069092,
|
|
"epoch": 0.4100369577903132,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0004987567810522892,
|
|
"loss": 5.626,
|
|
"mean_token_accuracy": 0.15348759293556213,
|
|
"num_tokens": 9147808.0,
|
|
"step": 5270
|
|
},
|
|
{
|
|
"entropy": 5.818262100219727,
|
|
"epoch": 0.4104259871620307,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004987538698377451,
|
|
"loss": 5.7377,
|
|
"mean_token_accuracy": 0.14077338203787804,
|
|
"num_tokens": 9157117.0,
|
|
"step": 5275
|
|
},
|
|
{
|
|
"entropy": 5.736328840255737,
|
|
"epoch": 0.4108150165337483,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0004987509552280924,
|
|
"loss": 5.573,
|
|
"mean_token_accuracy": 0.15244077891111374,
|
|
"num_tokens": 9165297.0,
|
|
"step": 5280
|
|
},
|
|
{
|
|
"entropy": 5.708140563964844,
|
|
"epoch": 0.4112040459054659,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.000498748037223375,
|
|
"loss": 5.7137,
|
|
"mean_token_accuracy": 0.151723912358284,
|
|
"num_tokens": 9172945.0,
|
|
"step": 5285
|
|
},
|
|
{
|
|
"entropy": 5.745821762084961,
|
|
"epoch": 0.4115930752771834,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.0004987451158236372,
|
|
"loss": 5.6428,
|
|
"mean_token_accuracy": 0.15701709389686586,
|
|
"num_tokens": 9181445.0,
|
|
"step": 5290
|
|
},
|
|
{
|
|
"entropy": 5.605129194259644,
|
|
"epoch": 0.411982104648901,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.0004987421910289234,
|
|
"loss": 5.4712,
|
|
"mean_token_accuracy": 0.1588175266981125,
|
|
"num_tokens": 9189535.0,
|
|
"step": 5295
|
|
},
|
|
{
|
|
"entropy": 5.649341869354248,
|
|
"epoch": 0.41237113402061853,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0004987392628392781,
|
|
"loss": 5.6881,
|
|
"mean_token_accuracy": 0.15033083707094191,
|
|
"num_tokens": 9198328.0,
|
|
"step": 5300
|
|
},
|
|
{
|
|
"entropy": 5.740281772613526,
|
|
"epoch": 0.4127601633923361,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.0004987363312547456,
|
|
"loss": 5.6035,
|
|
"mean_token_accuracy": 0.1550357922911644,
|
|
"num_tokens": 9206840.0,
|
|
"step": 5305
|
|
},
|
|
{
|
|
"entropy": 5.686477708816528,
|
|
"epoch": 0.4131491927640537,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.0004987333962753703,
|
|
"loss": 5.5073,
|
|
"mean_token_accuracy": 0.1557457096874714,
|
|
"num_tokens": 9215155.0,
|
|
"step": 5310
|
|
},
|
|
{
|
|
"entropy": 5.689324522018433,
|
|
"epoch": 0.41353822213577124,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0004987304579011967,
|
|
"loss": 5.6741,
|
|
"mean_token_accuracy": 0.1526474580168724,
|
|
"num_tokens": 9224426.0,
|
|
"step": 5315
|
|
},
|
|
{
|
|
"entropy": 5.768082618713379,
|
|
"epoch": 0.4139272515074888,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.0004987275161322697,
|
|
"loss": 5.6794,
|
|
"mean_token_accuracy": 0.1533222734928131,
|
|
"num_tokens": 9233785.0,
|
|
"step": 5320
|
|
},
|
|
{
|
|
"entropy": 5.695648050308227,
|
|
"epoch": 0.41431628087920636,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0004987245709686337,
|
|
"loss": 5.6307,
|
|
"mean_token_accuracy": 0.15449224412441254,
|
|
"num_tokens": 9242168.0,
|
|
"step": 5325
|
|
},
|
|
{
|
|
"entropy": 5.718257284164428,
|
|
"epoch": 0.41470531025092394,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0004987216224103334,
|
|
"loss": 5.6645,
|
|
"mean_token_accuracy": 0.15255628675222396,
|
|
"num_tokens": 9250862.0,
|
|
"step": 5330
|
|
},
|
|
{
|
|
"entropy": 5.7047186374664305,
|
|
"epoch": 0.41509433962264153,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0004987186704574136,
|
|
"loss": 5.6741,
|
|
"mean_token_accuracy": 0.14798310920596122,
|
|
"num_tokens": 9259957.0,
|
|
"step": 5335
|
|
},
|
|
{
|
|
"entropy": 5.61541223526001,
|
|
"epoch": 0.41548336899435906,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0004987157151099189,
|
|
"loss": 5.5546,
|
|
"mean_token_accuracy": 0.15545115619897842,
|
|
"num_tokens": 9268590.0,
|
|
"step": 5340
|
|
},
|
|
{
|
|
"entropy": 5.702762413024902,
|
|
"epoch": 0.41587239836607665,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0004987127563678945,
|
|
"loss": 5.6005,
|
|
"mean_token_accuracy": 0.15641995817422866,
|
|
"num_tokens": 9276872.0,
|
|
"step": 5345
|
|
},
|
|
{
|
|
"entropy": 5.679139614105225,
|
|
"epoch": 0.4162614277377942,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0004987097942313852,
|
|
"loss": 5.5116,
|
|
"mean_token_accuracy": 0.15718710869550706,
|
|
"num_tokens": 9284556.0,
|
|
"step": 5350
|
|
},
|
|
{
|
|
"entropy": 5.651728963851928,
|
|
"epoch": 0.41665045710951176,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0004987068287004355,
|
|
"loss": 5.6732,
|
|
"mean_token_accuracy": 0.15081616044044494,
|
|
"num_tokens": 9293315.0,
|
|
"step": 5355
|
|
},
|
|
{
|
|
"entropy": 5.773790979385376,
|
|
"epoch": 0.41703948648122935,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.0004987038597750909,
|
|
"loss": 5.6363,
|
|
"mean_token_accuracy": 0.15579553544521332,
|
|
"num_tokens": 9302923.0,
|
|
"step": 5360
|
|
},
|
|
{
|
|
"entropy": 5.722340250015259,
|
|
"epoch": 0.4174285158529469,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.0004987008874553964,
|
|
"loss": 5.5691,
|
|
"mean_token_accuracy": 0.1573861852288246,
|
|
"num_tokens": 9311388.0,
|
|
"step": 5365
|
|
},
|
|
{
|
|
"entropy": 5.6082155227661135,
|
|
"epoch": 0.41781754522466447,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.0004986979117413969,
|
|
"loss": 5.5166,
|
|
"mean_token_accuracy": 0.15783468931913375,
|
|
"num_tokens": 9319880.0,
|
|
"step": 5370
|
|
},
|
|
{
|
|
"entropy": 5.66514778137207,
|
|
"epoch": 0.41820657459638205,
|
|
"grad_norm": 2.390625,
|
|
"learning_rate": 0.0004986949326331376,
|
|
"loss": 5.6584,
|
|
"mean_token_accuracy": 0.15248090997338296,
|
|
"num_tokens": 9328374.0,
|
|
"step": 5375
|
|
},
|
|
{
|
|
"entropy": 5.7879310131073,
|
|
"epoch": 0.4185956039680996,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.0004986919501306638,
|
|
"loss": 5.6027,
|
|
"mean_token_accuracy": 0.16203720420598983,
|
|
"num_tokens": 9336428.0,
|
|
"step": 5380
|
|
},
|
|
{
|
|
"entropy": 5.629948520660401,
|
|
"epoch": 0.41898463333981717,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004986889642340207,
|
|
"loss": 5.7067,
|
|
"mean_token_accuracy": 0.15284340232610702,
|
|
"num_tokens": 9345794.0,
|
|
"step": 5385
|
|
},
|
|
{
|
|
"entropy": 5.776071500778198,
|
|
"epoch": 0.4193736627115347,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0004986859749432536,
|
|
"loss": 5.6636,
|
|
"mean_token_accuracy": 0.1524375021457672,
|
|
"num_tokens": 9354724.0,
|
|
"step": 5390
|
|
},
|
|
{
|
|
"entropy": 5.768964719772339,
|
|
"epoch": 0.4197626920832523,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0004986829822584078,
|
|
"loss": 5.6802,
|
|
"mean_token_accuracy": 0.1479766398668289,
|
|
"num_tokens": 9364008.0,
|
|
"step": 5395
|
|
},
|
|
{
|
|
"entropy": 5.72349443435669,
|
|
"epoch": 0.4201517214549699,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0004986799861795289,
|
|
"loss": 5.6363,
|
|
"mean_token_accuracy": 0.16576656699180603,
|
|
"num_tokens": 9372409.0,
|
|
"step": 5400
|
|
},
|
|
{
|
|
"entropy": 5.697003746032715,
|
|
"epoch": 0.4205407508266874,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.0004986769867066622,
|
|
"loss": 5.579,
|
|
"mean_token_accuracy": 0.15202543288469314,
|
|
"num_tokens": 9381172.0,
|
|
"step": 5405
|
|
},
|
|
{
|
|
"entropy": 5.68998646736145,
|
|
"epoch": 0.420929780198405,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.0004986739838398532,
|
|
"loss": 5.6024,
|
|
"mean_token_accuracy": 0.16151912212371827,
|
|
"num_tokens": 9389245.0,
|
|
"step": 5410
|
|
},
|
|
{
|
|
"entropy": 5.710152196884155,
|
|
"epoch": 0.4213188095701225,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.0004986709775791475,
|
|
"loss": 5.6409,
|
|
"mean_token_accuracy": 0.15243250578641893,
|
|
"num_tokens": 9397954.0,
|
|
"step": 5415
|
|
},
|
|
{
|
|
"entropy": 5.68855242729187,
|
|
"epoch": 0.4217078389418401,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0004986679679245907,
|
|
"loss": 5.7307,
|
|
"mean_token_accuracy": 0.14909764230251313,
|
|
"num_tokens": 9406986.0,
|
|
"step": 5420
|
|
},
|
|
{
|
|
"entropy": 5.755280351638794,
|
|
"epoch": 0.4220968683135577,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0004986649548762286,
|
|
"loss": 5.6857,
|
|
"mean_token_accuracy": 0.15256578773260115,
|
|
"num_tokens": 9415163.0,
|
|
"step": 5425
|
|
},
|
|
{
|
|
"entropy": 5.672216081619263,
|
|
"epoch": 0.4224858976852752,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0004986619384341066,
|
|
"loss": 5.5171,
|
|
"mean_token_accuracy": 0.1674740955233574,
|
|
"num_tokens": 9423422.0,
|
|
"step": 5430
|
|
},
|
|
{
|
|
"entropy": 5.641525936126709,
|
|
"epoch": 0.4228749270569928,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0004986589185982708,
|
|
"loss": 5.554,
|
|
"mean_token_accuracy": 0.1703364595770836,
|
|
"num_tokens": 9431349.0,
|
|
"step": 5435
|
|
},
|
|
{
|
|
"entropy": 5.704486656188965,
|
|
"epoch": 0.42326395642871034,
|
|
"grad_norm": 1.5,
|
|
"learning_rate": 0.0004986558953687671,
|
|
"loss": 5.6504,
|
|
"mean_token_accuracy": 0.1514353260397911,
|
|
"num_tokens": 9439715.0,
|
|
"step": 5440
|
|
},
|
|
{
|
|
"entropy": 5.736121320724488,
|
|
"epoch": 0.42365298580042793,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0004986528687456409,
|
|
"loss": 5.6528,
|
|
"mean_token_accuracy": 0.15465957820415496,
|
|
"num_tokens": 9448216.0,
|
|
"step": 5445
|
|
},
|
|
{
|
|
"entropy": 5.739035606384277,
|
|
"epoch": 0.4240420151721455,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0004986498387289384,
|
|
"loss": 5.5811,
|
|
"mean_token_accuracy": 0.1586304396390915,
|
|
"num_tokens": 9456346.0,
|
|
"step": 5450
|
|
},
|
|
{
|
|
"entropy": 5.70108847618103,
|
|
"epoch": 0.42443104454386305,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0004986468053187058,
|
|
"loss": 5.6537,
|
|
"mean_token_accuracy": 0.1538468062877655,
|
|
"num_tokens": 9465476.0,
|
|
"step": 5455
|
|
},
|
|
{
|
|
"entropy": 5.770843505859375,
|
|
"epoch": 0.42482007391558063,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0004986437685149887,
|
|
"loss": 5.7147,
|
|
"mean_token_accuracy": 0.1504819832742214,
|
|
"num_tokens": 9474582.0,
|
|
"step": 5460
|
|
},
|
|
{
|
|
"entropy": 5.699989891052246,
|
|
"epoch": 0.4252091032872982,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0004986407283178334,
|
|
"loss": 5.5785,
|
|
"mean_token_accuracy": 0.14940586686134338,
|
|
"num_tokens": 9482801.0,
|
|
"step": 5465
|
|
},
|
|
{
|
|
"entropy": 5.649980115890503,
|
|
"epoch": 0.42559813265901575,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.0004986376847272861,
|
|
"loss": 5.6356,
|
|
"mean_token_accuracy": 0.15340728610754012,
|
|
"num_tokens": 9490894.0,
|
|
"step": 5470
|
|
},
|
|
{
|
|
"entropy": 5.674148035049439,
|
|
"epoch": 0.42598716203073334,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0004986346377433929,
|
|
"loss": 5.5886,
|
|
"mean_token_accuracy": 0.155898617208004,
|
|
"num_tokens": 9499414.0,
|
|
"step": 5475
|
|
},
|
|
{
|
|
"entropy": 5.6370621681213375,
|
|
"epoch": 0.42637619140245087,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0004986315873661999,
|
|
"loss": 5.5502,
|
|
"mean_token_accuracy": 0.15451737493276596,
|
|
"num_tokens": 9508945.0,
|
|
"step": 5480
|
|
},
|
|
{
|
|
"entropy": 5.727960109710693,
|
|
"epoch": 0.42676522077416845,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0004986285335957536,
|
|
"loss": 5.6277,
|
|
"mean_token_accuracy": 0.1591019555926323,
|
|
"num_tokens": 9517833.0,
|
|
"step": 5485
|
|
},
|
|
{
|
|
"entropy": 5.782824993133545,
|
|
"epoch": 0.42715425014588604,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0004986254764321002,
|
|
"loss": 5.768,
|
|
"mean_token_accuracy": 0.14558715224266053,
|
|
"num_tokens": 9526551.0,
|
|
"step": 5490
|
|
},
|
|
{
|
|
"entropy": 5.6884478569030765,
|
|
"epoch": 0.42754327951760357,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004986224158752861,
|
|
"loss": 5.5169,
|
|
"mean_token_accuracy": 0.15997313857078552,
|
|
"num_tokens": 9535224.0,
|
|
"step": 5495
|
|
},
|
|
{
|
|
"entropy": 5.723999786376953,
|
|
"epoch": 0.42793230888932116,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0004986193519253578,
|
|
"loss": 5.647,
|
|
"mean_token_accuracy": 0.14827475771307946,
|
|
"num_tokens": 9544466.0,
|
|
"step": 5500
|
|
},
|
|
{
|
|
"entropy": 5.652610635757446,
|
|
"epoch": 0.4283213382610387,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0004986162845823618,
|
|
"loss": 5.6416,
|
|
"mean_token_accuracy": 0.1531407952308655,
|
|
"num_tokens": 9553520.0,
|
|
"step": 5505
|
|
},
|
|
{
|
|
"entropy": 5.6986065864562985,
|
|
"epoch": 0.4287103676327563,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0004986132138463446,
|
|
"loss": 5.5536,
|
|
"mean_token_accuracy": 0.1587995931506157,
|
|
"num_tokens": 9562053.0,
|
|
"step": 5510
|
|
},
|
|
{
|
|
"entropy": 5.650413608551025,
|
|
"epoch": 0.42909939700447386,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0004986101397173528,
|
|
"loss": 5.5361,
|
|
"mean_token_accuracy": 0.15939041525125502,
|
|
"num_tokens": 9570632.0,
|
|
"step": 5515
|
|
},
|
|
{
|
|
"entropy": 5.637784433364868,
|
|
"epoch": 0.4294884263761914,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.000498607062195433,
|
|
"loss": 5.5628,
|
|
"mean_token_accuracy": 0.15918782651424407,
|
|
"num_tokens": 9578739.0,
|
|
"step": 5520
|
|
},
|
|
{
|
|
"entropy": 5.681663131713867,
|
|
"epoch": 0.429877455747909,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.000498603981280632,
|
|
"loss": 5.5821,
|
|
"mean_token_accuracy": 0.15625160336494445,
|
|
"num_tokens": 9587314.0,
|
|
"step": 5525
|
|
},
|
|
{
|
|
"entropy": 5.723372554779052,
|
|
"epoch": 0.4302664851196265,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.0004986008969729964,
|
|
"loss": 5.6419,
|
|
"mean_token_accuracy": 0.15364105701446534,
|
|
"num_tokens": 9595954.0,
|
|
"step": 5530
|
|
},
|
|
{
|
|
"entropy": 5.693819379806518,
|
|
"epoch": 0.4306555144913441,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.0004985978092725731,
|
|
"loss": 5.6581,
|
|
"mean_token_accuracy": 0.1521173059940338,
|
|
"num_tokens": 9604767.0,
|
|
"step": 5535
|
|
},
|
|
{
|
|
"entropy": 5.6503571510314945,
|
|
"epoch": 0.4310445438630617,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.000498594718179409,
|
|
"loss": 5.5238,
|
|
"mean_token_accuracy": 0.15622634440660477,
|
|
"num_tokens": 9613173.0,
|
|
"step": 5540
|
|
},
|
|
{
|
|
"entropy": 5.711286640167236,
|
|
"epoch": 0.4314335732347792,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0004985916236935508,
|
|
"loss": 5.6142,
|
|
"mean_token_accuracy": 0.15553787499666213,
|
|
"num_tokens": 9622777.0,
|
|
"step": 5545
|
|
},
|
|
{
|
|
"entropy": 5.608004999160767,
|
|
"epoch": 0.4318226026064968,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.0004985885258150458,
|
|
"loss": 5.548,
|
|
"mean_token_accuracy": 0.15261236429214478,
|
|
"num_tokens": 9631019.0,
|
|
"step": 5550
|
|
},
|
|
{
|
|
"entropy": 5.66903657913208,
|
|
"epoch": 0.43221163197821433,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004985854245439408,
|
|
"loss": 5.6201,
|
|
"mean_token_accuracy": 0.1510221004486084,
|
|
"num_tokens": 9639797.0,
|
|
"step": 5555
|
|
},
|
|
{
|
|
"entropy": 5.675737190246582,
|
|
"epoch": 0.4326006613499319,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0004985823198802827,
|
|
"loss": 5.5886,
|
|
"mean_token_accuracy": 0.16301481425762177,
|
|
"num_tokens": 9648393.0,
|
|
"step": 5560
|
|
},
|
|
{
|
|
"entropy": 5.710528373718262,
|
|
"epoch": 0.4329896907216495,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.0004985792118241188,
|
|
"loss": 5.5958,
|
|
"mean_token_accuracy": 0.15752308517694474,
|
|
"num_tokens": 9657260.0,
|
|
"step": 5565
|
|
},
|
|
{
|
|
"entropy": 5.668179178237915,
|
|
"epoch": 0.43337872009336703,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.0004985761003754961,
|
|
"loss": 5.6327,
|
|
"mean_token_accuracy": 0.16131462305784225,
|
|
"num_tokens": 9665883.0,
|
|
"step": 5570
|
|
},
|
|
{
|
|
"entropy": 5.726443815231323,
|
|
"epoch": 0.4337677494650846,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.0004985729855344622,
|
|
"loss": 5.6628,
|
|
"mean_token_accuracy": 0.15568624585866928,
|
|
"num_tokens": 9674100.0,
|
|
"step": 5575
|
|
},
|
|
{
|
|
"entropy": 5.669579696655274,
|
|
"epoch": 0.4341567788368022,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.000498569867301064,
|
|
"loss": 5.6411,
|
|
"mean_token_accuracy": 0.14948973059654236,
|
|
"num_tokens": 9683236.0,
|
|
"step": 5580
|
|
},
|
|
{
|
|
"entropy": 5.671548175811767,
|
|
"epoch": 0.43454580820851973,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.0004985667456753489,
|
|
"loss": 5.6118,
|
|
"mean_token_accuracy": 0.15591788440942764,
|
|
"num_tokens": 9692076.0,
|
|
"step": 5585
|
|
},
|
|
{
|
|
"entropy": 5.749252414703369,
|
|
"epoch": 0.4349348375802373,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004985636206573642,
|
|
"loss": 5.6574,
|
|
"mean_token_accuracy": 0.1567201316356659,
|
|
"num_tokens": 9700266.0,
|
|
"step": 5590
|
|
},
|
|
{
|
|
"entropy": 5.6495452404022215,
|
|
"epoch": 0.43532386695195485,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004985604922471575,
|
|
"loss": 5.5804,
|
|
"mean_token_accuracy": 0.15612577348947526,
|
|
"num_tokens": 9708643.0,
|
|
"step": 5595
|
|
},
|
|
{
|
|
"entropy": 5.722015714645385,
|
|
"epoch": 0.43571289632367244,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0004985573604447761,
|
|
"loss": 5.6391,
|
|
"mean_token_accuracy": 0.15270705446600913,
|
|
"num_tokens": 9717459.0,
|
|
"step": 5600
|
|
},
|
|
{
|
|
"entropy": 5.683666324615478,
|
|
"epoch": 0.43610192569539,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004985542252502676,
|
|
"loss": 5.556,
|
|
"mean_token_accuracy": 0.15867960900068284,
|
|
"num_tokens": 9726251.0,
|
|
"step": 5605
|
|
},
|
|
{
|
|
"entropy": 5.572760534286499,
|
|
"epoch": 0.43649095506710756,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0004985510866636796,
|
|
"loss": 5.5414,
|
|
"mean_token_accuracy": 0.1563876047730446,
|
|
"num_tokens": 9735327.0,
|
|
"step": 5610
|
|
},
|
|
{
|
|
"entropy": 5.710997104644775,
|
|
"epoch": 0.43687998443882514,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0004985479446850596,
|
|
"loss": 5.6939,
|
|
"mean_token_accuracy": 0.14747919738292695,
|
|
"num_tokens": 9743642.0,
|
|
"step": 5615
|
|
},
|
|
{
|
|
"entropy": 5.745656728744507,
|
|
"epoch": 0.4372690138105427,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004985447993144554,
|
|
"loss": 5.5575,
|
|
"mean_token_accuracy": 0.1631772004067898,
|
|
"num_tokens": 9752235.0,
|
|
"step": 5620
|
|
},
|
|
{
|
|
"entropy": 5.710186576843261,
|
|
"epoch": 0.43765804318226026,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0004985416505519147,
|
|
"loss": 5.6486,
|
|
"mean_token_accuracy": 0.14850047677755357,
|
|
"num_tokens": 9761012.0,
|
|
"step": 5625
|
|
},
|
|
{
|
|
"entropy": 5.664464712142944,
|
|
"epoch": 0.43804707255397785,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0004985384983974853,
|
|
"loss": 5.6143,
|
|
"mean_token_accuracy": 0.157231392711401,
|
|
"num_tokens": 9769810.0,
|
|
"step": 5630
|
|
},
|
|
{
|
|
"entropy": 5.700027561187744,
|
|
"epoch": 0.4384361019256954,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.0004985353428512148,
|
|
"loss": 5.5438,
|
|
"mean_token_accuracy": 0.15658937096595765,
|
|
"num_tokens": 9778186.0,
|
|
"step": 5635
|
|
},
|
|
{
|
|
"entropy": 5.659540843963623,
|
|
"epoch": 0.43882513129741296,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0004985321839131514,
|
|
"loss": 5.6229,
|
|
"mean_token_accuracy": 0.1591310068964958,
|
|
"num_tokens": 9786456.0,
|
|
"step": 5640
|
|
},
|
|
{
|
|
"entropy": 5.67944016456604,
|
|
"epoch": 0.4392141606691305,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0004985290215833428,
|
|
"loss": 5.6157,
|
|
"mean_token_accuracy": 0.152775377035141,
|
|
"num_tokens": 9794613.0,
|
|
"step": 5645
|
|
},
|
|
{
|
|
"entropy": 5.751613807678223,
|
|
"epoch": 0.4396031900408481,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0004985258558618372,
|
|
"loss": 5.5591,
|
|
"mean_token_accuracy": 0.15995817482471467,
|
|
"num_tokens": 9803388.0,
|
|
"step": 5650
|
|
},
|
|
{
|
|
"entropy": 5.620654487609864,
|
|
"epoch": 0.43999221941256567,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.0004985226867486825,
|
|
"loss": 5.6052,
|
|
"mean_token_accuracy": 0.16028854846954346,
|
|
"num_tokens": 9812450.0,
|
|
"step": 5655
|
|
},
|
|
{
|
|
"entropy": 5.6909432888031,
|
|
"epoch": 0.4403812487842832,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0004985195142439267,
|
|
"loss": 5.68,
|
|
"mean_token_accuracy": 0.15284086763858795,
|
|
"num_tokens": 9821377.0,
|
|
"step": 5660
|
|
},
|
|
{
|
|
"entropy": 5.7234701156616214,
|
|
"epoch": 0.4407702781560008,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.0004985163383476181,
|
|
"loss": 5.5778,
|
|
"mean_token_accuracy": 0.15479062795639037,
|
|
"num_tokens": 9829761.0,
|
|
"step": 5665
|
|
},
|
|
{
|
|
"entropy": 5.706999444961548,
|
|
"epoch": 0.44115930752771837,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.0004985131590598048,
|
|
"loss": 5.6653,
|
|
"mean_token_accuracy": 0.14726217687129975,
|
|
"num_tokens": 9838921.0,
|
|
"step": 5670
|
|
},
|
|
{
|
|
"entropy": 5.646905469894409,
|
|
"epoch": 0.4415483368994359,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0004985099763805352,
|
|
"loss": 5.5007,
|
|
"mean_token_accuracy": 0.1659899964928627,
|
|
"num_tokens": 9846822.0,
|
|
"step": 5675
|
|
},
|
|
{
|
|
"entropy": 5.7456502437591555,
|
|
"epoch": 0.4419373662711535,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.0004985067903098574,
|
|
"loss": 5.7295,
|
|
"mean_token_accuracy": 0.15629381388425828,
|
|
"num_tokens": 9855951.0,
|
|
"step": 5680
|
|
},
|
|
{
|
|
"entropy": 5.7572588443756105,
|
|
"epoch": 0.442326395642871,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0004985036008478197,
|
|
"loss": 5.6582,
|
|
"mean_token_accuracy": 0.15795501098036765,
|
|
"num_tokens": 9864875.0,
|
|
"step": 5685
|
|
},
|
|
{
|
|
"entropy": 5.738973951339721,
|
|
"epoch": 0.4427154250145886,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.0004985004079944707,
|
|
"loss": 5.6286,
|
|
"mean_token_accuracy": 0.1554968997836113,
|
|
"num_tokens": 9873785.0,
|
|
"step": 5690
|
|
},
|
|
{
|
|
"entropy": 5.714623546600341,
|
|
"epoch": 0.4431044543863062,
|
|
"grad_norm": 1.53125,
|
|
"learning_rate": 0.0004984972117498587,
|
|
"loss": 5.6291,
|
|
"mean_token_accuracy": 0.14927410408854486,
|
|
"num_tokens": 9883214.0,
|
|
"step": 5695
|
|
},
|
|
{
|
|
"entropy": 5.672214412689209,
|
|
"epoch": 0.4434934837580237,
|
|
"grad_norm": 1.546875,
|
|
"learning_rate": 0.0004984940121140323,
|
|
"loss": 5.6088,
|
|
"mean_token_accuracy": 0.15693314075469972,
|
|
"num_tokens": 9891346.0,
|
|
"step": 5700
|
|
},
|
|
{
|
|
"entropy": 5.637992000579834,
|
|
"epoch": 0.4438825131297413,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.00049849080908704,
|
|
"loss": 5.531,
|
|
"mean_token_accuracy": 0.15485147386789322,
|
|
"num_tokens": 9900646.0,
|
|
"step": 5705
|
|
},
|
|
{
|
|
"entropy": 5.71306209564209,
|
|
"epoch": 0.44427154250145884,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0004984876026689302,
|
|
"loss": 5.6701,
|
|
"mean_token_accuracy": 0.15194630101323128,
|
|
"num_tokens": 9910851.0,
|
|
"step": 5710
|
|
},
|
|
{
|
|
"entropy": 5.784929990768433,
|
|
"epoch": 0.4446605718731764,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.000498484392859752,
|
|
"loss": 5.685,
|
|
"mean_token_accuracy": 0.15186055302619933,
|
|
"num_tokens": 9919919.0,
|
|
"step": 5715
|
|
},
|
|
{
|
|
"entropy": 5.767201137542725,
|
|
"epoch": 0.445049601244894,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.0004984811796595538,
|
|
"loss": 5.6054,
|
|
"mean_token_accuracy": 0.15849266946315765,
|
|
"num_tokens": 9928831.0,
|
|
"step": 5720
|
|
},
|
|
{
|
|
"entropy": 5.662395191192627,
|
|
"epoch": 0.44543863061661154,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0004984779630683843,
|
|
"loss": 5.5571,
|
|
"mean_token_accuracy": 0.16009855270385742,
|
|
"num_tokens": 9936840.0,
|
|
"step": 5725
|
|
},
|
|
{
|
|
"entropy": 5.672893428802491,
|
|
"epoch": 0.44582765998832913,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004984747430862924,
|
|
"loss": 5.647,
|
|
"mean_token_accuracy": 0.1535024493932724,
|
|
"num_tokens": 9945845.0,
|
|
"step": 5730
|
|
},
|
|
{
|
|
"entropy": 5.713797903060913,
|
|
"epoch": 0.44621668936004666,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0004984715197133271,
|
|
"loss": 5.6304,
|
|
"mean_token_accuracy": 0.1542983204126358,
|
|
"num_tokens": 9955176.0,
|
|
"step": 5735
|
|
},
|
|
{
|
|
"entropy": 5.6174845695495605,
|
|
"epoch": 0.44660571873176425,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.0004984682929495371,
|
|
"loss": 5.5239,
|
|
"mean_token_accuracy": 0.16356904953718185,
|
|
"num_tokens": 9963182.0,
|
|
"step": 5740
|
|
},
|
|
{
|
|
"entropy": 5.703261232376098,
|
|
"epoch": 0.44699474810348183,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0004984650627949715,
|
|
"loss": 5.6546,
|
|
"mean_token_accuracy": 0.1533096879720688,
|
|
"num_tokens": 9971239.0,
|
|
"step": 5745
|
|
},
|
|
{
|
|
"entropy": 5.666077423095703,
|
|
"epoch": 0.44738377747519936,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0004984618292496792,
|
|
"loss": 5.609,
|
|
"mean_token_accuracy": 0.1545335054397583,
|
|
"num_tokens": 9980285.0,
|
|
"step": 5750
|
|
},
|
|
{
|
|
"entropy": 5.693202304840088,
|
|
"epoch": 0.44777280684691695,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0004984585923137093,
|
|
"loss": 5.6373,
|
|
"mean_token_accuracy": 0.15373781323432922,
|
|
"num_tokens": 9988922.0,
|
|
"step": 5755
|
|
},
|
|
{
|
|
"entropy": 5.741955804824829,
|
|
"epoch": 0.4481618362186345,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.000498455351987111,
|
|
"loss": 5.706,
|
|
"mean_token_accuracy": 0.14707285165786743,
|
|
"num_tokens": 9998538.0,
|
|
"step": 5760
|
|
},
|
|
{
|
|
"entropy": 5.788418865203857,
|
|
"epoch": 0.44855086559035207,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004984521082699333,
|
|
"loss": 5.6135,
|
|
"mean_token_accuracy": 0.15476753562688828,
|
|
"num_tokens": 10006646.0,
|
|
"step": 5765
|
|
},
|
|
{
|
|
"entropy": 5.661280012130737,
|
|
"epoch": 0.44893989496206965,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0004984488611622256,
|
|
"loss": 5.6027,
|
|
"mean_token_accuracy": 0.15705500692129135,
|
|
"num_tokens": 10016511.0,
|
|
"step": 5770
|
|
},
|
|
{
|
|
"entropy": 5.636836957931519,
|
|
"epoch": 0.4493289243337872,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.000498445610664037,
|
|
"loss": 5.4999,
|
|
"mean_token_accuracy": 0.1614679366350174,
|
|
"num_tokens": 10025223.0,
|
|
"step": 5775
|
|
},
|
|
{
|
|
"entropy": 5.649578857421875,
|
|
"epoch": 0.44971795370550477,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.000498442356775417,
|
|
"loss": 5.5849,
|
|
"mean_token_accuracy": 0.15652598887681962,
|
|
"num_tokens": 10033678.0,
|
|
"step": 5780
|
|
},
|
|
{
|
|
"entropy": 5.66576738357544,
|
|
"epoch": 0.45010698307722236,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0004984390994964148,
|
|
"loss": 5.4934,
|
|
"mean_token_accuracy": 0.15820170938968658,
|
|
"num_tokens": 10042028.0,
|
|
"step": 5785
|
|
},
|
|
{
|
|
"entropy": 5.672802352905274,
|
|
"epoch": 0.4504960124489399,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.00049843583882708,
|
|
"loss": 5.6915,
|
|
"mean_token_accuracy": 0.1554969623684883,
|
|
"num_tokens": 10050758.0,
|
|
"step": 5790
|
|
},
|
|
{
|
|
"entropy": 5.641775178909302,
|
|
"epoch": 0.4508850418206575,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.000498432574767462,
|
|
"loss": 5.4427,
|
|
"mean_token_accuracy": 0.16750287264585495,
|
|
"num_tokens": 10058688.0,
|
|
"step": 5795
|
|
},
|
|
{
|
|
"entropy": 5.644252109527588,
|
|
"epoch": 0.451274071192375,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0004984293073176103,
|
|
"loss": 5.5453,
|
|
"mean_token_accuracy": 0.1645413100719452,
|
|
"num_tokens": 10067302.0,
|
|
"step": 5800
|
|
},
|
|
{
|
|
"entropy": 5.5666821002960205,
|
|
"epoch": 0.4516631005640926,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0004984260364775744,
|
|
"loss": 5.5331,
|
|
"mean_token_accuracy": 0.15917521715164185,
|
|
"num_tokens": 10076424.0,
|
|
"step": 5805
|
|
},
|
|
{
|
|
"entropy": 5.724156904220581,
|
|
"epoch": 0.4520521299358102,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.000498422762247404,
|
|
"loss": 5.6703,
|
|
"mean_token_accuracy": 0.14797478914260864,
|
|
"num_tokens": 10086307.0,
|
|
"step": 5810
|
|
},
|
|
{
|
|
"entropy": 5.696759462356567,
|
|
"epoch": 0.4524411593075277,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0004984194846271489,
|
|
"loss": 5.5395,
|
|
"mean_token_accuracy": 0.1550739273428917,
|
|
"num_tokens": 10094954.0,
|
|
"step": 5815
|
|
},
|
|
{
|
|
"entropy": 5.609128522872925,
|
|
"epoch": 0.4528301886792453,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0004984162036168586,
|
|
"loss": 5.628,
|
|
"mean_token_accuracy": 0.15431981831789016,
|
|
"num_tokens": 10104401.0,
|
|
"step": 5820
|
|
},
|
|
{
|
|
"entropy": 5.638042354583741,
|
|
"epoch": 0.4532192180509628,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0004984129192165831,
|
|
"loss": 5.625,
|
|
"mean_token_accuracy": 0.16010936647653579,
|
|
"num_tokens": 10112596.0,
|
|
"step": 5825
|
|
},
|
|
{
|
|
"entropy": 5.729681921005249,
|
|
"epoch": 0.4536082474226804,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0004984096314263722,
|
|
"loss": 5.6688,
|
|
"mean_token_accuracy": 0.1558495357632637,
|
|
"num_tokens": 10121311.0,
|
|
"step": 5830
|
|
},
|
|
{
|
|
"entropy": 5.574494218826294,
|
|
"epoch": 0.453997276794398,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0004984063402462757,
|
|
"loss": 5.468,
|
|
"mean_token_accuracy": 0.16243041604757308,
|
|
"num_tokens": 10130010.0,
|
|
"step": 5835
|
|
},
|
|
{
|
|
"entropy": 5.605675840377808,
|
|
"epoch": 0.45438630616611553,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0004984030456763435,
|
|
"loss": 5.5912,
|
|
"mean_token_accuracy": 0.1590662494301796,
|
|
"num_tokens": 10138473.0,
|
|
"step": 5840
|
|
},
|
|
{
|
|
"entropy": 5.8279444694519045,
|
|
"epoch": 0.4547753355378331,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0004983997477166257,
|
|
"loss": 5.651,
|
|
"mean_token_accuracy": 0.15664980113506316,
|
|
"num_tokens": 10146843.0,
|
|
"step": 5845
|
|
},
|
|
{
|
|
"entropy": 5.584151268005371,
|
|
"epoch": 0.45516436490955064,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0004983964463671723,
|
|
"loss": 5.5015,
|
|
"mean_token_accuracy": 0.16206508874893188,
|
|
"num_tokens": 10155319.0,
|
|
"step": 5850
|
|
},
|
|
{
|
|
"entropy": 5.641605281829834,
|
|
"epoch": 0.45555339428126823,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.0004983931416280334,
|
|
"loss": 5.6853,
|
|
"mean_token_accuracy": 0.14777326062321663,
|
|
"num_tokens": 10164308.0,
|
|
"step": 5855
|
|
},
|
|
{
|
|
"entropy": 5.776509571075439,
|
|
"epoch": 0.4559424236529858,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0004983898334992591,
|
|
"loss": 5.7025,
|
|
"mean_token_accuracy": 0.1513962298631668,
|
|
"num_tokens": 10173173.0,
|
|
"step": 5860
|
|
},
|
|
{
|
|
"entropy": 5.691646337509155,
|
|
"epoch": 0.45633145302470335,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.0004983865219808998,
|
|
"loss": 5.6123,
|
|
"mean_token_accuracy": 0.15464477241039276,
|
|
"num_tokens": 10181376.0,
|
|
"step": 5865
|
|
},
|
|
{
|
|
"entropy": 5.724706697463989,
|
|
"epoch": 0.45672048239642093,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.0004983832070730055,
|
|
"loss": 5.6959,
|
|
"mean_token_accuracy": 0.1563864156603813,
|
|
"num_tokens": 10189701.0,
|
|
"step": 5870
|
|
},
|
|
{
|
|
"entropy": 5.710652160644531,
|
|
"epoch": 0.4571095117681385,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.0004983798887756265,
|
|
"loss": 5.5836,
|
|
"mean_token_accuracy": 0.1592947706580162,
|
|
"num_tokens": 10198721.0,
|
|
"step": 5875
|
|
},
|
|
{
|
|
"entropy": 5.672290182113647,
|
|
"epoch": 0.45749854113985605,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.0004983765670888133,
|
|
"loss": 5.4761,
|
|
"mean_token_accuracy": 0.16269083470106124,
|
|
"num_tokens": 10206428.0,
|
|
"step": 5880
|
|
},
|
|
{
|
|
"entropy": 5.562413501739502,
|
|
"epoch": 0.45788757051157364,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0004983732420126163,
|
|
"loss": 5.6116,
|
|
"mean_token_accuracy": 0.15439745485782624,
|
|
"num_tokens": 10214941.0,
|
|
"step": 5885
|
|
},
|
|
{
|
|
"entropy": 5.67099027633667,
|
|
"epoch": 0.45827659988329117,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0004983699135470858,
|
|
"loss": 5.6174,
|
|
"mean_token_accuracy": 0.16162062734365462,
|
|
"num_tokens": 10223491.0,
|
|
"step": 5890
|
|
},
|
|
{
|
|
"entropy": 5.720311975479126,
|
|
"epoch": 0.45866562925500876,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.0004983665816922723,
|
|
"loss": 5.5396,
|
|
"mean_token_accuracy": 0.15808571577072145,
|
|
"num_tokens": 10231820.0,
|
|
"step": 5895
|
|
},
|
|
{
|
|
"entropy": 5.61470627784729,
|
|
"epoch": 0.45905465862672634,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0004983632464482267,
|
|
"loss": 5.536,
|
|
"mean_token_accuracy": 0.16108897626399993,
|
|
"num_tokens": 10239781.0,
|
|
"step": 5900
|
|
},
|
|
{
|
|
"entropy": 5.635873746871948,
|
|
"epoch": 0.4594436879984439,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0004983599078149991,
|
|
"loss": 5.5609,
|
|
"mean_token_accuracy": 0.16366778314113617,
|
|
"num_tokens": 10248093.0,
|
|
"step": 5905
|
|
},
|
|
{
|
|
"entropy": 5.69731912612915,
|
|
"epoch": 0.45983271737016146,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.0004983565657926405,
|
|
"loss": 5.5878,
|
|
"mean_token_accuracy": 0.1563509926199913,
|
|
"num_tokens": 10256370.0,
|
|
"step": 5910
|
|
},
|
|
{
|
|
"entropy": 5.619994688034057,
|
|
"epoch": 0.460221746741879,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0004983532203812017,
|
|
"loss": 5.5593,
|
|
"mean_token_accuracy": 0.1569221630692482,
|
|
"num_tokens": 10264924.0,
|
|
"step": 5915
|
|
},
|
|
{
|
|
"entropy": 5.630159044265747,
|
|
"epoch": 0.4606107761135966,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.0004983498715807331,
|
|
"loss": 5.5033,
|
|
"mean_token_accuracy": 0.160485377907753,
|
|
"num_tokens": 10273488.0,
|
|
"step": 5920
|
|
},
|
|
{
|
|
"entropy": 5.672831010818482,
|
|
"epoch": 0.46099980548531416,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0004983465193912857,
|
|
"loss": 5.5644,
|
|
"mean_token_accuracy": 0.1572013482451439,
|
|
"num_tokens": 10281534.0,
|
|
"step": 5925
|
|
},
|
|
{
|
|
"entropy": 5.719956016540527,
|
|
"epoch": 0.4613888348570317,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.0004983431638129104,
|
|
"loss": 5.6069,
|
|
"mean_token_accuracy": 0.15728743895888328,
|
|
"num_tokens": 10289613.0,
|
|
"step": 5930
|
|
},
|
|
{
|
|
"entropy": 5.74925742149353,
|
|
"epoch": 0.4617778642287493,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.0004983398048456581,
|
|
"loss": 5.6668,
|
|
"mean_token_accuracy": 0.15779462456703186,
|
|
"num_tokens": 10299027.0,
|
|
"step": 5935
|
|
},
|
|
{
|
|
"entropy": 5.748346519470215,
|
|
"epoch": 0.4621668936004668,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0004983364424895796,
|
|
"loss": 5.6219,
|
|
"mean_token_accuracy": 0.15128087997436523,
|
|
"num_tokens": 10308727.0,
|
|
"step": 5940
|
|
},
|
|
{
|
|
"entropy": 5.716321325302124,
|
|
"epoch": 0.4625559229721844,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0004983330767447262,
|
|
"loss": 5.6393,
|
|
"mean_token_accuracy": 0.15531712099909784,
|
|
"num_tokens": 10318129.0,
|
|
"step": 5945
|
|
},
|
|
{
|
|
"entropy": 5.6274834156036375,
|
|
"epoch": 0.462944952343902,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0004983297076111489,
|
|
"loss": 5.494,
|
|
"mean_token_accuracy": 0.1664715051651001,
|
|
"num_tokens": 10326504.0,
|
|
"step": 5950
|
|
},
|
|
{
|
|
"entropy": 5.549721384048462,
|
|
"epoch": 0.4633339817156195,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.0004983263350888987,
|
|
"loss": 5.5596,
|
|
"mean_token_accuracy": 0.16194145381450653,
|
|
"num_tokens": 10334585.0,
|
|
"step": 5955
|
|
},
|
|
{
|
|
"entropy": 5.6667708396911625,
|
|
"epoch": 0.4637230110873371,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.0004983229591780268,
|
|
"loss": 5.5495,
|
|
"mean_token_accuracy": 0.1623869687318802,
|
|
"num_tokens": 10343328.0,
|
|
"step": 5960
|
|
},
|
|
{
|
|
"entropy": 5.665079545974732,
|
|
"epoch": 0.46411204045905463,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0004983195798785844,
|
|
"loss": 5.5816,
|
|
"mean_token_accuracy": 0.15681301951408386,
|
|
"num_tokens": 10352289.0,
|
|
"step": 5965
|
|
},
|
|
{
|
|
"entropy": 5.705914878845215,
|
|
"epoch": 0.4645010698307722,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.0004983161971906228,
|
|
"loss": 5.6951,
|
|
"mean_token_accuracy": 0.14757215976715088,
|
|
"num_tokens": 10360847.0,
|
|
"step": 5970
|
|
},
|
|
{
|
|
"entropy": 5.761966180801392,
|
|
"epoch": 0.4648900992024898,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.0004983128111141935,
|
|
"loss": 5.6165,
|
|
"mean_token_accuracy": 0.1592383563518524,
|
|
"num_tokens": 10368911.0,
|
|
"step": 5975
|
|
},
|
|
{
|
|
"entropy": 5.662771272659302,
|
|
"epoch": 0.46527912857420733,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0004983094216493475,
|
|
"loss": 5.5573,
|
|
"mean_token_accuracy": 0.16440646350383759,
|
|
"num_tokens": 10377257.0,
|
|
"step": 5980
|
|
},
|
|
{
|
|
"entropy": 5.601254081726074,
|
|
"epoch": 0.4656681579459249,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.0004983060287961367,
|
|
"loss": 5.6192,
|
|
"mean_token_accuracy": 0.15791454762220383,
|
|
"num_tokens": 10386167.0,
|
|
"step": 5985
|
|
},
|
|
{
|
|
"entropy": 5.633698558807373,
|
|
"epoch": 0.4660571873176425,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004983026325546123,
|
|
"loss": 5.5035,
|
|
"mean_token_accuracy": 0.1562596693634987,
|
|
"num_tokens": 10395802.0,
|
|
"step": 5990
|
|
},
|
|
{
|
|
"entropy": 5.68686261177063,
|
|
"epoch": 0.46644621668936004,
|
|
"grad_norm": 1.4921875,
|
|
"learning_rate": 0.0004982992329248257,
|
|
"loss": 5.6341,
|
|
"mean_token_accuracy": 0.15112658590078354,
|
|
"num_tokens": 10404836.0,
|
|
"step": 5995
|
|
},
|
|
{
|
|
"entropy": 5.764874982833862,
|
|
"epoch": 0.4668352460610776,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0004982958299068289,
|
|
"loss": 5.623,
|
|
"mean_token_accuracy": 0.15592485070228576,
|
|
"num_tokens": 10413394.0,
|
|
"step": 6000
|
|
},
|
|
{
|
|
"epoch": 0.4668352460610776,
|
|
"eval_entropy": 5.559448653855384,
|
|
"eval_loss": 5.644718647003174,
|
|
"eval_mean_token_accuracy": 0.16176202593584607,
|
|
"eval_num_tokens": 10413394.0,
|
|
"eval_runtime": 28.4474,
|
|
"eval_samples_per_second": 1460.874,
|
|
"eval_steps_per_second": 182.618,
|
|
"step": 6000
|
|
},
|
|
{
|
|
"entropy": 5.599856758117676,
|
|
"epoch": 0.46722427543279516,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.000498292423500673,
|
|
"loss": 5.5164,
|
|
"mean_token_accuracy": 0.16224406957626342,
|
|
"num_tokens": 10421916.0,
|
|
"step": 6005
|
|
},
|
|
{
|
|
"entropy": 5.646891021728516,
|
|
"epoch": 0.46761330480451274,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0004982890137064102,
|
|
"loss": 5.582,
|
|
"mean_token_accuracy": 0.15907793641090393,
|
|
"num_tokens": 10430703.0,
|
|
"step": 6010
|
|
},
|
|
{
|
|
"entropy": 5.743211698532105,
|
|
"epoch": 0.46800233417623033,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.000498285600524092,
|
|
"loss": 5.6429,
|
|
"mean_token_accuracy": 0.1553155668079853,
|
|
"num_tokens": 10439523.0,
|
|
"step": 6015
|
|
},
|
|
{
|
|
"entropy": 5.683924865722656,
|
|
"epoch": 0.46839136354794786,
|
|
"grad_norm": 1.5390625,
|
|
"learning_rate": 0.0004982821839537701,
|
|
"loss": 5.5435,
|
|
"mean_token_accuracy": 0.1604115754365921,
|
|
"num_tokens": 10447777.0,
|
|
"step": 6020
|
|
},
|
|
{
|
|
"entropy": 5.6141105651855465,
|
|
"epoch": 0.46878039291966545,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0004982787639954966,
|
|
"loss": 5.5246,
|
|
"mean_token_accuracy": 0.1618039131164551,
|
|
"num_tokens": 10456105.0,
|
|
"step": 6025
|
|
},
|
|
{
|
|
"entropy": 5.640907192230225,
|
|
"epoch": 0.469169422291383,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.0004982753406493232,
|
|
"loss": 5.5704,
|
|
"mean_token_accuracy": 0.159077899903059,
|
|
"num_tokens": 10464590.0,
|
|
"step": 6030
|
|
},
|
|
{
|
|
"entropy": 5.687194967269898,
|
|
"epoch": 0.46955845166310056,
|
|
"grad_norm": 1.5078125,
|
|
"learning_rate": 0.0004982719139153018,
|
|
"loss": 5.5938,
|
|
"mean_token_accuracy": 0.1523827828466892,
|
|
"num_tokens": 10472702.0,
|
|
"step": 6035
|
|
},
|
|
{
|
|
"entropy": 5.57777214050293,
|
|
"epoch": 0.46994748103481815,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0004982684837934845,
|
|
"loss": 5.5136,
|
|
"mean_token_accuracy": 0.1578451305627823,
|
|
"num_tokens": 10480682.0,
|
|
"step": 6040
|
|
},
|
|
{
|
|
"entropy": 5.688637924194336,
|
|
"epoch": 0.4703365104065357,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.0004982650502839234,
|
|
"loss": 5.6146,
|
|
"mean_token_accuracy": 0.15147078782320023,
|
|
"num_tokens": 10488873.0,
|
|
"step": 6045
|
|
},
|
|
{
|
|
"entropy": 5.66636176109314,
|
|
"epoch": 0.47072553977825327,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004982616133866705,
|
|
"loss": 5.5789,
|
|
"mean_token_accuracy": 0.16179264783859254,
|
|
"num_tokens": 10497077.0,
|
|
"step": 6050
|
|
},
|
|
{
|
|
"entropy": 5.681707859039307,
|
|
"epoch": 0.4711145691499708,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0004982581731017779,
|
|
"loss": 5.5575,
|
|
"mean_token_accuracy": 0.15877941399812698,
|
|
"num_tokens": 10506072.0,
|
|
"step": 6055
|
|
},
|
|
{
|
|
"entropy": 5.718855381011963,
|
|
"epoch": 0.4715035985216884,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.0004982547294292979,
|
|
"loss": 5.6207,
|
|
"mean_token_accuracy": 0.15153614282608033,
|
|
"num_tokens": 10515175.0,
|
|
"step": 6060
|
|
},
|
|
{
|
|
"entropy": 5.605925559997559,
|
|
"epoch": 0.47189262789340597,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0004982512823692828,
|
|
"loss": 5.508,
|
|
"mean_token_accuracy": 0.15940281450748445,
|
|
"num_tokens": 10524800.0,
|
|
"step": 6065
|
|
},
|
|
{
|
|
"entropy": 5.652846336364746,
|
|
"epoch": 0.4722816572651235,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.0004982478319217848,
|
|
"loss": 5.7054,
|
|
"mean_token_accuracy": 0.14966497719287872,
|
|
"num_tokens": 10534608.0,
|
|
"step": 6070
|
|
},
|
|
{
|
|
"entropy": 5.745728874206543,
|
|
"epoch": 0.4726706866368411,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0004982443780868562,
|
|
"loss": 5.5948,
|
|
"mean_token_accuracy": 0.15881826132535934,
|
|
"num_tokens": 10542992.0,
|
|
"step": 6075
|
|
},
|
|
{
|
|
"entropy": 5.662547779083252,
|
|
"epoch": 0.4730597160085587,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0004982409208645496,
|
|
"loss": 5.6235,
|
|
"mean_token_accuracy": 0.15793444067239762,
|
|
"num_tokens": 10551682.0,
|
|
"step": 6080
|
|
},
|
|
{
|
|
"entropy": 5.607632875442505,
|
|
"epoch": 0.4734487453802762,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0004982374602549173,
|
|
"loss": 5.55,
|
|
"mean_token_accuracy": 0.16171603202819823,
|
|
"num_tokens": 10560556.0,
|
|
"step": 6085
|
|
},
|
|
{
|
|
"entropy": 5.732918691635132,
|
|
"epoch": 0.4738377747519938,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.0004982339962580119,
|
|
"loss": 5.7323,
|
|
"mean_token_accuracy": 0.14882105439901352,
|
|
"num_tokens": 10569361.0,
|
|
"step": 6090
|
|
},
|
|
{
|
|
"entropy": 5.668002557754517,
|
|
"epoch": 0.4742268041237113,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0004982305288738859,
|
|
"loss": 5.5426,
|
|
"mean_token_accuracy": 0.16289373785257338,
|
|
"num_tokens": 10577997.0,
|
|
"step": 6095
|
|
},
|
|
{
|
|
"entropy": 5.701682186126709,
|
|
"epoch": 0.4746158334954289,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0004982270581025919,
|
|
"loss": 5.6444,
|
|
"mean_token_accuracy": 0.1589728429913521,
|
|
"num_tokens": 10587005.0,
|
|
"step": 6100
|
|
},
|
|
{
|
|
"entropy": 5.65606369972229,
|
|
"epoch": 0.4750048628671465,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.0004982235839441826,
|
|
"loss": 5.5047,
|
|
"mean_token_accuracy": 0.17128463685512543,
|
|
"num_tokens": 10595196.0,
|
|
"step": 6105
|
|
},
|
|
{
|
|
"entropy": 5.691293668746948,
|
|
"epoch": 0.475393892238864,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.0004982201063987108,
|
|
"loss": 5.6487,
|
|
"mean_token_accuracy": 0.14815771952271461,
|
|
"num_tokens": 10603796.0,
|
|
"step": 6110
|
|
},
|
|
{
|
|
"entropy": 5.697172737121582,
|
|
"epoch": 0.4757829216105816,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.0004982166254662292,
|
|
"loss": 5.6324,
|
|
"mean_token_accuracy": 0.15333464592695237,
|
|
"num_tokens": 10612895.0,
|
|
"step": 6115
|
|
},
|
|
{
|
|
"entropy": 5.72194128036499,
|
|
"epoch": 0.47617195098229914,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.0004982131411467904,
|
|
"loss": 5.6968,
|
|
"mean_token_accuracy": 0.1535396084189415,
|
|
"num_tokens": 10621310.0,
|
|
"step": 6120
|
|
},
|
|
{
|
|
"entropy": 5.626172780990601,
|
|
"epoch": 0.4765609803540167,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.0004982096534404476,
|
|
"loss": 5.5128,
|
|
"mean_token_accuracy": 0.16079071760177613,
|
|
"num_tokens": 10629598.0,
|
|
"step": 6125
|
|
},
|
|
{
|
|
"entropy": 5.72747836112976,
|
|
"epoch": 0.4769500097257343,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.0004982061623472535,
|
|
"loss": 5.5331,
|
|
"mean_token_accuracy": 0.15735719203948975,
|
|
"num_tokens": 10638218.0,
|
|
"step": 6130
|
|
},
|
|
{
|
|
"entropy": 5.687162113189697,
|
|
"epoch": 0.47733903909745184,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.0004982026678672612,
|
|
"loss": 5.6234,
|
|
"mean_token_accuracy": 0.1520923927426338,
|
|
"num_tokens": 10647215.0,
|
|
"step": 6135
|
|
},
|
|
{
|
|
"entropy": 5.688553428649902,
|
|
"epoch": 0.47772806846916943,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0004981991700005238,
|
|
"loss": 5.7478,
|
|
"mean_token_accuracy": 0.14633624255657196,
|
|
"num_tokens": 10655755.0,
|
|
"step": 6140
|
|
},
|
|
{
|
|
"entropy": 5.761098909378052,
|
|
"epoch": 0.47811709784088696,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.000498195668747094,
|
|
"loss": 5.6224,
|
|
"mean_token_accuracy": 0.1543148413300514,
|
|
"num_tokens": 10663969.0,
|
|
"step": 6145
|
|
},
|
|
{
|
|
"entropy": 5.714224195480346,
|
|
"epoch": 0.47850612721260455,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.0004981921641070254,
|
|
"loss": 5.493,
|
|
"mean_token_accuracy": 0.16152573823928834,
|
|
"num_tokens": 10672048.0,
|
|
"step": 6150
|
|
},
|
|
{
|
|
"entropy": 5.627324819564819,
|
|
"epoch": 0.47889515658432213,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0004981886560803708,
|
|
"loss": 5.6021,
|
|
"mean_token_accuracy": 0.15429380685091018,
|
|
"num_tokens": 10681802.0,
|
|
"step": 6155
|
|
},
|
|
{
|
|
"entropy": 5.68464241027832,
|
|
"epoch": 0.47928418595603967,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 0.0004981851446671838,
|
|
"loss": 5.6538,
|
|
"mean_token_accuracy": 0.14972650855779648,
|
|
"num_tokens": 10690618.0,
|
|
"step": 6160
|
|
},
|
|
{
|
|
"entropy": 5.689493703842163,
|
|
"epoch": 0.47967321532775725,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0004981816298675173,
|
|
"loss": 5.5716,
|
|
"mean_token_accuracy": 0.15978924930095673,
|
|
"num_tokens": 10699080.0,
|
|
"step": 6165
|
|
},
|
|
{
|
|
"entropy": 5.633434629440307,
|
|
"epoch": 0.4800622446994748,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004981781116814248,
|
|
"loss": 5.5734,
|
|
"mean_token_accuracy": 0.15396522134542465,
|
|
"num_tokens": 10708939.0,
|
|
"step": 6170
|
|
},
|
|
{
|
|
"entropy": 5.723195362091064,
|
|
"epoch": 0.48045127407119237,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0004981745901089596,
|
|
"loss": 5.4795,
|
|
"mean_token_accuracy": 0.15833590775728226,
|
|
"num_tokens": 10717356.0,
|
|
"step": 6175
|
|
},
|
|
{
|
|
"entropy": 5.667737150192261,
|
|
"epoch": 0.48084030344290996,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.0004981710651501753,
|
|
"loss": 5.568,
|
|
"mean_token_accuracy": 0.15206077918410302,
|
|
"num_tokens": 10725616.0,
|
|
"step": 6180
|
|
},
|
|
{
|
|
"entropy": 5.615799808502198,
|
|
"epoch": 0.4812293328146275,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.0004981675368051254,
|
|
"loss": 5.5753,
|
|
"mean_token_accuracy": 0.1609847441315651,
|
|
"num_tokens": 10734337.0,
|
|
"step": 6185
|
|
},
|
|
{
|
|
"entropy": 5.684136199951172,
|
|
"epoch": 0.4816183621863451,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0004981640050738633,
|
|
"loss": 5.6006,
|
|
"mean_token_accuracy": 0.15555059164762497,
|
|
"num_tokens": 10742720.0,
|
|
"step": 6190
|
|
},
|
|
{
|
|
"entropy": 5.7327721118927,
|
|
"epoch": 0.48200739155806266,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 0.0004981604699564426,
|
|
"loss": 5.6446,
|
|
"mean_token_accuracy": 0.14744160026311875,
|
|
"num_tokens": 10751809.0,
|
|
"step": 6195
|
|
},
|
|
{
|
|
"entropy": 5.6392982006073,
|
|
"epoch": 0.4823964209297802,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0004981569314529169,
|
|
"loss": 5.5001,
|
|
"mean_token_accuracy": 0.15971516519784928,
|
|
"num_tokens": 10759879.0,
|
|
"step": 6200
|
|
},
|
|
{
|
|
"entropy": 5.5582897663116455,
|
|
"epoch": 0.4827854503014978,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.00049815338956334,
|
|
"loss": 5.5642,
|
|
"mean_token_accuracy": 0.15791321396827698,
|
|
"num_tokens": 10769309.0,
|
|
"step": 6205
|
|
},
|
|
{
|
|
"entropy": 5.654816770553589,
|
|
"epoch": 0.4831744796732153,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0004981498442877656,
|
|
"loss": 5.4911,
|
|
"mean_token_accuracy": 0.16367221474647523,
|
|
"num_tokens": 10777676.0,
|
|
"step": 6210
|
|
},
|
|
{
|
|
"entropy": 5.650180530548096,
|
|
"epoch": 0.4835635090449329,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.0004981462956262474,
|
|
"loss": 5.708,
|
|
"mean_token_accuracy": 0.15045704692602158,
|
|
"num_tokens": 10786278.0,
|
|
"step": 6215
|
|
},
|
|
{
|
|
"entropy": 5.742503547668457,
|
|
"epoch": 0.4839525384166505,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0004981427435788396,
|
|
"loss": 5.6291,
|
|
"mean_token_accuracy": 0.15221197307109832,
|
|
"num_tokens": 10795323.0,
|
|
"step": 6220
|
|
},
|
|
{
|
|
"entropy": 5.7140473365783695,
|
|
"epoch": 0.484341567788368,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0004981391881455957,
|
|
"loss": 5.5261,
|
|
"mean_token_accuracy": 0.15894377529621123,
|
|
"num_tokens": 10803978.0,
|
|
"step": 6225
|
|
},
|
|
{
|
|
"entropy": 5.671517276763916,
|
|
"epoch": 0.4847305971600856,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.0004981356293265696,
|
|
"loss": 5.6268,
|
|
"mean_token_accuracy": 0.15697673261165618,
|
|
"num_tokens": 10812488.0,
|
|
"step": 6230
|
|
},
|
|
{
|
|
"entropy": 5.6791136264801025,
|
|
"epoch": 0.4851196265318031,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.0004981320671218157,
|
|
"loss": 5.5952,
|
|
"mean_token_accuracy": 0.1559137649834156,
|
|
"num_tokens": 10821076.0,
|
|
"step": 6235
|
|
},
|
|
{
|
|
"entropy": 5.59618444442749,
|
|
"epoch": 0.4855086559035207,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.0004981285015313877,
|
|
"loss": 5.424,
|
|
"mean_token_accuracy": 0.17230252772569657,
|
|
"num_tokens": 10828634.0,
|
|
"step": 6240
|
|
},
|
|
{
|
|
"entropy": 5.599424219131469,
|
|
"epoch": 0.4858976852752383,
|
|
"grad_norm": 1.5546875,
|
|
"learning_rate": 0.0004981249325553399,
|
|
"loss": 5.5609,
|
|
"mean_token_accuracy": 0.15971072167158126,
|
|
"num_tokens": 10837481.0,
|
|
"step": 6245
|
|
},
|
|
{
|
|
"entropy": 5.683236837387085,
|
|
"epoch": 0.48628671464695583,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0004981213601937264,
|
|
"loss": 5.6434,
|
|
"mean_token_accuracy": 0.15290929526090621,
|
|
"num_tokens": 10846729.0,
|
|
"step": 6250
|
|
},
|
|
{
|
|
"entropy": 5.744317626953125,
|
|
"epoch": 0.4866757440186734,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.0004981177844466013,
|
|
"loss": 5.616,
|
|
"mean_token_accuracy": 0.15153464525938035,
|
|
"num_tokens": 10855344.0,
|
|
"step": 6255
|
|
},
|
|
{
|
|
"entropy": 5.702961158752442,
|
|
"epoch": 0.48706477339039095,
|
|
"grad_norm": 1.5,
|
|
"learning_rate": 0.0004981142053140192,
|
|
"loss": 5.6496,
|
|
"mean_token_accuracy": 0.15403816998004913,
|
|
"num_tokens": 10863934.0,
|
|
"step": 6260
|
|
},
|
|
{
|
|
"entropy": 5.659459257125855,
|
|
"epoch": 0.48745380276210853,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.0004981106227960339,
|
|
"loss": 5.6108,
|
|
"mean_token_accuracy": 0.15299373418092727,
|
|
"num_tokens": 10872031.0,
|
|
"step": 6265
|
|
},
|
|
{
|
|
"entropy": 5.730347967147827,
|
|
"epoch": 0.4878428321338261,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0004981070368927001,
|
|
"loss": 5.6902,
|
|
"mean_token_accuracy": 0.15396978259086608,
|
|
"num_tokens": 10881385.0,
|
|
"step": 6270
|
|
},
|
|
{
|
|
"entropy": 5.695536041259766,
|
|
"epoch": 0.48823186150554365,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.000498103447604072,
|
|
"loss": 5.5999,
|
|
"mean_token_accuracy": 0.16020937711000444,
|
|
"num_tokens": 10890483.0,
|
|
"step": 6275
|
|
},
|
|
{
|
|
"entropy": 5.704893159866333,
|
|
"epoch": 0.48862089087726124,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0004980998549302044,
|
|
"loss": 5.6332,
|
|
"mean_token_accuracy": 0.16258720457553863,
|
|
"num_tokens": 10898338.0,
|
|
"step": 6280
|
|
},
|
|
{
|
|
"entropy": 5.659977054595947,
|
|
"epoch": 0.4890099202489788,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 0.0004980962588711516,
|
|
"loss": 5.6093,
|
|
"mean_token_accuracy": 0.1559084713459015,
|
|
"num_tokens": 10908087.0,
|
|
"step": 6285
|
|
},
|
|
{
|
|
"entropy": 5.747127103805542,
|
|
"epoch": 0.48939894962069636,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.000498092659426968,
|
|
"loss": 5.6047,
|
|
"mean_token_accuracy": 0.14977360516786575,
|
|
"num_tokens": 10916704.0,
|
|
"step": 6290
|
|
},
|
|
{
|
|
"entropy": 5.733406352996826,
|
|
"epoch": 0.48978797899241394,
|
|
"grad_norm": 1.6328125,
|
|
"learning_rate": 0.0004980890565977085,
|
|
"loss": 5.5708,
|
|
"mean_token_accuracy": 0.15654229521751403,
|
|
"num_tokens": 10925186.0,
|
|
"step": 6295
|
|
},
|
|
{
|
|
"entropy": 5.670359992980957,
|
|
"epoch": 0.4901770083641315,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.0004980854503834276,
|
|
"loss": 5.6237,
|
|
"mean_token_accuracy": 0.15868111401796342,
|
|
"num_tokens": 10934247.0,
|
|
"step": 6300
|
|
},
|
|
{
|
|
"entropy": 5.730028200149536,
|
|
"epoch": 0.49056603773584906,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0004980818407841802,
|
|
"loss": 5.6388,
|
|
"mean_token_accuracy": 0.15077922344207764,
|
|
"num_tokens": 10944260.0,
|
|
"step": 6305
|
|
},
|
|
{
|
|
"entropy": 5.684900522232056,
|
|
"epoch": 0.49095506710756665,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.0004980782278000207,
|
|
"loss": 5.6024,
|
|
"mean_token_accuracy": 0.15438488870859146,
|
|
"num_tokens": 10954065.0,
|
|
"step": 6310
|
|
},
|
|
{
|
|
"entropy": 5.69667501449585,
|
|
"epoch": 0.4913440964792842,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0004980746114310043,
|
|
"loss": 5.6701,
|
|
"mean_token_accuracy": 0.15619819164276122,
|
|
"num_tokens": 10962918.0,
|
|
"step": 6315
|
|
},
|
|
{
|
|
"entropy": 5.599684524536133,
|
|
"epoch": 0.49173312585100176,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0004980709916771858,
|
|
"loss": 5.5242,
|
|
"mean_token_accuracy": 0.1607260599732399,
|
|
"num_tokens": 10972356.0,
|
|
"step": 6320
|
|
},
|
|
{
|
|
"entropy": 5.636107015609741,
|
|
"epoch": 0.4921221552227193,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 0.0004980673685386198,
|
|
"loss": 5.5757,
|
|
"mean_token_accuracy": 0.15274077281355858,
|
|
"num_tokens": 10980984.0,
|
|
"step": 6325
|
|
},
|
|
{
|
|
"entropy": 5.631813192367554,
|
|
"epoch": 0.4925111845944369,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.0004980637420153618,
|
|
"loss": 5.5111,
|
|
"mean_token_accuracy": 0.15772687792778015,
|
|
"num_tokens": 10989809.0,
|
|
"step": 6330
|
|
},
|
|
{
|
|
"entropy": 5.665310287475586,
|
|
"epoch": 0.49290021396615447,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.0004980601121074664,
|
|
"loss": 5.5641,
|
|
"mean_token_accuracy": 0.1530244916677475,
|
|
"num_tokens": 10998824.0,
|
|
"step": 6335
|
|
},
|
|
{
|
|
"entropy": 5.738433790206909,
|
|
"epoch": 0.493289243337872,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0004980564788149889,
|
|
"loss": 5.6617,
|
|
"mean_token_accuracy": 0.15882298350334167,
|
|
"num_tokens": 11006755.0,
|
|
"step": 6340
|
|
},
|
|
{
|
|
"entropy": 5.645573234558105,
|
|
"epoch": 0.4936782727095896,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0004980528421379844,
|
|
"loss": 5.5346,
|
|
"mean_token_accuracy": 0.16477559357881547,
|
|
"num_tokens": 11015337.0,
|
|
"step": 6345
|
|
},
|
|
{
|
|
"entropy": 5.5610456466674805,
|
|
"epoch": 0.4940673020813071,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.000498049202076508,
|
|
"loss": 5.4638,
|
|
"mean_token_accuracy": 0.16363136917352678,
|
|
"num_tokens": 11024186.0,
|
|
"step": 6350
|
|
},
|
|
{
|
|
"entropy": 5.689836311340332,
|
|
"epoch": 0.4944563314530247,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0004980455586306149,
|
|
"loss": 5.586,
|
|
"mean_token_accuracy": 0.16271042674779893,
|
|
"num_tokens": 11032504.0,
|
|
"step": 6355
|
|
},
|
|
{
|
|
"entropy": 5.724547481536865,
|
|
"epoch": 0.4948453608247423,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.0004980419118003605,
|
|
"loss": 5.5451,
|
|
"mean_token_accuracy": 0.1571075886487961,
|
|
"num_tokens": 11042252.0,
|
|
"step": 6360
|
|
},
|
|
{
|
|
"entropy": 5.6988561153411865,
|
|
"epoch": 0.4952343901964598,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.0004980382615858001,
|
|
"loss": 5.6027,
|
|
"mean_token_accuracy": 0.15843562185764312,
|
|
"num_tokens": 11051361.0,
|
|
"step": 6365
|
|
},
|
|
{
|
|
"entropy": 5.635060262680054,
|
|
"epoch": 0.4956234195681774,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0004980346079869892,
|
|
"loss": 5.5843,
|
|
"mean_token_accuracy": 0.1544535830616951,
|
|
"num_tokens": 11060822.0,
|
|
"step": 6370
|
|
},
|
|
{
|
|
"entropy": 5.700907468795776,
|
|
"epoch": 0.49601244893989493,
|
|
"grad_norm": 1.53125,
|
|
"learning_rate": 0.000498030951003983,
|
|
"loss": 5.6455,
|
|
"mean_token_accuracy": 0.1547166809439659,
|
|
"num_tokens": 11069528.0,
|
|
"step": 6375
|
|
},
|
|
{
|
|
"entropy": 5.679643297195435,
|
|
"epoch": 0.4964014783116125,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0004980272906368371,
|
|
"loss": 5.4827,
|
|
"mean_token_accuracy": 0.16679324954748154,
|
|
"num_tokens": 11077917.0,
|
|
"step": 6380
|
|
},
|
|
{
|
|
"entropy": 5.59128475189209,
|
|
"epoch": 0.4967905076833301,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004980236268856071,
|
|
"loss": 5.5546,
|
|
"mean_token_accuracy": 0.1547350376844406,
|
|
"num_tokens": 11085938.0,
|
|
"step": 6385
|
|
},
|
|
{
|
|
"entropy": 5.609622240066528,
|
|
"epoch": 0.49717953705504764,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0004980199597503487,
|
|
"loss": 5.6147,
|
|
"mean_token_accuracy": 0.15192969441413878,
|
|
"num_tokens": 11094898.0,
|
|
"step": 6390
|
|
},
|
|
{
|
|
"entropy": 5.693767881393432,
|
|
"epoch": 0.4975685664267652,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.0004980162892311171,
|
|
"loss": 5.4737,
|
|
"mean_token_accuracy": 0.16259513646364213,
|
|
"num_tokens": 11103038.0,
|
|
"step": 6395
|
|
},
|
|
{
|
|
"entropy": 5.697658061981201,
|
|
"epoch": 0.4979575957984828,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0004980126153279684,
|
|
"loss": 5.5723,
|
|
"mean_token_accuracy": 0.15827525407075882,
|
|
"num_tokens": 11111965.0,
|
|
"step": 6400
|
|
},
|
|
{
|
|
"entropy": 5.605089139938355,
|
|
"epoch": 0.49834662517020034,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0004980089380409583,
|
|
"loss": 5.5947,
|
|
"mean_token_accuracy": 0.15535541325807573,
|
|
"num_tokens": 11121482.0,
|
|
"step": 6405
|
|
},
|
|
{
|
|
"entropy": 5.672932577133179,
|
|
"epoch": 0.4987356545419179,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.0004980052573701424,
|
|
"loss": 5.5853,
|
|
"mean_token_accuracy": 0.15607178062200547,
|
|
"num_tokens": 11129742.0,
|
|
"step": 6410
|
|
},
|
|
{
|
|
"entropy": 5.675456905364991,
|
|
"epoch": 0.49912468391363546,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004980015733155767,
|
|
"loss": 5.5873,
|
|
"mean_token_accuracy": 0.15734535753726958,
|
|
"num_tokens": 11138388.0,
|
|
"step": 6415
|
|
},
|
|
{
|
|
"entropy": 5.520279121398926,
|
|
"epoch": 0.49951371328535304,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.0004979978858773171,
|
|
"loss": 5.3289,
|
|
"mean_token_accuracy": 0.17224133461713792,
|
|
"num_tokens": 11146967.0,
|
|
"step": 6420
|
|
},
|
|
{
|
|
"entropy": 5.645619964599609,
|
|
"epoch": 0.49990274265707063,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0004979941950554195,
|
|
"loss": 5.6735,
|
|
"mean_token_accuracy": 0.15287676751613616,
|
|
"num_tokens": 11155888.0,
|
|
"step": 6425
|
|
},
|
|
{
|
|
"entropy": 5.717220449447632,
|
|
"epoch": 0.5002917720287882,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.0004979905008499399,
|
|
"loss": 5.5328,
|
|
"mean_token_accuracy": 0.15672664046287538,
|
|
"num_tokens": 11164358.0,
|
|
"step": 6430
|
|
},
|
|
{
|
|
"entropy": 5.59271731376648,
|
|
"epoch": 0.5006808014005057,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0004979868032609344,
|
|
"loss": 5.3922,
|
|
"mean_token_accuracy": 0.17046331167221068,
|
|
"num_tokens": 11172416.0,
|
|
"step": 6435
|
|
},
|
|
{
|
|
"entropy": 5.661533260345459,
|
|
"epoch": 0.5010698307722233,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0004979831022884591,
|
|
"loss": 5.5715,
|
|
"mean_token_accuracy": 0.15518891513347627,
|
|
"num_tokens": 11181159.0,
|
|
"step": 6440
|
|
},
|
|
{
|
|
"entropy": 5.6787347316741945,
|
|
"epoch": 0.5014588601439409,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.0004979793979325701,
|
|
"loss": 5.6135,
|
|
"mean_token_accuracy": 0.15603988468647004,
|
|
"num_tokens": 11189725.0,
|
|
"step": 6445
|
|
},
|
|
{
|
|
"entropy": 5.678800773620606,
|
|
"epoch": 0.5018478895156584,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.0004979756901933236,
|
|
"loss": 5.5999,
|
|
"mean_token_accuracy": 0.15560702234506607,
|
|
"num_tokens": 11197795.0,
|
|
"step": 6450
|
|
},
|
|
{
|
|
"entropy": 5.674616813659668,
|
|
"epoch": 0.502236918887376,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.000497971979070776,
|
|
"loss": 5.5438,
|
|
"mean_token_accuracy": 0.16058342829346656,
|
|
"num_tokens": 11205352.0,
|
|
"step": 6455
|
|
},
|
|
{
|
|
"entropy": 5.674797487258911,
|
|
"epoch": 0.5026259482590936,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.0004979682645649834,
|
|
"loss": 5.6084,
|
|
"mean_token_accuracy": 0.1550489269196987,
|
|
"num_tokens": 11214142.0,
|
|
"step": 6460
|
|
},
|
|
{
|
|
"entropy": 5.61780571937561,
|
|
"epoch": 0.5030149776308112,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0004979645466760025,
|
|
"loss": 5.4781,
|
|
"mean_token_accuracy": 0.16321058422327042,
|
|
"num_tokens": 11222565.0,
|
|
"step": 6465
|
|
},
|
|
{
|
|
"entropy": 5.588930559158325,
|
|
"epoch": 0.5034040070025287,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0004979608254038892,
|
|
"loss": 5.5811,
|
|
"mean_token_accuracy": 0.15546856224536895,
|
|
"num_tokens": 11231829.0,
|
|
"step": 6470
|
|
},
|
|
{
|
|
"entropy": 5.624651479721069,
|
|
"epoch": 0.5037930363742462,
|
|
"grad_norm": 1.984375,
|
|
"learning_rate": 0.0004979571007487003,
|
|
"loss": 5.5923,
|
|
"mean_token_accuracy": 0.15631648153066635,
|
|
"num_tokens": 11240302.0,
|
|
"step": 6475
|
|
},
|
|
{
|
|
"entropy": 5.791405725479126,
|
|
"epoch": 0.5041820657459638,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 0.0004979533727104924,
|
|
"loss": 5.6838,
|
|
"mean_token_accuracy": 0.1518307164311409,
|
|
"num_tokens": 11248610.0,
|
|
"step": 6480
|
|
},
|
|
{
|
|
"entropy": 5.69047703742981,
|
|
"epoch": 0.5045710951176814,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.000497949641289322,
|
|
"loss": 5.5964,
|
|
"mean_token_accuracy": 0.15891549587249756,
|
|
"num_tokens": 11257441.0,
|
|
"step": 6485
|
|
},
|
|
{
|
|
"entropy": 5.549295377731323,
|
|
"epoch": 0.504960124489399,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0004979459064852456,
|
|
"loss": 5.4659,
|
|
"mean_token_accuracy": 0.15760838985443115,
|
|
"num_tokens": 11265915.0,
|
|
"step": 6490
|
|
},
|
|
{
|
|
"entropy": 5.648113203048706,
|
|
"epoch": 0.5053491538611166,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.0004979421682983197,
|
|
"loss": 5.5975,
|
|
"mean_token_accuracy": 0.15131368562579156,
|
|
"num_tokens": 11274165.0,
|
|
"step": 6495
|
|
},
|
|
{
|
|
"entropy": 5.706796312332154,
|
|
"epoch": 0.505738183232834,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0004979384267286015,
|
|
"loss": 5.5461,
|
|
"mean_token_accuracy": 0.16159669756889344,
|
|
"num_tokens": 11283316.0,
|
|
"step": 6500
|
|
},
|
|
{
|
|
"entropy": 5.690013027191162,
|
|
"epoch": 0.5061272126045516,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.0004979346817761475,
|
|
"loss": 5.6692,
|
|
"mean_token_accuracy": 0.15432394593954085,
|
|
"num_tokens": 11292289.0,
|
|
"step": 6505
|
|
},
|
|
{
|
|
"entropy": 5.678025627136231,
|
|
"epoch": 0.5065162419762692,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004979309334410144,
|
|
"loss": 5.5717,
|
|
"mean_token_accuracy": 0.15459866374731063,
|
|
"num_tokens": 11301192.0,
|
|
"step": 6510
|
|
},
|
|
{
|
|
"entropy": 5.6778205871582035,
|
|
"epoch": 0.5069052713479868,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.0004979271817232594,
|
|
"loss": 5.5882,
|
|
"mean_token_accuracy": 0.1566533237695694,
|
|
"num_tokens": 11309906.0,
|
|
"step": 6515
|
|
},
|
|
{
|
|
"entropy": 5.721369457244873,
|
|
"epoch": 0.5072943007197044,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0004979234266229391,
|
|
"loss": 5.5822,
|
|
"mean_token_accuracy": 0.15548757910728456,
|
|
"num_tokens": 11318227.0,
|
|
"step": 6520
|
|
},
|
|
{
|
|
"entropy": 5.576367330551148,
|
|
"epoch": 0.5076833300914219,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0004979196681401106,
|
|
"loss": 5.5998,
|
|
"mean_token_accuracy": 0.1588978312909603,
|
|
"num_tokens": 11327524.0,
|
|
"step": 6525
|
|
},
|
|
{
|
|
"entropy": 5.630653429031372,
|
|
"epoch": 0.5080723594631394,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.000497915906274831,
|
|
"loss": 5.5438,
|
|
"mean_token_accuracy": 0.161087529361248,
|
|
"num_tokens": 11336214.0,
|
|
"step": 6530
|
|
},
|
|
{
|
|
"entropy": 5.631156921386719,
|
|
"epoch": 0.508461388834857,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.0004979121410271574,
|
|
"loss": 5.3896,
|
|
"mean_token_accuracy": 0.16864126175642014,
|
|
"num_tokens": 11344551.0,
|
|
"step": 6535
|
|
},
|
|
{
|
|
"entropy": 5.530792999267578,
|
|
"epoch": 0.5088504182065746,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0004979083723971468,
|
|
"loss": 5.46,
|
|
"mean_token_accuracy": 0.16636885404586793,
|
|
"num_tokens": 11353180.0,
|
|
"step": 6540
|
|
},
|
|
{
|
|
"entropy": 5.495325994491577,
|
|
"epoch": 0.5092394475782922,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0004979046003848564,
|
|
"loss": 5.4368,
|
|
"mean_token_accuracy": 0.16852892339229583,
|
|
"num_tokens": 11361343.0,
|
|
"step": 6545
|
|
},
|
|
{
|
|
"entropy": 5.625004386901855,
|
|
"epoch": 0.5096284769500097,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0004979008249903435,
|
|
"loss": 5.5466,
|
|
"mean_token_accuracy": 0.16107016056776047,
|
|
"num_tokens": 11369915.0,
|
|
"step": 6550
|
|
},
|
|
{
|
|
"entropy": 5.6815948486328125,
|
|
"epoch": 0.5100175063217273,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004978970462136655,
|
|
"loss": 5.564,
|
|
"mean_token_accuracy": 0.15614417046308518,
|
|
"num_tokens": 11379813.0,
|
|
"step": 6555
|
|
},
|
|
{
|
|
"entropy": 5.628446245193482,
|
|
"epoch": 0.5104065356934449,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0004978932640548794,
|
|
"loss": 5.5171,
|
|
"mean_token_accuracy": 0.15718891769647597,
|
|
"num_tokens": 11388029.0,
|
|
"step": 6560
|
|
},
|
|
{
|
|
"entropy": 5.600995826721191,
|
|
"epoch": 0.5107955650651624,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0004978894785140429,
|
|
"loss": 5.458,
|
|
"mean_token_accuracy": 0.15973847061395646,
|
|
"num_tokens": 11395852.0,
|
|
"step": 6565
|
|
},
|
|
{
|
|
"entropy": 5.605973625183106,
|
|
"epoch": 0.51118459443688,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0004978856895912132,
|
|
"loss": 5.5467,
|
|
"mean_token_accuracy": 0.1593152642250061,
|
|
"num_tokens": 11404756.0,
|
|
"step": 6570
|
|
},
|
|
{
|
|
"entropy": 5.763776159286499,
|
|
"epoch": 0.5115736238085975,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 0.0004978818972864481,
|
|
"loss": 5.7037,
|
|
"mean_token_accuracy": 0.149703748524189,
|
|
"num_tokens": 11413301.0,
|
|
"step": 6575
|
|
},
|
|
{
|
|
"entropy": 5.687377214431763,
|
|
"epoch": 0.5119626531803151,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0004978781015998048,
|
|
"loss": 5.4517,
|
|
"mean_token_accuracy": 0.16738782972097396,
|
|
"num_tokens": 11421034.0,
|
|
"step": 6580
|
|
},
|
|
{
|
|
"entropy": 5.586408901214599,
|
|
"epoch": 0.5123516825520327,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.0004978743025313413,
|
|
"loss": 5.4916,
|
|
"mean_token_accuracy": 0.15781426280736924,
|
|
"num_tokens": 11429066.0,
|
|
"step": 6585
|
|
},
|
|
{
|
|
"entropy": 5.5836893081665036,
|
|
"epoch": 0.5127407119237503,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0004978705000811148,
|
|
"loss": 5.5184,
|
|
"mean_token_accuracy": 0.16265126764774324,
|
|
"num_tokens": 11438109.0,
|
|
"step": 6590
|
|
},
|
|
{
|
|
"entropy": 5.682431221008301,
|
|
"epoch": 0.5131297412954678,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0004978666942491832,
|
|
"loss": 5.5468,
|
|
"mean_token_accuracy": 0.16171859800815583,
|
|
"num_tokens": 11446787.0,
|
|
"step": 6595
|
|
},
|
|
{
|
|
"entropy": 5.576941347122192,
|
|
"epoch": 0.5135187706671853,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0004978628850356043,
|
|
"loss": 5.4978,
|
|
"mean_token_accuracy": 0.15480518341064453,
|
|
"num_tokens": 11456262.0,
|
|
"step": 6600
|
|
},
|
|
{
|
|
"entropy": 5.6838137149810795,
|
|
"epoch": 0.5139078000389029,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.0004978590724404358,
|
|
"loss": 5.4963,
|
|
"mean_token_accuracy": 0.16990127712488173,
|
|
"num_tokens": 11464297.0,
|
|
"step": 6605
|
|
},
|
|
{
|
|
"entropy": 5.693605375289917,
|
|
"epoch": 0.5142968294106205,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0004978552564637356,
|
|
"loss": 5.5981,
|
|
"mean_token_accuracy": 0.15441921055316926,
|
|
"num_tokens": 11473519.0,
|
|
"step": 6610
|
|
},
|
|
{
|
|
"entropy": 5.644426012039185,
|
|
"epoch": 0.5146858587823381,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0004978514371055616,
|
|
"loss": 5.5747,
|
|
"mean_token_accuracy": 0.15011529326438905,
|
|
"num_tokens": 11482249.0,
|
|
"step": 6615
|
|
},
|
|
{
|
|
"entropy": 5.589239454269409,
|
|
"epoch": 0.5150748881540557,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0004978476143659718,
|
|
"loss": 5.5288,
|
|
"mean_token_accuracy": 0.1568063020706177,
|
|
"num_tokens": 11490687.0,
|
|
"step": 6620
|
|
},
|
|
{
|
|
"entropy": 5.607043504714966,
|
|
"epoch": 0.5154639175257731,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0004978437882450241,
|
|
"loss": 5.5485,
|
|
"mean_token_accuracy": 0.16212338656187059,
|
|
"num_tokens": 11500225.0,
|
|
"step": 6625
|
|
},
|
|
{
|
|
"entropy": 5.6719512939453125,
|
|
"epoch": 0.5158529468974907,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0004978399587427766,
|
|
"loss": 5.4822,
|
|
"mean_token_accuracy": 0.16089026927947997,
|
|
"num_tokens": 11508116.0,
|
|
"step": 6630
|
|
},
|
|
{
|
|
"entropy": 5.567082118988037,
|
|
"epoch": 0.5162419762692083,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0004978361258592874,
|
|
"loss": 5.5642,
|
|
"mean_token_accuracy": 0.15507243424654008,
|
|
"num_tokens": 11516525.0,
|
|
"step": 6635
|
|
},
|
|
{
|
|
"entropy": 5.6446949481964115,
|
|
"epoch": 0.5166310056409259,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0004978322895946147,
|
|
"loss": 5.538,
|
|
"mean_token_accuracy": 0.16238362938165665,
|
|
"num_tokens": 11525434.0,
|
|
"step": 6640
|
|
},
|
|
{
|
|
"entropy": 5.695188665390015,
|
|
"epoch": 0.5170200350126435,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004978284499488167,
|
|
"loss": 5.5602,
|
|
"mean_token_accuracy": 0.15848546028137206,
|
|
"num_tokens": 11534318.0,
|
|
"step": 6645
|
|
},
|
|
{
|
|
"entropy": 5.600885820388794,
|
|
"epoch": 0.5174090643843611,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0004978246069219516,
|
|
"loss": 5.5403,
|
|
"mean_token_accuracy": 0.16719124466180801,
|
|
"num_tokens": 11542777.0,
|
|
"step": 6650
|
|
},
|
|
{
|
|
"entropy": 5.561204528808593,
|
|
"epoch": 0.5177980937560785,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0004978207605140777,
|
|
"loss": 5.5148,
|
|
"mean_token_accuracy": 0.16363105028867722,
|
|
"num_tokens": 11550888.0,
|
|
"step": 6655
|
|
},
|
|
{
|
|
"entropy": 5.622227907180786,
|
|
"epoch": 0.5181871231277961,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.0004978169107252534,
|
|
"loss": 5.5435,
|
|
"mean_token_accuracy": 0.15494584143161774,
|
|
"num_tokens": 11560047.0,
|
|
"step": 6660
|
|
},
|
|
{
|
|
"entropy": 5.755712890625,
|
|
"epoch": 0.5185761524995137,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.0004978130575555373,
|
|
"loss": 5.5661,
|
|
"mean_token_accuracy": 0.1614314630627632,
|
|
"num_tokens": 11568862.0,
|
|
"step": 6665
|
|
},
|
|
{
|
|
"entropy": 5.568341636657715,
|
|
"epoch": 0.5189651818712313,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0004978092010049877,
|
|
"loss": 5.5043,
|
|
"mean_token_accuracy": 0.163470259308815,
|
|
"num_tokens": 11577509.0,
|
|
"step": 6670
|
|
},
|
|
{
|
|
"entropy": 5.6859883785247805,
|
|
"epoch": 0.5193542112429489,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.000497805341073663,
|
|
"loss": 5.6282,
|
|
"mean_token_accuracy": 0.15651989430189134,
|
|
"num_tokens": 11585902.0,
|
|
"step": 6675
|
|
},
|
|
{
|
|
"entropy": 5.674084663391113,
|
|
"epoch": 0.5197432406146664,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0004978014777616219,
|
|
"loss": 5.6123,
|
|
"mean_token_accuracy": 0.16017613857984542,
|
|
"num_tokens": 11594895.0,
|
|
"step": 6680
|
|
},
|
|
{
|
|
"entropy": 5.586768913269043,
|
|
"epoch": 0.520132269986384,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0004977976110689229,
|
|
"loss": 5.4369,
|
|
"mean_token_accuracy": 0.162335567176342,
|
|
"num_tokens": 11604080.0,
|
|
"step": 6685
|
|
},
|
|
{
|
|
"entropy": 5.687888431549072,
|
|
"epoch": 0.5205212993581015,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.000497793740995625,
|
|
"loss": 5.5551,
|
|
"mean_token_accuracy": 0.15847532749176024,
|
|
"num_tokens": 11613370.0,
|
|
"step": 6690
|
|
},
|
|
{
|
|
"entropy": 5.589132499694824,
|
|
"epoch": 0.5209103287298191,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.0004977898675417866,
|
|
"loss": 5.5413,
|
|
"mean_token_accuracy": 0.15930339246988295,
|
|
"num_tokens": 11621913.0,
|
|
"step": 6695
|
|
},
|
|
{
|
|
"entropy": 5.677670526504516,
|
|
"epoch": 0.5212993581015367,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.0004977859907074664,
|
|
"loss": 5.6869,
|
|
"mean_token_accuracy": 0.1528049200773239,
|
|
"num_tokens": 11630393.0,
|
|
"step": 6700
|
|
},
|
|
{
|
|
"entropy": 5.732822036743164,
|
|
"epoch": 0.5216883874732542,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 0.0004977821104927236,
|
|
"loss": 5.6297,
|
|
"mean_token_accuracy": 0.1573626160621643,
|
|
"num_tokens": 11639038.0,
|
|
"step": 6705
|
|
},
|
|
{
|
|
"entropy": 5.6175659656524655,
|
|
"epoch": 0.5220774168449718,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0004977782268976167,
|
|
"loss": 5.5012,
|
|
"mean_token_accuracy": 0.15832498222589492,
|
|
"num_tokens": 11647355.0,
|
|
"step": 6710
|
|
},
|
|
{
|
|
"entropy": 5.581278133392334,
|
|
"epoch": 0.5224664462166894,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.0004977743399222048,
|
|
"loss": 5.5111,
|
|
"mean_token_accuracy": 0.15422431975603104,
|
|
"num_tokens": 11655899.0,
|
|
"step": 6715
|
|
},
|
|
{
|
|
"entropy": 5.753375005722046,
|
|
"epoch": 0.522855475588407,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0004977704495665471,
|
|
"loss": 5.6935,
|
|
"mean_token_accuracy": 0.14948423206806183,
|
|
"num_tokens": 11664602.0,
|
|
"step": 6720
|
|
},
|
|
{
|
|
"entropy": 5.686633586883545,
|
|
"epoch": 0.5232445049601245,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0004977665558307023,
|
|
"loss": 5.5188,
|
|
"mean_token_accuracy": 0.1614977553486824,
|
|
"num_tokens": 11673011.0,
|
|
"step": 6725
|
|
},
|
|
{
|
|
"entropy": 5.728595113754272,
|
|
"epoch": 0.523633534331842,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.0004977626587147295,
|
|
"loss": 5.6987,
|
|
"mean_token_accuracy": 0.14548852294683456,
|
|
"num_tokens": 11681989.0,
|
|
"step": 6730
|
|
},
|
|
{
|
|
"entropy": 5.722722291946411,
|
|
"epoch": 0.5240225637035596,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.000497758758218688,
|
|
"loss": 5.6269,
|
|
"mean_token_accuracy": 0.15139962285757064,
|
|
"num_tokens": 11690502.0,
|
|
"step": 6735
|
|
},
|
|
{
|
|
"entropy": 5.672935247421265,
|
|
"epoch": 0.5244115930752772,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.0004977548543426368,
|
|
"loss": 5.6226,
|
|
"mean_token_accuracy": 0.1551753543317318,
|
|
"num_tokens": 11699594.0,
|
|
"step": 6740
|
|
},
|
|
{
|
|
"entropy": 5.587326717376709,
|
|
"epoch": 0.5248006224469948,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.0004977509470866353,
|
|
"loss": 5.4916,
|
|
"mean_token_accuracy": 0.16007392406463622,
|
|
"num_tokens": 11708009.0,
|
|
"step": 6745
|
|
},
|
|
{
|
|
"entropy": 5.707208347320557,
|
|
"epoch": 0.5251896518187124,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.0004977470364507427,
|
|
"loss": 5.6656,
|
|
"mean_token_accuracy": 0.1489517107605934,
|
|
"num_tokens": 11716592.0,
|
|
"step": 6750
|
|
},
|
|
{
|
|
"entropy": 5.694457864761352,
|
|
"epoch": 0.5255786811904298,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0004977431224350184,
|
|
"loss": 5.6656,
|
|
"mean_token_accuracy": 0.1458994671702385,
|
|
"num_tokens": 11725894.0,
|
|
"step": 6755
|
|
},
|
|
{
|
|
"entropy": 5.768098592758179,
|
|
"epoch": 0.5259677105621474,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.0004977392050395217,
|
|
"loss": 5.5362,
|
|
"mean_token_accuracy": 0.1602727875113487,
|
|
"num_tokens": 11734141.0,
|
|
"step": 6760
|
|
},
|
|
{
|
|
"entropy": 5.642729377746582,
|
|
"epoch": 0.526356739933865,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.0004977352842643121,
|
|
"loss": 5.6457,
|
|
"mean_token_accuracy": 0.15595187842845917,
|
|
"num_tokens": 11742539.0,
|
|
"step": 6765
|
|
},
|
|
{
|
|
"entropy": 5.648681259155273,
|
|
"epoch": 0.5267457693055826,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.000497731360109449,
|
|
"loss": 5.5973,
|
|
"mean_token_accuracy": 0.15659012347459794,
|
|
"num_tokens": 11751649.0,
|
|
"step": 6770
|
|
},
|
|
{
|
|
"entropy": 5.729363012313843,
|
|
"epoch": 0.5271347986773002,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 0.0004977274325749922,
|
|
"loss": 5.6011,
|
|
"mean_token_accuracy": 0.1551893211901188,
|
|
"num_tokens": 11760376.0,
|
|
"step": 6775
|
|
},
|
|
{
|
|
"entropy": 5.703770875930786,
|
|
"epoch": 0.5275238280490177,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0004977235016610011,
|
|
"loss": 5.564,
|
|
"mean_token_accuracy": 0.15711267292499542,
|
|
"num_tokens": 11768644.0,
|
|
"step": 6780
|
|
},
|
|
{
|
|
"entropy": 5.734229660034179,
|
|
"epoch": 0.5279128574207352,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.0004977195673675353,
|
|
"loss": 5.6425,
|
|
"mean_token_accuracy": 0.15375020503997802,
|
|
"num_tokens": 11777282.0,
|
|
"step": 6785
|
|
},
|
|
{
|
|
"entropy": 5.625796604156494,
|
|
"epoch": 0.5283018867924528,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.0004977156296946545,
|
|
"loss": 5.5393,
|
|
"mean_token_accuracy": 0.15840379446744918,
|
|
"num_tokens": 11786108.0,
|
|
"step": 6790
|
|
},
|
|
{
|
|
"entropy": 5.676083612442016,
|
|
"epoch": 0.5286909161641704,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.0004977116886424187,
|
|
"loss": 5.5956,
|
|
"mean_token_accuracy": 0.15348794162273408,
|
|
"num_tokens": 11795151.0,
|
|
"step": 6795
|
|
},
|
|
{
|
|
"entropy": 5.786767816543579,
|
|
"epoch": 0.529079945535888,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.0004977077442108873,
|
|
"loss": 5.5445,
|
|
"mean_token_accuracy": 0.16012217849493027,
|
|
"num_tokens": 11803971.0,
|
|
"step": 6800
|
|
},
|
|
{
|
|
"entropy": 5.579844236373901,
|
|
"epoch": 0.5294689749076055,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 0.0004977037964001204,
|
|
"loss": 5.6101,
|
|
"mean_token_accuracy": 0.1626015529036522,
|
|
"num_tokens": 11812483.0,
|
|
"step": 6805
|
|
},
|
|
{
|
|
"entropy": 5.598951911926269,
|
|
"epoch": 0.5298580042793231,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.000497699845210178,
|
|
"loss": 5.4882,
|
|
"mean_token_accuracy": 0.15942364782094956,
|
|
"num_tokens": 11821144.0,
|
|
"step": 6810
|
|
},
|
|
{
|
|
"entropy": 5.649045038223266,
|
|
"epoch": 0.5302470336510406,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.0004976958906411197,
|
|
"loss": 5.4502,
|
|
"mean_token_accuracy": 0.16786729842424392,
|
|
"num_tokens": 11829298.0,
|
|
"step": 6815
|
|
},
|
|
{
|
|
"entropy": 5.6356611251831055,
|
|
"epoch": 0.5306360630227582,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.0004976919326930059,
|
|
"loss": 5.5413,
|
|
"mean_token_accuracy": 0.1632298156619072,
|
|
"num_tokens": 11837558.0,
|
|
"step": 6820
|
|
},
|
|
{
|
|
"entropy": 5.538313484191894,
|
|
"epoch": 0.5310250923944758,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.0004976879713658964,
|
|
"loss": 5.4329,
|
|
"mean_token_accuracy": 0.16372002512216569,
|
|
"num_tokens": 11845770.0,
|
|
"step": 6825
|
|
},
|
|
{
|
|
"entropy": 5.641631031036377,
|
|
"epoch": 0.5314141217661933,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.0004976840066598514,
|
|
"loss": 5.6338,
|
|
"mean_token_accuracy": 0.14802222698926926,
|
|
"num_tokens": 11854351.0,
|
|
"step": 6830
|
|
},
|
|
{
|
|
"entropy": 5.793056392669678,
|
|
"epoch": 0.5318031511379109,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0004976800385749309,
|
|
"loss": 5.6301,
|
|
"mean_token_accuracy": 0.16096321791410445,
|
|
"num_tokens": 11862610.0,
|
|
"step": 6835
|
|
},
|
|
{
|
|
"entropy": 5.6363152980804445,
|
|
"epoch": 0.5321921805096285,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.0004976760671111954,
|
|
"loss": 5.5878,
|
|
"mean_token_accuracy": 0.16149788051843644,
|
|
"num_tokens": 11871078.0,
|
|
"step": 6840
|
|
},
|
|
{
|
|
"entropy": 5.602367925643921,
|
|
"epoch": 0.532581209881346,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.000497672092268705,
|
|
"loss": 5.4558,
|
|
"mean_token_accuracy": 0.16823557317256926,
|
|
"num_tokens": 11879303.0,
|
|
"step": 6845
|
|
},
|
|
{
|
|
"entropy": 5.697409915924072,
|
|
"epoch": 0.5329702392530636,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.00049766811404752,
|
|
"loss": 5.5198,
|
|
"mean_token_accuracy": 0.15866248458623886,
|
|
"num_tokens": 11887855.0,
|
|
"step": 6850
|
|
},
|
|
{
|
|
"entropy": 5.669441270828247,
|
|
"epoch": 0.5333592686247812,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0004976641324477008,
|
|
"loss": 5.4896,
|
|
"mean_token_accuracy": 0.1634063646197319,
|
|
"num_tokens": 11896262.0,
|
|
"step": 6855
|
|
},
|
|
{
|
|
"entropy": 5.4838920593261715,
|
|
"epoch": 0.5337482979964987,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.0004976601474693077,
|
|
"loss": 5.4028,
|
|
"mean_token_accuracy": 0.16620713621377944,
|
|
"num_tokens": 11905140.0,
|
|
"step": 6860
|
|
},
|
|
{
|
|
"entropy": 5.534974670410156,
|
|
"epoch": 0.5341373273682163,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.0004976561591124014,
|
|
"loss": 5.4434,
|
|
"mean_token_accuracy": 0.1693867936730385,
|
|
"num_tokens": 11913177.0,
|
|
"step": 6865
|
|
},
|
|
{
|
|
"entropy": 5.501511096954346,
|
|
"epoch": 0.5345263567399339,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.0004976521673770421,
|
|
"loss": 5.4746,
|
|
"mean_token_accuracy": 0.16013596653938295,
|
|
"num_tokens": 11921955.0,
|
|
"step": 6870
|
|
},
|
|
{
|
|
"entropy": 5.614723873138428,
|
|
"epoch": 0.5349153861116515,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0004976481722632907,
|
|
"loss": 5.484,
|
|
"mean_token_accuracy": 0.15625718086957932,
|
|
"num_tokens": 11930976.0,
|
|
"step": 6875
|
|
},
|
|
{
|
|
"entropy": 5.621336030960083,
|
|
"epoch": 0.535304415483369,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0004976441737712076,
|
|
"loss": 5.4153,
|
|
"mean_token_accuracy": 0.16089983880519867,
|
|
"num_tokens": 11939708.0,
|
|
"step": 6880
|
|
},
|
|
{
|
|
"entropy": 5.668586921691895,
|
|
"epoch": 0.5356934448550865,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.0004976401719008536,
|
|
"loss": 5.6059,
|
|
"mean_token_accuracy": 0.15665263086557388,
|
|
"num_tokens": 11949176.0,
|
|
"step": 6885
|
|
},
|
|
{
|
|
"entropy": 5.609954023361206,
|
|
"epoch": 0.5360824742268041,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0004976361666522893,
|
|
"loss": 5.4534,
|
|
"mean_token_accuracy": 0.16610209494829178,
|
|
"num_tokens": 11958089.0,
|
|
"step": 6890
|
|
},
|
|
{
|
|
"entropy": 5.6360095024108885,
|
|
"epoch": 0.5364715035985217,
|
|
"grad_norm": 1.75,
|
|
"learning_rate": 0.0004976321580255755,
|
|
"loss": 5.5369,
|
|
"mean_token_accuracy": 0.16299730837345122,
|
|
"num_tokens": 11966719.0,
|
|
"step": 6895
|
|
},
|
|
{
|
|
"entropy": 5.68487663269043,
|
|
"epoch": 0.5368605329702393,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0004976281460207731,
|
|
"loss": 5.6002,
|
|
"mean_token_accuracy": 0.15535397827625275,
|
|
"num_tokens": 11975959.0,
|
|
"step": 6900
|
|
},
|
|
{
|
|
"entropy": 5.674017238616943,
|
|
"epoch": 0.5372495623419569,
|
|
"grad_norm": 1.5234375,
|
|
"learning_rate": 0.000497624130637943,
|
|
"loss": 5.5641,
|
|
"mean_token_accuracy": 0.16273371428251265,
|
|
"num_tokens": 11984282.0,
|
|
"step": 6905
|
|
},
|
|
{
|
|
"entropy": 5.644144487380982,
|
|
"epoch": 0.5376385917136743,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.000497620111877146,
|
|
"loss": 5.5637,
|
|
"mean_token_accuracy": 0.15435383319854737,
|
|
"num_tokens": 11993289.0,
|
|
"step": 6910
|
|
},
|
|
{
|
|
"entropy": 5.60618839263916,
|
|
"epoch": 0.5380276210853919,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.0004976160897384431,
|
|
"loss": 5.4969,
|
|
"mean_token_accuracy": 0.16079047173261643,
|
|
"num_tokens": 12002425.0,
|
|
"step": 6915
|
|
},
|
|
{
|
|
"entropy": 5.638632774353027,
|
|
"epoch": 0.5384166504571095,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0004976120642218955,
|
|
"loss": 5.5134,
|
|
"mean_token_accuracy": 0.15918543487787246,
|
|
"num_tokens": 12010435.0,
|
|
"step": 6920
|
|
},
|
|
{
|
|
"entropy": 5.5793486595153805,
|
|
"epoch": 0.5388056798288271,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.000497608035327564,
|
|
"loss": 5.5623,
|
|
"mean_token_accuracy": 0.15495380908250808,
|
|
"num_tokens": 12018768.0,
|
|
"step": 6925
|
|
},
|
|
{
|
|
"entropy": 5.678703308105469,
|
|
"epoch": 0.5391947092005447,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.00049760400305551,
|
|
"loss": 5.5672,
|
|
"mean_token_accuracy": 0.1580612525343895,
|
|
"num_tokens": 12027617.0,
|
|
"step": 6930
|
|
},
|
|
{
|
|
"entropy": 5.695169067382812,
|
|
"epoch": 0.5395837385722622,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.0004975999674057944,
|
|
"loss": 5.5489,
|
|
"mean_token_accuracy": 0.15605789721012114,
|
|
"num_tokens": 12036024.0,
|
|
"step": 6935
|
|
},
|
|
{
|
|
"entropy": 5.723021030426025,
|
|
"epoch": 0.5399727679439797,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0004975959283784787,
|
|
"loss": 5.5789,
|
|
"mean_token_accuracy": 0.1569458082318306,
|
|
"num_tokens": 12044206.0,
|
|
"step": 6940
|
|
},
|
|
{
|
|
"entropy": 5.619761753082275,
|
|
"epoch": 0.5403617973156973,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004975918859736241,
|
|
"loss": 5.4611,
|
|
"mean_token_accuracy": 0.16328767985105513,
|
|
"num_tokens": 12052294.0,
|
|
"step": 6945
|
|
},
|
|
{
|
|
"entropy": 5.593639135360718,
|
|
"epoch": 0.5407508266874149,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0004975878401912919,
|
|
"loss": 5.5733,
|
|
"mean_token_accuracy": 0.15376802980899812,
|
|
"num_tokens": 12060446.0,
|
|
"step": 6950
|
|
},
|
|
{
|
|
"entropy": 5.663234519958496,
|
|
"epoch": 0.5411398560591325,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.0004975837910315436,
|
|
"loss": 5.6616,
|
|
"mean_token_accuracy": 0.15635811388492585,
|
|
"num_tokens": 12069267.0,
|
|
"step": 6955
|
|
},
|
|
{
|
|
"entropy": 5.709695672988891,
|
|
"epoch": 0.54152888543085,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0004975797384944405,
|
|
"loss": 5.5824,
|
|
"mean_token_accuracy": 0.15533999651670455,
|
|
"num_tokens": 12077808.0,
|
|
"step": 6960
|
|
},
|
|
{
|
|
"entropy": 5.638394355773926,
|
|
"epoch": 0.5419179148025676,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.000497575682580044,
|
|
"loss": 5.5542,
|
|
"mean_token_accuracy": 0.1539350613951683,
|
|
"num_tokens": 12086893.0,
|
|
"step": 6965
|
|
},
|
|
{
|
|
"entropy": 5.666961669921875,
|
|
"epoch": 0.5423069441742852,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.000497571623288416,
|
|
"loss": 5.4399,
|
|
"mean_token_accuracy": 0.1644754961133003,
|
|
"num_tokens": 12095462.0,
|
|
"step": 6970
|
|
},
|
|
{
|
|
"entropy": 5.6487678527832035,
|
|
"epoch": 0.5426959735460027,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.0004975675606196177,
|
|
"loss": 5.5295,
|
|
"mean_token_accuracy": 0.15933847576379775,
|
|
"num_tokens": 12103477.0,
|
|
"step": 6975
|
|
},
|
|
{
|
|
"entropy": 5.671709299087524,
|
|
"epoch": 0.5430850029177203,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.000497563494573711,
|
|
"loss": 5.6699,
|
|
"mean_token_accuracy": 0.15767599493265153,
|
|
"num_tokens": 12112752.0,
|
|
"step": 6980
|
|
},
|
|
{
|
|
"entropy": 5.7197895526885985,
|
|
"epoch": 0.5434740322894378,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.0004975594251507575,
|
|
"loss": 5.5767,
|
|
"mean_token_accuracy": 0.1488715760409832,
|
|
"num_tokens": 12121883.0,
|
|
"step": 6985
|
|
},
|
|
{
|
|
"entropy": 5.684212684631348,
|
|
"epoch": 0.5438630616611554,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.000497555352350819,
|
|
"loss": 5.5251,
|
|
"mean_token_accuracy": 0.15814283341169358,
|
|
"num_tokens": 12130316.0,
|
|
"step": 6990
|
|
},
|
|
{
|
|
"entropy": 5.640691900253296,
|
|
"epoch": 0.544252091032873,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0004975512761739572,
|
|
"loss": 5.5032,
|
|
"mean_token_accuracy": 0.15524298548698426,
|
|
"num_tokens": 12138856.0,
|
|
"step": 6995
|
|
},
|
|
{
|
|
"entropy": 5.592985916137695,
|
|
"epoch": 0.5446411204045906,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.000497547196620234,
|
|
"loss": 5.5785,
|
|
"mean_token_accuracy": 0.15525238662958146,
|
|
"num_tokens": 12147933.0,
|
|
"step": 7000
|
|
},
|
|
{
|
|
"entropy": 5.633612012863159,
|
|
"epoch": 0.5450301497763081,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.0004975431136897114,
|
|
"loss": 5.4554,
|
|
"mean_token_accuracy": 0.1621299922466278,
|
|
"num_tokens": 12156529.0,
|
|
"step": 7005
|
|
},
|
|
{
|
|
"entropy": 5.597944164276123,
|
|
"epoch": 0.5454191791480256,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0004975390273824512,
|
|
"loss": 5.4113,
|
|
"mean_token_accuracy": 0.16376460194587708,
|
|
"num_tokens": 12165233.0,
|
|
"step": 7010
|
|
},
|
|
{
|
|
"entropy": 5.611815452575684,
|
|
"epoch": 0.5458082085197432,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0004975349376985155,
|
|
"loss": 5.6011,
|
|
"mean_token_accuracy": 0.15549773424863816,
|
|
"num_tokens": 12173260.0,
|
|
"step": 7015
|
|
},
|
|
{
|
|
"entropy": 5.673900985717774,
|
|
"epoch": 0.5461972378914608,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0004975308446379663,
|
|
"loss": 5.6101,
|
|
"mean_token_accuracy": 0.15461681336164473,
|
|
"num_tokens": 12181676.0,
|
|
"step": 7020
|
|
},
|
|
{
|
|
"entropy": 5.6847456932067875,
|
|
"epoch": 0.5465862672631784,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.0004975267482008657,
|
|
"loss": 5.5254,
|
|
"mean_token_accuracy": 0.1594758614897728,
|
|
"num_tokens": 12189485.0,
|
|
"step": 7025
|
|
},
|
|
{
|
|
"entropy": 5.6035644054412845,
|
|
"epoch": 0.546975296634896,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.000497522648387276,
|
|
"loss": 5.4527,
|
|
"mean_token_accuracy": 0.16365523785352706,
|
|
"num_tokens": 12198429.0,
|
|
"step": 7030
|
|
},
|
|
{
|
|
"entropy": 5.577117395401001,
|
|
"epoch": 0.5473643260066134,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.0004975185451972592,
|
|
"loss": 5.572,
|
|
"mean_token_accuracy": 0.16115963011980056,
|
|
"num_tokens": 12207404.0,
|
|
"step": 7035
|
|
},
|
|
{
|
|
"entropy": 5.701930236816406,
|
|
"epoch": 0.547753355378331,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0004975144386308776,
|
|
"loss": 5.5479,
|
|
"mean_token_accuracy": 0.15822896361351013,
|
|
"num_tokens": 12216301.0,
|
|
"step": 7040
|
|
},
|
|
{
|
|
"entropy": 5.591483783721924,
|
|
"epoch": 0.5481423847500486,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.0004975103286881936,
|
|
"loss": 5.5384,
|
|
"mean_token_accuracy": 0.16383027136325837,
|
|
"num_tokens": 12224873.0,
|
|
"step": 7045
|
|
},
|
|
{
|
|
"entropy": 5.612608337402344,
|
|
"epoch": 0.5485314141217662,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0004975062153692696,
|
|
"loss": 5.5158,
|
|
"mean_token_accuracy": 0.1623031973838806,
|
|
"num_tokens": 12233439.0,
|
|
"step": 7050
|
|
},
|
|
{
|
|
"entropy": 5.694883489608765,
|
|
"epoch": 0.5489204434934838,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.0004975020986741678,
|
|
"loss": 5.5703,
|
|
"mean_token_accuracy": 0.15239009335637094,
|
|
"num_tokens": 12242235.0,
|
|
"step": 7055
|
|
},
|
|
{
|
|
"entropy": 5.609505271911621,
|
|
"epoch": 0.5493094728652014,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.0004974979786029509,
|
|
"loss": 5.5242,
|
|
"mean_token_accuracy": 0.16340847909450532,
|
|
"num_tokens": 12251295.0,
|
|
"step": 7060
|
|
},
|
|
{
|
|
"entropy": 5.638507509231568,
|
|
"epoch": 0.5496985022369189,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.0004974938551556814,
|
|
"loss": 5.4621,
|
|
"mean_token_accuracy": 0.1659865766763687,
|
|
"num_tokens": 12260130.0,
|
|
"step": 7065
|
|
},
|
|
{
|
|
"entropy": 5.6084636688232425,
|
|
"epoch": 0.5500875316086364,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0004974897283324217,
|
|
"loss": 5.5148,
|
|
"mean_token_accuracy": 0.160197813808918,
|
|
"num_tokens": 12269542.0,
|
|
"step": 7070
|
|
},
|
|
{
|
|
"entropy": 5.6162344455719,
|
|
"epoch": 0.550476560980354,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0004974855981332343,
|
|
"loss": 5.6004,
|
|
"mean_token_accuracy": 0.16120688617229462,
|
|
"num_tokens": 12278174.0,
|
|
"step": 7075
|
|
},
|
|
{
|
|
"entropy": 5.673370409011841,
|
|
"epoch": 0.5508655903520716,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0004974814645581823,
|
|
"loss": 5.6678,
|
|
"mean_token_accuracy": 0.15251821428537368,
|
|
"num_tokens": 12287651.0,
|
|
"step": 7080
|
|
},
|
|
{
|
|
"entropy": 5.763124084472656,
|
|
"epoch": 0.5512546197237892,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0004974773276073282,
|
|
"loss": 5.6438,
|
|
"mean_token_accuracy": 0.15593429803848266,
|
|
"num_tokens": 12296009.0,
|
|
"step": 7085
|
|
},
|
|
{
|
|
"entropy": 5.612685346603394,
|
|
"epoch": 0.5516436490955067,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.0004974731872807347,
|
|
"loss": 5.5443,
|
|
"mean_token_accuracy": 0.15328624844551086,
|
|
"num_tokens": 12305406.0,
|
|
"step": 7090
|
|
},
|
|
{
|
|
"entropy": 5.6309099197387695,
|
|
"epoch": 0.5520326784672243,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0004974690435784647,
|
|
"loss": 5.5797,
|
|
"mean_token_accuracy": 0.15415759533643722,
|
|
"num_tokens": 12314169.0,
|
|
"step": 7095
|
|
},
|
|
{
|
|
"entropy": 5.598780250549316,
|
|
"epoch": 0.5524217078389418,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.0004974648965005811,
|
|
"loss": 5.4733,
|
|
"mean_token_accuracy": 0.16661957502365113,
|
|
"num_tokens": 12323019.0,
|
|
"step": 7100
|
|
},
|
|
{
|
|
"entropy": 5.621094560623169,
|
|
"epoch": 0.5528107372106594,
|
|
"grad_norm": 1.5390625,
|
|
"learning_rate": 0.0004974607460471466,
|
|
"loss": 5.5827,
|
|
"mean_token_accuracy": 0.1506951481103897,
|
|
"num_tokens": 12331491.0,
|
|
"step": 7105
|
|
},
|
|
{
|
|
"entropy": 5.62510232925415,
|
|
"epoch": 0.553199766582377,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.0004974565922182246,
|
|
"loss": 5.5438,
|
|
"mean_token_accuracy": 0.15989115089178085,
|
|
"num_tokens": 12339647.0,
|
|
"step": 7110
|
|
},
|
|
{
|
|
"entropy": 5.607163286209106,
|
|
"epoch": 0.5535887959540945,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.0004974524350138777,
|
|
"loss": 5.522,
|
|
"mean_token_accuracy": 0.15979181230068207,
|
|
"num_tokens": 12348469.0,
|
|
"step": 7115
|
|
},
|
|
{
|
|
"entropy": 5.6572285175323485,
|
|
"epoch": 0.5539778253258121,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.0004974482744341693,
|
|
"loss": 5.4974,
|
|
"mean_token_accuracy": 0.16333761662244797,
|
|
"num_tokens": 12357168.0,
|
|
"step": 7120
|
|
},
|
|
{
|
|
"entropy": 5.534380054473877,
|
|
"epoch": 0.5543668546975297,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.0004974441104791624,
|
|
"loss": 5.4967,
|
|
"mean_token_accuracy": 0.1589392438530922,
|
|
"num_tokens": 12365750.0,
|
|
"step": 7125
|
|
},
|
|
{
|
|
"entropy": 5.601346969604492,
|
|
"epoch": 0.5547558840692473,
|
|
"grad_norm": 1.515625,
|
|
"learning_rate": 0.0004974399431489201,
|
|
"loss": 5.5427,
|
|
"mean_token_accuracy": 0.15742712914943696,
|
|
"num_tokens": 12374086.0,
|
|
"step": 7130
|
|
},
|
|
{
|
|
"entropy": 5.660343980789184,
|
|
"epoch": 0.5551449134409648,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.0004974357724435057,
|
|
"loss": 5.4835,
|
|
"mean_token_accuracy": 0.16328005641698837,
|
|
"num_tokens": 12381997.0,
|
|
"step": 7135
|
|
},
|
|
{
|
|
"entropy": 5.676285028457642,
|
|
"epoch": 0.5555339428126823,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0004974315983629825,
|
|
"loss": 5.5817,
|
|
"mean_token_accuracy": 0.1614387571811676,
|
|
"num_tokens": 12391083.0,
|
|
"step": 7140
|
|
},
|
|
{
|
|
"entropy": 5.644300699234009,
|
|
"epoch": 0.5559229721843999,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.0004974274209074139,
|
|
"loss": 5.497,
|
|
"mean_token_accuracy": 0.16053244918584825,
|
|
"num_tokens": 12400016.0,
|
|
"step": 7145
|
|
},
|
|
{
|
|
"entropy": 5.698569917678833,
|
|
"epoch": 0.5563120015561175,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.0004974232400768632,
|
|
"loss": 5.6068,
|
|
"mean_token_accuracy": 0.15869893729686738,
|
|
"num_tokens": 12409255.0,
|
|
"step": 7150
|
|
},
|
|
{
|
|
"entropy": 5.660106754302978,
|
|
"epoch": 0.5567010309278351,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0004974190558713939,
|
|
"loss": 5.4848,
|
|
"mean_token_accuracy": 0.16400493532419205,
|
|
"num_tokens": 12417765.0,
|
|
"step": 7155
|
|
},
|
|
{
|
|
"entropy": 5.702695846557617,
|
|
"epoch": 0.5570900602995527,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0004974148682910694,
|
|
"loss": 5.7475,
|
|
"mean_token_accuracy": 0.1424033060669899,
|
|
"num_tokens": 12427588.0,
|
|
"step": 7160
|
|
},
|
|
{
|
|
"entropy": 5.648605871200561,
|
|
"epoch": 0.5574790896712701,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.0004974106773359533,
|
|
"loss": 5.4138,
|
|
"mean_token_accuracy": 0.16430372297763823,
|
|
"num_tokens": 12435773.0,
|
|
"step": 7165
|
|
},
|
|
{
|
|
"entropy": 5.619985103607178,
|
|
"epoch": 0.5578681190429877,
|
|
"grad_norm": 1.7421875,
|
|
"learning_rate": 0.0004974064830061091,
|
|
"loss": 5.5464,
|
|
"mean_token_accuracy": 0.16402772665023804,
|
|
"num_tokens": 12443837.0,
|
|
"step": 7170
|
|
},
|
|
{
|
|
"entropy": 5.6071559429168705,
|
|
"epoch": 0.5582571484147053,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.0004974022853016006,
|
|
"loss": 5.5454,
|
|
"mean_token_accuracy": 0.16198388189077378,
|
|
"num_tokens": 12452945.0,
|
|
"step": 7175
|
|
},
|
|
{
|
|
"entropy": 5.632401609420777,
|
|
"epoch": 0.5586461777864229,
|
|
"grad_norm": 1.6171875,
|
|
"learning_rate": 0.0004973980842224913,
|
|
"loss": 5.475,
|
|
"mean_token_accuracy": 0.16739387661218644,
|
|
"num_tokens": 12461008.0,
|
|
"step": 7180
|
|
},
|
|
{
|
|
"entropy": 5.5655022144317625,
|
|
"epoch": 0.5590352071581405,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.0004973938797688452,
|
|
"loss": 5.4734,
|
|
"mean_token_accuracy": 0.156940957903862,
|
|
"num_tokens": 12469314.0,
|
|
"step": 7185
|
|
},
|
|
{
|
|
"entropy": 5.636973476409912,
|
|
"epoch": 0.559424236529858,
|
|
"grad_norm": 1.5625,
|
|
"learning_rate": 0.0004973896719407259,
|
|
"loss": 5.4887,
|
|
"mean_token_accuracy": 0.1571099802851677,
|
|
"num_tokens": 12477540.0,
|
|
"step": 7190
|
|
},
|
|
{
|
|
"entropy": 5.62240891456604,
|
|
"epoch": 0.5598132659015755,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.0004973854607381972,
|
|
"loss": 5.5421,
|
|
"mean_token_accuracy": 0.16325449496507644,
|
|
"num_tokens": 12486894.0,
|
|
"step": 7195
|
|
},
|
|
{
|
|
"entropy": 5.655526065826416,
|
|
"epoch": 0.5602022952732931,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.0004973812461613232,
|
|
"loss": 5.5413,
|
|
"mean_token_accuracy": 0.15660593509674073,
|
|
"num_tokens": 12496213.0,
|
|
"step": 7200
|
|
},
|
|
{
|
|
"entropy": 5.592194223403931,
|
|
"epoch": 0.5605913246450107,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0004973770282101677,
|
|
"loss": 5.5315,
|
|
"mean_token_accuracy": 0.15898202806711198,
|
|
"num_tokens": 12504160.0,
|
|
"step": 7205
|
|
},
|
|
{
|
|
"entropy": 5.54472541809082,
|
|
"epoch": 0.5609803540167283,
|
|
"grad_norm": 1.4921875,
|
|
"learning_rate": 0.0004973728068847947,
|
|
"loss": 5.474,
|
|
"mean_token_accuracy": 0.16442665830254555,
|
|
"num_tokens": 12511915.0,
|
|
"step": 7210
|
|
},
|
|
{
|
|
"entropy": 5.639721298217774,
|
|
"epoch": 0.5613693833884458,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0004973685821852684,
|
|
"loss": 5.5125,
|
|
"mean_token_accuracy": 0.159575916826725,
|
|
"num_tokens": 12520400.0,
|
|
"step": 7215
|
|
},
|
|
{
|
|
"entropy": 5.580363988876343,
|
|
"epoch": 0.5617584127601634,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0004973643541116528,
|
|
"loss": 5.4226,
|
|
"mean_token_accuracy": 0.168043652176857,
|
|
"num_tokens": 12528724.0,
|
|
"step": 7220
|
|
},
|
|
{
|
|
"entropy": 5.648554515838623,
|
|
"epoch": 0.562147442131881,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.000497360122664012,
|
|
"loss": 5.6009,
|
|
"mean_token_accuracy": 0.15417485386133195,
|
|
"num_tokens": 12537378.0,
|
|
"step": 7225
|
|
},
|
|
{
|
|
"entropy": 5.626233673095703,
|
|
"epoch": 0.5625364715035985,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0004973558878424104,
|
|
"loss": 5.5328,
|
|
"mean_token_accuracy": 0.16310097873210908,
|
|
"num_tokens": 12546080.0,
|
|
"step": 7230
|
|
},
|
|
{
|
|
"entropy": 5.6941893100738525,
|
|
"epoch": 0.5629255008753161,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0004973516496469119,
|
|
"loss": 5.5547,
|
|
"mean_token_accuracy": 0.16019777953624725,
|
|
"num_tokens": 12554526.0,
|
|
"step": 7235
|
|
},
|
|
{
|
|
"entropy": 5.63044319152832,
|
|
"epoch": 0.5633145302470336,
|
|
"grad_norm": 1.5390625,
|
|
"learning_rate": 0.0004973474080775811,
|
|
"loss": 5.5093,
|
|
"mean_token_accuracy": 0.16128407865762712,
|
|
"num_tokens": 12563018.0,
|
|
"step": 7240
|
|
},
|
|
{
|
|
"entropy": 5.627581405639648,
|
|
"epoch": 0.5637035596187512,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.0004973431631344824,
|
|
"loss": 5.567,
|
|
"mean_token_accuracy": 0.1591254025697708,
|
|
"num_tokens": 12571611.0,
|
|
"step": 7245
|
|
},
|
|
{
|
|
"entropy": 5.698124742507934,
|
|
"epoch": 0.5640925889904688,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00049733891481768,
|
|
"loss": 5.635,
|
|
"mean_token_accuracy": 0.15900451242923735,
|
|
"num_tokens": 12580168.0,
|
|
"step": 7250
|
|
},
|
|
{
|
|
"entropy": 5.620501375198364,
|
|
"epoch": 0.5644816183621864,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0004973346631272384,
|
|
"loss": 5.5396,
|
|
"mean_token_accuracy": 0.1586569592356682,
|
|
"num_tokens": 12589843.0,
|
|
"step": 7255
|
|
},
|
|
{
|
|
"entropy": 5.712000942230224,
|
|
"epoch": 0.5648706477339039,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0004973304080632222,
|
|
"loss": 5.5776,
|
|
"mean_token_accuracy": 0.1545659400522709,
|
|
"num_tokens": 12598219.0,
|
|
"step": 7260
|
|
},
|
|
{
|
|
"entropy": 5.625898599624634,
|
|
"epoch": 0.5652596771056215,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.000497326149625696,
|
|
"loss": 5.5644,
|
|
"mean_token_accuracy": 0.16191482096910476,
|
|
"num_tokens": 12606665.0,
|
|
"step": 7265
|
|
},
|
|
{
|
|
"entropy": 5.556368732452393,
|
|
"epoch": 0.565648706477339,
|
|
"grad_norm": 1.5625,
|
|
"learning_rate": 0.0004973218878147244,
|
|
"loss": 5.4893,
|
|
"mean_token_accuracy": 0.16165162175893782,
|
|
"num_tokens": 12615062.0,
|
|
"step": 7270
|
|
},
|
|
{
|
|
"entropy": 5.701360082626342,
|
|
"epoch": 0.5660377358490566,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0004973176226303719,
|
|
"loss": 5.5805,
|
|
"mean_token_accuracy": 0.1605806604027748,
|
|
"num_tokens": 12623923.0,
|
|
"step": 7275
|
|
},
|
|
{
|
|
"entropy": 5.665620994567871,
|
|
"epoch": 0.5664267652207742,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 0.0004973133540727033,
|
|
"loss": 5.4939,
|
|
"mean_token_accuracy": 0.15362900421023368,
|
|
"num_tokens": 12632579.0,
|
|
"step": 7280
|
|
},
|
|
{
|
|
"entropy": 5.6012444496154785,
|
|
"epoch": 0.5668157945924918,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.0004973090821417835,
|
|
"loss": 5.4818,
|
|
"mean_token_accuracy": 0.161869415640831,
|
|
"num_tokens": 12640847.0,
|
|
"step": 7285
|
|
},
|
|
{
|
|
"entropy": 5.6269035816192625,
|
|
"epoch": 0.5672048239642093,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.0004973048068376772,
|
|
"loss": 5.4605,
|
|
"mean_token_accuracy": 0.1663483962416649,
|
|
"num_tokens": 12649020.0,
|
|
"step": 7290
|
|
},
|
|
{
|
|
"entropy": 5.498252439498901,
|
|
"epoch": 0.5675938533359268,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0004973005281604492,
|
|
"loss": 5.3791,
|
|
"mean_token_accuracy": 0.16371892839670182,
|
|
"num_tokens": 12657569.0,
|
|
"step": 7295
|
|
},
|
|
{
|
|
"entropy": 5.70664758682251,
|
|
"epoch": 0.5679828827076444,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.0004972962461101646,
|
|
"loss": 5.6503,
|
|
"mean_token_accuracy": 0.14907950535416603,
|
|
"num_tokens": 12666681.0,
|
|
"step": 7300
|
|
},
|
|
{
|
|
"entropy": 5.640994834899902,
|
|
"epoch": 0.568371912079362,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0004972919606868883,
|
|
"loss": 5.4688,
|
|
"mean_token_accuracy": 0.1601715177297592,
|
|
"num_tokens": 12675210.0,
|
|
"step": 7305
|
|
},
|
|
{
|
|
"entropy": 5.625789308547974,
|
|
"epoch": 0.5687609414510796,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0004972876718906852,
|
|
"loss": 5.5133,
|
|
"mean_token_accuracy": 0.1565352126955986,
|
|
"num_tokens": 12684019.0,
|
|
"step": 7310
|
|
},
|
|
{
|
|
"entropy": 5.622615385055542,
|
|
"epoch": 0.5691499708227972,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.0004972833797216206,
|
|
"loss": 5.5633,
|
|
"mean_token_accuracy": 0.14711394608020784,
|
|
"num_tokens": 12692891.0,
|
|
"step": 7315
|
|
},
|
|
{
|
|
"entropy": 5.657730054855347,
|
|
"epoch": 0.5695390001945146,
|
|
"grad_norm": 1.640625,
|
|
"learning_rate": 0.0004972790841797595,
|
|
"loss": 5.4749,
|
|
"mean_token_accuracy": 0.16254037916660308,
|
|
"num_tokens": 12700606.0,
|
|
"step": 7320
|
|
},
|
|
{
|
|
"entropy": 5.584020566940308,
|
|
"epoch": 0.5699280295662322,
|
|
"grad_norm": 1.546875,
|
|
"learning_rate": 0.000497274785265167,
|
|
"loss": 5.5761,
|
|
"mean_token_accuracy": 0.15465729534626008,
|
|
"num_tokens": 12709116.0,
|
|
"step": 7325
|
|
},
|
|
{
|
|
"entropy": 5.620603036880493,
|
|
"epoch": 0.5703170589379498,
|
|
"grad_norm": 1.578125,
|
|
"learning_rate": 0.0004972704829779086,
|
|
"loss": 5.515,
|
|
"mean_token_accuracy": 0.16086004823446273,
|
|
"num_tokens": 12717484.0,
|
|
"step": 7330
|
|
},
|
|
{
|
|
"entropy": 5.5484014511108395,
|
|
"epoch": 0.5707060883096674,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.0004972661773180492,
|
|
"loss": 5.4495,
|
|
"mean_token_accuracy": 0.1614287480711937,
|
|
"num_tokens": 12726216.0,
|
|
"step": 7335
|
|
},
|
|
{
|
|
"entropy": 5.596465110778809,
|
|
"epoch": 0.571095117681385,
|
|
"grad_norm": 1.65625,
|
|
"learning_rate": 0.0004972618682856545,
|
|
"loss": 5.446,
|
|
"mean_token_accuracy": 0.1665715456008911,
|
|
"num_tokens": 12735312.0,
|
|
"step": 7340
|
|
},
|
|
{
|
|
"entropy": 5.606229066848755,
|
|
"epoch": 0.5714841470531025,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0004972575558807896,
|
|
"loss": 5.5775,
|
|
"mean_token_accuracy": 0.15633748471736908,
|
|
"num_tokens": 12744641.0,
|
|
"step": 7345
|
|
},
|
|
{
|
|
"entropy": 5.665216493606567,
|
|
"epoch": 0.57187317642482,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0004972532401035201,
|
|
"loss": 5.5346,
|
|
"mean_token_accuracy": 0.15907908231019974,
|
|
"num_tokens": 12753951.0,
|
|
"step": 7350
|
|
},
|
|
{
|
|
"entropy": 5.723617362976074,
|
|
"epoch": 0.5722622057965376,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.0004972489209539114,
|
|
"loss": 5.5512,
|
|
"mean_token_accuracy": 0.16019677892327308,
|
|
"num_tokens": 12762571.0,
|
|
"step": 7355
|
|
},
|
|
{
|
|
"entropy": 5.712904691696167,
|
|
"epoch": 0.5726512351682552,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004972445984320292,
|
|
"loss": 5.6205,
|
|
"mean_token_accuracy": 0.15869905799627304,
|
|
"num_tokens": 12771275.0,
|
|
"step": 7360
|
|
},
|
|
{
|
|
"entropy": 5.674981260299683,
|
|
"epoch": 0.5730402645399728,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0004972402725379388,
|
|
"loss": 5.5153,
|
|
"mean_token_accuracy": 0.1596535786986351,
|
|
"num_tokens": 12780488.0,
|
|
"step": 7365
|
|
},
|
|
{
|
|
"entropy": 5.6578387260437015,
|
|
"epoch": 0.5734292939116903,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.000497235943271706,
|
|
"loss": 5.5456,
|
|
"mean_token_accuracy": 0.1624777302145958,
|
|
"num_tokens": 12788588.0,
|
|
"step": 7370
|
|
},
|
|
{
|
|
"entropy": 5.560195541381836,
|
|
"epoch": 0.5738183232834079,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.0004972316106333966,
|
|
"loss": 5.4871,
|
|
"mean_token_accuracy": 0.1583039477467537,
|
|
"num_tokens": 12797010.0,
|
|
"step": 7375
|
|
},
|
|
{
|
|
"entropy": 5.672476291656494,
|
|
"epoch": 0.5742073526551255,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0004972272746230761,
|
|
"loss": 5.5737,
|
|
"mean_token_accuracy": 0.16159822195768356,
|
|
"num_tokens": 12805430.0,
|
|
"step": 7380
|
|
},
|
|
{
|
|
"entropy": 5.699739456176758,
|
|
"epoch": 0.574596382026843,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.0004972229352408104,
|
|
"loss": 5.5415,
|
|
"mean_token_accuracy": 0.16303423792123795,
|
|
"num_tokens": 12813912.0,
|
|
"step": 7385
|
|
},
|
|
{
|
|
"entropy": 5.688510894775391,
|
|
"epoch": 0.5749854113985606,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0004972185924866655,
|
|
"loss": 5.5546,
|
|
"mean_token_accuracy": 0.15873103514313697,
|
|
"num_tokens": 12822421.0,
|
|
"step": 7390
|
|
},
|
|
{
|
|
"entropy": 5.554236936569214,
|
|
"epoch": 0.5753744407702781,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.0004972142463607071,
|
|
"loss": 5.4408,
|
|
"mean_token_accuracy": 0.16305190920829774,
|
|
"num_tokens": 12830670.0,
|
|
"step": 7395
|
|
},
|
|
{
|
|
"entropy": 5.625152826309204,
|
|
"epoch": 0.5757634701419957,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.0004972098968630012,
|
|
"loss": 5.5553,
|
|
"mean_token_accuracy": 0.16401876807212828,
|
|
"num_tokens": 12839887.0,
|
|
"step": 7400
|
|
},
|
|
{
|
|
"entropy": 5.5732255458831785,
|
|
"epoch": 0.5761524995137133,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0004972055439936137,
|
|
"loss": 5.4636,
|
|
"mean_token_accuracy": 0.16273102313280105,
|
|
"num_tokens": 12848028.0,
|
|
"step": 7405
|
|
},
|
|
{
|
|
"entropy": 5.571136522293091,
|
|
"epoch": 0.5765415288854309,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004972011877526109,
|
|
"loss": 5.4718,
|
|
"mean_token_accuracy": 0.1594846174120903,
|
|
"num_tokens": 12857248.0,
|
|
"step": 7410
|
|
},
|
|
{
|
|
"entropy": 5.621489238739014,
|
|
"epoch": 0.5769305582571485,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0004971968281400587,
|
|
"loss": 5.4828,
|
|
"mean_token_accuracy": 0.1662975862622261,
|
|
"num_tokens": 12866352.0,
|
|
"step": 7415
|
|
},
|
|
{
|
|
"entropy": 5.666937637329101,
|
|
"epoch": 0.5773195876288659,
|
|
"grad_norm": 1.671875,
|
|
"learning_rate": 0.0004971924651560233,
|
|
"loss": 5.5766,
|
|
"mean_token_accuracy": 0.15306324139237404,
|
|
"num_tokens": 12874548.0,
|
|
"step": 7420
|
|
},
|
|
{
|
|
"entropy": 5.623528480529785,
|
|
"epoch": 0.5777086170005835,
|
|
"grad_norm": 1.609375,
|
|
"learning_rate": 0.0004971880988005709,
|
|
"loss": 5.3968,
|
|
"mean_token_accuracy": 0.16885466426610946,
|
|
"num_tokens": 12883172.0,
|
|
"step": 7425
|
|
},
|
|
{
|
|
"entropy": 5.517974090576172,
|
|
"epoch": 0.5780976463723011,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.0004971837290737677,
|
|
"loss": 5.48,
|
|
"mean_token_accuracy": 0.16351478695869445,
|
|
"num_tokens": 12891776.0,
|
|
"step": 7430
|
|
},
|
|
{
|
|
"entropy": 5.5739844799041744,
|
|
"epoch": 0.5784866757440187,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0004971793559756801,
|
|
"loss": 5.4198,
|
|
"mean_token_accuracy": 0.16615208461880684,
|
|
"num_tokens": 12900530.0,
|
|
"step": 7435
|
|
},
|
|
{
|
|
"entropy": 5.5704282283782955,
|
|
"epoch": 0.5788757051157363,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.0004971749795063744,
|
|
"loss": 5.4675,
|
|
"mean_token_accuracy": 0.16340652704238892,
|
|
"num_tokens": 12909260.0,
|
|
"step": 7440
|
|
},
|
|
{
|
|
"entropy": 5.615681982040405,
|
|
"epoch": 0.5792647344874537,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.000497170599665917,
|
|
"loss": 5.4631,
|
|
"mean_token_accuracy": 0.15883395224809646,
|
|
"num_tokens": 12918143.0,
|
|
"step": 7445
|
|
},
|
|
{
|
|
"entropy": 5.6724207401275635,
|
|
"epoch": 0.5796537638591713,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.0004971662164543743,
|
|
"loss": 5.5346,
|
|
"mean_token_accuracy": 0.16386547535657883,
|
|
"num_tokens": 12926361.0,
|
|
"step": 7450
|
|
},
|
|
{
|
|
"entropy": 5.593789339065552,
|
|
"epoch": 0.5800427932308889,
|
|
"grad_norm": 1.53125,
|
|
"learning_rate": 0.0004971618298718131,
|
|
"loss": 5.4645,
|
|
"mean_token_accuracy": 0.16232849061489105,
|
|
"num_tokens": 12935080.0,
|
|
"step": 7455
|
|
},
|
|
{
|
|
"entropy": 5.644500350952148,
|
|
"epoch": 0.5804318226026065,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 0.0004971574399182995,
|
|
"loss": 5.6323,
|
|
"mean_token_accuracy": 0.15592513233423233,
|
|
"num_tokens": 12944078.0,
|
|
"step": 7460
|
|
},
|
|
{
|
|
"entropy": 5.635997152328491,
|
|
"epoch": 0.5808208519743241,
|
|
"grad_norm": 1.6015625,
|
|
"learning_rate": 0.0004971530465939005,
|
|
"loss": 5.548,
|
|
"mean_token_accuracy": 0.1559380941092968,
|
|
"num_tokens": 12952800.0,
|
|
"step": 7465
|
|
},
|
|
{
|
|
"entropy": 5.724119472503662,
|
|
"epoch": 0.5812098813460417,
|
|
"grad_norm": 1.515625,
|
|
"learning_rate": 0.0004971486498986825,
|
|
"loss": 5.6344,
|
|
"mean_token_accuracy": 0.15321501046419145,
|
|
"num_tokens": 12962402.0,
|
|
"step": 7470
|
|
},
|
|
{
|
|
"entropy": 5.621135282516479,
|
|
"epoch": 0.5815989107177592,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0004971442498327124,
|
|
"loss": 5.4026,
|
|
"mean_token_accuracy": 0.16943953484296798,
|
|
"num_tokens": 12971116.0,
|
|
"step": 7475
|
|
},
|
|
{
|
|
"entropy": 5.5255170345306395,
|
|
"epoch": 0.5819879400894767,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 0.0004971398463960568,
|
|
"loss": 5.5058,
|
|
"mean_token_accuracy": 0.1556493379175663,
|
|
"num_tokens": 12979570.0,
|
|
"step": 7480
|
|
},
|
|
{
|
|
"entropy": 5.673506450653076,
|
|
"epoch": 0.5823769694611943,
|
|
"grad_norm": 1.578125,
|
|
"learning_rate": 0.0004971354395887827,
|
|
"loss": 5.5064,
|
|
"mean_token_accuracy": 0.16239574402570725,
|
|
"num_tokens": 12987942.0,
|
|
"step": 7485
|
|
},
|
|
{
|
|
"entropy": 5.678384733200073,
|
|
"epoch": 0.5827659988329119,
|
|
"grad_norm": 1.6328125,
|
|
"learning_rate": 0.0004971310294109569,
|
|
"loss": 5.5726,
|
|
"mean_token_accuracy": 0.15900402516126633,
|
|
"num_tokens": 12996499.0,
|
|
"step": 7490
|
|
},
|
|
{
|
|
"entropy": 5.596940183639527,
|
|
"epoch": 0.5831550282046295,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0004971266158626461,
|
|
"loss": 5.5215,
|
|
"mean_token_accuracy": 0.16408492773771285,
|
|
"num_tokens": 13005622.0,
|
|
"step": 7495
|
|
},
|
|
{
|
|
"entropy": 5.666322374343872,
|
|
"epoch": 0.583544057576347,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.0004971221989439177,
|
|
"loss": 5.5131,
|
|
"mean_token_accuracy": 0.1555515393614769,
|
|
"num_tokens": 13014417.0,
|
|
"step": 7500
|
|
},
|
|
{
|
|
"entropy": 5.591904401779175,
|
|
"epoch": 0.5839330869480646,
|
|
"grad_norm": 1.7734375,
|
|
"learning_rate": 0.0004971177786548384,
|
|
"loss": 5.4505,
|
|
"mean_token_accuracy": 0.1593570254743099,
|
|
"num_tokens": 13022887.0,
|
|
"step": 7505
|
|
},
|
|
{
|
|
"entropy": 5.598121070861817,
|
|
"epoch": 0.5843221163197821,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0004971133549954753,
|
|
"loss": 5.5523,
|
|
"mean_token_accuracy": 0.15993799567222594,
|
|
"num_tokens": 13031676.0,
|
|
"step": 7510
|
|
},
|
|
{
|
|
"entropy": 5.591425514221191,
|
|
"epoch": 0.5847111456914997,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.0004971089279658954,
|
|
"loss": 5.5058,
|
|
"mean_token_accuracy": 0.1619194507598877,
|
|
"num_tokens": 13040489.0,
|
|
"step": 7515
|
|
},
|
|
{
|
|
"entropy": 5.681172895431518,
|
|
"epoch": 0.5851001750632173,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0004971044975661663,
|
|
"loss": 5.4316,
|
|
"mean_token_accuracy": 0.16690255403518678,
|
|
"num_tokens": 13048280.0,
|
|
"step": 7520
|
|
},
|
|
{
|
|
"entropy": 5.5702001571655275,
|
|
"epoch": 0.5854892044349348,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.0004971000637963549,
|
|
"loss": 5.4192,
|
|
"mean_token_accuracy": 0.1744627207517624,
|
|
"num_tokens": 13056471.0,
|
|
"step": 7525
|
|
},
|
|
{
|
|
"entropy": 5.584231662750244,
|
|
"epoch": 0.5858782338066524,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.0004970956266565285,
|
|
"loss": 5.6039,
|
|
"mean_token_accuracy": 0.15952491909265518,
|
|
"num_tokens": 13065289.0,
|
|
"step": 7530
|
|
},
|
|
{
|
|
"entropy": 5.666153907775879,
|
|
"epoch": 0.58626726317837,
|
|
"grad_norm": 1.703125,
|
|
"learning_rate": 0.0004970911861467544,
|
|
"loss": 5.6199,
|
|
"mean_token_accuracy": 0.15906012058258057,
|
|
"num_tokens": 13073648.0,
|
|
"step": 7535
|
|
},
|
|
{
|
|
"entropy": 5.713760423660278,
|
|
"epoch": 0.5866562925500876,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.0004970867422671002,
|
|
"loss": 5.6328,
|
|
"mean_token_accuracy": 0.15964424088597298,
|
|
"num_tokens": 13082205.0,
|
|
"step": 7540
|
|
},
|
|
{
|
|
"entropy": 5.688720226287842,
|
|
"epoch": 0.5870453219218051,
|
|
"grad_norm": 1.640625,
|
|
"learning_rate": 0.000497082295017633,
|
|
"loss": 5.5039,
|
|
"mean_token_accuracy": 0.15762317776679993,
|
|
"num_tokens": 13090970.0,
|
|
"step": 7545
|
|
},
|
|
{
|
|
"entropy": 5.660140466690064,
|
|
"epoch": 0.5874343512935226,
|
|
"grad_norm": 1.640625,
|
|
"learning_rate": 0.0004970778443984206,
|
|
"loss": 5.408,
|
|
"mean_token_accuracy": 0.16850501745939256,
|
|
"num_tokens": 13098290.0,
|
|
"step": 7550
|
|
},
|
|
{
|
|
"entropy": 5.521188640594483,
|
|
"epoch": 0.5878233806652402,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0004970733904095303,
|
|
"loss": 5.3654,
|
|
"mean_token_accuracy": 0.1694828599691391,
|
|
"num_tokens": 13106971.0,
|
|
"step": 7555
|
|
},
|
|
{
|
|
"entropy": 5.6553733348846436,
|
|
"epoch": 0.5882124100369578,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0004970689330510298,
|
|
"loss": 5.6533,
|
|
"mean_token_accuracy": 0.15376500338315963,
|
|
"num_tokens": 13115742.0,
|
|
"step": 7560
|
|
},
|
|
{
|
|
"entropy": 5.676582717895508,
|
|
"epoch": 0.5886014394086754,
|
|
"grad_norm": 1.5625,
|
|
"learning_rate": 0.0004970644723229868,
|
|
"loss": 5.6128,
|
|
"mean_token_accuracy": 0.15956298857927323,
|
|
"num_tokens": 13124192.0,
|
|
"step": 7565
|
|
},
|
|
{
|
|
"entropy": 5.625477743148804,
|
|
"epoch": 0.588990468780393,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.0004970600082254687,
|
|
"loss": 5.4197,
|
|
"mean_token_accuracy": 0.16239960491657257,
|
|
"num_tokens": 13133510.0,
|
|
"step": 7570
|
|
},
|
|
{
|
|
"entropy": 5.592658853530883,
|
|
"epoch": 0.5893794981521104,
|
|
"grad_norm": 1.546875,
|
|
"learning_rate": 0.0004970555407585436,
|
|
"loss": 5.5552,
|
|
"mean_token_accuracy": 0.1599623069167137,
|
|
"num_tokens": 13141704.0,
|
|
"step": 7575
|
|
},
|
|
{
|
|
"entropy": 5.518377590179443,
|
|
"epoch": 0.589768527523828,
|
|
"grad_norm": 1.5625,
|
|
"learning_rate": 0.000497051069922279,
|
|
"loss": 5.4366,
|
|
"mean_token_accuracy": 0.15510185062885284,
|
|
"num_tokens": 13150559.0,
|
|
"step": 7580
|
|
},
|
|
{
|
|
"entropy": 5.581053924560547,
|
|
"epoch": 0.5901575568955456,
|
|
"grad_norm": 1.5078125,
|
|
"learning_rate": 0.0004970465957167429,
|
|
"loss": 5.4834,
|
|
"mean_token_accuracy": 0.15990304946899414,
|
|
"num_tokens": 13159428.0,
|
|
"step": 7585
|
|
},
|
|
{
|
|
"entropy": 5.644467401504516,
|
|
"epoch": 0.5905465862672632,
|
|
"grad_norm": 1.5390625,
|
|
"learning_rate": 0.000497042118142003,
|
|
"loss": 5.6244,
|
|
"mean_token_accuracy": 0.15349241942167283,
|
|
"num_tokens": 13168299.0,
|
|
"step": 7590
|
|
},
|
|
{
|
|
"entropy": 5.6267036437988285,
|
|
"epoch": 0.5909356156389808,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.0004970376371981275,
|
|
"loss": 5.4908,
|
|
"mean_token_accuracy": 0.15986540913581848,
|
|
"num_tokens": 13176906.0,
|
|
"step": 7595
|
|
},
|
|
{
|
|
"entropy": 5.735187244415283,
|
|
"epoch": 0.5913246450106983,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.0004970331528851842,
|
|
"loss": 5.5883,
|
|
"mean_token_accuracy": 0.15484750866889954,
|
|
"num_tokens": 13186180.0,
|
|
"step": 7600
|
|
},
|
|
{
|
|
"entropy": 5.550314044952392,
|
|
"epoch": 0.5917136743824158,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 0.0004970286652032412,
|
|
"loss": 5.4165,
|
|
"mean_token_accuracy": 0.16556940227746964,
|
|
"num_tokens": 13195111.0,
|
|
"step": 7605
|
|
},
|
|
{
|
|
"entropy": 5.586171960830688,
|
|
"epoch": 0.5921027037541334,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.0004970241741523667,
|
|
"loss": 5.4881,
|
|
"mean_token_accuracy": 0.15955300033092498,
|
|
"num_tokens": 13204170.0,
|
|
"step": 7610
|
|
},
|
|
{
|
|
"entropy": 5.677660846710205,
|
|
"epoch": 0.592491733125851,
|
|
"grad_norm": 1.546875,
|
|
"learning_rate": 0.0004970196797326286,
|
|
"loss": 5.5105,
|
|
"mean_token_accuracy": 0.15856559723615646,
|
|
"num_tokens": 13213479.0,
|
|
"step": 7615
|
|
},
|
|
{
|
|
"entropy": 5.639448738098144,
|
|
"epoch": 0.5928807624975686,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.0004970151819440955,
|
|
"loss": 5.5509,
|
|
"mean_token_accuracy": 0.15828660875558853,
|
|
"num_tokens": 13222182.0,
|
|
"step": 7620
|
|
},
|
|
{
|
|
"entropy": 5.531005382537842,
|
|
"epoch": 0.5932697918692861,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0004970106807868351,
|
|
"loss": 5.4032,
|
|
"mean_token_accuracy": 0.16099072992801666,
|
|
"num_tokens": 13230681.0,
|
|
"step": 7625
|
|
},
|
|
{
|
|
"entropy": 5.700342130661011,
|
|
"epoch": 0.5936588212410037,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.000497006176260916,
|
|
"loss": 5.5912,
|
|
"mean_token_accuracy": 0.1595593973994255,
|
|
"num_tokens": 13239254.0,
|
|
"step": 7630
|
|
},
|
|
{
|
|
"entropy": 5.617882537841797,
|
|
"epoch": 0.5940478506127213,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.0004970016683664068,
|
|
"loss": 5.4469,
|
|
"mean_token_accuracy": 0.16579967588186265,
|
|
"num_tokens": 13248317.0,
|
|
"step": 7635
|
|
},
|
|
{
|
|
"entropy": 5.654610681533813,
|
|
"epoch": 0.5944368799844388,
|
|
"grad_norm": 1.921875,
|
|
"learning_rate": 0.0004969971571033754,
|
|
"loss": 5.5053,
|
|
"mean_token_accuracy": 0.15919456630945206,
|
|
"num_tokens": 13256977.0,
|
|
"step": 7640
|
|
},
|
|
{
|
|
"entropy": 5.615067386627198,
|
|
"epoch": 0.5948259093561564,
|
|
"grad_norm": 1.5,
|
|
"learning_rate": 0.0004969926424718906,
|
|
"loss": 5.5841,
|
|
"mean_token_accuracy": 0.15947894304990767,
|
|
"num_tokens": 13266012.0,
|
|
"step": 7645
|
|
},
|
|
{
|
|
"entropy": 5.707496690750122,
|
|
"epoch": 0.5952149387278739,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.0004969881244720207,
|
|
"loss": 5.6046,
|
|
"mean_token_accuracy": 0.1607809454202652,
|
|
"num_tokens": 13275248.0,
|
|
"step": 7650
|
|
},
|
|
{
|
|
"entropy": 5.637995338439941,
|
|
"epoch": 0.5956039680995915,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.0004969836031038343,
|
|
"loss": 5.4403,
|
|
"mean_token_accuracy": 0.1559646725654602,
|
|
"num_tokens": 13284235.0,
|
|
"step": 7655
|
|
},
|
|
{
|
|
"entropy": 5.573863458633423,
|
|
"epoch": 0.5959929974713091,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.0004969790783674002,
|
|
"loss": 5.5246,
|
|
"mean_token_accuracy": 0.1523687422275543,
|
|
"num_tokens": 13292423.0,
|
|
"step": 7660
|
|
},
|
|
{
|
|
"entropy": 5.6371039867401125,
|
|
"epoch": 0.5963820268430267,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0004969745502627868,
|
|
"loss": 5.5628,
|
|
"mean_token_accuracy": 0.15199742317199708,
|
|
"num_tokens": 13300936.0,
|
|
"step": 7665
|
|
},
|
|
{
|
|
"entropy": 5.552597761154175,
|
|
"epoch": 0.5967710562147442,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0004969700187900629,
|
|
"loss": 5.3773,
|
|
"mean_token_accuracy": 0.17030118703842162,
|
|
"num_tokens": 13308881.0,
|
|
"step": 7670
|
|
},
|
|
{
|
|
"entropy": 5.61635012626648,
|
|
"epoch": 0.5971600855864618,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.0004969654839492973,
|
|
"loss": 5.5448,
|
|
"mean_token_accuracy": 0.15784391164779663,
|
|
"num_tokens": 13317864.0,
|
|
"step": 7675
|
|
},
|
|
{
|
|
"entropy": 5.657650375366211,
|
|
"epoch": 0.5975491149581793,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 0.0004969609457405588,
|
|
"loss": 5.5087,
|
|
"mean_token_accuracy": 0.15694525986909866,
|
|
"num_tokens": 13326990.0,
|
|
"step": 7680
|
|
},
|
|
{
|
|
"entropy": 5.748386859893799,
|
|
"epoch": 0.5979381443298969,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 0.0004969564041639163,
|
|
"loss": 5.6993,
|
|
"mean_token_accuracy": 0.14893480986356736,
|
|
"num_tokens": 13336437.0,
|
|
"step": 7685
|
|
},
|
|
{
|
|
"entropy": 5.663937950134278,
|
|
"epoch": 0.5983271737016145,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.0004969518592194386,
|
|
"loss": 5.5151,
|
|
"mean_token_accuracy": 0.15797433406114578,
|
|
"num_tokens": 13345368.0,
|
|
"step": 7690
|
|
},
|
|
{
|
|
"entropy": 5.5918773174285885,
|
|
"epoch": 0.5987162030733321,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0004969473109071946,
|
|
"loss": 5.5545,
|
|
"mean_token_accuracy": 0.1600046530365944,
|
|
"num_tokens": 13354171.0,
|
|
"step": 7695
|
|
},
|
|
{
|
|
"entropy": 5.682364416122437,
|
|
"epoch": 0.5991052324450497,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.0004969427592272535,
|
|
"loss": 5.5552,
|
|
"mean_token_accuracy": 0.15920861437916756,
|
|
"num_tokens": 13362912.0,
|
|
"step": 7700
|
|
},
|
|
{
|
|
"entropy": 5.603416681289673,
|
|
"epoch": 0.5994942618167671,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.0004969382041796843,
|
|
"loss": 5.4395,
|
|
"mean_token_accuracy": 0.1599783182144165,
|
|
"num_tokens": 13370913.0,
|
|
"step": 7705
|
|
},
|
|
{
|
|
"entropy": 5.660623693466187,
|
|
"epoch": 0.5998832911884847,
|
|
"grad_norm": 1.953125,
|
|
"learning_rate": 0.000496933645764556,
|
|
"loss": 5.6038,
|
|
"mean_token_accuracy": 0.1545683339238167,
|
|
"num_tokens": 13379557.0,
|
|
"step": 7710
|
|
},
|
|
{
|
|
"entropy": 5.658495330810547,
|
|
"epoch": 0.6002723205602023,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.0004969290839819381,
|
|
"loss": 5.511,
|
|
"mean_token_accuracy": 0.1654706969857216,
|
|
"num_tokens": 13388129.0,
|
|
"step": 7715
|
|
},
|
|
{
|
|
"entropy": 5.644501495361328,
|
|
"epoch": 0.6006613499319199,
|
|
"grad_norm": 1.5078125,
|
|
"learning_rate": 0.0004969245188318994,
|
|
"loss": 5.6286,
|
|
"mean_token_accuracy": 0.15689315497875214,
|
|
"num_tokens": 13396713.0,
|
|
"step": 7720
|
|
},
|
|
{
|
|
"entropy": 5.6918860912323,
|
|
"epoch": 0.6010503793036375,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.0004969199503145093,
|
|
"loss": 5.5562,
|
|
"mean_token_accuracy": 0.16171080321073533,
|
|
"num_tokens": 13406171.0,
|
|
"step": 7725
|
|
},
|
|
{
|
|
"entropy": 5.5995087146759035,
|
|
"epoch": 0.601439408675355,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.0004969153784298374,
|
|
"loss": 5.4815,
|
|
"mean_token_accuracy": 0.1628172367811203,
|
|
"num_tokens": 13415107.0,
|
|
"step": 7730
|
|
},
|
|
{
|
|
"entropy": 5.590442943572998,
|
|
"epoch": 0.6018284380470725,
|
|
"grad_norm": 1.546875,
|
|
"learning_rate": 0.0004969108031779527,
|
|
"loss": 5.5996,
|
|
"mean_token_accuracy": 0.16061357855796815,
|
|
"num_tokens": 13423533.0,
|
|
"step": 7735
|
|
},
|
|
{
|
|
"entropy": 5.716766357421875,
|
|
"epoch": 0.6022174674187901,
|
|
"grad_norm": 1.5390625,
|
|
"learning_rate": 0.0004969062245589247,
|
|
"loss": 5.565,
|
|
"mean_token_accuracy": 0.15467922687530516,
|
|
"num_tokens": 13432798.0,
|
|
"step": 7740
|
|
},
|
|
{
|
|
"entropy": 5.691170167922974,
|
|
"epoch": 0.6026064967905077,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 0.0004969016425728231,
|
|
"loss": 5.5097,
|
|
"mean_token_accuracy": 0.16404221951961517,
|
|
"num_tokens": 13441123.0,
|
|
"step": 7745
|
|
},
|
|
{
|
|
"entropy": 5.564320659637451,
|
|
"epoch": 0.6029955261622253,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.0004968970572197172,
|
|
"loss": 5.4399,
|
|
"mean_token_accuracy": 0.16656853556632994,
|
|
"num_tokens": 13449548.0,
|
|
"step": 7750
|
|
},
|
|
{
|
|
"entropy": 5.631894779205322,
|
|
"epoch": 0.6033845555339428,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.0004968924684996765,
|
|
"loss": 5.5268,
|
|
"mean_token_accuracy": 0.15824869126081467,
|
|
"num_tokens": 13458022.0,
|
|
"step": 7755
|
|
},
|
|
{
|
|
"entropy": 5.609321880340576,
|
|
"epoch": 0.6037735849056604,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 0.000496887876412771,
|
|
"loss": 5.4797,
|
|
"mean_token_accuracy": 0.16207483112812043,
|
|
"num_tokens": 13466871.0,
|
|
"step": 7760
|
|
},
|
|
{
|
|
"entropy": 5.600290250778198,
|
|
"epoch": 0.6041626142773779,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.0004968832809590701,
|
|
"loss": 5.5171,
|
|
"mean_token_accuracy": 0.16046020835638047,
|
|
"num_tokens": 13475659.0,
|
|
"step": 7765
|
|
},
|
|
{
|
|
"entropy": 5.656421041488647,
|
|
"epoch": 0.6045516436490955,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 0.0004968786821386435,
|
|
"loss": 5.5303,
|
|
"mean_token_accuracy": 0.16244256794452666,
|
|
"num_tokens": 13484146.0,
|
|
"step": 7770
|
|
},
|
|
{
|
|
"entropy": 5.684045696258545,
|
|
"epoch": 0.6049406730208131,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0004968740799515611,
|
|
"loss": 5.5367,
|
|
"mean_token_accuracy": 0.16123472899198532,
|
|
"num_tokens": 13492831.0,
|
|
"step": 7775
|
|
},
|
|
{
|
|
"entropy": 5.642293262481689,
|
|
"epoch": 0.6053297023925306,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.0004968694743978926,
|
|
"loss": 5.503,
|
|
"mean_token_accuracy": 0.16224339455366135,
|
|
"num_tokens": 13501640.0,
|
|
"step": 7780
|
|
},
|
|
{
|
|
"entropy": 5.707996892929077,
|
|
"epoch": 0.6057187317642482,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.0004968648654777081,
|
|
"loss": 5.5145,
|
|
"mean_token_accuracy": 0.16158525943756102,
|
|
"num_tokens": 13509816.0,
|
|
"step": 7785
|
|
},
|
|
{
|
|
"entropy": 5.663367700576782,
|
|
"epoch": 0.6061077611359658,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 0.0004968602531910773,
|
|
"loss": 5.5868,
|
|
"mean_token_accuracy": 0.15522609949111937,
|
|
"num_tokens": 13518384.0,
|
|
"step": 7790
|
|
},
|
|
{
|
|
"entropy": 5.551813411712646,
|
|
"epoch": 0.6064967905076833,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 0.0004968556375380704,
|
|
"loss": 5.4464,
|
|
"mean_token_accuracy": 0.1610630139708519,
|
|
"num_tokens": 13527115.0,
|
|
"step": 7795
|
|
},
|
|
{
|
|
"entropy": 5.6546814918518065,
|
|
"epoch": 0.6068858198794009,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.0004968510185187571,
|
|
"loss": 5.6641,
|
|
"mean_token_accuracy": 0.1552654519677162,
|
|
"num_tokens": 13535743.0,
|
|
"step": 7800
|
|
},
|
|
{
|
|
"entropy": 5.596662521362305,
|
|
"epoch": 0.6072748492511184,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.000496846396133208,
|
|
"loss": 5.4717,
|
|
"mean_token_accuracy": 0.16270544081926347,
|
|
"num_tokens": 13544167.0,
|
|
"step": 7805
|
|
},
|
|
{
|
|
"entropy": 5.643411493301391,
|
|
"epoch": 0.607663878622836,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.0004968417703814928,
|
|
"loss": 5.5246,
|
|
"mean_token_accuracy": 0.15955984592437744,
|
|
"num_tokens": 13552291.0,
|
|
"step": 7810
|
|
},
|
|
{
|
|
"entropy": 5.669795370101928,
|
|
"epoch": 0.6080529079945536,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.0004968371412636818,
|
|
"loss": 5.5821,
|
|
"mean_token_accuracy": 0.15759380161762238,
|
|
"num_tokens": 13561185.0,
|
|
"step": 7815
|
|
},
|
|
{
|
|
"entropy": 5.650271654129028,
|
|
"epoch": 0.6084419373662712,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.0004968325087798453,
|
|
"loss": 5.4608,
|
|
"mean_token_accuracy": 0.1675198793411255,
|
|
"num_tokens": 13569815.0,
|
|
"step": 7820
|
|
},
|
|
{
|
|
"entropy": 5.66109619140625,
|
|
"epoch": 0.6088309667379888,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.0004968278729300536,
|
|
"loss": 5.5835,
|
|
"mean_token_accuracy": 0.15778862088918685,
|
|
"num_tokens": 13578882.0,
|
|
"step": 7825
|
|
},
|
|
{
|
|
"entropy": 5.557735729217529,
|
|
"epoch": 0.6092199961097062,
|
|
"grad_norm": 1.546875,
|
|
"learning_rate": 0.0004968232337143769,
|
|
"loss": 5.4403,
|
|
"mean_token_accuracy": 0.16673890501260757,
|
|
"num_tokens": 13587479.0,
|
|
"step": 7830
|
|
},
|
|
{
|
|
"entropy": 5.47802152633667,
|
|
"epoch": 0.6096090254814238,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0004968185911328858,
|
|
"loss": 5.3486,
|
|
"mean_token_accuracy": 0.16249027252197265,
|
|
"num_tokens": 13596049.0,
|
|
"step": 7835
|
|
},
|
|
{
|
|
"entropy": 5.684981775283814,
|
|
"epoch": 0.6099980548531414,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004968139451856506,
|
|
"loss": 5.6045,
|
|
"mean_token_accuracy": 0.1551737293601036,
|
|
"num_tokens": 13604766.0,
|
|
"step": 7840
|
|
},
|
|
{
|
|
"entropy": 5.684131145477295,
|
|
"epoch": 0.610387084224859,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0004968092958727419,
|
|
"loss": 5.5887,
|
|
"mean_token_accuracy": 0.1608073055744171,
|
|
"num_tokens": 13614051.0,
|
|
"step": 7845
|
|
},
|
|
{
|
|
"entropy": 5.571271324157715,
|
|
"epoch": 0.6107761135965766,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.00049680464319423,
|
|
"loss": 5.5338,
|
|
"mean_token_accuracy": 0.15778470188379287,
|
|
"num_tokens": 13623100.0,
|
|
"step": 7850
|
|
},
|
|
{
|
|
"entropy": 5.699359178543091,
|
|
"epoch": 0.6111651429682942,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.0004967999871501858,
|
|
"loss": 5.552,
|
|
"mean_token_accuracy": 0.15810873508453369,
|
|
"num_tokens": 13631732.0,
|
|
"step": 7855
|
|
},
|
|
{
|
|
"entropy": 5.61888165473938,
|
|
"epoch": 0.6115541723400116,
|
|
"grad_norm": 1.703125,
|
|
"learning_rate": 0.0004967953277406798,
|
|
"loss": 5.5358,
|
|
"mean_token_accuracy": 0.16011350452899933,
|
|
"num_tokens": 13640355.0,
|
|
"step": 7860
|
|
},
|
|
{
|
|
"entropy": 5.630750751495361,
|
|
"epoch": 0.6119432017117292,
|
|
"grad_norm": 1.5703125,
|
|
"learning_rate": 0.0004967906649657828,
|
|
"loss": 5.6121,
|
|
"mean_token_accuracy": 0.16256681680679322,
|
|
"num_tokens": 13649108.0,
|
|
"step": 7865
|
|
},
|
|
{
|
|
"entropy": 5.613716268539429,
|
|
"epoch": 0.6123322310834468,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.0004967859988255655,
|
|
"loss": 5.4381,
|
|
"mean_token_accuracy": 0.17376051247119903,
|
|
"num_tokens": 13656765.0,
|
|
"step": 7870
|
|
},
|
|
{
|
|
"entropy": 5.616294431686401,
|
|
"epoch": 0.6127212604551644,
|
|
"grad_norm": 1.5390625,
|
|
"learning_rate": 0.0004967813293200985,
|
|
"loss": 5.529,
|
|
"mean_token_accuracy": 0.15748461037874223,
|
|
"num_tokens": 13664692.0,
|
|
"step": 7875
|
|
},
|
|
{
|
|
"entropy": 5.500170755386352,
|
|
"epoch": 0.613110289826882,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0004967766564494529,
|
|
"loss": 5.3894,
|
|
"mean_token_accuracy": 0.16902236491441727,
|
|
"num_tokens": 13672913.0,
|
|
"step": 7880
|
|
},
|
|
{
|
|
"entropy": 5.559022665023804,
|
|
"epoch": 0.6134993191985995,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.0004967719802136996,
|
|
"loss": 5.3854,
|
|
"mean_token_accuracy": 0.16822486221790314,
|
|
"num_tokens": 13682427.0,
|
|
"step": 7885
|
|
},
|
|
{
|
|
"entropy": 5.612292194366455,
|
|
"epoch": 0.613888348570317,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.0004967673006129094,
|
|
"loss": 5.4823,
|
|
"mean_token_accuracy": 0.16599115133285522,
|
|
"num_tokens": 13690815.0,
|
|
"step": 7890
|
|
},
|
|
{
|
|
"entropy": 5.672644567489624,
|
|
"epoch": 0.6142773779420346,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.0004967626176471536,
|
|
"loss": 5.6092,
|
|
"mean_token_accuracy": 0.15415968373417854,
|
|
"num_tokens": 13699522.0,
|
|
"step": 7895
|
|
},
|
|
{
|
|
"entropy": 5.705391597747803,
|
|
"epoch": 0.6146664073137522,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.0004967579313165028,
|
|
"loss": 5.618,
|
|
"mean_token_accuracy": 0.1559215635061264,
|
|
"num_tokens": 13708075.0,
|
|
"step": 7900
|
|
},
|
|
{
|
|
"entropy": 5.673476839065552,
|
|
"epoch": 0.6150554366854698,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0004967532416210284,
|
|
"loss": 5.4947,
|
|
"mean_token_accuracy": 0.16200094670057297,
|
|
"num_tokens": 13716397.0,
|
|
"step": 7905
|
|
},
|
|
{
|
|
"entropy": 5.5525562286376955,
|
|
"epoch": 0.6154444660571873,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0004967485485608016,
|
|
"loss": 5.5068,
|
|
"mean_token_accuracy": 0.16395258158445358,
|
|
"num_tokens": 13724724.0,
|
|
"step": 7910
|
|
},
|
|
{
|
|
"entropy": 5.668342161178589,
|
|
"epoch": 0.6158334954289049,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0004967438521358934,
|
|
"loss": 5.4794,
|
|
"mean_token_accuracy": 0.16554345041513444,
|
|
"num_tokens": 13733389.0,
|
|
"step": 7915
|
|
},
|
|
{
|
|
"entropy": 5.5953020572662355,
|
|
"epoch": 0.6162225248006225,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 0.0004967391523463754,
|
|
"loss": 5.4385,
|
|
"mean_token_accuracy": 0.1632681056857109,
|
|
"num_tokens": 13742569.0,
|
|
"step": 7920
|
|
},
|
|
{
|
|
"entropy": 5.581040382385254,
|
|
"epoch": 0.61661155417234,
|
|
"grad_norm": 1.5078125,
|
|
"learning_rate": 0.0004967344491923185,
|
|
"loss": 5.4168,
|
|
"mean_token_accuracy": 0.16416201442480088,
|
|
"num_tokens": 13750975.0,
|
|
"step": 7925
|
|
},
|
|
{
|
|
"entropy": 5.57597918510437,
|
|
"epoch": 0.6170005835440576,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.0004967297426737943,
|
|
"loss": 5.4778,
|
|
"mean_token_accuracy": 0.16318628638982774,
|
|
"num_tokens": 13758782.0,
|
|
"step": 7930
|
|
},
|
|
{
|
|
"entropy": 5.630909013748169,
|
|
"epoch": 0.6173896129157751,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.0004967250327908742,
|
|
"loss": 5.5922,
|
|
"mean_token_accuracy": 0.15122650414705277,
|
|
"num_tokens": 13767321.0,
|
|
"step": 7935
|
|
},
|
|
{
|
|
"entropy": 5.693921947479248,
|
|
"epoch": 0.6177786422874927,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.0004967203195436297,
|
|
"loss": 5.5725,
|
|
"mean_token_accuracy": 0.16585950404405594,
|
|
"num_tokens": 13775992.0,
|
|
"step": 7940
|
|
},
|
|
{
|
|
"entropy": 5.578035116195679,
|
|
"epoch": 0.6181676716592103,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.0004967156029321322,
|
|
"loss": 5.4309,
|
|
"mean_token_accuracy": 0.16884675174951552,
|
|
"num_tokens": 13784358.0,
|
|
"step": 7945
|
|
},
|
|
{
|
|
"entropy": 5.484552240371704,
|
|
"epoch": 0.6185567010309279,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.0004967108829564532,
|
|
"loss": 5.4268,
|
|
"mean_token_accuracy": 0.16732152700424194,
|
|
"num_tokens": 13792834.0,
|
|
"step": 7950
|
|
},
|
|
{
|
|
"entropy": 5.632082462310791,
|
|
"epoch": 0.6189457304026454,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0004967061596166646,
|
|
"loss": 5.5165,
|
|
"mean_token_accuracy": 0.15893340855836868,
|
|
"num_tokens": 13801414.0,
|
|
"step": 7955
|
|
},
|
|
{
|
|
"entropy": 5.6532261848449705,
|
|
"epoch": 0.6193347597743629,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0004967014329128378,
|
|
"loss": 5.5581,
|
|
"mean_token_accuracy": 0.16025267094373702,
|
|
"num_tokens": 13810459.0,
|
|
"step": 7960
|
|
},
|
|
{
|
|
"entropy": 5.592121505737305,
|
|
"epoch": 0.6197237891460805,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.0004966967028450448,
|
|
"loss": 5.3791,
|
|
"mean_token_accuracy": 0.16667962819337845,
|
|
"num_tokens": 13818460.0,
|
|
"step": 7965
|
|
},
|
|
{
|
|
"entropy": 5.554238891601562,
|
|
"epoch": 0.6201128185177981,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.000496691969413357,
|
|
"loss": 5.507,
|
|
"mean_token_accuracy": 0.16117742657661438,
|
|
"num_tokens": 13827693.0,
|
|
"step": 7970
|
|
},
|
|
{
|
|
"entropy": 5.683591508865357,
|
|
"epoch": 0.6205018478895157,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.0004966872326178466,
|
|
"loss": 5.5158,
|
|
"mean_token_accuracy": 0.15253090113401413,
|
|
"num_tokens": 13836506.0,
|
|
"step": 7975
|
|
},
|
|
{
|
|
"entropy": 5.642145490646362,
|
|
"epoch": 0.6208908772612333,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 0.0004966824924585851,
|
|
"loss": 5.5238,
|
|
"mean_token_accuracy": 0.15704460814595222,
|
|
"num_tokens": 13844977.0,
|
|
"step": 7980
|
|
},
|
|
{
|
|
"entropy": 5.580069446563721,
|
|
"epoch": 0.6212799066329507,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0004966777489356448,
|
|
"loss": 5.5077,
|
|
"mean_token_accuracy": 0.15980817675590514,
|
|
"num_tokens": 13854514.0,
|
|
"step": 7985
|
|
},
|
|
{
|
|
"entropy": 5.645097970962524,
|
|
"epoch": 0.6216689360046683,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0004966730020490975,
|
|
"loss": 5.5072,
|
|
"mean_token_accuracy": 0.1550505816936493,
|
|
"num_tokens": 13863037.0,
|
|
"step": 7990
|
|
},
|
|
{
|
|
"entropy": 5.599818134307862,
|
|
"epoch": 0.6220579653763859,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.000496668251799015,
|
|
"loss": 5.4687,
|
|
"mean_token_accuracy": 0.1692013517022133,
|
|
"num_tokens": 13871720.0,
|
|
"step": 7995
|
|
},
|
|
{
|
|
"entropy": 5.636774635314941,
|
|
"epoch": 0.6224469947481035,
|
|
"grad_norm": 1.5546875,
|
|
"learning_rate": 0.0004966634981854699,
|
|
"loss": 5.5026,
|
|
"mean_token_accuracy": 0.16675081104040146,
|
|
"num_tokens": 13880214.0,
|
|
"step": 8000
|
|
},
|
|
{
|
|
"entropy": 5.616530132293701,
|
|
"epoch": 0.6228360241198211,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0004966587412085339,
|
|
"loss": 5.5975,
|
|
"mean_token_accuracy": 0.152876765280962,
|
|
"num_tokens": 13888784.0,
|
|
"step": 8005
|
|
},
|
|
{
|
|
"entropy": 5.650445365905762,
|
|
"epoch": 0.6232250534915386,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.0004966539808682793,
|
|
"loss": 5.5021,
|
|
"mean_token_accuracy": 0.16107800453901291,
|
|
"num_tokens": 13897466.0,
|
|
"step": 8010
|
|
},
|
|
{
|
|
"entropy": 5.589649438858032,
|
|
"epoch": 0.6236140828632561,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.0004966492171647783,
|
|
"loss": 5.5146,
|
|
"mean_token_accuracy": 0.15655134320259095,
|
|
"num_tokens": 13906556.0,
|
|
"step": 8015
|
|
},
|
|
{
|
|
"entropy": 5.555747985839844,
|
|
"epoch": 0.6240031122349737,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.0004966444500981032,
|
|
"loss": 5.4576,
|
|
"mean_token_accuracy": 0.16158139556646348,
|
|
"num_tokens": 13915473.0,
|
|
"step": 8020
|
|
},
|
|
{
|
|
"entropy": 5.653251791000367,
|
|
"epoch": 0.6243921416066913,
|
|
"grad_norm": 1.5546875,
|
|
"learning_rate": 0.0004966396796683265,
|
|
"loss": 5.6261,
|
|
"mean_token_accuracy": 0.15274745523929595,
|
|
"num_tokens": 13924775.0,
|
|
"step": 8025
|
|
},
|
|
{
|
|
"entropy": 5.692790603637695,
|
|
"epoch": 0.6247811709784089,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.0004966349058755204,
|
|
"loss": 5.5036,
|
|
"mean_token_accuracy": 0.15476525872945784,
|
|
"num_tokens": 13933992.0,
|
|
"step": 8030
|
|
},
|
|
{
|
|
"entropy": 5.731003522872925,
|
|
"epoch": 0.6251702003501264,
|
|
"grad_norm": 1.5078125,
|
|
"learning_rate": 0.0004966301287197573,
|
|
"loss": 5.6728,
|
|
"mean_token_accuracy": 0.15809391736984252,
|
|
"num_tokens": 13942877.0,
|
|
"step": 8035
|
|
},
|
|
{
|
|
"entropy": 5.636298751831054,
|
|
"epoch": 0.625559229721844,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0004966253482011098,
|
|
"loss": 5.5205,
|
|
"mean_token_accuracy": 0.16148761957883834,
|
|
"num_tokens": 13952003.0,
|
|
"step": 8040
|
|
},
|
|
{
|
|
"entropy": 5.6766040325164795,
|
|
"epoch": 0.6259482590935616,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 0.0004966205643196503,
|
|
"loss": 5.4583,
|
|
"mean_token_accuracy": 0.16635134518146516,
|
|
"num_tokens": 13959801.0,
|
|
"step": 8045
|
|
},
|
|
{
|
|
"entropy": 5.51854133605957,
|
|
"epoch": 0.6263372884652791,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.0004966157770754516,
|
|
"loss": 5.4561,
|
|
"mean_token_accuracy": 0.15555119663476943,
|
|
"num_tokens": 13968535.0,
|
|
"step": 8050
|
|
},
|
|
{
|
|
"entropy": 5.647353887557983,
|
|
"epoch": 0.6267263178369967,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 0.000496610986468586,
|
|
"loss": 5.445,
|
|
"mean_token_accuracy": 0.16241587996482848,
|
|
"num_tokens": 13977079.0,
|
|
"step": 8055
|
|
},
|
|
{
|
|
"entropy": 5.602263879776001,
|
|
"epoch": 0.6271153472087143,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0004966061924991267,
|
|
"loss": 5.4639,
|
|
"mean_token_accuracy": 0.17081388980150222,
|
|
"num_tokens": 13985118.0,
|
|
"step": 8060
|
|
},
|
|
{
|
|
"entropy": 5.552741384506225,
|
|
"epoch": 0.6275043765804318,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.000496601395167146,
|
|
"loss": 5.4125,
|
|
"mean_token_accuracy": 0.16479296535253524,
|
|
"num_tokens": 13994061.0,
|
|
"step": 8065
|
|
},
|
|
{
|
|
"entropy": 5.61691837310791,
|
|
"epoch": 0.6278934059521494,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0004965965944727168,
|
|
"loss": 5.5592,
|
|
"mean_token_accuracy": 0.1568474255502224,
|
|
"num_tokens": 14002879.0,
|
|
"step": 8070
|
|
},
|
|
{
|
|
"entropy": 5.667020177841186,
|
|
"epoch": 0.628282435323867,
|
|
"grad_norm": 1.5234375,
|
|
"learning_rate": 0.0004965917904159121,
|
|
"loss": 5.5355,
|
|
"mean_token_accuracy": 0.1621012195944786,
|
|
"num_tokens": 14011570.0,
|
|
"step": 8075
|
|
},
|
|
{
|
|
"entropy": 5.573873233795166,
|
|
"epoch": 0.6286714646955845,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.0004965869829968046,
|
|
"loss": 5.3767,
|
|
"mean_token_accuracy": 0.16462417393922807,
|
|
"num_tokens": 14019282.0,
|
|
"step": 8080
|
|
},
|
|
{
|
|
"entropy": 5.547157669067383,
|
|
"epoch": 0.6290604940673021,
|
|
"grad_norm": 1.6015625,
|
|
"learning_rate": 0.0004965821722154674,
|
|
"loss": 5.3898,
|
|
"mean_token_accuracy": 0.1729328453540802,
|
|
"num_tokens": 14027774.0,
|
|
"step": 8085
|
|
},
|
|
{
|
|
"entropy": 5.598388719558716,
|
|
"epoch": 0.6294495234390196,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.0004965773580719734,
|
|
"loss": 5.4058,
|
|
"mean_token_accuracy": 0.1658223569393158,
|
|
"num_tokens": 14036754.0,
|
|
"step": 8090
|
|
},
|
|
{
|
|
"entropy": 5.665834665298462,
|
|
"epoch": 0.6298385528107372,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0004965725405663957,
|
|
"loss": 5.5791,
|
|
"mean_token_accuracy": 0.16007334589958191,
|
|
"num_tokens": 14045714.0,
|
|
"step": 8095
|
|
},
|
|
{
|
|
"entropy": 5.676879072189331,
|
|
"epoch": 0.6302275821824548,
|
|
"grad_norm": 2.078125,
|
|
"learning_rate": 0.0004965677196988073,
|
|
"loss": 5.5926,
|
|
"mean_token_accuracy": 0.1579957962036133,
|
|
"num_tokens": 14054973.0,
|
|
"step": 8100
|
|
},
|
|
{
|
|
"entropy": 5.616937971115112,
|
|
"epoch": 0.6306166115541724,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.0004965628954692815,
|
|
"loss": 5.4947,
|
|
"mean_token_accuracy": 0.1623809590935707,
|
|
"num_tokens": 14064037.0,
|
|
"step": 8105
|
|
},
|
|
{
|
|
"entropy": 5.661908102035523,
|
|
"epoch": 0.63100564092589,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.0004965580678778913,
|
|
"loss": 5.5264,
|
|
"mean_token_accuracy": 0.16121605634689332,
|
|
"num_tokens": 14072269.0,
|
|
"step": 8110
|
|
},
|
|
{
|
|
"entropy": 5.621046781539917,
|
|
"epoch": 0.6313946702976074,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.0004965532369247102,
|
|
"loss": 5.4633,
|
|
"mean_token_accuracy": 0.16086421832442283,
|
|
"num_tokens": 14080595.0,
|
|
"step": 8115
|
|
},
|
|
{
|
|
"entropy": 5.58659930229187,
|
|
"epoch": 0.631783699669325,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.0004965484026098111,
|
|
"loss": 5.4495,
|
|
"mean_token_accuracy": 0.1654338777065277,
|
|
"num_tokens": 14089159.0,
|
|
"step": 8120
|
|
},
|
|
{
|
|
"entropy": 5.630824947357178,
|
|
"epoch": 0.6321727290410426,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.0004965435649332679,
|
|
"loss": 5.5381,
|
|
"mean_token_accuracy": 0.15698456019163132,
|
|
"num_tokens": 14098192.0,
|
|
"step": 8125
|
|
},
|
|
{
|
|
"entropy": 5.657534599304199,
|
|
"epoch": 0.6325617584127602,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 0.0004965387238951536,
|
|
"loss": 5.36,
|
|
"mean_token_accuracy": 0.17074259370565414,
|
|
"num_tokens": 14106552.0,
|
|
"step": 8130
|
|
},
|
|
{
|
|
"entropy": 5.592873573303223,
|
|
"epoch": 0.6329507877844778,
|
|
"grad_norm": 2.859375,
|
|
"learning_rate": 0.0004965338794955418,
|
|
"loss": 5.4319,
|
|
"mean_token_accuracy": 0.16148714870214462,
|
|
"num_tokens": 14114783.0,
|
|
"step": 8135
|
|
},
|
|
{
|
|
"entropy": 5.535675430297852,
|
|
"epoch": 0.6333398171561953,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.0004965290317345061,
|
|
"loss": 5.4973,
|
|
"mean_token_accuracy": 0.15594300478696824,
|
|
"num_tokens": 14124182.0,
|
|
"step": 8140
|
|
},
|
|
{
|
|
"entropy": 5.678386974334717,
|
|
"epoch": 0.6337288465279128,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0004965241806121198,
|
|
"loss": 5.5245,
|
|
"mean_token_accuracy": 0.15432342439889907,
|
|
"num_tokens": 14133037.0,
|
|
"step": 8145
|
|
},
|
|
{
|
|
"entropy": 5.651481246948242,
|
|
"epoch": 0.6341178758996304,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.0004965193261284567,
|
|
"loss": 5.4997,
|
|
"mean_token_accuracy": 0.16438781023025512,
|
|
"num_tokens": 14141677.0,
|
|
"step": 8150
|
|
},
|
|
{
|
|
"entropy": 5.569592905044556,
|
|
"epoch": 0.634506905271348,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 0.0004965144682835904,
|
|
"loss": 5.4629,
|
|
"mean_token_accuracy": 0.17072515040636063,
|
|
"num_tokens": 14149980.0,
|
|
"step": 8155
|
|
},
|
|
{
|
|
"entropy": 5.563594961166382,
|
|
"epoch": 0.6348959346430656,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.0004965096070775946,
|
|
"loss": 5.5003,
|
|
"mean_token_accuracy": 0.16639333367347717,
|
|
"num_tokens": 14158298.0,
|
|
"step": 8160
|
|
},
|
|
{
|
|
"entropy": 5.627389335632325,
|
|
"epoch": 0.6352849640147831,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.0004965047425105431,
|
|
"loss": 5.4598,
|
|
"mean_token_accuracy": 0.16781965643167496,
|
|
"num_tokens": 14166321.0,
|
|
"step": 8165
|
|
},
|
|
{
|
|
"entropy": 5.5292116641998295,
|
|
"epoch": 0.6356739933865007,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.0004964998745825097,
|
|
"loss": 5.4246,
|
|
"mean_token_accuracy": 0.17231572419404984,
|
|
"num_tokens": 14174619.0,
|
|
"step": 8170
|
|
},
|
|
{
|
|
"entropy": 5.566997861862182,
|
|
"epoch": 0.6360630227582182,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 0.0004964950032935682,
|
|
"loss": 5.4403,
|
|
"mean_token_accuracy": 0.16089098602533342,
|
|
"num_tokens": 14183548.0,
|
|
"step": 8175
|
|
},
|
|
{
|
|
"entropy": 5.698858404159546,
|
|
"epoch": 0.6364520521299358,
|
|
"grad_norm": 1.546875,
|
|
"learning_rate": 0.0004964901286437927,
|
|
"loss": 5.6397,
|
|
"mean_token_accuracy": 0.1611291542649269,
|
|
"num_tokens": 14192306.0,
|
|
"step": 8180
|
|
},
|
|
{
|
|
"entropy": 5.5540143013000485,
|
|
"epoch": 0.6368410815016534,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.0004964852506332568,
|
|
"loss": 5.3126,
|
|
"mean_token_accuracy": 0.1775052949786186,
|
|
"num_tokens": 14200280.0,
|
|
"step": 8185
|
|
},
|
|
{
|
|
"entropy": 5.570341730117798,
|
|
"epoch": 0.6372301108733709,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.000496480369262035,
|
|
"loss": 5.5486,
|
|
"mean_token_accuracy": 0.16719427704811096,
|
|
"num_tokens": 14208484.0,
|
|
"step": 8190
|
|
},
|
|
{
|
|
"entropy": 5.606416893005371,
|
|
"epoch": 0.6376191402450885,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.000496475484530201,
|
|
"loss": 5.5412,
|
|
"mean_token_accuracy": 0.16160168945789338,
|
|
"num_tokens": 14217368.0,
|
|
"step": 8195
|
|
},
|
|
{
|
|
"entropy": 5.693037462234497,
|
|
"epoch": 0.6380081696168061,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.0004964705964378292,
|
|
"loss": 5.5571,
|
|
"mean_token_accuracy": 0.15757941454648972,
|
|
"num_tokens": 14226663.0,
|
|
"step": 8200
|
|
},
|
|
{
|
|
"entropy": 5.59523377418518,
|
|
"epoch": 0.6383971989885237,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 0.0004964657049849934,
|
|
"loss": 5.4228,
|
|
"mean_token_accuracy": 0.15858400166034697,
|
|
"num_tokens": 14235153.0,
|
|
"step": 8205
|
|
},
|
|
{
|
|
"entropy": 5.599985122680664,
|
|
"epoch": 0.6387862283602412,
|
|
"grad_norm": 1.546875,
|
|
"learning_rate": 0.0004964608101717681,
|
|
"loss": 5.5548,
|
|
"mean_token_accuracy": 0.15804918855428696,
|
|
"num_tokens": 14244245.0,
|
|
"step": 8210
|
|
},
|
|
{
|
|
"entropy": 5.63315052986145,
|
|
"epoch": 0.6391752577319587,
|
|
"grad_norm": 1.53125,
|
|
"learning_rate": 0.0004964559119982275,
|
|
"loss": 5.4708,
|
|
"mean_token_accuracy": 0.16142986565828324,
|
|
"num_tokens": 14252666.0,
|
|
"step": 8215
|
|
},
|
|
{
|
|
"entropy": 5.637704515457154,
|
|
"epoch": 0.6395642871036763,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.000496451010464446,
|
|
"loss": 5.548,
|
|
"mean_token_accuracy": 0.15910727083683013,
|
|
"num_tokens": 14262232.0,
|
|
"step": 8220
|
|
},
|
|
{
|
|
"entropy": 5.6048393726348875,
|
|
"epoch": 0.6399533164753939,
|
|
"grad_norm": 1.6875,
|
|
"learning_rate": 0.0004964461055704978,
|
|
"loss": 5.4765,
|
|
"mean_token_accuracy": 0.16455696076154708,
|
|
"num_tokens": 14270496.0,
|
|
"step": 8225
|
|
},
|
|
{
|
|
"entropy": 5.528129291534424,
|
|
"epoch": 0.6403423458471115,
|
|
"grad_norm": 1.5546875,
|
|
"learning_rate": 0.0004964411973164574,
|
|
"loss": 5.3994,
|
|
"mean_token_accuracy": 0.17100196778774263,
|
|
"num_tokens": 14278597.0,
|
|
"step": 8230
|
|
},
|
|
{
|
|
"entropy": 5.5415791988372805,
|
|
"epoch": 0.6407313752188291,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 0.0004964362857023993,
|
|
"loss": 5.4861,
|
|
"mean_token_accuracy": 0.16359479427337648,
|
|
"num_tokens": 14287444.0,
|
|
"step": 8235
|
|
},
|
|
{
|
|
"entropy": 5.563477563858032,
|
|
"epoch": 0.6411204045905465,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.000496431370728398,
|
|
"loss": 5.3847,
|
|
"mean_token_accuracy": 0.16639602482318877,
|
|
"num_tokens": 14296041.0,
|
|
"step": 8240
|
|
},
|
|
{
|
|
"entropy": 5.57078709602356,
|
|
"epoch": 0.6415094339622641,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.0004964264523945281,
|
|
"loss": 5.4103,
|
|
"mean_token_accuracy": 0.1668490380048752,
|
|
"num_tokens": 14304700.0,
|
|
"step": 8245
|
|
},
|
|
{
|
|
"entropy": 5.613706636428833,
|
|
"epoch": 0.6418984633339817,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.0004964215307008643,
|
|
"loss": 5.5295,
|
|
"mean_token_accuracy": 0.16124773621559144,
|
|
"num_tokens": 14312873.0,
|
|
"step": 8250
|
|
},
|
|
{
|
|
"entropy": 5.674438238143921,
|
|
"epoch": 0.6422874927056993,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.0004964166056474811,
|
|
"loss": 5.5317,
|
|
"mean_token_accuracy": 0.15775930359959603,
|
|
"num_tokens": 14321697.0,
|
|
"step": 8255
|
|
},
|
|
{
|
|
"entropy": 5.587344217300415,
|
|
"epoch": 0.6426765220774169,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 0.0004964116772344534,
|
|
"loss": 5.527,
|
|
"mean_token_accuracy": 0.1574459046125412,
|
|
"num_tokens": 14330074.0,
|
|
"step": 8260
|
|
},
|
|
{
|
|
"entropy": 5.696241664886474,
|
|
"epoch": 0.6430655514491345,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 0.0004964067454618559,
|
|
"loss": 5.5967,
|
|
"mean_token_accuracy": 0.15248970463871955,
|
|
"num_tokens": 14339485.0,
|
|
"step": 8265
|
|
},
|
|
{
|
|
"entropy": 5.717200422286988,
|
|
"epoch": 0.6434545808208519,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.0004964018103297634,
|
|
"loss": 5.5406,
|
|
"mean_token_accuracy": 0.15757163912057875,
|
|
"num_tokens": 14348182.0,
|
|
"step": 8270
|
|
},
|
|
{
|
|
"entropy": 5.728037929534912,
|
|
"epoch": 0.6438436101925695,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.0004963968718382509,
|
|
"loss": 5.6075,
|
|
"mean_token_accuracy": 0.155861759185791,
|
|
"num_tokens": 14357202.0,
|
|
"step": 8275
|
|
},
|
|
{
|
|
"entropy": 5.627114486694336,
|
|
"epoch": 0.6442326395642871,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.0004963919299873931,
|
|
"loss": 5.5137,
|
|
"mean_token_accuracy": 0.15722453445196152,
|
|
"num_tokens": 14366001.0,
|
|
"step": 8280
|
|
},
|
|
{
|
|
"entropy": 5.695006942749023,
|
|
"epoch": 0.6446216689360047,
|
|
"grad_norm": 1.65625,
|
|
"learning_rate": 0.0004963869847772653,
|
|
"loss": 5.5558,
|
|
"mean_token_accuracy": 0.1576986774802208,
|
|
"num_tokens": 14374894.0,
|
|
"step": 8285
|
|
},
|
|
{
|
|
"entropy": 5.590862274169922,
|
|
"epoch": 0.6450106983077223,
|
|
"grad_norm": 1.7734375,
|
|
"learning_rate": 0.0004963820362079423,
|
|
"loss": 5.4925,
|
|
"mean_token_accuracy": 0.16458533555269242,
|
|
"num_tokens": 14383396.0,
|
|
"step": 8290
|
|
},
|
|
{
|
|
"entropy": 5.581786012649536,
|
|
"epoch": 0.6453997276794398,
|
|
"grad_norm": 1.546875,
|
|
"learning_rate": 0.0004963770842794994,
|
|
"loss": 5.4504,
|
|
"mean_token_accuracy": 0.1657285675406456,
|
|
"num_tokens": 14392514.0,
|
|
"step": 8295
|
|
},
|
|
{
|
|
"entropy": 5.629509305953979,
|
|
"epoch": 0.6457887570511573,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.0004963721289920115,
|
|
"loss": 5.4895,
|
|
"mean_token_accuracy": 0.1577771633863449,
|
|
"num_tokens": 14401916.0,
|
|
"step": 8300
|
|
},
|
|
{
|
|
"entropy": 5.642601203918457,
|
|
"epoch": 0.6461777864228749,
|
|
"grad_norm": 1.671875,
|
|
"learning_rate": 0.0004963671703455538,
|
|
"loss": 5.5519,
|
|
"mean_token_accuracy": 0.15847557485103608,
|
|
"num_tokens": 14410476.0,
|
|
"step": 8305
|
|
},
|
|
{
|
|
"entropy": 5.65356411933899,
|
|
"epoch": 0.6465668157945925,
|
|
"grad_norm": 1.578125,
|
|
"learning_rate": 0.0004963622083402018,
|
|
"loss": 5.5281,
|
|
"mean_token_accuracy": 0.15930469781160356,
|
|
"num_tokens": 14418437.0,
|
|
"step": 8310
|
|
},
|
|
{
|
|
"entropy": 5.576390409469605,
|
|
"epoch": 0.6469558451663101,
|
|
"grad_norm": 1.515625,
|
|
"learning_rate": 0.0004963572429760305,
|
|
"loss": 5.4747,
|
|
"mean_token_accuracy": 0.16562929451465608,
|
|
"num_tokens": 14426978.0,
|
|
"step": 8315
|
|
},
|
|
{
|
|
"entropy": 5.662410306930542,
|
|
"epoch": 0.6473448745380276,
|
|
"grad_norm": 1.5234375,
|
|
"learning_rate": 0.0004963522742531155,
|
|
"loss": 5.5256,
|
|
"mean_token_accuracy": 0.15617482513189315,
|
|
"num_tokens": 14435043.0,
|
|
"step": 8320
|
|
},
|
|
{
|
|
"entropy": 5.5775915622711185,
|
|
"epoch": 0.6477339039097452,
|
|
"grad_norm": 1.515625,
|
|
"learning_rate": 0.000496347302171532,
|
|
"loss": 5.4221,
|
|
"mean_token_accuracy": 0.1707099497318268,
|
|
"num_tokens": 14443397.0,
|
|
"step": 8325
|
|
},
|
|
{
|
|
"entropy": 5.630001449584961,
|
|
"epoch": 0.6481229332814628,
|
|
"grad_norm": 1.5,
|
|
"learning_rate": 0.0004963423267313554,
|
|
"loss": 5.5111,
|
|
"mean_token_accuracy": 0.16315706968307495,
|
|
"num_tokens": 14452536.0,
|
|
"step": 8330
|
|
},
|
|
{
|
|
"entropy": 5.678388071060181,
|
|
"epoch": 0.6485119626531803,
|
|
"grad_norm": 2.28125,
|
|
"learning_rate": 0.0004963373479326614,
|
|
"loss": 5.5626,
|
|
"mean_token_accuracy": 0.152607698738575,
|
|
"num_tokens": 14461901.0,
|
|
"step": 8335
|
|
},
|
|
{
|
|
"entropy": 5.605925178527832,
|
|
"epoch": 0.6489009920248979,
|
|
"grad_norm": 1.6484375,
|
|
"learning_rate": 0.0004963323657755255,
|
|
"loss": 5.4965,
|
|
"mean_token_accuracy": 0.16920969188213347,
|
|
"num_tokens": 14470547.0,
|
|
"step": 8340
|
|
},
|
|
{
|
|
"entropy": 5.545820569992065,
|
|
"epoch": 0.6492900213966154,
|
|
"grad_norm": 1.5078125,
|
|
"learning_rate": 0.0004963273802600231,
|
|
"loss": 5.3666,
|
|
"mean_token_accuracy": 0.16293006539344787,
|
|
"num_tokens": 14478439.0,
|
|
"step": 8345
|
|
},
|
|
{
|
|
"entropy": 5.640049695968628,
|
|
"epoch": 0.649679050768333,
|
|
"grad_norm": 1.53125,
|
|
"learning_rate": 0.00049632239138623,
|
|
"loss": 5.4395,
|
|
"mean_token_accuracy": 0.1675925999879837,
|
|
"num_tokens": 14486621.0,
|
|
"step": 8350
|
|
},
|
|
{
|
|
"entropy": 5.583245944976807,
|
|
"epoch": 0.6500680801400506,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.0004963173991542219,
|
|
"loss": 5.4247,
|
|
"mean_token_accuracy": 0.16209669709205626,
|
|
"num_tokens": 14495313.0,
|
|
"step": 8355
|
|
},
|
|
{
|
|
"entropy": 5.61328010559082,
|
|
"epoch": 0.6504571095117682,
|
|
"grad_norm": 1.5625,
|
|
"learning_rate": 0.0004963124035640746,
|
|
"loss": 5.4962,
|
|
"mean_token_accuracy": 0.16555400639772416,
|
|
"num_tokens": 14503647.0,
|
|
"step": 8360
|
|
},
|
|
{
|
|
"entropy": 5.612566041946411,
|
|
"epoch": 0.6508461388834857,
|
|
"grad_norm": 1.796875,
|
|
"learning_rate": 0.0004963074046158637,
|
|
"loss": 5.4302,
|
|
"mean_token_accuracy": 0.16509283930063248,
|
|
"num_tokens": 14512350.0,
|
|
"step": 8365
|
|
},
|
|
{
|
|
"entropy": 5.679213905334473,
|
|
"epoch": 0.6512351682552032,
|
|
"grad_norm": 1.5,
|
|
"learning_rate": 0.0004963024023096652,
|
|
"loss": 5.5734,
|
|
"mean_token_accuracy": 0.15210946649312973,
|
|
"num_tokens": 14521801.0,
|
|
"step": 8370
|
|
},
|
|
{
|
|
"entropy": 5.560119771957398,
|
|
"epoch": 0.6516241976269208,
|
|
"grad_norm": 1.59375,
|
|
"learning_rate": 0.0004962973966455551,
|
|
"loss": 5.4078,
|
|
"mean_token_accuracy": 0.16019269973039627,
|
|
"num_tokens": 14530045.0,
|
|
"step": 8375
|
|
},
|
|
{
|
|
"entropy": 5.55653567314148,
|
|
"epoch": 0.6520132269986384,
|
|
"grad_norm": 1.90625,
|
|
"learning_rate": 0.0004962923876236092,
|
|
"loss": 5.5038,
|
|
"mean_token_accuracy": 0.16818015426397323,
|
|
"num_tokens": 14538944.0,
|
|
"step": 8380
|
|
},
|
|
{
|
|
"entropy": 5.6275276184082035,
|
|
"epoch": 0.652402256370356,
|
|
"grad_norm": 1.5,
|
|
"learning_rate": 0.0004962873752439035,
|
|
"loss": 5.5462,
|
|
"mean_token_accuracy": 0.15992224514484404,
|
|
"num_tokens": 14548180.0,
|
|
"step": 8385
|
|
},
|
|
{
|
|
"entropy": 5.65324182510376,
|
|
"epoch": 0.6527912857420736,
|
|
"grad_norm": 1.6015625,
|
|
"learning_rate": 0.0004962823595065141,
|
|
"loss": 5.5374,
|
|
"mean_token_accuracy": 0.15571261197328568,
|
|
"num_tokens": 14556907.0,
|
|
"step": 8390
|
|
},
|
|
{
|
|
"entropy": 5.607539129257202,
|
|
"epoch": 0.653180315113791,
|
|
"grad_norm": 1.5078125,
|
|
"learning_rate": 0.0004962773404115172,
|
|
"loss": 5.5153,
|
|
"mean_token_accuracy": 0.15769898295402526,
|
|
"num_tokens": 14565317.0,
|
|
"step": 8395
|
|
},
|
|
{
|
|
"entropy": 5.683702993392944,
|
|
"epoch": 0.6535693444855086,
|
|
"grad_norm": 1.546875,
|
|
"learning_rate": 0.0004962723179589886,
|
|
"loss": 5.5783,
|
|
"mean_token_accuracy": 0.16089919656515123,
|
|
"num_tokens": 14574485.0,
|
|
"step": 8400
|
|
},
|
|
{
|
|
"entropy": 5.707424640655518,
|
|
"epoch": 0.6539583738572262,
|
|
"grad_norm": 1.640625,
|
|
"learning_rate": 0.000496267292149005,
|
|
"loss": 5.4845,
|
|
"mean_token_accuracy": 0.16174585819244386,
|
|
"num_tokens": 14584002.0,
|
|
"step": 8405
|
|
},
|
|
{
|
|
"entropy": 5.633489513397217,
|
|
"epoch": 0.6543474032289438,
|
|
"grad_norm": 1.5703125,
|
|
"learning_rate": 0.0004962622629816423,
|
|
"loss": 5.4311,
|
|
"mean_token_accuracy": 0.16070465072989465,
|
|
"num_tokens": 14592033.0,
|
|
"step": 8410
|
|
},
|
|
{
|
|
"entropy": 5.594094085693359,
|
|
"epoch": 0.6547364326006614,
|
|
"grad_norm": 1.6640625,
|
|
"learning_rate": 0.000496257230456977,
|
|
"loss": 5.5511,
|
|
"mean_token_accuracy": 0.15814293622970582,
|
|
"num_tokens": 14600084.0,
|
|
"step": 8415
|
|
},
|
|
{
|
|
"entropy": 5.609566974639892,
|
|
"epoch": 0.6551254619723789,
|
|
"grad_norm": 1.71875,
|
|
"learning_rate": 0.0004962521945750855,
|
|
"loss": 5.4655,
|
|
"mean_token_accuracy": 0.17209602296352386,
|
|
"num_tokens": 14608380.0,
|
|
"step": 8420
|
|
},
|
|
{
|
|
"entropy": 5.62038254737854,
|
|
"epoch": 0.6555144913440965,
|
|
"grad_norm": 1.5234375,
|
|
"learning_rate": 0.000496247155336044,
|
|
"loss": 5.5372,
|
|
"mean_token_accuracy": 0.16135943531990052,
|
|
"num_tokens": 14616864.0,
|
|
"step": 8425
|
|
},
|
|
{
|
|
"entropy": 5.643423366546631,
|
|
"epoch": 0.655903520715814,
|
|
"grad_norm": 1.828125,
|
|
"learning_rate": 0.0004962421127399291,
|
|
"loss": 5.5848,
|
|
"mean_token_accuracy": 0.15594003945589066,
|
|
"num_tokens": 14627054.0,
|
|
"step": 8430
|
|
},
|
|
{
|
|
"entropy": 5.681075525283814,
|
|
"epoch": 0.6562925500875316,
|
|
"grad_norm": 1.8125,
|
|
"learning_rate": 0.0004962370667868172,
|
|
"loss": 5.4622,
|
|
"mean_token_accuracy": 0.16358790993690492,
|
|
"num_tokens": 14634985.0,
|
|
"step": 8435
|
|
},
|
|
{
|
|
"entropy": 5.67454514503479,
|
|
"epoch": 0.6566815794592492,
|
|
"grad_norm": 1.9453125,
|
|
"learning_rate": 0.0004962320174767851,
|
|
"loss": 5.5275,
|
|
"mean_token_accuracy": 0.16311112195253372,
|
|
"num_tokens": 14644135.0,
|
|
"step": 8440
|
|
},
|
|
{
|
|
"entropy": 5.603046178817749,
|
|
"epoch": 0.6570706088309667,
|
|
"grad_norm": 1.6328125,
|
|
"learning_rate": 0.000496226964809909,
|
|
"loss": 5.475,
|
|
"mean_token_accuracy": 0.1671380341053009,
|
|
"num_tokens": 14652997.0,
|
|
"step": 8445
|
|
},
|
|
{
|
|
"entropy": 5.582294082641601,
|
|
"epoch": 0.6574596382026843,
|
|
"grad_norm": 1.515625,
|
|
"learning_rate": 0.000496221908786266,
|
|
"loss": 5.5694,
|
|
"mean_token_accuracy": 0.15573946237564087,
|
|
"num_tokens": 14661961.0,
|
|
"step": 8450
|
|
},
|
|
{
|
|
"entropy": 5.72095365524292,
|
|
"epoch": 0.6578486675744019,
|
|
"grad_norm": 1.4921875,
|
|
"learning_rate": 0.0004962168494059327,
|
|
"loss": 5.6857,
|
|
"mean_token_accuracy": 0.14969259947538377,
|
|
"num_tokens": 14671407.0,
|
|
"step": 8455
|
|
},
|
|
{
|
|
"entropy": 5.648622035980225,
|
|
"epoch": 0.6582376969461194,
|
|
"grad_norm": 3.46875,
|
|
"learning_rate": 0.0004962117866689857,
|
|
"loss": 5.5337,
|
|
"mean_token_accuracy": 0.16302797496318816,
|
|
"num_tokens": 14680015.0,
|
|
"step": 8460
|
|
},
|
|
{
|
|
"entropy": 5.558050012588501,
|
|
"epoch": 0.658626726317837,
|
|
"grad_norm": 1.65625,
|
|
"learning_rate": 0.000496206720575502,
|
|
"loss": 5.3794,
|
|
"mean_token_accuracy": 0.16196016669273378,
|
|
"num_tokens": 14688444.0,
|
|
"step": 8465
|
|
},
|
|
{
|
|
"entropy": 5.565975618362427,
|
|
"epoch": 0.6590157556895546,
|
|
"grad_norm": 1.6328125,
|
|
"learning_rate": 0.0004962016511255584,
|
|
"loss": 5.5212,
|
|
"mean_token_accuracy": 0.15961693376302719,
|
|
"num_tokens": 14697246.0,
|
|
"step": 8470
|
|
},
|
|
{
|
|
"entropy": 5.590129041671753,
|
|
"epoch": 0.6594047850612721,
|
|
"grad_norm": 1.9609375,
|
|
"learning_rate": 0.0004961965783192318,
|
|
"loss": 5.3933,
|
|
"mean_token_accuracy": 0.16685593873262405,
|
|
"num_tokens": 14706066.0,
|
|
"step": 8475
|
|
},
|
|
{
|
|
"entropy": 5.638283777236938,
|
|
"epoch": 0.6597938144329897,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0004961915021565992,
|
|
"loss": 5.5079,
|
|
"mean_token_accuracy": 0.1568120762705803,
|
|
"num_tokens": 14714327.0,
|
|
"step": 8480
|
|
},
|
|
{
|
|
"entropy": 5.570411491394043,
|
|
"epoch": 0.6601828438047073,
|
|
"grad_norm": 1.5,
|
|
"learning_rate": 0.0004961864226377377,
|
|
"loss": 5.382,
|
|
"mean_token_accuracy": 0.16485304087400438,
|
|
"num_tokens": 14723053.0,
|
|
"step": 8485
|
|
},
|
|
{
|
|
"entropy": 5.544371938705444,
|
|
"epoch": 0.6605718731764249,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.0004961813397627241,
|
|
"loss": 5.3785,
|
|
"mean_token_accuracy": 0.17082611471414566,
|
|
"num_tokens": 14731825.0,
|
|
"step": 8490
|
|
},
|
|
{
|
|
"entropy": 5.629836750030518,
|
|
"epoch": 0.6609609025481424,
|
|
"grad_norm": 1.609375,
|
|
"learning_rate": 0.0004961762535316358,
|
|
"loss": 5.5762,
|
|
"mean_token_accuracy": 0.156722342222929,
|
|
"num_tokens": 14740751.0,
|
|
"step": 8495
|
|
},
|
|
{
|
|
"entropy": 5.5798173427581785,
|
|
"epoch": 0.6613499319198599,
|
|
"grad_norm": 1.6953125,
|
|
"learning_rate": 0.0004961711639445499,
|
|
"loss": 5.4425,
|
|
"mean_token_accuracy": 0.16466536670923232,
|
|
"num_tokens": 14748994.0,
|
|
"step": 8500
|
|
},
|
|
{
|
|
"entropy": 5.582650995254516,
|
|
"epoch": 0.6617389612915775,
|
|
"grad_norm": 2.21875,
|
|
"learning_rate": 0.0004961660710015435,
|
|
"loss": 5.4294,
|
|
"mean_token_accuracy": 0.1654239133000374,
|
|
"num_tokens": 14757388.0,
|
|
"step": 8505
|
|
},
|
|
{
|
|
"entropy": 5.707845401763916,
|
|
"epoch": 0.6621279906632951,
|
|
"grad_norm": 1.5859375,
|
|
"learning_rate": 0.0004961609747026943,
|
|
"loss": 5.6107,
|
|
"mean_token_accuracy": 0.15208702832460402,
|
|
"num_tokens": 14766654.0,
|
|
"step": 8510
|
|
},
|
|
{
|
|
"entropy": 5.628918075561524,
|
|
"epoch": 0.6625170200350127,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.0004961558750480791,
|
|
"loss": 5.5065,
|
|
"mean_token_accuracy": 0.16062942296266555,
|
|
"num_tokens": 14775561.0,
|
|
"step": 8515
|
|
},
|
|
{
|
|
"entropy": 5.590156745910645,
|
|
"epoch": 0.6629060494067303,
|
|
"grad_norm": 1.59375,
|
|
"learning_rate": 0.0004961507720377756,
|
|
"loss": 5.5583,
|
|
"mean_token_accuracy": 0.15312558114528657,
|
|
"num_tokens": 14783596.0,
|
|
"step": 8520
|
|
},
|
|
{
|
|
"entropy": 5.673126602172852,
|
|
"epoch": 0.6632950787784477,
|
|
"grad_norm": 1.8984375,
|
|
"learning_rate": 0.0004961456656718611,
|
|
"loss": 5.5673,
|
|
"mean_token_accuracy": 0.1590380698442459,
|
|
"num_tokens": 14791932.0,
|
|
"step": 8525
|
|
},
|
|
{
|
|
"entropy": 5.685076332092285,
|
|
"epoch": 0.6636841081501653,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 0.000496140555950413,
|
|
"loss": 5.6037,
|
|
"mean_token_accuracy": 0.15631160587072374,
|
|
"num_tokens": 14801261.0,
|
|
"step": 8530
|
|
},
|
|
{
|
|
"entropy": 5.622698163986206,
|
|
"epoch": 0.6640731375218829,
|
|
"grad_norm": 1.4921875,
|
|
"learning_rate": 0.0004961354428735091,
|
|
"loss": 5.4777,
|
|
"mean_token_accuracy": 0.1577353447675705,
|
|
"num_tokens": 14809788.0,
|
|
"step": 8535
|
|
},
|
|
{
|
|
"entropy": 5.542088317871094,
|
|
"epoch": 0.6644621668936005,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.0004961303264412267,
|
|
"loss": 5.4653,
|
|
"mean_token_accuracy": 0.15726249366998674,
|
|
"num_tokens": 14818324.0,
|
|
"step": 8540
|
|
},
|
|
{
|
|
"entropy": 5.527442979812622,
|
|
"epoch": 0.6648511962653181,
|
|
"grad_norm": 1.8984375,
|
|
"learning_rate": 0.0004961252066536437,
|
|
"loss": 5.4235,
|
|
"mean_token_accuracy": 0.16347662657499312,
|
|
"num_tokens": 14827020.0,
|
|
"step": 8545
|
|
},
|
|
{
|
|
"entropy": 5.569663619995117,
|
|
"epoch": 0.6652402256370356,
|
|
"grad_norm": 1.6796875,
|
|
"learning_rate": 0.0004961200835108375,
|
|
"loss": 5.5391,
|
|
"mean_token_accuracy": 0.15555160492658615,
|
|
"num_tokens": 14835522.0,
|
|
"step": 8550
|
|
},
|
|
{
|
|
"entropy": 5.627895498275757,
|
|
"epoch": 0.6656292550087531,
|
|
"grad_norm": 1.9453125,
|
|
"learning_rate": 0.000496114957012886,
|
|
"loss": 5.493,
|
|
"mean_token_accuracy": 0.16153236776590346,
|
|
"num_tokens": 14844676.0,
|
|
"step": 8555
|
|
},
|
|
{
|
|
"entropy": 5.699510955810547,
|
|
"epoch": 0.6660182843804707,
|
|
"grad_norm": 1.6328125,
|
|
"learning_rate": 0.0004961098271598671,
|
|
"loss": 5.5413,
|
|
"mean_token_accuracy": 0.1609079509973526,
|
|
"num_tokens": 14853996.0,
|
|
"step": 8560
|
|
},
|
|
{
|
|
"entropy": 5.619197607040405,
|
|
"epoch": 0.6664073137521883,
|
|
"grad_norm": 1.671875,
|
|
"learning_rate": 0.0004961046939518585,
|
|
"loss": 5.5239,
|
|
"mean_token_accuracy": 0.15910777151584626,
|
|
"num_tokens": 14862981.0,
|
|
"step": 8565
|
|
},
|
|
{
|
|
"entropy": 5.658803033828735,
|
|
"epoch": 0.6667963431239059,
|
|
"grad_norm": 1.4921875,
|
|
"learning_rate": 0.0004960995573889379,
|
|
"loss": 5.5612,
|
|
"mean_token_accuracy": 0.1559648483991623,
|
|
"num_tokens": 14872378.0,
|
|
"step": 8570
|
|
},
|
|
{
|
|
"entropy": 5.589079093933106,
|
|
"epoch": 0.6671853724956234,
|
|
"grad_norm": 1.5078125,
|
|
"learning_rate": 0.0004960944174711836,
|
|
"loss": 5.4968,
|
|
"mean_token_accuracy": 0.15561144798994064,
|
|
"num_tokens": 14881662.0,
|
|
"step": 8575
|
|
},
|
|
{
|
|
"entropy": 5.621028661727905,
|
|
"epoch": 0.667574401867341,
|
|
"grad_norm": 1.9921875,
|
|
"learning_rate": 0.0004960892741986734,
|
|
"loss": 5.3817,
|
|
"mean_token_accuracy": 0.16623928993940354,
|
|
"num_tokens": 14890211.0,
|
|
"step": 8580
|
|
},
|
|
{
|
|
"entropy": 5.671985101699829,
|
|
"epoch": 0.6679634312390585,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.0004960841275714853,
|
|
"loss": 5.6131,
|
|
"mean_token_accuracy": 0.15232166945934295,
|
|
"num_tokens": 14899865.0,
|
|
"step": 8585
|
|
},
|
|
{
|
|
"entropy": 5.65290093421936,
|
|
"epoch": 0.6683524606107761,
|
|
"grad_norm": 1.5,
|
|
"learning_rate": 0.0004960789775896975,
|
|
"loss": 5.5242,
|
|
"mean_token_accuracy": 0.15458524227142334,
|
|
"num_tokens": 14908334.0,
|
|
"step": 8590
|
|
},
|
|
{
|
|
"entropy": 5.5436254978179935,
|
|
"epoch": 0.6687414899824937,
|
|
"grad_norm": 1.75,
|
|
"learning_rate": 0.0004960738242533881,
|
|
"loss": 5.4829,
|
|
"mean_token_accuracy": 0.16041945219039916,
|
|
"num_tokens": 14916477.0,
|
|
"step": 8595
|
|
},
|
|
{
|
|
"entropy": 5.554329109191895,
|
|
"epoch": 0.6691305193542112,
|
|
"grad_norm": 1.6796875,
|
|
"learning_rate": 0.0004960686675626353,
|
|
"loss": 5.4019,
|
|
"mean_token_accuracy": 0.16701223701238632,
|
|
"num_tokens": 14925223.0,
|
|
"step": 8600
|
|
},
|
|
{
|
|
"entropy": 5.687564706802368,
|
|
"epoch": 0.6695195487259288,
|
|
"grad_norm": 2.046875,
|
|
"learning_rate": 0.0004960635075175173,
|
|
"loss": 5.5495,
|
|
"mean_token_accuracy": 0.16739532649517058,
|
|
"num_tokens": 14934427.0,
|
|
"step": 8605
|
|
},
|
|
{
|
|
"entropy": 5.636126184463501,
|
|
"epoch": 0.6699085780976464,
|
|
"grad_norm": 1.515625,
|
|
"learning_rate": 0.0004960583441181124,
|
|
"loss": 5.4747,
|
|
"mean_token_accuracy": 0.16085093319416047,
|
|
"num_tokens": 14943175.0,
|
|
"step": 8610
|
|
},
|
|
{
|
|
"entropy": 5.587858009338379,
|
|
"epoch": 0.670297607469364,
|
|
"grad_norm": 1.5078125,
|
|
"learning_rate": 0.0004960531773644992,
|
|
"loss": 5.5039,
|
|
"mean_token_accuracy": 0.16135278195142747,
|
|
"num_tokens": 14951933.0,
|
|
"step": 8615
|
|
},
|
|
{
|
|
"entropy": 5.554653596878052,
|
|
"epoch": 0.6706866368410815,
|
|
"grad_norm": 3.734375,
|
|
"learning_rate": 0.0004960480072567557,
|
|
"loss": 5.491,
|
|
"mean_token_accuracy": 0.16200556010007858,
|
|
"num_tokens": 14960735.0,
|
|
"step": 8620
|
|
},
|
|
{
|
|
"entropy": 5.607791566848755,
|
|
"epoch": 0.671075666212799,
|
|
"grad_norm": 1.65625,
|
|
"learning_rate": 0.0004960428337949604,
|
|
"loss": 5.5836,
|
|
"mean_token_accuracy": 0.15506957173347474,
|
|
"num_tokens": 14970326.0,
|
|
"step": 8625
|
|
},
|
|
{
|
|
"entropy": 5.645353841781616,
|
|
"epoch": 0.6714646955845166,
|
|
"grad_norm": 1.6875,
|
|
"learning_rate": 0.0004960376569791921,
|
|
"loss": 5.4494,
|
|
"mean_token_accuracy": 0.1644549399614334,
|
|
"num_tokens": 14979822.0,
|
|
"step": 8630
|
|
},
|
|
{
|
|
"entropy": 5.733426570892334,
|
|
"epoch": 0.6718537249562342,
|
|
"grad_norm": 1.6640625,
|
|
"learning_rate": 0.0004960324768095291,
|
|
"loss": 5.5556,
|
|
"mean_token_accuracy": 0.15823704600334168,
|
|
"num_tokens": 14989350.0,
|
|
"step": 8635
|
|
},
|
|
{
|
|
"entropy": 5.657193660736084,
|
|
"epoch": 0.6722427543279518,
|
|
"grad_norm": 1.96875,
|
|
"learning_rate": 0.0004960272932860502,
|
|
"loss": 5.5569,
|
|
"mean_token_accuracy": 0.15302964970469474,
|
|
"num_tokens": 14998763.0,
|
|
"step": 8640
|
|
},
|
|
{
|
|
"entropy": 5.610429859161377,
|
|
"epoch": 0.6726317836996694,
|
|
"grad_norm": 1.8203125,
|
|
"learning_rate": 0.0004960221064088338,
|
|
"loss": 5.4387,
|
|
"mean_token_accuracy": 0.16410010904073716,
|
|
"num_tokens": 15006497.0,
|
|
"step": 8645
|
|
},
|
|
{
|
|
"entropy": 5.521879577636719,
|
|
"epoch": 0.6730208130713868,
|
|
"grad_norm": 2.140625,
|
|
"learning_rate": 0.0004960169161779588,
|
|
"loss": 5.4088,
|
|
"mean_token_accuracy": 0.16455425322055817,
|
|
"num_tokens": 15014397.0,
|
|
"step": 8650
|
|
},
|
|
{
|
|
"entropy": 5.5825025081634525,
|
|
"epoch": 0.6734098424431044,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 0.0004960117225935038,
|
|
"loss": 5.434,
|
|
"mean_token_accuracy": 0.1634689003229141,
|
|
"num_tokens": 15022726.0,
|
|
"step": 8655
|
|
},
|
|
{
|
|
"entropy": 5.689628839492798,
|
|
"epoch": 0.673798871814822,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.0004960065256555477,
|
|
"loss": 5.6392,
|
|
"mean_token_accuracy": 0.15156934410333633,
|
|
"num_tokens": 15032317.0,
|
|
"step": 8660
|
|
},
|
|
{
|
|
"entropy": 5.632172536849976,
|
|
"epoch": 0.6741879011865396,
|
|
"grad_norm": 1.5390625,
|
|
"learning_rate": 0.0004960013253641695,
|
|
"loss": 5.5093,
|
|
"mean_token_accuracy": 0.16222840100526809,
|
|
"num_tokens": 15041091.0,
|
|
"step": 8665
|
|
},
|
|
{
|
|
"entropy": 5.696352577209472,
|
|
"epoch": 0.6745769305582572,
|
|
"grad_norm": 1.4921875,
|
|
"learning_rate": 0.0004959961217194477,
|
|
"loss": 5.6481,
|
|
"mean_token_accuracy": 0.15019654110074043,
|
|
"num_tokens": 15049797.0,
|
|
"step": 8670
|
|
},
|
|
{
|
|
"entropy": 5.562292814254761,
|
|
"epoch": 0.6749659599299748,
|
|
"grad_norm": 1.5078125,
|
|
"learning_rate": 0.0004959909147214615,
|
|
"loss": 5.3326,
|
|
"mean_token_accuracy": 0.17687424272298813,
|
|
"num_tokens": 15057736.0,
|
|
"step": 8675
|
|
},
|
|
{
|
|
"entropy": 5.586552238464355,
|
|
"epoch": 0.6753549893016922,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 0.0004959857043702902,
|
|
"loss": 5.5146,
|
|
"mean_token_accuracy": 0.16430850476026534,
|
|
"num_tokens": 15066072.0,
|
|
"step": 8680
|
|
},
|
|
{
|
|
"entropy": 5.605910587310791,
|
|
"epoch": 0.6757440186734098,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.0004959804906660124,
|
|
"loss": 5.4266,
|
|
"mean_token_accuracy": 0.1668688103556633,
|
|
"num_tokens": 15073918.0,
|
|
"step": 8685
|
|
},
|
|
{
|
|
"entropy": 5.665558671951294,
|
|
"epoch": 0.6761330480451274,
|
|
"grad_norm": 1.4921875,
|
|
"learning_rate": 0.0004959752736087073,
|
|
"loss": 5.5073,
|
|
"mean_token_accuracy": 0.16089159101247788,
|
|
"num_tokens": 15082937.0,
|
|
"step": 8690
|
|
},
|
|
{
|
|
"entropy": 5.609713792800903,
|
|
"epoch": 0.676522077416845,
|
|
"grad_norm": 1.65625,
|
|
"learning_rate": 0.0004959700531984543,
|
|
"loss": 5.4734,
|
|
"mean_token_accuracy": 0.1653521776199341,
|
|
"num_tokens": 15091218.0,
|
|
"step": 8695
|
|
},
|
|
{
|
|
"entropy": 5.616780757904053,
|
|
"epoch": 0.6769111067885626,
|
|
"grad_norm": 1.5390625,
|
|
"learning_rate": 0.0004959648294353324,
|
|
"loss": 5.4071,
|
|
"mean_token_accuracy": 0.16858331859111786,
|
|
"num_tokens": 15099640.0,
|
|
"step": 8700
|
|
},
|
|
{
|
|
"entropy": 5.62099781036377,
|
|
"epoch": 0.6773001361602801,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.0004959596023194208,
|
|
"loss": 5.4814,
|
|
"mean_token_accuracy": 0.1604107677936554,
|
|
"num_tokens": 15108710.0,
|
|
"step": 8705
|
|
},
|
|
{
|
|
"entropy": 5.589712762832642,
|
|
"epoch": 0.6776891655319977,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.000495954371850799,
|
|
"loss": 5.4417,
|
|
"mean_token_accuracy": 0.16216772943735122,
|
|
"num_tokens": 15117074.0,
|
|
"step": 8710
|
|
},
|
|
{
|
|
"entropy": 5.635924339294434,
|
|
"epoch": 0.6780781949037152,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 0.0004959491380295463,
|
|
"loss": 5.4247,
|
|
"mean_token_accuracy": 0.1658407837152481,
|
|
"num_tokens": 15124714.0,
|
|
"step": 8715
|
|
},
|
|
{
|
|
"entropy": 5.545988988876343,
|
|
"epoch": 0.6784672242754328,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.0004959439008557422,
|
|
"loss": 5.448,
|
|
"mean_token_accuracy": 0.16205866634845734,
|
|
"num_tokens": 15134177.0,
|
|
"step": 8720
|
|
},
|
|
{
|
|
"entropy": 5.591541147232055,
|
|
"epoch": 0.6788562536471504,
|
|
"grad_norm": 1.890625,
|
|
"learning_rate": 0.000495938660329466,
|
|
"loss": 5.4609,
|
|
"mean_token_accuracy": 0.16577730029821397,
|
|
"num_tokens": 15142659.0,
|
|
"step": 8725
|
|
},
|
|
{
|
|
"entropy": 5.62673921585083,
|
|
"epoch": 0.6792452830188679,
|
|
"grad_norm": 1.625,
|
|
"learning_rate": 0.0004959334164507973,
|
|
"loss": 5.6093,
|
|
"mean_token_accuracy": 0.15286325365304948,
|
|
"num_tokens": 15151423.0,
|
|
"step": 8730
|
|
},
|
|
{
|
|
"entropy": 5.624324989318848,
|
|
"epoch": 0.6796343123905855,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.0004959281692198155,
|
|
"loss": 5.4109,
|
|
"mean_token_accuracy": 0.16259230971336364,
|
|
"num_tokens": 15159986.0,
|
|
"step": 8735
|
|
},
|
|
{
|
|
"entropy": 5.607788467407227,
|
|
"epoch": 0.6800233417623031,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.0004959229186366007,
|
|
"loss": 5.4614,
|
|
"mean_token_accuracy": 0.16272899210453035,
|
|
"num_tokens": 15168183.0,
|
|
"step": 8740
|
|
},
|
|
{
|
|
"entropy": 5.509155893325806,
|
|
"epoch": 0.6804123711340206,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.000495917664701232,
|
|
"loss": 5.3957,
|
|
"mean_token_accuracy": 0.1645374119281769,
|
|
"num_tokens": 15176476.0,
|
|
"step": 8745
|
|
},
|
|
{
|
|
"entropy": 5.751757669448852,
|
|
"epoch": 0.6808014005057382,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.0004959124074137894,
|
|
"loss": 5.6686,
|
|
"mean_token_accuracy": 0.15058834254741668,
|
|
"num_tokens": 15186873.0,
|
|
"step": 8750
|
|
},
|
|
{
|
|
"entropy": 5.654232454299927,
|
|
"epoch": 0.6811904298774557,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.0004959071467743526,
|
|
"loss": 5.4605,
|
|
"mean_token_accuracy": 0.1574256755411625,
|
|
"num_tokens": 15194965.0,
|
|
"step": 8755
|
|
},
|
|
{
|
|
"entropy": 5.511550617218018,
|
|
"epoch": 0.6815794592491733,
|
|
"grad_norm": 1.515625,
|
|
"learning_rate": 0.0004959018827830016,
|
|
"loss": 5.3325,
|
|
"mean_token_accuracy": 0.16597196459770203,
|
|
"num_tokens": 15204028.0,
|
|
"step": 8760
|
|
},
|
|
{
|
|
"entropy": 5.483450841903687,
|
|
"epoch": 0.6819684886208909,
|
|
"grad_norm": 1.5859375,
|
|
"learning_rate": 0.000495896615439816,
|
|
"loss": 5.3448,
|
|
"mean_token_accuracy": 0.17626579105854034,
|
|
"num_tokens": 15212011.0,
|
|
"step": 8765
|
|
},
|
|
{
|
|
"entropy": 5.540477132797241,
|
|
"epoch": 0.6823575179926085,
|
|
"grad_norm": 1.703125,
|
|
"learning_rate": 0.0004958913447448759,
|
|
"loss": 5.4426,
|
|
"mean_token_accuracy": 0.1627766102552414,
|
|
"num_tokens": 15220088.0,
|
|
"step": 8770
|
|
},
|
|
{
|
|
"entropy": 5.6379650115966795,
|
|
"epoch": 0.682746547364326,
|
|
"grad_norm": 1.5390625,
|
|
"learning_rate": 0.0004958860706982613,
|
|
"loss": 5.3944,
|
|
"mean_token_accuracy": 0.16646525710821153,
|
|
"num_tokens": 15228676.0,
|
|
"step": 8775
|
|
},
|
|
{
|
|
"entropy": 5.5093952178955075,
|
|
"epoch": 0.6831355767360435,
|
|
"grad_norm": 1.5390625,
|
|
"learning_rate": 0.000495880793300052,
|
|
"loss": 5.4235,
|
|
"mean_token_accuracy": 0.168090882897377,
|
|
"num_tokens": 15237392.0,
|
|
"step": 8780
|
|
},
|
|
{
|
|
"entropy": 5.555091094970703,
|
|
"epoch": 0.6835246061077611,
|
|
"grad_norm": 1.6875,
|
|
"learning_rate": 0.0004958755125503284,
|
|
"loss": 5.563,
|
|
"mean_token_accuracy": 0.1629531815648079,
|
|
"num_tokens": 15246738.0,
|
|
"step": 8785
|
|
},
|
|
{
|
|
"entropy": 5.70695013999939,
|
|
"epoch": 0.6839136354794787,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.0004958702284491703,
|
|
"loss": 5.5492,
|
|
"mean_token_accuracy": 0.1600048288702965,
|
|
"num_tokens": 15255154.0,
|
|
"step": 8790
|
|
},
|
|
{
|
|
"entropy": 5.617724895477295,
|
|
"epoch": 0.6843026648511963,
|
|
"grad_norm": 1.53125,
|
|
"learning_rate": 0.0004958649409966581,
|
|
"loss": 5.4238,
|
|
"mean_token_accuracy": 0.1639481157064438,
|
|
"num_tokens": 15264178.0,
|
|
"step": 8795
|
|
},
|
|
{
|
|
"entropy": 5.6335736274719235,
|
|
"epoch": 0.6846916942229139,
|
|
"grad_norm": 1.625,
|
|
"learning_rate": 0.000495859650192872,
|
|
"loss": 5.5289,
|
|
"mean_token_accuracy": 0.1640607163310051,
|
|
"num_tokens": 15272591.0,
|
|
"step": 8800
|
|
},
|
|
{
|
|
"entropy": 5.627588701248169,
|
|
"epoch": 0.6850807235946313,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.0004958543560378922,
|
|
"loss": 5.4459,
|
|
"mean_token_accuracy": 0.16031597703695297,
|
|
"num_tokens": 15281280.0,
|
|
"step": 8805
|
|
},
|
|
{
|
|
"entropy": 5.577515888214111,
|
|
"epoch": 0.6854697529663489,
|
|
"grad_norm": 1.5703125,
|
|
"learning_rate": 0.0004958490585317991,
|
|
"loss": 5.3933,
|
|
"mean_token_accuracy": 0.169253808259964,
|
|
"num_tokens": 15290639.0,
|
|
"step": 8810
|
|
},
|
|
{
|
|
"entropy": 5.539572143554688,
|
|
"epoch": 0.6858587823380665,
|
|
"grad_norm": 1.546875,
|
|
"learning_rate": 0.000495843757674673,
|
|
"loss": 5.3904,
|
|
"mean_token_accuracy": 0.15841607749462128,
|
|
"num_tokens": 15298877.0,
|
|
"step": 8815
|
|
},
|
|
{
|
|
"entropy": 5.627851152420044,
|
|
"epoch": 0.6862478117097841,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.0004958384534665945,
|
|
"loss": 5.5185,
|
|
"mean_token_accuracy": 0.15833221822977067,
|
|
"num_tokens": 15307710.0,
|
|
"step": 8820
|
|
},
|
|
{
|
|
"entropy": 5.643237590789795,
|
|
"epoch": 0.6866368410815017,
|
|
"grad_norm": 1.5859375,
|
|
"learning_rate": 0.0004958331459076438,
|
|
"loss": 5.5354,
|
|
"mean_token_accuracy": 0.16657649874687194,
|
|
"num_tokens": 15315749.0,
|
|
"step": 8825
|
|
},
|
|
{
|
|
"entropy": 5.666751956939697,
|
|
"epoch": 0.6870258704532192,
|
|
"grad_norm": 1.5625,
|
|
"learning_rate": 0.0004958278349979018,
|
|
"loss": 5.4937,
|
|
"mean_token_accuracy": 0.15831152200698853,
|
|
"num_tokens": 15324161.0,
|
|
"step": 8830
|
|
},
|
|
{
|
|
"entropy": 5.525657415390015,
|
|
"epoch": 0.6874148998249368,
|
|
"grad_norm": 1.65625,
|
|
"learning_rate": 0.0004958225207374488,
|
|
"loss": 5.3865,
|
|
"mean_token_accuracy": 0.16515809148550034,
|
|
"num_tokens": 15333414.0,
|
|
"step": 8835
|
|
},
|
|
{
|
|
"entropy": 5.619464302062989,
|
|
"epoch": 0.6878039291966543,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.0004958172031263655,
|
|
"loss": 5.4721,
|
|
"mean_token_accuracy": 0.1637744888663292,
|
|
"num_tokens": 15342369.0,
|
|
"step": 8840
|
|
},
|
|
{
|
|
"entropy": 5.668105411529541,
|
|
"epoch": 0.6881929585683719,
|
|
"grad_norm": 1.5234375,
|
|
"learning_rate": 0.0004958118821647326,
|
|
"loss": 5.5448,
|
|
"mean_token_accuracy": 0.154964642226696,
|
|
"num_tokens": 15351109.0,
|
|
"step": 8845
|
|
},
|
|
{
|
|
"entropy": 5.5900016784667965,
|
|
"epoch": 0.6885819879400895,
|
|
"grad_norm": 1.609375,
|
|
"learning_rate": 0.0004958065578526308,
|
|
"loss": 5.4351,
|
|
"mean_token_accuracy": 0.16864016205072402,
|
|
"num_tokens": 15359837.0,
|
|
"step": 8850
|
|
},
|
|
{
|
|
"entropy": 5.547193765640259,
|
|
"epoch": 0.688971017311807,
|
|
"grad_norm": 1.9921875,
|
|
"learning_rate": 0.000495801230190141,
|
|
"loss": 5.4663,
|
|
"mean_token_accuracy": 0.1670744426548481,
|
|
"num_tokens": 15368776.0,
|
|
"step": 8855
|
|
},
|
|
{
|
|
"entropy": 5.571122741699218,
|
|
"epoch": 0.6893600466835246,
|
|
"grad_norm": 1.5703125,
|
|
"learning_rate": 0.0004957958991773441,
|
|
"loss": 5.4472,
|
|
"mean_token_accuracy": 0.16593606919050216,
|
|
"num_tokens": 15378127.0,
|
|
"step": 8860
|
|
},
|
|
{
|
|
"entropy": 5.618199396133423,
|
|
"epoch": 0.6897490760552422,
|
|
"grad_norm": 1.53125,
|
|
"learning_rate": 0.0004957905648143206,
|
|
"loss": 5.4145,
|
|
"mean_token_accuracy": 0.1654287099838257,
|
|
"num_tokens": 15386580.0,
|
|
"step": 8865
|
|
},
|
|
{
|
|
"entropy": 5.626070880889893,
|
|
"epoch": 0.6901381054269597,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 0.0004957852271011519,
|
|
"loss": 5.5675,
|
|
"mean_token_accuracy": 0.1599985420703888,
|
|
"num_tokens": 15395973.0,
|
|
"step": 8870
|
|
},
|
|
{
|
|
"entropy": 5.6116798400878904,
|
|
"epoch": 0.6905271347986773,
|
|
"grad_norm": 1.5,
|
|
"learning_rate": 0.0004957798860379187,
|
|
"loss": 5.4506,
|
|
"mean_token_accuracy": 0.1576478213071823,
|
|
"num_tokens": 15404738.0,
|
|
"step": 8875
|
|
},
|
|
{
|
|
"entropy": 5.624153327941895,
|
|
"epoch": 0.6909161641703949,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.0004957745416247022,
|
|
"loss": 5.5947,
|
|
"mean_token_accuracy": 0.1643390730023384,
|
|
"num_tokens": 15413530.0,
|
|
"step": 8880
|
|
},
|
|
{
|
|
"entropy": 5.61382155418396,
|
|
"epoch": 0.6913051935421124,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.0004957691938615833,
|
|
"loss": 5.5804,
|
|
"mean_token_accuracy": 0.15752760097384452,
|
|
"num_tokens": 15423268.0,
|
|
"step": 8885
|
|
},
|
|
{
|
|
"entropy": 5.573393630981445,
|
|
"epoch": 0.69169422291383,
|
|
"grad_norm": 1.53125,
|
|
"learning_rate": 0.0004957638427486434,
|
|
"loss": 5.3878,
|
|
"mean_token_accuracy": 0.1690160557627678,
|
|
"num_tokens": 15431690.0,
|
|
"step": 8890
|
|
},
|
|
{
|
|
"entropy": 5.602618646621704,
|
|
"epoch": 0.6920832522855476,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.0004957584882859636,
|
|
"loss": 5.5484,
|
|
"mean_token_accuracy": 0.15811869204044343,
|
|
"num_tokens": 15440110.0,
|
|
"step": 8895
|
|
},
|
|
{
|
|
"entropy": 5.714527559280396,
|
|
"epoch": 0.6924722816572652,
|
|
"grad_norm": 1.6875,
|
|
"learning_rate": 0.0004957531304736251,
|
|
"loss": 5.5609,
|
|
"mean_token_accuracy": 0.15900706499814987,
|
|
"num_tokens": 15449022.0,
|
|
"step": 8900
|
|
},
|
|
{
|
|
"entropy": 5.74059796333313,
|
|
"epoch": 0.6928613110289827,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.0004957477693117091,
|
|
"loss": 5.6081,
|
|
"mean_token_accuracy": 0.1521860897541046,
|
|
"num_tokens": 15457826.0,
|
|
"step": 8905
|
|
},
|
|
{
|
|
"entropy": 5.633170747756958,
|
|
"epoch": 0.6932503404007002,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 0.0004957424048002971,
|
|
"loss": 5.4866,
|
|
"mean_token_accuracy": 0.16168588250875474,
|
|
"num_tokens": 15466631.0,
|
|
"step": 8910
|
|
},
|
|
{
|
|
"entropy": 5.528276968002319,
|
|
"epoch": 0.6936393697724178,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0004957370369394706,
|
|
"loss": 5.3796,
|
|
"mean_token_accuracy": 0.16295055896043778,
|
|
"num_tokens": 15474666.0,
|
|
"step": 8915
|
|
},
|
|
{
|
|
"entropy": 5.515926742553711,
|
|
"epoch": 0.6940283991441354,
|
|
"grad_norm": 1.625,
|
|
"learning_rate": 0.0004957316657293107,
|
|
"loss": 5.3883,
|
|
"mean_token_accuracy": 0.16150261461734772,
|
|
"num_tokens": 15483576.0,
|
|
"step": 8920
|
|
},
|
|
{
|
|
"entropy": 5.744505786895752,
|
|
"epoch": 0.694417428515853,
|
|
"grad_norm": 1.5390625,
|
|
"learning_rate": 0.0004957262911698992,
|
|
"loss": 5.5505,
|
|
"mean_token_accuracy": 0.15730631202459336,
|
|
"num_tokens": 15491313.0,
|
|
"step": 8925
|
|
},
|
|
{
|
|
"entropy": 5.61945481300354,
|
|
"epoch": 0.6948064578875706,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.0004957209132613175,
|
|
"loss": 5.5039,
|
|
"mean_token_accuracy": 0.16225907653570176,
|
|
"num_tokens": 15500638.0,
|
|
"step": 8930
|
|
},
|
|
{
|
|
"entropy": 5.5722874164581295,
|
|
"epoch": 0.695195487259288,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.0004957155320036473,
|
|
"loss": 5.4996,
|
|
"mean_token_accuracy": 0.16195370107889176,
|
|
"num_tokens": 15509170.0,
|
|
"step": 8935
|
|
},
|
|
{
|
|
"entropy": 5.737703943252564,
|
|
"epoch": 0.6955845166310056,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.0004957101473969702,
|
|
"loss": 5.5868,
|
|
"mean_token_accuracy": 0.1541694298386574,
|
|
"num_tokens": 15518108.0,
|
|
"step": 8940
|
|
},
|
|
{
|
|
"entropy": 5.608725214004517,
|
|
"epoch": 0.6959735460027232,
|
|
"grad_norm": 1.5,
|
|
"learning_rate": 0.000495704759441368,
|
|
"loss": 5.4399,
|
|
"mean_token_accuracy": 0.16826948374509812,
|
|
"num_tokens": 15526558.0,
|
|
"step": 8945
|
|
},
|
|
{
|
|
"entropy": 5.567080926895142,
|
|
"epoch": 0.6963625753744408,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 0.0004956993681369221,
|
|
"loss": 5.4086,
|
|
"mean_token_accuracy": 0.16608458757400513,
|
|
"num_tokens": 15535685.0,
|
|
"step": 8950
|
|
},
|
|
{
|
|
"entropy": 5.598057079315185,
|
|
"epoch": 0.6967516047461584,
|
|
"grad_norm": 1.5390625,
|
|
"learning_rate": 0.0004956939734837148,
|
|
"loss": 5.4573,
|
|
"mean_token_accuracy": 0.16753346621990203,
|
|
"num_tokens": 15544072.0,
|
|
"step": 8955
|
|
},
|
|
{
|
|
"entropy": 5.616986417770386,
|
|
"epoch": 0.6971406341178759,
|
|
"grad_norm": 1.546875,
|
|
"learning_rate": 0.0004956885754818277,
|
|
"loss": 5.5587,
|
|
"mean_token_accuracy": 0.1520525261759758,
|
|
"num_tokens": 15553303.0,
|
|
"step": 8960
|
|
},
|
|
{
|
|
"entropy": 5.633440065383911,
|
|
"epoch": 0.6975296634895934,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.0004956831741313427,
|
|
"loss": 5.4995,
|
|
"mean_token_accuracy": 0.15973107665777206,
|
|
"num_tokens": 15561942.0,
|
|
"step": 8965
|
|
},
|
|
{
|
|
"entropy": 5.623577308654785,
|
|
"epoch": 0.697918692861311,
|
|
"grad_norm": 1.5,
|
|
"learning_rate": 0.0004956777694323418,
|
|
"loss": 5.3534,
|
|
"mean_token_accuracy": 0.172841776907444,
|
|
"num_tokens": 15569988.0,
|
|
"step": 8970
|
|
},
|
|
{
|
|
"entropy": 5.570699214935303,
|
|
"epoch": 0.6983077222330286,
|
|
"grad_norm": 1.703125,
|
|
"learning_rate": 0.000495672361384907,
|
|
"loss": 5.5355,
|
|
"mean_token_accuracy": 0.16330803483724593,
|
|
"num_tokens": 15579816.0,
|
|
"step": 8975
|
|
},
|
|
{
|
|
"entropy": 5.595700073242187,
|
|
"epoch": 0.6986967516047462,
|
|
"grad_norm": 2.03125,
|
|
"learning_rate": 0.0004956669499891202,
|
|
"loss": 5.4168,
|
|
"mean_token_accuracy": 0.1699569582939148,
|
|
"num_tokens": 15587843.0,
|
|
"step": 8980
|
|
},
|
|
{
|
|
"entropy": 5.651184034347534,
|
|
"epoch": 0.6990857809764637,
|
|
"grad_norm": 1.5859375,
|
|
"learning_rate": 0.0004956615352450639,
|
|
"loss": 5.4735,
|
|
"mean_token_accuracy": 0.16514448672533036,
|
|
"num_tokens": 15596798.0,
|
|
"step": 8985
|
|
},
|
|
{
|
|
"entropy": 5.618335151672364,
|
|
"epoch": 0.6994748103481813,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 0.0004956561171528198,
|
|
"loss": 5.5535,
|
|
"mean_token_accuracy": 0.16553656309843062,
|
|
"num_tokens": 15605360.0,
|
|
"step": 8990
|
|
},
|
|
{
|
|
"entropy": 5.550785064697266,
|
|
"epoch": 0.6998638397198989,
|
|
"grad_norm": 1.546875,
|
|
"learning_rate": 0.0004956506957124704,
|
|
"loss": 5.4225,
|
|
"mean_token_accuracy": 0.170002281665802,
|
|
"num_tokens": 15613557.0,
|
|
"step": 8995
|
|
},
|
|
{
|
|
"entropy": 5.597484922409057,
|
|
"epoch": 0.7002528690916164,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.000495645270924098,
|
|
"loss": 5.4867,
|
|
"mean_token_accuracy": 0.16351661831140518,
|
|
"num_tokens": 15622144.0,
|
|
"step": 9000
|
|
},
|
|
{
|
|
"epoch": 0.7002528690916164,
|
|
"eval_entropy": 5.496048769615841,
|
|
"eval_loss": 5.52293062210083,
|
|
"eval_mean_token_accuracy": 0.16872901462226447,
|
|
"eval_num_tokens": 15622144.0,
|
|
"eval_runtime": 28.4802,
|
|
"eval_samples_per_second": 1459.192,
|
|
"eval_steps_per_second": 182.408,
|
|
"step": 9000
|
|
},
|
|
{
|
|
"entropy": 5.584130096435547,
|
|
"epoch": 0.700641898463334,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.0004956398427877847,
|
|
"loss": 5.4332,
|
|
"mean_token_accuracy": 0.16233085095882416,
|
|
"num_tokens": 15631119.0,
|
|
"step": 9005
|
|
},
|
|
{
|
|
"entropy": 5.512149953842163,
|
|
"epoch": 0.7010309278350515,
|
|
"grad_norm": 1.6015625,
|
|
"learning_rate": 0.000495634411303613,
|
|
"loss": 5.3482,
|
|
"mean_token_accuracy": 0.17366744726896285,
|
|
"num_tokens": 15639969.0,
|
|
"step": 9010
|
|
},
|
|
{
|
|
"entropy": 5.547135066986084,
|
|
"epoch": 0.7014199572067691,
|
|
"grad_norm": 1.515625,
|
|
"learning_rate": 0.0004956289764716654,
|
|
"loss": 5.4802,
|
|
"mean_token_accuracy": 0.16370593160390853,
|
|
"num_tokens": 15648522.0,
|
|
"step": 9015
|
|
},
|
|
{
|
|
"entropy": 5.535307693481445,
|
|
"epoch": 0.7018089865784867,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.0004956235382920241,
|
|
"loss": 5.4256,
|
|
"mean_token_accuracy": 0.1641954869031906,
|
|
"num_tokens": 15656834.0,
|
|
"step": 9020
|
|
},
|
|
{
|
|
"entropy": 5.663244962692261,
|
|
"epoch": 0.7021980159502043,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 0.0004956180967647717,
|
|
"loss": 5.5942,
|
|
"mean_token_accuracy": 0.15337878167629243,
|
|
"num_tokens": 15665066.0,
|
|
"step": 9025
|
|
},
|
|
{
|
|
"entropy": 5.668092441558838,
|
|
"epoch": 0.7025870453219218,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.0004956126518899911,
|
|
"loss": 5.4986,
|
|
"mean_token_accuracy": 0.15815163403749466,
|
|
"num_tokens": 15673733.0,
|
|
"step": 9030
|
|
},
|
|
{
|
|
"entropy": 5.699274063110352,
|
|
"epoch": 0.7029760746936393,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.0004956072036677644,
|
|
"loss": 5.522,
|
|
"mean_token_accuracy": 0.1604725942015648,
|
|
"num_tokens": 15682212.0,
|
|
"step": 9035
|
|
},
|
|
{
|
|
"entropy": 5.586855792999268,
|
|
"epoch": 0.7033651040653569,
|
|
"grad_norm": 1.546875,
|
|
"learning_rate": 0.0004956017520981746,
|
|
"loss": 5.5274,
|
|
"mean_token_accuracy": 0.15395476371049882,
|
|
"num_tokens": 15690518.0,
|
|
"step": 9040
|
|
},
|
|
{
|
|
"entropy": 5.6907836437225345,
|
|
"epoch": 0.7037541334370745,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.0004955962971813044,
|
|
"loss": 5.5798,
|
|
"mean_token_accuracy": 0.15354745984077453,
|
|
"num_tokens": 15699474.0,
|
|
"step": 9045
|
|
},
|
|
{
|
|
"entropy": 5.7091151714324955,
|
|
"epoch": 0.7041431628087921,
|
|
"grad_norm": 1.515625,
|
|
"learning_rate": 0.0004955908389172364,
|
|
"loss": 5.5728,
|
|
"mean_token_accuracy": 0.1551925852894783,
|
|
"num_tokens": 15708571.0,
|
|
"step": 9050
|
|
},
|
|
{
|
|
"entropy": 5.701828336715698,
|
|
"epoch": 0.7045321921805097,
|
|
"grad_norm": 1.5234375,
|
|
"learning_rate": 0.0004955853773060536,
|
|
"loss": 5.5461,
|
|
"mean_token_accuracy": 0.16137275099754333,
|
|
"num_tokens": 15717307.0,
|
|
"step": 9055
|
|
},
|
|
{
|
|
"entropy": 5.5792402744293215,
|
|
"epoch": 0.7049212215522271,
|
|
"grad_norm": 2.1875,
|
|
"learning_rate": 0.0004955799123478388,
|
|
"loss": 5.3449,
|
|
"mean_token_accuracy": 0.16866725385189058,
|
|
"num_tokens": 15725502.0,
|
|
"step": 9060
|
|
},
|
|
{
|
|
"entropy": 5.550484132766724,
|
|
"epoch": 0.7053102509239447,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.0004955744440426748,
|
|
"loss": 5.5417,
|
|
"mean_token_accuracy": 0.15647795647382737,
|
|
"num_tokens": 15734805.0,
|
|
"step": 9065
|
|
},
|
|
{
|
|
"entropy": 5.589828538894653,
|
|
"epoch": 0.7056992802956623,
|
|
"grad_norm": 1.8828125,
|
|
"learning_rate": 0.0004955689723906448,
|
|
"loss": 5.3993,
|
|
"mean_token_accuracy": 0.16252316832542418,
|
|
"num_tokens": 15743313.0,
|
|
"step": 9070
|
|
},
|
|
{
|
|
"entropy": 5.535020256042481,
|
|
"epoch": 0.7060883096673799,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0004955634973918318,
|
|
"loss": 5.3524,
|
|
"mean_token_accuracy": 0.16813426911830903,
|
|
"num_tokens": 15752552.0,
|
|
"step": 9075
|
|
},
|
|
{
|
|
"entropy": 5.607556486129761,
|
|
"epoch": 0.7064773390390975,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 0.0004955580190463186,
|
|
"loss": 5.4694,
|
|
"mean_token_accuracy": 0.17079655826091766,
|
|
"num_tokens": 15761404.0,
|
|
"step": 9080
|
|
},
|
|
{
|
|
"entropy": 5.621607828140259,
|
|
"epoch": 0.7068663684108151,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.0004955525373541886,
|
|
"loss": 5.5342,
|
|
"mean_token_accuracy": 0.16124300956726073,
|
|
"num_tokens": 15770605.0,
|
|
"step": 9085
|
|
},
|
|
{
|
|
"entropy": 5.559562492370605,
|
|
"epoch": 0.7072553977825325,
|
|
"grad_norm": 1.5625,
|
|
"learning_rate": 0.0004955470523155249,
|
|
"loss": 5.4102,
|
|
"mean_token_accuracy": 0.1709872752428055,
|
|
"num_tokens": 15778047.0,
|
|
"step": 9090
|
|
},
|
|
{
|
|
"entropy": 5.588971424102783,
|
|
"epoch": 0.7076444271542501,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0004955415639304107,
|
|
"loss": 5.4812,
|
|
"mean_token_accuracy": 0.1654489055275917,
|
|
"num_tokens": 15788304.0,
|
|
"step": 9095
|
|
},
|
|
{
|
|
"entropy": 5.640074825286865,
|
|
"epoch": 0.7080334565259677,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.0004955360721989292,
|
|
"loss": 5.4769,
|
|
"mean_token_accuracy": 0.161972077190876,
|
|
"num_tokens": 15796448.0,
|
|
"step": 9100
|
|
},
|
|
{
|
|
"entropy": 5.506970643997192,
|
|
"epoch": 0.7084224858976853,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0004955305771211641,
|
|
"loss": 5.4435,
|
|
"mean_token_accuracy": 0.16246534883975983,
|
|
"num_tokens": 15805072.0,
|
|
"step": 9105
|
|
},
|
|
{
|
|
"entropy": 5.53871636390686,
|
|
"epoch": 0.7088115152694029,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.0004955250786971982,
|
|
"loss": 5.4976,
|
|
"mean_token_accuracy": 0.16125560104846953,
|
|
"num_tokens": 15813918.0,
|
|
"step": 9110
|
|
},
|
|
{
|
|
"entropy": 5.749186897277832,
|
|
"epoch": 0.7092005446411204,
|
|
"grad_norm": 1.5234375,
|
|
"learning_rate": 0.0004955195769271154,
|
|
"loss": 5.629,
|
|
"mean_token_accuracy": 0.159039643406868,
|
|
"num_tokens": 15822675.0,
|
|
"step": 9115
|
|
},
|
|
{
|
|
"entropy": 5.613381195068359,
|
|
"epoch": 0.709589574012838,
|
|
"grad_norm": 1.921875,
|
|
"learning_rate": 0.0004955140718109991,
|
|
"loss": 5.4933,
|
|
"mean_token_accuracy": 0.15853687524795532,
|
|
"num_tokens": 15831056.0,
|
|
"step": 9120
|
|
},
|
|
{
|
|
"entropy": 5.629505681991577,
|
|
"epoch": 0.7099786033845555,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0004955085633489326,
|
|
"loss": 5.5691,
|
|
"mean_token_accuracy": 0.15488039702177048,
|
|
"num_tokens": 15839948.0,
|
|
"step": 9125
|
|
},
|
|
{
|
|
"entropy": 5.656857299804687,
|
|
"epoch": 0.7103676327562731,
|
|
"grad_norm": 1.5546875,
|
|
"learning_rate": 0.0004955030515409997,
|
|
"loss": 5.4599,
|
|
"mean_token_accuracy": 0.16460514813661575,
|
|
"num_tokens": 15848738.0,
|
|
"step": 9130
|
|
},
|
|
{
|
|
"entropy": 5.6479651927948,
|
|
"epoch": 0.7107566621279907,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0004954975363872838,
|
|
"loss": 5.5355,
|
|
"mean_token_accuracy": 0.1553099572658539,
|
|
"num_tokens": 15859073.0,
|
|
"step": 9135
|
|
},
|
|
{
|
|
"entropy": 5.577330875396728,
|
|
"epoch": 0.7111456914997082,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 0.0004954920178878689,
|
|
"loss": 5.4359,
|
|
"mean_token_accuracy": 0.1606438487768173,
|
|
"num_tokens": 15868146.0,
|
|
"step": 9140
|
|
},
|
|
{
|
|
"entropy": 5.513467645645141,
|
|
"epoch": 0.7115347208714258,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.0004954864960428385,
|
|
"loss": 5.3771,
|
|
"mean_token_accuracy": 0.1637046977877617,
|
|
"num_tokens": 15876915.0,
|
|
"step": 9145
|
|
},
|
|
{
|
|
"entropy": 5.5574743270874025,
|
|
"epoch": 0.7119237502431434,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 0.0004954809708522765,
|
|
"loss": 5.4498,
|
|
"mean_token_accuracy": 0.16000136882066726,
|
|
"num_tokens": 15884947.0,
|
|
"step": 9150
|
|
},
|
|
{
|
|
"entropy": 5.585346937179565,
|
|
"epoch": 0.712312779614861,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0004954754423162667,
|
|
"loss": 5.4753,
|
|
"mean_token_accuracy": 0.1583109453320503,
|
|
"num_tokens": 15894595.0,
|
|
"step": 9155
|
|
},
|
|
{
|
|
"entropy": 5.617086410522461,
|
|
"epoch": 0.7127018089865785,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 0.000495469910434893,
|
|
"loss": 5.4684,
|
|
"mean_token_accuracy": 0.16696888506412505,
|
|
"num_tokens": 15902920.0,
|
|
"step": 9160
|
|
},
|
|
{
|
|
"entropy": 5.567520332336426,
|
|
"epoch": 0.713090838358296,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.0004954643752082392,
|
|
"loss": 5.452,
|
|
"mean_token_accuracy": 0.1669886142015457,
|
|
"num_tokens": 15911414.0,
|
|
"step": 9165
|
|
},
|
|
{
|
|
"entropy": 5.6806916236877445,
|
|
"epoch": 0.7134798677300136,
|
|
"grad_norm": 1.6875,
|
|
"learning_rate": 0.0004954588366363896,
|
|
"loss": 5.5378,
|
|
"mean_token_accuracy": 0.15698813572525977,
|
|
"num_tokens": 15919855.0,
|
|
"step": 9170
|
|
},
|
|
{
|
|
"entropy": 5.565380716323853,
|
|
"epoch": 0.7138688971017312,
|
|
"grad_norm": 1.4921875,
|
|
"learning_rate": 0.0004954532947194279,
|
|
"loss": 5.4646,
|
|
"mean_token_accuracy": 0.1613001361489296,
|
|
"num_tokens": 15928932.0,
|
|
"step": 9175
|
|
},
|
|
{
|
|
"entropy": 5.591390323638916,
|
|
"epoch": 0.7142579264734488,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 0.0004954477494574384,
|
|
"loss": 5.5053,
|
|
"mean_token_accuracy": 0.1586716115474701,
|
|
"num_tokens": 15938266.0,
|
|
"step": 9180
|
|
},
|
|
{
|
|
"entropy": 5.720804500579834,
|
|
"epoch": 0.7146469558451664,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.0004954422008505052,
|
|
"loss": 5.5379,
|
|
"mean_token_accuracy": 0.1626137003302574,
|
|
"num_tokens": 15947100.0,
|
|
"step": 9185
|
|
},
|
|
{
|
|
"entropy": 5.575640153884888,
|
|
"epoch": 0.7150359852168838,
|
|
"grad_norm": 1.6328125,
|
|
"learning_rate": 0.0004954366488987125,
|
|
"loss": 5.5316,
|
|
"mean_token_accuracy": 0.1536930650472641,
|
|
"num_tokens": 15955544.0,
|
|
"step": 9190
|
|
},
|
|
{
|
|
"entropy": 5.6070897579193115,
|
|
"epoch": 0.7154250145886014,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.0004954310936021444,
|
|
"loss": 5.5575,
|
|
"mean_token_accuracy": 0.16221348494291304,
|
|
"num_tokens": 15963372.0,
|
|
"step": 9195
|
|
},
|
|
{
|
|
"entropy": 5.674570846557617,
|
|
"epoch": 0.715814043960319,
|
|
"grad_norm": 1.71875,
|
|
"learning_rate": 0.0004954255349608853,
|
|
"loss": 5.522,
|
|
"mean_token_accuracy": 0.15607647448778153,
|
|
"num_tokens": 15972940.0,
|
|
"step": 9200
|
|
},
|
|
{
|
|
"entropy": 5.618421745300293,
|
|
"epoch": 0.7162030733320366,
|
|
"grad_norm": 1.515625,
|
|
"learning_rate": 0.0004954199729750198,
|
|
"loss": 5.4962,
|
|
"mean_token_accuracy": 0.15723588317632675,
|
|
"num_tokens": 15982238.0,
|
|
"step": 9205
|
|
},
|
|
{
|
|
"entropy": 5.628593873977661,
|
|
"epoch": 0.7165921027037542,
|
|
"grad_norm": 1.5859375,
|
|
"learning_rate": 0.0004954144076446318,
|
|
"loss": 5.4974,
|
|
"mean_token_accuracy": 0.16220944076776506,
|
|
"num_tokens": 15990835.0,
|
|
"step": 9210
|
|
},
|
|
{
|
|
"entropy": 5.703175258636475,
|
|
"epoch": 0.7169811320754716,
|
|
"grad_norm": 1.640625,
|
|
"learning_rate": 0.0004954088389698061,
|
|
"loss": 5.6135,
|
|
"mean_token_accuracy": 0.15768413245677948,
|
|
"num_tokens": 16000649.0,
|
|
"step": 9215
|
|
},
|
|
{
|
|
"entropy": 5.601278972625733,
|
|
"epoch": 0.7173701614471892,
|
|
"grad_norm": 1.5,
|
|
"learning_rate": 0.000495403266950627,
|
|
"loss": 5.514,
|
|
"mean_token_accuracy": 0.15895985662937165,
|
|
"num_tokens": 16009214.0,
|
|
"step": 9220
|
|
},
|
|
{
|
|
"entropy": 5.667197322845459,
|
|
"epoch": 0.7177591908189068,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0004953976915871792,
|
|
"loss": 5.4894,
|
|
"mean_token_accuracy": 0.165646892786026,
|
|
"num_tokens": 16018173.0,
|
|
"step": 9225
|
|
},
|
|
{
|
|
"entropy": 5.548560762405396,
|
|
"epoch": 0.7181482201906244,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.0004953921128795472,
|
|
"loss": 5.3853,
|
|
"mean_token_accuracy": 0.1733367085456848,
|
|
"num_tokens": 16026857.0,
|
|
"step": 9230
|
|
},
|
|
{
|
|
"entropy": 5.561794137954712,
|
|
"epoch": 0.718537249562342,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.0004953865308278156,
|
|
"loss": 5.547,
|
|
"mean_token_accuracy": 0.15863846987485886,
|
|
"num_tokens": 16035792.0,
|
|
"step": 9235
|
|
},
|
|
{
|
|
"entropy": 5.630701732635498,
|
|
"epoch": 0.7189262789340595,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.0004953809454320693,
|
|
"loss": 5.4865,
|
|
"mean_token_accuracy": 0.1660788431763649,
|
|
"num_tokens": 16044874.0,
|
|
"step": 9240
|
|
},
|
|
{
|
|
"entropy": 5.62094521522522,
|
|
"epoch": 0.7193153083057771,
|
|
"grad_norm": 1.6015625,
|
|
"learning_rate": 0.0004953753566923929,
|
|
"loss": 5.4602,
|
|
"mean_token_accuracy": 0.15726660937070847,
|
|
"num_tokens": 16053705.0,
|
|
"step": 9245
|
|
},
|
|
{
|
|
"entropy": 5.601760959625244,
|
|
"epoch": 0.7197043376774946,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0004953697646088712,
|
|
"loss": 5.4788,
|
|
"mean_token_accuracy": 0.15892313420772552,
|
|
"num_tokens": 16062987.0,
|
|
"step": 9250
|
|
},
|
|
{
|
|
"entropy": 5.550564193725586,
|
|
"epoch": 0.7200933670492122,
|
|
"grad_norm": 2.21875,
|
|
"learning_rate": 0.0004953641691815891,
|
|
"loss": 5.4353,
|
|
"mean_token_accuracy": 0.16546119451522828,
|
|
"num_tokens": 16071247.0,
|
|
"step": 9255
|
|
},
|
|
{
|
|
"entropy": 5.550580978393555,
|
|
"epoch": 0.7204823964209298,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.0004953585704106315,
|
|
"loss": 5.3668,
|
|
"mean_token_accuracy": 0.16232201904058458,
|
|
"num_tokens": 16080190.0,
|
|
"step": 9260
|
|
},
|
|
{
|
|
"entropy": 5.602763891220093,
|
|
"epoch": 0.7208714257926473,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.0004953529682960832,
|
|
"loss": 5.4764,
|
|
"mean_token_accuracy": 0.16436592787504195,
|
|
"num_tokens": 16088885.0,
|
|
"step": 9265
|
|
},
|
|
{
|
|
"entropy": 5.531141471862793,
|
|
"epoch": 0.7212604551643649,
|
|
"grad_norm": 1.53125,
|
|
"learning_rate": 0.0004953473628380295,
|
|
"loss": 5.4239,
|
|
"mean_token_accuracy": 0.16692962646484374,
|
|
"num_tokens": 16097202.0,
|
|
"step": 9270
|
|
},
|
|
{
|
|
"entropy": 5.5650519847869875,
|
|
"epoch": 0.7216494845360825,
|
|
"grad_norm": 1.5234375,
|
|
"learning_rate": 0.0004953417540365553,
|
|
"loss": 5.3855,
|
|
"mean_token_accuracy": 0.1626739203929901,
|
|
"num_tokens": 16105468.0,
|
|
"step": 9275
|
|
},
|
|
{
|
|
"entropy": 5.635207080841065,
|
|
"epoch": 0.7220385139078,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.0004953361418917455,
|
|
"loss": 5.5405,
|
|
"mean_token_accuracy": 0.15884630233049393,
|
|
"num_tokens": 16114624.0,
|
|
"step": 9280
|
|
},
|
|
{
|
|
"entropy": 5.527190065383911,
|
|
"epoch": 0.7224275432795176,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.0004953305264036856,
|
|
"loss": 5.3866,
|
|
"mean_token_accuracy": 0.16229167729616165,
|
|
"num_tokens": 16123983.0,
|
|
"step": 9285
|
|
},
|
|
{
|
|
"entropy": 5.616349601745606,
|
|
"epoch": 0.7228165726512352,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.0004953249075724607,
|
|
"loss": 5.4912,
|
|
"mean_token_accuracy": 0.1632054179906845,
|
|
"num_tokens": 16132886.0,
|
|
"step": 9290
|
|
},
|
|
{
|
|
"entropy": 5.597035694122314,
|
|
"epoch": 0.7232056020229527,
|
|
"grad_norm": 1.546875,
|
|
"learning_rate": 0.0004953192853981559,
|
|
"loss": 5.3493,
|
|
"mean_token_accuracy": 0.1766229122877121,
|
|
"num_tokens": 16141526.0,
|
|
"step": 9295
|
|
},
|
|
{
|
|
"entropy": 5.591595983505249,
|
|
"epoch": 0.7235946313946703,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.0004953136598808566,
|
|
"loss": 5.5492,
|
|
"mean_token_accuracy": 0.16761816889047623,
|
|
"num_tokens": 16149949.0,
|
|
"step": 9300
|
|
},
|
|
{
|
|
"entropy": 5.640862035751343,
|
|
"epoch": 0.7239836607663879,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.0004953080310206481,
|
|
"loss": 5.516,
|
|
"mean_token_accuracy": 0.1610817015171051,
|
|
"num_tokens": 16158131.0,
|
|
"step": 9305
|
|
},
|
|
{
|
|
"entropy": 5.514364194869995,
|
|
"epoch": 0.7243726901381055,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.0004953023988176162,
|
|
"loss": 5.4051,
|
|
"mean_token_accuracy": 0.1642155408859253,
|
|
"num_tokens": 16167131.0,
|
|
"step": 9310
|
|
},
|
|
{
|
|
"entropy": 5.659480857849121,
|
|
"epoch": 0.724761719509823,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 0.0004952967632718458,
|
|
"loss": 5.6225,
|
|
"mean_token_accuracy": 0.1589721217751503,
|
|
"num_tokens": 16176198.0,
|
|
"step": 9315
|
|
},
|
|
{
|
|
"entropy": 5.597436046600341,
|
|
"epoch": 0.7251507488815405,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 0.0004952911243834227,
|
|
"loss": 5.4814,
|
|
"mean_token_accuracy": 0.15860309153795243,
|
|
"num_tokens": 16184860.0,
|
|
"step": 9320
|
|
},
|
|
{
|
|
"entropy": 5.620567846298218,
|
|
"epoch": 0.7255397782532581,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.0004952854821524324,
|
|
"loss": 5.4749,
|
|
"mean_token_accuracy": 0.16052934527397156,
|
|
"num_tokens": 16193126.0,
|
|
"step": 9325
|
|
},
|
|
{
|
|
"entropy": 5.564336967468262,
|
|
"epoch": 0.7259288076249757,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.0004952798365789606,
|
|
"loss": 5.4642,
|
|
"mean_token_accuracy": 0.16046443581581116,
|
|
"num_tokens": 16201763.0,
|
|
"step": 9330
|
|
},
|
|
{
|
|
"entropy": 5.575883960723877,
|
|
"epoch": 0.7263178369966933,
|
|
"grad_norm": 1.5390625,
|
|
"learning_rate": 0.0004952741876630928,
|
|
"loss": 5.3998,
|
|
"mean_token_accuracy": 0.1679904654622078,
|
|
"num_tokens": 16210947.0,
|
|
"step": 9335
|
|
},
|
|
{
|
|
"entropy": 5.630392360687256,
|
|
"epoch": 0.7267068663684109,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.0004952685354049148,
|
|
"loss": 5.4796,
|
|
"mean_token_accuracy": 0.16024356633424758,
|
|
"num_tokens": 16219772.0,
|
|
"step": 9340
|
|
},
|
|
{
|
|
"entropy": 5.623006916046142,
|
|
"epoch": 0.7270958957401283,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.0004952628798045124,
|
|
"loss": 5.4778,
|
|
"mean_token_accuracy": 0.16884386390447617,
|
|
"num_tokens": 16227759.0,
|
|
"step": 9345
|
|
},
|
|
{
|
|
"entropy": 5.569640684127807,
|
|
"epoch": 0.7274849251118459,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0004952572208619714,
|
|
"loss": 5.353,
|
|
"mean_token_accuracy": 0.16934995651245116,
|
|
"num_tokens": 16236913.0,
|
|
"step": 9350
|
|
},
|
|
{
|
|
"entropy": 5.574661064147949,
|
|
"epoch": 0.7278739544835635,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 0.0004952515585773778,
|
|
"loss": 5.48,
|
|
"mean_token_accuracy": 0.16137221753597258,
|
|
"num_tokens": 16246190.0,
|
|
"step": 9355
|
|
},
|
|
{
|
|
"entropy": 5.5795831203460695,
|
|
"epoch": 0.7282629838552811,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0004952458929508171,
|
|
"loss": 5.4429,
|
|
"mean_token_accuracy": 0.16195769011974334,
|
|
"num_tokens": 16255476.0,
|
|
"step": 9360
|
|
},
|
|
{
|
|
"entropy": 5.619848728179932,
|
|
"epoch": 0.7286520132269987,
|
|
"grad_norm": 1.53125,
|
|
"learning_rate": 0.0004952402239823757,
|
|
"loss": 5.4997,
|
|
"mean_token_accuracy": 0.16256965696811676,
|
|
"num_tokens": 16264701.0,
|
|
"step": 9365
|
|
},
|
|
{
|
|
"entropy": 5.478322172164917,
|
|
"epoch": 0.7290410425987162,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0004952345516721393,
|
|
"loss": 5.312,
|
|
"mean_token_accuracy": 0.17474743723869324,
|
|
"num_tokens": 16272999.0,
|
|
"step": 9370
|
|
},
|
|
{
|
|
"entropy": 5.641229629516602,
|
|
"epoch": 0.7294300719704337,
|
|
"grad_norm": 1.53125,
|
|
"learning_rate": 0.0004952288760201942,
|
|
"loss": 5.5986,
|
|
"mean_token_accuracy": 0.16387001499533654,
|
|
"num_tokens": 16282537.0,
|
|
"step": 9375
|
|
},
|
|
{
|
|
"entropy": 5.638582706451416,
|
|
"epoch": 0.7298191013421513,
|
|
"grad_norm": 1.5546875,
|
|
"learning_rate": 0.0004952231970266265,
|
|
"loss": 5.4497,
|
|
"mean_token_accuracy": 0.17014080584049224,
|
|
"num_tokens": 16291155.0,
|
|
"step": 9380
|
|
},
|
|
{
|
|
"entropy": 5.666637420654297,
|
|
"epoch": 0.7302081307138689,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.0004952175146915223,
|
|
"loss": 5.5231,
|
|
"mean_token_accuracy": 0.15771302729845046,
|
|
"num_tokens": 16300466.0,
|
|
"step": 9385
|
|
},
|
|
{
|
|
"entropy": 5.609297752380371,
|
|
"epoch": 0.7305971600855865,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 0.0004952118290149679,
|
|
"loss": 5.4115,
|
|
"mean_token_accuracy": 0.16585402488708495,
|
|
"num_tokens": 16309250.0,
|
|
"step": 9390
|
|
},
|
|
{
|
|
"entropy": 5.643940162658692,
|
|
"epoch": 0.730986189457304,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.0004952061399970492,
|
|
"loss": 5.5282,
|
|
"mean_token_accuracy": 0.15753922909498214,
|
|
"num_tokens": 16318056.0,
|
|
"step": 9395
|
|
},
|
|
{
|
|
"entropy": 5.524111223220825,
|
|
"epoch": 0.7313752188290216,
|
|
"grad_norm": 1.609375,
|
|
"learning_rate": 0.000495200447637853,
|
|
"loss": 5.3884,
|
|
"mean_token_accuracy": 0.16298533380031585,
|
|
"num_tokens": 16326455.0,
|
|
"step": 9400
|
|
},
|
|
{
|
|
"entropy": 5.5443085670471195,
|
|
"epoch": 0.7317642482007392,
|
|
"grad_norm": 1.609375,
|
|
"learning_rate": 0.0004951947519374655,
|
|
"loss": 5.3595,
|
|
"mean_token_accuracy": 0.16749800890684127,
|
|
"num_tokens": 16334584.0,
|
|
"step": 9405
|
|
},
|
|
{
|
|
"entropy": 5.618832159042358,
|
|
"epoch": 0.7321532775724567,
|
|
"grad_norm": 1.5234375,
|
|
"learning_rate": 0.0004951890528959731,
|
|
"loss": 5.4111,
|
|
"mean_token_accuracy": 0.17092057168483735,
|
|
"num_tokens": 16342361.0,
|
|
"step": 9410
|
|
},
|
|
{
|
|
"entropy": 5.688623046875,
|
|
"epoch": 0.7325423069441743,
|
|
"grad_norm": 1.671875,
|
|
"learning_rate": 0.0004951833505134623,
|
|
"loss": 5.5519,
|
|
"mean_token_accuracy": 0.16083619147539138,
|
|
"num_tokens": 16350414.0,
|
|
"step": 9415
|
|
},
|
|
{
|
|
"entropy": 5.5569733619689945,
|
|
"epoch": 0.7329313363158918,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.0004951776447900196,
|
|
"loss": 5.3729,
|
|
"mean_token_accuracy": 0.17199201881885529,
|
|
"num_tokens": 16359266.0,
|
|
"step": 9420
|
|
},
|
|
{
|
|
"entropy": 5.4728546142578125,
|
|
"epoch": 0.7333203656876094,
|
|
"grad_norm": 1.5,
|
|
"learning_rate": 0.0004951719357257317,
|
|
"loss": 5.3716,
|
|
"mean_token_accuracy": 0.1669355571269989,
|
|
"num_tokens": 16367558.0,
|
|
"step": 9425
|
|
},
|
|
{
|
|
"entropy": 5.425278615951538,
|
|
"epoch": 0.733709395059327,
|
|
"grad_norm": 1.609375,
|
|
"learning_rate": 0.000495166223320685,
|
|
"loss": 5.3499,
|
|
"mean_token_accuracy": 0.17242926806211473,
|
|
"num_tokens": 16375690.0,
|
|
"step": 9430
|
|
},
|
|
{
|
|
"entropy": 5.575134372711181,
|
|
"epoch": 0.7340984244310446,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.0004951605075749662,
|
|
"loss": 5.4733,
|
|
"mean_token_accuracy": 0.16204415559768676,
|
|
"num_tokens": 16384157.0,
|
|
"step": 9435
|
|
},
|
|
{
|
|
"entropy": 5.592302656173706,
|
|
"epoch": 0.7344874538027621,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.0004951547884886623,
|
|
"loss": 5.5091,
|
|
"mean_token_accuracy": 0.16609383076429368,
|
|
"num_tokens": 16392153.0,
|
|
"step": 9440
|
|
},
|
|
{
|
|
"entropy": 5.476838254928589,
|
|
"epoch": 0.7348764831744796,
|
|
"grad_norm": 1.5390625,
|
|
"learning_rate": 0.0004951490660618598,
|
|
"loss": 5.254,
|
|
"mean_token_accuracy": 0.1805071696639061,
|
|
"num_tokens": 16400132.0,
|
|
"step": 9445
|
|
},
|
|
{
|
|
"entropy": 5.518449020385742,
|
|
"epoch": 0.7352655125461972,
|
|
"grad_norm": 1.984375,
|
|
"learning_rate": 0.0004951433402946457,
|
|
"loss": 5.441,
|
|
"mean_token_accuracy": 0.1731431618332863,
|
|
"num_tokens": 16408297.0,
|
|
"step": 9450
|
|
},
|
|
{
|
|
"entropy": 5.529580307006836,
|
|
"epoch": 0.7356545419179148,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.0004951376111871068,
|
|
"loss": 5.4958,
|
|
"mean_token_accuracy": 0.1599218189716339,
|
|
"num_tokens": 16417977.0,
|
|
"step": 9455
|
|
},
|
|
{
|
|
"entropy": 5.632377815246582,
|
|
"epoch": 0.7360435712896324,
|
|
"grad_norm": 1.609375,
|
|
"learning_rate": 0.0004951318787393299,
|
|
"loss": 5.3952,
|
|
"mean_token_accuracy": 0.16501280218362807,
|
|
"num_tokens": 16427156.0,
|
|
"step": 9460
|
|
},
|
|
{
|
|
"entropy": 5.665159082412719,
|
|
"epoch": 0.73643260066135,
|
|
"grad_norm": 1.5859375,
|
|
"learning_rate": 0.0004951261429514023,
|
|
"loss": 5.5766,
|
|
"mean_token_accuracy": 0.1560535579919815,
|
|
"num_tokens": 16435845.0,
|
|
"step": 9465
|
|
},
|
|
{
|
|
"entropy": 5.592835998535156,
|
|
"epoch": 0.7368216300330674,
|
|
"grad_norm": 1.6015625,
|
|
"learning_rate": 0.0004951204038234106,
|
|
"loss": 5.5481,
|
|
"mean_token_accuracy": 0.16239631026983262,
|
|
"num_tokens": 16445876.0,
|
|
"step": 9470
|
|
},
|
|
{
|
|
"entropy": 5.579823780059814,
|
|
"epoch": 0.737210659404785,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.0004951146613554424,
|
|
"loss": 5.486,
|
|
"mean_token_accuracy": 0.16736538857221603,
|
|
"num_tokens": 16454688.0,
|
|
"step": 9475
|
|
},
|
|
{
|
|
"entropy": 5.630280685424805,
|
|
"epoch": 0.7375996887765026,
|
|
"grad_norm": 1.7109375,
|
|
"learning_rate": 0.0004951089155475843,
|
|
"loss": 5.544,
|
|
"mean_token_accuracy": 0.16136215925216674,
|
|
"num_tokens": 16463932.0,
|
|
"step": 9480
|
|
},
|
|
{
|
|
"entropy": 5.643390369415283,
|
|
"epoch": 0.7379887181482202,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.000495103166399924,
|
|
"loss": 5.4849,
|
|
"mean_token_accuracy": 0.16349284648895263,
|
|
"num_tokens": 16472627.0,
|
|
"step": 9485
|
|
},
|
|
{
|
|
"entropy": 5.635018539428711,
|
|
"epoch": 0.7383777475199378,
|
|
"grad_norm": 1.734375,
|
|
"learning_rate": 0.0004950974139125484,
|
|
"loss": 5.4949,
|
|
"mean_token_accuracy": 0.16311829388141633,
|
|
"num_tokens": 16480819.0,
|
|
"step": 9490
|
|
},
|
|
{
|
|
"entropy": 5.55206708908081,
|
|
"epoch": 0.7387667768916554,
|
|
"grad_norm": 1.5234375,
|
|
"learning_rate": 0.0004950916580855448,
|
|
"loss": 5.473,
|
|
"mean_token_accuracy": 0.1609806925058365,
|
|
"num_tokens": 16489055.0,
|
|
"step": 9495
|
|
},
|
|
{
|
|
"entropy": 5.563097381591797,
|
|
"epoch": 0.7391558062633728,
|
|
"grad_norm": 1.6015625,
|
|
"learning_rate": 0.0004950858989190007,
|
|
"loss": 5.4691,
|
|
"mean_token_accuracy": 0.17230552434921265,
|
|
"num_tokens": 16497375.0,
|
|
"step": 9500
|
|
},
|
|
{
|
|
"entropy": 5.496043252944946,
|
|
"epoch": 0.7395448356350904,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.0004950801364130032,
|
|
"loss": 5.2937,
|
|
"mean_token_accuracy": 0.17340207993984222,
|
|
"num_tokens": 16505183.0,
|
|
"step": 9505
|
|
},
|
|
{
|
|
"entropy": 5.591700601577759,
|
|
"epoch": 0.739933865006808,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.0004950743705676401,
|
|
"loss": 5.5896,
|
|
"mean_token_accuracy": 0.1553812712430954,
|
|
"num_tokens": 16514018.0,
|
|
"step": 9510
|
|
},
|
|
{
|
|
"entropy": 5.648381280899048,
|
|
"epoch": 0.7403228943785256,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.0004950686013829987,
|
|
"loss": 5.4714,
|
|
"mean_token_accuracy": 0.1652623936533928,
|
|
"num_tokens": 16522954.0,
|
|
"step": 9515
|
|
},
|
|
{
|
|
"entropy": 5.6629143238067625,
|
|
"epoch": 0.7407119237502432,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.0004950628288591665,
|
|
"loss": 5.5069,
|
|
"mean_token_accuracy": 0.15993356853723525,
|
|
"num_tokens": 16530845.0,
|
|
"step": 9520
|
|
},
|
|
{
|
|
"entropy": 5.547266674041748,
|
|
"epoch": 0.7411009531219607,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 0.0004950570529962311,
|
|
"loss": 5.4749,
|
|
"mean_token_accuracy": 0.16346780955791473,
|
|
"num_tokens": 16540464.0,
|
|
"step": 9525
|
|
},
|
|
{
|
|
"entropy": 5.483546257019043,
|
|
"epoch": 0.7414899824936783,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.0004950512737942803,
|
|
"loss": 5.3877,
|
|
"mean_token_accuracy": 0.17326026707887648,
|
|
"num_tokens": 16549485.0,
|
|
"step": 9530
|
|
},
|
|
{
|
|
"entropy": 5.642919969558716,
|
|
"epoch": 0.7418790118653958,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.0004950454912534015,
|
|
"loss": 5.5267,
|
|
"mean_token_accuracy": 0.16447333842515946,
|
|
"num_tokens": 16557854.0,
|
|
"step": 9535
|
|
},
|
|
{
|
|
"entropy": 5.615914058685303,
|
|
"epoch": 0.7422680412371134,
|
|
"grad_norm": 1.5703125,
|
|
"learning_rate": 0.0004950397053736827,
|
|
"loss": 5.553,
|
|
"mean_token_accuracy": 0.16307123601436616,
|
|
"num_tokens": 16565975.0,
|
|
"step": 9540
|
|
},
|
|
{
|
|
"entropy": 5.5966729640960695,
|
|
"epoch": 0.742657070608831,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.0004950339161552117,
|
|
"loss": 5.515,
|
|
"mean_token_accuracy": 0.16534047722816467,
|
|
"num_tokens": 16575038.0,
|
|
"step": 9545
|
|
},
|
|
{
|
|
"entropy": 5.566877698898315,
|
|
"epoch": 0.7430460999805485,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.0004950281235980761,
|
|
"loss": 5.3809,
|
|
"mean_token_accuracy": 0.16896103471517562,
|
|
"num_tokens": 16584292.0,
|
|
"step": 9550
|
|
},
|
|
{
|
|
"entropy": 5.630538368225098,
|
|
"epoch": 0.7434351293522661,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.000495022327702364,
|
|
"loss": 5.4694,
|
|
"mean_token_accuracy": 0.16563740819692613,
|
|
"num_tokens": 16592331.0,
|
|
"step": 9555
|
|
},
|
|
{
|
|
"entropy": 5.5774084568023685,
|
|
"epoch": 0.7438241587239837,
|
|
"grad_norm": 1.5859375,
|
|
"learning_rate": 0.0004950165284681631,
|
|
"loss": 5.4052,
|
|
"mean_token_accuracy": 0.16738104373216628,
|
|
"num_tokens": 16601845.0,
|
|
"step": 9560
|
|
},
|
|
{
|
|
"entropy": 5.592267656326294,
|
|
"epoch": 0.7442131880957013,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0004950107258955618,
|
|
"loss": 5.5124,
|
|
"mean_token_accuracy": 0.161766354739666,
|
|
"num_tokens": 16610438.0,
|
|
"step": 9565
|
|
},
|
|
{
|
|
"entropy": 5.527006816864014,
|
|
"epoch": 0.7446022174674188,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 0.0004950049199846479,
|
|
"loss": 5.4044,
|
|
"mean_token_accuracy": 0.16695664525032045,
|
|
"num_tokens": 16618892.0,
|
|
"step": 9570
|
|
},
|
|
{
|
|
"entropy": 5.622400331497192,
|
|
"epoch": 0.7449912468391363,
|
|
"grad_norm": 1.515625,
|
|
"learning_rate": 0.0004949991107355095,
|
|
"loss": 5.4686,
|
|
"mean_token_accuracy": 0.16732008904218673,
|
|
"num_tokens": 16627702.0,
|
|
"step": 9575
|
|
},
|
|
{
|
|
"entropy": 5.568833112716675,
|
|
"epoch": 0.7453802762108539,
|
|
"grad_norm": 1.5546875,
|
|
"learning_rate": 0.0004949932981482347,
|
|
"loss": 5.3646,
|
|
"mean_token_accuracy": 0.17611705958843232,
|
|
"num_tokens": 16635653.0,
|
|
"step": 9580
|
|
},
|
|
{
|
|
"entropy": 5.582194185256958,
|
|
"epoch": 0.7457693055825715,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.0004949874822229118,
|
|
"loss": 5.5247,
|
|
"mean_token_accuracy": 0.16280439794063567,
|
|
"num_tokens": 16643898.0,
|
|
"step": 9585
|
|
},
|
|
{
|
|
"entropy": 5.557568740844727,
|
|
"epoch": 0.7461583349542891,
|
|
"grad_norm": 1.5,
|
|
"learning_rate": 0.0004949816629596288,
|
|
"loss": 5.38,
|
|
"mean_token_accuracy": 0.16781843900680543,
|
|
"num_tokens": 16653126.0,
|
|
"step": 9590
|
|
},
|
|
{
|
|
"entropy": 5.611994028091431,
|
|
"epoch": 0.7465473643260067,
|
|
"grad_norm": 1.5,
|
|
"learning_rate": 0.0004949758403584746,
|
|
"loss": 5.4992,
|
|
"mean_token_accuracy": 0.16199871003627778,
|
|
"num_tokens": 16661561.0,
|
|
"step": 9595
|
|
},
|
|
{
|
|
"entropy": 5.572059297561646,
|
|
"epoch": 0.7469363936977241,
|
|
"grad_norm": 1.4921875,
|
|
"learning_rate": 0.0004949700144195368,
|
|
"loss": 5.461,
|
|
"mean_token_accuracy": 0.16721679419279098,
|
|
"num_tokens": 16669657.0,
|
|
"step": 9600
|
|
},
|
|
{
|
|
"entropy": 5.567546606063843,
|
|
"epoch": 0.7473254230694417,
|
|
"grad_norm": 1.6796875,
|
|
"learning_rate": 0.0004949641851429043,
|
|
"loss": 5.4521,
|
|
"mean_token_accuracy": 0.16164853125810624,
|
|
"num_tokens": 16678486.0,
|
|
"step": 9605
|
|
},
|
|
{
|
|
"entropy": 5.603635597229004,
|
|
"epoch": 0.7477144524411593,
|
|
"grad_norm": 1.5546875,
|
|
"learning_rate": 0.0004949583525286654,
|
|
"loss": 5.4249,
|
|
"mean_token_accuracy": 0.15870596021413802,
|
|
"num_tokens": 16686638.0,
|
|
"step": 9610
|
|
},
|
|
{
|
|
"entropy": 5.561826896667481,
|
|
"epoch": 0.7481034818128769,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0004949525165769085,
|
|
"loss": 5.3962,
|
|
"mean_token_accuracy": 0.16577211171388626,
|
|
"num_tokens": 16694393.0,
|
|
"step": 9615
|
|
},
|
|
{
|
|
"entropy": 5.565818643569946,
|
|
"epoch": 0.7484925111845945,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.0004949466772877224,
|
|
"loss": 5.4298,
|
|
"mean_token_accuracy": 0.17146286964416504,
|
|
"num_tokens": 16702613.0,
|
|
"step": 9620
|
|
},
|
|
{
|
|
"entropy": 5.5888903617858885,
|
|
"epoch": 0.748881540556312,
|
|
"grad_norm": 1.6640625,
|
|
"learning_rate": 0.0004949408346611955,
|
|
"loss": 5.3801,
|
|
"mean_token_accuracy": 0.16653349101543427,
|
|
"num_tokens": 16711210.0,
|
|
"step": 9625
|
|
},
|
|
{
|
|
"entropy": 5.5719380378723145,
|
|
"epoch": 0.7492705699280295,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.0004949349886974165,
|
|
"loss": 5.4341,
|
|
"mean_token_accuracy": 0.1705416738986969,
|
|
"num_tokens": 16719124.0,
|
|
"step": 9630
|
|
},
|
|
{
|
|
"entropy": 5.585111665725708,
|
|
"epoch": 0.7496595992997471,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.0004949291393964741,
|
|
"loss": 5.418,
|
|
"mean_token_accuracy": 0.1670316129922867,
|
|
"num_tokens": 16727240.0,
|
|
"step": 9635
|
|
},
|
|
{
|
|
"entropy": 5.59084186553955,
|
|
"epoch": 0.7500486286714647,
|
|
"grad_norm": 1.65625,
|
|
"learning_rate": 0.000494923286758457,
|
|
"loss": 5.5381,
|
|
"mean_token_accuracy": 0.162394617497921,
|
|
"num_tokens": 16736524.0,
|
|
"step": 9640
|
|
},
|
|
{
|
|
"entropy": 5.703877592086792,
|
|
"epoch": 0.7504376580431823,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 0.0004949174307834541,
|
|
"loss": 5.6694,
|
|
"mean_token_accuracy": 0.1475190818309784,
|
|
"num_tokens": 16745798.0,
|
|
"step": 9645
|
|
},
|
|
{
|
|
"entropy": 5.604979372024536,
|
|
"epoch": 0.7508266874148998,
|
|
"grad_norm": 2.140625,
|
|
"learning_rate": 0.0004949115714715543,
|
|
"loss": 5.4218,
|
|
"mean_token_accuracy": 0.16380434036254882,
|
|
"num_tokens": 16754263.0,
|
|
"step": 9650
|
|
},
|
|
{
|
|
"entropy": 5.515176439285279,
|
|
"epoch": 0.7512157167866174,
|
|
"grad_norm": 1.75,
|
|
"learning_rate": 0.0004949057088228465,
|
|
"loss": 5.3057,
|
|
"mean_token_accuracy": 0.17124868631362916,
|
|
"num_tokens": 16762610.0,
|
|
"step": 9655
|
|
},
|
|
{
|
|
"entropy": 5.615438222885132,
|
|
"epoch": 0.751604746158335,
|
|
"grad_norm": 1.5390625,
|
|
"learning_rate": 0.0004948998428374194,
|
|
"loss": 5.5149,
|
|
"mean_token_accuracy": 0.16087360233068465,
|
|
"num_tokens": 16771436.0,
|
|
"step": 9660
|
|
},
|
|
{
|
|
"entropy": 5.693601465225219,
|
|
"epoch": 0.7519937755300525,
|
|
"grad_norm": 2.171875,
|
|
"learning_rate": 0.0004948939735153622,
|
|
"loss": 5.5587,
|
|
"mean_token_accuracy": 0.16020183712244035,
|
|
"num_tokens": 16779647.0,
|
|
"step": 9665
|
|
},
|
|
{
|
|
"entropy": 5.682334852218628,
|
|
"epoch": 0.7523828049017701,
|
|
"grad_norm": 1.65625,
|
|
"learning_rate": 0.0004948881008567641,
|
|
"loss": 5.5112,
|
|
"mean_token_accuracy": 0.1604753240942955,
|
|
"num_tokens": 16788116.0,
|
|
"step": 9670
|
|
},
|
|
{
|
|
"entropy": 5.541039323806762,
|
|
"epoch": 0.7527718342734876,
|
|
"grad_norm": 1.5703125,
|
|
"learning_rate": 0.0004948822248617139,
|
|
"loss": 5.4307,
|
|
"mean_token_accuracy": 0.16998641937971115,
|
|
"num_tokens": 16796518.0,
|
|
"step": 9675
|
|
},
|
|
{
|
|
"entropy": 5.599405193328858,
|
|
"epoch": 0.7531608636452052,
|
|
"grad_norm": 1.7109375,
|
|
"learning_rate": 0.000494876345530301,
|
|
"loss": 5.4262,
|
|
"mean_token_accuracy": 0.163827808201313,
|
|
"num_tokens": 16805511.0,
|
|
"step": 9680
|
|
},
|
|
{
|
|
"entropy": 5.608861494064331,
|
|
"epoch": 0.7535498930169228,
|
|
"grad_norm": 1.53125,
|
|
"learning_rate": 0.0004948704628626145,
|
|
"loss": 5.4156,
|
|
"mean_token_accuracy": 0.16347003877162933,
|
|
"num_tokens": 16813173.0,
|
|
"step": 9685
|
|
},
|
|
{
|
|
"entropy": 5.582597398757935,
|
|
"epoch": 0.7539389223886404,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 0.0004948645768587437,
|
|
"loss": 5.5205,
|
|
"mean_token_accuracy": 0.15378826707601548,
|
|
"num_tokens": 16822193.0,
|
|
"step": 9690
|
|
},
|
|
{
|
|
"entropy": 5.494058084487915,
|
|
"epoch": 0.7543279517603579,
|
|
"grad_norm": 1.6953125,
|
|
"learning_rate": 0.0004948586875187778,
|
|
"loss": 5.2565,
|
|
"mean_token_accuracy": 0.1758536785840988,
|
|
"num_tokens": 16830421.0,
|
|
"step": 9695
|
|
},
|
|
{
|
|
"entropy": 5.540645027160645,
|
|
"epoch": 0.7547169811320755,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.0004948527948428064,
|
|
"loss": 5.396,
|
|
"mean_token_accuracy": 0.1691470354795456,
|
|
"num_tokens": 16838988.0,
|
|
"step": 9700
|
|
},
|
|
{
|
|
"entropy": 5.532936096191406,
|
|
"epoch": 0.755106010503793,
|
|
"grad_norm": 1.515625,
|
|
"learning_rate": 0.0004948468988309187,
|
|
"loss": 5.4798,
|
|
"mean_token_accuracy": 0.16092120558023454,
|
|
"num_tokens": 16847980.0,
|
|
"step": 9705
|
|
},
|
|
{
|
|
"entropy": 5.546801519393921,
|
|
"epoch": 0.7554950398755106,
|
|
"grad_norm": 2.0625,
|
|
"learning_rate": 0.0004948409994832043,
|
|
"loss": 5.4005,
|
|
"mean_token_accuracy": 0.16306585520505906,
|
|
"num_tokens": 16857263.0,
|
|
"step": 9710
|
|
},
|
|
{
|
|
"entropy": 5.63371696472168,
|
|
"epoch": 0.7558840692472282,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.0004948350967997526,
|
|
"loss": 5.3766,
|
|
"mean_token_accuracy": 0.16783807724714278,
|
|
"num_tokens": 16865314.0,
|
|
"step": 9715
|
|
},
|
|
{
|
|
"entropy": 5.595693683624267,
|
|
"epoch": 0.7562730986189458,
|
|
"grad_norm": 1.6953125,
|
|
"learning_rate": 0.0004948291907806532,
|
|
"loss": 5.4907,
|
|
"mean_token_accuracy": 0.16305321604013442,
|
|
"num_tokens": 16875359.0,
|
|
"step": 9720
|
|
},
|
|
{
|
|
"entropy": 5.627140188217163,
|
|
"epoch": 0.7566621279906633,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.0004948232814259957,
|
|
"loss": 5.5845,
|
|
"mean_token_accuracy": 0.15356298983097078,
|
|
"num_tokens": 16885279.0,
|
|
"step": 9725
|
|
},
|
|
{
|
|
"entropy": 5.726843452453613,
|
|
"epoch": 0.7570511573623808,
|
|
"grad_norm": 1.5625,
|
|
"learning_rate": 0.0004948173687358699,
|
|
"loss": 5.5353,
|
|
"mean_token_accuracy": 0.15876051783561707,
|
|
"num_tokens": 16894463.0,
|
|
"step": 9730
|
|
},
|
|
{
|
|
"entropy": 5.651642799377441,
|
|
"epoch": 0.7574401867340984,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 0.0004948114527103652,
|
|
"loss": 5.4537,
|
|
"mean_token_accuracy": 0.15732816755771636,
|
|
"num_tokens": 16903378.0,
|
|
"step": 9735
|
|
},
|
|
{
|
|
"entropy": 5.538081312179566,
|
|
"epoch": 0.757829216105816,
|
|
"grad_norm": 1.7421875,
|
|
"learning_rate": 0.0004948055333495717,
|
|
"loss": 5.4974,
|
|
"mean_token_accuracy": 0.16314080357551575,
|
|
"num_tokens": 16912039.0,
|
|
"step": 9740
|
|
},
|
|
{
|
|
"entropy": 5.588148403167724,
|
|
"epoch": 0.7582182454775336,
|
|
"grad_norm": 1.578125,
|
|
"learning_rate": 0.0004947996106535791,
|
|
"loss": 5.4425,
|
|
"mean_token_accuracy": 0.15965240448713303,
|
|
"num_tokens": 16920516.0,
|
|
"step": 9745
|
|
},
|
|
{
|
|
"entropy": 5.673912191390992,
|
|
"epoch": 0.7586072748492512,
|
|
"grad_norm": 1.5390625,
|
|
"learning_rate": 0.0004947936846224773,
|
|
"loss": 5.4551,
|
|
"mean_token_accuracy": 0.16163322031497956,
|
|
"num_tokens": 16929131.0,
|
|
"step": 9750
|
|
},
|
|
{
|
|
"entropy": 5.549356412887573,
|
|
"epoch": 0.7589963042209686,
|
|
"grad_norm": 1.5625,
|
|
"learning_rate": 0.0004947877552563562,
|
|
"loss": 5.4778,
|
|
"mean_token_accuracy": 0.1686248555779457,
|
|
"num_tokens": 16937352.0,
|
|
"step": 9755
|
|
},
|
|
{
|
|
"entropy": 5.635425758361817,
|
|
"epoch": 0.7593853335926862,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.0004947818225553056,
|
|
"loss": 5.5642,
|
|
"mean_token_accuracy": 0.16105495393276215,
|
|
"num_tokens": 16946439.0,
|
|
"step": 9760
|
|
},
|
|
{
|
|
"entropy": 5.674735689163208,
|
|
"epoch": 0.7597743629644038,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.0004947758865194156,
|
|
"loss": 5.4521,
|
|
"mean_token_accuracy": 0.16383536159992218,
|
|
"num_tokens": 16955402.0,
|
|
"step": 9765
|
|
},
|
|
{
|
|
"entropy": 5.442025089263916,
|
|
"epoch": 0.7601633923361214,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.0004947699471487766,
|
|
"loss": 5.3709,
|
|
"mean_token_accuracy": 0.17045130282640458,
|
|
"num_tokens": 16964299.0,
|
|
"step": 9770
|
|
},
|
|
{
|
|
"entropy": 5.503045511245728,
|
|
"epoch": 0.760552421707839,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.0004947640044434782,
|
|
"loss": 5.4329,
|
|
"mean_token_accuracy": 0.16265159249305725,
|
|
"num_tokens": 16973483.0,
|
|
"step": 9775
|
|
},
|
|
{
|
|
"entropy": 5.630168056488037,
|
|
"epoch": 0.7609414510795565,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0004947580584036109,
|
|
"loss": 5.4821,
|
|
"mean_token_accuracy": 0.16721660643815994,
|
|
"num_tokens": 16982234.0,
|
|
"step": 9780
|
|
},
|
|
{
|
|
"entropy": 5.592389631271362,
|
|
"epoch": 0.761330480451274,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.0004947521090292649,
|
|
"loss": 5.4358,
|
|
"mean_token_accuracy": 0.16668277680873872,
|
|
"num_tokens": 16990669.0,
|
|
"step": 9785
|
|
},
|
|
{
|
|
"entropy": 5.663802719116211,
|
|
"epoch": 0.7617195098229916,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 0.0004947461563205304,
|
|
"loss": 5.5076,
|
|
"mean_token_accuracy": 0.16735657155513764,
|
|
"num_tokens": 16999998.0,
|
|
"step": 9790
|
|
},
|
|
{
|
|
"entropy": 5.632854843139649,
|
|
"epoch": 0.7621085391947092,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.0004947402002774977,
|
|
"loss": 5.4926,
|
|
"mean_token_accuracy": 0.16238462924957275,
|
|
"num_tokens": 17008518.0,
|
|
"step": 9795
|
|
},
|
|
{
|
|
"entropy": 5.528278112411499,
|
|
"epoch": 0.7624975685664268,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.0004947342409002572,
|
|
"loss": 5.4374,
|
|
"mean_token_accuracy": 0.16266196966171265,
|
|
"num_tokens": 17017182.0,
|
|
"step": 9800
|
|
},
|
|
{
|
|
"entropy": 5.557402515411377,
|
|
"epoch": 0.7628865979381443,
|
|
"grad_norm": 1.5625,
|
|
"learning_rate": 0.0004947282781888994,
|
|
"loss": 5.4557,
|
|
"mean_token_accuracy": 0.16173066347837448,
|
|
"num_tokens": 17026186.0,
|
|
"step": 9805
|
|
},
|
|
{
|
|
"entropy": 5.506473207473755,
|
|
"epoch": 0.7632756273098619,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.0004947223121435147,
|
|
"loss": 5.3237,
|
|
"mean_token_accuracy": 0.17344443947076799,
|
|
"num_tokens": 17034295.0,
|
|
"step": 9810
|
|
},
|
|
{
|
|
"entropy": 5.489818096160889,
|
|
"epoch": 0.7636646566815795,
|
|
"grad_norm": 1.5703125,
|
|
"learning_rate": 0.0004947163427641936,
|
|
"loss": 5.4103,
|
|
"mean_token_accuracy": 0.16541531831026077,
|
|
"num_tokens": 17043195.0,
|
|
"step": 9815
|
|
},
|
|
{
|
|
"entropy": 5.497310924530029,
|
|
"epoch": 0.764053686053297,
|
|
"grad_norm": 1.609375,
|
|
"learning_rate": 0.0004947103700510268,
|
|
"loss": 5.3431,
|
|
"mean_token_accuracy": 0.1667629897594452,
|
|
"num_tokens": 17051903.0,
|
|
"step": 9820
|
|
},
|
|
{
|
|
"entropy": 5.521335697174072,
|
|
"epoch": 0.7644427154250146,
|
|
"grad_norm": 1.4921875,
|
|
"learning_rate": 0.0004947043940041047,
|
|
"loss": 5.4212,
|
|
"mean_token_accuracy": 0.17430951148271562,
|
|
"num_tokens": 17060495.0,
|
|
"step": 9825
|
|
},
|
|
{
|
|
"entropy": 5.6016762256622314,
|
|
"epoch": 0.7648317447967321,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.0004946984146235183,
|
|
"loss": 5.4716,
|
|
"mean_token_accuracy": 0.16526757106184958,
|
|
"num_tokens": 17069254.0,
|
|
"step": 9830
|
|
},
|
|
{
|
|
"entropy": 5.67843599319458,
|
|
"epoch": 0.7652207741684497,
|
|
"grad_norm": 1.5078125,
|
|
"learning_rate": 0.0004946924319093579,
|
|
"loss": 5.4434,
|
|
"mean_token_accuracy": 0.16862938553094864,
|
|
"num_tokens": 17077323.0,
|
|
"step": 9835
|
|
},
|
|
{
|
|
"entropy": 5.5361096382141115,
|
|
"epoch": 0.7656098035401673,
|
|
"grad_norm": 2.453125,
|
|
"learning_rate": 0.0004946864458617148,
|
|
"loss": 5.3127,
|
|
"mean_token_accuracy": 0.1744935244321823,
|
|
"num_tokens": 17085377.0,
|
|
"step": 9840
|
|
},
|
|
{
|
|
"entropy": 5.485551643371582,
|
|
"epoch": 0.7659988329118849,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.0004946804564806793,
|
|
"loss": 5.3999,
|
|
"mean_token_accuracy": 0.16610120385885238,
|
|
"num_tokens": 17094288.0,
|
|
"step": 9845
|
|
},
|
|
{
|
|
"entropy": 5.5387038230896,
|
|
"epoch": 0.7663878622836025,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.0004946744637663427,
|
|
"loss": 5.3222,
|
|
"mean_token_accuracy": 0.17849676460027694,
|
|
"num_tokens": 17101572.0,
|
|
"step": 9850
|
|
},
|
|
{
|
|
"entropy": 5.558818721771241,
|
|
"epoch": 0.7667768916553199,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.0004946684677187956,
|
|
"loss": 5.4698,
|
|
"mean_token_accuracy": 0.1644863784313202,
|
|
"num_tokens": 17110151.0,
|
|
"step": 9855
|
|
},
|
|
{
|
|
"entropy": 5.568019008636474,
|
|
"epoch": 0.7671659210270375,
|
|
"grad_norm": 1.5390625,
|
|
"learning_rate": 0.0004946624683381292,
|
|
"loss": 5.4458,
|
|
"mean_token_accuracy": 0.1656898006796837,
|
|
"num_tokens": 17118172.0,
|
|
"step": 9860
|
|
},
|
|
{
|
|
"entropy": 5.522030210494995,
|
|
"epoch": 0.7675549503987551,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.0004946564656244345,
|
|
"loss": 5.3519,
|
|
"mean_token_accuracy": 0.1725288525223732,
|
|
"num_tokens": 17126855.0,
|
|
"step": 9865
|
|
},
|
|
{
|
|
"entropy": 5.594412517547608,
|
|
"epoch": 0.7679439797704727,
|
|
"grad_norm": 1.7265625,
|
|
"learning_rate": 0.0004946504595778026,
|
|
"loss": 5.5248,
|
|
"mean_token_accuracy": 0.16505391001701356,
|
|
"num_tokens": 17135737.0,
|
|
"step": 9870
|
|
},
|
|
{
|
|
"entropy": 5.6575945854187015,
|
|
"epoch": 0.7683330091421903,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 0.0004946444501983246,
|
|
"loss": 5.4604,
|
|
"mean_token_accuracy": 0.1610216826200485,
|
|
"num_tokens": 17144521.0,
|
|
"step": 9875
|
|
},
|
|
{
|
|
"entropy": 5.658867597579956,
|
|
"epoch": 0.7687220385139077,
|
|
"grad_norm": 1.5625,
|
|
"learning_rate": 0.0004946384374860916,
|
|
"loss": 5.564,
|
|
"mean_token_accuracy": 0.16371750980615615,
|
|
"num_tokens": 17153534.0,
|
|
"step": 9880
|
|
},
|
|
{
|
|
"entropy": 5.528557062149048,
|
|
"epoch": 0.7691110678856253,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.0004946324214411949,
|
|
"loss": 5.4116,
|
|
"mean_token_accuracy": 0.16632574498653413,
|
|
"num_tokens": 17162600.0,
|
|
"step": 9885
|
|
},
|
|
{
|
|
"entropy": 5.580212259292603,
|
|
"epoch": 0.7695000972573429,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.0004946264020637259,
|
|
"loss": 5.4723,
|
|
"mean_token_accuracy": 0.15897754430770875,
|
|
"num_tokens": 17171373.0,
|
|
"step": 9890
|
|
},
|
|
{
|
|
"entropy": 5.6670910835266115,
|
|
"epoch": 0.7698891266290605,
|
|
"grad_norm": 1.6328125,
|
|
"learning_rate": 0.0004946203793537757,
|
|
"loss": 5.5038,
|
|
"mean_token_accuracy": 0.16297393292188644,
|
|
"num_tokens": 17180090.0,
|
|
"step": 9895
|
|
},
|
|
{
|
|
"entropy": 5.637380361557007,
|
|
"epoch": 0.7702781560007781,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.0004946143533114358,
|
|
"loss": 5.4195,
|
|
"mean_token_accuracy": 0.1694469153881073,
|
|
"num_tokens": 17189592.0,
|
|
"step": 9900
|
|
},
|
|
{
|
|
"entropy": 5.529821920394897,
|
|
"epoch": 0.7706671853724957,
|
|
"grad_norm": 1.5703125,
|
|
"learning_rate": 0.0004946083239367976,
|
|
"loss": 5.3527,
|
|
"mean_token_accuracy": 0.17120934575796126,
|
|
"num_tokens": 17198287.0,
|
|
"step": 9905
|
|
},
|
|
{
|
|
"entropy": 5.552817964553833,
|
|
"epoch": 0.7710562147442132,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 0.0004946022912299527,
|
|
"loss": 5.4739,
|
|
"mean_token_accuracy": 0.16421546936035156,
|
|
"num_tokens": 17206349.0,
|
|
"step": 9910
|
|
},
|
|
{
|
|
"entropy": 5.644651126861572,
|
|
"epoch": 0.7714452441159307,
|
|
"grad_norm": 1.5625,
|
|
"learning_rate": 0.0004945962551909926,
|
|
"loss": 5.5718,
|
|
"mean_token_accuracy": 0.1579301953315735,
|
|
"num_tokens": 17215408.0,
|
|
"step": 9915
|
|
},
|
|
{
|
|
"entropy": 5.672359752655029,
|
|
"epoch": 0.7718342734876483,
|
|
"grad_norm": 1.9453125,
|
|
"learning_rate": 0.0004945902158200089,
|
|
"loss": 5.4996,
|
|
"mean_token_accuracy": 0.1619244024157524,
|
|
"num_tokens": 17224342.0,
|
|
"step": 9920
|
|
},
|
|
{
|
|
"entropy": 5.565824508666992,
|
|
"epoch": 0.7722233028593659,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.0004945841731170931,
|
|
"loss": 5.3772,
|
|
"mean_token_accuracy": 0.1610265702009201,
|
|
"num_tokens": 17232532.0,
|
|
"step": 9925
|
|
},
|
|
{
|
|
"entropy": 5.523751640319825,
|
|
"epoch": 0.7726123322310835,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.0004945781270823369,
|
|
"loss": 5.3826,
|
|
"mean_token_accuracy": 0.16825056672096253,
|
|
"num_tokens": 17240786.0,
|
|
"step": 9930
|
|
},
|
|
{
|
|
"entropy": 5.574452877044678,
|
|
"epoch": 0.773001361602801,
|
|
"grad_norm": 1.640625,
|
|
"learning_rate": 0.0004945720777158323,
|
|
"loss": 5.3584,
|
|
"mean_token_accuracy": 0.1710540920495987,
|
|
"num_tokens": 17248515.0,
|
|
"step": 9935
|
|
},
|
|
{
|
|
"entropy": 5.602618217468262,
|
|
"epoch": 0.7733903909745186,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.0004945660250176708,
|
|
"loss": 5.4352,
|
|
"mean_token_accuracy": 0.17003979086875914,
|
|
"num_tokens": 17257098.0,
|
|
"step": 9940
|
|
},
|
|
{
|
|
"entropy": 5.543260478973389,
|
|
"epoch": 0.7737794203462361,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.0004945599689879443,
|
|
"loss": 5.4403,
|
|
"mean_token_accuracy": 0.15870731920003892,
|
|
"num_tokens": 17266851.0,
|
|
"step": 9945
|
|
},
|
|
{
|
|
"entropy": 5.54620246887207,
|
|
"epoch": 0.7741684497179537,
|
|
"grad_norm": 1.625,
|
|
"learning_rate": 0.0004945539096267448,
|
|
"loss": 5.38,
|
|
"mean_token_accuracy": 0.15749988406896592,
|
|
"num_tokens": 17275568.0,
|
|
"step": 9950
|
|
},
|
|
{
|
|
"entropy": 5.502654361724853,
|
|
"epoch": 0.7745574790896713,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 0.0004945478469341642,
|
|
"loss": 5.3494,
|
|
"mean_token_accuracy": 0.16825371235609055,
|
|
"num_tokens": 17284528.0,
|
|
"step": 9955
|
|
},
|
|
{
|
|
"entropy": 5.629582452774048,
|
|
"epoch": 0.7749465084613888,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.0004945417809102944,
|
|
"loss": 5.5123,
|
|
"mean_token_accuracy": 0.16047662049531936,
|
|
"num_tokens": 17293973.0,
|
|
"step": 9960
|
|
},
|
|
{
|
|
"entropy": 5.54505467414856,
|
|
"epoch": 0.7753355378331064,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.0004945357115552275,
|
|
"loss": 5.3619,
|
|
"mean_token_accuracy": 0.16990180015563966,
|
|
"num_tokens": 17302321.0,
|
|
"step": 9965
|
|
},
|
|
{
|
|
"entropy": 5.563962125778199,
|
|
"epoch": 0.775724567204824,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.0004945296388690557,
|
|
"loss": 5.5068,
|
|
"mean_token_accuracy": 0.16015054732561113,
|
|
"num_tokens": 17311226.0,
|
|
"step": 9970
|
|
},
|
|
{
|
|
"entropy": 5.615965557098389,
|
|
"epoch": 0.7761135965765416,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 0.000494523562851871,
|
|
"loss": 5.472,
|
|
"mean_token_accuracy": 0.1580027550458908,
|
|
"num_tokens": 17319818.0,
|
|
"step": 9975
|
|
},
|
|
{
|
|
"entropy": 5.665783786773682,
|
|
"epoch": 0.7765026259482591,
|
|
"grad_norm": 1.5078125,
|
|
"learning_rate": 0.0004945174835037655,
|
|
"loss": 5.5344,
|
|
"mean_token_accuracy": 0.15653909295797347,
|
|
"num_tokens": 17329195.0,
|
|
"step": 9980
|
|
},
|
|
{
|
|
"entropy": 5.643244791030884,
|
|
"epoch": 0.7768916553199766,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.0004945114008248319,
|
|
"loss": 5.579,
|
|
"mean_token_accuracy": 0.16743383705615997,
|
|
"num_tokens": 17337689.0,
|
|
"step": 9985
|
|
},
|
|
{
|
|
"entropy": 5.602228450775146,
|
|
"epoch": 0.7772806846916942,
|
|
"grad_norm": 1.78125,
|
|
"learning_rate": 0.0004945053148151619,
|
|
"loss": 5.3313,
|
|
"mean_token_accuracy": 0.17215876877307892,
|
|
"num_tokens": 17345467.0,
|
|
"step": 9990
|
|
},
|
|
{
|
|
"entropy": 5.555410099029541,
|
|
"epoch": 0.7776697140634118,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 0.0004944992254748482,
|
|
"loss": 5.4759,
|
|
"mean_token_accuracy": 0.16185110360383986,
|
|
"num_tokens": 17353651.0,
|
|
"step": 9995
|
|
},
|
|
{
|
|
"entropy": 5.623938083648682,
|
|
"epoch": 0.7780587434351294,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.0004944931328039832,
|
|
"loss": 5.5335,
|
|
"mean_token_accuracy": 0.15981249064207076,
|
|
"num_tokens": 17362777.0,
|
|
"step": 10000
|
|
},
|
|
{
|
|
"entropy": 5.706428670883179,
|
|
"epoch": 0.778447772806847,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.0004944870368026592,
|
|
"loss": 5.4747,
|
|
"mean_token_accuracy": 0.17055122256278993,
|
|
"num_tokens": 17371562.0,
|
|
"step": 10005
|
|
},
|
|
{
|
|
"entropy": 5.6338499069213865,
|
|
"epoch": 0.7788368021785644,
|
|
"grad_norm": 1.53125,
|
|
"learning_rate": 0.0004944809374709689,
|
|
"loss": 5.4789,
|
|
"mean_token_accuracy": 0.1562877118587494,
|
|
"num_tokens": 17381185.0,
|
|
"step": 10010
|
|
},
|
|
{
|
|
"entropy": 5.602717685699463,
|
|
"epoch": 0.779225831550282,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.0004944748348090045,
|
|
"loss": 5.4388,
|
|
"mean_token_accuracy": 0.17197284549474717,
|
|
"num_tokens": 17390658.0,
|
|
"step": 10015
|
|
},
|
|
{
|
|
"entropy": 5.559042930603027,
|
|
"epoch": 0.7796148609219996,
|
|
"grad_norm": 1.5546875,
|
|
"learning_rate": 0.0004944687288168589,
|
|
"loss": 5.3866,
|
|
"mean_token_accuracy": 0.16711320579051972,
|
|
"num_tokens": 17399968.0,
|
|
"step": 10020
|
|
},
|
|
{
|
|
"entropy": 5.624416923522949,
|
|
"epoch": 0.7800038902937172,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 0.0004944626194946246,
|
|
"loss": 5.5111,
|
|
"mean_token_accuracy": 0.16354575157165527,
|
|
"num_tokens": 17408727.0,
|
|
"step": 10025
|
|
},
|
|
{
|
|
"entropy": 5.645158195495606,
|
|
"epoch": 0.7803929196654348,
|
|
"grad_norm": 1.7890625,
|
|
"learning_rate": 0.0004944565068423945,
|
|
"loss": 5.5146,
|
|
"mean_token_accuracy": 0.16532395631074906,
|
|
"num_tokens": 17417517.0,
|
|
"step": 10030
|
|
},
|
|
{
|
|
"entropy": 5.61456708908081,
|
|
"epoch": 0.7807819490371523,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.0004944503908602612,
|
|
"loss": 5.5103,
|
|
"mean_token_accuracy": 0.16158866435289382,
|
|
"num_tokens": 17427035.0,
|
|
"step": 10035
|
|
},
|
|
{
|
|
"entropy": 5.66776065826416,
|
|
"epoch": 0.7811709784088698,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 0.0004944442715483174,
|
|
"loss": 5.3956,
|
|
"mean_token_accuracy": 0.166395965218544,
|
|
"num_tokens": 17435585.0,
|
|
"step": 10040
|
|
},
|
|
{
|
|
"entropy": 5.5760262966156,
|
|
"epoch": 0.7815600077805874,
|
|
"grad_norm": 1.5859375,
|
|
"learning_rate": 0.0004944381489066561,
|
|
"loss": 5.4276,
|
|
"mean_token_accuracy": 0.1671623021364212,
|
|
"num_tokens": 17444317.0,
|
|
"step": 10045
|
|
},
|
|
{
|
|
"entropy": 5.6087377071380615,
|
|
"epoch": 0.781949037152305,
|
|
"grad_norm": 2.03125,
|
|
"learning_rate": 0.0004944320229353702,
|
|
"loss": 5.6346,
|
|
"mean_token_accuracy": 0.1621250942349434,
|
|
"num_tokens": 17453585.0,
|
|
"step": 10050
|
|
},
|
|
{
|
|
"entropy": 5.649258661270141,
|
|
"epoch": 0.7823380665240226,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.0004944258936345526,
|
|
"loss": 5.4098,
|
|
"mean_token_accuracy": 0.16680939346551896,
|
|
"num_tokens": 17462233.0,
|
|
"step": 10055
|
|
},
|
|
{
|
|
"entropy": 5.530995512008667,
|
|
"epoch": 0.7827270958957401,
|
|
"grad_norm": 1.515625,
|
|
"learning_rate": 0.0004944197610042963,
|
|
"loss": 5.3421,
|
|
"mean_token_accuracy": 0.17281670197844506,
|
|
"num_tokens": 17470566.0,
|
|
"step": 10060
|
|
},
|
|
{
|
|
"entropy": 5.504527044296265,
|
|
"epoch": 0.7831161252674577,
|
|
"grad_norm": 1.78125,
|
|
"learning_rate": 0.0004944136250446944,
|
|
"loss": 5.4191,
|
|
"mean_token_accuracy": 0.16703671663999559,
|
|
"num_tokens": 17479267.0,
|
|
"step": 10065
|
|
},
|
|
{
|
|
"entropy": 5.4788202285766605,
|
|
"epoch": 0.7835051546391752,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.0004944074857558399,
|
|
"loss": 5.3361,
|
|
"mean_token_accuracy": 0.17151730060577391,
|
|
"num_tokens": 17488060.0,
|
|
"step": 10070
|
|
},
|
|
{
|
|
"entropy": 5.669717836380005,
|
|
"epoch": 0.7838941840108928,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.0004944013431378261,
|
|
"loss": 5.573,
|
|
"mean_token_accuracy": 0.16319650560617446,
|
|
"num_tokens": 17497240.0,
|
|
"step": 10075
|
|
},
|
|
{
|
|
"entropy": 5.656308269500732,
|
|
"epoch": 0.7842832133826104,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.0004943951971907461,
|
|
"loss": 5.5319,
|
|
"mean_token_accuracy": 0.16159944534301757,
|
|
"num_tokens": 17506017.0,
|
|
"step": 10080
|
|
},
|
|
{
|
|
"entropy": 5.597034072875976,
|
|
"epoch": 0.7846722427543279,
|
|
"grad_norm": 1.6328125,
|
|
"learning_rate": 0.0004943890479146933,
|
|
"loss": 5.4782,
|
|
"mean_token_accuracy": 0.1599705621600151,
|
|
"num_tokens": 17514764.0,
|
|
"step": 10085
|
|
},
|
|
{
|
|
"entropy": 5.498212575912476,
|
|
"epoch": 0.7850612721260455,
|
|
"grad_norm": 1.546875,
|
|
"learning_rate": 0.0004943828953097607,
|
|
"loss": 5.4479,
|
|
"mean_token_accuracy": 0.16137347146868705,
|
|
"num_tokens": 17524183.0,
|
|
"step": 10090
|
|
},
|
|
{
|
|
"entropy": 5.617017459869385,
|
|
"epoch": 0.7854503014977631,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.000494376739376042,
|
|
"loss": 5.3896,
|
|
"mean_token_accuracy": 0.16983293145895004,
|
|
"num_tokens": 17533426.0,
|
|
"step": 10095
|
|
},
|
|
{
|
|
"entropy": 5.596925497055054,
|
|
"epoch": 0.7858393308694807,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.0004943705801136304,
|
|
"loss": 5.351,
|
|
"mean_token_accuracy": 0.17040693908929824,
|
|
"num_tokens": 17541966.0,
|
|
"step": 10100
|
|
},
|
|
{
|
|
"entropy": 5.553137636184692,
|
|
"epoch": 0.7862283602411982,
|
|
"grad_norm": 1.5625,
|
|
"learning_rate": 0.0004943644175226193,
|
|
"loss": 5.4439,
|
|
"mean_token_accuracy": 0.16552093625068665,
|
|
"num_tokens": 17551157.0,
|
|
"step": 10105
|
|
},
|
|
{
|
|
"entropy": 5.5377716541290285,
|
|
"epoch": 0.7866173896129158,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 0.0004943582516031025,
|
|
"loss": 5.3515,
|
|
"mean_token_accuracy": 0.17493999153375625,
|
|
"num_tokens": 17559999.0,
|
|
"step": 10110
|
|
},
|
|
{
|
|
"entropy": 5.5717082023620605,
|
|
"epoch": 0.7870064189846333,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0004943520823551732,
|
|
"loss": 5.3978,
|
|
"mean_token_accuracy": 0.16706651002168654,
|
|
"num_tokens": 17568873.0,
|
|
"step": 10115
|
|
},
|
|
{
|
|
"entropy": 5.56819977760315,
|
|
"epoch": 0.7873954483563509,
|
|
"grad_norm": 1.71875,
|
|
"learning_rate": 0.0004943459097789252,
|
|
"loss": 5.4791,
|
|
"mean_token_accuracy": 0.17377860993146896,
|
|
"num_tokens": 17577807.0,
|
|
"step": 10120
|
|
},
|
|
{
|
|
"entropy": 5.599589490890503,
|
|
"epoch": 0.7877844777280685,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0004943397338744523,
|
|
"loss": 5.5085,
|
|
"mean_token_accuracy": 0.15993668138980865,
|
|
"num_tokens": 17586646.0,
|
|
"step": 10125
|
|
},
|
|
{
|
|
"entropy": 5.670113754272461,
|
|
"epoch": 0.7881735070997861,
|
|
"grad_norm": 1.5546875,
|
|
"learning_rate": 0.000494333554641848,
|
|
"loss": 5.5505,
|
|
"mean_token_accuracy": 0.16283230036497115,
|
|
"num_tokens": 17595458.0,
|
|
"step": 10130
|
|
},
|
|
{
|
|
"entropy": 5.602777719497681,
|
|
"epoch": 0.7885625364715037,
|
|
"grad_norm": 1.5625,
|
|
"learning_rate": 0.000494327372081206,
|
|
"loss": 5.476,
|
|
"mean_token_accuracy": 0.16561120003461838,
|
|
"num_tokens": 17603997.0,
|
|
"step": 10135
|
|
},
|
|
{
|
|
"entropy": 5.605063390731812,
|
|
"epoch": 0.7889515658432211,
|
|
"grad_norm": 1.59375,
|
|
"learning_rate": 0.0004943211861926204,
|
|
"loss": 5.4778,
|
|
"mean_token_accuracy": 0.16220617294311523,
|
|
"num_tokens": 17612347.0,
|
|
"step": 10140
|
|
},
|
|
{
|
|
"entropy": 5.501496028900147,
|
|
"epoch": 0.7893405952149387,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 0.0004943149969761848,
|
|
"loss": 5.3621,
|
|
"mean_token_accuracy": 0.17086334824562072,
|
|
"num_tokens": 17620618.0,
|
|
"step": 10145
|
|
},
|
|
{
|
|
"entropy": 5.524677419662476,
|
|
"epoch": 0.7897296245866563,
|
|
"grad_norm": 1.515625,
|
|
"learning_rate": 0.0004943088044319932,
|
|
"loss": 5.3599,
|
|
"mean_token_accuracy": 0.16739994734525682,
|
|
"num_tokens": 17629164.0,
|
|
"step": 10150
|
|
},
|
|
{
|
|
"entropy": 5.666185903549194,
|
|
"epoch": 0.7901186539583739,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.0004943026085601395,
|
|
"loss": 5.5386,
|
|
"mean_token_accuracy": 0.1631959304213524,
|
|
"num_tokens": 17638454.0,
|
|
"step": 10155
|
|
},
|
|
{
|
|
"entropy": 5.621808481216431,
|
|
"epoch": 0.7905076833300915,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 0.0004942964093607178,
|
|
"loss": 5.4521,
|
|
"mean_token_accuracy": 0.1612175151705742,
|
|
"num_tokens": 17647099.0,
|
|
"step": 10160
|
|
},
|
|
{
|
|
"entropy": 5.648972654342652,
|
|
"epoch": 0.790896712701809,
|
|
"grad_norm": 1.8359375,
|
|
"learning_rate": 0.0004942902068338222,
|
|
"loss": 5.4357,
|
|
"mean_token_accuracy": 0.16804789006710052,
|
|
"num_tokens": 17655214.0,
|
|
"step": 10165
|
|
},
|
|
{
|
|
"entropy": 5.55198483467102,
|
|
"epoch": 0.7912857420735265,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.0004942840009795466,
|
|
"loss": 5.3993,
|
|
"mean_token_accuracy": 0.16623064428567885,
|
|
"num_tokens": 17663342.0,
|
|
"step": 10170
|
|
},
|
|
{
|
|
"entropy": 5.716285037994385,
|
|
"epoch": 0.7916747714452441,
|
|
"grad_norm": 1.625,
|
|
"learning_rate": 0.0004942777917979855,
|
|
"loss": 5.587,
|
|
"mean_token_accuracy": 0.1541963428258896,
|
|
"num_tokens": 17671725.0,
|
|
"step": 10175
|
|
},
|
|
{
|
|
"entropy": 5.591437530517578,
|
|
"epoch": 0.7920638008169617,
|
|
"grad_norm": 1.5234375,
|
|
"learning_rate": 0.0004942715792892328,
|
|
"loss": 5.4913,
|
|
"mean_token_accuracy": 0.1559672825038433,
|
|
"num_tokens": 17680627.0,
|
|
"step": 10180
|
|
},
|
|
{
|
|
"entropy": 5.6027037620544435,
|
|
"epoch": 0.7924528301886793,
|
|
"grad_norm": 1.703125,
|
|
"learning_rate": 0.000494265363453383,
|
|
"loss": 5.4676,
|
|
"mean_token_accuracy": 0.1708559960126877,
|
|
"num_tokens": 17688392.0,
|
|
"step": 10185
|
|
},
|
|
{
|
|
"entropy": 5.49579496383667,
|
|
"epoch": 0.7928418595603968,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.0004942591442905302,
|
|
"loss": 5.4129,
|
|
"mean_token_accuracy": 0.17170892059803008,
|
|
"num_tokens": 17697546.0,
|
|
"step": 10190
|
|
},
|
|
{
|
|
"entropy": 5.550096130371093,
|
|
"epoch": 0.7932308889321144,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.0004942529218007689,
|
|
"loss": 5.3801,
|
|
"mean_token_accuracy": 0.16477303802967072,
|
|
"num_tokens": 17705555.0,
|
|
"step": 10195
|
|
},
|
|
{
|
|
"entropy": 5.601612281799317,
|
|
"epoch": 0.7936199183038319,
|
|
"grad_norm": 1.6953125,
|
|
"learning_rate": 0.0004942466959841936,
|
|
"loss": 5.5442,
|
|
"mean_token_accuracy": 0.15382677614688872,
|
|
"num_tokens": 17715652.0,
|
|
"step": 10200
|
|
},
|
|
{
|
|
"entropy": 5.524223327636719,
|
|
"epoch": 0.7940089476755495,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 0.0004942404668408985,
|
|
"loss": 5.2832,
|
|
"mean_token_accuracy": 0.16528073996305465,
|
|
"num_tokens": 17724111.0,
|
|
"step": 10205
|
|
},
|
|
{
|
|
"entropy": 5.486041593551636,
|
|
"epoch": 0.7943979770472671,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.0004942342343709783,
|
|
"loss": 5.2823,
|
|
"mean_token_accuracy": 0.1720765382051468,
|
|
"num_tokens": 17732732.0,
|
|
"step": 10210
|
|
},
|
|
{
|
|
"entropy": 5.520828676223755,
|
|
"epoch": 0.7947870064189846,
|
|
"grad_norm": 1.5703125,
|
|
"learning_rate": 0.0004942279985745275,
|
|
"loss": 5.3954,
|
|
"mean_token_accuracy": 0.16788703352212905,
|
|
"num_tokens": 17741338.0,
|
|
"step": 10215
|
|
},
|
|
{
|
|
"entropy": 5.635388040542603,
|
|
"epoch": 0.7951760357907022,
|
|
"grad_norm": 1.7421875,
|
|
"learning_rate": 0.0004942217594516409,
|
|
"loss": 5.6126,
|
|
"mean_token_accuracy": 0.15470884889364242,
|
|
"num_tokens": 17750651.0,
|
|
"step": 10220
|
|
},
|
|
{
|
|
"entropy": 5.620717716217041,
|
|
"epoch": 0.7955650651624198,
|
|
"grad_norm": 1.65625,
|
|
"learning_rate": 0.000494215517002413,
|
|
"loss": 5.4072,
|
|
"mean_token_accuracy": 0.17064217776060103,
|
|
"num_tokens": 17759052.0,
|
|
"step": 10225
|
|
},
|
|
{
|
|
"entropy": 5.641384410858154,
|
|
"epoch": 0.7959540945341373,
|
|
"grad_norm": 1.5546875,
|
|
"learning_rate": 0.0004942092712269384,
|
|
"loss": 5.4751,
|
|
"mean_token_accuracy": 0.15961465537548064,
|
|
"num_tokens": 17767246.0,
|
|
"step": 10230
|
|
},
|
|
{
|
|
"entropy": 5.646351623535156,
|
|
"epoch": 0.7963431239058549,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.0004942030221253122,
|
|
"loss": 5.4976,
|
|
"mean_token_accuracy": 0.16838526874780654,
|
|
"num_tokens": 17777022.0,
|
|
"step": 10235
|
|
},
|
|
{
|
|
"entropy": 5.606373596191406,
|
|
"epoch": 0.7967321532775724,
|
|
"grad_norm": 2.1875,
|
|
"learning_rate": 0.0004941967696976289,
|
|
"loss": 5.4566,
|
|
"mean_token_accuracy": 0.1601052239537239,
|
|
"num_tokens": 17785586.0,
|
|
"step": 10240
|
|
},
|
|
{
|
|
"entropy": 5.533231353759765,
|
|
"epoch": 0.79712118264929,
|
|
"grad_norm": 1.5859375,
|
|
"learning_rate": 0.0004941905139439835,
|
|
"loss": 5.4623,
|
|
"mean_token_accuracy": 0.16345107704401016,
|
|
"num_tokens": 17794320.0,
|
|
"step": 10245
|
|
},
|
|
{
|
|
"entropy": 5.573796367645263,
|
|
"epoch": 0.7975102120210076,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.0004941842548644712,
|
|
"loss": 5.4749,
|
|
"mean_token_accuracy": 0.16987491250038148,
|
|
"num_tokens": 17803384.0,
|
|
"step": 10250
|
|
},
|
|
{
|
|
"entropy": 5.634557676315308,
|
|
"epoch": 0.7978992413927252,
|
|
"grad_norm": 1.4921875,
|
|
"learning_rate": 0.0004941779924591864,
|
|
"loss": 5.4317,
|
|
"mean_token_accuracy": 0.16256911307573318,
|
|
"num_tokens": 17811955.0,
|
|
"step": 10255
|
|
},
|
|
{
|
|
"entropy": 5.593855953216552,
|
|
"epoch": 0.7982882707644428,
|
|
"grad_norm": 1.5078125,
|
|
"learning_rate": 0.0004941717267282244,
|
|
"loss": 5.4865,
|
|
"mean_token_accuracy": 0.16269293576478958,
|
|
"num_tokens": 17820582.0,
|
|
"step": 10260
|
|
},
|
|
{
|
|
"entropy": 5.598372220993042,
|
|
"epoch": 0.7986773001361602,
|
|
"grad_norm": 1.625,
|
|
"learning_rate": 0.0004941654576716806,
|
|
"loss": 5.3988,
|
|
"mean_token_accuracy": 0.17172585427761078,
|
|
"num_tokens": 17828465.0,
|
|
"step": 10265
|
|
},
|
|
{
|
|
"entropy": 5.55808391571045,
|
|
"epoch": 0.7990663295078778,
|
|
"grad_norm": 1.7421875,
|
|
"learning_rate": 0.0004941591852896495,
|
|
"loss": 5.4228,
|
|
"mean_token_accuracy": 0.16660724580287933,
|
|
"num_tokens": 17836931.0,
|
|
"step": 10270
|
|
},
|
|
{
|
|
"entropy": 5.600241613388062,
|
|
"epoch": 0.7994553588795954,
|
|
"grad_norm": 1.5625,
|
|
"learning_rate": 0.0004941529095822268,
|
|
"loss": 5.4895,
|
|
"mean_token_accuracy": 0.16436177343130112,
|
|
"num_tokens": 17845192.0,
|
|
"step": 10275
|
|
},
|
|
{
|
|
"entropy": 5.605954694747925,
|
|
"epoch": 0.799844388251313,
|
|
"grad_norm": 1.8515625,
|
|
"learning_rate": 0.0004941466305495074,
|
|
"loss": 5.4446,
|
|
"mean_token_accuracy": 0.17005664259195327,
|
|
"num_tokens": 17854121.0,
|
|
"step": 10280
|
|
},
|
|
{
|
|
"entropy": 5.592868423461914,
|
|
"epoch": 0.8002334176230306,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.0004941403481915867,
|
|
"loss": 5.4549,
|
|
"mean_token_accuracy": 0.16366417109966278,
|
|
"num_tokens": 17862931.0,
|
|
"step": 10285
|
|
},
|
|
{
|
|
"entropy": 5.624537801742553,
|
|
"epoch": 0.800622446994748,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 0.0004941340625085601,
|
|
"loss": 5.4687,
|
|
"mean_token_accuracy": 0.15939135998487472,
|
|
"num_tokens": 17871909.0,
|
|
"step": 10290
|
|
},
|
|
{
|
|
"entropy": 5.557803964614868,
|
|
"epoch": 0.8010114763664656,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 0.0004941277735005228,
|
|
"loss": 5.393,
|
|
"mean_token_accuracy": 0.17381084114313125,
|
|
"num_tokens": 17880487.0,
|
|
"step": 10295
|
|
},
|
|
{
|
|
"entropy": 5.588583517074585,
|
|
"epoch": 0.8014005057381832,
|
|
"grad_norm": 1.5390625,
|
|
"learning_rate": 0.0004941214811675702,
|
|
"loss": 5.4542,
|
|
"mean_token_accuracy": 0.16852321177721025,
|
|
"num_tokens": 17888712.0,
|
|
"step": 10300
|
|
},
|
|
{
|
|
"entropy": 5.642118215560913,
|
|
"epoch": 0.8017895351099008,
|
|
"grad_norm": 2.609375,
|
|
"learning_rate": 0.0004941151855097982,
|
|
"loss": 5.4903,
|
|
"mean_token_accuracy": 0.15546952784061432,
|
|
"num_tokens": 17898163.0,
|
|
"step": 10305
|
|
},
|
|
{
|
|
"entropy": 5.535411024093628,
|
|
"epoch": 0.8021785644816184,
|
|
"grad_norm": 1.53125,
|
|
"learning_rate": 0.0004941088865273018,
|
|
"loss": 5.3703,
|
|
"mean_token_accuracy": 0.16942618489265443,
|
|
"num_tokens": 17906849.0,
|
|
"step": 10310
|
|
},
|
|
{
|
|
"entropy": 5.608208322525025,
|
|
"epoch": 0.802567593853336,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.0004941025842201769,
|
|
"loss": 5.4008,
|
|
"mean_token_accuracy": 0.16982601284980775,
|
|
"num_tokens": 17915695.0,
|
|
"step": 10315
|
|
},
|
|
{
|
|
"entropy": 5.596428537368775,
|
|
"epoch": 0.8029566232250535,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.0004940962785885189,
|
|
"loss": 5.5122,
|
|
"mean_token_accuracy": 0.1608186975121498,
|
|
"num_tokens": 17924706.0,
|
|
"step": 10320
|
|
},
|
|
{
|
|
"entropy": 5.562576389312744,
|
|
"epoch": 0.803345652596771,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 0.0004940899696324237,
|
|
"loss": 5.4711,
|
|
"mean_token_accuracy": 0.16752206534147263,
|
|
"num_tokens": 17934061.0,
|
|
"step": 10325
|
|
},
|
|
{
|
|
"entropy": 5.546580028533936,
|
|
"epoch": 0.8037346819684886,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.0004940836573519868,
|
|
"loss": 5.3595,
|
|
"mean_token_accuracy": 0.16760505586862565,
|
|
"num_tokens": 17942580.0,
|
|
"step": 10330
|
|
},
|
|
{
|
|
"entropy": 5.539015054702759,
|
|
"epoch": 0.8041237113402062,
|
|
"grad_norm": 1.609375,
|
|
"learning_rate": 0.0004940773417473043,
|
|
"loss": 5.2718,
|
|
"mean_token_accuracy": 0.17465481162071228,
|
|
"num_tokens": 17951171.0,
|
|
"step": 10335
|
|
},
|
|
{
|
|
"entropy": 5.505323362350464,
|
|
"epoch": 0.8045127407119238,
|
|
"grad_norm": 1.5078125,
|
|
"learning_rate": 0.0004940710228184717,
|
|
"loss": 5.3372,
|
|
"mean_token_accuracy": 0.17467240542173385,
|
|
"num_tokens": 17959674.0,
|
|
"step": 10340
|
|
},
|
|
{
|
|
"entropy": 5.5616072654724125,
|
|
"epoch": 0.8049017700836413,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.000494064700565585,
|
|
"loss": 5.3916,
|
|
"mean_token_accuracy": 0.17132804691791534,
|
|
"num_tokens": 17969036.0,
|
|
"step": 10345
|
|
},
|
|
{
|
|
"entropy": 5.532428979873657,
|
|
"epoch": 0.8052907994553589,
|
|
"grad_norm": 1.4921875,
|
|
"learning_rate": 0.0004940583749887403,
|
|
"loss": 5.4045,
|
|
"mean_token_accuracy": 0.17045033425092698,
|
|
"num_tokens": 17977406.0,
|
|
"step": 10350
|
|
},
|
|
{
|
|
"entropy": 5.526391220092774,
|
|
"epoch": 0.8056798288270764,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.0004940520460880333,
|
|
"loss": 5.3813,
|
|
"mean_token_accuracy": 0.16534534841775894,
|
|
"num_tokens": 17985981.0,
|
|
"step": 10355
|
|
},
|
|
{
|
|
"entropy": 5.650390529632569,
|
|
"epoch": 0.806068858198794,
|
|
"grad_norm": 1.609375,
|
|
"learning_rate": 0.0004940457138635601,
|
|
"loss": 5.5773,
|
|
"mean_token_accuracy": 0.15537587255239488,
|
|
"num_tokens": 17994246.0,
|
|
"step": 10360
|
|
},
|
|
{
|
|
"entropy": 5.547157096862793,
|
|
"epoch": 0.8064578875705116,
|
|
"grad_norm": 1.7265625,
|
|
"learning_rate": 0.0004940393783154169,
|
|
"loss": 5.4117,
|
|
"mean_token_accuracy": 0.16677334606647493,
|
|
"num_tokens": 18002444.0,
|
|
"step": 10365
|
|
},
|
|
{
|
|
"entropy": 5.520352935791015,
|
|
"epoch": 0.8068469169422291,
|
|
"grad_norm": 1.4921875,
|
|
"learning_rate": 0.0004940330394436999,
|
|
"loss": 5.3228,
|
|
"mean_token_accuracy": 0.17117541283369064,
|
|
"num_tokens": 18011076.0,
|
|
"step": 10370
|
|
},
|
|
{
|
|
"entropy": 5.6307567119598385,
|
|
"epoch": 0.8072359463139467,
|
|
"grad_norm": 1.546875,
|
|
"learning_rate": 0.000494026697248505,
|
|
"loss": 5.6128,
|
|
"mean_token_accuracy": 0.15513427555561066,
|
|
"num_tokens": 18020232.0,
|
|
"step": 10375
|
|
},
|
|
{
|
|
"entropy": 5.632945775985718,
|
|
"epoch": 0.8076249756856643,
|
|
"grad_norm": 1.6171875,
|
|
"learning_rate": 0.0004940203517299287,
|
|
"loss": 5.4423,
|
|
"mean_token_accuracy": 0.16628613770008088,
|
|
"num_tokens": 18029055.0,
|
|
"step": 10380
|
|
},
|
|
{
|
|
"entropy": 5.6604228019714355,
|
|
"epoch": 0.8080140050573819,
|
|
"grad_norm": 1.6015625,
|
|
"learning_rate": 0.000494014002888067,
|
|
"loss": 5.5832,
|
|
"mean_token_accuracy": 0.15375707671046257,
|
|
"num_tokens": 18037827.0,
|
|
"step": 10385
|
|
},
|
|
{
|
|
"entropy": 5.532300758361816,
|
|
"epoch": 0.8084030344290994,
|
|
"grad_norm": 1.5078125,
|
|
"learning_rate": 0.0004940076507230166,
|
|
"loss": 5.4075,
|
|
"mean_token_accuracy": 0.16032442599534988,
|
|
"num_tokens": 18047017.0,
|
|
"step": 10390
|
|
},
|
|
{
|
|
"entropy": 5.572431898117065,
|
|
"epoch": 0.8087920638008169,
|
|
"grad_norm": 1.8203125,
|
|
"learning_rate": 0.0004940012952348735,
|
|
"loss": 5.4952,
|
|
"mean_token_accuracy": 0.1637907072901726,
|
|
"num_tokens": 18056256.0,
|
|
"step": 10395
|
|
},
|
|
{
|
|
"entropy": 5.571317577362061,
|
|
"epoch": 0.8091810931725345,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.0004939949364237345,
|
|
"loss": 5.2766,
|
|
"mean_token_accuracy": 0.1846555769443512,
|
|
"num_tokens": 18064127.0,
|
|
"step": 10400
|
|
},
|
|
{
|
|
"entropy": 5.525552558898926,
|
|
"epoch": 0.8095701225442521,
|
|
"grad_norm": 1.5390625,
|
|
"learning_rate": 0.0004939885742896958,
|
|
"loss": 5.4217,
|
|
"mean_token_accuracy": 0.16987547874450684,
|
|
"num_tokens": 18072766.0,
|
|
"step": 10405
|
|
},
|
|
{
|
|
"entropy": 5.533914470672608,
|
|
"epoch": 0.8099591519159697,
|
|
"grad_norm": 1.546875,
|
|
"learning_rate": 0.000493982208832854,
|
|
"loss": 5.389,
|
|
"mean_token_accuracy": 0.16176797598600387,
|
|
"num_tokens": 18080685.0,
|
|
"step": 10410
|
|
},
|
|
{
|
|
"entropy": 5.615296936035156,
|
|
"epoch": 0.8103481812876873,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.0004939758400533058,
|
|
"loss": 5.4916,
|
|
"mean_token_accuracy": 0.16295187026262284,
|
|
"num_tokens": 18090026.0,
|
|
"step": 10415
|
|
},
|
|
{
|
|
"entropy": 5.584811973571777,
|
|
"epoch": 0.8107372106594047,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 0.0004939694679511478,
|
|
"loss": 5.3816,
|
|
"mean_token_accuracy": 0.1665487602353096,
|
|
"num_tokens": 18098638.0,
|
|
"step": 10420
|
|
},
|
|
{
|
|
"entropy": 5.580897521972656,
|
|
"epoch": 0.8111262400311223,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.0004939630925264765,
|
|
"loss": 5.4018,
|
|
"mean_token_accuracy": 0.16661616712808608,
|
|
"num_tokens": 18106844.0,
|
|
"step": 10425
|
|
},
|
|
{
|
|
"entropy": 5.543839836120606,
|
|
"epoch": 0.8115152694028399,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.000493956713779389,
|
|
"loss": 5.4096,
|
|
"mean_token_accuracy": 0.16410439163446428,
|
|
"num_tokens": 18114758.0,
|
|
"step": 10430
|
|
},
|
|
{
|
|
"entropy": 5.501433897018432,
|
|
"epoch": 0.8119042987745575,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.0004939503317099817,
|
|
"loss": 5.375,
|
|
"mean_token_accuracy": 0.16939013153314592,
|
|
"num_tokens": 18122839.0,
|
|
"step": 10435
|
|
},
|
|
{
|
|
"entropy": 5.585040616989136,
|
|
"epoch": 0.8122933281462751,
|
|
"grad_norm": 2.078125,
|
|
"learning_rate": 0.0004939439463183517,
|
|
"loss": 5.4855,
|
|
"mean_token_accuracy": 0.16006513983011245,
|
|
"num_tokens": 18131709.0,
|
|
"step": 10440
|
|
},
|
|
{
|
|
"entropy": 5.590785646438599,
|
|
"epoch": 0.8126823575179926,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 0.0004939375576045958,
|
|
"loss": 5.4507,
|
|
"mean_token_accuracy": 0.16072610169649124,
|
|
"num_tokens": 18140334.0,
|
|
"step": 10445
|
|
},
|
|
{
|
|
"entropy": 5.535165596008301,
|
|
"epoch": 0.8130713868897101,
|
|
"grad_norm": 1.59375,
|
|
"learning_rate": 0.0004939311655688109,
|
|
"loss": 5.4314,
|
|
"mean_token_accuracy": 0.16793013066053392,
|
|
"num_tokens": 18148648.0,
|
|
"step": 10450
|
|
},
|
|
{
|
|
"entropy": 5.538791751861572,
|
|
"epoch": 0.8134604162614277,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.0004939247702110941,
|
|
"loss": 5.4273,
|
|
"mean_token_accuracy": 0.16139496266841888,
|
|
"num_tokens": 18156891.0,
|
|
"step": 10455
|
|
},
|
|
{
|
|
"entropy": 5.537261009216309,
|
|
"epoch": 0.8138494456331453,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.0004939183715315423,
|
|
"loss": 5.4021,
|
|
"mean_token_accuracy": 0.167157644033432,
|
|
"num_tokens": 18166512.0,
|
|
"step": 10460
|
|
},
|
|
{
|
|
"entropy": 5.581291580200196,
|
|
"epoch": 0.8142384750048629,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0004939119695302526,
|
|
"loss": 5.3555,
|
|
"mean_token_accuracy": 0.1694805070757866,
|
|
"num_tokens": 18175064.0,
|
|
"step": 10465
|
|
},
|
|
{
|
|
"entropy": 5.59117169380188,
|
|
"epoch": 0.8146275043765804,
|
|
"grad_norm": 1.6015625,
|
|
"learning_rate": 0.0004939055642073224,
|
|
"loss": 5.4883,
|
|
"mean_token_accuracy": 0.16789814084768295,
|
|
"num_tokens": 18184251.0,
|
|
"step": 10470
|
|
},
|
|
{
|
|
"entropy": 5.533836698532104,
|
|
"epoch": 0.815016533748298,
|
|
"grad_norm": 1.4921875,
|
|
"learning_rate": 0.0004938991555628484,
|
|
"loss": 5.3344,
|
|
"mean_token_accuracy": 0.1767840102314949,
|
|
"num_tokens": 18193274.0,
|
|
"step": 10475
|
|
},
|
|
{
|
|
"entropy": 5.535302639007568,
|
|
"epoch": 0.8154055631200156,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.0004938927435969283,
|
|
"loss": 5.3778,
|
|
"mean_token_accuracy": 0.17561944872140883,
|
|
"num_tokens": 18201878.0,
|
|
"step": 10480
|
|
},
|
|
{
|
|
"entropy": 5.502153730392456,
|
|
"epoch": 0.8157945924917331,
|
|
"grad_norm": 1.5,
|
|
"learning_rate": 0.0004938863283096592,
|
|
"loss": 5.345,
|
|
"mean_token_accuracy": 0.17128555178642274,
|
|
"num_tokens": 18210343.0,
|
|
"step": 10485
|
|
},
|
|
{
|
|
"entropy": 5.612079429626465,
|
|
"epoch": 0.8161836218634507,
|
|
"grad_norm": 1.5546875,
|
|
"learning_rate": 0.0004938799097011384,
|
|
"loss": 5.4758,
|
|
"mean_token_accuracy": 0.17280255556106566,
|
|
"num_tokens": 18218599.0,
|
|
"step": 10490
|
|
},
|
|
{
|
|
"entropy": 5.538069152832032,
|
|
"epoch": 0.8165726512351682,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.0004938734877714634,
|
|
"loss": 5.3758,
|
|
"mean_token_accuracy": 0.1752694681286812,
|
|
"num_tokens": 18226384.0,
|
|
"step": 10495
|
|
},
|
|
{
|
|
"entropy": 5.481068897247314,
|
|
"epoch": 0.8169616806068858,
|
|
"grad_norm": 1.5546875,
|
|
"learning_rate": 0.0004938670625207317,
|
|
"loss": 5.3619,
|
|
"mean_token_accuracy": 0.1663648247718811,
|
|
"num_tokens": 18234894.0,
|
|
"step": 10500
|
|
},
|
|
{
|
|
"entropy": 5.564583492279053,
|
|
"epoch": 0.8173507099786034,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 0.0004938606339490406,
|
|
"loss": 5.4119,
|
|
"mean_token_accuracy": 0.16760359108448028,
|
|
"num_tokens": 18243768.0,
|
|
"step": 10505
|
|
},
|
|
{
|
|
"entropy": 5.598694324493408,
|
|
"epoch": 0.817739739350321,
|
|
"grad_norm": 1.53125,
|
|
"learning_rate": 0.0004938542020564877,
|
|
"loss": 5.4365,
|
|
"mean_token_accuracy": 0.1723689153790474,
|
|
"num_tokens": 18252364.0,
|
|
"step": 10510
|
|
},
|
|
{
|
|
"entropy": 5.534125804901123,
|
|
"epoch": 0.8181287687220385,
|
|
"grad_norm": 1.59375,
|
|
"learning_rate": 0.0004938477668431706,
|
|
"loss": 5.3896,
|
|
"mean_token_accuracy": 0.1713106393814087,
|
|
"num_tokens": 18260997.0,
|
|
"step": 10515
|
|
},
|
|
{
|
|
"entropy": 5.676814079284668,
|
|
"epoch": 0.8185177980937561,
|
|
"grad_norm": 1.578125,
|
|
"learning_rate": 0.0004938413283091871,
|
|
"loss": 5.592,
|
|
"mean_token_accuracy": 0.15618581473827362,
|
|
"num_tokens": 18270171.0,
|
|
"step": 10520
|
|
},
|
|
{
|
|
"entropy": 5.628856182098389,
|
|
"epoch": 0.8189068274654736,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.0004938348864546347,
|
|
"loss": 5.43,
|
|
"mean_token_accuracy": 0.16960666179656983,
|
|
"num_tokens": 18278772.0,
|
|
"step": 10525
|
|
},
|
|
{
|
|
"entropy": 5.429003572463989,
|
|
"epoch": 0.8192958568371912,
|
|
"grad_norm": 1.65625,
|
|
"learning_rate": 0.0004938284412796111,
|
|
"loss": 5.2631,
|
|
"mean_token_accuracy": 0.17318774163722991,
|
|
"num_tokens": 18287305.0,
|
|
"step": 10530
|
|
},
|
|
{
|
|
"entropy": 5.520912504196167,
|
|
"epoch": 0.8196848862089088,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 0.0004938219927842144,
|
|
"loss": 5.4826,
|
|
"mean_token_accuracy": 0.15914302319288254,
|
|
"num_tokens": 18296532.0,
|
|
"step": 10535
|
|
},
|
|
{
|
|
"entropy": 5.559760522842407,
|
|
"epoch": 0.8200739155806264,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.0004938155409685422,
|
|
"loss": 5.3533,
|
|
"mean_token_accuracy": 0.17692378908395767,
|
|
"num_tokens": 18304612.0,
|
|
"step": 10540
|
|
},
|
|
{
|
|
"entropy": 5.572201156616211,
|
|
"epoch": 0.820462944952344,
|
|
"grad_norm": 1.5234375,
|
|
"learning_rate": 0.0004938090858326923,
|
|
"loss": 5.4245,
|
|
"mean_token_accuracy": 0.1682295471429825,
|
|
"num_tokens": 18312970.0,
|
|
"step": 10545
|
|
},
|
|
{
|
|
"entropy": 5.616934204101563,
|
|
"epoch": 0.8208519743240614,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 0.000493802627376763,
|
|
"loss": 5.4276,
|
|
"mean_token_accuracy": 0.16691444516181947,
|
|
"num_tokens": 18321073.0,
|
|
"step": 10550
|
|
},
|
|
{
|
|
"entropy": 5.575044441223144,
|
|
"epoch": 0.821241003695779,
|
|
"grad_norm": 1.71875,
|
|
"learning_rate": 0.0004937961656008518,
|
|
"loss": 5.4188,
|
|
"mean_token_accuracy": 0.16600096374750137,
|
|
"num_tokens": 18329960.0,
|
|
"step": 10555
|
|
},
|
|
{
|
|
"entropy": 5.521937656402588,
|
|
"epoch": 0.8216300330674966,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.0004937897005050573,
|
|
"loss": 5.3948,
|
|
"mean_token_accuracy": 0.1701318606734276,
|
|
"num_tokens": 18337935.0,
|
|
"step": 10560
|
|
},
|
|
{
|
|
"entropy": 5.545421028137207,
|
|
"epoch": 0.8220190624392142,
|
|
"grad_norm": 1.53125,
|
|
"learning_rate": 0.0004937832320894772,
|
|
"loss": 5.3868,
|
|
"mean_token_accuracy": 0.16694458872079848,
|
|
"num_tokens": 18347445.0,
|
|
"step": 10565
|
|
},
|
|
{
|
|
"entropy": 5.560770082473755,
|
|
"epoch": 0.8224080918109318,
|
|
"grad_norm": 1.84375,
|
|
"learning_rate": 0.0004937767603542098,
|
|
"loss": 5.3754,
|
|
"mean_token_accuracy": 0.16941318958997725,
|
|
"num_tokens": 18355817.0,
|
|
"step": 10570
|
|
},
|
|
{
|
|
"entropy": 5.620953845977783,
|
|
"epoch": 0.8227971211826492,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.0004937702852993534,
|
|
"loss": 5.3748,
|
|
"mean_token_accuracy": 0.17274976819753646,
|
|
"num_tokens": 18363478.0,
|
|
"step": 10575
|
|
},
|
|
{
|
|
"entropy": 5.548452854156494,
|
|
"epoch": 0.8231861505543668,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.000493763806925006,
|
|
"loss": 5.3751,
|
|
"mean_token_accuracy": 0.16753287017345428,
|
|
"num_tokens": 18371788.0,
|
|
"step": 10580
|
|
},
|
|
{
|
|
"entropy": 5.468597459793091,
|
|
"epoch": 0.8235751799260844,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.0004937573252312661,
|
|
"loss": 5.3883,
|
|
"mean_token_accuracy": 0.16964965760707856,
|
|
"num_tokens": 18380361.0,
|
|
"step": 10585
|
|
},
|
|
{
|
|
"entropy": 5.5768290042877195,
|
|
"epoch": 0.823964209297802,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.000493750840218232,
|
|
"loss": 5.455,
|
|
"mean_token_accuracy": 0.17311280518770217,
|
|
"num_tokens": 18389396.0,
|
|
"step": 10590
|
|
},
|
|
{
|
|
"entropy": 5.583901214599609,
|
|
"epoch": 0.8243532386695196,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.0004937443518860021,
|
|
"loss": 5.5305,
|
|
"mean_token_accuracy": 0.1546028196811676,
|
|
"num_tokens": 18398517.0,
|
|
"step": 10595
|
|
},
|
|
{
|
|
"entropy": 5.654685926437378,
|
|
"epoch": 0.8247422680412371,
|
|
"grad_norm": 1.53125,
|
|
"learning_rate": 0.0004937378602346747,
|
|
"loss": 5.4548,
|
|
"mean_token_accuracy": 0.16782184839248657,
|
|
"num_tokens": 18406620.0,
|
|
"step": 10600
|
|
},
|
|
{
|
|
"entropy": 5.589144134521485,
|
|
"epoch": 0.8251312974129547,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.0004937313652643485,
|
|
"loss": 5.4916,
|
|
"mean_token_accuracy": 0.16066399812698365,
|
|
"num_tokens": 18414849.0,
|
|
"step": 10605
|
|
},
|
|
{
|
|
"entropy": 5.536501550674439,
|
|
"epoch": 0.8255203267846722,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.000493724866975122,
|
|
"loss": 5.4219,
|
|
"mean_token_accuracy": 0.16284872740507125,
|
|
"num_tokens": 18423675.0,
|
|
"step": 10610
|
|
},
|
|
{
|
|
"entropy": 5.605426549911499,
|
|
"epoch": 0.8259093561563898,
|
|
"grad_norm": 1.53125,
|
|
"learning_rate": 0.0004937183653670937,
|
|
"loss": 5.4872,
|
|
"mean_token_accuracy": 0.16344206929206848,
|
|
"num_tokens": 18432848.0,
|
|
"step": 10615
|
|
},
|
|
{
|
|
"entropy": 5.614923477172852,
|
|
"epoch": 0.8262983855281074,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.0004937118604403623,
|
|
"loss": 5.5242,
|
|
"mean_token_accuracy": 0.16344038695096968,
|
|
"num_tokens": 18441210.0,
|
|
"step": 10620
|
|
},
|
|
{
|
|
"entropy": 5.620850515365601,
|
|
"epoch": 0.8266874148998249,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.0004937053521950266,
|
|
"loss": 5.4392,
|
|
"mean_token_accuracy": 0.16228336989879608,
|
|
"num_tokens": 18450084.0,
|
|
"step": 10625
|
|
},
|
|
{
|
|
"entropy": 5.4885618686676025,
|
|
"epoch": 0.8270764442715425,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 0.0004936988406311854,
|
|
"loss": 5.3129,
|
|
"mean_token_accuracy": 0.1663394585251808,
|
|
"num_tokens": 18458329.0,
|
|
"step": 10630
|
|
},
|
|
{
|
|
"entropy": 5.5116783618927006,
|
|
"epoch": 0.8274654736432601,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 0.0004936923257489373,
|
|
"loss": 5.4387,
|
|
"mean_token_accuracy": 0.16123657375574113,
|
|
"num_tokens": 18467518.0,
|
|
"step": 10635
|
|
},
|
|
{
|
|
"entropy": 5.570949697494507,
|
|
"epoch": 0.8278545030149776,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 0.0004936858075483811,
|
|
"loss": 5.3113,
|
|
"mean_token_accuracy": 0.1803199365735054,
|
|
"num_tokens": 18476051.0,
|
|
"step": 10640
|
|
},
|
|
{
|
|
"entropy": 5.551233148574829,
|
|
"epoch": 0.8282435323866952,
|
|
"grad_norm": 1.625,
|
|
"learning_rate": 0.000493679286029616,
|
|
"loss": 5.4194,
|
|
"mean_token_accuracy": 0.17045304626226426,
|
|
"num_tokens": 18484492.0,
|
|
"step": 10645
|
|
},
|
|
{
|
|
"entropy": 5.5319945335388185,
|
|
"epoch": 0.8286325617584127,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 0.0004936727611927407,
|
|
"loss": 5.473,
|
|
"mean_token_accuracy": 0.15831886380910873,
|
|
"num_tokens": 18493759.0,
|
|
"step": 10650
|
|
},
|
|
{
|
|
"entropy": 5.590476083755493,
|
|
"epoch": 0.8290215911301303,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 0.0004936662330378546,
|
|
"loss": 5.3368,
|
|
"mean_token_accuracy": 0.1734246402978897,
|
|
"num_tokens": 18501750.0,
|
|
"step": 10655
|
|
},
|
|
{
|
|
"entropy": 5.475524234771728,
|
|
"epoch": 0.8294106205018479,
|
|
"grad_norm": 1.59375,
|
|
"learning_rate": 0.0004936597015650561,
|
|
"loss": 5.3553,
|
|
"mean_token_accuracy": 0.17020751237869264,
|
|
"num_tokens": 18511003.0,
|
|
"step": 10660
|
|
},
|
|
{
|
|
"entropy": 5.489647436141968,
|
|
"epoch": 0.8297996498735655,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0004936531667744448,
|
|
"loss": 5.4099,
|
|
"mean_token_accuracy": 0.17030000388622285,
|
|
"num_tokens": 18519544.0,
|
|
"step": 10665
|
|
},
|
|
{
|
|
"entropy": 5.677573251724243,
|
|
"epoch": 0.8301886792452831,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 0.0004936466286661197,
|
|
"loss": 5.4954,
|
|
"mean_token_accuracy": 0.16336029171943664,
|
|
"num_tokens": 18528766.0,
|
|
"step": 10670
|
|
},
|
|
{
|
|
"entropy": 5.584993124008179,
|
|
"epoch": 0.8305777086170005,
|
|
"grad_norm": 1.609375,
|
|
"learning_rate": 0.00049364008724018,
|
|
"loss": 5.4935,
|
|
"mean_token_accuracy": 0.16371748298406602,
|
|
"num_tokens": 18538243.0,
|
|
"step": 10675
|
|
},
|
|
{
|
|
"entropy": 5.560536050796509,
|
|
"epoch": 0.8309667379887181,
|
|
"grad_norm": 1.5,
|
|
"learning_rate": 0.000493633542496725,
|
|
"loss": 5.4957,
|
|
"mean_token_accuracy": 0.17018121778964995,
|
|
"num_tokens": 18547028.0,
|
|
"step": 10680
|
|
},
|
|
{
|
|
"entropy": 5.586135339736939,
|
|
"epoch": 0.8313557673604357,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0004936269944358539,
|
|
"loss": 5.5188,
|
|
"mean_token_accuracy": 0.1603980079293251,
|
|
"num_tokens": 18555821.0,
|
|
"step": 10685
|
|
},
|
|
{
|
|
"entropy": 5.549597215652466,
|
|
"epoch": 0.8317447967321533,
|
|
"grad_norm": 1.5390625,
|
|
"learning_rate": 0.0004936204430576664,
|
|
"loss": 5.4773,
|
|
"mean_token_accuracy": 0.1603648066520691,
|
|
"num_tokens": 18564213.0,
|
|
"step": 10690
|
|
},
|
|
{
|
|
"entropy": 5.612131357192993,
|
|
"epoch": 0.8321338261038709,
|
|
"grad_norm": 1.5234375,
|
|
"learning_rate": 0.0004936138883622614,
|
|
"loss": 5.4448,
|
|
"mean_token_accuracy": 0.1611863285303116,
|
|
"num_tokens": 18573132.0,
|
|
"step": 10695
|
|
},
|
|
{
|
|
"entropy": 5.5748532772064205,
|
|
"epoch": 0.8325228554755884,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0004936073303497387,
|
|
"loss": 5.3533,
|
|
"mean_token_accuracy": 0.1693910300731659,
|
|
"num_tokens": 18581131.0,
|
|
"step": 10700
|
|
},
|
|
{
|
|
"entropy": 5.509807825088501,
|
|
"epoch": 0.8329118848473059,
|
|
"grad_norm": 1.609375,
|
|
"learning_rate": 0.0004936007690201976,
|
|
"loss": 5.4532,
|
|
"mean_token_accuracy": 0.16321152448654175,
|
|
"num_tokens": 18589602.0,
|
|
"step": 10705
|
|
},
|
|
{
|
|
"entropy": 5.549233436584473,
|
|
"epoch": 0.8333009142190235,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 0.000493594204373738,
|
|
"loss": 5.4288,
|
|
"mean_token_accuracy": 0.1674068585038185,
|
|
"num_tokens": 18598263.0,
|
|
"step": 10710
|
|
},
|
|
{
|
|
"entropy": 5.5804527759552,
|
|
"epoch": 0.8336899435907411,
|
|
"grad_norm": 1.53125,
|
|
"learning_rate": 0.0004935876364104591,
|
|
"loss": 5.3227,
|
|
"mean_token_accuracy": 0.17426640689373016,
|
|
"num_tokens": 18606432.0,
|
|
"step": 10715
|
|
},
|
|
{
|
|
"entropy": 5.53414306640625,
|
|
"epoch": 0.8340789729624587,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.0004935810651304608,
|
|
"loss": 5.4677,
|
|
"mean_token_accuracy": 0.1617758348584175,
|
|
"num_tokens": 18614769.0,
|
|
"step": 10720
|
|
},
|
|
{
|
|
"entropy": 5.564225721359253,
|
|
"epoch": 0.8344680023341763,
|
|
"grad_norm": 1.8125,
|
|
"learning_rate": 0.0004935744905338427,
|
|
"loss": 5.4331,
|
|
"mean_token_accuracy": 0.1664901629090309,
|
|
"num_tokens": 18623505.0,
|
|
"step": 10725
|
|
},
|
|
{
|
|
"entropy": 5.601116275787353,
|
|
"epoch": 0.8348570317058938,
|
|
"grad_norm": 1.578125,
|
|
"learning_rate": 0.0004935679126207046,
|
|
"loss": 5.3964,
|
|
"mean_token_accuracy": 0.17452556937932967,
|
|
"num_tokens": 18632072.0,
|
|
"step": 10730
|
|
},
|
|
{
|
|
"entropy": 5.630527400970459,
|
|
"epoch": 0.8352460610776113,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.0004935613313911463,
|
|
"loss": 5.4819,
|
|
"mean_token_accuracy": 0.1619068369269371,
|
|
"num_tokens": 18640439.0,
|
|
"step": 10735
|
|
},
|
|
{
|
|
"entropy": 5.531963634490967,
|
|
"epoch": 0.8356350904493289,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 0.0004935547468452678,
|
|
"loss": 5.4606,
|
|
"mean_token_accuracy": 0.1599298372864723,
|
|
"num_tokens": 18649554.0,
|
|
"step": 10740
|
|
},
|
|
{
|
|
"entropy": 5.604838275909424,
|
|
"epoch": 0.8360241198210465,
|
|
"grad_norm": 1.4921875,
|
|
"learning_rate": 0.0004935481589831688,
|
|
"loss": 5.3385,
|
|
"mean_token_accuracy": 0.16614857465028762,
|
|
"num_tokens": 18657918.0,
|
|
"step": 10745
|
|
},
|
|
{
|
|
"entropy": 5.610438251495362,
|
|
"epoch": 0.8364131491927641,
|
|
"grad_norm": 1.5,
|
|
"learning_rate": 0.0004935415678049492,
|
|
"loss": 5.4564,
|
|
"mean_token_accuracy": 0.16079498082399368,
|
|
"num_tokens": 18666735.0,
|
|
"step": 10750
|
|
},
|
|
{
|
|
"entropy": 5.547011137008667,
|
|
"epoch": 0.8368021785644816,
|
|
"grad_norm": 1.796875,
|
|
"learning_rate": 0.0004935349733107094,
|
|
"loss": 5.3454,
|
|
"mean_token_accuracy": 0.16375958770513535,
|
|
"num_tokens": 18674977.0,
|
|
"step": 10755
|
|
},
|
|
{
|
|
"entropy": 5.575332736968994,
|
|
"epoch": 0.8371912079361992,
|
|
"grad_norm": 1.59375,
|
|
"learning_rate": 0.000493528375500549,
|
|
"loss": 5.47,
|
|
"mean_token_accuracy": 0.16258184611797333,
|
|
"num_tokens": 18683624.0,
|
|
"step": 10760
|
|
},
|
|
{
|
|
"entropy": 5.513408184051514,
|
|
"epoch": 0.8375802373079168,
|
|
"grad_norm": 1.9609375,
|
|
"learning_rate": 0.0004935217743745685,
|
|
"loss": 5.3801,
|
|
"mean_token_accuracy": 0.16637008190155028,
|
|
"num_tokens": 18692183.0,
|
|
"step": 10765
|
|
},
|
|
{
|
|
"entropy": 5.62416090965271,
|
|
"epoch": 0.8379692666796343,
|
|
"grad_norm": 1.6328125,
|
|
"learning_rate": 0.0004935151699328677,
|
|
"loss": 5.4675,
|
|
"mean_token_accuracy": 0.1567910671234131,
|
|
"num_tokens": 18700989.0,
|
|
"step": 10770
|
|
},
|
|
{
|
|
"entropy": 5.59164080619812,
|
|
"epoch": 0.8383582960513519,
|
|
"grad_norm": 1.515625,
|
|
"learning_rate": 0.0004935085621755471,
|
|
"loss": 5.3554,
|
|
"mean_token_accuracy": 0.17235667109489441,
|
|
"num_tokens": 18709126.0,
|
|
"step": 10775
|
|
},
|
|
{
|
|
"entropy": 5.612299680709839,
|
|
"epoch": 0.8387473254230694,
|
|
"grad_norm": 1.6484375,
|
|
"learning_rate": 0.000493501951102707,
|
|
"loss": 5.4464,
|
|
"mean_token_accuracy": 0.1676034525036812,
|
|
"num_tokens": 18717378.0,
|
|
"step": 10780
|
|
},
|
|
{
|
|
"entropy": 5.666617584228516,
|
|
"epoch": 0.839136354794787,
|
|
"grad_norm": 1.625,
|
|
"learning_rate": 0.0004934953367144474,
|
|
"loss": 5.5048,
|
|
"mean_token_accuracy": 0.15813286304473878,
|
|
"num_tokens": 18725694.0,
|
|
"step": 10785
|
|
},
|
|
{
|
|
"entropy": 5.540688705444336,
|
|
"epoch": 0.8395253841665046,
|
|
"grad_norm": 1.90625,
|
|
"learning_rate": 0.0004934887190108688,
|
|
"loss": 5.3891,
|
|
"mean_token_accuracy": 0.1703401178121567,
|
|
"num_tokens": 18734737.0,
|
|
"step": 10790
|
|
},
|
|
{
|
|
"entropy": 5.686959600448608,
|
|
"epoch": 0.8399144135382222,
|
|
"grad_norm": 1.546875,
|
|
"learning_rate": 0.0004934820979920719,
|
|
"loss": 5.6315,
|
|
"mean_token_accuracy": 0.15653401017189025,
|
|
"num_tokens": 18743895.0,
|
|
"step": 10795
|
|
},
|
|
{
|
|
"entropy": 5.6683997631073,
|
|
"epoch": 0.8403034429099397,
|
|
"grad_norm": 1.6875,
|
|
"learning_rate": 0.0004934754736581567,
|
|
"loss": 5.4905,
|
|
"mean_token_accuracy": 0.16242460310459136,
|
|
"num_tokens": 18753105.0,
|
|
"step": 10800
|
|
},
|
|
{
|
|
"entropy": 5.5665730953216555,
|
|
"epoch": 0.8406924722816572,
|
|
"grad_norm": 1.578125,
|
|
"learning_rate": 0.000493468846009224,
|
|
"loss": 5.3397,
|
|
"mean_token_accuracy": 0.1671126589179039,
|
|
"num_tokens": 18761593.0,
|
|
"step": 10805
|
|
},
|
|
{
|
|
"entropy": 5.61871075630188,
|
|
"epoch": 0.8410815016533748,
|
|
"grad_norm": 1.5,
|
|
"learning_rate": 0.0004934622150453742,
|
|
"loss": 5.3932,
|
|
"mean_token_accuracy": 0.17331528961658477,
|
|
"num_tokens": 18770105.0,
|
|
"step": 10810
|
|
},
|
|
{
|
|
"entropy": 5.5453849792480465,
|
|
"epoch": 0.8414705310250924,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 0.000493455580766708,
|
|
"loss": 5.4428,
|
|
"mean_token_accuracy": 0.1649451285600662,
|
|
"num_tokens": 18778429.0,
|
|
"step": 10815
|
|
},
|
|
{
|
|
"entropy": 5.63263783454895,
|
|
"epoch": 0.84185956039681,
|
|
"grad_norm": 2.265625,
|
|
"learning_rate": 0.0004934489431733262,
|
|
"loss": 5.4915,
|
|
"mean_token_accuracy": 0.1641908973455429,
|
|
"num_tokens": 18787072.0,
|
|
"step": 10820
|
|
},
|
|
{
|
|
"entropy": 5.556106042861939,
|
|
"epoch": 0.8422485897685276,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.0004934423022653293,
|
|
"loss": 5.3499,
|
|
"mean_token_accuracy": 0.1757698379456997,
|
|
"num_tokens": 18795628.0,
|
|
"step": 10825
|
|
},
|
|
{
|
|
"entropy": 5.561394596099854,
|
|
"epoch": 0.842637619140245,
|
|
"grad_norm": 1.6171875,
|
|
"learning_rate": 0.0004934356580428182,
|
|
"loss": 5.4416,
|
|
"mean_token_accuracy": 0.1657291278243065,
|
|
"num_tokens": 18804313.0,
|
|
"step": 10830
|
|
},
|
|
{
|
|
"entropy": 5.625190877914429,
|
|
"epoch": 0.8430266485119626,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.0004934290105058937,
|
|
"loss": 5.4647,
|
|
"mean_token_accuracy": 0.16012297570705414,
|
|
"num_tokens": 18813170.0,
|
|
"step": 10835
|
|
},
|
|
{
|
|
"entropy": 5.589764499664307,
|
|
"epoch": 0.8434156778836802,
|
|
"grad_norm": 1.6171875,
|
|
"learning_rate": 0.0004934223596546565,
|
|
"loss": 5.3883,
|
|
"mean_token_accuracy": 0.16826024502515793,
|
|
"num_tokens": 18823009.0,
|
|
"step": 10840
|
|
},
|
|
{
|
|
"entropy": 5.556996011734009,
|
|
"epoch": 0.8438047072553978,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.0004934157054892077,
|
|
"loss": 5.4694,
|
|
"mean_token_accuracy": 0.16876722872257233,
|
|
"num_tokens": 18831272.0,
|
|
"step": 10845
|
|
},
|
|
{
|
|
"entropy": 5.554804992675781,
|
|
"epoch": 0.8441937366271154,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.0004934090480096482,
|
|
"loss": 5.4438,
|
|
"mean_token_accuracy": 0.16085582226514816,
|
|
"num_tokens": 18839481.0,
|
|
"step": 10850
|
|
},
|
|
{
|
|
"entropy": 5.566276407241821,
|
|
"epoch": 0.8445827659988329,
|
|
"grad_norm": 1.578125,
|
|
"learning_rate": 0.0004934023872160791,
|
|
"loss": 5.4318,
|
|
"mean_token_accuracy": 0.16860787868499755,
|
|
"num_tokens": 18848586.0,
|
|
"step": 10855
|
|
},
|
|
{
|
|
"entropy": 5.570894002914429,
|
|
"epoch": 0.8449717953705504,
|
|
"grad_norm": 1.5,
|
|
"learning_rate": 0.0004933957231086014,
|
|
"loss": 5.3174,
|
|
"mean_token_accuracy": 0.17001835405826568,
|
|
"num_tokens": 18856948.0,
|
|
"step": 10860
|
|
},
|
|
{
|
|
"entropy": 5.606099796295166,
|
|
"epoch": 0.845360824742268,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 0.0004933890556873161,
|
|
"loss": 5.3896,
|
|
"mean_token_accuracy": 0.1649198979139328,
|
|
"num_tokens": 18864741.0,
|
|
"step": 10865
|
|
},
|
|
{
|
|
"entropy": 5.58132529258728,
|
|
"epoch": 0.8457498541139856,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.0004933823849523246,
|
|
"loss": 5.4677,
|
|
"mean_token_accuracy": 0.16213586181402206,
|
|
"num_tokens": 18873373.0,
|
|
"step": 10870
|
|
},
|
|
{
|
|
"entropy": 5.61713399887085,
|
|
"epoch": 0.8461388834857032,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.0004933757109037279,
|
|
"loss": 5.3303,
|
|
"mean_token_accuracy": 0.17016200125217437,
|
|
"num_tokens": 18881590.0,
|
|
"step": 10875
|
|
},
|
|
{
|
|
"entropy": 5.572556591033935,
|
|
"epoch": 0.8465279128574207,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.0004933690335416274,
|
|
"loss": 5.4305,
|
|
"mean_token_accuracy": 0.1637813627719879,
|
|
"num_tokens": 18889838.0,
|
|
"step": 10880
|
|
},
|
|
{
|
|
"entropy": 5.552700185775757,
|
|
"epoch": 0.8469169422291383,
|
|
"grad_norm": 1.5,
|
|
"learning_rate": 0.0004933623528661245,
|
|
"loss": 5.3441,
|
|
"mean_token_accuracy": 0.17247612923383712,
|
|
"num_tokens": 18898577.0,
|
|
"step": 10885
|
|
},
|
|
{
|
|
"entropy": 5.6202739715576175,
|
|
"epoch": 0.8473059716008559,
|
|
"grad_norm": 1.5546875,
|
|
"learning_rate": 0.0004933556688773203,
|
|
"loss": 5.4885,
|
|
"mean_token_accuracy": 0.16694238036870956,
|
|
"num_tokens": 18907309.0,
|
|
"step": 10890
|
|
},
|
|
{
|
|
"entropy": 5.621315288543701,
|
|
"epoch": 0.8476950009725734,
|
|
"grad_norm": 1.5078125,
|
|
"learning_rate": 0.0004933489815753165,
|
|
"loss": 5.4106,
|
|
"mean_token_accuracy": 0.16841107606887817,
|
|
"num_tokens": 18915956.0,
|
|
"step": 10895
|
|
},
|
|
{
|
|
"entropy": 5.52905044555664,
|
|
"epoch": 0.848084030344291,
|
|
"grad_norm": 1.546875,
|
|
"learning_rate": 0.0004933422909602143,
|
|
"loss": 5.509,
|
|
"mean_token_accuracy": 0.1620262160897255,
|
|
"num_tokens": 18924603.0,
|
|
"step": 10900
|
|
},
|
|
{
|
|
"entropy": 5.549146223068237,
|
|
"epoch": 0.8484730597160085,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.0004933355970321155,
|
|
"loss": 5.4007,
|
|
"mean_token_accuracy": 0.17655430734157562,
|
|
"num_tokens": 18933231.0,
|
|
"step": 10905
|
|
},
|
|
{
|
|
"entropy": 5.68997106552124,
|
|
"epoch": 0.8488620890877261,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.0004933288997911215,
|
|
"loss": 5.5174,
|
|
"mean_token_accuracy": 0.1586891695857048,
|
|
"num_tokens": 18942172.0,
|
|
"step": 10910
|
|
},
|
|
{
|
|
"entropy": 5.596334505081177,
|
|
"epoch": 0.8492511184594437,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.0004933221992373338,
|
|
"loss": 5.4538,
|
|
"mean_token_accuracy": 0.16567957848310472,
|
|
"num_tokens": 18951440.0,
|
|
"step": 10915
|
|
},
|
|
{
|
|
"entropy": 5.5552136421203615,
|
|
"epoch": 0.8496401478311613,
|
|
"grad_norm": 1.5390625,
|
|
"learning_rate": 0.0004933154953708544,
|
|
"loss": 5.4197,
|
|
"mean_token_accuracy": 0.16126616001129152,
|
|
"num_tokens": 18959797.0,
|
|
"step": 10920
|
|
},
|
|
{
|
|
"entropy": 5.599853754043579,
|
|
"epoch": 0.8500291772028788,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.0004933087881917848,
|
|
"loss": 5.4249,
|
|
"mean_token_accuracy": 0.16775873452425002,
|
|
"num_tokens": 18968811.0,
|
|
"step": 10925
|
|
},
|
|
{
|
|
"entropy": 5.6504920482635494,
|
|
"epoch": 0.8504182065745964,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.0004933020777002268,
|
|
"loss": 5.5465,
|
|
"mean_token_accuracy": 0.15841249078512193,
|
|
"num_tokens": 18977467.0,
|
|
"step": 10930
|
|
},
|
|
{
|
|
"entropy": 5.6737282276153564,
|
|
"epoch": 0.8508072359463139,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0004932953638962823,
|
|
"loss": 5.4403,
|
|
"mean_token_accuracy": 0.1651856020092964,
|
|
"num_tokens": 18985760.0,
|
|
"step": 10935
|
|
},
|
|
{
|
|
"entropy": 5.699455785751343,
|
|
"epoch": 0.8511962653180315,
|
|
"grad_norm": 1.6015625,
|
|
"learning_rate": 0.000493288646780053,
|
|
"loss": 5.4834,
|
|
"mean_token_accuracy": 0.15546912103891372,
|
|
"num_tokens": 18993812.0,
|
|
"step": 10940
|
|
},
|
|
{
|
|
"entropy": 5.575416231155396,
|
|
"epoch": 0.8515852946897491,
|
|
"grad_norm": 1.5078125,
|
|
"learning_rate": 0.0004932819263516409,
|
|
"loss": 5.4917,
|
|
"mean_token_accuracy": 0.1625030368566513,
|
|
"num_tokens": 19003056.0,
|
|
"step": 10945
|
|
},
|
|
{
|
|
"entropy": 5.675415563583374,
|
|
"epoch": 0.8519743240614667,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0004932752026111481,
|
|
"loss": 5.4705,
|
|
"mean_token_accuracy": 0.1690106511116028,
|
|
"num_tokens": 19011533.0,
|
|
"step": 10950
|
|
},
|
|
{
|
|
"entropy": 5.6119842529296875,
|
|
"epoch": 0.8523633534331843,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.0004932684755586765,
|
|
"loss": 5.42,
|
|
"mean_token_accuracy": 0.1668616071343422,
|
|
"num_tokens": 19020773.0,
|
|
"step": 10955
|
|
},
|
|
{
|
|
"entropy": 5.564594173431397,
|
|
"epoch": 0.8527523828049017,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.0004932617451943282,
|
|
"loss": 5.4341,
|
|
"mean_token_accuracy": 0.1613341137766838,
|
|
"num_tokens": 19029809.0,
|
|
"step": 10960
|
|
},
|
|
{
|
|
"entropy": 5.583635759353638,
|
|
"epoch": 0.8531414121766193,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.0004932550115182053,
|
|
"loss": 5.3734,
|
|
"mean_token_accuracy": 0.1697031795978546,
|
|
"num_tokens": 19038875.0,
|
|
"step": 10965
|
|
},
|
|
{
|
|
"entropy": 5.671226453781128,
|
|
"epoch": 0.8535304415483369,
|
|
"grad_norm": 1.6015625,
|
|
"learning_rate": 0.00049324827453041,
|
|
"loss": 5.4619,
|
|
"mean_token_accuracy": 0.17031318098306655,
|
|
"num_tokens": 19047273.0,
|
|
"step": 10970
|
|
},
|
|
{
|
|
"entropy": 5.5258331298828125,
|
|
"epoch": 0.8539194709200545,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0004932415342310446,
|
|
"loss": 5.3956,
|
|
"mean_token_accuracy": 0.16772737354040146,
|
|
"num_tokens": 19056309.0,
|
|
"step": 10975
|
|
},
|
|
{
|
|
"entropy": 5.553267145156861,
|
|
"epoch": 0.8543085002917721,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.0004932347906202111,
|
|
"loss": 5.3658,
|
|
"mean_token_accuracy": 0.16715893745422364,
|
|
"num_tokens": 19064487.0,
|
|
"step": 10980
|
|
},
|
|
{
|
|
"entropy": 5.586594200134277,
|
|
"epoch": 0.8546975296634896,
|
|
"grad_norm": 1.6796875,
|
|
"learning_rate": 0.000493228043698012,
|
|
"loss": 5.5889,
|
|
"mean_token_accuracy": 0.16258976012468337,
|
|
"num_tokens": 19073431.0,
|
|
"step": 10985
|
|
},
|
|
{
|
|
"entropy": 5.582021570205688,
|
|
"epoch": 0.8550865590352071,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.0004932212934645498,
|
|
"loss": 5.4556,
|
|
"mean_token_accuracy": 0.16721367686986924,
|
|
"num_tokens": 19081648.0,
|
|
"step": 10990
|
|
},
|
|
{
|
|
"entropy": 5.525068902969361,
|
|
"epoch": 0.8554755884069247,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.0004932145399199268,
|
|
"loss": 5.3542,
|
|
"mean_token_accuracy": 0.1711691588163376,
|
|
"num_tokens": 19090581.0,
|
|
"step": 10995
|
|
},
|
|
{
|
|
"entropy": 5.61999740600586,
|
|
"epoch": 0.8558646177786423,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 0.0004932077830642455,
|
|
"loss": 5.4745,
|
|
"mean_token_accuracy": 0.16335834115743636,
|
|
"num_tokens": 19098924.0,
|
|
"step": 11000
|
|
},
|
|
{
|
|
"entropy": 5.644947862625122,
|
|
"epoch": 0.8562536471503599,
|
|
"grad_norm": 1.5390625,
|
|
"learning_rate": 0.0004932010228976084,
|
|
"loss": 5.4515,
|
|
"mean_token_accuracy": 0.1678395614027977,
|
|
"num_tokens": 19108267.0,
|
|
"step": 11005
|
|
},
|
|
{
|
|
"entropy": 5.682941675186157,
|
|
"epoch": 0.8566426765220774,
|
|
"grad_norm": 1.59375,
|
|
"learning_rate": 0.000493194259420118,
|
|
"loss": 5.474,
|
|
"mean_token_accuracy": 0.1619163230061531,
|
|
"num_tokens": 19117158.0,
|
|
"step": 11010
|
|
},
|
|
{
|
|
"entropy": 5.562949085235596,
|
|
"epoch": 0.857031705893795,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.000493187492631877,
|
|
"loss": 5.4514,
|
|
"mean_token_accuracy": 0.1655110687017441,
|
|
"num_tokens": 19126013.0,
|
|
"step": 11015
|
|
},
|
|
{
|
|
"entropy": 5.472146654129029,
|
|
"epoch": 0.8574207352655125,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.0004931807225329882,
|
|
"loss": 5.3822,
|
|
"mean_token_accuracy": 0.16488017737865449,
|
|
"num_tokens": 19134655.0,
|
|
"step": 11020
|
|
},
|
|
{
|
|
"entropy": 5.53136248588562,
|
|
"epoch": 0.8578097646372301,
|
|
"grad_norm": 1.5625,
|
|
"learning_rate": 0.0004931739491235541,
|
|
"loss": 5.2834,
|
|
"mean_token_accuracy": 0.16555664390325547,
|
|
"num_tokens": 19143311.0,
|
|
"step": 11025
|
|
},
|
|
{
|
|
"entropy": 5.59962477684021,
|
|
"epoch": 0.8581987940089477,
|
|
"grad_norm": 1.5390625,
|
|
"learning_rate": 0.0004931671724036777,
|
|
"loss": 5.4432,
|
|
"mean_token_accuracy": 0.17099899649620057,
|
|
"num_tokens": 19152422.0,
|
|
"step": 11030
|
|
},
|
|
{
|
|
"entropy": 5.610012149810791,
|
|
"epoch": 0.8585878233806652,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0004931603923734616,
|
|
"loss": 5.5176,
|
|
"mean_token_accuracy": 0.1600009486079216,
|
|
"num_tokens": 19161510.0,
|
|
"step": 11035
|
|
},
|
|
{
|
|
"entropy": 5.564943170547485,
|
|
"epoch": 0.8589768527523828,
|
|
"grad_norm": 2.203125,
|
|
"learning_rate": 0.0004931536090330088,
|
|
"loss": 5.3544,
|
|
"mean_token_accuracy": 0.16602486968040467,
|
|
"num_tokens": 19170097.0,
|
|
"step": 11040
|
|
},
|
|
{
|
|
"entropy": 5.5572069644927975,
|
|
"epoch": 0.8593658821241004,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.0004931468223824222,
|
|
"loss": 5.4032,
|
|
"mean_token_accuracy": 0.17011643052101136,
|
|
"num_tokens": 19179131.0,
|
|
"step": 11045
|
|
},
|
|
{
|
|
"entropy": 5.516173696517944,
|
|
"epoch": 0.859754911495818,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.0004931400324218048,
|
|
"loss": 5.3104,
|
|
"mean_token_accuracy": 0.1758366346359253,
|
|
"num_tokens": 19187289.0,
|
|
"step": 11050
|
|
},
|
|
{
|
|
"entropy": 5.546682739257813,
|
|
"epoch": 0.8601439408675355,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0004931332391512597,
|
|
"loss": 5.4245,
|
|
"mean_token_accuracy": 0.16874566525220872,
|
|
"num_tokens": 19195746.0,
|
|
"step": 11055
|
|
},
|
|
{
|
|
"entropy": 5.655080127716064,
|
|
"epoch": 0.860532970239253,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.0004931264425708897,
|
|
"loss": 5.4413,
|
|
"mean_token_accuracy": 0.16570912301540375,
|
|
"num_tokens": 19204683.0,
|
|
"step": 11060
|
|
},
|
|
{
|
|
"entropy": 5.5210959911346436,
|
|
"epoch": 0.8609219996109706,
|
|
"grad_norm": 1.6640625,
|
|
"learning_rate": 0.0004931196426807983,
|
|
"loss": 5.3469,
|
|
"mean_token_accuracy": 0.161997252702713,
|
|
"num_tokens": 19213405.0,
|
|
"step": 11065
|
|
},
|
|
{
|
|
"entropy": 5.59285044670105,
|
|
"epoch": 0.8613110289826882,
|
|
"grad_norm": 1.75,
|
|
"learning_rate": 0.0004931128394810884,
|
|
"loss": 5.4458,
|
|
"mean_token_accuracy": 0.1710154190659523,
|
|
"num_tokens": 19222717.0,
|
|
"step": 11070
|
|
},
|
|
{
|
|
"entropy": 5.631794214248657,
|
|
"epoch": 0.8617000583544058,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.0004931060329718634,
|
|
"loss": 5.4567,
|
|
"mean_token_accuracy": 0.16193218156695366,
|
|
"num_tokens": 19230688.0,
|
|
"step": 11075
|
|
},
|
|
{
|
|
"entropy": 5.588335084915161,
|
|
"epoch": 0.8620890877261234,
|
|
"grad_norm": 1.578125,
|
|
"learning_rate": 0.0004930992231532265,
|
|
"loss": 5.5275,
|
|
"mean_token_accuracy": 0.15564640313386918,
|
|
"num_tokens": 19239192.0,
|
|
"step": 11080
|
|
},
|
|
{
|
|
"entropy": 5.626792526245117,
|
|
"epoch": 0.8624781170978408,
|
|
"grad_norm": 1.5625,
|
|
"learning_rate": 0.000493092410025281,
|
|
"loss": 5.5153,
|
|
"mean_token_accuracy": 0.15964918583631516,
|
|
"num_tokens": 19247903.0,
|
|
"step": 11085
|
|
},
|
|
{
|
|
"entropy": 5.606396007537842,
|
|
"epoch": 0.8628671464695584,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.0004930855935881302,
|
|
"loss": 5.4354,
|
|
"mean_token_accuracy": 0.16549526304006576,
|
|
"num_tokens": 19256127.0,
|
|
"step": 11090
|
|
},
|
|
{
|
|
"entropy": 5.5886890411376955,
|
|
"epoch": 0.863256175841276,
|
|
"grad_norm": 1.7421875,
|
|
"learning_rate": 0.0004930787738418777,
|
|
"loss": 5.3995,
|
|
"mean_token_accuracy": 0.169436477124691,
|
|
"num_tokens": 19264742.0,
|
|
"step": 11095
|
|
},
|
|
{
|
|
"entropy": 5.527159881591797,
|
|
"epoch": 0.8636452052129936,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.0004930719507866269,
|
|
"loss": 5.3727,
|
|
"mean_token_accuracy": 0.16563803404569627,
|
|
"num_tokens": 19273618.0,
|
|
"step": 11100
|
|
},
|
|
{
|
|
"entropy": 5.600240278244018,
|
|
"epoch": 0.8640342345847112,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.0004930651244224814,
|
|
"loss": 5.4219,
|
|
"mean_token_accuracy": 0.17024289220571517,
|
|
"num_tokens": 19281792.0,
|
|
"step": 11105
|
|
},
|
|
{
|
|
"entropy": 5.496180438995362,
|
|
"epoch": 0.8644232639564287,
|
|
"grad_norm": 1.625,
|
|
"learning_rate": 0.0004930582947495448,
|
|
"loss": 5.3852,
|
|
"mean_token_accuracy": 0.16692871898412703,
|
|
"num_tokens": 19289738.0,
|
|
"step": 11110
|
|
},
|
|
{
|
|
"entropy": 5.615656518936158,
|
|
"epoch": 0.8648122933281462,
|
|
"grad_norm": 2.0,
|
|
"learning_rate": 0.0004930514617679206,
|
|
"loss": 5.3839,
|
|
"mean_token_accuracy": 0.1686216786503792,
|
|
"num_tokens": 19298711.0,
|
|
"step": 11115
|
|
},
|
|
{
|
|
"entropy": 5.685328626632691,
|
|
"epoch": 0.8652013226998638,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.0004930446254777125,
|
|
"loss": 5.4913,
|
|
"mean_token_accuracy": 0.16433748751878738,
|
|
"num_tokens": 19307435.0,
|
|
"step": 11120
|
|
},
|
|
{
|
|
"entropy": 5.538598823547363,
|
|
"epoch": 0.8655903520715814,
|
|
"grad_norm": 1.5546875,
|
|
"learning_rate": 0.0004930377858790242,
|
|
"loss": 5.3596,
|
|
"mean_token_accuracy": 0.16777653396129608,
|
|
"num_tokens": 19315327.0,
|
|
"step": 11125
|
|
},
|
|
{
|
|
"entropy": 5.532667636871338,
|
|
"epoch": 0.865979381443299,
|
|
"grad_norm": 2.03125,
|
|
"learning_rate": 0.0004930309429719595,
|
|
"loss": 5.3183,
|
|
"mean_token_accuracy": 0.17217909991741182,
|
|
"num_tokens": 19323261.0,
|
|
"step": 11130
|
|
},
|
|
{
|
|
"entropy": 5.463712978363037,
|
|
"epoch": 0.8663684108150166,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.0004930240967566224,
|
|
"loss": 5.3019,
|
|
"mean_token_accuracy": 0.16938008815050126,
|
|
"num_tokens": 19332297.0,
|
|
"step": 11135
|
|
},
|
|
{
|
|
"entropy": 5.497597551345825,
|
|
"epoch": 0.8667574401867341,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.0004930172472331167,
|
|
"loss": 5.3095,
|
|
"mean_token_accuracy": 0.17312744557857512,
|
|
"num_tokens": 19340848.0,
|
|
"step": 11140
|
|
},
|
|
{
|
|
"entropy": 5.491792011260986,
|
|
"epoch": 0.8671464695584516,
|
|
"grad_norm": 1.5546875,
|
|
"learning_rate": 0.0004930103944015463,
|
|
"loss": 5.3774,
|
|
"mean_token_accuracy": 0.17115949243307113,
|
|
"num_tokens": 19349072.0,
|
|
"step": 11145
|
|
},
|
|
{
|
|
"entropy": 5.619730997085571,
|
|
"epoch": 0.8675354989301692,
|
|
"grad_norm": 1.65625,
|
|
"learning_rate": 0.0004930035382620149,
|
|
"loss": 5.4234,
|
|
"mean_token_accuracy": 0.16752508133649827,
|
|
"num_tokens": 19357723.0,
|
|
"step": 11150
|
|
},
|
|
{
|
|
"entropy": 5.5437096118927,
|
|
"epoch": 0.8679245283018868,
|
|
"grad_norm": 1.53125,
|
|
"learning_rate": 0.000492996678814627,
|
|
"loss": 5.3466,
|
|
"mean_token_accuracy": 0.17316702455282212,
|
|
"num_tokens": 19365925.0,
|
|
"step": 11155
|
|
},
|
|
{
|
|
"entropy": 5.5340173721313475,
|
|
"epoch": 0.8683135576736044,
|
|
"grad_norm": 1.5078125,
|
|
"learning_rate": 0.0004929898160594865,
|
|
"loss": 5.3943,
|
|
"mean_token_accuracy": 0.17101194709539413,
|
|
"num_tokens": 19374190.0,
|
|
"step": 11160
|
|
},
|
|
{
|
|
"entropy": 5.523618936538696,
|
|
"epoch": 0.8687025870453219,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.0004929829499966974,
|
|
"loss": 5.4004,
|
|
"mean_token_accuracy": 0.1685847282409668,
|
|
"num_tokens": 19382375.0,
|
|
"step": 11165
|
|
},
|
|
{
|
|
"entropy": 5.642296648025512,
|
|
"epoch": 0.8690916164170395,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.0004929760806263641,
|
|
"loss": 5.4571,
|
|
"mean_token_accuracy": 0.1682697132229805,
|
|
"num_tokens": 19390191.0,
|
|
"step": 11170
|
|
},
|
|
{
|
|
"entropy": 5.535978174209594,
|
|
"epoch": 0.8694806457887571,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.0004929692079485906,
|
|
"loss": 5.2604,
|
|
"mean_token_accuracy": 0.1755853533744812,
|
|
"num_tokens": 19399401.0,
|
|
"step": 11175
|
|
},
|
|
{
|
|
"entropy": 5.490648174285889,
|
|
"epoch": 0.8698696751604746,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0004929623319634814,
|
|
"loss": 5.3516,
|
|
"mean_token_accuracy": 0.17433520257472992,
|
|
"num_tokens": 19407956.0,
|
|
"step": 11180
|
|
},
|
|
{
|
|
"entropy": 5.560776090621948,
|
|
"epoch": 0.8702587045321922,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 0.0004929554526711407,
|
|
"loss": 5.5159,
|
|
"mean_token_accuracy": 0.1625481054186821,
|
|
"num_tokens": 19416432.0,
|
|
"step": 11185
|
|
},
|
|
{
|
|
"entropy": 5.53424391746521,
|
|
"epoch": 0.8706477339039097,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.0004929485700716729,
|
|
"loss": 5.3581,
|
|
"mean_token_accuracy": 0.17236267030239105,
|
|
"num_tokens": 19425208.0,
|
|
"step": 11190
|
|
},
|
|
{
|
|
"entropy": 5.638381767272949,
|
|
"epoch": 0.8710367632756273,
|
|
"grad_norm": 1.546875,
|
|
"learning_rate": 0.0004929416841651824,
|
|
"loss": 5.5035,
|
|
"mean_token_accuracy": 0.1660827562212944,
|
|
"num_tokens": 19434169.0,
|
|
"step": 11195
|
|
},
|
|
{
|
|
"entropy": 5.557585287094116,
|
|
"epoch": 0.8714257926473449,
|
|
"grad_norm": 1.53125,
|
|
"learning_rate": 0.0004929347949517739,
|
|
"loss": 5.2829,
|
|
"mean_token_accuracy": 0.17812299728393555,
|
|
"num_tokens": 19443484.0,
|
|
"step": 11200
|
|
},
|
|
{
|
|
"entropy": 5.512750053405762,
|
|
"epoch": 0.8718148220190625,
|
|
"grad_norm": 1.5390625,
|
|
"learning_rate": 0.0004929279024315516,
|
|
"loss": 5.4249,
|
|
"mean_token_accuracy": 0.1689809814095497,
|
|
"num_tokens": 19452193.0,
|
|
"step": 11205
|
|
},
|
|
{
|
|
"entropy": 5.690864896774292,
|
|
"epoch": 0.87220385139078,
|
|
"grad_norm": 1.703125,
|
|
"learning_rate": 0.0004929210066046204,
|
|
"loss": 5.5427,
|
|
"mean_token_accuracy": 0.15889561772346497,
|
|
"num_tokens": 19460684.0,
|
|
"step": 11210
|
|
},
|
|
{
|
|
"entropy": 5.573667192459107,
|
|
"epoch": 0.8725928807624975,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.0004929141074710847,
|
|
"loss": 5.3649,
|
|
"mean_token_accuracy": 0.17416849881410598,
|
|
"num_tokens": 19469206.0,
|
|
"step": 11215
|
|
},
|
|
{
|
|
"entropy": 5.50807204246521,
|
|
"epoch": 0.8729819101342151,
|
|
"grad_norm": 1.9296875,
|
|
"learning_rate": 0.0004929072050310491,
|
|
"loss": 5.4212,
|
|
"mean_token_accuracy": 0.1704845279455185,
|
|
"num_tokens": 19477514.0,
|
|
"step": 11220
|
|
},
|
|
{
|
|
"entropy": 5.556146144866943,
|
|
"epoch": 0.8733709395059327,
|
|
"grad_norm": 1.78125,
|
|
"learning_rate": 0.0004929002992846188,
|
|
"loss": 5.4844,
|
|
"mean_token_accuracy": 0.16183665692806243,
|
|
"num_tokens": 19486792.0,
|
|
"step": 11225
|
|
},
|
|
{
|
|
"entropy": 5.597028732299805,
|
|
"epoch": 0.8737599688776503,
|
|
"grad_norm": 1.609375,
|
|
"learning_rate": 0.0004928933902318981,
|
|
"loss": 5.4356,
|
|
"mean_token_accuracy": 0.17462601214647294,
|
|
"num_tokens": 19495708.0,
|
|
"step": 11230
|
|
},
|
|
{
|
|
"entropy": 5.658380556106567,
|
|
"epoch": 0.8741489982493679,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.000492886477872992,
|
|
"loss": 5.5828,
|
|
"mean_token_accuracy": 0.15301429033279418,
|
|
"num_tokens": 19505063.0,
|
|
"step": 11235
|
|
},
|
|
{
|
|
"entropy": 5.648887681961059,
|
|
"epoch": 0.8745380276210853,
|
|
"grad_norm": 1.625,
|
|
"learning_rate": 0.0004928795622080054,
|
|
"loss": 5.4971,
|
|
"mean_token_accuracy": 0.16162820905447006,
|
|
"num_tokens": 19514641.0,
|
|
"step": 11240
|
|
},
|
|
{
|
|
"entropy": 5.583265590667724,
|
|
"epoch": 0.8749270569928029,
|
|
"grad_norm": 1.5,
|
|
"learning_rate": 0.0004928726432370434,
|
|
"loss": 5.3864,
|
|
"mean_token_accuracy": 0.1669035166501999,
|
|
"num_tokens": 19523136.0,
|
|
"step": 11245
|
|
},
|
|
{
|
|
"entropy": 5.519823598861694,
|
|
"epoch": 0.8753160863645205,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.0004928657209602107,
|
|
"loss": 5.2883,
|
|
"mean_token_accuracy": 0.1751377359032631,
|
|
"num_tokens": 19532258.0,
|
|
"step": 11250
|
|
},
|
|
{
|
|
"entropy": 5.580462884902954,
|
|
"epoch": 0.8757051157362381,
|
|
"grad_norm": 1.53125,
|
|
"learning_rate": 0.0004928587953776125,
|
|
"loss": 5.5305,
|
|
"mean_token_accuracy": 0.16641346961259842,
|
|
"num_tokens": 19541235.0,
|
|
"step": 11255
|
|
},
|
|
{
|
|
"entropy": 5.605775976181031,
|
|
"epoch": 0.8760941451079557,
|
|
"grad_norm": 1.6328125,
|
|
"learning_rate": 0.0004928518664893538,
|
|
"loss": 5.4458,
|
|
"mean_token_accuracy": 0.16409534588456154,
|
|
"num_tokens": 19550259.0,
|
|
"step": 11260
|
|
},
|
|
{
|
|
"entropy": 5.615903568267822,
|
|
"epoch": 0.8764831744796732,
|
|
"grad_norm": 1.5234375,
|
|
"learning_rate": 0.0004928449342955397,
|
|
"loss": 5.4358,
|
|
"mean_token_accuracy": 0.16389891356229783,
|
|
"num_tokens": 19558500.0,
|
|
"step": 11265
|
|
},
|
|
{
|
|
"entropy": 5.5283490180969235,
|
|
"epoch": 0.8768722038513908,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 0.0004928379987962756,
|
|
"loss": 5.3741,
|
|
"mean_token_accuracy": 0.16884355247020721,
|
|
"num_tokens": 19566562.0,
|
|
"step": 11270
|
|
},
|
|
{
|
|
"entropy": 5.515049266815185,
|
|
"epoch": 0.8772612332231083,
|
|
"grad_norm": 1.4921875,
|
|
"learning_rate": 0.0004928310599916666,
|
|
"loss": 5.3853,
|
|
"mean_token_accuracy": 0.16551622450351716,
|
|
"num_tokens": 19575219.0,
|
|
"step": 11275
|
|
},
|
|
{
|
|
"entropy": 5.4597554206848145,
|
|
"epoch": 0.8776502625948259,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 0.0004928241178818178,
|
|
"loss": 5.3257,
|
|
"mean_token_accuracy": 0.1707369640469551,
|
|
"num_tokens": 19584311.0,
|
|
"step": 11280
|
|
},
|
|
{
|
|
"entropy": 5.578729295730591,
|
|
"epoch": 0.8780392919665435,
|
|
"grad_norm": 1.75,
|
|
"learning_rate": 0.0004928171724668349,
|
|
"loss": 5.4742,
|
|
"mean_token_accuracy": 0.15891241580247878,
|
|
"num_tokens": 19593802.0,
|
|
"step": 11285
|
|
},
|
|
{
|
|
"entropy": 5.596161842346191,
|
|
"epoch": 0.878428321338261,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0004928102237468229,
|
|
"loss": 5.4382,
|
|
"mean_token_accuracy": 0.16021957099437714,
|
|
"num_tokens": 19603046.0,
|
|
"step": 11290
|
|
},
|
|
{
|
|
"entropy": 5.477987575531006,
|
|
"epoch": 0.8788173507099786,
|
|
"grad_norm": 1.5234375,
|
|
"learning_rate": 0.0004928032717218876,
|
|
"loss": 5.327,
|
|
"mean_token_accuracy": 0.17128750383853913,
|
|
"num_tokens": 19611609.0,
|
|
"step": 11295
|
|
},
|
|
{
|
|
"entropy": 5.535358715057373,
|
|
"epoch": 0.8792063800816962,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 0.0004927963163921343,
|
|
"loss": 5.3174,
|
|
"mean_token_accuracy": 0.1724611461162567,
|
|
"num_tokens": 19619380.0,
|
|
"step": 11300
|
|
},
|
|
{
|
|
"entropy": 5.660423040390015,
|
|
"epoch": 0.8795954094534137,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.0004927893577576685,
|
|
"loss": 5.5158,
|
|
"mean_token_accuracy": 0.16152099370956421,
|
|
"num_tokens": 19628336.0,
|
|
"step": 11305
|
|
},
|
|
{
|
|
"entropy": 5.550154733657837,
|
|
"epoch": 0.8799844388251313,
|
|
"grad_norm": 1.625,
|
|
"learning_rate": 0.0004927823958185959,
|
|
"loss": 5.4772,
|
|
"mean_token_accuracy": 0.1703892767429352,
|
|
"num_tokens": 19637888.0,
|
|
"step": 11310
|
|
},
|
|
{
|
|
"entropy": 5.52217116355896,
|
|
"epoch": 0.8803734681968488,
|
|
"grad_norm": 1.6015625,
|
|
"learning_rate": 0.000492775430575022,
|
|
"loss": 5.3769,
|
|
"mean_token_accuracy": 0.1711402118206024,
|
|
"num_tokens": 19646123.0,
|
|
"step": 11315
|
|
},
|
|
{
|
|
"entropy": 5.553801441192627,
|
|
"epoch": 0.8807624975685664,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 0.0004927684620270527,
|
|
"loss": 5.3806,
|
|
"mean_token_accuracy": 0.1713252618908882,
|
|
"num_tokens": 19655264.0,
|
|
"step": 11320
|
|
},
|
|
{
|
|
"entropy": 5.659976005554199,
|
|
"epoch": 0.881151526940284,
|
|
"grad_norm": 1.546875,
|
|
"learning_rate": 0.0004927614901747935,
|
|
"loss": 5.5008,
|
|
"mean_token_accuracy": 0.15829492807388307,
|
|
"num_tokens": 19663594.0,
|
|
"step": 11325
|
|
},
|
|
{
|
|
"entropy": 5.603869247436523,
|
|
"epoch": 0.8815405563120016,
|
|
"grad_norm": 1.625,
|
|
"learning_rate": 0.0004927545150183503,
|
|
"loss": 5.4514,
|
|
"mean_token_accuracy": 0.16312796175479888,
|
|
"num_tokens": 19671515.0,
|
|
"step": 11330
|
|
},
|
|
{
|
|
"entropy": 5.527267026901245,
|
|
"epoch": 0.8819295856837192,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.000492747536557829,
|
|
"loss": 5.3052,
|
|
"mean_token_accuracy": 0.17422009855508805,
|
|
"num_tokens": 19680288.0,
|
|
"step": 11335
|
|
},
|
|
{
|
|
"entropy": 5.521861791610718,
|
|
"epoch": 0.8823186150554367,
|
|
"grad_norm": 1.5625,
|
|
"learning_rate": 0.0004927405547933353,
|
|
"loss": 5.3426,
|
|
"mean_token_accuracy": 0.1709321469068527,
|
|
"num_tokens": 19688717.0,
|
|
"step": 11340
|
|
},
|
|
{
|
|
"entropy": 5.479914283752441,
|
|
"epoch": 0.8827076444271542,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 0.0004927335697249753,
|
|
"loss": 5.2918,
|
|
"mean_token_accuracy": 0.17452473938465118,
|
|
"num_tokens": 19697412.0,
|
|
"step": 11345
|
|
},
|
|
{
|
|
"entropy": 5.550742864608765,
|
|
"epoch": 0.8830966737988718,
|
|
"grad_norm": 1.4921875,
|
|
"learning_rate": 0.0004927265813528549,
|
|
"loss": 5.4509,
|
|
"mean_token_accuracy": 0.16693398207426072,
|
|
"num_tokens": 19706127.0,
|
|
"step": 11350
|
|
},
|
|
{
|
|
"entropy": 5.629002046585083,
|
|
"epoch": 0.8834857031705894,
|
|
"grad_norm": 1.6015625,
|
|
"learning_rate": 0.0004927195896770804,
|
|
"loss": 5.5093,
|
|
"mean_token_accuracy": 0.16149643212556838,
|
|
"num_tokens": 19715178.0,
|
|
"step": 11355
|
|
},
|
|
{
|
|
"entropy": 5.60448145866394,
|
|
"epoch": 0.883874732542307,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.0004927125946977574,
|
|
"loss": 5.3897,
|
|
"mean_token_accuracy": 0.17134506851434708,
|
|
"num_tokens": 19723814.0,
|
|
"step": 11360
|
|
},
|
|
{
|
|
"entropy": 5.643859004974365,
|
|
"epoch": 0.8842637619140246,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.0004927055964149923,
|
|
"loss": 5.5034,
|
|
"mean_token_accuracy": 0.1638002246618271,
|
|
"num_tokens": 19732153.0,
|
|
"step": 11365
|
|
},
|
|
{
|
|
"entropy": 5.613669395446777,
|
|
"epoch": 0.884652791285742,
|
|
"grad_norm": 1.6796875,
|
|
"learning_rate": 0.0004926985948288914,
|
|
"loss": 5.4246,
|
|
"mean_token_accuracy": 0.16479934006929398,
|
|
"num_tokens": 19740251.0,
|
|
"step": 11370
|
|
},
|
|
{
|
|
"entropy": 5.511256217956543,
|
|
"epoch": 0.8850418206574596,
|
|
"grad_norm": 1.8203125,
|
|
"learning_rate": 0.0004926915899395608,
|
|
"loss": 5.353,
|
|
"mean_token_accuracy": 0.17248303145170213,
|
|
"num_tokens": 19748695.0,
|
|
"step": 11375
|
|
},
|
|
{
|
|
"entropy": 5.576343297958374,
|
|
"epoch": 0.8854308500291772,
|
|
"grad_norm": 1.5546875,
|
|
"learning_rate": 0.0004926845817471068,
|
|
"loss": 5.3806,
|
|
"mean_token_accuracy": 0.16375323235988617,
|
|
"num_tokens": 19757674.0,
|
|
"step": 11380
|
|
},
|
|
{
|
|
"entropy": 5.499237489700318,
|
|
"epoch": 0.8858198794008948,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.0004926775702516358,
|
|
"loss": 5.2499,
|
|
"mean_token_accuracy": 0.17762889266014098,
|
|
"num_tokens": 19765555.0,
|
|
"step": 11385
|
|
},
|
|
{
|
|
"entropy": 5.475513696670532,
|
|
"epoch": 0.8862089087726124,
|
|
"grad_norm": 1.5546875,
|
|
"learning_rate": 0.0004926705554532541,
|
|
"loss": 5.3908,
|
|
"mean_token_accuracy": 0.17034557610750198,
|
|
"num_tokens": 19773986.0,
|
|
"step": 11390
|
|
},
|
|
{
|
|
"entropy": 5.606078386306763,
|
|
"epoch": 0.8865979381443299,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 0.0004926635373520682,
|
|
"loss": 5.4257,
|
|
"mean_token_accuracy": 0.16838602870702743,
|
|
"num_tokens": 19782308.0,
|
|
"step": 11395
|
|
},
|
|
{
|
|
"entropy": 5.572033357620239,
|
|
"epoch": 0.8869869675160474,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 0.0004926565159481845,
|
|
"loss": 5.386,
|
|
"mean_token_accuracy": 0.16937547773122788,
|
|
"num_tokens": 19790447.0,
|
|
"step": 11400
|
|
},
|
|
{
|
|
"entropy": 5.5389289379119875,
|
|
"epoch": 0.887375996887765,
|
|
"grad_norm": 1.6328125,
|
|
"learning_rate": 0.0004926494912417097,
|
|
"loss": 5.4891,
|
|
"mean_token_accuracy": 0.16308147758245467,
|
|
"num_tokens": 19798889.0,
|
|
"step": 11405
|
|
},
|
|
{
|
|
"entropy": 5.58053297996521,
|
|
"epoch": 0.8877650262594826,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.0004926424632327503,
|
|
"loss": 5.3088,
|
|
"mean_token_accuracy": 0.1733681246638298,
|
|
"num_tokens": 19807192.0,
|
|
"step": 11410
|
|
},
|
|
{
|
|
"entropy": 5.593471479415894,
|
|
"epoch": 0.8881540556312002,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0004926354319214129,
|
|
"loss": 5.4429,
|
|
"mean_token_accuracy": 0.16237304955720902,
|
|
"num_tokens": 19815864.0,
|
|
"step": 11415
|
|
},
|
|
{
|
|
"entropy": 5.547385263442993,
|
|
"epoch": 0.8885430850029177,
|
|
"grad_norm": 1.609375,
|
|
"learning_rate": 0.0004926283973078041,
|
|
"loss": 5.3716,
|
|
"mean_token_accuracy": 0.16968866735696791,
|
|
"num_tokens": 19823218.0,
|
|
"step": 11420
|
|
},
|
|
{
|
|
"entropy": 5.5402172088623045,
|
|
"epoch": 0.8889321143746353,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.0004926213593920309,
|
|
"loss": 5.425,
|
|
"mean_token_accuracy": 0.1676907166838646,
|
|
"num_tokens": 19832098.0,
|
|
"step": 11425
|
|
},
|
|
{
|
|
"entropy": 5.532503938674926,
|
|
"epoch": 0.8893211437463528,
|
|
"grad_norm": 2.671875,
|
|
"learning_rate": 0.0004926143181742,
|
|
"loss": 5.3452,
|
|
"mean_token_accuracy": 0.17280984669923782,
|
|
"num_tokens": 19840180.0,
|
|
"step": 11430
|
|
},
|
|
{
|
|
"entropy": 5.56445689201355,
|
|
"epoch": 0.8897101731180704,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 0.0004926072736544181,
|
|
"loss": 5.413,
|
|
"mean_token_accuracy": 0.16488739401102065,
|
|
"num_tokens": 19849016.0,
|
|
"step": 11435
|
|
},
|
|
{
|
|
"entropy": 5.504498052597046,
|
|
"epoch": 0.890099202489788,
|
|
"grad_norm": 1.53125,
|
|
"learning_rate": 0.0004926002258327922,
|
|
"loss": 5.3337,
|
|
"mean_token_accuracy": 0.17296406626701355,
|
|
"num_tokens": 19858044.0,
|
|
"step": 11440
|
|
},
|
|
{
|
|
"entropy": 5.46937198638916,
|
|
"epoch": 0.8904882318615055,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0004925931747094292,
|
|
"loss": 5.295,
|
|
"mean_token_accuracy": 0.17614005804061889,
|
|
"num_tokens": 19867557.0,
|
|
"step": 11445
|
|
},
|
|
{
|
|
"entropy": 5.565935277938843,
|
|
"epoch": 0.8908772612332231,
|
|
"grad_norm": 1.5859375,
|
|
"learning_rate": 0.0004925861202844361,
|
|
"loss": 5.399,
|
|
"mean_token_accuracy": 0.1677923858165741,
|
|
"num_tokens": 19876009.0,
|
|
"step": 11450
|
|
},
|
|
{
|
|
"entropy": 5.625434064865113,
|
|
"epoch": 0.8912662906049407,
|
|
"grad_norm": 1.71875,
|
|
"learning_rate": 0.00049257906255792,
|
|
"loss": 5.482,
|
|
"mean_token_accuracy": 0.16082603186368943,
|
|
"num_tokens": 19885085.0,
|
|
"step": 11455
|
|
},
|
|
{
|
|
"entropy": 5.692309951782226,
|
|
"epoch": 0.8916553199766583,
|
|
"grad_norm": 1.5390625,
|
|
"learning_rate": 0.000492572001529988,
|
|
"loss": 5.4152,
|
|
"mean_token_accuracy": 0.16631953418254852,
|
|
"num_tokens": 19893877.0,
|
|
"step": 11460
|
|
},
|
|
{
|
|
"entropy": 5.6170957565307615,
|
|
"epoch": 0.8920443493483758,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0004925649372007469,
|
|
"loss": 5.5506,
|
|
"mean_token_accuracy": 0.16721371412277222,
|
|
"num_tokens": 19902480.0,
|
|
"step": 11465
|
|
},
|
|
{
|
|
"entropy": 5.542704296112061,
|
|
"epoch": 0.8924333787200933,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.0004925578695703045,
|
|
"loss": 5.3204,
|
|
"mean_token_accuracy": 0.17218605130910875,
|
|
"num_tokens": 19910981.0,
|
|
"step": 11470
|
|
},
|
|
{
|
|
"entropy": 5.575353384017944,
|
|
"epoch": 0.8928224080918109,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.0004925507986387676,
|
|
"loss": 5.4467,
|
|
"mean_token_accuracy": 0.1668962210416794,
|
|
"num_tokens": 19920055.0,
|
|
"step": 11475
|
|
},
|
|
{
|
|
"entropy": 5.636821985244751,
|
|
"epoch": 0.8932114374635285,
|
|
"grad_norm": 1.6640625,
|
|
"learning_rate": 0.0004925437244062436,
|
|
"loss": 5.5014,
|
|
"mean_token_accuracy": 0.16508774608373641,
|
|
"num_tokens": 19928010.0,
|
|
"step": 11480
|
|
},
|
|
{
|
|
"entropy": 5.612282609939575,
|
|
"epoch": 0.8936004668352461,
|
|
"grad_norm": 1.7265625,
|
|
"learning_rate": 0.0004925366468728397,
|
|
"loss": 5.375,
|
|
"mean_token_accuracy": 0.1714618131518364,
|
|
"num_tokens": 19935992.0,
|
|
"step": 11485
|
|
},
|
|
{
|
|
"entropy": 5.556436681747437,
|
|
"epoch": 0.8939894962069637,
|
|
"grad_norm": 1.5,
|
|
"learning_rate": 0.0004925295660386635,
|
|
"loss": 5.4872,
|
|
"mean_token_accuracy": 0.16400733441114426,
|
|
"num_tokens": 19944522.0,
|
|
"step": 11490
|
|
},
|
|
{
|
|
"entropy": 5.657855606079101,
|
|
"epoch": 0.8943785255786811,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.0004925224819038224,
|
|
"loss": 5.4437,
|
|
"mean_token_accuracy": 0.16268703192472458,
|
|
"num_tokens": 19952991.0,
|
|
"step": 11495
|
|
},
|
|
{
|
|
"entropy": 5.57559757232666,
|
|
"epoch": 0.8947675549503987,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.0004925153944684239,
|
|
"loss": 5.4747,
|
|
"mean_token_accuracy": 0.16336518079042434,
|
|
"num_tokens": 19962301.0,
|
|
"step": 11500
|
|
},
|
|
{
|
|
"entropy": 5.654898309707642,
|
|
"epoch": 0.8951565843221163,
|
|
"grad_norm": 1.6953125,
|
|
"learning_rate": 0.0004925083037325754,
|
|
"loss": 5.5359,
|
|
"mean_token_accuracy": 0.15567568987607955,
|
|
"num_tokens": 19971159.0,
|
|
"step": 11505
|
|
},
|
|
{
|
|
"entropy": 5.636246681213379,
|
|
"epoch": 0.8955456136938339,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.0004925012096963847,
|
|
"loss": 5.3966,
|
|
"mean_token_accuracy": 0.16252862811088561,
|
|
"num_tokens": 19979608.0,
|
|
"step": 11510
|
|
},
|
|
{
|
|
"entropy": 5.595708894729614,
|
|
"epoch": 0.8959346430655515,
|
|
"grad_norm": 1.6484375,
|
|
"learning_rate": 0.0004924941123599593,
|
|
"loss": 5.3889,
|
|
"mean_token_accuracy": 0.16272395998239517,
|
|
"num_tokens": 19988348.0,
|
|
"step": 11515
|
|
},
|
|
{
|
|
"entropy": 5.518790435791016,
|
|
"epoch": 0.896323672437269,
|
|
"grad_norm": 2.203125,
|
|
"learning_rate": 0.0004924870117234069,
|
|
"loss": 5.3813,
|
|
"mean_token_accuracy": 0.16586881130933762,
|
|
"num_tokens": 19996970.0,
|
|
"step": 11520
|
|
},
|
|
{
|
|
"entropy": 5.6056602001190186,
|
|
"epoch": 0.8967127018089865,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.0004924799077868353,
|
|
"loss": 5.518,
|
|
"mean_token_accuracy": 0.1701822578907013,
|
|
"num_tokens": 20005297.0,
|
|
"step": 11525
|
|
},
|
|
{
|
|
"entropy": 5.597276830673218,
|
|
"epoch": 0.8971017311807041,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0004924728005503522,
|
|
"loss": 5.4559,
|
|
"mean_token_accuracy": 0.1568764790892601,
|
|
"num_tokens": 20013971.0,
|
|
"step": 11530
|
|
},
|
|
{
|
|
"entropy": 5.610063457489014,
|
|
"epoch": 0.8974907605524217,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.0004924656900140655,
|
|
"loss": 5.4146,
|
|
"mean_token_accuracy": 0.16589949578046798,
|
|
"num_tokens": 20022536.0,
|
|
"step": 11535
|
|
},
|
|
{
|
|
"entropy": 5.539964199066162,
|
|
"epoch": 0.8978797899241393,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0004924585761780831,
|
|
"loss": 5.332,
|
|
"mean_token_accuracy": 0.16694836765527726,
|
|
"num_tokens": 20031676.0,
|
|
"step": 11540
|
|
},
|
|
{
|
|
"entropy": 5.597091960906982,
|
|
"epoch": 0.8982688192958569,
|
|
"grad_norm": 1.4921875,
|
|
"learning_rate": 0.000492451459042513,
|
|
"loss": 5.396,
|
|
"mean_token_accuracy": 0.16850428879261017,
|
|
"num_tokens": 20039783.0,
|
|
"step": 11545
|
|
},
|
|
{
|
|
"entropy": 5.53537425994873,
|
|
"epoch": 0.8986578486675744,
|
|
"grad_norm": 1.5,
|
|
"learning_rate": 0.000492444338607463,
|
|
"loss": 5.4568,
|
|
"mean_token_accuracy": 0.16167483776807784,
|
|
"num_tokens": 20047859.0,
|
|
"step": 11550
|
|
},
|
|
{
|
|
"entropy": 5.61722583770752,
|
|
"epoch": 0.899046878039292,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.0004924372148730413,
|
|
"loss": 5.4939,
|
|
"mean_token_accuracy": 0.1566051334142685,
|
|
"num_tokens": 20056711.0,
|
|
"step": 11555
|
|
},
|
|
{
|
|
"entropy": 5.5410792350769045,
|
|
"epoch": 0.8994359074110095,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.000492430087839356,
|
|
"loss": 5.3345,
|
|
"mean_token_accuracy": 0.1677985593676567,
|
|
"num_tokens": 20065715.0,
|
|
"step": 11560
|
|
},
|
|
{
|
|
"entropy": 5.5740954875946045,
|
|
"epoch": 0.8998249367827271,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 0.0004924229575065152,
|
|
"loss": 5.4394,
|
|
"mean_token_accuracy": 0.16821805238723755,
|
|
"num_tokens": 20073815.0,
|
|
"step": 11565
|
|
},
|
|
{
|
|
"entropy": 5.612536334991455,
|
|
"epoch": 0.9002139661544447,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 0.000492415823874627,
|
|
"loss": 5.4172,
|
|
"mean_token_accuracy": 0.16439640522003174,
|
|
"num_tokens": 20082331.0,
|
|
"step": 11570
|
|
},
|
|
{
|
|
"entropy": 5.5884815692901615,
|
|
"epoch": 0.9006029955261622,
|
|
"grad_norm": 1.5,
|
|
"learning_rate": 0.0004924086869437998,
|
|
"loss": 5.4857,
|
|
"mean_token_accuracy": 0.1639646589756012,
|
|
"num_tokens": 20091095.0,
|
|
"step": 11575
|
|
},
|
|
{
|
|
"entropy": 5.583862066268921,
|
|
"epoch": 0.9009920248978798,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.0004924015467141417,
|
|
"loss": 5.4048,
|
|
"mean_token_accuracy": 0.1721714124083519,
|
|
"num_tokens": 20100111.0,
|
|
"step": 11580
|
|
},
|
|
{
|
|
"entropy": 5.634499263763428,
|
|
"epoch": 0.9013810542695974,
|
|
"grad_norm": 1.5859375,
|
|
"learning_rate": 0.0004923944031857613,
|
|
"loss": 5.4747,
|
|
"mean_token_accuracy": 0.17119355350732804,
|
|
"num_tokens": 20108542.0,
|
|
"step": 11585
|
|
},
|
|
{
|
|
"entropy": 5.540798568725586,
|
|
"epoch": 0.901770083641315,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.0004923872563587668,
|
|
"loss": 5.3858,
|
|
"mean_token_accuracy": 0.17029852867126466,
|
|
"num_tokens": 20117831.0,
|
|
"step": 11590
|
|
},
|
|
{
|
|
"entropy": 5.5578783512115475,
|
|
"epoch": 0.9021591130130325,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.0004923801062332666,
|
|
"loss": 5.3541,
|
|
"mean_token_accuracy": 0.16690099239349365,
|
|
"num_tokens": 20127322.0,
|
|
"step": 11595
|
|
},
|
|
{
|
|
"entropy": 5.62836766242981,
|
|
"epoch": 0.90254814238475,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.0004923729528093694,
|
|
"loss": 5.4257,
|
|
"mean_token_accuracy": 0.16922255456447602,
|
|
"num_tokens": 20135772.0,
|
|
"step": 11600
|
|
},
|
|
{
|
|
"entropy": 5.589234209060669,
|
|
"epoch": 0.9029371717564676,
|
|
"grad_norm": 1.5078125,
|
|
"learning_rate": 0.0004923657960871836,
|
|
"loss": 5.4238,
|
|
"mean_token_accuracy": 0.17161959856748582,
|
|
"num_tokens": 20144110.0,
|
|
"step": 11605
|
|
},
|
|
{
|
|
"entropy": 5.5908387184143065,
|
|
"epoch": 0.9033262011281852,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 0.0004923586360668178,
|
|
"loss": 5.5314,
|
|
"mean_token_accuracy": 0.16080180257558824,
|
|
"num_tokens": 20153391.0,
|
|
"step": 11610
|
|
},
|
|
{
|
|
"entropy": 5.488399410247803,
|
|
"epoch": 0.9037152304999028,
|
|
"grad_norm": 1.5234375,
|
|
"learning_rate": 0.0004923514727483807,
|
|
"loss": 5.3518,
|
|
"mean_token_accuracy": 0.17050424665212632,
|
|
"num_tokens": 20161877.0,
|
|
"step": 11615
|
|
},
|
|
{
|
|
"entropy": 5.45561637878418,
|
|
"epoch": 0.9041042598716204,
|
|
"grad_norm": 1.5703125,
|
|
"learning_rate": 0.000492344306131981,
|
|
"loss": 5.3213,
|
|
"mean_token_accuracy": 0.17042506337165833,
|
|
"num_tokens": 20169922.0,
|
|
"step": 11620
|
|
},
|
|
{
|
|
"entropy": 5.466183853149414,
|
|
"epoch": 0.9044932892433378,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.0004923371362177272,
|
|
"loss": 5.3535,
|
|
"mean_token_accuracy": 0.16962634325027465,
|
|
"num_tokens": 20177780.0,
|
|
"step": 11625
|
|
},
|
|
{
|
|
"entropy": 5.558832311630249,
|
|
"epoch": 0.9048823186150554,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.0004923299630057284,
|
|
"loss": 5.3618,
|
|
"mean_token_accuracy": 0.1693778559565544,
|
|
"num_tokens": 20186303.0,
|
|
"step": 11630
|
|
},
|
|
{
|
|
"entropy": 5.484474754333496,
|
|
"epoch": 0.905271347986773,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 0.0004923227864960934,
|
|
"loss": 5.3436,
|
|
"mean_token_accuracy": 0.1737839788198471,
|
|
"num_tokens": 20194042.0,
|
|
"step": 11635
|
|
},
|
|
{
|
|
"entropy": 5.429728555679321,
|
|
"epoch": 0.9056603773584906,
|
|
"grad_norm": 1.796875,
|
|
"learning_rate": 0.000492315606688931,
|
|
"loss": 5.3524,
|
|
"mean_token_accuracy": 0.16970919370651244,
|
|
"num_tokens": 20202929.0,
|
|
"step": 11640
|
|
},
|
|
{
|
|
"entropy": 5.542688322067261,
|
|
"epoch": 0.9060494067302082,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 0.0004923084235843501,
|
|
"loss": 5.3994,
|
|
"mean_token_accuracy": 0.16830789297819138,
|
|
"num_tokens": 20210864.0,
|
|
"step": 11645
|
|
},
|
|
{
|
|
"entropy": 5.619127178192139,
|
|
"epoch": 0.9064384361019256,
|
|
"grad_norm": 1.9375,
|
|
"learning_rate": 0.0004923012371824598,
|
|
"loss": 5.4096,
|
|
"mean_token_accuracy": 0.16993769407272338,
|
|
"num_tokens": 20219390.0,
|
|
"step": 11650
|
|
},
|
|
{
|
|
"entropy": 5.51544713973999,
|
|
"epoch": 0.9068274654736432,
|
|
"grad_norm": 1.5546875,
|
|
"learning_rate": 0.000492294047483369,
|
|
"loss": 5.3352,
|
|
"mean_token_accuracy": 0.17380872666835784,
|
|
"num_tokens": 20227241.0,
|
|
"step": 11655
|
|
},
|
|
{
|
|
"entropy": 5.497108030319214,
|
|
"epoch": 0.9072164948453608,
|
|
"grad_norm": 1.5390625,
|
|
"learning_rate": 0.0004922868544871869,
|
|
"loss": 5.5019,
|
|
"mean_token_accuracy": 0.16477687805891036,
|
|
"num_tokens": 20236001.0,
|
|
"step": 11660
|
|
},
|
|
{
|
|
"entropy": 5.661060237884522,
|
|
"epoch": 0.9076055242170784,
|
|
"grad_norm": 1.5390625,
|
|
"learning_rate": 0.0004922796581940227,
|
|
"loss": 5.4026,
|
|
"mean_token_accuracy": 0.166934534907341,
|
|
"num_tokens": 20244316.0,
|
|
"step": 11665
|
|
},
|
|
{
|
|
"entropy": 5.536293363571167,
|
|
"epoch": 0.907994553588796,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.0004922724586039855,
|
|
"loss": 5.3503,
|
|
"mean_token_accuracy": 0.1758762553334236,
|
|
"num_tokens": 20252693.0,
|
|
"step": 11670
|
|
},
|
|
{
|
|
"entropy": 5.491916370391846,
|
|
"epoch": 0.9083835829605135,
|
|
"grad_norm": 1.828125,
|
|
"learning_rate": 0.0004922652557171846,
|
|
"loss": 5.4219,
|
|
"mean_token_accuracy": 0.16736511141061783,
|
|
"num_tokens": 20262252.0,
|
|
"step": 11675
|
|
},
|
|
{
|
|
"entropy": 5.526864671707154,
|
|
"epoch": 0.9087726123322311,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.0004922580495337292,
|
|
"loss": 5.2747,
|
|
"mean_token_accuracy": 0.17781864255666732,
|
|
"num_tokens": 20270755.0,
|
|
"step": 11680
|
|
},
|
|
{
|
|
"entropy": 5.525045871734619,
|
|
"epoch": 0.9091616417039486,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.0004922508400537288,
|
|
"loss": 5.3499,
|
|
"mean_token_accuracy": 0.16931665539741517,
|
|
"num_tokens": 20278739.0,
|
|
"step": 11685
|
|
},
|
|
{
|
|
"entropy": 5.5669698238372805,
|
|
"epoch": 0.9095506710756662,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.0004922436272772926,
|
|
"loss": 5.4908,
|
|
"mean_token_accuracy": 0.15875268131494522,
|
|
"num_tokens": 20288160.0,
|
|
"step": 11690
|
|
},
|
|
{
|
|
"entropy": 5.551499748229981,
|
|
"epoch": 0.9099397004473838,
|
|
"grad_norm": 1.6796875,
|
|
"learning_rate": 0.0004922364112045301,
|
|
"loss": 5.4334,
|
|
"mean_token_accuracy": 0.16487108469009398,
|
|
"num_tokens": 20296730.0,
|
|
"step": 11695
|
|
},
|
|
{
|
|
"entropy": 5.515936851501465,
|
|
"epoch": 0.9103287298191013,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.000492229191835551,
|
|
"loss": 5.3751,
|
|
"mean_token_accuracy": 0.16235080659389495,
|
|
"num_tokens": 20305941.0,
|
|
"step": 11700
|
|
},
|
|
{
|
|
"entropy": 5.529587936401367,
|
|
"epoch": 0.9107177591908189,
|
|
"grad_norm": 2.1875,
|
|
"learning_rate": 0.0004922219691704645,
|
|
"loss": 5.3846,
|
|
"mean_token_accuracy": 0.1715839296579361,
|
|
"num_tokens": 20314081.0,
|
|
"step": 11705
|
|
},
|
|
{
|
|
"entropy": 5.610342073440552,
|
|
"epoch": 0.9111067885625365,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 0.0004922147432093805,
|
|
"loss": 5.4341,
|
|
"mean_token_accuracy": 0.16086156964302062,
|
|
"num_tokens": 20323004.0,
|
|
"step": 11710
|
|
},
|
|
{
|
|
"entropy": 5.559319114685058,
|
|
"epoch": 0.911495817934254,
|
|
"grad_norm": 1.8828125,
|
|
"learning_rate": 0.0004922075139524083,
|
|
"loss": 5.3605,
|
|
"mean_token_accuracy": 0.16922397166490555,
|
|
"num_tokens": 20331122.0,
|
|
"step": 11715
|
|
},
|
|
{
|
|
"entropy": 5.502468490600586,
|
|
"epoch": 0.9118848473059716,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.000492200281399658,
|
|
"loss": 5.425,
|
|
"mean_token_accuracy": 0.1607287809252739,
|
|
"num_tokens": 20339602.0,
|
|
"step": 11720
|
|
},
|
|
{
|
|
"entropy": 5.541914367675782,
|
|
"epoch": 0.9122738766776891,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.000492193045551239,
|
|
"loss": 5.3133,
|
|
"mean_token_accuracy": 0.16714433431625367,
|
|
"num_tokens": 20348431.0,
|
|
"step": 11725
|
|
},
|
|
{
|
|
"entropy": 5.469029664993286,
|
|
"epoch": 0.9126629060494067,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.0004921858064072612,
|
|
"loss": 5.3583,
|
|
"mean_token_accuracy": 0.16788104325532913,
|
|
"num_tokens": 20357235.0,
|
|
"step": 11730
|
|
},
|
|
{
|
|
"entropy": 5.557778263092041,
|
|
"epoch": 0.9130519354211243,
|
|
"grad_norm": 1.53125,
|
|
"learning_rate": 0.0004921785639678347,
|
|
"loss": 5.3089,
|
|
"mean_token_accuracy": 0.1702603742480278,
|
|
"num_tokens": 20366169.0,
|
|
"step": 11735
|
|
},
|
|
{
|
|
"entropy": 5.580132293701172,
|
|
"epoch": 0.9134409647928419,
|
|
"grad_norm": 1.5234375,
|
|
"learning_rate": 0.000492171318233069,
|
|
"loss": 5.3956,
|
|
"mean_token_accuracy": 0.16502324044704436,
|
|
"num_tokens": 20375213.0,
|
|
"step": 11740
|
|
},
|
|
{
|
|
"entropy": 5.501100635528564,
|
|
"epoch": 0.9138299941645595,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.0004921640692030742,
|
|
"loss": 5.3957,
|
|
"mean_token_accuracy": 0.17093413323163986,
|
|
"num_tokens": 20383992.0,
|
|
"step": 11745
|
|
},
|
|
{
|
|
"entropy": 5.539239454269409,
|
|
"epoch": 0.914219023536277,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.0004921568168779603,
|
|
"loss": 5.3631,
|
|
"mean_token_accuracy": 0.1754248708486557,
|
|
"num_tokens": 20392318.0,
|
|
"step": 11750
|
|
},
|
|
{
|
|
"entropy": 5.664598751068115,
|
|
"epoch": 0.9146080529079945,
|
|
"grad_norm": 1.5234375,
|
|
"learning_rate": 0.0004921495612578374,
|
|
"loss": 5.5079,
|
|
"mean_token_accuracy": 0.16295591592788697,
|
|
"num_tokens": 20401556.0,
|
|
"step": 11755
|
|
},
|
|
{
|
|
"entropy": 5.5183642387390135,
|
|
"epoch": 0.9149970822797121,
|
|
"grad_norm": 1.5859375,
|
|
"learning_rate": 0.0004921423023428156,
|
|
"loss": 5.3778,
|
|
"mean_token_accuracy": 0.163390851020813,
|
|
"num_tokens": 20410480.0,
|
|
"step": 11760
|
|
},
|
|
{
|
|
"entropy": 5.490876150131226,
|
|
"epoch": 0.9153861116514297,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 0.0004921350401330049,
|
|
"loss": 5.339,
|
|
"mean_token_accuracy": 0.16899747252464295,
|
|
"num_tokens": 20419748.0,
|
|
"step": 11765
|
|
},
|
|
{
|
|
"entropy": 5.57486310005188,
|
|
"epoch": 0.9157751410231473,
|
|
"grad_norm": 1.6015625,
|
|
"learning_rate": 0.0004921277746285155,
|
|
"loss": 5.4046,
|
|
"mean_token_accuracy": 0.1624474048614502,
|
|
"num_tokens": 20429552.0,
|
|
"step": 11770
|
|
},
|
|
{
|
|
"entropy": 5.694101572036743,
|
|
"epoch": 0.9161641703948649,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.0004921205058294579,
|
|
"loss": 5.4704,
|
|
"mean_token_accuracy": 0.16239598095417024,
|
|
"num_tokens": 20438476.0,
|
|
"step": 11775
|
|
},
|
|
{
|
|
"entropy": 5.508808708190918,
|
|
"epoch": 0.9165531997665823,
|
|
"grad_norm": 1.5234375,
|
|
"learning_rate": 0.000492113233735942,
|
|
"loss": 5.2657,
|
|
"mean_token_accuracy": 0.17543971985578538,
|
|
"num_tokens": 20447035.0,
|
|
"step": 11780
|
|
},
|
|
{
|
|
"entropy": 5.542420816421509,
|
|
"epoch": 0.9169422291382999,
|
|
"grad_norm": 1.6640625,
|
|
"learning_rate": 0.0004921059583480785,
|
|
"loss": 5.4246,
|
|
"mean_token_accuracy": 0.16850287169218064,
|
|
"num_tokens": 20456200.0,
|
|
"step": 11785
|
|
},
|
|
{
|
|
"entropy": 5.567418813705444,
|
|
"epoch": 0.9173312585100175,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0004920986796659775,
|
|
"loss": 5.4295,
|
|
"mean_token_accuracy": 0.17314960211515426,
|
|
"num_tokens": 20465444.0,
|
|
"step": 11790
|
|
},
|
|
{
|
|
"entropy": 5.523631477355957,
|
|
"epoch": 0.9177202878817351,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.0004920913976897498,
|
|
"loss": 5.3068,
|
|
"mean_token_accuracy": 0.17249808013439177,
|
|
"num_tokens": 20473851.0,
|
|
"step": 11795
|
|
},
|
|
{
|
|
"entropy": 5.550854825973511,
|
|
"epoch": 0.9181093172534527,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0004920841124195055,
|
|
"loss": 5.4061,
|
|
"mean_token_accuracy": 0.16749586164951324,
|
|
"num_tokens": 20482232.0,
|
|
"step": 11800
|
|
},
|
|
{
|
|
"entropy": 5.479307842254639,
|
|
"epoch": 0.9184983466251702,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.0004920768238553554,
|
|
"loss": 5.2966,
|
|
"mean_token_accuracy": 0.18034131079912186,
|
|
"num_tokens": 20490498.0,
|
|
"step": 11805
|
|
},
|
|
{
|
|
"entropy": 5.478506565093994,
|
|
"epoch": 0.9188873759968877,
|
|
"grad_norm": 1.5,
|
|
"learning_rate": 0.0004920695319974099,
|
|
"loss": 5.3633,
|
|
"mean_token_accuracy": 0.16815510243177414,
|
|
"num_tokens": 20499125.0,
|
|
"step": 11810
|
|
},
|
|
{
|
|
"entropy": 5.590223217010498,
|
|
"epoch": 0.9192764053686053,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.0004920622368457798,
|
|
"loss": 5.5452,
|
|
"mean_token_accuracy": 0.15663281828165054,
|
|
"num_tokens": 20507665.0,
|
|
"step": 11815
|
|
},
|
|
{
|
|
"entropy": 5.620478248596191,
|
|
"epoch": 0.9196654347403229,
|
|
"grad_norm": 1.5,
|
|
"learning_rate": 0.0004920549384005759,
|
|
"loss": 5.4366,
|
|
"mean_token_accuracy": 0.16730313748121262,
|
|
"num_tokens": 20516509.0,
|
|
"step": 11820
|
|
},
|
|
{
|
|
"entropy": 5.6098487854003904,
|
|
"epoch": 0.9200544641120405,
|
|
"grad_norm": 1.4921875,
|
|
"learning_rate": 0.0004920476366619086,
|
|
"loss": 5.4763,
|
|
"mean_token_accuracy": 0.16809720396995545,
|
|
"num_tokens": 20524830.0,
|
|
"step": 11825
|
|
},
|
|
{
|
|
"entropy": 5.527750015258789,
|
|
"epoch": 0.920443493483758,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.000492040331629889,
|
|
"loss": 5.3625,
|
|
"mean_token_accuracy": 0.16703199446201325,
|
|
"num_tokens": 20533746.0,
|
|
"step": 11830
|
|
},
|
|
{
|
|
"entropy": 5.542729473114013,
|
|
"epoch": 0.9208325228554756,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0004920330233046277,
|
|
"loss": 5.3331,
|
|
"mean_token_accuracy": 0.17348472625017167,
|
|
"num_tokens": 20542350.0,
|
|
"step": 11835
|
|
},
|
|
{
|
|
"entropy": 5.575383043289184,
|
|
"epoch": 0.9212215522271932,
|
|
"grad_norm": 1.6875,
|
|
"learning_rate": 0.0004920257116862359,
|
|
"loss": 5.474,
|
|
"mean_token_accuracy": 0.16687478721141816,
|
|
"num_tokens": 20551670.0,
|
|
"step": 11840
|
|
},
|
|
{
|
|
"entropy": 5.589216423034668,
|
|
"epoch": 0.9216105815989107,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.0004920183967748241,
|
|
"loss": 5.4,
|
|
"mean_token_accuracy": 0.1685417965054512,
|
|
"num_tokens": 20560692.0,
|
|
"step": 11845
|
|
},
|
|
{
|
|
"entropy": 5.578690719604492,
|
|
"epoch": 0.9219996109706283,
|
|
"grad_norm": 1.546875,
|
|
"learning_rate": 0.0004920110785705037,
|
|
"loss": 5.351,
|
|
"mean_token_accuracy": 0.16806455105543136,
|
|
"num_tokens": 20569262.0,
|
|
"step": 11850
|
|
},
|
|
{
|
|
"entropy": 5.501679229736328,
|
|
"epoch": 0.9223886403423458,
|
|
"grad_norm": 1.4921875,
|
|
"learning_rate": 0.0004920037570733857,
|
|
"loss": 5.3656,
|
|
"mean_token_accuracy": 0.17025428265333176,
|
|
"num_tokens": 20577850.0,
|
|
"step": 11855
|
|
},
|
|
{
|
|
"entropy": 5.53700590133667,
|
|
"epoch": 0.9227776697140634,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.0004919964322835809,
|
|
"loss": 5.4376,
|
|
"mean_token_accuracy": 0.1631557360291481,
|
|
"num_tokens": 20587021.0,
|
|
"step": 11860
|
|
},
|
|
{
|
|
"entropy": 5.590654373168945,
|
|
"epoch": 0.923166699085781,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.0004919891042012006,
|
|
"loss": 5.3728,
|
|
"mean_token_accuracy": 0.1707693710923195,
|
|
"num_tokens": 20594631.0,
|
|
"step": 11865
|
|
},
|
|
{
|
|
"entropy": 5.496949577331543,
|
|
"epoch": 0.9235557284574986,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.0004919817728263562,
|
|
"loss": 5.2909,
|
|
"mean_token_accuracy": 0.1699821799993515,
|
|
"num_tokens": 20602765.0,
|
|
"step": 11870
|
|
},
|
|
{
|
|
"entropy": 5.575145959854126,
|
|
"epoch": 0.9239447578292161,
|
|
"grad_norm": 1.5078125,
|
|
"learning_rate": 0.0004919744381591586,
|
|
"loss": 5.433,
|
|
"mean_token_accuracy": 0.17425196319818498,
|
|
"num_tokens": 20611350.0,
|
|
"step": 11875
|
|
},
|
|
{
|
|
"entropy": 5.557479476928711,
|
|
"epoch": 0.9243337872009336,
|
|
"grad_norm": 1.5,
|
|
"learning_rate": 0.0004919671001997193,
|
|
"loss": 5.344,
|
|
"mean_token_accuracy": 0.17579306066036224,
|
|
"num_tokens": 20620201.0,
|
|
"step": 11880
|
|
},
|
|
{
|
|
"entropy": 5.577688121795655,
|
|
"epoch": 0.9247228165726512,
|
|
"grad_norm": 1.6015625,
|
|
"learning_rate": 0.0004919597589481497,
|
|
"loss": 5.4324,
|
|
"mean_token_accuracy": 0.16765122562646867,
|
|
"num_tokens": 20627870.0,
|
|
"step": 11885
|
|
},
|
|
{
|
|
"entropy": 5.540508365631103,
|
|
"epoch": 0.9251118459443688,
|
|
"grad_norm": 1.8203125,
|
|
"learning_rate": 0.000491952414404561,
|
|
"loss": 5.3966,
|
|
"mean_token_accuracy": 0.1689246952533722,
|
|
"num_tokens": 20635894.0,
|
|
"step": 11890
|
|
},
|
|
{
|
|
"entropy": 5.61571774482727,
|
|
"epoch": 0.9255008753160864,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.0004919450665690646,
|
|
"loss": 5.4535,
|
|
"mean_token_accuracy": 0.17070710957050322,
|
|
"num_tokens": 20644091.0,
|
|
"step": 11895
|
|
},
|
|
{
|
|
"entropy": 5.614666843414307,
|
|
"epoch": 0.925889904687804,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.0004919377154417724,
|
|
"loss": 5.3161,
|
|
"mean_token_accuracy": 0.17163473516702651,
|
|
"num_tokens": 20651994.0,
|
|
"step": 11900
|
|
},
|
|
{
|
|
"entropy": 5.4973626136779785,
|
|
"epoch": 0.9262789340595214,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.0004919303610227954,
|
|
"loss": 5.3427,
|
|
"mean_token_accuracy": 0.16905196607112885,
|
|
"num_tokens": 20660192.0,
|
|
"step": 11905
|
|
},
|
|
{
|
|
"entropy": 5.626149225234985,
|
|
"epoch": 0.926667963431239,
|
|
"grad_norm": 1.5234375,
|
|
"learning_rate": 0.0004919230033122457,
|
|
"loss": 5.4056,
|
|
"mean_token_accuracy": 0.1687226414680481,
|
|
"num_tokens": 20668275.0,
|
|
"step": 11910
|
|
},
|
|
{
|
|
"entropy": 5.482329082489014,
|
|
"epoch": 0.9270569928029566,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.0004919156423102345,
|
|
"loss": 5.3826,
|
|
"mean_token_accuracy": 0.16945904791355132,
|
|
"num_tokens": 20676936.0,
|
|
"step": 11915
|
|
},
|
|
{
|
|
"entropy": 5.5744280338287355,
|
|
"epoch": 0.9274460221746742,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0004919082780168736,
|
|
"loss": 5.5024,
|
|
"mean_token_accuracy": 0.1619183152914047,
|
|
"num_tokens": 20685600.0,
|
|
"step": 11920
|
|
},
|
|
{
|
|
"entropy": 5.571272230148315,
|
|
"epoch": 0.9278350515463918,
|
|
"grad_norm": 1.546875,
|
|
"learning_rate": 0.0004919009104322751,
|
|
"loss": 5.4194,
|
|
"mean_token_accuracy": 0.16548635065555573,
|
|
"num_tokens": 20693714.0,
|
|
"step": 11925
|
|
},
|
|
{
|
|
"entropy": 5.5382568359375,
|
|
"epoch": 0.9282240809181093,
|
|
"grad_norm": 1.625,
|
|
"learning_rate": 0.0004918935395565503,
|
|
"loss": 5.4041,
|
|
"mean_token_accuracy": 0.1636177897453308,
|
|
"num_tokens": 20702529.0,
|
|
"step": 11930
|
|
},
|
|
{
|
|
"entropy": 5.537384748458862,
|
|
"epoch": 0.9286131102898268,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.0004918861653898113,
|
|
"loss": 5.3346,
|
|
"mean_token_accuracy": 0.16773627400398256,
|
|
"num_tokens": 20711775.0,
|
|
"step": 11935
|
|
},
|
|
{
|
|
"entropy": 5.599783563613892,
|
|
"epoch": 0.9290021396615444,
|
|
"grad_norm": 1.515625,
|
|
"learning_rate": 0.0004918787879321701,
|
|
"loss": 5.3819,
|
|
"mean_token_accuracy": 0.17063708007335662,
|
|
"num_tokens": 20720653.0,
|
|
"step": 11940
|
|
},
|
|
{
|
|
"entropy": 5.522376585006714,
|
|
"epoch": 0.929391169033262,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 0.0004918714071837384,
|
|
"loss": 5.3895,
|
|
"mean_token_accuracy": 0.1673469364643097,
|
|
"num_tokens": 20729208.0,
|
|
"step": 11945
|
|
},
|
|
{
|
|
"entropy": 5.610297393798828,
|
|
"epoch": 0.9297801984049796,
|
|
"grad_norm": 1.65625,
|
|
"learning_rate": 0.0004918640231446282,
|
|
"loss": 5.4512,
|
|
"mean_token_accuracy": 0.16779119819402694,
|
|
"num_tokens": 20738670.0,
|
|
"step": 11950
|
|
},
|
|
{
|
|
"entropy": 5.6242156505584715,
|
|
"epoch": 0.9301692277766972,
|
|
"grad_norm": 1.7734375,
|
|
"learning_rate": 0.0004918566358149517,
|
|
"loss": 5.5074,
|
|
"mean_token_accuracy": 0.16253920048475265,
|
|
"num_tokens": 20748315.0,
|
|
"step": 11955
|
|
},
|
|
{
|
|
"entropy": 5.6387773036956785,
|
|
"epoch": 0.9305582571484147,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.000491849245194821,
|
|
"loss": 5.5657,
|
|
"mean_token_accuracy": 0.16133267283439637,
|
|
"num_tokens": 20757623.0,
|
|
"step": 11960
|
|
},
|
|
{
|
|
"entropy": 5.634545612335205,
|
|
"epoch": 0.9309472865201323,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 0.0004918418512843479,
|
|
"loss": 5.3923,
|
|
"mean_token_accuracy": 0.16616931408643723,
|
|
"num_tokens": 20765817.0,
|
|
"step": 11965
|
|
},
|
|
{
|
|
"entropy": 5.511015701293945,
|
|
"epoch": 0.9313363158918498,
|
|
"grad_norm": 1.53125,
|
|
"learning_rate": 0.0004918344540836451,
|
|
"loss": 5.2564,
|
|
"mean_token_accuracy": 0.17636050879955292,
|
|
"num_tokens": 20773931.0,
|
|
"step": 11970
|
|
},
|
|
{
|
|
"entropy": 5.595106077194214,
|
|
"epoch": 0.9317253452635674,
|
|
"grad_norm": 1.5390625,
|
|
"learning_rate": 0.0004918270535928244,
|
|
"loss": 5.4069,
|
|
"mean_token_accuracy": 0.16532163172960282,
|
|
"num_tokens": 20782652.0,
|
|
"step": 11975
|
|
},
|
|
{
|
|
"entropy": 5.491355609893799,
|
|
"epoch": 0.932114374635285,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.0004918196498119984,
|
|
"loss": 5.3049,
|
|
"mean_token_accuracy": 0.17544931769371033,
|
|
"num_tokens": 20791293.0,
|
|
"step": 11980
|
|
},
|
|
{
|
|
"entropy": 5.514186239242553,
|
|
"epoch": 0.9325034040070025,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 0.0004918122427412793,
|
|
"loss": 5.4302,
|
|
"mean_token_accuracy": 0.16274045556783676,
|
|
"num_tokens": 20800317.0,
|
|
"step": 11985
|
|
},
|
|
{
|
|
"entropy": 5.584352254867554,
|
|
"epoch": 0.9328924333787201,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.0004918048323807795,
|
|
"loss": 5.3986,
|
|
"mean_token_accuracy": 0.17177387177944184,
|
|
"num_tokens": 20809231.0,
|
|
"step": 11990
|
|
},
|
|
{
|
|
"entropy": 5.607217788696289,
|
|
"epoch": 0.9332814627504377,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.0004917974187306114,
|
|
"loss": 5.322,
|
|
"mean_token_accuracy": 0.1658833995461464,
|
|
"num_tokens": 20818327.0,
|
|
"step": 11995
|
|
},
|
|
{
|
|
"entropy": 5.578121280670166,
|
|
"epoch": 0.9336704921221552,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.0004917900017908875,
|
|
"loss": 5.4827,
|
|
"mean_token_accuracy": 0.16153437048196792,
|
|
"num_tokens": 20826995.0,
|
|
"step": 12000
|
|
},
|
|
{
|
|
"epoch": 0.9336704921221552,
|
|
"eval_entropy": 5.388003500937498,
|
|
"eval_loss": 5.445855617523193,
|
|
"eval_mean_token_accuracy": 0.17358772557110483,
|
|
"eval_num_tokens": 20826995.0,
|
|
"eval_runtime": 28.4412,
|
|
"eval_samples_per_second": 1461.19,
|
|
"eval_steps_per_second": 182.658,
|
|
"step": 12000
|
|
},
|
|
{
|
|
"entropy": 5.44256477355957,
|
|
"epoch": 0.9340595214938728,
|
|
"grad_norm": 1.5234375,
|
|
"learning_rate": 0.0004917825815617205,
|
|
"loss": 5.1973,
|
|
"mean_token_accuracy": 0.18006435185670852,
|
|
"num_tokens": 20835641.0,
|
|
"step": 12005
|
|
},
|
|
{
|
|
"entropy": 5.585927867889405,
|
|
"epoch": 0.9344485508655903,
|
|
"grad_norm": 1.5703125,
|
|
"learning_rate": 0.0004917751580432229,
|
|
"loss": 5.3558,
|
|
"mean_token_accuracy": 0.167583367228508,
|
|
"num_tokens": 20844728.0,
|
|
"step": 12010
|
|
},
|
|
{
|
|
"entropy": 5.514683628082276,
|
|
"epoch": 0.9348375802373079,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.0004917677312355072,
|
|
"loss": 5.3194,
|
|
"mean_token_accuracy": 0.17395581305027008,
|
|
"num_tokens": 20853013.0,
|
|
"step": 12015
|
|
},
|
|
{
|
|
"entropy": 5.601926612854004,
|
|
"epoch": 0.9352266096090255,
|
|
"grad_norm": 1.5625,
|
|
"learning_rate": 0.0004917603011386863,
|
|
"loss": 5.4143,
|
|
"mean_token_accuracy": 0.16894597858190535,
|
|
"num_tokens": 20861592.0,
|
|
"step": 12020
|
|
},
|
|
{
|
|
"entropy": 5.533649015426636,
|
|
"epoch": 0.9356156389807431,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 0.0004917528677528727,
|
|
"loss": 5.3721,
|
|
"mean_token_accuracy": 0.17113135308027266,
|
|
"num_tokens": 20869645.0,
|
|
"step": 12025
|
|
},
|
|
{
|
|
"entropy": 5.5597740650177006,
|
|
"epoch": 0.9360046683524607,
|
|
"grad_norm": 1.546875,
|
|
"learning_rate": 0.0004917454310781795,
|
|
"loss": 5.4124,
|
|
"mean_token_accuracy": 0.1685989484190941,
|
|
"num_tokens": 20878154.0,
|
|
"step": 12030
|
|
},
|
|
{
|
|
"entropy": 5.578198862075806,
|
|
"epoch": 0.9363936977241781,
|
|
"grad_norm": 1.546875,
|
|
"learning_rate": 0.0004917379911147193,
|
|
"loss": 5.3555,
|
|
"mean_token_accuracy": 0.1777196228504181,
|
|
"num_tokens": 20886260.0,
|
|
"step": 12035
|
|
},
|
|
{
|
|
"entropy": 5.535090684890747,
|
|
"epoch": 0.9367827270958957,
|
|
"grad_norm": 1.5546875,
|
|
"learning_rate": 0.0004917305478626049,
|
|
"loss": 5.3239,
|
|
"mean_token_accuracy": 0.17040987089276313,
|
|
"num_tokens": 20895688.0,
|
|
"step": 12040
|
|
},
|
|
{
|
|
"entropy": 5.5670891284942625,
|
|
"epoch": 0.9371717564676133,
|
|
"grad_norm": 1.4921875,
|
|
"learning_rate": 0.0004917231013219495,
|
|
"loss": 5.4416,
|
|
"mean_token_accuracy": 0.16440101116895675,
|
|
"num_tokens": 20903904.0,
|
|
"step": 12045
|
|
},
|
|
{
|
|
"entropy": 5.601820993423462,
|
|
"epoch": 0.9375607858393309,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.000491715651492866,
|
|
"loss": 5.4587,
|
|
"mean_token_accuracy": 0.16410596370697023,
|
|
"num_tokens": 20913411.0,
|
|
"step": 12050
|
|
},
|
|
{
|
|
"entropy": 5.594565439224243,
|
|
"epoch": 0.9379498152110485,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.0004917081983754675,
|
|
"loss": 5.404,
|
|
"mean_token_accuracy": 0.16168863624334334,
|
|
"num_tokens": 20922088.0,
|
|
"step": 12055
|
|
},
|
|
{
|
|
"entropy": 5.4826037883758545,
|
|
"epoch": 0.938338844582766,
|
|
"grad_norm": 1.5546875,
|
|
"learning_rate": 0.0004917007419698669,
|
|
"loss": 5.3958,
|
|
"mean_token_accuracy": 0.16772531494498252,
|
|
"num_tokens": 20930879.0,
|
|
"step": 12060
|
|
},
|
|
{
|
|
"entropy": 5.551362752914429,
|
|
"epoch": 0.9387278739544835,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.0004916932822761776,
|
|
"loss": 5.3513,
|
|
"mean_token_accuracy": 0.1729399546980858,
|
|
"num_tokens": 20939092.0,
|
|
"step": 12065
|
|
},
|
|
{
|
|
"entropy": 5.527021694183349,
|
|
"epoch": 0.9391169033262011,
|
|
"grad_norm": 1.75,
|
|
"learning_rate": 0.0004916858192945126,
|
|
"loss": 5.4036,
|
|
"mean_token_accuracy": 0.1687800630927086,
|
|
"num_tokens": 20947599.0,
|
|
"step": 12070
|
|
},
|
|
{
|
|
"entropy": 5.582270336151123,
|
|
"epoch": 0.9395059326979187,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.0004916783530249852,
|
|
"loss": 5.4509,
|
|
"mean_token_accuracy": 0.16832178384065627,
|
|
"num_tokens": 20955725.0,
|
|
"step": 12075
|
|
},
|
|
{
|
|
"entropy": 5.503492927551269,
|
|
"epoch": 0.9398949620696363,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.0004916708834677086,
|
|
"loss": 5.283,
|
|
"mean_token_accuracy": 0.17304554879665374,
|
|
"num_tokens": 20965040.0,
|
|
"step": 12080
|
|
},
|
|
{
|
|
"entropy": 5.61143307685852,
|
|
"epoch": 0.9402839914413538,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.0004916634106227962,
|
|
"loss": 5.432,
|
|
"mean_token_accuracy": 0.16256042420864106,
|
|
"num_tokens": 20974204.0,
|
|
"step": 12085
|
|
},
|
|
{
|
|
"entropy": 5.621157455444336,
|
|
"epoch": 0.9406730208130714,
|
|
"grad_norm": 1.640625,
|
|
"learning_rate": 0.0004916559344903614,
|
|
"loss": 5.4062,
|
|
"mean_token_accuracy": 0.16993506103754044,
|
|
"num_tokens": 20982109.0,
|
|
"step": 12090
|
|
},
|
|
{
|
|
"entropy": 5.516245412826538,
|
|
"epoch": 0.941062050184789,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.0004916484550705176,
|
|
"loss": 5.4397,
|
|
"mean_token_accuracy": 0.1644568085670471,
|
|
"num_tokens": 20990375.0,
|
|
"step": 12095
|
|
},
|
|
{
|
|
"entropy": 5.527275609970093,
|
|
"epoch": 0.9414510795565065,
|
|
"grad_norm": 1.7265625,
|
|
"learning_rate": 0.0004916409723633785,
|
|
"loss": 5.4395,
|
|
"mean_token_accuracy": 0.16648600846529008,
|
|
"num_tokens": 20998535.0,
|
|
"step": 12100
|
|
},
|
|
{
|
|
"entropy": 5.479147624969483,
|
|
"epoch": 0.9418401089282241,
|
|
"grad_norm": 1.640625,
|
|
"learning_rate": 0.0004916334863690573,
|
|
"loss": 5.2937,
|
|
"mean_token_accuracy": 0.1718555822968483,
|
|
"num_tokens": 21006597.0,
|
|
"step": 12105
|
|
},
|
|
{
|
|
"entropy": 5.516942644119263,
|
|
"epoch": 0.9422291382999416,
|
|
"grad_norm": 1.7109375,
|
|
"learning_rate": 0.0004916259970876678,
|
|
"loss": 5.3777,
|
|
"mean_token_accuracy": 0.17228891104459762,
|
|
"num_tokens": 21015498.0,
|
|
"step": 12110
|
|
},
|
|
{
|
|
"entropy": 5.622916603088379,
|
|
"epoch": 0.9426181676716592,
|
|
"grad_norm": 1.8203125,
|
|
"learning_rate": 0.0004916185045193237,
|
|
"loss": 5.4073,
|
|
"mean_token_accuracy": 0.16307393610477447,
|
|
"num_tokens": 21024090.0,
|
|
"step": 12115
|
|
},
|
|
{
|
|
"entropy": 5.652024269104004,
|
|
"epoch": 0.9430071970433768,
|
|
"grad_norm": 1.59375,
|
|
"learning_rate": 0.0004916110086641384,
|
|
"loss": 5.4296,
|
|
"mean_token_accuracy": 0.1620110884308815,
|
|
"num_tokens": 21032928.0,
|
|
"step": 12120
|
|
},
|
|
{
|
|
"entropy": 5.633784532546997,
|
|
"epoch": 0.9433962264150944,
|
|
"grad_norm": 1.6796875,
|
|
"learning_rate": 0.0004916035095222259,
|
|
"loss": 5.4832,
|
|
"mean_token_accuracy": 0.16601784080266951,
|
|
"num_tokens": 21041467.0,
|
|
"step": 12125
|
|
},
|
|
{
|
|
"entropy": 5.525217723846436,
|
|
"epoch": 0.9437852557868119,
|
|
"grad_norm": 1.4921875,
|
|
"learning_rate": 0.0004915960070936999,
|
|
"loss": 5.413,
|
|
"mean_token_accuracy": 0.17504813224077226,
|
|
"num_tokens": 21049325.0,
|
|
"step": 12130
|
|
},
|
|
{
|
|
"entropy": 5.597278642654419,
|
|
"epoch": 0.9441742851585294,
|
|
"grad_norm": 1.8046875,
|
|
"learning_rate": 0.0004915885013786742,
|
|
"loss": 5.463,
|
|
"mean_token_accuracy": 0.16030641943216323,
|
|
"num_tokens": 21057911.0,
|
|
"step": 12135
|
|
},
|
|
{
|
|
"entropy": 5.639433288574219,
|
|
"epoch": 0.944563314530247,
|
|
"grad_norm": 1.5546875,
|
|
"learning_rate": 0.0004915809923772628,
|
|
"loss": 5.4652,
|
|
"mean_token_accuracy": 0.15780694037675858,
|
|
"num_tokens": 21066974.0,
|
|
"step": 12140
|
|
},
|
|
{
|
|
"entropy": 5.57930326461792,
|
|
"epoch": 0.9449523439019646,
|
|
"grad_norm": 1.5703125,
|
|
"learning_rate": 0.0004915734800895796,
|
|
"loss": 5.3738,
|
|
"mean_token_accuracy": 0.16594722718000413,
|
|
"num_tokens": 21075591.0,
|
|
"step": 12145
|
|
},
|
|
{
|
|
"entropy": 5.547514152526856,
|
|
"epoch": 0.9453413732736822,
|
|
"grad_norm": 1.6015625,
|
|
"learning_rate": 0.0004915659645157383,
|
|
"loss": 5.4325,
|
|
"mean_token_accuracy": 0.16641419380903244,
|
|
"num_tokens": 21084496.0,
|
|
"step": 12150
|
|
},
|
|
{
|
|
"entropy": 5.559930515289307,
|
|
"epoch": 0.9457304026453998,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.0004915584456558535,
|
|
"loss": 5.327,
|
|
"mean_token_accuracy": 0.1706374853849411,
|
|
"num_tokens": 21092811.0,
|
|
"step": 12155
|
|
},
|
|
{
|
|
"entropy": 5.554985237121582,
|
|
"epoch": 0.9461194320171173,
|
|
"grad_norm": 1.828125,
|
|
"learning_rate": 0.0004915509235100388,
|
|
"loss": 5.3706,
|
|
"mean_token_accuracy": 0.1755172312259674,
|
|
"num_tokens": 21101449.0,
|
|
"step": 12160
|
|
},
|
|
{
|
|
"entropy": 5.658511829376221,
|
|
"epoch": 0.9465084613888348,
|
|
"grad_norm": 1.4921875,
|
|
"learning_rate": 0.0004915433980784086,
|
|
"loss": 5.4903,
|
|
"mean_token_accuracy": 0.1588090181350708,
|
|
"num_tokens": 21109476.0,
|
|
"step": 12165
|
|
},
|
|
{
|
|
"entropy": 5.559300708770752,
|
|
"epoch": 0.9468974907605524,
|
|
"grad_norm": 1.5625,
|
|
"learning_rate": 0.0004915358693610769,
|
|
"loss": 5.4089,
|
|
"mean_token_accuracy": 0.16485532820224763,
|
|
"num_tokens": 21118431.0,
|
|
"step": 12170
|
|
},
|
|
{
|
|
"entropy": 5.491687250137329,
|
|
"epoch": 0.94728652013227,
|
|
"grad_norm": 1.5234375,
|
|
"learning_rate": 0.0004915283373581581,
|
|
"loss": 5.3505,
|
|
"mean_token_accuracy": 0.16730640530586244,
|
|
"num_tokens": 21127390.0,
|
|
"step": 12175
|
|
},
|
|
{
|
|
"entropy": 5.615506315231324,
|
|
"epoch": 0.9476755495039876,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.0004915208020697664,
|
|
"loss": 5.4768,
|
|
"mean_token_accuracy": 0.16488441675901414,
|
|
"num_tokens": 21136323.0,
|
|
"step": 12180
|
|
},
|
|
{
|
|
"entropy": 5.530043601989746,
|
|
"epoch": 0.9480645788757052,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 0.0004915132634960162,
|
|
"loss": 5.4156,
|
|
"mean_token_accuracy": 0.17036765515804292,
|
|
"num_tokens": 21145228.0,
|
|
"step": 12185
|
|
},
|
|
{
|
|
"entropy": 5.5894242286682125,
|
|
"epoch": 0.9484536082474226,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.0004915057216370218,
|
|
"loss": 5.3128,
|
|
"mean_token_accuracy": 0.17234140187501906,
|
|
"num_tokens": 21153288.0,
|
|
"step": 12190
|
|
},
|
|
{
|
|
"entropy": 5.554346179962158,
|
|
"epoch": 0.9488426376191402,
|
|
"grad_norm": 1.5,
|
|
"learning_rate": 0.0004914981764928977,
|
|
"loss": 5.3784,
|
|
"mean_token_accuracy": 0.17709745466709137,
|
|
"num_tokens": 21161802.0,
|
|
"step": 12195
|
|
},
|
|
{
|
|
"entropy": 5.5001016616821286,
|
|
"epoch": 0.9492316669908578,
|
|
"grad_norm": 1.6875,
|
|
"learning_rate": 0.0004914906280637584,
|
|
"loss": 5.3102,
|
|
"mean_token_accuracy": 0.17752815634012223,
|
|
"num_tokens": 21170018.0,
|
|
"step": 12200
|
|
},
|
|
{
|
|
"entropy": 5.641617250442505,
|
|
"epoch": 0.9496206963625754,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.0004914830763497183,
|
|
"loss": 5.5303,
|
|
"mean_token_accuracy": 0.15591267943382264,
|
|
"num_tokens": 21179128.0,
|
|
"step": 12205
|
|
},
|
|
{
|
|
"entropy": 5.62851300239563,
|
|
"epoch": 0.950009725734293,
|
|
"grad_norm": 1.5625,
|
|
"learning_rate": 0.0004914755213508922,
|
|
"loss": 5.3513,
|
|
"mean_token_accuracy": 0.17078163027763366,
|
|
"num_tokens": 21188138.0,
|
|
"step": 12210
|
|
},
|
|
{
|
|
"entropy": 5.589785194396972,
|
|
"epoch": 0.9503987551060105,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 0.0004914679630673945,
|
|
"loss": 5.4201,
|
|
"mean_token_accuracy": 0.1664300560951233,
|
|
"num_tokens": 21196465.0,
|
|
"step": 12215
|
|
},
|
|
{
|
|
"entropy": 5.497233819961548,
|
|
"epoch": 0.950787784477728,
|
|
"grad_norm": 1.5234375,
|
|
"learning_rate": 0.0004914604014993401,
|
|
"loss": 5.3496,
|
|
"mean_token_accuracy": 0.16689626425504683,
|
|
"num_tokens": 21205309.0,
|
|
"step": 12220
|
|
},
|
|
{
|
|
"entropy": 5.503593921661377,
|
|
"epoch": 0.9511768138494456,
|
|
"grad_norm": 1.5390625,
|
|
"learning_rate": 0.0004914528366468436,
|
|
"loss": 5.3018,
|
|
"mean_token_accuracy": 0.17624219954013826,
|
|
"num_tokens": 21214216.0,
|
|
"step": 12225
|
|
},
|
|
{
|
|
"entropy": 5.516157102584839,
|
|
"epoch": 0.9515658432211632,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.0004914452685100199,
|
|
"loss": 5.3294,
|
|
"mean_token_accuracy": 0.17359803915023803,
|
|
"num_tokens": 21222246.0,
|
|
"step": 12230
|
|
},
|
|
{
|
|
"entropy": 5.561765098571778,
|
|
"epoch": 0.9519548725928808,
|
|
"grad_norm": 1.515625,
|
|
"learning_rate": 0.0004914376970889836,
|
|
"loss": 5.3972,
|
|
"mean_token_accuracy": 0.1665797770023346,
|
|
"num_tokens": 21230696.0,
|
|
"step": 12235
|
|
},
|
|
{
|
|
"entropy": 5.59852614402771,
|
|
"epoch": 0.9523439019645983,
|
|
"grad_norm": 1.515625,
|
|
"learning_rate": 0.0004914301223838497,
|
|
"loss": 5.5024,
|
|
"mean_token_accuracy": 0.1625322848558426,
|
|
"num_tokens": 21239909.0,
|
|
"step": 12240
|
|
},
|
|
{
|
|
"entropy": 5.513423013687134,
|
|
"epoch": 0.9527329313363159,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.0004914225443947334,
|
|
"loss": 5.3579,
|
|
"mean_token_accuracy": 0.1661682590842247,
|
|
"num_tokens": 21248124.0,
|
|
"step": 12245
|
|
},
|
|
{
|
|
"entropy": 5.6989874839782715,
|
|
"epoch": 0.9531219607080335,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0004914149631217494,
|
|
"loss": 5.5398,
|
|
"mean_token_accuracy": 0.15586884468793868,
|
|
"num_tokens": 21257042.0,
|
|
"step": 12250
|
|
},
|
|
{
|
|
"entropy": 5.656883668899536,
|
|
"epoch": 0.953510990079751,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004914073785650127,
|
|
"loss": 5.4641,
|
|
"mean_token_accuracy": 0.16630377620458603,
|
|
"num_tokens": 21265627.0,
|
|
"step": 12255
|
|
},
|
|
{
|
|
"entropy": 5.542170810699463,
|
|
"epoch": 0.9539000194514686,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.0004913997907246385,
|
|
"loss": 5.3805,
|
|
"mean_token_accuracy": 0.16810978800058365,
|
|
"num_tokens": 21273688.0,
|
|
"step": 12260
|
|
},
|
|
{
|
|
"entropy": 5.508345413208008,
|
|
"epoch": 0.9542890488231861,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.000491392199600742,
|
|
"loss": 5.3747,
|
|
"mean_token_accuracy": 0.17054288685321808,
|
|
"num_tokens": 21283432.0,
|
|
"step": 12265
|
|
},
|
|
{
|
|
"entropy": 5.628151369094849,
|
|
"epoch": 0.9546780781949037,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.0004913846051934382,
|
|
"loss": 5.4193,
|
|
"mean_token_accuracy": 0.16427808552980422,
|
|
"num_tokens": 21292003.0,
|
|
"step": 12270
|
|
},
|
|
{
|
|
"entropy": 5.5416093349456785,
|
|
"epoch": 0.9550671075666213,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.0004913770075028425,
|
|
"loss": 5.3215,
|
|
"mean_token_accuracy": 0.1750449761748314,
|
|
"num_tokens": 21299914.0,
|
|
"step": 12275
|
|
},
|
|
{
|
|
"entropy": 5.540078353881836,
|
|
"epoch": 0.9554561369383389,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.0004913694065290701,
|
|
"loss": 5.5363,
|
|
"mean_token_accuracy": 0.15762787610292434,
|
|
"num_tokens": 21309398.0,
|
|
"step": 12280
|
|
},
|
|
{
|
|
"entropy": 5.553359460830689,
|
|
"epoch": 0.9558451663100564,
|
|
"grad_norm": 1.5859375,
|
|
"learning_rate": 0.0004913618022722363,
|
|
"loss": 5.3742,
|
|
"mean_token_accuracy": 0.1718411311507225,
|
|
"num_tokens": 21317828.0,
|
|
"step": 12285
|
|
},
|
|
{
|
|
"entropy": 5.637666940689087,
|
|
"epoch": 0.9562341956817739,
|
|
"grad_norm": 1.515625,
|
|
"learning_rate": 0.0004913541947324566,
|
|
"loss": 5.4912,
|
|
"mean_token_accuracy": 0.16552940756082535,
|
|
"num_tokens": 21326266.0,
|
|
"step": 12290
|
|
},
|
|
{
|
|
"entropy": 5.602405786514282,
|
|
"epoch": 0.9566232250534915,
|
|
"grad_norm": 2.015625,
|
|
"learning_rate": 0.0004913465839098463,
|
|
"loss": 5.4081,
|
|
"mean_token_accuracy": 0.1617061033844948,
|
|
"num_tokens": 21335476.0,
|
|
"step": 12295
|
|
},
|
|
{
|
|
"entropy": 5.579249238967895,
|
|
"epoch": 0.9570122544252091,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.0004913389698045209,
|
|
"loss": 5.3521,
|
|
"mean_token_accuracy": 0.17059026062488555,
|
|
"num_tokens": 21344045.0,
|
|
"step": 12300
|
|
},
|
|
{
|
|
"entropy": 5.5715968132019045,
|
|
"epoch": 0.9574012837969267,
|
|
"grad_norm": 1.53125,
|
|
"learning_rate": 0.000491331352416596,
|
|
"loss": 5.3857,
|
|
"mean_token_accuracy": 0.1672879621386528,
|
|
"num_tokens": 21352309.0,
|
|
"step": 12305
|
|
},
|
|
{
|
|
"entropy": 5.543367862701416,
|
|
"epoch": 0.9577903131686443,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.0004913237317461872,
|
|
"loss": 5.4259,
|
|
"mean_token_accuracy": 0.16890395283699036,
|
|
"num_tokens": 21362164.0,
|
|
"step": 12310
|
|
},
|
|
{
|
|
"entropy": 5.632788753509521,
|
|
"epoch": 0.9581793425403617,
|
|
"grad_norm": 1.4921875,
|
|
"learning_rate": 0.00049131610779341,
|
|
"loss": 5.4221,
|
|
"mean_token_accuracy": 0.16740877777338029,
|
|
"num_tokens": 21372817.0,
|
|
"step": 12315
|
|
},
|
|
{
|
|
"entropy": 5.551085567474365,
|
|
"epoch": 0.9585683719120793,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.0004913084805583803,
|
|
"loss": 5.3829,
|
|
"mean_token_accuracy": 0.16717528104782103,
|
|
"num_tokens": 21381035.0,
|
|
"step": 12320
|
|
},
|
|
{
|
|
"entropy": 5.516797971725464,
|
|
"epoch": 0.9589574012837969,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.0004913008500412136,
|
|
"loss": 5.3469,
|
|
"mean_token_accuracy": 0.17566467225551605,
|
|
"num_tokens": 21390074.0,
|
|
"step": 12325
|
|
},
|
|
{
|
|
"entropy": 5.588978242874146,
|
|
"epoch": 0.9593464306555145,
|
|
"grad_norm": 1.5234375,
|
|
"learning_rate": 0.0004912932162420259,
|
|
"loss": 5.4025,
|
|
"mean_token_accuracy": 0.16604723185300826,
|
|
"num_tokens": 21398726.0,
|
|
"step": 12330
|
|
},
|
|
{
|
|
"entropy": 5.579054546356201,
|
|
"epoch": 0.9597354600272321,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 0.0004912855791609327,
|
|
"loss": 5.3758,
|
|
"mean_token_accuracy": 0.16327784806489945,
|
|
"num_tokens": 21407225.0,
|
|
"step": 12335
|
|
},
|
|
{
|
|
"entropy": 5.4908506870269775,
|
|
"epoch": 0.9601244893989496,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.0004912779387980502,
|
|
"loss": 5.3901,
|
|
"mean_token_accuracy": 0.16156468391418458,
|
|
"num_tokens": 21416746.0,
|
|
"step": 12340
|
|
},
|
|
{
|
|
"entropy": 5.5407885074615475,
|
|
"epoch": 0.9605135187706672,
|
|
"grad_norm": 1.5703125,
|
|
"learning_rate": 0.0004912702951534942,
|
|
"loss": 5.4574,
|
|
"mean_token_accuracy": 0.15704269856214523,
|
|
"num_tokens": 21425621.0,
|
|
"step": 12345
|
|
},
|
|
{
|
|
"entropy": 5.561798906326294,
|
|
"epoch": 0.9609025481423847,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.0004912626482273809,
|
|
"loss": 5.335,
|
|
"mean_token_accuracy": 0.17911162823438645,
|
|
"num_tokens": 21433674.0,
|
|
"step": 12350
|
|
},
|
|
{
|
|
"entropy": 5.577276563644409,
|
|
"epoch": 0.9612915775141023,
|
|
"grad_norm": 2.078125,
|
|
"learning_rate": 0.0004912549980198258,
|
|
"loss": 5.4178,
|
|
"mean_token_accuracy": 0.16573524475097656,
|
|
"num_tokens": 21442285.0,
|
|
"step": 12355
|
|
},
|
|
{
|
|
"entropy": 5.624950551986695,
|
|
"epoch": 0.9616806068858199,
|
|
"grad_norm": 1.765625,
|
|
"learning_rate": 0.0004912473445309455,
|
|
"loss": 5.382,
|
|
"mean_token_accuracy": 0.17169068604707718,
|
|
"num_tokens": 21450345.0,
|
|
"step": 12360
|
|
},
|
|
{
|
|
"entropy": 5.4715653419494625,
|
|
"epoch": 0.9620696362575375,
|
|
"grad_norm": 1.71875,
|
|
"learning_rate": 0.000491239687760856,
|
|
"loss": 5.2868,
|
|
"mean_token_accuracy": 0.1779909610748291,
|
|
"num_tokens": 21458618.0,
|
|
"step": 12365
|
|
},
|
|
{
|
|
"entropy": 5.475194072723388,
|
|
"epoch": 0.962458665629255,
|
|
"grad_norm": 1.4921875,
|
|
"learning_rate": 0.0004912320277096732,
|
|
"loss": 5.3258,
|
|
"mean_token_accuracy": 0.16934404969215394,
|
|
"num_tokens": 21467410.0,
|
|
"step": 12370
|
|
},
|
|
{
|
|
"entropy": 5.530296754837036,
|
|
"epoch": 0.9628476950009726,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.0004912243643775137,
|
|
"loss": 5.3804,
|
|
"mean_token_accuracy": 0.16468485593795776,
|
|
"num_tokens": 21475454.0,
|
|
"step": 12375
|
|
},
|
|
{
|
|
"entropy": 5.53042163848877,
|
|
"epoch": 0.9632367243726901,
|
|
"grad_norm": 1.53125,
|
|
"learning_rate": 0.0004912166977644936,
|
|
"loss": 5.3115,
|
|
"mean_token_accuracy": 0.17639981657266618,
|
|
"num_tokens": 21483431.0,
|
|
"step": 12380
|
|
},
|
|
{
|
|
"entropy": 5.562231969833374,
|
|
"epoch": 0.9636257537444077,
|
|
"grad_norm": 1.7109375,
|
|
"learning_rate": 0.0004912090278707293,
|
|
"loss": 5.371,
|
|
"mean_token_accuracy": 0.16846155971288682,
|
|
"num_tokens": 21491199.0,
|
|
"step": 12385
|
|
},
|
|
{
|
|
"entropy": 5.551068687438965,
|
|
"epoch": 0.9640147831161253,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.000491201354696337,
|
|
"loss": 5.4612,
|
|
"mean_token_accuracy": 0.16482184827327728,
|
|
"num_tokens": 21500339.0,
|
|
"step": 12390
|
|
},
|
|
{
|
|
"entropy": 5.578508949279785,
|
|
"epoch": 0.9644038124878428,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 0.0004911936782414334,
|
|
"loss": 5.3923,
|
|
"mean_token_accuracy": 0.165883569419384,
|
|
"num_tokens": 21508945.0,
|
|
"step": 12395
|
|
},
|
|
{
|
|
"entropy": 5.609786558151245,
|
|
"epoch": 0.9647928418595604,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.0004911859985061348,
|
|
"loss": 5.3756,
|
|
"mean_token_accuracy": 0.16790519058704376,
|
|
"num_tokens": 21517649.0,
|
|
"step": 12400
|
|
},
|
|
{
|
|
"entropy": 5.560817432403565,
|
|
"epoch": 0.965181871231278,
|
|
"grad_norm": 1.515625,
|
|
"learning_rate": 0.0004911783154905577,
|
|
"loss": 5.3751,
|
|
"mean_token_accuracy": 0.1683609142899513,
|
|
"num_tokens": 21526650.0,
|
|
"step": 12405
|
|
},
|
|
{
|
|
"entropy": 5.586350631713867,
|
|
"epoch": 0.9655709006029956,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.0004911706291948188,
|
|
"loss": 5.3799,
|
|
"mean_token_accuracy": 0.17076589167118073,
|
|
"num_tokens": 21535401.0,
|
|
"step": 12410
|
|
},
|
|
{
|
|
"entropy": 5.6253735542297365,
|
|
"epoch": 0.9659599299747131,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.0004911629396190348,
|
|
"loss": 5.4136,
|
|
"mean_token_accuracy": 0.16528507322072983,
|
|
"num_tokens": 21543973.0,
|
|
"step": 12415
|
|
},
|
|
{
|
|
"entropy": 5.52022967338562,
|
|
"epoch": 0.9663489593464306,
|
|
"grad_norm": 1.515625,
|
|
"learning_rate": 0.0004911552467633221,
|
|
"loss": 5.3473,
|
|
"mean_token_accuracy": 0.16995420902967454,
|
|
"num_tokens": 21552875.0,
|
|
"step": 12420
|
|
},
|
|
{
|
|
"entropy": 5.431509065628052,
|
|
"epoch": 0.9667379887181482,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.0004911475506277976,
|
|
"loss": 5.279,
|
|
"mean_token_accuracy": 0.17634952068328857,
|
|
"num_tokens": 21561469.0,
|
|
"step": 12425
|
|
},
|
|
{
|
|
"entropy": 5.5322596549987795,
|
|
"epoch": 0.9671270180898658,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 0.000491139851212578,
|
|
"loss": 5.3693,
|
|
"mean_token_accuracy": 0.1743447095155716,
|
|
"num_tokens": 21569523.0,
|
|
"step": 12430
|
|
},
|
|
{
|
|
"entropy": 5.490969467163086,
|
|
"epoch": 0.9675160474615834,
|
|
"grad_norm": 1.53125,
|
|
"learning_rate": 0.0004911321485177802,
|
|
"loss": 5.3068,
|
|
"mean_token_accuracy": 0.17414761185646058,
|
|
"num_tokens": 21577700.0,
|
|
"step": 12435
|
|
},
|
|
{
|
|
"entropy": 5.58392858505249,
|
|
"epoch": 0.967905076833301,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.0004911244425435212,
|
|
"loss": 5.3863,
|
|
"mean_token_accuracy": 0.17134580463171006,
|
|
"num_tokens": 21586233.0,
|
|
"step": 12440
|
|
},
|
|
{
|
|
"entropy": 5.5466711044311525,
|
|
"epoch": 0.9682941062050184,
|
|
"grad_norm": 2.25,
|
|
"learning_rate": 0.0004911167332899176,
|
|
"loss": 5.4219,
|
|
"mean_token_accuracy": 0.17210243493318558,
|
|
"num_tokens": 21595330.0,
|
|
"step": 12445
|
|
},
|
|
{
|
|
"entropy": 5.532320356369018,
|
|
"epoch": 0.968683135576736,
|
|
"grad_norm": 1.7578125,
|
|
"learning_rate": 0.0004911090207570867,
|
|
"loss": 5.3474,
|
|
"mean_token_accuracy": 0.17149314284324646,
|
|
"num_tokens": 21604522.0,
|
|
"step": 12450
|
|
},
|
|
{
|
|
"entropy": 5.58540153503418,
|
|
"epoch": 0.9690721649484536,
|
|
"grad_norm": 1.5390625,
|
|
"learning_rate": 0.0004911013049451453,
|
|
"loss": 5.3348,
|
|
"mean_token_accuracy": 0.16969534903764724,
|
|
"num_tokens": 21613599.0,
|
|
"step": 12455
|
|
},
|
|
{
|
|
"entropy": 5.531045198440552,
|
|
"epoch": 0.9694611943201712,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.0004910935858542106,
|
|
"loss": 5.421,
|
|
"mean_token_accuracy": 0.1644749939441681,
|
|
"num_tokens": 21622587.0,
|
|
"step": 12460
|
|
},
|
|
{
|
|
"entropy": 5.5519630908966064,
|
|
"epoch": 0.9698502236918888,
|
|
"grad_norm": 1.5078125,
|
|
"learning_rate": 0.0004910858634843997,
|
|
"loss": 5.4035,
|
|
"mean_token_accuracy": 0.1654059812426567,
|
|
"num_tokens": 21630782.0,
|
|
"step": 12465
|
|
},
|
|
{
|
|
"entropy": 5.554431581497193,
|
|
"epoch": 0.9702392530636063,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.0004910781378358297,
|
|
"loss": 5.3007,
|
|
"mean_token_accuracy": 0.17476201206445693,
|
|
"num_tokens": 21639354.0,
|
|
"step": 12470
|
|
},
|
|
{
|
|
"entropy": 5.46932897567749,
|
|
"epoch": 0.9706282824353238,
|
|
"grad_norm": 1.6796875,
|
|
"learning_rate": 0.0004910704089086178,
|
|
"loss": 5.4476,
|
|
"mean_token_accuracy": 0.16485905647277832,
|
|
"num_tokens": 21648292.0,
|
|
"step": 12475
|
|
},
|
|
{
|
|
"entropy": 5.596227788925171,
|
|
"epoch": 0.9710173118070414,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 0.0004910626767028815,
|
|
"loss": 5.4065,
|
|
"mean_token_accuracy": 0.16999571919441223,
|
|
"num_tokens": 21657382.0,
|
|
"step": 12480
|
|
},
|
|
{
|
|
"entropy": 5.588405752182007,
|
|
"epoch": 0.971406341178759,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.0004910549412187379,
|
|
"loss": 5.3672,
|
|
"mean_token_accuracy": 0.16503708213567733,
|
|
"num_tokens": 21666327.0,
|
|
"step": 12485
|
|
},
|
|
{
|
|
"entropy": 5.575157308578492,
|
|
"epoch": 0.9717953705504766,
|
|
"grad_norm": 1.5625,
|
|
"learning_rate": 0.0004910472024563045,
|
|
"loss": 5.4165,
|
|
"mean_token_accuracy": 0.17350658029317856,
|
|
"num_tokens": 21674882.0,
|
|
"step": 12490
|
|
},
|
|
{
|
|
"entropy": 5.6440962791442875,
|
|
"epoch": 0.9721843999221941,
|
|
"grad_norm": 1.5390625,
|
|
"learning_rate": 0.0004910394604156987,
|
|
"loss": 5.4818,
|
|
"mean_token_accuracy": 0.16394657045602798,
|
|
"num_tokens": 21683255.0,
|
|
"step": 12495
|
|
},
|
|
{
|
|
"entropy": 5.62670750617981,
|
|
"epoch": 0.9725734292939117,
|
|
"grad_norm": 1.5078125,
|
|
"learning_rate": 0.0004910317150970379,
|
|
"loss": 5.3456,
|
|
"mean_token_accuracy": 0.17043299376964569,
|
|
"num_tokens": 21692274.0,
|
|
"step": 12500
|
|
},
|
|
{
|
|
"entropy": 5.439621496200561,
|
|
"epoch": 0.9729624586656292,
|
|
"grad_norm": 1.5859375,
|
|
"learning_rate": 0.0004910239665004397,
|
|
"loss": 5.2848,
|
|
"mean_token_accuracy": 0.17927485853433608,
|
|
"num_tokens": 21700767.0,
|
|
"step": 12505
|
|
},
|
|
{
|
|
"entropy": 5.526528263092041,
|
|
"epoch": 0.9733514880373468,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 0.0004910162146260216,
|
|
"loss": 5.4341,
|
|
"mean_token_accuracy": 0.16639893651008605,
|
|
"num_tokens": 21709430.0,
|
|
"step": 12510
|
|
},
|
|
{
|
|
"entropy": 5.52956256866455,
|
|
"epoch": 0.9737405174090644,
|
|
"grad_norm": 1.609375,
|
|
"learning_rate": 0.0004910084594739013,
|
|
"loss": 5.3422,
|
|
"mean_token_accuracy": 0.17064064294099807,
|
|
"num_tokens": 21717978.0,
|
|
"step": 12515
|
|
},
|
|
{
|
|
"entropy": 5.42146315574646,
|
|
"epoch": 0.9741295467807819,
|
|
"grad_norm": 1.59375,
|
|
"learning_rate": 0.0004910007010441964,
|
|
"loss": 5.2039,
|
|
"mean_token_accuracy": 0.18186760395765306,
|
|
"num_tokens": 21726608.0,
|
|
"step": 12520
|
|
},
|
|
{
|
|
"entropy": 5.535458374023437,
|
|
"epoch": 0.9745185761524995,
|
|
"grad_norm": 1.5859375,
|
|
"learning_rate": 0.0004909929393370248,
|
|
"loss": 5.3757,
|
|
"mean_token_accuracy": 0.169576233625412,
|
|
"num_tokens": 21735402.0,
|
|
"step": 12525
|
|
},
|
|
{
|
|
"entropy": 5.538657903671265,
|
|
"epoch": 0.9749076055242171,
|
|
"grad_norm": 1.6171875,
|
|
"learning_rate": 0.0004909851743525041,
|
|
"loss": 5.362,
|
|
"mean_token_accuracy": 0.170218725502491,
|
|
"num_tokens": 21744620.0,
|
|
"step": 12530
|
|
},
|
|
{
|
|
"entropy": 5.560051107406617,
|
|
"epoch": 0.9752966348959347,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.000490977406090752,
|
|
"loss": 5.3958,
|
|
"mean_token_accuracy": 0.16788250654935838,
|
|
"num_tokens": 21753270.0,
|
|
"step": 12535
|
|
},
|
|
{
|
|
"entropy": 5.654540109634399,
|
|
"epoch": 0.9756856642676522,
|
|
"grad_norm": 1.78125,
|
|
"learning_rate": 0.0004909696345518867,
|
|
"loss": 5.4239,
|
|
"mean_token_accuracy": 0.16545404493808746,
|
|
"num_tokens": 21761477.0,
|
|
"step": 12540
|
|
},
|
|
{
|
|
"entropy": 5.465372085571289,
|
|
"epoch": 0.9760746936393697,
|
|
"grad_norm": 1.6875,
|
|
"learning_rate": 0.0004909618597360258,
|
|
"loss": 5.3426,
|
|
"mean_token_accuracy": 0.1710445001721382,
|
|
"num_tokens": 21769925.0,
|
|
"step": 12545
|
|
},
|
|
{
|
|
"entropy": 5.5323145389556885,
|
|
"epoch": 0.9764637230110873,
|
|
"grad_norm": 1.5390625,
|
|
"learning_rate": 0.0004909540816432876,
|
|
"loss": 5.4147,
|
|
"mean_token_accuracy": 0.17307539731264115,
|
|
"num_tokens": 21778850.0,
|
|
"step": 12550
|
|
},
|
|
{
|
|
"entropy": 5.599014472961426,
|
|
"epoch": 0.9768527523828049,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.0004909463002737897,
|
|
"loss": 5.4578,
|
|
"mean_token_accuracy": 0.16602482572197913,
|
|
"num_tokens": 21787408.0,
|
|
"step": 12555
|
|
},
|
|
{
|
|
"entropy": 5.633021306991577,
|
|
"epoch": 0.9772417817545225,
|
|
"grad_norm": 1.6171875,
|
|
"learning_rate": 0.0004909385156276506,
|
|
"loss": 5.4026,
|
|
"mean_token_accuracy": 0.17237799018621444,
|
|
"num_tokens": 21795967.0,
|
|
"step": 12560
|
|
},
|
|
{
|
|
"entropy": 5.518686676025391,
|
|
"epoch": 0.9776308111262401,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.0004909307277049881,
|
|
"loss": 5.3573,
|
|
"mean_token_accuracy": 0.16549931913614274,
|
|
"num_tokens": 21804472.0,
|
|
"step": 12565
|
|
},
|
|
{
|
|
"entropy": 5.460463142395019,
|
|
"epoch": 0.9780198404979576,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0004909229365059205,
|
|
"loss": 5.344,
|
|
"mean_token_accuracy": 0.1692412778735161,
|
|
"num_tokens": 21813233.0,
|
|
"step": 12570
|
|
},
|
|
{
|
|
"entropy": 5.489893674850464,
|
|
"epoch": 0.9784088698696751,
|
|
"grad_norm": 1.5,
|
|
"learning_rate": 0.0004909151420305661,
|
|
"loss": 5.2328,
|
|
"mean_token_accuracy": 0.18162205666303635,
|
|
"num_tokens": 21821413.0,
|
|
"step": 12575
|
|
},
|
|
{
|
|
"entropy": 5.494278621673584,
|
|
"epoch": 0.9787978992413927,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.000490907344279043,
|
|
"loss": 5.3276,
|
|
"mean_token_accuracy": 0.1738600954413414,
|
|
"num_tokens": 21829222.0,
|
|
"step": 12580
|
|
},
|
|
{
|
|
"entropy": 5.498348617553711,
|
|
"epoch": 0.9791869286131103,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.0004908995432514698,
|
|
"loss": 5.357,
|
|
"mean_token_accuracy": 0.1704433500766754,
|
|
"num_tokens": 21837033.0,
|
|
"step": 12585
|
|
},
|
|
{
|
|
"entropy": 5.608533430099487,
|
|
"epoch": 0.9795759579848279,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 0.0004908917389479645,
|
|
"loss": 5.4112,
|
|
"mean_token_accuracy": 0.16187066733837127,
|
|
"num_tokens": 21845464.0,
|
|
"step": 12590
|
|
},
|
|
{
|
|
"entropy": 5.488953876495361,
|
|
"epoch": 0.9799649873565455,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.0004908839313686456,
|
|
"loss": 5.3437,
|
|
"mean_token_accuracy": 0.17201852202415466,
|
|
"num_tokens": 21853497.0,
|
|
"step": 12595
|
|
},
|
|
{
|
|
"entropy": 5.5987184047698975,
|
|
"epoch": 0.980354016728263,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.0004908761205136319,
|
|
"loss": 5.4216,
|
|
"mean_token_accuracy": 0.1672752842307091,
|
|
"num_tokens": 21861710.0,
|
|
"step": 12600
|
|
},
|
|
{
|
|
"entropy": 5.602752923965454,
|
|
"epoch": 0.9807430460999805,
|
|
"grad_norm": 1.5859375,
|
|
"learning_rate": 0.0004908683063830414,
|
|
"loss": 5.3813,
|
|
"mean_token_accuracy": 0.16177596747875214,
|
|
"num_tokens": 21870472.0,
|
|
"step": 12605
|
|
},
|
|
{
|
|
"entropy": 5.602488660812378,
|
|
"epoch": 0.9811320754716981,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 0.0004908604889769932,
|
|
"loss": 5.4327,
|
|
"mean_token_accuracy": 0.1645247995853424,
|
|
"num_tokens": 21878287.0,
|
|
"step": 12610
|
|
},
|
|
{
|
|
"entropy": 5.639327526092529,
|
|
"epoch": 0.9815211048434157,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.0004908526682956054,
|
|
"loss": 5.4823,
|
|
"mean_token_accuracy": 0.16139356791973114,
|
|
"num_tokens": 21887587.0,
|
|
"step": 12615
|
|
},
|
|
{
|
|
"entropy": 5.5384681224823,
|
|
"epoch": 0.9819101342151333,
|
|
"grad_norm": 1.4921875,
|
|
"learning_rate": 0.0004908448443389972,
|
|
"loss": 5.3295,
|
|
"mean_token_accuracy": 0.16925830990076066,
|
|
"num_tokens": 21895923.0,
|
|
"step": 12620
|
|
},
|
|
{
|
|
"entropy": 5.5761942863464355,
|
|
"epoch": 0.9822991635868508,
|
|
"grad_norm": 1.578125,
|
|
"learning_rate": 0.0004908370171072869,
|
|
"loss": 5.3548,
|
|
"mean_token_accuracy": 0.1748336911201477,
|
|
"num_tokens": 21904439.0,
|
|
"step": 12625
|
|
},
|
|
{
|
|
"entropy": 5.532333850860596,
|
|
"epoch": 0.9826881929585684,
|
|
"grad_norm": 1.5625,
|
|
"learning_rate": 0.0004908291866005933,
|
|
"loss": 5.3123,
|
|
"mean_token_accuracy": 0.1754220023751259,
|
|
"num_tokens": 21912473.0,
|
|
"step": 12630
|
|
},
|
|
{
|
|
"entropy": 5.497559642791748,
|
|
"epoch": 0.9830772223302859,
|
|
"grad_norm": 2.109375,
|
|
"learning_rate": 0.0004908213528190355,
|
|
"loss": 5.3909,
|
|
"mean_token_accuracy": 0.16665016785264014,
|
|
"num_tokens": 21921631.0,
|
|
"step": 12635
|
|
},
|
|
{
|
|
"entropy": 5.478603982925415,
|
|
"epoch": 0.9834662517020035,
|
|
"grad_norm": 1.921875,
|
|
"learning_rate": 0.0004908135157627321,
|
|
"loss": 5.3025,
|
|
"mean_token_accuracy": 0.1735884353518486,
|
|
"num_tokens": 21929984.0,
|
|
"step": 12640
|
|
},
|
|
{
|
|
"entropy": 5.47756519317627,
|
|
"epoch": 0.9838552810737211,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.0004908056754318022,
|
|
"loss": 5.2545,
|
|
"mean_token_accuracy": 0.1734400436282158,
|
|
"num_tokens": 21937349.0,
|
|
"step": 12645
|
|
},
|
|
{
|
|
"entropy": 5.495678520202636,
|
|
"epoch": 0.9842443104454386,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.0004907978318263646,
|
|
"loss": 5.3983,
|
|
"mean_token_accuracy": 0.16898857802152634,
|
|
"num_tokens": 21946176.0,
|
|
"step": 12650
|
|
},
|
|
{
|
|
"entropy": 5.547983980178833,
|
|
"epoch": 0.9846333398171562,
|
|
"grad_norm": 1.5625,
|
|
"learning_rate": 0.0004907899849465383,
|
|
"loss": 5.3466,
|
|
"mean_token_accuracy": 0.1739278793334961,
|
|
"num_tokens": 21954645.0,
|
|
"step": 12655
|
|
},
|
|
{
|
|
"entropy": 5.566146564483643,
|
|
"epoch": 0.9850223691888738,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.0004907821347924424,
|
|
"loss": 5.4061,
|
|
"mean_token_accuracy": 0.16499786227941513,
|
|
"num_tokens": 21963290.0,
|
|
"step": 12660
|
|
},
|
|
{
|
|
"entropy": 5.590229082107544,
|
|
"epoch": 0.9854113985605913,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.0004907742813641963,
|
|
"loss": 5.3803,
|
|
"mean_token_accuracy": 0.16901493370532988,
|
|
"num_tokens": 21971005.0,
|
|
"step": 12665
|
|
},
|
|
{
|
|
"entropy": 5.506345939636231,
|
|
"epoch": 0.9858004279323089,
|
|
"grad_norm": 1.7578125,
|
|
"learning_rate": 0.0004907664246619187,
|
|
"loss": 5.318,
|
|
"mean_token_accuracy": 0.17287847995758057,
|
|
"num_tokens": 21980067.0,
|
|
"step": 12670
|
|
},
|
|
{
|
|
"entropy": 5.535951900482178,
|
|
"epoch": 0.9861894573040264,
|
|
"grad_norm": 1.578125,
|
|
"learning_rate": 0.0004907585646857293,
|
|
"loss": 5.3441,
|
|
"mean_token_accuracy": 0.16887053102254868,
|
|
"num_tokens": 21988511.0,
|
|
"step": 12675
|
|
},
|
|
{
|
|
"entropy": 5.521044683456421,
|
|
"epoch": 0.986578486675744,
|
|
"grad_norm": 1.5546875,
|
|
"learning_rate": 0.0004907507014357467,
|
|
"loss": 5.34,
|
|
"mean_token_accuracy": 0.16689002960920335,
|
|
"num_tokens": 21997074.0,
|
|
"step": 12680
|
|
},
|
|
{
|
|
"entropy": 5.555815696716309,
|
|
"epoch": 0.9869675160474616,
|
|
"grad_norm": 1.9296875,
|
|
"learning_rate": 0.0004907428349120909,
|
|
"loss": 5.4665,
|
|
"mean_token_accuracy": 0.1642643094062805,
|
|
"num_tokens": 22005412.0,
|
|
"step": 12685
|
|
},
|
|
{
|
|
"entropy": 5.512627267837525,
|
|
"epoch": 0.9873565454191792,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.0004907349651148809,
|
|
"loss": 5.2672,
|
|
"mean_token_accuracy": 0.17630641758441926,
|
|
"num_tokens": 22013588.0,
|
|
"step": 12690
|
|
},
|
|
{
|
|
"entropy": 5.540982818603515,
|
|
"epoch": 0.9877455747908968,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0004907270920442361,
|
|
"loss": 5.4038,
|
|
"mean_token_accuracy": 0.1709127902984619,
|
|
"num_tokens": 22021669.0,
|
|
"step": 12695
|
|
},
|
|
{
|
|
"entropy": 5.507408332824707,
|
|
"epoch": 0.9881346041626142,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 0.0004907192157002762,
|
|
"loss": 5.2788,
|
|
"mean_token_accuracy": 0.1766637980937958,
|
|
"num_tokens": 22030295.0,
|
|
"step": 12700
|
|
},
|
|
{
|
|
"entropy": 5.558818006515503,
|
|
"epoch": 0.9885236335343318,
|
|
"grad_norm": 1.671875,
|
|
"learning_rate": 0.0004907113360831204,
|
|
"loss": 5.4359,
|
|
"mean_token_accuracy": 0.1616995304822922,
|
|
"num_tokens": 22038924.0,
|
|
"step": 12705
|
|
},
|
|
{
|
|
"entropy": 5.555681467056274,
|
|
"epoch": 0.9889126629060494,
|
|
"grad_norm": 1.5234375,
|
|
"learning_rate": 0.0004907034531928886,
|
|
"loss": 5.3437,
|
|
"mean_token_accuracy": 0.1774219810962677,
|
|
"num_tokens": 22047586.0,
|
|
"step": 12710
|
|
},
|
|
{
|
|
"entropy": 5.5058817863464355,
|
|
"epoch": 0.989301692277767,
|
|
"grad_norm": 1.8203125,
|
|
"learning_rate": 0.0004906955670297001,
|
|
"loss": 5.3141,
|
|
"mean_token_accuracy": 0.16815177500247955,
|
|
"num_tokens": 22055695.0,
|
|
"step": 12715
|
|
},
|
|
{
|
|
"entropy": 5.634102725982666,
|
|
"epoch": 0.9896907216494846,
|
|
"grad_norm": 1.6953125,
|
|
"learning_rate": 0.0004906876775936746,
|
|
"loss": 5.4947,
|
|
"mean_token_accuracy": 0.16482122838497162,
|
|
"num_tokens": 22064472.0,
|
|
"step": 12720
|
|
},
|
|
{
|
|
"entropy": 5.593327903747559,
|
|
"epoch": 0.990079751021202,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.0004906797848849321,
|
|
"loss": 5.3991,
|
|
"mean_token_accuracy": 0.16168297231197357,
|
|
"num_tokens": 22072726.0,
|
|
"step": 12725
|
|
},
|
|
{
|
|
"entropy": 5.542585945129394,
|
|
"epoch": 0.9904687803929196,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.000490671888903592,
|
|
"loss": 5.3039,
|
|
"mean_token_accuracy": 0.1760962650179863,
|
|
"num_tokens": 22081074.0,
|
|
"step": 12730
|
|
},
|
|
{
|
|
"entropy": 5.494793558120728,
|
|
"epoch": 0.9908578097646372,
|
|
"grad_norm": 1.5234375,
|
|
"learning_rate": 0.0004906639896497744,
|
|
"loss": 5.2924,
|
|
"mean_token_accuracy": 0.17551180273294448,
|
|
"num_tokens": 22089924.0,
|
|
"step": 12735
|
|
},
|
|
{
|
|
"entropy": 5.545717668533325,
|
|
"epoch": 0.9912468391363548,
|
|
"grad_norm": 1.640625,
|
|
"learning_rate": 0.0004906560871235988,
|
|
"loss": 5.3033,
|
|
"mean_token_accuracy": 0.17040894627571107,
|
|
"num_tokens": 22099088.0,
|
|
"step": 12740
|
|
},
|
|
{
|
|
"entropy": 5.597740554809571,
|
|
"epoch": 0.9916358685080724,
|
|
"grad_norm": 1.7109375,
|
|
"learning_rate": 0.0004906481813251854,
|
|
"loss": 5.4783,
|
|
"mean_token_accuracy": 0.16306995898485183,
|
|
"num_tokens": 22108344.0,
|
|
"step": 12745
|
|
},
|
|
{
|
|
"entropy": 5.564219808578491,
|
|
"epoch": 0.9920248978797899,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.0004906402722546542,
|
|
"loss": 5.3566,
|
|
"mean_token_accuracy": 0.16615731865167618,
|
|
"num_tokens": 22116476.0,
|
|
"step": 12750
|
|
},
|
|
{
|
|
"entropy": 5.611138486862183,
|
|
"epoch": 0.9924139272515075,
|
|
"grad_norm": 1.5546875,
|
|
"learning_rate": 0.000490632359912125,
|
|
"loss": 5.4735,
|
|
"mean_token_accuracy": 0.1599627271294594,
|
|
"num_tokens": 22125445.0,
|
|
"step": 12755
|
|
},
|
|
{
|
|
"entropy": 5.612223339080811,
|
|
"epoch": 0.992802956623225,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 0.000490624444297718,
|
|
"loss": 5.5115,
|
|
"mean_token_accuracy": 0.15771945863962172,
|
|
"num_tokens": 22134886.0,
|
|
"step": 12760
|
|
},
|
|
{
|
|
"entropy": 5.515939521789551,
|
|
"epoch": 0.9931919859949426,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.0004906165254115533,
|
|
"loss": 5.3309,
|
|
"mean_token_accuracy": 0.1733183041214943,
|
|
"num_tokens": 22144521.0,
|
|
"step": 12765
|
|
},
|
|
{
|
|
"entropy": 5.500012922286987,
|
|
"epoch": 0.9935810153666602,
|
|
"grad_norm": 1.6484375,
|
|
"learning_rate": 0.000490608603253751,
|
|
"loss": 5.3418,
|
|
"mean_token_accuracy": 0.1769414559006691,
|
|
"num_tokens": 22152754.0,
|
|
"step": 12770
|
|
},
|
|
{
|
|
"entropy": 5.591070699691772,
|
|
"epoch": 0.9939700447383778,
|
|
"grad_norm": 1.765625,
|
|
"learning_rate": 0.0004906006778244312,
|
|
"loss": 5.3434,
|
|
"mean_token_accuracy": 0.1685001879930496,
|
|
"num_tokens": 22161711.0,
|
|
"step": 12775
|
|
},
|
|
{
|
|
"entropy": 5.608580303192139,
|
|
"epoch": 0.9943590741100953,
|
|
"grad_norm": 1.59375,
|
|
"learning_rate": 0.0004905927491237145,
|
|
"loss": 5.4692,
|
|
"mean_token_accuracy": 0.16658519208431244,
|
|
"num_tokens": 22169762.0,
|
|
"step": 12780
|
|
},
|
|
{
|
|
"entropy": 5.4660426616668705,
|
|
"epoch": 0.9947481034818129,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 0.0004905848171517208,
|
|
"loss": 5.3108,
|
|
"mean_token_accuracy": 0.173878276348114,
|
|
"num_tokens": 22178415.0,
|
|
"step": 12785
|
|
},
|
|
{
|
|
"entropy": 5.412874507904053,
|
|
"epoch": 0.9951371328535304,
|
|
"grad_norm": 1.65625,
|
|
"learning_rate": 0.0004905768819085706,
|
|
"loss": 5.2655,
|
|
"mean_token_accuracy": 0.17446559369564058,
|
|
"num_tokens": 22187643.0,
|
|
"step": 12790
|
|
},
|
|
{
|
|
"entropy": 5.489374399185181,
|
|
"epoch": 0.995526162225248,
|
|
"grad_norm": 1.5234375,
|
|
"learning_rate": 0.0004905689433943846,
|
|
"loss": 5.2934,
|
|
"mean_token_accuracy": 0.17443826347589492,
|
|
"num_tokens": 22196355.0,
|
|
"step": 12795
|
|
},
|
|
{
|
|
"entropy": 5.640457391738892,
|
|
"epoch": 0.9959151915969656,
|
|
"grad_norm": 1.7890625,
|
|
"learning_rate": 0.0004905610016092828,
|
|
"loss": 5.3993,
|
|
"mean_token_accuracy": 0.16902930289506912,
|
|
"num_tokens": 22204648.0,
|
|
"step": 12800
|
|
},
|
|
{
|
|
"entropy": 5.539623880386353,
|
|
"epoch": 0.9963042209686831,
|
|
"grad_norm": 1.6015625,
|
|
"learning_rate": 0.0004905530565533859,
|
|
"loss": 5.3875,
|
|
"mean_token_accuracy": 0.16953061074018477,
|
|
"num_tokens": 22212811.0,
|
|
"step": 12805
|
|
},
|
|
{
|
|
"entropy": 5.485774564743042,
|
|
"epoch": 0.9966932503404007,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.0004905451082268146,
|
|
"loss": 5.3426,
|
|
"mean_token_accuracy": 0.1691968783736229,
|
|
"num_tokens": 22220611.0,
|
|
"step": 12810
|
|
},
|
|
{
|
|
"entropy": 5.641964864730835,
|
|
"epoch": 0.9970822797121183,
|
|
"grad_norm": 1.6328125,
|
|
"learning_rate": 0.0004905371566296891,
|
|
"loss": 5.3741,
|
|
"mean_token_accuracy": 0.16540755480527877,
|
|
"num_tokens": 22229606.0,
|
|
"step": 12815
|
|
},
|
|
{
|
|
"entropy": 5.624663305282593,
|
|
"epoch": 0.9974713090838359,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.0004905292017621305,
|
|
"loss": 5.3701,
|
|
"mean_token_accuracy": 0.17140647917985916,
|
|
"num_tokens": 22238157.0,
|
|
"step": 12820
|
|
},
|
|
{
|
|
"entropy": 5.516221189498902,
|
|
"epoch": 0.9978603384555534,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 0.0004905212436242593,
|
|
"loss": 5.3797,
|
|
"mean_token_accuracy": 0.16921704709529878,
|
|
"num_tokens": 22246696.0,
|
|
"step": 12825
|
|
},
|
|
{
|
|
"entropy": 5.5207586765289305,
|
|
"epoch": 0.9982493678272709,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.0004905132822161962,
|
|
"loss": 5.4261,
|
|
"mean_token_accuracy": 0.16652178019285202,
|
|
"num_tokens": 22255028.0,
|
|
"step": 12830
|
|
},
|
|
{
|
|
"entropy": 5.688052225112915,
|
|
"epoch": 0.9986383971989885,
|
|
"grad_norm": 1.7734375,
|
|
"learning_rate": 0.0004905053175380621,
|
|
"loss": 5.4463,
|
|
"mean_token_accuracy": 0.16639384031295776,
|
|
"num_tokens": 22263198.0,
|
|
"step": 12835
|
|
},
|
|
{
|
|
"entropy": 5.667515611648559,
|
|
"epoch": 0.9990274265707061,
|
|
"grad_norm": 1.546875,
|
|
"learning_rate": 0.0004904973495899778,
|
|
"loss": 5.4711,
|
|
"mean_token_accuracy": 0.16980278640985488,
|
|
"num_tokens": 22273780.0,
|
|
"step": 12840
|
|
},
|
|
{
|
|
"entropy": 5.650799417495728,
|
|
"epoch": 0.9994164559424237,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.0004904893783720642,
|
|
"loss": 5.4837,
|
|
"mean_token_accuracy": 0.16519640684127807,
|
|
"num_tokens": 22281545.0,
|
|
"step": 12845
|
|
},
|
|
{
|
|
"entropy": 5.516597843170166,
|
|
"epoch": 0.9998054853141413,
|
|
"grad_norm": 1.625,
|
|
"learning_rate": 0.0004904814038844424,
|
|
"loss": 5.3928,
|
|
"mean_token_accuracy": 0.16057446599006653,
|
|
"num_tokens": 22290426.0,
|
|
"step": 12850
|
|
},
|
|
{
|
|
"entropy": 5.5570358700222435,
|
|
"epoch": 1.000155611748687,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.0004904734261272332,
|
|
"loss": 5.4261,
|
|
"mean_token_accuracy": 0.17388065821594662,
|
|
"num_tokens": 22297475.0,
|
|
"step": 12855
|
|
},
|
|
{
|
|
"entropy": 5.523546838760376,
|
|
"epoch": 1.0005446411204046,
|
|
"grad_norm": 1.5390625,
|
|
"learning_rate": 0.0004904654451005576,
|
|
"loss": 5.1548,
|
|
"mean_token_accuracy": 0.17881681472063066,
|
|
"num_tokens": 22305784.0,
|
|
"step": 12860
|
|
},
|
|
{
|
|
"entropy": 5.522774362564087,
|
|
"epoch": 1.0009336704921221,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.0004904574608045369,
|
|
"loss": 5.2653,
|
|
"mean_token_accuracy": 0.17851061075925828,
|
|
"num_tokens": 22313951.0,
|
|
"step": 12865
|
|
},
|
|
{
|
|
"entropy": 5.617976284027099,
|
|
"epoch": 1.0013226998638398,
|
|
"grad_norm": 1.5,
|
|
"learning_rate": 0.0004904494732392923,
|
|
"loss": 5.3555,
|
|
"mean_token_accuracy": 0.1691703036427498,
|
|
"num_tokens": 22322509.0,
|
|
"step": 12870
|
|
},
|
|
{
|
|
"entropy": 5.49655294418335,
|
|
"epoch": 1.0017117292355573,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 0.0004904414824049448,
|
|
"loss": 5.3098,
|
|
"mean_token_accuracy": 0.16939163208007812,
|
|
"num_tokens": 22331475.0,
|
|
"step": 12875
|
|
},
|
|
{
|
|
"entropy": 5.512731599807739,
|
|
"epoch": 1.0021007586072748,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.0004904334883016156,
|
|
"loss": 5.2492,
|
|
"mean_token_accuracy": 0.17484806329011918,
|
|
"num_tokens": 22341114.0,
|
|
"step": 12880
|
|
},
|
|
{
|
|
"entropy": 5.595742559432983,
|
|
"epoch": 1.0024897879789925,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.0004904254909294261,
|
|
"loss": 5.311,
|
|
"mean_token_accuracy": 0.1778619334101677,
|
|
"num_tokens": 22349199.0,
|
|
"step": 12885
|
|
},
|
|
{
|
|
"entropy": 5.500297355651855,
|
|
"epoch": 1.00287881735071,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.0004904174902884978,
|
|
"loss": 5.2892,
|
|
"mean_token_accuracy": 0.1734541654586792,
|
|
"num_tokens": 22358485.0,
|
|
"step": 12890
|
|
},
|
|
{
|
|
"entropy": 5.619526529312134,
|
|
"epoch": 1.0032678467224276,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.0004904094863789519,
|
|
"loss": 5.3379,
|
|
"mean_token_accuracy": 0.16528905034065247,
|
|
"num_tokens": 22366936.0,
|
|
"step": 12895
|
|
},
|
|
{
|
|
"entropy": 5.610384607315064,
|
|
"epoch": 1.0036568760941451,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.00049040147920091,
|
|
"loss": 5.3366,
|
|
"mean_token_accuracy": 0.1698949158191681,
|
|
"num_tokens": 22376007.0,
|
|
"step": 12900
|
|
},
|
|
{
|
|
"entropy": 5.471351909637451,
|
|
"epoch": 1.0040459054658626,
|
|
"grad_norm": 1.6171875,
|
|
"learning_rate": 0.0004903934687544933,
|
|
"loss": 5.2509,
|
|
"mean_token_accuracy": 0.1787009432911873,
|
|
"num_tokens": 22384747.0,
|
|
"step": 12905
|
|
},
|
|
{
|
|
"entropy": 5.54491024017334,
|
|
"epoch": 1.0044349348375803,
|
|
"grad_norm": 1.53125,
|
|
"learning_rate": 0.0004903854550398237,
|
|
"loss": 5.2684,
|
|
"mean_token_accuracy": 0.17942501455545426,
|
|
"num_tokens": 22393730.0,
|
|
"step": 12910
|
|
},
|
|
{
|
|
"entropy": 5.588310432434082,
|
|
"epoch": 1.0048239642092978,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.0004903774380570226,
|
|
"loss": 5.292,
|
|
"mean_token_accuracy": 0.16754848062992095,
|
|
"num_tokens": 22402121.0,
|
|
"step": 12915
|
|
},
|
|
{
|
|
"entropy": 5.5205357551574705,
|
|
"epoch": 1.0052129935810155,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0004903694178062117,
|
|
"loss": 5.3043,
|
|
"mean_token_accuracy": 0.1711421236395836,
|
|
"num_tokens": 22410943.0,
|
|
"step": 12920
|
|
},
|
|
{
|
|
"entropy": 5.588519191741943,
|
|
"epoch": 1.005602022952733,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.0004903613942875126,
|
|
"loss": 5.3836,
|
|
"mean_token_accuracy": 0.1663561701774597,
|
|
"num_tokens": 22420137.0,
|
|
"step": 12925
|
|
},
|
|
{
|
|
"entropy": 5.5643699169158936,
|
|
"epoch": 1.0059910523244504,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 0.0004903533675010472,
|
|
"loss": 5.3033,
|
|
"mean_token_accuracy": 0.16773653626441956,
|
|
"num_tokens": 22429031.0,
|
|
"step": 12930
|
|
},
|
|
{
|
|
"entropy": 5.482028484344482,
|
|
"epoch": 1.006380081696168,
|
|
"grad_norm": 1.5078125,
|
|
"learning_rate": 0.0004903453374469373,
|
|
"loss": 5.3412,
|
|
"mean_token_accuracy": 0.16637110114097595,
|
|
"num_tokens": 22438735.0,
|
|
"step": 12935
|
|
},
|
|
{
|
|
"entropy": 5.6026373386383055,
|
|
"epoch": 1.0067691110678856,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.0004903373041253045,
|
|
"loss": 5.3505,
|
|
"mean_token_accuracy": 0.16359059512615204,
|
|
"num_tokens": 22447374.0,
|
|
"step": 12940
|
|
},
|
|
{
|
|
"entropy": 5.613511085510254,
|
|
"epoch": 1.0071581404396033,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.0004903292675362709,
|
|
"loss": 5.2708,
|
|
"mean_token_accuracy": 0.17284512370824814,
|
|
"num_tokens": 22455542.0,
|
|
"step": 12945
|
|
},
|
|
{
|
|
"entropy": 5.469234037399292,
|
|
"epoch": 1.0075471698113208,
|
|
"grad_norm": 1.6484375,
|
|
"learning_rate": 0.0004903212276799584,
|
|
"loss": 5.3202,
|
|
"mean_token_accuracy": 0.16955188363790513,
|
|
"num_tokens": 22464591.0,
|
|
"step": 12950
|
|
},
|
|
{
|
|
"entropy": 5.545535087585449,
|
|
"epoch": 1.0079361991830382,
|
|
"grad_norm": 1.53125,
|
|
"learning_rate": 0.0004903131845564889,
|
|
"loss": 5.2601,
|
|
"mean_token_accuracy": 0.18278864175081252,
|
|
"num_tokens": 22472315.0,
|
|
"step": 12955
|
|
},
|
|
{
|
|
"entropy": 5.6099896907806395,
|
|
"epoch": 1.008325228554756,
|
|
"grad_norm": 1.53125,
|
|
"learning_rate": 0.0004903051381659847,
|
|
"loss": 5.3979,
|
|
"mean_token_accuracy": 0.17157152146100998,
|
|
"num_tokens": 22480662.0,
|
|
"step": 12960
|
|
},
|
|
{
|
|
"entropy": 5.456760358810425,
|
|
"epoch": 1.0087142579264734,
|
|
"grad_norm": 1.5859375,
|
|
"learning_rate": 0.0004902970885085677,
|
|
"loss": 5.2675,
|
|
"mean_token_accuracy": 0.17337485104799272,
|
|
"num_tokens": 22489600.0,
|
|
"step": 12965
|
|
},
|
|
{
|
|
"entropy": 5.579549646377563,
|
|
"epoch": 1.009103287298191,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.00049028903558436,
|
|
"loss": 5.3412,
|
|
"mean_token_accuracy": 0.169442754983902,
|
|
"num_tokens": 22498114.0,
|
|
"step": 12970
|
|
},
|
|
{
|
|
"entropy": 5.542692804336548,
|
|
"epoch": 1.0094923166699086,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.0004902809793934838,
|
|
"loss": 5.1924,
|
|
"mean_token_accuracy": 0.17911877781152724,
|
|
"num_tokens": 22506349.0,
|
|
"step": 12975
|
|
},
|
|
{
|
|
"entropy": 5.5219934463500975,
|
|
"epoch": 1.009881346041626,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.0004902729199360615,
|
|
"loss": 5.287,
|
|
"mean_token_accuracy": 0.17722095400094987,
|
|
"num_tokens": 22514878.0,
|
|
"step": 12980
|
|
},
|
|
{
|
|
"entropy": 5.490213394165039,
|
|
"epoch": 1.0102703754133437,
|
|
"grad_norm": 1.5078125,
|
|
"learning_rate": 0.0004902648572122153,
|
|
"loss": 5.3091,
|
|
"mean_token_accuracy": 0.16282469183206558,
|
|
"num_tokens": 22522992.0,
|
|
"step": 12985
|
|
},
|
|
{
|
|
"entropy": 5.588901567459106,
|
|
"epoch": 1.0106594047850612,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.0004902567912220674,
|
|
"loss": 5.3481,
|
|
"mean_token_accuracy": 0.16807745695114135,
|
|
"num_tokens": 22531407.0,
|
|
"step": 12990
|
|
},
|
|
{
|
|
"entropy": 5.4717206954956055,
|
|
"epoch": 1.011048434156779,
|
|
"grad_norm": 1.5625,
|
|
"learning_rate": 0.0004902487219657404,
|
|
"loss": 5.2332,
|
|
"mean_token_accuracy": 0.1733588382601738,
|
|
"num_tokens": 22540255.0,
|
|
"step": 12995
|
|
},
|
|
{
|
|
"entropy": 5.4836445331573485,
|
|
"epoch": 1.0114374635284964,
|
|
"grad_norm": 1.5078125,
|
|
"learning_rate": 0.0004902406494433566,
|
|
"loss": 5.2944,
|
|
"mean_token_accuracy": 0.17397915124893187,
|
|
"num_tokens": 22549139.0,
|
|
"step": 13000
|
|
},
|
|
{
|
|
"entropy": 5.5719012260437015,
|
|
"epoch": 1.0118264929002139,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 0.0004902325736550386,
|
|
"loss": 5.2815,
|
|
"mean_token_accuracy": 0.17646536380052566,
|
|
"num_tokens": 22557746.0,
|
|
"step": 13005
|
|
},
|
|
{
|
|
"entropy": 5.534259557723999,
|
|
"epoch": 1.0122155222719316,
|
|
"grad_norm": 1.59375,
|
|
"learning_rate": 0.0004902244946009088,
|
|
"loss": 5.268,
|
|
"mean_token_accuracy": 0.17062594890594482,
|
|
"num_tokens": 22566695.0,
|
|
"step": 13010
|
|
},
|
|
{
|
|
"entropy": 5.474474096298218,
|
|
"epoch": 1.012604551643649,
|
|
"grad_norm": 1.65625,
|
|
"learning_rate": 0.0004902164122810899,
|
|
"loss": 5.2858,
|
|
"mean_token_accuracy": 0.170113243162632,
|
|
"num_tokens": 22575196.0,
|
|
"step": 13015
|
|
},
|
|
{
|
|
"entropy": 5.5639995574951175,
|
|
"epoch": 1.0129935810153667,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 0.0004902083266957045,
|
|
"loss": 5.2949,
|
|
"mean_token_accuracy": 0.17444577813148499,
|
|
"num_tokens": 22583520.0,
|
|
"step": 13020
|
|
},
|
|
{
|
|
"entropy": 5.6080474853515625,
|
|
"epoch": 1.0133826103870842,
|
|
"grad_norm": 1.6328125,
|
|
"learning_rate": 0.0004902002378448753,
|
|
"loss": 5.3375,
|
|
"mean_token_accuracy": 0.16806702613830565,
|
|
"num_tokens": 22591896.0,
|
|
"step": 13025
|
|
},
|
|
{
|
|
"entropy": 5.588902854919434,
|
|
"epoch": 1.0137716397588017,
|
|
"grad_norm": 1.578125,
|
|
"learning_rate": 0.000490192145728725,
|
|
"loss": 5.2748,
|
|
"mean_token_accuracy": 0.17871918380260468,
|
|
"num_tokens": 22600097.0,
|
|
"step": 13030
|
|
},
|
|
{
|
|
"entropy": 5.5454301834106445,
|
|
"epoch": 1.0141606691305194,
|
|
"grad_norm": 1.7109375,
|
|
"learning_rate": 0.0004901840503473764,
|
|
"loss": 5.2085,
|
|
"mean_token_accuracy": 0.1683547243475914,
|
|
"num_tokens": 22607956.0,
|
|
"step": 13035
|
|
},
|
|
{
|
|
"entropy": 5.479225730895996,
|
|
"epoch": 1.0145496985022369,
|
|
"grad_norm": 2.046875,
|
|
"learning_rate": 0.0004901759517009522,
|
|
"loss": 5.2889,
|
|
"mean_token_accuracy": 0.16536511480808258,
|
|
"num_tokens": 22616549.0,
|
|
"step": 13040
|
|
},
|
|
{
|
|
"entropy": 5.496964693069458,
|
|
"epoch": 1.0149387278739546,
|
|
"grad_norm": 1.6875,
|
|
"learning_rate": 0.0004901678497895755,
|
|
"loss": 5.2013,
|
|
"mean_token_accuracy": 0.17258040755987167,
|
|
"num_tokens": 22625138.0,
|
|
"step": 13045
|
|
},
|
|
{
|
|
"entropy": 5.556217241287231,
|
|
"epoch": 1.015327757245672,
|
|
"grad_norm": 1.4921875,
|
|
"learning_rate": 0.0004901597446133692,
|
|
"loss": 5.3101,
|
|
"mean_token_accuracy": 0.16471708714962005,
|
|
"num_tokens": 22633808.0,
|
|
"step": 13050
|
|
},
|
|
{
|
|
"entropy": 5.531499910354614,
|
|
"epoch": 1.0157167866173895,
|
|
"grad_norm": 1.5703125,
|
|
"learning_rate": 0.0004901516361724564,
|
|
"loss": 5.2722,
|
|
"mean_token_accuracy": 0.17534152120351792,
|
|
"num_tokens": 22642517.0,
|
|
"step": 13055
|
|
},
|
|
{
|
|
"entropy": 5.576869916915894,
|
|
"epoch": 1.0161058159891072,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.0004901435244669597,
|
|
"loss": 5.3269,
|
|
"mean_token_accuracy": 0.165169657766819,
|
|
"num_tokens": 22651822.0,
|
|
"step": 13060
|
|
},
|
|
{
|
|
"entropy": 5.525007009506226,
|
|
"epoch": 1.0164948453608247,
|
|
"grad_norm": 2.0625,
|
|
"learning_rate": 0.0004901354094970025,
|
|
"loss": 5.3087,
|
|
"mean_token_accuracy": 0.17057413160800933,
|
|
"num_tokens": 22660763.0,
|
|
"step": 13065
|
|
},
|
|
{
|
|
"entropy": 5.479302597045899,
|
|
"epoch": 1.0168838747325424,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.0004901272912627081,
|
|
"loss": 5.2851,
|
|
"mean_token_accuracy": 0.17264565229415893,
|
|
"num_tokens": 22669449.0,
|
|
"step": 13070
|
|
},
|
|
{
|
|
"entropy": 5.55150990486145,
|
|
"epoch": 1.0172729041042599,
|
|
"grad_norm": 1.609375,
|
|
"learning_rate": 0.0004901191697641992,
|
|
"loss": 5.3316,
|
|
"mean_token_accuracy": 0.17265421003103257,
|
|
"num_tokens": 22678212.0,
|
|
"step": 13075
|
|
},
|
|
{
|
|
"entropy": 5.522483396530151,
|
|
"epoch": 1.0176619334759773,
|
|
"grad_norm": 1.5078125,
|
|
"learning_rate": 0.0004901110450015994,
|
|
"loss": 5.2543,
|
|
"mean_token_accuracy": 0.17973925173282623,
|
|
"num_tokens": 22686509.0,
|
|
"step": 13080
|
|
},
|
|
{
|
|
"entropy": 5.512483596801758,
|
|
"epoch": 1.018050962847695,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.0004901029169750319,
|
|
"loss": 5.2879,
|
|
"mean_token_accuracy": 0.1782244548201561,
|
|
"num_tokens": 22695473.0,
|
|
"step": 13085
|
|
},
|
|
{
|
|
"entropy": 5.538054943084717,
|
|
"epoch": 1.0184399922194125,
|
|
"grad_norm": 1.625,
|
|
"learning_rate": 0.0004900947856846201,
|
|
"loss": 5.3616,
|
|
"mean_token_accuracy": 0.1674347475171089,
|
|
"num_tokens": 22704567.0,
|
|
"step": 13090
|
|
},
|
|
{
|
|
"entropy": 5.519725656509399,
|
|
"epoch": 1.0188290215911302,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.000490086651130487,
|
|
"loss": 5.2387,
|
|
"mean_token_accuracy": 0.1735985353589058,
|
|
"num_tokens": 22713981.0,
|
|
"step": 13095
|
|
},
|
|
{
|
|
"entropy": 5.375979089736939,
|
|
"epoch": 1.0192180509628477,
|
|
"grad_norm": 1.59375,
|
|
"learning_rate": 0.0004900785133127566,
|
|
"loss": 5.1693,
|
|
"mean_token_accuracy": 0.18233491629362106,
|
|
"num_tokens": 22722855.0,
|
|
"step": 13100
|
|
},
|
|
{
|
|
"entropy": 5.418504619598389,
|
|
"epoch": 1.0196070803345652,
|
|
"grad_norm": 1.703125,
|
|
"learning_rate": 0.000490070372231552,
|
|
"loss": 5.3064,
|
|
"mean_token_accuracy": 0.16758803129196168,
|
|
"num_tokens": 22732454.0,
|
|
"step": 13105
|
|
},
|
|
{
|
|
"entropy": 5.552613830566406,
|
|
"epoch": 1.0199961097062828,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 0.0004900622278869968,
|
|
"loss": 5.1598,
|
|
"mean_token_accuracy": 0.1850112795829773,
|
|
"num_tokens": 22741331.0,
|
|
"step": 13110
|
|
},
|
|
{
|
|
"entropy": 5.550606918334961,
|
|
"epoch": 1.0203851390780003,
|
|
"grad_norm": 1.578125,
|
|
"learning_rate": 0.0004900540802792146,
|
|
"loss": 5.3448,
|
|
"mean_token_accuracy": 0.1711778849363327,
|
|
"num_tokens": 22749983.0,
|
|
"step": 13115
|
|
},
|
|
{
|
|
"entropy": 5.471428108215332,
|
|
"epoch": 1.020774168449718,
|
|
"grad_norm": 1.5703125,
|
|
"learning_rate": 0.000490045929408329,
|
|
"loss": 5.2867,
|
|
"mean_token_accuracy": 0.17198589891195298,
|
|
"num_tokens": 22759112.0,
|
|
"step": 13120
|
|
},
|
|
{
|
|
"entropy": 5.528674173355102,
|
|
"epoch": 1.0211631978214355,
|
|
"grad_norm": 1.6171875,
|
|
"learning_rate": 0.0004900377752744637,
|
|
"loss": 5.3349,
|
|
"mean_token_accuracy": 0.17381939440965652,
|
|
"num_tokens": 22768456.0,
|
|
"step": 13125
|
|
},
|
|
{
|
|
"entropy": 5.553075313568115,
|
|
"epoch": 1.021552227193153,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.0004900296178777426,
|
|
"loss": 5.2569,
|
|
"mean_token_accuracy": 0.17494437098503113,
|
|
"num_tokens": 22777450.0,
|
|
"step": 13130
|
|
},
|
|
{
|
|
"entropy": 5.549312019348145,
|
|
"epoch": 1.0219412565648707,
|
|
"grad_norm": 1.53125,
|
|
"learning_rate": 0.000490021457218289,
|
|
"loss": 5.2871,
|
|
"mean_token_accuracy": 0.1765150785446167,
|
|
"num_tokens": 22785704.0,
|
|
"step": 13135
|
|
},
|
|
{
|
|
"entropy": 5.4410844326019285,
|
|
"epoch": 1.0223302859365881,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.0004900132932962272,
|
|
"loss": 5.2897,
|
|
"mean_token_accuracy": 0.16746250540018082,
|
|
"num_tokens": 22794649.0,
|
|
"step": 13140
|
|
},
|
|
{
|
|
"entropy": 5.557854461669922,
|
|
"epoch": 1.0227193153083058,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.000490005126111681,
|
|
"loss": 5.3962,
|
|
"mean_token_accuracy": 0.1683148980140686,
|
|
"num_tokens": 22803501.0,
|
|
"step": 13145
|
|
},
|
|
{
|
|
"entropy": 5.642955684661866,
|
|
"epoch": 1.0231083446800233,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.000489996955664774,
|
|
"loss": 5.3063,
|
|
"mean_token_accuracy": 0.1695007413625717,
|
|
"num_tokens": 22811779.0,
|
|
"step": 13150
|
|
},
|
|
{
|
|
"entropy": 5.494333171844483,
|
|
"epoch": 1.023497374051741,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.0004899887819556306,
|
|
"loss": 5.3183,
|
|
"mean_token_accuracy": 0.17430364489555358,
|
|
"num_tokens": 22821108.0,
|
|
"step": 13155
|
|
},
|
|
{
|
|
"entropy": 5.571894025802612,
|
|
"epoch": 1.0238864034234585,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.0004899806049843745,
|
|
"loss": 5.3357,
|
|
"mean_token_accuracy": 0.16800168603658677,
|
|
"num_tokens": 22829369.0,
|
|
"step": 13160
|
|
},
|
|
{
|
|
"entropy": 5.553596067428589,
|
|
"epoch": 1.024275432795176,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.0004899724247511299,
|
|
"loss": 5.3092,
|
|
"mean_token_accuracy": 0.16919184625148773,
|
|
"num_tokens": 22838441.0,
|
|
"step": 13165
|
|
},
|
|
{
|
|
"entropy": 5.547909545898437,
|
|
"epoch": 1.0246644621668937,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.000489964241256021,
|
|
"loss": 5.2574,
|
|
"mean_token_accuracy": 0.17296576201915742,
|
|
"num_tokens": 22847587.0,
|
|
"step": 13170
|
|
},
|
|
{
|
|
"entropy": 5.444735097885132,
|
|
"epoch": 1.0250534915386111,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 0.0004899560544991718,
|
|
"loss": 5.2533,
|
|
"mean_token_accuracy": 0.17598360478878022,
|
|
"num_tokens": 22856051.0,
|
|
"step": 13175
|
|
},
|
|
{
|
|
"entropy": 5.548771619796753,
|
|
"epoch": 1.0254425209103288,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.0004899478644807068,
|
|
"loss": 5.3261,
|
|
"mean_token_accuracy": 0.16842278242111205,
|
|
"num_tokens": 22864822.0,
|
|
"step": 13180
|
|
},
|
|
{
|
|
"entropy": 5.570658206939697,
|
|
"epoch": 1.0258315502820463,
|
|
"grad_norm": 1.6171875,
|
|
"learning_rate": 0.0004899396712007498,
|
|
"loss": 5.2971,
|
|
"mean_token_accuracy": 0.1770306870341301,
|
|
"num_tokens": 22873199.0,
|
|
"step": 13185
|
|
},
|
|
{
|
|
"entropy": 5.525741386413574,
|
|
"epoch": 1.0262205796537638,
|
|
"grad_norm": 1.6640625,
|
|
"learning_rate": 0.0004899314746594256,
|
|
"loss": 5.3487,
|
|
"mean_token_accuracy": 0.16684436053037643,
|
|
"num_tokens": 22881184.0,
|
|
"step": 13190
|
|
},
|
|
{
|
|
"entropy": 5.528432941436767,
|
|
"epoch": 1.0266096090254815,
|
|
"grad_norm": 1.5390625,
|
|
"learning_rate": 0.0004899232748568584,
|
|
"loss": 5.2539,
|
|
"mean_token_accuracy": 0.17741697430610656,
|
|
"num_tokens": 22890087.0,
|
|
"step": 13195
|
|
},
|
|
{
|
|
"entropy": 5.549570322036743,
|
|
"epoch": 1.026998638397199,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.0004899150717931724,
|
|
"loss": 5.2594,
|
|
"mean_token_accuracy": 0.1733081355690956,
|
|
"num_tokens": 22899013.0,
|
|
"step": 13200
|
|
},
|
|
{
|
|
"entropy": 5.545243263244629,
|
|
"epoch": 1.0273876677689167,
|
|
"grad_norm": 1.84375,
|
|
"learning_rate": 0.0004899068654684924,
|
|
"loss": 5.4348,
|
|
"mean_token_accuracy": 0.16527665704488753,
|
|
"num_tokens": 22908740.0,
|
|
"step": 13205
|
|
},
|
|
{
|
|
"entropy": 5.597586393356323,
|
|
"epoch": 1.0277766971406341,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.0004898986558829428,
|
|
"loss": 5.3524,
|
|
"mean_token_accuracy": 0.1712162524461746,
|
|
"num_tokens": 22917502.0,
|
|
"step": 13210
|
|
},
|
|
{
|
|
"entropy": 5.535340023040772,
|
|
"epoch": 1.0281657265123516,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 0.0004898904430366479,
|
|
"loss": 5.2642,
|
|
"mean_token_accuracy": 0.17161000967025758,
|
|
"num_tokens": 22927076.0,
|
|
"step": 13215
|
|
},
|
|
{
|
|
"entropy": 5.568803071975708,
|
|
"epoch": 1.0285547558840693,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.0004898822269297328,
|
|
"loss": 5.3295,
|
|
"mean_token_accuracy": 0.16263166218996047,
|
|
"num_tokens": 22936111.0,
|
|
"step": 13220
|
|
},
|
|
{
|
|
"entropy": 5.486574792861939,
|
|
"epoch": 1.0289437852557868,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.0004898740075623218,
|
|
"loss": 5.1947,
|
|
"mean_token_accuracy": 0.18024656176567078,
|
|
"num_tokens": 22944752.0,
|
|
"step": 13225
|
|
},
|
|
{
|
|
"entropy": 5.578030776977539,
|
|
"epoch": 1.0293328146275045,
|
|
"grad_norm": 1.515625,
|
|
"learning_rate": 0.0004898657849345399,
|
|
"loss": 5.4195,
|
|
"mean_token_accuracy": 0.1684816874563694,
|
|
"num_tokens": 22952971.0,
|
|
"step": 13230
|
|
},
|
|
{
|
|
"entropy": 5.5485940933227536,
|
|
"epoch": 1.029721843999222,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 0.0004898575590465116,
|
|
"loss": 5.3393,
|
|
"mean_token_accuracy": 0.17579842060804368,
|
|
"num_tokens": 22961257.0,
|
|
"step": 13235
|
|
},
|
|
{
|
|
"entropy": 5.530694389343262,
|
|
"epoch": 1.0301108733709394,
|
|
"grad_norm": 1.953125,
|
|
"learning_rate": 0.0004898493298983619,
|
|
"loss": 5.3779,
|
|
"mean_token_accuracy": 0.16456894129514693,
|
|
"num_tokens": 22970659.0,
|
|
"step": 13240
|
|
},
|
|
{
|
|
"entropy": 5.556435823440552,
|
|
"epoch": 1.0304999027426571,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.0004898410974902155,
|
|
"loss": 5.3202,
|
|
"mean_token_accuracy": 0.17372994422912597,
|
|
"num_tokens": 22978830.0,
|
|
"step": 13245
|
|
},
|
|
{
|
|
"entropy": 5.553006172180176,
|
|
"epoch": 1.0308889321143746,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.0004898328618221974,
|
|
"loss": 5.2989,
|
|
"mean_token_accuracy": 0.18095583021640776,
|
|
"num_tokens": 22987100.0,
|
|
"step": 13250
|
|
},
|
|
{
|
|
"entropy": 5.524930858612061,
|
|
"epoch": 1.0312779614860923,
|
|
"grad_norm": 1.9453125,
|
|
"learning_rate": 0.0004898246228944327,
|
|
"loss": 5.305,
|
|
"mean_token_accuracy": 0.17208175659179686,
|
|
"num_tokens": 22995749.0,
|
|
"step": 13255
|
|
},
|
|
{
|
|
"entropy": 5.609223222732544,
|
|
"epoch": 1.0316669908578098,
|
|
"grad_norm": 1.90625,
|
|
"learning_rate": 0.0004898163807070461,
|
|
"loss": 5.3733,
|
|
"mean_token_accuracy": 0.17638735324144364,
|
|
"num_tokens": 23004410.0,
|
|
"step": 13260
|
|
},
|
|
{
|
|
"entropy": 5.527045154571534,
|
|
"epoch": 1.0320560202295272,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.0004898081352601629,
|
|
"loss": 5.2404,
|
|
"mean_token_accuracy": 0.17105171829462051,
|
|
"num_tokens": 23012935.0,
|
|
"step": 13265
|
|
},
|
|
{
|
|
"entropy": 5.468330812454224,
|
|
"epoch": 1.032445049601245,
|
|
"grad_norm": 1.515625,
|
|
"learning_rate": 0.0004897998865539082,
|
|
"loss": 5.2455,
|
|
"mean_token_accuracy": 0.16925933063030243,
|
|
"num_tokens": 23021769.0,
|
|
"step": 13270
|
|
},
|
|
{
|
|
"entropy": 5.485386705398559,
|
|
"epoch": 1.0328340789729624,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.0004897916345884069,
|
|
"loss": 5.2459,
|
|
"mean_token_accuracy": 0.17402863800525664,
|
|
"num_tokens": 23030915.0,
|
|
"step": 13275
|
|
},
|
|
{
|
|
"entropy": 5.50831241607666,
|
|
"epoch": 1.0332231083446801,
|
|
"grad_norm": 1.6875,
|
|
"learning_rate": 0.0004897833793637847,
|
|
"loss": 5.3564,
|
|
"mean_token_accuracy": 0.17065636366605758,
|
|
"num_tokens": 23039422.0,
|
|
"step": 13280
|
|
},
|
|
{
|
|
"entropy": 5.57260479927063,
|
|
"epoch": 1.0336121377163976,
|
|
"grad_norm": 1.5,
|
|
"learning_rate": 0.0004897751208801665,
|
|
"loss": 5.4079,
|
|
"mean_token_accuracy": 0.16120281517505647,
|
|
"num_tokens": 23048485.0,
|
|
"step": 13285
|
|
},
|
|
{
|
|
"entropy": 5.524514198303223,
|
|
"epoch": 1.034001167088115,
|
|
"grad_norm": 1.546875,
|
|
"learning_rate": 0.0004897668591376777,
|
|
"loss": 5.2735,
|
|
"mean_token_accuracy": 0.17662156969308854,
|
|
"num_tokens": 23057506.0,
|
|
"step": 13290
|
|
},
|
|
{
|
|
"entropy": 5.454878807067871,
|
|
"epoch": 1.0343901964598328,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.0004897585941364436,
|
|
"loss": 5.1278,
|
|
"mean_token_accuracy": 0.18146211802959442,
|
|
"num_tokens": 23065430.0,
|
|
"step": 13295
|
|
},
|
|
{
|
|
"entropy": 5.4088164329528805,
|
|
"epoch": 1.0347792258315502,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.0004897503258765896,
|
|
"loss": 5.2497,
|
|
"mean_token_accuracy": 0.16961822509765626,
|
|
"num_tokens": 23074533.0,
|
|
"step": 13300
|
|
},
|
|
{
|
|
"entropy": 5.541276741027832,
|
|
"epoch": 1.035168255203268,
|
|
"grad_norm": 1.515625,
|
|
"learning_rate": 0.0004897420543582413,
|
|
"loss": 5.2566,
|
|
"mean_token_accuracy": 0.17172229290008545,
|
|
"num_tokens": 23083020.0,
|
|
"step": 13305
|
|
},
|
|
{
|
|
"entropy": 5.519902229309082,
|
|
"epoch": 1.0355572845749854,
|
|
"grad_norm": 1.546875,
|
|
"learning_rate": 0.000489733779581524,
|
|
"loss": 5.3161,
|
|
"mean_token_accuracy": 0.1741691052913666,
|
|
"num_tokens": 23091992.0,
|
|
"step": 13310
|
|
},
|
|
{
|
|
"entropy": 5.464567232131958,
|
|
"epoch": 1.035946313946703,
|
|
"grad_norm": 1.65625,
|
|
"learning_rate": 0.0004897255015465635,
|
|
"loss": 5.2657,
|
|
"mean_token_accuracy": 0.17678949534893035,
|
|
"num_tokens": 23100411.0,
|
|
"step": 13315
|
|
},
|
|
{
|
|
"entropy": 5.443428802490234,
|
|
"epoch": 1.0363353433184206,
|
|
"grad_norm": 1.6328125,
|
|
"learning_rate": 0.0004897172202534853,
|
|
"loss": 5.3628,
|
|
"mean_token_accuracy": 0.168155275285244,
|
|
"num_tokens": 23108867.0,
|
|
"step": 13320
|
|
},
|
|
{
|
|
"entropy": 5.495881700515747,
|
|
"epoch": 1.036724372690138,
|
|
"grad_norm": 1.546875,
|
|
"learning_rate": 0.000489708935702415,
|
|
"loss": 5.1993,
|
|
"mean_token_accuracy": 0.16957461833953857,
|
|
"num_tokens": 23116692.0,
|
|
"step": 13325
|
|
},
|
|
{
|
|
"entropy": 5.547291994094849,
|
|
"epoch": 1.0371134020618558,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.0004897006478934784,
|
|
"loss": 5.2843,
|
|
"mean_token_accuracy": 0.17300619930028915,
|
|
"num_tokens": 23125138.0,
|
|
"step": 13330
|
|
},
|
|
{
|
|
"entropy": 5.4647290229797365,
|
|
"epoch": 1.0375024314335732,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.0004896923568268011,
|
|
"loss": 5.291,
|
|
"mean_token_accuracy": 0.16938004195690154,
|
|
"num_tokens": 23133263.0,
|
|
"step": 13335
|
|
},
|
|
{
|
|
"entropy": 5.546141147613525,
|
|
"epoch": 1.0378914608052907,
|
|
"grad_norm": 1.6484375,
|
|
"learning_rate": 0.000489684062502509,
|
|
"loss": 5.291,
|
|
"mean_token_accuracy": 0.17217222303152085,
|
|
"num_tokens": 23141984.0,
|
|
"step": 13340
|
|
},
|
|
{
|
|
"entropy": 5.504475259780884,
|
|
"epoch": 1.0382804901770084,
|
|
"grad_norm": 1.5234375,
|
|
"learning_rate": 0.0004896757649207281,
|
|
"loss": 5.2484,
|
|
"mean_token_accuracy": 0.1749482810497284,
|
|
"num_tokens": 23151598.0,
|
|
"step": 13345
|
|
},
|
|
{
|
|
"entropy": 5.542143249511719,
|
|
"epoch": 1.0386695195487259,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.000489667464081584,
|
|
"loss": 5.3794,
|
|
"mean_token_accuracy": 0.1688281401991844,
|
|
"num_tokens": 23159737.0,
|
|
"step": 13350
|
|
},
|
|
{
|
|
"entropy": 5.480085706710815,
|
|
"epoch": 1.0390585489204436,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.0004896591599852029,
|
|
"loss": 5.2364,
|
|
"mean_token_accuracy": 0.17880214899778366,
|
|
"num_tokens": 23168852.0,
|
|
"step": 13355
|
|
},
|
|
{
|
|
"entropy": 5.567393636703491,
|
|
"epoch": 1.039447578292161,
|
|
"grad_norm": 1.828125,
|
|
"learning_rate": 0.0004896508526317107,
|
|
"loss": 5.3324,
|
|
"mean_token_accuracy": 0.1715226024389267,
|
|
"num_tokens": 23178227.0,
|
|
"step": 13360
|
|
},
|
|
{
|
|
"entropy": 5.480564165115356,
|
|
"epoch": 1.0398366076638785,
|
|
"grad_norm": 1.546875,
|
|
"learning_rate": 0.0004896425420212334,
|
|
"loss": 5.2334,
|
|
"mean_token_accuracy": 0.1764785349369049,
|
|
"num_tokens": 23187286.0,
|
|
"step": 13365
|
|
},
|
|
{
|
|
"entropy": 5.561172866821289,
|
|
"epoch": 1.0402256370355962,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.0004896342281538973,
|
|
"loss": 5.2958,
|
|
"mean_token_accuracy": 0.18206935226917267,
|
|
"num_tokens": 23196163.0,
|
|
"step": 13370
|
|
},
|
|
{
|
|
"entropy": 5.565270471572876,
|
|
"epoch": 1.0406146664073137,
|
|
"grad_norm": 2.75,
|
|
"learning_rate": 0.0004896259110298283,
|
|
"loss": 5.247,
|
|
"mean_token_accuracy": 0.17623820453882216,
|
|
"num_tokens": 23203742.0,
|
|
"step": 13375
|
|
},
|
|
{
|
|
"entropy": 5.576069641113281,
|
|
"epoch": 1.0410036957790314,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.0004896175906491528,
|
|
"loss": 5.4118,
|
|
"mean_token_accuracy": 0.170791158080101,
|
|
"num_tokens": 23212860.0,
|
|
"step": 13380
|
|
},
|
|
{
|
|
"entropy": 5.533156967163086,
|
|
"epoch": 1.0413927251507489,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.0004896092670119968,
|
|
"loss": 5.2695,
|
|
"mean_token_accuracy": 0.168504199385643,
|
|
"num_tokens": 23222558.0,
|
|
"step": 13385
|
|
},
|
|
{
|
|
"entropy": 5.556425094604492,
|
|
"epoch": 1.0417817545224664,
|
|
"grad_norm": 1.6875,
|
|
"learning_rate": 0.0004896009401184869,
|
|
"loss": 5.3188,
|
|
"mean_token_accuracy": 0.17318859249353408,
|
|
"num_tokens": 23231413.0,
|
|
"step": 13390
|
|
},
|
|
{
|
|
"entropy": 5.59720516204834,
|
|
"epoch": 1.042170783894184,
|
|
"grad_norm": 1.5703125,
|
|
"learning_rate": 0.0004895926099687493,
|
|
"loss": 5.2852,
|
|
"mean_token_accuracy": 0.17516269236803056,
|
|
"num_tokens": 23240783.0,
|
|
"step": 13395
|
|
},
|
|
{
|
|
"entropy": 5.519211864471435,
|
|
"epoch": 1.0425598132659015,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.0004895842765629104,
|
|
"loss": 5.3771,
|
|
"mean_token_accuracy": 0.16749323308467864,
|
|
"num_tokens": 23249125.0,
|
|
"step": 13400
|
|
},
|
|
{
|
|
"entropy": 5.500641202926635,
|
|
"epoch": 1.0429488426376192,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.0004895759399010966,
|
|
"loss": 5.2315,
|
|
"mean_token_accuracy": 0.17279189229011535,
|
|
"num_tokens": 23257793.0,
|
|
"step": 13405
|
|
},
|
|
{
|
|
"entropy": 5.478333377838135,
|
|
"epoch": 1.0433378720093367,
|
|
"grad_norm": 1.4921875,
|
|
"learning_rate": 0.0004895675999834345,
|
|
"loss": 5.2134,
|
|
"mean_token_accuracy": 0.17972014248371124,
|
|
"num_tokens": 23266361.0,
|
|
"step": 13410
|
|
},
|
|
{
|
|
"entropy": 5.46014437675476,
|
|
"epoch": 1.0437269013810542,
|
|
"grad_norm": 1.9375,
|
|
"learning_rate": 0.0004895592568100505,
|
|
"loss": 5.2015,
|
|
"mean_token_accuracy": 0.17767742425203323,
|
|
"num_tokens": 23274914.0,
|
|
"step": 13415
|
|
},
|
|
{
|
|
"entropy": 5.484378004074097,
|
|
"epoch": 1.0441159307527719,
|
|
"grad_norm": 1.5234375,
|
|
"learning_rate": 0.0004895509103810714,
|
|
"loss": 5.273,
|
|
"mean_token_accuracy": 0.17297763973474503,
|
|
"num_tokens": 23283067.0,
|
|
"step": 13420
|
|
},
|
|
{
|
|
"entropy": 5.529915189743042,
|
|
"epoch": 1.0445049601244893,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 0.0004895425606966237,
|
|
"loss": 5.2813,
|
|
"mean_token_accuracy": 0.16556593775749207,
|
|
"num_tokens": 23291114.0,
|
|
"step": 13425
|
|
},
|
|
{
|
|
"entropy": 5.438701438903808,
|
|
"epoch": 1.044893989496207,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.000489534207756834,
|
|
"loss": 5.1566,
|
|
"mean_token_accuracy": 0.18234228044748307,
|
|
"num_tokens": 23300525.0,
|
|
"step": 13430
|
|
},
|
|
{
|
|
"entropy": 5.476650285720825,
|
|
"epoch": 1.0452830188679245,
|
|
"grad_norm": 1.4921875,
|
|
"learning_rate": 0.0004895258515618293,
|
|
"loss": 5.2417,
|
|
"mean_token_accuracy": 0.17851203978061675,
|
|
"num_tokens": 23308984.0,
|
|
"step": 13435
|
|
},
|
|
{
|
|
"entropy": 5.519491863250733,
|
|
"epoch": 1.045672048239642,
|
|
"grad_norm": 2.03125,
|
|
"learning_rate": 0.0004895174921117362,
|
|
"loss": 5.3512,
|
|
"mean_token_accuracy": 0.16742511093616486,
|
|
"num_tokens": 23318137.0,
|
|
"step": 13440
|
|
},
|
|
{
|
|
"entropy": 5.626071977615356,
|
|
"epoch": 1.0460610776113597,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.0004895091294066816,
|
|
"loss": 5.4069,
|
|
"mean_token_accuracy": 0.1664462596178055,
|
|
"num_tokens": 23326276.0,
|
|
"step": 13445
|
|
},
|
|
{
|
|
"entropy": 5.562966680526733,
|
|
"epoch": 1.0464501069830772,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.0004895007634467924,
|
|
"loss": 5.2888,
|
|
"mean_token_accuracy": 0.17338868528604506,
|
|
"num_tokens": 23334578.0,
|
|
"step": 13450
|
|
},
|
|
{
|
|
"entropy": 5.467001962661743,
|
|
"epoch": 1.0468391363547949,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.0004894923942321955,
|
|
"loss": 5.3221,
|
|
"mean_token_accuracy": 0.1677706092596054,
|
|
"num_tokens": 23344173.0,
|
|
"step": 13455
|
|
},
|
|
{
|
|
"entropy": 5.491952705383301,
|
|
"epoch": 1.0472281657265123,
|
|
"grad_norm": 1.4921875,
|
|
"learning_rate": 0.0004894840217630179,
|
|
"loss": 5.1781,
|
|
"mean_token_accuracy": 0.17806885540485382,
|
|
"num_tokens": 23353098.0,
|
|
"step": 13460
|
|
},
|
|
{
|
|
"entropy": 5.572282505035401,
|
|
"epoch": 1.0476171950982298,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.0004894756460393868,
|
|
"loss": 5.3245,
|
|
"mean_token_accuracy": 0.1694008782505989,
|
|
"num_tokens": 23362364.0,
|
|
"step": 13465
|
|
},
|
|
{
|
|
"entropy": 5.548322963714599,
|
|
"epoch": 1.0480062244699475,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.000489467267061429,
|
|
"loss": 5.3417,
|
|
"mean_token_accuracy": 0.1688351735472679,
|
|
"num_tokens": 23371903.0,
|
|
"step": 13470
|
|
},
|
|
{
|
|
"entropy": 5.52583589553833,
|
|
"epoch": 1.048395253841665,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.0004894588848292718,
|
|
"loss": 5.2557,
|
|
"mean_token_accuracy": 0.18037861138582229,
|
|
"num_tokens": 23381711.0,
|
|
"step": 13475
|
|
},
|
|
{
|
|
"entropy": 5.495605516433716,
|
|
"epoch": 1.0487842832133827,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 0.0004894504993430425,
|
|
"loss": 5.219,
|
|
"mean_token_accuracy": 0.17501617670059205,
|
|
"num_tokens": 23389812.0,
|
|
"step": 13480
|
|
},
|
|
{
|
|
"entropy": 5.51205792427063,
|
|
"epoch": 1.0491733125851002,
|
|
"grad_norm": 1.4921875,
|
|
"learning_rate": 0.000489442110602868,
|
|
"loss": 5.2795,
|
|
"mean_token_accuracy": 0.17062579244375228,
|
|
"num_tokens": 23399231.0,
|
|
"step": 13485
|
|
},
|
|
{
|
|
"entropy": 5.486600875854492,
|
|
"epoch": 1.0495623419568176,
|
|
"grad_norm": 1.5,
|
|
"learning_rate": 0.0004894337186088759,
|
|
"loss": 5.2378,
|
|
"mean_token_accuracy": 0.16807817220687865,
|
|
"num_tokens": 23407764.0,
|
|
"step": 13490
|
|
},
|
|
{
|
|
"entropy": 5.512649393081665,
|
|
"epoch": 1.0499513713285353,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.0004894253233611934,
|
|
"loss": 5.1985,
|
|
"mean_token_accuracy": 0.17123304754495622,
|
|
"num_tokens": 23416368.0,
|
|
"step": 13495
|
|
},
|
|
{
|
|
"entropy": 5.5942949771881105,
|
|
"epoch": 1.0503404007002528,
|
|
"grad_norm": 1.6953125,
|
|
"learning_rate": 0.000489416924859948,
|
|
"loss": 5.4472,
|
|
"mean_token_accuracy": 0.16766640692949294,
|
|
"num_tokens": 23425415.0,
|
|
"step": 13500
|
|
},
|
|
{
|
|
"entropy": 5.4984533309936525,
|
|
"epoch": 1.0507294300719705,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 0.000489408523105267,
|
|
"loss": 5.2443,
|
|
"mean_token_accuracy": 0.17002047300338746,
|
|
"num_tokens": 23433435.0,
|
|
"step": 13505
|
|
},
|
|
{
|
|
"entropy": 5.5616655349731445,
|
|
"epoch": 1.051118459443688,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 0.0004894001180972779,
|
|
"loss": 5.3129,
|
|
"mean_token_accuracy": 0.1687181130051613,
|
|
"num_tokens": 23442002.0,
|
|
"step": 13510
|
|
},
|
|
{
|
|
"entropy": 5.421151113510132,
|
|
"epoch": 1.0515074888154055,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.0004893917098361082,
|
|
"loss": 5.1016,
|
|
"mean_token_accuracy": 0.17431665509939193,
|
|
"num_tokens": 23450437.0,
|
|
"step": 13515
|
|
},
|
|
{
|
|
"entropy": 5.3939250946044925,
|
|
"epoch": 1.0518965181871232,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.0004893832983218856,
|
|
"loss": 5.2015,
|
|
"mean_token_accuracy": 0.18134456276893615,
|
|
"num_tokens": 23458755.0,
|
|
"step": 13520
|
|
},
|
|
{
|
|
"entropy": 5.469194555282593,
|
|
"epoch": 1.0522855475588406,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.0004893748835547377,
|
|
"loss": 5.3228,
|
|
"mean_token_accuracy": 0.17383601516485214,
|
|
"num_tokens": 23467138.0,
|
|
"step": 13525
|
|
},
|
|
{
|
|
"entropy": 5.461789560317993,
|
|
"epoch": 1.0526745769305583,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.0004893664655347921,
|
|
"loss": 5.1855,
|
|
"mean_token_accuracy": 0.18599656522274016,
|
|
"num_tokens": 23475494.0,
|
|
"step": 13530
|
|
},
|
|
{
|
|
"entropy": 5.423098468780518,
|
|
"epoch": 1.0530636063022758,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.0004893580442621767,
|
|
"loss": 5.1245,
|
|
"mean_token_accuracy": 0.18259056955575942,
|
|
"num_tokens": 23484215.0,
|
|
"step": 13535
|
|
},
|
|
{
|
|
"entropy": 5.38731894493103,
|
|
"epoch": 1.0534526356739935,
|
|
"grad_norm": 1.5625,
|
|
"learning_rate": 0.000489349619737019,
|
|
"loss": 5.2327,
|
|
"mean_token_accuracy": 0.1701631173491478,
|
|
"num_tokens": 23492604.0,
|
|
"step": 13540
|
|
},
|
|
{
|
|
"entropy": 5.6060703754425045,
|
|
"epoch": 1.053841665045711,
|
|
"grad_norm": 1.4921875,
|
|
"learning_rate": 0.000489341191959447,
|
|
"loss": 5.4775,
|
|
"mean_token_accuracy": 0.16311267167329788,
|
|
"num_tokens": 23501817.0,
|
|
"step": 13545
|
|
},
|
|
{
|
|
"entropy": 5.674867439270019,
|
|
"epoch": 1.0542306944174284,
|
|
"grad_norm": 1.6640625,
|
|
"learning_rate": 0.0004893327609295887,
|
|
"loss": 5.3426,
|
|
"mean_token_accuracy": 0.17258263975381852,
|
|
"num_tokens": 23509996.0,
|
|
"step": 13550
|
|
},
|
|
{
|
|
"entropy": 5.4278984546661375,
|
|
"epoch": 1.0546197237891461,
|
|
"grad_norm": 1.9921875,
|
|
"learning_rate": 0.0004893243266475719,
|
|
"loss": 5.102,
|
|
"mean_token_accuracy": 0.1872847184538841,
|
|
"num_tokens": 23518316.0,
|
|
"step": 13555
|
|
},
|
|
{
|
|
"entropy": 5.363415908813477,
|
|
"epoch": 1.0550087531608636,
|
|
"grad_norm": 1.734375,
|
|
"learning_rate": 0.0004893158891135245,
|
|
"loss": 5.3373,
|
|
"mean_token_accuracy": 0.1713738903403282,
|
|
"num_tokens": 23526851.0,
|
|
"step": 13560
|
|
},
|
|
{
|
|
"entropy": 5.562817478179932,
|
|
"epoch": 1.055397782532581,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 0.0004893074483275746,
|
|
"loss": 5.1991,
|
|
"mean_token_accuracy": 0.1810261145234108,
|
|
"num_tokens": 23534757.0,
|
|
"step": 13565
|
|
},
|
|
{
|
|
"entropy": 5.489916658401489,
|
|
"epoch": 1.0557868119042988,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.0004892990042898503,
|
|
"loss": 5.2811,
|
|
"mean_token_accuracy": 0.16816927790641784,
|
|
"num_tokens": 23544102.0,
|
|
"step": 13570
|
|
},
|
|
{
|
|
"entropy": 5.450853300094605,
|
|
"epoch": 1.0561758412760163,
|
|
"grad_norm": 1.671875,
|
|
"learning_rate": 0.0004892905570004798,
|
|
"loss": 5.3325,
|
|
"mean_token_accuracy": 0.16643284410238265,
|
|
"num_tokens": 23552663.0,
|
|
"step": 13575
|
|
},
|
|
{
|
|
"entropy": 5.45705623626709,
|
|
"epoch": 1.056564870647734,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 0.000489282106459591,
|
|
"loss": 5.2202,
|
|
"mean_token_accuracy": 0.1761070415377617,
|
|
"num_tokens": 23561144.0,
|
|
"step": 13580
|
|
},
|
|
{
|
|
"entropy": 5.475066709518432,
|
|
"epoch": 1.0569539000194514,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.0004892736526673124,
|
|
"loss": 5.1921,
|
|
"mean_token_accuracy": 0.1789240226149559,
|
|
"num_tokens": 23569833.0,
|
|
"step": 13585
|
|
},
|
|
{
|
|
"entropy": 5.513002824783325,
|
|
"epoch": 1.0573429293911691,
|
|
"grad_norm": 1.5,
|
|
"learning_rate": 0.0004892651956237721,
|
|
"loss": 5.2696,
|
|
"mean_token_accuracy": 0.1695745050907135,
|
|
"num_tokens": 23578643.0,
|
|
"step": 13590
|
|
},
|
|
{
|
|
"entropy": 5.526211166381836,
|
|
"epoch": 1.0577319587628866,
|
|
"grad_norm": 1.578125,
|
|
"learning_rate": 0.0004892567353290986,
|
|
"loss": 5.3303,
|
|
"mean_token_accuracy": 0.16901452243328094,
|
|
"num_tokens": 23587324.0,
|
|
"step": 13595
|
|
},
|
|
{
|
|
"entropy": 5.484643411636353,
|
|
"epoch": 1.058120988134604,
|
|
"grad_norm": 1.5078125,
|
|
"learning_rate": 0.0004892482717834201,
|
|
"loss": 5.2859,
|
|
"mean_token_accuracy": 0.17125508487224578,
|
|
"num_tokens": 23595670.0,
|
|
"step": 13600
|
|
},
|
|
{
|
|
"entropy": 5.501117610931397,
|
|
"epoch": 1.0585100175063218,
|
|
"grad_norm": 1.6015625,
|
|
"learning_rate": 0.0004892398049868651,
|
|
"loss": 5.1955,
|
|
"mean_token_accuracy": 0.18598539382219315,
|
|
"num_tokens": 23603833.0,
|
|
"step": 13605
|
|
},
|
|
{
|
|
"entropy": 5.489117765426636,
|
|
"epoch": 1.0588990468780393,
|
|
"grad_norm": 1.609375,
|
|
"learning_rate": 0.000489231334939562,
|
|
"loss": 5.2803,
|
|
"mean_token_accuracy": 0.170607028901577,
|
|
"num_tokens": 23612815.0,
|
|
"step": 13610
|
|
},
|
|
{
|
|
"entropy": 5.495545959472656,
|
|
"epoch": 1.059288076249757,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.0004892228616416395,
|
|
"loss": 5.2759,
|
|
"mean_token_accuracy": 0.17046092450618744,
|
|
"num_tokens": 23621178.0,
|
|
"step": 13615
|
|
},
|
|
{
|
|
"entropy": 5.521439266204834,
|
|
"epoch": 1.0596771056214744,
|
|
"grad_norm": 1.6015625,
|
|
"learning_rate": 0.0004892143850932259,
|
|
"loss": 5.4818,
|
|
"mean_token_accuracy": 0.1657577119767666,
|
|
"num_tokens": 23630681.0,
|
|
"step": 13620
|
|
},
|
|
{
|
|
"entropy": 5.606350326538086,
|
|
"epoch": 1.060066134993192,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.00048920590529445,
|
|
"loss": 5.2601,
|
|
"mean_token_accuracy": 0.1809553548693657,
|
|
"num_tokens": 23639374.0,
|
|
"step": 13625
|
|
},
|
|
{
|
|
"entropy": 5.511284446716308,
|
|
"epoch": 1.0604551643649096,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0004891974222454406,
|
|
"loss": 5.2775,
|
|
"mean_token_accuracy": 0.17681968212127686,
|
|
"num_tokens": 23648217.0,
|
|
"step": 13630
|
|
},
|
|
{
|
|
"entropy": 5.525805997848511,
|
|
"epoch": 1.060844193736627,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.0004891889359463261,
|
|
"loss": 5.2448,
|
|
"mean_token_accuracy": 0.1823773980140686,
|
|
"num_tokens": 23656688.0,
|
|
"step": 13635
|
|
},
|
|
{
|
|
"entropy": 5.478025293350219,
|
|
"epoch": 1.0612332231083448,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0004891804463972354,
|
|
"loss": 5.3423,
|
|
"mean_token_accuracy": 0.17352458238601684,
|
|
"num_tokens": 23666646.0,
|
|
"step": 13640
|
|
},
|
|
{
|
|
"entropy": 5.465211963653564,
|
|
"epoch": 1.0616222524800623,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.0004891719535982974,
|
|
"loss": 5.2215,
|
|
"mean_token_accuracy": 0.18674075454473496,
|
|
"num_tokens": 23675278.0,
|
|
"step": 13645
|
|
},
|
|
{
|
|
"entropy": 5.568284606933593,
|
|
"epoch": 1.0620112818517797,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.0004891634575496408,
|
|
"loss": 5.3292,
|
|
"mean_token_accuracy": 0.16905170828104019,
|
|
"num_tokens": 23684263.0,
|
|
"step": 13650
|
|
},
|
|
{
|
|
"entropy": 5.520307779312134,
|
|
"epoch": 1.0624003112234974,
|
|
"grad_norm": 1.5546875,
|
|
"learning_rate": 0.0004891549582513946,
|
|
"loss": 5.1674,
|
|
"mean_token_accuracy": 0.18085059076547622,
|
|
"num_tokens": 23692249.0,
|
|
"step": 13655
|
|
},
|
|
{
|
|
"entropy": 5.528056287765503,
|
|
"epoch": 1.062789340595215,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 0.000489146455703688,
|
|
"loss": 5.3893,
|
|
"mean_token_accuracy": 0.1735594689846039,
|
|
"num_tokens": 23701082.0,
|
|
"step": 13660
|
|
},
|
|
{
|
|
"entropy": 5.488478803634644,
|
|
"epoch": 1.0631783699669326,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.0004891379499066495,
|
|
"loss": 5.339,
|
|
"mean_token_accuracy": 0.16487124264240266,
|
|
"num_tokens": 23710277.0,
|
|
"step": 13665
|
|
},
|
|
{
|
|
"entropy": 5.5258571147918705,
|
|
"epoch": 1.06356739933865,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.0004891294408604087,
|
|
"loss": 5.3009,
|
|
"mean_token_accuracy": 0.17213804572820662,
|
|
"num_tokens": 23719131.0,
|
|
"step": 13670
|
|
},
|
|
{
|
|
"entropy": 5.435294198989868,
|
|
"epoch": 1.0639564287103676,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.0004891209285650942,
|
|
"loss": 5.2157,
|
|
"mean_token_accuracy": 0.17662305384874344,
|
|
"num_tokens": 23727674.0,
|
|
"step": 13675
|
|
},
|
|
{
|
|
"entropy": 5.5362263202667235,
|
|
"epoch": 1.0643454580820852,
|
|
"grad_norm": 1.578125,
|
|
"learning_rate": 0.0004891124130208355,
|
|
"loss": 5.3673,
|
|
"mean_token_accuracy": 0.16604161858558655,
|
|
"num_tokens": 23736181.0,
|
|
"step": 13680
|
|
},
|
|
{
|
|
"entropy": 5.456675100326538,
|
|
"epoch": 1.0647344874538027,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.0004891038942277618,
|
|
"loss": 5.2362,
|
|
"mean_token_accuracy": 0.1761413961648941,
|
|
"num_tokens": 23744552.0,
|
|
"step": 13685
|
|
},
|
|
{
|
|
"entropy": 5.585657119750977,
|
|
"epoch": 1.0651235168255204,
|
|
"grad_norm": 1.5,
|
|
"learning_rate": 0.0004890953721860022,
|
|
"loss": 5.3797,
|
|
"mean_token_accuracy": 0.16632058024406432,
|
|
"num_tokens": 23753755.0,
|
|
"step": 13690
|
|
},
|
|
{
|
|
"entropy": 5.528018474578857,
|
|
"epoch": 1.065512546197238,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.0004890868468956862,
|
|
"loss": 5.2732,
|
|
"mean_token_accuracy": 0.17564847469329833,
|
|
"num_tokens": 23761759.0,
|
|
"step": 13695
|
|
},
|
|
{
|
|
"entropy": 5.455029535293579,
|
|
"epoch": 1.0659015755689554,
|
|
"grad_norm": 1.6171875,
|
|
"learning_rate": 0.000489078318356943,
|
|
"loss": 5.2832,
|
|
"mean_token_accuracy": 0.16916959285736083,
|
|
"num_tokens": 23769952.0,
|
|
"step": 13700
|
|
},
|
|
{
|
|
"entropy": 5.455484914779663,
|
|
"epoch": 1.066290604940673,
|
|
"grad_norm": 1.7109375,
|
|
"learning_rate": 0.0004890697865699021,
|
|
"loss": 5.296,
|
|
"mean_token_accuracy": 0.1771170452237129,
|
|
"num_tokens": 23778045.0,
|
|
"step": 13705
|
|
},
|
|
{
|
|
"entropy": 5.527831268310547,
|
|
"epoch": 1.0666796343123905,
|
|
"grad_norm": 1.53125,
|
|
"learning_rate": 0.0004890612515346929,
|
|
"loss": 5.2693,
|
|
"mean_token_accuracy": 0.17209134697914125,
|
|
"num_tokens": 23787477.0,
|
|
"step": 13710
|
|
},
|
|
{
|
|
"entropy": 5.52645320892334,
|
|
"epoch": 1.0670686636841082,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.0004890527132514448,
|
|
"loss": 5.2298,
|
|
"mean_token_accuracy": 0.18076589256525039,
|
|
"num_tokens": 23795905.0,
|
|
"step": 13715
|
|
},
|
|
{
|
|
"entropy": 5.537902879714966,
|
|
"epoch": 1.0674576930558257,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 0.0004890441717202876,
|
|
"loss": 5.3202,
|
|
"mean_token_accuracy": 0.17314850389957429,
|
|
"num_tokens": 23804339.0,
|
|
"step": 13720
|
|
},
|
|
{
|
|
"entropy": 5.508216476440429,
|
|
"epoch": 1.0678467224275432,
|
|
"grad_norm": 1.5703125,
|
|
"learning_rate": 0.0004890356269413507,
|
|
"loss": 5.3149,
|
|
"mean_token_accuracy": 0.17237518727779388,
|
|
"num_tokens": 23813032.0,
|
|
"step": 13725
|
|
},
|
|
{
|
|
"entropy": 5.469225978851318,
|
|
"epoch": 1.068235751799261,
|
|
"grad_norm": 1.5625,
|
|
"learning_rate": 0.000489027078914764,
|
|
"loss": 5.2067,
|
|
"mean_token_accuracy": 0.1862444743514061,
|
|
"num_tokens": 23822047.0,
|
|
"step": 13730
|
|
},
|
|
{
|
|
"entropy": 5.376841926574707,
|
|
"epoch": 1.0686247811709784,
|
|
"grad_norm": 1.546875,
|
|
"learning_rate": 0.0004890185276406569,
|
|
"loss": 5.1837,
|
|
"mean_token_accuracy": 0.17995652109384536,
|
|
"num_tokens": 23831220.0,
|
|
"step": 13735
|
|
},
|
|
{
|
|
"entropy": 5.509959125518799,
|
|
"epoch": 1.069013810542696,
|
|
"grad_norm": 1.53125,
|
|
"learning_rate": 0.0004890099731191592,
|
|
"loss": 5.3625,
|
|
"mean_token_accuracy": 0.16882993131875992,
|
|
"num_tokens": 23840118.0,
|
|
"step": 13740
|
|
},
|
|
{
|
|
"entropy": 5.51298885345459,
|
|
"epoch": 1.0694028399144135,
|
|
"grad_norm": 1.640625,
|
|
"learning_rate": 0.000489001415350401,
|
|
"loss": 5.2921,
|
|
"mean_token_accuracy": 0.17207494974136353,
|
|
"num_tokens": 23848826.0,
|
|
"step": 13745
|
|
},
|
|
{
|
|
"entropy": 5.581535530090332,
|
|
"epoch": 1.069791869286131,
|
|
"grad_norm": 1.5234375,
|
|
"learning_rate": 0.0004889928543345118,
|
|
"loss": 5.426,
|
|
"mean_token_accuracy": 0.1689763769507408,
|
|
"num_tokens": 23857462.0,
|
|
"step": 13750
|
|
},
|
|
{
|
|
"entropy": 5.515957069396973,
|
|
"epoch": 1.0701808986578487,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.0004889842900716217,
|
|
"loss": 5.2581,
|
|
"mean_token_accuracy": 0.1731693923473358,
|
|
"num_tokens": 23866842.0,
|
|
"step": 13755
|
|
},
|
|
{
|
|
"entropy": 5.507188034057617,
|
|
"epoch": 1.0705699280295662,
|
|
"grad_norm": 1.5703125,
|
|
"learning_rate": 0.0004889757225618606,
|
|
"loss": 5.3104,
|
|
"mean_token_accuracy": 0.16708216518163682,
|
|
"num_tokens": 23875079.0,
|
|
"step": 13760
|
|
},
|
|
{
|
|
"entropy": 5.5463803768157955,
|
|
"epoch": 1.0709589574012839,
|
|
"grad_norm": 1.84375,
|
|
"learning_rate": 0.0004889671518053584,
|
|
"loss": 5.2548,
|
|
"mean_token_accuracy": 0.17044838666915893,
|
|
"num_tokens": 23883963.0,
|
|
"step": 13765
|
|
},
|
|
{
|
|
"entropy": 5.4997642040252686,
|
|
"epoch": 1.0713479867730014,
|
|
"grad_norm": 1.71875,
|
|
"learning_rate": 0.0004889585778022453,
|
|
"loss": 5.239,
|
|
"mean_token_accuracy": 0.18146473914384842,
|
|
"num_tokens": 23892709.0,
|
|
"step": 13770
|
|
},
|
|
{
|
|
"entropy": 5.492747068405151,
|
|
"epoch": 1.0717370161447188,
|
|
"grad_norm": 1.8046875,
|
|
"learning_rate": 0.0004889500005526514,
|
|
"loss": 5.3804,
|
|
"mean_token_accuracy": 0.17092076316475868,
|
|
"num_tokens": 23901124.0,
|
|
"step": 13775
|
|
},
|
|
{
|
|
"entropy": 5.535728645324707,
|
|
"epoch": 1.0721260455164365,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0004889414200567067,
|
|
"loss": 5.3293,
|
|
"mean_token_accuracy": 0.16633498817682266,
|
|
"num_tokens": 23909442.0,
|
|
"step": 13780
|
|
},
|
|
{
|
|
"entropy": 5.512922954559326,
|
|
"epoch": 1.072515074888154,
|
|
"grad_norm": 1.546875,
|
|
"learning_rate": 0.0004889328363145415,
|
|
"loss": 5.2777,
|
|
"mean_token_accuracy": 0.17441274374723434,
|
|
"num_tokens": 23918143.0,
|
|
"step": 13785
|
|
},
|
|
{
|
|
"entropy": 5.489599895477295,
|
|
"epoch": 1.0729041042598717,
|
|
"grad_norm": 1.6328125,
|
|
"learning_rate": 0.0004889242493262859,
|
|
"loss": 5.245,
|
|
"mean_token_accuracy": 0.1780176654458046,
|
|
"num_tokens": 23926432.0,
|
|
"step": 13790
|
|
},
|
|
{
|
|
"entropy": 5.57047758102417,
|
|
"epoch": 1.0732931336315892,
|
|
"grad_norm": 1.6640625,
|
|
"learning_rate": 0.0004889156590920704,
|
|
"loss": 5.3727,
|
|
"mean_token_accuracy": 0.16337321549654008,
|
|
"num_tokens": 23935362.0,
|
|
"step": 13795
|
|
},
|
|
{
|
|
"entropy": 5.458642387390137,
|
|
"epoch": 1.0736821630033067,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.0004889070656120253,
|
|
"loss": 5.1366,
|
|
"mean_token_accuracy": 0.17875975072383882,
|
|
"num_tokens": 23943926.0,
|
|
"step": 13800
|
|
},
|
|
{
|
|
"entropy": 5.469856405258179,
|
|
"epoch": 1.0740711923750244,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.0004888984688862809,
|
|
"loss": 5.2823,
|
|
"mean_token_accuracy": 0.175020931661129,
|
|
"num_tokens": 23952513.0,
|
|
"step": 13805
|
|
},
|
|
{
|
|
"entropy": 5.4628509998321535,
|
|
"epoch": 1.0744602217467418,
|
|
"grad_norm": 1.6484375,
|
|
"learning_rate": 0.0004888898689149677,
|
|
"loss": 5.3335,
|
|
"mean_token_accuracy": 0.1650994449853897,
|
|
"num_tokens": 23961529.0,
|
|
"step": 13810
|
|
},
|
|
{
|
|
"entropy": 5.636935758590698,
|
|
"epoch": 1.0748492511184595,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.0004888812656982162,
|
|
"loss": 5.3822,
|
|
"mean_token_accuracy": 0.16842030137777328,
|
|
"num_tokens": 23971156.0,
|
|
"step": 13815
|
|
},
|
|
{
|
|
"entropy": 5.572997665405273,
|
|
"epoch": 1.075238280490177,
|
|
"grad_norm": 1.8046875,
|
|
"learning_rate": 0.0004888726592361569,
|
|
"loss": 5.2832,
|
|
"mean_token_accuracy": 0.17064432203769683,
|
|
"num_tokens": 23979676.0,
|
|
"step": 13820
|
|
},
|
|
{
|
|
"entropy": 5.519537258148193,
|
|
"epoch": 1.0756273098618945,
|
|
"grad_norm": 1.515625,
|
|
"learning_rate": 0.0004888640495289204,
|
|
"loss": 5.2279,
|
|
"mean_token_accuracy": 0.1808910682797432,
|
|
"num_tokens": 23987764.0,
|
|
"step": 13825
|
|
},
|
|
{
|
|
"entropy": 5.549085712432861,
|
|
"epoch": 1.0760163392336122,
|
|
"grad_norm": 1.546875,
|
|
"learning_rate": 0.0004888554365766374,
|
|
"loss": 5.2696,
|
|
"mean_token_accuracy": 0.16803651452064514,
|
|
"num_tokens": 23995844.0,
|
|
"step": 13830
|
|
},
|
|
{
|
|
"entropy": 5.552345895767212,
|
|
"epoch": 1.0764053686053296,
|
|
"grad_norm": 1.6953125,
|
|
"learning_rate": 0.0004888468203794385,
|
|
"loss": 5.3576,
|
|
"mean_token_accuracy": 0.16544483453035355,
|
|
"num_tokens": 24003824.0,
|
|
"step": 13835
|
|
},
|
|
{
|
|
"entropy": 5.463160610198974,
|
|
"epoch": 1.0767943979770473,
|
|
"grad_norm": 1.5546875,
|
|
"learning_rate": 0.0004888382009374545,
|
|
"loss": 5.292,
|
|
"mean_token_accuracy": 0.1725937694311142,
|
|
"num_tokens": 24012471.0,
|
|
"step": 13840
|
|
},
|
|
{
|
|
"entropy": 5.525017404556275,
|
|
"epoch": 1.0771834273487648,
|
|
"grad_norm": 1.578125,
|
|
"learning_rate": 0.0004888295782508161,
|
|
"loss": 5.2662,
|
|
"mean_token_accuracy": 0.17510892897844316,
|
|
"num_tokens": 24021344.0,
|
|
"step": 13845
|
|
},
|
|
{
|
|
"entropy": 5.486898756027221,
|
|
"epoch": 1.0775724567204823,
|
|
"grad_norm": 1.59375,
|
|
"learning_rate": 0.0004888209523196542,
|
|
"loss": 5.2607,
|
|
"mean_token_accuracy": 0.17639965415000916,
|
|
"num_tokens": 24029598.0,
|
|
"step": 13850
|
|
},
|
|
{
|
|
"entropy": 5.484881019592285,
|
|
"epoch": 1.0779614860922,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.0004888123231440997,
|
|
"loss": 5.2767,
|
|
"mean_token_accuracy": 0.1789987400174141,
|
|
"num_tokens": 24038097.0,
|
|
"step": 13855
|
|
},
|
|
{
|
|
"entropy": 5.533191394805908,
|
|
"epoch": 1.0783505154639175,
|
|
"grad_norm": 1.59375,
|
|
"learning_rate": 0.0004888036907242834,
|
|
"loss": 5.3323,
|
|
"mean_token_accuracy": 0.17413052171468735,
|
|
"num_tokens": 24046812.0,
|
|
"step": 13860
|
|
},
|
|
{
|
|
"entropy": 5.528208303451538,
|
|
"epoch": 1.0787395448356352,
|
|
"grad_norm": 1.5390625,
|
|
"learning_rate": 0.0004887950550603366,
|
|
"loss": 5.2836,
|
|
"mean_token_accuracy": 0.17413816899061202,
|
|
"num_tokens": 24054908.0,
|
|
"step": 13865
|
|
},
|
|
{
|
|
"entropy": 5.452695608139038,
|
|
"epoch": 1.0791285742073526,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 0.0004887864161523901,
|
|
"loss": 5.2676,
|
|
"mean_token_accuracy": 0.17835528701543807,
|
|
"num_tokens": 24063695.0,
|
|
"step": 13870
|
|
},
|
|
{
|
|
"entropy": 5.503851222991943,
|
|
"epoch": 1.0795176035790701,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.0004887777740005749,
|
|
"loss": 5.2661,
|
|
"mean_token_accuracy": 0.18128465861082077,
|
|
"num_tokens": 24072481.0,
|
|
"step": 13875
|
|
},
|
|
{
|
|
"entropy": 5.448667240142822,
|
|
"epoch": 1.0799066329507878,
|
|
"grad_norm": 1.4921875,
|
|
"learning_rate": 0.0004887691286050224,
|
|
"loss": 5.2707,
|
|
"mean_token_accuracy": 0.17877298444509507,
|
|
"num_tokens": 24080751.0,
|
|
"step": 13880
|
|
},
|
|
{
|
|
"entropy": 5.48421049118042,
|
|
"epoch": 1.0802956623225053,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 0.0004887604799658635,
|
|
"loss": 5.2654,
|
|
"mean_token_accuracy": 0.1737658679485321,
|
|
"num_tokens": 24088618.0,
|
|
"step": 13885
|
|
},
|
|
{
|
|
"entropy": 5.5620828628540036,
|
|
"epoch": 1.080684691694223,
|
|
"grad_norm": 1.5234375,
|
|
"learning_rate": 0.0004887518280832295,
|
|
"loss": 5.345,
|
|
"mean_token_accuracy": 0.17011184096336365,
|
|
"num_tokens": 24096754.0,
|
|
"step": 13890
|
|
},
|
|
{
|
|
"entropy": 5.532328653335571,
|
|
"epoch": 1.0810737210659405,
|
|
"grad_norm": 1.7421875,
|
|
"learning_rate": 0.0004887431729572519,
|
|
"loss": 5.3002,
|
|
"mean_token_accuracy": 0.1793048232793808,
|
|
"num_tokens": 24104793.0,
|
|
"step": 13895
|
|
},
|
|
{
|
|
"entropy": 5.667744255065918,
|
|
"epoch": 1.081462750437658,
|
|
"grad_norm": 1.734375,
|
|
"learning_rate": 0.0004887345145880617,
|
|
"loss": 5.4321,
|
|
"mean_token_accuracy": 0.15813654214143752,
|
|
"num_tokens": 24113816.0,
|
|
"step": 13900
|
|
},
|
|
{
|
|
"entropy": 5.493576860427856,
|
|
"epoch": 1.0818517798093756,
|
|
"grad_norm": 1.75,
|
|
"learning_rate": 0.0004887258529757904,
|
|
"loss": 5.2002,
|
|
"mean_token_accuracy": 0.17426275163888932,
|
|
"num_tokens": 24123002.0,
|
|
"step": 13905
|
|
},
|
|
{
|
|
"entropy": 5.499223804473877,
|
|
"epoch": 1.082240809181093,
|
|
"grad_norm": 1.609375,
|
|
"learning_rate": 0.0004887171881205696,
|
|
"loss": 5.2648,
|
|
"mean_token_accuracy": 0.17826527506113052,
|
|
"num_tokens": 24130841.0,
|
|
"step": 13910
|
|
},
|
|
{
|
|
"entropy": 5.498661088943481,
|
|
"epoch": 1.0826298385528108,
|
|
"grad_norm": 1.671875,
|
|
"learning_rate": 0.0004887085200225306,
|
|
"loss": 5.3304,
|
|
"mean_token_accuracy": 0.16763283759355546,
|
|
"num_tokens": 24139236.0,
|
|
"step": 13915
|
|
},
|
|
{
|
|
"entropy": 5.502839183807373,
|
|
"epoch": 1.0830188679245283,
|
|
"grad_norm": 1.6953125,
|
|
"learning_rate": 0.0004886998486818049,
|
|
"loss": 5.1958,
|
|
"mean_token_accuracy": 0.17567423582077027,
|
|
"num_tokens": 24147824.0,
|
|
"step": 13920
|
|
},
|
|
{
|
|
"entropy": 5.5200048923492435,
|
|
"epoch": 1.083407897296246,
|
|
"grad_norm": 1.7265625,
|
|
"learning_rate": 0.0004886911740985242,
|
|
"loss": 5.3113,
|
|
"mean_token_accuracy": 0.1778162971138954,
|
|
"num_tokens": 24156555.0,
|
|
"step": 13925
|
|
},
|
|
{
|
|
"entropy": 5.562920188903808,
|
|
"epoch": 1.0837969266679635,
|
|
"grad_norm": 1.75,
|
|
"learning_rate": 0.00048868249627282,
|
|
"loss": 5.2392,
|
|
"mean_token_accuracy": 0.17716726660728455,
|
|
"num_tokens": 24164424.0,
|
|
"step": 13930
|
|
},
|
|
{
|
|
"entropy": 5.556947088241577,
|
|
"epoch": 1.084185956039681,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.000488673815204824,
|
|
"loss": 5.2657,
|
|
"mean_token_accuracy": 0.17522095143795013,
|
|
"num_tokens": 24173325.0,
|
|
"step": 13935
|
|
},
|
|
{
|
|
"entropy": 5.570267677307129,
|
|
"epoch": 1.0845749854113986,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.0004886651308946681,
|
|
"loss": 5.4047,
|
|
"mean_token_accuracy": 0.16763739436864852,
|
|
"num_tokens": 24181781.0,
|
|
"step": 13940
|
|
},
|
|
{
|
|
"entropy": 5.538307142257691,
|
|
"epoch": 1.084964014783116,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.0004886564433424839,
|
|
"loss": 5.2259,
|
|
"mean_token_accuracy": 0.17270767837762832,
|
|
"num_tokens": 24190065.0,
|
|
"step": 13945
|
|
},
|
|
{
|
|
"entropy": 5.530714750289917,
|
|
"epoch": 1.0853530441548336,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 0.0004886477525484032,
|
|
"loss": 5.3773,
|
|
"mean_token_accuracy": 0.15824755132198334,
|
|
"num_tokens": 24198814.0,
|
|
"step": 13950
|
|
},
|
|
{
|
|
"entropy": 5.504873752593994,
|
|
"epoch": 1.0857420735265513,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 0.0004886390585125579,
|
|
"loss": 5.2598,
|
|
"mean_token_accuracy": 0.17002679109573365,
|
|
"num_tokens": 24208008.0,
|
|
"step": 13955
|
|
},
|
|
{
|
|
"entropy": 5.570418977737427,
|
|
"epoch": 1.0861311028982688,
|
|
"grad_norm": 1.5078125,
|
|
"learning_rate": 0.0004886303612350799,
|
|
"loss": 5.2475,
|
|
"mean_token_accuracy": 0.17582174241542817,
|
|
"num_tokens": 24216098.0,
|
|
"step": 13960
|
|
},
|
|
{
|
|
"entropy": 5.388692474365234,
|
|
"epoch": 1.0865201322699864,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 0.0004886216607161013,
|
|
"loss": 5.1886,
|
|
"mean_token_accuracy": 0.17689920961856842,
|
|
"num_tokens": 24224943.0,
|
|
"step": 13965
|
|
},
|
|
{
|
|
"entropy": 5.472116184234619,
|
|
"epoch": 1.086909161641704,
|
|
"grad_norm": 1.5546875,
|
|
"learning_rate": 0.0004886129569557538,
|
|
"loss": 5.2458,
|
|
"mean_token_accuracy": 0.16619395166635514,
|
|
"num_tokens": 24232950.0,
|
|
"step": 13970
|
|
},
|
|
{
|
|
"entropy": 5.589103507995605,
|
|
"epoch": 1.0872981910134216,
|
|
"grad_norm": 1.5,
|
|
"learning_rate": 0.0004886042499541699,
|
|
"loss": 5.3923,
|
|
"mean_token_accuracy": 0.16164568513631822,
|
|
"num_tokens": 24242355.0,
|
|
"step": 13975
|
|
},
|
|
{
|
|
"entropy": 5.543732023239135,
|
|
"epoch": 1.087687220385139,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.0004885955397114813,
|
|
"loss": 5.2482,
|
|
"mean_token_accuracy": 0.17452059984207152,
|
|
"num_tokens": 24251247.0,
|
|
"step": 13980
|
|
},
|
|
{
|
|
"entropy": 5.498383712768555,
|
|
"epoch": 1.0880762497568566,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.0004885868262278205,
|
|
"loss": 5.3242,
|
|
"mean_token_accuracy": 0.1711634576320648,
|
|
"num_tokens": 24260281.0,
|
|
"step": 13985
|
|
},
|
|
{
|
|
"entropy": 5.607320308685303,
|
|
"epoch": 1.0884652791285743,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 0.0004885781095033195,
|
|
"loss": 5.3465,
|
|
"mean_token_accuracy": 0.16992434710264206,
|
|
"num_tokens": 24268474.0,
|
|
"step": 13990
|
|
},
|
|
{
|
|
"entropy": 5.569406509399414,
|
|
"epoch": 1.0888543085002917,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.0004885693895381108,
|
|
"loss": 5.3184,
|
|
"mean_token_accuracy": 0.17732724398374558,
|
|
"num_tokens": 24276897.0,
|
|
"step": 13995
|
|
},
|
|
{
|
|
"entropy": 5.526185989379883,
|
|
"epoch": 1.0892433378720092,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.0004885606663323263,
|
|
"loss": 5.2956,
|
|
"mean_token_accuracy": 0.17122695297002793,
|
|
"num_tokens": 24285892.0,
|
|
"step": 14000
|
|
},
|
|
{
|
|
"entropy": 5.494509553909301,
|
|
"epoch": 1.089632367243727,
|
|
"grad_norm": 1.6171875,
|
|
"learning_rate": 0.0004885519398860987,
|
|
"loss": 5.3126,
|
|
"mean_token_accuracy": 0.17743243128061295,
|
|
"num_tokens": 24294141.0,
|
|
"step": 14005
|
|
},
|
|
{
|
|
"entropy": 5.455658960342407,
|
|
"epoch": 1.0900213966154444,
|
|
"grad_norm": 1.5234375,
|
|
"learning_rate": 0.0004885432101995604,
|
|
"loss": 5.2563,
|
|
"mean_token_accuracy": 0.17039165049791336,
|
|
"num_tokens": 24302803.0,
|
|
"step": 14010
|
|
},
|
|
{
|
|
"entropy": 5.64307746887207,
|
|
"epoch": 1.090410425987162,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 0.0004885344772728436,
|
|
"loss": 5.4248,
|
|
"mean_token_accuracy": 0.16275346875190735,
|
|
"num_tokens": 24311755.0,
|
|
"step": 14015
|
|
},
|
|
{
|
|
"entropy": 5.515815353393554,
|
|
"epoch": 1.0907994553588796,
|
|
"grad_norm": 1.625,
|
|
"learning_rate": 0.0004885257411060812,
|
|
"loss": 5.242,
|
|
"mean_token_accuracy": 0.18066604137420655,
|
|
"num_tokens": 24320913.0,
|
|
"step": 14020
|
|
},
|
|
{
|
|
"entropy": 5.573009300231933,
|
|
"epoch": 1.0911884847305973,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 0.0004885170016994053,
|
|
"loss": 5.429,
|
|
"mean_token_accuracy": 0.16419671177864076,
|
|
"num_tokens": 24331112.0,
|
|
"step": 14025
|
|
},
|
|
{
|
|
"entropy": 5.47002010345459,
|
|
"epoch": 1.0915775141023147,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0004885082590529489,
|
|
"loss": 5.2034,
|
|
"mean_token_accuracy": 0.16966800689697265,
|
|
"num_tokens": 24339286.0,
|
|
"step": 14030
|
|
},
|
|
{
|
|
"entropy": 5.489774703979492,
|
|
"epoch": 1.0919665434740322,
|
|
"grad_norm": 1.5625,
|
|
"learning_rate": 0.0004884995131668445,
|
|
"loss": 5.2234,
|
|
"mean_token_accuracy": 0.17345633655786513,
|
|
"num_tokens": 24347787.0,
|
|
"step": 14035
|
|
},
|
|
{
|
|
"entropy": 5.512749528884887,
|
|
"epoch": 1.09235557284575,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.0004884907640412248,
|
|
"loss": 5.206,
|
|
"mean_token_accuracy": 0.18087660074234008,
|
|
"num_tokens": 24356340.0,
|
|
"step": 14040
|
|
},
|
|
{
|
|
"entropy": 5.493124723434448,
|
|
"epoch": 1.0927446022174674,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.0004884820116762225,
|
|
"loss": 5.2968,
|
|
"mean_token_accuracy": 0.16501840054988862,
|
|
"num_tokens": 24365182.0,
|
|
"step": 14045
|
|
},
|
|
{
|
|
"entropy": 5.5643104076385494,
|
|
"epoch": 1.093133631589185,
|
|
"grad_norm": 1.4921875,
|
|
"learning_rate": 0.0004884732560719706,
|
|
"loss": 5.3258,
|
|
"mean_token_accuracy": 0.170979143679142,
|
|
"num_tokens": 24373455.0,
|
|
"step": 14050
|
|
},
|
|
{
|
|
"entropy": 5.576919460296631,
|
|
"epoch": 1.0935226609609026,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.0004884644972286017,
|
|
"loss": 5.4021,
|
|
"mean_token_accuracy": 0.1658269241452217,
|
|
"num_tokens": 24382433.0,
|
|
"step": 14055
|
|
},
|
|
{
|
|
"entropy": 5.466411495208741,
|
|
"epoch": 1.09391169033262,
|
|
"grad_norm": 1.515625,
|
|
"learning_rate": 0.0004884557351462488,
|
|
"loss": 5.2123,
|
|
"mean_token_accuracy": 0.1760855197906494,
|
|
"num_tokens": 24390971.0,
|
|
"step": 14060
|
|
},
|
|
{
|
|
"entropy": 5.540451145172119,
|
|
"epoch": 1.0943007197043377,
|
|
"grad_norm": 1.9765625,
|
|
"learning_rate": 0.0004884469698250449,
|
|
"loss": 5.268,
|
|
"mean_token_accuracy": 0.1665873035788536,
|
|
"num_tokens": 24399508.0,
|
|
"step": 14065
|
|
},
|
|
{
|
|
"entropy": 5.513807106018066,
|
|
"epoch": 1.0946897490760552,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.000488438201265123,
|
|
"loss": 5.2397,
|
|
"mean_token_accuracy": 0.17556947767734526,
|
|
"num_tokens": 24408424.0,
|
|
"step": 14070
|
|
},
|
|
{
|
|
"entropy": 5.439089298248291,
|
|
"epoch": 1.095078778447773,
|
|
"grad_norm": 1.4921875,
|
|
"learning_rate": 0.0004884294294666161,
|
|
"loss": 5.3338,
|
|
"mean_token_accuracy": 0.16726643294095994,
|
|
"num_tokens": 24416918.0,
|
|
"step": 14075
|
|
},
|
|
{
|
|
"entropy": 5.498077535629273,
|
|
"epoch": 1.0954678078194904,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.0004884206544296573,
|
|
"loss": 5.1981,
|
|
"mean_token_accuracy": 0.1824410378932953,
|
|
"num_tokens": 24425779.0,
|
|
"step": 14080
|
|
},
|
|
{
|
|
"entropy": 5.4063379764556885,
|
|
"epoch": 1.0958568371912079,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.0004884118761543797,
|
|
"loss": 5.216,
|
|
"mean_token_accuracy": 0.17712197154760362,
|
|
"num_tokens": 24434567.0,
|
|
"step": 14085
|
|
},
|
|
{
|
|
"entropy": 5.448072719573974,
|
|
"epoch": 1.0962458665629256,
|
|
"grad_norm": 1.6953125,
|
|
"learning_rate": 0.0004884030946409167,
|
|
"loss": 5.2988,
|
|
"mean_token_accuracy": 0.1740243747830391,
|
|
"num_tokens": 24442980.0,
|
|
"step": 14090
|
|
},
|
|
{
|
|
"entropy": 5.515756893157959,
|
|
"epoch": 1.096634895934643,
|
|
"grad_norm": 1.8203125,
|
|
"learning_rate": 0.0004883943098894013,
|
|
"loss": 5.2276,
|
|
"mean_token_accuracy": 0.17545544505119323,
|
|
"num_tokens": 24452273.0,
|
|
"step": 14095
|
|
},
|
|
{
|
|
"entropy": 5.566474723815918,
|
|
"epoch": 1.0970239253063607,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.000488385521899967,
|
|
"loss": 5.327,
|
|
"mean_token_accuracy": 0.17111365646123886,
|
|
"num_tokens": 24461854.0,
|
|
"step": 14100
|
|
},
|
|
{
|
|
"entropy": 5.545776987075806,
|
|
"epoch": 1.0974129546780782,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.000488376730672747,
|
|
"loss": 5.382,
|
|
"mean_token_accuracy": 0.1663053661584854,
|
|
"num_tokens": 24470468.0,
|
|
"step": 14105
|
|
},
|
|
{
|
|
"entropy": 5.511515283584595,
|
|
"epoch": 1.0978019840497957,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 0.0004883679362078746,
|
|
"loss": 5.2336,
|
|
"mean_token_accuracy": 0.17532713562250138,
|
|
"num_tokens": 24479282.0,
|
|
"step": 14110
|
|
},
|
|
{
|
|
"entropy": 5.59149580001831,
|
|
"epoch": 1.0981910134215134,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.0004883591385054836,
|
|
"loss": 5.3124,
|
|
"mean_token_accuracy": 0.17655971199274062,
|
|
"num_tokens": 24487331.0,
|
|
"step": 14115
|
|
},
|
|
{
|
|
"entropy": 5.49587459564209,
|
|
"epoch": 1.0985800427932308,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.0004883503375657072,
|
|
"loss": 5.2278,
|
|
"mean_token_accuracy": 0.17757638692855834,
|
|
"num_tokens": 24496101.0,
|
|
"step": 14120
|
|
},
|
|
{
|
|
"entropy": 5.564512252807617,
|
|
"epoch": 1.0989690721649485,
|
|
"grad_norm": 1.515625,
|
|
"learning_rate": 0.0004883415333886789,
|
|
"loss": 5.3144,
|
|
"mean_token_accuracy": 0.16900820136070252,
|
|
"num_tokens": 24504321.0,
|
|
"step": 14125
|
|
},
|
|
{
|
|
"entropy": 5.527364253997803,
|
|
"epoch": 1.099358101536666,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.0004883327259745325,
|
|
"loss": 5.2132,
|
|
"mean_token_accuracy": 0.18230594992637633,
|
|
"num_tokens": 24511887.0,
|
|
"step": 14130
|
|
},
|
|
{
|
|
"entropy": 5.446292209625244,
|
|
"epoch": 1.0997471309083835,
|
|
"grad_norm": 1.59375,
|
|
"learning_rate": 0.0004883239153234015,
|
|
"loss": 5.2343,
|
|
"mean_token_accuracy": 0.1736101821064949,
|
|
"num_tokens": 24521188.0,
|
|
"step": 14135
|
|
},
|
|
{
|
|
"entropy": 5.53908143043518,
|
|
"epoch": 1.1001361602801012,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0004883151014354197,
|
|
"loss": 5.2132,
|
|
"mean_token_accuracy": 0.17559333592653276,
|
|
"num_tokens": 24530656.0,
|
|
"step": 14140
|
|
},
|
|
{
|
|
"entropy": 5.483546781539917,
|
|
"epoch": 1.1005251896518187,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.0004883062843107207,
|
|
"loss": 5.2299,
|
|
"mean_token_accuracy": 0.17139920890331267,
|
|
"num_tokens": 24539438.0,
|
|
"step": 14145
|
|
},
|
|
{
|
|
"entropy": 5.498910617828369,
|
|
"epoch": 1.1009142190235364,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 0.0004882974639494383,
|
|
"loss": 5.3033,
|
|
"mean_token_accuracy": 0.17399274706840515,
|
|
"num_tokens": 24548005.0,
|
|
"step": 14150
|
|
},
|
|
{
|
|
"entropy": 5.566946887969971,
|
|
"epoch": 1.1013032483952538,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.0004882886403517065,
|
|
"loss": 5.3681,
|
|
"mean_token_accuracy": 0.1682498037815094,
|
|
"num_tokens": 24556507.0,
|
|
"step": 14155
|
|
},
|
|
{
|
|
"entropy": 5.5137049674987795,
|
|
"epoch": 1.1016922777669713,
|
|
"grad_norm": 1.578125,
|
|
"learning_rate": 0.0004882798135176589,
|
|
"loss": 5.3057,
|
|
"mean_token_accuracy": 0.17206979393959046,
|
|
"num_tokens": 24565228.0,
|
|
"step": 14160
|
|
},
|
|
{
|
|
"entropy": 5.4789231300354,
|
|
"epoch": 1.102081307138689,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.00048827098344742973,
|
|
"loss": 5.2407,
|
|
"mean_token_accuracy": 0.17383838891983033,
|
|
"num_tokens": 24573977.0,
|
|
"step": 14165
|
|
},
|
|
{
|
|
"entropy": 5.458100080490112,
|
|
"epoch": 1.1024703365104065,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.0004882621501411528,
|
|
"loss": 5.1939,
|
|
"mean_token_accuracy": 0.1821801632642746,
|
|
"num_tokens": 24582897.0,
|
|
"step": 14170
|
|
},
|
|
{
|
|
"entropy": 5.490749979019165,
|
|
"epoch": 1.1028593658821242,
|
|
"grad_norm": 1.6328125,
|
|
"learning_rate": 0.0004882533135989622,
|
|
"loss": 5.1999,
|
|
"mean_token_accuracy": 0.17521614581346512,
|
|
"num_tokens": 24591132.0,
|
|
"step": 14175
|
|
},
|
|
{
|
|
"entropy": 5.466962289810181,
|
|
"epoch": 1.1032483952538417,
|
|
"grad_norm": 2.0,
|
|
"learning_rate": 0.000488244473820992,
|
|
"loss": 5.2294,
|
|
"mean_token_accuracy": 0.17761001884937286,
|
|
"num_tokens": 24600111.0,
|
|
"step": 14180
|
|
},
|
|
{
|
|
"entropy": 5.443285846710205,
|
|
"epoch": 1.1036374246255591,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.00048823563080737634,
|
|
"loss": 5.2862,
|
|
"mean_token_accuracy": 0.17004667669534684,
|
|
"num_tokens": 24609229.0,
|
|
"step": 14185
|
|
},
|
|
{
|
|
"entropy": 5.501825761795044,
|
|
"epoch": 1.1040264539972768,
|
|
"grad_norm": 1.4921875,
|
|
"learning_rate": 0.0004882267845582493,
|
|
"loss": 5.2083,
|
|
"mean_token_accuracy": 0.17707748860120773,
|
|
"num_tokens": 24618012.0,
|
|
"step": 14190
|
|
},
|
|
{
|
|
"entropy": 5.542854928970337,
|
|
"epoch": 1.1044154833689943,
|
|
"grad_norm": 1.6015625,
|
|
"learning_rate": 0.00048821793507374526,
|
|
"loss": 5.2696,
|
|
"mean_token_accuracy": 0.1741737350821495,
|
|
"num_tokens": 24626801.0,
|
|
"step": 14195
|
|
},
|
|
{
|
|
"entropy": 5.569772338867187,
|
|
"epoch": 1.104804512740712,
|
|
"grad_norm": 1.5390625,
|
|
"learning_rate": 0.0004882090823539984,
|
|
"loss": 5.3253,
|
|
"mean_token_accuracy": 0.17464749217033387,
|
|
"num_tokens": 24635365.0,
|
|
"step": 14200
|
|
},
|
|
{
|
|
"entropy": 5.489601039886475,
|
|
"epoch": 1.1051935421124295,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.0004882002263991431,
|
|
"loss": 5.2556,
|
|
"mean_token_accuracy": 0.17316529005765915,
|
|
"num_tokens": 24643745.0,
|
|
"step": 14205
|
|
},
|
|
{
|
|
"entropy": 5.41388430595398,
|
|
"epoch": 1.105582571484147,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 0.00048819136720931364,
|
|
"loss": 5.1873,
|
|
"mean_token_accuracy": 0.17632879167795182,
|
|
"num_tokens": 24652760.0,
|
|
"step": 14210
|
|
},
|
|
{
|
|
"entropy": 5.49701418876648,
|
|
"epoch": 1.1059716008558647,
|
|
"grad_norm": 1.5234375,
|
|
"learning_rate": 0.00048818250478464457,
|
|
"loss": 5.2879,
|
|
"mean_token_accuracy": 0.17305073738098145,
|
|
"num_tokens": 24661326.0,
|
|
"step": 14215
|
|
},
|
|
{
|
|
"entropy": 5.551826047897339,
|
|
"epoch": 1.1063606302275821,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0004881736391252703,
|
|
"loss": 5.178,
|
|
"mean_token_accuracy": 0.1862391099333763,
|
|
"num_tokens": 24669611.0,
|
|
"step": 14220
|
|
},
|
|
{
|
|
"entropy": 5.520254325866699,
|
|
"epoch": 1.1067496595992998,
|
|
"grad_norm": 2.046875,
|
|
"learning_rate": 0.0004881647702313253,
|
|
"loss": 5.3132,
|
|
"mean_token_accuracy": 0.16749733984470366,
|
|
"num_tokens": 24677780.0,
|
|
"step": 14225
|
|
},
|
|
{
|
|
"entropy": 5.429117727279663,
|
|
"epoch": 1.1071386889710173,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.00048815589810294427,
|
|
"loss": 5.1826,
|
|
"mean_token_accuracy": 0.1751769483089447,
|
|
"num_tokens": 24685807.0,
|
|
"step": 14230
|
|
},
|
|
{
|
|
"entropy": 5.4855146408081055,
|
|
"epoch": 1.1075277183427348,
|
|
"grad_norm": 1.6328125,
|
|
"learning_rate": 0.00048814702274026174,
|
|
"loss": 5.2601,
|
|
"mean_token_accuracy": 0.16906141936779023,
|
|
"num_tokens": 24694383.0,
|
|
"step": 14235
|
|
},
|
|
{
|
|
"entropy": 5.464105606079102,
|
|
"epoch": 1.1079167477144525,
|
|
"grad_norm": 1.578125,
|
|
"learning_rate": 0.0004881381441434124,
|
|
"loss": 5.188,
|
|
"mean_token_accuracy": 0.18194652944803238,
|
|
"num_tokens": 24702325.0,
|
|
"step": 14240
|
|
},
|
|
{
|
|
"entropy": 5.561114072799683,
|
|
"epoch": 1.10830577708617,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.000488129262312531,
|
|
"loss": 5.2532,
|
|
"mean_token_accuracy": 0.1720443457365036,
|
|
"num_tokens": 24710725.0,
|
|
"step": 14245
|
|
},
|
|
{
|
|
"entropy": 5.460937070846557,
|
|
"epoch": 1.1086948064578876,
|
|
"grad_norm": 1.5234375,
|
|
"learning_rate": 0.00048812037724775217,
|
|
"loss": 5.2786,
|
|
"mean_token_accuracy": 0.1711227923631668,
|
|
"num_tokens": 24720230.0,
|
|
"step": 14250
|
|
},
|
|
{
|
|
"entropy": 5.501880311965943,
|
|
"epoch": 1.1090838358296051,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 0.0004881114889492109,
|
|
"loss": 5.2371,
|
|
"mean_token_accuracy": 0.1753535360097885,
|
|
"num_tokens": 24728896.0,
|
|
"step": 14255
|
|
},
|
|
{
|
|
"entropy": 5.560100173950195,
|
|
"epoch": 1.1094728652013226,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.00048810259741704197,
|
|
"loss": 5.3088,
|
|
"mean_token_accuracy": 0.17286834567785264,
|
|
"num_tokens": 24737731.0,
|
|
"step": 14260
|
|
},
|
|
{
|
|
"entropy": 5.489499187469482,
|
|
"epoch": 1.1098618945730403,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.0004880937026513803,
|
|
"loss": 5.1875,
|
|
"mean_token_accuracy": 0.18093744218349456,
|
|
"num_tokens": 24746335.0,
|
|
"step": 14265
|
|
},
|
|
{
|
|
"entropy": 5.476787281036377,
|
|
"epoch": 1.1102509239447578,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.0004880848046523609,
|
|
"loss": 5.2122,
|
|
"mean_token_accuracy": 0.18025351762771608,
|
|
"num_tokens": 24755917.0,
|
|
"step": 14270
|
|
},
|
|
{
|
|
"entropy": 5.56396975517273,
|
|
"epoch": 1.1106399533164755,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.00048807590342011875,
|
|
"loss": 5.3483,
|
|
"mean_token_accuracy": 0.16797933876514434,
|
|
"num_tokens": 24764713.0,
|
|
"step": 14275
|
|
},
|
|
{
|
|
"entropy": 5.616701889038086,
|
|
"epoch": 1.111028982688193,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.00048806699895478895,
|
|
"loss": 5.3653,
|
|
"mean_token_accuracy": 0.17085302323102952,
|
|
"num_tokens": 24773464.0,
|
|
"step": 14280
|
|
},
|
|
{
|
|
"entropy": 5.492700242996216,
|
|
"epoch": 1.1114180120599104,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.0004880580912565065,
|
|
"loss": 5.2838,
|
|
"mean_token_accuracy": 0.17509262263774872,
|
|
"num_tokens": 24781437.0,
|
|
"step": 14285
|
|
},
|
|
{
|
|
"entropy": 5.409321451187134,
|
|
"epoch": 1.1118070414316281,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0004880491803254067,
|
|
"loss": 5.1033,
|
|
"mean_token_accuracy": 0.18359559625387192,
|
|
"num_tokens": 24789505.0,
|
|
"step": 14290
|
|
},
|
|
{
|
|
"entropy": 5.552230453491211,
|
|
"epoch": 1.1121960708033456,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0004880402661616246,
|
|
"loss": 5.345,
|
|
"mean_token_accuracy": 0.17013064920902252,
|
|
"num_tokens": 24798492.0,
|
|
"step": 14295
|
|
},
|
|
{
|
|
"entropy": 5.51050181388855,
|
|
"epoch": 1.1125851001750633,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.0004880313487652956,
|
|
"loss": 5.3048,
|
|
"mean_token_accuracy": 0.16945937126874924,
|
|
"num_tokens": 24807472.0,
|
|
"step": 14300
|
|
},
|
|
{
|
|
"entropy": 5.59943208694458,
|
|
"epoch": 1.1129741295467808,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.00048802242813655503,
|
|
"loss": 5.3054,
|
|
"mean_token_accuracy": 0.17116051465272902,
|
|
"num_tokens": 24815838.0,
|
|
"step": 14305
|
|
},
|
|
{
|
|
"entropy": 5.451162433624267,
|
|
"epoch": 1.1133631589184985,
|
|
"grad_norm": 1.6015625,
|
|
"learning_rate": 0.000488013504275538,
|
|
"loss": 5.1964,
|
|
"mean_token_accuracy": 0.18074142187833786,
|
|
"num_tokens": 24823953.0,
|
|
"step": 14310
|
|
},
|
|
{
|
|
"entropy": 5.424050760269165,
|
|
"epoch": 1.113752188290216,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.0004880045771823802,
|
|
"loss": 5.1235,
|
|
"mean_token_accuracy": 0.1825163871049881,
|
|
"num_tokens": 24832414.0,
|
|
"step": 14315
|
|
},
|
|
{
|
|
"entropy": 5.4545470714569095,
|
|
"epoch": 1.1141412176619334,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.00048799564685721695,
|
|
"loss": 5.2501,
|
|
"mean_token_accuracy": 0.1822354808449745,
|
|
"num_tokens": 24840503.0,
|
|
"step": 14320
|
|
},
|
|
{
|
|
"entropy": 5.5194086074829105,
|
|
"epoch": 1.1145302470336511,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 0.0004879867133001837,
|
|
"loss": 5.3888,
|
|
"mean_token_accuracy": 0.16101891696453094,
|
|
"num_tokens": 24849272.0,
|
|
"step": 14325
|
|
},
|
|
{
|
|
"entropy": 5.544814777374268,
|
|
"epoch": 1.1149192764053686,
|
|
"grad_norm": 1.546875,
|
|
"learning_rate": 0.0004879777765114162,
|
|
"loss": 5.3474,
|
|
"mean_token_accuracy": 0.17115128487348558,
|
|
"num_tokens": 24858565.0,
|
|
"step": 14330
|
|
},
|
|
{
|
|
"entropy": 5.585868549346924,
|
|
"epoch": 1.115308305777086,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.00048796883649104996,
|
|
"loss": 5.2763,
|
|
"mean_token_accuracy": 0.1752402141690254,
|
|
"num_tokens": 24867811.0,
|
|
"step": 14335
|
|
},
|
|
{
|
|
"entropy": 5.512491226196289,
|
|
"epoch": 1.1156973351488038,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0004879598932392206,
|
|
"loss": 5.3187,
|
|
"mean_token_accuracy": 0.16691262722015382,
|
|
"num_tokens": 24876776.0,
|
|
"step": 14340
|
|
},
|
|
{
|
|
"entropy": 5.408519840240478,
|
|
"epoch": 1.1160863645205212,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.00048795094675606364,
|
|
"loss": 5.2523,
|
|
"mean_token_accuracy": 0.16862001717090608,
|
|
"num_tokens": 24885030.0,
|
|
"step": 14345
|
|
},
|
|
{
|
|
"entropy": 5.562605381011963,
|
|
"epoch": 1.116475393892239,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.0004879419970417152,
|
|
"loss": 5.3881,
|
|
"mean_token_accuracy": 0.1631487026810646,
|
|
"num_tokens": 24894336.0,
|
|
"step": 14350
|
|
},
|
|
{
|
|
"entropy": 5.586774253845215,
|
|
"epoch": 1.1168644232639564,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.00048793304409631077,
|
|
"loss": 5.3363,
|
|
"mean_token_accuracy": 0.1736133798956871,
|
|
"num_tokens": 24903107.0,
|
|
"step": 14355
|
|
},
|
|
{
|
|
"entropy": 5.6495466232299805,
|
|
"epoch": 1.117253452635674,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.0004879240879199863,
|
|
"loss": 5.4387,
|
|
"mean_token_accuracy": 0.16647580415010452,
|
|
"num_tokens": 24912727.0,
|
|
"step": 14360
|
|
},
|
|
{
|
|
"entropy": 5.459299039840698,
|
|
"epoch": 1.1176424820073916,
|
|
"grad_norm": 1.515625,
|
|
"learning_rate": 0.00048791512851287786,
|
|
"loss": 5.1895,
|
|
"mean_token_accuracy": 0.17333534806966783,
|
|
"num_tokens": 24921534.0,
|
|
"step": 14365
|
|
},
|
|
{
|
|
"entropy": 5.4738912105560305,
|
|
"epoch": 1.118031511379109,
|
|
"grad_norm": 1.578125,
|
|
"learning_rate": 0.00048790616587512107,
|
|
"loss": 5.2708,
|
|
"mean_token_accuracy": 0.1715287908911705,
|
|
"num_tokens": 24930093.0,
|
|
"step": 14370
|
|
},
|
|
{
|
|
"entropy": 5.536205768585205,
|
|
"epoch": 1.1184205407508268,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.0004878972000068521,
|
|
"loss": 5.368,
|
|
"mean_token_accuracy": 0.17202307283878326,
|
|
"num_tokens": 24939230.0,
|
|
"step": 14375
|
|
},
|
|
{
|
|
"entropy": 5.606374883651734,
|
|
"epoch": 1.1188095701225442,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.00048788823090820707,
|
|
"loss": 5.3971,
|
|
"mean_token_accuracy": 0.17488905787467957,
|
|
"num_tokens": 24947595.0,
|
|
"step": 14380
|
|
},
|
|
{
|
|
"entropy": 5.6173121452331545,
|
|
"epoch": 1.1191985994942617,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.00048787925857932194,
|
|
"loss": 5.364,
|
|
"mean_token_accuracy": 0.17087926268577575,
|
|
"num_tokens": 24957099.0,
|
|
"step": 14385
|
|
},
|
|
{
|
|
"entropy": 5.468348217010498,
|
|
"epoch": 1.1195876288659794,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 0.00048787028302033287,
|
|
"loss": 5.229,
|
|
"mean_token_accuracy": 0.1756865292787552,
|
|
"num_tokens": 24965701.0,
|
|
"step": 14390
|
|
},
|
|
{
|
|
"entropy": 5.524595069885254,
|
|
"epoch": 1.1199766582376969,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.00048786130423137606,
|
|
"loss": 5.3592,
|
|
"mean_token_accuracy": 0.1627870738506317,
|
|
"num_tokens": 24974025.0,
|
|
"step": 14395
|
|
},
|
|
{
|
|
"entropy": 5.623825216293335,
|
|
"epoch": 1.1203656876094146,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.0004878523222125879,
|
|
"loss": 5.4011,
|
|
"mean_token_accuracy": 0.1706815853714943,
|
|
"num_tokens": 24982930.0,
|
|
"step": 14400
|
|
},
|
|
{
|
|
"entropy": 5.584575843811035,
|
|
"epoch": 1.120754716981132,
|
|
"grad_norm": 1.5234375,
|
|
"learning_rate": 0.0004878433369641044,
|
|
"loss": 5.2743,
|
|
"mean_token_accuracy": 0.17862582802772523,
|
|
"num_tokens": 24991332.0,
|
|
"step": 14405
|
|
},
|
|
{
|
|
"entropy": 5.4755340099334715,
|
|
"epoch": 1.1211437463528497,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.0004878343484860621,
|
|
"loss": 5.2657,
|
|
"mean_token_accuracy": 0.17420647740364076,
|
|
"num_tokens": 25000130.0,
|
|
"step": 14410
|
|
},
|
|
{
|
|
"entropy": 5.469361066818237,
|
|
"epoch": 1.1215327757245672,
|
|
"grad_norm": 1.7734375,
|
|
"learning_rate": 0.0004878253567785972,
|
|
"loss": 5.2748,
|
|
"mean_token_accuracy": 0.17610540986061096,
|
|
"num_tokens": 25008423.0,
|
|
"step": 14415
|
|
},
|
|
{
|
|
"entropy": 5.5332142353057865,
|
|
"epoch": 1.1219218050962847,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.00048781636184184644,
|
|
"loss": 5.3629,
|
|
"mean_token_accuracy": 0.1674705982208252,
|
|
"num_tokens": 25017399.0,
|
|
"step": 14420
|
|
},
|
|
{
|
|
"entropy": 5.606417083740235,
|
|
"epoch": 1.1223108344680024,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.000487807363675946,
|
|
"loss": 5.3286,
|
|
"mean_token_accuracy": 0.17869464308023453,
|
|
"num_tokens": 25025957.0,
|
|
"step": 14425
|
|
},
|
|
{
|
|
"entropy": 5.561326169967652,
|
|
"epoch": 1.1226998638397199,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 0.0004877983622810326,
|
|
"loss": 5.2301,
|
|
"mean_token_accuracy": 0.18196647316217424,
|
|
"num_tokens": 25034246.0,
|
|
"step": 14430
|
|
},
|
|
{
|
|
"entropy": 5.431968450546265,
|
|
"epoch": 1.1230888932114376,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.0004877893576572427,
|
|
"loss": 5.2368,
|
|
"mean_token_accuracy": 0.17758679389953613,
|
|
"num_tokens": 25042461.0,
|
|
"step": 14435
|
|
},
|
|
{
|
|
"entropy": 5.451863193511963,
|
|
"epoch": 1.123477922583155,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.000487780349804713,
|
|
"loss": 5.2232,
|
|
"mean_token_accuracy": 0.17890723347663878,
|
|
"num_tokens": 25051291.0,
|
|
"step": 14440
|
|
},
|
|
{
|
|
"entropy": 5.526486492156982,
|
|
"epoch": 1.1238669519548725,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.0004877713387235802,
|
|
"loss": 5.3482,
|
|
"mean_token_accuracy": 0.17070892155170442,
|
|
"num_tokens": 25060538.0,
|
|
"step": 14445
|
|
},
|
|
{
|
|
"entropy": 5.572833061218262,
|
|
"epoch": 1.1242559813265902,
|
|
"grad_norm": 1.6328125,
|
|
"learning_rate": 0.000487762324413981,
|
|
"loss": 5.3146,
|
|
"mean_token_accuracy": 0.16665484458208085,
|
|
"num_tokens": 25068965.0,
|
|
"step": 14450
|
|
},
|
|
{
|
|
"entropy": 5.531497430801392,
|
|
"epoch": 1.1246450106983077,
|
|
"grad_norm": 1.4921875,
|
|
"learning_rate": 0.00048775330687605213,
|
|
"loss": 5.3006,
|
|
"mean_token_accuracy": 0.16858672946691514,
|
|
"num_tokens": 25077021.0,
|
|
"step": 14455
|
|
},
|
|
{
|
|
"entropy": 5.529527425765991,
|
|
"epoch": 1.1250340400700254,
|
|
"grad_norm": 1.6953125,
|
|
"learning_rate": 0.0004877442861099305,
|
|
"loss": 5.3053,
|
|
"mean_token_accuracy": 0.17757799625396728,
|
|
"num_tokens": 25086009.0,
|
|
"step": 14460
|
|
},
|
|
{
|
|
"entropy": 5.429346370697021,
|
|
"epoch": 1.1254230694417429,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.0004877352621157529,
|
|
"loss": 5.204,
|
|
"mean_token_accuracy": 0.18223759829998015,
|
|
"num_tokens": 25094745.0,
|
|
"step": 14465
|
|
},
|
|
{
|
|
"entropy": 5.503374528884888,
|
|
"epoch": 1.1258120988134603,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.00048772623489365635,
|
|
"loss": 5.263,
|
|
"mean_token_accuracy": 0.17386261373758316,
|
|
"num_tokens": 25103087.0,
|
|
"step": 14470
|
|
},
|
|
{
|
|
"entropy": 5.540647506713867,
|
|
"epoch": 1.126201128185178,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.0004877172044437777,
|
|
"loss": 5.279,
|
|
"mean_token_accuracy": 0.1717000797390938,
|
|
"num_tokens": 25111822.0,
|
|
"step": 14475
|
|
},
|
|
{
|
|
"entropy": 5.48570818901062,
|
|
"epoch": 1.1265901575568955,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.00048770817076625416,
|
|
"loss": 5.2562,
|
|
"mean_token_accuracy": 0.17591685503721238,
|
|
"num_tokens": 25119975.0,
|
|
"step": 14480
|
|
},
|
|
{
|
|
"entropy": 5.509499216079712,
|
|
"epoch": 1.126979186928613,
|
|
"grad_norm": 1.71875,
|
|
"learning_rate": 0.00048769913386122253,
|
|
"loss": 5.344,
|
|
"mean_token_accuracy": 0.16708275377750398,
|
|
"num_tokens": 25129031.0,
|
|
"step": 14485
|
|
},
|
|
{
|
|
"entropy": 5.553398847579956,
|
|
"epoch": 1.1273682163003307,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 0.0004876900937288202,
|
|
"loss": 5.2579,
|
|
"mean_token_accuracy": 0.17342377305030823,
|
|
"num_tokens": 25138230.0,
|
|
"step": 14490
|
|
},
|
|
{
|
|
"entropy": 5.5680934429168705,
|
|
"epoch": 1.1277572456720482,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.00048768105036918426,
|
|
"loss": 5.2668,
|
|
"mean_token_accuracy": 0.17579276263713836,
|
|
"num_tokens": 25147120.0,
|
|
"step": 14495
|
|
},
|
|
{
|
|
"entropy": 5.5095714092254635,
|
|
"epoch": 1.1281462750437659,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.00048767200378245187,
|
|
"loss": 5.2762,
|
|
"mean_token_accuracy": 0.16822680532932283,
|
|
"num_tokens": 25155623.0,
|
|
"step": 14500
|
|
},
|
|
{
|
|
"entropy": 5.416744041442871,
|
|
"epoch": 1.1285353044154833,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.00048766295396876025,
|
|
"loss": 5.1717,
|
|
"mean_token_accuracy": 0.1830092415213585,
|
|
"num_tokens": 25163867.0,
|
|
"step": 14505
|
|
},
|
|
{
|
|
"entropy": 5.495766830444336,
|
|
"epoch": 1.128924333787201,
|
|
"grad_norm": 1.6328125,
|
|
"learning_rate": 0.00048765390092824683,
|
|
"loss": 5.2948,
|
|
"mean_token_accuracy": 0.17490708976984023,
|
|
"num_tokens": 25172838.0,
|
|
"step": 14510
|
|
},
|
|
{
|
|
"entropy": 5.519143152236938,
|
|
"epoch": 1.1293133631589185,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.000487644844661049,
|
|
"loss": 5.2325,
|
|
"mean_token_accuracy": 0.17986900210380555,
|
|
"num_tokens": 25181168.0,
|
|
"step": 14515
|
|
},
|
|
{
|
|
"entropy": 5.478940725326538,
|
|
"epoch": 1.129702392530636,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.000487635785167304,
|
|
"loss": 5.2914,
|
|
"mean_token_accuracy": 0.178208564221859,
|
|
"num_tokens": 25190115.0,
|
|
"step": 14520
|
|
},
|
|
{
|
|
"entropy": 5.512725448608398,
|
|
"epoch": 1.1300914219023537,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.00048762672244714953,
|
|
"loss": 5.3209,
|
|
"mean_token_accuracy": 0.17323659509420394,
|
|
"num_tokens": 25199594.0,
|
|
"step": 14525
|
|
},
|
|
{
|
|
"entropy": 5.542869186401367,
|
|
"epoch": 1.1304804512740712,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.0004876176565007229,
|
|
"loss": 5.2567,
|
|
"mean_token_accuracy": 0.16444095969200134,
|
|
"num_tokens": 25208060.0,
|
|
"step": 14530
|
|
},
|
|
{
|
|
"entropy": 5.486799335479736,
|
|
"epoch": 1.1308694806457888,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.00048760858732816174,
|
|
"loss": 5.221,
|
|
"mean_token_accuracy": 0.17471545338630676,
|
|
"num_tokens": 25216257.0,
|
|
"step": 14535
|
|
},
|
|
{
|
|
"entropy": 5.4936473846435545,
|
|
"epoch": 1.1312585100175063,
|
|
"grad_norm": 1.5546875,
|
|
"learning_rate": 0.0004875995149296037,
|
|
"loss": 5.2443,
|
|
"mean_token_accuracy": 0.17619386017322541,
|
|
"num_tokens": 25225032.0,
|
|
"step": 14540
|
|
},
|
|
{
|
|
"entropy": 5.537398147583008,
|
|
"epoch": 1.1316475393892238,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.0004875904393051864,
|
|
"loss": 5.2867,
|
|
"mean_token_accuracy": 0.17638191431760789,
|
|
"num_tokens": 25233624.0,
|
|
"step": 14545
|
|
},
|
|
{
|
|
"entropy": 5.398117160797119,
|
|
"epoch": 1.1320365687609415,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.0004875813604550476,
|
|
"loss": 5.2489,
|
|
"mean_token_accuracy": 0.17609538733959199,
|
|
"num_tokens": 25242132.0,
|
|
"step": 14550
|
|
},
|
|
{
|
|
"entropy": 5.51240758895874,
|
|
"epoch": 1.132425598132659,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.00048757227837932494,
|
|
"loss": 5.26,
|
|
"mean_token_accuracy": 0.17577965408563614,
|
|
"num_tokens": 25250923.0,
|
|
"step": 14555
|
|
},
|
|
{
|
|
"entropy": 5.5694276809692385,
|
|
"epoch": 1.1328146275043767,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.0004875631930781563,
|
|
"loss": 5.2554,
|
|
"mean_token_accuracy": 0.17414026856422424,
|
|
"num_tokens": 25259783.0,
|
|
"step": 14560
|
|
},
|
|
{
|
|
"entropy": 5.585868692398071,
|
|
"epoch": 1.1332036568760941,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.00048755410455167967,
|
|
"loss": 5.4448,
|
|
"mean_token_accuracy": 0.167725133895874,
|
|
"num_tokens": 25268801.0,
|
|
"step": 14565
|
|
},
|
|
{
|
|
"entropy": 5.50393238067627,
|
|
"epoch": 1.1335926862478116,
|
|
"grad_norm": 1.4921875,
|
|
"learning_rate": 0.0004875450128000326,
|
|
"loss": 5.2666,
|
|
"mean_token_accuracy": 0.183109250664711,
|
|
"num_tokens": 25277226.0,
|
|
"step": 14570
|
|
},
|
|
{
|
|
"entropy": 5.515140533447266,
|
|
"epoch": 1.1339817156195293,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.0004875359178233534,
|
|
"loss": 5.3105,
|
|
"mean_token_accuracy": 0.16551288962364197,
|
|
"num_tokens": 25285887.0,
|
|
"step": 14575
|
|
},
|
|
{
|
|
"entropy": 5.4384214878082275,
|
|
"epoch": 1.1343707449912468,
|
|
"grad_norm": 1.5,
|
|
"learning_rate": 0.00048752681962177985,
|
|
"loss": 5.1727,
|
|
"mean_token_accuracy": 0.176611091196537,
|
|
"num_tokens": 25294025.0,
|
|
"step": 14580
|
|
},
|
|
{
|
|
"entropy": 5.498254823684692,
|
|
"epoch": 1.1347597743629645,
|
|
"grad_norm": 1.53125,
|
|
"learning_rate": 0.00048751771819545013,
|
|
"loss": 5.3815,
|
|
"mean_token_accuracy": 0.16712383478879927,
|
|
"num_tokens": 25303016.0,
|
|
"step": 14585
|
|
},
|
|
{
|
|
"entropy": 5.483353137969971,
|
|
"epoch": 1.135148803734682,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.00048750861354450236,
|
|
"loss": 5.1755,
|
|
"mean_token_accuracy": 0.17676083147525787,
|
|
"num_tokens": 25311193.0,
|
|
"step": 14590
|
|
},
|
|
{
|
|
"entropy": 5.481668424606323,
|
|
"epoch": 1.1355378331063994,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.0004874995056690746,
|
|
"loss": 5.2231,
|
|
"mean_token_accuracy": 0.17191832065582274,
|
|
"num_tokens": 25319380.0,
|
|
"step": 14595
|
|
},
|
|
{
|
|
"entropy": 5.490535306930542,
|
|
"epoch": 1.1359268624781171,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.000487490394569305,
|
|
"loss": 5.2526,
|
|
"mean_token_accuracy": 0.17922306209802627,
|
|
"num_tokens": 25327854.0,
|
|
"step": 14600
|
|
},
|
|
{
|
|
"entropy": 5.504375219345093,
|
|
"epoch": 1.1363158918498346,
|
|
"grad_norm": 1.5078125,
|
|
"learning_rate": 0.0004874812802453319,
|
|
"loss": 5.2983,
|
|
"mean_token_accuracy": 0.1733245149254799,
|
|
"num_tokens": 25335912.0,
|
|
"step": 14605
|
|
},
|
|
{
|
|
"entropy": 5.475161933898926,
|
|
"epoch": 1.1367049212215523,
|
|
"grad_norm": 1.5078125,
|
|
"learning_rate": 0.0004874721626972936,
|
|
"loss": 5.3156,
|
|
"mean_token_accuracy": 0.1783476710319519,
|
|
"num_tokens": 25344104.0,
|
|
"step": 14610
|
|
},
|
|
{
|
|
"entropy": 5.400818490982056,
|
|
"epoch": 1.1370939505932698,
|
|
"grad_norm": 1.59375,
|
|
"learning_rate": 0.0004874630419253284,
|
|
"loss": 5.0836,
|
|
"mean_token_accuracy": 0.18518089950084687,
|
|
"num_tokens": 25352583.0,
|
|
"step": 14615
|
|
},
|
|
{
|
|
"entropy": 5.446536064147949,
|
|
"epoch": 1.1374829799649873,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.00048745391792957474,
|
|
"loss": 5.2056,
|
|
"mean_token_accuracy": 0.17710380554199218,
|
|
"num_tokens": 25361035.0,
|
|
"step": 14620
|
|
},
|
|
{
|
|
"entropy": 5.457904720306397,
|
|
"epoch": 1.137872009336705,
|
|
"grad_norm": 1.5625,
|
|
"learning_rate": 0.00048744479071017097,
|
|
"loss": 5.2455,
|
|
"mean_token_accuracy": 0.17462990283966065,
|
|
"num_tokens": 25369511.0,
|
|
"step": 14625
|
|
},
|
|
{
|
|
"entropy": 5.516271924972534,
|
|
"epoch": 1.1382610387084224,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.0004874356602672556,
|
|
"loss": 5.2416,
|
|
"mean_token_accuracy": 0.17254792749881745,
|
|
"num_tokens": 25378023.0,
|
|
"step": 14630
|
|
},
|
|
{
|
|
"entropy": 5.463342237472534,
|
|
"epoch": 1.1386500680801401,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0004874265266009673,
|
|
"loss": 5.2694,
|
|
"mean_token_accuracy": 0.1757393255829811,
|
|
"num_tokens": 25386791.0,
|
|
"step": 14635
|
|
},
|
|
{
|
|
"entropy": 5.533389043807984,
|
|
"epoch": 1.1390390974518576,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0004874173897114445,
|
|
"loss": 5.3223,
|
|
"mean_token_accuracy": 0.16988997608423234,
|
|
"num_tokens": 25395401.0,
|
|
"step": 14640
|
|
},
|
|
{
|
|
"entropy": 5.491459751129151,
|
|
"epoch": 1.1394281268235753,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.00048740824959882603,
|
|
"loss": 5.2634,
|
|
"mean_token_accuracy": 0.1747543618083,
|
|
"num_tokens": 25404193.0,
|
|
"step": 14645
|
|
},
|
|
{
|
|
"entropy": 5.577925682067871,
|
|
"epoch": 1.1398171561952928,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.0004873991062632504,
|
|
"loss": 5.3606,
|
|
"mean_token_accuracy": 0.16573098450899124,
|
|
"num_tokens": 25413073.0,
|
|
"step": 14650
|
|
},
|
|
{
|
|
"entropy": 5.54101333618164,
|
|
"epoch": 1.1402061855670103,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.00048738995970485635,
|
|
"loss": 5.2393,
|
|
"mean_token_accuracy": 0.17702944129705428,
|
|
"num_tokens": 25422064.0,
|
|
"step": 14655
|
|
},
|
|
{
|
|
"entropy": 5.470462942123413,
|
|
"epoch": 1.140595214938728,
|
|
"grad_norm": 1.5078125,
|
|
"learning_rate": 0.0004873808099237827,
|
|
"loss": 5.2194,
|
|
"mean_token_accuracy": 0.17407362312078475,
|
|
"num_tokens": 25430711.0,
|
|
"step": 14660
|
|
},
|
|
{
|
|
"entropy": 5.521389198303223,
|
|
"epoch": 1.1409842443104454,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0004873716569201684,
|
|
"loss": 5.3322,
|
|
"mean_token_accuracy": 0.173028427362442,
|
|
"num_tokens": 25439527.0,
|
|
"step": 14665
|
|
},
|
|
{
|
|
"entropy": 5.567311000823975,
|
|
"epoch": 1.141373273682163,
|
|
"grad_norm": 1.5234375,
|
|
"learning_rate": 0.00048736250069415213,
|
|
"loss": 5.31,
|
|
"mean_token_accuracy": 0.1651947319507599,
|
|
"num_tokens": 25448633.0,
|
|
"step": 14670
|
|
},
|
|
{
|
|
"entropy": 5.539625215530395,
|
|
"epoch": 1.1417623030538806,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 0.0004873533412458729,
|
|
"loss": 5.2738,
|
|
"mean_token_accuracy": 0.17126673460006714,
|
|
"num_tokens": 25457657.0,
|
|
"step": 14675
|
|
},
|
|
{
|
|
"entropy": 5.5466142177581785,
|
|
"epoch": 1.142151332425598,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.00048734417857546986,
|
|
"loss": 5.3373,
|
|
"mean_token_accuracy": 0.16673405170440675,
|
|
"num_tokens": 25466698.0,
|
|
"step": 14680
|
|
},
|
|
{
|
|
"entropy": 5.5340875625610355,
|
|
"epoch": 1.1425403617973158,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.0004873350126830818,
|
|
"loss": 5.2765,
|
|
"mean_token_accuracy": 0.17524281591176988,
|
|
"num_tokens": 25474921.0,
|
|
"step": 14685
|
|
},
|
|
{
|
|
"entropy": 5.479874897003174,
|
|
"epoch": 1.1429293911690332,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.0004873258435688479,
|
|
"loss": 5.1833,
|
|
"mean_token_accuracy": 0.17880246192216873,
|
|
"num_tokens": 25483553.0,
|
|
"step": 14690
|
|
},
|
|
{
|
|
"entropy": 5.515859460830688,
|
|
"epoch": 1.143318420540751,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.0004873166712329073,
|
|
"loss": 5.2825,
|
|
"mean_token_accuracy": 0.17519325911998748,
|
|
"num_tokens": 25492408.0,
|
|
"step": 14695
|
|
},
|
|
{
|
|
"entropy": 5.4956684589385985,
|
|
"epoch": 1.1437074499124684,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.00048730749567539914,
|
|
"loss": 5.3005,
|
|
"mean_token_accuracy": 0.1683206781744957,
|
|
"num_tokens": 25501404.0,
|
|
"step": 14700
|
|
},
|
|
{
|
|
"entropy": 5.611879777908325,
|
|
"epoch": 1.144096479284186,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.00048729831689646257,
|
|
"loss": 5.2936,
|
|
"mean_token_accuracy": 0.16889838874340057,
|
|
"num_tokens": 25510176.0,
|
|
"step": 14705
|
|
},
|
|
{
|
|
"entropy": 5.487307929992676,
|
|
"epoch": 1.1444855086559036,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.00048728913489623705,
|
|
"loss": 5.2102,
|
|
"mean_token_accuracy": 0.1775286689400673,
|
|
"num_tokens": 25518809.0,
|
|
"step": 14710
|
|
},
|
|
{
|
|
"entropy": 5.484960317611694,
|
|
"epoch": 1.144874538027621,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.0004872799496748618,
|
|
"loss": 5.3154,
|
|
"mean_token_accuracy": 0.17022545337677003,
|
|
"num_tokens": 25527415.0,
|
|
"step": 14715
|
|
},
|
|
{
|
|
"entropy": 5.48862657546997,
|
|
"epoch": 1.1452635673993385,
|
|
"grad_norm": 1.5625,
|
|
"learning_rate": 0.0004872707612324761,
|
|
"loss": 5.245,
|
|
"mean_token_accuracy": 0.1742952361702919,
|
|
"num_tokens": 25535618.0,
|
|
"step": 14720
|
|
},
|
|
{
|
|
"entropy": 5.548863315582276,
|
|
"epoch": 1.1456525967710562,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 0.0004872615695692196,
|
|
"loss": 5.2524,
|
|
"mean_token_accuracy": 0.17555700838565827,
|
|
"num_tokens": 25544228.0,
|
|
"step": 14725
|
|
},
|
|
{
|
|
"entropy": 5.556531143188477,
|
|
"epoch": 1.1460416261427737,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.0004872523746852315,
|
|
"loss": 5.2981,
|
|
"mean_token_accuracy": 0.17266268730163575,
|
|
"num_tokens": 25553557.0,
|
|
"step": 14730
|
|
},
|
|
{
|
|
"entropy": 5.496634674072266,
|
|
"epoch": 1.1464306555144914,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.00048724317658065146,
|
|
"loss": 5.2571,
|
|
"mean_token_accuracy": 0.1716156467795372,
|
|
"num_tokens": 25562018.0,
|
|
"step": 14735
|
|
},
|
|
{
|
|
"entropy": 5.527238750457764,
|
|
"epoch": 1.146819684886209,
|
|
"grad_norm": 1.6171875,
|
|
"learning_rate": 0.00048723397525561916,
|
|
"loss": 5.2724,
|
|
"mean_token_accuracy": 0.18034477680921554,
|
|
"num_tokens": 25569382.0,
|
|
"step": 14740
|
|
},
|
|
{
|
|
"entropy": 5.406917524337769,
|
|
"epoch": 1.1472087142579266,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.00048722477071027394,
|
|
"loss": 5.2377,
|
|
"mean_token_accuracy": 0.17280066460371019,
|
|
"num_tokens": 25578172.0,
|
|
"step": 14745
|
|
},
|
|
{
|
|
"entropy": 5.453845977783203,
|
|
"epoch": 1.147597743629644,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.00048721556294475574,
|
|
"loss": 5.2862,
|
|
"mean_token_accuracy": 0.1699090212583542,
|
|
"num_tokens": 25587572.0,
|
|
"step": 14750
|
|
},
|
|
{
|
|
"entropy": 5.53148627281189,
|
|
"epoch": 1.1479867730013615,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.00048720635195920403,
|
|
"loss": 5.3199,
|
|
"mean_token_accuracy": 0.17257970720529556,
|
|
"num_tokens": 25596609.0,
|
|
"step": 14755
|
|
},
|
|
{
|
|
"entropy": 5.53697657585144,
|
|
"epoch": 1.1483758023730792,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.0004871971377537588,
|
|
"loss": 5.3306,
|
|
"mean_token_accuracy": 0.16578828990459443,
|
|
"num_tokens": 25605707.0,
|
|
"step": 14760
|
|
},
|
|
{
|
|
"entropy": 5.486789798736572,
|
|
"epoch": 1.1487648317447967,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.0004871879203285597,
|
|
"loss": 5.2704,
|
|
"mean_token_accuracy": 0.17287899404764176,
|
|
"num_tokens": 25614218.0,
|
|
"step": 14765
|
|
},
|
|
{
|
|
"entropy": 5.4688270568847654,
|
|
"epoch": 1.1491538611165142,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.00048717869968374655,
|
|
"loss": 5.197,
|
|
"mean_token_accuracy": 0.17571456283330916,
|
|
"num_tokens": 25622613.0,
|
|
"step": 14770
|
|
},
|
|
{
|
|
"entropy": 5.648395347595215,
|
|
"epoch": 1.1495428904882319,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.00048716947581945954,
|
|
"loss": 5.3596,
|
|
"mean_token_accuracy": 0.16967739313840866,
|
|
"num_tokens": 25631396.0,
|
|
"step": 14775
|
|
},
|
|
{
|
|
"entropy": 5.520706272125244,
|
|
"epoch": 1.1499319198599494,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0004871602487358383,
|
|
"loss": 5.2455,
|
|
"mean_token_accuracy": 0.17188442051410674,
|
|
"num_tokens": 25640870.0,
|
|
"step": 14780
|
|
},
|
|
{
|
|
"entropy": 5.474168586730957,
|
|
"epoch": 1.150320949231667,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.000487151018433023,
|
|
"loss": 5.3012,
|
|
"mean_token_accuracy": 0.16997490376234053,
|
|
"num_tokens": 25649395.0,
|
|
"step": 14785
|
|
},
|
|
{
|
|
"entropy": 5.545903253555298,
|
|
"epoch": 1.1507099786033845,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 0.00048714178491115367,
|
|
"loss": 5.429,
|
|
"mean_token_accuracy": 0.16178262531757354,
|
|
"num_tokens": 25659087.0,
|
|
"step": 14790
|
|
},
|
|
{
|
|
"entropy": 5.591632127761841,
|
|
"epoch": 1.1510990079751022,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.00048713254817037046,
|
|
"loss": 5.3282,
|
|
"mean_token_accuracy": 0.1745515376329422,
|
|
"num_tokens": 25667847.0,
|
|
"step": 14795
|
|
},
|
|
{
|
|
"entropy": 5.527452373504639,
|
|
"epoch": 1.1514880373468197,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.0004871233082108135,
|
|
"loss": 5.2784,
|
|
"mean_token_accuracy": 0.17815037965774536,
|
|
"num_tokens": 25676786.0,
|
|
"step": 14800
|
|
},
|
|
{
|
|
"entropy": 5.531932258605957,
|
|
"epoch": 1.1518770667185372,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 0.0004871140650326228,
|
|
"loss": 5.3214,
|
|
"mean_token_accuracy": 0.16794054657220842,
|
|
"num_tokens": 25685223.0,
|
|
"step": 14805
|
|
},
|
|
{
|
|
"entropy": 5.515975284576416,
|
|
"epoch": 1.1522660960902549,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0004871048186359389,
|
|
"loss": 5.2759,
|
|
"mean_token_accuracy": 0.17498894929885864,
|
|
"num_tokens": 25694243.0,
|
|
"step": 14810
|
|
},
|
|
{
|
|
"entropy": 5.5161628246307375,
|
|
"epoch": 1.1526551254619724,
|
|
"grad_norm": 1.5,
|
|
"learning_rate": 0.000487095569020902,
|
|
"loss": 5.1648,
|
|
"mean_token_accuracy": 0.17979977875947953,
|
|
"num_tokens": 25702735.0,
|
|
"step": 14815
|
|
},
|
|
{
|
|
"entropy": 5.452590417861939,
|
|
"epoch": 1.1530441548336898,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 0.0004870863161876524,
|
|
"loss": 5.2292,
|
|
"mean_token_accuracy": 0.1791177973151207,
|
|
"num_tokens": 25711577.0,
|
|
"step": 14820
|
|
},
|
|
{
|
|
"entropy": 5.470571660995484,
|
|
"epoch": 1.1534331842054075,
|
|
"grad_norm": 1.5390625,
|
|
"learning_rate": 0.0004870770601363305,
|
|
"loss": 5.1648,
|
|
"mean_token_accuracy": 0.18687797337770462,
|
|
"num_tokens": 25719927.0,
|
|
"step": 14825
|
|
},
|
|
{
|
|
"entropy": 5.481204175949097,
|
|
"epoch": 1.153822213577125,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.00048706780086707675,
|
|
"loss": 5.1957,
|
|
"mean_token_accuracy": 0.1778558611869812,
|
|
"num_tokens": 25728144.0,
|
|
"step": 14830
|
|
},
|
|
{
|
|
"entropy": 5.428620767593384,
|
|
"epoch": 1.1542112429488427,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.0004870585383800317,
|
|
"loss": 5.1908,
|
|
"mean_token_accuracy": 0.181229430437088,
|
|
"num_tokens": 25736736.0,
|
|
"step": 14835
|
|
},
|
|
{
|
|
"entropy": 5.534958553314209,
|
|
"epoch": 1.1546002723205602,
|
|
"grad_norm": 1.4921875,
|
|
"learning_rate": 0.00048704927267533585,
|
|
"loss": 5.3702,
|
|
"mean_token_accuracy": 0.17278939187526704,
|
|
"num_tokens": 25745031.0,
|
|
"step": 14840
|
|
},
|
|
{
|
|
"entropy": 5.607956981658935,
|
|
"epoch": 1.1549893016922779,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.00048704000375312975,
|
|
"loss": 5.3363,
|
|
"mean_token_accuracy": 0.1760665774345398,
|
|
"num_tokens": 25754265.0,
|
|
"step": 14845
|
|
},
|
|
{
|
|
"entropy": 5.612948560714722,
|
|
"epoch": 1.1553783310639953,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.00048703073161355414,
|
|
"loss": 5.349,
|
|
"mean_token_accuracy": 0.1639382630586624,
|
|
"num_tokens": 25763084.0,
|
|
"step": 14850
|
|
},
|
|
{
|
|
"entropy": 5.533888149261474,
|
|
"epoch": 1.1557673604357128,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.0004870214562567497,
|
|
"loss": 5.3302,
|
|
"mean_token_accuracy": 0.1670328602194786,
|
|
"num_tokens": 25771626.0,
|
|
"step": 14855
|
|
},
|
|
{
|
|
"entropy": 5.493502283096314,
|
|
"epoch": 1.1561563898074305,
|
|
"grad_norm": 1.6171875,
|
|
"learning_rate": 0.000487012177682857,
|
|
"loss": 5.2755,
|
|
"mean_token_accuracy": 0.17252386808395387,
|
|
"num_tokens": 25780326.0,
|
|
"step": 14860
|
|
},
|
|
{
|
|
"entropy": 5.594791650772095,
|
|
"epoch": 1.156545419179148,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0004870028958920171,
|
|
"loss": 5.402,
|
|
"mean_token_accuracy": 0.167504246532917,
|
|
"num_tokens": 25789318.0,
|
|
"step": 14865
|
|
},
|
|
{
|
|
"entropy": 5.564109945297242,
|
|
"epoch": 1.1569344485508655,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0004869936108843706,
|
|
"loss": 5.3484,
|
|
"mean_token_accuracy": 0.17456323206424712,
|
|
"num_tokens": 25798025.0,
|
|
"step": 14870
|
|
},
|
|
{
|
|
"entropy": 5.51595664024353,
|
|
"epoch": 1.1573234779225832,
|
|
"grad_norm": 1.6875,
|
|
"learning_rate": 0.00048698432266005854,
|
|
"loss": 5.2502,
|
|
"mean_token_accuracy": 0.17536690086126328,
|
|
"num_tokens": 25806669.0,
|
|
"step": 14875
|
|
},
|
|
{
|
|
"entropy": 5.527758026123047,
|
|
"epoch": 1.1577125072943006,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.0004869750312192217,
|
|
"loss": 5.2691,
|
|
"mean_token_accuracy": 0.17074106335639955,
|
|
"num_tokens": 25815938.0,
|
|
"step": 14880
|
|
},
|
|
{
|
|
"entropy": 5.489625597000122,
|
|
"epoch": 1.1581015366660183,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.00048696573656200123,
|
|
"loss": 5.2009,
|
|
"mean_token_accuracy": 0.17507342249155045,
|
|
"num_tokens": 25824293.0,
|
|
"step": 14885
|
|
},
|
|
{
|
|
"entropy": 5.508816957473755,
|
|
"epoch": 1.1584905660377358,
|
|
"grad_norm": 1.5703125,
|
|
"learning_rate": 0.00048695643868853806,
|
|
"loss": 5.3134,
|
|
"mean_token_accuracy": 0.1757759466767311,
|
|
"num_tokens": 25833081.0,
|
|
"step": 14890
|
|
},
|
|
{
|
|
"entropy": 5.550866889953613,
|
|
"epoch": 1.1588795954094535,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.0004869471375989733,
|
|
"loss": 5.3383,
|
|
"mean_token_accuracy": 0.17036498337984085,
|
|
"num_tokens": 25841344.0,
|
|
"step": 14895
|
|
},
|
|
{
|
|
"entropy": 5.535708093643189,
|
|
"epoch": 1.159268624781171,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.0004869378332934481,
|
|
"loss": 5.3306,
|
|
"mean_token_accuracy": 0.17351298928260803,
|
|
"num_tokens": 25850617.0,
|
|
"step": 14900
|
|
},
|
|
{
|
|
"entropy": 5.508704710006714,
|
|
"epoch": 1.1596576541528885,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.00048692852577210356,
|
|
"loss": 5.2869,
|
|
"mean_token_accuracy": 0.17655283957719803,
|
|
"num_tokens": 25858569.0,
|
|
"step": 14905
|
|
},
|
|
{
|
|
"entropy": 5.450353336334229,
|
|
"epoch": 1.1600466835246062,
|
|
"grad_norm": 1.5546875,
|
|
"learning_rate": 0.000486919215035081,
|
|
"loss": 5.2682,
|
|
"mean_token_accuracy": 0.1785864233970642,
|
|
"num_tokens": 25866892.0,
|
|
"step": 14910
|
|
},
|
|
{
|
|
"entropy": 5.533081769943237,
|
|
"epoch": 1.1604357128963236,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.0004869099010825217,
|
|
"loss": 5.3381,
|
|
"mean_token_accuracy": 0.1690782204270363,
|
|
"num_tokens": 25875661.0,
|
|
"step": 14915
|
|
},
|
|
{
|
|
"entropy": 5.424652624130249,
|
|
"epoch": 1.1608247422680413,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.00048690058391456684,
|
|
"loss": 5.156,
|
|
"mean_token_accuracy": 0.18416557610034942,
|
|
"num_tokens": 25884951.0,
|
|
"step": 14920
|
|
},
|
|
{
|
|
"entropy": 5.580033445358277,
|
|
"epoch": 1.1612137716397588,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.0004868912635313579,
|
|
"loss": 5.3957,
|
|
"mean_token_accuracy": 0.16869698762893676,
|
|
"num_tokens": 25893652.0,
|
|
"step": 14925
|
|
},
|
|
{
|
|
"entropy": 5.557562160491943,
|
|
"epoch": 1.1616028010114763,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.0004868819399330364,
|
|
"loss": 5.236,
|
|
"mean_token_accuracy": 0.17636475712060928,
|
|
"num_tokens": 25902375.0,
|
|
"step": 14930
|
|
},
|
|
{
|
|
"entropy": 5.529547643661499,
|
|
"epoch": 1.161991830383194,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0004868726131197436,
|
|
"loss": 5.2235,
|
|
"mean_token_accuracy": 0.18093867897987365,
|
|
"num_tokens": 25911322.0,
|
|
"step": 14935
|
|
},
|
|
{
|
|
"entropy": 5.528238582611084,
|
|
"epoch": 1.1623808597549115,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0004868632830916212,
|
|
"loss": 5.3131,
|
|
"mean_token_accuracy": 0.17147083729505538,
|
|
"num_tokens": 25920444.0,
|
|
"step": 14940
|
|
},
|
|
{
|
|
"entropy": 5.53430061340332,
|
|
"epoch": 1.1627698891266292,
|
|
"grad_norm": 1.5546875,
|
|
"learning_rate": 0.0004868539498488106,
|
|
"loss": 5.319,
|
|
"mean_token_accuracy": 0.17443039417266845,
|
|
"num_tokens": 25928986.0,
|
|
"step": 14945
|
|
},
|
|
{
|
|
"entropy": 5.552328777313233,
|
|
"epoch": 1.1631589184983466,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 0.0004868446133914536,
|
|
"loss": 5.321,
|
|
"mean_token_accuracy": 0.16807695776224135,
|
|
"num_tokens": 25938209.0,
|
|
"step": 14950
|
|
},
|
|
{
|
|
"entropy": 5.595097446441651,
|
|
"epoch": 1.163547947870064,
|
|
"grad_norm": 1.546875,
|
|
"learning_rate": 0.00048683527371969185,
|
|
"loss": 5.347,
|
|
"mean_token_accuracy": 0.16814862340688705,
|
|
"num_tokens": 25946909.0,
|
|
"step": 14955
|
|
},
|
|
{
|
|
"entropy": 5.547474098205567,
|
|
"epoch": 1.1639369772417818,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.00048682593083366685,
|
|
"loss": 5.3748,
|
|
"mean_token_accuracy": 0.17345093190670013,
|
|
"num_tokens": 25956154.0,
|
|
"step": 14960
|
|
},
|
|
{
|
|
"entropy": 5.48573055267334,
|
|
"epoch": 1.1643260066134993,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.00048681658473352055,
|
|
"loss": 5.26,
|
|
"mean_token_accuracy": 0.17706416100263594,
|
|
"num_tokens": 25964478.0,
|
|
"step": 14965
|
|
},
|
|
{
|
|
"entropy": 5.484834337234497,
|
|
"epoch": 1.164715035985217,
|
|
"grad_norm": 1.5234375,
|
|
"learning_rate": 0.0004868072354193947,
|
|
"loss": 5.2666,
|
|
"mean_token_accuracy": 0.17319488227367402,
|
|
"num_tokens": 25973162.0,
|
|
"step": 14970
|
|
},
|
|
{
|
|
"entropy": 5.539928007125854,
|
|
"epoch": 1.1651040653569344,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.0004867978828914312,
|
|
"loss": 5.2377,
|
|
"mean_token_accuracy": 0.1758410304784775,
|
|
"num_tokens": 25982790.0,
|
|
"step": 14975
|
|
},
|
|
{
|
|
"entropy": 5.506482267379761,
|
|
"epoch": 1.165493094728652,
|
|
"grad_norm": 1.8046875,
|
|
"learning_rate": 0.0004867885271497719,
|
|
"loss": 5.17,
|
|
"mean_token_accuracy": 0.17919344305992127,
|
|
"num_tokens": 25992111.0,
|
|
"step": 14980
|
|
},
|
|
{
|
|
"entropy": 5.541373586654663,
|
|
"epoch": 1.1658821241003696,
|
|
"grad_norm": 1.5078125,
|
|
"learning_rate": 0.0004867791681945588,
|
|
"loss": 5.3173,
|
|
"mean_token_accuracy": 0.16922234147787094,
|
|
"num_tokens": 26000803.0,
|
|
"step": 14985
|
|
},
|
|
{
|
|
"entropy": 5.555414295196533,
|
|
"epoch": 1.166271153472087,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.00048676980602593395,
|
|
"loss": 5.4362,
|
|
"mean_token_accuracy": 0.1632263496518135,
|
|
"num_tokens": 26010152.0,
|
|
"step": 14990
|
|
},
|
|
{
|
|
"entropy": 5.571560096740723,
|
|
"epoch": 1.1666601828438048,
|
|
"grad_norm": 1.734375,
|
|
"learning_rate": 0.00048676044064403936,
|
|
"loss": 5.3137,
|
|
"mean_token_accuracy": 0.1627359539270401,
|
|
"num_tokens": 26019183.0,
|
|
"step": 14995
|
|
},
|
|
{
|
|
"entropy": 5.549491500854492,
|
|
"epoch": 1.1670492122155223,
|
|
"grad_norm": 1.6015625,
|
|
"learning_rate": 0.0004867510720490171,
|
|
"loss": 5.253,
|
|
"mean_token_accuracy": 0.17882109433412552,
|
|
"num_tokens": 26027459.0,
|
|
"step": 15000
|
|
},
|
|
{
|
|
"epoch": 1.1670492122155223,
|
|
"eval_entropy": 5.343993307651523,
|
|
"eval_loss": 5.385531902313232,
|
|
"eval_mean_token_accuracy": 0.17835605981848468,
|
|
"eval_num_tokens": 26027459.0,
|
|
"eval_runtime": 28.4605,
|
|
"eval_samples_per_second": 1460.199,
|
|
"eval_steps_per_second": 182.534,
|
|
"step": 15000
|
|
},
|
|
{
|
|
"entropy": 5.505486154556275,
|
|
"epoch": 1.1674382415872397,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 0.0004867417002410094,
|
|
"loss": 5.3225,
|
|
"mean_token_accuracy": 0.17250902950763702,
|
|
"num_tokens": 26036421.0,
|
|
"step": 15005
|
|
},
|
|
{
|
|
"entropy": 5.508649921417236,
|
|
"epoch": 1.1678272709589574,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.00048673232522015845,
|
|
"loss": 5.3073,
|
|
"mean_token_accuracy": 0.17687088400125503,
|
|
"num_tokens": 26044971.0,
|
|
"step": 15010
|
|
},
|
|
{
|
|
"entropy": 5.499291133880615,
|
|
"epoch": 1.168216300330675,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.0004867229469866064,
|
|
"loss": 5.2597,
|
|
"mean_token_accuracy": 0.17006338387727737,
|
|
"num_tokens": 26053597.0,
|
|
"step": 15015
|
|
},
|
|
{
|
|
"entropy": 5.5724945068359375,
|
|
"epoch": 1.1686053297023926,
|
|
"grad_norm": 1.5703125,
|
|
"learning_rate": 0.0004867135655404956,
|
|
"loss": 5.3237,
|
|
"mean_token_accuracy": 0.17078772634267808,
|
|
"num_tokens": 26061928.0,
|
|
"step": 15020
|
|
},
|
|
{
|
|
"entropy": 5.517803907394409,
|
|
"epoch": 1.16899435907411,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 0.00048670418088196844,
|
|
"loss": 5.261,
|
|
"mean_token_accuracy": 0.17745352536439896,
|
|
"num_tokens": 26070917.0,
|
|
"step": 15025
|
|
},
|
|
{
|
|
"entropy": 5.454018068313599,
|
|
"epoch": 1.1693833884458276,
|
|
"grad_norm": 1.5625,
|
|
"learning_rate": 0.0004866947930111674,
|
|
"loss": 5.1855,
|
|
"mean_token_accuracy": 0.18048908710479736,
|
|
"num_tokens": 26079556.0,
|
|
"step": 15030
|
|
},
|
|
{
|
|
"entropy": 5.491762113571167,
|
|
"epoch": 1.1697724178175453,
|
|
"grad_norm": 1.71875,
|
|
"learning_rate": 0.00048668540192823467,
|
|
"loss": 5.319,
|
|
"mean_token_accuracy": 0.17351290732622146,
|
|
"num_tokens": 26087963.0,
|
|
"step": 15035
|
|
},
|
|
{
|
|
"entropy": 5.508210229873657,
|
|
"epoch": 1.1701614471892627,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.000486676007633313,
|
|
"loss": 5.239,
|
|
"mean_token_accuracy": 0.17787270694971086,
|
|
"num_tokens": 26096208.0,
|
|
"step": 15040
|
|
},
|
|
{
|
|
"entropy": 5.504089784622193,
|
|
"epoch": 1.1705504765609804,
|
|
"grad_norm": 1.53125,
|
|
"learning_rate": 0.0004866666101265448,
|
|
"loss": 5.2531,
|
|
"mean_token_accuracy": 0.17728083282709123,
|
|
"num_tokens": 26104961.0,
|
|
"step": 15045
|
|
},
|
|
{
|
|
"entropy": 5.5123138427734375,
|
|
"epoch": 1.170939505932698,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.00048665720940807274,
|
|
"loss": 5.2872,
|
|
"mean_token_accuracy": 0.17374863773584365,
|
|
"num_tokens": 26113889.0,
|
|
"step": 15050
|
|
},
|
|
{
|
|
"entropy": 5.47006049156189,
|
|
"epoch": 1.1713285353044154,
|
|
"grad_norm": 1.5,
|
|
"learning_rate": 0.00048664780547803935,
|
|
"loss": 5.2429,
|
|
"mean_token_accuracy": 0.17934939712285997,
|
|
"num_tokens": 26122139.0,
|
|
"step": 15055
|
|
},
|
|
{
|
|
"entropy": 5.570874643325806,
|
|
"epoch": 1.171717564676133,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.0004866383983365873,
|
|
"loss": 5.2883,
|
|
"mean_token_accuracy": 0.18369991928339005,
|
|
"num_tokens": 26130817.0,
|
|
"step": 15060
|
|
},
|
|
{
|
|
"entropy": 5.529329299926758,
|
|
"epoch": 1.1721065940478506,
|
|
"grad_norm": 1.5234375,
|
|
"learning_rate": 0.00048662898798385956,
|
|
"loss": 5.2945,
|
|
"mean_token_accuracy": 0.17200957238674164,
|
|
"num_tokens": 26140035.0,
|
|
"step": 15065
|
|
},
|
|
{
|
|
"entropy": 5.568940782546997,
|
|
"epoch": 1.1724956234195683,
|
|
"grad_norm": 1.5703125,
|
|
"learning_rate": 0.00048661957441999875,
|
|
"loss": 5.3693,
|
|
"mean_token_accuracy": 0.17299638837575912,
|
|
"num_tokens": 26149575.0,
|
|
"step": 15070
|
|
},
|
|
{
|
|
"entropy": 5.549425220489502,
|
|
"epoch": 1.1728846527912857,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.00048661015764514765,
|
|
"loss": 5.3,
|
|
"mean_token_accuracy": 0.17698389291763306,
|
|
"num_tokens": 26158743.0,
|
|
"step": 15075
|
|
},
|
|
{
|
|
"entropy": 5.512171936035156,
|
|
"epoch": 1.1732736821630034,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.00048660073765944927,
|
|
"loss": 5.2965,
|
|
"mean_token_accuracy": 0.17440622597932814,
|
|
"num_tokens": 26167380.0,
|
|
"step": 15080
|
|
},
|
|
{
|
|
"entropy": 5.432060766220093,
|
|
"epoch": 1.173662711534721,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.0004865913144630465,
|
|
"loss": 5.2284,
|
|
"mean_token_accuracy": 0.17474821209907532,
|
|
"num_tokens": 26175613.0,
|
|
"step": 15085
|
|
},
|
|
{
|
|
"entropy": 5.5436242580413815,
|
|
"epoch": 1.1740517409064384,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.00048658188805608227,
|
|
"loss": 5.3448,
|
|
"mean_token_accuracy": 0.17022832483053207,
|
|
"num_tokens": 26184347.0,
|
|
"step": 15090
|
|
},
|
|
{
|
|
"entropy": 5.49397382736206,
|
|
"epoch": 1.174440770278156,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.0004865724584386998,
|
|
"loss": 5.3047,
|
|
"mean_token_accuracy": 0.17209259569644927,
|
|
"num_tokens": 26193513.0,
|
|
"step": 15095
|
|
},
|
|
{
|
|
"entropy": 5.545153188705444,
|
|
"epoch": 1.1748297996498736,
|
|
"grad_norm": 1.6015625,
|
|
"learning_rate": 0.0004865630256110418,
|
|
"loss": 5.2763,
|
|
"mean_token_accuracy": 0.16896928250789642,
|
|
"num_tokens": 26202790.0,
|
|
"step": 15100
|
|
},
|
|
{
|
|
"entropy": 5.495885372161865,
|
|
"epoch": 1.175218829021591,
|
|
"grad_norm": 1.546875,
|
|
"learning_rate": 0.00048655358957325174,
|
|
"loss": 5.2316,
|
|
"mean_token_accuracy": 0.17473772317171096,
|
|
"num_tokens": 26211032.0,
|
|
"step": 15105
|
|
},
|
|
{
|
|
"entropy": 5.428192234039306,
|
|
"epoch": 1.1756078583933087,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.00048654415032547277,
|
|
"loss": 5.1797,
|
|
"mean_token_accuracy": 0.17604877501726152,
|
|
"num_tokens": 26219963.0,
|
|
"step": 15110
|
|
},
|
|
{
|
|
"entropy": 5.550877809524536,
|
|
"epoch": 1.1759968877650262,
|
|
"grad_norm": 1.5703125,
|
|
"learning_rate": 0.00048653470786784794,
|
|
"loss": 5.2433,
|
|
"mean_token_accuracy": 0.17054082304239274,
|
|
"num_tokens": 26228164.0,
|
|
"step": 15115
|
|
},
|
|
{
|
|
"entropy": 5.501662302017212,
|
|
"epoch": 1.176385917136744,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.0004865252622005206,
|
|
"loss": 5.2454,
|
|
"mean_token_accuracy": 0.1808508187532425,
|
|
"num_tokens": 26236294.0,
|
|
"step": 15120
|
|
},
|
|
{
|
|
"entropy": 5.416070222854614,
|
|
"epoch": 1.1767749465084614,
|
|
"grad_norm": 1.53125,
|
|
"learning_rate": 0.00048651581332363405,
|
|
"loss": 5.2087,
|
|
"mean_token_accuracy": 0.17768478989601136,
|
|
"num_tokens": 26244955.0,
|
|
"step": 15125
|
|
},
|
|
{
|
|
"entropy": 5.523351240158081,
|
|
"epoch": 1.177163975880179,
|
|
"grad_norm": 1.5078125,
|
|
"learning_rate": 0.00048650636123733176,
|
|
"loss": 5.3077,
|
|
"mean_token_accuracy": 0.17069950699806213,
|
|
"num_tokens": 26253221.0,
|
|
"step": 15130
|
|
},
|
|
{
|
|
"entropy": 5.560183048248291,
|
|
"epoch": 1.1775530052518965,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0004864969059417571,
|
|
"loss": 5.3806,
|
|
"mean_token_accuracy": 0.1650077536702156,
|
|
"num_tokens": 26262544.0,
|
|
"step": 15135
|
|
},
|
|
{
|
|
"entropy": 5.55550627708435,
|
|
"epoch": 1.177942034623614,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.0004864874474370534,
|
|
"loss": 5.2679,
|
|
"mean_token_accuracy": 0.17493995726108552,
|
|
"num_tokens": 26271864.0,
|
|
"step": 15140
|
|
},
|
|
{
|
|
"entropy": 5.543304347991944,
|
|
"epoch": 1.1783310639953317,
|
|
"grad_norm": 1.5234375,
|
|
"learning_rate": 0.00048647798572336445,
|
|
"loss": 5.3098,
|
|
"mean_token_accuracy": 0.17515021115541457,
|
|
"num_tokens": 26279713.0,
|
|
"step": 15145
|
|
},
|
|
{
|
|
"entropy": 5.475018787384033,
|
|
"epoch": 1.1787200933670492,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.00048646852080083355,
|
|
"loss": 5.1448,
|
|
"mean_token_accuracy": 0.18069939464330673,
|
|
"num_tokens": 26288654.0,
|
|
"step": 15150
|
|
},
|
|
{
|
|
"entropy": 5.482875013351441,
|
|
"epoch": 1.1791091227387667,
|
|
"grad_norm": 1.640625,
|
|
"learning_rate": 0.0004864590526696045,
|
|
"loss": 5.3347,
|
|
"mean_token_accuracy": 0.16853394359350204,
|
|
"num_tokens": 26297007.0,
|
|
"step": 15155
|
|
},
|
|
{
|
|
"entropy": 5.487427234649658,
|
|
"epoch": 1.1794981521104844,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.00048644958132982094,
|
|
"loss": 5.2558,
|
|
"mean_token_accuracy": 0.1802915945649147,
|
|
"num_tokens": 26305601.0,
|
|
"step": 15160
|
|
},
|
|
{
|
|
"entropy": 5.51662049293518,
|
|
"epoch": 1.1798871814822018,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 0.00048644010678162644,
|
|
"loss": 5.285,
|
|
"mean_token_accuracy": 0.18299965113401412,
|
|
"num_tokens": 26313455.0,
|
|
"step": 15165
|
|
},
|
|
{
|
|
"entropy": 5.509361934661865,
|
|
"epoch": 1.1802762108539195,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0004864306290251649,
|
|
"loss": 5.3318,
|
|
"mean_token_accuracy": 0.172724649310112,
|
|
"num_tokens": 26322450.0,
|
|
"step": 15170
|
|
},
|
|
{
|
|
"entropy": 5.550538444519043,
|
|
"epoch": 1.180665240225637,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.00048642114806058014,
|
|
"loss": 5.3165,
|
|
"mean_token_accuracy": 0.16448683887720109,
|
|
"num_tokens": 26331301.0,
|
|
"step": 15175
|
|
},
|
|
{
|
|
"entropy": 5.6680913925170895,
|
|
"epoch": 1.1810542695973547,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.0004864116638880159,
|
|
"loss": 5.4072,
|
|
"mean_token_accuracy": 0.17031198740005493,
|
|
"num_tokens": 26339937.0,
|
|
"step": 15180
|
|
},
|
|
{
|
|
"entropy": 5.570975589752197,
|
|
"epoch": 1.1814432989690722,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.0004864021765076162,
|
|
"loss": 5.2674,
|
|
"mean_token_accuracy": 0.1754144087433815,
|
|
"num_tokens": 26348541.0,
|
|
"step": 15185
|
|
},
|
|
{
|
|
"entropy": 5.40344500541687,
|
|
"epoch": 1.1818323283407897,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.00048639268591952494,
|
|
"loss": 5.2174,
|
|
"mean_token_accuracy": 0.17627357095479965,
|
|
"num_tokens": 26356621.0,
|
|
"step": 15190
|
|
},
|
|
{
|
|
"entropy": 5.52975640296936,
|
|
"epoch": 1.1822213577125074,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.00048638319212388614,
|
|
"loss": 5.3279,
|
|
"mean_token_accuracy": 0.17215086221694947,
|
|
"num_tokens": 26366112.0,
|
|
"step": 15195
|
|
},
|
|
{
|
|
"entropy": 5.581024980545044,
|
|
"epoch": 1.1826103870842248,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0004863736951208438,
|
|
"loss": 5.3225,
|
|
"mean_token_accuracy": 0.17638045847415923,
|
|
"num_tokens": 26374768.0,
|
|
"step": 15200
|
|
},
|
|
{
|
|
"entropy": 5.550275993347168,
|
|
"epoch": 1.1829994164559423,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.00048636419491054217,
|
|
"loss": 5.2941,
|
|
"mean_token_accuracy": 0.17490982711315156,
|
|
"num_tokens": 26383097.0,
|
|
"step": 15205
|
|
},
|
|
{
|
|
"entropy": 5.5006516456604,
|
|
"epoch": 1.18338844582766,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.0004863546914931252,
|
|
"loss": 5.2702,
|
|
"mean_token_accuracy": 0.1742387518286705,
|
|
"num_tokens": 26391361.0,
|
|
"step": 15210
|
|
},
|
|
{
|
|
"entropy": 5.521454906463623,
|
|
"epoch": 1.1837774751993775,
|
|
"grad_norm": 1.515625,
|
|
"learning_rate": 0.0004863451848687373,
|
|
"loss": 5.2238,
|
|
"mean_token_accuracy": 0.18027711510658265,
|
|
"num_tokens": 26400818.0,
|
|
"step": 15215
|
|
},
|
|
{
|
|
"entropy": 5.531339359283447,
|
|
"epoch": 1.1841665045710952,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.00048633567503752253,
|
|
"loss": 5.2781,
|
|
"mean_token_accuracy": 0.1759803846478462,
|
|
"num_tokens": 26409650.0,
|
|
"step": 15220
|
|
},
|
|
{
|
|
"entropy": 5.449646615982056,
|
|
"epoch": 1.1845555339428127,
|
|
"grad_norm": 1.59375,
|
|
"learning_rate": 0.0004863261619996253,
|
|
"loss": 5.1846,
|
|
"mean_token_accuracy": 0.1811449259519577,
|
|
"num_tokens": 26418237.0,
|
|
"step": 15225
|
|
},
|
|
{
|
|
"entropy": 5.4022862911224365,
|
|
"epoch": 1.1849445633145304,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0004863166457551899,
|
|
"loss": 5.1252,
|
|
"mean_token_accuracy": 0.19037967175245285,
|
|
"num_tokens": 26426366.0,
|
|
"step": 15230
|
|
},
|
|
{
|
|
"entropy": 5.374770402908325,
|
|
"epoch": 1.1853335926862478,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0004863071263043608,
|
|
"loss": 5.2241,
|
|
"mean_token_accuracy": 0.1722566530108452,
|
|
"num_tokens": 26435603.0,
|
|
"step": 15235
|
|
},
|
|
{
|
|
"entropy": 5.529952478408814,
|
|
"epoch": 1.1857226220579653,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.0004862976036472823,
|
|
"loss": 5.3581,
|
|
"mean_token_accuracy": 0.1680940419435501,
|
|
"num_tokens": 26444230.0,
|
|
"step": 15240
|
|
},
|
|
{
|
|
"entropy": 5.517985773086548,
|
|
"epoch": 1.186111651429683,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.00048628807778409907,
|
|
"loss": 5.2194,
|
|
"mean_token_accuracy": 0.17059637010097503,
|
|
"num_tokens": 26452779.0,
|
|
"step": 15245
|
|
},
|
|
{
|
|
"entropy": 5.499024677276611,
|
|
"epoch": 1.1865006808014005,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0004862785487149555,
|
|
"loss": 5.3557,
|
|
"mean_token_accuracy": 0.1689263641834259,
|
|
"num_tokens": 26461977.0,
|
|
"step": 15250
|
|
},
|
|
{
|
|
"entropy": 5.505593967437744,
|
|
"epoch": 1.186889710173118,
|
|
"grad_norm": 1.6328125,
|
|
"learning_rate": 0.0004862690164399963,
|
|
"loss": 5.1614,
|
|
"mean_token_accuracy": 0.17805588394403457,
|
|
"num_tokens": 26470182.0,
|
|
"step": 15255
|
|
},
|
|
{
|
|
"entropy": 5.526981163024902,
|
|
"epoch": 1.1872787395448356,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.00048625948095936593,
|
|
"loss": 5.3788,
|
|
"mean_token_accuracy": 0.16746178418397903,
|
|
"num_tokens": 26479445.0,
|
|
"step": 15260
|
|
},
|
|
{
|
|
"entropy": 5.500918674468994,
|
|
"epoch": 1.1876677689165531,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.00048624994227320923,
|
|
"loss": 5.2275,
|
|
"mean_token_accuracy": 0.17573239505290986,
|
|
"num_tokens": 26488085.0,
|
|
"step": 15265
|
|
},
|
|
{
|
|
"entropy": 5.640781307220459,
|
|
"epoch": 1.1880567982882708,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.00048624040038167094,
|
|
"loss": 5.3946,
|
|
"mean_token_accuracy": 0.1723005637526512,
|
|
"num_tokens": 26496849.0,
|
|
"step": 15270
|
|
},
|
|
{
|
|
"entropy": 5.491225814819336,
|
|
"epoch": 1.1884458276599883,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.00048623085528489584,
|
|
"loss": 5.2667,
|
|
"mean_token_accuracy": 0.17982023060321808,
|
|
"num_tokens": 26505412.0,
|
|
"step": 15275
|
|
},
|
|
{
|
|
"entropy": 5.443025255203247,
|
|
"epoch": 1.188834857031706,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.00048622130698302863,
|
|
"loss": 5.2326,
|
|
"mean_token_accuracy": 0.17415424883365632,
|
|
"num_tokens": 26513564.0,
|
|
"step": 15280
|
|
},
|
|
{
|
|
"entropy": 5.436628818511963,
|
|
"epoch": 1.1892238864034235,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.00048621175547621426,
|
|
"loss": 5.2306,
|
|
"mean_token_accuracy": 0.17475161105394363,
|
|
"num_tokens": 26522230.0,
|
|
"step": 15285
|
|
},
|
|
{
|
|
"entropy": 5.458022022247315,
|
|
"epoch": 1.189612915775141,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0004862022007645978,
|
|
"loss": 5.2401,
|
|
"mean_token_accuracy": 0.1740517407655716,
|
|
"num_tokens": 26531719.0,
|
|
"step": 15290
|
|
},
|
|
{
|
|
"entropy": 5.46057825088501,
|
|
"epoch": 1.1900019451468586,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00048619264284832403,
|
|
"loss": 5.1967,
|
|
"mean_token_accuracy": 0.1912194475531578,
|
|
"num_tokens": 26540352.0,
|
|
"step": 15295
|
|
},
|
|
{
|
|
"entropy": 5.540399408340454,
|
|
"epoch": 1.1903909745185761,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.00048618308172753804,
|
|
"loss": 5.1781,
|
|
"mean_token_accuracy": 0.18599122613668442,
|
|
"num_tokens": 26548252.0,
|
|
"step": 15300
|
|
},
|
|
{
|
|
"entropy": 5.54229965209961,
|
|
"epoch": 1.1907800038902936,
|
|
"grad_norm": 1.59375,
|
|
"learning_rate": 0.0004861735174023849,
|
|
"loss": 5.2762,
|
|
"mean_token_accuracy": 0.17638776004314421,
|
|
"num_tokens": 26557267.0,
|
|
"step": 15305
|
|
},
|
|
{
|
|
"entropy": 5.5406331539154055,
|
|
"epoch": 1.1911690332620113,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.00048616394987300985,
|
|
"loss": 5.3679,
|
|
"mean_token_accuracy": 0.1719802737236023,
|
|
"num_tokens": 26566221.0,
|
|
"step": 15310
|
|
},
|
|
{
|
|
"entropy": 5.497641372680664,
|
|
"epoch": 1.1915580626337288,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.0004861543791395579,
|
|
"loss": 5.3777,
|
|
"mean_token_accuracy": 0.1763498917222023,
|
|
"num_tokens": 26574826.0,
|
|
"step": 15315
|
|
},
|
|
{
|
|
"entropy": 5.527216863632202,
|
|
"epoch": 1.1919470920054465,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.0004861448052021743,
|
|
"loss": 5.3389,
|
|
"mean_token_accuracy": 0.1643924131989479,
|
|
"num_tokens": 26583442.0,
|
|
"step": 15320
|
|
},
|
|
{
|
|
"entropy": 5.575404262542724,
|
|
"epoch": 1.192336121377164,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.0004861352280610044,
|
|
"loss": 5.3027,
|
|
"mean_token_accuracy": 0.17529321759939193,
|
|
"num_tokens": 26592106.0,
|
|
"step": 15325
|
|
},
|
|
{
|
|
"entropy": 5.479348087310791,
|
|
"epoch": 1.1927251507488816,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.00048612564771619346,
|
|
"loss": 5.161,
|
|
"mean_token_accuracy": 0.17972079962491988,
|
|
"num_tokens": 26601275.0,
|
|
"step": 15330
|
|
},
|
|
{
|
|
"entropy": 5.399018144607544,
|
|
"epoch": 1.193114180120599,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00048611606416788686,
|
|
"loss": 5.1236,
|
|
"mean_token_accuracy": 0.1844784289598465,
|
|
"num_tokens": 26610179.0,
|
|
"step": 15335
|
|
},
|
|
{
|
|
"entropy": 5.481526327133179,
|
|
"epoch": 1.1935032094923166,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.00048610647741622996,
|
|
"loss": 5.3131,
|
|
"mean_token_accuracy": 0.17379384785890578,
|
|
"num_tokens": 26619463.0,
|
|
"step": 15340
|
|
},
|
|
{
|
|
"entropy": 5.472293472290039,
|
|
"epoch": 1.1938922388640343,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 0.0004860968874613683,
|
|
"loss": 5.1402,
|
|
"mean_token_accuracy": 0.18848013132810593,
|
|
"num_tokens": 26627597.0,
|
|
"step": 15345
|
|
},
|
|
{
|
|
"entropy": 5.47904896736145,
|
|
"epoch": 1.1942812682357518,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0004860872943034474,
|
|
"loss": 5.2556,
|
|
"mean_token_accuracy": 0.18038507848978041,
|
|
"num_tokens": 26636180.0,
|
|
"step": 15350
|
|
},
|
|
{
|
|
"entropy": 5.434398937225342,
|
|
"epoch": 1.1946702976074695,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.0004860776979426128,
|
|
"loss": 5.1752,
|
|
"mean_token_accuracy": 0.1820618912577629,
|
|
"num_tokens": 26644803.0,
|
|
"step": 15355
|
|
},
|
|
{
|
|
"entropy": 5.416516971588135,
|
|
"epoch": 1.195059326979187,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.0004860680983790101,
|
|
"loss": 5.2214,
|
|
"mean_token_accuracy": 0.1702832743525505,
|
|
"num_tokens": 26653619.0,
|
|
"step": 15360
|
|
},
|
|
{
|
|
"entropy": 5.506034660339355,
|
|
"epoch": 1.1954483563509044,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0004860584956127849,
|
|
"loss": 5.2399,
|
|
"mean_token_accuracy": 0.16921795904636383,
|
|
"num_tokens": 26662291.0,
|
|
"step": 15365
|
|
},
|
|
{
|
|
"entropy": 5.491010427474976,
|
|
"epoch": 1.195837385722622,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.00048604888964408306,
|
|
"loss": 5.1986,
|
|
"mean_token_accuracy": 0.18535471260547637,
|
|
"num_tokens": 26670592.0,
|
|
"step": 15370
|
|
},
|
|
{
|
|
"entropy": 5.4652605056762695,
|
|
"epoch": 1.1962264150943396,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 0.0004860392804730502,
|
|
"loss": 5.2734,
|
|
"mean_token_accuracy": 0.17707352191209794,
|
|
"num_tokens": 26679816.0,
|
|
"step": 15375
|
|
},
|
|
{
|
|
"entropy": 5.518105840682983,
|
|
"epoch": 1.1966154444660573,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.00048602966809983204,
|
|
"loss": 5.2393,
|
|
"mean_token_accuracy": 0.182095468044281,
|
|
"num_tokens": 26688185.0,
|
|
"step": 15380
|
|
},
|
|
{
|
|
"entropy": 5.514083290100098,
|
|
"epoch": 1.1970044738377748,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.0004860200525245746,
|
|
"loss": 5.3066,
|
|
"mean_token_accuracy": 0.1808842182159424,
|
|
"num_tokens": 26697157.0,
|
|
"step": 15385
|
|
},
|
|
{
|
|
"entropy": 5.4472421169281,
|
|
"epoch": 1.1973935032094922,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.0004860104337474239,
|
|
"loss": 5.248,
|
|
"mean_token_accuracy": 0.16783505380153657,
|
|
"num_tokens": 26705868.0,
|
|
"step": 15390
|
|
},
|
|
{
|
|
"entropy": 5.543714904785157,
|
|
"epoch": 1.19778253258121,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.00048600081176852555,
|
|
"loss": 5.3134,
|
|
"mean_token_accuracy": 0.17632490396499634,
|
|
"num_tokens": 26714364.0,
|
|
"step": 15395
|
|
},
|
|
{
|
|
"entropy": 5.525758981704712,
|
|
"epoch": 1.1981715619529274,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.00048599118658802575,
|
|
"loss": 5.2808,
|
|
"mean_token_accuracy": 0.17054822593927382,
|
|
"num_tokens": 26722866.0,
|
|
"step": 15400
|
|
},
|
|
{
|
|
"entropy": 5.542753410339356,
|
|
"epoch": 1.198560591324645,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.0004859815582060706,
|
|
"loss": 5.2112,
|
|
"mean_token_accuracy": 0.17796418964862823,
|
|
"num_tokens": 26731305.0,
|
|
"step": 15405
|
|
},
|
|
{
|
|
"entropy": 5.525659894943237,
|
|
"epoch": 1.1989496206963626,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.0004859719266228061,
|
|
"loss": 5.2612,
|
|
"mean_token_accuracy": 0.17567186504602433,
|
|
"num_tokens": 26740807.0,
|
|
"step": 15410
|
|
},
|
|
{
|
|
"entropy": 5.483808898925782,
|
|
"epoch": 1.19933865006808,
|
|
"grad_norm": 1.6640625,
|
|
"learning_rate": 0.0004859622918383784,
|
|
"loss": 5.2398,
|
|
"mean_token_accuracy": 0.17919955551624298,
|
|
"num_tokens": 26749748.0,
|
|
"step": 15415
|
|
},
|
|
{
|
|
"entropy": 5.537015390396118,
|
|
"epoch": 1.1997276794397977,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0004859526538529337,
|
|
"loss": 5.2994,
|
|
"mean_token_accuracy": 0.17403259873390198,
|
|
"num_tokens": 26758597.0,
|
|
"step": 15420
|
|
},
|
|
{
|
|
"entropy": 5.506263399124146,
|
|
"epoch": 1.2001167088115152,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.0004859430126666182,
|
|
"loss": 5.335,
|
|
"mean_token_accuracy": 0.17321491688489915,
|
|
"num_tokens": 26766772.0,
|
|
"step": 15425
|
|
},
|
|
{
|
|
"entropy": 5.3521260738372805,
|
|
"epoch": 1.200505738183233,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.00048593336827957824,
|
|
"loss": 5.0842,
|
|
"mean_token_accuracy": 0.19030144065618515,
|
|
"num_tokens": 26775229.0,
|
|
"step": 15430
|
|
},
|
|
{
|
|
"entropy": 5.404987955093384,
|
|
"epoch": 1.2008947675549504,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.00048592372069196024,
|
|
"loss": 5.2477,
|
|
"mean_token_accuracy": 0.17235234379768372,
|
|
"num_tokens": 26784188.0,
|
|
"step": 15435
|
|
},
|
|
{
|
|
"entropy": 5.39737639427185,
|
|
"epoch": 1.2012837969266679,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.0004859140699039104,
|
|
"loss": 5.1683,
|
|
"mean_token_accuracy": 0.18072133809328078,
|
|
"num_tokens": 26792687.0,
|
|
"step": 15440
|
|
},
|
|
{
|
|
"entropy": 5.438218641281128,
|
|
"epoch": 1.2016728262983856,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.00048590441591557526,
|
|
"loss": 5.2364,
|
|
"mean_token_accuracy": 0.17849221229553222,
|
|
"num_tokens": 26801931.0,
|
|
"step": 15445
|
|
},
|
|
{
|
|
"entropy": 5.505065441131592,
|
|
"epoch": 1.202061855670103,
|
|
"grad_norm": 1.671875,
|
|
"learning_rate": 0.00048589475872710134,
|
|
"loss": 5.4476,
|
|
"mean_token_accuracy": 0.17276598885655403,
|
|
"num_tokens": 26810689.0,
|
|
"step": 15450
|
|
},
|
|
{
|
|
"entropy": 5.5509138107299805,
|
|
"epoch": 1.2024508850418207,
|
|
"grad_norm": 1.5390625,
|
|
"learning_rate": 0.0004858850983386351,
|
|
"loss": 5.2543,
|
|
"mean_token_accuracy": 0.17251985818147658,
|
|
"num_tokens": 26819038.0,
|
|
"step": 15455
|
|
},
|
|
{
|
|
"entropy": 5.482952213287353,
|
|
"epoch": 1.2028399144135382,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0004858754347503231,
|
|
"loss": 5.168,
|
|
"mean_token_accuracy": 0.1780230164527893,
|
|
"num_tokens": 26827443.0,
|
|
"step": 15460
|
|
},
|
|
{
|
|
"entropy": 5.424577140808106,
|
|
"epoch": 1.203228943785256,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.00048586576796231216,
|
|
"loss": 5.1843,
|
|
"mean_token_accuracy": 0.18295662850141525,
|
|
"num_tokens": 26836306.0,
|
|
"step": 15465
|
|
},
|
|
{
|
|
"entropy": 5.4828393936157225,
|
|
"epoch": 1.2036179731569734,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.0004858560979747487,
|
|
"loss": 5.2853,
|
|
"mean_token_accuracy": 0.16759757846593856,
|
|
"num_tokens": 26845043.0,
|
|
"step": 15470
|
|
},
|
|
{
|
|
"entropy": 5.51875672340393,
|
|
"epoch": 1.2040070025286909,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.00048584642478777967,
|
|
"loss": 5.2176,
|
|
"mean_token_accuracy": 0.1779843732714653,
|
|
"num_tokens": 26853978.0,
|
|
"step": 15475
|
|
},
|
|
{
|
|
"entropy": 5.464112997055054,
|
|
"epoch": 1.2043960319004086,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0004858367484015517,
|
|
"loss": 5.1418,
|
|
"mean_token_accuracy": 0.1793970361351967,
|
|
"num_tokens": 26862487.0,
|
|
"step": 15480
|
|
},
|
|
{
|
|
"entropy": 5.452538061141968,
|
|
"epoch": 1.204785061272126,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.00048582706881621166,
|
|
"loss": 5.3087,
|
|
"mean_token_accuracy": 0.17768737971782683,
|
|
"num_tokens": 26871137.0,
|
|
"step": 15485
|
|
},
|
|
{
|
|
"entropy": 5.475749444961548,
|
|
"epoch": 1.2051740906438435,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.0004858173860319063,
|
|
"loss": 5.1906,
|
|
"mean_token_accuracy": 0.17435334771871566,
|
|
"num_tokens": 26880091.0,
|
|
"step": 15490
|
|
},
|
|
{
|
|
"entropy": 5.468170690536499,
|
|
"epoch": 1.2055631200155612,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.00048580770004878277,
|
|
"loss": 5.248,
|
|
"mean_token_accuracy": 0.17480643689632416,
|
|
"num_tokens": 26888777.0,
|
|
"step": 15495
|
|
},
|
|
{
|
|
"entropy": 5.483546781539917,
|
|
"epoch": 1.2059521493872787,
|
|
"grad_norm": 1.5546875,
|
|
"learning_rate": 0.0004857980108669879,
|
|
"loss": 5.1864,
|
|
"mean_token_accuracy": 0.17777623981237411,
|
|
"num_tokens": 26897689.0,
|
|
"step": 15500
|
|
},
|
|
{
|
|
"entropy": 5.537374830245971,
|
|
"epoch": 1.2063411787589964,
|
|
"grad_norm": 1.4921875,
|
|
"learning_rate": 0.00048578831848666875,
|
|
"loss": 5.2429,
|
|
"mean_token_accuracy": 0.17582704722881318,
|
|
"num_tokens": 26906209.0,
|
|
"step": 15505
|
|
},
|
|
{
|
|
"entropy": 5.5790770053863525,
|
|
"epoch": 1.2067302081307139,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.00048577862290797235,
|
|
"loss": 5.4158,
|
|
"mean_token_accuracy": 0.16453992575407028,
|
|
"num_tokens": 26916340.0,
|
|
"step": 15510
|
|
},
|
|
{
|
|
"entropy": 5.511990022659302,
|
|
"epoch": 1.2071192375024316,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.00048576892413104586,
|
|
"loss": 5.277,
|
|
"mean_token_accuracy": 0.17492361217737198,
|
|
"num_tokens": 26924482.0,
|
|
"step": 15515
|
|
},
|
|
{
|
|
"entropy": 5.43505449295044,
|
|
"epoch": 1.207508266874149,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.0004857592221560364,
|
|
"loss": 5.209,
|
|
"mean_token_accuracy": 0.17647359967231752,
|
|
"num_tokens": 26932844.0,
|
|
"step": 15520
|
|
},
|
|
{
|
|
"entropy": 5.410753059387207,
|
|
"epoch": 1.2078972962458665,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0004857495169830912,
|
|
"loss": 5.1136,
|
|
"mean_token_accuracy": 0.1828247383236885,
|
|
"num_tokens": 26940916.0,
|
|
"step": 15525
|
|
},
|
|
{
|
|
"entropy": 5.541863298416137,
|
|
"epoch": 1.2082863256175842,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.0004857398086123575,
|
|
"loss": 5.2514,
|
|
"mean_token_accuracy": 0.17455164194107056,
|
|
"num_tokens": 26949182.0,
|
|
"step": 15530
|
|
},
|
|
{
|
|
"entropy": 5.4823707103729244,
|
|
"epoch": 1.2086753549893017,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.0004857300970439827,
|
|
"loss": 5.2274,
|
|
"mean_token_accuracy": 0.17845567762851716,
|
|
"num_tokens": 26957531.0,
|
|
"step": 15535
|
|
},
|
|
{
|
|
"entropy": 5.511475992202759,
|
|
"epoch": 1.2090643843610192,
|
|
"grad_norm": 1.546875,
|
|
"learning_rate": 0.00048572038227811404,
|
|
"loss": 5.3029,
|
|
"mean_token_accuracy": 0.17839886099100113,
|
|
"num_tokens": 26965430.0,
|
|
"step": 15540
|
|
},
|
|
{
|
|
"entropy": 5.535074663162232,
|
|
"epoch": 1.2094534137327368,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.000485710664314899,
|
|
"loss": 5.3327,
|
|
"mean_token_accuracy": 0.17270613163709642,
|
|
"num_tokens": 26974132.0,
|
|
"step": 15545
|
|
},
|
|
{
|
|
"entropy": 5.48595027923584,
|
|
"epoch": 1.2098424431044543,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.000485700943154485,
|
|
"loss": 5.2194,
|
|
"mean_token_accuracy": 0.18303572684526442,
|
|
"num_tokens": 26982277.0,
|
|
"step": 15550
|
|
},
|
|
{
|
|
"entropy": 5.412470388412475,
|
|
"epoch": 1.210231472476172,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0004856912187970195,
|
|
"loss": 5.1891,
|
|
"mean_token_accuracy": 0.1742159217596054,
|
|
"num_tokens": 26991827.0,
|
|
"step": 15555
|
|
},
|
|
{
|
|
"entropy": 5.551828336715698,
|
|
"epoch": 1.2106205018478895,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.0004856814912426502,
|
|
"loss": 5.3397,
|
|
"mean_token_accuracy": 0.16540759950876235,
|
|
"num_tokens": 27000697.0,
|
|
"step": 15560
|
|
},
|
|
{
|
|
"entropy": 5.4759745597839355,
|
|
"epoch": 1.2110095312196072,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.0004856717604915245,
|
|
"loss": 5.2747,
|
|
"mean_token_accuracy": 0.17751561254262924,
|
|
"num_tokens": 27009461.0,
|
|
"step": 15565
|
|
},
|
|
{
|
|
"entropy": 5.442897462844849,
|
|
"epoch": 1.2113985605913247,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.0004856620265437902,
|
|
"loss": 5.1991,
|
|
"mean_token_accuracy": 0.17782714813947678,
|
|
"num_tokens": 27017970.0,
|
|
"step": 15570
|
|
},
|
|
{
|
|
"entropy": 5.460359668731689,
|
|
"epoch": 1.2117875899630421,
|
|
"grad_norm": 1.5546875,
|
|
"learning_rate": 0.000485652289399595,
|
|
"loss": 5.2819,
|
|
"mean_token_accuracy": 0.17499244064092637,
|
|
"num_tokens": 27026439.0,
|
|
"step": 15575
|
|
},
|
|
{
|
|
"entropy": 5.433102321624756,
|
|
"epoch": 1.2121766193347598,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 0.00048564254905908655,
|
|
"loss": 5.2492,
|
|
"mean_token_accuracy": 0.17063169777393342,
|
|
"num_tokens": 27034985.0,
|
|
"step": 15580
|
|
},
|
|
{
|
|
"entropy": 5.537007188796997,
|
|
"epoch": 1.2125656487064773,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 0.00048563280552241266,
|
|
"loss": 5.3667,
|
|
"mean_token_accuracy": 0.17174585908651352,
|
|
"num_tokens": 27044171.0,
|
|
"step": 15585
|
|
},
|
|
{
|
|
"entropy": 5.572177124023438,
|
|
"epoch": 1.2129546780781948,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.0004856230587897212,
|
|
"loss": 5.3152,
|
|
"mean_token_accuracy": 0.17625476270914078,
|
|
"num_tokens": 27053219.0,
|
|
"step": 15590
|
|
},
|
|
{
|
|
"entropy": 5.475028705596924,
|
|
"epoch": 1.2133437074499125,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0004856133088611602,
|
|
"loss": 5.1846,
|
|
"mean_token_accuracy": 0.18433427661657334,
|
|
"num_tokens": 27062012.0,
|
|
"step": 15595
|
|
},
|
|
{
|
|
"entropy": 5.473410034179688,
|
|
"epoch": 1.21373273682163,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.0004856035557368773,
|
|
"loss": 5.28,
|
|
"mean_token_accuracy": 0.16721234619617462,
|
|
"num_tokens": 27070854.0,
|
|
"step": 15600
|
|
},
|
|
{
|
|
"entropy": 5.553583383560181,
|
|
"epoch": 1.2141217661933477,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.00048559379941702074,
|
|
"loss": 5.3124,
|
|
"mean_token_accuracy": 0.17317847311496734,
|
|
"num_tokens": 27079295.0,
|
|
"step": 15605
|
|
},
|
|
{
|
|
"entropy": 5.497786045074463,
|
|
"epoch": 1.2145107955650651,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.00048558403990173844,
|
|
"loss": 5.2067,
|
|
"mean_token_accuracy": 0.17837853133678436,
|
|
"num_tokens": 27087909.0,
|
|
"step": 15610
|
|
},
|
|
{
|
|
"entropy": 5.423837566375733,
|
|
"epoch": 1.2148998249367828,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.00048557427719117855,
|
|
"loss": 5.2419,
|
|
"mean_token_accuracy": 0.17956048548221587,
|
|
"num_tokens": 27096461.0,
|
|
"step": 15615
|
|
},
|
|
{
|
|
"entropy": 5.511550760269165,
|
|
"epoch": 1.2152888543085003,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.0004855645112854891,
|
|
"loss": 5.3761,
|
|
"mean_token_accuracy": 0.17158395648002625,
|
|
"num_tokens": 27104846.0,
|
|
"step": 15620
|
|
},
|
|
{
|
|
"entropy": 5.546880769729614,
|
|
"epoch": 1.2156778836802178,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.0004855547421848184,
|
|
"loss": 5.1679,
|
|
"mean_token_accuracy": 0.18537740260362626,
|
|
"num_tokens": 27112623.0,
|
|
"step": 15625
|
|
},
|
|
{
|
|
"entropy": 5.439598798751831,
|
|
"epoch": 1.2160669130519355,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.00048554496988931456,
|
|
"loss": 5.2014,
|
|
"mean_token_accuracy": 0.18307663649320602,
|
|
"num_tokens": 27120752.0,
|
|
"step": 15630
|
|
},
|
|
{
|
|
"entropy": 5.499944257736206,
|
|
"epoch": 1.216455942423653,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.00048553519439912597,
|
|
"loss": 5.3724,
|
|
"mean_token_accuracy": 0.168205526471138,
|
|
"num_tokens": 27129583.0,
|
|
"step": 15635
|
|
},
|
|
{
|
|
"entropy": 5.550511360168457,
|
|
"epoch": 1.2168449717953704,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0004855254157144009,
|
|
"loss": 5.2922,
|
|
"mean_token_accuracy": 0.17158283442258834,
|
|
"num_tokens": 27137807.0,
|
|
"step": 15640
|
|
},
|
|
{
|
|
"entropy": 5.436446952819824,
|
|
"epoch": 1.2172340011670881,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.0004855156338352877,
|
|
"loss": 5.1372,
|
|
"mean_token_accuracy": 0.18327006846666336,
|
|
"num_tokens": 27146246.0,
|
|
"step": 15645
|
|
},
|
|
{
|
|
"entropy": 5.443410921096802,
|
|
"epoch": 1.2176230305388056,
|
|
"grad_norm": 1.59375,
|
|
"learning_rate": 0.00048550584876193493,
|
|
"loss": 5.2233,
|
|
"mean_token_accuracy": 0.17513495087623596,
|
|
"num_tokens": 27154811.0,
|
|
"step": 15650
|
|
},
|
|
{
|
|
"entropy": 5.483706426620484,
|
|
"epoch": 1.2180120599105233,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 0.00048549606049449085,
|
|
"loss": 5.2265,
|
|
"mean_token_accuracy": 0.1862750008702278,
|
|
"num_tokens": 27162849.0,
|
|
"step": 15655
|
|
},
|
|
{
|
|
"entropy": 5.470354604721069,
|
|
"epoch": 1.2184010892822408,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.0004854862690331041,
|
|
"loss": 5.3031,
|
|
"mean_token_accuracy": 0.17516927570104598,
|
|
"num_tokens": 27171268.0,
|
|
"step": 15660
|
|
},
|
|
{
|
|
"entropy": 5.531012630462646,
|
|
"epoch": 1.2187901186539585,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.00048547647437792327,
|
|
"loss": 5.2487,
|
|
"mean_token_accuracy": 0.17604827582836152,
|
|
"num_tokens": 27179571.0,
|
|
"step": 15665
|
|
},
|
|
{
|
|
"entropy": 5.475275182723999,
|
|
"epoch": 1.219179148025676,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 0.000485466676529097,
|
|
"loss": 5.2397,
|
|
"mean_token_accuracy": 0.17888182848691941,
|
|
"num_tokens": 27188441.0,
|
|
"step": 15670
|
|
},
|
|
{
|
|
"entropy": 5.478651857376098,
|
|
"epoch": 1.2195681773973934,
|
|
"grad_norm": 1.5390625,
|
|
"learning_rate": 0.00048545687548677373,
|
|
"loss": 5.2406,
|
|
"mean_token_accuracy": 0.17476353645324708,
|
|
"num_tokens": 27196960.0,
|
|
"step": 15675
|
|
},
|
|
{
|
|
"entropy": 5.487743902206421,
|
|
"epoch": 1.2199572067691111,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.0004854470712511025,
|
|
"loss": 5.2402,
|
|
"mean_token_accuracy": 0.17835523933172226,
|
|
"num_tokens": 27205129.0,
|
|
"step": 15680
|
|
},
|
|
{
|
|
"entropy": 5.4481260776519775,
|
|
"epoch": 1.2203462361408286,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.00048543726382223193,
|
|
"loss": 5.1846,
|
|
"mean_token_accuracy": 0.18032802641391754,
|
|
"num_tokens": 27214213.0,
|
|
"step": 15685
|
|
},
|
|
{
|
|
"entropy": 5.450518226623535,
|
|
"epoch": 1.220735265512546,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 0.00048542745320031075,
|
|
"loss": 5.2766,
|
|
"mean_token_accuracy": 0.16967780143022537,
|
|
"num_tokens": 27222447.0,
|
|
"step": 15690
|
|
},
|
|
{
|
|
"entropy": 5.508639764785767,
|
|
"epoch": 1.2211242948842638,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.00048541763938548795,
|
|
"loss": 5.2319,
|
|
"mean_token_accuracy": 0.17223200500011443,
|
|
"num_tokens": 27230872.0,
|
|
"step": 15695
|
|
},
|
|
{
|
|
"entropy": 5.465868234634399,
|
|
"epoch": 1.2215133242559812,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.00048540782237791244,
|
|
"loss": 5.2799,
|
|
"mean_token_accuracy": 0.17547931671142578,
|
|
"num_tokens": 27239171.0,
|
|
"step": 15700
|
|
},
|
|
{
|
|
"entropy": 5.424468183517456,
|
|
"epoch": 1.221902353627699,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.00048539800217773293,
|
|
"loss": 5.2162,
|
|
"mean_token_accuracy": 0.17269158065319062,
|
|
"num_tokens": 27247530.0,
|
|
"step": 15705
|
|
},
|
|
{
|
|
"entropy": 5.511728000640869,
|
|
"epoch": 1.2222913829994164,
|
|
"grad_norm": 1.640625,
|
|
"learning_rate": 0.0004853881787850988,
|
|
"loss": 5.2837,
|
|
"mean_token_accuracy": 0.17648686915636064,
|
|
"num_tokens": 27255579.0,
|
|
"step": 15710
|
|
},
|
|
{
|
|
"entropy": 5.425483655929566,
|
|
"epoch": 1.2226804123711341,
|
|
"grad_norm": 1.515625,
|
|
"learning_rate": 0.00048537835220015886,
|
|
"loss": 5.2355,
|
|
"mean_token_accuracy": 0.17767584025859834,
|
|
"num_tokens": 27264209.0,
|
|
"step": 15715
|
|
},
|
|
{
|
|
"entropy": 5.506767272949219,
|
|
"epoch": 1.2230694417428516,
|
|
"grad_norm": 1.5234375,
|
|
"learning_rate": 0.0004853685224230623,
|
|
"loss": 5.3054,
|
|
"mean_token_accuracy": 0.16528232246637345,
|
|
"num_tokens": 27272424.0,
|
|
"step": 15720
|
|
},
|
|
{
|
|
"entropy": 5.457148122787475,
|
|
"epoch": 1.223458471114569,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.00048535868945395825,
|
|
"loss": 5.1065,
|
|
"mean_token_accuracy": 0.18542055338621138,
|
|
"num_tokens": 27281265.0,
|
|
"step": 15725
|
|
},
|
|
{
|
|
"entropy": 5.549820041656494,
|
|
"epoch": 1.2238475004862868,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.00048534885329299586,
|
|
"loss": 5.3693,
|
|
"mean_token_accuracy": 0.17770871222019197,
|
|
"num_tokens": 27290026.0,
|
|
"step": 15730
|
|
},
|
|
{
|
|
"entropy": 5.505022144317627,
|
|
"epoch": 1.2242365298580042,
|
|
"grad_norm": 1.578125,
|
|
"learning_rate": 0.0004853390139403245,
|
|
"loss": 5.3273,
|
|
"mean_token_accuracy": 0.17424038499593736,
|
|
"num_tokens": 27298597.0,
|
|
"step": 15735
|
|
},
|
|
{
|
|
"entropy": 5.492482662200928,
|
|
"epoch": 1.224625559229722,
|
|
"grad_norm": 1.5546875,
|
|
"learning_rate": 0.00048532917139609334,
|
|
"loss": 5.2945,
|
|
"mean_token_accuracy": 0.17144012898206712,
|
|
"num_tokens": 27306763.0,
|
|
"step": 15740
|
|
},
|
|
{
|
|
"entropy": 5.4816591262817385,
|
|
"epoch": 1.2250145886014394,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.0004853193256604518,
|
|
"loss": 5.2789,
|
|
"mean_token_accuracy": 0.175824536383152,
|
|
"num_tokens": 27315782.0,
|
|
"step": 15745
|
|
},
|
|
{
|
|
"entropy": 5.597652959823608,
|
|
"epoch": 1.2254036179731569,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.00048530947673354924,
|
|
"loss": 5.3469,
|
|
"mean_token_accuracy": 0.16758460476994513,
|
|
"num_tokens": 27324487.0,
|
|
"step": 15750
|
|
},
|
|
{
|
|
"entropy": 5.453849363327026,
|
|
"epoch": 1.2257926473448746,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.0004852996246155351,
|
|
"loss": 5.2779,
|
|
"mean_token_accuracy": 0.1686175212264061,
|
|
"num_tokens": 27333099.0,
|
|
"step": 15755
|
|
},
|
|
{
|
|
"entropy": 5.445325469970703,
|
|
"epoch": 1.226181676716592,
|
|
"grad_norm": 1.609375,
|
|
"learning_rate": 0.00048528976930655896,
|
|
"loss": 5.2651,
|
|
"mean_token_accuracy": 0.17441341429948806,
|
|
"num_tokens": 27341697.0,
|
|
"step": 15760
|
|
},
|
|
{
|
|
"entropy": 5.486058330535888,
|
|
"epoch": 1.2265707060883098,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.00048527991080677015,
|
|
"loss": 5.2598,
|
|
"mean_token_accuracy": 0.17641414552927018,
|
|
"num_tokens": 27349811.0,
|
|
"step": 15765
|
|
},
|
|
{
|
|
"entropy": 5.465488004684448,
|
|
"epoch": 1.2269597354600272,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.00048527004911631843,
|
|
"loss": 5.2648,
|
|
"mean_token_accuracy": 0.17553373873233796,
|
|
"num_tokens": 27358257.0,
|
|
"step": 15770
|
|
},
|
|
{
|
|
"entropy": 5.477497148513794,
|
|
"epoch": 1.2273487648317447,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 0.0004852601842353534,
|
|
"loss": 5.224,
|
|
"mean_token_accuracy": 0.17824947237968444,
|
|
"num_tokens": 27366993.0,
|
|
"step": 15775
|
|
},
|
|
{
|
|
"entropy": 5.495562791824341,
|
|
"epoch": 1.2277377942034624,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.00048525031616402476,
|
|
"loss": 5.2871,
|
|
"mean_token_accuracy": 0.1762702763080597,
|
|
"num_tokens": 27375780.0,
|
|
"step": 15780
|
|
},
|
|
{
|
|
"entropy": 5.504449272155762,
|
|
"epoch": 1.2281268235751799,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.00048524044490248227,
|
|
"loss": 5.3167,
|
|
"mean_token_accuracy": 0.1752270057797432,
|
|
"num_tokens": 27384641.0,
|
|
"step": 15785
|
|
},
|
|
{
|
|
"entropy": 5.5637085914611815,
|
|
"epoch": 1.2285158529468976,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.00048523057045087557,
|
|
"loss": 5.2776,
|
|
"mean_token_accuracy": 0.17950163930654525,
|
|
"num_tokens": 27392990.0,
|
|
"step": 15790
|
|
},
|
|
{
|
|
"entropy": 5.536189794540405,
|
|
"epoch": 1.228904882318615,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.00048522069280935466,
|
|
"loss": 5.433,
|
|
"mean_token_accuracy": 0.16787081062793732,
|
|
"num_tokens": 27401012.0,
|
|
"step": 15795
|
|
},
|
|
{
|
|
"entropy": 5.444540119171142,
|
|
"epoch": 1.2292939116903325,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0004852108119780693,
|
|
"loss": 5.2453,
|
|
"mean_token_accuracy": 0.1739180013537407,
|
|
"num_tokens": 27409758.0,
|
|
"step": 15800
|
|
},
|
|
{
|
|
"entropy": 5.528168058395385,
|
|
"epoch": 1.2296829410620502,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0004852009279571694,
|
|
"loss": 5.2378,
|
|
"mean_token_accuracy": 0.18022283911705017,
|
|
"num_tokens": 27417592.0,
|
|
"step": 15805
|
|
},
|
|
{
|
|
"entropy": 5.439705562591553,
|
|
"epoch": 1.2300719704337677,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.000485191040746805,
|
|
"loss": 5.2197,
|
|
"mean_token_accuracy": 0.17247380912303925,
|
|
"num_tokens": 27426822.0,
|
|
"step": 15810
|
|
},
|
|
{
|
|
"entropy": 5.40670108795166,
|
|
"epoch": 1.2304609998054854,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0004851811503471262,
|
|
"loss": 5.1903,
|
|
"mean_token_accuracy": 0.18721838295459747,
|
|
"num_tokens": 27435446.0,
|
|
"step": 15815
|
|
},
|
|
{
|
|
"entropy": 5.489194774627686,
|
|
"epoch": 1.2308500291772029,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.00048517125675828294,
|
|
"loss": 5.2025,
|
|
"mean_token_accuracy": 0.17326698899269105,
|
|
"num_tokens": 27443156.0,
|
|
"step": 15820
|
|
},
|
|
{
|
|
"entropy": 5.523782348632812,
|
|
"epoch": 1.2312390585489204,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.00048516135998042536,
|
|
"loss": 5.322,
|
|
"mean_token_accuracy": 0.17499844804406167,
|
|
"num_tokens": 27451500.0,
|
|
"step": 15825
|
|
},
|
|
{
|
|
"entropy": 5.506570100784302,
|
|
"epoch": 1.231628087920638,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.0004851514600137037,
|
|
"loss": 5.3085,
|
|
"mean_token_accuracy": 0.18177199810743333,
|
|
"num_tokens": 27460237.0,
|
|
"step": 15830
|
|
},
|
|
{
|
|
"entropy": 5.516687488555908,
|
|
"epoch": 1.2320171172923555,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.00048514155685826807,
|
|
"loss": 5.2557,
|
|
"mean_token_accuracy": 0.1834619089961052,
|
|
"num_tokens": 27468434.0,
|
|
"step": 15835
|
|
},
|
|
{
|
|
"entropy": 5.557322978973389,
|
|
"epoch": 1.2324061466640732,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.0004851316505142688,
|
|
"loss": 5.2884,
|
|
"mean_token_accuracy": 0.17500267326831817,
|
|
"num_tokens": 27477667.0,
|
|
"step": 15840
|
|
},
|
|
{
|
|
"entropy": 5.513675022125244,
|
|
"epoch": 1.2327951760357907,
|
|
"grad_norm": 1.6953125,
|
|
"learning_rate": 0.00048512174098185615,
|
|
"loss": 5.2379,
|
|
"mean_token_accuracy": 0.17005163431167603,
|
|
"num_tokens": 27486365.0,
|
|
"step": 15845
|
|
},
|
|
{
|
|
"entropy": 5.426891088485718,
|
|
"epoch": 1.2331842054075082,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.00048511182826118055,
|
|
"loss": 5.2135,
|
|
"mean_token_accuracy": 0.18548982441425324,
|
|
"num_tokens": 27495310.0,
|
|
"step": 15850
|
|
},
|
|
{
|
|
"entropy": 5.417548084259034,
|
|
"epoch": 1.2335732347792259,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.00048510191235239246,
|
|
"loss": 5.1822,
|
|
"mean_token_accuracy": 0.18007411658763886,
|
|
"num_tokens": 27504175.0,
|
|
"step": 15855
|
|
},
|
|
{
|
|
"entropy": 5.56289849281311,
|
|
"epoch": 1.2339622641509433,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.00048509199325564217,
|
|
"loss": 5.2461,
|
|
"mean_token_accuracy": 0.17590783834457396,
|
|
"num_tokens": 27512042.0,
|
|
"step": 15860
|
|
},
|
|
{
|
|
"entropy": 5.524714612960816,
|
|
"epoch": 1.234351293522661,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0004850820709710803,
|
|
"loss": 5.329,
|
|
"mean_token_accuracy": 0.1797504872083664,
|
|
"num_tokens": 27520721.0,
|
|
"step": 15865
|
|
},
|
|
{
|
|
"entropy": 5.378135919570923,
|
|
"epoch": 1.2347403228943785,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.0004850721454988574,
|
|
"loss": 5.2042,
|
|
"mean_token_accuracy": 0.1747194856405258,
|
|
"num_tokens": 27529431.0,
|
|
"step": 15870
|
|
},
|
|
{
|
|
"entropy": 5.396539497375488,
|
|
"epoch": 1.235129352266096,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.00048506221683912405,
|
|
"loss": 5.1649,
|
|
"mean_token_accuracy": 0.19042879194021226,
|
|
"num_tokens": 27537380.0,
|
|
"step": 15875
|
|
},
|
|
{
|
|
"entropy": 5.443312740325927,
|
|
"epoch": 1.2355183816378137,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004850522849920309,
|
|
"loss": 5.1782,
|
|
"mean_token_accuracy": 0.17227473706007004,
|
|
"num_tokens": 27547487.0,
|
|
"step": 15880
|
|
},
|
|
{
|
|
"entropy": 5.5449117660522464,
|
|
"epoch": 1.2359074110095312,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.00048504234995772863,
|
|
"loss": 5.2643,
|
|
"mean_token_accuracy": 0.18243306875228882,
|
|
"num_tokens": 27556813.0,
|
|
"step": 15885
|
|
},
|
|
{
|
|
"entropy": 5.530151224136352,
|
|
"epoch": 1.2362964403812489,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0004850324117363681,
|
|
"loss": 5.366,
|
|
"mean_token_accuracy": 0.1678698778152466,
|
|
"num_tokens": 27566602.0,
|
|
"step": 15890
|
|
},
|
|
{
|
|
"entropy": 5.487677049636841,
|
|
"epoch": 1.2366854697529663,
|
|
"grad_norm": 1.875,
|
|
"learning_rate": 0.00048502247032809997,
|
|
"loss": 5.2815,
|
|
"mean_token_accuracy": 0.17698195576667786,
|
|
"num_tokens": 27574577.0,
|
|
"step": 15895
|
|
},
|
|
{
|
|
"entropy": 5.613036203384399,
|
|
"epoch": 1.237074499124684,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.0004850125257330751,
|
|
"loss": 5.4438,
|
|
"mean_token_accuracy": 0.16410594135522844,
|
|
"num_tokens": 27582702.0,
|
|
"step": 15900
|
|
},
|
|
{
|
|
"entropy": 5.467191982269287,
|
|
"epoch": 1.2374635284964015,
|
|
"grad_norm": 1.71875,
|
|
"learning_rate": 0.00048500257795144446,
|
|
"loss": 5.3154,
|
|
"mean_token_accuracy": 0.17378822714090347,
|
|
"num_tokens": 27591457.0,
|
|
"step": 15905
|
|
},
|
|
{
|
|
"entropy": 5.496062231063843,
|
|
"epoch": 1.237852557868119,
|
|
"grad_norm": 1.5546875,
|
|
"learning_rate": 0.000484992626983359,
|
|
"loss": 5.1868,
|
|
"mean_token_accuracy": 0.1804353564977646,
|
|
"num_tokens": 27600643.0,
|
|
"step": 15910
|
|
},
|
|
{
|
|
"entropy": 5.460226964950562,
|
|
"epoch": 1.2382415872398367,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.0004849826728289696,
|
|
"loss": 5.1772,
|
|
"mean_token_accuracy": 0.1787505030632019,
|
|
"num_tokens": 27608438.0,
|
|
"step": 15915
|
|
},
|
|
{
|
|
"entropy": 5.437861633300781,
|
|
"epoch": 1.2386306166115542,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.00048497271548842737,
|
|
"loss": 5.2969,
|
|
"mean_token_accuracy": 0.17473477274179458,
|
|
"num_tokens": 27617149.0,
|
|
"step": 15920
|
|
},
|
|
{
|
|
"entropy": 5.376610946655274,
|
|
"epoch": 1.2390196459832716,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.0004849627549618834,
|
|
"loss": 5.213,
|
|
"mean_token_accuracy": 0.18426057696342468,
|
|
"num_tokens": 27625188.0,
|
|
"step": 15925
|
|
},
|
|
{
|
|
"entropy": 5.452475929260254,
|
|
"epoch": 1.2394086753549893,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.00048495279124948886,
|
|
"loss": 5.3005,
|
|
"mean_token_accuracy": 0.17987428456544877,
|
|
"num_tokens": 27633865.0,
|
|
"step": 15930
|
|
},
|
|
{
|
|
"entropy": 5.50133376121521,
|
|
"epoch": 1.2397977047267068,
|
|
"grad_norm": 1.53125,
|
|
"learning_rate": 0.0004849428243513948,
|
|
"loss": 5.2654,
|
|
"mean_token_accuracy": 0.1721073016524315,
|
|
"num_tokens": 27642528.0,
|
|
"step": 15935
|
|
},
|
|
{
|
|
"entropy": 5.530778455734253,
|
|
"epoch": 1.2401867340984245,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.00048493285426775255,
|
|
"loss": 5.362,
|
|
"mean_token_accuracy": 0.16647080183029175,
|
|
"num_tokens": 27651291.0,
|
|
"step": 15940
|
|
},
|
|
{
|
|
"entropy": 5.595407962799072,
|
|
"epoch": 1.240575763470142,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.0004849228809987135,
|
|
"loss": 5.3696,
|
|
"mean_token_accuracy": 0.1729394167661667,
|
|
"num_tokens": 27660725.0,
|
|
"step": 15945
|
|
},
|
|
{
|
|
"entropy": 5.534488391876221,
|
|
"epoch": 1.2409647928418597,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 0.0004849129045444288,
|
|
"loss": 5.1946,
|
|
"mean_token_accuracy": 0.17993429005146028,
|
|
"num_tokens": 27669282.0,
|
|
"step": 15950
|
|
},
|
|
{
|
|
"entropy": 5.414973640441895,
|
|
"epoch": 1.2413538222135772,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.0004849029249050498,
|
|
"loss": 5.1986,
|
|
"mean_token_accuracy": 0.1776224911212921,
|
|
"num_tokens": 27677987.0,
|
|
"step": 15955
|
|
},
|
|
{
|
|
"entropy": 5.366016817092896,
|
|
"epoch": 1.2417428515852946,
|
|
"grad_norm": 1.4921875,
|
|
"learning_rate": 0.00048489294208072805,
|
|
"loss": 5.1789,
|
|
"mean_token_accuracy": 0.1801241770386696,
|
|
"num_tokens": 27686409.0,
|
|
"step": 15960
|
|
},
|
|
{
|
|
"entropy": 5.443279027938843,
|
|
"epoch": 1.2421318809570123,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.00048488295607161495,
|
|
"loss": 5.2179,
|
|
"mean_token_accuracy": 0.1784661203622818,
|
|
"num_tokens": 27695485.0,
|
|
"step": 15965
|
|
},
|
|
{
|
|
"entropy": 5.397273969650269,
|
|
"epoch": 1.2425209103287298,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.0004848729668778621,
|
|
"loss": 5.1015,
|
|
"mean_token_accuracy": 0.189507357776165,
|
|
"num_tokens": 27703962.0,
|
|
"step": 15970
|
|
},
|
|
{
|
|
"entropy": 5.458210372924805,
|
|
"epoch": 1.2429099397004473,
|
|
"grad_norm": 1.515625,
|
|
"learning_rate": 0.0004848629744996211,
|
|
"loss": 5.2527,
|
|
"mean_token_accuracy": 0.1757992535829544,
|
|
"num_tokens": 27713632.0,
|
|
"step": 15975
|
|
},
|
|
{
|
|
"entropy": 5.470901775360107,
|
|
"epoch": 1.243298969072165,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 0.0004848529789370434,
|
|
"loss": 5.291,
|
|
"mean_token_accuracy": 0.17782314270734786,
|
|
"num_tokens": 27722890.0,
|
|
"step": 15980
|
|
},
|
|
{
|
|
"entropy": 5.491668605804444,
|
|
"epoch": 1.2436879984438824,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.0004848429801902808,
|
|
"loss": 5.2186,
|
|
"mean_token_accuracy": 0.18407932817935943,
|
|
"num_tokens": 27731325.0,
|
|
"step": 15985
|
|
},
|
|
{
|
|
"entropy": 5.486194705963134,
|
|
"epoch": 1.2440770278156001,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.00048483297825948485,
|
|
"loss": 5.3156,
|
|
"mean_token_accuracy": 0.1758503422141075,
|
|
"num_tokens": 27739600.0,
|
|
"step": 15990
|
|
},
|
|
{
|
|
"entropy": 5.543510961532593,
|
|
"epoch": 1.2444660571873176,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.00048482297314480756,
|
|
"loss": 5.3006,
|
|
"mean_token_accuracy": 0.17465368360280992,
|
|
"num_tokens": 27747860.0,
|
|
"step": 15995
|
|
},
|
|
{
|
|
"entropy": 5.472729444503784,
|
|
"epoch": 1.2448550865590353,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 0.0004848129648464006,
|
|
"loss": 5.215,
|
|
"mean_token_accuracy": 0.17891848534345628,
|
|
"num_tokens": 27757141.0,
|
|
"step": 16000
|
|
},
|
|
{
|
|
"entropy": 5.5583357334136965,
|
|
"epoch": 1.2452441159307528,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.0004848029533644159,
|
|
"loss": 5.3673,
|
|
"mean_token_accuracy": 0.1748943418264389,
|
|
"num_tokens": 27766832.0,
|
|
"step": 16005
|
|
},
|
|
{
|
|
"entropy": 5.498703193664551,
|
|
"epoch": 1.2456331453024703,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0004847929386990052,
|
|
"loss": 5.2558,
|
|
"mean_token_accuracy": 0.17267411798238755,
|
|
"num_tokens": 27775487.0,
|
|
"step": 16010
|
|
},
|
|
{
|
|
"entropy": 5.47706241607666,
|
|
"epoch": 1.246022174674188,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.00048478292085032065,
|
|
"loss": 5.216,
|
|
"mean_token_accuracy": 0.17603672295808792,
|
|
"num_tokens": 27783601.0,
|
|
"step": 16015
|
|
},
|
|
{
|
|
"entropy": 5.512782859802246,
|
|
"epoch": 1.2464112040459054,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.0004847728998185142,
|
|
"loss": 5.3106,
|
|
"mean_token_accuracy": 0.17121509462594986,
|
|
"num_tokens": 27792931.0,
|
|
"step": 16020
|
|
},
|
|
{
|
|
"entropy": 5.550661039352417,
|
|
"epoch": 1.246800233417623,
|
|
"grad_norm": 1.53125,
|
|
"learning_rate": 0.00048476287560373786,
|
|
"loss": 5.2667,
|
|
"mean_token_accuracy": 0.1779284343123436,
|
|
"num_tokens": 27801388.0,
|
|
"step": 16025
|
|
},
|
|
{
|
|
"entropy": 5.504043531417847,
|
|
"epoch": 1.2471892627893406,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.00048475284820614375,
|
|
"loss": 5.2115,
|
|
"mean_token_accuracy": 0.17613635063171387,
|
|
"num_tokens": 27810047.0,
|
|
"step": 16030
|
|
},
|
|
{
|
|
"entropy": 5.4678081512451175,
|
|
"epoch": 1.247578292161058,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 0.00048474281762588407,
|
|
"loss": 5.242,
|
|
"mean_token_accuracy": 0.17732588797807694,
|
|
"num_tokens": 27818800.0,
|
|
"step": 16035
|
|
},
|
|
{
|
|
"entropy": 5.455697250366211,
|
|
"epoch": 1.2479673215327758,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0004847327838631109,
|
|
"loss": 5.2117,
|
|
"mean_token_accuracy": 0.174435555934906,
|
|
"num_tokens": 27827623.0,
|
|
"step": 16040
|
|
},
|
|
{
|
|
"entropy": 5.443018198013306,
|
|
"epoch": 1.2483563509044933,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0004847227469179766,
|
|
"loss": 5.1686,
|
|
"mean_token_accuracy": 0.18914233893156052,
|
|
"num_tokens": 27836491.0,
|
|
"step": 16045
|
|
},
|
|
{
|
|
"entropy": 5.479505634307861,
|
|
"epoch": 1.248745380276211,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 0.0004847127067906334,
|
|
"loss": 5.2416,
|
|
"mean_token_accuracy": 0.18159117102622985,
|
|
"num_tokens": 27845563.0,
|
|
"step": 16050
|
|
},
|
|
{
|
|
"entropy": 5.450436687469482,
|
|
"epoch": 1.2491344096479284,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.00048470266348123365,
|
|
"loss": 5.1873,
|
|
"mean_token_accuracy": 0.17724606096744538,
|
|
"num_tokens": 27854263.0,
|
|
"step": 16055
|
|
},
|
|
{
|
|
"entropy": 5.496408081054687,
|
|
"epoch": 1.249523439019646,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0004846926169899298,
|
|
"loss": 5.2376,
|
|
"mean_token_accuracy": 0.17651015073060988,
|
|
"num_tokens": 27862868.0,
|
|
"step": 16060
|
|
},
|
|
{
|
|
"entropy": 5.539421033859253,
|
|
"epoch": 1.2499124683913636,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.00048468256731687426,
|
|
"loss": 5.3467,
|
|
"mean_token_accuracy": 0.17136863619089127,
|
|
"num_tokens": 27872053.0,
|
|
"step": 16065
|
|
},
|
|
{
|
|
"entropy": 5.432773733139038,
|
|
"epoch": 1.250301497763081,
|
|
"grad_norm": 1.9921875,
|
|
"learning_rate": 0.0004846725144622194,
|
|
"loss": 5.1444,
|
|
"mean_token_accuracy": 0.1862142100930214,
|
|
"num_tokens": 27880953.0,
|
|
"step": 16070
|
|
},
|
|
{
|
|
"entropy": 5.479116058349609,
|
|
"epoch": 1.2506905271347986,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.000484662458426118,
|
|
"loss": 5.246,
|
|
"mean_token_accuracy": 0.17731681019067763,
|
|
"num_tokens": 27890102.0,
|
|
"step": 16075
|
|
},
|
|
{
|
|
"entropy": 5.5705382347106935,
|
|
"epoch": 1.2510795565065163,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.00048465239920872247,
|
|
"loss": 5.3323,
|
|
"mean_token_accuracy": 0.1745040386915207,
|
|
"num_tokens": 27899305.0,
|
|
"step": 16080
|
|
},
|
|
{
|
|
"entropy": 5.541355133056641,
|
|
"epoch": 1.2514685858782337,
|
|
"grad_norm": 1.4921875,
|
|
"learning_rate": 0.00048464233681018545,
|
|
"loss": 5.2602,
|
|
"mean_token_accuracy": 0.17806057780981063,
|
|
"num_tokens": 27907476.0,
|
|
"step": 16085
|
|
},
|
|
{
|
|
"entropy": 5.514520311355591,
|
|
"epoch": 1.2518576152499514,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0004846322712306596,
|
|
"loss": 5.3317,
|
|
"mean_token_accuracy": 0.1794234037399292,
|
|
"num_tokens": 27915353.0,
|
|
"step": 16090
|
|
},
|
|
{
|
|
"entropy": 5.4693365573883055,
|
|
"epoch": 1.252246644621669,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.00048462220247029783,
|
|
"loss": 5.2471,
|
|
"mean_token_accuracy": 0.17789728194475174,
|
|
"num_tokens": 27923980.0,
|
|
"step": 16095
|
|
},
|
|
{
|
|
"entropy": 5.483224391937256,
|
|
"epoch": 1.2526356739933866,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.00048461213052925265,
|
|
"loss": 5.336,
|
|
"mean_token_accuracy": 0.17547824680805207,
|
|
"num_tokens": 27932760.0,
|
|
"step": 16100
|
|
},
|
|
{
|
|
"entropy": 5.456972265243531,
|
|
"epoch": 1.253024703365104,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.0004846020554076771,
|
|
"loss": 5.2057,
|
|
"mean_token_accuracy": 0.17643631547689437,
|
|
"num_tokens": 27941328.0,
|
|
"step": 16105
|
|
},
|
|
{
|
|
"entropy": 5.568940877914429,
|
|
"epoch": 1.2534137327368216,
|
|
"grad_norm": 1.9375,
|
|
"learning_rate": 0.0004845919771057239,
|
|
"loss": 5.3852,
|
|
"mean_token_accuracy": 0.17011766284704208,
|
|
"num_tokens": 27949597.0,
|
|
"step": 16110
|
|
},
|
|
{
|
|
"entropy": 5.58374056816101,
|
|
"epoch": 1.2538027621085392,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0004845818956235462,
|
|
"loss": 5.2651,
|
|
"mean_token_accuracy": 0.17929119020700454,
|
|
"num_tokens": 27958798.0,
|
|
"step": 16115
|
|
},
|
|
{
|
|
"entropy": 5.536112880706787,
|
|
"epoch": 1.2541917914802567,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 0.00048457181096129664,
|
|
"loss": 5.2257,
|
|
"mean_token_accuracy": 0.17642829567193985,
|
|
"num_tokens": 27967582.0,
|
|
"step": 16120
|
|
},
|
|
{
|
|
"entropy": 5.475820922851563,
|
|
"epoch": 1.2545808208519742,
|
|
"grad_norm": 1.71875,
|
|
"learning_rate": 0.0004845617231191285,
|
|
"loss": 5.1887,
|
|
"mean_token_accuracy": 0.17645180225372314,
|
|
"num_tokens": 27975959.0,
|
|
"step": 16125
|
|
},
|
|
{
|
|
"entropy": 5.461424064636231,
|
|
"epoch": 1.254969850223692,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.0004845516320971948,
|
|
"loss": 5.2058,
|
|
"mean_token_accuracy": 0.18109354823827745,
|
|
"num_tokens": 27983980.0,
|
|
"step": 16130
|
|
},
|
|
{
|
|
"entropy": 5.459164190292358,
|
|
"epoch": 1.2553588795954094,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.0004845415378956486,
|
|
"loss": 5.1188,
|
|
"mean_token_accuracy": 0.17931146323680877,
|
|
"num_tokens": 27992563.0,
|
|
"step": 16135
|
|
},
|
|
{
|
|
"entropy": 5.451525497436523,
|
|
"epoch": 1.255747908967127,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.000484531440514643,
|
|
"loss": 5.1188,
|
|
"mean_token_accuracy": 0.1892002835869789,
|
|
"num_tokens": 28001457.0,
|
|
"step": 16140
|
|
},
|
|
{
|
|
"entropy": 5.51419620513916,
|
|
"epoch": 1.2561369383388445,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.00048452133995433136,
|
|
"loss": 5.2929,
|
|
"mean_token_accuracy": 0.17462045103311538,
|
|
"num_tokens": 28009507.0,
|
|
"step": 16145
|
|
},
|
|
{
|
|
"entropy": 5.399370384216309,
|
|
"epoch": 1.2565259677105622,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.0004845112362148668,
|
|
"loss": 5.2315,
|
|
"mean_token_accuracy": 0.16929426789283752,
|
|
"num_tokens": 28017858.0,
|
|
"step": 16150
|
|
},
|
|
{
|
|
"entropy": 5.509197854995728,
|
|
"epoch": 1.2569149970822797,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0004845011292964028,
|
|
"loss": 5.3089,
|
|
"mean_token_accuracy": 0.1709074407815933,
|
|
"num_tokens": 28026832.0,
|
|
"step": 16155
|
|
},
|
|
{
|
|
"entropy": 5.545967435836792,
|
|
"epoch": 1.2573040264539972,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.00048449101919909265,
|
|
"loss": 5.1987,
|
|
"mean_token_accuracy": 0.1815027803182602,
|
|
"num_tokens": 28034546.0,
|
|
"step": 16160
|
|
},
|
|
{
|
|
"entropy": 5.4364176273345945,
|
|
"epoch": 1.257693055825715,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00048448090592308955,
|
|
"loss": 5.2566,
|
|
"mean_token_accuracy": 0.1737620487809181,
|
|
"num_tokens": 28043400.0,
|
|
"step": 16165
|
|
},
|
|
{
|
|
"entropy": 5.4688023090362545,
|
|
"epoch": 1.2580820851974324,
|
|
"grad_norm": 1.8203125,
|
|
"learning_rate": 0.0004844707894685473,
|
|
"loss": 5.2252,
|
|
"mean_token_accuracy": 0.18468010574579238,
|
|
"num_tokens": 28052764.0,
|
|
"step": 16170
|
|
},
|
|
{
|
|
"entropy": 5.533858442306519,
|
|
"epoch": 1.2584711145691498,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004844606698356192,
|
|
"loss": 5.2908,
|
|
"mean_token_accuracy": 0.1714635819196701,
|
|
"num_tokens": 28061859.0,
|
|
"step": 16175
|
|
},
|
|
{
|
|
"entropy": 5.494021701812744,
|
|
"epoch": 1.2588601439408675,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0004844505470244588,
|
|
"loss": 5.1752,
|
|
"mean_token_accuracy": 0.1828700065612793,
|
|
"num_tokens": 28070935.0,
|
|
"step": 16180
|
|
},
|
|
{
|
|
"entropy": 5.480620193481445,
|
|
"epoch": 1.2592491733125852,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.0004844404210352197,
|
|
"loss": 5.2474,
|
|
"mean_token_accuracy": 0.17727855145931243,
|
|
"num_tokens": 28079864.0,
|
|
"step": 16185
|
|
},
|
|
{
|
|
"entropy": 5.417865514755249,
|
|
"epoch": 1.2596382026843027,
|
|
"grad_norm": 1.515625,
|
|
"learning_rate": 0.00048443029186805554,
|
|
"loss": 5.1225,
|
|
"mean_token_accuracy": 0.1779842495918274,
|
|
"num_tokens": 28088938.0,
|
|
"step": 16190
|
|
},
|
|
{
|
|
"entropy": 5.476406621932983,
|
|
"epoch": 1.2600272320560202,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.0004844201595231201,
|
|
"loss": 5.2406,
|
|
"mean_token_accuracy": 0.17104055732488632,
|
|
"num_tokens": 28097213.0,
|
|
"step": 16195
|
|
},
|
|
{
|
|
"entropy": 5.4360919952392575,
|
|
"epoch": 1.2604162614277379,
|
|
"grad_norm": 1.5078125,
|
|
"learning_rate": 0.00048441002400056706,
|
|
"loss": 5.2689,
|
|
"mean_token_accuracy": 0.17366572469472885,
|
|
"num_tokens": 28105187.0,
|
|
"step": 16200
|
|
},
|
|
{
|
|
"entropy": 5.469094181060791,
|
|
"epoch": 1.2608052907994554,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.0004843998853005502,
|
|
"loss": 5.1973,
|
|
"mean_token_accuracy": 0.18125773668289186,
|
|
"num_tokens": 28113238.0,
|
|
"step": 16205
|
|
},
|
|
{
|
|
"entropy": 5.386022520065308,
|
|
"epoch": 1.2611943201711728,
|
|
"grad_norm": 1.515625,
|
|
"learning_rate": 0.0004843897434232233,
|
|
"loss": 5.1373,
|
|
"mean_token_accuracy": 0.1829356163740158,
|
|
"num_tokens": 28121502.0,
|
|
"step": 16210
|
|
},
|
|
{
|
|
"entropy": 5.439625406265259,
|
|
"epoch": 1.2615833495428905,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.00048437959836874047,
|
|
"loss": 5.2427,
|
|
"mean_token_accuracy": 0.1784916937351227,
|
|
"num_tokens": 28130269.0,
|
|
"step": 16215
|
|
},
|
|
{
|
|
"entropy": 5.524720764160156,
|
|
"epoch": 1.261972378914608,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.00048436945013725544,
|
|
"loss": 5.3939,
|
|
"mean_token_accuracy": 0.16763487607240676,
|
|
"num_tokens": 28139482.0,
|
|
"step": 16220
|
|
},
|
|
{
|
|
"entropy": 5.530150318145752,
|
|
"epoch": 1.2623614082863255,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.00048435929872892226,
|
|
"loss": 5.3322,
|
|
"mean_token_accuracy": 0.17418678253889083,
|
|
"num_tokens": 28148443.0,
|
|
"step": 16225
|
|
},
|
|
{
|
|
"entropy": 5.543543720245362,
|
|
"epoch": 1.2627504376580432,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 0.0004843491441438949,
|
|
"loss": 5.1813,
|
|
"mean_token_accuracy": 0.18123750388622284,
|
|
"num_tokens": 28156807.0,
|
|
"step": 16230
|
|
},
|
|
{
|
|
"entropy": 5.463288831710815,
|
|
"epoch": 1.2631394670297609,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.00048433898638232755,
|
|
"loss": 5.2496,
|
|
"mean_token_accuracy": 0.17886511236429214,
|
|
"num_tokens": 28165019.0,
|
|
"step": 16235
|
|
},
|
|
{
|
|
"entropy": 5.46819167137146,
|
|
"epoch": 1.2635284964014784,
|
|
"grad_norm": 1.5234375,
|
|
"learning_rate": 0.0004843288254443742,
|
|
"loss": 5.2569,
|
|
"mean_token_accuracy": 0.17380767017602922,
|
|
"num_tokens": 28173505.0,
|
|
"step": 16240
|
|
},
|
|
{
|
|
"entropy": 5.594399309158325,
|
|
"epoch": 1.2639175257731958,
|
|
"grad_norm": 1.5390625,
|
|
"learning_rate": 0.0004843186613301892,
|
|
"loss": 5.3221,
|
|
"mean_token_accuracy": 0.17378030866384506,
|
|
"num_tokens": 28182524.0,
|
|
"step": 16245
|
|
},
|
|
{
|
|
"entropy": 5.563673639297486,
|
|
"epoch": 1.2643065551449135,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 0.0004843084940399266,
|
|
"loss": 5.3627,
|
|
"mean_token_accuracy": 0.17066486552357674,
|
|
"num_tokens": 28191093.0,
|
|
"step": 16250
|
|
},
|
|
{
|
|
"entropy": 5.476001596450805,
|
|
"epoch": 1.264695584516631,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.0004842983235737408,
|
|
"loss": 5.2351,
|
|
"mean_token_accuracy": 0.17515968084335326,
|
|
"num_tokens": 28199092.0,
|
|
"step": 16255
|
|
},
|
|
{
|
|
"entropy": 5.547818279266357,
|
|
"epoch": 1.2650846138883485,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.0004842881499317861,
|
|
"loss": 5.3329,
|
|
"mean_token_accuracy": 0.17457364350557328,
|
|
"num_tokens": 28207341.0,
|
|
"step": 16260
|
|
},
|
|
{
|
|
"entropy": 5.537169313430786,
|
|
"epoch": 1.2654736432600662,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.0004842779731142168,
|
|
"loss": 5.2511,
|
|
"mean_token_accuracy": 0.17711718380451202,
|
|
"num_tokens": 28216370.0,
|
|
"step": 16265
|
|
},
|
|
{
|
|
"entropy": 5.51004958152771,
|
|
"epoch": 1.2658626726317836,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.00048426779312118735,
|
|
"loss": 5.2883,
|
|
"mean_token_accuracy": 0.176120425760746,
|
|
"num_tokens": 28224554.0,
|
|
"step": 16270
|
|
},
|
|
{
|
|
"entropy": 5.521767330169678,
|
|
"epoch": 1.2662517020035013,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.0004842576099528522,
|
|
"loss": 5.2889,
|
|
"mean_token_accuracy": 0.17439346462488176,
|
|
"num_tokens": 28232672.0,
|
|
"step": 16275
|
|
},
|
|
{
|
|
"entropy": 5.401370573043823,
|
|
"epoch": 1.2666407313752188,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.0004842474236093659,
|
|
"loss": 5.1243,
|
|
"mean_token_accuracy": 0.18079132437705994,
|
|
"num_tokens": 28240730.0,
|
|
"step": 16280
|
|
},
|
|
{
|
|
"entropy": 5.442571115493775,
|
|
"epoch": 1.2670297607469365,
|
|
"grad_norm": 1.53125,
|
|
"learning_rate": 0.00048423723409088306,
|
|
"loss": 5.2461,
|
|
"mean_token_accuracy": 0.175859697163105,
|
|
"num_tokens": 28248989.0,
|
|
"step": 16285
|
|
},
|
|
{
|
|
"entropy": 5.5483057498931885,
|
|
"epoch": 1.267418790118654,
|
|
"grad_norm": 1.53125,
|
|
"learning_rate": 0.0004842270413975582,
|
|
"loss": 5.3286,
|
|
"mean_token_accuracy": 0.1679416909813881,
|
|
"num_tokens": 28256900.0,
|
|
"step": 16290
|
|
},
|
|
{
|
|
"entropy": 5.53696608543396,
|
|
"epoch": 1.2678078194903715,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.000484216845529546,
|
|
"loss": 5.2735,
|
|
"mean_token_accuracy": 0.17081423550844194,
|
|
"num_tokens": 28265832.0,
|
|
"step": 16295
|
|
},
|
|
{
|
|
"entropy": 5.432358837127685,
|
|
"epoch": 1.2681968488620892,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.00048420664648700113,
|
|
"loss": 5.1558,
|
|
"mean_token_accuracy": 0.1770220011472702,
|
|
"num_tokens": 28274661.0,
|
|
"step": 16300
|
|
},
|
|
{
|
|
"entropy": 5.530181789398194,
|
|
"epoch": 1.2685858782338066,
|
|
"grad_norm": 1.5234375,
|
|
"learning_rate": 0.0004841964442700784,
|
|
"loss": 5.2334,
|
|
"mean_token_accuracy": 0.17457151561975479,
|
|
"num_tokens": 28283303.0,
|
|
"step": 16305
|
|
},
|
|
{
|
|
"entropy": 5.454696369171143,
|
|
"epoch": 1.2689749076055241,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 0.00048418623887893264,
|
|
"loss": 5.1119,
|
|
"mean_token_accuracy": 0.17928371727466583,
|
|
"num_tokens": 28291660.0,
|
|
"step": 16310
|
|
},
|
|
{
|
|
"entropy": 5.490466165542602,
|
|
"epoch": 1.2693639369772418,
|
|
"grad_norm": 1.5546875,
|
|
"learning_rate": 0.00048417603031371867,
|
|
"loss": 5.2951,
|
|
"mean_token_accuracy": 0.17176648527383803,
|
|
"num_tokens": 28301314.0,
|
|
"step": 16315
|
|
},
|
|
{
|
|
"entropy": 5.522611045837403,
|
|
"epoch": 1.2697529663489593,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0004841658185745913,
|
|
"loss": 5.2304,
|
|
"mean_token_accuracy": 0.16735271215438843,
|
|
"num_tokens": 28310044.0,
|
|
"step": 16320
|
|
},
|
|
{
|
|
"entropy": 5.634258031845093,
|
|
"epoch": 1.270141995720677,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.00048415560366170564,
|
|
"loss": 5.349,
|
|
"mean_token_accuracy": 0.180294768512249,
|
|
"num_tokens": 28319773.0,
|
|
"step": 16325
|
|
},
|
|
{
|
|
"entropy": 5.469909286499023,
|
|
"epoch": 1.2705310250923945,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0004841453855752165,
|
|
"loss": 5.1167,
|
|
"mean_token_accuracy": 0.18387712985277177,
|
|
"num_tokens": 28328070.0,
|
|
"step": 16330
|
|
},
|
|
{
|
|
"entropy": 5.459448146820068,
|
|
"epoch": 1.2709200544641122,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0004841351643152791,
|
|
"loss": 5.2382,
|
|
"mean_token_accuracy": 0.17865411639213563,
|
|
"num_tokens": 28337636.0,
|
|
"step": 16335
|
|
},
|
|
{
|
|
"entropy": 5.373522758483887,
|
|
"epoch": 1.2713090838358296,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0004841249398820485,
|
|
"loss": 5.2326,
|
|
"mean_token_accuracy": 0.17584374099969863,
|
|
"num_tokens": 28346609.0,
|
|
"step": 16340
|
|
},
|
|
{
|
|
"entropy": 5.447516870498657,
|
|
"epoch": 1.271698113207547,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0004841147122756797,
|
|
"loss": 5.2479,
|
|
"mean_token_accuracy": 0.17630080431699752,
|
|
"num_tokens": 28355395.0,
|
|
"step": 16345
|
|
},
|
|
{
|
|
"entropy": 5.423162746429443,
|
|
"epoch": 1.2720871425792648,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.000484104481496328,
|
|
"loss": 5.353,
|
|
"mean_token_accuracy": 0.17391128093004227,
|
|
"num_tokens": 28364447.0,
|
|
"step": 16350
|
|
},
|
|
{
|
|
"entropy": 5.510781574249267,
|
|
"epoch": 1.2724761719509823,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0004840942475441486,
|
|
"loss": 5.2639,
|
|
"mean_token_accuracy": 0.17910945415496826,
|
|
"num_tokens": 28372872.0,
|
|
"step": 16355
|
|
},
|
|
{
|
|
"entropy": 5.5165708541870115,
|
|
"epoch": 1.2728652013226998,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.0004840840104192969,
|
|
"loss": 5.1576,
|
|
"mean_token_accuracy": 0.1780828982591629,
|
|
"num_tokens": 28380840.0,
|
|
"step": 16360
|
|
},
|
|
{
|
|
"entropy": 5.421405029296875,
|
|
"epoch": 1.2732542306944175,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.000484073770121928,
|
|
"loss": 5.1797,
|
|
"mean_token_accuracy": 0.1737140029668808,
|
|
"num_tokens": 28390417.0,
|
|
"step": 16365
|
|
},
|
|
{
|
|
"entropy": 5.501765775680542,
|
|
"epoch": 1.273643260066135,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 0.0004840635266521975,
|
|
"loss": 5.2436,
|
|
"mean_token_accuracy": 0.1747473046183586,
|
|
"num_tokens": 28400101.0,
|
|
"step": 16370
|
|
},
|
|
{
|
|
"entropy": 5.40831413269043,
|
|
"epoch": 1.2740322894378526,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.0004840532800102607,
|
|
"loss": 5.1624,
|
|
"mean_token_accuracy": 0.1840745121240616,
|
|
"num_tokens": 28408336.0,
|
|
"step": 16375
|
|
},
|
|
{
|
|
"entropy": 5.374412250518799,
|
|
"epoch": 1.27442131880957,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.00048404303019627314,
|
|
"loss": 5.19,
|
|
"mean_token_accuracy": 0.17816560119390487,
|
|
"num_tokens": 28416985.0,
|
|
"step": 16380
|
|
},
|
|
{
|
|
"entropy": 5.473758220672607,
|
|
"epoch": 1.2748103481812878,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.00048403277721039036,
|
|
"loss": 5.34,
|
|
"mean_token_accuracy": 0.16575801372528076,
|
|
"num_tokens": 28425543.0,
|
|
"step": 16385
|
|
},
|
|
{
|
|
"entropy": 5.551471281051636,
|
|
"epoch": 1.2751993775530053,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 0.0004840225210527679,
|
|
"loss": 5.2784,
|
|
"mean_token_accuracy": 0.172513510286808,
|
|
"num_tokens": 28435151.0,
|
|
"step": 16390
|
|
},
|
|
{
|
|
"entropy": 5.513803625106812,
|
|
"epoch": 1.2755884069247228,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0004840122617235613,
|
|
"loss": 5.2922,
|
|
"mean_token_accuracy": 0.17031923681497574,
|
|
"num_tokens": 28444535.0,
|
|
"step": 16395
|
|
},
|
|
{
|
|
"entropy": 5.5126196384429935,
|
|
"epoch": 1.2759774362964404,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.0004840019992229263,
|
|
"loss": 5.2123,
|
|
"mean_token_accuracy": 0.1758396416902542,
|
|
"num_tokens": 28452852.0,
|
|
"step": 16400
|
|
},
|
|
{
|
|
"entropy": 5.4684813022613525,
|
|
"epoch": 1.276366465668158,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.00048399173355101867,
|
|
"loss": 5.2593,
|
|
"mean_token_accuracy": 0.1736247271299362,
|
|
"num_tokens": 28462573.0,
|
|
"step": 16405
|
|
},
|
|
{
|
|
"entropy": 5.546539735794068,
|
|
"epoch": 1.2767554950398754,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.00048398146470799417,
|
|
"loss": 5.3175,
|
|
"mean_token_accuracy": 0.16955233961343766,
|
|
"num_tokens": 28471714.0,
|
|
"step": 16410
|
|
},
|
|
{
|
|
"entropy": 5.455294179916382,
|
|
"epoch": 1.277144524411593,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.00048397119269400846,
|
|
"loss": 5.2054,
|
|
"mean_token_accuracy": 0.1762496441602707,
|
|
"num_tokens": 28479989.0,
|
|
"step": 16415
|
|
},
|
|
{
|
|
"entropy": 5.430337858200073,
|
|
"epoch": 1.2775335537833106,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.00048396091750921766,
|
|
"loss": 5.2493,
|
|
"mean_token_accuracy": 0.17211588770151137,
|
|
"num_tokens": 28488707.0,
|
|
"step": 16420
|
|
},
|
|
{
|
|
"entropy": 5.539992427825927,
|
|
"epoch": 1.2779225831550283,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0004839506391537774,
|
|
"loss": 5.3893,
|
|
"mean_token_accuracy": 0.17205370962619781,
|
|
"num_tokens": 28497228.0,
|
|
"step": 16425
|
|
},
|
|
{
|
|
"entropy": 5.550241136550904,
|
|
"epoch": 1.2783116125267457,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.0004839403576278438,
|
|
"loss": 5.2401,
|
|
"mean_token_accuracy": 0.1817205771803856,
|
|
"num_tokens": 28505604.0,
|
|
"step": 16430
|
|
},
|
|
{
|
|
"entropy": 5.4601161003112795,
|
|
"epoch": 1.2787006418984634,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 0.0004839300729315729,
|
|
"loss": 5.3057,
|
|
"mean_token_accuracy": 0.17057207077741623,
|
|
"num_tokens": 28514798.0,
|
|
"step": 16435
|
|
},
|
|
{
|
|
"entropy": 5.556891345977784,
|
|
"epoch": 1.279089671270181,
|
|
"grad_norm": 1.4921875,
|
|
"learning_rate": 0.0004839197850651206,
|
|
"loss": 5.2997,
|
|
"mean_token_accuracy": 0.1786057710647583,
|
|
"num_tokens": 28523883.0,
|
|
"step": 16440
|
|
},
|
|
{
|
|
"entropy": 5.510235738754273,
|
|
"epoch": 1.2794787006418984,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.00048390949402864317,
|
|
"loss": 5.2861,
|
|
"mean_token_accuracy": 0.17379218637943267,
|
|
"num_tokens": 28532290.0,
|
|
"step": 16445
|
|
},
|
|
{
|
|
"entropy": 5.419999074935913,
|
|
"epoch": 1.279867730013616,
|
|
"grad_norm": 1.5546875,
|
|
"learning_rate": 0.00048389919982229666,
|
|
"loss": 5.1932,
|
|
"mean_token_accuracy": 0.17638996988534927,
|
|
"num_tokens": 28540775.0,
|
|
"step": 16450
|
|
},
|
|
{
|
|
"entropy": 5.5101734638214115,
|
|
"epoch": 1.2802567593853336,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.00048388890244623723,
|
|
"loss": 5.2856,
|
|
"mean_token_accuracy": 0.17323748171329498,
|
|
"num_tokens": 28549517.0,
|
|
"step": 16455
|
|
},
|
|
{
|
|
"entropy": 5.475038480758667,
|
|
"epoch": 1.280645788757051,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0004838786019006213,
|
|
"loss": 5.2549,
|
|
"mean_token_accuracy": 0.18170392215251924,
|
|
"num_tokens": 28557708.0,
|
|
"step": 16460
|
|
},
|
|
{
|
|
"entropy": 5.5590160369873045,
|
|
"epoch": 1.2810348181287687,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00048386829818560493,
|
|
"loss": 5.2787,
|
|
"mean_token_accuracy": 0.17825947999954223,
|
|
"num_tokens": 28566912.0,
|
|
"step": 16465
|
|
},
|
|
{
|
|
"entropy": 5.468572187423706,
|
|
"epoch": 1.2814238475004862,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00048385799130134464,
|
|
"loss": 5.2977,
|
|
"mean_token_accuracy": 0.17290488481521607,
|
|
"num_tokens": 28577104.0,
|
|
"step": 16470
|
|
},
|
|
{
|
|
"entropy": 5.4020110130310055,
|
|
"epoch": 1.281812876872204,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.0004838476812479968,
|
|
"loss": 5.2712,
|
|
"mean_token_accuracy": 0.1771841451525688,
|
|
"num_tokens": 28585984.0,
|
|
"step": 16475
|
|
},
|
|
{
|
|
"entropy": 5.542328596115112,
|
|
"epoch": 1.2822019062439214,
|
|
"grad_norm": 1.5625,
|
|
"learning_rate": 0.00048383736802571774,
|
|
"loss": 5.2853,
|
|
"mean_token_accuracy": 0.17197678834199906,
|
|
"num_tokens": 28594945.0,
|
|
"step": 16480
|
|
},
|
|
{
|
|
"entropy": 5.637636327743531,
|
|
"epoch": 1.282590935615639,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.000483827051634664,
|
|
"loss": 5.3305,
|
|
"mean_token_accuracy": 0.1713242083787918,
|
|
"num_tokens": 28603546.0,
|
|
"step": 16485
|
|
},
|
|
{
|
|
"entropy": 5.517670488357544,
|
|
"epoch": 1.2829799649873566,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.00048381673207499224,
|
|
"loss": 5.2591,
|
|
"mean_token_accuracy": 0.17759563028812408,
|
|
"num_tokens": 28612057.0,
|
|
"step": 16490
|
|
},
|
|
{
|
|
"entropy": 5.424947738647461,
|
|
"epoch": 1.283368994359074,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 0.0004838064093468588,
|
|
"loss": 5.2017,
|
|
"mean_token_accuracy": 0.177443490922451,
|
|
"num_tokens": 28620945.0,
|
|
"step": 16495
|
|
},
|
|
{
|
|
"entropy": 5.382672882080078,
|
|
"epoch": 1.2837580237307917,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0004837960834504206,
|
|
"loss": 5.1292,
|
|
"mean_token_accuracy": 0.1877993956208229,
|
|
"num_tokens": 28629028.0,
|
|
"step": 16500
|
|
},
|
|
{
|
|
"entropy": 5.424057579040527,
|
|
"epoch": 1.2841470531025092,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004837857543858341,
|
|
"loss": 5.1773,
|
|
"mean_token_accuracy": 0.17858725786209106,
|
|
"num_tokens": 28637533.0,
|
|
"step": 16505
|
|
},
|
|
{
|
|
"entropy": 5.518388175964356,
|
|
"epoch": 1.2845360824742267,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.0004837754221532561,
|
|
"loss": 5.3457,
|
|
"mean_token_accuracy": 0.17425785213708878,
|
|
"num_tokens": 28646906.0,
|
|
"step": 16510
|
|
},
|
|
{
|
|
"entropy": 5.4876491069793705,
|
|
"epoch": 1.2849251118459444,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.00048376508675284334,
|
|
"loss": 5.2071,
|
|
"mean_token_accuracy": 0.1816145345568657,
|
|
"num_tokens": 28655597.0,
|
|
"step": 16515
|
|
},
|
|
{
|
|
"entropy": 5.506335735321045,
|
|
"epoch": 1.2853141412176619,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.00048375474818475274,
|
|
"loss": 5.3487,
|
|
"mean_token_accuracy": 0.16967411190271378,
|
|
"num_tokens": 28664806.0,
|
|
"step": 16520
|
|
},
|
|
{
|
|
"entropy": 5.450713872909546,
|
|
"epoch": 1.2857031705893796,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 0.00048374440644914104,
|
|
"loss": 5.1899,
|
|
"mean_token_accuracy": 0.1852163165807724,
|
|
"num_tokens": 28673610.0,
|
|
"step": 16525
|
|
},
|
|
{
|
|
"entropy": 5.45979266166687,
|
|
"epoch": 1.286092199961097,
|
|
"grad_norm": 1.6796875,
|
|
"learning_rate": 0.00048373406154616523,
|
|
"loss": 5.2316,
|
|
"mean_token_accuracy": 0.17208587527275085,
|
|
"num_tokens": 28681726.0,
|
|
"step": 16530
|
|
},
|
|
{
|
|
"entropy": 5.582917308807373,
|
|
"epoch": 1.2864812293328147,
|
|
"grad_norm": 2.390625,
|
|
"learning_rate": 0.00048372371347598226,
|
|
"loss": 5.4105,
|
|
"mean_token_accuracy": 0.16327884942293167,
|
|
"num_tokens": 28691014.0,
|
|
"step": 16535
|
|
},
|
|
{
|
|
"entropy": 5.567583656311035,
|
|
"epoch": 1.2868702587045322,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.00048371336223874923,
|
|
"loss": 5.2598,
|
|
"mean_token_accuracy": 0.1747429773211479,
|
|
"num_tokens": 28699304.0,
|
|
"step": 16540
|
|
},
|
|
{
|
|
"entropy": 5.526841831207276,
|
|
"epoch": 1.2872592880762497,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.000483703007834623,
|
|
"loss": 5.1875,
|
|
"mean_token_accuracy": 0.1813199669122696,
|
|
"num_tokens": 28707950.0,
|
|
"step": 16545
|
|
},
|
|
{
|
|
"entropy": 5.403838968276977,
|
|
"epoch": 1.2876483174479674,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 0.0004836926502637609,
|
|
"loss": 5.2066,
|
|
"mean_token_accuracy": 0.17755566090345382,
|
|
"num_tokens": 28716678.0,
|
|
"step": 16550
|
|
},
|
|
{
|
|
"entropy": 5.450593423843384,
|
|
"epoch": 1.2880373468196848,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00048368228952632005,
|
|
"loss": 5.2314,
|
|
"mean_token_accuracy": 0.18036616146564483,
|
|
"num_tokens": 28725658.0,
|
|
"step": 16555
|
|
},
|
|
{
|
|
"entropy": 5.5394350528717045,
|
|
"epoch": 1.2884263761914023,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.00048367192562245756,
|
|
"loss": 5.2625,
|
|
"mean_token_accuracy": 0.17962267100811005,
|
|
"num_tokens": 28733859.0,
|
|
"step": 16560
|
|
},
|
|
{
|
|
"entropy": 5.355400419235229,
|
|
"epoch": 1.28881540556312,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.00048366155855233067,
|
|
"loss": 5.151,
|
|
"mean_token_accuracy": 0.1870662033557892,
|
|
"num_tokens": 28741941.0,
|
|
"step": 16565
|
|
},
|
|
{
|
|
"entropy": 5.380025625228882,
|
|
"epoch": 1.2892044349348377,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0004836511883160968,
|
|
"loss": 5.098,
|
|
"mean_token_accuracy": 0.1813839539885521,
|
|
"num_tokens": 28750296.0,
|
|
"step": 16570
|
|
},
|
|
{
|
|
"entropy": 5.4191608905792235,
|
|
"epoch": 1.2895934643065552,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.0004836408149139133,
|
|
"loss": 5.0805,
|
|
"mean_token_accuracy": 0.1857111483812332,
|
|
"num_tokens": 28758359.0,
|
|
"step": 16575
|
|
},
|
|
{
|
|
"entropy": 5.477891206741333,
|
|
"epoch": 1.2899824936782727,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 0.00048363043834593743,
|
|
"loss": 5.2795,
|
|
"mean_token_accuracy": 0.17737163454294205,
|
|
"num_tokens": 28766944.0,
|
|
"step": 16580
|
|
},
|
|
{
|
|
"entropy": 5.472108697891235,
|
|
"epoch": 1.2903715230499904,
|
|
"grad_norm": 1.4921875,
|
|
"learning_rate": 0.0004836200586123268,
|
|
"loss": 5.3042,
|
|
"mean_token_accuracy": 0.17624610364437104,
|
|
"num_tokens": 28775897.0,
|
|
"step": 16585
|
|
},
|
|
{
|
|
"entropy": 5.4618124008178714,
|
|
"epoch": 1.2907605524217078,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00048360967571323875,
|
|
"loss": 5.2069,
|
|
"mean_token_accuracy": 0.17975049018859862,
|
|
"num_tokens": 28784509.0,
|
|
"step": 16590
|
|
},
|
|
{
|
|
"entropy": 5.376451206207276,
|
|
"epoch": 1.2911495817934253,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00048359928964883094,
|
|
"loss": 5.0763,
|
|
"mean_token_accuracy": 0.18987792432308198,
|
|
"num_tokens": 28793347.0,
|
|
"step": 16595
|
|
},
|
|
{
|
|
"entropy": 5.449303150177002,
|
|
"epoch": 1.291538611165143,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.000483588900419261,
|
|
"loss": 5.1703,
|
|
"mean_token_accuracy": 0.1835750386118889,
|
|
"num_tokens": 28801100.0,
|
|
"step": 16600
|
|
},
|
|
{
|
|
"entropy": 5.418455314636231,
|
|
"epoch": 1.2919276405368605,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.0004835785080246864,
|
|
"loss": 5.1733,
|
|
"mean_token_accuracy": 0.18339648991823196,
|
|
"num_tokens": 28809508.0,
|
|
"step": 16605
|
|
},
|
|
{
|
|
"entropy": 5.407320833206176,
|
|
"epoch": 1.292316669908578,
|
|
"grad_norm": 1.5390625,
|
|
"learning_rate": 0.000483568112465265,
|
|
"loss": 5.2613,
|
|
"mean_token_accuracy": 0.17024484425783157,
|
|
"num_tokens": 28819263.0,
|
|
"step": 16610
|
|
},
|
|
{
|
|
"entropy": 5.570907831192017,
|
|
"epoch": 1.2927056992802957,
|
|
"grad_norm": 1.5625,
|
|
"learning_rate": 0.00048355771374115436,
|
|
"loss": 5.338,
|
|
"mean_token_accuracy": 0.16404026001691818,
|
|
"num_tokens": 28827316.0,
|
|
"step": 16615
|
|
},
|
|
{
|
|
"entropy": 5.575836133956909,
|
|
"epoch": 1.2930947286520134,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.0004835473118525125,
|
|
"loss": 5.3484,
|
|
"mean_token_accuracy": 0.17342509031295777,
|
|
"num_tokens": 28836272.0,
|
|
"step": 16620
|
|
},
|
|
{
|
|
"entropy": 5.456055736541748,
|
|
"epoch": 1.2934837580237308,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0004835369067994971,
|
|
"loss": 5.2352,
|
|
"mean_token_accuracy": 0.1743704691529274,
|
|
"num_tokens": 28845180.0,
|
|
"step": 16625
|
|
},
|
|
{
|
|
"entropy": 5.431114435195923,
|
|
"epoch": 1.2938727873954483,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.000483526498582266,
|
|
"loss": 5.1884,
|
|
"mean_token_accuracy": 0.17326849699020386,
|
|
"num_tokens": 28853903.0,
|
|
"step": 16630
|
|
},
|
|
{
|
|
"entropy": 5.439738845825195,
|
|
"epoch": 1.294261816767166,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00048351608720097715,
|
|
"loss": 5.1893,
|
|
"mean_token_accuracy": 0.18295179605484008,
|
|
"num_tokens": 28863071.0,
|
|
"step": 16635
|
|
},
|
|
{
|
|
"entropy": 5.4979939460754395,
|
|
"epoch": 1.2946508461388835,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.00048350567265578867,
|
|
"loss": 5.29,
|
|
"mean_token_accuracy": 0.16931591480970382,
|
|
"num_tokens": 28871620.0,
|
|
"step": 16640
|
|
},
|
|
{
|
|
"entropy": 5.588835191726685,
|
|
"epoch": 1.295039875510601,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.0004834952549468584,
|
|
"loss": 5.3224,
|
|
"mean_token_accuracy": 0.16981561481952667,
|
|
"num_tokens": 28879940.0,
|
|
"step": 16645
|
|
},
|
|
{
|
|
"entropy": 5.5503458976745605,
|
|
"epoch": 1.2954289048823187,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004834848340743446,
|
|
"loss": 5.3451,
|
|
"mean_token_accuracy": 0.1675911843776703,
|
|
"num_tokens": 28889012.0,
|
|
"step": 16650
|
|
},
|
|
{
|
|
"entropy": 5.528504371643066,
|
|
"epoch": 1.2958179342540361,
|
|
"grad_norm": 1.5625,
|
|
"learning_rate": 0.0004834744100384052,
|
|
"loss": 5.2108,
|
|
"mean_token_accuracy": 0.18337976783514023,
|
|
"num_tokens": 28897312.0,
|
|
"step": 16655
|
|
},
|
|
{
|
|
"entropy": 5.480485582351685,
|
|
"epoch": 1.2962069636257538,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.0004834639828391984,
|
|
"loss": 5.1756,
|
|
"mean_token_accuracy": 0.18273263573646545,
|
|
"num_tokens": 28905977.0,
|
|
"step": 16660
|
|
},
|
|
{
|
|
"entropy": 5.432545614242554,
|
|
"epoch": 1.2965959929974713,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.00048345355247688256,
|
|
"loss": 5.1871,
|
|
"mean_token_accuracy": 0.18038800209760666,
|
|
"num_tokens": 28913979.0,
|
|
"step": 16665
|
|
},
|
|
{
|
|
"entropy": 5.449227523803711,
|
|
"epoch": 1.296985022369189,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 0.0004834431189516158,
|
|
"loss": 5.2121,
|
|
"mean_token_accuracy": 0.1908937469124794,
|
|
"num_tokens": 28922090.0,
|
|
"step": 16670
|
|
},
|
|
{
|
|
"entropy": 5.501261377334595,
|
|
"epoch": 1.2973740517409065,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 0.0004834326822635565,
|
|
"loss": 5.3686,
|
|
"mean_token_accuracy": 0.16585621982812881,
|
|
"num_tokens": 28930816.0,
|
|
"step": 16675
|
|
},
|
|
{
|
|
"entropy": 5.559801197052002,
|
|
"epoch": 1.297763081112624,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.00048342224241286296,
|
|
"loss": 5.2916,
|
|
"mean_token_accuracy": 0.16808870285749436,
|
|
"num_tokens": 28939125.0,
|
|
"step": 16680
|
|
},
|
|
{
|
|
"entropy": 5.4852031707763675,
|
|
"epoch": 1.2981521104843416,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0004834117993996937,
|
|
"loss": 5.1954,
|
|
"mean_token_accuracy": 0.18622385561466218,
|
|
"num_tokens": 28947783.0,
|
|
"step": 16685
|
|
},
|
|
{
|
|
"entropy": 5.578096723556518,
|
|
"epoch": 1.2985411398560591,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0004834013532242071,
|
|
"loss": 5.3244,
|
|
"mean_token_accuracy": 0.17459237426519394,
|
|
"num_tokens": 28957305.0,
|
|
"step": 16690
|
|
},
|
|
{
|
|
"entropy": 5.5729897022247314,
|
|
"epoch": 1.2989301692277766,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0004833909038865616,
|
|
"loss": 5.2813,
|
|
"mean_token_accuracy": 0.15963828712701797,
|
|
"num_tokens": 28965757.0,
|
|
"step": 16695
|
|
},
|
|
{
|
|
"entropy": 5.496206951141358,
|
|
"epoch": 1.2993191985994943,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0004833804513869159,
|
|
"loss": 5.2704,
|
|
"mean_token_accuracy": 0.17117171138525009,
|
|
"num_tokens": 28974846.0,
|
|
"step": 16700
|
|
},
|
|
{
|
|
"entropy": 5.389321279525757,
|
|
"epoch": 1.2997082279712118,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0004833699957254284,
|
|
"loss": 5.111,
|
|
"mean_token_accuracy": 0.17951308637857438,
|
|
"num_tokens": 28984060.0,
|
|
"step": 16705
|
|
},
|
|
{
|
|
"entropy": 5.459994888305664,
|
|
"epoch": 1.3000972573429295,
|
|
"grad_norm": 1.5,
|
|
"learning_rate": 0.000483359536902258,
|
|
"loss": 5.1843,
|
|
"mean_token_accuracy": 0.17581637352705,
|
|
"num_tokens": 28992705.0,
|
|
"step": 16710
|
|
},
|
|
{
|
|
"entropy": 5.500532245635986,
|
|
"epoch": 1.300486286714647,
|
|
"grad_norm": 1.515625,
|
|
"learning_rate": 0.0004833490749175632,
|
|
"loss": 5.2852,
|
|
"mean_token_accuracy": 0.17449826449155809,
|
|
"num_tokens": 29001306.0,
|
|
"step": 16715
|
|
},
|
|
{
|
|
"entropy": 5.46809754371643,
|
|
"epoch": 1.3008753160863646,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.00048333860977150286,
|
|
"loss": 5.3003,
|
|
"mean_token_accuracy": 0.17776818871498107,
|
|
"num_tokens": 29010371.0,
|
|
"step": 16720
|
|
},
|
|
{
|
|
"entropy": 5.530137968063355,
|
|
"epoch": 1.3012643454580821,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.00048332814146423566,
|
|
"loss": 5.2677,
|
|
"mean_token_accuracy": 0.17504500597715378,
|
|
"num_tokens": 29019940.0,
|
|
"step": 16725
|
|
},
|
|
{
|
|
"entropy": 5.583278036117553,
|
|
"epoch": 1.3016533748297996,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.0004833176699959206,
|
|
"loss": 5.2792,
|
|
"mean_token_accuracy": 0.17342123687267302,
|
|
"num_tokens": 29027644.0,
|
|
"step": 16730
|
|
},
|
|
{
|
|
"entropy": 5.451085948944092,
|
|
"epoch": 1.3020424042015173,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.00048330719536671633,
|
|
"loss": 5.2067,
|
|
"mean_token_accuracy": 0.18024676144123078,
|
|
"num_tokens": 29035166.0,
|
|
"step": 16735
|
|
},
|
|
{
|
|
"entropy": 5.395693397521972,
|
|
"epoch": 1.3024314335732348,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.000483296717576782,
|
|
"loss": 5.1815,
|
|
"mean_token_accuracy": 0.1790855422616005,
|
|
"num_tokens": 29044539.0,
|
|
"step": 16740
|
|
},
|
|
{
|
|
"entropy": 5.52463812828064,
|
|
"epoch": 1.3028204629449522,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0004832862366262765,
|
|
"loss": 5.2404,
|
|
"mean_token_accuracy": 0.18767423778772355,
|
|
"num_tokens": 29052849.0,
|
|
"step": 16745
|
|
},
|
|
{
|
|
"entropy": 5.472813987731934,
|
|
"epoch": 1.30320949231667,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.00048327575251535886,
|
|
"loss": 5.2439,
|
|
"mean_token_accuracy": 0.17264259606599808,
|
|
"num_tokens": 29061881.0,
|
|
"step": 16750
|
|
},
|
|
{
|
|
"entropy": 5.577336931228638,
|
|
"epoch": 1.3035985216883874,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0004832652652441883,
|
|
"loss": 5.2969,
|
|
"mean_token_accuracy": 0.16959179937839508,
|
|
"num_tokens": 29070460.0,
|
|
"step": 16755
|
|
},
|
|
{
|
|
"entropy": 5.557647705078125,
|
|
"epoch": 1.303987551060105,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.00048325477481292375,
|
|
"loss": 5.3116,
|
|
"mean_token_accuracy": 0.16884099692106247,
|
|
"num_tokens": 29079061.0,
|
|
"step": 16760
|
|
},
|
|
{
|
|
"entropy": 5.475124073028565,
|
|
"epoch": 1.3043765804318226,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0004832442812217244,
|
|
"loss": 5.2214,
|
|
"mean_token_accuracy": 0.17832874208688737,
|
|
"num_tokens": 29087525.0,
|
|
"step": 16765
|
|
},
|
|
{
|
|
"entropy": 5.473687934875488,
|
|
"epoch": 1.3047656098035403,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0004832337844707496,
|
|
"loss": 5.1618,
|
|
"mean_token_accuracy": 0.1824201300740242,
|
|
"num_tokens": 29096206.0,
|
|
"step": 16770
|
|
},
|
|
{
|
|
"entropy": 5.517829084396363,
|
|
"epoch": 1.3051546391752578,
|
|
"grad_norm": 1.5,
|
|
"learning_rate": 0.00048322328456015855,
|
|
"loss": 5.3688,
|
|
"mean_token_accuracy": 0.1709981992840767,
|
|
"num_tokens": 29105025.0,
|
|
"step": 16775
|
|
},
|
|
{
|
|
"entropy": 5.4974733829498295,
|
|
"epoch": 1.3055436685469752,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.00048321278149011053,
|
|
"loss": 5.3236,
|
|
"mean_token_accuracy": 0.1700569808483124,
|
|
"num_tokens": 29113468.0,
|
|
"step": 16780
|
|
},
|
|
{
|
|
"entropy": 5.488374662399292,
|
|
"epoch": 1.305932697918693,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.00048320227526076504,
|
|
"loss": 5.2442,
|
|
"mean_token_accuracy": 0.17641721665859222,
|
|
"num_tokens": 29122904.0,
|
|
"step": 16785
|
|
},
|
|
{
|
|
"entropy": 5.531284761428833,
|
|
"epoch": 1.3063217272904104,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.0004831917658722814,
|
|
"loss": 5.2309,
|
|
"mean_token_accuracy": 0.1841050699353218,
|
|
"num_tokens": 29132408.0,
|
|
"step": 16790
|
|
},
|
|
{
|
|
"entropy": 5.547504520416259,
|
|
"epoch": 1.3067107566621279,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.00048318125332481903,
|
|
"loss": 5.3717,
|
|
"mean_token_accuracy": 0.1684241771697998,
|
|
"num_tokens": 29141840.0,
|
|
"step": 16795
|
|
},
|
|
{
|
|
"entropy": 5.631039667129516,
|
|
"epoch": 1.3070997860338456,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.00048317073761853764,
|
|
"loss": 5.3246,
|
|
"mean_token_accuracy": 0.17543092966079712,
|
|
"num_tokens": 29150759.0,
|
|
"step": 16800
|
|
},
|
|
{
|
|
"entropy": 5.477938604354859,
|
|
"epoch": 1.307488815405563,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0004831602187535965,
|
|
"loss": 5.1482,
|
|
"mean_token_accuracy": 0.18028225898742675,
|
|
"num_tokens": 29159489.0,
|
|
"step": 16805
|
|
},
|
|
{
|
|
"entropy": 5.462970781326294,
|
|
"epoch": 1.3078778447772808,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0004831496967301554,
|
|
"loss": 5.1699,
|
|
"mean_token_accuracy": 0.18005609065294265,
|
|
"num_tokens": 29168160.0,
|
|
"step": 16810
|
|
},
|
|
{
|
|
"entropy": 5.524637889862061,
|
|
"epoch": 1.3082668741489982,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.00048313917154837386,
|
|
"loss": 5.2609,
|
|
"mean_token_accuracy": 0.17554370760917665,
|
|
"num_tokens": 29176534.0,
|
|
"step": 16815
|
|
},
|
|
{
|
|
"entropy": 5.41055212020874,
|
|
"epoch": 1.308655903520716,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0004831286432084118,
|
|
"loss": 5.1483,
|
|
"mean_token_accuracy": 0.1828785553574562,
|
|
"num_tokens": 29185461.0,
|
|
"step": 16820
|
|
},
|
|
{
|
|
"entropy": 5.5248425006866455,
|
|
"epoch": 1.3090449328924334,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.0004831181117104289,
|
|
"loss": 5.298,
|
|
"mean_token_accuracy": 0.1726389080286026,
|
|
"num_tokens": 29194218.0,
|
|
"step": 16825
|
|
},
|
|
{
|
|
"entropy": 5.472246217727661,
|
|
"epoch": 1.3094339622641509,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.00048310757705458476,
|
|
"loss": 5.2496,
|
|
"mean_token_accuracy": 0.1761614888906479,
|
|
"num_tokens": 29203720.0,
|
|
"step": 16830
|
|
},
|
|
{
|
|
"entropy": 5.529952335357666,
|
|
"epoch": 1.3098229916358686,
|
|
"grad_norm": 1.546875,
|
|
"learning_rate": 0.00048309703924103944,
|
|
"loss": 5.3283,
|
|
"mean_token_accuracy": 0.17252070903778077,
|
|
"num_tokens": 29212588.0,
|
|
"step": 16835
|
|
},
|
|
{
|
|
"entropy": 5.573881196975708,
|
|
"epoch": 1.310212021007586,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 0.00048308649826995283,
|
|
"loss": 5.3094,
|
|
"mean_token_accuracy": 0.17612760066986083,
|
|
"num_tokens": 29220718.0,
|
|
"step": 16840
|
|
},
|
|
{
|
|
"entropy": 5.515702819824218,
|
|
"epoch": 1.3106010503793035,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.00048307595414148475,
|
|
"loss": 5.1825,
|
|
"mean_token_accuracy": 0.18570471405982972,
|
|
"num_tokens": 29229386.0,
|
|
"step": 16845
|
|
},
|
|
{
|
|
"entropy": 5.45784854888916,
|
|
"epoch": 1.3109900797510212,
|
|
"grad_norm": 1.6796875,
|
|
"learning_rate": 0.0004830654068557952,
|
|
"loss": 5.2474,
|
|
"mean_token_accuracy": 0.17849715799093246,
|
|
"num_tokens": 29238390.0,
|
|
"step": 16850
|
|
},
|
|
{
|
|
"entropy": 5.502755546569825,
|
|
"epoch": 1.3113791091227387,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.0004830548564130444,
|
|
"loss": 5.3183,
|
|
"mean_token_accuracy": 0.17546208202838898,
|
|
"num_tokens": 29246502.0,
|
|
"step": 16855
|
|
},
|
|
{
|
|
"entropy": 5.487176847457886,
|
|
"epoch": 1.3117681384944564,
|
|
"grad_norm": 1.6484375,
|
|
"learning_rate": 0.00048304430281339216,
|
|
"loss": 5.2517,
|
|
"mean_token_accuracy": 0.17074074447155,
|
|
"num_tokens": 29254954.0,
|
|
"step": 16860
|
|
},
|
|
{
|
|
"entropy": 5.522469997406006,
|
|
"epoch": 1.3121571678661739,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0004830337460569989,
|
|
"loss": 5.2142,
|
|
"mean_token_accuracy": 0.18119794875383377,
|
|
"num_tokens": 29263294.0,
|
|
"step": 16865
|
|
},
|
|
{
|
|
"entropy": 5.430172443389893,
|
|
"epoch": 1.3125461972378916,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0004830231861440246,
|
|
"loss": 5.1918,
|
|
"mean_token_accuracy": 0.1767362102866173,
|
|
"num_tokens": 29271737.0,
|
|
"step": 16870
|
|
},
|
|
{
|
|
"entropy": 5.509420442581177,
|
|
"epoch": 1.312935226609609,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0004830126230746295,
|
|
"loss": 5.3367,
|
|
"mean_token_accuracy": 0.1693131923675537,
|
|
"num_tokens": 29279473.0,
|
|
"step": 16875
|
|
},
|
|
{
|
|
"entropy": 5.4937409400939945,
|
|
"epoch": 1.3133242559813265,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.00048300205684897405,
|
|
"loss": 5.2371,
|
|
"mean_token_accuracy": 0.1878308191895485,
|
|
"num_tokens": 29287650.0,
|
|
"step": 16880
|
|
},
|
|
{
|
|
"entropy": 5.475452947616577,
|
|
"epoch": 1.3137132853530442,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004829914874672184,
|
|
"loss": 5.2748,
|
|
"mean_token_accuracy": 0.17647088021039964,
|
|
"num_tokens": 29296914.0,
|
|
"step": 16885
|
|
},
|
|
{
|
|
"entropy": 5.525088882446289,
|
|
"epoch": 1.3141023147247617,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.00048298091492952297,
|
|
"loss": 5.2755,
|
|
"mean_token_accuracy": 0.17729541063308715,
|
|
"num_tokens": 29305409.0,
|
|
"step": 16890
|
|
},
|
|
{
|
|
"entropy": 5.547475957870484,
|
|
"epoch": 1.3144913440964792,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0004829703392360482,
|
|
"loss": 5.2906,
|
|
"mean_token_accuracy": 0.17043836116790773,
|
|
"num_tokens": 29314333.0,
|
|
"step": 16895
|
|
},
|
|
{
|
|
"entropy": 5.458041954040527,
|
|
"epoch": 1.3148803734681969,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.00048295976038695455,
|
|
"loss": 5.144,
|
|
"mean_token_accuracy": 0.18503309190273284,
|
|
"num_tokens": 29323764.0,
|
|
"step": 16900
|
|
},
|
|
{
|
|
"entropy": 5.447067642211914,
|
|
"epoch": 1.3152694028399143,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.0004829491783824025,
|
|
"loss": 5.1986,
|
|
"mean_token_accuracy": 0.18337195813655854,
|
|
"num_tokens": 29331734.0,
|
|
"step": 16905
|
|
},
|
|
{
|
|
"entropy": 5.364851999282837,
|
|
"epoch": 1.315658432211632,
|
|
"grad_norm": 1.4921875,
|
|
"learning_rate": 0.00048293859322255276,
|
|
"loss": 5.1471,
|
|
"mean_token_accuracy": 0.18833026587963103,
|
|
"num_tokens": 29339791.0,
|
|
"step": 16910
|
|
},
|
|
{
|
|
"entropy": 5.44777774810791,
|
|
"epoch": 1.3160474615833495,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0004829280049075657,
|
|
"loss": 5.2712,
|
|
"mean_token_accuracy": 0.17197880297899246,
|
|
"num_tokens": 29348548.0,
|
|
"step": 16915
|
|
},
|
|
{
|
|
"entropy": 5.531647062301635,
|
|
"epoch": 1.3164364909550672,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.00048291741343760216,
|
|
"loss": 5.198,
|
|
"mean_token_accuracy": 0.17299035787582398,
|
|
"num_tokens": 29357151.0,
|
|
"step": 16920
|
|
},
|
|
{
|
|
"entropy": 5.525174760818482,
|
|
"epoch": 1.3168255203267847,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.0004829068188128229,
|
|
"loss": 5.1907,
|
|
"mean_token_accuracy": 0.18366375863552092,
|
|
"num_tokens": 29365643.0,
|
|
"step": 16925
|
|
},
|
|
{
|
|
"entropy": 5.447732543945312,
|
|
"epoch": 1.3172145496985022,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 0.0004828962210333885,
|
|
"loss": 5.2883,
|
|
"mean_token_accuracy": 0.1729740783572197,
|
|
"num_tokens": 29374215.0,
|
|
"step": 16930
|
|
},
|
|
{
|
|
"entropy": 5.491642665863037,
|
|
"epoch": 1.3176035790702199,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0004828856200994598,
|
|
"loss": 5.1909,
|
|
"mean_token_accuracy": 0.1799288272857666,
|
|
"num_tokens": 29382586.0,
|
|
"step": 16935
|
|
},
|
|
{
|
|
"entropy": 5.393301010131836,
|
|
"epoch": 1.3179926084419373,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.0004828750160111978,
|
|
"loss": 5.238,
|
|
"mean_token_accuracy": 0.1726415276527405,
|
|
"num_tokens": 29391922.0,
|
|
"step": 16940
|
|
},
|
|
{
|
|
"entropy": 5.473742294311523,
|
|
"epoch": 1.3183816378136548,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.00048286440876876325,
|
|
"loss": 5.2035,
|
|
"mean_token_accuracy": 0.17527247071266175,
|
|
"num_tokens": 29400408.0,
|
|
"step": 16945
|
|
},
|
|
{
|
|
"entropy": 5.463558006286621,
|
|
"epoch": 1.3187706671853725,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 0.00048285379837231714,
|
|
"loss": 5.1291,
|
|
"mean_token_accuracy": 0.19060914665460588,
|
|
"num_tokens": 29408130.0,
|
|
"step": 16950
|
|
},
|
|
{
|
|
"entropy": 5.497085952758789,
|
|
"epoch": 1.31915969655709,
|
|
"grad_norm": 1.625,
|
|
"learning_rate": 0.0004828431848220205,
|
|
"loss": 5.2189,
|
|
"mean_token_accuracy": 0.17894755005836488,
|
|
"num_tokens": 29417446.0,
|
|
"step": 16955
|
|
},
|
|
{
|
|
"entropy": 5.496921873092651,
|
|
"epoch": 1.3195487259288077,
|
|
"grad_norm": 1.5234375,
|
|
"learning_rate": 0.0004828325681180343,
|
|
"loss": 5.3049,
|
|
"mean_token_accuracy": 0.17422318309545518,
|
|
"num_tokens": 29426023.0,
|
|
"step": 16960
|
|
},
|
|
{
|
|
"entropy": 5.518601751327514,
|
|
"epoch": 1.3199377553005252,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0004828219482605197,
|
|
"loss": 5.2167,
|
|
"mean_token_accuracy": 0.1839369311928749,
|
|
"num_tokens": 29434737.0,
|
|
"step": 16965
|
|
},
|
|
{
|
|
"entropy": 5.405993127822876,
|
|
"epoch": 1.3203267846722428,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.00048281132524963786,
|
|
"loss": 5.2431,
|
|
"mean_token_accuracy": 0.170933099091053,
|
|
"num_tokens": 29443926.0,
|
|
"step": 16970
|
|
},
|
|
{
|
|
"entropy": 5.472154998779297,
|
|
"epoch": 1.3207158140439603,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.0004828006990855499,
|
|
"loss": 5.2196,
|
|
"mean_token_accuracy": 0.1806778609752655,
|
|
"num_tokens": 29452495.0,
|
|
"step": 16975
|
|
},
|
|
{
|
|
"entropy": 5.4757812976837155,
|
|
"epoch": 1.3211048434156778,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.00048279006976841704,
|
|
"loss": 5.1778,
|
|
"mean_token_accuracy": 0.17714895009994508,
|
|
"num_tokens": 29460661.0,
|
|
"step": 16980
|
|
},
|
|
{
|
|
"entropy": 5.467296314239502,
|
|
"epoch": 1.3214938727873955,
|
|
"grad_norm": 1.4921875,
|
|
"learning_rate": 0.0004827794372984007,
|
|
"loss": 5.1791,
|
|
"mean_token_accuracy": 0.18186292797327042,
|
|
"num_tokens": 29469155.0,
|
|
"step": 16985
|
|
},
|
|
{
|
|
"entropy": 5.455309343338013,
|
|
"epoch": 1.321882902159113,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.000482768801675662,
|
|
"loss": 5.2909,
|
|
"mean_token_accuracy": 0.18031759858131408,
|
|
"num_tokens": 29478220.0,
|
|
"step": 16990
|
|
},
|
|
{
|
|
"entropy": 5.469020414352417,
|
|
"epoch": 1.3222719315308304,
|
|
"grad_norm": 1.609375,
|
|
"learning_rate": 0.0004827581629003625,
|
|
"loss": 5.2544,
|
|
"mean_token_accuracy": 0.17651599794626235,
|
|
"num_tokens": 29486336.0,
|
|
"step": 16995
|
|
},
|
|
{
|
|
"entropy": 5.531178092956543,
|
|
"epoch": 1.3226609609025481,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 0.00048274752097266356,
|
|
"loss": 5.3434,
|
|
"mean_token_accuracy": 0.17201607823371887,
|
|
"num_tokens": 29495150.0,
|
|
"step": 17000
|
|
},
|
|
{
|
|
"entropy": 5.506674718856812,
|
|
"epoch": 1.3230499902742658,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.0004827368758927266,
|
|
"loss": 5.2367,
|
|
"mean_token_accuracy": 0.17920218259096146,
|
|
"num_tokens": 29503508.0,
|
|
"step": 17005
|
|
},
|
|
{
|
|
"entropy": 5.479684066772461,
|
|
"epoch": 1.3234390196459833,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0004827262276607132,
|
|
"loss": 5.2407,
|
|
"mean_token_accuracy": 0.17378330379724502,
|
|
"num_tokens": 29513038.0,
|
|
"step": 17010
|
|
},
|
|
{
|
|
"entropy": 5.452485704421997,
|
|
"epoch": 1.3238280490177008,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.000482715576276785,
|
|
"loss": 5.1666,
|
|
"mean_token_accuracy": 0.18325186520814896,
|
|
"num_tokens": 29521344.0,
|
|
"step": 17015
|
|
},
|
|
{
|
|
"entropy": 5.51010799407959,
|
|
"epoch": 1.3242170783894185,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004827049217411035,
|
|
"loss": 5.2967,
|
|
"mean_token_accuracy": 0.1695142060518265,
|
|
"num_tokens": 29530109.0,
|
|
"step": 17020
|
|
},
|
|
{
|
|
"entropy": 5.529137706756591,
|
|
"epoch": 1.324606107761136,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.00048269426405383043,
|
|
"loss": 5.2289,
|
|
"mean_token_accuracy": 0.16018726527690888,
|
|
"num_tokens": 29539114.0,
|
|
"step": 17025
|
|
},
|
|
{
|
|
"entropy": 5.5423665046691895,
|
|
"epoch": 1.3249951371328534,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.00048268360321512745,
|
|
"loss": 5.2785,
|
|
"mean_token_accuracy": 0.17455030232667923,
|
|
"num_tokens": 29548746.0,
|
|
"step": 17030
|
|
},
|
|
{
|
|
"entropy": 5.507274627685547,
|
|
"epoch": 1.3253841665045711,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0004826729392251564,
|
|
"loss": 5.3341,
|
|
"mean_token_accuracy": 0.17177271097898483,
|
|
"num_tokens": 29557681.0,
|
|
"step": 17035
|
|
},
|
|
{
|
|
"entropy": 5.533541107177735,
|
|
"epoch": 1.3257731958762886,
|
|
"grad_norm": 1.515625,
|
|
"learning_rate": 0.000482662272084079,
|
|
"loss": 5.28,
|
|
"mean_token_accuracy": 0.1755232259631157,
|
|
"num_tokens": 29566151.0,
|
|
"step": 17040
|
|
},
|
|
{
|
|
"entropy": 5.482423257827759,
|
|
"epoch": 1.326162225248006,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.0004826516017920571,
|
|
"loss": 5.0905,
|
|
"mean_token_accuracy": 0.19454223066568374,
|
|
"num_tokens": 29574853.0,
|
|
"step": 17045
|
|
},
|
|
{
|
|
"entropy": 5.41596531867981,
|
|
"epoch": 1.3265512546197238,
|
|
"grad_norm": 1.5703125,
|
|
"learning_rate": 0.0004826409283492528,
|
|
"loss": 5.206,
|
|
"mean_token_accuracy": 0.17888752669095992,
|
|
"num_tokens": 29583319.0,
|
|
"step": 17050
|
|
},
|
|
{
|
|
"entropy": 5.495956087112427,
|
|
"epoch": 1.3269402839914415,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.00048263025175582783,
|
|
"loss": 5.3125,
|
|
"mean_token_accuracy": 0.17151685208082199,
|
|
"num_tokens": 29591949.0,
|
|
"step": 17055
|
|
},
|
|
{
|
|
"entropy": 5.560805988311768,
|
|
"epoch": 1.327329313363159,
|
|
"grad_norm": 1.5,
|
|
"learning_rate": 0.0004826195720119442,
|
|
"loss": 5.3109,
|
|
"mean_token_accuracy": 0.16976340115070343,
|
|
"num_tokens": 29600293.0,
|
|
"step": 17060
|
|
},
|
|
{
|
|
"entropy": 5.54003872871399,
|
|
"epoch": 1.3277183427348764,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.0004826088891177641,
|
|
"loss": 5.3233,
|
|
"mean_token_accuracy": 0.17604486346244813,
|
|
"num_tokens": 29608602.0,
|
|
"step": 17065
|
|
},
|
|
{
|
|
"entropy": 5.453752708435059,
|
|
"epoch": 1.3281073721065941,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.00048259820307344954,
|
|
"loss": 5.2766,
|
|
"mean_token_accuracy": 0.1759918823838234,
|
|
"num_tokens": 29617464.0,
|
|
"step": 17070
|
|
},
|
|
{
|
|
"entropy": 5.48290786743164,
|
|
"epoch": 1.3284964014783116,
|
|
"grad_norm": 1.7734375,
|
|
"learning_rate": 0.00048258751387916267,
|
|
"loss": 5.1938,
|
|
"mean_token_accuracy": 0.18529756516218185,
|
|
"num_tokens": 29626297.0,
|
|
"step": 17075
|
|
},
|
|
{
|
|
"entropy": 5.4328789710998535,
|
|
"epoch": 1.328885430850029,
|
|
"grad_norm": 1.578125,
|
|
"learning_rate": 0.00048257682153506564,
|
|
"loss": 5.2243,
|
|
"mean_token_accuracy": 0.17499957382678985,
|
|
"num_tokens": 29635085.0,
|
|
"step": 17080
|
|
},
|
|
{
|
|
"entropy": 5.509983491897583,
|
|
"epoch": 1.3292744602217468,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.0004825661260413208,
|
|
"loss": 5.2006,
|
|
"mean_token_accuracy": 0.17917946875095367,
|
|
"num_tokens": 29643528.0,
|
|
"step": 17085
|
|
},
|
|
{
|
|
"entropy": 5.470966720581055,
|
|
"epoch": 1.3296634895934643,
|
|
"grad_norm": 1.75,
|
|
"learning_rate": 0.00048255542739809035,
|
|
"loss": 5.2415,
|
|
"mean_token_accuracy": 0.17621973752975464,
|
|
"num_tokens": 29651883.0,
|
|
"step": 17090
|
|
},
|
|
{
|
|
"entropy": 5.422865629196167,
|
|
"epoch": 1.330052518965182,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.00048254472560553665,
|
|
"loss": 5.2515,
|
|
"mean_token_accuracy": 0.1758228987455368,
|
|
"num_tokens": 29661092.0,
|
|
"step": 17095
|
|
},
|
|
{
|
|
"entropy": 5.567375946044922,
|
|
"epoch": 1.3304415483368994,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.00048253402066382207,
|
|
"loss": 5.2779,
|
|
"mean_token_accuracy": 0.1792393982410431,
|
|
"num_tokens": 29670285.0,
|
|
"step": 17100
|
|
},
|
|
{
|
|
"entropy": 5.5675395965576175,
|
|
"epoch": 1.3308305777086171,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 0.0004825233125731091,
|
|
"loss": 5.3445,
|
|
"mean_token_accuracy": 0.17455863058567048,
|
|
"num_tokens": 29679249.0,
|
|
"step": 17105
|
|
},
|
|
{
|
|
"entropy": 5.484007263183594,
|
|
"epoch": 1.3312196070803346,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 0.00048251260133356014,
|
|
"loss": 5.2958,
|
|
"mean_token_accuracy": 0.1721057265996933,
|
|
"num_tokens": 29687978.0,
|
|
"step": 17110
|
|
},
|
|
{
|
|
"entropy": 5.509602689743042,
|
|
"epoch": 1.331608636452052,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.00048250188694533774,
|
|
"loss": 5.3039,
|
|
"mean_token_accuracy": 0.176420596241951,
|
|
"num_tokens": 29695972.0,
|
|
"step": 17115
|
|
},
|
|
{
|
|
"entropy": 5.492380905151367,
|
|
"epoch": 1.3319976658237698,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0004824911694086044,
|
|
"loss": 5.1582,
|
|
"mean_token_accuracy": 0.1750987023115158,
|
|
"num_tokens": 29704997.0,
|
|
"step": 17120
|
|
},
|
|
{
|
|
"entropy": 5.601944208145142,
|
|
"epoch": 1.3323866951954872,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.000482480448723523,
|
|
"loss": 5.3951,
|
|
"mean_token_accuracy": 0.174538516998291,
|
|
"num_tokens": 29713957.0,
|
|
"step": 17125
|
|
},
|
|
{
|
|
"entropy": 5.492581176757812,
|
|
"epoch": 1.3327757245672047,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.00048246972489025586,
|
|
"loss": 5.2683,
|
|
"mean_token_accuracy": 0.17820209860801697,
|
|
"num_tokens": 29721989.0,
|
|
"step": 17130
|
|
},
|
|
{
|
|
"entropy": 5.447675037384033,
|
|
"epoch": 1.3331647539389224,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.00048245899790896597,
|
|
"loss": 5.2001,
|
|
"mean_token_accuracy": 0.18251659274101256,
|
|
"num_tokens": 29730032.0,
|
|
"step": 17135
|
|
},
|
|
{
|
|
"entropy": 5.455309867858887,
|
|
"epoch": 1.33355378331064,
|
|
"grad_norm": 1.6015625,
|
|
"learning_rate": 0.0004824482677798159,
|
|
"loss": 5.209,
|
|
"mean_token_accuracy": 0.177140474319458,
|
|
"num_tokens": 29738545.0,
|
|
"step": 17140
|
|
},
|
|
{
|
|
"entropy": 5.534008502960205,
|
|
"epoch": 1.3339428126823576,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.00048243753450296863,
|
|
"loss": 5.2481,
|
|
"mean_token_accuracy": 0.17813731133937835,
|
|
"num_tokens": 29747371.0,
|
|
"step": 17145
|
|
},
|
|
{
|
|
"entropy": 5.4993507862091064,
|
|
"epoch": 1.334331842054075,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.00048242679807858693,
|
|
"loss": 5.1761,
|
|
"mean_token_accuracy": 0.1823880136013031,
|
|
"num_tokens": 29756565.0,
|
|
"step": 17150
|
|
},
|
|
{
|
|
"entropy": 5.455775499343872,
|
|
"epoch": 1.3347208714257928,
|
|
"grad_norm": 1.5703125,
|
|
"learning_rate": 0.00048241605850683365,
|
|
"loss": 5.1844,
|
|
"mean_token_accuracy": 0.18443227112293242,
|
|
"num_tokens": 29765846.0,
|
|
"step": 17155
|
|
},
|
|
{
|
|
"entropy": 5.425571537017822,
|
|
"epoch": 1.3351099007975102,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.00048240531578787197,
|
|
"loss": 5.2104,
|
|
"mean_token_accuracy": 0.1823340430855751,
|
|
"num_tokens": 29774222.0,
|
|
"step": 17160
|
|
},
|
|
{
|
|
"entropy": 5.419958257675171,
|
|
"epoch": 1.3354989301692277,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 0.0004823945699218647,
|
|
"loss": 5.1196,
|
|
"mean_token_accuracy": 0.1917722389101982,
|
|
"num_tokens": 29782366.0,
|
|
"step": 17165
|
|
},
|
|
{
|
|
"entropy": 5.529707241058349,
|
|
"epoch": 1.3358879595409454,
|
|
"grad_norm": 1.625,
|
|
"learning_rate": 0.0004823838209089749,
|
|
"loss": 5.3201,
|
|
"mean_token_accuracy": 0.17108533382415772,
|
|
"num_tokens": 29792147.0,
|
|
"step": 17170
|
|
},
|
|
{
|
|
"entropy": 5.48813214302063,
|
|
"epoch": 1.3362769889126629,
|
|
"grad_norm": 1.5234375,
|
|
"learning_rate": 0.00048237306874936565,
|
|
"loss": 5.242,
|
|
"mean_token_accuracy": 0.17615937292575837,
|
|
"num_tokens": 29801325.0,
|
|
"step": 17175
|
|
},
|
|
{
|
|
"entropy": 5.4469012260437015,
|
|
"epoch": 1.3366660182843804,
|
|
"grad_norm": 1.703125,
|
|
"learning_rate": 0.0004823623134432001,
|
|
"loss": 5.1821,
|
|
"mean_token_accuracy": 0.18040625602006913,
|
|
"num_tokens": 29809353.0,
|
|
"step": 17180
|
|
},
|
|
{
|
|
"entropy": 5.469843626022339,
|
|
"epoch": 1.337055047656098,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.00048235155499064166,
|
|
"loss": 5.2465,
|
|
"mean_token_accuracy": 0.1800548404455185,
|
|
"num_tokens": 29817746.0,
|
|
"step": 17185
|
|
},
|
|
{
|
|
"entropy": 5.489180850982666,
|
|
"epoch": 1.3374440770278155,
|
|
"grad_norm": 1.703125,
|
|
"learning_rate": 0.00048234079339185335,
|
|
"loss": 5.2582,
|
|
"mean_token_accuracy": 0.17191974818706512,
|
|
"num_tokens": 29826468.0,
|
|
"step": 17190
|
|
},
|
|
{
|
|
"entropy": 5.519423341751098,
|
|
"epoch": 1.3378331063995332,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.00048233002864699856,
|
|
"loss": 5.3372,
|
|
"mean_token_accuracy": 0.16889057010412217,
|
|
"num_tokens": 29835051.0,
|
|
"step": 17195
|
|
},
|
|
{
|
|
"entropy": 5.480764722824096,
|
|
"epoch": 1.3382221357712507,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.0004823192607562405,
|
|
"loss": 5.2196,
|
|
"mean_token_accuracy": 0.17624942809343339,
|
|
"num_tokens": 29843514.0,
|
|
"step": 17200
|
|
},
|
|
{
|
|
"entropy": 5.501816511154175,
|
|
"epoch": 1.3386111651429684,
|
|
"grad_norm": 1.7890625,
|
|
"learning_rate": 0.00048230848971974265,
|
|
"loss": 5.1551,
|
|
"mean_token_accuracy": 0.1773585245013237,
|
|
"num_tokens": 29851861.0,
|
|
"step": 17205
|
|
},
|
|
{
|
|
"entropy": 5.433729887008667,
|
|
"epoch": 1.3390001945146859,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.0004822977155376684,
|
|
"loss": 5.1521,
|
|
"mean_token_accuracy": 0.18054487854242324,
|
|
"num_tokens": 29860639.0,
|
|
"step": 17210
|
|
},
|
|
{
|
|
"entropy": 5.438904619216919,
|
|
"epoch": 1.3393892238864034,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.0004822869382101814,
|
|
"loss": 5.3722,
|
|
"mean_token_accuracy": 0.16856206059455872,
|
|
"num_tokens": 29869931.0,
|
|
"step": 17215
|
|
},
|
|
{
|
|
"entropy": 5.511276483535767,
|
|
"epoch": 1.339778253258121,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.0004822761577374449,
|
|
"loss": 5.271,
|
|
"mean_token_accuracy": 0.17683886140584945,
|
|
"num_tokens": 29878933.0,
|
|
"step": 17220
|
|
},
|
|
{
|
|
"entropy": 5.514138698577881,
|
|
"epoch": 1.3401672826298385,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0004822653741196227,
|
|
"loss": 5.2485,
|
|
"mean_token_accuracy": 0.17719458937644958,
|
|
"num_tokens": 29888031.0,
|
|
"step": 17225
|
|
},
|
|
{
|
|
"entropy": 5.462238740921021,
|
|
"epoch": 1.340556312001556,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.0004822545873568783,
|
|
"loss": 5.1866,
|
|
"mean_token_accuracy": 0.17841969430446625,
|
|
"num_tokens": 29896792.0,
|
|
"step": 17230
|
|
},
|
|
{
|
|
"entropy": 5.450891542434692,
|
|
"epoch": 1.3409453413732737,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.00048224379744937545,
|
|
"loss": 5.192,
|
|
"mean_token_accuracy": 0.17688935846090317,
|
|
"num_tokens": 29905185.0,
|
|
"step": 17235
|
|
},
|
|
{
|
|
"entropy": 5.472045183181763,
|
|
"epoch": 1.3413343707449912,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.00048223300439727783,
|
|
"loss": 5.3136,
|
|
"mean_token_accuracy": 0.16861119717359543,
|
|
"num_tokens": 29913289.0,
|
|
"step": 17240
|
|
},
|
|
{
|
|
"entropy": 5.442542505264282,
|
|
"epoch": 1.3417234001167089,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00048222220820074926,
|
|
"loss": 5.2646,
|
|
"mean_token_accuracy": 0.17920224219560624,
|
|
"num_tokens": 29922112.0,
|
|
"step": 17245
|
|
},
|
|
{
|
|
"entropy": 5.528877401351929,
|
|
"epoch": 1.3421124294884264,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 0.00048221140885995346,
|
|
"loss": 5.2524,
|
|
"mean_token_accuracy": 0.17331501841545105,
|
|
"num_tokens": 29930944.0,
|
|
"step": 17250
|
|
},
|
|
{
|
|
"entropy": 5.549095249176025,
|
|
"epoch": 1.342501458860144,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.0004822006063750543,
|
|
"loss": 5.3584,
|
|
"mean_token_accuracy": 0.17036155313253404,
|
|
"num_tokens": 29938576.0,
|
|
"step": 17255
|
|
},
|
|
{
|
|
"entropy": 5.448603391647339,
|
|
"epoch": 1.3428904882318615,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.00048218980074621575,
|
|
"loss": 5.2236,
|
|
"mean_token_accuracy": 0.17743732482194902,
|
|
"num_tokens": 29946771.0,
|
|
"step": 17260
|
|
},
|
|
{
|
|
"entropy": 5.579141473770141,
|
|
"epoch": 1.343279517603579,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.00048217899197360183,
|
|
"loss": 5.2562,
|
|
"mean_token_accuracy": 0.17793361842632294,
|
|
"num_tokens": 29955098.0,
|
|
"step": 17265
|
|
},
|
|
{
|
|
"entropy": 5.464924955368042,
|
|
"epoch": 1.3436685469752967,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0004821681800573764,
|
|
"loss": 5.2572,
|
|
"mean_token_accuracy": 0.17426925748586655,
|
|
"num_tokens": 29964538.0,
|
|
"step": 17270
|
|
},
|
|
{
|
|
"entropy": 5.451232242584228,
|
|
"epoch": 1.3440575763470142,
|
|
"grad_norm": 1.546875,
|
|
"learning_rate": 0.0004821573649977036,
|
|
"loss": 5.2063,
|
|
"mean_token_accuracy": 0.1761238917708397,
|
|
"num_tokens": 29973965.0,
|
|
"step": 17275
|
|
},
|
|
{
|
|
"entropy": 5.441684627532959,
|
|
"epoch": 1.3444466057187316,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.00048214654679474753,
|
|
"loss": 5.122,
|
|
"mean_token_accuracy": 0.18359608203172684,
|
|
"num_tokens": 29982742.0,
|
|
"step": 17280
|
|
},
|
|
{
|
|
"entropy": 5.406542730331421,
|
|
"epoch": 1.3448356350904493,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.00048213572544867224,
|
|
"loss": 5.188,
|
|
"mean_token_accuracy": 0.17772355824708938,
|
|
"num_tokens": 29991846.0,
|
|
"step": 17285
|
|
},
|
|
{
|
|
"entropy": 5.5150475025177,
|
|
"epoch": 1.3452246644621668,
|
|
"grad_norm": 1.4921875,
|
|
"learning_rate": 0.00048212490095964213,
|
|
"loss": 5.1376,
|
|
"mean_token_accuracy": 0.1873519465327263,
|
|
"num_tokens": 29999784.0,
|
|
"step": 17290
|
|
},
|
|
{
|
|
"entropy": 5.4866142749786375,
|
|
"epoch": 1.3456136938338845,
|
|
"grad_norm": 1.53125,
|
|
"learning_rate": 0.0004821140733278212,
|
|
"loss": 5.2896,
|
|
"mean_token_accuracy": 0.1761855497956276,
|
|
"num_tokens": 30008139.0,
|
|
"step": 17295
|
|
},
|
|
{
|
|
"entropy": 5.485325193405151,
|
|
"epoch": 1.346002723205602,
|
|
"grad_norm": 1.7421875,
|
|
"learning_rate": 0.0004821032425533739,
|
|
"loss": 5.2889,
|
|
"mean_token_accuracy": 0.173797370493412,
|
|
"num_tokens": 30016891.0,
|
|
"step": 17300
|
|
},
|
|
{
|
|
"entropy": 5.498318719863891,
|
|
"epoch": 1.3463917525773197,
|
|
"grad_norm": 1.5,
|
|
"learning_rate": 0.0004820924086364646,
|
|
"loss": 5.2158,
|
|
"mean_token_accuracy": 0.17879442870616913,
|
|
"num_tokens": 30025472.0,
|
|
"step": 17305
|
|
},
|
|
{
|
|
"entropy": 5.560962200164795,
|
|
"epoch": 1.3467807819490372,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.00048208157157725756,
|
|
"loss": 5.242,
|
|
"mean_token_accuracy": 0.1773715242743492,
|
|
"num_tokens": 30034088.0,
|
|
"step": 17310
|
|
},
|
|
{
|
|
"entropy": 5.4021834373474125,
|
|
"epoch": 1.3471698113207546,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.00048207073137591726,
|
|
"loss": 5.1651,
|
|
"mean_token_accuracy": 0.17579952329397203,
|
|
"num_tokens": 30042651.0,
|
|
"step": 17315
|
|
},
|
|
{
|
|
"entropy": 5.476802730560303,
|
|
"epoch": 1.3475588406924723,
|
|
"grad_norm": 1.6484375,
|
|
"learning_rate": 0.00048205988803260824,
|
|
"loss": 5.1592,
|
|
"mean_token_accuracy": 0.18015269041061402,
|
|
"num_tokens": 30050898.0,
|
|
"step": 17320
|
|
},
|
|
{
|
|
"entropy": 5.5731285572052,
|
|
"epoch": 1.3479478700641898,
|
|
"grad_norm": 1.5,
|
|
"learning_rate": 0.00048204904154749496,
|
|
"loss": 5.3257,
|
|
"mean_token_accuracy": 0.17252847254276277,
|
|
"num_tokens": 30059357.0,
|
|
"step": 17325
|
|
},
|
|
{
|
|
"entropy": 5.5236536979675295,
|
|
"epoch": 1.3483368994359073,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.00048203819192074206,
|
|
"loss": 5.2636,
|
|
"mean_token_accuracy": 0.17482992708683015,
|
|
"num_tokens": 30068137.0,
|
|
"step": 17330
|
|
},
|
|
{
|
|
"entropy": 5.504386234283447,
|
|
"epoch": 1.348725928807625,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.00048202733915251407,
|
|
"loss": 5.2934,
|
|
"mean_token_accuracy": 0.1741149455308914,
|
|
"num_tokens": 30077139.0,
|
|
"step": 17335
|
|
},
|
|
{
|
|
"entropy": 5.488800001144409,
|
|
"epoch": 1.3491149581793425,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.00048201648324297573,
|
|
"loss": 5.2703,
|
|
"mean_token_accuracy": 0.18121775537729262,
|
|
"num_tokens": 30085267.0,
|
|
"step": 17340
|
|
},
|
|
{
|
|
"entropy": 5.456932640075683,
|
|
"epoch": 1.3495039875510602,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.00048200562419229185,
|
|
"loss": 5.1912,
|
|
"mean_token_accuracy": 0.18366157859563828,
|
|
"num_tokens": 30093804.0,
|
|
"step": 17345
|
|
},
|
|
{
|
|
"entropy": 5.515213918685913,
|
|
"epoch": 1.3498930169227776,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.000481994762000627,
|
|
"loss": 5.1938,
|
|
"mean_token_accuracy": 0.1855141043663025,
|
|
"num_tokens": 30102653.0,
|
|
"step": 17350
|
|
},
|
|
{
|
|
"entropy": 5.377200746536255,
|
|
"epoch": 1.3502820462944953,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.00048198389666814616,
|
|
"loss": 5.1497,
|
|
"mean_token_accuracy": 0.18063022047281266,
|
|
"num_tokens": 30111978.0,
|
|
"step": 17355
|
|
},
|
|
{
|
|
"entropy": 5.499823427200317,
|
|
"epoch": 1.3506710756662128,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 0.00048197302819501416,
|
|
"loss": 5.3878,
|
|
"mean_token_accuracy": 0.1690291240811348,
|
|
"num_tokens": 30120387.0,
|
|
"step": 17360
|
|
},
|
|
{
|
|
"entropy": 5.521423768997193,
|
|
"epoch": 1.3510601050379303,
|
|
"grad_norm": 1.53125,
|
|
"learning_rate": 0.00048196215658139586,
|
|
"loss": 5.2473,
|
|
"mean_token_accuracy": 0.17864008396863937,
|
|
"num_tokens": 30129069.0,
|
|
"step": 17365
|
|
},
|
|
{
|
|
"entropy": 5.454082584381103,
|
|
"epoch": 1.351449134409648,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.0004819512818274562,
|
|
"loss": 5.2013,
|
|
"mean_token_accuracy": 0.17336247563362123,
|
|
"num_tokens": 30138077.0,
|
|
"step": 17370
|
|
},
|
|
{
|
|
"entropy": 5.439135408401489,
|
|
"epoch": 1.3518381637813655,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.0004819404039333603,
|
|
"loss": 5.1774,
|
|
"mean_token_accuracy": 0.18369375318288803,
|
|
"num_tokens": 30146189.0,
|
|
"step": 17375
|
|
},
|
|
{
|
|
"entropy": 5.493515968322754,
|
|
"epoch": 1.352227193153083,
|
|
"grad_norm": 1.5390625,
|
|
"learning_rate": 0.0004819295228992731,
|
|
"loss": 5.2912,
|
|
"mean_token_accuracy": 0.17566606998443604,
|
|
"num_tokens": 30155664.0,
|
|
"step": 17380
|
|
},
|
|
{
|
|
"entropy": 5.484637355804443,
|
|
"epoch": 1.3526162225248006,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.00048191863872535984,
|
|
"loss": 5.2337,
|
|
"mean_token_accuracy": 0.1763281151652336,
|
|
"num_tokens": 30164701.0,
|
|
"step": 17385
|
|
},
|
|
{
|
|
"entropy": 5.4817366123199465,
|
|
"epoch": 1.3530052518965183,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.0004819077514117855,
|
|
"loss": 5.285,
|
|
"mean_token_accuracy": 0.17144161462783813,
|
|
"num_tokens": 30173916.0,
|
|
"step": 17390
|
|
},
|
|
{
|
|
"entropy": 5.494414520263672,
|
|
"epoch": 1.3533942812682358,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.00048189686095871545,
|
|
"loss": 5.2052,
|
|
"mean_token_accuracy": 0.18014294356107713,
|
|
"num_tokens": 30182803.0,
|
|
"step": 17395
|
|
},
|
|
{
|
|
"entropy": 5.478781223297119,
|
|
"epoch": 1.3537833106399533,
|
|
"grad_norm": 1.671875,
|
|
"learning_rate": 0.00048188596736631475,
|
|
"loss": 5.2345,
|
|
"mean_token_accuracy": 0.18244491666555404,
|
|
"num_tokens": 30191589.0,
|
|
"step": 17400
|
|
},
|
|
{
|
|
"entropy": 5.483405447006225,
|
|
"epoch": 1.354172340011671,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.00048187507063474885,
|
|
"loss": 5.3144,
|
|
"mean_token_accuracy": 0.1792867064476013,
|
|
"num_tokens": 30200170.0,
|
|
"step": 17405
|
|
},
|
|
{
|
|
"entropy": 5.525790166854859,
|
|
"epoch": 1.3545613693833884,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.00048186417076418294,
|
|
"loss": 5.1992,
|
|
"mean_token_accuracy": 0.17972753942012787,
|
|
"num_tokens": 30208683.0,
|
|
"step": 17410
|
|
},
|
|
{
|
|
"entropy": 5.444584131240845,
|
|
"epoch": 1.354950398755106,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 0.00048185326775478256,
|
|
"loss": 5.2415,
|
|
"mean_token_accuracy": 0.1678399696946144,
|
|
"num_tokens": 30217141.0,
|
|
"step": 17415
|
|
},
|
|
{
|
|
"entropy": 5.477710342407226,
|
|
"epoch": 1.3553394281268236,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.00048184236160671306,
|
|
"loss": 5.2487,
|
|
"mean_token_accuracy": 0.16956150084733962,
|
|
"num_tokens": 30226759.0,
|
|
"step": 17420
|
|
},
|
|
{
|
|
"entropy": 5.5595215320587155,
|
|
"epoch": 1.355728457498541,
|
|
"grad_norm": 1.640625,
|
|
"learning_rate": 0.00048183145232013995,
|
|
"loss": 5.3193,
|
|
"mean_token_accuracy": 0.17258228361606598,
|
|
"num_tokens": 30235945.0,
|
|
"step": 17425
|
|
},
|
|
{
|
|
"entropy": 5.559804248809814,
|
|
"epoch": 1.3561174868702586,
|
|
"grad_norm": 2.953125,
|
|
"learning_rate": 0.00048182053989522883,
|
|
"loss": 5.2788,
|
|
"mean_token_accuracy": 0.1710512787103653,
|
|
"num_tokens": 30244912.0,
|
|
"step": 17430
|
|
},
|
|
{
|
|
"entropy": 5.442434787750244,
|
|
"epoch": 1.3565065162419763,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.00048180962433214515,
|
|
"loss": 5.219,
|
|
"mean_token_accuracy": 0.17777471393346786,
|
|
"num_tokens": 30253807.0,
|
|
"step": 17435
|
|
},
|
|
{
|
|
"entropy": 5.483846426010132,
|
|
"epoch": 1.356895545613694,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.00048179870563105453,
|
|
"loss": 5.3149,
|
|
"mean_token_accuracy": 0.1783726453781128,
|
|
"num_tokens": 30262380.0,
|
|
"step": 17440
|
|
},
|
|
{
|
|
"entropy": 5.596456384658813,
|
|
"epoch": 1.3572845749854114,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0004817877837921228,
|
|
"loss": 5.2502,
|
|
"mean_token_accuracy": 0.17519735395908356,
|
|
"num_tokens": 30271374.0,
|
|
"step": 17445
|
|
},
|
|
{
|
|
"entropy": 5.490361452102661,
|
|
"epoch": 1.357673604357129,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0004817768588155155,
|
|
"loss": 5.2853,
|
|
"mean_token_accuracy": 0.17867863476276397,
|
|
"num_tokens": 30280037.0,
|
|
"step": 17450
|
|
},
|
|
{
|
|
"entropy": 5.367529296875,
|
|
"epoch": 1.3580626337288466,
|
|
"grad_norm": 1.734375,
|
|
"learning_rate": 0.00048176593070139865,
|
|
"loss": 5.0812,
|
|
"mean_token_accuracy": 0.19717075526714326,
|
|
"num_tokens": 30288335.0,
|
|
"step": 17455
|
|
},
|
|
{
|
|
"entropy": 5.400042009353638,
|
|
"epoch": 1.358451663100564,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.00048175499944993767,
|
|
"loss": 5.2056,
|
|
"mean_token_accuracy": 0.17974575757980346,
|
|
"num_tokens": 30297109.0,
|
|
"step": 17460
|
|
},
|
|
{
|
|
"entropy": 5.534235048294067,
|
|
"epoch": 1.3588406924722816,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.00048174406506129884,
|
|
"loss": 5.2034,
|
|
"mean_token_accuracy": 0.17888144999742508,
|
|
"num_tokens": 30305594.0,
|
|
"step": 17465
|
|
},
|
|
{
|
|
"entropy": 5.453529644012451,
|
|
"epoch": 1.3592297218439993,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.00048173312753564787,
|
|
"loss": 5.1003,
|
|
"mean_token_accuracy": 0.19087499976158143,
|
|
"num_tokens": 30313106.0,
|
|
"step": 17470
|
|
},
|
|
{
|
|
"entropy": 5.464592456817627,
|
|
"epoch": 1.3596187512157167,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.0004817221868731506,
|
|
"loss": 5.337,
|
|
"mean_token_accuracy": 0.16995429545640944,
|
|
"num_tokens": 30322194.0,
|
|
"step": 17475
|
|
},
|
|
{
|
|
"entropy": 5.4159761428833,
|
|
"epoch": 1.3600077805874344,
|
|
"grad_norm": 1.59375,
|
|
"learning_rate": 0.00048171124307397334,
|
|
"loss": 5.1521,
|
|
"mean_token_accuracy": 0.1823340490460396,
|
|
"num_tokens": 30330247.0,
|
|
"step": 17480
|
|
},
|
|
{
|
|
"entropy": 5.499040699005127,
|
|
"epoch": 1.360396809959152,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 0.0004817002961382819,
|
|
"loss": 5.2818,
|
|
"mean_token_accuracy": 0.17848298698663712,
|
|
"num_tokens": 30338738.0,
|
|
"step": 17485
|
|
},
|
|
{
|
|
"entropy": 5.4582672119140625,
|
|
"epoch": 1.3607858393308696,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.00048168934606624255,
|
|
"loss": 5.2446,
|
|
"mean_token_accuracy": 0.170152747631073,
|
|
"num_tokens": 30347729.0,
|
|
"step": 17490
|
|
},
|
|
{
|
|
"entropy": 5.505961894989014,
|
|
"epoch": 1.361174868702587,
|
|
"grad_norm": 1.4921875,
|
|
"learning_rate": 0.00048167839285802116,
|
|
"loss": 5.2381,
|
|
"mean_token_accuracy": 0.1757768601179123,
|
|
"num_tokens": 30356408.0,
|
|
"step": 17495
|
|
},
|
|
{
|
|
"entropy": 5.467833137512207,
|
|
"epoch": 1.3615638980743046,
|
|
"grad_norm": 1.515625,
|
|
"learning_rate": 0.0004816674365137843,
|
|
"loss": 5.1995,
|
|
"mean_token_accuracy": 0.17317010909318925,
|
|
"num_tokens": 30364910.0,
|
|
"step": 17500
|
|
},
|
|
{
|
|
"entropy": 5.454586219787598,
|
|
"epoch": 1.3619529274460223,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.000481656477033698,
|
|
"loss": 5.2365,
|
|
"mean_token_accuracy": 0.17724293023347854,
|
|
"num_tokens": 30373882.0,
|
|
"step": 17505
|
|
},
|
|
{
|
|
"entropy": 5.5559628963470455,
|
|
"epoch": 1.3623419568177397,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.0004816455144179286,
|
|
"loss": 5.2985,
|
|
"mean_token_accuracy": 0.16873742789030075,
|
|
"num_tokens": 30382884.0,
|
|
"step": 17510
|
|
},
|
|
{
|
|
"entropy": 5.489894390106201,
|
|
"epoch": 1.3627309861894572,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.0004816345486666424,
|
|
"loss": 5.193,
|
|
"mean_token_accuracy": 0.18445000648498536,
|
|
"num_tokens": 30391798.0,
|
|
"step": 17515
|
|
},
|
|
{
|
|
"entropy": 5.481246471405029,
|
|
"epoch": 1.363120015561175,
|
|
"grad_norm": 1.4921875,
|
|
"learning_rate": 0.0004816235797800058,
|
|
"loss": 5.2011,
|
|
"mean_token_accuracy": 0.18085924685001373,
|
|
"num_tokens": 30400194.0,
|
|
"step": 17520
|
|
},
|
|
{
|
|
"entropy": 5.470969820022583,
|
|
"epoch": 1.3635090449328924,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 0.0004816126077581852,
|
|
"loss": 5.1296,
|
|
"mean_token_accuracy": 0.18465941548347473,
|
|
"num_tokens": 30408653.0,
|
|
"step": 17525
|
|
},
|
|
{
|
|
"entropy": 5.412633180618286,
|
|
"epoch": 1.36389807430461,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.00048160163260134724,
|
|
"loss": 5.2828,
|
|
"mean_token_accuracy": 0.17281537652015685,
|
|
"num_tokens": 30417467.0,
|
|
"step": 17530
|
|
},
|
|
{
|
|
"entropy": 5.4725724220275875,
|
|
"epoch": 1.3642871036763276,
|
|
"grad_norm": 1.7890625,
|
|
"learning_rate": 0.0004815906543096583,
|
|
"loss": 5.2383,
|
|
"mean_token_accuracy": 0.1726375177502632,
|
|
"num_tokens": 30425993.0,
|
|
"step": 17535
|
|
},
|
|
{
|
|
"entropy": 5.514776039123535,
|
|
"epoch": 1.3646761330480452,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.000481579672883285,
|
|
"loss": 5.2226,
|
|
"mean_token_accuracy": 0.1777011290192604,
|
|
"num_tokens": 30434809.0,
|
|
"step": 17540
|
|
},
|
|
{
|
|
"entropy": 5.482051849365234,
|
|
"epoch": 1.3650651624197627,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.00048156868832239396,
|
|
"loss": 5.241,
|
|
"mean_token_accuracy": 0.17695044428110124,
|
|
"num_tokens": 30443536.0,
|
|
"step": 17545
|
|
},
|
|
{
|
|
"entropy": 5.411913108825684,
|
|
"epoch": 1.3654541917914802,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0004815577006271519,
|
|
"loss": 5.2165,
|
|
"mean_token_accuracy": 0.17960001528263092,
|
|
"num_tokens": 30452163.0,
|
|
"step": 17550
|
|
},
|
|
{
|
|
"entropy": 5.430967807769775,
|
|
"epoch": 1.365843221163198,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.00048154670979772555,
|
|
"loss": 5.2089,
|
|
"mean_token_accuracy": 0.18010239452123641,
|
|
"num_tokens": 30461234.0,
|
|
"step": 17555
|
|
},
|
|
{
|
|
"entropy": 5.606772136688233,
|
|
"epoch": 1.3662322505349154,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0004815357158342815,
|
|
"loss": 5.3664,
|
|
"mean_token_accuracy": 0.16491302996873855,
|
|
"num_tokens": 30470438.0,
|
|
"step": 17560
|
|
},
|
|
{
|
|
"entropy": 5.5209925174713135,
|
|
"epoch": 1.3666212799066328,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0004815247187369868,
|
|
"loss": 5.1846,
|
|
"mean_token_accuracy": 0.1815535008907318,
|
|
"num_tokens": 30479454.0,
|
|
"step": 17565
|
|
},
|
|
{
|
|
"entropy": 5.540090036392212,
|
|
"epoch": 1.3670103092783505,
|
|
"grad_norm": 1.546875,
|
|
"learning_rate": 0.00048151371850600814,
|
|
"loss": 5.2561,
|
|
"mean_token_accuracy": 0.17614753991365434,
|
|
"num_tokens": 30487968.0,
|
|
"step": 17570
|
|
},
|
|
{
|
|
"entropy": 5.475705623626709,
|
|
"epoch": 1.367399338650068,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.00048150271514151255,
|
|
"loss": 5.1847,
|
|
"mean_token_accuracy": 0.18580191135406493,
|
|
"num_tokens": 30495712.0,
|
|
"step": 17575
|
|
},
|
|
{
|
|
"entropy": 5.462652730941772,
|
|
"epoch": 1.3677883680217857,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.00048149170864366693,
|
|
"loss": 5.3035,
|
|
"mean_token_accuracy": 0.17307011485099794,
|
|
"num_tokens": 30505008.0,
|
|
"step": 17580
|
|
},
|
|
{
|
|
"entropy": 5.494186544418335,
|
|
"epoch": 1.3681773973935032,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.00048148069901263836,
|
|
"loss": 5.1908,
|
|
"mean_token_accuracy": 0.17936362624168395,
|
|
"num_tokens": 30514496.0,
|
|
"step": 17585
|
|
},
|
|
{
|
|
"entropy": 5.484045171737671,
|
|
"epoch": 1.368566426765221,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.00048146968624859375,
|
|
"loss": 5.1702,
|
|
"mean_token_accuracy": 0.1841189444065094,
|
|
"num_tokens": 30522942.0,
|
|
"step": 17590
|
|
},
|
|
{
|
|
"entropy": 5.5148717880249025,
|
|
"epoch": 1.3689554561369384,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.0004814586703517003,
|
|
"loss": 5.3464,
|
|
"mean_token_accuracy": 0.17623562812805177,
|
|
"num_tokens": 30532124.0,
|
|
"step": 17595
|
|
},
|
|
{
|
|
"entropy": 5.569475412368774,
|
|
"epoch": 1.3693444855086558,
|
|
"grad_norm": 1.515625,
|
|
"learning_rate": 0.0004814476513221251,
|
|
"loss": 5.4567,
|
|
"mean_token_accuracy": 0.16458929181098939,
|
|
"num_tokens": 30541063.0,
|
|
"step": 17600
|
|
},
|
|
{
|
|
"entropy": 5.572985982894897,
|
|
"epoch": 1.3697335148803735,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 0.00048143662916003545,
|
|
"loss": 5.1618,
|
|
"mean_token_accuracy": 0.17925930470228196,
|
|
"num_tokens": 30549062.0,
|
|
"step": 17605
|
|
},
|
|
{
|
|
"entropy": 5.532514953613282,
|
|
"epoch": 1.370122544252091,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.0004814256038655985,
|
|
"loss": 5.2603,
|
|
"mean_token_accuracy": 0.17622988671064377,
|
|
"num_tokens": 30557211.0,
|
|
"step": 17610
|
|
},
|
|
{
|
|
"entropy": 5.509684276580811,
|
|
"epoch": 1.3705115736238085,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.0004814145754389816,
|
|
"loss": 5.3351,
|
|
"mean_token_accuracy": 0.17111367583274842,
|
|
"num_tokens": 30566603.0,
|
|
"step": 17615
|
|
},
|
|
{
|
|
"entropy": 5.4712201118469235,
|
|
"epoch": 1.3709006029955262,
|
|
"grad_norm": 1.8984375,
|
|
"learning_rate": 0.00048140354388035204,
|
|
"loss": 5.1889,
|
|
"mean_token_accuracy": 0.17791188061237334,
|
|
"num_tokens": 30574903.0,
|
|
"step": 17620
|
|
},
|
|
{
|
|
"entropy": 5.537505626678467,
|
|
"epoch": 1.3712896323672437,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0004813925091898772,
|
|
"loss": 5.3015,
|
|
"mean_token_accuracy": 0.1691759556531906,
|
|
"num_tokens": 30584925.0,
|
|
"step": 17625
|
|
},
|
|
{
|
|
"entropy": 5.548365736007691,
|
|
"epoch": 1.3716786617389614,
|
|
"grad_norm": 1.5,
|
|
"learning_rate": 0.0004813814713677246,
|
|
"loss": 5.344,
|
|
"mean_token_accuracy": 0.17372958064079286,
|
|
"num_tokens": 30593376.0,
|
|
"step": 17630
|
|
},
|
|
{
|
|
"entropy": 5.518748188018799,
|
|
"epoch": 1.3720676911106788,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0004813704304140616,
|
|
"loss": 5.2584,
|
|
"mean_token_accuracy": 0.1792948365211487,
|
|
"num_tokens": 30602306.0,
|
|
"step": 17635
|
|
},
|
|
{
|
|
"entropy": 5.478524875640869,
|
|
"epoch": 1.3724567204823965,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0004813593863290559,
|
|
"loss": 5.1941,
|
|
"mean_token_accuracy": 0.1794302135705948,
|
|
"num_tokens": 30611340.0,
|
|
"step": 17640
|
|
},
|
|
{
|
|
"entropy": 5.51245002746582,
|
|
"epoch": 1.372845749854114,
|
|
"grad_norm": 1.546875,
|
|
"learning_rate": 0.0004813483391128748,
|
|
"loss": 5.28,
|
|
"mean_token_accuracy": 0.1792408272624016,
|
|
"num_tokens": 30619507.0,
|
|
"step": 17645
|
|
},
|
|
{
|
|
"entropy": 5.526970481872558,
|
|
"epoch": 1.3732347792258315,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.0004813372887656862,
|
|
"loss": 5.3168,
|
|
"mean_token_accuracy": 0.17348881512880326,
|
|
"num_tokens": 30629897.0,
|
|
"step": 17650
|
|
},
|
|
{
|
|
"entropy": 5.536590242385865,
|
|
"epoch": 1.3736238085975492,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0004813262352876576,
|
|
"loss": 5.229,
|
|
"mean_token_accuracy": 0.18029115349054337,
|
|
"num_tokens": 30638517.0,
|
|
"step": 17655
|
|
},
|
|
{
|
|
"entropy": 5.531946182250977,
|
|
"epoch": 1.3740128379692667,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.00048131517867895684,
|
|
"loss": 5.2794,
|
|
"mean_token_accuracy": 0.18195407092571259,
|
|
"num_tokens": 30646816.0,
|
|
"step": 17660
|
|
},
|
|
{
|
|
"entropy": 5.4948890209198,
|
|
"epoch": 1.3744018673409841,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.00048130411893975155,
|
|
"loss": 5.2457,
|
|
"mean_token_accuracy": 0.18316302299499512,
|
|
"num_tokens": 30655199.0,
|
|
"step": 17665
|
|
},
|
|
{
|
|
"entropy": 5.425690507888794,
|
|
"epoch": 1.3747908967127018,
|
|
"grad_norm": 1.5,
|
|
"learning_rate": 0.0004812930560702097,
|
|
"loss": 5.1159,
|
|
"mean_token_accuracy": 0.1851021647453308,
|
|
"num_tokens": 30663562.0,
|
|
"step": 17670
|
|
},
|
|
{
|
|
"entropy": 5.53632698059082,
|
|
"epoch": 1.3751799260844193,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.00048128199007049907,
|
|
"loss": 5.3114,
|
|
"mean_token_accuracy": 0.17654617577791215,
|
|
"num_tokens": 30672611.0,
|
|
"step": 17675
|
|
},
|
|
{
|
|
"entropy": 5.447826862335205,
|
|
"epoch": 1.375568955456137,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.00048127092094078756,
|
|
"loss": 5.1992,
|
|
"mean_token_accuracy": 0.18219852298498154,
|
|
"num_tokens": 30680766.0,
|
|
"step": 17680
|
|
},
|
|
{
|
|
"entropy": 5.427951335906982,
|
|
"epoch": 1.3759579848278545,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.00048125984868124317,
|
|
"loss": 5.0699,
|
|
"mean_token_accuracy": 0.18820186108350753,
|
|
"num_tokens": 30689192.0,
|
|
"step": 17685
|
|
},
|
|
{
|
|
"entropy": 5.470542144775391,
|
|
"epoch": 1.3763470141995722,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.0004812487732920338,
|
|
"loss": 5.2128,
|
|
"mean_token_accuracy": 0.17582817524671554,
|
|
"num_tokens": 30697889.0,
|
|
"step": 17690
|
|
},
|
|
{
|
|
"entropy": 5.505899715423584,
|
|
"epoch": 1.3767360435712896,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.0004812376947733277,
|
|
"loss": 5.266,
|
|
"mean_token_accuracy": 0.17976069450378418,
|
|
"num_tokens": 30706285.0,
|
|
"step": 17695
|
|
},
|
|
{
|
|
"entropy": 5.479380941390991,
|
|
"epoch": 1.3771250729430071,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.00048122661312529263,
|
|
"loss": 5.2206,
|
|
"mean_token_accuracy": 0.17799070626497268,
|
|
"num_tokens": 30715159.0,
|
|
"step": 17700
|
|
},
|
|
{
|
|
"entropy": 5.4012833595275875,
|
|
"epoch": 1.3775141023147248,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004812155283480971,
|
|
"loss": 5.1174,
|
|
"mean_token_accuracy": 0.18203524351119996,
|
|
"num_tokens": 30723133.0,
|
|
"step": 17705
|
|
},
|
|
{
|
|
"entropy": 5.512424755096435,
|
|
"epoch": 1.3779031316864423,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.0004812044404419091,
|
|
"loss": 5.3152,
|
|
"mean_token_accuracy": 0.17294375002384185,
|
|
"num_tokens": 30732272.0,
|
|
"step": 17710
|
|
},
|
|
{
|
|
"entropy": 5.458614110946655,
|
|
"epoch": 1.3782921610581598,
|
|
"grad_norm": 1.7265625,
|
|
"learning_rate": 0.000481193349406897,
|
|
"loss": 5.154,
|
|
"mean_token_accuracy": 0.18055310994386672,
|
|
"num_tokens": 30740439.0,
|
|
"step": 17715
|
|
},
|
|
{
|
|
"entropy": 5.441726446151733,
|
|
"epoch": 1.3786811904298775,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.000481182255243229,
|
|
"loss": 5.2636,
|
|
"mean_token_accuracy": 0.1760513022542,
|
|
"num_tokens": 30749722.0,
|
|
"step": 17720
|
|
},
|
|
{
|
|
"entropy": 5.577563142776489,
|
|
"epoch": 1.379070219801595,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.00048117115795107335,
|
|
"loss": 5.4542,
|
|
"mean_token_accuracy": 0.16481081247329712,
|
|
"num_tokens": 30759261.0,
|
|
"step": 17725
|
|
},
|
|
{
|
|
"entropy": 5.608131790161133,
|
|
"epoch": 1.3794592491733126,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.0004811600575305987,
|
|
"loss": 5.2747,
|
|
"mean_token_accuracy": 0.17702706158161163,
|
|
"num_tokens": 30769133.0,
|
|
"step": 17730
|
|
},
|
|
{
|
|
"entropy": 5.494538831710815,
|
|
"epoch": 1.3798482785450301,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0004811489539819731,
|
|
"loss": 5.2055,
|
|
"mean_token_accuracy": 0.1806598871946335,
|
|
"num_tokens": 30777879.0,
|
|
"step": 17735
|
|
},
|
|
{
|
|
"entropy": 5.485691118240356,
|
|
"epoch": 1.3802373079167478,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00048113784730536544,
|
|
"loss": 5.3133,
|
|
"mean_token_accuracy": 0.17931223809719085,
|
|
"num_tokens": 30786307.0,
|
|
"step": 17740
|
|
},
|
|
{
|
|
"entropy": 5.53962664604187,
|
|
"epoch": 1.3806263372884653,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.00048112673750094396,
|
|
"loss": 5.3271,
|
|
"mean_token_accuracy": 0.1764896109700203,
|
|
"num_tokens": 30796153.0,
|
|
"step": 17745
|
|
},
|
|
{
|
|
"entropy": 5.483430290222168,
|
|
"epoch": 1.3810153666601828,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0004811156245688773,
|
|
"loss": 5.0985,
|
|
"mean_token_accuracy": 0.18633727580308915,
|
|
"num_tokens": 30805441.0,
|
|
"step": 17750
|
|
},
|
|
{
|
|
"entropy": 5.4438379287719725,
|
|
"epoch": 1.3814043960319005,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004811045085093342,
|
|
"loss": 5.2645,
|
|
"mean_token_accuracy": 0.16739901751279831,
|
|
"num_tokens": 30814898.0,
|
|
"step": 17755
|
|
},
|
|
{
|
|
"entropy": 5.662993621826172,
|
|
"epoch": 1.381793425403618,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.0004810933893224831,
|
|
"loss": 5.4258,
|
|
"mean_token_accuracy": 0.16295039653778076,
|
|
"num_tokens": 30823995.0,
|
|
"step": 17760
|
|
},
|
|
{
|
|
"entropy": 5.533854389190674,
|
|
"epoch": 1.3821824547753354,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.00048108226700849287,
|
|
"loss": 5.2686,
|
|
"mean_token_accuracy": 0.17513501942157744,
|
|
"num_tokens": 30832963.0,
|
|
"step": 17765
|
|
},
|
|
{
|
|
"entropy": 5.482215213775635,
|
|
"epoch": 1.382571484147053,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0004810711415675323,
|
|
"loss": 5.26,
|
|
"mean_token_accuracy": 0.1700100377202034,
|
|
"num_tokens": 30841559.0,
|
|
"step": 17770
|
|
},
|
|
{
|
|
"entropy": 5.530559396743774,
|
|
"epoch": 1.3829605135187706,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0004810600129997702,
|
|
"loss": 5.3181,
|
|
"mean_token_accuracy": 0.17674199789762496,
|
|
"num_tokens": 30850481.0,
|
|
"step": 17775
|
|
},
|
|
{
|
|
"entropy": 5.534937524795533,
|
|
"epoch": 1.3833495428904883,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.00048104888130537534,
|
|
"loss": 5.1868,
|
|
"mean_token_accuracy": 0.1816599428653717,
|
|
"num_tokens": 30859632.0,
|
|
"step": 17780
|
|
},
|
|
{
|
|
"entropy": 5.526521062850952,
|
|
"epoch": 1.3837385722622058,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.00048103774648451664,
|
|
"loss": 5.238,
|
|
"mean_token_accuracy": 0.17586234211921692,
|
|
"num_tokens": 30867909.0,
|
|
"step": 17785
|
|
},
|
|
{
|
|
"entropy": 5.508820867538452,
|
|
"epoch": 1.3841276016339235,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.00048102660853736314,
|
|
"loss": 5.2469,
|
|
"mean_token_accuracy": 0.18207636922597886,
|
|
"num_tokens": 30876339.0,
|
|
"step": 17790
|
|
},
|
|
{
|
|
"entropy": 5.511918544769287,
|
|
"epoch": 1.384516631005641,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.0004810154674640837,
|
|
"loss": 5.2338,
|
|
"mean_token_accuracy": 0.17675154507160187,
|
|
"num_tokens": 30884998.0,
|
|
"step": 17795
|
|
},
|
|
{
|
|
"entropy": 5.4847723007202145,
|
|
"epoch": 1.3849056603773584,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.00048100432326484744,
|
|
"loss": 5.2553,
|
|
"mean_token_accuracy": 0.1717436358332634,
|
|
"num_tokens": 30893554.0,
|
|
"step": 17800
|
|
},
|
|
{
|
|
"entropy": 5.454303789138794,
|
|
"epoch": 1.385294689749076,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 0.0004809931759398235,
|
|
"loss": 5.2959,
|
|
"mean_token_accuracy": 0.17158586531877518,
|
|
"num_tokens": 30901954.0,
|
|
"step": 17805
|
|
},
|
|
{
|
|
"entropy": 5.520076179504395,
|
|
"epoch": 1.3856837191207936,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.00048098202548918094,
|
|
"loss": 5.219,
|
|
"mean_token_accuracy": 0.17881811559200286,
|
|
"num_tokens": 30911145.0,
|
|
"step": 17810
|
|
},
|
|
{
|
|
"entropy": 5.425348329544067,
|
|
"epoch": 1.386072748492511,
|
|
"grad_norm": 1.53125,
|
|
"learning_rate": 0.00048097087191308914,
|
|
"loss": 5.1145,
|
|
"mean_token_accuracy": 0.1815677285194397,
|
|
"num_tokens": 30918924.0,
|
|
"step": 17815
|
|
},
|
|
{
|
|
"entropy": 5.470867156982422,
|
|
"epoch": 1.3864617778642288,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.0004809597152117171,
|
|
"loss": 5.2895,
|
|
"mean_token_accuracy": 0.17505019158124924,
|
|
"num_tokens": 30927620.0,
|
|
"step": 17820
|
|
},
|
|
{
|
|
"entropy": 5.471066665649414,
|
|
"epoch": 1.3868508072359464,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.0004809485553852342,
|
|
"loss": 5.1773,
|
|
"mean_token_accuracy": 0.17874298095703126,
|
|
"num_tokens": 30936140.0,
|
|
"step": 17825
|
|
},
|
|
{
|
|
"entropy": 5.559423589706421,
|
|
"epoch": 1.387239836607664,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.0004809373924338098,
|
|
"loss": 5.3627,
|
|
"mean_token_accuracy": 0.17417063117027282,
|
|
"num_tokens": 30944450.0,
|
|
"step": 17830
|
|
},
|
|
{
|
|
"entropy": 5.429990530014038,
|
|
"epoch": 1.3876288659793814,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.00048092622635761316,
|
|
"loss": 5.2012,
|
|
"mean_token_accuracy": 0.17550955712795258,
|
|
"num_tokens": 30953536.0,
|
|
"step": 17835
|
|
},
|
|
{
|
|
"entropy": 5.519266605377197,
|
|
"epoch": 1.388017895351099,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.00048091505715681395,
|
|
"loss": 5.2255,
|
|
"mean_token_accuracy": 0.17561615854501725,
|
|
"num_tokens": 30962556.0,
|
|
"step": 17840
|
|
},
|
|
{
|
|
"entropy": 5.408575391769409,
|
|
"epoch": 1.3884069247228166,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.0004809038848315814,
|
|
"loss": 5.1597,
|
|
"mean_token_accuracy": 0.18756389617919922,
|
|
"num_tokens": 30970476.0,
|
|
"step": 17845
|
|
},
|
|
{
|
|
"entropy": 5.489425420761108,
|
|
"epoch": 1.388795954094534,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.0004808927093820851,
|
|
"loss": 5.1937,
|
|
"mean_token_accuracy": 0.17492384910583497,
|
|
"num_tokens": 30978945.0,
|
|
"step": 17850
|
|
},
|
|
{
|
|
"entropy": 5.4314511775970455,
|
|
"epoch": 1.3891849834662517,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.0004808815308084947,
|
|
"loss": 5.1721,
|
|
"mean_token_accuracy": 0.1748127207159996,
|
|
"num_tokens": 30988135.0,
|
|
"step": 17855
|
|
},
|
|
{
|
|
"entropy": 5.546903228759765,
|
|
"epoch": 1.3895740128379692,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.0004808703491109798,
|
|
"loss": 5.2689,
|
|
"mean_token_accuracy": 0.17492063343524933,
|
|
"num_tokens": 30996408.0,
|
|
"step": 17860
|
|
},
|
|
{
|
|
"entropy": 5.449305486679077,
|
|
"epoch": 1.3899630422096867,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.0004808591642897099,
|
|
"loss": 5.2721,
|
|
"mean_token_accuracy": 0.1772267922759056,
|
|
"num_tokens": 31004156.0,
|
|
"step": 17865
|
|
},
|
|
{
|
|
"entropy": 5.4502420902252195,
|
|
"epoch": 1.3903520715814044,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.000480847976344855,
|
|
"loss": 5.2074,
|
|
"mean_token_accuracy": 0.1809771478176117,
|
|
"num_tokens": 31013518.0,
|
|
"step": 17870
|
|
},
|
|
{
|
|
"entropy": 5.435634279251099,
|
|
"epoch": 1.390741100953122,
|
|
"grad_norm": 1.6171875,
|
|
"learning_rate": 0.00048083678527658465,
|
|
"loss": 5.0981,
|
|
"mean_token_accuracy": 0.18312658816576005,
|
|
"num_tokens": 31022116.0,
|
|
"step": 17875
|
|
},
|
|
{
|
|
"entropy": 5.47791109085083,
|
|
"epoch": 1.3911301303248396,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.0004808255910850687,
|
|
"loss": 5.2557,
|
|
"mean_token_accuracy": 0.18032569885253907,
|
|
"num_tokens": 31030320.0,
|
|
"step": 17880
|
|
},
|
|
{
|
|
"entropy": 5.494035959243774,
|
|
"epoch": 1.391519159696557,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.0004808143937704769,
|
|
"loss": 5.2276,
|
|
"mean_token_accuracy": 0.1806335911154747,
|
|
"num_tokens": 31038410.0,
|
|
"step": 17885
|
|
},
|
|
{
|
|
"entropy": 5.414658451080323,
|
|
"epoch": 1.3919081890682747,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.00048080319333297937,
|
|
"loss": 5.1695,
|
|
"mean_token_accuracy": 0.1831390842795372,
|
|
"num_tokens": 31047719.0,
|
|
"step": 17890
|
|
},
|
|
{
|
|
"entropy": 5.448948526382447,
|
|
"epoch": 1.3922972184399922,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.00048079198977274597,
|
|
"loss": 5.2661,
|
|
"mean_token_accuracy": 0.1796051248908043,
|
|
"num_tokens": 31057536.0,
|
|
"step": 17895
|
|
},
|
|
{
|
|
"entropy": 5.554400777816772,
|
|
"epoch": 1.3926862478117097,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.00048078078308994666,
|
|
"loss": 5.2474,
|
|
"mean_token_accuracy": 0.1825242221355438,
|
|
"num_tokens": 31066975.0,
|
|
"step": 17900
|
|
},
|
|
{
|
|
"entropy": 5.478024673461914,
|
|
"epoch": 1.3930752771834274,
|
|
"grad_norm": 1.53125,
|
|
"learning_rate": 0.0004807695732847515,
|
|
"loss": 5.214,
|
|
"mean_token_accuracy": 0.18381236344575883,
|
|
"num_tokens": 31075573.0,
|
|
"step": 17905
|
|
},
|
|
{
|
|
"entropy": 5.398452615737915,
|
|
"epoch": 1.3934643065551449,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.00048075836035733053,
|
|
"loss": 5.1577,
|
|
"mean_token_accuracy": 0.18735102713108062,
|
|
"num_tokens": 31084486.0,
|
|
"step": 17910
|
|
},
|
|
{
|
|
"entropy": 5.42413363456726,
|
|
"epoch": 1.3938533359268626,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.000480747144307854,
|
|
"loss": 5.1813,
|
|
"mean_token_accuracy": 0.1842433750629425,
|
|
"num_tokens": 31093045.0,
|
|
"step": 17915
|
|
},
|
|
{
|
|
"entropy": 5.465947866439819,
|
|
"epoch": 1.39424236529858,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.00048073592513649203,
|
|
"loss": 5.2375,
|
|
"mean_token_accuracy": 0.18174562007188796,
|
|
"num_tokens": 31102024.0,
|
|
"step": 17920
|
|
},
|
|
{
|
|
"entropy": 5.4516518115997314,
|
|
"epoch": 1.3946313946702977,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0004807247028434148,
|
|
"loss": 5.3028,
|
|
"mean_token_accuracy": 0.17244891673326493,
|
|
"num_tokens": 31110656.0,
|
|
"step": 17925
|
|
},
|
|
{
|
|
"entropy": 5.487002515792847,
|
|
"epoch": 1.3950204240420152,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.0004807134774287927,
|
|
"loss": 5.1894,
|
|
"mean_token_accuracy": 0.1856229692697525,
|
|
"num_tokens": 31119199.0,
|
|
"step": 17930
|
|
},
|
|
{
|
|
"entropy": 5.433686685562134,
|
|
"epoch": 1.3954094534137327,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.00048070224889279603,
|
|
"loss": 5.1808,
|
|
"mean_token_accuracy": 0.18199242800474166,
|
|
"num_tokens": 31127301.0,
|
|
"step": 17935
|
|
},
|
|
{
|
|
"entropy": 5.4784486293792725,
|
|
"epoch": 1.3957984827854504,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.00048069101723559505,
|
|
"loss": 5.274,
|
|
"mean_token_accuracy": 0.1810097336769104,
|
|
"num_tokens": 31136714.0,
|
|
"step": 17940
|
|
},
|
|
{
|
|
"entropy": 5.52238392829895,
|
|
"epoch": 1.3961875121571679,
|
|
"grad_norm": 2.34375,
|
|
"learning_rate": 0.0004806797824573603,
|
|
"loss": 5.2422,
|
|
"mean_token_accuracy": 0.17201750725507736,
|
|
"num_tokens": 31145663.0,
|
|
"step": 17945
|
|
},
|
|
{
|
|
"entropy": 5.402653646469116,
|
|
"epoch": 1.3965765415288853,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0004806685445582624,
|
|
"loss": 4.995,
|
|
"mean_token_accuracy": 0.19295692145824433,
|
|
"num_tokens": 31154335.0,
|
|
"step": 17950
|
|
},
|
|
{
|
|
"entropy": 5.384617185592651,
|
|
"epoch": 1.396965570900603,
|
|
"grad_norm": 1.6328125,
|
|
"learning_rate": 0.00048065730353847143,
|
|
"loss": 5.2282,
|
|
"mean_token_accuracy": 0.18029399514198302,
|
|
"num_tokens": 31163683.0,
|
|
"step": 17955
|
|
},
|
|
{
|
|
"entropy": 5.453492116928101,
|
|
"epoch": 1.3973546002723205,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.00048064605939815837,
|
|
"loss": 5.2972,
|
|
"mean_token_accuracy": 0.17821234315633774,
|
|
"num_tokens": 31172361.0,
|
|
"step": 17960
|
|
},
|
|
{
|
|
"entropy": 5.503365898132325,
|
|
"epoch": 1.3977436296440382,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.0004806348121374936,
|
|
"loss": 5.1418,
|
|
"mean_token_accuracy": 0.18665060997009278,
|
|
"num_tokens": 31180572.0,
|
|
"step": 17965
|
|
},
|
|
{
|
|
"entropy": 5.399412393569946,
|
|
"epoch": 1.3981326590157557,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.0004806235617566479,
|
|
"loss": 5.1509,
|
|
"mean_token_accuracy": 0.18249404430389404,
|
|
"num_tokens": 31188751.0,
|
|
"step": 17970
|
|
},
|
|
{
|
|
"entropy": 5.514432764053344,
|
|
"epoch": 1.3985216883874734,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.000480612308255792,
|
|
"loss": 5.3559,
|
|
"mean_token_accuracy": 0.16781715154647828,
|
|
"num_tokens": 31197762.0,
|
|
"step": 17975
|
|
},
|
|
{
|
|
"entropy": 5.55035433769226,
|
|
"epoch": 1.3989107177591908,
|
|
"grad_norm": 1.5234375,
|
|
"learning_rate": 0.00048060105163509647,
|
|
"loss": 5.2554,
|
|
"mean_token_accuracy": 0.17506884336471557,
|
|
"num_tokens": 31207203.0,
|
|
"step": 17980
|
|
},
|
|
{
|
|
"entropy": 5.530920314788818,
|
|
"epoch": 1.3992997471309083,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0004805897918947323,
|
|
"loss": 5.2581,
|
|
"mean_token_accuracy": 0.17933039367198944,
|
|
"num_tokens": 31215711.0,
|
|
"step": 17985
|
|
},
|
|
{
|
|
"entropy": 5.461055040359497,
|
|
"epoch": 1.399688776502626,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.0004805785290348702,
|
|
"loss": 5.1835,
|
|
"mean_token_accuracy": 0.18045685142278672,
|
|
"num_tokens": 31224564.0,
|
|
"step": 17990
|
|
},
|
|
{
|
|
"entropy": 5.410236406326294,
|
|
"epoch": 1.4000778058743435,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.00048056726305568124,
|
|
"loss": 5.1798,
|
|
"mean_token_accuracy": 0.17926315367221832,
|
|
"num_tokens": 31233252.0,
|
|
"step": 17995
|
|
},
|
|
{
|
|
"entropy": 5.4720165729522705,
|
|
"epoch": 1.400466835246061,
|
|
"grad_norm": 1.515625,
|
|
"learning_rate": 0.00048055599395733617,
|
|
"loss": 5.2631,
|
|
"mean_token_accuracy": 0.18022310584783555,
|
|
"num_tokens": 31242539.0,
|
|
"step": 18000
|
|
},
|
|
{
|
|
"epoch": 1.400466835246061,
|
|
"eval_entropy": 5.350850989201301,
|
|
"eval_loss": 5.329644680023193,
|
|
"eval_mean_token_accuracy": 0.18264124202358253,
|
|
"eval_num_tokens": 31242539.0,
|
|
"eval_runtime": 28.4214,
|
|
"eval_samples_per_second": 1462.207,
|
|
"eval_steps_per_second": 182.785,
|
|
"step": 18000
|
|
},
|
|
{
|
|
"entropy": 5.5263731479644775,
|
|
"epoch": 1.4008558646177787,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.00048054472174000615,
|
|
"loss": 5.2491,
|
|
"mean_token_accuracy": 0.1797153353691101,
|
|
"num_tokens": 31250770.0,
|
|
"step": 18005
|
|
},
|
|
{
|
|
"entropy": 5.442011404037475,
|
|
"epoch": 1.4012448939894961,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 0.00048053344640386207,
|
|
"loss": 5.1811,
|
|
"mean_token_accuracy": 0.19132875949144362,
|
|
"num_tokens": 31259507.0,
|
|
"step": 18010
|
|
},
|
|
{
|
|
"entropy": 5.428150177001953,
|
|
"epoch": 1.4016339233612138,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.00048052216794907505,
|
|
"loss": 5.2792,
|
|
"mean_token_accuracy": 0.17548789978027343,
|
|
"num_tokens": 31268106.0,
|
|
"step": 18015
|
|
},
|
|
{
|
|
"entropy": 5.411325979232788,
|
|
"epoch": 1.4020229527329313,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.00048051088637581624,
|
|
"loss": 5.1757,
|
|
"mean_token_accuracy": 0.18286990523338317,
|
|
"num_tokens": 31276495.0,
|
|
"step": 18020
|
|
},
|
|
{
|
|
"entropy": 5.5340807914733885,
|
|
"epoch": 1.402411982104649,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.000480499601684257,
|
|
"loss": 5.2669,
|
|
"mean_token_accuracy": 0.1725315347313881,
|
|
"num_tokens": 31284962.0,
|
|
"step": 18025
|
|
},
|
|
{
|
|
"entropy": 5.524370765686035,
|
|
"epoch": 1.4028010114763665,
|
|
"grad_norm": 1.5078125,
|
|
"learning_rate": 0.0004804883138745682,
|
|
"loss": 5.3105,
|
|
"mean_token_accuracy": 0.16837209612131118,
|
|
"num_tokens": 31294497.0,
|
|
"step": 18030
|
|
},
|
|
{
|
|
"entropy": 5.459423494338989,
|
|
"epoch": 1.403190040848084,
|
|
"grad_norm": 1.5,
|
|
"learning_rate": 0.0004804770229469214,
|
|
"loss": 5.2081,
|
|
"mean_token_accuracy": 0.18599114418029786,
|
|
"num_tokens": 31302607.0,
|
|
"step": 18035
|
|
},
|
|
{
|
|
"entropy": 5.572231721878052,
|
|
"epoch": 1.4035790702198017,
|
|
"grad_norm": 1.5,
|
|
"learning_rate": 0.0004804657289014878,
|
|
"loss": 5.2849,
|
|
"mean_token_accuracy": 0.18076523244380951,
|
|
"num_tokens": 31311989.0,
|
|
"step": 18040
|
|
},
|
|
{
|
|
"entropy": 5.5667151927948,
|
|
"epoch": 1.4039680995915191,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.00048045443173843884,
|
|
"loss": 5.1935,
|
|
"mean_token_accuracy": 0.18314482867717743,
|
|
"num_tokens": 31320681.0,
|
|
"step": 18045
|
|
},
|
|
{
|
|
"entropy": 5.461316013336182,
|
|
"epoch": 1.4043571289632366,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 0.00048044313145794587,
|
|
"loss": 5.2217,
|
|
"mean_token_accuracy": 0.17935324758291243,
|
|
"num_tokens": 31328985.0,
|
|
"step": 18050
|
|
},
|
|
{
|
|
"entropy": 5.441216897964478,
|
|
"epoch": 1.4047461583349543,
|
|
"grad_norm": 1.796875,
|
|
"learning_rate": 0.00048043182806018034,
|
|
"loss": 5.168,
|
|
"mean_token_accuracy": 0.17946912050247193,
|
|
"num_tokens": 31337486.0,
|
|
"step": 18055
|
|
},
|
|
{
|
|
"entropy": 5.513202476501465,
|
|
"epoch": 1.4051351877066718,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.00048042052154531384,
|
|
"loss": 5.2895,
|
|
"mean_token_accuracy": 0.18216563761234283,
|
|
"num_tokens": 31345831.0,
|
|
"step": 18060
|
|
},
|
|
{
|
|
"entropy": 5.444756031036377,
|
|
"epoch": 1.4055242170783895,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0004804092119135179,
|
|
"loss": 5.1829,
|
|
"mean_token_accuracy": 0.18152471631765366,
|
|
"num_tokens": 31354791.0,
|
|
"step": 18065
|
|
},
|
|
{
|
|
"entropy": 5.4355779647827145,
|
|
"epoch": 1.405913246450107,
|
|
"grad_norm": 1.59375,
|
|
"learning_rate": 0.0004803978991649641,
|
|
"loss": 5.1455,
|
|
"mean_token_accuracy": 0.18362685292959213,
|
|
"num_tokens": 31362652.0,
|
|
"step": 18070
|
|
},
|
|
{
|
|
"entropy": 5.447424030303955,
|
|
"epoch": 1.4063022758218247,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.00048038658329982404,
|
|
"loss": 5.2166,
|
|
"mean_token_accuracy": 0.18235095143318175,
|
|
"num_tokens": 31371439.0,
|
|
"step": 18075
|
|
},
|
|
{
|
|
"entropy": 5.505274057388306,
|
|
"epoch": 1.4066913051935421,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0004803752643182695,
|
|
"loss": 5.2453,
|
|
"mean_token_accuracy": 0.17296168357133865,
|
|
"num_tokens": 31380039.0,
|
|
"step": 18080
|
|
},
|
|
{
|
|
"entropy": 5.495355939865112,
|
|
"epoch": 1.4070803345652596,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.0004803639422204723,
|
|
"loss": 5.3636,
|
|
"mean_token_accuracy": 0.16720153838396073,
|
|
"num_tokens": 31389318.0,
|
|
"step": 18085
|
|
},
|
|
{
|
|
"entropy": 5.506799221038818,
|
|
"epoch": 1.4074693639369773,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0004803526170066041,
|
|
"loss": 5.2271,
|
|
"mean_token_accuracy": 0.1766585811972618,
|
|
"num_tokens": 31398442.0,
|
|
"step": 18090
|
|
},
|
|
{
|
|
"entropy": 5.4893897533416744,
|
|
"epoch": 1.4078583933086948,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00048034128867683674,
|
|
"loss": 5.2249,
|
|
"mean_token_accuracy": 0.1818626493215561,
|
|
"num_tokens": 31406566.0,
|
|
"step": 18095
|
|
},
|
|
{
|
|
"entropy": 5.455459213256836,
|
|
"epoch": 1.4082474226804123,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 0.0004803299572313422,
|
|
"loss": 5.286,
|
|
"mean_token_accuracy": 0.17086722552776337,
|
|
"num_tokens": 31415207.0,
|
|
"step": 18100
|
|
},
|
|
{
|
|
"entropy": 5.6051431655883786,
|
|
"epoch": 1.40863645205213,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.0004803186226702924,
|
|
"loss": 5.2975,
|
|
"mean_token_accuracy": 0.16654933542013167,
|
|
"num_tokens": 31424175.0,
|
|
"step": 18105
|
|
},
|
|
{
|
|
"entropy": 5.583214330673218,
|
|
"epoch": 1.4090254814238474,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.0004803072849938592,
|
|
"loss": 5.3164,
|
|
"mean_token_accuracy": 0.16744719296693802,
|
|
"num_tokens": 31434022.0,
|
|
"step": 18110
|
|
},
|
|
{
|
|
"entropy": 5.514408349990845,
|
|
"epoch": 1.4094145107955651,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.0004802959442022149,
|
|
"loss": 5.1879,
|
|
"mean_token_accuracy": 0.1815322920680046,
|
|
"num_tokens": 31442838.0,
|
|
"step": 18115
|
|
},
|
|
{
|
|
"entropy": 5.438424921035766,
|
|
"epoch": 1.4098035401672826,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.00048028460029553126,
|
|
"loss": 5.1658,
|
|
"mean_token_accuracy": 0.17856270968914031,
|
|
"num_tokens": 31451482.0,
|
|
"step": 18120
|
|
},
|
|
{
|
|
"entropy": 5.453842449188232,
|
|
"epoch": 1.4101925695390003,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.00048027325327398065,
|
|
"loss": 5.2327,
|
|
"mean_token_accuracy": 0.17675680965185164,
|
|
"num_tokens": 31460234.0,
|
|
"step": 18125
|
|
},
|
|
{
|
|
"entropy": 5.466915607452393,
|
|
"epoch": 1.4105815989107178,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.0004802619031377351,
|
|
"loss": 5.1987,
|
|
"mean_token_accuracy": 0.1833869308233261,
|
|
"num_tokens": 31470466.0,
|
|
"step": 18130
|
|
},
|
|
{
|
|
"entropy": 5.472537803649902,
|
|
"epoch": 1.4109706282824352,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.00048025054988696684,
|
|
"loss": 5.3072,
|
|
"mean_token_accuracy": 0.17066388875246047,
|
|
"num_tokens": 31480901.0,
|
|
"step": 18135
|
|
},
|
|
{
|
|
"entropy": 5.497697114944458,
|
|
"epoch": 1.411359657654153,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.00048023919352184827,
|
|
"loss": 5.2109,
|
|
"mean_token_accuracy": 0.17782883942127228,
|
|
"num_tokens": 31490329.0,
|
|
"step": 18140
|
|
},
|
|
{
|
|
"entropy": 5.466535997390747,
|
|
"epoch": 1.4117486870258704,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.00048022783404255156,
|
|
"loss": 5.239,
|
|
"mean_token_accuracy": 0.1762927070260048,
|
|
"num_tokens": 31499519.0,
|
|
"step": 18145
|
|
},
|
|
{
|
|
"entropy": 5.462879085540772,
|
|
"epoch": 1.412137716397588,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.0004802164714492491,
|
|
"loss": 5.2882,
|
|
"mean_token_accuracy": 0.1755024805665016,
|
|
"num_tokens": 31507899.0,
|
|
"step": 18150
|
|
},
|
|
{
|
|
"entropy": 5.57371072769165,
|
|
"epoch": 1.4125267457693056,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 0.00048020510574211335,
|
|
"loss": 5.4357,
|
|
"mean_token_accuracy": 0.16321652978658677,
|
|
"num_tokens": 31517861.0,
|
|
"step": 18155
|
|
},
|
|
{
|
|
"entropy": 5.576320171356201,
|
|
"epoch": 1.412915775141023,
|
|
"grad_norm": 1.5546875,
|
|
"learning_rate": 0.00048019373692131674,
|
|
"loss": 5.3164,
|
|
"mean_token_accuracy": 0.1713208481669426,
|
|
"num_tokens": 31527273.0,
|
|
"step": 18160
|
|
},
|
|
{
|
|
"entropy": 5.521735191345215,
|
|
"epoch": 1.4133048045127408,
|
|
"grad_norm": 1.578125,
|
|
"learning_rate": 0.00048018236498703176,
|
|
"loss": 5.2374,
|
|
"mean_token_accuracy": 0.17349209934473037,
|
|
"num_tokens": 31536221.0,
|
|
"step": 18165
|
|
},
|
|
{
|
|
"entropy": 5.45868558883667,
|
|
"epoch": 1.4136938338844582,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.00048017098993943097,
|
|
"loss": 5.1764,
|
|
"mean_token_accuracy": 0.18448155373334885,
|
|
"num_tokens": 31544329.0,
|
|
"step": 18170
|
|
},
|
|
{
|
|
"entropy": 5.553943681716919,
|
|
"epoch": 1.414082863256176,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.000480159611778687,
|
|
"loss": 5.2706,
|
|
"mean_token_accuracy": 0.17889992147684097,
|
|
"num_tokens": 31552323.0,
|
|
"step": 18175
|
|
},
|
|
{
|
|
"entropy": 5.501322507858276,
|
|
"epoch": 1.4144718926278934,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.00048014823050497243,
|
|
"loss": 5.2225,
|
|
"mean_token_accuracy": 0.1761839672923088,
|
|
"num_tokens": 31560432.0,
|
|
"step": 18180
|
|
},
|
|
{
|
|
"entropy": 5.388775587081909,
|
|
"epoch": 1.4148609219996109,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 0.00048013684611846,
|
|
"loss": 5.1894,
|
|
"mean_token_accuracy": 0.18051880449056626,
|
|
"num_tokens": 31569294.0,
|
|
"step": 18185
|
|
},
|
|
{
|
|
"entropy": 5.468929195404053,
|
|
"epoch": 1.4152499513713286,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.00048012545861932245,
|
|
"loss": 5.2144,
|
|
"mean_token_accuracy": 0.17976803928613663,
|
|
"num_tokens": 31577860.0,
|
|
"step": 18190
|
|
},
|
|
{
|
|
"entropy": 5.471890115737915,
|
|
"epoch": 1.415638980743046,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.0004801140680077325,
|
|
"loss": 5.1432,
|
|
"mean_token_accuracy": 0.18126462996006013,
|
|
"num_tokens": 31586034.0,
|
|
"step": 18195
|
|
},
|
|
{
|
|
"entropy": 5.419580793380737,
|
|
"epoch": 1.4160280101147635,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.0004801026742838631,
|
|
"loss": 5.2013,
|
|
"mean_token_accuracy": 0.17756079733371735,
|
|
"num_tokens": 31594911.0,
|
|
"step": 18200
|
|
},
|
|
{
|
|
"entropy": 5.498726892471313,
|
|
"epoch": 1.4164170394864812,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.0004800912774478871,
|
|
"loss": 5.279,
|
|
"mean_token_accuracy": 0.17289074808359145,
|
|
"num_tokens": 31603477.0,
|
|
"step": 18205
|
|
},
|
|
{
|
|
"entropy": 5.594529008865356,
|
|
"epoch": 1.416806068858199,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.0004800798774999773,
|
|
"loss": 5.2746,
|
|
"mean_token_accuracy": 0.1770025908946991,
|
|
"num_tokens": 31612288.0,
|
|
"step": 18210
|
|
},
|
|
{
|
|
"entropy": 5.5031050682067875,
|
|
"epoch": 1.4171950982299164,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.00048006847444030686,
|
|
"loss": 5.1737,
|
|
"mean_token_accuracy": 0.18476022481918336,
|
|
"num_tokens": 31621580.0,
|
|
"step": 18215
|
|
},
|
|
{
|
|
"entropy": 5.40883584022522,
|
|
"epoch": 1.4175841276016339,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0004800570682690487,
|
|
"loss": 5.1892,
|
|
"mean_token_accuracy": 0.17169617861509323,
|
|
"num_tokens": 31629860.0,
|
|
"step": 18220
|
|
},
|
|
{
|
|
"entropy": 5.516142177581787,
|
|
"epoch": 1.4179731569733516,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.0004800456589863759,
|
|
"loss": 5.2592,
|
|
"mean_token_accuracy": 0.1711919814348221,
|
|
"num_tokens": 31639012.0,
|
|
"step": 18225
|
|
},
|
|
{
|
|
"entropy": 5.4786614894866945,
|
|
"epoch": 1.418362186345069,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0004800342465924616,
|
|
"loss": 5.2831,
|
|
"mean_token_accuracy": 0.17760680317878724,
|
|
"num_tokens": 31648675.0,
|
|
"step": 18230
|
|
},
|
|
{
|
|
"entropy": 5.49333930015564,
|
|
"epoch": 1.4187512157167865,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.000480022831087479,
|
|
"loss": 5.2114,
|
|
"mean_token_accuracy": 0.18882330507040024,
|
|
"num_tokens": 31656570.0,
|
|
"step": 18235
|
|
},
|
|
{
|
|
"entropy": 5.417568731307983,
|
|
"epoch": 1.4191402450885042,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0004800114124716012,
|
|
"loss": 5.1774,
|
|
"mean_token_accuracy": 0.17982569187879563,
|
|
"num_tokens": 31665636.0,
|
|
"step": 18240
|
|
},
|
|
{
|
|
"entropy": 5.537606811523437,
|
|
"epoch": 1.4195292744602217,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0004799999907450015,
|
|
"loss": 5.2892,
|
|
"mean_token_accuracy": 0.17782238572835923,
|
|
"num_tokens": 31673638.0,
|
|
"step": 18245
|
|
},
|
|
{
|
|
"entropy": 5.521145963668824,
|
|
"epoch": 1.4199183038319392,
|
|
"grad_norm": 1.5546875,
|
|
"learning_rate": 0.0004799885659078533,
|
|
"loss": 5.2546,
|
|
"mean_token_accuracy": 0.1782358855009079,
|
|
"num_tokens": 31681886.0,
|
|
"step": 18250
|
|
},
|
|
{
|
|
"entropy": 5.58081955909729,
|
|
"epoch": 1.4203073332036569,
|
|
"grad_norm": 1.5234375,
|
|
"learning_rate": 0.0004799771379603299,
|
|
"loss": 5.3971,
|
|
"mean_token_accuracy": 0.17115249037742614,
|
|
"num_tokens": 31690349.0,
|
|
"step": 18255
|
|
},
|
|
{
|
|
"entropy": 5.454118156433106,
|
|
"epoch": 1.4206963625753746,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.0004799657069026046,
|
|
"loss": 5.2351,
|
|
"mean_token_accuracy": 0.17414960265159607,
|
|
"num_tokens": 31699183.0,
|
|
"step": 18260
|
|
},
|
|
{
|
|
"entropy": 5.479208517074585,
|
|
"epoch": 1.421085391947092,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.00047995427273485097,
|
|
"loss": 5.2241,
|
|
"mean_token_accuracy": 0.18138944804668428,
|
|
"num_tokens": 31707759.0,
|
|
"step": 18265
|
|
},
|
|
{
|
|
"entropy": 5.59560751914978,
|
|
"epoch": 1.4214744213188095,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.00047994283545724247,
|
|
"loss": 5.3637,
|
|
"mean_token_accuracy": 0.16737689077854156,
|
|
"num_tokens": 31716383.0,
|
|
"step": 18270
|
|
},
|
|
{
|
|
"entropy": 5.518065786361694,
|
|
"epoch": 1.4218634506905272,
|
|
"grad_norm": 1.609375,
|
|
"learning_rate": 0.00047993139506995273,
|
|
"loss": 5.2528,
|
|
"mean_token_accuracy": 0.17404465079307557,
|
|
"num_tokens": 31724617.0,
|
|
"step": 18275
|
|
},
|
|
{
|
|
"entropy": 5.464353322982788,
|
|
"epoch": 1.4222524800622447,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.0004799199515731551,
|
|
"loss": 5.19,
|
|
"mean_token_accuracy": 0.18391357064247132,
|
|
"num_tokens": 31732027.0,
|
|
"step": 18280
|
|
},
|
|
{
|
|
"entropy": 5.381789064407348,
|
|
"epoch": 1.4226415094339622,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.00047990850496702346,
|
|
"loss": 5.1561,
|
|
"mean_token_accuracy": 0.18425126373767853,
|
|
"num_tokens": 31740707.0,
|
|
"step": 18285
|
|
},
|
|
{
|
|
"entropy": 5.44275016784668,
|
|
"epoch": 1.4230305388056799,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0004798970552517314,
|
|
"loss": 5.1848,
|
|
"mean_token_accuracy": 0.1795347288250923,
|
|
"num_tokens": 31748864.0,
|
|
"step": 18290
|
|
},
|
|
{
|
|
"entropy": 5.569283866882325,
|
|
"epoch": 1.4234195681773973,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00047988560242745264,
|
|
"loss": 5.3908,
|
|
"mean_token_accuracy": 0.16576953679323198,
|
|
"num_tokens": 31758356.0,
|
|
"step": 18295
|
|
},
|
|
{
|
|
"entropy": 5.548240089416504,
|
|
"epoch": 1.423808597549115,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.000479874146494361,
|
|
"loss": 5.2434,
|
|
"mean_token_accuracy": 0.18585043996572495,
|
|
"num_tokens": 31766911.0,
|
|
"step": 18300
|
|
},
|
|
{
|
|
"entropy": 5.523188591003418,
|
|
"epoch": 1.4241976269208325,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.0004798626874526302,
|
|
"loss": 5.2271,
|
|
"mean_token_accuracy": 0.1728651523590088,
|
|
"num_tokens": 31775551.0,
|
|
"step": 18305
|
|
},
|
|
{
|
|
"entropy": 5.508284044265747,
|
|
"epoch": 1.4245866562925502,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.00047985122530243426,
|
|
"loss": 5.3802,
|
|
"mean_token_accuracy": 0.1662404179573059,
|
|
"num_tokens": 31784064.0,
|
|
"step": 18310
|
|
},
|
|
{
|
|
"entropy": 5.600048637390136,
|
|
"epoch": 1.4249756856642677,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.000479839760043947,
|
|
"loss": 5.2718,
|
|
"mean_token_accuracy": 0.17287858277559282,
|
|
"num_tokens": 31792574.0,
|
|
"step": 18315
|
|
},
|
|
{
|
|
"entropy": 5.480391311645508,
|
|
"epoch": 1.4253647150359852,
|
|
"grad_norm": 1.890625,
|
|
"learning_rate": 0.00047982829167734245,
|
|
"loss": 5.0886,
|
|
"mean_token_accuracy": 0.18848509192466736,
|
|
"num_tokens": 31800331.0,
|
|
"step": 18320
|
|
},
|
|
{
|
|
"entropy": 5.402872228622437,
|
|
"epoch": 1.4257537444077029,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.00047981682020279456,
|
|
"loss": 5.1853,
|
|
"mean_token_accuracy": 0.17700561583042146,
|
|
"num_tokens": 31808474.0,
|
|
"step": 18325
|
|
},
|
|
{
|
|
"entropy": 5.536686372756958,
|
|
"epoch": 1.4261427737794203,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.0004798053456204775,
|
|
"loss": 5.2786,
|
|
"mean_token_accuracy": 0.17116958051919937,
|
|
"num_tokens": 31817026.0,
|
|
"step": 18330
|
|
},
|
|
{
|
|
"entropy": 5.441331386566162,
|
|
"epoch": 1.4265318031511378,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0004797938679305651,
|
|
"loss": 5.1215,
|
|
"mean_token_accuracy": 0.17952772229909897,
|
|
"num_tokens": 31825096.0,
|
|
"step": 18335
|
|
},
|
|
{
|
|
"entropy": 5.44946026802063,
|
|
"epoch": 1.4269208325228555,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00047978238713323193,
|
|
"loss": 5.2624,
|
|
"mean_token_accuracy": 0.17737486958503723,
|
|
"num_tokens": 31833650.0,
|
|
"step": 18340
|
|
},
|
|
{
|
|
"entropy": 5.4915625095367435,
|
|
"epoch": 1.427309861894573,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.00047977090322865183,
|
|
"loss": 5.1914,
|
|
"mean_token_accuracy": 0.1824164569377899,
|
|
"num_tokens": 31841803.0,
|
|
"step": 18345
|
|
},
|
|
{
|
|
"entropy": 5.543830823898316,
|
|
"epoch": 1.4276988912662907,
|
|
"grad_norm": 1.5546875,
|
|
"learning_rate": 0.0004797594162169993,
|
|
"loss": 5.2558,
|
|
"mean_token_accuracy": 0.17973877489566803,
|
|
"num_tokens": 31850121.0,
|
|
"step": 18350
|
|
},
|
|
{
|
|
"entropy": 5.4819482326507565,
|
|
"epoch": 1.4280879206380082,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.0004797479260984485,
|
|
"loss": 5.2168,
|
|
"mean_token_accuracy": 0.1790147453546524,
|
|
"num_tokens": 31858585.0,
|
|
"step": 18355
|
|
},
|
|
{
|
|
"entropy": 5.429919910430908,
|
|
"epoch": 1.4284769500097259,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.00047973643287317386,
|
|
"loss": 5.2035,
|
|
"mean_token_accuracy": 0.17699279338121415,
|
|
"num_tokens": 31866199.0,
|
|
"step": 18360
|
|
},
|
|
{
|
|
"entropy": 5.46229739189148,
|
|
"epoch": 1.4288659793814433,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.00047972493654134963,
|
|
"loss": 5.2324,
|
|
"mean_token_accuracy": 0.17713208198547364,
|
|
"num_tokens": 31875423.0,
|
|
"step": 18365
|
|
},
|
|
{
|
|
"entropy": 5.460847282409668,
|
|
"epoch": 1.4292550087531608,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 0.00047971343710315043,
|
|
"loss": 5.0972,
|
|
"mean_token_accuracy": 0.18757133483886718,
|
|
"num_tokens": 31883110.0,
|
|
"step": 18370
|
|
},
|
|
{
|
|
"entropy": 5.427517366409302,
|
|
"epoch": 1.4296440381248785,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0004797019345587506,
|
|
"loss": 5.2325,
|
|
"mean_token_accuracy": 0.17970472127199172,
|
|
"num_tokens": 31891588.0,
|
|
"step": 18375
|
|
},
|
|
{
|
|
"entropy": 5.420027256011963,
|
|
"epoch": 1.430033067496596,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0004796904289083248,
|
|
"loss": 5.1793,
|
|
"mean_token_accuracy": 0.1820973977446556,
|
|
"num_tokens": 31900671.0,
|
|
"step": 18380
|
|
},
|
|
{
|
|
"entropy": 5.505449867248535,
|
|
"epoch": 1.4304220968683135,
|
|
"grad_norm": 1.609375,
|
|
"learning_rate": 0.0004796789201520474,
|
|
"loss": 5.2495,
|
|
"mean_token_accuracy": 0.17633761316537858,
|
|
"num_tokens": 31909188.0,
|
|
"step": 18385
|
|
},
|
|
{
|
|
"entropy": 5.475505638122558,
|
|
"epoch": 1.4308111262400312,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.00047966740829009333,
|
|
"loss": 5.1678,
|
|
"mean_token_accuracy": 0.1832387551665306,
|
|
"num_tokens": 31917607.0,
|
|
"step": 18390
|
|
},
|
|
{
|
|
"entropy": 5.501669931411743,
|
|
"epoch": 1.4312001556117486,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.000479655893322637,
|
|
"loss": 5.2505,
|
|
"mean_token_accuracy": 0.17494168281555175,
|
|
"num_tokens": 31926510.0,
|
|
"step": 18395
|
|
},
|
|
{
|
|
"entropy": 5.528379726409912,
|
|
"epoch": 1.4315891849834663,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0004796443752498532,
|
|
"loss": 5.3524,
|
|
"mean_token_accuracy": 0.1656708225607872,
|
|
"num_tokens": 31935550.0,
|
|
"step": 18400
|
|
},
|
|
{
|
|
"entropy": 5.613227891921997,
|
|
"epoch": 1.4319782143551838,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0004796328540719169,
|
|
"loss": 5.3974,
|
|
"mean_token_accuracy": 0.16702781468629838,
|
|
"num_tokens": 31944499.0,
|
|
"step": 18405
|
|
},
|
|
{
|
|
"entropy": 5.535029125213623,
|
|
"epoch": 1.4323672437269015,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.0004796213297890026,
|
|
"loss": 5.1245,
|
|
"mean_token_accuracy": 0.19094879031181336,
|
|
"num_tokens": 31952622.0,
|
|
"step": 18410
|
|
},
|
|
{
|
|
"entropy": 5.4266517162323,
|
|
"epoch": 1.432756273098619,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.0004796098024012853,
|
|
"loss": 5.1885,
|
|
"mean_token_accuracy": 0.1793039008975029,
|
|
"num_tokens": 31961606.0,
|
|
"step": 18415
|
|
},
|
|
{
|
|
"entropy": 5.4624498844146725,
|
|
"epoch": 1.4331453024703364,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00047959827190894,
|
|
"loss": 5.3004,
|
|
"mean_token_accuracy": 0.1734811007976532,
|
|
"num_tokens": 31970312.0,
|
|
"step": 18420
|
|
},
|
|
{
|
|
"entropy": 5.5558093070983885,
|
|
"epoch": 1.4335343318420541,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.00047958673831214157,
|
|
"loss": 5.2538,
|
|
"mean_token_accuracy": 0.17742112874984742,
|
|
"num_tokens": 31978718.0,
|
|
"step": 18425
|
|
},
|
|
{
|
|
"entropy": 5.583144092559815,
|
|
"epoch": 1.4339233612137716,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.00047957520161106496,
|
|
"loss": 5.2838,
|
|
"mean_token_accuracy": 0.17255945801734923,
|
|
"num_tokens": 31987451.0,
|
|
"step": 18430
|
|
},
|
|
{
|
|
"entropy": 5.448249483108521,
|
|
"epoch": 1.434312390585489,
|
|
"grad_norm": 1.609375,
|
|
"learning_rate": 0.0004795636618058853,
|
|
"loss": 5.0599,
|
|
"mean_token_accuracy": 0.19537626057863236,
|
|
"num_tokens": 31994977.0,
|
|
"step": 18435
|
|
},
|
|
{
|
|
"entropy": 5.373802995681762,
|
|
"epoch": 1.4347014199572068,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.0004795521188967777,
|
|
"loss": 5.1524,
|
|
"mean_token_accuracy": 0.18869252800941466,
|
|
"num_tokens": 32003804.0,
|
|
"step": 18440
|
|
},
|
|
{
|
|
"entropy": 5.56097264289856,
|
|
"epoch": 1.4350904493289243,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0004795405728839172,
|
|
"loss": 5.2986,
|
|
"mean_token_accuracy": 0.16838204860687256,
|
|
"num_tokens": 32012090.0,
|
|
"step": 18445
|
|
},
|
|
{
|
|
"entropy": 5.4632055282592775,
|
|
"epoch": 1.435479478700642,
|
|
"grad_norm": 1.6640625,
|
|
"learning_rate": 0.0004795290237674792,
|
|
"loss": 5.2199,
|
|
"mean_token_accuracy": 0.18055543154478074,
|
|
"num_tokens": 32019664.0,
|
|
"step": 18450
|
|
},
|
|
{
|
|
"entropy": 5.497677898406982,
|
|
"epoch": 1.4358685080723594,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.00047951747154763866,
|
|
"loss": 5.3017,
|
|
"mean_token_accuracy": 0.17322807908058166,
|
|
"num_tokens": 32028457.0,
|
|
"step": 18455
|
|
},
|
|
{
|
|
"entropy": 5.464205551147461,
|
|
"epoch": 1.4362575374440771,
|
|
"grad_norm": 1.71875,
|
|
"learning_rate": 0.00047950591622457106,
|
|
"loss": 5.1153,
|
|
"mean_token_accuracy": 0.18159251809120178,
|
|
"num_tokens": 32036730.0,
|
|
"step": 18460
|
|
},
|
|
{
|
|
"entropy": 5.514876031875611,
|
|
"epoch": 1.4366465668157946,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.00047949435779845174,
|
|
"loss": 5.3168,
|
|
"mean_token_accuracy": 0.1727965295314789,
|
|
"num_tokens": 32045657.0,
|
|
"step": 18465
|
|
},
|
|
{
|
|
"entropy": 5.44603705406189,
|
|
"epoch": 1.437035596187512,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00047948279626945596,
|
|
"loss": 5.2049,
|
|
"mean_token_accuracy": 0.17871636971831323,
|
|
"num_tokens": 32053973.0,
|
|
"step": 18470
|
|
},
|
|
{
|
|
"entropy": 5.5791268825531,
|
|
"epoch": 1.4374246255592298,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.00047947123163775924,
|
|
"loss": 5.3411,
|
|
"mean_token_accuracy": 0.1693403020501137,
|
|
"num_tokens": 32062833.0,
|
|
"step": 18475
|
|
},
|
|
{
|
|
"entropy": 5.450551843643188,
|
|
"epoch": 1.4378136549309473,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.000479459663903537,
|
|
"loss": 5.1922,
|
|
"mean_token_accuracy": 0.18252055794000627,
|
|
"num_tokens": 32071578.0,
|
|
"step": 18480
|
|
},
|
|
{
|
|
"entropy": 5.434541797637939,
|
|
"epoch": 1.4382026843026647,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0004794480930669649,
|
|
"loss": 5.1302,
|
|
"mean_token_accuracy": 0.18050495386123658,
|
|
"num_tokens": 32079847.0,
|
|
"step": 18485
|
|
},
|
|
{
|
|
"entropy": 5.468673419952393,
|
|
"epoch": 1.4385917136743824,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 0.0004794365191282183,
|
|
"loss": 5.1935,
|
|
"mean_token_accuracy": 0.17572144120931626,
|
|
"num_tokens": 32089751.0,
|
|
"step": 18490
|
|
},
|
|
{
|
|
"entropy": 5.5339319705963135,
|
|
"epoch": 1.4389807430461,
|
|
"grad_norm": 1.5078125,
|
|
"learning_rate": 0.00047942494208747297,
|
|
"loss": 5.3466,
|
|
"mean_token_accuracy": 0.1754387304186821,
|
|
"num_tokens": 32097791.0,
|
|
"step": 18495
|
|
},
|
|
{
|
|
"entropy": 5.49284257888794,
|
|
"epoch": 1.4393697724178176,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0004794133619449045,
|
|
"loss": 5.1558,
|
|
"mean_token_accuracy": 0.18228802382946013,
|
|
"num_tokens": 32106417.0,
|
|
"step": 18500
|
|
},
|
|
{
|
|
"entropy": 5.448126602172851,
|
|
"epoch": 1.439758801789535,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.0004794017787006886,
|
|
"loss": 5.2457,
|
|
"mean_token_accuracy": 0.1746419295668602,
|
|
"num_tokens": 32115035.0,
|
|
"step": 18505
|
|
},
|
|
{
|
|
"entropy": 5.433640003204346,
|
|
"epoch": 1.4401478311612528,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.000479390192355001,
|
|
"loss": 5.2165,
|
|
"mean_token_accuracy": 0.17342013865709305,
|
|
"num_tokens": 32123704.0,
|
|
"step": 18510
|
|
},
|
|
{
|
|
"entropy": 5.593865299224854,
|
|
"epoch": 1.4405368605329703,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.0004793786029080176,
|
|
"loss": 5.3081,
|
|
"mean_token_accuracy": 0.17159412205219268,
|
|
"num_tokens": 32132672.0,
|
|
"step": 18515
|
|
},
|
|
{
|
|
"entropy": 5.412581300735473,
|
|
"epoch": 1.4409258899046877,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.0004793670103599143,
|
|
"loss": 5.1891,
|
|
"mean_token_accuracy": 0.1784740060567856,
|
|
"num_tokens": 32142135.0,
|
|
"step": 18520
|
|
},
|
|
{
|
|
"entropy": 5.443901443481446,
|
|
"epoch": 1.4413149192764054,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.00047935541471086677,
|
|
"loss": 5.2897,
|
|
"mean_token_accuracy": 0.16665616184473037,
|
|
"num_tokens": 32151261.0,
|
|
"step": 18525
|
|
},
|
|
{
|
|
"entropy": 5.471156406402588,
|
|
"epoch": 1.441703948648123,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0004793438159610511,
|
|
"loss": 5.1728,
|
|
"mean_token_accuracy": 0.1797388091683388,
|
|
"num_tokens": 32159454.0,
|
|
"step": 18530
|
|
},
|
|
{
|
|
"entropy": 5.580642032623291,
|
|
"epoch": 1.4420929780198404,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.00047933221411064334,
|
|
"loss": 5.2783,
|
|
"mean_token_accuracy": 0.1684955030679703,
|
|
"num_tokens": 32168706.0,
|
|
"step": 18535
|
|
},
|
|
{
|
|
"entropy": 5.602070426940918,
|
|
"epoch": 1.442482007391558,
|
|
"grad_norm": 1.4921875,
|
|
"learning_rate": 0.0004793206091598194,
|
|
"loss": 5.3592,
|
|
"mean_token_accuracy": 0.1691383183002472,
|
|
"num_tokens": 32177892.0,
|
|
"step": 18540
|
|
},
|
|
{
|
|
"entropy": 5.483515214920044,
|
|
"epoch": 1.4428710367632755,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0004793090011087554,
|
|
"loss": 5.2141,
|
|
"mean_token_accuracy": 0.18537631183862685,
|
|
"num_tokens": 32186081.0,
|
|
"step": 18545
|
|
},
|
|
{
|
|
"entropy": 5.477320384979248,
|
|
"epoch": 1.4432600661349932,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00047929738995762755,
|
|
"loss": 5.1997,
|
|
"mean_token_accuracy": 0.18172577619552613,
|
|
"num_tokens": 32193778.0,
|
|
"step": 18550
|
|
},
|
|
{
|
|
"entropy": 5.368476533889771,
|
|
"epoch": 1.4436490955067107,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.000479285775706612,
|
|
"loss": 5.166,
|
|
"mean_token_accuracy": 0.18344126641750336,
|
|
"num_tokens": 32202773.0,
|
|
"step": 18555
|
|
},
|
|
{
|
|
"entropy": 5.464862871170044,
|
|
"epoch": 1.4440381248784284,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.00047927415835588496,
|
|
"loss": 5.1998,
|
|
"mean_token_accuracy": 0.18280504047870635,
|
|
"num_tokens": 32212105.0,
|
|
"step": 18560
|
|
},
|
|
{
|
|
"entropy": 5.415600538253784,
|
|
"epoch": 1.444427154250146,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.00047926253790562265,
|
|
"loss": 5.076,
|
|
"mean_token_accuracy": 0.18748060315847398,
|
|
"num_tokens": 32220550.0,
|
|
"step": 18565
|
|
},
|
|
{
|
|
"entropy": 5.401068544387817,
|
|
"epoch": 1.4448161836218634,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 0.00047925091435600147,
|
|
"loss": 5.0916,
|
|
"mean_token_accuracy": 0.18292773365974427,
|
|
"num_tokens": 32228562.0,
|
|
"step": 18570
|
|
},
|
|
{
|
|
"entropy": 5.466281318664551,
|
|
"epoch": 1.445205212993581,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00047923928770719776,
|
|
"loss": 5.2598,
|
|
"mean_token_accuracy": 0.17952028661966324,
|
|
"num_tokens": 32237172.0,
|
|
"step": 18575
|
|
},
|
|
{
|
|
"entropy": 5.460274076461792,
|
|
"epoch": 1.4455942423652985,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.00047922765795938797,
|
|
"loss": 5.229,
|
|
"mean_token_accuracy": 0.18011214584112167,
|
|
"num_tokens": 32246211.0,
|
|
"step": 18580
|
|
},
|
|
{
|
|
"entropy": 5.399421358108521,
|
|
"epoch": 1.445983271737016,
|
|
"grad_norm": 1.609375,
|
|
"learning_rate": 0.0004792160251127485,
|
|
"loss": 5.1385,
|
|
"mean_token_accuracy": 0.1861582189798355,
|
|
"num_tokens": 32255366.0,
|
|
"step": 18585
|
|
},
|
|
{
|
|
"entropy": 5.514032888412475,
|
|
"epoch": 1.4463723011087337,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.00047920438916745586,
|
|
"loss": 5.3354,
|
|
"mean_token_accuracy": 0.16853050887584686,
|
|
"num_tokens": 32264342.0,
|
|
"step": 18590
|
|
},
|
|
{
|
|
"entropy": 5.51638126373291,
|
|
"epoch": 1.4467613304804512,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.0004791927501236866,
|
|
"loss": 5.2772,
|
|
"mean_token_accuracy": 0.17963633686304092,
|
|
"num_tokens": 32273184.0,
|
|
"step": 18595
|
|
},
|
|
{
|
|
"entropy": 5.548255968093872,
|
|
"epoch": 1.4471503598521689,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.00047918110798161754,
|
|
"loss": 5.2857,
|
|
"mean_token_accuracy": 0.1705787032842636,
|
|
"num_tokens": 32282303.0,
|
|
"step": 18600
|
|
},
|
|
{
|
|
"entropy": 5.510072803497314,
|
|
"epoch": 1.4475393892238864,
|
|
"grad_norm": 1.515625,
|
|
"learning_rate": 0.00047916946274142503,
|
|
"loss": 5.1781,
|
|
"mean_token_accuracy": 0.18537161499261856,
|
|
"num_tokens": 32291118.0,
|
|
"step": 18605
|
|
},
|
|
{
|
|
"entropy": 5.507492637634277,
|
|
"epoch": 1.447928418595604,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.00047915781440328593,
|
|
"loss": 5.2385,
|
|
"mean_token_accuracy": 0.16987878531217576,
|
|
"num_tokens": 32299746.0,
|
|
"step": 18610
|
|
},
|
|
{
|
|
"entropy": 5.432093000411987,
|
|
"epoch": 1.4483174479673215,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0004791461629673769,
|
|
"loss": 5.2258,
|
|
"mean_token_accuracy": 0.18358027786016465,
|
|
"num_tokens": 32308515.0,
|
|
"step": 18615
|
|
},
|
|
{
|
|
"entropy": 5.538900089263916,
|
|
"epoch": 1.448706477339039,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0004791345084338748,
|
|
"loss": 5.367,
|
|
"mean_token_accuracy": 0.17313355803489686,
|
|
"num_tokens": 32317607.0,
|
|
"step": 18620
|
|
},
|
|
{
|
|
"entropy": 5.564659833908081,
|
|
"epoch": 1.4490955067107567,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.0004791228508029565,
|
|
"loss": 5.255,
|
|
"mean_token_accuracy": 0.17707549333572387,
|
|
"num_tokens": 32325822.0,
|
|
"step": 18625
|
|
},
|
|
{
|
|
"entropy": 5.52716760635376,
|
|
"epoch": 1.4494845360824742,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00047911119007479873,
|
|
"loss": 5.3362,
|
|
"mean_token_accuracy": 0.1719816282391548,
|
|
"num_tokens": 32336297.0,
|
|
"step": 18630
|
|
},
|
|
{
|
|
"entropy": 5.496382761001587,
|
|
"epoch": 1.4498735654541917,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.00047909952624957866,
|
|
"loss": 5.2099,
|
|
"mean_token_accuracy": 0.17675570249557496,
|
|
"num_tokens": 32344306.0,
|
|
"step": 18635
|
|
},
|
|
{
|
|
"entropy": 5.526102209091187,
|
|
"epoch": 1.4502625948259094,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.000479087859327473,
|
|
"loss": 5.3372,
|
|
"mean_token_accuracy": 0.17576269656419755,
|
|
"num_tokens": 32353668.0,
|
|
"step": 18640
|
|
},
|
|
{
|
|
"entropy": 5.500024127960205,
|
|
"epoch": 1.450651624197627,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.000479076189308659,
|
|
"loss": 5.1966,
|
|
"mean_token_accuracy": 0.17442311942577363,
|
|
"num_tokens": 32361563.0,
|
|
"step": 18645
|
|
},
|
|
{
|
|
"entropy": 5.562808513641357,
|
|
"epoch": 1.4510406535693445,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.00047906451619331364,
|
|
"loss": 5.3309,
|
|
"mean_token_accuracy": 0.17551316022872926,
|
|
"num_tokens": 32369612.0,
|
|
"step": 18650
|
|
},
|
|
{
|
|
"entropy": 5.442113637924194,
|
|
"epoch": 1.451429682941062,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.00047905283998161404,
|
|
"loss": 5.1341,
|
|
"mean_token_accuracy": 0.18217557072639465,
|
|
"num_tokens": 32379013.0,
|
|
"step": 18655
|
|
},
|
|
{
|
|
"entropy": 5.401201629638672,
|
|
"epoch": 1.4518187123127797,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.00047904116067373743,
|
|
"loss": 5.2042,
|
|
"mean_token_accuracy": 0.17736102342605592,
|
|
"num_tokens": 32387933.0,
|
|
"step": 18660
|
|
},
|
|
{
|
|
"entropy": 5.484335470199585,
|
|
"epoch": 1.4522077416844972,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0004790294782698609,
|
|
"loss": 5.2784,
|
|
"mean_token_accuracy": 0.17783260345458984,
|
|
"num_tokens": 32395669.0,
|
|
"step": 18665
|
|
},
|
|
{
|
|
"entropy": 5.403977632522583,
|
|
"epoch": 1.4525967710562147,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.0004790177927701618,
|
|
"loss": 5.1197,
|
|
"mean_token_accuracy": 0.18963489234447478,
|
|
"num_tokens": 32403676.0,
|
|
"step": 18670
|
|
},
|
|
{
|
|
"entropy": 5.458328151702881,
|
|
"epoch": 1.4529858004279324,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.0004790061041748174,
|
|
"loss": 5.2037,
|
|
"mean_token_accuracy": 0.18194677978754042,
|
|
"num_tokens": 32412089.0,
|
|
"step": 18675
|
|
},
|
|
{
|
|
"entropy": 5.511987686157227,
|
|
"epoch": 1.4533748297996498,
|
|
"grad_norm": 1.5078125,
|
|
"learning_rate": 0.0004789944124840051,
|
|
"loss": 5.1776,
|
|
"mean_token_accuracy": 0.18360118865966796,
|
|
"num_tokens": 32420357.0,
|
|
"step": 18680
|
|
},
|
|
{
|
|
"entropy": 5.536622619628906,
|
|
"epoch": 1.4537638591713673,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0004789827176979022,
|
|
"loss": 5.2546,
|
|
"mean_token_accuracy": 0.1797065556049347,
|
|
"num_tokens": 32429118.0,
|
|
"step": 18685
|
|
},
|
|
{
|
|
"entropy": 5.520533895492553,
|
|
"epoch": 1.454152888543085,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0004789710198166864,
|
|
"loss": 5.1774,
|
|
"mean_token_accuracy": 0.17354135662317277,
|
|
"num_tokens": 32437266.0,
|
|
"step": 18690
|
|
},
|
|
{
|
|
"entropy": 5.483531284332275,
|
|
"epoch": 1.4545419179148027,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.00047895931884053497,
|
|
"loss": 5.2801,
|
|
"mean_token_accuracy": 0.17534692734479904,
|
|
"num_tokens": 32446014.0,
|
|
"step": 18695
|
|
},
|
|
{
|
|
"entropy": 5.448425960540772,
|
|
"epoch": 1.4549309472865202,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.00047894761476962547,
|
|
"loss": 5.2779,
|
|
"mean_token_accuracy": 0.17118306010961531,
|
|
"num_tokens": 32454591.0,
|
|
"step": 18700
|
|
},
|
|
{
|
|
"entropy": 5.4775416374206545,
|
|
"epoch": 1.4553199766582376,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.00047893590760413545,
|
|
"loss": 5.2316,
|
|
"mean_token_accuracy": 0.17925910353660585,
|
|
"num_tokens": 32462748.0,
|
|
"step": 18705
|
|
},
|
|
{
|
|
"entropy": 5.4649430274963375,
|
|
"epoch": 1.4557090060299553,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.00047892419734424276,
|
|
"loss": 5.1994,
|
|
"mean_token_accuracy": 0.1781282439827919,
|
|
"num_tokens": 32471792.0,
|
|
"step": 18710
|
|
},
|
|
{
|
|
"entropy": 5.494879484176636,
|
|
"epoch": 1.4560980354016728,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00047891248399012495,
|
|
"loss": 5.2957,
|
|
"mean_token_accuracy": 0.1818397805094719,
|
|
"num_tokens": 32480804.0,
|
|
"step": 18715
|
|
},
|
|
{
|
|
"entropy": 5.57960958480835,
|
|
"epoch": 1.4564870647733903,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0004789007675419597,
|
|
"loss": 5.194,
|
|
"mean_token_accuracy": 0.178276626765728,
|
|
"num_tokens": 32489591.0,
|
|
"step": 18720
|
|
},
|
|
{
|
|
"entropy": 5.470126295089722,
|
|
"epoch": 1.456876094145108,
|
|
"grad_norm": 2.65625,
|
|
"learning_rate": 0.00047888904799992486,
|
|
"loss": 5.2356,
|
|
"mean_token_accuracy": 0.17744988799095154,
|
|
"num_tokens": 32498164.0,
|
|
"step": 18725
|
|
},
|
|
{
|
|
"entropy": 5.390956878662109,
|
|
"epoch": 1.4572651235168255,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.00047887732536419826,
|
|
"loss": 5.0426,
|
|
"mean_token_accuracy": 0.18851525485515594,
|
|
"num_tokens": 32505909.0,
|
|
"step": 18730
|
|
},
|
|
{
|
|
"entropy": 5.411091756820679,
|
|
"epoch": 1.4576541528885432,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.0004788655996349577,
|
|
"loss": 5.1841,
|
|
"mean_token_accuracy": 0.17994549572467805,
|
|
"num_tokens": 32513990.0,
|
|
"step": 18735
|
|
},
|
|
{
|
|
"entropy": 5.420747470855713,
|
|
"epoch": 1.4580431822602606,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.00047885387081238125,
|
|
"loss": 5.2125,
|
|
"mean_token_accuracy": 0.18109757751226424,
|
|
"num_tokens": 32522932.0,
|
|
"step": 18740
|
|
},
|
|
{
|
|
"entropy": 5.474479341506958,
|
|
"epoch": 1.4584322116319783,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 0.0004788421388966467,
|
|
"loss": 5.3118,
|
|
"mean_token_accuracy": 0.177246156334877,
|
|
"num_tokens": 32530953.0,
|
|
"step": 18745
|
|
},
|
|
{
|
|
"entropy": 5.480226516723633,
|
|
"epoch": 1.4588212410036958,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.00047883040388793207,
|
|
"loss": 5.1468,
|
|
"mean_token_accuracy": 0.17467701733112334,
|
|
"num_tokens": 32539812.0,
|
|
"step": 18750
|
|
},
|
|
{
|
|
"entropy": 5.438571119308472,
|
|
"epoch": 1.4592102703754133,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.00047881866578641563,
|
|
"loss": 5.1473,
|
|
"mean_token_accuracy": 0.1777130052447319,
|
|
"num_tokens": 32548425.0,
|
|
"step": 18755
|
|
},
|
|
{
|
|
"entropy": 5.434152555465698,
|
|
"epoch": 1.459599299747131,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.0004788069245922753,
|
|
"loss": 5.2105,
|
|
"mean_token_accuracy": 0.1789073407649994,
|
|
"num_tokens": 32557619.0,
|
|
"step": 18760
|
|
},
|
|
{
|
|
"entropy": 5.479773998260498,
|
|
"epoch": 1.4599883291188485,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0004787951803056893,
|
|
"loss": 5.2367,
|
|
"mean_token_accuracy": 0.1725791111588478,
|
|
"num_tokens": 32565602.0,
|
|
"step": 18765
|
|
},
|
|
{
|
|
"entropy": 5.484281969070435,
|
|
"epoch": 1.460377358490566,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0004787834329268358,
|
|
"loss": 5.2409,
|
|
"mean_token_accuracy": 0.17615429162979127,
|
|
"num_tokens": 32573691.0,
|
|
"step": 18770
|
|
},
|
|
{
|
|
"entropy": 5.495927047729492,
|
|
"epoch": 1.4607663878622836,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.000478771682455893,
|
|
"loss": 5.321,
|
|
"mean_token_accuracy": 0.1695410579442978,
|
|
"num_tokens": 32582642.0,
|
|
"step": 18775
|
|
},
|
|
{
|
|
"entropy": 5.5170002460479735,
|
|
"epoch": 1.461155417234001,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0004787599288930393,
|
|
"loss": 5.2558,
|
|
"mean_token_accuracy": 0.17524343878030776,
|
|
"num_tokens": 32591328.0,
|
|
"step": 18780
|
|
},
|
|
{
|
|
"entropy": 5.486884832382202,
|
|
"epoch": 1.4615444466057188,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.000478748172238453,
|
|
"loss": 5.1828,
|
|
"mean_token_accuracy": 0.17761124074459075,
|
|
"num_tokens": 32599286.0,
|
|
"step": 18785
|
|
},
|
|
{
|
|
"entropy": 5.544167804718017,
|
|
"epoch": 1.4619334759774363,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0004787364124923125,
|
|
"loss": 5.3507,
|
|
"mean_token_accuracy": 0.16819806545972824,
|
|
"num_tokens": 32608156.0,
|
|
"step": 18790
|
|
},
|
|
{
|
|
"entropy": 5.461387491226196,
|
|
"epoch": 1.462322505349154,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.00047872464965479625,
|
|
"loss": 5.1464,
|
|
"mean_token_accuracy": 0.18480401635169982,
|
|
"num_tokens": 32616134.0,
|
|
"step": 18795
|
|
},
|
|
{
|
|
"entropy": 5.441110849380493,
|
|
"epoch": 1.4627115347208715,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.0004787128837260826,
|
|
"loss": 5.2157,
|
|
"mean_token_accuracy": 0.17601969093084335,
|
|
"num_tokens": 32624711.0,
|
|
"step": 18800
|
|
},
|
|
{
|
|
"entropy": 5.48026328086853,
|
|
"epoch": 1.463100564092589,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0004787011147063503,
|
|
"loss": 5.2206,
|
|
"mean_token_accuracy": 0.18145304322242736,
|
|
"num_tokens": 32633049.0,
|
|
"step": 18805
|
|
},
|
|
{
|
|
"entropy": 5.472019863128662,
|
|
"epoch": 1.4634895934643066,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 0.0004786893425957777,
|
|
"loss": 5.1664,
|
|
"mean_token_accuracy": 0.17998918294906616,
|
|
"num_tokens": 32641173.0,
|
|
"step": 18810
|
|
},
|
|
{
|
|
"entropy": 5.45564374923706,
|
|
"epoch": 1.463878622836024,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0004786775673945436,
|
|
"loss": 5.1643,
|
|
"mean_token_accuracy": 0.18290238082408905,
|
|
"num_tokens": 32650275.0,
|
|
"step": 18815
|
|
},
|
|
{
|
|
"entropy": 5.428669404983521,
|
|
"epoch": 1.4642676522077416,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.00047866578910282656,
|
|
"loss": 5.18,
|
|
"mean_token_accuracy": 0.18925225883722305,
|
|
"num_tokens": 32658675.0,
|
|
"step": 18820
|
|
},
|
|
{
|
|
"entropy": 5.444432020187378,
|
|
"epoch": 1.4646566815794593,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.00047865400772080535,
|
|
"loss": 5.1829,
|
|
"mean_token_accuracy": 0.17841393500566483,
|
|
"num_tokens": 32666643.0,
|
|
"step": 18825
|
|
},
|
|
{
|
|
"entropy": 5.459620141983033,
|
|
"epoch": 1.4650457109511767,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.00047864222324865875,
|
|
"loss": 5.09,
|
|
"mean_token_accuracy": 0.18572174608707429,
|
|
"num_tokens": 32674791.0,
|
|
"step": 18830
|
|
},
|
|
{
|
|
"entropy": 5.450570964813233,
|
|
"epoch": 1.4654347403228944,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0004786304356865655,
|
|
"loss": 5.1803,
|
|
"mean_token_accuracy": 0.18987230509519576,
|
|
"num_tokens": 32682790.0,
|
|
"step": 18835
|
|
},
|
|
{
|
|
"entropy": 5.476630544662475,
|
|
"epoch": 1.465823769694612,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.00047861864503470457,
|
|
"loss": 5.3196,
|
|
"mean_token_accuracy": 0.172784686088562,
|
|
"num_tokens": 32692701.0,
|
|
"step": 18840
|
|
},
|
|
{
|
|
"entropy": 5.529924201965332,
|
|
"epoch": 1.4662127990663296,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0004786068512932547,
|
|
"loss": 5.2503,
|
|
"mean_token_accuracy": 0.17849311232566833,
|
|
"num_tokens": 32701297.0,
|
|
"step": 18845
|
|
},
|
|
{
|
|
"entropy": 5.508241748809814,
|
|
"epoch": 1.466601828438047,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.000478595054462395,
|
|
"loss": 5.1598,
|
|
"mean_token_accuracy": 0.18130504935979844,
|
|
"num_tokens": 32710188.0,
|
|
"step": 18850
|
|
},
|
|
{
|
|
"entropy": 5.42124834060669,
|
|
"epoch": 1.4669908578097646,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00047858325454230437,
|
|
"loss": 5.2217,
|
|
"mean_token_accuracy": 0.1808610126376152,
|
|
"num_tokens": 32719255.0,
|
|
"step": 18855
|
|
},
|
|
{
|
|
"entropy": 5.479483509063721,
|
|
"epoch": 1.4673798871814823,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.0004785714515331619,
|
|
"loss": 5.27,
|
|
"mean_token_accuracy": 0.17980635315179824,
|
|
"num_tokens": 32728133.0,
|
|
"step": 18860
|
|
},
|
|
{
|
|
"entropy": 5.534544038772583,
|
|
"epoch": 1.4677689165531997,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.00047855964543514666,
|
|
"loss": 5.262,
|
|
"mean_token_accuracy": 0.17740251868963242,
|
|
"num_tokens": 32736333.0,
|
|
"step": 18865
|
|
},
|
|
{
|
|
"entropy": 5.3996328830719,
|
|
"epoch": 1.4681579459249172,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.00047854783624843786,
|
|
"loss": 5.1665,
|
|
"mean_token_accuracy": 0.18552245050668717,
|
|
"num_tokens": 32744954.0,
|
|
"step": 18870
|
|
},
|
|
{
|
|
"entropy": 5.396755743026733,
|
|
"epoch": 1.468546975296635,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.00047853602397321453,
|
|
"loss": 5.2458,
|
|
"mean_token_accuracy": 0.18212308287620543,
|
|
"num_tokens": 32753720.0,
|
|
"step": 18875
|
|
},
|
|
{
|
|
"entropy": 5.522083806991577,
|
|
"epoch": 1.4689360046683524,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.00047852420860965605,
|
|
"loss": 5.1272,
|
|
"mean_token_accuracy": 0.1841589704155922,
|
|
"num_tokens": 32762903.0,
|
|
"step": 18880
|
|
},
|
|
{
|
|
"entropy": 5.576237392425537,
|
|
"epoch": 1.46932503404007,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.00047851239015794166,
|
|
"loss": 5.3113,
|
|
"mean_token_accuracy": 0.17154305726289748,
|
|
"num_tokens": 32771367.0,
|
|
"step": 18885
|
|
},
|
|
{
|
|
"entropy": 5.482736396789551,
|
|
"epoch": 1.4697140634117876,
|
|
"grad_norm": 1.5703125,
|
|
"learning_rate": 0.00047850056861825066,
|
|
"loss": 5.2397,
|
|
"mean_token_accuracy": 0.17780001908540727,
|
|
"num_tokens": 32779782.0,
|
|
"step": 18890
|
|
},
|
|
{
|
|
"entropy": 5.4111613750457765,
|
|
"epoch": 1.4701030927835053,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.00047848874399076245,
|
|
"loss": 5.118,
|
|
"mean_token_accuracy": 0.17996083199977875,
|
|
"num_tokens": 32788157.0,
|
|
"step": 18895
|
|
},
|
|
{
|
|
"entropy": 5.397430038452148,
|
|
"epoch": 1.4704921221552227,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.0004784769162756563,
|
|
"loss": 5.1038,
|
|
"mean_token_accuracy": 0.18671779334545135,
|
|
"num_tokens": 32796590.0,
|
|
"step": 18900
|
|
},
|
|
{
|
|
"entropy": 5.531782150268555,
|
|
"epoch": 1.4708811515269402,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.000478465085473112,
|
|
"loss": 5.3649,
|
|
"mean_token_accuracy": 0.1690208226442337,
|
|
"num_tokens": 32806297.0,
|
|
"step": 18905
|
|
},
|
|
{
|
|
"entropy": 5.512090110778809,
|
|
"epoch": 1.471270180898658,
|
|
"grad_norm": 1.6015625,
|
|
"learning_rate": 0.0004784532515833088,
|
|
"loss": 5.196,
|
|
"mean_token_accuracy": 0.1851867228746414,
|
|
"num_tokens": 32815370.0,
|
|
"step": 18910
|
|
},
|
|
{
|
|
"entropy": 5.4117820262908936,
|
|
"epoch": 1.4716592102703754,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.00047844141460642636,
|
|
"loss": 5.2196,
|
|
"mean_token_accuracy": 0.1765821933746338,
|
|
"num_tokens": 32824678.0,
|
|
"step": 18915
|
|
},
|
|
{
|
|
"entropy": 5.5388978004455565,
|
|
"epoch": 1.4720482396420929,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.00047842957454264425,
|
|
"loss": 5.2919,
|
|
"mean_token_accuracy": 0.17475738674402236,
|
|
"num_tokens": 32834759.0,
|
|
"step": 18920
|
|
},
|
|
{
|
|
"entropy": 5.558327293395996,
|
|
"epoch": 1.4724372690138106,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.00047841773139214213,
|
|
"loss": 5.2462,
|
|
"mean_token_accuracy": 0.17976084649562835,
|
|
"num_tokens": 32843152.0,
|
|
"step": 18925
|
|
},
|
|
{
|
|
"entropy": 5.573939609527588,
|
|
"epoch": 1.472826298385528,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0004784058851550997,
|
|
"loss": 5.4354,
|
|
"mean_token_accuracy": 0.16532717347145082,
|
|
"num_tokens": 32852702.0,
|
|
"step": 18930
|
|
},
|
|
{
|
|
"entropy": 5.479413843154907,
|
|
"epoch": 1.4732153277572457,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.0004783940358316967,
|
|
"loss": 5.1146,
|
|
"mean_token_accuracy": 0.18592068403959275,
|
|
"num_tokens": 32860201.0,
|
|
"step": 18935
|
|
},
|
|
{
|
|
"entropy": 5.404597234725952,
|
|
"epoch": 1.4736043571289632,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.00047838218342211296,
|
|
"loss": 5.0865,
|
|
"mean_token_accuracy": 0.19167012125253677,
|
|
"num_tokens": 32868731.0,
|
|
"step": 18940
|
|
},
|
|
{
|
|
"entropy": 5.463802480697632,
|
|
"epoch": 1.473993386500681,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.00047837032792652837,
|
|
"loss": 5.2982,
|
|
"mean_token_accuracy": 0.17795735746622085,
|
|
"num_tokens": 32876960.0,
|
|
"step": 18945
|
|
},
|
|
{
|
|
"entropy": 5.521774482727051,
|
|
"epoch": 1.4743824158723984,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.0004783584693451226,
|
|
"loss": 5.2469,
|
|
"mean_token_accuracy": 0.1817639574408531,
|
|
"num_tokens": 32886446.0,
|
|
"step": 18950
|
|
},
|
|
{
|
|
"entropy": 5.542544746398926,
|
|
"epoch": 1.4747714452441159,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 0.0004783466076780759,
|
|
"loss": 5.311,
|
|
"mean_token_accuracy": 0.1694379508495331,
|
|
"num_tokens": 32895141.0,
|
|
"step": 18955
|
|
},
|
|
{
|
|
"entropy": 5.542437410354614,
|
|
"epoch": 1.4751604746158336,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0004783347429255679,
|
|
"loss": 5.2254,
|
|
"mean_token_accuracy": 0.1778141140937805,
|
|
"num_tokens": 32904191.0,
|
|
"step": 18960
|
|
},
|
|
{
|
|
"entropy": 5.5346107006073,
|
|
"epoch": 1.475549503987551,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.000478322875087779,
|
|
"loss": 5.2055,
|
|
"mean_token_accuracy": 0.18154967129230498,
|
|
"num_tokens": 32912805.0,
|
|
"step": 18965
|
|
},
|
|
{
|
|
"entropy": 5.458024501800537,
|
|
"epoch": 1.4759385333592685,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.00047831100416488906,
|
|
"loss": 5.1961,
|
|
"mean_token_accuracy": 0.17444189488887787,
|
|
"num_tokens": 32921275.0,
|
|
"step": 18970
|
|
},
|
|
{
|
|
"entropy": 5.493920707702637,
|
|
"epoch": 1.4763275627309862,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.00047829913015707816,
|
|
"loss": 5.2281,
|
|
"mean_token_accuracy": 0.18344388008117676,
|
|
"num_tokens": 32929472.0,
|
|
"step": 18975
|
|
},
|
|
{
|
|
"entropy": 5.508865308761597,
|
|
"epoch": 1.4767165921027037,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.00047828725306452657,
|
|
"loss": 5.2466,
|
|
"mean_token_accuracy": 0.1758577197790146,
|
|
"num_tokens": 32937697.0,
|
|
"step": 18980
|
|
},
|
|
{
|
|
"entropy": 5.496637630462646,
|
|
"epoch": 1.4771056214744214,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00047827537288741453,
|
|
"loss": 5.2091,
|
|
"mean_token_accuracy": 0.18022481501102447,
|
|
"num_tokens": 32946516.0,
|
|
"step": 18985
|
|
},
|
|
{
|
|
"entropy": 5.431010770797729,
|
|
"epoch": 1.4774946508461388,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.0004782634896259222,
|
|
"loss": 5.1034,
|
|
"mean_token_accuracy": 0.1849052846431732,
|
|
"num_tokens": 32954841.0,
|
|
"step": 18990
|
|
},
|
|
{
|
|
"entropy": 5.459078168869018,
|
|
"epoch": 1.4778836802178565,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00047825160328023,
|
|
"loss": 5.2682,
|
|
"mean_token_accuracy": 0.17717995643615722,
|
|
"num_tokens": 32963678.0,
|
|
"step": 18995
|
|
},
|
|
{
|
|
"entropy": 5.366038084030151,
|
|
"epoch": 1.478272709589574,
|
|
"grad_norm": 1.5078125,
|
|
"learning_rate": 0.0004782397138505181,
|
|
"loss": 5.0689,
|
|
"mean_token_accuracy": 0.18955635726451875,
|
|
"num_tokens": 32973163.0,
|
|
"step": 19000
|
|
},
|
|
{
|
|
"entropy": 5.509649181365967,
|
|
"epoch": 1.4786617389612915,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.00047822782133696715,
|
|
"loss": 5.2757,
|
|
"mean_token_accuracy": 0.17284945100545884,
|
|
"num_tokens": 32982473.0,
|
|
"step": 19005
|
|
},
|
|
{
|
|
"entropy": 5.459305095672607,
|
|
"epoch": 1.4790507683330092,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004782159257397574,
|
|
"loss": 5.1117,
|
|
"mean_token_accuracy": 0.19406988471746445,
|
|
"num_tokens": 32990328.0,
|
|
"step": 19010
|
|
},
|
|
{
|
|
"entropy": 5.36344051361084,
|
|
"epoch": 1.4794397977047267,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.00047820402705906953,
|
|
"loss": 5.1858,
|
|
"mean_token_accuracy": 0.17730076014995574,
|
|
"num_tokens": 32998432.0,
|
|
"step": 19015
|
|
},
|
|
{
|
|
"entropy": 5.493593168258667,
|
|
"epoch": 1.4798288270764441,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.00047819212529508394,
|
|
"loss": 5.2708,
|
|
"mean_token_accuracy": 0.17800803035497664,
|
|
"num_tokens": 33007017.0,
|
|
"step": 19020
|
|
},
|
|
{
|
|
"entropy": 5.538372325897217,
|
|
"epoch": 1.4802178564481618,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 0.0004781802204479812,
|
|
"loss": 5.1864,
|
|
"mean_token_accuracy": 0.188335083425045,
|
|
"num_tokens": 33015212.0,
|
|
"step": 19025
|
|
},
|
|
{
|
|
"entropy": 5.448433351516724,
|
|
"epoch": 1.4806068858198795,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.0004781683125179421,
|
|
"loss": 5.224,
|
|
"mean_token_accuracy": 0.17419015765190124,
|
|
"num_tokens": 33023555.0,
|
|
"step": 19030
|
|
},
|
|
{
|
|
"entropy": 5.4041119575500485,
|
|
"epoch": 1.480995915191597,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0004781564015051472,
|
|
"loss": 5.2053,
|
|
"mean_token_accuracy": 0.1750833198428154,
|
|
"num_tokens": 33033048.0,
|
|
"step": 19035
|
|
},
|
|
{
|
|
"entropy": 5.4126099109649655,
|
|
"epoch": 1.4813849445633145,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0004781444874097772,
|
|
"loss": 5.0892,
|
|
"mean_token_accuracy": 0.18323202580213546,
|
|
"num_tokens": 33041553.0,
|
|
"step": 19040
|
|
},
|
|
{
|
|
"entropy": 5.417594051361084,
|
|
"epoch": 1.4817739739350322,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.00047813257023201307,
|
|
"loss": 5.2107,
|
|
"mean_token_accuracy": 0.18073199838399887,
|
|
"num_tokens": 33050864.0,
|
|
"step": 19045
|
|
},
|
|
{
|
|
"entropy": 5.392450332641602,
|
|
"epoch": 1.4821630033067497,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.0004781206499720354,
|
|
"loss": 5.0867,
|
|
"mean_token_accuracy": 0.19068018198013306,
|
|
"num_tokens": 33059700.0,
|
|
"step": 19050
|
|
},
|
|
{
|
|
"entropy": 5.3810193061828615,
|
|
"epoch": 1.4825520326784671,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 0.00047810872663002523,
|
|
"loss": 5.0641,
|
|
"mean_token_accuracy": 0.18580039590597153,
|
|
"num_tokens": 33067784.0,
|
|
"step": 19055
|
|
},
|
|
{
|
|
"entropy": 5.4524160861969,
|
|
"epoch": 1.4829410620501848,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00047809680020616333,
|
|
"loss": 5.2284,
|
|
"mean_token_accuracy": 0.1768863618373871,
|
|
"num_tokens": 33077174.0,
|
|
"step": 19060
|
|
},
|
|
{
|
|
"entropy": 5.508147859573365,
|
|
"epoch": 1.4833300914219023,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.00047808487070063083,
|
|
"loss": 5.2448,
|
|
"mean_token_accuracy": 0.18085899353027343,
|
|
"num_tokens": 33085492.0,
|
|
"step": 19065
|
|
},
|
|
{
|
|
"entropy": 5.486947870254516,
|
|
"epoch": 1.4837191207936198,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0004780729381136086,
|
|
"loss": 5.2143,
|
|
"mean_token_accuracy": 0.1870437502861023,
|
|
"num_tokens": 33094388.0,
|
|
"step": 19070
|
|
},
|
|
{
|
|
"entropy": 5.377500820159912,
|
|
"epoch": 1.4841081501653375,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.0004780610024452778,
|
|
"loss": 5.0437,
|
|
"mean_token_accuracy": 0.1885310649871826,
|
|
"num_tokens": 33101996.0,
|
|
"step": 19075
|
|
},
|
|
{
|
|
"entropy": 5.43360333442688,
|
|
"epoch": 1.4844971795370552,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.00047804906369581954,
|
|
"loss": 5.2673,
|
|
"mean_token_accuracy": 0.17870389968156813,
|
|
"num_tokens": 33111139.0,
|
|
"step": 19080
|
|
},
|
|
{
|
|
"entropy": 5.486876964569092,
|
|
"epoch": 1.4848862089087727,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0004780371218654148,
|
|
"loss": 5.1112,
|
|
"mean_token_accuracy": 0.17735509276390077,
|
|
"num_tokens": 33119159.0,
|
|
"step": 19085
|
|
},
|
|
{
|
|
"entropy": 5.545796966552734,
|
|
"epoch": 1.4852752382804901,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.00047802517695424496,
|
|
"loss": 5.2716,
|
|
"mean_token_accuracy": 0.1789771258831024,
|
|
"num_tokens": 33128317.0,
|
|
"step": 19090
|
|
},
|
|
{
|
|
"entropy": 5.4514398097991945,
|
|
"epoch": 1.4856642676522078,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.0004780132289624913,
|
|
"loss": 5.1926,
|
|
"mean_token_accuracy": 0.18862663060426713,
|
|
"num_tokens": 33136936.0,
|
|
"step": 19095
|
|
},
|
|
{
|
|
"entropy": 5.535688495635986,
|
|
"epoch": 1.4860532970239253,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.0004780012778903349,
|
|
"loss": 5.2474,
|
|
"mean_token_accuracy": 0.1827515482902527,
|
|
"num_tokens": 33145059.0,
|
|
"step": 19100
|
|
},
|
|
{
|
|
"entropy": 5.416590547561645,
|
|
"epoch": 1.4864423263956428,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.00047798932373795724,
|
|
"loss": 5.1303,
|
|
"mean_token_accuracy": 0.18182187974452974,
|
|
"num_tokens": 33153683.0,
|
|
"step": 19105
|
|
},
|
|
{
|
|
"entropy": 5.58031587600708,
|
|
"epoch": 1.4868313557673605,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 0.00047797736650553977,
|
|
"loss": 5.2976,
|
|
"mean_token_accuracy": 0.17467335164546965,
|
|
"num_tokens": 33163179.0,
|
|
"step": 19110
|
|
},
|
|
{
|
|
"entropy": 5.459546852111816,
|
|
"epoch": 1.487220385139078,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.00047796540619326366,
|
|
"loss": 5.0839,
|
|
"mean_token_accuracy": 0.18810902833938598,
|
|
"num_tokens": 33172029.0,
|
|
"step": 19115
|
|
},
|
|
{
|
|
"entropy": 5.523521566390992,
|
|
"epoch": 1.4876094145107956,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.0004779534428013107,
|
|
"loss": 5.2801,
|
|
"mean_token_accuracy": 0.180377858877182,
|
|
"num_tokens": 33181168.0,
|
|
"step": 19120
|
|
},
|
|
{
|
|
"entropy": 5.51525616645813,
|
|
"epoch": 1.4879984438825131,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.00047794147632986223,
|
|
"loss": 5.2937,
|
|
"mean_token_accuracy": 0.17230410724878312,
|
|
"num_tokens": 33191320.0,
|
|
"step": 19125
|
|
},
|
|
{
|
|
"entropy": 5.400260353088379,
|
|
"epoch": 1.4883874732542308,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0004779295067790999,
|
|
"loss": 5.1699,
|
|
"mean_token_accuracy": 0.18297987878322602,
|
|
"num_tokens": 33199625.0,
|
|
"step": 19130
|
|
},
|
|
{
|
|
"entropy": 5.456357955932617,
|
|
"epoch": 1.4887765026259483,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.0004779175341492053,
|
|
"loss": 5.1886,
|
|
"mean_token_accuracy": 0.18856837898492812,
|
|
"num_tokens": 33208145.0,
|
|
"step": 19135
|
|
},
|
|
{
|
|
"entropy": 5.5095789432525635,
|
|
"epoch": 1.4891655319976658,
|
|
"grad_norm": 1.578125,
|
|
"learning_rate": 0.0004779055584403601,
|
|
"loss": 5.1957,
|
|
"mean_token_accuracy": 0.18154570758342742,
|
|
"num_tokens": 33216441.0,
|
|
"step": 19140
|
|
},
|
|
{
|
|
"entropy": 5.515572500228882,
|
|
"epoch": 1.4895545613693835,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.000477893579652746,
|
|
"loss": 5.2074,
|
|
"mean_token_accuracy": 0.17709636241197585,
|
|
"num_tokens": 33225612.0,
|
|
"step": 19145
|
|
},
|
|
{
|
|
"entropy": 5.451858186721802,
|
|
"epoch": 1.489943590741101,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.00047788159778654475,
|
|
"loss": 5.1786,
|
|
"mean_token_accuracy": 0.17737296223640442,
|
|
"num_tokens": 33234410.0,
|
|
"step": 19150
|
|
},
|
|
{
|
|
"entropy": 5.483284854888916,
|
|
"epoch": 1.4903326201128184,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.00047786961284193813,
|
|
"loss": 5.1187,
|
|
"mean_token_accuracy": 0.18336522579193115,
|
|
"num_tokens": 33242838.0,
|
|
"step": 19155
|
|
},
|
|
{
|
|
"entropy": 5.433384943008423,
|
|
"epoch": 1.4907216494845361,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.0004778576248191081,
|
|
"loss": 5.2627,
|
|
"mean_token_accuracy": 0.182778562605381,
|
|
"num_tokens": 33251266.0,
|
|
"step": 19160
|
|
},
|
|
{
|
|
"entropy": 5.4901885986328125,
|
|
"epoch": 1.4911106788562536,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.0004778456337182365,
|
|
"loss": 5.1744,
|
|
"mean_token_accuracy": 0.1808495119214058,
|
|
"num_tokens": 33259644.0,
|
|
"step": 19165
|
|
},
|
|
{
|
|
"entropy": 5.493185043334961,
|
|
"epoch": 1.4914997082279713,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0004778336395395052,
|
|
"loss": 5.1597,
|
|
"mean_token_accuracy": 0.1830964595079422,
|
|
"num_tokens": 33267547.0,
|
|
"step": 19170
|
|
},
|
|
{
|
|
"entropy": 5.4217133045196535,
|
|
"epoch": 1.4918887375996888,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.00047782164228309636,
|
|
"loss": 5.2099,
|
|
"mean_token_accuracy": 0.18030260652303695,
|
|
"num_tokens": 33276808.0,
|
|
"step": 19175
|
|
},
|
|
{
|
|
"entropy": 5.48171648979187,
|
|
"epoch": 1.4922777669714065,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.00047780964194919193,
|
|
"loss": 5.2409,
|
|
"mean_token_accuracy": 0.18135538548231125,
|
|
"num_tokens": 33285569.0,
|
|
"step": 19180
|
|
},
|
|
{
|
|
"entropy": 5.504447650909424,
|
|
"epoch": 1.492666796343124,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.00047779763853797387,
|
|
"loss": 5.2439,
|
|
"mean_token_accuracy": 0.18040698766708374,
|
|
"num_tokens": 33295214.0,
|
|
"step": 19185
|
|
},
|
|
{
|
|
"entropy": 5.440892171859741,
|
|
"epoch": 1.4930558257148414,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.0004777856320496245,
|
|
"loss": 5.15,
|
|
"mean_token_accuracy": 0.18482630848884582,
|
|
"num_tokens": 33304140.0,
|
|
"step": 19190
|
|
},
|
|
{
|
|
"entropy": 5.442900943756103,
|
|
"epoch": 1.493444855086559,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.000477773622484326,
|
|
"loss": 5.2626,
|
|
"mean_token_accuracy": 0.17975836545228957,
|
|
"num_tokens": 33312879.0,
|
|
"step": 19195
|
|
},
|
|
{
|
|
"entropy": 5.4715611934661865,
|
|
"epoch": 1.4938338844582766,
|
|
"grad_norm": 1.6328125,
|
|
"learning_rate": 0.0004777616098422604,
|
|
"loss": 5.1919,
|
|
"mean_token_accuracy": 0.18639179393649102,
|
|
"num_tokens": 33320769.0,
|
|
"step": 19200
|
|
},
|
|
{
|
|
"entropy": 5.3871983051300045,
|
|
"epoch": 1.494222913829994,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.00047774959412361014,
|
|
"loss": 5.095,
|
|
"mean_token_accuracy": 0.19059139341115952,
|
|
"num_tokens": 33328911.0,
|
|
"step": 19205
|
|
},
|
|
{
|
|
"entropy": 5.465117597579956,
|
|
"epoch": 1.4946119432017118,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.0004777375753285575,
|
|
"loss": 5.1486,
|
|
"mean_token_accuracy": 0.18504270911216736,
|
|
"num_tokens": 33337607.0,
|
|
"step": 19210
|
|
},
|
|
{
|
|
"entropy": 5.480438756942749,
|
|
"epoch": 1.4950009725734292,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00047772555345728486,
|
|
"loss": 5.2197,
|
|
"mean_token_accuracy": 0.179573892056942,
|
|
"num_tokens": 33346663.0,
|
|
"step": 19215
|
|
},
|
|
{
|
|
"entropy": 5.596265172958374,
|
|
"epoch": 1.495390001945147,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0004777135285099746,
|
|
"loss": 5.2593,
|
|
"mean_token_accuracy": 0.17067298144102097,
|
|
"num_tokens": 33355501.0,
|
|
"step": 19220
|
|
},
|
|
{
|
|
"entropy": 5.487182188034057,
|
|
"epoch": 1.4957790313168644,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.0004777015004868092,
|
|
"loss": 5.1043,
|
|
"mean_token_accuracy": 0.1746610015630722,
|
|
"num_tokens": 33363497.0,
|
|
"step": 19225
|
|
},
|
|
{
|
|
"entropy": 5.419445896148682,
|
|
"epoch": 1.496168060688582,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.0004776894693879712,
|
|
"loss": 5.0841,
|
|
"mean_token_accuracy": 0.1901463285088539,
|
|
"num_tokens": 33371349.0,
|
|
"step": 19230
|
|
},
|
|
{
|
|
"entropy": 5.398255395889282,
|
|
"epoch": 1.4965570900602996,
|
|
"grad_norm": 1.5078125,
|
|
"learning_rate": 0.0004776774352136431,
|
|
"loss": 5.0528,
|
|
"mean_token_accuracy": 0.1882214516401291,
|
|
"num_tokens": 33379889.0,
|
|
"step": 19235
|
|
},
|
|
{
|
|
"entropy": 5.443554067611695,
|
|
"epoch": 1.496946119432017,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.00047766539796400756,
|
|
"loss": 5.2208,
|
|
"mean_token_accuracy": 0.18137498199939728,
|
|
"num_tokens": 33388452.0,
|
|
"step": 19240
|
|
},
|
|
{
|
|
"entropy": 5.41297345161438,
|
|
"epoch": 1.4973351488037348,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0004776533576392471,
|
|
"loss": 5.1588,
|
|
"mean_token_accuracy": 0.18347925543785096,
|
|
"num_tokens": 33397598.0,
|
|
"step": 19245
|
|
},
|
|
{
|
|
"entropy": 5.5165736198425295,
|
|
"epoch": 1.4977241781754522,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004776413142395445,
|
|
"loss": 5.2065,
|
|
"mean_token_accuracy": 0.18012795150279998,
|
|
"num_tokens": 33406509.0,
|
|
"step": 19250
|
|
},
|
|
{
|
|
"entropy": 5.421728944778442,
|
|
"epoch": 1.4981132075471697,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.00047762926776508244,
|
|
"loss": 5.205,
|
|
"mean_token_accuracy": 0.1787506654858589,
|
|
"num_tokens": 33415129.0,
|
|
"step": 19255
|
|
},
|
|
{
|
|
"entropy": 5.357886552810669,
|
|
"epoch": 1.4985022369188874,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.00047761721821604387,
|
|
"loss": 5.0561,
|
|
"mean_token_accuracy": 0.18412531167268753,
|
|
"num_tokens": 33423588.0,
|
|
"step": 19260
|
|
},
|
|
{
|
|
"entropy": 5.488271760940552,
|
|
"epoch": 1.4988912662906049,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0004776051655926115,
|
|
"loss": 5.2344,
|
|
"mean_token_accuracy": 0.17699860483407975,
|
|
"num_tokens": 33431598.0,
|
|
"step": 19265
|
|
},
|
|
{
|
|
"entropy": 5.579805898666382,
|
|
"epoch": 1.4992802956623226,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.00047759310989496813,
|
|
"loss": 5.3382,
|
|
"mean_token_accuracy": 0.17470152378082277,
|
|
"num_tokens": 33441139.0,
|
|
"step": 19270
|
|
},
|
|
{
|
|
"entropy": 5.507847309112549,
|
|
"epoch": 1.49966932503404,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0004775810511232969,
|
|
"loss": 5.1634,
|
|
"mean_token_accuracy": 0.18191005289554596,
|
|
"num_tokens": 33449558.0,
|
|
"step": 19275
|
|
},
|
|
{
|
|
"entropy": 5.511995315551758,
|
|
"epoch": 1.5000583544057577,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 0.00047756898927778056,
|
|
"loss": 5.2262,
|
|
"mean_token_accuracy": 0.17960501164197923,
|
|
"num_tokens": 33457429.0,
|
|
"step": 19280
|
|
},
|
|
{
|
|
"entropy": 5.393494129180908,
|
|
"epoch": 1.5004473837774752,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.00047755692435860227,
|
|
"loss": 5.105,
|
|
"mean_token_accuracy": 0.19161136895418168,
|
|
"num_tokens": 33465781.0,
|
|
"step": 19285
|
|
},
|
|
{
|
|
"entropy": 5.480853796005249,
|
|
"epoch": 1.5008364131491927,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.000477544856365945,
|
|
"loss": 5.1682,
|
|
"mean_token_accuracy": 0.18393547534942628,
|
|
"num_tokens": 33473865.0,
|
|
"step": 19290
|
|
},
|
|
{
|
|
"entropy": 5.463537931442261,
|
|
"epoch": 1.5012254425209104,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.00047753278529999205,
|
|
"loss": 5.2154,
|
|
"mean_token_accuracy": 0.17896395772695542,
|
|
"num_tokens": 33482497.0,
|
|
"step": 19295
|
|
},
|
|
{
|
|
"entropy": 5.456485033035278,
|
|
"epoch": 1.5016144718926279,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.00047752071116092637,
|
|
"loss": 5.238,
|
|
"mean_token_accuracy": 0.17785248309373855,
|
|
"num_tokens": 33490933.0,
|
|
"step": 19300
|
|
},
|
|
{
|
|
"entropy": 5.456659936904908,
|
|
"epoch": 1.5020035012643453,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 0.0004775086339489312,
|
|
"loss": 5.2303,
|
|
"mean_token_accuracy": 0.17924463748931885,
|
|
"num_tokens": 33500192.0,
|
|
"step": 19305
|
|
},
|
|
{
|
|
"entropy": 5.498013830184936,
|
|
"epoch": 1.502392530636063,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.0004774965536641899,
|
|
"loss": 5.1979,
|
|
"mean_token_accuracy": 0.1808093473315239,
|
|
"num_tokens": 33508543.0,
|
|
"step": 19310
|
|
},
|
|
{
|
|
"entropy": 5.460071754455567,
|
|
"epoch": 1.5027815600077807,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00047748447030688575,
|
|
"loss": 5.2227,
|
|
"mean_token_accuracy": 0.17895960211753845,
|
|
"num_tokens": 33517310.0,
|
|
"step": 19315
|
|
},
|
|
{
|
|
"entropy": 5.479748153686524,
|
|
"epoch": 1.503170589379498,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.00047747238387720194,
|
|
"loss": 5.2826,
|
|
"mean_token_accuracy": 0.17462820559740067,
|
|
"num_tokens": 33526274.0,
|
|
"step": 19320
|
|
},
|
|
{
|
|
"entropy": 5.553435659408569,
|
|
"epoch": 1.5035596187512157,
|
|
"grad_norm": 1.609375,
|
|
"learning_rate": 0.000477460294375322,
|
|
"loss": 5.2688,
|
|
"mean_token_accuracy": 0.17671048939228057,
|
|
"num_tokens": 33534438.0,
|
|
"step": 19325
|
|
},
|
|
{
|
|
"entropy": 5.496205615997314,
|
|
"epoch": 1.5039486481229334,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.00047744820180142935,
|
|
"loss": 5.1654,
|
|
"mean_token_accuracy": 0.1769416719675064,
|
|
"num_tokens": 33542943.0,
|
|
"step": 19330
|
|
},
|
|
{
|
|
"entropy": 5.449843025207519,
|
|
"epoch": 1.5043376774946509,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 0.00047743610615570746,
|
|
"loss": 5.1895,
|
|
"mean_token_accuracy": 0.1820890188217163,
|
|
"num_tokens": 33550567.0,
|
|
"step": 19335
|
|
},
|
|
{
|
|
"entropy": 5.515642929077148,
|
|
"epoch": 1.5047267068663683,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.00047742400743833993,
|
|
"loss": 5.3014,
|
|
"mean_token_accuracy": 0.17504193484783173,
|
|
"num_tokens": 33559851.0,
|
|
"step": 19340
|
|
},
|
|
{
|
|
"entropy": 5.571846866607666,
|
|
"epoch": 1.505115736238086,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.0004774119056495102,
|
|
"loss": 5.2247,
|
|
"mean_token_accuracy": 0.17265723496675492,
|
|
"num_tokens": 33568645.0,
|
|
"step": 19345
|
|
},
|
|
{
|
|
"entropy": 5.386165904998779,
|
|
"epoch": 1.5055047656098035,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.00047739980078940206,
|
|
"loss": 5.1908,
|
|
"mean_token_accuracy": 0.18712951987981796,
|
|
"num_tokens": 33577331.0,
|
|
"step": 19350
|
|
},
|
|
{
|
|
"entropy": 5.361925506591797,
|
|
"epoch": 1.505893794981521,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.00047738769285819894,
|
|
"loss": 5.0304,
|
|
"mean_token_accuracy": 0.18944639563560486,
|
|
"num_tokens": 33586196.0,
|
|
"step": 19355
|
|
},
|
|
{
|
|
"entropy": 5.465072917938232,
|
|
"epoch": 1.5062828243532387,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0004773755818560849,
|
|
"loss": 5.2443,
|
|
"mean_token_accuracy": 0.17697518020868303,
|
|
"num_tokens": 33595200.0,
|
|
"step": 19360
|
|
},
|
|
{
|
|
"entropy": 5.496227979660034,
|
|
"epoch": 1.5066718537249564,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.0004773634677832434,
|
|
"loss": 5.1424,
|
|
"mean_token_accuracy": 0.18970729857683183,
|
|
"num_tokens": 33604130.0,
|
|
"step": 19365
|
|
},
|
|
{
|
|
"entropy": 5.462098407745361,
|
|
"epoch": 1.5070608830966739,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0004773513506398584,
|
|
"loss": 5.3189,
|
|
"mean_token_accuracy": 0.16969507336616516,
|
|
"num_tokens": 33613254.0,
|
|
"step": 19370
|
|
},
|
|
{
|
|
"entropy": 5.482469463348389,
|
|
"epoch": 1.5074499124683913,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.0004773392304261137,
|
|
"loss": 5.2054,
|
|
"mean_token_accuracy": 0.17997311502695085,
|
|
"num_tokens": 33621395.0,
|
|
"step": 19375
|
|
},
|
|
{
|
|
"entropy": 5.482410621643067,
|
|
"epoch": 1.507838941840109,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0004773271071421933,
|
|
"loss": 5.1398,
|
|
"mean_token_accuracy": 0.1783592864871025,
|
|
"num_tokens": 33630293.0,
|
|
"step": 19380
|
|
},
|
|
{
|
|
"entropy": 5.494434404373169,
|
|
"epoch": 1.5082279712118265,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.00047731498078828105,
|
|
"loss": 5.2398,
|
|
"mean_token_accuracy": 0.18042422086000443,
|
|
"num_tokens": 33638224.0,
|
|
"step": 19385
|
|
},
|
|
{
|
|
"entropy": 5.544911813735962,
|
|
"epoch": 1.508617000583544,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.000477302851364561,
|
|
"loss": 5.3125,
|
|
"mean_token_accuracy": 0.16991392523050308,
|
|
"num_tokens": 33646974.0,
|
|
"step": 19390
|
|
},
|
|
{
|
|
"entropy": 5.56158037185669,
|
|
"epoch": 1.5090060299552617,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.00047729071887121717,
|
|
"loss": 5.2707,
|
|
"mean_token_accuracy": 0.17525714486837388,
|
|
"num_tokens": 33656171.0,
|
|
"step": 19395
|
|
},
|
|
{
|
|
"entropy": 5.463377857208252,
|
|
"epoch": 1.5093950593269791,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 0.0004772785833084337,
|
|
"loss": 5.2628,
|
|
"mean_token_accuracy": 0.1726651072502136,
|
|
"num_tokens": 33664605.0,
|
|
"step": 19400
|
|
},
|
|
{
|
|
"entropy": 5.518970155715943,
|
|
"epoch": 1.5097840886986966,
|
|
"grad_norm": 1.625,
|
|
"learning_rate": 0.0004772664446763946,
|
|
"loss": 5.2479,
|
|
"mean_token_accuracy": 0.17498343288898469,
|
|
"num_tokens": 33673128.0,
|
|
"step": 19405
|
|
},
|
|
{
|
|
"entropy": 5.426829099655151,
|
|
"epoch": 1.5101731180704143,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0004772543029752842,
|
|
"loss": 5.1657,
|
|
"mean_token_accuracy": 0.1868521273136139,
|
|
"num_tokens": 33681358.0,
|
|
"step": 19410
|
|
},
|
|
{
|
|
"entropy": 5.390666437149048,
|
|
"epoch": 1.510562147442132,
|
|
"grad_norm": 1.5703125,
|
|
"learning_rate": 0.00047724215820528666,
|
|
"loss": 5.0721,
|
|
"mean_token_accuracy": 0.1924533039331436,
|
|
"num_tokens": 33690282.0,
|
|
"step": 19415
|
|
},
|
|
{
|
|
"entropy": 5.394773197174072,
|
|
"epoch": 1.5109511768138495,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.0004772300103665863,
|
|
"loss": 5.1246,
|
|
"mean_token_accuracy": 0.18384106755256652,
|
|
"num_tokens": 33698294.0,
|
|
"step": 19420
|
|
},
|
|
{
|
|
"entropy": 5.39921498298645,
|
|
"epoch": 1.511340206185567,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.00047721785945936733,
|
|
"loss": 5.0947,
|
|
"mean_token_accuracy": 0.19088248014450074,
|
|
"num_tokens": 33706552.0,
|
|
"step": 19425
|
|
},
|
|
{
|
|
"entropy": 5.464116716384888,
|
|
"epoch": 1.5117292355572847,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0004772057054838143,
|
|
"loss": 5.1758,
|
|
"mean_token_accuracy": 0.1816762238740921,
|
|
"num_tokens": 33714704.0,
|
|
"step": 19430
|
|
},
|
|
{
|
|
"entropy": 5.518450403213501,
|
|
"epoch": 1.5121182649290021,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.00047719354844011146,
|
|
"loss": 5.2291,
|
|
"mean_token_accuracy": 0.18014201074838637,
|
|
"num_tokens": 33723823.0,
|
|
"step": 19435
|
|
},
|
|
{
|
|
"entropy": 5.546505403518677,
|
|
"epoch": 1.5125072943007196,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0004771813883284434,
|
|
"loss": 5.2921,
|
|
"mean_token_accuracy": 0.1720948949456215,
|
|
"num_tokens": 33732616.0,
|
|
"step": 19440
|
|
},
|
|
{
|
|
"entropy": 5.4377992153167725,
|
|
"epoch": 1.5128963236724373,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.00047716922514899455,
|
|
"loss": 5.1294,
|
|
"mean_token_accuracy": 0.18666136711835862,
|
|
"num_tokens": 33741542.0,
|
|
"step": 19445
|
|
},
|
|
{
|
|
"entropy": 5.457616567611694,
|
|
"epoch": 1.5132853530441548,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.00047715705890194953,
|
|
"loss": 5.1871,
|
|
"mean_token_accuracy": 0.1861388474702835,
|
|
"num_tokens": 33750651.0,
|
|
"step": 19450
|
|
},
|
|
{
|
|
"entropy": 5.410335636138916,
|
|
"epoch": 1.5136743824158723,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.00047714488958749285,
|
|
"loss": 5.2371,
|
|
"mean_token_accuracy": 0.17786485701799393,
|
|
"num_tokens": 33760741.0,
|
|
"step": 19455
|
|
},
|
|
{
|
|
"entropy": 5.567200231552124,
|
|
"epoch": 1.51406341178759,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.00047713271720580924,
|
|
"loss": 5.2474,
|
|
"mean_token_accuracy": 0.17900880426168442,
|
|
"num_tokens": 33769541.0,
|
|
"step": 19460
|
|
},
|
|
{
|
|
"entropy": 5.477507400512695,
|
|
"epoch": 1.5144524411593077,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0004771205417570834,
|
|
"loss": 5.2476,
|
|
"mean_token_accuracy": 0.1848368912935257,
|
|
"num_tokens": 33778684.0,
|
|
"step": 19465
|
|
},
|
|
{
|
|
"entropy": 5.492230224609375,
|
|
"epoch": 1.5148414705310251,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.00047710836324150004,
|
|
"loss": 5.24,
|
|
"mean_token_accuracy": 0.17677652537822724,
|
|
"num_tokens": 33787782.0,
|
|
"step": 19470
|
|
},
|
|
{
|
|
"entropy": 5.504099178314209,
|
|
"epoch": 1.5152304999027426,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.000477096181659244,
|
|
"loss": 5.1753,
|
|
"mean_token_accuracy": 0.1842043250799179,
|
|
"num_tokens": 33796194.0,
|
|
"step": 19475
|
|
},
|
|
{
|
|
"entropy": 5.483596515655518,
|
|
"epoch": 1.5156195292744603,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0004770839970105,
|
|
"loss": 5.1872,
|
|
"mean_token_accuracy": 0.17996893525123597,
|
|
"num_tokens": 33804615.0,
|
|
"step": 19480
|
|
},
|
|
{
|
|
"entropy": 5.5140767097473145,
|
|
"epoch": 1.5160085586461778,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00047707180929545295,
|
|
"loss": 5.2636,
|
|
"mean_token_accuracy": 0.17915041297674178,
|
|
"num_tokens": 33812937.0,
|
|
"step": 19485
|
|
},
|
|
{
|
|
"entropy": 5.48929009437561,
|
|
"epoch": 1.5163975880178953,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.00047705961851428786,
|
|
"loss": 5.1449,
|
|
"mean_token_accuracy": 0.18312469124794006,
|
|
"num_tokens": 33821454.0,
|
|
"step": 19490
|
|
},
|
|
{
|
|
"entropy": 5.522294807434082,
|
|
"epoch": 1.516786617389613,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00047704742466718973,
|
|
"loss": 5.2463,
|
|
"mean_token_accuracy": 0.1774074137210846,
|
|
"num_tokens": 33829736.0,
|
|
"step": 19495
|
|
},
|
|
{
|
|
"entropy": 5.498462343215943,
|
|
"epoch": 1.5171756467613304,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.00047703522775434354,
|
|
"loss": 5.2317,
|
|
"mean_token_accuracy": 0.1784259021282196,
|
|
"num_tokens": 33838403.0,
|
|
"step": 19500
|
|
},
|
|
{
|
|
"entropy": 5.485769462585449,
|
|
"epoch": 1.517564676133048,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.00047702302777593425,
|
|
"loss": 5.2105,
|
|
"mean_token_accuracy": 0.18380846083164215,
|
|
"num_tokens": 33847149.0,
|
|
"step": 19505
|
|
},
|
|
{
|
|
"entropy": 5.495974493026734,
|
|
"epoch": 1.5179537055047656,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.00047701082473214715,
|
|
"loss": 5.1671,
|
|
"mean_token_accuracy": 0.17903087437152862,
|
|
"num_tokens": 33855924.0,
|
|
"step": 19510
|
|
},
|
|
{
|
|
"entropy": 5.4521249294281,
|
|
"epoch": 1.5183427348764833,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.00047699861862316725,
|
|
"loss": 5.1845,
|
|
"mean_token_accuracy": 0.18303153961896895,
|
|
"num_tokens": 33864314.0,
|
|
"step": 19515
|
|
},
|
|
{
|
|
"entropy": 5.5172327041625975,
|
|
"epoch": 1.5187317642482008,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0004769864094491798,
|
|
"loss": 5.1342,
|
|
"mean_token_accuracy": 0.1855878695845604,
|
|
"num_tokens": 33873468.0,
|
|
"step": 19520
|
|
},
|
|
{
|
|
"entropy": 5.481070947647095,
|
|
"epoch": 1.5191207936199183,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0004769741972103702,
|
|
"loss": 5.1984,
|
|
"mean_token_accuracy": 0.1751307800412178,
|
|
"num_tokens": 33881627.0,
|
|
"step": 19525
|
|
},
|
|
{
|
|
"entropy": 5.431173276901245,
|
|
"epoch": 1.519509822991636,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00047696198190692353,
|
|
"loss": 5.1933,
|
|
"mean_token_accuracy": 0.17997549772262572,
|
|
"num_tokens": 33889839.0,
|
|
"step": 19530
|
|
},
|
|
{
|
|
"entropy": 5.454691219329834,
|
|
"epoch": 1.5198988523633534,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.0004769497635390253,
|
|
"loss": 5.1298,
|
|
"mean_token_accuracy": 0.181427963078022,
|
|
"num_tokens": 33898370.0,
|
|
"step": 19535
|
|
},
|
|
{
|
|
"entropy": 5.530297708511353,
|
|
"epoch": 1.520287881735071,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0004769375421068608,
|
|
"loss": 5.2423,
|
|
"mean_token_accuracy": 0.17953067272901535,
|
|
"num_tokens": 33907419.0,
|
|
"step": 19540
|
|
},
|
|
{
|
|
"entropy": 5.457008409500122,
|
|
"epoch": 1.5206769111067886,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.00047692531761061555,
|
|
"loss": 5.1983,
|
|
"mean_token_accuracy": 0.17364510297775268,
|
|
"num_tokens": 33915957.0,
|
|
"step": 19545
|
|
},
|
|
{
|
|
"entropy": 5.464373302459717,
|
|
"epoch": 1.521065940478506,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.000476913090050475,
|
|
"loss": 5.1645,
|
|
"mean_token_accuracy": 0.18563216775655747,
|
|
"num_tokens": 33924012.0,
|
|
"step": 19550
|
|
},
|
|
{
|
|
"entropy": 5.434740447998047,
|
|
"epoch": 1.5214549698502235,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.00047690085942662464,
|
|
"loss": 5.2511,
|
|
"mean_token_accuracy": 0.17466012835502626,
|
|
"num_tokens": 33932652.0,
|
|
"step": 19555
|
|
},
|
|
{
|
|
"entropy": 5.550287437438965,
|
|
"epoch": 1.5218439992219412,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.00047688862573925015,
|
|
"loss": 5.1692,
|
|
"mean_token_accuracy": 0.18138314187526702,
|
|
"num_tokens": 33941208.0,
|
|
"step": 19560
|
|
},
|
|
{
|
|
"entropy": 5.445321750640869,
|
|
"epoch": 1.522233028593659,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00047687638898853707,
|
|
"loss": 5.1502,
|
|
"mean_token_accuracy": 0.18243453800678253,
|
|
"num_tokens": 33950435.0,
|
|
"step": 19565
|
|
},
|
|
{
|
|
"entropy": 5.3997721672058105,
|
|
"epoch": 1.5226220579653764,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.0004768641491746711,
|
|
"loss": 5.1693,
|
|
"mean_token_accuracy": 0.1808338612318039,
|
|
"num_tokens": 33959659.0,
|
|
"step": 19570
|
|
},
|
|
{
|
|
"entropy": 5.441751146316529,
|
|
"epoch": 1.523011087337094,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.000476851906297838,
|
|
"loss": 5.1672,
|
|
"mean_token_accuracy": 0.17784252464771272,
|
|
"num_tokens": 33969105.0,
|
|
"step": 19575
|
|
},
|
|
{
|
|
"entropy": 5.478368711471558,
|
|
"epoch": 1.5234001167088116,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.00047683966035822346,
|
|
"loss": 5.2683,
|
|
"mean_token_accuracy": 0.17877189218997955,
|
|
"num_tokens": 33977314.0,
|
|
"step": 19580
|
|
},
|
|
{
|
|
"entropy": 5.450025844573974,
|
|
"epoch": 1.523789146080529,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.00047682741135601336,
|
|
"loss": 5.2028,
|
|
"mean_token_accuracy": 0.18269501477479935,
|
|
"num_tokens": 33985696.0,
|
|
"step": 19585
|
|
},
|
|
{
|
|
"entropy": 5.3442751407623295,
|
|
"epoch": 1.5241781754522465,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.00047681515929139356,
|
|
"loss": 4.9578,
|
|
"mean_token_accuracy": 0.19645140767097474,
|
|
"num_tokens": 33994539.0,
|
|
"step": 19590
|
|
},
|
|
{
|
|
"entropy": 5.412262201309204,
|
|
"epoch": 1.5245672048239642,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.00047680290416454995,
|
|
"loss": 5.2359,
|
|
"mean_token_accuracy": 0.17501673102378845,
|
|
"num_tokens": 34003101.0,
|
|
"step": 19595
|
|
},
|
|
{
|
|
"entropy": 5.54208197593689,
|
|
"epoch": 1.524956234195682,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0004767906459756684,
|
|
"loss": 5.208,
|
|
"mean_token_accuracy": 0.17722005546092987,
|
|
"num_tokens": 34011344.0,
|
|
"step": 19600
|
|
},
|
|
{
|
|
"entropy": 5.4815764904022215,
|
|
"epoch": 1.5253452635673992,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.00047677838472493504,
|
|
"loss": 5.2089,
|
|
"mean_token_accuracy": 0.1827727511525154,
|
|
"num_tokens": 34019628.0,
|
|
"step": 19605
|
|
},
|
|
{
|
|
"entropy": 5.4544227600097654,
|
|
"epoch": 1.5257342929391169,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004767661204125358,
|
|
"loss": 5.1686,
|
|
"mean_token_accuracy": 0.18208509534597397,
|
|
"num_tokens": 34027709.0,
|
|
"step": 19610
|
|
},
|
|
{
|
|
"entropy": 5.4490618228912355,
|
|
"epoch": 1.5261233223108346,
|
|
"grad_norm": 1.4921875,
|
|
"learning_rate": 0.0004767538530386569,
|
|
"loss": 5.248,
|
|
"mean_token_accuracy": 0.17692126333713531,
|
|
"num_tokens": 34036412.0,
|
|
"step": 19615
|
|
},
|
|
{
|
|
"entropy": 5.444081544876099,
|
|
"epoch": 1.526512351682552,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.00047674158260348437,
|
|
"loss": 5.1616,
|
|
"mean_token_accuracy": 0.1847056195139885,
|
|
"num_tokens": 34044842.0,
|
|
"step": 19620
|
|
},
|
|
{
|
|
"entropy": 5.406767272949219,
|
|
"epoch": 1.5269013810542695,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.00047672930910720436,
|
|
"loss": 5.1213,
|
|
"mean_token_accuracy": 0.18297962546348573,
|
|
"num_tokens": 34053286.0,
|
|
"step": 19625
|
|
},
|
|
{
|
|
"entropy": 5.423502254486084,
|
|
"epoch": 1.5272904104259872,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.00047671703255000326,
|
|
"loss": 5.1654,
|
|
"mean_token_accuracy": 0.18301084488630295,
|
|
"num_tokens": 34062059.0,
|
|
"step": 19630
|
|
},
|
|
{
|
|
"entropy": 5.500806188583374,
|
|
"epoch": 1.5276794397977047,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0004767047529320673,
|
|
"loss": 5.225,
|
|
"mean_token_accuracy": 0.17521772533655167,
|
|
"num_tokens": 34070800.0,
|
|
"step": 19635
|
|
},
|
|
{
|
|
"entropy": 5.486517095565796,
|
|
"epoch": 1.5280684691694222,
|
|
"grad_norm": 1.5546875,
|
|
"learning_rate": 0.00047669247025358257,
|
|
"loss": 5.28,
|
|
"mean_token_accuracy": 0.17450067400932312,
|
|
"num_tokens": 34079935.0,
|
|
"step": 19640
|
|
},
|
|
{
|
|
"entropy": 5.426252222061157,
|
|
"epoch": 1.5284574985411399,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00047668018451473584,
|
|
"loss": 5.1294,
|
|
"mean_token_accuracy": 0.18027275502681733,
|
|
"num_tokens": 34088614.0,
|
|
"step": 19645
|
|
},
|
|
{
|
|
"entropy": 5.4861650466918945,
|
|
"epoch": 1.5288465279128576,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0004766678957157132,
|
|
"loss": 5.1695,
|
|
"mean_token_accuracy": 0.18520078361034392,
|
|
"num_tokens": 34096899.0,
|
|
"step": 19650
|
|
},
|
|
{
|
|
"entropy": 5.498898315429687,
|
|
"epoch": 1.5292355572845748,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0004766556038567013,
|
|
"loss": 5.2853,
|
|
"mean_token_accuracy": 0.1748550772666931,
|
|
"num_tokens": 34105936.0,
|
|
"step": 19655
|
|
},
|
|
{
|
|
"entropy": 5.44925856590271,
|
|
"epoch": 1.5296245866562925,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.0004766433089378865,
|
|
"loss": 5.1134,
|
|
"mean_token_accuracy": 0.18217934668064117,
|
|
"num_tokens": 34113675.0,
|
|
"step": 19660
|
|
},
|
|
{
|
|
"entropy": 5.437675809860229,
|
|
"epoch": 1.5300136160280102,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.00047663101095945544,
|
|
"loss": 5.0417,
|
|
"mean_token_accuracy": 0.1928710386157036,
|
|
"num_tokens": 34121944.0,
|
|
"step": 19665
|
|
},
|
|
{
|
|
"entropy": 5.3499672412872314,
|
|
"epoch": 1.5304026453997277,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.00047661870992159476,
|
|
"loss": 5.1546,
|
|
"mean_token_accuracy": 0.1867653787136078,
|
|
"num_tokens": 34130403.0,
|
|
"step": 19670
|
|
},
|
|
{
|
|
"entropy": 5.476577043533325,
|
|
"epoch": 1.5307916747714452,
|
|
"grad_norm": 1.5703125,
|
|
"learning_rate": 0.00047660640582449106,
|
|
"loss": 5.2835,
|
|
"mean_token_accuracy": 0.1842742756009102,
|
|
"num_tokens": 34139853.0,
|
|
"step": 19675
|
|
},
|
|
{
|
|
"entropy": 5.61764817237854,
|
|
"epoch": 1.5311807041431629,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.00047659409866833104,
|
|
"loss": 5.3053,
|
|
"mean_token_accuracy": 0.18074336946010588,
|
|
"num_tokens": 34147833.0,
|
|
"step": 19680
|
|
},
|
|
{
|
|
"entropy": 5.498538589477539,
|
|
"epoch": 1.5315697335148803,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0004765817884533014,
|
|
"loss": 5.1976,
|
|
"mean_token_accuracy": 0.18689271062612534,
|
|
"num_tokens": 34156248.0,
|
|
"step": 19685
|
|
},
|
|
{
|
|
"entropy": 5.346911430358887,
|
|
"epoch": 1.5319587628865978,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.000476569475179589,
|
|
"loss": 5.043,
|
|
"mean_token_accuracy": 0.18949762880802154,
|
|
"num_tokens": 34164523.0,
|
|
"step": 19690
|
|
},
|
|
{
|
|
"entropy": 5.479613447189331,
|
|
"epoch": 1.5323477922583155,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.00047655715884738074,
|
|
"loss": 5.3472,
|
|
"mean_token_accuracy": 0.17629763334989548,
|
|
"num_tokens": 34174084.0,
|
|
"step": 19695
|
|
},
|
|
{
|
|
"entropy": 5.525538158416748,
|
|
"epoch": 1.5327368216300332,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004765448394568632,
|
|
"loss": 5.2173,
|
|
"mean_token_accuracy": 0.17957034856081008,
|
|
"num_tokens": 34182551.0,
|
|
"step": 19700
|
|
},
|
|
{
|
|
"entropy": 5.418088054656982,
|
|
"epoch": 1.5331258510017505,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0004765325170082237,
|
|
"loss": 5.0651,
|
|
"mean_token_accuracy": 0.18832858204841613,
|
|
"num_tokens": 34190899.0,
|
|
"step": 19705
|
|
},
|
|
{
|
|
"entropy": 5.522061109542847,
|
|
"epoch": 1.5335148803734682,
|
|
"grad_norm": 1.4921875,
|
|
"learning_rate": 0.000476520191501649,
|
|
"loss": 5.3083,
|
|
"mean_token_accuracy": 0.177359838783741,
|
|
"num_tokens": 34200394.0,
|
|
"step": 19710
|
|
},
|
|
{
|
|
"entropy": 5.611400032043457,
|
|
"epoch": 1.5339039097451859,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.00047650786293732607,
|
|
"loss": 5.2874,
|
|
"mean_token_accuracy": 0.17331336587667465,
|
|
"num_tokens": 34209773.0,
|
|
"step": 19715
|
|
},
|
|
{
|
|
"entropy": 5.511234283447266,
|
|
"epoch": 1.5342929391169033,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0004764955313154421,
|
|
"loss": 5.2064,
|
|
"mean_token_accuracy": 0.17431368678808212,
|
|
"num_tokens": 34218487.0,
|
|
"step": 19720
|
|
},
|
|
{
|
|
"entropy": 5.487458896636963,
|
|
"epoch": 1.5346819684886208,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00047648319663618415,
|
|
"loss": 5.2548,
|
|
"mean_token_accuracy": 0.1804940178990364,
|
|
"num_tokens": 34227309.0,
|
|
"step": 19725
|
|
},
|
|
{
|
|
"entropy": 5.503789329528809,
|
|
"epoch": 1.5350709978603385,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.00047647085889973936,
|
|
"loss": 5.2114,
|
|
"mean_token_accuracy": 0.17855969667434693,
|
|
"num_tokens": 34235877.0,
|
|
"step": 19730
|
|
},
|
|
{
|
|
"entropy": 5.46956729888916,
|
|
"epoch": 1.535460027232056,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.00047645851810629503,
|
|
"loss": 5.1683,
|
|
"mean_token_accuracy": 0.1814999908208847,
|
|
"num_tokens": 34244073.0,
|
|
"step": 19735
|
|
},
|
|
{
|
|
"entropy": 5.431026744842529,
|
|
"epoch": 1.5358490566037735,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00047644617425603825,
|
|
"loss": 5.1868,
|
|
"mean_token_accuracy": 0.1871108666062355,
|
|
"num_tokens": 34252255.0,
|
|
"step": 19740
|
|
},
|
|
{
|
|
"entropy": 5.431720304489136,
|
|
"epoch": 1.5362380859754912,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.0004764338273491565,
|
|
"loss": 5.1739,
|
|
"mean_token_accuracy": 0.18503494411706925,
|
|
"num_tokens": 34261063.0,
|
|
"step": 19745
|
|
},
|
|
{
|
|
"entropy": 5.4985613346099855,
|
|
"epoch": 1.5366271153472089,
|
|
"grad_norm": 1.5,
|
|
"learning_rate": 0.00047642147738583695,
|
|
"loss": 5.2282,
|
|
"mean_token_accuracy": 0.18080779612064363,
|
|
"num_tokens": 34269072.0,
|
|
"step": 19750
|
|
},
|
|
{
|
|
"entropy": 5.572714757919312,
|
|
"epoch": 1.5370161447189261,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.0004764091243662671,
|
|
"loss": 5.2334,
|
|
"mean_token_accuracy": 0.1733746498823166,
|
|
"num_tokens": 34277845.0,
|
|
"step": 19755
|
|
},
|
|
{
|
|
"entropy": 5.364095258712768,
|
|
"epoch": 1.5374051740906438,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.00047639676829063437,
|
|
"loss": 5.045,
|
|
"mean_token_accuracy": 0.18852402567863463,
|
|
"num_tokens": 34285831.0,
|
|
"step": 19760
|
|
},
|
|
{
|
|
"entropy": 5.504438877105713,
|
|
"epoch": 1.5377942034623615,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.00047638440915912623,
|
|
"loss": 5.2508,
|
|
"mean_token_accuracy": 0.17240538448095322,
|
|
"num_tokens": 34294095.0,
|
|
"step": 19765
|
|
},
|
|
{
|
|
"entropy": 5.547203922271729,
|
|
"epoch": 1.538183232834079,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0004763720469719303,
|
|
"loss": 5.1954,
|
|
"mean_token_accuracy": 0.18026113361120225,
|
|
"num_tokens": 34301570.0,
|
|
"step": 19770
|
|
},
|
|
{
|
|
"entropy": 5.495599031448364,
|
|
"epoch": 1.5385722622057965,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.000476359681729234,
|
|
"loss": 5.2356,
|
|
"mean_token_accuracy": 0.17696039229631425,
|
|
"num_tokens": 34310119.0,
|
|
"step": 19775
|
|
},
|
|
{
|
|
"entropy": 5.480938148498535,
|
|
"epoch": 1.5389612915775142,
|
|
"grad_norm": 1.7734375,
|
|
"learning_rate": 0.000476347313431225,
|
|
"loss": 5.1883,
|
|
"mean_token_accuracy": 0.1851821169257164,
|
|
"num_tokens": 34319622.0,
|
|
"step": 19780
|
|
},
|
|
{
|
|
"entropy": 5.452160167694092,
|
|
"epoch": 1.5393503209492316,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00047633494207809096,
|
|
"loss": 5.1393,
|
|
"mean_token_accuracy": 0.18909958004951477,
|
|
"num_tokens": 34328376.0,
|
|
"step": 19785
|
|
},
|
|
{
|
|
"entropy": 5.44116439819336,
|
|
"epoch": 1.539739350320949,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.00047632256767001977,
|
|
"loss": 5.2084,
|
|
"mean_token_accuracy": 0.1765326291322708,
|
|
"num_tokens": 34337430.0,
|
|
"step": 19790
|
|
},
|
|
{
|
|
"entropy": 5.490219402313232,
|
|
"epoch": 1.5401283796926668,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.000476310190207199,
|
|
"loss": 5.2132,
|
|
"mean_token_accuracy": 0.17990840077400208,
|
|
"num_tokens": 34345639.0,
|
|
"step": 19795
|
|
},
|
|
{
|
|
"entropy": 5.506849002838135,
|
|
"epoch": 1.5405174090643845,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.00047629780968981653,
|
|
"loss": 5.2122,
|
|
"mean_token_accuracy": 0.18238580226898193,
|
|
"num_tokens": 34354083.0,
|
|
"step": 19800
|
|
},
|
|
{
|
|
"entropy": 5.418828344345092,
|
|
"epoch": 1.540906438436102,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.00047628542611806007,
|
|
"loss": 5.2057,
|
|
"mean_token_accuracy": 0.17785896956920624,
|
|
"num_tokens": 34363882.0,
|
|
"step": 19805
|
|
},
|
|
{
|
|
"entropy": 5.435290765762329,
|
|
"epoch": 1.5412954678078195,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.00047627303949211773,
|
|
"loss": 5.1217,
|
|
"mean_token_accuracy": 0.1828346937894821,
|
|
"num_tokens": 34372487.0,
|
|
"step": 19810
|
|
},
|
|
{
|
|
"entropy": 5.444420289993286,
|
|
"epoch": 1.5416844971795371,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.0004762606498121774,
|
|
"loss": 5.1576,
|
|
"mean_token_accuracy": 0.18511340916156768,
|
|
"num_tokens": 34380729.0,
|
|
"step": 19815
|
|
},
|
|
{
|
|
"entropy": 5.4918725967407225,
|
|
"epoch": 1.5420735265512546,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.000476248257078427,
|
|
"loss": 5.2117,
|
|
"mean_token_accuracy": 0.1794438421726227,
|
|
"num_tokens": 34390121.0,
|
|
"step": 19820
|
|
},
|
|
{
|
|
"entropy": 5.479753303527832,
|
|
"epoch": 1.542462555922972,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.0004762358612910547,
|
|
"loss": 5.1712,
|
|
"mean_token_accuracy": 0.1830163836479187,
|
|
"num_tokens": 34398460.0,
|
|
"step": 19825
|
|
},
|
|
{
|
|
"entropy": 5.409863662719727,
|
|
"epoch": 1.5428515852946898,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.0004762234624502484,
|
|
"loss": 5.1799,
|
|
"mean_token_accuracy": 0.17674736827611923,
|
|
"num_tokens": 34407406.0,
|
|
"step": 19830
|
|
},
|
|
{
|
|
"entropy": 5.405714082717895,
|
|
"epoch": 1.5432406146664073,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.00047621106055619644,
|
|
"loss": 5.1475,
|
|
"mean_token_accuracy": 0.18271561861038207,
|
|
"num_tokens": 34416588.0,
|
|
"step": 19835
|
|
},
|
|
{
|
|
"entropy": 5.507746934890747,
|
|
"epoch": 1.5436296440381247,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00047619865560908687,
|
|
"loss": 5.2173,
|
|
"mean_token_accuracy": 0.17487202882766723,
|
|
"num_tokens": 34425266.0,
|
|
"step": 19840
|
|
},
|
|
{
|
|
"entropy": 5.483136749267578,
|
|
"epoch": 1.5440186734098424,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.0004761862476091079,
|
|
"loss": 5.1389,
|
|
"mean_token_accuracy": 0.1795143261551857,
|
|
"num_tokens": 34433790.0,
|
|
"step": 19845
|
|
},
|
|
{
|
|
"entropy": 5.531909418106079,
|
|
"epoch": 1.5444077027815601,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.00047617383655644785,
|
|
"loss": 5.2876,
|
|
"mean_token_accuracy": 0.17520427703857422,
|
|
"num_tokens": 34442733.0,
|
|
"step": 19850
|
|
},
|
|
{
|
|
"entropy": 5.565989542007446,
|
|
"epoch": 1.5447967321532776,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0004761614224512951,
|
|
"loss": 5.1963,
|
|
"mean_token_accuracy": 0.17827538698911666,
|
|
"num_tokens": 34451756.0,
|
|
"step": 19855
|
|
},
|
|
{
|
|
"entropy": 5.432512331008911,
|
|
"epoch": 1.545185761524995,
|
|
"grad_norm": 1.53125,
|
|
"learning_rate": 0.0004761490052938379,
|
|
"loss": 5.2104,
|
|
"mean_token_accuracy": 0.18320125043392183,
|
|
"num_tokens": 34460003.0,
|
|
"step": 19860
|
|
},
|
|
{
|
|
"entropy": 5.474145603179932,
|
|
"epoch": 1.5455747908967128,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0004761365850842646,
|
|
"loss": 5.2008,
|
|
"mean_token_accuracy": 0.18178107887506484,
|
|
"num_tokens": 34468485.0,
|
|
"step": 19865
|
|
},
|
|
{
|
|
"entropy": 5.495116233825684,
|
|
"epoch": 1.5459638202684303,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.0004761241618227639,
|
|
"loss": 5.1354,
|
|
"mean_token_accuracy": 0.184324748814106,
|
|
"num_tokens": 34477221.0,
|
|
"step": 19870
|
|
},
|
|
{
|
|
"entropy": 5.487471008300782,
|
|
"epoch": 1.5463528496401477,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00047611173550952414,
|
|
"loss": 5.2695,
|
|
"mean_token_accuracy": 0.1747969314455986,
|
|
"num_tokens": 34486339.0,
|
|
"step": 19875
|
|
},
|
|
{
|
|
"entropy": 5.4889143943786625,
|
|
"epoch": 1.5467418790118654,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.00047609930614473387,
|
|
"loss": 5.1477,
|
|
"mean_token_accuracy": 0.18432500660419465,
|
|
"num_tokens": 34494595.0,
|
|
"step": 19880
|
|
},
|
|
{
|
|
"entropy": 5.402968835830689,
|
|
"epoch": 1.547130908383583,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.00047608687372858175,
|
|
"loss": 5.1042,
|
|
"mean_token_accuracy": 0.18374691009521485,
|
|
"num_tokens": 34502702.0,
|
|
"step": 19885
|
|
},
|
|
{
|
|
"entropy": 5.471234607696533,
|
|
"epoch": 1.5475199377553004,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.00047607443826125633,
|
|
"loss": 5.2517,
|
|
"mean_token_accuracy": 0.18215447068214416,
|
|
"num_tokens": 34510828.0,
|
|
"step": 19890
|
|
},
|
|
{
|
|
"entropy": 5.5496598243713375,
|
|
"epoch": 1.547908967127018,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.00047606199974294637,
|
|
"loss": 5.3267,
|
|
"mean_token_accuracy": 0.17488835752010345,
|
|
"num_tokens": 34520288.0,
|
|
"step": 19895
|
|
},
|
|
{
|
|
"entropy": 5.540404415130615,
|
|
"epoch": 1.5482979964987358,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.0004760495581738406,
|
|
"loss": 5.1778,
|
|
"mean_token_accuracy": 0.18626682013273238,
|
|
"num_tokens": 34528178.0,
|
|
"step": 19900
|
|
},
|
|
{
|
|
"entropy": 5.515796661376953,
|
|
"epoch": 1.5486870258704533,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.0004760371135541278,
|
|
"loss": 5.2237,
|
|
"mean_token_accuracy": 0.17197165340185167,
|
|
"num_tokens": 34536915.0,
|
|
"step": 19905
|
|
},
|
|
{
|
|
"entropy": 5.492049074172973,
|
|
"epoch": 1.5490760552421707,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004760246658839967,
|
|
"loss": 5.1954,
|
|
"mean_token_accuracy": 0.17590635120868683,
|
|
"num_tokens": 34545009.0,
|
|
"step": 19910
|
|
},
|
|
{
|
|
"entropy": 5.505061864852905,
|
|
"epoch": 1.5494650846138884,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0004760122151636364,
|
|
"loss": 5.2785,
|
|
"mean_token_accuracy": 0.18025541603565215,
|
|
"num_tokens": 34553936.0,
|
|
"step": 19915
|
|
},
|
|
{
|
|
"entropy": 5.549693870544433,
|
|
"epoch": 1.549854113985606,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.0004759997613932356,
|
|
"loss": 5.1699,
|
|
"mean_token_accuracy": 0.1813696250319481,
|
|
"num_tokens": 34563068.0,
|
|
"step": 19920
|
|
},
|
|
{
|
|
"entropy": 5.542169284820557,
|
|
"epoch": 1.5502431433573234,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.00047598730457298335,
|
|
"loss": 5.2894,
|
|
"mean_token_accuracy": 0.17407681941986083,
|
|
"num_tokens": 34571787.0,
|
|
"step": 19925
|
|
},
|
|
{
|
|
"entropy": 5.535120296478271,
|
|
"epoch": 1.550632172729041,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.00047597484470306866,
|
|
"loss": 5.1868,
|
|
"mean_token_accuracy": 0.18009826689958572,
|
|
"num_tokens": 34580375.0,
|
|
"step": 19930
|
|
},
|
|
{
|
|
"entropy": 5.503318452835083,
|
|
"epoch": 1.5510212021007586,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0004759623817836806,
|
|
"loss": 5.245,
|
|
"mean_token_accuracy": 0.18353112339973449,
|
|
"num_tokens": 34588762.0,
|
|
"step": 19935
|
|
},
|
|
{
|
|
"entropy": 5.447995662689209,
|
|
"epoch": 1.551410231472476,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0004759499158150082,
|
|
"loss": 5.1248,
|
|
"mean_token_accuracy": 0.1830548956990242,
|
|
"num_tokens": 34596986.0,
|
|
"step": 19940
|
|
},
|
|
{
|
|
"entropy": 5.54951286315918,
|
|
"epoch": 1.5517992608441937,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.00047593744679724076,
|
|
"loss": 5.2702,
|
|
"mean_token_accuracy": 0.17655257731676102,
|
|
"num_tokens": 34605445.0,
|
|
"step": 19945
|
|
},
|
|
{
|
|
"entropy": 5.446385192871094,
|
|
"epoch": 1.5521882902159114,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.00047592497473056733,
|
|
"loss": 5.24,
|
|
"mean_token_accuracy": 0.1844542443752289,
|
|
"num_tokens": 34614793.0,
|
|
"step": 19950
|
|
},
|
|
{
|
|
"entropy": 5.584630346298217,
|
|
"epoch": 1.552577319587629,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.00047591249961517724,
|
|
"loss": 5.3185,
|
|
"mean_token_accuracy": 0.17114103883504866,
|
|
"num_tokens": 34623790.0,
|
|
"step": 19955
|
|
},
|
|
{
|
|
"entropy": 5.517696809768677,
|
|
"epoch": 1.5529663489593464,
|
|
"grad_norm": 1.546875,
|
|
"learning_rate": 0.0004759000214512598,
|
|
"loss": 5.1859,
|
|
"mean_token_accuracy": 0.1818420946598053,
|
|
"num_tokens": 34632387.0,
|
|
"step": 19960
|
|
},
|
|
{
|
|
"entropy": 5.397317361831665,
|
|
"epoch": 1.553355378331064,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.0004758875402390042,
|
|
"loss": 5.1678,
|
|
"mean_token_accuracy": 0.19219065010547637,
|
|
"num_tokens": 34640097.0,
|
|
"step": 19965
|
|
},
|
|
{
|
|
"entropy": 5.458669185638428,
|
|
"epoch": 1.5537444077027815,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.00047587505597859996,
|
|
"loss": 5.1831,
|
|
"mean_token_accuracy": 0.17667574435472488,
|
|
"num_tokens": 34649525.0,
|
|
"step": 19970
|
|
},
|
|
{
|
|
"entropy": 5.44020528793335,
|
|
"epoch": 1.554133437074499,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.00047586256867023646,
|
|
"loss": 5.1297,
|
|
"mean_token_accuracy": 0.1852404221892357,
|
|
"num_tokens": 34658467.0,
|
|
"step": 19975
|
|
},
|
|
{
|
|
"entropy": 5.577917671203613,
|
|
"epoch": 1.5545224664462167,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.0004758500783141032,
|
|
"loss": 5.2773,
|
|
"mean_token_accuracy": 0.17768087536096572,
|
|
"num_tokens": 34666926.0,
|
|
"step": 19980
|
|
},
|
|
{
|
|
"entropy": 5.526213502883911,
|
|
"epoch": 1.5549114958179344,
|
|
"grad_norm": 1.6015625,
|
|
"learning_rate": 0.0004758375849103897,
|
|
"loss": 5.2087,
|
|
"mean_token_accuracy": 0.18167522102594375,
|
|
"num_tokens": 34675023.0,
|
|
"step": 19985
|
|
},
|
|
{
|
|
"entropy": 5.419299173355102,
|
|
"epoch": 1.5553005251896517,
|
|
"grad_norm": 1.5625,
|
|
"learning_rate": 0.0004758250884592855,
|
|
"loss": 5.1438,
|
|
"mean_token_accuracy": 0.18262318074703215,
|
|
"num_tokens": 34683191.0,
|
|
"step": 19990
|
|
},
|
|
{
|
|
"entropy": 5.514609670639038,
|
|
"epoch": 1.5556895545613694,
|
|
"grad_norm": 1.5,
|
|
"learning_rate": 0.00047581258896098024,
|
|
"loss": 5.1846,
|
|
"mean_token_accuracy": 0.18850539922714232,
|
|
"num_tokens": 34691899.0,
|
|
"step": 19995
|
|
},
|
|
{
|
|
"entropy": 5.509262943267823,
|
|
"epoch": 1.556078583933087,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.0004758000864156636,
|
|
"loss": 5.2475,
|
|
"mean_token_accuracy": 0.17835673689842224,
|
|
"num_tokens": 34700942.0,
|
|
"step": 20000
|
|
},
|
|
{
|
|
"entropy": 5.5044395446777346,
|
|
"epoch": 1.5564676133048045,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.00047578758082352527,
|
|
"loss": 5.2879,
|
|
"mean_token_accuracy": 0.1785033419728279,
|
|
"num_tokens": 34710780.0,
|
|
"step": 20005
|
|
},
|
|
{
|
|
"entropy": 5.49509072303772,
|
|
"epoch": 1.556856642676522,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 0.00047577507218475487,
|
|
"loss": 5.2164,
|
|
"mean_token_accuracy": 0.17685188353061676,
|
|
"num_tokens": 34719332.0,
|
|
"step": 20010
|
|
},
|
|
{
|
|
"entropy": 5.545003652572632,
|
|
"epoch": 1.5572456720482397,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.00047576256049954236,
|
|
"loss": 5.2716,
|
|
"mean_token_accuracy": 0.16867067515850068,
|
|
"num_tokens": 34727890.0,
|
|
"step": 20015
|
|
},
|
|
{
|
|
"entropy": 5.507272338867187,
|
|
"epoch": 1.5576347014199572,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0004757500457680776,
|
|
"loss": 5.2147,
|
|
"mean_token_accuracy": 0.18060846477746964,
|
|
"num_tokens": 34736942.0,
|
|
"step": 20020
|
|
},
|
|
{
|
|
"entropy": 5.455156087875366,
|
|
"epoch": 1.5580237307916747,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 0.0004757375279905504,
|
|
"loss": 5.0807,
|
|
"mean_token_accuracy": 0.18964427560567856,
|
|
"num_tokens": 34745612.0,
|
|
"step": 20025
|
|
},
|
|
{
|
|
"entropy": 5.459772968292237,
|
|
"epoch": 1.5584127601633924,
|
|
"grad_norm": 1.5078125,
|
|
"learning_rate": 0.00047572500716715075,
|
|
"loss": 5.1761,
|
|
"mean_token_accuracy": 0.17480820119380952,
|
|
"num_tokens": 34754276.0,
|
|
"step": 20030
|
|
},
|
|
{
|
|
"entropy": 5.408022832870484,
|
|
"epoch": 1.55880178953511,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.00047571248329806855,
|
|
"loss": 5.0851,
|
|
"mean_token_accuracy": 0.19091185331344604,
|
|
"num_tokens": 34762042.0,
|
|
"step": 20035
|
|
},
|
|
{
|
|
"entropy": 5.4226601123809814,
|
|
"epoch": 1.5591908189068273,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.00047569995638349383,
|
|
"loss": 5.1381,
|
|
"mean_token_accuracy": 0.18298070281744003,
|
|
"num_tokens": 34770172.0,
|
|
"step": 20040
|
|
},
|
|
{
|
|
"entropy": 5.468042612075806,
|
|
"epoch": 1.559579848278545,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0004756874264236168,
|
|
"loss": 5.1465,
|
|
"mean_token_accuracy": 0.17935450673103331,
|
|
"num_tokens": 34778647.0,
|
|
"step": 20045
|
|
},
|
|
{
|
|
"entropy": 5.456257677078247,
|
|
"epoch": 1.5599688776502627,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.00047567489341862753,
|
|
"loss": 5.1715,
|
|
"mean_token_accuracy": 0.18207741528749466,
|
|
"num_tokens": 34787409.0,
|
|
"step": 20050
|
|
},
|
|
{
|
|
"entropy": 5.528086948394775,
|
|
"epoch": 1.5603579070219802,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.00047566235736871607,
|
|
"loss": 5.26,
|
|
"mean_token_accuracy": 0.17863278985023498,
|
|
"num_tokens": 34795634.0,
|
|
"step": 20055
|
|
},
|
|
{
|
|
"entropy": 5.430089521408081,
|
|
"epoch": 1.5607469363936977,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.00047564981827407277,
|
|
"loss": 5.1169,
|
|
"mean_token_accuracy": 0.18615238815546037,
|
|
"num_tokens": 34803803.0,
|
|
"step": 20060
|
|
},
|
|
{
|
|
"entropy": 5.479111433029175,
|
|
"epoch": 1.5611359657654154,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.00047563727613488785,
|
|
"loss": 5.1208,
|
|
"mean_token_accuracy": 0.18263283669948577,
|
|
"num_tokens": 34813202.0,
|
|
"step": 20065
|
|
},
|
|
{
|
|
"entropy": 5.456806564331055,
|
|
"epoch": 1.5615249951371328,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.00047562473095135154,
|
|
"loss": 5.2443,
|
|
"mean_token_accuracy": 0.17681720703840256,
|
|
"num_tokens": 34821717.0,
|
|
"step": 20070
|
|
},
|
|
{
|
|
"entropy": 5.437485980987549,
|
|
"epoch": 1.5619140245088503,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.0004756121827236544,
|
|
"loss": 5.1429,
|
|
"mean_token_accuracy": 0.18623988777399064,
|
|
"num_tokens": 34830366.0,
|
|
"step": 20075
|
|
},
|
|
{
|
|
"entropy": 5.46750659942627,
|
|
"epoch": 1.562303053880568,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0004755996314519866,
|
|
"loss": 5.2125,
|
|
"mean_token_accuracy": 0.18663814812898635,
|
|
"num_tokens": 34838734.0,
|
|
"step": 20080
|
|
},
|
|
{
|
|
"entropy": 5.441515922546387,
|
|
"epoch": 1.5626920832522857,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0004755870771365387,
|
|
"loss": 5.1099,
|
|
"mean_token_accuracy": 0.18490248173475266,
|
|
"num_tokens": 34846873.0,
|
|
"step": 20085
|
|
},
|
|
{
|
|
"entropy": 5.49475884437561,
|
|
"epoch": 1.563081112624003,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.00047557451977750113,
|
|
"loss": 5.1646,
|
|
"mean_token_accuracy": 0.18140379935503007,
|
|
"num_tokens": 34855542.0,
|
|
"step": 20090
|
|
},
|
|
{
|
|
"entropy": 5.445983028411865,
|
|
"epoch": 1.5634701419957207,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.0004755619593750645,
|
|
"loss": 5.132,
|
|
"mean_token_accuracy": 0.18272922784090043,
|
|
"num_tokens": 34864656.0,
|
|
"step": 20095
|
|
},
|
|
{
|
|
"entropy": 5.4873534679412845,
|
|
"epoch": 1.5638591713674383,
|
|
"grad_norm": 1.578125,
|
|
"learning_rate": 0.0004755493959294194,
|
|
"loss": 5.2385,
|
|
"mean_token_accuracy": 0.17879534065723418,
|
|
"num_tokens": 34873891.0,
|
|
"step": 20100
|
|
},
|
|
{
|
|
"entropy": 5.546848249435425,
|
|
"epoch": 1.5642482007391558,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.0004755368294407564,
|
|
"loss": 5.2312,
|
|
"mean_token_accuracy": 0.17930146902799607,
|
|
"num_tokens": 34883278.0,
|
|
"step": 20105
|
|
},
|
|
{
|
|
"entropy": 5.41421914100647,
|
|
"epoch": 1.5646372301108733,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0004755242599092662,
|
|
"loss": 5.1279,
|
|
"mean_token_accuracy": 0.17887418419122697,
|
|
"num_tokens": 34892323.0,
|
|
"step": 20110
|
|
},
|
|
{
|
|
"entropy": 5.465075826644897,
|
|
"epoch": 1.565026259482591,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.00047551168733513956,
|
|
"loss": 5.1851,
|
|
"mean_token_accuracy": 0.17728228271007537,
|
|
"num_tokens": 34901774.0,
|
|
"step": 20115
|
|
},
|
|
{
|
|
"entropy": 5.545860385894775,
|
|
"epoch": 1.5654152888543085,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.00047549911171856717,
|
|
"loss": 5.1976,
|
|
"mean_token_accuracy": 0.1806068405508995,
|
|
"num_tokens": 34911082.0,
|
|
"step": 20120
|
|
},
|
|
{
|
|
"entropy": 5.490971231460572,
|
|
"epoch": 1.565804318226026,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.0004754865330597398,
|
|
"loss": 5.2061,
|
|
"mean_token_accuracy": 0.18051420599222184,
|
|
"num_tokens": 34919631.0,
|
|
"step": 20125
|
|
},
|
|
{
|
|
"entropy": 5.535692453384399,
|
|
"epoch": 1.5661933475977436,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.00047547395135884854,
|
|
"loss": 5.2087,
|
|
"mean_token_accuracy": 0.1791385143995285,
|
|
"num_tokens": 34928258.0,
|
|
"step": 20130
|
|
},
|
|
{
|
|
"entropy": 5.481483840942383,
|
|
"epoch": 1.5665823769694613,
|
|
"grad_norm": 1.9140625,
|
|
"learning_rate": 0.0004754613666160841,
|
|
"loss": 5.1922,
|
|
"mean_token_accuracy": 0.18388463705778121,
|
|
"num_tokens": 34936590.0,
|
|
"step": 20135
|
|
},
|
|
{
|
|
"entropy": 5.462180948257446,
|
|
"epoch": 1.5669714063411786,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.00047544877883163753,
|
|
"loss": 5.2088,
|
|
"mean_token_accuracy": 0.17439429759979247,
|
|
"num_tokens": 34945468.0,
|
|
"step": 20140
|
|
},
|
|
{
|
|
"entropy": 5.412143993377685,
|
|
"epoch": 1.5673604357128963,
|
|
"grad_norm": 1.8203125,
|
|
"learning_rate": 0.00047543618800569975,
|
|
"loss": 5.1265,
|
|
"mean_token_accuracy": 0.18731385320425034,
|
|
"num_tokens": 34954005.0,
|
|
"step": 20145
|
|
},
|
|
{
|
|
"entropy": 5.364945936203003,
|
|
"epoch": 1.567749465084614,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.00047542359413846184,
|
|
"loss": 5.1444,
|
|
"mean_token_accuracy": 0.18193342238664628,
|
|
"num_tokens": 34962852.0,
|
|
"step": 20150
|
|
},
|
|
{
|
|
"entropy": 5.479076814651489,
|
|
"epoch": 1.5681384944563315,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.0004754109972301149,
|
|
"loss": 5.2003,
|
|
"mean_token_accuracy": 0.17850263118743898,
|
|
"num_tokens": 34971718.0,
|
|
"step": 20155
|
|
},
|
|
{
|
|
"entropy": 5.496933317184448,
|
|
"epoch": 1.568527523828049,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.00047539839728085007,
|
|
"loss": 5.1171,
|
|
"mean_token_accuracy": 0.1883447512984276,
|
|
"num_tokens": 34980155.0,
|
|
"step": 20160
|
|
},
|
|
{
|
|
"entropy": 5.515892601013183,
|
|
"epoch": 1.5689165531997666,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.0004753857942908585,
|
|
"loss": 5.3715,
|
|
"mean_token_accuracy": 0.16563240736722945,
|
|
"num_tokens": 34989971.0,
|
|
"step": 20165
|
|
},
|
|
{
|
|
"entropy": 5.439229297637939,
|
|
"epoch": 1.5693055825714841,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.0004753731882603315,
|
|
"loss": 5.1607,
|
|
"mean_token_accuracy": 0.17715786248445511,
|
|
"num_tokens": 34998760.0,
|
|
"step": 20170
|
|
},
|
|
{
|
|
"entropy": 5.479458665847778,
|
|
"epoch": 1.5696946119432016,
|
|
"grad_norm": 1.578125,
|
|
"learning_rate": 0.00047536057918946026,
|
|
"loss": 5.2129,
|
|
"mean_token_accuracy": 0.181034417450428,
|
|
"num_tokens": 35008020.0,
|
|
"step": 20175
|
|
},
|
|
{
|
|
"entropy": 5.388949680328369,
|
|
"epoch": 1.5700836413149193,
|
|
"grad_norm": 1.515625,
|
|
"learning_rate": 0.0004753479670784361,
|
|
"loss": 5.1018,
|
|
"mean_token_accuracy": 0.18547747284173965,
|
|
"num_tokens": 35016357.0,
|
|
"step": 20180
|
|
},
|
|
{
|
|
"entropy": 5.439433670043945,
|
|
"epoch": 1.570472670686637,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.0004753353519274505,
|
|
"loss": 5.2026,
|
|
"mean_token_accuracy": 0.18218655735254288,
|
|
"num_tokens": 35025312.0,
|
|
"step": 20185
|
|
},
|
|
{
|
|
"entropy": 5.425490427017212,
|
|
"epoch": 1.5708617000583545,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0004753227337366948,
|
|
"loss": 5.244,
|
|
"mean_token_accuracy": 0.1861625462770462,
|
|
"num_tokens": 35033781.0,
|
|
"step": 20190
|
|
},
|
|
{
|
|
"entropy": 5.528507804870605,
|
|
"epoch": 1.571250729430072,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 0.00047531011250636046,
|
|
"loss": 5.2653,
|
|
"mean_token_accuracy": 0.17623920142650604,
|
|
"num_tokens": 35042884.0,
|
|
"step": 20195
|
|
},
|
|
{
|
|
"entropy": 5.52542724609375,
|
|
"epoch": 1.5716397588017896,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.00047529748823663896,
|
|
"loss": 5.1287,
|
|
"mean_token_accuracy": 0.1856717973947525,
|
|
"num_tokens": 35051789.0,
|
|
"step": 20200
|
|
},
|
|
{
|
|
"entropy": 5.483914804458618,
|
|
"epoch": 1.572028788173507,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0004752848609277219,
|
|
"loss": 5.2065,
|
|
"mean_token_accuracy": 0.18556610643863677,
|
|
"num_tokens": 35059958.0,
|
|
"step": 20205
|
|
},
|
|
{
|
|
"entropy": 5.504895973205566,
|
|
"epoch": 1.5724178175452246,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 0.00047527223057980086,
|
|
"loss": 5.1815,
|
|
"mean_token_accuracy": 0.17927256971597672,
|
|
"num_tokens": 35068384.0,
|
|
"step": 20210
|
|
},
|
|
{
|
|
"entropy": 5.541245460510254,
|
|
"epoch": 1.5728068469169423,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 0.00047525959719306736,
|
|
"loss": 5.2638,
|
|
"mean_token_accuracy": 0.17057959586381913,
|
|
"num_tokens": 35076660.0,
|
|
"step": 20215
|
|
},
|
|
{
|
|
"entropy": 5.4924084663391115,
|
|
"epoch": 1.5731958762886598,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 0.0004752469607677134,
|
|
"loss": 5.1652,
|
|
"mean_token_accuracy": 0.178454253077507,
|
|
"num_tokens": 35085527.0,
|
|
"step": 20220
|
|
},
|
|
{
|
|
"entropy": 5.4322062015533445,
|
|
"epoch": 1.5735849056603772,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0004752343213039305,
|
|
"loss": 5.1585,
|
|
"mean_token_accuracy": 0.17887477427721024,
|
|
"num_tokens": 35094066.0,
|
|
"step": 20225
|
|
},
|
|
{
|
|
"entropy": 5.5089866638183596,
|
|
"epoch": 1.573973935032095,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.0004752216788019104,
|
|
"loss": 5.3163,
|
|
"mean_token_accuracy": 0.16887042671442032,
|
|
"num_tokens": 35103219.0,
|
|
"step": 20230
|
|
},
|
|
{
|
|
"entropy": 5.527264547348023,
|
|
"epoch": 1.5743629644038126,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.0004752090332618451,
|
|
"loss": 5.2206,
|
|
"mean_token_accuracy": 0.17967237383127213,
|
|
"num_tokens": 35111336.0,
|
|
"step": 20235
|
|
},
|
|
{
|
|
"entropy": 5.483721399307251,
|
|
"epoch": 1.57475199377553,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0004751963846839263,
|
|
"loss": 5.1584,
|
|
"mean_token_accuracy": 0.18572721481323243,
|
|
"num_tokens": 35119758.0,
|
|
"step": 20240
|
|
},
|
|
{
|
|
"entropy": 5.38640456199646,
|
|
"epoch": 1.5751410231472476,
|
|
"grad_norm": 1.7421875,
|
|
"learning_rate": 0.00047518373306834605,
|
|
"loss": 5.0832,
|
|
"mean_token_accuracy": 0.18867708444595338,
|
|
"num_tokens": 35128535.0,
|
|
"step": 20245
|
|
},
|
|
{
|
|
"entropy": 5.4226783275604244,
|
|
"epoch": 1.5755300525189653,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.00047517107841529626,
|
|
"loss": 5.2642,
|
|
"mean_token_accuracy": 0.17584407925605774,
|
|
"num_tokens": 35137443.0,
|
|
"step": 20250
|
|
},
|
|
{
|
|
"entropy": 5.431370878219605,
|
|
"epoch": 1.5759190818906827,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.000475158420724969,
|
|
"loss": 5.0463,
|
|
"mean_token_accuracy": 0.18866675347089767,
|
|
"num_tokens": 35145801.0,
|
|
"step": 20255
|
|
},
|
|
{
|
|
"entropy": 5.540943908691406,
|
|
"epoch": 1.5763081112624002,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.00047514575999755627,
|
|
"loss": 5.2942,
|
|
"mean_token_accuracy": 0.17408110797405243,
|
|
"num_tokens": 35154661.0,
|
|
"step": 20260
|
|
},
|
|
{
|
|
"entropy": 5.511713886260987,
|
|
"epoch": 1.576697140634118,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.00047513309623325024,
|
|
"loss": 5.2793,
|
|
"mean_token_accuracy": 0.17403359711170197,
|
|
"num_tokens": 35163762.0,
|
|
"step": 20265
|
|
},
|
|
{
|
|
"entropy": 5.441919994354248,
|
|
"epoch": 1.5770861700058354,
|
|
"grad_norm": 1.5078125,
|
|
"learning_rate": 0.0004751204294322429,
|
|
"loss": 5.1797,
|
|
"mean_token_accuracy": 0.1780450239777565,
|
|
"num_tokens": 35172059.0,
|
|
"step": 20270
|
|
},
|
|
{
|
|
"entropy": 5.472014665603638,
|
|
"epoch": 1.5774751993775529,
|
|
"grad_norm": 1.5078125,
|
|
"learning_rate": 0.00047510775959472675,
|
|
"loss": 5.2504,
|
|
"mean_token_accuracy": 0.17407365143299103,
|
|
"num_tokens": 35179805.0,
|
|
"step": 20275
|
|
},
|
|
{
|
|
"entropy": 5.455626392364502,
|
|
"epoch": 1.5778642287492706,
|
|
"grad_norm": 1.4921875,
|
|
"learning_rate": 0.0004750950867208937,
|
|
"loss": 5.2072,
|
|
"mean_token_accuracy": 0.1857330769300461,
|
|
"num_tokens": 35188136.0,
|
|
"step": 20280
|
|
},
|
|
{
|
|
"entropy": 5.592495155334473,
|
|
"epoch": 1.5782532581209883,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0004750824108109362,
|
|
"loss": 5.2933,
|
|
"mean_token_accuracy": 0.17318070828914642,
|
|
"num_tokens": 35196577.0,
|
|
"step": 20285
|
|
},
|
|
{
|
|
"entropy": 5.416881084442139,
|
|
"epoch": 1.5786422874927057,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004750697318650466,
|
|
"loss": 5.1981,
|
|
"mean_token_accuracy": 0.17965558916330338,
|
|
"num_tokens": 35205223.0,
|
|
"step": 20290
|
|
},
|
|
{
|
|
"entropy": 5.510413932800293,
|
|
"epoch": 1.5790313168644232,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0004750570498834173,
|
|
"loss": 5.2692,
|
|
"mean_token_accuracy": 0.17673759013414383,
|
|
"num_tokens": 35213776.0,
|
|
"step": 20295
|
|
},
|
|
{
|
|
"entropy": 5.4544912815094,
|
|
"epoch": 1.579420346236141,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0004750443648662407,
|
|
"loss": 5.1789,
|
|
"mean_token_accuracy": 0.18731918185949326,
|
|
"num_tokens": 35222596.0,
|
|
"step": 20300
|
|
},
|
|
{
|
|
"entropy": 5.553009176254273,
|
|
"epoch": 1.5798093756078584,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.00047503167681370924,
|
|
"loss": 5.3616,
|
|
"mean_token_accuracy": 0.16760940849781036,
|
|
"num_tokens": 35232402.0,
|
|
"step": 20305
|
|
},
|
|
{
|
|
"entropy": 5.453909683227539,
|
|
"epoch": 1.5801984049795759,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.0004750189857260154,
|
|
"loss": 5.1,
|
|
"mean_token_accuracy": 0.19228098243474961,
|
|
"num_tokens": 35240651.0,
|
|
"step": 20310
|
|
},
|
|
{
|
|
"entropy": 5.410676622390747,
|
|
"epoch": 1.5805874343512936,
|
|
"grad_norm": 1.5078125,
|
|
"learning_rate": 0.0004750062916033519,
|
|
"loss": 5.13,
|
|
"mean_token_accuracy": 0.18499166667461395,
|
|
"num_tokens": 35249101.0,
|
|
"step": 20315
|
|
},
|
|
{
|
|
"entropy": 5.456141519546509,
|
|
"epoch": 1.580976463723011,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.0004749935944459113,
|
|
"loss": 5.2747,
|
|
"mean_token_accuracy": 0.173062002658844,
|
|
"num_tokens": 35257909.0,
|
|
"step": 20320
|
|
},
|
|
{
|
|
"entropy": 5.538648986816407,
|
|
"epoch": 1.5813654930947285,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0004749808942538862,
|
|
"loss": 5.3066,
|
|
"mean_token_accuracy": 0.17200930565595626,
|
|
"num_tokens": 35267128.0,
|
|
"step": 20325
|
|
},
|
|
{
|
|
"entropy": 5.515222454071045,
|
|
"epoch": 1.5817545224664462,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0004749681910274693,
|
|
"loss": 5.1942,
|
|
"mean_token_accuracy": 0.1811247080564499,
|
|
"num_tokens": 35275751.0,
|
|
"step": 20330
|
|
},
|
|
{
|
|
"entropy": 5.457746934890747,
|
|
"epoch": 1.582143551838164,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.00047495548476685334,
|
|
"loss": 5.1146,
|
|
"mean_token_accuracy": 0.18918879479169845,
|
|
"num_tokens": 35285359.0,
|
|
"step": 20335
|
|
},
|
|
{
|
|
"entropy": 5.3944993019104,
|
|
"epoch": 1.5825325812098814,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.00047494277547223125,
|
|
"loss": 5.114,
|
|
"mean_token_accuracy": 0.1809425249695778,
|
|
"num_tokens": 35293691.0,
|
|
"step": 20340
|
|
},
|
|
{
|
|
"entropy": 5.427465391159058,
|
|
"epoch": 1.5829216105815989,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.00047493006314379573,
|
|
"loss": 5.1423,
|
|
"mean_token_accuracy": 0.18757483810186387,
|
|
"num_tokens": 35302751.0,
|
|
"step": 20345
|
|
},
|
|
{
|
|
"entropy": 5.494105577468872,
|
|
"epoch": 1.5833106399533166,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.00047491734778173976,
|
|
"loss": 5.2123,
|
|
"mean_token_accuracy": 0.17558159977197646,
|
|
"num_tokens": 35311849.0,
|
|
"step": 20350
|
|
},
|
|
{
|
|
"entropy": 5.402540111541748,
|
|
"epoch": 1.583699669325034,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 0.00047490462938625617,
|
|
"loss": 5.1598,
|
|
"mean_token_accuracy": 0.18622606098651887,
|
|
"num_tokens": 35320248.0,
|
|
"step": 20355
|
|
},
|
|
{
|
|
"entropy": 5.487895250320435,
|
|
"epoch": 1.5840886986967515,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00047489190795753806,
|
|
"loss": 5.1401,
|
|
"mean_token_accuracy": 0.1911189526319504,
|
|
"num_tokens": 35328565.0,
|
|
"step": 20360
|
|
},
|
|
{
|
|
"entropy": 5.429814243316651,
|
|
"epoch": 1.5844777280684692,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.0004748791834957784,
|
|
"loss": 5.1606,
|
|
"mean_token_accuracy": 0.1863364428281784,
|
|
"num_tokens": 35337828.0,
|
|
"step": 20365
|
|
},
|
|
{
|
|
"entropy": 5.470037126541138,
|
|
"epoch": 1.5848667574401867,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.00047486645600117037,
|
|
"loss": 5.2448,
|
|
"mean_token_accuracy": 0.1784466713666916,
|
|
"num_tokens": 35347107.0,
|
|
"step": 20370
|
|
},
|
|
{
|
|
"entropy": 5.512237119674682,
|
|
"epoch": 1.5852557868119042,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.0004748537254739068,
|
|
"loss": 5.179,
|
|
"mean_token_accuracy": 0.18304122388362884,
|
|
"num_tokens": 35355925.0,
|
|
"step": 20375
|
|
},
|
|
{
|
|
"entropy": 5.44460506439209,
|
|
"epoch": 1.5856448161836219,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.0004748409919141812,
|
|
"loss": 5.1413,
|
|
"mean_token_accuracy": 0.18456193506717683,
|
|
"num_tokens": 35364319.0,
|
|
"step": 20380
|
|
},
|
|
{
|
|
"entropy": 5.4104071140289305,
|
|
"epoch": 1.5860338455553395,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0004748282553221865,
|
|
"loss": 5.1015,
|
|
"mean_token_accuracy": 0.1901659831404686,
|
|
"num_tokens": 35372358.0,
|
|
"step": 20385
|
|
},
|
|
{
|
|
"entropy": 5.497802495956421,
|
|
"epoch": 1.586422874927057,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.0004748155156981162,
|
|
"loss": 5.3238,
|
|
"mean_token_accuracy": 0.168743734061718,
|
|
"num_tokens": 35381301.0,
|
|
"step": 20390
|
|
},
|
|
{
|
|
"entropy": 5.4645380020141605,
|
|
"epoch": 1.5868119042987745,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.00047480277304216346,
|
|
"loss": 5.1385,
|
|
"mean_token_accuracy": 0.1789548933506012,
|
|
"num_tokens": 35389778.0,
|
|
"step": 20395
|
|
},
|
|
{
|
|
"entropy": 5.408751773834228,
|
|
"epoch": 1.5872009336704922,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.00047479002735452164,
|
|
"loss": 5.1073,
|
|
"mean_token_accuracy": 0.18414198011159896,
|
|
"num_tokens": 35397926.0,
|
|
"step": 20400
|
|
},
|
|
{
|
|
"entropy": 5.4239739894866945,
|
|
"epoch": 1.5875899630422097,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.00047477727863538415,
|
|
"loss": 5.149,
|
|
"mean_token_accuracy": 0.18654552549123765,
|
|
"num_tokens": 35406462.0,
|
|
"step": 20405
|
|
},
|
|
{
|
|
"entropy": 5.495453214645385,
|
|
"epoch": 1.5879789924139271,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.00047476452688494444,
|
|
"loss": 5.1577,
|
|
"mean_token_accuracy": 0.18202903121709824,
|
|
"num_tokens": 35414989.0,
|
|
"step": 20410
|
|
},
|
|
{
|
|
"entropy": 5.457301902770996,
|
|
"epoch": 1.5883680217856448,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.000474751772103396,
|
|
"loss": 5.1523,
|
|
"mean_token_accuracy": 0.1885913297533989,
|
|
"num_tokens": 35423738.0,
|
|
"step": 20415
|
|
},
|
|
{
|
|
"entropy": 5.492164659500122,
|
|
"epoch": 1.5887570511573625,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0004747390142909323,
|
|
"loss": 5.2033,
|
|
"mean_token_accuracy": 0.17635703086853027,
|
|
"num_tokens": 35432377.0,
|
|
"step": 20420
|
|
},
|
|
{
|
|
"entropy": 5.41399245262146,
|
|
"epoch": 1.5891460805290798,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.00047472625344774713,
|
|
"loss": 5.1752,
|
|
"mean_token_accuracy": 0.18544546365737916,
|
|
"num_tokens": 35441188.0,
|
|
"step": 20425
|
|
},
|
|
{
|
|
"entropy": 5.438808822631836,
|
|
"epoch": 1.5895351099007975,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 0.00047471348957403374,
|
|
"loss": 5.2557,
|
|
"mean_token_accuracy": 0.17948213666677476,
|
|
"num_tokens": 35449715.0,
|
|
"step": 20430
|
|
},
|
|
{
|
|
"entropy": 5.454863548278809,
|
|
"epoch": 1.5899241392725152,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.0004747007226699862,
|
|
"loss": 5.1931,
|
|
"mean_token_accuracy": 0.1849524959921837,
|
|
"num_tokens": 35458420.0,
|
|
"step": 20435
|
|
},
|
|
{
|
|
"entropy": 5.465144348144531,
|
|
"epoch": 1.5903131686442327,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 0.00047468795273579803,
|
|
"loss": 5.1006,
|
|
"mean_token_accuracy": 0.19094710052013397,
|
|
"num_tokens": 35467072.0,
|
|
"step": 20440
|
|
},
|
|
{
|
|
"entropy": 5.471920299530029,
|
|
"epoch": 1.5907021980159501,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0004746751797716629,
|
|
"loss": 5.1772,
|
|
"mean_token_accuracy": 0.18365492522716523,
|
|
"num_tokens": 35475539.0,
|
|
"step": 20445
|
|
},
|
|
{
|
|
"entropy": 5.495706987380982,
|
|
"epoch": 1.5910912273876678,
|
|
"grad_norm": 1.53125,
|
|
"learning_rate": 0.0004746624037777748,
|
|
"loss": 5.1997,
|
|
"mean_token_accuracy": 0.18149741888046264,
|
|
"num_tokens": 35484260.0,
|
|
"step": 20450
|
|
},
|
|
{
|
|
"entropy": 5.415353107452392,
|
|
"epoch": 1.5914802567593853,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.00047464962475432754,
|
|
"loss": 5.1159,
|
|
"mean_token_accuracy": 0.18603166788816453,
|
|
"num_tokens": 35492539.0,
|
|
"step": 20455
|
|
},
|
|
{
|
|
"entropy": 5.497933721542358,
|
|
"epoch": 1.5918692861311028,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.000474636842701515,
|
|
"loss": 5.2893,
|
|
"mean_token_accuracy": 0.17149089574813842,
|
|
"num_tokens": 35502008.0,
|
|
"step": 20460
|
|
},
|
|
{
|
|
"entropy": 5.465149354934693,
|
|
"epoch": 1.5922583155028205,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.0004746240576195311,
|
|
"loss": 5.1233,
|
|
"mean_token_accuracy": 0.1890583336353302,
|
|
"num_tokens": 35510677.0,
|
|
"step": 20465
|
|
},
|
|
{
|
|
"entropy": 5.435738182067871,
|
|
"epoch": 1.5926473448745382,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 0.00047461126950856987,
|
|
"loss": 5.1708,
|
|
"mean_token_accuracy": 0.18259909898042678,
|
|
"num_tokens": 35519368.0,
|
|
"step": 20470
|
|
},
|
|
{
|
|
"entropy": 5.5418288230896,
|
|
"epoch": 1.5930363742462554,
|
|
"grad_norm": 1.5390625,
|
|
"learning_rate": 0.0004745984783688253,
|
|
"loss": 5.3106,
|
|
"mean_token_accuracy": 0.1746356949210167,
|
|
"num_tokens": 35527952.0,
|
|
"step": 20475
|
|
},
|
|
{
|
|
"entropy": 5.5789844512939455,
|
|
"epoch": 1.5934254036179731,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.00047458568420049153,
|
|
"loss": 5.2345,
|
|
"mean_token_accuracy": 0.1773173391819,
|
|
"num_tokens": 35537806.0,
|
|
"step": 20480
|
|
},
|
|
{
|
|
"entropy": 5.429643726348877,
|
|
"epoch": 1.5938144329896908,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.00047457288700376274,
|
|
"loss": 5.0493,
|
|
"mean_token_accuracy": 0.1828259587287903,
|
|
"num_tokens": 35546135.0,
|
|
"step": 20485
|
|
},
|
|
{
|
|
"entropy": 5.332148456573487,
|
|
"epoch": 1.5942034623614083,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.00047456008677883304,
|
|
"loss": 5.151,
|
|
"mean_token_accuracy": 0.18037886321544647,
|
|
"num_tokens": 35555065.0,
|
|
"step": 20490
|
|
},
|
|
{
|
|
"entropy": 5.447528123855591,
|
|
"epoch": 1.5945924917331258,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.0004745472835258966,
|
|
"loss": 5.2539,
|
|
"mean_token_accuracy": 0.17747115939855576,
|
|
"num_tokens": 35564222.0,
|
|
"step": 20495
|
|
},
|
|
{
|
|
"entropy": 5.530115222930908,
|
|
"epoch": 1.5949815211048435,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.00047453447724514773,
|
|
"loss": 5.2131,
|
|
"mean_token_accuracy": 0.1767485111951828,
|
|
"num_tokens": 35573021.0,
|
|
"step": 20500
|
|
},
|
|
{
|
|
"entropy": 5.499778366088867,
|
|
"epoch": 1.595370550476561,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.0004745216679367808,
|
|
"loss": 5.2654,
|
|
"mean_token_accuracy": 0.17927251011133194,
|
|
"num_tokens": 35581105.0,
|
|
"step": 20505
|
|
},
|
|
{
|
|
"entropy": 5.534879398345947,
|
|
"epoch": 1.5957595798482784,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0004745088556009901,
|
|
"loss": 5.2848,
|
|
"mean_token_accuracy": 0.17313258796930314,
|
|
"num_tokens": 35590169.0,
|
|
"step": 20510
|
|
},
|
|
{
|
|
"entropy": 5.509119081497192,
|
|
"epoch": 1.5961486092199961,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.0004744960402379701,
|
|
"loss": 5.1735,
|
|
"mean_token_accuracy": 0.19020876437425613,
|
|
"num_tokens": 35598760.0,
|
|
"step": 20515
|
|
},
|
|
{
|
|
"entropy": 5.531984186172485,
|
|
"epoch": 1.5965376385917138,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.00047448322184791525,
|
|
"loss": 5.2018,
|
|
"mean_token_accuracy": 0.18199270069599152,
|
|
"num_tokens": 35607014.0,
|
|
"step": 20520
|
|
},
|
|
{
|
|
"entropy": 5.511300802230835,
|
|
"epoch": 1.596926667963431,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00047447040043101994,
|
|
"loss": 5.213,
|
|
"mean_token_accuracy": 0.17538028508424758,
|
|
"num_tokens": 35615319.0,
|
|
"step": 20525
|
|
},
|
|
{
|
|
"entropy": 5.4404603958129885,
|
|
"epoch": 1.5973156973351488,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.00047445757598747886,
|
|
"loss": 5.215,
|
|
"mean_token_accuracy": 0.18172764033079147,
|
|
"num_tokens": 35623836.0,
|
|
"step": 20530
|
|
},
|
|
{
|
|
"entropy": 5.421029853820801,
|
|
"epoch": 1.5977047267068665,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0004744447485174864,
|
|
"loss": 5.0859,
|
|
"mean_token_accuracy": 0.18272554874420166,
|
|
"num_tokens": 35632601.0,
|
|
"step": 20535
|
|
},
|
|
{
|
|
"entropy": 5.571485471725464,
|
|
"epoch": 1.598093756078584,
|
|
"grad_norm": 1.7578125,
|
|
"learning_rate": 0.00047443191802123746,
|
|
"loss": 5.291,
|
|
"mean_token_accuracy": 0.17192058265209198,
|
|
"num_tokens": 35642035.0,
|
|
"step": 20540
|
|
},
|
|
{
|
|
"entropy": 5.481582975387573,
|
|
"epoch": 1.5984827854503014,
|
|
"grad_norm": 2.03125,
|
|
"learning_rate": 0.00047441908449892664,
|
|
"loss": 5.1718,
|
|
"mean_token_accuracy": 0.1844406709074974,
|
|
"num_tokens": 35650454.0,
|
|
"step": 20545
|
|
},
|
|
{
|
|
"entropy": 5.499776601791382,
|
|
"epoch": 1.5988718148220191,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.00047440624795074855,
|
|
"loss": 5.2438,
|
|
"mean_token_accuracy": 0.18200285136699676,
|
|
"num_tokens": 35658945.0,
|
|
"step": 20550
|
|
},
|
|
{
|
|
"entropy": 5.4507087707519535,
|
|
"epoch": 1.5992608441937366,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.00047439340837689804,
|
|
"loss": 5.2161,
|
|
"mean_token_accuracy": 0.18007699772715569,
|
|
"num_tokens": 35667193.0,
|
|
"step": 20555
|
|
},
|
|
{
|
|
"entropy": 5.406033706665039,
|
|
"epoch": 1.599649873565454,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.00047438056577756986,
|
|
"loss": 5.0829,
|
|
"mean_token_accuracy": 0.1861460790038109,
|
|
"num_tokens": 35676100.0,
|
|
"step": 20560
|
|
},
|
|
{
|
|
"entropy": 5.486457681655883,
|
|
"epoch": 1.6000389029371718,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.00047436772015295903,
|
|
"loss": 5.1941,
|
|
"mean_token_accuracy": 0.17660576105117798,
|
|
"num_tokens": 35684352.0,
|
|
"step": 20565
|
|
},
|
|
{
|
|
"entropy": 5.492393493652344,
|
|
"epoch": 1.6004279323088895,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.00047435487150326036,
|
|
"loss": 5.1623,
|
|
"mean_token_accuracy": 0.18603489249944688,
|
|
"num_tokens": 35693044.0,
|
|
"step": 20570
|
|
},
|
|
{
|
|
"entropy": 5.397309875488281,
|
|
"epoch": 1.6008169616806067,
|
|
"grad_norm": 1.5234375,
|
|
"learning_rate": 0.0004743420198286688,
|
|
"loss": 5.1314,
|
|
"mean_token_accuracy": 0.19199467450380325,
|
|
"num_tokens": 35701172.0,
|
|
"step": 20575
|
|
},
|
|
{
|
|
"entropy": 5.503251695632935,
|
|
"epoch": 1.6012059910523244,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.00047432916512937936,
|
|
"loss": 5.2305,
|
|
"mean_token_accuracy": 0.1765425756573677,
|
|
"num_tokens": 35709905.0,
|
|
"step": 20580
|
|
},
|
|
{
|
|
"entropy": 5.477742338180542,
|
|
"epoch": 1.6015950204240421,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.0004743163074055871,
|
|
"loss": 5.2006,
|
|
"mean_token_accuracy": 0.17887855619192122,
|
|
"num_tokens": 35718404.0,
|
|
"step": 20585
|
|
},
|
|
{
|
|
"entropy": 5.5118170261383055,
|
|
"epoch": 1.6019840497957596,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.0004743034466574871,
|
|
"loss": 5.2077,
|
|
"mean_token_accuracy": 0.18155071884393692,
|
|
"num_tokens": 35726475.0,
|
|
"step": 20590
|
|
},
|
|
{
|
|
"entropy": 5.483558225631714,
|
|
"epoch": 1.602373079167477,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0004742905828852746,
|
|
"loss": 5.2375,
|
|
"mean_token_accuracy": 0.17774428129196168,
|
|
"num_tokens": 35734819.0,
|
|
"step": 20595
|
|
},
|
|
{
|
|
"entropy": 5.391334199905396,
|
|
"epoch": 1.6027621085391948,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0004742777160891447,
|
|
"loss": 5.1184,
|
|
"mean_token_accuracy": 0.180104860663414,
|
|
"num_tokens": 35743098.0,
|
|
"step": 20600
|
|
},
|
|
{
|
|
"entropy": 5.4968794822692875,
|
|
"epoch": 1.6031511379109122,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0004742648462692926,
|
|
"loss": 5.2376,
|
|
"mean_token_accuracy": 0.18164463490247726,
|
|
"num_tokens": 35752502.0,
|
|
"step": 20605
|
|
},
|
|
{
|
|
"entropy": 5.520245361328125,
|
|
"epoch": 1.6035401672826297,
|
|
"grad_norm": 1.8828125,
|
|
"learning_rate": 0.00047425197342591363,
|
|
"loss": 5.1637,
|
|
"mean_token_accuracy": 0.1903032824397087,
|
|
"num_tokens": 35761293.0,
|
|
"step": 20610
|
|
},
|
|
{
|
|
"entropy": 5.521714305877685,
|
|
"epoch": 1.6039291966543474,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.0004742390975592031,
|
|
"loss": 5.2884,
|
|
"mean_token_accuracy": 0.16920629143714905,
|
|
"num_tokens": 35771031.0,
|
|
"step": 20615
|
|
},
|
|
{
|
|
"entropy": 5.53647780418396,
|
|
"epoch": 1.604318226026065,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 0.00047422621866935645,
|
|
"loss": 5.1769,
|
|
"mean_token_accuracy": 0.18148970007896423,
|
|
"num_tokens": 35778894.0,
|
|
"step": 20620
|
|
},
|
|
{
|
|
"entropy": 5.540125179290771,
|
|
"epoch": 1.6047072553977826,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.000474213336756569,
|
|
"loss": 5.2409,
|
|
"mean_token_accuracy": 0.17824349105358123,
|
|
"num_tokens": 35787159.0,
|
|
"step": 20625
|
|
},
|
|
{
|
|
"entropy": 5.441607427597046,
|
|
"epoch": 1.6050962847695,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0004742004518210362,
|
|
"loss": 5.1748,
|
|
"mean_token_accuracy": 0.18812182545661926,
|
|
"num_tokens": 35795858.0,
|
|
"step": 20630
|
|
},
|
|
{
|
|
"entropy": 5.442809057235718,
|
|
"epoch": 1.6054853141412178,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.0004741875638629536,
|
|
"loss": 5.1681,
|
|
"mean_token_accuracy": 0.18200849890708923,
|
|
"num_tokens": 35804754.0,
|
|
"step": 20635
|
|
},
|
|
{
|
|
"entropy": 5.4924053192138675,
|
|
"epoch": 1.6058743435129352,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0004741746728825168,
|
|
"loss": 5.2749,
|
|
"mean_token_accuracy": 0.17502398937940597,
|
|
"num_tokens": 35813622.0,
|
|
"step": 20640
|
|
},
|
|
{
|
|
"entropy": 5.4498106956481935,
|
|
"epoch": 1.6062633728846527,
|
|
"grad_norm": 1.5,
|
|
"learning_rate": 0.0004741617788799213,
|
|
"loss": 5.1468,
|
|
"mean_token_accuracy": 0.18627086132764817,
|
|
"num_tokens": 35821345.0,
|
|
"step": 20645
|
|
},
|
|
{
|
|
"entropy": 5.447965860366821,
|
|
"epoch": 1.6066524022563704,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 0.00047414888185536285,
|
|
"loss": 5.1908,
|
|
"mean_token_accuracy": 0.18537099063396453,
|
|
"num_tokens": 35830058.0,
|
|
"step": 20650
|
|
},
|
|
{
|
|
"entropy": 5.514035367965699,
|
|
"epoch": 1.6070414316280879,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0004741359818090371,
|
|
"loss": 5.2133,
|
|
"mean_token_accuracy": 0.18435004502534866,
|
|
"num_tokens": 35838951.0,
|
|
"step": 20655
|
|
},
|
|
{
|
|
"entropy": 5.478178548812866,
|
|
"epoch": 1.6074304609998054,
|
|
"grad_norm": 1.6640625,
|
|
"learning_rate": 0.00047412307874113976,
|
|
"loss": 5.17,
|
|
"mean_token_accuracy": 0.18680742681026458,
|
|
"num_tokens": 35847245.0,
|
|
"step": 20660
|
|
},
|
|
{
|
|
"entropy": 5.526635360717774,
|
|
"epoch": 1.607819490371523,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0004741101726518667,
|
|
"loss": 5.2741,
|
|
"mean_token_accuracy": 0.1773046910762787,
|
|
"num_tokens": 35856037.0,
|
|
"step": 20665
|
|
},
|
|
{
|
|
"entropy": 5.47281322479248,
|
|
"epoch": 1.6082085197432407,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0004740972635414136,
|
|
"loss": 5.1179,
|
|
"mean_token_accuracy": 0.18888673335313796,
|
|
"num_tokens": 35864881.0,
|
|
"step": 20670
|
|
},
|
|
{
|
|
"entropy": 5.544754266738892,
|
|
"epoch": 1.6085975491149582,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 0.0004740843514099765,
|
|
"loss": 5.2439,
|
|
"mean_token_accuracy": 0.17636827975511551,
|
|
"num_tokens": 35872941.0,
|
|
"step": 20675
|
|
},
|
|
{
|
|
"entropy": 5.4163319110870365,
|
|
"epoch": 1.6089865784866757,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0004740714362577512,
|
|
"loss": 5.1935,
|
|
"mean_token_accuracy": 0.17455083280801773,
|
|
"num_tokens": 35882068.0,
|
|
"step": 20680
|
|
},
|
|
{
|
|
"entropy": 5.47118444442749,
|
|
"epoch": 1.6093756078583934,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.00047405851808493364,
|
|
"loss": 5.1476,
|
|
"mean_token_accuracy": 0.17911248207092284,
|
|
"num_tokens": 35890306.0,
|
|
"step": 20685
|
|
},
|
|
{
|
|
"entropy": 5.483102607727051,
|
|
"epoch": 1.6097646372301109,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.00047404559689172006,
|
|
"loss": 5.1973,
|
|
"mean_token_accuracy": 0.19302754998207092,
|
|
"num_tokens": 35899311.0,
|
|
"step": 20690
|
|
},
|
|
{
|
|
"entropy": 5.5089061737060545,
|
|
"epoch": 1.6101536666018283,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00047403267267830617,
|
|
"loss": 5.2473,
|
|
"mean_token_accuracy": 0.174527083337307,
|
|
"num_tokens": 35908599.0,
|
|
"step": 20695
|
|
},
|
|
{
|
|
"entropy": 5.539671182632446,
|
|
"epoch": 1.610542695973546,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.00047401974544488844,
|
|
"loss": 5.2188,
|
|
"mean_token_accuracy": 0.17592242062091829,
|
|
"num_tokens": 35917318.0,
|
|
"step": 20700
|
|
},
|
|
{
|
|
"entropy": 5.481278562545777,
|
|
"epoch": 1.6109317253452635,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0004740068151916628,
|
|
"loss": 5.1904,
|
|
"mean_token_accuracy": 0.18462580144405366,
|
|
"num_tokens": 35926179.0,
|
|
"step": 20705
|
|
},
|
|
{
|
|
"entropy": 5.376132249832153,
|
|
"epoch": 1.611320754716981,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0004739938819188255,
|
|
"loss": 5.0441,
|
|
"mean_token_accuracy": 0.19148256480693818,
|
|
"num_tokens": 35934155.0,
|
|
"step": 20710
|
|
},
|
|
{
|
|
"entropy": 5.391366338729858,
|
|
"epoch": 1.6117097840886987,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.0004739809456265727,
|
|
"loss": 5.1208,
|
|
"mean_token_accuracy": 0.18791704177856444,
|
|
"num_tokens": 35942301.0,
|
|
"step": 20715
|
|
},
|
|
{
|
|
"entropy": 5.401929092407227,
|
|
"epoch": 1.6120988134604164,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0004739680063151008,
|
|
"loss": 5.1109,
|
|
"mean_token_accuracy": 0.18798888921737672,
|
|
"num_tokens": 35951005.0,
|
|
"step": 20720
|
|
},
|
|
{
|
|
"entropy": 5.482685375213623,
|
|
"epoch": 1.6124878428321339,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0004739550639846061,
|
|
"loss": 5.2181,
|
|
"mean_token_accuracy": 0.18445932269096374,
|
|
"num_tokens": 35959425.0,
|
|
"step": 20725
|
|
},
|
|
{
|
|
"entropy": 5.464898204803466,
|
|
"epoch": 1.6128768722038513,
|
|
"grad_norm": 1.578125,
|
|
"learning_rate": 0.00047394211863528496,
|
|
"loss": 5.1692,
|
|
"mean_token_accuracy": 0.182822348177433,
|
|
"num_tokens": 35967803.0,
|
|
"step": 20730
|
|
},
|
|
{
|
|
"entropy": 5.409885406494141,
|
|
"epoch": 1.613265901575569,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.0004739291702673338,
|
|
"loss": 5.291,
|
|
"mean_token_accuracy": 0.17299067974090576,
|
|
"num_tokens": 35977313.0,
|
|
"step": 20735
|
|
},
|
|
{
|
|
"entropy": 5.588252353668213,
|
|
"epoch": 1.6136549309472865,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0004739162188809492,
|
|
"loss": 5.2555,
|
|
"mean_token_accuracy": 0.17984988540410995,
|
|
"num_tokens": 35986404.0,
|
|
"step": 20740
|
|
},
|
|
{
|
|
"entropy": 5.515131282806396,
|
|
"epoch": 1.614043960319004,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00047390326447632747,
|
|
"loss": 5.2485,
|
|
"mean_token_accuracy": 0.1791035994887352,
|
|
"num_tokens": 35995865.0,
|
|
"step": 20745
|
|
},
|
|
{
|
|
"entropy": 5.43668646812439,
|
|
"epoch": 1.6144329896907217,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0004738903070536654,
|
|
"loss": 5.121,
|
|
"mean_token_accuracy": 0.18234838992357255,
|
|
"num_tokens": 36005098.0,
|
|
"step": 20750
|
|
},
|
|
{
|
|
"entropy": 5.410497236251831,
|
|
"epoch": 1.6148220190624392,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0004738773466131594,
|
|
"loss": 5.151,
|
|
"mean_token_accuracy": 0.18768104761838914,
|
|
"num_tokens": 36013642.0,
|
|
"step": 20755
|
|
},
|
|
{
|
|
"entropy": 5.505680561065674,
|
|
"epoch": 1.6152110484341566,
|
|
"grad_norm": 1.5,
|
|
"learning_rate": 0.0004738643831550063,
|
|
"loss": 5.2962,
|
|
"mean_token_accuracy": 0.17138197422027587,
|
|
"num_tokens": 36022565.0,
|
|
"step": 20760
|
|
},
|
|
{
|
|
"entropy": 5.511611366271973,
|
|
"epoch": 1.6156000778058743,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.0004738514166794026,
|
|
"loss": 5.2466,
|
|
"mean_token_accuracy": 0.17470160275697708,
|
|
"num_tokens": 36031406.0,
|
|
"step": 20765
|
|
},
|
|
{
|
|
"entropy": 5.53081169128418,
|
|
"epoch": 1.615989107177592,
|
|
"grad_norm": 1.546875,
|
|
"learning_rate": 0.00047383844718654525,
|
|
"loss": 5.2339,
|
|
"mean_token_accuracy": 0.1813293993473053,
|
|
"num_tokens": 36040282.0,
|
|
"step": 20770
|
|
},
|
|
{
|
|
"entropy": 5.560623025894165,
|
|
"epoch": 1.6163781365493095,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.0004738254746766309,
|
|
"loss": 5.3193,
|
|
"mean_token_accuracy": 0.18225802034139632,
|
|
"num_tokens": 36049647.0,
|
|
"step": 20775
|
|
},
|
|
{
|
|
"entropy": 5.400055265426635,
|
|
"epoch": 1.616767165921027,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.0004738124991498565,
|
|
"loss": 5.1183,
|
|
"mean_token_accuracy": 0.18474107682704927,
|
|
"num_tokens": 36057992.0,
|
|
"step": 20780
|
|
},
|
|
{
|
|
"entropy": 5.4260776996612545,
|
|
"epoch": 1.6171561952927447,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 0.00047379952060641866,
|
|
"loss": 5.16,
|
|
"mean_token_accuracy": 0.18336678445339202,
|
|
"num_tokens": 36066145.0,
|
|
"step": 20785
|
|
},
|
|
{
|
|
"entropy": 5.446443176269531,
|
|
"epoch": 1.6175452246644622,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.00047378653904651475,
|
|
"loss": 5.1684,
|
|
"mean_token_accuracy": 0.18403954952955245,
|
|
"num_tokens": 36074596.0,
|
|
"step": 20790
|
|
},
|
|
{
|
|
"entropy": 5.507423734664917,
|
|
"epoch": 1.6179342540361796,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.00047377355447034136,
|
|
"loss": 5.092,
|
|
"mean_token_accuracy": 0.19746127277612685,
|
|
"num_tokens": 36083499.0,
|
|
"step": 20795
|
|
},
|
|
{
|
|
"entropy": 5.468140554428101,
|
|
"epoch": 1.6183232834078973,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0004737605668780958,
|
|
"loss": 5.2178,
|
|
"mean_token_accuracy": 0.17951821982860566,
|
|
"num_tokens": 36092293.0,
|
|
"step": 20800
|
|
},
|
|
{
|
|
"entropy": 5.420831823348999,
|
|
"epoch": 1.618712312779615,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.00047374757626997494,
|
|
"loss": 5.1733,
|
|
"mean_token_accuracy": 0.17748800069093704,
|
|
"num_tokens": 36100926.0,
|
|
"step": 20805
|
|
},
|
|
{
|
|
"entropy": 5.5344829082489015,
|
|
"epoch": 1.6191013421513323,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0004737345826461759,
|
|
"loss": 5.2349,
|
|
"mean_token_accuracy": 0.18200028836727142,
|
|
"num_tokens": 36109831.0,
|
|
"step": 20810
|
|
},
|
|
{
|
|
"entropy": 5.553755521774292,
|
|
"epoch": 1.61949037152305,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004737215860068959,
|
|
"loss": 5.3114,
|
|
"mean_token_accuracy": 0.1768397346138954,
|
|
"num_tokens": 36118759.0,
|
|
"step": 20815
|
|
},
|
|
{
|
|
"entropy": 5.5058125972747805,
|
|
"epoch": 1.6198794008947677,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.00047370858635233223,
|
|
"loss": 5.3182,
|
|
"mean_token_accuracy": 0.1724585473537445,
|
|
"num_tokens": 36127854.0,
|
|
"step": 20820
|
|
},
|
|
{
|
|
"entropy": 5.501207637786865,
|
|
"epoch": 1.6202684302664851,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00047369558368268194,
|
|
"loss": 5.2312,
|
|
"mean_token_accuracy": 0.17959168702363967,
|
|
"num_tokens": 36137686.0,
|
|
"step": 20825
|
|
},
|
|
{
|
|
"entropy": 5.543732213973999,
|
|
"epoch": 1.6206574596382026,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0004736825779981424,
|
|
"loss": 5.2174,
|
|
"mean_token_accuracy": 0.17839380949735642,
|
|
"num_tokens": 36146352.0,
|
|
"step": 20830
|
|
},
|
|
{
|
|
"entropy": 5.454100275039673,
|
|
"epoch": 1.6210464890099203,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0004736695692989111,
|
|
"loss": 5.1619,
|
|
"mean_token_accuracy": 0.18554824590682983,
|
|
"num_tokens": 36156106.0,
|
|
"step": 20835
|
|
},
|
|
{
|
|
"entropy": 5.392924976348877,
|
|
"epoch": 1.6214355183816378,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0004736565575851852,
|
|
"loss": 5.0311,
|
|
"mean_token_accuracy": 0.18951328992843627,
|
|
"num_tokens": 36164169.0,
|
|
"step": 20840
|
|
},
|
|
{
|
|
"entropy": 5.472887277603149,
|
|
"epoch": 1.6218245477533553,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.0004736435428571622,
|
|
"loss": 5.2234,
|
|
"mean_token_accuracy": 0.17599323242902756,
|
|
"num_tokens": 36173368.0,
|
|
"step": 20845
|
|
},
|
|
{
|
|
"entropy": 5.508453512191773,
|
|
"epoch": 1.622213577125073,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.0004736305251150397,
|
|
"loss": 5.2018,
|
|
"mean_token_accuracy": 0.18134894520044326,
|
|
"num_tokens": 36182405.0,
|
|
"step": 20850
|
|
},
|
|
{
|
|
"entropy": 5.516885614395141,
|
|
"epoch": 1.6226026064967907,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0004736175043590151,
|
|
"loss": 5.2442,
|
|
"mean_token_accuracy": 0.1803520515561104,
|
|
"num_tokens": 36191683.0,
|
|
"step": 20855
|
|
},
|
|
{
|
|
"entropy": 5.483318424224853,
|
|
"epoch": 1.622991635868508,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.000473604480589286,
|
|
"loss": 5.101,
|
|
"mean_token_accuracy": 0.18624744117259978,
|
|
"num_tokens": 36200173.0,
|
|
"step": 20860
|
|
},
|
|
{
|
|
"entropy": 5.346344661712647,
|
|
"epoch": 1.6233806652402256,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.00047359145380605007,
|
|
"loss": 5.1483,
|
|
"mean_token_accuracy": 0.18465072214603423,
|
|
"num_tokens": 36209057.0,
|
|
"step": 20865
|
|
},
|
|
{
|
|
"entropy": 5.431147336959839,
|
|
"epoch": 1.6237696946119433,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0004735784240095049,
|
|
"loss": 5.1758,
|
|
"mean_token_accuracy": 0.18200361281633376,
|
|
"num_tokens": 36217645.0,
|
|
"step": 20870
|
|
},
|
|
{
|
|
"entropy": 5.568696355819702,
|
|
"epoch": 1.6241587239836608,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.00047356539119984813,
|
|
"loss": 5.2484,
|
|
"mean_token_accuracy": 0.1758081555366516,
|
|
"num_tokens": 36226282.0,
|
|
"step": 20875
|
|
},
|
|
{
|
|
"entropy": 5.49404559135437,
|
|
"epoch": 1.6245477533553783,
|
|
"grad_norm": 1.4921875,
|
|
"learning_rate": 0.0004735523553772777,
|
|
"loss": 5.2327,
|
|
"mean_token_accuracy": 0.18078527748584747,
|
|
"num_tokens": 36235322.0,
|
|
"step": 20880
|
|
},
|
|
{
|
|
"entropy": 5.448576736450195,
|
|
"epoch": 1.624936782727096,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0004735393165419912,
|
|
"loss": 5.1726,
|
|
"mean_token_accuracy": 0.18625034689903258,
|
|
"num_tokens": 36244212.0,
|
|
"step": 20885
|
|
},
|
|
{
|
|
"entropy": 5.427348279953003,
|
|
"epoch": 1.6253258120988134,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.00047352627469418666,
|
|
"loss": 5.1475,
|
|
"mean_token_accuracy": 0.1872599869966507,
|
|
"num_tokens": 36252837.0,
|
|
"step": 20890
|
|
},
|
|
{
|
|
"entropy": 5.512896394729614,
|
|
"epoch": 1.625714841470531,
|
|
"grad_norm": 1.7890625,
|
|
"learning_rate": 0.0004735132298340619,
|
|
"loss": 5.2208,
|
|
"mean_token_accuracy": 0.17607235610485078,
|
|
"num_tokens": 36261492.0,
|
|
"step": 20895
|
|
},
|
|
{
|
|
"entropy": 5.5167747974395756,
|
|
"epoch": 1.6261038708422486,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0004735001819618148,
|
|
"loss": 5.183,
|
|
"mean_token_accuracy": 0.1804351508617401,
|
|
"num_tokens": 36270195.0,
|
|
"step": 20900
|
|
},
|
|
{
|
|
"entropy": 5.495071983337402,
|
|
"epoch": 1.6264929002139663,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.0004734871310776434,
|
|
"loss": 5.1222,
|
|
"mean_token_accuracy": 0.1921781688928604,
|
|
"num_tokens": 36278546.0,
|
|
"step": 20905
|
|
},
|
|
{
|
|
"entropy": 5.472602081298828,
|
|
"epoch": 1.6268819295856836,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.0004734740771817457,
|
|
"loss": 5.2686,
|
|
"mean_token_accuracy": 0.17154050171375274,
|
|
"num_tokens": 36287433.0,
|
|
"step": 20910
|
|
},
|
|
{
|
|
"entropy": 5.392034196853638,
|
|
"epoch": 1.6272709589574013,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0004734610202743198,
|
|
"loss": 5.1134,
|
|
"mean_token_accuracy": 0.17898679971694947,
|
|
"num_tokens": 36296213.0,
|
|
"step": 20915
|
|
},
|
|
{
|
|
"entropy": 5.4305887699127195,
|
|
"epoch": 1.627659988329119,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0004734479603555638,
|
|
"loss": 5.0751,
|
|
"mean_token_accuracy": 0.19643169939517974,
|
|
"num_tokens": 36303989.0,
|
|
"step": 20920
|
|
},
|
|
{
|
|
"entropy": 5.5976804256439205,
|
|
"epoch": 1.6280490177008364,
|
|
"grad_norm": 1.5390625,
|
|
"learning_rate": 0.00047343489742567593,
|
|
"loss": 5.3937,
|
|
"mean_token_accuracy": 0.16939037591218947,
|
|
"num_tokens": 36312939.0,
|
|
"step": 20925
|
|
},
|
|
{
|
|
"entropy": 5.53128752708435,
|
|
"epoch": 1.628438047072554,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.00047342183148485424,
|
|
"loss": 5.1514,
|
|
"mean_token_accuracy": 0.1816410943865776,
|
|
"num_tokens": 36322130.0,
|
|
"step": 20930
|
|
},
|
|
{
|
|
"entropy": 5.387099981307983,
|
|
"epoch": 1.6288270764442716,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.00047340876253329706,
|
|
"loss": 5.1133,
|
|
"mean_token_accuracy": 0.18367586880922318,
|
|
"num_tokens": 36330376.0,
|
|
"step": 20935
|
|
},
|
|
{
|
|
"entropy": 5.407538604736328,
|
|
"epoch": 1.629216105815989,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.00047339569057120275,
|
|
"loss": 5.1374,
|
|
"mean_token_accuracy": 0.18430205434560776,
|
|
"num_tokens": 36339614.0,
|
|
"step": 20940
|
|
},
|
|
{
|
|
"entropy": 5.5296672821044925,
|
|
"epoch": 1.6296051351877066,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00047338261559876966,
|
|
"loss": 5.2363,
|
|
"mean_token_accuracy": 0.17719132006168364,
|
|
"num_tokens": 36349561.0,
|
|
"step": 20945
|
|
},
|
|
{
|
|
"entropy": 5.57050051689148,
|
|
"epoch": 1.6299941645594243,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00047336953761619604,
|
|
"loss": 5.2877,
|
|
"mean_token_accuracy": 0.17643799632787704,
|
|
"num_tokens": 36358277.0,
|
|
"step": 20950
|
|
},
|
|
{
|
|
"entropy": 5.53431921005249,
|
|
"epoch": 1.630383193931142,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.00047335645662368046,
|
|
"loss": 5.2284,
|
|
"mean_token_accuracy": 0.1848193511366844,
|
|
"num_tokens": 36366736.0,
|
|
"step": 20955
|
|
},
|
|
{
|
|
"entropy": 5.482513475418091,
|
|
"epoch": 1.6307722233028592,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0004733433726214214,
|
|
"loss": 5.1828,
|
|
"mean_token_accuracy": 0.18691345453262329,
|
|
"num_tokens": 36374802.0,
|
|
"step": 20960
|
|
},
|
|
{
|
|
"entropy": 5.479587602615356,
|
|
"epoch": 1.631161252674577,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.00047333028560961733,
|
|
"loss": 5.251,
|
|
"mean_token_accuracy": 0.1780051827430725,
|
|
"num_tokens": 36384195.0,
|
|
"step": 20965
|
|
},
|
|
{
|
|
"entropy": 5.48459529876709,
|
|
"epoch": 1.6315502820462946,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.00047331719558846687,
|
|
"loss": 5.2197,
|
|
"mean_token_accuracy": 0.1756053775548935,
|
|
"num_tokens": 36393001.0,
|
|
"step": 20970
|
|
},
|
|
{
|
|
"entropy": 5.468611764907837,
|
|
"epoch": 1.631939311418012,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.00047330410255816863,
|
|
"loss": 5.1672,
|
|
"mean_token_accuracy": 0.17389518469572068,
|
|
"num_tokens": 36401674.0,
|
|
"step": 20975
|
|
},
|
|
{
|
|
"entropy": 5.443812894821167,
|
|
"epoch": 1.6323283407897295,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.00047329100651892123,
|
|
"loss": 5.1467,
|
|
"mean_token_accuracy": 0.19463392496109008,
|
|
"num_tokens": 36409817.0,
|
|
"step": 20980
|
|
},
|
|
{
|
|
"entropy": 5.4859498023986815,
|
|
"epoch": 1.6327173701614472,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0004732779074709234,
|
|
"loss": 5.0829,
|
|
"mean_token_accuracy": 0.18936517536640168,
|
|
"num_tokens": 36417541.0,
|
|
"step": 20985
|
|
},
|
|
{
|
|
"entropy": 5.432406616210938,
|
|
"epoch": 1.6331063995331647,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.000473264805414374,
|
|
"loss": 5.2222,
|
|
"mean_token_accuracy": 0.17607683837413787,
|
|
"num_tokens": 36426613.0,
|
|
"step": 20990
|
|
},
|
|
{
|
|
"entropy": 5.464840412139893,
|
|
"epoch": 1.6334954289048822,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00047325170034947167,
|
|
"loss": 5.2438,
|
|
"mean_token_accuracy": 0.17849491834640502,
|
|
"num_tokens": 36436052.0,
|
|
"step": 20995
|
|
},
|
|
{
|
|
"entropy": 5.497308540344238,
|
|
"epoch": 1.6338844582766,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.00047323859227641537,
|
|
"loss": 5.1218,
|
|
"mean_token_accuracy": 0.18366954177618028,
|
|
"num_tokens": 36444386.0,
|
|
"step": 21000
|
|
},
|
|
{
|
|
"epoch": 1.6338844582766,
|
|
"eval_entropy": 5.3745178121689765,
|
|
"eval_loss": 5.277838706970215,
|
|
"eval_mean_token_accuracy": 0.18617092999302504,
|
|
"eval_num_tokens": 36444386.0,
|
|
"eval_runtime": 28.5705,
|
|
"eval_samples_per_second": 1454.576,
|
|
"eval_steps_per_second": 181.831,
|
|
"step": 21000
|
|
},
|
|
{
|
|
"entropy": 5.528669738769532,
|
|
"epoch": 1.6342734876483176,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00047322548119540397,
|
|
"loss": 5.1759,
|
|
"mean_token_accuracy": 0.18001073598861694,
|
|
"num_tokens": 36452759.0,
|
|
"step": 21005
|
|
},
|
|
{
|
|
"entropy": 5.486782455444336,
|
|
"epoch": 1.634662517020035,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00047321236710663636,
|
|
"loss": 5.1319,
|
|
"mean_token_accuracy": 0.1882358357310295,
|
|
"num_tokens": 36460581.0,
|
|
"step": 21010
|
|
},
|
|
{
|
|
"entropy": 5.456148958206176,
|
|
"epoch": 1.6350515463917525,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.00047319925001031165,
|
|
"loss": 5.1734,
|
|
"mean_token_accuracy": 0.18629803210496904,
|
|
"num_tokens": 36468995.0,
|
|
"step": 21015
|
|
},
|
|
{
|
|
"entropy": 5.562962341308594,
|
|
"epoch": 1.6354405757634702,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0004731861299066287,
|
|
"loss": 5.2639,
|
|
"mean_token_accuracy": 0.18103989511728286,
|
|
"num_tokens": 36477901.0,
|
|
"step": 21020
|
|
},
|
|
{
|
|
"entropy": 5.468941497802734,
|
|
"epoch": 1.6358296051351877,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0004731730067957867,
|
|
"loss": 5.2361,
|
|
"mean_token_accuracy": 0.18166091293096542,
|
|
"num_tokens": 36486500.0,
|
|
"step": 21025
|
|
},
|
|
{
|
|
"entropy": 5.4481635093688965,
|
|
"epoch": 1.6362186345069052,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.00047315988067798476,
|
|
"loss": 5.1607,
|
|
"mean_token_accuracy": 0.18342582434415816,
|
|
"num_tokens": 36495247.0,
|
|
"step": 21030
|
|
},
|
|
{
|
|
"entropy": 5.481537675857544,
|
|
"epoch": 1.6366076638786229,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.000473146751553422,
|
|
"loss": 5.1267,
|
|
"mean_token_accuracy": 0.1927894026041031,
|
|
"num_tokens": 36503633.0,
|
|
"step": 21035
|
|
},
|
|
{
|
|
"entropy": 5.4976880073547365,
|
|
"epoch": 1.6369966932503404,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0004731336194222978,
|
|
"loss": 5.2199,
|
|
"mean_token_accuracy": 0.18330923467874527,
|
|
"num_tokens": 36512138.0,
|
|
"step": 21040
|
|
},
|
|
{
|
|
"entropy": 5.531950330734253,
|
|
"epoch": 1.6373857226220578,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.00047312048428481114,
|
|
"loss": 5.2083,
|
|
"mean_token_accuracy": 0.18679561614990234,
|
|
"num_tokens": 36521029.0,
|
|
"step": 21045
|
|
},
|
|
{
|
|
"entropy": 5.433400869369507,
|
|
"epoch": 1.6377747519937755,
|
|
"grad_norm": 1.6015625,
|
|
"learning_rate": 0.00047310734614116153,
|
|
"loss": 5.1203,
|
|
"mean_token_accuracy": 0.183465313911438,
|
|
"num_tokens": 36530658.0,
|
|
"step": 21050
|
|
},
|
|
{
|
|
"entropy": 5.424539995193482,
|
|
"epoch": 1.6381637813654932,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0004730942049915483,
|
|
"loss": 5.1118,
|
|
"mean_token_accuracy": 0.18296203762292862,
|
|
"num_tokens": 36539037.0,
|
|
"step": 21055
|
|
},
|
|
{
|
|
"entropy": 5.444966888427734,
|
|
"epoch": 1.6385528107372107,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0004730810608361707,
|
|
"loss": 5.1931,
|
|
"mean_token_accuracy": 0.18480487614870073,
|
|
"num_tokens": 36547863.0,
|
|
"step": 21060
|
|
},
|
|
{
|
|
"entropy": 5.512889719009399,
|
|
"epoch": 1.6389418401089282,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.00047306791367522833,
|
|
"loss": 5.2096,
|
|
"mean_token_accuracy": 0.18151307553052903,
|
|
"num_tokens": 36555896.0,
|
|
"step": 21065
|
|
},
|
|
{
|
|
"entropy": 5.4272222995758055,
|
|
"epoch": 1.6393308694806459,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0004730547635089206,
|
|
"loss": 5.1294,
|
|
"mean_token_accuracy": 0.1929125115275383,
|
|
"num_tokens": 36564088.0,
|
|
"step": 21070
|
|
},
|
|
{
|
|
"entropy": 5.4738341808319095,
|
|
"epoch": 1.6397198988523634,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.00047304161033744714,
|
|
"loss": 5.106,
|
|
"mean_token_accuracy": 0.18501498997211457,
|
|
"num_tokens": 36572490.0,
|
|
"step": 21075
|
|
},
|
|
{
|
|
"entropy": 5.49489459991455,
|
|
"epoch": 1.6401089282240808,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.0004730284541610075,
|
|
"loss": 5.1832,
|
|
"mean_token_accuracy": 0.17720876783132553,
|
|
"num_tokens": 36580834.0,
|
|
"step": 21080
|
|
},
|
|
{
|
|
"entropy": 5.401579427719116,
|
|
"epoch": 1.6404979575957985,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0004730152949798012,
|
|
"loss": 5.1608,
|
|
"mean_token_accuracy": 0.19064083993434905,
|
|
"num_tokens": 36589420.0,
|
|
"step": 21085
|
|
},
|
|
{
|
|
"entropy": 5.4306535720825195,
|
|
"epoch": 1.640886986967516,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.00047300213279402787,
|
|
"loss": 5.1772,
|
|
"mean_token_accuracy": 0.18251401484012603,
|
|
"num_tokens": 36598419.0,
|
|
"step": 21090
|
|
},
|
|
{
|
|
"entropy": 5.483335733413696,
|
|
"epoch": 1.6412760163392335,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.00047298896760388745,
|
|
"loss": 5.1956,
|
|
"mean_token_accuracy": 0.18290065973997116,
|
|
"num_tokens": 36607367.0,
|
|
"step": 21095
|
|
},
|
|
{
|
|
"entropy": 5.514923620223999,
|
|
"epoch": 1.6416650457109512,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0004729757994095796,
|
|
"loss": 5.2617,
|
|
"mean_token_accuracy": 0.17232670187950133,
|
|
"num_tokens": 36616197.0,
|
|
"step": 21100
|
|
},
|
|
{
|
|
"entropy": 5.508531856536865,
|
|
"epoch": 1.6420540750826689,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.00047296262821130405,
|
|
"loss": 5.301,
|
|
"mean_token_accuracy": 0.17552568316459655,
|
|
"num_tokens": 36625452.0,
|
|
"step": 21105
|
|
},
|
|
{
|
|
"entropy": 5.4955769062042235,
|
|
"epoch": 1.6424431044543863,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00047294945400926065,
|
|
"loss": 5.2249,
|
|
"mean_token_accuracy": 0.1770986795425415,
|
|
"num_tokens": 36634356.0,
|
|
"step": 21110
|
|
},
|
|
{
|
|
"entropy": 5.471290922164917,
|
|
"epoch": 1.6428321338261038,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0004729362768036494,
|
|
"loss": 5.2041,
|
|
"mean_token_accuracy": 0.17991159707307816,
|
|
"num_tokens": 36642548.0,
|
|
"step": 21115
|
|
},
|
|
{
|
|
"entropy": 5.422236108779908,
|
|
"epoch": 1.6432211631978215,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.00047292309659467024,
|
|
"loss": 5.0922,
|
|
"mean_token_accuracy": 0.19454638063907623,
|
|
"num_tokens": 36650548.0,
|
|
"step": 21120
|
|
},
|
|
{
|
|
"entropy": 5.3576140880584715,
|
|
"epoch": 1.643610192569539,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004729099133825231,
|
|
"loss": 5.1347,
|
|
"mean_token_accuracy": 0.18739009648561478,
|
|
"num_tokens": 36659322.0,
|
|
"step": 21125
|
|
},
|
|
{
|
|
"entropy": 5.427200889587402,
|
|
"epoch": 1.6439992219412565,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.000472896727167408,
|
|
"loss": 5.1098,
|
|
"mean_token_accuracy": 0.19002711325883864,
|
|
"num_tokens": 36667699.0,
|
|
"step": 21130
|
|
},
|
|
{
|
|
"entropy": 5.527372074127197,
|
|
"epoch": 1.6443882513129742,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00047288353794952505,
|
|
"loss": 5.2528,
|
|
"mean_token_accuracy": 0.1773348405957222,
|
|
"num_tokens": 36677842.0,
|
|
"step": 21135
|
|
},
|
|
{
|
|
"entropy": 5.397771549224854,
|
|
"epoch": 1.6447772806846916,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004728703457290744,
|
|
"loss": 5.0639,
|
|
"mean_token_accuracy": 0.19210756719112396,
|
|
"num_tokens": 36686488.0,
|
|
"step": 21140
|
|
},
|
|
{
|
|
"entropy": 5.43499608039856,
|
|
"epoch": 1.6451663100564091,
|
|
"grad_norm": 1.546875,
|
|
"learning_rate": 0.0004728571505062562,
|
|
"loss": 5.2201,
|
|
"mean_token_accuracy": 0.18548770397901534,
|
|
"num_tokens": 36694955.0,
|
|
"step": 21145
|
|
},
|
|
{
|
|
"entropy": 5.383376169204712,
|
|
"epoch": 1.6455553394281268,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004728439522812707,
|
|
"loss": 5.1102,
|
|
"mean_token_accuracy": 0.18933332711458206,
|
|
"num_tokens": 36703481.0,
|
|
"step": 21150
|
|
},
|
|
{
|
|
"entropy": 5.5120659351348875,
|
|
"epoch": 1.6459443687998445,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.00047283075105431806,
|
|
"loss": 5.3263,
|
|
"mean_token_accuracy": 0.17586686164140702,
|
|
"num_tokens": 36711812.0,
|
|
"step": 21155
|
|
},
|
|
{
|
|
"entropy": 5.502885198593139,
|
|
"epoch": 1.646333398171562,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004728175468255987,
|
|
"loss": 5.1976,
|
|
"mean_token_accuracy": 0.18580035120248795,
|
|
"num_tokens": 36720496.0,
|
|
"step": 21160
|
|
},
|
|
{
|
|
"entropy": 5.414668369293213,
|
|
"epoch": 1.6467224275432795,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.00047280433959531287,
|
|
"loss": 5.0525,
|
|
"mean_token_accuracy": 0.1890591025352478,
|
|
"num_tokens": 36728959.0,
|
|
"step": 21165
|
|
},
|
|
{
|
|
"entropy": 5.347526121139526,
|
|
"epoch": 1.6471114569149972,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.000472791129363661,
|
|
"loss": 5.158,
|
|
"mean_token_accuracy": 0.18552952706813813,
|
|
"num_tokens": 36737492.0,
|
|
"step": 21170
|
|
},
|
|
{
|
|
"entropy": 5.472883510589599,
|
|
"epoch": 1.6475004862867146,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0004727779161308436,
|
|
"loss": 5.1303,
|
|
"mean_token_accuracy": 0.18681171983480455,
|
|
"num_tokens": 36745852.0,
|
|
"step": 21175
|
|
},
|
|
{
|
|
"entropy": 5.462583589553833,
|
|
"epoch": 1.6478895156584321,
|
|
"grad_norm": 1.671875,
|
|
"learning_rate": 0.0004727646998970612,
|
|
"loss": 5.1893,
|
|
"mean_token_accuracy": 0.181314180791378,
|
|
"num_tokens": 36753897.0,
|
|
"step": 21180
|
|
},
|
|
{
|
|
"entropy": 5.437054252624511,
|
|
"epoch": 1.6482785450301498,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.00047275148066251417,
|
|
"loss": 5.1223,
|
|
"mean_token_accuracy": 0.18211720138788223,
|
|
"num_tokens": 36762737.0,
|
|
"step": 21185
|
|
},
|
|
{
|
|
"entropy": 5.536819887161255,
|
|
"epoch": 1.6486675744018673,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0004727382584274032,
|
|
"loss": 5.2568,
|
|
"mean_token_accuracy": 0.1780978888273239,
|
|
"num_tokens": 36770742.0,
|
|
"step": 21190
|
|
},
|
|
{
|
|
"entropy": 5.5391552448272705,
|
|
"epoch": 1.6490566037735848,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.00047272503319192887,
|
|
"loss": 5.3027,
|
|
"mean_token_accuracy": 0.17244922965765,
|
|
"num_tokens": 36779420.0,
|
|
"step": 21195
|
|
},
|
|
{
|
|
"entropy": 5.413461494445801,
|
|
"epoch": 1.6494456331453025,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 0.0004727118049562919,
|
|
"loss": 5.1008,
|
|
"mean_token_accuracy": 0.18950988352298737,
|
|
"num_tokens": 36787888.0,
|
|
"step": 21200
|
|
},
|
|
{
|
|
"entropy": 5.369880962371826,
|
|
"epoch": 1.6498346625170202,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.000472698573720693,
|
|
"loss": 5.041,
|
|
"mean_token_accuracy": 0.19358342438936232,
|
|
"num_tokens": 36797131.0,
|
|
"step": 21205
|
|
},
|
|
{
|
|
"entropy": 5.413011598587036,
|
|
"epoch": 1.6502236918887376,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.0004726853394853329,
|
|
"loss": 5.2341,
|
|
"mean_token_accuracy": 0.17686241269111633,
|
|
"num_tokens": 36805429.0,
|
|
"step": 21210
|
|
},
|
|
{
|
|
"entropy": 5.478509092330933,
|
|
"epoch": 1.650612721260455,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.00047267210225041234,
|
|
"loss": 5.265,
|
|
"mean_token_accuracy": 0.17884287238121033,
|
|
"num_tokens": 36814204.0,
|
|
"step": 21215
|
|
},
|
|
{
|
|
"entropy": 5.555078363418579,
|
|
"epoch": 1.6510017506321728,
|
|
"grad_norm": 1.5859375,
|
|
"learning_rate": 0.00047265886201613234,
|
|
"loss": 5.2252,
|
|
"mean_token_accuracy": 0.18186666518449784,
|
|
"num_tokens": 36823229.0,
|
|
"step": 21220
|
|
},
|
|
{
|
|
"entropy": 5.533970975875855,
|
|
"epoch": 1.6513907800038903,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.00047264561878269365,
|
|
"loss": 5.2944,
|
|
"mean_token_accuracy": 0.17468467950820923,
|
|
"num_tokens": 36832252.0,
|
|
"step": 21225
|
|
},
|
|
{
|
|
"entropy": 5.474828386306763,
|
|
"epoch": 1.6517798093756078,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0004726323725502973,
|
|
"loss": 5.1725,
|
|
"mean_token_accuracy": 0.18032560348510743,
|
|
"num_tokens": 36841456.0,
|
|
"step": 21230
|
|
},
|
|
{
|
|
"entropy": 5.501571750640869,
|
|
"epoch": 1.6521688387473255,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.0004726191233191443,
|
|
"loss": 5.1603,
|
|
"mean_token_accuracy": 0.18912065625190735,
|
|
"num_tokens": 36849717.0,
|
|
"step": 21235
|
|
},
|
|
{
|
|
"entropy": 5.483205032348633,
|
|
"epoch": 1.6525578681190431,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0004726058710894357,
|
|
"loss": 5.213,
|
|
"mean_token_accuracy": 0.17605281472206116,
|
|
"num_tokens": 36858222.0,
|
|
"step": 21240
|
|
},
|
|
{
|
|
"entropy": 5.3973784923553465,
|
|
"epoch": 1.6529468974907604,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0004725926158613724,
|
|
"loss": 5.2266,
|
|
"mean_token_accuracy": 0.1770833119750023,
|
|
"num_tokens": 36866899.0,
|
|
"step": 21245
|
|
},
|
|
{
|
|
"entropy": 5.490845584869385,
|
|
"epoch": 1.653335926862478,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.0004725793576351557,
|
|
"loss": 5.1746,
|
|
"mean_token_accuracy": 0.19120905548334122,
|
|
"num_tokens": 36876124.0,
|
|
"step": 21250
|
|
},
|
|
{
|
|
"entropy": 5.525161457061768,
|
|
"epoch": 1.6537249562341958,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0004725660964109867,
|
|
"loss": 5.2485,
|
|
"mean_token_accuracy": 0.17969964444637299,
|
|
"num_tokens": 36884689.0,
|
|
"step": 21255
|
|
},
|
|
{
|
|
"entropy": 5.497931385040284,
|
|
"epoch": 1.6541139856059133,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.00047255283218906673,
|
|
"loss": 5.1746,
|
|
"mean_token_accuracy": 0.18193556517362594,
|
|
"num_tokens": 36893073.0,
|
|
"step": 21260
|
|
},
|
|
{
|
|
"entropy": 5.479152059555053,
|
|
"epoch": 1.6545030149776307,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.000472539564969597,
|
|
"loss": 5.2253,
|
|
"mean_token_accuracy": 0.1756857842206955,
|
|
"num_tokens": 36902428.0,
|
|
"step": 21265
|
|
},
|
|
{
|
|
"entropy": 5.4898333072662355,
|
|
"epoch": 1.6548920443493484,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00047252629475277863,
|
|
"loss": 5.2269,
|
|
"mean_token_accuracy": 0.18409541100263596,
|
|
"num_tokens": 36910297.0,
|
|
"step": 21270
|
|
},
|
|
{
|
|
"entropy": 5.4531206607818605,
|
|
"epoch": 1.655281073721066,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0004725130215388132,
|
|
"loss": 5.1572,
|
|
"mean_token_accuracy": 0.18274469524621964,
|
|
"num_tokens": 36919115.0,
|
|
"step": 21275
|
|
},
|
|
{
|
|
"entropy": 5.509743499755859,
|
|
"epoch": 1.6556701030927834,
|
|
"grad_norm": 1.859375,
|
|
"learning_rate": 0.0004724997453279021,
|
|
"loss": 5.2027,
|
|
"mean_token_accuracy": 0.1817948117852211,
|
|
"num_tokens": 36928419.0,
|
|
"step": 21280
|
|
},
|
|
{
|
|
"entropy": 5.528812599182129,
|
|
"epoch": 1.656059132464501,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004724864661202467,
|
|
"loss": 5.1481,
|
|
"mean_token_accuracy": 0.18658121377229692,
|
|
"num_tokens": 36936511.0,
|
|
"step": 21285
|
|
},
|
|
{
|
|
"entropy": 5.48697338104248,
|
|
"epoch": 1.6564481618362188,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.00047247318391604846,
|
|
"loss": 5.2116,
|
|
"mean_token_accuracy": 0.18273700922727584,
|
|
"num_tokens": 36945316.0,
|
|
"step": 21290
|
|
},
|
|
{
|
|
"entropy": 5.464405155181884,
|
|
"epoch": 1.656837191207936,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.00047245989871550897,
|
|
"loss": 5.2437,
|
|
"mean_token_accuracy": 0.17317323982715607,
|
|
"num_tokens": 36954140.0,
|
|
"step": 21295
|
|
},
|
|
{
|
|
"entropy": 5.511450099945068,
|
|
"epoch": 1.6572262205796537,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0004724466105188299,
|
|
"loss": 5.1787,
|
|
"mean_token_accuracy": 0.18265851885080336,
|
|
"num_tokens": 36962852.0,
|
|
"step": 21300
|
|
},
|
|
{
|
|
"entropy": 5.5928566455841064,
|
|
"epoch": 1.6576152499513714,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.00047243331932621263,
|
|
"loss": 5.2243,
|
|
"mean_token_accuracy": 0.18260930180549623,
|
|
"num_tokens": 36971617.0,
|
|
"step": 21305
|
|
},
|
|
{
|
|
"entropy": 5.453424978256225,
|
|
"epoch": 1.658004279323089,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.0004724200251378591,
|
|
"loss": 5.2288,
|
|
"mean_token_accuracy": 0.18045469671487807,
|
|
"num_tokens": 36981078.0,
|
|
"step": 21310
|
|
},
|
|
{
|
|
"entropy": 5.466329193115234,
|
|
"epoch": 1.6583933086948064,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0004724067279539709,
|
|
"loss": 5.1268,
|
|
"mean_token_accuracy": 0.17876289337873458,
|
|
"num_tokens": 36989860.0,
|
|
"step": 21315
|
|
},
|
|
{
|
|
"entropy": 5.459926414489746,
|
|
"epoch": 1.658782338066524,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00047239342777474975,
|
|
"loss": 5.1606,
|
|
"mean_token_accuracy": 0.186983859539032,
|
|
"num_tokens": 36998037.0,
|
|
"step": 21320
|
|
},
|
|
{
|
|
"entropy": 5.472283554077149,
|
|
"epoch": 1.6591713674382416,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.00047238012460039765,
|
|
"loss": 5.1894,
|
|
"mean_token_accuracy": 0.1812639579176903,
|
|
"num_tokens": 37006375.0,
|
|
"step": 21325
|
|
},
|
|
{
|
|
"entropy": 5.476419305801391,
|
|
"epoch": 1.659560396809959,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0004723668184311162,
|
|
"loss": 5.2505,
|
|
"mean_token_accuracy": 0.17863859087228776,
|
|
"num_tokens": 37014650.0,
|
|
"step": 21330
|
|
},
|
|
{
|
|
"entropy": 5.5464410305023195,
|
|
"epoch": 1.6599494261816767,
|
|
"grad_norm": 1.5,
|
|
"learning_rate": 0.0004723535092671074,
|
|
"loss": 5.211,
|
|
"mean_token_accuracy": 0.1769264057278633,
|
|
"num_tokens": 37023147.0,
|
|
"step": 21335
|
|
},
|
|
{
|
|
"entropy": 5.534593868255615,
|
|
"epoch": 1.6603384555533944,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.00047234019710857335,
|
|
"loss": 5.2293,
|
|
"mean_token_accuracy": 0.1810394823551178,
|
|
"num_tokens": 37031461.0,
|
|
"step": 21340
|
|
},
|
|
{
|
|
"entropy": 5.535591888427734,
|
|
"epoch": 1.6607274849251117,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004723268819557158,
|
|
"loss": 5.2449,
|
|
"mean_token_accuracy": 0.18641917854547502,
|
|
"num_tokens": 37039924.0,
|
|
"step": 21345
|
|
},
|
|
{
|
|
"entropy": 5.417038440704346,
|
|
"epoch": 1.6611165142968294,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.00047231356380873687,
|
|
"loss": 5.1665,
|
|
"mean_token_accuracy": 0.18110019862651824,
|
|
"num_tokens": 37048631.0,
|
|
"step": 21350
|
|
},
|
|
{
|
|
"entropy": 5.464333343505859,
|
|
"epoch": 1.661505543668547,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.0004723002426678388,
|
|
"loss": 5.1569,
|
|
"mean_token_accuracy": 0.18926072120666504,
|
|
"num_tokens": 37057018.0,
|
|
"step": 21355
|
|
},
|
|
{
|
|
"entropy": 5.49429931640625,
|
|
"epoch": 1.6618945730402646,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.0004722869185332235,
|
|
"loss": 5.1842,
|
|
"mean_token_accuracy": 0.18258886337280272,
|
|
"num_tokens": 37065762.0,
|
|
"step": 21360
|
|
},
|
|
{
|
|
"entropy": 5.428005504608154,
|
|
"epoch": 1.662283602411982,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.00047227359140509324,
|
|
"loss": 5.1846,
|
|
"mean_token_accuracy": 0.18040224760770798,
|
|
"num_tokens": 37073836.0,
|
|
"step": 21365
|
|
},
|
|
{
|
|
"entropy": 5.431950044631958,
|
|
"epoch": 1.6626726317836997,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.0004722602612836501,
|
|
"loss": 5.2434,
|
|
"mean_token_accuracy": 0.17611737102270125,
|
|
"num_tokens": 37082788.0,
|
|
"step": 21370
|
|
},
|
|
{
|
|
"entropy": 5.580137109756469,
|
|
"epoch": 1.6630616611554172,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.00047224692816909665,
|
|
"loss": 5.2482,
|
|
"mean_token_accuracy": 0.17717309147119523,
|
|
"num_tokens": 37091228.0,
|
|
"step": 21375
|
|
},
|
|
{
|
|
"entropy": 5.540875959396362,
|
|
"epoch": 1.6634506905271347,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0004722335920616349,
|
|
"loss": 5.1715,
|
|
"mean_token_accuracy": 0.18301521390676498,
|
|
"num_tokens": 37099819.0,
|
|
"step": 21380
|
|
},
|
|
{
|
|
"entropy": 5.4199143409729,
|
|
"epoch": 1.6638397198988524,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00047222025296146745,
|
|
"loss": 5.2082,
|
|
"mean_token_accuracy": 0.174732007086277,
|
|
"num_tokens": 37108129.0,
|
|
"step": 21385
|
|
},
|
|
{
|
|
"entropy": 5.398650360107422,
|
|
"epoch": 1.66422874927057,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00047220691086879643,
|
|
"loss": 5.1098,
|
|
"mean_token_accuracy": 0.18977808505296706,
|
|
"num_tokens": 37116093.0,
|
|
"step": 21390
|
|
},
|
|
{
|
|
"entropy": 5.459658145904541,
|
|
"epoch": 1.6646177786422873,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0004721935657838245,
|
|
"loss": 5.162,
|
|
"mean_token_accuracy": 0.1835104078054428,
|
|
"num_tokens": 37124098.0,
|
|
"step": 21395
|
|
},
|
|
{
|
|
"entropy": 5.520260620117187,
|
|
"epoch": 1.665006808014005,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.000472180217706754,
|
|
"loss": 5.2278,
|
|
"mean_token_accuracy": 0.17799590528011322,
|
|
"num_tokens": 37132608.0,
|
|
"step": 21400
|
|
},
|
|
{
|
|
"entropy": 5.496925735473633,
|
|
"epoch": 1.6653958373857227,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.0004721668666377876,
|
|
"loss": 5.2154,
|
|
"mean_token_accuracy": 0.18403584659099578,
|
|
"num_tokens": 37141365.0,
|
|
"step": 21405
|
|
},
|
|
{
|
|
"entropy": 5.424926519393921,
|
|
"epoch": 1.6657848667574402,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.00047215351257712783,
|
|
"loss": 5.1331,
|
|
"mean_token_accuracy": 0.18554792702198028,
|
|
"num_tokens": 37150146.0,
|
|
"step": 21410
|
|
},
|
|
{
|
|
"entropy": 5.5633574485778805,
|
|
"epoch": 1.6661738961291577,
|
|
"grad_norm": 1.6328125,
|
|
"learning_rate": 0.00047214015552497735,
|
|
"loss": 5.2954,
|
|
"mean_token_accuracy": 0.1747785896062851,
|
|
"num_tokens": 37158887.0,
|
|
"step": 21415
|
|
},
|
|
{
|
|
"entropy": 5.522117662429809,
|
|
"epoch": 1.6665629255008754,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.00047212679548153867,
|
|
"loss": 5.1386,
|
|
"mean_token_accuracy": 0.18266212791204453,
|
|
"num_tokens": 37167902.0,
|
|
"step": 21420
|
|
},
|
|
{
|
|
"entropy": 5.514734506607056,
|
|
"epoch": 1.6669519548725928,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.00047211343244701475,
|
|
"loss": 5.2609,
|
|
"mean_token_accuracy": 0.18035067915916442,
|
|
"num_tokens": 37175853.0,
|
|
"step": 21425
|
|
},
|
|
{
|
|
"entropy": 5.453936767578125,
|
|
"epoch": 1.6673409842443103,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.0004721000664216081,
|
|
"loss": 5.1573,
|
|
"mean_token_accuracy": 0.18276971727609634,
|
|
"num_tokens": 37184036.0,
|
|
"step": 21430
|
|
},
|
|
{
|
|
"entropy": 5.502601099014282,
|
|
"epoch": 1.667730013616028,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.0004720866974055219,
|
|
"loss": 5.211,
|
|
"mean_token_accuracy": 0.18155357986688614,
|
|
"num_tokens": 37193277.0,
|
|
"step": 21435
|
|
},
|
|
{
|
|
"entropy": 5.522041988372803,
|
|
"epoch": 1.6681190429877457,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.0004720733253989585,
|
|
"loss": 5.1667,
|
|
"mean_token_accuracy": 0.1853174790740013,
|
|
"num_tokens": 37201925.0,
|
|
"step": 21440
|
|
},
|
|
{
|
|
"entropy": 5.516654205322266,
|
|
"epoch": 1.6685080723594632,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.00047205995040212114,
|
|
"loss": 5.2661,
|
|
"mean_token_accuracy": 0.1726203069090843,
|
|
"num_tokens": 37210552.0,
|
|
"step": 21445
|
|
},
|
|
{
|
|
"entropy": 5.479701042175293,
|
|
"epoch": 1.6688971017311807,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.0004720465724152127,
|
|
"loss": 5.2174,
|
|
"mean_token_accuracy": 0.18304990530014037,
|
|
"num_tokens": 37219001.0,
|
|
"step": 21450
|
|
},
|
|
{
|
|
"entropy": 5.460734558105469,
|
|
"epoch": 1.6692861311028984,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.00047203319143843613,
|
|
"loss": 5.1423,
|
|
"mean_token_accuracy": 0.19142136573791504,
|
|
"num_tokens": 37227635.0,
|
|
"step": 21455
|
|
},
|
|
{
|
|
"entropy": 5.450155019760132,
|
|
"epoch": 1.6696751604746158,
|
|
"grad_norm": 1.53125,
|
|
"learning_rate": 0.0004720198074719946,
|
|
"loss": 5.1661,
|
|
"mean_token_accuracy": 0.18147356659173966,
|
|
"num_tokens": 37236872.0,
|
|
"step": 21460
|
|
},
|
|
{
|
|
"entropy": 5.5014739513397215,
|
|
"epoch": 1.6700641898463333,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 0.00047200642051609094,
|
|
"loss": 5.2326,
|
|
"mean_token_accuracy": 0.17663762271404265,
|
|
"num_tokens": 37245026.0,
|
|
"step": 21465
|
|
},
|
|
{
|
|
"entropy": 5.486216354370117,
|
|
"epoch": 1.670453219218051,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0004719930305709285,
|
|
"loss": 5.1991,
|
|
"mean_token_accuracy": 0.17639574855566026,
|
|
"num_tokens": 37253295.0,
|
|
"step": 21470
|
|
},
|
|
{
|
|
"entropy": 5.4627148628234865,
|
|
"epoch": 1.6708422485897685,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.00047197963763671033,
|
|
"loss": 5.1733,
|
|
"mean_token_accuracy": 0.1859034702181816,
|
|
"num_tokens": 37262785.0,
|
|
"step": 21475
|
|
},
|
|
{
|
|
"entropy": 5.422159099578858,
|
|
"epoch": 1.671231277961486,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0004719662417136397,
|
|
"loss": 5.2357,
|
|
"mean_token_accuracy": 0.18522778451442717,
|
|
"num_tokens": 37271937.0,
|
|
"step": 21480
|
|
},
|
|
{
|
|
"entropy": 5.465244913101197,
|
|
"epoch": 1.6716203073332037,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.00047195284280191987,
|
|
"loss": 5.1511,
|
|
"mean_token_accuracy": 0.1886195495724678,
|
|
"num_tokens": 37280861.0,
|
|
"step": 21485
|
|
},
|
|
{
|
|
"entropy": 5.482504749298096,
|
|
"epoch": 1.6720093367049214,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0004719394409017541,
|
|
"loss": 5.1771,
|
|
"mean_token_accuracy": 0.18508583009243013,
|
|
"num_tokens": 37289235.0,
|
|
"step": 21490
|
|
},
|
|
{
|
|
"entropy": 5.446719980239868,
|
|
"epoch": 1.6723983660766388,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.00047192603601334585,
|
|
"loss": 5.1889,
|
|
"mean_token_accuracy": 0.1792226403951645,
|
|
"num_tokens": 37297778.0,
|
|
"step": 21495
|
|
},
|
|
{
|
|
"entropy": 5.452008390426636,
|
|
"epoch": 1.6727873954483563,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.00047191262813689835,
|
|
"loss": 5.1925,
|
|
"mean_token_accuracy": 0.1710060179233551,
|
|
"num_tokens": 37306960.0,
|
|
"step": 21500
|
|
},
|
|
{
|
|
"entropy": 5.499750852584839,
|
|
"epoch": 1.673176424820074,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.0004718992172726152,
|
|
"loss": 5.2287,
|
|
"mean_token_accuracy": 0.17869676202535628,
|
|
"num_tokens": 37316050.0,
|
|
"step": 21505
|
|
},
|
|
{
|
|
"entropy": 5.421911334991455,
|
|
"epoch": 1.6735654541917915,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.00047188580342069983,
|
|
"loss": 5.1747,
|
|
"mean_token_accuracy": 0.1850631579756737,
|
|
"num_tokens": 37325058.0,
|
|
"step": 21510
|
|
},
|
|
{
|
|
"entropy": 5.500029039382935,
|
|
"epoch": 1.673954483563509,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.0004718723865813557,
|
|
"loss": 5.269,
|
|
"mean_token_accuracy": 0.17668198496103288,
|
|
"num_tokens": 37333512.0,
|
|
"step": 21515
|
|
},
|
|
{
|
|
"entropy": 5.450409412384033,
|
|
"epoch": 1.6743435129352267,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0004718589667547865,
|
|
"loss": 5.1832,
|
|
"mean_token_accuracy": 0.18660251647233964,
|
|
"num_tokens": 37341695.0,
|
|
"step": 21520
|
|
},
|
|
{
|
|
"entropy": 5.551853179931641,
|
|
"epoch": 1.6747325423069441,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0004718455439411958,
|
|
"loss": 5.315,
|
|
"mean_token_accuracy": 0.16997454315423965,
|
|
"num_tokens": 37350917.0,
|
|
"step": 21525
|
|
},
|
|
{
|
|
"entropy": 5.570763063430786,
|
|
"epoch": 1.6751215716786616,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0004718321181407873,
|
|
"loss": 5.3156,
|
|
"mean_token_accuracy": 0.16932897120714188,
|
|
"num_tokens": 37360206.0,
|
|
"step": 21530
|
|
},
|
|
{
|
|
"entropy": 5.549673366546631,
|
|
"epoch": 1.6755106010503793,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004718186893537647,
|
|
"loss": 5.2798,
|
|
"mean_token_accuracy": 0.17510711997747422,
|
|
"num_tokens": 37369378.0,
|
|
"step": 21535
|
|
},
|
|
{
|
|
"entropy": 5.467506027221679,
|
|
"epoch": 1.675899630422097,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.0004718052575803318,
|
|
"loss": 5.1584,
|
|
"mean_token_accuracy": 0.19133659303188325,
|
|
"num_tokens": 37377744.0,
|
|
"step": 21540
|
|
},
|
|
{
|
|
"entropy": 5.473029565811157,
|
|
"epoch": 1.6762886597938145,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.0004717918228206923,
|
|
"loss": 5.2009,
|
|
"mean_token_accuracy": 0.17576997876167297,
|
|
"num_tokens": 37387097.0,
|
|
"step": 21545
|
|
},
|
|
{
|
|
"entropy": 5.5223987102508545,
|
|
"epoch": 1.676677689165532,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.0004717783850750501,
|
|
"loss": 5.2668,
|
|
"mean_token_accuracy": 0.17804792821407317,
|
|
"num_tokens": 37395551.0,
|
|
"step": 21550
|
|
},
|
|
{
|
|
"entropy": 5.4536683559417725,
|
|
"epoch": 1.6770667185372496,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0004717649443436091,
|
|
"loss": 5.017,
|
|
"mean_token_accuracy": 0.19075393825769424,
|
|
"num_tokens": 37403876.0,
|
|
"step": 21555
|
|
},
|
|
{
|
|
"entropy": 5.42834358215332,
|
|
"epoch": 1.6774557479089671,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00047175150062657336,
|
|
"loss": 5.1551,
|
|
"mean_token_accuracy": 0.18577537983655928,
|
|
"num_tokens": 37412658.0,
|
|
"step": 21560
|
|
},
|
|
{
|
|
"entropy": 5.424991512298584,
|
|
"epoch": 1.6778447772806846,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.00047173805392414664,
|
|
"loss": 5.1504,
|
|
"mean_token_accuracy": 0.18152452409267425,
|
|
"num_tokens": 37420790.0,
|
|
"step": 21565
|
|
},
|
|
{
|
|
"entropy": 5.445191287994385,
|
|
"epoch": 1.6782338066524023,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0004717246042365332,
|
|
"loss": 5.2106,
|
|
"mean_token_accuracy": 0.18707268089056014,
|
|
"num_tokens": 37428866.0,
|
|
"step": 21570
|
|
},
|
|
{
|
|
"entropy": 5.445303153991699,
|
|
"epoch": 1.6786228360241198,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.00047171115156393695,
|
|
"loss": 5.1472,
|
|
"mean_token_accuracy": 0.18674639612436295,
|
|
"num_tokens": 37437636.0,
|
|
"step": 21575
|
|
},
|
|
{
|
|
"entropy": 5.460844421386719,
|
|
"epoch": 1.6790118653958372,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.00047169769590656207,
|
|
"loss": 5.1958,
|
|
"mean_token_accuracy": 0.18597369343042375,
|
|
"num_tokens": 37446455.0,
|
|
"step": 21580
|
|
},
|
|
{
|
|
"entropy": 5.4874711513519285,
|
|
"epoch": 1.679400894767555,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.00047168423726461273,
|
|
"loss": 5.2785,
|
|
"mean_token_accuracy": 0.17528842389583588,
|
|
"num_tokens": 37454997.0,
|
|
"step": 21585
|
|
},
|
|
{
|
|
"entropy": 5.439086961746216,
|
|
"epoch": 1.6797899241392726,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004716707756382931,
|
|
"loss": 5.1032,
|
|
"mean_token_accuracy": 0.18924276083707808,
|
|
"num_tokens": 37463701.0,
|
|
"step": 21590
|
|
},
|
|
{
|
|
"entropy": 5.482520914077758,
|
|
"epoch": 1.6801789535109901,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00047165731102780757,
|
|
"loss": 5.2377,
|
|
"mean_token_accuracy": 0.17546220421791076,
|
|
"num_tokens": 37472460.0,
|
|
"step": 21595
|
|
},
|
|
{
|
|
"entropy": 5.506062984466553,
|
|
"epoch": 1.6805679828827076,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.00047164384343336037,
|
|
"loss": 5.137,
|
|
"mean_token_accuracy": 0.187108314037323,
|
|
"num_tokens": 37481114.0,
|
|
"step": 21600
|
|
},
|
|
{
|
|
"entropy": 5.487678575515747,
|
|
"epoch": 1.6809570122544253,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.00047163037285515583,
|
|
"loss": 5.2309,
|
|
"mean_token_accuracy": 0.17664194256067275,
|
|
"num_tokens": 37489593.0,
|
|
"step": 21605
|
|
},
|
|
{
|
|
"entropy": 5.52338490486145,
|
|
"epoch": 1.6813460416261428,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.0004716168992933982,
|
|
"loss": 5.2931,
|
|
"mean_token_accuracy": 0.17980174273252486,
|
|
"num_tokens": 37498044.0,
|
|
"step": 21610
|
|
},
|
|
{
|
|
"entropy": 5.576248550415039,
|
|
"epoch": 1.6817350709978602,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.00047160342274829234,
|
|
"loss": 5.1909,
|
|
"mean_token_accuracy": 0.1783790573477745,
|
|
"num_tokens": 37507339.0,
|
|
"step": 21615
|
|
},
|
|
{
|
|
"entropy": 5.402055072784424,
|
|
"epoch": 1.682124100369578,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00047158994322004223,
|
|
"loss": 5.0629,
|
|
"mean_token_accuracy": 0.18599337488412857,
|
|
"num_tokens": 37515919.0,
|
|
"step": 21620
|
|
},
|
|
{
|
|
"entropy": 5.41980881690979,
|
|
"epoch": 1.6825131297412956,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0004715764607088527,
|
|
"loss": 5.0759,
|
|
"mean_token_accuracy": 0.19855934232473374,
|
|
"num_tokens": 37524990.0,
|
|
"step": 21625
|
|
},
|
|
{
|
|
"entropy": 5.357426691055298,
|
|
"epoch": 1.6829021591130129,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0004715629752149283,
|
|
"loss": 5.2021,
|
|
"mean_token_accuracy": 0.1801751062273979,
|
|
"num_tokens": 37534125.0,
|
|
"step": 21630
|
|
},
|
|
{
|
|
"entropy": 5.4377974510192875,
|
|
"epoch": 1.6832911884847306,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.00047154948673847356,
|
|
"loss": 5.1043,
|
|
"mean_token_accuracy": 0.18635933846235275,
|
|
"num_tokens": 37541715.0,
|
|
"step": 21635
|
|
},
|
|
{
|
|
"entropy": 5.571857595443726,
|
|
"epoch": 1.6836802178564483,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.0004715359952796933,
|
|
"loss": 5.2806,
|
|
"mean_token_accuracy": 0.18334741443395614,
|
|
"num_tokens": 37550097.0,
|
|
"step": 21640
|
|
},
|
|
{
|
|
"entropy": 5.412969875335693,
|
|
"epoch": 1.6840692472281658,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00047152250083879203,
|
|
"loss": 5.1432,
|
|
"mean_token_accuracy": 0.18714241534471512,
|
|
"num_tokens": 37558950.0,
|
|
"step": 21645
|
|
},
|
|
{
|
|
"entropy": 5.49203405380249,
|
|
"epoch": 1.6844582765998832,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 0.00047150900341597464,
|
|
"loss": 5.1754,
|
|
"mean_token_accuracy": 0.1835342451930046,
|
|
"num_tokens": 37567737.0,
|
|
"step": 21650
|
|
},
|
|
{
|
|
"entropy": 5.499365282058716,
|
|
"epoch": 1.684847305971601,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0004714955030114459,
|
|
"loss": 5.2154,
|
|
"mean_token_accuracy": 0.1802396446466446,
|
|
"num_tokens": 37576649.0,
|
|
"step": 21655
|
|
},
|
|
{
|
|
"entropy": 5.454767417907715,
|
|
"epoch": 1.6852363353433184,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.00047148199962541065,
|
|
"loss": 5.1615,
|
|
"mean_token_accuracy": 0.19093205779790878,
|
|
"num_tokens": 37584455.0,
|
|
"step": 21660
|
|
},
|
|
{
|
|
"entropy": 5.448482084274292,
|
|
"epoch": 1.6856253647150359,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0004714684932580738,
|
|
"loss": 5.2535,
|
|
"mean_token_accuracy": 0.17322952300310135,
|
|
"num_tokens": 37593653.0,
|
|
"step": 21665
|
|
},
|
|
{
|
|
"entropy": 5.497285079956055,
|
|
"epoch": 1.6860143940867536,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0004714549839096403,
|
|
"loss": 5.2078,
|
|
"mean_token_accuracy": 0.1763451039791107,
|
|
"num_tokens": 37603212.0,
|
|
"step": 21670
|
|
},
|
|
{
|
|
"entropy": 5.505492496490478,
|
|
"epoch": 1.6864034234584713,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.00047144147158031507,
|
|
"loss": 5.16,
|
|
"mean_token_accuracy": 0.18592147082090377,
|
|
"num_tokens": 37611871.0,
|
|
"step": 21675
|
|
},
|
|
{
|
|
"entropy": 5.5368345260620115,
|
|
"epoch": 1.6867924528301885,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.0004714279562703032,
|
|
"loss": 5.3555,
|
|
"mean_token_accuracy": 0.1708686903119087,
|
|
"num_tokens": 37621410.0,
|
|
"step": 21680
|
|
},
|
|
{
|
|
"entropy": 5.5193798542022705,
|
|
"epoch": 1.6871814822019062,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0004714144379798098,
|
|
"loss": 5.1446,
|
|
"mean_token_accuracy": 0.18192583620548247,
|
|
"num_tokens": 37629525.0,
|
|
"step": 21685
|
|
},
|
|
{
|
|
"entropy": 5.536234951019287,
|
|
"epoch": 1.687570511573624,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00047140091670903986,
|
|
"loss": 5.1884,
|
|
"mean_token_accuracy": 0.18255068063735963,
|
|
"num_tokens": 37638183.0,
|
|
"step": 21690
|
|
},
|
|
{
|
|
"entropy": 5.47870192527771,
|
|
"epoch": 1.6879595409453414,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.00047138739245819857,
|
|
"loss": 5.1943,
|
|
"mean_token_accuracy": 0.18142457902431489,
|
|
"num_tokens": 37646884.0,
|
|
"step": 21695
|
|
},
|
|
{
|
|
"entropy": 5.527023363113403,
|
|
"epoch": 1.6883485703170589,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00047137386522749124,
|
|
"loss": 5.2518,
|
|
"mean_token_accuracy": 0.17820024937391282,
|
|
"num_tokens": 37655482.0,
|
|
"step": 21700
|
|
},
|
|
{
|
|
"entropy": 5.456340265274048,
|
|
"epoch": 1.6887375996887766,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0004713603350171231,
|
|
"loss": 5.0603,
|
|
"mean_token_accuracy": 0.18941994458436967,
|
|
"num_tokens": 37664056.0,
|
|
"step": 21705
|
|
},
|
|
{
|
|
"entropy": 5.526046276092529,
|
|
"epoch": 1.689126629060494,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.00047134680182729926,
|
|
"loss": 5.3715,
|
|
"mean_token_accuracy": 0.1740104839205742,
|
|
"num_tokens": 37673198.0,
|
|
"step": 21710
|
|
},
|
|
{
|
|
"entropy": 5.479557704925537,
|
|
"epoch": 1.6895156584322115,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0004713332656582254,
|
|
"loss": 5.1866,
|
|
"mean_token_accuracy": 0.179257732629776,
|
|
"num_tokens": 37682660.0,
|
|
"step": 21715
|
|
},
|
|
{
|
|
"entropy": 5.45224404335022,
|
|
"epoch": 1.6899046878039292,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.0004713197265101066,
|
|
"loss": 5.1245,
|
|
"mean_token_accuracy": 0.1894549012184143,
|
|
"num_tokens": 37691232.0,
|
|
"step": 21720
|
|
},
|
|
{
|
|
"entropy": 5.4656774520874025,
|
|
"epoch": 1.690293717175647,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.00047130618438314856,
|
|
"loss": 5.091,
|
|
"mean_token_accuracy": 0.18957409262657166,
|
|
"num_tokens": 37699734.0,
|
|
"step": 21725
|
|
},
|
|
{
|
|
"entropy": 5.509268569946289,
|
|
"epoch": 1.6906827465473642,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0004712926392775565,
|
|
"loss": 5.2136,
|
|
"mean_token_accuracy": 0.18614676892757415,
|
|
"num_tokens": 37708529.0,
|
|
"step": 21730
|
|
},
|
|
{
|
|
"entropy": 5.437744808197022,
|
|
"epoch": 1.6910717759190819,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004712790911935362,
|
|
"loss": 5.0695,
|
|
"mean_token_accuracy": 0.19235442578792572,
|
|
"num_tokens": 37717197.0,
|
|
"step": 21735
|
|
},
|
|
{
|
|
"entropy": 5.42674503326416,
|
|
"epoch": 1.6914608052907996,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.000471265540131293,
|
|
"loss": 5.231,
|
|
"mean_token_accuracy": 0.17683700770139693,
|
|
"num_tokens": 37726276.0,
|
|
"step": 21740
|
|
},
|
|
{
|
|
"entropy": 5.56557822227478,
|
|
"epoch": 1.691849834662517,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.00047125198609103267,
|
|
"loss": 5.2611,
|
|
"mean_token_accuracy": 0.17319420278072356,
|
|
"num_tokens": 37735016.0,
|
|
"step": 21745
|
|
},
|
|
{
|
|
"entropy": 5.5916131973266605,
|
|
"epoch": 1.6922388640342345,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0004712384290729607,
|
|
"loss": 5.2227,
|
|
"mean_token_accuracy": 0.18264103233814238,
|
|
"num_tokens": 37744332.0,
|
|
"step": 21750
|
|
},
|
|
{
|
|
"entropy": 5.567017126083374,
|
|
"epoch": 1.6926278934059522,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.000471224869077283,
|
|
"loss": 5.264,
|
|
"mean_token_accuracy": 0.17130552381277084,
|
|
"num_tokens": 37752805.0,
|
|
"step": 21755
|
|
},
|
|
{
|
|
"entropy": 5.511889505386352,
|
|
"epoch": 1.6930169227776697,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.00047121130610420527,
|
|
"loss": 5.1866,
|
|
"mean_token_accuracy": 0.18206255584955217,
|
|
"num_tokens": 37760979.0,
|
|
"step": 21760
|
|
},
|
|
{
|
|
"entropy": 5.421501302719117,
|
|
"epoch": 1.6934059521493872,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.00047119774015393323,
|
|
"loss": 5.112,
|
|
"mean_token_accuracy": 0.18570806086063385,
|
|
"num_tokens": 37769096.0,
|
|
"step": 21765
|
|
},
|
|
{
|
|
"entropy": 5.42561616897583,
|
|
"epoch": 1.6937949815211049,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.00047118417122667285,
|
|
"loss": 5.1201,
|
|
"mean_token_accuracy": 0.18631493002176286,
|
|
"num_tokens": 37776998.0,
|
|
"step": 21770
|
|
},
|
|
{
|
|
"entropy": 5.459209871292114,
|
|
"epoch": 1.6941840108928226,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0004711705993226298,
|
|
"loss": 5.2616,
|
|
"mean_token_accuracy": 0.1790543705224991,
|
|
"num_tokens": 37785547.0,
|
|
"step": 21775
|
|
},
|
|
{
|
|
"entropy": 5.48904857635498,
|
|
"epoch": 1.6945730402645398,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0004711570244420102,
|
|
"loss": 5.2281,
|
|
"mean_token_accuracy": 0.18304537683725358,
|
|
"num_tokens": 37793659.0,
|
|
"step": 21780
|
|
},
|
|
{
|
|
"entropy": 5.556977987289429,
|
|
"epoch": 1.6949620696362575,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0004711434465850199,
|
|
"loss": 5.129,
|
|
"mean_token_accuracy": 0.1895242840051651,
|
|
"num_tokens": 37802282.0,
|
|
"step": 21785
|
|
},
|
|
{
|
|
"entropy": 5.4802467823028564,
|
|
"epoch": 1.6953510990079752,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.0004711298657518651,
|
|
"loss": 5.2029,
|
|
"mean_token_accuracy": 0.18438080698251724,
|
|
"num_tokens": 37810692.0,
|
|
"step": 21790
|
|
},
|
|
{
|
|
"entropy": 5.452144193649292,
|
|
"epoch": 1.6957401283796927,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0004711162819427518,
|
|
"loss": 5.1523,
|
|
"mean_token_accuracy": 0.1874224066734314,
|
|
"num_tokens": 37819264.0,
|
|
"step": 21795
|
|
},
|
|
{
|
|
"entropy": 5.5173835277557375,
|
|
"epoch": 1.6961291577514102,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.000471102695157886,
|
|
"loss": 5.1793,
|
|
"mean_token_accuracy": 0.1844692498445511,
|
|
"num_tokens": 37827650.0,
|
|
"step": 21800
|
|
},
|
|
{
|
|
"entropy": 5.403632164001465,
|
|
"epoch": 1.6965181871231279,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0004710891053974739,
|
|
"loss": 5.1367,
|
|
"mean_token_accuracy": 0.18615172058343887,
|
|
"num_tokens": 37835683.0,
|
|
"step": 21805
|
|
},
|
|
{
|
|
"entropy": 5.437741756439209,
|
|
"epoch": 1.6969072164948453,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0004710755126617217,
|
|
"loss": 5.1562,
|
|
"mean_token_accuracy": 0.18022779673337935,
|
|
"num_tokens": 37844334.0,
|
|
"step": 21810
|
|
},
|
|
{
|
|
"entropy": 5.408273363113404,
|
|
"epoch": 1.6972962458665628,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0004710619169508358,
|
|
"loss": 5.1167,
|
|
"mean_token_accuracy": 0.1818087086081505,
|
|
"num_tokens": 37853609.0,
|
|
"step": 21815
|
|
},
|
|
{
|
|
"entropy": 5.48780460357666,
|
|
"epoch": 1.6976852752382805,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0004710483182650223,
|
|
"loss": 5.1849,
|
|
"mean_token_accuracy": 0.1785520628094673,
|
|
"num_tokens": 37862817.0,
|
|
"step": 21820
|
|
},
|
|
{
|
|
"entropy": 5.432931995391845,
|
|
"epoch": 1.6980743046099982,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.00047103471660448767,
|
|
"loss": 5.1208,
|
|
"mean_token_accuracy": 0.18961375653743745,
|
|
"num_tokens": 37871630.0,
|
|
"step": 21825
|
|
},
|
|
{
|
|
"entropy": 5.383476877212525,
|
|
"epoch": 1.6984633339817157,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.00047102111196943813,
|
|
"loss": 5.1378,
|
|
"mean_token_accuracy": 0.18788239359855652,
|
|
"num_tokens": 37881098.0,
|
|
"step": 21830
|
|
},
|
|
{
|
|
"entropy": 5.484206819534302,
|
|
"epoch": 1.6988523633534331,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.00047100750436008035,
|
|
"loss": 5.1504,
|
|
"mean_token_accuracy": 0.18563647270202638,
|
|
"num_tokens": 37889760.0,
|
|
"step": 21835
|
|
},
|
|
{
|
|
"entropy": 5.582745027542114,
|
|
"epoch": 1.6992413927251508,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.00047099389377662054,
|
|
"loss": 5.2536,
|
|
"mean_token_accuracy": 0.1785595014691353,
|
|
"num_tokens": 37898417.0,
|
|
"step": 21840
|
|
},
|
|
{
|
|
"entropy": 5.488845634460449,
|
|
"epoch": 1.6996304220968683,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0004709802802192654,
|
|
"loss": 5.1856,
|
|
"mean_token_accuracy": 0.18901499956846238,
|
|
"num_tokens": 37907117.0,
|
|
"step": 21845
|
|
},
|
|
{
|
|
"entropy": 5.452686977386475,
|
|
"epoch": 1.7000194514685858,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.00047096666368822153,
|
|
"loss": 5.1054,
|
|
"mean_token_accuracy": 0.18972180038690567,
|
|
"num_tokens": 37915781.0,
|
|
"step": 21850
|
|
},
|
|
{
|
|
"entropy": 5.481147718429566,
|
|
"epoch": 1.7004084808403035,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.00047095304418369536,
|
|
"loss": 5.2192,
|
|
"mean_token_accuracy": 0.1790919244289398,
|
|
"num_tokens": 37924770.0,
|
|
"step": 21855
|
|
},
|
|
{
|
|
"entropy": 5.474031734466553,
|
|
"epoch": 1.700797510212021,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0004709394217058936,
|
|
"loss": 5.2128,
|
|
"mean_token_accuracy": 0.17771313786506654,
|
|
"num_tokens": 37933512.0,
|
|
"step": 21860
|
|
},
|
|
{
|
|
"entropy": 5.478064727783203,
|
|
"epoch": 1.7011865395837384,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0004709257962550231,
|
|
"loss": 5.0432,
|
|
"mean_token_accuracy": 0.18830222338438035,
|
|
"num_tokens": 37942439.0,
|
|
"step": 21865
|
|
},
|
|
{
|
|
"entropy": 5.508541059494019,
|
|
"epoch": 1.7015755689554561,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.00047091216783129035,
|
|
"loss": 5.2535,
|
|
"mean_token_accuracy": 0.17767124772071838,
|
|
"num_tokens": 37951388.0,
|
|
"step": 21870
|
|
},
|
|
{
|
|
"entropy": 5.499156904220581,
|
|
"epoch": 1.7019645983271738,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0004708985364349024,
|
|
"loss": 5.2278,
|
|
"mean_token_accuracy": 0.18199572712183,
|
|
"num_tokens": 37960372.0,
|
|
"step": 21875
|
|
},
|
|
{
|
|
"entropy": 5.560420036315918,
|
|
"epoch": 1.7023536276988913,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 0.00047088490206606586,
|
|
"loss": 5.3252,
|
|
"mean_token_accuracy": 0.16874147057533265,
|
|
"num_tokens": 37969472.0,
|
|
"step": 21880
|
|
},
|
|
{
|
|
"entropy": 5.451031494140625,
|
|
"epoch": 1.7027426570706088,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.00047087126472498785,
|
|
"loss": 5.0597,
|
|
"mean_token_accuracy": 0.19225776493549346,
|
|
"num_tokens": 37977422.0,
|
|
"step": 21885
|
|
},
|
|
{
|
|
"entropy": 5.396897268295288,
|
|
"epoch": 1.7031316864423265,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.000470857624411875,
|
|
"loss": 5.0249,
|
|
"mean_token_accuracy": 0.1890472114086151,
|
|
"num_tokens": 37985861.0,
|
|
"step": 21890
|
|
},
|
|
{
|
|
"entropy": 5.492931652069092,
|
|
"epoch": 1.703520715814044,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 0.00047084398112693456,
|
|
"loss": 5.1738,
|
|
"mean_token_accuracy": 0.18054302483797074,
|
|
"num_tokens": 37994535.0,
|
|
"step": 21895
|
|
},
|
|
{
|
|
"entropy": 5.459228372573852,
|
|
"epoch": 1.7039097451857614,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0004708303348703734,
|
|
"loss": 5.1874,
|
|
"mean_token_accuracy": 0.17980311810970306,
|
|
"num_tokens": 38003351.0,
|
|
"step": 21900
|
|
},
|
|
{
|
|
"entropy": 5.468518543243408,
|
|
"epoch": 1.7042987745574791,
|
|
"grad_norm": 1.5234375,
|
|
"learning_rate": 0.0004708166856423986,
|
|
"loss": 5.1751,
|
|
"mean_token_accuracy": 0.1801972582936287,
|
|
"num_tokens": 38012210.0,
|
|
"step": 21905
|
|
},
|
|
{
|
|
"entropy": 5.5348419666290285,
|
|
"epoch": 1.7046878039291966,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.00047080303344321727,
|
|
"loss": 5.1983,
|
|
"mean_token_accuracy": 0.18600852340459822,
|
|
"num_tokens": 38020548.0,
|
|
"step": 21910
|
|
},
|
|
{
|
|
"entropy": 5.50296721458435,
|
|
"epoch": 1.705076833300914,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.00047078937827303653,
|
|
"loss": 5.1574,
|
|
"mean_token_accuracy": 0.17908090949058533,
|
|
"num_tokens": 38029451.0,
|
|
"step": 21915
|
|
},
|
|
{
|
|
"entropy": 5.507396650314331,
|
|
"epoch": 1.7054658626726318,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0004707757201320636,
|
|
"loss": 5.1872,
|
|
"mean_token_accuracy": 0.1779931366443634,
|
|
"num_tokens": 38037821.0,
|
|
"step": 21920
|
|
},
|
|
{
|
|
"entropy": 5.468212747573853,
|
|
"epoch": 1.7058548920443495,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.00047076205902050577,
|
|
"loss": 5.2451,
|
|
"mean_token_accuracy": 0.17384670525789261,
|
|
"num_tokens": 38046188.0,
|
|
"step": 21925
|
|
},
|
|
{
|
|
"entropy": 5.48951358795166,
|
|
"epoch": 1.706243921416067,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00047074839493857024,
|
|
"loss": 5.2448,
|
|
"mean_token_accuracy": 0.17903341203927994,
|
|
"num_tokens": 38054821.0,
|
|
"step": 21930
|
|
},
|
|
{
|
|
"entropy": 5.5162371635437015,
|
|
"epoch": 1.7066329507877844,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004707347278864644,
|
|
"loss": 5.1368,
|
|
"mean_token_accuracy": 0.18613288849592208,
|
|
"num_tokens": 38063057.0,
|
|
"step": 21935
|
|
},
|
|
{
|
|
"entropy": 5.5428966045379635,
|
|
"epoch": 1.7070219801595021,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00047072105786439563,
|
|
"loss": 5.3323,
|
|
"mean_token_accuracy": 0.17659984529018402,
|
|
"num_tokens": 38071694.0,
|
|
"step": 21940
|
|
},
|
|
{
|
|
"entropy": 5.49590482711792,
|
|
"epoch": 1.7074110095312196,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00047070738487257137,
|
|
"loss": 5.1401,
|
|
"mean_token_accuracy": 0.18106452524662017,
|
|
"num_tokens": 38080965.0,
|
|
"step": 21945
|
|
},
|
|
{
|
|
"entropy": 5.4778368949890135,
|
|
"epoch": 1.707800038902937,
|
|
"grad_norm": 1.5390625,
|
|
"learning_rate": 0.00047069370891119895,
|
|
"loss": 5.1505,
|
|
"mean_token_accuracy": 0.18181752413511276,
|
|
"num_tokens": 38089786.0,
|
|
"step": 21950
|
|
},
|
|
{
|
|
"entropy": 5.484994697570801,
|
|
"epoch": 1.7081890682746548,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 0.000470680029980486,
|
|
"loss": 5.1717,
|
|
"mean_token_accuracy": 0.1887707769870758,
|
|
"num_tokens": 38097994.0,
|
|
"step": 21955
|
|
},
|
|
{
|
|
"entropy": 5.461494445800781,
|
|
"epoch": 1.7085780976463723,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00047066634808064006,
|
|
"loss": 5.2357,
|
|
"mean_token_accuracy": 0.18059082329273224,
|
|
"num_tokens": 38106910.0,
|
|
"step": 21960
|
|
},
|
|
{
|
|
"entropy": 5.492050266265869,
|
|
"epoch": 1.7089671270180897,
|
|
"grad_norm": 1.4921875,
|
|
"learning_rate": 0.00047065266321186873,
|
|
"loss": 5.1314,
|
|
"mean_token_accuracy": 0.18940888792276384,
|
|
"num_tokens": 38115162.0,
|
|
"step": 21965
|
|
},
|
|
{
|
|
"entropy": 5.5154944896698,
|
|
"epoch": 1.7093561563898074,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0004706389753743797,
|
|
"loss": 5.2083,
|
|
"mean_token_accuracy": 0.18512068390846254,
|
|
"num_tokens": 38123776.0,
|
|
"step": 21970
|
|
},
|
|
{
|
|
"entropy": 5.501916837692261,
|
|
"epoch": 1.7097451857615251,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0004706252845683805,
|
|
"loss": 5.3003,
|
|
"mean_token_accuracy": 0.179806949198246,
|
|
"num_tokens": 38132591.0,
|
|
"step": 21975
|
|
},
|
|
{
|
|
"entropy": 5.46964282989502,
|
|
"epoch": 1.7101342151332426,
|
|
"grad_norm": 1.546875,
|
|
"learning_rate": 0.00047061159079407903,
|
|
"loss": 5.1445,
|
|
"mean_token_accuracy": 0.1893348887562752,
|
|
"num_tokens": 38141092.0,
|
|
"step": 21980
|
|
},
|
|
{
|
|
"entropy": 5.4742332935333256,
|
|
"epoch": 1.71052324450496,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.000470597894051683,
|
|
"loss": 5.1087,
|
|
"mean_token_accuracy": 0.1865133300423622,
|
|
"num_tokens": 38149315.0,
|
|
"step": 21985
|
|
},
|
|
{
|
|
"entropy": 5.403580665588379,
|
|
"epoch": 1.7109122738766778,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0004705841943414003,
|
|
"loss": 5.0723,
|
|
"mean_token_accuracy": 0.18359042555093766,
|
|
"num_tokens": 38158208.0,
|
|
"step": 21990
|
|
},
|
|
{
|
|
"entropy": 5.543454551696778,
|
|
"epoch": 1.7113013032483952,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.00047057049166343876,
|
|
"loss": 5.2694,
|
|
"mean_token_accuracy": 0.1762729302048683,
|
|
"num_tokens": 38166339.0,
|
|
"step": 21995
|
|
},
|
|
{
|
|
"entropy": 5.470950889587402,
|
|
"epoch": 1.7116903326201127,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.00047055678601800623,
|
|
"loss": 5.1984,
|
|
"mean_token_accuracy": 0.18115722388029099,
|
|
"num_tokens": 38174813.0,
|
|
"step": 22000
|
|
},
|
|
{
|
|
"entropy": 5.434200811386108,
|
|
"epoch": 1.7120793619918304,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00047054307740531076,
|
|
"loss": 5.0759,
|
|
"mean_token_accuracy": 0.18827767670154572,
|
|
"num_tokens": 38183440.0,
|
|
"step": 22005
|
|
},
|
|
{
|
|
"entropy": 5.407111597061157,
|
|
"epoch": 1.712468391363548,
|
|
"grad_norm": 1.796875,
|
|
"learning_rate": 0.00047052936582556035,
|
|
"loss": 5.1475,
|
|
"mean_token_accuracy": 0.18075976073741912,
|
|
"num_tokens": 38192510.0,
|
|
"step": 22010
|
|
},
|
|
{
|
|
"entropy": 5.456093883514404,
|
|
"epoch": 1.7128574207352654,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00047051565127896307,
|
|
"loss": 5.1308,
|
|
"mean_token_accuracy": 0.18713924735784532,
|
|
"num_tokens": 38200854.0,
|
|
"step": 22015
|
|
},
|
|
{
|
|
"entropy": 5.489348268508911,
|
|
"epoch": 1.713246450106983,
|
|
"grad_norm": 1.53125,
|
|
"learning_rate": 0.00047050193376572686,
|
|
"loss": 5.1977,
|
|
"mean_token_accuracy": 0.17768681198358535,
|
|
"num_tokens": 38209632.0,
|
|
"step": 22020
|
|
},
|
|
{
|
|
"entropy": 5.430175113677978,
|
|
"epoch": 1.7136354794787008,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00047048821328606,
|
|
"loss": 5.1042,
|
|
"mean_token_accuracy": 0.18659493327140808,
|
|
"num_tokens": 38218657.0,
|
|
"step": 22025
|
|
},
|
|
{
|
|
"entropy": 5.509564304351807,
|
|
"epoch": 1.7140245088504182,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004704744898401708,
|
|
"loss": 5.1837,
|
|
"mean_token_accuracy": 0.18010811358690262,
|
|
"num_tokens": 38227507.0,
|
|
"step": 22030
|
|
},
|
|
{
|
|
"entropy": 5.497655630111694,
|
|
"epoch": 1.7144135382221357,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0004704607634282672,
|
|
"loss": 5.1545,
|
|
"mean_token_accuracy": 0.1801443263888359,
|
|
"num_tokens": 38236822.0,
|
|
"step": 22035
|
|
},
|
|
{
|
|
"entropy": 5.363424158096313,
|
|
"epoch": 1.7148025675938534,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00047044703405055765,
|
|
"loss": 5.0378,
|
|
"mean_token_accuracy": 0.19286258816719054,
|
|
"num_tokens": 38245144.0,
|
|
"step": 22040
|
|
},
|
|
{
|
|
"entropy": 5.410093784332275,
|
|
"epoch": 1.7151915969655709,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.00047043330170725046,
|
|
"loss": 5.1446,
|
|
"mean_token_accuracy": 0.1825016438961029,
|
|
"num_tokens": 38254363.0,
|
|
"step": 22045
|
|
},
|
|
{
|
|
"entropy": 5.406072473526001,
|
|
"epoch": 1.7155806263372884,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.00047041956639855406,
|
|
"loss": 5.1506,
|
|
"mean_token_accuracy": 0.18412292152643203,
|
|
"num_tokens": 38263117.0,
|
|
"step": 22050
|
|
},
|
|
{
|
|
"entropy": 5.442934942245484,
|
|
"epoch": 1.715969655709006,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0004704058281246766,
|
|
"loss": 5.1459,
|
|
"mean_token_accuracy": 0.18146743029356002,
|
|
"num_tokens": 38271217.0,
|
|
"step": 22055
|
|
},
|
|
{
|
|
"entropy": 5.560351610183716,
|
|
"epoch": 1.7163586850807238,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0004703920868858268,
|
|
"loss": 5.2944,
|
|
"mean_token_accuracy": 0.17736971080303193,
|
|
"num_tokens": 38279789.0,
|
|
"step": 22060
|
|
},
|
|
{
|
|
"entropy": 5.487414455413818,
|
|
"epoch": 1.716747714452441,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00047037834268221315,
|
|
"loss": 5.0983,
|
|
"mean_token_accuracy": 0.18638417720794678,
|
|
"num_tokens": 38288845.0,
|
|
"step": 22065
|
|
},
|
|
{
|
|
"entropy": 5.461179876327515,
|
|
"epoch": 1.7171367438241587,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.0004703645955140441,
|
|
"loss": 5.1521,
|
|
"mean_token_accuracy": 0.18562852144241332,
|
|
"num_tokens": 38297237.0,
|
|
"step": 22070
|
|
},
|
|
{
|
|
"entropy": 5.535586595535278,
|
|
"epoch": 1.7175257731958764,
|
|
"grad_norm": 1.671875,
|
|
"learning_rate": 0.00047035084538152815,
|
|
"loss": 5.2867,
|
|
"mean_token_accuracy": 0.17631856352090836,
|
|
"num_tokens": 38306582.0,
|
|
"step": 22075
|
|
},
|
|
{
|
|
"entropy": 5.492889356613159,
|
|
"epoch": 1.7179148025675939,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004703370922848742,
|
|
"loss": 5.088,
|
|
"mean_token_accuracy": 0.19182030111551285,
|
|
"num_tokens": 38315406.0,
|
|
"step": 22080
|
|
},
|
|
{
|
|
"entropy": 5.385633850097657,
|
|
"epoch": 1.7183038319393114,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.00047032333622429074,
|
|
"loss": 5.0737,
|
|
"mean_token_accuracy": 0.1865725800395012,
|
|
"num_tokens": 38324271.0,
|
|
"step": 22085
|
|
},
|
|
{
|
|
"entropy": 5.4675578594207765,
|
|
"epoch": 1.718692861311029,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.00047030957719998656,
|
|
"loss": 5.1864,
|
|
"mean_token_accuracy": 0.18055996745824815,
|
|
"num_tokens": 38332831.0,
|
|
"step": 22090
|
|
},
|
|
{
|
|
"entropy": 5.45624418258667,
|
|
"epoch": 1.7190818906827465,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0004702958152121704,
|
|
"loss": 5.0811,
|
|
"mean_token_accuracy": 0.1836458832025528,
|
|
"num_tokens": 38341263.0,
|
|
"step": 22095
|
|
},
|
|
{
|
|
"entropy": 5.50359787940979,
|
|
"epoch": 1.719470920054464,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0004702820502610511,
|
|
"loss": 5.2817,
|
|
"mean_token_accuracy": 0.1755241185426712,
|
|
"num_tokens": 38349890.0,
|
|
"step": 22100
|
|
},
|
|
{
|
|
"entropy": 5.379726934432983,
|
|
"epoch": 1.7198599494261817,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004702682823468375,
|
|
"loss": 5.0697,
|
|
"mean_token_accuracy": 0.18643116801977158,
|
|
"num_tokens": 38358071.0,
|
|
"step": 22105
|
|
},
|
|
{
|
|
"entropy": 5.51623911857605,
|
|
"epoch": 1.7202489787978994,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00047025451146973844,
|
|
"loss": 5.258,
|
|
"mean_token_accuracy": 0.1749507248401642,
|
|
"num_tokens": 38366859.0,
|
|
"step": 22110
|
|
},
|
|
{
|
|
"entropy": 5.63382396697998,
|
|
"epoch": 1.7206380081696167,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.00047024073762996305,
|
|
"loss": 5.3902,
|
|
"mean_token_accuracy": 0.16557009220123292,
|
|
"num_tokens": 38375897.0,
|
|
"step": 22115
|
|
},
|
|
{
|
|
"entropy": 5.532764434814453,
|
|
"epoch": 1.7210270375413343,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0004702269608277202,
|
|
"loss": 5.1786,
|
|
"mean_token_accuracy": 0.1866125464439392,
|
|
"num_tokens": 38384700.0,
|
|
"step": 22120
|
|
},
|
|
{
|
|
"entropy": 5.479254817962646,
|
|
"epoch": 1.721416066913052,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.0004702131810632189,
|
|
"loss": 5.2039,
|
|
"mean_token_accuracy": 0.18158965259790422,
|
|
"num_tokens": 38393212.0,
|
|
"step": 22125
|
|
},
|
|
{
|
|
"entropy": 5.438112497329712,
|
|
"epoch": 1.7218050962847695,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00047019939833666837,
|
|
"loss": 5.1248,
|
|
"mean_token_accuracy": 0.18704920411109924,
|
|
"num_tokens": 38401572.0,
|
|
"step": 22130
|
|
},
|
|
{
|
|
"entropy": 5.451372861862183,
|
|
"epoch": 1.722194125656487,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.0004701856126482776,
|
|
"loss": 5.1686,
|
|
"mean_token_accuracy": 0.18047335743904114,
|
|
"num_tokens": 38410669.0,
|
|
"step": 22135
|
|
},
|
|
{
|
|
"entropy": 5.439099597930908,
|
|
"epoch": 1.7225831550282047,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.0004701718239982559,
|
|
"loss": 5.1779,
|
|
"mean_token_accuracy": 0.1813839480280876,
|
|
"num_tokens": 38419038.0,
|
|
"step": 22140
|
|
},
|
|
{
|
|
"entropy": 5.4189269065856935,
|
|
"epoch": 1.7229721843999222,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.00047015803238681234,
|
|
"loss": 5.0914,
|
|
"mean_token_accuracy": 0.19410210847854614,
|
|
"num_tokens": 38427314.0,
|
|
"step": 22145
|
|
},
|
|
{
|
|
"entropy": 5.444206428527832,
|
|
"epoch": 1.7233612137716396,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0004701442378141563,
|
|
"loss": 5.0886,
|
|
"mean_token_accuracy": 0.18488903045654298,
|
|
"num_tokens": 38435373.0,
|
|
"step": 22150
|
|
},
|
|
{
|
|
"entropy": 5.4263427734375,
|
|
"epoch": 1.7237502431433573,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.000470130440280497,
|
|
"loss": 5.1363,
|
|
"mean_token_accuracy": 0.1891674965620041,
|
|
"num_tokens": 38444448.0,
|
|
"step": 22155
|
|
},
|
|
{
|
|
"entropy": 5.4646138668060305,
|
|
"epoch": 1.724139272515075,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004701166397860439,
|
|
"loss": 5.0608,
|
|
"mean_token_accuracy": 0.1896888643503189,
|
|
"num_tokens": 38453576.0,
|
|
"step": 22160
|
|
},
|
|
{
|
|
"entropy": 5.469957447052002,
|
|
"epoch": 1.7245283018867923,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.0004701028363310064,
|
|
"loss": 5.141,
|
|
"mean_token_accuracy": 0.18905406892299653,
|
|
"num_tokens": 38462848.0,
|
|
"step": 22165
|
|
},
|
|
{
|
|
"entropy": 5.383284235000611,
|
|
"epoch": 1.72491733125851,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.00047008902991559385,
|
|
"loss": 5.0852,
|
|
"mean_token_accuracy": 0.18901194930076598,
|
|
"num_tokens": 38470953.0,
|
|
"step": 22170
|
|
},
|
|
{
|
|
"entropy": 5.4624855518341064,
|
|
"epoch": 1.7253063606302277,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004700752205400158,
|
|
"loss": 5.2505,
|
|
"mean_token_accuracy": 0.1754434123635292,
|
|
"num_tokens": 38479835.0,
|
|
"step": 22175
|
|
},
|
|
{
|
|
"entropy": 5.503275585174561,
|
|
"epoch": 1.7256953900019452,
|
|
"grad_norm": 1.5,
|
|
"learning_rate": 0.00047006140820448174,
|
|
"loss": 5.1525,
|
|
"mean_token_accuracy": 0.17973658591508865,
|
|
"num_tokens": 38488342.0,
|
|
"step": 22180
|
|
},
|
|
{
|
|
"entropy": 5.495552206039429,
|
|
"epoch": 1.7260844193736626,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00047004759290920136,
|
|
"loss": 5.1872,
|
|
"mean_token_accuracy": 0.1793127626180649,
|
|
"num_tokens": 38496716.0,
|
|
"step": 22185
|
|
},
|
|
{
|
|
"entropy": 5.49908127784729,
|
|
"epoch": 1.7264734487453803,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0004700337746543841,
|
|
"loss": 5.2071,
|
|
"mean_token_accuracy": 0.17958493828773497,
|
|
"num_tokens": 38506615.0,
|
|
"step": 22190
|
|
},
|
|
{
|
|
"entropy": 5.378666067123413,
|
|
"epoch": 1.7268624781170978,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0004700199534402398,
|
|
"loss": 5.0086,
|
|
"mean_token_accuracy": 0.1907874435186386,
|
|
"num_tokens": 38515936.0,
|
|
"step": 22195
|
|
},
|
|
{
|
|
"entropy": 5.376315927505493,
|
|
"epoch": 1.7272515074888153,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0004700061292669781,
|
|
"loss": 5.1553,
|
|
"mean_token_accuracy": 0.18106213063001633,
|
|
"num_tokens": 38524829.0,
|
|
"step": 22200
|
|
},
|
|
{
|
|
"entropy": 5.551873874664307,
|
|
"epoch": 1.727640536860533,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0004699923021348088,
|
|
"loss": 5.2936,
|
|
"mean_token_accuracy": 0.16981442272663116,
|
|
"num_tokens": 38533686.0,
|
|
"step": 22205
|
|
},
|
|
{
|
|
"entropy": 5.548052072525024,
|
|
"epoch": 1.7280295662322507,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00046997847204394166,
|
|
"loss": 5.1834,
|
|
"mean_token_accuracy": 0.18329640328884125,
|
|
"num_tokens": 38542449.0,
|
|
"step": 22210
|
|
},
|
|
{
|
|
"entropy": 5.425648736953735,
|
|
"epoch": 1.728418595603968,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.00046996463899458653,
|
|
"loss": 5.1474,
|
|
"mean_token_accuracy": 0.18340075761079788,
|
|
"num_tokens": 38550888.0,
|
|
"step": 22215
|
|
},
|
|
{
|
|
"entropy": 5.430046558380127,
|
|
"epoch": 1.7288076249756856,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.0004699508029869533,
|
|
"loss": 5.1861,
|
|
"mean_token_accuracy": 0.18463295102119445,
|
|
"num_tokens": 38559366.0,
|
|
"step": 22220
|
|
},
|
|
{
|
|
"entropy": 5.500632333755493,
|
|
"epoch": 1.7291966543474033,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.00046993696402125205,
|
|
"loss": 5.1922,
|
|
"mean_token_accuracy": 0.1893218770623207,
|
|
"num_tokens": 38567080.0,
|
|
"step": 22225
|
|
},
|
|
{
|
|
"entropy": 5.448725461959839,
|
|
"epoch": 1.7295856837191208,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0004699231220976925,
|
|
"loss": 5.186,
|
|
"mean_token_accuracy": 0.18618176877498627,
|
|
"num_tokens": 38575520.0,
|
|
"step": 22230
|
|
},
|
|
{
|
|
"entropy": 5.509118556976318,
|
|
"epoch": 1.7299747130908383,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0004699092772164849,
|
|
"loss": 5.2631,
|
|
"mean_token_accuracy": 0.16927947252988815,
|
|
"num_tokens": 38583974.0,
|
|
"step": 22235
|
|
},
|
|
{
|
|
"entropy": 5.421317195892334,
|
|
"epoch": 1.730363742462556,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0004698954293778392,
|
|
"loss": 5.1702,
|
|
"mean_token_accuracy": 0.18597484827041627,
|
|
"num_tokens": 38592677.0,
|
|
"step": 22240
|
|
},
|
|
{
|
|
"entropy": 5.46505069732666,
|
|
"epoch": 1.7307527718342735,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.00046988157858196555,
|
|
"loss": 5.0062,
|
|
"mean_token_accuracy": 0.19476415812969208,
|
|
"num_tokens": 38601342.0,
|
|
"step": 22245
|
|
},
|
|
{
|
|
"entropy": 5.497976541519165,
|
|
"epoch": 1.731141801205991,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.00046986772482907426,
|
|
"loss": 5.2943,
|
|
"mean_token_accuracy": 0.1689124211668968,
|
|
"num_tokens": 38610895.0,
|
|
"step": 22250
|
|
},
|
|
{
|
|
"entropy": 5.5042956352233885,
|
|
"epoch": 1.7315308305777086,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.0004698538681193754,
|
|
"loss": 5.2483,
|
|
"mean_token_accuracy": 0.1772924154996872,
|
|
"num_tokens": 38619059.0,
|
|
"step": 22255
|
|
},
|
|
{
|
|
"entropy": 5.535574102401734,
|
|
"epoch": 1.7319198599494263,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.00046984000845307907,
|
|
"loss": 5.1947,
|
|
"mean_token_accuracy": 0.18294396251440048,
|
|
"num_tokens": 38628084.0,
|
|
"step": 22260
|
|
},
|
|
{
|
|
"entropy": 5.429641675949097,
|
|
"epoch": 1.7323088893211438,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.00046982614583039584,
|
|
"loss": 5.1577,
|
|
"mean_token_accuracy": 0.18668740540742873,
|
|
"num_tokens": 38636205.0,
|
|
"step": 22265
|
|
},
|
|
{
|
|
"entropy": 5.38273057937622,
|
|
"epoch": 1.7326979186928613,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.0004698122802515359,
|
|
"loss": 5.1452,
|
|
"mean_token_accuracy": 0.17684746086597442,
|
|
"num_tokens": 38644583.0,
|
|
"step": 22270
|
|
},
|
|
{
|
|
"entropy": 5.440549755096436,
|
|
"epoch": 1.733086948064579,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0004697984117167097,
|
|
"loss": 5.1255,
|
|
"mean_token_accuracy": 0.1873730316758156,
|
|
"num_tokens": 38653517.0,
|
|
"step": 22275
|
|
},
|
|
{
|
|
"entropy": 5.437548112869263,
|
|
"epoch": 1.7334759774362964,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.00046978454022612767,
|
|
"loss": 5.1883,
|
|
"mean_token_accuracy": 0.18019161969423295,
|
|
"num_tokens": 38661926.0,
|
|
"step": 22280
|
|
},
|
|
{
|
|
"entropy": 5.490012121200562,
|
|
"epoch": 1.733865006808014,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.00046977066578000025,
|
|
"loss": 5.2804,
|
|
"mean_token_accuracy": 0.1795118570327759,
|
|
"num_tokens": 38671567.0,
|
|
"step": 22285
|
|
},
|
|
{
|
|
"entropy": 5.489447116851807,
|
|
"epoch": 1.7342540361797316,
|
|
"grad_norm": 1.8515625,
|
|
"learning_rate": 0.00046975678837853806,
|
|
"loss": 5.1571,
|
|
"mean_token_accuracy": 0.18748637437820434,
|
|
"num_tokens": 38680439.0,
|
|
"step": 22290
|
|
},
|
|
{
|
|
"entropy": 5.509334516525269,
|
|
"epoch": 1.734643065551449,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.00046974290802195156,
|
|
"loss": 5.2201,
|
|
"mean_token_accuracy": 0.18281150311231614,
|
|
"num_tokens": 38689168.0,
|
|
"step": 22295
|
|
},
|
|
{
|
|
"entropy": 5.525952291488648,
|
|
"epoch": 1.7350320949231666,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0004697290247104513,
|
|
"loss": 5.138,
|
|
"mean_token_accuracy": 0.18853412717580795,
|
|
"num_tokens": 38697592.0,
|
|
"step": 22300
|
|
},
|
|
{
|
|
"entropy": 5.422291326522827,
|
|
"epoch": 1.7354211242948843,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.00046971513844424814,
|
|
"loss": 5.186,
|
|
"mean_token_accuracy": 0.17944524586200714,
|
|
"num_tokens": 38705561.0,
|
|
"step": 22305
|
|
},
|
|
{
|
|
"entropy": 5.382885980606079,
|
|
"epoch": 1.735810153666602,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.00046970124922355265,
|
|
"loss": 5.1694,
|
|
"mean_token_accuracy": 0.18152492195367814,
|
|
"num_tokens": 38714694.0,
|
|
"step": 22310
|
|
},
|
|
{
|
|
"entropy": 5.43862133026123,
|
|
"epoch": 1.7361991830383194,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0004696873570485756,
|
|
"loss": 5.1343,
|
|
"mean_token_accuracy": 0.18580865412950515,
|
|
"num_tokens": 38722797.0,
|
|
"step": 22315
|
|
},
|
|
{
|
|
"entropy": 5.481307506561279,
|
|
"epoch": 1.736588212410037,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0004696734619195278,
|
|
"loss": 5.2189,
|
|
"mean_token_accuracy": 0.181018403172493,
|
|
"num_tokens": 38732076.0,
|
|
"step": 22320
|
|
},
|
|
{
|
|
"entropy": 5.53885235786438,
|
|
"epoch": 1.7369772417817546,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.00046965956383662,
|
|
"loss": 5.2166,
|
|
"mean_token_accuracy": 0.18667361736297608,
|
|
"num_tokens": 38740992.0,
|
|
"step": 22325
|
|
},
|
|
{
|
|
"entropy": 5.4700523853302006,
|
|
"epoch": 1.737366271153472,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.0004696456628000632,
|
|
"loss": 5.1772,
|
|
"mean_token_accuracy": 0.18716241121292115,
|
|
"num_tokens": 38749266.0,
|
|
"step": 22330
|
|
},
|
|
{
|
|
"entropy": 5.487962007522583,
|
|
"epoch": 1.7377553005251896,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.00046963175881006825,
|
|
"loss": 5.2716,
|
|
"mean_token_accuracy": 0.18032833337783813,
|
|
"num_tokens": 38757983.0,
|
|
"step": 22335
|
|
},
|
|
{
|
|
"entropy": 5.489951848983765,
|
|
"epoch": 1.7381443298969073,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0004696178518668462,
|
|
"loss": 5.0934,
|
|
"mean_token_accuracy": 0.19742371439933776,
|
|
"num_tokens": 38766258.0,
|
|
"step": 22340
|
|
},
|
|
{
|
|
"entropy": 5.472571516036988,
|
|
"epoch": 1.7385333592686247,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.00046960394197060804,
|
|
"loss": 5.2297,
|
|
"mean_token_accuracy": 0.1812346786260605,
|
|
"num_tokens": 38775105.0,
|
|
"step": 22345
|
|
},
|
|
{
|
|
"entropy": 5.497124814987183,
|
|
"epoch": 1.7389223886403422,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.00046959002912156473,
|
|
"loss": 5.2218,
|
|
"mean_token_accuracy": 0.18146286010742188,
|
|
"num_tokens": 38783415.0,
|
|
"step": 22350
|
|
},
|
|
{
|
|
"entropy": 5.467630338668823,
|
|
"epoch": 1.73931141801206,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0004695761133199275,
|
|
"loss": 5.2208,
|
|
"mean_token_accuracy": 0.1822282060980797,
|
|
"num_tokens": 38791703.0,
|
|
"step": 22355
|
|
},
|
|
{
|
|
"entropy": 5.454380512237549,
|
|
"epoch": 1.7397004473837776,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0004695621945659074,
|
|
"loss": 5.2371,
|
|
"mean_token_accuracy": 0.17642873525619507,
|
|
"num_tokens": 38800823.0,
|
|
"step": 22360
|
|
},
|
|
{
|
|
"entropy": 5.511862087249756,
|
|
"epoch": 1.740089476755495,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004695482728597157,
|
|
"loss": 5.1995,
|
|
"mean_token_accuracy": 0.17799396812915802,
|
|
"num_tokens": 38810607.0,
|
|
"step": 22365
|
|
},
|
|
{
|
|
"entropy": 5.450649213790894,
|
|
"epoch": 1.7404785061272126,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.00046953434820156363,
|
|
"loss": 5.1488,
|
|
"mean_token_accuracy": 0.1768909737467766,
|
|
"num_tokens": 38819288.0,
|
|
"step": 22370
|
|
},
|
|
{
|
|
"entropy": 5.422649717330932,
|
|
"epoch": 1.7408675354989303,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.0004695204205916624,
|
|
"loss": 5.1044,
|
|
"mean_token_accuracy": 0.18822149634361268,
|
|
"num_tokens": 38827791.0,
|
|
"step": 22375
|
|
},
|
|
{
|
|
"entropy": 5.476151323318481,
|
|
"epoch": 1.7412565648706477,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0004695064900302235,
|
|
"loss": 5.1562,
|
|
"mean_token_accuracy": 0.18575465828180313,
|
|
"num_tokens": 38836338.0,
|
|
"step": 22380
|
|
},
|
|
{
|
|
"entropy": 5.521825981140137,
|
|
"epoch": 1.7416455942423652,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.0004694925565174581,
|
|
"loss": 5.1047,
|
|
"mean_token_accuracy": 0.1829013481736183,
|
|
"num_tokens": 38844768.0,
|
|
"step": 22385
|
|
},
|
|
{
|
|
"entropy": 5.5273419380187985,
|
|
"epoch": 1.742034623614083,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.00046947862005357777,
|
|
"loss": 5.2643,
|
|
"mean_token_accuracy": 0.17570252120494842,
|
|
"num_tokens": 38854022.0,
|
|
"step": 22390
|
|
},
|
|
{
|
|
"entropy": 5.440276384353638,
|
|
"epoch": 1.7424236529858004,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0004694646806387939,
|
|
"loss": 5.1221,
|
|
"mean_token_accuracy": 0.1885112300515175,
|
|
"num_tokens": 38862035.0,
|
|
"step": 22395
|
|
},
|
|
{
|
|
"entropy": 5.470210266113281,
|
|
"epoch": 1.7428126823575179,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.0004694507382733181,
|
|
"loss": 5.1724,
|
|
"mean_token_accuracy": 0.18895844966173173,
|
|
"num_tokens": 38870762.0,
|
|
"step": 22400
|
|
},
|
|
{
|
|
"entropy": 5.469910335540772,
|
|
"epoch": 1.7432017117292355,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.0004694367929573618,
|
|
"loss": 5.1372,
|
|
"mean_token_accuracy": 0.18954809308052062,
|
|
"num_tokens": 38879791.0,
|
|
"step": 22405
|
|
},
|
|
{
|
|
"entropy": 5.534672546386719,
|
|
"epoch": 1.7435907411009532,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0004694228446911367,
|
|
"loss": 5.2769,
|
|
"mean_token_accuracy": 0.1763258919119835,
|
|
"num_tokens": 38889926.0,
|
|
"step": 22410
|
|
},
|
|
{
|
|
"entropy": 5.496361875534058,
|
|
"epoch": 1.7439797704726707,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0004694088934748542,
|
|
"loss": 5.1744,
|
|
"mean_token_accuracy": 0.18221628218889235,
|
|
"num_tokens": 38898428.0,
|
|
"step": 22415
|
|
},
|
|
{
|
|
"entropy": 5.418698072433472,
|
|
"epoch": 1.7443687998443882,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0004693949393087263,
|
|
"loss": 5.2042,
|
|
"mean_token_accuracy": 0.17764114439487458,
|
|
"num_tokens": 38906800.0,
|
|
"step": 22420
|
|
},
|
|
{
|
|
"entropy": 5.446313667297363,
|
|
"epoch": 1.744757829216106,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004693809821929647,
|
|
"loss": 5.1568,
|
|
"mean_token_accuracy": 0.18023986667394637,
|
|
"num_tokens": 38915947.0,
|
|
"step": 22425
|
|
},
|
|
{
|
|
"entropy": 5.581137800216675,
|
|
"epoch": 1.7451468585878234,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.000469367022127781,
|
|
"loss": 5.2197,
|
|
"mean_token_accuracy": 0.17630225867033006,
|
|
"num_tokens": 38924895.0,
|
|
"step": 22430
|
|
},
|
|
{
|
|
"entropy": 5.513008642196655,
|
|
"epoch": 1.7455358879595408,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.00046935305911338703,
|
|
"loss": 5.2205,
|
|
"mean_token_accuracy": 0.16947292983531953,
|
|
"num_tokens": 38933393.0,
|
|
"step": 22435
|
|
},
|
|
{
|
|
"entropy": 5.439327383041382,
|
|
"epoch": 1.7459249173312585,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004693390931499948,
|
|
"loss": 5.2036,
|
|
"mean_token_accuracy": 0.18419903218746186,
|
|
"num_tokens": 38942219.0,
|
|
"step": 22440
|
|
},
|
|
{
|
|
"entropy": 5.472254037857056,
|
|
"epoch": 1.7463139467029762,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.0004693251242378162,
|
|
"loss": 5.1478,
|
|
"mean_token_accuracy": 0.17509762644767762,
|
|
"num_tokens": 38950938.0,
|
|
"step": 22445
|
|
},
|
|
{
|
|
"entropy": 5.448265314102173,
|
|
"epoch": 1.7467029760746935,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00046931115237706304,
|
|
"loss": 5.1572,
|
|
"mean_token_accuracy": 0.1862674981355667,
|
|
"num_tokens": 38959805.0,
|
|
"step": 22450
|
|
},
|
|
{
|
|
"entropy": 5.4496852397918705,
|
|
"epoch": 1.7470920054464112,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004692971775679475,
|
|
"loss": 5.0675,
|
|
"mean_token_accuracy": 0.19268402755260466,
|
|
"num_tokens": 38968308.0,
|
|
"step": 22455
|
|
},
|
|
{
|
|
"entropy": 5.582467174530029,
|
|
"epoch": 1.7474810348181289,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.00046928319981068154,
|
|
"loss": 5.238,
|
|
"mean_token_accuracy": 0.17960563600063323,
|
|
"num_tokens": 38976409.0,
|
|
"step": 22460
|
|
},
|
|
{
|
|
"entropy": 5.424221611022949,
|
|
"epoch": 1.7478700641898464,
|
|
"grad_norm": 1.859375,
|
|
"learning_rate": 0.0004692692191054773,
|
|
"loss": 5.1557,
|
|
"mean_token_accuracy": 0.1855572283267975,
|
|
"num_tokens": 38985193.0,
|
|
"step": 22465
|
|
},
|
|
{
|
|
"entropy": 5.448609066009522,
|
|
"epoch": 1.7482590935615638,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0004692552354525468,
|
|
"loss": 5.1387,
|
|
"mean_token_accuracy": 0.18431031852960586,
|
|
"num_tokens": 38994141.0,
|
|
"step": 22470
|
|
},
|
|
{
|
|
"entropy": 5.497061252593994,
|
|
"epoch": 1.7486481229332815,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.0004692412488521023,
|
|
"loss": 5.3035,
|
|
"mean_token_accuracy": 0.17529143542051315,
|
|
"num_tokens": 39002953.0,
|
|
"step": 22475
|
|
},
|
|
{
|
|
"entropy": 5.525261068344117,
|
|
"epoch": 1.749037152304999,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.000469227259304356,
|
|
"loss": 5.2027,
|
|
"mean_token_accuracy": 0.1877537712454796,
|
|
"num_tokens": 39010672.0,
|
|
"step": 22480
|
|
},
|
|
{
|
|
"entropy": 5.445794296264649,
|
|
"epoch": 1.7494261816767165,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.00046921326680952023,
|
|
"loss": 5.2263,
|
|
"mean_token_accuracy": 0.17683114409446715,
|
|
"num_tokens": 39019677.0,
|
|
"step": 22485
|
|
},
|
|
{
|
|
"entropy": 5.476195907592773,
|
|
"epoch": 1.7498152110484342,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0004691992713678072,
|
|
"loss": 5.1795,
|
|
"mean_token_accuracy": 0.18174509704113007,
|
|
"num_tokens": 39028165.0,
|
|
"step": 22490
|
|
},
|
|
{
|
|
"entropy": 5.4098548412323,
|
|
"epoch": 1.7502042404201519,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0004691852729794293,
|
|
"loss": 5.1113,
|
|
"mean_token_accuracy": 0.183260016143322,
|
|
"num_tokens": 39037537.0,
|
|
"step": 22495
|
|
},
|
|
{
|
|
"entropy": 5.457123851776123,
|
|
"epoch": 1.7505932697918691,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0004691712716445991,
|
|
"loss": 5.128,
|
|
"mean_token_accuracy": 0.18350170850753783,
|
|
"num_tokens": 39045861.0,
|
|
"step": 22500
|
|
},
|
|
{
|
|
"entropy": 5.492616605758667,
|
|
"epoch": 1.7509822991635868,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0004691572673635288,
|
|
"loss": 5.1724,
|
|
"mean_token_accuracy": 0.1820408895611763,
|
|
"num_tokens": 39054526.0,
|
|
"step": 22505
|
|
},
|
|
{
|
|
"entropy": 5.482195949554443,
|
|
"epoch": 1.7513713285353045,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.000469143260136431,
|
|
"loss": 5.1717,
|
|
"mean_token_accuracy": 0.1777298390865326,
|
|
"num_tokens": 39063296.0,
|
|
"step": 22510
|
|
},
|
|
{
|
|
"entropy": 5.465510654449463,
|
|
"epoch": 1.751760357907022,
|
|
"grad_norm": 2.75,
|
|
"learning_rate": 0.0004691292499635183,
|
|
"loss": 5.089,
|
|
"mean_token_accuracy": 0.18384735137224198,
|
|
"num_tokens": 39071570.0,
|
|
"step": 22515
|
|
},
|
|
{
|
|
"entropy": 5.447725439071656,
|
|
"epoch": 1.7521493872787395,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0004691152368450032,
|
|
"loss": 5.1922,
|
|
"mean_token_accuracy": 0.1873163565993309,
|
|
"num_tokens": 39080798.0,
|
|
"step": 22520
|
|
},
|
|
{
|
|
"entropy": 5.456830835342407,
|
|
"epoch": 1.7525384166504572,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.00046910122078109835,
|
|
"loss": 5.1794,
|
|
"mean_token_accuracy": 0.1851043298840523,
|
|
"num_tokens": 39089572.0,
|
|
"step": 22525
|
|
},
|
|
{
|
|
"entropy": 5.577934455871582,
|
|
"epoch": 1.7529274460221747,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0004690872017720163,
|
|
"loss": 5.2744,
|
|
"mean_token_accuracy": 0.1779394656419754,
|
|
"num_tokens": 39098391.0,
|
|
"step": 22530
|
|
},
|
|
{
|
|
"entropy": 5.485655307769775,
|
|
"epoch": 1.7533164753938921,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.00046907317981797006,
|
|
"loss": 5.2171,
|
|
"mean_token_accuracy": 0.17790737748146057,
|
|
"num_tokens": 39106892.0,
|
|
"step": 22535
|
|
},
|
|
{
|
|
"entropy": 5.4796693325042725,
|
|
"epoch": 1.7537055047656098,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.00046905915491917213,
|
|
"loss": 5.1559,
|
|
"mean_token_accuracy": 0.18388474285602568,
|
|
"num_tokens": 39115635.0,
|
|
"step": 22540
|
|
},
|
|
{
|
|
"entropy": 5.530629110336304,
|
|
"epoch": 1.7540945341373275,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0004690451270758354,
|
|
"loss": 5.1668,
|
|
"mean_token_accuracy": 0.17807382494211196,
|
|
"num_tokens": 39123665.0,
|
|
"step": 22545
|
|
},
|
|
{
|
|
"entropy": 5.546247386932373,
|
|
"epoch": 1.7544835635090448,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00046903109628817276,
|
|
"loss": 5.2232,
|
|
"mean_token_accuracy": 0.17503586411476135,
|
|
"num_tokens": 39132727.0,
|
|
"step": 22550
|
|
},
|
|
{
|
|
"entropy": 5.4609537601470945,
|
|
"epoch": 1.7548725928807625,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.00046901706255639703,
|
|
"loss": 5.2015,
|
|
"mean_token_accuracy": 0.17819113582372664,
|
|
"num_tokens": 39140814.0,
|
|
"step": 22555
|
|
},
|
|
{
|
|
"entropy": 5.524260759353638,
|
|
"epoch": 1.7552616222524802,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0004690030258807212,
|
|
"loss": 5.2671,
|
|
"mean_token_accuracy": 0.17636601626873016,
|
|
"num_tokens": 39149877.0,
|
|
"step": 22560
|
|
},
|
|
{
|
|
"entropy": 5.465193414688111,
|
|
"epoch": 1.7556506516241976,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.00046898898626135827,
|
|
"loss": 5.1982,
|
|
"mean_token_accuracy": 0.1805619105696678,
|
|
"num_tokens": 39158698.0,
|
|
"step": 22565
|
|
},
|
|
{
|
|
"entropy": 5.430248975753784,
|
|
"epoch": 1.7560396809959151,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.0004689749436985211,
|
|
"loss": 5.1061,
|
|
"mean_token_accuracy": 0.1895295962691307,
|
|
"num_tokens": 39167546.0,
|
|
"step": 22570
|
|
},
|
|
{
|
|
"entropy": 5.504935455322266,
|
|
"epoch": 1.7564287103676328,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.00046896089819242304,
|
|
"loss": 5.1701,
|
|
"mean_token_accuracy": 0.17628379613161088,
|
|
"num_tokens": 39176547.0,
|
|
"step": 22575
|
|
},
|
|
{
|
|
"entropy": 5.560612297058105,
|
|
"epoch": 1.7568177397393503,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.0004689468497432771,
|
|
"loss": 5.1762,
|
|
"mean_token_accuracy": 0.18397220671176912,
|
|
"num_tokens": 39185273.0,
|
|
"step": 22580
|
|
},
|
|
{
|
|
"entropy": 5.516317844390869,
|
|
"epoch": 1.7572067691110678,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.0004689327983512963,
|
|
"loss": 5.152,
|
|
"mean_token_accuracy": 0.18340541869401933,
|
|
"num_tokens": 39194204.0,
|
|
"step": 22585
|
|
},
|
|
{
|
|
"entropy": 5.453921985626221,
|
|
"epoch": 1.7575957984827855,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.00046891874401669404,
|
|
"loss": 5.1039,
|
|
"mean_token_accuracy": 0.18791799545288085,
|
|
"num_tokens": 39202951.0,
|
|
"step": 22590
|
|
},
|
|
{
|
|
"entropy": 5.369445085525513,
|
|
"epoch": 1.7579848278545032,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0004689046867396834,
|
|
"loss": 5.1516,
|
|
"mean_token_accuracy": 0.18200442045927048,
|
|
"num_tokens": 39211508.0,
|
|
"step": 22595
|
|
},
|
|
{
|
|
"entropy": 5.524729013442993,
|
|
"epoch": 1.7583738572262204,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0004688906265204779,
|
|
"loss": 5.1997,
|
|
"mean_token_accuracy": 0.17682316303253173,
|
|
"num_tokens": 39219804.0,
|
|
"step": 22600
|
|
},
|
|
{
|
|
"entropy": 5.563323211669922,
|
|
"epoch": 1.7587628865979381,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.0004688765633592907,
|
|
"loss": 5.2422,
|
|
"mean_token_accuracy": 0.17577288299798965,
|
|
"num_tokens": 39228204.0,
|
|
"step": 22605
|
|
},
|
|
{
|
|
"entropy": 5.471670484542846,
|
|
"epoch": 1.7591519159696558,
|
|
"grad_norm": 1.5859375,
|
|
"learning_rate": 0.0004688624972563352,
|
|
"loss": 5.1546,
|
|
"mean_token_accuracy": 0.17827369421720504,
|
|
"num_tokens": 39237003.0,
|
|
"step": 22610
|
|
},
|
|
{
|
|
"entropy": 5.396750783920288,
|
|
"epoch": 1.7595409453413733,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.0004688484282118249,
|
|
"loss": 5.134,
|
|
"mean_token_accuracy": 0.17877383679151534,
|
|
"num_tokens": 39245636.0,
|
|
"step": 22615
|
|
},
|
|
{
|
|
"entropy": 5.40052342414856,
|
|
"epoch": 1.7599299747130908,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0004688343562259732,
|
|
"loss": 4.9863,
|
|
"mean_token_accuracy": 0.19137980192899703,
|
|
"num_tokens": 39254288.0,
|
|
"step": 22620
|
|
},
|
|
{
|
|
"entropy": 5.5003986835479735,
|
|
"epoch": 1.7603190040848085,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.0004688202812989937,
|
|
"loss": 5.2089,
|
|
"mean_token_accuracy": 0.18283996284008025,
|
|
"num_tokens": 39263217.0,
|
|
"step": 22625
|
|
},
|
|
{
|
|
"entropy": 5.404484367370605,
|
|
"epoch": 1.760708033456526,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0004688062034311,
|
|
"loss": 5.1637,
|
|
"mean_token_accuracy": 0.18608333319425582,
|
|
"num_tokens": 39271240.0,
|
|
"step": 22630
|
|
},
|
|
{
|
|
"entropy": 5.4020905017852785,
|
|
"epoch": 1.7610970628282434,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.00046879212262250546,
|
|
"loss": 5.0993,
|
|
"mean_token_accuracy": 0.19059553891420364,
|
|
"num_tokens": 39279665.0,
|
|
"step": 22635
|
|
},
|
|
{
|
|
"entropy": 5.466123342514038,
|
|
"epoch": 1.761486092199961,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.00046877803887342406,
|
|
"loss": 5.2848,
|
|
"mean_token_accuracy": 0.1789517104625702,
|
|
"num_tokens": 39287975.0,
|
|
"step": 22640
|
|
},
|
|
{
|
|
"entropy": 5.544944620132446,
|
|
"epoch": 1.7618751215716788,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.0004687639521840693,
|
|
"loss": 5.24,
|
|
"mean_token_accuracy": 0.1780037373304367,
|
|
"num_tokens": 39296541.0,
|
|
"step": 22645
|
|
},
|
|
{
|
|
"entropy": 5.516239881515503,
|
|
"epoch": 1.7622641509433963,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.00046874986255465495,
|
|
"loss": 5.1054,
|
|
"mean_token_accuracy": 0.18752430826425553,
|
|
"num_tokens": 39304710.0,
|
|
"step": 22650
|
|
},
|
|
{
|
|
"entropy": 5.431145858764649,
|
|
"epoch": 1.7626531803151138,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.00046873576998539485,
|
|
"loss": 5.0845,
|
|
"mean_token_accuracy": 0.18629807531833648,
|
|
"num_tokens": 39313236.0,
|
|
"step": 22655
|
|
},
|
|
{
|
|
"entropy": 5.375265502929688,
|
|
"epoch": 1.7630422096868315,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004687216744765028,
|
|
"loss": 5.0045,
|
|
"mean_token_accuracy": 0.19502213150262832,
|
|
"num_tokens": 39322656.0,
|
|
"step": 22660
|
|
},
|
|
{
|
|
"entropy": 5.437173509597779,
|
|
"epoch": 1.763431239058549,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0004687075760281927,
|
|
"loss": 5.1022,
|
|
"mean_token_accuracy": 0.19160324484109878,
|
|
"num_tokens": 39331074.0,
|
|
"step": 22665
|
|
},
|
|
{
|
|
"entropy": 5.433528470993042,
|
|
"epoch": 1.7638202684302664,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.0004686934746406784,
|
|
"loss": 5.1582,
|
|
"mean_token_accuracy": 0.1809625968337059,
|
|
"num_tokens": 39339450.0,
|
|
"step": 22670
|
|
},
|
|
{
|
|
"entropy": 5.529172611236572,
|
|
"epoch": 1.764209297801984,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.00046867937031417397,
|
|
"loss": 5.2359,
|
|
"mean_token_accuracy": 0.18689853698015213,
|
|
"num_tokens": 39347270.0,
|
|
"step": 22675
|
|
},
|
|
{
|
|
"entropy": 5.480555820465088,
|
|
"epoch": 1.7645983271737016,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0004686652630488933,
|
|
"loss": 5.161,
|
|
"mean_token_accuracy": 0.18236614316701888,
|
|
"num_tokens": 39355853.0,
|
|
"step": 22680
|
|
},
|
|
{
|
|
"entropy": 5.384286308288575,
|
|
"epoch": 1.764987356545419,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.00046865115284505063,
|
|
"loss": 5.0699,
|
|
"mean_token_accuracy": 0.19774107486009598,
|
|
"num_tokens": 39364160.0,
|
|
"step": 22685
|
|
},
|
|
{
|
|
"entropy": 5.449788188934326,
|
|
"epoch": 1.7653763859171367,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 0.00046863703970285986,
|
|
"loss": 5.1468,
|
|
"mean_token_accuracy": 0.19034121930599213,
|
|
"num_tokens": 39372504.0,
|
|
"step": 22690
|
|
},
|
|
{
|
|
"entropy": 5.472116088867187,
|
|
"epoch": 1.7657654152888544,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0004686229236225352,
|
|
"loss": 5.1528,
|
|
"mean_token_accuracy": 0.18396700769662858,
|
|
"num_tokens": 39380883.0,
|
|
"step": 22695
|
|
},
|
|
{
|
|
"entropy": 5.570156908035278,
|
|
"epoch": 1.766154444660572,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0004686088046042909,
|
|
"loss": 5.235,
|
|
"mean_token_accuracy": 0.17422347366809846,
|
|
"num_tokens": 39389943.0,
|
|
"step": 22700
|
|
},
|
|
{
|
|
"entropy": 5.425736045837402,
|
|
"epoch": 1.7665434740322894,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00046859468264834114,
|
|
"loss": 5.1619,
|
|
"mean_token_accuracy": 0.18831947296857834,
|
|
"num_tokens": 39398919.0,
|
|
"step": 22705
|
|
},
|
|
{
|
|
"entropy": 5.48894419670105,
|
|
"epoch": 1.766932503404007,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.00046858055775490017,
|
|
"loss": 5.234,
|
|
"mean_token_accuracy": 0.18076644241809844,
|
|
"num_tokens": 39407547.0,
|
|
"step": 22710
|
|
},
|
|
{
|
|
"entropy": 5.474356985092163,
|
|
"epoch": 1.7673215327757246,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.0004685664299241825,
|
|
"loss": 5.0577,
|
|
"mean_token_accuracy": 0.18891118168830873,
|
|
"num_tokens": 39416264.0,
|
|
"step": 22715
|
|
},
|
|
{
|
|
"entropy": 5.399944067001343,
|
|
"epoch": 1.767710562147442,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0004685522991564022,
|
|
"loss": 5.1063,
|
|
"mean_token_accuracy": 0.18270018696784973,
|
|
"num_tokens": 39424104.0,
|
|
"step": 22720
|
|
},
|
|
{
|
|
"entropy": 5.489658784866333,
|
|
"epoch": 1.7680995915191597,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0004685381654517738,
|
|
"loss": 5.2011,
|
|
"mean_token_accuracy": 0.1806568458676338,
|
|
"num_tokens": 39432443.0,
|
|
"step": 22725
|
|
},
|
|
{
|
|
"entropy": 5.435421180725098,
|
|
"epoch": 1.7684886208908772,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.0004685240288105119,
|
|
"loss": 5.1402,
|
|
"mean_token_accuracy": 0.1829176977276802,
|
|
"num_tokens": 39441620.0,
|
|
"step": 22730
|
|
},
|
|
{
|
|
"entropy": 5.435894727706909,
|
|
"epoch": 1.7688776502625947,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.00046850988923283085,
|
|
"loss": 5.1162,
|
|
"mean_token_accuracy": 0.18494036048650742,
|
|
"num_tokens": 39449854.0,
|
|
"step": 22735
|
|
},
|
|
{
|
|
"entropy": 5.464275789260864,
|
|
"epoch": 1.7692666796343124,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.00046849574671894523,
|
|
"loss": 5.1917,
|
|
"mean_token_accuracy": 0.18091578930616378,
|
|
"num_tokens": 39458496.0,
|
|
"step": 22740
|
|
},
|
|
{
|
|
"entropy": 5.536469984054565,
|
|
"epoch": 1.76965570900603,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.00046848160126906956,
|
|
"loss": 5.218,
|
|
"mean_token_accuracy": 0.18141041100025176,
|
|
"num_tokens": 39466545.0,
|
|
"step": 22745
|
|
},
|
|
{
|
|
"entropy": 5.491134834289551,
|
|
"epoch": 1.7700447383777476,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0004684674528834186,
|
|
"loss": 5.2034,
|
|
"mean_token_accuracy": 0.17925085872411728,
|
|
"num_tokens": 39475771.0,
|
|
"step": 22750
|
|
},
|
|
{
|
|
"entropy": 5.4805052280426025,
|
|
"epoch": 1.770433767749465,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 0.00046845330156220703,
|
|
"loss": 5.2074,
|
|
"mean_token_accuracy": 0.17984407693147658,
|
|
"num_tokens": 39484244.0,
|
|
"step": 22755
|
|
},
|
|
{
|
|
"entropy": 5.562279891967774,
|
|
"epoch": 1.7708227971211827,
|
|
"grad_norm": 1.828125,
|
|
"learning_rate": 0.0004684391473056495,
|
|
"loss": 5.2381,
|
|
"mean_token_accuracy": 0.17516525238752365,
|
|
"num_tokens": 39493138.0,
|
|
"step": 22760
|
|
},
|
|
{
|
|
"entropy": 5.562649917602539,
|
|
"epoch": 1.7712118264929002,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.00046842499011396076,
|
|
"loss": 5.203,
|
|
"mean_token_accuracy": 0.17877228260040284,
|
|
"num_tokens": 39502065.0,
|
|
"step": 22765
|
|
},
|
|
{
|
|
"entropy": 5.480378675460815,
|
|
"epoch": 1.7716008558646177,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.00046841082998735575,
|
|
"loss": 5.1608,
|
|
"mean_token_accuracy": 0.1889510601758957,
|
|
"num_tokens": 39510095.0,
|
|
"step": 22770
|
|
},
|
|
{
|
|
"entropy": 5.428599834442139,
|
|
"epoch": 1.7719898852363354,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00046839666692604916,
|
|
"loss": 5.2213,
|
|
"mean_token_accuracy": 0.18181411176919937,
|
|
"num_tokens": 39518104.0,
|
|
"step": 22775
|
|
},
|
|
{
|
|
"entropy": 5.523396396636963,
|
|
"epoch": 1.7723789146080529,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.000468382500930256,
|
|
"loss": 5.2059,
|
|
"mean_token_accuracy": 0.17685447186231612,
|
|
"num_tokens": 39526768.0,
|
|
"step": 22780
|
|
},
|
|
{
|
|
"entropy": 5.4961020946502686,
|
|
"epoch": 1.7727679439797703,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.00046836833200019116,
|
|
"loss": 5.1387,
|
|
"mean_token_accuracy": 0.18078558146953583,
|
|
"num_tokens": 39535847.0,
|
|
"step": 22785
|
|
},
|
|
{
|
|
"entropy": 5.525657987594604,
|
|
"epoch": 1.773156973351488,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.0004683541601360697,
|
|
"loss": 5.1987,
|
|
"mean_token_accuracy": 0.18961230665445328,
|
|
"num_tokens": 39544364.0,
|
|
"step": 22790
|
|
},
|
|
{
|
|
"entropy": 5.4946812152862545,
|
|
"epoch": 1.7735460027232057,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00046833998533810653,
|
|
"loss": 5.2137,
|
|
"mean_token_accuracy": 0.17819977849721907,
|
|
"num_tokens": 39552733.0,
|
|
"step": 22795
|
|
},
|
|
{
|
|
"entropy": 5.508381462097168,
|
|
"epoch": 1.7739350320949232,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0004683258076065169,
|
|
"loss": 5.1759,
|
|
"mean_token_accuracy": 0.17987517267465591,
|
|
"num_tokens": 39561580.0,
|
|
"step": 22800
|
|
},
|
|
{
|
|
"entropy": 5.407007646560669,
|
|
"epoch": 1.7743240614666407,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00046831162694151586,
|
|
"loss": 5.1367,
|
|
"mean_token_accuracy": 0.18430044054985045,
|
|
"num_tokens": 39570283.0,
|
|
"step": 22805
|
|
},
|
|
{
|
|
"entropy": 5.5113321304321286,
|
|
"epoch": 1.7747130908383584,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.00046829744334331855,
|
|
"loss": 5.1196,
|
|
"mean_token_accuracy": 0.18668840676546097,
|
|
"num_tokens": 39578835.0,
|
|
"step": 22810
|
|
},
|
|
{
|
|
"entropy": 5.451277732849121,
|
|
"epoch": 1.7751021202100759,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00046828325681214013,
|
|
"loss": 5.187,
|
|
"mean_token_accuracy": 0.1855984792113304,
|
|
"num_tokens": 39587053.0,
|
|
"step": 22815
|
|
},
|
|
{
|
|
"entropy": 5.472503280639648,
|
|
"epoch": 1.7754911495817933,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.000468269067348196,
|
|
"loss": 5.2854,
|
|
"mean_token_accuracy": 0.1653962567448616,
|
|
"num_tokens": 39595799.0,
|
|
"step": 22820
|
|
},
|
|
{
|
|
"entropy": 5.527693176269532,
|
|
"epoch": 1.775880178953511,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004682548749517014,
|
|
"loss": 5.1206,
|
|
"mean_token_accuracy": 0.18749001175165175,
|
|
"num_tokens": 39604248.0,
|
|
"step": 22825
|
|
},
|
|
{
|
|
"entropy": 5.420598936080933,
|
|
"epoch": 1.7762692083252287,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.00046824067962287163,
|
|
"loss": 5.1329,
|
|
"mean_token_accuracy": 0.19047351479530333,
|
|
"num_tokens": 39612690.0,
|
|
"step": 22830
|
|
},
|
|
{
|
|
"entropy": 5.467026805877685,
|
|
"epoch": 1.776658237696946,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0004682264813619221,
|
|
"loss": 5.1724,
|
|
"mean_token_accuracy": 0.17975070774555207,
|
|
"num_tokens": 39621784.0,
|
|
"step": 22835
|
|
},
|
|
{
|
|
"entropy": 5.494018983840943,
|
|
"epoch": 1.7770472670686637,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.00046821228016906836,
|
|
"loss": 5.1011,
|
|
"mean_token_accuracy": 0.1851718991994858,
|
|
"num_tokens": 39630455.0,
|
|
"step": 22840
|
|
},
|
|
{
|
|
"entropy": 5.41602783203125,
|
|
"epoch": 1.7774362964403814,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0004681980760445257,
|
|
"loss": 5.1147,
|
|
"mean_token_accuracy": 0.18482033908367157,
|
|
"num_tokens": 39639017.0,
|
|
"step": 22845
|
|
},
|
|
{
|
|
"entropy": 5.436076498031616,
|
|
"epoch": 1.7778253258120988,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0004681838689885098,
|
|
"loss": 5.0528,
|
|
"mean_token_accuracy": 0.18649808168411255,
|
|
"num_tokens": 39648083.0,
|
|
"step": 22850
|
|
},
|
|
{
|
|
"entropy": 5.3794517993927,
|
|
"epoch": 1.7782143551838163,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0004681696590012362,
|
|
"loss": 5.1528,
|
|
"mean_token_accuracy": 0.18833263516426085,
|
|
"num_tokens": 39656887.0,
|
|
"step": 22855
|
|
},
|
|
{
|
|
"entropy": 5.434454488754272,
|
|
"epoch": 1.778603384555534,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.00046815544608292043,
|
|
"loss": 5.1838,
|
|
"mean_token_accuracy": 0.18591940104961396,
|
|
"num_tokens": 39665658.0,
|
|
"step": 22860
|
|
},
|
|
{
|
|
"entropy": 5.456992769241333,
|
|
"epoch": 1.7789924139272515,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.0004681412302337782,
|
|
"loss": 5.1554,
|
|
"mean_token_accuracy": 0.1857403412461281,
|
|
"num_tokens": 39673423.0,
|
|
"step": 22865
|
|
},
|
|
{
|
|
"entropy": 5.4903497219085695,
|
|
"epoch": 1.779381443298969,
|
|
"grad_norm": 1.765625,
|
|
"learning_rate": 0.0004681270114540252,
|
|
"loss": 5.1781,
|
|
"mean_token_accuracy": 0.18412014544010163,
|
|
"num_tokens": 39682382.0,
|
|
"step": 22870
|
|
},
|
|
{
|
|
"entropy": 5.48302116394043,
|
|
"epoch": 1.7797704726706867,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.0004681127897438772,
|
|
"loss": 5.2308,
|
|
"mean_token_accuracy": 0.18164049834012985,
|
|
"num_tokens": 39691089.0,
|
|
"step": 22875
|
|
},
|
|
{
|
|
"entropy": 5.518176603317261,
|
|
"epoch": 1.7801595020424044,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.00046809856510355007,
|
|
"loss": 5.2914,
|
|
"mean_token_accuracy": 0.1750357374548912,
|
|
"num_tokens": 39700888.0,
|
|
"step": 22880
|
|
},
|
|
{
|
|
"entropy": 5.548483085632324,
|
|
"epoch": 1.7805485314141216,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0004680843375332595,
|
|
"loss": 5.187,
|
|
"mean_token_accuracy": 0.18636061549186705,
|
|
"num_tokens": 39708515.0,
|
|
"step": 22885
|
|
},
|
|
{
|
|
"entropy": 5.3951116561889645,
|
|
"epoch": 1.7809375607858393,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00046807010703322143,
|
|
"loss": 5.0662,
|
|
"mean_token_accuracy": 0.1868024855852127,
|
|
"num_tokens": 39716790.0,
|
|
"step": 22890
|
|
},
|
|
{
|
|
"entropy": 5.494457101821899,
|
|
"epoch": 1.781326590157557,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0004680558736036518,
|
|
"loss": 5.1425,
|
|
"mean_token_accuracy": 0.18425453305244446,
|
|
"num_tokens": 39726292.0,
|
|
"step": 22895
|
|
},
|
|
{
|
|
"entropy": 5.426535129547119,
|
|
"epoch": 1.7817156195292745,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0004680416372447666,
|
|
"loss": 5.1467,
|
|
"mean_token_accuracy": 0.1849789336323738,
|
|
"num_tokens": 39735222.0,
|
|
"step": 22900
|
|
},
|
|
{
|
|
"entropy": 5.4760654926300045,
|
|
"epoch": 1.782104648900992,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00046802739795678177,
|
|
"loss": 5.1967,
|
|
"mean_token_accuracy": 0.179933562874794,
|
|
"num_tokens": 39744619.0,
|
|
"step": 22905
|
|
},
|
|
{
|
|
"entropy": 5.505257034301758,
|
|
"epoch": 1.7824936782727097,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.00046801315573991346,
|
|
"loss": 5.19,
|
|
"mean_token_accuracy": 0.18137858659029008,
|
|
"num_tokens": 39752394.0,
|
|
"step": 22910
|
|
},
|
|
{
|
|
"entropy": 5.416035461425781,
|
|
"epoch": 1.7828827076444271,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.00046799891059437764,
|
|
"loss": 5.0801,
|
|
"mean_token_accuracy": 0.18927078545093537,
|
|
"num_tokens": 39760529.0,
|
|
"step": 22915
|
|
},
|
|
{
|
|
"entropy": 5.486957836151123,
|
|
"epoch": 1.7832717370161446,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00046798466252039056,
|
|
"loss": 5.2309,
|
|
"mean_token_accuracy": 0.18162210285663605,
|
|
"num_tokens": 39768231.0,
|
|
"step": 22920
|
|
},
|
|
{
|
|
"entropy": 5.543147993087769,
|
|
"epoch": 1.7836607663878623,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.00046797041151816845,
|
|
"loss": 5.3027,
|
|
"mean_token_accuracy": 0.1780250146985054,
|
|
"num_tokens": 39776773.0,
|
|
"step": 22925
|
|
},
|
|
{
|
|
"entropy": 5.5221508026123045,
|
|
"epoch": 1.78404979575958,
|
|
"grad_norm": 1.609375,
|
|
"learning_rate": 0.00046795615758792747,
|
|
"loss": 5.1502,
|
|
"mean_token_accuracy": 0.1803600937128067,
|
|
"num_tokens": 39785248.0,
|
|
"step": 22930
|
|
},
|
|
{
|
|
"entropy": 5.446562242507935,
|
|
"epoch": 1.7844388251312973,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0004679419007298839,
|
|
"loss": 5.1383,
|
|
"mean_token_accuracy": 0.18397189825773239,
|
|
"num_tokens": 39794794.0,
|
|
"step": 22935
|
|
},
|
|
{
|
|
"entropy": 5.47264723777771,
|
|
"epoch": 1.784827854503015,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0004679276409442541,
|
|
"loss": 5.1444,
|
|
"mean_token_accuracy": 0.1756580263376236,
|
|
"num_tokens": 39803662.0,
|
|
"step": 22940
|
|
},
|
|
{
|
|
"entropy": 5.513913249969482,
|
|
"epoch": 1.7852168838747327,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0004679133782312544,
|
|
"loss": 5.16,
|
|
"mean_token_accuracy": 0.1823689267039299,
|
|
"num_tokens": 39812189.0,
|
|
"step": 22945
|
|
},
|
|
{
|
|
"entropy": 5.499375247955323,
|
|
"epoch": 1.7856059132464501,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0004678991125911013,
|
|
"loss": 5.2002,
|
|
"mean_token_accuracy": 0.18524016588926315,
|
|
"num_tokens": 39820831.0,
|
|
"step": 22950
|
|
},
|
|
{
|
|
"entropy": 5.399232196807861,
|
|
"epoch": 1.7859949426181676,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004678848440240111,
|
|
"loss": 5.0381,
|
|
"mean_token_accuracy": 0.19027311056852342,
|
|
"num_tokens": 39829380.0,
|
|
"step": 22955
|
|
},
|
|
{
|
|
"entropy": 5.417461967468261,
|
|
"epoch": 1.7863839719898853,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0004678705725302005,
|
|
"loss": 5.187,
|
|
"mean_token_accuracy": 0.18635341376066208,
|
|
"num_tokens": 39838243.0,
|
|
"step": 22960
|
|
},
|
|
{
|
|
"entropy": 5.502604007720947,
|
|
"epoch": 1.7867730013616028,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0004678562981098859,
|
|
"loss": 5.1505,
|
|
"mean_token_accuracy": 0.1806425005197525,
|
|
"num_tokens": 39846885.0,
|
|
"step": 22965
|
|
},
|
|
{
|
|
"entropy": 5.473308849334717,
|
|
"epoch": 1.7871620307333203,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.00046784202076328394,
|
|
"loss": 5.1172,
|
|
"mean_token_accuracy": 0.18801402151584626,
|
|
"num_tokens": 39855337.0,
|
|
"step": 22970
|
|
},
|
|
{
|
|
"entropy": 5.411801958084107,
|
|
"epoch": 1.787551060105038,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.00046782774049061124,
|
|
"loss": 5.1778,
|
|
"mean_token_accuracy": 0.18863185048103331,
|
|
"num_tokens": 39864606.0,
|
|
"step": 22975
|
|
},
|
|
{
|
|
"entropy": 5.539475297927856,
|
|
"epoch": 1.7879400894767556,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004678134572920845,
|
|
"loss": 5.1675,
|
|
"mean_token_accuracy": 0.1811738759279251,
|
|
"num_tokens": 39872621.0,
|
|
"step": 22980
|
|
},
|
|
{
|
|
"entropy": 5.4153773307800295,
|
|
"epoch": 1.788329118848473,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004677991711679204,
|
|
"loss": 5.1445,
|
|
"mean_token_accuracy": 0.18738404661417007,
|
|
"num_tokens": 39880525.0,
|
|
"step": 22985
|
|
},
|
|
{
|
|
"entropy": 5.436581468582153,
|
|
"epoch": 1.7887181482201906,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.00046778488211833585,
|
|
"loss": 5.0809,
|
|
"mean_token_accuracy": 0.18787101060152053,
|
|
"num_tokens": 39889541.0,
|
|
"step": 22990
|
|
},
|
|
{
|
|
"entropy": 5.467618560791015,
|
|
"epoch": 1.7891071775919083,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004677705901435475,
|
|
"loss": 5.1354,
|
|
"mean_token_accuracy": 0.18369927108287812,
|
|
"num_tokens": 39897682.0,
|
|
"step": 22995
|
|
},
|
|
{
|
|
"entropy": 5.467347478866577,
|
|
"epoch": 1.7894962069636258,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0004677562952437723,
|
|
"loss": 5.1629,
|
|
"mean_token_accuracy": 0.1793891966342926,
|
|
"num_tokens": 39906656.0,
|
|
"step": 23000
|
|
},
|
|
{
|
|
"entropy": 5.481303644180298,
|
|
"epoch": 1.7898852363353432,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.00046774199741922705,
|
|
"loss": 5.2258,
|
|
"mean_token_accuracy": 0.1815507560968399,
|
|
"num_tokens": 39915202.0,
|
|
"step": 23005
|
|
},
|
|
{
|
|
"entropy": 5.434485626220703,
|
|
"epoch": 1.790274265707061,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.00046772769667012884,
|
|
"loss": 5.1053,
|
|
"mean_token_accuracy": 0.1826663002371788,
|
|
"num_tokens": 39923510.0,
|
|
"step": 23010
|
|
},
|
|
{
|
|
"entropy": 5.390435743331909,
|
|
"epoch": 1.7906632950787784,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004677133929966946,
|
|
"loss": 5.1322,
|
|
"mean_token_accuracy": 0.19109075218439103,
|
|
"num_tokens": 39932468.0,
|
|
"step": 23015
|
|
},
|
|
{
|
|
"entropy": 5.513824367523194,
|
|
"epoch": 1.791052324450496,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.00046769908639914134,
|
|
"loss": 5.2302,
|
|
"mean_token_accuracy": 0.18118311017751693,
|
|
"num_tokens": 39942758.0,
|
|
"step": 23020
|
|
},
|
|
{
|
|
"entropy": 5.556228733062744,
|
|
"epoch": 1.7914413538222136,
|
|
"grad_norm": 1.4921875,
|
|
"learning_rate": 0.0004676847768776861,
|
|
"loss": 5.2084,
|
|
"mean_token_accuracy": 0.18083118498325348,
|
|
"num_tokens": 39950829.0,
|
|
"step": 23025
|
|
},
|
|
{
|
|
"entropy": 5.415746736526489,
|
|
"epoch": 1.7918303831939313,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004676704644325462,
|
|
"loss": 5.2062,
|
|
"mean_token_accuracy": 0.18568203151226043,
|
|
"num_tokens": 39960204.0,
|
|
"step": 23030
|
|
},
|
|
{
|
|
"entropy": 5.431189775466919,
|
|
"epoch": 1.7922194125656488,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0004676561490639385,
|
|
"loss": 5.1235,
|
|
"mean_token_accuracy": 0.18627456575632095,
|
|
"num_tokens": 39968513.0,
|
|
"step": 23035
|
|
},
|
|
{
|
|
"entropy": 5.459836530685425,
|
|
"epoch": 1.7926084419373662,
|
|
"grad_norm": 1.65625,
|
|
"learning_rate": 0.0004676418307720805,
|
|
"loss": 5.1841,
|
|
"mean_token_accuracy": 0.1816483646631241,
|
|
"num_tokens": 39977181.0,
|
|
"step": 23040
|
|
},
|
|
{
|
|
"entropy": 5.369750118255615,
|
|
"epoch": 1.792997471309084,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004676275095571892,
|
|
"loss": 4.9925,
|
|
"mean_token_accuracy": 0.19489712566137313,
|
|
"num_tokens": 39986760.0,
|
|
"step": 23045
|
|
},
|
|
{
|
|
"entropy": 5.441999340057373,
|
|
"epoch": 1.7933865006808014,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.00046761318541948215,
|
|
"loss": 5.2146,
|
|
"mean_token_accuracy": 0.17421716898679734,
|
|
"num_tokens": 39995203.0,
|
|
"step": 23050
|
|
},
|
|
{
|
|
"entropy": 5.434117984771729,
|
|
"epoch": 1.7937755300525189,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004675988583591766,
|
|
"loss": 5.102,
|
|
"mean_token_accuracy": 0.19703855216503144,
|
|
"num_tokens": 40003526.0,
|
|
"step": 23055
|
|
},
|
|
{
|
|
"entropy": 5.476336288452148,
|
|
"epoch": 1.7941645594242366,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00046758452837648997,
|
|
"loss": 5.1699,
|
|
"mean_token_accuracy": 0.18086313009262084,
|
|
"num_tokens": 40012036.0,
|
|
"step": 23060
|
|
},
|
|
{
|
|
"entropy": 5.423497867584229,
|
|
"epoch": 1.794553588795954,
|
|
"grad_norm": 1.609375,
|
|
"learning_rate": 0.0004675701954716395,
|
|
"loss": 5.1841,
|
|
"mean_token_accuracy": 0.18324873596429825,
|
|
"num_tokens": 40020237.0,
|
|
"step": 23065
|
|
},
|
|
{
|
|
"entropy": 5.374324226379395,
|
|
"epoch": 1.7949426181676715,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00046755585964484286,
|
|
"loss": 5.059,
|
|
"mean_token_accuracy": 0.1920418083667755,
|
|
"num_tokens": 40028749.0,
|
|
"step": 23070
|
|
},
|
|
{
|
|
"entropy": 5.403493928909302,
|
|
"epoch": 1.7953316475393892,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0004675415208963177,
|
|
"loss": 5.0399,
|
|
"mean_token_accuracy": 0.19200357794761658,
|
|
"num_tokens": 40036799.0,
|
|
"step": 23075
|
|
},
|
|
{
|
|
"entropy": 5.435749578475952,
|
|
"epoch": 1.795720676911107,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.00046752717922628125,
|
|
"loss": 5.1727,
|
|
"mean_token_accuracy": 0.17864285111427308,
|
|
"num_tokens": 40045416.0,
|
|
"step": 23080
|
|
},
|
|
{
|
|
"entropy": 5.503822994232178,
|
|
"epoch": 1.7961097062828244,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0004675128346349514,
|
|
"loss": 5.2153,
|
|
"mean_token_accuracy": 0.1828645020723343,
|
|
"num_tokens": 40054128.0,
|
|
"step": 23085
|
|
},
|
|
{
|
|
"entropy": 5.5446703910827635,
|
|
"epoch": 1.7964987356545419,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00046749848712254554,
|
|
"loss": 5.2037,
|
|
"mean_token_accuracy": 0.18557826280593873,
|
|
"num_tokens": 40062765.0,
|
|
"step": 23090
|
|
},
|
|
{
|
|
"entropy": 5.413590812683106,
|
|
"epoch": 1.7968877650262596,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.00046748413668928164,
|
|
"loss": 5.1395,
|
|
"mean_token_accuracy": 0.18596210330724716,
|
|
"num_tokens": 40071190.0,
|
|
"step": 23095
|
|
},
|
|
{
|
|
"entropy": 5.489024448394775,
|
|
"epoch": 1.797276794397977,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0004674697833353774,
|
|
"loss": 5.1698,
|
|
"mean_token_accuracy": 0.18406279534101486,
|
|
"num_tokens": 40080552.0,
|
|
"step": 23100
|
|
},
|
|
{
|
|
"entropy": 5.489054203033447,
|
|
"epoch": 1.7976658237696945,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00046745542706105045,
|
|
"loss": 5.1802,
|
|
"mean_token_accuracy": 0.188940192759037,
|
|
"num_tokens": 40089407.0,
|
|
"step": 23105
|
|
},
|
|
{
|
|
"entropy": 5.605822515487671,
|
|
"epoch": 1.7980548531414122,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.00046744106786651875,
|
|
"loss": 5.3752,
|
|
"mean_token_accuracy": 0.1744626209139824,
|
|
"num_tokens": 40097946.0,
|
|
"step": 23110
|
|
},
|
|
{
|
|
"entropy": 5.455317735671997,
|
|
"epoch": 1.7984438825131297,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0004674267057520001,
|
|
"loss": 5.11,
|
|
"mean_token_accuracy": 0.1942792922258377,
|
|
"num_tokens": 40105901.0,
|
|
"step": 23115
|
|
},
|
|
{
|
|
"entropy": 5.353527212142945,
|
|
"epoch": 1.7988329118848472,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0004674123407177125,
|
|
"loss": 5.0378,
|
|
"mean_token_accuracy": 0.19014345705509186,
|
|
"num_tokens": 40114481.0,
|
|
"step": 23120
|
|
},
|
|
{
|
|
"entropy": 5.434337997436524,
|
|
"epoch": 1.7992219412565649,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00046739797276387394,
|
|
"loss": 5.0828,
|
|
"mean_token_accuracy": 0.19213710278272628,
|
|
"num_tokens": 40123086.0,
|
|
"step": 23125
|
|
},
|
|
{
|
|
"entropy": 5.460673999786377,
|
|
"epoch": 1.7996109706282826,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00046738360189070235,
|
|
"loss": 5.0918,
|
|
"mean_token_accuracy": 0.1873073622584343,
|
|
"num_tokens": 40131497.0,
|
|
"step": 23130
|
|
},
|
|
{
|
|
"entropy": 5.384670829772949,
|
|
"epoch": 1.8,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.0004673692280984157,
|
|
"loss": 5.1237,
|
|
"mean_token_accuracy": 0.1879059210419655,
|
|
"num_tokens": 40139632.0,
|
|
"step": 23135
|
|
},
|
|
{
|
|
"entropy": 5.402921199798584,
|
|
"epoch": 1.8003890293717175,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004673548513872324,
|
|
"loss": 5.1239,
|
|
"mean_token_accuracy": 0.18642526865005493,
|
|
"num_tokens": 40148312.0,
|
|
"step": 23140
|
|
},
|
|
{
|
|
"entropy": 5.519021320343017,
|
|
"epoch": 1.8007780587434352,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.00046734047175737026,
|
|
"loss": 5.1781,
|
|
"mean_token_accuracy": 0.1818983569741249,
|
|
"num_tokens": 40156750.0,
|
|
"step": 23145
|
|
},
|
|
{
|
|
"entropy": 5.416266870498657,
|
|
"epoch": 1.8011670881151527,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.00046732608920904754,
|
|
"loss": 5.1512,
|
|
"mean_token_accuracy": 0.18879878371953965,
|
|
"num_tokens": 40165334.0,
|
|
"step": 23150
|
|
},
|
|
{
|
|
"entropy": 5.451744174957275,
|
|
"epoch": 1.8015561174868702,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0004673117037424827,
|
|
"loss": 5.1472,
|
|
"mean_token_accuracy": 0.18193834871053696,
|
|
"num_tokens": 40174217.0,
|
|
"step": 23155
|
|
},
|
|
{
|
|
"entropy": 5.465801239013672,
|
|
"epoch": 1.8019451468585879,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.00046729731535789375,
|
|
"loss": 5.1094,
|
|
"mean_token_accuracy": 0.19122948348522187,
|
|
"num_tokens": 40182889.0,
|
|
"step": 23160
|
|
},
|
|
{
|
|
"entropy": 5.488010501861572,
|
|
"epoch": 1.8023341762303053,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.00046728292405549913,
|
|
"loss": 5.165,
|
|
"mean_token_accuracy": 0.18758666664361953,
|
|
"num_tokens": 40191428.0,
|
|
"step": 23165
|
|
},
|
|
{
|
|
"entropy": 5.4420435428619385,
|
|
"epoch": 1.8027232056020228,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0004672685298355172,
|
|
"loss": 5.1216,
|
|
"mean_token_accuracy": 0.19135793447494506,
|
|
"num_tokens": 40200204.0,
|
|
"step": 23170
|
|
},
|
|
{
|
|
"entropy": 5.4017333984375,
|
|
"epoch": 1.8031122349737405,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004672541326981664,
|
|
"loss": 5.0235,
|
|
"mean_token_accuracy": 0.19930849075317383,
|
|
"num_tokens": 40208326.0,
|
|
"step": 23175
|
|
},
|
|
{
|
|
"entropy": 5.393974781036377,
|
|
"epoch": 1.8035012643454582,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.000467239732643665,
|
|
"loss": 5.1541,
|
|
"mean_token_accuracy": 0.18477540761232375,
|
|
"num_tokens": 40217300.0,
|
|
"step": 23180
|
|
},
|
|
{
|
|
"entropy": 5.490010738372803,
|
|
"epoch": 1.8038902937171757,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.00046722532967223183,
|
|
"loss": 5.2656,
|
|
"mean_token_accuracy": 0.183006389439106,
|
|
"num_tokens": 40226695.0,
|
|
"step": 23185
|
|
},
|
|
{
|
|
"entropy": 5.425993633270264,
|
|
"epoch": 1.8042793230888932,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004672109237840851,
|
|
"loss": 5.129,
|
|
"mean_token_accuracy": 0.1887577086687088,
|
|
"num_tokens": 40235286.0,
|
|
"step": 23190
|
|
},
|
|
{
|
|
"entropy": 5.375521039962768,
|
|
"epoch": 1.8046683524606109,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.00046719651497944355,
|
|
"loss": 5.098,
|
|
"mean_token_accuracy": 0.1850908488035202,
|
|
"num_tokens": 40244065.0,
|
|
"step": 23195
|
|
},
|
|
{
|
|
"entropy": 5.555627107620239,
|
|
"epoch": 1.8050573818323283,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.0004671821032585259,
|
|
"loss": 5.2935,
|
|
"mean_token_accuracy": 0.1716819614171982,
|
|
"num_tokens": 40253058.0,
|
|
"step": 23200
|
|
},
|
|
{
|
|
"entropy": 5.56196928024292,
|
|
"epoch": 1.8054464112040458,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0004671676886215506,
|
|
"loss": 5.1937,
|
|
"mean_token_accuracy": 0.1800489529967308,
|
|
"num_tokens": 40261797.0,
|
|
"step": 23205
|
|
},
|
|
{
|
|
"entropy": 5.4071674823760985,
|
|
"epoch": 1.8058354405757635,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.0004671532710687365,
|
|
"loss": 5.1279,
|
|
"mean_token_accuracy": 0.19304683953523635,
|
|
"num_tokens": 40270003.0,
|
|
"step": 23210
|
|
},
|
|
{
|
|
"entropy": 5.439709663391113,
|
|
"epoch": 1.806224469947481,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004671388506003024,
|
|
"loss": 5.1511,
|
|
"mean_token_accuracy": 0.1898994639515877,
|
|
"num_tokens": 40278241.0,
|
|
"step": 23215
|
|
},
|
|
{
|
|
"entropy": 5.447816467285156,
|
|
"epoch": 1.8066134993191985,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0004671244272164671,
|
|
"loss": 5.2139,
|
|
"mean_token_accuracy": 0.17662492245435715,
|
|
"num_tokens": 40286316.0,
|
|
"step": 23220
|
|
},
|
|
{
|
|
"entropy": 5.461765480041504,
|
|
"epoch": 1.8070025286909162,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00046711000091744935,
|
|
"loss": 5.1708,
|
|
"mean_token_accuracy": 0.18385355472564696,
|
|
"num_tokens": 40295378.0,
|
|
"step": 23225
|
|
},
|
|
{
|
|
"entropy": 5.517857074737549,
|
|
"epoch": 1.8073915580626339,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0004670955717034681,
|
|
"loss": 5.2015,
|
|
"mean_token_accuracy": 0.17984024733304976,
|
|
"num_tokens": 40305379.0,
|
|
"step": 23230
|
|
},
|
|
{
|
|
"entropy": 5.507182312011719,
|
|
"epoch": 1.8077805874343513,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00046708113957474233,
|
|
"loss": 5.216,
|
|
"mean_token_accuracy": 0.1837383031845093,
|
|
"num_tokens": 40314174.0,
|
|
"step": 23235
|
|
},
|
|
{
|
|
"entropy": 5.532891368865966,
|
|
"epoch": 1.8081696168060688,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.000467066704531491,
|
|
"loss": 5.195,
|
|
"mean_token_accuracy": 0.1879311814904213,
|
|
"num_tokens": 40323708.0,
|
|
"step": 23240
|
|
},
|
|
{
|
|
"entropy": 5.452646732330322,
|
|
"epoch": 1.8085586461777865,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004670522665739332,
|
|
"loss": 5.1146,
|
|
"mean_token_accuracy": 0.18440792411565782,
|
|
"num_tokens": 40333664.0,
|
|
"step": 23245
|
|
},
|
|
{
|
|
"entropy": 5.491839456558227,
|
|
"epoch": 1.808947675549504,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.0004670378257022878,
|
|
"loss": 5.1645,
|
|
"mean_token_accuracy": 0.18548935055732726,
|
|
"num_tokens": 40342037.0,
|
|
"step": 23250
|
|
},
|
|
{
|
|
"entropy": 5.506096410751343,
|
|
"epoch": 1.8093367049212215,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00046702338191677414,
|
|
"loss": 5.0992,
|
|
"mean_token_accuracy": 0.19460695534944533,
|
|
"num_tokens": 40350472.0,
|
|
"step": 23255
|
|
},
|
|
{
|
|
"entropy": 5.428826808929443,
|
|
"epoch": 1.8097257342929391,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0004670089352176113,
|
|
"loss": 5.1599,
|
|
"mean_token_accuracy": 0.1843449965119362,
|
|
"num_tokens": 40358829.0,
|
|
"step": 23260
|
|
},
|
|
{
|
|
"entropy": 5.431121826171875,
|
|
"epoch": 1.8101147636646568,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00046699448560501847,
|
|
"loss": 5.1599,
|
|
"mean_token_accuracy": 0.18335520178079606,
|
|
"num_tokens": 40367414.0,
|
|
"step": 23265
|
|
},
|
|
{
|
|
"entropy": 5.520883512496948,
|
|
"epoch": 1.810503793036374,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0004669800330792149,
|
|
"loss": 5.2269,
|
|
"mean_token_accuracy": 0.1764501929283142,
|
|
"num_tokens": 40375969.0,
|
|
"step": 23270
|
|
},
|
|
{
|
|
"entropy": 5.513030481338501,
|
|
"epoch": 1.8108928224080918,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00046696557764041994,
|
|
"loss": 5.1753,
|
|
"mean_token_accuracy": 0.18240612894296646,
|
|
"num_tokens": 40384200.0,
|
|
"step": 23275
|
|
},
|
|
{
|
|
"entropy": 5.536885404586792,
|
|
"epoch": 1.8112818517798095,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.0004669511192888528,
|
|
"loss": 5.2682,
|
|
"mean_token_accuracy": 0.1782982349395752,
|
|
"num_tokens": 40392891.0,
|
|
"step": 23280
|
|
},
|
|
{
|
|
"entropy": 5.538742113113403,
|
|
"epoch": 1.811670881151527,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00046693665802473294,
|
|
"loss": 5.2236,
|
|
"mean_token_accuracy": 0.1825158029794693,
|
|
"num_tokens": 40402009.0,
|
|
"step": 23285
|
|
},
|
|
{
|
|
"entropy": 5.479896974563599,
|
|
"epoch": 1.8120599105232444,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.00046692219384827986,
|
|
"loss": 5.1855,
|
|
"mean_token_accuracy": 0.18070918768644334,
|
|
"num_tokens": 40410756.0,
|
|
"step": 23290
|
|
},
|
|
{
|
|
"entropy": 5.536929655075073,
|
|
"epoch": 1.8124489398949621,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004669077267597129,
|
|
"loss": 5.2321,
|
|
"mean_token_accuracy": 0.1807504951953888,
|
|
"num_tokens": 40420087.0,
|
|
"step": 23295
|
|
},
|
|
{
|
|
"entropy": 5.452242088317871,
|
|
"epoch": 1.8128379692666796,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.00046689325675925174,
|
|
"loss": 5.1019,
|
|
"mean_token_accuracy": 0.19031475335359574,
|
|
"num_tokens": 40428741.0,
|
|
"step": 23300
|
|
},
|
|
{
|
|
"entropy": 5.556022787094117,
|
|
"epoch": 1.813226998638397,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00046687878384711574,
|
|
"loss": 5.3039,
|
|
"mean_token_accuracy": 0.17355628907680512,
|
|
"num_tokens": 40438128.0,
|
|
"step": 23305
|
|
},
|
|
{
|
|
"entropy": 5.512592887878418,
|
|
"epoch": 1.8136160280101148,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.00046686430802352476,
|
|
"loss": 5.2439,
|
|
"mean_token_accuracy": 0.17933424562215805,
|
|
"num_tokens": 40446990.0,
|
|
"step": 23310
|
|
},
|
|
{
|
|
"entropy": 5.452840566635132,
|
|
"epoch": 1.8140050573818325,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0004668498292886982,
|
|
"loss": 5.1422,
|
|
"mean_token_accuracy": 0.18773091286420823,
|
|
"num_tokens": 40454627.0,
|
|
"step": 23315
|
|
},
|
|
{
|
|
"entropy": 5.466392564773559,
|
|
"epoch": 1.8143940867535497,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00046683534764285577,
|
|
"loss": 5.1609,
|
|
"mean_token_accuracy": 0.1873893991112709,
|
|
"num_tokens": 40463321.0,
|
|
"step": 23320
|
|
},
|
|
{
|
|
"entropy": 5.414951467514038,
|
|
"epoch": 1.8147831161252674,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.00046682086308621725,
|
|
"loss": 4.9968,
|
|
"mean_token_accuracy": 0.19436359852552415,
|
|
"num_tokens": 40472156.0,
|
|
"step": 23325
|
|
},
|
|
{
|
|
"entropy": 5.436511373519897,
|
|
"epoch": 1.8151721454969851,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0004668063756190026,
|
|
"loss": 5.1654,
|
|
"mean_token_accuracy": 0.18081745654344558,
|
|
"num_tokens": 40480938.0,
|
|
"step": 23330
|
|
},
|
|
{
|
|
"entropy": 5.381306743621826,
|
|
"epoch": 1.8155611748687026,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00046679188524143136,
|
|
"loss": 5.0988,
|
|
"mean_token_accuracy": 0.18636801093816757,
|
|
"num_tokens": 40489740.0,
|
|
"step": 23335
|
|
},
|
|
{
|
|
"entropy": 5.481018829345703,
|
|
"epoch": 1.81595020424042,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0004667773919537235,
|
|
"loss": 5.1094,
|
|
"mean_token_accuracy": 0.19009560644626616,
|
|
"num_tokens": 40498420.0,
|
|
"step": 23340
|
|
},
|
|
{
|
|
"entropy": 5.38794469833374,
|
|
"epoch": 1.8163392336121378,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.00046676289575609914,
|
|
"loss": 5.0157,
|
|
"mean_token_accuracy": 0.1954392284154892,
|
|
"num_tokens": 40506634.0,
|
|
"step": 23345
|
|
},
|
|
{
|
|
"entropy": 5.50755352973938,
|
|
"epoch": 1.8167282629838553,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00046674839664877796,
|
|
"loss": 5.2214,
|
|
"mean_token_accuracy": 0.182529915869236,
|
|
"num_tokens": 40515310.0,
|
|
"step": 23350
|
|
},
|
|
{
|
|
"entropy": 5.486479759216309,
|
|
"epoch": 1.8171172923555727,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0004667338946319801,
|
|
"loss": 5.0845,
|
|
"mean_token_accuracy": 0.19326406717300415,
|
|
"num_tokens": 40523739.0,
|
|
"step": 23355
|
|
},
|
|
{
|
|
"entropy": 5.466891765594482,
|
|
"epoch": 1.8175063217272904,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0004667193897059255,
|
|
"loss": 5.2611,
|
|
"mean_token_accuracy": 0.17791733145713806,
|
|
"num_tokens": 40533070.0,
|
|
"step": 23360
|
|
},
|
|
{
|
|
"entropy": 5.521513605117798,
|
|
"epoch": 1.8178953510990081,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00046670488187083436,
|
|
"loss": 5.1377,
|
|
"mean_token_accuracy": 0.18730199187994004,
|
|
"num_tokens": 40541975.0,
|
|
"step": 23365
|
|
},
|
|
{
|
|
"entropy": 5.551066493988037,
|
|
"epoch": 1.8182843804707254,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0004666903711269267,
|
|
"loss": 5.2463,
|
|
"mean_token_accuracy": 0.1827528715133667,
|
|
"num_tokens": 40550896.0,
|
|
"step": 23370
|
|
},
|
|
{
|
|
"entropy": 5.442790222167969,
|
|
"epoch": 1.818673409842443,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004666758574744228,
|
|
"loss": 5.2295,
|
|
"mean_token_accuracy": 0.17820956856012343,
|
|
"num_tokens": 40559719.0,
|
|
"step": 23375
|
|
},
|
|
{
|
|
"entropy": 5.507573080062866,
|
|
"epoch": 1.8190624392141608,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004666613409135429,
|
|
"loss": 5.226,
|
|
"mean_token_accuracy": 0.17964120656251908,
|
|
"num_tokens": 40568448.0,
|
|
"step": 23380
|
|
},
|
|
{
|
|
"entropy": 5.6080334186553955,
|
|
"epoch": 1.8194514685858783,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004666468214445072,
|
|
"loss": 5.2262,
|
|
"mean_token_accuracy": 0.17512208372354507,
|
|
"num_tokens": 40576443.0,
|
|
"step": 23385
|
|
},
|
|
{
|
|
"entropy": 5.401840734481811,
|
|
"epoch": 1.8198404979575957,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00046663229906753595,
|
|
"loss": 4.9988,
|
|
"mean_token_accuracy": 0.19805439114570617,
|
|
"num_tokens": 40584440.0,
|
|
"step": 23390
|
|
},
|
|
{
|
|
"entropy": 5.417028903961182,
|
|
"epoch": 1.8202295273293134,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00046661777378284965,
|
|
"loss": 5.2856,
|
|
"mean_token_accuracy": 0.18258226066827773,
|
|
"num_tokens": 40593696.0,
|
|
"step": 23395
|
|
},
|
|
{
|
|
"entropy": 5.458006906509399,
|
|
"epoch": 1.820618556701031,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.0004666032455906685,
|
|
"loss": 5.0848,
|
|
"mean_token_accuracy": 0.1933286726474762,
|
|
"num_tokens": 40601368.0,
|
|
"step": 23400
|
|
},
|
|
{
|
|
"entropy": 5.529492330551148,
|
|
"epoch": 1.8210075860727484,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.00046658871449121325,
|
|
"loss": 5.1821,
|
|
"mean_token_accuracy": 0.18526964336633683,
|
|
"num_tokens": 40609143.0,
|
|
"step": 23405
|
|
},
|
|
{
|
|
"entropy": 5.466282749176026,
|
|
"epoch": 1.821396615444466,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0004665741804847041,
|
|
"loss": 5.1847,
|
|
"mean_token_accuracy": 0.18623853027820586,
|
|
"num_tokens": 40617602.0,
|
|
"step": 23410
|
|
},
|
|
{
|
|
"entropy": 5.393481111526489,
|
|
"epoch": 1.8217856448161838,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.00046655964357136164,
|
|
"loss": 5.0525,
|
|
"mean_token_accuracy": 0.1929493546485901,
|
|
"num_tokens": 40626412.0,
|
|
"step": 23415
|
|
},
|
|
{
|
|
"entropy": 5.422512435913086,
|
|
"epoch": 1.822174674187901,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00046654510375140657,
|
|
"loss": 5.1121,
|
|
"mean_token_accuracy": 0.18927900940179826,
|
|
"num_tokens": 40635095.0,
|
|
"step": 23420
|
|
},
|
|
{
|
|
"entropy": 5.470872783660889,
|
|
"epoch": 1.8225637035596187,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004665305610250594,
|
|
"loss": 5.15,
|
|
"mean_token_accuracy": 0.18870654702186584,
|
|
"num_tokens": 40643421.0,
|
|
"step": 23425
|
|
},
|
|
{
|
|
"entropy": 5.4639084815979,
|
|
"epoch": 1.8229527329313364,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004665160153925408,
|
|
"loss": 5.1879,
|
|
"mean_token_accuracy": 0.18596282005310058,
|
|
"num_tokens": 40652180.0,
|
|
"step": 23430
|
|
},
|
|
{
|
|
"entropy": 5.5223548412323,
|
|
"epoch": 1.823341762303054,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.00046650146685407154,
|
|
"loss": 5.2257,
|
|
"mean_token_accuracy": 0.18098650574684144,
|
|
"num_tokens": 40660398.0,
|
|
"step": 23435
|
|
},
|
|
{
|
|
"entropy": 5.491229057312012,
|
|
"epoch": 1.8237307916747714,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00046648691540987226,
|
|
"loss": 5.2485,
|
|
"mean_token_accuracy": 0.17661017626523973,
|
|
"num_tokens": 40668827.0,
|
|
"step": 23440
|
|
},
|
|
{
|
|
"entropy": 5.504744625091552,
|
|
"epoch": 1.824119821046489,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.00046647236106016387,
|
|
"loss": 5.1407,
|
|
"mean_token_accuracy": 0.19118944108486174,
|
|
"num_tokens": 40676920.0,
|
|
"step": 23445
|
|
},
|
|
{
|
|
"entropy": 5.441109609603882,
|
|
"epoch": 1.8245088504182065,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0004664578038051672,
|
|
"loss": 5.1103,
|
|
"mean_token_accuracy": 0.19149552434682846,
|
|
"num_tokens": 40685115.0,
|
|
"step": 23450
|
|
},
|
|
{
|
|
"entropy": 5.434766387939453,
|
|
"epoch": 1.824897879789924,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.000466443243645103,
|
|
"loss": 5.1412,
|
|
"mean_token_accuracy": 0.18753363192081451,
|
|
"num_tokens": 40693870.0,
|
|
"step": 23455
|
|
},
|
|
{
|
|
"entropy": 5.488427209854126,
|
|
"epoch": 1.8252869091616417,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004664286805801923,
|
|
"loss": 5.1228,
|
|
"mean_token_accuracy": 0.18068734407424927,
|
|
"num_tokens": 40703031.0,
|
|
"step": 23460
|
|
},
|
|
{
|
|
"entropy": 5.3913809299469,
|
|
"epoch": 1.8256759385333594,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0004664141146106562,
|
|
"loss": 5.077,
|
|
"mean_token_accuracy": 0.19457968473434448,
|
|
"num_tokens": 40711690.0,
|
|
"step": 23465
|
|
},
|
|
{
|
|
"entropy": 5.40255708694458,
|
|
"epoch": 1.8260649679050769,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00046639954573671547,
|
|
"loss": 5.1746,
|
|
"mean_token_accuracy": 0.18295167684555053,
|
|
"num_tokens": 40720086.0,
|
|
"step": 23470
|
|
},
|
|
{
|
|
"entropy": 5.542586755752564,
|
|
"epoch": 1.8264539972767944,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.00046638497395859127,
|
|
"loss": 5.2165,
|
|
"mean_token_accuracy": 0.1817614421248436,
|
|
"num_tokens": 40728117.0,
|
|
"step": 23475
|
|
},
|
|
{
|
|
"entropy": 5.5636992931365965,
|
|
"epoch": 1.826843026648512,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0004663703992765047,
|
|
"loss": 5.2144,
|
|
"mean_token_accuracy": 0.1896081194281578,
|
|
"num_tokens": 40736761.0,
|
|
"step": 23480
|
|
},
|
|
{
|
|
"entropy": 5.390636730194092,
|
|
"epoch": 1.8272320560202295,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00046635582169067693,
|
|
"loss": 5.1484,
|
|
"mean_token_accuracy": 0.18095557540655136,
|
|
"num_tokens": 40745291.0,
|
|
"step": 23485
|
|
},
|
|
{
|
|
"entropy": 5.54840989112854,
|
|
"epoch": 1.827621085391947,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00046634124120132915,
|
|
"loss": 5.1743,
|
|
"mean_token_accuracy": 0.18733388036489487,
|
|
"num_tokens": 40754308.0,
|
|
"step": 23490
|
|
},
|
|
{
|
|
"entropy": 5.448008871078491,
|
|
"epoch": 1.8280101147636647,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004663266578086826,
|
|
"loss": 5.0633,
|
|
"mean_token_accuracy": 0.18662054985761642,
|
|
"num_tokens": 40763046.0,
|
|
"step": 23495
|
|
},
|
|
{
|
|
"entropy": 5.3517876148223875,
|
|
"epoch": 1.8283991441353822,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0004663120715129585,
|
|
"loss": 5.0999,
|
|
"mean_token_accuracy": 0.17912623137235642,
|
|
"num_tokens": 40770912.0,
|
|
"step": 23500
|
|
},
|
|
{
|
|
"entropy": 5.509221696853638,
|
|
"epoch": 1.8287881735070997,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 0.0004662974823143783,
|
|
"loss": 5.1952,
|
|
"mean_token_accuracy": 0.17274018228054047,
|
|
"num_tokens": 40779748.0,
|
|
"step": 23505
|
|
},
|
|
{
|
|
"entropy": 5.510226583480835,
|
|
"epoch": 1.8291772028788174,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004662828902131632,
|
|
"loss": 5.2014,
|
|
"mean_token_accuracy": 0.17924265563488007,
|
|
"num_tokens": 40787732.0,
|
|
"step": 23510
|
|
},
|
|
{
|
|
"entropy": 5.4629274845123295,
|
|
"epoch": 1.829566232250535,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0004662682952095348,
|
|
"loss": 5.0771,
|
|
"mean_token_accuracy": 0.18834544122219085,
|
|
"num_tokens": 40796521.0,
|
|
"step": 23515
|
|
},
|
|
{
|
|
"entropy": 5.492439460754395,
|
|
"epoch": 1.8299552616222525,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00046625369730371436,
|
|
"loss": 5.2406,
|
|
"mean_token_accuracy": 0.18148494213819505,
|
|
"num_tokens": 40805479.0,
|
|
"step": 23520
|
|
},
|
|
{
|
|
"entropy": 5.435658073425293,
|
|
"epoch": 1.83034429099397,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.0004662390964959235,
|
|
"loss": 5.0558,
|
|
"mean_token_accuracy": 0.18398656249046325,
|
|
"num_tokens": 40813647.0,
|
|
"step": 23525
|
|
},
|
|
{
|
|
"entropy": 5.359564590454101,
|
|
"epoch": 1.8307333203656877,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.00046622449278638375,
|
|
"loss": 5.0687,
|
|
"mean_token_accuracy": 0.18652674555778503,
|
|
"num_tokens": 40821753.0,
|
|
"step": 23530
|
|
},
|
|
{
|
|
"entropy": 5.410502195358276,
|
|
"epoch": 1.8311223497374052,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0004662098861753167,
|
|
"loss": 5.1861,
|
|
"mean_token_accuracy": 0.18628668487071992,
|
|
"num_tokens": 40830391.0,
|
|
"step": 23535
|
|
},
|
|
{
|
|
"entropy": 5.462909984588623,
|
|
"epoch": 1.8315113791091227,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00046619527666294394,
|
|
"loss": 5.143,
|
|
"mean_token_accuracy": 0.19373972862958908,
|
|
"num_tokens": 40839372.0,
|
|
"step": 23540
|
|
},
|
|
{
|
|
"entropy": 5.537566900253296,
|
|
"epoch": 1.8319004084808403,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.0004661806642494872,
|
|
"loss": 5.2435,
|
|
"mean_token_accuracy": 0.18024476021528243,
|
|
"num_tokens": 40847945.0,
|
|
"step": 23545
|
|
},
|
|
{
|
|
"entropy": 5.5658525943756105,
|
|
"epoch": 1.8322894378525578,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.0004661660489351681,
|
|
"loss": 5.2876,
|
|
"mean_token_accuracy": 0.17911046445369722,
|
|
"num_tokens": 40857600.0,
|
|
"step": 23550
|
|
},
|
|
{
|
|
"entropy": 5.469484472274781,
|
|
"epoch": 1.8326784672242753,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0004661514307202086,
|
|
"loss": 5.092,
|
|
"mean_token_accuracy": 0.19017273485660552,
|
|
"num_tokens": 40866672.0,
|
|
"step": 23555
|
|
},
|
|
{
|
|
"entropy": 5.475192070007324,
|
|
"epoch": 1.833067496595993,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.00046613680960483036,
|
|
"loss": 5.1373,
|
|
"mean_token_accuracy": 0.1809640794992447,
|
|
"num_tokens": 40875240.0,
|
|
"step": 23560
|
|
},
|
|
{
|
|
"entropy": 5.429525518417359,
|
|
"epoch": 1.8334565259677107,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004661221855892552,
|
|
"loss": 5.1073,
|
|
"mean_token_accuracy": 0.18319796472787858,
|
|
"num_tokens": 40883731.0,
|
|
"step": 23565
|
|
},
|
|
{
|
|
"entropy": 5.401902532577514,
|
|
"epoch": 1.8338455553394282,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.00046610755867370506,
|
|
"loss": 5.0728,
|
|
"mean_token_accuracy": 0.192316272854805,
|
|
"num_tokens": 40892572.0,
|
|
"step": 23570
|
|
},
|
|
{
|
|
"entropy": 5.4698010921478275,
|
|
"epoch": 1.8342345847111456,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.000466092928858402,
|
|
"loss": 5.17,
|
|
"mean_token_accuracy": 0.19086933583021165,
|
|
"num_tokens": 40901603.0,
|
|
"step": 23575
|
|
},
|
|
{
|
|
"entropy": 5.477512788772583,
|
|
"epoch": 1.8346236140828633,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.00046607829614356787,
|
|
"loss": 5.1499,
|
|
"mean_token_accuracy": 0.18670800626277922,
|
|
"num_tokens": 40910502.0,
|
|
"step": 23580
|
|
},
|
|
{
|
|
"entropy": 5.453986072540284,
|
|
"epoch": 1.8350126434545808,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0004660636605294247,
|
|
"loss": 5.1014,
|
|
"mean_token_accuracy": 0.19035519659519196,
|
|
"num_tokens": 40919858.0,
|
|
"step": 23585
|
|
},
|
|
{
|
|
"entropy": 5.469553518295288,
|
|
"epoch": 1.8354016728262983,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0004660490220161946,
|
|
"loss": 5.1508,
|
|
"mean_token_accuracy": 0.19002943634986877,
|
|
"num_tokens": 40928795.0,
|
|
"step": 23590
|
|
},
|
|
{
|
|
"entropy": 5.511152458190918,
|
|
"epoch": 1.835790702198016,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.00046603438060409966,
|
|
"loss": 5.1567,
|
|
"mean_token_accuracy": 0.18648817986249924,
|
|
"num_tokens": 40937240.0,
|
|
"step": 23595
|
|
},
|
|
{
|
|
"entropy": 5.468125724792481,
|
|
"epoch": 1.8361797315697335,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.000466019736293362,
|
|
"loss": 5.158,
|
|
"mean_token_accuracy": 0.18931260854005813,
|
|
"num_tokens": 40945974.0,
|
|
"step": 23600
|
|
},
|
|
{
|
|
"entropy": 5.412787437438965,
|
|
"epoch": 1.836568760941451,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.00046600508908420396,
|
|
"loss": 5.0608,
|
|
"mean_token_accuracy": 0.1990172192454338,
|
|
"num_tokens": 40953553.0,
|
|
"step": 23605
|
|
},
|
|
{
|
|
"entropy": 5.432899713516235,
|
|
"epoch": 1.8369577903131686,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.00046599043897684766,
|
|
"loss": 5.1089,
|
|
"mean_token_accuracy": 0.19648993164300918,
|
|
"num_tokens": 40961287.0,
|
|
"step": 23610
|
|
},
|
|
{
|
|
"entropy": 5.396137762069702,
|
|
"epoch": 1.8373468196848863,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.0004659757859715155,
|
|
"loss": 5.0607,
|
|
"mean_token_accuracy": 0.188524828851223,
|
|
"num_tokens": 40970266.0,
|
|
"step": 23615
|
|
},
|
|
{
|
|
"entropy": 5.464326524734497,
|
|
"epoch": 1.8377358490566038,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.00046596113006842975,
|
|
"loss": 5.1201,
|
|
"mean_token_accuracy": 0.19566244781017303,
|
|
"num_tokens": 40978303.0,
|
|
"step": 23620
|
|
},
|
|
{
|
|
"entropy": 5.538270950317383,
|
|
"epoch": 1.8381248784283213,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004659464712678128,
|
|
"loss": 5.1717,
|
|
"mean_token_accuracy": 0.18946965634822846,
|
|
"num_tokens": 40986360.0,
|
|
"step": 23625
|
|
},
|
|
{
|
|
"entropy": 5.453439331054687,
|
|
"epoch": 1.838513907800039,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0004659318095698871,
|
|
"loss": 5.2158,
|
|
"mean_token_accuracy": 0.18057546019554138,
|
|
"num_tokens": 40995323.0,
|
|
"step": 23630
|
|
},
|
|
{
|
|
"entropy": 5.484476900100708,
|
|
"epoch": 1.8389029371717565,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 0.000465917144974875,
|
|
"loss": 5.1085,
|
|
"mean_token_accuracy": 0.18589985221624375,
|
|
"num_tokens": 41004032.0,
|
|
"step": 23635
|
|
},
|
|
{
|
|
"entropy": 5.4534858703613285,
|
|
"epoch": 1.839291966543474,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004659024774829992,
|
|
"loss": 5.1491,
|
|
"mean_token_accuracy": 0.1860458567738533,
|
|
"num_tokens": 41011992.0,
|
|
"step": 23640
|
|
},
|
|
{
|
|
"entropy": 5.454087114334106,
|
|
"epoch": 1.8396809959151916,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.000465887807094482,
|
|
"loss": 5.1859,
|
|
"mean_token_accuracy": 0.18303187638521196,
|
|
"num_tokens": 41020252.0,
|
|
"step": 23645
|
|
},
|
|
{
|
|
"entropy": 5.461905288696289,
|
|
"epoch": 1.8400700252869093,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.00046587313380954635,
|
|
"loss": 5.1085,
|
|
"mean_token_accuracy": 0.18792423009872436,
|
|
"num_tokens": 41028858.0,
|
|
"step": 23650
|
|
},
|
|
{
|
|
"entropy": 5.460704326629639,
|
|
"epoch": 1.8404590546586266,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.00046585845762841453,
|
|
"loss": 5.0777,
|
|
"mean_token_accuracy": 0.1933815985918045,
|
|
"num_tokens": 41037539.0,
|
|
"step": 23655
|
|
},
|
|
{
|
|
"entropy": 5.424747514724731,
|
|
"epoch": 1.8408480840303443,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0004658437785513095,
|
|
"loss": 5.1655,
|
|
"mean_token_accuracy": 0.18635925203561782,
|
|
"num_tokens": 41045809.0,
|
|
"step": 23660
|
|
},
|
|
{
|
|
"entropy": 5.403650093078613,
|
|
"epoch": 1.841237113402062,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0004658290965784539,
|
|
"loss": 5.0892,
|
|
"mean_token_accuracy": 0.1865114688873291,
|
|
"num_tokens": 41054675.0,
|
|
"step": 23665
|
|
},
|
|
{
|
|
"entropy": 5.488287734985351,
|
|
"epoch": 1.8416261427737795,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0004658144117100704,
|
|
"loss": 5.242,
|
|
"mean_token_accuracy": 0.18071712851524352,
|
|
"num_tokens": 41063493.0,
|
|
"step": 23670
|
|
},
|
|
{
|
|
"entropy": 5.467473363876342,
|
|
"epoch": 1.842015172145497,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.00046579972394638204,
|
|
"loss": 5.1785,
|
|
"mean_token_accuracy": 0.18211568295955657,
|
|
"num_tokens": 41072985.0,
|
|
"step": 23675
|
|
},
|
|
{
|
|
"entropy": 5.460685205459595,
|
|
"epoch": 1.8424042015172146,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00046578503328761146,
|
|
"loss": 5.1477,
|
|
"mean_token_accuracy": 0.18426069021224975,
|
|
"num_tokens": 41080926.0,
|
|
"step": 23680
|
|
},
|
|
{
|
|
"entropy": 5.3876872062683105,
|
|
"epoch": 1.842793230888932,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.00046577033973398173,
|
|
"loss": 5.1016,
|
|
"mean_token_accuracy": 0.18949470669031143,
|
|
"num_tokens": 41090251.0,
|
|
"step": 23685
|
|
},
|
|
{
|
|
"entropy": 5.380768251419068,
|
|
"epoch": 1.8431822602606496,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0004657556432857157,
|
|
"loss": 5.0638,
|
|
"mean_token_accuracy": 0.1865130364894867,
|
|
"num_tokens": 41098681.0,
|
|
"step": 23690
|
|
},
|
|
{
|
|
"entropy": 5.514657688140869,
|
|
"epoch": 1.8435712896323673,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0004657409439430364,
|
|
"loss": 5.2064,
|
|
"mean_token_accuracy": 0.18349990248680115,
|
|
"num_tokens": 41107399.0,
|
|
"step": 23695
|
|
},
|
|
{
|
|
"entropy": 5.514560699462891,
|
|
"epoch": 1.843960319004085,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0004657262417061669,
|
|
"loss": 5.1646,
|
|
"mean_token_accuracy": 0.18160766065120698,
|
|
"num_tokens": 41116476.0,
|
|
"step": 23700
|
|
},
|
|
{
|
|
"entropy": 5.434439086914063,
|
|
"epoch": 1.8443493483758022,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.0004657115365753302,
|
|
"loss": 5.0794,
|
|
"mean_token_accuracy": 0.18742818534374237,
|
|
"num_tokens": 41125191.0,
|
|
"step": 23705
|
|
},
|
|
{
|
|
"entropy": 5.406622409820557,
|
|
"epoch": 1.84473837774752,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.00046569682855074953,
|
|
"loss": 5.0728,
|
|
"mean_token_accuracy": 0.19411438405513765,
|
|
"num_tokens": 41133811.0,
|
|
"step": 23710
|
|
},
|
|
{
|
|
"entropy": 5.431077766418457,
|
|
"epoch": 1.8451274071192376,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.00046568211763264796,
|
|
"loss": 5.2068,
|
|
"mean_token_accuracy": 0.1821148157119751,
|
|
"num_tokens": 41143093.0,
|
|
"step": 23715
|
|
},
|
|
{
|
|
"entropy": 5.5269660472869875,
|
|
"epoch": 1.845516436490955,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.0004656674038212488,
|
|
"loss": 5.2576,
|
|
"mean_token_accuracy": 0.18294116407632827,
|
|
"num_tokens": 41152106.0,
|
|
"step": 23720
|
|
},
|
|
{
|
|
"entropy": 5.472079610824585,
|
|
"epoch": 1.8459054658626726,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.00046565268711677525,
|
|
"loss": 5.1154,
|
|
"mean_token_accuracy": 0.1846821203827858,
|
|
"num_tokens": 41161100.0,
|
|
"step": 23725
|
|
},
|
|
{
|
|
"entropy": 5.428303670883179,
|
|
"epoch": 1.8462944952343903,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00046563796751945065,
|
|
"loss": 5.1693,
|
|
"mean_token_accuracy": 0.18427515476942063,
|
|
"num_tokens": 41170339.0,
|
|
"step": 23730
|
|
},
|
|
{
|
|
"entropy": 5.479092264175415,
|
|
"epoch": 1.8466835246061077,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.00046562324502949834,
|
|
"loss": 5.1528,
|
|
"mean_token_accuracy": 0.18135832995176315,
|
|
"num_tokens": 41178821.0,
|
|
"step": 23735
|
|
},
|
|
{
|
|
"entropy": 5.486088466644287,
|
|
"epoch": 1.8470725539778252,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 0.0004656085196471416,
|
|
"loss": 5.1797,
|
|
"mean_token_accuracy": 0.18353923708200454,
|
|
"num_tokens": 41187578.0,
|
|
"step": 23740
|
|
},
|
|
{
|
|
"entropy": 5.343141317367554,
|
|
"epoch": 1.847461583349543,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.00046559379137260404,
|
|
"loss": 5.0483,
|
|
"mean_token_accuracy": 0.19183846861124038,
|
|
"num_tokens": 41196799.0,
|
|
"step": 23745
|
|
},
|
|
{
|
|
"entropy": 5.47886290550232,
|
|
"epoch": 1.8478506127212606,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.000465579060206109,
|
|
"loss": 5.2121,
|
|
"mean_token_accuracy": 0.17870354056358337,
|
|
"num_tokens": 41206300.0,
|
|
"step": 23750
|
|
},
|
|
{
|
|
"entropy": 5.5449700355529785,
|
|
"epoch": 1.8482396420929779,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00046556432614788015,
|
|
"loss": 5.194,
|
|
"mean_token_accuracy": 0.18632852137088776,
|
|
"num_tokens": 41214377.0,
|
|
"step": 23755
|
|
},
|
|
{
|
|
"entropy": 5.447195911407471,
|
|
"epoch": 1.8486286714646956,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004655495891981409,
|
|
"loss": 5.1039,
|
|
"mean_token_accuracy": 0.18826203048229218,
|
|
"num_tokens": 41223303.0,
|
|
"step": 23760
|
|
},
|
|
{
|
|
"entropy": 5.478807783126831,
|
|
"epoch": 1.8490177008364133,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.000465534849357115,
|
|
"loss": 5.2095,
|
|
"mean_token_accuracy": 0.1831169381737709,
|
|
"num_tokens": 41232323.0,
|
|
"step": 23765
|
|
},
|
|
{
|
|
"entropy": 5.485122203826904,
|
|
"epoch": 1.8494067302081307,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00046552010662502595,
|
|
"loss": 5.2048,
|
|
"mean_token_accuracy": 0.1848752588033676,
|
|
"num_tokens": 41241605.0,
|
|
"step": 23770
|
|
},
|
|
{
|
|
"entropy": 5.513813495635986,
|
|
"epoch": 1.8497957595798482,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0004655053610020976,
|
|
"loss": 5.276,
|
|
"mean_token_accuracy": 0.17496470659971236,
|
|
"num_tokens": 41250604.0,
|
|
"step": 23775
|
|
},
|
|
{
|
|
"entropy": 5.45437970161438,
|
|
"epoch": 1.850184788951566,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0004654906124885535,
|
|
"loss": 5.0527,
|
|
"mean_token_accuracy": 0.19050905257463455,
|
|
"num_tokens": 41258640.0,
|
|
"step": 23780
|
|
},
|
|
{
|
|
"entropy": 5.482372856140136,
|
|
"epoch": 1.8505738183232834,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004654758610846176,
|
|
"loss": 5.2768,
|
|
"mean_token_accuracy": 0.1822562262415886,
|
|
"num_tokens": 41268104.0,
|
|
"step": 23785
|
|
},
|
|
{
|
|
"entropy": 5.511211299896241,
|
|
"epoch": 1.8509628476950009,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0004654611067905137,
|
|
"loss": 5.2324,
|
|
"mean_token_accuracy": 0.1830660507082939,
|
|
"num_tokens": 41276276.0,
|
|
"step": 23790
|
|
},
|
|
{
|
|
"entropy": 5.425739049911499,
|
|
"epoch": 1.8513518770667186,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00046544634960646563,
|
|
"loss": 5.0724,
|
|
"mean_token_accuracy": 0.19270382970571517,
|
|
"num_tokens": 41284464.0,
|
|
"step": 23795
|
|
},
|
|
{
|
|
"entropy": 5.451232528686523,
|
|
"epoch": 1.8517409064384363,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.0004654315895326974,
|
|
"loss": 5.0771,
|
|
"mean_token_accuracy": 0.18426578342914582,
|
|
"num_tokens": 41293108.0,
|
|
"step": 23800
|
|
},
|
|
{
|
|
"entropy": 5.454205179214478,
|
|
"epoch": 1.8521299358101535,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.0004654168265694328,
|
|
"loss": 5.12,
|
|
"mean_token_accuracy": 0.18528238832950591,
|
|
"num_tokens": 41301830.0,
|
|
"step": 23805
|
|
},
|
|
{
|
|
"entropy": 5.523759412765503,
|
|
"epoch": 1.8525189651818712,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.000465402060716896,
|
|
"loss": 5.1749,
|
|
"mean_token_accuracy": 0.1857190653681755,
|
|
"num_tokens": 41310487.0,
|
|
"step": 23810
|
|
},
|
|
{
|
|
"entropy": 5.5197385311126705,
|
|
"epoch": 1.852907994553589,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.000465387291975311,
|
|
"loss": 5.2507,
|
|
"mean_token_accuracy": 0.18191703408956528,
|
|
"num_tokens": 41319730.0,
|
|
"step": 23815
|
|
},
|
|
{
|
|
"entropy": 5.44227294921875,
|
|
"epoch": 1.8532970239253064,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.00046537252034490185,
|
|
"loss": 5.1348,
|
|
"mean_token_accuracy": 0.18759854137897491,
|
|
"num_tokens": 41328914.0,
|
|
"step": 23820
|
|
},
|
|
{
|
|
"entropy": 5.3977173328399655,
|
|
"epoch": 1.8536860532970239,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00046535774582589275,
|
|
"loss": 5.1774,
|
|
"mean_token_accuracy": 0.1810375362634659,
|
|
"num_tokens": 41337060.0,
|
|
"step": 23825
|
|
},
|
|
{
|
|
"entropy": 5.441968059539795,
|
|
"epoch": 1.8540750826687415,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00046534296841850776,
|
|
"loss": 5.0979,
|
|
"mean_token_accuracy": 0.19232777804136275,
|
|
"num_tokens": 41344966.0,
|
|
"step": 23830
|
|
},
|
|
{
|
|
"entropy": 5.407000494003296,
|
|
"epoch": 1.854464112040459,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.00046532818812297124,
|
|
"loss": 5.0047,
|
|
"mean_token_accuracy": 0.19768527299165725,
|
|
"num_tokens": 41353678.0,
|
|
"step": 23835
|
|
},
|
|
{
|
|
"entropy": 5.53778600692749,
|
|
"epoch": 1.8548531414121765,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.0004653134049395074,
|
|
"loss": 5.2998,
|
|
"mean_token_accuracy": 0.18442942947149277,
|
|
"num_tokens": 41362782.0,
|
|
"step": 23840
|
|
},
|
|
{
|
|
"entropy": 5.42816276550293,
|
|
"epoch": 1.8552421707838942,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0004652986188683406,
|
|
"loss": 5.0996,
|
|
"mean_token_accuracy": 0.1909518375992775,
|
|
"num_tokens": 41370668.0,
|
|
"step": 23845
|
|
},
|
|
{
|
|
"entropy": 5.44040093421936,
|
|
"epoch": 1.855631200155612,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.00046528382990969504,
|
|
"loss": 5.1255,
|
|
"mean_token_accuracy": 0.18699666112661362,
|
|
"num_tokens": 41378945.0,
|
|
"step": 23850
|
|
},
|
|
{
|
|
"entropy": 5.507497787475586,
|
|
"epoch": 1.8560202295273294,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004652690380637953,
|
|
"loss": 5.1562,
|
|
"mean_token_accuracy": 0.18164692521095277,
|
|
"num_tokens": 41387579.0,
|
|
"step": 23855
|
|
},
|
|
{
|
|
"entropy": 5.472086668014526,
|
|
"epoch": 1.8564092588990468,
|
|
"grad_norm": 1.5078125,
|
|
"learning_rate": 0.0004652542433308657,
|
|
"loss": 5.1764,
|
|
"mean_token_accuracy": 0.1848464533686638,
|
|
"num_tokens": 41396472.0,
|
|
"step": 23860
|
|
},
|
|
{
|
|
"entropy": 5.513326978683471,
|
|
"epoch": 1.8567982882707645,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.0004652394457111309,
|
|
"loss": 5.2283,
|
|
"mean_token_accuracy": 0.17720112651586534,
|
|
"num_tokens": 41404599.0,
|
|
"step": 23865
|
|
},
|
|
{
|
|
"entropy": 5.586637163162232,
|
|
"epoch": 1.857187317642482,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.00046522464520481517,
|
|
"loss": 5.2323,
|
|
"mean_token_accuracy": 0.17648339569568633,
|
|
"num_tokens": 41412799.0,
|
|
"step": 23870
|
|
},
|
|
{
|
|
"entropy": 5.441289472579956,
|
|
"epoch": 1.8575763470141995,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.00046520984181214333,
|
|
"loss": 5.0679,
|
|
"mean_token_accuracy": 0.1937624141573906,
|
|
"num_tokens": 41421193.0,
|
|
"step": 23875
|
|
},
|
|
{
|
|
"entropy": 5.411344575881958,
|
|
"epoch": 1.8579653763859172,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0004651950355333398,
|
|
"loss": 5.1043,
|
|
"mean_token_accuracy": 0.1841892957687378,
|
|
"num_tokens": 41430201.0,
|
|
"step": 23880
|
|
},
|
|
{
|
|
"entropy": 5.331236171722412,
|
|
"epoch": 1.8583544057576347,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0004651802263686294,
|
|
"loss": 5.09,
|
|
"mean_token_accuracy": 0.1862233102321625,
|
|
"num_tokens": 41439122.0,
|
|
"step": 23885
|
|
},
|
|
{
|
|
"entropy": 5.448552560806275,
|
|
"epoch": 1.8587434351293521,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0004651654143182367,
|
|
"loss": 5.1376,
|
|
"mean_token_accuracy": 0.1802106276154518,
|
|
"num_tokens": 41448553.0,
|
|
"step": 23890
|
|
},
|
|
{
|
|
"entropy": 5.42213888168335,
|
|
"epoch": 1.8591324645010698,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004651505993823866,
|
|
"loss": 5.0873,
|
|
"mean_token_accuracy": 0.18781908899545668,
|
|
"num_tokens": 41457098.0,
|
|
"step": 23895
|
|
},
|
|
{
|
|
"entropy": 5.454419565200806,
|
|
"epoch": 1.8595214938727875,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00046513578156130383,
|
|
"loss": 5.1601,
|
|
"mean_token_accuracy": 0.1825694814324379,
|
|
"num_tokens": 41465714.0,
|
|
"step": 23900
|
|
},
|
|
{
|
|
"entropy": 5.518798685073852,
|
|
"epoch": 1.859910523244505,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004651209608552131,
|
|
"loss": 5.1669,
|
|
"mean_token_accuracy": 0.18522556722164155,
|
|
"num_tokens": 41474418.0,
|
|
"step": 23905
|
|
},
|
|
{
|
|
"entropy": 5.421759605407715,
|
|
"epoch": 1.8602995526162225,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00046510613726433945,
|
|
"loss": 5.0649,
|
|
"mean_token_accuracy": 0.1904325321316719,
|
|
"num_tokens": 41482430.0,
|
|
"step": 23910
|
|
},
|
|
{
|
|
"entropy": 5.511632966995239,
|
|
"epoch": 1.8606885819879402,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0004650913107889078,
|
|
"loss": 5.2241,
|
|
"mean_token_accuracy": 0.18104615956544876,
|
|
"num_tokens": 41490759.0,
|
|
"step": 23915
|
|
},
|
|
{
|
|
"entropy": 5.343016862869263,
|
|
"epoch": 1.8610776113596577,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.000465076481429143,
|
|
"loss": 5.0625,
|
|
"mean_token_accuracy": 0.19390745759010314,
|
|
"num_tokens": 41499660.0,
|
|
"step": 23920
|
|
},
|
|
{
|
|
"entropy": 5.40338625907898,
|
|
"epoch": 1.8614666407313751,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004650616491852701,
|
|
"loss": 5.0988,
|
|
"mean_token_accuracy": 0.19200483113527297,
|
|
"num_tokens": 41507515.0,
|
|
"step": 23925
|
|
},
|
|
{
|
|
"entropy": 5.49579873085022,
|
|
"epoch": 1.8618556701030928,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.00046504681405751426,
|
|
"loss": 5.169,
|
|
"mean_token_accuracy": 0.18332203328609467,
|
|
"num_tokens": 41515859.0,
|
|
"step": 23930
|
|
},
|
|
{
|
|
"entropy": 5.483397912979126,
|
|
"epoch": 1.8622446994748103,
|
|
"grad_norm": 1.796875,
|
|
"learning_rate": 0.00046503197604610047,
|
|
"loss": 5.1996,
|
|
"mean_token_accuracy": 0.18741641640663148,
|
|
"num_tokens": 41524776.0,
|
|
"step": 23935
|
|
},
|
|
{
|
|
"entropy": 5.48962812423706,
|
|
"epoch": 1.8626337288465278,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00046501713515125393,
|
|
"loss": 5.0987,
|
|
"mean_token_accuracy": 0.19188895523548127,
|
|
"num_tokens": 41532854.0,
|
|
"step": 23940
|
|
},
|
|
{
|
|
"entropy": 5.507185649871826,
|
|
"epoch": 1.8630227582182455,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0004650022913731998,
|
|
"loss": 5.132,
|
|
"mean_token_accuracy": 0.19055043905973434,
|
|
"num_tokens": 41542038.0,
|
|
"step": 23945
|
|
},
|
|
{
|
|
"entropy": 5.466739273071289,
|
|
"epoch": 1.8634117875899632,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00046498744471216335,
|
|
"loss": 5.1228,
|
|
"mean_token_accuracy": 0.18627745658159256,
|
|
"num_tokens": 41550428.0,
|
|
"step": 23950
|
|
},
|
|
{
|
|
"entropy": 5.403680944442749,
|
|
"epoch": 1.8638008169616807,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.00046497259516836974,
|
|
"loss": 5.0879,
|
|
"mean_token_accuracy": 0.18716151863336564,
|
|
"num_tokens": 41559289.0,
|
|
"step": 23955
|
|
},
|
|
{
|
|
"entropy": 5.4214073657989506,
|
|
"epoch": 1.8641898463333981,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00046495774274204446,
|
|
"loss": 5.092,
|
|
"mean_token_accuracy": 0.1917103871703148,
|
|
"num_tokens": 41567901.0,
|
|
"step": 23960
|
|
},
|
|
{
|
|
"entropy": 5.522829484939575,
|
|
"epoch": 1.8645788757051158,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0004649428874334127,
|
|
"loss": 5.2272,
|
|
"mean_token_accuracy": 0.1788163363933563,
|
|
"num_tokens": 41577589.0,
|
|
"step": 23965
|
|
},
|
|
{
|
|
"entropy": 5.534354400634766,
|
|
"epoch": 1.8649679050768333,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0004649280292427,
|
|
"loss": 5.229,
|
|
"mean_token_accuracy": 0.18105229437351228,
|
|
"num_tokens": 41586319.0,
|
|
"step": 23970
|
|
},
|
|
{
|
|
"entropy": 5.533240175247192,
|
|
"epoch": 1.8653569344485508,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.0004649131681701318,
|
|
"loss": 5.1939,
|
|
"mean_token_accuracy": 0.18565918505191803,
|
|
"num_tokens": 41594316.0,
|
|
"step": 23975
|
|
},
|
|
{
|
|
"entropy": 5.446474170684814,
|
|
"epoch": 1.8657459638202685,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.00046489830421593347,
|
|
"loss": 5.1326,
|
|
"mean_token_accuracy": 0.1875303491950035,
|
|
"num_tokens": 41603221.0,
|
|
"step": 23980
|
|
},
|
|
{
|
|
"entropy": 5.441981077194214,
|
|
"epoch": 1.866134993191986,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004648834373803307,
|
|
"loss": 5.1129,
|
|
"mean_token_accuracy": 0.18431846648454667,
|
|
"num_tokens": 41612082.0,
|
|
"step": 23985
|
|
},
|
|
{
|
|
"entropy": 5.462725639343262,
|
|
"epoch": 1.8665240225637034,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00046486856766354893,
|
|
"loss": 5.1053,
|
|
"mean_token_accuracy": 0.1929277554154396,
|
|
"num_tokens": 41619762.0,
|
|
"step": 23990
|
|
},
|
|
{
|
|
"entropy": 5.395091247558594,
|
|
"epoch": 1.8669130519354211,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.00046485369506581387,
|
|
"loss": 5.1173,
|
|
"mean_token_accuracy": 0.18664432615041732,
|
|
"num_tokens": 41627968.0,
|
|
"step": 23995
|
|
},
|
|
{
|
|
"entropy": 5.550791168212891,
|
|
"epoch": 1.8673020813071388,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.00046483881958735124,
|
|
"loss": 5.2176,
|
|
"mean_token_accuracy": 0.17915906757116318,
|
|
"num_tokens": 41636841.0,
|
|
"step": 24000
|
|
},
|
|
{
|
|
"epoch": 1.8673020813071388,
|
|
"eval_entropy": 5.380492646838749,
|
|
"eval_loss": 5.230442047119141,
|
|
"eval_mean_token_accuracy": 0.19026380606547816,
|
|
"eval_num_tokens": 41636841.0,
|
|
"eval_runtime": 28.6082,
|
|
"eval_samples_per_second": 1452.661,
|
|
"eval_steps_per_second": 181.591,
|
|
"step": 24000
|
|
},
|
|
{
|
|
"entropy": 5.5266862392425535,
|
|
"epoch": 1.8676911106788563,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.00046482394122838663,
|
|
"loss": 5.1357,
|
|
"mean_token_accuracy": 0.1859994649887085,
|
|
"num_tokens": 41645352.0,
|
|
"step": 24005
|
|
},
|
|
{
|
|
"entropy": 5.450476932525635,
|
|
"epoch": 1.8680801400505738,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.00046480905998914587,
|
|
"loss": 5.0425,
|
|
"mean_token_accuracy": 0.19373636245727538,
|
|
"num_tokens": 41654296.0,
|
|
"step": 24010
|
|
},
|
|
{
|
|
"entropy": 5.39591703414917,
|
|
"epoch": 1.8684691694222915,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.0004647941758698547,
|
|
"loss": 5.0863,
|
|
"mean_token_accuracy": 0.1860190749168396,
|
|
"num_tokens": 41662008.0,
|
|
"step": 24015
|
|
},
|
|
{
|
|
"entropy": 5.4795468807220455,
|
|
"epoch": 1.868858198794009,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.000464779288870739,
|
|
"loss": 5.26,
|
|
"mean_token_accuracy": 0.1803176909685135,
|
|
"num_tokens": 41671765.0,
|
|
"step": 24020
|
|
},
|
|
{
|
|
"entropy": 5.495187091827392,
|
|
"epoch": 1.8692472281657264,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.00046476439899202464,
|
|
"loss": 5.241,
|
|
"mean_token_accuracy": 0.17707473039627075,
|
|
"num_tokens": 41681035.0,
|
|
"step": 24025
|
|
},
|
|
{
|
|
"entropy": 5.456947278976441,
|
|
"epoch": 1.8696362575374441,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00046474950623393756,
|
|
"loss": 5.1194,
|
|
"mean_token_accuracy": 0.18560980707407,
|
|
"num_tokens": 41689974.0,
|
|
"step": 24030
|
|
},
|
|
{
|
|
"entropy": 5.4655067920684814,
|
|
"epoch": 1.8700252869091616,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004647346105967038,
|
|
"loss": 5.1418,
|
|
"mean_token_accuracy": 0.18478066772222518,
|
|
"num_tokens": 41698560.0,
|
|
"step": 24035
|
|
},
|
|
{
|
|
"entropy": 5.455021619796753,
|
|
"epoch": 1.870414316280879,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0004647197120805493,
|
|
"loss": 5.1244,
|
|
"mean_token_accuracy": 0.18826833069324495,
|
|
"num_tokens": 41706741.0,
|
|
"step": 24040
|
|
},
|
|
{
|
|
"entropy": 5.413682270050049,
|
|
"epoch": 1.8708033456525968,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00046470481068570013,
|
|
"loss": 5.1116,
|
|
"mean_token_accuracy": 0.18616115003824235,
|
|
"num_tokens": 41715685.0,
|
|
"step": 24045
|
|
},
|
|
{
|
|
"entropy": 5.4495823860168455,
|
|
"epoch": 1.8711923750243145,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004646899064123824,
|
|
"loss": 5.2055,
|
|
"mean_token_accuracy": 0.18264019042253493,
|
|
"num_tokens": 41724123.0,
|
|
"step": 24050
|
|
},
|
|
{
|
|
"entropy": 5.497165107727051,
|
|
"epoch": 1.871581404396032,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0004646749992608223,
|
|
"loss": 5.151,
|
|
"mean_token_accuracy": 0.18590733408927917,
|
|
"num_tokens": 41732604.0,
|
|
"step": 24055
|
|
},
|
|
{
|
|
"entropy": 5.355326414108276,
|
|
"epoch": 1.8719704337677494,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0004646600892312459,
|
|
"loss": 5.1068,
|
|
"mean_token_accuracy": 0.18693995326757432,
|
|
"num_tokens": 41740444.0,
|
|
"step": 24060
|
|
},
|
|
{
|
|
"entropy": 5.416489315032959,
|
|
"epoch": 1.872359463139467,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.0004646451763238796,
|
|
"loss": 5.0855,
|
|
"mean_token_accuracy": 0.18208515048027038,
|
|
"num_tokens": 41748800.0,
|
|
"step": 24065
|
|
},
|
|
{
|
|
"entropy": 5.422815942764283,
|
|
"epoch": 1.8727484925111846,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004646302605389496,
|
|
"loss": 5.1295,
|
|
"mean_token_accuracy": 0.18266837298870087,
|
|
"num_tokens": 41757402.0,
|
|
"step": 24070
|
|
},
|
|
{
|
|
"entropy": 5.441775846481323,
|
|
"epoch": 1.873137521882902,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0004646153418766822,
|
|
"loss": 5.1262,
|
|
"mean_token_accuracy": 0.18915594071149827,
|
|
"num_tokens": 41766604.0,
|
|
"step": 24075
|
|
},
|
|
{
|
|
"entropy": 5.535004997253418,
|
|
"epoch": 1.8735265512546198,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.00046460042033730377,
|
|
"loss": 5.3147,
|
|
"mean_token_accuracy": 0.1752936527132988,
|
|
"num_tokens": 41775450.0,
|
|
"step": 24080
|
|
},
|
|
{
|
|
"entropy": 5.5326714515686035,
|
|
"epoch": 1.8739155806263375,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0004645854959210408,
|
|
"loss": 5.2726,
|
|
"mean_token_accuracy": 0.1808071792125702,
|
|
"num_tokens": 41784355.0,
|
|
"step": 24085
|
|
},
|
|
{
|
|
"entropy": 5.471151542663574,
|
|
"epoch": 1.8743046099980547,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.00046457056862811956,
|
|
"loss": 5.1161,
|
|
"mean_token_accuracy": 0.18049731105566025,
|
|
"num_tokens": 41793441.0,
|
|
"step": 24090
|
|
},
|
|
{
|
|
"entropy": 5.474300336837769,
|
|
"epoch": 1.8746936393697724,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0004645556384587668,
|
|
"loss": 5.0899,
|
|
"mean_token_accuracy": 0.1900794431567192,
|
|
"num_tokens": 41802407.0,
|
|
"step": 24095
|
|
},
|
|
{
|
|
"entropy": 5.482835960388184,
|
|
"epoch": 1.87508266874149,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004645407054132089,
|
|
"loss": 5.1431,
|
|
"mean_token_accuracy": 0.18311664015054702,
|
|
"num_tokens": 41810362.0,
|
|
"step": 24100
|
|
},
|
|
{
|
|
"entropy": 5.4221290111541744,
|
|
"epoch": 1.8754716981132076,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0004645257694916725,
|
|
"loss": 5.2444,
|
|
"mean_token_accuracy": 0.1821636825799942,
|
|
"num_tokens": 41819332.0,
|
|
"step": 24105
|
|
},
|
|
{
|
|
"entropy": 5.446872663497925,
|
|
"epoch": 1.875860727484925,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0004645108306943842,
|
|
"loss": 5.0976,
|
|
"mean_token_accuracy": 0.19056933522224426,
|
|
"num_tokens": 41828048.0,
|
|
"step": 24110
|
|
},
|
|
{
|
|
"entropy": 5.42320146560669,
|
|
"epoch": 1.8762497568566427,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004644958890215707,
|
|
"loss": 5.0786,
|
|
"mean_token_accuracy": 0.18683300763368607,
|
|
"num_tokens": 41836583.0,
|
|
"step": 24115
|
|
},
|
|
{
|
|
"entropy": 5.4503031253814695,
|
|
"epoch": 1.8766387862283602,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0004644809444734586,
|
|
"loss": 5.1403,
|
|
"mean_token_accuracy": 0.18270149528980256,
|
|
"num_tokens": 41845454.0,
|
|
"step": 24120
|
|
},
|
|
{
|
|
"entropy": 5.480255508422852,
|
|
"epoch": 1.8770278156000777,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.00046446599705027487,
|
|
"loss": 5.1182,
|
|
"mean_token_accuracy": 0.18268312364816666,
|
|
"num_tokens": 41854481.0,
|
|
"step": 24125
|
|
},
|
|
{
|
|
"entropy": 5.487434673309326,
|
|
"epoch": 1.8774168449717954,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00046445104675224607,
|
|
"loss": 5.1835,
|
|
"mean_token_accuracy": 0.183938130736351,
|
|
"num_tokens": 41863015.0,
|
|
"step": 24130
|
|
},
|
|
{
|
|
"entropy": 5.491235446929932,
|
|
"epoch": 1.877805874343513,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0004644360935795993,
|
|
"loss": 5.1583,
|
|
"mean_token_accuracy": 0.1808243975043297,
|
|
"num_tokens": 41871703.0,
|
|
"step": 24135
|
|
},
|
|
{
|
|
"entropy": 5.449118280410767,
|
|
"epoch": 1.8781949037152303,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.00046442113753256126,
|
|
"loss": 5.1005,
|
|
"mean_token_accuracy": 0.1816903308033943,
|
|
"num_tokens": 41880136.0,
|
|
"step": 24140
|
|
},
|
|
{
|
|
"entropy": 5.448924493789673,
|
|
"epoch": 1.878583933086948,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.00046440617861135905,
|
|
"loss": 5.2369,
|
|
"mean_token_accuracy": 0.1787792518734932,
|
|
"num_tokens": 41889065.0,
|
|
"step": 24145
|
|
},
|
|
{
|
|
"entropy": 5.448483324050903,
|
|
"epoch": 1.8789729624586657,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004643912168162194,
|
|
"loss": 5.0705,
|
|
"mean_token_accuracy": 0.1882781967520714,
|
|
"num_tokens": 41898160.0,
|
|
"step": 24150
|
|
},
|
|
{
|
|
"entropy": 5.488494491577148,
|
|
"epoch": 1.8793619918303832,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004643762521473696,
|
|
"loss": 5.1413,
|
|
"mean_token_accuracy": 0.18804794400930405,
|
|
"num_tokens": 41907037.0,
|
|
"step": 24155
|
|
},
|
|
{
|
|
"entropy": 5.499371433258057,
|
|
"epoch": 1.8797510212021007,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004643612846050366,
|
|
"loss": 5.2147,
|
|
"mean_token_accuracy": 0.17527129054069518,
|
|
"num_tokens": 41915176.0,
|
|
"step": 24160
|
|
},
|
|
{
|
|
"entropy": 5.512415170669556,
|
|
"epoch": 1.8801400505738184,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00046434631418944744,
|
|
"loss": 5.2122,
|
|
"mean_token_accuracy": 0.18202699422836305,
|
|
"num_tokens": 41923586.0,
|
|
"step": 24165
|
|
},
|
|
{
|
|
"entropy": 5.511921453475952,
|
|
"epoch": 1.8805290799455359,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.0004643313409008294,
|
|
"loss": 5.266,
|
|
"mean_token_accuracy": 0.1721154823899269,
|
|
"num_tokens": 41932803.0,
|
|
"step": 24170
|
|
},
|
|
{
|
|
"entropy": 5.485407114028931,
|
|
"epoch": 1.8809181093172533,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00046431636473940956,
|
|
"loss": 5.1712,
|
|
"mean_token_accuracy": 0.18699372559785843,
|
|
"num_tokens": 41941737.0,
|
|
"step": 24175
|
|
},
|
|
{
|
|
"entropy": 5.48391489982605,
|
|
"epoch": 1.881307138688971,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0004643013857054152,
|
|
"loss": 5.0941,
|
|
"mean_token_accuracy": 0.18542088866233825,
|
|
"num_tokens": 41950099.0,
|
|
"step": 24180
|
|
},
|
|
{
|
|
"entropy": 5.45158576965332,
|
|
"epoch": 1.8816961680606887,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00046428640379907367,
|
|
"loss": 5.1516,
|
|
"mean_token_accuracy": 0.18314019441604615,
|
|
"num_tokens": 41959091.0,
|
|
"step": 24185
|
|
},
|
|
{
|
|
"entropy": 5.485082626342773,
|
|
"epoch": 1.882085197432406,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00046427141902061225,
|
|
"loss": 5.0865,
|
|
"mean_token_accuracy": 0.1891992837190628,
|
|
"num_tokens": 41968462.0,
|
|
"step": 24190
|
|
},
|
|
{
|
|
"entropy": 5.461593055725098,
|
|
"epoch": 1.8824742268041237,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0004642564313702582,
|
|
"loss": 5.1609,
|
|
"mean_token_accuracy": 0.18333583623170852,
|
|
"num_tokens": 41976514.0,
|
|
"step": 24195
|
|
},
|
|
{
|
|
"entropy": 5.3711991786956785,
|
|
"epoch": 1.8828632561758414,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00046424144084823916,
|
|
"loss": 5.0572,
|
|
"mean_token_accuracy": 0.18507618010044097,
|
|
"num_tokens": 41985583.0,
|
|
"step": 24200
|
|
},
|
|
{
|
|
"entropy": 5.393287515640258,
|
|
"epoch": 1.8832522855475589,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0004642264474547824,
|
|
"loss": 5.0754,
|
|
"mean_token_accuracy": 0.1862674370408058,
|
|
"num_tokens": 41993684.0,
|
|
"step": 24205
|
|
},
|
|
{
|
|
"entropy": 5.422995138168335,
|
|
"epoch": 1.8836413149192763,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00046421145119011556,
|
|
"loss": 5.0246,
|
|
"mean_token_accuracy": 0.1907213494181633,
|
|
"num_tokens": 42002239.0,
|
|
"step": 24210
|
|
},
|
|
{
|
|
"entropy": 5.340552234649659,
|
|
"epoch": 1.884030344290994,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.000464196452054466,
|
|
"loss": 5.0278,
|
|
"mean_token_accuracy": 0.1945103958249092,
|
|
"num_tokens": 42010886.0,
|
|
"step": 24215
|
|
},
|
|
{
|
|
"entropy": 5.441726779937744,
|
|
"epoch": 1.8844193736627115,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0004641814500480615,
|
|
"loss": 5.1988,
|
|
"mean_token_accuracy": 0.17802906185388565,
|
|
"num_tokens": 42019703.0,
|
|
"step": 24220
|
|
},
|
|
{
|
|
"entropy": 5.540903568267822,
|
|
"epoch": 1.884808403034429,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004641664451711296,
|
|
"loss": 5.2442,
|
|
"mean_token_accuracy": 0.18060047924518585,
|
|
"num_tokens": 42028467.0,
|
|
"step": 24225
|
|
},
|
|
{
|
|
"entropy": 5.462961435317993,
|
|
"epoch": 1.8851974324061467,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00046415143742389793,
|
|
"loss": 5.1124,
|
|
"mean_token_accuracy": 0.18888040035963058,
|
|
"num_tokens": 42037220.0,
|
|
"step": 24230
|
|
},
|
|
{
|
|
"entropy": 5.480625820159912,
|
|
"epoch": 1.8855864617778644,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0004641364268065943,
|
|
"loss": 5.2162,
|
|
"mean_token_accuracy": 0.1797845646739006,
|
|
"num_tokens": 42046034.0,
|
|
"step": 24235
|
|
},
|
|
{
|
|
"entropy": 5.4537468433380125,
|
|
"epoch": 1.8859754911495816,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.00046412141331944644,
|
|
"loss": 5.1045,
|
|
"mean_token_accuracy": 0.1865515887737274,
|
|
"num_tokens": 42054659.0,
|
|
"step": 24240
|
|
},
|
|
{
|
|
"entropy": 5.49623441696167,
|
|
"epoch": 1.8863645205212993,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00046410639696268206,
|
|
"loss": 5.1771,
|
|
"mean_token_accuracy": 0.18167802691459656,
|
|
"num_tokens": 42063130.0,
|
|
"step": 24245
|
|
},
|
|
{
|
|
"entropy": 5.506428575515747,
|
|
"epoch": 1.886753549893017,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.0004640913777365292,
|
|
"loss": 5.1947,
|
|
"mean_token_accuracy": 0.17898126542568207,
|
|
"num_tokens": 42071162.0,
|
|
"step": 24250
|
|
},
|
|
{
|
|
"entropy": 5.4653017044067385,
|
|
"epoch": 1.8871425792647345,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00046407635564121565,
|
|
"loss": 5.1908,
|
|
"mean_token_accuracy": 0.18648219108581543,
|
|
"num_tokens": 42079948.0,
|
|
"step": 24255
|
|
},
|
|
{
|
|
"entropy": 5.4793616771698,
|
|
"epoch": 1.887531608636452,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.00046406133067696936,
|
|
"loss": 5.1788,
|
|
"mean_token_accuracy": 0.1828402191400528,
|
|
"num_tokens": 42089010.0,
|
|
"step": 24260
|
|
},
|
|
{
|
|
"entropy": 5.539972543716431,
|
|
"epoch": 1.8879206380081697,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0004640463028440182,
|
|
"loss": 5.175,
|
|
"mean_token_accuracy": 0.17774557769298555,
|
|
"num_tokens": 42097096.0,
|
|
"step": 24265
|
|
},
|
|
{
|
|
"entropy": 5.3504071712493895,
|
|
"epoch": 1.8883096673798871,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0004640312721425904,
|
|
"loss": 5.0427,
|
|
"mean_token_accuracy": 0.19138125628232955,
|
|
"num_tokens": 42105870.0,
|
|
"step": 24270
|
|
},
|
|
{
|
|
"entropy": 5.399279975891114,
|
|
"epoch": 1.8886986967516046,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0004640162385729139,
|
|
"loss": 5.0891,
|
|
"mean_token_accuracy": 0.19263002127408982,
|
|
"num_tokens": 42114246.0,
|
|
"step": 24275
|
|
},
|
|
{
|
|
"entropy": 5.429887962341309,
|
|
"epoch": 1.8890877261233223,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004640012021352168,
|
|
"loss": 5.0685,
|
|
"mean_token_accuracy": 0.1853076249361038,
|
|
"num_tokens": 42122163.0,
|
|
"step": 24280
|
|
},
|
|
{
|
|
"entropy": 5.455728530883789,
|
|
"epoch": 1.88947675549504,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0004639861628297273,
|
|
"loss": 5.1376,
|
|
"mean_token_accuracy": 0.1869522973895073,
|
|
"num_tokens": 42130255.0,
|
|
"step": 24285
|
|
},
|
|
{
|
|
"entropy": 5.514939880371093,
|
|
"epoch": 1.8898657848667575,
|
|
"grad_norm": 1.6640625,
|
|
"learning_rate": 0.00046397112065667354,
|
|
"loss": 5.1811,
|
|
"mean_token_accuracy": 0.1795892223715782,
|
|
"num_tokens": 42138615.0,
|
|
"step": 24290
|
|
},
|
|
{
|
|
"entropy": 5.413795852661133,
|
|
"epoch": 1.890254814238475,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00046395607561628387,
|
|
"loss": 5.0459,
|
|
"mean_token_accuracy": 0.1937818080186844,
|
|
"num_tokens": 42146502.0,
|
|
"step": 24295
|
|
},
|
|
{
|
|
"entropy": 5.432741117477417,
|
|
"epoch": 1.8906438436101927,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00046394102770878643,
|
|
"loss": 5.1551,
|
|
"mean_token_accuracy": 0.18316398113965987,
|
|
"num_tokens": 42155548.0,
|
|
"step": 24300
|
|
},
|
|
{
|
|
"entropy": 5.3302037715911865,
|
|
"epoch": 1.8910328729819101,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.00046392597693440974,
|
|
"loss": 4.9489,
|
|
"mean_token_accuracy": 0.20085753351449967,
|
|
"num_tokens": 42163813.0,
|
|
"step": 24305
|
|
},
|
|
{
|
|
"entropy": 5.495096683502197,
|
|
"epoch": 1.8914219023536276,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0004639109232933819,
|
|
"loss": 5.1986,
|
|
"mean_token_accuracy": 0.1790920078754425,
|
|
"num_tokens": 42172702.0,
|
|
"step": 24310
|
|
},
|
|
{
|
|
"entropy": 5.514695119857788,
|
|
"epoch": 1.8918109317253453,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0004638958667859316,
|
|
"loss": 5.2212,
|
|
"mean_token_accuracy": 0.18217707723379134,
|
|
"num_tokens": 42180776.0,
|
|
"step": 24315
|
|
},
|
|
{
|
|
"entropy": 5.49624195098877,
|
|
"epoch": 1.8921999610970628,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004638808074122872,
|
|
"loss": 5.1621,
|
|
"mean_token_accuracy": 0.1908087506890297,
|
|
"num_tokens": 42189695.0,
|
|
"step": 24320
|
|
},
|
|
{
|
|
"entropy": 5.376805114746094,
|
|
"epoch": 1.8925889904687803,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004638657451726771,
|
|
"loss": 5.1279,
|
|
"mean_token_accuracy": 0.18282254040241241,
|
|
"num_tokens": 42197884.0,
|
|
"step": 24325
|
|
},
|
|
{
|
|
"entropy": 5.494823408126831,
|
|
"epoch": 1.892978019840498,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.00046385068006732995,
|
|
"loss": 5.2617,
|
|
"mean_token_accuracy": 0.1761353686451912,
|
|
"num_tokens": 42206800.0,
|
|
"step": 24330
|
|
},
|
|
{
|
|
"entropy": 5.5054925918579105,
|
|
"epoch": 1.8933670492122157,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00046383561209647437,
|
|
"loss": 5.1279,
|
|
"mean_token_accuracy": 0.1979553744196892,
|
|
"num_tokens": 42216091.0,
|
|
"step": 24335
|
|
},
|
|
{
|
|
"entropy": 5.475465106964111,
|
|
"epoch": 1.8937560785839331,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00046382054126033884,
|
|
"loss": 5.1287,
|
|
"mean_token_accuracy": 0.18983456641435623,
|
|
"num_tokens": 42224675.0,
|
|
"step": 24340
|
|
},
|
|
{
|
|
"entropy": 5.470264053344726,
|
|
"epoch": 1.8941451079556506,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0004638054675591523,
|
|
"loss": 5.1531,
|
|
"mean_token_accuracy": 0.18400678187608718,
|
|
"num_tokens": 42232964.0,
|
|
"step": 24345
|
|
},
|
|
{
|
|
"entropy": 5.462781620025635,
|
|
"epoch": 1.8945341373273683,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0004637903909931432,
|
|
"loss": 5.1919,
|
|
"mean_token_accuracy": 0.17613836675882338,
|
|
"num_tokens": 42241932.0,
|
|
"step": 24350
|
|
},
|
|
{
|
|
"entropy": 5.412767696380615,
|
|
"epoch": 1.8949231666990858,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004637753115625404,
|
|
"loss": 4.9686,
|
|
"mean_token_accuracy": 0.19227485209703446,
|
|
"num_tokens": 42250146.0,
|
|
"step": 24355
|
|
},
|
|
{
|
|
"entropy": 5.456176233291626,
|
|
"epoch": 1.8953121960708033,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0004637602292675726,
|
|
"loss": 5.2365,
|
|
"mean_token_accuracy": 0.17850709706544876,
|
|
"num_tokens": 42259183.0,
|
|
"step": 24360
|
|
},
|
|
{
|
|
"entropy": 5.455179071426391,
|
|
"epoch": 1.895701225442521,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004637451441084689,
|
|
"loss": 5.2485,
|
|
"mean_token_accuracy": 0.17562604546546937,
|
|
"num_tokens": 42268436.0,
|
|
"step": 24365
|
|
},
|
|
{
|
|
"entropy": 5.551352071762085,
|
|
"epoch": 1.8960902548142384,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004637300560854581,
|
|
"loss": 5.1947,
|
|
"mean_token_accuracy": 0.18590783178806305,
|
|
"num_tokens": 42277146.0,
|
|
"step": 24370
|
|
},
|
|
{
|
|
"entropy": 5.558286809921265,
|
|
"epoch": 1.896479284185956,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.000463714965198769,
|
|
"loss": 5.1508,
|
|
"mean_token_accuracy": 0.1794161766767502,
|
|
"num_tokens": 42286571.0,
|
|
"step": 24375
|
|
},
|
|
{
|
|
"entropy": 5.42723913192749,
|
|
"epoch": 1.8968683135576736,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004636998714486307,
|
|
"loss": 5.0851,
|
|
"mean_token_accuracy": 0.19385833889245987,
|
|
"num_tokens": 42295415.0,
|
|
"step": 24380
|
|
},
|
|
{
|
|
"entropy": 5.4739855289459225,
|
|
"epoch": 1.8972573429293913,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00046368477483527224,
|
|
"loss": 5.1722,
|
|
"mean_token_accuracy": 0.1810181975364685,
|
|
"num_tokens": 42305105.0,
|
|
"step": 24385
|
|
},
|
|
{
|
|
"entropy": 5.481757926940918,
|
|
"epoch": 1.8976463723011088,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0004636696753589226,
|
|
"loss": 5.0366,
|
|
"mean_token_accuracy": 0.1917433187365532,
|
|
"num_tokens": 42313034.0,
|
|
"step": 24390
|
|
},
|
|
{
|
|
"entropy": 5.405845308303833,
|
|
"epoch": 1.8980354016728263,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0004636545730198109,
|
|
"loss": 5.136,
|
|
"mean_token_accuracy": 0.18503344506025315,
|
|
"num_tokens": 42321249.0,
|
|
"step": 24395
|
|
},
|
|
{
|
|
"entropy": 5.420350980758667,
|
|
"epoch": 1.898424431044544,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.00046363946781816643,
|
|
"loss": 5.1489,
|
|
"mean_token_accuracy": 0.1881787061691284,
|
|
"num_tokens": 42329519.0,
|
|
"step": 24400
|
|
},
|
|
{
|
|
"entropy": 5.529286289215088,
|
|
"epoch": 1.8988134604162614,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00046362435975421816,
|
|
"loss": 5.191,
|
|
"mean_token_accuracy": 0.18424092680215837,
|
|
"num_tokens": 42338318.0,
|
|
"step": 24405
|
|
},
|
|
{
|
|
"entropy": 5.417074966430664,
|
|
"epoch": 1.899202489787979,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.00046360924882819554,
|
|
"loss": 5.1298,
|
|
"mean_token_accuracy": 0.18776854127645493,
|
|
"num_tokens": 42346038.0,
|
|
"step": 24410
|
|
},
|
|
{
|
|
"entropy": 5.466696119308471,
|
|
"epoch": 1.8995915191596966,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004635941350403277,
|
|
"loss": 5.1104,
|
|
"mean_token_accuracy": 0.19031398743391037,
|
|
"num_tokens": 42356280.0,
|
|
"step": 24415
|
|
},
|
|
{
|
|
"entropy": 5.445505619049072,
|
|
"epoch": 1.899980548531414,
|
|
"grad_norm": 1.640625,
|
|
"learning_rate": 0.0004635790183908442,
|
|
"loss": 5.0651,
|
|
"mean_token_accuracy": 0.1950129747390747,
|
|
"num_tokens": 42364716.0,
|
|
"step": 24420
|
|
},
|
|
{
|
|
"entropy": 5.425743818283081,
|
|
"epoch": 1.9003695779031315,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00046356389887997415,
|
|
"loss": 5.1956,
|
|
"mean_token_accuracy": 0.1796469733119011,
|
|
"num_tokens": 42373137.0,
|
|
"step": 24425
|
|
},
|
|
{
|
|
"entropy": 5.40011944770813,
|
|
"epoch": 1.9007586072748492,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00046354877650794707,
|
|
"loss": 5.0912,
|
|
"mean_token_accuracy": 0.18302094787359238,
|
|
"num_tokens": 42382054.0,
|
|
"step": 24430
|
|
},
|
|
{
|
|
"entropy": 5.481983041763305,
|
|
"epoch": 1.901147636646567,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.00046353365127499235,
|
|
"loss": 5.1081,
|
|
"mean_token_accuracy": 0.17981300204992295,
|
|
"num_tokens": 42391228.0,
|
|
"step": 24435
|
|
},
|
|
{
|
|
"entropy": 5.4944939613342285,
|
|
"epoch": 1.9015366660182844,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004635185231813396,
|
|
"loss": 5.0988,
|
|
"mean_token_accuracy": 0.1865064412355423,
|
|
"num_tokens": 42400178.0,
|
|
"step": 24440
|
|
},
|
|
{
|
|
"entropy": 5.420658588409424,
|
|
"epoch": 1.901925695390002,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004635033922272183,
|
|
"loss": 5.1117,
|
|
"mean_token_accuracy": 0.19379601627588272,
|
|
"num_tokens": 42408515.0,
|
|
"step": 24445
|
|
},
|
|
{
|
|
"entropy": 5.510571908950806,
|
|
"epoch": 1.9023147247617196,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.00046348825841285813,
|
|
"loss": 5.1811,
|
|
"mean_token_accuracy": 0.1778416246175766,
|
|
"num_tokens": 42417291.0,
|
|
"step": 24450
|
|
},
|
|
{
|
|
"entropy": 5.583145618438721,
|
|
"epoch": 1.902703754133437,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004634731217384886,
|
|
"loss": 5.326,
|
|
"mean_token_accuracy": 0.16752185225486754,
|
|
"num_tokens": 42426371.0,
|
|
"step": 24455
|
|
},
|
|
{
|
|
"entropy": 5.569092416763306,
|
|
"epoch": 1.9030927835051545,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0004634579822043394,
|
|
"loss": 5.2723,
|
|
"mean_token_accuracy": 0.18250429183244704,
|
|
"num_tokens": 42434767.0,
|
|
"step": 24460
|
|
},
|
|
{
|
|
"entropy": 5.4466503143310545,
|
|
"epoch": 1.9034818128768722,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00046344283981064035,
|
|
"loss": 5.1719,
|
|
"mean_token_accuracy": 0.1882934659719467,
|
|
"num_tokens": 42443618.0,
|
|
"step": 24465
|
|
},
|
|
{
|
|
"entropy": 5.4528656005859375,
|
|
"epoch": 1.90387084224859,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00046342769455762114,
|
|
"loss": 5.1294,
|
|
"mean_token_accuracy": 0.1855500340461731,
|
|
"num_tokens": 42453134.0,
|
|
"step": 24470
|
|
},
|
|
{
|
|
"entropy": 5.504497766494751,
|
|
"epoch": 1.9042598716203072,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0004634125464455116,
|
|
"loss": 5.1507,
|
|
"mean_token_accuracy": 0.18050836622714997,
|
|
"num_tokens": 42462037.0,
|
|
"step": 24475
|
|
},
|
|
{
|
|
"entropy": 5.4474996566772464,
|
|
"epoch": 1.9046489009920249,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00046339739547454146,
|
|
"loss": 5.0777,
|
|
"mean_token_accuracy": 0.192548730969429,
|
|
"num_tokens": 42471318.0,
|
|
"step": 24480
|
|
},
|
|
{
|
|
"entropy": 5.360402393341064,
|
|
"epoch": 1.9050379303637426,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.00046338224164494074,
|
|
"loss": 5.1561,
|
|
"mean_token_accuracy": 0.18694016337394714,
|
|
"num_tokens": 42478851.0,
|
|
"step": 24485
|
|
},
|
|
{
|
|
"entropy": 5.3954911708831785,
|
|
"epoch": 1.90542695973546,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00046336708495693933,
|
|
"loss": 5.1003,
|
|
"mean_token_accuracy": 0.19183557033538817,
|
|
"num_tokens": 42488406.0,
|
|
"step": 24490
|
|
},
|
|
{
|
|
"entropy": 5.4864085674285885,
|
|
"epoch": 1.9058159891071775,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.00046335192541076725,
|
|
"loss": 5.0276,
|
|
"mean_token_accuracy": 0.19632097482681274,
|
|
"num_tokens": 42496001.0,
|
|
"step": 24495
|
|
},
|
|
{
|
|
"entropy": 5.430177211761475,
|
|
"epoch": 1.9062050184788952,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004633367630066545,
|
|
"loss": 5.1895,
|
|
"mean_token_accuracy": 0.17867903858423234,
|
|
"num_tokens": 42504808.0,
|
|
"step": 24500
|
|
},
|
|
{
|
|
"entropy": 5.433420038223266,
|
|
"epoch": 1.9065940478506127,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.00046332159774483116,
|
|
"loss": 5.1074,
|
|
"mean_token_accuracy": 0.19030864387750626,
|
|
"num_tokens": 42512885.0,
|
|
"step": 24505
|
|
},
|
|
{
|
|
"entropy": 5.447889995574951,
|
|
"epoch": 1.9069830772223302,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004633064296255273,
|
|
"loss": 5.0947,
|
|
"mean_token_accuracy": 0.1861974447965622,
|
|
"num_tokens": 42521481.0,
|
|
"step": 24510
|
|
},
|
|
{
|
|
"entropy": 5.48263258934021,
|
|
"epoch": 1.9073721065940479,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00046329125864897307,
|
|
"loss": 5.1385,
|
|
"mean_token_accuracy": 0.18121411502361298,
|
|
"num_tokens": 42529784.0,
|
|
"step": 24515
|
|
},
|
|
{
|
|
"entropy": 5.426755332946778,
|
|
"epoch": 1.9077611359657656,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0004632760848153987,
|
|
"loss": 5.0192,
|
|
"mean_token_accuracy": 0.19041645675897598,
|
|
"num_tokens": 42538802.0,
|
|
"step": 24520
|
|
},
|
|
{
|
|
"entropy": 5.392244148254394,
|
|
"epoch": 1.9081501653374828,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0004632609081250345,
|
|
"loss": 5.0574,
|
|
"mean_token_accuracy": 0.19062934517860414,
|
|
"num_tokens": 42547699.0,
|
|
"step": 24525
|
|
},
|
|
{
|
|
"entropy": 5.393301486968994,
|
|
"epoch": 1.9085391947092005,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00046324572857811054,
|
|
"loss": 5.1296,
|
|
"mean_token_accuracy": 0.18558546751737595,
|
|
"num_tokens": 42556583.0,
|
|
"step": 24530
|
|
},
|
|
{
|
|
"entropy": 5.384571361541748,
|
|
"epoch": 1.9089282240809182,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004632305461748573,
|
|
"loss": 5.0177,
|
|
"mean_token_accuracy": 0.19932078719139099,
|
|
"num_tokens": 42565025.0,
|
|
"step": 24535
|
|
},
|
|
{
|
|
"entropy": 5.423727178573609,
|
|
"epoch": 1.9093172534526357,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.00046321536091550517,
|
|
"loss": 5.142,
|
|
"mean_token_accuracy": 0.18057762533426286,
|
|
"num_tokens": 42573798.0,
|
|
"step": 24540
|
|
},
|
|
{
|
|
"entropy": 5.446083974838257,
|
|
"epoch": 1.9097062828243532,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0004632001728002845,
|
|
"loss": 5.1086,
|
|
"mean_token_accuracy": 0.18416004925966262,
|
|
"num_tokens": 42582002.0,
|
|
"step": 24545
|
|
},
|
|
{
|
|
"entropy": 5.589301681518554,
|
|
"epoch": 1.9100953121960709,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0004631849818294257,
|
|
"loss": 5.1405,
|
|
"mean_token_accuracy": 0.18021992295980455,
|
|
"num_tokens": 42591387.0,
|
|
"step": 24550
|
|
},
|
|
{
|
|
"entropy": 5.497700452804565,
|
|
"epoch": 1.9104843415677883,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.00046316978800315934,
|
|
"loss": 5.231,
|
|
"mean_token_accuracy": 0.1809960275888443,
|
|
"num_tokens": 42599769.0,
|
|
"step": 24555
|
|
},
|
|
{
|
|
"entropy": 5.34881911277771,
|
|
"epoch": 1.9108733709395058,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.000463154591321716,
|
|
"loss": 5.0277,
|
|
"mean_token_accuracy": 0.1919092983007431,
|
|
"num_tokens": 42608279.0,
|
|
"step": 24560
|
|
},
|
|
{
|
|
"entropy": 5.423420381546021,
|
|
"epoch": 1.9112624003112235,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00046313939178532624,
|
|
"loss": 5.1158,
|
|
"mean_token_accuracy": 0.1857924073934555,
|
|
"num_tokens": 42616652.0,
|
|
"step": 24565
|
|
},
|
|
{
|
|
"entropy": 5.380179357528687,
|
|
"epoch": 1.9116514296829412,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004631241893942206,
|
|
"loss": 5.0808,
|
|
"mean_token_accuracy": 0.18766250014305114,
|
|
"num_tokens": 42625629.0,
|
|
"step": 24570
|
|
},
|
|
{
|
|
"entropy": 5.442630004882813,
|
|
"epoch": 1.9120404590546585,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00046310898414862983,
|
|
"loss": 5.1462,
|
|
"mean_token_accuracy": 0.19131480902433395,
|
|
"num_tokens": 42634159.0,
|
|
"step": 24575
|
|
},
|
|
{
|
|
"entropy": 5.560131168365478,
|
|
"epoch": 1.9124294884263762,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004630937760487847,
|
|
"loss": 5.2494,
|
|
"mean_token_accuracy": 0.17558962255716323,
|
|
"num_tokens": 42642880.0,
|
|
"step": 24580
|
|
},
|
|
{
|
|
"entropy": 5.495311832427978,
|
|
"epoch": 1.9128185177980939,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0004630785650949158,
|
|
"loss": 5.1768,
|
|
"mean_token_accuracy": 0.18522849380970002,
|
|
"num_tokens": 42651481.0,
|
|
"step": 24585
|
|
},
|
|
{
|
|
"entropy": 5.446254014968872,
|
|
"epoch": 1.9132075471698113,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0004630633512872541,
|
|
"loss": 5.1475,
|
|
"mean_token_accuracy": 0.19237289279699327,
|
|
"num_tokens": 42660131.0,
|
|
"step": 24590
|
|
},
|
|
{
|
|
"entropy": 5.429976272583008,
|
|
"epoch": 1.9135965765415288,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00046304813462603035,
|
|
"loss": 5.142,
|
|
"mean_token_accuracy": 0.19099409878253937,
|
|
"num_tokens": 42669094.0,
|
|
"step": 24595
|
|
},
|
|
{
|
|
"entropy": 5.478194856643677,
|
|
"epoch": 1.9139856059132465,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0004630329151114754,
|
|
"loss": 5.1169,
|
|
"mean_token_accuracy": 0.19230376780033112,
|
|
"num_tokens": 42677792.0,
|
|
"step": 24600
|
|
},
|
|
{
|
|
"entropy": 5.479537582397461,
|
|
"epoch": 1.914374635284964,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00046301769274382034,
|
|
"loss": 5.1542,
|
|
"mean_token_accuracy": 0.19036847800016404,
|
|
"num_tokens": 42686397.0,
|
|
"step": 24605
|
|
},
|
|
{
|
|
"entropy": 5.454549646377563,
|
|
"epoch": 1.9147636646566815,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0004630024675232961,
|
|
"loss": 5.0916,
|
|
"mean_token_accuracy": 0.18972334861755372,
|
|
"num_tokens": 42695832.0,
|
|
"step": 24610
|
|
},
|
|
{
|
|
"entropy": 5.469930601119995,
|
|
"epoch": 1.9151526940283992,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.00046298723945013354,
|
|
"loss": 5.1451,
|
|
"mean_token_accuracy": 0.18490809500217437,
|
|
"num_tokens": 42704378.0,
|
|
"step": 24615
|
|
},
|
|
{
|
|
"entropy": 5.452401351928711,
|
|
"epoch": 1.9155417234001169,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004629720085245639,
|
|
"loss": 5.1078,
|
|
"mean_token_accuracy": 0.18363269716501235,
|
|
"num_tokens": 42713926.0,
|
|
"step": 24620
|
|
},
|
|
{
|
|
"entropy": 5.4834692001342775,
|
|
"epoch": 1.9159307527718341,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0004629567747468182,
|
|
"loss": 5.0692,
|
|
"mean_token_accuracy": 0.19204634577035903,
|
|
"num_tokens": 42722779.0,
|
|
"step": 24625
|
|
},
|
|
{
|
|
"entropy": 5.385450744628907,
|
|
"epoch": 1.9163197821435518,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004629415381171276,
|
|
"loss": 5.0499,
|
|
"mean_token_accuracy": 0.18571332693099976,
|
|
"num_tokens": 42731460.0,
|
|
"step": 24630
|
|
},
|
|
{
|
|
"entropy": 5.438055324554443,
|
|
"epoch": 1.9167088115152695,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00046292629863572325,
|
|
"loss": 5.1494,
|
|
"mean_token_accuracy": 0.18549105077981948,
|
|
"num_tokens": 42739733.0,
|
|
"step": 24635
|
|
},
|
|
{
|
|
"entropy": 5.5339795589447025,
|
|
"epoch": 1.917097840886987,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0004629110563028365,
|
|
"loss": 5.1587,
|
|
"mean_token_accuracy": 0.18147716224193572,
|
|
"num_tokens": 42748330.0,
|
|
"step": 24640
|
|
},
|
|
{
|
|
"entropy": 5.432466793060303,
|
|
"epoch": 1.9174868702587045,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004628958111186985,
|
|
"loss": 5.1644,
|
|
"mean_token_accuracy": 0.18176979273557664,
|
|
"num_tokens": 42757423.0,
|
|
"step": 24645
|
|
},
|
|
{
|
|
"entropy": 5.422976541519165,
|
|
"epoch": 1.9178758996304222,
|
|
"grad_norm": 1.5625,
|
|
"learning_rate": 0.0004628805630835407,
|
|
"loss": 5.1849,
|
|
"mean_token_accuracy": 0.17496306002140044,
|
|
"num_tokens": 42766213.0,
|
|
"step": 24650
|
|
},
|
|
{
|
|
"entropy": 5.5416652202606205,
|
|
"epoch": 1.9182649290021396,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0004628653121975944,
|
|
"loss": 5.1672,
|
|
"mean_token_accuracy": 0.1883589044213295,
|
|
"num_tokens": 42774037.0,
|
|
"step": 24655
|
|
},
|
|
{
|
|
"entropy": 5.47532958984375,
|
|
"epoch": 1.918653958373857,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.000462850058461091,
|
|
"loss": 5.2034,
|
|
"mean_token_accuracy": 0.18091268390417098,
|
|
"num_tokens": 42782806.0,
|
|
"step": 24660
|
|
},
|
|
{
|
|
"entropy": 5.411141777038575,
|
|
"epoch": 1.9190429877455748,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.0004628348018742619,
|
|
"loss": 5.0374,
|
|
"mean_token_accuracy": 0.18692378997802733,
|
|
"num_tokens": 42791790.0,
|
|
"step": 24665
|
|
},
|
|
{
|
|
"entropy": 5.5027320861816404,
|
|
"epoch": 1.9194320171172925,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004628195424373387,
|
|
"loss": 5.2654,
|
|
"mean_token_accuracy": 0.17513974457979203,
|
|
"num_tokens": 42799966.0,
|
|
"step": 24670
|
|
},
|
|
{
|
|
"entropy": 5.475761890411377,
|
|
"epoch": 1.91982104648901,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00046280428015055286,
|
|
"loss": 5.124,
|
|
"mean_token_accuracy": 0.18184951543807984,
|
|
"num_tokens": 42808022.0,
|
|
"step": 24675
|
|
},
|
|
{
|
|
"entropy": 5.504780340194702,
|
|
"epoch": 1.9202100758607274,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.00046278901501413606,
|
|
"loss": 5.0461,
|
|
"mean_token_accuracy": 0.19297143071889877,
|
|
"num_tokens": 42816191.0,
|
|
"step": 24680
|
|
},
|
|
{
|
|
"entropy": 5.454769515991211,
|
|
"epoch": 1.9205991052324451,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00046277374702831983,
|
|
"loss": 5.1506,
|
|
"mean_token_accuracy": 0.18265170305967332,
|
|
"num_tokens": 42824840.0,
|
|
"step": 24685
|
|
},
|
|
{
|
|
"entropy": 5.381754636764526,
|
|
"epoch": 1.9209881346041626,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00046275847619333576,
|
|
"loss": 5.129,
|
|
"mean_token_accuracy": 0.18569497615098954,
|
|
"num_tokens": 42833788.0,
|
|
"step": 24690
|
|
},
|
|
{
|
|
"entropy": 5.488091850280762,
|
|
"epoch": 1.92137716397588,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00046274320250941576,
|
|
"loss": 5.1552,
|
|
"mean_token_accuracy": 0.18658255636692048,
|
|
"num_tokens": 42842666.0,
|
|
"step": 24695
|
|
},
|
|
{
|
|
"entropy": 5.54749321937561,
|
|
"epoch": 1.9217661933475978,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.00046272792597679146,
|
|
"loss": 5.219,
|
|
"mean_token_accuracy": 0.1752565994858742,
|
|
"num_tokens": 42850725.0,
|
|
"step": 24700
|
|
},
|
|
{
|
|
"entropy": 5.4631763935089115,
|
|
"epoch": 1.9221552227193153,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.00046271264659569474,
|
|
"loss": 5.1408,
|
|
"mean_token_accuracy": 0.18136709332466125,
|
|
"num_tokens": 42859732.0,
|
|
"step": 24705
|
|
},
|
|
{
|
|
"entropy": 5.443387222290039,
|
|
"epoch": 1.9225442520910327,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0004626973643663573,
|
|
"loss": 5.1424,
|
|
"mean_token_accuracy": 0.18769567757844924,
|
|
"num_tokens": 42868858.0,
|
|
"step": 24710
|
|
},
|
|
{
|
|
"entropy": 5.5055207252502445,
|
|
"epoch": 1.9229332814627504,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0004626820792890112,
|
|
"loss": 5.16,
|
|
"mean_token_accuracy": 0.1817028343677521,
|
|
"num_tokens": 42877483.0,
|
|
"step": 24715
|
|
},
|
|
{
|
|
"entropy": 5.411924409866333,
|
|
"epoch": 1.9233223108344681,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0004626667913638882,
|
|
"loss": 5.0321,
|
|
"mean_token_accuracy": 0.1955586552619934,
|
|
"num_tokens": 42885156.0,
|
|
"step": 24720
|
|
},
|
|
{
|
|
"entropy": 5.459235620498657,
|
|
"epoch": 1.9237113402061856,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004626515005912203,
|
|
"loss": 5.2006,
|
|
"mean_token_accuracy": 0.17961460947990418,
|
|
"num_tokens": 42893599.0,
|
|
"step": 24725
|
|
},
|
|
{
|
|
"entropy": 5.4849334239959715,
|
|
"epoch": 1.924100369577903,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004626362069712397,
|
|
"loss": 5.0834,
|
|
"mean_token_accuracy": 0.19526495933532714,
|
|
"num_tokens": 42902861.0,
|
|
"step": 24730
|
|
},
|
|
{
|
|
"entropy": 5.474493169784546,
|
|
"epoch": 1.9244893989496208,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004626209105041782,
|
|
"loss": 5.1343,
|
|
"mean_token_accuracy": 0.18466322869062424,
|
|
"num_tokens": 42911246.0,
|
|
"step": 24735
|
|
},
|
|
{
|
|
"entropy": 5.448348522186279,
|
|
"epoch": 1.9248784283213383,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.000462605611190268,
|
|
"loss": 5.2116,
|
|
"mean_token_accuracy": 0.18912754207849503,
|
|
"num_tokens": 42919526.0,
|
|
"step": 24740
|
|
},
|
|
{
|
|
"entropy": 5.45012321472168,
|
|
"epoch": 1.9252674576930557,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.00046259030902974133,
|
|
"loss": 5.0697,
|
|
"mean_token_accuracy": 0.1895577609539032,
|
|
"num_tokens": 42927473.0,
|
|
"step": 24745
|
|
},
|
|
{
|
|
"entropy": 5.368224859237671,
|
|
"epoch": 1.9256564870647734,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0004625750040228302,
|
|
"loss": 5.1023,
|
|
"mean_token_accuracy": 0.189781554043293,
|
|
"num_tokens": 42936108.0,
|
|
"step": 24750
|
|
},
|
|
{
|
|
"entropy": 5.3298890590667725,
|
|
"epoch": 1.926045516436491,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 0.00046255969616976704,
|
|
"loss": 5.0315,
|
|
"mean_token_accuracy": 0.19715736359357833,
|
|
"num_tokens": 42944147.0,
|
|
"step": 24755
|
|
},
|
|
{
|
|
"entropy": 5.435338497161865,
|
|
"epoch": 1.9264345458082084,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.000462544385470784,
|
|
"loss": 5.2208,
|
|
"mean_token_accuracy": 0.18188493996858596,
|
|
"num_tokens": 42952674.0,
|
|
"step": 24760
|
|
},
|
|
{
|
|
"entropy": 5.449994659423828,
|
|
"epoch": 1.926823575179926,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004625290719261134,
|
|
"loss": 5.0885,
|
|
"mean_token_accuracy": 0.1870378151535988,
|
|
"num_tokens": 42960907.0,
|
|
"step": 24765
|
|
},
|
|
{
|
|
"entropy": 5.431129121780396,
|
|
"epoch": 1.9272126045516438,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0004625137555359876,
|
|
"loss": 5.0769,
|
|
"mean_token_accuracy": 0.18921552896499633,
|
|
"num_tokens": 42968875.0,
|
|
"step": 24770
|
|
},
|
|
{
|
|
"entropy": 5.433496189117432,
|
|
"epoch": 1.9276016339233613,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.00046249843630063905,
|
|
"loss": 5.1183,
|
|
"mean_token_accuracy": 0.19008222073316575,
|
|
"num_tokens": 42977062.0,
|
|
"step": 24775
|
|
},
|
|
{
|
|
"entropy": 5.429621982574463,
|
|
"epoch": 1.9279906632950787,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0004624831142203001,
|
|
"loss": 5.0858,
|
|
"mean_token_accuracy": 0.18923879116773606,
|
|
"num_tokens": 42985346.0,
|
|
"step": 24780
|
|
},
|
|
{
|
|
"entropy": 5.396388196945191,
|
|
"epoch": 1.9283796926667964,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.00046246778929520346,
|
|
"loss": 5.1314,
|
|
"mean_token_accuracy": 0.17807983458042145,
|
|
"num_tokens": 42993529.0,
|
|
"step": 24785
|
|
},
|
|
{
|
|
"entropy": 5.488701629638672,
|
|
"epoch": 1.928768722038514,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.0004624524615255814,
|
|
"loss": 5.1492,
|
|
"mean_token_accuracy": 0.18723775893449784,
|
|
"num_tokens": 43002254.0,
|
|
"step": 24790
|
|
},
|
|
{
|
|
"entropy": 5.463557577133178,
|
|
"epoch": 1.9291577514102314,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.00046243713091166655,
|
|
"loss": 5.1231,
|
|
"mean_token_accuracy": 0.18992913663387298,
|
|
"num_tokens": 43011130.0,
|
|
"step": 24795
|
|
},
|
|
{
|
|
"entropy": 5.448117685317993,
|
|
"epoch": 1.929546780781949,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0004624217974536916,
|
|
"loss": 5.0857,
|
|
"mean_token_accuracy": 0.19374331682920456,
|
|
"num_tokens": 43019185.0,
|
|
"step": 24800
|
|
},
|
|
{
|
|
"entropy": 5.527491712570191,
|
|
"epoch": 1.9299358101536666,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.00046240646115188925,
|
|
"loss": 5.2952,
|
|
"mean_token_accuracy": 0.17685521245002747,
|
|
"num_tokens": 43028817.0,
|
|
"step": 24805
|
|
},
|
|
{
|
|
"entropy": 5.467464542388916,
|
|
"epoch": 1.930324839525384,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0004623911220064921,
|
|
"loss": 5.1035,
|
|
"mean_token_accuracy": 0.19130326360464095,
|
|
"num_tokens": 43038205.0,
|
|
"step": 24810
|
|
},
|
|
{
|
|
"entropy": 5.421319103240966,
|
|
"epoch": 1.9307138688971017,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00046237578001773297,
|
|
"loss": 5.1252,
|
|
"mean_token_accuracy": 0.18758097887039185,
|
|
"num_tokens": 43046844.0,
|
|
"step": 24815
|
|
},
|
|
{
|
|
"entropy": 5.439845943450928,
|
|
"epoch": 1.9311028982688194,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00046236043518584454,
|
|
"loss": 5.2173,
|
|
"mean_token_accuracy": 0.18335138261318207,
|
|
"num_tokens": 43055928.0,
|
|
"step": 24820
|
|
},
|
|
{
|
|
"entropy": 5.530338191986084,
|
|
"epoch": 1.931491927640537,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0004623450875110597,
|
|
"loss": 5.1508,
|
|
"mean_token_accuracy": 0.1825666293501854,
|
|
"num_tokens": 43065371.0,
|
|
"step": 24825
|
|
},
|
|
{
|
|
"entropy": 5.496459341049194,
|
|
"epoch": 1.9318809570122544,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.00046232973699361147,
|
|
"loss": 5.0696,
|
|
"mean_token_accuracy": 0.1883788526058197,
|
|
"num_tokens": 43073486.0,
|
|
"step": 24830
|
|
},
|
|
{
|
|
"entropy": 5.421124124526978,
|
|
"epoch": 1.932269986383972,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004623143836337326,
|
|
"loss": 5.1641,
|
|
"mean_token_accuracy": 0.18632274568080903,
|
|
"num_tokens": 43083028.0,
|
|
"step": 24835
|
|
},
|
|
{
|
|
"entropy": 5.404304885864258,
|
|
"epoch": 1.9326590157556895,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.00046229902743165607,
|
|
"loss": 5.1165,
|
|
"mean_token_accuracy": 0.1852840706706047,
|
|
"num_tokens": 43091134.0,
|
|
"step": 24840
|
|
},
|
|
{
|
|
"entropy": 5.509053754806518,
|
|
"epoch": 1.933048045127407,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004622836683876149,
|
|
"loss": 5.1893,
|
|
"mean_token_accuracy": 0.1847757637500763,
|
|
"num_tokens": 43099849.0,
|
|
"step": 24845
|
|
},
|
|
{
|
|
"entropy": 5.43804178237915,
|
|
"epoch": 1.9334370744991247,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004622683065018422,
|
|
"loss": 5.1064,
|
|
"mean_token_accuracy": 0.182219760119915,
|
|
"num_tokens": 43108311.0,
|
|
"step": 24850
|
|
},
|
|
{
|
|
"entropy": 5.349687004089356,
|
|
"epoch": 1.9338261038708422,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.00046225294177457105,
|
|
"loss": 4.9785,
|
|
"mean_token_accuracy": 0.19626577198505402,
|
|
"num_tokens": 43116179.0,
|
|
"step": 24855
|
|
},
|
|
{
|
|
"entropy": 5.35234317779541,
|
|
"epoch": 1.9342151332425597,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00046223757420603445,
|
|
"loss": 5.0605,
|
|
"mean_token_accuracy": 0.19256825596094132,
|
|
"num_tokens": 43125728.0,
|
|
"step": 24860
|
|
},
|
|
{
|
|
"entropy": 5.392927360534668,
|
|
"epoch": 1.9346041626142774,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004622222037964658,
|
|
"loss": 5.017,
|
|
"mean_token_accuracy": 0.18860645592212677,
|
|
"num_tokens": 43134512.0,
|
|
"step": 24865
|
|
},
|
|
{
|
|
"entropy": 5.411875581741333,
|
|
"epoch": 1.934993191985995,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00046220683054609815,
|
|
"loss": 5.094,
|
|
"mean_token_accuracy": 0.18921117782592772,
|
|
"num_tokens": 43144831.0,
|
|
"step": 24870
|
|
},
|
|
{
|
|
"entropy": 5.44965295791626,
|
|
"epoch": 1.9353822213577125,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.00046219145445516483,
|
|
"loss": 5.1564,
|
|
"mean_token_accuracy": 0.1858713760972023,
|
|
"num_tokens": 43153614.0,
|
|
"step": 24875
|
|
},
|
|
{
|
|
"entropy": 5.479537105560302,
|
|
"epoch": 1.93577125072943,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00046217607552389905,
|
|
"loss": 5.166,
|
|
"mean_token_accuracy": 0.18676602989435195,
|
|
"num_tokens": 43162004.0,
|
|
"step": 24880
|
|
},
|
|
{
|
|
"entropy": 5.441852569580078,
|
|
"epoch": 1.9361602801011477,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.00046216069375253435,
|
|
"loss": 5.073,
|
|
"mean_token_accuracy": 0.1955839365720749,
|
|
"num_tokens": 43170255.0,
|
|
"step": 24885
|
|
},
|
|
{
|
|
"entropy": 5.384929180145264,
|
|
"epoch": 1.9365493094728652,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.000462145309141304,
|
|
"loss": 5.1513,
|
|
"mean_token_accuracy": 0.18250832259654998,
|
|
"num_tokens": 43179036.0,
|
|
"step": 24890
|
|
},
|
|
{
|
|
"entropy": 5.462961483001709,
|
|
"epoch": 1.9369383388445827,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004621299216904414,
|
|
"loss": 5.1423,
|
|
"mean_token_accuracy": 0.1936418354511261,
|
|
"num_tokens": 43187207.0,
|
|
"step": 24895
|
|
},
|
|
{
|
|
"entropy": 5.458221578598023,
|
|
"epoch": 1.9373273682163004,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00046211453140018006,
|
|
"loss": 5.148,
|
|
"mean_token_accuracy": 0.17727017551660537,
|
|
"num_tokens": 43195600.0,
|
|
"step": 24900
|
|
},
|
|
{
|
|
"entropy": 5.4709385395050045,
|
|
"epoch": 1.937716397588018,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004620991382707537,
|
|
"loss": 5.1646,
|
|
"mean_token_accuracy": 0.19386756122112275,
|
|
"num_tokens": 43204069.0,
|
|
"step": 24905
|
|
},
|
|
{
|
|
"entropy": 5.443561649322509,
|
|
"epoch": 1.9381054269597353,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.00046208374230239556,
|
|
"loss": 5.1965,
|
|
"mean_token_accuracy": 0.1774524062871933,
|
|
"num_tokens": 43212998.0,
|
|
"step": 24910
|
|
},
|
|
{
|
|
"entropy": 5.503031301498413,
|
|
"epoch": 1.938494456331453,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004620683434953394,
|
|
"loss": 5.1673,
|
|
"mean_token_accuracy": 0.1845482274889946,
|
|
"num_tokens": 43222411.0,
|
|
"step": 24915
|
|
},
|
|
{
|
|
"entropy": 5.477515697479248,
|
|
"epoch": 1.9388834857031707,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00046205294184981896,
|
|
"loss": 5.1239,
|
|
"mean_token_accuracy": 0.182538440823555,
|
|
"num_tokens": 43231265.0,
|
|
"step": 24920
|
|
},
|
|
{
|
|
"entropy": 5.481511068344116,
|
|
"epoch": 1.9392725150748882,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00046203753736606787,
|
|
"loss": 5.1192,
|
|
"mean_token_accuracy": 0.18315459340810775,
|
|
"num_tokens": 43240609.0,
|
|
"step": 24925
|
|
},
|
|
{
|
|
"entropy": 5.4378235816955565,
|
|
"epoch": 1.9396615444466057,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004620221300443197,
|
|
"loss": 5.1262,
|
|
"mean_token_accuracy": 0.19143047034740449,
|
|
"num_tokens": 43249381.0,
|
|
"step": 24930
|
|
},
|
|
{
|
|
"entropy": 5.424568843841553,
|
|
"epoch": 1.9400505738183234,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0004620067198848086,
|
|
"loss": 5.0967,
|
|
"mean_token_accuracy": 0.18610389530658722,
|
|
"num_tokens": 43257653.0,
|
|
"step": 24935
|
|
},
|
|
{
|
|
"entropy": 5.493094825744629,
|
|
"epoch": 1.9404396031900408,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.00046199130688776805,
|
|
"loss": 5.2168,
|
|
"mean_token_accuracy": 0.18286954164505004,
|
|
"num_tokens": 43267111.0,
|
|
"step": 24940
|
|
},
|
|
{
|
|
"entropy": 5.416477394104004,
|
|
"epoch": 1.9408286325617583,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00046197589105343204,
|
|
"loss": 5.0735,
|
|
"mean_token_accuracy": 0.18869625478982927,
|
|
"num_tokens": 43276207.0,
|
|
"step": 24945
|
|
},
|
|
{
|
|
"entropy": 5.430193853378296,
|
|
"epoch": 1.941217661933476,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004619604723820345,
|
|
"loss": 5.1241,
|
|
"mean_token_accuracy": 0.1902042269706726,
|
|
"num_tokens": 43285031.0,
|
|
"step": 24950
|
|
},
|
|
{
|
|
"entropy": 5.469347095489502,
|
|
"epoch": 1.9416066913051937,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0004619450508738094,
|
|
"loss": 5.1541,
|
|
"mean_token_accuracy": 0.18689170926809312,
|
|
"num_tokens": 43292802.0,
|
|
"step": 24955
|
|
},
|
|
{
|
|
"entropy": 5.488390207290649,
|
|
"epoch": 1.941995720676911,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00046192962652899056,
|
|
"loss": 5.1162,
|
|
"mean_token_accuracy": 0.18956592679023743,
|
|
"num_tokens": 43302349.0,
|
|
"step": 24960
|
|
},
|
|
{
|
|
"entropy": 5.4162756443023685,
|
|
"epoch": 1.9423847500486286,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00046191419934781236,
|
|
"loss": 5.0791,
|
|
"mean_token_accuracy": 0.18549565374851226,
|
|
"num_tokens": 43311455.0,
|
|
"step": 24965
|
|
},
|
|
{
|
|
"entropy": 5.445357084274292,
|
|
"epoch": 1.9427737794203463,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0004618987693305086,
|
|
"loss": 5.1162,
|
|
"mean_token_accuracy": 0.18692314773797988,
|
|
"num_tokens": 43319924.0,
|
|
"step": 24970
|
|
},
|
|
{
|
|
"entropy": 5.480496835708618,
|
|
"epoch": 1.9431628087920638,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004618833364773135,
|
|
"loss": 5.2574,
|
|
"mean_token_accuracy": 0.1843041479587555,
|
|
"num_tokens": 43328772.0,
|
|
"step": 24975
|
|
},
|
|
{
|
|
"entropy": 5.4377185821533205,
|
|
"epoch": 1.9435518381637813,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.00046186790078846127,
|
|
"loss": 5.1378,
|
|
"mean_token_accuracy": 0.18812571316957474,
|
|
"num_tokens": 43338862.0,
|
|
"step": 24980
|
|
},
|
|
{
|
|
"entropy": 5.500201082229614,
|
|
"epoch": 1.943940867535499,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00046185246226418603,
|
|
"loss": 5.1527,
|
|
"mean_token_accuracy": 0.18519557118415833,
|
|
"num_tokens": 43347292.0,
|
|
"step": 24985
|
|
},
|
|
{
|
|
"entropy": 5.414530515670776,
|
|
"epoch": 1.9443298969072165,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.00046183702090472206,
|
|
"loss": 5.0846,
|
|
"mean_token_accuracy": 0.18616401255130768,
|
|
"num_tokens": 43356676.0,
|
|
"step": 24990
|
|
},
|
|
{
|
|
"entropy": 5.520038795471192,
|
|
"epoch": 1.944718926278934,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0004618215767103037,
|
|
"loss": 5.217,
|
|
"mean_token_accuracy": 0.17961248904466628,
|
|
"num_tokens": 43364746.0,
|
|
"step": 24995
|
|
},
|
|
{
|
|
"entropy": 5.448811388015747,
|
|
"epoch": 1.9451079556506516,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0004618061296811653,
|
|
"loss": 5.0582,
|
|
"mean_token_accuracy": 0.186905200779438,
|
|
"num_tokens": 43373541.0,
|
|
"step": 25000
|
|
},
|
|
{
|
|
"entropy": 5.4221173286437985,
|
|
"epoch": 1.9454969850223693,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.00046179067981754124,
|
|
"loss": 5.0812,
|
|
"mean_token_accuracy": 0.18685564249753953,
|
|
"num_tokens": 43382524.0,
|
|
"step": 25005
|
|
},
|
|
{
|
|
"entropy": 5.398396444320679,
|
|
"epoch": 1.9458860143940866,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.00046177522711966584,
|
|
"loss": 5.1117,
|
|
"mean_token_accuracy": 0.18727776408195496,
|
|
"num_tokens": 43391875.0,
|
|
"step": 25010
|
|
},
|
|
{
|
|
"entropy": 5.480439949035644,
|
|
"epoch": 1.9462750437658043,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00046175977158777377,
|
|
"loss": 5.2104,
|
|
"mean_token_accuracy": 0.17521731555461884,
|
|
"num_tokens": 43399942.0,
|
|
"step": 25015
|
|
},
|
|
{
|
|
"entropy": 5.489329528808594,
|
|
"epoch": 1.946664073137522,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0004617443132220993,
|
|
"loss": 5.184,
|
|
"mean_token_accuracy": 0.18130216002464294,
|
|
"num_tokens": 43409371.0,
|
|
"step": 25020
|
|
},
|
|
{
|
|
"entropy": 5.498819732666016,
|
|
"epoch": 1.9470531025092395,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00046172885202287717,
|
|
"loss": 5.1535,
|
|
"mean_token_accuracy": 0.18855275511741637,
|
|
"num_tokens": 43418181.0,
|
|
"step": 25025
|
|
},
|
|
{
|
|
"entropy": 5.44780158996582,
|
|
"epoch": 1.947442131880957,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00046171338799034194,
|
|
"loss": 5.098,
|
|
"mean_token_accuracy": 0.19004820734262468,
|
|
"num_tokens": 43426004.0,
|
|
"step": 25030
|
|
},
|
|
{
|
|
"entropy": 5.4022666931152346,
|
|
"epoch": 1.9478311612526746,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0004616979211247282,
|
|
"loss": 5.0153,
|
|
"mean_token_accuracy": 0.1880813479423523,
|
|
"num_tokens": 43433732.0,
|
|
"step": 25035
|
|
},
|
|
{
|
|
"entropy": 5.421090745925904,
|
|
"epoch": 1.9482201906243921,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00046168245142627065,
|
|
"loss": 5.1616,
|
|
"mean_token_accuracy": 0.1835631623864174,
|
|
"num_tokens": 43442374.0,
|
|
"step": 25040
|
|
},
|
|
{
|
|
"entropy": 5.4902623176574705,
|
|
"epoch": 1.9486092199961096,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0004616669788952041,
|
|
"loss": 5.1708,
|
|
"mean_token_accuracy": 0.18792939186096191,
|
|
"num_tokens": 43451335.0,
|
|
"step": 25045
|
|
},
|
|
{
|
|
"entropy": 5.526312732696534,
|
|
"epoch": 1.9489982493678273,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00046165150353176315,
|
|
"loss": 5.1934,
|
|
"mean_token_accuracy": 0.18102587014436722,
|
|
"num_tokens": 43459520.0,
|
|
"step": 25050
|
|
},
|
|
{
|
|
"entropy": 5.413086366653443,
|
|
"epoch": 1.949387278739545,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 0.0004616360253361828,
|
|
"loss": 5.0901,
|
|
"mean_token_accuracy": 0.1872740864753723,
|
|
"num_tokens": 43467695.0,
|
|
"step": 25055
|
|
},
|
|
{
|
|
"entropy": 5.386177110671997,
|
|
"epoch": 1.9497763081112622,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00046162054430869777,
|
|
"loss": 5.1368,
|
|
"mean_token_accuracy": 0.1941215753555298,
|
|
"num_tokens": 43476161.0,
|
|
"step": 25060
|
|
},
|
|
{
|
|
"entropy": 5.427265071868897,
|
|
"epoch": 1.95016533748298,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.000461605060449543,
|
|
"loss": 5.0975,
|
|
"mean_token_accuracy": 0.17978012561798096,
|
|
"num_tokens": 43485106.0,
|
|
"step": 25065
|
|
},
|
|
{
|
|
"entropy": 5.534923028945923,
|
|
"epoch": 1.9505543668546976,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00046158957375895353,
|
|
"loss": 5.196,
|
|
"mean_token_accuracy": 0.17410032600164413,
|
|
"num_tokens": 43494232.0,
|
|
"step": 25070
|
|
},
|
|
{
|
|
"entropy": 5.516915512084961,
|
|
"epoch": 1.950943396226415,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0004615740842371643,
|
|
"loss": 5.0811,
|
|
"mean_token_accuracy": 0.19290326833724974,
|
|
"num_tokens": 43502556.0,
|
|
"step": 25075
|
|
},
|
|
{
|
|
"entropy": 5.405913639068603,
|
|
"epoch": 1.9513324255981326,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.00046155859188441023,
|
|
"loss": 5.0058,
|
|
"mean_token_accuracy": 0.19662971198558807,
|
|
"num_tokens": 43511594.0,
|
|
"step": 25080
|
|
},
|
|
{
|
|
"entropy": 5.355210590362549,
|
|
"epoch": 1.9517214549698503,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004615430967009265,
|
|
"loss": 5.1753,
|
|
"mean_token_accuracy": 0.18568242937326432,
|
|
"num_tokens": 43520532.0,
|
|
"step": 25085
|
|
},
|
|
{
|
|
"entropy": 5.438977003097534,
|
|
"epoch": 1.9521104843415678,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00046152759868694815,
|
|
"loss": 5.18,
|
|
"mean_token_accuracy": 0.18547088503837586,
|
|
"num_tokens": 43529286.0,
|
|
"step": 25090
|
|
},
|
|
{
|
|
"entropy": 5.491412544250489,
|
|
"epoch": 1.9524995137132852,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004615120978427104,
|
|
"loss": 5.1335,
|
|
"mean_token_accuracy": 0.18252035826444626,
|
|
"num_tokens": 43537983.0,
|
|
"step": 25095
|
|
},
|
|
{
|
|
"entropy": 5.451194000244141,
|
|
"epoch": 1.952888543085003,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004614965941684485,
|
|
"loss": 5.0814,
|
|
"mean_token_accuracy": 0.1929868280887604,
|
|
"num_tokens": 43546550.0,
|
|
"step": 25100
|
|
},
|
|
{
|
|
"entropy": 5.478314304351807,
|
|
"epoch": 1.9532775724567206,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0004614810876643975,
|
|
"loss": 5.1753,
|
|
"mean_token_accuracy": 0.1878936305642128,
|
|
"num_tokens": 43555006.0,
|
|
"step": 25105
|
|
},
|
|
{
|
|
"entropy": 5.497987413406372,
|
|
"epoch": 1.953666601828438,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.00046146557833079286,
|
|
"loss": 5.22,
|
|
"mean_token_accuracy": 0.18419184237718583,
|
|
"num_tokens": 43563925.0,
|
|
"step": 25110
|
|
},
|
|
{
|
|
"entropy": 5.5130088329315186,
|
|
"epoch": 1.9540556312001556,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0004614500661678698,
|
|
"loss": 5.1446,
|
|
"mean_token_accuracy": 0.18960401117801667,
|
|
"num_tokens": 43572269.0,
|
|
"step": 25115
|
|
},
|
|
{
|
|
"entropy": 5.474818181991577,
|
|
"epoch": 1.9544446605718733,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004614345511758639,
|
|
"loss": 5.1559,
|
|
"mean_token_accuracy": 0.18697709441184998,
|
|
"num_tokens": 43579908.0,
|
|
"step": 25120
|
|
},
|
|
{
|
|
"entropy": 5.389086389541626,
|
|
"epoch": 1.9548336899435907,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00046141903335501034,
|
|
"loss": 5.1215,
|
|
"mean_token_accuracy": 0.1834001824259758,
|
|
"num_tokens": 43589328.0,
|
|
"step": 25125
|
|
},
|
|
{
|
|
"entropy": 5.417955684661865,
|
|
"epoch": 1.9552227193153082,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0004614035127055447,
|
|
"loss": 5.1455,
|
|
"mean_token_accuracy": 0.18459923863410949,
|
|
"num_tokens": 43597840.0,
|
|
"step": 25130
|
|
},
|
|
{
|
|
"entropy": 5.435986518859863,
|
|
"epoch": 1.955611748687026,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0004613879892277024,
|
|
"loss": 5.0967,
|
|
"mean_token_accuracy": 0.19275453984737395,
|
|
"num_tokens": 43606496.0,
|
|
"step": 25135
|
|
},
|
|
{
|
|
"entropy": 5.465708494186401,
|
|
"epoch": 1.9560007780587434,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.000461372462921719,
|
|
"loss": 5.1128,
|
|
"mean_token_accuracy": 0.185288442671299,
|
|
"num_tokens": 43614411.0,
|
|
"step": 25140
|
|
},
|
|
{
|
|
"entropy": 5.35589451789856,
|
|
"epoch": 1.9563898074304609,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0004613569337878302,
|
|
"loss": 5.0454,
|
|
"mean_token_accuracy": 0.19121771901845933,
|
|
"num_tokens": 43622842.0,
|
|
"step": 25145
|
|
},
|
|
{
|
|
"entropy": 5.469338607788086,
|
|
"epoch": 1.9567788368021786,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0004613414018262715,
|
|
"loss": 5.1669,
|
|
"mean_token_accuracy": 0.1766262874007225,
|
|
"num_tokens": 43631535.0,
|
|
"step": 25150
|
|
},
|
|
{
|
|
"entropy": 5.523100090026856,
|
|
"epoch": 1.9571678661738963,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0004613258670372786,
|
|
"loss": 5.1484,
|
|
"mean_token_accuracy": 0.18719781786203385,
|
|
"num_tokens": 43640197.0,
|
|
"step": 25155
|
|
},
|
|
{
|
|
"entropy": 5.400858354568482,
|
|
"epoch": 1.9575568955456137,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004613103294210873,
|
|
"loss": 5.0648,
|
|
"mean_token_accuracy": 0.19230582416057587,
|
|
"num_tokens": 43648685.0,
|
|
"step": 25160
|
|
},
|
|
{
|
|
"entropy": 5.36841516494751,
|
|
"epoch": 1.9579459249173312,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.00046129478897793323,
|
|
"loss": 5.1041,
|
|
"mean_token_accuracy": 0.19057226479053496,
|
|
"num_tokens": 43657526.0,
|
|
"step": 25165
|
|
},
|
|
{
|
|
"entropy": 5.493056917190552,
|
|
"epoch": 1.958334954289049,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00046127924570805236,
|
|
"loss": 5.1254,
|
|
"mean_token_accuracy": 0.1918218567967415,
|
|
"num_tokens": 43666119.0,
|
|
"step": 25170
|
|
},
|
|
{
|
|
"entropy": 5.520423364639282,
|
|
"epoch": 1.9587239836607664,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004612636996116803,
|
|
"loss": 5.128,
|
|
"mean_token_accuracy": 0.17722194343805314,
|
|
"num_tokens": 43674634.0,
|
|
"step": 25175
|
|
},
|
|
{
|
|
"entropy": 5.330378150939941,
|
|
"epoch": 1.9591130130324839,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0004612481506890532,
|
|
"loss": 5.0382,
|
|
"mean_token_accuracy": 0.19518170058727263,
|
|
"num_tokens": 43683329.0,
|
|
"step": 25180
|
|
},
|
|
{
|
|
"entropy": 5.41314206123352,
|
|
"epoch": 1.9595020424042016,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.00046123259894040677,
|
|
"loss": 5.0846,
|
|
"mean_token_accuracy": 0.18784303367137908,
|
|
"num_tokens": 43692598.0,
|
|
"step": 25185
|
|
},
|
|
{
|
|
"entropy": 5.397613859176635,
|
|
"epoch": 1.959891071775919,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.000461217044365977,
|
|
"loss": 5.0639,
|
|
"mean_token_accuracy": 0.1877152994275093,
|
|
"num_tokens": 43702260.0,
|
|
"step": 25190
|
|
},
|
|
{
|
|
"entropy": 5.517280912399292,
|
|
"epoch": 1.9602801011476365,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004612014869660002,
|
|
"loss": 5.1559,
|
|
"mean_token_accuracy": 0.1864241451025009,
|
|
"num_tokens": 43710003.0,
|
|
"step": 25195
|
|
},
|
|
{
|
|
"entropy": 5.471633672714233,
|
|
"epoch": 1.9606691305193542,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.00046118592674071197,
|
|
"loss": 5.1112,
|
|
"mean_token_accuracy": 0.19072562456130981,
|
|
"num_tokens": 43718687.0,
|
|
"step": 25200
|
|
},
|
|
{
|
|
"entropy": 5.352226400375367,
|
|
"epoch": 1.961058159891072,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0004611703636903488,
|
|
"loss": 5.0076,
|
|
"mean_token_accuracy": 0.2013494849205017,
|
|
"num_tokens": 43727051.0,
|
|
"step": 25205
|
|
},
|
|
{
|
|
"entropy": 5.389390325546264,
|
|
"epoch": 1.9614471892627894,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.0004611547978151466,
|
|
"loss": 5.0564,
|
|
"mean_token_accuracy": 0.1958160400390625,
|
|
"num_tokens": 43735572.0,
|
|
"step": 25210
|
|
},
|
|
{
|
|
"entropy": 5.435591125488282,
|
|
"epoch": 1.9618362186345069,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.00046113922911534167,
|
|
"loss": 5.1175,
|
|
"mean_token_accuracy": 0.1872321382164955,
|
|
"num_tokens": 43744286.0,
|
|
"step": 25215
|
|
},
|
|
{
|
|
"entropy": 5.451939535140991,
|
|
"epoch": 1.9622252480062246,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.0004611236575911702,
|
|
"loss": 5.2256,
|
|
"mean_token_accuracy": 0.18280572742223739,
|
|
"num_tokens": 43754042.0,
|
|
"step": 25220
|
|
},
|
|
{
|
|
"entropy": 5.4101978778839115,
|
|
"epoch": 1.962614277377942,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00046110808324286844,
|
|
"loss": 5.0037,
|
|
"mean_token_accuracy": 0.19491268545389176,
|
|
"num_tokens": 43762031.0,
|
|
"step": 25225
|
|
},
|
|
{
|
|
"entropy": 5.45263032913208,
|
|
"epoch": 1.9630033067496595,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.00046109250607067275,
|
|
"loss": 5.15,
|
|
"mean_token_accuracy": 0.18939634114503862,
|
|
"num_tokens": 43770546.0,
|
|
"step": 25230
|
|
},
|
|
{
|
|
"entropy": 5.440660858154297,
|
|
"epoch": 1.9633923361213772,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004610769260748196,
|
|
"loss": 5.1277,
|
|
"mean_token_accuracy": 0.18779551088809968,
|
|
"num_tokens": 43779918.0,
|
|
"step": 25235
|
|
},
|
|
{
|
|
"entropy": 5.47425332069397,
|
|
"epoch": 1.9637813654930947,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0004610613432555451,
|
|
"loss": 5.1311,
|
|
"mean_token_accuracy": 0.1867818519473076,
|
|
"num_tokens": 43788425.0,
|
|
"step": 25240
|
|
},
|
|
{
|
|
"entropy": 5.451683378219604,
|
|
"epoch": 1.9641703948648122,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00046104575761308597,
|
|
"loss": 5.1839,
|
|
"mean_token_accuracy": 0.17876069992780685,
|
|
"num_tokens": 43797080.0,
|
|
"step": 25245
|
|
},
|
|
{
|
|
"entropy": 5.463306188583374,
|
|
"epoch": 1.9645594242365298,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0004610301691476786,
|
|
"loss": 5.1258,
|
|
"mean_token_accuracy": 0.19060919433832169,
|
|
"num_tokens": 43806026.0,
|
|
"step": 25250
|
|
},
|
|
{
|
|
"entropy": 5.519296598434448,
|
|
"epoch": 1.9649484536082475,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0004610145778595594,
|
|
"loss": 5.1368,
|
|
"mean_token_accuracy": 0.1911190465092659,
|
|
"num_tokens": 43814333.0,
|
|
"step": 25255
|
|
},
|
|
{
|
|
"entropy": 5.381476593017578,
|
|
"epoch": 1.965337482979965,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004609989837489651,
|
|
"loss": 5.0758,
|
|
"mean_token_accuracy": 0.19303134381771087,
|
|
"num_tokens": 43823235.0,
|
|
"step": 25260
|
|
},
|
|
{
|
|
"entropy": 5.481320333480835,
|
|
"epoch": 1.9657265123516825,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.00046098338681613234,
|
|
"loss": 5.1549,
|
|
"mean_token_accuracy": 0.18497256487607955,
|
|
"num_tokens": 43832257.0,
|
|
"step": 25265
|
|
},
|
|
{
|
|
"entropy": 5.500158643722534,
|
|
"epoch": 1.9661155417234002,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0004609677870612976,
|
|
"loss": 5.0734,
|
|
"mean_token_accuracy": 0.1960882678627968,
|
|
"num_tokens": 43840359.0,
|
|
"step": 25270
|
|
},
|
|
{
|
|
"entropy": 5.384835338592529,
|
|
"epoch": 1.9665045710951177,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0004609521844846978,
|
|
"loss": 5.195,
|
|
"mean_token_accuracy": 0.18151499927043915,
|
|
"num_tokens": 43849374.0,
|
|
"step": 25275
|
|
},
|
|
{
|
|
"entropy": 5.4381814956665036,
|
|
"epoch": 1.9668936004668351,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0004609365790865695,
|
|
"loss": 5.1669,
|
|
"mean_token_accuracy": 0.18197781443595887,
|
|
"num_tokens": 43857861.0,
|
|
"step": 25280
|
|
},
|
|
{
|
|
"entropy": 5.5036993503570555,
|
|
"epoch": 1.9672826298385528,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00046092097086714956,
|
|
"loss": 5.1842,
|
|
"mean_token_accuracy": 0.1843009188771248,
|
|
"num_tokens": 43865964.0,
|
|
"step": 25285
|
|
},
|
|
{
|
|
"entropy": 5.405485200881958,
|
|
"epoch": 1.9676716592102705,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.00046090535982667486,
|
|
"loss": 5.0809,
|
|
"mean_token_accuracy": 0.2000619053840637,
|
|
"num_tokens": 43874434.0,
|
|
"step": 25290
|
|
},
|
|
{
|
|
"entropy": 5.432703828811645,
|
|
"epoch": 1.9680606885819878,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00046088974596538216,
|
|
"loss": 5.1547,
|
|
"mean_token_accuracy": 0.18643044233322142,
|
|
"num_tokens": 43882691.0,
|
|
"step": 25295
|
|
},
|
|
{
|
|
"entropy": 5.539751815795898,
|
|
"epoch": 1.9684497179537055,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004608741292835085,
|
|
"loss": 5.1456,
|
|
"mean_token_accuracy": 0.18488708585500718,
|
|
"num_tokens": 43890589.0,
|
|
"step": 25300
|
|
},
|
|
{
|
|
"entropy": 5.4820140361785885,
|
|
"epoch": 1.9688387473254232,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004608585097812907,
|
|
"loss": 5.15,
|
|
"mean_token_accuracy": 0.1914763405919075,
|
|
"num_tokens": 43898908.0,
|
|
"step": 25305
|
|
},
|
|
{
|
|
"entropy": 5.475679779052735,
|
|
"epoch": 1.9692277766971407,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004608428874589659,
|
|
"loss": 5.1729,
|
|
"mean_token_accuracy": 0.18248163312673568,
|
|
"num_tokens": 43907640.0,
|
|
"step": 25310
|
|
},
|
|
{
|
|
"entropy": 5.442950487136841,
|
|
"epoch": 1.9696168060688581,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0004608272623167711,
|
|
"loss": 5.0229,
|
|
"mean_token_accuracy": 0.19743569195270538,
|
|
"num_tokens": 43915757.0,
|
|
"step": 25315
|
|
},
|
|
{
|
|
"entropy": 5.512614011764526,
|
|
"epoch": 1.9700058354405758,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.00046081163435494335,
|
|
"loss": 5.1951,
|
|
"mean_token_accuracy": 0.18031853139400483,
|
|
"num_tokens": 43924910.0,
|
|
"step": 25320
|
|
},
|
|
{
|
|
"entropy": 5.4823578834533695,
|
|
"epoch": 1.9703948648122933,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0004607960035737198,
|
|
"loss": 5.149,
|
|
"mean_token_accuracy": 0.1917443737387657,
|
|
"num_tokens": 43933122.0,
|
|
"step": 25325
|
|
},
|
|
{
|
|
"entropy": 5.359778976440429,
|
|
"epoch": 1.9707838941840108,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.0004607803699733376,
|
|
"loss": 5.1102,
|
|
"mean_token_accuracy": 0.18960886001586913,
|
|
"num_tokens": 43941996.0,
|
|
"step": 25330
|
|
},
|
|
{
|
|
"entropy": 5.445741939544678,
|
|
"epoch": 1.9711729235557285,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.000460764733554034,
|
|
"loss": 5.0606,
|
|
"mean_token_accuracy": 0.19529969543218612,
|
|
"num_tokens": 43950637.0,
|
|
"step": 25335
|
|
},
|
|
{
|
|
"entropy": 5.496492052078247,
|
|
"epoch": 1.9715619529274462,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00046074909431604623,
|
|
"loss": 5.1138,
|
|
"mean_token_accuracy": 0.18993473649024964,
|
|
"num_tokens": 43959252.0,
|
|
"step": 25340
|
|
},
|
|
{
|
|
"entropy": 5.390342950820923,
|
|
"epoch": 1.9719509822991634,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004607334522596116,
|
|
"loss": 5.0954,
|
|
"mean_token_accuracy": 0.18358451128005981,
|
|
"num_tokens": 43968391.0,
|
|
"step": 25345
|
|
},
|
|
{
|
|
"entropy": 5.44939546585083,
|
|
"epoch": 1.9723400116708811,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0004607178073849675,
|
|
"loss": 5.0463,
|
|
"mean_token_accuracy": 0.19665595889091492,
|
|
"num_tokens": 43977066.0,
|
|
"step": 25350
|
|
},
|
|
{
|
|
"entropy": 5.506793785095215,
|
|
"epoch": 1.9727290410425988,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.0004607021596923512,
|
|
"loss": 5.108,
|
|
"mean_token_accuracy": 0.19686611443758012,
|
|
"num_tokens": 43985072.0,
|
|
"step": 25355
|
|
},
|
|
{
|
|
"entropy": 5.5475757122039795,
|
|
"epoch": 1.9731180704143163,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0004606865091820003,
|
|
"loss": 5.3055,
|
|
"mean_token_accuracy": 0.1810056284070015,
|
|
"num_tokens": 43993321.0,
|
|
"step": 25360
|
|
},
|
|
{
|
|
"entropy": 5.373313093185425,
|
|
"epoch": 1.9735070997860338,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004606708558541521,
|
|
"loss": 4.9856,
|
|
"mean_token_accuracy": 0.2050961047410965,
|
|
"num_tokens": 44002476.0,
|
|
"step": 25365
|
|
},
|
|
{
|
|
"entropy": 5.470714950561524,
|
|
"epoch": 1.9738961291577515,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0004606551997090442,
|
|
"loss": 5.1945,
|
|
"mean_token_accuracy": 0.1834375247359276,
|
|
"num_tokens": 44011790.0,
|
|
"step": 25370
|
|
},
|
|
{
|
|
"entropy": 5.433232164382934,
|
|
"epoch": 1.974285158529469,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.0004606395407469141,
|
|
"loss": 5.0843,
|
|
"mean_token_accuracy": 0.18769994080066682,
|
|
"num_tokens": 44021086.0,
|
|
"step": 25375
|
|
},
|
|
{
|
|
"entropy": 5.422499084472657,
|
|
"epoch": 1.9746741879011864,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004606238789679995,
|
|
"loss": 5.0545,
|
|
"mean_token_accuracy": 0.19469659328460692,
|
|
"num_tokens": 44029789.0,
|
|
"step": 25380
|
|
},
|
|
{
|
|
"entropy": 5.411042022705078,
|
|
"epoch": 1.9750632172729041,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0004606082143725381,
|
|
"loss": 5.0905,
|
|
"mean_token_accuracy": 0.18292534202337266,
|
|
"num_tokens": 44039508.0,
|
|
"step": 25385
|
|
},
|
|
{
|
|
"entropy": 5.370553398132325,
|
|
"epoch": 1.9754522466446218,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0004605925469607673,
|
|
"loss": 5.0832,
|
|
"mean_token_accuracy": 0.18990588635206224,
|
|
"num_tokens": 44048464.0,
|
|
"step": 25390
|
|
},
|
|
{
|
|
"entropy": 5.5631050109863285,
|
|
"epoch": 1.975841276016339,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00046057687673292506,
|
|
"loss": 5.1856,
|
|
"mean_token_accuracy": 0.18350721150636673,
|
|
"num_tokens": 44057613.0,
|
|
"step": 25395
|
|
},
|
|
{
|
|
"entropy": 5.415027666091919,
|
|
"epoch": 1.9762303053880568,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.00046056120368924907,
|
|
"loss": 4.9872,
|
|
"mean_token_accuracy": 0.1952361837029457,
|
|
"num_tokens": 44066334.0,
|
|
"step": 25400
|
|
},
|
|
{
|
|
"entropy": 5.44974799156189,
|
|
"epoch": 1.9766193347597745,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.0004605455278299772,
|
|
"loss": 5.2443,
|
|
"mean_token_accuracy": 0.1830928608775139,
|
|
"num_tokens": 44076355.0,
|
|
"step": 25405
|
|
},
|
|
{
|
|
"entropy": 5.491162300109863,
|
|
"epoch": 1.977008364131492,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0004605298491553472,
|
|
"loss": 5.1714,
|
|
"mean_token_accuracy": 0.1792429804801941,
|
|
"num_tokens": 44084445.0,
|
|
"step": 25410
|
|
},
|
|
{
|
|
"entropy": 5.488689279556274,
|
|
"epoch": 1.9773973935032094,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004605141676655971,
|
|
"loss": 5.1127,
|
|
"mean_token_accuracy": 0.18875147998332978,
|
|
"num_tokens": 44093711.0,
|
|
"step": 25415
|
|
},
|
|
{
|
|
"entropy": 5.433429479598999,
|
|
"epoch": 1.9777864228749271,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00046049848336096485,
|
|
"loss": 5.0927,
|
|
"mean_token_accuracy": 0.18281544595956803,
|
|
"num_tokens": 44102647.0,
|
|
"step": 25420
|
|
},
|
|
{
|
|
"entropy": 5.3878984451293945,
|
|
"epoch": 1.9781754522466446,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004604827962416883,
|
|
"loss": 5.0329,
|
|
"mean_token_accuracy": 0.19317934513092042,
|
|
"num_tokens": 44110661.0,
|
|
"step": 25425
|
|
},
|
|
{
|
|
"entropy": 5.508700180053711,
|
|
"epoch": 1.978564481618362,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0004604671063080055,
|
|
"loss": 5.2792,
|
|
"mean_token_accuracy": 0.17330573946237565,
|
|
"num_tokens": 44119441.0,
|
|
"step": 25430
|
|
},
|
|
{
|
|
"entropy": 5.433810186386109,
|
|
"epoch": 1.9789535109900798,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0004604514135601546,
|
|
"loss": 5.0626,
|
|
"mean_token_accuracy": 0.19045995622873307,
|
|
"num_tokens": 44127774.0,
|
|
"step": 25435
|
|
},
|
|
{
|
|
"entropy": 5.4455413818359375,
|
|
"epoch": 1.9793425403617975,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0004604357179983736,
|
|
"loss": 5.2971,
|
|
"mean_token_accuracy": 0.1733509123325348,
|
|
"num_tokens": 44137075.0,
|
|
"step": 25440
|
|
},
|
|
{
|
|
"entropy": 5.3704736709594725,
|
|
"epoch": 1.9797315697335147,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004604200196229009,
|
|
"loss": 5.0158,
|
|
"mean_token_accuracy": 0.19197784811258317,
|
|
"num_tokens": 44145647.0,
|
|
"step": 25445
|
|
},
|
|
{
|
|
"entropy": 5.3886284828186035,
|
|
"epoch": 1.9801205991052324,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0004604043184339744,
|
|
"loss": 4.9887,
|
|
"mean_token_accuracy": 0.1958225041627884,
|
|
"num_tokens": 44154267.0,
|
|
"step": 25450
|
|
},
|
|
{
|
|
"entropy": 5.430800485610962,
|
|
"epoch": 1.9805096284769501,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004603886144318325,
|
|
"loss": 5.1541,
|
|
"mean_token_accuracy": 0.18356830924749373,
|
|
"num_tokens": 44162532.0,
|
|
"step": 25455
|
|
},
|
|
{
|
|
"entropy": 5.479406118392944,
|
|
"epoch": 1.9808986578486676,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.00046037290761671346,
|
|
"loss": 5.13,
|
|
"mean_token_accuracy": 0.19030331671237946,
|
|
"num_tokens": 44171218.0,
|
|
"step": 25460
|
|
},
|
|
{
|
|
"entropy": 5.421629858016968,
|
|
"epoch": 1.981287687220385,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004603571979888556,
|
|
"loss": 5.1807,
|
|
"mean_token_accuracy": 0.18650459349155427,
|
|
"num_tokens": 44180189.0,
|
|
"step": 25465
|
|
},
|
|
{
|
|
"entropy": 5.431524801254272,
|
|
"epoch": 1.9816767165921028,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0004603414855484973,
|
|
"loss": 5.0657,
|
|
"mean_token_accuracy": 0.1902753919363022,
|
|
"num_tokens": 44189048.0,
|
|
"step": 25470
|
|
},
|
|
{
|
|
"entropy": 5.424501371383667,
|
|
"epoch": 1.9820657459638202,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.000460325770295877,
|
|
"loss": 5.1159,
|
|
"mean_token_accuracy": 0.1858877032995224,
|
|
"num_tokens": 44197995.0,
|
|
"step": 25475
|
|
},
|
|
{
|
|
"entropy": 5.517265796661377,
|
|
"epoch": 1.9824547753355377,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00046031005223123297,
|
|
"loss": 5.2409,
|
|
"mean_token_accuracy": 0.17799139767885208,
|
|
"num_tokens": 44207042.0,
|
|
"step": 25480
|
|
},
|
|
{
|
|
"entropy": 5.4231315612792965,
|
|
"epoch": 1.9828438047072554,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.000460294331354804,
|
|
"loss": 5.0265,
|
|
"mean_token_accuracy": 0.19838292747735978,
|
|
"num_tokens": 44214678.0,
|
|
"step": 25485
|
|
},
|
|
{
|
|
"entropy": 5.410763597488403,
|
|
"epoch": 1.983232834078973,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004602786076668283,
|
|
"loss": 5.0587,
|
|
"mean_token_accuracy": 0.18839234113693237,
|
|
"num_tokens": 44223752.0,
|
|
"step": 25490
|
|
},
|
|
{
|
|
"entropy": 5.476414918899536,
|
|
"epoch": 1.9836218634506906,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.00046026288116754477,
|
|
"loss": 5.1499,
|
|
"mean_token_accuracy": 0.18430302441120147,
|
|
"num_tokens": 44232109.0,
|
|
"step": 25495
|
|
},
|
|
{
|
|
"entropy": 5.517906522750854,
|
|
"epoch": 1.984010892822408,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0004602471518571919,
|
|
"loss": 5.2429,
|
|
"mean_token_accuracy": 0.1768329322338104,
|
|
"num_tokens": 44239957.0,
|
|
"step": 25500
|
|
},
|
|
{
|
|
"entropy": 5.4962372303009035,
|
|
"epoch": 1.9843999221941258,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0004602314197360083,
|
|
"loss": 5.121,
|
|
"mean_token_accuracy": 0.18918487429618835,
|
|
"num_tokens": 44248582.0,
|
|
"step": 25505
|
|
},
|
|
{
|
|
"entropy": 5.48524284362793,
|
|
"epoch": 1.9847889515658432,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004602156848042328,
|
|
"loss": 5.1109,
|
|
"mean_token_accuracy": 0.18720681965351105,
|
|
"num_tokens": 44256711.0,
|
|
"step": 25510
|
|
},
|
|
{
|
|
"entropy": 5.4499176979064945,
|
|
"epoch": 1.9851779809375607,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.000460199947062104,
|
|
"loss": 5.1022,
|
|
"mean_token_accuracy": 0.19037640243768691,
|
|
"num_tokens": 44265140.0,
|
|
"step": 25515
|
|
},
|
|
{
|
|
"entropy": 5.506365013122559,
|
|
"epoch": 1.9855670103092784,
|
|
"grad_norm": 1.5234375,
|
|
"learning_rate": 0.00046018420650986074,
|
|
"loss": 5.1081,
|
|
"mean_token_accuracy": 0.18395187258720397,
|
|
"num_tokens": 44273560.0,
|
|
"step": 25520
|
|
},
|
|
{
|
|
"entropy": 5.359471702575684,
|
|
"epoch": 1.9859560396809959,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.000460168463147742,
|
|
"loss": 5.0214,
|
|
"mean_token_accuracy": 0.19556907564401627,
|
|
"num_tokens": 44282155.0,
|
|
"step": 25525
|
|
},
|
|
{
|
|
"entropy": 5.412130880355835,
|
|
"epoch": 1.9863450690527134,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004601527169759865,
|
|
"loss": 5.0302,
|
|
"mean_token_accuracy": 0.19116953313350676,
|
|
"num_tokens": 44291237.0,
|
|
"step": 25530
|
|
},
|
|
{
|
|
"entropy": 5.389124345779419,
|
|
"epoch": 1.986734098424431,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004601369679948333,
|
|
"loss": 5.0742,
|
|
"mean_token_accuracy": 0.19194547832012177,
|
|
"num_tokens": 44299886.0,
|
|
"step": 25535
|
|
},
|
|
{
|
|
"entropy": 5.439286518096924,
|
|
"epoch": 1.9871231277961487,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.00046012121620452127,
|
|
"loss": 5.2182,
|
|
"mean_token_accuracy": 0.18720661401748656,
|
|
"num_tokens": 44308247.0,
|
|
"step": 25540
|
|
},
|
|
{
|
|
"entropy": 5.505471277236938,
|
|
"epoch": 1.9875121571678662,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004601054616052893,
|
|
"loss": 5.0761,
|
|
"mean_token_accuracy": 0.18957599848508835,
|
|
"num_tokens": 44316301.0,
|
|
"step": 25545
|
|
},
|
|
{
|
|
"entropy": 5.54315071105957,
|
|
"epoch": 1.9879011865395837,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00046008970419737674,
|
|
"loss": 5.2126,
|
|
"mean_token_accuracy": 0.17113337516784669,
|
|
"num_tokens": 44324758.0,
|
|
"step": 25550
|
|
},
|
|
{
|
|
"entropy": 5.503973531723022,
|
|
"epoch": 1.9882902159113014,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0004600739439810225,
|
|
"loss": 5.2183,
|
|
"mean_token_accuracy": 0.1754635363817215,
|
|
"num_tokens": 44333139.0,
|
|
"step": 25555
|
|
},
|
|
{
|
|
"entropy": 5.532423734664917,
|
|
"epoch": 1.9886792452830189,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00046005818095646564,
|
|
"loss": 5.1616,
|
|
"mean_token_accuracy": 0.18649605065584182,
|
|
"num_tokens": 44341992.0,
|
|
"step": 25560
|
|
},
|
|
{
|
|
"entropy": 5.4218133926391605,
|
|
"epoch": 1.9890682746547363,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.00046004241512394544,
|
|
"loss": 5.1299,
|
|
"mean_token_accuracy": 0.18494678735733033,
|
|
"num_tokens": 44350947.0,
|
|
"step": 25565
|
|
},
|
|
{
|
|
"entropy": 5.424895143508911,
|
|
"epoch": 1.989457304026454,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004600266464837012,
|
|
"loss": 5.0706,
|
|
"mean_token_accuracy": 0.19498218595981598,
|
|
"num_tokens": 44358934.0,
|
|
"step": 25570
|
|
},
|
|
{
|
|
"entropy": 5.412136125564575,
|
|
"epoch": 1.9898463333981715,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004600108750359721,
|
|
"loss": 5.035,
|
|
"mean_token_accuracy": 0.19213857352733613,
|
|
"num_tokens": 44367117.0,
|
|
"step": 25575
|
|
},
|
|
{
|
|
"entropy": 5.39286847114563,
|
|
"epoch": 1.990235362769889,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00045999510078099736,
|
|
"loss": 5.1001,
|
|
"mean_token_accuracy": 0.1803663566708565,
|
|
"num_tokens": 44375591.0,
|
|
"step": 25580
|
|
},
|
|
{
|
|
"entropy": 5.392205619812012,
|
|
"epoch": 1.9906243921416067,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00045997932371901645,
|
|
"loss": 5.0087,
|
|
"mean_token_accuracy": 0.19347520172595978,
|
|
"num_tokens": 44384602.0,
|
|
"step": 25585
|
|
},
|
|
{
|
|
"entropy": 5.357974100112915,
|
|
"epoch": 1.9910134215133244,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0004599635438502687,
|
|
"loss": 5.0048,
|
|
"mean_token_accuracy": 0.1982121527194977,
|
|
"num_tokens": 44393451.0,
|
|
"step": 25590
|
|
},
|
|
{
|
|
"entropy": 5.415236520767212,
|
|
"epoch": 1.9914024508850419,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00045994776117499363,
|
|
"loss": 5.0412,
|
|
"mean_token_accuracy": 0.19221121072769165,
|
|
"num_tokens": 44401638.0,
|
|
"step": 25595
|
|
},
|
|
{
|
|
"entropy": 5.4471080780029295,
|
|
"epoch": 1.9917914802567593,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.00045993197569343063,
|
|
"loss": 5.0799,
|
|
"mean_token_accuracy": 0.1857247158885002,
|
|
"num_tokens": 44410337.0,
|
|
"step": 25600
|
|
},
|
|
{
|
|
"entropy": 5.44191575050354,
|
|
"epoch": 1.992180509628477,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00045991618740581926,
|
|
"loss": 5.1348,
|
|
"mean_token_accuracy": 0.18859644532203673,
|
|
"num_tokens": 44418178.0,
|
|
"step": 25605
|
|
},
|
|
{
|
|
"entropy": 5.4825092315673825,
|
|
"epoch": 1.9925695390001945,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004599003963123991,
|
|
"loss": 5.1655,
|
|
"mean_token_accuracy": 0.17812655866146088,
|
|
"num_tokens": 44427056.0,
|
|
"step": 25610
|
|
},
|
|
{
|
|
"entropy": 5.527002668380737,
|
|
"epoch": 1.992958568371912,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00045988460241340966,
|
|
"loss": 5.1052,
|
|
"mean_token_accuracy": 0.1891911432147026,
|
|
"num_tokens": 44434687.0,
|
|
"step": 25615
|
|
},
|
|
{
|
|
"entropy": 5.426431560516358,
|
|
"epoch": 1.9933475977436297,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00045986880570909075,
|
|
"loss": 5.0853,
|
|
"mean_token_accuracy": 0.19251642227172852,
|
|
"num_tokens": 44442763.0,
|
|
"step": 25620
|
|
},
|
|
{
|
|
"entropy": 5.302097034454346,
|
|
"epoch": 1.9937366271153472,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00045985300619968186,
|
|
"loss": 4.9971,
|
|
"mean_token_accuracy": 0.19307748675346376,
|
|
"num_tokens": 44451850.0,
|
|
"step": 25625
|
|
},
|
|
{
|
|
"entropy": 5.344841337203979,
|
|
"epoch": 1.9941256564870646,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00045983720388542286,
|
|
"loss": 5.0317,
|
|
"mean_token_accuracy": 0.19620566964149475,
|
|
"num_tokens": 44459915.0,
|
|
"step": 25630
|
|
},
|
|
{
|
|
"entropy": 5.335512781143189,
|
|
"epoch": 1.9945146858587823,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004598213987665535,
|
|
"loss": 5.1088,
|
|
"mean_token_accuracy": 0.18710825741291046,
|
|
"num_tokens": 44469252.0,
|
|
"step": 25635
|
|
},
|
|
{
|
|
"entropy": 5.537695980072021,
|
|
"epoch": 1.9949037152305,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00045980559084331354,
|
|
"loss": 5.1978,
|
|
"mean_token_accuracy": 0.18232716172933577,
|
|
"num_tokens": 44477748.0,
|
|
"step": 25640
|
|
},
|
|
{
|
|
"entropy": 5.439034366607666,
|
|
"epoch": 1.9952927446022175,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.000459789780115943,
|
|
"loss": 5.0972,
|
|
"mean_token_accuracy": 0.18603037297725677,
|
|
"num_tokens": 44485796.0,
|
|
"step": 25645
|
|
},
|
|
{
|
|
"entropy": 5.363985443115235,
|
|
"epoch": 1.995681773973935,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.00045977396658468156,
|
|
"loss": 5.1167,
|
|
"mean_token_accuracy": 0.18398183733224868,
|
|
"num_tokens": 44494604.0,
|
|
"step": 25650
|
|
},
|
|
{
|
|
"entropy": 5.3774957180023195,
|
|
"epoch": 1.9960708033456527,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004597581502497693,
|
|
"loss": 5.0954,
|
|
"mean_token_accuracy": 0.18464464992284774,
|
|
"num_tokens": 44503728.0,
|
|
"step": 25655
|
|
},
|
|
{
|
|
"entropy": 5.46725492477417,
|
|
"epoch": 1.9964598327173702,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004597423311114462,
|
|
"loss": 5.0732,
|
|
"mean_token_accuracy": 0.19545128792524338,
|
|
"num_tokens": 44512201.0,
|
|
"step": 25660
|
|
},
|
|
{
|
|
"entropy": 5.493855571746826,
|
|
"epoch": 1.9968488620890876,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004597265091699522,
|
|
"loss": 5.1178,
|
|
"mean_token_accuracy": 0.18901610374450684,
|
|
"num_tokens": 44520122.0,
|
|
"step": 25665
|
|
},
|
|
{
|
|
"entropy": 5.373078966140747,
|
|
"epoch": 1.9972378914608053,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0004597106844255276,
|
|
"loss": 5.0875,
|
|
"mean_token_accuracy": 0.19146127849817277,
|
|
"num_tokens": 44528928.0,
|
|
"step": 25670
|
|
},
|
|
{
|
|
"entropy": 5.48609561920166,
|
|
"epoch": 1.9976269208325228,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00045969485687841227,
|
|
"loss": 5.2461,
|
|
"mean_token_accuracy": 0.18020720034837723,
|
|
"num_tokens": 44537330.0,
|
|
"step": 25675
|
|
},
|
|
{
|
|
"entropy": 5.50549840927124,
|
|
"epoch": 1.9980159502042403,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.00045967902652884645,
|
|
"loss": 5.1043,
|
|
"mean_token_accuracy": 0.18896862268447875,
|
|
"num_tokens": 44545748.0,
|
|
"step": 25680
|
|
},
|
|
{
|
|
"entropy": 5.465701961517334,
|
|
"epoch": 1.998404979575958,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0004596631933770704,
|
|
"loss": 5.2182,
|
|
"mean_token_accuracy": 0.18674880713224412,
|
|
"num_tokens": 44554562.0,
|
|
"step": 25685
|
|
},
|
|
{
|
|
"entropy": 5.440627384185791,
|
|
"epoch": 1.9987940089476757,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00045964735742332427,
|
|
"loss": 5.0667,
|
|
"mean_token_accuracy": 0.189968740940094,
|
|
"num_tokens": 44563544.0,
|
|
"step": 25690
|
|
},
|
|
{
|
|
"entropy": 5.4541370391845705,
|
|
"epoch": 1.9991830383193931,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004596315186678484,
|
|
"loss": 5.1188,
|
|
"mean_token_accuracy": 0.1874745026230812,
|
|
"num_tokens": 44571179.0,
|
|
"step": 25695
|
|
},
|
|
{
|
|
"entropy": 5.420654773712158,
|
|
"epoch": 1.9995720676911106,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00045961567711088307,
|
|
"loss": 5.1589,
|
|
"mean_token_accuracy": 0.18598103076219558,
|
|
"num_tokens": 44580237.0,
|
|
"step": 25700
|
|
},
|
|
{
|
|
"entropy": 5.4172276020050045,
|
|
"epoch": 1.9999610970628283,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00045959983275266873,
|
|
"loss": 5.1123,
|
|
"mean_token_accuracy": 0.18862324208021164,
|
|
"num_tokens": 44588362.0,
|
|
"step": 25705
|
|
},
|
|
{
|
|
"entropy": 5.421308517456055,
|
|
"epoch": 2.000311223497374,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00045958398559344573,
|
|
"loss": 5.033,
|
|
"mean_token_accuracy": 0.19984576437208387,
|
|
"num_tokens": 44596037.0,
|
|
"step": 25710
|
|
},
|
|
{
|
|
"entropy": 5.46260437965393,
|
|
"epoch": 2.0007002528690916,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.00045956813563345454,
|
|
"loss": 5.0812,
|
|
"mean_token_accuracy": 0.19407282024621964,
|
|
"num_tokens": 44604913.0,
|
|
"step": 25715
|
|
},
|
|
{
|
|
"entropy": 5.510783576965332,
|
|
"epoch": 2.0010892822408093,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004595522828729357,
|
|
"loss": 5.127,
|
|
"mean_token_accuracy": 0.18896977305412294,
|
|
"num_tokens": 44613523.0,
|
|
"step": 25720
|
|
},
|
|
{
|
|
"entropy": 5.381552791595459,
|
|
"epoch": 2.0014783116125265,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004595364273121296,
|
|
"loss": 4.9153,
|
|
"mean_token_accuracy": 0.19704417884349823,
|
|
"num_tokens": 44622259.0,
|
|
"step": 25725
|
|
},
|
|
{
|
|
"entropy": 5.351221990585327,
|
|
"epoch": 2.0018673409842442,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0004595205689512771,
|
|
"loss": 4.9784,
|
|
"mean_token_accuracy": 0.19724734574556352,
|
|
"num_tokens": 44630793.0,
|
|
"step": 25730
|
|
},
|
|
{
|
|
"entropy": 5.454925060272217,
|
|
"epoch": 2.002256370355962,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.00045950470779061855,
|
|
"loss": 5.0341,
|
|
"mean_token_accuracy": 0.19047658741474152,
|
|
"num_tokens": 44638986.0,
|
|
"step": 25735
|
|
},
|
|
{
|
|
"entropy": 5.471593952178955,
|
|
"epoch": 2.0026453997276796,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.00045948884383039475,
|
|
"loss": 5.0793,
|
|
"mean_token_accuracy": 0.1854041561484337,
|
|
"num_tokens": 44647491.0,
|
|
"step": 25740
|
|
},
|
|
{
|
|
"entropy": 5.359787368774414,
|
|
"epoch": 2.003034429099397,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.00045947297707084637,
|
|
"loss": 4.9835,
|
|
"mean_token_accuracy": 0.19416986852884294,
|
|
"num_tokens": 44655431.0,
|
|
"step": 25745
|
|
},
|
|
{
|
|
"entropy": 5.386890029907226,
|
|
"epoch": 2.0034234584711146,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004594571075122142,
|
|
"loss": 5.0224,
|
|
"mean_token_accuracy": 0.19539991468191148,
|
|
"num_tokens": 44664398.0,
|
|
"step": 25750
|
|
},
|
|
{
|
|
"entropy": 5.458368396759033,
|
|
"epoch": 2.0038124878428323,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00045944123515473905,
|
|
"loss": 5.0062,
|
|
"mean_token_accuracy": 0.19371364414691924,
|
|
"num_tokens": 44673372.0,
|
|
"step": 25755
|
|
},
|
|
{
|
|
"entropy": 5.349647903442383,
|
|
"epoch": 2.0042015172145495,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00045942535999866175,
|
|
"loss": 4.9436,
|
|
"mean_token_accuracy": 0.1981011673808098,
|
|
"num_tokens": 44681736.0,
|
|
"step": 25760
|
|
},
|
|
{
|
|
"entropy": 5.385314035415649,
|
|
"epoch": 2.0045905465862672,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 0.0004594094820442231,
|
|
"loss": 5.0796,
|
|
"mean_token_accuracy": 0.189360573887825,
|
|
"num_tokens": 44691858.0,
|
|
"step": 25765
|
|
},
|
|
{
|
|
"entropy": 5.511190605163574,
|
|
"epoch": 2.004979575957985,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.000459393601291664,
|
|
"loss": 5.1287,
|
|
"mean_token_accuracy": 0.18726930320262908,
|
|
"num_tokens": 44701002.0,
|
|
"step": 25770
|
|
},
|
|
{
|
|
"entropy": 5.40196681022644,
|
|
"epoch": 2.005368605329702,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00045937771774122563,
|
|
"loss": 5.0016,
|
|
"mean_token_accuracy": 0.1971822753548622,
|
|
"num_tokens": 44709158.0,
|
|
"step": 25775
|
|
},
|
|
{
|
|
"entropy": 5.4094174861907955,
|
|
"epoch": 2.00575763470142,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0004593618313931488,
|
|
"loss": 5.0197,
|
|
"mean_token_accuracy": 0.19358438700437547,
|
|
"num_tokens": 44717495.0,
|
|
"step": 25780
|
|
},
|
|
{
|
|
"entropy": 5.408371639251709,
|
|
"epoch": 2.0061466640731376,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.00045934594224767463,
|
|
"loss": 5.0056,
|
|
"mean_token_accuracy": 0.19387351870536804,
|
|
"num_tokens": 44726040.0,
|
|
"step": 25785
|
|
},
|
|
{
|
|
"entropy": 5.395246362686157,
|
|
"epoch": 2.0065356934448553,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00045933005030504424,
|
|
"loss": 5.0648,
|
|
"mean_token_accuracy": 0.18496117293834685,
|
|
"num_tokens": 44735098.0,
|
|
"step": 25790
|
|
},
|
|
{
|
|
"entropy": 5.418350553512573,
|
|
"epoch": 2.0069247228165725,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00045931415556549863,
|
|
"loss": 5.0285,
|
|
"mean_token_accuracy": 0.1921205297112465,
|
|
"num_tokens": 44743764.0,
|
|
"step": 25795
|
|
},
|
|
{
|
|
"entropy": 5.423763847351074,
|
|
"epoch": 2.0073137521882902,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004592982580292792,
|
|
"loss": 4.9633,
|
|
"mean_token_accuracy": 0.1936950296163559,
|
|
"num_tokens": 44751554.0,
|
|
"step": 25800
|
|
},
|
|
{
|
|
"entropy": 5.491714811325073,
|
|
"epoch": 2.007702781560008,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00045928235769662697,
|
|
"loss": 5.1369,
|
|
"mean_token_accuracy": 0.18151630312204362,
|
|
"num_tokens": 44760158.0,
|
|
"step": 25805
|
|
},
|
|
{
|
|
"entropy": 5.384233379364014,
|
|
"epoch": 2.008091810931725,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00045926645456778327,
|
|
"loss": 5.012,
|
|
"mean_token_accuracy": 0.19640197604894638,
|
|
"num_tokens": 44769209.0,
|
|
"step": 25810
|
|
},
|
|
{
|
|
"entropy": 5.396884202957153,
|
|
"epoch": 2.008480840303443,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.00045925054864298946,
|
|
"loss": 5.0525,
|
|
"mean_token_accuracy": 0.19377089589834212,
|
|
"num_tokens": 44777991.0,
|
|
"step": 25815
|
|
},
|
|
{
|
|
"entropy": 5.4572313785552975,
|
|
"epoch": 2.0088698696751606,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00045923463992248684,
|
|
"loss": 5.0664,
|
|
"mean_token_accuracy": 0.18628352731466294,
|
|
"num_tokens": 44786492.0,
|
|
"step": 25820
|
|
},
|
|
{
|
|
"entropy": 5.449353933334351,
|
|
"epoch": 2.009258899046878,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00045921872840651675,
|
|
"loss": 5.1258,
|
|
"mean_token_accuracy": 0.188339501619339,
|
|
"num_tokens": 44795021.0,
|
|
"step": 25825
|
|
},
|
|
{
|
|
"entropy": 5.424725532531738,
|
|
"epoch": 2.0096479284185955,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00045920281409532064,
|
|
"loss": 4.9959,
|
|
"mean_token_accuracy": 0.1935458779335022,
|
|
"num_tokens": 44803267.0,
|
|
"step": 25830
|
|
},
|
|
{
|
|
"entropy": 5.472720289230347,
|
|
"epoch": 2.010036957790313,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0004591868969891401,
|
|
"loss": 5.1146,
|
|
"mean_token_accuracy": 0.18647825121879577,
|
|
"num_tokens": 44811954.0,
|
|
"step": 25835
|
|
},
|
|
{
|
|
"entropy": 5.406618118286133,
|
|
"epoch": 2.010425987162031,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0004591709770882165,
|
|
"loss": 4.948,
|
|
"mean_token_accuracy": 0.1979189246892929,
|
|
"num_tokens": 44820748.0,
|
|
"step": 25840
|
|
},
|
|
{
|
|
"entropy": 5.424556732177734,
|
|
"epoch": 2.010815016533748,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0004591550543927915,
|
|
"loss": 5.1599,
|
|
"mean_token_accuracy": 0.18526611477136612,
|
|
"num_tokens": 44829400.0,
|
|
"step": 25845
|
|
},
|
|
{
|
|
"entropy": 5.474016380310059,
|
|
"epoch": 2.011204045905466,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0004591391289031067,
|
|
"loss": 5.0657,
|
|
"mean_token_accuracy": 0.1941610261797905,
|
|
"num_tokens": 44838663.0,
|
|
"step": 25850
|
|
},
|
|
{
|
|
"entropy": 5.418667936325074,
|
|
"epoch": 2.0115930752771836,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0004591232006194036,
|
|
"loss": 4.9601,
|
|
"mean_token_accuracy": 0.19734057188034057,
|
|
"num_tokens": 44847365.0,
|
|
"step": 25855
|
|
},
|
|
{
|
|
"entropy": 5.437780237197876,
|
|
"epoch": 2.011982104648901,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00045910726954192404,
|
|
"loss": 5.0534,
|
|
"mean_token_accuracy": 0.19181837439537047,
|
|
"num_tokens": 44856093.0,
|
|
"step": 25860
|
|
},
|
|
{
|
|
"entropy": 5.380312919616699,
|
|
"epoch": 2.0123711340206185,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004590913356709097,
|
|
"loss": 5.0192,
|
|
"mean_token_accuracy": 0.19159596115350724,
|
|
"num_tokens": 44865116.0,
|
|
"step": 25865
|
|
},
|
|
{
|
|
"entropy": 5.415362691879272,
|
|
"epoch": 2.012760163392336,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00045907539900660237,
|
|
"loss": 5.0871,
|
|
"mean_token_accuracy": 0.18402304053306578,
|
|
"num_tokens": 44874037.0,
|
|
"step": 25870
|
|
},
|
|
{
|
|
"entropy": 5.3707544803619385,
|
|
"epoch": 2.013149192764054,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.0004590594595492438,
|
|
"loss": 4.9168,
|
|
"mean_token_accuracy": 0.19865640997886658,
|
|
"num_tokens": 44882603.0,
|
|
"step": 25875
|
|
},
|
|
{
|
|
"entropy": 5.41123857498169,
|
|
"epoch": 2.013538222135771,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00045904351729907593,
|
|
"loss": 4.9732,
|
|
"mean_token_accuracy": 0.19583404213190078,
|
|
"num_tokens": 44890645.0,
|
|
"step": 25880
|
|
},
|
|
{
|
|
"entropy": 5.441631221771241,
|
|
"epoch": 2.013927251507489,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.00045902757225634066,
|
|
"loss": 5.0894,
|
|
"mean_token_accuracy": 0.19437866657972336,
|
|
"num_tokens": 44898972.0,
|
|
"step": 25885
|
|
},
|
|
{
|
|
"entropy": 5.371956157684326,
|
|
"epoch": 2.0143162808792066,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0004590116244212799,
|
|
"loss": 5.0833,
|
|
"mean_token_accuracy": 0.19374625086784364,
|
|
"num_tokens": 44907427.0,
|
|
"step": 25890
|
|
},
|
|
{
|
|
"entropy": 5.485247468948364,
|
|
"epoch": 2.014705310250924,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0004589956737941355,
|
|
"loss": 5.127,
|
|
"mean_token_accuracy": 0.191416372358799,
|
|
"num_tokens": 44916465.0,
|
|
"step": 25895
|
|
},
|
|
{
|
|
"entropy": 5.45973801612854,
|
|
"epoch": 2.0150943396226415,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004589797203751497,
|
|
"loss": 5.0138,
|
|
"mean_token_accuracy": 0.1982505977153778,
|
|
"num_tokens": 44925102.0,
|
|
"step": 25900
|
|
},
|
|
{
|
|
"entropy": 5.347501802444458,
|
|
"epoch": 2.015483368994359,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0004589637641645645,
|
|
"loss": 4.9967,
|
|
"mean_token_accuracy": 0.19548143148422242,
|
|
"num_tokens": 44933061.0,
|
|
"step": 25905
|
|
},
|
|
{
|
|
"entropy": 5.3559760570526125,
|
|
"epoch": 2.0158723983660765,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00045894780516262193,
|
|
"loss": 5.0354,
|
|
"mean_token_accuracy": 0.19443740099668502,
|
|
"num_tokens": 44942342.0,
|
|
"step": 25910
|
|
},
|
|
{
|
|
"entropy": 5.466866493225098,
|
|
"epoch": 2.016261427737794,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0004589318433695642,
|
|
"loss": 5.0322,
|
|
"mean_token_accuracy": 0.19949530810117722,
|
|
"num_tokens": 44951163.0,
|
|
"step": 25915
|
|
},
|
|
{
|
|
"entropy": 5.368049097061157,
|
|
"epoch": 2.016650457109512,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004589158787856336,
|
|
"loss": 5.0257,
|
|
"mean_token_accuracy": 0.19454297721385955,
|
|
"num_tokens": 44960208.0,
|
|
"step": 25920
|
|
},
|
|
{
|
|
"entropy": 5.382708978652954,
|
|
"epoch": 2.0170394864812295,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0004588999114110721,
|
|
"loss": 4.9065,
|
|
"mean_token_accuracy": 0.1986604943871498,
|
|
"num_tokens": 44969051.0,
|
|
"step": 25925
|
|
},
|
|
{
|
|
"entropy": 5.382196950912475,
|
|
"epoch": 2.017428515852947,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.0004588839412461223,
|
|
"loss": 4.9693,
|
|
"mean_token_accuracy": 0.20577432215213776,
|
|
"num_tokens": 44977980.0,
|
|
"step": 25930
|
|
},
|
|
{
|
|
"entropy": 5.367998123168945,
|
|
"epoch": 2.0178175452246645,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0004588679682910264,
|
|
"loss": 5.024,
|
|
"mean_token_accuracy": 0.1836980476975441,
|
|
"num_tokens": 44986520.0,
|
|
"step": 25935
|
|
},
|
|
{
|
|
"entropy": 5.406614685058594,
|
|
"epoch": 2.018206574596382,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.0004588519925460266,
|
|
"loss": 5.0478,
|
|
"mean_token_accuracy": 0.19249131828546523,
|
|
"num_tokens": 44995011.0,
|
|
"step": 25940
|
|
},
|
|
{
|
|
"entropy": 5.3217706203460695,
|
|
"epoch": 2.0185956039680995,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004588360140113655,
|
|
"loss": 5.0255,
|
|
"mean_token_accuracy": 0.19762341380119325,
|
|
"num_tokens": 45004611.0,
|
|
"step": 25945
|
|
},
|
|
{
|
|
"entropy": 5.484057426452637,
|
|
"epoch": 2.018984633339817,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0004588200326872855,
|
|
"loss": 5.0625,
|
|
"mean_token_accuracy": 0.1855209141969681,
|
|
"num_tokens": 45013832.0,
|
|
"step": 25950
|
|
},
|
|
{
|
|
"entropy": 5.450709056854248,
|
|
"epoch": 2.019373662711535,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004588040485740291,
|
|
"loss": 4.9977,
|
|
"mean_token_accuracy": 0.19138199090957642,
|
|
"num_tokens": 45022751.0,
|
|
"step": 25955
|
|
},
|
|
{
|
|
"entropy": 5.465739631652832,
|
|
"epoch": 2.019762692083252,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 0.0004587880616718387,
|
|
"loss": 5.0727,
|
|
"mean_token_accuracy": 0.1880890741944313,
|
|
"num_tokens": 45030826.0,
|
|
"step": 25960
|
|
},
|
|
{
|
|
"entropy": 5.417150211334229,
|
|
"epoch": 2.02015172145497,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.0004587720719809572,
|
|
"loss": 5.0511,
|
|
"mean_token_accuracy": 0.19175425171852112,
|
|
"num_tokens": 45039625.0,
|
|
"step": 25965
|
|
},
|
|
{
|
|
"entropy": 5.368811082839966,
|
|
"epoch": 2.0205407508266875,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004587560795016269,
|
|
"loss": 5.0153,
|
|
"mean_token_accuracy": 0.1974886417388916,
|
|
"num_tokens": 45048229.0,
|
|
"step": 25970
|
|
},
|
|
{
|
|
"entropy": 5.439561080932617,
|
|
"epoch": 2.020929780198405,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0004587400842340905,
|
|
"loss": 5.1166,
|
|
"mean_token_accuracy": 0.18204376846551895,
|
|
"num_tokens": 45057414.0,
|
|
"step": 25975
|
|
},
|
|
{
|
|
"entropy": 5.348490762710571,
|
|
"epoch": 2.0213188095701224,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.00045872408617859083,
|
|
"loss": 4.9493,
|
|
"mean_token_accuracy": 0.19199012070894242,
|
|
"num_tokens": 45065785.0,
|
|
"step": 25980
|
|
},
|
|
{
|
|
"entropy": 5.368834733963013,
|
|
"epoch": 2.02170783894184,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00045870808533537066,
|
|
"loss": 4.9777,
|
|
"mean_token_accuracy": 0.19553280621767044,
|
|
"num_tokens": 45074896.0,
|
|
"step": 25985
|
|
},
|
|
{
|
|
"entropy": 5.351745653152466,
|
|
"epoch": 2.022096868313558,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00045869208170467256,
|
|
"loss": 5.0091,
|
|
"mean_token_accuracy": 0.18995742946863176,
|
|
"num_tokens": 45083554.0,
|
|
"step": 25990
|
|
},
|
|
{
|
|
"entropy": 5.4361546516418455,
|
|
"epoch": 2.022485897685275,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004586760752867396,
|
|
"loss": 5.0229,
|
|
"mean_token_accuracy": 0.19032378643751144,
|
|
"num_tokens": 45092204.0,
|
|
"step": 25995
|
|
},
|
|
{
|
|
"entropy": 5.389403438568115,
|
|
"epoch": 2.022874927056993,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00045866006608181456,
|
|
"loss": 5.058,
|
|
"mean_token_accuracy": 0.18302899599075317,
|
|
"num_tokens": 45101665.0,
|
|
"step": 26000
|
|
},
|
|
{
|
|
"entropy": 5.3970427989959715,
|
|
"epoch": 2.0232639564287105,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004586440540901403,
|
|
"loss": 5.1069,
|
|
"mean_token_accuracy": 0.18317549973726271,
|
|
"num_tokens": 45111093.0,
|
|
"step": 26005
|
|
},
|
|
{
|
|
"entropy": 5.418169069290161,
|
|
"epoch": 2.0236529858004277,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.00045862803931195976,
|
|
"loss": 5.0016,
|
|
"mean_token_accuracy": 0.19877195507287979,
|
|
"num_tokens": 45118826.0,
|
|
"step": 26010
|
|
},
|
|
{
|
|
"entropy": 5.43197922706604,
|
|
"epoch": 2.0240420151721454,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0004586120217475161,
|
|
"loss": 5.0669,
|
|
"mean_token_accuracy": 0.19353321492671965,
|
|
"num_tokens": 45128265.0,
|
|
"step": 26015
|
|
},
|
|
{
|
|
"entropy": 5.467695331573486,
|
|
"epoch": 2.024431044543863,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0004585960013970522,
|
|
"loss": 5.1265,
|
|
"mean_token_accuracy": 0.180475415289402,
|
|
"num_tokens": 45137922.0,
|
|
"step": 26020
|
|
},
|
|
{
|
|
"entropy": 5.335978078842163,
|
|
"epoch": 2.024820073915581,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004585799782608112,
|
|
"loss": 4.9257,
|
|
"mean_token_accuracy": 0.20844435691833496,
|
|
"num_tokens": 45146242.0,
|
|
"step": 26025
|
|
},
|
|
{
|
|
"entropy": 5.451327276229859,
|
|
"epoch": 2.025209103287298,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.00045856395233903624,
|
|
"loss": 5.0845,
|
|
"mean_token_accuracy": 0.1871362417936325,
|
|
"num_tokens": 45154897.0,
|
|
"step": 26030
|
|
},
|
|
{
|
|
"entropy": 5.447779703140259,
|
|
"epoch": 2.025598132659016,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004585479236319705,
|
|
"loss": 5.0497,
|
|
"mean_token_accuracy": 0.19219166040420532,
|
|
"num_tokens": 45164786.0,
|
|
"step": 26035
|
|
},
|
|
{
|
|
"entropy": 5.438527345657349,
|
|
"epoch": 2.0259871620307335,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00045853189213985714,
|
|
"loss": 5.0777,
|
|
"mean_token_accuracy": 0.19099787771701812,
|
|
"num_tokens": 45173652.0,
|
|
"step": 26040
|
|
},
|
|
{
|
|
"entropy": 5.439251375198364,
|
|
"epoch": 2.0263761914024507,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00045851585786293943,
|
|
"loss": 4.9481,
|
|
"mean_token_accuracy": 0.19813117235898972,
|
|
"num_tokens": 45182399.0,
|
|
"step": 26045
|
|
},
|
|
{
|
|
"entropy": 5.42302188873291,
|
|
"epoch": 2.0267652207741684,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00045849982080146067,
|
|
"loss": 5.0458,
|
|
"mean_token_accuracy": 0.18592471480369568,
|
|
"num_tokens": 45191587.0,
|
|
"step": 26050
|
|
},
|
|
{
|
|
"entropy": 5.358816242218017,
|
|
"epoch": 2.027154250145886,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.0004584837809556642,
|
|
"loss": 4.9973,
|
|
"mean_token_accuracy": 0.19537313729524614,
|
|
"num_tokens": 45200032.0,
|
|
"step": 26055
|
|
},
|
|
{
|
|
"entropy": 5.388509273529053,
|
|
"epoch": 2.0275432795176034,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00045846773832579346,
|
|
"loss": 5.0536,
|
|
"mean_token_accuracy": 0.19128959774971008,
|
|
"num_tokens": 45209205.0,
|
|
"step": 26060
|
|
},
|
|
{
|
|
"entropy": 5.4480650424957275,
|
|
"epoch": 2.027932308889321,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00045845169291209176,
|
|
"loss": 5.0296,
|
|
"mean_token_accuracy": 0.1956133648753166,
|
|
"num_tokens": 45217603.0,
|
|
"step": 26065
|
|
},
|
|
{
|
|
"entropy": 5.361388397216797,
|
|
"epoch": 2.0283213382610388,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00045843564471480263,
|
|
"loss": 4.9654,
|
|
"mean_token_accuracy": 0.19228676855564117,
|
|
"num_tokens": 45225971.0,
|
|
"step": 26070
|
|
},
|
|
{
|
|
"entropy": 5.438847064971924,
|
|
"epoch": 2.0287103676327565,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0004584195937341695,
|
|
"loss": 5.0641,
|
|
"mean_token_accuracy": 0.18811849802732467,
|
|
"num_tokens": 45234494.0,
|
|
"step": 26075
|
|
},
|
|
{
|
|
"entropy": 5.375124216079712,
|
|
"epoch": 2.0290993970044737,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.00045840353997043606,
|
|
"loss": 4.8865,
|
|
"mean_token_accuracy": 0.20367511212825776,
|
|
"num_tokens": 45242685.0,
|
|
"step": 26080
|
|
},
|
|
{
|
|
"entropy": 5.364949178695679,
|
|
"epoch": 2.0294884263761914,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004583874834238458,
|
|
"loss": 4.9546,
|
|
"mean_token_accuracy": 0.19468216150999068,
|
|
"num_tokens": 45252282.0,
|
|
"step": 26085
|
|
},
|
|
{
|
|
"entropy": 5.407217931747437,
|
|
"epoch": 2.029877455747909,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0004583714240946423,
|
|
"loss": 5.1253,
|
|
"mean_token_accuracy": 0.183768068253994,
|
|
"num_tokens": 45261390.0,
|
|
"step": 26090
|
|
},
|
|
{
|
|
"entropy": 5.529230642318725,
|
|
"epoch": 2.0302664851196264,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00045835536198306936,
|
|
"loss": 5.1574,
|
|
"mean_token_accuracy": 0.1857831209897995,
|
|
"num_tokens": 45270244.0,
|
|
"step": 26095
|
|
},
|
|
{
|
|
"entropy": 5.421908569335938,
|
|
"epoch": 2.030655514491344,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00045833929708937067,
|
|
"loss": 5.0613,
|
|
"mean_token_accuracy": 0.18150174468755723,
|
|
"num_tokens": 45279404.0,
|
|
"step": 26100
|
|
},
|
|
{
|
|
"entropy": 5.381596660614013,
|
|
"epoch": 2.0310445438630618,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004583232294137899,
|
|
"loss": 5.0127,
|
|
"mean_token_accuracy": 0.20008201897144318,
|
|
"num_tokens": 45288064.0,
|
|
"step": 26105
|
|
},
|
|
{
|
|
"entropy": 5.404865455627442,
|
|
"epoch": 2.031433573234779,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004583071589565709,
|
|
"loss": 5.0434,
|
|
"mean_token_accuracy": 0.19093966186046601,
|
|
"num_tokens": 45296528.0,
|
|
"step": 26110
|
|
},
|
|
{
|
|
"entropy": 5.381143999099732,
|
|
"epoch": 2.0318226026064967,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004582910857179576,
|
|
"loss": 4.9446,
|
|
"mean_token_accuracy": 0.20075131803750992,
|
|
"num_tokens": 45305524.0,
|
|
"step": 26115
|
|
},
|
|
{
|
|
"entropy": 5.470190143585205,
|
|
"epoch": 2.0322116319782144,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004582750096981938,
|
|
"loss": 5.1707,
|
|
"mean_token_accuracy": 0.18088085651397706,
|
|
"num_tokens": 45314386.0,
|
|
"step": 26120
|
|
},
|
|
{
|
|
"entropy": 5.4435337543487545,
|
|
"epoch": 2.032600661349932,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0004582589308975234,
|
|
"loss": 5.0619,
|
|
"mean_token_accuracy": 0.19031144827604293,
|
|
"num_tokens": 45322901.0,
|
|
"step": 26125
|
|
},
|
|
{
|
|
"entropy": 5.37007212638855,
|
|
"epoch": 2.0329896907216494,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00045824284931619044,
|
|
"loss": 4.988,
|
|
"mean_token_accuracy": 0.18776696920394897,
|
|
"num_tokens": 45331509.0,
|
|
"step": 26130
|
|
},
|
|
{
|
|
"entropy": 5.395872974395752,
|
|
"epoch": 2.033378720093367,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00045822676495443893,
|
|
"loss": 5.0586,
|
|
"mean_token_accuracy": 0.1902666598558426,
|
|
"num_tokens": 45340356.0,
|
|
"step": 26135
|
|
},
|
|
{
|
|
"entropy": 5.460249567031861,
|
|
"epoch": 2.0337677494650848,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00045821067781251284,
|
|
"loss": 5.0814,
|
|
"mean_token_accuracy": 0.19231048971414566,
|
|
"num_tokens": 45349890.0,
|
|
"step": 26140
|
|
},
|
|
{
|
|
"entropy": 5.404625463485718,
|
|
"epoch": 2.034156778836802,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00045819458789065633,
|
|
"loss": 5.0394,
|
|
"mean_token_accuracy": 0.19535226076841355,
|
|
"num_tokens": 45359249.0,
|
|
"step": 26145
|
|
},
|
|
{
|
|
"entropy": 5.394500780105591,
|
|
"epoch": 2.0345458082085197,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0004581784951891135,
|
|
"loss": 5.0141,
|
|
"mean_token_accuracy": 0.2017541766166687,
|
|
"num_tokens": 45367832.0,
|
|
"step": 26150
|
|
},
|
|
{
|
|
"entropy": 5.417349863052368,
|
|
"epoch": 2.0349348375802374,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0004581623997081286,
|
|
"loss": 5.0146,
|
|
"mean_token_accuracy": 0.19365923702716828,
|
|
"num_tokens": 45376316.0,
|
|
"step": 26155
|
|
},
|
|
{
|
|
"entropy": 5.444663000106812,
|
|
"epoch": 2.0353238669519547,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.0004581463014479459,
|
|
"loss": 5.0903,
|
|
"mean_token_accuracy": 0.1849350243806839,
|
|
"num_tokens": 45385801.0,
|
|
"step": 26160
|
|
},
|
|
{
|
|
"entropy": 5.409417247772216,
|
|
"epoch": 2.0357128963236724,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.0004581302004088095,
|
|
"loss": 5.0491,
|
|
"mean_token_accuracy": 0.1977722927927971,
|
|
"num_tokens": 45394669.0,
|
|
"step": 26165
|
|
},
|
|
{
|
|
"entropy": 5.3515464782714846,
|
|
"epoch": 2.03610192569539,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0004581140965909638,
|
|
"loss": 4.9985,
|
|
"mean_token_accuracy": 0.19251398742198944,
|
|
"num_tokens": 45402896.0,
|
|
"step": 26170
|
|
},
|
|
{
|
|
"entropy": 5.383649826049805,
|
|
"epoch": 2.0364909550671078,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0004580979899946531,
|
|
"loss": 5.0339,
|
|
"mean_token_accuracy": 0.18717775642871856,
|
|
"num_tokens": 45411047.0,
|
|
"step": 26175
|
|
},
|
|
{
|
|
"entropy": 5.489533996582031,
|
|
"epoch": 2.036879984438825,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004580818806201219,
|
|
"loss": 5.1517,
|
|
"mean_token_accuracy": 0.18341357707977296,
|
|
"num_tokens": 45420661.0,
|
|
"step": 26180
|
|
},
|
|
{
|
|
"entropy": 5.419586610794068,
|
|
"epoch": 2.0372690138105427,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00045806576846761453,
|
|
"loss": 5.0018,
|
|
"mean_token_accuracy": 0.19526728093624116,
|
|
"num_tokens": 45429199.0,
|
|
"step": 26185
|
|
},
|
|
{
|
|
"entropy": 5.399383449554444,
|
|
"epoch": 2.0376580431822604,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.00045804965353737556,
|
|
"loss": 4.9974,
|
|
"mean_token_accuracy": 0.19586683362722396,
|
|
"num_tokens": 45437504.0,
|
|
"step": 26190
|
|
},
|
|
{
|
|
"entropy": 5.35016360282898,
|
|
"epoch": 2.0380470725539777,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004580335358296494,
|
|
"loss": 4.9313,
|
|
"mean_token_accuracy": 0.19858157485723496,
|
|
"num_tokens": 45445696.0,
|
|
"step": 26195
|
|
},
|
|
{
|
|
"entropy": 5.386020708084106,
|
|
"epoch": 2.0384361019256954,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00045801741534468065,
|
|
"loss": 5.0566,
|
|
"mean_token_accuracy": 0.19132564812898636,
|
|
"num_tokens": 45455058.0,
|
|
"step": 26200
|
|
},
|
|
{
|
|
"entropy": 5.5379386901855465,
|
|
"epoch": 2.038825131297413,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0004580012920827139,
|
|
"loss": 5.1523,
|
|
"mean_token_accuracy": 0.1912221446633339,
|
|
"num_tokens": 45464193.0,
|
|
"step": 26205
|
|
},
|
|
{
|
|
"entropy": 5.3309485912323,
|
|
"epoch": 2.0392141606691303,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004579851660439939,
|
|
"loss": 4.8894,
|
|
"mean_token_accuracy": 0.20297409743070602,
|
|
"num_tokens": 45471922.0,
|
|
"step": 26210
|
|
},
|
|
{
|
|
"entropy": 5.4203649997711185,
|
|
"epoch": 2.039603190040848,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00045796903722876523,
|
|
"loss": 5.0878,
|
|
"mean_token_accuracy": 0.18505747765302658,
|
|
"num_tokens": 45480181.0,
|
|
"step": 26215
|
|
},
|
|
{
|
|
"entropy": 5.504444551467896,
|
|
"epoch": 2.0399922194125657,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0004579529056372726,
|
|
"loss": 5.1121,
|
|
"mean_token_accuracy": 0.18536008447408675,
|
|
"num_tokens": 45488970.0,
|
|
"step": 26220
|
|
},
|
|
{
|
|
"entropy": 5.489070320129395,
|
|
"epoch": 2.0403812487842834,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004579367712697609,
|
|
"loss": 5.0216,
|
|
"mean_token_accuracy": 0.19251990616321563,
|
|
"num_tokens": 45497066.0,
|
|
"step": 26225
|
|
},
|
|
{
|
|
"entropy": 5.318470239639282,
|
|
"epoch": 2.0407702781560006,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.00045792063412647475,
|
|
"loss": 4.9868,
|
|
"mean_token_accuracy": 0.1896705821156502,
|
|
"num_tokens": 45506399.0,
|
|
"step": 26230
|
|
},
|
|
{
|
|
"entropy": 5.380315589904785,
|
|
"epoch": 2.0411593075277183,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.00045790449420765925,
|
|
"loss": 5.0329,
|
|
"mean_token_accuracy": 0.18642533123493193,
|
|
"num_tokens": 45516625.0,
|
|
"step": 26235
|
|
},
|
|
{
|
|
"entropy": 5.50053653717041,
|
|
"epoch": 2.041548336899436,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00045788835151355914,
|
|
"loss": 5.136,
|
|
"mean_token_accuracy": 0.1838379755616188,
|
|
"num_tokens": 45525539.0,
|
|
"step": 26240
|
|
},
|
|
{
|
|
"entropy": 5.477184104919433,
|
|
"epoch": 2.0419373662711533,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.00045787220604441933,
|
|
"loss": 5.0641,
|
|
"mean_token_accuracy": 0.19023065268993378,
|
|
"num_tokens": 45535388.0,
|
|
"step": 26245
|
|
},
|
|
{
|
|
"entropy": 5.449324607849121,
|
|
"epoch": 2.042326395642871,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.00045785605780048497,
|
|
"loss": 5.0896,
|
|
"mean_token_accuracy": 0.1879400923848152,
|
|
"num_tokens": 45543729.0,
|
|
"step": 26250
|
|
},
|
|
{
|
|
"entropy": 5.4420207977294925,
|
|
"epoch": 2.0427154250145887,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00045783990678200086,
|
|
"loss": 5.0748,
|
|
"mean_token_accuracy": 0.19113170653581618,
|
|
"num_tokens": 45551887.0,
|
|
"step": 26255
|
|
},
|
|
{
|
|
"entropy": 5.513482093811035,
|
|
"epoch": 2.043104454386306,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.00045782375298921227,
|
|
"loss": 5.155,
|
|
"mean_token_accuracy": 0.1835791662335396,
|
|
"num_tokens": 45560267.0,
|
|
"step": 26260
|
|
},
|
|
{
|
|
"entropy": 5.456582307815552,
|
|
"epoch": 2.0434934837580236,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004578075964223642,
|
|
"loss": 5.0483,
|
|
"mean_token_accuracy": 0.18581804931163787,
|
|
"num_tokens": 45569459.0,
|
|
"step": 26265
|
|
},
|
|
{
|
|
"entropy": 5.498728084564209,
|
|
"epoch": 2.0438825131297413,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004577914370817018,
|
|
"loss": 5.018,
|
|
"mean_token_accuracy": 0.1909094125032425,
|
|
"num_tokens": 45577713.0,
|
|
"step": 26270
|
|
},
|
|
{
|
|
"entropy": 5.364718198776245,
|
|
"epoch": 2.044271542501459,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00045777527496747034,
|
|
"loss": 4.9591,
|
|
"mean_token_accuracy": 0.19274633675813674,
|
|
"num_tokens": 45586521.0,
|
|
"step": 26275
|
|
},
|
|
{
|
|
"entropy": 5.4050311088562015,
|
|
"epoch": 2.0446605718731763,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00045775911007991493,
|
|
"loss": 5.0348,
|
|
"mean_token_accuracy": 0.1895280510187149,
|
|
"num_tokens": 45595210.0,
|
|
"step": 26280
|
|
},
|
|
{
|
|
"entropy": 5.413984155654907,
|
|
"epoch": 2.045049601244894,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00045774294241928093,
|
|
"loss": 5.0793,
|
|
"mean_token_accuracy": 0.19449229538440704,
|
|
"num_tokens": 45603472.0,
|
|
"step": 26285
|
|
},
|
|
{
|
|
"entropy": 5.410886764526367,
|
|
"epoch": 2.0454386306166117,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004577267719858137,
|
|
"loss": 5.1011,
|
|
"mean_token_accuracy": 0.1893333986401558,
|
|
"num_tokens": 45612149.0,
|
|
"step": 26290
|
|
},
|
|
{
|
|
"entropy": 5.512052583694458,
|
|
"epoch": 2.045827659988329,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00045771059877975853,
|
|
"loss": 5.1349,
|
|
"mean_token_accuracy": 0.1856628254055977,
|
|
"num_tokens": 45619903.0,
|
|
"step": 26295
|
|
},
|
|
{
|
|
"entropy": 5.448427200317383,
|
|
"epoch": 2.0462166893600466,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0004576944228013608,
|
|
"loss": 5.0451,
|
|
"mean_token_accuracy": 0.19478957504034042,
|
|
"num_tokens": 45628012.0,
|
|
"step": 26300
|
|
},
|
|
{
|
|
"entropy": 5.4193802833557125,
|
|
"epoch": 2.0466057187317643,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.000457678244050866,
|
|
"loss": 5.0733,
|
|
"mean_token_accuracy": 0.18700272142887114,
|
|
"num_tokens": 45636587.0,
|
|
"step": 26305
|
|
},
|
|
{
|
|
"entropy": 5.437486553192139,
|
|
"epoch": 2.046994748103482,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0004576620625285196,
|
|
"loss": 5.0184,
|
|
"mean_token_accuracy": 0.18769490867853164,
|
|
"num_tokens": 45645189.0,
|
|
"step": 26310
|
|
},
|
|
{
|
|
"entropy": 5.471664190292358,
|
|
"epoch": 2.0473837774751993,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00045764587823456717,
|
|
"loss": 5.1134,
|
|
"mean_token_accuracy": 0.1862294554710388,
|
|
"num_tokens": 45654059.0,
|
|
"step": 26315
|
|
},
|
|
{
|
|
"entropy": 5.411434555053711,
|
|
"epoch": 2.047772806846917,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00045762969116925424,
|
|
"loss": 4.9554,
|
|
"mean_token_accuracy": 0.20261223018169403,
|
|
"num_tokens": 45662125.0,
|
|
"step": 26320
|
|
},
|
|
{
|
|
"entropy": 5.43969612121582,
|
|
"epoch": 2.0481618362186347,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00045761350133282643,
|
|
"loss": 5.0425,
|
|
"mean_token_accuracy": 0.19617673009634018,
|
|
"num_tokens": 45670068.0,
|
|
"step": 26325
|
|
},
|
|
{
|
|
"entropy": 5.4207923412323,
|
|
"epoch": 2.048550865590352,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.00045759730872552937,
|
|
"loss": 4.92,
|
|
"mean_token_accuracy": 0.2021739065647125,
|
|
"num_tokens": 45678717.0,
|
|
"step": 26330
|
|
},
|
|
{
|
|
"entropy": 5.392726182937622,
|
|
"epoch": 2.0489398949620696,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004575811133476088,
|
|
"loss": 5.0194,
|
|
"mean_token_accuracy": 0.19141270965337753,
|
|
"num_tokens": 45686882.0,
|
|
"step": 26335
|
|
},
|
|
{
|
|
"entropy": 5.327445125579834,
|
|
"epoch": 2.0493289243337873,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00045756491519931047,
|
|
"loss": 4.955,
|
|
"mean_token_accuracy": 0.19678519517183304,
|
|
"num_tokens": 45695460.0,
|
|
"step": 26340
|
|
},
|
|
{
|
|
"entropy": 5.507504844665528,
|
|
"epoch": 2.0497179537055046,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0004575487142808801,
|
|
"loss": 5.0983,
|
|
"mean_token_accuracy": 0.1843729078769684,
|
|
"num_tokens": 45703287.0,
|
|
"step": 26345
|
|
},
|
|
{
|
|
"entropy": 5.505461120605469,
|
|
"epoch": 2.0501069830772223,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004575325105925636,
|
|
"loss": 5.1414,
|
|
"mean_token_accuracy": 0.17672090232372284,
|
|
"num_tokens": 45712830.0,
|
|
"step": 26350
|
|
},
|
|
{
|
|
"entropy": 5.353002977371216,
|
|
"epoch": 2.05049601244894,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.00045751630413460665,
|
|
"loss": 5.089,
|
|
"mean_token_accuracy": 0.19246399402618408,
|
|
"num_tokens": 45720701.0,
|
|
"step": 26355
|
|
},
|
|
{
|
|
"entropy": 5.39636926651001,
|
|
"epoch": 2.0508850418206577,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004575000949072554,
|
|
"loss": 4.9897,
|
|
"mean_token_accuracy": 0.19478224068880082,
|
|
"num_tokens": 45728663.0,
|
|
"step": 26360
|
|
},
|
|
{
|
|
"entropy": 5.4227899551391605,
|
|
"epoch": 2.051274071192375,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0004574838829107557,
|
|
"loss": 5.0343,
|
|
"mean_token_accuracy": 0.1888278603553772,
|
|
"num_tokens": 45737661.0,
|
|
"step": 26365
|
|
},
|
|
{
|
|
"entropy": 5.304185295104981,
|
|
"epoch": 2.0516631005640926,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0004574676681453535,
|
|
"loss": 4.9898,
|
|
"mean_token_accuracy": 0.19670014679431916,
|
|
"num_tokens": 45746343.0,
|
|
"step": 26370
|
|
},
|
|
{
|
|
"entropy": 5.325126361846924,
|
|
"epoch": 2.0520521299358103,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00045745145061129485,
|
|
"loss": 5.0312,
|
|
"mean_token_accuracy": 0.19176389127969742,
|
|
"num_tokens": 45755025.0,
|
|
"step": 26375
|
|
},
|
|
{
|
|
"entropy": 5.428109407424927,
|
|
"epoch": 2.0524411593075276,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00045743523030882584,
|
|
"loss": 5.0828,
|
|
"mean_token_accuracy": 0.1929038032889366,
|
|
"num_tokens": 45763107.0,
|
|
"step": 26380
|
|
},
|
|
{
|
|
"entropy": 5.3779298782348635,
|
|
"epoch": 2.0528301886792453,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004574190072381926,
|
|
"loss": 4.9754,
|
|
"mean_token_accuracy": 0.19898145496845246,
|
|
"num_tokens": 45771754.0,
|
|
"step": 26385
|
|
},
|
|
{
|
|
"entropy": 5.4276305675506595,
|
|
"epoch": 2.053219218050963,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004574027813996413,
|
|
"loss": 5.1521,
|
|
"mean_token_accuracy": 0.18219714760780334,
|
|
"num_tokens": 45779282.0,
|
|
"step": 26390
|
|
},
|
|
{
|
|
"entropy": 5.506859493255615,
|
|
"epoch": 2.05360824742268,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0004573865527934181,
|
|
"loss": 5.1107,
|
|
"mean_token_accuracy": 0.188125841319561,
|
|
"num_tokens": 45788002.0,
|
|
"step": 26395
|
|
},
|
|
{
|
|
"entropy": 5.519529342651367,
|
|
"epoch": 2.053997276794398,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004573703214197692,
|
|
"loss": 5.1035,
|
|
"mean_token_accuracy": 0.1825848326086998,
|
|
"num_tokens": 45796563.0,
|
|
"step": 26400
|
|
},
|
|
{
|
|
"entropy": 5.386622762680053,
|
|
"epoch": 2.0543863061661156,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00045735408727894095,
|
|
"loss": 4.9954,
|
|
"mean_token_accuracy": 0.1879150614142418,
|
|
"num_tokens": 45806311.0,
|
|
"step": 26405
|
|
},
|
|
{
|
|
"entropy": 5.426680994033814,
|
|
"epoch": 2.0547753355378333,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.00045733785037117977,
|
|
"loss": 5.0057,
|
|
"mean_token_accuracy": 0.19833437353372574,
|
|
"num_tokens": 45814007.0,
|
|
"step": 26410
|
|
},
|
|
{
|
|
"entropy": 5.437084341049195,
|
|
"epoch": 2.0551643649095506,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0004573216106967319,
|
|
"loss": 5.0432,
|
|
"mean_token_accuracy": 0.18644810616970062,
|
|
"num_tokens": 45822492.0,
|
|
"step": 26415
|
|
},
|
|
{
|
|
"entropy": 5.338999271392822,
|
|
"epoch": 2.0555533942812683,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00045730536825584365,
|
|
"loss": 4.9764,
|
|
"mean_token_accuracy": 0.1982593536376953,
|
|
"num_tokens": 45830853.0,
|
|
"step": 26420
|
|
},
|
|
{
|
|
"entropy": 5.46483678817749,
|
|
"epoch": 2.055942423652986,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00045728912304876176,
|
|
"loss": 5.0787,
|
|
"mean_token_accuracy": 0.18382885158061982,
|
|
"num_tokens": 45839948.0,
|
|
"step": 26425
|
|
},
|
|
{
|
|
"entropy": 5.532828426361084,
|
|
"epoch": 2.056331453024703,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004572728750757326,
|
|
"loss": 5.1684,
|
|
"mean_token_accuracy": 0.17548505663871766,
|
|
"num_tokens": 45848264.0,
|
|
"step": 26430
|
|
},
|
|
{
|
|
"entropy": 5.336362695693969,
|
|
"epoch": 2.056720482396421,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004572566243370025,
|
|
"loss": 4.9393,
|
|
"mean_token_accuracy": 0.19766717851161958,
|
|
"num_tokens": 45856523.0,
|
|
"step": 26435
|
|
},
|
|
{
|
|
"entropy": 5.368370914459229,
|
|
"epoch": 2.0571095117681386,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0004572403708328183,
|
|
"loss": 5.0488,
|
|
"mean_token_accuracy": 0.19112208485603333,
|
|
"num_tokens": 45864736.0,
|
|
"step": 26440
|
|
},
|
|
{
|
|
"entropy": 5.387862300872802,
|
|
"epoch": 2.057498541139856,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0004572241145634266,
|
|
"loss": 5.0442,
|
|
"mean_token_accuracy": 0.187595197558403,
|
|
"num_tokens": 45873979.0,
|
|
"step": 26445
|
|
},
|
|
{
|
|
"entropy": 5.3853226661682125,
|
|
"epoch": 2.0578875705115736,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.000457207855529074,
|
|
"loss": 5.0416,
|
|
"mean_token_accuracy": 0.19554167836904526,
|
|
"num_tokens": 45882545.0,
|
|
"step": 26450
|
|
},
|
|
{
|
|
"entropy": 5.4254437446594235,
|
|
"epoch": 2.0582765998832913,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00045719159373000713,
|
|
"loss": 5.112,
|
|
"mean_token_accuracy": 0.18386237025260926,
|
|
"num_tokens": 45890830.0,
|
|
"step": 26455
|
|
},
|
|
{
|
|
"entropy": 5.524672937393189,
|
|
"epoch": 2.058665629255009,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004571753291664729,
|
|
"loss": 5.0458,
|
|
"mean_token_accuracy": 0.18822207152843476,
|
|
"num_tokens": 45899457.0,
|
|
"step": 26460
|
|
},
|
|
{
|
|
"entropy": 5.357991743087768,
|
|
"epoch": 2.059054658626726,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.0004571590618387179,
|
|
"loss": 5.0578,
|
|
"mean_token_accuracy": 0.1917414888739586,
|
|
"num_tokens": 45907998.0,
|
|
"step": 26465
|
|
},
|
|
{
|
|
"entropy": 5.368137788772583,
|
|
"epoch": 2.059443687998444,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0004571427917469892,
|
|
"loss": 4.965,
|
|
"mean_token_accuracy": 0.19362906515598297,
|
|
"num_tokens": 45916102.0,
|
|
"step": 26470
|
|
},
|
|
{
|
|
"entropy": 5.353817510604858,
|
|
"epoch": 2.0598327173701616,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00045712651889153345,
|
|
"loss": 5.024,
|
|
"mean_token_accuracy": 0.19396157264709474,
|
|
"num_tokens": 45924347.0,
|
|
"step": 26475
|
|
},
|
|
{
|
|
"entropy": 5.422517490386963,
|
|
"epoch": 2.060221746741879,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00045711024327259764,
|
|
"loss": 5.0357,
|
|
"mean_token_accuracy": 0.19892602860927583,
|
|
"num_tokens": 45932702.0,
|
|
"step": 26480
|
|
},
|
|
{
|
|
"entropy": 5.33369631767273,
|
|
"epoch": 2.0606107761135966,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.00045709396489042884,
|
|
"loss": 4.9853,
|
|
"mean_token_accuracy": 0.19209445118904114,
|
|
"num_tokens": 45941235.0,
|
|
"step": 26485
|
|
},
|
|
{
|
|
"entropy": 5.4426658153533936,
|
|
"epoch": 2.0609998054853143,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00045707768374527385,
|
|
"loss": 5.0017,
|
|
"mean_token_accuracy": 0.19857096970081328,
|
|
"num_tokens": 45949582.0,
|
|
"step": 26490
|
|
},
|
|
{
|
|
"entropy": 5.448131561279297,
|
|
"epoch": 2.0613888348570315,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.0004570613998373799,
|
|
"loss": 5.0593,
|
|
"mean_token_accuracy": 0.18770783692598342,
|
|
"num_tokens": 45957920.0,
|
|
"step": 26495
|
|
},
|
|
{
|
|
"entropy": 5.388140249252319,
|
|
"epoch": 2.061777864228749,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.00045704511316699395,
|
|
"loss": 5.1079,
|
|
"mean_token_accuracy": 0.19046034663915634,
|
|
"num_tokens": 45966302.0,
|
|
"step": 26500
|
|
},
|
|
{
|
|
"entropy": 5.437421083450317,
|
|
"epoch": 2.062166893600467,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00045702882373436317,
|
|
"loss": 5.1327,
|
|
"mean_token_accuracy": 0.1886591747403145,
|
|
"num_tokens": 45975481.0,
|
|
"step": 26505
|
|
},
|
|
{
|
|
"entropy": 5.5411149024963375,
|
|
"epoch": 2.0625559229721846,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004570125315397347,
|
|
"loss": 5.137,
|
|
"mean_token_accuracy": 0.18596181273460388,
|
|
"num_tokens": 45984466.0,
|
|
"step": 26510
|
|
},
|
|
{
|
|
"entropy": 5.3551208019256595,
|
|
"epoch": 2.062944952343902,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0004569962365833558,
|
|
"loss": 4.9614,
|
|
"mean_token_accuracy": 0.19354475885629654,
|
|
"num_tokens": 45992862.0,
|
|
"step": 26515
|
|
},
|
|
{
|
|
"entropy": 5.386298036575317,
|
|
"epoch": 2.0633339817156195,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.00045697993886547374,
|
|
"loss": 5.055,
|
|
"mean_token_accuracy": 0.18653280586004256,
|
|
"num_tokens": 46001211.0,
|
|
"step": 26520
|
|
},
|
|
{
|
|
"entropy": 5.471065616607666,
|
|
"epoch": 2.0637230110873372,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00045696363838633566,
|
|
"loss": 5.082,
|
|
"mean_token_accuracy": 0.1817440867424011,
|
|
"num_tokens": 46009574.0,
|
|
"step": 26525
|
|
},
|
|
{
|
|
"entropy": 5.4172827243804935,
|
|
"epoch": 2.0641120404590545,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00045694733514618904,
|
|
"loss": 4.9872,
|
|
"mean_token_accuracy": 0.1934663861989975,
|
|
"num_tokens": 46017686.0,
|
|
"step": 26530
|
|
},
|
|
{
|
|
"entropy": 5.4009908676147464,
|
|
"epoch": 2.064501069830772,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004569310291452812,
|
|
"loss": 5.0444,
|
|
"mean_token_accuracy": 0.1874256655573845,
|
|
"num_tokens": 46026842.0,
|
|
"step": 26535
|
|
},
|
|
{
|
|
"entropy": 5.381682920455932,
|
|
"epoch": 2.06489009920249,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004569147203838595,
|
|
"loss": 5.006,
|
|
"mean_token_accuracy": 0.19104905128479005,
|
|
"num_tokens": 46036308.0,
|
|
"step": 26540
|
|
},
|
|
{
|
|
"entropy": 5.392024803161621,
|
|
"epoch": 2.065279128574207,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00045689840886217157,
|
|
"loss": 5.0305,
|
|
"mean_token_accuracy": 0.1912926286458969,
|
|
"num_tokens": 46045424.0,
|
|
"step": 26545
|
|
},
|
|
{
|
|
"entropy": 5.40010929107666,
|
|
"epoch": 2.065668157945925,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00045688209458046475,
|
|
"loss": 5.0121,
|
|
"mean_token_accuracy": 0.19032019525766372,
|
|
"num_tokens": 46054386.0,
|
|
"step": 26550
|
|
},
|
|
{
|
|
"entropy": 5.37185435295105,
|
|
"epoch": 2.0660571873176425,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.00045686577753898663,
|
|
"loss": 4.9633,
|
|
"mean_token_accuracy": 0.19615142196416854,
|
|
"num_tokens": 46063617.0,
|
|
"step": 26555
|
|
},
|
|
{
|
|
"entropy": 5.4097206592559814,
|
|
"epoch": 2.0664462166893602,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00045684945773798483,
|
|
"loss": 5.1467,
|
|
"mean_token_accuracy": 0.18350289463996888,
|
|
"num_tokens": 46072915.0,
|
|
"step": 26560
|
|
},
|
|
{
|
|
"entropy": 5.408411836624145,
|
|
"epoch": 2.0668352460610775,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.000456833135177707,
|
|
"loss": 5.1669,
|
|
"mean_token_accuracy": 0.18664602637290956,
|
|
"num_tokens": 46081890.0,
|
|
"step": 26565
|
|
},
|
|
{
|
|
"entropy": 5.49239068031311,
|
|
"epoch": 2.067224275432795,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0004568168098584007,
|
|
"loss": 5.1323,
|
|
"mean_token_accuracy": 0.18312088698148726,
|
|
"num_tokens": 46090445.0,
|
|
"step": 26570
|
|
},
|
|
{
|
|
"entropy": 5.524904108047485,
|
|
"epoch": 2.067613304804513,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004568004817803137,
|
|
"loss": 5.1224,
|
|
"mean_token_accuracy": 0.18683040589094163,
|
|
"num_tokens": 46099866.0,
|
|
"step": 26575
|
|
},
|
|
{
|
|
"entropy": 5.382289075851441,
|
|
"epoch": 2.06800233417623,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0004567841509436937,
|
|
"loss": 4.9868,
|
|
"mean_token_accuracy": 0.19858779311180114,
|
|
"num_tokens": 46108036.0,
|
|
"step": 26580
|
|
},
|
|
{
|
|
"entropy": 5.370401668548584,
|
|
"epoch": 2.068391363547948,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004567678173487887,
|
|
"loss": 4.9471,
|
|
"mean_token_accuracy": 0.20068297535181046,
|
|
"num_tokens": 46116087.0,
|
|
"step": 26585
|
|
},
|
|
{
|
|
"entropy": 5.386041164398193,
|
|
"epoch": 2.0687803929196655,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004567514809958462,
|
|
"loss": 5.019,
|
|
"mean_token_accuracy": 0.20330306589603425,
|
|
"num_tokens": 46124934.0,
|
|
"step": 26590
|
|
},
|
|
{
|
|
"entropy": 5.4602302551269535,
|
|
"epoch": 2.069169422291383,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0004567351418851144,
|
|
"loss": 5.0651,
|
|
"mean_token_accuracy": 0.18913166224956512,
|
|
"num_tokens": 46133691.0,
|
|
"step": 26595
|
|
},
|
|
{
|
|
"entropy": 5.478541517257691,
|
|
"epoch": 2.0695584516631005,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00045671880001684113,
|
|
"loss": 5.0914,
|
|
"mean_token_accuracy": 0.18538061827421187,
|
|
"num_tokens": 46141933.0,
|
|
"step": 26600
|
|
},
|
|
{
|
|
"entropy": 5.355129098892212,
|
|
"epoch": 2.069947481034818,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00045670245539127413,
|
|
"loss": 4.9842,
|
|
"mean_token_accuracy": 0.1955270066857338,
|
|
"num_tokens": 46150656.0,
|
|
"step": 26605
|
|
},
|
|
{
|
|
"entropy": 5.350622034072876,
|
|
"epoch": 2.070336510406536,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00045668610800866173,
|
|
"loss": 5.0127,
|
|
"mean_token_accuracy": 0.19243651181459426,
|
|
"num_tokens": 46160353.0,
|
|
"step": 26610
|
|
},
|
|
{
|
|
"entropy": 5.464599847793579,
|
|
"epoch": 2.070725539778253,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00045666975786925177,
|
|
"loss": 5.0413,
|
|
"mean_token_accuracy": 0.19571170657873155,
|
|
"num_tokens": 46168810.0,
|
|
"step": 26615
|
|
},
|
|
{
|
|
"entropy": 5.392941999435425,
|
|
"epoch": 2.071114569149971,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004566534049732923,
|
|
"loss": 5.0235,
|
|
"mean_token_accuracy": 0.1957779124379158,
|
|
"num_tokens": 46177593.0,
|
|
"step": 26620
|
|
},
|
|
{
|
|
"entropy": 5.370887565612793,
|
|
"epoch": 2.0715035985216885,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.00045663704932103166,
|
|
"loss": 5.0752,
|
|
"mean_token_accuracy": 0.19125280380249024,
|
|
"num_tokens": 46186027.0,
|
|
"step": 26625
|
|
},
|
|
{
|
|
"entropy": 5.428931856155396,
|
|
"epoch": 2.071892627893406,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00045662069091271785,
|
|
"loss": 5.1186,
|
|
"mean_token_accuracy": 0.18589888662099838,
|
|
"num_tokens": 46194705.0,
|
|
"step": 26630
|
|
},
|
|
{
|
|
"entropy": 5.444761419296265,
|
|
"epoch": 2.0722816572651235,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00045660432974859924,
|
|
"loss": 4.9788,
|
|
"mean_token_accuracy": 0.1986072316765785,
|
|
"num_tokens": 46203498.0,
|
|
"step": 26635
|
|
},
|
|
{
|
|
"entropy": 5.435950851440429,
|
|
"epoch": 2.072670686636841,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00045658796582892383,
|
|
"loss": 5.0308,
|
|
"mean_token_accuracy": 0.19666505008935928,
|
|
"num_tokens": 46211918.0,
|
|
"step": 26640
|
|
},
|
|
{
|
|
"entropy": 5.465548324584961,
|
|
"epoch": 2.073059716008559,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00045657159915394013,
|
|
"loss": 5.1414,
|
|
"mean_token_accuracy": 0.18419665694236756,
|
|
"num_tokens": 46220689.0,
|
|
"step": 26645
|
|
},
|
|
{
|
|
"entropy": 5.439324235916137,
|
|
"epoch": 2.073448745380276,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004565552297238964,
|
|
"loss": 5.0933,
|
|
"mean_token_accuracy": 0.18456518799066543,
|
|
"num_tokens": 46229645.0,
|
|
"step": 26650
|
|
},
|
|
{
|
|
"entropy": 5.476610803604126,
|
|
"epoch": 2.073837774751994,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.000456538857539041,
|
|
"loss": 5.053,
|
|
"mean_token_accuracy": 0.1839945137500763,
|
|
"num_tokens": 46237691.0,
|
|
"step": 26655
|
|
},
|
|
{
|
|
"entropy": 5.442871809005737,
|
|
"epoch": 2.0742268041237115,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.00045652248259962254,
|
|
"loss": 5.0325,
|
|
"mean_token_accuracy": 0.19456465691328048,
|
|
"num_tokens": 46245756.0,
|
|
"step": 26660
|
|
},
|
|
{
|
|
"entropy": 5.497630262374878,
|
|
"epoch": 2.0746158334954288,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004565061049058892,
|
|
"loss": 5.1206,
|
|
"mean_token_accuracy": 0.18257547169923782,
|
|
"num_tokens": 46255233.0,
|
|
"step": 26665
|
|
},
|
|
{
|
|
"entropy": 5.490150260925293,
|
|
"epoch": 2.0750048628671465,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00045648972445808963,
|
|
"loss": 5.0929,
|
|
"mean_token_accuracy": 0.1819661632180214,
|
|
"num_tokens": 46263569.0,
|
|
"step": 26670
|
|
},
|
|
{
|
|
"entropy": 5.341439867019654,
|
|
"epoch": 2.075393892238864,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00045647334125647235,
|
|
"loss": 4.9602,
|
|
"mean_token_accuracy": 0.19963158667087555,
|
|
"num_tokens": 46273010.0,
|
|
"step": 26675
|
|
},
|
|
{
|
|
"entropy": 5.401032495498657,
|
|
"epoch": 2.0757829216105814,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.000456456955301286,
|
|
"loss": 5.0492,
|
|
"mean_token_accuracy": 0.19649419337511062,
|
|
"num_tokens": 46281566.0,
|
|
"step": 26680
|
|
},
|
|
{
|
|
"entropy": 5.305159187316894,
|
|
"epoch": 2.076171950982299,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004564405665927791,
|
|
"loss": 4.9061,
|
|
"mean_token_accuracy": 0.19944127798080444,
|
|
"num_tokens": 46290267.0,
|
|
"step": 26685
|
|
},
|
|
{
|
|
"entropy": 5.371257972717285,
|
|
"epoch": 2.076560980354017,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.00045642417513120043,
|
|
"loss": 4.9497,
|
|
"mean_token_accuracy": 0.2021263062953949,
|
|
"num_tokens": 46298694.0,
|
|
"step": 26690
|
|
},
|
|
{
|
|
"entropy": 5.381849861145019,
|
|
"epoch": 2.076950009725734,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00045640778091679876,
|
|
"loss": 4.9052,
|
|
"mean_token_accuracy": 0.19964803457260133,
|
|
"num_tokens": 46307358.0,
|
|
"step": 26695
|
|
},
|
|
{
|
|
"entropy": 5.373528289794922,
|
|
"epoch": 2.0773390390974518,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004563913839498226,
|
|
"loss": 4.9724,
|
|
"mean_token_accuracy": 0.19706337451934813,
|
|
"num_tokens": 46316351.0,
|
|
"step": 26700
|
|
},
|
|
{
|
|
"entropy": 5.365335845947266,
|
|
"epoch": 2.0777280684691695,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.000456374984230521,
|
|
"loss": 5.0384,
|
|
"mean_token_accuracy": 0.19235157817602158,
|
|
"num_tokens": 46325591.0,
|
|
"step": 26705
|
|
},
|
|
{
|
|
"entropy": 5.455436372756958,
|
|
"epoch": 2.078117097840887,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0004563585817591427,
|
|
"loss": 5.0249,
|
|
"mean_token_accuracy": 0.19098697304725648,
|
|
"num_tokens": 46334595.0,
|
|
"step": 26710
|
|
},
|
|
{
|
|
"entropy": 5.4872783660888675,
|
|
"epoch": 2.0785061272126044,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004563421765359365,
|
|
"loss": 5.1143,
|
|
"mean_token_accuracy": 0.19037314653396606,
|
|
"num_tokens": 46343587.0,
|
|
"step": 26715
|
|
},
|
|
{
|
|
"entropy": 5.500644016265869,
|
|
"epoch": 2.078895156584322,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00045632576856115156,
|
|
"loss": 5.0698,
|
|
"mean_token_accuracy": 0.19242760986089708,
|
|
"num_tokens": 46351900.0,
|
|
"step": 26720
|
|
},
|
|
{
|
|
"entropy": 5.429645109176636,
|
|
"epoch": 2.07928418595604,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00045630935783503657,
|
|
"loss": 5.0712,
|
|
"mean_token_accuracy": 0.1838282063603401,
|
|
"num_tokens": 46359854.0,
|
|
"step": 26725
|
|
},
|
|
{
|
|
"entropy": 5.494559478759766,
|
|
"epoch": 2.079673215327757,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004562929443578407,
|
|
"loss": 5.166,
|
|
"mean_token_accuracy": 0.1871547132730484,
|
|
"num_tokens": 46368930.0,
|
|
"step": 26730
|
|
},
|
|
{
|
|
"entropy": 5.38897933959961,
|
|
"epoch": 2.0800622446994748,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004562765281298129,
|
|
"loss": 4.9531,
|
|
"mean_token_accuracy": 0.1908261999487877,
|
|
"num_tokens": 46377522.0,
|
|
"step": 26735
|
|
},
|
|
{
|
|
"entropy": 5.388074016571045,
|
|
"epoch": 2.0804512740711925,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0004562601091512024,
|
|
"loss": 5.0618,
|
|
"mean_token_accuracy": 0.18359524458646775,
|
|
"num_tokens": 46386368.0,
|
|
"step": 26740
|
|
},
|
|
{
|
|
"entropy": 5.423078918457032,
|
|
"epoch": 2.08084030344291,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0004562436874222582,
|
|
"loss": 5.0228,
|
|
"mean_token_accuracy": 0.18908309787511826,
|
|
"num_tokens": 46395363.0,
|
|
"step": 26745
|
|
},
|
|
{
|
|
"entropy": 5.406333780288696,
|
|
"epoch": 2.0812293328146274,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00045622726294322955,
|
|
"loss": 5.0851,
|
|
"mean_token_accuracy": 0.1890594929456711,
|
|
"num_tokens": 46403998.0,
|
|
"step": 26750
|
|
},
|
|
{
|
|
"entropy": 5.316444826126099,
|
|
"epoch": 2.081618362186345,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.00045621083571436563,
|
|
"loss": 4.8617,
|
|
"mean_token_accuracy": 0.20850645005702972,
|
|
"num_tokens": 46412138.0,
|
|
"step": 26755
|
|
},
|
|
{
|
|
"entropy": 5.3882434368133545,
|
|
"epoch": 2.082007391558063,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0004561944057359157,
|
|
"loss": 5.0432,
|
|
"mean_token_accuracy": 0.1977139815688133,
|
|
"num_tokens": 46420761.0,
|
|
"step": 26760
|
|
},
|
|
{
|
|
"entropy": 5.364417982101441,
|
|
"epoch": 2.08239642092978,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0004561779730081291,
|
|
"loss": 5.0177,
|
|
"mean_token_accuracy": 0.1934445396065712,
|
|
"num_tokens": 46428938.0,
|
|
"step": 26765
|
|
},
|
|
{
|
|
"entropy": 5.414071941375733,
|
|
"epoch": 2.0827854503014978,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0004561615375312551,
|
|
"loss": 4.9937,
|
|
"mean_token_accuracy": 0.1987615168094635,
|
|
"num_tokens": 46436552.0,
|
|
"step": 26770
|
|
},
|
|
{
|
|
"entropy": 5.311163377761841,
|
|
"epoch": 2.0831744796732155,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00045614509930554304,
|
|
"loss": 4.9525,
|
|
"mean_token_accuracy": 0.19467213600873948,
|
|
"num_tokens": 46445223.0,
|
|
"step": 26775
|
|
},
|
|
{
|
|
"entropy": 5.404401588439941,
|
|
"epoch": 2.0835635090449327,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.00045612865833124253,
|
|
"loss": 5.079,
|
|
"mean_token_accuracy": 0.19310957342386245,
|
|
"num_tokens": 46453232.0,
|
|
"step": 26780
|
|
},
|
|
{
|
|
"entropy": 5.298688316345215,
|
|
"epoch": 2.0839525384166504,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004561122146086029,
|
|
"loss": 4.9047,
|
|
"mean_token_accuracy": 0.20235710591077805,
|
|
"num_tokens": 46462562.0,
|
|
"step": 26785
|
|
},
|
|
{
|
|
"entropy": 5.424392032623291,
|
|
"epoch": 2.084341567788368,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0004560957681378737,
|
|
"loss": 5.0718,
|
|
"mean_token_accuracy": 0.18561520874500276,
|
|
"num_tokens": 46470599.0,
|
|
"step": 26790
|
|
},
|
|
{
|
|
"entropy": 5.441938686370849,
|
|
"epoch": 2.084730597160086,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.00045607931891930445,
|
|
"loss": 5.0419,
|
|
"mean_token_accuracy": 0.19102299064397812,
|
|
"num_tokens": 46478707.0,
|
|
"step": 26795
|
|
},
|
|
{
|
|
"entropy": 5.36987419128418,
|
|
"epoch": 2.085119626531803,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004560628669531447,
|
|
"loss": 5.0131,
|
|
"mean_token_accuracy": 0.20059251487255098,
|
|
"num_tokens": 46487044.0,
|
|
"step": 26800
|
|
},
|
|
{
|
|
"entropy": 5.441597175598145,
|
|
"epoch": 2.0855086559035207,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.00045604641223964416,
|
|
"loss": 5.0366,
|
|
"mean_token_accuracy": 0.18717601895332336,
|
|
"num_tokens": 46495278.0,
|
|
"step": 26805
|
|
},
|
|
{
|
|
"entropy": 5.358327388763428,
|
|
"epoch": 2.0858976852752384,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.00045602995477905247,
|
|
"loss": 5.0314,
|
|
"mean_token_accuracy": 0.19974675327539443,
|
|
"num_tokens": 46503545.0,
|
|
"step": 26810
|
|
},
|
|
{
|
|
"entropy": 5.389119815826416,
|
|
"epoch": 2.0862867146469557,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0004560134945716194,
|
|
"loss": 5.1115,
|
|
"mean_token_accuracy": 0.19523144364356995,
|
|
"num_tokens": 46513058.0,
|
|
"step": 26815
|
|
},
|
|
{
|
|
"entropy": 5.452762699127197,
|
|
"epoch": 2.0866757440186734,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.00045599703161759464,
|
|
"loss": 4.9997,
|
|
"mean_token_accuracy": 0.19506117403507234,
|
|
"num_tokens": 46520651.0,
|
|
"step": 26820
|
|
},
|
|
{
|
|
"entropy": 5.379821014404297,
|
|
"epoch": 2.087064773390391,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00045598056591722805,
|
|
"loss": 4.9657,
|
|
"mean_token_accuracy": 0.1929590582847595,
|
|
"num_tokens": 46528899.0,
|
|
"step": 26825
|
|
},
|
|
{
|
|
"entropy": 5.4270049095153805,
|
|
"epoch": 2.0874538027621083,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00045596409747076936,
|
|
"loss": 5.1856,
|
|
"mean_token_accuracy": 0.18012941330671312,
|
|
"num_tokens": 46537921.0,
|
|
"step": 26830
|
|
},
|
|
{
|
|
"entropy": 5.433773469924927,
|
|
"epoch": 2.087842832133826,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004559476262784686,
|
|
"loss": 5.0228,
|
|
"mean_token_accuracy": 0.19161346405744553,
|
|
"num_tokens": 46547432.0,
|
|
"step": 26835
|
|
},
|
|
{
|
|
"entropy": 5.4108131408691404,
|
|
"epoch": 2.0882318615055437,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004559311523405755,
|
|
"loss": 5.0291,
|
|
"mean_token_accuracy": 0.19551636576652526,
|
|
"num_tokens": 46555406.0,
|
|
"step": 26840
|
|
},
|
|
{
|
|
"entropy": 5.457485675811768,
|
|
"epoch": 2.0886208908772614,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004559146756573402,
|
|
"loss": 5.0768,
|
|
"mean_token_accuracy": 0.18892700970172882,
|
|
"num_tokens": 46564428.0,
|
|
"step": 26845
|
|
},
|
|
{
|
|
"entropy": 5.4394666194915775,
|
|
"epoch": 2.0890099202489787,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.00045589819622901274,
|
|
"loss": 4.9922,
|
|
"mean_token_accuracy": 0.1958747923374176,
|
|
"num_tokens": 46573222.0,
|
|
"step": 26850
|
|
},
|
|
{
|
|
"entropy": 5.366905689239502,
|
|
"epoch": 2.0893989496206964,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.000455881714055843,
|
|
"loss": 4.9836,
|
|
"mean_token_accuracy": 0.19679927527904512,
|
|
"num_tokens": 46581951.0,
|
|
"step": 26855
|
|
},
|
|
{
|
|
"entropy": 5.445606517791748,
|
|
"epoch": 2.089787978992414,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00045586522913808114,
|
|
"loss": 5.1318,
|
|
"mean_token_accuracy": 0.1903458297252655,
|
|
"num_tokens": 46590658.0,
|
|
"step": 26860
|
|
},
|
|
{
|
|
"entropy": 5.436423921585083,
|
|
"epoch": 2.0901770083641313,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004558487414759773,
|
|
"loss": 4.966,
|
|
"mean_token_accuracy": 0.19730983078479766,
|
|
"num_tokens": 46599068.0,
|
|
"step": 26865
|
|
},
|
|
{
|
|
"entropy": 5.36162486076355,
|
|
"epoch": 2.090566037735849,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00045583225106978175,
|
|
"loss": 5.0335,
|
|
"mean_token_accuracy": 0.19394029229879378,
|
|
"num_tokens": 46608024.0,
|
|
"step": 26870
|
|
},
|
|
{
|
|
"entropy": 5.359584140777588,
|
|
"epoch": 2.0909550671075667,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004558157579197446,
|
|
"loss": 4.9736,
|
|
"mean_token_accuracy": 0.19705972373485564,
|
|
"num_tokens": 46616558.0,
|
|
"step": 26875
|
|
},
|
|
{
|
|
"entropy": 5.528281164169312,
|
|
"epoch": 2.091344096479284,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00045579926202611603,
|
|
"loss": 5.1875,
|
|
"mean_token_accuracy": 0.18382683247327805,
|
|
"num_tokens": 46624943.0,
|
|
"step": 26880
|
|
},
|
|
{
|
|
"entropy": 5.426905822753906,
|
|
"epoch": 2.0917331258510017,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004557827633891465,
|
|
"loss": 5.0395,
|
|
"mean_token_accuracy": 0.1860797092318535,
|
|
"num_tokens": 46633753.0,
|
|
"step": 26885
|
|
},
|
|
{
|
|
"entropy": 5.431225824356079,
|
|
"epoch": 2.0921221552227194,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004557662620090863,
|
|
"loss": 5.0634,
|
|
"mean_token_accuracy": 0.19505238384008408,
|
|
"num_tokens": 46642210.0,
|
|
"step": 26890
|
|
},
|
|
{
|
|
"entropy": 5.392735147476197,
|
|
"epoch": 2.092511184594437,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.00045574975788618564,
|
|
"loss": 5.0074,
|
|
"mean_token_accuracy": 0.19501732736825944,
|
|
"num_tokens": 46650327.0,
|
|
"step": 26895
|
|
},
|
|
{
|
|
"entropy": 5.313232040405273,
|
|
"epoch": 2.0929002139661543,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0004557332510206953,
|
|
"loss": 4.9385,
|
|
"mean_token_accuracy": 0.19272660762071608,
|
|
"num_tokens": 46659453.0,
|
|
"step": 26900
|
|
},
|
|
{
|
|
"entropy": 5.433003520965576,
|
|
"epoch": 2.093289243337872,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004557167414128654,
|
|
"loss": 5.0056,
|
|
"mean_token_accuracy": 0.19829933643341063,
|
|
"num_tokens": 46667378.0,
|
|
"step": 26905
|
|
},
|
|
{
|
|
"entropy": 5.490343856811523,
|
|
"epoch": 2.0936782727095897,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0004557002290629467,
|
|
"loss": 5.1895,
|
|
"mean_token_accuracy": 0.17928837686777116,
|
|
"num_tokens": 46675949.0,
|
|
"step": 26910
|
|
},
|
|
{
|
|
"entropy": 5.535121917724609,
|
|
"epoch": 2.094067302081307,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00045568371397118954,
|
|
"loss": 5.1941,
|
|
"mean_token_accuracy": 0.18699836432933808,
|
|
"num_tokens": 46684808.0,
|
|
"step": 26915
|
|
},
|
|
{
|
|
"entropy": 5.40729660987854,
|
|
"epoch": 2.0944563314530247,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004556671961378446,
|
|
"loss": 5.0221,
|
|
"mean_token_accuracy": 0.19141003787517546,
|
|
"num_tokens": 46693209.0,
|
|
"step": 26920
|
|
},
|
|
{
|
|
"entropy": 5.36139063835144,
|
|
"epoch": 2.0948453608247424,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00045565067556316264,
|
|
"loss": 4.9969,
|
|
"mean_token_accuracy": 0.1984749048948288,
|
|
"num_tokens": 46702405.0,
|
|
"step": 26925
|
|
},
|
|
{
|
|
"entropy": 5.345081615447998,
|
|
"epoch": 2.0952343901964596,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004556341522473941,
|
|
"loss": 5.0207,
|
|
"mean_token_accuracy": 0.1929626151919365,
|
|
"num_tokens": 46711568.0,
|
|
"step": 26930
|
|
},
|
|
{
|
|
"entropy": 5.339298057556152,
|
|
"epoch": 2.0956234195681773,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004556176261907899,
|
|
"loss": 5.0499,
|
|
"mean_token_accuracy": 0.19528461694717408,
|
|
"num_tokens": 46719886.0,
|
|
"step": 26935
|
|
},
|
|
{
|
|
"entropy": 5.326263046264648,
|
|
"epoch": 2.096012448939895,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004556010973936006,
|
|
"loss": 4.881,
|
|
"mean_token_accuracy": 0.2002449467778206,
|
|
"num_tokens": 46728293.0,
|
|
"step": 26940
|
|
},
|
|
{
|
|
"entropy": 5.443757200241089,
|
|
"epoch": 2.0964014783116127,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004555845658560772,
|
|
"loss": 5.0423,
|
|
"mean_token_accuracy": 0.18999491333961488,
|
|
"num_tokens": 46736730.0,
|
|
"step": 26945
|
|
},
|
|
{
|
|
"entropy": 5.433019018173217,
|
|
"epoch": 2.09679050768333,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00045556803157847036,
|
|
"loss": 5.0969,
|
|
"mean_token_accuracy": 0.17930440604686737,
|
|
"num_tokens": 46745563.0,
|
|
"step": 26950
|
|
},
|
|
{
|
|
"entropy": 5.427082157135009,
|
|
"epoch": 2.0971795370550477,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00045555149456103113,
|
|
"loss": 5.0549,
|
|
"mean_token_accuracy": 0.19308394193649292,
|
|
"num_tokens": 46754285.0,
|
|
"step": 26955
|
|
},
|
|
{
|
|
"entropy": 5.422067546844483,
|
|
"epoch": 2.0975685664267654,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004555349548040102,
|
|
"loss": 5.0327,
|
|
"mean_token_accuracy": 0.1990979790687561,
|
|
"num_tokens": 46763114.0,
|
|
"step": 26960
|
|
},
|
|
{
|
|
"entropy": 5.410259199142456,
|
|
"epoch": 2.0979575957984826,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004555184123076589,
|
|
"loss": 5.0285,
|
|
"mean_token_accuracy": 0.19594316482543944,
|
|
"num_tokens": 46771150.0,
|
|
"step": 26965
|
|
},
|
|
{
|
|
"entropy": 5.351689863204956,
|
|
"epoch": 2.0983466251702003,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.00045550186707222785,
|
|
"loss": 4.9245,
|
|
"mean_token_accuracy": 0.20719084441661834,
|
|
"num_tokens": 46779955.0,
|
|
"step": 26970
|
|
},
|
|
{
|
|
"entropy": 5.40891695022583,
|
|
"epoch": 2.098735654541918,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0004554853190979683,
|
|
"loss": 5.0733,
|
|
"mean_token_accuracy": 0.18659788370132446,
|
|
"num_tokens": 46788769.0,
|
|
"step": 26975
|
|
},
|
|
{
|
|
"entropy": 5.482321071624756,
|
|
"epoch": 2.0991246839136353,
|
|
"grad_norm": 1.6640625,
|
|
"learning_rate": 0.00045546876838513134,
|
|
"loss": 5.1317,
|
|
"mean_token_accuracy": 0.1859864577651024,
|
|
"num_tokens": 46797649.0,
|
|
"step": 26980
|
|
},
|
|
{
|
|
"entropy": 5.408661651611328,
|
|
"epoch": 2.099513713285353,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00045545221493396805,
|
|
"loss": 4.9716,
|
|
"mean_token_accuracy": 0.1966961666941643,
|
|
"num_tokens": 46806140.0,
|
|
"step": 26985
|
|
},
|
|
{
|
|
"entropy": 5.382923269271851,
|
|
"epoch": 2.0999027426570707,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00045543565874472963,
|
|
"loss": 4.9412,
|
|
"mean_token_accuracy": 0.2030116155743599,
|
|
"num_tokens": 46815476.0,
|
|
"step": 26990
|
|
},
|
|
{
|
|
"entropy": 5.404881954193115,
|
|
"epoch": 2.1002917720287884,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00045541909981766725,
|
|
"loss": 5.0788,
|
|
"mean_token_accuracy": 0.18919163644313813,
|
|
"num_tokens": 46824171.0,
|
|
"step": 26995
|
|
},
|
|
{
|
|
"entropy": 5.400956630706787,
|
|
"epoch": 2.1006808014005056,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004554025381530322,
|
|
"loss": 4.9268,
|
|
"mean_token_accuracy": 0.20240044891834258,
|
|
"num_tokens": 46832474.0,
|
|
"step": 27000
|
|
},
|
|
{
|
|
"epoch": 2.1006808014005056,
|
|
"eval_entropy": 5.2443842735510815,
|
|
"eval_loss": 5.188738822937012,
|
|
"eval_mean_token_accuracy": 0.19393767530925005,
|
|
"eval_num_tokens": 46832474.0,
|
|
"eval_runtime": 28.7782,
|
|
"eval_samples_per_second": 1444.078,
|
|
"eval_steps_per_second": 180.518,
|
|
"step": 27000
|
|
},
|
|
{
|
|
"entropy": 5.3701338291168215,
|
|
"epoch": 2.1010698307722233,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004553859737510758,
|
|
"loss": 4.9226,
|
|
"mean_token_accuracy": 0.19896375089883805,
|
|
"num_tokens": 46840626.0,
|
|
"step": 27005
|
|
},
|
|
{
|
|
"entropy": 5.311578321456909,
|
|
"epoch": 2.101458860143941,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0004553694066120493,
|
|
"loss": 4.9011,
|
|
"mean_token_accuracy": 0.20198492407798768,
|
|
"num_tokens": 46849626.0,
|
|
"step": 27010
|
|
},
|
|
{
|
|
"entropy": 5.444884252548218,
|
|
"epoch": 2.1018478895156583,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00045535283673620426,
|
|
"loss": 5.0785,
|
|
"mean_token_accuracy": 0.1882991224527359,
|
|
"num_tokens": 46858520.0,
|
|
"step": 27015
|
|
},
|
|
{
|
|
"entropy": 5.412739229202271,
|
|
"epoch": 2.102236918887376,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00045533626412379194,
|
|
"loss": 5.0346,
|
|
"mean_token_accuracy": 0.19366132020950316,
|
|
"num_tokens": 46866532.0,
|
|
"step": 27020
|
|
},
|
|
{
|
|
"entropy": 5.424739742279053,
|
|
"epoch": 2.1026259482590937,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004553196887750638,
|
|
"loss": 5.0885,
|
|
"mean_token_accuracy": 0.18926024734973906,
|
|
"num_tokens": 46875815.0,
|
|
"step": 27025
|
|
},
|
|
{
|
|
"entropy": 5.41136679649353,
|
|
"epoch": 2.103014977630811,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004553031106902714,
|
|
"loss": 5.0172,
|
|
"mean_token_accuracy": 0.18723538219928743,
|
|
"num_tokens": 46884708.0,
|
|
"step": 27030
|
|
},
|
|
{
|
|
"entropy": 5.402665853500366,
|
|
"epoch": 2.1034040070025286,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00045528652986966627,
|
|
"loss": 4.9332,
|
|
"mean_token_accuracy": 0.20395986884832382,
|
|
"num_tokens": 46894089.0,
|
|
"step": 27035
|
|
},
|
|
{
|
|
"entropy": 5.510696029663086,
|
|
"epoch": 2.1037930363742463,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.00045526994631350006,
|
|
"loss": 5.1411,
|
|
"mean_token_accuracy": 0.1866295874118805,
|
|
"num_tokens": 46903318.0,
|
|
"step": 27040
|
|
},
|
|
{
|
|
"entropy": 5.362477016448975,
|
|
"epoch": 2.104182065745964,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0004552533600220243,
|
|
"loss": 4.9536,
|
|
"mean_token_accuracy": 0.1979716658592224,
|
|
"num_tokens": 46912138.0,
|
|
"step": 27045
|
|
},
|
|
{
|
|
"entropy": 5.418417930603027,
|
|
"epoch": 2.1045710951176813,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.00045523677099549073,
|
|
"loss": 4.9957,
|
|
"mean_token_accuracy": 0.19296849519014359,
|
|
"num_tokens": 46919544.0,
|
|
"step": 27050
|
|
},
|
|
{
|
|
"entropy": 5.420910310745239,
|
|
"epoch": 2.104960124489399,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.000455220179234151,
|
|
"loss": 5.1251,
|
|
"mean_token_accuracy": 0.18568834364414216,
|
|
"num_tokens": 46928760.0,
|
|
"step": 27055
|
|
},
|
|
{
|
|
"entropy": 5.37098650932312,
|
|
"epoch": 2.1053491538611167,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004552035847382569,
|
|
"loss": 5.0448,
|
|
"mean_token_accuracy": 0.19538137763738633,
|
|
"num_tokens": 46936860.0,
|
|
"step": 27060
|
|
},
|
|
{
|
|
"entropy": 5.445346736907959,
|
|
"epoch": 2.105738183232834,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00045518698750806024,
|
|
"loss": 5.0186,
|
|
"mean_token_accuracy": 0.19173202365636827,
|
|
"num_tokens": 46945157.0,
|
|
"step": 27065
|
|
},
|
|
{
|
|
"entropy": 5.484525585174561,
|
|
"epoch": 2.1061272126045516,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.00045517038754381287,
|
|
"loss": 5.0538,
|
|
"mean_token_accuracy": 0.1877843677997589,
|
|
"num_tokens": 46954006.0,
|
|
"step": 27070
|
|
},
|
|
{
|
|
"entropy": 5.336861562728882,
|
|
"epoch": 2.1065162419762693,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004551537848457666,
|
|
"loss": 4.9865,
|
|
"mean_token_accuracy": 0.20204476416110992,
|
|
"num_tokens": 46962437.0,
|
|
"step": 27075
|
|
},
|
|
{
|
|
"entropy": 5.451944351196289,
|
|
"epoch": 2.106905271347987,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0004551371794141734,
|
|
"loss": 5.126,
|
|
"mean_token_accuracy": 0.19191298633813858,
|
|
"num_tokens": 46972379.0,
|
|
"step": 27080
|
|
},
|
|
{
|
|
"entropy": 5.492428350448608,
|
|
"epoch": 2.1072943007197042,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004551205712492852,
|
|
"loss": 5.0779,
|
|
"mean_token_accuracy": 0.1879526138305664,
|
|
"num_tokens": 46981410.0,
|
|
"step": 27085
|
|
},
|
|
{
|
|
"entropy": 5.40231876373291,
|
|
"epoch": 2.107683330091422,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004551039603513541,
|
|
"loss": 4.9213,
|
|
"mean_token_accuracy": 0.19685385823249818,
|
|
"num_tokens": 46989662.0,
|
|
"step": 27090
|
|
},
|
|
{
|
|
"entropy": 5.426345109939575,
|
|
"epoch": 2.1080723594631396,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00045508734672063204,
|
|
"loss": 5.074,
|
|
"mean_token_accuracy": 0.18965485095977783,
|
|
"num_tokens": 46998726.0,
|
|
"step": 27095
|
|
},
|
|
{
|
|
"entropy": 5.451350259780884,
|
|
"epoch": 2.108461388834857,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004550707303573711,
|
|
"loss": 5.0821,
|
|
"mean_token_accuracy": 0.1931113436818123,
|
|
"num_tokens": 47006980.0,
|
|
"step": 27100
|
|
},
|
|
{
|
|
"entropy": 5.378539133071899,
|
|
"epoch": 2.1088504182065746,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00045505411126182347,
|
|
"loss": 5.1005,
|
|
"mean_token_accuracy": 0.18363668918609619,
|
|
"num_tokens": 47015693.0,
|
|
"step": 27105
|
|
},
|
|
{
|
|
"entropy": 5.412285470962525,
|
|
"epoch": 2.1092394475782923,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004550374894342412,
|
|
"loss": 5.0056,
|
|
"mean_token_accuracy": 0.20311692208051682,
|
|
"num_tokens": 47024256.0,
|
|
"step": 27110
|
|
},
|
|
{
|
|
"entropy": 5.442031002044677,
|
|
"epoch": 2.1096284769500095,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004550208648748767,
|
|
"loss": 5.0952,
|
|
"mean_token_accuracy": 0.18307921588420867,
|
|
"num_tokens": 47032962.0,
|
|
"step": 27115
|
|
},
|
|
{
|
|
"entropy": 5.4221882820129395,
|
|
"epoch": 2.1100175063217272,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.000455004237583982,
|
|
"loss": 5.0644,
|
|
"mean_token_accuracy": 0.1888999417424202,
|
|
"num_tokens": 47041507.0,
|
|
"step": 27120
|
|
},
|
|
{
|
|
"entropy": 5.352731466293335,
|
|
"epoch": 2.110406535693445,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0004549876075618096,
|
|
"loss": 4.9759,
|
|
"mean_token_accuracy": 0.19842923879623414,
|
|
"num_tokens": 47050088.0,
|
|
"step": 27125
|
|
},
|
|
{
|
|
"entropy": 5.481393051147461,
|
|
"epoch": 2.110795565065162,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0004549709748086117,
|
|
"loss": 5.1536,
|
|
"mean_token_accuracy": 0.18580325245857238,
|
|
"num_tokens": 47058900.0,
|
|
"step": 27130
|
|
},
|
|
{
|
|
"entropy": 5.455089569091797,
|
|
"epoch": 2.11118459443688,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00045495433932464063,
|
|
"loss": 5.0261,
|
|
"mean_token_accuracy": 0.18857346028089522,
|
|
"num_tokens": 47067689.0,
|
|
"step": 27135
|
|
},
|
|
{
|
|
"entropy": 5.367141914367676,
|
|
"epoch": 2.1115736238085976,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.000454937701110149,
|
|
"loss": 4.9791,
|
|
"mean_token_accuracy": 0.19628666937351227,
|
|
"num_tokens": 47076309.0,
|
|
"step": 27140
|
|
},
|
|
{
|
|
"entropy": 5.408430767059326,
|
|
"epoch": 2.1119626531803153,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.00045492106016538917,
|
|
"loss": 4.9836,
|
|
"mean_token_accuracy": 0.20380158275365828,
|
|
"num_tokens": 47084462.0,
|
|
"step": 27145
|
|
},
|
|
{
|
|
"entropy": 5.420516586303711,
|
|
"epoch": 2.1123516825520325,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00045490441649061354,
|
|
"loss": 5.0916,
|
|
"mean_token_accuracy": 0.19081518203020095,
|
|
"num_tokens": 47093586.0,
|
|
"step": 27150
|
|
},
|
|
{
|
|
"entropy": 5.398988866806031,
|
|
"epoch": 2.1127407119237502,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0004548877700860747,
|
|
"loss": 4.9879,
|
|
"mean_token_accuracy": 0.1962234139442444,
|
|
"num_tokens": 47101296.0,
|
|
"step": 27155
|
|
},
|
|
{
|
|
"entropy": 5.407206583023071,
|
|
"epoch": 2.113129741295468,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00045487112095202544,
|
|
"loss": 5.0807,
|
|
"mean_token_accuracy": 0.19050924032926558,
|
|
"num_tokens": 47110033.0,
|
|
"step": 27160
|
|
},
|
|
{
|
|
"entropy": 5.371621417999267,
|
|
"epoch": 2.113518770667185,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0004548544690887181,
|
|
"loss": 5.1178,
|
|
"mean_token_accuracy": 0.18248849213123322,
|
|
"num_tokens": 47119292.0,
|
|
"step": 27165
|
|
},
|
|
{
|
|
"entropy": 5.487767219543457,
|
|
"epoch": 2.113907800038903,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0004548378144964054,
|
|
"loss": 5.0737,
|
|
"mean_token_accuracy": 0.1920868679881096,
|
|
"num_tokens": 47128081.0,
|
|
"step": 27170
|
|
},
|
|
{
|
|
"entropy": 5.533500480651855,
|
|
"epoch": 2.1142968294106206,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.00045482115717534024,
|
|
"loss": 5.0876,
|
|
"mean_token_accuracy": 0.18885562419891358,
|
|
"num_tokens": 47136639.0,
|
|
"step": 27175
|
|
},
|
|
{
|
|
"entropy": 5.467253303527832,
|
|
"epoch": 2.1146858587823383,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0004548044971257752,
|
|
"loss": 5.1301,
|
|
"mean_token_accuracy": 0.18584033399820327,
|
|
"num_tokens": 47145830.0,
|
|
"step": 27180
|
|
},
|
|
{
|
|
"entropy": 5.396470165252685,
|
|
"epoch": 2.1150748881540555,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00045478783434796307,
|
|
"loss": 5.0626,
|
|
"mean_token_accuracy": 0.18549806177616118,
|
|
"num_tokens": 47154695.0,
|
|
"step": 27185
|
|
},
|
|
{
|
|
"entropy": 5.433965063095092,
|
|
"epoch": 2.1154639175257732,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00045477116884215675,
|
|
"loss": 5.0895,
|
|
"mean_token_accuracy": 0.1890840858221054,
|
|
"num_tokens": 47163818.0,
|
|
"step": 27190
|
|
},
|
|
{
|
|
"entropy": 5.428095293045044,
|
|
"epoch": 2.115852946897491,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.000454754500608609,
|
|
"loss": 4.9794,
|
|
"mean_token_accuracy": 0.19849276244640351,
|
|
"num_tokens": 47172426.0,
|
|
"step": 27195
|
|
},
|
|
{
|
|
"entropy": 5.439114332199097,
|
|
"epoch": 2.116241976269208,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004547378296475729,
|
|
"loss": 5.1755,
|
|
"mean_token_accuracy": 0.18009322881698608,
|
|
"num_tokens": 47182034.0,
|
|
"step": 27200
|
|
},
|
|
{
|
|
"entropy": 5.361409521102905,
|
|
"epoch": 2.116631005640926,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00045472115595930124,
|
|
"loss": 5.0471,
|
|
"mean_token_accuracy": 0.18783133774995803,
|
|
"num_tokens": 47190968.0,
|
|
"step": 27205
|
|
},
|
|
{
|
|
"entropy": 5.356281280517578,
|
|
"epoch": 2.1170200350126436,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00045470447954404716,
|
|
"loss": 4.949,
|
|
"mean_token_accuracy": 0.19387365728616715,
|
|
"num_tokens": 47199917.0,
|
|
"step": 27210
|
|
},
|
|
{
|
|
"entropy": 5.433262300491333,
|
|
"epoch": 2.117409064384361,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.00045468780040206364,
|
|
"loss": 5.0744,
|
|
"mean_token_accuracy": 0.18901672065258027,
|
|
"num_tokens": 47208467.0,
|
|
"step": 27215
|
|
},
|
|
{
|
|
"entropy": 5.353519248962402,
|
|
"epoch": 2.1177980937560785,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004546711185336037,
|
|
"loss": 5.0201,
|
|
"mean_token_accuracy": 0.19732898473739624,
|
|
"num_tokens": 47216784.0,
|
|
"step": 27220
|
|
},
|
|
{
|
|
"entropy": 5.442028331756592,
|
|
"epoch": 2.1181871231277962,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00045465443393892047,
|
|
"loss": 5.1073,
|
|
"mean_token_accuracy": 0.19494381844997405,
|
|
"num_tokens": 47226215.0,
|
|
"step": 27225
|
|
},
|
|
{
|
|
"entropy": 5.434804821014405,
|
|
"epoch": 2.118576152499514,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004546377466182673,
|
|
"loss": 5.0126,
|
|
"mean_token_accuracy": 0.1979151412844658,
|
|
"num_tokens": 47234952.0,
|
|
"step": 27230
|
|
},
|
|
{
|
|
"entropy": 5.484819555282593,
|
|
"epoch": 2.118965181871231,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004546210565718972,
|
|
"loss": 5.0852,
|
|
"mean_token_accuracy": 0.18474817872047425,
|
|
"num_tokens": 47243897.0,
|
|
"step": 27235
|
|
},
|
|
{
|
|
"entropy": 5.3915454864501955,
|
|
"epoch": 2.119354211242949,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00045460436380006337,
|
|
"loss": 5.0331,
|
|
"mean_token_accuracy": 0.19334942549467088,
|
|
"num_tokens": 47252171.0,
|
|
"step": 27240
|
|
},
|
|
{
|
|
"entropy": 5.414375734329224,
|
|
"epoch": 2.1197432406146666,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004545876683030192,
|
|
"loss": 5.03,
|
|
"mean_token_accuracy": 0.1971109017729759,
|
|
"num_tokens": 47260494.0,
|
|
"step": 27245
|
|
},
|
|
{
|
|
"entropy": 5.505883979797363,
|
|
"epoch": 2.120132269986384,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004545709700810181,
|
|
"loss": 5.191,
|
|
"mean_token_accuracy": 0.1849369525909424,
|
|
"num_tokens": 47269485.0,
|
|
"step": 27250
|
|
},
|
|
{
|
|
"entropy": 5.333215141296387,
|
|
"epoch": 2.1205212993581015,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004545542691343133,
|
|
"loss": 4.8785,
|
|
"mean_token_accuracy": 0.2028707131743431,
|
|
"num_tokens": 47278275.0,
|
|
"step": 27255
|
|
},
|
|
{
|
|
"entropy": 5.413893842697144,
|
|
"epoch": 2.120910328729819,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004545375654631582,
|
|
"loss": 4.9926,
|
|
"mean_token_accuracy": 0.1939173683524132,
|
|
"num_tokens": 47287267.0,
|
|
"step": 27260
|
|
},
|
|
{
|
|
"entropy": 5.416305208206177,
|
|
"epoch": 2.1212993581015365,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.00045452085906780645,
|
|
"loss": 5.108,
|
|
"mean_token_accuracy": 0.18502960205078126,
|
|
"num_tokens": 47295785.0,
|
|
"step": 27265
|
|
},
|
|
{
|
|
"entropy": 5.423351669311524,
|
|
"epoch": 2.121688387473254,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00045450414994851123,
|
|
"loss": 5.0485,
|
|
"mean_token_accuracy": 0.1979637160897255,
|
|
"num_tokens": 47303951.0,
|
|
"step": 27270
|
|
},
|
|
{
|
|
"entropy": 5.388854598999023,
|
|
"epoch": 2.122077416844972,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.00045448743810552636,
|
|
"loss": 5.0354,
|
|
"mean_token_accuracy": 0.19156427234411239,
|
|
"num_tokens": 47312226.0,
|
|
"step": 27275
|
|
},
|
|
{
|
|
"entropy": 5.396623992919922,
|
|
"epoch": 2.1224664462166896,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.00045447072353910537,
|
|
"loss": 5.104,
|
|
"mean_token_accuracy": 0.19335343241691588,
|
|
"num_tokens": 47320657.0,
|
|
"step": 27280
|
|
},
|
|
{
|
|
"entropy": 5.398326349258423,
|
|
"epoch": 2.122855475588407,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004544540062495016,
|
|
"loss": 5.0316,
|
|
"mean_token_accuracy": 0.20122999995946883,
|
|
"num_tokens": 47329063.0,
|
|
"step": 27285
|
|
},
|
|
{
|
|
"entropy": 5.40952959060669,
|
|
"epoch": 2.1232445049601245,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00045443728623696905,
|
|
"loss": 4.9976,
|
|
"mean_token_accuracy": 0.19026436954736708,
|
|
"num_tokens": 47338304.0,
|
|
"step": 27290
|
|
},
|
|
{
|
|
"entropy": 5.3901762008667,
|
|
"epoch": 2.123633534331842,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.00045442056350176123,
|
|
"loss": 5.1097,
|
|
"mean_token_accuracy": 0.18816337138414382,
|
|
"num_tokens": 47347248.0,
|
|
"step": 27295
|
|
},
|
|
{
|
|
"entropy": 5.422716856002808,
|
|
"epoch": 2.1240225637035595,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.000454403838044132,
|
|
"loss": 5.0977,
|
|
"mean_token_accuracy": 0.1896965757012367,
|
|
"num_tokens": 47356586.0,
|
|
"step": 27300
|
|
},
|
|
{
|
|
"entropy": 5.48693995475769,
|
|
"epoch": 2.124411593075277,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.000454387109864335,
|
|
"loss": 4.9815,
|
|
"mean_token_accuracy": 0.19274987429380416,
|
|
"num_tokens": 47365195.0,
|
|
"step": 27305
|
|
},
|
|
{
|
|
"entropy": 5.458338975906372,
|
|
"epoch": 2.124800622446995,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00045437037896262425,
|
|
"loss": 5.1643,
|
|
"mean_token_accuracy": 0.1850208282470703,
|
|
"num_tokens": 47374154.0,
|
|
"step": 27310
|
|
},
|
|
{
|
|
"entropy": 5.451310110092163,
|
|
"epoch": 2.125189651818712,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004543536453392534,
|
|
"loss": 4.9853,
|
|
"mean_token_accuracy": 0.19751841723918914,
|
|
"num_tokens": 47383253.0,
|
|
"step": 27315
|
|
},
|
|
{
|
|
"entropy": 5.453739213943481,
|
|
"epoch": 2.12557868119043,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00045433690899447643,
|
|
"loss": 5.0564,
|
|
"mean_token_accuracy": 0.19325630664825438,
|
|
"num_tokens": 47391387.0,
|
|
"step": 27320
|
|
},
|
|
{
|
|
"entropy": 5.433286666870117,
|
|
"epoch": 2.1259677105621475,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00045432016992854734,
|
|
"loss": 5.0727,
|
|
"mean_token_accuracy": 0.1916116639971733,
|
|
"num_tokens": 47400294.0,
|
|
"step": 27325
|
|
},
|
|
{
|
|
"entropy": 5.426382923126221,
|
|
"epoch": 2.126356739933865,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004543034281417201,
|
|
"loss": 5.0079,
|
|
"mean_token_accuracy": 0.19289129674434663,
|
|
"num_tokens": 47409024.0,
|
|
"step": 27330
|
|
},
|
|
{
|
|
"entropy": 5.438505983352661,
|
|
"epoch": 2.1267457693055825,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.0004542866836342488,
|
|
"loss": 4.9875,
|
|
"mean_token_accuracy": 0.19781879484653472,
|
|
"num_tokens": 47416974.0,
|
|
"step": 27335
|
|
},
|
|
{
|
|
"entropy": 5.39802565574646,
|
|
"epoch": 2.1271347986773,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0004542699364063873,
|
|
"loss": 5.13,
|
|
"mean_token_accuracy": 0.18701911717653275,
|
|
"num_tokens": 47425934.0,
|
|
"step": 27340
|
|
},
|
|
{
|
|
"entropy": 5.337941646575928,
|
|
"epoch": 2.127523828049018,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004542531864583899,
|
|
"loss": 5.0831,
|
|
"mean_token_accuracy": 0.18908189088106156,
|
|
"num_tokens": 47434764.0,
|
|
"step": 27345
|
|
},
|
|
{
|
|
"entropy": 5.5233073234558105,
|
|
"epoch": 2.127912857420735,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004542364337905108,
|
|
"loss": 5.111,
|
|
"mean_token_accuracy": 0.18030160516500474,
|
|
"num_tokens": 47443435.0,
|
|
"step": 27350
|
|
},
|
|
{
|
|
"entropy": 5.499994373321533,
|
|
"epoch": 2.128301886792453,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00045421967840300403,
|
|
"loss": 5.1629,
|
|
"mean_token_accuracy": 0.1872631773352623,
|
|
"num_tokens": 47452109.0,
|
|
"step": 27355
|
|
},
|
|
{
|
|
"entropy": 5.412526655197143,
|
|
"epoch": 2.1286909161641705,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0004542029202961239,
|
|
"loss": 4.9783,
|
|
"mean_token_accuracy": 0.199757918715477,
|
|
"num_tokens": 47460319.0,
|
|
"step": 27360
|
|
},
|
|
{
|
|
"entropy": 5.466550731658936,
|
|
"epoch": 2.1290799455358878,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.00045418615947012464,
|
|
"loss": 5.1539,
|
|
"mean_token_accuracy": 0.18268648087978362,
|
|
"num_tokens": 47468806.0,
|
|
"step": 27365
|
|
},
|
|
{
|
|
"entropy": 5.446540594100952,
|
|
"epoch": 2.1294689749076054,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0004541693959252607,
|
|
"loss": 5.0701,
|
|
"mean_token_accuracy": 0.18990662544965745,
|
|
"num_tokens": 47477121.0,
|
|
"step": 27370
|
|
},
|
|
{
|
|
"entropy": 5.273397064208984,
|
|
"epoch": 2.129858004279323,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00045415262966178635,
|
|
"loss": 4.8916,
|
|
"mean_token_accuracy": 0.2019251748919487,
|
|
"num_tokens": 47485379.0,
|
|
"step": 27375
|
|
},
|
|
{
|
|
"entropy": 5.417995834350586,
|
|
"epoch": 2.130247033651041,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004541358606799559,
|
|
"loss": 5.0672,
|
|
"mean_token_accuracy": 0.18538389205932618,
|
|
"num_tokens": 47493402.0,
|
|
"step": 27380
|
|
},
|
|
{
|
|
"entropy": 5.487518310546875,
|
|
"epoch": 2.130636063022758,
|
|
"grad_norm": 1.4921875,
|
|
"learning_rate": 0.000454119088980024,
|
|
"loss": 5.0628,
|
|
"mean_token_accuracy": 0.19000712186098098,
|
|
"num_tokens": 47503148.0,
|
|
"step": 27385
|
|
},
|
|
{
|
|
"entropy": 5.384900712966919,
|
|
"epoch": 2.131025092394476,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0004541023145622449,
|
|
"loss": 4.9881,
|
|
"mean_token_accuracy": 0.1931207150220871,
|
|
"num_tokens": 47511681.0,
|
|
"step": 27390
|
|
},
|
|
{
|
|
"entropy": 5.352813673019409,
|
|
"epoch": 2.1314141217661935,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.00045408553742687336,
|
|
"loss": 4.9619,
|
|
"mean_token_accuracy": 0.20091713964939117,
|
|
"num_tokens": 47520240.0,
|
|
"step": 27395
|
|
},
|
|
{
|
|
"entropy": 5.412619972229004,
|
|
"epoch": 2.1318031511379107,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004540687575741638,
|
|
"loss": 5.0347,
|
|
"mean_token_accuracy": 0.1903489887714386,
|
|
"num_tokens": 47528553.0,
|
|
"step": 27400
|
|
},
|
|
{
|
|
"entropy": 5.42325119972229,
|
|
"epoch": 2.1321921805096284,
|
|
"grad_norm": 1.734375,
|
|
"learning_rate": 0.00045405197500437077,
|
|
"loss": 5.0904,
|
|
"mean_token_accuracy": 0.18802190124988555,
|
|
"num_tokens": 47537735.0,
|
|
"step": 27405
|
|
},
|
|
{
|
|
"entropy": 5.362662696838379,
|
|
"epoch": 2.132581209881346,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00045403518971774915,
|
|
"loss": 4.9441,
|
|
"mean_token_accuracy": 0.19960884749889374,
|
|
"num_tokens": 47545251.0,
|
|
"step": 27410
|
|
},
|
|
{
|
|
"entropy": 5.423771762847901,
|
|
"epoch": 2.132970239253064,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.00045401840171455343,
|
|
"loss": 5.0565,
|
|
"mean_token_accuracy": 0.1871227130293846,
|
|
"num_tokens": 47553962.0,
|
|
"step": 27415
|
|
},
|
|
{
|
|
"entropy": 5.423448276519776,
|
|
"epoch": 2.133359268624781,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0004540016109950384,
|
|
"loss": 5.0996,
|
|
"mean_token_accuracy": 0.18990655541419982,
|
|
"num_tokens": 47562401.0,
|
|
"step": 27420
|
|
},
|
|
{
|
|
"entropy": 5.422951555252075,
|
|
"epoch": 2.133748297996499,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004539848175594589,
|
|
"loss": 5.0317,
|
|
"mean_token_accuracy": 0.19416000843048095,
|
|
"num_tokens": 47570097.0,
|
|
"step": 27425
|
|
},
|
|
{
|
|
"entropy": 5.475415658950806,
|
|
"epoch": 2.1341373273682165,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004539680214080695,
|
|
"loss": 5.0814,
|
|
"mean_token_accuracy": 0.1903100371360779,
|
|
"num_tokens": 47578705.0,
|
|
"step": 27430
|
|
},
|
|
{
|
|
"entropy": 5.37512845993042,
|
|
"epoch": 2.1345263567399337,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00045395122254112536,
|
|
"loss": 5.0731,
|
|
"mean_token_accuracy": 0.18882074654102327,
|
|
"num_tokens": 47588075.0,
|
|
"step": 27435
|
|
},
|
|
{
|
|
"entropy": 5.346720886230469,
|
|
"epoch": 2.1349153861116514,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004539344209588812,
|
|
"loss": 4.9931,
|
|
"mean_token_accuracy": 0.19903385490179062,
|
|
"num_tokens": 47596906.0,
|
|
"step": 27440
|
|
},
|
|
{
|
|
"entropy": 5.4231939792633055,
|
|
"epoch": 2.135304415483369,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00045391761666159204,
|
|
"loss": 5.0236,
|
|
"mean_token_accuracy": 0.20138135999441148,
|
|
"num_tokens": 47605427.0,
|
|
"step": 27445
|
|
},
|
|
{
|
|
"entropy": 5.53788914680481,
|
|
"epoch": 2.1356934448550864,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00045390080964951294,
|
|
"loss": 5.186,
|
|
"mean_token_accuracy": 0.1803354024887085,
|
|
"num_tokens": 47614249.0,
|
|
"step": 27450
|
|
},
|
|
{
|
|
"entropy": 5.372472953796387,
|
|
"epoch": 2.136082474226804,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00045388399992289864,
|
|
"loss": 4.9681,
|
|
"mean_token_accuracy": 0.19113119095563888,
|
|
"num_tokens": 47623200.0,
|
|
"step": 27455
|
|
},
|
|
{
|
|
"entropy": 5.446621227264404,
|
|
"epoch": 2.136471503598522,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00045386718748200436,
|
|
"loss": 5.1017,
|
|
"mean_token_accuracy": 0.1875411555171013,
|
|
"num_tokens": 47632392.0,
|
|
"step": 27460
|
|
},
|
|
{
|
|
"entropy": 5.5249659538269045,
|
|
"epoch": 2.136860532970239,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00045385037232708534,
|
|
"loss": 5.1688,
|
|
"mean_token_accuracy": 0.18353452235460282,
|
|
"num_tokens": 47641648.0,
|
|
"step": 27465
|
|
},
|
|
{
|
|
"entropy": 5.427525997161865,
|
|
"epoch": 2.1372495623419567,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0004538335544583964,
|
|
"loss": 5.0242,
|
|
"mean_token_accuracy": 0.19735799580812455,
|
|
"num_tokens": 47651113.0,
|
|
"step": 27470
|
|
},
|
|
{
|
|
"entropy": 5.462687063217163,
|
|
"epoch": 2.1376385917136744,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00045381673387619306,
|
|
"loss": 5.2084,
|
|
"mean_token_accuracy": 0.1848178908228874,
|
|
"num_tokens": 47659959.0,
|
|
"step": 27475
|
|
},
|
|
{
|
|
"entropy": 5.458264541625977,
|
|
"epoch": 2.138027621085392,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00045379991058073035,
|
|
"loss": 5.1133,
|
|
"mean_token_accuracy": 0.18951049745082854,
|
|
"num_tokens": 47668738.0,
|
|
"step": 27480
|
|
},
|
|
{
|
|
"entropy": 5.390614032745361,
|
|
"epoch": 2.1384166504571094,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004537830845722636,
|
|
"loss": 4.9917,
|
|
"mean_token_accuracy": 0.19768296033143998,
|
|
"num_tokens": 47677268.0,
|
|
"step": 27485
|
|
},
|
|
{
|
|
"entropy": 5.3781016826629635,
|
|
"epoch": 2.138805679828827,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0004537662558510481,
|
|
"loss": 4.9604,
|
|
"mean_token_accuracy": 0.2018340051174164,
|
|
"num_tokens": 47685339.0,
|
|
"step": 27490
|
|
},
|
|
{
|
|
"entropy": 5.467798519134521,
|
|
"epoch": 2.1391947092005448,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00045374942441733925,
|
|
"loss": 5.0525,
|
|
"mean_token_accuracy": 0.18897547125816344,
|
|
"num_tokens": 47694729.0,
|
|
"step": 27495
|
|
},
|
|
{
|
|
"entropy": 5.370080423355103,
|
|
"epoch": 2.139583738572262,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0004537325902713923,
|
|
"loss": 5.0359,
|
|
"mean_token_accuracy": 0.19038586616516112,
|
|
"num_tokens": 47703555.0,
|
|
"step": 27500
|
|
},
|
|
{
|
|
"entropy": 5.391144132614135,
|
|
"epoch": 2.1399727679439797,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004537157534134629,
|
|
"loss": 5.091,
|
|
"mean_token_accuracy": 0.18459475338459014,
|
|
"num_tokens": 47713115.0,
|
|
"step": 27505
|
|
},
|
|
{
|
|
"entropy": 5.441892147064209,
|
|
"epoch": 2.1403617973156974,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00045369891384380623,
|
|
"loss": 5.0974,
|
|
"mean_token_accuracy": 0.19319476038217545,
|
|
"num_tokens": 47722263.0,
|
|
"step": 27510
|
|
},
|
|
{
|
|
"entropy": 5.462020492553711,
|
|
"epoch": 2.140750826687415,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0004536820715626781,
|
|
"loss": 5.0545,
|
|
"mean_token_accuracy": 0.19235535264015197,
|
|
"num_tokens": 47730037.0,
|
|
"step": 27515
|
|
},
|
|
{
|
|
"entropy": 5.369777488708496,
|
|
"epoch": 2.1411398560591324,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00045366522657033385,
|
|
"loss": 4.9974,
|
|
"mean_token_accuracy": 0.20412270873785018,
|
|
"num_tokens": 47738968.0,
|
|
"step": 27520
|
|
},
|
|
{
|
|
"entropy": 5.416019344329834,
|
|
"epoch": 2.14152888543085,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.00045364837886702924,
|
|
"loss": 5.0061,
|
|
"mean_token_accuracy": 0.19915127009153366,
|
|
"num_tokens": 47747515.0,
|
|
"step": 27525
|
|
},
|
|
{
|
|
"entropy": 5.422030448913574,
|
|
"epoch": 2.1419179148025678,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0004536315284530198,
|
|
"loss": 4.9994,
|
|
"mean_token_accuracy": 0.2012669786810875,
|
|
"num_tokens": 47756440.0,
|
|
"step": 27530
|
|
},
|
|
{
|
|
"entropy": 5.402505779266358,
|
|
"epoch": 2.142306944174285,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004536146753285612,
|
|
"loss": 5.0569,
|
|
"mean_token_accuracy": 0.18509171307086944,
|
|
"num_tokens": 47765823.0,
|
|
"step": 27535
|
|
},
|
|
{
|
|
"entropy": 5.4289562702178955,
|
|
"epoch": 2.1426959735460027,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004535978194939093,
|
|
"loss": 5.0336,
|
|
"mean_token_accuracy": 0.1928941786289215,
|
|
"num_tokens": 47775423.0,
|
|
"step": 27540
|
|
},
|
|
{
|
|
"entropy": 5.436025476455688,
|
|
"epoch": 2.1430850029177204,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00045358096094931966,
|
|
"loss": 5.0845,
|
|
"mean_token_accuracy": 0.18637435436248778,
|
|
"num_tokens": 47784276.0,
|
|
"step": 27545
|
|
},
|
|
{
|
|
"entropy": 5.419500255584717,
|
|
"epoch": 2.1434740322894377,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004535640996950482,
|
|
"loss": 4.9853,
|
|
"mean_token_accuracy": 0.19802622348070145,
|
|
"num_tokens": 47792608.0,
|
|
"step": 27550
|
|
},
|
|
{
|
|
"entropy": 5.375155353546143,
|
|
"epoch": 2.1438630616611554,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004535472357313507,
|
|
"loss": 5.082,
|
|
"mean_token_accuracy": 0.19032421559095383,
|
|
"num_tokens": 47802356.0,
|
|
"step": 27555
|
|
},
|
|
{
|
|
"entropy": 5.437775707244873,
|
|
"epoch": 2.144252091032873,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00045353036905848316,
|
|
"loss": 5.0404,
|
|
"mean_token_accuracy": 0.19040705561637877,
|
|
"num_tokens": 47811307.0,
|
|
"step": 27560
|
|
},
|
|
{
|
|
"entropy": 5.542190170288086,
|
|
"epoch": 2.1446411204045903,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004535134996767014,
|
|
"loss": 5.1904,
|
|
"mean_token_accuracy": 0.18149494379758835,
|
|
"num_tokens": 47820572.0,
|
|
"step": 27565
|
|
},
|
|
{
|
|
"entropy": 5.5153295516967775,
|
|
"epoch": 2.145030149776308,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004534966275862614,
|
|
"loss": 5.123,
|
|
"mean_token_accuracy": 0.18893694281578063,
|
|
"num_tokens": 47829053.0,
|
|
"step": 27570
|
|
},
|
|
{
|
|
"entropy": 5.47025203704834,
|
|
"epoch": 2.1454191791480257,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0004534797527874192,
|
|
"loss": 5.0461,
|
|
"mean_token_accuracy": 0.19064956158399582,
|
|
"num_tokens": 47838244.0,
|
|
"step": 27575
|
|
},
|
|
{
|
|
"entropy": 5.41400728225708,
|
|
"epoch": 2.1458082085197434,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.00045346287528043083,
|
|
"loss": 4.9874,
|
|
"mean_token_accuracy": 0.1956263303756714,
|
|
"num_tokens": 47846908.0,
|
|
"step": 27580
|
|
},
|
|
{
|
|
"entropy": 5.44817795753479,
|
|
"epoch": 2.1461972378914607,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.00045344599506555244,
|
|
"loss": 5.1003,
|
|
"mean_token_accuracy": 0.19207569360733032,
|
|
"num_tokens": 47855824.0,
|
|
"step": 27585
|
|
},
|
|
{
|
|
"entropy": 5.3649743556976315,
|
|
"epoch": 2.1465862672631784,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00045342911214304,
|
|
"loss": 4.9823,
|
|
"mean_token_accuracy": 0.19559280723333358,
|
|
"num_tokens": 47864641.0,
|
|
"step": 27590
|
|
},
|
|
{
|
|
"entropy": 5.441096067428589,
|
|
"epoch": 2.146975296634896,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0004534122265131498,
|
|
"loss": 5.1482,
|
|
"mean_token_accuracy": 0.18639719784259795,
|
|
"num_tokens": 47873721.0,
|
|
"step": 27595
|
|
},
|
|
{
|
|
"entropy": 5.429397106170654,
|
|
"epoch": 2.1473643260066133,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00045339533817613807,
|
|
"loss": 4.9616,
|
|
"mean_token_accuracy": 0.20429880321025848,
|
|
"num_tokens": 47882485.0,
|
|
"step": 27600
|
|
},
|
|
{
|
|
"entropy": 5.387918186187744,
|
|
"epoch": 2.147753355378331,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00045337844713226106,
|
|
"loss": 4.9434,
|
|
"mean_token_accuracy": 0.1943691313266754,
|
|
"num_tokens": 47891574.0,
|
|
"step": 27605
|
|
},
|
|
{
|
|
"entropy": 5.316628503799438,
|
|
"epoch": 2.1481423847500487,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00045336155338177497,
|
|
"loss": 4.9298,
|
|
"mean_token_accuracy": 0.2003473773598671,
|
|
"num_tokens": 47900123.0,
|
|
"step": 27610
|
|
},
|
|
{
|
|
"entropy": 5.388540744781494,
|
|
"epoch": 2.1485314141217664,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004533446569249362,
|
|
"loss": 5.0483,
|
|
"mean_token_accuracy": 0.19877819269895552,
|
|
"num_tokens": 47908342.0,
|
|
"step": 27615
|
|
},
|
|
{
|
|
"entropy": 5.402663993835449,
|
|
"epoch": 2.1489204434934837,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00045332775776200116,
|
|
"loss": 5.0099,
|
|
"mean_token_accuracy": 0.1972378358244896,
|
|
"num_tokens": 47917365.0,
|
|
"step": 27620
|
|
},
|
|
{
|
|
"entropy": 5.335995769500732,
|
|
"epoch": 2.1493094728652014,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00045331085589322626,
|
|
"loss": 4.983,
|
|
"mean_token_accuracy": 0.19504495412111283,
|
|
"num_tokens": 47925839.0,
|
|
"step": 27625
|
|
},
|
|
{
|
|
"entropy": 5.38365421295166,
|
|
"epoch": 2.149698502236919,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004532939513188679,
|
|
"loss": 4.9182,
|
|
"mean_token_accuracy": 0.20267347544431685,
|
|
"num_tokens": 47934408.0,
|
|
"step": 27630
|
|
},
|
|
{
|
|
"entropy": 5.381110191345215,
|
|
"epoch": 2.1500875316086363,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0004532770440391826,
|
|
"loss": 5.0577,
|
|
"mean_token_accuracy": 0.18853232711553575,
|
|
"num_tokens": 47943486.0,
|
|
"step": 27635
|
|
},
|
|
{
|
|
"entropy": 5.420677709579468,
|
|
"epoch": 2.150476560980354,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004532601340544269,
|
|
"loss": 5.105,
|
|
"mean_token_accuracy": 0.18818778842687606,
|
|
"num_tokens": 47952809.0,
|
|
"step": 27640
|
|
},
|
|
{
|
|
"entropy": 5.411874008178711,
|
|
"epoch": 2.1508655903520717,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004532432213648574,
|
|
"loss": 4.9882,
|
|
"mean_token_accuracy": 0.1942444697022438,
|
|
"num_tokens": 47961104.0,
|
|
"step": 27645
|
|
},
|
|
{
|
|
"entropy": 5.37989616394043,
|
|
"epoch": 2.151254619723789,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00045322630597073067,
|
|
"loss": 5.0002,
|
|
"mean_token_accuracy": 0.19274638891220092,
|
|
"num_tokens": 47969442.0,
|
|
"step": 27650
|
|
},
|
|
{
|
|
"entropy": 5.348083591461181,
|
|
"epoch": 2.1516436490955066,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00045320938787230355,
|
|
"loss": 4.9348,
|
|
"mean_token_accuracy": 0.20231230407953263,
|
|
"num_tokens": 47978703.0,
|
|
"step": 27655
|
|
},
|
|
{
|
|
"entropy": 5.4210813522338865,
|
|
"epoch": 2.1520326784672243,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00045319246706983257,
|
|
"loss": 5.0814,
|
|
"mean_token_accuracy": 0.19261979460716247,
|
|
"num_tokens": 47986886.0,
|
|
"step": 27660
|
|
},
|
|
{
|
|
"entropy": 5.369460153579712,
|
|
"epoch": 2.152421707838942,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00045317554356357446,
|
|
"loss": 4.9687,
|
|
"mean_token_accuracy": 0.19729771167039872,
|
|
"num_tokens": 47995278.0,
|
|
"step": 27665
|
|
},
|
|
{
|
|
"entropy": 5.370333003997803,
|
|
"epoch": 2.1528107372106593,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00045315861735378615,
|
|
"loss": 5.0294,
|
|
"mean_token_accuracy": 0.19204697012901306,
|
|
"num_tokens": 48004351.0,
|
|
"step": 27670
|
|
},
|
|
{
|
|
"entropy": 5.453907299041748,
|
|
"epoch": 2.153199766582377,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00045314168844072435,
|
|
"loss": 5.0208,
|
|
"mean_token_accuracy": 0.18774835914373397,
|
|
"num_tokens": 48013346.0,
|
|
"step": 27675
|
|
},
|
|
{
|
|
"entropy": 5.435391855239868,
|
|
"epoch": 2.1535887959540947,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00045312475682464604,
|
|
"loss": 5.1106,
|
|
"mean_token_accuracy": 0.18976333141326904,
|
|
"num_tokens": 48023371.0,
|
|
"step": 27680
|
|
},
|
|
{
|
|
"entropy": 5.352592611312867,
|
|
"epoch": 2.153977825325812,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.00045310782250580794,
|
|
"loss": 4.9819,
|
|
"mean_token_accuracy": 0.20000998079776763,
|
|
"num_tokens": 48032095.0,
|
|
"step": 27685
|
|
},
|
|
{
|
|
"entropy": 5.354420280456543,
|
|
"epoch": 2.1543668546975296,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0004530908854844672,
|
|
"loss": 4.9685,
|
|
"mean_token_accuracy": 0.19095195680856705,
|
|
"num_tokens": 48040818.0,
|
|
"step": 27690
|
|
},
|
|
{
|
|
"entropy": 5.410459995269775,
|
|
"epoch": 2.1547558840692473,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.00045307394576088076,
|
|
"loss": 4.963,
|
|
"mean_token_accuracy": 0.19614006876945494,
|
|
"num_tokens": 48049737.0,
|
|
"step": 27695
|
|
},
|
|
{
|
|
"entropy": 5.332494688034058,
|
|
"epoch": 2.1551449134409646,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004530570033353056,
|
|
"loss": 4.8897,
|
|
"mean_token_accuracy": 0.20397840589284896,
|
|
"num_tokens": 48057659.0,
|
|
"step": 27700
|
|
},
|
|
{
|
|
"entropy": 5.290556144714356,
|
|
"epoch": 2.1555339428126823,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00045304005820799874,
|
|
"loss": 4.9023,
|
|
"mean_token_accuracy": 0.1949540674686432,
|
|
"num_tokens": 48066578.0,
|
|
"step": 27705
|
|
},
|
|
{
|
|
"entropy": 5.381374263763428,
|
|
"epoch": 2.1559229721844,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004530231103792175,
|
|
"loss": 5.0865,
|
|
"mean_token_accuracy": 0.18522865027189256,
|
|
"num_tokens": 48076051.0,
|
|
"step": 27710
|
|
},
|
|
{
|
|
"entropy": 5.4641717910766605,
|
|
"epoch": 2.1563120015561177,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004530061598492188,
|
|
"loss": 5.1156,
|
|
"mean_token_accuracy": 0.18224289417266845,
|
|
"num_tokens": 48084722.0,
|
|
"step": 27715
|
|
},
|
|
{
|
|
"entropy": 5.334061145782471,
|
|
"epoch": 2.156701030927835,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00045298920661826004,
|
|
"loss": 4.9085,
|
|
"mean_token_accuracy": 0.19866011291742325,
|
|
"num_tokens": 48092890.0,
|
|
"step": 27720
|
|
},
|
|
{
|
|
"entropy": 5.389804124832153,
|
|
"epoch": 2.1570900602995526,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004529722506865984,
|
|
"loss": 5.0474,
|
|
"mean_token_accuracy": 0.19323141723871232,
|
|
"num_tokens": 48101146.0,
|
|
"step": 27725
|
|
},
|
|
{
|
|
"entropy": 5.425093412399292,
|
|
"epoch": 2.1574790896712703,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.000452955292054491,
|
|
"loss": 5.0445,
|
|
"mean_token_accuracy": 0.19154542088508605,
|
|
"num_tokens": 48109974.0,
|
|
"step": 27730
|
|
},
|
|
{
|
|
"entropy": 5.467369890213012,
|
|
"epoch": 2.1578681190429876,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.00045293833072219535,
|
|
"loss": 5.107,
|
|
"mean_token_accuracy": 0.1897028297185898,
|
|
"num_tokens": 48118325.0,
|
|
"step": 27735
|
|
},
|
|
{
|
|
"entropy": 5.4742847919464115,
|
|
"epoch": 2.1582571484147053,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00045292136668996876,
|
|
"loss": 5.1343,
|
|
"mean_token_accuracy": 0.18522509336471557,
|
|
"num_tokens": 48128255.0,
|
|
"step": 27740
|
|
},
|
|
{
|
|
"entropy": 5.400942659378051,
|
|
"epoch": 2.158646177786423,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004529043999580686,
|
|
"loss": 4.9633,
|
|
"mean_token_accuracy": 0.19742625802755356,
|
|
"num_tokens": 48136763.0,
|
|
"step": 27745
|
|
},
|
|
{
|
|
"entropy": 5.369121074676514,
|
|
"epoch": 2.1590352071581402,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00045288743052675234,
|
|
"loss": 4.9957,
|
|
"mean_token_accuracy": 0.2007910579442978,
|
|
"num_tokens": 48146371.0,
|
|
"step": 27750
|
|
},
|
|
{
|
|
"entropy": 5.404933261871338,
|
|
"epoch": 2.159424236529858,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00045287045839627744,
|
|
"loss": 5.0555,
|
|
"mean_token_accuracy": 0.19529910534620284,
|
|
"num_tokens": 48155180.0,
|
|
"step": 27755
|
|
},
|
|
{
|
|
"entropy": 5.330962657928467,
|
|
"epoch": 2.1598132659015756,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.00045285348356690155,
|
|
"loss": 5.0044,
|
|
"mean_token_accuracy": 0.19535451382398605,
|
|
"num_tokens": 48163728.0,
|
|
"step": 27760
|
|
},
|
|
{
|
|
"entropy": 5.3382776260375975,
|
|
"epoch": 2.1602022952732933,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.000452836506038882,
|
|
"loss": 4.995,
|
|
"mean_token_accuracy": 0.1908337488770485,
|
|
"num_tokens": 48171844.0,
|
|
"step": 27765
|
|
},
|
|
{
|
|
"entropy": 5.399021196365356,
|
|
"epoch": 2.1605913246450106,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00045281952581247654,
|
|
"loss": 5.1098,
|
|
"mean_token_accuracy": 0.19387965500354767,
|
|
"num_tokens": 48180617.0,
|
|
"step": 27770
|
|
},
|
|
{
|
|
"entropy": 5.379263591766358,
|
|
"epoch": 2.1609803540167283,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00045280254288794286,
|
|
"loss": 4.9499,
|
|
"mean_token_accuracy": 0.199419766664505,
|
|
"num_tokens": 48188875.0,
|
|
"step": 27775
|
|
},
|
|
{
|
|
"entropy": 5.3297630786895756,
|
|
"epoch": 2.161369383388446,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00045278555726553855,
|
|
"loss": 4.9274,
|
|
"mean_token_accuracy": 0.19676387161016465,
|
|
"num_tokens": 48197280.0,
|
|
"step": 27780
|
|
},
|
|
{
|
|
"entropy": 5.427419710159302,
|
|
"epoch": 2.1617584127601632,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00045276856894552143,
|
|
"loss": 5.127,
|
|
"mean_token_accuracy": 0.18385698944330214,
|
|
"num_tokens": 48206907.0,
|
|
"step": 27785
|
|
},
|
|
{
|
|
"entropy": 5.362340211868286,
|
|
"epoch": 2.162147442131881,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0004527515779281492,
|
|
"loss": 4.9503,
|
|
"mean_token_accuracy": 0.1982266739010811,
|
|
"num_tokens": 48215334.0,
|
|
"step": 27790
|
|
},
|
|
{
|
|
"entropy": 5.415247297286987,
|
|
"epoch": 2.1625364715035986,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.00045273458421367976,
|
|
"loss": 5.0576,
|
|
"mean_token_accuracy": 0.19488824307918548,
|
|
"num_tokens": 48224667.0,
|
|
"step": 27795
|
|
},
|
|
{
|
|
"entropy": 5.423513031005859,
|
|
"epoch": 2.162925500875316,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004527175878023708,
|
|
"loss": 5.1231,
|
|
"mean_token_accuracy": 0.18251290470361708,
|
|
"num_tokens": 48233237.0,
|
|
"step": 27800
|
|
},
|
|
{
|
|
"entropy": 5.425119209289551,
|
|
"epoch": 2.1633145302470336,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004527005886944803,
|
|
"loss": 5.0055,
|
|
"mean_token_accuracy": 0.1942443445324898,
|
|
"num_tokens": 48241048.0,
|
|
"step": 27805
|
|
},
|
|
{
|
|
"entropy": 5.500494146347046,
|
|
"epoch": 2.1637035596187513,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00045268358689026626,
|
|
"loss": 5.1567,
|
|
"mean_token_accuracy": 0.18781585097312928,
|
|
"num_tokens": 48250013.0,
|
|
"step": 27810
|
|
},
|
|
{
|
|
"entropy": 5.4736734390258786,
|
|
"epoch": 2.164092588990469,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0004526665823899866,
|
|
"loss": 5.0954,
|
|
"mean_token_accuracy": 0.19044607728719712,
|
|
"num_tokens": 48258566.0,
|
|
"step": 27815
|
|
},
|
|
{
|
|
"entropy": 5.443532466888428,
|
|
"epoch": 2.164481618362186,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00045264957519389936,
|
|
"loss": 4.9804,
|
|
"mean_token_accuracy": 0.1933306485414505,
|
|
"num_tokens": 48266843.0,
|
|
"step": 27820
|
|
},
|
|
{
|
|
"entropy": 5.333857870101928,
|
|
"epoch": 2.164870647733904,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00045263256530226253,
|
|
"loss": 4.9691,
|
|
"mean_token_accuracy": 0.19478013813495637,
|
|
"num_tokens": 48276138.0,
|
|
"step": 27825
|
|
},
|
|
{
|
|
"entropy": 5.333880758285522,
|
|
"epoch": 2.1652596771056216,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0004526155527153343,
|
|
"loss": 4.896,
|
|
"mean_token_accuracy": 0.20267748236656188,
|
|
"num_tokens": 48284452.0,
|
|
"step": 27830
|
|
},
|
|
{
|
|
"entropy": 5.429748630523681,
|
|
"epoch": 2.165648706477339,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004525985374333727,
|
|
"loss": 5.0592,
|
|
"mean_token_accuracy": 0.19107531607151032,
|
|
"num_tokens": 48292871.0,
|
|
"step": 27835
|
|
},
|
|
{
|
|
"entropy": 5.362192678451538,
|
|
"epoch": 2.1660377358490566,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.000452581519456636,
|
|
"loss": 5.0343,
|
|
"mean_token_accuracy": 0.1863759219646454,
|
|
"num_tokens": 48300642.0,
|
|
"step": 27840
|
|
},
|
|
{
|
|
"entropy": 5.3818597316741945,
|
|
"epoch": 2.1664267652207743,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00045256449878538243,
|
|
"loss": 5.1232,
|
|
"mean_token_accuracy": 0.18416507989168168,
|
|
"num_tokens": 48309229.0,
|
|
"step": 27845
|
|
},
|
|
{
|
|
"entropy": 5.443172931671143,
|
|
"epoch": 2.166815794592492,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00045254747541987017,
|
|
"loss": 5.0549,
|
|
"mean_token_accuracy": 0.18665554076433183,
|
|
"num_tokens": 48317474.0,
|
|
"step": 27850
|
|
},
|
|
{
|
|
"entropy": 5.48644061088562,
|
|
"epoch": 2.167204823964209,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0004525304493603576,
|
|
"loss": 5.1206,
|
|
"mean_token_accuracy": 0.18903460800647737,
|
|
"num_tokens": 48325810.0,
|
|
"step": 27855
|
|
},
|
|
{
|
|
"entropy": 5.431558132171631,
|
|
"epoch": 2.167593853335927,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00045251342060710295,
|
|
"loss": 5.0379,
|
|
"mean_token_accuracy": 0.19466957747936248,
|
|
"num_tokens": 48334348.0,
|
|
"step": 27860
|
|
},
|
|
{
|
|
"entropy": 5.334795045852661,
|
|
"epoch": 2.1679828827076446,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004524963891603647,
|
|
"loss": 4.8957,
|
|
"mean_token_accuracy": 0.2011874198913574,
|
|
"num_tokens": 48342565.0,
|
|
"step": 27865
|
|
},
|
|
{
|
|
"entropy": 5.413707160949707,
|
|
"epoch": 2.168371912079362,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00045247935502040136,
|
|
"loss": 5.1481,
|
|
"mean_token_accuracy": 0.18470294624567032,
|
|
"num_tokens": 48351398.0,
|
|
"step": 27870
|
|
},
|
|
{
|
|
"entropy": 5.403498697280884,
|
|
"epoch": 2.1687609414510796,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004524623181874712,
|
|
"loss": 5.0246,
|
|
"mean_token_accuracy": 0.1886204108595848,
|
|
"num_tokens": 48360275.0,
|
|
"step": 27875
|
|
},
|
|
{
|
|
"entropy": 5.355336332321167,
|
|
"epoch": 2.1691499708227973,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004524452786618329,
|
|
"loss": 4.995,
|
|
"mean_token_accuracy": 0.1874264270067215,
|
|
"num_tokens": 48369516.0,
|
|
"step": 27880
|
|
},
|
|
{
|
|
"entropy": 5.3591372013092045,
|
|
"epoch": 2.1695390001945145,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00045242823644374484,
|
|
"loss": 4.991,
|
|
"mean_token_accuracy": 0.18908893167972565,
|
|
"num_tokens": 48378412.0,
|
|
"step": 27885
|
|
},
|
|
{
|
|
"entropy": 5.462379598617554,
|
|
"epoch": 2.169928029566232,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004524111915334658,
|
|
"loss": 5.0574,
|
|
"mean_token_accuracy": 0.19022310078144072,
|
|
"num_tokens": 48386566.0,
|
|
"step": 27890
|
|
},
|
|
{
|
|
"entropy": 5.476092576980591,
|
|
"epoch": 2.17031705893795,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00045239414393125424,
|
|
"loss": 5.0606,
|
|
"mean_token_accuracy": 0.1862471103668213,
|
|
"num_tokens": 48394727.0,
|
|
"step": 27895
|
|
},
|
|
{
|
|
"entropy": 5.478165578842163,
|
|
"epoch": 2.170706088309667,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0004523770936373689,
|
|
"loss": 5.1073,
|
|
"mean_token_accuracy": 0.1884329840540886,
|
|
"num_tokens": 48404440.0,
|
|
"step": 27900
|
|
},
|
|
{
|
|
"entropy": 5.417226123809814,
|
|
"epoch": 2.171095117681385,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004523600406520685,
|
|
"loss": 4.9721,
|
|
"mean_token_accuracy": 0.19655323177576065,
|
|
"num_tokens": 48413441.0,
|
|
"step": 27905
|
|
},
|
|
{
|
|
"entropy": 5.44138731956482,
|
|
"epoch": 2.1714841470531026,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004523429849756118,
|
|
"loss": 5.1165,
|
|
"mean_token_accuracy": 0.19126634001731874,
|
|
"num_tokens": 48422393.0,
|
|
"step": 27910
|
|
},
|
|
{
|
|
"entropy": 5.443744277954101,
|
|
"epoch": 2.1718731764248203,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0004523259266082576,
|
|
"loss": 5.0677,
|
|
"mean_token_accuracy": 0.19718971252441406,
|
|
"num_tokens": 48431151.0,
|
|
"step": 27915
|
|
},
|
|
{
|
|
"entropy": 5.390175151824951,
|
|
"epoch": 2.1722622057965375,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00045230886555026455,
|
|
"loss": 4.9654,
|
|
"mean_token_accuracy": 0.20026516914367676,
|
|
"num_tokens": 48439453.0,
|
|
"step": 27920
|
|
},
|
|
{
|
|
"entropy": 5.447175168991089,
|
|
"epoch": 2.172651235168255,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00045229180180189176,
|
|
"loss": 5.0629,
|
|
"mean_token_accuracy": 0.19184852093458177,
|
|
"num_tokens": 48448055.0,
|
|
"step": 27925
|
|
},
|
|
{
|
|
"entropy": 5.356282377243042,
|
|
"epoch": 2.173040264539973,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00045227473536339817,
|
|
"loss": 4.924,
|
|
"mean_token_accuracy": 0.20465720295906067,
|
|
"num_tokens": 48456015.0,
|
|
"step": 27930
|
|
},
|
|
{
|
|
"entropy": 5.3888898372650145,
|
|
"epoch": 2.17342929391169,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004522576662350425,
|
|
"loss": 5.0217,
|
|
"mean_token_accuracy": 0.19882518500089646,
|
|
"num_tokens": 48464389.0,
|
|
"step": 27935
|
|
},
|
|
{
|
|
"entropy": 5.458875036239624,
|
|
"epoch": 2.173818323283408,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.000452240594417084,
|
|
"loss": 5.0097,
|
|
"mean_token_accuracy": 0.1894667163491249,
|
|
"num_tokens": 48472403.0,
|
|
"step": 27940
|
|
},
|
|
{
|
|
"entropy": 5.329954719543457,
|
|
"epoch": 2.1742073526551255,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004522235199097815,
|
|
"loss": 5.016,
|
|
"mean_token_accuracy": 0.1863328143954277,
|
|
"num_tokens": 48480879.0,
|
|
"step": 27945
|
|
},
|
|
{
|
|
"entropy": 5.309024953842163,
|
|
"epoch": 2.1745963820268432,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004522064427133942,
|
|
"loss": 4.9874,
|
|
"mean_token_accuracy": 0.19317472726106644,
|
|
"num_tokens": 48489722.0,
|
|
"step": 27950
|
|
},
|
|
{
|
|
"entropy": 5.404091310501099,
|
|
"epoch": 2.1749854113985605,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00045218936282818116,
|
|
"loss": 5.0371,
|
|
"mean_token_accuracy": 0.19619973748922348,
|
|
"num_tokens": 48499023.0,
|
|
"step": 27955
|
|
},
|
|
{
|
|
"entropy": 5.496057033538818,
|
|
"epoch": 2.175374440770278,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004521722802544016,
|
|
"loss": 5.079,
|
|
"mean_token_accuracy": 0.1974037066102028,
|
|
"num_tokens": 48508352.0,
|
|
"step": 27960
|
|
},
|
|
{
|
|
"entropy": 5.38067946434021,
|
|
"epoch": 2.175763470141996,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00045215519499231465,
|
|
"loss": 4.9677,
|
|
"mean_token_accuracy": 0.20111655592918395,
|
|
"num_tokens": 48517481.0,
|
|
"step": 27965
|
|
},
|
|
{
|
|
"entropy": 5.384751796722412,
|
|
"epoch": 2.176152499513713,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00045213810704217963,
|
|
"loss": 4.9954,
|
|
"mean_token_accuracy": 0.19309509694576263,
|
|
"num_tokens": 48525777.0,
|
|
"step": 27970
|
|
},
|
|
{
|
|
"entropy": 5.334950113296509,
|
|
"epoch": 2.176541528885431,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.0004521210164042557,
|
|
"loss": 4.9485,
|
|
"mean_token_accuracy": 0.19818932712078094,
|
|
"num_tokens": 48534297.0,
|
|
"step": 27975
|
|
},
|
|
{
|
|
"entropy": 5.40295557975769,
|
|
"epoch": 2.1769305582571485,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004521039230788024,
|
|
"loss": 5.0488,
|
|
"mean_token_accuracy": 0.19558234214782716,
|
|
"num_tokens": 48543425.0,
|
|
"step": 27980
|
|
},
|
|
{
|
|
"entropy": 5.349777460098267,
|
|
"epoch": 2.177319587628866,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004520868270660789,
|
|
"loss": 4.9763,
|
|
"mean_token_accuracy": 0.19175027310848236,
|
|
"num_tokens": 48553114.0,
|
|
"step": 27985
|
|
},
|
|
{
|
|
"entropy": 5.546117162704467,
|
|
"epoch": 2.1777086170005835,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004520697283663446,
|
|
"loss": 5.0622,
|
|
"mean_token_accuracy": 0.196283221244812,
|
|
"num_tokens": 48561409.0,
|
|
"step": 27990
|
|
},
|
|
{
|
|
"entropy": 5.392153215408325,
|
|
"epoch": 2.178097646372301,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00045205262697985897,
|
|
"loss": 5.0408,
|
|
"mean_token_accuracy": 0.18591720163822173,
|
|
"num_tokens": 48569782.0,
|
|
"step": 27995
|
|
},
|
|
{
|
|
"entropy": 5.432507562637329,
|
|
"epoch": 2.1784866757440184,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004520355229068816,
|
|
"loss": 5.1462,
|
|
"mean_token_accuracy": 0.1845673769712448,
|
|
"num_tokens": 48579283.0,
|
|
"step": 28000
|
|
},
|
|
{
|
|
"entropy": 5.461791133880615,
|
|
"epoch": 2.178875705115736,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00045201841614767203,
|
|
"loss": 5.0411,
|
|
"mean_token_accuracy": 0.18906245827674867,
|
|
"num_tokens": 48587649.0,
|
|
"step": 28005
|
|
},
|
|
{
|
|
"entropy": 5.457585382461548,
|
|
"epoch": 2.179264734487454,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00045200130670248974,
|
|
"loss": 5.0535,
|
|
"mean_token_accuracy": 0.19061661809682845,
|
|
"num_tokens": 48596227.0,
|
|
"step": 28010
|
|
},
|
|
{
|
|
"entropy": 5.3980574131011965,
|
|
"epoch": 2.1796537638591715,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00045198419457159424,
|
|
"loss": 4.9915,
|
|
"mean_token_accuracy": 0.18466486632823945,
|
|
"num_tokens": 48605364.0,
|
|
"step": 28015
|
|
},
|
|
{
|
|
"entropy": 5.421681690216064,
|
|
"epoch": 2.180042793230889,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004519670797552453,
|
|
"loss": 5.093,
|
|
"mean_token_accuracy": 0.18561969697475433,
|
|
"num_tokens": 48613794.0,
|
|
"step": 28020
|
|
},
|
|
{
|
|
"entropy": 5.460006332397461,
|
|
"epoch": 2.1804318226026065,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.00045194996225370266,
|
|
"loss": 5.043,
|
|
"mean_token_accuracy": 0.18504524528980254,
|
|
"num_tokens": 48622381.0,
|
|
"step": 28025
|
|
},
|
|
{
|
|
"entropy": 5.502499628067016,
|
|
"epoch": 2.180820851974324,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00045193284206722595,
|
|
"loss": 5.2,
|
|
"mean_token_accuracy": 0.18574041724205018,
|
|
"num_tokens": 48631484.0,
|
|
"step": 28030
|
|
},
|
|
{
|
|
"entropy": 5.404558897018433,
|
|
"epoch": 2.1812098813460414,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0004519157191960749,
|
|
"loss": 5.0801,
|
|
"mean_token_accuracy": 0.19211936444044114,
|
|
"num_tokens": 48641082.0,
|
|
"step": 28035
|
|
},
|
|
{
|
|
"entropy": 5.408262729644775,
|
|
"epoch": 2.181598910717759,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0004518985936405096,
|
|
"loss": 5.0522,
|
|
"mean_token_accuracy": 0.18842335045337677,
|
|
"num_tokens": 48649974.0,
|
|
"step": 28040
|
|
},
|
|
{
|
|
"entropy": 5.464209842681885,
|
|
"epoch": 2.181987940089477,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0004518814654007896,
|
|
"loss": 5.0496,
|
|
"mean_token_accuracy": 0.1924401640892029,
|
|
"num_tokens": 48658633.0,
|
|
"step": 28045
|
|
},
|
|
{
|
|
"entropy": 5.407297992706299,
|
|
"epoch": 2.1823769694611945,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00045186433447717486,
|
|
"loss": 5.0301,
|
|
"mean_token_accuracy": 0.19067004770040513,
|
|
"num_tokens": 48667313.0,
|
|
"step": 28050
|
|
},
|
|
{
|
|
"entropy": 5.460005092620849,
|
|
"epoch": 2.182765998832912,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.00045184720086992536,
|
|
"loss": 5.1321,
|
|
"mean_token_accuracy": 0.18997216373682022,
|
|
"num_tokens": 48676664.0,
|
|
"step": 28055
|
|
},
|
|
{
|
|
"entropy": 5.420013332366944,
|
|
"epoch": 2.1831550282046295,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.00045183006457930107,
|
|
"loss": 4.9848,
|
|
"mean_token_accuracy": 0.19489010721445083,
|
|
"num_tokens": 48684770.0,
|
|
"step": 28060
|
|
},
|
|
{
|
|
"entropy": 5.349559497833252,
|
|
"epoch": 2.183544057576347,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0004518129256055621,
|
|
"loss": 4.9662,
|
|
"mean_token_accuracy": 0.1951739028096199,
|
|
"num_tokens": 48692965.0,
|
|
"step": 28065
|
|
},
|
|
{
|
|
"entropy": 5.455432271957397,
|
|
"epoch": 2.1839330869480644,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004517957839489683,
|
|
"loss": 5.0817,
|
|
"mean_token_accuracy": 0.19036444127559662,
|
|
"num_tokens": 48702273.0,
|
|
"step": 28070
|
|
},
|
|
{
|
|
"entropy": 5.402045822143554,
|
|
"epoch": 2.184322116319782,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00045177863960977986,
|
|
"loss": 5.0157,
|
|
"mean_token_accuracy": 0.18129972368478775,
|
|
"num_tokens": 48710884.0,
|
|
"step": 28075
|
|
},
|
|
{
|
|
"entropy": 5.514720153808594,
|
|
"epoch": 2.1847111456915,
|
|
"grad_norm": 2.015625,
|
|
"learning_rate": 0.000451761492588257,
|
|
"loss": 5.1717,
|
|
"mean_token_accuracy": 0.17839690744876863,
|
|
"num_tokens": 48719673.0,
|
|
"step": 28080
|
|
},
|
|
{
|
|
"entropy": 5.365681982040405,
|
|
"epoch": 2.185100175063217,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00045174434288465986,
|
|
"loss": 5.0256,
|
|
"mean_token_accuracy": 0.19594370275735856,
|
|
"num_tokens": 48728084.0,
|
|
"step": 28085
|
|
},
|
|
{
|
|
"entropy": 5.523262977600098,
|
|
"epoch": 2.1854892044349348,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004517271904992486,
|
|
"loss": 5.1362,
|
|
"mean_token_accuracy": 0.18390195518732072,
|
|
"num_tokens": 48736621.0,
|
|
"step": 28090
|
|
},
|
|
{
|
|
"entropy": 5.492107152938843,
|
|
"epoch": 2.1858782338066525,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004517100354322835,
|
|
"loss": 5.0556,
|
|
"mean_token_accuracy": 0.19665486514568328,
|
|
"num_tokens": 48744990.0,
|
|
"step": 28095
|
|
},
|
|
{
|
|
"entropy": 5.324941253662109,
|
|
"epoch": 2.18626726317837,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00045169287768402497,
|
|
"loss": 5.0662,
|
|
"mean_token_accuracy": 0.17747486829757692,
|
|
"num_tokens": 48753640.0,
|
|
"step": 28100
|
|
},
|
|
{
|
|
"entropy": 5.28617033958435,
|
|
"epoch": 2.1866562925500874,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.0004516757172547331,
|
|
"loss": 4.9598,
|
|
"mean_token_accuracy": 0.19716623723506926,
|
|
"num_tokens": 48762836.0,
|
|
"step": 28105
|
|
},
|
|
{
|
|
"entropy": 5.498090744018555,
|
|
"epoch": 2.187045321921805,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004516585541446685,
|
|
"loss": 5.0816,
|
|
"mean_token_accuracy": 0.1909654349088669,
|
|
"num_tokens": 48771158.0,
|
|
"step": 28110
|
|
},
|
|
{
|
|
"entropy": 5.428505563735962,
|
|
"epoch": 2.187434351293523,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.00045164138835409153,
|
|
"loss": 5.0958,
|
|
"mean_token_accuracy": 0.18697828501462938,
|
|
"num_tokens": 48779631.0,
|
|
"step": 28115
|
|
},
|
|
{
|
|
"entropy": 5.4214588642120365,
|
|
"epoch": 2.18782338066524,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00045162421988326266,
|
|
"loss": 5.0912,
|
|
"mean_token_accuracy": 0.18804224133491515,
|
|
"num_tokens": 48788584.0,
|
|
"step": 28120
|
|
},
|
|
{
|
|
"entropy": 5.412262201309204,
|
|
"epoch": 2.1882124100369578,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004516070487324424,
|
|
"loss": 4.9844,
|
|
"mean_token_accuracy": 0.19471802860498427,
|
|
"num_tokens": 48797403.0,
|
|
"step": 28125
|
|
},
|
|
{
|
|
"entropy": 5.37298617362976,
|
|
"epoch": 2.1886014394086755,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00045158987490189124,
|
|
"loss": 5.0442,
|
|
"mean_token_accuracy": 0.19813482016324996,
|
|
"num_tokens": 48805448.0,
|
|
"step": 28130
|
|
},
|
|
{
|
|
"entropy": 5.433377933502197,
|
|
"epoch": 2.1889904687803927,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004515726983918697,
|
|
"loss": 5.1134,
|
|
"mean_token_accuracy": 0.18425017595291138,
|
|
"num_tokens": 48814983.0,
|
|
"step": 28135
|
|
},
|
|
{
|
|
"entropy": 5.447548198699951,
|
|
"epoch": 2.1893794981521104,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00045155551920263864,
|
|
"loss": 5.0718,
|
|
"mean_token_accuracy": 0.19170719236135483,
|
|
"num_tokens": 48823955.0,
|
|
"step": 28140
|
|
},
|
|
{
|
|
"entropy": 5.429609489440918,
|
|
"epoch": 2.189768527523828,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00045153833733445857,
|
|
"loss": 5.0807,
|
|
"mean_token_accuracy": 0.1894332766532898,
|
|
"num_tokens": 48832078.0,
|
|
"step": 28145
|
|
},
|
|
{
|
|
"entropy": 5.4771803855896,
|
|
"epoch": 2.190157556895546,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004515211527875903,
|
|
"loss": 5.0418,
|
|
"mean_token_accuracy": 0.19267219305038452,
|
|
"num_tokens": 48840351.0,
|
|
"step": 28150
|
|
},
|
|
{
|
|
"entropy": 5.368520832061767,
|
|
"epoch": 2.190546586267263,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004515039655622943,
|
|
"loss": 4.9863,
|
|
"mean_token_accuracy": 0.20262031853199006,
|
|
"num_tokens": 48848333.0,
|
|
"step": 28155
|
|
},
|
|
{
|
|
"entropy": 5.3157045364379885,
|
|
"epoch": 2.1909356156389808,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.00045148677565883167,
|
|
"loss": 5.0272,
|
|
"mean_token_accuracy": 0.18595658987760544,
|
|
"num_tokens": 48856806.0,
|
|
"step": 28160
|
|
},
|
|
{
|
|
"entropy": 5.481784772872925,
|
|
"epoch": 2.1913246450106985,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0004514695830774631,
|
|
"loss": 5.107,
|
|
"mean_token_accuracy": 0.19005442708730697,
|
|
"num_tokens": 48865848.0,
|
|
"step": 28165
|
|
},
|
|
{
|
|
"entropy": 5.491057538986206,
|
|
"epoch": 2.1917136743824157,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00045145238781844953,
|
|
"loss": 5.111,
|
|
"mean_token_accuracy": 0.18252404034137726,
|
|
"num_tokens": 48875899.0,
|
|
"step": 28170
|
|
},
|
|
{
|
|
"entropy": 5.387235975265503,
|
|
"epoch": 2.1921027037541334,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00045143518988205184,
|
|
"loss": 4.9683,
|
|
"mean_token_accuracy": 0.1970604658126831,
|
|
"num_tokens": 48884026.0,
|
|
"step": 28175
|
|
},
|
|
{
|
|
"entropy": 5.438482570648193,
|
|
"epoch": 2.192491733125851,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00045141798926853094,
|
|
"loss": 5.0294,
|
|
"mean_token_accuracy": 0.19003171771764754,
|
|
"num_tokens": 48892640.0,
|
|
"step": 28180
|
|
},
|
|
{
|
|
"entropy": 5.48634295463562,
|
|
"epoch": 2.1928807624975684,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004514007859781478,
|
|
"loss": 5.1006,
|
|
"mean_token_accuracy": 0.19112081974744796,
|
|
"num_tokens": 48901071.0,
|
|
"step": 28185
|
|
},
|
|
{
|
|
"entropy": 5.432191324234009,
|
|
"epoch": 2.193269791869286,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004513835800111635,
|
|
"loss": 4.9421,
|
|
"mean_token_accuracy": 0.1960209846496582,
|
|
"num_tokens": 48909034.0,
|
|
"step": 28190
|
|
},
|
|
{
|
|
"entropy": 5.447171354293824,
|
|
"epoch": 2.1936588212410038,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.0004513663713678392,
|
|
"loss": 5.1432,
|
|
"mean_token_accuracy": 0.18307837694883347,
|
|
"num_tokens": 48918399.0,
|
|
"step": 28195
|
|
},
|
|
{
|
|
"entropy": 5.45437536239624,
|
|
"epoch": 2.1940478506127215,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00045134916004843596,
|
|
"loss": 5.0325,
|
|
"mean_token_accuracy": 0.1897647798061371,
|
|
"num_tokens": 48926767.0,
|
|
"step": 28200
|
|
},
|
|
{
|
|
"entropy": 5.429740762710571,
|
|
"epoch": 2.1944368799844387,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0004513319460532148,
|
|
"loss": 4.9812,
|
|
"mean_token_accuracy": 0.19624552875757217,
|
|
"num_tokens": 48935666.0,
|
|
"step": 28205
|
|
},
|
|
{
|
|
"entropy": 5.346584796905518,
|
|
"epoch": 2.1948259093561564,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00045131472938243707,
|
|
"loss": 5.0569,
|
|
"mean_token_accuracy": 0.1914469540119171,
|
|
"num_tokens": 48944461.0,
|
|
"step": 28210
|
|
},
|
|
{
|
|
"entropy": 5.327824401855469,
|
|
"epoch": 2.195214938727874,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0004512975100363639,
|
|
"loss": 4.9641,
|
|
"mean_token_accuracy": 0.19471705406904222,
|
|
"num_tokens": 48952368.0,
|
|
"step": 28215
|
|
},
|
|
{
|
|
"entropy": 5.2918102741241455,
|
|
"epoch": 2.1956039680995914,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00045128028801525675,
|
|
"loss": 4.8483,
|
|
"mean_token_accuracy": 0.19947834312915802,
|
|
"num_tokens": 48961866.0,
|
|
"step": 28220
|
|
},
|
|
{
|
|
"entropy": 5.366620969772339,
|
|
"epoch": 2.195992997471309,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00045126306331937674,
|
|
"loss": 4.9963,
|
|
"mean_token_accuracy": 0.19690313339233398,
|
|
"num_tokens": 48970401.0,
|
|
"step": 28225
|
|
},
|
|
{
|
|
"entropy": 5.444857215881347,
|
|
"epoch": 2.1963820268430267,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004512458359489853,
|
|
"loss": 5.0692,
|
|
"mean_token_accuracy": 0.18379541039466857,
|
|
"num_tokens": 48979165.0,
|
|
"step": 28230
|
|
},
|
|
{
|
|
"entropy": 5.379595851898193,
|
|
"epoch": 2.196771056214744,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004512286059043437,
|
|
"loss": 4.9537,
|
|
"mean_token_accuracy": 0.20391090363264083,
|
|
"num_tokens": 48987700.0,
|
|
"step": 28235
|
|
},
|
|
{
|
|
"entropy": 5.372784519195557,
|
|
"epoch": 2.1971600855864617,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00045121137318571364,
|
|
"loss": 5.0319,
|
|
"mean_token_accuracy": 0.19617507457733155,
|
|
"num_tokens": 48996901.0,
|
|
"step": 28240
|
|
},
|
|
{
|
|
"entropy": 5.456158781051636,
|
|
"epoch": 2.1975491149581794,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00045119413779335645,
|
|
"loss": 5.1311,
|
|
"mean_token_accuracy": 0.18842933773994447,
|
|
"num_tokens": 49006049.0,
|
|
"step": 28245
|
|
},
|
|
{
|
|
"entropy": 5.481533145904541,
|
|
"epoch": 2.197938144329897,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004511768997275336,
|
|
"loss": 5.0838,
|
|
"mean_token_accuracy": 0.19189211577177048,
|
|
"num_tokens": 49015092.0,
|
|
"step": 28250
|
|
},
|
|
{
|
|
"entropy": 5.312004852294922,
|
|
"epoch": 2.1983271737016143,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0004511596589885068,
|
|
"loss": 5.0421,
|
|
"mean_token_accuracy": 0.1915465697646141,
|
|
"num_tokens": 49023388.0,
|
|
"step": 28255
|
|
},
|
|
{
|
|
"entropy": 5.344288682937622,
|
|
"epoch": 2.198716203073332,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004511424155765375,
|
|
"loss": 4.9648,
|
|
"mean_token_accuracy": 0.20107341259717942,
|
|
"num_tokens": 49031931.0,
|
|
"step": 28260
|
|
},
|
|
{
|
|
"entropy": 5.453381490707398,
|
|
"epoch": 2.1991052324450497,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00045112516949188735,
|
|
"loss": 5.1254,
|
|
"mean_token_accuracy": 0.1908780202269554,
|
|
"num_tokens": 49040584.0,
|
|
"step": 28265
|
|
},
|
|
{
|
|
"entropy": 5.439366292953491,
|
|
"epoch": 2.199494261816767,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004511079207348182,
|
|
"loss": 5.0284,
|
|
"mean_token_accuracy": 0.19958664923906327,
|
|
"num_tokens": 49049107.0,
|
|
"step": 28270
|
|
},
|
|
{
|
|
"entropy": 5.372990989685059,
|
|
"epoch": 2.1998832911884847,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004510906693055916,
|
|
"loss": 5.0084,
|
|
"mean_token_accuracy": 0.186807981133461,
|
|
"num_tokens": 49058038.0,
|
|
"step": 28275
|
|
},
|
|
{
|
|
"entropy": 5.38836178779602,
|
|
"epoch": 2.2002723205602024,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004510734152044694,
|
|
"loss": 4.9692,
|
|
"mean_token_accuracy": 0.19882271438837051,
|
|
"num_tokens": 49066875.0,
|
|
"step": 28280
|
|
},
|
|
{
|
|
"entropy": 5.380369853973389,
|
|
"epoch": 2.20066134993192,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00045105615843171336,
|
|
"loss": 5.078,
|
|
"mean_token_accuracy": 0.18423424512147904,
|
|
"num_tokens": 49076374.0,
|
|
"step": 28285
|
|
},
|
|
{
|
|
"entropy": 5.4191876411437985,
|
|
"epoch": 2.2010503793036373,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00045103889898758534,
|
|
"loss": 5.0206,
|
|
"mean_token_accuracy": 0.1880969688296318,
|
|
"num_tokens": 49085729.0,
|
|
"step": 28290
|
|
},
|
|
{
|
|
"entropy": 5.375594520568848,
|
|
"epoch": 2.201439408675355,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004510216368723472,
|
|
"loss": 4.9491,
|
|
"mean_token_accuracy": 0.19396336376667023,
|
|
"num_tokens": 49093959.0,
|
|
"step": 28295
|
|
},
|
|
{
|
|
"entropy": 5.371994161605835,
|
|
"epoch": 2.2018284380470727,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.00045100437208626086,
|
|
"loss": 5.0445,
|
|
"mean_token_accuracy": 0.1911723017692566,
|
|
"num_tokens": 49102412.0,
|
|
"step": 28300
|
|
},
|
|
{
|
|
"entropy": 5.339009952545166,
|
|
"epoch": 2.20221746741879,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00045098710462958844,
|
|
"loss": 5.0031,
|
|
"mean_token_accuracy": 0.19333076626062393,
|
|
"num_tokens": 49110655.0,
|
|
"step": 28305
|
|
},
|
|
{
|
|
"entropy": 5.411261320114136,
|
|
"epoch": 2.2026064967905077,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.00045096983450259166,
|
|
"loss": 5.0205,
|
|
"mean_token_accuracy": 0.1896621748805046,
|
|
"num_tokens": 49119117.0,
|
|
"step": 28310
|
|
},
|
|
{
|
|
"entropy": 5.394672298431397,
|
|
"epoch": 2.2029955261622254,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00045095256170553285,
|
|
"loss": 4.9597,
|
|
"mean_token_accuracy": 0.19078228622674942,
|
|
"num_tokens": 49127513.0,
|
|
"step": 28315
|
|
},
|
|
{
|
|
"entropy": 5.412776374816895,
|
|
"epoch": 2.2033845555339426,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00045093528623867384,
|
|
"loss": 4.9945,
|
|
"mean_token_accuracy": 0.19283927232027054,
|
|
"num_tokens": 49135851.0,
|
|
"step": 28320
|
|
},
|
|
{
|
|
"entropy": 5.454043865203857,
|
|
"epoch": 2.2037735849056603,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00045091800810227706,
|
|
"loss": 5.1114,
|
|
"mean_token_accuracy": 0.18604275435209275,
|
|
"num_tokens": 49144775.0,
|
|
"step": 28325
|
|
},
|
|
{
|
|
"entropy": 5.47678771018982,
|
|
"epoch": 2.204162614277378,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0004509007272966044,
|
|
"loss": 5.0627,
|
|
"mean_token_accuracy": 0.1945940524339676,
|
|
"num_tokens": 49152861.0,
|
|
"step": 28330
|
|
},
|
|
{
|
|
"entropy": 5.414076042175293,
|
|
"epoch": 2.2045516436490953,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0004508834438219182,
|
|
"loss": 5.1378,
|
|
"mean_token_accuracy": 0.18473929166793823,
|
|
"num_tokens": 49161875.0,
|
|
"step": 28335
|
|
},
|
|
{
|
|
"entropy": 5.469267082214356,
|
|
"epoch": 2.204940673020813,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004508661576784807,
|
|
"loss": 5.1527,
|
|
"mean_token_accuracy": 0.1893542155623436,
|
|
"num_tokens": 49170277.0,
|
|
"step": 28340
|
|
},
|
|
{
|
|
"entropy": 5.378471231460571,
|
|
"epoch": 2.2053297023925307,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004508488688665541,
|
|
"loss": 4.9152,
|
|
"mean_token_accuracy": 0.2032302960753441,
|
|
"num_tokens": 49179078.0,
|
|
"step": 28345
|
|
},
|
|
{
|
|
"entropy": 5.399324178695679,
|
|
"epoch": 2.2057187317642484,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004508315773864009,
|
|
"loss": 5.0083,
|
|
"mean_token_accuracy": 0.1880996823310852,
|
|
"num_tokens": 49187649.0,
|
|
"step": 28350
|
|
},
|
|
{
|
|
"entropy": 5.35129132270813,
|
|
"epoch": 2.2061077611359656,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.00045081428323828337,
|
|
"loss": 4.9429,
|
|
"mean_token_accuracy": 0.20895701944828032,
|
|
"num_tokens": 49195369.0,
|
|
"step": 28355
|
|
},
|
|
{
|
|
"entropy": 5.453681945800781,
|
|
"epoch": 2.2064967905076833,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004507969864224639,
|
|
"loss": 5.117,
|
|
"mean_token_accuracy": 0.18047391325235368,
|
|
"num_tokens": 49203623.0,
|
|
"step": 28360
|
|
},
|
|
{
|
|
"entropy": 5.431863307952881,
|
|
"epoch": 2.206885819879401,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.000450779686939205,
|
|
"loss": 5.046,
|
|
"mean_token_accuracy": 0.19163624197244644,
|
|
"num_tokens": 49212251.0,
|
|
"step": 28365
|
|
},
|
|
{
|
|
"entropy": 5.400700426101684,
|
|
"epoch": 2.2072748492511183,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00045076238478876916,
|
|
"loss": 5.011,
|
|
"mean_token_accuracy": 0.19248375445604324,
|
|
"num_tokens": 49220580.0,
|
|
"step": 28370
|
|
},
|
|
{
|
|
"entropy": 5.446966648101807,
|
|
"epoch": 2.207663878622836,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004507450799714188,
|
|
"loss": 5.0401,
|
|
"mean_token_accuracy": 0.1948488935828209,
|
|
"num_tokens": 49229011.0,
|
|
"step": 28375
|
|
},
|
|
{
|
|
"entropy": 5.409651803970337,
|
|
"epoch": 2.2080529079945537,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00045072777248741664,
|
|
"loss": 5.0091,
|
|
"mean_token_accuracy": 0.19693334102630616,
|
|
"num_tokens": 49237082.0,
|
|
"step": 28380
|
|
},
|
|
{
|
|
"entropy": 5.4535871028900145,
|
|
"epoch": 2.2084419373662714,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004507104623370252,
|
|
"loss": 5.1164,
|
|
"mean_token_accuracy": 0.1865948721766472,
|
|
"num_tokens": 49245768.0,
|
|
"step": 28385
|
|
},
|
|
{
|
|
"entropy": 5.406794023513794,
|
|
"epoch": 2.2088309667379886,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004506931495205072,
|
|
"loss": 5.0418,
|
|
"mean_token_accuracy": 0.1956426739692688,
|
|
"num_tokens": 49254932.0,
|
|
"step": 28390
|
|
},
|
|
{
|
|
"entropy": 5.375860977172851,
|
|
"epoch": 2.2092199961097063,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004506758340381253,
|
|
"loss": 5.0447,
|
|
"mean_token_accuracy": 0.18891033828258513,
|
|
"num_tokens": 49263798.0,
|
|
"step": 28395
|
|
},
|
|
{
|
|
"entropy": 5.4323498725891115,
|
|
"epoch": 2.209609025481424,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0004506585158901422,
|
|
"loss": 4.9258,
|
|
"mean_token_accuracy": 0.1967483788728714,
|
|
"num_tokens": 49272045.0,
|
|
"step": 28400
|
|
},
|
|
{
|
|
"entropy": 5.4898295402526855,
|
|
"epoch": 2.2099980548531413,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004506411950768207,
|
|
"loss": 5.1246,
|
|
"mean_token_accuracy": 0.18267075419425965,
|
|
"num_tokens": 49281562.0,
|
|
"step": 28405
|
|
},
|
|
{
|
|
"entropy": 5.302128314971924,
|
|
"epoch": 2.210387084224859,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.00045062387159842363,
|
|
"loss": 4.9144,
|
|
"mean_token_accuracy": 0.20220601558685303,
|
|
"num_tokens": 49290113.0,
|
|
"step": 28410
|
|
},
|
|
{
|
|
"entropy": 5.381335783004761,
|
|
"epoch": 2.2107761135965767,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00045060654545521386,
|
|
"loss": 5.0233,
|
|
"mean_token_accuracy": 0.19293704330921174,
|
|
"num_tokens": 49298210.0,
|
|
"step": 28415
|
|
},
|
|
{
|
|
"entropy": 5.439604091644287,
|
|
"epoch": 2.211165142968294,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00045058921664745436,
|
|
"loss": 5.0597,
|
|
"mean_token_accuracy": 0.19024938046932222,
|
|
"num_tokens": 49306533.0,
|
|
"step": 28420
|
|
},
|
|
{
|
|
"entropy": 5.417627000808716,
|
|
"epoch": 2.2115541723400116,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00045057188517540783,
|
|
"loss": 5.1012,
|
|
"mean_token_accuracy": 0.19111771434545516,
|
|
"num_tokens": 49315617.0,
|
|
"step": 28425
|
|
},
|
|
{
|
|
"entropy": 5.492405033111572,
|
|
"epoch": 2.2119432017117293,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004505545510393374,
|
|
"loss": 4.9985,
|
|
"mean_token_accuracy": 0.1932731106877327,
|
|
"num_tokens": 49324351.0,
|
|
"step": 28430
|
|
},
|
|
{
|
|
"entropy": 5.378728437423706,
|
|
"epoch": 2.2123322310834466,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00045053721423950617,
|
|
"loss": 4.9876,
|
|
"mean_token_accuracy": 0.2002292290329933,
|
|
"num_tokens": 49333036.0,
|
|
"step": 28435
|
|
},
|
|
{
|
|
"entropy": 5.353306007385254,
|
|
"epoch": 2.2127212604551643,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0004505198747761771,
|
|
"loss": 4.9781,
|
|
"mean_token_accuracy": 0.19263887405395508,
|
|
"num_tokens": 49341715.0,
|
|
"step": 28440
|
|
},
|
|
{
|
|
"entropy": 5.455445384979248,
|
|
"epoch": 2.213110289826882,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.0004505025326496132,
|
|
"loss": 5.0474,
|
|
"mean_token_accuracy": 0.18783219754695893,
|
|
"num_tokens": 49350505.0,
|
|
"step": 28445
|
|
},
|
|
{
|
|
"entropy": 5.421740531921387,
|
|
"epoch": 2.2134993191985997,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.00045048518786007784,
|
|
"loss": 5.0767,
|
|
"mean_token_accuracy": 0.19024426639080047,
|
|
"num_tokens": 49358902.0,
|
|
"step": 28450
|
|
},
|
|
{
|
|
"entropy": 5.4778783321380615,
|
|
"epoch": 2.213888348570317,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00045046784040783395,
|
|
"loss": 5.0945,
|
|
"mean_token_accuracy": 0.18827909529209136,
|
|
"num_tokens": 49366932.0,
|
|
"step": 28455
|
|
},
|
|
{
|
|
"entropy": 5.547447299957275,
|
|
"epoch": 2.2142773779420346,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.000450450490293145,
|
|
"loss": 5.1999,
|
|
"mean_token_accuracy": 0.18296363353729247,
|
|
"num_tokens": 49375907.0,
|
|
"step": 28460
|
|
},
|
|
{
|
|
"entropy": 5.478766775131225,
|
|
"epoch": 2.2146664073137523,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.000450433137516274,
|
|
"loss": 5.058,
|
|
"mean_token_accuracy": 0.19200606793165206,
|
|
"num_tokens": 49383871.0,
|
|
"step": 28465
|
|
},
|
|
{
|
|
"entropy": 5.390125322341919,
|
|
"epoch": 2.2150554366854696,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 0.0004504157820774844,
|
|
"loss": 5.0414,
|
|
"mean_token_accuracy": 0.19693129658699035,
|
|
"num_tokens": 49392452.0,
|
|
"step": 28470
|
|
},
|
|
{
|
|
"entropy": 5.3331615924835205,
|
|
"epoch": 2.2154444660571873,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004503984239770396,
|
|
"loss": 4.9197,
|
|
"mean_token_accuracy": 0.1997067853808403,
|
|
"num_tokens": 49401698.0,
|
|
"step": 28475
|
|
},
|
|
{
|
|
"entropy": 5.425263071060181,
|
|
"epoch": 2.215833495428905,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004503810632152028,
|
|
"loss": 5.0765,
|
|
"mean_token_accuracy": 0.1882842019200325,
|
|
"num_tokens": 49409505.0,
|
|
"step": 28480
|
|
},
|
|
{
|
|
"entropy": 5.431936502456665,
|
|
"epoch": 2.2162225248006227,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0004503636997922375,
|
|
"loss": 5.0906,
|
|
"mean_token_accuracy": 0.18762342035770416,
|
|
"num_tokens": 49418489.0,
|
|
"step": 28485
|
|
},
|
|
{
|
|
"entropy": 5.449176597595215,
|
|
"epoch": 2.21661155417234,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0004503463337084072,
|
|
"loss": 5.0097,
|
|
"mean_token_accuracy": 0.20085590928792954,
|
|
"num_tokens": 49426989.0,
|
|
"step": 28490
|
|
},
|
|
{
|
|
"entropy": 5.453350162506103,
|
|
"epoch": 2.2170005835440576,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004503289649639754,
|
|
"loss": 5.0713,
|
|
"mean_token_accuracy": 0.19008762240409852,
|
|
"num_tokens": 49436199.0,
|
|
"step": 28495
|
|
},
|
|
{
|
|
"entropy": 5.359768295288086,
|
|
"epoch": 2.2173896129157753,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004503115935592056,
|
|
"loss": 4.9363,
|
|
"mean_token_accuracy": 0.20054423362016677,
|
|
"num_tokens": 49444092.0,
|
|
"step": 28500
|
|
},
|
|
{
|
|
"entropy": 5.409162425994873,
|
|
"epoch": 2.2177786422874926,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0004502942194943614,
|
|
"loss": 5.0736,
|
|
"mean_token_accuracy": 0.19296668767929076,
|
|
"num_tokens": 49452461.0,
|
|
"step": 28505
|
|
},
|
|
{
|
|
"entropy": 5.492364120483399,
|
|
"epoch": 2.2181676716592102,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00045027684276970645,
|
|
"loss": 5.0259,
|
|
"mean_token_accuracy": 0.1925903305411339,
|
|
"num_tokens": 49461972.0,
|
|
"step": 28510
|
|
},
|
|
{
|
|
"entropy": 5.4426429271698,
|
|
"epoch": 2.218556701030928,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00045025946338550434,
|
|
"loss": 5.0323,
|
|
"mean_token_accuracy": 0.1941555008292198,
|
|
"num_tokens": 49470656.0,
|
|
"step": 28515
|
|
},
|
|
{
|
|
"entropy": 5.359527254104615,
|
|
"epoch": 2.218945730402645,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004502420813420189,
|
|
"loss": 5.0563,
|
|
"mean_token_accuracy": 0.19127824008464814,
|
|
"num_tokens": 49479018.0,
|
|
"step": 28520
|
|
},
|
|
{
|
|
"entropy": 5.418989944458008,
|
|
"epoch": 2.219334759774363,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004502246966395137,
|
|
"loss": 5.0578,
|
|
"mean_token_accuracy": 0.194000506401062,
|
|
"num_tokens": 49487521.0,
|
|
"step": 28525
|
|
},
|
|
{
|
|
"entropy": 5.455978202819824,
|
|
"epoch": 2.2197237891460806,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00045020730927825274,
|
|
"loss": 5.1045,
|
|
"mean_token_accuracy": 0.18716869950294496,
|
|
"num_tokens": 49495382.0,
|
|
"step": 28530
|
|
},
|
|
{
|
|
"entropy": 5.403925466537475,
|
|
"epoch": 2.2201128185177983,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004501899192584997,
|
|
"loss": 4.9987,
|
|
"mean_token_accuracy": 0.19890448749065398,
|
|
"num_tokens": 49503819.0,
|
|
"step": 28535
|
|
},
|
|
{
|
|
"entropy": 5.38745231628418,
|
|
"epoch": 2.2205018478895155,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004501725265805185,
|
|
"loss": 5.0641,
|
|
"mean_token_accuracy": 0.1917824551463127,
|
|
"num_tokens": 49512908.0,
|
|
"step": 28540
|
|
},
|
|
{
|
|
"entropy": 5.461819267272949,
|
|
"epoch": 2.2208908772612332,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00045015513124457303,
|
|
"loss": 5.0742,
|
|
"mean_token_accuracy": 0.1927698254585266,
|
|
"num_tokens": 49522462.0,
|
|
"step": 28545
|
|
},
|
|
{
|
|
"entropy": 5.4629395484924315,
|
|
"epoch": 2.221279906632951,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004501377332509272,
|
|
"loss": 5.0705,
|
|
"mean_token_accuracy": 0.19376590251922607,
|
|
"num_tokens": 49531089.0,
|
|
"step": 28550
|
|
},
|
|
{
|
|
"entropy": 5.444423961639404,
|
|
"epoch": 2.221668936004668,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00045012033259984494,
|
|
"loss": 4.9962,
|
|
"mean_token_accuracy": 0.1948261797428131,
|
|
"num_tokens": 49539074.0,
|
|
"step": 28555
|
|
},
|
|
{
|
|
"entropy": 5.362420511245728,
|
|
"epoch": 2.222057965376386,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004501029292915905,
|
|
"loss": 5.0564,
|
|
"mean_token_accuracy": 0.19520948380231856,
|
|
"num_tokens": 49547879.0,
|
|
"step": 28560
|
|
},
|
|
{
|
|
"entropy": 5.502680253982544,
|
|
"epoch": 2.2224469947481036,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00045008552332642774,
|
|
"loss": 5.1262,
|
|
"mean_token_accuracy": 0.1951983615756035,
|
|
"num_tokens": 49556220.0,
|
|
"step": 28565
|
|
},
|
|
{
|
|
"entropy": 5.457561779022217,
|
|
"epoch": 2.222836024119821,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00045006811470462083,
|
|
"loss": 5.0126,
|
|
"mean_token_accuracy": 0.19352376013994216,
|
|
"num_tokens": 49564710.0,
|
|
"step": 28570
|
|
},
|
|
{
|
|
"entropy": 5.345428705215454,
|
|
"epoch": 2.2232250534915385,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.000450050703426434,
|
|
"loss": 4.9502,
|
|
"mean_token_accuracy": 0.19422867447137832,
|
|
"num_tokens": 49572829.0,
|
|
"step": 28575
|
|
},
|
|
{
|
|
"entropy": 5.367513847351074,
|
|
"epoch": 2.2236140828632562,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0004500332894921313,
|
|
"loss": 5.0899,
|
|
"mean_token_accuracy": 0.19512893110513688,
|
|
"num_tokens": 49580355.0,
|
|
"step": 28580
|
|
},
|
|
{
|
|
"entropy": 5.427493906021118,
|
|
"epoch": 2.224003112234974,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004500158729019771,
|
|
"loss": 5.0361,
|
|
"mean_token_accuracy": 0.19477384984493257,
|
|
"num_tokens": 49589086.0,
|
|
"step": 28585
|
|
},
|
|
{
|
|
"entropy": 5.372280645370483,
|
|
"epoch": 2.224392141606691,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004499984536562355,
|
|
"loss": 4.9821,
|
|
"mean_token_accuracy": 0.1943938747048378,
|
|
"num_tokens": 49597434.0,
|
|
"step": 28590
|
|
},
|
|
{
|
|
"entropy": 5.455588054656983,
|
|
"epoch": 2.224781170978409,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.000449981031755171,
|
|
"loss": 5.0402,
|
|
"mean_token_accuracy": 0.19604054987430572,
|
|
"num_tokens": 49604981.0,
|
|
"step": 28595
|
|
},
|
|
{
|
|
"entropy": 5.472573947906494,
|
|
"epoch": 2.2251702003501266,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00044996360719904777,
|
|
"loss": 5.0512,
|
|
"mean_token_accuracy": 0.19621344804763793,
|
|
"num_tokens": 49614119.0,
|
|
"step": 28600
|
|
},
|
|
{
|
|
"entropy": 5.484685277938842,
|
|
"epoch": 2.225559229721844,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004499461799881303,
|
|
"loss": 5.0908,
|
|
"mean_token_accuracy": 0.19170414805412292,
|
|
"num_tokens": 49622705.0,
|
|
"step": 28605
|
|
},
|
|
{
|
|
"entropy": 5.432948970794678,
|
|
"epoch": 2.2259482590935615,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0004499287501226831,
|
|
"loss": 5.085,
|
|
"mean_token_accuracy": 0.18198685944080353,
|
|
"num_tokens": 49632086.0,
|
|
"step": 28610
|
|
},
|
|
{
|
|
"entropy": 5.437659168243409,
|
|
"epoch": 2.2263372884652792,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.00044991131760297045,
|
|
"loss": 5.0783,
|
|
"mean_token_accuracy": 0.19741007834672927,
|
|
"num_tokens": 49640733.0,
|
|
"step": 28615
|
|
},
|
|
{
|
|
"entropy": 5.36816439628601,
|
|
"epoch": 2.226726317836997,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00044989388242925693,
|
|
"loss": 5.0387,
|
|
"mean_token_accuracy": 0.19523588567972183,
|
|
"num_tokens": 49649694.0,
|
|
"step": 28620
|
|
},
|
|
{
|
|
"entropy": 5.464972400665284,
|
|
"epoch": 2.227115347208714,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004498764446018073,
|
|
"loss": 5.1373,
|
|
"mean_token_accuracy": 0.19174990952014923,
|
|
"num_tokens": 49657536.0,
|
|
"step": 28625
|
|
},
|
|
{
|
|
"entropy": 5.4100339889526365,
|
|
"epoch": 2.227504376580432,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004498590041208857,
|
|
"loss": 4.9753,
|
|
"mean_token_accuracy": 0.19697984009981157,
|
|
"num_tokens": 49666332.0,
|
|
"step": 28630
|
|
},
|
|
{
|
|
"entropy": 5.327340698242187,
|
|
"epoch": 2.2278934059521496,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004498415609867572,
|
|
"loss": 4.9534,
|
|
"mean_token_accuracy": 0.20087965875864028,
|
|
"num_tokens": 49675364.0,
|
|
"step": 28635
|
|
},
|
|
{
|
|
"entropy": 5.465593671798706,
|
|
"epoch": 2.228282435323867,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.00044982411519968625,
|
|
"loss": 5.1707,
|
|
"mean_token_accuracy": 0.18378072679042817,
|
|
"num_tokens": 49684178.0,
|
|
"step": 28640
|
|
},
|
|
{
|
|
"entropy": 5.497609281539917,
|
|
"epoch": 2.2286714646955845,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004498066667599377,
|
|
"loss": 5.0678,
|
|
"mean_token_accuracy": 0.18995979726314544,
|
|
"num_tokens": 49692747.0,
|
|
"step": 28645
|
|
},
|
|
{
|
|
"entropy": 5.358578634262085,
|
|
"epoch": 2.2290604940673022,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00044978921566777604,
|
|
"loss": 5.0498,
|
|
"mean_token_accuracy": 0.19096174091100693,
|
|
"num_tokens": 49701534.0,
|
|
"step": 28650
|
|
},
|
|
{
|
|
"entropy": 5.4067071914672855,
|
|
"epoch": 2.2294495234390195,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004497717619234664,
|
|
"loss": 5.0586,
|
|
"mean_token_accuracy": 0.1915797084569931,
|
|
"num_tokens": 49710021.0,
|
|
"step": 28655
|
|
},
|
|
{
|
|
"entropy": 5.37641716003418,
|
|
"epoch": 2.229838552810737,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00044975430552727337,
|
|
"loss": 4.9676,
|
|
"mean_token_accuracy": 0.1949818715453148,
|
|
"num_tokens": 49718786.0,
|
|
"step": 28660
|
|
},
|
|
{
|
|
"entropy": 5.42541537284851,
|
|
"epoch": 2.230227582182455,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0004497368464794619,
|
|
"loss": 5.0487,
|
|
"mean_token_accuracy": 0.1926829233765602,
|
|
"num_tokens": 49726840.0,
|
|
"step": 28665
|
|
},
|
|
{
|
|
"entropy": 5.472784900665284,
|
|
"epoch": 2.230616611554172,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00044971938478029693,
|
|
"loss": 5.1084,
|
|
"mean_token_accuracy": 0.18873153030872344,
|
|
"num_tokens": 49736130.0,
|
|
"step": 28670
|
|
},
|
|
{
|
|
"entropy": 5.406555986404419,
|
|
"epoch": 2.23100564092589,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00044970192043004343,
|
|
"loss": 5.0256,
|
|
"mean_token_accuracy": 0.1886287122964859,
|
|
"num_tokens": 49744810.0,
|
|
"step": 28675
|
|
},
|
|
{
|
|
"entropy": 5.4270611763000485,
|
|
"epoch": 2.2313946702976075,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004496844534289663,
|
|
"loss": 5.0481,
|
|
"mean_token_accuracy": 0.19720927774906158,
|
|
"num_tokens": 49754053.0,
|
|
"step": 28680
|
|
},
|
|
{
|
|
"entropy": 5.482103395462036,
|
|
"epoch": 2.231783699669325,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00044966698377733064,
|
|
"loss": 5.0621,
|
|
"mean_token_accuracy": 0.1866968497633934,
|
|
"num_tokens": 49763735.0,
|
|
"step": 28685
|
|
},
|
|
{
|
|
"entropy": 5.447889089584351,
|
|
"epoch": 2.2321727290410425,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004496495114754015,
|
|
"loss": 5.1044,
|
|
"mean_token_accuracy": 0.19134055376052855,
|
|
"num_tokens": 49772867.0,
|
|
"step": 28690
|
|
},
|
|
{
|
|
"entropy": 5.337449598312378,
|
|
"epoch": 2.23256175841276,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00044963203652344404,
|
|
"loss": 4.9098,
|
|
"mean_token_accuracy": 0.2004231259226799,
|
|
"num_tokens": 49781460.0,
|
|
"step": 28695
|
|
},
|
|
{
|
|
"entropy": 5.359178495407105,
|
|
"epoch": 2.232950787784478,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.0004496145589217234,
|
|
"loss": 4.9408,
|
|
"mean_token_accuracy": 0.19290661066770554,
|
|
"num_tokens": 49790249.0,
|
|
"step": 28700
|
|
},
|
|
{
|
|
"entropy": 5.437139463424683,
|
|
"epoch": 2.233339817156195,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00044959707867050467,
|
|
"loss": 5.0002,
|
|
"mean_token_accuracy": 0.1987817481160164,
|
|
"num_tokens": 49797959.0,
|
|
"step": 28705
|
|
},
|
|
{
|
|
"entropy": 5.340733814239502,
|
|
"epoch": 2.233728846527913,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004495795957700532,
|
|
"loss": 4.9404,
|
|
"mean_token_accuracy": 0.2024763584136963,
|
|
"num_tokens": 49806669.0,
|
|
"step": 28710
|
|
},
|
|
{
|
|
"entropy": 5.368253421783447,
|
|
"epoch": 2.2341178758996305,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00044956211022063424,
|
|
"loss": 5.1679,
|
|
"mean_token_accuracy": 0.18785798400640488,
|
|
"num_tokens": 49816821.0,
|
|
"step": 28715
|
|
},
|
|
{
|
|
"entropy": 5.519353008270263,
|
|
"epoch": 2.234506905271348,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00044954462202251316,
|
|
"loss": 5.0555,
|
|
"mean_token_accuracy": 0.19579057544469833,
|
|
"num_tokens": 49825411.0,
|
|
"step": 28720
|
|
},
|
|
{
|
|
"entropy": 5.437824344635009,
|
|
"epoch": 2.2348959346430655,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00044952713117595516,
|
|
"loss": 5.0818,
|
|
"mean_token_accuracy": 0.1920386806130409,
|
|
"num_tokens": 49833496.0,
|
|
"step": 28725
|
|
},
|
|
{
|
|
"entropy": 5.335183477401733,
|
|
"epoch": 2.235284964014783,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00044950963768122576,
|
|
"loss": 5.0216,
|
|
"mean_token_accuracy": 0.1824677914381027,
|
|
"num_tokens": 49842935.0,
|
|
"step": 28730
|
|
},
|
|
{
|
|
"entropy": 5.406265830993652,
|
|
"epoch": 2.235673993386501,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.0004494921415385905,
|
|
"loss": 5.0814,
|
|
"mean_token_accuracy": 0.188034787774086,
|
|
"num_tokens": 49851197.0,
|
|
"step": 28735
|
|
},
|
|
{
|
|
"entropy": 5.433552026748657,
|
|
"epoch": 2.236063022758218,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00044947464274831464,
|
|
"loss": 4.9823,
|
|
"mean_token_accuracy": 0.20005682557821275,
|
|
"num_tokens": 49859778.0,
|
|
"step": 28740
|
|
},
|
|
{
|
|
"entropy": 5.419425678253174,
|
|
"epoch": 2.236452052129936,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004494571413106637,
|
|
"loss": 5.0541,
|
|
"mean_token_accuracy": 0.18709381371736528,
|
|
"num_tokens": 49868548.0,
|
|
"step": 28745
|
|
},
|
|
{
|
|
"entropy": 5.421139812469482,
|
|
"epoch": 2.2368410815016535,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00044943963722590344,
|
|
"loss": 5.0134,
|
|
"mean_token_accuracy": 0.19126642346382142,
|
|
"num_tokens": 49877070.0,
|
|
"step": 28750
|
|
},
|
|
{
|
|
"entropy": 5.431540298461914,
|
|
"epoch": 2.2372301108733708,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00044942213049429917,
|
|
"loss": 5.0766,
|
|
"mean_token_accuracy": 0.18995630741119385,
|
|
"num_tokens": 49885225.0,
|
|
"step": 28755
|
|
},
|
|
{
|
|
"entropy": 5.411355876922608,
|
|
"epoch": 2.2376191402450885,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00044940462111611685,
|
|
"loss": 5.1641,
|
|
"mean_token_accuracy": 0.18878839164972305,
|
|
"num_tokens": 49894305.0,
|
|
"step": 28760
|
|
},
|
|
{
|
|
"entropy": 5.414623498916626,
|
|
"epoch": 2.238008169616806,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00044938710909162195,
|
|
"loss": 4.9747,
|
|
"mean_token_accuracy": 0.19653355777263642,
|
|
"num_tokens": 49902587.0,
|
|
"step": 28765
|
|
},
|
|
{
|
|
"entropy": 5.399187994003296,
|
|
"epoch": 2.2383971989885234,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004493695944210802,
|
|
"loss": 4.9193,
|
|
"mean_token_accuracy": 0.19730149805545807,
|
|
"num_tokens": 49911037.0,
|
|
"step": 28770
|
|
},
|
|
{
|
|
"entropy": 5.390562868118286,
|
|
"epoch": 2.238786228360241,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004493520771047574,
|
|
"loss": 5.0686,
|
|
"mean_token_accuracy": 0.1962337464094162,
|
|
"num_tokens": 49920724.0,
|
|
"step": 28775
|
|
},
|
|
{
|
|
"entropy": 5.356308078765869,
|
|
"epoch": 2.239175257731959,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00044933455714291944,
|
|
"loss": 5.0438,
|
|
"mean_token_accuracy": 0.1982683926820755,
|
|
"num_tokens": 49929173.0,
|
|
"step": 28780
|
|
},
|
|
{
|
|
"entropy": 5.449581289291382,
|
|
"epoch": 2.2395642871036765,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00044931703453583195,
|
|
"loss": 5.039,
|
|
"mean_token_accuracy": 0.18977890461683272,
|
|
"num_tokens": 49938213.0,
|
|
"step": 28785
|
|
},
|
|
{
|
|
"entropy": 5.405972719192505,
|
|
"epoch": 2.2399533164753938,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00044929950928376095,
|
|
"loss": 4.9326,
|
|
"mean_token_accuracy": 0.20035229176282882,
|
|
"num_tokens": 49946493.0,
|
|
"step": 28790
|
|
},
|
|
{
|
|
"entropy": 5.36329607963562,
|
|
"epoch": 2.2403423458471114,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004492819813869723,
|
|
"loss": 5.0013,
|
|
"mean_token_accuracy": 0.19573189169168473,
|
|
"num_tokens": 49954730.0,
|
|
"step": 28795
|
|
},
|
|
{
|
|
"entropy": 5.2990320205688475,
|
|
"epoch": 2.240731375218829,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00044926445084573206,
|
|
"loss": 4.9403,
|
|
"mean_token_accuracy": 0.20188199430704118,
|
|
"num_tokens": 49962651.0,
|
|
"step": 28800
|
|
},
|
|
{
|
|
"entropy": 5.398659324645996,
|
|
"epoch": 2.2411204045905464,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.000449246917660306,
|
|
"loss": 5.0239,
|
|
"mean_token_accuracy": 0.19019531458616257,
|
|
"num_tokens": 49972560.0,
|
|
"step": 28805
|
|
},
|
|
{
|
|
"entropy": 5.442583703994751,
|
|
"epoch": 2.241509433962264,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004492293818309604,
|
|
"loss": 5.0667,
|
|
"mean_token_accuracy": 0.19498851597309114,
|
|
"num_tokens": 49982292.0,
|
|
"step": 28810
|
|
},
|
|
{
|
|
"entropy": 5.472064638137818,
|
|
"epoch": 2.241898463333982,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004492118433579613,
|
|
"loss": 5.1435,
|
|
"mean_token_accuracy": 0.18600668460130693,
|
|
"num_tokens": 49990395.0,
|
|
"step": 28815
|
|
},
|
|
{
|
|
"entropy": 5.480933332443238,
|
|
"epoch": 2.2422874927056995,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00044919430224157463,
|
|
"loss": 5.0597,
|
|
"mean_token_accuracy": 0.19213223457336426,
|
|
"num_tokens": 49998944.0,
|
|
"step": 28820
|
|
},
|
|
{
|
|
"entropy": 5.39204216003418,
|
|
"epoch": 2.2426765220774167,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00044917675848206684,
|
|
"loss": 4.9624,
|
|
"mean_token_accuracy": 0.1958131566643715,
|
|
"num_tokens": 50007583.0,
|
|
"step": 28825
|
|
},
|
|
{
|
|
"entropy": 5.293333625793457,
|
|
"epoch": 2.2430655514491344,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.00044915921207970387,
|
|
"loss": 4.9033,
|
|
"mean_token_accuracy": 0.20214929133653642,
|
|
"num_tokens": 50015854.0,
|
|
"step": 28830
|
|
},
|
|
{
|
|
"entropy": 5.350975513458252,
|
|
"epoch": 2.243454580820852,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00044914166303475206,
|
|
"loss": 4.9209,
|
|
"mean_token_accuracy": 0.20385685414075852,
|
|
"num_tokens": 50024757.0,
|
|
"step": 28835
|
|
},
|
|
{
|
|
"entropy": 5.410600328445435,
|
|
"epoch": 2.2438436101925694,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.00044912411134747764,
|
|
"loss": 5.0109,
|
|
"mean_token_accuracy": 0.19406585842370988,
|
|
"num_tokens": 50034592.0,
|
|
"step": 28840
|
|
},
|
|
{
|
|
"entropy": 5.39328966140747,
|
|
"epoch": 2.244232639564287,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00044910655701814705,
|
|
"loss": 5.0388,
|
|
"mean_token_accuracy": 0.1890689954161644,
|
|
"num_tokens": 50043034.0,
|
|
"step": 28845
|
|
},
|
|
{
|
|
"entropy": 5.3367002487182615,
|
|
"epoch": 2.244621668936005,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004490890000470266,
|
|
"loss": 5.0172,
|
|
"mean_token_accuracy": 0.19488936364650727,
|
|
"num_tokens": 50051683.0,
|
|
"step": 28850
|
|
},
|
|
{
|
|
"entropy": 5.3876808166503904,
|
|
"epoch": 2.245010698307722,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00044907144043438265,
|
|
"loss": 5.0178,
|
|
"mean_token_accuracy": 0.18940330892801285,
|
|
"num_tokens": 50060257.0,
|
|
"step": 28855
|
|
},
|
|
{
|
|
"entropy": 5.31499137878418,
|
|
"epoch": 2.2453997276794397,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0004490538781804816,
|
|
"loss": 4.9252,
|
|
"mean_token_accuracy": 0.20039663314819336,
|
|
"num_tokens": 50068188.0,
|
|
"step": 28860
|
|
},
|
|
{
|
|
"entropy": 5.410995721817017,
|
|
"epoch": 2.2457887570511574,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00044903631328559,
|
|
"loss": 4.9779,
|
|
"mean_token_accuracy": 0.1931019201874733,
|
|
"num_tokens": 50076188.0,
|
|
"step": 28865
|
|
},
|
|
{
|
|
"entropy": 5.448713254928589,
|
|
"epoch": 2.246177786422875,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00044901874574997444,
|
|
"loss": 5.008,
|
|
"mean_token_accuracy": 0.20308829843997955,
|
|
"num_tokens": 50085139.0,
|
|
"step": 28870
|
|
},
|
|
{
|
|
"entropy": 5.488223648071289,
|
|
"epoch": 2.2465668157945924,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00044900117557390137,
|
|
"loss": 5.1204,
|
|
"mean_token_accuracy": 0.1882877990603447,
|
|
"num_tokens": 50093050.0,
|
|
"step": 28875
|
|
},
|
|
{
|
|
"entropy": 5.386711263656617,
|
|
"epoch": 2.24695584516631,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00044898360275763733,
|
|
"loss": 5.0687,
|
|
"mean_token_accuracy": 0.1938354790210724,
|
|
"num_tokens": 50101854.0,
|
|
"step": 28880
|
|
},
|
|
{
|
|
"entropy": 5.433473205566406,
|
|
"epoch": 2.247344874538028,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00044896602730144905,
|
|
"loss": 5.0933,
|
|
"mean_token_accuracy": 0.18615814447402954,
|
|
"num_tokens": 50110430.0,
|
|
"step": 28885
|
|
},
|
|
{
|
|
"entropy": 5.460976886749267,
|
|
"epoch": 2.247733903909745,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00044894844920560323,
|
|
"loss": 5.0181,
|
|
"mean_token_accuracy": 0.19567243605852128,
|
|
"num_tokens": 50118633.0,
|
|
"step": 28890
|
|
},
|
|
{
|
|
"entropy": 5.4637494564056395,
|
|
"epoch": 2.2481229332814627,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004489308684703666,
|
|
"loss": 5.093,
|
|
"mean_token_accuracy": 0.186974436044693,
|
|
"num_tokens": 50129120.0,
|
|
"step": 28895
|
|
},
|
|
{
|
|
"entropy": 5.50718502998352,
|
|
"epoch": 2.2485119626531804,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004489132850960059,
|
|
"loss": 5.0825,
|
|
"mean_token_accuracy": 0.18886901140213014,
|
|
"num_tokens": 50138404.0,
|
|
"step": 28900
|
|
},
|
|
{
|
|
"entropy": 5.43050479888916,
|
|
"epoch": 2.2489009920248977,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004488956990827878,
|
|
"loss": 5.0154,
|
|
"mean_token_accuracy": 0.18570856899023055,
|
|
"num_tokens": 50146908.0,
|
|
"step": 28905
|
|
},
|
|
{
|
|
"entropy": 5.321598863601684,
|
|
"epoch": 2.2492900213966154,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004488781104309793,
|
|
"loss": 4.9507,
|
|
"mean_token_accuracy": 0.19691694974899293,
|
|
"num_tokens": 50155922.0,
|
|
"step": 28910
|
|
},
|
|
{
|
|
"entropy": 5.402777147293091,
|
|
"epoch": 2.249679050768333,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00044886051914084726,
|
|
"loss": 5.0655,
|
|
"mean_token_accuracy": 0.19346524477005006,
|
|
"num_tokens": 50164023.0,
|
|
"step": 28915
|
|
},
|
|
{
|
|
"entropy": 5.377311515808105,
|
|
"epoch": 2.2500680801400508,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00044884292521265846,
|
|
"loss": 4.965,
|
|
"mean_token_accuracy": 0.19387730062007905,
|
|
"num_tokens": 50172147.0,
|
|
"step": 28920
|
|
},
|
|
{
|
|
"entropy": 5.380008792877197,
|
|
"epoch": 2.250457109511768,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004488253286466801,
|
|
"loss": 5.0892,
|
|
"mean_token_accuracy": 0.18070694506168367,
|
|
"num_tokens": 50180484.0,
|
|
"step": 28925
|
|
},
|
|
{
|
|
"entropy": 5.3693122386932375,
|
|
"epoch": 2.2508461388834857,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00044880772944317905,
|
|
"loss": 4.9744,
|
|
"mean_token_accuracy": 0.18953001052141188,
|
|
"num_tokens": 50189176.0,
|
|
"step": 28930
|
|
},
|
|
{
|
|
"entropy": 5.448866653442383,
|
|
"epoch": 2.2512351682552034,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00044879012760242224,
|
|
"loss": 4.9965,
|
|
"mean_token_accuracy": 0.2044367164373398,
|
|
"num_tokens": 50197674.0,
|
|
"step": 28935
|
|
},
|
|
{
|
|
"entropy": 5.463055181503296,
|
|
"epoch": 2.2516241976269207,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00044877252312467694,
|
|
"loss": 5.0725,
|
|
"mean_token_accuracy": 0.18741465955972672,
|
|
"num_tokens": 50206681.0,
|
|
"step": 28940
|
|
},
|
|
{
|
|
"entropy": 5.486759996414184,
|
|
"epoch": 2.2520132269986384,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004487549160102101,
|
|
"loss": 5.1117,
|
|
"mean_token_accuracy": 0.18628530949354172,
|
|
"num_tokens": 50215457.0,
|
|
"step": 28945
|
|
},
|
|
{
|
|
"entropy": 5.448297786712646,
|
|
"epoch": 2.252402256370356,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00044873730625928914,
|
|
"loss": 4.9911,
|
|
"mean_token_accuracy": 0.19212005585432052,
|
|
"num_tokens": 50224757.0,
|
|
"step": 28950
|
|
},
|
|
{
|
|
"entropy": 5.47625503540039,
|
|
"epoch": 2.2527912857420738,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00044871969387218094,
|
|
"loss": 5.0694,
|
|
"mean_token_accuracy": 0.19121143519878386,
|
|
"num_tokens": 50233570.0,
|
|
"step": 28955
|
|
},
|
|
{
|
|
"entropy": 5.424491024017334,
|
|
"epoch": 2.253180315113791,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.000448702078849153,
|
|
"loss": 5.0136,
|
|
"mean_token_accuracy": 0.19430207312107087,
|
|
"num_tokens": 50241767.0,
|
|
"step": 28960
|
|
},
|
|
{
|
|
"entropy": 5.334303522109986,
|
|
"epoch": 2.2535693444855087,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00044868446119047234,
|
|
"loss": 4.9705,
|
|
"mean_token_accuracy": 0.19489261656999587,
|
|
"num_tokens": 50250121.0,
|
|
"step": 28965
|
|
},
|
|
{
|
|
"entropy": 5.513517379760742,
|
|
"epoch": 2.253958373857226,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004486668408964065,
|
|
"loss": 5.1097,
|
|
"mean_token_accuracy": 0.18693292886018753,
|
|
"num_tokens": 50258717.0,
|
|
"step": 28970
|
|
},
|
|
{
|
|
"entropy": 5.443153238296508,
|
|
"epoch": 2.2543474032289437,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004486492179672228,
|
|
"loss": 5.0776,
|
|
"mean_token_accuracy": 0.19376598447561263,
|
|
"num_tokens": 50267528.0,
|
|
"step": 28975
|
|
},
|
|
{
|
|
"entropy": 5.44549593925476,
|
|
"epoch": 2.2547364326006614,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00044863159240318863,
|
|
"loss": 5.0601,
|
|
"mean_token_accuracy": 0.19213285595178603,
|
|
"num_tokens": 50276197.0,
|
|
"step": 28980
|
|
},
|
|
{
|
|
"entropy": 5.360124492645264,
|
|
"epoch": 2.255125461972379,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004486139642045714,
|
|
"loss": 4.9297,
|
|
"mean_token_accuracy": 0.20051412284374237,
|
|
"num_tokens": 50284222.0,
|
|
"step": 28985
|
|
},
|
|
{
|
|
"entropy": 5.369151592254639,
|
|
"epoch": 2.2555144913440963,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004485963333716385,
|
|
"loss": 4.9726,
|
|
"mean_token_accuracy": 0.19270563572645188,
|
|
"num_tokens": 50293061.0,
|
|
"step": 28990
|
|
},
|
|
{
|
|
"entropy": 5.377377223968506,
|
|
"epoch": 2.255903520715814,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004485786999046576,
|
|
"loss": 4.9929,
|
|
"mean_token_accuracy": 0.1975897043943405,
|
|
"num_tokens": 50301601.0,
|
|
"step": 28995
|
|
},
|
|
{
|
|
"entropy": 5.371033763885498,
|
|
"epoch": 2.2562925500875317,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00044856106380389624,
|
|
"loss": 5.0488,
|
|
"mean_token_accuracy": 0.19779658317565918,
|
|
"num_tokens": 50311595.0,
|
|
"step": 29000
|
|
},
|
|
{
|
|
"entropy": 5.3995050430297855,
|
|
"epoch": 2.256681579459249,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.000448543425069622,
|
|
"loss": 5.003,
|
|
"mean_token_accuracy": 0.1960317000746727,
|
|
"num_tokens": 50320205.0,
|
|
"step": 29005
|
|
},
|
|
{
|
|
"entropy": 5.433222532272339,
|
|
"epoch": 2.2570706088309667,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004485257837021025,
|
|
"loss": 4.9854,
|
|
"mean_token_accuracy": 0.19838855117559434,
|
|
"num_tokens": 50328414.0,
|
|
"step": 29010
|
|
},
|
|
{
|
|
"entropy": 5.380955171585083,
|
|
"epoch": 2.2574596382026844,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00044850813970160534,
|
|
"loss": 5.0232,
|
|
"mean_token_accuracy": 0.19880659133195877,
|
|
"num_tokens": 50337206.0,
|
|
"step": 29015
|
|
},
|
|
{
|
|
"entropy": 5.422238445281982,
|
|
"epoch": 2.257848667574402,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0004484904930683984,
|
|
"loss": 5.0605,
|
|
"mean_token_accuracy": 0.190559583902359,
|
|
"num_tokens": 50346320.0,
|
|
"step": 29020
|
|
},
|
|
{
|
|
"entropy": 5.425434732437134,
|
|
"epoch": 2.2582376969461193,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004484728438027494,
|
|
"loss": 5.0288,
|
|
"mean_token_accuracy": 0.19288922995328903,
|
|
"num_tokens": 50354199.0,
|
|
"step": 29025
|
|
},
|
|
{
|
|
"entropy": 5.424587249755859,
|
|
"epoch": 2.258626726317837,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0004484551919049261,
|
|
"loss": 5.0539,
|
|
"mean_token_accuracy": 0.19648435115814208,
|
|
"num_tokens": 50363085.0,
|
|
"step": 29030
|
|
},
|
|
{
|
|
"entropy": 5.403090906143189,
|
|
"epoch": 2.2590157556895547,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00044843753737519625,
|
|
"loss": 4.9963,
|
|
"mean_token_accuracy": 0.1921306371688843,
|
|
"num_tokens": 50371211.0,
|
|
"step": 29035
|
|
},
|
|
{
|
|
"entropy": 5.4104550838470455,
|
|
"epoch": 2.259404785061272,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0004484198802138279,
|
|
"loss": 4.9913,
|
|
"mean_token_accuracy": 0.1983576864004135,
|
|
"num_tokens": 50379426.0,
|
|
"step": 29040
|
|
},
|
|
{
|
|
"entropy": 5.403225088119507,
|
|
"epoch": 2.2597938144329897,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0004484022204210889,
|
|
"loss": 5.0628,
|
|
"mean_token_accuracy": 0.1954989030957222,
|
|
"num_tokens": 50388073.0,
|
|
"step": 29045
|
|
},
|
|
{
|
|
"entropy": 5.329072046279907,
|
|
"epoch": 2.2601828438047074,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00044838455799724717,
|
|
"loss": 4.9447,
|
|
"mean_token_accuracy": 0.19749689549207688,
|
|
"num_tokens": 50395943.0,
|
|
"step": 29050
|
|
},
|
|
{
|
|
"entropy": 5.393757057189942,
|
|
"epoch": 2.260571873176425,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00044836689294257075,
|
|
"loss": 5.0318,
|
|
"mean_token_accuracy": 0.19123842418193818,
|
|
"num_tokens": 50405218.0,
|
|
"step": 29055
|
|
},
|
|
{
|
|
"entropy": 5.352708578109741,
|
|
"epoch": 2.2609609025481423,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004483492252573276,
|
|
"loss": 4.9684,
|
|
"mean_token_accuracy": 0.1951957568526268,
|
|
"num_tokens": 50414169.0,
|
|
"step": 29060
|
|
},
|
|
{
|
|
"entropy": 5.423509836196899,
|
|
"epoch": 2.26134993191986,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.000448331554941786,
|
|
"loss": 5.084,
|
|
"mean_token_accuracy": 0.18814474791288377,
|
|
"num_tokens": 50422541.0,
|
|
"step": 29065
|
|
},
|
|
{
|
|
"entropy": 5.38032021522522,
|
|
"epoch": 2.2617389612915777,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00044831388199621385,
|
|
"loss": 4.9728,
|
|
"mean_token_accuracy": 0.19526656717061996,
|
|
"num_tokens": 50431081.0,
|
|
"step": 29070
|
|
},
|
|
{
|
|
"entropy": 5.406199741363525,
|
|
"epoch": 2.262127990663295,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00044829620642087946,
|
|
"loss": 5.0596,
|
|
"mean_token_accuracy": 0.19210369288921356,
|
|
"num_tokens": 50439279.0,
|
|
"step": 29075
|
|
},
|
|
{
|
|
"entropy": 5.4037707328796385,
|
|
"epoch": 2.2625170200350126,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004482785282160509,
|
|
"loss": 5.0311,
|
|
"mean_token_accuracy": 0.1905087113380432,
|
|
"num_tokens": 50447628.0,
|
|
"step": 29080
|
|
},
|
|
{
|
|
"entropy": 5.466364479064941,
|
|
"epoch": 2.2629060494067303,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00044826084738199657,
|
|
"loss": 5.0694,
|
|
"mean_token_accuracy": 0.18789685517549515,
|
|
"num_tokens": 50457109.0,
|
|
"step": 29085
|
|
},
|
|
{
|
|
"entropy": 5.4476288795471195,
|
|
"epoch": 2.2632950787784476,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00044824316391898464,
|
|
"loss": 4.9715,
|
|
"mean_token_accuracy": 0.19532388001680373,
|
|
"num_tokens": 50466222.0,
|
|
"step": 29090
|
|
},
|
|
{
|
|
"entropy": 5.401168918609619,
|
|
"epoch": 2.2636841081501653,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00044822547782728334,
|
|
"loss": 5.0055,
|
|
"mean_token_accuracy": 0.1953868016600609,
|
|
"num_tokens": 50475382.0,
|
|
"step": 29095
|
|
},
|
|
{
|
|
"entropy": 5.450822448730468,
|
|
"epoch": 2.264073137521883,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004482077891071612,
|
|
"loss": 5.0609,
|
|
"mean_token_accuracy": 0.19519524425268173,
|
|
"num_tokens": 50483501.0,
|
|
"step": 29100
|
|
},
|
|
{
|
|
"entropy": 5.410173082351685,
|
|
"epoch": 2.2644621668936002,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00044819009775888655,
|
|
"loss": 4.9939,
|
|
"mean_token_accuracy": 0.19959497898817063,
|
|
"num_tokens": 50492005.0,
|
|
"step": 29105
|
|
},
|
|
{
|
|
"entropy": 5.331663656234741,
|
|
"epoch": 2.264851196265318,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00044817240378272784,
|
|
"loss": 4.9298,
|
|
"mean_token_accuracy": 0.19936015009880065,
|
|
"num_tokens": 50500578.0,
|
|
"step": 29110
|
|
},
|
|
{
|
|
"entropy": 5.333936738967895,
|
|
"epoch": 2.2652402256370356,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00044815470717895345,
|
|
"loss": 4.9335,
|
|
"mean_token_accuracy": 0.19702517241239548,
|
|
"num_tokens": 50509285.0,
|
|
"step": 29115
|
|
},
|
|
{
|
|
"entropy": 5.311067152023315,
|
|
"epoch": 2.2656292550087533,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004481370079478321,
|
|
"loss": 4.9757,
|
|
"mean_token_accuracy": 0.19642349183559418,
|
|
"num_tokens": 50517519.0,
|
|
"step": 29120
|
|
},
|
|
{
|
|
"entropy": 5.345245885848999,
|
|
"epoch": 2.2660182843804706,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0004481193060896322,
|
|
"loss": 4.9858,
|
|
"mean_token_accuracy": 0.19470110386610032,
|
|
"num_tokens": 50525843.0,
|
|
"step": 29125
|
|
},
|
|
{
|
|
"entropy": 5.438086223602295,
|
|
"epoch": 2.2664073137521883,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004481016016046223,
|
|
"loss": 5.0776,
|
|
"mean_token_accuracy": 0.18842608481645584,
|
|
"num_tokens": 50535638.0,
|
|
"step": 29130
|
|
},
|
|
{
|
|
"entropy": 5.455880546569825,
|
|
"epoch": 2.266796343123906,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0004480838944930712,
|
|
"loss": 5.0801,
|
|
"mean_token_accuracy": 0.18753704577684402,
|
|
"num_tokens": 50544327.0,
|
|
"step": 29135
|
|
},
|
|
{
|
|
"entropy": 5.419277477264404,
|
|
"epoch": 2.2671853724956232,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004480661847552474,
|
|
"loss": 5.0247,
|
|
"mean_token_accuracy": 0.19337700307369232,
|
|
"num_tokens": 50552276.0,
|
|
"step": 29140
|
|
},
|
|
{
|
|
"entropy": 5.356444406509399,
|
|
"epoch": 2.267574401867341,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004480484723914198,
|
|
"loss": 4.945,
|
|
"mean_token_accuracy": 0.20106955170631408,
|
|
"num_tokens": 50561247.0,
|
|
"step": 29145
|
|
},
|
|
{
|
|
"entropy": 5.438007068634033,
|
|
"epoch": 2.2679634312390586,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004480307574018571,
|
|
"loss": 5.0194,
|
|
"mean_token_accuracy": 0.19230543524026872,
|
|
"num_tokens": 50569401.0,
|
|
"step": 29150
|
|
},
|
|
{
|
|
"entropy": 5.394376659393311,
|
|
"epoch": 2.2683524606107763,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.000448013039786828,
|
|
"loss": 4.9785,
|
|
"mean_token_accuracy": 0.19916591048240662,
|
|
"num_tokens": 50577346.0,
|
|
"step": 29155
|
|
},
|
|
{
|
|
"entropy": 5.35985631942749,
|
|
"epoch": 2.2687414899824936,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00044799531954660133,
|
|
"loss": 5.0073,
|
|
"mean_token_accuracy": 0.19526350647211074,
|
|
"num_tokens": 50586370.0,
|
|
"step": 29160
|
|
},
|
|
{
|
|
"entropy": 5.372613191604614,
|
|
"epoch": 2.2691305193542113,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0004479775966814461,
|
|
"loss": 4.9388,
|
|
"mean_token_accuracy": 0.19573659598827362,
|
|
"num_tokens": 50595326.0,
|
|
"step": 29165
|
|
},
|
|
{
|
|
"entropy": 5.436210870742798,
|
|
"epoch": 2.269519548725929,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00044795987119163115,
|
|
"loss": 5.041,
|
|
"mean_token_accuracy": 0.19597284942865373,
|
|
"num_tokens": 50603513.0,
|
|
"step": 29170
|
|
},
|
|
{
|
|
"entropy": 5.393761682510376,
|
|
"epoch": 2.2699085780976462,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004479421430774255,
|
|
"loss": 4.997,
|
|
"mean_token_accuracy": 0.1924804463982582,
|
|
"num_tokens": 50612416.0,
|
|
"step": 29175
|
|
},
|
|
{
|
|
"entropy": 5.391035509109497,
|
|
"epoch": 2.270297607469364,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004479244123390981,
|
|
"loss": 4.9999,
|
|
"mean_token_accuracy": 0.20514147728681564,
|
|
"num_tokens": 50620480.0,
|
|
"step": 29180
|
|
},
|
|
{
|
|
"entropy": 5.273274564743042,
|
|
"epoch": 2.2706866368410816,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.00044790667897691796,
|
|
"loss": 4.9174,
|
|
"mean_token_accuracy": 0.20355746001005173,
|
|
"num_tokens": 50629044.0,
|
|
"step": 29185
|
|
},
|
|
{
|
|
"entropy": 5.485718584060669,
|
|
"epoch": 2.271075666212799,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00044788894299115415,
|
|
"loss": 5.1236,
|
|
"mean_token_accuracy": 0.18348329067230223,
|
|
"num_tokens": 50638610.0,
|
|
"step": 29190
|
|
},
|
|
{
|
|
"entropy": 5.356621646881104,
|
|
"epoch": 2.2714646955845166,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004478712043820758,
|
|
"loss": 4.9996,
|
|
"mean_token_accuracy": 0.19027577042579652,
|
|
"num_tokens": 50647337.0,
|
|
"step": 29195
|
|
},
|
|
{
|
|
"entropy": 5.3972070693969725,
|
|
"epoch": 2.2718537249562343,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004478534631499521,
|
|
"loss": 5.0398,
|
|
"mean_token_accuracy": 0.19863011240959166,
|
|
"num_tokens": 50654641.0,
|
|
"step": 29200
|
|
},
|
|
{
|
|
"entropy": 5.351204824447632,
|
|
"epoch": 2.2722427543279515,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00044783571929505223,
|
|
"loss": 5.0612,
|
|
"mean_token_accuracy": 0.1829943209886551,
|
|
"num_tokens": 50663726.0,
|
|
"step": 29205
|
|
},
|
|
{
|
|
"entropy": 5.455354404449463,
|
|
"epoch": 2.2726317836996692,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004478179728176454,
|
|
"loss": 5.1045,
|
|
"mean_token_accuracy": 0.19573165029287337,
|
|
"num_tokens": 50672376.0,
|
|
"step": 29210
|
|
},
|
|
{
|
|
"entropy": 5.413188314437866,
|
|
"epoch": 2.273020813071387,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004478002237180009,
|
|
"loss": 5.0647,
|
|
"mean_token_accuracy": 0.1902701735496521,
|
|
"num_tokens": 50680990.0,
|
|
"step": 29215
|
|
},
|
|
{
|
|
"entropy": 5.494778203964233,
|
|
"epoch": 2.2734098424431046,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.000447782471996388,
|
|
"loss": 5.1192,
|
|
"mean_token_accuracy": 0.18420612663030625,
|
|
"num_tokens": 50690180.0,
|
|
"step": 29220
|
|
},
|
|
{
|
|
"entropy": 5.4502105712890625,
|
|
"epoch": 2.273798871814822,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004477647176530762,
|
|
"loss": 5.025,
|
|
"mean_token_accuracy": 0.19688266068696975,
|
|
"num_tokens": 50699094.0,
|
|
"step": 29225
|
|
},
|
|
{
|
|
"entropy": 5.424303674697876,
|
|
"epoch": 2.2741879011865396,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004477469606883347,
|
|
"loss": 5.0227,
|
|
"mean_token_accuracy": 0.18561350852251052,
|
|
"num_tokens": 50708312.0,
|
|
"step": 29230
|
|
},
|
|
{
|
|
"entropy": 5.34693489074707,
|
|
"epoch": 2.2745769305582573,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004477292011024331,
|
|
"loss": 4.9779,
|
|
"mean_token_accuracy": 0.20134482979774476,
|
|
"num_tokens": 50717092.0,
|
|
"step": 29235
|
|
},
|
|
{
|
|
"entropy": 5.384979248046875,
|
|
"epoch": 2.2749659599299745,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00044771143889564075,
|
|
"loss": 4.9782,
|
|
"mean_token_accuracy": 0.19886967092752456,
|
|
"num_tokens": 50725641.0,
|
|
"step": 29240
|
|
},
|
|
{
|
|
"entropy": 5.343654537200928,
|
|
"epoch": 2.275354989301692,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00044769367406822727,
|
|
"loss": 4.9866,
|
|
"mean_token_accuracy": 0.19394454807043077,
|
|
"num_tokens": 50734082.0,
|
|
"step": 29245
|
|
},
|
|
{
|
|
"entropy": 5.432721424102783,
|
|
"epoch": 2.27574401867341,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0004476759066204621,
|
|
"loss": 5.0979,
|
|
"mean_token_accuracy": 0.18387970626354216,
|
|
"num_tokens": 50743242.0,
|
|
"step": 29250
|
|
},
|
|
{
|
|
"entropy": 5.452132940292358,
|
|
"epoch": 2.2761330480451276,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004476581365526149,
|
|
"loss": 4.9638,
|
|
"mean_token_accuracy": 0.19675700068473817,
|
|
"num_tokens": 50751693.0,
|
|
"step": 29255
|
|
},
|
|
{
|
|
"entropy": 5.372200441360474,
|
|
"epoch": 2.276522077416845,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0004476403638649553,
|
|
"loss": 5.0295,
|
|
"mean_token_accuracy": 0.1893368422985077,
|
|
"num_tokens": 50760031.0,
|
|
"step": 29260
|
|
},
|
|
{
|
|
"entropy": 5.332626152038574,
|
|
"epoch": 2.2769111067885626,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00044762258855775294,
|
|
"loss": 5.0268,
|
|
"mean_token_accuracy": 0.1967645689845085,
|
|
"num_tokens": 50768236.0,
|
|
"step": 29265
|
|
},
|
|
{
|
|
"entropy": 5.4261644840240475,
|
|
"epoch": 2.2773001361602803,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00044760481063127754,
|
|
"loss": 5.0204,
|
|
"mean_token_accuracy": 0.1951639711856842,
|
|
"num_tokens": 50777055.0,
|
|
"step": 29270
|
|
},
|
|
{
|
|
"entropy": 5.3938765048980715,
|
|
"epoch": 2.2776891655319975,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.000447587030085799,
|
|
"loss": 5.0499,
|
|
"mean_token_accuracy": 0.19254744797945023,
|
|
"num_tokens": 50785574.0,
|
|
"step": 29275
|
|
},
|
|
{
|
|
"entropy": 5.360202264785767,
|
|
"epoch": 2.278078194903715,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00044756924692158684,
|
|
"loss": 5.0706,
|
|
"mean_token_accuracy": 0.19510678201913834,
|
|
"num_tokens": 50794889.0,
|
|
"step": 29280
|
|
},
|
|
{
|
|
"entropy": 5.396400737762451,
|
|
"epoch": 2.278467224275433,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004475514611389111,
|
|
"loss": 5.0715,
|
|
"mean_token_accuracy": 0.1864430218935013,
|
|
"num_tokens": 50804823.0,
|
|
"step": 29285
|
|
},
|
|
{
|
|
"entropy": 5.4496666431427006,
|
|
"epoch": 2.2788562536471506,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004475336727380415,
|
|
"loss": 4.9121,
|
|
"mean_token_accuracy": 0.20357360690832138,
|
|
"num_tokens": 50813233.0,
|
|
"step": 29290
|
|
},
|
|
{
|
|
"entropy": 5.362728071212769,
|
|
"epoch": 2.279245283018868,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004475158817192481,
|
|
"loss": 4.9997,
|
|
"mean_token_accuracy": 0.1945340856909752,
|
|
"num_tokens": 50821925.0,
|
|
"step": 29295
|
|
},
|
|
{
|
|
"entropy": 5.39490156173706,
|
|
"epoch": 2.2796343123905856,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00044749808808280077,
|
|
"loss": 5.064,
|
|
"mean_token_accuracy": 0.1936425417661667,
|
|
"num_tokens": 50831337.0,
|
|
"step": 29300
|
|
},
|
|
{
|
|
"entropy": 5.386767435073852,
|
|
"epoch": 2.280023341762303,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00044748029182896956,
|
|
"loss": 4.9968,
|
|
"mean_token_accuracy": 0.19356952756643295,
|
|
"num_tokens": 50840493.0,
|
|
"step": 29305
|
|
},
|
|
{
|
|
"entropy": 5.472566413879394,
|
|
"epoch": 2.2804123711340205,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0004474624929580243,
|
|
"loss": 5.1247,
|
|
"mean_token_accuracy": 0.188526251912117,
|
|
"num_tokens": 50848843.0,
|
|
"step": 29310
|
|
},
|
|
{
|
|
"entropy": 5.450723505020141,
|
|
"epoch": 2.280801400505738,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004474446914702354,
|
|
"loss": 5.0194,
|
|
"mean_token_accuracy": 0.1902531459927559,
|
|
"num_tokens": 50857882.0,
|
|
"step": 29315
|
|
},
|
|
{
|
|
"entropy": 5.464679193496704,
|
|
"epoch": 2.281190429877456,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004474268873658727,
|
|
"loss": 5.1591,
|
|
"mean_token_accuracy": 0.18380038291215897,
|
|
"num_tokens": 50866058.0,
|
|
"step": 29320
|
|
},
|
|
{
|
|
"entropy": 5.375986576080322,
|
|
"epoch": 2.281579459249173,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004474090806452064,
|
|
"loss": 5.04,
|
|
"mean_token_accuracy": 0.1951441138982773,
|
|
"num_tokens": 50874175.0,
|
|
"step": 29325
|
|
},
|
|
{
|
|
"entropy": 5.376010942459106,
|
|
"epoch": 2.281968488620891,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00044739127130850675,
|
|
"loss": 5.0092,
|
|
"mean_token_accuracy": 0.19152737706899642,
|
|
"num_tokens": 50883753.0,
|
|
"step": 29330
|
|
},
|
|
{
|
|
"entropy": 5.422561740875244,
|
|
"epoch": 2.2823575179926086,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00044737345935604397,
|
|
"loss": 5.071,
|
|
"mean_token_accuracy": 0.19087888896465302,
|
|
"num_tokens": 50891962.0,
|
|
"step": 29335
|
|
},
|
|
{
|
|
"entropy": 5.444908142089844,
|
|
"epoch": 2.282746547364326,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004473556447880883,
|
|
"loss": 4.9855,
|
|
"mean_token_accuracy": 0.19870771020650863,
|
|
"num_tokens": 50900405.0,
|
|
"step": 29340
|
|
},
|
|
{
|
|
"entropy": 5.386417722702026,
|
|
"epoch": 2.2831355767360435,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00044733782760490997,
|
|
"loss": 5.0744,
|
|
"mean_token_accuracy": 0.19026557803153993,
|
|
"num_tokens": 50908850.0,
|
|
"step": 29345
|
|
},
|
|
{
|
|
"entropy": 5.38972430229187,
|
|
"epoch": 2.283524606107761,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004473200078067795,
|
|
"loss": 5.1168,
|
|
"mean_token_accuracy": 0.18593920320272445,
|
|
"num_tokens": 50918545.0,
|
|
"step": 29350
|
|
},
|
|
{
|
|
"entropy": 5.426756906509399,
|
|
"epoch": 2.283913635479479,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00044730218539396717,
|
|
"loss": 5.0117,
|
|
"mean_token_accuracy": 0.20131250470876694,
|
|
"num_tokens": 50926664.0,
|
|
"step": 29355
|
|
},
|
|
{
|
|
"entropy": 5.406728315353393,
|
|
"epoch": 2.284302664851196,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004472843603667434,
|
|
"loss": 5.1045,
|
|
"mean_token_accuracy": 0.17812848538160325,
|
|
"num_tokens": 50935846.0,
|
|
"step": 29360
|
|
},
|
|
{
|
|
"entropy": 5.3945821762084964,
|
|
"epoch": 2.284691694222914,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00044726653272537866,
|
|
"loss": 5.027,
|
|
"mean_token_accuracy": 0.19640743732452393,
|
|
"num_tokens": 50944289.0,
|
|
"step": 29365
|
|
},
|
|
{
|
|
"entropy": 5.403178262710571,
|
|
"epoch": 2.2850807235946315,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004472487024701435,
|
|
"loss": 5.0252,
|
|
"mean_token_accuracy": 0.1937307521700859,
|
|
"num_tokens": 50952949.0,
|
|
"step": 29370
|
|
},
|
|
{
|
|
"entropy": 5.494167280197144,
|
|
"epoch": 2.285469752966349,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004472308696013085,
|
|
"loss": 5.1062,
|
|
"mean_token_accuracy": 0.18653718382120132,
|
|
"num_tokens": 50961957.0,
|
|
"step": 29375
|
|
},
|
|
{
|
|
"entropy": 5.470838356018066,
|
|
"epoch": 2.2858587823380665,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004472130341191441,
|
|
"loss": 5.0335,
|
|
"mean_token_accuracy": 0.19076593965291977,
|
|
"num_tokens": 50970463.0,
|
|
"step": 29380
|
|
},
|
|
{
|
|
"entropy": 5.439066219329834,
|
|
"epoch": 2.286247811709784,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004471951960239211,
|
|
"loss": 5.0406,
|
|
"mean_token_accuracy": 0.1910923272371292,
|
|
"num_tokens": 50979350.0,
|
|
"step": 29385
|
|
},
|
|
{
|
|
"entropy": 5.42767014503479,
|
|
"epoch": 2.286636841081502,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00044717735531591,
|
|
"loss": 5.0854,
|
|
"mean_token_accuracy": 0.18982186466455458,
|
|
"num_tokens": 50988048.0,
|
|
"step": 29390
|
|
},
|
|
{
|
|
"entropy": 5.42773027420044,
|
|
"epoch": 2.287025870453219,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.00044715951199538156,
|
|
"loss": 5.0419,
|
|
"mean_token_accuracy": 0.19250741302967073,
|
|
"num_tokens": 50996714.0,
|
|
"step": 29395
|
|
},
|
|
{
|
|
"entropy": 5.455298376083374,
|
|
"epoch": 2.287414899824937,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00044714166606260657,
|
|
"loss": 5.0008,
|
|
"mean_token_accuracy": 0.1947459176182747,
|
|
"num_tokens": 51005557.0,
|
|
"step": 29400
|
|
},
|
|
{
|
|
"entropy": 5.432126855850219,
|
|
"epoch": 2.2878039291966545,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0004471238175178559,
|
|
"loss": 4.9832,
|
|
"mean_token_accuracy": 0.19245392829179764,
|
|
"num_tokens": 51014024.0,
|
|
"step": 29405
|
|
},
|
|
{
|
|
"entropy": 5.30548882484436,
|
|
"epoch": 2.288192958568372,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004471059663614002,
|
|
"loss": 4.9067,
|
|
"mean_token_accuracy": 0.19526171833276748,
|
|
"num_tokens": 51022211.0,
|
|
"step": 29410
|
|
},
|
|
{
|
|
"entropy": 5.4010560512542725,
|
|
"epoch": 2.2885819879400895,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004470881125935103,
|
|
"loss": 5.1136,
|
|
"mean_token_accuracy": 0.1951492115855217,
|
|
"num_tokens": 51030459.0,
|
|
"step": 29415
|
|
},
|
|
{
|
|
"entropy": 5.471914291381836,
|
|
"epoch": 2.288971017311807,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00044707025621445735,
|
|
"loss": 5.0975,
|
|
"mean_token_accuracy": 0.1875719428062439,
|
|
"num_tokens": 51038439.0,
|
|
"step": 29420
|
|
},
|
|
{
|
|
"entropy": 5.39096097946167,
|
|
"epoch": 2.2893600466835244,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00044705239722451194,
|
|
"loss": 4.9662,
|
|
"mean_token_accuracy": 0.19921017438173294,
|
|
"num_tokens": 51047698.0,
|
|
"step": 29425
|
|
},
|
|
{
|
|
"entropy": 5.3665632724761965,
|
|
"epoch": 2.289749076055242,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00044703453562394544,
|
|
"loss": 4.9977,
|
|
"mean_token_accuracy": 0.19637516587972642,
|
|
"num_tokens": 51056211.0,
|
|
"step": 29430
|
|
},
|
|
{
|
|
"entropy": 5.410918283462524,
|
|
"epoch": 2.29013810542696,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0004470166714130286,
|
|
"loss": 5.0063,
|
|
"mean_token_accuracy": 0.19521842002868653,
|
|
"num_tokens": 51064321.0,
|
|
"step": 29435
|
|
},
|
|
{
|
|
"entropy": 5.441994476318359,
|
|
"epoch": 2.290527134798677,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00044699880459203264,
|
|
"loss": 5.003,
|
|
"mean_token_accuracy": 0.19385396242141723,
|
|
"num_tokens": 51072537.0,
|
|
"step": 29440
|
|
},
|
|
{
|
|
"entropy": 5.39630618095398,
|
|
"epoch": 2.290916164170395,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00044698093516122844,
|
|
"loss": 4.9927,
|
|
"mean_token_accuracy": 0.19747344404459,
|
|
"num_tokens": 51080873.0,
|
|
"step": 29445
|
|
},
|
|
{
|
|
"entropy": 5.369301128387451,
|
|
"epoch": 2.2913051935421125,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004469630631208874,
|
|
"loss": 5.0886,
|
|
"mean_token_accuracy": 0.19065219014883042,
|
|
"num_tokens": 51089462.0,
|
|
"step": 29450
|
|
},
|
|
{
|
|
"entropy": 5.385624980926513,
|
|
"epoch": 2.29169422291383,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004469451884712805,
|
|
"loss": 5.0327,
|
|
"mean_token_accuracy": 0.18896263241767883,
|
|
"num_tokens": 51098918.0,
|
|
"step": 29455
|
|
},
|
|
{
|
|
"entropy": 5.449255800247192,
|
|
"epoch": 2.2920832522855474,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004469273112126791,
|
|
"loss": 5.1105,
|
|
"mean_token_accuracy": 0.19002699851989746,
|
|
"num_tokens": 51107483.0,
|
|
"step": 29460
|
|
},
|
|
{
|
|
"entropy": 5.487997007369995,
|
|
"epoch": 2.292472281657265,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00044690943134535445,
|
|
"loss": 5.0909,
|
|
"mean_token_accuracy": 0.1889622449874878,
|
|
"num_tokens": 51116590.0,
|
|
"step": 29465
|
|
},
|
|
{
|
|
"entropy": 5.328696870803833,
|
|
"epoch": 2.292861311028983,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004468915488695777,
|
|
"loss": 4.9198,
|
|
"mean_token_accuracy": 0.2001431718468666,
|
|
"num_tokens": 51125296.0,
|
|
"step": 29470
|
|
},
|
|
{
|
|
"entropy": 5.36249098777771,
|
|
"epoch": 2.2932503404007,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00044687366378562036,
|
|
"loss": 5.0008,
|
|
"mean_token_accuracy": 0.1929762288928032,
|
|
"num_tokens": 51133369.0,
|
|
"step": 29475
|
|
},
|
|
{
|
|
"entropy": 5.540782785415649,
|
|
"epoch": 2.293639369772418,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00044685577609375373,
|
|
"loss": 5.1683,
|
|
"mean_token_accuracy": 0.1924312487244606,
|
|
"num_tokens": 51142789.0,
|
|
"step": 29480
|
|
},
|
|
{
|
|
"entropy": 5.441058111190796,
|
|
"epoch": 2.2940283991441355,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0004468378857942492,
|
|
"loss": 5.0176,
|
|
"mean_token_accuracy": 0.18828053772449493,
|
|
"num_tokens": 51151706.0,
|
|
"step": 29485
|
|
},
|
|
{
|
|
"entropy": 5.4564813613891605,
|
|
"epoch": 2.294417428515853,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00044681999288737826,
|
|
"loss": 5.0734,
|
|
"mean_token_accuracy": 0.1930876851081848,
|
|
"num_tokens": 51160924.0,
|
|
"step": 29490
|
|
},
|
|
{
|
|
"entropy": 5.439203310012817,
|
|
"epoch": 2.2948064578875704,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.00044680209737341244,
|
|
"loss": 5.0785,
|
|
"mean_token_accuracy": 0.18928737938404083,
|
|
"num_tokens": 51168871.0,
|
|
"step": 29495
|
|
},
|
|
{
|
|
"entropy": 5.352751636505127,
|
|
"epoch": 2.295195487259288,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004467841992526233,
|
|
"loss": 4.9757,
|
|
"mean_token_accuracy": 0.19594309329986573,
|
|
"num_tokens": 51177621.0,
|
|
"step": 29500
|
|
},
|
|
{
|
|
"entropy": 5.406075572967529,
|
|
"epoch": 2.295584516631006,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00044676629852528226,
|
|
"loss": 4.9563,
|
|
"mean_token_accuracy": 0.19968607276678085,
|
|
"num_tokens": 51186004.0,
|
|
"step": 29505
|
|
},
|
|
{
|
|
"entropy": 5.378000545501709,
|
|
"epoch": 2.295973546002723,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00044674839519166104,
|
|
"loss": 4.9619,
|
|
"mean_token_accuracy": 0.19854554384946824,
|
|
"num_tokens": 51194609.0,
|
|
"step": 29510
|
|
},
|
|
{
|
|
"entropy": 5.421860599517823,
|
|
"epoch": 2.2963625753744408,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00044673048925203136,
|
|
"loss": 5.0938,
|
|
"mean_token_accuracy": 0.19634728282690048,
|
|
"num_tokens": 51203928.0,
|
|
"step": 29515
|
|
},
|
|
{
|
|
"entropy": 5.393498086929322,
|
|
"epoch": 2.2967516047461585,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00044671258070666476,
|
|
"loss": 5.0079,
|
|
"mean_token_accuracy": 0.1956377625465393,
|
|
"num_tokens": 51212762.0,
|
|
"step": 29520
|
|
},
|
|
{
|
|
"entropy": 5.462045955657959,
|
|
"epoch": 2.2971406341178757,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004466946695558331,
|
|
"loss": 5.1198,
|
|
"mean_token_accuracy": 0.1844208538532257,
|
|
"num_tokens": 51221064.0,
|
|
"step": 29525
|
|
},
|
|
{
|
|
"entropy": 5.377310466766358,
|
|
"epoch": 2.2975296634895934,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00044667675579980817,
|
|
"loss": 5.0026,
|
|
"mean_token_accuracy": 0.19178557246923447,
|
|
"num_tokens": 51229633.0,
|
|
"step": 29530
|
|
},
|
|
{
|
|
"entropy": 5.42229905128479,
|
|
"epoch": 2.297918692861311,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0004466588394388616,
|
|
"loss": 5.069,
|
|
"mean_token_accuracy": 0.19170313328504562,
|
|
"num_tokens": 51239051.0,
|
|
"step": 29535
|
|
},
|
|
{
|
|
"entropy": 5.425269842147827,
|
|
"epoch": 2.2983077222330284,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004466409204732654,
|
|
"loss": 5.0089,
|
|
"mean_token_accuracy": 0.19264118522405624,
|
|
"num_tokens": 51247703.0,
|
|
"step": 29540
|
|
},
|
|
{
|
|
"entropy": 5.4040679931640625,
|
|
"epoch": 2.298696751604746,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00044662299890329144,
|
|
"loss": 4.9502,
|
|
"mean_token_accuracy": 0.20201728194952012,
|
|
"num_tokens": 51256394.0,
|
|
"step": 29545
|
|
},
|
|
{
|
|
"entropy": 5.415617609024048,
|
|
"epoch": 2.2990857809764638,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004466050747292116,
|
|
"loss": 5.041,
|
|
"mean_token_accuracy": 0.19226809740066528,
|
|
"num_tokens": 51264181.0,
|
|
"step": 29550
|
|
},
|
|
{
|
|
"entropy": 5.348475122451783,
|
|
"epoch": 2.2994748103481815,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.000446587147951298,
|
|
"loss": 4.9511,
|
|
"mean_token_accuracy": 0.1978834643959999,
|
|
"num_tokens": 51272758.0,
|
|
"step": 29555
|
|
},
|
|
{
|
|
"entropy": 5.437347507476806,
|
|
"epoch": 2.2998638397198987,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0004465692185698224,
|
|
"loss": 5.0605,
|
|
"mean_token_accuracy": 0.1903357043862343,
|
|
"num_tokens": 51281681.0,
|
|
"step": 29560
|
|
},
|
|
{
|
|
"entropy": 5.413667011260986,
|
|
"epoch": 2.3002528690916164,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00044655128658505717,
|
|
"loss": 5.0461,
|
|
"mean_token_accuracy": 0.19575890600681306,
|
|
"num_tokens": 51290060.0,
|
|
"step": 29565
|
|
},
|
|
{
|
|
"entropy": 5.426086330413819,
|
|
"epoch": 2.300641898463334,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004465333519972741,
|
|
"loss": 4.9673,
|
|
"mean_token_accuracy": 0.194631427526474,
|
|
"num_tokens": 51298262.0,
|
|
"step": 29570
|
|
},
|
|
{
|
|
"entropy": 5.3567338466644285,
|
|
"epoch": 2.3010309278350514,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004465154148067454,
|
|
"loss": 4.9032,
|
|
"mean_token_accuracy": 0.20273461788892747,
|
|
"num_tokens": 51306436.0,
|
|
"step": 29575
|
|
},
|
|
{
|
|
"entropy": 5.34570345878601,
|
|
"epoch": 2.301419957206769,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00044649747501374336,
|
|
"loss": 4.9881,
|
|
"mean_token_accuracy": 0.18986021131277084,
|
|
"num_tokens": 51315132.0,
|
|
"step": 29580
|
|
},
|
|
{
|
|
"entropy": 5.338670492172241,
|
|
"epoch": 2.3018089865784868,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004464795326185401,
|
|
"loss": 4.9616,
|
|
"mean_token_accuracy": 0.1970387652516365,
|
|
"num_tokens": 51324189.0,
|
|
"step": 29585
|
|
},
|
|
{
|
|
"entropy": 5.346889781951904,
|
|
"epoch": 2.3021980159502045,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004464615876214078,
|
|
"loss": 4.9711,
|
|
"mean_token_accuracy": 0.1992281898856163,
|
|
"num_tokens": 51332680.0,
|
|
"step": 29590
|
|
},
|
|
{
|
|
"entropy": 5.444274473190307,
|
|
"epoch": 2.3025870453219217,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004464436400226188,
|
|
"loss": 5.0522,
|
|
"mean_token_accuracy": 0.1943073570728302,
|
|
"num_tokens": 51342036.0,
|
|
"step": 29595
|
|
},
|
|
{
|
|
"entropy": 5.377940940856933,
|
|
"epoch": 2.3029760746936394,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004464256898224455,
|
|
"loss": 4.9877,
|
|
"mean_token_accuracy": 0.18870593458414078,
|
|
"num_tokens": 51350987.0,
|
|
"step": 29600
|
|
},
|
|
{
|
|
"entropy": 5.399097204208374,
|
|
"epoch": 2.303365104065357,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004464077370211602,
|
|
"loss": 4.9922,
|
|
"mean_token_accuracy": 0.19698799401521683,
|
|
"num_tokens": 51359787.0,
|
|
"step": 29605
|
|
},
|
|
{
|
|
"entropy": 5.390316295623779,
|
|
"epoch": 2.3037541334370744,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.00044638978161903533,
|
|
"loss": 5.0862,
|
|
"mean_token_accuracy": 0.1884043887257576,
|
|
"num_tokens": 51368329.0,
|
|
"step": 29610
|
|
},
|
|
{
|
|
"entropy": 5.4342413425445555,
|
|
"epoch": 2.304143162808792,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004463718236163433,
|
|
"loss": 5.0807,
|
|
"mean_token_accuracy": 0.18552881777286528,
|
|
"num_tokens": 51377104.0,
|
|
"step": 29615
|
|
},
|
|
{
|
|
"entropy": 5.426706266403198,
|
|
"epoch": 2.3045321921805098,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.00044635386301335666,
|
|
"loss": 5.0765,
|
|
"mean_token_accuracy": 0.19031668603420257,
|
|
"num_tokens": 51385210.0,
|
|
"step": 29620
|
|
},
|
|
{
|
|
"entropy": 5.4167670726776125,
|
|
"epoch": 2.304921221552227,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0004463358998103478,
|
|
"loss": 5.031,
|
|
"mean_token_accuracy": 0.18849214315414428,
|
|
"num_tokens": 51393492.0,
|
|
"step": 29625
|
|
},
|
|
{
|
|
"entropy": 5.329414129257202,
|
|
"epoch": 2.3053102509239447,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004463179340075894,
|
|
"loss": 4.8805,
|
|
"mean_token_accuracy": 0.2047551766037941,
|
|
"num_tokens": 51401953.0,
|
|
"step": 29630
|
|
},
|
|
{
|
|
"entropy": 5.3827299118042,
|
|
"epoch": 2.3056992802956624,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004462999656053541,
|
|
"loss": 5.0844,
|
|
"mean_token_accuracy": 0.19132220298051833,
|
|
"num_tokens": 51410874.0,
|
|
"step": 29635
|
|
},
|
|
{
|
|
"entropy": 5.401923179626465,
|
|
"epoch": 2.3060883096673797,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00044628199460391445,
|
|
"loss": 4.9496,
|
|
"mean_token_accuracy": 0.2004828780889511,
|
|
"num_tokens": 51419189.0,
|
|
"step": 29640
|
|
},
|
|
{
|
|
"entropy": 5.435768938064575,
|
|
"epoch": 2.3064773390390974,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00044626402100354307,
|
|
"loss": 5.0361,
|
|
"mean_token_accuracy": 0.1945285201072693,
|
|
"num_tokens": 51427970.0,
|
|
"step": 29645
|
|
},
|
|
{
|
|
"entropy": 5.446695137023926,
|
|
"epoch": 2.306866368410815,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004462460448045129,
|
|
"loss": 5.0341,
|
|
"mean_token_accuracy": 0.19012540578842163,
|
|
"num_tokens": 51436069.0,
|
|
"step": 29650
|
|
},
|
|
{
|
|
"entropy": 5.402632761001587,
|
|
"epoch": 2.3072553977825327,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00044622806600709645,
|
|
"loss": 5.0482,
|
|
"mean_token_accuracy": 0.19313860535621644,
|
|
"num_tokens": 51444424.0,
|
|
"step": 29655
|
|
},
|
|
{
|
|
"entropy": 5.399807453155518,
|
|
"epoch": 2.30764442715425,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0004462100846115667,
|
|
"loss": 5.0239,
|
|
"mean_token_accuracy": 0.19515331983566284,
|
|
"num_tokens": 51453095.0,
|
|
"step": 29660
|
|
},
|
|
{
|
|
"entropy": 5.4320969581604,
|
|
"epoch": 2.3080334565259677,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004461921006181964,
|
|
"loss": 4.9814,
|
|
"mean_token_accuracy": 0.1966902196407318,
|
|
"num_tokens": 51461525.0,
|
|
"step": 29665
|
|
},
|
|
{
|
|
"entropy": 5.393899583816529,
|
|
"epoch": 2.3084224858976854,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0004461741140272584,
|
|
"loss": 4.9728,
|
|
"mean_token_accuracy": 0.19807831346988677,
|
|
"num_tokens": 51469918.0,
|
|
"step": 29670
|
|
},
|
|
{
|
|
"entropy": 5.39286060333252,
|
|
"epoch": 2.3088115152694026,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004461561248390257,
|
|
"loss": 5.0788,
|
|
"mean_token_accuracy": 0.19683972597122193,
|
|
"num_tokens": 51478747.0,
|
|
"step": 29675
|
|
},
|
|
{
|
|
"entropy": 5.3901220798492435,
|
|
"epoch": 2.3092005446411203,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004461381330537713,
|
|
"loss": 5.041,
|
|
"mean_token_accuracy": 0.18595386445522308,
|
|
"num_tokens": 51487730.0,
|
|
"step": 29680
|
|
},
|
|
{
|
|
"entropy": 5.437414026260376,
|
|
"epoch": 2.309589574012838,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.000446120138671768,
|
|
"loss": 5.0058,
|
|
"mean_token_accuracy": 0.19734702557325362,
|
|
"num_tokens": 51495672.0,
|
|
"step": 29685
|
|
},
|
|
{
|
|
"entropy": 5.452589225769043,
|
|
"epoch": 2.3099786033845557,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.00044610214169328913,
|
|
"loss": 4.9938,
|
|
"mean_token_accuracy": 0.19299622476100922,
|
|
"num_tokens": 51503377.0,
|
|
"step": 29690
|
|
},
|
|
{
|
|
"entropy": 5.314637470245361,
|
|
"epoch": 2.310367632756273,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004460841421186075,
|
|
"loss": 4.9581,
|
|
"mean_token_accuracy": 0.20031320303678513,
|
|
"num_tokens": 51511932.0,
|
|
"step": 29695
|
|
},
|
|
{
|
|
"entropy": 5.436145353317261,
|
|
"epoch": 2.3107566621279907,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004460661399479963,
|
|
"loss": 5.0428,
|
|
"mean_token_accuracy": 0.18969437181949617,
|
|
"num_tokens": 51520565.0,
|
|
"step": 29700
|
|
},
|
|
{
|
|
"entropy": 5.381060409545898,
|
|
"epoch": 2.3111456914997084,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00044604813518172876,
|
|
"loss": 4.9336,
|
|
"mean_token_accuracy": 0.19723676294088363,
|
|
"num_tokens": 51529778.0,
|
|
"step": 29705
|
|
},
|
|
{
|
|
"entropy": 5.4216564178466795,
|
|
"epoch": 2.3115347208714256,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00044603012782007796,
|
|
"loss": 5.0664,
|
|
"mean_token_accuracy": 0.19430797547101974,
|
|
"num_tokens": 51539394.0,
|
|
"step": 29710
|
|
},
|
|
{
|
|
"entropy": 5.389931869506836,
|
|
"epoch": 2.3119237502431433,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004460121178633172,
|
|
"loss": 4.9781,
|
|
"mean_token_accuracy": 0.19556443989276887,
|
|
"num_tokens": 51548314.0,
|
|
"step": 29715
|
|
},
|
|
{
|
|
"entropy": 5.314131259918213,
|
|
"epoch": 2.312312779614861,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.00044599410531171986,
|
|
"loss": 4.9069,
|
|
"mean_token_accuracy": 0.20719375908374787,
|
|
"num_tokens": 51556828.0,
|
|
"step": 29720
|
|
},
|
|
{
|
|
"entropy": 5.385971450805664,
|
|
"epoch": 2.3127018089865787,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.000445976090165559,
|
|
"loss": 5.0453,
|
|
"mean_token_accuracy": 0.1930396780371666,
|
|
"num_tokens": 51565031.0,
|
|
"step": 29725
|
|
},
|
|
{
|
|
"entropy": 5.494488286972046,
|
|
"epoch": 2.313090838358296,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004459580724251082,
|
|
"loss": 5.1455,
|
|
"mean_token_accuracy": 0.18493392765522004,
|
|
"num_tokens": 51574218.0,
|
|
"step": 29730
|
|
},
|
|
{
|
|
"entropy": 5.373050832748413,
|
|
"epoch": 2.3134798677300137,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.00044594005209064064,
|
|
"loss": 5.0041,
|
|
"mean_token_accuracy": 0.19608528763055802,
|
|
"num_tokens": 51583229.0,
|
|
"step": 29735
|
|
},
|
|
{
|
|
"entropy": 5.369667482376099,
|
|
"epoch": 2.313868897101731,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00044592202916243003,
|
|
"loss": 4.9738,
|
|
"mean_token_accuracy": 0.19279537945985795,
|
|
"num_tokens": 51591969.0,
|
|
"step": 29740
|
|
},
|
|
{
|
|
"entropy": 5.44868311882019,
|
|
"epoch": 2.3142579264734486,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004459040036407495,
|
|
"loss": 5.0166,
|
|
"mean_token_accuracy": 0.19021652787923812,
|
|
"num_tokens": 51600840.0,
|
|
"step": 29745
|
|
},
|
|
{
|
|
"entropy": 5.318496131896973,
|
|
"epoch": 2.3146469558451663,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0004458859755258729,
|
|
"loss": 4.8465,
|
|
"mean_token_accuracy": 0.20776220858097078,
|
|
"num_tokens": 51608750.0,
|
|
"step": 29750
|
|
},
|
|
{
|
|
"entropy": 5.3829797267913815,
|
|
"epoch": 2.315035985216884,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.00044586794481807357,
|
|
"loss": 5.0503,
|
|
"mean_token_accuracy": 0.19519027024507524,
|
|
"num_tokens": 51617079.0,
|
|
"step": 29755
|
|
},
|
|
{
|
|
"entropy": 5.36235408782959,
|
|
"epoch": 2.3154250145886013,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00044584991151762506,
|
|
"loss": 5.0122,
|
|
"mean_token_accuracy": 0.19658900797367096,
|
|
"num_tokens": 51625310.0,
|
|
"step": 29760
|
|
},
|
|
{
|
|
"entropy": 5.4265709400177,
|
|
"epoch": 2.315814043960319,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004458318756248011,
|
|
"loss": 5.008,
|
|
"mean_token_accuracy": 0.190154267847538,
|
|
"num_tokens": 51634071.0,
|
|
"step": 29765
|
|
},
|
|
{
|
|
"entropy": 5.402804327011109,
|
|
"epoch": 2.3162030733320367,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00044581383713987547,
|
|
"loss": 4.9778,
|
|
"mean_token_accuracy": 0.1948614701628685,
|
|
"num_tokens": 51642761.0,
|
|
"step": 29770
|
|
},
|
|
{
|
|
"entropy": 5.388738918304443,
|
|
"epoch": 2.316592102703754,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004457957960631216,
|
|
"loss": 4.9862,
|
|
"mean_token_accuracy": 0.1998862400650978,
|
|
"num_tokens": 51652160.0,
|
|
"step": 29775
|
|
},
|
|
{
|
|
"entropy": 5.3109557151794435,
|
|
"epoch": 2.3169811320754716,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004457777523948134,
|
|
"loss": 4.951,
|
|
"mean_token_accuracy": 0.1967950403690338,
|
|
"num_tokens": 51661345.0,
|
|
"step": 29780
|
|
},
|
|
{
|
|
"entropy": 5.3921033382415775,
|
|
"epoch": 2.3173701614471893,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004457597061352247,
|
|
"loss": 5.0005,
|
|
"mean_token_accuracy": 0.2004665181040764,
|
|
"num_tokens": 51669855.0,
|
|
"step": 29785
|
|
},
|
|
{
|
|
"entropy": 5.454489612579346,
|
|
"epoch": 2.317759190818907,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004457416572846291,
|
|
"loss": 5.1162,
|
|
"mean_token_accuracy": 0.1926496684551239,
|
|
"num_tokens": 51679272.0,
|
|
"step": 29790
|
|
},
|
|
{
|
|
"entropy": 5.418266248703003,
|
|
"epoch": 2.3181482201906243,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004457236058433008,
|
|
"loss": 5.019,
|
|
"mean_token_accuracy": 0.18848942071199418,
|
|
"num_tokens": 51688383.0,
|
|
"step": 29795
|
|
},
|
|
{
|
|
"entropy": 5.443320417404175,
|
|
"epoch": 2.318537249562342,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00044570555181151333,
|
|
"loss": 5.0502,
|
|
"mean_token_accuracy": 0.19525537341833116,
|
|
"num_tokens": 51696996.0,
|
|
"step": 29800
|
|
},
|
|
{
|
|
"entropy": 5.333801174163819,
|
|
"epoch": 2.3189262789340597,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.000445687495189541,
|
|
"loss": 5.069,
|
|
"mean_token_accuracy": 0.19109150767326355,
|
|
"num_tokens": 51705830.0,
|
|
"step": 29805
|
|
},
|
|
{
|
|
"entropy": 5.420248556137085,
|
|
"epoch": 2.319315308305777,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00044566943597765745,
|
|
"loss": 4.9968,
|
|
"mean_token_accuracy": 0.19402042627334595,
|
|
"num_tokens": 51715357.0,
|
|
"step": 29810
|
|
},
|
|
{
|
|
"entropy": 5.4275881290435795,
|
|
"epoch": 2.3197043376774946,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00044565137417613694,
|
|
"loss": 5.0616,
|
|
"mean_token_accuracy": 0.1973115846514702,
|
|
"num_tokens": 51725342.0,
|
|
"step": 29815
|
|
},
|
|
{
|
|
"entropy": 5.451069641113281,
|
|
"epoch": 2.3200933670492123,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004456333097852534,
|
|
"loss": 5.0129,
|
|
"mean_token_accuracy": 0.19398652464151384,
|
|
"num_tokens": 51733788.0,
|
|
"step": 29820
|
|
},
|
|
{
|
|
"entropy": 5.419092988967895,
|
|
"epoch": 2.32048239642093,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00044561524280528104,
|
|
"loss": 5.0575,
|
|
"mean_token_accuracy": 0.19708173274993895,
|
|
"num_tokens": 51742713.0,
|
|
"step": 29825
|
|
},
|
|
{
|
|
"entropy": 5.482743978500366,
|
|
"epoch": 2.3208714257926473,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00044559717323649383,
|
|
"loss": 5.1347,
|
|
"mean_token_accuracy": 0.1921016290783882,
|
|
"num_tokens": 51751482.0,
|
|
"step": 29830
|
|
},
|
|
{
|
|
"entropy": 5.351164388656616,
|
|
"epoch": 2.321260455164365,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004455791010791662,
|
|
"loss": 4.8876,
|
|
"mean_token_accuracy": 0.20511779338121414,
|
|
"num_tokens": 51760217.0,
|
|
"step": 29835
|
|
},
|
|
{
|
|
"entropy": 5.38601541519165,
|
|
"epoch": 2.3216494845360827,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004455610263335721,
|
|
"loss": 5.0382,
|
|
"mean_token_accuracy": 0.1862327814102173,
|
|
"num_tokens": 51767945.0,
|
|
"step": 29840
|
|
},
|
|
{
|
|
"entropy": 5.381389522552491,
|
|
"epoch": 2.3220385139078,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004455429489999859,
|
|
"loss": 5.0705,
|
|
"mean_token_accuracy": 0.18623176962137222,
|
|
"num_tokens": 51777318.0,
|
|
"step": 29845
|
|
},
|
|
{
|
|
"entropy": 5.407787799835205,
|
|
"epoch": 2.3224275432795176,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00044552486907868194,
|
|
"loss": 5.0123,
|
|
"mean_token_accuracy": 0.19180071502923965,
|
|
"num_tokens": 51786571.0,
|
|
"step": 29850
|
|
},
|
|
{
|
|
"entropy": 5.522048664093018,
|
|
"epoch": 2.3228165726512353,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00044550678656993454,
|
|
"loss": 5.0913,
|
|
"mean_token_accuracy": 0.19304397255182265,
|
|
"num_tokens": 51794872.0,
|
|
"step": 29855
|
|
},
|
|
{
|
|
"entropy": 5.454934978485108,
|
|
"epoch": 2.3232056020229526,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.000445488701474018,
|
|
"loss": 5.0534,
|
|
"mean_token_accuracy": 0.18867406398057937,
|
|
"num_tokens": 51803111.0,
|
|
"step": 29860
|
|
},
|
|
{
|
|
"entropy": 5.33352952003479,
|
|
"epoch": 2.3235946313946703,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0004454706137912067,
|
|
"loss": 4.9355,
|
|
"mean_token_accuracy": 0.20143842250108718,
|
|
"num_tokens": 51811574.0,
|
|
"step": 29865
|
|
},
|
|
{
|
|
"entropy": 5.3391612529754635,
|
|
"epoch": 2.323983660766388,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004454525235217753,
|
|
"loss": 4.9191,
|
|
"mean_token_accuracy": 0.19525717049837113,
|
|
"num_tokens": 51820120.0,
|
|
"step": 29870
|
|
},
|
|
{
|
|
"entropy": 5.425647926330567,
|
|
"epoch": 2.324372690138105,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00044543443066599807,
|
|
"loss": 5.1128,
|
|
"mean_token_accuracy": 0.1909673109650612,
|
|
"num_tokens": 51828293.0,
|
|
"step": 29875
|
|
},
|
|
{
|
|
"entropy": 5.418616390228271,
|
|
"epoch": 2.324761719509823,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004454163352241498,
|
|
"loss": 4.9703,
|
|
"mean_token_accuracy": 0.18912673890590667,
|
|
"num_tokens": 51836595.0,
|
|
"step": 29880
|
|
},
|
|
{
|
|
"entropy": 5.4308970928192135,
|
|
"epoch": 2.3251507488815406,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00044539823719650463,
|
|
"loss": 5.0756,
|
|
"mean_token_accuracy": 0.1870182514190674,
|
|
"num_tokens": 51845415.0,
|
|
"step": 29885
|
|
},
|
|
{
|
|
"entropy": 5.421315097808838,
|
|
"epoch": 2.3255397782532583,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004453801365833376,
|
|
"loss": 5.0182,
|
|
"mean_token_accuracy": 0.19176635444164275,
|
|
"num_tokens": 51854091.0,
|
|
"step": 29890
|
|
},
|
|
{
|
|
"entropy": 5.3781249046325685,
|
|
"epoch": 2.3259288076249756,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00044536203338492317,
|
|
"loss": 5.0048,
|
|
"mean_token_accuracy": 0.2007279470562935,
|
|
"num_tokens": 51862767.0,
|
|
"step": 29895
|
|
},
|
|
{
|
|
"entropy": 5.3524072647094725,
|
|
"epoch": 2.3263178369966933,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00044534392760153596,
|
|
"loss": 4.901,
|
|
"mean_token_accuracy": 0.20232968479394914,
|
|
"num_tokens": 51871593.0,
|
|
"step": 29900
|
|
},
|
|
{
|
|
"entropy": 5.409956789016723,
|
|
"epoch": 2.326706866368411,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004453258192334508,
|
|
"loss": 5.0316,
|
|
"mean_token_accuracy": 0.19366694688796998,
|
|
"num_tokens": 51880775.0,
|
|
"step": 29905
|
|
},
|
|
{
|
|
"entropy": 5.3567369937896725,
|
|
"epoch": 2.327095895740128,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004453077082809425,
|
|
"loss": 5.0176,
|
|
"mean_token_accuracy": 0.19089481085538865,
|
|
"num_tokens": 51889663.0,
|
|
"step": 29910
|
|
},
|
|
{
|
|
"entropy": 5.421521329879761,
|
|
"epoch": 2.327484925111846,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00044528959474428575,
|
|
"loss": 5.053,
|
|
"mean_token_accuracy": 0.19303103983402253,
|
|
"num_tokens": 51898565.0,
|
|
"step": 29915
|
|
},
|
|
{
|
|
"entropy": 5.40078067779541,
|
|
"epoch": 2.3278739544835636,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004452714786237555,
|
|
"loss": 5.0121,
|
|
"mean_token_accuracy": 0.19658200740814208,
|
|
"num_tokens": 51906828.0,
|
|
"step": 29920
|
|
},
|
|
{
|
|
"entropy": 5.346303129196167,
|
|
"epoch": 2.3282629838552813,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004452533599196265,
|
|
"loss": 4.9537,
|
|
"mean_token_accuracy": 0.19605199992656708,
|
|
"num_tokens": 51914305.0,
|
|
"step": 29925
|
|
},
|
|
{
|
|
"entropy": 5.405530881881714,
|
|
"epoch": 2.3286520132269986,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00044523523863217374,
|
|
"loss": 5.0531,
|
|
"mean_token_accuracy": 0.19550808519124985,
|
|
"num_tokens": 51923544.0,
|
|
"step": 29930
|
|
},
|
|
{
|
|
"entropy": 5.408782863616944,
|
|
"epoch": 2.3290410425987162,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004452171147616723,
|
|
"loss": 4.9925,
|
|
"mean_token_accuracy": 0.19663666188716888,
|
|
"num_tokens": 51932198.0,
|
|
"step": 29935
|
|
},
|
|
{
|
|
"entropy": 5.299583053588867,
|
|
"epoch": 2.329430071970434,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.000445198988308397,
|
|
"loss": 4.942,
|
|
"mean_token_accuracy": 0.20136999487876892,
|
|
"num_tokens": 51940291.0,
|
|
"step": 29940
|
|
},
|
|
{
|
|
"entropy": 5.299046993255615,
|
|
"epoch": 2.329819101342151,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00044518085927262293,
|
|
"loss": 4.8959,
|
|
"mean_token_accuracy": 0.2035728305578232,
|
|
"num_tokens": 51948899.0,
|
|
"step": 29945
|
|
},
|
|
{
|
|
"entropy": 5.3596902847290036,
|
|
"epoch": 2.330208130713869,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004451627276546252,
|
|
"loss": 4.9552,
|
|
"mean_token_accuracy": 0.19617270976305007,
|
|
"num_tokens": 51957726.0,
|
|
"step": 29950
|
|
},
|
|
{
|
|
"entropy": 5.417377519607544,
|
|
"epoch": 2.3305971600855866,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.000445144593454679,
|
|
"loss": 4.9863,
|
|
"mean_token_accuracy": 0.2010478749871254,
|
|
"num_tokens": 51965922.0,
|
|
"step": 29955
|
|
},
|
|
{
|
|
"entropy": 5.385968971252441,
|
|
"epoch": 2.330986189457304,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0004451264566730593,
|
|
"loss": 4.9415,
|
|
"mean_token_accuracy": 0.1963234305381775,
|
|
"num_tokens": 51974096.0,
|
|
"step": 29960
|
|
},
|
|
{
|
|
"entropy": 5.3744340419769285,
|
|
"epoch": 2.3313752188290215,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00044510831731004146,
|
|
"loss": 5.0126,
|
|
"mean_token_accuracy": 0.18748579621315004,
|
|
"num_tokens": 51982954.0,
|
|
"step": 29965
|
|
},
|
|
{
|
|
"entropy": 5.354373979568481,
|
|
"epoch": 2.3317642482007392,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004450901753659007,
|
|
"loss": 4.9843,
|
|
"mean_token_accuracy": 0.200490240752697,
|
|
"num_tokens": 51991738.0,
|
|
"step": 29970
|
|
},
|
|
{
|
|
"entropy": 5.388850498199463,
|
|
"epoch": 2.3321532775724565,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00044507203084091215,
|
|
"loss": 4.9768,
|
|
"mean_token_accuracy": 0.19275224208831787,
|
|
"num_tokens": 52000227.0,
|
|
"step": 29975
|
|
},
|
|
{
|
|
"entropy": 5.456930446624756,
|
|
"epoch": 2.332542306944174,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004450538837353513,
|
|
"loss": 5.1237,
|
|
"mean_token_accuracy": 0.18070202320814133,
|
|
"num_tokens": 52009336.0,
|
|
"step": 29980
|
|
},
|
|
{
|
|
"entropy": 5.372079181671142,
|
|
"epoch": 2.332931336315892,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00044503573404949343,
|
|
"loss": 5.0403,
|
|
"mean_token_accuracy": 0.19498705267906188,
|
|
"num_tokens": 52017850.0,
|
|
"step": 29985
|
|
},
|
|
{
|
|
"entropy": 5.424704456329346,
|
|
"epoch": 2.3333203656876096,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004450175817836139,
|
|
"loss": 5.0404,
|
|
"mean_token_accuracy": 0.19173584431409835,
|
|
"num_tokens": 52027672.0,
|
|
"step": 29990
|
|
},
|
|
{
|
|
"entropy": 5.425837564468384,
|
|
"epoch": 2.333709395059327,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00044499942693798823,
|
|
"loss": 5.039,
|
|
"mean_token_accuracy": 0.18783184438943862,
|
|
"num_tokens": 52036134.0,
|
|
"step": 29995
|
|
},
|
|
{
|
|
"entropy": 5.361058187484741,
|
|
"epoch": 2.3340984244310445,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004449812695128918,
|
|
"loss": 5.0259,
|
|
"mean_token_accuracy": 0.19410353004932404,
|
|
"num_tokens": 52044719.0,
|
|
"step": 30000
|
|
},
|
|
{
|
|
"epoch": 2.3340984244310445,
|
|
"eval_entropy": 5.223434420246936,
|
|
"eval_loss": 5.145181655883789,
|
|
"eval_mean_token_accuracy": 0.19766220122833913,
|
|
"eval_num_tokens": 52044719.0,
|
|
"eval_runtime": 28.4379,
|
|
"eval_samples_per_second": 1461.359,
|
|
"eval_steps_per_second": 182.679,
|
|
"step": 30000
|
|
},
|
|
{
|
|
"entropy": 5.418763303756714,
|
|
"epoch": 2.3344874538027622,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00044496310950860015,
|
|
"loss": 5.0636,
|
|
"mean_token_accuracy": 0.18894778341054916,
|
|
"num_tokens": 52053238.0,
|
|
"step": 30005
|
|
},
|
|
{
|
|
"entropy": 5.481644821166992,
|
|
"epoch": 2.3348764831744795,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00044494494692538886,
|
|
"loss": 5.1047,
|
|
"mean_token_accuracy": 0.1908062294125557,
|
|
"num_tokens": 52062258.0,
|
|
"step": 30010
|
|
},
|
|
{
|
|
"entropy": 5.459772682189941,
|
|
"epoch": 2.335265512546197,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00044492678176353347,
|
|
"loss": 5.0621,
|
|
"mean_token_accuracy": 0.1861102133989334,
|
|
"num_tokens": 52070527.0,
|
|
"step": 30015
|
|
},
|
|
{
|
|
"entropy": 5.4163800239562985,
|
|
"epoch": 2.335654541917915,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00044490861402330967,
|
|
"loss": 5.1004,
|
|
"mean_token_accuracy": 0.19243659675121308,
|
|
"num_tokens": 52079827.0,
|
|
"step": 30020
|
|
},
|
|
{
|
|
"entropy": 5.408106184005737,
|
|
"epoch": 2.3360435712896326,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004448904437049931,
|
|
"loss": 5.0286,
|
|
"mean_token_accuracy": 0.19900045692920684,
|
|
"num_tokens": 52088963.0,
|
|
"step": 30025
|
|
},
|
|
{
|
|
"entropy": 5.405945062637329,
|
|
"epoch": 2.33643260066135,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004448722708088594,
|
|
"loss": 4.9875,
|
|
"mean_token_accuracy": 0.19641234427690507,
|
|
"num_tokens": 52096885.0,
|
|
"step": 30030
|
|
},
|
|
{
|
|
"entropy": 5.454981136322021,
|
|
"epoch": 2.3368216300330675,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004448540953351844,
|
|
"loss": 5.0097,
|
|
"mean_token_accuracy": 0.1949462205171585,
|
|
"num_tokens": 52105530.0,
|
|
"step": 30035
|
|
},
|
|
{
|
|
"entropy": 5.305704069137573,
|
|
"epoch": 2.3372106594047852,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004448359172842439,
|
|
"loss": 4.9372,
|
|
"mean_token_accuracy": 0.20406438410282135,
|
|
"num_tokens": 52114233.0,
|
|
"step": 30040
|
|
},
|
|
{
|
|
"entropy": 5.417793560028076,
|
|
"epoch": 2.3375996887765025,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00044481773665631355,
|
|
"loss": 5.0381,
|
|
"mean_token_accuracy": 0.19169072210788726,
|
|
"num_tokens": 52123561.0,
|
|
"step": 30045
|
|
},
|
|
{
|
|
"entropy": 5.364863681793213,
|
|
"epoch": 2.33798871814822,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0004447995534516695,
|
|
"loss": 4.9345,
|
|
"mean_token_accuracy": 0.2017069175839424,
|
|
"num_tokens": 52132329.0,
|
|
"step": 30050
|
|
},
|
|
{
|
|
"entropy": 5.381529998779297,
|
|
"epoch": 2.338377747519938,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00044478136767058733,
|
|
"loss": 5.0111,
|
|
"mean_token_accuracy": 0.19679865688085557,
|
|
"num_tokens": 52141019.0,
|
|
"step": 30055
|
|
},
|
|
{
|
|
"entropy": 5.377155923843384,
|
|
"epoch": 2.338766776891655,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004447631793133432,
|
|
"loss": 5.075,
|
|
"mean_token_accuracy": 0.19437997937202453,
|
|
"num_tokens": 52149865.0,
|
|
"step": 30060
|
|
},
|
|
{
|
|
"entropy": 5.446461963653564,
|
|
"epoch": 2.339155806263373,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004447449883802131,
|
|
"loss": 5.0489,
|
|
"mean_token_accuracy": 0.1927816554903984,
|
|
"num_tokens": 52158991.0,
|
|
"step": 30065
|
|
},
|
|
{
|
|
"entropy": 5.309474754333496,
|
|
"epoch": 2.3395448356350905,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00044472679487147295,
|
|
"loss": 4.9343,
|
|
"mean_token_accuracy": 0.20084628313779831,
|
|
"num_tokens": 52167141.0,
|
|
"step": 30070
|
|
},
|
|
{
|
|
"entropy": 5.3660133361816404,
|
|
"epoch": 2.339933865006808,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.00044470859878739877,
|
|
"loss": 4.9692,
|
|
"mean_token_accuracy": 0.19755050539970398,
|
|
"num_tokens": 52175483.0,
|
|
"step": 30075
|
|
},
|
|
{
|
|
"entropy": 5.461671781539917,
|
|
"epoch": 2.3403228943785255,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00044469040012826676,
|
|
"loss": 4.9636,
|
|
"mean_token_accuracy": 0.19719404131174087,
|
|
"num_tokens": 52184290.0,
|
|
"step": 30080
|
|
},
|
|
{
|
|
"entropy": 5.393988513946534,
|
|
"epoch": 2.340711923750243,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00044467219889435304,
|
|
"loss": 4.9402,
|
|
"mean_token_accuracy": 0.19660028368234633,
|
|
"num_tokens": 52193747.0,
|
|
"step": 30085
|
|
},
|
|
{
|
|
"entropy": 5.324088048934937,
|
|
"epoch": 2.341100953121961,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0004446539950859337,
|
|
"loss": 5.0441,
|
|
"mean_token_accuracy": 0.193026565015316,
|
|
"num_tokens": 52202744.0,
|
|
"step": 30090
|
|
},
|
|
{
|
|
"entropy": 5.376123237609863,
|
|
"epoch": 2.341489982493678,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00044463578870328506,
|
|
"loss": 4.9934,
|
|
"mean_token_accuracy": 0.19938113391399384,
|
|
"num_tokens": 52211257.0,
|
|
"step": 30095
|
|
},
|
|
{
|
|
"entropy": 5.451220941543579,
|
|
"epoch": 2.341879011865396,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0004446175797466834,
|
|
"loss": 5.0201,
|
|
"mean_token_accuracy": 0.19250795394182205,
|
|
"num_tokens": 52219797.0,
|
|
"step": 30100
|
|
},
|
|
{
|
|
"entropy": 5.477438974380493,
|
|
"epoch": 2.3422680412371135,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00044459936821640485,
|
|
"loss": 5.1172,
|
|
"mean_token_accuracy": 0.18738680332899094,
|
|
"num_tokens": 52228157.0,
|
|
"step": 30105
|
|
},
|
|
{
|
|
"entropy": 5.402554368972778,
|
|
"epoch": 2.3426570706088308,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.0004445811541127258,
|
|
"loss": 5.0539,
|
|
"mean_token_accuracy": 0.19839270114898683,
|
|
"num_tokens": 52237136.0,
|
|
"step": 30110
|
|
},
|
|
{
|
|
"entropy": 5.407093620300293,
|
|
"epoch": 2.3430460999805485,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00044456293743592274,
|
|
"loss": 5.035,
|
|
"mean_token_accuracy": 0.19214742183685302,
|
|
"num_tokens": 52245966.0,
|
|
"step": 30115
|
|
},
|
|
{
|
|
"entropy": 5.41645073890686,
|
|
"epoch": 2.343435129352266,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00044454471818627196,
|
|
"loss": 5.0305,
|
|
"mean_token_accuracy": 0.18672140836715698,
|
|
"num_tokens": 52254782.0,
|
|
"step": 30120
|
|
},
|
|
{
|
|
"entropy": 5.469600343704224,
|
|
"epoch": 2.343824158723984,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00044452649636404995,
|
|
"loss": 5.0948,
|
|
"mean_token_accuracy": 0.18767904490232468,
|
|
"num_tokens": 52264132.0,
|
|
"step": 30125
|
|
},
|
|
{
|
|
"entropy": 5.3829512119293215,
|
|
"epoch": 2.344213188095701,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004445082719695332,
|
|
"loss": 4.9228,
|
|
"mean_token_accuracy": 0.2010898321866989,
|
|
"num_tokens": 52272763.0,
|
|
"step": 30130
|
|
},
|
|
{
|
|
"entropy": 5.460457897186279,
|
|
"epoch": 2.344602217467419,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00044449004500299815,
|
|
"loss": 5.0924,
|
|
"mean_token_accuracy": 0.18683323115110398,
|
|
"num_tokens": 52281505.0,
|
|
"step": 30135
|
|
},
|
|
{
|
|
"entropy": 5.365544605255127,
|
|
"epoch": 2.3449912468391365,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00044447181546472146,
|
|
"loss": 4.9057,
|
|
"mean_token_accuracy": 0.20397514402866362,
|
|
"num_tokens": 52289559.0,
|
|
"step": 30140
|
|
},
|
|
{
|
|
"entropy": 5.3468909740448,
|
|
"epoch": 2.3453802762108538,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00044445358335497975,
|
|
"loss": 5.0061,
|
|
"mean_token_accuracy": 0.19992850869894027,
|
|
"num_tokens": 52298318.0,
|
|
"step": 30145
|
|
},
|
|
{
|
|
"entropy": 5.330973529815674,
|
|
"epoch": 2.3457693055825715,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0004444353486740496,
|
|
"loss": 4.9804,
|
|
"mean_token_accuracy": 0.1970817968249321,
|
|
"num_tokens": 52307908.0,
|
|
"step": 30150
|
|
},
|
|
{
|
|
"entropy": 5.433225917816162,
|
|
"epoch": 2.346158334954289,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004444171114222078,
|
|
"loss": 5.0111,
|
|
"mean_token_accuracy": 0.20118941813707353,
|
|
"num_tokens": 52315879.0,
|
|
"step": 30155
|
|
},
|
|
{
|
|
"entropy": 5.357790851593018,
|
|
"epoch": 2.346547364326007,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00044439887159973096,
|
|
"loss": 5.0233,
|
|
"mean_token_accuracy": 0.1917622447013855,
|
|
"num_tokens": 52324747.0,
|
|
"step": 30160
|
|
},
|
|
{
|
|
"entropy": 5.4173808097839355,
|
|
"epoch": 2.346936393697724,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004443806292068958,
|
|
"loss": 5.0143,
|
|
"mean_token_accuracy": 0.19427144527435303,
|
|
"num_tokens": 52333655.0,
|
|
"step": 30165
|
|
},
|
|
{
|
|
"entropy": 5.332532691955566,
|
|
"epoch": 2.347325423069442,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004443623842439792,
|
|
"loss": 5.021,
|
|
"mean_token_accuracy": 0.19633896350860597,
|
|
"num_tokens": 52342111.0,
|
|
"step": 30170
|
|
},
|
|
{
|
|
"entropy": 5.399201250076294,
|
|
"epoch": 2.347714452441159,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.000444344136711258,
|
|
"loss": 4.9931,
|
|
"mean_token_accuracy": 0.20263464450836183,
|
|
"num_tokens": 52351390.0,
|
|
"step": 30175
|
|
},
|
|
{
|
|
"entropy": 5.437429189682007,
|
|
"epoch": 2.3481034818128768,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.00044432588660900905,
|
|
"loss": 5.0557,
|
|
"mean_token_accuracy": 0.19430024027824402,
|
|
"num_tokens": 52361602.0,
|
|
"step": 30180
|
|
},
|
|
{
|
|
"entropy": 5.42653489112854,
|
|
"epoch": 2.3484925111845945,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004443076339375093,
|
|
"loss": 5.0413,
|
|
"mean_token_accuracy": 0.19979116320610046,
|
|
"num_tokens": 52370304.0,
|
|
"step": 30185
|
|
},
|
|
{
|
|
"entropy": 5.362420225143433,
|
|
"epoch": 2.348881540556312,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00044428937869703575,
|
|
"loss": 4.8704,
|
|
"mean_token_accuracy": 0.2043123260140419,
|
|
"num_tokens": 52378437.0,
|
|
"step": 30190
|
|
},
|
|
{
|
|
"entropy": 5.382938432693481,
|
|
"epoch": 2.3492705699280294,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00044427112088786525,
|
|
"loss": 4.9961,
|
|
"mean_token_accuracy": 0.20046598166227342,
|
|
"num_tokens": 52388413.0,
|
|
"step": 30195
|
|
},
|
|
{
|
|
"entropy": 5.317371845245361,
|
|
"epoch": 2.349659599299747,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004442528605102749,
|
|
"loss": 4.9562,
|
|
"mean_token_accuracy": 0.19907163977622985,
|
|
"num_tokens": 52396296.0,
|
|
"step": 30200
|
|
},
|
|
{
|
|
"entropy": 5.369873809814453,
|
|
"epoch": 2.350048628671465,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004442345975645418,
|
|
"loss": 4.949,
|
|
"mean_token_accuracy": 0.20131107419729233,
|
|
"num_tokens": 52403967.0,
|
|
"step": 30205
|
|
},
|
|
{
|
|
"entropy": 5.343939685821534,
|
|
"epoch": 2.350437658043182,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004442163320509431,
|
|
"loss": 5.0186,
|
|
"mean_token_accuracy": 0.2009178638458252,
|
|
"num_tokens": 52413107.0,
|
|
"step": 30210
|
|
},
|
|
{
|
|
"entropy": 5.417715120315552,
|
|
"epoch": 2.3508266874148998,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004441980639697558,
|
|
"loss": 4.9635,
|
|
"mean_token_accuracy": 0.20185658037662507,
|
|
"num_tokens": 52421029.0,
|
|
"step": 30215
|
|
},
|
|
{
|
|
"entropy": 5.419812536239624,
|
|
"epoch": 2.3512157167866174,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004441797933212573,
|
|
"loss": 5.0525,
|
|
"mean_token_accuracy": 0.1926191881299019,
|
|
"num_tokens": 52430538.0,
|
|
"step": 30220
|
|
},
|
|
{
|
|
"entropy": 5.46271162033081,
|
|
"epoch": 2.351604746158335,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004441615201057247,
|
|
"loss": 5.0719,
|
|
"mean_token_accuracy": 0.18606946766376495,
|
|
"num_tokens": 52440013.0,
|
|
"step": 30225
|
|
},
|
|
{
|
|
"entropy": 5.463526391983033,
|
|
"epoch": 2.3519937755300524,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0004441432443234352,
|
|
"loss": 5.177,
|
|
"mean_token_accuracy": 0.18553993552923204,
|
|
"num_tokens": 52449034.0,
|
|
"step": 30230
|
|
},
|
|
{
|
|
"entropy": 5.446694469451904,
|
|
"epoch": 2.35238280490177,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.00044412496597466626,
|
|
"loss": 5.0922,
|
|
"mean_token_accuracy": 0.1896051675081253,
|
|
"num_tokens": 52457649.0,
|
|
"step": 30235
|
|
},
|
|
{
|
|
"entropy": 5.372512006759644,
|
|
"epoch": 2.352771834273488,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004441066850596951,
|
|
"loss": 4.9345,
|
|
"mean_token_accuracy": 0.1983540713787079,
|
|
"num_tokens": 52465861.0,
|
|
"step": 30240
|
|
},
|
|
{
|
|
"entropy": 5.454167222976684,
|
|
"epoch": 2.353160863645205,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004440884015787992,
|
|
"loss": 5.08,
|
|
"mean_token_accuracy": 0.1928747296333313,
|
|
"num_tokens": 52474630.0,
|
|
"step": 30245
|
|
},
|
|
{
|
|
"entropy": 5.406492519378662,
|
|
"epoch": 2.3535498930169227,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004440701155322558,
|
|
"loss": 5.1189,
|
|
"mean_token_accuracy": 0.18899615854024887,
|
|
"num_tokens": 52482759.0,
|
|
"step": 30250
|
|
},
|
|
{
|
|
"entropy": 5.425615930557251,
|
|
"epoch": 2.3539389223886404,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004440518269203427,
|
|
"loss": 5.1409,
|
|
"mean_token_accuracy": 0.17812509685754777,
|
|
"num_tokens": 52491839.0,
|
|
"step": 30255
|
|
},
|
|
{
|
|
"entropy": 5.3976709842681885,
|
|
"epoch": 2.354327951760358,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00044403353574333715,
|
|
"loss": 4.941,
|
|
"mean_token_accuracy": 0.1986740544438362,
|
|
"num_tokens": 52500688.0,
|
|
"step": 30260
|
|
},
|
|
{
|
|
"entropy": 5.372706317901612,
|
|
"epoch": 2.3547169811320754,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00044401524200151667,
|
|
"loss": 5.0465,
|
|
"mean_token_accuracy": 0.19133081138134003,
|
|
"num_tokens": 52509031.0,
|
|
"step": 30265
|
|
},
|
|
{
|
|
"entropy": 5.403821086883545,
|
|
"epoch": 2.355106010503793,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00044399694569515895,
|
|
"loss": 4.9993,
|
|
"mean_token_accuracy": 0.19440345764160155,
|
|
"num_tokens": 52518337.0,
|
|
"step": 30270
|
|
},
|
|
{
|
|
"entropy": 5.419117879867554,
|
|
"epoch": 2.355495039875511,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00044397864682454156,
|
|
"loss": 5.002,
|
|
"mean_token_accuracy": 0.19769097715616227,
|
|
"num_tokens": 52527257.0,
|
|
"step": 30275
|
|
},
|
|
{
|
|
"entropy": 5.442627000808716,
|
|
"epoch": 2.355884069247228,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004439603453899421,
|
|
"loss": 5.0831,
|
|
"mean_token_accuracy": 0.19051087349653245,
|
|
"num_tokens": 52536999.0,
|
|
"step": 30280
|
|
},
|
|
{
|
|
"entropy": 5.426263904571533,
|
|
"epoch": 2.3562730986189457,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004439420413916384,
|
|
"loss": 5.0755,
|
|
"mean_token_accuracy": 0.18667403161525725,
|
|
"num_tokens": 52545975.0,
|
|
"step": 30285
|
|
},
|
|
{
|
|
"entropy": 5.433545207977295,
|
|
"epoch": 2.3566621279906634,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00044392373482990817,
|
|
"loss": 5.0295,
|
|
"mean_token_accuracy": 0.19322957545518876,
|
|
"num_tokens": 52554667.0,
|
|
"step": 30290
|
|
},
|
|
{
|
|
"entropy": 5.377437448501587,
|
|
"epoch": 2.3570511573623807,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004439054257050291,
|
|
"loss": 5.0235,
|
|
"mean_token_accuracy": 0.19814396798610687,
|
|
"num_tokens": 52563469.0,
|
|
"step": 30295
|
|
},
|
|
{
|
|
"entropy": 5.318478345870972,
|
|
"epoch": 2.3574401867340984,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004438871140172789,
|
|
"loss": 4.941,
|
|
"mean_token_accuracy": 0.19989730417728424,
|
|
"num_tokens": 52572038.0,
|
|
"step": 30300
|
|
},
|
|
{
|
|
"entropy": 5.414776706695557,
|
|
"epoch": 2.357829216105816,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0004438687997669357,
|
|
"loss": 5.0312,
|
|
"mean_token_accuracy": 0.18493329733610153,
|
|
"num_tokens": 52579642.0,
|
|
"step": 30305
|
|
},
|
|
{
|
|
"entropy": 5.404068470001221,
|
|
"epoch": 2.3582182454775333,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00044385048295427724,
|
|
"loss": 4.9548,
|
|
"mean_token_accuracy": 0.1987263187766075,
|
|
"num_tokens": 52587425.0,
|
|
"step": 30310
|
|
},
|
|
{
|
|
"entropy": 5.34434666633606,
|
|
"epoch": 2.358607274849251,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0004438321635795814,
|
|
"loss": 4.9856,
|
|
"mean_token_accuracy": 0.19478428959846497,
|
|
"num_tokens": 52596560.0,
|
|
"step": 30315
|
|
},
|
|
{
|
|
"entropy": 5.449916791915894,
|
|
"epoch": 2.3589963042209687,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004438138416431262,
|
|
"loss": 5.0993,
|
|
"mean_token_accuracy": 0.1977837160229683,
|
|
"num_tokens": 52604977.0,
|
|
"step": 30320
|
|
},
|
|
{
|
|
"entropy": 5.417195272445679,
|
|
"epoch": 2.3593853335926864,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00044379551714518966,
|
|
"loss": 5.0394,
|
|
"mean_token_accuracy": 0.19160117357969284,
|
|
"num_tokens": 52614069.0,
|
|
"step": 30325
|
|
},
|
|
{
|
|
"entropy": 5.400463342666626,
|
|
"epoch": 2.3597743629644037,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.00044377719008604984,
|
|
"loss": 5.0383,
|
|
"mean_token_accuracy": 0.19558971822261811,
|
|
"num_tokens": 52623065.0,
|
|
"step": 30330
|
|
},
|
|
{
|
|
"entropy": 5.405236625671387,
|
|
"epoch": 2.3601633923361214,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004437588604659848,
|
|
"loss": 5.0701,
|
|
"mean_token_accuracy": 0.19237641841173173,
|
|
"num_tokens": 52632422.0,
|
|
"step": 30335
|
|
},
|
|
{
|
|
"entropy": 5.438364791870117,
|
|
"epoch": 2.360552421707839,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004437405282852726,
|
|
"loss": 5.1185,
|
|
"mean_token_accuracy": 0.1851376324892044,
|
|
"num_tokens": 52641358.0,
|
|
"step": 30340
|
|
},
|
|
{
|
|
"entropy": 5.390559959411621,
|
|
"epoch": 2.3609414510795563,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00044372219354419154,
|
|
"loss": 4.9803,
|
|
"mean_token_accuracy": 0.1964762791991234,
|
|
"num_tokens": 52650011.0,
|
|
"step": 30345
|
|
},
|
|
{
|
|
"entropy": 5.443810510635376,
|
|
"epoch": 2.361330480451274,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0004437038562430197,
|
|
"loss": 5.08,
|
|
"mean_token_accuracy": 0.191288498044014,
|
|
"num_tokens": 52658111.0,
|
|
"step": 30350
|
|
},
|
|
{
|
|
"entropy": 5.400187969207764,
|
|
"epoch": 2.3617195098229917,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00044368551638203536,
|
|
"loss": 4.9227,
|
|
"mean_token_accuracy": 0.20466605871915816,
|
|
"num_tokens": 52666181.0,
|
|
"step": 30355
|
|
},
|
|
{
|
|
"entropy": 5.355642318725586,
|
|
"epoch": 2.3621085391947094,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004436671739615168,
|
|
"loss": 5.0433,
|
|
"mean_token_accuracy": 0.1919921025633812,
|
|
"num_tokens": 52675218.0,
|
|
"step": 30360
|
|
},
|
|
{
|
|
"entropy": 5.396150350570679,
|
|
"epoch": 2.3624975685664267,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00044364882898174235,
|
|
"loss": 5.1009,
|
|
"mean_token_accuracy": 0.18912100195884704,
|
|
"num_tokens": 52684254.0,
|
|
"step": 30365
|
|
},
|
|
{
|
|
"entropy": 5.451118040084839,
|
|
"epoch": 2.3628865979381444,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004436304814429903,
|
|
"loss": 5.0242,
|
|
"mean_token_accuracy": 0.19635079652071,
|
|
"num_tokens": 52693106.0,
|
|
"step": 30370
|
|
},
|
|
{
|
|
"entropy": 5.457514429092408,
|
|
"epoch": 2.363275627309862,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004436121313455391,
|
|
"loss": 5.0513,
|
|
"mean_token_accuracy": 0.19093235284090043,
|
|
"num_tokens": 52702260.0,
|
|
"step": 30375
|
|
},
|
|
{
|
|
"entropy": 5.428046417236328,
|
|
"epoch": 2.3636646566815793,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0004435937786896673,
|
|
"loss": 5.0177,
|
|
"mean_token_accuracy": 0.19687827676534653,
|
|
"num_tokens": 52710546.0,
|
|
"step": 30380
|
|
},
|
|
{
|
|
"entropy": 5.32040638923645,
|
|
"epoch": 2.364053686053297,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00044357542347565323,
|
|
"loss": 5.004,
|
|
"mean_token_accuracy": 0.19385386854410172,
|
|
"num_tokens": 52719197.0,
|
|
"step": 30385
|
|
},
|
|
{
|
|
"entropy": 5.492500591278076,
|
|
"epoch": 2.3644427154250147,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0004435570657037753,
|
|
"loss": 5.1669,
|
|
"mean_token_accuracy": 0.18803020417690278,
|
|
"num_tokens": 52728242.0,
|
|
"step": 30390
|
|
},
|
|
{
|
|
"entropy": 5.3879159450531,
|
|
"epoch": 2.364831744796732,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004435387053743123,
|
|
"loss": 4.9261,
|
|
"mean_token_accuracy": 0.1988093748688698,
|
|
"num_tokens": 52736943.0,
|
|
"step": 30395
|
|
},
|
|
{
|
|
"entropy": 5.293087911605835,
|
|
"epoch": 2.3652207741684497,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00044352034248754265,
|
|
"loss": 4.9911,
|
|
"mean_token_accuracy": 0.195296074450016,
|
|
"num_tokens": 52744893.0,
|
|
"step": 30400
|
|
},
|
|
{
|
|
"entropy": 5.297296237945557,
|
|
"epoch": 2.3656098035401674,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.000443501977043745,
|
|
"loss": 4.8891,
|
|
"mean_token_accuracy": 0.20134067684412002,
|
|
"num_tokens": 52753492.0,
|
|
"step": 30405
|
|
},
|
|
{
|
|
"entropy": 5.3555761814117435,
|
|
"epoch": 2.3659988329118846,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004434836090431981,
|
|
"loss": 5.0171,
|
|
"mean_token_accuracy": 0.1914955899119377,
|
|
"num_tokens": 52762598.0,
|
|
"step": 30410
|
|
},
|
|
{
|
|
"entropy": 5.344616270065307,
|
|
"epoch": 2.3663878622836023,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004434652384861806,
|
|
"loss": 5.0386,
|
|
"mean_token_accuracy": 0.19631507694721223,
|
|
"num_tokens": 52770942.0,
|
|
"step": 30415
|
|
},
|
|
{
|
|
"entropy": 5.398829126358033,
|
|
"epoch": 2.36677689165532,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004434468653729712,
|
|
"loss": 5.0011,
|
|
"mean_token_accuracy": 0.19565207809209822,
|
|
"num_tokens": 52779237.0,
|
|
"step": 30420
|
|
},
|
|
{
|
|
"entropy": 5.431178569793701,
|
|
"epoch": 2.3671659210270377,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00044342848970384876,
|
|
"loss": 5.0726,
|
|
"mean_token_accuracy": 0.1891084909439087,
|
|
"num_tokens": 52787721.0,
|
|
"step": 30425
|
|
},
|
|
{
|
|
"entropy": 5.4733438968658445,
|
|
"epoch": 2.367554950398755,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00044341011147909206,
|
|
"loss": 5.012,
|
|
"mean_token_accuracy": 0.18991246819496155,
|
|
"num_tokens": 52795765.0,
|
|
"step": 30430
|
|
},
|
|
{
|
|
"entropy": 5.35176043510437,
|
|
"epoch": 2.3679439797704727,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00044339173069897996,
|
|
"loss": 4.9492,
|
|
"mean_token_accuracy": 0.20344800055027007,
|
|
"num_tokens": 52804104.0,
|
|
"step": 30435
|
|
},
|
|
{
|
|
"entropy": 5.280908489227295,
|
|
"epoch": 2.3683330091421904,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00044337334736379143,
|
|
"loss": 4.9404,
|
|
"mean_token_accuracy": 0.2006893053650856,
|
|
"num_tokens": 52812817.0,
|
|
"step": 30440
|
|
},
|
|
{
|
|
"entropy": 5.395576286315918,
|
|
"epoch": 2.3687220385139076,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0004433549614738053,
|
|
"loss": 4.989,
|
|
"mean_token_accuracy": 0.19184469878673555,
|
|
"num_tokens": 52821924.0,
|
|
"step": 30445
|
|
},
|
|
{
|
|
"entropy": 5.416038846969604,
|
|
"epoch": 2.3691110678856253,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00044333657302930056,
|
|
"loss": 4.971,
|
|
"mean_token_accuracy": 0.19782205075025558,
|
|
"num_tokens": 52830943.0,
|
|
"step": 30450
|
|
},
|
|
{
|
|
"entropy": 5.368327903747558,
|
|
"epoch": 2.369500097257343,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004433181820305564,
|
|
"loss": 5.0825,
|
|
"mean_token_accuracy": 0.193613862991333,
|
|
"num_tokens": 52839697.0,
|
|
"step": 30455
|
|
},
|
|
{
|
|
"entropy": 5.405035161972046,
|
|
"epoch": 2.3698891266290607,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00044329978847785156,
|
|
"loss": 5.0472,
|
|
"mean_token_accuracy": 0.19381865561008454,
|
|
"num_tokens": 52848713.0,
|
|
"step": 30460
|
|
},
|
|
{
|
|
"entropy": 5.485594654083252,
|
|
"epoch": 2.370278156000778,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004432813923714654,
|
|
"loss": 5.1064,
|
|
"mean_token_accuracy": 0.18633773773908616,
|
|
"num_tokens": 52856852.0,
|
|
"step": 30465
|
|
},
|
|
{
|
|
"entropy": 5.332221221923828,
|
|
"epoch": 2.3706671853724957,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.00044326299371167695,
|
|
"loss": 4.9418,
|
|
"mean_token_accuracy": 0.19961559325456618,
|
|
"num_tokens": 52865235.0,
|
|
"step": 30470
|
|
},
|
|
{
|
|
"entropy": 5.345868301391602,
|
|
"epoch": 2.3710562147442134,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00044324459249876536,
|
|
"loss": 4.9639,
|
|
"mean_token_accuracy": 0.1942094936966896,
|
|
"num_tokens": 52873454.0,
|
|
"step": 30475
|
|
},
|
|
{
|
|
"entropy": 5.363625144958496,
|
|
"epoch": 2.3714452441159306,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004432261887330099,
|
|
"loss": 4.9931,
|
|
"mean_token_accuracy": 0.2030204102396965,
|
|
"num_tokens": 52882551.0,
|
|
"step": 30480
|
|
},
|
|
{
|
|
"entropy": 5.4559978485107425,
|
|
"epoch": 2.3718342734876483,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004432077824146898,
|
|
"loss": 5.0656,
|
|
"mean_token_accuracy": 0.19294535219669343,
|
|
"num_tokens": 52891145.0,
|
|
"step": 30485
|
|
},
|
|
{
|
|
"entropy": 5.404257535934448,
|
|
"epoch": 2.372223302859366,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004431893735440843,
|
|
"loss": 5.0038,
|
|
"mean_token_accuracy": 0.1868406742811203,
|
|
"num_tokens": 52899486.0,
|
|
"step": 30490
|
|
},
|
|
{
|
|
"entropy": 5.36927981376648,
|
|
"epoch": 2.3726123322310833,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004431709621214727,
|
|
"loss": 5.004,
|
|
"mean_token_accuracy": 0.19514624327421187,
|
|
"num_tokens": 52907896.0,
|
|
"step": 30495
|
|
},
|
|
{
|
|
"entropy": 5.3995888233184814,
|
|
"epoch": 2.373001361602801,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00044315254814713455,
|
|
"loss": 5.0056,
|
|
"mean_token_accuracy": 0.1963059514760971,
|
|
"num_tokens": 52916489.0,
|
|
"step": 30500
|
|
},
|
|
{
|
|
"entropy": 5.426941919326782,
|
|
"epoch": 2.3733903909745186,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00044313413162134894,
|
|
"loss": 5.0322,
|
|
"mean_token_accuracy": 0.18984858989715575,
|
|
"num_tokens": 52924559.0,
|
|
"step": 30505
|
|
},
|
|
{
|
|
"entropy": 5.412492561340332,
|
|
"epoch": 2.373779420346236,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004431157125443958,
|
|
"loss": 5.0591,
|
|
"mean_token_accuracy": 0.19584806114435196,
|
|
"num_tokens": 52934064.0,
|
|
"step": 30510
|
|
},
|
|
{
|
|
"entropy": 5.433523941040039,
|
|
"epoch": 2.3741684497179536,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.000443097290916554,
|
|
"loss": 5.0317,
|
|
"mean_token_accuracy": 0.19418727308511735,
|
|
"num_tokens": 52943283.0,
|
|
"step": 30515
|
|
},
|
|
{
|
|
"entropy": 5.33743953704834,
|
|
"epoch": 2.3745574790896713,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004430788667381035,
|
|
"loss": 4.9027,
|
|
"mean_token_accuracy": 0.19801723659038545,
|
|
"num_tokens": 52951694.0,
|
|
"step": 30520
|
|
},
|
|
{
|
|
"entropy": 5.354623556137085,
|
|
"epoch": 2.374946508461389,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00044306044000932374,
|
|
"loss": 5.0239,
|
|
"mean_token_accuracy": 0.1904174119234085,
|
|
"num_tokens": 52959850.0,
|
|
"step": 30525
|
|
},
|
|
{
|
|
"entropy": 5.5140190601348875,
|
|
"epoch": 2.3753355378331062,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004430420107304943,
|
|
"loss": 5.1959,
|
|
"mean_token_accuracy": 0.19013487547636032,
|
|
"num_tokens": 52969378.0,
|
|
"step": 30530
|
|
},
|
|
{
|
|
"entropy": 5.473598337173462,
|
|
"epoch": 2.375724567204824,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00044302357890189475,
|
|
"loss": 5.0367,
|
|
"mean_token_accuracy": 0.19712282121181487,
|
|
"num_tokens": 52977178.0,
|
|
"step": 30535
|
|
},
|
|
{
|
|
"entropy": 5.458655595779419,
|
|
"epoch": 2.3761135965765416,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0004430051445238049,
|
|
"loss": 5.054,
|
|
"mean_token_accuracy": 0.19487334042787552,
|
|
"num_tokens": 52986035.0,
|
|
"step": 30540
|
|
},
|
|
{
|
|
"entropy": 5.334892463684082,
|
|
"epoch": 2.376502625948259,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00044298670759650426,
|
|
"loss": 5.0785,
|
|
"mean_token_accuracy": 0.1933472365140915,
|
|
"num_tokens": 52995399.0,
|
|
"step": 30545
|
|
},
|
|
{
|
|
"entropy": 5.415270042419434,
|
|
"epoch": 2.3768916553199766,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004429682681202728,
|
|
"loss": 5.0095,
|
|
"mean_token_accuracy": 0.19903945475816726,
|
|
"num_tokens": 53004500.0,
|
|
"step": 30550
|
|
},
|
|
{
|
|
"entropy": 5.4921379566192625,
|
|
"epoch": 2.3772806846916943,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00044294982609539027,
|
|
"loss": 5.1186,
|
|
"mean_token_accuracy": 0.19133528470993041,
|
|
"num_tokens": 53014161.0,
|
|
"step": 30555
|
|
},
|
|
{
|
|
"entropy": 5.327301692962647,
|
|
"epoch": 2.377669714063412,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004429313815221363,
|
|
"loss": 4.8797,
|
|
"mean_token_accuracy": 0.20123362988233567,
|
|
"num_tokens": 53022560.0,
|
|
"step": 30560
|
|
},
|
|
{
|
|
"entropy": 5.389039659500122,
|
|
"epoch": 2.3780587434351292,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00044291293440079107,
|
|
"loss": 5.0635,
|
|
"mean_token_accuracy": 0.1923644632101059,
|
|
"num_tokens": 53031194.0,
|
|
"step": 30565
|
|
},
|
|
{
|
|
"entropy": 5.43643627166748,
|
|
"epoch": 2.378447772806847,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004428944847316342,
|
|
"loss": 5.0815,
|
|
"mean_token_accuracy": 0.19247312992811202,
|
|
"num_tokens": 53039512.0,
|
|
"step": 30570
|
|
},
|
|
{
|
|
"entropy": 5.449588203430176,
|
|
"epoch": 2.3788368021785646,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004428760325149458,
|
|
"loss": 5.0413,
|
|
"mean_token_accuracy": 0.19694886356592178,
|
|
"num_tokens": 53048579.0,
|
|
"step": 30575
|
|
},
|
|
{
|
|
"entropy": 5.4938396453857425,
|
|
"epoch": 2.379225831550282,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00044285757775100584,
|
|
"loss": 5.1674,
|
|
"mean_token_accuracy": 0.18698979914188385,
|
|
"num_tokens": 53057770.0,
|
|
"step": 30580
|
|
},
|
|
{
|
|
"entropy": 5.4218543529510494,
|
|
"epoch": 2.3796148609219996,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00044283912044009436,
|
|
"loss": 5.0312,
|
|
"mean_token_accuracy": 0.19643487334251403,
|
|
"num_tokens": 53067127.0,
|
|
"step": 30585
|
|
},
|
|
{
|
|
"entropy": 5.447482061386109,
|
|
"epoch": 2.3800038902937173,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00044282066058249123,
|
|
"loss": 5.018,
|
|
"mean_token_accuracy": 0.19424306750297546,
|
|
"num_tokens": 53076351.0,
|
|
"step": 30590
|
|
},
|
|
{
|
|
"entropy": 5.421877908706665,
|
|
"epoch": 2.380392919665435,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004428021981784768,
|
|
"loss": 5.0482,
|
|
"mean_token_accuracy": 0.1920485317707062,
|
|
"num_tokens": 53085472.0,
|
|
"step": 30595
|
|
},
|
|
{
|
|
"entropy": 5.431625127792358,
|
|
"epoch": 2.3807819490371522,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00044278373322833106,
|
|
"loss": 5.0,
|
|
"mean_token_accuracy": 0.194564525783062,
|
|
"num_tokens": 53094181.0,
|
|
"step": 30600
|
|
},
|
|
{
|
|
"entropy": 5.424614906311035,
|
|
"epoch": 2.38117097840887,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00044276526573233416,
|
|
"loss": 5.0702,
|
|
"mean_token_accuracy": 0.18509909957647325,
|
|
"num_tokens": 53103421.0,
|
|
"step": 30605
|
|
},
|
|
{
|
|
"entropy": 5.418405771255493,
|
|
"epoch": 2.381560007780587,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004427467956907664,
|
|
"loss": 4.9871,
|
|
"mean_token_accuracy": 0.1968007892370224,
|
|
"num_tokens": 53112058.0,
|
|
"step": 30610
|
|
},
|
|
{
|
|
"entropy": 5.423847293853759,
|
|
"epoch": 2.381949037152305,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.00044272832310390814,
|
|
"loss": 5.0752,
|
|
"mean_token_accuracy": 0.19400326013565064,
|
|
"num_tokens": 53119755.0,
|
|
"step": 30615
|
|
},
|
|
{
|
|
"entropy": 5.316181802749634,
|
|
"epoch": 2.3823380665240226,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004427098479720394,
|
|
"loss": 4.9616,
|
|
"mean_token_accuracy": 0.20256635248661042,
|
|
"num_tokens": 53128529.0,
|
|
"step": 30620
|
|
},
|
|
{
|
|
"entropy": 5.36008734703064,
|
|
"epoch": 2.3827270958957403,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00044269137029544073,
|
|
"loss": 4.9895,
|
|
"mean_token_accuracy": 0.1950661286711693,
|
|
"num_tokens": 53137594.0,
|
|
"step": 30625
|
|
},
|
|
{
|
|
"entropy": 5.5124729633331295,
|
|
"epoch": 2.3831161252674575,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0004426728900743924,
|
|
"loss": 5.0461,
|
|
"mean_token_accuracy": 0.1874262273311615,
|
|
"num_tokens": 53146521.0,
|
|
"step": 30630
|
|
},
|
|
{
|
|
"entropy": 5.451292943954468,
|
|
"epoch": 2.3835051546391752,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00044265440730917484,
|
|
"loss": 5.0093,
|
|
"mean_token_accuracy": 0.1992732748389244,
|
|
"num_tokens": 53154832.0,
|
|
"step": 30635
|
|
},
|
|
{
|
|
"entropy": 5.4052387237548825,
|
|
"epoch": 2.383894184010893,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00044263592200006845,
|
|
"loss": 5.0788,
|
|
"mean_token_accuracy": 0.18611396998167037,
|
|
"num_tokens": 53163889.0,
|
|
"step": 30640
|
|
},
|
|
{
|
|
"entropy": 5.394327926635742,
|
|
"epoch": 2.38428321338261,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00044261743414735383,
|
|
"loss": 5.0389,
|
|
"mean_token_accuracy": 0.19424591809511185,
|
|
"num_tokens": 53172688.0,
|
|
"step": 30645
|
|
},
|
|
{
|
|
"entropy": 5.454587793350219,
|
|
"epoch": 2.384672242754328,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004425989437513114,
|
|
"loss": 5.0111,
|
|
"mean_token_accuracy": 0.19329170435667037,
|
|
"num_tokens": 53180742.0,
|
|
"step": 30650
|
|
},
|
|
{
|
|
"entropy": 5.329313039779663,
|
|
"epoch": 2.3850612721260456,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004425804508122218,
|
|
"loss": 4.9884,
|
|
"mean_token_accuracy": 0.20226458758115767,
|
|
"num_tokens": 53188716.0,
|
|
"step": 30655
|
|
},
|
|
{
|
|
"entropy": 5.43035044670105,
|
|
"epoch": 2.3854503014977633,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00044256195533036566,
|
|
"loss": 5.1309,
|
|
"mean_token_accuracy": 0.18732646703720093,
|
|
"num_tokens": 53197420.0,
|
|
"step": 30660
|
|
},
|
|
{
|
|
"entropy": 5.409579467773438,
|
|
"epoch": 2.3858393308694805,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00044254345730602345,
|
|
"loss": 5.0342,
|
|
"mean_token_accuracy": 0.19419767260551452,
|
|
"num_tokens": 53205927.0,
|
|
"step": 30665
|
|
},
|
|
{
|
|
"entropy": 5.426610040664673,
|
|
"epoch": 2.386228360241198,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004425249567394759,
|
|
"loss": 4.9958,
|
|
"mean_token_accuracy": 0.19732051491737365,
|
|
"num_tokens": 53214793.0,
|
|
"step": 30670
|
|
},
|
|
{
|
|
"entropy": 5.371940755844117,
|
|
"epoch": 2.386617389612916,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00044250645363100386,
|
|
"loss": 4.9937,
|
|
"mean_token_accuracy": 0.1965232864022255,
|
|
"num_tokens": 53223429.0,
|
|
"step": 30675
|
|
},
|
|
{
|
|
"entropy": 5.37785325050354,
|
|
"epoch": 2.387006418984633,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00044248794798088805,
|
|
"loss": 4.8916,
|
|
"mean_token_accuracy": 0.20787483155727388,
|
|
"num_tokens": 53231697.0,
|
|
"step": 30680
|
|
},
|
|
{
|
|
"entropy": 5.443516492843628,
|
|
"epoch": 2.387395448356351,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004424694397894091,
|
|
"loss": 5.0247,
|
|
"mean_token_accuracy": 0.19835929125547408,
|
|
"num_tokens": 53239318.0,
|
|
"step": 30685
|
|
},
|
|
{
|
|
"entropy": 5.442487907409668,
|
|
"epoch": 2.3877844777280686,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00044245092905684794,
|
|
"loss": 5.0974,
|
|
"mean_token_accuracy": 0.1890202760696411,
|
|
"num_tokens": 53248079.0,
|
|
"step": 30690
|
|
},
|
|
{
|
|
"entropy": 5.414025926589966,
|
|
"epoch": 2.3881735070997863,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00044243241578348553,
|
|
"loss": 5.0589,
|
|
"mean_token_accuracy": 0.1939913108944893,
|
|
"num_tokens": 53256856.0,
|
|
"step": 30695
|
|
},
|
|
{
|
|
"entropy": 5.481858158111573,
|
|
"epoch": 2.3885625364715035,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004424138999696027,
|
|
"loss": 5.0998,
|
|
"mean_token_accuracy": 0.18905478119850158,
|
|
"num_tokens": 53265810.0,
|
|
"step": 30700
|
|
},
|
|
{
|
|
"entropy": 5.490751886367798,
|
|
"epoch": 2.388951565843221,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004423953816154804,
|
|
"loss": 5.0677,
|
|
"mean_token_accuracy": 0.19156312495470046,
|
|
"num_tokens": 53274485.0,
|
|
"step": 30705
|
|
},
|
|
{
|
|
"entropy": 5.395273923873901,
|
|
"epoch": 2.389340595214939,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.00044237686072139967,
|
|
"loss": 4.9477,
|
|
"mean_token_accuracy": 0.19312392622232438,
|
|
"num_tokens": 53282322.0,
|
|
"step": 30710
|
|
},
|
|
{
|
|
"entropy": 5.441404914855957,
|
|
"epoch": 2.389729624586656,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004423583372876414,
|
|
"loss": 5.0875,
|
|
"mean_token_accuracy": 0.18860950022935868,
|
|
"num_tokens": 53291868.0,
|
|
"step": 30715
|
|
},
|
|
{
|
|
"entropy": 5.361319255828858,
|
|
"epoch": 2.390118653958374,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00044233981131448677,
|
|
"loss": 4.9749,
|
|
"mean_token_accuracy": 0.20542532950639725,
|
|
"num_tokens": 53300654.0,
|
|
"step": 30720
|
|
},
|
|
{
|
|
"entropy": 5.408745384216308,
|
|
"epoch": 2.3905076833300916,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00044232128280221683,
|
|
"loss": 4.8602,
|
|
"mean_token_accuracy": 0.20927826911211014,
|
|
"num_tokens": 53309178.0,
|
|
"step": 30725
|
|
},
|
|
{
|
|
"entropy": 5.363996362686157,
|
|
"epoch": 2.390896712701809,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004423027517511128,
|
|
"loss": 5.063,
|
|
"mean_token_accuracy": 0.19236669987440108,
|
|
"num_tokens": 53317536.0,
|
|
"step": 30730
|
|
},
|
|
{
|
|
"entropy": 5.366774415969848,
|
|
"epoch": 2.3912857420735265,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.00044228421816145573,
|
|
"loss": 5.018,
|
|
"mean_token_accuracy": 0.19066746830940245,
|
|
"num_tokens": 53325942.0,
|
|
"step": 30735
|
|
},
|
|
{
|
|
"entropy": 5.409568023681641,
|
|
"epoch": 2.391674771445244,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00044226568203352694,
|
|
"loss": 5.0052,
|
|
"mean_token_accuracy": 0.19398888647556306,
|
|
"num_tokens": 53335124.0,
|
|
"step": 30740
|
|
},
|
|
{
|
|
"entropy": 5.428287553787231,
|
|
"epoch": 2.3920638008169615,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00044224714336760766,
|
|
"loss": 5.0919,
|
|
"mean_token_accuracy": 0.19102391749620437,
|
|
"num_tokens": 53344222.0,
|
|
"step": 30745
|
|
},
|
|
{
|
|
"entropy": 5.397597789764404,
|
|
"epoch": 2.392452830188679,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004422286021639792,
|
|
"loss": 5.0031,
|
|
"mean_token_accuracy": 0.19413872808218002,
|
|
"num_tokens": 53352639.0,
|
|
"step": 30750
|
|
},
|
|
{
|
|
"entropy": 5.4450608253479,
|
|
"epoch": 2.392841859560397,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004422100584229228,
|
|
"loss": 5.014,
|
|
"mean_token_accuracy": 0.20079839378595352,
|
|
"num_tokens": 53361357.0,
|
|
"step": 30755
|
|
},
|
|
{
|
|
"entropy": 5.425060510635376,
|
|
"epoch": 2.3932308889321146,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.00044219151214472,
|
|
"loss": 5.0367,
|
|
"mean_token_accuracy": 0.19571194648742676,
|
|
"num_tokens": 53369680.0,
|
|
"step": 30760
|
|
},
|
|
{
|
|
"entropy": 5.406001853942871,
|
|
"epoch": 2.393619918303832,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0004421729633296521,
|
|
"loss": 5.0402,
|
|
"mean_token_accuracy": 0.19584219306707382,
|
|
"num_tokens": 53378619.0,
|
|
"step": 30765
|
|
},
|
|
{
|
|
"entropy": 5.440612745285034,
|
|
"epoch": 2.3940089476755495,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00044215441197800054,
|
|
"loss": 5.0196,
|
|
"mean_token_accuracy": 0.1989392250776291,
|
|
"num_tokens": 53387630.0,
|
|
"step": 30770
|
|
},
|
|
{
|
|
"entropy": 5.377399206161499,
|
|
"epoch": 2.394397977047267,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00044213585809004685,
|
|
"loss": 4.9993,
|
|
"mean_token_accuracy": 0.1922181576490402,
|
|
"num_tokens": 53396696.0,
|
|
"step": 30775
|
|
},
|
|
{
|
|
"entropy": 5.418631458282471,
|
|
"epoch": 2.3947870064189845,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004421173016660725,
|
|
"loss": 5.0227,
|
|
"mean_token_accuracy": 0.19250572025775908,
|
|
"num_tokens": 53405097.0,
|
|
"step": 30780
|
|
},
|
|
{
|
|
"entropy": 5.363653039932251,
|
|
"epoch": 2.395176035790702,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004420987427063592,
|
|
"loss": 4.9741,
|
|
"mean_token_accuracy": 0.19682681411504746,
|
|
"num_tokens": 53413670.0,
|
|
"step": 30785
|
|
},
|
|
{
|
|
"entropy": 5.384137296676636,
|
|
"epoch": 2.39556506516242,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00044208018121118833,
|
|
"loss": 5.0779,
|
|
"mean_token_accuracy": 0.19030825048685074,
|
|
"num_tokens": 53422370.0,
|
|
"step": 30790
|
|
},
|
|
{
|
|
"entropy": 5.465094995498657,
|
|
"epoch": 2.3959540945341375,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00044206161718084164,
|
|
"loss": 5.1167,
|
|
"mean_token_accuracy": 0.18224213272333145,
|
|
"num_tokens": 53431607.0,
|
|
"step": 30795
|
|
},
|
|
{
|
|
"entropy": 5.412611198425293,
|
|
"epoch": 2.396343123905855,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.0004420430506156009,
|
|
"loss": 4.9123,
|
|
"mean_token_accuracy": 0.20767647176980972,
|
|
"num_tokens": 53440042.0,
|
|
"step": 30800
|
|
},
|
|
{
|
|
"entropy": 5.319740200042725,
|
|
"epoch": 2.3967321532775725,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00044202448151574764,
|
|
"loss": 5.0048,
|
|
"mean_token_accuracy": 0.20308858454227446,
|
|
"num_tokens": 53448780.0,
|
|
"step": 30805
|
|
},
|
|
{
|
|
"entropy": 5.424555921554566,
|
|
"epoch": 2.39712118264929,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004420059098815638,
|
|
"loss": 5.1114,
|
|
"mean_token_accuracy": 0.18620938062667847,
|
|
"num_tokens": 53457598.0,
|
|
"step": 30810
|
|
},
|
|
{
|
|
"entropy": 5.488473510742187,
|
|
"epoch": 2.3975102120210074,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004419873357133311,
|
|
"loss": 5.1112,
|
|
"mean_token_accuracy": 0.19560483396053313,
|
|
"num_tokens": 53466387.0,
|
|
"step": 30815
|
|
},
|
|
{
|
|
"entropy": 5.482522773742676,
|
|
"epoch": 2.397899241392725,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0004419687590113313,
|
|
"loss": 5.0423,
|
|
"mean_token_accuracy": 0.19537197798490524,
|
|
"num_tokens": 53475032.0,
|
|
"step": 30820
|
|
},
|
|
{
|
|
"entropy": 5.451695919036865,
|
|
"epoch": 2.398288270764443,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00044195017977584637,
|
|
"loss": 5.0388,
|
|
"mean_token_accuracy": 0.1998867690563202,
|
|
"num_tokens": 53483142.0,
|
|
"step": 30825
|
|
},
|
|
{
|
|
"entropy": 5.43352518081665,
|
|
"epoch": 2.39867730013616,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00044193159800715823,
|
|
"loss": 5.1214,
|
|
"mean_token_accuracy": 0.19339792281389237,
|
|
"num_tokens": 53492820.0,
|
|
"step": 30830
|
|
},
|
|
{
|
|
"entropy": 5.451276445388794,
|
|
"epoch": 2.399066329507878,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00044191301370554874,
|
|
"loss": 5.0523,
|
|
"mean_token_accuracy": 0.18964807242155074,
|
|
"num_tokens": 53502018.0,
|
|
"step": 30835
|
|
},
|
|
{
|
|
"entropy": 5.424482774734497,
|
|
"epoch": 2.3994553588795955,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00044189442687129994,
|
|
"loss": 4.9522,
|
|
"mean_token_accuracy": 0.19632142782211304,
|
|
"num_tokens": 53510287.0,
|
|
"step": 30840
|
|
},
|
|
{
|
|
"entropy": 5.386946153640747,
|
|
"epoch": 2.3998443882513127,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004418758375046939,
|
|
"loss": 5.0082,
|
|
"mean_token_accuracy": 0.1914263039827347,
|
|
"num_tokens": 53519042.0,
|
|
"step": 30845
|
|
},
|
|
{
|
|
"entropy": 5.458552408218384,
|
|
"epoch": 2.4002334176230304,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00044185724560601267,
|
|
"loss": 5.0201,
|
|
"mean_token_accuracy": 0.1927003726363182,
|
|
"num_tokens": 53527678.0,
|
|
"step": 30850
|
|
},
|
|
{
|
|
"entropy": 5.4738438606262205,
|
|
"epoch": 2.400622446994748,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004418386511755382,
|
|
"loss": 5.0508,
|
|
"mean_token_accuracy": 0.19198777973651887,
|
|
"num_tokens": 53536371.0,
|
|
"step": 30855
|
|
},
|
|
{
|
|
"entropy": 5.387752676010132,
|
|
"epoch": 2.401011476366466,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004418200542135528,
|
|
"loss": 5.0749,
|
|
"mean_token_accuracy": 0.1982365921139717,
|
|
"num_tokens": 53545534.0,
|
|
"step": 30860
|
|
},
|
|
{
|
|
"entropy": 5.40975546836853,
|
|
"epoch": 2.401400505738183,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004418014547203386,
|
|
"loss": 4.9769,
|
|
"mean_token_accuracy": 0.19642316699028015,
|
|
"num_tokens": 53554904.0,
|
|
"step": 30865
|
|
},
|
|
{
|
|
"entropy": 5.48582615852356,
|
|
"epoch": 2.401789535109901,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004417828526961778,
|
|
"loss": 5.0195,
|
|
"mean_token_accuracy": 0.19466073662042618,
|
|
"num_tokens": 53563359.0,
|
|
"step": 30870
|
|
},
|
|
{
|
|
"entropy": 5.381623792648315,
|
|
"epoch": 2.4021785644816185,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 0.00044176424814135266,
|
|
"loss": 5.147,
|
|
"mean_token_accuracy": 0.1881447583436966,
|
|
"num_tokens": 53573428.0,
|
|
"step": 30875
|
|
},
|
|
{
|
|
"entropy": 5.444944667816162,
|
|
"epoch": 2.4025675938533357,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004417456410561455,
|
|
"loss": 5.0926,
|
|
"mean_token_accuracy": 0.18804797232151033,
|
|
"num_tokens": 53581719.0,
|
|
"step": 30880
|
|
},
|
|
{
|
|
"entropy": 5.517395401000977,
|
|
"epoch": 2.4029566232250534,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004417270314408387,
|
|
"loss": 5.1561,
|
|
"mean_token_accuracy": 0.18775928020477295,
|
|
"num_tokens": 53589715.0,
|
|
"step": 30885
|
|
},
|
|
{
|
|
"entropy": 5.431297874450683,
|
|
"epoch": 2.403345652596771,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00044170841929571454,
|
|
"loss": 5.0236,
|
|
"mean_token_accuracy": 0.1950223296880722,
|
|
"num_tokens": 53598273.0,
|
|
"step": 30890
|
|
},
|
|
{
|
|
"entropy": 5.418065309524536,
|
|
"epoch": 2.403734681968489,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00044168980462105543,
|
|
"loss": 5.051,
|
|
"mean_token_accuracy": 0.19082193821668625,
|
|
"num_tokens": 53607824.0,
|
|
"step": 30895
|
|
},
|
|
{
|
|
"entropy": 5.43564805984497,
|
|
"epoch": 2.404123711340206,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004416711874171439,
|
|
"loss": 4.9661,
|
|
"mean_token_accuracy": 0.19981446117162704,
|
|
"num_tokens": 53616734.0,
|
|
"step": 30900
|
|
},
|
|
{
|
|
"entropy": 5.340733242034912,
|
|
"epoch": 2.404512740711924,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.0004416525676842624,
|
|
"loss": 5.0136,
|
|
"mean_token_accuracy": 0.20162587463855744,
|
|
"num_tokens": 53625877.0,
|
|
"step": 30905
|
|
},
|
|
{
|
|
"entropy": 5.393693923950195,
|
|
"epoch": 2.4049017700836415,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004416339454226933,
|
|
"loss": 5.0711,
|
|
"mean_token_accuracy": 0.1929358258843422,
|
|
"num_tokens": 53634872.0,
|
|
"step": 30910
|
|
},
|
|
{
|
|
"entropy": 5.400026321411133,
|
|
"epoch": 2.4052907994553587,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0004416153206327194,
|
|
"loss": 5.0094,
|
|
"mean_token_accuracy": 0.19994690418243408,
|
|
"num_tokens": 53643916.0,
|
|
"step": 30915
|
|
},
|
|
{
|
|
"entropy": 5.4065131664276125,
|
|
"epoch": 2.4056798288270764,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00044159669331462326,
|
|
"loss": 5.0415,
|
|
"mean_token_accuracy": 0.1896221563220024,
|
|
"num_tokens": 53652496.0,
|
|
"step": 30920
|
|
},
|
|
{
|
|
"entropy": 5.343953943252563,
|
|
"epoch": 2.406068858198794,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00044157806346868737,
|
|
"loss": 5.014,
|
|
"mean_token_accuracy": 0.19502445310354233,
|
|
"num_tokens": 53661191.0,
|
|
"step": 30925
|
|
},
|
|
{
|
|
"entropy": 5.4239434719085695,
|
|
"epoch": 2.406457887570512,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.00044155943109519454,
|
|
"loss": 5.0249,
|
|
"mean_token_accuracy": 0.1900385931134224,
|
|
"num_tokens": 53669520.0,
|
|
"step": 30930
|
|
},
|
|
{
|
|
"entropy": 5.437687110900879,
|
|
"epoch": 2.406846916942229,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004415407961944274,
|
|
"loss": 5.0511,
|
|
"mean_token_accuracy": 0.19101658165454866,
|
|
"num_tokens": 53678398.0,
|
|
"step": 30935
|
|
},
|
|
{
|
|
"entropy": 5.4347230911254885,
|
|
"epoch": 2.4072359463139468,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00044152215876666883,
|
|
"loss": 5.0655,
|
|
"mean_token_accuracy": 0.19613282531499862,
|
|
"num_tokens": 53687870.0,
|
|
"step": 30940
|
|
},
|
|
{
|
|
"entropy": 5.4615904808044435,
|
|
"epoch": 2.407624975685664,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004415035188122016,
|
|
"loss": 5.0362,
|
|
"mean_token_accuracy": 0.18978424817323686,
|
|
"num_tokens": 53697335.0,
|
|
"step": 30945
|
|
},
|
|
{
|
|
"entropy": 5.281361150741577,
|
|
"epoch": 2.4080140050573817,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00044148487633130837,
|
|
"loss": 4.9041,
|
|
"mean_token_accuracy": 0.20375325828790664,
|
|
"num_tokens": 53705457.0,
|
|
"step": 30950
|
|
},
|
|
{
|
|
"entropy": 5.283529472351074,
|
|
"epoch": 2.4084030344290994,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00044146623132427213,
|
|
"loss": 4.8316,
|
|
"mean_token_accuracy": 0.2058969959616661,
|
|
"num_tokens": 53714092.0,
|
|
"step": 30955
|
|
},
|
|
{
|
|
"entropy": 5.393737554550171,
|
|
"epoch": 2.408792063800817,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00044144758379137584,
|
|
"loss": 5.0297,
|
|
"mean_token_accuracy": 0.19410151988267899,
|
|
"num_tokens": 53722972.0,
|
|
"step": 30960
|
|
},
|
|
{
|
|
"entropy": 5.39993839263916,
|
|
"epoch": 2.4091810931725344,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00044142893373290236,
|
|
"loss": 4.9711,
|
|
"mean_token_accuracy": 0.20181001722812653,
|
|
"num_tokens": 53730842.0,
|
|
"step": 30965
|
|
},
|
|
{
|
|
"entropy": 5.439574193954468,
|
|
"epoch": 2.409570122544252,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0004414102811491348,
|
|
"loss": 5.0581,
|
|
"mean_token_accuracy": 0.18835478127002717,
|
|
"num_tokens": 53740241.0,
|
|
"step": 30970
|
|
},
|
|
{
|
|
"entropy": 5.365944719314575,
|
|
"epoch": 2.4099591519159698,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00044139162604035597,
|
|
"loss": 4.9869,
|
|
"mean_token_accuracy": 0.1912885367870331,
|
|
"num_tokens": 53749653.0,
|
|
"step": 30975
|
|
},
|
|
{
|
|
"entropy": 5.388735389709472,
|
|
"epoch": 2.410348181287687,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.00044137296840684917,
|
|
"loss": 4.9828,
|
|
"mean_token_accuracy": 0.20338206589221955,
|
|
"num_tokens": 53758161.0,
|
|
"step": 30980
|
|
},
|
|
{
|
|
"entropy": 5.396969556808472,
|
|
"epoch": 2.4107372106594047,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004413543082488973,
|
|
"loss": 4.8914,
|
|
"mean_token_accuracy": 0.22004808336496354,
|
|
"num_tokens": 53766345.0,
|
|
"step": 30985
|
|
},
|
|
{
|
|
"entropy": 5.387019109725952,
|
|
"epoch": 2.4111262400311224,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004413356455667836,
|
|
"loss": 4.9578,
|
|
"mean_token_accuracy": 0.2043931543827057,
|
|
"num_tokens": 53774725.0,
|
|
"step": 30990
|
|
},
|
|
{
|
|
"entropy": 5.3289635181427,
|
|
"epoch": 2.41151526940284,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004413169803607913,
|
|
"loss": 4.9805,
|
|
"mean_token_accuracy": 0.19591590017080307,
|
|
"num_tokens": 53783386.0,
|
|
"step": 30995
|
|
},
|
|
{
|
|
"entropy": 5.427493143081665,
|
|
"epoch": 2.4119042987745574,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.00044129831263120344,
|
|
"loss": 4.9814,
|
|
"mean_token_accuracy": 0.19367842376232147,
|
|
"num_tokens": 53791167.0,
|
|
"step": 31000
|
|
},
|
|
{
|
|
"entropy": 5.4133790016174315,
|
|
"epoch": 2.412293328146275,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004412796423783034,
|
|
"loss": 5.0157,
|
|
"mean_token_accuracy": 0.19186872988939285,
|
|
"num_tokens": 53800227.0,
|
|
"step": 31005
|
|
},
|
|
{
|
|
"entropy": 5.395814514160156,
|
|
"epoch": 2.4126823575179928,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004412609696023745,
|
|
"loss": 5.0235,
|
|
"mean_token_accuracy": 0.1948474496603012,
|
|
"num_tokens": 53808591.0,
|
|
"step": 31010
|
|
},
|
|
{
|
|
"entropy": 5.464764595031738,
|
|
"epoch": 2.41307138688971,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004412422943037,
|
|
"loss": 5.0944,
|
|
"mean_token_accuracy": 0.1929880529642105,
|
|
"num_tokens": 53817738.0,
|
|
"step": 31015
|
|
},
|
|
{
|
|
"entropy": 5.453347206115723,
|
|
"epoch": 2.4134604162614277,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00044122361648256327,
|
|
"loss": 5.061,
|
|
"mean_token_accuracy": 0.19630954563617706,
|
|
"num_tokens": 53826919.0,
|
|
"step": 31020
|
|
},
|
|
{
|
|
"entropy": 5.411454868316651,
|
|
"epoch": 2.4138494456331454,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.00044120493613924766,
|
|
"loss": 4.9553,
|
|
"mean_token_accuracy": 0.20158345103263856,
|
|
"num_tokens": 53835415.0,
|
|
"step": 31025
|
|
},
|
|
{
|
|
"entropy": 5.380985116958618,
|
|
"epoch": 2.414238475004863,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00044118625327403677,
|
|
"loss": 5.0796,
|
|
"mean_token_accuracy": 0.19394372552633285,
|
|
"num_tokens": 53844992.0,
|
|
"step": 31030
|
|
},
|
|
{
|
|
"entropy": 5.43061203956604,
|
|
"epoch": 2.4146275043765804,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.000441167567887214,
|
|
"loss": 5.0194,
|
|
"mean_token_accuracy": 0.19021786898374557,
|
|
"num_tokens": 53853864.0,
|
|
"step": 31035
|
|
},
|
|
{
|
|
"entropy": 5.469346332550049,
|
|
"epoch": 2.415016533748298,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004411488799790629,
|
|
"loss": 5.023,
|
|
"mean_token_accuracy": 0.1988400936126709,
|
|
"num_tokens": 53863021.0,
|
|
"step": 31040
|
|
},
|
|
{
|
|
"entropy": 5.450225877761841,
|
|
"epoch": 2.4154055631200158,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00044113018954986693,
|
|
"loss": 5.067,
|
|
"mean_token_accuracy": 0.18261824250221254,
|
|
"num_tokens": 53873259.0,
|
|
"step": 31045
|
|
},
|
|
{
|
|
"entropy": 5.372161960601806,
|
|
"epoch": 2.415794592491733,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004411114965999098,
|
|
"loss": 4.9775,
|
|
"mean_token_accuracy": 0.1993924304842949,
|
|
"num_tokens": 53881861.0,
|
|
"step": 31050
|
|
},
|
|
{
|
|
"entropy": 5.40552248954773,
|
|
"epoch": 2.4161836218634507,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.000441092801129475,
|
|
"loss": 5.0641,
|
|
"mean_token_accuracy": 0.18950241953134536,
|
|
"num_tokens": 53890852.0,
|
|
"step": 31055
|
|
},
|
|
{
|
|
"entropy": 5.3632200241088865,
|
|
"epoch": 2.4165726512351684,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00044107410313884643,
|
|
"loss": 4.9338,
|
|
"mean_token_accuracy": 0.19829141497612,
|
|
"num_tokens": 53899452.0,
|
|
"step": 31060
|
|
},
|
|
{
|
|
"entropy": 5.444210004806519,
|
|
"epoch": 2.4169616806068857,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00044105540262830763,
|
|
"loss": 5.1228,
|
|
"mean_token_accuracy": 0.1890322148799896,
|
|
"num_tokens": 53908458.0,
|
|
"step": 31065
|
|
},
|
|
{
|
|
"entropy": 5.441821908950805,
|
|
"epoch": 2.4173507099786034,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004410366995981424,
|
|
"loss": 5.0543,
|
|
"mean_token_accuracy": 0.1921500414609909,
|
|
"num_tokens": 53917998.0,
|
|
"step": 31070
|
|
},
|
|
{
|
|
"entropy": 5.481869316101074,
|
|
"epoch": 2.417739739350321,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00044101799404863457,
|
|
"loss": 5.1124,
|
|
"mean_token_accuracy": 0.1879383772611618,
|
|
"num_tokens": 53926320.0,
|
|
"step": 31075
|
|
},
|
|
{
|
|
"entropy": 5.430712604522705,
|
|
"epoch": 2.4181287687220383,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004409992859800679,
|
|
"loss": 5.0169,
|
|
"mean_token_accuracy": 0.18876795172691346,
|
|
"num_tokens": 53934723.0,
|
|
"step": 31080
|
|
},
|
|
{
|
|
"entropy": 5.4456737518310545,
|
|
"epoch": 2.418517798093756,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004409805753927263,
|
|
"loss": 5.1008,
|
|
"mean_token_accuracy": 0.19010978192090988,
|
|
"num_tokens": 53943125.0,
|
|
"step": 31085
|
|
},
|
|
{
|
|
"entropy": 5.45714111328125,
|
|
"epoch": 2.4189068274654737,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004409618622868936,
|
|
"loss": 5.0625,
|
|
"mean_token_accuracy": 0.1885081484913826,
|
|
"num_tokens": 53951781.0,
|
|
"step": 31090
|
|
},
|
|
{
|
|
"entropy": 5.479147672653198,
|
|
"epoch": 2.4192958568371914,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.00044094314666285385,
|
|
"loss": 5.0251,
|
|
"mean_token_accuracy": 0.19547722041606902,
|
|
"num_tokens": 53960556.0,
|
|
"step": 31095
|
|
},
|
|
{
|
|
"entropy": 5.339799165725708,
|
|
"epoch": 2.4196848862089086,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00044092442852089095,
|
|
"loss": 4.9153,
|
|
"mean_token_accuracy": 0.20224347710609436,
|
|
"num_tokens": 53969075.0,
|
|
"step": 31100
|
|
},
|
|
{
|
|
"entropy": 5.496554374694824,
|
|
"epoch": 2.4200739155806263,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0004409057078612889,
|
|
"loss": 5.2146,
|
|
"mean_token_accuracy": 0.18050424456596376,
|
|
"num_tokens": 53978203.0,
|
|
"step": 31105
|
|
},
|
|
{
|
|
"entropy": 5.488768196105957,
|
|
"epoch": 2.420462944952344,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00044088698468433194,
|
|
"loss": 5.0112,
|
|
"mean_token_accuracy": 0.19432411044836045,
|
|
"num_tokens": 53986935.0,
|
|
"step": 31110
|
|
},
|
|
{
|
|
"entropy": 5.398905229568482,
|
|
"epoch": 2.4208519743240613,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00044086825899030383,
|
|
"loss": 5.0332,
|
|
"mean_token_accuracy": 0.18574984073638917,
|
|
"num_tokens": 53996167.0,
|
|
"step": 31115
|
|
},
|
|
{
|
|
"entropy": 5.353693675994873,
|
|
"epoch": 2.421241003695779,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.000440849530779489,
|
|
"loss": 5.0429,
|
|
"mean_token_accuracy": 0.19634633809328078,
|
|
"num_tokens": 54004722.0,
|
|
"step": 31120
|
|
},
|
|
{
|
|
"entropy": 5.382027339935303,
|
|
"epoch": 2.4216300330674967,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004408308000521715,
|
|
"loss": 4.9646,
|
|
"mean_token_accuracy": 0.20433289110660552,
|
|
"num_tokens": 54012660.0,
|
|
"step": 31125
|
|
},
|
|
{
|
|
"entropy": 5.479435396194458,
|
|
"epoch": 2.4220190624392144,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00044081206680863556,
|
|
"loss": 5.0706,
|
|
"mean_token_accuracy": 0.1906100481748581,
|
|
"num_tokens": 54021517.0,
|
|
"step": 31130
|
|
},
|
|
{
|
|
"entropy": 5.429105377197265,
|
|
"epoch": 2.4224080918109316,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00044079333104916554,
|
|
"loss": 5.0239,
|
|
"mean_token_accuracy": 0.1974774032831192,
|
|
"num_tokens": 54030081.0,
|
|
"step": 31135
|
|
},
|
|
{
|
|
"entropy": 5.402469253540039,
|
|
"epoch": 2.4227971211826493,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004407745927740454,
|
|
"loss": 4.9562,
|
|
"mean_token_accuracy": 0.20426964312791823,
|
|
"num_tokens": 54038214.0,
|
|
"step": 31140
|
|
},
|
|
{
|
|
"entropy": 5.319804096221924,
|
|
"epoch": 2.423186150554367,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004407558519835598,
|
|
"loss": 4.9076,
|
|
"mean_token_accuracy": 0.19537126570940017,
|
|
"num_tokens": 54046813.0,
|
|
"step": 31145
|
|
},
|
|
{
|
|
"entropy": 5.3739540576934814,
|
|
"epoch": 2.4235751799260843,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00044073710867799295,
|
|
"loss": 5.0264,
|
|
"mean_token_accuracy": 0.19652935564517976,
|
|
"num_tokens": 54056095.0,
|
|
"step": 31150
|
|
},
|
|
{
|
|
"entropy": 5.356573057174683,
|
|
"epoch": 2.423964209297802,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0004407183628576293,
|
|
"loss": 4.9369,
|
|
"mean_token_accuracy": 0.20396465063095093,
|
|
"num_tokens": 54065173.0,
|
|
"step": 31155
|
|
},
|
|
{
|
|
"entropy": 5.469637870788574,
|
|
"epoch": 2.4243532386695197,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004406996145227532,
|
|
"loss": 5.1541,
|
|
"mean_token_accuracy": 0.1828441858291626,
|
|
"num_tokens": 54073858.0,
|
|
"step": 31160
|
|
},
|
|
{
|
|
"entropy": 5.487519979476929,
|
|
"epoch": 2.424742268041237,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004406808636736492,
|
|
"loss": 5.0365,
|
|
"mean_token_accuracy": 0.1917970135807991,
|
|
"num_tokens": 54082129.0,
|
|
"step": 31165
|
|
},
|
|
{
|
|
"entropy": 5.425129699707031,
|
|
"epoch": 2.4251312974129546,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00044066211031060183,
|
|
"loss": 4.9583,
|
|
"mean_token_accuracy": 0.1943225994706154,
|
|
"num_tokens": 54090360.0,
|
|
"step": 31170
|
|
},
|
|
{
|
|
"entropy": 5.422593498229981,
|
|
"epoch": 2.4255203267846723,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004406433544338956,
|
|
"loss": 5.0303,
|
|
"mean_token_accuracy": 0.19573379158973694,
|
|
"num_tokens": 54098309.0,
|
|
"step": 31175
|
|
},
|
|
{
|
|
"entropy": 5.4258056640625,
|
|
"epoch": 2.4259093561563896,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004406245960438151,
|
|
"loss": 5.0096,
|
|
"mean_token_accuracy": 0.20394102185964585,
|
|
"num_tokens": 54106505.0,
|
|
"step": 31180
|
|
},
|
|
{
|
|
"entropy": 5.490012502670288,
|
|
"epoch": 2.4262983855281073,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.000440605835140645,
|
|
"loss": 5.2013,
|
|
"mean_token_accuracy": 0.18369706124067306,
|
|
"num_tokens": 54115791.0,
|
|
"step": 31185
|
|
},
|
|
{
|
|
"entropy": 5.410346412658692,
|
|
"epoch": 2.426687414899825,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004405870717246699,
|
|
"loss": 4.9378,
|
|
"mean_token_accuracy": 0.1967812955379486,
|
|
"num_tokens": 54124187.0,
|
|
"step": 31190
|
|
},
|
|
{
|
|
"entropy": 5.43877215385437,
|
|
"epoch": 2.4270764442715427,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00044056830579617464,
|
|
"loss": 5.072,
|
|
"mean_token_accuracy": 0.19305126667022704,
|
|
"num_tokens": 54133566.0,
|
|
"step": 31195
|
|
},
|
|
{
|
|
"entropy": 5.439438676834106,
|
|
"epoch": 2.42746547364326,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00044054953735544376,
|
|
"loss": 4.9652,
|
|
"mean_token_accuracy": 0.1951311245560646,
|
|
"num_tokens": 54141698.0,
|
|
"step": 31200
|
|
},
|
|
{
|
|
"entropy": 5.466128778457642,
|
|
"epoch": 2.4278545030149776,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004405307664027622,
|
|
"loss": 5.1074,
|
|
"mean_token_accuracy": 0.18902733623981477,
|
|
"num_tokens": 54150094.0,
|
|
"step": 31205
|
|
},
|
|
{
|
|
"entropy": 5.405302953720093,
|
|
"epoch": 2.4282435323866953,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004405119929384147,
|
|
"loss": 4.9791,
|
|
"mean_token_accuracy": 0.20001201033592225,
|
|
"num_tokens": 54158770.0,
|
|
"step": 31210
|
|
},
|
|
{
|
|
"entropy": 5.372152996063233,
|
|
"epoch": 2.4286325617584126,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004404932169626862,
|
|
"loss": 4.9665,
|
|
"mean_token_accuracy": 0.1956900328397751,
|
|
"num_tokens": 54166912.0,
|
|
"step": 31215
|
|
},
|
|
{
|
|
"entropy": 5.4162764072418215,
|
|
"epoch": 2.4290215911301303,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004404744384758615,
|
|
"loss": 5.0253,
|
|
"mean_token_accuracy": 0.19210139513015748,
|
|
"num_tokens": 54176027.0,
|
|
"step": 31220
|
|
},
|
|
{
|
|
"entropy": 5.455837917327881,
|
|
"epoch": 2.429410620501848,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004404556574782256,
|
|
"loss": 4.9866,
|
|
"mean_token_accuracy": 0.20092392712831497,
|
|
"num_tokens": 54184116.0,
|
|
"step": 31225
|
|
},
|
|
{
|
|
"entropy": 5.363991546630859,
|
|
"epoch": 2.4297996498735657,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00044043687397006336,
|
|
"loss": 4.965,
|
|
"mean_token_accuracy": 0.20002925992012024,
|
|
"num_tokens": 54193043.0,
|
|
"step": 31230
|
|
},
|
|
{
|
|
"entropy": 5.364168119430542,
|
|
"epoch": 2.430188679245283,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00044041808795166,
|
|
"loss": 5.0418,
|
|
"mean_token_accuracy": 0.19186788350343703,
|
|
"num_tokens": 54201953.0,
|
|
"step": 31235
|
|
},
|
|
{
|
|
"entropy": 5.43768572807312,
|
|
"epoch": 2.4305777086170006,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004403992994233004,
|
|
"loss": 5.0351,
|
|
"mean_token_accuracy": 0.1989586979150772,
|
|
"num_tokens": 54210316.0,
|
|
"step": 31240
|
|
},
|
|
{
|
|
"entropy": 5.459669160842895,
|
|
"epoch": 2.4309667379887183,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00044038050838526974,
|
|
"loss": 4.9638,
|
|
"mean_token_accuracy": 0.1976586565375328,
|
|
"num_tokens": 54218795.0,
|
|
"step": 31245
|
|
},
|
|
{
|
|
"entropy": 5.394702577590943,
|
|
"epoch": 2.4313557673604356,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.000440361714837853,
|
|
"loss": 5.0067,
|
|
"mean_token_accuracy": 0.18828006088733673,
|
|
"num_tokens": 54227455.0,
|
|
"step": 31250
|
|
},
|
|
{
|
|
"entropy": 5.352814674377441,
|
|
"epoch": 2.4317447967321533,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004403429187813355,
|
|
"loss": 5.0059,
|
|
"mean_token_accuracy": 0.19510615915060042,
|
|
"num_tokens": 54236124.0,
|
|
"step": 31255
|
|
},
|
|
{
|
|
"entropy": 5.379930591583252,
|
|
"epoch": 2.432133826103871,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0004403241202160024,
|
|
"loss": 4.9682,
|
|
"mean_token_accuracy": 0.1957891672849655,
|
|
"num_tokens": 54244638.0,
|
|
"step": 31260
|
|
},
|
|
{
|
|
"entropy": 5.40061616897583,
|
|
"epoch": 2.432522855475588,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004403053191421388,
|
|
"loss": 5.0039,
|
|
"mean_token_accuracy": 0.1957416281104088,
|
|
"num_tokens": 54253678.0,
|
|
"step": 31265
|
|
},
|
|
{
|
|
"entropy": 5.493869066238403,
|
|
"epoch": 2.432911884847306,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004402865155600302,
|
|
"loss": 5.1724,
|
|
"mean_token_accuracy": 0.19079241901636124,
|
|
"num_tokens": 54262414.0,
|
|
"step": 31270
|
|
},
|
|
{
|
|
"entropy": 5.326379680633545,
|
|
"epoch": 2.4333009142190236,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00044026770946996183,
|
|
"loss": 4.8997,
|
|
"mean_token_accuracy": 0.20885610282421113,
|
|
"num_tokens": 54270597.0,
|
|
"step": 31275
|
|
},
|
|
{
|
|
"entropy": 5.346474313735962,
|
|
"epoch": 2.433689943590741,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00044024890087221896,
|
|
"loss": 5.0139,
|
|
"mean_token_accuracy": 0.19746981263160707,
|
|
"num_tokens": 54279432.0,
|
|
"step": 31280
|
|
},
|
|
{
|
|
"entropy": 5.376286792755127,
|
|
"epoch": 2.4340789729624586,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00044023008976708705,
|
|
"loss": 4.9169,
|
|
"mean_token_accuracy": 0.20057870596647262,
|
|
"num_tokens": 54287578.0,
|
|
"step": 31285
|
|
},
|
|
{
|
|
"entropy": 5.448392295837403,
|
|
"epoch": 2.4344680023341763,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004402112761548515,
|
|
"loss": 5.1189,
|
|
"mean_token_accuracy": 0.18612556010484696,
|
|
"num_tokens": 54296119.0,
|
|
"step": 31290
|
|
},
|
|
{
|
|
"entropy": 5.375394010543824,
|
|
"epoch": 2.434857031705894,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00044019246003579776,
|
|
"loss": 4.9043,
|
|
"mean_token_accuracy": 0.20132029354572295,
|
|
"num_tokens": 54304363.0,
|
|
"step": 31295
|
|
},
|
|
{
|
|
"entropy": 5.466589736938476,
|
|
"epoch": 2.435246061077611,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004401736414102115,
|
|
"loss": 5.0673,
|
|
"mean_token_accuracy": 0.19508639127016067,
|
|
"num_tokens": 54313672.0,
|
|
"step": 31300
|
|
},
|
|
{
|
|
"entropy": 5.45587477684021,
|
|
"epoch": 2.435635090449329,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.000440154820278378,
|
|
"loss": 5.0315,
|
|
"mean_token_accuracy": 0.19967650771141052,
|
|
"num_tokens": 54322163.0,
|
|
"step": 31305
|
|
},
|
|
{
|
|
"entropy": 5.392179012298584,
|
|
"epoch": 2.4360241198210466,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004401359966405831,
|
|
"loss": 5.0055,
|
|
"mean_token_accuracy": 0.19965829700231552,
|
|
"num_tokens": 54331176.0,
|
|
"step": 31310
|
|
},
|
|
{
|
|
"entropy": 5.356971597671508,
|
|
"epoch": 2.436413149192764,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00044011717049711216,
|
|
"loss": 5.0234,
|
|
"mean_token_accuracy": 0.19425858557224274,
|
|
"num_tokens": 54340404.0,
|
|
"step": 31315
|
|
},
|
|
{
|
|
"entropy": 5.427972316741943,
|
|
"epoch": 2.4368021785644816,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00044009834184825103,
|
|
"loss": 4.963,
|
|
"mean_token_accuracy": 0.19791922718286514,
|
|
"num_tokens": 54349704.0,
|
|
"step": 31320
|
|
},
|
|
{
|
|
"entropy": 5.452508401870728,
|
|
"epoch": 2.4371912079361993,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004400795106942853,
|
|
"loss": 5.0641,
|
|
"mean_token_accuracy": 0.19491473883390426,
|
|
"num_tokens": 54358869.0,
|
|
"step": 31325
|
|
},
|
|
{
|
|
"entropy": 5.377355623245239,
|
|
"epoch": 2.437580237307917,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00044006067703550083,
|
|
"loss": 4.9354,
|
|
"mean_token_accuracy": 0.20147132724523545,
|
|
"num_tokens": 54367918.0,
|
|
"step": 31330
|
|
},
|
|
{
|
|
"entropy": 5.372575807571411,
|
|
"epoch": 2.437969266679634,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0004400418408721833,
|
|
"loss": 5.0008,
|
|
"mean_token_accuracy": 0.1981264755129814,
|
|
"num_tokens": 54375798.0,
|
|
"step": 31335
|
|
},
|
|
{
|
|
"entropy": 5.4394513130187985,
|
|
"epoch": 2.438358296051352,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00044002300220461843,
|
|
"loss": 4.9661,
|
|
"mean_token_accuracy": 0.1978133961558342,
|
|
"num_tokens": 54384230.0,
|
|
"step": 31340
|
|
},
|
|
{
|
|
"entropy": 5.362436008453369,
|
|
"epoch": 2.4387473254230696,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004400041610330922,
|
|
"loss": 5.0154,
|
|
"mean_token_accuracy": 0.1938861072063446,
|
|
"num_tokens": 54392444.0,
|
|
"step": 31345
|
|
},
|
|
{
|
|
"entropy": 5.405610609054565,
|
|
"epoch": 2.439136354794787,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004399853173578905,
|
|
"loss": 5.0171,
|
|
"mean_token_accuracy": 0.1949130743741989,
|
|
"num_tokens": 54400788.0,
|
|
"step": 31350
|
|
},
|
|
{
|
|
"entropy": 5.415535926818848,
|
|
"epoch": 2.4395253841665046,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00043996647117929916,
|
|
"loss": 5.0434,
|
|
"mean_token_accuracy": 0.19495703428983688,
|
|
"num_tokens": 54409749.0,
|
|
"step": 31355
|
|
},
|
|
{
|
|
"entropy": 5.526915979385376,
|
|
"epoch": 2.4399144135382222,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004399476224976043,
|
|
"loss": 5.1744,
|
|
"mean_token_accuracy": 0.186597740650177,
|
|
"num_tokens": 54419677.0,
|
|
"step": 31360
|
|
},
|
|
{
|
|
"entropy": 5.529601192474365,
|
|
"epoch": 2.44030344290994,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00043992877131309165,
|
|
"loss": 5.1606,
|
|
"mean_token_accuracy": 0.19093016237020494,
|
|
"num_tokens": 54428821.0,
|
|
"step": 31365
|
|
},
|
|
{
|
|
"entropy": 5.443464994430542,
|
|
"epoch": 2.440692472281657,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0004399099176260475,
|
|
"loss": 5.0683,
|
|
"mean_token_accuracy": 0.19344780147075652,
|
|
"num_tokens": 54437549.0,
|
|
"step": 31370
|
|
},
|
|
{
|
|
"entropy": 5.3834327220916744,
|
|
"epoch": 2.441081501653375,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004398910614367579,
|
|
"loss": 4.9217,
|
|
"mean_token_accuracy": 0.2021382063627243,
|
|
"num_tokens": 54446247.0,
|
|
"step": 31375
|
|
},
|
|
{
|
|
"entropy": 5.429372978210449,
|
|
"epoch": 2.441470531025092,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00043987220274550876,
|
|
"loss": 5.0413,
|
|
"mean_token_accuracy": 0.1881820112466812,
|
|
"num_tokens": 54455191.0,
|
|
"step": 31380
|
|
},
|
|
{
|
|
"entropy": 5.4211362361907955,
|
|
"epoch": 2.44185956039681,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.00043985334155258643,
|
|
"loss": 5.0398,
|
|
"mean_token_accuracy": 0.19728320986032485,
|
|
"num_tokens": 54463094.0,
|
|
"step": 31385
|
|
},
|
|
{
|
|
"entropy": 5.445676183700561,
|
|
"epoch": 2.4422485897685275,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.000439834477858277,
|
|
"loss": 4.9711,
|
|
"mean_token_accuracy": 0.19550594091415405,
|
|
"num_tokens": 54471314.0,
|
|
"step": 31390
|
|
},
|
|
{
|
|
"entropy": 5.441308164596558,
|
|
"epoch": 2.4426376191402452,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00043981561166286676,
|
|
"loss": 5.0998,
|
|
"mean_token_accuracy": 0.1882629230618477,
|
|
"num_tokens": 54480283.0,
|
|
"step": 31395
|
|
},
|
|
{
|
|
"entropy": 5.406192302703857,
|
|
"epoch": 2.4430266485119625,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.000439796742966642,
|
|
"loss": 4.9945,
|
|
"mean_token_accuracy": 0.19359051883220674,
|
|
"num_tokens": 54488588.0,
|
|
"step": 31400
|
|
},
|
|
{
|
|
"entropy": 5.436214447021484,
|
|
"epoch": 2.44341567788368,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00043977787176988884,
|
|
"loss": 4.9824,
|
|
"mean_token_accuracy": 0.2007366180419922,
|
|
"num_tokens": 54497532.0,
|
|
"step": 31405
|
|
},
|
|
{
|
|
"entropy": 5.5001793384552,
|
|
"epoch": 2.443804707255398,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0004397589980728938,
|
|
"loss": 5.0812,
|
|
"mean_token_accuracy": 0.1921469509601593,
|
|
"num_tokens": 54506152.0,
|
|
"step": 31410
|
|
},
|
|
{
|
|
"entropy": 5.421291399002075,
|
|
"epoch": 2.444193736627115,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00043974012187594324,
|
|
"loss": 5.0335,
|
|
"mean_token_accuracy": 0.1939214885234833,
|
|
"num_tokens": 54515674.0,
|
|
"step": 31415
|
|
},
|
|
{
|
|
"entropy": 5.2948326587677,
|
|
"epoch": 2.444582765998833,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004397212431793235,
|
|
"loss": 4.8394,
|
|
"mean_token_accuracy": 0.20641729980707169,
|
|
"num_tokens": 54523399.0,
|
|
"step": 31420
|
|
},
|
|
{
|
|
"entropy": 5.2834690570831295,
|
|
"epoch": 2.4449717953705505,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00043970236198332107,
|
|
"loss": 4.9776,
|
|
"mean_token_accuracy": 0.20009081512689592,
|
|
"num_tokens": 54532128.0,
|
|
"step": 31425
|
|
},
|
|
{
|
|
"entropy": 5.416804552078247,
|
|
"epoch": 2.4453608247422682,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00043968347828822246,
|
|
"loss": 4.956,
|
|
"mean_token_accuracy": 0.1924523189663887,
|
|
"num_tokens": 54540474.0,
|
|
"step": 31430
|
|
},
|
|
{
|
|
"entropy": 5.425650882720947,
|
|
"epoch": 2.4457498541139855,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004396645920943142,
|
|
"loss": 4.9537,
|
|
"mean_token_accuracy": 0.1967518597841263,
|
|
"num_tokens": 54549534.0,
|
|
"step": 31435
|
|
},
|
|
{
|
|
"entropy": 5.399157762527466,
|
|
"epoch": 2.446138883485703,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004396457034018828,
|
|
"loss": 5.0029,
|
|
"mean_token_accuracy": 0.1959057256579399,
|
|
"num_tokens": 54558071.0,
|
|
"step": 31440
|
|
},
|
|
{
|
|
"entropy": 5.450203371047974,
|
|
"epoch": 2.446527912857421,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.000439626812211215,
|
|
"loss": 5.075,
|
|
"mean_token_accuracy": 0.19242481589317323,
|
|
"num_tokens": 54565814.0,
|
|
"step": 31445
|
|
},
|
|
{
|
|
"entropy": 5.432679271697998,
|
|
"epoch": 2.446916942229138,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00043960791852259735,
|
|
"loss": 5.0263,
|
|
"mean_token_accuracy": 0.18384938240051268,
|
|
"num_tokens": 54574911.0,
|
|
"step": 31450
|
|
},
|
|
{
|
|
"entropy": 5.372217798233033,
|
|
"epoch": 2.447305971600856,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004395890223363165,
|
|
"loss": 5.0062,
|
|
"mean_token_accuracy": 0.19198755621910096,
|
|
"num_tokens": 54584129.0,
|
|
"step": 31455
|
|
},
|
|
{
|
|
"entropy": 5.395292139053344,
|
|
"epoch": 2.4476950009725735,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00043957012365265915,
|
|
"loss": 4.9703,
|
|
"mean_token_accuracy": 0.19602918326854707,
|
|
"num_tokens": 54593203.0,
|
|
"step": 31460
|
|
},
|
|
{
|
|
"entropy": 5.415132904052735,
|
|
"epoch": 2.4480840303442912,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00043955122247191214,
|
|
"loss": 5.1034,
|
|
"mean_token_accuracy": 0.19607316255569457,
|
|
"num_tokens": 54601436.0,
|
|
"step": 31465
|
|
},
|
|
{
|
|
"entropy": 5.385945177078247,
|
|
"epoch": 2.4484730597160085,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004395323187943623,
|
|
"loss": 5.0398,
|
|
"mean_token_accuracy": 0.1924893543124199,
|
|
"num_tokens": 54610550.0,
|
|
"step": 31470
|
|
},
|
|
{
|
|
"entropy": 5.398789358139038,
|
|
"epoch": 2.448862089087726,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004395134126202964,
|
|
"loss": 4.9482,
|
|
"mean_token_accuracy": 0.19702083021402358,
|
|
"num_tokens": 54619176.0,
|
|
"step": 31475
|
|
},
|
|
{
|
|
"entropy": 5.386159372329712,
|
|
"epoch": 2.449251118459444,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.0004394945039500012,
|
|
"loss": 4.9946,
|
|
"mean_token_accuracy": 0.19556522965431214,
|
|
"num_tokens": 54627259.0,
|
|
"step": 31480
|
|
},
|
|
{
|
|
"entropy": 5.379903507232666,
|
|
"epoch": 2.449640147831161,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00043947559278376385,
|
|
"loss": 5.0046,
|
|
"mean_token_accuracy": 0.1868068605661392,
|
|
"num_tokens": 54635892.0,
|
|
"step": 31485
|
|
},
|
|
{
|
|
"entropy": 5.4704570293426515,
|
|
"epoch": 2.450029177202879,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00043945667912187117,
|
|
"loss": 5.074,
|
|
"mean_token_accuracy": 0.1872391387820244,
|
|
"num_tokens": 54645360.0,
|
|
"step": 31490
|
|
},
|
|
{
|
|
"entropy": 5.417306423187256,
|
|
"epoch": 2.4504182065745965,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004394377629646101,
|
|
"loss": 4.9957,
|
|
"mean_token_accuracy": 0.19780805855989456,
|
|
"num_tokens": 54654968.0,
|
|
"step": 31495
|
|
},
|
|
{
|
|
"entropy": 5.341229963302612,
|
|
"epoch": 2.4508072359463138,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00043941884431226763,
|
|
"loss": 4.9119,
|
|
"mean_token_accuracy": 0.20868354588747023,
|
|
"num_tokens": 54663347.0,
|
|
"step": 31500
|
|
},
|
|
{
|
|
"entropy": 5.452194929122925,
|
|
"epoch": 2.4511962653180315,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.000439399923165131,
|
|
"loss": 5.0724,
|
|
"mean_token_accuracy": 0.19170394092798232,
|
|
"num_tokens": 54671744.0,
|
|
"step": 31505
|
|
},
|
|
{
|
|
"entropy": 5.410960626602173,
|
|
"epoch": 2.451585294689749,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0004393809995234872,
|
|
"loss": 4.9775,
|
|
"mean_token_accuracy": 0.19728672355413437,
|
|
"num_tokens": 54680098.0,
|
|
"step": 31510
|
|
},
|
|
{
|
|
"entropy": 5.411456108093262,
|
|
"epoch": 2.4519743240614664,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004393620733876233,
|
|
"loss": 5.0772,
|
|
"mean_token_accuracy": 0.19867285192012787,
|
|
"num_tokens": 54689513.0,
|
|
"step": 31515
|
|
},
|
|
{
|
|
"entropy": 5.444696235656738,
|
|
"epoch": 2.452363353433184,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004393431447578267,
|
|
"loss": 5.0367,
|
|
"mean_token_accuracy": 0.20275148749351501,
|
|
"num_tokens": 54698079.0,
|
|
"step": 31520
|
|
},
|
|
{
|
|
"entropy": 5.429082250595092,
|
|
"epoch": 2.452752382804902,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00043932421363438427,
|
|
"loss": 4.9603,
|
|
"mean_token_accuracy": 0.20186777114868165,
|
|
"num_tokens": 54706956.0,
|
|
"step": 31525
|
|
},
|
|
{
|
|
"entropy": 5.288338041305542,
|
|
"epoch": 2.4531414121766195,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004393052800175835,
|
|
"loss": 5.0339,
|
|
"mean_token_accuracy": 0.19311471581459044,
|
|
"num_tokens": 54716131.0,
|
|
"step": 31530
|
|
},
|
|
{
|
|
"entropy": 5.373870325088501,
|
|
"epoch": 2.4535304415483368,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00043928634390771166,
|
|
"loss": 4.954,
|
|
"mean_token_accuracy": 0.19832768887281418,
|
|
"num_tokens": 54725080.0,
|
|
"step": 31535
|
|
},
|
|
{
|
|
"entropy": 5.430013513565063,
|
|
"epoch": 2.4539194709200545,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00043926740530505603,
|
|
"loss": 4.9868,
|
|
"mean_token_accuracy": 0.1958334594964981,
|
|
"num_tokens": 54733273.0,
|
|
"step": 31540
|
|
},
|
|
{
|
|
"entropy": 5.425298166275025,
|
|
"epoch": 2.454308500291772,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.000439248464209904,
|
|
"loss": 5.0402,
|
|
"mean_token_accuracy": 0.1899419143795967,
|
|
"num_tokens": 54742359.0,
|
|
"step": 31545
|
|
},
|
|
{
|
|
"entropy": 5.42931981086731,
|
|
"epoch": 2.4546975296634894,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.000439229520622543,
|
|
"loss": 5.0404,
|
|
"mean_token_accuracy": 0.18734922558069228,
|
|
"num_tokens": 54750360.0,
|
|
"step": 31550
|
|
},
|
|
{
|
|
"entropy": 5.392021942138672,
|
|
"epoch": 2.455086559035207,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0004392105745432603,
|
|
"loss": 4.9837,
|
|
"mean_token_accuracy": 0.19874288141727448,
|
|
"num_tokens": 54758663.0,
|
|
"step": 31555
|
|
},
|
|
{
|
|
"entropy": 5.392559576034546,
|
|
"epoch": 2.455475588406925,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004391916259723436,
|
|
"loss": 4.9805,
|
|
"mean_token_accuracy": 0.2016999140381813,
|
|
"num_tokens": 54767578.0,
|
|
"step": 31560
|
|
},
|
|
{
|
|
"entropy": 5.473572635650635,
|
|
"epoch": 2.4558646177786425,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00043917267491008023,
|
|
"loss": 5.1496,
|
|
"mean_token_accuracy": 0.18724444061517714,
|
|
"num_tokens": 54776651.0,
|
|
"step": 31565
|
|
},
|
|
{
|
|
"entropy": 5.432928848266601,
|
|
"epoch": 2.4562536471503598,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0004391537213567579,
|
|
"loss": 5.0561,
|
|
"mean_token_accuracy": 0.18541578948497772,
|
|
"num_tokens": 54784865.0,
|
|
"step": 31570
|
|
},
|
|
{
|
|
"entropy": 5.344668006896972,
|
|
"epoch": 2.4566426765220775,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004391347653126641,
|
|
"loss": 4.8923,
|
|
"mean_token_accuracy": 0.19960398972034454,
|
|
"num_tokens": 54794367.0,
|
|
"step": 31575
|
|
},
|
|
{
|
|
"entropy": 5.305246019363404,
|
|
"epoch": 2.457031705893795,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00043911580677808646,
|
|
"loss": 4.9057,
|
|
"mean_token_accuracy": 0.20029204040765763,
|
|
"num_tokens": 54802606.0,
|
|
"step": 31580
|
|
},
|
|
{
|
|
"entropy": 5.387216281890869,
|
|
"epoch": 2.4574207352655124,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00043909684575331264,
|
|
"loss": 4.952,
|
|
"mean_token_accuracy": 0.203133924305439,
|
|
"num_tokens": 54812207.0,
|
|
"step": 31585
|
|
},
|
|
{
|
|
"entropy": 5.428878402709961,
|
|
"epoch": 2.45780976463723,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0004390778822386304,
|
|
"loss": 4.9956,
|
|
"mean_token_accuracy": 0.20123641937971115,
|
|
"num_tokens": 54821047.0,
|
|
"step": 31590
|
|
},
|
|
{
|
|
"entropy": 5.510456323623657,
|
|
"epoch": 2.458198794008948,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00043905891623432754,
|
|
"loss": 5.1451,
|
|
"mean_token_accuracy": 0.1864195227622986,
|
|
"num_tokens": 54829849.0,
|
|
"step": 31595
|
|
},
|
|
{
|
|
"entropy": 5.391123580932617,
|
|
"epoch": 2.458587823380665,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00043903994774069165,
|
|
"loss": 5.0954,
|
|
"mean_token_accuracy": 0.188053460419178,
|
|
"num_tokens": 54838690.0,
|
|
"step": 31600
|
|
},
|
|
{
|
|
"entropy": 5.437462329864502,
|
|
"epoch": 2.4589768527523828,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004390209767580107,
|
|
"loss": 5.0307,
|
|
"mean_token_accuracy": 0.19463216960430146,
|
|
"num_tokens": 54847795.0,
|
|
"step": 31605
|
|
},
|
|
{
|
|
"entropy": 5.4592711448669435,
|
|
"epoch": 2.4593658821241005,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004390020032865725,
|
|
"loss": 4.9514,
|
|
"mean_token_accuracy": 0.20548547059297562,
|
|
"num_tokens": 54856676.0,
|
|
"step": 31610
|
|
},
|
|
{
|
|
"entropy": 5.390367221832276,
|
|
"epoch": 2.4597549114958177,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004389830273266649,
|
|
"loss": 4.9823,
|
|
"mean_token_accuracy": 0.19824273586273194,
|
|
"num_tokens": 54865177.0,
|
|
"step": 31615
|
|
},
|
|
{
|
|
"entropy": 5.35674557685852,
|
|
"epoch": 2.4601439408675354,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00043896404887857596,
|
|
"loss": 4.9507,
|
|
"mean_token_accuracy": 0.1900181069970131,
|
|
"num_tokens": 54872921.0,
|
|
"step": 31620
|
|
},
|
|
{
|
|
"entropy": 5.3780323505401615,
|
|
"epoch": 2.460532970239253,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004389450679425935,
|
|
"loss": 5.0865,
|
|
"mean_token_accuracy": 0.1900602549314499,
|
|
"num_tokens": 54882045.0,
|
|
"step": 31625
|
|
},
|
|
{
|
|
"entropy": 5.49856915473938,
|
|
"epoch": 2.460921999610971,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004389260845190055,
|
|
"loss": 5.0366,
|
|
"mean_token_accuracy": 0.1943578079342842,
|
|
"num_tokens": 54890647.0,
|
|
"step": 31630
|
|
},
|
|
{
|
|
"entropy": 5.400425767898559,
|
|
"epoch": 2.461311028982688,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00043890709860810014,
|
|
"loss": 5.0238,
|
|
"mean_token_accuracy": 0.19285185188055037,
|
|
"num_tokens": 54898958.0,
|
|
"step": 31635
|
|
},
|
|
{
|
|
"entropy": 5.386109113693237,
|
|
"epoch": 2.4617000583544058,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00043888811021016545,
|
|
"loss": 5.0685,
|
|
"mean_token_accuracy": 0.18876637518405914,
|
|
"num_tokens": 54907329.0,
|
|
"step": 31640
|
|
},
|
|
{
|
|
"entropy": 5.401598644256592,
|
|
"epoch": 2.4620890877261234,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00043886911932548953,
|
|
"loss": 5.0569,
|
|
"mean_token_accuracy": 0.20338728427886962,
|
|
"num_tokens": 54916093.0,
|
|
"step": 31645
|
|
},
|
|
{
|
|
"entropy": 5.472186517715454,
|
|
"epoch": 2.4624781170978407,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004388501259543605,
|
|
"loss": 5.0589,
|
|
"mean_token_accuracy": 0.18994611650705337,
|
|
"num_tokens": 54925030.0,
|
|
"step": 31650
|
|
},
|
|
{
|
|
"entropy": 5.4434614181518555,
|
|
"epoch": 2.4628671464695584,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004388311300970667,
|
|
"loss": 4.9921,
|
|
"mean_token_accuracy": 0.1909564346075058,
|
|
"num_tokens": 54933719.0,
|
|
"step": 31655
|
|
},
|
|
{
|
|
"entropy": 5.419138097763062,
|
|
"epoch": 2.463256175841276,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004388121317538962,
|
|
"loss": 5.0991,
|
|
"mean_token_accuracy": 0.1892107382416725,
|
|
"num_tokens": 54941533.0,
|
|
"step": 31660
|
|
},
|
|
{
|
|
"entropy": 5.341114139556884,
|
|
"epoch": 2.463645205212994,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004387931309251374,
|
|
"loss": 4.9574,
|
|
"mean_token_accuracy": 0.2051786243915558,
|
|
"num_tokens": 54949819.0,
|
|
"step": 31665
|
|
},
|
|
{
|
|
"entropy": 5.404318809509277,
|
|
"epoch": 2.464034234584711,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004387741276110785,
|
|
"loss": 5.0634,
|
|
"mean_token_accuracy": 0.19188826084136962,
|
|
"num_tokens": 54959199.0,
|
|
"step": 31670
|
|
},
|
|
{
|
|
"entropy": 5.460726356506347,
|
|
"epoch": 2.4644232639564287,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00043875512181200784,
|
|
"loss": 5.075,
|
|
"mean_token_accuracy": 0.19334174394607545,
|
|
"num_tokens": 54967742.0,
|
|
"step": 31675
|
|
},
|
|
{
|
|
"entropy": 5.4955236434936525,
|
|
"epoch": 2.4648122933281464,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004387361135282139,
|
|
"loss": 5.1493,
|
|
"mean_token_accuracy": 0.18444453775882722,
|
|
"num_tokens": 54976419.0,
|
|
"step": 31680
|
|
},
|
|
{
|
|
"entropy": 5.4501996517181395,
|
|
"epoch": 2.4652013226998637,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00043871710275998507,
|
|
"loss": 5.0073,
|
|
"mean_token_accuracy": 0.19629710614681245,
|
|
"num_tokens": 54984975.0,
|
|
"step": 31685
|
|
},
|
|
{
|
|
"entropy": 5.44846773147583,
|
|
"epoch": 2.4655903520715814,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004386980895076097,
|
|
"loss": 5.0417,
|
|
"mean_token_accuracy": 0.19153044521808624,
|
|
"num_tokens": 54993746.0,
|
|
"step": 31690
|
|
},
|
|
{
|
|
"entropy": 5.413451194763184,
|
|
"epoch": 2.465979381443299,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00043867907377137646,
|
|
"loss": 4.9173,
|
|
"mean_token_accuracy": 0.2067538395524025,
|
|
"num_tokens": 55002130.0,
|
|
"step": 31695
|
|
},
|
|
{
|
|
"entropy": 5.3680178165435795,
|
|
"epoch": 2.4663684108150163,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00043866005555157376,
|
|
"loss": 5.0709,
|
|
"mean_token_accuracy": 0.19386010617017746,
|
|
"num_tokens": 55010790.0,
|
|
"step": 31700
|
|
},
|
|
{
|
|
"entropy": 5.4195287227630615,
|
|
"epoch": 2.466757440186734,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004386410348484903,
|
|
"loss": 5.0081,
|
|
"mean_token_accuracy": 0.1948359876871109,
|
|
"num_tokens": 55019542.0,
|
|
"step": 31705
|
|
},
|
|
{
|
|
"entropy": 5.325864648818969,
|
|
"epoch": 2.4671464695584517,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004386220116624145,
|
|
"loss": 4.8675,
|
|
"mean_token_accuracy": 0.2030348613858223,
|
|
"num_tokens": 55029230.0,
|
|
"step": 31710
|
|
},
|
|
{
|
|
"entropy": 5.352613353729248,
|
|
"epoch": 2.467535498930169,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00043860298599363506,
|
|
"loss": 4.9841,
|
|
"mean_token_accuracy": 0.196756049990654,
|
|
"num_tokens": 55037371.0,
|
|
"step": 31715
|
|
},
|
|
{
|
|
"entropy": 5.324502658843994,
|
|
"epoch": 2.4679245283018867,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004385839578424408,
|
|
"loss": 4.9824,
|
|
"mean_token_accuracy": 0.19824841469526291,
|
|
"num_tokens": 55046022.0,
|
|
"step": 31720
|
|
},
|
|
{
|
|
"entropy": 5.409523296356201,
|
|
"epoch": 2.4683135576736044,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00043856492720912037,
|
|
"loss": 4.962,
|
|
"mean_token_accuracy": 0.20505266934633254,
|
|
"num_tokens": 55054713.0,
|
|
"step": 31725
|
|
},
|
|
{
|
|
"entropy": 5.2610764503479,
|
|
"epoch": 2.468702587045322,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004385458940939624,
|
|
"loss": 4.9442,
|
|
"mean_token_accuracy": 0.20973241031169892,
|
|
"num_tokens": 55064317.0,
|
|
"step": 31730
|
|
},
|
|
{
|
|
"entropy": 5.357292890548706,
|
|
"epoch": 2.4690916164170393,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004385268584972559,
|
|
"loss": 5.0134,
|
|
"mean_token_accuracy": 0.20058398246765136,
|
|
"num_tokens": 55072700.0,
|
|
"step": 31735
|
|
},
|
|
{
|
|
"entropy": 5.472076559066773,
|
|
"epoch": 2.469480645788757,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0004385078204192896,
|
|
"loss": 5.1068,
|
|
"mean_token_accuracy": 0.1919834941625595,
|
|
"num_tokens": 55081794.0,
|
|
"step": 31740
|
|
},
|
|
{
|
|
"entropy": 5.513136386871338,
|
|
"epoch": 2.4698696751604747,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004384887798603523,
|
|
"loss": 5.1075,
|
|
"mean_token_accuracy": 0.19148558229207993,
|
|
"num_tokens": 55090665.0,
|
|
"step": 31745
|
|
},
|
|
{
|
|
"entropy": 5.439836597442627,
|
|
"epoch": 2.470258704532192,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.000438469736820733,
|
|
"loss": 5.0092,
|
|
"mean_token_accuracy": 0.1961147055029869,
|
|
"num_tokens": 55099306.0,
|
|
"step": 31750
|
|
},
|
|
{
|
|
"entropy": 5.416819095611572,
|
|
"epoch": 2.4706477339039097,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00043845069130072067,
|
|
"loss": 5.0827,
|
|
"mean_token_accuracy": 0.1913134440779686,
|
|
"num_tokens": 55108420.0,
|
|
"step": 31755
|
|
},
|
|
{
|
|
"entropy": 5.477166748046875,
|
|
"epoch": 2.4710367632756274,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004384316433006043,
|
|
"loss": 5.0027,
|
|
"mean_token_accuracy": 0.19205942004919052,
|
|
"num_tokens": 55116629.0,
|
|
"step": 31760
|
|
},
|
|
{
|
|
"entropy": 5.393901252746582,
|
|
"epoch": 2.471425792647345,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00043841259282067276,
|
|
"loss": 5.0274,
|
|
"mean_token_accuracy": 0.19324393421411515,
|
|
"num_tokens": 55125469.0,
|
|
"step": 31765
|
|
},
|
|
{
|
|
"entropy": 5.397736883163452,
|
|
"epoch": 2.4718148220190623,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00043839353986121533,
|
|
"loss": 5.0277,
|
|
"mean_token_accuracy": 0.19089193642139435,
|
|
"num_tokens": 55134194.0,
|
|
"step": 31770
|
|
},
|
|
{
|
|
"entropy": 5.473677730560302,
|
|
"epoch": 2.47220385139078,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004383744844225209,
|
|
"loss": 5.0695,
|
|
"mean_token_accuracy": 0.18959053605794907,
|
|
"num_tokens": 55142931.0,
|
|
"step": 31775
|
|
},
|
|
{
|
|
"entropy": 5.4274650573730465,
|
|
"epoch": 2.4725928807624977,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00043835542650487875,
|
|
"loss": 5.0565,
|
|
"mean_token_accuracy": 0.19448353499174117,
|
|
"num_tokens": 55152331.0,
|
|
"step": 31780
|
|
},
|
|
{
|
|
"entropy": 5.371088647842408,
|
|
"epoch": 2.472981910134215,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0004383363661085781,
|
|
"loss": 5.0192,
|
|
"mean_token_accuracy": 0.1962620958685875,
|
|
"num_tokens": 55160860.0,
|
|
"step": 31785
|
|
},
|
|
{
|
|
"entropy": 5.429840326309204,
|
|
"epoch": 2.4733709395059327,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004383173032339079,
|
|
"loss": 5.1012,
|
|
"mean_token_accuracy": 0.1875933140516281,
|
|
"num_tokens": 55169891.0,
|
|
"step": 31790
|
|
},
|
|
{
|
|
"entropy": 5.362275838851929,
|
|
"epoch": 2.4737599688776504,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004382982378811577,
|
|
"loss": 4.9995,
|
|
"mean_token_accuracy": 0.19984019845724105,
|
|
"num_tokens": 55178283.0,
|
|
"step": 31795
|
|
},
|
|
{
|
|
"entropy": 5.469861030578613,
|
|
"epoch": 2.474148998249368,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004382791700506166,
|
|
"loss": 5.0633,
|
|
"mean_token_accuracy": 0.18660385459661483,
|
|
"num_tokens": 55186683.0,
|
|
"step": 31800
|
|
},
|
|
{
|
|
"entropy": 5.357827091217041,
|
|
"epoch": 2.4745380276210853,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.000438260099742574,
|
|
"loss": 4.9045,
|
|
"mean_token_accuracy": 0.2043865904211998,
|
|
"num_tokens": 55194758.0,
|
|
"step": 31805
|
|
},
|
|
{
|
|
"entropy": 5.335516309738159,
|
|
"epoch": 2.474927056992803,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004382410269573192,
|
|
"loss": 4.9655,
|
|
"mean_token_accuracy": 0.20361442416906356,
|
|
"num_tokens": 55203171.0,
|
|
"step": 31810
|
|
},
|
|
{
|
|
"entropy": 5.443462324142456,
|
|
"epoch": 2.4753160863645203,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00043822195169514167,
|
|
"loss": 5.0185,
|
|
"mean_token_accuracy": 0.18922071903944016,
|
|
"num_tokens": 55210942.0,
|
|
"step": 31815
|
|
},
|
|
{
|
|
"entropy": 5.418969678878784,
|
|
"epoch": 2.475705115736238,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00043820287395633086,
|
|
"loss": 5.0964,
|
|
"mean_token_accuracy": 0.18942733407020568,
|
|
"num_tokens": 55219937.0,
|
|
"step": 31820
|
|
},
|
|
{
|
|
"entropy": 5.465828704833984,
|
|
"epoch": 2.4760941451079557,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004381837937411761,
|
|
"loss": 5.0759,
|
|
"mean_token_accuracy": 0.1958286300301552,
|
|
"num_tokens": 55229461.0,
|
|
"step": 31825
|
|
},
|
|
{
|
|
"entropy": 5.35172929763794,
|
|
"epoch": 2.4764831744796734,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00043816471104996706,
|
|
"loss": 4.9257,
|
|
"mean_token_accuracy": 0.19760338366031646,
|
|
"num_tokens": 55237910.0,
|
|
"step": 31830
|
|
},
|
|
{
|
|
"entropy": 5.358775234222412,
|
|
"epoch": 2.4768722038513906,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004381456258829933,
|
|
"loss": 5.0004,
|
|
"mean_token_accuracy": 0.19409747719764708,
|
|
"num_tokens": 55246131.0,
|
|
"step": 31835
|
|
},
|
|
{
|
|
"entropy": 5.392410326004028,
|
|
"epoch": 2.4772612332231083,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00043812653824054426,
|
|
"loss": 5.0147,
|
|
"mean_token_accuracy": 0.19725086241960527,
|
|
"num_tokens": 55254677.0,
|
|
"step": 31840
|
|
},
|
|
{
|
|
"entropy": 5.400393295288086,
|
|
"epoch": 2.477650262594826,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0004381074481229097,
|
|
"loss": 5.0072,
|
|
"mean_token_accuracy": 0.1921542152762413,
|
|
"num_tokens": 55263496.0,
|
|
"step": 31845
|
|
},
|
|
{
|
|
"entropy": 5.360985136032104,
|
|
"epoch": 2.4780392919665433,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004380883555303791,
|
|
"loss": 4.9324,
|
|
"mean_token_accuracy": 0.20014408826828003,
|
|
"num_tokens": 55272614.0,
|
|
"step": 31850
|
|
},
|
|
{
|
|
"entropy": 5.372060537338257,
|
|
"epoch": 2.478428321338261,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004380692604632424,
|
|
"loss": 4.9718,
|
|
"mean_token_accuracy": 0.19297547787427902,
|
|
"num_tokens": 55281595.0,
|
|
"step": 31855
|
|
},
|
|
{
|
|
"entropy": 5.515956974029541,
|
|
"epoch": 2.4788173507099787,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.00043805016292178923,
|
|
"loss": 5.1061,
|
|
"mean_token_accuracy": 0.19527381360530854,
|
|
"num_tokens": 55291089.0,
|
|
"step": 31860
|
|
},
|
|
{
|
|
"entropy": 5.366569519042969,
|
|
"epoch": 2.4792063800816964,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004380310629063094,
|
|
"loss": 4.8802,
|
|
"mean_token_accuracy": 0.20865502208471298,
|
|
"num_tokens": 55299505.0,
|
|
"step": 31865
|
|
},
|
|
{
|
|
"entropy": 5.43313307762146,
|
|
"epoch": 2.4795954094534136,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0004380119604170925,
|
|
"loss": 5.0699,
|
|
"mean_token_accuracy": 0.19181161224842072,
|
|
"num_tokens": 55307383.0,
|
|
"step": 31870
|
|
},
|
|
{
|
|
"entropy": 5.464498805999756,
|
|
"epoch": 2.4799844388251313,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00043799285545442876,
|
|
"loss": 5.0777,
|
|
"mean_token_accuracy": 0.185017953813076,
|
|
"num_tokens": 55316312.0,
|
|
"step": 31875
|
|
},
|
|
{
|
|
"entropy": 5.397231912612915,
|
|
"epoch": 2.480373468196849,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004379737480186078,
|
|
"loss": 5.102,
|
|
"mean_token_accuracy": 0.19390355199575424,
|
|
"num_tokens": 55325818.0,
|
|
"step": 31880
|
|
},
|
|
{
|
|
"entropy": 5.3838049411773685,
|
|
"epoch": 2.4807624975685663,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00043795463810991956,
|
|
"loss": 5.0596,
|
|
"mean_token_accuracy": 0.18493707925081254,
|
|
"num_tokens": 55334641.0,
|
|
"step": 31885
|
|
},
|
|
{
|
|
"entropy": 5.474783563613892,
|
|
"epoch": 2.481151526940284,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004379355257286541,
|
|
"loss": 5.0276,
|
|
"mean_token_accuracy": 0.192593814432621,
|
|
"num_tokens": 55343109.0,
|
|
"step": 31890
|
|
},
|
|
{
|
|
"entropy": 5.373204517364502,
|
|
"epoch": 2.4815405563120017,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00043791641087510136,
|
|
"loss": 4.9776,
|
|
"mean_token_accuracy": 0.2059226557612419,
|
|
"num_tokens": 55351832.0,
|
|
"step": 31895
|
|
},
|
|
{
|
|
"entropy": 5.411711931228638,
|
|
"epoch": 2.4819295856837194,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0004378972935495514,
|
|
"loss": 5.0625,
|
|
"mean_token_accuracy": 0.19590418338775634,
|
|
"num_tokens": 55361688.0,
|
|
"step": 31900
|
|
},
|
|
{
|
|
"entropy": 5.421454572677613,
|
|
"epoch": 2.4823186150554366,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004378781737522943,
|
|
"loss": 5.0235,
|
|
"mean_token_accuracy": 0.1881646990776062,
|
|
"num_tokens": 55370572.0,
|
|
"step": 31905
|
|
},
|
|
{
|
|
"entropy": 5.424241161346435,
|
|
"epoch": 2.4827076444271543,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00043785905148362007,
|
|
"loss": 4.9974,
|
|
"mean_token_accuracy": 0.2002405896782875,
|
|
"num_tokens": 55379134.0,
|
|
"step": 31910
|
|
},
|
|
{
|
|
"entropy": 5.37305097579956,
|
|
"epoch": 2.483096673798872,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00043783992674381903,
|
|
"loss": 4.9564,
|
|
"mean_token_accuracy": 0.20215173065662384,
|
|
"num_tokens": 55387312.0,
|
|
"step": 31915
|
|
},
|
|
{
|
|
"entropy": 5.2777087688446045,
|
|
"epoch": 2.4834857031705893,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00043782079953318126,
|
|
"loss": 4.8836,
|
|
"mean_token_accuracy": 0.2041994348168373,
|
|
"num_tokens": 55396208.0,
|
|
"step": 31920
|
|
},
|
|
{
|
|
"entropy": 5.385955905914306,
|
|
"epoch": 2.483874732542307,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004378016698519971,
|
|
"loss": 5.0172,
|
|
"mean_token_accuracy": 0.19913000017404556,
|
|
"num_tokens": 55404142.0,
|
|
"step": 31925
|
|
},
|
|
{
|
|
"entropy": 5.3742852210998535,
|
|
"epoch": 2.4842637619140246,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00043778253770055666,
|
|
"loss": 4.9264,
|
|
"mean_token_accuracy": 0.20353603065013887,
|
|
"num_tokens": 55412227.0,
|
|
"step": 31930
|
|
},
|
|
{
|
|
"entropy": 5.342798662185669,
|
|
"epoch": 2.484652791285742,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00043776340307915033,
|
|
"loss": 4.9405,
|
|
"mean_token_accuracy": 0.19796893149614334,
|
|
"num_tokens": 55420566.0,
|
|
"step": 31935
|
|
},
|
|
{
|
|
"entropy": 5.38083963394165,
|
|
"epoch": 2.4850418206574596,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0004377442659880684,
|
|
"loss": 4.9209,
|
|
"mean_token_accuracy": 0.2090641051530838,
|
|
"num_tokens": 55429456.0,
|
|
"step": 31940
|
|
},
|
|
{
|
|
"entropy": 5.327810335159302,
|
|
"epoch": 2.4854308500291773,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0004377251264276013,
|
|
"loss": 4.9318,
|
|
"mean_token_accuracy": 0.20317727327346802,
|
|
"num_tokens": 55437607.0,
|
|
"step": 31945
|
|
},
|
|
{
|
|
"entropy": 5.312427997589111,
|
|
"epoch": 2.4858198794008945,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00043770598439803936,
|
|
"loss": 4.9491,
|
|
"mean_token_accuracy": 0.20227609127759932,
|
|
"num_tokens": 55446654.0,
|
|
"step": 31950
|
|
},
|
|
{
|
|
"entropy": 5.394081115722656,
|
|
"epoch": 2.4862089087726122,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00043768683989967304,
|
|
"loss": 5.0271,
|
|
"mean_token_accuracy": 0.19802693873643876,
|
|
"num_tokens": 55454963.0,
|
|
"step": 31955
|
|
},
|
|
{
|
|
"entropy": 5.375313425064087,
|
|
"epoch": 2.48659793814433,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00043766769293279294,
|
|
"loss": 4.9715,
|
|
"mean_token_accuracy": 0.1918281078338623,
|
|
"num_tokens": 55463259.0,
|
|
"step": 31960
|
|
},
|
|
{
|
|
"entropy": 5.315908765792846,
|
|
"epoch": 2.4869869675160476,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00043764854349768957,
|
|
"loss": 4.9653,
|
|
"mean_token_accuracy": 0.19214270859956742,
|
|
"num_tokens": 55472390.0,
|
|
"step": 31965
|
|
},
|
|
{
|
|
"entropy": 5.430684614181518,
|
|
"epoch": 2.487375996887765,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00043762939159465333,
|
|
"loss": 5.059,
|
|
"mean_token_accuracy": 0.18985690474510192,
|
|
"num_tokens": 55480821.0,
|
|
"step": 31970
|
|
},
|
|
{
|
|
"entropy": 5.476782655715942,
|
|
"epoch": 2.4877650262594826,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00043761023722397495,
|
|
"loss": 5.0258,
|
|
"mean_token_accuracy": 0.19679305106401443,
|
|
"num_tokens": 55489270.0,
|
|
"step": 31975
|
|
},
|
|
{
|
|
"entropy": 5.298780632019043,
|
|
"epoch": 2.4881540556312003,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.000437591080385945,
|
|
"loss": 4.9678,
|
|
"mean_token_accuracy": 0.20382864624261857,
|
|
"num_tokens": 55497811.0,
|
|
"step": 31980
|
|
},
|
|
{
|
|
"entropy": 5.340275287628174,
|
|
"epoch": 2.4885430850029175,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004375719210808543,
|
|
"loss": 4.9206,
|
|
"mean_token_accuracy": 0.19528032541275026,
|
|
"num_tokens": 55507068.0,
|
|
"step": 31985
|
|
},
|
|
{
|
|
"entropy": 5.375517272949219,
|
|
"epoch": 2.4889321143746352,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0004375527593089934,
|
|
"loss": 4.9117,
|
|
"mean_token_accuracy": 0.2025772288441658,
|
|
"num_tokens": 55515922.0,
|
|
"step": 31990
|
|
},
|
|
{
|
|
"entropy": 5.3581703186035154,
|
|
"epoch": 2.489321143746353,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004375335950706531,
|
|
"loss": 4.9727,
|
|
"mean_token_accuracy": 0.19381050318479537,
|
|
"num_tokens": 55524839.0,
|
|
"step": 31995
|
|
},
|
|
{
|
|
"entropy": 5.223787307739258,
|
|
"epoch": 2.4897101731180706,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004375144283661242,
|
|
"loss": 4.8675,
|
|
"mean_token_accuracy": 0.20274682939052582,
|
|
"num_tokens": 55534426.0,
|
|
"step": 32000
|
|
},
|
|
{
|
|
"entropy": 5.370130443572998,
|
|
"epoch": 2.490099202489788,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004374952591956975,
|
|
"loss": 5.0059,
|
|
"mean_token_accuracy": 0.19730344116687776,
|
|
"num_tokens": 55542773.0,
|
|
"step": 32005
|
|
},
|
|
{
|
|
"entropy": 5.438336944580078,
|
|
"epoch": 2.4904882318615056,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00043747608755966396,
|
|
"loss": 4.9817,
|
|
"mean_token_accuracy": 0.1988343045115471,
|
|
"num_tokens": 55551582.0,
|
|
"step": 32010
|
|
},
|
|
{
|
|
"entropy": 5.477785587310791,
|
|
"epoch": 2.4908772612332233,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004374569134583143,
|
|
"loss": 5.1239,
|
|
"mean_token_accuracy": 0.18770601898431777,
|
|
"num_tokens": 55561067.0,
|
|
"step": 32015
|
|
},
|
|
{
|
|
"entropy": 5.37761287689209,
|
|
"epoch": 2.4912662906049405,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004374377368919396,
|
|
"loss": 4.9664,
|
|
"mean_token_accuracy": 0.20275555402040482,
|
|
"num_tokens": 55569677.0,
|
|
"step": 32020
|
|
},
|
|
{
|
|
"entropy": 5.468303108215332,
|
|
"epoch": 2.4916553199766582,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00043741855786083085,
|
|
"loss": 5.1617,
|
|
"mean_token_accuracy": 0.18644483536481857,
|
|
"num_tokens": 55578391.0,
|
|
"step": 32025
|
|
},
|
|
{
|
|
"entropy": 5.466739273071289,
|
|
"epoch": 2.492044349348376,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00043739937636527894,
|
|
"loss": 5.0601,
|
|
"mean_token_accuracy": 0.19299477338790894,
|
|
"num_tokens": 55587074.0,
|
|
"step": 32030
|
|
},
|
|
{
|
|
"entropy": 5.441026020050049,
|
|
"epoch": 2.492433378720093,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00043738019240557494,
|
|
"loss": 4.9932,
|
|
"mean_token_accuracy": 0.1920644149184227,
|
|
"num_tokens": 55596944.0,
|
|
"step": 32035
|
|
},
|
|
{
|
|
"entropy": 5.427092552185059,
|
|
"epoch": 2.492822408091811,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00043736100598201,
|
|
"loss": 4.9841,
|
|
"mean_token_accuracy": 0.1986925184726715,
|
|
"num_tokens": 55605763.0,
|
|
"step": 32040
|
|
},
|
|
{
|
|
"entropy": 5.339112091064453,
|
|
"epoch": 2.4932114374635286,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004373418170948752,
|
|
"loss": 5.0401,
|
|
"mean_token_accuracy": 0.18951776176691054,
|
|
"num_tokens": 55614693.0,
|
|
"step": 32045
|
|
},
|
|
{
|
|
"entropy": 5.5140156745910645,
|
|
"epoch": 2.493600466835246,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004373226257444617,
|
|
"loss": 5.1827,
|
|
"mean_token_accuracy": 0.18380513340234755,
|
|
"num_tokens": 55623520.0,
|
|
"step": 32050
|
|
},
|
|
{
|
|
"entropy": 5.417255783081055,
|
|
"epoch": 2.4939894962069635,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0004373034319310608,
|
|
"loss": 4.9728,
|
|
"mean_token_accuracy": 0.2006630852818489,
|
|
"num_tokens": 55631818.0,
|
|
"step": 32055
|
|
},
|
|
{
|
|
"entropy": 5.4602076530456545,
|
|
"epoch": 2.4943785255786812,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00043728423565496367,
|
|
"loss": 5.1028,
|
|
"mean_token_accuracy": 0.19003146439790725,
|
|
"num_tokens": 55641388.0,
|
|
"step": 32060
|
|
},
|
|
{
|
|
"entropy": 5.3405262470245365,
|
|
"epoch": 2.494767554950399,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004372650369164615,
|
|
"loss": 5.006,
|
|
"mean_token_accuracy": 0.20108869522809983,
|
|
"num_tokens": 55650374.0,
|
|
"step": 32065
|
|
},
|
|
{
|
|
"entropy": 5.41640305519104,
|
|
"epoch": 2.495156584322116,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00043724583571584565,
|
|
"loss": 5.0287,
|
|
"mean_token_accuracy": 0.19598036110401154,
|
|
"num_tokens": 55658598.0,
|
|
"step": 32070
|
|
},
|
|
{
|
|
"entropy": 5.4510054111480715,
|
|
"epoch": 2.495545613693834,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00043722663205340753,
|
|
"loss": 5.0724,
|
|
"mean_token_accuracy": 0.1806057408452034,
|
|
"num_tokens": 55666954.0,
|
|
"step": 32075
|
|
},
|
|
{
|
|
"entropy": 5.4412600040435795,
|
|
"epoch": 2.4959346430655516,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004372074259294384,
|
|
"loss": 4.9835,
|
|
"mean_token_accuracy": 0.20118986517190934,
|
|
"num_tokens": 55675451.0,
|
|
"step": 32080
|
|
},
|
|
{
|
|
"entropy": 5.414380073547363,
|
|
"epoch": 2.496323672437269,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004371882173442299,
|
|
"loss": 5.1101,
|
|
"mean_token_accuracy": 0.19092480540275575,
|
|
"num_tokens": 55683778.0,
|
|
"step": 32085
|
|
},
|
|
{
|
|
"entropy": 5.308280086517334,
|
|
"epoch": 2.4967127018089865,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00043716900629807323,
|
|
"loss": 4.9639,
|
|
"mean_token_accuracy": 0.2042096585035324,
|
|
"num_tokens": 55692440.0,
|
|
"step": 32090
|
|
},
|
|
{
|
|
"entropy": 5.391364240646363,
|
|
"epoch": 2.497101731180704,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00043714979279126006,
|
|
"loss": 4.9765,
|
|
"mean_token_accuracy": 0.19986994862556456,
|
|
"num_tokens": 55700648.0,
|
|
"step": 32095
|
|
},
|
|
{
|
|
"entropy": 5.398708391189575,
|
|
"epoch": 2.497490760552422,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004371305768240818,
|
|
"loss": 4.956,
|
|
"mean_token_accuracy": 0.2019503816962242,
|
|
"num_tokens": 55709515.0,
|
|
"step": 32100
|
|
},
|
|
{
|
|
"entropy": 5.391159915924073,
|
|
"epoch": 2.497879789924139,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004371113583968302,
|
|
"loss": 5.0679,
|
|
"mean_token_accuracy": 0.196664722263813,
|
|
"num_tokens": 55717876.0,
|
|
"step": 32105
|
|
},
|
|
{
|
|
"entropy": 5.397810077667236,
|
|
"epoch": 2.498268819295857,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004370921375097967,
|
|
"loss": 4.9978,
|
|
"mean_token_accuracy": 0.19241620302200318,
|
|
"num_tokens": 55726330.0,
|
|
"step": 32110
|
|
},
|
|
{
|
|
"entropy": 5.440371990203857,
|
|
"epoch": 2.4986578486675746,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.00043707291416327307,
|
|
"loss": 5.0576,
|
|
"mean_token_accuracy": 0.19379918575286864,
|
|
"num_tokens": 55736102.0,
|
|
"step": 32115
|
|
},
|
|
{
|
|
"entropy": 5.469717073440552,
|
|
"epoch": 2.499046878039292,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0004370536883575509,
|
|
"loss": 5.0858,
|
|
"mean_token_accuracy": 0.19848588705062867,
|
|
"num_tokens": 55744022.0,
|
|
"step": 32120
|
|
},
|
|
{
|
|
"entropy": 5.382108926773071,
|
|
"epoch": 2.4994359074110095,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004370344600929219,
|
|
"loss": 5.0201,
|
|
"mean_token_accuracy": 0.19545325487852097,
|
|
"num_tokens": 55752613.0,
|
|
"step": 32125
|
|
},
|
|
{
|
|
"entropy": 5.37735276222229,
|
|
"epoch": 2.499824936782727,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004370152293696779,
|
|
"loss": 4.9957,
|
|
"mean_token_accuracy": 0.20103242248296738,
|
|
"num_tokens": 55761402.0,
|
|
"step": 32130
|
|
},
|
|
{
|
|
"entropy": 5.416461372375489,
|
|
"epoch": 2.500213966154445,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004369959961881107,
|
|
"loss": 4.9034,
|
|
"mean_token_accuracy": 0.19852776676416398,
|
|
"num_tokens": 55769630.0,
|
|
"step": 32135
|
|
},
|
|
{
|
|
"entropy": 5.372434139251709,
|
|
"epoch": 2.500602995526162,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.000436976760548512,
|
|
"loss": 4.9992,
|
|
"mean_token_accuracy": 0.20116361677646638,
|
|
"num_tokens": 55777928.0,
|
|
"step": 32140
|
|
},
|
|
{
|
|
"entropy": 5.399435567855835,
|
|
"epoch": 2.50099202489788,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00043695752245117393,
|
|
"loss": 5.0049,
|
|
"mean_token_accuracy": 0.19648951143026352,
|
|
"num_tokens": 55786585.0,
|
|
"step": 32145
|
|
},
|
|
{
|
|
"entropy": 5.382568597793579,
|
|
"epoch": 2.501381054269597,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004369382818963882,
|
|
"loss": 4.9119,
|
|
"mean_token_accuracy": 0.20592911839485167,
|
|
"num_tokens": 55795565.0,
|
|
"step": 32150
|
|
},
|
|
{
|
|
"entropy": 5.370478296279908,
|
|
"epoch": 2.501770083641315,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004369190388844467,
|
|
"loss": 4.9958,
|
|
"mean_token_accuracy": 0.19118421226739885,
|
|
"num_tokens": 55804211.0,
|
|
"step": 32155
|
|
},
|
|
{
|
|
"entropy": 5.335606813430786,
|
|
"epoch": 2.5021591130130325,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00043689979341564154,
|
|
"loss": 5.0047,
|
|
"mean_token_accuracy": 0.19293981343507766,
|
|
"num_tokens": 55812604.0,
|
|
"step": 32160
|
|
},
|
|
{
|
|
"entropy": 5.387471103668213,
|
|
"epoch": 2.50254814238475,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004368805454902648,
|
|
"loss": 4.9855,
|
|
"mean_token_accuracy": 0.19416254609823227,
|
|
"num_tokens": 55821293.0,
|
|
"step": 32165
|
|
},
|
|
{
|
|
"entropy": 5.39742078781128,
|
|
"epoch": 2.5029371717564675,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00043686129510860826,
|
|
"loss": 4.9292,
|
|
"mean_token_accuracy": 0.19681094884872435,
|
|
"num_tokens": 55830423.0,
|
|
"step": 32170
|
|
},
|
|
{
|
|
"entropy": 5.434660720825195,
|
|
"epoch": 2.503326201128185,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00043684204227096435,
|
|
"loss": 5.0309,
|
|
"mean_token_accuracy": 0.18779256343841552,
|
|
"num_tokens": 55838889.0,
|
|
"step": 32175
|
|
},
|
|
{
|
|
"entropy": 5.403591823577881,
|
|
"epoch": 2.503715230499903,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.000436822786977625,
|
|
"loss": 5.0213,
|
|
"mean_token_accuracy": 0.19747687131166458,
|
|
"num_tokens": 55846670.0,
|
|
"step": 32180
|
|
},
|
|
{
|
|
"entropy": 5.4328642845153805,
|
|
"epoch": 2.50410425987162,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00043680352922888244,
|
|
"loss": 5.0455,
|
|
"mean_token_accuracy": 0.19460490047931672,
|
|
"num_tokens": 55855341.0,
|
|
"step": 32185
|
|
},
|
|
{
|
|
"entropy": 5.454333686828614,
|
|
"epoch": 2.504493289243338,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004367842690250288,
|
|
"loss": 4.9966,
|
|
"mean_token_accuracy": 0.193300062417984,
|
|
"num_tokens": 55863491.0,
|
|
"step": 32190
|
|
},
|
|
{
|
|
"entropy": 5.3293314456939695,
|
|
"epoch": 2.5048823186150555,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004367650063663565,
|
|
"loss": 4.9247,
|
|
"mean_token_accuracy": 0.20173680186271667,
|
|
"num_tokens": 55872346.0,
|
|
"step": 32195
|
|
},
|
|
{
|
|
"entropy": 5.3065488815307615,
|
|
"epoch": 2.505271347986773,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0004367457412531576,
|
|
"loss": 4.9312,
|
|
"mean_token_accuracy": 0.2024470329284668,
|
|
"num_tokens": 55880672.0,
|
|
"step": 32200
|
|
},
|
|
{
|
|
"entropy": 5.470913124084473,
|
|
"epoch": 2.5056603773584905,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0004367264736857245,
|
|
"loss": 5.0548,
|
|
"mean_token_accuracy": 0.1957331195473671,
|
|
"num_tokens": 55888938.0,
|
|
"step": 32205
|
|
},
|
|
{
|
|
"entropy": 5.404807090759277,
|
|
"epoch": 2.506049406730208,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004367072036643497,
|
|
"loss": 4.9264,
|
|
"mean_token_accuracy": 0.20200915336608888,
|
|
"num_tokens": 55897522.0,
|
|
"step": 32210
|
|
},
|
|
{
|
|
"entropy": 5.389359664916992,
|
|
"epoch": 2.506438436101926,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.00043668793118932536,
|
|
"loss": 4.975,
|
|
"mean_token_accuracy": 0.1948966920375824,
|
|
"num_tokens": 55905425.0,
|
|
"step": 32215
|
|
},
|
|
{
|
|
"entropy": 5.356124687194824,
|
|
"epoch": 2.506827465473643,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00043666865626094405,
|
|
"loss": 4.9913,
|
|
"mean_token_accuracy": 0.19769603312015532,
|
|
"num_tokens": 55913990.0,
|
|
"step": 32220
|
|
},
|
|
{
|
|
"entropy": 5.5398290157318115,
|
|
"epoch": 2.507216494845361,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00043664937887949825,
|
|
"loss": 5.157,
|
|
"mean_token_accuracy": 0.18768719136714934,
|
|
"num_tokens": 55922899.0,
|
|
"step": 32225
|
|
},
|
|
{
|
|
"entropy": 5.43485918045044,
|
|
"epoch": 2.5076055242170785,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004366300990452803,
|
|
"loss": 4.9839,
|
|
"mean_token_accuracy": 0.1956053227186203,
|
|
"num_tokens": 55930935.0,
|
|
"step": 32230
|
|
},
|
|
{
|
|
"entropy": 5.433703947067261,
|
|
"epoch": 2.507994553588796,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00043661081675858295,
|
|
"loss": 5.0383,
|
|
"mean_token_accuracy": 0.19628583788871765,
|
|
"num_tokens": 55939258.0,
|
|
"step": 32235
|
|
},
|
|
{
|
|
"entropy": 5.374581670761108,
|
|
"epoch": 2.5083835829605134,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00043659153201969865,
|
|
"loss": 5.044,
|
|
"mean_token_accuracy": 0.19572957009077072,
|
|
"num_tokens": 55947672.0,
|
|
"step": 32240
|
|
},
|
|
{
|
|
"entropy": 5.386348152160645,
|
|
"epoch": 2.508772612332231,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004365722448289201,
|
|
"loss": 5.0314,
|
|
"mean_token_accuracy": 0.1968951165676117,
|
|
"num_tokens": 55956251.0,
|
|
"step": 32245
|
|
},
|
|
{
|
|
"entropy": 5.335434865951538,
|
|
"epoch": 2.5091616417039484,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004365529551865399,
|
|
"loss": 4.8701,
|
|
"mean_token_accuracy": 0.2046285793185234,
|
|
"num_tokens": 55965038.0,
|
|
"step": 32250
|
|
},
|
|
{
|
|
"entropy": 5.446961975097656,
|
|
"epoch": 2.509550671075666,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00043653366309285066,
|
|
"loss": 5.0646,
|
|
"mean_token_accuracy": 0.18491360992193223,
|
|
"num_tokens": 55973140.0,
|
|
"step": 32255
|
|
},
|
|
{
|
|
"entropy": 5.389738464355469,
|
|
"epoch": 2.509939700447384,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004365143685481452,
|
|
"loss": 5.0044,
|
|
"mean_token_accuracy": 0.19442484378814698,
|
|
"num_tokens": 55981097.0,
|
|
"step": 32260
|
|
},
|
|
{
|
|
"entropy": 5.343953275680542,
|
|
"epoch": 2.5103287298191015,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004364950715527164,
|
|
"loss": 4.9036,
|
|
"mean_token_accuracy": 0.20392945408821106,
|
|
"num_tokens": 55990077.0,
|
|
"step": 32265
|
|
},
|
|
{
|
|
"entropy": 5.363574028015137,
|
|
"epoch": 2.5107177591908187,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004364757721068568,
|
|
"loss": 5.0265,
|
|
"mean_token_accuracy": 0.20098851919174193,
|
|
"num_tokens": 55999289.0,
|
|
"step": 32270
|
|
},
|
|
{
|
|
"entropy": 5.418304395675659,
|
|
"epoch": 2.5111067885625364,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00043645647021085945,
|
|
"loss": 4.9274,
|
|
"mean_token_accuracy": 0.20525295287370682,
|
|
"num_tokens": 56007736.0,
|
|
"step": 32275
|
|
},
|
|
{
|
|
"entropy": 5.390245580673218,
|
|
"epoch": 2.511495817934254,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00043643716586501706,
|
|
"loss": 4.9744,
|
|
"mean_token_accuracy": 0.19886955618858337,
|
|
"num_tokens": 56016623.0,
|
|
"step": 32280
|
|
},
|
|
{
|
|
"entropy": 5.425648498535156,
|
|
"epoch": 2.5118848473059714,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00043641785906962276,
|
|
"loss": 4.9927,
|
|
"mean_token_accuracy": 0.2006028711795807,
|
|
"num_tokens": 56024536.0,
|
|
"step": 32285
|
|
},
|
|
{
|
|
"entropy": 5.361474275588989,
|
|
"epoch": 2.512273876677689,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004363985498249693,
|
|
"loss": 5.0418,
|
|
"mean_token_accuracy": 0.19517133384943008,
|
|
"num_tokens": 56033618.0,
|
|
"step": 32290
|
|
},
|
|
{
|
|
"entropy": 5.421626615524292,
|
|
"epoch": 2.512662906049407,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00043637923813134974,
|
|
"loss": 5.0846,
|
|
"mean_token_accuracy": 0.19119500666856765,
|
|
"num_tokens": 56042836.0,
|
|
"step": 32295
|
|
},
|
|
{
|
|
"entropy": 5.430089521408081,
|
|
"epoch": 2.5130519354211245,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00043635992398905713,
|
|
"loss": 4.9915,
|
|
"mean_token_accuracy": 0.1890509843826294,
|
|
"num_tokens": 56051296.0,
|
|
"step": 32300
|
|
},
|
|
{
|
|
"entropy": 5.385789012908935,
|
|
"epoch": 2.5134409647928417,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004363406073983844,
|
|
"loss": 4.9637,
|
|
"mean_token_accuracy": 0.20308204889297485,
|
|
"num_tokens": 56060093.0,
|
|
"step": 32305
|
|
},
|
|
{
|
|
"entropy": 5.435589838027954,
|
|
"epoch": 2.5138299941645594,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00043632128835962485,
|
|
"loss": 4.9696,
|
|
"mean_token_accuracy": 0.19668910652399063,
|
|
"num_tokens": 56068441.0,
|
|
"step": 32310
|
|
},
|
|
{
|
|
"entropy": 5.3645265102386475,
|
|
"epoch": 2.514219023536277,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00043630196687307156,
|
|
"loss": 4.9032,
|
|
"mean_token_accuracy": 0.20028816014528275,
|
|
"num_tokens": 56076592.0,
|
|
"step": 32315
|
|
},
|
|
{
|
|
"entropy": 5.310757970809936,
|
|
"epoch": 2.5146080529079944,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004362826429390176,
|
|
"loss": 4.9069,
|
|
"mean_token_accuracy": 0.20428854376077651,
|
|
"num_tokens": 56085299.0,
|
|
"step": 32320
|
|
},
|
|
{
|
|
"entropy": 5.39163613319397,
|
|
"epoch": 2.514997082279712,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00043626331655775624,
|
|
"loss": 4.9539,
|
|
"mean_token_accuracy": 0.2032100260257721,
|
|
"num_tokens": 56093891.0,
|
|
"step": 32325
|
|
},
|
|
{
|
|
"entropy": 5.387237071990967,
|
|
"epoch": 2.51538611165143,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00043624398772958075,
|
|
"loss": 5.0595,
|
|
"mean_token_accuracy": 0.19667782485485077,
|
|
"num_tokens": 56102767.0,
|
|
"step": 32330
|
|
},
|
|
{
|
|
"entropy": 5.384063673019409,
|
|
"epoch": 2.5157751410231475,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004362246564547844,
|
|
"loss": 4.9697,
|
|
"mean_token_accuracy": 0.2003084734082222,
|
|
"num_tokens": 56110861.0,
|
|
"step": 32335
|
|
},
|
|
{
|
|
"entropy": 5.464279842376709,
|
|
"epoch": 2.5161641703948647,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00043620532273366044,
|
|
"loss": 5.081,
|
|
"mean_token_accuracy": 0.19337862282991408,
|
|
"num_tokens": 56119842.0,
|
|
"step": 32340
|
|
},
|
|
{
|
|
"entropy": 5.491277647018433,
|
|
"epoch": 2.5165531997665824,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004361859865665024,
|
|
"loss": 5.0876,
|
|
"mean_token_accuracy": 0.1899813234806061,
|
|
"num_tokens": 56128246.0,
|
|
"step": 32345
|
|
},
|
|
{
|
|
"entropy": 5.4309587478637695,
|
|
"epoch": 2.5169422291382997,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00043616664795360346,
|
|
"loss": 5.0338,
|
|
"mean_token_accuracy": 0.1972397133708,
|
|
"num_tokens": 56137320.0,
|
|
"step": 32350
|
|
},
|
|
{
|
|
"entropy": 5.367820787429809,
|
|
"epoch": 2.5173312585100174,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00043614730689525716,
|
|
"loss": 4.9732,
|
|
"mean_token_accuracy": 0.19634073674678804,
|
|
"num_tokens": 56145739.0,
|
|
"step": 32355
|
|
},
|
|
{
|
|
"entropy": 5.390258264541626,
|
|
"epoch": 2.517720287881735,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.00043612796339175707,
|
|
"loss": 5.001,
|
|
"mean_token_accuracy": 0.1985723227262497,
|
|
"num_tokens": 56154526.0,
|
|
"step": 32360
|
|
},
|
|
{
|
|
"entropy": 5.526586246490479,
|
|
"epoch": 2.5181093172534528,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00043610861744339653,
|
|
"loss": 5.157,
|
|
"mean_token_accuracy": 0.18484565019607543,
|
|
"num_tokens": 56163209.0,
|
|
"step": 32365
|
|
},
|
|
{
|
|
"entropy": 5.429590272903442,
|
|
"epoch": 2.5184983466251705,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004360892690504692,
|
|
"loss": 4.9824,
|
|
"mean_token_accuracy": 0.20689349621534348,
|
|
"num_tokens": 56171541.0,
|
|
"step": 32370
|
|
},
|
|
{
|
|
"entropy": 5.3439678192138675,
|
|
"epoch": 2.5188873759968877,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004360699182132685,
|
|
"loss": 4.9859,
|
|
"mean_token_accuracy": 0.19798265993595124,
|
|
"num_tokens": 56180309.0,
|
|
"step": 32375
|
|
},
|
|
{
|
|
"entropy": 5.4654004096984865,
|
|
"epoch": 2.5192764053686054,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00043605056493208825,
|
|
"loss": 5.0914,
|
|
"mean_token_accuracy": 0.19965959191322327,
|
|
"num_tokens": 56188916.0,
|
|
"step": 32380
|
|
},
|
|
{
|
|
"entropy": 5.394084787368774,
|
|
"epoch": 2.5196654347403227,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.000436031209207222,
|
|
"loss": 4.8754,
|
|
"mean_token_accuracy": 0.20240339934825896,
|
|
"num_tokens": 56197358.0,
|
|
"step": 32385
|
|
},
|
|
{
|
|
"entropy": 5.3156641006469725,
|
|
"epoch": 2.5200544641120404,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00043601185103896346,
|
|
"loss": 5.0245,
|
|
"mean_token_accuracy": 0.19320577681064605,
|
|
"num_tokens": 56206060.0,
|
|
"step": 32390
|
|
},
|
|
{
|
|
"entropy": 5.27640061378479,
|
|
"epoch": 2.520443493483758,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00043599249042760636,
|
|
"loss": 4.9459,
|
|
"mean_token_accuracy": 0.19057336449623108,
|
|
"num_tokens": 56214539.0,
|
|
"step": 32395
|
|
},
|
|
{
|
|
"entropy": 5.332379579544067,
|
|
"epoch": 2.5208325228554758,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00043597312737344446,
|
|
"loss": 4.8455,
|
|
"mean_token_accuracy": 0.205069437623024,
|
|
"num_tokens": 56222386.0,
|
|
"step": 32400
|
|
},
|
|
{
|
|
"entropy": 5.339838457107544,
|
|
"epoch": 2.521221552227193,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00043595376187677157,
|
|
"loss": 4.9333,
|
|
"mean_token_accuracy": 0.19663689732551576,
|
|
"num_tokens": 56231036.0,
|
|
"step": 32405
|
|
},
|
|
{
|
|
"entropy": 5.356459999084473,
|
|
"epoch": 2.5216105815989107,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00043593439393788147,
|
|
"loss": 5.0081,
|
|
"mean_token_accuracy": 0.19810594767332076,
|
|
"num_tokens": 56239494.0,
|
|
"step": 32410
|
|
},
|
|
{
|
|
"entropy": 5.431342744827271,
|
|
"epoch": 2.5219996109706284,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004359150235570682,
|
|
"loss": 5.0302,
|
|
"mean_token_accuracy": 0.19545965790748596,
|
|
"num_tokens": 56248075.0,
|
|
"step": 32415
|
|
},
|
|
{
|
|
"entropy": 5.4104784488677975,
|
|
"epoch": 2.5223886403423457,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004358956507346255,
|
|
"loss": 5.0457,
|
|
"mean_token_accuracy": 0.19441032856702806,
|
|
"num_tokens": 56256630.0,
|
|
"step": 32420
|
|
},
|
|
{
|
|
"entropy": 5.319768857955933,
|
|
"epoch": 2.5227776697140634,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004358762754708474,
|
|
"loss": 4.8649,
|
|
"mean_token_accuracy": 0.20580192804336547,
|
|
"num_tokens": 56264922.0,
|
|
"step": 32425
|
|
},
|
|
{
|
|
"entropy": 5.401272964477539,
|
|
"epoch": 2.523166699085781,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00043585689776602795,
|
|
"loss": 5.1103,
|
|
"mean_token_accuracy": 0.1897198438644409,
|
|
"num_tokens": 56273996.0,
|
|
"step": 32430
|
|
},
|
|
{
|
|
"entropy": 5.4865294933319095,
|
|
"epoch": 2.5235557284574988,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00043583751762046104,
|
|
"loss": 5.0728,
|
|
"mean_token_accuracy": 0.19219736158847808,
|
|
"num_tokens": 56283583.0,
|
|
"step": 32435
|
|
},
|
|
{
|
|
"entropy": 5.4571349143981935,
|
|
"epoch": 2.523944757829216,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004358181350344408,
|
|
"loss": 5.0103,
|
|
"mean_token_accuracy": 0.19597954899072648,
|
|
"num_tokens": 56292197.0,
|
|
"step": 32440
|
|
},
|
|
{
|
|
"entropy": 5.407770681381225,
|
|
"epoch": 2.5243337872009337,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004357987500082613,
|
|
"loss": 5.0532,
|
|
"mean_token_accuracy": 0.18912947922945023,
|
|
"num_tokens": 56301177.0,
|
|
"step": 32445
|
|
},
|
|
{
|
|
"entropy": 5.432667684555054,
|
|
"epoch": 2.524722816572651,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00043577936254221675,
|
|
"loss": 4.9913,
|
|
"mean_token_accuracy": 0.19305782169103622,
|
|
"num_tokens": 56310024.0,
|
|
"step": 32450
|
|
},
|
|
{
|
|
"entropy": 5.428409671783447,
|
|
"epoch": 2.5251118459443687,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004357599726366013,
|
|
"loss": 5.0196,
|
|
"mean_token_accuracy": 0.19170882403850556,
|
|
"num_tokens": 56318190.0,
|
|
"step": 32455
|
|
},
|
|
{
|
|
"entropy": 5.293249940872192,
|
|
"epoch": 2.5255008753160864,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004357405802917091,
|
|
"loss": 4.8673,
|
|
"mean_token_accuracy": 0.20901996940374373,
|
|
"num_tokens": 56326443.0,
|
|
"step": 32460
|
|
},
|
|
{
|
|
"entropy": 5.294808769226075,
|
|
"epoch": 2.525889904687804,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004357211855078345,
|
|
"loss": 4.9709,
|
|
"mean_token_accuracy": 0.1986512914299965,
|
|
"num_tokens": 56335263.0,
|
|
"step": 32465
|
|
},
|
|
{
|
|
"entropy": 5.419492721557617,
|
|
"epoch": 2.5262789340595218,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00043570178828527157,
|
|
"loss": 5.0246,
|
|
"mean_token_accuracy": 0.19746648222208024,
|
|
"num_tokens": 56343202.0,
|
|
"step": 32470
|
|
},
|
|
{
|
|
"entropy": 5.400504493713379,
|
|
"epoch": 2.526667963431239,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004356823886243149,
|
|
"loss": 4.9127,
|
|
"mean_token_accuracy": 0.1954809308052063,
|
|
"num_tokens": 56352150.0,
|
|
"step": 32475
|
|
},
|
|
{
|
|
"entropy": 5.28996467590332,
|
|
"epoch": 2.5270569928029567,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00043566298652525875,
|
|
"loss": 4.8784,
|
|
"mean_token_accuracy": 0.2124801442027092,
|
|
"num_tokens": 56360460.0,
|
|
"step": 32480
|
|
},
|
|
{
|
|
"entropy": 5.315297269821167,
|
|
"epoch": 2.527446022174674,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00043564358198839746,
|
|
"loss": 5.0569,
|
|
"mean_token_accuracy": 0.1971816748380661,
|
|
"num_tokens": 56369889.0,
|
|
"step": 32485
|
|
},
|
|
{
|
|
"entropy": 5.414597415924073,
|
|
"epoch": 2.5278350515463917,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004356241750140256,
|
|
"loss": 4.9012,
|
|
"mean_token_accuracy": 0.1969568908214569,
|
|
"num_tokens": 56378500.0,
|
|
"step": 32490
|
|
},
|
|
{
|
|
"entropy": 5.469532918930054,
|
|
"epoch": 2.5282240809181094,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00043560476560243743,
|
|
"loss": 5.0618,
|
|
"mean_token_accuracy": 0.1905737742781639,
|
|
"num_tokens": 56387390.0,
|
|
"step": 32495
|
|
},
|
|
{
|
|
"entropy": 5.4575244903564455,
|
|
"epoch": 2.528613110289827,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004355853537539276,
|
|
"loss": 5.038,
|
|
"mean_token_accuracy": 0.19808294326066972,
|
|
"num_tokens": 56395782.0,
|
|
"step": 32500
|
|
},
|
|
{
|
|
"entropy": 5.399492597579956,
|
|
"epoch": 2.5290021396615443,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004355659394687906,
|
|
"loss": 4.9422,
|
|
"mean_token_accuracy": 0.2043975681066513,
|
|
"num_tokens": 56405023.0,
|
|
"step": 32505
|
|
},
|
|
{
|
|
"entropy": 5.446301651000977,
|
|
"epoch": 2.529391169033262,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004355465227473211,
|
|
"loss": 5.0691,
|
|
"mean_token_accuracy": 0.19323596805334092,
|
|
"num_tokens": 56413669.0,
|
|
"step": 32510
|
|
},
|
|
{
|
|
"entropy": 5.422313022613525,
|
|
"epoch": 2.5297801984049797,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004355271035898136,
|
|
"loss": 5.0169,
|
|
"mean_token_accuracy": 0.19778741002082825,
|
|
"num_tokens": 56422286.0,
|
|
"step": 32515
|
|
},
|
|
{
|
|
"entropy": 5.482103443145752,
|
|
"epoch": 2.530169227776697,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0004355076819965628,
|
|
"loss": 5.0544,
|
|
"mean_token_accuracy": 0.20013925731182097,
|
|
"num_tokens": 56430891.0,
|
|
"step": 32520
|
|
},
|
|
{
|
|
"entropy": 5.38812780380249,
|
|
"epoch": 2.5305582571484146,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00043548825796786353,
|
|
"loss": 5.0191,
|
|
"mean_token_accuracy": 0.19865642935037614,
|
|
"num_tokens": 56439231.0,
|
|
"step": 32525
|
|
},
|
|
{
|
|
"entropy": 5.306616544723511,
|
|
"epoch": 2.5309472865201323,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00043546883150401023,
|
|
"loss": 4.7887,
|
|
"mean_token_accuracy": 0.21773111075162888,
|
|
"num_tokens": 56447508.0,
|
|
"step": 32530
|
|
},
|
|
{
|
|
"entropy": 5.341956329345703,
|
|
"epoch": 2.53133631589185,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00043544940260529787,
|
|
"loss": 4.9634,
|
|
"mean_token_accuracy": 0.20265888422727585,
|
|
"num_tokens": 56456049.0,
|
|
"step": 32535
|
|
},
|
|
{
|
|
"entropy": 5.355829334259033,
|
|
"epoch": 2.5317253452635673,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0004354299712720213,
|
|
"loss": 5.0198,
|
|
"mean_token_accuracy": 0.20201081782579422,
|
|
"num_tokens": 56464775.0,
|
|
"step": 32540
|
|
},
|
|
{
|
|
"entropy": 5.40965633392334,
|
|
"epoch": 2.532114374635285,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004354105375044752,
|
|
"loss": 4.9862,
|
|
"mean_token_accuracy": 0.19741586744785308,
|
|
"num_tokens": 56473835.0,
|
|
"step": 32545
|
|
},
|
|
{
|
|
"entropy": 5.427690601348877,
|
|
"epoch": 2.5325034040070027,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00043539110130295445,
|
|
"loss": 5.0044,
|
|
"mean_token_accuracy": 0.19642794132232666,
|
|
"num_tokens": 56482488.0,
|
|
"step": 32550
|
|
},
|
|
{
|
|
"entropy": 5.339759111404419,
|
|
"epoch": 2.53289243337872,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00043537166266775405,
|
|
"loss": 4.9535,
|
|
"mean_token_accuracy": 0.19785019010305405,
|
|
"num_tokens": 56491928.0,
|
|
"step": 32555
|
|
},
|
|
{
|
|
"entropy": 5.297445964813233,
|
|
"epoch": 2.5332814627504376,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.000435352221599169,
|
|
"loss": 4.8969,
|
|
"mean_token_accuracy": 0.20106651782989501,
|
|
"num_tokens": 56500247.0,
|
|
"step": 32560
|
|
},
|
|
{
|
|
"entropy": 5.408609771728516,
|
|
"epoch": 2.5336704921221553,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004353327780974941,
|
|
"loss": 5.0393,
|
|
"mean_token_accuracy": 0.19395507127046585,
|
|
"num_tokens": 56509507.0,
|
|
"step": 32565
|
|
},
|
|
{
|
|
"entropy": 5.448973941802978,
|
|
"epoch": 2.534059521493873,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004353133321630246,
|
|
"loss": 5.0471,
|
|
"mean_token_accuracy": 0.19190725684165955,
|
|
"num_tokens": 56517895.0,
|
|
"step": 32570
|
|
},
|
|
{
|
|
"entropy": 5.355793190002442,
|
|
"epoch": 2.5344485508655903,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004352938837960554,
|
|
"loss": 4.941,
|
|
"mean_token_accuracy": 0.20079725831747056,
|
|
"num_tokens": 56526894.0,
|
|
"step": 32575
|
|
},
|
|
{
|
|
"entropy": 5.416588544845581,
|
|
"epoch": 2.534837580237308,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00043527443299688166,
|
|
"loss": 5.0188,
|
|
"mean_token_accuracy": 0.19484439939260484,
|
|
"num_tokens": 56535970.0,
|
|
"step": 32580
|
|
},
|
|
{
|
|
"entropy": 5.460320329666137,
|
|
"epoch": 2.5352266096090252,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00043525497976579843,
|
|
"loss": 5.0027,
|
|
"mean_token_accuracy": 0.19569645076990128,
|
|
"num_tokens": 56544385.0,
|
|
"step": 32585
|
|
},
|
|
{
|
|
"entropy": 5.338799476623535,
|
|
"epoch": 2.535615638980743,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.000435235524103101,
|
|
"loss": 4.9802,
|
|
"mean_token_accuracy": 0.19435409158468248,
|
|
"num_tokens": 56552645.0,
|
|
"step": 32590
|
|
},
|
|
{
|
|
"entropy": 5.501217842102051,
|
|
"epoch": 2.5360046683524606,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004352160660090846,
|
|
"loss": 5.0842,
|
|
"mean_token_accuracy": 0.1889079689979553,
|
|
"num_tokens": 56562223.0,
|
|
"step": 32595
|
|
},
|
|
{
|
|
"entropy": 5.410815191268921,
|
|
"epoch": 2.5363936977241783,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004351966054840443,
|
|
"loss": 4.955,
|
|
"mean_token_accuracy": 0.19765260964632034,
|
|
"num_tokens": 56571015.0,
|
|
"step": 32600
|
|
},
|
|
{
|
|
"entropy": 5.3445109844207765,
|
|
"epoch": 2.5367827270958956,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00043517714252827556,
|
|
"loss": 4.9046,
|
|
"mean_token_accuracy": 0.20604282468557358,
|
|
"num_tokens": 56579566.0,
|
|
"step": 32605
|
|
},
|
|
{
|
|
"entropy": 5.441760778427124,
|
|
"epoch": 2.5371717564676133,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004351576771420737,
|
|
"loss": 5.0286,
|
|
"mean_token_accuracy": 0.19846716970205308,
|
|
"num_tokens": 56588231.0,
|
|
"step": 32610
|
|
},
|
|
{
|
|
"entropy": 5.383497047424316,
|
|
"epoch": 2.537560785839331,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004351382093257339,
|
|
"loss": 5.0125,
|
|
"mean_token_accuracy": 0.19605728834867478,
|
|
"num_tokens": 56596581.0,
|
|
"step": 32615
|
|
},
|
|
{
|
|
"entropy": 5.34217939376831,
|
|
"epoch": 2.5379498152110482,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004351187390795517,
|
|
"loss": 4.9179,
|
|
"mean_token_accuracy": 0.2058378577232361,
|
|
"num_tokens": 56605440.0,
|
|
"step": 32620
|
|
},
|
|
{
|
|
"entropy": 5.410478782653809,
|
|
"epoch": 2.538338844582766,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.00043509926640382244,
|
|
"loss": 5.0884,
|
|
"mean_token_accuracy": 0.19782164245843886,
|
|
"num_tokens": 56614819.0,
|
|
"step": 32625
|
|
},
|
|
{
|
|
"entropy": 5.363060045242309,
|
|
"epoch": 2.5387278739544836,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004350797912988417,
|
|
"loss": 5.0403,
|
|
"mean_token_accuracy": 0.19826929718255998,
|
|
"num_tokens": 56623372.0,
|
|
"step": 32630
|
|
},
|
|
{
|
|
"entropy": 5.323605012893677,
|
|
"epoch": 2.5391169033262013,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004350603137649049,
|
|
"loss": 4.9349,
|
|
"mean_token_accuracy": 0.2005373701453209,
|
|
"num_tokens": 56631768.0,
|
|
"step": 32635
|
|
},
|
|
{
|
|
"entropy": 5.322753381729126,
|
|
"epoch": 2.5395059326979186,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004350408338023075,
|
|
"loss": 4.952,
|
|
"mean_token_accuracy": 0.20120840072631835,
|
|
"num_tokens": 56640135.0,
|
|
"step": 32640
|
|
},
|
|
{
|
|
"entropy": 5.323076772689819,
|
|
"epoch": 2.5398949620696363,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0004350213514113453,
|
|
"loss": 4.8871,
|
|
"mean_token_accuracy": 0.199225115776062,
|
|
"num_tokens": 56648007.0,
|
|
"step": 32645
|
|
},
|
|
{
|
|
"entropy": 5.4193097114562985,
|
|
"epoch": 2.540283991441354,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00043500186659231377,
|
|
"loss": 5.0592,
|
|
"mean_token_accuracy": 0.1947535276412964,
|
|
"num_tokens": 56656926.0,
|
|
"step": 32650
|
|
},
|
|
{
|
|
"entropy": 5.482250833511353,
|
|
"epoch": 2.5406730208130712,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004349823793455086,
|
|
"loss": 5.1036,
|
|
"mean_token_accuracy": 0.19122953414916993,
|
|
"num_tokens": 56665404.0,
|
|
"step": 32655
|
|
},
|
|
{
|
|
"entropy": 5.414553928375244,
|
|
"epoch": 2.541062050184789,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00043496288967122547,
|
|
"loss": 5.0019,
|
|
"mean_token_accuracy": 0.19383166134357452,
|
|
"num_tokens": 56673922.0,
|
|
"step": 32660
|
|
},
|
|
{
|
|
"entropy": 5.392436408996582,
|
|
"epoch": 2.5414510795565066,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00043494339756976007,
|
|
"loss": 4.9852,
|
|
"mean_token_accuracy": 0.19653818160295486,
|
|
"num_tokens": 56682062.0,
|
|
"step": 32665
|
|
},
|
|
{
|
|
"entropy": 5.438071203231812,
|
|
"epoch": 2.5418401089282243,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004349239030414082,
|
|
"loss": 5.0954,
|
|
"mean_token_accuracy": 0.19040025621652604,
|
|
"num_tokens": 56690571.0,
|
|
"step": 32670
|
|
},
|
|
{
|
|
"entropy": 5.413377809524536,
|
|
"epoch": 2.5422291382999416,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00043490440608646557,
|
|
"loss": 4.9961,
|
|
"mean_token_accuracy": 0.20147713124752045,
|
|
"num_tokens": 56699599.0,
|
|
"step": 32675
|
|
},
|
|
{
|
|
"entropy": 5.401550436019898,
|
|
"epoch": 2.5426181676716593,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00043488490670522817,
|
|
"loss": 4.9422,
|
|
"mean_token_accuracy": 0.20499475300312042,
|
|
"num_tokens": 56708120.0,
|
|
"step": 32680
|
|
},
|
|
{
|
|
"entropy": 5.376525449752807,
|
|
"epoch": 2.5430071970433765,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004348654048979918,
|
|
"loss": 4.956,
|
|
"mean_token_accuracy": 0.19767683744430542,
|
|
"num_tokens": 56716339.0,
|
|
"step": 32685
|
|
},
|
|
{
|
|
"entropy": 5.324510145187378,
|
|
"epoch": 2.543396226415094,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0004348459006650523,
|
|
"loss": 4.878,
|
|
"mean_token_accuracy": 0.21489011794328688,
|
|
"num_tokens": 56724157.0,
|
|
"step": 32690
|
|
},
|
|
{
|
|
"entropy": 5.348539924621582,
|
|
"epoch": 2.543785255786812,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00043482639400670576,
|
|
"loss": 5.0452,
|
|
"mean_token_accuracy": 0.19752895683050156,
|
|
"num_tokens": 56733075.0,
|
|
"step": 32695
|
|
},
|
|
{
|
|
"entropy": 5.317219877243042,
|
|
"epoch": 2.5441742851585296,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.000434806884923248,
|
|
"loss": 4.9188,
|
|
"mean_token_accuracy": 0.20399024188518525,
|
|
"num_tokens": 56742184.0,
|
|
"step": 32700
|
|
},
|
|
{
|
|
"entropy": 5.360914182662964,
|
|
"epoch": 2.5445633145302473,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004347873734149752,
|
|
"loss": 4.904,
|
|
"mean_token_accuracy": 0.20166399478912353,
|
|
"num_tokens": 56750559.0,
|
|
"step": 32705
|
|
},
|
|
{
|
|
"entropy": 5.378832721710205,
|
|
"epoch": 2.5449523439019646,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00043476785948218325,
|
|
"loss": 5.0647,
|
|
"mean_token_accuracy": 0.18976323753595353,
|
|
"num_tokens": 56760031.0,
|
|
"step": 32710
|
|
},
|
|
{
|
|
"entropy": 5.377664470672608,
|
|
"epoch": 2.5453413732736823,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00043474834312516835,
|
|
"loss": 5.0229,
|
|
"mean_token_accuracy": 0.19264144748449324,
|
|
"num_tokens": 56768496.0,
|
|
"step": 32715
|
|
},
|
|
{
|
|
"entropy": 5.4445360660552975,
|
|
"epoch": 2.5457304026453995,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004347288243442266,
|
|
"loss": 5.0219,
|
|
"mean_token_accuracy": 0.19857438206672667,
|
|
"num_tokens": 56776876.0,
|
|
"step": 32720
|
|
},
|
|
{
|
|
"entropy": 5.397977113723755,
|
|
"epoch": 2.546119432017117,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004347093031396543,
|
|
"loss": 4.9729,
|
|
"mean_token_accuracy": 0.20500152856111525,
|
|
"num_tokens": 56785661.0,
|
|
"step": 32725
|
|
},
|
|
{
|
|
"entropy": 5.358748197555542,
|
|
"epoch": 2.546508461388835,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004346897795117474,
|
|
"loss": 4.9643,
|
|
"mean_token_accuracy": 0.19860556572675706,
|
|
"num_tokens": 56794818.0,
|
|
"step": 32730
|
|
},
|
|
{
|
|
"entropy": 5.348541021347046,
|
|
"epoch": 2.5468974907605526,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004346702534608023,
|
|
"loss": 5.0081,
|
|
"mean_token_accuracy": 0.19369932413101196,
|
|
"num_tokens": 56804528.0,
|
|
"step": 32735
|
|
},
|
|
{
|
|
"entropy": 5.3800272941589355,
|
|
"epoch": 2.54728652013227,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0004346507249871153,
|
|
"loss": 4.9912,
|
|
"mean_token_accuracy": 0.20032689720392227,
|
|
"num_tokens": 56812766.0,
|
|
"step": 32740
|
|
},
|
|
{
|
|
"entropy": 5.39268159866333,
|
|
"epoch": 2.5476755495039876,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004346311940909826,
|
|
"loss": 4.9438,
|
|
"mean_token_accuracy": 0.1987973928451538,
|
|
"num_tokens": 56821108.0,
|
|
"step": 32745
|
|
},
|
|
{
|
|
"entropy": 5.447809886932373,
|
|
"epoch": 2.5480645788757053,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00043461166077270056,
|
|
"loss": 5.0507,
|
|
"mean_token_accuracy": 0.19227732419967652,
|
|
"num_tokens": 56829060.0,
|
|
"step": 32750
|
|
},
|
|
{
|
|
"entropy": 5.426973676681518,
|
|
"epoch": 2.5484536082474225,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00043459212503256566,
|
|
"loss": 5.0262,
|
|
"mean_token_accuracy": 0.19717164635658263,
|
|
"num_tokens": 56837440.0,
|
|
"step": 32755
|
|
},
|
|
{
|
|
"entropy": 5.3656737327575685,
|
|
"epoch": 2.54884263761914,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004345725868708743,
|
|
"loss": 4.999,
|
|
"mean_token_accuracy": 0.19778794199228286,
|
|
"num_tokens": 56845485.0,
|
|
"step": 32760
|
|
},
|
|
{
|
|
"entropy": 5.373947048187256,
|
|
"epoch": 2.549231666990858,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.00043455304628792294,
|
|
"loss": 4.9733,
|
|
"mean_token_accuracy": 0.20393747836351395,
|
|
"num_tokens": 56854498.0,
|
|
"step": 32765
|
|
},
|
|
{
|
|
"entropy": 5.350716495513916,
|
|
"epoch": 2.5496206963625756,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.000434533503284008,
|
|
"loss": 4.9774,
|
|
"mean_token_accuracy": 0.20300679802894592,
|
|
"num_tokens": 56862910.0,
|
|
"step": 32770
|
|
},
|
|
{
|
|
"entropy": 5.362820196151733,
|
|
"epoch": 2.550009725734293,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004345139578594261,
|
|
"loss": 4.9943,
|
|
"mean_token_accuracy": 0.1931072324514389,
|
|
"num_tokens": 56872235.0,
|
|
"step": 32775
|
|
},
|
|
{
|
|
"entropy": 5.386838054656982,
|
|
"epoch": 2.5503987551060106,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004344944100144738,
|
|
"loss": 4.9958,
|
|
"mean_token_accuracy": 0.1943257912993431,
|
|
"num_tokens": 56881506.0,
|
|
"step": 32780
|
|
},
|
|
{
|
|
"entropy": 5.387039089202881,
|
|
"epoch": 2.550787784477728,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00043447485974944765,
|
|
"loss": 4.973,
|
|
"mean_token_accuracy": 0.20046062767505646,
|
|
"num_tokens": 56890218.0,
|
|
"step": 32785
|
|
},
|
|
{
|
|
"entropy": 5.404049634933472,
|
|
"epoch": 2.5511768138494455,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00043445530706464437,
|
|
"loss": 4.9793,
|
|
"mean_token_accuracy": 0.20020410865545274,
|
|
"num_tokens": 56898037.0,
|
|
"step": 32790
|
|
},
|
|
{
|
|
"entropy": 5.338355159759521,
|
|
"epoch": 2.551565843221163,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004344357519603606,
|
|
"loss": 4.8869,
|
|
"mean_token_accuracy": 0.20264949798583984,
|
|
"num_tokens": 56906892.0,
|
|
"step": 32795
|
|
},
|
|
{
|
|
"entropy": 5.320281219482422,
|
|
"epoch": 2.551954872592881,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004344161944368931,
|
|
"loss": 4.8001,
|
|
"mean_token_accuracy": 0.20936599224805832,
|
|
"num_tokens": 56915286.0,
|
|
"step": 32800
|
|
},
|
|
{
|
|
"entropy": 5.305531215667725,
|
|
"epoch": 2.5523439019645986,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0004343966344945385,
|
|
"loss": 4.9461,
|
|
"mean_token_accuracy": 0.19897326081991196,
|
|
"num_tokens": 56923670.0,
|
|
"step": 32805
|
|
},
|
|
{
|
|
"entropy": 5.444967746734619,
|
|
"epoch": 2.552732931336316,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00043437707213359375,
|
|
"loss": 5.0939,
|
|
"mean_token_accuracy": 0.1886790007352829,
|
|
"num_tokens": 56932092.0,
|
|
"step": 32810
|
|
},
|
|
{
|
|
"entropy": 5.428129577636719,
|
|
"epoch": 2.5531219607080335,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00043435750735435554,
|
|
"loss": 5.0578,
|
|
"mean_token_accuracy": 0.1985599473118782,
|
|
"num_tokens": 56940938.0,
|
|
"step": 32815
|
|
},
|
|
{
|
|
"entropy": 5.440364980697632,
|
|
"epoch": 2.553510990079751,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00043433794015712085,
|
|
"loss": 5.0032,
|
|
"mean_token_accuracy": 0.19599149525165557,
|
|
"num_tokens": 56950001.0,
|
|
"step": 32820
|
|
},
|
|
{
|
|
"entropy": 5.466781044006348,
|
|
"epoch": 2.5539000194514685,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004343183705421865,
|
|
"loss": 5.078,
|
|
"mean_token_accuracy": 0.1921714037656784,
|
|
"num_tokens": 56958898.0,
|
|
"step": 32825
|
|
},
|
|
{
|
|
"entropy": 5.433738708496094,
|
|
"epoch": 2.554289048823186,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004342987985098495,
|
|
"loss": 4.9683,
|
|
"mean_token_accuracy": 0.20671307146549225,
|
|
"num_tokens": 56967586.0,
|
|
"step": 32830
|
|
},
|
|
{
|
|
"entropy": 5.288120317459106,
|
|
"epoch": 2.554678078194904,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00043427922406040676,
|
|
"loss": 4.8984,
|
|
"mean_token_accuracy": 0.19685294032096862,
|
|
"num_tokens": 56975781.0,
|
|
"step": 32835
|
|
},
|
|
{
|
|
"entropy": 5.453498029708863,
|
|
"epoch": 2.555067107566621,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.00043425964719415525,
|
|
"loss": 5.034,
|
|
"mean_token_accuracy": 0.198574934899807,
|
|
"num_tokens": 56984230.0,
|
|
"step": 32840
|
|
},
|
|
{
|
|
"entropy": 5.387336587905883,
|
|
"epoch": 2.555456136938339,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00043424006791139213,
|
|
"loss": 4.9655,
|
|
"mean_token_accuracy": 0.19895107597112655,
|
|
"num_tokens": 56992100.0,
|
|
"step": 32845
|
|
},
|
|
{
|
|
"entropy": 5.392412376403809,
|
|
"epoch": 2.5558451663100565,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00043422048621241443,
|
|
"loss": 5.0634,
|
|
"mean_token_accuracy": 0.19841053634881972,
|
|
"num_tokens": 57000407.0,
|
|
"step": 32850
|
|
},
|
|
{
|
|
"entropy": 5.452418804168701,
|
|
"epoch": 2.556234195681774,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00043420090209751933,
|
|
"loss": 5.0501,
|
|
"mean_token_accuracy": 0.2006923735141754,
|
|
"num_tokens": 57008781.0,
|
|
"step": 32855
|
|
},
|
|
{
|
|
"entropy": 5.340987825393677,
|
|
"epoch": 2.5566232250534915,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0004341813155670039,
|
|
"loss": 4.9361,
|
|
"mean_token_accuracy": 0.20685492902994157,
|
|
"num_tokens": 57017568.0,
|
|
"step": 32860
|
|
},
|
|
{
|
|
"entropy": 5.342080450057983,
|
|
"epoch": 2.557012254425209,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004341617266211654,
|
|
"loss": 4.86,
|
|
"mean_token_accuracy": 0.2100420966744423,
|
|
"num_tokens": 57025674.0,
|
|
"step": 32865
|
|
},
|
|
{
|
|
"entropy": 5.364832353591919,
|
|
"epoch": 2.557401283796927,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.000434142135260301,
|
|
"loss": 4.9724,
|
|
"mean_token_accuracy": 0.1984519273042679,
|
|
"num_tokens": 57033657.0,
|
|
"step": 32870
|
|
},
|
|
{
|
|
"entropy": 5.432851076126099,
|
|
"epoch": 2.557790313168644,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.000434122541484708,
|
|
"loss": 5.0772,
|
|
"mean_token_accuracy": 0.19555626362562178,
|
|
"num_tokens": 57043057.0,
|
|
"step": 32875
|
|
},
|
|
{
|
|
"entropy": 5.442611217498779,
|
|
"epoch": 2.558179342540362,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004341029452946837,
|
|
"loss": 4.9863,
|
|
"mean_token_accuracy": 0.19016913920640946,
|
|
"num_tokens": 57051721.0,
|
|
"step": 32880
|
|
},
|
|
{
|
|
"entropy": 5.437685251235962,
|
|
"epoch": 2.558568371912079,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004340833466905254,
|
|
"loss": 5.0048,
|
|
"mean_token_accuracy": 0.19890847504138948,
|
|
"num_tokens": 57060223.0,
|
|
"step": 32885
|
|
},
|
|
{
|
|
"entropy": 5.401111650466919,
|
|
"epoch": 2.558957401283797,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00043406374567253055,
|
|
"loss": 4.9838,
|
|
"mean_token_accuracy": 0.20205372124910354,
|
|
"num_tokens": 57068408.0,
|
|
"step": 32890
|
|
},
|
|
{
|
|
"entropy": 5.404002332687378,
|
|
"epoch": 2.5593464306555145,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004340441422409965,
|
|
"loss": 5.0569,
|
|
"mean_token_accuracy": 0.18950616866350173,
|
|
"num_tokens": 57076784.0,
|
|
"step": 32895
|
|
},
|
|
{
|
|
"entropy": 5.45456748008728,
|
|
"epoch": 2.559735460027232,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004340245363962209,
|
|
"loss": 5.0265,
|
|
"mean_token_accuracy": 0.19318908005952834,
|
|
"num_tokens": 57084745.0,
|
|
"step": 32900
|
|
},
|
|
{
|
|
"entropy": 5.352643966674805,
|
|
"epoch": 2.56012448939895,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00043400492813850083,
|
|
"loss": 4.9749,
|
|
"mean_token_accuracy": 0.19884245693683625,
|
|
"num_tokens": 57093395.0,
|
|
"step": 32905
|
|
},
|
|
{
|
|
"entropy": 5.327489852905273,
|
|
"epoch": 2.560513518770667,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00043398531746813426,
|
|
"loss": 4.9379,
|
|
"mean_token_accuracy": 0.19418791681528091,
|
|
"num_tokens": 57101665.0,
|
|
"step": 32910
|
|
},
|
|
{
|
|
"entropy": 5.265433740615845,
|
|
"epoch": 2.560902548142385,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00043396570438541845,
|
|
"loss": 4.8873,
|
|
"mean_token_accuracy": 0.19647327512502671,
|
|
"num_tokens": 57110328.0,
|
|
"step": 32915
|
|
},
|
|
{
|
|
"entropy": 5.3937829494476315,
|
|
"epoch": 2.561291577514102,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004339460888906512,
|
|
"loss": 5.0355,
|
|
"mean_token_accuracy": 0.19490766674280166,
|
|
"num_tokens": 57118834.0,
|
|
"step": 32920
|
|
},
|
|
{
|
|
"entropy": 5.515558576583862,
|
|
"epoch": 2.5616806068858198,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004339264709841299,
|
|
"loss": 5.1056,
|
|
"mean_token_accuracy": 0.18464373350143432,
|
|
"num_tokens": 57127672.0,
|
|
"step": 32925
|
|
},
|
|
{
|
|
"entropy": 5.349443244934082,
|
|
"epoch": 2.5620696362575375,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00043390685066615244,
|
|
"loss": 4.9299,
|
|
"mean_token_accuracy": 0.2027969941496849,
|
|
"num_tokens": 57136209.0,
|
|
"step": 32930
|
|
},
|
|
{
|
|
"entropy": 5.383748340606689,
|
|
"epoch": 2.562458665629255,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.0004338872279370164,
|
|
"loss": 4.9702,
|
|
"mean_token_accuracy": 0.20087292641401291,
|
|
"num_tokens": 57144427.0,
|
|
"step": 32935
|
|
},
|
|
{
|
|
"entropy": 5.3785535335540775,
|
|
"epoch": 2.5628476950009724,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004338676027970196,
|
|
"loss": 5.1222,
|
|
"mean_token_accuracy": 0.18389095216989518,
|
|
"num_tokens": 57152860.0,
|
|
"step": 32940
|
|
},
|
|
{
|
|
"entropy": 5.466862726211548,
|
|
"epoch": 2.56323672437269,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00043384797524645977,
|
|
"loss": 5.0028,
|
|
"mean_token_accuracy": 0.19488507509231567,
|
|
"num_tokens": 57162397.0,
|
|
"step": 32945
|
|
},
|
|
{
|
|
"entropy": 5.41713809967041,
|
|
"epoch": 2.563625753744408,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004338283452856348,
|
|
"loss": 4.9598,
|
|
"mean_token_accuracy": 0.20472395569086074,
|
|
"num_tokens": 57171178.0,
|
|
"step": 32950
|
|
},
|
|
{
|
|
"entropy": 5.410451507568359,
|
|
"epoch": 2.564014783116125,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004338087129148425,
|
|
"loss": 4.9631,
|
|
"mean_token_accuracy": 0.19792287200689315,
|
|
"num_tokens": 57178715.0,
|
|
"step": 32955
|
|
},
|
|
{
|
|
"entropy": 5.489461851119995,
|
|
"epoch": 2.5644038124878428,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00043378907813438066,
|
|
"loss": 5.0525,
|
|
"mean_token_accuracy": 0.18811921030282974,
|
|
"num_tokens": 57187239.0,
|
|
"step": 32960
|
|
},
|
|
{
|
|
"entropy": 5.413202857971191,
|
|
"epoch": 2.5647928418595605,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00043376944094454734,
|
|
"loss": 4.9757,
|
|
"mean_token_accuracy": 0.19294198751449584,
|
|
"num_tokens": 57195655.0,
|
|
"step": 32965
|
|
},
|
|
{
|
|
"entropy": 5.378011417388916,
|
|
"epoch": 2.565181871231278,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00043374980134564044,
|
|
"loss": 5.0412,
|
|
"mean_token_accuracy": 0.1912928506731987,
|
|
"num_tokens": 57205026.0,
|
|
"step": 32970
|
|
},
|
|
{
|
|
"entropy": 5.359329175949097,
|
|
"epoch": 2.5655709006029954,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00043373015933795804,
|
|
"loss": 4.9791,
|
|
"mean_token_accuracy": 0.19996938854455948,
|
|
"num_tokens": 57213344.0,
|
|
"step": 32975
|
|
},
|
|
{
|
|
"entropy": 5.407596635818481,
|
|
"epoch": 2.565959929974713,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004337105149217981,
|
|
"loss": 4.9964,
|
|
"mean_token_accuracy": 0.19756337404251098,
|
|
"num_tokens": 57222174.0,
|
|
"step": 32980
|
|
},
|
|
{
|
|
"entropy": 5.339840602874756,
|
|
"epoch": 2.566348959346431,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00043369086809745875,
|
|
"loss": 4.9765,
|
|
"mean_token_accuracy": 0.20119301974773407,
|
|
"num_tokens": 57231099.0,
|
|
"step": 32985
|
|
},
|
|
{
|
|
"entropy": 5.407732439041138,
|
|
"epoch": 2.566737988718148,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00043367121886523795,
|
|
"loss": 5.0139,
|
|
"mean_token_accuracy": 0.18738529533147813,
|
|
"num_tokens": 57239143.0,
|
|
"step": 32990
|
|
},
|
|
{
|
|
"entropy": 5.36846513748169,
|
|
"epoch": 2.5671270180898658,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.000433651567225434,
|
|
"loss": 5.0074,
|
|
"mean_token_accuracy": 0.20045491307973862,
|
|
"num_tokens": 57247971.0,
|
|
"step": 32995
|
|
},
|
|
{
|
|
"entropy": 5.37918062210083,
|
|
"epoch": 2.5675160474615835,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004336319131783451,
|
|
"loss": 4.9768,
|
|
"mean_token_accuracy": 0.20251345038414,
|
|
"num_tokens": 57256257.0,
|
|
"step": 33000
|
|
},
|
|
{
|
|
"epoch": 2.5675160474615835,
|
|
"eval_entropy": 5.225242014729828,
|
|
"eval_loss": 5.107059955596924,
|
|
"eval_mean_token_accuracy": 0.20114823337554702,
|
|
"eval_num_tokens": 57256257.0,
|
|
"eval_runtime": 28.7714,
|
|
"eval_samples_per_second": 1444.423,
|
|
"eval_steps_per_second": 180.562,
|
|
"step": 33000
|
|
},
|
|
{
|
|
"entropy": 5.413814687728882,
|
|
"epoch": 2.567905076833301,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00043361225672426933,
|
|
"loss": 4.9923,
|
|
"mean_token_accuracy": 0.19678923338651658,
|
|
"num_tokens": 57264729.0,
|
|
"step": 33005
|
|
},
|
|
{
|
|
"entropy": 5.4247291564941404,
|
|
"epoch": 2.5682941062050184,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004335925978635051,
|
|
"loss": 5.0558,
|
|
"mean_token_accuracy": 0.19453096389770508,
|
|
"num_tokens": 57273370.0,
|
|
"step": 33010
|
|
},
|
|
{
|
|
"entropy": 5.395574617385864,
|
|
"epoch": 2.568683135576736,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00043357293659635057,
|
|
"loss": 5.0148,
|
|
"mean_token_accuracy": 0.20081795006990433,
|
|
"num_tokens": 57282466.0,
|
|
"step": 33015
|
|
},
|
|
{
|
|
"entropy": 5.368965578079224,
|
|
"epoch": 2.5690721649484534,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004335532729231041,
|
|
"loss": 4.981,
|
|
"mean_token_accuracy": 0.19570138901472092,
|
|
"num_tokens": 57291015.0,
|
|
"step": 33020
|
|
},
|
|
{
|
|
"entropy": 5.431451797485352,
|
|
"epoch": 2.569461194320171,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.00043353360684406415,
|
|
"loss": 5.0581,
|
|
"mean_token_accuracy": 0.18931750059127808,
|
|
"num_tokens": 57300941.0,
|
|
"step": 33025
|
|
},
|
|
{
|
|
"entropy": 5.458180999755859,
|
|
"epoch": 2.5698502236918888,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.000433513938359529,
|
|
"loss": 5.0361,
|
|
"mean_token_accuracy": 0.1933378830552101,
|
|
"num_tokens": 57310412.0,
|
|
"step": 33030
|
|
},
|
|
{
|
|
"entropy": 5.491437196731567,
|
|
"epoch": 2.5702392530636065,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004334942674697971,
|
|
"loss": 5.1068,
|
|
"mean_token_accuracy": 0.19497440457344056,
|
|
"num_tokens": 57319262.0,
|
|
"step": 33035
|
|
},
|
|
{
|
|
"entropy": 5.387307929992676,
|
|
"epoch": 2.5706282824353237,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00043347459417516696,
|
|
"loss": 5.0219,
|
|
"mean_token_accuracy": 0.1937669724225998,
|
|
"num_tokens": 57327279.0,
|
|
"step": 33040
|
|
},
|
|
{
|
|
"entropy": 5.3643852233886715,
|
|
"epoch": 2.5710173118070414,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004334549184759371,
|
|
"loss": 4.8888,
|
|
"mean_token_accuracy": 0.20984860211610795,
|
|
"num_tokens": 57335498.0,
|
|
"step": 33045
|
|
},
|
|
{
|
|
"entropy": 5.391560173034668,
|
|
"epoch": 2.571406341178759,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004334352403724062,
|
|
"loss": 5.0766,
|
|
"mean_token_accuracy": 0.19173777252435684,
|
|
"num_tokens": 57345134.0,
|
|
"step": 33050
|
|
},
|
|
{
|
|
"entropy": 5.455765199661255,
|
|
"epoch": 2.5717953705504764,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00043341555986487254,
|
|
"loss": 5.0762,
|
|
"mean_token_accuracy": 0.19486733824014663,
|
|
"num_tokens": 57353451.0,
|
|
"step": 33055
|
|
},
|
|
{
|
|
"entropy": 5.424337434768677,
|
|
"epoch": 2.572184399922194,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004333958769536349,
|
|
"loss": 5.0069,
|
|
"mean_token_accuracy": 0.19521381258964537,
|
|
"num_tokens": 57362990.0,
|
|
"step": 33060
|
|
},
|
|
{
|
|
"entropy": 5.38012661933899,
|
|
"epoch": 2.5725734292939118,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004333761916389921,
|
|
"loss": 4.9773,
|
|
"mean_token_accuracy": 0.20276968777179719,
|
|
"num_tokens": 57371572.0,
|
|
"step": 33065
|
|
},
|
|
{
|
|
"entropy": 5.313905858993531,
|
|
"epoch": 2.5729624586656294,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004333565039212425,
|
|
"loss": 4.9155,
|
|
"mean_token_accuracy": 0.19919805526733397,
|
|
"num_tokens": 57380558.0,
|
|
"step": 33070
|
|
},
|
|
{
|
|
"entropy": 5.33050856590271,
|
|
"epoch": 2.5733514880373467,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004333368138006851,
|
|
"loss": 4.8613,
|
|
"mean_token_accuracy": 0.20112494379281998,
|
|
"num_tokens": 57389636.0,
|
|
"step": 33075
|
|
},
|
|
{
|
|
"entropy": 5.369415426254273,
|
|
"epoch": 2.5737405174090644,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0004333171212776185,
|
|
"loss": 4.9145,
|
|
"mean_token_accuracy": 0.20189293324947358,
|
|
"num_tokens": 57397546.0,
|
|
"step": 33080
|
|
},
|
|
{
|
|
"entropy": 5.4264226913452145,
|
|
"epoch": 2.574129546780782,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004332974263523416,
|
|
"loss": 5.1077,
|
|
"mean_token_accuracy": 0.19806709587574006,
|
|
"num_tokens": 57406981.0,
|
|
"step": 33085
|
|
},
|
|
{
|
|
"entropy": 5.462457370758057,
|
|
"epoch": 2.5745185761524993,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00043327772902515327,
|
|
"loss": 5.0484,
|
|
"mean_token_accuracy": 0.19725337475538254,
|
|
"num_tokens": 57416016.0,
|
|
"step": 33090
|
|
},
|
|
{
|
|
"entropy": 5.4115729331970215,
|
|
"epoch": 2.574907605524217,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004332580292963523,
|
|
"loss": 5.0417,
|
|
"mean_token_accuracy": 0.19376862794160843,
|
|
"num_tokens": 57425086.0,
|
|
"step": 33095
|
|
},
|
|
{
|
|
"entropy": 5.413253831863403,
|
|
"epoch": 2.5752966348959347,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004332383271662376,
|
|
"loss": 5.0351,
|
|
"mean_token_accuracy": 0.19673244804143905,
|
|
"num_tokens": 57433982.0,
|
|
"step": 33100
|
|
},
|
|
{
|
|
"entropy": 5.392880487442016,
|
|
"epoch": 2.5756856642676524,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00043321862263510816,
|
|
"loss": 4.8738,
|
|
"mean_token_accuracy": 0.20307066887617112,
|
|
"num_tokens": 57442922.0,
|
|
"step": 33105
|
|
},
|
|
{
|
|
"entropy": 5.421650362014771,
|
|
"epoch": 2.5760746936393697,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004331989157032629,
|
|
"loss": 5.0623,
|
|
"mean_token_accuracy": 0.1904524713754654,
|
|
"num_tokens": 57452373.0,
|
|
"step": 33110
|
|
},
|
|
{
|
|
"entropy": 5.3493452072143555,
|
|
"epoch": 2.5764637230110874,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00043317920637100097,
|
|
"loss": 4.9726,
|
|
"mean_token_accuracy": 0.20032243877649308,
|
|
"num_tokens": 57460741.0,
|
|
"step": 33115
|
|
},
|
|
{
|
|
"entropy": 5.314668989181518,
|
|
"epoch": 2.5768527523828046,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004331594946386213,
|
|
"loss": 4.9618,
|
|
"mean_token_accuracy": 0.20291125774383545,
|
|
"num_tokens": 57469488.0,
|
|
"step": 33120
|
|
},
|
|
{
|
|
"entropy": 5.396224880218506,
|
|
"epoch": 2.5772417817545223,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00043313978050642303,
|
|
"loss": 5.0236,
|
|
"mean_token_accuracy": 0.1925004705786705,
|
|
"num_tokens": 57478560.0,
|
|
"step": 33125
|
|
},
|
|
{
|
|
"entropy": 5.366699075698852,
|
|
"epoch": 2.57763081112624,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004331200639747053,
|
|
"loss": 4.9139,
|
|
"mean_token_accuracy": 0.20285016745328904,
|
|
"num_tokens": 57486670.0,
|
|
"step": 33130
|
|
},
|
|
{
|
|
"entropy": 5.405358362197876,
|
|
"epoch": 2.5780198404979577,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004331003450437674,
|
|
"loss": 5.0293,
|
|
"mean_token_accuracy": 0.19352518767118454,
|
|
"num_tokens": 57495676.0,
|
|
"step": 33135
|
|
},
|
|
{
|
|
"entropy": 5.360350704193115,
|
|
"epoch": 2.5784088698696754,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004330806237139083,
|
|
"loss": 4.9182,
|
|
"mean_token_accuracy": 0.20335044264793395,
|
|
"num_tokens": 57504422.0,
|
|
"step": 33140
|
|
},
|
|
{
|
|
"entropy": 5.352314424514771,
|
|
"epoch": 2.5787978992413927,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004330608999854273,
|
|
"loss": 4.9414,
|
|
"mean_token_accuracy": 0.19750514328479768,
|
|
"num_tokens": 57514555.0,
|
|
"step": 33145
|
|
},
|
|
{
|
|
"entropy": 5.305916357040405,
|
|
"epoch": 2.5791869286131104,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004330411738586238,
|
|
"loss": 4.8386,
|
|
"mean_token_accuracy": 0.20582491010427476,
|
|
"num_tokens": 57523088.0,
|
|
"step": 33150
|
|
},
|
|
{
|
|
"entropy": 5.314565753936767,
|
|
"epoch": 2.5795759579848276,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.000433021445333797,
|
|
"loss": 4.9598,
|
|
"mean_token_accuracy": 0.19909641444683074,
|
|
"num_tokens": 57530890.0,
|
|
"step": 33155
|
|
},
|
|
{
|
|
"entropy": 5.3788117408752445,
|
|
"epoch": 2.5799649873565453,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00043300171441124633,
|
|
"loss": 5.0124,
|
|
"mean_token_accuracy": 0.19969138354063035,
|
|
"num_tokens": 57539834.0,
|
|
"step": 33160
|
|
},
|
|
{
|
|
"entropy": 5.354266166687012,
|
|
"epoch": 2.580354016728263,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004329819810912711,
|
|
"loss": 4.9791,
|
|
"mean_token_accuracy": 0.19698383361101152,
|
|
"num_tokens": 57548962.0,
|
|
"step": 33165
|
|
},
|
|
{
|
|
"entropy": 5.332692718505859,
|
|
"epoch": 2.5807430460999807,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00043296224537417075,
|
|
"loss": 4.8862,
|
|
"mean_token_accuracy": 0.21002040505409242,
|
|
"num_tokens": 57557460.0,
|
|
"step": 33170
|
|
},
|
|
{
|
|
"entropy": 5.353478670120239,
|
|
"epoch": 2.581132075471698,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00043294250726024473,
|
|
"loss": 4.8462,
|
|
"mean_token_accuracy": 0.20843254327774047,
|
|
"num_tokens": 57566053.0,
|
|
"step": 33175
|
|
},
|
|
{
|
|
"entropy": 5.329200506210327,
|
|
"epoch": 2.5815211048434157,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004329227667497926,
|
|
"loss": 4.9446,
|
|
"mean_token_accuracy": 0.19803692847490312,
|
|
"num_tokens": 57575268.0,
|
|
"step": 33180
|
|
},
|
|
{
|
|
"entropy": 5.304578065872192,
|
|
"epoch": 2.5819101342151334,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00043290302384311373,
|
|
"loss": 4.9211,
|
|
"mean_token_accuracy": 0.20540099292993547,
|
|
"num_tokens": 57583518.0,
|
|
"step": 33185
|
|
},
|
|
{
|
|
"entropy": 5.304705095291138,
|
|
"epoch": 2.5822991635868506,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00043288327854050794,
|
|
"loss": 4.9048,
|
|
"mean_token_accuracy": 0.20250073373317717,
|
|
"num_tokens": 57592300.0,
|
|
"step": 33190
|
|
},
|
|
{
|
|
"entropy": 5.400116443634033,
|
|
"epoch": 2.5826881929585683,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00043286353084227467,
|
|
"loss": 5.0696,
|
|
"mean_token_accuracy": 0.19330461472272872,
|
|
"num_tokens": 57600694.0,
|
|
"step": 33195
|
|
},
|
|
{
|
|
"entropy": 5.418210506439209,
|
|
"epoch": 2.583077222330286,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00043284378074871354,
|
|
"loss": 5.0819,
|
|
"mean_token_accuracy": 0.19335220605134965,
|
|
"num_tokens": 57609213.0,
|
|
"step": 33200
|
|
},
|
|
{
|
|
"entropy": 5.3627111434936525,
|
|
"epoch": 2.5834662517020037,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004328240282601243,
|
|
"loss": 4.9673,
|
|
"mean_token_accuracy": 0.1970252960920334,
|
|
"num_tokens": 57617466.0,
|
|
"step": 33205
|
|
},
|
|
{
|
|
"entropy": 5.3151157855987545,
|
|
"epoch": 2.583855281073721,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004328042733768066,
|
|
"loss": 4.9886,
|
|
"mean_token_accuracy": 0.19520671516656876,
|
|
"num_tokens": 57626620.0,
|
|
"step": 33210
|
|
},
|
|
{
|
|
"entropy": 5.491671371459961,
|
|
"epoch": 2.5842443104454387,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00043278451609906027,
|
|
"loss": 5.0433,
|
|
"mean_token_accuracy": 0.19643065929412842,
|
|
"num_tokens": 57635230.0,
|
|
"step": 33215
|
|
},
|
|
{
|
|
"entropy": 5.407395267486573,
|
|
"epoch": 2.584633339817156,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00043276475642718503,
|
|
"loss": 5.0164,
|
|
"mean_token_accuracy": 0.19349130541086196,
|
|
"num_tokens": 57644444.0,
|
|
"step": 33220
|
|
},
|
|
{
|
|
"entropy": 5.435800695419312,
|
|
"epoch": 2.5850223691888736,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004327449943614808,
|
|
"loss": 5.0449,
|
|
"mean_token_accuracy": 0.19325482100248337,
|
|
"num_tokens": 57653282.0,
|
|
"step": 33225
|
|
},
|
|
{
|
|
"entropy": 5.406891775131226,
|
|
"epoch": 2.5854113985605913,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00043272522990224727,
|
|
"loss": 5.0086,
|
|
"mean_token_accuracy": 0.19932658821344376,
|
|
"num_tokens": 57661153.0,
|
|
"step": 33230
|
|
},
|
|
{
|
|
"entropy": 5.417339038848877,
|
|
"epoch": 2.585800427932309,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004327054630497844,
|
|
"loss": 5.07,
|
|
"mean_token_accuracy": 0.18848597705364228,
|
|
"num_tokens": 57669613.0,
|
|
"step": 33235
|
|
},
|
|
{
|
|
"entropy": 5.410283136367798,
|
|
"epoch": 2.5861894573040267,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00043268569380439223,
|
|
"loss": 5.0032,
|
|
"mean_token_accuracy": 0.19211409091949463,
|
|
"num_tokens": 57678174.0,
|
|
"step": 33240
|
|
},
|
|
{
|
|
"entropy": 5.367795515060425,
|
|
"epoch": 2.586578486675744,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004326659221663705,
|
|
"loss": 5.0202,
|
|
"mean_token_accuracy": 0.20239814817905427,
|
|
"num_tokens": 57687117.0,
|
|
"step": 33245
|
|
},
|
|
{
|
|
"entropy": 5.435872602462768,
|
|
"epoch": 2.5869675160474617,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004326461481360194,
|
|
"loss": 5.0582,
|
|
"mean_token_accuracy": 0.19274805784225463,
|
|
"num_tokens": 57695073.0,
|
|
"step": 33250
|
|
},
|
|
{
|
|
"entropy": 5.3038006782531735,
|
|
"epoch": 2.587356545419179,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00043262637171363906,
|
|
"loss": 4.864,
|
|
"mean_token_accuracy": 0.20748745203018187,
|
|
"num_tokens": 57703856.0,
|
|
"step": 33255
|
|
},
|
|
{
|
|
"entropy": 5.348478031158447,
|
|
"epoch": 2.5877455747908966,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00043260659289952926,
|
|
"loss": 4.8734,
|
|
"mean_token_accuracy": 0.20475658029317856,
|
|
"num_tokens": 57712072.0,
|
|
"step": 33260
|
|
},
|
|
{
|
|
"entropy": 5.363431644439697,
|
|
"epoch": 2.5881346041626143,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00043258681169399034,
|
|
"loss": 4.9949,
|
|
"mean_token_accuracy": 0.1994979441165924,
|
|
"num_tokens": 57721203.0,
|
|
"step": 33265
|
|
},
|
|
{
|
|
"entropy": 5.446130037307739,
|
|
"epoch": 2.588523633534332,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00043256702809732234,
|
|
"loss": 5.1156,
|
|
"mean_token_accuracy": 0.18319649547338485,
|
|
"num_tokens": 57730591.0,
|
|
"step": 33270
|
|
},
|
|
{
|
|
"entropy": 5.431209754943848,
|
|
"epoch": 2.5889126629060493,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004325472421098255,
|
|
"loss": 4.9862,
|
|
"mean_token_accuracy": 0.20028135031461716,
|
|
"num_tokens": 57739390.0,
|
|
"step": 33275
|
|
},
|
|
{
|
|
"entropy": 5.364736700057984,
|
|
"epoch": 2.589301692277767,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00043252745373180006,
|
|
"loss": 4.9378,
|
|
"mean_token_accuracy": 0.19527646899223328,
|
|
"num_tokens": 57748008.0,
|
|
"step": 33280
|
|
},
|
|
{
|
|
"entropy": 5.491778087615967,
|
|
"epoch": 2.5896907216494847,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004325076629635462,
|
|
"loss": 5.2218,
|
|
"mean_token_accuracy": 0.17947924733161927,
|
|
"num_tokens": 57757471.0,
|
|
"step": 33285
|
|
},
|
|
{
|
|
"entropy": 5.401350831985473,
|
|
"epoch": 2.590079751021202,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00043248786980536424,
|
|
"loss": 5.0029,
|
|
"mean_token_accuracy": 0.1967273473739624,
|
|
"num_tokens": 57766534.0,
|
|
"step": 33290
|
|
},
|
|
{
|
|
"entropy": 5.345935344696045,
|
|
"epoch": 2.5904687803929196,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004324680742575545,
|
|
"loss": 4.8953,
|
|
"mean_token_accuracy": 0.20851390063762665,
|
|
"num_tokens": 57775011.0,
|
|
"step": 33295
|
|
},
|
|
{
|
|
"entropy": 5.3977484703063965,
|
|
"epoch": 2.5908578097646373,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00043244827632041744,
|
|
"loss": 5.0336,
|
|
"mean_token_accuracy": 0.19835421741008757,
|
|
"num_tokens": 57783606.0,
|
|
"step": 33300
|
|
},
|
|
{
|
|
"entropy": 5.400182771682739,
|
|
"epoch": 2.591246839136355,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004324284759942534,
|
|
"loss": 4.9326,
|
|
"mean_token_accuracy": 0.20325964093208312,
|
|
"num_tokens": 57792170.0,
|
|
"step": 33305
|
|
},
|
|
{
|
|
"entropy": 5.286184310913086,
|
|
"epoch": 2.5916358685080723,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004324086732793627,
|
|
"loss": 4.8855,
|
|
"mean_token_accuracy": 0.20280107259750366,
|
|
"num_tokens": 57801379.0,
|
|
"step": 33310
|
|
},
|
|
{
|
|
"entropy": 5.3384490489959715,
|
|
"epoch": 2.59202489787979,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00043238886817604605,
|
|
"loss": 4.9639,
|
|
"mean_token_accuracy": 0.20065830945968627,
|
|
"num_tokens": 57810135.0,
|
|
"step": 33315
|
|
},
|
|
{
|
|
"entropy": 5.338615369796753,
|
|
"epoch": 2.5924139272515077,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004323690606846039,
|
|
"loss": 4.914,
|
|
"mean_token_accuracy": 0.19939966946840287,
|
|
"num_tokens": 57818314.0,
|
|
"step": 33320
|
|
},
|
|
{
|
|
"entropy": 5.358572483062744,
|
|
"epoch": 2.592802956623225,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00043234925080533657,
|
|
"loss": 4.9464,
|
|
"mean_token_accuracy": 0.1990666553378105,
|
|
"num_tokens": 57826883.0,
|
|
"step": 33325
|
|
},
|
|
{
|
|
"entropy": 5.355516672134399,
|
|
"epoch": 2.5931919859949426,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004323294385385448,
|
|
"loss": 4.8993,
|
|
"mean_token_accuracy": 0.19940508753061295,
|
|
"num_tokens": 57835215.0,
|
|
"step": 33330
|
|
},
|
|
{
|
|
"entropy": 5.323538827896118,
|
|
"epoch": 2.5935810153666603,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004323096238845293,
|
|
"loss": 4.9941,
|
|
"mean_token_accuracy": 0.19791705012321473,
|
|
"num_tokens": 57844002.0,
|
|
"step": 33335
|
|
},
|
|
{
|
|
"entropy": 5.403586101531983,
|
|
"epoch": 2.593970044738378,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004322898068435906,
|
|
"loss": 5.032,
|
|
"mean_token_accuracy": 0.19159453362226486,
|
|
"num_tokens": 57852453.0,
|
|
"step": 33340
|
|
},
|
|
{
|
|
"entropy": 5.3783244609832765,
|
|
"epoch": 2.5943590741100953,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004322699874160294,
|
|
"loss": 4.918,
|
|
"mean_token_accuracy": 0.1978710949420929,
|
|
"num_tokens": 57860807.0,
|
|
"step": 33345
|
|
},
|
|
{
|
|
"entropy": 5.380287170410156,
|
|
"epoch": 2.594748103481813,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00043225016560214654,
|
|
"loss": 4.9441,
|
|
"mean_token_accuracy": 0.19851536452770233,
|
|
"num_tokens": 57869768.0,
|
|
"step": 33350
|
|
},
|
|
{
|
|
"entropy": 5.436203908920288,
|
|
"epoch": 2.59513713285353,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00043223034140224266,
|
|
"loss": 4.9888,
|
|
"mean_token_accuracy": 0.1956920713186264,
|
|
"num_tokens": 57878089.0,
|
|
"step": 33355
|
|
},
|
|
{
|
|
"entropy": 5.407066535949707,
|
|
"epoch": 2.595526162225248,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004322105148166187,
|
|
"loss": 5.0088,
|
|
"mean_token_accuracy": 0.19682322889566423,
|
|
"num_tokens": 57886468.0,
|
|
"step": 33360
|
|
},
|
|
{
|
|
"entropy": 5.425498676300049,
|
|
"epoch": 2.5959151915969656,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00043219068584557526,
|
|
"loss": 5.0582,
|
|
"mean_token_accuracy": 0.1881077229976654,
|
|
"num_tokens": 57895993.0,
|
|
"step": 33365
|
|
},
|
|
{
|
|
"entropy": 5.302031803131103,
|
|
"epoch": 2.5963042209686833,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0004321708544894134,
|
|
"loss": 4.9102,
|
|
"mean_token_accuracy": 0.2070611983537674,
|
|
"num_tokens": 57904464.0,
|
|
"step": 33370
|
|
},
|
|
{
|
|
"entropy": 5.336132526397705,
|
|
"epoch": 2.5966932503404005,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00043215102074843403,
|
|
"loss": 5.0377,
|
|
"mean_token_accuracy": 0.1914057031273842,
|
|
"num_tokens": 57912711.0,
|
|
"step": 33375
|
|
},
|
|
{
|
|
"entropy": 5.358402490615845,
|
|
"epoch": 2.5970822797121182,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00043213118462293796,
|
|
"loss": 4.9883,
|
|
"mean_token_accuracy": 0.1957697793841362,
|
|
"num_tokens": 57920926.0,
|
|
"step": 33380
|
|
},
|
|
{
|
|
"entropy": 5.377789688110352,
|
|
"epoch": 2.597471309083836,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004321113461132264,
|
|
"loss": 4.923,
|
|
"mean_token_accuracy": 0.2050103187561035,
|
|
"num_tokens": 57930346.0,
|
|
"step": 33385
|
|
},
|
|
{
|
|
"entropy": 5.384866571426391,
|
|
"epoch": 2.597860338455553,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00043209150521960016,
|
|
"loss": 5.0201,
|
|
"mean_token_accuracy": 0.20044273883104324,
|
|
"num_tokens": 57938578.0,
|
|
"step": 33390
|
|
},
|
|
{
|
|
"entropy": 5.453577899932862,
|
|
"epoch": 2.598249367827271,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00043207166194236037,
|
|
"loss": 5.1144,
|
|
"mean_token_accuracy": 0.18646508008241652,
|
|
"num_tokens": 57947505.0,
|
|
"step": 33395
|
|
},
|
|
{
|
|
"entropy": 5.482055187225342,
|
|
"epoch": 2.5986383971989886,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004320518162818082,
|
|
"loss": 4.939,
|
|
"mean_token_accuracy": 0.19564956575632095,
|
|
"num_tokens": 57955806.0,
|
|
"step": 33400
|
|
},
|
|
{
|
|
"entropy": 5.4250589370727536,
|
|
"epoch": 2.5990274265707063,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004320319682382445,
|
|
"loss": 5.1483,
|
|
"mean_token_accuracy": 0.18234062492847442,
|
|
"num_tokens": 57964275.0,
|
|
"step": 33405
|
|
},
|
|
{
|
|
"entropy": 5.434121942520141,
|
|
"epoch": 2.5994164559424235,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00043201211781197075,
|
|
"loss": 5.0409,
|
|
"mean_token_accuracy": 0.19781838804483415,
|
|
"num_tokens": 57973616.0,
|
|
"step": 33410
|
|
},
|
|
{
|
|
"entropy": 5.450970888137817,
|
|
"epoch": 2.5998054853141412,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00043199226500328805,
|
|
"loss": 5.1049,
|
|
"mean_token_accuracy": 0.1951995775103569,
|
|
"num_tokens": 57982809.0,
|
|
"step": 33415
|
|
},
|
|
{
|
|
"entropy": 5.414273405075074,
|
|
"epoch": 2.600194514685859,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004319724098124975,
|
|
"loss": 4.9125,
|
|
"mean_token_accuracy": 0.2019151344895363,
|
|
"num_tokens": 57991239.0,
|
|
"step": 33420
|
|
},
|
|
{
|
|
"entropy": 5.362340831756592,
|
|
"epoch": 2.600583544057576,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00043195255223990055,
|
|
"loss": 4.9696,
|
|
"mean_token_accuracy": 0.20104119628667833,
|
|
"num_tokens": 57999213.0,
|
|
"step": 33425
|
|
},
|
|
{
|
|
"entropy": 5.36564269065857,
|
|
"epoch": 2.600972573429294,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004319326922857984,
|
|
"loss": 5.0106,
|
|
"mean_token_accuracy": 0.19516161382198333,
|
|
"num_tokens": 58008289.0,
|
|
"step": 33430
|
|
},
|
|
{
|
|
"entropy": 5.361428165435791,
|
|
"epoch": 2.6013616028010116,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004319128299504925,
|
|
"loss": 4.9513,
|
|
"mean_token_accuracy": 0.20214540958404542,
|
|
"num_tokens": 58017495.0,
|
|
"step": 33435
|
|
},
|
|
{
|
|
"entropy": 5.430932569503784,
|
|
"epoch": 2.6017506321727293,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00043189296523428407,
|
|
"loss": 5.0268,
|
|
"mean_token_accuracy": 0.20148614346981047,
|
|
"num_tokens": 58026368.0,
|
|
"step": 33440
|
|
},
|
|
{
|
|
"entropy": 5.447061967849732,
|
|
"epoch": 2.6021396615444465,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00043187309813747464,
|
|
"loss": 5.0713,
|
|
"mean_token_accuracy": 0.19386893659830093,
|
|
"num_tokens": 58035086.0,
|
|
"step": 33445
|
|
},
|
|
{
|
|
"entropy": 5.34666953086853,
|
|
"epoch": 2.6025286909161642,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00043185322866036565,
|
|
"loss": 4.976,
|
|
"mean_token_accuracy": 0.19845239222049713,
|
|
"num_tokens": 58044050.0,
|
|
"step": 33450
|
|
},
|
|
{
|
|
"entropy": 5.373878765106201,
|
|
"epoch": 2.6029177202878815,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00043183335680325866,
|
|
"loss": 4.9453,
|
|
"mean_token_accuracy": 0.19822389185428618,
|
|
"num_tokens": 58052257.0,
|
|
"step": 33455
|
|
},
|
|
{
|
|
"entropy": 5.495786714553833,
|
|
"epoch": 2.603306749659599,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00043181348256645497,
|
|
"loss": 5.1083,
|
|
"mean_token_accuracy": 0.1913090705871582,
|
|
"num_tokens": 58060742.0,
|
|
"step": 33460
|
|
},
|
|
{
|
|
"entropy": 5.390940570831299,
|
|
"epoch": 2.603695779031317,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00043179360595025637,
|
|
"loss": 4.985,
|
|
"mean_token_accuracy": 0.18620100170373916,
|
|
"num_tokens": 58069697.0,
|
|
"step": 33465
|
|
},
|
|
{
|
|
"entropy": 5.38796215057373,
|
|
"epoch": 2.6040848084030346,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004317737269549643,
|
|
"loss": 4.9387,
|
|
"mean_token_accuracy": 0.20443542748689653,
|
|
"num_tokens": 58077875.0,
|
|
"step": 33470
|
|
},
|
|
{
|
|
"entropy": 5.444569206237793,
|
|
"epoch": 2.604473837774752,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004317538455808805,
|
|
"loss": 5.0667,
|
|
"mean_token_accuracy": 0.2035176157951355,
|
|
"num_tokens": 58086500.0,
|
|
"step": 33475
|
|
},
|
|
{
|
|
"entropy": 5.317563009262085,
|
|
"epoch": 2.6048628671464695,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004317339618283065,
|
|
"loss": 4.9782,
|
|
"mean_token_accuracy": 0.20005602091550828,
|
|
"num_tokens": 58095851.0,
|
|
"step": 33480
|
|
},
|
|
{
|
|
"entropy": 5.404316806793213,
|
|
"epoch": 2.6052518965181872,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004317140756975442,
|
|
"loss": 4.9898,
|
|
"mean_token_accuracy": 0.19976191222667694,
|
|
"num_tokens": 58104462.0,
|
|
"step": 33485
|
|
},
|
|
{
|
|
"entropy": 5.462735033035278,
|
|
"epoch": 2.6056409258899045,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004316941871888951,
|
|
"loss": 5.0517,
|
|
"mean_token_accuracy": 0.19242407381534576,
|
|
"num_tokens": 58112698.0,
|
|
"step": 33490
|
|
},
|
|
{
|
|
"entropy": 5.483326816558838,
|
|
"epoch": 2.606029955261622,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00043167429630266134,
|
|
"loss": 5.038,
|
|
"mean_token_accuracy": 0.19808955490589142,
|
|
"num_tokens": 58121807.0,
|
|
"step": 33495
|
|
},
|
|
{
|
|
"entropy": 5.320720052719116,
|
|
"epoch": 2.60641898463334,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004316544030391444,
|
|
"loss": 4.9491,
|
|
"mean_token_accuracy": 0.2017153114080429,
|
|
"num_tokens": 58129824.0,
|
|
"step": 33500
|
|
},
|
|
{
|
|
"entropy": 5.434066486358643,
|
|
"epoch": 2.6068080140050576,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004316345073986461,
|
|
"loss": 4.9816,
|
|
"mean_token_accuracy": 0.2034386456012726,
|
|
"num_tokens": 58138083.0,
|
|
"step": 33505
|
|
},
|
|
{
|
|
"entropy": 5.4078453540802,
|
|
"epoch": 2.607197043376775,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004316146093814686,
|
|
"loss": 4.9596,
|
|
"mean_token_accuracy": 0.20940833538770676,
|
|
"num_tokens": 58146631.0,
|
|
"step": 33510
|
|
},
|
|
{
|
|
"entropy": 5.407180452346802,
|
|
"epoch": 2.6075860727484925,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004315947089879137,
|
|
"loss": 4.9712,
|
|
"mean_token_accuracy": 0.2028502568602562,
|
|
"num_tokens": 58154867.0,
|
|
"step": 33515
|
|
},
|
|
{
|
|
"entropy": 5.400879716873169,
|
|
"epoch": 2.60797510212021,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00043157480621828327,
|
|
"loss": 5.0245,
|
|
"mean_token_accuracy": 0.19606868475675582,
|
|
"num_tokens": 58163887.0,
|
|
"step": 33520
|
|
},
|
|
{
|
|
"entropy": 5.268083000183106,
|
|
"epoch": 2.6083641314919275,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00043155490107287935,
|
|
"loss": 4.8678,
|
|
"mean_token_accuracy": 0.20641232430934905,
|
|
"num_tokens": 58172731.0,
|
|
"step": 33525
|
|
},
|
|
{
|
|
"entropy": 5.272877883911133,
|
|
"epoch": 2.608753160863645,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004315349935520041,
|
|
"loss": 4.942,
|
|
"mean_token_accuracy": 0.2051867887377739,
|
|
"num_tokens": 58181619.0,
|
|
"step": 33530
|
|
},
|
|
{
|
|
"entropy": 5.373648023605346,
|
|
"epoch": 2.609142190235363,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004315150836559594,
|
|
"loss": 5.0311,
|
|
"mean_token_accuracy": 0.19761501699686052,
|
|
"num_tokens": 58190560.0,
|
|
"step": 33535
|
|
},
|
|
{
|
|
"entropy": 5.441530418395996,
|
|
"epoch": 2.6095312196070806,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0004314951713850474,
|
|
"loss": 5.0089,
|
|
"mean_token_accuracy": 0.19229307621717454,
|
|
"num_tokens": 58199212.0,
|
|
"step": 33540
|
|
},
|
|
{
|
|
"entropy": 5.425258159637451,
|
|
"epoch": 2.609920248978798,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00043147525673957026,
|
|
"loss": 4.9845,
|
|
"mean_token_accuracy": 0.19686296880245208,
|
|
"num_tokens": 58207704.0,
|
|
"step": 33545
|
|
},
|
|
{
|
|
"entropy": 5.367642974853515,
|
|
"epoch": 2.6103092783505155,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00043145533971983025,
|
|
"loss": 5.0492,
|
|
"mean_token_accuracy": 0.1920822188258171,
|
|
"num_tokens": 58217238.0,
|
|
"step": 33550
|
|
},
|
|
{
|
|
"entropy": 5.449360513687134,
|
|
"epoch": 2.6106983077222328,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00043143542032612935,
|
|
"loss": 5.0274,
|
|
"mean_token_accuracy": 0.20017631500959396,
|
|
"num_tokens": 58226732.0,
|
|
"step": 33555
|
|
},
|
|
{
|
|
"entropy": 5.36535611152649,
|
|
"epoch": 2.6110873370939505,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004314154985587701,
|
|
"loss": 4.9919,
|
|
"mean_token_accuracy": 0.20248396843671798,
|
|
"num_tokens": 58234602.0,
|
|
"step": 33560
|
|
},
|
|
{
|
|
"entropy": 5.351151371002198,
|
|
"epoch": 2.611476366465668,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00043139557441805457,
|
|
"loss": 5.0405,
|
|
"mean_token_accuracy": 0.1909555420279503,
|
|
"num_tokens": 58242557.0,
|
|
"step": 33565
|
|
},
|
|
{
|
|
"entropy": 5.391464948654175,
|
|
"epoch": 2.611865395837386,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.00043137564790428503,
|
|
"loss": 5.0353,
|
|
"mean_token_accuracy": 0.20138774961233138,
|
|
"num_tokens": 58251805.0,
|
|
"step": 33570
|
|
},
|
|
{
|
|
"entropy": 5.348659992218018,
|
|
"epoch": 2.6122544252091036,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.00043135571901776397,
|
|
"loss": 4.9638,
|
|
"mean_token_accuracy": 0.19846826195716857,
|
|
"num_tokens": 58261241.0,
|
|
"step": 33575
|
|
},
|
|
{
|
|
"entropy": 5.382275581359863,
|
|
"epoch": 2.612643454580821,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004313357877587937,
|
|
"loss": 4.9973,
|
|
"mean_token_accuracy": 0.20166804790496826,
|
|
"num_tokens": 58269965.0,
|
|
"step": 33580
|
|
},
|
|
{
|
|
"entropy": 5.3865598201751705,
|
|
"epoch": 2.6130324839525385,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004313158541276768,
|
|
"loss": 4.9723,
|
|
"mean_token_accuracy": 0.20207246541976928,
|
|
"num_tokens": 58278420.0,
|
|
"step": 33585
|
|
},
|
|
{
|
|
"entropy": 5.338783216476441,
|
|
"epoch": 2.6134215133242558,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004312959181247156,
|
|
"loss": 4.9262,
|
|
"mean_token_accuracy": 0.2015075668692589,
|
|
"num_tokens": 58287384.0,
|
|
"step": 33590
|
|
},
|
|
{
|
|
"entropy": 5.291149282455445,
|
|
"epoch": 2.6138105426959735,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004312759797502126,
|
|
"loss": 4.9306,
|
|
"mean_token_accuracy": 0.19975651651620865,
|
|
"num_tokens": 58295312.0,
|
|
"step": 33595
|
|
},
|
|
{
|
|
"entropy": 5.357451438903809,
|
|
"epoch": 2.614199572067691,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00043125603900447026,
|
|
"loss": 4.9649,
|
|
"mean_token_accuracy": 0.20000729858875274,
|
|
"num_tokens": 58303387.0,
|
|
"step": 33600
|
|
},
|
|
{
|
|
"entropy": 5.385416889190674,
|
|
"epoch": 2.614588601439409,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004312360958877913,
|
|
"loss": 4.9468,
|
|
"mean_token_accuracy": 0.20525642931461335,
|
|
"num_tokens": 58312368.0,
|
|
"step": 33605
|
|
},
|
|
{
|
|
"entropy": 5.305874252319336,
|
|
"epoch": 2.614977630811126,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004312161504004782,
|
|
"loss": 4.9441,
|
|
"mean_token_accuracy": 0.1985933244228363,
|
|
"num_tokens": 58320639.0,
|
|
"step": 33610
|
|
},
|
|
{
|
|
"entropy": 5.264783668518066,
|
|
"epoch": 2.615366660182844,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00043119620254283375,
|
|
"loss": 4.8839,
|
|
"mean_token_accuracy": 0.19962702691555023,
|
|
"num_tokens": 58329180.0,
|
|
"step": 33615
|
|
},
|
|
{
|
|
"entropy": 5.394754123687744,
|
|
"epoch": 2.6157556895545615,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00043117625231516054,
|
|
"loss": 4.9193,
|
|
"mean_token_accuracy": 0.20725204199552535,
|
|
"num_tokens": 58337837.0,
|
|
"step": 33620
|
|
},
|
|
{
|
|
"entropy": 5.412404537200928,
|
|
"epoch": 2.6161447189262788,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004311562997177612,
|
|
"loss": 4.9101,
|
|
"mean_token_accuracy": 0.2074065238237381,
|
|
"num_tokens": 58347000.0,
|
|
"step": 33625
|
|
},
|
|
{
|
|
"entropy": 5.265352869033814,
|
|
"epoch": 2.6165337482979965,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004311363447509386,
|
|
"loss": 4.9333,
|
|
"mean_token_accuracy": 0.20111688524484633,
|
|
"num_tokens": 58355895.0,
|
|
"step": 33630
|
|
},
|
|
{
|
|
"entropy": 5.328054332733155,
|
|
"epoch": 2.616922777669714,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004311163874149955,
|
|
"loss": 4.9818,
|
|
"mean_token_accuracy": 0.1935916304588318,
|
|
"num_tokens": 58364653.0,
|
|
"step": 33635
|
|
},
|
|
{
|
|
"entropy": 5.369314670562744,
|
|
"epoch": 2.617311807041432,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.00043109642771023464,
|
|
"loss": 4.8715,
|
|
"mean_token_accuracy": 0.2120027795433998,
|
|
"num_tokens": 58374157.0,
|
|
"step": 33640
|
|
},
|
|
{
|
|
"entropy": 5.442177724838257,
|
|
"epoch": 2.617700836413149,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0004310764656369591,
|
|
"loss": 5.0114,
|
|
"mean_token_accuracy": 0.19741845726966858,
|
|
"num_tokens": 58382870.0,
|
|
"step": 33645
|
|
},
|
|
{
|
|
"entropy": 5.402697324752808,
|
|
"epoch": 2.618089865784867,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004310565011954715,
|
|
"loss": 4.9164,
|
|
"mean_token_accuracy": 0.20557236224412917,
|
|
"num_tokens": 58391016.0,
|
|
"step": 33650
|
|
},
|
|
{
|
|
"entropy": 5.422146892547607,
|
|
"epoch": 2.618478895156584,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004310365343860748,
|
|
"loss": 5.0164,
|
|
"mean_token_accuracy": 0.20110046863555908,
|
|
"num_tokens": 58399595.0,
|
|
"step": 33655
|
|
},
|
|
{
|
|
"entropy": 5.495392179489135,
|
|
"epoch": 2.6188679245283017,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00043101656520907225,
|
|
"loss": 5.1276,
|
|
"mean_token_accuracy": 0.18900589346885682,
|
|
"num_tokens": 58409071.0,
|
|
"step": 33660
|
|
},
|
|
{
|
|
"entropy": 5.420030879974365,
|
|
"epoch": 2.6192569539000194,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004309965936647665,
|
|
"loss": 5.0536,
|
|
"mean_token_accuracy": 0.19295436441898345,
|
|
"num_tokens": 58418313.0,
|
|
"step": 33665
|
|
},
|
|
{
|
|
"entropy": 5.420562505722046,
|
|
"epoch": 2.619645983271737,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004309766197534608,
|
|
"loss": 4.9988,
|
|
"mean_token_accuracy": 0.19350678771734237,
|
|
"num_tokens": 58426263.0,
|
|
"step": 33670
|
|
},
|
|
{
|
|
"entropy": 5.397078895568848,
|
|
"epoch": 2.620035012643455,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00043095664347545816,
|
|
"loss": 5.0055,
|
|
"mean_token_accuracy": 0.19350493997335433,
|
|
"num_tokens": 58435449.0,
|
|
"step": 33675
|
|
},
|
|
{
|
|
"entropy": 5.4131121158599855,
|
|
"epoch": 2.620424042015172,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004309366648310616,
|
|
"loss": 5.039,
|
|
"mean_token_accuracy": 0.19788872599601745,
|
|
"num_tokens": 58444015.0,
|
|
"step": 33680
|
|
},
|
|
{
|
|
"entropy": 5.328211927413941,
|
|
"epoch": 2.62081307138689,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00043091668382057443,
|
|
"loss": 4.9427,
|
|
"mean_token_accuracy": 0.19611652195453644,
|
|
"num_tokens": 58452826.0,
|
|
"step": 33685
|
|
},
|
|
{
|
|
"entropy": 5.412720251083374,
|
|
"epoch": 2.621202100758607,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00043089670044429973,
|
|
"loss": 5.0704,
|
|
"mean_token_accuracy": 0.1993011489510536,
|
|
"num_tokens": 58462175.0,
|
|
"step": 33690
|
|
},
|
|
{
|
|
"entropy": 5.2831415176391605,
|
|
"epoch": 2.6215911301303247,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00043087671470254076,
|
|
"loss": 4.8619,
|
|
"mean_token_accuracy": 0.20176911652088164,
|
|
"num_tokens": 58470714.0,
|
|
"step": 33695
|
|
},
|
|
{
|
|
"entropy": 5.285301208496094,
|
|
"epoch": 2.6219801595020424,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00043085672659560077,
|
|
"loss": 4.8748,
|
|
"mean_token_accuracy": 0.20314591079950334,
|
|
"num_tokens": 58478839.0,
|
|
"step": 33700
|
|
},
|
|
{
|
|
"entropy": 5.391962003707886,
|
|
"epoch": 2.62236918887376,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00043083673612378295,
|
|
"loss": 5.0539,
|
|
"mean_token_accuracy": 0.19382858127355576,
|
|
"num_tokens": 58488184.0,
|
|
"step": 33705
|
|
},
|
|
{
|
|
"entropy": 5.4472403049469,
|
|
"epoch": 2.6227582182454774,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00043081674328739066,
|
|
"loss": 5.055,
|
|
"mean_token_accuracy": 0.19025808721780776,
|
|
"num_tokens": 58497202.0,
|
|
"step": 33710
|
|
},
|
|
{
|
|
"entropy": 5.368722581863404,
|
|
"epoch": 2.623147247617195,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00043079674808672744,
|
|
"loss": 4.8864,
|
|
"mean_token_accuracy": 0.20194543302059173,
|
|
"num_tokens": 58505885.0,
|
|
"step": 33715
|
|
},
|
|
{
|
|
"entropy": 5.364418888092041,
|
|
"epoch": 2.623536276988913,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004307767505220964,
|
|
"loss": 4.8886,
|
|
"mean_token_accuracy": 0.20877785682678224,
|
|
"num_tokens": 58513807.0,
|
|
"step": 33720
|
|
},
|
|
{
|
|
"entropy": 5.259344053268433,
|
|
"epoch": 2.62392530636063,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004307567505938012,
|
|
"loss": 4.8896,
|
|
"mean_token_accuracy": 0.2084610104560852,
|
|
"num_tokens": 58522426.0,
|
|
"step": 33725
|
|
},
|
|
{
|
|
"entropy": 5.316966390609741,
|
|
"epoch": 2.6243143357323477,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004307367483021452,
|
|
"loss": 4.971,
|
|
"mean_token_accuracy": 0.19935321658849717,
|
|
"num_tokens": 58531038.0,
|
|
"step": 33730
|
|
},
|
|
{
|
|
"entropy": 5.392615222930909,
|
|
"epoch": 2.6247033651040654,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.000430716743647432,
|
|
"loss": 4.9696,
|
|
"mean_token_accuracy": 0.20287786424160004,
|
|
"num_tokens": 58539373.0,
|
|
"step": 33735
|
|
},
|
|
{
|
|
"entropy": 5.304162693023682,
|
|
"epoch": 2.625092394475783,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.000430696736629965,
|
|
"loss": 4.848,
|
|
"mean_token_accuracy": 0.20108741670846939,
|
|
"num_tokens": 58547295.0,
|
|
"step": 33740
|
|
},
|
|
{
|
|
"entropy": 5.385747814178467,
|
|
"epoch": 2.6254814238475004,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004306767272500478,
|
|
"loss": 5.0385,
|
|
"mean_token_accuracy": 0.1988581657409668,
|
|
"num_tokens": 58555614.0,
|
|
"step": 33745
|
|
},
|
|
{
|
|
"entropy": 5.371101379394531,
|
|
"epoch": 2.625870453219218,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00043065671550798415,
|
|
"loss": 4.9573,
|
|
"mean_token_accuracy": 0.1950088396668434,
|
|
"num_tokens": 58564444.0,
|
|
"step": 33750
|
|
},
|
|
{
|
|
"entropy": 5.356553030014038,
|
|
"epoch": 2.626259482590936,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00043063670140407753,
|
|
"loss": 4.9221,
|
|
"mean_token_accuracy": 0.19957908540964125,
|
|
"num_tokens": 58573446.0,
|
|
"step": 33755
|
|
},
|
|
{
|
|
"entropy": 5.4460368156433105,
|
|
"epoch": 2.626648511962653,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004306166849386317,
|
|
"loss": 4.9662,
|
|
"mean_token_accuracy": 0.19512048363685608,
|
|
"num_tokens": 58582065.0,
|
|
"step": 33760
|
|
},
|
|
{
|
|
"entropy": 5.286070871353149,
|
|
"epoch": 2.6270375413343707,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.00043059666611195037,
|
|
"loss": 4.8648,
|
|
"mean_token_accuracy": 0.2067467451095581,
|
|
"num_tokens": 58590222.0,
|
|
"step": 33765
|
|
},
|
|
{
|
|
"entropy": 5.37785530090332,
|
|
"epoch": 2.6274265707060884,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004305766449243372,
|
|
"loss": 4.9653,
|
|
"mean_token_accuracy": 0.1987467661499977,
|
|
"num_tokens": 58598745.0,
|
|
"step": 33770
|
|
},
|
|
{
|
|
"entropy": 5.415403127670288,
|
|
"epoch": 2.627815600077806,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004305566213760962,
|
|
"loss": 4.9598,
|
|
"mean_token_accuracy": 0.2010659620165825,
|
|
"num_tokens": 58607199.0,
|
|
"step": 33775
|
|
},
|
|
{
|
|
"entropy": 5.411853265762329,
|
|
"epoch": 2.6282046294495234,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00043053659546753094,
|
|
"loss": 5.0748,
|
|
"mean_token_accuracy": 0.1880352020263672,
|
|
"num_tokens": 58616593.0,
|
|
"step": 33780
|
|
},
|
|
{
|
|
"entropy": 5.390313053131104,
|
|
"epoch": 2.628593658821241,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004305165671989455,
|
|
"loss": 4.9864,
|
|
"mean_token_accuracy": 0.1959020674228668,
|
|
"num_tokens": 58626165.0,
|
|
"step": 33785
|
|
},
|
|
{
|
|
"entropy": 5.340438365936279,
|
|
"epoch": 2.6289826881929583,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004304965365706437,
|
|
"loss": 4.9505,
|
|
"mean_token_accuracy": 0.19808007031679153,
|
|
"num_tokens": 58634392.0,
|
|
"step": 33790
|
|
},
|
|
{
|
|
"entropy": 5.339203262329102,
|
|
"epoch": 2.629371717564676,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004304765035829294,
|
|
"loss": 5.0612,
|
|
"mean_token_accuracy": 0.19623716324567794,
|
|
"num_tokens": 58644584.0,
|
|
"step": 33795
|
|
},
|
|
{
|
|
"entropy": 5.432407188415527,
|
|
"epoch": 2.6297607469363937,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00043045646823610664,
|
|
"loss": 5.0914,
|
|
"mean_token_accuracy": 0.1944478213787079,
|
|
"num_tokens": 58653601.0,
|
|
"step": 33800
|
|
},
|
|
{
|
|
"entropy": 5.409682035446167,
|
|
"epoch": 2.6301497763081114,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00043043643053047935,
|
|
"loss": 4.9547,
|
|
"mean_token_accuracy": 0.20303696691989898,
|
|
"num_tokens": 58661947.0,
|
|
"step": 33805
|
|
},
|
|
{
|
|
"entropy": 5.412146854400635,
|
|
"epoch": 2.6305388056798287,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004304163904663517,
|
|
"loss": 5.0985,
|
|
"mean_token_accuracy": 0.18883245438337326,
|
|
"num_tokens": 58670537.0,
|
|
"step": 33810
|
|
},
|
|
{
|
|
"entropy": 5.375216341018676,
|
|
"epoch": 2.6309278350515464,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00043039634804402767,
|
|
"loss": 4.9179,
|
|
"mean_token_accuracy": 0.20188799649477004,
|
|
"num_tokens": 58679491.0,
|
|
"step": 33815
|
|
},
|
|
{
|
|
"entropy": 5.359619379043579,
|
|
"epoch": 2.631316864423264,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004303763032638114,
|
|
"loss": 4.9458,
|
|
"mean_token_accuracy": 0.20124406963586808,
|
|
"num_tokens": 58689078.0,
|
|
"step": 33820
|
|
},
|
|
{
|
|
"entropy": 5.346489763259887,
|
|
"epoch": 2.6317058937949813,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004303562561260071,
|
|
"loss": 4.9345,
|
|
"mean_token_accuracy": 0.2009949043393135,
|
|
"num_tokens": 58697113.0,
|
|
"step": 33825
|
|
},
|
|
{
|
|
"entropy": 5.398408365249634,
|
|
"epoch": 2.632094923166699,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00043033620663091883,
|
|
"loss": 5.0123,
|
|
"mean_token_accuracy": 0.19807095676660538,
|
|
"num_tokens": 58705368.0,
|
|
"step": 33830
|
|
},
|
|
{
|
|
"entropy": 5.347299528121948,
|
|
"epoch": 2.6324839525384167,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004303161547788509,
|
|
"loss": 4.9623,
|
|
"mean_token_accuracy": 0.2005300059914589,
|
|
"num_tokens": 58713828.0,
|
|
"step": 33835
|
|
},
|
|
{
|
|
"entropy": 5.3324816703796385,
|
|
"epoch": 2.6328729819101344,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004302961005701074,
|
|
"loss": 4.9292,
|
|
"mean_token_accuracy": 0.1988653466105461,
|
|
"num_tokens": 58721896.0,
|
|
"step": 33840
|
|
},
|
|
{
|
|
"entropy": 5.466010904312133,
|
|
"epoch": 2.6332620112818517,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00043027604400499295,
|
|
"loss": 5.0104,
|
|
"mean_token_accuracy": 0.1985572025179863,
|
|
"num_tokens": 58729861.0,
|
|
"step": 33845
|
|
},
|
|
{
|
|
"entropy": 5.370575618743897,
|
|
"epoch": 2.6336510406535694,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00043025598508381155,
|
|
"loss": 4.9074,
|
|
"mean_token_accuracy": 0.21031697392463683,
|
|
"num_tokens": 58738023.0,
|
|
"step": 33850
|
|
},
|
|
{
|
|
"entropy": 5.328470468521118,
|
|
"epoch": 2.634040070025287,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004302359238068677,
|
|
"loss": 4.9954,
|
|
"mean_token_accuracy": 0.19577166587114334,
|
|
"num_tokens": 58746678.0,
|
|
"step": 33855
|
|
},
|
|
{
|
|
"entropy": 5.310218381881714,
|
|
"epoch": 2.6344290993970043,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00043021586017446585,
|
|
"loss": 4.8731,
|
|
"mean_token_accuracy": 0.2083798587322235,
|
|
"num_tokens": 58754746.0,
|
|
"step": 33860
|
|
},
|
|
{
|
|
"entropy": 5.336911725997925,
|
|
"epoch": 2.634818128768722,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00043019579418691027,
|
|
"loss": 4.9679,
|
|
"mean_token_accuracy": 0.19931928366422652,
|
|
"num_tokens": 58762972.0,
|
|
"step": 33865
|
|
},
|
|
{
|
|
"entropy": 5.398266410827636,
|
|
"epoch": 2.6352071581404397,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004301757258445056,
|
|
"loss": 5.0155,
|
|
"mean_token_accuracy": 0.19271832406520845,
|
|
"num_tokens": 58772529.0,
|
|
"step": 33870
|
|
},
|
|
{
|
|
"entropy": 5.321041297912598,
|
|
"epoch": 2.6355961875121574,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004301556551475563,
|
|
"loss": 4.8931,
|
|
"mean_token_accuracy": 0.206895911693573,
|
|
"num_tokens": 58781239.0,
|
|
"step": 33875
|
|
},
|
|
{
|
|
"entropy": 5.386790609359741,
|
|
"epoch": 2.6359852168838747,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004301355820963669,
|
|
"loss": 4.9493,
|
|
"mean_token_accuracy": 0.2011219471693039,
|
|
"num_tokens": 58789876.0,
|
|
"step": 33880
|
|
},
|
|
{
|
|
"entropy": 5.38179497718811,
|
|
"epoch": 2.6363742462555924,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004301155066912419,
|
|
"loss": 5.0133,
|
|
"mean_token_accuracy": 0.20095726251602172,
|
|
"num_tokens": 58798383.0,
|
|
"step": 33885
|
|
},
|
|
{
|
|
"entropy": 5.3700066089630125,
|
|
"epoch": 2.6367632756273096,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.000430095428932486,
|
|
"loss": 5.0093,
|
|
"mean_token_accuracy": 0.19604776054620743,
|
|
"num_tokens": 58806804.0,
|
|
"step": 33890
|
|
},
|
|
{
|
|
"entropy": 5.400948143005371,
|
|
"epoch": 2.6371523049990273,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00043007534882040385,
|
|
"loss": 4.9935,
|
|
"mean_token_accuracy": 0.19742311537265778,
|
|
"num_tokens": 58815755.0,
|
|
"step": 33895
|
|
},
|
|
{
|
|
"entropy": 5.419873762130737,
|
|
"epoch": 2.637541334370745,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004300552663553001,
|
|
"loss": 4.9914,
|
|
"mean_token_accuracy": 0.20688812136650087,
|
|
"num_tokens": 58824547.0,
|
|
"step": 33900
|
|
},
|
|
{
|
|
"entropy": 5.369836711883545,
|
|
"epoch": 2.6379303637424627,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0004300351815374795,
|
|
"loss": 5.0072,
|
|
"mean_token_accuracy": 0.19931228905916215,
|
|
"num_tokens": 58832471.0,
|
|
"step": 33905
|
|
},
|
|
{
|
|
"entropy": 5.341547966003418,
|
|
"epoch": 2.63831939311418,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0004300150943672467,
|
|
"loss": 5.0829,
|
|
"mean_token_accuracy": 0.19942234307527543,
|
|
"num_tokens": 58841367.0,
|
|
"step": 33910
|
|
},
|
|
{
|
|
"entropy": 5.388499546051025,
|
|
"epoch": 2.6387084224858977,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004299950048449067,
|
|
"loss": 4.9807,
|
|
"mean_token_accuracy": 0.19883813709020615,
|
|
"num_tokens": 58849946.0,
|
|
"step": 33915
|
|
},
|
|
{
|
|
"entropy": 5.457522773742676,
|
|
"epoch": 2.6390974518576154,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004299749129707641,
|
|
"loss": 5.0547,
|
|
"mean_token_accuracy": 0.1964985638856888,
|
|
"num_tokens": 58858288.0,
|
|
"step": 33920
|
|
},
|
|
{
|
|
"entropy": 5.435612201690674,
|
|
"epoch": 2.6394864812293326,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004299548187451239,
|
|
"loss": 5.0339,
|
|
"mean_token_accuracy": 0.1905030280351639,
|
|
"num_tokens": 58866968.0,
|
|
"step": 33925
|
|
},
|
|
{
|
|
"entropy": 5.409523153305054,
|
|
"epoch": 2.6398755106010503,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00042993472216829097,
|
|
"loss": 4.9266,
|
|
"mean_token_accuracy": 0.20145703107118607,
|
|
"num_tokens": 58875635.0,
|
|
"step": 33930
|
|
},
|
|
{
|
|
"entropy": 5.381389904022217,
|
|
"epoch": 2.640264539972768,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00042991462324057025,
|
|
"loss": 4.9762,
|
|
"mean_token_accuracy": 0.2029273509979248,
|
|
"num_tokens": 58884080.0,
|
|
"step": 33935
|
|
},
|
|
{
|
|
"entropy": 5.238629484176636,
|
|
"epoch": 2.6406535693444857,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004298945219622667,
|
|
"loss": 4.8754,
|
|
"mean_token_accuracy": 0.20865669548511506,
|
|
"num_tokens": 58891770.0,
|
|
"step": 33940
|
|
},
|
|
{
|
|
"entropy": 5.334838724136352,
|
|
"epoch": 2.641042598716203,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00042987441833368525,
|
|
"loss": 5.01,
|
|
"mean_token_accuracy": 0.19921975284814836,
|
|
"num_tokens": 58900446.0,
|
|
"step": 33945
|
|
},
|
|
{
|
|
"entropy": 5.439420175552368,
|
|
"epoch": 2.6414316280879206,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00042985431235513104,
|
|
"loss": 4.9926,
|
|
"mean_token_accuracy": 0.1968791589140892,
|
|
"num_tokens": 58909423.0,
|
|
"step": 33950
|
|
},
|
|
{
|
|
"entropy": 5.449236583709717,
|
|
"epoch": 2.6418206574596383,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00042983420402690917,
|
|
"loss": 5.0499,
|
|
"mean_token_accuracy": 0.19054039865732192,
|
|
"num_tokens": 58918175.0,
|
|
"step": 33955
|
|
},
|
|
{
|
|
"entropy": 5.343872213363648,
|
|
"epoch": 2.6422096868313556,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00042981409334932457,
|
|
"loss": 4.9573,
|
|
"mean_token_accuracy": 0.19938016086816787,
|
|
"num_tokens": 58926837.0,
|
|
"step": 33960
|
|
},
|
|
{
|
|
"entropy": 5.421875762939453,
|
|
"epoch": 2.6425987162030733,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004297939803226826,
|
|
"loss": 5.0211,
|
|
"mean_token_accuracy": 0.19759977757930755,
|
|
"num_tokens": 58934994.0,
|
|
"step": 33965
|
|
},
|
|
{
|
|
"entropy": 5.2958104610443115,
|
|
"epoch": 2.642987745574791,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004297738649472884,
|
|
"loss": 4.9504,
|
|
"mean_token_accuracy": 0.19949800819158553,
|
|
"num_tokens": 58943937.0,
|
|
"step": 33970
|
|
},
|
|
{
|
|
"entropy": 5.375646591186523,
|
|
"epoch": 2.6433767749465087,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00042975374722344713,
|
|
"loss": 5.0083,
|
|
"mean_token_accuracy": 0.1908338874578476,
|
|
"num_tokens": 58952360.0,
|
|
"step": 33975
|
|
},
|
|
{
|
|
"entropy": 5.363486623764038,
|
|
"epoch": 2.643765804318226,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.00042973362715146397,
|
|
"loss": 4.9696,
|
|
"mean_token_accuracy": 0.20372772812843323,
|
|
"num_tokens": 58961846.0,
|
|
"step": 33980
|
|
},
|
|
{
|
|
"entropy": 5.443544578552246,
|
|
"epoch": 2.6441548336899436,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004297135047316444,
|
|
"loss": 5.0161,
|
|
"mean_token_accuracy": 0.19347030073404312,
|
|
"num_tokens": 58970215.0,
|
|
"step": 33985
|
|
},
|
|
{
|
|
"entropy": 5.326972198486328,
|
|
"epoch": 2.644543863061661,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004296933799642936,
|
|
"loss": 4.8945,
|
|
"mean_token_accuracy": 0.19867499619722367,
|
|
"num_tokens": 58978623.0,
|
|
"step": 33990
|
|
},
|
|
{
|
|
"entropy": 5.38586802482605,
|
|
"epoch": 2.6449328924333786,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.000429673252849717,
|
|
"loss": 4.9569,
|
|
"mean_token_accuracy": 0.2069807007908821,
|
|
"num_tokens": 58986616.0,
|
|
"step": 33995
|
|
},
|
|
{
|
|
"entropy": 5.369820690155029,
|
|
"epoch": 2.6453219218050963,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00042965312338822005,
|
|
"loss": 5.0237,
|
|
"mean_token_accuracy": 0.1951487958431244,
|
|
"num_tokens": 58996121.0,
|
|
"step": 34000
|
|
},
|
|
{
|
|
"entropy": 5.3093428134918215,
|
|
"epoch": 2.645710951176814,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.000429632991580108,
|
|
"loss": 4.9157,
|
|
"mean_token_accuracy": 0.20189906805753707,
|
|
"num_tokens": 59004272.0,
|
|
"step": 34005
|
|
},
|
|
{
|
|
"entropy": 5.322339344024658,
|
|
"epoch": 2.6460999805485317,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0004296128574256864,
|
|
"loss": 4.9876,
|
|
"mean_token_accuracy": 0.19918779730796815,
|
|
"num_tokens": 59012513.0,
|
|
"step": 34010
|
|
},
|
|
{
|
|
"entropy": 5.3901525974273685,
|
|
"epoch": 2.646489009920249,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00042959272092526086,
|
|
"loss": 4.9575,
|
|
"mean_token_accuracy": 0.1992514669895172,
|
|
"num_tokens": 59021071.0,
|
|
"step": 34015
|
|
},
|
|
{
|
|
"entropy": 5.449054336547851,
|
|
"epoch": 2.6468780392919666,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00042957258207913687,
|
|
"loss": 5.0055,
|
|
"mean_token_accuracy": 0.19276181608438492,
|
|
"num_tokens": 59030154.0,
|
|
"step": 34020
|
|
},
|
|
{
|
|
"entropy": 5.382087850570679,
|
|
"epoch": 2.647267068663684,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00042955244088761985,
|
|
"loss": 5.0367,
|
|
"mean_token_accuracy": 0.19534399658441542,
|
|
"num_tokens": 59038962.0,
|
|
"step": 34025
|
|
},
|
|
{
|
|
"entropy": 5.360858201980591,
|
|
"epoch": 2.6476560980354016,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004295322973510156,
|
|
"loss": 4.9474,
|
|
"mean_token_accuracy": 0.1984208732843399,
|
|
"num_tokens": 59046856.0,
|
|
"step": 34030
|
|
},
|
|
{
|
|
"entropy": 5.403586339950562,
|
|
"epoch": 2.6480451274071193,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004295121514696297,
|
|
"loss": 5.0008,
|
|
"mean_token_accuracy": 0.1961250826716423,
|
|
"num_tokens": 59055124.0,
|
|
"step": 34035
|
|
},
|
|
{
|
|
"entropy": 5.407391691207886,
|
|
"epoch": 2.648434156778837,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00042949200324376784,
|
|
"loss": 5.0447,
|
|
"mean_token_accuracy": 0.19331638514995575,
|
|
"num_tokens": 59064104.0,
|
|
"step": 34040
|
|
},
|
|
{
|
|
"entropy": 5.322826862335205,
|
|
"epoch": 2.6488231861505542,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004294718526737357,
|
|
"loss": 4.9151,
|
|
"mean_token_accuracy": 0.20747000128030776,
|
|
"num_tokens": 59071991.0,
|
|
"step": 34045
|
|
},
|
|
{
|
|
"entropy": 5.331176900863648,
|
|
"epoch": 2.649212215522272,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004294516997598391,
|
|
"loss": 4.9594,
|
|
"mean_token_accuracy": 0.21118363589048386,
|
|
"num_tokens": 59080519.0,
|
|
"step": 34050
|
|
},
|
|
{
|
|
"entropy": 5.352009677886963,
|
|
"epoch": 2.6496012448939896,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004294315445023838,
|
|
"loss": 4.9748,
|
|
"mean_token_accuracy": 0.19531098008155823,
|
|
"num_tokens": 59089555.0,
|
|
"step": 34055
|
|
},
|
|
{
|
|
"entropy": 5.4087567806243895,
|
|
"epoch": 2.649990274265707,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00042941138690167556,
|
|
"loss": 4.9653,
|
|
"mean_token_accuracy": 0.195447239279747,
|
|
"num_tokens": 59098287.0,
|
|
"step": 34060
|
|
},
|
|
{
|
|
"entropy": 5.304724788665771,
|
|
"epoch": 2.6503793036374246,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004293912269580204,
|
|
"loss": 4.9497,
|
|
"mean_token_accuracy": 0.20810438990592955,
|
|
"num_tokens": 59106463.0,
|
|
"step": 34065
|
|
},
|
|
{
|
|
"entropy": 5.443411016464234,
|
|
"epoch": 2.6507683330091423,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.000429371064671724,
|
|
"loss": 5.0232,
|
|
"mean_token_accuracy": 0.19603666812181472,
|
|
"num_tokens": 59115324.0,
|
|
"step": 34070
|
|
},
|
|
{
|
|
"entropy": 5.352826690673828,
|
|
"epoch": 2.65115736238086,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00042935090004309247,
|
|
"loss": 4.9221,
|
|
"mean_token_accuracy": 0.20554738491773605,
|
|
"num_tokens": 59123438.0,
|
|
"step": 34075
|
|
},
|
|
{
|
|
"entropy": 5.444900560379028,
|
|
"epoch": 2.6515463917525772,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00042933073307243165,
|
|
"loss": 4.9705,
|
|
"mean_token_accuracy": 0.19962027221918105,
|
|
"num_tokens": 59131436.0,
|
|
"step": 34080
|
|
},
|
|
{
|
|
"entropy": 5.356242513656616,
|
|
"epoch": 2.651935421124295,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00042931056376004767,
|
|
"loss": 5.0306,
|
|
"mean_token_accuracy": 0.20063393115997313,
|
|
"num_tokens": 59139981.0,
|
|
"step": 34085
|
|
},
|
|
{
|
|
"entropy": 5.35341067314148,
|
|
"epoch": 2.652324450496012,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004292903921062465,
|
|
"loss": 4.9508,
|
|
"mean_token_accuracy": 0.20287465304136276,
|
|
"num_tokens": 59148833.0,
|
|
"step": 34090
|
|
},
|
|
{
|
|
"entropy": 5.39759783744812,
|
|
"epoch": 2.65271347986773,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00042927021811133416,
|
|
"loss": 5.0181,
|
|
"mean_token_accuracy": 0.18732453584671022,
|
|
"num_tokens": 59157597.0,
|
|
"step": 34095
|
|
},
|
|
{
|
|
"entropy": 5.412077140808106,
|
|
"epoch": 2.6531025092394476,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004292500417756167,
|
|
"loss": 4.9417,
|
|
"mean_token_accuracy": 0.19840147346258163,
|
|
"num_tokens": 59166286.0,
|
|
"step": 34100
|
|
},
|
|
{
|
|
"entropy": 5.4304920673370365,
|
|
"epoch": 2.6534915386111653,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.00042922986309940054,
|
|
"loss": 4.9777,
|
|
"mean_token_accuracy": 0.2007758140563965,
|
|
"num_tokens": 59174019.0,
|
|
"step": 34105
|
|
},
|
|
{
|
|
"entropy": 5.368457078933716,
|
|
"epoch": 2.653880567982883,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00042920968208299165,
|
|
"loss": 4.9787,
|
|
"mean_token_accuracy": 0.19855939596891403,
|
|
"num_tokens": 59183885.0,
|
|
"step": 34110
|
|
},
|
|
{
|
|
"entropy": 5.375678491592407,
|
|
"epoch": 2.6542695973546,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004291894987266963,
|
|
"loss": 4.8709,
|
|
"mean_token_accuracy": 0.2022365391254425,
|
|
"num_tokens": 59192196.0,
|
|
"step": 34115
|
|
},
|
|
{
|
|
"entropy": 5.377045917510986,
|
|
"epoch": 2.654658626726318,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00042916931303082064,
|
|
"loss": 4.9672,
|
|
"mean_token_accuracy": 0.19909878820180893,
|
|
"num_tokens": 59200269.0,
|
|
"step": 34120
|
|
},
|
|
{
|
|
"entropy": 5.409608983993531,
|
|
"epoch": 2.655047656098035,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.00042914912499567113,
|
|
"loss": 5.013,
|
|
"mean_token_accuracy": 0.19263674318790436,
|
|
"num_tokens": 59208690.0,
|
|
"step": 34125
|
|
},
|
|
{
|
|
"entropy": 5.42937707901001,
|
|
"epoch": 2.655436685469753,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00042912893462155395,
|
|
"loss": 4.9966,
|
|
"mean_token_accuracy": 0.1995888277888298,
|
|
"num_tokens": 59217222.0,
|
|
"step": 34130
|
|
},
|
|
{
|
|
"entropy": 5.408893966674805,
|
|
"epoch": 2.6558257148414706,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00042910874190877545,
|
|
"loss": 5.0139,
|
|
"mean_token_accuracy": 0.19425088763237,
|
|
"num_tokens": 59226161.0,
|
|
"step": 34135
|
|
},
|
|
{
|
|
"entropy": 5.424232816696167,
|
|
"epoch": 2.6562147442131883,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004290885468576422,
|
|
"loss": 4.9736,
|
|
"mean_token_accuracy": 0.19455759227275848,
|
|
"num_tokens": 59234239.0,
|
|
"step": 34140
|
|
},
|
|
{
|
|
"entropy": 5.341923618316651,
|
|
"epoch": 2.6566037735849055,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004290683494684604,
|
|
"loss": 4.8945,
|
|
"mean_token_accuracy": 0.20466382503509523,
|
|
"num_tokens": 59243390.0,
|
|
"step": 34145
|
|
},
|
|
{
|
|
"entropy": 5.3401671886444095,
|
|
"epoch": 2.656992802956623,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004290481497415367,
|
|
"loss": 4.9959,
|
|
"mean_token_accuracy": 0.2013798713684082,
|
|
"num_tokens": 59252854.0,
|
|
"step": 34150
|
|
},
|
|
{
|
|
"entropy": 5.283523893356323,
|
|
"epoch": 2.657381832328341,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004290279476771775,
|
|
"loss": 4.941,
|
|
"mean_token_accuracy": 0.2010742887854576,
|
|
"num_tokens": 59261505.0,
|
|
"step": 34155
|
|
},
|
|
{
|
|
"entropy": 5.390388917922974,
|
|
"epoch": 2.657770861700058,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0004290077432756894,
|
|
"loss": 4.9453,
|
|
"mean_token_accuracy": 0.1980362981557846,
|
|
"num_tokens": 59269209.0,
|
|
"step": 34160
|
|
},
|
|
{
|
|
"entropy": 5.388629341125489,
|
|
"epoch": 2.658159891071776,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004289875365373788,
|
|
"loss": 4.9782,
|
|
"mean_token_accuracy": 0.1909873217344284,
|
|
"num_tokens": 59277951.0,
|
|
"step": 34165
|
|
},
|
|
{
|
|
"entropy": 5.255499410629272,
|
|
"epoch": 2.6585489204434936,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00042896732746255256,
|
|
"loss": 4.8574,
|
|
"mean_token_accuracy": 0.20869599431753158,
|
|
"num_tokens": 59286266.0,
|
|
"step": 34170
|
|
},
|
|
{
|
|
"entropy": 5.35825834274292,
|
|
"epoch": 2.6589379498152113,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00042894711605151714,
|
|
"loss": 4.9968,
|
|
"mean_token_accuracy": 0.2000477448105812,
|
|
"num_tokens": 59294633.0,
|
|
"step": 34175
|
|
},
|
|
{
|
|
"entropy": 5.412497901916504,
|
|
"epoch": 2.6593269791869285,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00042892690230457924,
|
|
"loss": 4.9362,
|
|
"mean_token_accuracy": 0.21323633342981338,
|
|
"num_tokens": 59303526.0,
|
|
"step": 34180
|
|
},
|
|
{
|
|
"entropy": 5.3982268333435055,
|
|
"epoch": 2.659716008558646,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00042890668622204566,
|
|
"loss": 4.9193,
|
|
"mean_token_accuracy": 0.20515376925468445,
|
|
"num_tokens": 59311921.0,
|
|
"step": 34185
|
|
},
|
|
{
|
|
"entropy": 5.44091100692749,
|
|
"epoch": 2.660105037930364,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.000428886467804223,
|
|
"loss": 5.1137,
|
|
"mean_token_accuracy": 0.19864630848169326,
|
|
"num_tokens": 59320750.0,
|
|
"step": 34190
|
|
},
|
|
{
|
|
"entropy": 5.328501605987549,
|
|
"epoch": 2.660494067302081,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00042886624705141825,
|
|
"loss": 4.9101,
|
|
"mean_token_accuracy": 0.19891910552978515,
|
|
"num_tokens": 59330036.0,
|
|
"step": 34195
|
|
},
|
|
{
|
|
"entropy": 5.408054637908935,
|
|
"epoch": 2.660883096673799,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00042884602396393796,
|
|
"loss": 5.0638,
|
|
"mean_token_accuracy": 0.19057366698980333,
|
|
"num_tokens": 59339022.0,
|
|
"step": 34200
|
|
},
|
|
{
|
|
"entropy": 5.372069311141968,
|
|
"epoch": 2.6612721260455166,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0004288257985420892,
|
|
"loss": 4.8901,
|
|
"mean_token_accuracy": 0.20684991031885147,
|
|
"num_tokens": 59347599.0,
|
|
"step": 34205
|
|
},
|
|
{
|
|
"entropy": 5.465782642364502,
|
|
"epoch": 2.6616611554172342,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004288055707861788,
|
|
"loss": 5.0279,
|
|
"mean_token_accuracy": 0.19743961840867996,
|
|
"num_tokens": 59356453.0,
|
|
"step": 34210
|
|
},
|
|
{
|
|
"entropy": 5.355468797683716,
|
|
"epoch": 2.6620501847889515,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00042878534069651364,
|
|
"loss": 4.9745,
|
|
"mean_token_accuracy": 0.2011051207780838,
|
|
"num_tokens": 59364617.0,
|
|
"step": 34215
|
|
},
|
|
{
|
|
"entropy": 5.373475217819214,
|
|
"epoch": 2.662439214160669,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004287651082734007,
|
|
"loss": 5.0296,
|
|
"mean_token_accuracy": 0.19224614202976226,
|
|
"num_tokens": 59374144.0,
|
|
"step": 34220
|
|
},
|
|
{
|
|
"entropy": 5.418906593322754,
|
|
"epoch": 2.6628282435323865,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.000428744873517147,
|
|
"loss": 5.0576,
|
|
"mean_token_accuracy": 0.19127493351697922,
|
|
"num_tokens": 59382572.0,
|
|
"step": 34225
|
|
},
|
|
{
|
|
"entropy": 5.457189226150513,
|
|
"epoch": 2.663217272904104,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004287246364280596,
|
|
"loss": 5.0674,
|
|
"mean_token_accuracy": 0.1901233658194542,
|
|
"num_tokens": 59391582.0,
|
|
"step": 34230
|
|
},
|
|
{
|
|
"entropy": 5.376083421707153,
|
|
"epoch": 2.663606302275822,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004287043970064455,
|
|
"loss": 4.9607,
|
|
"mean_token_accuracy": 0.2063121095299721,
|
|
"num_tokens": 59400760.0,
|
|
"step": 34235
|
|
},
|
|
{
|
|
"entropy": 5.445486927032471,
|
|
"epoch": 2.6639953316475395,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004286841552526118,
|
|
"loss": 5.1056,
|
|
"mean_token_accuracy": 0.1899155631661415,
|
|
"num_tokens": 59409427.0,
|
|
"step": 34240
|
|
},
|
|
{
|
|
"entropy": 5.340504169464111,
|
|
"epoch": 2.664384361019257,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00042866391116686567,
|
|
"loss": 4.9555,
|
|
"mean_token_accuracy": 0.19601063430309296,
|
|
"num_tokens": 59417538.0,
|
|
"step": 34245
|
|
},
|
|
{
|
|
"entropy": 5.41779351234436,
|
|
"epoch": 2.6647733903909745,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004286436647495142,
|
|
"loss": 4.958,
|
|
"mean_token_accuracy": 0.1980714499950409,
|
|
"num_tokens": 59426499.0,
|
|
"step": 34250
|
|
},
|
|
{
|
|
"entropy": 5.451911973953247,
|
|
"epoch": 2.665162419762692,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00042862341600086477,
|
|
"loss": 5.0352,
|
|
"mean_token_accuracy": 0.19086260497570037,
|
|
"num_tokens": 59434921.0,
|
|
"step": 34255
|
|
},
|
|
{
|
|
"entropy": 5.302086257934571,
|
|
"epoch": 2.6655514491344094,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00042860316492122447,
|
|
"loss": 4.8198,
|
|
"mean_token_accuracy": 0.2057104989886284,
|
|
"num_tokens": 59443930.0,
|
|
"step": 34260
|
|
},
|
|
{
|
|
"entropy": 5.3693090915679935,
|
|
"epoch": 2.665940478506127,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004285829115109006,
|
|
"loss": 4.94,
|
|
"mean_token_accuracy": 0.20375465452671052,
|
|
"num_tokens": 59453335.0,
|
|
"step": 34265
|
|
},
|
|
{
|
|
"entropy": 5.3513213157653805,
|
|
"epoch": 2.666329507877845,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004285626557702005,
|
|
"loss": 5.0126,
|
|
"mean_token_accuracy": 0.1961280584335327,
|
|
"num_tokens": 59461937.0,
|
|
"step": 34270
|
|
},
|
|
{
|
|
"entropy": 5.390325689315796,
|
|
"epoch": 2.6667185372495625,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004285423976994316,
|
|
"loss": 4.9367,
|
|
"mean_token_accuracy": 0.20017177760601043,
|
|
"num_tokens": 59470858.0,
|
|
"step": 34275
|
|
},
|
|
{
|
|
"entropy": 5.356062650680542,
|
|
"epoch": 2.66710756662128,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00042852213729890117,
|
|
"loss": 4.9872,
|
|
"mean_token_accuracy": 0.19355384707450868,
|
|
"num_tokens": 59478902.0,
|
|
"step": 34280
|
|
},
|
|
{
|
|
"entropy": 5.323371505737304,
|
|
"epoch": 2.6674965959929975,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004285018745689166,
|
|
"loss": 4.8994,
|
|
"mean_token_accuracy": 0.208248108625412,
|
|
"num_tokens": 59487281.0,
|
|
"step": 34285
|
|
},
|
|
{
|
|
"entropy": 5.373340797424317,
|
|
"epoch": 2.667885625364715,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004284816095097855,
|
|
"loss": 4.9467,
|
|
"mean_token_accuracy": 0.20183555036783218,
|
|
"num_tokens": 59496304.0,
|
|
"step": 34290
|
|
},
|
|
{
|
|
"entropy": 5.2766930103302006,
|
|
"epoch": 2.6682746547364324,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004284613421218152,
|
|
"loss": 4.8792,
|
|
"mean_token_accuracy": 0.20856694877147675,
|
|
"num_tokens": 59504577.0,
|
|
"step": 34295
|
|
},
|
|
{
|
|
"entropy": 5.322265863418579,
|
|
"epoch": 2.66866368410815,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00042844107240531324,
|
|
"loss": 4.9542,
|
|
"mean_token_accuracy": 0.19931574761867524,
|
|
"num_tokens": 59513468.0,
|
|
"step": 34300
|
|
},
|
|
{
|
|
"entropy": 5.433460235595703,
|
|
"epoch": 2.669052713479868,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004284208003605873,
|
|
"loss": 4.9974,
|
|
"mean_token_accuracy": 0.19192649126052858,
|
|
"num_tokens": 59522516.0,
|
|
"step": 34305
|
|
},
|
|
{
|
|
"entropy": 5.386816215515137,
|
|
"epoch": 2.6694417428515855,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.000428400525987945,
|
|
"loss": 4.9183,
|
|
"mean_token_accuracy": 0.19824607372283937,
|
|
"num_tokens": 59531434.0,
|
|
"step": 34310
|
|
},
|
|
{
|
|
"entropy": 5.371961879730224,
|
|
"epoch": 2.669830772223303,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00042838024928769375,
|
|
"loss": 4.9636,
|
|
"mean_token_accuracy": 0.20968609303236008,
|
|
"num_tokens": 59539967.0,
|
|
"step": 34315
|
|
},
|
|
{
|
|
"entropy": 5.43619179725647,
|
|
"epoch": 2.6702198015950205,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00042835997026014145,
|
|
"loss": 5.1166,
|
|
"mean_token_accuracy": 0.19195984899997712,
|
|
"num_tokens": 59549558.0,
|
|
"step": 34320
|
|
},
|
|
{
|
|
"entropy": 5.356045913696289,
|
|
"epoch": 2.6706088309667377,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004283396889055957,
|
|
"loss": 4.933,
|
|
"mean_token_accuracy": 0.2073730155825615,
|
|
"num_tokens": 59557520.0,
|
|
"step": 34325
|
|
},
|
|
{
|
|
"entropy": 5.493088579177856,
|
|
"epoch": 2.6709978603384554,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004283194052243641,
|
|
"loss": 5.0684,
|
|
"mean_token_accuracy": 0.1961228907108307,
|
|
"num_tokens": 59565753.0,
|
|
"step": 34330
|
|
},
|
|
{
|
|
"entropy": 5.442750453948975,
|
|
"epoch": 2.671386889710173,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00042829911921675456,
|
|
"loss": 5.0625,
|
|
"mean_token_accuracy": 0.1939133957028389,
|
|
"num_tokens": 59574522.0,
|
|
"step": 34335
|
|
},
|
|
{
|
|
"entropy": 5.319617414474488,
|
|
"epoch": 2.671775919081891,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.000428278830883075,
|
|
"loss": 4.9437,
|
|
"mean_token_accuracy": 0.19830779880285263,
|
|
"num_tokens": 59583733.0,
|
|
"step": 34340
|
|
},
|
|
{
|
|
"entropy": 5.412617206573486,
|
|
"epoch": 2.6721649484536085,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00042825854022363307,
|
|
"loss": 5.0962,
|
|
"mean_token_accuracy": 0.19548834413290023,
|
|
"num_tokens": 59593009.0,
|
|
"step": 34345
|
|
},
|
|
{
|
|
"entropy": 5.378947830200195,
|
|
"epoch": 2.6725539778253258,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00042823824723873676,
|
|
"loss": 4.9759,
|
|
"mean_token_accuracy": 0.20451827794313432,
|
|
"num_tokens": 59601770.0,
|
|
"step": 34350
|
|
},
|
|
{
|
|
"entropy": 5.391450071334839,
|
|
"epoch": 2.6729430071970435,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00042821795192869407,
|
|
"loss": 4.9186,
|
|
"mean_token_accuracy": 0.20611869990825654,
|
|
"num_tokens": 59610397.0,
|
|
"step": 34355
|
|
},
|
|
{
|
|
"entropy": 5.388518857955932,
|
|
"epoch": 2.6733320365687607,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004281976542938127,
|
|
"loss": 4.9942,
|
|
"mean_token_accuracy": 0.19945466816425322,
|
|
"num_tokens": 59618864.0,
|
|
"step": 34360
|
|
},
|
|
{
|
|
"entropy": 5.323984146118164,
|
|
"epoch": 2.6737210659404784,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00042817735433440076,
|
|
"loss": 4.9607,
|
|
"mean_token_accuracy": 0.19761952459812165,
|
|
"num_tokens": 59627469.0,
|
|
"step": 34365
|
|
},
|
|
{
|
|
"entropy": 5.3097536087036135,
|
|
"epoch": 2.674110095312196,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004281570520507663,
|
|
"loss": 4.9508,
|
|
"mean_token_accuracy": 0.20419375896453856,
|
|
"num_tokens": 59636125.0,
|
|
"step": 34370
|
|
},
|
|
{
|
|
"entropy": 5.3795582294464115,
|
|
"epoch": 2.674499124683914,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00042813674744321737,
|
|
"loss": 4.9187,
|
|
"mean_token_accuracy": 0.20228943675756456,
|
|
"num_tokens": 59644586.0,
|
|
"step": 34375
|
|
},
|
|
{
|
|
"entropy": 5.39575080871582,
|
|
"epoch": 2.674888154055631,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.000428116440512062,
|
|
"loss": 4.963,
|
|
"mean_token_accuracy": 0.19803930670022965,
|
|
"num_tokens": 59653644.0,
|
|
"step": 34380
|
|
},
|
|
{
|
|
"entropy": 5.328214073181153,
|
|
"epoch": 2.6752771834273488,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004280961312576084,
|
|
"loss": 5.0037,
|
|
"mean_token_accuracy": 0.19198238402605056,
|
|
"num_tokens": 59662270.0,
|
|
"step": 34385
|
|
},
|
|
{
|
|
"entropy": 5.377955484390259,
|
|
"epoch": 2.6756662127990665,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004280758196801646,
|
|
"loss": 4.9337,
|
|
"mean_token_accuracy": 0.20776260942220687,
|
|
"num_tokens": 59670544.0,
|
|
"step": 34390
|
|
},
|
|
{
|
|
"entropy": 5.4088798522949215,
|
|
"epoch": 2.6760552421707837,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00042805550578003894,
|
|
"loss": 5.0462,
|
|
"mean_token_accuracy": 0.2006412371993065,
|
|
"num_tokens": 59679985.0,
|
|
"step": 34395
|
|
},
|
|
{
|
|
"entropy": 5.393606519699096,
|
|
"epoch": 2.6764442715425014,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004280351895575396,
|
|
"loss": 5.0259,
|
|
"mean_token_accuracy": 0.18971271812915802,
|
|
"num_tokens": 59689831.0,
|
|
"step": 34400
|
|
},
|
|
{
|
|
"entropy": 5.390142440795898,
|
|
"epoch": 2.676833300914219,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0004280148710129748,
|
|
"loss": 5.0348,
|
|
"mean_token_accuracy": 0.19521320909261702,
|
|
"num_tokens": 59697400.0,
|
|
"step": 34405
|
|
},
|
|
{
|
|
"entropy": 5.37974181175232,
|
|
"epoch": 2.677222330285937,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00042799455014665296,
|
|
"loss": 4.9412,
|
|
"mean_token_accuracy": 0.20023636221885682,
|
|
"num_tokens": 59706137.0,
|
|
"step": 34410
|
|
},
|
|
{
|
|
"entropy": 5.394614601135254,
|
|
"epoch": 2.677611359657654,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00042797422695888226,
|
|
"loss": 5.0165,
|
|
"mean_token_accuracy": 0.19154416024684906,
|
|
"num_tokens": 59715454.0,
|
|
"step": 34415
|
|
},
|
|
{
|
|
"entropy": 5.373456764221191,
|
|
"epoch": 2.6780003890293718,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004279539014499712,
|
|
"loss": 4.9053,
|
|
"mean_token_accuracy": 0.2093779370188713,
|
|
"num_tokens": 59723801.0,
|
|
"step": 34420
|
|
},
|
|
{
|
|
"entropy": 5.369338846206665,
|
|
"epoch": 2.678389418401089,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004279335736202281,
|
|
"loss": 4.9991,
|
|
"mean_token_accuracy": 0.20417073965072632,
|
|
"num_tokens": 59732899.0,
|
|
"step": 34425
|
|
},
|
|
{
|
|
"entropy": 5.384247541427612,
|
|
"epoch": 2.6787784477728067,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004279132434699615,
|
|
"loss": 5.0412,
|
|
"mean_token_accuracy": 0.19799069613218306,
|
|
"num_tokens": 59741693.0,
|
|
"step": 34430
|
|
},
|
|
{
|
|
"entropy": 5.311388254165649,
|
|
"epoch": 2.6791674771445244,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004278929109994798,
|
|
"loss": 4.8701,
|
|
"mean_token_accuracy": 0.20726193636655807,
|
|
"num_tokens": 59749583.0,
|
|
"step": 34435
|
|
},
|
|
{
|
|
"entropy": 5.40360426902771,
|
|
"epoch": 2.679556506516242,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00042787257620909144,
|
|
"loss": 5.0637,
|
|
"mean_token_accuracy": 0.1942752107977867,
|
|
"num_tokens": 59758638.0,
|
|
"step": 34440
|
|
},
|
|
{
|
|
"entropy": 5.3614482402801515,
|
|
"epoch": 2.67994553588796,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00042785223909910515,
|
|
"loss": 4.9037,
|
|
"mean_token_accuracy": 0.20381806343793868,
|
|
"num_tokens": 59767746.0,
|
|
"step": 34445
|
|
},
|
|
{
|
|
"entropy": 5.408695936203003,
|
|
"epoch": 2.680334565259677,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004278318996698294,
|
|
"loss": 4.9896,
|
|
"mean_token_accuracy": 0.19565177708864212,
|
|
"num_tokens": 59776426.0,
|
|
"step": 34450
|
|
},
|
|
{
|
|
"entropy": 5.333408212661743,
|
|
"epoch": 2.6807235946313948,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004278115579215728,
|
|
"loss": 4.9873,
|
|
"mean_token_accuracy": 0.19890154600143434,
|
|
"num_tokens": 59785032.0,
|
|
"step": 34455
|
|
},
|
|
{
|
|
"entropy": 5.3828386783599855,
|
|
"epoch": 2.681112624003112,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004277912138546441,
|
|
"loss": 5.024,
|
|
"mean_token_accuracy": 0.19332427978515626,
|
|
"num_tokens": 59794510.0,
|
|
"step": 34460
|
|
},
|
|
{
|
|
"entropy": 5.403111124038697,
|
|
"epoch": 2.6815016533748297,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004277708674693519,
|
|
"loss": 4.9379,
|
|
"mean_token_accuracy": 0.20095993727445602,
|
|
"num_tokens": 59802889.0,
|
|
"step": 34465
|
|
},
|
|
{
|
|
"entropy": 5.362936496734619,
|
|
"epoch": 2.6818906827465474,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00042775051876600483,
|
|
"loss": 4.9228,
|
|
"mean_token_accuracy": 0.20018546730279924,
|
|
"num_tokens": 59811940.0,
|
|
"step": 34470
|
|
},
|
|
{
|
|
"entropy": 5.344327688217163,
|
|
"epoch": 2.682279712118265,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004277301677449119,
|
|
"loss": 4.9743,
|
|
"mean_token_accuracy": 0.20301877558231354,
|
|
"num_tokens": 59820465.0,
|
|
"step": 34475
|
|
},
|
|
{
|
|
"entropy": 5.449883127212525,
|
|
"epoch": 2.6826687414899824,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004277098144063818,
|
|
"loss": 5.0645,
|
|
"mean_token_accuracy": 0.1929970309138298,
|
|
"num_tokens": 59829611.0,
|
|
"step": 34480
|
|
},
|
|
{
|
|
"entropy": 5.436542510986328,
|
|
"epoch": 2.6830577708617,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00042768945875072326,
|
|
"loss": 5.0049,
|
|
"mean_token_accuracy": 0.19675894528627397,
|
|
"num_tokens": 59839073.0,
|
|
"step": 34485
|
|
},
|
|
{
|
|
"entropy": 5.440522861480713,
|
|
"epoch": 2.6834468002334178,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004276691007782451,
|
|
"loss": 5.0703,
|
|
"mean_token_accuracy": 0.18557532727718354,
|
|
"num_tokens": 59847653.0,
|
|
"step": 34490
|
|
},
|
|
{
|
|
"entropy": 5.38441801071167,
|
|
"epoch": 2.683835829605135,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0004276487404892565,
|
|
"loss": 5.0028,
|
|
"mean_token_accuracy": 0.19308709651231765,
|
|
"num_tokens": 59855534.0,
|
|
"step": 34495
|
|
},
|
|
{
|
|
"entropy": 5.370562171936035,
|
|
"epoch": 2.6842248589768527,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.00042762837788406615,
|
|
"loss": 4.9474,
|
|
"mean_token_accuracy": 0.19599810391664504,
|
|
"num_tokens": 59864862.0,
|
|
"step": 34500
|
|
},
|
|
{
|
|
"entropy": 5.379722213745117,
|
|
"epoch": 2.6846138883485704,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004276080129629831,
|
|
"loss": 4.978,
|
|
"mean_token_accuracy": 0.1987994894385338,
|
|
"num_tokens": 59873100.0,
|
|
"step": 34505
|
|
},
|
|
{
|
|
"entropy": 5.390812063217163,
|
|
"epoch": 2.685002917720288,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00042758764572631644,
|
|
"loss": 4.9523,
|
|
"mean_token_accuracy": 0.19754843711853026,
|
|
"num_tokens": 59881500.0,
|
|
"step": 34510
|
|
},
|
|
{
|
|
"entropy": 5.36690354347229,
|
|
"epoch": 2.6853919470920053,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00042756727617437504,
|
|
"loss": 4.9551,
|
|
"mean_token_accuracy": 0.20342129468917847,
|
|
"num_tokens": 59890168.0,
|
|
"step": 34515
|
|
},
|
|
{
|
|
"entropy": 5.390420007705688,
|
|
"epoch": 2.685780976463723,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00042754690430746805,
|
|
"loss": 4.9923,
|
|
"mean_token_accuracy": 0.19185806810855865,
|
|
"num_tokens": 59898805.0,
|
|
"step": 34520
|
|
},
|
|
{
|
|
"entropy": 5.4083569049835205,
|
|
"epoch": 2.6861700058354403,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004275265301259046,
|
|
"loss": 5.0286,
|
|
"mean_token_accuracy": 0.19178288280963898,
|
|
"num_tokens": 59907012.0,
|
|
"step": 34525
|
|
},
|
|
{
|
|
"entropy": 5.387717914581299,
|
|
"epoch": 2.686559035207158,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00042750615362999395,
|
|
"loss": 4.9678,
|
|
"mean_token_accuracy": 0.20536677539348602,
|
|
"num_tokens": 59915117.0,
|
|
"step": 34530
|
|
},
|
|
{
|
|
"entropy": 5.401671981811523,
|
|
"epoch": 2.6869480645788757,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00042748577482004495,
|
|
"loss": 4.996,
|
|
"mean_token_accuracy": 0.19705521762371064,
|
|
"num_tokens": 59923625.0,
|
|
"step": 34535
|
|
},
|
|
{
|
|
"entropy": 5.423038291931152,
|
|
"epoch": 2.6873370939505934,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00042746539369636715,
|
|
"loss": 4.9979,
|
|
"mean_token_accuracy": 0.1981267124414444,
|
|
"num_tokens": 59932456.0,
|
|
"step": 34540
|
|
},
|
|
{
|
|
"entropy": 5.3538423538208,
|
|
"epoch": 2.687726123322311,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00042744501025926966,
|
|
"loss": 4.9561,
|
|
"mean_token_accuracy": 0.19685874581336976,
|
|
"num_tokens": 59941210.0,
|
|
"step": 34545
|
|
},
|
|
{
|
|
"entropy": 5.467728471755981,
|
|
"epoch": 2.6881151526940283,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004274246245090618,
|
|
"loss": 5.0491,
|
|
"mean_token_accuracy": 0.188378968834877,
|
|
"num_tokens": 59949646.0,
|
|
"step": 34550
|
|
},
|
|
{
|
|
"entropy": 5.3248964786529545,
|
|
"epoch": 2.688504182065746,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004274042364460529,
|
|
"loss": 4.8538,
|
|
"mean_token_accuracy": 0.2057757705450058,
|
|
"num_tokens": 59958263.0,
|
|
"step": 34555
|
|
},
|
|
{
|
|
"entropy": 5.3741625308990475,
|
|
"epoch": 2.6888932114374633,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00042738384607055214,
|
|
"loss": 5.0543,
|
|
"mean_token_accuracy": 0.19641852974891663,
|
|
"num_tokens": 59967222.0,
|
|
"step": 34560
|
|
},
|
|
{
|
|
"entropy": 5.379954147338867,
|
|
"epoch": 2.689282240809181,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00042736345338286917,
|
|
"loss": 4.9311,
|
|
"mean_token_accuracy": 0.20341241955757142,
|
|
"num_tokens": 59974898.0,
|
|
"step": 34565
|
|
},
|
|
{
|
|
"entropy": 5.363115024566651,
|
|
"epoch": 2.6896712701808987,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004273430583833133,
|
|
"loss": 4.9075,
|
|
"mean_token_accuracy": 0.20405565053224564,
|
|
"num_tokens": 59983593.0,
|
|
"step": 34570
|
|
},
|
|
{
|
|
"entropy": 5.35976996421814,
|
|
"epoch": 2.6900602995526164,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.000427322661072194,
|
|
"loss": 4.9282,
|
|
"mean_token_accuracy": 0.20593021512031556,
|
|
"num_tokens": 59991360.0,
|
|
"step": 34575
|
|
},
|
|
{
|
|
"entropy": 5.401122379302978,
|
|
"epoch": 2.6904493289243336,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004273022614498208,
|
|
"loss": 4.9813,
|
|
"mean_token_accuracy": 0.20183444768190384,
|
|
"num_tokens": 59999123.0,
|
|
"step": 34580
|
|
},
|
|
{
|
|
"entropy": 5.315407085418701,
|
|
"epoch": 2.6908383582960513,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004272818595165031,
|
|
"loss": 4.8628,
|
|
"mean_token_accuracy": 0.20884652882814408,
|
|
"num_tokens": 60007666.0,
|
|
"step": 34585
|
|
},
|
|
{
|
|
"entropy": 5.406532907485962,
|
|
"epoch": 2.691227387667769,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004272614552725506,
|
|
"loss": 5.0781,
|
|
"mean_token_accuracy": 0.1869439125061035,
|
|
"num_tokens": 60016813.0,
|
|
"step": 34590
|
|
},
|
|
{
|
|
"entropy": 5.4521606922149655,
|
|
"epoch": 2.6916164170394863,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00042724104871827293,
|
|
"loss": 4.977,
|
|
"mean_token_accuracy": 0.19915189892053603,
|
|
"num_tokens": 60025243.0,
|
|
"step": 34595
|
|
},
|
|
{
|
|
"entropy": 5.410744905471802,
|
|
"epoch": 2.692005446411204,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004272206398539795,
|
|
"loss": 5.0839,
|
|
"mean_token_accuracy": 0.18814264237880707,
|
|
"num_tokens": 60033705.0,
|
|
"step": 34600
|
|
},
|
|
{
|
|
"entropy": 5.440247678756714,
|
|
"epoch": 2.6923944757829217,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00042720022867998026,
|
|
"loss": 4.9705,
|
|
"mean_token_accuracy": 0.20509123802185059,
|
|
"num_tokens": 60042073.0,
|
|
"step": 34605
|
|
},
|
|
{
|
|
"entropy": 5.459591484069824,
|
|
"epoch": 2.6927835051546394,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004271798151965848,
|
|
"loss": 5.04,
|
|
"mean_token_accuracy": 0.19130787998437881,
|
|
"num_tokens": 60050286.0,
|
|
"step": 34610
|
|
},
|
|
{
|
|
"entropy": 5.264109897613525,
|
|
"epoch": 2.6931725345263566,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004271593994041029,
|
|
"loss": 4.8319,
|
|
"mean_token_accuracy": 0.20633379071950914,
|
|
"num_tokens": 60057812.0,
|
|
"step": 34615
|
|
},
|
|
{
|
|
"entropy": 5.268955373764038,
|
|
"epoch": 2.6935615638980743,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004271389813028443,
|
|
"loss": 4.8724,
|
|
"mean_token_accuracy": 0.20606954991817475,
|
|
"num_tokens": 60066636.0,
|
|
"step": 34620
|
|
},
|
|
{
|
|
"entropy": 5.315273761749268,
|
|
"epoch": 2.693950593269792,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004271185608931187,
|
|
"loss": 4.9507,
|
|
"mean_token_accuracy": 0.19987229257822037,
|
|
"num_tokens": 60075605.0,
|
|
"step": 34625
|
|
},
|
|
{
|
|
"entropy": 5.379639053344727,
|
|
"epoch": 2.6943396226415093,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00042709813817523617,
|
|
"loss": 4.8817,
|
|
"mean_token_accuracy": 0.20651884377002716,
|
|
"num_tokens": 60083947.0,
|
|
"step": 34630
|
|
},
|
|
{
|
|
"entropy": 5.3060229301452635,
|
|
"epoch": 2.694728652013227,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00042707771314950645,
|
|
"loss": 4.9103,
|
|
"mean_token_accuracy": 0.206938473880291,
|
|
"num_tokens": 60092518.0,
|
|
"step": 34635
|
|
},
|
|
{
|
|
"entropy": 5.364006614685058,
|
|
"epoch": 2.6951176813849447,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00042705728581623944,
|
|
"loss": 4.9379,
|
|
"mean_token_accuracy": 0.20119450539350509,
|
|
"num_tokens": 60100829.0,
|
|
"step": 34640
|
|
},
|
|
{
|
|
"entropy": 5.4405200481414795,
|
|
"epoch": 2.6955067107566624,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004270368561757452,
|
|
"loss": 4.9943,
|
|
"mean_token_accuracy": 0.20098990947008133,
|
|
"num_tokens": 60109423.0,
|
|
"step": 34645
|
|
},
|
|
{
|
|
"entropy": 5.271455192565918,
|
|
"epoch": 2.6958957401283796,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004270164242283336,
|
|
"loss": 4.8611,
|
|
"mean_token_accuracy": 0.20585769265890122,
|
|
"num_tokens": 60117938.0,
|
|
"step": 34650
|
|
},
|
|
{
|
|
"entropy": 5.347994136810303,
|
|
"epoch": 2.6962847695000973,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004269959899743148,
|
|
"loss": 4.978,
|
|
"mean_token_accuracy": 0.2034232184290886,
|
|
"num_tokens": 60126411.0,
|
|
"step": 34655
|
|
},
|
|
{
|
|
"entropy": 5.394872093200684,
|
|
"epoch": 2.6966737988718146,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004269755534139987,
|
|
"loss": 5.02,
|
|
"mean_token_accuracy": 0.19162299036979674,
|
|
"num_tokens": 60134811.0,
|
|
"step": 34660
|
|
},
|
|
{
|
|
"entropy": 5.364149951934815,
|
|
"epoch": 2.6970628282435323,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00042695511454769557,
|
|
"loss": 4.9369,
|
|
"mean_token_accuracy": 0.1961675390601158,
|
|
"num_tokens": 60143387.0,
|
|
"step": 34665
|
|
},
|
|
{
|
|
"entropy": 5.387380504608155,
|
|
"epoch": 2.69745185761525,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00042693467337571534,
|
|
"loss": 4.9793,
|
|
"mean_token_accuracy": 0.19509874135255814,
|
|
"num_tokens": 60152729.0,
|
|
"step": 34670
|
|
},
|
|
{
|
|
"entropy": 5.303729057312012,
|
|
"epoch": 2.6978408869869677,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004269142298983684,
|
|
"loss": 4.9349,
|
|
"mean_token_accuracy": 0.19943539202213287,
|
|
"num_tokens": 60160927.0,
|
|
"step": 34675
|
|
},
|
|
{
|
|
"entropy": 5.3441205501556395,
|
|
"epoch": 2.698229916358685,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00042689378411596467,
|
|
"loss": 4.9199,
|
|
"mean_token_accuracy": 0.20570038408041,
|
|
"num_tokens": 60169252.0,
|
|
"step": 34680
|
|
},
|
|
{
|
|
"entropy": 5.344624090194702,
|
|
"epoch": 2.6986189457304026,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004268733360288146,
|
|
"loss": 4.9627,
|
|
"mean_token_accuracy": 0.19987168312072753,
|
|
"num_tokens": 60178511.0,
|
|
"step": 34685
|
|
},
|
|
{
|
|
"entropy": 5.331116533279419,
|
|
"epoch": 2.6990079751021203,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00042685288563722835,
|
|
"loss": 4.942,
|
|
"mean_token_accuracy": 0.1975827395915985,
|
|
"num_tokens": 60187619.0,
|
|
"step": 34690
|
|
},
|
|
{
|
|
"entropy": 5.466305589675903,
|
|
"epoch": 2.6993970044738376,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004268324329415163,
|
|
"loss": 5.1041,
|
|
"mean_token_accuracy": 0.18991145938634874,
|
|
"num_tokens": 60196176.0,
|
|
"step": 34695
|
|
},
|
|
{
|
|
"entropy": 5.391061782836914,
|
|
"epoch": 2.6997860338455553,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0004268119779419887,
|
|
"loss": 5.0091,
|
|
"mean_token_accuracy": 0.19594821631908416,
|
|
"num_tokens": 60204960.0,
|
|
"step": 34700
|
|
},
|
|
{
|
|
"entropy": 5.337936735153198,
|
|
"epoch": 2.700175063217273,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00042679152063895603,
|
|
"loss": 4.9139,
|
|
"mean_token_accuracy": 0.19859689474105835,
|
|
"num_tokens": 60212974.0,
|
|
"step": 34705
|
|
},
|
|
{
|
|
"entropy": 5.35681185722351,
|
|
"epoch": 2.7005640925889907,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00042677106103272867,
|
|
"loss": 4.9596,
|
|
"mean_token_accuracy": 0.19527654498815536,
|
|
"num_tokens": 60221789.0,
|
|
"step": 34710
|
|
},
|
|
{
|
|
"entropy": 5.32783317565918,
|
|
"epoch": 2.700953121960708,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.000426750599123617,
|
|
"loss": 4.9984,
|
|
"mean_token_accuracy": 0.19666681587696075,
|
|
"num_tokens": 60230349.0,
|
|
"step": 34715
|
|
},
|
|
{
|
|
"entropy": 5.357149744033814,
|
|
"epoch": 2.7013421513324256,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00042673013491193145,
|
|
"loss": 4.935,
|
|
"mean_token_accuracy": 0.20340894609689714,
|
|
"num_tokens": 60238711.0,
|
|
"step": 34720
|
|
},
|
|
{
|
|
"entropy": 5.382628297805786,
|
|
"epoch": 2.7017311807041433,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00042670966839798263,
|
|
"loss": 4.9544,
|
|
"mean_token_accuracy": 0.19915827959775925,
|
|
"num_tokens": 60247210.0,
|
|
"step": 34725
|
|
},
|
|
{
|
|
"entropy": 5.442790079116821,
|
|
"epoch": 2.7021202100758606,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004266891995820811,
|
|
"loss": 4.9923,
|
|
"mean_token_accuracy": 0.19936205297708512,
|
|
"num_tokens": 60255916.0,
|
|
"step": 34730
|
|
},
|
|
{
|
|
"entropy": 5.368322086334229,
|
|
"epoch": 2.7025092394475783,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00042666872846453734,
|
|
"loss": 4.9516,
|
|
"mean_token_accuracy": 0.20203399956226348,
|
|
"num_tokens": 60264138.0,
|
|
"step": 34735
|
|
},
|
|
{
|
|
"entropy": 5.387244319915771,
|
|
"epoch": 2.702898268819296,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00042664825504566206,
|
|
"loss": 5.0091,
|
|
"mean_token_accuracy": 0.19110169559717177,
|
|
"num_tokens": 60272918.0,
|
|
"step": 34740
|
|
},
|
|
{
|
|
"entropy": 5.289311838150025,
|
|
"epoch": 2.7032872981910137,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.000426627779325766,
|
|
"loss": 4.74,
|
|
"mean_token_accuracy": 0.21823370456695557,
|
|
"num_tokens": 60281328.0,
|
|
"step": 34745
|
|
},
|
|
{
|
|
"entropy": 5.3037574768066404,
|
|
"epoch": 2.703676327562731,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004266073013051595,
|
|
"loss": 5.0083,
|
|
"mean_token_accuracy": 0.19463356882333754,
|
|
"num_tokens": 60290005.0,
|
|
"step": 34750
|
|
},
|
|
{
|
|
"entropy": 5.330426216125488,
|
|
"epoch": 2.7040653569344486,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004265868209841537,
|
|
"loss": 4.8751,
|
|
"mean_token_accuracy": 0.20159582495689393,
|
|
"num_tokens": 60298225.0,
|
|
"step": 34755
|
|
},
|
|
{
|
|
"entropy": 5.38794207572937,
|
|
"epoch": 2.704454386306166,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004265663383630591,
|
|
"loss": 4.9713,
|
|
"mean_token_accuracy": 0.1949460744857788,
|
|
"num_tokens": 60306700.0,
|
|
"step": 34760
|
|
},
|
|
{
|
|
"entropy": 5.348529529571533,
|
|
"epoch": 2.7048434156778836,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00042654585344218657,
|
|
"loss": 4.9588,
|
|
"mean_token_accuracy": 0.2038094073534012,
|
|
"num_tokens": 60314405.0,
|
|
"step": 34765
|
|
},
|
|
{
|
|
"entropy": 5.332219839096069,
|
|
"epoch": 2.7052324450496013,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004265253662218469,
|
|
"loss": 4.8999,
|
|
"mean_token_accuracy": 0.20289279669523239,
|
|
"num_tokens": 60323159.0,
|
|
"step": 34770
|
|
},
|
|
{
|
|
"entropy": 5.434286499023438,
|
|
"epoch": 2.705621474421319,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00042650487670235093,
|
|
"loss": 4.9973,
|
|
"mean_token_accuracy": 0.19924337714910506,
|
|
"num_tokens": 60331669.0,
|
|
"step": 34775
|
|
},
|
|
{
|
|
"entropy": 5.335219860076904,
|
|
"epoch": 2.7060105037930366,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004264843848840097,
|
|
"loss": 4.9788,
|
|
"mean_token_accuracy": 0.19983745217323304,
|
|
"num_tokens": 60340841.0,
|
|
"step": 34780
|
|
},
|
|
{
|
|
"entropy": 5.277787113189698,
|
|
"epoch": 2.706399533164754,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.000426463890767134,
|
|
"loss": 4.8735,
|
|
"mean_token_accuracy": 0.2056006297469139,
|
|
"num_tokens": 60349263.0,
|
|
"step": 34785
|
|
},
|
|
{
|
|
"entropy": 5.418739891052246,
|
|
"epoch": 2.7067885625364716,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004264433943520349,
|
|
"loss": 5.0355,
|
|
"mean_token_accuracy": 0.19776599407196044,
|
|
"num_tokens": 60358214.0,
|
|
"step": 34790
|
|
},
|
|
{
|
|
"entropy": 5.351519584655762,
|
|
"epoch": 2.707177591908189,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00042642289563902326,
|
|
"loss": 4.9577,
|
|
"mean_token_accuracy": 0.20484983175992966,
|
|
"num_tokens": 60367392.0,
|
|
"step": 34795
|
|
},
|
|
{
|
|
"entropy": 5.31849422454834,
|
|
"epoch": 2.7075666212799065,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00042640239462841023,
|
|
"loss": 4.9537,
|
|
"mean_token_accuracy": 0.19649308621883393,
|
|
"num_tokens": 60376223.0,
|
|
"step": 34800
|
|
},
|
|
{
|
|
"entropy": 5.444887161254883,
|
|
"epoch": 2.7079556506516242,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00042638189132050675,
|
|
"loss": 5.0825,
|
|
"mean_token_accuracy": 0.1880333974957466,
|
|
"num_tokens": 60385102.0,
|
|
"step": 34805
|
|
},
|
|
{
|
|
"entropy": 5.421322250366211,
|
|
"epoch": 2.708344680023342,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00042636138571562415,
|
|
"loss": 4.9575,
|
|
"mean_token_accuracy": 0.19545463472604752,
|
|
"num_tokens": 60393115.0,
|
|
"step": 34810
|
|
},
|
|
{
|
|
"entropy": 5.372217082977295,
|
|
"epoch": 2.708733709395059,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.00042634087781407337,
|
|
"loss": 5.0728,
|
|
"mean_token_accuracy": 0.1922438159584999,
|
|
"num_tokens": 60402185.0,
|
|
"step": 34815
|
|
},
|
|
{
|
|
"entropy": 5.487900733947754,
|
|
"epoch": 2.709122738766777,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00042632036761616564,
|
|
"loss": 4.9765,
|
|
"mean_token_accuracy": 0.19941693991422654,
|
|
"num_tokens": 60410420.0,
|
|
"step": 34820
|
|
},
|
|
{
|
|
"entropy": 5.374901628494262,
|
|
"epoch": 2.7095117681384946,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00042629985512221224,
|
|
"loss": 4.9285,
|
|
"mean_token_accuracy": 0.20184245258569716,
|
|
"num_tokens": 60419300.0,
|
|
"step": 34825
|
|
},
|
|
{
|
|
"entropy": 5.381605911254883,
|
|
"epoch": 2.709900797510212,
|
|
"grad_norm": 2.265625,
|
|
"learning_rate": 0.0004262793403325243,
|
|
"loss": 5.014,
|
|
"mean_token_accuracy": 0.20415671318769454,
|
|
"num_tokens": 60428108.0,
|
|
"step": 34830
|
|
},
|
|
{
|
|
"entropy": 5.385757398605347,
|
|
"epoch": 2.7102898268819295,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00042625882324741316,
|
|
"loss": 4.9648,
|
|
"mean_token_accuracy": 0.1951258510351181,
|
|
"num_tokens": 60436829.0,
|
|
"step": 34835
|
|
},
|
|
{
|
|
"entropy": 5.428536128997803,
|
|
"epoch": 2.7106788562536472,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004262383038671902,
|
|
"loss": 4.966,
|
|
"mean_token_accuracy": 0.20022047460079193,
|
|
"num_tokens": 60445681.0,
|
|
"step": 34840
|
|
},
|
|
{
|
|
"entropy": 5.432674264907837,
|
|
"epoch": 2.711067885625365,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004262177821921666,
|
|
"loss": 5.014,
|
|
"mean_token_accuracy": 0.20290272533893586,
|
|
"num_tokens": 60454263.0,
|
|
"step": 34845
|
|
},
|
|
{
|
|
"entropy": 5.438174676895142,
|
|
"epoch": 2.711456914997082,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00042619725822265394,
|
|
"loss": 5.074,
|
|
"mean_token_accuracy": 0.1946658968925476,
|
|
"num_tokens": 60463569.0,
|
|
"step": 34850
|
|
},
|
|
{
|
|
"entropy": 5.355553483963012,
|
|
"epoch": 2.7118459443688,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00042617673195896345,
|
|
"loss": 4.8993,
|
|
"mean_token_accuracy": 0.20493161380290986,
|
|
"num_tokens": 60471458.0,
|
|
"step": 34855
|
|
},
|
|
{
|
|
"entropy": 5.424509811401367,
|
|
"epoch": 2.712234973740517,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00042615620340140674,
|
|
"loss": 5.0456,
|
|
"mean_token_accuracy": 0.19631729125976563,
|
|
"num_tokens": 60480581.0,
|
|
"step": 34860
|
|
},
|
|
{
|
|
"entropy": 5.385473918914795,
|
|
"epoch": 2.712624003112235,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00042613567255029525,
|
|
"loss": 5.0149,
|
|
"mean_token_accuracy": 0.1993692323565483,
|
|
"num_tokens": 60488879.0,
|
|
"step": 34865
|
|
},
|
|
{
|
|
"entropy": 5.346762037277221,
|
|
"epoch": 2.7130130324839525,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.00042611513940594037,
|
|
"loss": 4.9636,
|
|
"mean_token_accuracy": 0.20714747607707978,
|
|
"num_tokens": 60497294.0,
|
|
"step": 34870
|
|
},
|
|
{
|
|
"entropy": 5.34515495300293,
|
|
"epoch": 2.7134020618556702,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004260946039686539,
|
|
"loss": 4.9063,
|
|
"mean_token_accuracy": 0.20757717043161392,
|
|
"num_tokens": 60506449.0,
|
|
"step": 34875
|
|
},
|
|
{
|
|
"entropy": 5.403919649124146,
|
|
"epoch": 2.713791091227388,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00042607406623874726,
|
|
"loss": 4.9837,
|
|
"mean_token_accuracy": 0.1975916624069214,
|
|
"num_tokens": 60515318.0,
|
|
"step": 34880
|
|
},
|
|
{
|
|
"entropy": 5.357729053497314,
|
|
"epoch": 2.714180120599105,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0004260535262165322,
|
|
"loss": 5.0624,
|
|
"mean_token_accuracy": 0.19917599409818648,
|
|
"num_tokens": 60525425.0,
|
|
"step": 34885
|
|
},
|
|
{
|
|
"entropy": 5.383405303955078,
|
|
"epoch": 2.714569149970823,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00042603298390232015,
|
|
"loss": 4.9906,
|
|
"mean_token_accuracy": 0.19140629321336747,
|
|
"num_tokens": 60535028.0,
|
|
"step": 34890
|
|
},
|
|
{
|
|
"entropy": 5.3716638565063475,
|
|
"epoch": 2.71495817934254,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00042601243929642305,
|
|
"loss": 4.9255,
|
|
"mean_token_accuracy": 0.20799052268266677,
|
|
"num_tokens": 60543076.0,
|
|
"step": 34895
|
|
},
|
|
{
|
|
"entropy": 5.346485996246338,
|
|
"epoch": 2.715347208714258,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00042599189239915253,
|
|
"loss": 4.9707,
|
|
"mean_token_accuracy": 0.20157477110624314,
|
|
"num_tokens": 60551697.0,
|
|
"step": 34900
|
|
},
|
|
{
|
|
"entropy": 5.29774956703186,
|
|
"epoch": 2.7157362380859755,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004259713432108204,
|
|
"loss": 4.9317,
|
|
"mean_token_accuracy": 0.1928666889667511,
|
|
"num_tokens": 60559910.0,
|
|
"step": 34905
|
|
},
|
|
{
|
|
"entropy": 5.457463264465332,
|
|
"epoch": 2.7161252674576932,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004259507917317384,
|
|
"loss": 5.0712,
|
|
"mean_token_accuracy": 0.1898985907435417,
|
|
"num_tokens": 60568717.0,
|
|
"step": 34910
|
|
},
|
|
{
|
|
"entropy": 5.450325155258179,
|
|
"epoch": 2.7165142968294105,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00042593023796221843,
|
|
"loss": 4.9865,
|
|
"mean_token_accuracy": 0.1966839998960495,
|
|
"num_tokens": 60576707.0,
|
|
"step": 34915
|
|
},
|
|
{
|
|
"entropy": 5.404114484786987,
|
|
"epoch": 2.716903326201128,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004259096819025723,
|
|
"loss": 4.94,
|
|
"mean_token_accuracy": 0.2007000580430031,
|
|
"num_tokens": 60585097.0,
|
|
"step": 34920
|
|
},
|
|
{
|
|
"entropy": 5.343565988540649,
|
|
"epoch": 2.717292355572846,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00042588912355311196,
|
|
"loss": 4.9719,
|
|
"mean_token_accuracy": 0.204275181889534,
|
|
"num_tokens": 60594026.0,
|
|
"step": 34925
|
|
},
|
|
{
|
|
"entropy": 5.380764389038086,
|
|
"epoch": 2.717681384944563,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00042586856291414925,
|
|
"loss": 4.9326,
|
|
"mean_token_accuracy": 0.20288337767124176,
|
|
"num_tokens": 60602281.0,
|
|
"step": 34930
|
|
},
|
|
{
|
|
"entropy": 5.356401491165161,
|
|
"epoch": 2.718070414316281,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00042584799998599633,
|
|
"loss": 4.9292,
|
|
"mean_token_accuracy": 0.20539550632238388,
|
|
"num_tokens": 60610329.0,
|
|
"step": 34935
|
|
},
|
|
{
|
|
"entropy": 5.3719861030578615,
|
|
"epoch": 2.7184594436879985,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004258274347689651,
|
|
"loss": 5.0239,
|
|
"mean_token_accuracy": 0.19869040101766586,
|
|
"num_tokens": 60618251.0,
|
|
"step": 34940
|
|
},
|
|
{
|
|
"entropy": 5.438964223861694,
|
|
"epoch": 2.718848473059716,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00042580686726336766,
|
|
"loss": 4.9706,
|
|
"mean_token_accuracy": 0.19448422342538835,
|
|
"num_tokens": 60626479.0,
|
|
"step": 34945
|
|
},
|
|
{
|
|
"entropy": 5.364186382293701,
|
|
"epoch": 2.7192375024314335,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00042578629746951597,
|
|
"loss": 4.9546,
|
|
"mean_token_accuracy": 0.20262847393751143,
|
|
"num_tokens": 60635375.0,
|
|
"step": 34950
|
|
},
|
|
{
|
|
"entropy": 5.406803178787231,
|
|
"epoch": 2.719626531803151,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004257657253877222,
|
|
"loss": 4.9999,
|
|
"mean_token_accuracy": 0.19876051247119902,
|
|
"num_tokens": 60644136.0,
|
|
"step": 34955
|
|
},
|
|
{
|
|
"entropy": 5.4829504013061525,
|
|
"epoch": 2.720015561174869,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00042574515101829856,
|
|
"loss": 5.0735,
|
|
"mean_token_accuracy": 0.20226812213659287,
|
|
"num_tokens": 60653258.0,
|
|
"step": 34960
|
|
},
|
|
{
|
|
"entropy": 5.410881996154785,
|
|
"epoch": 2.720404590546586,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00042572457436155717,
|
|
"loss": 4.9712,
|
|
"mean_token_accuracy": 0.20164205580949784,
|
|
"num_tokens": 60662320.0,
|
|
"step": 34965
|
|
},
|
|
{
|
|
"entropy": 5.326263952255249,
|
|
"epoch": 2.720793619918304,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00042570399541781023,
|
|
"loss": 4.9697,
|
|
"mean_token_accuracy": 0.201089708507061,
|
|
"num_tokens": 60671669.0,
|
|
"step": 34970
|
|
},
|
|
{
|
|
"entropy": 5.406627368927002,
|
|
"epoch": 2.7211826492900215,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00042568341418737016,
|
|
"loss": 5.0906,
|
|
"mean_token_accuracy": 0.1946942076086998,
|
|
"num_tokens": 60680391.0,
|
|
"step": 34975
|
|
},
|
|
{
|
|
"entropy": 5.431188583374023,
|
|
"epoch": 2.721571678661739,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.000425662830670549,
|
|
"loss": 5.0248,
|
|
"mean_token_accuracy": 0.1957213744521141,
|
|
"num_tokens": 60690150.0,
|
|
"step": 34980
|
|
},
|
|
{
|
|
"entropy": 5.377703332901001,
|
|
"epoch": 2.7219607080334565,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00042564224486765925,
|
|
"loss": 4.889,
|
|
"mean_token_accuracy": 0.2073738768696785,
|
|
"num_tokens": 60698950.0,
|
|
"step": 34985
|
|
},
|
|
{
|
|
"entropy": 5.45033278465271,
|
|
"epoch": 2.722349737405174,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004256216567790131,
|
|
"loss": 5.0116,
|
|
"mean_token_accuracy": 0.19431646168231964,
|
|
"num_tokens": 60707859.0,
|
|
"step": 34990
|
|
},
|
|
{
|
|
"entropy": 5.382950735092163,
|
|
"epoch": 2.7227387667768914,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004256010664049232,
|
|
"loss": 4.9849,
|
|
"mean_token_accuracy": 0.2028467059135437,
|
|
"num_tokens": 60716621.0,
|
|
"step": 34995
|
|
},
|
|
{
|
|
"entropy": 5.408921146392823,
|
|
"epoch": 2.723127796148609,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004255804737457017,
|
|
"loss": 5.103,
|
|
"mean_token_accuracy": 0.1877564549446106,
|
|
"num_tokens": 60725695.0,
|
|
"step": 35000
|
|
},
|
|
{
|
|
"entropy": 5.422921514511108,
|
|
"epoch": 2.723516825520327,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00042555987880166127,
|
|
"loss": 4.9485,
|
|
"mean_token_accuracy": 0.20472778975963593,
|
|
"num_tokens": 60733978.0,
|
|
"step": 35005
|
|
},
|
|
{
|
|
"entropy": 5.3629485130310055,
|
|
"epoch": 2.7239058548920445,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004255392815731142,
|
|
"loss": 4.9754,
|
|
"mean_token_accuracy": 0.2001110777258873,
|
|
"num_tokens": 60742391.0,
|
|
"step": 35010
|
|
},
|
|
{
|
|
"entropy": 5.370002317428589,
|
|
"epoch": 2.7242948842637618,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00042551868206037324,
|
|
"loss": 4.9285,
|
|
"mean_token_accuracy": 0.20952879637479782,
|
|
"num_tokens": 60749808.0,
|
|
"step": 35015
|
|
},
|
|
{
|
|
"entropy": 5.396552515029907,
|
|
"epoch": 2.7246839136354795,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00042549808026375084,
|
|
"loss": 5.0798,
|
|
"mean_token_accuracy": 0.19521878361701966,
|
|
"num_tokens": 60759902.0,
|
|
"step": 35020
|
|
},
|
|
{
|
|
"entropy": 5.387737131118774,
|
|
"epoch": 2.725072943007197,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00042547747618355966,
|
|
"loss": 4.9967,
|
|
"mean_token_accuracy": 0.2008301720023155,
|
|
"num_tokens": 60768542.0,
|
|
"step": 35025
|
|
},
|
|
{
|
|
"entropy": 5.3652698516845705,
|
|
"epoch": 2.7254619723789144,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004254568698201122,
|
|
"loss": 4.9516,
|
|
"mean_token_accuracy": 0.20900079160928725,
|
|
"num_tokens": 60777077.0,
|
|
"step": 35030
|
|
},
|
|
{
|
|
"entropy": 5.31120285987854,
|
|
"epoch": 2.725851001750632,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00042543626117372133,
|
|
"loss": 4.8898,
|
|
"mean_token_accuracy": 0.20063648521900176,
|
|
"num_tokens": 60786520.0,
|
|
"step": 35035
|
|
},
|
|
{
|
|
"entropy": 5.432752370834351,
|
|
"epoch": 2.72624003112235,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00042541565024469945,
|
|
"loss": 5.0141,
|
|
"mean_token_accuracy": 0.20687125325202943,
|
|
"num_tokens": 60795270.0,
|
|
"step": 35040
|
|
},
|
|
{
|
|
"entropy": 5.407832479476928,
|
|
"epoch": 2.7266290604940675,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00042539503703335963,
|
|
"loss": 4.9854,
|
|
"mean_token_accuracy": 0.19778105318546296,
|
|
"num_tokens": 60804047.0,
|
|
"step": 35045
|
|
},
|
|
{
|
|
"entropy": 5.334122276306152,
|
|
"epoch": 2.7270180898657848,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00042537442154001455,
|
|
"loss": 4.9335,
|
|
"mean_token_accuracy": 0.19598948806524277,
|
|
"num_tokens": 60812376.0,
|
|
"step": 35050
|
|
},
|
|
{
|
|
"entropy": 5.4614075183868405,
|
|
"epoch": 2.7274071192375025,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00042535380376497684,
|
|
"loss": 5.1207,
|
|
"mean_token_accuracy": 0.18710460513830185,
|
|
"num_tokens": 60822075.0,
|
|
"step": 35055
|
|
},
|
|
{
|
|
"entropy": 5.464821147918701,
|
|
"epoch": 2.72779614860922,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004253331837085595,
|
|
"loss": 5.0168,
|
|
"mean_token_accuracy": 0.20203171521425248,
|
|
"num_tokens": 60830729.0,
|
|
"step": 35060
|
|
},
|
|
{
|
|
"entropy": 5.361655187606812,
|
|
"epoch": 2.7281851779809374,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00042531256137107545,
|
|
"loss": 4.8786,
|
|
"mean_token_accuracy": 0.20346354693174362,
|
|
"num_tokens": 60840429.0,
|
|
"step": 35065
|
|
},
|
|
{
|
|
"entropy": 5.319899082183838,
|
|
"epoch": 2.728574207352655,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004252919367528375,
|
|
"loss": 4.8481,
|
|
"mean_token_accuracy": 0.2026260733604431,
|
|
"num_tokens": 60848967.0,
|
|
"step": 35070
|
|
},
|
|
{
|
|
"entropy": 5.323038816452026,
|
|
"epoch": 2.728963236724373,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.00042527130985415857,
|
|
"loss": 4.9227,
|
|
"mean_token_accuracy": 0.2029882475733757,
|
|
"num_tokens": 60856718.0,
|
|
"step": 35075
|
|
},
|
|
{
|
|
"entropy": 5.359774780273438,
|
|
"epoch": 2.7293522660960905,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004252506806753517,
|
|
"loss": 4.8866,
|
|
"mean_token_accuracy": 0.20467945635318757,
|
|
"num_tokens": 60865338.0,
|
|
"step": 35080
|
|
},
|
|
{
|
|
"entropy": 5.354181814193725,
|
|
"epoch": 2.7297412954678077,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00042523004921673,
|
|
"loss": 4.9887,
|
|
"mean_token_accuracy": 0.2039518415927887,
|
|
"num_tokens": 60873887.0,
|
|
"step": 35085
|
|
},
|
|
{
|
|
"entropy": 5.42711763381958,
|
|
"epoch": 2.7301303248395254,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004252094154786063,
|
|
"loss": 5.0381,
|
|
"mean_token_accuracy": 0.1949532464146614,
|
|
"num_tokens": 60882755.0,
|
|
"step": 35090
|
|
},
|
|
{
|
|
"entropy": 5.3572205066680905,
|
|
"epoch": 2.7305193542112427,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004251887794612939,
|
|
"loss": 4.8564,
|
|
"mean_token_accuracy": 0.21123257130384446,
|
|
"num_tokens": 60891191.0,
|
|
"step": 35095
|
|
},
|
|
{
|
|
"entropy": 5.406901264190674,
|
|
"epoch": 2.7309083835829604,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004251681411651057,
|
|
"loss": 5.0568,
|
|
"mean_token_accuracy": 0.19802723377943038,
|
|
"num_tokens": 60899634.0,
|
|
"step": 35100
|
|
},
|
|
{
|
|
"entropy": 5.405670499801635,
|
|
"epoch": 2.731297412954678,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00042514750059035504,
|
|
"loss": 5.0364,
|
|
"mean_token_accuracy": 0.20344208627939225,
|
|
"num_tokens": 60908468.0,
|
|
"step": 35105
|
|
},
|
|
{
|
|
"entropy": 5.386397409439087,
|
|
"epoch": 2.731686442326396,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004251268577373551,
|
|
"loss": 4.9838,
|
|
"mean_token_accuracy": 0.1937482088804245,
|
|
"num_tokens": 60917102.0,
|
|
"step": 35110
|
|
},
|
|
{
|
|
"entropy": 5.46617751121521,
|
|
"epoch": 2.732075471698113,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.000425106212606419,
|
|
"loss": 5.0562,
|
|
"mean_token_accuracy": 0.20040431767702102,
|
|
"num_tokens": 60926410.0,
|
|
"step": 35115
|
|
},
|
|
{
|
|
"entropy": 5.415679788589477,
|
|
"epoch": 2.7324645010698307,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00042508556519786004,
|
|
"loss": 4.9103,
|
|
"mean_token_accuracy": 0.20673118978738786,
|
|
"num_tokens": 60935068.0,
|
|
"step": 35120
|
|
},
|
|
{
|
|
"entropy": 5.3934855461120605,
|
|
"epoch": 2.7328535304415484,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004250649155119915,
|
|
"loss": 4.9579,
|
|
"mean_token_accuracy": 0.20045288354158403,
|
|
"num_tokens": 60943507.0,
|
|
"step": 35125
|
|
},
|
|
{
|
|
"entropy": 5.338783502578735,
|
|
"epoch": 2.7332425598132657,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00042504426354912666,
|
|
"loss": 4.9275,
|
|
"mean_token_accuracy": 0.2019277662038803,
|
|
"num_tokens": 60952175.0,
|
|
"step": 35130
|
|
},
|
|
{
|
|
"entropy": 5.29727840423584,
|
|
"epoch": 2.7336315891849834,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00042502360930957904,
|
|
"loss": 4.95,
|
|
"mean_token_accuracy": 0.2023328110575676,
|
|
"num_tokens": 60962087.0,
|
|
"step": 35135
|
|
},
|
|
{
|
|
"entropy": 5.3801963329315186,
|
|
"epoch": 2.734020618556701,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00042500295279366196,
|
|
"loss": 4.9254,
|
|
"mean_token_accuracy": 0.20954489558935166,
|
|
"num_tokens": 60970142.0,
|
|
"step": 35140
|
|
},
|
|
{
|
|
"entropy": 5.392442512512207,
|
|
"epoch": 2.734409647928419,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00042498229400168874,
|
|
"loss": 5.0196,
|
|
"mean_token_accuracy": 0.19313295185565948,
|
|
"num_tokens": 60979498.0,
|
|
"step": 35145
|
|
},
|
|
{
|
|
"entropy": 5.375092840194702,
|
|
"epoch": 2.734798677300136,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.000424961632933973,
|
|
"loss": 4.9945,
|
|
"mean_token_accuracy": 0.19961830824613572,
|
|
"num_tokens": 60988382.0,
|
|
"step": 35150
|
|
},
|
|
{
|
|
"entropy": 5.411002969741821,
|
|
"epoch": 2.7351877066718537,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004249409695908281,
|
|
"loss": 5.0592,
|
|
"mean_token_accuracy": 0.19502754062414168,
|
|
"num_tokens": 60998191.0,
|
|
"step": 35155
|
|
},
|
|
{
|
|
"entropy": 5.436344146728516,
|
|
"epoch": 2.7355767360435714,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004249203039725677,
|
|
"loss": 5.004,
|
|
"mean_token_accuracy": 0.1966912031173706,
|
|
"num_tokens": 61006417.0,
|
|
"step": 35160
|
|
},
|
|
{
|
|
"entropy": 5.336159896850586,
|
|
"epoch": 2.7359657654152887,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00042489963607950527,
|
|
"loss": 4.8488,
|
|
"mean_token_accuracy": 0.21572496891021728,
|
|
"num_tokens": 61014562.0,
|
|
"step": 35165
|
|
},
|
|
{
|
|
"entropy": 5.32479681968689,
|
|
"epoch": 2.7363547947870064,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.00042487896591195454,
|
|
"loss": 4.9239,
|
|
"mean_token_accuracy": 0.20034560114145278,
|
|
"num_tokens": 61022139.0,
|
|
"step": 35170
|
|
},
|
|
{
|
|
"entropy": 5.377214670181274,
|
|
"epoch": 2.736743824158724,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00042485829347022893,
|
|
"loss": 5.115,
|
|
"mean_token_accuracy": 0.19396832585334778,
|
|
"num_tokens": 61031099.0,
|
|
"step": 35175
|
|
},
|
|
{
|
|
"entropy": 5.521640110015869,
|
|
"epoch": 2.737132853530442,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00042483761875464226,
|
|
"loss": 5.0491,
|
|
"mean_token_accuracy": 0.1974119022488594,
|
|
"num_tokens": 61039136.0,
|
|
"step": 35180
|
|
},
|
|
{
|
|
"entropy": 5.382097816467285,
|
|
"epoch": 2.737521882902159,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00042481694176550825,
|
|
"loss": 4.9295,
|
|
"mean_token_accuracy": 0.20427945852279664,
|
|
"num_tokens": 61047177.0,
|
|
"step": 35185
|
|
},
|
|
{
|
|
"entropy": 5.350960397720337,
|
|
"epoch": 2.7379109122738767,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00042479626250314066,
|
|
"loss": 4.9175,
|
|
"mean_token_accuracy": 0.1989891216158867,
|
|
"num_tokens": 61055383.0,
|
|
"step": 35190
|
|
},
|
|
{
|
|
"entropy": 5.3613255500793455,
|
|
"epoch": 2.738299941645594,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00042477558096785316,
|
|
"loss": 4.9297,
|
|
"mean_token_accuracy": 0.20729342997074127,
|
|
"num_tokens": 61063831.0,
|
|
"step": 35195
|
|
},
|
|
{
|
|
"entropy": 5.445357418060302,
|
|
"epoch": 2.7386889710173117,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00042475489715995956,
|
|
"loss": 5.0419,
|
|
"mean_token_accuracy": 0.19432148337364197,
|
|
"num_tokens": 61072328.0,
|
|
"step": 35200
|
|
},
|
|
{
|
|
"entropy": 5.337676620483398,
|
|
"epoch": 2.7390780003890294,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00042473421107977385,
|
|
"loss": 4.8904,
|
|
"mean_token_accuracy": 0.20327156633138657,
|
|
"num_tokens": 61081191.0,
|
|
"step": 35205
|
|
},
|
|
{
|
|
"entropy": 5.409759140014648,
|
|
"epoch": 2.739467029760747,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00042471352272760974,
|
|
"loss": 4.9725,
|
|
"mean_token_accuracy": 0.20484423488378525,
|
|
"num_tokens": 61089314.0,
|
|
"step": 35210
|
|
},
|
|
{
|
|
"entropy": 5.323824167251587,
|
|
"epoch": 2.7398560591324648,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004246928321037813,
|
|
"loss": 4.9161,
|
|
"mean_token_accuracy": 0.20522205233573915,
|
|
"num_tokens": 61098322.0,
|
|
"step": 35215
|
|
},
|
|
{
|
|
"entropy": 5.489756393432617,
|
|
"epoch": 2.740245088504182,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004246721392086023,
|
|
"loss": 5.0989,
|
|
"mean_token_accuracy": 0.18871491104364396,
|
|
"num_tokens": 61106682.0,
|
|
"step": 35220
|
|
},
|
|
{
|
|
"entropy": 5.398154926300049,
|
|
"epoch": 2.7406341178758997,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.00042465144404238686,
|
|
"loss": 4.9855,
|
|
"mean_token_accuracy": 0.1971716359257698,
|
|
"num_tokens": 61115765.0,
|
|
"step": 35225
|
|
},
|
|
{
|
|
"entropy": 5.314597797393799,
|
|
"epoch": 2.741023147247617,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00042463074660544897,
|
|
"loss": 4.8682,
|
|
"mean_token_accuracy": 0.20525064766407014,
|
|
"num_tokens": 61124464.0,
|
|
"step": 35230
|
|
},
|
|
{
|
|
"entropy": 5.427773904800415,
|
|
"epoch": 2.7414121766193347,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004246100468981026,
|
|
"loss": 5.0751,
|
|
"mean_token_accuracy": 0.19600068032741547,
|
|
"num_tokens": 61133386.0,
|
|
"step": 35235
|
|
},
|
|
{
|
|
"entropy": 5.4985072135925295,
|
|
"epoch": 2.7418012059910524,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.000424589344920662,
|
|
"loss": 5.0919,
|
|
"mean_token_accuracy": 0.18596834540367127,
|
|
"num_tokens": 61141873.0,
|
|
"step": 35240
|
|
},
|
|
{
|
|
"entropy": 5.4353104591369625,
|
|
"epoch": 2.74219023536277,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004245686406734411,
|
|
"loss": 4.9744,
|
|
"mean_token_accuracy": 0.19829301536083221,
|
|
"num_tokens": 61150113.0,
|
|
"step": 35245
|
|
},
|
|
{
|
|
"entropy": 5.300794076919556,
|
|
"epoch": 2.7425792647344873,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004245479341567541,
|
|
"loss": 4.8662,
|
|
"mean_token_accuracy": 0.21083554476499558,
|
|
"num_tokens": 61158941.0,
|
|
"step": 35250
|
|
},
|
|
{
|
|
"entropy": 5.33780689239502,
|
|
"epoch": 2.742968294106205,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0004245272253709154,
|
|
"loss": 4.9647,
|
|
"mean_token_accuracy": 0.20341936200857164,
|
|
"num_tokens": 61167978.0,
|
|
"step": 35255
|
|
},
|
|
{
|
|
"entropy": 5.419666528701782,
|
|
"epoch": 2.7433573234779227,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004245065143162389,
|
|
"loss": 5.066,
|
|
"mean_token_accuracy": 0.1935967430472374,
|
|
"num_tokens": 61176581.0,
|
|
"step": 35260
|
|
},
|
|
{
|
|
"entropy": 5.5086503505706785,
|
|
"epoch": 2.74374635284964,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00042448580099303904,
|
|
"loss": 5.1208,
|
|
"mean_token_accuracy": 0.18689976036548614,
|
|
"num_tokens": 61186072.0,
|
|
"step": 35265
|
|
},
|
|
{
|
|
"entropy": 5.475858354568482,
|
|
"epoch": 2.7441353822213577,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00042446508540163017,
|
|
"loss": 4.9972,
|
|
"mean_token_accuracy": 0.19220044314861298,
|
|
"num_tokens": 61194632.0,
|
|
"step": 35270
|
|
},
|
|
{
|
|
"entropy": 5.321110582351684,
|
|
"epoch": 2.7445244115930754,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004244443675423264,
|
|
"loss": 4.922,
|
|
"mean_token_accuracy": 0.20376257449388505,
|
|
"num_tokens": 61203705.0,
|
|
"step": 35275
|
|
},
|
|
{
|
|
"entropy": 5.347429084777832,
|
|
"epoch": 2.744913440964793,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00042442364741544227,
|
|
"loss": 4.9115,
|
|
"mean_token_accuracy": 0.20028651505708694,
|
|
"num_tokens": 61212565.0,
|
|
"step": 35280
|
|
},
|
|
{
|
|
"entropy": 5.393892908096314,
|
|
"epoch": 2.7453024703365103,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00042440292502129214,
|
|
"loss": 4.9548,
|
|
"mean_token_accuracy": 0.19777675420045854,
|
|
"num_tokens": 61221092.0,
|
|
"step": 35285
|
|
},
|
|
{
|
|
"entropy": 5.376577615737915,
|
|
"epoch": 2.745691499708228,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004243822003601904,
|
|
"loss": 4.9978,
|
|
"mean_token_accuracy": 0.19573669284582138,
|
|
"num_tokens": 61229880.0,
|
|
"step": 35290
|
|
},
|
|
{
|
|
"entropy": 5.350202512741089,
|
|
"epoch": 2.7460805290799453,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004243614734324515,
|
|
"loss": 4.9571,
|
|
"mean_token_accuracy": 0.19926372319459915,
|
|
"num_tokens": 61238890.0,
|
|
"step": 35295
|
|
},
|
|
{
|
|
"entropy": 5.379403400421142,
|
|
"epoch": 2.746469558451663,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004243407442383901,
|
|
"loss": 4.9593,
|
|
"mean_token_accuracy": 0.19335587471723556,
|
|
"num_tokens": 61248260.0,
|
|
"step": 35300
|
|
},
|
|
{
|
|
"entropy": 5.436090707778931,
|
|
"epoch": 2.7468585878233807,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00042432001277832045,
|
|
"loss": 4.9549,
|
|
"mean_token_accuracy": 0.19740568697452546,
|
|
"num_tokens": 61256345.0,
|
|
"step": 35305
|
|
},
|
|
{
|
|
"entropy": 5.415718841552734,
|
|
"epoch": 2.7472476171950984,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004242992790525573,
|
|
"loss": 4.9586,
|
|
"mean_token_accuracy": 0.20259884148836135,
|
|
"num_tokens": 61264952.0,
|
|
"step": 35310
|
|
},
|
|
{
|
|
"entropy": 5.369949007034302,
|
|
"epoch": 2.747636646566816,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004242785430614154,
|
|
"loss": 5.0086,
|
|
"mean_token_accuracy": 0.1960822507739067,
|
|
"num_tokens": 61273596.0,
|
|
"step": 35315
|
|
},
|
|
{
|
|
"entropy": 5.365375280380249,
|
|
"epoch": 2.7480256759385333,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00042425780480520906,
|
|
"loss": 4.9274,
|
|
"mean_token_accuracy": 0.2019275575876236,
|
|
"num_tokens": 61281799.0,
|
|
"step": 35320
|
|
},
|
|
{
|
|
"entropy": 5.39530119895935,
|
|
"epoch": 2.748414705310251,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00042423706428425305,
|
|
"loss": 4.9137,
|
|
"mean_token_accuracy": 0.19874417185783386,
|
|
"num_tokens": 61290295.0,
|
|
"step": 35325
|
|
},
|
|
{
|
|
"entropy": 5.323211240768432,
|
|
"epoch": 2.7488037346819683,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0004242163214988622,
|
|
"loss": 4.9703,
|
|
"mean_token_accuracy": 0.20296016335487366,
|
|
"num_tokens": 61298745.0,
|
|
"step": 35330
|
|
},
|
|
{
|
|
"entropy": 5.461699628829956,
|
|
"epoch": 2.749192764053686,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.0004241955764493512,
|
|
"loss": 5.0647,
|
|
"mean_token_accuracy": 0.18952107727527617,
|
|
"num_tokens": 61307472.0,
|
|
"step": 35335
|
|
},
|
|
{
|
|
"entropy": 5.441533041000366,
|
|
"epoch": 2.7495817934254037,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.00042417482913603477,
|
|
"loss": 5.0722,
|
|
"mean_token_accuracy": 0.18939783573150634,
|
|
"num_tokens": 61317633.0,
|
|
"step": 35340
|
|
},
|
|
{
|
|
"entropy": 5.419112730026245,
|
|
"epoch": 2.7499708227971214,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.00042415407955922774,
|
|
"loss": 4.985,
|
|
"mean_token_accuracy": 0.2015675500035286,
|
|
"num_tokens": 61326836.0,
|
|
"step": 35345
|
|
},
|
|
{
|
|
"entropy": 5.429885196685791,
|
|
"epoch": 2.7503598521688386,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00042413332771924496,
|
|
"loss": 5.0189,
|
|
"mean_token_accuracy": 0.19724085479974746,
|
|
"num_tokens": 61335817.0,
|
|
"step": 35350
|
|
},
|
|
{
|
|
"entropy": 5.464182043075562,
|
|
"epoch": 2.7507488815405563,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004241125736164013,
|
|
"loss": 5.1472,
|
|
"mean_token_accuracy": 0.19115206748247146,
|
|
"num_tokens": 61345030.0,
|
|
"step": 35355
|
|
},
|
|
{
|
|
"entropy": 5.419407939910888,
|
|
"epoch": 2.751137910912274,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004240918172510117,
|
|
"loss": 4.9942,
|
|
"mean_token_accuracy": 0.19440263509750366,
|
|
"num_tokens": 61353061.0,
|
|
"step": 35360
|
|
},
|
|
{
|
|
"entropy": 5.484201669692993,
|
|
"epoch": 2.7515269402839913,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.000424071058623391,
|
|
"loss": 5.1122,
|
|
"mean_token_accuracy": 0.1927821159362793,
|
|
"num_tokens": 61361357.0,
|
|
"step": 35365
|
|
},
|
|
{
|
|
"entropy": 5.464963054656982,
|
|
"epoch": 2.751915969655709,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004240502977338543,
|
|
"loss": 5.0703,
|
|
"mean_token_accuracy": 0.1877596288919449,
|
|
"num_tokens": 61369731.0,
|
|
"step": 35370
|
|
},
|
|
{
|
|
"entropy": 5.393389749526977,
|
|
"epoch": 2.7523049990274266,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004240295345827166,
|
|
"loss": 4.9729,
|
|
"mean_token_accuracy": 0.20434136986732482,
|
|
"num_tokens": 61378212.0,
|
|
"step": 35375
|
|
},
|
|
{
|
|
"entropy": 5.3417524814605715,
|
|
"epoch": 2.7526940283991443,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004240087691702929,
|
|
"loss": 4.9388,
|
|
"mean_token_accuracy": 0.19773186296224593,
|
|
"num_tokens": 61386743.0,
|
|
"step": 35380
|
|
},
|
|
{
|
|
"entropy": 5.416187429428101,
|
|
"epoch": 2.7530830577708616,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004239880014968983,
|
|
"loss": 4.9626,
|
|
"mean_token_accuracy": 0.1989794045686722,
|
|
"num_tokens": 61394513.0,
|
|
"step": 35385
|
|
},
|
|
{
|
|
"entropy": 5.441179847717285,
|
|
"epoch": 2.7534720871425793,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00042396723156284786,
|
|
"loss": 4.9638,
|
|
"mean_token_accuracy": 0.19554123729467393,
|
|
"num_tokens": 61403999.0,
|
|
"step": 35390
|
|
},
|
|
{
|
|
"entropy": 5.386093473434448,
|
|
"epoch": 2.753861116514297,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004239464593684568,
|
|
"loss": 4.9304,
|
|
"mean_token_accuracy": 0.20308475196361542,
|
|
"num_tokens": 61413363.0,
|
|
"step": 35395
|
|
},
|
|
{
|
|
"entropy": 5.317185163497925,
|
|
"epoch": 2.7542501458860142,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00042392568491404043,
|
|
"loss": 4.8727,
|
|
"mean_token_accuracy": 0.2070518434047699,
|
|
"num_tokens": 61421749.0,
|
|
"step": 35400
|
|
},
|
|
{
|
|
"entropy": 5.401377010345459,
|
|
"epoch": 2.754639175257732,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00042390490819991367,
|
|
"loss": 5.0384,
|
|
"mean_token_accuracy": 0.19877706915140153,
|
|
"num_tokens": 61430422.0,
|
|
"step": 35405
|
|
},
|
|
{
|
|
"entropy": 5.418408346176148,
|
|
"epoch": 2.7550282046294496,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.000423884129226392,
|
|
"loss": 4.9821,
|
|
"mean_token_accuracy": 0.20056185275316238,
|
|
"num_tokens": 61439402.0,
|
|
"step": 35410
|
|
},
|
|
{
|
|
"entropy": 5.426454019546509,
|
|
"epoch": 2.7554172340011673,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004238633479937906,
|
|
"loss": 5.0584,
|
|
"mean_token_accuracy": 0.19726598262786865,
|
|
"num_tokens": 61448791.0,
|
|
"step": 35415
|
|
},
|
|
{
|
|
"entropy": 5.3473835468292235,
|
|
"epoch": 2.7558062633728846,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004238425645024249,
|
|
"loss": 4.8879,
|
|
"mean_token_accuracy": 0.1935310661792755,
|
|
"num_tokens": 61457181.0,
|
|
"step": 35420
|
|
},
|
|
{
|
|
"entropy": 5.4761615753173825,
|
|
"epoch": 2.7561952927446023,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004238217787526102,
|
|
"loss": 5.0647,
|
|
"mean_token_accuracy": 0.19254227429628373,
|
|
"num_tokens": 61465525.0,
|
|
"step": 35425
|
|
},
|
|
{
|
|
"entropy": 5.37877926826477,
|
|
"epoch": 2.7565843221163195,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004238009907446618,
|
|
"loss": 5.0649,
|
|
"mean_token_accuracy": 0.19574262648820878,
|
|
"num_tokens": 61474805.0,
|
|
"step": 35430
|
|
},
|
|
{
|
|
"entropy": 5.345131206512451,
|
|
"epoch": 2.7569733514880372,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00042378020047889527,
|
|
"loss": 4.8638,
|
|
"mean_token_accuracy": 0.21062728762626648,
|
|
"num_tokens": 61484147.0,
|
|
"step": 35435
|
|
},
|
|
{
|
|
"entropy": 5.338674116134643,
|
|
"epoch": 2.757362380859755,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00042375940795562594,
|
|
"loss": 4.8527,
|
|
"mean_token_accuracy": 0.2058672696352005,
|
|
"num_tokens": 61492396.0,
|
|
"step": 35440
|
|
},
|
|
{
|
|
"entropy": 5.307626247406006,
|
|
"epoch": 2.7577514102314726,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00042373861317516944,
|
|
"loss": 4.9401,
|
|
"mean_token_accuracy": 0.1950557366013527,
|
|
"num_tokens": 61500941.0,
|
|
"step": 35445
|
|
},
|
|
{
|
|
"entropy": 5.403898000717163,
|
|
"epoch": 2.75814043960319,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004237178161378412,
|
|
"loss": 4.9698,
|
|
"mean_token_accuracy": 0.20358236879110336,
|
|
"num_tokens": 61510245.0,
|
|
"step": 35450
|
|
},
|
|
{
|
|
"entropy": 5.328627252578736,
|
|
"epoch": 2.7585294689749076,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004236970168439568,
|
|
"loss": 4.9118,
|
|
"mean_token_accuracy": 0.19908031970262527,
|
|
"num_tokens": 61519070.0,
|
|
"step": 35455
|
|
},
|
|
{
|
|
"entropy": 5.281628799438477,
|
|
"epoch": 2.7589184983466253,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00042367621529383186,
|
|
"loss": 4.8422,
|
|
"mean_token_accuracy": 0.21207236647605895,
|
|
"num_tokens": 61526931.0,
|
|
"step": 35460
|
|
},
|
|
{
|
|
"entropy": 5.490721368789673,
|
|
"epoch": 2.7593075277183425,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00042365541148778205,
|
|
"loss": 5.0685,
|
|
"mean_token_accuracy": 0.19526457339525222,
|
|
"num_tokens": 61534645.0,
|
|
"step": 35465
|
|
},
|
|
{
|
|
"entropy": 5.372731447219849,
|
|
"epoch": 2.7596965570900602,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00042363460542612285,
|
|
"loss": 4.9027,
|
|
"mean_token_accuracy": 0.20172665417194366,
|
|
"num_tokens": 61542770.0,
|
|
"step": 35470
|
|
},
|
|
{
|
|
"entropy": 5.337182569503784,
|
|
"epoch": 2.760085586461778,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004236137971091702,
|
|
"loss": 4.982,
|
|
"mean_token_accuracy": 0.20445164889097214,
|
|
"num_tokens": 61551059.0,
|
|
"step": 35475
|
|
},
|
|
{
|
|
"entropy": 5.36499662399292,
|
|
"epoch": 2.7604746158334956,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00042359298653723963,
|
|
"loss": 4.8399,
|
|
"mean_token_accuracy": 0.20569880306720734,
|
|
"num_tokens": 61559384.0,
|
|
"step": 35480
|
|
},
|
|
{
|
|
"entropy": 5.31025013923645,
|
|
"epoch": 2.760863645205213,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004235721737106471,
|
|
"loss": 4.8965,
|
|
"mean_token_accuracy": 0.20264946222305297,
|
|
"num_tokens": 61568335.0,
|
|
"step": 35485
|
|
},
|
|
{
|
|
"entropy": 5.36141939163208,
|
|
"epoch": 2.7612526745769306,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004235513586297082,
|
|
"loss": 4.9158,
|
|
"mean_token_accuracy": 0.19997848719358444,
|
|
"num_tokens": 61577481.0,
|
|
"step": 35490
|
|
},
|
|
{
|
|
"entropy": 5.366316604614258,
|
|
"epoch": 2.7616417039486483,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00042353054129473894,
|
|
"loss": 4.9598,
|
|
"mean_token_accuracy": 0.1976238504052162,
|
|
"num_tokens": 61585921.0,
|
|
"step": 35495
|
|
},
|
|
{
|
|
"entropy": 5.335967588424682,
|
|
"epoch": 2.7620307333203655,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004235097217060552,
|
|
"loss": 4.928,
|
|
"mean_token_accuracy": 0.20122514814138412,
|
|
"num_tokens": 61594548.0,
|
|
"step": 35500
|
|
},
|
|
{
|
|
"entropy": 5.383836698532105,
|
|
"epoch": 2.7624197626920832,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004234888998639727,
|
|
"loss": 4.989,
|
|
"mean_token_accuracy": 0.2102173998951912,
|
|
"num_tokens": 61603165.0,
|
|
"step": 35505
|
|
},
|
|
{
|
|
"entropy": 5.3815693855285645,
|
|
"epoch": 2.762808792063801,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004234680757688076,
|
|
"loss": 4.866,
|
|
"mean_token_accuracy": 0.20518524646759034,
|
|
"num_tokens": 61611920.0,
|
|
"step": 35510
|
|
},
|
|
{
|
|
"entropy": 5.387668514251709,
|
|
"epoch": 2.7631978214355186,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00042344724942087564,
|
|
"loss": 4.976,
|
|
"mean_token_accuracy": 0.20233292728662491,
|
|
"num_tokens": 61620553.0,
|
|
"step": 35515
|
|
},
|
|
{
|
|
"entropy": 5.376456356048584,
|
|
"epoch": 2.763586850807236,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.000423426420820493,
|
|
"loss": 4.9631,
|
|
"mean_token_accuracy": 0.20021985620260238,
|
|
"num_tokens": 61629319.0,
|
|
"step": 35520
|
|
},
|
|
{
|
|
"entropy": 5.315109443664551,
|
|
"epoch": 2.7639758801789536,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00042340558996797564,
|
|
"loss": 4.8892,
|
|
"mean_token_accuracy": 0.20272863656282425,
|
|
"num_tokens": 61638475.0,
|
|
"step": 35525
|
|
},
|
|
{
|
|
"entropy": 5.343790054321289,
|
|
"epoch": 2.764364909550671,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00042338475686363964,
|
|
"loss": 4.9673,
|
|
"mean_token_accuracy": 0.2042631909251213,
|
|
"num_tokens": 61647345.0,
|
|
"step": 35530
|
|
},
|
|
{
|
|
"entropy": 5.456981134414673,
|
|
"epoch": 2.7647539389223885,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004233639215078012,
|
|
"loss": 5.0115,
|
|
"mean_token_accuracy": 0.19999634027481078,
|
|
"num_tokens": 61655871.0,
|
|
"step": 35535
|
|
},
|
|
{
|
|
"entropy": 5.462874126434326,
|
|
"epoch": 2.765142968294106,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00042334308390077637,
|
|
"loss": 4.995,
|
|
"mean_token_accuracy": 0.20313987880945206,
|
|
"num_tokens": 61664429.0,
|
|
"step": 35540
|
|
},
|
|
{
|
|
"entropy": 5.368949937820434,
|
|
"epoch": 2.765531997665824,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004233222440428814,
|
|
"loss": 4.915,
|
|
"mean_token_accuracy": 0.20746819972991942,
|
|
"num_tokens": 61671980.0,
|
|
"step": 35545
|
|
},
|
|
{
|
|
"entropy": 5.336424064636231,
|
|
"epoch": 2.765921027037541,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004233014019344324,
|
|
"loss": 4.8743,
|
|
"mean_token_accuracy": 0.20979664027690886,
|
|
"num_tokens": 61680140.0,
|
|
"step": 35550
|
|
},
|
|
{
|
|
"entropy": 5.329474830627442,
|
|
"epoch": 2.766310056409259,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004232805575757457,
|
|
"loss": 4.8982,
|
|
"mean_token_accuracy": 0.20394217371940612,
|
|
"num_tokens": 61688863.0,
|
|
"step": 35555
|
|
},
|
|
{
|
|
"entropy": 5.400298070907593,
|
|
"epoch": 2.7666990857809766,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004232597109671375,
|
|
"loss": 4.9682,
|
|
"mean_token_accuracy": 0.20032827705144882,
|
|
"num_tokens": 61697494.0,
|
|
"step": 35560
|
|
},
|
|
{
|
|
"entropy": 5.3413981914520265,
|
|
"epoch": 2.767088115152694,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004232388621089242,
|
|
"loss": 4.9739,
|
|
"mean_token_accuracy": 0.20093736797571182,
|
|
"num_tokens": 61706456.0,
|
|
"step": 35565
|
|
},
|
|
{
|
|
"entropy": 5.462663269042968,
|
|
"epoch": 2.7674771445244115,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00042321801100142216,
|
|
"loss": 5.0609,
|
|
"mean_token_accuracy": 0.19452243000268937,
|
|
"num_tokens": 61715123.0,
|
|
"step": 35570
|
|
},
|
|
{
|
|
"entropy": 5.415610933303833,
|
|
"epoch": 2.767866173896129,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00042319715764494765,
|
|
"loss": 4.9085,
|
|
"mean_token_accuracy": 0.19967283457517623,
|
|
"num_tokens": 61724129.0,
|
|
"step": 35575
|
|
},
|
|
{
|
|
"entropy": 5.334870862960815,
|
|
"epoch": 2.768255203267847,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00042317630203981714,
|
|
"loss": 5.0316,
|
|
"mean_token_accuracy": 0.19839723408222198,
|
|
"num_tokens": 61732646.0,
|
|
"step": 35580
|
|
},
|
|
{
|
|
"entropy": 5.416912317276001,
|
|
"epoch": 2.768644232639564,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00042315544418634714,
|
|
"loss": 4.9667,
|
|
"mean_token_accuracy": 0.19532251209020615,
|
|
"num_tokens": 61741511.0,
|
|
"step": 35585
|
|
},
|
|
{
|
|
"entropy": 5.440603446960449,
|
|
"epoch": 2.769033262011282,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00042313458408485414,
|
|
"loss": 4.9941,
|
|
"mean_token_accuracy": 0.20095448791980744,
|
|
"num_tokens": 61749703.0,
|
|
"step": 35590
|
|
},
|
|
{
|
|
"entropy": 5.373387718200684,
|
|
"epoch": 2.7694222913829996,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00042311372173565456,
|
|
"loss": 4.9182,
|
|
"mean_token_accuracy": 0.20611383020877838,
|
|
"num_tokens": 61758943.0,
|
|
"step": 35595
|
|
},
|
|
{
|
|
"entropy": 5.367106246948242,
|
|
"epoch": 2.769811320754717,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.000423092857139065,
|
|
"loss": 4.9299,
|
|
"mean_token_accuracy": 0.20111970454454423,
|
|
"num_tokens": 61767120.0,
|
|
"step": 35600
|
|
},
|
|
{
|
|
"entropy": 5.378551387786866,
|
|
"epoch": 2.7702003501264345,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.000423071990295402,
|
|
"loss": 4.9353,
|
|
"mean_token_accuracy": 0.20005976855754853,
|
|
"num_tokens": 61774760.0,
|
|
"step": 35605
|
|
},
|
|
{
|
|
"entropy": 5.325633764266968,
|
|
"epoch": 2.770589379498152,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004230511212049822,
|
|
"loss": 4.9412,
|
|
"mean_token_accuracy": 0.20574485510587692,
|
|
"num_tokens": 61783792.0,
|
|
"step": 35610
|
|
},
|
|
{
|
|
"entropy": 5.408705425262451,
|
|
"epoch": 2.77097840886987,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004230302498681224,
|
|
"loss": 5.0379,
|
|
"mean_token_accuracy": 0.1960559830069542,
|
|
"num_tokens": 61791991.0,
|
|
"step": 35615
|
|
},
|
|
{
|
|
"entropy": 5.408001852035523,
|
|
"epoch": 2.771367438241587,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004230093762851392,
|
|
"loss": 4.9452,
|
|
"mean_token_accuracy": 0.20775496810674668,
|
|
"num_tokens": 61801813.0,
|
|
"step": 35620
|
|
},
|
|
{
|
|
"entropy": 5.354648303985596,
|
|
"epoch": 2.771756467613305,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004229885004563491,
|
|
"loss": 4.8775,
|
|
"mean_token_accuracy": 0.21010547876358032,
|
|
"num_tokens": 61810140.0,
|
|
"step": 35625
|
|
},
|
|
{
|
|
"entropy": 5.2795275211334225,
|
|
"epoch": 2.772145496985022,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004229676223820692,
|
|
"loss": 4.7705,
|
|
"mean_token_accuracy": 0.21120137274265288,
|
|
"num_tokens": 61818168.0,
|
|
"step": 35630
|
|
},
|
|
{
|
|
"entropy": 5.296066045761108,
|
|
"epoch": 2.77253452635674,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00042294674206261616,
|
|
"loss": 4.9046,
|
|
"mean_token_accuracy": 0.20227013230323793,
|
|
"num_tokens": 61826640.0,
|
|
"step": 35635
|
|
},
|
|
{
|
|
"entropy": 5.284491491317749,
|
|
"epoch": 2.7729235557284575,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0004229258594983067,
|
|
"loss": 4.998,
|
|
"mean_token_accuracy": 0.20229514986276625,
|
|
"num_tokens": 61834787.0,
|
|
"step": 35640
|
|
},
|
|
{
|
|
"entropy": 5.3971727848052975,
|
|
"epoch": 2.773312585100175,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004229049746894578,
|
|
"loss": 4.9793,
|
|
"mean_token_accuracy": 0.20435227900743486,
|
|
"num_tokens": 61842847.0,
|
|
"step": 35645
|
|
},
|
|
{
|
|
"entropy": 5.533141946792602,
|
|
"epoch": 2.773701614471893,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004228840876363864,
|
|
"loss": 5.1356,
|
|
"mean_token_accuracy": 0.19535896927118301,
|
|
"num_tokens": 61851786.0,
|
|
"step": 35650
|
|
},
|
|
{
|
|
"entropy": 5.374950361251831,
|
|
"epoch": 2.77409064384361,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004228631983394093,
|
|
"loss": 4.9461,
|
|
"mean_token_accuracy": 0.21153436303138734,
|
|
"num_tokens": 61859917.0,
|
|
"step": 35655
|
|
},
|
|
{
|
|
"entropy": 5.373160791397095,
|
|
"epoch": 2.774479673215328,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004228423067988434,
|
|
"loss": 4.9572,
|
|
"mean_token_accuracy": 0.19733852446079253,
|
|
"num_tokens": 61868489.0,
|
|
"step": 35660
|
|
},
|
|
{
|
|
"entropy": 5.400880765914917,
|
|
"epoch": 2.774868702587045,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00042282141301500597,
|
|
"loss": 5.0065,
|
|
"mean_token_accuracy": 0.1996640831232071,
|
|
"num_tokens": 61876896.0,
|
|
"step": 35665
|
|
},
|
|
{
|
|
"entropy": 5.4187816143035885,
|
|
"epoch": 2.775257731958763,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004228005169882138,
|
|
"loss": 4.9951,
|
|
"mean_token_accuracy": 0.1983704686164856,
|
|
"num_tokens": 61886110.0,
|
|
"step": 35670
|
|
},
|
|
{
|
|
"entropy": 5.369893550872803,
|
|
"epoch": 2.7756467613304805,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00042277961871878413,
|
|
"loss": 4.9921,
|
|
"mean_token_accuracy": 0.19732103496789932,
|
|
"num_tokens": 61894121.0,
|
|
"step": 35675
|
|
},
|
|
{
|
|
"entropy": 5.408855962753296,
|
|
"epoch": 2.776035790702198,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004227587182070338,
|
|
"loss": 4.9535,
|
|
"mean_token_accuracy": 0.20409446805715561,
|
|
"num_tokens": 61903125.0,
|
|
"step": 35680
|
|
},
|
|
{
|
|
"entropy": 5.436468029022217,
|
|
"epoch": 2.7764248200739154,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004227378154532802,
|
|
"loss": 5.0449,
|
|
"mean_token_accuracy": 0.18957674950361253,
|
|
"num_tokens": 61912368.0,
|
|
"step": 35685
|
|
},
|
|
{
|
|
"entropy": 5.391947460174561,
|
|
"epoch": 2.776813849445633,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004227169104578404,
|
|
"loss": 4.9544,
|
|
"mean_token_accuracy": 0.20451094061136246,
|
|
"num_tokens": 61921044.0,
|
|
"step": 35690
|
|
},
|
|
{
|
|
"entropy": 5.318208074569702,
|
|
"epoch": 2.777202878817351,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00042269600322103164,
|
|
"loss": 4.9393,
|
|
"mean_token_accuracy": 0.19535464197397232,
|
|
"num_tokens": 61928706.0,
|
|
"step": 35695
|
|
},
|
|
{
|
|
"entropy": 5.346081495285034,
|
|
"epoch": 2.777591908189068,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.000422675093743171,
|
|
"loss": 4.9601,
|
|
"mean_token_accuracy": 0.19464902579784393,
|
|
"num_tokens": 61936403.0,
|
|
"step": 35700
|
|
},
|
|
{
|
|
"entropy": 5.3589637756347654,
|
|
"epoch": 2.777980937560786,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.00042265418202457603,
|
|
"loss": 4.8871,
|
|
"mean_token_accuracy": 0.20945197194814683,
|
|
"num_tokens": 61944970.0,
|
|
"step": 35705
|
|
},
|
|
{
|
|
"entropy": 5.345932960510254,
|
|
"epoch": 2.7783699669325035,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004226332680655637,
|
|
"loss": 4.9227,
|
|
"mean_token_accuracy": 0.2015525832772255,
|
|
"num_tokens": 61953305.0,
|
|
"step": 35710
|
|
},
|
|
{
|
|
"entropy": 5.346392107009888,
|
|
"epoch": 2.778758996304221,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004226123518664516,
|
|
"loss": 4.9283,
|
|
"mean_token_accuracy": 0.20176543146371842,
|
|
"num_tokens": 61961098.0,
|
|
"step": 35715
|
|
},
|
|
{
|
|
"entropy": 5.385269021987915,
|
|
"epoch": 2.7791480256759384,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004225914334275569,
|
|
"loss": 4.942,
|
|
"mean_token_accuracy": 0.19839888215065002,
|
|
"num_tokens": 61970862.0,
|
|
"step": 35720
|
|
},
|
|
{
|
|
"entropy": 5.3258466720581055,
|
|
"epoch": 2.779537055047656,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004225705127491972,
|
|
"loss": 4.8549,
|
|
"mean_token_accuracy": 0.20808338224887848,
|
|
"num_tokens": 61978967.0,
|
|
"step": 35725
|
|
},
|
|
{
|
|
"entropy": 5.381014347076416,
|
|
"epoch": 2.7799260844193734,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004225495898316899,
|
|
"loss": 4.9527,
|
|
"mean_token_accuracy": 0.20078279674053193,
|
|
"num_tokens": 61987251.0,
|
|
"step": 35730
|
|
},
|
|
{
|
|
"entropy": 5.410920238494873,
|
|
"epoch": 2.780315113791091,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00042252866467535233,
|
|
"loss": 4.983,
|
|
"mean_token_accuracy": 0.2016053557395935,
|
|
"num_tokens": 61995203.0,
|
|
"step": 35735
|
|
},
|
|
{
|
|
"entropy": 5.368065309524536,
|
|
"epoch": 2.780704143162809,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00042250773728050214,
|
|
"loss": 5.0629,
|
|
"mean_token_accuracy": 0.1950654312968254,
|
|
"num_tokens": 62004156.0,
|
|
"step": 35740
|
|
},
|
|
{
|
|
"entropy": 5.337486362457275,
|
|
"epoch": 2.7810931725345265,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004224868076474568,
|
|
"loss": 4.8767,
|
|
"mean_token_accuracy": 0.200043386220932,
|
|
"num_tokens": 62012919.0,
|
|
"step": 35745
|
|
},
|
|
{
|
|
"entropy": 5.333290004730225,
|
|
"epoch": 2.781482201906244,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00042246587577653394,
|
|
"loss": 4.9753,
|
|
"mean_token_accuracy": 0.19514933228492737,
|
|
"num_tokens": 62022622.0,
|
|
"step": 35750
|
|
},
|
|
{
|
|
"entropy": 5.404968118667602,
|
|
"epoch": 2.7818712312779614,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004224449416680511,
|
|
"loss": 5.0412,
|
|
"mean_token_accuracy": 0.1928999423980713,
|
|
"num_tokens": 62030747.0,
|
|
"step": 35755
|
|
},
|
|
{
|
|
"entropy": 5.4228067874908445,
|
|
"epoch": 2.782260260649679,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00042242400532232593,
|
|
"loss": 4.9816,
|
|
"mean_token_accuracy": 0.201634918153286,
|
|
"num_tokens": 62039722.0,
|
|
"step": 35760
|
|
},
|
|
{
|
|
"entropy": 5.349869155883789,
|
|
"epoch": 2.7826492900213964,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00042240306673967614,
|
|
"loss": 4.9653,
|
|
"mean_token_accuracy": 0.20043555796146392,
|
|
"num_tokens": 62047907.0,
|
|
"step": 35765
|
|
},
|
|
{
|
|
"entropy": 5.341720962524414,
|
|
"epoch": 2.783038319393114,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00042238212592041945,
|
|
"loss": 5.012,
|
|
"mean_token_accuracy": 0.19695937484502793,
|
|
"num_tokens": 62056917.0,
|
|
"step": 35770
|
|
},
|
|
{
|
|
"entropy": 5.358563852310181,
|
|
"epoch": 2.7834273487648318,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00042236118286487364,
|
|
"loss": 4.8936,
|
|
"mean_token_accuracy": 0.20683083385229112,
|
|
"num_tokens": 62065396.0,
|
|
"step": 35775
|
|
},
|
|
{
|
|
"entropy": 5.332380628585815,
|
|
"epoch": 2.7838163781365495,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00042234023757335633,
|
|
"loss": 4.9876,
|
|
"mean_token_accuracy": 0.19964022189378738,
|
|
"num_tokens": 62074202.0,
|
|
"step": 35780
|
|
},
|
|
{
|
|
"entropy": 5.304440307617187,
|
|
"epoch": 2.7842054075082667,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00042231929004618547,
|
|
"loss": 4.8072,
|
|
"mean_token_accuracy": 0.21160324960947036,
|
|
"num_tokens": 62082444.0,
|
|
"step": 35785
|
|
},
|
|
{
|
|
"entropy": 5.27491021156311,
|
|
"epoch": 2.7845944368799844,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004222983402836789,
|
|
"loss": 4.8236,
|
|
"mean_token_accuracy": 0.21052322834730147,
|
|
"num_tokens": 62090959.0,
|
|
"step": 35790
|
|
},
|
|
{
|
|
"entropy": 5.390896940231324,
|
|
"epoch": 2.784983466251702,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00042227738828615435,
|
|
"loss": 5.0151,
|
|
"mean_token_accuracy": 0.2026684984564781,
|
|
"num_tokens": 62099007.0,
|
|
"step": 35795
|
|
},
|
|
{
|
|
"entropy": 5.4437665939331055,
|
|
"epoch": 2.7853724956234194,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.00042225643405392993,
|
|
"loss": 4.9884,
|
|
"mean_token_accuracy": 0.20288634449243545,
|
|
"num_tokens": 62107754.0,
|
|
"step": 35800
|
|
},
|
|
{
|
|
"entropy": 5.456705379486084,
|
|
"epoch": 2.785761524995137,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00042223547758732356,
|
|
"loss": 5.0598,
|
|
"mean_token_accuracy": 0.19531172662973403,
|
|
"num_tokens": 62117183.0,
|
|
"step": 35805
|
|
},
|
|
{
|
|
"entropy": 5.403119897842407,
|
|
"epoch": 2.7861505543668548,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00042221451888665307,
|
|
"loss": 5.0096,
|
|
"mean_token_accuracy": 0.19551265835762024,
|
|
"num_tokens": 62125713.0,
|
|
"step": 35810
|
|
},
|
|
{
|
|
"entropy": 5.40948486328125,
|
|
"epoch": 2.7865395837385725,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.00042219355795223657,
|
|
"loss": 4.9553,
|
|
"mean_token_accuracy": 0.20462547540664672,
|
|
"num_tokens": 62134361.0,
|
|
"step": 35815
|
|
},
|
|
{
|
|
"entropy": 5.339956188201905,
|
|
"epoch": 2.7869286131102897,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00042217259478439216,
|
|
"loss": 4.9441,
|
|
"mean_token_accuracy": 0.2061563551425934,
|
|
"num_tokens": 62142912.0,
|
|
"step": 35820
|
|
},
|
|
{
|
|
"entropy": 5.382092142105103,
|
|
"epoch": 2.7873176424820074,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004221516293834379,
|
|
"loss": 4.9626,
|
|
"mean_token_accuracy": 0.20627699196338653,
|
|
"num_tokens": 62150873.0,
|
|
"step": 35825
|
|
},
|
|
{
|
|
"entropy": 5.368696403503418,
|
|
"epoch": 2.787706671853725,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00042213066174969177,
|
|
"loss": 5.0314,
|
|
"mean_token_accuracy": 0.18966059386730194,
|
|
"num_tokens": 62159734.0,
|
|
"step": 35830
|
|
},
|
|
{
|
|
"entropy": 5.386071395874024,
|
|
"epoch": 2.7880957012254424,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00042210969188347217,
|
|
"loss": 4.9323,
|
|
"mean_token_accuracy": 0.21106959879398346,
|
|
"num_tokens": 62168319.0,
|
|
"step": 35835
|
|
},
|
|
{
|
|
"entropy": 5.433932828903198,
|
|
"epoch": 2.78848473059716,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004220887197850971,
|
|
"loss": 4.9961,
|
|
"mean_token_accuracy": 0.19384128600358963,
|
|
"num_tokens": 62177176.0,
|
|
"step": 35840
|
|
},
|
|
{
|
|
"entropy": 5.416434049606323,
|
|
"epoch": 2.7888737599688778,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00042206774545488476,
|
|
"loss": 4.9848,
|
|
"mean_token_accuracy": 0.19898433238267899,
|
|
"num_tokens": 62185488.0,
|
|
"step": 35845
|
|
},
|
|
{
|
|
"entropy": 5.451373434066772,
|
|
"epoch": 2.7892627893405955,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004220467688931535,
|
|
"loss": 5.0387,
|
|
"mean_token_accuracy": 0.20304933190345764,
|
|
"num_tokens": 62193707.0,
|
|
"step": 35850
|
|
},
|
|
{
|
|
"entropy": 5.395894336700439,
|
|
"epoch": 2.7896518187123127,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004220257901002216,
|
|
"loss": 4.9499,
|
|
"mean_token_accuracy": 0.19926830381155014,
|
|
"num_tokens": 62201820.0,
|
|
"step": 35855
|
|
},
|
|
{
|
|
"entropy": 5.473869943618775,
|
|
"epoch": 2.7900408480840304,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0004220048090764073,
|
|
"loss": 5.0984,
|
|
"mean_token_accuracy": 0.19504852443933487,
|
|
"num_tokens": 62210239.0,
|
|
"step": 35860
|
|
},
|
|
{
|
|
"entropy": 5.44324803352356,
|
|
"epoch": 2.7904298774557477,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00042198382582202905,
|
|
"loss": 5.0189,
|
|
"mean_token_accuracy": 0.1998055800795555,
|
|
"num_tokens": 62218818.0,
|
|
"step": 35865
|
|
},
|
|
{
|
|
"entropy": 5.396937274932862,
|
|
"epoch": 2.7908189068274654,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004219628403374052,
|
|
"loss": 5.0284,
|
|
"mean_token_accuracy": 0.20015837997198105,
|
|
"num_tokens": 62227091.0,
|
|
"step": 35870
|
|
},
|
|
{
|
|
"entropy": 5.303743934631347,
|
|
"epoch": 2.791207936199183,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004219418526228541,
|
|
"loss": 4.9864,
|
|
"mean_token_accuracy": 0.19633195400238038,
|
|
"num_tokens": 62235838.0,
|
|
"step": 35875
|
|
},
|
|
{
|
|
"entropy": 5.41057939529419,
|
|
"epoch": 2.7915969655709008,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004219208626786943,
|
|
"loss": 4.9343,
|
|
"mean_token_accuracy": 0.20225551426410676,
|
|
"num_tokens": 62244081.0,
|
|
"step": 35880
|
|
},
|
|
{
|
|
"entropy": 5.37317304611206,
|
|
"epoch": 2.791985994942618,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004218998705052443,
|
|
"loss": 5.0387,
|
|
"mean_token_accuracy": 0.1921651378273964,
|
|
"num_tokens": 62253187.0,
|
|
"step": 35885
|
|
},
|
|
{
|
|
"entropy": 5.362657260894776,
|
|
"epoch": 2.7923750243143357,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00042187887610282255,
|
|
"loss": 5.0024,
|
|
"mean_token_accuracy": 0.20515951216220857,
|
|
"num_tokens": 62261004.0,
|
|
"step": 35890
|
|
},
|
|
{
|
|
"entropy": 5.431461381912231,
|
|
"epoch": 2.7927640536860534,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004218578794717476,
|
|
"loss": 4.9953,
|
|
"mean_token_accuracy": 0.20168450027704238,
|
|
"num_tokens": 62270196.0,
|
|
"step": 35895
|
|
},
|
|
{
|
|
"entropy": 5.332183885574341,
|
|
"epoch": 2.7931530830577707,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00042183688061233813,
|
|
"loss": 4.9382,
|
|
"mean_token_accuracy": 0.1985442414879799,
|
|
"num_tokens": 62278637.0,
|
|
"step": 35900
|
|
},
|
|
{
|
|
"entropy": 5.287631845474243,
|
|
"epoch": 2.7935421124294884,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00042181587952491267,
|
|
"loss": 4.923,
|
|
"mean_token_accuracy": 0.20275683850049972,
|
|
"num_tokens": 62287678.0,
|
|
"step": 35905
|
|
},
|
|
{
|
|
"entropy": 5.3567403793334964,
|
|
"epoch": 2.793931141801206,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00042179487620978997,
|
|
"loss": 4.9885,
|
|
"mean_token_accuracy": 0.20701873153448105,
|
|
"num_tokens": 62296123.0,
|
|
"step": 35910
|
|
},
|
|
{
|
|
"entropy": 5.397895336151123,
|
|
"epoch": 2.7943201711729238,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0004217738706672886,
|
|
"loss": 4.9659,
|
|
"mean_token_accuracy": 0.19987784326076508,
|
|
"num_tokens": 62304677.0,
|
|
"step": 35915
|
|
},
|
|
{
|
|
"entropy": 5.431461429595947,
|
|
"epoch": 2.794709200544641,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00042175286289772746,
|
|
"loss": 4.9787,
|
|
"mean_token_accuracy": 0.20081232488155365,
|
|
"num_tokens": 62313944.0,
|
|
"step": 35920
|
|
},
|
|
{
|
|
"entropy": 5.354380798339844,
|
|
"epoch": 2.7950982299163587,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004217318529014251,
|
|
"loss": 4.9589,
|
|
"mean_token_accuracy": 0.19173699468374253,
|
|
"num_tokens": 62323053.0,
|
|
"step": 35925
|
|
},
|
|
{
|
|
"entropy": 5.405733680725097,
|
|
"epoch": 2.7954872592880764,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004217108406787005,
|
|
"loss": 5.025,
|
|
"mean_token_accuracy": 0.19425627142190932,
|
|
"num_tokens": 62332642.0,
|
|
"step": 35930
|
|
},
|
|
{
|
|
"entropy": 5.4298171043396,
|
|
"epoch": 2.7958762886597937,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004216898262298724,
|
|
"loss": 5.0193,
|
|
"mean_token_accuracy": 0.19440154433250428,
|
|
"num_tokens": 62341700.0,
|
|
"step": 35935
|
|
},
|
|
{
|
|
"entropy": 5.435423374176025,
|
|
"epoch": 2.7962653180315113,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004216688095552596,
|
|
"loss": 4.9806,
|
|
"mean_token_accuracy": 0.19441543966531755,
|
|
"num_tokens": 62350828.0,
|
|
"step": 35940
|
|
},
|
|
{
|
|
"entropy": 5.294579601287841,
|
|
"epoch": 2.796654347403229,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004216477906551811,
|
|
"loss": 4.8847,
|
|
"mean_token_accuracy": 0.20516541749238967,
|
|
"num_tokens": 62359494.0,
|
|
"step": 35945
|
|
},
|
|
{
|
|
"entropy": 5.31225357055664,
|
|
"epoch": 2.7970433767749467,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00042162676952995585,
|
|
"loss": 4.9149,
|
|
"mean_token_accuracy": 0.20603366792201996,
|
|
"num_tokens": 62368272.0,
|
|
"step": 35950
|
|
},
|
|
{
|
|
"entropy": 5.277890729904175,
|
|
"epoch": 2.797432406146664,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00042160574617990267,
|
|
"loss": 4.9439,
|
|
"mean_token_accuracy": 0.20141870081424712,
|
|
"num_tokens": 62376937.0,
|
|
"step": 35955
|
|
},
|
|
{
|
|
"entropy": 5.409234714508057,
|
|
"epoch": 2.7978214355183817,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00042158472060534066,
|
|
"loss": 5.0232,
|
|
"mean_token_accuracy": 0.19266002327203752,
|
|
"num_tokens": 62385765.0,
|
|
"step": 35960
|
|
},
|
|
{
|
|
"entropy": 5.353356218338012,
|
|
"epoch": 2.798210464890099,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00042156369280658886,
|
|
"loss": 4.8681,
|
|
"mean_token_accuracy": 0.20790167152881622,
|
|
"num_tokens": 62393640.0,
|
|
"step": 35965
|
|
},
|
|
{
|
|
"entropy": 5.326437616348267,
|
|
"epoch": 2.7985994942618166,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004215426627839662,
|
|
"loss": 4.9028,
|
|
"mean_token_accuracy": 0.20326767712831498,
|
|
"num_tokens": 62402138.0,
|
|
"step": 35970
|
|
},
|
|
{
|
|
"entropy": 5.350489282608033,
|
|
"epoch": 2.7989885236335343,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00042152163053779196,
|
|
"loss": 5.015,
|
|
"mean_token_accuracy": 0.1896110087633133,
|
|
"num_tokens": 62410257.0,
|
|
"step": 35975
|
|
},
|
|
{
|
|
"entropy": 5.4010961055755615,
|
|
"epoch": 2.799377553005252,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004215005960683852,
|
|
"loss": 5.0177,
|
|
"mean_token_accuracy": 0.20254910439252855,
|
|
"num_tokens": 62418409.0,
|
|
"step": 35980
|
|
},
|
|
{
|
|
"entropy": 5.341051340103149,
|
|
"epoch": 2.7997665823769697,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004214795593760651,
|
|
"loss": 4.9231,
|
|
"mean_token_accuracy": 0.20879304856061937,
|
|
"num_tokens": 62426921.0,
|
|
"step": 35985
|
|
},
|
|
{
|
|
"entropy": 5.37565279006958,
|
|
"epoch": 2.800155611748687,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004214585204611508,
|
|
"loss": 5.0376,
|
|
"mean_token_accuracy": 0.1927580177783966,
|
|
"num_tokens": 62435293.0,
|
|
"step": 35990
|
|
},
|
|
{
|
|
"entropy": 5.41786561012268,
|
|
"epoch": 2.8005446411204047,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00042143747932396153,
|
|
"loss": 5.0094,
|
|
"mean_token_accuracy": 0.19439303129911423,
|
|
"num_tokens": 62443678.0,
|
|
"step": 35995
|
|
},
|
|
{
|
|
"entropy": 5.4135498046875,
|
|
"epoch": 2.800933670492122,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004214164359648166,
|
|
"loss": 5.0138,
|
|
"mean_token_accuracy": 0.19614969342947006,
|
|
"num_tokens": 62452092.0,
|
|
"step": 36000
|
|
},
|
|
{
|
|
"epoch": 2.800933670492122,
|
|
"eval_entropy": 5.242157841095911,
|
|
"eval_loss": 5.072832107543945,
|
|
"eval_mean_token_accuracy": 0.20369743779803606,
|
|
"eval_num_tokens": 62452092.0,
|
|
"eval_runtime": 28.4648,
|
|
"eval_samples_per_second": 1459.98,
|
|
"eval_steps_per_second": 182.506,
|
|
"step": 36000
|
|
},
|
|
{
|
|
"entropy": 5.496697807312012,
|
|
"epoch": 2.8013226998638396,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00042139539038403535,
|
|
"loss": 5.0364,
|
|
"mean_token_accuracy": 0.19904019236564635,
|
|
"num_tokens": 62460584.0,
|
|
"step": 36005
|
|
},
|
|
{
|
|
"entropy": 5.3883216381073,
|
|
"epoch": 2.8017117292355573,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.000421374342581937,
|
|
"loss": 5.0312,
|
|
"mean_token_accuracy": 0.19158420115709304,
|
|
"num_tokens": 62468615.0,
|
|
"step": 36010
|
|
},
|
|
{
|
|
"entropy": 5.404989433288574,
|
|
"epoch": 2.802100758607275,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00042135329255884105,
|
|
"loss": 5.1179,
|
|
"mean_token_accuracy": 0.19171320348978044,
|
|
"num_tokens": 62477630.0,
|
|
"step": 36015
|
|
},
|
|
{
|
|
"entropy": 5.367208051681518,
|
|
"epoch": 2.8024897879789923,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004213322403150668,
|
|
"loss": 4.8979,
|
|
"mean_token_accuracy": 0.20310165584087372,
|
|
"num_tokens": 62486385.0,
|
|
"step": 36020
|
|
},
|
|
{
|
|
"entropy": 5.344372510910034,
|
|
"epoch": 2.80287881735071,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004213111858509337,
|
|
"loss": 4.8285,
|
|
"mean_token_accuracy": 0.2146202802658081,
|
|
"num_tokens": 62494502.0,
|
|
"step": 36025
|
|
},
|
|
{
|
|
"entropy": 5.316223764419556,
|
|
"epoch": 2.8032678467224277,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004212901291667612,
|
|
"loss": 4.8784,
|
|
"mean_token_accuracy": 0.21158030778169631,
|
|
"num_tokens": 62503365.0,
|
|
"step": 36030
|
|
},
|
|
{
|
|
"entropy": 5.348690414428711,
|
|
"epoch": 2.803656876094145,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00042126907026286887,
|
|
"loss": 4.9606,
|
|
"mean_token_accuracy": 0.1969559222459793,
|
|
"num_tokens": 62511932.0,
|
|
"step": 36035
|
|
},
|
|
{
|
|
"entropy": 5.325362777709961,
|
|
"epoch": 2.8040459054658626,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00042124800913957624,
|
|
"loss": 4.8943,
|
|
"mean_token_accuracy": 0.20597973018884658,
|
|
"num_tokens": 62520478.0,
|
|
"step": 36040
|
|
},
|
|
{
|
|
"entropy": 5.269071292877197,
|
|
"epoch": 2.8044349348375803,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004212269457972028,
|
|
"loss": 4.8238,
|
|
"mean_token_accuracy": 0.20605671256780625,
|
|
"num_tokens": 62529514.0,
|
|
"step": 36045
|
|
},
|
|
{
|
|
"entropy": 5.405153274536133,
|
|
"epoch": 2.804823964209298,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004212058802360682,
|
|
"loss": 5.0836,
|
|
"mean_token_accuracy": 0.19601190835237503,
|
|
"num_tokens": 62538735.0,
|
|
"step": 36050
|
|
},
|
|
{
|
|
"entropy": 5.384910440444946,
|
|
"epoch": 2.8052129935810153,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004211848124564922,
|
|
"loss": 4.9606,
|
|
"mean_token_accuracy": 0.19250165075063705,
|
|
"num_tokens": 62548440.0,
|
|
"step": 36055
|
|
},
|
|
{
|
|
"entropy": 5.380704021453857,
|
|
"epoch": 2.805602022952733,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0004211637424587942,
|
|
"loss": 5.0529,
|
|
"mean_token_accuracy": 0.19883662909269334,
|
|
"num_tokens": 62556611.0,
|
|
"step": 36060
|
|
},
|
|
{
|
|
"entropy": 5.31823959350586,
|
|
"epoch": 2.8059910523244502,
|
|
"grad_norm": 1.5234375,
|
|
"learning_rate": 0.0004211426702432941,
|
|
"loss": 4.8409,
|
|
"mean_token_accuracy": 0.21831856667995453,
|
|
"num_tokens": 62565672.0,
|
|
"step": 36065
|
|
},
|
|
{
|
|
"entropy": 5.3300010681152346,
|
|
"epoch": 2.806380081696168,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004211215958103116,
|
|
"loss": 4.8759,
|
|
"mean_token_accuracy": 0.20394042432308196,
|
|
"num_tokens": 62574037.0,
|
|
"step": 36070
|
|
},
|
|
{
|
|
"entropy": 5.325292587280273,
|
|
"epoch": 2.8067691110678856,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00042110051916016645,
|
|
"loss": 4.9747,
|
|
"mean_token_accuracy": 0.20170585215091705,
|
|
"num_tokens": 62582210.0,
|
|
"step": 36075
|
|
},
|
|
{
|
|
"entropy": 5.33481183052063,
|
|
"epoch": 2.8071581404396033,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004210794402931785,
|
|
"loss": 4.9106,
|
|
"mean_token_accuracy": 0.20568906962871553,
|
|
"num_tokens": 62591442.0,
|
|
"step": 36080
|
|
},
|
|
{
|
|
"entropy": 5.382985925674438,
|
|
"epoch": 2.807547169811321,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004210583592096675,
|
|
"loss": 5.0256,
|
|
"mean_token_accuracy": 0.1973895937204361,
|
|
"num_tokens": 62599520.0,
|
|
"step": 36085
|
|
},
|
|
{
|
|
"entropy": 5.38798041343689,
|
|
"epoch": 2.8079361991830383,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004210372759099534,
|
|
"loss": 4.9608,
|
|
"mean_token_accuracy": 0.2040404498577118,
|
|
"num_tokens": 62606663.0,
|
|
"step": 36090
|
|
},
|
|
{
|
|
"entropy": 5.342358636856079,
|
|
"epoch": 2.808325228554756,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.000421016190394356,
|
|
"loss": 4.9692,
|
|
"mean_token_accuracy": 0.19702014476060867,
|
|
"num_tokens": 62615056.0,
|
|
"step": 36095
|
|
},
|
|
{
|
|
"entropy": 5.416167306900024,
|
|
"epoch": 2.8087142579264732,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00042099510266319545,
|
|
"loss": 5.0174,
|
|
"mean_token_accuracy": 0.1966432511806488,
|
|
"num_tokens": 62623627.0,
|
|
"step": 36100
|
|
},
|
|
{
|
|
"entropy": 5.433665037155151,
|
|
"epoch": 2.809103287298191,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004209740127167915,
|
|
"loss": 5.0456,
|
|
"mean_token_accuracy": 0.19751810133457184,
|
|
"num_tokens": 62632980.0,
|
|
"step": 36105
|
|
},
|
|
{
|
|
"entropy": 5.389589595794678,
|
|
"epoch": 2.8094923166699086,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004209529205554643,
|
|
"loss": 4.8443,
|
|
"mean_token_accuracy": 0.20525031089782714,
|
|
"num_tokens": 62641259.0,
|
|
"step": 36110
|
|
},
|
|
{
|
|
"entropy": 5.3763734817504885,
|
|
"epoch": 2.8098813460416263,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004209318261795339,
|
|
"loss": 5.0505,
|
|
"mean_token_accuracy": 0.19455087333917617,
|
|
"num_tokens": 62649540.0,
|
|
"step": 36115
|
|
},
|
|
{
|
|
"entropy": 5.389378452301026,
|
|
"epoch": 2.8102703754133436,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004209107295893202,
|
|
"loss": 4.9663,
|
|
"mean_token_accuracy": 0.20133348554372787,
|
|
"num_tokens": 62657496.0,
|
|
"step": 36120
|
|
},
|
|
{
|
|
"entropy": 5.3157624244689945,
|
|
"epoch": 2.8106594047850613,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00042088963078514344,
|
|
"loss": 4.8625,
|
|
"mean_token_accuracy": 0.2132271096110344,
|
|
"num_tokens": 62665800.0,
|
|
"step": 36125
|
|
},
|
|
{
|
|
"entropy": 5.435967016220093,
|
|
"epoch": 2.811048434156779,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004208685297673238,
|
|
"loss": 5.0693,
|
|
"mean_token_accuracy": 0.19239041805267335,
|
|
"num_tokens": 62675061.0,
|
|
"step": 36130
|
|
},
|
|
{
|
|
"entropy": 5.293759965896607,
|
|
"epoch": 2.811437463528496,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004208474265361813,
|
|
"loss": 4.8091,
|
|
"mean_token_accuracy": 0.21316652595996857,
|
|
"num_tokens": 62683889.0,
|
|
"step": 36135
|
|
},
|
|
{
|
|
"entropy": 5.283986759185791,
|
|
"epoch": 2.811826492900214,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00042082632109203627,
|
|
"loss": 4.909,
|
|
"mean_token_accuracy": 0.20220324397087097,
|
|
"num_tokens": 62692711.0,
|
|
"step": 36140
|
|
},
|
|
{
|
|
"entropy": 5.389346790313721,
|
|
"epoch": 2.8122155222719316,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.000420805213435209,
|
|
"loss": 4.9522,
|
|
"mean_token_accuracy": 0.2059206560254097,
|
|
"num_tokens": 62701048.0,
|
|
"step": 36145
|
|
},
|
|
{
|
|
"entropy": 5.448433542251587,
|
|
"epoch": 2.8126045516436493,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004207841035660196,
|
|
"loss": 5.0408,
|
|
"mean_token_accuracy": 0.1933677986264229,
|
|
"num_tokens": 62710440.0,
|
|
"step": 36150
|
|
},
|
|
{
|
|
"entropy": 5.42046160697937,
|
|
"epoch": 2.8129935810153666,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004207629914847885,
|
|
"loss": 5.0149,
|
|
"mean_token_accuracy": 0.19544921964406967,
|
|
"num_tokens": 62719853.0,
|
|
"step": 36155
|
|
},
|
|
{
|
|
"entropy": 5.3226179599761965,
|
|
"epoch": 2.8133826103870843,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.000420741877191836,
|
|
"loss": 5.0057,
|
|
"mean_token_accuracy": 0.19301511496305465,
|
|
"num_tokens": 62729784.0,
|
|
"step": 36160
|
|
},
|
|
{
|
|
"entropy": 5.393991994857788,
|
|
"epoch": 2.8137716397588015,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004207207606874825,
|
|
"loss": 4.9231,
|
|
"mean_token_accuracy": 0.2092340350151062,
|
|
"num_tokens": 62738414.0,
|
|
"step": 36165
|
|
},
|
|
{
|
|
"entropy": 5.374071884155273,
|
|
"epoch": 2.814160669130519,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004206996419720484,
|
|
"loss": 4.8982,
|
|
"mean_token_accuracy": 0.2062147945165634,
|
|
"num_tokens": 62746878.0,
|
|
"step": 36170
|
|
},
|
|
{
|
|
"entropy": 5.405999851226807,
|
|
"epoch": 2.814549698502237,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004206785210458541,
|
|
"loss": 5.0265,
|
|
"mean_token_accuracy": 0.19150407165288924,
|
|
"num_tokens": 62756060.0,
|
|
"step": 36175
|
|
},
|
|
{
|
|
"entropy": 5.391122961044312,
|
|
"epoch": 2.8149387278739546,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004206573979092202,
|
|
"loss": 4.9174,
|
|
"mean_token_accuracy": 0.20795087665319442,
|
|
"num_tokens": 62764864.0,
|
|
"step": 36180
|
|
},
|
|
{
|
|
"entropy": 5.355766344070434,
|
|
"epoch": 2.8153277572456723,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00042063627256246706,
|
|
"loss": 4.8736,
|
|
"mean_token_accuracy": 0.20389473885297776,
|
|
"num_tokens": 62772920.0,
|
|
"step": 36185
|
|
},
|
|
{
|
|
"entropy": 5.274503755569458,
|
|
"epoch": 2.8157167866173896,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004206151450059153,
|
|
"loss": 4.8488,
|
|
"mean_token_accuracy": 0.21296661347150803,
|
|
"num_tokens": 62781099.0,
|
|
"step": 36190
|
|
},
|
|
{
|
|
"entropy": 5.457506227493286,
|
|
"epoch": 2.8161058159891073,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00042059401523988546,
|
|
"loss": 5.064,
|
|
"mean_token_accuracy": 0.18596413284540175,
|
|
"num_tokens": 62789656.0,
|
|
"step": 36195
|
|
},
|
|
{
|
|
"entropy": 5.400265789031982,
|
|
"epoch": 2.8164948453608245,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004205728832646982,
|
|
"loss": 5.0507,
|
|
"mean_token_accuracy": 0.19939118176698684,
|
|
"num_tokens": 62798402.0,
|
|
"step": 36200
|
|
},
|
|
{
|
|
"entropy": 5.363863849639893,
|
|
"epoch": 2.816883874732542,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00042055174908067414,
|
|
"loss": 4.9809,
|
|
"mean_token_accuracy": 0.20128044039011,
|
|
"num_tokens": 62807260.0,
|
|
"step": 36205
|
|
},
|
|
{
|
|
"entropy": 5.341031932830811,
|
|
"epoch": 2.81727290410426,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00042053061268813397,
|
|
"loss": 4.8372,
|
|
"mean_token_accuracy": 0.2058132842183113,
|
|
"num_tokens": 62816240.0,
|
|
"step": 36210
|
|
},
|
|
{
|
|
"entropy": 5.3960240364074705,
|
|
"epoch": 2.8176619334759776,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00042050947408739836,
|
|
"loss": 4.9405,
|
|
"mean_token_accuracy": 0.2010473757982254,
|
|
"num_tokens": 62824630.0,
|
|
"step": 36215
|
|
},
|
|
{
|
|
"entropy": 5.3254822254180905,
|
|
"epoch": 2.818050962847695,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0004204883332787881,
|
|
"loss": 5.0618,
|
|
"mean_token_accuracy": 0.20548894107341767,
|
|
"num_tokens": 62833193.0,
|
|
"step": 36220
|
|
},
|
|
{
|
|
"entropy": 5.31356291770935,
|
|
"epoch": 2.8184399922194125,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00042046719026262396,
|
|
"loss": 4.8894,
|
|
"mean_token_accuracy": 0.21217816770076753,
|
|
"num_tokens": 62841424.0,
|
|
"step": 36225
|
|
},
|
|
{
|
|
"entropy": 5.41585111618042,
|
|
"epoch": 2.8188290215911302,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00042044604503922674,
|
|
"loss": 4.9363,
|
|
"mean_token_accuracy": 0.1983306348323822,
|
|
"num_tokens": 62849388.0,
|
|
"step": 36230
|
|
},
|
|
{
|
|
"entropy": 5.338037204742432,
|
|
"epoch": 2.8192180509628475,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004204248976089173,
|
|
"loss": 4.8866,
|
|
"mean_token_accuracy": 0.20652048140764237,
|
|
"num_tokens": 62857859.0,
|
|
"step": 36235
|
|
},
|
|
{
|
|
"entropy": 5.328308868408203,
|
|
"epoch": 2.819607080334565,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004204037479720165,
|
|
"loss": 4.9056,
|
|
"mean_token_accuracy": 0.20538002103567124,
|
|
"num_tokens": 62866558.0,
|
|
"step": 36240
|
|
},
|
|
{
|
|
"entropy": 5.277690982818603,
|
|
"epoch": 2.819996109706283,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00042038259612884514,
|
|
"loss": 4.8276,
|
|
"mean_token_accuracy": 0.2052981361746788,
|
|
"num_tokens": 62875663.0,
|
|
"step": 36245
|
|
},
|
|
{
|
|
"entropy": 5.3378981590271,
|
|
"epoch": 2.8203851390780006,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00042036144207972445,
|
|
"loss": 4.9197,
|
|
"mean_token_accuracy": 0.20683815330266953,
|
|
"num_tokens": 62884581.0,
|
|
"step": 36250
|
|
},
|
|
{
|
|
"entropy": 5.3449948787689205,
|
|
"epoch": 2.820774168449718,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004203402858249752,
|
|
"loss": 4.948,
|
|
"mean_token_accuracy": 0.20225100368261337,
|
|
"num_tokens": 62892710.0,
|
|
"step": 36255
|
|
},
|
|
{
|
|
"entropy": 5.332772445678711,
|
|
"epoch": 2.8211631978214355,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004203191273649184,
|
|
"loss": 4.9154,
|
|
"mean_token_accuracy": 0.20894486904144288,
|
|
"num_tokens": 62901933.0,
|
|
"step": 36260
|
|
},
|
|
{
|
|
"entropy": 5.369071435928345,
|
|
"epoch": 2.8215522271931532,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00042029796669987513,
|
|
"loss": 4.9155,
|
|
"mean_token_accuracy": 0.19685767441987992,
|
|
"num_tokens": 62910155.0,
|
|
"step": 36265
|
|
},
|
|
{
|
|
"entropy": 5.372627067565918,
|
|
"epoch": 2.8219412565648705,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004202768038301665,
|
|
"loss": 4.9867,
|
|
"mean_token_accuracy": 0.18932642340660094,
|
|
"num_tokens": 62919645.0,
|
|
"step": 36270
|
|
},
|
|
{
|
|
"entropy": 5.499980783462524,
|
|
"epoch": 2.822330285936588,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.00042025563875611367,
|
|
"loss": 5.0542,
|
|
"mean_token_accuracy": 0.1899677485227585,
|
|
"num_tokens": 62928824.0,
|
|
"step": 36275
|
|
},
|
|
{
|
|
"entropy": 5.345960712432861,
|
|
"epoch": 2.822719315308306,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004202344714780376,
|
|
"loss": 4.8816,
|
|
"mean_token_accuracy": 0.21019442677497863,
|
|
"num_tokens": 62936497.0,
|
|
"step": 36280
|
|
},
|
|
{
|
|
"entropy": 5.303362226486206,
|
|
"epoch": 2.8231083446800236,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00042021330199625966,
|
|
"loss": 4.9828,
|
|
"mean_token_accuracy": 0.19979316741228104,
|
|
"num_tokens": 62944245.0,
|
|
"step": 36285
|
|
},
|
|
{
|
|
"entropy": 5.327833223342895,
|
|
"epoch": 2.823497374051741,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00042019213031110105,
|
|
"loss": 4.998,
|
|
"mean_token_accuracy": 0.20076138973236085,
|
|
"num_tokens": 62952980.0,
|
|
"step": 36290
|
|
},
|
|
{
|
|
"entropy": 5.433194160461426,
|
|
"epoch": 2.8238864034234585,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004201709564228829,
|
|
"loss": 5.002,
|
|
"mean_token_accuracy": 0.2008898824453354,
|
|
"num_tokens": 62962082.0,
|
|
"step": 36295
|
|
},
|
|
{
|
|
"entropy": 5.4257337093353275,
|
|
"epoch": 2.824275432795176,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00042014978033192655,
|
|
"loss": 5.0736,
|
|
"mean_token_accuracy": 0.19556913375854493,
|
|
"num_tokens": 62971033.0,
|
|
"step": 36300
|
|
},
|
|
{
|
|
"entropy": 5.462235689163208,
|
|
"epoch": 2.8246644621668935,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00042012860203855337,
|
|
"loss": 4.972,
|
|
"mean_token_accuracy": 0.1959919810295105,
|
|
"num_tokens": 62979646.0,
|
|
"step": 36305
|
|
},
|
|
{
|
|
"entropy": 5.324029731750488,
|
|
"epoch": 2.825053491538611,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00042010742154308453,
|
|
"loss": 4.9748,
|
|
"mean_token_accuracy": 0.1997225433588028,
|
|
"num_tokens": 62988690.0,
|
|
"step": 36310
|
|
},
|
|
{
|
|
"entropy": 5.405141687393188,
|
|
"epoch": 2.825442520910329,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00042008623884584167,
|
|
"loss": 5.0008,
|
|
"mean_token_accuracy": 0.19777657687664033,
|
|
"num_tokens": 62997186.0,
|
|
"step": 36315
|
|
},
|
|
{
|
|
"entropy": 5.315159511566162,
|
|
"epoch": 2.825831550282046,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00042006505394714597,
|
|
"loss": 4.873,
|
|
"mean_token_accuracy": 0.20464374274015426,
|
|
"num_tokens": 63006449.0,
|
|
"step": 36320
|
|
},
|
|
{
|
|
"entropy": 5.295733785629272,
|
|
"epoch": 2.826220579653764,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.00042004386684731896,
|
|
"loss": 4.9023,
|
|
"mean_token_accuracy": 0.20723885148763657,
|
|
"num_tokens": 63015862.0,
|
|
"step": 36325
|
|
},
|
|
{
|
|
"entropy": 5.341760492324829,
|
|
"epoch": 2.8266096090254815,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.00042002267754668216,
|
|
"loss": 4.9824,
|
|
"mean_token_accuracy": 0.20097555518150328,
|
|
"num_tokens": 63024919.0,
|
|
"step": 36330
|
|
},
|
|
{
|
|
"entropy": 5.38703031539917,
|
|
"epoch": 2.826998638397199,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.000420001486045557,
|
|
"loss": 4.9366,
|
|
"mean_token_accuracy": 0.20237749218940734,
|
|
"num_tokens": 63033513.0,
|
|
"step": 36335
|
|
},
|
|
{
|
|
"entropy": 5.381186008453369,
|
|
"epoch": 2.8273876677689165,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004199802923442652,
|
|
"loss": 5.1449,
|
|
"mean_token_accuracy": 0.19312918037176133,
|
|
"num_tokens": 63043094.0,
|
|
"step": 36340
|
|
},
|
|
{
|
|
"entropy": 5.309092426300049,
|
|
"epoch": 2.827776697140634,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004199590964431282,
|
|
"loss": 4.8342,
|
|
"mean_token_accuracy": 0.21462522596120834,
|
|
"num_tokens": 63050714.0,
|
|
"step": 36345
|
|
},
|
|
{
|
|
"entropy": 5.349132966995239,
|
|
"epoch": 2.828165726512352,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0004199378983424676,
|
|
"loss": 4.9312,
|
|
"mean_token_accuracy": 0.19960952699184417,
|
|
"num_tokens": 63059381.0,
|
|
"step": 36350
|
|
},
|
|
{
|
|
"entropy": 5.348543977737426,
|
|
"epoch": 2.828554755884069,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00041991669804260505,
|
|
"loss": 4.977,
|
|
"mean_token_accuracy": 0.1991954565048218,
|
|
"num_tokens": 63067597.0,
|
|
"step": 36355
|
|
},
|
|
{
|
|
"entropy": 5.281967878341675,
|
|
"epoch": 2.828943785255787,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004198954955438623,
|
|
"loss": 4.8083,
|
|
"mean_token_accuracy": 0.21379784494638443,
|
|
"num_tokens": 63075680.0,
|
|
"step": 36360
|
|
},
|
|
{
|
|
"entropy": 5.321336698532105,
|
|
"epoch": 2.8293328146275045,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.000419874290846561,
|
|
"loss": 5.0145,
|
|
"mean_token_accuracy": 0.200300632417202,
|
|
"num_tokens": 63084067.0,
|
|
"step": 36365
|
|
},
|
|
{
|
|
"entropy": 5.405312633514404,
|
|
"epoch": 2.8297218439992218,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00041985308395102303,
|
|
"loss": 4.992,
|
|
"mean_token_accuracy": 0.19831511229276658,
|
|
"num_tokens": 63093694.0,
|
|
"step": 36370
|
|
},
|
|
{
|
|
"entropy": 5.395055103302002,
|
|
"epoch": 2.8301108733709395,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00041983187485756997,
|
|
"loss": 4.8561,
|
|
"mean_token_accuracy": 0.210378934442997,
|
|
"num_tokens": 63102496.0,
|
|
"step": 36375
|
|
},
|
|
{
|
|
"entropy": 5.408418083190918,
|
|
"epoch": 2.830499902742657,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00041981066356652373,
|
|
"loss": 5.0118,
|
|
"mean_token_accuracy": 0.1994267612695694,
|
|
"num_tokens": 63111246.0,
|
|
"step": 36380
|
|
},
|
|
{
|
|
"entropy": 5.384354829788208,
|
|
"epoch": 2.830888932114375,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00041978945007820626,
|
|
"loss": 4.9599,
|
|
"mean_token_accuracy": 0.2086955189704895,
|
|
"num_tokens": 63119953.0,
|
|
"step": 36385
|
|
},
|
|
{
|
|
"entropy": 5.433270835876465,
|
|
"epoch": 2.831277961486092,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00041976823439293925,
|
|
"loss": 5.0581,
|
|
"mean_token_accuracy": 0.1994537368416786,
|
|
"num_tokens": 63128904.0,
|
|
"step": 36390
|
|
},
|
|
{
|
|
"entropy": 5.394209527969361,
|
|
"epoch": 2.83166699085781,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004197470165110447,
|
|
"loss": 4.9959,
|
|
"mean_token_accuracy": 0.19778508096933364,
|
|
"num_tokens": 63137049.0,
|
|
"step": 36395
|
|
},
|
|
{
|
|
"entropy": 5.299397325515747,
|
|
"epoch": 2.832056020229527,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004197257964328446,
|
|
"loss": 4.9488,
|
|
"mean_token_accuracy": 0.20084109902381897,
|
|
"num_tokens": 63145772.0,
|
|
"step": 36400
|
|
},
|
|
{
|
|
"entropy": 5.364439392089844,
|
|
"epoch": 2.8324450496012448,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004197045741586609,
|
|
"loss": 4.9906,
|
|
"mean_token_accuracy": 0.19804690331220626,
|
|
"num_tokens": 63154913.0,
|
|
"step": 36405
|
|
},
|
|
{
|
|
"entropy": 5.323664331436158,
|
|
"epoch": 2.8328340789729625,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004196833496888156,
|
|
"loss": 4.9398,
|
|
"mean_token_accuracy": 0.20362005084753038,
|
|
"num_tokens": 63163671.0,
|
|
"step": 36410
|
|
},
|
|
{
|
|
"entropy": 5.357585763931274,
|
|
"epoch": 2.83322310834468,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004196621230236308,
|
|
"loss": 5.012,
|
|
"mean_token_accuracy": 0.19546100199222566,
|
|
"num_tokens": 63172276.0,
|
|
"step": 36415
|
|
},
|
|
{
|
|
"entropy": 5.4623754024505615,
|
|
"epoch": 2.833612137716398,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00041964089416342845,
|
|
"loss": 5.0531,
|
|
"mean_token_accuracy": 0.19725640267133712,
|
|
"num_tokens": 63180987.0,
|
|
"step": 36420
|
|
},
|
|
{
|
|
"entropy": 5.435922765731812,
|
|
"epoch": 2.834001167088115,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004196196631085308,
|
|
"loss": 4.974,
|
|
"mean_token_accuracy": 0.20923116505146028,
|
|
"num_tokens": 63189668.0,
|
|
"step": 36425
|
|
},
|
|
{
|
|
"entropy": 5.3322512149810795,
|
|
"epoch": 2.834390196459833,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00041959842985925987,
|
|
"loss": 4.9005,
|
|
"mean_token_accuracy": 0.20383508503437042,
|
|
"num_tokens": 63198757.0,
|
|
"step": 36430
|
|
},
|
|
{
|
|
"entropy": 5.380774879455567,
|
|
"epoch": 2.83477922583155,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.000419577194415938,
|
|
"loss": 5.0011,
|
|
"mean_token_accuracy": 0.1961287572979927,
|
|
"num_tokens": 63207695.0,
|
|
"step": 36435
|
|
},
|
|
{
|
|
"entropy": 5.424510335922241,
|
|
"epoch": 2.8351682552032678,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00041955595677888735,
|
|
"loss": 5.0684,
|
|
"mean_token_accuracy": 0.20011100471019744,
|
|
"num_tokens": 63216789.0,
|
|
"step": 36440
|
|
},
|
|
{
|
|
"entropy": 5.35416464805603,
|
|
"epoch": 2.8355572845749855,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004195347169484301,
|
|
"loss": 4.9065,
|
|
"mean_token_accuracy": 0.2031462997198105,
|
|
"num_tokens": 63225359.0,
|
|
"step": 36445
|
|
},
|
|
{
|
|
"entropy": 5.432998132705689,
|
|
"epoch": 2.835946313946703,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0004195134749248886,
|
|
"loss": 5.092,
|
|
"mean_token_accuracy": 0.1896144613623619,
|
|
"num_tokens": 63234405.0,
|
|
"step": 36450
|
|
},
|
|
{
|
|
"entropy": 5.383672666549683,
|
|
"epoch": 2.8363353433184204,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004194922307085851,
|
|
"loss": 4.9191,
|
|
"mean_token_accuracy": 0.21182100772857665,
|
|
"num_tokens": 63243558.0,
|
|
"step": 36455
|
|
},
|
|
{
|
|
"entropy": 5.386033964157105,
|
|
"epoch": 2.836724372690138,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004194709842998419,
|
|
"loss": 4.9423,
|
|
"mean_token_accuracy": 0.2044267013669014,
|
|
"num_tokens": 63251997.0,
|
|
"step": 36460
|
|
},
|
|
{
|
|
"entropy": 5.344236707687378,
|
|
"epoch": 2.837113402061856,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00041944973569898157,
|
|
"loss": 4.8906,
|
|
"mean_token_accuracy": 0.21019524931907654,
|
|
"num_tokens": 63260439.0,
|
|
"step": 36465
|
|
},
|
|
{
|
|
"entropy": 5.356781482696533,
|
|
"epoch": 2.837502431433573,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004194284849063265,
|
|
"loss": 4.8964,
|
|
"mean_token_accuracy": 0.2081655889749527,
|
|
"num_tokens": 63268613.0,
|
|
"step": 36470
|
|
},
|
|
{
|
|
"entropy": 5.395363998413086,
|
|
"epoch": 2.8378914608052908,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004194072319221989,
|
|
"loss": 4.9785,
|
|
"mean_token_accuracy": 0.19652318805456162,
|
|
"num_tokens": 63277255.0,
|
|
"step": 36475
|
|
},
|
|
{
|
|
"entropy": 5.352589416503906,
|
|
"epoch": 2.8382804901770085,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004193859767469214,
|
|
"loss": 4.97,
|
|
"mean_token_accuracy": 0.204716856777668,
|
|
"num_tokens": 63285596.0,
|
|
"step": 36480
|
|
},
|
|
{
|
|
"entropy": 5.340853834152222,
|
|
"epoch": 2.838669519548726,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00041936471938081667,
|
|
"loss": 4.8867,
|
|
"mean_token_accuracy": 0.2045819118618965,
|
|
"num_tokens": 63293752.0,
|
|
"step": 36485
|
|
},
|
|
{
|
|
"entropy": 5.391874170303344,
|
|
"epoch": 2.8390585489204434,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00041934345982420695,
|
|
"loss": 4.9603,
|
|
"mean_token_accuracy": 0.19740456342697144,
|
|
"num_tokens": 63302766.0,
|
|
"step": 36490
|
|
},
|
|
{
|
|
"entropy": 5.403186988830567,
|
|
"epoch": 2.839447578292161,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.000419322198077415,
|
|
"loss": 4.9709,
|
|
"mean_token_accuracy": 0.19703096598386766,
|
|
"num_tokens": 63311166.0,
|
|
"step": 36495
|
|
},
|
|
{
|
|
"entropy": 5.385082244873047,
|
|
"epoch": 2.8398366076638784,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00041930093414076344,
|
|
"loss": 4.9496,
|
|
"mean_token_accuracy": 0.2042883813381195,
|
|
"num_tokens": 63319355.0,
|
|
"step": 36500
|
|
},
|
|
{
|
|
"entropy": 5.37895393371582,
|
|
"epoch": 2.840225637035596,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00041927966801457486,
|
|
"loss": 5.0189,
|
|
"mean_token_accuracy": 0.1918247252702713,
|
|
"num_tokens": 63328548.0,
|
|
"step": 36505
|
|
},
|
|
{
|
|
"entropy": 5.425289964675903,
|
|
"epoch": 2.8406146664073137,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.000419258399699172,
|
|
"loss": 5.0382,
|
|
"mean_token_accuracy": 0.1940491035580635,
|
|
"num_tokens": 63337743.0,
|
|
"step": 36510
|
|
},
|
|
{
|
|
"entropy": 5.4288877010345455,
|
|
"epoch": 2.8410036957790314,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004192371291948775,
|
|
"loss": 4.9188,
|
|
"mean_token_accuracy": 0.20229528248310089,
|
|
"num_tokens": 63346064.0,
|
|
"step": 36515
|
|
},
|
|
{
|
|
"entropy": 5.364779138565064,
|
|
"epoch": 2.841392725150749,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00041921585650201413,
|
|
"loss": 4.9189,
|
|
"mean_token_accuracy": 0.20063506960868835,
|
|
"num_tokens": 63354957.0,
|
|
"step": 36520
|
|
},
|
|
{
|
|
"entropy": 5.313026189804077,
|
|
"epoch": 2.8417817545224664,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004191945816209047,
|
|
"loss": 4.9281,
|
|
"mean_token_accuracy": 0.19714562594890594,
|
|
"num_tokens": 63363918.0,
|
|
"step": 36525
|
|
},
|
|
{
|
|
"entropy": 5.408584117889404,
|
|
"epoch": 2.842170783894184,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00041917330455187195,
|
|
"loss": 5.0166,
|
|
"mean_token_accuracy": 0.1956108495593071,
|
|
"num_tokens": 63372540.0,
|
|
"step": 36530
|
|
},
|
|
{
|
|
"entropy": 5.51461443901062,
|
|
"epoch": 2.8425598132659013,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00041915202529523894,
|
|
"loss": 5.0626,
|
|
"mean_token_accuracy": 0.19178158193826675,
|
|
"num_tokens": 63381215.0,
|
|
"step": 36535
|
|
},
|
|
{
|
|
"entropy": 5.365229940414428,
|
|
"epoch": 2.842948842637619,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004191307438513283,
|
|
"loss": 4.944,
|
|
"mean_token_accuracy": 0.20474245697259902,
|
|
"num_tokens": 63390738.0,
|
|
"step": 36540
|
|
},
|
|
{
|
|
"entropy": 5.385931158065796,
|
|
"epoch": 2.8433378720093367,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.000419109460220463,
|
|
"loss": 5.046,
|
|
"mean_token_accuracy": 0.19268206506967545,
|
|
"num_tokens": 63398836.0,
|
|
"step": 36545
|
|
},
|
|
{
|
|
"entropy": 5.371402406692505,
|
|
"epoch": 2.8437269013810544,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00041908817440296605,
|
|
"loss": 4.8815,
|
|
"mean_token_accuracy": 0.2026103064417839,
|
|
"num_tokens": 63407211.0,
|
|
"step": 36550
|
|
},
|
|
{
|
|
"entropy": 5.37645206451416,
|
|
"epoch": 2.8441159307527717,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00041906688639916035,
|
|
"loss": 4.998,
|
|
"mean_token_accuracy": 0.19659543186426162,
|
|
"num_tokens": 63415415.0,
|
|
"step": 36555
|
|
},
|
|
{
|
|
"entropy": 5.2360570430755615,
|
|
"epoch": 2.8445049601244894,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004190455962093689,
|
|
"loss": 4.8027,
|
|
"mean_token_accuracy": 0.21116988062858583,
|
|
"num_tokens": 63422907.0,
|
|
"step": 36560
|
|
},
|
|
{
|
|
"entropy": 5.283784580230713,
|
|
"epoch": 2.844893989496207,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00041902430383391494,
|
|
"loss": 4.8602,
|
|
"mean_token_accuracy": 0.20309886187314988,
|
|
"num_tokens": 63431348.0,
|
|
"step": 36565
|
|
},
|
|
{
|
|
"entropy": 5.396503925323486,
|
|
"epoch": 2.8452830188679243,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004190030092731214,
|
|
"loss": 4.9539,
|
|
"mean_token_accuracy": 0.20607977658510207,
|
|
"num_tokens": 63440189.0,
|
|
"step": 36570
|
|
},
|
|
{
|
|
"entropy": 5.371004915237426,
|
|
"epoch": 2.845672048239642,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004189817125273113,
|
|
"loss": 5.0381,
|
|
"mean_token_accuracy": 0.1977330908179283,
|
|
"num_tokens": 63449082.0,
|
|
"step": 36575
|
|
},
|
|
{
|
|
"entropy": 5.395055866241455,
|
|
"epoch": 2.8460610776113597,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00041896041359680797,
|
|
"loss": 4.9995,
|
|
"mean_token_accuracy": 0.19630941301584243,
|
|
"num_tokens": 63458204.0,
|
|
"step": 36580
|
|
},
|
|
{
|
|
"entropy": 5.381702995300293,
|
|
"epoch": 2.8464501069830774,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00041893911248193437,
|
|
"loss": 4.8829,
|
|
"mean_token_accuracy": 0.20658014714717865,
|
|
"num_tokens": 63466623.0,
|
|
"step": 36585
|
|
},
|
|
{
|
|
"entropy": 5.3220518112182615,
|
|
"epoch": 2.8468391363547947,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.000418917809183014,
|
|
"loss": 4.9644,
|
|
"mean_token_accuracy": 0.20216426402330398,
|
|
"num_tokens": 63475903.0,
|
|
"step": 36590
|
|
},
|
|
{
|
|
"entropy": 5.390537881851197,
|
|
"epoch": 2.8472281657265124,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00041889650370036986,
|
|
"loss": 4.9915,
|
|
"mean_token_accuracy": 0.19922919273376466,
|
|
"num_tokens": 63484413.0,
|
|
"step": 36595
|
|
},
|
|
{
|
|
"entropy": 5.3438502788543705,
|
|
"epoch": 2.84761719509823,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004188751960343253,
|
|
"loss": 4.9751,
|
|
"mean_token_accuracy": 0.1981559693813324,
|
|
"num_tokens": 63494059.0,
|
|
"step": 36600
|
|
},
|
|
{
|
|
"entropy": 5.336892795562744,
|
|
"epoch": 2.8480062244699473,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004188538861852037,
|
|
"loss": 4.8638,
|
|
"mean_token_accuracy": 0.202815642952919,
|
|
"num_tokens": 63502673.0,
|
|
"step": 36605
|
|
},
|
|
{
|
|
"entropy": 5.384774303436279,
|
|
"epoch": 2.848395253841665,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004188325741533283,
|
|
"loss": 4.9595,
|
|
"mean_token_accuracy": 0.20292356759309768,
|
|
"num_tokens": 63511006.0,
|
|
"step": 36610
|
|
},
|
|
{
|
|
"entropy": 5.3831274032592775,
|
|
"epoch": 2.8487842832133827,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004188112599390225,
|
|
"loss": 4.9974,
|
|
"mean_token_accuracy": 0.20599197447299958,
|
|
"num_tokens": 63519381.0,
|
|
"step": 36615
|
|
},
|
|
{
|
|
"entropy": 5.342766809463501,
|
|
"epoch": 2.8491733125851004,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004187899435426098,
|
|
"loss": 4.9521,
|
|
"mean_token_accuracy": 0.20446196049451829,
|
|
"num_tokens": 63528111.0,
|
|
"step": 36620
|
|
},
|
|
{
|
|
"entropy": 5.382662963867188,
|
|
"epoch": 2.8495623419568177,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00041876862496441347,
|
|
"loss": 4.9329,
|
|
"mean_token_accuracy": 0.20565242320299149,
|
|
"num_tokens": 63537028.0,
|
|
"step": 36625
|
|
},
|
|
{
|
|
"entropy": 5.369632625579834,
|
|
"epoch": 2.8499513713285354,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00041874730420475716,
|
|
"loss": 4.8973,
|
|
"mean_token_accuracy": 0.19838838279247284,
|
|
"num_tokens": 63545666.0,
|
|
"step": 36630
|
|
},
|
|
{
|
|
"entropy": 5.294160175323486,
|
|
"epoch": 2.8503404007002526,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00041872598126396434,
|
|
"loss": 4.9323,
|
|
"mean_token_accuracy": 0.20309770554304124,
|
|
"num_tokens": 63554122.0,
|
|
"step": 36635
|
|
},
|
|
{
|
|
"entropy": 5.368007040023803,
|
|
"epoch": 2.8507294300719703,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00041870465614235843,
|
|
"loss": 4.9514,
|
|
"mean_token_accuracy": 0.20323843955993653,
|
|
"num_tokens": 63563108.0,
|
|
"step": 36640
|
|
},
|
|
{
|
|
"entropy": 5.396540021896362,
|
|
"epoch": 2.851118459443688,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.00041868332884026317,
|
|
"loss": 4.9753,
|
|
"mean_token_accuracy": 0.19610431641340256,
|
|
"num_tokens": 63572854.0,
|
|
"step": 36645
|
|
},
|
|
{
|
|
"entropy": 5.40368423461914,
|
|
"epoch": 2.8515074888154057,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0004186619993580021,
|
|
"loss": 4.9726,
|
|
"mean_token_accuracy": 0.1962792843580246,
|
|
"num_tokens": 63580900.0,
|
|
"step": 36650
|
|
},
|
|
{
|
|
"entropy": 5.331592178344726,
|
|
"epoch": 2.851896518187123,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00041864066769589875,
|
|
"loss": 4.878,
|
|
"mean_token_accuracy": 0.20724220275878907,
|
|
"num_tokens": 63590093.0,
|
|
"step": 36655
|
|
},
|
|
{
|
|
"entropy": 5.33964171409607,
|
|
"epoch": 2.8522855475588407,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00041861933385427697,
|
|
"loss": 5.0331,
|
|
"mean_token_accuracy": 0.2010623410344124,
|
|
"num_tokens": 63599519.0,
|
|
"step": 36660
|
|
},
|
|
{
|
|
"entropy": 5.345333909988403,
|
|
"epoch": 2.8526745769305584,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0004185979978334604,
|
|
"loss": 5.0186,
|
|
"mean_token_accuracy": 0.1982279196381569,
|
|
"num_tokens": 63608088.0,
|
|
"step": 36665
|
|
},
|
|
{
|
|
"entropy": 5.504365301132202,
|
|
"epoch": 2.8530636063022756,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004185766596337727,
|
|
"loss": 4.9986,
|
|
"mean_token_accuracy": 0.20079575926065446,
|
|
"num_tokens": 63617247.0,
|
|
"step": 36670
|
|
},
|
|
{
|
|
"entropy": 5.412511348724365,
|
|
"epoch": 2.8534526356739933,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.00041855531925553773,
|
|
"loss": 5.0043,
|
|
"mean_token_accuracy": 0.19889775514602662,
|
|
"num_tokens": 63626218.0,
|
|
"step": 36675
|
|
},
|
|
{
|
|
"entropy": 5.360298681259155,
|
|
"epoch": 2.853841665045711,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004185339766990794,
|
|
"loss": 4.923,
|
|
"mean_token_accuracy": 0.20260151475667953,
|
|
"num_tokens": 63634667.0,
|
|
"step": 36680
|
|
},
|
|
{
|
|
"entropy": 5.308692789077758,
|
|
"epoch": 2.8542306944174287,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004185126319647213,
|
|
"loss": 4.9043,
|
|
"mean_token_accuracy": 0.20701882988214493,
|
|
"num_tokens": 63643506.0,
|
|
"step": 36685
|
|
},
|
|
{
|
|
"entropy": 5.2904644966125485,
|
|
"epoch": 2.854619723789146,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004184912850527875,
|
|
"loss": 4.8505,
|
|
"mean_token_accuracy": 0.20915521085262298,
|
|
"num_tokens": 63651883.0,
|
|
"step": 36690
|
|
},
|
|
{
|
|
"entropy": 5.439735269546508,
|
|
"epoch": 2.8550087531608637,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004184699359636018,
|
|
"loss": 4.9991,
|
|
"mean_token_accuracy": 0.19749546945095062,
|
|
"num_tokens": 63660829.0,
|
|
"step": 36695
|
|
},
|
|
{
|
|
"entropy": 5.406318330764771,
|
|
"epoch": 2.8553977825325814,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004184485846974882,
|
|
"loss": 4.9412,
|
|
"mean_token_accuracy": 0.20332974195480347,
|
|
"num_tokens": 63669730.0,
|
|
"step": 36700
|
|
},
|
|
{
|
|
"entropy": 5.349156379699707,
|
|
"epoch": 2.8557868119042986,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004184272312547706,
|
|
"loss": 4.9381,
|
|
"mean_token_accuracy": 0.19928880631923676,
|
|
"num_tokens": 63678921.0,
|
|
"step": 36705
|
|
},
|
|
{
|
|
"entropy": 5.400165843963623,
|
|
"epoch": 2.8561758412760163,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00041840587563577315,
|
|
"loss": 5.0595,
|
|
"mean_token_accuracy": 0.19327778667211531,
|
|
"num_tokens": 63687636.0,
|
|
"step": 36710
|
|
},
|
|
{
|
|
"entropy": 5.3527202129364015,
|
|
"epoch": 2.856564870647734,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004183845178408197,
|
|
"loss": 4.9667,
|
|
"mean_token_accuracy": 0.19559735357761382,
|
|
"num_tokens": 63695701.0,
|
|
"step": 36715
|
|
},
|
|
{
|
|
"entropy": 5.349438858032227,
|
|
"epoch": 2.8569539000194517,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00041836315787023456,
|
|
"loss": 4.9661,
|
|
"mean_token_accuracy": 0.19702850580215453,
|
|
"num_tokens": 63704904.0,
|
|
"step": 36720
|
|
},
|
|
{
|
|
"entropy": 5.353082466125488,
|
|
"epoch": 2.857342929391169,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00041834179572434153,
|
|
"loss": 4.9387,
|
|
"mean_token_accuracy": 0.2028216078877449,
|
|
"num_tokens": 63714250.0,
|
|
"step": 36725
|
|
},
|
|
{
|
|
"entropy": 5.388898324966431,
|
|
"epoch": 2.8577319587628867,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00041832043140346495,
|
|
"loss": 4.9909,
|
|
"mean_token_accuracy": 0.1988374561071396,
|
|
"num_tokens": 63723472.0,
|
|
"step": 36730
|
|
},
|
|
{
|
|
"entropy": 5.321527290344238,
|
|
"epoch": 2.858120988134604,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004182990649079289,
|
|
"loss": 4.775,
|
|
"mean_token_accuracy": 0.20948495119810104,
|
|
"num_tokens": 63731510.0,
|
|
"step": 36735
|
|
},
|
|
{
|
|
"entropy": 5.470141363143921,
|
|
"epoch": 2.8585100175063216,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004182776962380577,
|
|
"loss": 5.0767,
|
|
"mean_token_accuracy": 0.19028838574886323,
|
|
"num_tokens": 63739809.0,
|
|
"step": 36740
|
|
},
|
|
{
|
|
"entropy": 5.342509508132935,
|
|
"epoch": 2.8588990468780393,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00041825632539417546,
|
|
"loss": 4.9156,
|
|
"mean_token_accuracy": 0.20867860764265062,
|
|
"num_tokens": 63748387.0,
|
|
"step": 36745
|
|
},
|
|
{
|
|
"entropy": 5.463844966888428,
|
|
"epoch": 2.859288076249757,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0004182349523766065,
|
|
"loss": 5.0251,
|
|
"mean_token_accuracy": 0.1968454509973526,
|
|
"num_tokens": 63756119.0,
|
|
"step": 36750
|
|
},
|
|
{
|
|
"entropy": 5.334530687332153,
|
|
"epoch": 2.8596771056214743,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00041821357718567514,
|
|
"loss": 4.9643,
|
|
"mean_token_accuracy": 0.20700517743825914,
|
|
"num_tokens": 63764797.0,
|
|
"step": 36755
|
|
},
|
|
{
|
|
"entropy": 5.304919958114624,
|
|
"epoch": 2.860066134993192,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004181921998217057,
|
|
"loss": 4.8493,
|
|
"mean_token_accuracy": 0.20566495805978774,
|
|
"num_tokens": 63773114.0,
|
|
"step": 36760
|
|
},
|
|
{
|
|
"entropy": 5.426658821105957,
|
|
"epoch": 2.8604551643649097,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004181708202850225,
|
|
"loss": 5.0572,
|
|
"mean_token_accuracy": 0.19351145029067993,
|
|
"num_tokens": 63781345.0,
|
|
"step": 36765
|
|
},
|
|
{
|
|
"entropy": 5.391635704040527,
|
|
"epoch": 2.860844193736627,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00041814943857595,
|
|
"loss": 4.9518,
|
|
"mean_token_accuracy": 0.20353857874870301,
|
|
"num_tokens": 63789666.0,
|
|
"step": 36770
|
|
},
|
|
{
|
|
"entropy": 5.355706214904785,
|
|
"epoch": 2.8612332231083446,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004181280546948127,
|
|
"loss": 5.0393,
|
|
"mean_token_accuracy": 0.19338743686676024,
|
|
"num_tokens": 63798121.0,
|
|
"step": 36775
|
|
},
|
|
{
|
|
"entropy": 5.343008947372437,
|
|
"epoch": 2.8616222524800623,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004181066686419349,
|
|
"loss": 4.8143,
|
|
"mean_token_accuracy": 0.2126834660768509,
|
|
"num_tokens": 63806443.0,
|
|
"step": 36780
|
|
},
|
|
{
|
|
"entropy": 5.313502168655395,
|
|
"epoch": 2.86201128185178,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00041808528041764115,
|
|
"loss": 4.9546,
|
|
"mean_token_accuracy": 0.19782498627901077,
|
|
"num_tokens": 63815068.0,
|
|
"step": 36785
|
|
},
|
|
{
|
|
"entropy": 5.381885099411011,
|
|
"epoch": 2.8624003112234973,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004180638900222561,
|
|
"loss": 4.9601,
|
|
"mean_token_accuracy": 0.20091420263051987,
|
|
"num_tokens": 63823518.0,
|
|
"step": 36790
|
|
},
|
|
{
|
|
"entropy": 5.43495545387268,
|
|
"epoch": 2.862789340595215,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004180424974561042,
|
|
"loss": 5.0831,
|
|
"mean_token_accuracy": 0.19239984601736068,
|
|
"num_tokens": 63832435.0,
|
|
"step": 36795
|
|
},
|
|
{
|
|
"entropy": 5.420851993560791,
|
|
"epoch": 2.8631783699669326,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00041802110271951,
|
|
"loss": 5.0204,
|
|
"mean_token_accuracy": 0.1944720223546028,
|
|
"num_tokens": 63841384.0,
|
|
"step": 36800
|
|
},
|
|
{
|
|
"entropy": 5.371727371215821,
|
|
"epoch": 2.86356739933865,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004179997058127983,
|
|
"loss": 4.883,
|
|
"mean_token_accuracy": 0.20526780039072037,
|
|
"num_tokens": 63850563.0,
|
|
"step": 36805
|
|
},
|
|
{
|
|
"entropy": 5.33814435005188,
|
|
"epoch": 2.8639564287103676,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004179783067362936,
|
|
"loss": 4.977,
|
|
"mean_token_accuracy": 0.19931438863277434,
|
|
"num_tokens": 63858657.0,
|
|
"step": 36810
|
|
},
|
|
{
|
|
"entropy": 5.428667688369751,
|
|
"epoch": 2.8643454580820853,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004179569054903207,
|
|
"loss": 5.0687,
|
|
"mean_token_accuracy": 0.1969722628593445,
|
|
"num_tokens": 63866970.0,
|
|
"step": 36815
|
|
},
|
|
{
|
|
"entropy": 5.314129829406738,
|
|
"epoch": 2.864734487453803,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00041793550207520436,
|
|
"loss": 4.8936,
|
|
"mean_token_accuracy": 0.2107781559228897,
|
|
"num_tokens": 63874875.0,
|
|
"step": 36820
|
|
},
|
|
{
|
|
"entropy": 5.33577332496643,
|
|
"epoch": 2.8651235168255202,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004179140964912692,
|
|
"loss": 4.9864,
|
|
"mean_token_accuracy": 0.19681049585342408,
|
|
"num_tokens": 63883479.0,
|
|
"step": 36825
|
|
},
|
|
{
|
|
"entropy": 5.3256010055542,
|
|
"epoch": 2.865512546197238,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004178926887388401,
|
|
"loss": 4.9269,
|
|
"mean_token_accuracy": 0.20112994015216829,
|
|
"num_tokens": 63891700.0,
|
|
"step": 36830
|
|
},
|
|
{
|
|
"entropy": 5.3524291038513185,
|
|
"epoch": 2.865901575568955,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00041787127881824193,
|
|
"loss": 4.976,
|
|
"mean_token_accuracy": 0.19227503538131713,
|
|
"num_tokens": 63900516.0,
|
|
"step": 36835
|
|
},
|
|
{
|
|
"entropy": 5.362793636322022,
|
|
"epoch": 2.866290604940673,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00041784986672979945,
|
|
"loss": 4.874,
|
|
"mean_token_accuracy": 0.2180183544754982,
|
|
"num_tokens": 63908290.0,
|
|
"step": 36840
|
|
},
|
|
{
|
|
"entropy": 5.39371280670166,
|
|
"epoch": 2.8666796343123906,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00041782845247383767,
|
|
"loss": 5.0409,
|
|
"mean_token_accuracy": 0.19186218231916427,
|
|
"num_tokens": 63917019.0,
|
|
"step": 36845
|
|
},
|
|
{
|
|
"entropy": 5.324879217147827,
|
|
"epoch": 2.8670686636841083,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00041780703605068145,
|
|
"loss": 4.8686,
|
|
"mean_token_accuracy": 0.2088683843612671,
|
|
"num_tokens": 63925155.0,
|
|
"step": 36850
|
|
},
|
|
{
|
|
"entropy": 5.411106157302856,
|
|
"epoch": 2.867457693055826,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004177856174606558,
|
|
"loss": 5.001,
|
|
"mean_token_accuracy": 0.1985299125313759,
|
|
"num_tokens": 63932931.0,
|
|
"step": 36855
|
|
},
|
|
{
|
|
"entropy": 5.398127460479737,
|
|
"epoch": 2.8678467224275432,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0004177641967040856,
|
|
"loss": 4.9972,
|
|
"mean_token_accuracy": 0.19696823209524156,
|
|
"num_tokens": 63942368.0,
|
|
"step": 36860
|
|
},
|
|
{
|
|
"entropy": 5.393574237823486,
|
|
"epoch": 2.868235751799261,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00041774277378129595,
|
|
"loss": 4.9384,
|
|
"mean_token_accuracy": 0.20630613714456558,
|
|
"num_tokens": 63950739.0,
|
|
"step": 36865
|
|
},
|
|
{
|
|
"entropy": 5.323387575149536,
|
|
"epoch": 2.868624781170978,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00041772134869261186,
|
|
"loss": 4.9082,
|
|
"mean_token_accuracy": 0.20754269063472747,
|
|
"num_tokens": 63959735.0,
|
|
"step": 36870
|
|
},
|
|
{
|
|
"entropy": 5.36847767829895,
|
|
"epoch": 2.869013810542696,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004176999214383585,
|
|
"loss": 4.9492,
|
|
"mean_token_accuracy": 0.20143691897392274,
|
|
"num_tokens": 63968771.0,
|
|
"step": 36875
|
|
},
|
|
{
|
|
"entropy": 5.307683992385864,
|
|
"epoch": 2.8694028399144136,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00041767849201886103,
|
|
"loss": 4.8887,
|
|
"mean_token_accuracy": 0.21188566833734512,
|
|
"num_tokens": 63977595.0,
|
|
"step": 36880
|
|
},
|
|
{
|
|
"entropy": 5.334543466567993,
|
|
"epoch": 2.8697918692861313,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004176570604344445,
|
|
"loss": 4.9169,
|
|
"mean_token_accuracy": 0.20184899121522903,
|
|
"num_tokens": 63985676.0,
|
|
"step": 36885
|
|
},
|
|
{
|
|
"entropy": 5.3966046333312985,
|
|
"epoch": 2.8701808986578485,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00041763562668543415,
|
|
"loss": 5.0589,
|
|
"mean_token_accuracy": 0.1926816761493683,
|
|
"num_tokens": 63994134.0,
|
|
"step": 36890
|
|
},
|
|
{
|
|
"entropy": 5.406799697875977,
|
|
"epoch": 2.8705699280295662,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004176141907721552,
|
|
"loss": 5.0723,
|
|
"mean_token_accuracy": 0.20241940021514893,
|
|
"num_tokens": 64002605.0,
|
|
"step": 36895
|
|
},
|
|
{
|
|
"entropy": 5.314457511901855,
|
|
"epoch": 2.870958957401284,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004175927526949329,
|
|
"loss": 4.9887,
|
|
"mean_token_accuracy": 0.19916872829198837,
|
|
"num_tokens": 64011232.0,
|
|
"step": 36900
|
|
},
|
|
{
|
|
"entropy": 5.300276803970337,
|
|
"epoch": 2.871347986773001,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004175713124540925,
|
|
"loss": 4.8941,
|
|
"mean_token_accuracy": 0.20504969209432602,
|
|
"num_tokens": 64019696.0,
|
|
"step": 36905
|
|
},
|
|
{
|
|
"entropy": 5.447099018096924,
|
|
"epoch": 2.871737016144719,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00041754987004995935,
|
|
"loss": 4.9705,
|
|
"mean_token_accuracy": 0.20089681446552277,
|
|
"num_tokens": 64028716.0,
|
|
"step": 36910
|
|
},
|
|
{
|
|
"entropy": 5.358922529220581,
|
|
"epoch": 2.8721260455164366,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00041752842548285887,
|
|
"loss": 4.9403,
|
|
"mean_token_accuracy": 0.20492362678050996,
|
|
"num_tokens": 64036915.0,
|
|
"step": 36915
|
|
},
|
|
{
|
|
"entropy": 5.311629819869995,
|
|
"epoch": 2.8725150748881543,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004175069787531163,
|
|
"loss": 4.9571,
|
|
"mean_token_accuracy": 0.20049223601818084,
|
|
"num_tokens": 64045857.0,
|
|
"step": 36920
|
|
},
|
|
{
|
|
"entropy": 5.387873935699463,
|
|
"epoch": 2.8729041042598715,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00041748552986105726,
|
|
"loss": 4.985,
|
|
"mean_token_accuracy": 0.20138221234083176,
|
|
"num_tokens": 64054958.0,
|
|
"step": 36925
|
|
},
|
|
{
|
|
"entropy": 5.352913904190063,
|
|
"epoch": 2.8732931336315892,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.000417464078807007,
|
|
"loss": 4.9696,
|
|
"mean_token_accuracy": 0.20042803287506103,
|
|
"num_tokens": 64063745.0,
|
|
"step": 36930
|
|
},
|
|
{
|
|
"entropy": 5.430801963806152,
|
|
"epoch": 2.8736821630033065,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004174426255912912,
|
|
"loss": 4.9585,
|
|
"mean_token_accuracy": 0.2006607860326767,
|
|
"num_tokens": 64072496.0,
|
|
"step": 36935
|
|
},
|
|
{
|
|
"entropy": 5.389697456359864,
|
|
"epoch": 2.874071192375024,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004174211702142352,
|
|
"loss": 4.9464,
|
|
"mean_token_accuracy": 0.2033034607768059,
|
|
"num_tokens": 64081112.0,
|
|
"step": 36940
|
|
},
|
|
{
|
|
"entropy": 5.2960090160369875,
|
|
"epoch": 2.874460221746742,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00041739971267616466,
|
|
"loss": 4.828,
|
|
"mean_token_accuracy": 0.20785453915596008,
|
|
"num_tokens": 64089346.0,
|
|
"step": 36945
|
|
},
|
|
{
|
|
"entropy": 5.3986693859100345,
|
|
"epoch": 2.8748492511184596,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004173782529774051,
|
|
"loss": 5.0084,
|
|
"mean_token_accuracy": 0.20253023356199265,
|
|
"num_tokens": 64097590.0,
|
|
"step": 36950
|
|
},
|
|
{
|
|
"entropy": 5.349428415298462,
|
|
"epoch": 2.8752382804901773,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00041735679111828223,
|
|
"loss": 4.9208,
|
|
"mean_token_accuracy": 0.2026242882013321,
|
|
"num_tokens": 64105870.0,
|
|
"step": 36955
|
|
},
|
|
{
|
|
"entropy": 5.407027816772461,
|
|
"epoch": 2.8756273098618945,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00041733532709912157,
|
|
"loss": 5.0104,
|
|
"mean_token_accuracy": 0.19676846414804458,
|
|
"num_tokens": 64114963.0,
|
|
"step": 36960
|
|
},
|
|
{
|
|
"entropy": 5.449996042251587,
|
|
"epoch": 2.876016339233612,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00041731386092024893,
|
|
"loss": 5.0792,
|
|
"mean_token_accuracy": 0.18951668292284013,
|
|
"num_tokens": 64123543.0,
|
|
"step": 36965
|
|
},
|
|
{
|
|
"entropy": 5.415232229232788,
|
|
"epoch": 2.8764053686053295,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00041729239258198996,
|
|
"loss": 5.0138,
|
|
"mean_token_accuracy": 0.19758569896221162,
|
|
"num_tokens": 64131962.0,
|
|
"step": 36970
|
|
},
|
|
{
|
|
"entropy": 5.379133939743042,
|
|
"epoch": 2.876794397977047,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00041727092208467036,
|
|
"loss": 4.9872,
|
|
"mean_token_accuracy": 0.20500266551971436,
|
|
"num_tokens": 64140292.0,
|
|
"step": 36975
|
|
},
|
|
{
|
|
"entropy": 5.381147336959839,
|
|
"epoch": 2.877183427348765,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00041724944942861603,
|
|
"loss": 4.9161,
|
|
"mean_token_accuracy": 0.20454721599817277,
|
|
"num_tokens": 64148936.0,
|
|
"step": 36980
|
|
},
|
|
{
|
|
"entropy": 5.366397094726563,
|
|
"epoch": 2.8775724567204826,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00041722797461415267,
|
|
"loss": 4.9969,
|
|
"mean_token_accuracy": 0.20423411726951599,
|
|
"num_tokens": 64157801.0,
|
|
"step": 36985
|
|
},
|
|
{
|
|
"entropy": 5.407845115661621,
|
|
"epoch": 2.8779614860922,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004172064976416062,
|
|
"loss": 5.0012,
|
|
"mean_token_accuracy": 0.19781197011470794,
|
|
"num_tokens": 64166049.0,
|
|
"step": 36990
|
|
},
|
|
{
|
|
"entropy": 5.400692319869995,
|
|
"epoch": 2.8783505154639175,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004171850185113024,
|
|
"loss": 5.053,
|
|
"mean_token_accuracy": 0.1931341826915741,
|
|
"num_tokens": 64174663.0,
|
|
"step": 36995
|
|
},
|
|
{
|
|
"entropy": 5.437733364105225,
|
|
"epoch": 2.878739544835635,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00041716353722356735,
|
|
"loss": 5.0611,
|
|
"mean_token_accuracy": 0.19034309834241867,
|
|
"num_tokens": 64183683.0,
|
|
"step": 37000
|
|
},
|
|
{
|
|
"entropy": 5.454071378707885,
|
|
"epoch": 2.8791285742073525,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004171420537787269,
|
|
"loss": 5.0095,
|
|
"mean_token_accuracy": 0.19799187630414963,
|
|
"num_tokens": 64192808.0,
|
|
"step": 37005
|
|
},
|
|
{
|
|
"entropy": 5.381619310379028,
|
|
"epoch": 2.87951760357907,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00041712056817710697,
|
|
"loss": 4.9185,
|
|
"mean_token_accuracy": 0.2021889090538025,
|
|
"num_tokens": 64201703.0,
|
|
"step": 37010
|
|
},
|
|
{
|
|
"entropy": 5.334100532531738,
|
|
"epoch": 2.879906632950788,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004170990804190337,
|
|
"loss": 4.9868,
|
|
"mean_token_accuracy": 0.1993370071053505,
|
|
"num_tokens": 64210343.0,
|
|
"step": 37015
|
|
},
|
|
{
|
|
"entropy": 5.443491697311401,
|
|
"epoch": 2.8802956623225056,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00041707759050483304,
|
|
"loss": 5.0232,
|
|
"mean_token_accuracy": 0.1982554391026497,
|
|
"num_tokens": 64218871.0,
|
|
"step": 37020
|
|
},
|
|
{
|
|
"entropy": 5.328158330917359,
|
|
"epoch": 2.880684691694223,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.000417056098434831,
|
|
"loss": 4.8653,
|
|
"mean_token_accuracy": 0.21353079229593278,
|
|
"num_tokens": 64226300.0,
|
|
"step": 37025
|
|
},
|
|
{
|
|
"entropy": 5.327289295196533,
|
|
"epoch": 2.8810737210659405,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004170346042093538,
|
|
"loss": 4.9296,
|
|
"mean_token_accuracy": 0.20347051024436952,
|
|
"num_tokens": 64235042.0,
|
|
"step": 37030
|
|
},
|
|
{
|
|
"entropy": 5.330820465087891,
|
|
"epoch": 2.881462750437658,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004170131078287276,
|
|
"loss": 4.8825,
|
|
"mean_token_accuracy": 0.20671766996383667,
|
|
"num_tokens": 64242942.0,
|
|
"step": 37035
|
|
},
|
|
{
|
|
"entropy": 5.395991563796997,
|
|
"epoch": 2.8818517798093755,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004169916092932785,
|
|
"loss": 5.0229,
|
|
"mean_token_accuracy": 0.1933741256594658,
|
|
"num_tokens": 64251187.0,
|
|
"step": 37040
|
|
},
|
|
{
|
|
"entropy": 5.41240668296814,
|
|
"epoch": 2.882240809181093,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004169701086033327,
|
|
"loss": 5.0533,
|
|
"mean_token_accuracy": 0.1966106727719307,
|
|
"num_tokens": 64260025.0,
|
|
"step": 37045
|
|
},
|
|
{
|
|
"entropy": 5.349978399276734,
|
|
"epoch": 2.882629838552811,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00041694860575921654,
|
|
"loss": 5.0354,
|
|
"mean_token_accuracy": 0.1986776649951935,
|
|
"num_tokens": 64269940.0,
|
|
"step": 37050
|
|
},
|
|
{
|
|
"entropy": 5.399356412887573,
|
|
"epoch": 2.8830188679245285,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00041692710076125615,
|
|
"loss": 4.9947,
|
|
"mean_token_accuracy": 0.1967592567205429,
|
|
"num_tokens": 64279054.0,
|
|
"step": 37055
|
|
},
|
|
{
|
|
"entropy": 5.374951553344727,
|
|
"epoch": 2.883407897296246,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.000416905593609778,
|
|
"loss": 5.0109,
|
|
"mean_token_accuracy": 0.19949739277362824,
|
|
"num_tokens": 64287332.0,
|
|
"step": 37060
|
|
},
|
|
{
|
|
"entropy": 5.384362506866455,
|
|
"epoch": 2.8837969266679635,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00041688408430510827,
|
|
"loss": 4.9479,
|
|
"mean_token_accuracy": 0.20140158981084824,
|
|
"num_tokens": 64295889.0,
|
|
"step": 37065
|
|
},
|
|
{
|
|
"entropy": 5.391523218154907,
|
|
"epoch": 2.8841859560396808,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004168625728475734,
|
|
"loss": 4.942,
|
|
"mean_token_accuracy": 0.20196360051631929,
|
|
"num_tokens": 64305138.0,
|
|
"step": 37070
|
|
},
|
|
{
|
|
"entropy": 5.3203715801239015,
|
|
"epoch": 2.8845749854113985,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00041684105923749977,
|
|
"loss": 4.984,
|
|
"mean_token_accuracy": 0.20258364975452423,
|
|
"num_tokens": 64314041.0,
|
|
"step": 37075
|
|
},
|
|
{
|
|
"entropy": 5.483639287948608,
|
|
"epoch": 2.884964014783116,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004168195434752139,
|
|
"loss": 5.0538,
|
|
"mean_token_accuracy": 0.19434479326009751,
|
|
"num_tokens": 64323686.0,
|
|
"step": 37080
|
|
},
|
|
{
|
|
"entropy": 5.393478965759277,
|
|
"epoch": 2.885353044154834,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00041679802556104207,
|
|
"loss": 4.9645,
|
|
"mean_token_accuracy": 0.20160310268402098,
|
|
"num_tokens": 64332395.0,
|
|
"step": 37085
|
|
},
|
|
{
|
|
"entropy": 5.361710071563721,
|
|
"epoch": 2.885742073526551,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00041677650549531097,
|
|
"loss": 4.9636,
|
|
"mean_token_accuracy": 0.20981577038764954,
|
|
"num_tokens": 64340577.0,
|
|
"step": 37090
|
|
},
|
|
{
|
|
"entropy": 5.292429828643799,
|
|
"epoch": 2.886131102898269,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00041675498327834706,
|
|
"loss": 4.9483,
|
|
"mean_token_accuracy": 0.19760295897722244,
|
|
"num_tokens": 64348903.0,
|
|
"step": 37095
|
|
},
|
|
{
|
|
"entropy": 5.4251944065094,
|
|
"epoch": 2.8865201322699865,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00041673345891047686,
|
|
"loss": 5.0657,
|
|
"mean_token_accuracy": 0.18725039362907409,
|
|
"num_tokens": 64357725.0,
|
|
"step": 37100
|
|
},
|
|
{
|
|
"entropy": 5.4748570919036865,
|
|
"epoch": 2.8869091616417037,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004167119323920271,
|
|
"loss": 5.0467,
|
|
"mean_token_accuracy": 0.19451011270284652,
|
|
"num_tokens": 64366871.0,
|
|
"step": 37105
|
|
},
|
|
{
|
|
"entropy": 5.399796438217163,
|
|
"epoch": 2.8872981910134214,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004166904037233243,
|
|
"loss": 4.9677,
|
|
"mean_token_accuracy": 0.1962062954902649,
|
|
"num_tokens": 64375155.0,
|
|
"step": 37110
|
|
},
|
|
{
|
|
"entropy": 5.333475494384766,
|
|
"epoch": 2.887687220385139,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00041666887290469506,
|
|
"loss": 4.9203,
|
|
"mean_token_accuracy": 0.20722077339887618,
|
|
"num_tokens": 64383956.0,
|
|
"step": 37115
|
|
},
|
|
{
|
|
"entropy": 5.432944679260254,
|
|
"epoch": 2.888076249756857,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004166473399364663,
|
|
"loss": 5.0125,
|
|
"mean_token_accuracy": 0.195708030462265,
|
|
"num_tokens": 64392816.0,
|
|
"step": 37120
|
|
},
|
|
{
|
|
"entropy": 5.399767351150513,
|
|
"epoch": 2.888465279128574,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00041662580481896446,
|
|
"loss": 4.9462,
|
|
"mean_token_accuracy": 0.20797515362501146,
|
|
"num_tokens": 64401676.0,
|
|
"step": 37125
|
|
},
|
|
{
|
|
"entropy": 5.452234172821045,
|
|
"epoch": 2.888854308500292,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004166042675525165,
|
|
"loss": 5.1248,
|
|
"mean_token_accuracy": 0.19088877737522125,
|
|
"num_tokens": 64410248.0,
|
|
"step": 37130
|
|
},
|
|
{
|
|
"entropy": 5.400062370300293,
|
|
"epoch": 2.8892433378720095,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00041658272813744924,
|
|
"loss": 4.9557,
|
|
"mean_token_accuracy": 0.2012479141354561,
|
|
"num_tokens": 64419023.0,
|
|
"step": 37135
|
|
},
|
|
{
|
|
"entropy": 5.378878545761109,
|
|
"epoch": 2.8896323672437267,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004165611865740894,
|
|
"loss": 4.8658,
|
|
"mean_token_accuracy": 0.19989986419677735,
|
|
"num_tokens": 64427775.0,
|
|
"step": 37140
|
|
},
|
|
{
|
|
"entropy": 5.306016969680786,
|
|
"epoch": 2.8900213966154444,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004165396428627638,
|
|
"loss": 4.9344,
|
|
"mean_token_accuracy": 0.20216196030378342,
|
|
"num_tokens": 64436113.0,
|
|
"step": 37145
|
|
},
|
|
{
|
|
"entropy": 5.355347347259522,
|
|
"epoch": 2.890410425987162,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00041651809700379947,
|
|
"loss": 4.9902,
|
|
"mean_token_accuracy": 0.20539370328187942,
|
|
"num_tokens": 64444325.0,
|
|
"step": 37150
|
|
},
|
|
{
|
|
"entropy": 5.349817371368408,
|
|
"epoch": 2.89079945535888,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00041649654899752326,
|
|
"loss": 4.9136,
|
|
"mean_token_accuracy": 0.2041795626282692,
|
|
"num_tokens": 64452560.0,
|
|
"step": 37155
|
|
},
|
|
{
|
|
"entropy": 5.365509462356568,
|
|
"epoch": 2.891188484730597,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004164749988442621,
|
|
"loss": 4.9154,
|
|
"mean_token_accuracy": 0.207687346637249,
|
|
"num_tokens": 64460983.0,
|
|
"step": 37160
|
|
},
|
|
{
|
|
"entropy": 5.377222728729248,
|
|
"epoch": 2.891577514102315,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.000416453446544343,
|
|
"loss": 4.9889,
|
|
"mean_token_accuracy": 0.2022017776966095,
|
|
"num_tokens": 64470103.0,
|
|
"step": 37165
|
|
},
|
|
{
|
|
"entropy": 5.431510877609253,
|
|
"epoch": 2.891966543474032,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004164318920980931,
|
|
"loss": 4.9193,
|
|
"mean_token_accuracy": 0.20355570167303086,
|
|
"num_tokens": 64478642.0,
|
|
"step": 37170
|
|
},
|
|
{
|
|
"entropy": 5.339621067047119,
|
|
"epoch": 2.8923555728457497,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004164103355058393,
|
|
"loss": 4.9239,
|
|
"mean_token_accuracy": 0.20127612054347993,
|
|
"num_tokens": 64487625.0,
|
|
"step": 37175
|
|
},
|
|
{
|
|
"entropy": 5.368389844894409,
|
|
"epoch": 2.8927446022174674,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004163887767679087,
|
|
"loss": 4.9375,
|
|
"mean_token_accuracy": 0.2036495491862297,
|
|
"num_tokens": 64497400.0,
|
|
"step": 37180
|
|
},
|
|
{
|
|
"entropy": 5.479900884628296,
|
|
"epoch": 2.893133631589185,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004163672158846285,
|
|
"loss": 5.0174,
|
|
"mean_token_accuracy": 0.1972857341170311,
|
|
"num_tokens": 64506119.0,
|
|
"step": 37185
|
|
},
|
|
{
|
|
"entropy": 5.386583423614502,
|
|
"epoch": 2.8935226609609024,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00041634565285632573,
|
|
"loss": 4.8544,
|
|
"mean_token_accuracy": 0.19973734617233277,
|
|
"num_tokens": 64514372.0,
|
|
"step": 37190
|
|
},
|
|
{
|
|
"entropy": 5.376695680618286,
|
|
"epoch": 2.89391169033262,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00041632408768332776,
|
|
"loss": 4.9187,
|
|
"mean_token_accuracy": 0.2035576283931732,
|
|
"num_tokens": 64522877.0,
|
|
"step": 37195
|
|
},
|
|
{
|
|
"entropy": 5.281811857223511,
|
|
"epoch": 2.8943007197043378,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00041630252036596165,
|
|
"loss": 4.7772,
|
|
"mean_token_accuracy": 0.21734653860330583,
|
|
"num_tokens": 64531647.0,
|
|
"step": 37200
|
|
},
|
|
{
|
|
"entropy": 5.300336647033691,
|
|
"epoch": 2.894689749076055,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004162809509045547,
|
|
"loss": 4.914,
|
|
"mean_token_accuracy": 0.20186670422554015,
|
|
"num_tokens": 64540323.0,
|
|
"step": 37205
|
|
},
|
|
{
|
|
"entropy": 5.4226710319519045,
|
|
"epoch": 2.8950787784477727,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.00041625937929943424,
|
|
"loss": 5.0374,
|
|
"mean_token_accuracy": 0.19797711074352264,
|
|
"num_tokens": 64548955.0,
|
|
"step": 37210
|
|
},
|
|
{
|
|
"entropy": 5.43925199508667,
|
|
"epoch": 2.8954678078194904,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00041623780555092747,
|
|
"loss": 4.9954,
|
|
"mean_token_accuracy": 0.19738141298294068,
|
|
"num_tokens": 64557744.0,
|
|
"step": 37215
|
|
},
|
|
{
|
|
"entropy": 5.303907108306885,
|
|
"epoch": 2.895856837191208,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004162162296593618,
|
|
"loss": 4.8366,
|
|
"mean_token_accuracy": 0.2032587245106697,
|
|
"num_tokens": 64566119.0,
|
|
"step": 37220
|
|
},
|
|
{
|
|
"entropy": 5.337768316268921,
|
|
"epoch": 2.8962458665629254,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00041619465162506466,
|
|
"loss": 4.9553,
|
|
"mean_token_accuracy": 0.20147458612918853,
|
|
"num_tokens": 64574995.0,
|
|
"step": 37225
|
|
},
|
|
{
|
|
"entropy": 5.389168071746826,
|
|
"epoch": 2.896634895934643,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004161730714483633,
|
|
"loss": 5.0635,
|
|
"mean_token_accuracy": 0.19549149721860887,
|
|
"num_tokens": 64583667.0,
|
|
"step": 37230
|
|
},
|
|
{
|
|
"entropy": 5.396248531341553,
|
|
"epoch": 2.8970239253063608,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004161514891295854,
|
|
"loss": 4.9065,
|
|
"mean_token_accuracy": 0.2094361111521721,
|
|
"num_tokens": 64591857.0,
|
|
"step": 37235
|
|
},
|
|
{
|
|
"entropy": 5.353471326828003,
|
|
"epoch": 2.897412954678078,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00041612990466905825,
|
|
"loss": 4.9879,
|
|
"mean_token_accuracy": 0.20113601982593537,
|
|
"num_tokens": 64600635.0,
|
|
"step": 37240
|
|
},
|
|
{
|
|
"entropy": 5.36184868812561,
|
|
"epoch": 2.8978019840497957,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00041610831806710954,
|
|
"loss": 4.9487,
|
|
"mean_token_accuracy": 0.1943442106246948,
|
|
"num_tokens": 64609141.0,
|
|
"step": 37245
|
|
},
|
|
{
|
|
"entropy": 5.405912160873413,
|
|
"epoch": 2.8981910134215134,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00041608672932406666,
|
|
"loss": 4.9652,
|
|
"mean_token_accuracy": 0.20004018843173982,
|
|
"num_tokens": 64617804.0,
|
|
"step": 37250
|
|
},
|
|
{
|
|
"entropy": 5.290182781219483,
|
|
"epoch": 2.898580042793231,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00041606513844025716,
|
|
"loss": 4.8179,
|
|
"mean_token_accuracy": 0.2151850402355194,
|
|
"num_tokens": 64626119.0,
|
|
"step": 37255
|
|
},
|
|
{
|
|
"entropy": 5.330122804641723,
|
|
"epoch": 2.8989690721649484,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0004160435454160087,
|
|
"loss": 4.9225,
|
|
"mean_token_accuracy": 0.19963030368089676,
|
|
"num_tokens": 64634483.0,
|
|
"step": 37260
|
|
},
|
|
{
|
|
"entropy": 5.30983567237854,
|
|
"epoch": 2.899358101536666,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.000416021950251649,
|
|
"loss": 4.9822,
|
|
"mean_token_accuracy": 0.19851722121238707,
|
|
"num_tokens": 64642500.0,
|
|
"step": 37265
|
|
},
|
|
{
|
|
"entropy": 5.323421764373779,
|
|
"epoch": 2.8997471309083833,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004160003529475057,
|
|
"loss": 4.9654,
|
|
"mean_token_accuracy": 0.19566881656646729,
|
|
"num_tokens": 64651808.0,
|
|
"step": 37270
|
|
},
|
|
{
|
|
"entropy": 5.393684577941895,
|
|
"epoch": 2.900136160280101,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0004159787535039064,
|
|
"loss": 4.968,
|
|
"mean_token_accuracy": 0.20235880166292192,
|
|
"num_tokens": 64660502.0,
|
|
"step": 37275
|
|
},
|
|
{
|
|
"entropy": 5.371540689468384,
|
|
"epoch": 2.9005251896518187,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004159571519211789,
|
|
"loss": 5.0329,
|
|
"mean_token_accuracy": 0.20524853616952896,
|
|
"num_tokens": 64669156.0,
|
|
"step": 37280
|
|
},
|
|
{
|
|
"entropy": 5.408015489578247,
|
|
"epoch": 2.9009142190235364,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.000415935548199651,
|
|
"loss": 4.9956,
|
|
"mean_token_accuracy": 0.19675534963607788,
|
|
"num_tokens": 64678321.0,
|
|
"step": 37285
|
|
},
|
|
{
|
|
"entropy": 5.419590711593628,
|
|
"epoch": 2.901303248395254,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004159139423396504,
|
|
"loss": 4.9658,
|
|
"mean_token_accuracy": 0.19978420734405516,
|
|
"num_tokens": 64686768.0,
|
|
"step": 37290
|
|
},
|
|
{
|
|
"entropy": 5.469217348098755,
|
|
"epoch": 2.9016922777669714,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004158923343415051,
|
|
"loss": 5.0537,
|
|
"mean_token_accuracy": 0.19891429394483567,
|
|
"num_tokens": 64695357.0,
|
|
"step": 37295
|
|
},
|
|
{
|
|
"entropy": 5.304123783111573,
|
|
"epoch": 2.902081307138689,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004158707242055429,
|
|
"loss": 4.9783,
|
|
"mean_token_accuracy": 0.1969512552022934,
|
|
"num_tokens": 64703912.0,
|
|
"step": 37300
|
|
},
|
|
{
|
|
"entropy": 5.298651885986328,
|
|
"epoch": 2.9024703365104063,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00041584911193209167,
|
|
"loss": 4.9079,
|
|
"mean_token_accuracy": 0.20512390434741973,
|
|
"num_tokens": 64713088.0,
|
|
"step": 37305
|
|
},
|
|
{
|
|
"entropy": 5.4175924301147464,
|
|
"epoch": 2.902859365882124,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004158274975214794,
|
|
"loss": 4.9834,
|
|
"mean_token_accuracy": 0.19537829160690307,
|
|
"num_tokens": 64721950.0,
|
|
"step": 37310
|
|
},
|
|
{
|
|
"entropy": 5.417685699462891,
|
|
"epoch": 2.9032483952538417,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00041580588097403384,
|
|
"loss": 4.9506,
|
|
"mean_token_accuracy": 0.19385679960250854,
|
|
"num_tokens": 64731032.0,
|
|
"step": 37315
|
|
},
|
|
{
|
|
"entropy": 5.363985395431518,
|
|
"epoch": 2.9036374246255594,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00041578426229008325,
|
|
"loss": 4.9844,
|
|
"mean_token_accuracy": 0.1970355600118637,
|
|
"num_tokens": 64739676.0,
|
|
"step": 37320
|
|
},
|
|
{
|
|
"entropy": 5.35716609954834,
|
|
"epoch": 2.9040264539972767,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00041576264146995557,
|
|
"loss": 4.9436,
|
|
"mean_token_accuracy": 0.20389612764120102,
|
|
"num_tokens": 64748827.0,
|
|
"step": 37325
|
|
},
|
|
{
|
|
"entropy": 5.319880867004395,
|
|
"epoch": 2.9044154833689944,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00041574101851397883,
|
|
"loss": 4.8651,
|
|
"mean_token_accuracy": 0.20533792525529862,
|
|
"num_tokens": 64757990.0,
|
|
"step": 37330
|
|
},
|
|
{
|
|
"entropy": 5.344013357162476,
|
|
"epoch": 2.904804512740712,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004157193934224811,
|
|
"loss": 5.0291,
|
|
"mean_token_accuracy": 0.19846984297037124,
|
|
"num_tokens": 64767351.0,
|
|
"step": 37335
|
|
},
|
|
{
|
|
"entropy": 5.476811170578003,
|
|
"epoch": 2.9051935421124293,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004156977661957906,
|
|
"loss": 5.0251,
|
|
"mean_token_accuracy": 0.1997022420167923,
|
|
"num_tokens": 64775294.0,
|
|
"step": 37340
|
|
},
|
|
{
|
|
"entropy": 5.415498971939087,
|
|
"epoch": 2.905582571484147,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004156761368342355,
|
|
"loss": 4.9988,
|
|
"mean_token_accuracy": 0.2063598930835724,
|
|
"num_tokens": 64784933.0,
|
|
"step": 37345
|
|
},
|
|
{
|
|
"entropy": 5.387592744827271,
|
|
"epoch": 2.9059716008558647,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00041565450533814384,
|
|
"loss": 4.9291,
|
|
"mean_token_accuracy": 0.20324084907770157,
|
|
"num_tokens": 64794137.0,
|
|
"step": 37350
|
|
},
|
|
{
|
|
"entropy": 5.374163675308227,
|
|
"epoch": 2.9063606302275824,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00041563287170784396,
|
|
"loss": 4.951,
|
|
"mean_token_accuracy": 0.20166610032320023,
|
|
"num_tokens": 64803100.0,
|
|
"step": 37355
|
|
},
|
|
{
|
|
"entropy": 5.288591384887695,
|
|
"epoch": 2.9067496595992997,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004156112359436641,
|
|
"loss": 4.8659,
|
|
"mean_token_accuracy": 0.21121285259723663,
|
|
"num_tokens": 64811980.0,
|
|
"step": 37360
|
|
},
|
|
{
|
|
"entropy": 5.319044351577759,
|
|
"epoch": 2.9071386889710173,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00041558959804593255,
|
|
"loss": 4.934,
|
|
"mean_token_accuracy": 0.2019159123301506,
|
|
"num_tokens": 64820201.0,
|
|
"step": 37365
|
|
},
|
|
{
|
|
"entropy": 5.340664339065552,
|
|
"epoch": 2.9075277183427346,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00041556795801497766,
|
|
"loss": 4.9026,
|
|
"mean_token_accuracy": 0.2104795217514038,
|
|
"num_tokens": 64829054.0,
|
|
"step": 37370
|
|
},
|
|
{
|
|
"entropy": 5.467510795593261,
|
|
"epoch": 2.9079167477144523,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004155463158511277,
|
|
"loss": 5.1027,
|
|
"mean_token_accuracy": 0.19545851051807403,
|
|
"num_tokens": 64838704.0,
|
|
"step": 37375
|
|
},
|
|
{
|
|
"entropy": 5.340311813354492,
|
|
"epoch": 2.90830577708617,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.00041552467155471105,
|
|
"loss": 4.7783,
|
|
"mean_token_accuracy": 0.2125468835234642,
|
|
"num_tokens": 64847508.0,
|
|
"step": 37380
|
|
},
|
|
{
|
|
"entropy": 5.348222064971924,
|
|
"epoch": 2.9086948064578877,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004155030251260563,
|
|
"loss": 4.8979,
|
|
"mean_token_accuracy": 0.20774298310279846,
|
|
"num_tokens": 64856112.0,
|
|
"step": 37385
|
|
},
|
|
{
|
|
"entropy": 5.292542791366577,
|
|
"epoch": 2.9090838358296054,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00041548137656549167,
|
|
"loss": 4.8534,
|
|
"mean_token_accuracy": 0.20734062045812607,
|
|
"num_tokens": 64864807.0,
|
|
"step": 37390
|
|
},
|
|
{
|
|
"entropy": 5.357112121582031,
|
|
"epoch": 2.9094728652013226,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004154597258733457,
|
|
"loss": 4.9232,
|
|
"mean_token_accuracy": 0.20104329586029052,
|
|
"num_tokens": 64872744.0,
|
|
"step": 37395
|
|
},
|
|
{
|
|
"entropy": 5.335861444473267,
|
|
"epoch": 2.9098618945730403,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004154380730499472,
|
|
"loss": 4.9143,
|
|
"mean_token_accuracy": 0.21156683415174485,
|
|
"num_tokens": 64882581.0,
|
|
"step": 37400
|
|
},
|
|
{
|
|
"entropy": 5.340922927856445,
|
|
"epoch": 2.9102509239447576,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00041541641809562425,
|
|
"loss": 4.8449,
|
|
"mean_token_accuracy": 0.20912200808525086,
|
|
"num_tokens": 64890935.0,
|
|
"step": 37405
|
|
},
|
|
{
|
|
"entropy": 5.4223652362823485,
|
|
"epoch": 2.9106399533164753,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004153947610107057,
|
|
"loss": 5.0511,
|
|
"mean_token_accuracy": 0.19548511654138565,
|
|
"num_tokens": 64900132.0,
|
|
"step": 37410
|
|
},
|
|
{
|
|
"entropy": 5.386390829086304,
|
|
"epoch": 2.911028982688193,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00041537310179552017,
|
|
"loss": 4.9754,
|
|
"mean_token_accuracy": 0.195708566904068,
|
|
"num_tokens": 64908733.0,
|
|
"step": 37415
|
|
},
|
|
{
|
|
"entropy": 5.393733072280884,
|
|
"epoch": 2.9114180120599107,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004153514404503962,
|
|
"loss": 4.9581,
|
|
"mean_token_accuracy": 0.20353571325540543,
|
|
"num_tokens": 64916824.0,
|
|
"step": 37420
|
|
},
|
|
{
|
|
"entropy": 5.423798656463623,
|
|
"epoch": 2.911807041431628,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004153297769756625,
|
|
"loss": 4.9701,
|
|
"mean_token_accuracy": 0.2000584214925766,
|
|
"num_tokens": 64926342.0,
|
|
"step": 37425
|
|
},
|
|
{
|
|
"entropy": 5.423081350326538,
|
|
"epoch": 2.9121960708033456,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004153081113716478,
|
|
"loss": 4.9844,
|
|
"mean_token_accuracy": 0.20184855461120604,
|
|
"num_tokens": 64935123.0,
|
|
"step": 37430
|
|
},
|
|
{
|
|
"entropy": 5.363427066802979,
|
|
"epoch": 2.9125851001750633,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00041528644363868087,
|
|
"loss": 4.9932,
|
|
"mean_token_accuracy": 0.19337051063776017,
|
|
"num_tokens": 64944046.0,
|
|
"step": 37435
|
|
},
|
|
{
|
|
"entropy": 5.489654541015625,
|
|
"epoch": 2.9129741295467806,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004152647737770904,
|
|
"loss": 5.0543,
|
|
"mean_token_accuracy": 0.1885812595486641,
|
|
"num_tokens": 64952897.0,
|
|
"step": 37440
|
|
},
|
|
{
|
|
"entropy": 5.439988517761231,
|
|
"epoch": 2.9133631589184983,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004152431017872053,
|
|
"loss": 5.0055,
|
|
"mean_token_accuracy": 0.19353672862052917,
|
|
"num_tokens": 64961432.0,
|
|
"step": 37445
|
|
},
|
|
{
|
|
"entropy": 5.429376077651978,
|
|
"epoch": 2.913752188290216,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00041522142766935426,
|
|
"loss": 5.0656,
|
|
"mean_token_accuracy": 0.19510917067527772,
|
|
"num_tokens": 64970298.0,
|
|
"step": 37450
|
|
},
|
|
{
|
|
"entropy": 5.427340078353882,
|
|
"epoch": 2.9141412176619337,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00041519975142386627,
|
|
"loss": 5.013,
|
|
"mean_token_accuracy": 0.1947298228740692,
|
|
"num_tokens": 64978735.0,
|
|
"step": 37455
|
|
},
|
|
{
|
|
"entropy": 5.375114059448242,
|
|
"epoch": 2.914530247033651,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004151780730510702,
|
|
"loss": 4.967,
|
|
"mean_token_accuracy": 0.19820231944322586,
|
|
"num_tokens": 64987222.0,
|
|
"step": 37460
|
|
},
|
|
{
|
|
"entropy": 5.269347333908081,
|
|
"epoch": 2.9149192764053686,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00041515639255129504,
|
|
"loss": 4.8746,
|
|
"mean_token_accuracy": 0.20782892853021623,
|
|
"num_tokens": 64995857.0,
|
|
"step": 37465
|
|
},
|
|
{
|
|
"entropy": 5.338833045959473,
|
|
"epoch": 2.9153083057770863,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004151347099248697,
|
|
"loss": 4.8945,
|
|
"mean_token_accuracy": 0.20555528104305268,
|
|
"num_tokens": 65005583.0,
|
|
"step": 37470
|
|
},
|
|
{
|
|
"entropy": 5.395391893386841,
|
|
"epoch": 2.9156973351488036,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004151130251721231,
|
|
"loss": 4.9406,
|
|
"mean_token_accuracy": 0.2025502473115921,
|
|
"num_tokens": 65013533.0,
|
|
"step": 37475
|
|
},
|
|
{
|
|
"entropy": 5.373561573028565,
|
|
"epoch": 2.9160863645205213,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00041509133829338454,
|
|
"loss": 4.9175,
|
|
"mean_token_accuracy": 0.21041665524244307,
|
|
"num_tokens": 65022674.0,
|
|
"step": 37480
|
|
},
|
|
{
|
|
"entropy": 5.351035308837891,
|
|
"epoch": 2.916475393892239,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004150696492889827,
|
|
"loss": 4.8813,
|
|
"mean_token_accuracy": 0.20601247102022172,
|
|
"num_tokens": 65030914.0,
|
|
"step": 37485
|
|
},
|
|
{
|
|
"entropy": 5.329110956192016,
|
|
"epoch": 2.9168644232639567,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00041504795815924697,
|
|
"loss": 4.9871,
|
|
"mean_token_accuracy": 0.201705265045166,
|
|
"num_tokens": 65040036.0,
|
|
"step": 37490
|
|
},
|
|
{
|
|
"entropy": 5.401362800598145,
|
|
"epoch": 2.917253452635674,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00041502626490450635,
|
|
"loss": 4.9247,
|
|
"mean_token_accuracy": 0.20747202038764953,
|
|
"num_tokens": 65048558.0,
|
|
"step": 37495
|
|
},
|
|
{
|
|
"entropy": 5.310954666137695,
|
|
"epoch": 2.9176424820073916,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004150045695250901,
|
|
"loss": 4.929,
|
|
"mean_token_accuracy": 0.21007044166326522,
|
|
"num_tokens": 65057158.0,
|
|
"step": 37500
|
|
},
|
|
{
|
|
"entropy": 5.380912017822266,
|
|
"epoch": 2.918031511379109,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004149828720213272,
|
|
"loss": 5.0138,
|
|
"mean_token_accuracy": 0.1999897003173828,
|
|
"num_tokens": 65065845.0,
|
|
"step": 37505
|
|
},
|
|
{
|
|
"entropy": 5.399272298812866,
|
|
"epoch": 2.9184205407508266,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004149611723935472,
|
|
"loss": 4.9385,
|
|
"mean_token_accuracy": 0.20354021191596985,
|
|
"num_tokens": 65075182.0,
|
|
"step": 37510
|
|
},
|
|
{
|
|
"entropy": 5.39171953201294,
|
|
"epoch": 2.9188095701225443,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004149394706420791,
|
|
"loss": 4.9671,
|
|
"mean_token_accuracy": 0.20318426340818405,
|
|
"num_tokens": 65084616.0,
|
|
"step": 37515
|
|
},
|
|
{
|
|
"entropy": 5.274928712844849,
|
|
"epoch": 2.919198599494262,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00041491776676725223,
|
|
"loss": 4.8318,
|
|
"mean_token_accuracy": 0.21738772839307785,
|
|
"num_tokens": 65092683.0,
|
|
"step": 37520
|
|
},
|
|
{
|
|
"entropy": 5.339082479476929,
|
|
"epoch": 2.9195876288659792,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004148960607693961,
|
|
"loss": 4.8791,
|
|
"mean_token_accuracy": 0.20388251692056655,
|
|
"num_tokens": 65100445.0,
|
|
"step": 37525
|
|
},
|
|
{
|
|
"entropy": 5.386516761779785,
|
|
"epoch": 2.919976658237697,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00041487435264883974,
|
|
"loss": 4.9609,
|
|
"mean_token_accuracy": 0.2012045592069626,
|
|
"num_tokens": 65109512.0,
|
|
"step": 37530
|
|
},
|
|
{
|
|
"entropy": 5.35376205444336,
|
|
"epoch": 2.9203656876094146,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004148526424059128,
|
|
"loss": 4.9486,
|
|
"mean_token_accuracy": 0.20072949975728988,
|
|
"num_tokens": 65117889.0,
|
|
"step": 37535
|
|
},
|
|
{
|
|
"entropy": 5.360037088394165,
|
|
"epoch": 2.920754716981132,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004148309300409446,
|
|
"loss": 4.9845,
|
|
"mean_token_accuracy": 0.20024109333753587,
|
|
"num_tokens": 65126226.0,
|
|
"step": 37540
|
|
},
|
|
{
|
|
"entropy": 5.326682043075562,
|
|
"epoch": 2.9211437463528496,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004148092155542646,
|
|
"loss": 4.9369,
|
|
"mean_token_accuracy": 0.20324024111032485,
|
|
"num_tokens": 65134474.0,
|
|
"step": 37545
|
|
},
|
|
{
|
|
"entropy": 5.414184093475342,
|
|
"epoch": 2.9215327757245673,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004147874989462023,
|
|
"loss": 5.0279,
|
|
"mean_token_accuracy": 0.19510591626167298,
|
|
"num_tokens": 65143068.0,
|
|
"step": 37550
|
|
},
|
|
{
|
|
"entropy": 5.38086838722229,
|
|
"epoch": 2.921921805096285,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004147657802170871,
|
|
"loss": 4.9225,
|
|
"mean_token_accuracy": 0.2069569244980812,
|
|
"num_tokens": 65151865.0,
|
|
"step": 37555
|
|
},
|
|
{
|
|
"entropy": 5.323944139480591,
|
|
"epoch": 2.922310834468002,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00041474405936724873,
|
|
"loss": 4.9207,
|
|
"mean_token_accuracy": 0.19961315393447876,
|
|
"num_tokens": 65160684.0,
|
|
"step": 37560
|
|
},
|
|
{
|
|
"entropy": 5.41795506477356,
|
|
"epoch": 2.92269986383972,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004147223363970166,
|
|
"loss": 4.9697,
|
|
"mean_token_accuracy": 0.19758064597845076,
|
|
"num_tokens": 65169084.0,
|
|
"step": 37565
|
|
},
|
|
{
|
|
"entropy": 5.295176935195923,
|
|
"epoch": 2.9230888932114376,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004147006113067205,
|
|
"loss": 4.8239,
|
|
"mean_token_accuracy": 0.21040179431438447,
|
|
"num_tokens": 65178428.0,
|
|
"step": 37570
|
|
},
|
|
{
|
|
"entropy": 5.295871829986572,
|
|
"epoch": 2.923477922583155,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004146788840966901,
|
|
"loss": 4.9103,
|
|
"mean_token_accuracy": 0.20014121979475022,
|
|
"num_tokens": 65187490.0,
|
|
"step": 37575
|
|
},
|
|
{
|
|
"entropy": 5.386913251876831,
|
|
"epoch": 2.9238669519548726,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004146571547672548,
|
|
"loss": 4.9688,
|
|
"mean_token_accuracy": 0.202760311961174,
|
|
"num_tokens": 65195987.0,
|
|
"step": 37580
|
|
},
|
|
{
|
|
"entropy": 5.297890758514404,
|
|
"epoch": 2.9242559813265903,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00041463542331874443,
|
|
"loss": 4.8988,
|
|
"mean_token_accuracy": 0.20495434552431108,
|
|
"num_tokens": 65204466.0,
|
|
"step": 37585
|
|
},
|
|
{
|
|
"entropy": 5.344933938980103,
|
|
"epoch": 2.924645010698308,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00041461368975148876,
|
|
"loss": 4.888,
|
|
"mean_token_accuracy": 0.20569198876619338,
|
|
"num_tokens": 65213023.0,
|
|
"step": 37590
|
|
},
|
|
{
|
|
"entropy": 5.4099774837493895,
|
|
"epoch": 2.925034040070025,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00041459195406581763,
|
|
"loss": 5.0786,
|
|
"mean_token_accuracy": 0.19362051486968995,
|
|
"num_tokens": 65221580.0,
|
|
"step": 37595
|
|
},
|
|
{
|
|
"entropy": 5.2840578079223635,
|
|
"epoch": 2.925423069441743,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004145702162620608,
|
|
"loss": 4.9301,
|
|
"mean_token_accuracy": 0.2018754079937935,
|
|
"num_tokens": 65230529.0,
|
|
"step": 37600
|
|
},
|
|
{
|
|
"entropy": 5.343974208831787,
|
|
"epoch": 2.92581209881346,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00041454847634054805,
|
|
"loss": 4.9469,
|
|
"mean_token_accuracy": 0.20127518028020858,
|
|
"num_tokens": 65239338.0,
|
|
"step": 37605
|
|
},
|
|
{
|
|
"entropy": 5.365229511260987,
|
|
"epoch": 2.926201128185178,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00041452673430160923,
|
|
"loss": 4.8816,
|
|
"mean_token_accuracy": 0.20884469598531724,
|
|
"num_tokens": 65248523.0,
|
|
"step": 37610
|
|
},
|
|
{
|
|
"entropy": 5.387389230728149,
|
|
"epoch": 2.9265901575568956,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004145049901455744,
|
|
"loss": 4.9963,
|
|
"mean_token_accuracy": 0.19820436835289001,
|
|
"num_tokens": 65257740.0,
|
|
"step": 37615
|
|
},
|
|
{
|
|
"entropy": 5.377244329452514,
|
|
"epoch": 2.9269791869286133,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.00041448324387277337,
|
|
"loss": 4.8814,
|
|
"mean_token_accuracy": 0.20877327173948287,
|
|
"num_tokens": 65266728.0,
|
|
"step": 37620
|
|
},
|
|
{
|
|
"entropy": 5.386267280578613,
|
|
"epoch": 2.927368216300331,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00041446149548353606,
|
|
"loss": 5.0434,
|
|
"mean_token_accuracy": 0.19404161125421523,
|
|
"num_tokens": 65275264.0,
|
|
"step": 37625
|
|
},
|
|
{
|
|
"entropy": 5.39141583442688,
|
|
"epoch": 2.927757245672048,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004144397449781926,
|
|
"loss": 5.0385,
|
|
"mean_token_accuracy": 0.19300076216459275,
|
|
"num_tokens": 65284247.0,
|
|
"step": 37630
|
|
},
|
|
{
|
|
"entropy": 5.362431383132934,
|
|
"epoch": 2.928146275043766,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004144179923570729,
|
|
"loss": 4.9097,
|
|
"mean_token_accuracy": 0.20379756838083268,
|
|
"num_tokens": 65293255.0,
|
|
"step": 37635
|
|
},
|
|
{
|
|
"entropy": 5.381832599639893,
|
|
"epoch": 2.928535304415483,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004143962376205071,
|
|
"loss": 4.9719,
|
|
"mean_token_accuracy": 0.20261037796735765,
|
|
"num_tokens": 65301945.0,
|
|
"step": 37640
|
|
},
|
|
{
|
|
"entropy": 5.365680074691772,
|
|
"epoch": 2.928924333787201,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00041437448076882526,
|
|
"loss": 4.9167,
|
|
"mean_token_accuracy": 0.21031944304704667,
|
|
"num_tokens": 65310521.0,
|
|
"step": 37645
|
|
},
|
|
{
|
|
"entropy": 5.339953088760376,
|
|
"epoch": 2.9293133631589185,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00041435272180235757,
|
|
"loss": 4.9251,
|
|
"mean_token_accuracy": 0.20113795548677443,
|
|
"num_tokens": 65318626.0,
|
|
"step": 37650
|
|
},
|
|
{
|
|
"entropy": 5.397060823440552,
|
|
"epoch": 2.9297023925306362,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.000414330960721434,
|
|
"loss": 4.9632,
|
|
"mean_token_accuracy": 0.19620810002088546,
|
|
"num_tokens": 65326098.0,
|
|
"step": 37655
|
|
},
|
|
{
|
|
"entropy": 5.389641666412354,
|
|
"epoch": 2.9300914219023535,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00041430919752638497,
|
|
"loss": 5.0374,
|
|
"mean_token_accuracy": 0.1936261847615242,
|
|
"num_tokens": 65334705.0,
|
|
"step": 37660
|
|
},
|
|
{
|
|
"entropy": 5.390426588058472,
|
|
"epoch": 2.930480451274071,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004142874322175406,
|
|
"loss": 4.9032,
|
|
"mean_token_accuracy": 0.20770372599363326,
|
|
"num_tokens": 65343965.0,
|
|
"step": 37665
|
|
},
|
|
{
|
|
"entropy": 5.426338815689087,
|
|
"epoch": 2.930869480645789,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00041426566479523116,
|
|
"loss": 4.9148,
|
|
"mean_token_accuracy": 0.2017579436302185,
|
|
"num_tokens": 65351467.0,
|
|
"step": 37670
|
|
},
|
|
{
|
|
"entropy": 5.301477766036987,
|
|
"epoch": 2.931258510017506,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00041424389525978683,
|
|
"loss": 4.9116,
|
|
"mean_token_accuracy": 0.20588507652282714,
|
|
"num_tokens": 65359820.0,
|
|
"step": 37675
|
|
},
|
|
{
|
|
"entropy": 5.290318202972412,
|
|
"epoch": 2.931647539389224,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004142221236115381,
|
|
"loss": 4.8501,
|
|
"mean_token_accuracy": 0.20666824728250505,
|
|
"num_tokens": 65368363.0,
|
|
"step": 37680
|
|
},
|
|
{
|
|
"entropy": 5.396524715423584,
|
|
"epoch": 2.9320365687609415,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004142003498508152,
|
|
"loss": 4.9765,
|
|
"mean_token_accuracy": 0.20754232108592988,
|
|
"num_tokens": 65376771.0,
|
|
"step": 37685
|
|
},
|
|
{
|
|
"entropy": 5.416061449050903,
|
|
"epoch": 2.9324255981326592,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004141785739779486,
|
|
"loss": 5.0037,
|
|
"mean_token_accuracy": 0.20277312099933625,
|
|
"num_tokens": 65385254.0,
|
|
"step": 37690
|
|
},
|
|
{
|
|
"entropy": 5.466414070129394,
|
|
"epoch": 2.9328146275043765,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00041415679599326853,
|
|
"loss": 4.9706,
|
|
"mean_token_accuracy": 0.19490021616220474,
|
|
"num_tokens": 65393276.0,
|
|
"step": 37695
|
|
},
|
|
{
|
|
"entropy": 5.275504159927368,
|
|
"epoch": 2.933203656876094,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.00041413501589710567,
|
|
"loss": 4.8359,
|
|
"mean_token_accuracy": 0.20631514638662338,
|
|
"num_tokens": 65401745.0,
|
|
"step": 37700
|
|
},
|
|
{
|
|
"entropy": 5.388788080215454,
|
|
"epoch": 2.9335926862478114,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004141132336897904,
|
|
"loss": 5.0841,
|
|
"mean_token_accuracy": 0.19875578433275223,
|
|
"num_tokens": 65409982.0,
|
|
"step": 37705
|
|
},
|
|
{
|
|
"entropy": 5.390400457382202,
|
|
"epoch": 2.933981715619529,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004140914493716533,
|
|
"loss": 4.9394,
|
|
"mean_token_accuracy": 0.20913472920656204,
|
|
"num_tokens": 65419617.0,
|
|
"step": 37710
|
|
},
|
|
{
|
|
"entropy": 5.379942607879639,
|
|
"epoch": 2.934370744991247,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004140696629430248,
|
|
"loss": 4.9535,
|
|
"mean_token_accuracy": 0.20148940235376359,
|
|
"num_tokens": 65428230.0,
|
|
"step": 37715
|
|
},
|
|
{
|
|
"entropy": 5.387977409362793,
|
|
"epoch": 2.9347597743629645,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00041404787440423534,
|
|
"loss": 4.9825,
|
|
"mean_token_accuracy": 0.20371298640966415,
|
|
"num_tokens": 65437126.0,
|
|
"step": 37720
|
|
},
|
|
{
|
|
"entropy": 5.397473287582398,
|
|
"epoch": 2.9351488037346822,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00041402608375561595,
|
|
"loss": 4.9838,
|
|
"mean_token_accuracy": 0.19834314584732055,
|
|
"num_tokens": 65445910.0,
|
|
"step": 37725
|
|
},
|
|
{
|
|
"entropy": 5.364032459259033,
|
|
"epoch": 2.9355378331063995,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00041400429099749687,
|
|
"loss": 5.0148,
|
|
"mean_token_accuracy": 0.20013068318367006,
|
|
"num_tokens": 65454371.0,
|
|
"step": 37730
|
|
},
|
|
{
|
|
"entropy": 5.391096925735473,
|
|
"epoch": 2.935926862478117,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.000413982496130209,
|
|
"loss": 4.9856,
|
|
"mean_token_accuracy": 0.19619592726230622,
|
|
"num_tokens": 65463207.0,
|
|
"step": 37735
|
|
},
|
|
{
|
|
"entropy": 5.331643581390381,
|
|
"epoch": 2.9363158918498344,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00041396069915408294,
|
|
"loss": 4.9416,
|
|
"mean_token_accuracy": 0.2038038358092308,
|
|
"num_tokens": 65471703.0,
|
|
"step": 37740
|
|
},
|
|
{
|
|
"entropy": 5.313036918640137,
|
|
"epoch": 2.936704921221552,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00041393890006944945,
|
|
"loss": 4.8761,
|
|
"mean_token_accuracy": 0.20930017828941344,
|
|
"num_tokens": 65480516.0,
|
|
"step": 37745
|
|
},
|
|
{
|
|
"entropy": 5.293054246902466,
|
|
"epoch": 2.93709395059327,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004139170988766393,
|
|
"loss": 4.9294,
|
|
"mean_token_accuracy": 0.20443944931030272,
|
|
"num_tokens": 65489233.0,
|
|
"step": 37750
|
|
},
|
|
{
|
|
"entropy": 5.321640062332153,
|
|
"epoch": 2.9374829799649875,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004138952955759833,
|
|
"loss": 4.8586,
|
|
"mean_token_accuracy": 0.2048437088727951,
|
|
"num_tokens": 65497827.0,
|
|
"step": 37755
|
|
},
|
|
{
|
|
"entropy": 5.328530025482178,
|
|
"epoch": 2.937872009336705,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00041387349016781225,
|
|
"loss": 4.9866,
|
|
"mean_token_accuracy": 0.20304617136716843,
|
|
"num_tokens": 65505629.0,
|
|
"step": 37760
|
|
},
|
|
{
|
|
"entropy": 5.4190394401550295,
|
|
"epoch": 2.9382610387084225,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.000413851682652457,
|
|
"loss": 5.057,
|
|
"mean_token_accuracy": 0.197891765832901,
|
|
"num_tokens": 65514097.0,
|
|
"step": 37765
|
|
},
|
|
{
|
|
"entropy": 5.4248169422149655,
|
|
"epoch": 2.93865006808014,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004138298730302485,
|
|
"loss": 5.0354,
|
|
"mean_token_accuracy": 0.19569046646356583,
|
|
"num_tokens": 65522868.0,
|
|
"step": 37770
|
|
},
|
|
{
|
|
"entropy": 5.381247901916504,
|
|
"epoch": 2.9390390974518574,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0004138080613015176,
|
|
"loss": 4.9156,
|
|
"mean_token_accuracy": 0.2008703514933586,
|
|
"num_tokens": 65531433.0,
|
|
"step": 37775
|
|
},
|
|
{
|
|
"entropy": 5.387717390060425,
|
|
"epoch": 2.939428126823575,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.00041378624746659536,
|
|
"loss": 4.9692,
|
|
"mean_token_accuracy": 0.20051268339157105,
|
|
"num_tokens": 65541113.0,
|
|
"step": 37780
|
|
},
|
|
{
|
|
"entropy": 5.386761093139649,
|
|
"epoch": 2.939817156195293,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00041376443152581265,
|
|
"loss": 4.9418,
|
|
"mean_token_accuracy": 0.2012167125940323,
|
|
"num_tokens": 65550103.0,
|
|
"step": 37785
|
|
},
|
|
{
|
|
"entropy": 5.357759284973144,
|
|
"epoch": 2.9402061855670105,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00041374261347950064,
|
|
"loss": 4.9599,
|
|
"mean_token_accuracy": 0.2061675578355789,
|
|
"num_tokens": 65558618.0,
|
|
"step": 37790
|
|
},
|
|
{
|
|
"entropy": 5.3916003704071045,
|
|
"epoch": 2.9405952149387278,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004137207933279903,
|
|
"loss": 4.9363,
|
|
"mean_token_accuracy": 0.2008431524038315,
|
|
"num_tokens": 65568025.0,
|
|
"step": 37795
|
|
},
|
|
{
|
|
"entropy": 5.338155794143677,
|
|
"epoch": 2.9409842443104455,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00041369897107161266,
|
|
"loss": 4.963,
|
|
"mean_token_accuracy": 0.20262217968702317,
|
|
"num_tokens": 65576360.0,
|
|
"step": 37800
|
|
},
|
|
{
|
|
"entropy": 5.360418462753296,
|
|
"epoch": 2.941373273682163,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00041367714671069897,
|
|
"loss": 4.9656,
|
|
"mean_token_accuracy": 0.20181121081113815,
|
|
"num_tokens": 65585764.0,
|
|
"step": 37805
|
|
},
|
|
{
|
|
"entropy": 5.428329706192017,
|
|
"epoch": 2.9417623030538804,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00041365532024558024,
|
|
"loss": 4.9956,
|
|
"mean_token_accuracy": 0.20076480507850647,
|
|
"num_tokens": 65594093.0,
|
|
"step": 37810
|
|
},
|
|
{
|
|
"entropy": 5.41986780166626,
|
|
"epoch": 2.942151332425598,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004136334916765877,
|
|
"loss": 4.93,
|
|
"mean_token_accuracy": 0.202096027135849,
|
|
"num_tokens": 65602503.0,
|
|
"step": 37815
|
|
},
|
|
{
|
|
"entropy": 5.365942525863647,
|
|
"epoch": 2.942540361797316,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00041361166100405264,
|
|
"loss": 4.909,
|
|
"mean_token_accuracy": 0.2046512708067894,
|
|
"num_tokens": 65611107.0,
|
|
"step": 37820
|
|
},
|
|
{
|
|
"entropy": 5.37239441871643,
|
|
"epoch": 2.9429293911690335,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004135898282283062,
|
|
"loss": 5.0311,
|
|
"mean_token_accuracy": 0.19952771663665772,
|
|
"num_tokens": 65620008.0,
|
|
"step": 37825
|
|
},
|
|
{
|
|
"entropy": 5.3321802616119385,
|
|
"epoch": 2.9433184205407508,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004135679933496797,
|
|
"loss": 4.9434,
|
|
"mean_token_accuracy": 0.19970779567956926,
|
|
"num_tokens": 65629206.0,
|
|
"step": 37830
|
|
},
|
|
{
|
|
"entropy": 5.386870622634888,
|
|
"epoch": 2.9437074499124685,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004135461563685045,
|
|
"loss": 4.9919,
|
|
"mean_token_accuracy": 0.2044909954071045,
|
|
"num_tokens": 65637403.0,
|
|
"step": 37835
|
|
},
|
|
{
|
|
"entropy": 5.395250368118286,
|
|
"epoch": 2.9440964792841857,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00041352431728511194,
|
|
"loss": 4.8278,
|
|
"mean_token_accuracy": 0.2167973816394806,
|
|
"num_tokens": 65646123.0,
|
|
"step": 37840
|
|
},
|
|
{
|
|
"entropy": 5.430347728729248,
|
|
"epoch": 2.9444855086559034,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004135024760998333,
|
|
"loss": 4.9613,
|
|
"mean_token_accuracy": 0.19529460072517396,
|
|
"num_tokens": 65655019.0,
|
|
"step": 37845
|
|
},
|
|
{
|
|
"entropy": 5.394823360443115,
|
|
"epoch": 2.944874538027621,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00041348063281299995,
|
|
"loss": 5.0278,
|
|
"mean_token_accuracy": 0.20284398943185805,
|
|
"num_tokens": 65663721.0,
|
|
"step": 37850
|
|
},
|
|
{
|
|
"entropy": 5.343653440475464,
|
|
"epoch": 2.945263567399339,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00041345878742494346,
|
|
"loss": 4.8083,
|
|
"mean_token_accuracy": 0.21191250383853913,
|
|
"num_tokens": 65671546.0,
|
|
"step": 37855
|
|
},
|
|
{
|
|
"entropy": 5.367030811309815,
|
|
"epoch": 2.945652596771056,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00041343693993599535,
|
|
"loss": 4.9732,
|
|
"mean_token_accuracy": 0.1999453142285347,
|
|
"num_tokens": 65680630.0,
|
|
"step": 37860
|
|
},
|
|
{
|
|
"entropy": 5.382861757278443,
|
|
"epoch": 2.9460416261427738,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004134150903464869,
|
|
"loss": 5.0071,
|
|
"mean_token_accuracy": 0.19370317608118057,
|
|
"num_tokens": 65688579.0,
|
|
"step": 37865
|
|
},
|
|
{
|
|
"entropy": 5.361818075180054,
|
|
"epoch": 2.9464306555144915,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004133932386567498,
|
|
"loss": 4.888,
|
|
"mean_token_accuracy": 0.19652958810329438,
|
|
"num_tokens": 65696531.0,
|
|
"step": 37870
|
|
},
|
|
{
|
|
"entropy": 5.312861776351928,
|
|
"epoch": 2.9468196848862087,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004133713848671156,
|
|
"loss": 4.8549,
|
|
"mean_token_accuracy": 0.208931565284729,
|
|
"num_tokens": 65705271.0,
|
|
"step": 37875
|
|
},
|
|
{
|
|
"entropy": 5.279078245162964,
|
|
"epoch": 2.9472087142579264,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004133495289779159,
|
|
"loss": 4.954,
|
|
"mean_token_accuracy": 0.19804306626319884,
|
|
"num_tokens": 65713638.0,
|
|
"step": 37880
|
|
},
|
|
{
|
|
"entropy": 5.391410875320434,
|
|
"epoch": 2.947597743629644,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004133276709894823,
|
|
"loss": 5.0216,
|
|
"mean_token_accuracy": 0.20135777145624162,
|
|
"num_tokens": 65722339.0,
|
|
"step": 37885
|
|
},
|
|
{
|
|
"entropy": 5.482567405700683,
|
|
"epoch": 2.947986773001362,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004133058109021464,
|
|
"loss": 5.1089,
|
|
"mean_token_accuracy": 0.19586635529994964,
|
|
"num_tokens": 65730969.0,
|
|
"step": 37890
|
|
},
|
|
{
|
|
"entropy": 5.484099721908569,
|
|
"epoch": 2.948375802373079,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00041328394871624003,
|
|
"loss": 4.9963,
|
|
"mean_token_accuracy": 0.19770125597715377,
|
|
"num_tokens": 65739196.0,
|
|
"step": 37895
|
|
},
|
|
{
|
|
"entropy": 5.443966722488403,
|
|
"epoch": 2.9487648317447968,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004132620844320948,
|
|
"loss": 5.0676,
|
|
"mean_token_accuracy": 0.18928190767765046,
|
|
"num_tokens": 65748032.0,
|
|
"step": 37900
|
|
},
|
|
{
|
|
"entropy": 5.3763673305511475,
|
|
"epoch": 2.9491538611165145,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004132402180500425,
|
|
"loss": 4.9665,
|
|
"mean_token_accuracy": 0.1958635851740837,
|
|
"num_tokens": 65756149.0,
|
|
"step": 37905
|
|
},
|
|
{
|
|
"entropy": 5.346277809143066,
|
|
"epoch": 2.9495428904882317,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004132183495704149,
|
|
"loss": 4.901,
|
|
"mean_token_accuracy": 0.20701911598443984,
|
|
"num_tokens": 65765275.0,
|
|
"step": 37910
|
|
},
|
|
{
|
|
"entropy": 5.390711784362793,
|
|
"epoch": 2.9499319198599494,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004131964789935439,
|
|
"loss": 4.9276,
|
|
"mean_token_accuracy": 0.20138952285051345,
|
|
"num_tokens": 65773517.0,
|
|
"step": 37915
|
|
},
|
|
{
|
|
"entropy": 5.361279916763306,
|
|
"epoch": 2.950320949231667,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004131746063197612,
|
|
"loss": 5.0251,
|
|
"mean_token_accuracy": 0.19626958966255187,
|
|
"num_tokens": 65782728.0,
|
|
"step": 37920
|
|
},
|
|
{
|
|
"entropy": 5.3929366111755375,
|
|
"epoch": 2.950709978603385,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004131527315493989,
|
|
"loss": 4.9535,
|
|
"mean_token_accuracy": 0.20005957931280136,
|
|
"num_tokens": 65791460.0,
|
|
"step": 37925
|
|
},
|
|
{
|
|
"entropy": 5.44710898399353,
|
|
"epoch": 2.951099007975102,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00041313085468278873,
|
|
"loss": 4.9582,
|
|
"mean_token_accuracy": 0.20158697068691253,
|
|
"num_tokens": 65799760.0,
|
|
"step": 37930
|
|
},
|
|
{
|
|
"entropy": 5.404420804977417,
|
|
"epoch": 2.9514880373468197,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004131089757202627,
|
|
"loss": 5.0317,
|
|
"mean_token_accuracy": 0.1968708500266075,
|
|
"num_tokens": 65808675.0,
|
|
"step": 37935
|
|
},
|
|
{
|
|
"entropy": 5.416034698486328,
|
|
"epoch": 2.951877066718537,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00041308709466215276,
|
|
"loss": 5.0126,
|
|
"mean_token_accuracy": 0.20078667551279067,
|
|
"num_tokens": 65817372.0,
|
|
"step": 37940
|
|
},
|
|
{
|
|
"entropy": 5.316894245147705,
|
|
"epoch": 2.9522660960902547,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.000413065211508791,
|
|
"loss": 4.9847,
|
|
"mean_token_accuracy": 0.19923557788133622,
|
|
"num_tokens": 65825899.0,
|
|
"step": 37945
|
|
},
|
|
{
|
|
"entropy": 5.343360328674317,
|
|
"epoch": 2.9526551254619724,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00041304332626050937,
|
|
"loss": 4.9151,
|
|
"mean_token_accuracy": 0.20738191455602645,
|
|
"num_tokens": 65834357.0,
|
|
"step": 37950
|
|
},
|
|
{
|
|
"entropy": 5.305930137634277,
|
|
"epoch": 2.95304415483369,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00041302143891764,
|
|
"loss": 4.8562,
|
|
"mean_token_accuracy": 0.21408461332321166,
|
|
"num_tokens": 65842869.0,
|
|
"step": 37955
|
|
},
|
|
{
|
|
"entropy": 5.280531549453736,
|
|
"epoch": 2.9534331842054073,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.000412999549480515,
|
|
"loss": 4.8317,
|
|
"mean_token_accuracy": 0.20469579249620437,
|
|
"num_tokens": 65851378.0,
|
|
"step": 37960
|
|
},
|
|
{
|
|
"entropy": 5.349099063873291,
|
|
"epoch": 2.953822213577125,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004129776579494665,
|
|
"loss": 4.884,
|
|
"mean_token_accuracy": 0.20679627358913422,
|
|
"num_tokens": 65860209.0,
|
|
"step": 37965
|
|
},
|
|
{
|
|
"entropy": 5.337625741958618,
|
|
"epoch": 2.9542112429488427,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004129557643248265,
|
|
"loss": 5.022,
|
|
"mean_token_accuracy": 0.19709988832473754,
|
|
"num_tokens": 65868313.0,
|
|
"step": 37970
|
|
},
|
|
{
|
|
"entropy": 5.340727758407593,
|
|
"epoch": 2.95460027232056,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.0004129338686069276,
|
|
"loss": 4.8683,
|
|
"mean_token_accuracy": 0.20918378680944444,
|
|
"num_tokens": 65876049.0,
|
|
"step": 37975
|
|
},
|
|
{
|
|
"entropy": 5.402218866348266,
|
|
"epoch": 2.9549893016922777,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004129119707961016,
|
|
"loss": 4.987,
|
|
"mean_token_accuracy": 0.20075734853744506,
|
|
"num_tokens": 65884042.0,
|
|
"step": 37980
|
|
},
|
|
{
|
|
"entropy": 5.355855417251587,
|
|
"epoch": 2.9553783310639954,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.000412890070892681,
|
|
"loss": 4.9824,
|
|
"mean_token_accuracy": 0.2013458639383316,
|
|
"num_tokens": 65892303.0,
|
|
"step": 37985
|
|
},
|
|
{
|
|
"entropy": 5.362926292419433,
|
|
"epoch": 2.955767360435713,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.000412868168896998,
|
|
"loss": 4.9776,
|
|
"mean_token_accuracy": 0.1947074294090271,
|
|
"num_tokens": 65900515.0,
|
|
"step": 37990
|
|
},
|
|
{
|
|
"entropy": 5.338269901275635,
|
|
"epoch": 2.9561563898074303,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004128462648093851,
|
|
"loss": 4.9371,
|
|
"mean_token_accuracy": 0.19888475090265273,
|
|
"num_tokens": 65908609.0,
|
|
"step": 37995
|
|
},
|
|
{
|
|
"entropy": 5.41190185546875,
|
|
"epoch": 2.956545419179148,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004128243586301745,
|
|
"loss": 4.9035,
|
|
"mean_token_accuracy": 0.20389135032892228,
|
|
"num_tokens": 65917803.0,
|
|
"step": 38000
|
|
},
|
|
{
|
|
"entropy": 5.358080530166626,
|
|
"epoch": 2.9569344485508657,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004128024503596986,
|
|
"loss": 4.8813,
|
|
"mean_token_accuracy": 0.2061939135193825,
|
|
"num_tokens": 65926269.0,
|
|
"step": 38005
|
|
},
|
|
{
|
|
"entropy": 5.307503604888916,
|
|
"epoch": 2.957323477922583,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00041278053999828986,
|
|
"loss": 4.8808,
|
|
"mean_token_accuracy": 0.2057558298110962,
|
|
"num_tokens": 65934826.0,
|
|
"step": 38010
|
|
},
|
|
{
|
|
"entropy": 5.376512241363526,
|
|
"epoch": 2.9577125072943007,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004127586275462806,
|
|
"loss": 4.95,
|
|
"mean_token_accuracy": 0.2016778513789177,
|
|
"num_tokens": 65943609.0,
|
|
"step": 38015
|
|
},
|
|
{
|
|
"entropy": 5.25891432762146,
|
|
"epoch": 2.9581015366660184,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.00041273671300400363,
|
|
"loss": 4.8412,
|
|
"mean_token_accuracy": 0.2051338016986847,
|
|
"num_tokens": 65952244.0,
|
|
"step": 38020
|
|
},
|
|
{
|
|
"entropy": 5.2514149188995365,
|
|
"epoch": 2.958490566037736,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00041271479637179116,
|
|
"loss": 4.8831,
|
|
"mean_token_accuracy": 0.20609053820371628,
|
|
"num_tokens": 65960915.0,
|
|
"step": 38025
|
|
},
|
|
{
|
|
"entropy": 5.314189434051514,
|
|
"epoch": 2.9588795954094533,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004126928776499759,
|
|
"loss": 4.8658,
|
|
"mean_token_accuracy": 0.20735610723495485,
|
|
"num_tokens": 65969375.0,
|
|
"step": 38030
|
|
},
|
|
{
|
|
"entropy": 5.409398126602173,
|
|
"epoch": 2.959268624781171,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004126709568388903,
|
|
"loss": 4.9383,
|
|
"mean_token_accuracy": 0.205841127038002,
|
|
"num_tokens": 65978724.0,
|
|
"step": 38035
|
|
},
|
|
{
|
|
"entropy": 5.397347354888916,
|
|
"epoch": 2.9596576541528883,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004126490339388672,
|
|
"loss": 5.0035,
|
|
"mean_token_accuracy": 0.19663366675376892,
|
|
"num_tokens": 65987255.0,
|
|
"step": 38040
|
|
},
|
|
{
|
|
"entropy": 5.419967365264893,
|
|
"epoch": 2.960046683524606,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.000412627108950239,
|
|
"loss": 5.078,
|
|
"mean_token_accuracy": 0.19764647036790847,
|
|
"num_tokens": 65996193.0,
|
|
"step": 38045
|
|
},
|
|
{
|
|
"entropy": 5.442963314056397,
|
|
"epoch": 2.9604357128963237,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004126051818733385,
|
|
"loss": 5.0503,
|
|
"mean_token_accuracy": 0.2008456513285637,
|
|
"num_tokens": 66005081.0,
|
|
"step": 38050
|
|
},
|
|
{
|
|
"entropy": 5.405065870285034,
|
|
"epoch": 2.9608247422680414,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004125832527084984,
|
|
"loss": 5.0239,
|
|
"mean_token_accuracy": 0.19613294154405594,
|
|
"num_tokens": 66014389.0,
|
|
"step": 38055
|
|
},
|
|
{
|
|
"entropy": 5.453430414199829,
|
|
"epoch": 2.961213771639759,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00041256132145605143,
|
|
"loss": 5.0457,
|
|
"mean_token_accuracy": 0.19435992538928987,
|
|
"num_tokens": 66022486.0,
|
|
"step": 38060
|
|
},
|
|
{
|
|
"entropy": 5.383773756027222,
|
|
"epoch": 2.9616028010114763,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004125393881163304,
|
|
"loss": 4.9247,
|
|
"mean_token_accuracy": 0.1971763089299202,
|
|
"num_tokens": 66031058.0,
|
|
"step": 38065
|
|
},
|
|
{
|
|
"entropy": 5.332604932785034,
|
|
"epoch": 2.961991830383194,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00041251745268966797,
|
|
"loss": 4.8475,
|
|
"mean_token_accuracy": 0.20473856180906297,
|
|
"num_tokens": 66038705.0,
|
|
"step": 38070
|
|
},
|
|
{
|
|
"entropy": 5.381705188751221,
|
|
"epoch": 2.9623808597549113,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004124955151763971,
|
|
"loss": 4.9335,
|
|
"mean_token_accuracy": 0.2037108600139618,
|
|
"num_tokens": 66047231.0,
|
|
"step": 38075
|
|
},
|
|
{
|
|
"entropy": 5.353786849975586,
|
|
"epoch": 2.962769889126629,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004124735755768506,
|
|
"loss": 4.9717,
|
|
"mean_token_accuracy": 0.19683888852596282,
|
|
"num_tokens": 66055536.0,
|
|
"step": 38080
|
|
},
|
|
{
|
|
"entropy": 5.394478464126587,
|
|
"epoch": 2.9631589184983467,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004124516338913615,
|
|
"loss": 5.01,
|
|
"mean_token_accuracy": 0.19394494444131852,
|
|
"num_tokens": 66065215.0,
|
|
"step": 38085
|
|
},
|
|
{
|
|
"entropy": 5.425701761245728,
|
|
"epoch": 2.9635479478700644,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004124296901202626,
|
|
"loss": 5.0112,
|
|
"mean_token_accuracy": 0.20239698886871338,
|
|
"num_tokens": 66074455.0,
|
|
"step": 38090
|
|
},
|
|
{
|
|
"entropy": 5.4518656730651855,
|
|
"epoch": 2.9639369772417816,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00041240774426388685,
|
|
"loss": 4.9569,
|
|
"mean_token_accuracy": 0.19702935963869095,
|
|
"num_tokens": 66082793.0,
|
|
"step": 38095
|
|
},
|
|
{
|
|
"entropy": 5.348243951797485,
|
|
"epoch": 2.9643260066134993,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004123857963225673,
|
|
"loss": 4.9146,
|
|
"mean_token_accuracy": 0.20479051619768143,
|
|
"num_tokens": 66091503.0,
|
|
"step": 38100
|
|
},
|
|
{
|
|
"entropy": 5.335634326934814,
|
|
"epoch": 2.964715035985217,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.000412363846296637,
|
|
"loss": 4.9844,
|
|
"mean_token_accuracy": 0.20402684509754182,
|
|
"num_tokens": 66099210.0,
|
|
"step": 38105
|
|
},
|
|
{
|
|
"entropy": 5.286110877990723,
|
|
"epoch": 2.9651040653569343,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.000412341894186429,
|
|
"loss": 4.9444,
|
|
"mean_token_accuracy": 0.2032478556036949,
|
|
"num_tokens": 66107338.0,
|
|
"step": 38110
|
|
},
|
|
{
|
|
"entropy": 5.376686429977417,
|
|
"epoch": 2.965493094728652,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004123199399922763,
|
|
"loss": 4.9761,
|
|
"mean_token_accuracy": 0.19714278727769852,
|
|
"num_tokens": 66115962.0,
|
|
"step": 38115
|
|
},
|
|
{
|
|
"entropy": 5.331450033187866,
|
|
"epoch": 2.9658821241003697,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00041229798371451203,
|
|
"loss": 4.9085,
|
|
"mean_token_accuracy": 0.20169205069541932,
|
|
"num_tokens": 66123849.0,
|
|
"step": 38120
|
|
},
|
|
{
|
|
"entropy": 5.396948528289795,
|
|
"epoch": 2.9662711534720874,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004122760253534695,
|
|
"loss": 4.9767,
|
|
"mean_token_accuracy": 0.19719480574131013,
|
|
"num_tokens": 66132791.0,
|
|
"step": 38125
|
|
},
|
|
{
|
|
"entropy": 5.430639410018921,
|
|
"epoch": 2.9666601828438046,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004122540649094817,
|
|
"loss": 5.0536,
|
|
"mean_token_accuracy": 0.20083200484514235,
|
|
"num_tokens": 66141434.0,
|
|
"step": 38130
|
|
},
|
|
{
|
|
"entropy": 5.3525067329406735,
|
|
"epoch": 2.9670492122155223,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00041223210238288196,
|
|
"loss": 4.9505,
|
|
"mean_token_accuracy": 0.2024303138256073,
|
|
"num_tokens": 66149941.0,
|
|
"step": 38135
|
|
},
|
|
{
|
|
"entropy": 5.437225866317749,
|
|
"epoch": 2.9674382415872396,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004122101377740035,
|
|
"loss": 4.9938,
|
|
"mean_token_accuracy": 0.19837080538272858,
|
|
"num_tokens": 66159411.0,
|
|
"step": 38140
|
|
},
|
|
{
|
|
"entropy": 5.393365716934204,
|
|
"epoch": 2.9678272709589573,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004121881710831796,
|
|
"loss": 4.9092,
|
|
"mean_token_accuracy": 0.207408344745636,
|
|
"num_tokens": 66168504.0,
|
|
"step": 38145
|
|
},
|
|
{
|
|
"entropy": 5.41329927444458,
|
|
"epoch": 2.968216300330675,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004121662023107435,
|
|
"loss": 4.9735,
|
|
"mean_token_accuracy": 0.2063927620649338,
|
|
"num_tokens": 66176777.0,
|
|
"step": 38150
|
|
},
|
|
{
|
|
"entropy": 5.397536182403565,
|
|
"epoch": 2.9686053297023927,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004121442314570286,
|
|
"loss": 4.9131,
|
|
"mean_token_accuracy": 0.2021958574652672,
|
|
"num_tokens": 66185028.0,
|
|
"step": 38155
|
|
},
|
|
{
|
|
"entropy": 5.3881669521331785,
|
|
"epoch": 2.9689943590741104,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00041212225852236834,
|
|
"loss": 4.9206,
|
|
"mean_token_accuracy": 0.20725196599960327,
|
|
"num_tokens": 66193139.0,
|
|
"step": 38160
|
|
},
|
|
{
|
|
"entropy": 5.389472341537475,
|
|
"epoch": 2.9693833884458276,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004121002835070961,
|
|
"loss": 5.0061,
|
|
"mean_token_accuracy": 0.18938835263252257,
|
|
"num_tokens": 66202196.0,
|
|
"step": 38165
|
|
},
|
|
{
|
|
"entropy": 5.4182610511779785,
|
|
"epoch": 2.9697724178175453,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004120783064115452,
|
|
"loss": 4.9524,
|
|
"mean_token_accuracy": 0.19817203134298325,
|
|
"num_tokens": 66209889.0,
|
|
"step": 38170
|
|
},
|
|
{
|
|
"entropy": 5.337880325317383,
|
|
"epoch": 2.9701614471892626,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004120563272360492,
|
|
"loss": 4.9281,
|
|
"mean_token_accuracy": 0.19813189059495925,
|
|
"num_tokens": 66218889.0,
|
|
"step": 38175
|
|
},
|
|
{
|
|
"entropy": 5.3923955917358395,
|
|
"epoch": 2.9705504765609803,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0004120343459809416,
|
|
"loss": 5.0335,
|
|
"mean_token_accuracy": 0.19475739747285842,
|
|
"num_tokens": 66227293.0,
|
|
"step": 38180
|
|
},
|
|
{
|
|
"entropy": 5.445002031326294,
|
|
"epoch": 2.970939505932698,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0004120123626465559,
|
|
"loss": 4.9783,
|
|
"mean_token_accuracy": 0.20320293605327605,
|
|
"num_tokens": 66235322.0,
|
|
"step": 38185
|
|
},
|
|
{
|
|
"entropy": 5.399246501922607,
|
|
"epoch": 2.9713285353044157,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00041199037723322566,
|
|
"loss": 5.0041,
|
|
"mean_token_accuracy": 0.19496151208877563,
|
|
"num_tokens": 66244776.0,
|
|
"step": 38190
|
|
},
|
|
{
|
|
"entropy": 5.326519918441773,
|
|
"epoch": 2.971717564676133,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00041196838974128446,
|
|
"loss": 4.9544,
|
|
"mean_token_accuracy": 0.1959936022758484,
|
|
"num_tokens": 66254058.0,
|
|
"step": 38195
|
|
},
|
|
{
|
|
"entropy": 5.412625455856324,
|
|
"epoch": 2.9721065940478506,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.000411946400171066,
|
|
"loss": 5.0433,
|
|
"mean_token_accuracy": 0.20058872550725937,
|
|
"num_tokens": 66262816.0,
|
|
"step": 38200
|
|
},
|
|
{
|
|
"entropy": 5.503356313705444,
|
|
"epoch": 2.9724956234195683,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00041192440852290385,
|
|
"loss": 5.0432,
|
|
"mean_token_accuracy": 0.19369950145483017,
|
|
"num_tokens": 66271808.0,
|
|
"step": 38205
|
|
},
|
|
{
|
|
"entropy": 5.402292728424072,
|
|
"epoch": 2.9728846527912856,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004119024147971318,
|
|
"loss": 4.9567,
|
|
"mean_token_accuracy": 0.1967776596546173,
|
|
"num_tokens": 66280737.0,
|
|
"step": 38210
|
|
},
|
|
{
|
|
"entropy": 5.293628168106079,
|
|
"epoch": 2.9732736821630033,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00041188041899408345,
|
|
"loss": 4.9351,
|
|
"mean_token_accuracy": 0.20252836644649505,
|
|
"num_tokens": 66289970.0,
|
|
"step": 38215
|
|
},
|
|
{
|
|
"entropy": 5.435785531997681,
|
|
"epoch": 2.973662711534721,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004118584211140926,
|
|
"loss": 5.0108,
|
|
"mean_token_accuracy": 0.19848366379737853,
|
|
"num_tokens": 66297917.0,
|
|
"step": 38220
|
|
},
|
|
{
|
|
"entropy": 5.375291395187378,
|
|
"epoch": 2.9740517409064386,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00041183642115749316,
|
|
"loss": 4.9378,
|
|
"mean_token_accuracy": 0.20438310801982879,
|
|
"num_tokens": 66306094.0,
|
|
"step": 38225
|
|
},
|
|
{
|
|
"entropy": 5.35624680519104,
|
|
"epoch": 2.974440770278156,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00041181441912461873,
|
|
"loss": 4.9166,
|
|
"mean_token_accuracy": 0.20022811889648437,
|
|
"num_tokens": 66315002.0,
|
|
"step": 38230
|
|
},
|
|
{
|
|
"entropy": 5.357925891876221,
|
|
"epoch": 2.9748297996498736,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004117924150158032,
|
|
"loss": 4.9201,
|
|
"mean_token_accuracy": 0.20063001066446304,
|
|
"num_tokens": 66322720.0,
|
|
"step": 38235
|
|
},
|
|
{
|
|
"entropy": 5.313100051879883,
|
|
"epoch": 2.9752188290215913,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00041177040883138064,
|
|
"loss": 4.8727,
|
|
"mean_token_accuracy": 0.2103765204548836,
|
|
"num_tokens": 66331478.0,
|
|
"step": 38240
|
|
},
|
|
{
|
|
"entropy": 5.443608713150025,
|
|
"epoch": 2.9756078583933085,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00041174840057168474,
|
|
"loss": 5.0211,
|
|
"mean_token_accuracy": 0.1977916806936264,
|
|
"num_tokens": 66339683.0,
|
|
"step": 38245
|
|
},
|
|
{
|
|
"entropy": 5.409101486206055,
|
|
"epoch": 2.9759968877650262,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004117263902370495,
|
|
"loss": 4.9734,
|
|
"mean_token_accuracy": 0.19708535820245743,
|
|
"num_tokens": 66347944.0,
|
|
"step": 38250
|
|
},
|
|
{
|
|
"entropy": 5.412063980102539,
|
|
"epoch": 2.976385917136744,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00041170437782780896,
|
|
"loss": 5.0619,
|
|
"mean_token_accuracy": 0.19884467422962188,
|
|
"num_tokens": 66356947.0,
|
|
"step": 38255
|
|
},
|
|
{
|
|
"entropy": 5.3431321144104,
|
|
"epoch": 2.9767749465084616,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.000411682363344297,
|
|
"loss": 4.824,
|
|
"mean_token_accuracy": 0.20706185400485994,
|
|
"num_tokens": 66365843.0,
|
|
"step": 38260
|
|
},
|
|
{
|
|
"entropy": 5.442998838424683,
|
|
"epoch": 2.977163975880179,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00041166034678684777,
|
|
"loss": 5.0765,
|
|
"mean_token_accuracy": 0.18775401413440704,
|
|
"num_tokens": 66375305.0,
|
|
"step": 38265
|
|
},
|
|
{
|
|
"entropy": 5.404040098190308,
|
|
"epoch": 2.9775530052518966,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004116383281557953,
|
|
"loss": 4.9199,
|
|
"mean_token_accuracy": 0.20447848737239838,
|
|
"num_tokens": 66383758.0,
|
|
"step": 38270
|
|
},
|
|
{
|
|
"entropy": 5.302385520935059,
|
|
"epoch": 2.977942034623614,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00041161630745147374,
|
|
"loss": 4.9415,
|
|
"mean_token_accuracy": 0.2046975940465927,
|
|
"num_tokens": 66393538.0,
|
|
"step": 38275
|
|
},
|
|
{
|
|
"entropy": 5.415553760528565,
|
|
"epoch": 2.9783310639953315,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004115942846742171,
|
|
"loss": 4.9878,
|
|
"mean_token_accuracy": 0.19805275946855544,
|
|
"num_tokens": 66402395.0,
|
|
"step": 38280
|
|
},
|
|
{
|
|
"entropy": 5.40104455947876,
|
|
"epoch": 2.9787200933670492,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004115722598243596,
|
|
"loss": 4.8964,
|
|
"mean_token_accuracy": 0.20020996183156967,
|
|
"num_tokens": 66410671.0,
|
|
"step": 38285
|
|
},
|
|
{
|
|
"entropy": 5.4165552139282225,
|
|
"epoch": 2.979109122738767,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00041155023290223537,
|
|
"loss": 4.9941,
|
|
"mean_token_accuracy": 0.20175594091415405,
|
|
"num_tokens": 66419370.0,
|
|
"step": 38290
|
|
},
|
|
{
|
|
"entropy": 5.286021900177002,
|
|
"epoch": 2.979498152110484,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004115282039081788,
|
|
"loss": 4.9292,
|
|
"mean_token_accuracy": 0.20300638526678086,
|
|
"num_tokens": 66427816.0,
|
|
"step": 38295
|
|
},
|
|
{
|
|
"entropy": 5.355514240264893,
|
|
"epoch": 2.979887181482202,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00041150617284252405,
|
|
"loss": 4.9358,
|
|
"mean_token_accuracy": 0.2051052838563919,
|
|
"num_tokens": 66436371.0,
|
|
"step": 38300
|
|
},
|
|
{
|
|
"entropy": 5.462689590454102,
|
|
"epoch": 2.9802762108539196,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0004114841397056053,
|
|
"loss": 4.9975,
|
|
"mean_token_accuracy": 0.20318372845649718,
|
|
"num_tokens": 66445158.0,
|
|
"step": 38305
|
|
},
|
|
{
|
|
"entropy": 5.425387811660767,
|
|
"epoch": 2.980665240225637,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00041146210449775704,
|
|
"loss": 4.9648,
|
|
"mean_token_accuracy": 0.20529809594154358,
|
|
"num_tokens": 66454133.0,
|
|
"step": 38310
|
|
},
|
|
{
|
|
"entropy": 5.310114526748658,
|
|
"epoch": 2.9810542695973545,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004114400672193136,
|
|
"loss": 4.9761,
|
|
"mean_token_accuracy": 0.2012653633952141,
|
|
"num_tokens": 66462698.0,
|
|
"step": 38315
|
|
},
|
|
{
|
|
"entropy": 5.407210206985473,
|
|
"epoch": 2.9814432989690722,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00041141802787060923,
|
|
"loss": 4.9668,
|
|
"mean_token_accuracy": 0.20530688762664795,
|
|
"num_tokens": 66473145.0,
|
|
"step": 38320
|
|
},
|
|
{
|
|
"entropy": 5.44717116355896,
|
|
"epoch": 2.98183232834079,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004113959864519784,
|
|
"loss": 4.9614,
|
|
"mean_token_accuracy": 0.198038512468338,
|
|
"num_tokens": 66482481.0,
|
|
"step": 38325
|
|
},
|
|
{
|
|
"entropy": 5.354867601394654,
|
|
"epoch": 2.982221357712507,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004113739429637556,
|
|
"loss": 4.9438,
|
|
"mean_token_accuracy": 0.2153770998120308,
|
|
"num_tokens": 66491338.0,
|
|
"step": 38330
|
|
},
|
|
{
|
|
"entropy": 5.362190389633179,
|
|
"epoch": 2.982610387084225,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004113518974062753,
|
|
"loss": 5.0429,
|
|
"mean_token_accuracy": 0.20234884172677994,
|
|
"num_tokens": 66500517.0,
|
|
"step": 38335
|
|
},
|
|
{
|
|
"entropy": 5.408883190155029,
|
|
"epoch": 2.9829994164559426,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.000411329849779872,
|
|
"loss": 4.9202,
|
|
"mean_token_accuracy": 0.2062375381588936,
|
|
"num_tokens": 66509431.0,
|
|
"step": 38340
|
|
},
|
|
{
|
|
"entropy": 5.375468778610229,
|
|
"epoch": 2.98338844582766,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00041130780008488015,
|
|
"loss": 4.9422,
|
|
"mean_token_accuracy": 0.20858137905597687,
|
|
"num_tokens": 66518111.0,
|
|
"step": 38345
|
|
},
|
|
{
|
|
"entropy": 5.3632570743560795,
|
|
"epoch": 2.9837774751993775,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004112857483216344,
|
|
"loss": 4.8964,
|
|
"mean_token_accuracy": 0.20067645013332366,
|
|
"num_tokens": 66527325.0,
|
|
"step": 38350
|
|
},
|
|
{
|
|
"entropy": 5.371960306167603,
|
|
"epoch": 2.9841665045710952,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00041126369449046935,
|
|
"loss": 4.9008,
|
|
"mean_token_accuracy": 0.20264987647533417,
|
|
"num_tokens": 66536542.0,
|
|
"step": 38355
|
|
},
|
|
{
|
|
"entropy": 5.415199422836304,
|
|
"epoch": 2.984555533942813,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00041124163859171967,
|
|
"loss": 4.9534,
|
|
"mean_token_accuracy": 0.1968763843178749,
|
|
"num_tokens": 66544724.0,
|
|
"step": 38360
|
|
},
|
|
{
|
|
"entropy": 5.409219217300415,
|
|
"epoch": 2.98494456331453,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004112195806257199,
|
|
"loss": 5.0354,
|
|
"mean_token_accuracy": 0.19687448740005492,
|
|
"num_tokens": 66553679.0,
|
|
"step": 38365
|
|
},
|
|
{
|
|
"entropy": 5.307811307907104,
|
|
"epoch": 2.985333592686248,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004111975205928049,
|
|
"loss": 4.8851,
|
|
"mean_token_accuracy": 0.19986024498939514,
|
|
"num_tokens": 66562593.0,
|
|
"step": 38370
|
|
},
|
|
{
|
|
"entropy": 5.3876689910888675,
|
|
"epoch": 2.985722622057965,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00041117545849330924,
|
|
"loss": 4.9198,
|
|
"mean_token_accuracy": 0.20852190405130386,
|
|
"num_tokens": 66570947.0,
|
|
"step": 38375
|
|
},
|
|
{
|
|
"entropy": 5.332684803009033,
|
|
"epoch": 2.986111651429683,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00041115339432756776,
|
|
"loss": 4.8324,
|
|
"mean_token_accuracy": 0.21178413182497025,
|
|
"num_tokens": 66579733.0,
|
|
"step": 38380
|
|
},
|
|
{
|
|
"entropy": 5.362506961822509,
|
|
"epoch": 2.9865006808014005,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004111313280959152,
|
|
"loss": 4.9372,
|
|
"mean_token_accuracy": 0.2013031467795372,
|
|
"num_tokens": 66589252.0,
|
|
"step": 38385
|
|
},
|
|
{
|
|
"entropy": 5.343757629394531,
|
|
"epoch": 2.986889710173118,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00041110925979868647,
|
|
"loss": 4.9159,
|
|
"mean_token_accuracy": 0.21294088661670685,
|
|
"num_tokens": 66597817.0,
|
|
"step": 38390
|
|
},
|
|
{
|
|
"entropy": 5.33729887008667,
|
|
"epoch": 2.9872787395448355,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004110871894362163,
|
|
"loss": 4.9048,
|
|
"mean_token_accuracy": 0.2080773890018463,
|
|
"num_tokens": 66606154.0,
|
|
"step": 38395
|
|
},
|
|
{
|
|
"entropy": 5.325871849060059,
|
|
"epoch": 2.987667768916553,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00041106511700883975,
|
|
"loss": 4.9285,
|
|
"mean_token_accuracy": 0.20890228152275087,
|
|
"num_tokens": 66614799.0,
|
|
"step": 38400
|
|
},
|
|
{
|
|
"entropy": 5.373120403289795,
|
|
"epoch": 2.988056798288271,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00041104304251689147,
|
|
"loss": 4.8988,
|
|
"mean_token_accuracy": 0.20577867329120636,
|
|
"num_tokens": 66623250.0,
|
|
"step": 38405
|
|
},
|
|
{
|
|
"entropy": 5.283082962036133,
|
|
"epoch": 2.988445827659988,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00041102096596070666,
|
|
"loss": 4.8262,
|
|
"mean_token_accuracy": 0.2111327514052391,
|
|
"num_tokens": 66631948.0,
|
|
"step": 38410
|
|
},
|
|
{
|
|
"entropy": 5.284381008148193,
|
|
"epoch": 2.988834857031706,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00041099888734062013,
|
|
"loss": 4.8849,
|
|
"mean_token_accuracy": 0.2039794385433197,
|
|
"num_tokens": 66639864.0,
|
|
"step": 38415
|
|
},
|
|
{
|
|
"entropy": 5.356776189804077,
|
|
"epoch": 2.9892238864034235,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.000410976806656967,
|
|
"loss": 4.898,
|
|
"mean_token_accuracy": 0.20133571326732635,
|
|
"num_tokens": 66647758.0,
|
|
"step": 38420
|
|
},
|
|
{
|
|
"entropy": 5.381281518936158,
|
|
"epoch": 2.989612915775141,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0004109547239100822,
|
|
"loss": 4.9151,
|
|
"mean_token_accuracy": 0.21392828077077866,
|
|
"num_tokens": 66655490.0,
|
|
"step": 38425
|
|
},
|
|
{
|
|
"entropy": 5.259660339355468,
|
|
"epoch": 2.9900019451468585,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004109326391003009,
|
|
"loss": 4.9055,
|
|
"mean_token_accuracy": 0.20990592539310454,
|
|
"num_tokens": 66664264.0,
|
|
"step": 38430
|
|
},
|
|
{
|
|
"entropy": 5.307831573486328,
|
|
"epoch": 2.990390974518576,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00041091055222795814,
|
|
"loss": 4.8568,
|
|
"mean_token_accuracy": 0.20090347528457642,
|
|
"num_tokens": 66672595.0,
|
|
"step": 38435
|
|
},
|
|
{
|
|
"entropy": 5.40856671333313,
|
|
"epoch": 2.990780003890294,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004108884632933891,
|
|
"loss": 4.9445,
|
|
"mean_token_accuracy": 0.20128121823072434,
|
|
"num_tokens": 66680494.0,
|
|
"step": 38440
|
|
},
|
|
{
|
|
"entropy": 5.442004251480102,
|
|
"epoch": 2.991169033262011,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00041086637229692893,
|
|
"loss": 5.0357,
|
|
"mean_token_accuracy": 0.19295066148042678,
|
|
"num_tokens": 66689462.0,
|
|
"step": 38445
|
|
},
|
|
{
|
|
"entropy": 5.375440645217895,
|
|
"epoch": 2.991558062633729,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00041084427923891275,
|
|
"loss": 4.9332,
|
|
"mean_token_accuracy": 0.20488304197788237,
|
|
"num_tokens": 66697123.0,
|
|
"step": 38450
|
|
},
|
|
{
|
|
"entropy": 5.392136430740356,
|
|
"epoch": 2.9919470920054465,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00041082218411967586,
|
|
"loss": 5.0514,
|
|
"mean_token_accuracy": 0.18936477452516556,
|
|
"num_tokens": 66705889.0,
|
|
"step": 38455
|
|
},
|
|
{
|
|
"entropy": 5.393692541122436,
|
|
"epoch": 2.992336121377164,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00041080008693955355,
|
|
"loss": 4.9468,
|
|
"mean_token_accuracy": 0.20885615646839142,
|
|
"num_tokens": 66713832.0,
|
|
"step": 38460
|
|
},
|
|
{
|
|
"entropy": 5.390092611312866,
|
|
"epoch": 2.9927251507488815,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004107779876988811,
|
|
"loss": 4.9191,
|
|
"mean_token_accuracy": 0.2093328654766083,
|
|
"num_tokens": 66722594.0,
|
|
"step": 38465
|
|
},
|
|
{
|
|
"entropy": 5.382728433609008,
|
|
"epoch": 2.993114180120599,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00041075588639799375,
|
|
"loss": 4.8674,
|
|
"mean_token_accuracy": 0.20376219749450683,
|
|
"num_tokens": 66731125.0,
|
|
"step": 38470
|
|
},
|
|
{
|
|
"entropy": 5.348121261596679,
|
|
"epoch": 2.9935032094923164,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004107337830372269,
|
|
"loss": 5.071,
|
|
"mean_token_accuracy": 0.20052508413791656,
|
|
"num_tokens": 66739234.0,
|
|
"step": 38475
|
|
},
|
|
{
|
|
"entropy": 5.371851682662964,
|
|
"epoch": 2.993892238864034,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.000410711677616916,
|
|
"loss": 4.9533,
|
|
"mean_token_accuracy": 0.1963425725698471,
|
|
"num_tokens": 66747630.0,
|
|
"step": 38480
|
|
},
|
|
{
|
|
"entropy": 5.4359416484832765,
|
|
"epoch": 2.994281268235752,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004106895701373963,
|
|
"loss": 4.9676,
|
|
"mean_token_accuracy": 0.20338501483201982,
|
|
"num_tokens": 66755545.0,
|
|
"step": 38485
|
|
},
|
|
{
|
|
"entropy": 5.392308759689331,
|
|
"epoch": 2.9946702976074695,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00041066746059900336,
|
|
"loss": 4.9607,
|
|
"mean_token_accuracy": 0.2045695349574089,
|
|
"num_tokens": 66764336.0,
|
|
"step": 38490
|
|
},
|
|
{
|
|
"entropy": 5.390614652633667,
|
|
"epoch": 2.995059326979187,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004106453490020727,
|
|
"loss": 4.9691,
|
|
"mean_token_accuracy": 0.2070741131901741,
|
|
"num_tokens": 66773045.0,
|
|
"step": 38495
|
|
},
|
|
{
|
|
"entropy": 5.379932832717896,
|
|
"epoch": 2.9954483563509045,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00041062323534693973,
|
|
"loss": 4.9012,
|
|
"mean_token_accuracy": 0.20910641998052598,
|
|
"num_tokens": 66781228.0,
|
|
"step": 38500
|
|
},
|
|
{
|
|
"entropy": 5.472181177139282,
|
|
"epoch": 2.995837385722622,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00041060111963394004,
|
|
"loss": 5.0317,
|
|
"mean_token_accuracy": 0.20062291175127028,
|
|
"num_tokens": 66789829.0,
|
|
"step": 38505
|
|
},
|
|
{
|
|
"entropy": 5.3886044979095455,
|
|
"epoch": 2.9962264150943394,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00041057900186340917,
|
|
"loss": 4.8958,
|
|
"mean_token_accuracy": 0.20587784349918364,
|
|
"num_tokens": 66798023.0,
|
|
"step": 38510
|
|
},
|
|
{
|
|
"entropy": 5.3275487422943115,
|
|
"epoch": 2.996615444466057,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00041055688203568274,
|
|
"loss": 4.9125,
|
|
"mean_token_accuracy": 0.20619778484106063,
|
|
"num_tokens": 66806536.0,
|
|
"step": 38515
|
|
},
|
|
{
|
|
"entropy": 5.342609024047851,
|
|
"epoch": 2.997004473837775,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004105347601510964,
|
|
"loss": 4.8717,
|
|
"mean_token_accuracy": 0.20333769023418427,
|
|
"num_tokens": 66815698.0,
|
|
"step": 38520
|
|
},
|
|
{
|
|
"entropy": 5.370044946670532,
|
|
"epoch": 2.9973935032094925,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004105126362099859,
|
|
"loss": 4.9176,
|
|
"mean_token_accuracy": 0.2072613313794136,
|
|
"num_tokens": 66824358.0,
|
|
"step": 38525
|
|
},
|
|
{
|
|
"entropy": 5.349159288406372,
|
|
"epoch": 2.9977825325812097,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004104905102126867,
|
|
"loss": 4.8933,
|
|
"mean_token_accuracy": 0.20782238245010376,
|
|
"num_tokens": 66832895.0,
|
|
"step": 38530
|
|
},
|
|
{
|
|
"entropy": 5.341231155395508,
|
|
"epoch": 2.9981715619529274,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004104683821595347,
|
|
"loss": 4.8651,
|
|
"mean_token_accuracy": 0.2037097305059433,
|
|
"num_tokens": 66842289.0,
|
|
"step": 38535
|
|
},
|
|
{
|
|
"entropy": 5.359250879287719,
|
|
"epoch": 2.998560591324645,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00041044625205086566,
|
|
"loss": 4.9173,
|
|
"mean_token_accuracy": 0.20928233563899995,
|
|
"num_tokens": 66850656.0,
|
|
"step": 38540
|
|
},
|
|
{
|
|
"entropy": 5.314585733413696,
|
|
"epoch": 2.9989496206963624,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00041042411988701535,
|
|
"loss": 4.8274,
|
|
"mean_token_accuracy": 0.20613961815834045,
|
|
"num_tokens": 66859518.0,
|
|
"step": 38545
|
|
},
|
|
{
|
|
"entropy": 5.307775259017944,
|
|
"epoch": 2.99933865006808,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00041040198566831944,
|
|
"loss": 4.9367,
|
|
"mean_token_accuracy": 0.20262207984924316,
|
|
"num_tokens": 66868431.0,
|
|
"step": 38550
|
|
},
|
|
{
|
|
"entropy": 5.3857897281646725,
|
|
"epoch": 2.999727679439798,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004103798493951141,
|
|
"loss": 4.9396,
|
|
"mean_token_accuracy": 0.20116014033555984,
|
|
"num_tokens": 66877255.0,
|
|
"step": 38555
|
|
},
|
|
{
|
|
"entropy": 5.409631835089789,
|
|
"epoch": 3.0000778058743434,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00041035771106773483,
|
|
"loss": 4.8708,
|
|
"mean_token_accuracy": 0.20738539761967129,
|
|
"num_tokens": 66884881.0,
|
|
"step": 38560
|
|
},
|
|
{
|
|
"entropy": 5.371629858016968,
|
|
"epoch": 3.000466835246061,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004103355706865179,
|
|
"loss": 4.8855,
|
|
"mean_token_accuracy": 0.2131451591849327,
|
|
"num_tokens": 66893369.0,
|
|
"step": 38565
|
|
},
|
|
{
|
|
"entropy": 5.376195287704467,
|
|
"epoch": 3.0008558646177788,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.000410313428251799,
|
|
"loss": 4.8508,
|
|
"mean_token_accuracy": 0.20677294284105302,
|
|
"num_tokens": 66900994.0,
|
|
"step": 38570
|
|
},
|
|
{
|
|
"entropy": 5.313718271255493,
|
|
"epoch": 3.001244893989496,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00041029128376391424,
|
|
"loss": 4.8936,
|
|
"mean_token_accuracy": 0.2079121947288513,
|
|
"num_tokens": 66909906.0,
|
|
"step": 38575
|
|
},
|
|
{
|
|
"entropy": 5.351029586791992,
|
|
"epoch": 3.0016339233612137,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00041026913722319954,
|
|
"loss": 4.8539,
|
|
"mean_token_accuracy": 0.2122810199856758,
|
|
"num_tokens": 66918712.0,
|
|
"step": 38580
|
|
},
|
|
{
|
|
"entropy": 5.435798263549804,
|
|
"epoch": 3.0020229527329314,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.000410246988629991,
|
|
"loss": 4.8635,
|
|
"mean_token_accuracy": 0.20826564133167266,
|
|
"num_tokens": 66927462.0,
|
|
"step": 38585
|
|
},
|
|
{
|
|
"entropy": 5.297920799255371,
|
|
"epoch": 3.002411982104649,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00041022483798462466,
|
|
"loss": 4.7872,
|
|
"mean_token_accuracy": 0.21642928719520568,
|
|
"num_tokens": 66935920.0,
|
|
"step": 38590
|
|
},
|
|
{
|
|
"entropy": 5.3110490322113035,
|
|
"epoch": 3.0028010114763664,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004102026852874367,
|
|
"loss": 4.8484,
|
|
"mean_token_accuracy": 0.21492189168930054,
|
|
"num_tokens": 66944595.0,
|
|
"step": 38595
|
|
},
|
|
{
|
|
"entropy": 5.423013353347779,
|
|
"epoch": 3.003190040848084,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.00041018053053876316,
|
|
"loss": 5.0451,
|
|
"mean_token_accuracy": 0.20462241023778915,
|
|
"num_tokens": 66954025.0,
|
|
"step": 38600
|
|
},
|
|
{
|
|
"entropy": 5.407014846801758,
|
|
"epoch": 3.0035790702198017,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004101583737389402,
|
|
"loss": 4.8387,
|
|
"mean_token_accuracy": 0.21155964732170104,
|
|
"num_tokens": 66963143.0,
|
|
"step": 38605
|
|
},
|
|
{
|
|
"entropy": 5.403164339065552,
|
|
"epoch": 3.003968099591519,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00041013621488830406,
|
|
"loss": 4.9473,
|
|
"mean_token_accuracy": 0.20335627645254134,
|
|
"num_tokens": 66972619.0,
|
|
"step": 38610
|
|
},
|
|
{
|
|
"entropy": 5.290521144866943,
|
|
"epoch": 3.0043571289632367,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00041011405398719096,
|
|
"loss": 4.8025,
|
|
"mean_token_accuracy": 0.21760838627815246,
|
|
"num_tokens": 66980749.0,
|
|
"step": 38615
|
|
},
|
|
{
|
|
"entropy": 5.376144075393677,
|
|
"epoch": 3.0047461583349544,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00041009189103593716,
|
|
"loss": 4.864,
|
|
"mean_token_accuracy": 0.20319731235504152,
|
|
"num_tokens": 66989656.0,
|
|
"step": 38620
|
|
},
|
|
{
|
|
"entropy": 5.35672698020935,
|
|
"epoch": 3.0051351877066717,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004100697260348789,
|
|
"loss": 4.846,
|
|
"mean_token_accuracy": 0.21243641525506973,
|
|
"num_tokens": 66998308.0,
|
|
"step": 38625
|
|
},
|
|
{
|
|
"entropy": 5.387416028976441,
|
|
"epoch": 3.0055242170783893,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.00041004755898435254,
|
|
"loss": 4.9042,
|
|
"mean_token_accuracy": 0.2012210488319397,
|
|
"num_tokens": 67007596.0,
|
|
"step": 38630
|
|
},
|
|
{
|
|
"entropy": 5.294346761703491,
|
|
"epoch": 3.005913246450107,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004100253898846945,
|
|
"loss": 4.784,
|
|
"mean_token_accuracy": 0.21138084381818772,
|
|
"num_tokens": 67016137.0,
|
|
"step": 38635
|
|
},
|
|
{
|
|
"entropy": 5.410755395889282,
|
|
"epoch": 3.0063022758218247,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.000410003218736241,
|
|
"loss": 4.9862,
|
|
"mean_token_accuracy": 0.2084052622318268,
|
|
"num_tokens": 67024839.0,
|
|
"step": 38640
|
|
},
|
|
{
|
|
"entropy": 5.389471626281738,
|
|
"epoch": 3.006691305193542,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00040998104553932856,
|
|
"loss": 4.8629,
|
|
"mean_token_accuracy": 0.20004348903894426,
|
|
"num_tokens": 67033572.0,
|
|
"step": 38645
|
|
},
|
|
{
|
|
"entropy": 5.4100316047668455,
|
|
"epoch": 3.0070803345652597,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004099588702942936,
|
|
"loss": 4.8707,
|
|
"mean_token_accuracy": 0.2084184169769287,
|
|
"num_tokens": 67042355.0,
|
|
"step": 38650
|
|
},
|
|
{
|
|
"entropy": 5.283771944046021,
|
|
"epoch": 3.0074693639369774,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00040993669300147257,
|
|
"loss": 4.7895,
|
|
"mean_token_accuracy": 0.20945192873477936,
|
|
"num_tokens": 67050418.0,
|
|
"step": 38655
|
|
},
|
|
{
|
|
"entropy": 5.32660059928894,
|
|
"epoch": 3.0078583933086946,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00040991451366120205,
|
|
"loss": 4.9519,
|
|
"mean_token_accuracy": 0.19270940870046616,
|
|
"num_tokens": 67059846.0,
|
|
"step": 38660
|
|
},
|
|
{
|
|
"entropy": 5.440450239181518,
|
|
"epoch": 3.0082474226804123,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004098923322738185,
|
|
"loss": 4.9236,
|
|
"mean_token_accuracy": 0.20375099331140517,
|
|
"num_tokens": 67068680.0,
|
|
"step": 38665
|
|
},
|
|
{
|
|
"entropy": 5.328177642822266,
|
|
"epoch": 3.00863645205213,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00040987014883965843,
|
|
"loss": 4.8411,
|
|
"mean_token_accuracy": 0.20709384530782698,
|
|
"num_tokens": 67077607.0,
|
|
"step": 38670
|
|
},
|
|
{
|
|
"entropy": 5.321854066848755,
|
|
"epoch": 3.0090254814238473,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00040984796335905867,
|
|
"loss": 4.8799,
|
|
"mean_token_accuracy": 0.2080298349261284,
|
|
"num_tokens": 67086553.0,
|
|
"step": 38675
|
|
},
|
|
{
|
|
"entropy": 5.428297424316407,
|
|
"epoch": 3.009414510795565,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004098257758323556,
|
|
"loss": 4.9146,
|
|
"mean_token_accuracy": 0.2056966692209244,
|
|
"num_tokens": 67095543.0,
|
|
"step": 38680
|
|
},
|
|
{
|
|
"entropy": 5.3603187084198,
|
|
"epoch": 3.0098035401672827,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004098035862598859,
|
|
"loss": 4.9633,
|
|
"mean_token_accuracy": 0.20198530703783035,
|
|
"num_tokens": 67103831.0,
|
|
"step": 38685
|
|
},
|
|
{
|
|
"entropy": 5.353617715835571,
|
|
"epoch": 3.0101925695390004,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004097813946419865,
|
|
"loss": 4.8554,
|
|
"mean_token_accuracy": 0.20775722563266755,
|
|
"num_tokens": 67112289.0,
|
|
"step": 38690
|
|
},
|
|
{
|
|
"entropy": 5.337837553024292,
|
|
"epoch": 3.0105815989107176,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004097592009789939,
|
|
"loss": 4.9124,
|
|
"mean_token_accuracy": 0.21032709181308745,
|
|
"num_tokens": 67120376.0,
|
|
"step": 38695
|
|
},
|
|
{
|
|
"entropy": 5.409401607513428,
|
|
"epoch": 3.0109706282824353,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00040973700527124494,
|
|
"loss": 4.955,
|
|
"mean_token_accuracy": 0.201490318775177,
|
|
"num_tokens": 67128412.0,
|
|
"step": 38700
|
|
},
|
|
{
|
|
"entropy": 5.301716327667236,
|
|
"epoch": 3.011359657654153,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00040971480751907633,
|
|
"loss": 4.7568,
|
|
"mean_token_accuracy": 0.20584432929754257,
|
|
"num_tokens": 67136212.0,
|
|
"step": 38705
|
|
},
|
|
{
|
|
"entropy": 5.325664615631103,
|
|
"epoch": 3.0117486870258703,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00040969260772282494,
|
|
"loss": 4.9437,
|
|
"mean_token_accuracy": 0.2031140595674515,
|
|
"num_tokens": 67145206.0,
|
|
"step": 38710
|
|
},
|
|
{
|
|
"entropy": 5.30687198638916,
|
|
"epoch": 3.012137716397588,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004096704058828277,
|
|
"loss": 4.824,
|
|
"mean_token_accuracy": 0.20737795233726503,
|
|
"num_tokens": 67153760.0,
|
|
"step": 38715
|
|
},
|
|
{
|
|
"entropy": 5.407768869400025,
|
|
"epoch": 3.0125267457693057,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00040964820199942135,
|
|
"loss": 4.9231,
|
|
"mean_token_accuracy": 0.2054056704044342,
|
|
"num_tokens": 67162574.0,
|
|
"step": 38720
|
|
},
|
|
{
|
|
"entropy": 5.396566534042359,
|
|
"epoch": 3.012915775141023,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004096259960729428,
|
|
"loss": 4.8972,
|
|
"mean_token_accuracy": 0.20496667176485062,
|
|
"num_tokens": 67171329.0,
|
|
"step": 38725
|
|
},
|
|
{
|
|
"entropy": 5.382814598083496,
|
|
"epoch": 3.0133048045127406,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00040960378810372906,
|
|
"loss": 4.8394,
|
|
"mean_token_accuracy": 0.20607417821884155,
|
|
"num_tokens": 67180243.0,
|
|
"step": 38730
|
|
},
|
|
{
|
|
"entropy": 5.228844404220581,
|
|
"epoch": 3.0136938338844583,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004095815780921171,
|
|
"loss": 4.7274,
|
|
"mean_token_accuracy": 0.21841067224740982,
|
|
"num_tokens": 67189610.0,
|
|
"step": 38735
|
|
},
|
|
{
|
|
"entropy": 5.362099885940552,
|
|
"epoch": 3.014082863256176,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004095593660384439,
|
|
"loss": 4.9426,
|
|
"mean_token_accuracy": 0.1998063862323761,
|
|
"num_tokens": 67199084.0,
|
|
"step": 38740
|
|
},
|
|
{
|
|
"entropy": 5.3749449253082275,
|
|
"epoch": 3.0144718926278933,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004095371519430465,
|
|
"loss": 4.8633,
|
|
"mean_token_accuracy": 0.20558678209781647,
|
|
"num_tokens": 67207705.0,
|
|
"step": 38745
|
|
},
|
|
{
|
|
"entropy": 5.399401569366455,
|
|
"epoch": 3.014860921999611,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.00040951493580626195,
|
|
"loss": 4.8791,
|
|
"mean_token_accuracy": 0.20847342014312745,
|
|
"num_tokens": 67215576.0,
|
|
"step": 38750
|
|
},
|
|
{
|
|
"entropy": 5.314389848709107,
|
|
"epoch": 3.0152499513713287,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0004094927176284273,
|
|
"loss": 4.793,
|
|
"mean_token_accuracy": 0.20512417405843736,
|
|
"num_tokens": 67223700.0,
|
|
"step": 38755
|
|
},
|
|
{
|
|
"entropy": 5.322641468048095,
|
|
"epoch": 3.015638980743046,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00040947049740987977,
|
|
"loss": 4.8718,
|
|
"mean_token_accuracy": 0.21142702400684357,
|
|
"num_tokens": 67231878.0,
|
|
"step": 38760
|
|
},
|
|
{
|
|
"entropy": 5.352596378326416,
|
|
"epoch": 3.0160280101147636,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004094482751509565,
|
|
"loss": 4.8324,
|
|
"mean_token_accuracy": 0.206750850379467,
|
|
"num_tokens": 67240174.0,
|
|
"step": 38765
|
|
},
|
|
{
|
|
"entropy": 5.382400608062744,
|
|
"epoch": 3.0164170394864813,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004094260508519947,
|
|
"loss": 4.9231,
|
|
"mean_token_accuracy": 0.20973684042692184,
|
|
"num_tokens": 67248617.0,
|
|
"step": 38770
|
|
},
|
|
{
|
|
"entropy": 5.461048030853272,
|
|
"epoch": 3.0168060688581986,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00040940382451333144,
|
|
"loss": 5.0122,
|
|
"mean_token_accuracy": 0.1997057780623436,
|
|
"num_tokens": 67258581.0,
|
|
"step": 38775
|
|
},
|
|
{
|
|
"entropy": 5.511263465881347,
|
|
"epoch": 3.0171950982299163,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00040938159613530405,
|
|
"loss": 4.9448,
|
|
"mean_token_accuracy": 0.21168652027845383,
|
|
"num_tokens": 67267854.0,
|
|
"step": 38780
|
|
},
|
|
{
|
|
"entropy": 5.391778755187988,
|
|
"epoch": 3.017584127601634,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004093593657182499,
|
|
"loss": 4.8626,
|
|
"mean_token_accuracy": 0.20464949011802674,
|
|
"num_tokens": 67277391.0,
|
|
"step": 38785
|
|
},
|
|
{
|
|
"entropy": 5.327175617218018,
|
|
"epoch": 3.0179731569733517,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004093371332625062,
|
|
"loss": 4.8645,
|
|
"mean_token_accuracy": 0.2114735335111618,
|
|
"num_tokens": 67285460.0,
|
|
"step": 38790
|
|
},
|
|
{
|
|
"entropy": 5.383656120300293,
|
|
"epoch": 3.018362186345069,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004093148987684103,
|
|
"loss": 4.8854,
|
|
"mean_token_accuracy": 0.20634294301271439,
|
|
"num_tokens": 67294023.0,
|
|
"step": 38795
|
|
},
|
|
{
|
|
"entropy": 5.322823572158813,
|
|
"epoch": 3.0187512157167866,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00040929266223629966,
|
|
"loss": 4.7939,
|
|
"mean_token_accuracy": 0.207029826939106,
|
|
"num_tokens": 67302053.0,
|
|
"step": 38800
|
|
},
|
|
{
|
|
"entropy": 5.327833557128907,
|
|
"epoch": 3.0191402450885043,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00040927042366651164,
|
|
"loss": 4.9682,
|
|
"mean_token_accuracy": 0.20061895996332169,
|
|
"num_tokens": 67310478.0,
|
|
"step": 38805
|
|
},
|
|
{
|
|
"entropy": 5.335454654693604,
|
|
"epoch": 3.0195292744602216,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00040924818305938354,
|
|
"loss": 4.8291,
|
|
"mean_token_accuracy": 0.2098989099264145,
|
|
"num_tokens": 67318096.0,
|
|
"step": 38810
|
|
},
|
|
{
|
|
"entropy": 5.369532489776612,
|
|
"epoch": 3.0199183038319393,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00040922594041525303,
|
|
"loss": 4.9016,
|
|
"mean_token_accuracy": 0.20274136066436768,
|
|
"num_tokens": 67326760.0,
|
|
"step": 38815
|
|
},
|
|
{
|
|
"entropy": 5.305325222015381,
|
|
"epoch": 3.020307333203657,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004092036957344574,
|
|
"loss": 4.8269,
|
|
"mean_token_accuracy": 0.20876094102859497,
|
|
"num_tokens": 67335982.0,
|
|
"step": 38820
|
|
},
|
|
{
|
|
"entropy": 5.309072589874267,
|
|
"epoch": 3.0206963625753747,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00040918144901733443,
|
|
"loss": 4.8757,
|
|
"mean_token_accuracy": 0.20364058911800384,
|
|
"num_tokens": 67344666.0,
|
|
"step": 38825
|
|
},
|
|
{
|
|
"entropy": 5.375777769088745,
|
|
"epoch": 3.021085391947092,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004091592002642215,
|
|
"loss": 4.9244,
|
|
"mean_token_accuracy": 0.20489163994789122,
|
|
"num_tokens": 67352607.0,
|
|
"step": 38830
|
|
},
|
|
{
|
|
"entropy": 5.363179779052734,
|
|
"epoch": 3.0214744213188096,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004091369494754562,
|
|
"loss": 4.9179,
|
|
"mean_token_accuracy": 0.20898292660713197,
|
|
"num_tokens": 67361097.0,
|
|
"step": 38835
|
|
},
|
|
{
|
|
"entropy": 5.274556970596313,
|
|
"epoch": 3.0218634506905273,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004091146966513763,
|
|
"loss": 4.854,
|
|
"mean_token_accuracy": 0.20321758091449738,
|
|
"num_tokens": 67370229.0,
|
|
"step": 38840
|
|
},
|
|
{
|
|
"entropy": 5.353457450866699,
|
|
"epoch": 3.0222524800622446,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00040909244179231926,
|
|
"loss": 4.8706,
|
|
"mean_token_accuracy": 0.20899474769830703,
|
|
"num_tokens": 67379226.0,
|
|
"step": 38845
|
|
},
|
|
{
|
|
"entropy": 5.338396167755127,
|
|
"epoch": 3.0226415094339623,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004090701848986229,
|
|
"loss": 4.7967,
|
|
"mean_token_accuracy": 0.21891996562480925,
|
|
"num_tokens": 67388048.0,
|
|
"step": 38850
|
|
},
|
|
{
|
|
"entropy": 5.32727837562561,
|
|
"epoch": 3.02303053880568,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004090479259706247,
|
|
"loss": 4.7231,
|
|
"mean_token_accuracy": 0.21628516763448716,
|
|
"num_tokens": 67396545.0,
|
|
"step": 38855
|
|
},
|
|
{
|
|
"entropy": 5.273797130584716,
|
|
"epoch": 3.023419568177397,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004090256650086628,
|
|
"loss": 4.8039,
|
|
"mean_token_accuracy": 0.2126876264810562,
|
|
"num_tokens": 67405128.0,
|
|
"step": 38860
|
|
},
|
|
{
|
|
"entropy": 5.316504001617432,
|
|
"epoch": 3.023808597549115,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00040900340201307475,
|
|
"loss": 4.9381,
|
|
"mean_token_accuracy": 0.20751468241214752,
|
|
"num_tokens": 67414231.0,
|
|
"step": 38865
|
|
},
|
|
{
|
|
"entropy": 5.322649526596069,
|
|
"epoch": 3.0241976269208326,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00040898113698419823,
|
|
"loss": 4.887,
|
|
"mean_token_accuracy": 0.2098349317908287,
|
|
"num_tokens": 67423023.0,
|
|
"step": 38870
|
|
},
|
|
{
|
|
"entropy": 5.375913333892822,
|
|
"epoch": 3.0245866562925503,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0004089588699223713,
|
|
"loss": 4.9264,
|
|
"mean_token_accuracy": 0.1995796039700508,
|
|
"num_tokens": 67431377.0,
|
|
"step": 38875
|
|
},
|
|
{
|
|
"entropy": 5.411909675598144,
|
|
"epoch": 3.0249756856642676,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00040893660082793167,
|
|
"loss": 4.9533,
|
|
"mean_token_accuracy": 0.2059389293193817,
|
|
"num_tokens": 67439888.0,
|
|
"step": 38880
|
|
},
|
|
{
|
|
"entropy": 5.406026363372803,
|
|
"epoch": 3.0253647150359853,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00040891432970121736,
|
|
"loss": 4.8977,
|
|
"mean_token_accuracy": 0.19846780896186828,
|
|
"num_tokens": 67448174.0,
|
|
"step": 38885
|
|
},
|
|
{
|
|
"entropy": 5.31670446395874,
|
|
"epoch": 3.025753744407703,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00040889205654256615,
|
|
"loss": 4.9081,
|
|
"mean_token_accuracy": 0.19883451610803604,
|
|
"num_tokens": 67456562.0,
|
|
"step": 38890
|
|
},
|
|
{
|
|
"entropy": 5.3855993270874025,
|
|
"epoch": 3.02614277377942,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00040886978135231625,
|
|
"loss": 4.9269,
|
|
"mean_token_accuracy": 0.20295477509498597,
|
|
"num_tokens": 67465518.0,
|
|
"step": 38895
|
|
},
|
|
{
|
|
"entropy": 5.3777679920196535,
|
|
"epoch": 3.026531803151138,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00040884750413080535,
|
|
"loss": 4.9046,
|
|
"mean_token_accuracy": 0.20385487675666808,
|
|
"num_tokens": 67474988.0,
|
|
"step": 38900
|
|
},
|
|
{
|
|
"entropy": 5.256654596328735,
|
|
"epoch": 3.0269208325228556,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00040882522487837176,
|
|
"loss": 4.75,
|
|
"mean_token_accuracy": 0.21682214587926865,
|
|
"num_tokens": 67484097.0,
|
|
"step": 38905
|
|
},
|
|
{
|
|
"entropy": 5.3677184104919435,
|
|
"epoch": 3.027309861894573,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00040880294359535327,
|
|
"loss": 4.8304,
|
|
"mean_token_accuracy": 0.2044965907931328,
|
|
"num_tokens": 67493348.0,
|
|
"step": 38910
|
|
},
|
|
{
|
|
"entropy": 5.33874020576477,
|
|
"epoch": 3.0276988912662905,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00040878066028208804,
|
|
"loss": 4.8202,
|
|
"mean_token_accuracy": 0.21519086062908171,
|
|
"num_tokens": 67501586.0,
|
|
"step": 38915
|
|
},
|
|
{
|
|
"entropy": 5.407989645004273,
|
|
"epoch": 3.0280879206380082,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00040875837493891434,
|
|
"loss": 5.0045,
|
|
"mean_token_accuracy": 0.20518122017383575,
|
|
"num_tokens": 67510416.0,
|
|
"step": 38920
|
|
},
|
|
{
|
|
"entropy": 5.316352891921997,
|
|
"epoch": 3.028476950009726,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004087360875661701,
|
|
"loss": 4.7639,
|
|
"mean_token_accuracy": 0.21642113029956817,
|
|
"num_tokens": 67518974.0,
|
|
"step": 38925
|
|
},
|
|
{
|
|
"entropy": 5.265423536300659,
|
|
"epoch": 3.028865979381443,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00040871379816419376,
|
|
"loss": 4.8767,
|
|
"mean_token_accuracy": 0.2039298117160797,
|
|
"num_tokens": 67528194.0,
|
|
"step": 38930
|
|
},
|
|
{
|
|
"entropy": 5.3963480472564695,
|
|
"epoch": 3.029255008753161,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004086915067333232,
|
|
"loss": 4.9078,
|
|
"mean_token_accuracy": 0.2063104823231697,
|
|
"num_tokens": 67536884.0,
|
|
"step": 38935
|
|
},
|
|
{
|
|
"entropy": 5.389633321762085,
|
|
"epoch": 3.0296440381248786,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004086692132738968,
|
|
"loss": 4.8769,
|
|
"mean_token_accuracy": 0.2061626985669136,
|
|
"num_tokens": 67544969.0,
|
|
"step": 38940
|
|
},
|
|
{
|
|
"entropy": 5.465931177139282,
|
|
"epoch": 3.030033067496596,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.000408646917786253,
|
|
"loss": 5.08,
|
|
"mean_token_accuracy": 0.19114660024642943,
|
|
"num_tokens": 67555681.0,
|
|
"step": 38945
|
|
},
|
|
{
|
|
"entropy": 5.397300434112549,
|
|
"epoch": 3.0304220968683135,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004086246202707298,
|
|
"loss": 4.8417,
|
|
"mean_token_accuracy": 0.21330460011959076,
|
|
"num_tokens": 67564346.0,
|
|
"step": 38950
|
|
},
|
|
{
|
|
"entropy": 5.381330490112305,
|
|
"epoch": 3.0308111262400312,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.00040860232072766577,
|
|
"loss": 4.9359,
|
|
"mean_token_accuracy": 0.19992727488279344,
|
|
"num_tokens": 67573497.0,
|
|
"step": 38955
|
|
},
|
|
{
|
|
"entropy": 5.383692455291748,
|
|
"epoch": 3.0312001556117485,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004085800191573991,
|
|
"loss": 4.8274,
|
|
"mean_token_accuracy": 0.21115343123674393,
|
|
"num_tokens": 67581842.0,
|
|
"step": 38960
|
|
},
|
|
{
|
|
"entropy": 5.409601068496704,
|
|
"epoch": 3.031589184983466,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0004085577155602683,
|
|
"loss": 4.9317,
|
|
"mean_token_accuracy": 0.20223153829574586,
|
|
"num_tokens": 67590763.0,
|
|
"step": 38965
|
|
},
|
|
{
|
|
"entropy": 5.359137105941772,
|
|
"epoch": 3.031978214355184,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00040853540993661175,
|
|
"loss": 4.9963,
|
|
"mean_token_accuracy": 0.19467896819114686,
|
|
"num_tokens": 67599232.0,
|
|
"step": 38970
|
|
},
|
|
{
|
|
"entropy": 5.378431367874145,
|
|
"epoch": 3.0323672437269016,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00040851310228676787,
|
|
"loss": 4.8766,
|
|
"mean_token_accuracy": 0.2102770909667015,
|
|
"num_tokens": 67608314.0,
|
|
"step": 38975
|
|
},
|
|
{
|
|
"entropy": 5.4215248107910154,
|
|
"epoch": 3.032756273098619,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004084907926110752,
|
|
"loss": 4.8031,
|
|
"mean_token_accuracy": 0.21465802788734437,
|
|
"num_tokens": 67616902.0,
|
|
"step": 38980
|
|
},
|
|
{
|
|
"entropy": 5.355353927612304,
|
|
"epoch": 3.0331453024703365,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004084684809098722,
|
|
"loss": 4.9015,
|
|
"mean_token_accuracy": 0.21188381910324097,
|
|
"num_tokens": 67625163.0,
|
|
"step": 38985
|
|
},
|
|
{
|
|
"entropy": 5.306963634490967,
|
|
"epoch": 3.0335343318420542,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00040844616718349743,
|
|
"loss": 4.8057,
|
|
"mean_token_accuracy": 0.21722989976406099,
|
|
"num_tokens": 67632997.0,
|
|
"step": 38990
|
|
},
|
|
{
|
|
"entropy": 5.377382278442383,
|
|
"epoch": 3.0339233612137715,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00040842385143228946,
|
|
"loss": 4.8137,
|
|
"mean_token_accuracy": 0.21369080990552902,
|
|
"num_tokens": 67640813.0,
|
|
"step": 38995
|
|
},
|
|
{
|
|
"entropy": 5.320043516159058,
|
|
"epoch": 3.034312390585489,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00040840153365658693,
|
|
"loss": 4.8018,
|
|
"mean_token_accuracy": 0.22020691335201265,
|
|
"num_tokens": 67649701.0,
|
|
"step": 39000
|
|
},
|
|
{
|
|
"epoch": 3.034312390585489,
|
|
"eval_entropy": 5.114409923278104,
|
|
"eval_loss": 5.043065547943115,
|
|
"eval_mean_token_accuracy": 0.20751321915684123,
|
|
"eval_num_tokens": 67649701.0,
|
|
"eval_runtime": 28.6428,
|
|
"eval_samples_per_second": 1450.908,
|
|
"eval_steps_per_second": 181.372,
|
|
"step": 39000
|
|
}
|
|
],
|
|
"logging_steps": 5,
|
|
"max_steps": 128520,
|
|
"num_input_tokens_seen": 0,
|
|
"num_train_epochs": 10,
|
|
"save_steps": 3000,
|
|
"stateful_callbacks": {
|
|
"TrainerControl": {
|
|
"args": {
|
|
"should_epoch_stop": false,
|
|
"should_evaluate": false,
|
|
"should_log": false,
|
|
"should_save": true,
|
|
"should_training_stop": false
|
|
},
|
|
"attributes": {}
|
|
}
|
|
},
|
|
"total_flos": 9.1840491159552e+16,
|
|
"train_batch_size": 16,
|
|
"trial_name": null,
|
|
"trial_params": null
|
|
}
|