3035 lines
81 KiB
JSON
3035 lines
81 KiB
JSON
|
|
{
|
||
|
|
"best_global_step": null,
|
||
|
|
"best_metric": null,
|
||
|
|
"best_model_checkpoint": null,
|
||
|
|
"epoch": 0.07715454054471106,
|
||
|
|
"eval_steps": 500,
|
||
|
|
"global_step": 1500,
|
||
|
|
"is_hyper_param_search": false,
|
||
|
|
"is_local_process_zero": true,
|
||
|
|
"is_world_process_zero": true,
|
||
|
|
"log_history": [
|
||
|
|
{
|
||
|
|
"entropy": 10.691593360900878,
|
||
|
|
"epoch": 0.0002571818018157035,
|
||
|
|
"grad_norm": 13.5625,
|
||
|
|
"learning_rate": 2e-06,
|
||
|
|
"loss": 10.761,
|
||
|
|
"mean_token_accuracy": 0.00011363636003807187,
|
||
|
|
"num_tokens": 8373.0,
|
||
|
|
"step": 5
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.691572093963623,
|
||
|
|
"epoch": 0.000514363603631407,
|
||
|
|
"grad_norm": 12.375,
|
||
|
|
"learning_rate": 4.5e-06,
|
||
|
|
"loss": 10.7039,
|
||
|
|
"mean_token_accuracy": 0.0,
|
||
|
|
"num_tokens": 17090.0,
|
||
|
|
"step": 10
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.691090297698974,
|
||
|
|
"epoch": 0.0007715454054471106,
|
||
|
|
"grad_norm": 9.875,
|
||
|
|
"learning_rate": 7e-06,
|
||
|
|
"loss": 10.5011,
|
||
|
|
"mean_token_accuracy": 0.018853903049603105,
|
||
|
|
"num_tokens": 26219.0,
|
||
|
|
"step": 15
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.680709075927734,
|
||
|
|
"epoch": 0.001028727207262814,
|
||
|
|
"grad_norm": 6.03125,
|
||
|
|
"learning_rate": 9.5e-06,
|
||
|
|
"loss": 10.2462,
|
||
|
|
"mean_token_accuracy": 0.04484990499913692,
|
||
|
|
"num_tokens": 36191.0,
|
||
|
|
"step": 20
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.582563495635986,
|
||
|
|
"epoch": 0.0012859090090785177,
|
||
|
|
"grad_norm": 3.9375,
|
||
|
|
"learning_rate": 1.2e-05,
|
||
|
|
"loss": 9.9749,
|
||
|
|
"mean_token_accuracy": 0.040961484611034396,
|
||
|
|
"num_tokens": 45318.0,
|
||
|
|
"step": 25
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.534116744995117,
|
||
|
|
"epoch": 0.0015430908108942211,
|
||
|
|
"grad_norm": 3.703125,
|
||
|
|
"learning_rate": 1.4500000000000002e-05,
|
||
|
|
"loss": 9.8021,
|
||
|
|
"mean_token_accuracy": 0.04536043591797352,
|
||
|
|
"num_tokens": 53102.0,
|
||
|
|
"step": 30
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.562399864196777,
|
||
|
|
"epoch": 0.0018002726127099246,
|
||
|
|
"grad_norm": 2.984375,
|
||
|
|
"learning_rate": 1.7000000000000003e-05,
|
||
|
|
"loss": 9.7539,
|
||
|
|
"mean_token_accuracy": 0.042898242548108104,
|
||
|
|
"num_tokens": 61808.0,
|
||
|
|
"step": 35
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.547216129302978,
|
||
|
|
"epoch": 0.002057454414525628,
|
||
|
|
"grad_norm": 2.8125,
|
||
|
|
"learning_rate": 1.95e-05,
|
||
|
|
"loss": 9.7136,
|
||
|
|
"mean_token_accuracy": 0.044699297100305554,
|
||
|
|
"num_tokens": 70708.0,
|
||
|
|
"step": 40
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.517444515228272,
|
||
|
|
"epoch": 0.0023146362163413317,
|
||
|
|
"grad_norm": 2.5,
|
||
|
|
"learning_rate": 2.2e-05,
|
||
|
|
"loss": 9.632,
|
||
|
|
"mean_token_accuracy": 0.04661537855863571,
|
||
|
|
"num_tokens": 79541.0,
|
||
|
|
"step": 45
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.505586051940918,
|
||
|
|
"epoch": 0.0025718180181570354,
|
||
|
|
"grad_norm": 2.40625,
|
||
|
|
"learning_rate": 2.4500000000000003e-05,
|
||
|
|
"loss": 9.5459,
|
||
|
|
"mean_token_accuracy": 0.05164888352155685,
|
||
|
|
"num_tokens": 87073.0,
|
||
|
|
"step": 50
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.474337196350097,
|
||
|
|
"epoch": 0.0028289998199727386,
|
||
|
|
"grad_norm": 2.25,
|
||
|
|
"learning_rate": 2.7e-05,
|
||
|
|
"loss": 9.5486,
|
||
|
|
"mean_token_accuracy": 0.059509020671248435,
|
||
|
|
"num_tokens": 96581.0,
|
||
|
|
"step": 55
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.405019569396973,
|
||
|
|
"epoch": 0.0030861816217884423,
|
||
|
|
"grad_norm": 2.359375,
|
||
|
|
"learning_rate": 2.95e-05,
|
||
|
|
"loss": 9.4782,
|
||
|
|
"mean_token_accuracy": 0.060714465007185935,
|
||
|
|
"num_tokens": 105741.0,
|
||
|
|
"step": 60
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.288742446899414,
|
||
|
|
"epoch": 0.003343363423604146,
|
||
|
|
"grad_norm": 2.125,
|
||
|
|
"learning_rate": 3.2e-05,
|
||
|
|
"loss": 9.385,
|
||
|
|
"mean_token_accuracy": 0.061338124051690104,
|
||
|
|
"num_tokens": 114609.0,
|
||
|
|
"step": 65
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.352596855163574,
|
||
|
|
"epoch": 0.003600545225419849,
|
||
|
|
"grad_norm": 2.125,
|
||
|
|
"learning_rate": 3.4500000000000005e-05,
|
||
|
|
"loss": 9.35,
|
||
|
|
"mean_token_accuracy": 0.05903933756053448,
|
||
|
|
"num_tokens": 123922.0,
|
||
|
|
"step": 70
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.332678699493409,
|
||
|
|
"epoch": 0.003857727027235553,
|
||
|
|
"grad_norm": 2.125,
|
||
|
|
"learning_rate": 3.7e-05,
|
||
|
|
"loss": 9.2218,
|
||
|
|
"mean_token_accuracy": 0.06484894305467606,
|
||
|
|
"num_tokens": 133213.0,
|
||
|
|
"step": 75
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.27952938079834,
|
||
|
|
"epoch": 0.004114908829051256,
|
||
|
|
"grad_norm": 1.96875,
|
||
|
|
"learning_rate": 3.95e-05,
|
||
|
|
"loss": 9.1737,
|
||
|
|
"mean_token_accuracy": 0.06273005269467831,
|
||
|
|
"num_tokens": 141582.0,
|
||
|
|
"step": 80
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.254050540924073,
|
||
|
|
"epoch": 0.00437209063086696,
|
||
|
|
"grad_norm": 2.0625,
|
||
|
|
"learning_rate": 4.2000000000000004e-05,
|
||
|
|
"loss": 8.9925,
|
||
|
|
"mean_token_accuracy": 0.06865651868283748,
|
||
|
|
"num_tokens": 149709.0,
|
||
|
|
"step": 85
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.210903453826905,
|
||
|
|
"epoch": 0.004629272432682663,
|
||
|
|
"grad_norm": 1.8203125,
|
||
|
|
"learning_rate": 4.45e-05,
|
||
|
|
"loss": 8.856,
|
||
|
|
"mean_token_accuracy": 0.07082752697169781,
|
||
|
|
"num_tokens": 158239.0,
|
||
|
|
"step": 90
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.24482765197754,
|
||
|
|
"epoch": 0.004886454234498367,
|
||
|
|
"grad_norm": 1.7578125,
|
||
|
|
"learning_rate": 4.7000000000000004e-05,
|
||
|
|
"loss": 8.9023,
|
||
|
|
"mean_token_accuracy": 0.0604440800845623,
|
||
|
|
"num_tokens": 168046.0,
|
||
|
|
"step": 95
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.135429000854492,
|
||
|
|
"epoch": 0.005143636036314071,
|
||
|
|
"grad_norm": 1.53125,
|
||
|
|
"learning_rate": 4.9500000000000004e-05,
|
||
|
|
"loss": 8.8077,
|
||
|
|
"mean_token_accuracy": 0.06280115209519863,
|
||
|
|
"num_tokens": 177797.0,
|
||
|
|
"step": 100
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.110702419281006,
|
||
|
|
"epoch": 0.0054008178381297735,
|
||
|
|
"grad_norm": 1.796875,
|
||
|
|
"learning_rate": 5.2e-05,
|
||
|
|
"loss": 8.6609,
|
||
|
|
"mean_token_accuracy": 0.06286422722041607,
|
||
|
|
"num_tokens": 186664.0,
|
||
|
|
"step": 105
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 10.024668121337891,
|
||
|
|
"epoch": 0.005657999639945477,
|
||
|
|
"grad_norm": 1.5546875,
|
||
|
|
"learning_rate": 5.45e-05,
|
||
|
|
"loss": 8.5449,
|
||
|
|
"mean_token_accuracy": 0.06326077207922935,
|
||
|
|
"num_tokens": 195404.0,
|
||
|
|
"step": 110
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 9.922544002532959,
|
||
|
|
"epoch": 0.005915181441761181,
|
||
|
|
"grad_norm": 1.5546875,
|
||
|
|
"learning_rate": 5.7e-05,
|
||
|
|
"loss": 8.4327,
|
||
|
|
"mean_token_accuracy": 0.06552885584533215,
|
||
|
|
"num_tokens": 204248.0,
|
||
|
|
"step": 115
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 9.780591869354248,
|
||
|
|
"epoch": 0.0061723632435768845,
|
||
|
|
"grad_norm": 1.515625,
|
||
|
|
"learning_rate": 5.9499999999999996e-05,
|
||
|
|
"loss": 8.2869,
|
||
|
|
"mean_token_accuracy": 0.060110585764050484,
|
||
|
|
"num_tokens": 214042.0,
|
||
|
|
"step": 120
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 9.649379444122314,
|
||
|
|
"epoch": 0.006429545045392588,
|
||
|
|
"grad_norm": 1.390625,
|
||
|
|
"learning_rate": 6.2e-05,
|
||
|
|
"loss": 8.189,
|
||
|
|
"mean_token_accuracy": 0.06577248759567737,
|
||
|
|
"num_tokens": 223194.0,
|
||
|
|
"step": 125
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 9.431284046173095,
|
||
|
|
"epoch": 0.006686726847208292,
|
||
|
|
"grad_norm": 1.484375,
|
||
|
|
"learning_rate": 6.450000000000001e-05,
|
||
|
|
"loss": 7.9307,
|
||
|
|
"mean_token_accuracy": 0.07218964248895646,
|
||
|
|
"num_tokens": 230929.0,
|
||
|
|
"step": 130
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 9.260346984863281,
|
||
|
|
"epoch": 0.006943908649023995,
|
||
|
|
"grad_norm": 1.734375,
|
||
|
|
"learning_rate": 6.7e-05,
|
||
|
|
"loss": 7.9081,
|
||
|
|
"mean_token_accuracy": 0.07038265988230705,
|
||
|
|
"num_tokens": 238687.0,
|
||
|
|
"step": 135
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 9.035238265991211,
|
||
|
|
"epoch": 0.007201090450839698,
|
||
|
|
"grad_norm": 1.4921875,
|
||
|
|
"learning_rate": 6.950000000000001e-05,
|
||
|
|
"loss": 7.8152,
|
||
|
|
"mean_token_accuracy": 0.07054561264812946,
|
||
|
|
"num_tokens": 247397.0,
|
||
|
|
"step": 140
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 8.894649696350097,
|
||
|
|
"epoch": 0.007458272252655402,
|
||
|
|
"grad_norm": 1.4453125,
|
||
|
|
"learning_rate": 7.2e-05,
|
||
|
|
"loss": 7.7444,
|
||
|
|
"mean_token_accuracy": 0.07246604040265084,
|
||
|
|
"num_tokens": 255924.0,
|
||
|
|
"step": 145
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 8.742353820800782,
|
||
|
|
"epoch": 0.007715454054471106,
|
||
|
|
"grad_norm": 1.2890625,
|
||
|
|
"learning_rate": 7.45e-05,
|
||
|
|
"loss": 7.6781,
|
||
|
|
"mean_token_accuracy": 0.06747029088437557,
|
||
|
|
"num_tokens": 264767.0,
|
||
|
|
"step": 150
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 8.636024761199952,
|
||
|
|
"epoch": 0.00797263585628681,
|
||
|
|
"grad_norm": 1.1640625,
|
||
|
|
"learning_rate": 7.7e-05,
|
||
|
|
"loss": 7.6787,
|
||
|
|
"mean_token_accuracy": 0.07033539973199368,
|
||
|
|
"num_tokens": 274250.0,
|
||
|
|
"step": 155
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 8.433564472198487,
|
||
|
|
"epoch": 0.008229817658102512,
|
||
|
|
"grad_norm": 1.3828125,
|
||
|
|
"learning_rate": 7.950000000000001e-05,
|
||
|
|
"loss": 7.5648,
|
||
|
|
"mean_token_accuracy": 0.07707317210733891,
|
||
|
|
"num_tokens": 282568.0,
|
||
|
|
"step": 160
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 8.366222667694093,
|
||
|
|
"epoch": 0.008486999459918217,
|
||
|
|
"grad_norm": 1.3671875,
|
||
|
|
"learning_rate": 8.2e-05,
|
||
|
|
"loss": 7.5969,
|
||
|
|
"mean_token_accuracy": 0.06956044659018516,
|
||
|
|
"num_tokens": 291126.0,
|
||
|
|
"step": 165
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 8.285852527618408,
|
||
|
|
"epoch": 0.00874418126173392,
|
||
|
|
"grad_norm": 1.1953125,
|
||
|
|
"learning_rate": 8.450000000000001e-05,
|
||
|
|
"loss": 7.5209,
|
||
|
|
"mean_token_accuracy": 0.07576571702957154,
|
||
|
|
"num_tokens": 299751.0,
|
||
|
|
"step": 170
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 8.235202884674072,
|
||
|
|
"epoch": 0.009001363063549624,
|
||
|
|
"grad_norm": 1.2734375,
|
||
|
|
"learning_rate": 8.7e-05,
|
||
|
|
"loss": 7.5119,
|
||
|
|
"mean_token_accuracy": 0.07470664568245411,
|
||
|
|
"num_tokens": 309560.0,
|
||
|
|
"step": 175
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 8.157529830932617,
|
||
|
|
"epoch": 0.009258544865365327,
|
||
|
|
"grad_norm": 1.296875,
|
||
|
|
"learning_rate": 8.95e-05,
|
||
|
|
"loss": 7.4928,
|
||
|
|
"mean_token_accuracy": 0.06981925927102565,
|
||
|
|
"num_tokens": 318613.0,
|
||
|
|
"step": 180
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 8.12168264389038,
|
||
|
|
"epoch": 0.00951572666718103,
|
||
|
|
"grad_norm": 1.328125,
|
||
|
|
"learning_rate": 9.2e-05,
|
||
|
|
"loss": 7.551,
|
||
|
|
"mean_token_accuracy": 0.07186717689037322,
|
||
|
|
"num_tokens": 327650.0,
|
||
|
|
"step": 185
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 8.121650791168213,
|
||
|
|
"epoch": 0.009772908468996734,
|
||
|
|
"grad_norm": 1.125,
|
||
|
|
"learning_rate": 9.45e-05,
|
||
|
|
"loss": 7.4394,
|
||
|
|
"mean_token_accuracy": 0.07240154445171357,
|
||
|
|
"num_tokens": 337198.0,
|
||
|
|
"step": 190
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 8.03664698600769,
|
||
|
|
"epoch": 0.010030090270812437,
|
||
|
|
"grad_norm": 1.34375,
|
||
|
|
"learning_rate": 9.7e-05,
|
||
|
|
"loss": 7.5301,
|
||
|
|
"mean_token_accuracy": 0.07011710181832313,
|
||
|
|
"num_tokens": 346179.0,
|
||
|
|
"step": 195
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 8.069316053390503,
|
||
|
|
"epoch": 0.010287272072628141,
|
||
|
|
"grad_norm": 1.6875,
|
||
|
|
"learning_rate": 9.95e-05,
|
||
|
|
"loss": 7.4276,
|
||
|
|
"mean_token_accuracy": 0.07499495595693588,
|
||
|
|
"num_tokens": 355972.0,
|
||
|
|
"step": 200
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.968952226638794,
|
||
|
|
"epoch": 0.010544453874443844,
|
||
|
|
"grad_norm": 1.4375,
|
||
|
|
"learning_rate": 0.000102,
|
||
|
|
"loss": 7.3626,
|
||
|
|
"mean_token_accuracy": 0.077250687032938,
|
||
|
|
"num_tokens": 364635.0,
|
||
|
|
"step": 205
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.948678016662598,
|
||
|
|
"epoch": 0.010801635676259547,
|
||
|
|
"grad_norm": 1.328125,
|
||
|
|
"learning_rate": 0.00010449999999999999,
|
||
|
|
"loss": 7.5125,
|
||
|
|
"mean_token_accuracy": 0.07722728103399276,
|
||
|
|
"num_tokens": 374161.0,
|
||
|
|
"step": 210
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.955185747146606,
|
||
|
|
"epoch": 0.011058817478075252,
|
||
|
|
"grad_norm": 1.1875,
|
||
|
|
"learning_rate": 0.000107,
|
||
|
|
"loss": 7.3673,
|
||
|
|
"mean_token_accuracy": 0.0733168862760067,
|
||
|
|
"num_tokens": 383641.0,
|
||
|
|
"step": 215
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.921580362319946,
|
||
|
|
"epoch": 0.011315999279890954,
|
||
|
|
"grad_norm": 1.3515625,
|
||
|
|
"learning_rate": 0.0001095,
|
||
|
|
"loss": 7.3171,
|
||
|
|
"mean_token_accuracy": 0.0784445971250534,
|
||
|
|
"num_tokens": 392300.0,
|
||
|
|
"step": 220
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.939724063873291,
|
||
|
|
"epoch": 0.011573181081706659,
|
||
|
|
"grad_norm": 1.3125,
|
||
|
|
"learning_rate": 0.000112,
|
||
|
|
"loss": 7.3486,
|
||
|
|
"mean_token_accuracy": 0.07721329033374787,
|
||
|
|
"num_tokens": 400721.0,
|
||
|
|
"step": 225
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.914973640441895,
|
||
|
|
"epoch": 0.011830362883522362,
|
||
|
|
"grad_norm": 1.265625,
|
||
|
|
"learning_rate": 0.0001145,
|
||
|
|
"loss": 7.3563,
|
||
|
|
"mean_token_accuracy": 0.08054085932672024,
|
||
|
|
"num_tokens": 410261.0,
|
||
|
|
"step": 230
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.840137624740601,
|
||
|
|
"epoch": 0.012087544685338066,
|
||
|
|
"grad_norm": 1.296875,
|
||
|
|
"learning_rate": 0.00011700000000000001,
|
||
|
|
"loss": 7.2993,
|
||
|
|
"mean_token_accuracy": 0.08381507098674774,
|
||
|
|
"num_tokens": 419006.0,
|
||
|
|
"step": 235
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.865709638595581,
|
||
|
|
"epoch": 0.012344726487153769,
|
||
|
|
"grad_norm": 1.1953125,
|
||
|
|
"learning_rate": 0.00011949999999999999,
|
||
|
|
"loss": 7.3679,
|
||
|
|
"mean_token_accuracy": 0.07533743120729923,
|
||
|
|
"num_tokens": 428773.0,
|
||
|
|
"step": 240
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.8893204689025875,
|
||
|
|
"epoch": 0.012601908288969472,
|
||
|
|
"grad_norm": 1.5390625,
|
||
|
|
"learning_rate": 0.000122,
|
||
|
|
"loss": 7.2843,
|
||
|
|
"mean_token_accuracy": 0.08408410698175431,
|
||
|
|
"num_tokens": 438111.0,
|
||
|
|
"step": 245
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.718148136138916,
|
||
|
|
"epoch": 0.012859090090785176,
|
||
|
|
"grad_norm": 1.3046875,
|
||
|
|
"learning_rate": 0.0001245,
|
||
|
|
"loss": 7.2826,
|
||
|
|
"mean_token_accuracy": 0.07801055312156677,
|
||
|
|
"num_tokens": 447352.0,
|
||
|
|
"step": 250
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.834936952590942,
|
||
|
|
"epoch": 0.01311627189260088,
|
||
|
|
"grad_norm": 1.2421875,
|
||
|
|
"learning_rate": 0.000127,
|
||
|
|
"loss": 7.2718,
|
||
|
|
"mean_token_accuracy": 0.08380828946828842,
|
||
|
|
"num_tokens": 456118.0,
|
||
|
|
"step": 255
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.78115496635437,
|
||
|
|
"epoch": 0.013373453694416584,
|
||
|
|
"grad_norm": 1.3359375,
|
||
|
|
"learning_rate": 0.0001295,
|
||
|
|
"loss": 7.3091,
|
||
|
|
"mean_token_accuracy": 0.0782765805721283,
|
||
|
|
"num_tokens": 465016.0,
|
||
|
|
"step": 260
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.746971464157104,
|
||
|
|
"epoch": 0.013630635496232286,
|
||
|
|
"grad_norm": 1.234375,
|
||
|
|
"learning_rate": 0.000132,
|
||
|
|
"loss": 7.2129,
|
||
|
|
"mean_token_accuracy": 0.0813664972782135,
|
||
|
|
"num_tokens": 473828.0,
|
||
|
|
"step": 265
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.73144416809082,
|
||
|
|
"epoch": 0.01388781729804799,
|
||
|
|
"grad_norm": 1.125,
|
||
|
|
"learning_rate": 0.00013450000000000002,
|
||
|
|
"loss": 7.1867,
|
||
|
|
"mean_token_accuracy": 0.08951399773359299,
|
||
|
|
"num_tokens": 482481.0,
|
||
|
|
"step": 270
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.821958923339844,
|
||
|
|
"epoch": 0.014144999099863694,
|
||
|
|
"grad_norm": 1.34375,
|
||
|
|
"learning_rate": 0.00013700000000000002,
|
||
|
|
"loss": 7.2565,
|
||
|
|
"mean_token_accuracy": 0.08631709441542626,
|
||
|
|
"num_tokens": 491784.0,
|
||
|
|
"step": 275
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.713495445251465,
|
||
|
|
"epoch": 0.014402180901679397,
|
||
|
|
"grad_norm": 1.421875,
|
||
|
|
"learning_rate": 0.0001395,
|
||
|
|
"loss": 7.3491,
|
||
|
|
"mean_token_accuracy": 0.0803300604224205,
|
||
|
|
"num_tokens": 501227.0,
|
||
|
|
"step": 280
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.609055280685425,
|
||
|
|
"epoch": 0.014659362703495101,
|
||
|
|
"grad_norm": 1.6640625,
|
||
|
|
"learning_rate": 0.00014199999999999998,
|
||
|
|
"loss": 7.1247,
|
||
|
|
"mean_token_accuracy": 0.0826262541115284,
|
||
|
|
"num_tokens": 509566.0,
|
||
|
|
"step": 285
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.692761611938477,
|
||
|
|
"epoch": 0.014916544505310804,
|
||
|
|
"grad_norm": 1.3984375,
|
||
|
|
"learning_rate": 0.0001445,
|
||
|
|
"loss": 7.1787,
|
||
|
|
"mean_token_accuracy": 0.09211432188749313,
|
||
|
|
"num_tokens": 517517.0,
|
||
|
|
"step": 290
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.6960266590118405,
|
||
|
|
"epoch": 0.015173726307126508,
|
||
|
|
"grad_norm": 1.21875,
|
||
|
|
"learning_rate": 0.000147,
|
||
|
|
"loss": 7.2176,
|
||
|
|
"mean_token_accuracy": 0.0820289522409439,
|
||
|
|
"num_tokens": 526279.0,
|
||
|
|
"step": 295
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.665759134292602,
|
||
|
|
"epoch": 0.015430908108942211,
|
||
|
|
"grad_norm": 1.171875,
|
||
|
|
"learning_rate": 0.0001495,
|
||
|
|
"loss": 7.1406,
|
||
|
|
"mean_token_accuracy": 0.0928925946354866,
|
||
|
|
"num_tokens": 534516.0,
|
||
|
|
"step": 300
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.661193418502807,
|
||
|
|
"epoch": 0.015688089910757916,
|
||
|
|
"grad_norm": 1.3671875,
|
||
|
|
"learning_rate": 0.000152,
|
||
|
|
"loss": 7.2216,
|
||
|
|
"mean_token_accuracy": 0.08248281478881836,
|
||
|
|
"num_tokens": 543828.0,
|
||
|
|
"step": 305
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.662406015396118,
|
||
|
|
"epoch": 0.01594527171257362,
|
||
|
|
"grad_norm": 1.2734375,
|
||
|
|
"learning_rate": 0.00015450000000000001,
|
||
|
|
"loss": 7.1559,
|
||
|
|
"mean_token_accuracy": 0.08263281881809234,
|
||
|
|
"num_tokens": 552530.0,
|
||
|
|
"step": 310
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.536833572387695,
|
||
|
|
"epoch": 0.01620245351438932,
|
||
|
|
"grad_norm": 1.359375,
|
||
|
|
"learning_rate": 0.000157,
|
||
|
|
"loss": 7.1062,
|
||
|
|
"mean_token_accuracy": 0.08527780249714852,
|
||
|
|
"num_tokens": 561475.0,
|
||
|
|
"step": 315
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.684497308731079,
|
||
|
|
"epoch": 0.016459635316205024,
|
||
|
|
"grad_norm": 1.4609375,
|
||
|
|
"learning_rate": 0.0001595,
|
||
|
|
"loss": 7.1742,
|
||
|
|
"mean_token_accuracy": 0.08275718316435814,
|
||
|
|
"num_tokens": 569852.0,
|
||
|
|
"step": 320
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.586278247833252,
|
||
|
|
"epoch": 0.01671681711802073,
|
||
|
|
"grad_norm": 1.203125,
|
||
|
|
"learning_rate": 0.000162,
|
||
|
|
"loss": 7.2073,
|
||
|
|
"mean_token_accuracy": 0.08587946742773056,
|
||
|
|
"num_tokens": 578326.0,
|
||
|
|
"step": 325
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.664967060089111,
|
||
|
|
"epoch": 0.016973998919836433,
|
||
|
|
"grad_norm": 1.1484375,
|
||
|
|
"learning_rate": 0.00016450000000000001,
|
||
|
|
"loss": 7.238,
|
||
|
|
"mean_token_accuracy": 0.08378956839442253,
|
||
|
|
"num_tokens": 587606.0,
|
||
|
|
"step": 330
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.510732364654541,
|
||
|
|
"epoch": 0.017231180721652136,
|
||
|
|
"grad_norm": 1.3828125,
|
||
|
|
"learning_rate": 0.00016700000000000002,
|
||
|
|
"loss": 6.9636,
|
||
|
|
"mean_token_accuracy": 0.09541863054037095,
|
||
|
|
"num_tokens": 595321.0,
|
||
|
|
"step": 335
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.525554895401001,
|
||
|
|
"epoch": 0.01748836252346784,
|
||
|
|
"grad_norm": 1.1875,
|
||
|
|
"learning_rate": 0.00016950000000000003,
|
||
|
|
"loss": 7.0757,
|
||
|
|
"mean_token_accuracy": 0.08646541684865952,
|
||
|
|
"num_tokens": 603836.0,
|
||
|
|
"step": 340
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.485527229309082,
|
||
|
|
"epoch": 0.01774554432528354,
|
||
|
|
"grad_norm": 1.359375,
|
||
|
|
"learning_rate": 0.00017199999999999998,
|
||
|
|
"loss": 7.0746,
|
||
|
|
"mean_token_accuracy": 0.08882175087928772,
|
||
|
|
"num_tokens": 612847.0,
|
||
|
|
"step": 345
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.5213652610778805,
|
||
|
|
"epoch": 0.018002726127099248,
|
||
|
|
"grad_norm": 1.2734375,
|
||
|
|
"learning_rate": 0.00017449999999999999,
|
||
|
|
"loss": 7.1177,
|
||
|
|
"mean_token_accuracy": 0.08585901409387589,
|
||
|
|
"num_tokens": 620840.0,
|
||
|
|
"step": 350
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.538561153411865,
|
||
|
|
"epoch": 0.01825990792891495,
|
||
|
|
"grad_norm": 1.4140625,
|
||
|
|
"learning_rate": 0.000177,
|
||
|
|
"loss": 7.0237,
|
||
|
|
"mean_token_accuracy": 0.09108547568321228,
|
||
|
|
"num_tokens": 629495.0,
|
||
|
|
"step": 355
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.50935378074646,
|
||
|
|
"epoch": 0.018517089730730654,
|
||
|
|
"grad_norm": 1.203125,
|
||
|
|
"learning_rate": 0.0001795,
|
||
|
|
"loss": 7.1784,
|
||
|
|
"mean_token_accuracy": 0.08739718049764633,
|
||
|
|
"num_tokens": 638589.0,
|
||
|
|
"step": 360
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.4144041538238525,
|
||
|
|
"epoch": 0.018774271532546356,
|
||
|
|
"grad_norm": 1.2890625,
|
||
|
|
"learning_rate": 0.000182,
|
||
|
|
"loss": 7.05,
|
||
|
|
"mean_token_accuracy": 0.08531938642263412,
|
||
|
|
"num_tokens": 647713.0,
|
||
|
|
"step": 365
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.665746688842773,
|
||
|
|
"epoch": 0.01903145333436206,
|
||
|
|
"grad_norm": 1.40625,
|
||
|
|
"learning_rate": 0.0001845,
|
||
|
|
"loss": 7.1511,
|
||
|
|
"mean_token_accuracy": 0.08770897537469864,
|
||
|
|
"num_tokens": 656472.0,
|
||
|
|
"step": 370
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.371031093597412,
|
||
|
|
"epoch": 0.019288635136177765,
|
||
|
|
"grad_norm": 1.5625,
|
||
|
|
"learning_rate": 0.000187,
|
||
|
|
"loss": 7.0004,
|
||
|
|
"mean_token_accuracy": 0.09101735278964043,
|
||
|
|
"num_tokens": 664858.0,
|
||
|
|
"step": 375
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.439912271499634,
|
||
|
|
"epoch": 0.019545816937993468,
|
||
|
|
"grad_norm": 1.1796875,
|
||
|
|
"learning_rate": 0.0001895,
|
||
|
|
"loss": 7.0322,
|
||
|
|
"mean_token_accuracy": 0.09086323380470276,
|
||
|
|
"num_tokens": 673675.0,
|
||
|
|
"step": 380
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.4977442741394045,
|
||
|
|
"epoch": 0.01980299873980917,
|
||
|
|
"grad_norm": 1.3046875,
|
||
|
|
"learning_rate": 0.000192,
|
||
|
|
"loss": 7.1526,
|
||
|
|
"mean_token_accuracy": 0.0906866118311882,
|
||
|
|
"num_tokens": 681968.0,
|
||
|
|
"step": 385
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.431271123886108,
|
||
|
|
"epoch": 0.020060180541624874,
|
||
|
|
"grad_norm": 1.1640625,
|
||
|
|
"learning_rate": 0.0001945,
|
||
|
|
"loss": 7.0089,
|
||
|
|
"mean_token_accuracy": 0.09397086799144745,
|
||
|
|
"num_tokens": 690447.0,
|
||
|
|
"step": 390
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.5096940994262695,
|
||
|
|
"epoch": 0.020317362343440577,
|
||
|
|
"grad_norm": 1.1953125,
|
||
|
|
"learning_rate": 0.00019700000000000002,
|
||
|
|
"loss": 7.0298,
|
||
|
|
"mean_token_accuracy": 0.09151682630181313,
|
||
|
|
"num_tokens": 699659.0,
|
||
|
|
"step": 395
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.40989465713501,
|
||
|
|
"epoch": 0.020574544145256283,
|
||
|
|
"grad_norm": 1.4921875,
|
||
|
|
"learning_rate": 0.00019950000000000002,
|
||
|
|
"loss": 7.0506,
|
||
|
|
"mean_token_accuracy": 0.09182499945163727,
|
||
|
|
"num_tokens": 708342.0,
|
||
|
|
"step": 400
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.437063407897949,
|
||
|
|
"epoch": 0.020831725947071986,
|
||
|
|
"grad_norm": 1.2421875,
|
||
|
|
"learning_rate": 0.000202,
|
||
|
|
"loss": 7.0589,
|
||
|
|
"mean_token_accuracy": 0.08685924187302589,
|
||
|
|
"num_tokens": 717986.0,
|
||
|
|
"step": 405
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.506326389312744,
|
||
|
|
"epoch": 0.02108890774888769,
|
||
|
|
"grad_norm": 1.1875,
|
||
|
|
"learning_rate": 0.00020449999999999998,
|
||
|
|
"loss": 7.0868,
|
||
|
|
"mean_token_accuracy": 0.08464771658182144,
|
||
|
|
"num_tokens": 727397.0,
|
||
|
|
"step": 410
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.389501142501831,
|
||
|
|
"epoch": 0.02134608955070339,
|
||
|
|
"grad_norm": 1.109375,
|
||
|
|
"learning_rate": 0.000207,
|
||
|
|
"loss": 7.0421,
|
||
|
|
"mean_token_accuracy": 0.09134713932871819,
|
||
|
|
"num_tokens": 736291.0,
|
||
|
|
"step": 415
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.398612976074219,
|
||
|
|
"epoch": 0.021603271352519094,
|
||
|
|
"grad_norm": 1.3046875,
|
||
|
|
"learning_rate": 0.0002095,
|
||
|
|
"loss": 7.0983,
|
||
|
|
"mean_token_accuracy": 0.08749841973185539,
|
||
|
|
"num_tokens": 745132.0,
|
||
|
|
"step": 420
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.387109804153442,
|
||
|
|
"epoch": 0.0218604531543348,
|
||
|
|
"grad_norm": 1.359375,
|
||
|
|
"learning_rate": 0.000212,
|
||
|
|
"loss": 6.9801,
|
||
|
|
"mean_token_accuracy": 0.09526508301496506,
|
||
|
|
"num_tokens": 753535.0,
|
||
|
|
"step": 425
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.287825727462769,
|
||
|
|
"epoch": 0.022117634956150503,
|
||
|
|
"grad_norm": 1.34375,
|
||
|
|
"learning_rate": 0.0002145,
|
||
|
|
"loss": 6.8881,
|
||
|
|
"mean_token_accuracy": 0.09665613695979118,
|
||
|
|
"num_tokens": 762626.0,
|
||
|
|
"step": 430
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.425317716598511,
|
||
|
|
"epoch": 0.022374816757966206,
|
||
|
|
"grad_norm": 1.265625,
|
||
|
|
"learning_rate": 0.00021700000000000002,
|
||
|
|
"loss": 7.0183,
|
||
|
|
"mean_token_accuracy": 0.08952494263648987,
|
||
|
|
"num_tokens": 771802.0,
|
||
|
|
"step": 435
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.3904194831848145,
|
||
|
|
"epoch": 0.02263199855978191,
|
||
|
|
"grad_norm": 1.109375,
|
||
|
|
"learning_rate": 0.0002195,
|
||
|
|
"loss": 7.055,
|
||
|
|
"mean_token_accuracy": 0.09687120616436004,
|
||
|
|
"num_tokens": 780444.0,
|
||
|
|
"step": 440
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.46030330657959,
|
||
|
|
"epoch": 0.022889180361597615,
|
||
|
|
"grad_norm": 1.28125,
|
||
|
|
"learning_rate": 0.000222,
|
||
|
|
"loss": 7.0891,
|
||
|
|
"mean_token_accuracy": 0.08583850935101509,
|
||
|
|
"num_tokens": 789335.0,
|
||
|
|
"step": 445
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.254354047775268,
|
||
|
|
"epoch": 0.023146362163413318,
|
||
|
|
"grad_norm": 1.3828125,
|
||
|
|
"learning_rate": 0.0002245,
|
||
|
|
"loss": 6.9291,
|
||
|
|
"mean_token_accuracy": 0.09709356278181076,
|
||
|
|
"num_tokens": 797891.0,
|
||
|
|
"step": 450
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.221427774429321,
|
||
|
|
"epoch": 0.02340354396522902,
|
||
|
|
"grad_norm": 1.328125,
|
||
|
|
"learning_rate": 0.00022700000000000002,
|
||
|
|
"loss": 6.9026,
|
||
|
|
"mean_token_accuracy": 0.09430735632777214,
|
||
|
|
"num_tokens": 806238.0,
|
||
|
|
"step": 455
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.3990577220916744,
|
||
|
|
"epoch": 0.023660725767044723,
|
||
|
|
"grad_norm": 1.4765625,
|
||
|
|
"learning_rate": 0.00022950000000000002,
|
||
|
|
"loss": 6.9081,
|
||
|
|
"mean_token_accuracy": 0.09148178026080131,
|
||
|
|
"num_tokens": 814430.0,
|
||
|
|
"step": 460
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.347194242477417,
|
||
|
|
"epoch": 0.023917907568860426,
|
||
|
|
"grad_norm": 1.140625,
|
||
|
|
"learning_rate": 0.00023200000000000003,
|
||
|
|
"loss": 7.0802,
|
||
|
|
"mean_token_accuracy": 0.08918680474162102,
|
||
|
|
"num_tokens": 823546.0,
|
||
|
|
"step": 465
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.322706604003907,
|
||
|
|
"epoch": 0.024175089370676132,
|
||
|
|
"grad_norm": 1.3203125,
|
||
|
|
"learning_rate": 0.00023449999999999998,
|
||
|
|
"loss": 6.8709,
|
||
|
|
"mean_token_accuracy": 0.0952567420899868,
|
||
|
|
"num_tokens": 832885.0,
|
||
|
|
"step": 470
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.260769939422607,
|
||
|
|
"epoch": 0.024432271172491835,
|
||
|
|
"grad_norm": 1.171875,
|
||
|
|
"learning_rate": 0.000237,
|
||
|
|
"loss": 6.8382,
|
||
|
|
"mean_token_accuracy": 0.09813853800296783,
|
||
|
|
"num_tokens": 841140.0,
|
||
|
|
"step": 475
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.244242477416992,
|
||
|
|
"epoch": 0.024689452974307538,
|
||
|
|
"grad_norm": 1.5703125,
|
||
|
|
"learning_rate": 0.0002395,
|
||
|
|
"loss": 6.9147,
|
||
|
|
"mean_token_accuracy": 0.09300818815827369,
|
||
|
|
"num_tokens": 849768.0,
|
||
|
|
"step": 480
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.25398006439209,
|
||
|
|
"epoch": 0.02494663477612324,
|
||
|
|
"grad_norm": 1.09375,
|
||
|
|
"learning_rate": 0.000242,
|
||
|
|
"loss": 6.8165,
|
||
|
|
"mean_token_accuracy": 0.09476587101817131,
|
||
|
|
"num_tokens": 859080.0,
|
||
|
|
"step": 485
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.220676612854004,
|
||
|
|
"epoch": 0.025203816577938944,
|
||
|
|
"grad_norm": 1.1328125,
|
||
|
|
"learning_rate": 0.0002445,
|
||
|
|
"loss": 6.9026,
|
||
|
|
"mean_token_accuracy": 0.0947590596973896,
|
||
|
|
"num_tokens": 868624.0,
|
||
|
|
"step": 490
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.27272310256958,
|
||
|
|
"epoch": 0.02546099837975465,
|
||
|
|
"grad_norm": 1.15625,
|
||
|
|
"learning_rate": 0.000247,
|
||
|
|
"loss": 6.893,
|
||
|
|
"mean_token_accuracy": 0.09338614419102668,
|
||
|
|
"num_tokens": 877592.0,
|
||
|
|
"step": 495
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.275995779037475,
|
||
|
|
"epoch": 0.025718180181570353,
|
||
|
|
"grad_norm": 1.2578125,
|
||
|
|
"learning_rate": 0.0002495,
|
||
|
|
"loss": 6.8668,
|
||
|
|
"mean_token_accuracy": 0.09461153075098991,
|
||
|
|
"num_tokens": 886470.0,
|
||
|
|
"step": 500
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.182675886154175,
|
||
|
|
"epoch": 0.025975361983386056,
|
||
|
|
"grad_norm": 1.203125,
|
||
|
|
"learning_rate": 0.000252,
|
||
|
|
"loss": 6.9033,
|
||
|
|
"mean_token_accuracy": 0.09226062297821044,
|
||
|
|
"num_tokens": 895940.0,
|
||
|
|
"step": 505
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.2134950160980225,
|
||
|
|
"epoch": 0.02623254378520176,
|
||
|
|
"grad_norm": 1.1328125,
|
||
|
|
"learning_rate": 0.0002545,
|
||
|
|
"loss": 6.9523,
|
||
|
|
"mean_token_accuracy": 0.09598998427391052,
|
||
|
|
"num_tokens": 905344.0,
|
||
|
|
"step": 510
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.144832706451416,
|
||
|
|
"epoch": 0.02648972558701746,
|
||
|
|
"grad_norm": 1.28125,
|
||
|
|
"learning_rate": 0.000257,
|
||
|
|
"loss": 6.8974,
|
||
|
|
"mean_token_accuracy": 0.09212475568056107,
|
||
|
|
"num_tokens": 914323.0,
|
||
|
|
"step": 515
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.195075178146363,
|
||
|
|
"epoch": 0.026746907388833167,
|
||
|
|
"grad_norm": 1.3515625,
|
||
|
|
"learning_rate": 0.0002595,
|
||
|
|
"loss": 6.8358,
|
||
|
|
"mean_token_accuracy": 0.0931648664176464,
|
||
|
|
"num_tokens": 922913.0,
|
||
|
|
"step": 520
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.201556158065796,
|
||
|
|
"epoch": 0.02700408919064887,
|
||
|
|
"grad_norm": 1.2109375,
|
||
|
|
"learning_rate": 0.000262,
|
||
|
|
"loss": 6.9151,
|
||
|
|
"mean_token_accuracy": 0.08820494934916497,
|
||
|
|
"num_tokens": 931487.0,
|
||
|
|
"step": 525
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.12173867225647,
|
||
|
|
"epoch": 0.027261270992464573,
|
||
|
|
"grad_norm": 1.25,
|
||
|
|
"learning_rate": 0.00026450000000000003,
|
||
|
|
"loss": 6.8622,
|
||
|
|
"mean_token_accuracy": 0.09719429761171341,
|
||
|
|
"num_tokens": 939694.0,
|
||
|
|
"step": 530
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.300619316101074,
|
||
|
|
"epoch": 0.027518452794280276,
|
||
|
|
"grad_norm": 1.3203125,
|
||
|
|
"learning_rate": 0.00026700000000000004,
|
||
|
|
"loss": 6.8258,
|
||
|
|
"mean_token_accuracy": 0.1024305358529091,
|
||
|
|
"num_tokens": 948437.0,
|
||
|
|
"step": 535
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.087061405181885,
|
||
|
|
"epoch": 0.02777563459609598,
|
||
|
|
"grad_norm": 1.359375,
|
||
|
|
"learning_rate": 0.00026950000000000005,
|
||
|
|
"loss": 6.7424,
|
||
|
|
"mean_token_accuracy": 0.09930474832653999,
|
||
|
|
"num_tokens": 957490.0,
|
||
|
|
"step": 540
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.975574159622193,
|
||
|
|
"epoch": 0.028032816397911685,
|
||
|
|
"grad_norm": 1.2109375,
|
||
|
|
"learning_rate": 0.00027200000000000005,
|
||
|
|
"loss": 6.6873,
|
||
|
|
"mean_token_accuracy": 0.10134570002555847,
|
||
|
|
"num_tokens": 966077.0,
|
||
|
|
"step": 545
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.103092670440674,
|
||
|
|
"epoch": 0.028289998199727388,
|
||
|
|
"grad_norm": 1.1875,
|
||
|
|
"learning_rate": 0.0002745,
|
||
|
|
"loss": 6.7758,
|
||
|
|
"mean_token_accuracy": 0.09924016520380974,
|
||
|
|
"num_tokens": 974788.0,
|
||
|
|
"step": 550
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.049304628372193,
|
||
|
|
"epoch": 0.02854718000154309,
|
||
|
|
"grad_norm": 1.453125,
|
||
|
|
"learning_rate": 0.000277,
|
||
|
|
"loss": 6.8437,
|
||
|
|
"mean_token_accuracy": 0.09455109983682633,
|
||
|
|
"num_tokens": 983645.0,
|
||
|
|
"step": 555
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.199927759170532,
|
||
|
|
"epoch": 0.028804361803358793,
|
||
|
|
"grad_norm": 1.3984375,
|
||
|
|
"learning_rate": 0.0002795,
|
||
|
|
"loss": 6.8972,
|
||
|
|
"mean_token_accuracy": 0.09381847679615021,
|
||
|
|
"num_tokens": 991795.0,
|
||
|
|
"step": 560
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.130536651611328,
|
||
|
|
"epoch": 0.0290615436051745,
|
||
|
|
"grad_norm": 1.234375,
|
||
|
|
"learning_rate": 0.00028199999999999997,
|
||
|
|
"loss": 6.8817,
|
||
|
|
"mean_token_accuracy": 0.0921133041381836,
|
||
|
|
"num_tokens": 1000732.0,
|
||
|
|
"step": 565
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.128713464736938,
|
||
|
|
"epoch": 0.029318725406990202,
|
||
|
|
"grad_norm": 1.2421875,
|
||
|
|
"learning_rate": 0.0002845,
|
||
|
|
"loss": 6.7298,
|
||
|
|
"mean_token_accuracy": 0.10322466343641282,
|
||
|
|
"num_tokens": 1009016.0,
|
||
|
|
"step": 570
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.071855258941651,
|
||
|
|
"epoch": 0.029575907208805905,
|
||
|
|
"grad_norm": 1.28125,
|
||
|
|
"learning_rate": 0.000287,
|
||
|
|
"loss": 6.8085,
|
||
|
|
"mean_token_accuracy": 0.10027840360999107,
|
||
|
|
"num_tokens": 1017497.0,
|
||
|
|
"step": 575
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.045392799377441,
|
||
|
|
"epoch": 0.029833089010621608,
|
||
|
|
"grad_norm": 1.390625,
|
||
|
|
"learning_rate": 0.0002895,
|
||
|
|
"loss": 6.7627,
|
||
|
|
"mean_token_accuracy": 0.09184609279036522,
|
||
|
|
"num_tokens": 1026437.0,
|
||
|
|
"step": 580
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.177649688720703,
|
||
|
|
"epoch": 0.03009027081243731,
|
||
|
|
"grad_norm": 1.4375,
|
||
|
|
"learning_rate": 0.000292,
|
||
|
|
"loss": 6.7745,
|
||
|
|
"mean_token_accuracy": 0.10040023326873779,
|
||
|
|
"num_tokens": 1034621.0,
|
||
|
|
"step": 585
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.030013942718506,
|
||
|
|
"epoch": 0.030347452614253017,
|
||
|
|
"grad_norm": 1.140625,
|
||
|
|
"learning_rate": 0.0002945,
|
||
|
|
"loss": 6.8522,
|
||
|
|
"mean_token_accuracy": 0.09577706381678582,
|
||
|
|
"num_tokens": 1043665.0,
|
||
|
|
"step": 590
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.080531978607178,
|
||
|
|
"epoch": 0.03060463441606872,
|
||
|
|
"grad_norm": 1.359375,
|
||
|
|
"learning_rate": 0.000297,
|
||
|
|
"loss": 6.8845,
|
||
|
|
"mean_token_accuracy": 0.09267403185367584,
|
||
|
|
"num_tokens": 1052891.0,
|
||
|
|
"step": 595
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.106464290618897,
|
||
|
|
"epoch": 0.030861816217884423,
|
||
|
|
"grad_norm": 1.3984375,
|
||
|
|
"learning_rate": 0.0002995,
|
||
|
|
"loss": 6.7591,
|
||
|
|
"mean_token_accuracy": 0.10866603180766106,
|
||
|
|
"num_tokens": 1060520.0,
|
||
|
|
"step": 600
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.065040636062622,
|
||
|
|
"epoch": 0.031118998019700125,
|
||
|
|
"grad_norm": 1.3671875,
|
||
|
|
"learning_rate": 0.000302,
|
||
|
|
"loss": 6.7758,
|
||
|
|
"mean_token_accuracy": 0.09805820658802986,
|
||
|
|
"num_tokens": 1069150.0,
|
||
|
|
"step": 605
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.90897569656372,
|
||
|
|
"epoch": 0.03137617982151583,
|
||
|
|
"grad_norm": 1.3203125,
|
||
|
|
"learning_rate": 0.0003045,
|
||
|
|
"loss": 6.6602,
|
||
|
|
"mean_token_accuracy": 0.10792294815182686,
|
||
|
|
"num_tokens": 1077015.0,
|
||
|
|
"step": 610
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.989263916015625,
|
||
|
|
"epoch": 0.03163336162333153,
|
||
|
|
"grad_norm": 1.2421875,
|
||
|
|
"learning_rate": 0.000307,
|
||
|
|
"loss": 6.732,
|
||
|
|
"mean_token_accuracy": 0.09874670803546906,
|
||
|
|
"num_tokens": 1085630.0,
|
||
|
|
"step": 615
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.091088914871216,
|
||
|
|
"epoch": 0.03189054342514724,
|
||
|
|
"grad_norm": 1.3125,
|
||
|
|
"learning_rate": 0.0003095,
|
||
|
|
"loss": 6.8404,
|
||
|
|
"mean_token_accuracy": 0.093934640660882,
|
||
|
|
"num_tokens": 1094423.0,
|
||
|
|
"step": 620
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.986142826080322,
|
||
|
|
"epoch": 0.032147725226962943,
|
||
|
|
"grad_norm": 1.1328125,
|
||
|
|
"learning_rate": 0.000312,
|
||
|
|
"loss": 6.7539,
|
||
|
|
"mean_token_accuracy": 0.09798811599612237,
|
||
|
|
"num_tokens": 1103049.0,
|
||
|
|
"step": 625
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.063631439208985,
|
||
|
|
"epoch": 0.03240490702877864,
|
||
|
|
"grad_norm": 1.375,
|
||
|
|
"learning_rate": 0.0003145,
|
||
|
|
"loss": 6.7592,
|
||
|
|
"mean_token_accuracy": 0.09810860157012939,
|
||
|
|
"num_tokens": 1111852.0,
|
||
|
|
"step": 630
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.935723733901978,
|
||
|
|
"epoch": 0.03266208883059435,
|
||
|
|
"grad_norm": 1.296875,
|
||
|
|
"learning_rate": 0.000317,
|
||
|
|
"loss": 6.6757,
|
||
|
|
"mean_token_accuracy": 0.09773161709308624,
|
||
|
|
"num_tokens": 1121545.0,
|
||
|
|
"step": 635
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.963910818099976,
|
||
|
|
"epoch": 0.03291927063241005,
|
||
|
|
"grad_norm": 1.140625,
|
||
|
|
"learning_rate": 0.0003195,
|
||
|
|
"loss": 6.6986,
|
||
|
|
"mean_token_accuracy": 0.0950073927640915,
|
||
|
|
"num_tokens": 1130639.0,
|
||
|
|
"step": 640
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.92723650932312,
|
||
|
|
"epoch": 0.033176452434225755,
|
||
|
|
"grad_norm": 1.171875,
|
||
|
|
"learning_rate": 0.000322,
|
||
|
|
"loss": 6.6173,
|
||
|
|
"mean_token_accuracy": 0.10274656191468239,
|
||
|
|
"num_tokens": 1138741.0,
|
||
|
|
"step": 645
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.957373142242432,
|
||
|
|
"epoch": 0.03343363423604146,
|
||
|
|
"grad_norm": 1.2578125,
|
||
|
|
"learning_rate": 0.00032450000000000003,
|
||
|
|
"loss": 6.7487,
|
||
|
|
"mean_token_accuracy": 0.10246102660894393,
|
||
|
|
"num_tokens": 1146985.0,
|
||
|
|
"step": 650
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.968684911727905,
|
||
|
|
"epoch": 0.03369081603785716,
|
||
|
|
"grad_norm": 1.2734375,
|
||
|
|
"learning_rate": 0.00032700000000000003,
|
||
|
|
"loss": 6.6421,
|
||
|
|
"mean_token_accuracy": 0.10296816006302834,
|
||
|
|
"num_tokens": 1155393.0,
|
||
|
|
"step": 655
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 7.074275159835816,
|
||
|
|
"epoch": 0.03394799783967287,
|
||
|
|
"grad_norm": 1.359375,
|
||
|
|
"learning_rate": 0.00032950000000000004,
|
||
|
|
"loss": 6.7709,
|
||
|
|
"mean_token_accuracy": 0.09904137998819351,
|
||
|
|
"num_tokens": 1164285.0,
|
||
|
|
"step": 660
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.8998229026794435,
|
||
|
|
"epoch": 0.034205179641488566,
|
||
|
|
"grad_norm": 1.1875,
|
||
|
|
"learning_rate": 0.00033200000000000005,
|
||
|
|
"loss": 6.7359,
|
||
|
|
"mean_token_accuracy": 0.10153986811637879,
|
||
|
|
"num_tokens": 1172997.0,
|
||
|
|
"step": 665
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.809995031356811,
|
||
|
|
"epoch": 0.03446236144330427,
|
||
|
|
"grad_norm": 1.3515625,
|
||
|
|
"learning_rate": 0.00033450000000000005,
|
||
|
|
"loss": 6.5043,
|
||
|
|
"mean_token_accuracy": 0.10296982899308205,
|
||
|
|
"num_tokens": 1182316.0,
|
||
|
|
"step": 670
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.95496187210083,
|
||
|
|
"epoch": 0.03471954324511998,
|
||
|
|
"grad_norm": 1.359375,
|
||
|
|
"learning_rate": 0.000337,
|
||
|
|
"loss": 6.7375,
|
||
|
|
"mean_token_accuracy": 0.10285088196396827,
|
||
|
|
"num_tokens": 1190660.0,
|
||
|
|
"step": 675
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.985808277130127,
|
||
|
|
"epoch": 0.03497672504693568,
|
||
|
|
"grad_norm": 1.25,
|
||
|
|
"learning_rate": 0.0003395,
|
||
|
|
"loss": 6.7359,
|
||
|
|
"mean_token_accuracy": 0.10022683814167976,
|
||
|
|
"num_tokens": 1199158.0,
|
||
|
|
"step": 680
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.826939868927002,
|
||
|
|
"epoch": 0.035233906848751384,
|
||
|
|
"grad_norm": 1.2734375,
|
||
|
|
"learning_rate": 0.000342,
|
||
|
|
"loss": 6.6363,
|
||
|
|
"mean_token_accuracy": 0.10053048059344291,
|
||
|
|
"num_tokens": 1208550.0,
|
||
|
|
"step": 685
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.928761577606201,
|
||
|
|
"epoch": 0.03549108865056708,
|
||
|
|
"grad_norm": 1.1875,
|
||
|
|
"learning_rate": 0.00034449999999999997,
|
||
|
|
"loss": 6.7171,
|
||
|
|
"mean_token_accuracy": 0.09703745916485787,
|
||
|
|
"num_tokens": 1218526.0,
|
||
|
|
"step": 690
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.970518112182617,
|
||
|
|
"epoch": 0.03574827045238279,
|
||
|
|
"grad_norm": 1.265625,
|
||
|
|
"learning_rate": 0.000347,
|
||
|
|
"loss": 6.8224,
|
||
|
|
"mean_token_accuracy": 0.09267975017428398,
|
||
|
|
"num_tokens": 1227247.0,
|
||
|
|
"step": 695
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.905700254440307,
|
||
|
|
"epoch": 0.036005452254198496,
|
||
|
|
"grad_norm": 1.21875,
|
||
|
|
"learning_rate": 0.0003495,
|
||
|
|
"loss": 6.7287,
|
||
|
|
"mean_token_accuracy": 0.10465597808361053,
|
||
|
|
"num_tokens": 1236146.0,
|
||
|
|
"step": 700
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.922169589996338,
|
||
|
|
"epoch": 0.036262634056014195,
|
||
|
|
"grad_norm": 1.234375,
|
||
|
|
"learning_rate": 0.000352,
|
||
|
|
"loss": 6.7667,
|
||
|
|
"mean_token_accuracy": 0.1004488743841648,
|
||
|
|
"num_tokens": 1244958.0,
|
||
|
|
"step": 705
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.962793493270874,
|
||
|
|
"epoch": 0.0365198158578299,
|
||
|
|
"grad_norm": 1.234375,
|
||
|
|
"learning_rate": 0.0003545,
|
||
|
|
"loss": 6.7626,
|
||
|
|
"mean_token_accuracy": 0.09757086858153344,
|
||
|
|
"num_tokens": 1254502.0,
|
||
|
|
"step": 710
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.917850494384766,
|
||
|
|
"epoch": 0.0367769976596456,
|
||
|
|
"grad_norm": 1.28125,
|
||
|
|
"learning_rate": 0.000357,
|
||
|
|
"loss": 6.691,
|
||
|
|
"mean_token_accuracy": 0.10314588993787766,
|
||
|
|
"num_tokens": 1263291.0,
|
||
|
|
"step": 715
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.852348566055298,
|
||
|
|
"epoch": 0.03703417946146131,
|
||
|
|
"grad_norm": 1.1875,
|
||
|
|
"learning_rate": 0.0003595,
|
||
|
|
"loss": 6.6744,
|
||
|
|
"mean_token_accuracy": 0.10638380572199821,
|
||
|
|
"num_tokens": 1272494.0,
|
||
|
|
"step": 720
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.917734289169312,
|
||
|
|
"epoch": 0.03729136126327701,
|
||
|
|
"grad_norm": 1.328125,
|
||
|
|
"learning_rate": 0.000362,
|
||
|
|
"loss": 6.8097,
|
||
|
|
"mean_token_accuracy": 0.0955355480313301,
|
||
|
|
"num_tokens": 1281611.0,
|
||
|
|
"step": 725
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.913245725631714,
|
||
|
|
"epoch": 0.03754854306509271,
|
||
|
|
"grad_norm": 1.125,
|
||
|
|
"learning_rate": 0.0003645,
|
||
|
|
"loss": 6.6715,
|
||
|
|
"mean_token_accuracy": 0.09784635901451111,
|
||
|
|
"num_tokens": 1291512.0,
|
||
|
|
"step": 730
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.8256752490997314,
|
||
|
|
"epoch": 0.03780572486690842,
|
||
|
|
"grad_norm": 1.2421875,
|
||
|
|
"learning_rate": 0.000367,
|
||
|
|
"loss": 6.5595,
|
||
|
|
"mean_token_accuracy": 0.10571763291954994,
|
||
|
|
"num_tokens": 1300413.0,
|
||
|
|
"step": 735
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.930764818191529,
|
||
|
|
"epoch": 0.03806290666872412,
|
||
|
|
"grad_norm": 1.2421875,
|
||
|
|
"learning_rate": 0.0003695,
|
||
|
|
"loss": 6.7698,
|
||
|
|
"mean_token_accuracy": 0.09721217602491379,
|
||
|
|
"num_tokens": 1309524.0,
|
||
|
|
"step": 740
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.896268653869629,
|
||
|
|
"epoch": 0.038320088470539825,
|
||
|
|
"grad_norm": 1.140625,
|
||
|
|
"learning_rate": 0.000372,
|
||
|
|
"loss": 6.6535,
|
||
|
|
"mean_token_accuracy": 0.10513104945421219,
|
||
|
|
"num_tokens": 1318128.0,
|
||
|
|
"step": 745
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.851891374588012,
|
||
|
|
"epoch": 0.03857727027235553,
|
||
|
|
"grad_norm": 1.2734375,
|
||
|
|
"learning_rate": 0.0003745,
|
||
|
|
"loss": 6.7028,
|
||
|
|
"mean_token_accuracy": 0.09935224205255508,
|
||
|
|
"num_tokens": 1326705.0,
|
||
|
|
"step": 750
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.729863882064819,
|
||
|
|
"epoch": 0.03883445207417123,
|
||
|
|
"grad_norm": 1.234375,
|
||
|
|
"learning_rate": 0.000377,
|
||
|
|
"loss": 6.5243,
|
||
|
|
"mean_token_accuracy": 0.10701719000935554,
|
||
|
|
"num_tokens": 1335271.0,
|
||
|
|
"step": 755
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.829174661636353,
|
||
|
|
"epoch": 0.039091633875986936,
|
||
|
|
"grad_norm": 1.359375,
|
||
|
|
"learning_rate": 0.0003795,
|
||
|
|
"loss": 6.5755,
|
||
|
|
"mean_token_accuracy": 0.10041920840740204,
|
||
|
|
"num_tokens": 1343944.0,
|
||
|
|
"step": 760
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.730857849121094,
|
||
|
|
"epoch": 0.039348815677802636,
|
||
|
|
"grad_norm": 1.1796875,
|
||
|
|
"learning_rate": 0.000382,
|
||
|
|
"loss": 6.5869,
|
||
|
|
"mean_token_accuracy": 0.10631005689501763,
|
||
|
|
"num_tokens": 1352294.0,
|
||
|
|
"step": 765
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.8131995677948,
|
||
|
|
"epoch": 0.03960599747961834,
|
||
|
|
"grad_norm": 1.359375,
|
||
|
|
"learning_rate": 0.0003845,
|
||
|
|
"loss": 6.6112,
|
||
|
|
"mean_token_accuracy": 0.10081271678209305,
|
||
|
|
"num_tokens": 1360533.0,
|
||
|
|
"step": 770
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.826685190200806,
|
||
|
|
"epoch": 0.03986317928143405,
|
||
|
|
"grad_norm": 1.28125,
|
||
|
|
"learning_rate": 0.00038700000000000003,
|
||
|
|
"loss": 6.5435,
|
||
|
|
"mean_token_accuracy": 0.10690599977970124,
|
||
|
|
"num_tokens": 1368880.0,
|
||
|
|
"step": 775
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.743242073059082,
|
||
|
|
"epoch": 0.04012036108324975,
|
||
|
|
"grad_norm": 1.203125,
|
||
|
|
"learning_rate": 0.00038950000000000003,
|
||
|
|
"loss": 6.568,
|
||
|
|
"mean_token_accuracy": 0.10478584542870521,
|
||
|
|
"num_tokens": 1377226.0,
|
||
|
|
"step": 780
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.831422472000122,
|
||
|
|
"epoch": 0.040377542885065454,
|
||
|
|
"grad_norm": 1.296875,
|
||
|
|
"learning_rate": 0.00039200000000000004,
|
||
|
|
"loss": 6.6902,
|
||
|
|
"mean_token_accuracy": 0.1015243612229824,
|
||
|
|
"num_tokens": 1386196.0,
|
||
|
|
"step": 785
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.745612382888794,
|
||
|
|
"epoch": 0.04063472468688115,
|
||
|
|
"grad_norm": 1.2109375,
|
||
|
|
"learning_rate": 0.00039450000000000005,
|
||
|
|
"loss": 6.6026,
|
||
|
|
"mean_token_accuracy": 0.10642225667834282,
|
||
|
|
"num_tokens": 1395019.0,
|
||
|
|
"step": 790
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.7675634860992435,
|
||
|
|
"epoch": 0.04089190648869686,
|
||
|
|
"grad_norm": 1.296875,
|
||
|
|
"learning_rate": 0.00039700000000000005,
|
||
|
|
"loss": 6.7062,
|
||
|
|
"mean_token_accuracy": 0.10018283650279045,
|
||
|
|
"num_tokens": 1404120.0,
|
||
|
|
"step": 795
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.898847818374634,
|
||
|
|
"epoch": 0.041149088290512566,
|
||
|
|
"grad_norm": 1.2421875,
|
||
|
|
"learning_rate": 0.0003995,
|
||
|
|
"loss": 6.5752,
|
||
|
|
"mean_token_accuracy": 0.0967138335108757,
|
||
|
|
"num_tokens": 1412812.0,
|
||
|
|
"step": 800
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.683012008666992,
|
||
|
|
"epoch": 0.041406270092328265,
|
||
|
|
"grad_norm": 1.0859375,
|
||
|
|
"learning_rate": 0.000402,
|
||
|
|
"loss": 6.5476,
|
||
|
|
"mean_token_accuracy": 0.10471888035535812,
|
||
|
|
"num_tokens": 1421439.0,
|
||
|
|
"step": 805
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.711639165878296,
|
||
|
|
"epoch": 0.04166345189414397,
|
||
|
|
"grad_norm": 1.1953125,
|
||
|
|
"learning_rate": 0.0004045,
|
||
|
|
"loss": 6.5496,
|
||
|
|
"mean_token_accuracy": 0.10460042878985405,
|
||
|
|
"num_tokens": 1429882.0,
|
||
|
|
"step": 810
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.719864559173584,
|
||
|
|
"epoch": 0.04192063369595967,
|
||
|
|
"grad_norm": 1.21875,
|
||
|
|
"learning_rate": 0.00040699999999999997,
|
||
|
|
"loss": 6.5972,
|
||
|
|
"mean_token_accuracy": 0.10305096060037613,
|
||
|
|
"num_tokens": 1438918.0,
|
||
|
|
"step": 815
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.770114183425903,
|
||
|
|
"epoch": 0.04217781549777538,
|
||
|
|
"grad_norm": 1.2578125,
|
||
|
|
"learning_rate": 0.0004095,
|
||
|
|
"loss": 6.7244,
|
||
|
|
"mean_token_accuracy": 0.09797946363687515,
|
||
|
|
"num_tokens": 1448337.0,
|
||
|
|
"step": 820
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.901697778701783,
|
||
|
|
"epoch": 0.04243499729959108,
|
||
|
|
"grad_norm": 1.28125,
|
||
|
|
"learning_rate": 0.000412,
|
||
|
|
"loss": 6.6691,
|
||
|
|
"mean_token_accuracy": 0.10322674512863159,
|
||
|
|
"num_tokens": 1457928.0,
|
||
|
|
"step": 825
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.765479469299317,
|
||
|
|
"epoch": 0.04269217910140678,
|
||
|
|
"grad_norm": 1.25,
|
||
|
|
"learning_rate": 0.0004145,
|
||
|
|
"loss": 6.6076,
|
||
|
|
"mean_token_accuracy": 0.11027010977268219,
|
||
|
|
"num_tokens": 1467022.0,
|
||
|
|
"step": 830
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.64197793006897,
|
||
|
|
"epoch": 0.04294936090322249,
|
||
|
|
"grad_norm": 1.09375,
|
||
|
|
"learning_rate": 0.000417,
|
||
|
|
"loss": 6.5992,
|
||
|
|
"mean_token_accuracy": 0.10252309665083885,
|
||
|
|
"num_tokens": 1476510.0,
|
||
|
|
"step": 835
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.800649499893188,
|
||
|
|
"epoch": 0.04320654270503819,
|
||
|
|
"grad_norm": 1.1484375,
|
||
|
|
"learning_rate": 0.0004195,
|
||
|
|
"loss": 6.5706,
|
||
|
|
"mean_token_accuracy": 0.10807883217930794,
|
||
|
|
"num_tokens": 1485141.0,
|
||
|
|
"step": 840
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.722679805755615,
|
||
|
|
"epoch": 0.043463724506853894,
|
||
|
|
"grad_norm": 1.3125,
|
||
|
|
"learning_rate": 0.000422,
|
||
|
|
"loss": 6.6423,
|
||
|
|
"mean_token_accuracy": 0.10095877721905708,
|
||
|
|
"num_tokens": 1494343.0,
|
||
|
|
"step": 845
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.649412488937378,
|
||
|
|
"epoch": 0.0437209063086696,
|
||
|
|
"grad_norm": 1.1171875,
|
||
|
|
"learning_rate": 0.0004245,
|
||
|
|
"loss": 6.5835,
|
||
|
|
"mean_token_accuracy": 0.10432918965816498,
|
||
|
|
"num_tokens": 1503753.0,
|
||
|
|
"step": 850
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.760374069213867,
|
||
|
|
"epoch": 0.0439780881104853,
|
||
|
|
"grad_norm": 1.1875,
|
||
|
|
"learning_rate": 0.000427,
|
||
|
|
"loss": 6.6178,
|
||
|
|
"mean_token_accuracy": 0.09621104225516319,
|
||
|
|
"num_tokens": 1512434.0,
|
||
|
|
"step": 855
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.713858127593994,
|
||
|
|
"epoch": 0.044235269912301006,
|
||
|
|
"grad_norm": 1.265625,
|
||
|
|
"learning_rate": 0.0004295,
|
||
|
|
"loss": 6.4808,
|
||
|
|
"mean_token_accuracy": 0.10826214924454688,
|
||
|
|
"num_tokens": 1521201.0,
|
||
|
|
"step": 860
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.593627119064331,
|
||
|
|
"epoch": 0.04449245171411671,
|
||
|
|
"grad_norm": 1.2734375,
|
||
|
|
"learning_rate": 0.000432,
|
||
|
|
"loss": 6.5988,
|
||
|
|
"mean_token_accuracy": 0.10316284075379371,
|
||
|
|
"num_tokens": 1529958.0,
|
||
|
|
"step": 865
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.778238105773926,
|
||
|
|
"epoch": 0.04474963351593241,
|
||
|
|
"grad_norm": 1.125,
|
||
|
|
"learning_rate": 0.0004345,
|
||
|
|
"loss": 6.5475,
|
||
|
|
"mean_token_accuracy": 0.10538713037967681,
|
||
|
|
"num_tokens": 1539524.0,
|
||
|
|
"step": 870
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.572915077209473,
|
||
|
|
"epoch": 0.04500681531774812,
|
||
|
|
"grad_norm": 1.140625,
|
||
|
|
"learning_rate": 0.000437,
|
||
|
|
"loss": 6.4783,
|
||
|
|
"mean_token_accuracy": 0.10733042433857917,
|
||
|
|
"num_tokens": 1547955.0,
|
||
|
|
"step": 875
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.661984968185425,
|
||
|
|
"epoch": 0.04526399711956382,
|
||
|
|
"grad_norm": 1.2578125,
|
||
|
|
"learning_rate": 0.0004395,
|
||
|
|
"loss": 6.5371,
|
||
|
|
"mean_token_accuracy": 0.10633926317095757,
|
||
|
|
"num_tokens": 1557401.0,
|
||
|
|
"step": 880
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.592761278152466,
|
||
|
|
"epoch": 0.045521178921379524,
|
||
|
|
"grad_norm": 1.265625,
|
||
|
|
"learning_rate": 0.000442,
|
||
|
|
"loss": 6.5084,
|
||
|
|
"mean_token_accuracy": 0.10569668263196945,
|
||
|
|
"num_tokens": 1566022.0,
|
||
|
|
"step": 885
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.636467218399048,
|
||
|
|
"epoch": 0.04577836072319523,
|
||
|
|
"grad_norm": 1.171875,
|
||
|
|
"learning_rate": 0.0004445,
|
||
|
|
"loss": 6.5551,
|
||
|
|
"mean_token_accuracy": 0.10752687007188796,
|
||
|
|
"num_tokens": 1575035.0,
|
||
|
|
"step": 890
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.695861721038819,
|
||
|
|
"epoch": 0.04603554252501093,
|
||
|
|
"grad_norm": 1.140625,
|
||
|
|
"learning_rate": 0.000447,
|
||
|
|
"loss": 6.5778,
|
||
|
|
"mean_token_accuracy": 0.10746671482920647,
|
||
|
|
"num_tokens": 1583357.0,
|
||
|
|
"step": 895
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.70294976234436,
|
||
|
|
"epoch": 0.046292724326826636,
|
||
|
|
"grad_norm": 1.1875,
|
||
|
|
"learning_rate": 0.00044950000000000003,
|
||
|
|
"loss": 6.3892,
|
||
|
|
"mean_token_accuracy": 0.11069994270801545,
|
||
|
|
"num_tokens": 1591702.0,
|
||
|
|
"step": 900
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.617056608200073,
|
||
|
|
"epoch": 0.046549906128642335,
|
||
|
|
"grad_norm": 1.1171875,
|
||
|
|
"learning_rate": 0.00045200000000000004,
|
||
|
|
"loss": 6.4792,
|
||
|
|
"mean_token_accuracy": 0.11211444064974785,
|
||
|
|
"num_tokens": 1600562.0,
|
||
|
|
"step": 905
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.684534406661987,
|
||
|
|
"epoch": 0.04680708793045804,
|
||
|
|
"grad_norm": 1.0625,
|
||
|
|
"learning_rate": 0.00045450000000000004,
|
||
|
|
"loss": 6.6204,
|
||
|
|
"mean_token_accuracy": 0.10558928847312928,
|
||
|
|
"num_tokens": 1610139.0,
|
||
|
|
"step": 910
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.765460586547851,
|
||
|
|
"epoch": 0.04706426973227375,
|
||
|
|
"grad_norm": 1.2734375,
|
||
|
|
"learning_rate": 0.00045700000000000005,
|
||
|
|
"loss": 6.6139,
|
||
|
|
"mean_token_accuracy": 0.10323682352900505,
|
||
|
|
"num_tokens": 1619464.0,
|
||
|
|
"step": 915
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.656091642379761,
|
||
|
|
"epoch": 0.04732145153408945,
|
||
|
|
"grad_norm": 1.1171875,
|
||
|
|
"learning_rate": 0.00045950000000000006,
|
||
|
|
"loss": 6.4596,
|
||
|
|
"mean_token_accuracy": 0.1120453879237175,
|
||
|
|
"num_tokens": 1628632.0,
|
||
|
|
"step": 920
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.445028781890869,
|
||
|
|
"epoch": 0.04757863333590515,
|
||
|
|
"grad_norm": 1.265625,
|
||
|
|
"learning_rate": 0.000462,
|
||
|
|
"loss": 6.4023,
|
||
|
|
"mean_token_accuracy": 0.11046137437224388,
|
||
|
|
"num_tokens": 1636855.0,
|
||
|
|
"step": 925
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.55358853340149,
|
||
|
|
"epoch": 0.04783581513772085,
|
||
|
|
"grad_norm": 1.1484375,
|
||
|
|
"learning_rate": 0.0004645,
|
||
|
|
"loss": 6.3969,
|
||
|
|
"mean_token_accuracy": 0.11445706561207772,
|
||
|
|
"num_tokens": 1645204.0,
|
||
|
|
"step": 930
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.668329048156738,
|
||
|
|
"epoch": 0.04809299693953656,
|
||
|
|
"grad_norm": 1.203125,
|
||
|
|
"learning_rate": 0.000467,
|
||
|
|
"loss": 6.5778,
|
||
|
|
"mean_token_accuracy": 0.10868966206908226,
|
||
|
|
"num_tokens": 1654231.0,
|
||
|
|
"step": 935
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.57129602432251,
|
||
|
|
"epoch": 0.048350178741352265,
|
||
|
|
"grad_norm": 1.1953125,
|
||
|
|
"learning_rate": 0.0004695,
|
||
|
|
"loss": 6.5478,
|
||
|
|
"mean_token_accuracy": 0.1099221870303154,
|
||
|
|
"num_tokens": 1663312.0,
|
||
|
|
"step": 940
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.630906820297241,
|
||
|
|
"epoch": 0.048607360543167964,
|
||
|
|
"grad_norm": 1.0859375,
|
||
|
|
"learning_rate": 0.000472,
|
||
|
|
"loss": 6.5729,
|
||
|
|
"mean_token_accuracy": 0.10720053240656853,
|
||
|
|
"num_tokens": 1672672.0,
|
||
|
|
"step": 945
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.701202535629273,
|
||
|
|
"epoch": 0.04886454234498367,
|
||
|
|
"grad_norm": 1.2421875,
|
||
|
|
"learning_rate": 0.0004745,
|
||
|
|
"loss": 6.6146,
|
||
|
|
"mean_token_accuracy": 0.10442524701356888,
|
||
|
|
"num_tokens": 1681497.0,
|
||
|
|
"step": 950
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.558098268508911,
|
||
|
|
"epoch": 0.04912172414679937,
|
||
|
|
"grad_norm": 1.203125,
|
||
|
|
"learning_rate": 0.000477,
|
||
|
|
"loss": 6.5076,
|
||
|
|
"mean_token_accuracy": 0.10559550374746322,
|
||
|
|
"num_tokens": 1690429.0,
|
||
|
|
"step": 955
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.602577352523804,
|
||
|
|
"epoch": 0.049378905948615076,
|
||
|
|
"grad_norm": 1.3125,
|
||
|
|
"learning_rate": 0.0004795,
|
||
|
|
"loss": 6.4754,
|
||
|
|
"mean_token_accuracy": 0.11203035712242126,
|
||
|
|
"num_tokens": 1698804.0,
|
||
|
|
"step": 960
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.621676778793335,
|
||
|
|
"epoch": 0.04963608775043078,
|
||
|
|
"grad_norm": 1.15625,
|
||
|
|
"learning_rate": 0.000482,
|
||
|
|
"loss": 6.5161,
|
||
|
|
"mean_token_accuracy": 0.1092241458594799,
|
||
|
|
"num_tokens": 1707309.0,
|
||
|
|
"step": 965
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.533698225021363,
|
||
|
|
"epoch": 0.04989326955224648,
|
||
|
|
"grad_norm": 1.171875,
|
||
|
|
"learning_rate": 0.0004845,
|
||
|
|
"loss": 6.4973,
|
||
|
|
"mean_token_accuracy": 0.11040452271699905,
|
||
|
|
"num_tokens": 1716163.0,
|
||
|
|
"step": 970
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.572607231140137,
|
||
|
|
"epoch": 0.05015045135406219,
|
||
|
|
"grad_norm": 1.109375,
|
||
|
|
"learning_rate": 0.000487,
|
||
|
|
"loss": 6.547,
|
||
|
|
"mean_token_accuracy": 0.10961430817842484,
|
||
|
|
"num_tokens": 1725316.0,
|
||
|
|
"step": 975
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.6284825801849365,
|
||
|
|
"epoch": 0.05040763315587789,
|
||
|
|
"grad_norm": 1.125,
|
||
|
|
"learning_rate": 0.0004895,
|
||
|
|
"loss": 6.5083,
|
||
|
|
"mean_token_accuracy": 0.11171742677688598,
|
||
|
|
"num_tokens": 1735193.0,
|
||
|
|
"step": 980
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.561748790740967,
|
||
|
|
"epoch": 0.050664814957693594,
|
||
|
|
"grad_norm": 1.1328125,
|
||
|
|
"learning_rate": 0.000492,
|
||
|
|
"loss": 6.4313,
|
||
|
|
"mean_token_accuracy": 0.10571753829717637,
|
||
|
|
"num_tokens": 1744624.0,
|
||
|
|
"step": 985
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.532333707809448,
|
||
|
|
"epoch": 0.0509219967595093,
|
||
|
|
"grad_norm": 1.171875,
|
||
|
|
"learning_rate": 0.0004945,
|
||
|
|
"loss": 6.4262,
|
||
|
|
"mean_token_accuracy": 0.1134820282459259,
|
||
|
|
"num_tokens": 1753566.0,
|
||
|
|
"step": 990
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.585614109039307,
|
||
|
|
"epoch": 0.051179178561325,
|
||
|
|
"grad_norm": 1.2734375,
|
||
|
|
"learning_rate": 0.000497,
|
||
|
|
"loss": 6.5563,
|
||
|
|
"mean_token_accuracy": 0.10488807931542396,
|
||
|
|
"num_tokens": 1762793.0,
|
||
|
|
"step": 995
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.60942120552063,
|
||
|
|
"epoch": 0.051436360363140705,
|
||
|
|
"grad_norm": 1.1328125,
|
||
|
|
"learning_rate": 0.0004995,
|
||
|
|
"loss": 6.5411,
|
||
|
|
"mean_token_accuracy": 0.10642052963376045,
|
||
|
|
"num_tokens": 1771511.0,
|
||
|
|
"step": 1000
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.607848262786865,
|
||
|
|
"epoch": 0.051693542164956405,
|
||
|
|
"grad_norm": 1.171875,
|
||
|
|
"learning_rate": 0.000499998026082006,
|
||
|
|
"loss": 6.5517,
|
||
|
|
"mean_token_accuracy": 0.10087490379810334,
|
||
|
|
"num_tokens": 1780230.0,
|
||
|
|
"step": 1005
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.517893648147583,
|
||
|
|
"epoch": 0.05195072396677211,
|
||
|
|
"grad_norm": 1.1640625,
|
||
|
|
"learning_rate": 0.0004999900070995136,
|
||
|
|
"loss": 6.4313,
|
||
|
|
"mean_token_accuracy": 0.11181956753134728,
|
||
|
|
"num_tokens": 1789372.0,
|
||
|
|
"step": 1010
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.466477012634277,
|
||
|
|
"epoch": 0.05220790576858782,
|
||
|
|
"grad_norm": 1.21875,
|
||
|
|
"learning_rate": 0.0004999758199023239,
|
||
|
|
"loss": 6.3947,
|
||
|
|
"mean_token_accuracy": 0.11296560466289521,
|
||
|
|
"num_tokens": 1798312.0,
|
||
|
|
"step": 1015
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.519049787521363,
|
||
|
|
"epoch": 0.05246508757040352,
|
||
|
|
"grad_norm": 1.2421875,
|
||
|
|
"learning_rate": 0.0004999554648793858,
|
||
|
|
"loss": 6.3971,
|
||
|
|
"mean_token_accuracy": 0.11271054744720459,
|
||
|
|
"num_tokens": 1806354.0,
|
||
|
|
"step": 1020
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.451335763931274,
|
||
|
|
"epoch": 0.05272226937221922,
|
||
|
|
"grad_norm": 1.265625,
|
||
|
|
"learning_rate": 0.0004999289425887425,
|
||
|
|
"loss": 6.4042,
|
||
|
|
"mean_token_accuracy": 0.11678544953465461,
|
||
|
|
"num_tokens": 1815366.0,
|
||
|
|
"step": 1025
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.533133411407471,
|
||
|
|
"epoch": 0.05297945117403492,
|
||
|
|
"grad_norm": 1.109375,
|
||
|
|
"learning_rate": 0.0004998962537575161,
|
||
|
|
"loss": 6.4659,
|
||
|
|
"mean_token_accuracy": 0.1081003189086914,
|
||
|
|
"num_tokens": 1824645.0,
|
||
|
|
"step": 1030
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.429107570648194,
|
||
|
|
"epoch": 0.05323663297585063,
|
||
|
|
"grad_norm": 1.03125,
|
||
|
|
"learning_rate": 0.0004998573992818874,
|
||
|
|
"loss": 6.4251,
|
||
|
|
"mean_token_accuracy": 0.11395458430051804,
|
||
|
|
"num_tokens": 1833166.0,
|
||
|
|
"step": 1035
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.645290565490723,
|
||
|
|
"epoch": 0.053493814777666335,
|
||
|
|
"grad_norm": 1.109375,
|
||
|
|
"learning_rate": 0.0004998123802270715,
|
||
|
|
"loss": 6.555,
|
||
|
|
"mean_token_accuracy": 0.10978370234370231,
|
||
|
|
"num_tokens": 1842390.0,
|
||
|
|
"step": 1040
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.419606733322143,
|
||
|
|
"epoch": 0.053750996579482034,
|
||
|
|
"grad_norm": 1.140625,
|
||
|
|
"learning_rate": 0.0004997611978272886,
|
||
|
|
"loss": 6.3838,
|
||
|
|
"mean_token_accuracy": 0.1112293429672718,
|
||
|
|
"num_tokens": 1851645.0,
|
||
|
|
"step": 1045
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.453891038894653,
|
||
|
|
"epoch": 0.05400817838129774,
|
||
|
|
"grad_norm": 1.2734375,
|
||
|
|
"learning_rate": 0.0004997038534857298,
|
||
|
|
"loss": 6.3782,
|
||
|
|
"mean_token_accuracy": 0.11755769476294517,
|
||
|
|
"num_tokens": 1860008.0,
|
||
|
|
"step": 1050
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.4972833633422855,
|
||
|
|
"epoch": 0.05426536018311344,
|
||
|
|
"grad_norm": 1.09375,
|
||
|
|
"learning_rate": 0.0004996403487745194,
|
||
|
|
"loss": 6.4343,
|
||
|
|
"mean_token_accuracy": 0.1094091109931469,
|
||
|
|
"num_tokens": 1869329.0,
|
||
|
|
"step": 1055
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.387360382080078,
|
||
|
|
"epoch": 0.054522541984929146,
|
||
|
|
"grad_norm": 1.0859375,
|
||
|
|
"learning_rate": 0.000499570685434671,
|
||
|
|
"loss": 6.3339,
|
||
|
|
"mean_token_accuracy": 0.11642076373100281,
|
||
|
|
"num_tokens": 1878054.0,
|
||
|
|
"step": 1060
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.484694147109986,
|
||
|
|
"epoch": 0.05477972378674485,
|
||
|
|
"grad_norm": 1.1171875,
|
||
|
|
"learning_rate": 0.0004994948653760405,
|
||
|
|
"loss": 6.3946,
|
||
|
|
"mean_token_accuracy": 0.11390996798872947,
|
||
|
|
"num_tokens": 1886581.0,
|
||
|
|
"step": 1065
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.580167531967163,
|
||
|
|
"epoch": 0.05503690558856055,
|
||
|
|
"grad_norm": 1.1328125,
|
||
|
|
"learning_rate": 0.0004994128906772729,
|
||
|
|
"loss": 6.4711,
|
||
|
|
"mean_token_accuracy": 0.11259651854634285,
|
||
|
|
"num_tokens": 1895731.0,
|
||
|
|
"step": 1070
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.423868322372437,
|
||
|
|
"epoch": 0.05529408739037626,
|
||
|
|
"grad_norm": 1.1015625,
|
||
|
|
"learning_rate": 0.000499324763585746,
|
||
|
|
"loss": 6.3499,
|
||
|
|
"mean_token_accuracy": 0.11970952153205872,
|
||
|
|
"num_tokens": 1904181.0,
|
||
|
|
"step": 1075
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.406012630462646,
|
||
|
|
"epoch": 0.05555126919219196,
|
||
|
|
"grad_norm": 1.0859375,
|
||
|
|
"learning_rate": 0.0004992304865175085,
|
||
|
|
"loss": 6.3772,
|
||
|
|
"mean_token_accuracy": 0.11032988727092743,
|
||
|
|
"num_tokens": 1913335.0,
|
||
|
|
"step": 1080
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.484732151031494,
|
||
|
|
"epoch": 0.05580845099400766,
|
||
|
|
"grad_norm": 1.15625,
|
||
|
|
"learning_rate": 0.0004991300620572138,
|
||
|
|
"loss": 6.3966,
|
||
|
|
"mean_token_accuracy": 0.11090287342667579,
|
||
|
|
"num_tokens": 1922789.0,
|
||
|
|
"step": 1085
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.436389446258545,
|
||
|
|
"epoch": 0.05606563279582337,
|
||
|
|
"grad_norm": 1.0859375,
|
||
|
|
"learning_rate": 0.0004990234929580494,
|
||
|
|
"loss": 6.3178,
|
||
|
|
"mean_token_accuracy": 0.11508271917700767,
|
||
|
|
"num_tokens": 1931214.0,
|
||
|
|
"step": 1090
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.433405256271362,
|
||
|
|
"epoch": 0.05632281459763907,
|
||
|
|
"grad_norm": 1.1015625,
|
||
|
|
"learning_rate": 0.0004989107821416609,
|
||
|
|
"loss": 6.4827,
|
||
|
|
"mean_token_accuracy": 0.10500127375125885,
|
||
|
|
"num_tokens": 1941151.0,
|
||
|
|
"step": 1095
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.4416193008422855,
|
||
|
|
"epoch": 0.056579996399454775,
|
||
|
|
"grad_norm": 1.1328125,
|
||
|
|
"learning_rate": 0.0004987919326980723,
|
||
|
|
"loss": 6.331,
|
||
|
|
"mean_token_accuracy": 0.11337620094418525,
|
||
|
|
"num_tokens": 1949326.0,
|
||
|
|
"step": 1100
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.514848232269287,
|
||
|
|
"epoch": 0.05683717820127048,
|
||
|
|
"grad_norm": 1.1171875,
|
||
|
|
"learning_rate": 0.0004986669478856011,
|
||
|
|
"loss": 6.4664,
|
||
|
|
"mean_token_accuracy": 0.10760492980480194,
|
||
|
|
"num_tokens": 1958929.0,
|
||
|
|
"step": 1105
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.39950590133667,
|
||
|
|
"epoch": 0.05709436000308618,
|
||
|
|
"grad_norm": 1.0703125,
|
||
|
|
"learning_rate": 0.0004985358311307688,
|
||
|
|
"loss": 6.2505,
|
||
|
|
"mean_token_accuracy": 0.11898310258984565,
|
||
|
|
"num_tokens": 1967690.0,
|
||
|
|
"step": 1110
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.384913921356201,
|
||
|
|
"epoch": 0.05735154180490189,
|
||
|
|
"grad_norm": 1.015625,
|
||
|
|
"learning_rate": 0.0004983985860282081,
|
||
|
|
"loss": 6.3981,
|
||
|
|
"mean_token_accuracy": 0.11035036444664001,
|
||
|
|
"num_tokens": 1977786.0,
|
||
|
|
"step": 1115
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.379779815673828,
|
||
|
|
"epoch": 0.057608723606717586,
|
||
|
|
"grad_norm": 1.0859375,
|
||
|
|
"learning_rate": 0.0004982552163405623,
|
||
|
|
"loss": 6.3107,
|
||
|
|
"mean_token_accuracy": 0.11793362498283386,
|
||
|
|
"num_tokens": 1986708.0,
|
||
|
|
"step": 1120
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.341381025314331,
|
||
|
|
"epoch": 0.05786590540853329,
|
||
|
|
"grad_norm": 1.078125,
|
||
|
|
"learning_rate": 0.0004981057259983839,
|
||
|
|
"loss": 6.3345,
|
||
|
|
"mean_token_accuracy": 0.11417381316423417,
|
||
|
|
"num_tokens": 1996309.0,
|
||
|
|
"step": 1125
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.446984195709229,
|
||
|
|
"epoch": 0.058123087210349,
|
||
|
|
"grad_norm": 1.140625,
|
||
|
|
"learning_rate": 0.0004979501191000262,
|
||
|
|
"loss": 6.2712,
|
||
|
|
"mean_token_accuracy": 0.11331850737333297,
|
||
|
|
"num_tokens": 2004754.0,
|
||
|
|
"step": 1130
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.322438764572143,
|
||
|
|
"epoch": 0.0583802690121647,
|
||
|
|
"grad_norm": 1.09375,
|
||
|
|
"learning_rate": 0.0004977883999115311,
|
||
|
|
"loss": 6.3644,
|
||
|
|
"mean_token_accuracy": 0.11575946882367134,
|
||
|
|
"num_tokens": 2013231.0,
|
||
|
|
"step": 1135
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.3898763179779055,
|
||
|
|
"epoch": 0.058637450813980405,
|
||
|
|
"grad_norm": 1.1328125,
|
||
|
|
"learning_rate": 0.0004976205728665113,
|
||
|
|
"loss": 6.3163,
|
||
|
|
"mean_token_accuracy": 0.11673919707536698,
|
||
|
|
"num_tokens": 2021918.0,
|
||
|
|
"step": 1140
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.395988273620605,
|
||
|
|
"epoch": 0.058894632615796104,
|
||
|
|
"grad_norm": 1.109375,
|
||
|
|
"learning_rate": 0.0004974466425660307,
|
||
|
|
"loss": 6.3607,
|
||
|
|
"mean_token_accuracy": 0.1184878721833229,
|
||
|
|
"num_tokens": 2030341.0,
|
||
|
|
"step": 1145
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.378729295730591,
|
||
|
|
"epoch": 0.05915181441761181,
|
||
|
|
"grad_norm": 1.1953125,
|
||
|
|
"learning_rate": 0.0004972666137784759,
|
||
|
|
"loss": 6.3114,
|
||
|
|
"mean_token_accuracy": 0.11576305478811263,
|
||
|
|
"num_tokens": 2038869.0,
|
||
|
|
"step": 1150
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.363564395904541,
|
||
|
|
"epoch": 0.059408996219427516,
|
||
|
|
"grad_norm": 1.09375,
|
||
|
|
"learning_rate": 0.0004970804914394271,
|
||
|
|
"loss": 6.3938,
|
||
|
|
"mean_token_accuracy": 0.1138048842549324,
|
||
|
|
"num_tokens": 2047545.0,
|
||
|
|
"step": 1155
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.406496477127075,
|
||
|
|
"epoch": 0.059666178021243216,
|
||
|
|
"grad_norm": 1.078125,
|
||
|
|
"learning_rate": 0.0004968882806515225,
|
||
|
|
"loss": 6.4462,
|
||
|
|
"mean_token_accuracy": 0.11089355796575547,
|
||
|
|
"num_tokens": 2056802.0,
|
||
|
|
"step": 1160
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.383754062652588,
|
||
|
|
"epoch": 0.05992335982305892,
|
||
|
|
"grad_norm": 1.1328125,
|
||
|
|
"learning_rate": 0.0004966899866843177,
|
||
|
|
"loss": 6.3043,
|
||
|
|
"mean_token_accuracy": 0.11790038123726845,
|
||
|
|
"num_tokens": 2065106.0,
|
||
|
|
"step": 1165
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.439864730834961,
|
||
|
|
"epoch": 0.06018054162487462,
|
||
|
|
"grad_norm": 1.0859375,
|
||
|
|
"learning_rate": 0.000496485614974142,
|
||
|
|
"loss": 6.3607,
|
||
|
|
"mean_token_accuracy": 0.11016541495919227,
|
||
|
|
"num_tokens": 2073723.0,
|
||
|
|
"step": 1170
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.336991977691651,
|
||
|
|
"epoch": 0.06043772342669033,
|
||
|
|
"grad_norm": 1.0859375,
|
||
|
|
"learning_rate": 0.0004962751711239492,
|
||
|
|
"loss": 6.2888,
|
||
|
|
"mean_token_accuracy": 0.1206134170293808,
|
||
|
|
"num_tokens": 2082296.0,
|
||
|
|
"step": 1175
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.377587127685547,
|
||
|
|
"epoch": 0.060694905228506034,
|
||
|
|
"grad_norm": 1.140625,
|
||
|
|
"learning_rate": 0.0004960586609031636,
|
||
|
|
"loss": 6.3447,
|
||
|
|
"mean_token_accuracy": 0.11322090104222297,
|
||
|
|
"num_tokens": 2091239.0,
|
||
|
|
"step": 1180
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.373478603363037,
|
||
|
|
"epoch": 0.06095208703032173,
|
||
|
|
"grad_norm": 1.09375,
|
||
|
|
"learning_rate": 0.0004958360902475224,
|
||
|
|
"loss": 6.3073,
|
||
|
|
"mean_token_accuracy": 0.11865990906953812,
|
||
|
|
"num_tokens": 2100809.0,
|
||
|
|
"step": 1185
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.37120213508606,
|
||
|
|
"epoch": 0.06120926883213744,
|
||
|
|
"grad_norm": 1.1953125,
|
||
|
|
"learning_rate": 0.0004956074652589125,
|
||
|
|
"loss": 6.3806,
|
||
|
|
"mean_token_accuracy": 0.11596836000680924,
|
||
|
|
"num_tokens": 2109373.0,
|
||
|
|
"step": 1190
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.386609125137329,
|
||
|
|
"epoch": 0.06146645063395314,
|
||
|
|
"grad_norm": 1.125,
|
||
|
|
"learning_rate": 0.0004953727922052035,
|
||
|
|
"loss": 6.335,
|
||
|
|
"mean_token_accuracy": 0.1201685570180416,
|
||
|
|
"num_tokens": 2117351.0,
|
||
|
|
"step": 1195
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.3725518703460695,
|
||
|
|
"epoch": 0.061723632435768845,
|
||
|
|
"grad_norm": 1.09375,
|
||
|
|
"learning_rate": 0.0004951320775200756,
|
||
|
|
"loss": 6.2876,
|
||
|
|
"mean_token_accuracy": 0.12080588638782501,
|
||
|
|
"num_tokens": 2125792.0,
|
||
|
|
"step": 1200
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.261738634109497,
|
||
|
|
"epoch": 0.06198081423758455,
|
||
|
|
"grad_norm": 1.0703125,
|
||
|
|
"learning_rate": 0.0004948853278028436,
|
||
|
|
"loss": 6.2851,
|
||
|
|
"mean_token_accuracy": 0.12247317284345627,
|
||
|
|
"num_tokens": 2134755.0,
|
||
|
|
"step": 1205
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.426895523071289,
|
||
|
|
"epoch": 0.06223799603940025,
|
||
|
|
"grad_norm": 1.171875,
|
||
|
|
"learning_rate": 0.0004946325498182755,
|
||
|
|
"loss": 6.2479,
|
||
|
|
"mean_token_accuracy": 0.11313225403428077,
|
||
|
|
"num_tokens": 2144063.0,
|
||
|
|
"step": 1210
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.373356294631958,
|
||
|
|
"epoch": 0.06249517784121596,
|
||
|
|
"grad_norm": 1.109375,
|
||
|
|
"learning_rate": 0.0004943737504964076,
|
||
|
|
"loss": 6.3527,
|
||
|
|
"mean_token_accuracy": 0.11966249272227288,
|
||
|
|
"num_tokens": 2153664.0,
|
||
|
|
"step": 1215
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.227408838272095,
|
||
|
|
"epoch": 0.06275235964303166,
|
||
|
|
"grad_norm": 1.1015625,
|
||
|
|
"learning_rate": 0.000494108936932354,
|
||
|
|
"loss": 6.1855,
|
||
|
|
"mean_token_accuracy": 0.1191711500287056,
|
||
|
|
"num_tokens": 2161797.0,
|
||
|
|
"step": 1220
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.517656993865967,
|
||
|
|
"epoch": 0.06300954144484737,
|
||
|
|
"grad_norm": 1.0859375,
|
||
|
|
"learning_rate": 0.0004938381163861124,
|
||
|
|
"loss": 6.3498,
|
||
|
|
"mean_token_accuracy": 0.11286477893590927,
|
||
|
|
"num_tokens": 2170312.0,
|
||
|
|
"step": 1225
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.230176687240601,
|
||
|
|
"epoch": 0.06326672324666306,
|
||
|
|
"grad_norm": 1.0859375,
|
||
|
|
"learning_rate": 0.0004935612962823645,
|
||
|
|
"loss": 6.3298,
|
||
|
|
"mean_token_accuracy": 0.11120934784412384,
|
||
|
|
"num_tokens": 2179850.0,
|
||
|
|
"step": 1230
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.308627033233643,
|
||
|
|
"epoch": 0.06352390504847877,
|
||
|
|
"grad_norm": 1.109375,
|
||
|
|
"learning_rate": 0.0004932784842102739,
|
||
|
|
"loss": 6.2072,
|
||
|
|
"mean_token_accuracy": 0.11979541927576065,
|
||
|
|
"num_tokens": 2189201.0,
|
||
|
|
"step": 1235
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.313740825653076,
|
||
|
|
"epoch": 0.06378108685029447,
|
||
|
|
"grad_norm": 0.984375,
|
||
|
|
"learning_rate": 0.0004929896879232758,
|
||
|
|
"loss": 6.3061,
|
||
|
|
"mean_token_accuracy": 0.11951600462198257,
|
||
|
|
"num_tokens": 2198362.0,
|
||
|
|
"step": 1240
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.322280406951904,
|
||
|
|
"epoch": 0.06403826865211018,
|
||
|
|
"grad_norm": 1.09375,
|
||
|
|
"learning_rate": 0.0004926949153388668,
|
||
|
|
"loss": 6.2858,
|
||
|
|
"mean_token_accuracy": 0.1180046945810318,
|
||
|
|
"num_tokens": 2207261.0,
|
||
|
|
"step": 1245
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.374325513839722,
|
||
|
|
"epoch": 0.06429545045392589,
|
||
|
|
"grad_norm": 1.0546875,
|
||
|
|
"learning_rate": 0.0004923941745383859,
|
||
|
|
"loss": 6.324,
|
||
|
|
"mean_token_accuracy": 0.12014769464731216,
|
||
|
|
"num_tokens": 2216293.0,
|
||
|
|
"step": 1250
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.248019790649414,
|
||
|
|
"epoch": 0.06455263225574158,
|
||
|
|
"grad_norm": 1.1796875,
|
||
|
|
"learning_rate": 0.000492087473766794,
|
||
|
|
"loss": 6.1756,
|
||
|
|
"mean_token_accuracy": 0.12480147182941437,
|
||
|
|
"num_tokens": 2224638.0,
|
||
|
|
"step": 1255
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.246414041519165,
|
||
|
|
"epoch": 0.06480981405755729,
|
||
|
|
"grad_norm": 1.140625,
|
||
|
|
"learning_rate": 0.000491774821432448,
|
||
|
|
"loss": 6.174,
|
||
|
|
"mean_token_accuracy": 0.12405480146408081,
|
||
|
|
"num_tokens": 2233422.0,
|
||
|
|
"step": 1260
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.36962661743164,
|
||
|
|
"epoch": 0.06506699585937299,
|
||
|
|
"grad_norm": 1.0390625,
|
||
|
|
"learning_rate": 0.0004914562261068693,
|
||
|
|
"loss": 6.3003,
|
||
|
|
"mean_token_accuracy": 0.11817166209220886,
|
||
|
|
"num_tokens": 2242497.0,
|
||
|
|
"step": 1265
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.283186435699463,
|
||
|
|
"epoch": 0.0653241776611887,
|
||
|
|
"grad_norm": 1.09375,
|
||
|
|
"learning_rate": 0.0004911316965245098,
|
||
|
|
"loss": 6.3951,
|
||
|
|
"mean_token_accuracy": 0.11700899675488471,
|
||
|
|
"num_tokens": 2251876.0,
|
||
|
|
"step": 1270
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.4162839412689205,
|
||
|
|
"epoch": 0.0655813594630044,
|
||
|
|
"grad_norm": 1.046875,
|
||
|
|
"learning_rate": 0.000490801241582512,
|
||
|
|
"loss": 6.3263,
|
||
|
|
"mean_token_accuracy": 0.11120393425226212,
|
||
|
|
"num_tokens": 2261476.0,
|
||
|
|
"step": 1275
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.217834234237671,
|
||
|
|
"epoch": 0.0658385412648201,
|
||
|
|
"grad_norm": 1.09375,
|
||
|
|
"learning_rate": 0.000490464870340465,
|
||
|
|
"loss": 6.2036,
|
||
|
|
"mean_token_accuracy": 0.12037949934601784,
|
||
|
|
"num_tokens": 2269830.0,
|
||
|
|
"step": 1280
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.354285717010498,
|
||
|
|
"epoch": 0.0660957230666358,
|
||
|
|
"grad_norm": 1.0546875,
|
||
|
|
"learning_rate": 0.0004901225920201563,
|
||
|
|
"loss": 6.2549,
|
||
|
|
"mean_token_accuracy": 0.1226073995232582,
|
||
|
|
"num_tokens": 2278846.0,
|
||
|
|
"step": 1285
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.259861993789673,
|
||
|
|
"epoch": 0.06635290486845151,
|
||
|
|
"grad_norm": 1.1015625,
|
||
|
|
"learning_rate": 0.000489774416005319,
|
||
|
|
"loss": 6.1377,
|
||
|
|
"mean_token_accuracy": 0.12190483957529068,
|
||
|
|
"num_tokens": 2287379.0,
|
||
|
|
"step": 1290
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.185118103027344,
|
||
|
|
"epoch": 0.06661008667026722,
|
||
|
|
"grad_norm": 1.1015625,
|
||
|
|
"learning_rate": 0.0004894203518413742,
|
||
|
|
"loss": 6.232,
|
||
|
|
"mean_token_accuracy": 0.11986896097660064,
|
||
|
|
"num_tokens": 2296071.0,
|
||
|
|
"step": 1295
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.285954570770263,
|
||
|
|
"epoch": 0.06686726847208292,
|
||
|
|
"grad_norm": 1.1015625,
|
||
|
|
"learning_rate": 0.0004890604092351701,
|
||
|
|
"loss": 6.1568,
|
||
|
|
"mean_token_accuracy": 0.12937120646238326,
|
||
|
|
"num_tokens": 2305629.0,
|
||
|
|
"step": 1300
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.352389907836914,
|
||
|
|
"epoch": 0.06712445027389861,
|
||
|
|
"grad_norm": 1.15625,
|
||
|
|
"learning_rate": 0.000488694598054715,
|
||
|
|
"loss": 6.2792,
|
||
|
|
"mean_token_accuracy": 0.11652439460158348,
|
||
|
|
"num_tokens": 2314297.0,
|
||
|
|
"step": 1305
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.281135702133179,
|
||
|
|
"epoch": 0.06738163207571432,
|
||
|
|
"grad_norm": 1.015625,
|
||
|
|
"learning_rate": 0.0004883229283289071,
|
||
|
|
"loss": 6.2421,
|
||
|
|
"mean_token_accuracy": 0.1163830317556858,
|
||
|
|
"num_tokens": 2323583.0,
|
||
|
|
"step": 1310
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.275307750701904,
|
||
|
|
"epoch": 0.06763881387753003,
|
||
|
|
"grad_norm": 1.125,
|
||
|
|
"learning_rate": 0.00048794541024725993,
|
||
|
|
"loss": 6.1962,
|
||
|
|
"mean_token_accuracy": 0.12070676833391189,
|
||
|
|
"num_tokens": 2332362.0,
|
||
|
|
"step": 1315
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.247883081436157,
|
||
|
|
"epoch": 0.06789599567934573,
|
||
|
|
"grad_norm": 1.03125,
|
||
|
|
"learning_rate": 0.0004875620541596221,
|
||
|
|
"loss": 6.2433,
|
||
|
|
"mean_token_accuracy": 0.11916191950440407,
|
||
|
|
"num_tokens": 2341724.0,
|
||
|
|
"step": 1320
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.323701190948486,
|
||
|
|
"epoch": 0.06815317748116144,
|
||
|
|
"grad_norm": 1.1953125,
|
||
|
|
"learning_rate": 0.00048717287057589454,
|
||
|
|
"loss": 6.3094,
|
||
|
|
"mean_token_accuracy": 0.11830834746360779,
|
||
|
|
"num_tokens": 2350687.0,
|
||
|
|
"step": 1325
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.180278348922729,
|
||
|
|
"epoch": 0.06841035928297713,
|
||
|
|
"grad_norm": 1.0078125,
|
||
|
|
"learning_rate": 0.0004867778701657417,
|
||
|
|
"loss": 6.123,
|
||
|
|
"mean_token_accuracy": 0.12217027693986893,
|
||
|
|
"num_tokens": 2359761.0,
|
||
|
|
"step": 1330
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.274547529220581,
|
||
|
|
"epoch": 0.06866754108479284,
|
||
|
|
"grad_norm": 0.99609375,
|
||
|
|
"learning_rate": 0.00048637706375829955,
|
||
|
|
"loss": 6.2057,
|
||
|
|
"mean_token_accuracy": 0.12222478315234184,
|
||
|
|
"num_tokens": 2369203.0,
|
||
|
|
"step": 1335
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.284049701690674,
|
||
|
|
"epoch": 0.06892472288660854,
|
||
|
|
"grad_norm": 1.0625,
|
||
|
|
"learning_rate": 0.000485970462341878,
|
||
|
|
"loss": 6.2373,
|
||
|
|
"mean_token_accuracy": 0.12175923585891724,
|
||
|
|
"num_tokens": 2377576.0,
|
||
|
|
"step": 1340
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.255672264099121,
|
||
|
|
"epoch": 0.06918190468842425,
|
||
|
|
"grad_norm": 1.1640625,
|
||
|
|
"learning_rate": 0.00048555807706366044,
|
||
|
|
"loss": 6.2313,
|
||
|
|
"mean_token_accuracy": 0.11880970671772957,
|
||
|
|
"num_tokens": 2386658.0,
|
||
|
|
"step": 1345
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.267937898635864,
|
||
|
|
"epoch": 0.06943908649023996,
|
||
|
|
"grad_norm": 1.125,
|
||
|
|
"learning_rate": 0.00048513991922939756,
|
||
|
|
"loss": 6.2557,
|
||
|
|
"mean_token_accuracy": 0.12166587859392167,
|
||
|
|
"num_tokens": 2395340.0,
|
||
|
|
"step": 1350
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.228494787216187,
|
||
|
|
"epoch": 0.06969626829205565,
|
||
|
|
"grad_norm": 1.046875,
|
||
|
|
"learning_rate": 0.00048471600030309744,
|
||
|
|
"loss": 6.287,
|
||
|
|
"mean_token_accuracy": 0.11910992339253426,
|
||
|
|
"num_tokens": 2404844.0,
|
||
|
|
"step": 1355
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.3855327606201175,
|
||
|
|
"epoch": 0.06995345009387136,
|
||
|
|
"grad_norm": 1.1484375,
|
||
|
|
"learning_rate": 0.00048428633190671186,
|
||
|
|
"loss": 6.2122,
|
||
|
|
"mean_token_accuracy": 0.11871807649731636,
|
||
|
|
"num_tokens": 2413641.0,
|
||
|
|
"step": 1360
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.2528892993927006,
|
||
|
|
"epoch": 0.07021063189568706,
|
||
|
|
"grad_norm": 1.0859375,
|
||
|
|
"learning_rate": 0.0004838509258198167,
|
||
|
|
"loss": 6.2608,
|
||
|
|
"mean_token_accuracy": 0.12074613049626351,
|
||
|
|
"num_tokens": 2423065.0,
|
||
|
|
"step": 1365
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.365111207962036,
|
||
|
|
"epoch": 0.07046781369750277,
|
||
|
|
"grad_norm": 1.1640625,
|
||
|
|
"learning_rate": 0.00048340979397929,
|
||
|
|
"loss": 6.1988,
|
||
|
|
"mean_token_accuracy": 0.1260582149028778,
|
||
|
|
"num_tokens": 2432486.0,
|
||
|
|
"step": 1370
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.297368955612183,
|
||
|
|
"epoch": 0.07072499549931847,
|
||
|
|
"grad_norm": 1.171875,
|
||
|
|
"learning_rate": 0.00048296294847898386,
|
||
|
|
"loss": 6.2855,
|
||
|
|
"mean_token_accuracy": 0.1175057515501976,
|
||
|
|
"num_tokens": 2441582.0,
|
||
|
|
"step": 1375
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.272958660125733,
|
||
|
|
"epoch": 0.07098217730113417,
|
||
|
|
"grad_norm": 1.046875,
|
||
|
|
"learning_rate": 0.0004825104015693934,
|
||
|
|
"loss": 6.1998,
|
||
|
|
"mean_token_accuracy": 0.1187170147895813,
|
||
|
|
"num_tokens": 2450618.0,
|
||
|
|
"step": 1380
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.21057162284851,
|
||
|
|
"epoch": 0.07123935910294987,
|
||
|
|
"grad_norm": 1.0234375,
|
||
|
|
"learning_rate": 0.0004820521656573208,
|
||
|
|
"loss": 6.2205,
|
||
|
|
"mean_token_accuracy": 0.11892557591199875,
|
||
|
|
"num_tokens": 2459346.0,
|
||
|
|
"step": 1385
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.275320386886596,
|
||
|
|
"epoch": 0.07149654090476558,
|
||
|
|
"grad_norm": 1.15625,
|
||
|
|
"learning_rate": 0.00048158825330553505,
|
||
|
|
"loss": 6.2183,
|
||
|
|
"mean_token_accuracy": 0.12063762545585632,
|
||
|
|
"num_tokens": 2467775.0,
|
||
|
|
"step": 1390
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.233735370635986,
|
||
|
|
"epoch": 0.07175372270658129,
|
||
|
|
"grad_norm": 1.21875,
|
||
|
|
"learning_rate": 0.00048111867723242763,
|
||
|
|
"loss": 6.0805,
|
||
|
|
"mean_token_accuracy": 0.12942860201001166,
|
||
|
|
"num_tokens": 2475732.0,
|
||
|
|
"step": 1395
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.302308511734009,
|
||
|
|
"epoch": 0.07201090450839699,
|
||
|
|
"grad_norm": 1.0859375,
|
||
|
|
"learning_rate": 0.0004806434503116637,
|
||
|
|
"loss": 6.2751,
|
||
|
|
"mean_token_accuracy": 0.11736578792333603,
|
||
|
|
"num_tokens": 2484468.0,
|
||
|
|
"step": 1400
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.20477180480957,
|
||
|
|
"epoch": 0.07226808631021268,
|
||
|
|
"grad_norm": 1.1015625,
|
||
|
|
"learning_rate": 0.0004801625855718296,
|
||
|
|
"loss": 6.0979,
|
||
|
|
"mean_token_accuracy": 0.12714530006051064,
|
||
|
|
"num_tokens": 2492945.0,
|
||
|
|
"step": 1405
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.303807067871094,
|
||
|
|
"epoch": 0.07252526811202839,
|
||
|
|
"grad_norm": 1.015625,
|
||
|
|
"learning_rate": 0.00047967609619607477,
|
||
|
|
"loss": 6.2581,
|
||
|
|
"mean_token_accuracy": 0.12180023640394211,
|
||
|
|
"num_tokens": 2502267.0,
|
||
|
|
"step": 1410
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.076932668685913,
|
||
|
|
"epoch": 0.0727824499138441,
|
||
|
|
"grad_norm": 1.1171875,
|
||
|
|
"learning_rate": 0.0004791839955217513,
|
||
|
|
"loss": 6.1385,
|
||
|
|
"mean_token_accuracy": 0.12108586356043816,
|
||
|
|
"num_tokens": 2511182.0,
|
||
|
|
"step": 1415
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.260076665878296,
|
||
|
|
"epoch": 0.0730396317156598,
|
||
|
|
"grad_norm": 1.09375,
|
||
|
|
"learning_rate": 0.00047868629704004786,
|
||
|
|
"loss": 6.2165,
|
||
|
|
"mean_token_accuracy": 0.11969843655824661,
|
||
|
|
"num_tokens": 2519756.0,
|
||
|
|
"step": 1420
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.295289468765259,
|
||
|
|
"epoch": 0.07329681351747551,
|
||
|
|
"grad_norm": 1.078125,
|
||
|
|
"learning_rate": 0.00047818301439561965,
|
||
|
|
"loss": 6.2174,
|
||
|
|
"mean_token_accuracy": 0.12359980940818786,
|
||
|
|
"num_tokens": 2528925.0,
|
||
|
|
"step": 1425
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.314094161987304,
|
||
|
|
"epoch": 0.0735539953192912,
|
||
|
|
"grad_norm": 1.078125,
|
||
|
|
"learning_rate": 0.00047767416138621454,
|
||
|
|
"loss": 6.2839,
|
||
|
|
"mean_token_accuracy": 0.11689749956130982,
|
||
|
|
"num_tokens": 2538557.0,
|
||
|
|
"step": 1430
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.229358911514282,
|
||
|
|
"epoch": 0.07381117712110691,
|
||
|
|
"grad_norm": 1.1484375,
|
||
|
|
"learning_rate": 0.000477159751962295,
|
||
|
|
"loss": 6.1894,
|
||
|
|
"mean_token_accuracy": 0.12646755203604698,
|
||
|
|
"num_tokens": 2547190.0,
|
||
|
|
"step": 1435
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.241942453384399,
|
||
|
|
"epoch": 0.07406835892292261,
|
||
|
|
"grad_norm": 1.1015625,
|
||
|
|
"learning_rate": 0.00047663980022665507,
|
||
|
|
"loss": 6.2148,
|
||
|
|
"mean_token_accuracy": 0.12242325693368912,
|
||
|
|
"num_tokens": 2556168.0,
|
||
|
|
"step": 1440
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.306135368347168,
|
||
|
|
"epoch": 0.07432554072473832,
|
||
|
|
"grad_norm": 1.078125,
|
||
|
|
"learning_rate": 0.00047611432043403437,
|
||
|
|
"loss": 6.2626,
|
||
|
|
"mean_token_accuracy": 0.1197875827550888,
|
||
|
|
"num_tokens": 2565409.0,
|
||
|
|
"step": 1445
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.228486442565918,
|
||
|
|
"epoch": 0.07458272252655403,
|
||
|
|
"grad_norm": 1.1328125,
|
||
|
|
"learning_rate": 0.0004755833269907267,
|
||
|
|
"loss": 6.0994,
|
||
|
|
"mean_token_accuracy": 0.12629354000091553,
|
||
|
|
"num_tokens": 2574710.0,
|
||
|
|
"step": 1450
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.119667053222656,
|
||
|
|
"epoch": 0.07483990432836972,
|
||
|
|
"grad_norm": 1.09375,
|
||
|
|
"learning_rate": 0.0004750468344541857,
|
||
|
|
"loss": 6.0366,
|
||
|
|
"mean_token_accuracy": 0.13156967237591743,
|
||
|
|
"num_tokens": 2583210.0,
|
||
|
|
"step": 1455
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.1274964809417725,
|
||
|
|
"epoch": 0.07509708613018543,
|
||
|
|
"grad_norm": 1.078125,
|
||
|
|
"learning_rate": 0.00047450485753262525,
|
||
|
|
"loss": 6.0896,
|
||
|
|
"mean_token_accuracy": 0.13029113933444023,
|
||
|
|
"num_tokens": 2592143.0,
|
||
|
|
"step": 1460
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.23237795829773,
|
||
|
|
"epoch": 0.07535426793200113,
|
||
|
|
"grad_norm": 1.234375,
|
||
|
|
"learning_rate": 0.00047395741108461633,
|
||
|
|
"loss": 6.0884,
|
||
|
|
"mean_token_accuracy": 0.1269154392182827,
|
||
|
|
"num_tokens": 2601051.0,
|
||
|
|
"step": 1465
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.124324464797974,
|
||
|
|
"epoch": 0.07561144973381684,
|
||
|
|
"grad_norm": 1.25,
|
||
|
|
"learning_rate": 0.00047340451011867985,
|
||
|
|
"loss": 6.1757,
|
||
|
|
"mean_token_accuracy": 0.12620116993784905,
|
||
|
|
"num_tokens": 2609334.0,
|
||
|
|
"step": 1470
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.34974856376648,
|
||
|
|
"epoch": 0.07586863153563254,
|
||
|
|
"grad_norm": 1.0078125,
|
||
|
|
"learning_rate": 0.00047284616979287515,
|
||
|
|
"loss": 6.2833,
|
||
|
|
"mean_token_accuracy": 0.1270563654601574,
|
||
|
|
"num_tokens": 2618670.0,
|
||
|
|
"step": 1475
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.1445026874542235,
|
||
|
|
"epoch": 0.07612581333744824,
|
||
|
|
"grad_norm": 1.1015625,
|
||
|
|
"learning_rate": 0.00047228240541438433,
|
||
|
|
"loss": 6.1026,
|
||
|
|
"mean_token_accuracy": 0.12804780080914496,
|
||
|
|
"num_tokens": 2627829.0,
|
||
|
|
"step": 1480
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.234681034088135,
|
||
|
|
"epoch": 0.07638299513926394,
|
||
|
|
"grad_norm": 1.1171875,
|
||
|
|
"learning_rate": 0.00047171323243909257,
|
||
|
|
"loss": 6.0433,
|
||
|
|
"mean_token_accuracy": 0.132904352247715,
|
||
|
|
"num_tokens": 2636508.0,
|
||
|
|
"step": 1485
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.130121564865112,
|
||
|
|
"epoch": 0.07664017694107965,
|
||
|
|
"grad_norm": 1.078125,
|
||
|
|
"learning_rate": 0.00047113866647116457,
|
||
|
|
"loss": 6.1347,
|
||
|
|
"mean_token_accuracy": 0.12549900785088539,
|
||
|
|
"num_tokens": 2645713.0,
|
||
|
|
"step": 1490
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.149539947509766,
|
||
|
|
"epoch": 0.07689735874289536,
|
||
|
|
"grad_norm": 1.09375,
|
||
|
|
"learning_rate": 0.0004705587232626164,
|
||
|
|
"loss": 6.0803,
|
||
|
|
"mean_token_accuracy": 0.13423071429133415,
|
||
|
|
"num_tokens": 2654194.0,
|
||
|
|
"step": 1495
|
||
|
|
},
|
||
|
|
{
|
||
|
|
"entropy": 6.214192914962768,
|
||
|
|
"epoch": 0.07715454054471106,
|
||
|
|
"grad_norm": 1.1171875,
|
||
|
|
"learning_rate": 0.00046997341871288424,
|
||
|
|
"loss": 6.1258,
|
||
|
|
"mean_token_accuracy": 0.12882963046431542,
|
||
|
|
"num_tokens": 2662932.0,
|
||
|
|
"step": 1500
|
||
|
|
}
|
||
|
|
],
|
||
|
|
"logging_steps": 5,
|
||
|
|
"max_steps": 4000,
|
||
|
|
"num_input_tokens_seen": 0,
|
||
|
|
"num_train_epochs": 1,
|
||
|
|
"save_steps": 500,
|
||
|
|
"stateful_callbacks": {
|
||
|
|
"TrainerControl": {
|
||
|
|
"args": {
|
||
|
|
"should_epoch_stop": false,
|
||
|
|
"should_evaluate": false,
|
||
|
|
"should_log": false,
|
||
|
|
"should_save": true,
|
||
|
|
"should_training_stop": false
|
||
|
|
},
|
||
|
|
"attributes": {}
|
||
|
|
}
|
||
|
|
},
|
||
|
|
"total_flos": 3592406163456000.0,
|
||
|
|
"train_batch_size": 16,
|
||
|
|
"trial_name": null,
|
||
|
|
"trial_params": null
|
||
|
|
}
|