13842 lines
384 KiB
JSON
13842 lines
384 KiB
JSON
{
|
|
"best_global_step": null,
|
|
"best_metric": null,
|
|
"best_model_checkpoint": null,
|
|
"epoch": 2.9848535102266447,
|
|
"eval_steps": 500,
|
|
"global_step": 13500,
|
|
"is_hyper_param_search": false,
|
|
"is_local_process_zero": true,
|
|
"is_world_process_zero": true,
|
|
"log_history": [
|
|
{
|
|
"entropy": 2.0859375,
|
|
"epoch": 0.0002211166390270868,
|
|
"grad_norm": 13.491881370544434,
|
|
"learning_rate": 0.0,
|
|
"loss": 3.364,
|
|
"mean_token_accuracy": 0.42396533489227295,
|
|
"num_tokens": 3991.0,
|
|
"step": 1
|
|
},
|
|
{
|
|
"entropy": 2.1475694444444446,
|
|
"epoch": 0.002211166390270868,
|
|
"grad_norm": 15.421286582946777,
|
|
"learning_rate": 9e-08,
|
|
"loss": 3.4868,
|
|
"mean_token_accuracy": 0.4146432313654158,
|
|
"num_tokens": 35423.0,
|
|
"step": 10
|
|
},
|
|
{
|
|
"entropy": 2.103515625,
|
|
"epoch": 0.004422332780541736,
|
|
"grad_norm": 13.73885726928711,
|
|
"learning_rate": 1.9e-07,
|
|
"loss": 3.4521,
|
|
"mean_token_accuracy": 0.4223955884575844,
|
|
"num_tokens": 70035.0,
|
|
"step": 20
|
|
},
|
|
{
|
|
"entropy": 2.14140625,
|
|
"epoch": 0.006633499170812604,
|
|
"grad_norm": 11.23896312713623,
|
|
"learning_rate": 2.9000000000000003e-07,
|
|
"loss": 3.3955,
|
|
"mean_token_accuracy": 0.4187392756342888,
|
|
"num_tokens": 107394.0,
|
|
"step": 30
|
|
},
|
|
{
|
|
"entropy": 2.1359375,
|
|
"epoch": 0.008844665561083471,
|
|
"grad_norm": 10.99072265625,
|
|
"learning_rate": 3.9e-07,
|
|
"loss": 3.3239,
|
|
"mean_token_accuracy": 0.422987724840641,
|
|
"num_tokens": 146215.0,
|
|
"step": 40
|
|
},
|
|
{
|
|
"entropy": 2.14140625,
|
|
"epoch": 0.01105583195135434,
|
|
"grad_norm": 12.723716735839844,
|
|
"learning_rate": 4.900000000000001e-07,
|
|
"loss": 3.2944,
|
|
"mean_token_accuracy": 0.4271391898393631,
|
|
"num_tokens": 179461.0,
|
|
"step": 50
|
|
},
|
|
{
|
|
"entropy": 2.21953125,
|
|
"epoch": 0.013266998341625208,
|
|
"grad_norm": 9.92940616607666,
|
|
"learning_rate": 5.900000000000001e-07,
|
|
"loss": 3.1561,
|
|
"mean_token_accuracy": 0.42118664383888244,
|
|
"num_tokens": 214588.0,
|
|
"step": 60
|
|
},
|
|
{
|
|
"entropy": 2.21796875,
|
|
"epoch": 0.015478164731896076,
|
|
"grad_norm": 9.654187202453613,
|
|
"learning_rate": 6.900000000000001e-07,
|
|
"loss": 2.8464,
|
|
"mean_token_accuracy": 0.43979292213916776,
|
|
"num_tokens": 252797.0,
|
|
"step": 70
|
|
},
|
|
{
|
|
"entropy": 2.32265625,
|
|
"epoch": 0.017689331122166942,
|
|
"grad_norm": 6.960601329803467,
|
|
"learning_rate": 7.900000000000001e-07,
|
|
"loss": 2.7819,
|
|
"mean_token_accuracy": 0.44136977642774583,
|
|
"num_tokens": 289082.0,
|
|
"step": 80
|
|
},
|
|
{
|
|
"entropy": 2.38125,
|
|
"epoch": 0.01990049751243781,
|
|
"grad_norm": 6.603098392486572,
|
|
"learning_rate": 8.900000000000001e-07,
|
|
"loss": 2.6354,
|
|
"mean_token_accuracy": 0.4472609981894493,
|
|
"num_tokens": 324599.0,
|
|
"step": 90
|
|
},
|
|
{
|
|
"entropy": 2.38203125,
|
|
"epoch": 0.02211166390270868,
|
|
"grad_norm": 6.4688239097595215,
|
|
"learning_rate": 9.9e-07,
|
|
"loss": 2.4429,
|
|
"mean_token_accuracy": 0.4658281743526459,
|
|
"num_tokens": 360597.0,
|
|
"step": 100
|
|
},
|
|
{
|
|
"entropy": 2.3984375,
|
|
"epoch": 0.024322830292979547,
|
|
"grad_norm": 5.344963073730469,
|
|
"learning_rate": 1.0900000000000002e-06,
|
|
"loss": 2.4422,
|
|
"mean_token_accuracy": 0.4678023889660835,
|
|
"num_tokens": 395801.0,
|
|
"step": 110
|
|
},
|
|
{
|
|
"entropy": 2.33359375,
|
|
"epoch": 0.026533996683250415,
|
|
"grad_norm": 5.074892520904541,
|
|
"learning_rate": 1.19e-06,
|
|
"loss": 2.383,
|
|
"mean_token_accuracy": 0.47881196439266205,
|
|
"num_tokens": 432428.0,
|
|
"step": 120
|
|
},
|
|
{
|
|
"entropy": 2.3171875,
|
|
"epoch": 0.028745163073521283,
|
|
"grad_norm": 4.863015651702881,
|
|
"learning_rate": 1.2900000000000001e-06,
|
|
"loss": 2.3649,
|
|
"mean_token_accuracy": 0.4759433209896088,
|
|
"num_tokens": 469596.0,
|
|
"step": 130
|
|
},
|
|
{
|
|
"entropy": 2.321484375,
|
|
"epoch": 0.03095632946379215,
|
|
"grad_norm": 5.090569972991943,
|
|
"learning_rate": 1.3900000000000002e-06,
|
|
"loss": 2.3273,
|
|
"mean_token_accuracy": 0.48223552107810974,
|
|
"num_tokens": 504776.0,
|
|
"step": 140
|
|
},
|
|
{
|
|
"entropy": 2.28359375,
|
|
"epoch": 0.03316749585406302,
|
|
"grad_norm": 4.892899990081787,
|
|
"learning_rate": 1.4900000000000001e-06,
|
|
"loss": 2.2889,
|
|
"mean_token_accuracy": 0.4861461818218231,
|
|
"num_tokens": 542525.0,
|
|
"step": 150
|
|
},
|
|
{
|
|
"entropy": 2.30703125,
|
|
"epoch": 0.035378662244333885,
|
|
"grad_norm": 4.994112968444824,
|
|
"learning_rate": 1.5900000000000002e-06,
|
|
"loss": 2.2815,
|
|
"mean_token_accuracy": 0.4921098127961159,
|
|
"num_tokens": 578036.0,
|
|
"step": 160
|
|
},
|
|
{
|
|
"entropy": 2.340625,
|
|
"epoch": 0.037589828634604756,
|
|
"grad_norm": 4.949061393737793,
|
|
"learning_rate": 1.6900000000000003e-06,
|
|
"loss": 2.3154,
|
|
"mean_token_accuracy": 0.4910279303789139,
|
|
"num_tokens": 614171.0,
|
|
"step": 170
|
|
},
|
|
{
|
|
"entropy": 2.29296875,
|
|
"epoch": 0.03980099502487562,
|
|
"grad_norm": 4.922420501708984,
|
|
"learning_rate": 1.79e-06,
|
|
"loss": 2.2607,
|
|
"mean_token_accuracy": 0.4972550317645073,
|
|
"num_tokens": 649938.0,
|
|
"step": 180
|
|
},
|
|
{
|
|
"entropy": 2.28359375,
|
|
"epoch": 0.04201216141514649,
|
|
"grad_norm": 5.138777732849121,
|
|
"learning_rate": 1.8900000000000001e-06,
|
|
"loss": 2.2391,
|
|
"mean_token_accuracy": 0.4931071326136589,
|
|
"num_tokens": 686377.0,
|
|
"step": 190
|
|
},
|
|
{
|
|
"entropy": 2.28203125,
|
|
"epoch": 0.04422332780541736,
|
|
"grad_norm": 4.027737617492676,
|
|
"learning_rate": 1.9900000000000004e-06,
|
|
"loss": 2.2285,
|
|
"mean_token_accuracy": 0.5010080248117447,
|
|
"num_tokens": 724085.0,
|
|
"step": 200
|
|
},
|
|
{
|
|
"entropy": 2.16796875,
|
|
"epoch": 0.04643449419568822,
|
|
"grad_norm": 4.081982612609863,
|
|
"learning_rate": 2.09e-06,
|
|
"loss": 2.1872,
|
|
"mean_token_accuracy": 0.49938761740922927,
|
|
"num_tokens": 758852.0,
|
|
"step": 210
|
|
},
|
|
{
|
|
"entropy": 2.121484375,
|
|
"epoch": 0.048645660585959094,
|
|
"grad_norm": 3.8146069049835205,
|
|
"learning_rate": 2.19e-06,
|
|
"loss": 2.1273,
|
|
"mean_token_accuracy": 0.5086612522602081,
|
|
"num_tokens": 796249.0,
|
|
"step": 220
|
|
},
|
|
{
|
|
"entropy": 2.17734375,
|
|
"epoch": 0.05085682697622996,
|
|
"grad_norm": 3.8457095623016357,
|
|
"learning_rate": 2.29e-06,
|
|
"loss": 2.2071,
|
|
"mean_token_accuracy": 0.49974310100078584,
|
|
"num_tokens": 831917.0,
|
|
"step": 230
|
|
},
|
|
{
|
|
"entropy": 2.14375,
|
|
"epoch": 0.05306799336650083,
|
|
"grad_norm": 3.408496141433716,
|
|
"learning_rate": 2.39e-06,
|
|
"loss": 2.1607,
|
|
"mean_token_accuracy": 0.5061767563223839,
|
|
"num_tokens": 865571.0,
|
|
"step": 240
|
|
},
|
|
{
|
|
"entropy": 2.20078125,
|
|
"epoch": 0.055279159756771695,
|
|
"grad_norm": 3.8531494140625,
|
|
"learning_rate": 2.4900000000000003e-06,
|
|
"loss": 2.2087,
|
|
"mean_token_accuracy": 0.4973599374294281,
|
|
"num_tokens": 901225.0,
|
|
"step": 250
|
|
},
|
|
{
|
|
"entropy": 2.128515625,
|
|
"epoch": 0.05749032614704257,
|
|
"grad_norm": 3.7157583236694336,
|
|
"learning_rate": 2.59e-06,
|
|
"loss": 2.1356,
|
|
"mean_token_accuracy": 0.5112481728196144,
|
|
"num_tokens": 937815.0,
|
|
"step": 260
|
|
},
|
|
{
|
|
"entropy": 2.138671875,
|
|
"epoch": 0.05970149253731343,
|
|
"grad_norm": 3.6800172328948975,
|
|
"learning_rate": 2.6900000000000005e-06,
|
|
"loss": 2.1553,
|
|
"mean_token_accuracy": 0.5024145051836968,
|
|
"num_tokens": 974667.0,
|
|
"step": 270
|
|
},
|
|
{
|
|
"entropy": 2.18046875,
|
|
"epoch": 0.0619126589275843,
|
|
"grad_norm": 2.8408560752868652,
|
|
"learning_rate": 2.7900000000000004e-06,
|
|
"loss": 2.1953,
|
|
"mean_token_accuracy": 0.5002159148454666,
|
|
"num_tokens": 1014523.0,
|
|
"step": 280
|
|
},
|
|
{
|
|
"entropy": 2.105859375,
|
|
"epoch": 0.06412382531785517,
|
|
"grad_norm": 3.5996458530426025,
|
|
"learning_rate": 2.89e-06,
|
|
"loss": 2.134,
|
|
"mean_token_accuracy": 0.5081727758049965,
|
|
"num_tokens": 1048973.0,
|
|
"step": 290
|
|
},
|
|
{
|
|
"entropy": 2.14921875,
|
|
"epoch": 0.06633499170812604,
|
|
"grad_norm": 3.262476921081543,
|
|
"learning_rate": 2.99e-06,
|
|
"loss": 2.158,
|
|
"mean_token_accuracy": 0.5075192973017693,
|
|
"num_tokens": 1084258.0,
|
|
"step": 300
|
|
},
|
|
{
|
|
"entropy": 2.11015625,
|
|
"epoch": 0.0685461580983969,
|
|
"grad_norm": 4.357229709625244,
|
|
"learning_rate": 3.09e-06,
|
|
"loss": 2.1037,
|
|
"mean_token_accuracy": 0.5091981217265129,
|
|
"num_tokens": 1120381.0,
|
|
"step": 310
|
|
},
|
|
{
|
|
"entropy": 2.15859375,
|
|
"epoch": 0.07075732448866777,
|
|
"grad_norm": 4.424260139465332,
|
|
"learning_rate": 3.1900000000000004e-06,
|
|
"loss": 2.1651,
|
|
"mean_token_accuracy": 0.507042008638382,
|
|
"num_tokens": 1158282.0,
|
|
"step": 320
|
|
},
|
|
{
|
|
"entropy": 2.11796875,
|
|
"epoch": 0.07296849087893864,
|
|
"grad_norm": 4.158038139343262,
|
|
"learning_rate": 3.2900000000000003e-06,
|
|
"loss": 2.1306,
|
|
"mean_token_accuracy": 0.5126419425010681,
|
|
"num_tokens": 1193272.0,
|
|
"step": 330
|
|
},
|
|
{
|
|
"entropy": 2.105078125,
|
|
"epoch": 0.07517965726920951,
|
|
"grad_norm": 3.590698480606079,
|
|
"learning_rate": 3.3900000000000006e-06,
|
|
"loss": 2.1156,
|
|
"mean_token_accuracy": 0.5069046452641487,
|
|
"num_tokens": 1227236.0,
|
|
"step": 340
|
|
},
|
|
{
|
|
"entropy": 2.13828125,
|
|
"epoch": 0.07739082365948037,
|
|
"grad_norm": 3.479738473892212,
|
|
"learning_rate": 3.49e-06,
|
|
"loss": 2.155,
|
|
"mean_token_accuracy": 0.5023644655942917,
|
|
"num_tokens": 1266841.0,
|
|
"step": 350
|
|
},
|
|
{
|
|
"entropy": 2.123828125,
|
|
"epoch": 0.07960199004975124,
|
|
"grad_norm": 3.2290194034576416,
|
|
"learning_rate": 3.5900000000000004e-06,
|
|
"loss": 2.155,
|
|
"mean_token_accuracy": 0.5044166415929794,
|
|
"num_tokens": 1302141.0,
|
|
"step": 360
|
|
},
|
|
{
|
|
"entropy": 2.187109375,
|
|
"epoch": 0.08181315644002211,
|
|
"grad_norm": 3.9645466804504395,
|
|
"learning_rate": 3.6900000000000002e-06,
|
|
"loss": 2.2007,
|
|
"mean_token_accuracy": 0.5027717053890228,
|
|
"num_tokens": 1339324.0,
|
|
"step": 370
|
|
},
|
|
{
|
|
"entropy": 2.116796875,
|
|
"epoch": 0.08402432283029299,
|
|
"grad_norm": 3.3966081142425537,
|
|
"learning_rate": 3.79e-06,
|
|
"loss": 2.1439,
|
|
"mean_token_accuracy": 0.514509916305542,
|
|
"num_tokens": 1373308.0,
|
|
"step": 380
|
|
},
|
|
{
|
|
"entropy": 2.087890625,
|
|
"epoch": 0.08623548922056384,
|
|
"grad_norm": 3.7397348880767822,
|
|
"learning_rate": 3.89e-06,
|
|
"loss": 2.1182,
|
|
"mean_token_accuracy": 0.5127018868923188,
|
|
"num_tokens": 1413621.0,
|
|
"step": 390
|
|
},
|
|
{
|
|
"entropy": 2.084765625,
|
|
"epoch": 0.08844665561083472,
|
|
"grad_norm": 4.161512851715088,
|
|
"learning_rate": 3.990000000000001e-06,
|
|
"loss": 2.0916,
|
|
"mean_token_accuracy": 0.510770146548748,
|
|
"num_tokens": 1449093.0,
|
|
"step": 400
|
|
},
|
|
{
|
|
"entropy": 2.11953125,
|
|
"epoch": 0.09065782200110559,
|
|
"grad_norm": 4.093839645385742,
|
|
"learning_rate": 4.09e-06,
|
|
"loss": 2.1202,
|
|
"mean_token_accuracy": 0.5110749483108521,
|
|
"num_tokens": 1484013.0,
|
|
"step": 410
|
|
},
|
|
{
|
|
"entropy": 2.0671875,
|
|
"epoch": 0.09286898839137644,
|
|
"grad_norm": 2.7546298503875732,
|
|
"learning_rate": 4.1900000000000005e-06,
|
|
"loss": 2.0955,
|
|
"mean_token_accuracy": 0.5149266749620438,
|
|
"num_tokens": 1519801.0,
|
|
"step": 420
|
|
},
|
|
{
|
|
"entropy": 2.1546875,
|
|
"epoch": 0.09508015478164732,
|
|
"grad_norm": 3.5816216468811035,
|
|
"learning_rate": 4.2900000000000004e-06,
|
|
"loss": 2.132,
|
|
"mean_token_accuracy": 0.5095141559839249,
|
|
"num_tokens": 1557313.0,
|
|
"step": 430
|
|
},
|
|
{
|
|
"entropy": 2.08671875,
|
|
"epoch": 0.09729132117191819,
|
|
"grad_norm": 3.6089766025543213,
|
|
"learning_rate": 4.39e-06,
|
|
"loss": 2.0994,
|
|
"mean_token_accuracy": 0.5114065691828728,
|
|
"num_tokens": 1592544.0,
|
|
"step": 440
|
|
},
|
|
{
|
|
"entropy": 2.042578125,
|
|
"epoch": 0.09950248756218906,
|
|
"grad_norm": 4.00061559677124,
|
|
"learning_rate": 4.49e-06,
|
|
"loss": 2.0928,
|
|
"mean_token_accuracy": 0.5145848706364632,
|
|
"num_tokens": 1630046.0,
|
|
"step": 450
|
|
},
|
|
{
|
|
"entropy": 2.111328125,
|
|
"epoch": 0.10171365395245992,
|
|
"grad_norm": 3.1204726696014404,
|
|
"learning_rate": 4.590000000000001e-06,
|
|
"loss": 2.1092,
|
|
"mean_token_accuracy": 0.5067434504628181,
|
|
"num_tokens": 1664597.0,
|
|
"step": 460
|
|
},
|
|
{
|
|
"entropy": 2.0828125,
|
|
"epoch": 0.10392482034273079,
|
|
"grad_norm": 3.627305269241333,
|
|
"learning_rate": 4.69e-06,
|
|
"loss": 2.0478,
|
|
"mean_token_accuracy": 0.5200336396694183,
|
|
"num_tokens": 1698996.0,
|
|
"step": 470
|
|
},
|
|
{
|
|
"entropy": 2.013671875,
|
|
"epoch": 0.10613598673300166,
|
|
"grad_norm": 3.278118848800659,
|
|
"learning_rate": 4.79e-06,
|
|
"loss": 2.0681,
|
|
"mean_token_accuracy": 0.5208383575081825,
|
|
"num_tokens": 1733652.0,
|
|
"step": 480
|
|
},
|
|
{
|
|
"entropy": 2.100390625,
|
|
"epoch": 0.10834715312327253,
|
|
"grad_norm": 3.5335357189178467,
|
|
"learning_rate": 4.890000000000001e-06,
|
|
"loss": 2.1416,
|
|
"mean_token_accuracy": 0.5040016114711762,
|
|
"num_tokens": 1769058.0,
|
|
"step": 490
|
|
},
|
|
{
|
|
"entropy": 2.15078125,
|
|
"epoch": 0.11055831951354339,
|
|
"grad_norm": 3.244101047515869,
|
|
"learning_rate": 4.9900000000000005e-06,
|
|
"loss": 2.1144,
|
|
"mean_token_accuracy": 0.515406896173954,
|
|
"num_tokens": 1804126.0,
|
|
"step": 500
|
|
},
|
|
{
|
|
"epoch": 0.11055831951354339,
|
|
"eval_entropy": 2.1323305348258708,
|
|
"eval_loss": 2.1050989627838135,
|
|
"eval_mean_token_accuracy": 0.5125636699187814,
|
|
"eval_num_tokens": 1804126.0,
|
|
"eval_runtime": 112.0154,
|
|
"eval_samples_per_second": 143.552,
|
|
"eval_steps_per_second": 8.972,
|
|
"step": 500
|
|
},
|
|
{
|
|
"entropy": 2.086328125,
|
|
"epoch": 0.11276948590381426,
|
|
"grad_norm": 3.1509811878204346,
|
|
"learning_rate": 4.9999941492722206e-06,
|
|
"loss": 2.0918,
|
|
"mean_token_accuracy": 0.5177638530731201,
|
|
"num_tokens": 1841492.0,
|
|
"step": 510
|
|
},
|
|
{
|
|
"entropy": 2.05625,
|
|
"epoch": 0.11498065229408513,
|
|
"grad_norm": 2.7028956413269043,
|
|
"learning_rate": 4.9999739245693716e-06,
|
|
"loss": 2.0952,
|
|
"mean_token_accuracy": 0.5098208919167518,
|
|
"num_tokens": 1879410.0,
|
|
"step": 520
|
|
},
|
|
{
|
|
"entropy": 2.1265625,
|
|
"epoch": 0.11719181868435599,
|
|
"grad_norm": 3.4666130542755127,
|
|
"learning_rate": 4.999939253777089e-06,
|
|
"loss": 2.1109,
|
|
"mean_token_accuracy": 0.5116298273205757,
|
|
"num_tokens": 1914529.0,
|
|
"step": 530
|
|
},
|
|
{
|
|
"entropy": 2.044921875,
|
|
"epoch": 0.11940298507462686,
|
|
"grad_norm": 3.2309253215789795,
|
|
"learning_rate": 4.999890137095717e-06,
|
|
"loss": 2.0612,
|
|
"mean_token_accuracy": 0.5192536026239395,
|
|
"num_tokens": 1950364.0,
|
|
"step": 540
|
|
},
|
|
{
|
|
"entropy": 2.062890625,
|
|
"epoch": 0.12161415146489774,
|
|
"grad_norm": 3.670274496078491,
|
|
"learning_rate": 4.999826574809076e-06,
|
|
"loss": 2.0973,
|
|
"mean_token_accuracy": 0.5143837660551072,
|
|
"num_tokens": 1985936.0,
|
|
"step": 550
|
|
},
|
|
{
|
|
"entropy": 2.1140625,
|
|
"epoch": 0.1238253178551686,
|
|
"grad_norm": 3.7882168292999268,
|
|
"learning_rate": 4.99974856728446e-06,
|
|
"loss": 2.1332,
|
|
"mean_token_accuracy": 0.5078542321920395,
|
|
"num_tokens": 2019487.0,
|
|
"step": 560
|
|
},
|
|
{
|
|
"entropy": 2.078515625,
|
|
"epoch": 0.12603648424543948,
|
|
"grad_norm": 3.7122929096221924,
|
|
"learning_rate": 4.999656114972636e-06,
|
|
"loss": 2.1039,
|
|
"mean_token_accuracy": 0.5080955445766449,
|
|
"num_tokens": 2054357.0,
|
|
"step": 570
|
|
},
|
|
{
|
|
"entropy": 2.071875,
|
|
"epoch": 0.12824765063571034,
|
|
"grad_norm": 2.4576525688171387,
|
|
"learning_rate": 4.9995492184078385e-06,
|
|
"loss": 2.0919,
|
|
"mean_token_accuracy": 0.5124289333820343,
|
|
"num_tokens": 2089121.0,
|
|
"step": 580
|
|
},
|
|
{
|
|
"entropy": 2.030078125,
|
|
"epoch": 0.1304588170259812,
|
|
"grad_norm": 3.3369228839874268,
|
|
"learning_rate": 4.99942787820777e-06,
|
|
"loss": 2.0626,
|
|
"mean_token_accuracy": 0.5206080719828605,
|
|
"num_tokens": 2124911.0,
|
|
"step": 590
|
|
},
|
|
{
|
|
"entropy": 2.1,
|
|
"epoch": 0.13266998341625208,
|
|
"grad_norm": 3.4969582557678223,
|
|
"learning_rate": 4.999292095073593e-06,
|
|
"loss": 2.1047,
|
|
"mean_token_accuracy": 0.5153959050774575,
|
|
"num_tokens": 2161423.0,
|
|
"step": 600
|
|
},
|
|
{
|
|
"entropy": 2.105859375,
|
|
"epoch": 0.13488114980652294,
|
|
"grad_norm": 3.1263840198516846,
|
|
"learning_rate": 4.999141869789932e-06,
|
|
"loss": 2.0978,
|
|
"mean_token_accuracy": 0.5143096804618835,
|
|
"num_tokens": 2196883.0,
|
|
"step": 610
|
|
},
|
|
{
|
|
"entropy": 2.069140625,
|
|
"epoch": 0.1370923161967938,
|
|
"grad_norm": 3.248612642288208,
|
|
"learning_rate": 4.9989772032248605e-06,
|
|
"loss": 2.0664,
|
|
"mean_token_accuracy": 0.518137164413929,
|
|
"num_tokens": 2234713.0,
|
|
"step": 620
|
|
},
|
|
{
|
|
"entropy": 2.098828125,
|
|
"epoch": 0.13930348258706468,
|
|
"grad_norm": 3.164656162261963,
|
|
"learning_rate": 4.998798096329905e-06,
|
|
"loss": 2.1027,
|
|
"mean_token_accuracy": 0.5106432005763054,
|
|
"num_tokens": 2269869.0,
|
|
"step": 630
|
|
},
|
|
{
|
|
"entropy": 2.054296875,
|
|
"epoch": 0.14151464897733554,
|
|
"grad_norm": 3.4724669456481934,
|
|
"learning_rate": 4.998604550140034e-06,
|
|
"loss": 2.0666,
|
|
"mean_token_accuracy": 0.519081138074398,
|
|
"num_tokens": 2305154.0,
|
|
"step": 640
|
|
},
|
|
{
|
|
"entropy": 2.100390625,
|
|
"epoch": 0.14372581536760642,
|
|
"grad_norm": 2.1056556701660156,
|
|
"learning_rate": 4.998396565773653e-06,
|
|
"loss": 2.1098,
|
|
"mean_token_accuracy": 0.511474198102951,
|
|
"num_tokens": 2342409.0,
|
|
"step": 650
|
|
},
|
|
{
|
|
"entropy": 2.074609375,
|
|
"epoch": 0.14593698175787728,
|
|
"grad_norm": 3.526925563812256,
|
|
"learning_rate": 4.998174144432599e-06,
|
|
"loss": 2.0813,
|
|
"mean_token_accuracy": 0.5129822865128517,
|
|
"num_tokens": 2377939.0,
|
|
"step": 660
|
|
},
|
|
{
|
|
"entropy": 2.047265625,
|
|
"epoch": 0.14814814814814814,
|
|
"grad_norm": 3.6618149280548096,
|
|
"learning_rate": 4.9979372874021334e-06,
|
|
"loss": 2.0617,
|
|
"mean_token_accuracy": 0.512530866265297,
|
|
"num_tokens": 2412344.0,
|
|
"step": 670
|
|
},
|
|
{
|
|
"entropy": 2.084375,
|
|
"epoch": 0.15035931453841903,
|
|
"grad_norm": 3.130889892578125,
|
|
"learning_rate": 4.997685996050933e-06,
|
|
"loss": 2.0848,
|
|
"mean_token_accuracy": 0.5145954489707947,
|
|
"num_tokens": 2446755.0,
|
|
"step": 680
|
|
},
|
|
{
|
|
"entropy": 2.0640625,
|
|
"epoch": 0.15257048092868988,
|
|
"grad_norm": 3.012781858444214,
|
|
"learning_rate": 4.9974202718310835e-06,
|
|
"loss": 2.0358,
|
|
"mean_token_accuracy": 0.5226449191570282,
|
|
"num_tokens": 2487104.0,
|
|
"step": 690
|
|
},
|
|
{
|
|
"entropy": 2.1140625,
|
|
"epoch": 0.15478164731896074,
|
|
"grad_norm": 3.1782774925231934,
|
|
"learning_rate": 4.997140116278072e-06,
|
|
"loss": 2.0994,
|
|
"mean_token_accuracy": 0.5159388601779937,
|
|
"num_tokens": 2522787.0,
|
|
"step": 700
|
|
},
|
|
{
|
|
"entropy": 2.05546875,
|
|
"epoch": 0.15699281370923163,
|
|
"grad_norm": 3.2635788917541504,
|
|
"learning_rate": 4.996845531010776e-06,
|
|
"loss": 2.0946,
|
|
"mean_token_accuracy": 0.5172607436776161,
|
|
"num_tokens": 2559917.0,
|
|
"step": 710
|
|
},
|
|
{
|
|
"entropy": 2.1078125,
|
|
"epoch": 0.15920398009950248,
|
|
"grad_norm": 2.3570048809051514,
|
|
"learning_rate": 4.996536517731456e-06,
|
|
"loss": 2.1824,
|
|
"mean_token_accuracy": 0.5059584200382232,
|
|
"num_tokens": 2598082.0,
|
|
"step": 720
|
|
},
|
|
{
|
|
"entropy": 2.09453125,
|
|
"epoch": 0.16141514648977334,
|
|
"grad_norm": 3.011674165725708,
|
|
"learning_rate": 4.996213078225743e-06,
|
|
"loss": 2.1104,
|
|
"mean_token_accuracy": 0.5101976647973061,
|
|
"num_tokens": 2634330.0,
|
|
"step": 730
|
|
},
|
|
{
|
|
"entropy": 2.104296875,
|
|
"epoch": 0.16362631288004423,
|
|
"grad_norm": 3.1082472801208496,
|
|
"learning_rate": 4.99587521436263e-06,
|
|
"loss": 2.1152,
|
|
"mean_token_accuracy": 0.5096311271190643,
|
|
"num_tokens": 2671436.0,
|
|
"step": 740
|
|
},
|
|
{
|
|
"entropy": 2.02890625,
|
|
"epoch": 0.16583747927031509,
|
|
"grad_norm": 3.394878625869751,
|
|
"learning_rate": 4.995522928094464e-06,
|
|
"loss": 2.0491,
|
|
"mean_token_accuracy": 0.5202280208468437,
|
|
"num_tokens": 2705362.0,
|
|
"step": 750
|
|
},
|
|
{
|
|
"entropy": 2.08046875,
|
|
"epoch": 0.16804864566058597,
|
|
"grad_norm": 3.5359127521514893,
|
|
"learning_rate": 4.99515622145693e-06,
|
|
"loss": 2.1182,
|
|
"mean_token_accuracy": 0.5109568238258362,
|
|
"num_tokens": 2742358.0,
|
|
"step": 760
|
|
},
|
|
{
|
|
"entropy": 2.052734375,
|
|
"epoch": 0.17025981205085683,
|
|
"grad_norm": 3.516289710998535,
|
|
"learning_rate": 4.994775096569038e-06,
|
|
"loss": 2.0446,
|
|
"mean_token_accuracy": 0.5238539129495621,
|
|
"num_tokens": 2777961.0,
|
|
"step": 770
|
|
},
|
|
{
|
|
"entropy": 2.10625,
|
|
"epoch": 0.1724709784411277,
|
|
"grad_norm": 3.0492849349975586,
|
|
"learning_rate": 4.9943795556331195e-06,
|
|
"loss": 2.1082,
|
|
"mean_token_accuracy": 0.5114821001887322,
|
|
"num_tokens": 2816127.0,
|
|
"step": 780
|
|
},
|
|
{
|
|
"entropy": 2.1,
|
|
"epoch": 0.17468214483139857,
|
|
"grad_norm": 3.256518840789795,
|
|
"learning_rate": 4.993969600934805e-06,
|
|
"loss": 2.0871,
|
|
"mean_token_accuracy": 0.5167936980724335,
|
|
"num_tokens": 2852821.0,
|
|
"step": 790
|
|
},
|
|
{
|
|
"entropy": 2.0453125,
|
|
"epoch": 0.17689331122166943,
|
|
"grad_norm": 3.638335704803467,
|
|
"learning_rate": 4.993545234843016e-06,
|
|
"loss": 2.0887,
|
|
"mean_token_accuracy": 0.5134402886033058,
|
|
"num_tokens": 2886733.0,
|
|
"step": 800
|
|
},
|
|
{
|
|
"entropy": 2.048046875,
|
|
"epoch": 0.1791044776119403,
|
|
"grad_norm": 3.737710475921631,
|
|
"learning_rate": 4.993106459809952e-06,
|
|
"loss": 2.0394,
|
|
"mean_token_accuracy": 0.520734640955925,
|
|
"num_tokens": 2921471.0,
|
|
"step": 810
|
|
},
|
|
{
|
|
"entropy": 2.093359375,
|
|
"epoch": 0.18131564400221117,
|
|
"grad_norm": 3.340587854385376,
|
|
"learning_rate": 4.9926532783710705e-06,
|
|
"loss": 2.0687,
|
|
"mean_token_accuracy": 0.5202266246080398,
|
|
"num_tokens": 2957636.0,
|
|
"step": 820
|
|
},
|
|
{
|
|
"entropy": 2.10078125,
|
|
"epoch": 0.18352681039248203,
|
|
"grad_norm": 3.947770595550537,
|
|
"learning_rate": 4.99218569314508e-06,
|
|
"loss": 2.1402,
|
|
"mean_token_accuracy": 0.5113625213503837,
|
|
"num_tokens": 2993908.0,
|
|
"step": 830
|
|
},
|
|
{
|
|
"entropy": 2.094140625,
|
|
"epoch": 0.1857379767827529,
|
|
"grad_norm": 3.3025078773498535,
|
|
"learning_rate": 4.991703706833919e-06,
|
|
"loss": 2.0904,
|
|
"mean_token_accuracy": 0.5102549090981483,
|
|
"num_tokens": 3028882.0,
|
|
"step": 840
|
|
},
|
|
{
|
|
"entropy": 2.085546875,
|
|
"epoch": 0.18794914317302377,
|
|
"grad_norm": 2.902519464492798,
|
|
"learning_rate": 4.991207322222743e-06,
|
|
"loss": 2.113,
|
|
"mean_token_accuracy": 0.509818272292614,
|
|
"num_tokens": 3065276.0,
|
|
"step": 850
|
|
},
|
|
{
|
|
"entropy": 2.05625,
|
|
"epoch": 0.19016030956329463,
|
|
"grad_norm": 3.3408896923065186,
|
|
"learning_rate": 4.990696542179911e-06,
|
|
"loss": 2.0813,
|
|
"mean_token_accuracy": 0.5192014425992966,
|
|
"num_tokens": 3102022.0,
|
|
"step": 860
|
|
},
|
|
{
|
|
"entropy": 2.0578125,
|
|
"epoch": 0.19237147595356552,
|
|
"grad_norm": 2.8319661617279053,
|
|
"learning_rate": 4.990171369656962e-06,
|
|
"loss": 2.0742,
|
|
"mean_token_accuracy": 0.5178813964128495,
|
|
"num_tokens": 3137476.0,
|
|
"step": 870
|
|
},
|
|
{
|
|
"entropy": 2.034765625,
|
|
"epoch": 0.19458264234383638,
|
|
"grad_norm": 3.714707374572754,
|
|
"learning_rate": 4.9896318076886026e-06,
|
|
"loss": 2.036,
|
|
"mean_token_accuracy": 0.51841921210289,
|
|
"num_tokens": 3173205.0,
|
|
"step": 880
|
|
},
|
|
{
|
|
"entropy": 2.032421875,
|
|
"epoch": 0.19679380873410723,
|
|
"grad_norm": 2.956759214401245,
|
|
"learning_rate": 4.98907785939269e-06,
|
|
"loss": 2.0408,
|
|
"mean_token_accuracy": 0.5258077561855317,
|
|
"num_tokens": 3212741.0,
|
|
"step": 890
|
|
},
|
|
{
|
|
"entropy": 2.065234375,
|
|
"epoch": 0.19900497512437812,
|
|
"grad_norm": 3.065991163253784,
|
|
"learning_rate": 4.988509527970213e-06,
|
|
"loss": 2.0589,
|
|
"mean_token_accuracy": 0.5204547926783561,
|
|
"num_tokens": 3247053.0,
|
|
"step": 900
|
|
},
|
|
{
|
|
"entropy": 2.05,
|
|
"epoch": 0.20121614151464898,
|
|
"grad_norm": 3.4980456829071045,
|
|
"learning_rate": 4.987926816705272e-06,
|
|
"loss": 2.0629,
|
|
"mean_token_accuracy": 0.518908366560936,
|
|
"num_tokens": 3281829.0,
|
|
"step": 910
|
|
},
|
|
{
|
|
"entropy": 2.001953125,
|
|
"epoch": 0.20342730790491984,
|
|
"grad_norm": 2.832669496536255,
|
|
"learning_rate": 4.987329728965061e-06,
|
|
"loss": 2.034,
|
|
"mean_token_accuracy": 0.5249859780073166,
|
|
"num_tokens": 3318448.0,
|
|
"step": 920
|
|
},
|
|
{
|
|
"entropy": 2.055859375,
|
|
"epoch": 0.20563847429519072,
|
|
"grad_norm": 3.2094218730926514,
|
|
"learning_rate": 4.98671826819985e-06,
|
|
"loss": 2.0547,
|
|
"mean_token_accuracy": 0.5203769773244857,
|
|
"num_tokens": 3355448.0,
|
|
"step": 930
|
|
},
|
|
{
|
|
"entropy": 2.0609375,
|
|
"epoch": 0.20784964068546158,
|
|
"grad_norm": 3.0192489624023438,
|
|
"learning_rate": 4.986092437942962e-06,
|
|
"loss": 2.0751,
|
|
"mean_token_accuracy": 0.5177171722054481,
|
|
"num_tokens": 3393311.0,
|
|
"step": 940
|
|
},
|
|
{
|
|
"entropy": 2.05859375,
|
|
"epoch": 0.21006080707573244,
|
|
"grad_norm": 2.692469358444214,
|
|
"learning_rate": 4.985452241810755e-06,
|
|
"loss": 2.0637,
|
|
"mean_token_accuracy": 0.5169694602489472,
|
|
"num_tokens": 3431150.0,
|
|
"step": 950
|
|
},
|
|
{
|
|
"entropy": 2.048046875,
|
|
"epoch": 0.21227197346600332,
|
|
"grad_norm": 2.79972767829895,
|
|
"learning_rate": 4.984797683502602e-06,
|
|
"loss": 2.0489,
|
|
"mean_token_accuracy": 0.5185723170638085,
|
|
"num_tokens": 3467047.0,
|
|
"step": 960
|
|
},
|
|
{
|
|
"entropy": 2.042578125,
|
|
"epoch": 0.21448313985627418,
|
|
"grad_norm": 3.4971227645874023,
|
|
"learning_rate": 4.984128766800861e-06,
|
|
"loss": 2.0587,
|
|
"mean_token_accuracy": 0.5191132619976997,
|
|
"num_tokens": 3501749.0,
|
|
"step": 970
|
|
},
|
|
{
|
|
"entropy": 2.0703125,
|
|
"epoch": 0.21669430624654507,
|
|
"grad_norm": 3.202972888946533,
|
|
"learning_rate": 4.983445495570868e-06,
|
|
"loss": 2.0677,
|
|
"mean_token_accuracy": 0.5176109686493874,
|
|
"num_tokens": 3537837.0,
|
|
"step": 980
|
|
},
|
|
{
|
|
"entropy": 2.00703125,
|
|
"epoch": 0.21890547263681592,
|
|
"grad_norm": 2.777912139892578,
|
|
"learning_rate": 4.982747873760902e-06,
|
|
"loss": 2.0259,
|
|
"mean_token_accuracy": 0.5225431248545647,
|
|
"num_tokens": 3573738.0,
|
|
"step": 990
|
|
},
|
|
{
|
|
"entropy": 2.047265625,
|
|
"epoch": 0.22111663902708678,
|
|
"grad_norm": 2.596719264984131,
|
|
"learning_rate": 4.982035905402167e-06,
|
|
"loss": 2.083,
|
|
"mean_token_accuracy": 0.5185031279921531,
|
|
"num_tokens": 3610126.0,
|
|
"step": 1000
|
|
},
|
|
{
|
|
"epoch": 0.22111663902708678,
|
|
"eval_entropy": 2.076710199004975,
|
|
"eval_loss": 2.0526020526885986,
|
|
"eval_mean_token_accuracy": 0.520084024661809,
|
|
"eval_num_tokens": 3610126.0,
|
|
"eval_runtime": 111.8048,
|
|
"eval_samples_per_second": 143.822,
|
|
"eval_steps_per_second": 8.989,
|
|
"step": 1000
|
|
},
|
|
{
|
|
"entropy": 2.114453125,
|
|
"epoch": 0.22332780541735767,
|
|
"grad_norm": 3.875258684158325,
|
|
"learning_rate": 4.981309594608771e-06,
|
|
"loss": 2.0871,
|
|
"mean_token_accuracy": 0.5167941331863404,
|
|
"num_tokens": 3643167.0,
|
|
"step": 1010
|
|
},
|
|
{
|
|
"entropy": 2.0484375,
|
|
"epoch": 0.22553897180762852,
|
|
"grad_norm": 3.5693397521972656,
|
|
"learning_rate": 4.980568945577697e-06,
|
|
"loss": 2.0479,
|
|
"mean_token_accuracy": 0.5224012836813927,
|
|
"num_tokens": 3679207.0,
|
|
"step": 1020
|
|
},
|
|
{
|
|
"entropy": 2.03203125,
|
|
"epoch": 0.22775013819789938,
|
|
"grad_norm": 3.2723288536071777,
|
|
"learning_rate": 4.979813962588784e-06,
|
|
"loss": 2.0538,
|
|
"mean_token_accuracy": 0.5196092277765274,
|
|
"num_tokens": 3713829.0,
|
|
"step": 1030
|
|
},
|
|
{
|
|
"entropy": 2.08203125,
|
|
"epoch": 0.22996130458817027,
|
|
"grad_norm": 3.1510467529296875,
|
|
"learning_rate": 4.979044650004696e-06,
|
|
"loss": 2.0934,
|
|
"mean_token_accuracy": 0.5114318132400513,
|
|
"num_tokens": 3750202.0,
|
|
"step": 1040
|
|
},
|
|
{
|
|
"entropy": 2.049609375,
|
|
"epoch": 0.23217247097844113,
|
|
"grad_norm": 3.2102668285369873,
|
|
"learning_rate": 4.978261012270904e-06,
|
|
"loss": 2.058,
|
|
"mean_token_accuracy": 0.5233743146061898,
|
|
"num_tokens": 3784512.0,
|
|
"step": 1050
|
|
},
|
|
{
|
|
"entropy": 2.087890625,
|
|
"epoch": 0.23438363736871198,
|
|
"grad_norm": 3.133835554122925,
|
|
"learning_rate": 4.977463053915655e-06,
|
|
"loss": 2.0815,
|
|
"mean_token_accuracy": 0.5125426039099693,
|
|
"num_tokens": 3822905.0,
|
|
"step": 1060
|
|
},
|
|
{
|
|
"entropy": 2.06171875,
|
|
"epoch": 0.23659480375898287,
|
|
"grad_norm": 3.03928279876709,
|
|
"learning_rate": 4.976650779549949e-06,
|
|
"loss": 2.055,
|
|
"mean_token_accuracy": 0.5166697531938553,
|
|
"num_tokens": 3860464.0,
|
|
"step": 1070
|
|
},
|
|
{
|
|
"entropy": 1.99140625,
|
|
"epoch": 0.23880597014925373,
|
|
"grad_norm": 2.9765543937683105,
|
|
"learning_rate": 4.97582419386751e-06,
|
|
"loss": 2.0203,
|
|
"mean_token_accuracy": 0.5222927004098892,
|
|
"num_tokens": 3894344.0,
|
|
"step": 1080
|
|
},
|
|
{
|
|
"entropy": 2.066796875,
|
|
"epoch": 0.2410171365395246,
|
|
"grad_norm": 3.5072827339172363,
|
|
"learning_rate": 4.97498330164476e-06,
|
|
"loss": 2.0972,
|
|
"mean_token_accuracy": 0.5140745937824249,
|
|
"num_tokens": 3930143.0,
|
|
"step": 1090
|
|
},
|
|
{
|
|
"entropy": 2.065234375,
|
|
"epoch": 0.24322830292979547,
|
|
"grad_norm": 3.496581792831421,
|
|
"learning_rate": 4.9741281077407895e-06,
|
|
"loss": 2.0693,
|
|
"mean_token_accuracy": 0.5172520309686661,
|
|
"num_tokens": 3964008.0,
|
|
"step": 1100
|
|
},
|
|
{
|
|
"entropy": 2.08515625,
|
|
"epoch": 0.24543946932006633,
|
|
"grad_norm": 3.3615691661834717,
|
|
"learning_rate": 4.973258617097336e-06,
|
|
"loss": 2.0912,
|
|
"mean_token_accuracy": 0.5135252505540848,
|
|
"num_tokens": 3998895.0,
|
|
"step": 1110
|
|
},
|
|
{
|
|
"entropy": 2.042578125,
|
|
"epoch": 0.2476506357103372,
|
|
"grad_norm": 4.020509243011475,
|
|
"learning_rate": 4.9723748347387466e-06,
|
|
"loss": 2.0231,
|
|
"mean_token_accuracy": 0.5249299377202987,
|
|
"num_tokens": 4034995.0,
|
|
"step": 1120
|
|
},
|
|
{
|
|
"entropy": 2.024609375,
|
|
"epoch": 0.24986180210060807,
|
|
"grad_norm": 3.453850746154785,
|
|
"learning_rate": 4.9714767657719546e-06,
|
|
"loss": 2.0477,
|
|
"mean_token_accuracy": 0.5195066630840302,
|
|
"num_tokens": 4070784.0,
|
|
"step": 1130
|
|
},
|
|
{
|
|
"entropy": 2.019921875,
|
|
"epoch": 0.25207296849087896,
|
|
"grad_norm": 2.781249761581421,
|
|
"learning_rate": 4.970564415386447e-06,
|
|
"loss": 2.0072,
|
|
"mean_token_accuracy": 0.5254052251577377,
|
|
"num_tokens": 4106077.0,
|
|
"step": 1140
|
|
},
|
|
{
|
|
"entropy": 2.09921875,
|
|
"epoch": 0.2542841348811498,
|
|
"grad_norm": 3.1547138690948486,
|
|
"learning_rate": 4.969637788854237e-06,
|
|
"loss": 2.0874,
|
|
"mean_token_accuracy": 0.5099081441760063,
|
|
"num_tokens": 4142406.0,
|
|
"step": 1150
|
|
},
|
|
{
|
|
"entropy": 2.055859375,
|
|
"epoch": 0.2564953012714207,
|
|
"grad_norm": 3.136136531829834,
|
|
"learning_rate": 4.968696891529833e-06,
|
|
"loss": 2.0482,
|
|
"mean_token_accuracy": 0.5239317551255226,
|
|
"num_tokens": 4177363.0,
|
|
"step": 1160
|
|
},
|
|
{
|
|
"entropy": 2.024609375,
|
|
"epoch": 0.25870646766169153,
|
|
"grad_norm": 3.2736003398895264,
|
|
"learning_rate": 4.967741728850206e-06,
|
|
"loss": 2.0359,
|
|
"mean_token_accuracy": 0.5175553143024445,
|
|
"num_tokens": 4213599.0,
|
|
"step": 1170
|
|
},
|
|
{
|
|
"entropy": 2.0078125,
|
|
"epoch": 0.2609176340519624,
|
|
"grad_norm": 3.7074875831604004,
|
|
"learning_rate": 4.966772306334761e-06,
|
|
"loss": 2.0224,
|
|
"mean_token_accuracy": 0.5266255125403404,
|
|
"num_tokens": 4252752.0,
|
|
"step": 1180
|
|
},
|
|
{
|
|
"entropy": 2.045703125,
|
|
"epoch": 0.2631288004422333,
|
|
"grad_norm": 3.133660078048706,
|
|
"learning_rate": 4.9657886295853e-06,
|
|
"loss": 2.0331,
|
|
"mean_token_accuracy": 0.5198695093393326,
|
|
"num_tokens": 4289454.0,
|
|
"step": 1190
|
|
},
|
|
{
|
|
"entropy": 2.070703125,
|
|
"epoch": 0.26533996683250416,
|
|
"grad_norm": 2.8777458667755127,
|
|
"learning_rate": 4.964790704285996e-06,
|
|
"loss": 2.0692,
|
|
"mean_token_accuracy": 0.5144023418426513,
|
|
"num_tokens": 4325442.0,
|
|
"step": 1200
|
|
},
|
|
{
|
|
"entropy": 2.055078125,
|
|
"epoch": 0.267551133222775,
|
|
"grad_norm": 3.7900989055633545,
|
|
"learning_rate": 4.963778536203357e-06,
|
|
"loss": 2.0761,
|
|
"mean_token_accuracy": 0.5142589136958122,
|
|
"num_tokens": 4361168.0,
|
|
"step": 1210
|
|
},
|
|
{
|
|
"entropy": 2.0734375,
|
|
"epoch": 0.2697622996130459,
|
|
"grad_norm": 3.1633262634277344,
|
|
"learning_rate": 4.9627521311861925e-06,
|
|
"loss": 2.0677,
|
|
"mean_token_accuracy": 0.5143312171101571,
|
|
"num_tokens": 4395758.0,
|
|
"step": 1220
|
|
},
|
|
{
|
|
"entropy": 2.092578125,
|
|
"epoch": 0.27197346600331673,
|
|
"grad_norm": 3.301394462585449,
|
|
"learning_rate": 4.961711495165579e-06,
|
|
"loss": 2.1126,
|
|
"mean_token_accuracy": 0.5116095244884491,
|
|
"num_tokens": 4429271.0,
|
|
"step": 1230
|
|
},
|
|
{
|
|
"entropy": 1.989453125,
|
|
"epoch": 0.2741846323935876,
|
|
"grad_norm": 3.0996313095092773,
|
|
"learning_rate": 4.960656634154828e-06,
|
|
"loss": 1.9959,
|
|
"mean_token_accuracy": 0.5351725295186043,
|
|
"num_tokens": 4466603.0,
|
|
"step": 1240
|
|
},
|
|
{
|
|
"entropy": 2.025,
|
|
"epoch": 0.2763957987838585,
|
|
"grad_norm": 3.8732588291168213,
|
|
"learning_rate": 4.95958755424945e-06,
|
|
"loss": 2.0488,
|
|
"mean_token_accuracy": 0.5226330637931824,
|
|
"num_tokens": 4503326.0,
|
|
"step": 1250
|
|
},
|
|
{
|
|
"entropy": 2.062109375,
|
|
"epoch": 0.27860696517412936,
|
|
"grad_norm": 3.2532734870910645,
|
|
"learning_rate": 4.958504261627119e-06,
|
|
"loss": 2.0681,
|
|
"mean_token_accuracy": 0.5155357450246811,
|
|
"num_tokens": 4539140.0,
|
|
"step": 1260
|
|
},
|
|
{
|
|
"entropy": 2.0421875,
|
|
"epoch": 0.2808181315644002,
|
|
"grad_norm": 3.2847983837127686,
|
|
"learning_rate": 4.9574067625476355e-06,
|
|
"loss": 2.042,
|
|
"mean_token_accuracy": 0.5190395534038543,
|
|
"num_tokens": 4575706.0,
|
|
"step": 1270
|
|
},
|
|
{
|
|
"entropy": 2.008984375,
|
|
"epoch": 0.2830292979546711,
|
|
"grad_norm": 3.526211977005005,
|
|
"learning_rate": 4.956295063352895e-06,
|
|
"loss": 2.0388,
|
|
"mean_token_accuracy": 0.5281762689352035,
|
|
"num_tokens": 4612909.0,
|
|
"step": 1280
|
|
},
|
|
{
|
|
"entropy": 2.089453125,
|
|
"epoch": 0.28524046434494194,
|
|
"grad_norm": 3.5005431175231934,
|
|
"learning_rate": 4.955169170466847e-06,
|
|
"loss": 2.066,
|
|
"mean_token_accuracy": 0.5185081407427787,
|
|
"num_tokens": 4649837.0,
|
|
"step": 1290
|
|
},
|
|
{
|
|
"entropy": 2.076953125,
|
|
"epoch": 0.28745163073521285,
|
|
"grad_norm": 3.4639599323272705,
|
|
"learning_rate": 4.954029090395459e-06,
|
|
"loss": 2.0816,
|
|
"mean_token_accuracy": 0.5106042638421059,
|
|
"num_tokens": 4683417.0,
|
|
"step": 1300
|
|
},
|
|
{
|
|
"entropy": 2.04609375,
|
|
"epoch": 0.2896627971254837,
|
|
"grad_norm": 3.0740296840667725,
|
|
"learning_rate": 4.952874829726679e-06,
|
|
"loss": 2.0301,
|
|
"mean_token_accuracy": 0.5250205516815185,
|
|
"num_tokens": 4718803.0,
|
|
"step": 1310
|
|
},
|
|
{
|
|
"entropy": 1.996484375,
|
|
"epoch": 0.29187396351575456,
|
|
"grad_norm": 3.3780007362365723,
|
|
"learning_rate": 4.951706395130398e-06,
|
|
"loss": 2.0583,
|
|
"mean_token_accuracy": 0.5185863241553307,
|
|
"num_tokens": 4755118.0,
|
|
"step": 1320
|
|
},
|
|
{
|
|
"entropy": 1.9734375,
|
|
"epoch": 0.2940851299060254,
|
|
"grad_norm": 3.4502792358398438,
|
|
"learning_rate": 4.950523793358411e-06,
|
|
"loss": 1.987,
|
|
"mean_token_accuracy": 0.5277883052825928,
|
|
"num_tokens": 4791611.0,
|
|
"step": 1330
|
|
},
|
|
{
|
|
"entropy": 1.998828125,
|
|
"epoch": 0.2962962962962963,
|
|
"grad_norm": 3.038604497909546,
|
|
"learning_rate": 4.9493270312443755e-06,
|
|
"loss": 2.0056,
|
|
"mean_token_accuracy": 0.529706421494484,
|
|
"num_tokens": 4830994.0,
|
|
"step": 1340
|
|
},
|
|
{
|
|
"entropy": 2.0359375,
|
|
"epoch": 0.29850746268656714,
|
|
"grad_norm": 3.100778579711914,
|
|
"learning_rate": 4.9481161157037796e-06,
|
|
"loss": 2.0698,
|
|
"mean_token_accuracy": 0.5177467226982116,
|
|
"num_tokens": 4866747.0,
|
|
"step": 1350
|
|
},
|
|
{
|
|
"entropy": 2.045703125,
|
|
"epoch": 0.30071862907683805,
|
|
"grad_norm": 3.9446866512298584,
|
|
"learning_rate": 4.946891053733892e-06,
|
|
"loss": 2.0683,
|
|
"mean_token_accuracy": 0.5160597786307335,
|
|
"num_tokens": 4902490.0,
|
|
"step": 1360
|
|
},
|
|
{
|
|
"entropy": 2.00625,
|
|
"epoch": 0.3029297954671089,
|
|
"grad_norm": 3.167123556137085,
|
|
"learning_rate": 4.945651852413728e-06,
|
|
"loss": 2.0378,
|
|
"mean_token_accuracy": 0.524365185201168,
|
|
"num_tokens": 4937384.0,
|
|
"step": 1370
|
|
},
|
|
{
|
|
"entropy": 2.00703125,
|
|
"epoch": 0.30514096185737977,
|
|
"grad_norm": 2.4206273555755615,
|
|
"learning_rate": 4.94439851890401e-06,
|
|
"loss": 1.9942,
|
|
"mean_token_accuracy": 0.528535221517086,
|
|
"num_tokens": 4973442.0,
|
|
"step": 1380
|
|
},
|
|
{
|
|
"entropy": 2.053515625,
|
|
"epoch": 0.3073521282476506,
|
|
"grad_norm": 3.1989834308624268,
|
|
"learning_rate": 4.94313106044712e-06,
|
|
"loss": 2.0545,
|
|
"mean_token_accuracy": 0.5201150357723237,
|
|
"num_tokens": 5009008.0,
|
|
"step": 1390
|
|
},
|
|
{
|
|
"entropy": 2.026171875,
|
|
"epoch": 0.3095632946379215,
|
|
"grad_norm": 3.1637074947357178,
|
|
"learning_rate": 4.9418494843670585e-06,
|
|
"loss": 2.0658,
|
|
"mean_token_accuracy": 0.5158878669142724,
|
|
"num_tokens": 5047814.0,
|
|
"step": 1400
|
|
},
|
|
{
|
|
"entropy": 2.022265625,
|
|
"epoch": 0.3117744610281924,
|
|
"grad_norm": 3.2978219985961914,
|
|
"learning_rate": 4.940553798069412e-06,
|
|
"loss": 2.0314,
|
|
"mean_token_accuracy": 0.5247649118304253,
|
|
"num_tokens": 5081837.0,
|
|
"step": 1410
|
|
},
|
|
{
|
|
"entropy": 2.05859375,
|
|
"epoch": 0.31398562741846325,
|
|
"grad_norm": 2.8718130588531494,
|
|
"learning_rate": 4.939244009041297e-06,
|
|
"loss": 2.0524,
|
|
"mean_token_accuracy": 0.5260623335838318,
|
|
"num_tokens": 5122184.0,
|
|
"step": 1420
|
|
},
|
|
{
|
|
"entropy": 2.0546875,
|
|
"epoch": 0.3161967938087341,
|
|
"grad_norm": 3.2099649906158447,
|
|
"learning_rate": 4.9379201248513235e-06,
|
|
"loss": 2.0654,
|
|
"mean_token_accuracy": 0.5193627223372459,
|
|
"num_tokens": 5157638.0,
|
|
"step": 1430
|
|
},
|
|
{
|
|
"entropy": 2.055859375,
|
|
"epoch": 0.31840796019900497,
|
|
"grad_norm": 2.2885003089904785,
|
|
"learning_rate": 4.9365821531495515e-06,
|
|
"loss": 2.0415,
|
|
"mean_token_accuracy": 0.5157875746488572,
|
|
"num_tokens": 5196661.0,
|
|
"step": 1440
|
|
},
|
|
{
|
|
"entropy": 2.018359375,
|
|
"epoch": 0.3206191265892758,
|
|
"grad_norm": 2.864169120788574,
|
|
"learning_rate": 4.935230101667446e-06,
|
|
"loss": 2.0094,
|
|
"mean_token_accuracy": 0.5312970861792564,
|
|
"num_tokens": 5232726.0,
|
|
"step": 1450
|
|
},
|
|
{
|
|
"entropy": 2.02109375,
|
|
"epoch": 0.3228302929795467,
|
|
"grad_norm": 3.0841586589813232,
|
|
"learning_rate": 4.933863978217831e-06,
|
|
"loss": 2.021,
|
|
"mean_token_accuracy": 0.5244891539216041,
|
|
"num_tokens": 5268949.0,
|
|
"step": 1460
|
|
},
|
|
{
|
|
"entropy": 1.981640625,
|
|
"epoch": 0.3250414593698176,
|
|
"grad_norm": 3.211052417755127,
|
|
"learning_rate": 4.9324837906948445e-06,
|
|
"loss": 1.9792,
|
|
"mean_token_accuracy": 0.5358170449733735,
|
|
"num_tokens": 5304978.0,
|
|
"step": 1470
|
|
},
|
|
{
|
|
"entropy": 2.04921875,
|
|
"epoch": 0.32725262576008846,
|
|
"grad_norm": 3.485799551010132,
|
|
"learning_rate": 4.931089547073895e-06,
|
|
"loss": 2.0925,
|
|
"mean_token_accuracy": 0.516342180967331,
|
|
"num_tokens": 5341064.0,
|
|
"step": 1480
|
|
},
|
|
{
|
|
"entropy": 2.083203125,
|
|
"epoch": 0.3294637921503593,
|
|
"grad_norm": 3.1947202682495117,
|
|
"learning_rate": 4.929681255411614e-06,
|
|
"loss": 2.0789,
|
|
"mean_token_accuracy": 0.515719099342823,
|
|
"num_tokens": 5377405.0,
|
|
"step": 1490
|
|
},
|
|
{
|
|
"entropy": 2.006640625,
|
|
"epoch": 0.33167495854063017,
|
|
"grad_norm": 3.4811670780181885,
|
|
"learning_rate": 4.928258923845808e-06,
|
|
"loss": 1.9908,
|
|
"mean_token_accuracy": 0.5227188125252724,
|
|
"num_tokens": 5412308.0,
|
|
"step": 1500
|
|
},
|
|
{
|
|
"epoch": 0.33167495854063017,
|
|
"eval_entropy": 2.0015469527363186,
|
|
"eval_loss": 2.020139455795288,
|
|
"eval_mean_token_accuracy": 0.5245392740069337,
|
|
"eval_num_tokens": 5412308.0,
|
|
"eval_runtime": 111.642,
|
|
"eval_samples_per_second": 144.032,
|
|
"eval_steps_per_second": 9.002,
|
|
"step": 1500
|
|
},
|
|
{
|
|
"entropy": 1.97734375,
|
|
"epoch": 0.33388612493090103,
|
|
"grad_norm": 3.286555528640747,
|
|
"learning_rate": 4.926822560595416e-06,
|
|
"loss": 1.9979,
|
|
"mean_token_accuracy": 0.5268404155969619,
|
|
"num_tokens": 5445439.0,
|
|
"step": 1510
|
|
},
|
|
{
|
|
"entropy": 1.988671875,
|
|
"epoch": 0.33609729132117194,
|
|
"grad_norm": 3.4769322872161865,
|
|
"learning_rate": 4.925372173960458e-06,
|
|
"loss": 2.0348,
|
|
"mean_token_accuracy": 0.5200627565383911,
|
|
"num_tokens": 5483959.0,
|
|
"step": 1520
|
|
},
|
|
{
|
|
"entropy": 2.06875,
|
|
"epoch": 0.3383084577114428,
|
|
"grad_norm": 3.410193920135498,
|
|
"learning_rate": 4.923907772321986e-06,
|
|
"loss": 2.0513,
|
|
"mean_token_accuracy": 0.5150986418128014,
|
|
"num_tokens": 5520121.0,
|
|
"step": 1530
|
|
},
|
|
{
|
|
"entropy": 2.051171875,
|
|
"epoch": 0.34051962410171366,
|
|
"grad_norm": 3.275287628173828,
|
|
"learning_rate": 4.922429364142039e-06,
|
|
"loss": 2.0289,
|
|
"mean_token_accuracy": 0.5222316756844521,
|
|
"num_tokens": 5556091.0,
|
|
"step": 1540
|
|
},
|
|
{
|
|
"entropy": 1.96015625,
|
|
"epoch": 0.3427307904919845,
|
|
"grad_norm": 3.107334852218628,
|
|
"learning_rate": 4.920936957963594e-06,
|
|
"loss": 1.9953,
|
|
"mean_token_accuracy": 0.5287952840328216,
|
|
"num_tokens": 5591761.0,
|
|
"step": 1550
|
|
},
|
|
{
|
|
"entropy": 2.051171875,
|
|
"epoch": 0.3449419568822554,
|
|
"grad_norm": 2.963439464569092,
|
|
"learning_rate": 4.919430562410512e-06,
|
|
"loss": 2.0444,
|
|
"mean_token_accuracy": 0.515690267086029,
|
|
"num_tokens": 5626047.0,
|
|
"step": 1560
|
|
},
|
|
{
|
|
"entropy": 2.0703125,
|
|
"epoch": 0.34715312327252623,
|
|
"grad_norm": 3.074941873550415,
|
|
"learning_rate": 4.917910186187495e-06,
|
|
"loss": 2.095,
|
|
"mean_token_accuracy": 0.5144581392407417,
|
|
"num_tokens": 5663058.0,
|
|
"step": 1570
|
|
},
|
|
{
|
|
"entropy": 2.011328125,
|
|
"epoch": 0.34936428966279715,
|
|
"grad_norm": 2.9343066215515137,
|
|
"learning_rate": 4.916375838080033e-06,
|
|
"loss": 2.0013,
|
|
"mean_token_accuracy": 0.527287694811821,
|
|
"num_tokens": 5699281.0,
|
|
"step": 1580
|
|
},
|
|
{
|
|
"entropy": 1.990625,
|
|
"epoch": 0.351575456053068,
|
|
"grad_norm": 3.0326335430145264,
|
|
"learning_rate": 4.914827526954347e-06,
|
|
"loss": 2.009,
|
|
"mean_token_accuracy": 0.5286151185631752,
|
|
"num_tokens": 5735611.0,
|
|
"step": 1590
|
|
},
|
|
{
|
|
"entropy": 1.97890625,
|
|
"epoch": 0.35378662244333886,
|
|
"grad_norm": 3.16322922706604,
|
|
"learning_rate": 4.913265261757348e-06,
|
|
"loss": 1.9667,
|
|
"mean_token_accuracy": 0.5288407698273658,
|
|
"num_tokens": 5768995.0,
|
|
"step": 1600
|
|
},
|
|
{
|
|
"entropy": 2.0234375,
|
|
"epoch": 0.3559977888336097,
|
|
"grad_norm": 3.2227258682250977,
|
|
"learning_rate": 4.911689051516581e-06,
|
|
"loss": 2.0097,
|
|
"mean_token_accuracy": 0.5236464008688927,
|
|
"num_tokens": 5802584.0,
|
|
"step": 1610
|
|
},
|
|
{
|
|
"entropy": 2.034375,
|
|
"epoch": 0.3582089552238806,
|
|
"grad_norm": 3.4065120220184326,
|
|
"learning_rate": 4.910098905340169e-06,
|
|
"loss": 2.0176,
|
|
"mean_token_accuracy": 0.5262903615832328,
|
|
"num_tokens": 5839648.0,
|
|
"step": 1620
|
|
},
|
|
{
|
|
"entropy": 2.01484375,
|
|
"epoch": 0.3604201216141515,
|
|
"grad_norm": 3.445894956588745,
|
|
"learning_rate": 4.908494832416764e-06,
|
|
"loss": 2.014,
|
|
"mean_token_accuracy": 0.5278646647930145,
|
|
"num_tokens": 5875102.0,
|
|
"step": 1630
|
|
},
|
|
{
|
|
"entropy": 2.00390625,
|
|
"epoch": 0.36263128800442235,
|
|
"grad_norm": 2.894221544265747,
|
|
"learning_rate": 4.906876842015499e-06,
|
|
"loss": 2.0651,
|
|
"mean_token_accuracy": 0.5241049721837043,
|
|
"num_tokens": 5912593.0,
|
|
"step": 1640
|
|
},
|
|
{
|
|
"entropy": 2.0296875,
|
|
"epoch": 0.3648424543946932,
|
|
"grad_norm": 3.1065828800201416,
|
|
"learning_rate": 4.905244943485921e-06,
|
|
"loss": 2.039,
|
|
"mean_token_accuracy": 0.5218931689858437,
|
|
"num_tokens": 5950975.0,
|
|
"step": 1650
|
|
},
|
|
{
|
|
"entropy": 2.02265625,
|
|
"epoch": 0.36705362078496406,
|
|
"grad_norm": 2.857823371887207,
|
|
"learning_rate": 4.903599146257952e-06,
|
|
"loss": 2.0308,
|
|
"mean_token_accuracy": 0.5198357656598092,
|
|
"num_tokens": 5987316.0,
|
|
"step": 1660
|
|
},
|
|
{
|
|
"entropy": 2.00546875,
|
|
"epoch": 0.3692647871752349,
|
|
"grad_norm": 3.0297486782073975,
|
|
"learning_rate": 4.9019394598418225e-06,
|
|
"loss": 2.0157,
|
|
"mean_token_accuracy": 0.5213582336902618,
|
|
"num_tokens": 6022113.0,
|
|
"step": 1670
|
|
},
|
|
{
|
|
"entropy": 2.01875,
|
|
"epoch": 0.3714759535655058,
|
|
"grad_norm": 3.2613017559051514,
|
|
"learning_rate": 4.9002658938280265e-06,
|
|
"loss": 2.0366,
|
|
"mean_token_accuracy": 0.5199184194207191,
|
|
"num_tokens": 6059707.0,
|
|
"step": 1680
|
|
},
|
|
{
|
|
"entropy": 2.01015625,
|
|
"epoch": 0.3736871199557767,
|
|
"grad_norm": 2.819084882736206,
|
|
"learning_rate": 4.898578457887256e-06,
|
|
"loss": 2.0391,
|
|
"mean_token_accuracy": 0.5251257419586182,
|
|
"num_tokens": 6099280.0,
|
|
"step": 1690
|
|
},
|
|
{
|
|
"entropy": 2.018359375,
|
|
"epoch": 0.37589828634604755,
|
|
"grad_norm": 3.639329433441162,
|
|
"learning_rate": 4.896877161770356e-06,
|
|
"loss": 2.002,
|
|
"mean_token_accuracy": 0.5279067263007164,
|
|
"num_tokens": 6133394.0,
|
|
"step": 1700
|
|
},
|
|
{
|
|
"entropy": 2.01171875,
|
|
"epoch": 0.3781094527363184,
|
|
"grad_norm": 3.7768845558166504,
|
|
"learning_rate": 4.895162015308256e-06,
|
|
"loss": 2.0063,
|
|
"mean_token_accuracy": 0.5246257245540619,
|
|
"num_tokens": 6170401.0,
|
|
"step": 1710
|
|
},
|
|
{
|
|
"entropy": 1.965234375,
|
|
"epoch": 0.38032061912658927,
|
|
"grad_norm": 3.422788143157959,
|
|
"learning_rate": 4.893433028411924e-06,
|
|
"loss": 1.9681,
|
|
"mean_token_accuracy": 0.5322629019618035,
|
|
"num_tokens": 6206773.0,
|
|
"step": 1720
|
|
},
|
|
{
|
|
"entropy": 2.013671875,
|
|
"epoch": 0.3825317855168601,
|
|
"grad_norm": 2.9707889556884766,
|
|
"learning_rate": 4.891690211072306e-06,
|
|
"loss": 2.0266,
|
|
"mean_token_accuracy": 0.5252422988414764,
|
|
"num_tokens": 6242756.0,
|
|
"step": 1730
|
|
},
|
|
{
|
|
"entropy": 2.02265625,
|
|
"epoch": 0.38474295190713104,
|
|
"grad_norm": 3.2246110439300537,
|
|
"learning_rate": 4.8899335733602635e-06,
|
|
"loss": 2.02,
|
|
"mean_token_accuracy": 0.5224257856607437,
|
|
"num_tokens": 6279484.0,
|
|
"step": 1740
|
|
},
|
|
{
|
|
"entropy": 1.96875,
|
|
"epoch": 0.3869541182974019,
|
|
"grad_norm": 2.7384414672851562,
|
|
"learning_rate": 4.88816312542652e-06,
|
|
"loss": 1.9764,
|
|
"mean_token_accuracy": 0.5283252835273743,
|
|
"num_tokens": 6317492.0,
|
|
"step": 1750
|
|
},
|
|
{
|
|
"entropy": 1.99453125,
|
|
"epoch": 0.38916528468767275,
|
|
"grad_norm": 4.392463207244873,
|
|
"learning_rate": 4.886378877501603e-06,
|
|
"loss": 2.0513,
|
|
"mean_token_accuracy": 0.5172360330820084,
|
|
"num_tokens": 6353436.0,
|
|
"step": 1760
|
|
},
|
|
{
|
|
"entropy": 2.0875,
|
|
"epoch": 0.3913764510779436,
|
|
"grad_norm": 3.436783790588379,
|
|
"learning_rate": 4.884580839895781e-06,
|
|
"loss": 2.0735,
|
|
"mean_token_accuracy": 0.5116148293018341,
|
|
"num_tokens": 6390976.0,
|
|
"step": 1770
|
|
},
|
|
{
|
|
"entropy": 2.0265625,
|
|
"epoch": 0.39358761746821447,
|
|
"grad_norm": 3.3862481117248535,
|
|
"learning_rate": 4.882769022999009e-06,
|
|
"loss": 2.0148,
|
|
"mean_token_accuracy": 0.5261307835578919,
|
|
"num_tokens": 6426736.0,
|
|
"step": 1780
|
|
},
|
|
{
|
|
"entropy": 2.006640625,
|
|
"epoch": 0.3957987838584853,
|
|
"grad_norm": 2.5017852783203125,
|
|
"learning_rate": 4.880943437280861e-06,
|
|
"loss": 2.0449,
|
|
"mean_token_accuracy": 0.5277575939893723,
|
|
"num_tokens": 6463902.0,
|
|
"step": 1790
|
|
},
|
|
{
|
|
"entropy": 1.98359375,
|
|
"epoch": 0.39800995024875624,
|
|
"grad_norm": 2.7924301624298096,
|
|
"learning_rate": 4.87910409329048e-06,
|
|
"loss": 1.9795,
|
|
"mean_token_accuracy": 0.530899016559124,
|
|
"num_tokens": 6499738.0,
|
|
"step": 1800
|
|
},
|
|
{
|
|
"entropy": 1.964453125,
|
|
"epoch": 0.4002211166390271,
|
|
"grad_norm": 3.3680801391601562,
|
|
"learning_rate": 4.877251001656506e-06,
|
|
"loss": 1.9509,
|
|
"mean_token_accuracy": 0.5317232936620713,
|
|
"num_tokens": 6534129.0,
|
|
"step": 1810
|
|
},
|
|
{
|
|
"entropy": 1.990625,
|
|
"epoch": 0.40243228302929795,
|
|
"grad_norm": 2.4256699085235596,
|
|
"learning_rate": 4.875384173087021e-06,
|
|
"loss": 2.0282,
|
|
"mean_token_accuracy": 0.5240411281585693,
|
|
"num_tokens": 6571287.0,
|
|
"step": 1820
|
|
},
|
|
{
|
|
"entropy": 2.05625,
|
|
"epoch": 0.4046434494195688,
|
|
"grad_norm": 2.913134813308716,
|
|
"learning_rate": 4.873503618369489e-06,
|
|
"loss": 2.0856,
|
|
"mean_token_accuracy": 0.5163218721747398,
|
|
"num_tokens": 6610703.0,
|
|
"step": 1830
|
|
},
|
|
{
|
|
"entropy": 2.006640625,
|
|
"epoch": 0.40685461580983967,
|
|
"grad_norm": 3.4239633083343506,
|
|
"learning_rate": 4.871609348370686e-06,
|
|
"loss": 1.999,
|
|
"mean_token_accuracy": 0.5269322291016578,
|
|
"num_tokens": 6647395.0,
|
|
"step": 1840
|
|
},
|
|
{
|
|
"entropy": 1.98046875,
|
|
"epoch": 0.4090657822001106,
|
|
"grad_norm": 2.9546079635620117,
|
|
"learning_rate": 4.869701374036644e-06,
|
|
"loss": 2.0095,
|
|
"mean_token_accuracy": 0.5220134198665619,
|
|
"num_tokens": 6683942.0,
|
|
"step": 1850
|
|
},
|
|
{
|
|
"entropy": 1.94375,
|
|
"epoch": 0.41127694859038144,
|
|
"grad_norm": 3.476383686065674,
|
|
"learning_rate": 4.8677797063925855e-06,
|
|
"loss": 1.9621,
|
|
"mean_token_accuracy": 0.5390887811779976,
|
|
"num_tokens": 6721469.0,
|
|
"step": 1860
|
|
},
|
|
{
|
|
"entropy": 1.971875,
|
|
"epoch": 0.4134881149806523,
|
|
"grad_norm": 3.4428083896636963,
|
|
"learning_rate": 4.8658443565428605e-06,
|
|
"loss": 2.0089,
|
|
"mean_token_accuracy": 0.5274516686797142,
|
|
"num_tokens": 6758813.0,
|
|
"step": 1870
|
|
},
|
|
{
|
|
"entropy": 2.00234375,
|
|
"epoch": 0.41569928137092316,
|
|
"grad_norm": 2.8875725269317627,
|
|
"learning_rate": 4.863895335670879e-06,
|
|
"loss": 2.0001,
|
|
"mean_token_accuracy": 0.5276427209377289,
|
|
"num_tokens": 6793691.0,
|
|
"step": 1880
|
|
},
|
|
{
|
|
"entropy": 2.012109375,
|
|
"epoch": 0.417910447761194,
|
|
"grad_norm": 3.414984941482544,
|
|
"learning_rate": 4.8619326550390495e-06,
|
|
"loss": 1.9848,
|
|
"mean_token_accuracy": 0.5272266566753387,
|
|
"num_tokens": 6832113.0,
|
|
"step": 1890
|
|
},
|
|
{
|
|
"entropy": 1.9609375,
|
|
"epoch": 0.4201216141514649,
|
|
"grad_norm": 3.075002670288086,
|
|
"learning_rate": 4.859956325988716e-06,
|
|
"loss": 1.9864,
|
|
"mean_token_accuracy": 0.5318835929036141,
|
|
"num_tokens": 6868949.0,
|
|
"step": 1900
|
|
},
|
|
{
|
|
"entropy": 1.976953125,
|
|
"epoch": 0.4223327805417358,
|
|
"grad_norm": 2.8310725688934326,
|
|
"learning_rate": 4.8579663599400875e-06,
|
|
"loss": 1.9668,
|
|
"mean_token_accuracy": 0.5309950023889541,
|
|
"num_tokens": 6905049.0,
|
|
"step": 1910
|
|
},
|
|
{
|
|
"entropy": 1.994921875,
|
|
"epoch": 0.42454394693200664,
|
|
"grad_norm": 2.7676169872283936,
|
|
"learning_rate": 4.855962768392175e-06,
|
|
"loss": 1.9493,
|
|
"mean_token_accuracy": 0.5334994912147522,
|
|
"num_tokens": 6941480.0,
|
|
"step": 1920
|
|
},
|
|
{
|
|
"entropy": 1.9234375,
|
|
"epoch": 0.4267551133222775,
|
|
"grad_norm": 4.15484619140625,
|
|
"learning_rate": 4.853945562922725e-06,
|
|
"loss": 1.9413,
|
|
"mean_token_accuracy": 0.5358347952365875,
|
|
"num_tokens": 6975371.0,
|
|
"step": 1930
|
|
},
|
|
{
|
|
"entropy": 1.98359375,
|
|
"epoch": 0.42896627971254836,
|
|
"grad_norm": 3.328986883163452,
|
|
"learning_rate": 4.851914755188149e-06,
|
|
"loss": 1.9963,
|
|
"mean_token_accuracy": 0.5291261881589889,
|
|
"num_tokens": 7012473.0,
|
|
"step": 1940
|
|
},
|
|
{
|
|
"entropy": 1.992578125,
|
|
"epoch": 0.4311774461028192,
|
|
"grad_norm": 3.605990171432495,
|
|
"learning_rate": 4.849870356923465e-06,
|
|
"loss": 1.9949,
|
|
"mean_token_accuracy": 0.5312375798821449,
|
|
"num_tokens": 7047117.0,
|
|
"step": 1950
|
|
},
|
|
{
|
|
"entropy": 1.98828125,
|
|
"epoch": 0.43338861249309013,
|
|
"grad_norm": 3.2588589191436768,
|
|
"learning_rate": 4.847812379942217e-06,
|
|
"loss": 2.0122,
|
|
"mean_token_accuracy": 0.5246651962399482,
|
|
"num_tokens": 7082697.0,
|
|
"step": 1960
|
|
},
|
|
{
|
|
"entropy": 1.95546875,
|
|
"epoch": 0.435599778883361,
|
|
"grad_norm": 3.2713136672973633,
|
|
"learning_rate": 4.845740836136419e-06,
|
|
"loss": 1.9502,
|
|
"mean_token_accuracy": 0.535953414440155,
|
|
"num_tokens": 7119748.0,
|
|
"step": 1970
|
|
},
|
|
{
|
|
"entropy": 1.982421875,
|
|
"epoch": 0.43781094527363185,
|
|
"grad_norm": 3.7937722206115723,
|
|
"learning_rate": 4.843655737476478e-06,
|
|
"loss": 1.9975,
|
|
"mean_token_accuracy": 0.5286378636956215,
|
|
"num_tokens": 7154907.0,
|
|
"step": 1980
|
|
},
|
|
{
|
|
"entropy": 2.01953125,
|
|
"epoch": 0.4400221116639027,
|
|
"grad_norm": 3.515338182449341,
|
|
"learning_rate": 4.841557096011128e-06,
|
|
"loss": 2.0227,
|
|
"mean_token_accuracy": 0.5251514956355094,
|
|
"num_tokens": 7193118.0,
|
|
"step": 1990
|
|
},
|
|
{
|
|
"entropy": 1.98984375,
|
|
"epoch": 0.44223327805417356,
|
|
"grad_norm": 3.7926671504974365,
|
|
"learning_rate": 4.839444923867361e-06,
|
|
"loss": 2.0032,
|
|
"mean_token_accuracy": 0.5273692816495895,
|
|
"num_tokens": 7229210.0,
|
|
"step": 2000
|
|
},
|
|
{
|
|
"epoch": 0.44223327805417356,
|
|
"eval_entropy": 1.9872590174129354,
|
|
"eval_loss": 1.9946436882019043,
|
|
"eval_mean_token_accuracy": 0.5280916218733906,
|
|
"eval_num_tokens": 7229210.0,
|
|
"eval_runtime": 111.8723,
|
|
"eval_samples_per_second": 143.735,
|
|
"eval_steps_per_second": 8.983,
|
|
"step": 2000
|
|
},
|
|
{
|
|
"entropy": 1.983984375,
|
|
"epoch": 0.4444444444444444,
|
|
"grad_norm": 3.584087371826172,
|
|
"learning_rate": 4.837319233250355e-06,
|
|
"loss": 1.9848,
|
|
"mean_token_accuracy": 0.528825818002224,
|
|
"num_tokens": 7266601.0,
|
|
"step": 2010
|
|
},
|
|
{
|
|
"entropy": 1.94296875,
|
|
"epoch": 0.44665561083471533,
|
|
"grad_norm": 2.794679880142212,
|
|
"learning_rate": 4.835180036443405e-06,
|
|
"loss": 1.9537,
|
|
"mean_token_accuracy": 0.532137893140316,
|
|
"num_tokens": 7301710.0,
|
|
"step": 2020
|
|
},
|
|
{
|
|
"entropy": 1.97890625,
|
|
"epoch": 0.4488667772249862,
|
|
"grad_norm": 3.4439918994903564,
|
|
"learning_rate": 4.833027345807851e-06,
|
|
"loss": 2.0035,
|
|
"mean_token_accuracy": 0.5284280598163604,
|
|
"num_tokens": 7337896.0,
|
|
"step": 2030
|
|
},
|
|
{
|
|
"entropy": 2.000390625,
|
|
"epoch": 0.45107794361525705,
|
|
"grad_norm": 2.858286142349243,
|
|
"learning_rate": 4.830861173783007e-06,
|
|
"loss": 2.013,
|
|
"mean_token_accuracy": 0.531543330848217,
|
|
"num_tokens": 7376444.0,
|
|
"step": 2040
|
|
},
|
|
{
|
|
"entropy": 1.984765625,
|
|
"epoch": 0.4532891100055279,
|
|
"grad_norm": 2.9520671367645264,
|
|
"learning_rate": 4.82868153288609e-06,
|
|
"loss": 1.9783,
|
|
"mean_token_accuracy": 0.5301756590604783,
|
|
"num_tokens": 7413600.0,
|
|
"step": 2050
|
|
},
|
|
{
|
|
"entropy": 2.026171875,
|
|
"epoch": 0.45550027639579876,
|
|
"grad_norm": 3.400359869003296,
|
|
"learning_rate": 4.826488435712146e-06,
|
|
"loss": 2.0126,
|
|
"mean_token_accuracy": 0.5227610245347023,
|
|
"num_tokens": 7450416.0,
|
|
"step": 2060
|
|
},
|
|
{
|
|
"entropy": 1.98984375,
|
|
"epoch": 0.4577114427860697,
|
|
"grad_norm": 3.1152267456054688,
|
|
"learning_rate": 4.8242818949339795e-06,
|
|
"loss": 1.9815,
|
|
"mean_token_accuracy": 0.5310664609074592,
|
|
"num_tokens": 7490517.0,
|
|
"step": 2070
|
|
},
|
|
{
|
|
"entropy": 1.99375,
|
|
"epoch": 0.45992260917634054,
|
|
"grad_norm": 3.58620023727417,
|
|
"learning_rate": 4.822061923302077e-06,
|
|
"loss": 2.0008,
|
|
"mean_token_accuracy": 0.5222583279013634,
|
|
"num_tokens": 7526522.0,
|
|
"step": 2080
|
|
},
|
|
{
|
|
"entropy": 1.98671875,
|
|
"epoch": 0.4621337755666114,
|
|
"grad_norm": 3.3485400676727295,
|
|
"learning_rate": 4.8198285336445345e-06,
|
|
"loss": 1.9971,
|
|
"mean_token_accuracy": 0.527626684308052,
|
|
"num_tokens": 7561247.0,
|
|
"step": 2090
|
|
},
|
|
{
|
|
"entropy": 1.960546875,
|
|
"epoch": 0.46434494195688225,
|
|
"grad_norm": 3.2537410259246826,
|
|
"learning_rate": 4.817581738866988e-06,
|
|
"loss": 1.9854,
|
|
"mean_token_accuracy": 0.52382532954216,
|
|
"num_tokens": 7598123.0,
|
|
"step": 2100
|
|
},
|
|
{
|
|
"entropy": 1.980859375,
|
|
"epoch": 0.4665561083471531,
|
|
"grad_norm": 3.2869839668273926,
|
|
"learning_rate": 4.8153215519525294e-06,
|
|
"loss": 1.9762,
|
|
"mean_token_accuracy": 0.5292315185070038,
|
|
"num_tokens": 7633809.0,
|
|
"step": 2110
|
|
},
|
|
{
|
|
"entropy": 1.99765625,
|
|
"epoch": 0.46876727473742397,
|
|
"grad_norm": 2.608034372329712,
|
|
"learning_rate": 4.813047985961641e-06,
|
|
"loss": 2.0076,
|
|
"mean_token_accuracy": 0.5262059271335602,
|
|
"num_tokens": 7673415.0,
|
|
"step": 2120
|
|
},
|
|
{
|
|
"entropy": 1.951953125,
|
|
"epoch": 0.4709784411276949,
|
|
"grad_norm": 3.475959300994873,
|
|
"learning_rate": 4.810761054032115e-06,
|
|
"loss": 1.9906,
|
|
"mean_token_accuracy": 0.5288190424442292,
|
|
"num_tokens": 7707130.0,
|
|
"step": 2130
|
|
},
|
|
{
|
|
"entropy": 1.99609375,
|
|
"epoch": 0.47318960751796574,
|
|
"grad_norm": 3.474595785140991,
|
|
"learning_rate": 4.8084607693789796e-06,
|
|
"loss": 1.9953,
|
|
"mean_token_accuracy": 0.5295667469501495,
|
|
"num_tokens": 7739702.0,
|
|
"step": 2140
|
|
},
|
|
{
|
|
"entropy": 2.020703125,
|
|
"epoch": 0.4754007739082366,
|
|
"grad_norm": 3.2300822734832764,
|
|
"learning_rate": 4.806147145294418e-06,
|
|
"loss": 2.0104,
|
|
"mean_token_accuracy": 0.5236712947487832,
|
|
"num_tokens": 7774323.0,
|
|
"step": 2150
|
|
},
|
|
{
|
|
"entropy": 2.00859375,
|
|
"epoch": 0.47761194029850745,
|
|
"grad_norm": 3.140997886657715,
|
|
"learning_rate": 4.8038201951477e-06,
|
|
"loss": 2.0193,
|
|
"mean_token_accuracy": 0.5262003257870674,
|
|
"num_tokens": 7813410.0,
|
|
"step": 2160
|
|
},
|
|
{
|
|
"entropy": 1.93828125,
|
|
"epoch": 0.4798231066887783,
|
|
"grad_norm": 3.0355441570281982,
|
|
"learning_rate": 4.801479932385097e-06,
|
|
"loss": 1.9525,
|
|
"mean_token_accuracy": 0.5373364612460136,
|
|
"num_tokens": 7850044.0,
|
|
"step": 2170
|
|
},
|
|
{
|
|
"entropy": 1.9640625,
|
|
"epoch": 0.4820342730790492,
|
|
"grad_norm": 3.3321173191070557,
|
|
"learning_rate": 4.799126370529807e-06,
|
|
"loss": 1.9549,
|
|
"mean_token_accuracy": 0.5367608845233918,
|
|
"num_tokens": 7885208.0,
|
|
"step": 2180
|
|
},
|
|
{
|
|
"entropy": 1.924609375,
|
|
"epoch": 0.4842454394693201,
|
|
"grad_norm": 3.8043746948242188,
|
|
"learning_rate": 4.796759523181881e-06,
|
|
"loss": 1.9077,
|
|
"mean_token_accuracy": 0.5465276122093201,
|
|
"num_tokens": 7919612.0,
|
|
"step": 2190
|
|
},
|
|
{
|
|
"entropy": 1.978125,
|
|
"epoch": 0.48645660585959094,
|
|
"grad_norm": 3.251349449157715,
|
|
"learning_rate": 4.794379404018134e-06,
|
|
"loss": 1.9966,
|
|
"mean_token_accuracy": 0.5266179665923119,
|
|
"num_tokens": 7952907.0,
|
|
"step": 2200
|
|
},
|
|
{
|
|
"entropy": 1.976171875,
|
|
"epoch": 0.4886677722498618,
|
|
"grad_norm": 3.3656363487243652,
|
|
"learning_rate": 4.7919860267920766e-06,
|
|
"loss": 2.0095,
|
|
"mean_token_accuracy": 0.5276166632771492,
|
|
"num_tokens": 7988354.0,
|
|
"step": 2210
|
|
},
|
|
{
|
|
"entropy": 2.015234375,
|
|
"epoch": 0.49087893864013266,
|
|
"grad_norm": 3.0376927852630615,
|
|
"learning_rate": 4.789579405333829e-06,
|
|
"loss": 2.0095,
|
|
"mean_token_accuracy": 0.5284107387065887,
|
|
"num_tokens": 8025464.0,
|
|
"step": 2220
|
|
},
|
|
{
|
|
"entropy": 1.958203125,
|
|
"epoch": 0.4930901050304035,
|
|
"grad_norm": 3.3354475498199463,
|
|
"learning_rate": 4.787159553550044e-06,
|
|
"loss": 1.9554,
|
|
"mean_token_accuracy": 0.5324451982975006,
|
|
"num_tokens": 8059773.0,
|
|
"step": 2230
|
|
},
|
|
{
|
|
"entropy": 1.946484375,
|
|
"epoch": 0.4953012714206744,
|
|
"grad_norm": 3.2195026874542236,
|
|
"learning_rate": 4.784726485423826e-06,
|
|
"loss": 1.9755,
|
|
"mean_token_accuracy": 0.5312342554330826,
|
|
"num_tokens": 8095824.0,
|
|
"step": 2240
|
|
},
|
|
{
|
|
"entropy": 1.943359375,
|
|
"epoch": 0.4975124378109453,
|
|
"grad_norm": 3.6470742225646973,
|
|
"learning_rate": 4.782280215014649e-06,
|
|
"loss": 1.949,
|
|
"mean_token_accuracy": 0.5355236887931824,
|
|
"num_tokens": 8127561.0,
|
|
"step": 2250
|
|
},
|
|
{
|
|
"entropy": 1.994921875,
|
|
"epoch": 0.49972360420121614,
|
|
"grad_norm": 2.461458683013916,
|
|
"learning_rate": 4.779820756458277e-06,
|
|
"loss": 2.0066,
|
|
"mean_token_accuracy": 0.5283254072070122,
|
|
"num_tokens": 8162809.0,
|
|
"step": 2260
|
|
},
|
|
{
|
|
"entropy": 1.948046875,
|
|
"epoch": 0.5019347705914871,
|
|
"grad_norm": 3.2263569831848145,
|
|
"learning_rate": 4.777348123966682e-06,
|
|
"loss": 1.9558,
|
|
"mean_token_accuracy": 0.5369130149483681,
|
|
"num_tokens": 8196851.0,
|
|
"step": 2270
|
|
},
|
|
{
|
|
"entropy": 1.953515625,
|
|
"epoch": 0.5041459369817579,
|
|
"grad_norm": 3.399358034133911,
|
|
"learning_rate": 4.77486233182796e-06,
|
|
"loss": 1.9817,
|
|
"mean_token_accuracy": 0.5317654237151146,
|
|
"num_tokens": 8234282.0,
|
|
"step": 2280
|
|
},
|
|
{
|
|
"entropy": 1.987109375,
|
|
"epoch": 0.5063571033720288,
|
|
"grad_norm": 3.4737977981567383,
|
|
"learning_rate": 4.772363394406252e-06,
|
|
"loss": 2.0086,
|
|
"mean_token_accuracy": 0.526680725812912,
|
|
"num_tokens": 8270520.0,
|
|
"step": 2290
|
|
},
|
|
{
|
|
"entropy": 1.948046875,
|
|
"epoch": 0.5085682697622996,
|
|
"grad_norm": 2.7183966636657715,
|
|
"learning_rate": 4.769851326141658e-06,
|
|
"loss": 1.9656,
|
|
"mean_token_accuracy": 0.5319627165794373,
|
|
"num_tokens": 8304910.0,
|
|
"step": 2300
|
|
},
|
|
{
|
|
"entropy": 1.99921875,
|
|
"epoch": 0.5107794361525705,
|
|
"grad_norm": 2.9910993576049805,
|
|
"learning_rate": 4.767326141550155e-06,
|
|
"loss": 2.0497,
|
|
"mean_token_accuracy": 0.5210982084274292,
|
|
"num_tokens": 8343674.0,
|
|
"step": 2310
|
|
},
|
|
{
|
|
"entropy": 1.99609375,
|
|
"epoch": 0.5129906025428413,
|
|
"grad_norm": 3.245457172393799,
|
|
"learning_rate": 4.764787855223509e-06,
|
|
"loss": 1.9975,
|
|
"mean_token_accuracy": 0.5253664508461953,
|
|
"num_tokens": 8376757.0,
|
|
"step": 2320
|
|
},
|
|
{
|
|
"entropy": 1.94921875,
|
|
"epoch": 0.5152017689331122,
|
|
"grad_norm": 3.09206223487854,
|
|
"learning_rate": 4.7622364818292025e-06,
|
|
"loss": 1.9532,
|
|
"mean_token_accuracy": 0.5335244342684746,
|
|
"num_tokens": 8410129.0,
|
|
"step": 2330
|
|
},
|
|
{
|
|
"entropy": 1.980078125,
|
|
"epoch": 0.5174129353233831,
|
|
"grad_norm": 3.0276973247528076,
|
|
"learning_rate": 4.759672036110332e-06,
|
|
"loss": 1.9572,
|
|
"mean_token_accuracy": 0.5330440893769264,
|
|
"num_tokens": 8446472.0,
|
|
"step": 2340
|
|
},
|
|
{
|
|
"entropy": 2.012890625,
|
|
"epoch": 0.5196241017136539,
|
|
"grad_norm": 3.503645658493042,
|
|
"learning_rate": 4.75709453288554e-06,
|
|
"loss": 2.0094,
|
|
"mean_token_accuracy": 0.5294659733772278,
|
|
"num_tokens": 8485139.0,
|
|
"step": 2350
|
|
},
|
|
{
|
|
"entropy": 1.96328125,
|
|
"epoch": 0.5218352681039248,
|
|
"grad_norm": 2.74729323387146,
|
|
"learning_rate": 4.754503987048918e-06,
|
|
"loss": 1.9551,
|
|
"mean_token_accuracy": 0.5381256014108657,
|
|
"num_tokens": 8523225.0,
|
|
"step": 2360
|
|
},
|
|
{
|
|
"entropy": 1.962109375,
|
|
"epoch": 0.5240464344941956,
|
|
"grad_norm": 3.1583802700042725,
|
|
"learning_rate": 4.751900413569924e-06,
|
|
"loss": 1.9806,
|
|
"mean_token_accuracy": 0.5270368605852127,
|
|
"num_tokens": 8557403.0,
|
|
"step": 2370
|
|
},
|
|
{
|
|
"entropy": 1.980078125,
|
|
"epoch": 0.5262576008844666,
|
|
"grad_norm": 3.5454792976379395,
|
|
"learning_rate": 4.749283827493297e-06,
|
|
"loss": 2.0092,
|
|
"mean_token_accuracy": 0.5232952460646629,
|
|
"num_tokens": 8592216.0,
|
|
"step": 2380
|
|
},
|
|
{
|
|
"entropy": 1.973046875,
|
|
"epoch": 0.5284687672747375,
|
|
"grad_norm": 3.267307758331299,
|
|
"learning_rate": 4.746654243938971e-06,
|
|
"loss": 1.9954,
|
|
"mean_token_accuracy": 0.5297577306628227,
|
|
"num_tokens": 8628427.0,
|
|
"step": 2390
|
|
},
|
|
{
|
|
"entropy": 1.970703125,
|
|
"epoch": 0.5306799336650083,
|
|
"grad_norm": 3.108689308166504,
|
|
"learning_rate": 4.744011678101982e-06,
|
|
"loss": 1.9858,
|
|
"mean_token_accuracy": 0.5295312121510506,
|
|
"num_tokens": 8663057.0,
|
|
"step": 2400
|
|
},
|
|
{
|
|
"entropy": 1.95234375,
|
|
"epoch": 0.5328911000552792,
|
|
"grad_norm": 3.545428991317749,
|
|
"learning_rate": 4.7413561452523875e-06,
|
|
"loss": 1.9886,
|
|
"mean_token_accuracy": 0.5298693463206291,
|
|
"num_tokens": 8697637.0,
|
|
"step": 2410
|
|
},
|
|
{
|
|
"entropy": 1.99765625,
|
|
"epoch": 0.53510226644555,
|
|
"grad_norm": 3.096508741378784,
|
|
"learning_rate": 4.7386876607351735e-06,
|
|
"loss": 1.9999,
|
|
"mean_token_accuracy": 0.5239310264587402,
|
|
"num_tokens": 8737513.0,
|
|
"step": 2420
|
|
},
|
|
{
|
|
"entropy": 1.973828125,
|
|
"epoch": 0.5373134328358209,
|
|
"grad_norm": 3.313612222671509,
|
|
"learning_rate": 4.7360062399701665e-06,
|
|
"loss": 1.9599,
|
|
"mean_token_accuracy": 0.534371504187584,
|
|
"num_tokens": 8774475.0,
|
|
"step": 2430
|
|
},
|
|
{
|
|
"entropy": 1.97421875,
|
|
"epoch": 0.5395245992260918,
|
|
"grad_norm": 2.5942392349243164,
|
|
"learning_rate": 4.733311898451947e-06,
|
|
"loss": 1.9701,
|
|
"mean_token_accuracy": 0.5348088696599007,
|
|
"num_tokens": 8811186.0,
|
|
"step": 2440
|
|
},
|
|
{
|
|
"entropy": 2.0,
|
|
"epoch": 0.5417357656163626,
|
|
"grad_norm": 3.3712050914764404,
|
|
"learning_rate": 4.730604651749756e-06,
|
|
"loss": 2.0208,
|
|
"mean_token_accuracy": 0.520662447810173,
|
|
"num_tokens": 8847638.0,
|
|
"step": 2450
|
|
},
|
|
{
|
|
"entropy": 1.941796875,
|
|
"epoch": 0.5439469320066335,
|
|
"grad_norm": 4.207601070404053,
|
|
"learning_rate": 4.727884515507408e-06,
|
|
"loss": 1.9293,
|
|
"mean_token_accuracy": 0.5403480961918831,
|
|
"num_tokens": 8881185.0,
|
|
"step": 2460
|
|
},
|
|
{
|
|
"entropy": 1.980859375,
|
|
"epoch": 0.5461580983969043,
|
|
"grad_norm": 2.924936532974243,
|
|
"learning_rate": 4.7251515054432e-06,
|
|
"loss": 1.9963,
|
|
"mean_token_accuracy": 0.5296011701226234,
|
|
"num_tokens": 8919018.0,
|
|
"step": 2470
|
|
},
|
|
{
|
|
"entropy": 1.98203125,
|
|
"epoch": 0.5483692647871752,
|
|
"grad_norm": 3.207223892211914,
|
|
"learning_rate": 4.7224056373498186e-06,
|
|
"loss": 1.9833,
|
|
"mean_token_accuracy": 0.5308783873915672,
|
|
"num_tokens": 8954854.0,
|
|
"step": 2480
|
|
},
|
|
{
|
|
"entropy": 2.0046875,
|
|
"epoch": 0.5505804311774462,
|
|
"grad_norm": 3.3104751110076904,
|
|
"learning_rate": 4.719646927094252e-06,
|
|
"loss": 1.9986,
|
|
"mean_token_accuracy": 0.5207533955574035,
|
|
"num_tokens": 8991276.0,
|
|
"step": 2490
|
|
},
|
|
{
|
|
"entropy": 2.006640625,
|
|
"epoch": 0.552791597567717,
|
|
"grad_norm": 3.401648998260498,
|
|
"learning_rate": 4.7168753906176975e-06,
|
|
"loss": 2.0062,
|
|
"mean_token_accuracy": 0.5235192358493805,
|
|
"num_tokens": 9027642.0,
|
|
"step": 2500
|
|
},
|
|
{
|
|
"epoch": 0.552791597567717,
|
|
"eval_entropy": 1.9466184701492537,
|
|
"eval_loss": 1.9719250202178955,
|
|
"eval_mean_token_accuracy": 0.5324211383933452,
|
|
"eval_num_tokens": 9027642.0,
|
|
"eval_runtime": 111.7908,
|
|
"eval_samples_per_second": 143.84,
|
|
"eval_steps_per_second": 8.99,
|
|
"step": 2500
|
|
},
|
|
{
|
|
"entropy": 1.926171875,
|
|
"epoch": 0.5550027639579879,
|
|
"grad_norm": 3.34617018699646,
|
|
"learning_rate": 4.714091043935467e-06,
|
|
"loss": 1.9613,
|
|
"mean_token_accuracy": 0.5319983184337616,
|
|
"num_tokens": 9062123.0,
|
|
"step": 2510
|
|
},
|
|
{
|
|
"entropy": 1.94453125,
|
|
"epoch": 0.5572139303482587,
|
|
"grad_norm": 3.2840592861175537,
|
|
"learning_rate": 4.711293903136898e-06,
|
|
"loss": 1.9765,
|
|
"mean_token_accuracy": 0.5307324916124344,
|
|
"num_tokens": 9097000.0,
|
|
"step": 2520
|
|
},
|
|
{
|
|
"entropy": 1.951953125,
|
|
"epoch": 0.5594250967385296,
|
|
"grad_norm": 3.3803882598876953,
|
|
"learning_rate": 4.7084839843852545e-06,
|
|
"loss": 1.9291,
|
|
"mean_token_accuracy": 0.5374570921063423,
|
|
"num_tokens": 9135105.0,
|
|
"step": 2530
|
|
},
|
|
{
|
|
"entropy": 1.96953125,
|
|
"epoch": 0.5616362631288004,
|
|
"grad_norm": 3.2837789058685303,
|
|
"learning_rate": 4.705661303917645e-06,
|
|
"loss": 1.955,
|
|
"mean_token_accuracy": 0.5328634202480316,
|
|
"num_tokens": 9171242.0,
|
|
"step": 2540
|
|
},
|
|
{
|
|
"entropy": 1.96484375,
|
|
"epoch": 0.5638474295190713,
|
|
"grad_norm": 2.92405104637146,
|
|
"learning_rate": 4.702825878044914e-06,
|
|
"loss": 1.9763,
|
|
"mean_token_accuracy": 0.5340756550431252,
|
|
"num_tokens": 9207883.0,
|
|
"step": 2550
|
|
},
|
|
{
|
|
"entropy": 1.921875,
|
|
"epoch": 0.5660585959093422,
|
|
"grad_norm": 3.626108407974243,
|
|
"learning_rate": 4.69997772315156e-06,
|
|
"loss": 1.9277,
|
|
"mean_token_accuracy": 0.543017354607582,
|
|
"num_tokens": 9244133.0,
|
|
"step": 2560
|
|
},
|
|
{
|
|
"entropy": 1.923046875,
|
|
"epoch": 0.568269762299613,
|
|
"grad_norm": 3.578974723815918,
|
|
"learning_rate": 4.6971168556956344e-06,
|
|
"loss": 1.9463,
|
|
"mean_token_accuracy": 0.532431548833847,
|
|
"num_tokens": 9277380.0,
|
|
"step": 2570
|
|
},
|
|
{
|
|
"entropy": 1.95859375,
|
|
"epoch": 0.5704809286898839,
|
|
"grad_norm": 2.7316198348999023,
|
|
"learning_rate": 4.69424329220865e-06,
|
|
"loss": 1.9567,
|
|
"mean_token_accuracy": 0.5378687530755997,
|
|
"num_tokens": 9313099.0,
|
|
"step": 2580
|
|
},
|
|
{
|
|
"entropy": 1.9796875,
|
|
"epoch": 0.5726920950801547,
|
|
"grad_norm": 3.063166379928589,
|
|
"learning_rate": 4.69135704929548e-06,
|
|
"loss": 1.9925,
|
|
"mean_token_accuracy": 0.5290182754397392,
|
|
"num_tokens": 9350440.0,
|
|
"step": 2590
|
|
},
|
|
{
|
|
"entropy": 1.999609375,
|
|
"epoch": 0.5749032614704257,
|
|
"grad_norm": 3.381293296813965,
|
|
"learning_rate": 4.688458143634269e-06,
|
|
"loss": 1.9803,
|
|
"mean_token_accuracy": 0.5303419068455696,
|
|
"num_tokens": 9387127.0,
|
|
"step": 2600
|
|
},
|
|
{
|
|
"entropy": 2.02109375,
|
|
"epoch": 0.5771144278606966,
|
|
"grad_norm": 3.1944916248321533,
|
|
"learning_rate": 4.685546591976331e-06,
|
|
"loss": 2.0231,
|
|
"mean_token_accuracy": 0.5250900968909263,
|
|
"num_tokens": 9422981.0,
|
|
"step": 2610
|
|
},
|
|
{
|
|
"entropy": 2.004296875,
|
|
"epoch": 0.5793255942509674,
|
|
"grad_norm": 3.9806878566741943,
|
|
"learning_rate": 4.682622411146056e-06,
|
|
"loss": 1.9871,
|
|
"mean_token_accuracy": 0.5325405180454255,
|
|
"num_tokens": 9458541.0,
|
|
"step": 2620
|
|
},
|
|
{
|
|
"entropy": 2.00859375,
|
|
"epoch": 0.5815367606412383,
|
|
"grad_norm": 3.2026121616363525,
|
|
"learning_rate": 4.679685618040812e-06,
|
|
"loss": 2.0316,
|
|
"mean_token_accuracy": 0.5258310928940773,
|
|
"num_tokens": 9495365.0,
|
|
"step": 2630
|
|
},
|
|
{
|
|
"entropy": 1.93046875,
|
|
"epoch": 0.5837479270315091,
|
|
"grad_norm": 3.081270933151245,
|
|
"learning_rate": 4.676736229630846e-06,
|
|
"loss": 1.9394,
|
|
"mean_token_accuracy": 0.5424817472696304,
|
|
"num_tokens": 9533330.0,
|
|
"step": 2640
|
|
},
|
|
{
|
|
"entropy": 1.966015625,
|
|
"epoch": 0.58595909342178,
|
|
"grad_norm": 3.2268669605255127,
|
|
"learning_rate": 4.673774262959186e-06,
|
|
"loss": 1.9853,
|
|
"mean_token_accuracy": 0.5290401428937912,
|
|
"num_tokens": 9567016.0,
|
|
"step": 2650
|
|
},
|
|
{
|
|
"entropy": 1.987890625,
|
|
"epoch": 0.5881702598120508,
|
|
"grad_norm": 3.1565258502960205,
|
|
"learning_rate": 4.6707997351415475e-06,
|
|
"loss": 1.9969,
|
|
"mean_token_accuracy": 0.5264357924461365,
|
|
"num_tokens": 9602519.0,
|
|
"step": 2660
|
|
},
|
|
{
|
|
"entropy": 1.965234375,
|
|
"epoch": 0.5903814262023217,
|
|
"grad_norm": 2.6177172660827637,
|
|
"learning_rate": 4.667812663366225e-06,
|
|
"loss": 1.9691,
|
|
"mean_token_accuracy": 0.5364043325185776,
|
|
"num_tokens": 9639494.0,
|
|
"step": 2670
|
|
},
|
|
{
|
|
"entropy": 1.948046875,
|
|
"epoch": 0.5925925925925926,
|
|
"grad_norm": 3.227576494216919,
|
|
"learning_rate": 4.664813064894002e-06,
|
|
"loss": 1.9758,
|
|
"mean_token_accuracy": 0.5293244972825051,
|
|
"num_tokens": 9675354.0,
|
|
"step": 2680
|
|
},
|
|
{
|
|
"entropy": 1.989453125,
|
|
"epoch": 0.5948037589828634,
|
|
"grad_norm": 2.9756932258605957,
|
|
"learning_rate": 4.661800957058047e-06,
|
|
"loss": 1.975,
|
|
"mean_token_accuracy": 0.5286542773246765,
|
|
"num_tokens": 9711868.0,
|
|
"step": 2690
|
|
},
|
|
{
|
|
"entropy": 1.958203125,
|
|
"epoch": 0.5970149253731343,
|
|
"grad_norm": 3.256072998046875,
|
|
"learning_rate": 4.6587763572638125e-06,
|
|
"loss": 1.9724,
|
|
"mean_token_accuracy": 0.5347406268119812,
|
|
"num_tokens": 9747423.0,
|
|
"step": 2700
|
|
},
|
|
{
|
|
"entropy": 1.95234375,
|
|
"epoch": 0.5992260917634052,
|
|
"grad_norm": 2.700119733810425,
|
|
"learning_rate": 4.655739282988936e-06,
|
|
"loss": 1.988,
|
|
"mean_token_accuracy": 0.5346204385161399,
|
|
"num_tokens": 9782834.0,
|
|
"step": 2710
|
|
},
|
|
{
|
|
"entropy": 1.970703125,
|
|
"epoch": 0.6014372581536761,
|
|
"grad_norm": 2.6439340114593506,
|
|
"learning_rate": 4.65268975178314e-06,
|
|
"loss": 1.9822,
|
|
"mean_token_accuracy": 0.5348147198557853,
|
|
"num_tokens": 9818521.0,
|
|
"step": 2720
|
|
},
|
|
{
|
|
"entropy": 1.955078125,
|
|
"epoch": 0.603648424543947,
|
|
"grad_norm": 3.3310129642486572,
|
|
"learning_rate": 4.649627781268128e-06,
|
|
"loss": 1.9452,
|
|
"mean_token_accuracy": 0.5295668348670006,
|
|
"num_tokens": 9854380.0,
|
|
"step": 2730
|
|
},
|
|
{
|
|
"entropy": 1.9234375,
|
|
"epoch": 0.6058595909342178,
|
|
"grad_norm": 2.8515071868896484,
|
|
"learning_rate": 4.646553389137485e-06,
|
|
"loss": 1.9506,
|
|
"mean_token_accuracy": 0.5384080529212951,
|
|
"num_tokens": 9889161.0,
|
|
"step": 2740
|
|
},
|
|
{
|
|
"entropy": 1.961328125,
|
|
"epoch": 0.6080707573244887,
|
|
"grad_norm": 3.505270004272461,
|
|
"learning_rate": 4.643466593156574e-06,
|
|
"loss": 1.9647,
|
|
"mean_token_accuracy": 0.5331409767270088,
|
|
"num_tokens": 9924964.0,
|
|
"step": 2750
|
|
},
|
|
{
|
|
"entropy": 1.96484375,
|
|
"epoch": 0.6102819237147595,
|
|
"grad_norm": 3.046457529067993,
|
|
"learning_rate": 4.640367411162432e-06,
|
|
"loss": 1.9464,
|
|
"mean_token_accuracy": 0.5367121875286103,
|
|
"num_tokens": 9961067.0,
|
|
"step": 2760
|
|
},
|
|
{
|
|
"entropy": 1.969921875,
|
|
"epoch": 0.6124930901050304,
|
|
"grad_norm": 3.0849227905273438,
|
|
"learning_rate": 4.637255861063672e-06,
|
|
"loss": 1.9546,
|
|
"mean_token_accuracy": 0.5341137796640396,
|
|
"num_tokens": 9999608.0,
|
|
"step": 2770
|
|
},
|
|
{
|
|
"entropy": 1.961328125,
|
|
"epoch": 0.6147042564953012,
|
|
"grad_norm": 3.042711019515991,
|
|
"learning_rate": 4.634131960840371e-06,
|
|
"loss": 1.965,
|
|
"mean_token_accuracy": 0.5323047161102294,
|
|
"num_tokens": 10034892.0,
|
|
"step": 2780
|
|
},
|
|
{
|
|
"entropy": 1.966796875,
|
|
"epoch": 0.6169154228855721,
|
|
"grad_norm": 3.3474748134613037,
|
|
"learning_rate": 4.630995728543977e-06,
|
|
"loss": 1.9494,
|
|
"mean_token_accuracy": 0.5387876823544502,
|
|
"num_tokens": 10068777.0,
|
|
"step": 2790
|
|
},
|
|
{
|
|
"entropy": 1.951953125,
|
|
"epoch": 0.619126589275843,
|
|
"grad_norm": 2.858520984649658,
|
|
"learning_rate": 4.6278471822971945e-06,
|
|
"loss": 1.9723,
|
|
"mean_token_accuracy": 0.5322260513901711,
|
|
"num_tokens": 10104236.0,
|
|
"step": 2800
|
|
},
|
|
{
|
|
"entropy": 1.90859375,
|
|
"epoch": 0.6213377556661138,
|
|
"grad_norm": 3.2176084518432617,
|
|
"learning_rate": 4.624686340293886e-06,
|
|
"loss": 1.9147,
|
|
"mean_token_accuracy": 0.539067667722702,
|
|
"num_tokens": 10142142.0,
|
|
"step": 2810
|
|
},
|
|
{
|
|
"entropy": 1.953515625,
|
|
"epoch": 0.6235489220563848,
|
|
"grad_norm": 2.986359119415283,
|
|
"learning_rate": 4.6215132207989645e-06,
|
|
"loss": 1.96,
|
|
"mean_token_accuracy": 0.5324950978159905,
|
|
"num_tokens": 10179082.0,
|
|
"step": 2820
|
|
},
|
|
{
|
|
"entropy": 1.975390625,
|
|
"epoch": 0.6257600884466556,
|
|
"grad_norm": 2.772944211959839,
|
|
"learning_rate": 4.618327842148288e-06,
|
|
"loss": 1.9624,
|
|
"mean_token_accuracy": 0.533715794980526,
|
|
"num_tokens": 10215443.0,
|
|
"step": 2830
|
|
},
|
|
{
|
|
"entropy": 1.95625,
|
|
"epoch": 0.6279712548369265,
|
|
"grad_norm": 2.8045969009399414,
|
|
"learning_rate": 4.615130222748554e-06,
|
|
"loss": 1.9412,
|
|
"mean_token_accuracy": 0.5376159489154816,
|
|
"num_tokens": 10249725.0,
|
|
"step": 2840
|
|
},
|
|
{
|
|
"entropy": 1.916796875,
|
|
"epoch": 0.6301824212271974,
|
|
"grad_norm": 3.2690083980560303,
|
|
"learning_rate": 4.611920381077194e-06,
|
|
"loss": 1.9125,
|
|
"mean_token_accuracy": 0.5433236837387085,
|
|
"num_tokens": 10285889.0,
|
|
"step": 2850
|
|
},
|
|
{
|
|
"entropy": 1.980859375,
|
|
"epoch": 0.6323935876174682,
|
|
"grad_norm": 3.448453664779663,
|
|
"learning_rate": 4.608698335682266e-06,
|
|
"loss": 2.0185,
|
|
"mean_token_accuracy": 0.5267414793372154,
|
|
"num_tokens": 10321597.0,
|
|
"step": 2860
|
|
},
|
|
{
|
|
"entropy": 1.95703125,
|
|
"epoch": 0.6346047540077391,
|
|
"grad_norm": 3.2905313968658447,
|
|
"learning_rate": 4.6054641051823475e-06,
|
|
"loss": 1.918,
|
|
"mean_token_accuracy": 0.5403017580509186,
|
|
"num_tokens": 10358916.0,
|
|
"step": 2870
|
|
},
|
|
{
|
|
"entropy": 1.89921875,
|
|
"epoch": 0.6368159203980099,
|
|
"grad_norm": 3.1981401443481445,
|
|
"learning_rate": 4.602217708266424e-06,
|
|
"loss": 1.9213,
|
|
"mean_token_accuracy": 0.5386829376220703,
|
|
"num_tokens": 10393262.0,
|
|
"step": 2880
|
|
},
|
|
{
|
|
"entropy": 1.878515625,
|
|
"epoch": 0.6390270867882808,
|
|
"grad_norm": 3.406118631362915,
|
|
"learning_rate": 4.598959163693789e-06,
|
|
"loss": 1.9213,
|
|
"mean_token_accuracy": 0.5412570327520371,
|
|
"num_tokens": 10427612.0,
|
|
"step": 2890
|
|
},
|
|
{
|
|
"entropy": 1.929296875,
|
|
"epoch": 0.6412382531785517,
|
|
"grad_norm": 2.9147799015045166,
|
|
"learning_rate": 4.595688490293929e-06,
|
|
"loss": 1.938,
|
|
"mean_token_accuracy": 0.5343619927763938,
|
|
"num_tokens": 10464389.0,
|
|
"step": 2900
|
|
},
|
|
{
|
|
"entropy": 1.981640625,
|
|
"epoch": 0.6434494195688225,
|
|
"grad_norm": 2.7654571533203125,
|
|
"learning_rate": 4.592405706966417e-06,
|
|
"loss": 1.9866,
|
|
"mean_token_accuracy": 0.5300002068281173,
|
|
"num_tokens": 10503109.0,
|
|
"step": 2910
|
|
},
|
|
{
|
|
"entropy": 1.975390625,
|
|
"epoch": 0.6456605859590934,
|
|
"grad_norm": 3.0418496131896973,
|
|
"learning_rate": 4.5891108326808046e-06,
|
|
"loss": 1.996,
|
|
"mean_token_accuracy": 0.5277341455221176,
|
|
"num_tokens": 10539856.0,
|
|
"step": 2920
|
|
},
|
|
{
|
|
"entropy": 1.933203125,
|
|
"epoch": 0.6478717523493643,
|
|
"grad_norm": 3.482114315032959,
|
|
"learning_rate": 4.585803886476508e-06,
|
|
"loss": 1.9409,
|
|
"mean_token_accuracy": 0.5337098792195321,
|
|
"num_tokens": 10574486.0,
|
|
"step": 2930
|
|
},
|
|
{
|
|
"entropy": 1.929296875,
|
|
"epoch": 0.6500829187396352,
|
|
"grad_norm": 3.4069488048553467,
|
|
"learning_rate": 4.582484887462704e-06,
|
|
"loss": 1.9188,
|
|
"mean_token_accuracy": 0.5414301753044128,
|
|
"num_tokens": 10609416.0,
|
|
"step": 2940
|
|
},
|
|
{
|
|
"entropy": 1.9421875,
|
|
"epoch": 0.652294085129906,
|
|
"grad_norm": 3.3480241298675537,
|
|
"learning_rate": 4.579153854818215e-06,
|
|
"loss": 1.9566,
|
|
"mean_token_accuracy": 0.5342737689614296,
|
|
"num_tokens": 10645800.0,
|
|
"step": 2950
|
|
},
|
|
{
|
|
"entropy": 1.92890625,
|
|
"epoch": 0.6545052515201769,
|
|
"grad_norm": 3.1822264194488525,
|
|
"learning_rate": 4.5758108077914e-06,
|
|
"loss": 1.9536,
|
|
"mean_token_accuracy": 0.5342486649751663,
|
|
"num_tokens": 10682374.0,
|
|
"step": 2960
|
|
},
|
|
{
|
|
"entropy": 1.91640625,
|
|
"epoch": 0.6567164179104478,
|
|
"grad_norm": 3.1464545726776123,
|
|
"learning_rate": 4.572455765700043e-06,
|
|
"loss": 1.9046,
|
|
"mean_token_accuracy": 0.5395681723952294,
|
|
"num_tokens": 10719231.0,
|
|
"step": 2970
|
|
},
|
|
{
|
|
"entropy": 1.8984375,
|
|
"epoch": 0.6589275843007186,
|
|
"grad_norm": 3.3488457202911377,
|
|
"learning_rate": 4.5690887479312415e-06,
|
|
"loss": 1.923,
|
|
"mean_token_accuracy": 0.5402853652834892,
|
|
"num_tokens": 10753444.0,
|
|
"step": 2980
|
|
},
|
|
{
|
|
"entropy": 1.90625,
|
|
"epoch": 0.6611387506909895,
|
|
"grad_norm": 2.9410223960876465,
|
|
"learning_rate": 4.565709773941295e-06,
|
|
"loss": 1.934,
|
|
"mean_token_accuracy": 0.5421337768435478,
|
|
"num_tokens": 10789433.0,
|
|
"step": 2990
|
|
},
|
|
{
|
|
"entropy": 1.994140625,
|
|
"epoch": 0.6633499170812603,
|
|
"grad_norm": 3.083699941635132,
|
|
"learning_rate": 4.5623188632555895e-06,
|
|
"loss": 1.9807,
|
|
"mean_token_accuracy": 0.5336082071065903,
|
|
"num_tokens": 10825994.0,
|
|
"step": 3000
|
|
},
|
|
{
|
|
"epoch": 0.6633499170812603,
|
|
"eval_entropy": 1.9587919776119402,
|
|
"eval_loss": 1.95093834400177,
|
|
"eval_mean_token_accuracy": 0.5356559536646848,
|
|
"eval_num_tokens": 10825994.0,
|
|
"eval_runtime": 111.6228,
|
|
"eval_samples_per_second": 144.057,
|
|
"eval_steps_per_second": 9.004,
|
|
"step": 3000
|
|
},
|
|
{
|
|
"entropy": 1.923828125,
|
|
"epoch": 0.6655610834715312,
|
|
"grad_norm": 3.66687273979187,
|
|
"learning_rate": 4.558916035468492e-06,
|
|
"loss": 1.9437,
|
|
"mean_token_accuracy": 0.5405759528279305,
|
|
"num_tokens": 10860794.0,
|
|
"step": 3010
|
|
},
|
|
{
|
|
"entropy": 1.927734375,
|
|
"epoch": 0.6677722498618021,
|
|
"grad_norm": 3.2094507217407227,
|
|
"learning_rate": 4.555501310243225e-06,
|
|
"loss": 1.9873,
|
|
"mean_token_accuracy": 0.5294178947806358,
|
|
"num_tokens": 10899057.0,
|
|
"step": 3020
|
|
},
|
|
{
|
|
"entropy": 1.956640625,
|
|
"epoch": 0.6699834162520729,
|
|
"grad_norm": 3.5061943531036377,
|
|
"learning_rate": 4.552074707311769e-06,
|
|
"loss": 1.9453,
|
|
"mean_token_accuracy": 0.5383028030395508,
|
|
"num_tokens": 10935790.0,
|
|
"step": 3030
|
|
},
|
|
{
|
|
"entropy": 1.987109375,
|
|
"epoch": 0.6721945826423439,
|
|
"grad_norm": 2.8061094284057617,
|
|
"learning_rate": 4.5486362464747335e-06,
|
|
"loss": 1.9924,
|
|
"mean_token_accuracy": 0.5299150764942169,
|
|
"num_tokens": 10973298.0,
|
|
"step": 3040
|
|
},
|
|
{
|
|
"entropy": 1.97421875,
|
|
"epoch": 0.6744057490326147,
|
|
"grad_norm": 3.6874330043792725,
|
|
"learning_rate": 4.54518594760125e-06,
|
|
"loss": 1.9578,
|
|
"mean_token_accuracy": 0.5319989040493965,
|
|
"num_tokens": 11009753.0,
|
|
"step": 3050
|
|
},
|
|
{
|
|
"entropy": 1.96328125,
|
|
"epoch": 0.6766169154228856,
|
|
"grad_norm": 3.0986382961273193,
|
|
"learning_rate": 4.541723830628859e-06,
|
|
"loss": 1.9535,
|
|
"mean_token_accuracy": 0.5299851894378662,
|
|
"num_tokens": 11045967.0,
|
|
"step": 3060
|
|
},
|
|
{
|
|
"entropy": 1.940625,
|
|
"epoch": 0.6788280818131565,
|
|
"grad_norm": 3.353624105453491,
|
|
"learning_rate": 4.5382499155633895e-06,
|
|
"loss": 1.96,
|
|
"mean_token_accuracy": 0.530767297744751,
|
|
"num_tokens": 11082080.0,
|
|
"step": 3070
|
|
},
|
|
{
|
|
"entropy": 2.008984375,
|
|
"epoch": 0.6810392482034273,
|
|
"grad_norm": 3.0978360176086426,
|
|
"learning_rate": 4.534764222478844e-06,
|
|
"loss": 2.0142,
|
|
"mean_token_accuracy": 0.5247927069664001,
|
|
"num_tokens": 11119010.0,
|
|
"step": 3080
|
|
},
|
|
{
|
|
"entropy": 1.93828125,
|
|
"epoch": 0.6832504145936982,
|
|
"grad_norm": 3.3659987449645996,
|
|
"learning_rate": 4.531266771517287e-06,
|
|
"loss": 1.9362,
|
|
"mean_token_accuracy": 0.5402613162994385,
|
|
"num_tokens": 11155539.0,
|
|
"step": 3090
|
|
},
|
|
{
|
|
"entropy": 1.922265625,
|
|
"epoch": 0.685461580983969,
|
|
"grad_norm": 4.269067287445068,
|
|
"learning_rate": 4.527757582888726e-06,
|
|
"loss": 1.9395,
|
|
"mean_token_accuracy": 0.5363096848130227,
|
|
"num_tokens": 11191454.0,
|
|
"step": 3100
|
|
},
|
|
{
|
|
"entropy": 1.903125,
|
|
"epoch": 0.6876727473742399,
|
|
"grad_norm": 2.4798460006713867,
|
|
"learning_rate": 4.524236676870994e-06,
|
|
"loss": 1.892,
|
|
"mean_token_accuracy": 0.545521354675293,
|
|
"num_tokens": 11227263.0,
|
|
"step": 3110
|
|
},
|
|
{
|
|
"entropy": 1.926953125,
|
|
"epoch": 0.6898839137645107,
|
|
"grad_norm": 3.0905323028564453,
|
|
"learning_rate": 4.520704073809631e-06,
|
|
"loss": 1.9539,
|
|
"mean_token_accuracy": 0.5366878464818001,
|
|
"num_tokens": 11264236.0,
|
|
"step": 3120
|
|
},
|
|
{
|
|
"entropy": 1.905859375,
|
|
"epoch": 0.6920950801547816,
|
|
"grad_norm": 2.794585704803467,
|
|
"learning_rate": 4.51715979411777e-06,
|
|
"loss": 1.8946,
|
|
"mean_token_accuracy": 0.5380493372678756,
|
|
"num_tokens": 11300318.0,
|
|
"step": 3130
|
|
},
|
|
{
|
|
"entropy": 1.9765625,
|
|
"epoch": 0.6943062465450525,
|
|
"grad_norm": 2.948543071746826,
|
|
"learning_rate": 4.513603858276018e-06,
|
|
"loss": 2.0098,
|
|
"mean_token_accuracy": 0.5298963755369186,
|
|
"num_tokens": 11337328.0,
|
|
"step": 3140
|
|
},
|
|
{
|
|
"entropy": 1.9578125,
|
|
"epoch": 0.6965174129353234,
|
|
"grad_norm": 3.3547677993774414,
|
|
"learning_rate": 4.510036286832335e-06,
|
|
"loss": 1.9596,
|
|
"mean_token_accuracy": 0.53755624294281,
|
|
"num_tokens": 11373949.0,
|
|
"step": 3150
|
|
},
|
|
{
|
|
"entropy": 1.959765625,
|
|
"epoch": 0.6987285793255943,
|
|
"grad_norm": 3.0166943073272705,
|
|
"learning_rate": 4.5064571004019195e-06,
|
|
"loss": 1.9246,
|
|
"mean_token_accuracy": 0.5420637220144272,
|
|
"num_tokens": 11408443.0,
|
|
"step": 3160
|
|
},
|
|
{
|
|
"entropy": 1.9796875,
|
|
"epoch": 0.7009397457158651,
|
|
"grad_norm": 3.277949094772339,
|
|
"learning_rate": 4.502866319667086e-06,
|
|
"loss": 1.9714,
|
|
"mean_token_accuracy": 0.5322265028953552,
|
|
"num_tokens": 11445473.0,
|
|
"step": 3170
|
|
},
|
|
{
|
|
"entropy": 1.915625,
|
|
"epoch": 0.703150912106136,
|
|
"grad_norm": 3.3797526359558105,
|
|
"learning_rate": 4.499263965377146e-06,
|
|
"loss": 1.9236,
|
|
"mean_token_accuracy": 0.5380560234189034,
|
|
"num_tokens": 11480259.0,
|
|
"step": 3180
|
|
},
|
|
{
|
|
"entropy": 1.914453125,
|
|
"epoch": 0.7053620784964069,
|
|
"grad_norm": 3.5612270832061768,
|
|
"learning_rate": 4.4956500583482905e-06,
|
|
"loss": 1.9558,
|
|
"mean_token_accuracy": 0.5386397585272789,
|
|
"num_tokens": 11514003.0,
|
|
"step": 3190
|
|
},
|
|
{
|
|
"entropy": 1.888671875,
|
|
"epoch": 0.7075732448866777,
|
|
"grad_norm": 3.2914936542510986,
|
|
"learning_rate": 4.492024619463467e-06,
|
|
"loss": 1.9138,
|
|
"mean_token_accuracy": 0.5368052333593368,
|
|
"num_tokens": 11548624.0,
|
|
"step": 3200
|
|
},
|
|
{
|
|
"entropy": 1.954296875,
|
|
"epoch": 0.7097844112769486,
|
|
"grad_norm": 3.3482491970062256,
|
|
"learning_rate": 4.48838766967226e-06,
|
|
"loss": 1.9551,
|
|
"mean_token_accuracy": 0.5341341644525528,
|
|
"num_tokens": 11584216.0,
|
|
"step": 3210
|
|
},
|
|
{
|
|
"entropy": 1.992578125,
|
|
"epoch": 0.7119955776672194,
|
|
"grad_norm": 3.52199125289917,
|
|
"learning_rate": 4.484739229990766e-06,
|
|
"loss": 2.0123,
|
|
"mean_token_accuracy": 0.5259271785616875,
|
|
"num_tokens": 11621330.0,
|
|
"step": 3220
|
|
},
|
|
{
|
|
"entropy": 1.926171875,
|
|
"epoch": 0.7142067440574903,
|
|
"grad_norm": 3.8549458980560303,
|
|
"learning_rate": 4.481079321501485e-06,
|
|
"loss": 1.9445,
|
|
"mean_token_accuracy": 0.5349083244800568,
|
|
"num_tokens": 11656464.0,
|
|
"step": 3230
|
|
},
|
|
{
|
|
"entropy": 1.91640625,
|
|
"epoch": 0.7164179104477612,
|
|
"grad_norm": 3.172024726867676,
|
|
"learning_rate": 4.47740796535318e-06,
|
|
"loss": 1.9086,
|
|
"mean_token_accuracy": 0.5436216592788696,
|
|
"num_tokens": 11692035.0,
|
|
"step": 3240
|
|
},
|
|
{
|
|
"entropy": 1.941796875,
|
|
"epoch": 0.718629076838032,
|
|
"grad_norm": 3.3799118995666504,
|
|
"learning_rate": 4.473725182760769e-06,
|
|
"loss": 1.9111,
|
|
"mean_token_accuracy": 0.5431932747364044,
|
|
"num_tokens": 11728107.0,
|
|
"step": 3250
|
|
},
|
|
{
|
|
"entropy": 1.968359375,
|
|
"epoch": 0.720840243228303,
|
|
"grad_norm": 3.2504072189331055,
|
|
"learning_rate": 4.470030995005196e-06,
|
|
"loss": 1.9767,
|
|
"mean_token_accuracy": 0.5296573370695115,
|
|
"num_tokens": 11765845.0,
|
|
"step": 3260
|
|
},
|
|
{
|
|
"entropy": 1.967578125,
|
|
"epoch": 0.7230514096185738,
|
|
"grad_norm": 3.507723093032837,
|
|
"learning_rate": 4.466325423433311e-06,
|
|
"loss": 1.9903,
|
|
"mean_token_accuracy": 0.5313287481665612,
|
|
"num_tokens": 11802844.0,
|
|
"step": 3270
|
|
},
|
|
{
|
|
"entropy": 1.958203125,
|
|
"epoch": 0.7252625760088447,
|
|
"grad_norm": 2.964226484298706,
|
|
"learning_rate": 4.462608489457743e-06,
|
|
"loss": 1.9621,
|
|
"mean_token_accuracy": 0.5350794792175293,
|
|
"num_tokens": 11840340.0,
|
|
"step": 3280
|
|
},
|
|
{
|
|
"entropy": 1.90546875,
|
|
"epoch": 0.7274737423991156,
|
|
"grad_norm": 3.484192371368408,
|
|
"learning_rate": 4.458880214556785e-06,
|
|
"loss": 1.9395,
|
|
"mean_token_accuracy": 0.5354994118213654,
|
|
"num_tokens": 11874049.0,
|
|
"step": 3290
|
|
},
|
|
{
|
|
"entropy": 1.880078125,
|
|
"epoch": 0.7296849087893864,
|
|
"grad_norm": 3.1520373821258545,
|
|
"learning_rate": 4.4551406202742535e-06,
|
|
"loss": 1.9135,
|
|
"mean_token_accuracy": 0.5401819556951523,
|
|
"num_tokens": 11909617.0,
|
|
"step": 3300
|
|
},
|
|
{
|
|
"entropy": 1.933203125,
|
|
"epoch": 0.7318960751796573,
|
|
"grad_norm": 3.6023361682891846,
|
|
"learning_rate": 4.451389728219381e-06,
|
|
"loss": 1.9398,
|
|
"mean_token_accuracy": 0.5388837993144989,
|
|
"num_tokens": 11945348.0,
|
|
"step": 3310
|
|
},
|
|
{
|
|
"entropy": 1.940234375,
|
|
"epoch": 0.7341072415699281,
|
|
"grad_norm": 3.2926368713378906,
|
|
"learning_rate": 4.447627560066683e-06,
|
|
"loss": 1.9126,
|
|
"mean_token_accuracy": 0.5391048103570938,
|
|
"num_tokens": 11978508.0,
|
|
"step": 3320
|
|
},
|
|
{
|
|
"entropy": 1.979296875,
|
|
"epoch": 0.736318407960199,
|
|
"grad_norm": 3.710659980773926,
|
|
"learning_rate": 4.443854137555833e-06,
|
|
"loss": 1.9863,
|
|
"mean_token_accuracy": 0.5324991881847382,
|
|
"num_tokens": 12017113.0,
|
|
"step": 3330
|
|
},
|
|
{
|
|
"entropy": 1.895703125,
|
|
"epoch": 0.7385295743504698,
|
|
"grad_norm": 3.240388870239258,
|
|
"learning_rate": 4.440069482491538e-06,
|
|
"loss": 1.9236,
|
|
"mean_token_accuracy": 0.5393800973892212,
|
|
"num_tokens": 12053457.0,
|
|
"step": 3340
|
|
},
|
|
{
|
|
"entropy": 1.930859375,
|
|
"epoch": 0.7407407407407407,
|
|
"grad_norm": 2.951979875564575,
|
|
"learning_rate": 4.436273616743412e-06,
|
|
"loss": 1.9308,
|
|
"mean_token_accuracy": 0.5348971873521805,
|
|
"num_tokens": 12090714.0,
|
|
"step": 3350
|
|
},
|
|
{
|
|
"entropy": 1.916015625,
|
|
"epoch": 0.7429519071310116,
|
|
"grad_norm": 3.0989770889282227,
|
|
"learning_rate": 4.432466562245851e-06,
|
|
"loss": 1.9411,
|
|
"mean_token_accuracy": 0.5346557691693306,
|
|
"num_tokens": 12127624.0,
|
|
"step": 3360
|
|
},
|
|
{
|
|
"entropy": 1.916796875,
|
|
"epoch": 0.7451630735212825,
|
|
"grad_norm": 2.943408727645874,
|
|
"learning_rate": 4.428648340997905e-06,
|
|
"loss": 1.908,
|
|
"mean_token_accuracy": 0.5415560081601143,
|
|
"num_tokens": 12163280.0,
|
|
"step": 3370
|
|
},
|
|
{
|
|
"entropy": 1.94140625,
|
|
"epoch": 0.7473742399115534,
|
|
"grad_norm": 3.1663312911987305,
|
|
"learning_rate": 4.4248189750631475e-06,
|
|
"loss": 1.987,
|
|
"mean_token_accuracy": 0.5312561333179474,
|
|
"num_tokens": 12200609.0,
|
|
"step": 3380
|
|
},
|
|
{
|
|
"entropy": 1.95390625,
|
|
"epoch": 0.7495854063018242,
|
|
"grad_norm": 3.5459885597229004,
|
|
"learning_rate": 4.420978486569557e-06,
|
|
"loss": 1.952,
|
|
"mean_token_accuracy": 0.5332310974597931,
|
|
"num_tokens": 12235337.0,
|
|
"step": 3390
|
|
},
|
|
{
|
|
"entropy": 1.96484375,
|
|
"epoch": 0.7517965726920951,
|
|
"grad_norm": 3.4921398162841797,
|
|
"learning_rate": 4.417126897709379e-06,
|
|
"loss": 1.9421,
|
|
"mean_token_accuracy": 0.5312773406505584,
|
|
"num_tokens": 12271409.0,
|
|
"step": 3400
|
|
},
|
|
{
|
|
"entropy": 1.975390625,
|
|
"epoch": 0.754007739082366,
|
|
"grad_norm": 3.4567480087280273,
|
|
"learning_rate": 4.413264230739007e-06,
|
|
"loss": 1.9968,
|
|
"mean_token_accuracy": 0.526788805425167,
|
|
"num_tokens": 12306986.0,
|
|
"step": 3410
|
|
},
|
|
{
|
|
"entropy": 1.935546875,
|
|
"epoch": 0.7562189054726368,
|
|
"grad_norm": 3.529651403427124,
|
|
"learning_rate": 4.409390507978846e-06,
|
|
"loss": 1.9246,
|
|
"mean_token_accuracy": 0.5403603315353394,
|
|
"num_tokens": 12341721.0,
|
|
"step": 3420
|
|
},
|
|
{
|
|
"entropy": 1.89921875,
|
|
"epoch": 0.7584300718629077,
|
|
"grad_norm": 3.5528626441955566,
|
|
"learning_rate": 4.405505751813186e-06,
|
|
"loss": 1.9017,
|
|
"mean_token_accuracy": 0.5436147466301918,
|
|
"num_tokens": 12376862.0,
|
|
"step": 3430
|
|
},
|
|
{
|
|
"entropy": 1.939453125,
|
|
"epoch": 0.7606412382531785,
|
|
"grad_norm": 3.1853108406066895,
|
|
"learning_rate": 4.401609984690077e-06,
|
|
"loss": 1.9574,
|
|
"mean_token_accuracy": 0.5320401027798652,
|
|
"num_tokens": 12413448.0,
|
|
"step": 3440
|
|
},
|
|
{
|
|
"entropy": 1.914453125,
|
|
"epoch": 0.7628524046434494,
|
|
"grad_norm": 3.595334529876709,
|
|
"learning_rate": 4.3977032291211935e-06,
|
|
"loss": 1.9286,
|
|
"mean_token_accuracy": 0.5395437106490135,
|
|
"num_tokens": 12448425.0,
|
|
"step": 3450
|
|
},
|
|
{
|
|
"entropy": 1.923046875,
|
|
"epoch": 0.7650635710337202,
|
|
"grad_norm": 3.1512863636016846,
|
|
"learning_rate": 4.393785507681707e-06,
|
|
"loss": 1.9097,
|
|
"mean_token_accuracy": 0.5434191063046455,
|
|
"num_tokens": 12483050.0,
|
|
"step": 3460
|
|
},
|
|
{
|
|
"entropy": 1.95234375,
|
|
"epoch": 0.7672747374239911,
|
|
"grad_norm": 3.246129035949707,
|
|
"learning_rate": 4.389856843010154e-06,
|
|
"loss": 1.9747,
|
|
"mean_token_accuracy": 0.5359687626361846,
|
|
"num_tokens": 12519332.0,
|
|
"step": 3470
|
|
},
|
|
{
|
|
"entropy": 1.982421875,
|
|
"epoch": 0.7694859038142621,
|
|
"grad_norm": 3.3705050945281982,
|
|
"learning_rate": 4.38591725780831e-06,
|
|
"loss": 1.984,
|
|
"mean_token_accuracy": 0.5291391164064407,
|
|
"num_tokens": 12557424.0,
|
|
"step": 3480
|
|
},
|
|
{
|
|
"entropy": 1.9296875,
|
|
"epoch": 0.7716970702045329,
|
|
"grad_norm": 3.7661564350128174,
|
|
"learning_rate": 4.381966774841051e-06,
|
|
"loss": 1.9229,
|
|
"mean_token_accuracy": 0.5386329710483551,
|
|
"num_tokens": 12593348.0,
|
|
"step": 3490
|
|
},
|
|
{
|
|
"entropy": 1.90703125,
|
|
"epoch": 0.7739082365948038,
|
|
"grad_norm": 3.2870442867279053,
|
|
"learning_rate": 4.3780054169362285e-06,
|
|
"loss": 1.9325,
|
|
"mean_token_accuracy": 0.5367092192173004,
|
|
"num_tokens": 12629313.0,
|
|
"step": 3500
|
|
},
|
|
{
|
|
"epoch": 0.7739082365948038,
|
|
"eval_entropy": 1.9186178482587064,
|
|
"eval_loss": 1.931942105293274,
|
|
"eval_mean_token_accuracy": 0.538700125021721,
|
|
"eval_num_tokens": 12629313.0,
|
|
"eval_runtime": 111.7968,
|
|
"eval_samples_per_second": 143.832,
|
|
"eval_steps_per_second": 8.99,
|
|
"step": 3500
|
|
},
|
|
{
|
|
"entropy": 1.972265625,
|
|
"epoch": 0.7761194029850746,
|
|
"grad_norm": 2.6008334159851074,
|
|
"learning_rate": 4.374033206984531e-06,
|
|
"loss": 1.9724,
|
|
"mean_token_accuracy": 0.5319897070527076,
|
|
"num_tokens": 12664088.0,
|
|
"step": 3510
|
|
},
|
|
{
|
|
"entropy": 1.9421875,
|
|
"epoch": 0.7783305693753455,
|
|
"grad_norm": 2.7723631858825684,
|
|
"learning_rate": 4.370050167939361e-06,
|
|
"loss": 1.9197,
|
|
"mean_token_accuracy": 0.5419470056891441,
|
|
"num_tokens": 12697507.0,
|
|
"step": 3520
|
|
},
|
|
{
|
|
"entropy": 1.919921875,
|
|
"epoch": 0.7805417357656164,
|
|
"grad_norm": 3.474357843399048,
|
|
"learning_rate": 4.366056322816692e-06,
|
|
"loss": 1.9082,
|
|
"mean_token_accuracy": 0.5425771564245224,
|
|
"num_tokens": 12732612.0,
|
|
"step": 3530
|
|
},
|
|
{
|
|
"entropy": 1.913671875,
|
|
"epoch": 0.7827529021558872,
|
|
"grad_norm": 2.5832314491271973,
|
|
"learning_rate": 4.3620516946949435e-06,
|
|
"loss": 1.948,
|
|
"mean_token_accuracy": 0.5381650015711784,
|
|
"num_tokens": 12769575.0,
|
|
"step": 3540
|
|
},
|
|
{
|
|
"entropy": 1.959765625,
|
|
"epoch": 0.7849640685461581,
|
|
"grad_norm": 3.4367220401763916,
|
|
"learning_rate": 4.358036306714842e-06,
|
|
"loss": 1.9681,
|
|
"mean_token_accuracy": 0.5334075421094895,
|
|
"num_tokens": 12806084.0,
|
|
"step": 3550
|
|
},
|
|
{
|
|
"entropy": 1.897265625,
|
|
"epoch": 0.7871752349364289,
|
|
"grad_norm": 3.8769137859344482,
|
|
"learning_rate": 4.354010182079292e-06,
|
|
"loss": 1.9146,
|
|
"mean_token_accuracy": 0.544142709672451,
|
|
"num_tokens": 12842272.0,
|
|
"step": 3560
|
|
},
|
|
{
|
|
"entropy": 1.908203125,
|
|
"epoch": 0.7893864013266998,
|
|
"grad_norm": 2.88879132270813,
|
|
"learning_rate": 4.3499733440532374e-06,
|
|
"loss": 1.942,
|
|
"mean_token_accuracy": 0.5378496155142785,
|
|
"num_tokens": 12877516.0,
|
|
"step": 3570
|
|
},
|
|
{
|
|
"entropy": 1.9125,
|
|
"epoch": 0.7915975677169707,
|
|
"grad_norm": 2.8685011863708496,
|
|
"learning_rate": 4.3459258159635325e-06,
|
|
"loss": 1.9031,
|
|
"mean_token_accuracy": 0.5425672397017479,
|
|
"num_tokens": 12912744.0,
|
|
"step": 3580
|
|
},
|
|
{
|
|
"entropy": 1.96328125,
|
|
"epoch": 0.7938087341072416,
|
|
"grad_norm": 3.245892286300659,
|
|
"learning_rate": 4.341867621198801e-06,
|
|
"loss": 1.9487,
|
|
"mean_token_accuracy": 0.5353641182184219,
|
|
"num_tokens": 12949814.0,
|
|
"step": 3590
|
|
},
|
|
{
|
|
"entropy": 1.911328125,
|
|
"epoch": 0.7960199004975125,
|
|
"grad_norm": 2.8265836238861084,
|
|
"learning_rate": 4.337798783209307e-06,
|
|
"loss": 1.9322,
|
|
"mean_token_accuracy": 0.5360799193382263,
|
|
"num_tokens": 12985461.0,
|
|
"step": 3600
|
|
},
|
|
{
|
|
"entropy": 1.882421875,
|
|
"epoch": 0.7982310668877833,
|
|
"grad_norm": 3.0406415462493896,
|
|
"learning_rate": 4.333719325506812e-06,
|
|
"loss": 1.8884,
|
|
"mean_token_accuracy": 0.544411626458168,
|
|
"num_tokens": 13020421.0,
|
|
"step": 3610
|
|
},
|
|
{
|
|
"entropy": 1.883203125,
|
|
"epoch": 0.8004422332780542,
|
|
"grad_norm": 3.2346084117889404,
|
|
"learning_rate": 4.329629271664449e-06,
|
|
"loss": 1.8916,
|
|
"mean_token_accuracy": 0.5445612698793412,
|
|
"num_tokens": 13055923.0,
|
|
"step": 3620
|
|
},
|
|
{
|
|
"entropy": 1.880859375,
|
|
"epoch": 0.802653399668325,
|
|
"grad_norm": 3.5634877681732178,
|
|
"learning_rate": 4.325528645316577e-06,
|
|
"loss": 1.893,
|
|
"mean_token_accuracy": 0.5408861741423607,
|
|
"num_tokens": 13088047.0,
|
|
"step": 3630
|
|
},
|
|
{
|
|
"entropy": 1.9953125,
|
|
"epoch": 0.8048645660585959,
|
|
"grad_norm": 4.091281414031982,
|
|
"learning_rate": 4.3214174701586475e-06,
|
|
"loss": 1.9872,
|
|
"mean_token_accuracy": 0.5278794556856156,
|
|
"num_tokens": 13125181.0,
|
|
"step": 3640
|
|
},
|
|
{
|
|
"entropy": 1.8796875,
|
|
"epoch": 0.8070757324488668,
|
|
"grad_norm": 3.1842451095581055,
|
|
"learning_rate": 4.317295769947072e-06,
|
|
"loss": 1.8735,
|
|
"mean_token_accuracy": 0.5462472170591355,
|
|
"num_tokens": 13160783.0,
|
|
"step": 3650
|
|
},
|
|
{
|
|
"entropy": 1.913671875,
|
|
"epoch": 0.8092868988391376,
|
|
"grad_norm": 3.0181612968444824,
|
|
"learning_rate": 4.313163568499078e-06,
|
|
"loss": 1.9256,
|
|
"mean_token_accuracy": 0.538513295352459,
|
|
"num_tokens": 13197813.0,
|
|
"step": 3660
|
|
},
|
|
{
|
|
"entropy": 1.9671875,
|
|
"epoch": 0.8114980652294085,
|
|
"grad_norm": 3.2187881469726562,
|
|
"learning_rate": 4.309020889692576e-06,
|
|
"loss": 1.9489,
|
|
"mean_token_accuracy": 0.5362419620156288,
|
|
"num_tokens": 13232602.0,
|
|
"step": 3670
|
|
},
|
|
{
|
|
"entropy": 1.948828125,
|
|
"epoch": 0.8137092316196793,
|
|
"grad_norm": 3.2021963596343994,
|
|
"learning_rate": 4.304867757466018e-06,
|
|
"loss": 1.9391,
|
|
"mean_token_accuracy": 0.5342616707086563,
|
|
"num_tokens": 13270385.0,
|
|
"step": 3680
|
|
},
|
|
{
|
|
"entropy": 1.90546875,
|
|
"epoch": 0.8159203980099502,
|
|
"grad_norm": 3.773561716079712,
|
|
"learning_rate": 4.300704195818263e-06,
|
|
"loss": 1.9559,
|
|
"mean_token_accuracy": 0.534406827390194,
|
|
"num_tokens": 13308977.0,
|
|
"step": 3690
|
|
},
|
|
{
|
|
"entropy": 1.941015625,
|
|
"epoch": 0.8181315644002212,
|
|
"grad_norm": 3.372133493423462,
|
|
"learning_rate": 4.296530228808436e-06,
|
|
"loss": 1.9726,
|
|
"mean_token_accuracy": 0.5299327090382576,
|
|
"num_tokens": 13347269.0,
|
|
"step": 3700
|
|
},
|
|
{
|
|
"entropy": 1.896875,
|
|
"epoch": 0.820342730790492,
|
|
"grad_norm": 3.5388503074645996,
|
|
"learning_rate": 4.292345880555786e-06,
|
|
"loss": 1.9105,
|
|
"mean_token_accuracy": 0.544195145368576,
|
|
"num_tokens": 13383440.0,
|
|
"step": 3710
|
|
},
|
|
{
|
|
"entropy": 1.955078125,
|
|
"epoch": 0.8225538971807629,
|
|
"grad_norm": 3.185600757598877,
|
|
"learning_rate": 4.288151175239556e-06,
|
|
"loss": 1.9566,
|
|
"mean_token_accuracy": 0.5397349417209625,
|
|
"num_tokens": 13422954.0,
|
|
"step": 3720
|
|
},
|
|
{
|
|
"entropy": 1.95703125,
|
|
"epoch": 0.8247650635710337,
|
|
"grad_norm": 3.4206392765045166,
|
|
"learning_rate": 4.2839461370988315e-06,
|
|
"loss": 1.9675,
|
|
"mean_token_accuracy": 0.5330950111150742,
|
|
"num_tokens": 13458339.0,
|
|
"step": 3730
|
|
},
|
|
{
|
|
"entropy": 1.946484375,
|
|
"epoch": 0.8269762299613046,
|
|
"grad_norm": 3.7486207485198975,
|
|
"learning_rate": 4.279730790432411e-06,
|
|
"loss": 1.9541,
|
|
"mean_token_accuracy": 0.5361742466688156,
|
|
"num_tokens": 13491865.0,
|
|
"step": 3740
|
|
},
|
|
{
|
|
"entropy": 1.932421875,
|
|
"epoch": 0.8291873963515755,
|
|
"grad_norm": 2.8904426097869873,
|
|
"learning_rate": 4.275505159598658e-06,
|
|
"loss": 1.9215,
|
|
"mean_token_accuracy": 0.53859623670578,
|
|
"num_tokens": 13526516.0,
|
|
"step": 3750
|
|
},
|
|
{
|
|
"entropy": 1.884765625,
|
|
"epoch": 0.8313985627418463,
|
|
"grad_norm": 3.151921272277832,
|
|
"learning_rate": 4.271269269015364e-06,
|
|
"loss": 1.8831,
|
|
"mean_token_accuracy": 0.5485805451869965,
|
|
"num_tokens": 13560498.0,
|
|
"step": 3760
|
|
},
|
|
{
|
|
"entropy": 1.940234375,
|
|
"epoch": 0.8336097291321172,
|
|
"grad_norm": 3.5728070735931396,
|
|
"learning_rate": 4.267023143159603e-06,
|
|
"loss": 1.953,
|
|
"mean_token_accuracy": 0.5409418523311615,
|
|
"num_tokens": 13600254.0,
|
|
"step": 3770
|
|
},
|
|
{
|
|
"entropy": 1.940234375,
|
|
"epoch": 0.835820895522388,
|
|
"grad_norm": 2.794917106628418,
|
|
"learning_rate": 4.262766806567601e-06,
|
|
"loss": 1.9375,
|
|
"mean_token_accuracy": 0.5386961862444878,
|
|
"num_tokens": 13637854.0,
|
|
"step": 3780
|
|
},
|
|
{
|
|
"entropy": 1.928515625,
|
|
"epoch": 0.8380320619126589,
|
|
"grad_norm": 3.859802007675171,
|
|
"learning_rate": 4.258500283834578e-06,
|
|
"loss": 1.9547,
|
|
"mean_token_accuracy": 0.5362945303320885,
|
|
"num_tokens": 13674265.0,
|
|
"step": 3790
|
|
},
|
|
{
|
|
"entropy": 1.9703125,
|
|
"epoch": 0.8402432283029297,
|
|
"grad_norm": 3.2604432106018066,
|
|
"learning_rate": 4.254223599614622e-06,
|
|
"loss": 1.9593,
|
|
"mean_token_accuracy": 0.5336057275533677,
|
|
"num_tokens": 13709773.0,
|
|
"step": 3800
|
|
},
|
|
{
|
|
"entropy": 1.96640625,
|
|
"epoch": 0.8424543946932007,
|
|
"grad_norm": 3.8005752563476562,
|
|
"learning_rate": 4.249936778620534e-06,
|
|
"loss": 1.9661,
|
|
"mean_token_accuracy": 0.5298973023891449,
|
|
"num_tokens": 13747984.0,
|
|
"step": 3810
|
|
},
|
|
{
|
|
"entropy": 1.9453125,
|
|
"epoch": 0.8446655610834716,
|
|
"grad_norm": 2.9430394172668457,
|
|
"learning_rate": 4.245639845623692e-06,
|
|
"loss": 1.9317,
|
|
"mean_token_accuracy": 0.5358313575387001,
|
|
"num_tokens": 13784946.0,
|
|
"step": 3820
|
|
},
|
|
{
|
|
"entropy": 1.915234375,
|
|
"epoch": 0.8468767274737424,
|
|
"grad_norm": 3.000013589859009,
|
|
"learning_rate": 4.2413328254539075e-06,
|
|
"loss": 1.9129,
|
|
"mean_token_accuracy": 0.5399297952651978,
|
|
"num_tokens": 13822086.0,
|
|
"step": 3830
|
|
},
|
|
{
|
|
"entropy": 1.87421875,
|
|
"epoch": 0.8490878938640133,
|
|
"grad_norm": 3.1604533195495605,
|
|
"learning_rate": 4.237015742999279e-06,
|
|
"loss": 1.9055,
|
|
"mean_token_accuracy": 0.5383271276950836,
|
|
"num_tokens": 13857226.0,
|
|
"step": 3840
|
|
},
|
|
{
|
|
"entropy": 1.948828125,
|
|
"epoch": 0.8512990602542841,
|
|
"grad_norm": 2.962773084640503,
|
|
"learning_rate": 4.232688623206049e-06,
|
|
"loss": 1.9493,
|
|
"mean_token_accuracy": 0.5346002340316772,
|
|
"num_tokens": 13892604.0,
|
|
"step": 3850
|
|
},
|
|
{
|
|
"entropy": 1.980859375,
|
|
"epoch": 0.853510226644555,
|
|
"grad_norm": 3.5025715827941895,
|
|
"learning_rate": 4.228351491078465e-06,
|
|
"loss": 1.9653,
|
|
"mean_token_accuracy": 0.5344145551323891,
|
|
"num_tokens": 13929221.0,
|
|
"step": 3860
|
|
},
|
|
{
|
|
"entropy": 1.91484375,
|
|
"epoch": 0.8557213930348259,
|
|
"grad_norm": 3.1019279956817627,
|
|
"learning_rate": 4.224004371678626e-06,
|
|
"loss": 1.9284,
|
|
"mean_token_accuracy": 0.5401875883340835,
|
|
"num_tokens": 13964673.0,
|
|
"step": 3870
|
|
},
|
|
{
|
|
"entropy": 1.86875,
|
|
"epoch": 0.8579325594250967,
|
|
"grad_norm": 2.4966201782226562,
|
|
"learning_rate": 4.219647290126344e-06,
|
|
"loss": 1.8904,
|
|
"mean_token_accuracy": 0.5469870507717133,
|
|
"num_tokens": 13998794.0,
|
|
"step": 3880
|
|
},
|
|
{
|
|
"entropy": 1.93359375,
|
|
"epoch": 0.8601437258153676,
|
|
"grad_norm": 3.3688573837280273,
|
|
"learning_rate": 4.215280271598998e-06,
|
|
"loss": 1.9416,
|
|
"mean_token_accuracy": 0.5335712164640427,
|
|
"num_tokens": 14035101.0,
|
|
"step": 3890
|
|
},
|
|
{
|
|
"entropy": 1.926953125,
|
|
"epoch": 0.8623548922056384,
|
|
"grad_norm": 3.4508743286132812,
|
|
"learning_rate": 4.210903341331388e-06,
|
|
"loss": 1.9311,
|
|
"mean_token_accuracy": 0.5424894750118255,
|
|
"num_tokens": 14074359.0,
|
|
"step": 3900
|
|
},
|
|
{
|
|
"entropy": 1.96640625,
|
|
"epoch": 0.8645660585959093,
|
|
"grad_norm": 3.0193846225738525,
|
|
"learning_rate": 4.206516524615587e-06,
|
|
"loss": 2.0008,
|
|
"mean_token_accuracy": 0.5271704345941544,
|
|
"num_tokens": 14113385.0,
|
|
"step": 3910
|
|
},
|
|
{
|
|
"entropy": 1.880859375,
|
|
"epoch": 0.8667772249861803,
|
|
"grad_norm": 2.665515899658203,
|
|
"learning_rate": 4.2021198468007995e-06,
|
|
"loss": 1.8905,
|
|
"mean_token_accuracy": 0.5444725215435028,
|
|
"num_tokens": 14146408.0,
|
|
"step": 3920
|
|
},
|
|
{
|
|
"entropy": 1.89765625,
|
|
"epoch": 0.8689883913764511,
|
|
"grad_norm": 2.620870590209961,
|
|
"learning_rate": 4.1977133332932085e-06,
|
|
"loss": 1.9079,
|
|
"mean_token_accuracy": 0.5405832916498184,
|
|
"num_tokens": 14183631.0,
|
|
"step": 3930
|
|
},
|
|
{
|
|
"entropy": 1.875,
|
|
"epoch": 0.871199557766722,
|
|
"grad_norm": 3.5019686222076416,
|
|
"learning_rate": 4.193297009555838e-06,
|
|
"loss": 1.9105,
|
|
"mean_token_accuracy": 0.5461666271090507,
|
|
"num_tokens": 14217874.0,
|
|
"step": 3940
|
|
},
|
|
{
|
|
"entropy": 1.91796875,
|
|
"epoch": 0.8734107241569928,
|
|
"grad_norm": 3.248090982437134,
|
|
"learning_rate": 4.188870901108395e-06,
|
|
"loss": 1.9667,
|
|
"mean_token_accuracy": 0.5356802776455879,
|
|
"num_tokens": 14255585.0,
|
|
"step": 3950
|
|
},
|
|
{
|
|
"entropy": 1.9375,
|
|
"epoch": 0.8756218905472637,
|
|
"grad_norm": 3.220170021057129,
|
|
"learning_rate": 4.184435033527129e-06,
|
|
"loss": 1.9515,
|
|
"mean_token_accuracy": 0.5346527516841888,
|
|
"num_tokens": 14294042.0,
|
|
"step": 3960
|
|
},
|
|
{
|
|
"entropy": 1.925,
|
|
"epoch": 0.8778330569375346,
|
|
"grad_norm": 3.438251256942749,
|
|
"learning_rate": 4.179989432444686e-06,
|
|
"loss": 1.9107,
|
|
"mean_token_accuracy": 0.5394331067800522,
|
|
"num_tokens": 14331327.0,
|
|
"step": 3970
|
|
},
|
|
{
|
|
"entropy": 1.878125,
|
|
"epoch": 0.8800442233278054,
|
|
"grad_norm": 2.9318506717681885,
|
|
"learning_rate": 4.1755341235499525e-06,
|
|
"loss": 1.8914,
|
|
"mean_token_accuracy": 0.5450169116258621,
|
|
"num_tokens": 14368396.0,
|
|
"step": 3980
|
|
},
|
|
{
|
|
"entropy": 1.86640625,
|
|
"epoch": 0.8822553897180763,
|
|
"grad_norm": 3.39992094039917,
|
|
"learning_rate": 4.171069132587913e-06,
|
|
"loss": 1.8875,
|
|
"mean_token_accuracy": 0.5458775490522385,
|
|
"num_tokens": 14402900.0,
|
|
"step": 3990
|
|
},
|
|
{
|
|
"entropy": 1.90703125,
|
|
"epoch": 0.8844665561083471,
|
|
"grad_norm": 2.5475125312805176,
|
|
"learning_rate": 4.166594485359502e-06,
|
|
"loss": 1.9237,
|
|
"mean_token_accuracy": 0.5404252767562866,
|
|
"num_tokens": 14438729.0,
|
|
"step": 4000
|
|
},
|
|
{
|
|
"epoch": 0.8844665561083471,
|
|
"eval_entropy": 1.9188510572139303,
|
|
"eval_loss": 1.9126449823379517,
|
|
"eval_mean_token_accuracy": 0.5416562696594504,
|
|
"eval_num_tokens": 14438729.0,
|
|
"eval_runtime": 113.3363,
|
|
"eval_samples_per_second": 141.879,
|
|
"eval_steps_per_second": 8.867,
|
|
"step": 4000
|
|
},
|
|
{
|
|
"entropy": 1.955859375,
|
|
"epoch": 0.886677722498618,
|
|
"grad_norm": 3.684173107147217,
|
|
"learning_rate": 4.162110207721448e-06,
|
|
"loss": 1.9558,
|
|
"mean_token_accuracy": 0.535205788910389,
|
|
"num_tokens": 14474574.0,
|
|
"step": 4010
|
|
},
|
|
{
|
|
"entropy": 1.86328125,
|
|
"epoch": 0.8888888888888888,
|
|
"grad_norm": 4.06991720199585,
|
|
"learning_rate": 4.157616325586134e-06,
|
|
"loss": 1.8534,
|
|
"mean_token_accuracy": 0.5511356204748153,
|
|
"num_tokens": 14509862.0,
|
|
"step": 4020
|
|
},
|
|
{
|
|
"entropy": 1.87578125,
|
|
"epoch": 0.8911000552791598,
|
|
"grad_norm": 3.0546224117279053,
|
|
"learning_rate": 4.153112864921439e-06,
|
|
"loss": 1.8977,
|
|
"mean_token_accuracy": 0.5420440047979355,
|
|
"num_tokens": 14546096.0,
|
|
"step": 4030
|
|
},
|
|
{
|
|
"entropy": 1.889453125,
|
|
"epoch": 0.8933112216694307,
|
|
"grad_norm": 3.049771785736084,
|
|
"learning_rate": 4.148599851750593e-06,
|
|
"loss": 1.9036,
|
|
"mean_token_accuracy": 0.5387859135866165,
|
|
"num_tokens": 14583145.0,
|
|
"step": 4040
|
|
},
|
|
{
|
|
"entropy": 1.87265625,
|
|
"epoch": 0.8955223880597015,
|
|
"grad_norm": 3.1174356937408447,
|
|
"learning_rate": 4.144077312152025e-06,
|
|
"loss": 1.8736,
|
|
"mean_token_accuracy": 0.5475644856691361,
|
|
"num_tokens": 14617201.0,
|
|
"step": 4050
|
|
},
|
|
{
|
|
"entropy": 1.8953125,
|
|
"epoch": 0.8977335544499724,
|
|
"grad_norm": 3.402278423309326,
|
|
"learning_rate": 4.139545272259211e-06,
|
|
"loss": 1.9215,
|
|
"mean_token_accuracy": 0.5450775384902954,
|
|
"num_tokens": 14654928.0,
|
|
"step": 4060
|
|
},
|
|
{
|
|
"entropy": 1.919921875,
|
|
"epoch": 0.8999447208402432,
|
|
"grad_norm": 2.925335645675659,
|
|
"learning_rate": 4.1350037582605275e-06,
|
|
"loss": 1.9161,
|
|
"mean_token_accuracy": 0.5423222750425338,
|
|
"num_tokens": 14692049.0,
|
|
"step": 4070
|
|
},
|
|
{
|
|
"entropy": 1.904296875,
|
|
"epoch": 0.9021558872305141,
|
|
"grad_norm": 2.824946641921997,
|
|
"learning_rate": 4.130452796399094e-06,
|
|
"loss": 1.9228,
|
|
"mean_token_accuracy": 0.5353797942399978,
|
|
"num_tokens": 14727602.0,
|
|
"step": 4080
|
|
},
|
|
{
|
|
"entropy": 1.911328125,
|
|
"epoch": 0.904367053620785,
|
|
"grad_norm": 3.9287309646606445,
|
|
"learning_rate": 4.125892412972625e-06,
|
|
"loss": 1.9236,
|
|
"mean_token_accuracy": 0.5360626980662346,
|
|
"num_tokens": 14763216.0,
|
|
"step": 4090
|
|
},
|
|
{
|
|
"entropy": 1.97890625,
|
|
"epoch": 0.9065782200110558,
|
|
"grad_norm": 3.4621336460113525,
|
|
"learning_rate": 4.121322634333279e-06,
|
|
"loss": 1.9513,
|
|
"mean_token_accuracy": 0.5344884380698204,
|
|
"num_tokens": 14799187.0,
|
|
"step": 4100
|
|
},
|
|
{
|
|
"entropy": 1.946875,
|
|
"epoch": 0.9087893864013267,
|
|
"grad_norm": 3.50201678276062,
|
|
"learning_rate": 4.1167434868875045e-06,
|
|
"loss": 1.9309,
|
|
"mean_token_accuracy": 0.5461748734116554,
|
|
"num_tokens": 14837393.0,
|
|
"step": 4110
|
|
},
|
|
{
|
|
"entropy": 1.92265625,
|
|
"epoch": 0.9110005527915975,
|
|
"grad_norm": 3.3906443119049072,
|
|
"learning_rate": 4.112154997095885e-06,
|
|
"loss": 1.9323,
|
|
"mean_token_accuracy": 0.5365500524640083,
|
|
"num_tokens": 14874490.0,
|
|
"step": 4120
|
|
},
|
|
{
|
|
"entropy": 1.860546875,
|
|
"epoch": 0.9132117191818684,
|
|
"grad_norm": 3.8525633811950684,
|
|
"learning_rate": 4.107557191472991e-06,
|
|
"loss": 1.9,
|
|
"mean_token_accuracy": 0.5453802317380905,
|
|
"num_tokens": 14908274.0,
|
|
"step": 4130
|
|
},
|
|
{
|
|
"entropy": 1.880859375,
|
|
"epoch": 0.9154228855721394,
|
|
"grad_norm": 3.2404062747955322,
|
|
"learning_rate": 4.1029500965872265e-06,
|
|
"loss": 1.89,
|
|
"mean_token_accuracy": 0.550041849911213,
|
|
"num_tokens": 14943724.0,
|
|
"step": 4140
|
|
},
|
|
{
|
|
"entropy": 1.91640625,
|
|
"epoch": 0.9176340519624102,
|
|
"grad_norm": 3.3359262943267822,
|
|
"learning_rate": 4.098333739060668e-06,
|
|
"loss": 1.9272,
|
|
"mean_token_accuracy": 0.5448615044355393,
|
|
"num_tokens": 14982306.0,
|
|
"step": 4150
|
|
},
|
|
{
|
|
"entropy": 1.853515625,
|
|
"epoch": 0.9198452183526811,
|
|
"grad_norm": 3.827122926712036,
|
|
"learning_rate": 4.093708145568922e-06,
|
|
"loss": 1.8539,
|
|
"mean_token_accuracy": 0.5497287213802338,
|
|
"num_tokens": 15017396.0,
|
|
"step": 4160
|
|
},
|
|
{
|
|
"entropy": 1.9171875,
|
|
"epoch": 0.9220563847429519,
|
|
"grad_norm": 3.218873977661133,
|
|
"learning_rate": 4.089073342840959e-06,
|
|
"loss": 1.9487,
|
|
"mean_token_accuracy": 0.5369037941098214,
|
|
"num_tokens": 15051623.0,
|
|
"step": 4170
|
|
},
|
|
{
|
|
"entropy": 1.93359375,
|
|
"epoch": 0.9242675511332228,
|
|
"grad_norm": 3.875128984451294,
|
|
"learning_rate": 4.084429357658971e-06,
|
|
"loss": 1.9212,
|
|
"mean_token_accuracy": 0.53728848695755,
|
|
"num_tokens": 15087359.0,
|
|
"step": 4180
|
|
},
|
|
{
|
|
"entropy": 1.931640625,
|
|
"epoch": 0.9264787175234936,
|
|
"grad_norm": 3.1470813751220703,
|
|
"learning_rate": 4.079776216858207e-06,
|
|
"loss": 1.9217,
|
|
"mean_token_accuracy": 0.5414172351360321,
|
|
"num_tokens": 15122844.0,
|
|
"step": 4190
|
|
},
|
|
{
|
|
"entropy": 1.915234375,
|
|
"epoch": 0.9286898839137645,
|
|
"grad_norm": 3.252145528793335,
|
|
"learning_rate": 4.075113947326822e-06,
|
|
"loss": 1.9089,
|
|
"mean_token_accuracy": 0.5462937578558922,
|
|
"num_tokens": 15161239.0,
|
|
"step": 4200
|
|
},
|
|
{
|
|
"entropy": 1.87890625,
|
|
"epoch": 0.9309010503040354,
|
|
"grad_norm": 3.8397457599639893,
|
|
"learning_rate": 4.070442576005723e-06,
|
|
"loss": 1.9349,
|
|
"mean_token_accuracy": 0.5433342188596726,
|
|
"num_tokens": 15197805.0,
|
|
"step": 4210
|
|
},
|
|
{
|
|
"entropy": 1.927734375,
|
|
"epoch": 0.9331122166943062,
|
|
"grad_norm": 3.6428112983703613,
|
|
"learning_rate": 4.065762129888411e-06,
|
|
"loss": 1.9286,
|
|
"mean_token_accuracy": 0.5316698774695396,
|
|
"num_tokens": 15233320.0,
|
|
"step": 4220
|
|
},
|
|
{
|
|
"entropy": 1.9375,
|
|
"epoch": 0.9353233830845771,
|
|
"grad_norm": 3.38865327835083,
|
|
"learning_rate": 4.0610726360208245e-06,
|
|
"loss": 1.9358,
|
|
"mean_token_accuracy": 0.5407742202281952,
|
|
"num_tokens": 15269570.0,
|
|
"step": 4230
|
|
},
|
|
{
|
|
"entropy": 1.91015625,
|
|
"epoch": 0.9375345494748479,
|
|
"grad_norm": 2.5511257648468018,
|
|
"learning_rate": 4.056374121501185e-06,
|
|
"loss": 1.8913,
|
|
"mean_token_accuracy": 0.5450213491916657,
|
|
"num_tokens": 15304083.0,
|
|
"step": 4240
|
|
},
|
|
{
|
|
"entropy": 1.904296875,
|
|
"epoch": 0.9397457158651189,
|
|
"grad_norm": 3.068298578262329,
|
|
"learning_rate": 4.051666613479841e-06,
|
|
"loss": 1.9512,
|
|
"mean_token_accuracy": 0.5351329863071441,
|
|
"num_tokens": 15340576.0,
|
|
"step": 4250
|
|
},
|
|
{
|
|
"entropy": 1.932421875,
|
|
"epoch": 0.9419568822553898,
|
|
"grad_norm": 2.827686309814453,
|
|
"learning_rate": 4.046950139159108e-06,
|
|
"loss": 1.9484,
|
|
"mean_token_accuracy": 0.5355295330286026,
|
|
"num_tokens": 15376857.0,
|
|
"step": 4260
|
|
},
|
|
{
|
|
"entropy": 1.9546875,
|
|
"epoch": 0.9441680486456606,
|
|
"grad_norm": 3.0990796089172363,
|
|
"learning_rate": 4.042224725793116e-06,
|
|
"loss": 1.9464,
|
|
"mean_token_accuracy": 0.5348751246929169,
|
|
"num_tokens": 15414720.0,
|
|
"step": 4270
|
|
},
|
|
{
|
|
"entropy": 1.9421875,
|
|
"epoch": 0.9463792150359315,
|
|
"grad_norm": 3.662965774536133,
|
|
"learning_rate": 4.037490400687646e-06,
|
|
"loss": 1.9251,
|
|
"mean_token_accuracy": 0.5382256016135216,
|
|
"num_tokens": 15450528.0,
|
|
"step": 4280
|
|
},
|
|
{
|
|
"entropy": 1.874609375,
|
|
"epoch": 0.9485903814262023,
|
|
"grad_norm": 3.9825875759124756,
|
|
"learning_rate": 4.032747191199976e-06,
|
|
"loss": 1.8888,
|
|
"mean_token_accuracy": 0.5442078769207,
|
|
"num_tokens": 15487280.0,
|
|
"step": 4290
|
|
},
|
|
{
|
|
"entropy": 1.88125,
|
|
"epoch": 0.9508015478164732,
|
|
"grad_norm": 3.268082857131958,
|
|
"learning_rate": 4.027995124738725e-06,
|
|
"loss": 1.8871,
|
|
"mean_token_accuracy": 0.5460310637950897,
|
|
"num_tokens": 15524367.0,
|
|
"step": 4300
|
|
},
|
|
{
|
|
"entropy": 1.875390625,
|
|
"epoch": 0.953012714206744,
|
|
"grad_norm": 3.111990451812744,
|
|
"learning_rate": 4.023234228763691e-06,
|
|
"loss": 1.8814,
|
|
"mean_token_accuracy": 0.5478014558553695,
|
|
"num_tokens": 15559528.0,
|
|
"step": 4310
|
|
},
|
|
{
|
|
"entropy": 1.8921875,
|
|
"epoch": 0.9552238805970149,
|
|
"grad_norm": 3.305328845977783,
|
|
"learning_rate": 4.018464530785689e-06,
|
|
"loss": 1.908,
|
|
"mean_token_accuracy": 0.5411547064781189,
|
|
"num_tokens": 15596135.0,
|
|
"step": 4320
|
|
},
|
|
{
|
|
"entropy": 1.932421875,
|
|
"epoch": 0.9574350469872858,
|
|
"grad_norm": 3.4154648780822754,
|
|
"learning_rate": 4.013686058366403e-06,
|
|
"loss": 1.9549,
|
|
"mean_token_accuracy": 0.5352584987878799,
|
|
"num_tokens": 15633949.0,
|
|
"step": 4330
|
|
},
|
|
{
|
|
"entropy": 1.9,
|
|
"epoch": 0.9596462133775566,
|
|
"grad_norm": 3.2575430870056152,
|
|
"learning_rate": 4.0088988391182166e-06,
|
|
"loss": 1.9057,
|
|
"mean_token_accuracy": 0.5455828040838242,
|
|
"num_tokens": 15670509.0,
|
|
"step": 4340
|
|
},
|
|
{
|
|
"entropy": 1.89453125,
|
|
"epoch": 0.9618573797678275,
|
|
"grad_norm": 3.0902981758117676,
|
|
"learning_rate": 4.004102900704057e-06,
|
|
"loss": 1.8611,
|
|
"mean_token_accuracy": 0.546709680557251,
|
|
"num_tokens": 15703401.0,
|
|
"step": 4350
|
|
},
|
|
{
|
|
"entropy": 1.935546875,
|
|
"epoch": 0.9640685461580984,
|
|
"grad_norm": 3.510676383972168,
|
|
"learning_rate": 3.999298270837234e-06,
|
|
"loss": 1.9203,
|
|
"mean_token_accuracy": 0.5407052993774414,
|
|
"num_tokens": 15741563.0,
|
|
"step": 4360
|
|
},
|
|
{
|
|
"entropy": 1.87890625,
|
|
"epoch": 0.9662797125483693,
|
|
"grad_norm": 3.798187017440796,
|
|
"learning_rate": 3.994484977281284e-06,
|
|
"loss": 1.8968,
|
|
"mean_token_accuracy": 0.543719370663166,
|
|
"num_tokens": 15776376.0,
|
|
"step": 4370
|
|
},
|
|
{
|
|
"entropy": 1.934375,
|
|
"epoch": 0.9684908789386402,
|
|
"grad_norm": 3.677476644515991,
|
|
"learning_rate": 3.989663047849804e-06,
|
|
"loss": 1.9398,
|
|
"mean_token_accuracy": 0.5404128700494766,
|
|
"num_tokens": 15809463.0,
|
|
"step": 4380
|
|
},
|
|
{
|
|
"entropy": 1.885546875,
|
|
"epoch": 0.970702045328911,
|
|
"grad_norm": 3.044034957885742,
|
|
"learning_rate": 3.9848325104062945e-06,
|
|
"loss": 1.858,
|
|
"mean_token_accuracy": 0.5474234521389008,
|
|
"num_tokens": 15844117.0,
|
|
"step": 4390
|
|
},
|
|
{
|
|
"entropy": 1.879296875,
|
|
"epoch": 0.9729132117191819,
|
|
"grad_norm": 3.2886359691619873,
|
|
"learning_rate": 3.979993392863997e-06,
|
|
"loss": 1.9034,
|
|
"mean_token_accuracy": 0.5416353791952133,
|
|
"num_tokens": 15880493.0,
|
|
"step": 4400
|
|
},
|
|
{
|
|
"entropy": 1.891015625,
|
|
"epoch": 0.9751243781094527,
|
|
"grad_norm": 2.7740585803985596,
|
|
"learning_rate": 3.9751457231857325e-06,
|
|
"loss": 1.8861,
|
|
"mean_token_accuracy": 0.5488071829080582,
|
|
"num_tokens": 15915900.0,
|
|
"step": 4410
|
|
},
|
|
{
|
|
"entropy": 1.91640625,
|
|
"epoch": 0.9773355444997236,
|
|
"grad_norm": 3.2476296424865723,
|
|
"learning_rate": 3.970289529383743e-06,
|
|
"loss": 1.916,
|
|
"mean_token_accuracy": 0.5365955427289009,
|
|
"num_tokens": 15951323.0,
|
|
"step": 4420
|
|
},
|
|
{
|
|
"entropy": 1.889453125,
|
|
"epoch": 0.9795467108899945,
|
|
"grad_norm": 3.1823527812957764,
|
|
"learning_rate": 3.965424839519522e-06,
|
|
"loss": 1.9215,
|
|
"mean_token_accuracy": 0.5389618843793869,
|
|
"num_tokens": 15989555.0,
|
|
"step": 4430
|
|
},
|
|
{
|
|
"entropy": 1.925,
|
|
"epoch": 0.9817578772802653,
|
|
"grad_norm": 3.0395121574401855,
|
|
"learning_rate": 3.960551681703663e-06,
|
|
"loss": 1.9138,
|
|
"mean_token_accuracy": 0.5402269750833512,
|
|
"num_tokens": 16027047.0,
|
|
"step": 4440
|
|
},
|
|
{
|
|
"entropy": 1.915625,
|
|
"epoch": 0.9839690436705362,
|
|
"grad_norm": 3.556783676147461,
|
|
"learning_rate": 3.955670084095687e-06,
|
|
"loss": 1.9283,
|
|
"mean_token_accuracy": 0.5380309224128723,
|
|
"num_tokens": 16062486.0,
|
|
"step": 4450
|
|
},
|
|
{
|
|
"entropy": 1.903515625,
|
|
"epoch": 0.986180210060807,
|
|
"grad_norm": 3.5073933601379395,
|
|
"learning_rate": 3.950780074903889e-06,
|
|
"loss": 1.8993,
|
|
"mean_token_accuracy": 0.5455669865012169,
|
|
"num_tokens": 16096883.0,
|
|
"step": 4460
|
|
},
|
|
{
|
|
"entropy": 1.9203125,
|
|
"epoch": 0.988391376451078,
|
|
"grad_norm": 3.406268835067749,
|
|
"learning_rate": 3.945881682385168e-06,
|
|
"loss": 1.909,
|
|
"mean_token_accuracy": 0.5403860121965408,
|
|
"num_tokens": 16132257.0,
|
|
"step": 4470
|
|
},
|
|
{
|
|
"entropy": 1.864453125,
|
|
"epoch": 0.9906025428413489,
|
|
"grad_norm": 2.83659291267395,
|
|
"learning_rate": 3.940974934844863e-06,
|
|
"loss": 1.8706,
|
|
"mean_token_accuracy": 0.5472238451242447,
|
|
"num_tokens": 16166111.0,
|
|
"step": 4480
|
|
},
|
|
{
|
|
"entropy": 1.8734375,
|
|
"epoch": 0.9928137092316197,
|
|
"grad_norm": 3.039048433303833,
|
|
"learning_rate": 3.936059860636598e-06,
|
|
"loss": 1.8658,
|
|
"mean_token_accuracy": 0.5526719331741333,
|
|
"num_tokens": 16201706.0,
|
|
"step": 4490
|
|
},
|
|
{
|
|
"entropy": 1.92578125,
|
|
"epoch": 0.9950248756218906,
|
|
"grad_norm": 3.3237369060516357,
|
|
"learning_rate": 3.931136488162107e-06,
|
|
"loss": 1.9303,
|
|
"mean_token_accuracy": 0.5338204294443131,
|
|
"num_tokens": 16238439.0,
|
|
"step": 4500
|
|
},
|
|
{
|
|
"epoch": 0.9950248756218906,
|
|
"eval_entropy": 1.8889536691542288,
|
|
"eval_loss": 1.8963500261306763,
|
|
"eval_mean_token_accuracy": 0.5442636843937546,
|
|
"eval_num_tokens": 16238439.0,
|
|
"eval_runtime": 111.8926,
|
|
"eval_samples_per_second": 143.709,
|
|
"eval_steps_per_second": 8.982,
|
|
"step": 4500
|
|
},
|
|
{
|
|
"entropy": 1.896875,
|
|
"epoch": 0.9972360420121614,
|
|
"grad_norm": 3.566272258758545,
|
|
"learning_rate": 3.9262048458710805e-06,
|
|
"loss": 1.9143,
|
|
"mean_token_accuracy": 0.5406926721334457,
|
|
"num_tokens": 16273430.0,
|
|
"step": 4510
|
|
},
|
|
{
|
|
"entropy": 1.876953125,
|
|
"epoch": 0.9994472084024323,
|
|
"grad_norm": 3.7358896732330322,
|
|
"learning_rate": 3.9212649622609935e-06,
|
|
"loss": 1.8669,
|
|
"mean_token_accuracy": 0.5468032449483872,
|
|
"num_tokens": 16309228.0,
|
|
"step": 4520
|
|
},
|
|
{
|
|
"entropy": 1.8511513157894737,
|
|
"epoch": 1.0015478164731897,
|
|
"grad_norm": 3.6489620208740234,
|
|
"learning_rate": 3.916316865876945e-06,
|
|
"loss": 1.8198,
|
|
"mean_token_accuracy": 0.5546513827223527,
|
|
"num_tokens": 16342632.0,
|
|
"step": 4530
|
|
},
|
|
{
|
|
"entropy": 1.79609375,
|
|
"epoch": 1.0037589828634605,
|
|
"grad_norm": 2.5735867023468018,
|
|
"learning_rate": 3.911360585311488e-06,
|
|
"loss": 1.8063,
|
|
"mean_token_accuracy": 0.5635162651538849,
|
|
"num_tokens": 16377784.0,
|
|
"step": 4540
|
|
},
|
|
{
|
|
"entropy": 1.7953125,
|
|
"epoch": 1.0059701492537314,
|
|
"grad_norm": 3.058192729949951,
|
|
"learning_rate": 3.906396149204472e-06,
|
|
"loss": 1.7979,
|
|
"mean_token_accuracy": 0.5593321830034256,
|
|
"num_tokens": 16413036.0,
|
|
"step": 4550
|
|
},
|
|
{
|
|
"entropy": 1.81484375,
|
|
"epoch": 1.0081813156440023,
|
|
"grad_norm": 2.951831102371216,
|
|
"learning_rate": 3.901423586242869e-06,
|
|
"loss": 1.807,
|
|
"mean_token_accuracy": 0.5591068655252457,
|
|
"num_tokens": 16447818.0,
|
|
"step": 4560
|
|
},
|
|
{
|
|
"entropy": 1.78125,
|
|
"epoch": 1.0103924820342731,
|
|
"grad_norm": 3.391406297683716,
|
|
"learning_rate": 3.896442925160618e-06,
|
|
"loss": 1.7729,
|
|
"mean_token_accuracy": 0.5678528934717179,
|
|
"num_tokens": 16480405.0,
|
|
"step": 4570
|
|
},
|
|
{
|
|
"entropy": 1.84609375,
|
|
"epoch": 1.012603648424544,
|
|
"grad_norm": 3.469679594039917,
|
|
"learning_rate": 3.891454194738448e-06,
|
|
"loss": 1.8775,
|
|
"mean_token_accuracy": 0.5478696256875992,
|
|
"num_tokens": 16518289.0,
|
|
"step": 4580
|
|
},
|
|
{
|
|
"entropy": 1.8125,
|
|
"epoch": 1.0148148148148148,
|
|
"grad_norm": 3.23343563079834,
|
|
"learning_rate": 3.886457423803717e-06,
|
|
"loss": 1.8041,
|
|
"mean_token_accuracy": 0.5634237855672837,
|
|
"num_tokens": 16553972.0,
|
|
"step": 4590
|
|
},
|
|
{
|
|
"entropy": 1.8421875,
|
|
"epoch": 1.0170259812050857,
|
|
"grad_norm": 3.8759403228759766,
|
|
"learning_rate": 3.881452641230247e-06,
|
|
"loss": 1.8302,
|
|
"mean_token_accuracy": 0.5579734325408936,
|
|
"num_tokens": 16590488.0,
|
|
"step": 4600
|
|
},
|
|
{
|
|
"entropy": 1.78671875,
|
|
"epoch": 1.0192371475953566,
|
|
"grad_norm": 4.138722896575928,
|
|
"learning_rate": 3.876439875938153e-06,
|
|
"loss": 1.8136,
|
|
"mean_token_accuracy": 0.5557315021753311,
|
|
"num_tokens": 16626299.0,
|
|
"step": 4610
|
|
},
|
|
{
|
|
"entropy": 1.82734375,
|
|
"epoch": 1.0214483139856274,
|
|
"grad_norm": 3.8862240314483643,
|
|
"learning_rate": 3.871419156893681e-06,
|
|
"loss": 1.8279,
|
|
"mean_token_accuracy": 0.5565461277961731,
|
|
"num_tokens": 16660563.0,
|
|
"step": 4620
|
|
},
|
|
{
|
|
"entropy": 1.83125,
|
|
"epoch": 1.0236594803758983,
|
|
"grad_norm": 3.6678528785705566,
|
|
"learning_rate": 3.866390513109035e-06,
|
|
"loss": 1.8117,
|
|
"mean_token_accuracy": 0.5574209183454514,
|
|
"num_tokens": 16697572.0,
|
|
"step": 4630
|
|
},
|
|
{
|
|
"entropy": 1.7890625,
|
|
"epoch": 1.0258706467661691,
|
|
"grad_norm": 3.5637757778167725,
|
|
"learning_rate": 3.861353973642214e-06,
|
|
"loss": 1.7763,
|
|
"mean_token_accuracy": 0.5672460049390793,
|
|
"num_tokens": 16729747.0,
|
|
"step": 4640
|
|
},
|
|
{
|
|
"entropy": 1.821875,
|
|
"epoch": 1.02808181315644,
|
|
"grad_norm": 3.6049387454986572,
|
|
"learning_rate": 3.856309567596842e-06,
|
|
"loss": 1.8432,
|
|
"mean_token_accuracy": 0.5531365409493446,
|
|
"num_tokens": 16768485.0,
|
|
"step": 4650
|
|
},
|
|
{
|
|
"entropy": 1.8109375,
|
|
"epoch": 1.0302929795467108,
|
|
"grad_norm": 3.0019540786743164,
|
|
"learning_rate": 3.851257324121998e-06,
|
|
"loss": 1.7905,
|
|
"mean_token_accuracy": 0.5601180583238602,
|
|
"num_tokens": 16801101.0,
|
|
"step": 4660
|
|
},
|
|
{
|
|
"entropy": 1.860546875,
|
|
"epoch": 1.0325041459369817,
|
|
"grad_norm": 3.290112257003784,
|
|
"learning_rate": 3.84619727241205e-06,
|
|
"loss": 1.8377,
|
|
"mean_token_accuracy": 0.556305718421936,
|
|
"num_tokens": 16837927.0,
|
|
"step": 4670
|
|
},
|
|
{
|
|
"entropy": 1.84375,
|
|
"epoch": 1.0347153123272526,
|
|
"grad_norm": 3.5095109939575195,
|
|
"learning_rate": 3.84112944170649e-06,
|
|
"loss": 1.8221,
|
|
"mean_token_accuracy": 0.5608943462371826,
|
|
"num_tokens": 16877255.0,
|
|
"step": 4680
|
|
},
|
|
{
|
|
"entropy": 1.84296875,
|
|
"epoch": 1.0369264787175234,
|
|
"grad_norm": 3.063561201095581,
|
|
"learning_rate": 3.8360538612897545e-06,
|
|
"loss": 1.8523,
|
|
"mean_token_accuracy": 0.5544700175523758,
|
|
"num_tokens": 16912558.0,
|
|
"step": 4690
|
|
},
|
|
{
|
|
"entropy": 1.7890625,
|
|
"epoch": 1.0391376451077943,
|
|
"grad_norm": 3.295924663543701,
|
|
"learning_rate": 3.830970560491068e-06,
|
|
"loss": 1.809,
|
|
"mean_token_accuracy": 0.560962800681591,
|
|
"num_tokens": 16947956.0,
|
|
"step": 4700
|
|
},
|
|
{
|
|
"entropy": 1.805078125,
|
|
"epoch": 1.0413488114980651,
|
|
"grad_norm": 3.2698428630828857,
|
|
"learning_rate": 3.825879568684261e-06,
|
|
"loss": 1.8197,
|
|
"mean_token_accuracy": 0.5555193990468978,
|
|
"num_tokens": 16982086.0,
|
|
"step": 4710
|
|
},
|
|
{
|
|
"entropy": 1.8015625,
|
|
"epoch": 1.0435599778883362,
|
|
"grad_norm": 3.2953996658325195,
|
|
"learning_rate": 3.820780915287612e-06,
|
|
"loss": 1.7783,
|
|
"mean_token_accuracy": 0.5682111203670501,
|
|
"num_tokens": 17017420.0,
|
|
"step": 4720
|
|
},
|
|
{
|
|
"entropy": 1.80546875,
|
|
"epoch": 1.045771144278607,
|
|
"grad_norm": 3.2186648845672607,
|
|
"learning_rate": 3.815674629763668e-06,
|
|
"loss": 1.8167,
|
|
"mean_token_accuracy": 0.5638742208480835,
|
|
"num_tokens": 17053650.0,
|
|
"step": 4730
|
|
},
|
|
{
|
|
"entropy": 1.801953125,
|
|
"epoch": 1.047982310668878,
|
|
"grad_norm": 3.229968547821045,
|
|
"learning_rate": 3.8105607416190792e-06,
|
|
"loss": 1.8104,
|
|
"mean_token_accuracy": 0.5603099703788758,
|
|
"num_tokens": 17088920.0,
|
|
"step": 4740
|
|
},
|
|
{
|
|
"entropy": 1.78046875,
|
|
"epoch": 1.0501934770591488,
|
|
"grad_norm": 3.861144542694092,
|
|
"learning_rate": 3.8054392804044292e-06,
|
|
"loss": 1.8121,
|
|
"mean_token_accuracy": 0.5570038884878159,
|
|
"num_tokens": 17124495.0,
|
|
"step": 4750
|
|
},
|
|
{
|
|
"entropy": 1.7875,
|
|
"epoch": 1.0524046434494196,
|
|
"grad_norm": 3.1243979930877686,
|
|
"learning_rate": 3.800310275714061e-06,
|
|
"loss": 1.806,
|
|
"mean_token_accuracy": 0.5590326100587845,
|
|
"num_tokens": 17160061.0,
|
|
"step": 4760
|
|
},
|
|
{
|
|
"entropy": 1.82109375,
|
|
"epoch": 1.0546158098396905,
|
|
"grad_norm": 3.517993688583374,
|
|
"learning_rate": 3.795173757185908e-06,
|
|
"loss": 1.8111,
|
|
"mean_token_accuracy": 0.5631527751684189,
|
|
"num_tokens": 17198517.0,
|
|
"step": 4770
|
|
},
|
|
{
|
|
"entropy": 1.79375,
|
|
"epoch": 1.0568269762299614,
|
|
"grad_norm": 3.146130084991455,
|
|
"learning_rate": 3.7900297545013227e-06,
|
|
"loss": 1.7701,
|
|
"mean_token_accuracy": 0.5665472269058227,
|
|
"num_tokens": 17235157.0,
|
|
"step": 4780
|
|
},
|
|
{
|
|
"entropy": 1.7984375,
|
|
"epoch": 1.0590381426202322,
|
|
"grad_norm": 3.4495346546173096,
|
|
"learning_rate": 3.784878297384903e-06,
|
|
"loss": 1.8207,
|
|
"mean_token_accuracy": 0.5569171607494354,
|
|
"num_tokens": 17271144.0,
|
|
"step": 4790
|
|
},
|
|
{
|
|
"entropy": 1.79921875,
|
|
"epoch": 1.061249309010503,
|
|
"grad_norm": 3.2662720680236816,
|
|
"learning_rate": 3.7797194156043248e-06,
|
|
"loss": 1.8235,
|
|
"mean_token_accuracy": 0.5576835155487061,
|
|
"num_tokens": 17308688.0,
|
|
"step": 4800
|
|
},
|
|
{
|
|
"entropy": 1.855859375,
|
|
"epoch": 1.063460475400774,
|
|
"grad_norm": 3.2390568256378174,
|
|
"learning_rate": 3.7745531389701643e-06,
|
|
"loss": 1.8548,
|
|
"mean_token_accuracy": 0.5510483264923096,
|
|
"num_tokens": 17344325.0,
|
|
"step": 4810
|
|
},
|
|
{
|
|
"entropy": 1.83515625,
|
|
"epoch": 1.0656716417910448,
|
|
"grad_norm": 3.697944402694702,
|
|
"learning_rate": 3.7693794973357333e-06,
|
|
"loss": 1.8209,
|
|
"mean_token_accuracy": 0.5602743715047837,
|
|
"num_tokens": 17381118.0,
|
|
"step": 4820
|
|
},
|
|
{
|
|
"entropy": 1.79375,
|
|
"epoch": 1.0678828081813156,
|
|
"grad_norm": 4.086962699890137,
|
|
"learning_rate": 3.7641985205968965e-06,
|
|
"loss": 1.829,
|
|
"mean_token_accuracy": 0.55612932741642,
|
|
"num_tokens": 17415842.0,
|
|
"step": 4830
|
|
},
|
|
{
|
|
"entropy": 1.84609375,
|
|
"epoch": 1.0700939745715865,
|
|
"grad_norm": 3.413696050643921,
|
|
"learning_rate": 3.7590102386919103e-06,
|
|
"loss": 1.8197,
|
|
"mean_token_accuracy": 0.5570108830928803,
|
|
"num_tokens": 17450577.0,
|
|
"step": 4840
|
|
},
|
|
{
|
|
"entropy": 1.81015625,
|
|
"epoch": 1.0723051409618574,
|
|
"grad_norm": 4.149393081665039,
|
|
"learning_rate": 3.753814681601239e-06,
|
|
"loss": 1.7964,
|
|
"mean_token_accuracy": 0.5602624654769898,
|
|
"num_tokens": 17485873.0,
|
|
"step": 4850
|
|
},
|
|
{
|
|
"entropy": 1.81875,
|
|
"epoch": 1.0745163073521282,
|
|
"grad_norm": 3.8652758598327637,
|
|
"learning_rate": 3.74861187934739e-06,
|
|
"loss": 1.8229,
|
|
"mean_token_accuracy": 0.5579535394906998,
|
|
"num_tokens": 17521632.0,
|
|
"step": 4860
|
|
},
|
|
{
|
|
"entropy": 1.762890625,
|
|
"epoch": 1.076727473742399,
|
|
"grad_norm": 3.8266611099243164,
|
|
"learning_rate": 3.743401861994734e-06,
|
|
"loss": 1.772,
|
|
"mean_token_accuracy": 0.5699301362037659,
|
|
"num_tokens": 17555730.0,
|
|
"step": 4870
|
|
},
|
|
{
|
|
"entropy": 1.820703125,
|
|
"epoch": 1.07893864013267,
|
|
"grad_norm": 3.515138626098633,
|
|
"learning_rate": 3.7381846596493376e-06,
|
|
"loss": 1.8096,
|
|
"mean_token_accuracy": 0.5621564239263535,
|
|
"num_tokens": 17588290.0,
|
|
"step": 4880
|
|
},
|
|
{
|
|
"entropy": 1.83984375,
|
|
"epoch": 1.0811498065229408,
|
|
"grad_norm": 3.184519052505493,
|
|
"learning_rate": 3.732960302458783e-06,
|
|
"loss": 1.8267,
|
|
"mean_token_accuracy": 0.5541789025068283,
|
|
"num_tokens": 17623215.0,
|
|
"step": 4890
|
|
},
|
|
{
|
|
"entropy": 1.784375,
|
|
"epoch": 1.0833609729132117,
|
|
"grad_norm": 3.543375253677368,
|
|
"learning_rate": 3.7277288206119972e-06,
|
|
"loss": 1.7937,
|
|
"mean_token_accuracy": 0.5672435730695724,
|
|
"num_tokens": 17661442.0,
|
|
"step": 4900
|
|
},
|
|
{
|
|
"entropy": 1.777734375,
|
|
"epoch": 1.0855721393034825,
|
|
"grad_norm": 2.400563955307007,
|
|
"learning_rate": 3.722490244339078e-06,
|
|
"loss": 1.7696,
|
|
"mean_token_accuracy": 0.5693740874528885,
|
|
"num_tokens": 17695539.0,
|
|
"step": 4910
|
|
},
|
|
{
|
|
"entropy": 1.82109375,
|
|
"epoch": 1.0877833056937534,
|
|
"grad_norm": 3.5872690677642822,
|
|
"learning_rate": 3.7172446039111176e-06,
|
|
"loss": 1.8464,
|
|
"mean_token_accuracy": 0.5561143085360527,
|
|
"num_tokens": 17732548.0,
|
|
"step": 4920
|
|
},
|
|
{
|
|
"entropy": 1.841796875,
|
|
"epoch": 1.0899944720840242,
|
|
"grad_norm": 3.5267386436462402,
|
|
"learning_rate": 3.711991929640028e-06,
|
|
"loss": 1.8415,
|
|
"mean_token_accuracy": 0.557052418589592,
|
|
"num_tokens": 17770185.0,
|
|
"step": 4930
|
|
},
|
|
{
|
|
"entropy": 1.85078125,
|
|
"epoch": 1.092205638474295,
|
|
"grad_norm": 3.6018447875976562,
|
|
"learning_rate": 3.706732251878367e-06,
|
|
"loss": 1.8577,
|
|
"mean_token_accuracy": 0.5492183089256286,
|
|
"num_tokens": 17806898.0,
|
|
"step": 4940
|
|
},
|
|
{
|
|
"entropy": 1.84609375,
|
|
"epoch": 1.0944168048645662,
|
|
"grad_norm": 3.5661914348602295,
|
|
"learning_rate": 3.7014656010191625e-06,
|
|
"loss": 1.8332,
|
|
"mean_token_accuracy": 0.5575710266828537,
|
|
"num_tokens": 17842928.0,
|
|
"step": 4950
|
|
},
|
|
{
|
|
"entropy": 1.832421875,
|
|
"epoch": 1.096627971254837,
|
|
"grad_norm": 3.5708367824554443,
|
|
"learning_rate": 3.6961920074957334e-06,
|
|
"loss": 1.8348,
|
|
"mean_token_accuracy": 0.5552757412195206,
|
|
"num_tokens": 17879708.0,
|
|
"step": 4960
|
|
},
|
|
{
|
|
"entropy": 1.820703125,
|
|
"epoch": 1.0988391376451079,
|
|
"grad_norm": 3.893779993057251,
|
|
"learning_rate": 3.6909115017815224e-06,
|
|
"loss": 1.8328,
|
|
"mean_token_accuracy": 0.5542289972305298,
|
|
"num_tokens": 17917046.0,
|
|
"step": 4970
|
|
},
|
|
{
|
|
"entropy": 1.8421875,
|
|
"epoch": 1.1010503040353787,
|
|
"grad_norm": 4.008321762084961,
|
|
"learning_rate": 3.685624114389908e-06,
|
|
"loss": 1.8503,
|
|
"mean_token_accuracy": 0.5507669001817703,
|
|
"num_tokens": 17954231.0,
|
|
"step": 4980
|
|
},
|
|
{
|
|
"entropy": 1.834765625,
|
|
"epoch": 1.1032614704256496,
|
|
"grad_norm": 3.752816915512085,
|
|
"learning_rate": 3.680329875874038e-06,
|
|
"loss": 1.8375,
|
|
"mean_token_accuracy": 0.5589002639055252,
|
|
"num_tokens": 17990901.0,
|
|
"step": 4990
|
|
},
|
|
{
|
|
"entropy": 1.8140625,
|
|
"epoch": 1.1054726368159205,
|
|
"grad_norm": 3.5049827098846436,
|
|
"learning_rate": 3.6750288168266494e-06,
|
|
"loss": 1.8097,
|
|
"mean_token_accuracy": 0.5603310585021972,
|
|
"num_tokens": 18025966.0,
|
|
"step": 5000
|
|
},
|
|
{
|
|
"epoch": 1.1054726368159205,
|
|
"eval_entropy": 1.830682524875622,
|
|
"eval_loss": 1.883301019668579,
|
|
"eval_mean_token_accuracy": 0.5469028416854232,
|
|
"eval_num_tokens": 18025966.0,
|
|
"eval_runtime": 112.5014,
|
|
"eval_samples_per_second": 142.932,
|
|
"eval_steps_per_second": 8.933,
|
|
"step": 5000
|
|
},
|
|
{
|
|
"entropy": 1.823828125,
|
|
"epoch": 1.1076838032061913,
|
|
"grad_norm": 2.9052512645721436,
|
|
"learning_rate": 3.6697209678798908e-06,
|
|
"loss": 1.832,
|
|
"mean_token_accuracy": 0.5533883243799209,
|
|
"num_tokens": 18061500.0,
|
|
"step": 5010
|
|
},
|
|
{
|
|
"entropy": 1.802734375,
|
|
"epoch": 1.1098949695964622,
|
|
"grad_norm": 2.655911922454834,
|
|
"learning_rate": 3.6644063597051455e-06,
|
|
"loss": 1.8053,
|
|
"mean_token_accuracy": 0.5638729199767113,
|
|
"num_tokens": 18099631.0,
|
|
"step": 5020
|
|
},
|
|
{
|
|
"entropy": 1.80078125,
|
|
"epoch": 1.112106135986733,
|
|
"grad_norm": 2.943432331085205,
|
|
"learning_rate": 3.6590850230128565e-06,
|
|
"loss": 1.7872,
|
|
"mean_token_accuracy": 0.5625256687402725,
|
|
"num_tokens": 18136870.0,
|
|
"step": 5030
|
|
},
|
|
{
|
|
"entropy": 1.83046875,
|
|
"epoch": 1.1143173023770039,
|
|
"grad_norm": 3.210944890975952,
|
|
"learning_rate": 3.653756988552347e-06,
|
|
"loss": 1.8497,
|
|
"mean_token_accuracy": 0.5534161686897278,
|
|
"num_tokens": 18174917.0,
|
|
"step": 5040
|
|
},
|
|
{
|
|
"entropy": 1.8046875,
|
|
"epoch": 1.1165284687672747,
|
|
"grad_norm": 4.036181926727295,
|
|
"learning_rate": 3.6484222871116425e-06,
|
|
"loss": 1.8216,
|
|
"mean_token_accuracy": 0.5570145905017853,
|
|
"num_tokens": 18208148.0,
|
|
"step": 5050
|
|
},
|
|
{
|
|
"entropy": 1.79921875,
|
|
"epoch": 1.1187396351575456,
|
|
"grad_norm": 3.5327327251434326,
|
|
"learning_rate": 3.643080949517296e-06,
|
|
"loss": 1.8097,
|
|
"mean_token_accuracy": 0.5566195756196975,
|
|
"num_tokens": 18244007.0,
|
|
"step": 5060
|
|
},
|
|
{
|
|
"entropy": 1.769140625,
|
|
"epoch": 1.1209508015478165,
|
|
"grad_norm": 2.9146604537963867,
|
|
"learning_rate": 3.637733006634202e-06,
|
|
"loss": 1.779,
|
|
"mean_token_accuracy": 0.5662169039249421,
|
|
"num_tokens": 18279592.0,
|
|
"step": 5070
|
|
},
|
|
{
|
|
"entropy": 1.798046875,
|
|
"epoch": 1.1231619679380873,
|
|
"grad_norm": 3.600449562072754,
|
|
"learning_rate": 3.632378489365431e-06,
|
|
"loss": 1.8051,
|
|
"mean_token_accuracy": 0.5553045645356178,
|
|
"num_tokens": 18313490.0,
|
|
"step": 5080
|
|
},
|
|
{
|
|
"entropy": 1.846484375,
|
|
"epoch": 1.1253731343283582,
|
|
"grad_norm": 3.454976797103882,
|
|
"learning_rate": 3.6270174286520378e-06,
|
|
"loss": 1.8527,
|
|
"mean_token_accuracy": 0.5464070841670037,
|
|
"num_tokens": 18348814.0,
|
|
"step": 5090
|
|
},
|
|
{
|
|
"entropy": 1.82890625,
|
|
"epoch": 1.127584300718629,
|
|
"grad_norm": 3.306880235671997,
|
|
"learning_rate": 3.6216498554728908e-06,
|
|
"loss": 1.8145,
|
|
"mean_token_accuracy": 0.5551435083150864,
|
|
"num_tokens": 18384052.0,
|
|
"step": 5100
|
|
},
|
|
{
|
|
"entropy": 1.824609375,
|
|
"epoch": 1.1297954671088999,
|
|
"grad_norm": 3.2064096927642822,
|
|
"learning_rate": 3.616275800844491e-06,
|
|
"loss": 1.803,
|
|
"mean_token_accuracy": 0.5590496510267258,
|
|
"num_tokens": 18422781.0,
|
|
"step": 5110
|
|
},
|
|
{
|
|
"entropy": 1.831640625,
|
|
"epoch": 1.1320066334991707,
|
|
"grad_norm": 4.38361120223999,
|
|
"learning_rate": 3.6108952958207906e-06,
|
|
"loss": 1.827,
|
|
"mean_token_accuracy": 0.5605113938450813,
|
|
"num_tokens": 18458289.0,
|
|
"step": 5120
|
|
},
|
|
{
|
|
"entropy": 1.787109375,
|
|
"epoch": 1.1342177998894416,
|
|
"grad_norm": 3.2545828819274902,
|
|
"learning_rate": 3.6055083714930185e-06,
|
|
"loss": 1.8133,
|
|
"mean_token_accuracy": 0.5603759199380874,
|
|
"num_tokens": 18496102.0,
|
|
"step": 5130
|
|
},
|
|
{
|
|
"entropy": 1.757421875,
|
|
"epoch": 1.1364289662797125,
|
|
"grad_norm": 2.9343931674957275,
|
|
"learning_rate": 3.600115058989494e-06,
|
|
"loss": 1.7483,
|
|
"mean_token_accuracy": 0.5704005062580109,
|
|
"num_tokens": 18531370.0,
|
|
"step": 5140
|
|
},
|
|
{
|
|
"entropy": 1.808984375,
|
|
"epoch": 1.1386401326699835,
|
|
"grad_norm": 3.281367063522339,
|
|
"learning_rate": 3.5947153894754526e-06,
|
|
"loss": 1.7986,
|
|
"mean_token_accuracy": 0.5598361402750015,
|
|
"num_tokens": 18566106.0,
|
|
"step": 5150
|
|
},
|
|
{
|
|
"entropy": 1.780859375,
|
|
"epoch": 1.1408512990602544,
|
|
"grad_norm": 3.154594898223877,
|
|
"learning_rate": 3.5893093941528633e-06,
|
|
"loss": 1.8011,
|
|
"mean_token_accuracy": 0.5642092615365982,
|
|
"num_tokens": 18600911.0,
|
|
"step": 5160
|
|
},
|
|
{
|
|
"entropy": 1.8234375,
|
|
"epoch": 1.1430624654505253,
|
|
"grad_norm": 3.894033193588257,
|
|
"learning_rate": 3.583897104260249e-06,
|
|
"loss": 1.8459,
|
|
"mean_token_accuracy": 0.5521841764450073,
|
|
"num_tokens": 18637530.0,
|
|
"step": 5170
|
|
},
|
|
{
|
|
"entropy": 1.81328125,
|
|
"epoch": 1.1452736318407961,
|
|
"grad_norm": 3.9591643810272217,
|
|
"learning_rate": 3.5784785510725047e-06,
|
|
"loss": 1.8159,
|
|
"mean_token_accuracy": 0.559244054555893,
|
|
"num_tokens": 18673599.0,
|
|
"step": 5180
|
|
},
|
|
{
|
|
"entropy": 1.72578125,
|
|
"epoch": 1.147484798231067,
|
|
"grad_norm": 3.444801092147827,
|
|
"learning_rate": 3.573053765900719e-06,
|
|
"loss": 1.7214,
|
|
"mean_token_accuracy": 0.5725833803415299,
|
|
"num_tokens": 18707410.0,
|
|
"step": 5190
|
|
},
|
|
{
|
|
"entropy": 1.752734375,
|
|
"epoch": 1.1496959646213378,
|
|
"grad_norm": 3.5314764976501465,
|
|
"learning_rate": 3.567622780091991e-06,
|
|
"loss": 1.7893,
|
|
"mean_token_accuracy": 0.5637159794569016,
|
|
"num_tokens": 18743511.0,
|
|
"step": 5200
|
|
},
|
|
{
|
|
"entropy": 1.788671875,
|
|
"epoch": 1.1519071310116087,
|
|
"grad_norm": 3.3316822052001953,
|
|
"learning_rate": 3.562185625029252e-06,
|
|
"loss": 1.7938,
|
|
"mean_token_accuracy": 0.561698392033577,
|
|
"num_tokens": 18780182.0,
|
|
"step": 5210
|
|
},
|
|
{
|
|
"entropy": 1.79609375,
|
|
"epoch": 1.1541182974018795,
|
|
"grad_norm": 3.647265672683716,
|
|
"learning_rate": 3.55674233213108e-06,
|
|
"loss": 1.801,
|
|
"mean_token_accuracy": 0.5657747179269791,
|
|
"num_tokens": 18814586.0,
|
|
"step": 5220
|
|
},
|
|
{
|
|
"entropy": 1.77734375,
|
|
"epoch": 1.1563294637921504,
|
|
"grad_norm": 3.555049180984497,
|
|
"learning_rate": 3.5512929328515218e-06,
|
|
"loss": 1.8016,
|
|
"mean_token_accuracy": 0.5614618912339211,
|
|
"num_tokens": 18850829.0,
|
|
"step": 5230
|
|
},
|
|
{
|
|
"entropy": 1.818359375,
|
|
"epoch": 1.1585406301824213,
|
|
"grad_norm": 3.3881125450134277,
|
|
"learning_rate": 3.545837458679909e-06,
|
|
"loss": 1.8181,
|
|
"mean_token_accuracy": 0.5577396064996719,
|
|
"num_tokens": 18887329.0,
|
|
"step": 5240
|
|
},
|
|
{
|
|
"entropy": 1.845703125,
|
|
"epoch": 1.1607517965726921,
|
|
"grad_norm": 3.5618348121643066,
|
|
"learning_rate": 3.5403759411406785e-06,
|
|
"loss": 1.869,
|
|
"mean_token_accuracy": 0.5539507746696473,
|
|
"num_tokens": 18923489.0,
|
|
"step": 5250
|
|
},
|
|
{
|
|
"entropy": 1.7921875,
|
|
"epoch": 1.162962962962963,
|
|
"grad_norm": 4.485518455505371,
|
|
"learning_rate": 3.5349084117931874e-06,
|
|
"loss": 1.8019,
|
|
"mean_token_accuracy": 0.5633798271417618,
|
|
"num_tokens": 18960295.0,
|
|
"step": 5260
|
|
},
|
|
{
|
|
"entropy": 1.79921875,
|
|
"epoch": 1.1651741293532338,
|
|
"grad_norm": 3.2539970874786377,
|
|
"learning_rate": 3.529434902231532e-06,
|
|
"loss": 1.7961,
|
|
"mean_token_accuracy": 0.5625804305076599,
|
|
"num_tokens": 18998298.0,
|
|
"step": 5270
|
|
},
|
|
{
|
|
"entropy": 1.8640625,
|
|
"epoch": 1.1673852957435047,
|
|
"grad_norm": 2.906817674636841,
|
|
"learning_rate": 3.523955444084366e-06,
|
|
"loss": 1.859,
|
|
"mean_token_accuracy": 0.5573142901062965,
|
|
"num_tokens": 19038155.0,
|
|
"step": 5280
|
|
},
|
|
{
|
|
"entropy": 1.841796875,
|
|
"epoch": 1.1695964621337755,
|
|
"grad_norm": 3.7016377449035645,
|
|
"learning_rate": 3.518470069014717e-06,
|
|
"loss": 1.8137,
|
|
"mean_token_accuracy": 0.5588720053434372,
|
|
"num_tokens": 19074231.0,
|
|
"step": 5290
|
|
},
|
|
{
|
|
"entropy": 1.803515625,
|
|
"epoch": 1.1718076285240464,
|
|
"grad_norm": 3.9876022338867188,
|
|
"learning_rate": 3.5129788087198025e-06,
|
|
"loss": 1.81,
|
|
"mean_token_accuracy": 0.5592465251684189,
|
|
"num_tokens": 19107823.0,
|
|
"step": 5300
|
|
},
|
|
{
|
|
"entropy": 1.8046875,
|
|
"epoch": 1.1740187949143173,
|
|
"grad_norm": 3.647291660308838,
|
|
"learning_rate": 3.507481694930848e-06,
|
|
"loss": 1.8432,
|
|
"mean_token_accuracy": 0.553630281984806,
|
|
"num_tokens": 19142032.0,
|
|
"step": 5310
|
|
},
|
|
{
|
|
"entropy": 1.79140625,
|
|
"epoch": 1.1762299613045881,
|
|
"grad_norm": 3.6309502124786377,
|
|
"learning_rate": 3.501978759412905e-06,
|
|
"loss": 1.7851,
|
|
"mean_token_accuracy": 0.5666571229696273,
|
|
"num_tokens": 19178386.0,
|
|
"step": 5320
|
|
},
|
|
{
|
|
"entropy": 1.780859375,
|
|
"epoch": 1.178441127694859,
|
|
"grad_norm": 3.1592068672180176,
|
|
"learning_rate": 3.496470033964664e-06,
|
|
"loss": 1.784,
|
|
"mean_token_accuracy": 0.5650387316942215,
|
|
"num_tokens": 19213272.0,
|
|
"step": 5330
|
|
},
|
|
{
|
|
"entropy": 1.76171875,
|
|
"epoch": 1.1806522940851298,
|
|
"grad_norm": 3.9811642169952393,
|
|
"learning_rate": 3.490955550418273e-06,
|
|
"loss": 1.7796,
|
|
"mean_token_accuracy": 0.5650362581014633,
|
|
"num_tokens": 19251027.0,
|
|
"step": 5340
|
|
},
|
|
{
|
|
"entropy": 1.78359375,
|
|
"epoch": 1.1828634604754007,
|
|
"grad_norm": 2.9762301445007324,
|
|
"learning_rate": 3.4854353406391537e-06,
|
|
"loss": 1.8024,
|
|
"mean_token_accuracy": 0.5604519486427307,
|
|
"num_tokens": 19288319.0,
|
|
"step": 5350
|
|
},
|
|
{
|
|
"entropy": 1.823828125,
|
|
"epoch": 1.1850746268656716,
|
|
"grad_norm": 4.1221442222595215,
|
|
"learning_rate": 3.4799094365258167e-06,
|
|
"loss": 1.8169,
|
|
"mean_token_accuracy": 0.5621909618377685,
|
|
"num_tokens": 19324331.0,
|
|
"step": 5360
|
|
},
|
|
{
|
|
"entropy": 1.808984375,
|
|
"epoch": 1.1872857932559424,
|
|
"grad_norm": 3.697798728942871,
|
|
"learning_rate": 3.474377870009677e-06,
|
|
"loss": 1.7966,
|
|
"mean_token_accuracy": 0.5626327961683273,
|
|
"num_tokens": 19360976.0,
|
|
"step": 5370
|
|
},
|
|
{
|
|
"entropy": 1.8359375,
|
|
"epoch": 1.1894969596462133,
|
|
"grad_norm": 3.584628105163574,
|
|
"learning_rate": 3.4688406730548684e-06,
|
|
"loss": 1.8198,
|
|
"mean_token_accuracy": 0.5556138277053833,
|
|
"num_tokens": 19397361.0,
|
|
"step": 5380
|
|
},
|
|
{
|
|
"entropy": 1.805859375,
|
|
"epoch": 1.1917081260364841,
|
|
"grad_norm": 3.491758108139038,
|
|
"learning_rate": 3.463297877658064e-06,
|
|
"loss": 1.828,
|
|
"mean_token_accuracy": 0.5600568175315856,
|
|
"num_tokens": 19432274.0,
|
|
"step": 5390
|
|
},
|
|
{
|
|
"entropy": 1.77421875,
|
|
"epoch": 1.1939192924267552,
|
|
"grad_norm": 3.0235788822174072,
|
|
"learning_rate": 3.4577495158482833e-06,
|
|
"loss": 1.7774,
|
|
"mean_token_accuracy": 0.5672204285860062,
|
|
"num_tokens": 19468071.0,
|
|
"step": 5400
|
|
},
|
|
{
|
|
"entropy": 1.81484375,
|
|
"epoch": 1.196130458817026,
|
|
"grad_norm": 3.516422748565674,
|
|
"learning_rate": 3.4521956196867142e-06,
|
|
"loss": 1.8107,
|
|
"mean_token_accuracy": 0.555186653137207,
|
|
"num_tokens": 19504784.0,
|
|
"step": 5410
|
|
},
|
|
{
|
|
"entropy": 1.780078125,
|
|
"epoch": 1.198341625207297,
|
|
"grad_norm": 3.161365270614624,
|
|
"learning_rate": 3.446636221266522e-06,
|
|
"loss": 1.727,
|
|
"mean_token_accuracy": 0.5710610717535018,
|
|
"num_tokens": 19542273.0,
|
|
"step": 5420
|
|
},
|
|
{
|
|
"entropy": 1.771484375,
|
|
"epoch": 1.2005527915975678,
|
|
"grad_norm": 3.771331548690796,
|
|
"learning_rate": 3.441071352712671e-06,
|
|
"loss": 1.8075,
|
|
"mean_token_accuracy": 0.5596056699752807,
|
|
"num_tokens": 19579922.0,
|
|
"step": 5430
|
|
},
|
|
{
|
|
"entropy": 1.778515625,
|
|
"epoch": 1.2027639579878386,
|
|
"grad_norm": 3.280606985092163,
|
|
"learning_rate": 3.4355010461817294e-06,
|
|
"loss": 1.782,
|
|
"mean_token_accuracy": 0.5591793596744538,
|
|
"num_tokens": 19612440.0,
|
|
"step": 5440
|
|
},
|
|
{
|
|
"entropy": 1.773046875,
|
|
"epoch": 1.2049751243781095,
|
|
"grad_norm": 4.4035964012146,
|
|
"learning_rate": 3.429925333861694e-06,
|
|
"loss": 1.7861,
|
|
"mean_token_accuracy": 0.5663846373558045,
|
|
"num_tokens": 19647112.0,
|
|
"step": 5450
|
|
},
|
|
{
|
|
"entropy": 1.808984375,
|
|
"epoch": 1.2071862907683804,
|
|
"grad_norm": 3.805811882019043,
|
|
"learning_rate": 3.4243442479717946e-06,
|
|
"loss": 1.8182,
|
|
"mean_token_accuracy": 0.5621969848871231,
|
|
"num_tokens": 19682780.0,
|
|
"step": 5460
|
|
},
|
|
{
|
|
"entropy": 1.80234375,
|
|
"epoch": 1.2093974571586512,
|
|
"grad_norm": 3.3051345348358154,
|
|
"learning_rate": 3.418757820762314e-06,
|
|
"loss": 1.7893,
|
|
"mean_token_accuracy": 0.5610921829938889,
|
|
"num_tokens": 19718444.0,
|
|
"step": 5470
|
|
},
|
|
{
|
|
"entropy": 1.771484375,
|
|
"epoch": 1.211608623548922,
|
|
"grad_norm": 3.6130034923553467,
|
|
"learning_rate": 3.413166084514401e-06,
|
|
"loss": 1.7735,
|
|
"mean_token_accuracy": 0.5692863404750824,
|
|
"num_tokens": 19752855.0,
|
|
"step": 5480
|
|
},
|
|
{
|
|
"entropy": 1.830859375,
|
|
"epoch": 1.213819789939193,
|
|
"grad_norm": 3.5256946086883545,
|
|
"learning_rate": 3.4075690715398805e-06,
|
|
"loss": 1.8405,
|
|
"mean_token_accuracy": 0.5547150656580925,
|
|
"num_tokens": 19790002.0,
|
|
"step": 5490
|
|
},
|
|
{
|
|
"entropy": 1.8203125,
|
|
"epoch": 1.2160309563294638,
|
|
"grad_norm": 3.3252151012420654,
|
|
"learning_rate": 3.40196681418107e-06,
|
|
"loss": 1.8203,
|
|
"mean_token_accuracy": 0.5584905654191971,
|
|
"num_tokens": 19825980.0,
|
|
"step": 5500
|
|
},
|
|
{
|
|
"epoch": 1.2160309563294638,
|
|
"eval_entropy": 1.8066231343283583,
|
|
"eval_loss": 1.869123101234436,
|
|
"eval_mean_token_accuracy": 0.5496349883316761,
|
|
"eval_num_tokens": 19825980.0,
|
|
"eval_runtime": 111.7076,
|
|
"eval_samples_per_second": 143.947,
|
|
"eval_steps_per_second": 8.997,
|
|
"step": 5500
|
|
},
|
|
{
|
|
"entropy": 1.76015625,
|
|
"epoch": 1.2182421227197346,
|
|
"grad_norm": 3.64263916015625,
|
|
"learning_rate": 3.396359344810592e-06,
|
|
"loss": 1.7585,
|
|
"mean_token_accuracy": 0.5672214716672898,
|
|
"num_tokens": 19861453.0,
|
|
"step": 5510
|
|
},
|
|
{
|
|
"entropy": 1.76953125,
|
|
"epoch": 1.2204532891100055,
|
|
"grad_norm": 3.128525495529175,
|
|
"learning_rate": 3.3907466958311846e-06,
|
|
"loss": 1.7931,
|
|
"mean_token_accuracy": 0.566547179222107,
|
|
"num_tokens": 19896058.0,
|
|
"step": 5520
|
|
},
|
|
{
|
|
"entropy": 1.850390625,
|
|
"epoch": 1.2226644555002764,
|
|
"grad_norm": 3.4977822303771973,
|
|
"learning_rate": 3.3851288996755193e-06,
|
|
"loss": 1.8366,
|
|
"mean_token_accuracy": 0.5531932085752487,
|
|
"num_tokens": 19936661.0,
|
|
"step": 5530
|
|
},
|
|
{
|
|
"entropy": 1.800390625,
|
|
"epoch": 1.2248756218905472,
|
|
"grad_norm": 3.7290360927581787,
|
|
"learning_rate": 3.379505988806008e-06,
|
|
"loss": 1.7962,
|
|
"mean_token_accuracy": 0.5639491826295853,
|
|
"num_tokens": 19972406.0,
|
|
"step": 5540
|
|
},
|
|
{
|
|
"entropy": 1.756640625,
|
|
"epoch": 1.227086788280818,
|
|
"grad_norm": 3.9299118518829346,
|
|
"learning_rate": 3.3738779957146196e-06,
|
|
"loss": 1.7905,
|
|
"mean_token_accuracy": 0.5627733021974564,
|
|
"num_tokens": 20007813.0,
|
|
"step": 5550
|
|
},
|
|
{
|
|
"entropy": 1.812890625,
|
|
"epoch": 1.229297954671089,
|
|
"grad_norm": 4.079070568084717,
|
|
"learning_rate": 3.3682449529226897e-06,
|
|
"loss": 1.8171,
|
|
"mean_token_accuracy": 0.554118487238884,
|
|
"num_tokens": 20042753.0,
|
|
"step": 5560
|
|
},
|
|
{
|
|
"entropy": 1.809765625,
|
|
"epoch": 1.2315091210613598,
|
|
"grad_norm": 3.5342938899993896,
|
|
"learning_rate": 3.362606892980733e-06,
|
|
"loss": 1.8012,
|
|
"mean_token_accuracy": 0.5551428779959678,
|
|
"num_tokens": 20080692.0,
|
|
"step": 5570
|
|
},
|
|
{
|
|
"entropy": 1.749609375,
|
|
"epoch": 1.2337202874516306,
|
|
"grad_norm": 3.0421226024627686,
|
|
"learning_rate": 3.356963848468257e-06,
|
|
"loss": 1.7314,
|
|
"mean_token_accuracy": 0.572898530960083,
|
|
"num_tokens": 20115150.0,
|
|
"step": 5580
|
|
},
|
|
{
|
|
"entropy": 1.803515625,
|
|
"epoch": 1.2359314538419015,
|
|
"grad_norm": 3.638065814971924,
|
|
"learning_rate": 3.3513158519935735e-06,
|
|
"loss": 1.8239,
|
|
"mean_token_accuracy": 0.5563164204359055,
|
|
"num_tokens": 20149279.0,
|
|
"step": 5590
|
|
},
|
|
{
|
|
"entropy": 1.788671875,
|
|
"epoch": 1.2381426202321726,
|
|
"grad_norm": 3.0333824157714844,
|
|
"learning_rate": 3.3456629361936057e-06,
|
|
"loss": 1.8222,
|
|
"mean_token_accuracy": 0.5578877419233322,
|
|
"num_tokens": 20183175.0,
|
|
"step": 5600
|
|
},
|
|
{
|
|
"entropy": 1.802734375,
|
|
"epoch": 1.2403537866224434,
|
|
"grad_norm": 3.4787251949310303,
|
|
"learning_rate": 3.3400051337337064e-06,
|
|
"loss": 1.7951,
|
|
"mean_token_accuracy": 0.5597830682992935,
|
|
"num_tokens": 20221094.0,
|
|
"step": 5610
|
|
},
|
|
{
|
|
"entropy": 1.801171875,
|
|
"epoch": 1.2425649530127143,
|
|
"grad_norm": 3.272167205810547,
|
|
"learning_rate": 3.3343424773074647e-06,
|
|
"loss": 1.7667,
|
|
"mean_token_accuracy": 0.5651083737611771,
|
|
"num_tokens": 20257020.0,
|
|
"step": 5620
|
|
},
|
|
{
|
|
"entropy": 1.723046875,
|
|
"epoch": 1.2447761194029852,
|
|
"grad_norm": 3.5526514053344727,
|
|
"learning_rate": 3.3286749996365174e-06,
|
|
"loss": 1.7662,
|
|
"mean_token_accuracy": 0.5635533422231674,
|
|
"num_tokens": 20294081.0,
|
|
"step": 5630
|
|
},
|
|
{
|
|
"entropy": 1.804296875,
|
|
"epoch": 1.246987285793256,
|
|
"grad_norm": 3.399162530899048,
|
|
"learning_rate": 3.3230027334703627e-06,
|
|
"loss": 1.8339,
|
|
"mean_token_accuracy": 0.5531530886888504,
|
|
"num_tokens": 20329917.0,
|
|
"step": 5640
|
|
},
|
|
{
|
|
"entropy": 1.803515625,
|
|
"epoch": 1.2491984521835269,
|
|
"grad_norm": 3.286513328552246,
|
|
"learning_rate": 3.317325711586169e-06,
|
|
"loss": 1.7907,
|
|
"mean_token_accuracy": 0.5630396157503128,
|
|
"num_tokens": 20365963.0,
|
|
"step": 5650
|
|
},
|
|
{
|
|
"entropy": 1.78984375,
|
|
"epoch": 1.2514096185737977,
|
|
"grad_norm": 3.615518808364868,
|
|
"learning_rate": 3.3116439667885824e-06,
|
|
"loss": 1.8202,
|
|
"mean_token_accuracy": 0.5621116042137146,
|
|
"num_tokens": 20400775.0,
|
|
"step": 5660
|
|
},
|
|
{
|
|
"entropy": 1.805859375,
|
|
"epoch": 1.2536207849640686,
|
|
"grad_norm": 4.013845443725586,
|
|
"learning_rate": 3.3059575319095457e-06,
|
|
"loss": 1.8051,
|
|
"mean_token_accuracy": 0.555592519044876,
|
|
"num_tokens": 20436053.0,
|
|
"step": 5670
|
|
},
|
|
{
|
|
"entropy": 1.81484375,
|
|
"epoch": 1.2558319513543394,
|
|
"grad_norm": 3.2020750045776367,
|
|
"learning_rate": 3.3002664398080973e-06,
|
|
"loss": 1.7957,
|
|
"mean_token_accuracy": 0.5647481322288513,
|
|
"num_tokens": 20472992.0,
|
|
"step": 5680
|
|
},
|
|
{
|
|
"entropy": 1.7765625,
|
|
"epoch": 1.2580431177446103,
|
|
"grad_norm": 3.5436997413635254,
|
|
"learning_rate": 3.2945707233701928e-06,
|
|
"loss": 1.7963,
|
|
"mean_token_accuracy": 0.5634588420391082,
|
|
"num_tokens": 20511290.0,
|
|
"step": 5690
|
|
},
|
|
{
|
|
"entropy": 1.77734375,
|
|
"epoch": 1.2602542841348812,
|
|
"grad_norm": 2.98034930229187,
|
|
"learning_rate": 3.288870415508506e-06,
|
|
"loss": 1.7743,
|
|
"mean_token_accuracy": 0.5676083490252495,
|
|
"num_tokens": 20546413.0,
|
|
"step": 5700
|
|
},
|
|
{
|
|
"entropy": 1.77421875,
|
|
"epoch": 1.262465450525152,
|
|
"grad_norm": 2.8382561206817627,
|
|
"learning_rate": 3.2831655491622433e-06,
|
|
"loss": 1.7743,
|
|
"mean_token_accuracy": 0.5654417097568512,
|
|
"num_tokens": 20580819.0,
|
|
"step": 5710
|
|
},
|
|
{
|
|
"entropy": 1.786328125,
|
|
"epoch": 1.2646766169154229,
|
|
"grad_norm": 3.536799669265747,
|
|
"learning_rate": 3.2774561572969533e-06,
|
|
"loss": 1.7819,
|
|
"mean_token_accuracy": 0.5645060062408447,
|
|
"num_tokens": 20618012.0,
|
|
"step": 5720
|
|
},
|
|
{
|
|
"entropy": 1.81171875,
|
|
"epoch": 1.2668877833056937,
|
|
"grad_norm": 3.211913585662842,
|
|
"learning_rate": 3.2717422729043326e-06,
|
|
"loss": 1.7804,
|
|
"mean_token_accuracy": 0.5650122970342636,
|
|
"num_tokens": 20654813.0,
|
|
"step": 5730
|
|
},
|
|
{
|
|
"entropy": 1.774609375,
|
|
"epoch": 1.2690989496959646,
|
|
"grad_norm": 3.6548187732696533,
|
|
"learning_rate": 3.2660239290020414e-06,
|
|
"loss": 1.7591,
|
|
"mean_token_accuracy": 0.5687688261270523,
|
|
"num_tokens": 20691862.0,
|
|
"step": 5740
|
|
},
|
|
{
|
|
"entropy": 1.816015625,
|
|
"epoch": 1.2713101160862355,
|
|
"grad_norm": 3.761094331741333,
|
|
"learning_rate": 3.260301158633506e-06,
|
|
"loss": 1.8209,
|
|
"mean_token_accuracy": 0.5604167640209198,
|
|
"num_tokens": 20729050.0,
|
|
"step": 5750
|
|
},
|
|
{
|
|
"entropy": 1.7953125,
|
|
"epoch": 1.2735212824765063,
|
|
"grad_norm": 3.6631155014038086,
|
|
"learning_rate": 3.2545739948677328e-06,
|
|
"loss": 1.8152,
|
|
"mean_token_accuracy": 0.5569219946861267,
|
|
"num_tokens": 20765868.0,
|
|
"step": 5760
|
|
},
|
|
{
|
|
"entropy": 1.8265625,
|
|
"epoch": 1.2757324488667772,
|
|
"grad_norm": 3.5497615337371826,
|
|
"learning_rate": 3.2488424707991153e-06,
|
|
"loss": 1.8175,
|
|
"mean_token_accuracy": 0.5578499391674996,
|
|
"num_tokens": 20800811.0,
|
|
"step": 5770
|
|
},
|
|
{
|
|
"entropy": 1.827734375,
|
|
"epoch": 1.277943615257048,
|
|
"grad_norm": 3.3413047790527344,
|
|
"learning_rate": 3.243106619547242e-06,
|
|
"loss": 1.7848,
|
|
"mean_token_accuracy": 0.5605043083429336,
|
|
"num_tokens": 20839108.0,
|
|
"step": 5780
|
|
},
|
|
{
|
|
"entropy": 1.81484375,
|
|
"epoch": 1.2801547816473189,
|
|
"grad_norm": 3.638014793395996,
|
|
"learning_rate": 3.2373664742567067e-06,
|
|
"loss": 1.7985,
|
|
"mean_token_accuracy": 0.5557990193367004,
|
|
"num_tokens": 20875954.0,
|
|
"step": 5790
|
|
},
|
|
{
|
|
"entropy": 1.780078125,
|
|
"epoch": 1.2823659480375897,
|
|
"grad_norm": 4.250361442565918,
|
|
"learning_rate": 3.231622068096917e-06,
|
|
"loss": 1.7959,
|
|
"mean_token_accuracy": 0.5575650364160538,
|
|
"num_tokens": 20910398.0,
|
|
"step": 5800
|
|
},
|
|
{
|
|
"entropy": 1.808984375,
|
|
"epoch": 1.2845771144278606,
|
|
"grad_norm": 3.240628480911255,
|
|
"learning_rate": 3.225873434261901e-06,
|
|
"loss": 1.8446,
|
|
"mean_token_accuracy": 0.5537953585386276,
|
|
"num_tokens": 20946967.0,
|
|
"step": 5810
|
|
},
|
|
{
|
|
"entropy": 1.783984375,
|
|
"epoch": 1.2867882808181315,
|
|
"grad_norm": 2.703902006149292,
|
|
"learning_rate": 3.220120605970116e-06,
|
|
"loss": 1.7654,
|
|
"mean_token_accuracy": 0.5665196567773819,
|
|
"num_tokens": 20985321.0,
|
|
"step": 5820
|
|
},
|
|
{
|
|
"entropy": 1.812890625,
|
|
"epoch": 1.2889994472084023,
|
|
"grad_norm": 3.472301959991455,
|
|
"learning_rate": 3.2143636164642577e-06,
|
|
"loss": 1.801,
|
|
"mean_token_accuracy": 0.560531222820282,
|
|
"num_tokens": 21021526.0,
|
|
"step": 5830
|
|
},
|
|
{
|
|
"entropy": 1.79765625,
|
|
"epoch": 1.2912106135986732,
|
|
"grad_norm": 3.3239078521728516,
|
|
"learning_rate": 3.2086024990110677e-06,
|
|
"loss": 1.8352,
|
|
"mean_token_accuracy": 0.5581744194030762,
|
|
"num_tokens": 21058076.0,
|
|
"step": 5840
|
|
},
|
|
{
|
|
"entropy": 1.785546875,
|
|
"epoch": 1.293421779988944,
|
|
"grad_norm": 3.357722282409668,
|
|
"learning_rate": 3.2028372869011397e-06,
|
|
"loss": 1.7433,
|
|
"mean_token_accuracy": 0.5705197423696518,
|
|
"num_tokens": 21091714.0,
|
|
"step": 5850
|
|
},
|
|
{
|
|
"entropy": 1.774609375,
|
|
"epoch": 1.2956329463792151,
|
|
"grad_norm": 3.7626278400421143,
|
|
"learning_rate": 3.197068013448729e-06,
|
|
"loss": 1.7829,
|
|
"mean_token_accuracy": 0.5648401558399201,
|
|
"num_tokens": 21126210.0,
|
|
"step": 5860
|
|
},
|
|
{
|
|
"entropy": 1.834765625,
|
|
"epoch": 1.297844112769486,
|
|
"grad_norm": 4.342770099639893,
|
|
"learning_rate": 3.1912947119915603e-06,
|
|
"loss": 1.8543,
|
|
"mean_token_accuracy": 0.5537184774875641,
|
|
"num_tokens": 21164060.0,
|
|
"step": 5870
|
|
},
|
|
{
|
|
"entropy": 1.78515625,
|
|
"epoch": 1.3000552791597568,
|
|
"grad_norm": 3.123088836669922,
|
|
"learning_rate": 3.1855174158906327e-06,
|
|
"loss": 1.7443,
|
|
"mean_token_accuracy": 0.5699366807937623,
|
|
"num_tokens": 21200004.0,
|
|
"step": 5880
|
|
},
|
|
{
|
|
"entropy": 1.74765625,
|
|
"epoch": 1.3022664455500277,
|
|
"grad_norm": 3.5616226196289062,
|
|
"learning_rate": 3.179736158530029e-06,
|
|
"loss": 1.7238,
|
|
"mean_token_accuracy": 0.5746718764305114,
|
|
"num_tokens": 21236493.0,
|
|
"step": 5890
|
|
},
|
|
{
|
|
"entropy": 1.766796875,
|
|
"epoch": 1.3044776119402985,
|
|
"grad_norm": 4.311583995819092,
|
|
"learning_rate": 3.1739509733167217e-06,
|
|
"loss": 1.7797,
|
|
"mean_token_accuracy": 0.5613225072622299,
|
|
"num_tokens": 21273292.0,
|
|
"step": 5900
|
|
},
|
|
{
|
|
"entropy": 1.813671875,
|
|
"epoch": 1.3066887783305694,
|
|
"grad_norm": 3.814483404159546,
|
|
"learning_rate": 3.168161893680381e-06,
|
|
"loss": 1.7913,
|
|
"mean_token_accuracy": 0.561202609539032,
|
|
"num_tokens": 21309115.0,
|
|
"step": 5910
|
|
},
|
|
{
|
|
"entropy": 1.81796875,
|
|
"epoch": 1.3088999447208403,
|
|
"grad_norm": 3.6585819721221924,
|
|
"learning_rate": 3.162368953073181e-06,
|
|
"loss": 1.7914,
|
|
"mean_token_accuracy": 0.5669221550226211,
|
|
"num_tokens": 21345584.0,
|
|
"step": 5920
|
|
},
|
|
{
|
|
"entropy": 1.775,
|
|
"epoch": 1.3111111111111111,
|
|
"grad_norm": 3.0892252922058105,
|
|
"learning_rate": 3.1565721849696053e-06,
|
|
"loss": 1.7678,
|
|
"mean_token_accuracy": 0.5694296389818192,
|
|
"num_tokens": 21381305.0,
|
|
"step": 5930
|
|
},
|
|
{
|
|
"entropy": 1.76171875,
|
|
"epoch": 1.313322277501382,
|
|
"grad_norm": 3.468299627304077,
|
|
"learning_rate": 3.1507716228662557e-06,
|
|
"loss": 1.7799,
|
|
"mean_token_accuracy": 0.5634338557720184,
|
|
"num_tokens": 21415632.0,
|
|
"step": 5940
|
|
},
|
|
{
|
|
"entropy": 1.773828125,
|
|
"epoch": 1.3155334438916528,
|
|
"grad_norm": 3.9129812717437744,
|
|
"learning_rate": 3.144967300281657e-06,
|
|
"loss": 1.7608,
|
|
"mean_token_accuracy": 0.5738358110189438,
|
|
"num_tokens": 21452071.0,
|
|
"step": 5950
|
|
},
|
|
{
|
|
"entropy": 1.798828125,
|
|
"epoch": 1.3177446102819237,
|
|
"grad_norm": 4.279623985290527,
|
|
"learning_rate": 3.139159250756066e-06,
|
|
"loss": 1.8359,
|
|
"mean_token_accuracy": 0.5571326866745949,
|
|
"num_tokens": 21487682.0,
|
|
"step": 5960
|
|
},
|
|
{
|
|
"entropy": 1.864453125,
|
|
"epoch": 1.3199557766721945,
|
|
"grad_norm": 3.366504192352295,
|
|
"learning_rate": 3.133347507851272e-06,
|
|
"loss": 1.8475,
|
|
"mean_token_accuracy": 0.5572561532258987,
|
|
"num_tokens": 21526918.0,
|
|
"step": 5970
|
|
},
|
|
{
|
|
"entropy": 1.812109375,
|
|
"epoch": 1.3221669430624654,
|
|
"grad_norm": 3.256833076477051,
|
|
"learning_rate": 3.1275321051504093e-06,
|
|
"loss": 1.8074,
|
|
"mean_token_accuracy": 0.5580455496907234,
|
|
"num_tokens": 21565231.0,
|
|
"step": 5980
|
|
},
|
|
{
|
|
"entropy": 1.821484375,
|
|
"epoch": 1.3243781094527363,
|
|
"grad_norm": 3.6120660305023193,
|
|
"learning_rate": 3.1217130762577586e-06,
|
|
"loss": 1.8362,
|
|
"mean_token_accuracy": 0.5574668347835541,
|
|
"num_tokens": 21602996.0,
|
|
"step": 5990
|
|
},
|
|
{
|
|
"entropy": 1.75234375,
|
|
"epoch": 1.3265892758430071,
|
|
"grad_norm": 3.6986913681030273,
|
|
"learning_rate": 3.115890454798557e-06,
|
|
"loss": 1.777,
|
|
"mean_token_accuracy": 0.5652501463890076,
|
|
"num_tokens": 21641120.0,
|
|
"step": 6000
|
|
},
|
|
{
|
|
"epoch": 1.3265892758430071,
|
|
"eval_entropy": 1.7850124378109453,
|
|
"eval_loss": 1.8571977615356445,
|
|
"eval_mean_token_accuracy": 0.552127306467265,
|
|
"eval_num_tokens": 21641120.0,
|
|
"eval_runtime": 112.1069,
|
|
"eval_samples_per_second": 143.434,
|
|
"eval_steps_per_second": 8.965,
|
|
"step": 6000
|
|
},
|
|
{
|
|
"entropy": 1.767578125,
|
|
"epoch": 1.328800442233278,
|
|
"grad_norm": 3.820396900177002,
|
|
"learning_rate": 3.110064274418797e-06,
|
|
"loss": 1.776,
|
|
"mean_token_accuracy": 0.5668271213769913,
|
|
"num_tokens": 21677626.0,
|
|
"step": 6010
|
|
},
|
|
{
|
|
"entropy": 1.793359375,
|
|
"epoch": 1.331011608623549,
|
|
"grad_norm": 3.534780263900757,
|
|
"learning_rate": 3.104234568785041e-06,
|
|
"loss": 1.8039,
|
|
"mean_token_accuracy": 0.558014976978302,
|
|
"num_tokens": 21713279.0,
|
|
"step": 6020
|
|
},
|
|
{
|
|
"entropy": 1.785546875,
|
|
"epoch": 1.33322277501382,
|
|
"grad_norm": 3.8351495265960693,
|
|
"learning_rate": 3.0984013715842196e-06,
|
|
"loss": 1.7894,
|
|
"mean_token_accuracy": 0.5611502975225449,
|
|
"num_tokens": 21749396.0,
|
|
"step": 6030
|
|
},
|
|
{
|
|
"entropy": 1.775390625,
|
|
"epoch": 1.3354339414040908,
|
|
"grad_norm": 3.727304220199585,
|
|
"learning_rate": 3.0925647165234394e-06,
|
|
"loss": 1.7961,
|
|
"mean_token_accuracy": 0.5596056342124939,
|
|
"num_tokens": 21784454.0,
|
|
"step": 6040
|
|
},
|
|
{
|
|
"entropy": 1.746484375,
|
|
"epoch": 1.3376451077943616,
|
|
"grad_norm": 3.3840034008026123,
|
|
"learning_rate": 3.086724637329789e-06,
|
|
"loss": 1.7458,
|
|
"mean_token_accuracy": 0.5678827106952667,
|
|
"num_tokens": 21820242.0,
|
|
"step": 6050
|
|
},
|
|
{
|
|
"entropy": 1.78984375,
|
|
"epoch": 1.3398562741846325,
|
|
"grad_norm": 3.678936719894409,
|
|
"learning_rate": 3.0808811677501425e-06,
|
|
"loss": 1.8207,
|
|
"mean_token_accuracy": 0.5588392555713654,
|
|
"num_tokens": 21858520.0,
|
|
"step": 6060
|
|
},
|
|
{
|
|
"entropy": 1.787890625,
|
|
"epoch": 1.3420674405749033,
|
|
"grad_norm": 3.6143128871917725,
|
|
"learning_rate": 3.0750343415509654e-06,
|
|
"loss": 1.8109,
|
|
"mean_token_accuracy": 0.5628083169460296,
|
|
"num_tokens": 21895073.0,
|
|
"step": 6070
|
|
},
|
|
{
|
|
"entropy": 1.82890625,
|
|
"epoch": 1.3442786069651742,
|
|
"grad_norm": 3.7559196949005127,
|
|
"learning_rate": 3.0691841925181203e-06,
|
|
"loss": 1.8282,
|
|
"mean_token_accuracy": 0.5517563879489898,
|
|
"num_tokens": 21930064.0,
|
|
"step": 6080
|
|
},
|
|
{
|
|
"entropy": 1.794140625,
|
|
"epoch": 1.346489773355445,
|
|
"grad_norm": 3.136530876159668,
|
|
"learning_rate": 3.0633307544566705e-06,
|
|
"loss": 1.7965,
|
|
"mean_token_accuracy": 0.5639650210738182,
|
|
"num_tokens": 21965403.0,
|
|
"step": 6090
|
|
},
|
|
{
|
|
"entropy": 1.79140625,
|
|
"epoch": 1.348700939745716,
|
|
"grad_norm": 3.8732857704162598,
|
|
"learning_rate": 3.057474061190684e-06,
|
|
"loss": 1.8043,
|
|
"mean_token_accuracy": 0.5628103628754616,
|
|
"num_tokens": 22001121.0,
|
|
"step": 6100
|
|
},
|
|
{
|
|
"entropy": 1.723828125,
|
|
"epoch": 1.3509121061359868,
|
|
"grad_norm": 3.044196844100952,
|
|
"learning_rate": 3.05161414656304e-06,
|
|
"loss": 1.7104,
|
|
"mean_token_accuracy": 0.5743643552064895,
|
|
"num_tokens": 22035675.0,
|
|
"step": 6110
|
|
},
|
|
{
|
|
"entropy": 1.753125,
|
|
"epoch": 1.3531232725262576,
|
|
"grad_norm": 3.3551251888275146,
|
|
"learning_rate": 3.0457510444352318e-06,
|
|
"loss": 1.7749,
|
|
"mean_token_accuracy": 0.5593810588121414,
|
|
"num_tokens": 22069035.0,
|
|
"step": 6120
|
|
},
|
|
{
|
|
"entropy": 1.7609375,
|
|
"epoch": 1.3553344389165285,
|
|
"grad_norm": 3.3142549991607666,
|
|
"learning_rate": 3.0398847886871718e-06,
|
|
"loss": 1.7877,
|
|
"mean_token_accuracy": 0.5619940429925918,
|
|
"num_tokens": 22104297.0,
|
|
"step": 6130
|
|
},
|
|
{
|
|
"entropy": 1.78046875,
|
|
"epoch": 1.3575456053067994,
|
|
"grad_norm": 3.6372194290161133,
|
|
"learning_rate": 3.0340154132169963e-06,
|
|
"loss": 1.7534,
|
|
"mean_token_accuracy": 0.5727092772722244,
|
|
"num_tokens": 22140878.0,
|
|
"step": 6140
|
|
},
|
|
{
|
|
"entropy": 1.8109375,
|
|
"epoch": 1.3597567716970702,
|
|
"grad_norm": 3.323709726333618,
|
|
"learning_rate": 3.028142951940868e-06,
|
|
"loss": 1.8059,
|
|
"mean_token_accuracy": 0.5585047423839569,
|
|
"num_tokens": 22176807.0,
|
|
"step": 6150
|
|
},
|
|
{
|
|
"entropy": 1.769921875,
|
|
"epoch": 1.361967938087341,
|
|
"grad_norm": 3.404179573059082,
|
|
"learning_rate": 3.022267438792781e-06,
|
|
"loss": 1.7555,
|
|
"mean_token_accuracy": 0.5680437862873078,
|
|
"num_tokens": 22213766.0,
|
|
"step": 6160
|
|
},
|
|
{
|
|
"entropy": 1.785546875,
|
|
"epoch": 1.364179104477612,
|
|
"grad_norm": 3.52239990234375,
|
|
"learning_rate": 3.016388907724364e-06,
|
|
"loss": 1.7937,
|
|
"mean_token_accuracy": 0.5593192428350449,
|
|
"num_tokens": 22250602.0,
|
|
"step": 6170
|
|
},
|
|
{
|
|
"entropy": 1.7609375,
|
|
"epoch": 1.3663902708678828,
|
|
"grad_norm": 3.9132049083709717,
|
|
"learning_rate": 3.010507392704687e-06,
|
|
"loss": 1.7849,
|
|
"mean_token_accuracy": 0.5654122918844223,
|
|
"num_tokens": 22285446.0,
|
|
"step": 6180
|
|
},
|
|
{
|
|
"entropy": 1.762890625,
|
|
"epoch": 1.3686014372581536,
|
|
"grad_norm": 3.373643398284912,
|
|
"learning_rate": 3.00462292772006e-06,
|
|
"loss": 1.7742,
|
|
"mean_token_accuracy": 0.5645978271961212,
|
|
"num_tokens": 22320129.0,
|
|
"step": 6190
|
|
},
|
|
{
|
|
"entropy": 1.82265625,
|
|
"epoch": 1.3708126036484245,
|
|
"grad_norm": 2.6540253162384033,
|
|
"learning_rate": 2.9987355467738423e-06,
|
|
"loss": 1.8108,
|
|
"mean_token_accuracy": 0.5569920986890793,
|
|
"num_tokens": 22356357.0,
|
|
"step": 6200
|
|
},
|
|
{
|
|
"entropy": 1.816015625,
|
|
"epoch": 1.3730237700386954,
|
|
"grad_norm": 3.918698787689209,
|
|
"learning_rate": 2.9928452838862387e-06,
|
|
"loss": 1.7933,
|
|
"mean_token_accuracy": 0.5639100223779678,
|
|
"num_tokens": 22391047.0,
|
|
"step": 6210
|
|
},
|
|
{
|
|
"entropy": 1.762890625,
|
|
"epoch": 1.3752349364289662,
|
|
"grad_norm": 3.1953556537628174,
|
|
"learning_rate": 2.986952173094113e-06,
|
|
"loss": 1.7848,
|
|
"mean_token_accuracy": 0.5650658786296845,
|
|
"num_tokens": 22426348.0,
|
|
"step": 6220
|
|
},
|
|
{
|
|
"entropy": 1.809765625,
|
|
"epoch": 1.377446102819237,
|
|
"grad_norm": 3.59268856048584,
|
|
"learning_rate": 2.9810562484507806e-06,
|
|
"loss": 1.8065,
|
|
"mean_token_accuracy": 0.5616378337144852,
|
|
"num_tokens": 22462821.0,
|
|
"step": 6230
|
|
},
|
|
{
|
|
"entropy": 1.771484375,
|
|
"epoch": 1.379657269209508,
|
|
"grad_norm": 4.052269458770752,
|
|
"learning_rate": 2.975157544025819e-06,
|
|
"loss": 1.7795,
|
|
"mean_token_accuracy": 0.5660430938005447,
|
|
"num_tokens": 22498917.0,
|
|
"step": 6240
|
|
},
|
|
{
|
|
"entropy": 1.769921875,
|
|
"epoch": 1.3818684355997788,
|
|
"grad_norm": 3.9682633876800537,
|
|
"learning_rate": 2.969256093904869e-06,
|
|
"loss": 1.7709,
|
|
"mean_token_accuracy": 0.5626526653766633,
|
|
"num_tokens": 22533705.0,
|
|
"step": 6250
|
|
},
|
|
{
|
|
"entropy": 1.784375,
|
|
"epoch": 1.3840796019900496,
|
|
"grad_norm": 2.326179265975952,
|
|
"learning_rate": 2.963351932189437e-06,
|
|
"loss": 1.7813,
|
|
"mean_token_accuracy": 0.5670030087232589,
|
|
"num_tokens": 22569599.0,
|
|
"step": 6260
|
|
},
|
|
{
|
|
"entropy": 1.82734375,
|
|
"epoch": 1.3862907683803205,
|
|
"grad_norm": 3.4143896102905273,
|
|
"learning_rate": 2.9574450929966977e-06,
|
|
"loss": 1.8424,
|
|
"mean_token_accuracy": 0.5509164839982986,
|
|
"num_tokens": 22604988.0,
|
|
"step": 6270
|
|
},
|
|
{
|
|
"entropy": 1.8265625,
|
|
"epoch": 1.3885019347705914,
|
|
"grad_norm": 3.34903883934021,
|
|
"learning_rate": 2.9515356104592967e-06,
|
|
"loss": 1.8018,
|
|
"mean_token_accuracy": 0.5605247437953949,
|
|
"num_tokens": 22642550.0,
|
|
"step": 6280
|
|
},
|
|
{
|
|
"entropy": 1.816015625,
|
|
"epoch": 1.3907131011608622,
|
|
"grad_norm": 3.6885504722595215,
|
|
"learning_rate": 2.9456235187251582e-06,
|
|
"loss": 1.802,
|
|
"mean_token_accuracy": 0.5593595266342163,
|
|
"num_tokens": 22678756.0,
|
|
"step": 6290
|
|
},
|
|
{
|
|
"entropy": 1.77109375,
|
|
"epoch": 1.3929242675511333,
|
|
"grad_norm": 3.866255283355713,
|
|
"learning_rate": 2.939708851957278e-06,
|
|
"loss": 1.7531,
|
|
"mean_token_accuracy": 0.5701113522052765,
|
|
"num_tokens": 22714987.0,
|
|
"step": 6300
|
|
},
|
|
{
|
|
"entropy": 1.8140625,
|
|
"epoch": 1.3951354339414042,
|
|
"grad_norm": 3.5575506687164307,
|
|
"learning_rate": 2.9337916443335374e-06,
|
|
"loss": 1.8239,
|
|
"mean_token_accuracy": 0.5536852985620498,
|
|
"num_tokens": 22750731.0,
|
|
"step": 6310
|
|
},
|
|
{
|
|
"entropy": 1.753515625,
|
|
"epoch": 1.397346600331675,
|
|
"grad_norm": 3.3051750659942627,
|
|
"learning_rate": 2.927871930046495e-06,
|
|
"loss": 1.7172,
|
|
"mean_token_accuracy": 0.5749614030122757,
|
|
"num_tokens": 22786150.0,
|
|
"step": 6320
|
|
},
|
|
{
|
|
"entropy": 1.758203125,
|
|
"epoch": 1.3995577667219459,
|
|
"grad_norm": 3.677420139312744,
|
|
"learning_rate": 2.921949743303197e-06,
|
|
"loss": 1.7685,
|
|
"mean_token_accuracy": 0.5683232516050338,
|
|
"num_tokens": 22821915.0,
|
|
"step": 6330
|
|
},
|
|
{
|
|
"entropy": 1.765234375,
|
|
"epoch": 1.4017689331122167,
|
|
"grad_norm": 3.6115567684173584,
|
|
"learning_rate": 2.9160251183249777e-06,
|
|
"loss": 1.7562,
|
|
"mean_token_accuracy": 0.5710659384727478,
|
|
"num_tokens": 22860388.0,
|
|
"step": 6340
|
|
},
|
|
{
|
|
"entropy": 1.7359375,
|
|
"epoch": 1.4039800995024876,
|
|
"grad_norm": 3.852043867111206,
|
|
"learning_rate": 2.9100980893472565e-06,
|
|
"loss": 1.7283,
|
|
"mean_token_accuracy": 0.5753805041313171,
|
|
"num_tokens": 22893371.0,
|
|
"step": 6350
|
|
},
|
|
{
|
|
"entropy": 1.7578125,
|
|
"epoch": 1.4061912658927584,
|
|
"grad_norm": 3.275733232498169,
|
|
"learning_rate": 2.904168690619349e-06,
|
|
"loss": 1.7776,
|
|
"mean_token_accuracy": 0.563394570350647,
|
|
"num_tokens": 22930592.0,
|
|
"step": 6360
|
|
},
|
|
{
|
|
"entropy": 1.794921875,
|
|
"epoch": 1.4084024322830293,
|
|
"grad_norm": 3.9969217777252197,
|
|
"learning_rate": 2.8982369564042607e-06,
|
|
"loss": 1.7988,
|
|
"mean_token_accuracy": 0.560490146279335,
|
|
"num_tokens": 22966072.0,
|
|
"step": 6370
|
|
},
|
|
{
|
|
"entropy": 1.766796875,
|
|
"epoch": 1.4106135986733002,
|
|
"grad_norm": 3.636631727218628,
|
|
"learning_rate": 2.8923029209784952e-06,
|
|
"loss": 1.7481,
|
|
"mean_token_accuracy": 0.5732327073812484,
|
|
"num_tokens": 23000611.0,
|
|
"step": 6380
|
|
},
|
|
{
|
|
"entropy": 1.76953125,
|
|
"epoch": 1.412824765063571,
|
|
"grad_norm": 3.46740460395813,
|
|
"learning_rate": 2.886366618631852e-06,
|
|
"loss": 1.7815,
|
|
"mean_token_accuracy": 0.563927635550499,
|
|
"num_tokens": 23037361.0,
|
|
"step": 6390
|
|
},
|
|
{
|
|
"entropy": 1.78125,
|
|
"epoch": 1.4150359314538419,
|
|
"grad_norm": 3.56950044631958,
|
|
"learning_rate": 2.8804280836672327e-06,
|
|
"loss": 1.7819,
|
|
"mean_token_accuracy": 0.5618812888860703,
|
|
"num_tokens": 23073773.0,
|
|
"step": 6400
|
|
},
|
|
{
|
|
"entropy": 1.762109375,
|
|
"epoch": 1.4172470978441127,
|
|
"grad_norm": 3.3874595165252686,
|
|
"learning_rate": 2.8744873504004355e-06,
|
|
"loss": 1.7651,
|
|
"mean_token_accuracy": 0.5682212561368942,
|
|
"num_tokens": 23110495.0,
|
|
"step": 6410
|
|
},
|
|
{
|
|
"entropy": 1.789453125,
|
|
"epoch": 1.4194582642343836,
|
|
"grad_norm": 3.414144515991211,
|
|
"learning_rate": 2.868544453159966e-06,
|
|
"loss": 1.7663,
|
|
"mean_token_accuracy": 0.5659948736429214,
|
|
"num_tokens": 23144602.0,
|
|
"step": 6420
|
|
},
|
|
{
|
|
"entropy": 1.730078125,
|
|
"epoch": 1.4216694306246545,
|
|
"grad_norm": 2.2560346126556396,
|
|
"learning_rate": 2.8625994262868314e-06,
|
|
"loss": 1.7384,
|
|
"mean_token_accuracy": 0.5730728596448899,
|
|
"num_tokens": 23181109.0,
|
|
"step": 6430
|
|
},
|
|
{
|
|
"entropy": 1.737890625,
|
|
"epoch": 1.4238805970149253,
|
|
"grad_norm": 3.801737070083618,
|
|
"learning_rate": 2.8566523041343465e-06,
|
|
"loss": 1.7636,
|
|
"mean_token_accuracy": 0.567984202504158,
|
|
"num_tokens": 23218980.0,
|
|
"step": 6440
|
|
},
|
|
{
|
|
"entropy": 1.7703125,
|
|
"epoch": 1.4260917634051962,
|
|
"grad_norm": 4.60996150970459,
|
|
"learning_rate": 2.8507031210679328e-06,
|
|
"loss": 1.8034,
|
|
"mean_token_accuracy": 0.5598806262016296,
|
|
"num_tokens": 23253856.0,
|
|
"step": 6450
|
|
},
|
|
{
|
|
"entropy": 1.815625,
|
|
"epoch": 1.4283029297954672,
|
|
"grad_norm": 3.7916951179504395,
|
|
"learning_rate": 2.8447519114649203e-06,
|
|
"loss": 1.8191,
|
|
"mean_token_accuracy": 0.5626054763793945,
|
|
"num_tokens": 23293089.0,
|
|
"step": 6460
|
|
},
|
|
{
|
|
"entropy": 1.75859375,
|
|
"epoch": 1.430514096185738,
|
|
"grad_norm": 4.215456962585449,
|
|
"learning_rate": 2.838798709714352e-06,
|
|
"loss": 1.7364,
|
|
"mean_token_accuracy": 0.5671977251768112,
|
|
"num_tokens": 23327059.0,
|
|
"step": 6470
|
|
},
|
|
{
|
|
"entropy": 1.79765625,
|
|
"epoch": 1.432725262576009,
|
|
"grad_norm": 2.7653579711914062,
|
|
"learning_rate": 2.8328435502167795e-06,
|
|
"loss": 1.799,
|
|
"mean_token_accuracy": 0.5632517874240875,
|
|
"num_tokens": 23362006.0,
|
|
"step": 6480
|
|
},
|
|
{
|
|
"entropy": 1.80234375,
|
|
"epoch": 1.4349364289662798,
|
|
"grad_norm": 3.4138288497924805,
|
|
"learning_rate": 2.826886467384069e-06,
|
|
"loss": 1.7829,
|
|
"mean_token_accuracy": 0.5621898084878921,
|
|
"num_tokens": 23398263.0,
|
|
"step": 6490
|
|
},
|
|
{
|
|
"entropy": 1.792578125,
|
|
"epoch": 1.4371475953565507,
|
|
"grad_norm": 2.771493434906006,
|
|
"learning_rate": 2.8209274956391993e-06,
|
|
"loss": 1.8076,
|
|
"mean_token_accuracy": 0.5588776767253876,
|
|
"num_tokens": 23435712.0,
|
|
"step": 6500
|
|
},
|
|
{
|
|
"epoch": 1.4371475953565507,
|
|
"eval_entropy": 1.7771766169154228,
|
|
"eval_loss": 1.844801902770996,
|
|
"eval_mean_token_accuracy": 0.5543095984565678,
|
|
"eval_num_tokens": 23435712.0,
|
|
"eval_runtime": 111.7954,
|
|
"eval_samples_per_second": 143.834,
|
|
"eval_steps_per_second": 8.99,
|
|
"step": 6500
|
|
},
|
|
{
|
|
"entropy": 1.776171875,
|
|
"epoch": 1.4393587617468215,
|
|
"grad_norm": 3.992645502090454,
|
|
"learning_rate": 2.814966669416066e-06,
|
|
"loss": 1.7933,
|
|
"mean_token_accuracy": 0.5660274803638459,
|
|
"num_tokens": 23471456.0,
|
|
"step": 6510
|
|
},
|
|
{
|
|
"entropy": 1.800390625,
|
|
"epoch": 1.4415699281370924,
|
|
"grad_norm": 3.3418450355529785,
|
|
"learning_rate": 2.8090040231592786e-06,
|
|
"loss": 1.7774,
|
|
"mean_token_accuracy": 0.5672044098377228,
|
|
"num_tokens": 23508887.0,
|
|
"step": 6520
|
|
},
|
|
{
|
|
"entropy": 1.788671875,
|
|
"epoch": 1.4437810945273633,
|
|
"grad_norm": 3.965697765350342,
|
|
"learning_rate": 2.803039591323966e-06,
|
|
"loss": 1.7812,
|
|
"mean_token_accuracy": 0.5604627668857575,
|
|
"num_tokens": 23542761.0,
|
|
"step": 6530
|
|
},
|
|
{
|
|
"entropy": 1.7984375,
|
|
"epoch": 1.445992260917634,
|
|
"grad_norm": 4.169949054718018,
|
|
"learning_rate": 2.7970734083755735e-06,
|
|
"loss": 1.7958,
|
|
"mean_token_accuracy": 0.566362076997757,
|
|
"num_tokens": 23578134.0,
|
|
"step": 6540
|
|
},
|
|
{
|
|
"entropy": 1.75703125,
|
|
"epoch": 1.448203427307905,
|
|
"grad_norm": 3.827418088912964,
|
|
"learning_rate": 2.791105508789666e-06,
|
|
"loss": 1.7646,
|
|
"mean_token_accuracy": 0.566959148645401,
|
|
"num_tokens": 23613526.0,
|
|
"step": 6550
|
|
},
|
|
{
|
|
"entropy": 1.734375,
|
|
"epoch": 1.4504145936981758,
|
|
"grad_norm": 3.7612462043762207,
|
|
"learning_rate": 2.785135927051727e-06,
|
|
"loss": 1.7344,
|
|
"mean_token_accuracy": 0.5662859410047532,
|
|
"num_tokens": 23646661.0,
|
|
"step": 6560
|
|
},
|
|
{
|
|
"entropy": 1.776953125,
|
|
"epoch": 1.4526257600884467,
|
|
"grad_norm": 3.3953490257263184,
|
|
"learning_rate": 2.7791646976569615e-06,
|
|
"loss": 1.7634,
|
|
"mean_token_accuracy": 0.5674682110548019,
|
|
"num_tokens": 23680315.0,
|
|
"step": 6570
|
|
},
|
|
{
|
|
"entropy": 1.75390625,
|
|
"epoch": 1.4548369264787175,
|
|
"grad_norm": 4.478320598602295,
|
|
"learning_rate": 2.773191855110095e-06,
|
|
"loss": 1.7572,
|
|
"mean_token_accuracy": 0.564544004201889,
|
|
"num_tokens": 23714323.0,
|
|
"step": 6580
|
|
},
|
|
{
|
|
"entropy": 1.748046875,
|
|
"epoch": 1.4570480928689884,
|
|
"grad_norm": 3.6026175022125244,
|
|
"learning_rate": 2.7672174339251747e-06,
|
|
"loss": 1.7884,
|
|
"mean_token_accuracy": 0.5681850671768188,
|
|
"num_tokens": 23749273.0,
|
|
"step": 6590
|
|
},
|
|
{
|
|
"entropy": 1.76953125,
|
|
"epoch": 1.4592592592592593,
|
|
"grad_norm": 3.054741859436035,
|
|
"learning_rate": 2.761241468625369e-06,
|
|
"loss": 1.7546,
|
|
"mean_token_accuracy": 0.5717523038387299,
|
|
"num_tokens": 23786399.0,
|
|
"step": 6600
|
|
},
|
|
{
|
|
"entropy": 1.780078125,
|
|
"epoch": 1.4614704256495301,
|
|
"grad_norm": 3.4545223712921143,
|
|
"learning_rate": 2.7552639937427707e-06,
|
|
"loss": 1.8001,
|
|
"mean_token_accuracy": 0.5618358820676803,
|
|
"num_tokens": 23821430.0,
|
|
"step": 6610
|
|
},
|
|
{
|
|
"entropy": 1.815234375,
|
|
"epoch": 1.463681592039801,
|
|
"grad_norm": 3.6075918674468994,
|
|
"learning_rate": 2.7492850438181933e-06,
|
|
"loss": 1.8047,
|
|
"mean_token_accuracy": 0.5616067349910736,
|
|
"num_tokens": 23857271.0,
|
|
"step": 6620
|
|
},
|
|
{
|
|
"entropy": 1.8109375,
|
|
"epoch": 1.4658927584300718,
|
|
"grad_norm": 3.6836564540863037,
|
|
"learning_rate": 2.7433046534009772e-06,
|
|
"loss": 1.7804,
|
|
"mean_token_accuracy": 0.5608997613191604,
|
|
"num_tokens": 23892188.0,
|
|
"step": 6630
|
|
},
|
|
{
|
|
"entropy": 1.815234375,
|
|
"epoch": 1.4681039248203427,
|
|
"grad_norm": 3.167994976043701,
|
|
"learning_rate": 2.737322857048784e-06,
|
|
"loss": 1.8074,
|
|
"mean_token_accuracy": 0.559985825419426,
|
|
"num_tokens": 23929360.0,
|
|
"step": 6640
|
|
},
|
|
{
|
|
"entropy": 1.798046875,
|
|
"epoch": 1.4703150912106135,
|
|
"grad_norm": 3.9118082523345947,
|
|
"learning_rate": 2.7313396893273984e-06,
|
|
"loss": 1.801,
|
|
"mean_token_accuracy": 0.5545473724603653,
|
|
"num_tokens": 23964820.0,
|
|
"step": 6650
|
|
},
|
|
{
|
|
"entropy": 1.758984375,
|
|
"epoch": 1.4725262576008844,
|
|
"grad_norm": 3.614159345626831,
|
|
"learning_rate": 2.7253551848105346e-06,
|
|
"loss": 1.7417,
|
|
"mean_token_accuracy": 0.572695043683052,
|
|
"num_tokens": 23997914.0,
|
|
"step": 6660
|
|
},
|
|
{
|
|
"entropy": 1.775390625,
|
|
"epoch": 1.4747374239911553,
|
|
"grad_norm": 3.576554298400879,
|
|
"learning_rate": 2.719369378079626e-06,
|
|
"loss": 1.794,
|
|
"mean_token_accuracy": 0.5605390518903732,
|
|
"num_tokens": 24032184.0,
|
|
"step": 6670
|
|
},
|
|
{
|
|
"entropy": 1.7859375,
|
|
"epoch": 1.4769485903814261,
|
|
"grad_norm": 3.463318347930908,
|
|
"learning_rate": 2.713382303723634e-06,
|
|
"loss": 1.7616,
|
|
"mean_token_accuracy": 0.5717710316181183,
|
|
"num_tokens": 24069356.0,
|
|
"step": 6680
|
|
},
|
|
{
|
|
"entropy": 1.719921875,
|
|
"epoch": 1.479159756771697,
|
|
"grad_norm": 4.016140937805176,
|
|
"learning_rate": 2.707393996338844e-06,
|
|
"loss": 1.7185,
|
|
"mean_token_accuracy": 0.5830074578523636,
|
|
"num_tokens": 24106517.0,
|
|
"step": 6690
|
|
},
|
|
{
|
|
"entropy": 1.753515625,
|
|
"epoch": 1.4813709231619678,
|
|
"grad_norm": 3.9528045654296875,
|
|
"learning_rate": 2.7014044905286664e-06,
|
|
"loss": 1.7788,
|
|
"mean_token_accuracy": 0.5631624072790146,
|
|
"num_tokens": 24142877.0,
|
|
"step": 6700
|
|
},
|
|
{
|
|
"entropy": 1.78828125,
|
|
"epoch": 1.4835820895522387,
|
|
"grad_norm": 3.84322452545166,
|
|
"learning_rate": 2.6954138209034375e-06,
|
|
"loss": 1.7908,
|
|
"mean_token_accuracy": 0.5673695862293243,
|
|
"num_tokens": 24182191.0,
|
|
"step": 6710
|
|
},
|
|
{
|
|
"entropy": 1.79296875,
|
|
"epoch": 1.4857932559425095,
|
|
"grad_norm": 3.6799237728118896,
|
|
"learning_rate": 2.689422022080217e-06,
|
|
"loss": 1.8051,
|
|
"mean_token_accuracy": 0.562924399971962,
|
|
"num_tokens": 24216604.0,
|
|
"step": 6720
|
|
},
|
|
{
|
|
"entropy": 1.753515625,
|
|
"epoch": 1.4880044223327804,
|
|
"grad_norm": 3.308382034301758,
|
|
"learning_rate": 2.6834291286825915e-06,
|
|
"loss": 1.7457,
|
|
"mean_token_accuracy": 0.5736207246780396,
|
|
"num_tokens": 24252217.0,
|
|
"step": 6730
|
|
},
|
|
{
|
|
"entropy": 1.79453125,
|
|
"epoch": 1.4902155887230515,
|
|
"grad_norm": 3.043153762817383,
|
|
"learning_rate": 2.677435175340471e-06,
|
|
"loss": 1.7787,
|
|
"mean_token_accuracy": 0.5649339318275451,
|
|
"num_tokens": 24288704.0,
|
|
"step": 6740
|
|
},
|
|
{
|
|
"entropy": 1.75078125,
|
|
"epoch": 1.4924267551133223,
|
|
"grad_norm": 3.3482656478881836,
|
|
"learning_rate": 2.671440196689892e-06,
|
|
"loss": 1.7364,
|
|
"mean_token_accuracy": 0.5702936947345734,
|
|
"num_tokens": 24322249.0,
|
|
"step": 6750
|
|
},
|
|
{
|
|
"entropy": 1.766796875,
|
|
"epoch": 1.4946379215035932,
|
|
"grad_norm": 3.874194383621216,
|
|
"learning_rate": 2.6654442273728143e-06,
|
|
"loss": 1.7835,
|
|
"mean_token_accuracy": 0.5604252785444259,
|
|
"num_tokens": 24358139.0,
|
|
"step": 6760
|
|
},
|
|
{
|
|
"entropy": 1.74765625,
|
|
"epoch": 1.496849087893864,
|
|
"grad_norm": 3.7722084522247314,
|
|
"learning_rate": 2.659447302036923e-06,
|
|
"loss": 1.7524,
|
|
"mean_token_accuracy": 0.5671618014574051,
|
|
"num_tokens": 24395101.0,
|
|
"step": 6770
|
|
},
|
|
{
|
|
"entropy": 1.755078125,
|
|
"epoch": 1.499060254284135,
|
|
"grad_norm": 3.672588586807251,
|
|
"learning_rate": 2.653449455335428e-06,
|
|
"loss": 1.7485,
|
|
"mean_token_accuracy": 0.5709905534982681,
|
|
"num_tokens": 24430135.0,
|
|
"step": 6780
|
|
},
|
|
{
|
|
"entropy": 1.76015625,
|
|
"epoch": 1.5012714206744058,
|
|
"grad_norm": 3.6790823936462402,
|
|
"learning_rate": 2.647450721926862e-06,
|
|
"loss": 1.7696,
|
|
"mean_token_accuracy": 0.5680080950260162,
|
|
"num_tokens": 24464763.0,
|
|
"step": 6790
|
|
},
|
|
{
|
|
"entropy": 1.77890625,
|
|
"epoch": 1.5034825870646766,
|
|
"grad_norm": 3.462122917175293,
|
|
"learning_rate": 2.641451136474883e-06,
|
|
"loss": 1.7798,
|
|
"mean_token_accuracy": 0.5666156440973282,
|
|
"num_tokens": 24501316.0,
|
|
"step": 6800
|
|
},
|
|
{
|
|
"entropy": 1.77734375,
|
|
"epoch": 1.5056937534549475,
|
|
"grad_norm": 4.919149398803711,
|
|
"learning_rate": 2.6354507336480707e-06,
|
|
"loss": 1.7767,
|
|
"mean_token_accuracy": 0.5715942829847336,
|
|
"num_tokens": 24536367.0,
|
|
"step": 6810
|
|
},
|
|
{
|
|
"entropy": 1.758984375,
|
|
"epoch": 1.5079049198452184,
|
|
"grad_norm": 3.2147161960601807,
|
|
"learning_rate": 2.62944954811973e-06,
|
|
"loss": 1.7939,
|
|
"mean_token_accuracy": 0.5674211353063583,
|
|
"num_tokens": 24573055.0,
|
|
"step": 6820
|
|
},
|
|
{
|
|
"entropy": 1.78671875,
|
|
"epoch": 1.5101160862354892,
|
|
"grad_norm": 3.72737455368042,
|
|
"learning_rate": 2.623447614567688e-06,
|
|
"loss": 1.7903,
|
|
"mean_token_accuracy": 0.5639339953660965,
|
|
"num_tokens": 24611131.0,
|
|
"step": 6830
|
|
},
|
|
{
|
|
"entropy": 1.74765625,
|
|
"epoch": 1.51232725262576,
|
|
"grad_norm": 4.152836799621582,
|
|
"learning_rate": 2.6174449676740933e-06,
|
|
"loss": 1.7072,
|
|
"mean_token_accuracy": 0.5771721541881562,
|
|
"num_tokens": 24646840.0,
|
|
"step": 6840
|
|
},
|
|
{
|
|
"entropy": 1.805078125,
|
|
"epoch": 1.514538419016031,
|
|
"grad_norm": 3.0797042846679688,
|
|
"learning_rate": 2.611441642125217e-06,
|
|
"loss": 1.819,
|
|
"mean_token_accuracy": 0.555337205529213,
|
|
"num_tokens": 24684793.0,
|
|
"step": 6850
|
|
},
|
|
{
|
|
"entropy": 1.76328125,
|
|
"epoch": 1.5167495854063018,
|
|
"grad_norm": 3.4738271236419678,
|
|
"learning_rate": 2.6054376726112536e-06,
|
|
"loss": 1.7626,
|
|
"mean_token_accuracy": 0.5688392043113708,
|
|
"num_tokens": 24723545.0,
|
|
"step": 6860
|
|
},
|
|
{
|
|
"entropy": 1.77265625,
|
|
"epoch": 1.5189607517965726,
|
|
"grad_norm": 3.5689122676849365,
|
|
"learning_rate": 2.5994330938261148e-06,
|
|
"loss": 1.7646,
|
|
"mean_token_accuracy": 0.5735682964324951,
|
|
"num_tokens": 24761697.0,
|
|
"step": 6870
|
|
},
|
|
{
|
|
"entropy": 1.82578125,
|
|
"epoch": 1.5211719181868437,
|
|
"grad_norm": 2.730982542037964,
|
|
"learning_rate": 2.5934279404672375e-06,
|
|
"loss": 1.8302,
|
|
"mean_token_accuracy": 0.5567848086357117,
|
|
"num_tokens": 24800175.0,
|
|
"step": 6880
|
|
},
|
|
{
|
|
"entropy": 1.7765625,
|
|
"epoch": 1.5233830845771146,
|
|
"grad_norm": 3.563002586364746,
|
|
"learning_rate": 2.5874222472353755e-06,
|
|
"loss": 1.8108,
|
|
"mean_token_accuracy": 0.5600845083594322,
|
|
"num_tokens": 24836604.0,
|
|
"step": 6890
|
|
},
|
|
{
|
|
"entropy": 1.741015625,
|
|
"epoch": 1.5255942509673854,
|
|
"grad_norm": 3.0959527492523193,
|
|
"learning_rate": 2.581416048834404e-06,
|
|
"loss": 1.7627,
|
|
"mean_token_accuracy": 0.5675601989030838,
|
|
"num_tokens": 24873196.0,
|
|
"step": 6900
|
|
},
|
|
{
|
|
"entropy": 1.76171875,
|
|
"epoch": 1.5278054173576563,
|
|
"grad_norm": 3.692702531814575,
|
|
"learning_rate": 2.5754093799711163e-06,
|
|
"loss": 1.7541,
|
|
"mean_token_accuracy": 0.5672732532024384,
|
|
"num_tokens": 24910747.0,
|
|
"step": 6910
|
|
},
|
|
{
|
|
"entropy": 1.787109375,
|
|
"epoch": 1.5300165837479272,
|
|
"grad_norm": 3.9912259578704834,
|
|
"learning_rate": 2.5694022753550235e-06,
|
|
"loss": 1.7792,
|
|
"mean_token_accuracy": 0.5604482442140579,
|
|
"num_tokens": 24947180.0,
|
|
"step": 6920
|
|
},
|
|
{
|
|
"entropy": 1.74765625,
|
|
"epoch": 1.532227750138198,
|
|
"grad_norm": 3.743095874786377,
|
|
"learning_rate": 2.5633947696981583e-06,
|
|
"loss": 1.7545,
|
|
"mean_token_accuracy": 0.568946024775505,
|
|
"num_tokens": 24983326.0,
|
|
"step": 6930
|
|
},
|
|
{
|
|
"entropy": 1.725390625,
|
|
"epoch": 1.5344389165284689,
|
|
"grad_norm": 3.4966163635253906,
|
|
"learning_rate": 2.5573868977148662e-06,
|
|
"loss": 1.6999,
|
|
"mean_token_accuracy": 0.5783929646015167,
|
|
"num_tokens": 25018538.0,
|
|
"step": 6940
|
|
},
|
|
{
|
|
"entropy": 1.716015625,
|
|
"epoch": 1.5366500829187397,
|
|
"grad_norm": 4.541505813598633,
|
|
"learning_rate": 2.551378694121614e-06,
|
|
"loss": 1.7362,
|
|
"mean_token_accuracy": 0.5765231758356094,
|
|
"num_tokens": 25052862.0,
|
|
"step": 6950
|
|
},
|
|
{
|
|
"entropy": 1.69609375,
|
|
"epoch": 1.5388612493090106,
|
|
"grad_norm": 3.38029146194458,
|
|
"learning_rate": 2.54537019363678e-06,
|
|
"loss": 1.6861,
|
|
"mean_token_accuracy": 0.5840657472610473,
|
|
"num_tokens": 25088216.0,
|
|
"step": 6960
|
|
},
|
|
{
|
|
"entropy": 1.781640625,
|
|
"epoch": 1.5410724156992814,
|
|
"grad_norm": 3.097414255142212,
|
|
"learning_rate": 2.539361430980462e-06,
|
|
"loss": 1.7993,
|
|
"mean_token_accuracy": 0.5590603083372117,
|
|
"num_tokens": 25126093.0,
|
|
"step": 6970
|
|
},
|
|
{
|
|
"entropy": 1.73515625,
|
|
"epoch": 1.5432835820895523,
|
|
"grad_norm": 3.4769742488861084,
|
|
"learning_rate": 2.5333524408742706e-06,
|
|
"loss": 1.7433,
|
|
"mean_token_accuracy": 0.567692956328392,
|
|
"num_tokens": 25162044.0,
|
|
"step": 6980
|
|
},
|
|
{
|
|
"entropy": 1.74375,
|
|
"epoch": 1.5454947484798232,
|
|
"grad_norm": 4.057430267333984,
|
|
"learning_rate": 2.527343258041132e-06,
|
|
"loss": 1.7578,
|
|
"mean_token_accuracy": 0.5708003491163254,
|
|
"num_tokens": 25196386.0,
|
|
"step": 6990
|
|
},
|
|
{
|
|
"entropy": 1.7859375,
|
|
"epoch": 1.547705914870094,
|
|
"grad_norm": 3.487654685974121,
|
|
"learning_rate": 2.5213339172050836e-06,
|
|
"loss": 1.7859,
|
|
"mean_token_accuracy": 0.5639381110668182,
|
|
"num_tokens": 25231907.0,
|
|
"step": 7000
|
|
},
|
|
{
|
|
"epoch": 1.547705914870094,
|
|
"eval_entropy": 1.7844760572139304,
|
|
"eval_loss": 1.8325761556625366,
|
|
"eval_mean_token_accuracy": 0.5560018426150232,
|
|
"eval_num_tokens": 25231907.0,
|
|
"eval_runtime": 112.1363,
|
|
"eval_samples_per_second": 143.397,
|
|
"eval_steps_per_second": 8.962,
|
|
"step": 7000
|
|
},
|
|
{
|
|
"entropy": 1.774609375,
|
|
"epoch": 1.5499170812603649,
|
|
"grad_norm": 3.2935473918914795,
|
|
"learning_rate": 2.5153244530910797e-06,
|
|
"loss": 1.8069,
|
|
"mean_token_accuracy": 0.5632348790764808,
|
|
"num_tokens": 25266768.0,
|
|
"step": 7010
|
|
},
|
|
{
|
|
"entropy": 1.708984375,
|
|
"epoch": 1.5521282476506357,
|
|
"grad_norm": 4.052131175994873,
|
|
"learning_rate": 2.5093149004247846e-06,
|
|
"loss": 1.7369,
|
|
"mean_token_accuracy": 0.5778332084417344,
|
|
"num_tokens": 25305494.0,
|
|
"step": 7020
|
|
},
|
|
{
|
|
"entropy": 1.733203125,
|
|
"epoch": 1.5543394140409066,
|
|
"grad_norm": 3.9324333667755127,
|
|
"learning_rate": 2.503305293932374e-06,
|
|
"loss": 1.7329,
|
|
"mean_token_accuracy": 0.5739285767078399,
|
|
"num_tokens": 25341552.0,
|
|
"step": 7030
|
|
},
|
|
{
|
|
"entropy": 1.7015625,
|
|
"epoch": 1.5565505804311774,
|
|
"grad_norm": 3.629425525665283,
|
|
"learning_rate": 2.497295668340336e-06,
|
|
"loss": 1.7228,
|
|
"mean_token_accuracy": 0.5711603134870529,
|
|
"num_tokens": 25376773.0,
|
|
"step": 7040
|
|
},
|
|
{
|
|
"entropy": 1.798828125,
|
|
"epoch": 1.5587617468214483,
|
|
"grad_norm": 3.912900924682617,
|
|
"learning_rate": 2.4912860583752676e-06,
|
|
"loss": 1.8125,
|
|
"mean_token_accuracy": 0.5630194246768951,
|
|
"num_tokens": 25414473.0,
|
|
"step": 7050
|
|
},
|
|
{
|
|
"entropy": 1.76484375,
|
|
"epoch": 1.5609729132117192,
|
|
"grad_norm": 3.241807699203491,
|
|
"learning_rate": 2.485276498763675e-06,
|
|
"loss": 1.7565,
|
|
"mean_token_accuracy": 0.5685221642255783,
|
|
"num_tokens": 25451541.0,
|
|
"step": 7060
|
|
},
|
|
{
|
|
"entropy": 1.755078125,
|
|
"epoch": 1.56318407960199,
|
|
"grad_norm": 3.9236767292022705,
|
|
"learning_rate": 2.479267024231778e-06,
|
|
"loss": 1.7371,
|
|
"mean_token_accuracy": 0.5698756158351899,
|
|
"num_tokens": 25488035.0,
|
|
"step": 7070
|
|
},
|
|
{
|
|
"entropy": 1.783984375,
|
|
"epoch": 1.5653952459922609,
|
|
"grad_norm": 3.288602113723755,
|
|
"learning_rate": 2.4732576695052985e-06,
|
|
"loss": 1.7842,
|
|
"mean_token_accuracy": 0.5657739579677582,
|
|
"num_tokens": 25526334.0,
|
|
"step": 7080
|
|
},
|
|
{
|
|
"entropy": 1.833203125,
|
|
"epoch": 1.5676064123825317,
|
|
"grad_norm": 3.8555123805999756,
|
|
"learning_rate": 2.4672484693092706e-06,
|
|
"loss": 1.8197,
|
|
"mean_token_accuracy": 0.5579866766929626,
|
|
"num_tokens": 25563191.0,
|
|
"step": 7090
|
|
},
|
|
{
|
|
"entropy": 1.783984375,
|
|
"epoch": 1.5698175787728026,
|
|
"grad_norm": 3.596827745437622,
|
|
"learning_rate": 2.461239458367832e-06,
|
|
"loss": 1.7894,
|
|
"mean_token_accuracy": 0.564463523030281,
|
|
"num_tokens": 25600146.0,
|
|
"step": 7100
|
|
},
|
|
{
|
|
"entropy": 1.773828125,
|
|
"epoch": 1.5720287451630734,
|
|
"grad_norm": 3.784573554992676,
|
|
"learning_rate": 2.455230671404031e-06,
|
|
"loss": 1.7925,
|
|
"mean_token_accuracy": 0.5639462798833847,
|
|
"num_tokens": 25637307.0,
|
|
"step": 7110
|
|
},
|
|
{
|
|
"entropy": 1.782421875,
|
|
"epoch": 1.5742399115533443,
|
|
"grad_norm": 2.2928454875946045,
|
|
"learning_rate": 2.4492221431396183e-06,
|
|
"loss": 1.8091,
|
|
"mean_token_accuracy": 0.5643916323781013,
|
|
"num_tokens": 25674757.0,
|
|
"step": 7120
|
|
},
|
|
{
|
|
"entropy": 1.776171875,
|
|
"epoch": 1.5764510779436152,
|
|
"grad_norm": 4.0011091232299805,
|
|
"learning_rate": 2.44321390829485e-06,
|
|
"loss": 1.7815,
|
|
"mean_token_accuracy": 0.5631216481328011,
|
|
"num_tokens": 25711968.0,
|
|
"step": 7130
|
|
},
|
|
{
|
|
"entropy": 1.781640625,
|
|
"epoch": 1.578662244333886,
|
|
"grad_norm": 2.9508564472198486,
|
|
"learning_rate": 2.4372060015882883e-06,
|
|
"loss": 1.7604,
|
|
"mean_token_accuracy": 0.570650315284729,
|
|
"num_tokens": 25748490.0,
|
|
"step": 7140
|
|
},
|
|
{
|
|
"entropy": 1.772265625,
|
|
"epoch": 1.5808734107241569,
|
|
"grad_norm": 3.5423355102539062,
|
|
"learning_rate": 2.431198457736598e-06,
|
|
"loss": 1.8116,
|
|
"mean_token_accuracy": 0.5605478376150131,
|
|
"num_tokens": 25787322.0,
|
|
"step": 7150
|
|
},
|
|
{
|
|
"entropy": 1.7671875,
|
|
"epoch": 1.5830845771144277,
|
|
"grad_norm": 3.6493072509765625,
|
|
"learning_rate": 2.4251913114543476e-06,
|
|
"loss": 1.7745,
|
|
"mean_token_accuracy": 0.5665105938911438,
|
|
"num_tokens": 25823767.0,
|
|
"step": 7160
|
|
},
|
|
{
|
|
"entropy": 1.770703125,
|
|
"epoch": 1.5852957435046986,
|
|
"grad_norm": 2.9376003742218018,
|
|
"learning_rate": 2.4191845974538076e-06,
|
|
"loss": 1.7899,
|
|
"mean_token_accuracy": 0.5623317450284958,
|
|
"num_tokens": 25861736.0,
|
|
"step": 7170
|
|
},
|
|
{
|
|
"entropy": 1.751171875,
|
|
"epoch": 1.5875069098949695,
|
|
"grad_norm": 3.5045368671417236,
|
|
"learning_rate": 2.4131783504447525e-06,
|
|
"loss": 1.7288,
|
|
"mean_token_accuracy": 0.5731777131557465,
|
|
"num_tokens": 25898466.0,
|
|
"step": 7180
|
|
},
|
|
{
|
|
"entropy": 1.6984375,
|
|
"epoch": 1.5897180762852403,
|
|
"grad_norm": 3.567500114440918,
|
|
"learning_rate": 2.4071726051342556e-06,
|
|
"loss": 1.6779,
|
|
"mean_token_accuracy": 0.5847471922636032,
|
|
"num_tokens": 25932753.0,
|
|
"step": 7190
|
|
},
|
|
{
|
|
"entropy": 1.751171875,
|
|
"epoch": 1.5919292426755112,
|
|
"grad_norm": 3.6937148571014404,
|
|
"learning_rate": 2.4011673962264922e-06,
|
|
"loss": 1.7786,
|
|
"mean_token_accuracy": 0.5640725582838059,
|
|
"num_tokens": 25970798.0,
|
|
"step": 7200
|
|
},
|
|
{
|
|
"entropy": 1.763671875,
|
|
"epoch": 1.5941404090657822,
|
|
"grad_norm": 3.899021863937378,
|
|
"learning_rate": 2.395162758422539e-06,
|
|
"loss": 1.7695,
|
|
"mean_token_accuracy": 0.5626502573490143,
|
|
"num_tokens": 26007723.0,
|
|
"step": 7210
|
|
},
|
|
{
|
|
"entropy": 1.7546875,
|
|
"epoch": 1.596351575456053,
|
|
"grad_norm": 3.431830883026123,
|
|
"learning_rate": 2.389158726420172e-06,
|
|
"loss": 1.7786,
|
|
"mean_token_accuracy": 0.5626732289791108,
|
|
"num_tokens": 26045473.0,
|
|
"step": 7220
|
|
},
|
|
{
|
|
"entropy": 1.7328125,
|
|
"epoch": 1.598562741846324,
|
|
"grad_norm": 3.717010498046875,
|
|
"learning_rate": 2.383155334913666e-06,
|
|
"loss": 1.7261,
|
|
"mean_token_accuracy": 0.5754173040390015,
|
|
"num_tokens": 26081785.0,
|
|
"step": 7230
|
|
},
|
|
{
|
|
"entropy": 1.7546875,
|
|
"epoch": 1.6007739082365948,
|
|
"grad_norm": 4.240694522857666,
|
|
"learning_rate": 2.3771526185935932e-06,
|
|
"loss": 1.7886,
|
|
"mean_token_accuracy": 0.569563165307045,
|
|
"num_tokens": 26115163.0,
|
|
"step": 7240
|
|
},
|
|
{
|
|
"entropy": 1.753125,
|
|
"epoch": 1.6029850746268657,
|
|
"grad_norm": 3.8336782455444336,
|
|
"learning_rate": 2.3711506121466297e-06,
|
|
"loss": 1.7484,
|
|
"mean_token_accuracy": 0.5711957097053528,
|
|
"num_tokens": 26151399.0,
|
|
"step": 7250
|
|
},
|
|
{
|
|
"entropy": 1.772265625,
|
|
"epoch": 1.6051962410171365,
|
|
"grad_norm": 3.8589277267456055,
|
|
"learning_rate": 2.3651493502553445e-06,
|
|
"loss": 1.7582,
|
|
"mean_token_accuracy": 0.5644830495119095,
|
|
"num_tokens": 26187032.0,
|
|
"step": 7260
|
|
},
|
|
{
|
|
"entropy": 1.76953125,
|
|
"epoch": 1.6074074074074074,
|
|
"grad_norm": 3.483405828475952,
|
|
"learning_rate": 2.359148867598005e-06,
|
|
"loss": 1.7644,
|
|
"mean_token_accuracy": 0.5712861210107804,
|
|
"num_tokens": 26223626.0,
|
|
"step": 7270
|
|
},
|
|
{
|
|
"entropy": 1.75078125,
|
|
"epoch": 1.6096185737976783,
|
|
"grad_norm": 4.582447052001953,
|
|
"learning_rate": 2.3531491988483763e-06,
|
|
"loss": 1.7588,
|
|
"mean_token_accuracy": 0.5709590166807175,
|
|
"num_tokens": 26257913.0,
|
|
"step": 7280
|
|
},
|
|
{
|
|
"entropy": 1.762109375,
|
|
"epoch": 1.6118297401879491,
|
|
"grad_norm": 3.6897058486938477,
|
|
"learning_rate": 2.347150378675522e-06,
|
|
"loss": 1.7842,
|
|
"mean_token_accuracy": 0.5664550840854645,
|
|
"num_tokens": 26293905.0,
|
|
"step": 7290
|
|
},
|
|
{
|
|
"entropy": 1.80859375,
|
|
"epoch": 1.61404090657822,
|
|
"grad_norm": 3.458678960800171,
|
|
"learning_rate": 2.3411524417435995e-06,
|
|
"loss": 1.8238,
|
|
"mean_token_accuracy": 0.5591387033462525,
|
|
"num_tokens": 26330788.0,
|
|
"step": 7300
|
|
},
|
|
{
|
|
"entropy": 1.788671875,
|
|
"epoch": 1.6162520729684908,
|
|
"grad_norm": 4.170225143432617,
|
|
"learning_rate": 2.3351554227116648e-06,
|
|
"loss": 1.7579,
|
|
"mean_token_accuracy": 0.570235300064087,
|
|
"num_tokens": 26369704.0,
|
|
"step": 7310
|
|
},
|
|
{
|
|
"entropy": 1.759765625,
|
|
"epoch": 1.618463239358762,
|
|
"grad_norm": 4.74111270904541,
|
|
"learning_rate": 2.3291593562334664e-06,
|
|
"loss": 1.7773,
|
|
"mean_token_accuracy": 0.5653113335371017,
|
|
"num_tokens": 26405618.0,
|
|
"step": 7320
|
|
},
|
|
{
|
|
"entropy": 1.76875,
|
|
"epoch": 1.6206744057490328,
|
|
"grad_norm": 3.2384071350097656,
|
|
"learning_rate": 2.3231642769572536e-06,
|
|
"loss": 1.7815,
|
|
"mean_token_accuracy": 0.5630915135145187,
|
|
"num_tokens": 26445322.0,
|
|
"step": 7330
|
|
},
|
|
{
|
|
"entropy": 1.75859375,
|
|
"epoch": 1.6228855721393036,
|
|
"grad_norm": 4.125173568725586,
|
|
"learning_rate": 2.3171702195255667e-06,
|
|
"loss": 1.7312,
|
|
"mean_token_accuracy": 0.5690771192312241,
|
|
"num_tokens": 26482737.0,
|
|
"step": 7340
|
|
},
|
|
{
|
|
"entropy": 1.76640625,
|
|
"epoch": 1.6250967385295745,
|
|
"grad_norm": 4.30896520614624,
|
|
"learning_rate": 2.311177218575042e-06,
|
|
"loss": 1.7611,
|
|
"mean_token_accuracy": 0.568313717842102,
|
|
"num_tokens": 26521987.0,
|
|
"step": 7350
|
|
},
|
|
{
|
|
"entropy": 1.749609375,
|
|
"epoch": 1.6273079049198453,
|
|
"grad_norm": 3.631840705871582,
|
|
"learning_rate": 2.305185308736214e-06,
|
|
"loss": 1.753,
|
|
"mean_token_accuracy": 0.5710633844137192,
|
|
"num_tokens": 26558933.0,
|
|
"step": 7360
|
|
},
|
|
{
|
|
"entropy": 1.726171875,
|
|
"epoch": 1.6295190713101162,
|
|
"grad_norm": 3.4106040000915527,
|
|
"learning_rate": 2.299194524633309e-06,
|
|
"loss": 1.725,
|
|
"mean_token_accuracy": 0.5737834721803665,
|
|
"num_tokens": 26591260.0,
|
|
"step": 7370
|
|
},
|
|
{
|
|
"entropy": 1.766015625,
|
|
"epoch": 1.631730237700387,
|
|
"grad_norm": 4.189522743225098,
|
|
"learning_rate": 2.293204900884049e-06,
|
|
"loss": 1.7826,
|
|
"mean_token_accuracy": 0.566990676522255,
|
|
"num_tokens": 26628364.0,
|
|
"step": 7380
|
|
},
|
|
{
|
|
"entropy": 1.755078125,
|
|
"epoch": 1.633941404090658,
|
|
"grad_norm": 3.4339346885681152,
|
|
"learning_rate": 2.287216472099451e-06,
|
|
"loss": 1.7434,
|
|
"mean_token_accuracy": 0.5712514191865921,
|
|
"num_tokens": 26664522.0,
|
|
"step": 7390
|
|
},
|
|
{
|
|
"entropy": 1.804296875,
|
|
"epoch": 1.6361525704809288,
|
|
"grad_norm": 3.3980278968811035,
|
|
"learning_rate": 2.281229272883627e-06,
|
|
"loss": 1.7756,
|
|
"mean_token_accuracy": 0.5677028208971023,
|
|
"num_tokens": 26702454.0,
|
|
"step": 7400
|
|
},
|
|
{
|
|
"entropy": 1.771484375,
|
|
"epoch": 1.6383637368711996,
|
|
"grad_norm": 3.8581361770629883,
|
|
"learning_rate": 2.275243337833585e-06,
|
|
"loss": 1.7985,
|
|
"mean_token_accuracy": 0.5594134509563446,
|
|
"num_tokens": 26739431.0,
|
|
"step": 7410
|
|
},
|
|
{
|
|
"entropy": 1.7515625,
|
|
"epoch": 1.6405749032614705,
|
|
"grad_norm": 3.435934543609619,
|
|
"learning_rate": 2.269258701539026e-06,
|
|
"loss": 1.7703,
|
|
"mean_token_accuracy": 0.568172162771225,
|
|
"num_tokens": 26776724.0,
|
|
"step": 7420
|
|
},
|
|
{
|
|
"entropy": 1.734765625,
|
|
"epoch": 1.6427860696517413,
|
|
"grad_norm": 3.4337878227233887,
|
|
"learning_rate": 2.2632753985821474e-06,
|
|
"loss": 1.7192,
|
|
"mean_token_accuracy": 0.5746338725090027,
|
|
"num_tokens": 26812370.0,
|
|
"step": 7430
|
|
},
|
|
{
|
|
"entropy": 1.7078125,
|
|
"epoch": 1.6449972360420122,
|
|
"grad_norm": 3.4302914142608643,
|
|
"learning_rate": 2.257293463537442e-06,
|
|
"loss": 1.7571,
|
|
"mean_token_accuracy": 0.5703925579786301,
|
|
"num_tokens": 26848541.0,
|
|
"step": 7440
|
|
},
|
|
{
|
|
"entropy": 1.75390625,
|
|
"epoch": 1.647208402432283,
|
|
"grad_norm": 4.981202602386475,
|
|
"learning_rate": 2.251312930971497e-06,
|
|
"loss": 1.791,
|
|
"mean_token_accuracy": 0.5687300458550453,
|
|
"num_tokens": 26885650.0,
|
|
"step": 7450
|
|
},
|
|
{
|
|
"entropy": 1.785546875,
|
|
"epoch": 1.649419568822554,
|
|
"grad_norm": 2.636835813522339,
|
|
"learning_rate": 2.2453338354427966e-06,
|
|
"loss": 1.7378,
|
|
"mean_token_accuracy": 0.5772638648748398,
|
|
"num_tokens": 26921482.0,
|
|
"step": 7460
|
|
},
|
|
{
|
|
"entropy": 1.783984375,
|
|
"epoch": 1.6516307352128248,
|
|
"grad_norm": 3.299297332763672,
|
|
"learning_rate": 2.2393562115015216e-06,
|
|
"loss": 1.7454,
|
|
"mean_token_accuracy": 0.5685813903808594,
|
|
"num_tokens": 26957539.0,
|
|
"step": 7470
|
|
},
|
|
{
|
|
"entropy": 1.723828125,
|
|
"epoch": 1.6538419016030956,
|
|
"grad_norm": 3.5639665126800537,
|
|
"learning_rate": 2.233380093689347e-06,
|
|
"loss": 1.7303,
|
|
"mean_token_accuracy": 0.570636248588562,
|
|
"num_tokens": 26994040.0,
|
|
"step": 7480
|
|
},
|
|
{
|
|
"entropy": 1.72265625,
|
|
"epoch": 1.6560530679933665,
|
|
"grad_norm": 4.027807712554932,
|
|
"learning_rate": 2.2274055165392467e-06,
|
|
"loss": 1.7398,
|
|
"mean_token_accuracy": 0.5701359272003174,
|
|
"num_tokens": 27029109.0,
|
|
"step": 7490
|
|
},
|
|
{
|
|
"entropy": 1.7546875,
|
|
"epoch": 1.6582642343836373,
|
|
"grad_norm": 3.6100778579711914,
|
|
"learning_rate": 2.22143251457529e-06,
|
|
"loss": 1.737,
|
|
"mean_token_accuracy": 0.5729959607124329,
|
|
"num_tokens": 27062671.0,
|
|
"step": 7500
|
|
},
|
|
{
|
|
"epoch": 1.6582642343836373,
|
|
"eval_entropy": 1.7909981343283583,
|
|
"eval_loss": 1.820815086364746,
|
|
"eval_mean_token_accuracy": 0.5585399604258846,
|
|
"eval_num_tokens": 27062671.0,
|
|
"eval_runtime": 112.0715,
|
|
"eval_samples_per_second": 143.48,
|
|
"eval_steps_per_second": 8.967,
|
|
"step": 7500
|
|
},
|
|
{
|
|
"entropy": 1.791796875,
|
|
"epoch": 1.6604754007739082,
|
|
"grad_norm": 3.7595696449279785,
|
|
"learning_rate": 2.2154611223124467e-06,
|
|
"loss": 1.7695,
|
|
"mean_token_accuracy": 0.5697845876216888,
|
|
"num_tokens": 27099881.0,
|
|
"step": 7510
|
|
},
|
|
{
|
|
"entropy": 1.762109375,
|
|
"epoch": 1.662686567164179,
|
|
"grad_norm": 3.423952102661133,
|
|
"learning_rate": 2.209491374256383e-06,
|
|
"loss": 1.7715,
|
|
"mean_token_accuracy": 0.5635389596223831,
|
|
"num_tokens": 27134969.0,
|
|
"step": 7520
|
|
},
|
|
{
|
|
"entropy": 1.775,
|
|
"epoch": 1.66489773355445,
|
|
"grad_norm": 3.4782917499542236,
|
|
"learning_rate": 2.2035233049032636e-06,
|
|
"loss": 1.7704,
|
|
"mean_token_accuracy": 0.5671257078647614,
|
|
"num_tokens": 27171033.0,
|
|
"step": 7530
|
|
},
|
|
{
|
|
"entropy": 1.774609375,
|
|
"epoch": 1.6671088999447208,
|
|
"grad_norm": 3.6433393955230713,
|
|
"learning_rate": 2.197556948739553e-06,
|
|
"loss": 1.7727,
|
|
"mean_token_accuracy": 0.5640848904848099,
|
|
"num_tokens": 27207610.0,
|
|
"step": 7540
|
|
},
|
|
{
|
|
"entropy": 1.761328125,
|
|
"epoch": 1.6693200663349916,
|
|
"grad_norm": 3.8429110050201416,
|
|
"learning_rate": 2.1915923402418195e-06,
|
|
"loss": 1.738,
|
|
"mean_token_accuracy": 0.5756726711988449,
|
|
"num_tokens": 27245892.0,
|
|
"step": 7550
|
|
},
|
|
{
|
|
"entropy": 1.757421875,
|
|
"epoch": 1.6715312327252625,
|
|
"grad_norm": 4.01326847076416,
|
|
"learning_rate": 2.1856295138765276e-06,
|
|
"loss": 1.7536,
|
|
"mean_token_accuracy": 0.5707933187484742,
|
|
"num_tokens": 27285398.0,
|
|
"step": 7560
|
|
},
|
|
{
|
|
"entropy": 1.751953125,
|
|
"epoch": 1.6737423991155334,
|
|
"grad_norm": 2.605844259262085,
|
|
"learning_rate": 2.179668504099845e-06,
|
|
"loss": 1.7537,
|
|
"mean_token_accuracy": 0.5705649733543396,
|
|
"num_tokens": 27323068.0,
|
|
"step": 7570
|
|
},
|
|
{
|
|
"entropy": 1.768359375,
|
|
"epoch": 1.6759535655058042,
|
|
"grad_norm": 3.699206829071045,
|
|
"learning_rate": 2.1737093453574457e-06,
|
|
"loss": 1.7744,
|
|
"mean_token_accuracy": 0.5677089363336563,
|
|
"num_tokens": 27358752.0,
|
|
"step": 7580
|
|
},
|
|
{
|
|
"entropy": 1.774609375,
|
|
"epoch": 1.678164731896075,
|
|
"grad_norm": 3.646165370941162,
|
|
"learning_rate": 2.1677520720843035e-06,
|
|
"loss": 1.7541,
|
|
"mean_token_accuracy": 0.5704272836446762,
|
|
"num_tokens": 27396399.0,
|
|
"step": 7590
|
|
},
|
|
{
|
|
"entropy": 1.763671875,
|
|
"epoch": 1.680375898286346,
|
|
"grad_norm": 3.5304229259490967,
|
|
"learning_rate": 2.1617967187044984e-06,
|
|
"loss": 1.7404,
|
|
"mean_token_accuracy": 0.5702267676591873,
|
|
"num_tokens": 27429593.0,
|
|
"step": 7600
|
|
},
|
|
{
|
|
"entropy": 1.7390625,
|
|
"epoch": 1.6825870646766168,
|
|
"grad_norm": 3.3857970237731934,
|
|
"learning_rate": 2.1558433196310157e-06,
|
|
"loss": 1.7467,
|
|
"mean_token_accuracy": 0.5700134605169296,
|
|
"num_tokens": 27465260.0,
|
|
"step": 7610
|
|
},
|
|
{
|
|
"entropy": 1.73203125,
|
|
"epoch": 1.6847982310668876,
|
|
"grad_norm": 4.115582466125488,
|
|
"learning_rate": 2.1498919092655505e-06,
|
|
"loss": 1.7759,
|
|
"mean_token_accuracy": 0.569431459903717,
|
|
"num_tokens": 27501020.0,
|
|
"step": 7620
|
|
},
|
|
{
|
|
"entropy": 1.723046875,
|
|
"epoch": 1.6870093974571585,
|
|
"grad_norm": 3.6850368976593018,
|
|
"learning_rate": 2.1439425219983023e-06,
|
|
"loss": 1.746,
|
|
"mean_token_accuracy": 0.5700583934783936,
|
|
"num_tokens": 27538314.0,
|
|
"step": 7630
|
|
},
|
|
{
|
|
"entropy": 1.786328125,
|
|
"epoch": 1.6892205638474294,
|
|
"grad_norm": 4.318277835845947,
|
|
"learning_rate": 2.1379951922077827e-06,
|
|
"loss": 1.7814,
|
|
"mean_token_accuracy": 0.5615612238645553,
|
|
"num_tokens": 27572777.0,
|
|
"step": 7640
|
|
},
|
|
{
|
|
"entropy": 1.75390625,
|
|
"epoch": 1.6914317302377004,
|
|
"grad_norm": 3.791924476623535,
|
|
"learning_rate": 2.132049954260612e-06,
|
|
"loss": 1.7259,
|
|
"mean_token_accuracy": 0.5715990096330643,
|
|
"num_tokens": 27607045.0,
|
|
"step": 7650
|
|
},
|
|
{
|
|
"entropy": 1.7625,
|
|
"epoch": 1.6936428966279713,
|
|
"grad_norm": 4.01589822769165,
|
|
"learning_rate": 2.1261068425113257e-06,
|
|
"loss": 1.7631,
|
|
"mean_token_accuracy": 0.5656978905200958,
|
|
"num_tokens": 27643619.0,
|
|
"step": 7660
|
|
},
|
|
{
|
|
"entropy": 1.73671875,
|
|
"epoch": 1.6958540630182422,
|
|
"grad_norm": 3.9449081420898438,
|
|
"learning_rate": 2.1201658913021715e-06,
|
|
"loss": 1.7469,
|
|
"mean_token_accuracy": 0.5706801593303681,
|
|
"num_tokens": 27680442.0,
|
|
"step": 7670
|
|
},
|
|
{
|
|
"entropy": 1.741796875,
|
|
"epoch": 1.698065229408513,
|
|
"grad_norm": 3.6826679706573486,
|
|
"learning_rate": 2.1142271349629113e-06,
|
|
"loss": 1.7404,
|
|
"mean_token_accuracy": 0.5725519210100174,
|
|
"num_tokens": 27716531.0,
|
|
"step": 7680
|
|
},
|
|
{
|
|
"entropy": 1.73828125,
|
|
"epoch": 1.7002763957987839,
|
|
"grad_norm": 4.526356220245361,
|
|
"learning_rate": 2.1082906078106263e-06,
|
|
"loss": 1.7499,
|
|
"mean_token_accuracy": 0.570724093914032,
|
|
"num_tokens": 27751964.0,
|
|
"step": 7690
|
|
},
|
|
{
|
|
"entropy": 1.723828125,
|
|
"epoch": 1.7024875621890547,
|
|
"grad_norm": 3.5279245376586914,
|
|
"learning_rate": 2.1023563441495145e-06,
|
|
"loss": 1.7314,
|
|
"mean_token_accuracy": 0.5758717566728592,
|
|
"num_tokens": 27788687.0,
|
|
"step": 7700
|
|
},
|
|
{
|
|
"entropy": 1.725390625,
|
|
"epoch": 1.7046987285793256,
|
|
"grad_norm": 4.081562042236328,
|
|
"learning_rate": 2.0964243782706953e-06,
|
|
"loss": 1.7292,
|
|
"mean_token_accuracy": 0.5762430936098099,
|
|
"num_tokens": 27823669.0,
|
|
"step": 7710
|
|
},
|
|
{
|
|
"entropy": 1.759765625,
|
|
"epoch": 1.7069098949695964,
|
|
"grad_norm": 3.913522958755493,
|
|
"learning_rate": 2.0904947444520095e-06,
|
|
"loss": 1.7804,
|
|
"mean_token_accuracy": 0.5663032159209251,
|
|
"num_tokens": 27858826.0,
|
|
"step": 7720
|
|
},
|
|
{
|
|
"entropy": 1.803125,
|
|
"epoch": 1.7091210613598673,
|
|
"grad_norm": 3.434763193130493,
|
|
"learning_rate": 2.0845674769578233e-06,
|
|
"loss": 1.7993,
|
|
"mean_token_accuracy": 0.5611698776483536,
|
|
"num_tokens": 27894637.0,
|
|
"step": 7730
|
|
},
|
|
{
|
|
"entropy": 1.778515625,
|
|
"epoch": 1.7113322277501382,
|
|
"grad_norm": 4.175652980804443,
|
|
"learning_rate": 2.078642610038829e-06,
|
|
"loss": 1.7717,
|
|
"mean_token_accuracy": 0.5616742044687271,
|
|
"num_tokens": 27929790.0,
|
|
"step": 7740
|
|
},
|
|
{
|
|
"entropy": 1.746875,
|
|
"epoch": 1.713543394140409,
|
|
"grad_norm": 3.8664772510528564,
|
|
"learning_rate": 2.072720177931845e-06,
|
|
"loss": 1.7439,
|
|
"mean_token_accuracy": 0.5729645609855651,
|
|
"num_tokens": 27966519.0,
|
|
"step": 7750
|
|
},
|
|
{
|
|
"entropy": 1.733984375,
|
|
"epoch": 1.71575456053068,
|
|
"grad_norm": 4.563918590545654,
|
|
"learning_rate": 2.0668002148596224e-06,
|
|
"loss": 1.7328,
|
|
"mean_token_accuracy": 0.5739035993814469,
|
|
"num_tokens": 27999552.0,
|
|
"step": 7760
|
|
},
|
|
{
|
|
"entropy": 1.7390625,
|
|
"epoch": 1.717965726920951,
|
|
"grad_norm": 3.527977228164673,
|
|
"learning_rate": 2.0608827550306455e-06,
|
|
"loss": 1.7132,
|
|
"mean_token_accuracy": 0.5799436926841736,
|
|
"num_tokens": 28034986.0,
|
|
"step": 7770
|
|
},
|
|
{
|
|
"entropy": 1.7515625,
|
|
"epoch": 1.7201768933112218,
|
|
"grad_norm": 4.23599100112915,
|
|
"learning_rate": 2.0549678326389318e-06,
|
|
"loss": 1.7288,
|
|
"mean_token_accuracy": 0.572889119386673,
|
|
"num_tokens": 28070351.0,
|
|
"step": 7780
|
|
},
|
|
{
|
|
"entropy": 1.72265625,
|
|
"epoch": 1.7223880597014927,
|
|
"grad_norm": 2.9946486949920654,
|
|
"learning_rate": 2.0490554818638357e-06,
|
|
"loss": 1.7396,
|
|
"mean_token_accuracy": 0.5700162887573242,
|
|
"num_tokens": 28108232.0,
|
|
"step": 7790
|
|
},
|
|
{
|
|
"entropy": 1.7015625,
|
|
"epoch": 1.7245992260917635,
|
|
"grad_norm": 3.2284834384918213,
|
|
"learning_rate": 2.0431457368698553e-06,
|
|
"loss": 1.7322,
|
|
"mean_token_accuracy": 0.574472913146019,
|
|
"num_tokens": 28145432.0,
|
|
"step": 7800
|
|
},
|
|
{
|
|
"entropy": 1.710546875,
|
|
"epoch": 1.7268103924820344,
|
|
"grad_norm": 3.0827646255493164,
|
|
"learning_rate": 2.037238631806427e-06,
|
|
"loss": 1.6804,
|
|
"mean_token_accuracy": 0.582582426071167,
|
|
"num_tokens": 28182693.0,
|
|
"step": 7810
|
|
},
|
|
{
|
|
"entropy": 1.7828125,
|
|
"epoch": 1.7290215588723052,
|
|
"grad_norm": 3.5181822776794434,
|
|
"learning_rate": 2.0313342008077343e-06,
|
|
"loss": 1.7855,
|
|
"mean_token_accuracy": 0.5651570498943329,
|
|
"num_tokens": 28217956.0,
|
|
"step": 7820
|
|
},
|
|
{
|
|
"entropy": 1.777734375,
|
|
"epoch": 1.731232725262576,
|
|
"grad_norm": 2.82606840133667,
|
|
"learning_rate": 2.0254324779925076e-06,
|
|
"loss": 1.7598,
|
|
"mean_token_accuracy": 0.5681768357753754,
|
|
"num_tokens": 28255794.0,
|
|
"step": 7830
|
|
},
|
|
{
|
|
"entropy": 1.751953125,
|
|
"epoch": 1.733443891652847,
|
|
"grad_norm": 4.586568832397461,
|
|
"learning_rate": 2.0195334974638308e-06,
|
|
"loss": 1.761,
|
|
"mean_token_accuracy": 0.5662160098552704,
|
|
"num_tokens": 28288371.0,
|
|
"step": 7840
|
|
},
|
|
{
|
|
"entropy": 1.790234375,
|
|
"epoch": 1.7356550580431178,
|
|
"grad_norm": 3.811717987060547,
|
|
"learning_rate": 2.013637293308938e-06,
|
|
"loss": 1.8135,
|
|
"mean_token_accuracy": 0.5562566369771957,
|
|
"num_tokens": 28325742.0,
|
|
"step": 7850
|
|
},
|
|
{
|
|
"entropy": 1.7484375,
|
|
"epoch": 1.7378662244333887,
|
|
"grad_norm": 3.411470890045166,
|
|
"learning_rate": 2.0077438995990225e-06,
|
|
"loss": 1.7209,
|
|
"mean_token_accuracy": 0.5750664860010147,
|
|
"num_tokens": 28358620.0,
|
|
"step": 7860
|
|
},
|
|
{
|
|
"entropy": 1.78515625,
|
|
"epoch": 1.7400773908236595,
|
|
"grad_norm": 3.5559356212615967,
|
|
"learning_rate": 2.001853350389035e-06,
|
|
"loss": 1.7753,
|
|
"mean_token_accuracy": 0.565812686085701,
|
|
"num_tokens": 28397403.0,
|
|
"step": 7870
|
|
},
|
|
{
|
|
"entropy": 1.738671875,
|
|
"epoch": 1.7422885572139304,
|
|
"grad_norm": 3.3087964057922363,
|
|
"learning_rate": 1.9959656797174925e-06,
|
|
"loss": 1.7353,
|
|
"mean_token_accuracy": 0.5672001123428345,
|
|
"num_tokens": 28431658.0,
|
|
"step": 7880
|
|
},
|
|
{
|
|
"entropy": 1.69296875,
|
|
"epoch": 1.7444997236042012,
|
|
"grad_norm": 3.081078052520752,
|
|
"learning_rate": 1.9900809216062765e-06,
|
|
"loss": 1.722,
|
|
"mean_token_accuracy": 0.5780637085437774,
|
|
"num_tokens": 28467568.0,
|
|
"step": 7890
|
|
},
|
|
{
|
|
"entropy": 1.750390625,
|
|
"epoch": 1.746710889994472,
|
|
"grad_norm": 3.4102554321289062,
|
|
"learning_rate": 1.9841991100604366e-06,
|
|
"loss": 1.7596,
|
|
"mean_token_accuracy": 0.5691831529140472,
|
|
"num_tokens": 28503904.0,
|
|
"step": 7900
|
|
},
|
|
{
|
|
"entropy": 1.759375,
|
|
"epoch": 1.748922056384743,
|
|
"grad_norm": 4.3687872886657715,
|
|
"learning_rate": 1.978320279068e-06,
|
|
"loss": 1.7903,
|
|
"mean_token_accuracy": 0.5672489494085312,
|
|
"num_tokens": 28542784.0,
|
|
"step": 7910
|
|
},
|
|
{
|
|
"entropy": 1.741796875,
|
|
"epoch": 1.7511332227750138,
|
|
"grad_norm": 4.317598819732666,
|
|
"learning_rate": 1.9724444625997676e-06,
|
|
"loss": 1.734,
|
|
"mean_token_accuracy": 0.5699514597654343,
|
|
"num_tokens": 28577634.0,
|
|
"step": 7920
|
|
},
|
|
{
|
|
"entropy": 1.720703125,
|
|
"epoch": 1.7533443891652847,
|
|
"grad_norm": 4.00547981262207,
|
|
"learning_rate": 1.9665716946091213e-06,
|
|
"loss": 1.7611,
|
|
"mean_token_accuracy": 0.5745073556900024,
|
|
"num_tokens": 28616124.0,
|
|
"step": 7930
|
|
},
|
|
{
|
|
"entropy": 1.742578125,
|
|
"epoch": 1.7555555555555555,
|
|
"grad_norm": 3.915745258331299,
|
|
"learning_rate": 1.960702009031827e-06,
|
|
"loss": 1.7267,
|
|
"mean_token_accuracy": 0.5761003434658051,
|
|
"num_tokens": 28650383.0,
|
|
"step": 7940
|
|
},
|
|
{
|
|
"entropy": 1.73828125,
|
|
"epoch": 1.7577667219458264,
|
|
"grad_norm": 3.7228305339813232,
|
|
"learning_rate": 1.9548354397858406e-06,
|
|
"loss": 1.7451,
|
|
"mean_token_accuracy": 0.5721576631069183,
|
|
"num_tokens": 28684524.0,
|
|
"step": 7950
|
|
},
|
|
{
|
|
"entropy": 1.784375,
|
|
"epoch": 1.7599778883360973,
|
|
"grad_norm": 3.9681882858276367,
|
|
"learning_rate": 1.948972020771109e-06,
|
|
"loss": 1.7946,
|
|
"mean_token_accuracy": 0.5612717270851135,
|
|
"num_tokens": 28720087.0,
|
|
"step": 7960
|
|
},
|
|
{
|
|
"entropy": 1.74765625,
|
|
"epoch": 1.762189054726368,
|
|
"grad_norm": 3.758746862411499,
|
|
"learning_rate": 1.9431117858693764e-06,
|
|
"loss": 1.7385,
|
|
"mean_token_accuracy": 0.5739440441131591,
|
|
"num_tokens": 28756343.0,
|
|
"step": 7970
|
|
},
|
|
{
|
|
"entropy": 1.76875,
|
|
"epoch": 1.764400221116639,
|
|
"grad_norm": 4.041624546051025,
|
|
"learning_rate": 1.937254768943986e-06,
|
|
"loss": 1.7601,
|
|
"mean_token_accuracy": 0.5669008567929268,
|
|
"num_tokens": 28793192.0,
|
|
"step": 7980
|
|
},
|
|
{
|
|
"entropy": 1.70078125,
|
|
"epoch": 1.7666113875069098,
|
|
"grad_norm": 3.514730930328369,
|
|
"learning_rate": 1.9314010038396872e-06,
|
|
"loss": 1.7243,
|
|
"mean_token_accuracy": 0.5738515079021453,
|
|
"num_tokens": 28830690.0,
|
|
"step": 7990
|
|
},
|
|
{
|
|
"entropy": 1.72109375,
|
|
"epoch": 1.7688225538971807,
|
|
"grad_norm": 3.3707940578460693,
|
|
"learning_rate": 1.9255505243824387e-06,
|
|
"loss": 1.7275,
|
|
"mean_token_accuracy": 0.5717095464468003,
|
|
"num_tokens": 28866320.0,
|
|
"step": 8000
|
|
},
|
|
{
|
|
"epoch": 1.7688225538971807,
|
|
"eval_entropy": 1.7527985074626866,
|
|
"eval_loss": 1.8116077184677124,
|
|
"eval_mean_token_accuracy": 0.5600321406748757,
|
|
"eval_num_tokens": 28866320.0,
|
|
"eval_runtime": 112.3694,
|
|
"eval_samples_per_second": 143.099,
|
|
"eval_steps_per_second": 8.944,
|
|
"step": 8000
|
|
},
|
|
{
|
|
"entropy": 1.695703125,
|
|
"epoch": 1.7710337202874515,
|
|
"grad_norm": 3.481527805328369,
|
|
"learning_rate": 1.9197033643792124e-06,
|
|
"loss": 1.6943,
|
|
"mean_token_accuracy": 0.5820229351520538,
|
|
"num_tokens": 28901213.0,
|
|
"step": 8010
|
|
},
|
|
{
|
|
"entropy": 1.69296875,
|
|
"epoch": 1.7732448866777224,
|
|
"grad_norm": 3.673452138900757,
|
|
"learning_rate": 1.9138595576178e-06,
|
|
"loss": 1.6959,
|
|
"mean_token_accuracy": 0.5805958807468414,
|
|
"num_tokens": 28935630.0,
|
|
"step": 8020
|
|
},
|
|
{
|
|
"entropy": 1.71171875,
|
|
"epoch": 1.7754560530679933,
|
|
"grad_norm": 3.4650521278381348,
|
|
"learning_rate": 1.908019137866616e-06,
|
|
"loss": 1.7152,
|
|
"mean_token_accuracy": 0.5756863653659821,
|
|
"num_tokens": 28973740.0,
|
|
"step": 8030
|
|
},
|
|
{
|
|
"entropy": 1.79609375,
|
|
"epoch": 1.7776672194582641,
|
|
"grad_norm": 3.155453681945801,
|
|
"learning_rate": 1.902182138874502e-06,
|
|
"loss": 1.786,
|
|
"mean_token_accuracy": 0.5642720311880112,
|
|
"num_tokens": 29012165.0,
|
|
"step": 8040
|
|
},
|
|
{
|
|
"entropy": 1.746484375,
|
|
"epoch": 1.779878385848535,
|
|
"grad_norm": 3.613926887512207,
|
|
"learning_rate": 1.896348594370533e-06,
|
|
"loss": 1.7538,
|
|
"mean_token_accuracy": 0.5782447338104248,
|
|
"num_tokens": 29049685.0,
|
|
"step": 8050
|
|
},
|
|
{
|
|
"entropy": 1.701953125,
|
|
"epoch": 1.7820895522388058,
|
|
"grad_norm": 3.7910702228546143,
|
|
"learning_rate": 1.8905185380638244e-06,
|
|
"loss": 1.671,
|
|
"mean_token_accuracy": 0.5876582473516464,
|
|
"num_tokens": 29084806.0,
|
|
"step": 8060
|
|
},
|
|
{
|
|
"entropy": 1.729296875,
|
|
"epoch": 1.7843007186290767,
|
|
"grad_norm": 3.83339262008667,
|
|
"learning_rate": 1.884692003643333e-06,
|
|
"loss": 1.7231,
|
|
"mean_token_accuracy": 0.5751573115587234,
|
|
"num_tokens": 29119211.0,
|
|
"step": 8070
|
|
},
|
|
{
|
|
"entropy": 1.7546875,
|
|
"epoch": 1.7865118850193475,
|
|
"grad_norm": 3.8487260341644287,
|
|
"learning_rate": 1.8788690247776648e-06,
|
|
"loss": 1.7558,
|
|
"mean_token_accuracy": 0.5674388974905014,
|
|
"num_tokens": 29153177.0,
|
|
"step": 8080
|
|
},
|
|
{
|
|
"entropy": 1.75546875,
|
|
"epoch": 1.7887230514096186,
|
|
"grad_norm": 3.1663689613342285,
|
|
"learning_rate": 1.8730496351148785e-06,
|
|
"loss": 1.7585,
|
|
"mean_token_accuracy": 0.5690556049346924,
|
|
"num_tokens": 29190018.0,
|
|
"step": 8090
|
|
},
|
|
{
|
|
"entropy": 1.7171875,
|
|
"epoch": 1.7909342177998895,
|
|
"grad_norm": 3.591547966003418,
|
|
"learning_rate": 1.8672338682822974e-06,
|
|
"loss": 1.7004,
|
|
"mean_token_accuracy": 0.5772475987672806,
|
|
"num_tokens": 29225792.0,
|
|
"step": 8100
|
|
},
|
|
{
|
|
"entropy": 1.73203125,
|
|
"epoch": 1.7931453841901603,
|
|
"grad_norm": 4.373234272003174,
|
|
"learning_rate": 1.8614217578863053e-06,
|
|
"loss": 1.7316,
|
|
"mean_token_accuracy": 0.5656394362449646,
|
|
"num_tokens": 29261067.0,
|
|
"step": 8110
|
|
},
|
|
{
|
|
"entropy": 1.755078125,
|
|
"epoch": 1.7953565505804312,
|
|
"grad_norm": 3.215458631515503,
|
|
"learning_rate": 1.8556133375121585e-06,
|
|
"loss": 1.7374,
|
|
"mean_token_accuracy": 0.5738924205303192,
|
|
"num_tokens": 29298442.0,
|
|
"step": 8120
|
|
},
|
|
{
|
|
"entropy": 1.758203125,
|
|
"epoch": 1.797567716970702,
|
|
"grad_norm": 3.753331184387207,
|
|
"learning_rate": 1.849808640723793e-06,
|
|
"loss": 1.7564,
|
|
"mean_token_accuracy": 0.5726885080337525,
|
|
"num_tokens": 29335921.0,
|
|
"step": 8130
|
|
},
|
|
{
|
|
"entropy": 1.7703125,
|
|
"epoch": 1.799778883360973,
|
|
"grad_norm": 3.0127716064453125,
|
|
"learning_rate": 1.8440077010636254e-06,
|
|
"loss": 1.7572,
|
|
"mean_token_accuracy": 0.5741880804300308,
|
|
"num_tokens": 29370675.0,
|
|
"step": 8140
|
|
},
|
|
{
|
|
"entropy": 1.726171875,
|
|
"epoch": 1.8019900497512438,
|
|
"grad_norm": 4.160800933837891,
|
|
"learning_rate": 1.8382105520523619e-06,
|
|
"loss": 1.7321,
|
|
"mean_token_accuracy": 0.5715920597314834,
|
|
"num_tokens": 29407781.0,
|
|
"step": 8150
|
|
},
|
|
{
|
|
"entropy": 1.75078125,
|
|
"epoch": 1.8042012161415146,
|
|
"grad_norm": 3.4418046474456787,
|
|
"learning_rate": 1.8324172271888053e-06,
|
|
"loss": 1.7375,
|
|
"mean_token_accuracy": 0.5746371477842331,
|
|
"num_tokens": 29448176.0,
|
|
"step": 8160
|
|
},
|
|
{
|
|
"entropy": 1.743359375,
|
|
"epoch": 1.8064123825317855,
|
|
"grad_norm": 3.2298433780670166,
|
|
"learning_rate": 1.8266277599496612e-06,
|
|
"loss": 1.7545,
|
|
"mean_token_accuracy": 0.5719492465257645,
|
|
"num_tokens": 29484387.0,
|
|
"step": 8170
|
|
},
|
|
{
|
|
"entropy": 1.73671875,
|
|
"epoch": 1.8086235489220563,
|
|
"grad_norm": 3.3115484714508057,
|
|
"learning_rate": 1.820842183789343e-06,
|
|
"loss": 1.7536,
|
|
"mean_token_accuracy": 0.5727066189050675,
|
|
"num_tokens": 29522170.0,
|
|
"step": 8180
|
|
},
|
|
{
|
|
"entropy": 1.7703125,
|
|
"epoch": 1.8108347153123272,
|
|
"grad_norm": 3.204620122909546,
|
|
"learning_rate": 1.8150605321397797e-06,
|
|
"loss": 1.7552,
|
|
"mean_token_accuracy": 0.5682245850563049,
|
|
"num_tokens": 29558595.0,
|
|
"step": 8190
|
|
},
|
|
{
|
|
"entropy": 1.73125,
|
|
"epoch": 1.8130458817025983,
|
|
"grad_norm": 3.874518632888794,
|
|
"learning_rate": 1.8092828384102206e-06,
|
|
"loss": 1.7167,
|
|
"mean_token_accuracy": 0.5744330048561096,
|
|
"num_tokens": 29592925.0,
|
|
"step": 8200
|
|
},
|
|
{
|
|
"entropy": 1.7328125,
|
|
"epoch": 1.8152570480928691,
|
|
"grad_norm": 3.6139872074127197,
|
|
"learning_rate": 1.8035091359870487e-06,
|
|
"loss": 1.7512,
|
|
"mean_token_accuracy": 0.569906759262085,
|
|
"num_tokens": 29627461.0,
|
|
"step": 8210
|
|
},
|
|
{
|
|
"entropy": 1.7765625,
|
|
"epoch": 1.81746821448314,
|
|
"grad_norm": 2.622617244720459,
|
|
"learning_rate": 1.79773945823358e-06,
|
|
"loss": 1.7991,
|
|
"mean_token_accuracy": 0.5663322985172272,
|
|
"num_tokens": 29664661.0,
|
|
"step": 8220
|
|
},
|
|
{
|
|
"entropy": 1.746484375,
|
|
"epoch": 1.8196793808734109,
|
|
"grad_norm": 3.4388933181762695,
|
|
"learning_rate": 1.7919738384898738e-06,
|
|
"loss": 1.7462,
|
|
"mean_token_accuracy": 0.5731872946023941,
|
|
"num_tokens": 29701634.0,
|
|
"step": 8230
|
|
},
|
|
{
|
|
"entropy": 1.742578125,
|
|
"epoch": 1.8218905472636817,
|
|
"grad_norm": 3.3022141456604004,
|
|
"learning_rate": 1.7862123100725407e-06,
|
|
"loss": 1.7382,
|
|
"mean_token_accuracy": 0.5729328274726868,
|
|
"num_tokens": 29737527.0,
|
|
"step": 8240
|
|
},
|
|
{
|
|
"entropy": 1.733984375,
|
|
"epoch": 1.8241017136539526,
|
|
"grad_norm": 3.491898775100708,
|
|
"learning_rate": 1.7804549062745505e-06,
|
|
"loss": 1.7091,
|
|
"mean_token_accuracy": 0.5717461258172989,
|
|
"num_tokens": 29770674.0,
|
|
"step": 8250
|
|
},
|
|
{
|
|
"entropy": 1.765625,
|
|
"epoch": 1.8263128800442234,
|
|
"grad_norm": 4.191249847412109,
|
|
"learning_rate": 1.7747016603650388e-06,
|
|
"loss": 1.7792,
|
|
"mean_token_accuracy": 0.561087554693222,
|
|
"num_tokens": 29807063.0,
|
|
"step": 8260
|
|
},
|
|
{
|
|
"entropy": 1.773046875,
|
|
"epoch": 1.8285240464344943,
|
|
"grad_norm": 3.579638957977295,
|
|
"learning_rate": 1.7689526055891132e-06,
|
|
"loss": 1.7735,
|
|
"mean_token_accuracy": 0.564491230249405,
|
|
"num_tokens": 29842098.0,
|
|
"step": 8270
|
|
},
|
|
{
|
|
"entropy": 1.732421875,
|
|
"epoch": 1.8307352128247651,
|
|
"grad_norm": 3.7996206283569336,
|
|
"learning_rate": 1.7632077751676651e-06,
|
|
"loss": 1.6988,
|
|
"mean_token_accuracy": 0.5789406001567841,
|
|
"num_tokens": 29876933.0,
|
|
"step": 8280
|
|
},
|
|
{
|
|
"entropy": 1.7421875,
|
|
"epoch": 1.832946379215036,
|
|
"grad_norm": 4.05126428604126,
|
|
"learning_rate": 1.757467202297174e-06,
|
|
"loss": 1.7442,
|
|
"mean_token_accuracy": 0.5745589852333068,
|
|
"num_tokens": 29912814.0,
|
|
"step": 8290
|
|
},
|
|
{
|
|
"entropy": 1.728515625,
|
|
"epoch": 1.8351575456053069,
|
|
"grad_norm": 4.31002140045166,
|
|
"learning_rate": 1.7517309201495174e-06,
|
|
"loss": 1.7584,
|
|
"mean_token_accuracy": 0.5702622473239899,
|
|
"num_tokens": 29949570.0,
|
|
"step": 8300
|
|
},
|
|
{
|
|
"entropy": 1.749609375,
|
|
"epoch": 1.8373687119955777,
|
|
"grad_norm": 3.5952541828155518,
|
|
"learning_rate": 1.7459989618717776e-06,
|
|
"loss": 1.7473,
|
|
"mean_token_accuracy": 0.5745158642530441,
|
|
"num_tokens": 29989000.0,
|
|
"step": 8310
|
|
},
|
|
{
|
|
"entropy": 1.78125,
|
|
"epoch": 1.8395798783858486,
|
|
"grad_norm": 2.8128936290740967,
|
|
"learning_rate": 1.7402713605860555e-06,
|
|
"loss": 1.7589,
|
|
"mean_token_accuracy": 0.5652533769607544,
|
|
"num_tokens": 30025020.0,
|
|
"step": 8320
|
|
},
|
|
{
|
|
"entropy": 1.738671875,
|
|
"epoch": 1.8417910447761194,
|
|
"grad_norm": 3.7733871936798096,
|
|
"learning_rate": 1.734548149389271e-06,
|
|
"loss": 1.7434,
|
|
"mean_token_accuracy": 0.5714739739894867,
|
|
"num_tokens": 30061202.0,
|
|
"step": 8330
|
|
},
|
|
{
|
|
"entropy": 1.69375,
|
|
"epoch": 1.8440022111663903,
|
|
"grad_norm": 3.79392147064209,
|
|
"learning_rate": 1.7288293613529774e-06,
|
|
"loss": 1.7055,
|
|
"mean_token_accuracy": 0.5750734001398087,
|
|
"num_tokens": 30096752.0,
|
|
"step": 8340
|
|
},
|
|
{
|
|
"entropy": 1.7734375,
|
|
"epoch": 1.8462133775566612,
|
|
"grad_norm": 3.157735824584961,
|
|
"learning_rate": 1.723115029523168e-06,
|
|
"loss": 1.7789,
|
|
"mean_token_accuracy": 0.5671907365322113,
|
|
"num_tokens": 30130459.0,
|
|
"step": 8350
|
|
},
|
|
{
|
|
"entropy": 1.73359375,
|
|
"epoch": 1.848424543946932,
|
|
"grad_norm": 3.359495162963867,
|
|
"learning_rate": 1.7174051869200887e-06,
|
|
"loss": 1.6788,
|
|
"mean_token_accuracy": 0.581543755531311,
|
|
"num_tokens": 30165150.0,
|
|
"step": 8360
|
|
},
|
|
{
|
|
"entropy": 1.744140625,
|
|
"epoch": 1.8506357103372029,
|
|
"grad_norm": 3.7475826740264893,
|
|
"learning_rate": 1.711699866538041e-06,
|
|
"loss": 1.7498,
|
|
"mean_token_accuracy": 0.5735862344503403,
|
|
"num_tokens": 30200732.0,
|
|
"step": 8370
|
|
},
|
|
{
|
|
"entropy": 1.746484375,
|
|
"epoch": 1.8528468767274737,
|
|
"grad_norm": 3.309199333190918,
|
|
"learning_rate": 1.7059991013451954e-06,
|
|
"loss": 1.7277,
|
|
"mean_token_accuracy": 0.5712708473205567,
|
|
"num_tokens": 30238890.0,
|
|
"step": 8380
|
|
},
|
|
{
|
|
"entropy": 1.698046875,
|
|
"epoch": 1.8550580431177446,
|
|
"grad_norm": 3.6902072429656982,
|
|
"learning_rate": 1.7003029242834031e-06,
|
|
"loss": 1.7018,
|
|
"mean_token_accuracy": 0.5787638515233994,
|
|
"num_tokens": 30272044.0,
|
|
"step": 8390
|
|
},
|
|
{
|
|
"entropy": 1.759765625,
|
|
"epoch": 1.8572692095080154,
|
|
"grad_norm": 3.4713850021362305,
|
|
"learning_rate": 1.694611368268e-06,
|
|
"loss": 1.766,
|
|
"mean_token_accuracy": 0.5663641974329948,
|
|
"num_tokens": 30310881.0,
|
|
"step": 8400
|
|
},
|
|
{
|
|
"entropy": 1.72421875,
|
|
"epoch": 1.8594803758982863,
|
|
"grad_norm": 3.426764965057373,
|
|
"learning_rate": 1.6889244661876191e-06,
|
|
"loss": 1.7464,
|
|
"mean_token_accuracy": 0.5717824459075928,
|
|
"num_tokens": 30346318.0,
|
|
"step": 8410
|
|
},
|
|
{
|
|
"entropy": 1.787109375,
|
|
"epoch": 1.8616915422885572,
|
|
"grad_norm": 3.535482406616211,
|
|
"learning_rate": 1.6832422509040014e-06,
|
|
"loss": 1.8229,
|
|
"mean_token_accuracy": 0.5620052516460419,
|
|
"num_tokens": 30383522.0,
|
|
"step": 8420
|
|
},
|
|
{
|
|
"entropy": 1.70078125,
|
|
"epoch": 1.863902708678828,
|
|
"grad_norm": 4.048870086669922,
|
|
"learning_rate": 1.677564755251807e-06,
|
|
"loss": 1.6861,
|
|
"mean_token_accuracy": 0.5872763484716416,
|
|
"num_tokens": 30419199.0,
|
|
"step": 8430
|
|
},
|
|
{
|
|
"entropy": 1.70546875,
|
|
"epoch": 1.8661138750690989,
|
|
"grad_norm": 3.500356435775757,
|
|
"learning_rate": 1.6718920120384213e-06,
|
|
"loss": 1.7283,
|
|
"mean_token_accuracy": 0.5689642608165741,
|
|
"num_tokens": 30456837.0,
|
|
"step": 8440
|
|
},
|
|
{
|
|
"entropy": 1.745703125,
|
|
"epoch": 1.8683250414593697,
|
|
"grad_norm": 3.2823715209960938,
|
|
"learning_rate": 1.6662240540437686e-06,
|
|
"loss": 1.748,
|
|
"mean_token_accuracy": 0.5728102922439575,
|
|
"num_tokens": 30496203.0,
|
|
"step": 8450
|
|
},
|
|
{
|
|
"entropy": 1.75546875,
|
|
"epoch": 1.8705362078496406,
|
|
"grad_norm": 4.411621570587158,
|
|
"learning_rate": 1.6605609140201205e-06,
|
|
"loss": 1.7518,
|
|
"mean_token_accuracy": 0.5735918387770653,
|
|
"num_tokens": 30532423.0,
|
|
"step": 8460
|
|
},
|
|
{
|
|
"entropy": 1.76328125,
|
|
"epoch": 1.8727473742399114,
|
|
"grad_norm": 3.37626051902771,
|
|
"learning_rate": 1.6549026246919114e-06,
|
|
"loss": 1.7493,
|
|
"mean_token_accuracy": 0.5716759324073791,
|
|
"num_tokens": 30567500.0,
|
|
"step": 8470
|
|
},
|
|
{
|
|
"entropy": 1.732421875,
|
|
"epoch": 1.8749585406301823,
|
|
"grad_norm": 3.8107094764709473,
|
|
"learning_rate": 1.6492492187555429e-06,
|
|
"loss": 1.6939,
|
|
"mean_token_accuracy": 0.5784647166728973,
|
|
"num_tokens": 30602362.0,
|
|
"step": 8480
|
|
},
|
|
{
|
|
"entropy": 1.719921875,
|
|
"epoch": 1.8771697070204532,
|
|
"grad_norm": 3.459578514099121,
|
|
"learning_rate": 1.643600728879198e-06,
|
|
"loss": 1.7421,
|
|
"mean_token_accuracy": 0.574610584974289,
|
|
"num_tokens": 30639719.0,
|
|
"step": 8490
|
|
},
|
|
{
|
|
"entropy": 1.712109375,
|
|
"epoch": 1.879380873410724,
|
|
"grad_norm": 3.9836461544036865,
|
|
"learning_rate": 1.637957187702654e-06,
|
|
"loss": 1.7251,
|
|
"mean_token_accuracy": 0.577015432715416,
|
|
"num_tokens": 30675424.0,
|
|
"step": 8500
|
|
},
|
|
{
|
|
"epoch": 1.879380873410724,
|
|
"eval_entropy": 1.754158893034826,
|
|
"eval_loss": 1.8024015426635742,
|
|
"eval_mean_token_accuracy": 0.5620353238796121,
|
|
"eval_num_tokens": 30675424.0,
|
|
"eval_runtime": 112.0371,
|
|
"eval_samples_per_second": 143.524,
|
|
"eval_steps_per_second": 8.97,
|
|
"step": 8500
|
|
},
|
|
{
|
|
"entropy": 1.727734375,
|
|
"epoch": 1.8815920398009949,
|
|
"grad_norm": 3.5092110633850098,
|
|
"learning_rate": 1.6323186278370913e-06,
|
|
"loss": 1.711,
|
|
"mean_token_accuracy": 0.577846622467041,
|
|
"num_tokens": 30712297.0,
|
|
"step": 8510
|
|
},
|
|
{
|
|
"entropy": 1.75,
|
|
"epoch": 1.8838032061912657,
|
|
"grad_norm": 4.088970184326172,
|
|
"learning_rate": 1.6266850818649056e-06,
|
|
"loss": 1.7581,
|
|
"mean_token_accuracy": 0.567107206583023,
|
|
"num_tokens": 30746543.0,
|
|
"step": 8520
|
|
},
|
|
{
|
|
"entropy": 1.711328125,
|
|
"epoch": 1.8860143725815368,
|
|
"grad_norm": 3.663259744644165,
|
|
"learning_rate": 1.6210565823395195e-06,
|
|
"loss": 1.7078,
|
|
"mean_token_accuracy": 0.574769452214241,
|
|
"num_tokens": 30780720.0,
|
|
"step": 8530
|
|
},
|
|
{
|
|
"entropy": 1.6984375,
|
|
"epoch": 1.8882255389718077,
|
|
"grad_norm": 3.715101957321167,
|
|
"learning_rate": 1.6154331617851963e-06,
|
|
"loss": 1.6996,
|
|
"mean_token_accuracy": 0.582516434788704,
|
|
"num_tokens": 30816751.0,
|
|
"step": 8540
|
|
},
|
|
{
|
|
"entropy": 1.7,
|
|
"epoch": 1.8904367053620785,
|
|
"grad_norm": 3.5320138931274414,
|
|
"learning_rate": 1.6098148526968488e-06,
|
|
"loss": 1.7055,
|
|
"mean_token_accuracy": 0.5797714412212371,
|
|
"num_tokens": 30852172.0,
|
|
"step": 8550
|
|
},
|
|
{
|
|
"entropy": 1.709765625,
|
|
"epoch": 1.8926478717523494,
|
|
"grad_norm": 3.5932626724243164,
|
|
"learning_rate": 1.604201687539853e-06,
|
|
"loss": 1.7335,
|
|
"mean_token_accuracy": 0.5764575719833374,
|
|
"num_tokens": 30887850.0,
|
|
"step": 8560
|
|
},
|
|
{
|
|
"entropy": 1.726953125,
|
|
"epoch": 1.8948590381426202,
|
|
"grad_norm": 3.6895172595977783,
|
|
"learning_rate": 1.5985936987498629e-06,
|
|
"loss": 1.752,
|
|
"mean_token_accuracy": 0.5675917476415634,
|
|
"num_tokens": 30925112.0,
|
|
"step": 8570
|
|
},
|
|
{
|
|
"entropy": 1.729296875,
|
|
"epoch": 1.897070204532891,
|
|
"grad_norm": 2.9210522174835205,
|
|
"learning_rate": 1.5929909187326193e-06,
|
|
"loss": 1.7398,
|
|
"mean_token_accuracy": 0.5717852294445038,
|
|
"num_tokens": 30962376.0,
|
|
"step": 8580
|
|
},
|
|
{
|
|
"entropy": 1.7328125,
|
|
"epoch": 1.899281370923162,
|
|
"grad_norm": 3.673238754272461,
|
|
"learning_rate": 1.5873933798637642e-06,
|
|
"loss": 1.7095,
|
|
"mean_token_accuracy": 0.5786424428224564,
|
|
"num_tokens": 30999352.0,
|
|
"step": 8590
|
|
},
|
|
{
|
|
"entropy": 1.73046875,
|
|
"epoch": 1.9014925373134328,
|
|
"grad_norm": 4.024681091308594,
|
|
"learning_rate": 1.581801114488653e-06,
|
|
"loss": 1.7034,
|
|
"mean_token_accuracy": 0.5814568758010864,
|
|
"num_tokens": 31037428.0,
|
|
"step": 8600
|
|
},
|
|
{
|
|
"entropy": 1.742578125,
|
|
"epoch": 1.9037037037037037,
|
|
"grad_norm": 3.858382225036621,
|
|
"learning_rate": 1.5762141549221704e-06,
|
|
"loss": 1.7278,
|
|
"mean_token_accuracy": 0.5759885489940644,
|
|
"num_tokens": 31074806.0,
|
|
"step": 8610
|
|
},
|
|
{
|
|
"entropy": 1.7078125,
|
|
"epoch": 1.9059148700939745,
|
|
"grad_norm": 4.027462005615234,
|
|
"learning_rate": 1.57063253344854e-06,
|
|
"loss": 1.7053,
|
|
"mean_token_accuracy": 0.5763076961040496,
|
|
"num_tokens": 31111013.0,
|
|
"step": 8620
|
|
},
|
|
{
|
|
"entropy": 1.732421875,
|
|
"epoch": 1.9081260364842454,
|
|
"grad_norm": 4.843277454376221,
|
|
"learning_rate": 1.5650562823211389e-06,
|
|
"loss": 1.7096,
|
|
"mean_token_accuracy": 0.5769873410463333,
|
|
"num_tokens": 31148152.0,
|
|
"step": 8630
|
|
},
|
|
{
|
|
"entropy": 1.728125,
|
|
"epoch": 1.9103372028745165,
|
|
"grad_norm": 3.5383851528167725,
|
|
"learning_rate": 1.559485433762311e-06,
|
|
"loss": 1.7287,
|
|
"mean_token_accuracy": 0.574589541554451,
|
|
"num_tokens": 31184565.0,
|
|
"step": 8640
|
|
},
|
|
{
|
|
"entropy": 1.704296875,
|
|
"epoch": 1.9125483692647873,
|
|
"grad_norm": 3.0316293239593506,
|
|
"learning_rate": 1.5539200199631848e-06,
|
|
"loss": 1.7022,
|
|
"mean_token_accuracy": 0.5772084563970565,
|
|
"num_tokens": 31221517.0,
|
|
"step": 8650
|
|
},
|
|
{
|
|
"entropy": 1.7046875,
|
|
"epoch": 1.9147595356550582,
|
|
"grad_norm": 4.197947025299072,
|
|
"learning_rate": 1.5483600730834814e-06,
|
|
"loss": 1.7201,
|
|
"mean_token_accuracy": 0.5785938739776612,
|
|
"num_tokens": 31256175.0,
|
|
"step": 8660
|
|
},
|
|
{
|
|
"entropy": 1.71875,
|
|
"epoch": 1.916970702045329,
|
|
"grad_norm": 4.4617533683776855,
|
|
"learning_rate": 1.5428056252513312e-06,
|
|
"loss": 1.7234,
|
|
"mean_token_accuracy": 0.5795243799686431,
|
|
"num_tokens": 31291196.0,
|
|
"step": 8670
|
|
},
|
|
{
|
|
"entropy": 1.772265625,
|
|
"epoch": 1.9191818684356,
|
|
"grad_norm": 3.776618480682373,
|
|
"learning_rate": 1.5372567085630884e-06,
|
|
"loss": 1.7784,
|
|
"mean_token_accuracy": 0.5642356276512146,
|
|
"num_tokens": 31327035.0,
|
|
"step": 8680
|
|
},
|
|
{
|
|
"entropy": 1.7734375,
|
|
"epoch": 1.9213930348258708,
|
|
"grad_norm": 3.324803590774536,
|
|
"learning_rate": 1.5317133550831483e-06,
|
|
"loss": 1.7519,
|
|
"mean_token_accuracy": 0.5677950263023377,
|
|
"num_tokens": 31365373.0,
|
|
"step": 8690
|
|
},
|
|
{
|
|
"entropy": 1.776953125,
|
|
"epoch": 1.9236042012161416,
|
|
"grad_norm": 3.644521474838257,
|
|
"learning_rate": 1.5261755968437559e-06,
|
|
"loss": 1.7645,
|
|
"mean_token_accuracy": 0.5704007536172867,
|
|
"num_tokens": 31403797.0,
|
|
"step": 8700
|
|
},
|
|
{
|
|
"entropy": 1.67578125,
|
|
"epoch": 1.9258153676064125,
|
|
"grad_norm": 3.257751703262329,
|
|
"learning_rate": 1.5206434658448238e-06,
|
|
"loss": 1.6633,
|
|
"mean_token_accuracy": 0.5842669188976288,
|
|
"num_tokens": 31439274.0,
|
|
"step": 8710
|
|
},
|
|
{
|
|
"entropy": 1.723046875,
|
|
"epoch": 1.9280265339966833,
|
|
"grad_norm": 3.7180957794189453,
|
|
"learning_rate": 1.5151169940537514e-06,
|
|
"loss": 1.7295,
|
|
"mean_token_accuracy": 0.5727511942386627,
|
|
"num_tokens": 31475689.0,
|
|
"step": 8720
|
|
},
|
|
{
|
|
"entropy": 1.719140625,
|
|
"epoch": 1.9302377003869542,
|
|
"grad_norm": 3.536086320877075,
|
|
"learning_rate": 1.5095962134052333e-06,
|
|
"loss": 1.7275,
|
|
"mean_token_accuracy": 0.5742514729499817,
|
|
"num_tokens": 31510604.0,
|
|
"step": 8730
|
|
},
|
|
{
|
|
"entropy": 1.724609375,
|
|
"epoch": 1.932448866777225,
|
|
"grad_norm": 4.31387186050415,
|
|
"learning_rate": 1.5040811558010787e-06,
|
|
"loss": 1.7355,
|
|
"mean_token_accuracy": 0.5727599918842315,
|
|
"num_tokens": 31547277.0,
|
|
"step": 8740
|
|
},
|
|
{
|
|
"entropy": 1.723828125,
|
|
"epoch": 1.934660033167496,
|
|
"grad_norm": 3.6574904918670654,
|
|
"learning_rate": 1.498571853110025e-06,
|
|
"loss": 1.7067,
|
|
"mean_token_accuracy": 0.5768580168485642,
|
|
"num_tokens": 31584038.0,
|
|
"step": 8750
|
|
},
|
|
{
|
|
"entropy": 1.7296875,
|
|
"epoch": 1.9368711995577668,
|
|
"grad_norm": 3.688235282897949,
|
|
"learning_rate": 1.4930683371675575e-06,
|
|
"loss": 1.7012,
|
|
"mean_token_accuracy": 0.5770545303821564,
|
|
"num_tokens": 31619026.0,
|
|
"step": 8760
|
|
},
|
|
{
|
|
"entropy": 1.73359375,
|
|
"epoch": 1.9390823659480376,
|
|
"grad_norm": 4.745366096496582,
|
|
"learning_rate": 1.487570639775721e-06,
|
|
"loss": 1.7541,
|
|
"mean_token_accuracy": 0.5715758055448532,
|
|
"num_tokens": 31653086.0,
|
|
"step": 8770
|
|
},
|
|
{
|
|
"entropy": 1.763671875,
|
|
"epoch": 1.9412935323383085,
|
|
"grad_norm": 3.193467378616333,
|
|
"learning_rate": 1.4820787927029384e-06,
|
|
"loss": 1.7454,
|
|
"mean_token_accuracy": 0.5660520881414414,
|
|
"num_tokens": 31690069.0,
|
|
"step": 8780
|
|
},
|
|
{
|
|
"entropy": 1.759765625,
|
|
"epoch": 1.9435046987285793,
|
|
"grad_norm": 3.7091901302337646,
|
|
"learning_rate": 1.4765928276838248e-06,
|
|
"loss": 1.7729,
|
|
"mean_token_accuracy": 0.5686738759279251,
|
|
"num_tokens": 31727852.0,
|
|
"step": 8790
|
|
},
|
|
{
|
|
"entropy": 1.744140625,
|
|
"epoch": 1.9457158651188502,
|
|
"grad_norm": 3.406608819961548,
|
|
"learning_rate": 1.471112776419009e-06,
|
|
"loss": 1.7205,
|
|
"mean_token_accuracy": 0.5765075117349625,
|
|
"num_tokens": 31768040.0,
|
|
"step": 8800
|
|
},
|
|
{
|
|
"entropy": 1.744921875,
|
|
"epoch": 1.947927031509121,
|
|
"grad_norm": 3.5158963203430176,
|
|
"learning_rate": 1.4656386705749442e-06,
|
|
"loss": 1.7367,
|
|
"mean_token_accuracy": 0.572776859998703,
|
|
"num_tokens": 31805251.0,
|
|
"step": 8810
|
|
},
|
|
{
|
|
"entropy": 1.74140625,
|
|
"epoch": 1.950138197899392,
|
|
"grad_norm": 3.740358352661133,
|
|
"learning_rate": 1.4601705417837303e-06,
|
|
"loss": 1.7487,
|
|
"mean_token_accuracy": 0.5731150895357132,
|
|
"num_tokens": 31842903.0,
|
|
"step": 8820
|
|
},
|
|
{
|
|
"entropy": 1.712890625,
|
|
"epoch": 1.9523493642896628,
|
|
"grad_norm": 3.9042723178863525,
|
|
"learning_rate": 1.4547084216429274e-06,
|
|
"loss": 1.704,
|
|
"mean_token_accuracy": 0.5799987941980362,
|
|
"num_tokens": 31877123.0,
|
|
"step": 8830
|
|
},
|
|
{
|
|
"entropy": 1.7671875,
|
|
"epoch": 1.9545605306799336,
|
|
"grad_norm": 3.9414663314819336,
|
|
"learning_rate": 1.449252341715377e-06,
|
|
"loss": 1.7486,
|
|
"mean_token_accuracy": 0.5716243773698807,
|
|
"num_tokens": 31911943.0,
|
|
"step": 8840
|
|
},
|
|
{
|
|
"entropy": 1.739453125,
|
|
"epoch": 1.9567716970702045,
|
|
"grad_norm": 4.049784183502197,
|
|
"learning_rate": 1.4438023335290122e-06,
|
|
"loss": 1.7518,
|
|
"mean_token_accuracy": 0.5717391669750214,
|
|
"num_tokens": 31945561.0,
|
|
"step": 8850
|
|
},
|
|
{
|
|
"entropy": 1.7296875,
|
|
"epoch": 1.9589828634604753,
|
|
"grad_norm": 2.76662540435791,
|
|
"learning_rate": 1.4383584285766855e-06,
|
|
"loss": 1.722,
|
|
"mean_token_accuracy": 0.5767583161592483,
|
|
"num_tokens": 31982712.0,
|
|
"step": 8860
|
|
},
|
|
{
|
|
"entropy": 1.743359375,
|
|
"epoch": 1.9611940298507462,
|
|
"grad_norm": 3.2501332759857178,
|
|
"learning_rate": 1.43292065831598e-06,
|
|
"loss": 1.7537,
|
|
"mean_token_accuracy": 0.570072415471077,
|
|
"num_tokens": 32017119.0,
|
|
"step": 8870
|
|
},
|
|
{
|
|
"entropy": 1.73359375,
|
|
"epoch": 1.963405196241017,
|
|
"grad_norm": 4.228973865509033,
|
|
"learning_rate": 1.4274890541690307e-06,
|
|
"loss": 1.6778,
|
|
"mean_token_accuracy": 0.5832488298416137,
|
|
"num_tokens": 32050453.0,
|
|
"step": 8880
|
|
},
|
|
{
|
|
"entropy": 1.687890625,
|
|
"epoch": 1.965616362631288,
|
|
"grad_norm": 4.217631816864014,
|
|
"learning_rate": 1.4220636475223384e-06,
|
|
"loss": 1.6976,
|
|
"mean_token_accuracy": 0.5768374413251877,
|
|
"num_tokens": 32083423.0,
|
|
"step": 8890
|
|
},
|
|
{
|
|
"entropy": 1.6828125,
|
|
"epoch": 1.9678275290215588,
|
|
"grad_norm": 4.2789788246154785,
|
|
"learning_rate": 1.4166444697265952e-06,
|
|
"loss": 1.6797,
|
|
"mean_token_accuracy": 0.582291665673256,
|
|
"num_tokens": 32118709.0,
|
|
"step": 8900
|
|
},
|
|
{
|
|
"entropy": 1.7515625,
|
|
"epoch": 1.9700386954118296,
|
|
"grad_norm": 3.519991397857666,
|
|
"learning_rate": 1.4112315520964987e-06,
|
|
"loss": 1.7709,
|
|
"mean_token_accuracy": 0.5668433830142021,
|
|
"num_tokens": 32152968.0,
|
|
"step": 8910
|
|
},
|
|
{
|
|
"entropy": 1.716796875,
|
|
"epoch": 1.9722498618021005,
|
|
"grad_norm": 3.9140188694000244,
|
|
"learning_rate": 1.4058249259105721e-06,
|
|
"loss": 1.745,
|
|
"mean_token_accuracy": 0.5708180367946625,
|
|
"num_tokens": 32190347.0,
|
|
"step": 8920
|
|
},
|
|
{
|
|
"entropy": 1.724609375,
|
|
"epoch": 1.9744610281923713,
|
|
"grad_norm": 3.1383965015411377,
|
|
"learning_rate": 1.400424622410983e-06,
|
|
"loss": 1.697,
|
|
"mean_token_accuracy": 0.5784273475408555,
|
|
"num_tokens": 32224681.0,
|
|
"step": 8930
|
|
},
|
|
{
|
|
"entropy": 1.738671875,
|
|
"epoch": 1.9766721945826422,
|
|
"grad_norm": 3.5489258766174316,
|
|
"learning_rate": 1.3950306728033636e-06,
|
|
"loss": 1.7333,
|
|
"mean_token_accuracy": 0.5714338600635529,
|
|
"num_tokens": 32261946.0,
|
|
"step": 8940
|
|
},
|
|
{
|
|
"entropy": 1.735546875,
|
|
"epoch": 1.978883360972913,
|
|
"grad_norm": 3.947706460952759,
|
|
"learning_rate": 1.3896431082566314e-06,
|
|
"loss": 1.7196,
|
|
"mean_token_accuracy": 0.5734545469284058,
|
|
"num_tokens": 32296628.0,
|
|
"step": 8950
|
|
},
|
|
{
|
|
"entropy": 1.787890625,
|
|
"epoch": 1.981094527363184,
|
|
"grad_norm": 3.701552391052246,
|
|
"learning_rate": 1.3842619599028056e-06,
|
|
"loss": 1.7658,
|
|
"mean_token_accuracy": 0.5658468186855317,
|
|
"num_tokens": 32331752.0,
|
|
"step": 8960
|
|
},
|
|
{
|
|
"entropy": 1.74609375,
|
|
"epoch": 1.983305693753455,
|
|
"grad_norm": 3.781827688217163,
|
|
"learning_rate": 1.378887258836831e-06,
|
|
"loss": 1.7355,
|
|
"mean_token_accuracy": 0.5761446237564087,
|
|
"num_tokens": 32369893.0,
|
|
"step": 8970
|
|
},
|
|
{
|
|
"entropy": 1.68046875,
|
|
"epoch": 1.9855168601437259,
|
|
"grad_norm": 3.480821132659912,
|
|
"learning_rate": 1.373519036116397e-06,
|
|
"loss": 1.6979,
|
|
"mean_token_accuracy": 0.5798484325408936,
|
|
"num_tokens": 32404439.0,
|
|
"step": 8980
|
|
},
|
|
{
|
|
"entropy": 1.698046875,
|
|
"epoch": 1.9877280265339967,
|
|
"grad_norm": 3.5216033458709717,
|
|
"learning_rate": 1.3681573227617573e-06,
|
|
"loss": 1.6951,
|
|
"mean_token_accuracy": 0.579479169845581,
|
|
"num_tokens": 32438536.0,
|
|
"step": 8990
|
|
},
|
|
{
|
|
"entropy": 1.744921875,
|
|
"epoch": 1.9899391929242676,
|
|
"grad_norm": 3.6973209381103516,
|
|
"learning_rate": 1.3628021497555504e-06,
|
|
"loss": 1.7515,
|
|
"mean_token_accuracy": 0.5687436163425446,
|
|
"num_tokens": 32473979.0,
|
|
"step": 9000
|
|
},
|
|
{
|
|
"epoch": 1.9899391929242676,
|
|
"eval_entropy": 1.7468827736318409,
|
|
"eval_loss": 1.7950092554092407,
|
|
"eval_mean_token_accuracy": 0.5633634380736754,
|
|
"eval_num_tokens": 32473979.0,
|
|
"eval_runtime": 112.4305,
|
|
"eval_samples_per_second": 143.022,
|
|
"eval_steps_per_second": 8.939,
|
|
"step": 9000
|
|
},
|
|
{
|
|
"entropy": 1.719140625,
|
|
"epoch": 1.9921503593145384,
|
|
"grad_norm": 3.362218141555786,
|
|
"learning_rate": 1.357453548042623e-06,
|
|
"loss": 1.719,
|
|
"mean_token_accuracy": 0.5770722329616547,
|
|
"num_tokens": 32508177.0,
|
|
"step": 9010
|
|
},
|
|
{
|
|
"entropy": 1.7375,
|
|
"epoch": 1.9943615257048093,
|
|
"grad_norm": 3.4757819175720215,
|
|
"learning_rate": 1.352111548529849e-06,
|
|
"loss": 1.7105,
|
|
"mean_token_accuracy": 0.5790396720170975,
|
|
"num_tokens": 32544462.0,
|
|
"step": 9020
|
|
},
|
|
{
|
|
"entropy": 1.746875,
|
|
"epoch": 1.9965726920950801,
|
|
"grad_norm": 3.72638201713562,
|
|
"learning_rate": 1.3467761820859526e-06,
|
|
"loss": 1.7579,
|
|
"mean_token_accuracy": 0.5691894888877869,
|
|
"num_tokens": 32580253.0,
|
|
"step": 9030
|
|
},
|
|
{
|
|
"entropy": 1.69296875,
|
|
"epoch": 1.998783858485351,
|
|
"grad_norm": 3.9151062965393066,
|
|
"learning_rate": 1.341447479541324e-06,
|
|
"loss": 1.6919,
|
|
"mean_token_accuracy": 0.5805132389068604,
|
|
"num_tokens": 32616545.0,
|
|
"step": 9040
|
|
},
|
|
{
|
|
"entropy": 1.6854440789473684,
|
|
"epoch": 2.0008844665561085,
|
|
"grad_norm": 3.7604727745056152,
|
|
"learning_rate": 1.3361254716878547e-06,
|
|
"loss": 1.6984,
|
|
"mean_token_accuracy": 0.5820427725189611,
|
|
"num_tokens": 32651893.0,
|
|
"step": 9050
|
|
},
|
|
{
|
|
"entropy": 1.706640625,
|
|
"epoch": 2.0030956329463794,
|
|
"grad_norm": 3.6576740741729736,
|
|
"learning_rate": 1.3308101892787423e-06,
|
|
"loss": 1.6937,
|
|
"mean_token_accuracy": 0.586036927998066,
|
|
"num_tokens": 32692096.0,
|
|
"step": 9060
|
|
},
|
|
{
|
|
"entropy": 1.6703125,
|
|
"epoch": 2.0053067993366502,
|
|
"grad_norm": 4.634953498840332,
|
|
"learning_rate": 1.3255016630283272e-06,
|
|
"loss": 1.6611,
|
|
"mean_token_accuracy": 0.5873037904500962,
|
|
"num_tokens": 32729548.0,
|
|
"step": 9070
|
|
},
|
|
{
|
|
"entropy": 1.67265625,
|
|
"epoch": 2.007517965726921,
|
|
"grad_norm": 3.818631172180176,
|
|
"learning_rate": 1.3201999236119048e-06,
|
|
"loss": 1.665,
|
|
"mean_token_accuracy": 0.5847580909729004,
|
|
"num_tokens": 32764088.0,
|
|
"step": 9080
|
|
},
|
|
{
|
|
"entropy": 1.66875,
|
|
"epoch": 2.009729132117192,
|
|
"grad_norm": 3.3340251445770264,
|
|
"learning_rate": 1.314905001665559e-06,
|
|
"loss": 1.6899,
|
|
"mean_token_accuracy": 0.5834394335746765,
|
|
"num_tokens": 32800074.0,
|
|
"step": 9090
|
|
},
|
|
{
|
|
"entropy": 1.628125,
|
|
"epoch": 2.011940298507463,
|
|
"grad_norm": 3.9723172187805176,
|
|
"learning_rate": 1.3096169277859727e-06,
|
|
"loss": 1.6102,
|
|
"mean_token_accuracy": 0.5987802535295487,
|
|
"num_tokens": 32834438.0,
|
|
"step": 9100
|
|
},
|
|
{
|
|
"entropy": 1.6390625,
|
|
"epoch": 2.0141514648977337,
|
|
"grad_norm": 4.273256301879883,
|
|
"learning_rate": 1.3043357325302614e-06,
|
|
"loss": 1.6157,
|
|
"mean_token_accuracy": 0.6003403097391129,
|
|
"num_tokens": 32870881.0,
|
|
"step": 9110
|
|
},
|
|
{
|
|
"entropy": 1.68125,
|
|
"epoch": 2.0163626312880045,
|
|
"grad_norm": 3.3602006435394287,
|
|
"learning_rate": 1.2990614464157887e-06,
|
|
"loss": 1.6781,
|
|
"mean_token_accuracy": 0.5872556120157242,
|
|
"num_tokens": 32906217.0,
|
|
"step": 9120
|
|
},
|
|
{
|
|
"entropy": 1.6734375,
|
|
"epoch": 2.0185737976782754,
|
|
"grad_norm": 2.7324209213256836,
|
|
"learning_rate": 1.2937940999199988e-06,
|
|
"loss": 1.6755,
|
|
"mean_token_accuracy": 0.5851371377706528,
|
|
"num_tokens": 32941802.0,
|
|
"step": 9130
|
|
},
|
|
{
|
|
"entropy": 1.647265625,
|
|
"epoch": 2.0207849640685462,
|
|
"grad_norm": 3.4412288665771484,
|
|
"learning_rate": 1.288533723480231e-06,
|
|
"loss": 1.6387,
|
|
"mean_token_accuracy": 0.5925711005926132,
|
|
"num_tokens": 32978651.0,
|
|
"step": 9140
|
|
},
|
|
{
|
|
"entropy": 1.644140625,
|
|
"epoch": 2.022996130458817,
|
|
"grad_norm": 4.807136058807373,
|
|
"learning_rate": 1.28328034749355e-06,
|
|
"loss": 1.6217,
|
|
"mean_token_accuracy": 0.597022607922554,
|
|
"num_tokens": 33012178.0,
|
|
"step": 9150
|
|
},
|
|
{
|
|
"entropy": 1.68203125,
|
|
"epoch": 2.025207296849088,
|
|
"grad_norm": 3.934673547744751,
|
|
"learning_rate": 1.2780340023165682e-06,
|
|
"loss": 1.7026,
|
|
"mean_token_accuracy": 0.5778836280107498,
|
|
"num_tokens": 33049224.0,
|
|
"step": 9160
|
|
},
|
|
{
|
|
"entropy": 1.666015625,
|
|
"epoch": 2.027418463239359,
|
|
"grad_norm": 3.4702706336975098,
|
|
"learning_rate": 1.2727947182652717e-06,
|
|
"loss": 1.6669,
|
|
"mean_token_accuracy": 0.5885435223579407,
|
|
"num_tokens": 33087205.0,
|
|
"step": 9170
|
|
},
|
|
{
|
|
"entropy": 1.7015625,
|
|
"epoch": 2.0296296296296297,
|
|
"grad_norm": 3.811098337173462,
|
|
"learning_rate": 1.2675625256148403e-06,
|
|
"loss": 1.672,
|
|
"mean_token_accuracy": 0.5831019759178162,
|
|
"num_tokens": 33124275.0,
|
|
"step": 9180
|
|
},
|
|
{
|
|
"entropy": 1.687890625,
|
|
"epoch": 2.0318407960199005,
|
|
"grad_norm": 4.947207450866699,
|
|
"learning_rate": 1.2623374545994798e-06,
|
|
"loss": 1.6639,
|
|
"mean_token_accuracy": 0.5862949162721633,
|
|
"num_tokens": 33161985.0,
|
|
"step": 9190
|
|
},
|
|
{
|
|
"entropy": 1.676171875,
|
|
"epoch": 2.0340519624101714,
|
|
"grad_norm": 3.775390148162842,
|
|
"learning_rate": 1.2571195354122433e-06,
|
|
"loss": 1.6495,
|
|
"mean_token_accuracy": 0.5907007902860641,
|
|
"num_tokens": 33200505.0,
|
|
"step": 9200
|
|
},
|
|
{
|
|
"entropy": 1.69921875,
|
|
"epoch": 2.0362631288004422,
|
|
"grad_norm": 4.2508864402771,
|
|
"learning_rate": 1.2519087982048545e-06,
|
|
"loss": 1.6948,
|
|
"mean_token_accuracy": 0.5842921555042266,
|
|
"num_tokens": 33233548.0,
|
|
"step": 9210
|
|
},
|
|
{
|
|
"entropy": 1.65546875,
|
|
"epoch": 2.038474295190713,
|
|
"grad_norm": 4.247050762176514,
|
|
"learning_rate": 1.2467052730875381e-06,
|
|
"loss": 1.6761,
|
|
"mean_token_accuracy": 0.5898781210184098,
|
|
"num_tokens": 33270877.0,
|
|
"step": 9220
|
|
},
|
|
{
|
|
"entropy": 1.662109375,
|
|
"epoch": 2.040685461580984,
|
|
"grad_norm": 3.307677745819092,
|
|
"learning_rate": 1.241508990128844e-06,
|
|
"loss": 1.6648,
|
|
"mean_token_accuracy": 0.5906867325305939,
|
|
"num_tokens": 33305640.0,
|
|
"step": 9230
|
|
},
|
|
{
|
|
"entropy": 1.68515625,
|
|
"epoch": 2.042896627971255,
|
|
"grad_norm": 4.581154823303223,
|
|
"learning_rate": 1.2363199793554735e-06,
|
|
"loss": 1.6575,
|
|
"mean_token_accuracy": 0.5892653465270996,
|
|
"num_tokens": 33343663.0,
|
|
"step": 9240
|
|
},
|
|
{
|
|
"entropy": 1.6671875,
|
|
"epoch": 2.0451077943615257,
|
|
"grad_norm": 3.278214454650879,
|
|
"learning_rate": 1.2311382707521027e-06,
|
|
"loss": 1.6664,
|
|
"mean_token_accuracy": 0.5821044594049454,
|
|
"num_tokens": 33378846.0,
|
|
"step": 9250
|
|
},
|
|
{
|
|
"entropy": 1.662109375,
|
|
"epoch": 2.0473189607517965,
|
|
"grad_norm": 3.9423975944519043,
|
|
"learning_rate": 1.2259638942612157e-06,
|
|
"loss": 1.6489,
|
|
"mean_token_accuracy": 0.5910352289676666,
|
|
"num_tokens": 33413307.0,
|
|
"step": 9260
|
|
},
|
|
{
|
|
"entropy": 1.647265625,
|
|
"epoch": 2.0495301271420674,
|
|
"grad_norm": 4.124790191650391,
|
|
"learning_rate": 1.220796879782926e-06,
|
|
"loss": 1.6085,
|
|
"mean_token_accuracy": 0.5974036246538162,
|
|
"num_tokens": 33447510.0,
|
|
"step": 9270
|
|
},
|
|
{
|
|
"entropy": 1.700390625,
|
|
"epoch": 2.0517412935323383,
|
|
"grad_norm": 3.829763889312744,
|
|
"learning_rate": 1.2156372571748077e-06,
|
|
"loss": 1.6916,
|
|
"mean_token_accuracy": 0.5794416457414627,
|
|
"num_tokens": 33486530.0,
|
|
"step": 9280
|
|
},
|
|
{
|
|
"entropy": 1.666015625,
|
|
"epoch": 2.053952459922609,
|
|
"grad_norm": 4.0884809494018555,
|
|
"learning_rate": 1.2104850562517175e-06,
|
|
"loss": 1.6504,
|
|
"mean_token_accuracy": 0.5896530210971832,
|
|
"num_tokens": 33525692.0,
|
|
"step": 9290
|
|
},
|
|
{
|
|
"entropy": 1.6484375,
|
|
"epoch": 2.05616362631288,
|
|
"grad_norm": 3.627532958984375,
|
|
"learning_rate": 1.205340306785629e-06,
|
|
"loss": 1.5957,
|
|
"mean_token_accuracy": 0.603008696436882,
|
|
"num_tokens": 33560908.0,
|
|
"step": 9300
|
|
},
|
|
{
|
|
"entropy": 1.6390625,
|
|
"epoch": 2.058374792703151,
|
|
"grad_norm": 3.4198801517486572,
|
|
"learning_rate": 1.200203038505457e-06,
|
|
"loss": 1.5846,
|
|
"mean_token_accuracy": 0.5999058246612549,
|
|
"num_tokens": 33595859.0,
|
|
"step": 9310
|
|
},
|
|
{
|
|
"entropy": 1.667578125,
|
|
"epoch": 2.0605859590934217,
|
|
"grad_norm": 3.7610087394714355,
|
|
"learning_rate": 1.1950732810968863e-06,
|
|
"loss": 1.6615,
|
|
"mean_token_accuracy": 0.5829620629549026,
|
|
"num_tokens": 33632001.0,
|
|
"step": 9320
|
|
},
|
|
{
|
|
"entropy": 1.634765625,
|
|
"epoch": 2.0627971254836925,
|
|
"grad_norm": 3.5851423740386963,
|
|
"learning_rate": 1.1899510642021986e-06,
|
|
"loss": 1.6411,
|
|
"mean_token_accuracy": 0.5868986129760743,
|
|
"num_tokens": 33665548.0,
|
|
"step": 9330
|
|
},
|
|
{
|
|
"entropy": 1.662890625,
|
|
"epoch": 2.0650082918739634,
|
|
"grad_norm": 3.9838619232177734,
|
|
"learning_rate": 1.1848364174201041e-06,
|
|
"loss": 1.6524,
|
|
"mean_token_accuracy": 0.5904654026031494,
|
|
"num_tokens": 33700187.0,
|
|
"step": 9340
|
|
},
|
|
{
|
|
"entropy": 1.674609375,
|
|
"epoch": 2.0672194582642343,
|
|
"grad_norm": 4.710204601287842,
|
|
"learning_rate": 1.1797293703055696e-06,
|
|
"loss": 1.6826,
|
|
"mean_token_accuracy": 0.5840006828308105,
|
|
"num_tokens": 33736668.0,
|
|
"step": 9350
|
|
},
|
|
{
|
|
"entropy": 1.694140625,
|
|
"epoch": 2.069430624654505,
|
|
"grad_norm": 2.8968753814697266,
|
|
"learning_rate": 1.1746299523696475e-06,
|
|
"loss": 1.7038,
|
|
"mean_token_accuracy": 0.5801070272922516,
|
|
"num_tokens": 33773384.0,
|
|
"step": 9360
|
|
},
|
|
{
|
|
"entropy": 1.6578125,
|
|
"epoch": 2.071641791044776,
|
|
"grad_norm": 4.808715343475342,
|
|
"learning_rate": 1.1695381930793013e-06,
|
|
"loss": 1.6775,
|
|
"mean_token_accuracy": 0.5874375969171524,
|
|
"num_tokens": 33810139.0,
|
|
"step": 9370
|
|
},
|
|
{
|
|
"entropy": 1.655078125,
|
|
"epoch": 2.073852957435047,
|
|
"grad_norm": 4.600178241729736,
|
|
"learning_rate": 1.1644541218572456e-06,
|
|
"loss": 1.6369,
|
|
"mean_token_accuracy": 0.5893501251935959,
|
|
"num_tokens": 33846155.0,
|
|
"step": 9380
|
|
},
|
|
{
|
|
"entropy": 1.63046875,
|
|
"epoch": 2.0760641238253177,
|
|
"grad_norm": 3.091615915298462,
|
|
"learning_rate": 1.1593777680817631e-06,
|
|
"loss": 1.6271,
|
|
"mean_token_accuracy": 0.5923317819833755,
|
|
"num_tokens": 33879832.0,
|
|
"step": 9390
|
|
},
|
|
{
|
|
"entropy": 1.657421875,
|
|
"epoch": 2.0782752902155885,
|
|
"grad_norm": 3.9050323963165283,
|
|
"learning_rate": 1.1543091610865456e-06,
|
|
"loss": 1.6507,
|
|
"mean_token_accuracy": 0.58967727124691,
|
|
"num_tokens": 33916383.0,
|
|
"step": 9400
|
|
},
|
|
{
|
|
"entropy": 1.709375,
|
|
"epoch": 2.0804864566058594,
|
|
"grad_norm": 3.872868299484253,
|
|
"learning_rate": 1.1492483301605165e-06,
|
|
"loss": 1.7136,
|
|
"mean_token_accuracy": 0.5769048154354095,
|
|
"num_tokens": 33955692.0,
|
|
"step": 9410
|
|
},
|
|
{
|
|
"entropy": 1.6625,
|
|
"epoch": 2.0826976229961303,
|
|
"grad_norm": 4.43612003326416,
|
|
"learning_rate": 1.14419530454767e-06,
|
|
"loss": 1.6505,
|
|
"mean_token_accuracy": 0.5944570094347,
|
|
"num_tokens": 33993251.0,
|
|
"step": 9420
|
|
},
|
|
{
|
|
"entropy": 1.587890625,
|
|
"epoch": 2.084908789386401,
|
|
"grad_norm": 3.896233081817627,
|
|
"learning_rate": 1.1391501134468927e-06,
|
|
"loss": 1.5743,
|
|
"mean_token_accuracy": 0.6039249539375305,
|
|
"num_tokens": 34030918.0,
|
|
"step": 9430
|
|
},
|
|
{
|
|
"entropy": 1.654296875,
|
|
"epoch": 2.0871199557766724,
|
|
"grad_norm": 4.2811713218688965,
|
|
"learning_rate": 1.134112786011803e-06,
|
|
"loss": 1.691,
|
|
"mean_token_accuracy": 0.5805846691131592,
|
|
"num_tokens": 34065965.0,
|
|
"step": 9440
|
|
},
|
|
{
|
|
"entropy": 1.6609375,
|
|
"epoch": 2.0893311221669433,
|
|
"grad_norm": 3.495391368865967,
|
|
"learning_rate": 1.1290833513505755e-06,
|
|
"loss": 1.6578,
|
|
"mean_token_accuracy": 0.5863269746303559,
|
|
"num_tokens": 34100689.0,
|
|
"step": 9450
|
|
},
|
|
{
|
|
"entropy": 1.66328125,
|
|
"epoch": 2.091542288557214,
|
|
"grad_norm": 4.109462738037109,
|
|
"learning_rate": 1.1240618385257798e-06,
|
|
"loss": 1.6511,
|
|
"mean_token_accuracy": 0.588376647233963,
|
|
"num_tokens": 34133110.0,
|
|
"step": 9460
|
|
},
|
|
{
|
|
"entropy": 1.714453125,
|
|
"epoch": 2.093753454947485,
|
|
"grad_norm": 4.109835147857666,
|
|
"learning_rate": 1.1190482765542077e-06,
|
|
"loss": 1.6929,
|
|
"mean_token_accuracy": 0.5806125104427338,
|
|
"num_tokens": 34169509.0,
|
|
"step": 9470
|
|
},
|
|
{
|
|
"entropy": 1.6484375,
|
|
"epoch": 2.095964621337756,
|
|
"grad_norm": 4.12890625,
|
|
"learning_rate": 1.1140426944067068e-06,
|
|
"loss": 1.6203,
|
|
"mean_token_accuracy": 0.5960247188806533,
|
|
"num_tokens": 34205258.0,
|
|
"step": 9480
|
|
},
|
|
{
|
|
"entropy": 1.665625,
|
|
"epoch": 2.0981757877280267,
|
|
"grad_norm": 3.5141777992248535,
|
|
"learning_rate": 1.1090451210080155e-06,
|
|
"loss": 1.6882,
|
|
"mean_token_accuracy": 0.5870868861675262,
|
|
"num_tokens": 34242051.0,
|
|
"step": 9490
|
|
},
|
|
{
|
|
"entropy": 1.633984375,
|
|
"epoch": 2.1003869541182976,
|
|
"grad_norm": 3.7343881130218506,
|
|
"learning_rate": 1.1040555852365895e-06,
|
|
"loss": 1.6259,
|
|
"mean_token_accuracy": 0.5932332783937454,
|
|
"num_tokens": 34276423.0,
|
|
"step": 9500
|
|
},
|
|
{
|
|
"epoch": 2.1003869541182976,
|
|
"eval_entropy": 1.6913557213930348,
|
|
"eval_loss": 1.794851303100586,
|
|
"eval_mean_token_accuracy": 0.5645787341677727,
|
|
"eval_num_tokens": 34276423.0,
|
|
"eval_runtime": 112.1343,
|
|
"eval_samples_per_second": 143.399,
|
|
"eval_steps_per_second": 8.962,
|
|
"step": 9500
|
|
},
|
|
{
|
|
"entropy": 1.6625,
|
|
"epoch": 2.1025981205085684,
|
|
"grad_norm": 4.0971479415893555,
|
|
"learning_rate": 1.0990741159244422e-06,
|
|
"loss": 1.6547,
|
|
"mean_token_accuracy": 0.5878496408462525,
|
|
"num_tokens": 34311916.0,
|
|
"step": 9510
|
|
},
|
|
{
|
|
"entropy": 1.644921875,
|
|
"epoch": 2.1048092868988393,
|
|
"grad_norm": 4.2546491622924805,
|
|
"learning_rate": 1.094100741856975e-06,
|
|
"loss": 1.6313,
|
|
"mean_token_accuracy": 0.589262244105339,
|
|
"num_tokens": 34347782.0,
|
|
"step": 9520
|
|
},
|
|
{
|
|
"entropy": 1.6046875,
|
|
"epoch": 2.10702045328911,
|
|
"grad_norm": 4.321098804473877,
|
|
"learning_rate": 1.0891354917728112e-06,
|
|
"loss": 1.5975,
|
|
"mean_token_accuracy": 0.5994806945323944,
|
|
"num_tokens": 34382958.0,
|
|
"step": 9530
|
|
},
|
|
{
|
|
"entropy": 1.666015625,
|
|
"epoch": 2.109231619679381,
|
|
"grad_norm": 3.9937922954559326,
|
|
"learning_rate": 1.084178394363626e-06,
|
|
"loss": 1.696,
|
|
"mean_token_accuracy": 0.5875179678201675,
|
|
"num_tokens": 34420054.0,
|
|
"step": 9540
|
|
},
|
|
{
|
|
"entropy": 1.681640625,
|
|
"epoch": 2.111442786069652,
|
|
"grad_norm": 3.289050340652466,
|
|
"learning_rate": 1.0792294782739901e-06,
|
|
"loss": 1.7125,
|
|
"mean_token_accuracy": 0.5799039959907532,
|
|
"num_tokens": 34457966.0,
|
|
"step": 9550
|
|
},
|
|
{
|
|
"entropy": 1.6546875,
|
|
"epoch": 2.1136539524599227,
|
|
"grad_norm": 3.9801626205444336,
|
|
"learning_rate": 1.0742887721011922e-06,
|
|
"loss": 1.6299,
|
|
"mean_token_accuracy": 0.5924351423978805,
|
|
"num_tokens": 34493335.0,
|
|
"step": 9560
|
|
},
|
|
{
|
|
"entropy": 1.66640625,
|
|
"epoch": 2.1158651188501936,
|
|
"grad_norm": 3.0172829627990723,
|
|
"learning_rate": 1.0693563043950868e-06,
|
|
"loss": 1.6354,
|
|
"mean_token_accuracy": 0.5975950539112092,
|
|
"num_tokens": 34529596.0,
|
|
"step": 9570
|
|
},
|
|
{
|
|
"entropy": 1.658203125,
|
|
"epoch": 2.1180762852404644,
|
|
"grad_norm": 4.129273891448975,
|
|
"learning_rate": 1.0644321036579172e-06,
|
|
"loss": 1.6304,
|
|
"mean_token_accuracy": 0.5922056257724762,
|
|
"num_tokens": 34564428.0,
|
|
"step": 9580
|
|
},
|
|
{
|
|
"entropy": 1.634765625,
|
|
"epoch": 2.1202874516307353,
|
|
"grad_norm": 3.903503656387329,
|
|
"learning_rate": 1.0595161983441578e-06,
|
|
"loss": 1.6045,
|
|
"mean_token_accuracy": 0.5974501520395279,
|
|
"num_tokens": 34600308.0,
|
|
"step": 9590
|
|
},
|
|
{
|
|
"entropy": 1.64140625,
|
|
"epoch": 2.122498618021006,
|
|
"grad_norm": 4.2293267250061035,
|
|
"learning_rate": 1.0546086168603489e-06,
|
|
"loss": 1.6482,
|
|
"mean_token_accuracy": 0.5904124855995179,
|
|
"num_tokens": 34639921.0,
|
|
"step": 9600
|
|
},
|
|
{
|
|
"entropy": 1.633203125,
|
|
"epoch": 2.124709784411277,
|
|
"grad_norm": 3.7998239994049072,
|
|
"learning_rate": 1.049709387564931e-06,
|
|
"loss": 1.6332,
|
|
"mean_token_accuracy": 0.5945297390222549,
|
|
"num_tokens": 34677255.0,
|
|
"step": 9610
|
|
},
|
|
{
|
|
"entropy": 1.64375,
|
|
"epoch": 2.126920950801548,
|
|
"grad_norm": 4.141975402832031,
|
|
"learning_rate": 1.0448185387680794e-06,
|
|
"loss": 1.6362,
|
|
"mean_token_accuracy": 0.5945258915424347,
|
|
"num_tokens": 34711984.0,
|
|
"step": 9620
|
|
},
|
|
{
|
|
"entropy": 1.674609375,
|
|
"epoch": 2.1291321171918187,
|
|
"grad_norm": 4.005610942840576,
|
|
"learning_rate": 1.0399360987315458e-06,
|
|
"loss": 1.6725,
|
|
"mean_token_accuracy": 0.5868113815784455,
|
|
"num_tokens": 34752083.0,
|
|
"step": 9630
|
|
},
|
|
{
|
|
"entropy": 1.6421875,
|
|
"epoch": 2.1313432835820896,
|
|
"grad_norm": 3.113109588623047,
|
|
"learning_rate": 1.0350620956684901e-06,
|
|
"loss": 1.6237,
|
|
"mean_token_accuracy": 0.5969673097133636,
|
|
"num_tokens": 34789788.0,
|
|
"step": 9640
|
|
},
|
|
{
|
|
"entropy": 1.63671875,
|
|
"epoch": 2.1335544499723604,
|
|
"grad_norm": 3.8784596920013428,
|
|
"learning_rate": 1.030196557743321e-06,
|
|
"loss": 1.6215,
|
|
"mean_token_accuracy": 0.5964713245630264,
|
|
"num_tokens": 34826219.0,
|
|
"step": 9650
|
|
},
|
|
{
|
|
"entropy": 1.677734375,
|
|
"epoch": 2.1357656163626313,
|
|
"grad_norm": 3.9165449142456055,
|
|
"learning_rate": 1.0253395130715286e-06,
|
|
"loss": 1.6741,
|
|
"mean_token_accuracy": 0.58501897752285,
|
|
"num_tokens": 34861851.0,
|
|
"step": 9660
|
|
},
|
|
{
|
|
"entropy": 1.684375,
|
|
"epoch": 2.137976782752902,
|
|
"grad_norm": 4.459188938140869,
|
|
"learning_rate": 1.0204909897195268e-06,
|
|
"loss": 1.6688,
|
|
"mean_token_accuracy": 0.5869225353002548,
|
|
"num_tokens": 34898245.0,
|
|
"step": 9670
|
|
},
|
|
{
|
|
"entropy": 1.662890625,
|
|
"epoch": 2.140187949143173,
|
|
"grad_norm": 4.163595676422119,
|
|
"learning_rate": 1.0156510157044885e-06,
|
|
"loss": 1.6669,
|
|
"mean_token_accuracy": 0.5829361081123352,
|
|
"num_tokens": 34933855.0,
|
|
"step": 9680
|
|
},
|
|
{
|
|
"entropy": 1.653125,
|
|
"epoch": 2.142399115533444,
|
|
"grad_norm": 4.216367244720459,
|
|
"learning_rate": 1.0108196189941858e-06,
|
|
"loss": 1.6632,
|
|
"mean_token_accuracy": 0.5864406168460846,
|
|
"num_tokens": 34969878.0,
|
|
"step": 9690
|
|
},
|
|
{
|
|
"entropy": 1.707421875,
|
|
"epoch": 2.1446102819237147,
|
|
"grad_norm": 3.61181378364563,
|
|
"learning_rate": 1.005996827506823e-06,
|
|
"loss": 1.7254,
|
|
"mean_token_accuracy": 0.5790015578269958,
|
|
"num_tokens": 35007042.0,
|
|
"step": 9700
|
|
},
|
|
{
|
|
"entropy": 1.6828125,
|
|
"epoch": 2.1468214483139856,
|
|
"grad_norm": 3.6967859268188477,
|
|
"learning_rate": 1.0011826691108834e-06,
|
|
"loss": 1.6486,
|
|
"mean_token_accuracy": 0.5885917782783509,
|
|
"num_tokens": 35042550.0,
|
|
"step": 9710
|
|
},
|
|
{
|
|
"entropy": 1.671484375,
|
|
"epoch": 2.1490326147042564,
|
|
"grad_norm": 4.0739006996154785,
|
|
"learning_rate": 9.963771716249614e-07,
|
|
"loss": 1.6486,
|
|
"mean_token_accuracy": 0.5914486140012741,
|
|
"num_tokens": 35077758.0,
|
|
"step": 9720
|
|
},
|
|
{
|
|
"entropy": 1.616796875,
|
|
"epoch": 2.1512437810945273,
|
|
"grad_norm": 3.8693509101867676,
|
|
"learning_rate": 9.91580362817607e-07,
|
|
"loss": 1.5905,
|
|
"mean_token_accuracy": 0.6057449907064438,
|
|
"num_tokens": 35114756.0,
|
|
"step": 9730
|
|
},
|
|
{
|
|
"entropy": 1.657421875,
|
|
"epoch": 2.153454947484798,
|
|
"grad_norm": 4.244692325592041,
|
|
"learning_rate": 9.867922704071583e-07,
|
|
"loss": 1.6454,
|
|
"mean_token_accuracy": 0.594467768073082,
|
|
"num_tokens": 35148977.0,
|
|
"step": 9740
|
|
},
|
|
{
|
|
"entropy": 1.65,
|
|
"epoch": 2.155666113875069,
|
|
"grad_norm": 3.924206495285034,
|
|
"learning_rate": 9.820129220615896e-07,
|
|
"loss": 1.6676,
|
|
"mean_token_accuracy": 0.5851344615221024,
|
|
"num_tokens": 35184040.0,
|
|
"step": 9750
|
|
},
|
|
{
|
|
"entropy": 1.6625,
|
|
"epoch": 2.15787728026534,
|
|
"grad_norm": 3.689344644546509,
|
|
"learning_rate": 9.772423453983466e-07,
|
|
"loss": 1.6678,
|
|
"mean_token_accuracy": 0.5863826185464859,
|
|
"num_tokens": 35221491.0,
|
|
"step": 9760
|
|
},
|
|
{
|
|
"entropy": 1.698046875,
|
|
"epoch": 2.1600884466556107,
|
|
"grad_norm": 3.783862590789795,
|
|
"learning_rate": 9.72480567984188e-07,
|
|
"loss": 1.7159,
|
|
"mean_token_accuracy": 0.5796569019556046,
|
|
"num_tokens": 35259732.0,
|
|
"step": 9770
|
|
},
|
|
{
|
|
"entropy": 1.616015625,
|
|
"epoch": 2.1622996130458816,
|
|
"grad_norm": 3.214698076248169,
|
|
"learning_rate": 9.677276173350248e-07,
|
|
"loss": 1.6039,
|
|
"mean_token_accuracy": 0.601754567027092,
|
|
"num_tokens": 35295716.0,
|
|
"step": 9780
|
|
},
|
|
{
|
|
"entropy": 1.6703125,
|
|
"epoch": 2.1645107794361524,
|
|
"grad_norm": 3.0740807056427,
|
|
"learning_rate": 9.629835209157634e-07,
|
|
"loss": 1.6665,
|
|
"mean_token_accuracy": 0.5883079558610916,
|
|
"num_tokens": 35332139.0,
|
|
"step": 9790
|
|
},
|
|
{
|
|
"entropy": 1.66875,
|
|
"epoch": 2.1667219458264233,
|
|
"grad_norm": 3.392265796661377,
|
|
"learning_rate": 9.582483061401478e-07,
|
|
"loss": 1.6367,
|
|
"mean_token_accuracy": 0.5929653942584991,
|
|
"num_tokens": 35367639.0,
|
|
"step": 9800
|
|
},
|
|
{
|
|
"entropy": 1.64140625,
|
|
"epoch": 2.168933112216694,
|
|
"grad_norm": 3.8785974979400635,
|
|
"learning_rate": 9.535220003705953e-07,
|
|
"loss": 1.6411,
|
|
"mean_token_accuracy": 0.5909535974264145,
|
|
"num_tokens": 35402288.0,
|
|
"step": 9810
|
|
},
|
|
{
|
|
"entropy": 1.665625,
|
|
"epoch": 2.171144278606965,
|
|
"grad_norm": 4.227286338806152,
|
|
"learning_rate": 9.488046309180482e-07,
|
|
"loss": 1.6816,
|
|
"mean_token_accuracy": 0.5812132567167282,
|
|
"num_tokens": 35437739.0,
|
|
"step": 9820
|
|
},
|
|
{
|
|
"entropy": 1.66328125,
|
|
"epoch": 2.173355444997236,
|
|
"grad_norm": 3.2717180252075195,
|
|
"learning_rate": 9.440962250418048e-07,
|
|
"loss": 1.6463,
|
|
"mean_token_accuracy": 0.593735134601593,
|
|
"num_tokens": 35472974.0,
|
|
"step": 9830
|
|
},
|
|
{
|
|
"entropy": 1.676953125,
|
|
"epoch": 2.1755666113875067,
|
|
"grad_norm": 3.9498894214630127,
|
|
"learning_rate": 9.393968099493714e-07,
|
|
"loss": 1.6623,
|
|
"mean_token_accuracy": 0.5901206344366073,
|
|
"num_tokens": 35509352.0,
|
|
"step": 9840
|
|
},
|
|
{
|
|
"entropy": 1.69375,
|
|
"epoch": 2.1777777777777776,
|
|
"grad_norm": 3.717860698699951,
|
|
"learning_rate": 9.34706412796297e-07,
|
|
"loss": 1.6666,
|
|
"mean_token_accuracy": 0.5834533333778381,
|
|
"num_tokens": 35543274.0,
|
|
"step": 9850
|
|
},
|
|
{
|
|
"entropy": 1.662890625,
|
|
"epoch": 2.1799889441680484,
|
|
"grad_norm": 4.873961925506592,
|
|
"learning_rate": 9.300250606860268e-07,
|
|
"loss": 1.6608,
|
|
"mean_token_accuracy": 0.5882317185401916,
|
|
"num_tokens": 35579838.0,
|
|
"step": 9860
|
|
},
|
|
{
|
|
"entropy": 1.678125,
|
|
"epoch": 2.1822001105583193,
|
|
"grad_norm": 3.683516502380371,
|
|
"learning_rate": 9.253527806697321e-07,
|
|
"loss": 1.7087,
|
|
"mean_token_accuracy": 0.5794265359640122,
|
|
"num_tokens": 35618351.0,
|
|
"step": 9870
|
|
},
|
|
{
|
|
"entropy": 1.63515625,
|
|
"epoch": 2.18441127694859,
|
|
"grad_norm": 4.722360610961914,
|
|
"learning_rate": 9.206895997461668e-07,
|
|
"loss": 1.6369,
|
|
"mean_token_accuracy": 0.5896208763122559,
|
|
"num_tokens": 35653740.0,
|
|
"step": 9880
|
|
},
|
|
{
|
|
"entropy": 1.662890625,
|
|
"epoch": 2.1866224433388615,
|
|
"grad_norm": 4.031754493713379,
|
|
"learning_rate": 9.160355448615008e-07,
|
|
"loss": 1.6376,
|
|
"mean_token_accuracy": 0.5892221212387085,
|
|
"num_tokens": 35687463.0,
|
|
"step": 9890
|
|
},
|
|
{
|
|
"entropy": 1.703125,
|
|
"epoch": 2.1888336097291323,
|
|
"grad_norm": 3.8833189010620117,
|
|
"learning_rate": 9.113906429091754e-07,
|
|
"loss": 1.6719,
|
|
"mean_token_accuracy": 0.5895426988601684,
|
|
"num_tokens": 35725791.0,
|
|
"step": 9900
|
|
},
|
|
{
|
|
"entropy": 1.663671875,
|
|
"epoch": 2.191044776119403,
|
|
"grad_norm": 4.354165077209473,
|
|
"learning_rate": 9.06754920729735e-07,
|
|
"loss": 1.6416,
|
|
"mean_token_accuracy": 0.5888224154710769,
|
|
"num_tokens": 35761365.0,
|
|
"step": 9910
|
|
},
|
|
{
|
|
"entropy": 1.6421875,
|
|
"epoch": 2.193255942509674,
|
|
"grad_norm": 4.1222639083862305,
|
|
"learning_rate": 9.021284051106832e-07,
|
|
"loss": 1.6402,
|
|
"mean_token_accuracy": 0.5917343676090241,
|
|
"num_tokens": 35796572.0,
|
|
"step": 9920
|
|
},
|
|
{
|
|
"entropy": 1.633203125,
|
|
"epoch": 2.195467108899945,
|
|
"grad_norm": 3.9305975437164307,
|
|
"learning_rate": 8.975111227863223e-07,
|
|
"loss": 1.644,
|
|
"mean_token_accuracy": 0.5896116942167282,
|
|
"num_tokens": 35832785.0,
|
|
"step": 9930
|
|
},
|
|
{
|
|
"entropy": 1.643359375,
|
|
"epoch": 2.1976782752902158,
|
|
"grad_norm": 4.133862018585205,
|
|
"learning_rate": 8.929031004376004e-07,
|
|
"loss": 1.6376,
|
|
"mean_token_accuracy": 0.5921714454889297,
|
|
"num_tokens": 35869508.0,
|
|
"step": 9940
|
|
},
|
|
{
|
|
"entropy": 1.682421875,
|
|
"epoch": 2.1998894416804866,
|
|
"grad_norm": 4.324777126312256,
|
|
"learning_rate": 8.883043646919551e-07,
|
|
"loss": 1.6991,
|
|
"mean_token_accuracy": 0.5864171355962753,
|
|
"num_tokens": 35909075.0,
|
|
"step": 9950
|
|
},
|
|
{
|
|
"entropy": 1.640234375,
|
|
"epoch": 2.2021006080707575,
|
|
"grad_norm": 3.720689058303833,
|
|
"learning_rate": 8.83714942123163e-07,
|
|
"loss": 1.617,
|
|
"mean_token_accuracy": 0.5940989196300507,
|
|
"num_tokens": 35942928.0,
|
|
"step": 9960
|
|
},
|
|
{
|
|
"entropy": 1.68671875,
|
|
"epoch": 2.2043117744610283,
|
|
"grad_norm": 3.8230671882629395,
|
|
"learning_rate": 8.79134859251185e-07,
|
|
"loss": 1.6806,
|
|
"mean_token_accuracy": 0.5844277948141098,
|
|
"num_tokens": 35977541.0,
|
|
"step": 9970
|
|
},
|
|
{
|
|
"entropy": 1.669140625,
|
|
"epoch": 2.206522940851299,
|
|
"grad_norm": 4.613833904266357,
|
|
"learning_rate": 8.745641425420124e-07,
|
|
"loss": 1.6498,
|
|
"mean_token_accuracy": 0.5863915592432022,
|
|
"num_tokens": 36012867.0,
|
|
"step": 9980
|
|
},
|
|
{
|
|
"entropy": 1.646484375,
|
|
"epoch": 2.20873410724157,
|
|
"grad_norm": 4.28706169128418,
|
|
"learning_rate": 8.700028184075119e-07,
|
|
"loss": 1.6286,
|
|
"mean_token_accuracy": 0.5974502593278885,
|
|
"num_tokens": 36050003.0,
|
|
"step": 9990
|
|
},
|
|
{
|
|
"entropy": 1.67578125,
|
|
"epoch": 2.210945273631841,
|
|
"grad_norm": 4.122777938842773,
|
|
"learning_rate": 8.654509132052774e-07,
|
|
"loss": 1.662,
|
|
"mean_token_accuracy": 0.5833598256111145,
|
|
"num_tokens": 36086485.0,
|
|
"step": 10000
|
|
},
|
|
{
|
|
"epoch": 2.210945273631841,
|
|
"eval_entropy": 1.680939054726368,
|
|
"eval_loss": 1.7898541688919067,
|
|
"eval_mean_token_accuracy": 0.5655909090196315,
|
|
"eval_num_tokens": 36086485.0,
|
|
"eval_runtime": 112.5324,
|
|
"eval_samples_per_second": 142.892,
|
|
"eval_steps_per_second": 8.931,
|
|
"step": 10000
|
|
},
|
|
{
|
|
"entropy": 1.635546875,
|
|
"epoch": 2.2131564400221118,
|
|
"grad_norm": 3.622375249862671,
|
|
"learning_rate": 8.609084532384759e-07,
|
|
"loss": 1.6093,
|
|
"mean_token_accuracy": 0.59775630235672,
|
|
"num_tokens": 36126191.0,
|
|
"step": 10010
|
|
},
|
|
{
|
|
"entropy": 1.6359375,
|
|
"epoch": 2.2153676064123826,
|
|
"grad_norm": 4.0857415199279785,
|
|
"learning_rate": 8.563754647556946e-07,
|
|
"loss": 1.6107,
|
|
"mean_token_accuracy": 0.5934461295604706,
|
|
"num_tokens": 36159445.0,
|
|
"step": 10020
|
|
},
|
|
{
|
|
"entropy": 1.635546875,
|
|
"epoch": 2.2175787728026535,
|
|
"grad_norm": 2.851653575897217,
|
|
"learning_rate": 8.518519739507882e-07,
|
|
"loss": 1.639,
|
|
"mean_token_accuracy": 0.5913150012493134,
|
|
"num_tokens": 36196739.0,
|
|
"step": 10030
|
|
},
|
|
{
|
|
"entropy": 1.63671875,
|
|
"epoch": 2.2197899391929243,
|
|
"grad_norm": 3.781244993209839,
|
|
"learning_rate": 8.47338006962731e-07,
|
|
"loss": 1.6461,
|
|
"mean_token_accuracy": 0.5871370524168015,
|
|
"num_tokens": 36232574.0,
|
|
"step": 10040
|
|
},
|
|
{
|
|
"entropy": 1.61875,
|
|
"epoch": 2.222001105583195,
|
|
"grad_norm": 3.7562243938446045,
|
|
"learning_rate": 8.428335898754644e-07,
|
|
"loss": 1.6152,
|
|
"mean_token_accuracy": 0.5953419506549835,
|
|
"num_tokens": 36269132.0,
|
|
"step": 10050
|
|
},
|
|
{
|
|
"entropy": 1.621875,
|
|
"epoch": 2.224212271973466,
|
|
"grad_norm": 4.491815090179443,
|
|
"learning_rate": 8.38338748717743e-07,
|
|
"loss": 1.6145,
|
|
"mean_token_accuracy": 0.59502092897892,
|
|
"num_tokens": 36304282.0,
|
|
"step": 10060
|
|
},
|
|
{
|
|
"entropy": 1.678125,
|
|
"epoch": 2.226423438363737,
|
|
"grad_norm": 3.691129446029663,
|
|
"learning_rate": 8.338535094629894e-07,
|
|
"loss": 1.6846,
|
|
"mean_token_accuracy": 0.5799425959587097,
|
|
"num_tokens": 36342300.0,
|
|
"step": 10070
|
|
},
|
|
{
|
|
"entropy": 1.61796875,
|
|
"epoch": 2.2286346047540078,
|
|
"grad_norm": 3.6524910926818848,
|
|
"learning_rate": 8.293778980291408e-07,
|
|
"loss": 1.6037,
|
|
"mean_token_accuracy": 0.599416071176529,
|
|
"num_tokens": 36376260.0,
|
|
"step": 10080
|
|
},
|
|
{
|
|
"entropy": 1.64375,
|
|
"epoch": 2.2308457711442786,
|
|
"grad_norm": 3.0791642665863037,
|
|
"learning_rate": 8.249119402785014e-07,
|
|
"loss": 1.6234,
|
|
"mean_token_accuracy": 0.592498853802681,
|
|
"num_tokens": 36414113.0,
|
|
"step": 10090
|
|
},
|
|
{
|
|
"entropy": 1.65625,
|
|
"epoch": 2.2330569375345495,
|
|
"grad_norm": 4.270403861999512,
|
|
"learning_rate": 8.204556620175882e-07,
|
|
"loss": 1.6191,
|
|
"mean_token_accuracy": 0.5977440983057022,
|
|
"num_tokens": 36451234.0,
|
|
"step": 10100
|
|
},
|
|
{
|
|
"entropy": 1.69609375,
|
|
"epoch": 2.2352681039248203,
|
|
"grad_norm": 3.685277223587036,
|
|
"learning_rate": 8.160090889969887e-07,
|
|
"loss": 1.6686,
|
|
"mean_token_accuracy": 0.5867778480052948,
|
|
"num_tokens": 36490205.0,
|
|
"step": 10110
|
|
},
|
|
{
|
|
"entropy": 1.630859375,
|
|
"epoch": 2.237479270315091,
|
|
"grad_norm": 3.2156941890716553,
|
|
"learning_rate": 8.115722469112078e-07,
|
|
"loss": 1.6168,
|
|
"mean_token_accuracy": 0.5949454426765441,
|
|
"num_tokens": 36526931.0,
|
|
"step": 10120
|
|
},
|
|
{
|
|
"entropy": 1.658984375,
|
|
"epoch": 2.239690436705362,
|
|
"grad_norm": 4.47505521774292,
|
|
"learning_rate": 8.071451613985199e-07,
|
|
"loss": 1.6613,
|
|
"mean_token_accuracy": 0.5873622119426727,
|
|
"num_tokens": 36561128.0,
|
|
"step": 10130
|
|
},
|
|
{
|
|
"entropy": 1.641796875,
|
|
"epoch": 2.241901603095633,
|
|
"grad_norm": 3.8162333965301514,
|
|
"learning_rate": 8.027278580408194e-07,
|
|
"loss": 1.6177,
|
|
"mean_token_accuracy": 0.5959106415510178,
|
|
"num_tokens": 36594792.0,
|
|
"step": 10140
|
|
},
|
|
{
|
|
"entropy": 1.690625,
|
|
"epoch": 2.2441127694859038,
|
|
"grad_norm": 3.5998377799987793,
|
|
"learning_rate": 7.983203623634794e-07,
|
|
"loss": 1.6803,
|
|
"mean_token_accuracy": 0.588790038228035,
|
|
"num_tokens": 36635052.0,
|
|
"step": 10150
|
|
},
|
|
{
|
|
"entropy": 1.665625,
|
|
"epoch": 2.2463239358761746,
|
|
"grad_norm": 4.129461765289307,
|
|
"learning_rate": 7.939226998351934e-07,
|
|
"loss": 1.6482,
|
|
"mean_token_accuracy": 0.5881589829921723,
|
|
"num_tokens": 36671561.0,
|
|
"step": 10160
|
|
},
|
|
{
|
|
"entropy": 1.671875,
|
|
"epoch": 2.2485351022664455,
|
|
"grad_norm": 3.663065195083618,
|
|
"learning_rate": 7.895348958678392e-07,
|
|
"loss": 1.6579,
|
|
"mean_token_accuracy": 0.5880895465612411,
|
|
"num_tokens": 36708621.0,
|
|
"step": 10170
|
|
},
|
|
{
|
|
"entropy": 1.6234375,
|
|
"epoch": 2.2507462686567163,
|
|
"grad_norm": 3.5403990745544434,
|
|
"learning_rate": 7.851569758163217e-07,
|
|
"loss": 1.6003,
|
|
"mean_token_accuracy": 0.5959459006786346,
|
|
"num_tokens": 36743451.0,
|
|
"step": 10180
|
|
},
|
|
{
|
|
"entropy": 1.64609375,
|
|
"epoch": 2.252957435046987,
|
|
"grad_norm": 3.9739184379577637,
|
|
"learning_rate": 7.807889649784381e-07,
|
|
"loss": 1.6404,
|
|
"mean_token_accuracy": 0.590265879034996,
|
|
"num_tokens": 36780513.0,
|
|
"step": 10190
|
|
},
|
|
{
|
|
"entropy": 1.66875,
|
|
"epoch": 2.255168601437258,
|
|
"grad_norm": 4.181736469268799,
|
|
"learning_rate": 7.764308885947191e-07,
|
|
"loss": 1.666,
|
|
"mean_token_accuracy": 0.5878528714179992,
|
|
"num_tokens": 36815328.0,
|
|
"step": 10200
|
|
},
|
|
{
|
|
"entropy": 1.644921875,
|
|
"epoch": 2.257379767827529,
|
|
"grad_norm": 3.944838285446167,
|
|
"learning_rate": 7.720827718482937e-07,
|
|
"loss": 1.6353,
|
|
"mean_token_accuracy": 0.5911028474569321,
|
|
"num_tokens": 36851301.0,
|
|
"step": 10210
|
|
},
|
|
{
|
|
"entropy": 1.667578125,
|
|
"epoch": 2.2595909342177998,
|
|
"grad_norm": 4.653888702392578,
|
|
"learning_rate": 7.677446398647348e-07,
|
|
"loss": 1.6914,
|
|
"mean_token_accuracy": 0.584631872177124,
|
|
"num_tokens": 36889784.0,
|
|
"step": 10220
|
|
},
|
|
{
|
|
"entropy": 1.652734375,
|
|
"epoch": 2.2618021006080706,
|
|
"grad_norm": 3.6742589473724365,
|
|
"learning_rate": 7.63416517711924e-07,
|
|
"loss": 1.6224,
|
|
"mean_token_accuracy": 0.5906828016042709,
|
|
"num_tokens": 36925544.0,
|
|
"step": 10230
|
|
},
|
|
{
|
|
"entropy": 1.67578125,
|
|
"epoch": 2.2640132669983415,
|
|
"grad_norm": 3.3667688369750977,
|
|
"learning_rate": 7.590984303998961e-07,
|
|
"loss": 1.6873,
|
|
"mean_token_accuracy": 0.5787302792072296,
|
|
"num_tokens": 36961836.0,
|
|
"step": 10240
|
|
},
|
|
{
|
|
"entropy": 1.629296875,
|
|
"epoch": 2.2662244333886123,
|
|
"grad_norm": 3.7188103199005127,
|
|
"learning_rate": 7.547904028807018e-07,
|
|
"loss": 1.6243,
|
|
"mean_token_accuracy": 0.5905676364898682,
|
|
"num_tokens": 36998707.0,
|
|
"step": 10250
|
|
},
|
|
{
|
|
"entropy": 1.617578125,
|
|
"epoch": 2.268435599778883,
|
|
"grad_norm": 3.8408377170562744,
|
|
"learning_rate": 7.504924600482613e-07,
|
|
"loss": 1.6017,
|
|
"mean_token_accuracy": 0.5996009021997452,
|
|
"num_tokens": 37033074.0,
|
|
"step": 10260
|
|
},
|
|
{
|
|
"entropy": 1.64609375,
|
|
"epoch": 2.270646766169154,
|
|
"grad_norm": 3.645970344543457,
|
|
"learning_rate": 7.462046267382212e-07,
|
|
"loss": 1.6337,
|
|
"mean_token_accuracy": 0.59505954682827,
|
|
"num_tokens": 37067366.0,
|
|
"step": 10270
|
|
},
|
|
{
|
|
"entropy": 1.65078125,
|
|
"epoch": 2.272857932559425,
|
|
"grad_norm": 2.9627480506896973,
|
|
"learning_rate": 7.419269277278073e-07,
|
|
"loss": 1.6671,
|
|
"mean_token_accuracy": 0.5880758047103882,
|
|
"num_tokens": 37104039.0,
|
|
"step": 10280
|
|
},
|
|
{
|
|
"entropy": 1.6265625,
|
|
"epoch": 2.275069098949696,
|
|
"grad_norm": 3.653026580810547,
|
|
"learning_rate": 7.376593877356877e-07,
|
|
"loss": 1.629,
|
|
"mean_token_accuracy": 0.5970774859189987,
|
|
"num_tokens": 37141842.0,
|
|
"step": 10290
|
|
},
|
|
{
|
|
"entropy": 1.642578125,
|
|
"epoch": 2.277280265339967,
|
|
"grad_norm": 3.448512554168701,
|
|
"learning_rate": 7.33402031421826e-07,
|
|
"loss": 1.6581,
|
|
"mean_token_accuracy": 0.587392058968544,
|
|
"num_tokens": 37175871.0,
|
|
"step": 10300
|
|
},
|
|
{
|
|
"entropy": 1.7,
|
|
"epoch": 2.2794914317302375,
|
|
"grad_norm": 3.149461030960083,
|
|
"learning_rate": 7.291548833873371e-07,
|
|
"loss": 1.6907,
|
|
"mean_token_accuracy": 0.5861868977546691,
|
|
"num_tokens": 37212259.0,
|
|
"step": 10310
|
|
},
|
|
{
|
|
"entropy": 1.66328125,
|
|
"epoch": 2.281702598120509,
|
|
"grad_norm": 3.343381881713867,
|
|
"learning_rate": 7.249179681743501e-07,
|
|
"loss": 1.6364,
|
|
"mean_token_accuracy": 0.5925963282585144,
|
|
"num_tokens": 37249439.0,
|
|
"step": 10320
|
|
},
|
|
{
|
|
"entropy": 1.663671875,
|
|
"epoch": 2.283913764510779,
|
|
"grad_norm": 3.8509092330932617,
|
|
"learning_rate": 7.206913102658627e-07,
|
|
"loss": 1.6588,
|
|
"mean_token_accuracy": 0.5876330971717835,
|
|
"num_tokens": 37287615.0,
|
|
"step": 10330
|
|
},
|
|
{
|
|
"entropy": 1.66484375,
|
|
"epoch": 2.2861249309010505,
|
|
"grad_norm": 4.006129264831543,
|
|
"learning_rate": 7.164749340856014e-07,
|
|
"loss": 1.657,
|
|
"mean_token_accuracy": 0.5862541973590851,
|
|
"num_tokens": 37324320.0,
|
|
"step": 10340
|
|
},
|
|
{
|
|
"entropy": 1.6453125,
|
|
"epoch": 2.288336097291321,
|
|
"grad_norm": 3.49574613571167,
|
|
"learning_rate": 7.122688639978784e-07,
|
|
"loss": 1.6123,
|
|
"mean_token_accuracy": 0.5951761305332184,
|
|
"num_tokens": 37359408.0,
|
|
"step": 10350
|
|
},
|
|
{
|
|
"entropy": 1.612890625,
|
|
"epoch": 2.2905472636815922,
|
|
"grad_norm": 3.669109344482422,
|
|
"learning_rate": 7.080731243074531e-07,
|
|
"loss": 1.587,
|
|
"mean_token_accuracy": 0.5994881123304368,
|
|
"num_tokens": 37391792.0,
|
|
"step": 10360
|
|
},
|
|
{
|
|
"entropy": 1.646875,
|
|
"epoch": 2.292758430071863,
|
|
"grad_norm": 3.4717578887939453,
|
|
"learning_rate": 7.038877392593913e-07,
|
|
"loss": 1.6496,
|
|
"mean_token_accuracy": 0.5929923504590988,
|
|
"num_tokens": 37428862.0,
|
|
"step": 10370
|
|
},
|
|
{
|
|
"entropy": 1.65703125,
|
|
"epoch": 2.294969596462134,
|
|
"grad_norm": 4.697922706604004,
|
|
"learning_rate": 6.997127330389242e-07,
|
|
"loss": 1.6583,
|
|
"mean_token_accuracy": 0.5864217549562454,
|
|
"num_tokens": 37465379.0,
|
|
"step": 10380
|
|
},
|
|
{
|
|
"entropy": 1.589453125,
|
|
"epoch": 2.297180762852405,
|
|
"grad_norm": 4.279449939727783,
|
|
"learning_rate": 6.955481297713076e-07,
|
|
"loss": 1.5721,
|
|
"mean_token_accuracy": 0.6088831961154938,
|
|
"num_tokens": 37501343.0,
|
|
"step": 10390
|
|
},
|
|
{
|
|
"entropy": 1.66953125,
|
|
"epoch": 2.2993919292426757,
|
|
"grad_norm": 4.148053169250488,
|
|
"learning_rate": 6.913939535216857e-07,
|
|
"loss": 1.6847,
|
|
"mean_token_accuracy": 0.5842261284589767,
|
|
"num_tokens": 37538598.0,
|
|
"step": 10400
|
|
},
|
|
{
|
|
"entropy": 1.63046875,
|
|
"epoch": 2.3016030956329465,
|
|
"grad_norm": 4.100341320037842,
|
|
"learning_rate": 6.872502282949495e-07,
|
|
"loss": 1.6174,
|
|
"mean_token_accuracy": 0.5970572859048844,
|
|
"num_tokens": 37573477.0,
|
|
"step": 10410
|
|
},
|
|
{
|
|
"entropy": 1.650390625,
|
|
"epoch": 2.3038142620232174,
|
|
"grad_norm": 4.222926139831543,
|
|
"learning_rate": 6.831169780355995e-07,
|
|
"loss": 1.6499,
|
|
"mean_token_accuracy": 0.5906051814556121,
|
|
"num_tokens": 37608542.0,
|
|
"step": 10420
|
|
},
|
|
{
|
|
"entropy": 1.61640625,
|
|
"epoch": 2.3060254284134882,
|
|
"grad_norm": 3.443911075592041,
|
|
"learning_rate": 6.789942266276045e-07,
|
|
"loss": 1.6147,
|
|
"mean_token_accuracy": 0.5979989409446717,
|
|
"num_tokens": 37645524.0,
|
|
"step": 10430
|
|
},
|
|
{
|
|
"entropy": 1.62265625,
|
|
"epoch": 2.308236594803759,
|
|
"grad_norm": 4.070090293884277,
|
|
"learning_rate": 6.748819978942677e-07,
|
|
"loss": 1.6382,
|
|
"mean_token_accuracy": 0.590546327829361,
|
|
"num_tokens": 37681349.0,
|
|
"step": 10440
|
|
},
|
|
{
|
|
"entropy": 1.6484375,
|
|
"epoch": 2.31044776119403,
|
|
"grad_norm": 4.308807373046875,
|
|
"learning_rate": 6.707803155980872e-07,
|
|
"loss": 1.6673,
|
|
"mean_token_accuracy": 0.5826854348182678,
|
|
"num_tokens": 37716852.0,
|
|
"step": 10450
|
|
},
|
|
{
|
|
"entropy": 1.667578125,
|
|
"epoch": 2.312658927584301,
|
|
"grad_norm": 3.232156276702881,
|
|
"learning_rate": 6.666892034406183e-07,
|
|
"loss": 1.6611,
|
|
"mean_token_accuracy": 0.5924216598272324,
|
|
"num_tokens": 37751490.0,
|
|
"step": 10460
|
|
},
|
|
{
|
|
"entropy": 1.669140625,
|
|
"epoch": 2.3148700939745717,
|
|
"grad_norm": 3.4908416271209717,
|
|
"learning_rate": 6.62608685062334e-07,
|
|
"loss": 1.6747,
|
|
"mean_token_accuracy": 0.5884420543909072,
|
|
"num_tokens": 37786868.0,
|
|
"step": 10470
|
|
},
|
|
{
|
|
"entropy": 1.649609375,
|
|
"epoch": 2.3170812603648425,
|
|
"grad_norm": 4.414630889892578,
|
|
"learning_rate": 6.585387840424967e-07,
|
|
"loss": 1.6462,
|
|
"mean_token_accuracy": 0.5911196172237396,
|
|
"num_tokens": 37820619.0,
|
|
"step": 10480
|
|
},
|
|
{
|
|
"entropy": 1.669921875,
|
|
"epoch": 2.3192924267551134,
|
|
"grad_norm": 3.9287071228027344,
|
|
"learning_rate": 6.544795238990115e-07,
|
|
"loss": 1.6451,
|
|
"mean_token_accuracy": 0.586186683177948,
|
|
"num_tokens": 37857350.0,
|
|
"step": 10490
|
|
},
|
|
{
|
|
"entropy": 1.659765625,
|
|
"epoch": 2.3215035931453842,
|
|
"grad_norm": 4.126605033874512,
|
|
"learning_rate": 6.504309280882981e-07,
|
|
"loss": 1.6359,
|
|
"mean_token_accuracy": 0.5897322088479996,
|
|
"num_tokens": 37893891.0,
|
|
"step": 10500
|
|
},
|
|
{
|
|
"epoch": 2.3215035931453842,
|
|
"eval_entropy": 1.6942241915422886,
|
|
"eval_loss": 1.785590410232544,
|
|
"eval_mean_token_accuracy": 0.5662108426070331,
|
|
"eval_num_tokens": 37893891.0,
|
|
"eval_runtime": 113.3166,
|
|
"eval_samples_per_second": 141.903,
|
|
"eval_steps_per_second": 8.869,
|
|
"step": 10500
|
|
},
|
|
{
|
|
"entropy": 1.615234375,
|
|
"epoch": 2.323714759535655,
|
|
"grad_norm": 4.357997894287109,
|
|
"learning_rate": 6.463930200051494e-07,
|
|
"loss": 1.5731,
|
|
"mean_token_accuracy": 0.6029756456613541,
|
|
"num_tokens": 37929901.0,
|
|
"step": 10510
|
|
},
|
|
{
|
|
"entropy": 1.630078125,
|
|
"epoch": 2.325925925925926,
|
|
"grad_norm": 4.052964210510254,
|
|
"learning_rate": 6.42365822982604e-07,
|
|
"loss": 1.6082,
|
|
"mean_token_accuracy": 0.5999705284833908,
|
|
"num_tokens": 37968198.0,
|
|
"step": 10520
|
|
},
|
|
{
|
|
"entropy": 1.662890625,
|
|
"epoch": 2.328137092316197,
|
|
"grad_norm": 4.5125908851623535,
|
|
"learning_rate": 6.38349360291802e-07,
|
|
"loss": 1.6639,
|
|
"mean_token_accuracy": 0.5870465397834778,
|
|
"num_tokens": 38005072.0,
|
|
"step": 10530
|
|
},
|
|
{
|
|
"entropy": 1.6265625,
|
|
"epoch": 2.3303482587064677,
|
|
"grad_norm": 4.022906303405762,
|
|
"learning_rate": 6.343436551418586e-07,
|
|
"loss": 1.6122,
|
|
"mean_token_accuracy": 0.5981589943170548,
|
|
"num_tokens": 38038455.0,
|
|
"step": 10540
|
|
},
|
|
{
|
|
"entropy": 1.66875,
|
|
"epoch": 2.3325594250967385,
|
|
"grad_norm": 4.6861443519592285,
|
|
"learning_rate": 6.303487306797237e-07,
|
|
"loss": 1.6474,
|
|
"mean_token_accuracy": 0.5891249388456344,
|
|
"num_tokens": 38074616.0,
|
|
"step": 10550
|
|
},
|
|
{
|
|
"entropy": 1.63671875,
|
|
"epoch": 2.3347705914870094,
|
|
"grad_norm": 3.9527344703674316,
|
|
"learning_rate": 6.263646099900531e-07,
|
|
"loss": 1.6259,
|
|
"mean_token_accuracy": 0.5952818065881729,
|
|
"num_tokens": 38110929.0,
|
|
"step": 10560
|
|
},
|
|
{
|
|
"entropy": 1.646875,
|
|
"epoch": 2.3369817578772802,
|
|
"grad_norm": 4.391312122344971,
|
|
"learning_rate": 6.223913160950726e-07,
|
|
"loss": 1.628,
|
|
"mean_token_accuracy": 0.5921220153570175,
|
|
"num_tokens": 38149576.0,
|
|
"step": 10570
|
|
},
|
|
{
|
|
"entropy": 1.655859375,
|
|
"epoch": 2.339192924267551,
|
|
"grad_norm": 4.042408466339111,
|
|
"learning_rate": 6.184288719544451e-07,
|
|
"loss": 1.6228,
|
|
"mean_token_accuracy": 0.5952717304229737,
|
|
"num_tokens": 38185181.0,
|
|
"step": 10580
|
|
},
|
|
{
|
|
"entropy": 1.685546875,
|
|
"epoch": 2.341404090657822,
|
|
"grad_norm": 4.624055862426758,
|
|
"learning_rate": 6.144773004651394e-07,
|
|
"loss": 1.6795,
|
|
"mean_token_accuracy": 0.5825979053974152,
|
|
"num_tokens": 38219914.0,
|
|
"step": 10590
|
|
},
|
|
{
|
|
"entropy": 1.646484375,
|
|
"epoch": 2.343615257048093,
|
|
"grad_norm": 3.464829921722412,
|
|
"learning_rate": 6.105366244612939e-07,
|
|
"loss": 1.6397,
|
|
"mean_token_accuracy": 0.5915174454450607,
|
|
"num_tokens": 38253819.0,
|
|
"step": 10600
|
|
},
|
|
{
|
|
"entropy": 1.662109375,
|
|
"epoch": 2.3458264234383637,
|
|
"grad_norm": 4.028199195861816,
|
|
"learning_rate": 6.066068667140909e-07,
|
|
"loss": 1.6548,
|
|
"mean_token_accuracy": 0.5891728222370147,
|
|
"num_tokens": 38290928.0,
|
|
"step": 10610
|
|
},
|
|
{
|
|
"entropy": 1.646875,
|
|
"epoch": 2.3480375898286345,
|
|
"grad_norm": 2.417612075805664,
|
|
"learning_rate": 6.026880499316179e-07,
|
|
"loss": 1.6395,
|
|
"mean_token_accuracy": 0.5925948709249497,
|
|
"num_tokens": 38326906.0,
|
|
"step": 10620
|
|
},
|
|
{
|
|
"entropy": 1.648828125,
|
|
"epoch": 2.3502487562189054,
|
|
"grad_norm": 3.740410804748535,
|
|
"learning_rate": 5.98780196758745e-07,
|
|
"loss": 1.6254,
|
|
"mean_token_accuracy": 0.5938886612653732,
|
|
"num_tokens": 38361724.0,
|
|
"step": 10630
|
|
},
|
|
{
|
|
"entropy": 1.6625,
|
|
"epoch": 2.3524599226091762,
|
|
"grad_norm": 4.287269592285156,
|
|
"learning_rate": 5.948833297769843e-07,
|
|
"loss": 1.6733,
|
|
"mean_token_accuracy": 0.5877776056528091,
|
|
"num_tokens": 38399707.0,
|
|
"step": 10640
|
|
},
|
|
{
|
|
"entropy": 1.621484375,
|
|
"epoch": 2.354671088999447,
|
|
"grad_norm": 4.122889041900635,
|
|
"learning_rate": 5.909974715043676e-07,
|
|
"loss": 1.6029,
|
|
"mean_token_accuracy": 0.598813870549202,
|
|
"num_tokens": 38437196.0,
|
|
"step": 10650
|
|
},
|
|
{
|
|
"entropy": 1.67421875,
|
|
"epoch": 2.356882255389718,
|
|
"grad_norm": 4.526904106140137,
|
|
"learning_rate": 5.87122644395309e-07,
|
|
"loss": 1.6505,
|
|
"mean_token_accuracy": 0.5907502412796021,
|
|
"num_tokens": 38471316.0,
|
|
"step": 10660
|
|
},
|
|
{
|
|
"entropy": 1.66640625,
|
|
"epoch": 2.359093421779989,
|
|
"grad_norm": 4.458926200866699,
|
|
"learning_rate": 5.832588708404851e-07,
|
|
"loss": 1.676,
|
|
"mean_token_accuracy": 0.5830943793058395,
|
|
"num_tokens": 38505648.0,
|
|
"step": 10670
|
|
},
|
|
{
|
|
"entropy": 1.6828125,
|
|
"epoch": 2.3613045881702597,
|
|
"grad_norm": 3.751084566116333,
|
|
"learning_rate": 5.794061731666936e-07,
|
|
"loss": 1.6746,
|
|
"mean_token_accuracy": 0.5852399677038193,
|
|
"num_tokens": 38543739.0,
|
|
"step": 10680
|
|
},
|
|
{
|
|
"entropy": 1.675,
|
|
"epoch": 2.3635157545605305,
|
|
"grad_norm": 3.6415445804595947,
|
|
"learning_rate": 5.755645736367338e-07,
|
|
"loss": 1.6409,
|
|
"mean_token_accuracy": 0.5872159093618393,
|
|
"num_tokens": 38578087.0,
|
|
"step": 10690
|
|
},
|
|
{
|
|
"entropy": 1.683984375,
|
|
"epoch": 2.3657269209508014,
|
|
"grad_norm": 3.881847858428955,
|
|
"learning_rate": 5.717340944492727e-07,
|
|
"loss": 1.6689,
|
|
"mean_token_accuracy": 0.5817341655492783,
|
|
"num_tokens": 38612339.0,
|
|
"step": 10700
|
|
},
|
|
{
|
|
"entropy": 1.683203125,
|
|
"epoch": 2.3679380873410723,
|
|
"grad_norm": 4.006392955780029,
|
|
"learning_rate": 5.679147577387206e-07,
|
|
"loss": 1.6656,
|
|
"mean_token_accuracy": 0.5869998097419739,
|
|
"num_tokens": 38650965.0,
|
|
"step": 10710
|
|
},
|
|
{
|
|
"entropy": 1.653515625,
|
|
"epoch": 2.370149253731343,
|
|
"grad_norm": 3.6738076210021973,
|
|
"learning_rate": 5.64106585575098e-07,
|
|
"loss": 1.6204,
|
|
"mean_token_accuracy": 0.5924384534358978,
|
|
"num_tokens": 38686593.0,
|
|
"step": 10720
|
|
},
|
|
{
|
|
"entropy": 1.659375,
|
|
"epoch": 2.372360420121614,
|
|
"grad_norm": 3.932408332824707,
|
|
"learning_rate": 5.60309599963913e-07,
|
|
"loss": 1.6477,
|
|
"mean_token_accuracy": 0.5905351161956787,
|
|
"num_tokens": 38722229.0,
|
|
"step": 10730
|
|
},
|
|
{
|
|
"entropy": 1.6640625,
|
|
"epoch": 2.374571586511885,
|
|
"grad_norm": 3.4699652194976807,
|
|
"learning_rate": 5.565238228460324e-07,
|
|
"loss": 1.6284,
|
|
"mean_token_accuracy": 0.5913682550191879,
|
|
"num_tokens": 38757485.0,
|
|
"step": 10740
|
|
},
|
|
{
|
|
"entropy": 1.650390625,
|
|
"epoch": 2.376782752902156,
|
|
"grad_norm": 3.4888837337493896,
|
|
"learning_rate": 5.527492760975547e-07,
|
|
"loss": 1.6276,
|
|
"mean_token_accuracy": 0.5937826752662658,
|
|
"num_tokens": 38794335.0,
|
|
"step": 10750
|
|
},
|
|
{
|
|
"entropy": 1.624609375,
|
|
"epoch": 2.3789939192924265,
|
|
"grad_norm": 4.228898525238037,
|
|
"learning_rate": 5.489859815296819e-07,
|
|
"loss": 1.6229,
|
|
"mean_token_accuracy": 0.5922769755125046,
|
|
"num_tokens": 38829879.0,
|
|
"step": 10760
|
|
},
|
|
{
|
|
"entropy": 1.67265625,
|
|
"epoch": 2.381205085682698,
|
|
"grad_norm": 4.4233012199401855,
|
|
"learning_rate": 5.452339608885978e-07,
|
|
"loss": 1.6646,
|
|
"mean_token_accuracy": 0.5852960675954819,
|
|
"num_tokens": 38866394.0,
|
|
"step": 10770
|
|
},
|
|
{
|
|
"entropy": 1.645703125,
|
|
"epoch": 2.3834162520729683,
|
|
"grad_norm": 3.4468111991882324,
|
|
"learning_rate": 5.414932358553388e-07,
|
|
"loss": 1.6771,
|
|
"mean_token_accuracy": 0.5843212157487869,
|
|
"num_tokens": 38902928.0,
|
|
"step": 10780
|
|
},
|
|
{
|
|
"entropy": 1.61796875,
|
|
"epoch": 2.3856274184632396,
|
|
"grad_norm": 3.6829450130462646,
|
|
"learning_rate": 5.377638280456701e-07,
|
|
"loss": 1.6092,
|
|
"mean_token_accuracy": 0.5973028689622879,
|
|
"num_tokens": 38938536.0,
|
|
"step": 10790
|
|
},
|
|
{
|
|
"entropy": 1.68359375,
|
|
"epoch": 2.3878385848535104,
|
|
"grad_norm": 4.310695648193359,
|
|
"learning_rate": 5.340457590099587e-07,
|
|
"loss": 1.6551,
|
|
"mean_token_accuracy": 0.5871124714612961,
|
|
"num_tokens": 38972733.0,
|
|
"step": 10800
|
|
},
|
|
{
|
|
"entropy": 1.6875,
|
|
"epoch": 2.3900497512437813,
|
|
"grad_norm": 4.016414165496826,
|
|
"learning_rate": 5.303390502330525e-07,
|
|
"loss": 1.693,
|
|
"mean_token_accuracy": 0.5798867374658585,
|
|
"num_tokens": 39007685.0,
|
|
"step": 10810
|
|
},
|
|
{
|
|
"entropy": 1.63515625,
|
|
"epoch": 2.392260917634052,
|
|
"grad_norm": 3.880418300628662,
|
|
"learning_rate": 5.266437231341537e-07,
|
|
"loss": 1.6335,
|
|
"mean_token_accuracy": 0.5903711318969727,
|
|
"num_tokens": 39042124.0,
|
|
"step": 10820
|
|
},
|
|
{
|
|
"entropy": 1.691796875,
|
|
"epoch": 2.394472084024323,
|
|
"grad_norm": 3.4255521297454834,
|
|
"learning_rate": 5.229597990666957e-07,
|
|
"loss": 1.7028,
|
|
"mean_token_accuracy": 0.5805467665195465,
|
|
"num_tokens": 39079218.0,
|
|
"step": 10830
|
|
},
|
|
{
|
|
"entropy": 1.684765625,
|
|
"epoch": 2.396683250414594,
|
|
"grad_norm": 4.014716148376465,
|
|
"learning_rate": 5.192872993182182e-07,
|
|
"loss": 1.6658,
|
|
"mean_token_accuracy": 0.5832873821258545,
|
|
"num_tokens": 39115158.0,
|
|
"step": 10840
|
|
},
|
|
{
|
|
"entropy": 1.679296875,
|
|
"epoch": 2.3988944168048647,
|
|
"grad_norm": 4.473108768463135,
|
|
"learning_rate": 5.156262451102467e-07,
|
|
"loss": 1.6703,
|
|
"mean_token_accuracy": 0.5828846603631973,
|
|
"num_tokens": 39151839.0,
|
|
"step": 10850
|
|
},
|
|
{
|
|
"entropy": 1.655859375,
|
|
"epoch": 2.4011055831951356,
|
|
"grad_norm": 4.2684760093688965,
|
|
"learning_rate": 5.119766575981688e-07,
|
|
"loss": 1.6517,
|
|
"mean_token_accuracy": 0.5864876806735992,
|
|
"num_tokens": 39189825.0,
|
|
"step": 10860
|
|
},
|
|
{
|
|
"entropy": 1.653125,
|
|
"epoch": 2.4033167495854064,
|
|
"grad_norm": 2.9997897148132324,
|
|
"learning_rate": 5.083385578711119e-07,
|
|
"loss": 1.6116,
|
|
"mean_token_accuracy": 0.5985949277877808,
|
|
"num_tokens": 39226556.0,
|
|
"step": 10870
|
|
},
|
|
{
|
|
"entropy": 1.68359375,
|
|
"epoch": 2.4055279159756773,
|
|
"grad_norm": 4.303988456726074,
|
|
"learning_rate": 5.047119669518199e-07,
|
|
"loss": 1.6771,
|
|
"mean_token_accuracy": 0.584500515460968,
|
|
"num_tokens": 39263437.0,
|
|
"step": 10880
|
|
},
|
|
{
|
|
"entropy": 1.689453125,
|
|
"epoch": 2.407739082365948,
|
|
"grad_norm": 3.5498876571655273,
|
|
"learning_rate": 5.010969057965345e-07,
|
|
"loss": 1.6894,
|
|
"mean_token_accuracy": 0.5823587834835052,
|
|
"num_tokens": 39301329.0,
|
|
"step": 10890
|
|
},
|
|
{
|
|
"entropy": 1.673046875,
|
|
"epoch": 2.409950248756219,
|
|
"grad_norm": 3.913151979446411,
|
|
"learning_rate": 4.97493395294873e-07,
|
|
"loss": 1.6741,
|
|
"mean_token_accuracy": 0.583511883020401,
|
|
"num_tokens": 39336663.0,
|
|
"step": 10900
|
|
},
|
|
{
|
|
"entropy": 1.680078125,
|
|
"epoch": 2.41216141514649,
|
|
"grad_norm": 3.7701663970947266,
|
|
"learning_rate": 4.939014562697044e-07,
|
|
"loss": 1.6512,
|
|
"mean_token_accuracy": 0.5862707227468491,
|
|
"num_tokens": 39373724.0,
|
|
"step": 10910
|
|
},
|
|
{
|
|
"entropy": 1.696875,
|
|
"epoch": 2.4143725815367607,
|
|
"grad_norm": 4.002053737640381,
|
|
"learning_rate": 4.903211094770371e-07,
|
|
"loss": 1.7021,
|
|
"mean_token_accuracy": 0.5828726023435593,
|
|
"num_tokens": 39411475.0,
|
|
"step": 10920
|
|
},
|
|
{
|
|
"entropy": 1.64296875,
|
|
"epoch": 2.4165837479270316,
|
|
"grad_norm": 4.275795936584473,
|
|
"learning_rate": 4.867523756058887e-07,
|
|
"loss": 1.6565,
|
|
"mean_token_accuracy": 0.5852976709604263,
|
|
"num_tokens": 39446577.0,
|
|
"step": 10930
|
|
},
|
|
{
|
|
"entropy": 1.69375,
|
|
"epoch": 2.4187949143173024,
|
|
"grad_norm": 3.6176841259002686,
|
|
"learning_rate": 4.831952752781751e-07,
|
|
"loss": 1.7209,
|
|
"mean_token_accuracy": 0.5795985788106919,
|
|
"num_tokens": 39479749.0,
|
|
"step": 10940
|
|
},
|
|
{
|
|
"entropy": 1.62265625,
|
|
"epoch": 2.4210060807075733,
|
|
"grad_norm": 4.351016998291016,
|
|
"learning_rate": 4.796498290485846e-07,
|
|
"loss": 1.616,
|
|
"mean_token_accuracy": 0.6004918307065964,
|
|
"num_tokens": 39515645.0,
|
|
"step": 10950
|
|
},
|
|
{
|
|
"entropy": 1.644921875,
|
|
"epoch": 2.423217247097844,
|
|
"grad_norm": 4.595334529876709,
|
|
"learning_rate": 4.7611605740446707e-07,
|
|
"loss": 1.6236,
|
|
"mean_token_accuracy": 0.5942845910787582,
|
|
"num_tokens": 39551581.0,
|
|
"step": 10960
|
|
},
|
|
{
|
|
"entropy": 1.640234375,
|
|
"epoch": 2.425428413488115,
|
|
"grad_norm": 4.1810808181762695,
|
|
"learning_rate": 4.725939807657054e-07,
|
|
"loss": 1.6257,
|
|
"mean_token_accuracy": 0.5940275967121125,
|
|
"num_tokens": 39587731.0,
|
|
"step": 10970
|
|
},
|
|
{
|
|
"entropy": 1.688671875,
|
|
"epoch": 2.427639579878386,
|
|
"grad_norm": 3.4906792640686035,
|
|
"learning_rate": 4.690836194846071e-07,
|
|
"loss": 1.6692,
|
|
"mean_token_accuracy": 0.5860633373260498,
|
|
"num_tokens": 39627086.0,
|
|
"step": 10980
|
|
},
|
|
{
|
|
"entropy": 1.692578125,
|
|
"epoch": 2.4298507462686567,
|
|
"grad_norm": 4.0736083984375,
|
|
"learning_rate": 4.655849938457793e-07,
|
|
"loss": 1.6997,
|
|
"mean_token_accuracy": 0.5831152558326721,
|
|
"num_tokens": 39664628.0,
|
|
"step": 10990
|
|
},
|
|
{
|
|
"entropy": 1.68203125,
|
|
"epoch": 2.4320619126589276,
|
|
"grad_norm": 4.641111373901367,
|
|
"learning_rate": 4.6209812406601855e-07,
|
|
"loss": 1.6833,
|
|
"mean_token_accuracy": 0.583993273973465,
|
|
"num_tokens": 39701510.0,
|
|
"step": 11000
|
|
},
|
|
{
|
|
"epoch": 2.4320619126589276,
|
|
"eval_entropy": 1.68662157960199,
|
|
"eval_loss": 1.782144546508789,
|
|
"eval_mean_token_accuracy": 0.5668732436142158,
|
|
"eval_num_tokens": 39701510.0,
|
|
"eval_runtime": 112.3071,
|
|
"eval_samples_per_second": 143.179,
|
|
"eval_steps_per_second": 8.949,
|
|
"step": 11000
|
|
},
|
|
{
|
|
"entropy": 1.673046875,
|
|
"epoch": 2.4342730790491984,
|
|
"grad_norm": 4.4318013191223145,
|
|
"learning_rate": 4.586230302941866e-07,
|
|
"loss": 1.6719,
|
|
"mean_token_accuracy": 0.5887830674648284,
|
|
"num_tokens": 39737622.0,
|
|
"step": 11010
|
|
},
|
|
{
|
|
"entropy": 1.654296875,
|
|
"epoch": 2.4364842454394693,
|
|
"grad_norm": 4.570435523986816,
|
|
"learning_rate": 4.551597326110993e-07,
|
|
"loss": 1.6249,
|
|
"mean_token_accuracy": 0.5958606690168381,
|
|
"num_tokens": 39773361.0,
|
|
"step": 11020
|
|
},
|
|
{
|
|
"entropy": 1.64765625,
|
|
"epoch": 2.43869541182974,
|
|
"grad_norm": 3.7941668033599854,
|
|
"learning_rate": 4.517082510294088e-07,
|
|
"loss": 1.6505,
|
|
"mean_token_accuracy": 0.5901256650686264,
|
|
"num_tokens": 39812525.0,
|
|
"step": 11030
|
|
},
|
|
{
|
|
"entropy": 1.657421875,
|
|
"epoch": 2.440906578220011,
|
|
"grad_norm": 3.4180266857147217,
|
|
"learning_rate": 4.4826860549348843e-07,
|
|
"loss": 1.6593,
|
|
"mean_token_accuracy": 0.5855771720409393,
|
|
"num_tokens": 39848879.0,
|
|
"step": 11040
|
|
},
|
|
{
|
|
"entropy": 1.642578125,
|
|
"epoch": 2.443117744610282,
|
|
"grad_norm": 3.9395036697387695,
|
|
"learning_rate": 4.4484081587931496e-07,
|
|
"loss": 1.6353,
|
|
"mean_token_accuracy": 0.592729240655899,
|
|
"num_tokens": 39885789.0,
|
|
"step": 11050
|
|
},
|
|
{
|
|
"entropy": 1.62109375,
|
|
"epoch": 2.4453289110005527,
|
|
"grad_norm": 3.884824275970459,
|
|
"learning_rate": 4.414249019943576e-07,
|
|
"loss": 1.624,
|
|
"mean_token_accuracy": 0.5960972249507904,
|
|
"num_tokens": 39919422.0,
|
|
"step": 11060
|
|
},
|
|
{
|
|
"entropy": 1.637109375,
|
|
"epoch": 2.4475400773908236,
|
|
"grad_norm": 3.91243052482605,
|
|
"learning_rate": 4.3802088357746156e-07,
|
|
"loss": 1.6122,
|
|
"mean_token_accuracy": 0.6005002468824386,
|
|
"num_tokens": 39955924.0,
|
|
"step": 11070
|
|
},
|
|
{
|
|
"entropy": 1.673828125,
|
|
"epoch": 2.4497512437810944,
|
|
"grad_norm": 3.5646939277648926,
|
|
"learning_rate": 4.346287802987342e-07,
|
|
"loss": 1.6758,
|
|
"mean_token_accuracy": 0.5837758392095566,
|
|
"num_tokens": 39990995.0,
|
|
"step": 11080
|
|
},
|
|
{
|
|
"entropy": 1.66171875,
|
|
"epoch": 2.4519624101713653,
|
|
"grad_norm": 4.234783172607422,
|
|
"learning_rate": 4.312486117594297e-07,
|
|
"loss": 1.6553,
|
|
"mean_token_accuracy": 0.587647208571434,
|
|
"num_tokens": 40026310.0,
|
|
"step": 11090
|
|
},
|
|
{
|
|
"entropy": 1.693359375,
|
|
"epoch": 2.454173576561636,
|
|
"grad_norm": 3.986737012863159,
|
|
"learning_rate": 4.278803974918394e-07,
|
|
"loss": 1.6842,
|
|
"mean_token_accuracy": 0.5804200619459152,
|
|
"num_tokens": 40063477.0,
|
|
"step": 11100
|
|
},
|
|
{
|
|
"entropy": 1.675,
|
|
"epoch": 2.456384742951907,
|
|
"grad_norm": 4.200352191925049,
|
|
"learning_rate": 4.245241569591757e-07,
|
|
"loss": 1.6457,
|
|
"mean_token_accuracy": 0.5833163380622863,
|
|
"num_tokens": 40099246.0,
|
|
"step": 11110
|
|
},
|
|
{
|
|
"entropy": 1.65390625,
|
|
"epoch": 2.458595909342178,
|
|
"grad_norm": 3.4477579593658447,
|
|
"learning_rate": 4.211799095554625e-07,
|
|
"loss": 1.6475,
|
|
"mean_token_accuracy": 0.5924760580062867,
|
|
"num_tokens": 40135802.0,
|
|
"step": 11120
|
|
},
|
|
{
|
|
"entropy": 1.631640625,
|
|
"epoch": 2.4608070757324487,
|
|
"grad_norm": 3.6972849369049072,
|
|
"learning_rate": 4.178476746054183e-07,
|
|
"loss": 1.6125,
|
|
"mean_token_accuracy": 0.5977048069238663,
|
|
"num_tokens": 40171195.0,
|
|
"step": 11130
|
|
},
|
|
{
|
|
"entropy": 1.61640625,
|
|
"epoch": 2.4630182421227196,
|
|
"grad_norm": 3.797767162322998,
|
|
"learning_rate": 4.1452747136435046e-07,
|
|
"loss": 1.5945,
|
|
"mean_token_accuracy": 0.6000763028860092,
|
|
"num_tokens": 40207987.0,
|
|
"step": 11140
|
|
},
|
|
{
|
|
"entropy": 1.61953125,
|
|
"epoch": 2.4652294085129904,
|
|
"grad_norm": 3.648907423019409,
|
|
"learning_rate": 4.112193190180411e-07,
|
|
"loss": 1.6253,
|
|
"mean_token_accuracy": 0.5947603017091752,
|
|
"num_tokens": 40245040.0,
|
|
"step": 11150
|
|
},
|
|
{
|
|
"entropy": 1.636328125,
|
|
"epoch": 2.4674405749032613,
|
|
"grad_norm": 3.84521746635437,
|
|
"learning_rate": 4.0792323668263386e-07,
|
|
"loss": 1.6204,
|
|
"mean_token_accuracy": 0.5967138200998306,
|
|
"num_tokens": 40284404.0,
|
|
"step": 11160
|
|
},
|
|
{
|
|
"entropy": 1.64609375,
|
|
"epoch": 2.469651741293532,
|
|
"grad_norm": 4.296773910522461,
|
|
"learning_rate": 4.0463924340452823e-07,
|
|
"loss": 1.6531,
|
|
"mean_token_accuracy": 0.5871505975723267,
|
|
"num_tokens": 40323282.0,
|
|
"step": 11170
|
|
},
|
|
{
|
|
"entropy": 1.65078125,
|
|
"epoch": 2.471862907683803,
|
|
"grad_norm": 4.122213363647461,
|
|
"learning_rate": 4.0136735816026647e-07,
|
|
"loss": 1.6599,
|
|
"mean_token_accuracy": 0.5925206571817399,
|
|
"num_tokens": 40359470.0,
|
|
"step": 11180
|
|
},
|
|
{
|
|
"entropy": 1.66015625,
|
|
"epoch": 2.474074074074074,
|
|
"grad_norm": 4.381568908691406,
|
|
"learning_rate": 3.9810759985642515e-07,
|
|
"loss": 1.6343,
|
|
"mean_token_accuracy": 0.589119839668274,
|
|
"num_tokens": 40392914.0,
|
|
"step": 11190
|
|
},
|
|
{
|
|
"entropy": 1.684765625,
|
|
"epoch": 2.476285240464345,
|
|
"grad_norm": 3.09333872795105,
|
|
"learning_rate": 3.9485998732950337e-07,
|
|
"loss": 1.6642,
|
|
"mean_token_accuracy": 0.5876926869153977,
|
|
"num_tokens": 40426475.0,
|
|
"step": 11200
|
|
},
|
|
{
|
|
"entropy": 1.63828125,
|
|
"epoch": 2.4784964068546156,
|
|
"grad_norm": 4.326834678649902,
|
|
"learning_rate": 3.916245393458179e-07,
|
|
"loss": 1.6549,
|
|
"mean_token_accuracy": 0.5913239270448685,
|
|
"num_tokens": 40462700.0,
|
|
"step": 11210
|
|
},
|
|
{
|
|
"entropy": 1.6328125,
|
|
"epoch": 2.480707573244887,
|
|
"grad_norm": 3.9191200733184814,
|
|
"learning_rate": 3.8840127460139236e-07,
|
|
"loss": 1.6188,
|
|
"mean_token_accuracy": 0.6030291736125946,
|
|
"num_tokens": 40498591.0,
|
|
"step": 11220
|
|
},
|
|
{
|
|
"entropy": 1.665625,
|
|
"epoch": 2.4829187396351573,
|
|
"grad_norm": 4.370935440063477,
|
|
"learning_rate": 3.851902117218495e-07,
|
|
"loss": 1.6966,
|
|
"mean_token_accuracy": 0.5864339500665665,
|
|
"num_tokens": 40534387.0,
|
|
"step": 11230
|
|
},
|
|
{
|
|
"entropy": 1.665625,
|
|
"epoch": 2.4851299060254286,
|
|
"grad_norm": 4.236398696899414,
|
|
"learning_rate": 3.81991369262302e-07,
|
|
"loss": 1.6336,
|
|
"mean_token_accuracy": 0.5926491796970368,
|
|
"num_tokens": 40571011.0,
|
|
"step": 11240
|
|
},
|
|
{
|
|
"entropy": 1.6359375,
|
|
"epoch": 2.4873410724156995,
|
|
"grad_norm": 4.349100589752197,
|
|
"learning_rate": 3.7880476570725076e-07,
|
|
"loss": 1.6002,
|
|
"mean_token_accuracy": 0.5975788712501526,
|
|
"num_tokens": 40604692.0,
|
|
"step": 11250
|
|
},
|
|
{
|
|
"entropy": 1.64375,
|
|
"epoch": 2.4895522388059703,
|
|
"grad_norm": 3.7533280849456787,
|
|
"learning_rate": 3.756304194704699e-07,
|
|
"loss": 1.6296,
|
|
"mean_token_accuracy": 0.5908368676900864,
|
|
"num_tokens": 40640167.0,
|
|
"step": 11260
|
|
},
|
|
{
|
|
"entropy": 1.653125,
|
|
"epoch": 2.491763405196241,
|
|
"grad_norm": 3.869410514831543,
|
|
"learning_rate": 3.72468348894908e-07,
|
|
"loss": 1.6329,
|
|
"mean_token_accuracy": 0.5920696198940277,
|
|
"num_tokens": 40678048.0,
|
|
"step": 11270
|
|
},
|
|
{
|
|
"entropy": 1.6625,
|
|
"epoch": 2.493974571586512,
|
|
"grad_norm": 3.747925281524658,
|
|
"learning_rate": 3.6931857225257494e-07,
|
|
"loss": 1.6725,
|
|
"mean_token_accuracy": 0.5914702832698822,
|
|
"num_tokens": 40715519.0,
|
|
"step": 11280
|
|
},
|
|
{
|
|
"entropy": 1.6515625,
|
|
"epoch": 2.496185737976783,
|
|
"grad_norm": 4.1814985275268555,
|
|
"learning_rate": 3.661811077444458e-07,
|
|
"loss": 1.6317,
|
|
"mean_token_accuracy": 0.5937252074480057,
|
|
"num_tokens": 40753136.0,
|
|
"step": 11290
|
|
},
|
|
{
|
|
"entropy": 1.653515625,
|
|
"epoch": 2.4983969043670538,
|
|
"grad_norm": 3.890594005584717,
|
|
"learning_rate": 3.6305597350034445e-07,
|
|
"loss": 1.6382,
|
|
"mean_token_accuracy": 0.5907213807106018,
|
|
"num_tokens": 40787825.0,
|
|
"step": 11300
|
|
},
|
|
{
|
|
"entropy": 1.66875,
|
|
"epoch": 2.5006080707573246,
|
|
"grad_norm": 3.665424346923828,
|
|
"learning_rate": 3.599431875788484e-07,
|
|
"loss": 1.6983,
|
|
"mean_token_accuracy": 0.582234850525856,
|
|
"num_tokens": 40821610.0,
|
|
"step": 11310
|
|
},
|
|
{
|
|
"entropy": 1.623046875,
|
|
"epoch": 2.5028192371475955,
|
|
"grad_norm": 4.094082832336426,
|
|
"learning_rate": 3.568427679671765e-07,
|
|
"loss": 1.6147,
|
|
"mean_token_accuracy": 0.5944758832454682,
|
|
"num_tokens": 40856556.0,
|
|
"step": 11320
|
|
},
|
|
{
|
|
"entropy": 1.644921875,
|
|
"epoch": 2.5050304035378663,
|
|
"grad_norm": 3.930649757385254,
|
|
"learning_rate": 3.5375473258109416e-07,
|
|
"loss": 1.6401,
|
|
"mean_token_accuracy": 0.5941253125667572,
|
|
"num_tokens": 40892125.0,
|
|
"step": 11330
|
|
},
|
|
{
|
|
"entropy": 1.6296875,
|
|
"epoch": 2.507241569928137,
|
|
"grad_norm": 3.513338327407837,
|
|
"learning_rate": 3.506790992647993e-07,
|
|
"loss": 1.6412,
|
|
"mean_token_accuracy": 0.5925517469644547,
|
|
"num_tokens": 40928504.0,
|
|
"step": 11340
|
|
},
|
|
{
|
|
"entropy": 1.629296875,
|
|
"epoch": 2.509452736318408,
|
|
"grad_norm": 2.7860162258148193,
|
|
"learning_rate": 3.4761588579082796e-07,
|
|
"loss": 1.6071,
|
|
"mean_token_accuracy": 0.5959939241409302,
|
|
"num_tokens": 40962009.0,
|
|
"step": 11350
|
|
},
|
|
{
|
|
"entropy": 1.608984375,
|
|
"epoch": 2.511663902708679,
|
|
"grad_norm": 4.404608249664307,
|
|
"learning_rate": 3.445651098599467e-07,
|
|
"loss": 1.6182,
|
|
"mean_token_accuracy": 0.5953892201185227,
|
|
"num_tokens": 40995856.0,
|
|
"step": 11360
|
|
},
|
|
{
|
|
"entropy": 1.643359375,
|
|
"epoch": 2.5138750690989498,
|
|
"grad_norm": 4.417123317718506,
|
|
"learning_rate": 3.415267891010529e-07,
|
|
"loss": 1.6105,
|
|
"mean_token_accuracy": 0.6029132634401322,
|
|
"num_tokens": 41031103.0,
|
|
"step": 11370
|
|
},
|
|
{
|
|
"entropy": 1.628515625,
|
|
"epoch": 2.5160862354892206,
|
|
"grad_norm": 3.855990171432495,
|
|
"learning_rate": 3.385009410710699e-07,
|
|
"loss": 1.6024,
|
|
"mean_token_accuracy": 0.5980090707540512,
|
|
"num_tokens": 41066473.0,
|
|
"step": 11380
|
|
},
|
|
{
|
|
"entropy": 1.655859375,
|
|
"epoch": 2.5182974018794915,
|
|
"grad_norm": 4.439486026763916,
|
|
"learning_rate": 3.354875832548493e-07,
|
|
"loss": 1.6794,
|
|
"mean_token_accuracy": 0.584595263004303,
|
|
"num_tokens": 41101878.0,
|
|
"step": 11390
|
|
},
|
|
{
|
|
"entropy": 1.60546875,
|
|
"epoch": 2.5205085682697623,
|
|
"grad_norm": 4.2726311683654785,
|
|
"learning_rate": 3.3248673306506774e-07,
|
|
"loss": 1.6035,
|
|
"mean_token_accuracy": 0.5966331869363785,
|
|
"num_tokens": 41138969.0,
|
|
"step": 11400
|
|
},
|
|
{
|
|
"entropy": 1.625390625,
|
|
"epoch": 2.522719734660033,
|
|
"grad_norm": 3.883124351501465,
|
|
"learning_rate": 3.2949840784212484e-07,
|
|
"loss": 1.6244,
|
|
"mean_token_accuracy": 0.598982748389244,
|
|
"num_tokens": 41174283.0,
|
|
"step": 11410
|
|
},
|
|
{
|
|
"entropy": 1.673046875,
|
|
"epoch": 2.524930901050304,
|
|
"grad_norm": 4.158418655395508,
|
|
"learning_rate": 3.265226248540468e-07,
|
|
"loss": 1.6679,
|
|
"mean_token_accuracy": 0.58449387550354,
|
|
"num_tokens": 41212002.0,
|
|
"step": 11420
|
|
},
|
|
{
|
|
"entropy": 1.659375,
|
|
"epoch": 2.527142067440575,
|
|
"grad_norm": 3.858161211013794,
|
|
"learning_rate": 3.2355940129638415e-07,
|
|
"loss": 1.643,
|
|
"mean_token_accuracy": 0.5941768139600754,
|
|
"num_tokens": 41252448.0,
|
|
"step": 11430
|
|
},
|
|
{
|
|
"entropy": 1.6140625,
|
|
"epoch": 2.5293532338308458,
|
|
"grad_norm": 4.309246063232422,
|
|
"learning_rate": 3.206087542921127e-07,
|
|
"loss": 1.5998,
|
|
"mean_token_accuracy": 0.5998376339673996,
|
|
"num_tokens": 41290559.0,
|
|
"step": 11440
|
|
},
|
|
{
|
|
"entropy": 1.633984375,
|
|
"epoch": 2.5315644002211166,
|
|
"grad_norm": 4.083694934844971,
|
|
"learning_rate": 3.1767070089153337e-07,
|
|
"loss": 1.5971,
|
|
"mean_token_accuracy": 0.5980282872915268,
|
|
"num_tokens": 41325509.0,
|
|
"step": 11450
|
|
},
|
|
{
|
|
"entropy": 1.694921875,
|
|
"epoch": 2.5337755666113875,
|
|
"grad_norm": 4.562839984893799,
|
|
"learning_rate": 3.147452580721766e-07,
|
|
"loss": 1.6945,
|
|
"mean_token_accuracy": 0.5868044406175613,
|
|
"num_tokens": 41365340.0,
|
|
"step": 11460
|
|
},
|
|
{
|
|
"entropy": 1.63671875,
|
|
"epoch": 2.5359867330016583,
|
|
"grad_norm": 3.7756259441375732,
|
|
"learning_rate": 3.118324427387026e-07,
|
|
"loss": 1.6357,
|
|
"mean_token_accuracy": 0.590502867102623,
|
|
"num_tokens": 41401290.0,
|
|
"step": 11470
|
|
},
|
|
{
|
|
"entropy": 1.665625,
|
|
"epoch": 2.538197899391929,
|
|
"grad_norm": 5.907230377197266,
|
|
"learning_rate": 3.0893227172280353e-07,
|
|
"loss": 1.686,
|
|
"mean_token_accuracy": 0.5850258499383927,
|
|
"num_tokens": 41437932.0,
|
|
"step": 11480
|
|
},
|
|
{
|
|
"entropy": 1.67421875,
|
|
"epoch": 2.5404090657822,
|
|
"grad_norm": 3.787842035293579,
|
|
"learning_rate": 3.06044761783105e-07,
|
|
"loss": 1.6637,
|
|
"mean_token_accuracy": 0.5862620085477829,
|
|
"num_tokens": 41474170.0,
|
|
"step": 11490
|
|
},
|
|
{
|
|
"entropy": 1.63984375,
|
|
"epoch": 2.542620232172471,
|
|
"grad_norm": 3.9197394847869873,
|
|
"learning_rate": 3.031699296050722e-07,
|
|
"loss": 1.6318,
|
|
"mean_token_accuracy": 0.5988325715065003,
|
|
"num_tokens": 41506136.0,
|
|
"step": 11500
|
|
},
|
|
{
|
|
"epoch": 2.542620232172471,
|
|
"eval_entropy": 1.691876554726368,
|
|
"eval_loss": 1.7791978120803833,
|
|
"eval_mean_token_accuracy": 0.5673433519121426,
|
|
"eval_num_tokens": 41506136.0,
|
|
"eval_runtime": 112.058,
|
|
"eval_samples_per_second": 143.497,
|
|
"eval_steps_per_second": 8.969,
|
|
"step": 11500
|
|
},
|
|
{
|
|
"entropy": 1.64453125,
|
|
"epoch": 2.5448313985627418,
|
|
"grad_norm": 3.325420618057251,
|
|
"learning_rate": 3.0030779180091174e-07,
|
|
"loss": 1.6229,
|
|
"mean_token_accuracy": 0.5960267364978791,
|
|
"num_tokens": 41544572.0,
|
|
"step": 11510
|
|
},
|
|
{
|
|
"entropy": 1.6515625,
|
|
"epoch": 2.5470425649530126,
|
|
"grad_norm": 3.9773294925689697,
|
|
"learning_rate": 2.9745836490947586e-07,
|
|
"loss": 1.644,
|
|
"mean_token_accuracy": 0.5893475592136384,
|
|
"num_tokens": 41579364.0,
|
|
"step": 11520
|
|
},
|
|
{
|
|
"entropy": 1.676953125,
|
|
"epoch": 2.5492537313432835,
|
|
"grad_norm": 3.745245933532715,
|
|
"learning_rate": 2.9462166539616586e-07,
|
|
"loss": 1.6854,
|
|
"mean_token_accuracy": 0.5900467276573181,
|
|
"num_tokens": 41616295.0,
|
|
"step": 11530
|
|
},
|
|
{
|
|
"entropy": 1.66875,
|
|
"epoch": 2.5514648977335543,
|
|
"grad_norm": 3.358013153076172,
|
|
"learning_rate": 2.9179770965283906e-07,
|
|
"loss": 1.6337,
|
|
"mean_token_accuracy": 0.5917086154222488,
|
|
"num_tokens": 41652832.0,
|
|
"step": 11540
|
|
},
|
|
{
|
|
"entropy": 1.674609375,
|
|
"epoch": 2.553676064123825,
|
|
"grad_norm": 4.3461079597473145,
|
|
"learning_rate": 2.889865139977127e-07,
|
|
"loss": 1.6558,
|
|
"mean_token_accuracy": 0.5890581399202347,
|
|
"num_tokens": 41690388.0,
|
|
"step": 11550
|
|
},
|
|
{
|
|
"entropy": 1.6375,
|
|
"epoch": 2.555887230514096,
|
|
"grad_norm": 4.097951412200928,
|
|
"learning_rate": 2.861880946752699e-07,
|
|
"loss": 1.6259,
|
|
"mean_token_accuracy": 0.5965524911880493,
|
|
"num_tokens": 41727542.0,
|
|
"step": 11560
|
|
},
|
|
{
|
|
"entropy": 1.66796875,
|
|
"epoch": 2.558098396904367,
|
|
"grad_norm": 2.864159345626831,
|
|
"learning_rate": 2.834024678561642e-07,
|
|
"loss": 1.6937,
|
|
"mean_token_accuracy": 0.5841955184936524,
|
|
"num_tokens": 41765056.0,
|
|
"step": 11570
|
|
},
|
|
{
|
|
"entropy": 1.6625,
|
|
"epoch": 2.5603095632946378,
|
|
"grad_norm": 4.250892639160156,
|
|
"learning_rate": 2.8062964963713134e-07,
|
|
"loss": 1.6582,
|
|
"mean_token_accuracy": 0.5865849316120147,
|
|
"num_tokens": 41800725.0,
|
|
"step": 11580
|
|
},
|
|
{
|
|
"entropy": 1.65625,
|
|
"epoch": 2.5625207296849086,
|
|
"grad_norm": 3.8060455322265625,
|
|
"learning_rate": 2.778696560408889e-07,
|
|
"loss": 1.6512,
|
|
"mean_token_accuracy": 0.5866000831127167,
|
|
"num_tokens": 41835591.0,
|
|
"step": 11590
|
|
},
|
|
{
|
|
"entropy": 1.6609375,
|
|
"epoch": 2.5647318960751795,
|
|
"grad_norm": 3.922635555267334,
|
|
"learning_rate": 2.751225030160501e-07,
|
|
"loss": 1.6551,
|
|
"mean_token_accuracy": 0.5843694716691971,
|
|
"num_tokens": 41870454.0,
|
|
"step": 11600
|
|
},
|
|
{
|
|
"entropy": 1.61640625,
|
|
"epoch": 2.566943062465451,
|
|
"grad_norm": 4.644700050354004,
|
|
"learning_rate": 2.723882064370259e-07,
|
|
"loss": 1.5866,
|
|
"mean_token_accuracy": 0.5961883842945099,
|
|
"num_tokens": 41907396.0,
|
|
"step": 11610
|
|
},
|
|
{
|
|
"entropy": 1.60078125,
|
|
"epoch": 2.569154228855721,
|
|
"grad_norm": 4.0675554275512695,
|
|
"learning_rate": 2.696667821039406e-07,
|
|
"loss": 1.5822,
|
|
"mean_token_accuracy": 0.6026701629161835,
|
|
"num_tokens": 41942744.0,
|
|
"step": 11620
|
|
},
|
|
{
|
|
"entropy": 1.646875,
|
|
"epoch": 2.5713653952459925,
|
|
"grad_norm": 4.183914661407471,
|
|
"learning_rate": 2.6695824574253236e-07,
|
|
"loss": 1.6639,
|
|
"mean_token_accuracy": 0.5853926092386246,
|
|
"num_tokens": 41979041.0,
|
|
"step": 11630
|
|
},
|
|
{
|
|
"entropy": 1.708984375,
|
|
"epoch": 2.573576561636263,
|
|
"grad_norm": 3.463205337524414,
|
|
"learning_rate": 2.6426261300406874e-07,
|
|
"loss": 1.7118,
|
|
"mean_token_accuracy": 0.578419703245163,
|
|
"num_tokens": 42014573.0,
|
|
"step": 11640
|
|
},
|
|
{
|
|
"entropy": 1.657421875,
|
|
"epoch": 2.575787728026534,
|
|
"grad_norm": 4.563073635101318,
|
|
"learning_rate": 2.6157989946525216e-07,
|
|
"loss": 1.647,
|
|
"mean_token_accuracy": 0.588895371556282,
|
|
"num_tokens": 42051088.0,
|
|
"step": 11650
|
|
},
|
|
{
|
|
"entropy": 1.675390625,
|
|
"epoch": 2.5779988944168046,
|
|
"grad_norm": 4.019829750061035,
|
|
"learning_rate": 2.589101206281322e-07,
|
|
"loss": 1.6799,
|
|
"mean_token_accuracy": 0.5837547391653061,
|
|
"num_tokens": 42087009.0,
|
|
"step": 11660
|
|
},
|
|
{
|
|
"entropy": 1.66875,
|
|
"epoch": 2.580210060807076,
|
|
"grad_norm": 3.8760251998901367,
|
|
"learning_rate": 2.5625329192001586e-07,
|
|
"loss": 1.647,
|
|
"mean_token_accuracy": 0.5894177109003067,
|
|
"num_tokens": 42122802.0,
|
|
"step": 11670
|
|
},
|
|
{
|
|
"entropy": 1.66796875,
|
|
"epoch": 2.5824212271973463,
|
|
"grad_norm": 4.452449321746826,
|
|
"learning_rate": 2.536094286933768e-07,
|
|
"loss": 1.6701,
|
|
"mean_token_accuracy": 0.5883320778608322,
|
|
"num_tokens": 42156125.0,
|
|
"step": 11680
|
|
},
|
|
{
|
|
"entropy": 1.65,
|
|
"epoch": 2.5846323935876176,
|
|
"grad_norm": 3.0527849197387695,
|
|
"learning_rate": 2.509785462257691e-07,
|
|
"loss": 1.6198,
|
|
"mean_token_accuracy": 0.5950593531131745,
|
|
"num_tokens": 42193897.0,
|
|
"step": 11690
|
|
},
|
|
{
|
|
"entropy": 1.64609375,
|
|
"epoch": 2.586843559977888,
|
|
"grad_norm": 3.8048477172851562,
|
|
"learning_rate": 2.483606597197358e-07,
|
|
"loss": 1.644,
|
|
"mean_token_accuracy": 0.5912558943033218,
|
|
"num_tokens": 42228972.0,
|
|
"step": 11700
|
|
},
|
|
{
|
|
"entropy": 1.648046875,
|
|
"epoch": 2.5890547263681594,
|
|
"grad_norm": 4.222141742706299,
|
|
"learning_rate": 2.457557843027242e-07,
|
|
"loss": 1.6473,
|
|
"mean_token_accuracy": 0.5910660088062286,
|
|
"num_tokens": 42261947.0,
|
|
"step": 11710
|
|
},
|
|
{
|
|
"entropy": 1.64765625,
|
|
"epoch": 2.5912658927584302,
|
|
"grad_norm": 4.439295291900635,
|
|
"learning_rate": 2.431639350269954e-07,
|
|
"loss": 1.6806,
|
|
"mean_token_accuracy": 0.5886007934808731,
|
|
"num_tokens": 42298856.0,
|
|
"step": 11720
|
|
},
|
|
{
|
|
"entropy": 1.666796875,
|
|
"epoch": 2.593477059148701,
|
|
"grad_norm": 3.1303133964538574,
|
|
"learning_rate": 2.405851268695422e-07,
|
|
"loss": 1.682,
|
|
"mean_token_accuracy": 0.5838881015777588,
|
|
"num_tokens": 42334964.0,
|
|
"step": 11730
|
|
},
|
|
{
|
|
"entropy": 1.668359375,
|
|
"epoch": 2.595688225538972,
|
|
"grad_norm": 4.561310291290283,
|
|
"learning_rate": 2.3801937473199588e-07,
|
|
"loss": 1.6679,
|
|
"mean_token_accuracy": 0.5893527656793595,
|
|
"num_tokens": 42370850.0,
|
|
"step": 11740
|
|
},
|
|
{
|
|
"entropy": 1.6890625,
|
|
"epoch": 2.597899391929243,
|
|
"grad_norm": 3.672267198562622,
|
|
"learning_rate": 2.3546669344054586e-07,
|
|
"loss": 1.6722,
|
|
"mean_token_accuracy": 0.5861592411994934,
|
|
"num_tokens": 42406420.0,
|
|
"step": 11750
|
|
},
|
|
{
|
|
"entropy": 1.6421875,
|
|
"epoch": 2.6001105583195137,
|
|
"grad_norm": 5.630838394165039,
|
|
"learning_rate": 2.3292709774584947e-07,
|
|
"loss": 1.627,
|
|
"mean_token_accuracy": 0.5915925651788712,
|
|
"num_tokens": 42444718.0,
|
|
"step": 11760
|
|
},
|
|
{
|
|
"entropy": 1.629296875,
|
|
"epoch": 2.6023217247097845,
|
|
"grad_norm": 3.5556516647338867,
|
|
"learning_rate": 2.3040060232295242e-07,
|
|
"loss": 1.6158,
|
|
"mean_token_accuracy": 0.6013228923082352,
|
|
"num_tokens": 42483503.0,
|
|
"step": 11770
|
|
},
|
|
{
|
|
"entropy": 1.651171875,
|
|
"epoch": 2.6045328911000554,
|
|
"grad_norm": 4.276744365692139,
|
|
"learning_rate": 2.2788722177119694e-07,
|
|
"loss": 1.6212,
|
|
"mean_token_accuracy": 0.5915576994419098,
|
|
"num_tokens": 42517377.0,
|
|
"step": 11780
|
|
},
|
|
{
|
|
"entropy": 1.6328125,
|
|
"epoch": 2.6067440574903262,
|
|
"grad_norm": 3.7926578521728516,
|
|
"learning_rate": 2.2538697061414373e-07,
|
|
"loss": 1.6311,
|
|
"mean_token_accuracy": 0.5958375990390777,
|
|
"num_tokens": 42553745.0,
|
|
"step": 11790
|
|
},
|
|
{
|
|
"entropy": 1.632421875,
|
|
"epoch": 2.608955223880597,
|
|
"grad_norm": 4.424424171447754,
|
|
"learning_rate": 2.228998632994825e-07,
|
|
"loss": 1.6299,
|
|
"mean_token_accuracy": 0.5930960088968277,
|
|
"num_tokens": 42588314.0,
|
|
"step": 11800
|
|
},
|
|
{
|
|
"entropy": 1.64453125,
|
|
"epoch": 2.611166390270868,
|
|
"grad_norm": 4.069036960601807,
|
|
"learning_rate": 2.204259141989551e-07,
|
|
"loss": 1.6493,
|
|
"mean_token_accuracy": 0.5903482645750046,
|
|
"num_tokens": 42625986.0,
|
|
"step": 11810
|
|
},
|
|
{
|
|
"entropy": 1.642578125,
|
|
"epoch": 2.613377556661139,
|
|
"grad_norm": 3.855574131011963,
|
|
"learning_rate": 2.1796513760826532e-07,
|
|
"loss": 1.6475,
|
|
"mean_token_accuracy": 0.590580627322197,
|
|
"num_tokens": 42660107.0,
|
|
"step": 11820
|
|
},
|
|
{
|
|
"entropy": 1.662109375,
|
|
"epoch": 2.6155887230514097,
|
|
"grad_norm": 3.7044780254364014,
|
|
"learning_rate": 2.1551754774700146e-07,
|
|
"loss": 1.6544,
|
|
"mean_token_accuracy": 0.5887376934289932,
|
|
"num_tokens": 42695786.0,
|
|
"step": 11830
|
|
},
|
|
{
|
|
"entropy": 1.650390625,
|
|
"epoch": 2.6177998894416805,
|
|
"grad_norm": 4.269886493682861,
|
|
"learning_rate": 2.1308315875855135e-07,
|
|
"loss": 1.6041,
|
|
"mean_token_accuracy": 0.5957382410764694,
|
|
"num_tokens": 42731422.0,
|
|
"step": 11840
|
|
},
|
|
{
|
|
"entropy": 1.678125,
|
|
"epoch": 2.6200110558319514,
|
|
"grad_norm": 4.39829683303833,
|
|
"learning_rate": 2.106619847100233e-07,
|
|
"loss": 1.6529,
|
|
"mean_token_accuracy": 0.5941168695688248,
|
|
"num_tokens": 42766298.0,
|
|
"step": 11850
|
|
},
|
|
{
|
|
"entropy": 1.664453125,
|
|
"epoch": 2.6222222222222222,
|
|
"grad_norm": 3.6997694969177246,
|
|
"learning_rate": 2.0825403959216062e-07,
|
|
"loss": 1.6806,
|
|
"mean_token_accuracy": 0.5814034909009933,
|
|
"num_tokens": 42802729.0,
|
|
"step": 11860
|
|
},
|
|
{
|
|
"entropy": 1.654296875,
|
|
"epoch": 2.624433388612493,
|
|
"grad_norm": 3.664547920227051,
|
|
"learning_rate": 2.0585933731926495e-07,
|
|
"loss": 1.6179,
|
|
"mean_token_accuracy": 0.590117484331131,
|
|
"num_tokens": 42837464.0,
|
|
"step": 11870
|
|
},
|
|
{
|
|
"entropy": 1.63984375,
|
|
"epoch": 2.626644555002764,
|
|
"grad_norm": 4.441150188446045,
|
|
"learning_rate": 2.034778917291144e-07,
|
|
"loss": 1.6284,
|
|
"mean_token_accuracy": 0.5936590760946274,
|
|
"num_tokens": 42872291.0,
|
|
"step": 11880
|
|
},
|
|
{
|
|
"entropy": 1.694921875,
|
|
"epoch": 2.628855721393035,
|
|
"grad_norm": 4.441260814666748,
|
|
"learning_rate": 2.0110971658288292e-07,
|
|
"loss": 1.6821,
|
|
"mean_token_accuracy": 0.5870131105184555,
|
|
"num_tokens": 42910306.0,
|
|
"step": 11890
|
|
},
|
|
{
|
|
"entropy": 1.66953125,
|
|
"epoch": 2.6310668877833057,
|
|
"grad_norm": 4.090194225311279,
|
|
"learning_rate": 1.9875482556506064e-07,
|
|
"loss": 1.6702,
|
|
"mean_token_accuracy": 0.5843910723924637,
|
|
"num_tokens": 42946247.0,
|
|
"step": 11900
|
|
},
|
|
{
|
|
"entropy": 1.65234375,
|
|
"epoch": 2.6332780541735765,
|
|
"grad_norm": 3.7483279705047607,
|
|
"learning_rate": 1.9641323228337616e-07,
|
|
"loss": 1.6721,
|
|
"mean_token_accuracy": 0.5857365489006042,
|
|
"num_tokens": 42982125.0,
|
|
"step": 11910
|
|
},
|
|
{
|
|
"entropy": 1.6703125,
|
|
"epoch": 2.6354892205638474,
|
|
"grad_norm": 4.430009365081787,
|
|
"learning_rate": 1.9408495026871727e-07,
|
|
"loss": 1.6595,
|
|
"mean_token_accuracy": 0.5897878587245942,
|
|
"num_tokens": 43017680.0,
|
|
"step": 11920
|
|
},
|
|
{
|
|
"entropy": 1.668359375,
|
|
"epoch": 2.6377003869541182,
|
|
"grad_norm": 3.686194658279419,
|
|
"learning_rate": 1.9176999297505245e-07,
|
|
"loss": 1.6539,
|
|
"mean_token_accuracy": 0.5866464406251908,
|
|
"num_tokens": 43052287.0,
|
|
"step": 11930
|
|
},
|
|
{
|
|
"entropy": 1.709375,
|
|
"epoch": 2.639911553344389,
|
|
"grad_norm": 4.046802997589111,
|
|
"learning_rate": 1.8946837377935289e-07,
|
|
"loss": 1.7105,
|
|
"mean_token_accuracy": 0.5801169723272324,
|
|
"num_tokens": 43089289.0,
|
|
"step": 11940
|
|
},
|
|
{
|
|
"entropy": 1.684765625,
|
|
"epoch": 2.64212271973466,
|
|
"grad_norm": 4.522784233093262,
|
|
"learning_rate": 1.8718010598151591e-07,
|
|
"loss": 1.6857,
|
|
"mean_token_accuracy": 0.5842505127191544,
|
|
"num_tokens": 43125263.0,
|
|
"step": 11950
|
|
},
|
|
{
|
|
"entropy": 1.66015625,
|
|
"epoch": 2.644333886124931,
|
|
"grad_norm": 4.03385591506958,
|
|
"learning_rate": 1.8490520280428885e-07,
|
|
"loss": 1.6443,
|
|
"mean_token_accuracy": 0.587689071893692,
|
|
"num_tokens": 43163929.0,
|
|
"step": 11960
|
|
},
|
|
{
|
|
"entropy": 1.65,
|
|
"epoch": 2.6465450525152017,
|
|
"grad_norm": 3.3798513412475586,
|
|
"learning_rate": 1.8264367739318944e-07,
|
|
"loss": 1.6324,
|
|
"mean_token_accuracy": 0.5898526251316071,
|
|
"num_tokens": 43199581.0,
|
|
"step": 11970
|
|
},
|
|
{
|
|
"entropy": 1.658203125,
|
|
"epoch": 2.6487562189054725,
|
|
"grad_norm": 5.216836452484131,
|
|
"learning_rate": 1.8039554281643418e-07,
|
|
"loss": 1.6678,
|
|
"mean_token_accuracy": 0.5914018273353576,
|
|
"num_tokens": 43234985.0,
|
|
"step": 11980
|
|
},
|
|
{
|
|
"entropy": 1.626953125,
|
|
"epoch": 2.6509673852957434,
|
|
"grad_norm": 3.9133737087249756,
|
|
"learning_rate": 1.7816081206485952e-07,
|
|
"loss": 1.6176,
|
|
"mean_token_accuracy": 0.5932684808969497,
|
|
"num_tokens": 43270661.0,
|
|
"step": 11990
|
|
},
|
|
{
|
|
"entropy": 1.659765625,
|
|
"epoch": 2.6531785516860142,
|
|
"grad_norm": 4.12150239944458,
|
|
"learning_rate": 1.759394980518486e-07,
|
|
"loss": 1.6545,
|
|
"mean_token_accuracy": 0.5922661572694778,
|
|
"num_tokens": 43305600.0,
|
|
"step": 12000
|
|
},
|
|
{
|
|
"epoch": 2.6531785516860142,
|
|
"eval_entropy": 1.6869869402985074,
|
|
"eval_loss": 1.7773772478103638,
|
|
"eval_mean_token_accuracy": 0.5677351055453665,
|
|
"eval_num_tokens": 43305600.0,
|
|
"eval_runtime": 112.1299,
|
|
"eval_samples_per_second": 143.405,
|
|
"eval_steps_per_second": 8.963,
|
|
"step": 12000
|
|
},
|
|
{
|
|
"entropy": 1.6625,
|
|
"epoch": 2.655389718076285,
|
|
"grad_norm": 4.613038063049316,
|
|
"learning_rate": 1.7373161361325525e-07,
|
|
"loss": 1.6587,
|
|
"mean_token_accuracy": 0.591291531920433,
|
|
"num_tokens": 43341378.0,
|
|
"step": 12010
|
|
},
|
|
{
|
|
"entropy": 1.6203125,
|
|
"epoch": 2.657600884466556,
|
|
"grad_norm": 3.7450149059295654,
|
|
"learning_rate": 1.715371715073308e-07,
|
|
"loss": 1.5999,
|
|
"mean_token_accuracy": 0.5970103353261947,
|
|
"num_tokens": 43375188.0,
|
|
"step": 12020
|
|
},
|
|
{
|
|
"entropy": 1.6546875,
|
|
"epoch": 2.659812050856827,
|
|
"grad_norm": 3.7469353675842285,
|
|
"learning_rate": 1.6935618441465074e-07,
|
|
"loss": 1.6575,
|
|
"mean_token_accuracy": 0.593611353635788,
|
|
"num_tokens": 43408612.0,
|
|
"step": 12030
|
|
},
|
|
{
|
|
"entropy": 1.6625,
|
|
"epoch": 2.662023217247098,
|
|
"grad_norm": 4.0776753425598145,
|
|
"learning_rate": 1.6718866493804052e-07,
|
|
"loss": 1.6665,
|
|
"mean_token_accuracy": 0.5865698784589768,
|
|
"num_tokens": 43443952.0,
|
|
"step": 12040
|
|
},
|
|
{
|
|
"entropy": 1.625,
|
|
"epoch": 2.6642343836373685,
|
|
"grad_norm": 4.496905326843262,
|
|
"learning_rate": 1.6503462560250206e-07,
|
|
"loss": 1.6184,
|
|
"mean_token_accuracy": 0.5963836073875427,
|
|
"num_tokens": 43478977.0,
|
|
"step": 12050
|
|
},
|
|
{
|
|
"entropy": 1.63828125,
|
|
"epoch": 2.66644555002764,
|
|
"grad_norm": 4.359302043914795,
|
|
"learning_rate": 1.6289407885514418e-07,
|
|
"loss": 1.5993,
|
|
"mean_token_accuracy": 0.6028230935335159,
|
|
"num_tokens": 43515079.0,
|
|
"step": 12060
|
|
},
|
|
{
|
|
"entropy": 1.666015625,
|
|
"epoch": 2.6686567164179102,
|
|
"grad_norm": 3.340536117553711,
|
|
"learning_rate": 1.6076703706510682e-07,
|
|
"loss": 1.6514,
|
|
"mean_token_accuracy": 0.5904446899890899,
|
|
"num_tokens": 43552693.0,
|
|
"step": 12070
|
|
},
|
|
{
|
|
"entropy": 1.65859375,
|
|
"epoch": 2.6708678828081815,
|
|
"grad_norm": 4.266609191894531,
|
|
"learning_rate": 1.5865351252349364e-07,
|
|
"loss": 1.6363,
|
|
"mean_token_accuracy": 0.5866362571716308,
|
|
"num_tokens": 43589095.0,
|
|
"step": 12080
|
|
},
|
|
{
|
|
"entropy": 1.679296875,
|
|
"epoch": 2.673079049198452,
|
|
"grad_norm": 4.269710540771484,
|
|
"learning_rate": 1.565535174432961e-07,
|
|
"loss": 1.6524,
|
|
"mean_token_accuracy": 0.5864337176084519,
|
|
"num_tokens": 43626696.0,
|
|
"step": 12090
|
|
},
|
|
{
|
|
"entropy": 1.655078125,
|
|
"epoch": 2.6752902155887233,
|
|
"grad_norm": 4.128224849700928,
|
|
"learning_rate": 1.544670639593293e-07,
|
|
"loss": 1.636,
|
|
"mean_token_accuracy": 0.5914372265338897,
|
|
"num_tokens": 43662894.0,
|
|
"step": 12100
|
|
},
|
|
{
|
|
"entropy": 1.66484375,
|
|
"epoch": 2.6775013819789937,
|
|
"grad_norm": 4.019471168518066,
|
|
"learning_rate": 1.5239416412815566e-07,
|
|
"loss": 1.6574,
|
|
"mean_token_accuracy": 0.5923333764076233,
|
|
"num_tokens": 43698340.0,
|
|
"step": 12110
|
|
},
|
|
{
|
|
"entropy": 1.670703125,
|
|
"epoch": 2.679712548369265,
|
|
"grad_norm": 5.685184955596924,
|
|
"learning_rate": 1.5033482992801884e-07,
|
|
"loss": 1.6642,
|
|
"mean_token_accuracy": 0.5900224953889847,
|
|
"num_tokens": 43735369.0,
|
|
"step": 12120
|
|
},
|
|
{
|
|
"entropy": 1.63984375,
|
|
"epoch": 2.6819237147595354,
|
|
"grad_norm": 4.553216934204102,
|
|
"learning_rate": 1.4828907325877244e-07,
|
|
"loss": 1.633,
|
|
"mean_token_accuracy": 0.5952091723680496,
|
|
"num_tokens": 43771193.0,
|
|
"step": 12130
|
|
},
|
|
{
|
|
"entropy": 1.63203125,
|
|
"epoch": 2.6841348811498067,
|
|
"grad_norm": 3.737790822982788,
|
|
"learning_rate": 1.462569059418148e-07,
|
|
"loss": 1.6201,
|
|
"mean_token_accuracy": 0.5992921561002731,
|
|
"num_tokens": 43807087.0,
|
|
"step": 12140
|
|
},
|
|
{
|
|
"entropy": 1.67109375,
|
|
"epoch": 2.6863460475400776,
|
|
"grad_norm": 2.9110357761383057,
|
|
"learning_rate": 1.442383397200156e-07,
|
|
"loss": 1.6859,
|
|
"mean_token_accuracy": 0.5837462931871414,
|
|
"num_tokens": 43843853.0,
|
|
"step": 12150
|
|
},
|
|
{
|
|
"entropy": 1.684765625,
|
|
"epoch": 2.6885572139303484,
|
|
"grad_norm": 3.5840563774108887,
|
|
"learning_rate": 1.422333862576522e-07,
|
|
"loss": 1.6783,
|
|
"mean_token_accuracy": 0.5830057024955749,
|
|
"num_tokens": 43881075.0,
|
|
"step": 12160
|
|
},
|
|
{
|
|
"entropy": 1.650390625,
|
|
"epoch": 2.6907683803206193,
|
|
"grad_norm": 4.5620198249816895,
|
|
"learning_rate": 1.402420571403401e-07,
|
|
"loss": 1.6555,
|
|
"mean_token_accuracy": 0.5861944913864136,
|
|
"num_tokens": 43916121.0,
|
|
"step": 12170
|
|
},
|
|
{
|
|
"entropy": 1.6703125,
|
|
"epoch": 2.69297954671089,
|
|
"grad_norm": 3.6704137325286865,
|
|
"learning_rate": 1.3826436387496756e-07,
|
|
"loss": 1.6682,
|
|
"mean_token_accuracy": 0.5847749203443527,
|
|
"num_tokens": 43954708.0,
|
|
"step": 12180
|
|
},
|
|
{
|
|
"entropy": 1.666796875,
|
|
"epoch": 2.695190713101161,
|
|
"grad_norm": 3.5926811695098877,
|
|
"learning_rate": 1.3630031788962577e-07,
|
|
"loss": 1.6345,
|
|
"mean_token_accuracy": 0.5951758682727813,
|
|
"num_tokens": 43992279.0,
|
|
"step": 12190
|
|
},
|
|
{
|
|
"entropy": 1.661328125,
|
|
"epoch": 2.697401879491432,
|
|
"grad_norm": 4.718471527099609,
|
|
"learning_rate": 1.3434993053354771e-07,
|
|
"loss": 1.6428,
|
|
"mean_token_accuracy": 0.5958007544279098,
|
|
"num_tokens": 44027255.0,
|
|
"step": 12200
|
|
},
|
|
{
|
|
"entropy": 1.654296875,
|
|
"epoch": 2.6996130458817027,
|
|
"grad_norm": 4.397036075592041,
|
|
"learning_rate": 1.324132130770389e-07,
|
|
"loss": 1.63,
|
|
"mean_token_accuracy": 0.5884867519140243,
|
|
"num_tokens": 44061642.0,
|
|
"step": 12210
|
|
},
|
|
{
|
|
"entropy": 1.6828125,
|
|
"epoch": 2.7018242122719736,
|
|
"grad_norm": 3.8298187255859375,
|
|
"learning_rate": 1.3049017671141334e-07,
|
|
"loss": 1.6749,
|
|
"mean_token_accuracy": 0.5822920799255371,
|
|
"num_tokens": 44097064.0,
|
|
"step": 12220
|
|
},
|
|
{
|
|
"entropy": 1.6375,
|
|
"epoch": 2.7040353786622444,
|
|
"grad_norm": 3.9657070636749268,
|
|
"learning_rate": 1.2858083254892879e-07,
|
|
"loss": 1.619,
|
|
"mean_token_accuracy": 0.5879209458827972,
|
|
"num_tokens": 44135222.0,
|
|
"step": 12230
|
|
},
|
|
{
|
|
"entropy": 1.673046875,
|
|
"epoch": 2.7062465450525153,
|
|
"grad_norm": 4.10100793838501,
|
|
"learning_rate": 1.2668519162272325e-07,
|
|
"loss": 1.6572,
|
|
"mean_token_accuracy": 0.5863908469676972,
|
|
"num_tokens": 44169998.0,
|
|
"step": 12240
|
|
},
|
|
{
|
|
"entropy": 1.658984375,
|
|
"epoch": 2.708457711442786,
|
|
"grad_norm": 4.201930046081543,
|
|
"learning_rate": 1.2480326488675087e-07,
|
|
"loss": 1.6298,
|
|
"mean_token_accuracy": 0.5964894026517868,
|
|
"num_tokens": 44206831.0,
|
|
"step": 12250
|
|
},
|
|
{
|
|
"entropy": 1.640625,
|
|
"epoch": 2.710668877833057,
|
|
"grad_norm": 3.0715036392211914,
|
|
"learning_rate": 1.2293506321571698e-07,
|
|
"loss": 1.6389,
|
|
"mean_token_accuracy": 0.5923538848757743,
|
|
"num_tokens": 44242222.0,
|
|
"step": 12260
|
|
},
|
|
{
|
|
"entropy": 1.668359375,
|
|
"epoch": 2.712880044223328,
|
|
"grad_norm": 3.6053807735443115,
|
|
"learning_rate": 1.2108059740501748e-07,
|
|
"loss": 1.6613,
|
|
"mean_token_accuracy": 0.5896725952625275,
|
|
"num_tokens": 44278481.0,
|
|
"step": 12270
|
|
},
|
|
{
|
|
"entropy": 1.648046875,
|
|
"epoch": 2.7150912106135987,
|
|
"grad_norm": 3.9035542011260986,
|
|
"learning_rate": 1.1923987817067633e-07,
|
|
"loss": 1.6444,
|
|
"mean_token_accuracy": 0.5926850855350494,
|
|
"num_tokens": 44313567.0,
|
|
"step": 12280
|
|
},
|
|
{
|
|
"entropy": 1.62109375,
|
|
"epoch": 2.7173023770038696,
|
|
"grad_norm": 4.356287479400635,
|
|
"learning_rate": 1.1741291614928263e-07,
|
|
"loss": 1.6009,
|
|
"mean_token_accuracy": 0.5969807296991348,
|
|
"num_tokens": 44348854.0,
|
|
"step": 12290
|
|
},
|
|
{
|
|
"entropy": 1.59375,
|
|
"epoch": 2.7195135433941404,
|
|
"grad_norm": 3.8566582202911377,
|
|
"learning_rate": 1.1559972189792795e-07,
|
|
"loss": 1.5892,
|
|
"mean_token_accuracy": 0.6005391478538513,
|
|
"num_tokens": 44383468.0,
|
|
"step": 12300
|
|
},
|
|
{
|
|
"entropy": 1.680859375,
|
|
"epoch": 2.7217247097844113,
|
|
"grad_norm": 3.542430877685547,
|
|
"learning_rate": 1.138003058941492e-07,
|
|
"loss": 1.6899,
|
|
"mean_token_accuracy": 0.5803634554147721,
|
|
"num_tokens": 44424579.0,
|
|
"step": 12310
|
|
},
|
|
{
|
|
"entropy": 1.653515625,
|
|
"epoch": 2.723935876174682,
|
|
"grad_norm": 4.312977313995361,
|
|
"learning_rate": 1.1201467853586389e-07,
|
|
"loss": 1.6469,
|
|
"mean_token_accuracy": 0.5940011769533158,
|
|
"num_tokens": 44460494.0,
|
|
"step": 12320
|
|
},
|
|
{
|
|
"entropy": 1.65703125,
|
|
"epoch": 2.726147042564953,
|
|
"grad_norm": 3.786905527114868,
|
|
"learning_rate": 1.1024285014131358e-07,
|
|
"loss": 1.642,
|
|
"mean_token_accuracy": 0.5895095944404602,
|
|
"num_tokens": 44498211.0,
|
|
"step": 12330
|
|
},
|
|
{
|
|
"entropy": 1.6921875,
|
|
"epoch": 2.728358208955224,
|
|
"grad_norm": 4.198472023010254,
|
|
"learning_rate": 1.0848483094900081e-07,
|
|
"loss": 1.6897,
|
|
"mean_token_accuracy": 0.5855895668268204,
|
|
"num_tokens": 44534684.0,
|
|
"step": 12340
|
|
},
|
|
{
|
|
"entropy": 1.64453125,
|
|
"epoch": 2.7305693753454947,
|
|
"grad_norm": 4.131270885467529,
|
|
"learning_rate": 1.0674063111763277e-07,
|
|
"loss": 1.636,
|
|
"mean_token_accuracy": 0.5918486773967743,
|
|
"num_tokens": 44573388.0,
|
|
"step": 12350
|
|
},
|
|
{
|
|
"entropy": 1.65859375,
|
|
"epoch": 2.7327805417357656,
|
|
"grad_norm": 4.199599742889404,
|
|
"learning_rate": 1.0501026072606113e-07,
|
|
"loss": 1.6373,
|
|
"mean_token_accuracy": 0.5888915538787842,
|
|
"num_tokens": 44611181.0,
|
|
"step": 12360
|
|
},
|
|
{
|
|
"entropy": 1.66328125,
|
|
"epoch": 2.7349917081260364,
|
|
"grad_norm": 4.371722221374512,
|
|
"learning_rate": 1.0329372977322505e-07,
|
|
"loss": 1.6435,
|
|
"mean_token_accuracy": 0.5894839525222778,
|
|
"num_tokens": 44646536.0,
|
|
"step": 12370
|
|
},
|
|
{
|
|
"entropy": 1.629296875,
|
|
"epoch": 2.7372028745163073,
|
|
"grad_norm": 4.242416858673096,
|
|
"learning_rate": 1.0159104817809073e-07,
|
|
"loss": 1.6121,
|
|
"mean_token_accuracy": 0.5968893706798554,
|
|
"num_tokens": 44681378.0,
|
|
"step": 12380
|
|
},
|
|
{
|
|
"entropy": 1.621875,
|
|
"epoch": 2.739414040906578,
|
|
"grad_norm": 3.8870904445648193,
|
|
"learning_rate": 9.990222577959813e-08,
|
|
"loss": 1.6308,
|
|
"mean_token_accuracy": 0.5937034785747528,
|
|
"num_tokens": 44716224.0,
|
|
"step": 12390
|
|
},
|
|
{
|
|
"entropy": 1.675,
|
|
"epoch": 2.741625207296849,
|
|
"grad_norm": 3.9863204956054688,
|
|
"learning_rate": 9.822727233660012e-08,
|
|
"loss": 1.657,
|
|
"mean_token_accuracy": 0.589903125166893,
|
|
"num_tokens": 44753046.0,
|
|
"step": 12400
|
|
},
|
|
{
|
|
"entropy": 1.669140625,
|
|
"epoch": 2.74383637368712,
|
|
"grad_norm": 3.3982460498809814,
|
|
"learning_rate": 9.656619752780899e-08,
|
|
"loss": 1.6379,
|
|
"mean_token_accuracy": 0.5860684126615524,
|
|
"num_tokens": 44788986.0,
|
|
"step": 12410
|
|
},
|
|
{
|
|
"entropy": 1.633984375,
|
|
"epoch": 2.7460475400773907,
|
|
"grad_norm": 4.260997295379639,
|
|
"learning_rate": 9.491901095173783e-08,
|
|
"loss": 1.6301,
|
|
"mean_token_accuracy": 0.5988463997840882,
|
|
"num_tokens": 44822464.0,
|
|
"step": 12420
|
|
},
|
|
{
|
|
"entropy": 1.668359375,
|
|
"epoch": 2.7482587064676616,
|
|
"grad_norm": 3.3983500003814697,
|
|
"learning_rate": 9.32857221266495e-08,
|
|
"loss": 1.6727,
|
|
"mean_token_accuracy": 0.5848731249570847,
|
|
"num_tokens": 44857621.0,
|
|
"step": 12430
|
|
},
|
|
{
|
|
"entropy": 1.594921875,
|
|
"epoch": 2.7504698728579324,
|
|
"grad_norm": 4.0810136795043945,
|
|
"learning_rate": 9.166634049049577e-08,
|
|
"loss": 1.5767,
|
|
"mean_token_accuracy": 0.6069340735673905,
|
|
"num_tokens": 44891626.0,
|
|
"step": 12440
|
|
},
|
|
{
|
|
"entropy": 1.673046875,
|
|
"epoch": 2.7526810392482033,
|
|
"grad_norm": 4.646790981292725,
|
|
"learning_rate": 9.006087540086778e-08,
|
|
"loss": 1.6866,
|
|
"mean_token_accuracy": 0.5852156668901444,
|
|
"num_tokens": 44926683.0,
|
|
"step": 12450
|
|
},
|
|
{
|
|
"entropy": 1.622265625,
|
|
"epoch": 2.754892205638474,
|
|
"grad_norm": 4.614007949829102,
|
|
"learning_rate": 8.846933613493841e-08,
|
|
"loss": 1.5798,
|
|
"mean_token_accuracy": 0.6000434070825577,
|
|
"num_tokens": 44963244.0,
|
|
"step": 12460
|
|
},
|
|
{
|
|
"entropy": 1.637890625,
|
|
"epoch": 2.757103372028745,
|
|
"grad_norm": 4.653644561767578,
|
|
"learning_rate": 8.689173188941163e-08,
|
|
"loss": 1.6402,
|
|
"mean_token_accuracy": 0.5912492513656616,
|
|
"num_tokens": 44998061.0,
|
|
"step": 12470
|
|
},
|
|
{
|
|
"entropy": 1.63671875,
|
|
"epoch": 2.759314538419016,
|
|
"grad_norm": 4.4553751945495605,
|
|
"learning_rate": 8.532807178046693e-08,
|
|
"loss": 1.6275,
|
|
"mean_token_accuracy": 0.5926077753305435,
|
|
"num_tokens": 45034852.0,
|
|
"step": 12480
|
|
},
|
|
{
|
|
"entropy": 1.6484375,
|
|
"epoch": 2.761525704809287,
|
|
"grad_norm": 4.357314109802246,
|
|
"learning_rate": 8.377836484370822e-08,
|
|
"loss": 1.6389,
|
|
"mean_token_accuracy": 0.5900608241558075,
|
|
"num_tokens": 45069533.0,
|
|
"step": 12490
|
|
},
|
|
{
|
|
"entropy": 1.63515625,
|
|
"epoch": 2.7637368711995576,
|
|
"grad_norm": 4.152191638946533,
|
|
"learning_rate": 8.224262003411116e-08,
|
|
"loss": 1.6137,
|
|
"mean_token_accuracy": 0.5975213468074798,
|
|
"num_tokens": 45106057.0,
|
|
"step": 12500
|
|
},
|
|
{
|
|
"epoch": 2.7637368711995576,
|
|
"eval_entropy": 1.6856576492537314,
|
|
"eval_loss": 1.7769663333892822,
|
|
"eval_mean_token_accuracy": 0.5677829944968816,
|
|
"eval_num_tokens": 45106057.0,
|
|
"eval_runtime": 112.4855,
|
|
"eval_samples_per_second": 142.952,
|
|
"eval_steps_per_second": 8.934,
|
|
"step": 12500
|
|
},
|
|
{
|
|
"entropy": 1.65703125,
|
|
"epoch": 2.765948037589829,
|
|
"grad_norm": 4.203451633453369,
|
|
"learning_rate": 8.072084622597065e-08,
|
|
"loss": 1.6216,
|
|
"mean_token_accuracy": 0.5933431446552276,
|
|
"num_tokens": 45143717.0,
|
|
"step": 12510
|
|
},
|
|
{
|
|
"entropy": 1.651953125,
|
|
"epoch": 2.7681592039800993,
|
|
"grad_norm": 3.9696078300476074,
|
|
"learning_rate": 7.921305221285092e-08,
|
|
"loss": 1.6629,
|
|
"mean_token_accuracy": 0.5916117161512375,
|
|
"num_tokens": 45181204.0,
|
|
"step": 12520
|
|
},
|
|
{
|
|
"entropy": 1.6140625,
|
|
"epoch": 2.7703703703703706,
|
|
"grad_norm": 4.628373146057129,
|
|
"learning_rate": 7.771924670753328e-08,
|
|
"loss": 1.6001,
|
|
"mean_token_accuracy": 0.598871698975563,
|
|
"num_tokens": 45215357.0,
|
|
"step": 12530
|
|
},
|
|
{
|
|
"entropy": 1.66015625,
|
|
"epoch": 2.772581536760641,
|
|
"grad_norm": 3.5428171157836914,
|
|
"learning_rate": 7.62394383419679e-08,
|
|
"loss": 1.6613,
|
|
"mean_token_accuracy": 0.5921337991952896,
|
|
"num_tokens": 45253751.0,
|
|
"step": 12540
|
|
},
|
|
{
|
|
"entropy": 1.619921875,
|
|
"epoch": 2.7747927031509123,
|
|
"grad_norm": 3.8824331760406494,
|
|
"learning_rate": 7.477363566722046e-08,
|
|
"loss": 1.5975,
|
|
"mean_token_accuracy": 0.5913000047206879,
|
|
"num_tokens": 45288975.0,
|
|
"step": 12550
|
|
},
|
|
{
|
|
"entropy": 1.659375,
|
|
"epoch": 2.7770038695411827,
|
|
"grad_norm": 3.7930829524993896,
|
|
"learning_rate": 7.332184715342666e-08,
|
|
"loss": 1.6671,
|
|
"mean_token_accuracy": 0.5886818289756774,
|
|
"num_tokens": 45323496.0,
|
|
"step": 12560
|
|
},
|
|
{
|
|
"entropy": 1.65,
|
|
"epoch": 2.779215035931454,
|
|
"grad_norm": 4.109228134155273,
|
|
"learning_rate": 7.188408118973977e-08,
|
|
"loss": 1.6319,
|
|
"mean_token_accuracy": 0.5961740702390671,
|
|
"num_tokens": 45358903.0,
|
|
"step": 12570
|
|
},
|
|
{
|
|
"entropy": 1.694921875,
|
|
"epoch": 2.7814262023217244,
|
|
"grad_norm": 4.043583869934082,
|
|
"learning_rate": 7.046034608428593e-08,
|
|
"loss": 1.6807,
|
|
"mean_token_accuracy": 0.5881491333246232,
|
|
"num_tokens": 45394476.0,
|
|
"step": 12580
|
|
},
|
|
{
|
|
"entropy": 1.641796875,
|
|
"epoch": 2.7836373687119957,
|
|
"grad_norm": 3.6539359092712402,
|
|
"learning_rate": 6.905065006411194e-08,
|
|
"loss": 1.6261,
|
|
"mean_token_accuracy": 0.5926414430141449,
|
|
"num_tokens": 45432948.0,
|
|
"step": 12590
|
|
},
|
|
{
|
|
"entropy": 1.654296875,
|
|
"epoch": 2.7858485351022666,
|
|
"grad_norm": 3.8241515159606934,
|
|
"learning_rate": 6.765500127514091e-08,
|
|
"loss": 1.622,
|
|
"mean_token_accuracy": 0.5961004018783569,
|
|
"num_tokens": 45468177.0,
|
|
"step": 12600
|
|
},
|
|
{
|
|
"entropy": 1.6234375,
|
|
"epoch": 2.7880597014925375,
|
|
"grad_norm": 4.329864501953125,
|
|
"learning_rate": 6.627340778212393e-08,
|
|
"loss": 1.6026,
|
|
"mean_token_accuracy": 0.5971056282520294,
|
|
"num_tokens": 45502667.0,
|
|
"step": 12610
|
|
},
|
|
{
|
|
"entropy": 1.625,
|
|
"epoch": 2.7902708678828083,
|
|
"grad_norm": 3.576049327850342,
|
|
"learning_rate": 6.490587756859402e-08,
|
|
"loss": 1.6045,
|
|
"mean_token_accuracy": 0.6016596853733063,
|
|
"num_tokens": 45540258.0,
|
|
"step": 12620
|
|
},
|
|
{
|
|
"entropy": 1.6625,
|
|
"epoch": 2.792482034273079,
|
|
"grad_norm": 4.135618686676025,
|
|
"learning_rate": 6.355241853681804e-08,
|
|
"loss": 1.6468,
|
|
"mean_token_accuracy": 0.5871924966573715,
|
|
"num_tokens": 45575682.0,
|
|
"step": 12630
|
|
},
|
|
{
|
|
"entropy": 1.59921875,
|
|
"epoch": 2.79469320066335,
|
|
"grad_norm": 4.231292247772217,
|
|
"learning_rate": 6.221303850775435e-08,
|
|
"loss": 1.5712,
|
|
"mean_token_accuracy": 0.6081149846315383,
|
|
"num_tokens": 45608074.0,
|
|
"step": 12640
|
|
},
|
|
{
|
|
"entropy": 1.635546875,
|
|
"epoch": 2.796904367053621,
|
|
"grad_norm": 3.8389456272125244,
|
|
"learning_rate": 6.088774522100521e-08,
|
|
"loss": 1.6248,
|
|
"mean_token_accuracy": 0.5953689396381379,
|
|
"num_tokens": 45643449.0,
|
|
"step": 12650
|
|
},
|
|
{
|
|
"entropy": 1.684765625,
|
|
"epoch": 2.7991155334438917,
|
|
"grad_norm": 3.6036877632141113,
|
|
"learning_rate": 5.957654633477222e-08,
|
|
"loss": 1.6988,
|
|
"mean_token_accuracy": 0.5867615669965744,
|
|
"num_tokens": 45683711.0,
|
|
"step": 12660
|
|
},
|
|
{
|
|
"entropy": 1.62109375,
|
|
"epoch": 2.8013266998341626,
|
|
"grad_norm": 3.5430359840393066,
|
|
"learning_rate": 5.8279449425813206e-08,
|
|
"loss": 1.6053,
|
|
"mean_token_accuracy": 0.6015674382448196,
|
|
"num_tokens": 45718613.0,
|
|
"step": 12670
|
|
},
|
|
{
|
|
"entropy": 1.65078125,
|
|
"epoch": 2.8035378662244335,
|
|
"grad_norm": 4.283117294311523,
|
|
"learning_rate": 5.699646198939757e-08,
|
|
"loss": 1.6574,
|
|
"mean_token_accuracy": 0.5940529137849808,
|
|
"num_tokens": 45755200.0,
|
|
"step": 12680
|
|
},
|
|
{
|
|
"entropy": 1.6859375,
|
|
"epoch": 2.8057490326147043,
|
|
"grad_norm": 3.984330654144287,
|
|
"learning_rate": 5.572759143926299e-08,
|
|
"loss": 1.6803,
|
|
"mean_token_accuracy": 0.5903393387794494,
|
|
"num_tokens": 45791496.0,
|
|
"step": 12690
|
|
},
|
|
{
|
|
"entropy": 1.633203125,
|
|
"epoch": 2.807960199004975,
|
|
"grad_norm": 4.094389915466309,
|
|
"learning_rate": 5.4472845107573225e-08,
|
|
"loss": 1.591,
|
|
"mean_token_accuracy": 0.6019279956817627,
|
|
"num_tokens": 45826846.0,
|
|
"step": 12700
|
|
},
|
|
{
|
|
"entropy": 1.647265625,
|
|
"epoch": 2.810171365395246,
|
|
"grad_norm": 4.031773090362549,
|
|
"learning_rate": 5.323223024487456e-08,
|
|
"loss": 1.6308,
|
|
"mean_token_accuracy": 0.5940986514091492,
|
|
"num_tokens": 45863980.0,
|
|
"step": 12710
|
|
},
|
|
{
|
|
"entropy": 1.68515625,
|
|
"epoch": 2.812382531785517,
|
|
"grad_norm": 3.875953197479248,
|
|
"learning_rate": 5.2005754020055256e-08,
|
|
"loss": 1.6813,
|
|
"mean_token_accuracy": 0.5845620095729828,
|
|
"num_tokens": 45900029.0,
|
|
"step": 12720
|
|
},
|
|
{
|
|
"entropy": 1.645703125,
|
|
"epoch": 2.8145936981757878,
|
|
"grad_norm": 4.181349754333496,
|
|
"learning_rate": 5.0793423520303364e-08,
|
|
"loss": 1.6132,
|
|
"mean_token_accuracy": 0.5952747106552124,
|
|
"num_tokens": 45934398.0,
|
|
"step": 12730
|
|
},
|
|
{
|
|
"entropy": 1.664453125,
|
|
"epoch": 2.8168048645660586,
|
|
"grad_norm": 4.280387878417969,
|
|
"learning_rate": 4.9595245751065944e-08,
|
|
"loss": 1.6494,
|
|
"mean_token_accuracy": 0.5947684556245804,
|
|
"num_tokens": 45971261.0,
|
|
"step": 12740
|
|
},
|
|
{
|
|
"entropy": 1.678515625,
|
|
"epoch": 2.8190160309563295,
|
|
"grad_norm": 4.162785530090332,
|
|
"learning_rate": 4.841122763600825e-08,
|
|
"loss": 1.6805,
|
|
"mean_token_accuracy": 0.5884193539619446,
|
|
"num_tokens": 46009194.0,
|
|
"step": 12750
|
|
},
|
|
{
|
|
"entropy": 1.6578125,
|
|
"epoch": 2.8212271973466003,
|
|
"grad_norm": 3.525569438934326,
|
|
"learning_rate": 4.724137601697459e-08,
|
|
"loss": 1.6704,
|
|
"mean_token_accuracy": 0.5859906315803528,
|
|
"num_tokens": 46044770.0,
|
|
"step": 12760
|
|
},
|
|
{
|
|
"entropy": 1.662890625,
|
|
"epoch": 2.823438363736871,
|
|
"grad_norm": 3.9060959815979004,
|
|
"learning_rate": 4.6085697653947544e-08,
|
|
"loss": 1.6512,
|
|
"mean_token_accuracy": 0.589400264620781,
|
|
"num_tokens": 46080176.0,
|
|
"step": 12770
|
|
},
|
|
{
|
|
"entropy": 1.645703125,
|
|
"epoch": 2.825649530127142,
|
|
"grad_norm": 5.2108354568481445,
|
|
"learning_rate": 4.4944199225010473e-08,
|
|
"loss": 1.6165,
|
|
"mean_token_accuracy": 0.5957522302865982,
|
|
"num_tokens": 46117409.0,
|
|
"step": 12780
|
|
},
|
|
{
|
|
"entropy": 1.680078125,
|
|
"epoch": 2.827860696517413,
|
|
"grad_norm": 4.499181270599365,
|
|
"learning_rate": 4.381688732630701e-08,
|
|
"loss": 1.658,
|
|
"mean_token_accuracy": 0.5859708815813065,
|
|
"num_tokens": 46151685.0,
|
|
"step": 12790
|
|
},
|
|
{
|
|
"entropy": 1.653125,
|
|
"epoch": 2.8300718629076838,
|
|
"grad_norm": 3.033838987350464,
|
|
"learning_rate": 4.270376847200497e-08,
|
|
"loss": 1.6113,
|
|
"mean_token_accuracy": 0.5985817581415176,
|
|
"num_tokens": 46189800.0,
|
|
"step": 12800
|
|
},
|
|
{
|
|
"entropy": 1.662109375,
|
|
"epoch": 2.8322830292979546,
|
|
"grad_norm": 3.553948163986206,
|
|
"learning_rate": 4.1604849094256935e-08,
|
|
"loss": 1.6492,
|
|
"mean_token_accuracy": 0.5918176114559174,
|
|
"num_tokens": 46223833.0,
|
|
"step": 12810
|
|
},
|
|
{
|
|
"entropy": 1.666015625,
|
|
"epoch": 2.8344941956882255,
|
|
"grad_norm": 4.058619022369385,
|
|
"learning_rate": 4.0520135543163916e-08,
|
|
"loss": 1.6409,
|
|
"mean_token_accuracy": 0.5876541346311569,
|
|
"num_tokens": 46260962.0,
|
|
"step": 12820
|
|
},
|
|
{
|
|
"entropy": 1.665625,
|
|
"epoch": 2.8367053620784963,
|
|
"grad_norm": 3.9116175174713135,
|
|
"learning_rate": 3.9449634086739795e-08,
|
|
"loss": 1.6189,
|
|
"mean_token_accuracy": 0.594248577952385,
|
|
"num_tokens": 46296036.0,
|
|
"step": 12830
|
|
},
|
|
{
|
|
"entropy": 1.634375,
|
|
"epoch": 2.838916528468767,
|
|
"grad_norm": 3.964871644973755,
|
|
"learning_rate": 3.839335091087193e-08,
|
|
"loss": 1.6274,
|
|
"mean_token_accuracy": 0.5952156543731689,
|
|
"num_tokens": 46332958.0,
|
|
"step": 12840
|
|
},
|
|
{
|
|
"entropy": 1.635546875,
|
|
"epoch": 2.841127694859038,
|
|
"grad_norm": 3.974292755126953,
|
|
"learning_rate": 3.7351292119289505e-08,
|
|
"loss": 1.6088,
|
|
"mean_token_accuracy": 0.5955435842275619,
|
|
"num_tokens": 46369980.0,
|
|
"step": 12850
|
|
},
|
|
{
|
|
"entropy": 1.67265625,
|
|
"epoch": 2.843338861249309,
|
|
"grad_norm": 4.162252426147461,
|
|
"learning_rate": 3.6323463733523854e-08,
|
|
"loss": 1.669,
|
|
"mean_token_accuracy": 0.5832523167133331,
|
|
"num_tokens": 46404658.0,
|
|
"step": 12860
|
|
},
|
|
{
|
|
"entropy": 1.644921875,
|
|
"epoch": 2.8455500276395798,
|
|
"grad_norm": 3.658139705657959,
|
|
"learning_rate": 3.530987169287875e-08,
|
|
"loss": 1.6318,
|
|
"mean_token_accuracy": 0.5934416443109513,
|
|
"num_tokens": 46439904.0,
|
|
"step": 12870
|
|
},
|
|
{
|
|
"entropy": 1.630078125,
|
|
"epoch": 2.8477611940298506,
|
|
"grad_norm": 4.072232246398926,
|
|
"learning_rate": 3.431052185439071e-08,
|
|
"loss": 1.6175,
|
|
"mean_token_accuracy": 0.5970421642065048,
|
|
"num_tokens": 46475856.0,
|
|
"step": 12880
|
|
},
|
|
{
|
|
"entropy": 1.647265625,
|
|
"epoch": 2.8499723604201215,
|
|
"grad_norm": 3.689831495285034,
|
|
"learning_rate": 3.332541999279903e-08,
|
|
"loss": 1.6288,
|
|
"mean_token_accuracy": 0.5953065752983093,
|
|
"num_tokens": 46511724.0,
|
|
"step": 12890
|
|
},
|
|
{
|
|
"entropy": 1.677734375,
|
|
"epoch": 2.8521835268103923,
|
|
"grad_norm": 3.334261417388916,
|
|
"learning_rate": 3.2354571800511105e-08,
|
|
"loss": 1.6656,
|
|
"mean_token_accuracy": 0.588189747929573,
|
|
"num_tokens": 46549654.0,
|
|
"step": 12900
|
|
},
|
|
{
|
|
"entropy": 1.6578125,
|
|
"epoch": 2.854394693200663,
|
|
"grad_norm": 4.499913692474365,
|
|
"learning_rate": 3.1397982887569345e-08,
|
|
"loss": 1.6731,
|
|
"mean_token_accuracy": 0.5912659883499145,
|
|
"num_tokens": 46589370.0,
|
|
"step": 12910
|
|
},
|
|
{
|
|
"entropy": 1.680859375,
|
|
"epoch": 2.8566058595909345,
|
|
"grad_norm": 4.558979511260986,
|
|
"learning_rate": 3.045565878161877e-08,
|
|
"loss": 1.6681,
|
|
"mean_token_accuracy": 0.5871021389961243,
|
|
"num_tokens": 46623411.0,
|
|
"step": 12920
|
|
},
|
|
{
|
|
"entropy": 1.6875,
|
|
"epoch": 2.858817025981205,
|
|
"grad_norm": 3.9945380687713623,
|
|
"learning_rate": 2.9527604927875874e-08,
|
|
"loss": 1.6833,
|
|
"mean_token_accuracy": 0.5869188904762268,
|
|
"num_tokens": 46662660.0,
|
|
"step": 12930
|
|
},
|
|
{
|
|
"entropy": 1.67265625,
|
|
"epoch": 2.861028192371476,
|
|
"grad_norm": 3.823910713195801,
|
|
"learning_rate": 2.8613826689095903e-08,
|
|
"loss": 1.6813,
|
|
"mean_token_accuracy": 0.5848930209875107,
|
|
"num_tokens": 46697060.0,
|
|
"step": 12940
|
|
},
|
|
{
|
|
"entropy": 1.610546875,
|
|
"epoch": 2.8632393587617466,
|
|
"grad_norm": 4.502660274505615,
|
|
"learning_rate": 2.7714329345543135e-08,
|
|
"loss": 1.591,
|
|
"mean_token_accuracy": 0.6016790419816971,
|
|
"num_tokens": 46735253.0,
|
|
"step": 12950
|
|
},
|
|
{
|
|
"entropy": 1.67421875,
|
|
"epoch": 2.865450525152018,
|
|
"grad_norm": 4.100869655609131,
|
|
"learning_rate": 2.6829118094958974e-08,
|
|
"loss": 1.6891,
|
|
"mean_token_accuracy": 0.5845727652311326,
|
|
"num_tokens": 46772760.0,
|
|
"step": 12960
|
|
},
|
|
{
|
|
"entropy": 1.712109375,
|
|
"epoch": 2.8676616915422883,
|
|
"grad_norm": 3.298762559890747,
|
|
"learning_rate": 2.595819805253308e-08,
|
|
"loss": 1.7208,
|
|
"mean_token_accuracy": 0.5794914022088051,
|
|
"num_tokens": 46809456.0,
|
|
"step": 12970
|
|
},
|
|
{
|
|
"entropy": 1.646875,
|
|
"epoch": 2.8698728579325596,
|
|
"grad_norm": 3.8945202827453613,
|
|
"learning_rate": 2.510157425087395e-08,
|
|
"loss": 1.6472,
|
|
"mean_token_accuracy": 0.5903005033731461,
|
|
"num_tokens": 46847818.0,
|
|
"step": 12980
|
|
},
|
|
{
|
|
"entropy": 1.65390625,
|
|
"epoch": 2.87208402432283,
|
|
"grad_norm": 3.2822165489196777,
|
|
"learning_rate": 2.4259251639978665e-08,
|
|
"loss": 1.6206,
|
|
"mean_token_accuracy": 0.6003502368927002,
|
|
"num_tokens": 46884012.0,
|
|
"step": 12990
|
|
},
|
|
{
|
|
"entropy": 1.684765625,
|
|
"epoch": 2.8742951907131014,
|
|
"grad_norm": 4.310787200927734,
|
|
"learning_rate": 2.343123508720485e-08,
|
|
"loss": 1.6841,
|
|
"mean_token_accuracy": 0.5834894686937332,
|
|
"num_tokens": 46920861.0,
|
|
"step": 13000
|
|
},
|
|
{
|
|
"epoch": 2.8742951907131014,
|
|
"eval_entropy": 1.6843672263681593,
|
|
"eval_loss": 1.7765709161758423,
|
|
"eval_mean_token_accuracy": 0.5678447590538518,
|
|
"eval_num_tokens": 46920861.0,
|
|
"eval_runtime": 112.1224,
|
|
"eval_samples_per_second": 143.415,
|
|
"eval_steps_per_second": 8.963,
|
|
"step": 13000
|
|
},
|
|
{
|
|
"entropy": 1.67109375,
|
|
"epoch": 2.8765063571033718,
|
|
"grad_norm": 4.378058910369873,
|
|
"learning_rate": 2.261752937724293e-08,
|
|
"loss": 1.6659,
|
|
"mean_token_accuracy": 0.5859705537557602,
|
|
"num_tokens": 46955649.0,
|
|
"step": 13010
|
|
},
|
|
{
|
|
"entropy": 1.6765625,
|
|
"epoch": 2.878717523493643,
|
|
"grad_norm": 3.5847487449645996,
|
|
"learning_rate": 2.1818139212088363e-08,
|
|
"loss": 1.6927,
|
|
"mean_token_accuracy": 0.5852095454931259,
|
|
"num_tokens": 46992581.0,
|
|
"step": 13020
|
|
},
|
|
{
|
|
"entropy": 1.63359375,
|
|
"epoch": 2.880928689883914,
|
|
"grad_norm": 2.975508689880371,
|
|
"learning_rate": 2.1033069211014167e-08,
|
|
"loss": 1.6257,
|
|
"mean_token_accuracy": 0.5969172656536103,
|
|
"num_tokens": 47027114.0,
|
|
"step": 13030
|
|
},
|
|
{
|
|
"entropy": 1.667578125,
|
|
"epoch": 2.883139856274185,
|
|
"grad_norm": 3.6523118019104004,
|
|
"learning_rate": 2.0262323910543723e-08,
|
|
"loss": 1.6704,
|
|
"mean_token_accuracy": 0.583617091178894,
|
|
"num_tokens": 47060846.0,
|
|
"step": 13040
|
|
},
|
|
{
|
|
"entropy": 1.6375,
|
|
"epoch": 2.8853510226644556,
|
|
"grad_norm": 3.7036027908325195,
|
|
"learning_rate": 1.9505907764426347e-08,
|
|
"loss": 1.6187,
|
|
"mean_token_accuracy": 0.597618094086647,
|
|
"num_tokens": 47095462.0,
|
|
"step": 13050
|
|
},
|
|
{
|
|
"entropy": 1.622265625,
|
|
"epoch": 2.8875621890547265,
|
|
"grad_norm": 4.448975563049316,
|
|
"learning_rate": 1.876382514360925e-08,
|
|
"loss": 1.6101,
|
|
"mean_token_accuracy": 0.5962168037891388,
|
|
"num_tokens": 47132901.0,
|
|
"step": 13060
|
|
},
|
|
{
|
|
"entropy": 1.6109375,
|
|
"epoch": 2.8897733554449974,
|
|
"grad_norm": 4.272410869598389,
|
|
"learning_rate": 1.8036080336213958e-08,
|
|
"loss": 1.5981,
|
|
"mean_token_accuracy": 0.598596602678299,
|
|
"num_tokens": 47166228.0,
|
|
"step": 13070
|
|
},
|
|
{
|
|
"entropy": 1.683203125,
|
|
"epoch": 2.891984521835268,
|
|
"grad_norm": 4.762310981750488,
|
|
"learning_rate": 1.7322677547511048e-08,
|
|
"loss": 1.6618,
|
|
"mean_token_accuracy": 0.5840688228607178,
|
|
"num_tokens": 47201284.0,
|
|
"step": 13080
|
|
},
|
|
{
|
|
"entropy": 1.65625,
|
|
"epoch": 2.894195688225539,
|
|
"grad_norm": 4.5530924797058105,
|
|
"learning_rate": 1.662362089989572e-08,
|
|
"loss": 1.6603,
|
|
"mean_token_accuracy": 0.5887762665748596,
|
|
"num_tokens": 47237129.0,
|
|
"step": 13090
|
|
},
|
|
{
|
|
"entropy": 1.614453125,
|
|
"epoch": 2.89640685461581,
|
|
"grad_norm": 3.9602699279785156,
|
|
"learning_rate": 1.5938914432864217e-08,
|
|
"loss": 1.6057,
|
|
"mean_token_accuracy": 0.5984326213598251,
|
|
"num_tokens": 47274329.0,
|
|
"step": 13100
|
|
},
|
|
{
|
|
"entropy": 1.68046875,
|
|
"epoch": 2.898618021006081,
|
|
"grad_norm": 3.732564687728882,
|
|
"learning_rate": 1.5268562102989937e-08,
|
|
"loss": 1.6534,
|
|
"mean_token_accuracy": 0.5857302963733673,
|
|
"num_tokens": 47309974.0,
|
|
"step": 13110
|
|
},
|
|
{
|
|
"entropy": 1.674609375,
|
|
"epoch": 2.9008291873963516,
|
|
"grad_norm": 3.4360592365264893,
|
|
"learning_rate": 1.4612567783901243e-08,
|
|
"loss": 1.6716,
|
|
"mean_token_accuracy": 0.5841006636619568,
|
|
"num_tokens": 47345006.0,
|
|
"step": 13120
|
|
},
|
|
{
|
|
"entropy": 1.673046875,
|
|
"epoch": 2.9030403537866225,
|
|
"grad_norm": 4.229859828948975,
|
|
"learning_rate": 1.3970935266258701e-08,
|
|
"loss": 1.6758,
|
|
"mean_token_accuracy": 0.5876132071018219,
|
|
"num_tokens": 47382049.0,
|
|
"step": 13130
|
|
},
|
|
{
|
|
"entropy": 1.674609375,
|
|
"epoch": 2.9052515201768934,
|
|
"grad_norm": 3.8717739582061768,
|
|
"learning_rate": 1.3343668257733144e-08,
|
|
"loss": 1.666,
|
|
"mean_token_accuracy": 0.5852203458547592,
|
|
"num_tokens": 47415140.0,
|
|
"step": 13140
|
|
},
|
|
{
|
|
"entropy": 1.67890625,
|
|
"epoch": 2.9074626865671642,
|
|
"grad_norm": 4.248335361480713,
|
|
"learning_rate": 1.2730770382984592e-08,
|
|
"loss": 1.6653,
|
|
"mean_token_accuracy": 0.5911050468683243,
|
|
"num_tokens": 47452187.0,
|
|
"step": 13150
|
|
},
|
|
{
|
|
"entropy": 1.660546875,
|
|
"epoch": 2.909673852957435,
|
|
"grad_norm": 3.9126954078674316,
|
|
"learning_rate": 1.2132245183641145e-08,
|
|
"loss": 1.6842,
|
|
"mean_token_accuracy": 0.5871102064847946,
|
|
"num_tokens": 47487579.0,
|
|
"step": 13160
|
|
},
|
|
{
|
|
"entropy": 1.653125,
|
|
"epoch": 2.911885019347706,
|
|
"grad_norm": 4.596493721008301,
|
|
"learning_rate": 1.1548096118278173e-08,
|
|
"loss": 1.6321,
|
|
"mean_token_accuracy": 0.593408852815628,
|
|
"num_tokens": 47523999.0,
|
|
"step": 13170
|
|
},
|
|
{
|
|
"entropy": 1.614453125,
|
|
"epoch": 2.914096185737977,
|
|
"grad_norm": 4.203975200653076,
|
|
"learning_rate": 1.097832656239889e-08,
|
|
"loss": 1.5864,
|
|
"mean_token_accuracy": 0.600899514555931,
|
|
"num_tokens": 47558332.0,
|
|
"step": 13180
|
|
},
|
|
{
|
|
"entropy": 1.703125,
|
|
"epoch": 2.9163073521282477,
|
|
"grad_norm": 4.119178771972656,
|
|
"learning_rate": 1.0422939808414079e-08,
|
|
"loss": 1.6952,
|
|
"mean_token_accuracy": 0.5813955813646317,
|
|
"num_tokens": 47595215.0,
|
|
"step": 13190
|
|
},
|
|
{
|
|
"entropy": 1.653125,
|
|
"epoch": 2.9185185185185185,
|
|
"grad_norm": 3.542818307876587,
|
|
"learning_rate": 9.881939065624347e-09,
|
|
"loss": 1.6426,
|
|
"mean_token_accuracy": 0.5895743757486344,
|
|
"num_tokens": 47632423.0,
|
|
"step": 13200
|
|
},
|
|
{
|
|
"entropy": 1.64375,
|
|
"epoch": 2.9207296849087894,
|
|
"grad_norm": 3.2984488010406494,
|
|
"learning_rate": 9.355327460199848e-09,
|
|
"loss": 1.6138,
|
|
"mean_token_accuracy": 0.5945003718137741,
|
|
"num_tokens": 47669542.0,
|
|
"step": 13210
|
|
},
|
|
{
|
|
"entropy": 1.701171875,
|
|
"epoch": 2.9229408512990602,
|
|
"grad_norm": 4.357846260070801,
|
|
"learning_rate": 8.843108035163916e-09,
|
|
"loss": 1.6728,
|
|
"mean_token_accuracy": 0.5854611814022064,
|
|
"num_tokens": 47704173.0,
|
|
"step": 13220
|
|
},
|
|
{
|
|
"entropy": 1.63046875,
|
|
"epoch": 2.925152017689331,
|
|
"grad_norm": 3.8289992809295654,
|
|
"learning_rate": 8.345283750374466e-09,
|
|
"loss": 1.6173,
|
|
"mean_token_accuracy": 0.5989271193742752,
|
|
"num_tokens": 47738266.0,
|
|
"step": 13230
|
|
},
|
|
{
|
|
"entropy": 1.65390625,
|
|
"epoch": 2.927363184079602,
|
|
"grad_norm": 3.626721143722534,
|
|
"learning_rate": 7.86185748250734e-09,
|
|
"loss": 1.6297,
|
|
"mean_token_accuracy": 0.5958569079637528,
|
|
"num_tokens": 47774057.0,
|
|
"step": 13240
|
|
},
|
|
{
|
|
"entropy": 1.644921875,
|
|
"epoch": 2.929574350469873,
|
|
"grad_norm": 3.820176601409912,
|
|
"learning_rate": 7.3928320250390986e-09,
|
|
"loss": 1.619,
|
|
"mean_token_accuracy": 0.5977859228849411,
|
|
"num_tokens": 47808903.0,
|
|
"step": 13250
|
|
},
|
|
{
|
|
"entropy": 1.659375,
|
|
"epoch": 2.9317855168601437,
|
|
"grad_norm": 3.627906322479248,
|
|
"learning_rate": 6.938210088231479e-09,
|
|
"loss": 1.6417,
|
|
"mean_token_accuracy": 0.5899067997932435,
|
|
"num_tokens": 47845121.0,
|
|
"step": 13260
|
|
},
|
|
{
|
|
"entropy": 1.6953125,
|
|
"epoch": 2.9339966832504145,
|
|
"grad_norm": 4.299013137817383,
|
|
"learning_rate": 6.497994299115573e-09,
|
|
"loss": 1.6822,
|
|
"mean_token_accuracy": 0.5820305347442627,
|
|
"num_tokens": 47882044.0,
|
|
"step": 13270
|
|
},
|
|
{
|
|
"entropy": 1.63984375,
|
|
"epoch": 2.9362078496406854,
|
|
"grad_norm": 3.3737595081329346,
|
|
"learning_rate": 6.072187201476565e-09,
|
|
"loss": 1.6175,
|
|
"mean_token_accuracy": 0.5900583624839782,
|
|
"num_tokens": 47915960.0,
|
|
"step": 13280
|
|
},
|
|
{
|
|
"entropy": 1.637890625,
|
|
"epoch": 2.9384190160309562,
|
|
"grad_norm": 3.6324002742767334,
|
|
"learning_rate": 5.660791255839293e-09,
|
|
"loss": 1.6248,
|
|
"mean_token_accuracy": 0.5937619715929031,
|
|
"num_tokens": 47953807.0,
|
|
"step": 13290
|
|
},
|
|
{
|
|
"entropy": 1.623828125,
|
|
"epoch": 2.940630182421227,
|
|
"grad_norm": 4.5471343994140625,
|
|
"learning_rate": 5.263808839453266e-09,
|
|
"loss": 1.6246,
|
|
"mean_token_accuracy": 0.5999820619821549,
|
|
"num_tokens": 47989562.0,
|
|
"step": 13300
|
|
},
|
|
{
|
|
"entropy": 1.626953125,
|
|
"epoch": 2.942841348811498,
|
|
"grad_norm": 3.731358051300049,
|
|
"learning_rate": 4.881242246279894e-09,
|
|
"loss": 1.5846,
|
|
"mean_token_accuracy": 0.6023639440536499,
|
|
"num_tokens": 48024924.0,
|
|
"step": 13310
|
|
},
|
|
{
|
|
"entropy": 1.669921875,
|
|
"epoch": 2.945052515201769,
|
|
"grad_norm": 4.596261501312256,
|
|
"learning_rate": 4.5130936869788865e-09,
|
|
"loss": 1.6598,
|
|
"mean_token_accuracy": 0.5864508658647537,
|
|
"num_tokens": 48058837.0,
|
|
"step": 13320
|
|
},
|
|
{
|
|
"entropy": 1.66875,
|
|
"epoch": 2.9472636815920397,
|
|
"grad_norm": 3.4455087184906006,
|
|
"learning_rate": 4.159365288895212e-09,
|
|
"loss": 1.6695,
|
|
"mean_token_accuracy": 0.5888384789228439,
|
|
"num_tokens": 48097411.0,
|
|
"step": 13330
|
|
},
|
|
{
|
|
"entropy": 1.67109375,
|
|
"epoch": 2.9494748479823105,
|
|
"grad_norm": 3.738842010498047,
|
|
"learning_rate": 3.82005909604688e-09,
|
|
"loss": 1.6704,
|
|
"mean_token_accuracy": 0.5824524998664856,
|
|
"num_tokens": 48134805.0,
|
|
"step": 13340
|
|
},
|
|
{
|
|
"entropy": 1.666796875,
|
|
"epoch": 2.9516860143725814,
|
|
"grad_norm": 4.094563007354736,
|
|
"learning_rate": 3.4951770691135646e-09,
|
|
"loss": 1.6782,
|
|
"mean_token_accuracy": 0.5807325601577759,
|
|
"num_tokens": 48171305.0,
|
|
"step": 13350
|
|
},
|
|
{
|
|
"entropy": 1.6546875,
|
|
"epoch": 2.9538971807628522,
|
|
"grad_norm": 3.8009655475616455,
|
|
"learning_rate": 3.184721085424669e-09,
|
|
"loss": 1.6529,
|
|
"mean_token_accuracy": 0.5879477769136429,
|
|
"num_tokens": 48206018.0,
|
|
"step": 13360
|
|
},
|
|
{
|
|
"entropy": 1.67265625,
|
|
"epoch": 2.9561083471531235,
|
|
"grad_norm": 4.675745487213135,
|
|
"learning_rate": 2.8886929389487785e-09,
|
|
"loss": 1.6819,
|
|
"mean_token_accuracy": 0.5816639453172684,
|
|
"num_tokens": 48241366.0,
|
|
"step": 13370
|
|
},
|
|
{
|
|
"entropy": 1.626953125,
|
|
"epoch": 2.958319513543394,
|
|
"grad_norm": 4.149998664855957,
|
|
"learning_rate": 2.6070943402833894e-09,
|
|
"loss": 1.6416,
|
|
"mean_token_accuracy": 0.5860764056444168,
|
|
"num_tokens": 48274825.0,
|
|
"step": 13380
|
|
},
|
|
{
|
|
"entropy": 1.67421875,
|
|
"epoch": 2.9605306799336653,
|
|
"grad_norm": 3.5707154273986816,
|
|
"learning_rate": 2.339926916644919e-09,
|
|
"loss": 1.6817,
|
|
"mean_token_accuracy": 0.5837209329009057,
|
|
"num_tokens": 48309435.0,
|
|
"step": 13390
|
|
},
|
|
{
|
|
"entropy": 1.65625,
|
|
"epoch": 2.9627418463239357,
|
|
"grad_norm": 3.853034257888794,
|
|
"learning_rate": 2.0871922118595457e-09,
|
|
"loss": 1.6458,
|
|
"mean_token_accuracy": 0.5935676783323288,
|
|
"num_tokens": 48345938.0,
|
|
"step": 13400
|
|
},
|
|
{
|
|
"entropy": 1.715625,
|
|
"epoch": 2.964953012714207,
|
|
"grad_norm": 4.895432472229004,
|
|
"learning_rate": 1.8488916863532158e-09,
|
|
"loss": 1.6985,
|
|
"mean_token_accuracy": 0.5875573098659516,
|
|
"num_tokens": 48385394.0,
|
|
"step": 13410
|
|
},
|
|
{
|
|
"entropy": 1.644140625,
|
|
"epoch": 2.9671641791044774,
|
|
"grad_norm": 4.060731410980225,
|
|
"learning_rate": 1.6250267171452616e-09,
|
|
"loss": 1.6466,
|
|
"mean_token_accuracy": 0.5939691662788391,
|
|
"num_tokens": 48422685.0,
|
|
"step": 13420
|
|
},
|
|
{
|
|
"entropy": 1.623828125,
|
|
"epoch": 2.9693753454947487,
|
|
"grad_norm": 4.185715675354004,
|
|
"learning_rate": 1.4155985978378528e-09,
|
|
"loss": 1.6221,
|
|
"mean_token_accuracy": 0.5965218156576156,
|
|
"num_tokens": 48458822.0,
|
|
"step": 13430
|
|
},
|
|
{
|
|
"entropy": 1.629296875,
|
|
"epoch": 2.971586511885019,
|
|
"grad_norm": 4.543457508087158,
|
|
"learning_rate": 1.220608538611001e-09,
|
|
"loss": 1.6192,
|
|
"mean_token_accuracy": 0.590055701136589,
|
|
"num_tokens": 48494480.0,
|
|
"step": 13440
|
|
},
|
|
{
|
|
"entropy": 1.62109375,
|
|
"epoch": 2.9737976782752904,
|
|
"grad_norm": 3.783036947250366,
|
|
"learning_rate": 1.0400576662136785e-09,
|
|
"loss": 1.6149,
|
|
"mean_token_accuracy": 0.5959477007389069,
|
|
"num_tokens": 48530581.0,
|
|
"step": 13450
|
|
},
|
|
{
|
|
"entropy": 1.632421875,
|
|
"epoch": 2.976008844665561,
|
|
"grad_norm": 3.462634325027466,
|
|
"learning_rate": 8.739470239585435e-10,
|
|
"loss": 1.6192,
|
|
"mean_token_accuracy": 0.5971563220024109,
|
|
"num_tokens": 48567743.0,
|
|
"step": 13460
|
|
},
|
|
{
|
|
"entropy": 1.6265625,
|
|
"epoch": 2.978220011055832,
|
|
"grad_norm": 3.638840675354004,
|
|
"learning_rate": 7.222775717152797e-10,
|
|
"loss": 1.6259,
|
|
"mean_token_accuracy": 0.5975542217493057,
|
|
"num_tokens": 48602732.0,
|
|
"step": 13470
|
|
},
|
|
{
|
|
"entropy": 1.62890625,
|
|
"epoch": 2.980431177446103,
|
|
"grad_norm": 3.9042389392852783,
|
|
"learning_rate": 5.850501859053226e-10,
|
|
"loss": 1.623,
|
|
"mean_token_accuracy": 0.5939550846815109,
|
|
"num_tokens": 48637869.0,
|
|
"step": 13480
|
|
},
|
|
{
|
|
"entropy": 1.65859375,
|
|
"epoch": 2.982642343836374,
|
|
"grad_norm": 4.407820224761963,
|
|
"learning_rate": 4.622656594963082e-10,
|
|
"loss": 1.6407,
|
|
"mean_token_accuracy": 0.5933983951807023,
|
|
"num_tokens": 48675870.0,
|
|
"step": 13490
|
|
},
|
|
{
|
|
"entropy": 1.686328125,
|
|
"epoch": 2.9848535102266447,
|
|
"grad_norm": 4.5784220695495605,
|
|
"learning_rate": 3.5392470199846485e-10,
|
|
"loss": 1.6782,
|
|
"mean_token_accuracy": 0.586545991897583,
|
|
"num_tokens": 48713006.0,
|
|
"step": 13500
|
|
},
|
|
{
|
|
"epoch": 2.9848535102266447,
|
|
"eval_entropy": 1.6848491915422885,
|
|
"eval_loss": 1.7765321731567383,
|
|
"eval_mean_token_accuracy": 0.5679252127509805,
|
|
"eval_num_tokens": 48713006.0,
|
|
"eval_runtime": 112.2177,
|
|
"eval_samples_per_second": 143.293,
|
|
"eval_steps_per_second": 8.956,
|
|
"step": 13500
|
|
}
|
|
],
|
|
"logging_steps": 10,
|
|
"max_steps": 13569,
|
|
"num_input_tokens_seen": 0,
|
|
"num_train_epochs": 3,
|
|
"save_steps": 500,
|
|
"stateful_callbacks": {
|
|
"TrainerControl": {
|
|
"args": {
|
|
"should_epoch_stop": false,
|
|
"should_evaluate": false,
|
|
"should_log": false,
|
|
"should_save": true,
|
|
"should_training_stop": false
|
|
},
|
|
"attributes": {}
|
|
}
|
|
},
|
|
"total_flos": 3.530587961022218e+17,
|
|
"train_batch_size": 16,
|
|
"trial_name": null,
|
|
"trial_params": null
|
|
}
|