1035 lines
27 KiB
JSON
1035 lines
27 KiB
JSON
{
|
|
"best_global_step": null,
|
|
"best_metric": null,
|
|
"best_model_checkpoint": null,
|
|
"epoch": 0.027977506085107573,
|
|
"eval_steps": 500,
|
|
"global_step": 500,
|
|
"is_hyper_param_search": false,
|
|
"is_local_process_zero": true,
|
|
"is_world_process_zero": true,
|
|
"log_history": [
|
|
{
|
|
"entropy": 10.691505527496338,
|
|
"epoch": 0.0002797750608510757,
|
|
"grad_norm": 12.375,
|
|
"learning_rate": 2e-06,
|
|
"loss": 10.7862,
|
|
"mean_token_accuracy": 0.0,
|
|
"num_tokens": 9833.0,
|
|
"step": 5
|
|
},
|
|
{
|
|
"entropy": 10.691538619995118,
|
|
"epoch": 0.0005595501217021514,
|
|
"grad_norm": 13.0,
|
|
"learning_rate": 4.5e-06,
|
|
"loss": 10.7246,
|
|
"mean_token_accuracy": 0.0,
|
|
"num_tokens": 19666.0,
|
|
"step": 10
|
|
},
|
|
{
|
|
"entropy": 10.691145992279052,
|
|
"epoch": 0.0008393251825532272,
|
|
"grad_norm": 9.3125,
|
|
"learning_rate": 7e-06,
|
|
"loss": 10.4747,
|
|
"mean_token_accuracy": 0.019643833697773515,
|
|
"num_tokens": 28771.0,
|
|
"step": 15
|
|
},
|
|
{
|
|
"entropy": 10.682477760314942,
|
|
"epoch": 0.0011191002434043028,
|
|
"grad_norm": 6.21875,
|
|
"learning_rate": 9.5e-06,
|
|
"loss": 10.1639,
|
|
"mean_token_accuracy": 0.04193656481802464,
|
|
"num_tokens": 38625.0,
|
|
"step": 20
|
|
},
|
|
{
|
|
"entropy": 10.617809772491455,
|
|
"epoch": 0.0013988753042553786,
|
|
"grad_norm": 4.09375,
|
|
"learning_rate": 1.2e-05,
|
|
"loss": 9.8606,
|
|
"mean_token_accuracy": 0.04725950676947832,
|
|
"num_tokens": 47864.0,
|
|
"step": 25
|
|
},
|
|
{
|
|
"entropy": 10.55274839401245,
|
|
"epoch": 0.0016786503651064545,
|
|
"grad_norm": 3.421875,
|
|
"learning_rate": 1.4500000000000002e-05,
|
|
"loss": 9.6963,
|
|
"mean_token_accuracy": 0.04289307370781899,
|
|
"num_tokens": 55926.0,
|
|
"step": 30
|
|
},
|
|
{
|
|
"entropy": 10.584246730804443,
|
|
"epoch": 0.0019584254259575303,
|
|
"grad_norm": 3.078125,
|
|
"learning_rate": 1.7000000000000003e-05,
|
|
"loss": 9.6414,
|
|
"mean_token_accuracy": 0.044558577984571454,
|
|
"num_tokens": 64915.0,
|
|
"step": 35
|
|
},
|
|
{
|
|
"entropy": 10.56161117553711,
|
|
"epoch": 0.0022382004868086057,
|
|
"grad_norm": 2.65625,
|
|
"learning_rate": 1.95e-05,
|
|
"loss": 9.6116,
|
|
"mean_token_accuracy": 0.041977206617593764,
|
|
"num_tokens": 73813.0,
|
|
"step": 40
|
|
},
|
|
{
|
|
"entropy": 10.549141788482666,
|
|
"epoch": 0.0025179755476596815,
|
|
"grad_norm": 2.421875,
|
|
"learning_rate": 2.2e-05,
|
|
"loss": 9.5772,
|
|
"mean_token_accuracy": 0.04488353617489338,
|
|
"num_tokens": 83706.0,
|
|
"step": 45
|
|
},
|
|
{
|
|
"entropy": 10.555339050292968,
|
|
"epoch": 0.0027977506085107573,
|
|
"grad_norm": 2.53125,
|
|
"learning_rate": 2.4500000000000003e-05,
|
|
"loss": 9.5206,
|
|
"mean_token_accuracy": 0.041607250832021235,
|
|
"num_tokens": 92739.0,
|
|
"step": 50
|
|
},
|
|
{
|
|
"entropy": 10.562696361541748,
|
|
"epoch": 0.003077525669361833,
|
|
"grad_norm": 2.65625,
|
|
"learning_rate": 2.7e-05,
|
|
"loss": 9.4731,
|
|
"mean_token_accuracy": 0.04852877669036389,
|
|
"num_tokens": 101880.0,
|
|
"step": 55
|
|
},
|
|
{
|
|
"entropy": 10.513782119750976,
|
|
"epoch": 0.003357300730212909,
|
|
"grad_norm": 2.59375,
|
|
"learning_rate": 2.95e-05,
|
|
"loss": 9.4135,
|
|
"mean_token_accuracy": 0.05527102164924145,
|
|
"num_tokens": 111303.0,
|
|
"step": 60
|
|
},
|
|
{
|
|
"entropy": 10.410881614685058,
|
|
"epoch": 0.0036370757910639847,
|
|
"grad_norm": 2.578125,
|
|
"learning_rate": 3.2e-05,
|
|
"loss": 9.2608,
|
|
"mean_token_accuracy": 0.059278345108032225,
|
|
"num_tokens": 121022.0,
|
|
"step": 65
|
|
},
|
|
{
|
|
"entropy": 10.35908842086792,
|
|
"epoch": 0.0039168508519150606,
|
|
"grad_norm": 2.3125,
|
|
"learning_rate": 3.4500000000000005e-05,
|
|
"loss": 9.1931,
|
|
"mean_token_accuracy": 0.05288665182888508,
|
|
"num_tokens": 129764.0,
|
|
"step": 70
|
|
},
|
|
{
|
|
"entropy": 10.414530277252197,
|
|
"epoch": 0.004196625912766136,
|
|
"grad_norm": 2.671875,
|
|
"learning_rate": 3.7e-05,
|
|
"loss": 9.12,
|
|
"mean_token_accuracy": 0.05712716057896614,
|
|
"num_tokens": 139543.0,
|
|
"step": 75
|
|
},
|
|
{
|
|
"entropy": 10.420390224456787,
|
|
"epoch": 0.004476400973617211,
|
|
"grad_norm": 2.453125,
|
|
"learning_rate": 3.95e-05,
|
|
"loss": 9.0894,
|
|
"mean_token_accuracy": 0.055438223481178286,
|
|
"num_tokens": 148772.0,
|
|
"step": 80
|
|
},
|
|
{
|
|
"entropy": 10.439853763580322,
|
|
"epoch": 0.004756176034468288,
|
|
"grad_norm": 2.53125,
|
|
"learning_rate": 4.2000000000000004e-05,
|
|
"loss": 8.8746,
|
|
"mean_token_accuracy": 0.06480722092092037,
|
|
"num_tokens": 158786.0,
|
|
"step": 85
|
|
},
|
|
{
|
|
"entropy": 10.333017063140868,
|
|
"epoch": 0.005035951095319363,
|
|
"grad_norm": 2.46875,
|
|
"learning_rate": 4.45e-05,
|
|
"loss": 8.7978,
|
|
"mean_token_accuracy": 0.06817127540707588,
|
|
"num_tokens": 166989.0,
|
|
"step": 90
|
|
},
|
|
{
|
|
"entropy": 10.257375049591065,
|
|
"epoch": 0.005315726156170439,
|
|
"grad_norm": 2.421875,
|
|
"learning_rate": 4.7000000000000004e-05,
|
|
"loss": 8.6945,
|
|
"mean_token_accuracy": 0.06792460419237614,
|
|
"num_tokens": 175840.0,
|
|
"step": 95
|
|
},
|
|
{
|
|
"entropy": 10.24816074371338,
|
|
"epoch": 0.005595501217021515,
|
|
"grad_norm": 2.484375,
|
|
"learning_rate": 4.9500000000000004e-05,
|
|
"loss": 8.6247,
|
|
"mean_token_accuracy": 0.06662830822169781,
|
|
"num_tokens": 185375.0,
|
|
"step": 100
|
|
},
|
|
{
|
|
"entropy": 10.16532497406006,
|
|
"epoch": 0.005875276277872591,
|
|
"grad_norm": 2.125,
|
|
"learning_rate": 5.2e-05,
|
|
"loss": 8.5206,
|
|
"mean_token_accuracy": 0.07044463530182839,
|
|
"num_tokens": 194647.0,
|
|
"step": 105
|
|
},
|
|
{
|
|
"entropy": 10.170048713684082,
|
|
"epoch": 0.006155051338723666,
|
|
"grad_norm": 2.421875,
|
|
"learning_rate": 5.45e-05,
|
|
"loss": 8.4143,
|
|
"mean_token_accuracy": 0.07247264273464679,
|
|
"num_tokens": 203882.0,
|
|
"step": 110
|
|
},
|
|
{
|
|
"entropy": 10.117275524139405,
|
|
"epoch": 0.006434826399574742,
|
|
"grad_norm": 2.796875,
|
|
"learning_rate": 5.7e-05,
|
|
"loss": 8.2929,
|
|
"mean_token_accuracy": 0.06882111690938472,
|
|
"num_tokens": 212641.0,
|
|
"step": 115
|
|
},
|
|
{
|
|
"entropy": 10.047082424163818,
|
|
"epoch": 0.006714601460425818,
|
|
"grad_norm": 2.125,
|
|
"learning_rate": 5.9499999999999996e-05,
|
|
"loss": 8.1784,
|
|
"mean_token_accuracy": 0.07864802330732346,
|
|
"num_tokens": 221668.0,
|
|
"step": 120
|
|
},
|
|
{
|
|
"entropy": 9.896892261505126,
|
|
"epoch": 0.006994376521276893,
|
|
"grad_norm": 2.390625,
|
|
"learning_rate": 6.2e-05,
|
|
"loss": 8.0655,
|
|
"mean_token_accuracy": 0.07759866937994957,
|
|
"num_tokens": 230277.0,
|
|
"step": 125
|
|
},
|
|
{
|
|
"entropy": 9.822550010681152,
|
|
"epoch": 0.0072741515821279695,
|
|
"grad_norm": 1.8125,
|
|
"learning_rate": 6.450000000000001e-05,
|
|
"loss": 7.9853,
|
|
"mean_token_accuracy": 0.07847488112747669,
|
|
"num_tokens": 240191.0,
|
|
"step": 130
|
|
},
|
|
{
|
|
"entropy": 9.653499507904053,
|
|
"epoch": 0.007553926642979045,
|
|
"grad_norm": 2.40625,
|
|
"learning_rate": 6.7e-05,
|
|
"loss": 7.8597,
|
|
"mean_token_accuracy": 0.08022317960858345,
|
|
"num_tokens": 249600.0,
|
|
"step": 135
|
|
},
|
|
{
|
|
"entropy": 9.487109375,
|
|
"epoch": 0.007833701703830121,
|
|
"grad_norm": 1.96875,
|
|
"learning_rate": 6.950000000000001e-05,
|
|
"loss": 7.7858,
|
|
"mean_token_accuracy": 0.07919244170188904,
|
|
"num_tokens": 258766.0,
|
|
"step": 140
|
|
},
|
|
{
|
|
"entropy": 9.301309394836426,
|
|
"epoch": 0.008113476764681197,
|
|
"grad_norm": 1.84375,
|
|
"learning_rate": 7.2e-05,
|
|
"loss": 7.5919,
|
|
"mean_token_accuracy": 0.08380925506353379,
|
|
"num_tokens": 268399.0,
|
|
"step": 145
|
|
},
|
|
{
|
|
"entropy": 9.010336112976074,
|
|
"epoch": 0.008393251825532272,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 7.45e-05,
|
|
"loss": 7.5475,
|
|
"mean_token_accuracy": 0.08445582017302514,
|
|
"num_tokens": 278348.0,
|
|
"step": 150
|
|
},
|
|
{
|
|
"entropy": 8.899579620361328,
|
|
"epoch": 0.008673026886383347,
|
|
"grad_norm": 1.7265625,
|
|
"learning_rate": 7.7e-05,
|
|
"loss": 7.5228,
|
|
"mean_token_accuracy": 0.07803246155381202,
|
|
"num_tokens": 288429.0,
|
|
"step": 155
|
|
},
|
|
{
|
|
"entropy": 8.617181396484375,
|
|
"epoch": 0.008952801947234423,
|
|
"grad_norm": 1.5078125,
|
|
"learning_rate": 7.950000000000001e-05,
|
|
"loss": 7.319,
|
|
"mean_token_accuracy": 0.09034765139222145,
|
|
"num_tokens": 297936.0,
|
|
"step": 160
|
|
},
|
|
{
|
|
"entropy": 8.410243892669678,
|
|
"epoch": 0.0092325770080855,
|
|
"grad_norm": 1.6640625,
|
|
"learning_rate": 8.2e-05,
|
|
"loss": 7.3897,
|
|
"mean_token_accuracy": 0.08498694151639938,
|
|
"num_tokens": 307390.0,
|
|
"step": 165
|
|
},
|
|
{
|
|
"entropy": 8.320203971862792,
|
|
"epoch": 0.009512352068936575,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 8.450000000000001e-05,
|
|
"loss": 7.3416,
|
|
"mean_token_accuracy": 0.07727829068899154,
|
|
"num_tokens": 316381.0,
|
|
"step": 170
|
|
},
|
|
{
|
|
"entropy": 8.236638164520263,
|
|
"epoch": 0.00979212712978765,
|
|
"grad_norm": 1.96875,
|
|
"learning_rate": 8.7e-05,
|
|
"loss": 7.3116,
|
|
"mean_token_accuracy": 0.07726738080382348,
|
|
"num_tokens": 325086.0,
|
|
"step": 175
|
|
},
|
|
{
|
|
"entropy": 8.076795291900634,
|
|
"epoch": 0.010071902190638726,
|
|
"grad_norm": 1.5546875,
|
|
"learning_rate": 8.95e-05,
|
|
"loss": 7.1784,
|
|
"mean_token_accuracy": 0.08438889384269714,
|
|
"num_tokens": 334438.0,
|
|
"step": 180
|
|
},
|
|
{
|
|
"entropy": 7.889586877822876,
|
|
"epoch": 0.010351677251489803,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 9.2e-05,
|
|
"loss": 7.1976,
|
|
"mean_token_accuracy": 0.0870728187263012,
|
|
"num_tokens": 343169.0,
|
|
"step": 185
|
|
},
|
|
{
|
|
"entropy": 7.912118721008301,
|
|
"epoch": 0.010631452312340878,
|
|
"grad_norm": 1.734375,
|
|
"learning_rate": 9.45e-05,
|
|
"loss": 7.126,
|
|
"mean_token_accuracy": 0.08688639178872108,
|
|
"num_tokens": 352260.0,
|
|
"step": 190
|
|
},
|
|
{
|
|
"entropy": 7.820125246047974,
|
|
"epoch": 0.010911227373191954,
|
|
"grad_norm": 1.6796875,
|
|
"learning_rate": 9.7e-05,
|
|
"loss": 7.0827,
|
|
"mean_token_accuracy": 0.08836827799677849,
|
|
"num_tokens": 361436.0,
|
|
"step": 195
|
|
},
|
|
{
|
|
"entropy": 7.675041007995605,
|
|
"epoch": 0.01119100243404303,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 9.95e-05,
|
|
"loss": 7.1613,
|
|
"mean_token_accuracy": 0.09058133289217948,
|
|
"num_tokens": 370232.0,
|
|
"step": 200
|
|
},
|
|
{
|
|
"entropy": 7.803629922866821,
|
|
"epoch": 0.011470777494894105,
|
|
"grad_norm": 1.5234375,
|
|
"learning_rate": 0.000102,
|
|
"loss": 7.1257,
|
|
"mean_token_accuracy": 0.0905453845858574,
|
|
"num_tokens": 380211.0,
|
|
"step": 205
|
|
},
|
|
{
|
|
"entropy": 7.76220006942749,
|
|
"epoch": 0.011750552555745182,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 0.00010449999999999999,
|
|
"loss": 7.1154,
|
|
"mean_token_accuracy": 0.08261686339974403,
|
|
"num_tokens": 390089.0,
|
|
"step": 210
|
|
},
|
|
{
|
|
"entropy": 7.6790376663208,
|
|
"epoch": 0.012030327616596257,
|
|
"grad_norm": 1.734375,
|
|
"learning_rate": 0.000107,
|
|
"loss": 7.0364,
|
|
"mean_token_accuracy": 0.08655178025364876,
|
|
"num_tokens": 398513.0,
|
|
"step": 215
|
|
},
|
|
{
|
|
"entropy": 7.6753379821777346,
|
|
"epoch": 0.012310102677447332,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.0001095,
|
|
"loss": 7.1785,
|
|
"mean_token_accuracy": 0.08271857276558876,
|
|
"num_tokens": 408114.0,
|
|
"step": 220
|
|
},
|
|
{
|
|
"entropy": 7.658677101135254,
|
|
"epoch": 0.012589877738298408,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.000112,
|
|
"loss": 7.0324,
|
|
"mean_token_accuracy": 0.08730659186840058,
|
|
"num_tokens": 417680.0,
|
|
"step": 225
|
|
},
|
|
{
|
|
"entropy": 7.590711975097657,
|
|
"epoch": 0.012869652799149483,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0001145,
|
|
"loss": 6.94,
|
|
"mean_token_accuracy": 0.0981583096086979,
|
|
"num_tokens": 426056.0,
|
|
"step": 230
|
|
},
|
|
{
|
|
"entropy": 7.538638401031494,
|
|
"epoch": 0.01314942786000056,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.00011700000000000001,
|
|
"loss": 6.8994,
|
|
"mean_token_accuracy": 0.09497818350791931,
|
|
"num_tokens": 435465.0,
|
|
"step": 235
|
|
},
|
|
{
|
|
"entropy": 7.547599267959595,
|
|
"epoch": 0.013429202920851636,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00011949999999999999,
|
|
"loss": 6.9882,
|
|
"mean_token_accuracy": 0.09514376819133759,
|
|
"num_tokens": 444295.0,
|
|
"step": 240
|
|
},
|
|
{
|
|
"entropy": 7.532002258300781,
|
|
"epoch": 0.013708977981702711,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.000122,
|
|
"loss": 6.9084,
|
|
"mean_token_accuracy": 0.09089445620775223,
|
|
"num_tokens": 453111.0,
|
|
"step": 245
|
|
},
|
|
{
|
|
"entropy": 7.416005039215088,
|
|
"epoch": 0.013988753042553786,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0001245,
|
|
"loss": 6.8671,
|
|
"mean_token_accuracy": 0.09376973509788514,
|
|
"num_tokens": 462438.0,
|
|
"step": 250
|
|
},
|
|
{
|
|
"entropy": 7.44201397895813,
|
|
"epoch": 0.014268528103404862,
|
|
"grad_norm": 1.5234375,
|
|
"learning_rate": 0.000127,
|
|
"loss": 6.8518,
|
|
"mean_token_accuracy": 0.0919196330010891,
|
|
"num_tokens": 471610.0,
|
|
"step": 255
|
|
},
|
|
{
|
|
"entropy": 7.486415004730224,
|
|
"epoch": 0.014548303164255939,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.0001295,
|
|
"loss": 6.9342,
|
|
"mean_token_accuracy": 0.09321872368454934,
|
|
"num_tokens": 480849.0,
|
|
"step": 260
|
|
},
|
|
{
|
|
"entropy": 7.40749454498291,
|
|
"epoch": 0.014828078225107014,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.000132,
|
|
"loss": 6.9376,
|
|
"mean_token_accuracy": 0.08951603546738625,
|
|
"num_tokens": 489756.0,
|
|
"step": 265
|
|
},
|
|
{
|
|
"entropy": 7.461516523361206,
|
|
"epoch": 0.01510785328595809,
|
|
"grad_norm": 1.734375,
|
|
"learning_rate": 0.00013450000000000002,
|
|
"loss": 6.9217,
|
|
"mean_token_accuracy": 0.09437951892614364,
|
|
"num_tokens": 498818.0,
|
|
"step": 270
|
|
},
|
|
{
|
|
"entropy": 7.285744953155517,
|
|
"epoch": 0.015387628346809165,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00013700000000000002,
|
|
"loss": 6.8458,
|
|
"mean_token_accuracy": 0.09555465653538704,
|
|
"num_tokens": 508508.0,
|
|
"step": 275
|
|
},
|
|
{
|
|
"entropy": 7.444489002227783,
|
|
"epoch": 0.015667403407660242,
|
|
"grad_norm": 1.5078125,
|
|
"learning_rate": 0.0001395,
|
|
"loss": 7.0025,
|
|
"mean_token_accuracy": 0.09034469872713088,
|
|
"num_tokens": 518257.0,
|
|
"step": 280
|
|
},
|
|
{
|
|
"entropy": 7.36638994216919,
|
|
"epoch": 0.015947178468511316,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.00014199999999999998,
|
|
"loss": 6.9625,
|
|
"mean_token_accuracy": 0.08916445821523666,
|
|
"num_tokens": 527811.0,
|
|
"step": 285
|
|
},
|
|
{
|
|
"entropy": 7.358241605758667,
|
|
"epoch": 0.016226953529362393,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 0.0001445,
|
|
"loss": 6.8297,
|
|
"mean_token_accuracy": 0.09337828531861306,
|
|
"num_tokens": 536991.0,
|
|
"step": 290
|
|
},
|
|
{
|
|
"entropy": 7.320535326004029,
|
|
"epoch": 0.016506728590213467,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.000147,
|
|
"loss": 6.9245,
|
|
"mean_token_accuracy": 0.0914350025355816,
|
|
"num_tokens": 546498.0,
|
|
"step": 295
|
|
},
|
|
{
|
|
"entropy": 7.351836109161377,
|
|
"epoch": 0.016786503651064544,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0001495,
|
|
"loss": 6.8809,
|
|
"mean_token_accuracy": 0.09436944723129273,
|
|
"num_tokens": 556022.0,
|
|
"step": 300
|
|
},
|
|
{
|
|
"entropy": 7.289101552963257,
|
|
"epoch": 0.01706627871191562,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.000152,
|
|
"loss": 6.8212,
|
|
"mean_token_accuracy": 0.09640712589025498,
|
|
"num_tokens": 565392.0,
|
|
"step": 305
|
|
},
|
|
{
|
|
"entropy": 7.230247545242309,
|
|
"epoch": 0.017346053772766695,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.00015450000000000001,
|
|
"loss": 6.8043,
|
|
"mean_token_accuracy": 0.09431554824113846,
|
|
"num_tokens": 574485.0,
|
|
"step": 310
|
|
},
|
|
{
|
|
"entropy": 7.3728536605834964,
|
|
"epoch": 0.01762582883361777,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.000157,
|
|
"loss": 6.8343,
|
|
"mean_token_accuracy": 0.09452549517154693,
|
|
"num_tokens": 583149.0,
|
|
"step": 315
|
|
},
|
|
{
|
|
"entropy": 7.280808210372925,
|
|
"epoch": 0.017905603894468845,
|
|
"grad_norm": 1.5234375,
|
|
"learning_rate": 0.0001595,
|
|
"loss": 6.8855,
|
|
"mean_token_accuracy": 0.09358676373958588,
|
|
"num_tokens": 592876.0,
|
|
"step": 320
|
|
},
|
|
{
|
|
"entropy": 7.064757013320923,
|
|
"epoch": 0.018185378955319922,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.000162,
|
|
"loss": 6.6685,
|
|
"mean_token_accuracy": 0.09988230094313622,
|
|
"num_tokens": 602001.0,
|
|
"step": 325
|
|
},
|
|
{
|
|
"entropy": 7.323857975006104,
|
|
"epoch": 0.018465154016171,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 0.00016450000000000001,
|
|
"loss": 6.8667,
|
|
"mean_token_accuracy": 0.09093789532780647,
|
|
"num_tokens": 611602.0,
|
|
"step": 330
|
|
},
|
|
{
|
|
"entropy": 7.089147615432739,
|
|
"epoch": 0.018744929077022073,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.00016700000000000002,
|
|
"loss": 6.7506,
|
|
"mean_token_accuracy": 0.09642454162240029,
|
|
"num_tokens": 620905.0,
|
|
"step": 335
|
|
},
|
|
{
|
|
"entropy": 7.273478889465332,
|
|
"epoch": 0.01902470413787315,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00016950000000000003,
|
|
"loss": 6.8279,
|
|
"mean_token_accuracy": 0.0952286258339882,
|
|
"num_tokens": 630151.0,
|
|
"step": 340
|
|
},
|
|
{
|
|
"entropy": 7.070547962188721,
|
|
"epoch": 0.019304479198724227,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00017199999999999998,
|
|
"loss": 6.7905,
|
|
"mean_token_accuracy": 0.09692409187555313,
|
|
"num_tokens": 639864.0,
|
|
"step": 345
|
|
},
|
|
{
|
|
"entropy": 7.4187744140625,
|
|
"epoch": 0.0195842542595753,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.00017449999999999999,
|
|
"loss": 6.8707,
|
|
"mean_token_accuracy": 0.09315617531538009,
|
|
"num_tokens": 648819.0,
|
|
"step": 350
|
|
},
|
|
{
|
|
"entropy": 7.169836378097534,
|
|
"epoch": 0.019864029320426378,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.000177,
|
|
"loss": 6.8027,
|
|
"mean_token_accuracy": 0.09456639736890793,
|
|
"num_tokens": 658438.0,
|
|
"step": 355
|
|
},
|
|
{
|
|
"entropy": 7.143348264694214,
|
|
"epoch": 0.020143804381277452,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0001795,
|
|
"loss": 6.7459,
|
|
"mean_token_accuracy": 0.09843514785170555,
|
|
"num_tokens": 668140.0,
|
|
"step": 360
|
|
},
|
|
{
|
|
"entropy": 7.207337665557861,
|
|
"epoch": 0.02042357944212853,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.000182,
|
|
"loss": 6.7733,
|
|
"mean_token_accuracy": 0.09692016914486885,
|
|
"num_tokens": 677505.0,
|
|
"step": 365
|
|
},
|
|
{
|
|
"entropy": 7.047050952911377,
|
|
"epoch": 0.020703354502979606,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0001845,
|
|
"loss": 6.7596,
|
|
"mean_token_accuracy": 0.09099765941500663,
|
|
"num_tokens": 687911.0,
|
|
"step": 370
|
|
},
|
|
{
|
|
"entropy": 7.110365295410157,
|
|
"epoch": 0.02098312956383068,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.000187,
|
|
"loss": 6.7002,
|
|
"mean_token_accuracy": 0.10557077825069427,
|
|
"num_tokens": 696565.0,
|
|
"step": 375
|
|
},
|
|
{
|
|
"entropy": 7.068933725357056,
|
|
"epoch": 0.021262904624681757,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0001895,
|
|
"loss": 6.6321,
|
|
"mean_token_accuracy": 0.09727629125118256,
|
|
"num_tokens": 704918.0,
|
|
"step": 380
|
|
},
|
|
{
|
|
"entropy": 7.053268480300903,
|
|
"epoch": 0.02154267968553283,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.000192,
|
|
"loss": 6.6612,
|
|
"mean_token_accuracy": 0.1000488631427288,
|
|
"num_tokens": 716172.0,
|
|
"step": 385
|
|
},
|
|
{
|
|
"entropy": 7.058245515823364,
|
|
"epoch": 0.021822454746383908,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.0001945,
|
|
"loss": 6.6344,
|
|
"mean_token_accuracy": 0.10481962487101555,
|
|
"num_tokens": 725075.0,
|
|
"step": 390
|
|
},
|
|
{
|
|
"entropy": 7.085121202468872,
|
|
"epoch": 0.022102229807234985,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 0.00019700000000000002,
|
|
"loss": 6.7861,
|
|
"mean_token_accuracy": 0.09666902050375939,
|
|
"num_tokens": 733314.0,
|
|
"step": 395
|
|
},
|
|
{
|
|
"entropy": 7.137383270263672,
|
|
"epoch": 0.02238200486808606,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.00019950000000000002,
|
|
"loss": 6.6717,
|
|
"mean_token_accuracy": 0.10260491818189621,
|
|
"num_tokens": 742390.0,
|
|
"step": 400
|
|
},
|
|
{
|
|
"entropy": 6.997572708129883,
|
|
"epoch": 0.022661779928937135,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.000202,
|
|
"loss": 6.7582,
|
|
"mean_token_accuracy": 0.09590908735990525,
|
|
"num_tokens": 751464.0,
|
|
"step": 405
|
|
},
|
|
{
|
|
"entropy": 7.058079195022583,
|
|
"epoch": 0.02294155498978821,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.00020449999999999998,
|
|
"loss": 6.6488,
|
|
"mean_token_accuracy": 0.10047566667199134,
|
|
"num_tokens": 760746.0,
|
|
"step": 410
|
|
},
|
|
{
|
|
"entropy": 6.995281791687011,
|
|
"epoch": 0.023221330050639286,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.000207,
|
|
"loss": 6.5617,
|
|
"mean_token_accuracy": 0.10464712381362914,
|
|
"num_tokens": 769052.0,
|
|
"step": 415
|
|
},
|
|
{
|
|
"entropy": 6.989618110656738,
|
|
"epoch": 0.023501105111490363,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0002095,
|
|
"loss": 6.7826,
|
|
"mean_token_accuracy": 0.09742124751210213,
|
|
"num_tokens": 778660.0,
|
|
"step": 420
|
|
},
|
|
{
|
|
"entropy": 7.074799585342407,
|
|
"epoch": 0.023780880172341437,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.000212,
|
|
"loss": 6.6877,
|
|
"mean_token_accuracy": 0.10435819402337074,
|
|
"num_tokens": 787841.0,
|
|
"step": 425
|
|
},
|
|
{
|
|
"entropy": 6.878971099853516,
|
|
"epoch": 0.024060655233192514,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0002145,
|
|
"loss": 6.537,
|
|
"mean_token_accuracy": 0.10397473350167274,
|
|
"num_tokens": 796175.0,
|
|
"step": 430
|
|
},
|
|
{
|
|
"entropy": 6.980287361145019,
|
|
"epoch": 0.024340430294043588,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.00021700000000000002,
|
|
"loss": 6.5959,
|
|
"mean_token_accuracy": 0.10773405581712722,
|
|
"num_tokens": 805941.0,
|
|
"step": 435
|
|
},
|
|
{
|
|
"entropy": 6.9006028175354,
|
|
"epoch": 0.024620205354894665,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0002195,
|
|
"loss": 6.6389,
|
|
"mean_token_accuracy": 0.09920870438218117,
|
|
"num_tokens": 815058.0,
|
|
"step": 440
|
|
},
|
|
{
|
|
"entropy": 7.100294494628907,
|
|
"epoch": 0.024899980415745742,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.000222,
|
|
"loss": 6.6593,
|
|
"mean_token_accuracy": 0.10117991864681244,
|
|
"num_tokens": 824459.0,
|
|
"step": 445
|
|
},
|
|
{
|
|
"entropy": 6.872482252120972,
|
|
"epoch": 0.025179755476596816,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0002245,
|
|
"loss": 6.656,
|
|
"mean_token_accuracy": 0.10260392725467682,
|
|
"num_tokens": 835250.0,
|
|
"step": 450
|
|
},
|
|
{
|
|
"entropy": 6.986909580230713,
|
|
"epoch": 0.025459530537447893,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00022700000000000002,
|
|
"loss": 6.6617,
|
|
"mean_token_accuracy": 0.10458940342068672,
|
|
"num_tokens": 844643.0,
|
|
"step": 455
|
|
},
|
|
{
|
|
"entropy": 6.96947169303894,
|
|
"epoch": 0.025739305598298966,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00022950000000000002,
|
|
"loss": 6.5977,
|
|
"mean_token_accuracy": 0.10226123109459877,
|
|
"num_tokens": 853375.0,
|
|
"step": 460
|
|
},
|
|
{
|
|
"entropy": 6.875414848327637,
|
|
"epoch": 0.026019080659150044,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00023200000000000003,
|
|
"loss": 6.5253,
|
|
"mean_token_accuracy": 0.11177821755409241,
|
|
"num_tokens": 862244.0,
|
|
"step": 465
|
|
},
|
|
{
|
|
"entropy": 6.945923662185669,
|
|
"epoch": 0.02629885572000112,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.00023449999999999998,
|
|
"loss": 6.6286,
|
|
"mean_token_accuracy": 0.09996586814522743,
|
|
"num_tokens": 871828.0,
|
|
"step": 470
|
|
},
|
|
{
|
|
"entropy": 6.8525604724884035,
|
|
"epoch": 0.026578630780852194,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.000237,
|
|
"loss": 6.6076,
|
|
"mean_token_accuracy": 0.10374173521995544,
|
|
"num_tokens": 881087.0,
|
|
"step": 475
|
|
},
|
|
{
|
|
"entropy": 6.889187860488891,
|
|
"epoch": 0.02685840584170327,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0002395,
|
|
"loss": 6.6779,
|
|
"mean_token_accuracy": 0.10589562878012657,
|
|
"num_tokens": 890061.0,
|
|
"step": 480
|
|
},
|
|
{
|
|
"entropy": 7.009466075897217,
|
|
"epoch": 0.027138180902554345,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.000242,
|
|
"loss": 6.6192,
|
|
"mean_token_accuracy": 0.10268636345863343,
|
|
"num_tokens": 899388.0,
|
|
"step": 485
|
|
},
|
|
{
|
|
"entropy": 6.763098287582397,
|
|
"epoch": 0.027417955963405422,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0002445,
|
|
"loss": 6.5255,
|
|
"mean_token_accuracy": 0.10589060559868813,
|
|
"num_tokens": 908295.0,
|
|
"step": 490
|
|
},
|
|
{
|
|
"entropy": 6.7688929557800295,
|
|
"epoch": 0.0276977310242565,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.000247,
|
|
"loss": 6.4924,
|
|
"mean_token_accuracy": 0.10882084742188454,
|
|
"num_tokens": 917514.0,
|
|
"step": 495
|
|
},
|
|
{
|
|
"entropy": 6.904528284072876,
|
|
"epoch": 0.027977506085107573,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0002495,
|
|
"loss": 6.5978,
|
|
"mean_token_accuracy": 0.10768755748867989,
|
|
"num_tokens": 927146.0,
|
|
"step": 500
|
|
}
|
|
],
|
|
"logging_steps": 5,
|
|
"max_steps": 4000,
|
|
"num_input_tokens_seen": 0,
|
|
"num_train_epochs": 1,
|
|
"save_steps": 500,
|
|
"stateful_callbacks": {
|
|
"TrainerControl": {
|
|
"args": {
|
|
"should_epoch_stop": false,
|
|
"should_evaluate": false,
|
|
"should_log": false,
|
|
"should_save": true,
|
|
"should_training_stop": false
|
|
},
|
|
"attributes": {}
|
|
}
|
|
},
|
|
"total_flos": 1367316707328000.0,
|
|
"train_batch_size": 16,
|
|
"trial_name": null,
|
|
"trial_params": null
|
|
}
|