Model: fpadovani/eng-latn-100mb-after-ppt-Dp-10mb-ckpt500_seed455 Source: Original Platform
2046 lines
54 KiB
JSON
2046 lines
54 KiB
JSON
{
|
|
"best_global_step": null,
|
|
"best_metric": null,
|
|
"best_model_checkpoint": null,
|
|
"epoch": 1.0811249323958896,
|
|
"eval_steps": 1000,
|
|
"global_step": 1000,
|
|
"is_hyper_param_search": false,
|
|
"is_local_process_zero": true,
|
|
"is_world_process_zero": true,
|
|
"log_history": [
|
|
{
|
|
"entropy": 6.745217990875244,
|
|
"epoch": 0.005408328826392645,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 2e-06,
|
|
"loss": 6.4399,
|
|
"mean_token_accuracy": 0.12539481073617936,
|
|
"num_tokens": 9564.0,
|
|
"step": 5
|
|
},
|
|
{
|
|
"entropy": 6.7341703414917,
|
|
"epoch": 0.01081665765278529,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 4.5e-06,
|
|
"loss": 6.4966,
|
|
"mean_token_accuracy": 0.12570957243442535,
|
|
"num_tokens": 20265.0,
|
|
"step": 10
|
|
},
|
|
{
|
|
"entropy": 6.810567569732666,
|
|
"epoch": 0.016224986479177934,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 7e-06,
|
|
"loss": 6.6044,
|
|
"mean_token_accuracy": 0.12070711851119995,
|
|
"num_tokens": 30733.0,
|
|
"step": 15
|
|
},
|
|
{
|
|
"entropy": 6.691426467895508,
|
|
"epoch": 0.02163331530557058,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 9.5e-06,
|
|
"loss": 6.5463,
|
|
"mean_token_accuracy": 0.1250626839697361,
|
|
"num_tokens": 41633.0,
|
|
"step": 20
|
|
},
|
|
{
|
|
"entropy": 6.713900947570801,
|
|
"epoch": 0.02704164413196322,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 1.2e-05,
|
|
"loss": 6.6055,
|
|
"mean_token_accuracy": 0.12766451835632325,
|
|
"num_tokens": 53776.0,
|
|
"step": 25
|
|
},
|
|
{
|
|
"entropy": 6.794030284881591,
|
|
"epoch": 0.03244997295835587,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 1.4500000000000002e-05,
|
|
"loss": 6.55,
|
|
"mean_token_accuracy": 0.13146025240421294,
|
|
"num_tokens": 64936.0,
|
|
"step": 30
|
|
},
|
|
{
|
|
"entropy": 6.735936450958252,
|
|
"epoch": 0.03785830178474851,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 1.7000000000000003e-05,
|
|
"loss": 6.5551,
|
|
"mean_token_accuracy": 0.12577222511172295,
|
|
"num_tokens": 76664.0,
|
|
"step": 35
|
|
},
|
|
{
|
|
"entropy": 6.720685720443726,
|
|
"epoch": 0.04326663061114116,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 1.95e-05,
|
|
"loss": 6.4589,
|
|
"mean_token_accuracy": 0.12645927220582961,
|
|
"num_tokens": 87188.0,
|
|
"step": 40
|
|
},
|
|
{
|
|
"entropy": 6.770437097549438,
|
|
"epoch": 0.048674959437533805,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 2.2e-05,
|
|
"loss": 6.6097,
|
|
"mean_token_accuracy": 0.1324235811829567,
|
|
"num_tokens": 99337.0,
|
|
"step": 45
|
|
},
|
|
{
|
|
"entropy": 6.7956713199615475,
|
|
"epoch": 0.05408328826392644,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 2.4500000000000003e-05,
|
|
"loss": 6.5528,
|
|
"mean_token_accuracy": 0.1259615793824196,
|
|
"num_tokens": 110870.0,
|
|
"step": 50
|
|
},
|
|
{
|
|
"entropy": 6.821929407119751,
|
|
"epoch": 0.05949161709031909,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 2.7e-05,
|
|
"loss": 6.4581,
|
|
"mean_token_accuracy": 0.13586550429463387,
|
|
"num_tokens": 122183.0,
|
|
"step": 55
|
|
},
|
|
{
|
|
"entropy": 6.810019540786743,
|
|
"epoch": 0.06489994591671173,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 2.95e-05,
|
|
"loss": 6.471,
|
|
"mean_token_accuracy": 0.134011822193861,
|
|
"num_tokens": 133676.0,
|
|
"step": 60
|
|
},
|
|
{
|
|
"entropy": 6.7516721248626705,
|
|
"epoch": 0.07030827474310439,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 3.2e-05,
|
|
"loss": 6.5101,
|
|
"mean_token_accuracy": 0.13094406202435493,
|
|
"num_tokens": 144821.0,
|
|
"step": 65
|
|
},
|
|
{
|
|
"entropy": 6.73709626197815,
|
|
"epoch": 0.07571660356949703,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 3.4500000000000005e-05,
|
|
"loss": 6.4945,
|
|
"mean_token_accuracy": 0.13041364997625352,
|
|
"num_tokens": 156873.0,
|
|
"step": 70
|
|
},
|
|
{
|
|
"entropy": 6.649084663391113,
|
|
"epoch": 0.08112493239588967,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 3.7e-05,
|
|
"loss": 6.4459,
|
|
"mean_token_accuracy": 0.12853534668684005,
|
|
"num_tokens": 168794.0,
|
|
"step": 75
|
|
},
|
|
{
|
|
"entropy": 6.839602088928222,
|
|
"epoch": 0.08653326122228232,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 3.95e-05,
|
|
"loss": 6.603,
|
|
"mean_token_accuracy": 0.12388623431324959,
|
|
"num_tokens": 180756.0,
|
|
"step": 80
|
|
},
|
|
{
|
|
"entropy": 6.882611703872681,
|
|
"epoch": 0.09194159004867496,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 4.2000000000000004e-05,
|
|
"loss": 6.5729,
|
|
"mean_token_accuracy": 0.12938066497445105,
|
|
"num_tokens": 191127.0,
|
|
"step": 85
|
|
},
|
|
{
|
|
"entropy": 6.704812479019165,
|
|
"epoch": 0.09734991887506761,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 4.45e-05,
|
|
"loss": 6.455,
|
|
"mean_token_accuracy": 0.13043807074427605,
|
|
"num_tokens": 203352.0,
|
|
"step": 90
|
|
},
|
|
{
|
|
"entropy": 6.752549362182617,
|
|
"epoch": 0.10275824770146025,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 4.7000000000000004e-05,
|
|
"loss": 6.4423,
|
|
"mean_token_accuracy": 0.1375568687915802,
|
|
"num_tokens": 213810.0,
|
|
"step": 95
|
|
},
|
|
{
|
|
"entropy": 6.83305549621582,
|
|
"epoch": 0.10816657652785289,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 4.9500000000000004e-05,
|
|
"loss": 6.5476,
|
|
"mean_token_accuracy": 0.1357502222061157,
|
|
"num_tokens": 225310.0,
|
|
"step": 100
|
|
},
|
|
{
|
|
"entropy": 6.757467412948609,
|
|
"epoch": 0.11357490535424554,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 5.2e-05,
|
|
"loss": 6.3829,
|
|
"mean_token_accuracy": 0.13580593466758728,
|
|
"num_tokens": 236676.0,
|
|
"step": 105
|
|
},
|
|
{
|
|
"entropy": 6.749653005599976,
|
|
"epoch": 0.11898323418063818,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 5.45e-05,
|
|
"loss": 6.4842,
|
|
"mean_token_accuracy": 0.13619382083415985,
|
|
"num_tokens": 247453.0,
|
|
"step": 110
|
|
},
|
|
{
|
|
"entropy": 6.7436058044433596,
|
|
"epoch": 0.12439156300703083,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 5.7e-05,
|
|
"loss": 6.4908,
|
|
"mean_token_accuracy": 0.1296382687985897,
|
|
"num_tokens": 258267.0,
|
|
"step": 115
|
|
},
|
|
{
|
|
"entropy": 6.699334526062012,
|
|
"epoch": 0.12979989183342347,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 5.9499999999999996e-05,
|
|
"loss": 6.5306,
|
|
"mean_token_accuracy": 0.1270687237381935,
|
|
"num_tokens": 269839.0,
|
|
"step": 120
|
|
},
|
|
{
|
|
"entropy": 6.761990737915039,
|
|
"epoch": 0.1352082206598161,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 6.2e-05,
|
|
"loss": 6.5192,
|
|
"mean_token_accuracy": 0.13135910406708717,
|
|
"num_tokens": 281748.0,
|
|
"step": 125
|
|
},
|
|
{
|
|
"entropy": 6.810469007492065,
|
|
"epoch": 0.14061654948620878,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 6.450000000000001e-05,
|
|
"loss": 6.5302,
|
|
"mean_token_accuracy": 0.12570069655776023,
|
|
"num_tokens": 292592.0,
|
|
"step": 130
|
|
},
|
|
{
|
|
"entropy": 6.8416718482971195,
|
|
"epoch": 0.1460248783126014,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 6.7e-05,
|
|
"loss": 6.4401,
|
|
"mean_token_accuracy": 0.13145631179213524,
|
|
"num_tokens": 303122.0,
|
|
"step": 135
|
|
},
|
|
{
|
|
"entropy": 6.692539358139038,
|
|
"epoch": 0.15143320713899405,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 6.950000000000001e-05,
|
|
"loss": 6.3644,
|
|
"mean_token_accuracy": 0.13424549549818038,
|
|
"num_tokens": 314728.0,
|
|
"step": 140
|
|
},
|
|
{
|
|
"entropy": 6.719494438171386,
|
|
"epoch": 0.1568415359653867,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 7.2e-05,
|
|
"loss": 6.5632,
|
|
"mean_token_accuracy": 0.13301948606967925,
|
|
"num_tokens": 325292.0,
|
|
"step": 145
|
|
},
|
|
{
|
|
"entropy": 6.830582857131958,
|
|
"epoch": 0.16224986479177933,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 7.45e-05,
|
|
"loss": 6.5829,
|
|
"mean_token_accuracy": 0.1278594434261322,
|
|
"num_tokens": 336140.0,
|
|
"step": 150
|
|
},
|
|
{
|
|
"entropy": 6.741078948974609,
|
|
"epoch": 0.167658193618172,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 7.7e-05,
|
|
"loss": 6.4212,
|
|
"mean_token_accuracy": 0.13609526231884955,
|
|
"num_tokens": 346885.0,
|
|
"step": 155
|
|
},
|
|
{
|
|
"entropy": 6.667781114578247,
|
|
"epoch": 0.17306652244456464,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 7.950000000000001e-05,
|
|
"loss": 6.4422,
|
|
"mean_token_accuracy": 0.13269152715802193,
|
|
"num_tokens": 356630.0,
|
|
"step": 160
|
|
},
|
|
{
|
|
"entropy": 6.826272296905517,
|
|
"epoch": 0.17847485127095727,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 8.2e-05,
|
|
"loss": 6.4434,
|
|
"mean_token_accuracy": 0.13844147995114325,
|
|
"num_tokens": 366693.0,
|
|
"step": 165
|
|
},
|
|
{
|
|
"entropy": 6.623198461532593,
|
|
"epoch": 0.1838831800973499,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 8.450000000000001e-05,
|
|
"loss": 6.3919,
|
|
"mean_token_accuracy": 0.12981215193867685,
|
|
"num_tokens": 377779.0,
|
|
"step": 170
|
|
},
|
|
{
|
|
"entropy": 6.907767629623413,
|
|
"epoch": 0.18929150892374255,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 8.7e-05,
|
|
"loss": 6.5139,
|
|
"mean_token_accuracy": 0.1325360544025898,
|
|
"num_tokens": 388482.0,
|
|
"step": 175
|
|
},
|
|
{
|
|
"entropy": 6.72784013748169,
|
|
"epoch": 0.19469983775013522,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 8.95e-05,
|
|
"loss": 6.577,
|
|
"mean_token_accuracy": 0.13030516654253005,
|
|
"num_tokens": 400110.0,
|
|
"step": 180
|
|
},
|
|
{
|
|
"entropy": 6.742452812194824,
|
|
"epoch": 0.20010816657652786,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 9.2e-05,
|
|
"loss": 6.3125,
|
|
"mean_token_accuracy": 0.13682465478777886,
|
|
"num_tokens": 412535.0,
|
|
"step": 185
|
|
},
|
|
{
|
|
"entropy": 6.676760053634643,
|
|
"epoch": 0.2055164954029205,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 9.45e-05,
|
|
"loss": 6.4502,
|
|
"mean_token_accuracy": 0.13751535415649413,
|
|
"num_tokens": 424309.0,
|
|
"step": 190
|
|
},
|
|
{
|
|
"entropy": 6.74865140914917,
|
|
"epoch": 0.21092482422931313,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 9.7e-05,
|
|
"loss": 6.4565,
|
|
"mean_token_accuracy": 0.13581018298864364,
|
|
"num_tokens": 435592.0,
|
|
"step": 195
|
|
},
|
|
{
|
|
"entropy": 6.591330480575562,
|
|
"epoch": 0.21633315305570577,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 9.95e-05,
|
|
"loss": 6.3516,
|
|
"mean_token_accuracy": 0.1346059188246727,
|
|
"num_tokens": 446767.0,
|
|
"step": 200
|
|
},
|
|
{
|
|
"entropy": 6.724362230300903,
|
|
"epoch": 0.22174148188209844,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.000102,
|
|
"loss": 6.3719,
|
|
"mean_token_accuracy": 0.1348101980984211,
|
|
"num_tokens": 457959.0,
|
|
"step": 205
|
|
},
|
|
{
|
|
"entropy": 6.5875874042510985,
|
|
"epoch": 0.22714981070849108,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00010449999999999999,
|
|
"loss": 6.3364,
|
|
"mean_token_accuracy": 0.14194149523973465,
|
|
"num_tokens": 468107.0,
|
|
"step": 210
|
|
},
|
|
{
|
|
"entropy": 6.896349143981934,
|
|
"epoch": 0.23255813953488372,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.000107,
|
|
"loss": 6.5223,
|
|
"mean_token_accuracy": 0.13508757278323175,
|
|
"num_tokens": 478954.0,
|
|
"step": 215
|
|
},
|
|
{
|
|
"entropy": 6.597625112533569,
|
|
"epoch": 0.23796646836127636,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0001095,
|
|
"loss": 6.436,
|
|
"mean_token_accuracy": 0.12944695577025414,
|
|
"num_tokens": 490297.0,
|
|
"step": 220
|
|
},
|
|
{
|
|
"entropy": 6.734339427947998,
|
|
"epoch": 0.24337479718766902,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.000112,
|
|
"loss": 6.4306,
|
|
"mean_token_accuracy": 0.1379121758043766,
|
|
"num_tokens": 501597.0,
|
|
"step": 225
|
|
},
|
|
{
|
|
"entropy": 6.699416732788086,
|
|
"epoch": 0.24878312601406166,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0001145,
|
|
"loss": 6.4431,
|
|
"mean_token_accuracy": 0.13053352981805802,
|
|
"num_tokens": 514182.0,
|
|
"step": 230
|
|
},
|
|
{
|
|
"entropy": 6.637861156463623,
|
|
"epoch": 0.2541914548404543,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00011700000000000001,
|
|
"loss": 6.3907,
|
|
"mean_token_accuracy": 0.1391088232398033,
|
|
"num_tokens": 525972.0,
|
|
"step": 235
|
|
},
|
|
{
|
|
"entropy": 6.706511783599853,
|
|
"epoch": 0.25959978366684694,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00011949999999999999,
|
|
"loss": 6.3833,
|
|
"mean_token_accuracy": 0.1393005795776844,
|
|
"num_tokens": 537445.0,
|
|
"step": 240
|
|
},
|
|
{
|
|
"entropy": 6.676162910461426,
|
|
"epoch": 0.2650081124932396,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.000122,
|
|
"loss": 6.4325,
|
|
"mean_token_accuracy": 0.13711966052651406,
|
|
"num_tokens": 548599.0,
|
|
"step": 245
|
|
},
|
|
{
|
|
"entropy": 6.67521448135376,
|
|
"epoch": 0.2704164413196322,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0001245,
|
|
"loss": 6.3094,
|
|
"mean_token_accuracy": 0.1379949890077114,
|
|
"num_tokens": 559222.0,
|
|
"step": 250
|
|
},
|
|
{
|
|
"entropy": 6.713015365600586,
|
|
"epoch": 0.27582477014602486,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.000127,
|
|
"loss": 6.4632,
|
|
"mean_token_accuracy": 0.12452752217650413,
|
|
"num_tokens": 568949.0,
|
|
"step": 255
|
|
},
|
|
{
|
|
"entropy": 6.779383373260498,
|
|
"epoch": 0.28123309897241755,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0001295,
|
|
"loss": 6.4922,
|
|
"mean_token_accuracy": 0.13144948631525039,
|
|
"num_tokens": 580029.0,
|
|
"step": 260
|
|
},
|
|
{
|
|
"entropy": 6.726202201843262,
|
|
"epoch": 0.2866414277988102,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.000132,
|
|
"loss": 6.4077,
|
|
"mean_token_accuracy": 0.1364477679133415,
|
|
"num_tokens": 591633.0,
|
|
"step": 265
|
|
},
|
|
{
|
|
"entropy": 6.753827857971191,
|
|
"epoch": 0.2920497566252028,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00013450000000000002,
|
|
"loss": 6.4197,
|
|
"mean_token_accuracy": 0.1380621761083603,
|
|
"num_tokens": 602511.0,
|
|
"step": 270
|
|
},
|
|
{
|
|
"entropy": 6.733678150177002,
|
|
"epoch": 0.29745808545159547,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00013700000000000002,
|
|
"loss": 6.4977,
|
|
"mean_token_accuracy": 0.1339564248919487,
|
|
"num_tokens": 613318.0,
|
|
"step": 275
|
|
},
|
|
{
|
|
"entropy": 6.607444524765015,
|
|
"epoch": 0.3028664142779881,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0001395,
|
|
"loss": 6.3873,
|
|
"mean_token_accuracy": 0.13400006145238877,
|
|
"num_tokens": 624043.0,
|
|
"step": 280
|
|
},
|
|
{
|
|
"entropy": 6.67069182395935,
|
|
"epoch": 0.30827474310438074,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.00014199999999999998,
|
|
"loss": 6.3469,
|
|
"mean_token_accuracy": 0.14132973700761794,
|
|
"num_tokens": 634713.0,
|
|
"step": 285
|
|
},
|
|
{
|
|
"entropy": 6.528910064697266,
|
|
"epoch": 0.3136830719307734,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0001445,
|
|
"loss": 6.2954,
|
|
"mean_token_accuracy": 0.13748166486620902,
|
|
"num_tokens": 645491.0,
|
|
"step": 290
|
|
},
|
|
{
|
|
"entropy": 6.753203821182251,
|
|
"epoch": 0.319091400757166,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.000147,
|
|
"loss": 6.4336,
|
|
"mean_token_accuracy": 0.13378573432564736,
|
|
"num_tokens": 656832.0,
|
|
"step": 295
|
|
},
|
|
{
|
|
"entropy": 6.682645654678344,
|
|
"epoch": 0.32449972958355866,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.0001495,
|
|
"loss": 6.3984,
|
|
"mean_token_accuracy": 0.13327668309211732,
|
|
"num_tokens": 668499.0,
|
|
"step": 300
|
|
},
|
|
{
|
|
"entropy": 6.722540235519409,
|
|
"epoch": 0.3299080584099513,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.000152,
|
|
"loss": 6.4665,
|
|
"mean_token_accuracy": 0.1349737487733364,
|
|
"num_tokens": 679962.0,
|
|
"step": 305
|
|
},
|
|
{
|
|
"entropy": 6.740982961654663,
|
|
"epoch": 0.335316387236344,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.00015450000000000001,
|
|
"loss": 6.4479,
|
|
"mean_token_accuracy": 0.13650912493467332,
|
|
"num_tokens": 692170.0,
|
|
"step": 310
|
|
},
|
|
{
|
|
"entropy": 6.57421088218689,
|
|
"epoch": 0.34072471606273663,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.000157,
|
|
"loss": 6.3711,
|
|
"mean_token_accuracy": 0.13764476627111435,
|
|
"num_tokens": 702886.0,
|
|
"step": 315
|
|
},
|
|
{
|
|
"entropy": 6.688414525985718,
|
|
"epoch": 0.34613304488912927,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0001595,
|
|
"loss": 6.4313,
|
|
"mean_token_accuracy": 0.13261876478791237,
|
|
"num_tokens": 714257.0,
|
|
"step": 320
|
|
},
|
|
{
|
|
"entropy": 6.638928413391113,
|
|
"epoch": 0.3515413737155219,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.000162,
|
|
"loss": 6.4197,
|
|
"mean_token_accuracy": 0.13729432821273804,
|
|
"num_tokens": 725751.0,
|
|
"step": 325
|
|
},
|
|
{
|
|
"entropy": 6.782710266113281,
|
|
"epoch": 0.35694970254191455,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.00016450000000000001,
|
|
"loss": 6.4891,
|
|
"mean_token_accuracy": 0.1316055290400982,
|
|
"num_tokens": 737147.0,
|
|
"step": 330
|
|
},
|
|
{
|
|
"entropy": 6.616734218597412,
|
|
"epoch": 0.3623580313683072,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.00016700000000000002,
|
|
"loss": 6.3442,
|
|
"mean_token_accuracy": 0.14010964184999466,
|
|
"num_tokens": 748439.0,
|
|
"step": 335
|
|
},
|
|
{
|
|
"entropy": 6.645461893081665,
|
|
"epoch": 0.3677663601946998,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00016950000000000003,
|
|
"loss": 6.3558,
|
|
"mean_token_accuracy": 0.1416398137807846,
|
|
"num_tokens": 760380.0,
|
|
"step": 340
|
|
},
|
|
{
|
|
"entropy": 6.582087898254395,
|
|
"epoch": 0.37317468902109246,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00017199999999999998,
|
|
"loss": 6.3419,
|
|
"mean_token_accuracy": 0.13614206165075302,
|
|
"num_tokens": 770827.0,
|
|
"step": 345
|
|
},
|
|
{
|
|
"entropy": 6.588772773742676,
|
|
"epoch": 0.3785830178474851,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.00017449999999999999,
|
|
"loss": 6.371,
|
|
"mean_token_accuracy": 0.130119176954031,
|
|
"num_tokens": 781887.0,
|
|
"step": 350
|
|
},
|
|
{
|
|
"entropy": 6.6461952209472654,
|
|
"epoch": 0.3839913466738778,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.000177,
|
|
"loss": 6.3707,
|
|
"mean_token_accuracy": 0.12962670475244523,
|
|
"num_tokens": 792676.0,
|
|
"step": 355
|
|
},
|
|
{
|
|
"entropy": 6.811271715164184,
|
|
"epoch": 0.38939967550027044,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0001795,
|
|
"loss": 6.5791,
|
|
"mean_token_accuracy": 0.13036322295665742,
|
|
"num_tokens": 804148.0,
|
|
"step": 360
|
|
},
|
|
{
|
|
"entropy": 6.647534465789795,
|
|
"epoch": 0.3948080043266631,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.000182,
|
|
"loss": 6.3464,
|
|
"mean_token_accuracy": 0.13733255341649056,
|
|
"num_tokens": 815835.0,
|
|
"step": 365
|
|
},
|
|
{
|
|
"entropy": 6.539557218551636,
|
|
"epoch": 0.4002163331530557,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0001845,
|
|
"loss": 6.2902,
|
|
"mean_token_accuracy": 0.14055102020502092,
|
|
"num_tokens": 827975.0,
|
|
"step": 370
|
|
},
|
|
{
|
|
"entropy": 6.627246284484864,
|
|
"epoch": 0.40562466197944835,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.000187,
|
|
"loss": 6.3392,
|
|
"mean_token_accuracy": 0.13682809248566627,
|
|
"num_tokens": 838982.0,
|
|
"step": 375
|
|
},
|
|
{
|
|
"entropy": 6.624072790145874,
|
|
"epoch": 0.411032990805841,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0001895,
|
|
"loss": 6.4402,
|
|
"mean_token_accuracy": 0.13047717586159707,
|
|
"num_tokens": 851377.0,
|
|
"step": 380
|
|
},
|
|
{
|
|
"entropy": 6.7495063781738285,
|
|
"epoch": 0.41644131963223363,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.000192,
|
|
"loss": 6.4657,
|
|
"mean_token_accuracy": 0.13667654022574424,
|
|
"num_tokens": 862593.0,
|
|
"step": 385
|
|
},
|
|
{
|
|
"entropy": 6.551447343826294,
|
|
"epoch": 0.42184964845862627,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0001945,
|
|
"loss": 6.3196,
|
|
"mean_token_accuracy": 0.1354401208460331,
|
|
"num_tokens": 873906.0,
|
|
"step": 390
|
|
},
|
|
{
|
|
"entropy": 6.712440156936646,
|
|
"epoch": 0.4272579772850189,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.00019700000000000002,
|
|
"loss": 6.4657,
|
|
"mean_token_accuracy": 0.1353951647877693,
|
|
"num_tokens": 884477.0,
|
|
"step": 395
|
|
},
|
|
{
|
|
"entropy": 6.659290027618408,
|
|
"epoch": 0.43266630611141155,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00019950000000000002,
|
|
"loss": 6.3206,
|
|
"mean_token_accuracy": 0.13656646832823754,
|
|
"num_tokens": 896151.0,
|
|
"step": 400
|
|
},
|
|
{
|
|
"entropy": 6.6360023021698,
|
|
"epoch": 0.43807463493780424,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.000202,
|
|
"loss": 6.4024,
|
|
"mean_token_accuracy": 0.13927194178104402,
|
|
"num_tokens": 907580.0,
|
|
"step": 405
|
|
},
|
|
{
|
|
"entropy": 6.59203953742981,
|
|
"epoch": 0.4434829637641969,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00020449999999999998,
|
|
"loss": 6.3489,
|
|
"mean_token_accuracy": 0.13741599917411804,
|
|
"num_tokens": 918141.0,
|
|
"step": 410
|
|
},
|
|
{
|
|
"entropy": 6.65588059425354,
|
|
"epoch": 0.4488912925905895,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.000207,
|
|
"loss": 6.3899,
|
|
"mean_token_accuracy": 0.14542332291603088,
|
|
"num_tokens": 929868.0,
|
|
"step": 415
|
|
},
|
|
{
|
|
"entropy": 6.4867551803588865,
|
|
"epoch": 0.45429962141698216,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0002095,
|
|
"loss": 6.2806,
|
|
"mean_token_accuracy": 0.13965032547712325,
|
|
"num_tokens": 940582.0,
|
|
"step": 420
|
|
},
|
|
{
|
|
"entropy": 6.6291666507720945,
|
|
"epoch": 0.4597079502433748,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.000212,
|
|
"loss": 6.3463,
|
|
"mean_token_accuracy": 0.13679536208510398,
|
|
"num_tokens": 952233.0,
|
|
"step": 425
|
|
},
|
|
{
|
|
"entropy": 6.669621229171753,
|
|
"epoch": 0.46511627906976744,
|
|
"grad_norm": 1.515625,
|
|
"learning_rate": 0.0002145,
|
|
"loss": 6.4395,
|
|
"mean_token_accuracy": 0.13214596956968308,
|
|
"num_tokens": 964252.0,
|
|
"step": 430
|
|
},
|
|
{
|
|
"entropy": 6.623089265823364,
|
|
"epoch": 0.4705246078961601,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00021700000000000002,
|
|
"loss": 6.3381,
|
|
"mean_token_accuracy": 0.1373963512480259,
|
|
"num_tokens": 974692.0,
|
|
"step": 435
|
|
},
|
|
{
|
|
"entropy": 6.575704860687256,
|
|
"epoch": 0.4759329367225527,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0002195,
|
|
"loss": 6.354,
|
|
"mean_token_accuracy": 0.13740625306963922,
|
|
"num_tokens": 986019.0,
|
|
"step": 440
|
|
},
|
|
{
|
|
"entropy": 6.479989528656006,
|
|
"epoch": 0.48134126554894535,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 0.000222,
|
|
"loss": 6.2588,
|
|
"mean_token_accuracy": 0.1383764624595642,
|
|
"num_tokens": 996701.0,
|
|
"step": 445
|
|
},
|
|
{
|
|
"entropy": 6.638360166549683,
|
|
"epoch": 0.48674959437533805,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0002245,
|
|
"loss": 6.3562,
|
|
"mean_token_accuracy": 0.1420356035232544,
|
|
"num_tokens": 1008596.0,
|
|
"step": 450
|
|
},
|
|
{
|
|
"entropy": 6.603897285461426,
|
|
"epoch": 0.4921579232017307,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00022700000000000002,
|
|
"loss": 6.3896,
|
|
"mean_token_accuracy": 0.13321260511875152,
|
|
"num_tokens": 1019263.0,
|
|
"step": 455
|
|
},
|
|
{
|
|
"entropy": 6.627950143814087,
|
|
"epoch": 0.4975662520281233,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.00022950000000000002,
|
|
"loss": 6.3281,
|
|
"mean_token_accuracy": 0.13852308169007302,
|
|
"num_tokens": 1029460.0,
|
|
"step": 460
|
|
},
|
|
{
|
|
"entropy": 6.532049703598022,
|
|
"epoch": 0.502974580854516,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00023200000000000003,
|
|
"loss": 6.3947,
|
|
"mean_token_accuracy": 0.13395455181598664,
|
|
"num_tokens": 1041747.0,
|
|
"step": 465
|
|
},
|
|
{
|
|
"entropy": 6.580554580688476,
|
|
"epoch": 0.5083829096809086,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.00023449999999999998,
|
|
"loss": 6.2302,
|
|
"mean_token_accuracy": 0.13726723864674567,
|
|
"num_tokens": 1051645.0,
|
|
"step": 470
|
|
},
|
|
{
|
|
"entropy": 6.394359159469604,
|
|
"epoch": 0.5137912385073012,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.000237,
|
|
"loss": 6.1471,
|
|
"mean_token_accuracy": 0.14182863682508468,
|
|
"num_tokens": 1062358.0,
|
|
"step": 475
|
|
},
|
|
{
|
|
"entropy": 6.6230544090271,
|
|
"epoch": 0.5191995673336939,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0002395,
|
|
"loss": 6.3291,
|
|
"mean_token_accuracy": 0.13732218518853187,
|
|
"num_tokens": 1074234.0,
|
|
"step": 480
|
|
},
|
|
{
|
|
"entropy": 6.400064849853516,
|
|
"epoch": 0.5246078961600865,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.000242,
|
|
"loss": 6.257,
|
|
"mean_token_accuracy": 0.1385449767112732,
|
|
"num_tokens": 1086608.0,
|
|
"step": 485
|
|
},
|
|
{
|
|
"entropy": 6.640989637374878,
|
|
"epoch": 0.5300162249864792,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0002445,
|
|
"loss": 6.3092,
|
|
"mean_token_accuracy": 0.1422146663069725,
|
|
"num_tokens": 1096878.0,
|
|
"step": 490
|
|
},
|
|
{
|
|
"entropy": 6.501981782913208,
|
|
"epoch": 0.5354245538128718,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.000247,
|
|
"loss": 6.3667,
|
|
"mean_token_accuracy": 0.14159199818968773,
|
|
"num_tokens": 1108089.0,
|
|
"step": 495
|
|
},
|
|
{
|
|
"entropy": 6.608476877212524,
|
|
"epoch": 0.5408328826392644,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0002495,
|
|
"loss": 6.3983,
|
|
"mean_token_accuracy": 0.13436152264475823,
|
|
"num_tokens": 1120910.0,
|
|
"step": 500
|
|
},
|
|
{
|
|
"entropy": 6.558342504501343,
|
|
"epoch": 0.5462412114656571,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.000252,
|
|
"loss": 6.2966,
|
|
"mean_token_accuracy": 0.13886259347200394,
|
|
"num_tokens": 1131685.0,
|
|
"step": 505
|
|
},
|
|
{
|
|
"entropy": 6.493104648590088,
|
|
"epoch": 0.5516495402920497,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0002545,
|
|
"loss": 6.337,
|
|
"mean_token_accuracy": 0.13808612152934074,
|
|
"num_tokens": 1142273.0,
|
|
"step": 510
|
|
},
|
|
{
|
|
"entropy": 6.593916702270508,
|
|
"epoch": 0.5570578691184424,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.000257,
|
|
"loss": 6.212,
|
|
"mean_token_accuracy": 0.1403546467423439,
|
|
"num_tokens": 1152818.0,
|
|
"step": 515
|
|
},
|
|
{
|
|
"entropy": 6.4184082508087155,
|
|
"epoch": 0.5624661979448351,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0002595,
|
|
"loss": 6.2539,
|
|
"mean_token_accuracy": 0.14156585782766343,
|
|
"num_tokens": 1163398.0,
|
|
"step": 520
|
|
},
|
|
{
|
|
"entropy": 6.639800310134888,
|
|
"epoch": 0.5678745267712277,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.000262,
|
|
"loss": 6.3113,
|
|
"mean_token_accuracy": 0.14177494123578072,
|
|
"num_tokens": 1174493.0,
|
|
"step": 525
|
|
},
|
|
{
|
|
"entropy": 6.449878311157226,
|
|
"epoch": 0.5732828555976204,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.00026450000000000003,
|
|
"loss": 6.2964,
|
|
"mean_token_accuracy": 0.14197195023298265,
|
|
"num_tokens": 1185534.0,
|
|
"step": 530
|
|
},
|
|
{
|
|
"entropy": 6.524397659301758,
|
|
"epoch": 0.578691184424013,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.00026700000000000004,
|
|
"loss": 6.2393,
|
|
"mean_token_accuracy": 0.14146455824375154,
|
|
"num_tokens": 1196488.0,
|
|
"step": 535
|
|
},
|
|
{
|
|
"entropy": 6.451419448852539,
|
|
"epoch": 0.5840995132504057,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.00026950000000000005,
|
|
"loss": 6.3155,
|
|
"mean_token_accuracy": 0.139084542542696,
|
|
"num_tokens": 1208116.0,
|
|
"step": 540
|
|
},
|
|
{
|
|
"entropy": 6.48581862449646,
|
|
"epoch": 0.5895078420767983,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00027200000000000005,
|
|
"loss": 6.3035,
|
|
"mean_token_accuracy": 0.14370152205228806,
|
|
"num_tokens": 1219571.0,
|
|
"step": 545
|
|
},
|
|
{
|
|
"entropy": 6.518029594421387,
|
|
"epoch": 0.5949161709031909,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0002745,
|
|
"loss": 6.2869,
|
|
"mean_token_accuracy": 0.13986791446805,
|
|
"num_tokens": 1231049.0,
|
|
"step": 550
|
|
},
|
|
{
|
|
"entropy": 6.475363636016846,
|
|
"epoch": 0.6003244997295836,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.000277,
|
|
"loss": 6.3097,
|
|
"mean_token_accuracy": 0.1364640511572361,
|
|
"num_tokens": 1242507.0,
|
|
"step": 555
|
|
},
|
|
{
|
|
"entropy": 6.44856014251709,
|
|
"epoch": 0.6057328285559762,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0002795,
|
|
"loss": 6.2934,
|
|
"mean_token_accuracy": 0.13697041645646096,
|
|
"num_tokens": 1253607.0,
|
|
"step": 560
|
|
},
|
|
{
|
|
"entropy": 6.528074312210083,
|
|
"epoch": 0.6111411573823688,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00028199999999999997,
|
|
"loss": 6.3358,
|
|
"mean_token_accuracy": 0.13758110031485557,
|
|
"num_tokens": 1266604.0,
|
|
"step": 565
|
|
},
|
|
{
|
|
"entropy": 6.573901605606079,
|
|
"epoch": 0.6165494862087615,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0002845,
|
|
"loss": 6.3815,
|
|
"mean_token_accuracy": 0.13712944313883782,
|
|
"num_tokens": 1276930.0,
|
|
"step": 570
|
|
},
|
|
{
|
|
"entropy": 6.598294305801391,
|
|
"epoch": 0.6219578150351541,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.000287,
|
|
"loss": 6.3853,
|
|
"mean_token_accuracy": 0.13915850892663,
|
|
"num_tokens": 1288326.0,
|
|
"step": 575
|
|
},
|
|
{
|
|
"entropy": 6.450491666793823,
|
|
"epoch": 0.6273661438615468,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.0002895,
|
|
"loss": 6.3287,
|
|
"mean_token_accuracy": 0.13975025117397308,
|
|
"num_tokens": 1298950.0,
|
|
"step": 580
|
|
},
|
|
{
|
|
"entropy": 6.524539470672607,
|
|
"epoch": 0.6327744726879394,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.000292,
|
|
"loss": 6.3231,
|
|
"mean_token_accuracy": 0.13521830812096597,
|
|
"num_tokens": 1311254.0,
|
|
"step": 585
|
|
},
|
|
{
|
|
"entropy": 6.515868997573852,
|
|
"epoch": 0.638182801514332,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0002945,
|
|
"loss": 6.2362,
|
|
"mean_token_accuracy": 0.13961164206266402,
|
|
"num_tokens": 1322723.0,
|
|
"step": 590
|
|
},
|
|
{
|
|
"entropy": 6.4743040084838865,
|
|
"epoch": 0.6435911303407247,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.000297,
|
|
"loss": 6.2488,
|
|
"mean_token_accuracy": 0.14040838554501534,
|
|
"num_tokens": 1333998.0,
|
|
"step": 595
|
|
},
|
|
{
|
|
"entropy": 6.309730291366577,
|
|
"epoch": 0.6489994591671173,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0002995,
|
|
"loss": 6.1926,
|
|
"mean_token_accuracy": 0.14279944226145744,
|
|
"num_tokens": 1345113.0,
|
|
"step": 600
|
|
},
|
|
{
|
|
"entropy": 6.439900350570679,
|
|
"epoch": 0.65440778799351,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.000302,
|
|
"loss": 6.2886,
|
|
"mean_token_accuracy": 0.14252566993236543,
|
|
"num_tokens": 1356850.0,
|
|
"step": 605
|
|
},
|
|
{
|
|
"entropy": 6.550169944763184,
|
|
"epoch": 0.6598161168199026,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0003045,
|
|
"loss": 6.3744,
|
|
"mean_token_accuracy": 0.1397650845348835,
|
|
"num_tokens": 1369671.0,
|
|
"step": 610
|
|
},
|
|
{
|
|
"entropy": 6.427625703811645,
|
|
"epoch": 0.6652244456462953,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.000307,
|
|
"loss": 6.2835,
|
|
"mean_token_accuracy": 0.13882820978760718,
|
|
"num_tokens": 1380298.0,
|
|
"step": 615
|
|
},
|
|
{
|
|
"entropy": 6.527406787872314,
|
|
"epoch": 0.670632774472688,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0003095,
|
|
"loss": 6.2763,
|
|
"mean_token_accuracy": 0.13872483968734742,
|
|
"num_tokens": 1391617.0,
|
|
"step": 620
|
|
},
|
|
{
|
|
"entropy": 6.535118579864502,
|
|
"epoch": 0.6760411032990806,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.000312,
|
|
"loss": 6.3461,
|
|
"mean_token_accuracy": 0.14173057228326796,
|
|
"num_tokens": 1403509.0,
|
|
"step": 625
|
|
},
|
|
{
|
|
"entropy": 6.511589908599854,
|
|
"epoch": 0.6814494321254733,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0003145,
|
|
"loss": 6.4039,
|
|
"mean_token_accuracy": 0.13432303741574286,
|
|
"num_tokens": 1415125.0,
|
|
"step": 630
|
|
},
|
|
{
|
|
"entropy": 6.580691337585449,
|
|
"epoch": 0.6868577609518659,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.000317,
|
|
"loss": 6.402,
|
|
"mean_token_accuracy": 0.13456533700227738,
|
|
"num_tokens": 1426785.0,
|
|
"step": 635
|
|
},
|
|
{
|
|
"entropy": 6.480119514465332,
|
|
"epoch": 0.6922660897782585,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0003195,
|
|
"loss": 6.3605,
|
|
"mean_token_accuracy": 0.12881308048963547,
|
|
"num_tokens": 1439013.0,
|
|
"step": 640
|
|
},
|
|
{
|
|
"entropy": 6.417783641815186,
|
|
"epoch": 0.6976744186046512,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.000322,
|
|
"loss": 6.2202,
|
|
"mean_token_accuracy": 0.14642192423343658,
|
|
"num_tokens": 1449818.0,
|
|
"step": 645
|
|
},
|
|
{
|
|
"entropy": 6.413159942626953,
|
|
"epoch": 0.7030827474310438,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00032450000000000003,
|
|
"loss": 6.1358,
|
|
"mean_token_accuracy": 0.1415444567799568,
|
|
"num_tokens": 1460681.0,
|
|
"step": 650
|
|
},
|
|
{
|
|
"entropy": 6.338744592666626,
|
|
"epoch": 0.7084910762574365,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00032700000000000003,
|
|
"loss": 6.2476,
|
|
"mean_token_accuracy": 0.13981930315494537,
|
|
"num_tokens": 1471840.0,
|
|
"step": 655
|
|
},
|
|
{
|
|
"entropy": 6.466752004623413,
|
|
"epoch": 0.7138994050838291,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.00032950000000000004,
|
|
"loss": 6.2436,
|
|
"mean_token_accuracy": 0.14259599149227142,
|
|
"num_tokens": 1482326.0,
|
|
"step": 660
|
|
},
|
|
{
|
|
"entropy": 6.328251123428345,
|
|
"epoch": 0.7193077339102217,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00033200000000000005,
|
|
"loss": 6.1715,
|
|
"mean_token_accuracy": 0.14127768352627754,
|
|
"num_tokens": 1493277.0,
|
|
"step": 665
|
|
},
|
|
{
|
|
"entropy": 6.4282067775726315,
|
|
"epoch": 0.7247160627366144,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.00033450000000000005,
|
|
"loss": 6.2511,
|
|
"mean_token_accuracy": 0.14475265368819237,
|
|
"num_tokens": 1504563.0,
|
|
"step": 670
|
|
},
|
|
{
|
|
"entropy": 6.372472429275513,
|
|
"epoch": 0.730124391563007,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.000337,
|
|
"loss": 6.2369,
|
|
"mean_token_accuracy": 0.1476322367787361,
|
|
"num_tokens": 1516311.0,
|
|
"step": 675
|
|
},
|
|
{
|
|
"entropy": 6.354723262786865,
|
|
"epoch": 0.7355327203893997,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0003395,
|
|
"loss": 6.1563,
|
|
"mean_token_accuracy": 0.14649124294519425,
|
|
"num_tokens": 1527391.0,
|
|
"step": 680
|
|
},
|
|
{
|
|
"entropy": 6.439003276824951,
|
|
"epoch": 0.7409410492157923,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.000342,
|
|
"loss": 6.2846,
|
|
"mean_token_accuracy": 0.14316972196102143,
|
|
"num_tokens": 1537755.0,
|
|
"step": 685
|
|
},
|
|
{
|
|
"entropy": 6.466528415679932,
|
|
"epoch": 0.7463493780421849,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00034449999999999997,
|
|
"loss": 6.3203,
|
|
"mean_token_accuracy": 0.1379350833594799,
|
|
"num_tokens": 1550525.0,
|
|
"step": 690
|
|
},
|
|
{
|
|
"entropy": 6.425952291488647,
|
|
"epoch": 0.7517577068685776,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.000347,
|
|
"loss": 6.2344,
|
|
"mean_token_accuracy": 0.14136113673448564,
|
|
"num_tokens": 1561995.0,
|
|
"step": 695
|
|
},
|
|
{
|
|
"entropy": 6.384309434890747,
|
|
"epoch": 0.7571660356949702,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0003495,
|
|
"loss": 6.2363,
|
|
"mean_token_accuracy": 0.13751797899603843,
|
|
"num_tokens": 1573137.0,
|
|
"step": 700
|
|
},
|
|
{
|
|
"entropy": 6.332474660873413,
|
|
"epoch": 0.7625743645213628,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.000352,
|
|
"loss": 6.2516,
|
|
"mean_token_accuracy": 0.1449413001537323,
|
|
"num_tokens": 1584938.0,
|
|
"step": 705
|
|
},
|
|
{
|
|
"entropy": 6.549186563491821,
|
|
"epoch": 0.7679826933477556,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0003545,
|
|
"loss": 6.308,
|
|
"mean_token_accuracy": 0.1355679027736187,
|
|
"num_tokens": 1596306.0,
|
|
"step": 710
|
|
},
|
|
{
|
|
"entropy": 6.34313998222351,
|
|
"epoch": 0.7733910221741482,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.000357,
|
|
"loss": 6.2934,
|
|
"mean_token_accuracy": 0.14217483699321748,
|
|
"num_tokens": 1608112.0,
|
|
"step": 715
|
|
},
|
|
{
|
|
"entropy": 6.5022155284881595,
|
|
"epoch": 0.7787993510005409,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0003595,
|
|
"loss": 6.2833,
|
|
"mean_token_accuracy": 0.14302016869187356,
|
|
"num_tokens": 1618635.0,
|
|
"step": 720
|
|
},
|
|
{
|
|
"entropy": 6.277605819702148,
|
|
"epoch": 0.7842076798269335,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.000362,
|
|
"loss": 6.1878,
|
|
"mean_token_accuracy": 0.14160637855529784,
|
|
"num_tokens": 1629476.0,
|
|
"step": 725
|
|
},
|
|
{
|
|
"entropy": 6.544418144226074,
|
|
"epoch": 0.7896160086533262,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0003645,
|
|
"loss": 6.2851,
|
|
"mean_token_accuracy": 0.14023412466049195,
|
|
"num_tokens": 1641305.0,
|
|
"step": 730
|
|
},
|
|
{
|
|
"entropy": 6.323581790924072,
|
|
"epoch": 0.7950243374797188,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.000367,
|
|
"loss": 6.228,
|
|
"mean_token_accuracy": 0.1453120455145836,
|
|
"num_tokens": 1653424.0,
|
|
"step": 735
|
|
},
|
|
{
|
|
"entropy": 6.338683032989502,
|
|
"epoch": 0.8004326663061114,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.0003695,
|
|
"loss": 6.2738,
|
|
"mean_token_accuracy": 0.13886456340551376,
|
|
"num_tokens": 1664222.0,
|
|
"step": 740
|
|
},
|
|
{
|
|
"entropy": 6.45950026512146,
|
|
"epoch": 0.8058409951325041,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.000372,
|
|
"loss": 6.3182,
|
|
"mean_token_accuracy": 0.13927288502454757,
|
|
"num_tokens": 1676829.0,
|
|
"step": 745
|
|
},
|
|
{
|
|
"entropy": 6.389509057998657,
|
|
"epoch": 0.8112493239588967,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0003745,
|
|
"loss": 6.2171,
|
|
"mean_token_accuracy": 0.13743837997317315,
|
|
"num_tokens": 1688534.0,
|
|
"step": 750
|
|
},
|
|
{
|
|
"entropy": 6.2615196228027346,
|
|
"epoch": 0.8166576527852893,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.000377,
|
|
"loss": 6.1995,
|
|
"mean_token_accuracy": 0.14325060099363326,
|
|
"num_tokens": 1699051.0,
|
|
"step": 755
|
|
},
|
|
{
|
|
"entropy": 6.446281814575196,
|
|
"epoch": 0.822065981611682,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0003795,
|
|
"loss": 6.2276,
|
|
"mean_token_accuracy": 0.13753046318888665,
|
|
"num_tokens": 1709849.0,
|
|
"step": 760
|
|
},
|
|
{
|
|
"entropy": 6.236609411239624,
|
|
"epoch": 0.8274743104380746,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.000382,
|
|
"loss": 6.0689,
|
|
"mean_token_accuracy": 0.15064243003726005,
|
|
"num_tokens": 1721956.0,
|
|
"step": 765
|
|
},
|
|
{
|
|
"entropy": 6.327112913131714,
|
|
"epoch": 0.8328826392644673,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0003845,
|
|
"loss": 6.0921,
|
|
"mean_token_accuracy": 0.15326208472251893,
|
|
"num_tokens": 1733302.0,
|
|
"step": 770
|
|
},
|
|
{
|
|
"entropy": 6.198913812637329,
|
|
"epoch": 0.8382909680908599,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00038700000000000003,
|
|
"loss": 6.041,
|
|
"mean_token_accuracy": 0.15577499121427535,
|
|
"num_tokens": 1744835.0,
|
|
"step": 775
|
|
},
|
|
{
|
|
"entropy": 6.3341676712036135,
|
|
"epoch": 0.8436992969172525,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00038950000000000003,
|
|
"loss": 6.1797,
|
|
"mean_token_accuracy": 0.14762855991721152,
|
|
"num_tokens": 1755174.0,
|
|
"step": 780
|
|
},
|
|
{
|
|
"entropy": 6.381376791000366,
|
|
"epoch": 0.8491076257436452,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00039200000000000004,
|
|
"loss": 6.3989,
|
|
"mean_token_accuracy": 0.13875442296266555,
|
|
"num_tokens": 1767572.0,
|
|
"step": 785
|
|
},
|
|
{
|
|
"entropy": 6.218066310882568,
|
|
"epoch": 0.8545159545700378,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00039450000000000005,
|
|
"loss": 6.1405,
|
|
"mean_token_accuracy": 0.1449118934571743,
|
|
"num_tokens": 1777537.0,
|
|
"step": 790
|
|
},
|
|
{
|
|
"entropy": 6.425797414779663,
|
|
"epoch": 0.8599242833964305,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00039700000000000005,
|
|
"loss": 6.1712,
|
|
"mean_token_accuracy": 0.14846592620015145,
|
|
"num_tokens": 1789731.0,
|
|
"step": 795
|
|
},
|
|
{
|
|
"entropy": 6.419421625137329,
|
|
"epoch": 0.8653326122228231,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0003995,
|
|
"loss": 6.3029,
|
|
"mean_token_accuracy": 0.14081404209136963,
|
|
"num_tokens": 1800754.0,
|
|
"step": 800
|
|
},
|
|
{
|
|
"entropy": 6.272062110900879,
|
|
"epoch": 0.8707409410492158,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.000402,
|
|
"loss": 6.2734,
|
|
"mean_token_accuracy": 0.1466397300362587,
|
|
"num_tokens": 1811496.0,
|
|
"step": 805
|
|
},
|
|
{
|
|
"entropy": 6.3589723110198975,
|
|
"epoch": 0.8761492698756085,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004045,
|
|
"loss": 6.184,
|
|
"mean_token_accuracy": 0.1434461772441864,
|
|
"num_tokens": 1822733.0,
|
|
"step": 810
|
|
},
|
|
{
|
|
"entropy": 6.342323112487793,
|
|
"epoch": 0.8815575987020011,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00040699999999999997,
|
|
"loss": 6.1623,
|
|
"mean_token_accuracy": 0.14631599932909012,
|
|
"num_tokens": 1834121.0,
|
|
"step": 815
|
|
},
|
|
{
|
|
"entropy": 6.243607139587402,
|
|
"epoch": 0.8869659275283938,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0004095,
|
|
"loss": 6.0895,
|
|
"mean_token_accuracy": 0.1486702710390091,
|
|
"num_tokens": 1844674.0,
|
|
"step": 820
|
|
},
|
|
{
|
|
"entropy": 6.2104573249816895,
|
|
"epoch": 0.8923742563547864,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.000412,
|
|
"loss": 6.0988,
|
|
"mean_token_accuracy": 0.1491689234972,
|
|
"num_tokens": 1856692.0,
|
|
"step": 825
|
|
},
|
|
{
|
|
"entropy": 6.453680181503296,
|
|
"epoch": 0.897782585181179,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004145,
|
|
"loss": 6.3707,
|
|
"mean_token_accuracy": 0.1408935658633709,
|
|
"num_tokens": 1867888.0,
|
|
"step": 830
|
|
},
|
|
{
|
|
"entropy": 6.105977869033813,
|
|
"epoch": 0.9031909140075717,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.000417,
|
|
"loss": 6.043,
|
|
"mean_token_accuracy": 0.15483584851026536,
|
|
"num_tokens": 1877869.0,
|
|
"step": 835
|
|
},
|
|
{
|
|
"entropy": 6.322730207443238,
|
|
"epoch": 0.9085992428339643,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004195,
|
|
"loss": 6.1548,
|
|
"mean_token_accuracy": 0.1412374958395958,
|
|
"num_tokens": 1887975.0,
|
|
"step": 840
|
|
},
|
|
{
|
|
"entropy": 6.305921459197998,
|
|
"epoch": 0.914007571660357,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.000422,
|
|
"loss": 6.1018,
|
|
"mean_token_accuracy": 0.14518715515732766,
|
|
"num_tokens": 1898289.0,
|
|
"step": 845
|
|
},
|
|
{
|
|
"entropy": 6.211407423019409,
|
|
"epoch": 0.9194159004867496,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0004245,
|
|
"loss": 6.2213,
|
|
"mean_token_accuracy": 0.15009732991456987,
|
|
"num_tokens": 1910038.0,
|
|
"step": 850
|
|
},
|
|
{
|
|
"entropy": 6.209096813201905,
|
|
"epoch": 0.9248242293131422,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.000427,
|
|
"loss": 6.0914,
|
|
"mean_token_accuracy": 0.15314256697893142,
|
|
"num_tokens": 1920774.0,
|
|
"step": 855
|
|
},
|
|
{
|
|
"entropy": 6.293406915664673,
|
|
"epoch": 0.9302325581395349,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004295,
|
|
"loss": 6.1251,
|
|
"mean_token_accuracy": 0.15404994785785675,
|
|
"num_tokens": 1932085.0,
|
|
"step": 860
|
|
},
|
|
{
|
|
"entropy": 6.232555866241455,
|
|
"epoch": 0.9356408869659275,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.000432,
|
|
"loss": 6.1331,
|
|
"mean_token_accuracy": 0.15166230872273445,
|
|
"num_tokens": 1943949.0,
|
|
"step": 865
|
|
},
|
|
{
|
|
"entropy": 6.28867917060852,
|
|
"epoch": 0.9410492157923201,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004345,
|
|
"loss": 6.1927,
|
|
"mean_token_accuracy": 0.14988541305065156,
|
|
"num_tokens": 1956051.0,
|
|
"step": 870
|
|
},
|
|
{
|
|
"entropy": 6.260223913192749,
|
|
"epoch": 0.9464575446187128,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.000437,
|
|
"loss": 6.1868,
|
|
"mean_token_accuracy": 0.14389916732907296,
|
|
"num_tokens": 1967804.0,
|
|
"step": 875
|
|
},
|
|
{
|
|
"entropy": 6.208997774124145,
|
|
"epoch": 0.9518658734451054,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004395,
|
|
"loss": 6.2995,
|
|
"mean_token_accuracy": 0.13391195982694626,
|
|
"num_tokens": 1979222.0,
|
|
"step": 880
|
|
},
|
|
{
|
|
"entropy": 6.381609487533569,
|
|
"epoch": 0.9572742022714981,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.000442,
|
|
"loss": 6.2248,
|
|
"mean_token_accuracy": 0.14088413566350938,
|
|
"num_tokens": 1988998.0,
|
|
"step": 885
|
|
},
|
|
{
|
|
"entropy": 6.245026969909668,
|
|
"epoch": 0.9626825310978907,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004445,
|
|
"loss": 6.1451,
|
|
"mean_token_accuracy": 0.14165820479393004,
|
|
"num_tokens": 2000539.0,
|
|
"step": 890
|
|
},
|
|
{
|
|
"entropy": 6.321556282043457,
|
|
"epoch": 0.9680908599242833,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.000447,
|
|
"loss": 6.2385,
|
|
"mean_token_accuracy": 0.14436768293380736,
|
|
"num_tokens": 2012321.0,
|
|
"step": 895
|
|
},
|
|
{
|
|
"entropy": 6.173920106887818,
|
|
"epoch": 0.9734991887506761,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00044950000000000003,
|
|
"loss": 6.1231,
|
|
"mean_token_accuracy": 0.14439835995435715,
|
|
"num_tokens": 2023330.0,
|
|
"step": 900
|
|
},
|
|
{
|
|
"entropy": 6.284840297698975,
|
|
"epoch": 0.9789075175770687,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00045200000000000004,
|
|
"loss": 6.1095,
|
|
"mean_token_accuracy": 0.13921767249703407,
|
|
"num_tokens": 2034655.0,
|
|
"step": 905
|
|
},
|
|
{
|
|
"entropy": 6.110538482666016,
|
|
"epoch": 0.9843158464034614,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00045450000000000004,
|
|
"loss": 6.1513,
|
|
"mean_token_accuracy": 0.1441517509520054,
|
|
"num_tokens": 2045785.0,
|
|
"step": 910
|
|
},
|
|
{
|
|
"entropy": 6.445047616958618,
|
|
"epoch": 0.989724175229854,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00045700000000000005,
|
|
"loss": 6.2424,
|
|
"mean_token_accuracy": 0.14532435238361358,
|
|
"num_tokens": 2056038.0,
|
|
"step": 915
|
|
},
|
|
{
|
|
"entropy": 6.129134559631348,
|
|
"epoch": 0.9951325040562466,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.00045950000000000006,
|
|
"loss": 6.1023,
|
|
"mean_token_accuracy": 0.15468567311763765,
|
|
"num_tokens": 2066803.0,
|
|
"step": 920
|
|
},
|
|
{
|
|
"entropy": 6.241815196143256,
|
|
"epoch": 1.0,
|
|
"grad_norm": 1.90625,
|
|
"learning_rate": 0.000462,
|
|
"loss": 6.2124,
|
|
"mean_token_accuracy": 0.14124820878108343,
|
|
"num_tokens": 2076889.0,
|
|
"step": 925
|
|
},
|
|
{
|
|
"entropy": 6.257176446914673,
|
|
"epoch": 1.0054083288263926,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004645,
|
|
"loss": 5.9752,
|
|
"mean_token_accuracy": 0.14727601259946824,
|
|
"num_tokens": 2089019.0,
|
|
"step": 930
|
|
},
|
|
{
|
|
"entropy": 6.028801822662354,
|
|
"epoch": 1.0108166576527853,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.000467,
|
|
"loss": 5.8447,
|
|
"mean_token_accuracy": 0.16022417545318604,
|
|
"num_tokens": 2099849.0,
|
|
"step": 935
|
|
},
|
|
{
|
|
"entropy": 6.177911376953125,
|
|
"epoch": 1.016224986479178,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0004695,
|
|
"loss": 6.0094,
|
|
"mean_token_accuracy": 0.1548767253756523,
|
|
"num_tokens": 2110671.0,
|
|
"step": 940
|
|
},
|
|
{
|
|
"entropy": 6.136840963363648,
|
|
"epoch": 1.0216333153055706,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.000472,
|
|
"loss": 6.0524,
|
|
"mean_token_accuracy": 0.1497804716229439,
|
|
"num_tokens": 2122357.0,
|
|
"step": 945
|
|
},
|
|
{
|
|
"entropy": 6.268298530578614,
|
|
"epoch": 1.0270416441319632,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004745,
|
|
"loss": 5.9944,
|
|
"mean_token_accuracy": 0.14714996218681337,
|
|
"num_tokens": 2133878.0,
|
|
"step": 950
|
|
},
|
|
{
|
|
"entropy": 6.203853130340576,
|
|
"epoch": 1.0324499729583558,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.000477,
|
|
"loss": 6.0033,
|
|
"mean_token_accuracy": 0.15483788400888443,
|
|
"num_tokens": 2145565.0,
|
|
"step": 955
|
|
},
|
|
{
|
|
"entropy": 6.0750096321105955,
|
|
"epoch": 1.0378583017847485,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004795,
|
|
"loss": 5.9273,
|
|
"mean_token_accuracy": 0.14823657721281053,
|
|
"num_tokens": 2157393.0,
|
|
"step": 960
|
|
},
|
|
{
|
|
"entropy": 6.056691598892212,
|
|
"epoch": 1.043266630611141,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.000482,
|
|
"loss": 5.7809,
|
|
"mean_token_accuracy": 0.1595247745513916,
|
|
"num_tokens": 2169318.0,
|
|
"step": 965
|
|
},
|
|
{
|
|
"entropy": 6.050301027297974,
|
|
"epoch": 1.0486749594375337,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004845,
|
|
"loss": 5.8674,
|
|
"mean_token_accuracy": 0.15364039540290833,
|
|
"num_tokens": 2179727.0,
|
|
"step": 970
|
|
},
|
|
{
|
|
"entropy": 6.027638483047485,
|
|
"epoch": 1.0540832882639264,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.000487,
|
|
"loss": 5.9021,
|
|
"mean_token_accuracy": 0.1545193985104561,
|
|
"num_tokens": 2190119.0,
|
|
"step": 975
|
|
},
|
|
{
|
|
"entropy": 6.070952320098877,
|
|
"epoch": 1.059491617090319,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004895,
|
|
"loss": 5.9234,
|
|
"mean_token_accuracy": 0.15558279752731324,
|
|
"num_tokens": 2201077.0,
|
|
"step": 980
|
|
},
|
|
{
|
|
"entropy": 6.101561832427978,
|
|
"epoch": 1.0648999459167117,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.000492,
|
|
"loss": 5.9922,
|
|
"mean_token_accuracy": 0.15358568280935286,
|
|
"num_tokens": 2211572.0,
|
|
"step": 985
|
|
},
|
|
{
|
|
"entropy": 6.181616640090942,
|
|
"epoch": 1.0703082747431043,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004945,
|
|
"loss": 6.0144,
|
|
"mean_token_accuracy": 0.1533959075808525,
|
|
"num_tokens": 2223372.0,
|
|
"step": 990
|
|
},
|
|
{
|
|
"entropy": 5.968746328353882,
|
|
"epoch": 1.075716603569497,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.000497,
|
|
"loss": 5.886,
|
|
"mean_token_accuracy": 0.154812690615654,
|
|
"num_tokens": 2234946.0,
|
|
"step": 995
|
|
},
|
|
{
|
|
"entropy": 6.149488687515259,
|
|
"epoch": 1.0811249323958896,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004995,
|
|
"loss": 5.969,
|
|
"mean_token_accuracy": 0.14452582895755767,
|
|
"num_tokens": 2246608.0,
|
|
"step": 1000
|
|
},
|
|
{
|
|
"epoch": 1.0811249323958896,
|
|
"eval_entropy": 5.931731963157654,
|
|
"eval_loss": 6.293067455291748,
|
|
"eval_mean_token_accuracy": 0.14824318431995132,
|
|
"eval_num_tokens": 2246608.0,
|
|
"eval_runtime": 2.567,
|
|
"eval_samples_per_second": 1369.326,
|
|
"eval_steps_per_second": 171.409,
|
|
"step": 1000
|
|
}
|
|
],
|
|
"logging_steps": 5,
|
|
"max_steps": 9240,
|
|
"num_input_tokens_seen": 0,
|
|
"num_train_epochs": 10,
|
|
"save_steps": 1000,
|
|
"stateful_callbacks": {
|
|
"TrainerControl": {
|
|
"args": {
|
|
"should_epoch_stop": false,
|
|
"should_evaluate": false,
|
|
"should_log": false,
|
|
"should_save": true,
|
|
"should_training_stop": false
|
|
},
|
|
"attributes": {}
|
|
}
|
|
},
|
|
"total_flos": 3536848945152000.0,
|
|
"train_batch_size": 16,
|
|
"trial_name": null,
|
|
"trial_params": null
|
|
}
|