Model: fpadovani/eng-latn-100mb-after-ppt-Dp-10mb-ckpt500_seed455 Source: Original Platform
14112 lines
385 KiB
JSON
14112 lines
385 KiB
JSON
{
|
|
"best_global_step": null,
|
|
"best_metric": null,
|
|
"best_model_checkpoint": null,
|
|
"epoch": 7.567874526771227,
|
|
"eval_steps": 1000,
|
|
"global_step": 7000,
|
|
"is_hyper_param_search": false,
|
|
"is_local_process_zero": true,
|
|
"is_world_process_zero": true,
|
|
"log_history": [
|
|
{
|
|
"entropy": 6.745217990875244,
|
|
"epoch": 0.005408328826392645,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 2e-06,
|
|
"loss": 6.4399,
|
|
"mean_token_accuracy": 0.12539481073617936,
|
|
"num_tokens": 9564.0,
|
|
"step": 5
|
|
},
|
|
{
|
|
"entropy": 6.7341703414917,
|
|
"epoch": 0.01081665765278529,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 4.5e-06,
|
|
"loss": 6.4966,
|
|
"mean_token_accuracy": 0.12570957243442535,
|
|
"num_tokens": 20265.0,
|
|
"step": 10
|
|
},
|
|
{
|
|
"entropy": 6.810567569732666,
|
|
"epoch": 0.016224986479177934,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 7e-06,
|
|
"loss": 6.6044,
|
|
"mean_token_accuracy": 0.12070711851119995,
|
|
"num_tokens": 30733.0,
|
|
"step": 15
|
|
},
|
|
{
|
|
"entropy": 6.691426467895508,
|
|
"epoch": 0.02163331530557058,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 9.5e-06,
|
|
"loss": 6.5463,
|
|
"mean_token_accuracy": 0.1250626839697361,
|
|
"num_tokens": 41633.0,
|
|
"step": 20
|
|
},
|
|
{
|
|
"entropy": 6.713900947570801,
|
|
"epoch": 0.02704164413196322,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 1.2e-05,
|
|
"loss": 6.6055,
|
|
"mean_token_accuracy": 0.12766451835632325,
|
|
"num_tokens": 53776.0,
|
|
"step": 25
|
|
},
|
|
{
|
|
"entropy": 6.794030284881591,
|
|
"epoch": 0.03244997295835587,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 1.4500000000000002e-05,
|
|
"loss": 6.55,
|
|
"mean_token_accuracy": 0.13146025240421294,
|
|
"num_tokens": 64936.0,
|
|
"step": 30
|
|
},
|
|
{
|
|
"entropy": 6.735936450958252,
|
|
"epoch": 0.03785830178474851,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 1.7000000000000003e-05,
|
|
"loss": 6.5551,
|
|
"mean_token_accuracy": 0.12577222511172295,
|
|
"num_tokens": 76664.0,
|
|
"step": 35
|
|
},
|
|
{
|
|
"entropy": 6.720685720443726,
|
|
"epoch": 0.04326663061114116,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 1.95e-05,
|
|
"loss": 6.4589,
|
|
"mean_token_accuracy": 0.12645927220582961,
|
|
"num_tokens": 87188.0,
|
|
"step": 40
|
|
},
|
|
{
|
|
"entropy": 6.770437097549438,
|
|
"epoch": 0.048674959437533805,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 2.2e-05,
|
|
"loss": 6.6097,
|
|
"mean_token_accuracy": 0.1324235811829567,
|
|
"num_tokens": 99337.0,
|
|
"step": 45
|
|
},
|
|
{
|
|
"entropy": 6.7956713199615475,
|
|
"epoch": 0.05408328826392644,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 2.4500000000000003e-05,
|
|
"loss": 6.5528,
|
|
"mean_token_accuracy": 0.1259615793824196,
|
|
"num_tokens": 110870.0,
|
|
"step": 50
|
|
},
|
|
{
|
|
"entropy": 6.821929407119751,
|
|
"epoch": 0.05949161709031909,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 2.7e-05,
|
|
"loss": 6.4581,
|
|
"mean_token_accuracy": 0.13586550429463387,
|
|
"num_tokens": 122183.0,
|
|
"step": 55
|
|
},
|
|
{
|
|
"entropy": 6.810019540786743,
|
|
"epoch": 0.06489994591671173,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 2.95e-05,
|
|
"loss": 6.471,
|
|
"mean_token_accuracy": 0.134011822193861,
|
|
"num_tokens": 133676.0,
|
|
"step": 60
|
|
},
|
|
{
|
|
"entropy": 6.7516721248626705,
|
|
"epoch": 0.07030827474310439,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 3.2e-05,
|
|
"loss": 6.5101,
|
|
"mean_token_accuracy": 0.13094406202435493,
|
|
"num_tokens": 144821.0,
|
|
"step": 65
|
|
},
|
|
{
|
|
"entropy": 6.73709626197815,
|
|
"epoch": 0.07571660356949703,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 3.4500000000000005e-05,
|
|
"loss": 6.4945,
|
|
"mean_token_accuracy": 0.13041364997625352,
|
|
"num_tokens": 156873.0,
|
|
"step": 70
|
|
},
|
|
{
|
|
"entropy": 6.649084663391113,
|
|
"epoch": 0.08112493239588967,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 3.7e-05,
|
|
"loss": 6.4459,
|
|
"mean_token_accuracy": 0.12853534668684005,
|
|
"num_tokens": 168794.0,
|
|
"step": 75
|
|
},
|
|
{
|
|
"entropy": 6.839602088928222,
|
|
"epoch": 0.08653326122228232,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 3.95e-05,
|
|
"loss": 6.603,
|
|
"mean_token_accuracy": 0.12388623431324959,
|
|
"num_tokens": 180756.0,
|
|
"step": 80
|
|
},
|
|
{
|
|
"entropy": 6.882611703872681,
|
|
"epoch": 0.09194159004867496,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 4.2000000000000004e-05,
|
|
"loss": 6.5729,
|
|
"mean_token_accuracy": 0.12938066497445105,
|
|
"num_tokens": 191127.0,
|
|
"step": 85
|
|
},
|
|
{
|
|
"entropy": 6.704812479019165,
|
|
"epoch": 0.09734991887506761,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 4.45e-05,
|
|
"loss": 6.455,
|
|
"mean_token_accuracy": 0.13043807074427605,
|
|
"num_tokens": 203352.0,
|
|
"step": 90
|
|
},
|
|
{
|
|
"entropy": 6.752549362182617,
|
|
"epoch": 0.10275824770146025,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 4.7000000000000004e-05,
|
|
"loss": 6.4423,
|
|
"mean_token_accuracy": 0.1375568687915802,
|
|
"num_tokens": 213810.0,
|
|
"step": 95
|
|
},
|
|
{
|
|
"entropy": 6.83305549621582,
|
|
"epoch": 0.10816657652785289,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 4.9500000000000004e-05,
|
|
"loss": 6.5476,
|
|
"mean_token_accuracy": 0.1357502222061157,
|
|
"num_tokens": 225310.0,
|
|
"step": 100
|
|
},
|
|
{
|
|
"entropy": 6.757467412948609,
|
|
"epoch": 0.11357490535424554,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 5.2e-05,
|
|
"loss": 6.3829,
|
|
"mean_token_accuracy": 0.13580593466758728,
|
|
"num_tokens": 236676.0,
|
|
"step": 105
|
|
},
|
|
{
|
|
"entropy": 6.749653005599976,
|
|
"epoch": 0.11898323418063818,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 5.45e-05,
|
|
"loss": 6.4842,
|
|
"mean_token_accuracy": 0.13619382083415985,
|
|
"num_tokens": 247453.0,
|
|
"step": 110
|
|
},
|
|
{
|
|
"entropy": 6.7436058044433596,
|
|
"epoch": 0.12439156300703083,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 5.7e-05,
|
|
"loss": 6.4908,
|
|
"mean_token_accuracy": 0.1296382687985897,
|
|
"num_tokens": 258267.0,
|
|
"step": 115
|
|
},
|
|
{
|
|
"entropy": 6.699334526062012,
|
|
"epoch": 0.12979989183342347,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 5.9499999999999996e-05,
|
|
"loss": 6.5306,
|
|
"mean_token_accuracy": 0.1270687237381935,
|
|
"num_tokens": 269839.0,
|
|
"step": 120
|
|
},
|
|
{
|
|
"entropy": 6.761990737915039,
|
|
"epoch": 0.1352082206598161,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 6.2e-05,
|
|
"loss": 6.5192,
|
|
"mean_token_accuracy": 0.13135910406708717,
|
|
"num_tokens": 281748.0,
|
|
"step": 125
|
|
},
|
|
{
|
|
"entropy": 6.810469007492065,
|
|
"epoch": 0.14061654948620878,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 6.450000000000001e-05,
|
|
"loss": 6.5302,
|
|
"mean_token_accuracy": 0.12570069655776023,
|
|
"num_tokens": 292592.0,
|
|
"step": 130
|
|
},
|
|
{
|
|
"entropy": 6.8416718482971195,
|
|
"epoch": 0.1460248783126014,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 6.7e-05,
|
|
"loss": 6.4401,
|
|
"mean_token_accuracy": 0.13145631179213524,
|
|
"num_tokens": 303122.0,
|
|
"step": 135
|
|
},
|
|
{
|
|
"entropy": 6.692539358139038,
|
|
"epoch": 0.15143320713899405,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 6.950000000000001e-05,
|
|
"loss": 6.3644,
|
|
"mean_token_accuracy": 0.13424549549818038,
|
|
"num_tokens": 314728.0,
|
|
"step": 140
|
|
},
|
|
{
|
|
"entropy": 6.719494438171386,
|
|
"epoch": 0.1568415359653867,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 7.2e-05,
|
|
"loss": 6.5632,
|
|
"mean_token_accuracy": 0.13301948606967925,
|
|
"num_tokens": 325292.0,
|
|
"step": 145
|
|
},
|
|
{
|
|
"entropy": 6.830582857131958,
|
|
"epoch": 0.16224986479177933,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 7.45e-05,
|
|
"loss": 6.5829,
|
|
"mean_token_accuracy": 0.1278594434261322,
|
|
"num_tokens": 336140.0,
|
|
"step": 150
|
|
},
|
|
{
|
|
"entropy": 6.741078948974609,
|
|
"epoch": 0.167658193618172,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 7.7e-05,
|
|
"loss": 6.4212,
|
|
"mean_token_accuracy": 0.13609526231884955,
|
|
"num_tokens": 346885.0,
|
|
"step": 155
|
|
},
|
|
{
|
|
"entropy": 6.667781114578247,
|
|
"epoch": 0.17306652244456464,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 7.950000000000001e-05,
|
|
"loss": 6.4422,
|
|
"mean_token_accuracy": 0.13269152715802193,
|
|
"num_tokens": 356630.0,
|
|
"step": 160
|
|
},
|
|
{
|
|
"entropy": 6.826272296905517,
|
|
"epoch": 0.17847485127095727,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 8.2e-05,
|
|
"loss": 6.4434,
|
|
"mean_token_accuracy": 0.13844147995114325,
|
|
"num_tokens": 366693.0,
|
|
"step": 165
|
|
},
|
|
{
|
|
"entropy": 6.623198461532593,
|
|
"epoch": 0.1838831800973499,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 8.450000000000001e-05,
|
|
"loss": 6.3919,
|
|
"mean_token_accuracy": 0.12981215193867685,
|
|
"num_tokens": 377779.0,
|
|
"step": 170
|
|
},
|
|
{
|
|
"entropy": 6.907767629623413,
|
|
"epoch": 0.18929150892374255,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 8.7e-05,
|
|
"loss": 6.5139,
|
|
"mean_token_accuracy": 0.1325360544025898,
|
|
"num_tokens": 388482.0,
|
|
"step": 175
|
|
},
|
|
{
|
|
"entropy": 6.72784013748169,
|
|
"epoch": 0.19469983775013522,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 8.95e-05,
|
|
"loss": 6.577,
|
|
"mean_token_accuracy": 0.13030516654253005,
|
|
"num_tokens": 400110.0,
|
|
"step": 180
|
|
},
|
|
{
|
|
"entropy": 6.742452812194824,
|
|
"epoch": 0.20010816657652786,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 9.2e-05,
|
|
"loss": 6.3125,
|
|
"mean_token_accuracy": 0.13682465478777886,
|
|
"num_tokens": 412535.0,
|
|
"step": 185
|
|
},
|
|
{
|
|
"entropy": 6.676760053634643,
|
|
"epoch": 0.2055164954029205,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 9.45e-05,
|
|
"loss": 6.4502,
|
|
"mean_token_accuracy": 0.13751535415649413,
|
|
"num_tokens": 424309.0,
|
|
"step": 190
|
|
},
|
|
{
|
|
"entropy": 6.74865140914917,
|
|
"epoch": 0.21092482422931313,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 9.7e-05,
|
|
"loss": 6.4565,
|
|
"mean_token_accuracy": 0.13581018298864364,
|
|
"num_tokens": 435592.0,
|
|
"step": 195
|
|
},
|
|
{
|
|
"entropy": 6.591330480575562,
|
|
"epoch": 0.21633315305570577,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 9.95e-05,
|
|
"loss": 6.3516,
|
|
"mean_token_accuracy": 0.1346059188246727,
|
|
"num_tokens": 446767.0,
|
|
"step": 200
|
|
},
|
|
{
|
|
"entropy": 6.724362230300903,
|
|
"epoch": 0.22174148188209844,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.000102,
|
|
"loss": 6.3719,
|
|
"mean_token_accuracy": 0.1348101980984211,
|
|
"num_tokens": 457959.0,
|
|
"step": 205
|
|
},
|
|
{
|
|
"entropy": 6.5875874042510985,
|
|
"epoch": 0.22714981070849108,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00010449999999999999,
|
|
"loss": 6.3364,
|
|
"mean_token_accuracy": 0.14194149523973465,
|
|
"num_tokens": 468107.0,
|
|
"step": 210
|
|
},
|
|
{
|
|
"entropy": 6.896349143981934,
|
|
"epoch": 0.23255813953488372,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.000107,
|
|
"loss": 6.5223,
|
|
"mean_token_accuracy": 0.13508757278323175,
|
|
"num_tokens": 478954.0,
|
|
"step": 215
|
|
},
|
|
{
|
|
"entropy": 6.597625112533569,
|
|
"epoch": 0.23796646836127636,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0001095,
|
|
"loss": 6.436,
|
|
"mean_token_accuracy": 0.12944695577025414,
|
|
"num_tokens": 490297.0,
|
|
"step": 220
|
|
},
|
|
{
|
|
"entropy": 6.734339427947998,
|
|
"epoch": 0.24337479718766902,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.000112,
|
|
"loss": 6.4306,
|
|
"mean_token_accuracy": 0.1379121758043766,
|
|
"num_tokens": 501597.0,
|
|
"step": 225
|
|
},
|
|
{
|
|
"entropy": 6.699416732788086,
|
|
"epoch": 0.24878312601406166,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0001145,
|
|
"loss": 6.4431,
|
|
"mean_token_accuracy": 0.13053352981805802,
|
|
"num_tokens": 514182.0,
|
|
"step": 230
|
|
},
|
|
{
|
|
"entropy": 6.637861156463623,
|
|
"epoch": 0.2541914548404543,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00011700000000000001,
|
|
"loss": 6.3907,
|
|
"mean_token_accuracy": 0.1391088232398033,
|
|
"num_tokens": 525972.0,
|
|
"step": 235
|
|
},
|
|
{
|
|
"entropy": 6.706511783599853,
|
|
"epoch": 0.25959978366684694,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00011949999999999999,
|
|
"loss": 6.3833,
|
|
"mean_token_accuracy": 0.1393005795776844,
|
|
"num_tokens": 537445.0,
|
|
"step": 240
|
|
},
|
|
{
|
|
"entropy": 6.676162910461426,
|
|
"epoch": 0.2650081124932396,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.000122,
|
|
"loss": 6.4325,
|
|
"mean_token_accuracy": 0.13711966052651406,
|
|
"num_tokens": 548599.0,
|
|
"step": 245
|
|
},
|
|
{
|
|
"entropy": 6.67521448135376,
|
|
"epoch": 0.2704164413196322,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0001245,
|
|
"loss": 6.3094,
|
|
"mean_token_accuracy": 0.1379949890077114,
|
|
"num_tokens": 559222.0,
|
|
"step": 250
|
|
},
|
|
{
|
|
"entropy": 6.713015365600586,
|
|
"epoch": 0.27582477014602486,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.000127,
|
|
"loss": 6.4632,
|
|
"mean_token_accuracy": 0.12452752217650413,
|
|
"num_tokens": 568949.0,
|
|
"step": 255
|
|
},
|
|
{
|
|
"entropy": 6.779383373260498,
|
|
"epoch": 0.28123309897241755,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0001295,
|
|
"loss": 6.4922,
|
|
"mean_token_accuracy": 0.13144948631525039,
|
|
"num_tokens": 580029.0,
|
|
"step": 260
|
|
},
|
|
{
|
|
"entropy": 6.726202201843262,
|
|
"epoch": 0.2866414277988102,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.000132,
|
|
"loss": 6.4077,
|
|
"mean_token_accuracy": 0.1364477679133415,
|
|
"num_tokens": 591633.0,
|
|
"step": 265
|
|
},
|
|
{
|
|
"entropy": 6.753827857971191,
|
|
"epoch": 0.2920497566252028,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00013450000000000002,
|
|
"loss": 6.4197,
|
|
"mean_token_accuracy": 0.1380621761083603,
|
|
"num_tokens": 602511.0,
|
|
"step": 270
|
|
},
|
|
{
|
|
"entropy": 6.733678150177002,
|
|
"epoch": 0.29745808545159547,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00013700000000000002,
|
|
"loss": 6.4977,
|
|
"mean_token_accuracy": 0.1339564248919487,
|
|
"num_tokens": 613318.0,
|
|
"step": 275
|
|
},
|
|
{
|
|
"entropy": 6.607444524765015,
|
|
"epoch": 0.3028664142779881,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.0001395,
|
|
"loss": 6.3873,
|
|
"mean_token_accuracy": 0.13400006145238877,
|
|
"num_tokens": 624043.0,
|
|
"step": 280
|
|
},
|
|
{
|
|
"entropy": 6.67069182395935,
|
|
"epoch": 0.30827474310438074,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.00014199999999999998,
|
|
"loss": 6.3469,
|
|
"mean_token_accuracy": 0.14132973700761794,
|
|
"num_tokens": 634713.0,
|
|
"step": 285
|
|
},
|
|
{
|
|
"entropy": 6.528910064697266,
|
|
"epoch": 0.3136830719307734,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0001445,
|
|
"loss": 6.2954,
|
|
"mean_token_accuracy": 0.13748166486620902,
|
|
"num_tokens": 645491.0,
|
|
"step": 290
|
|
},
|
|
{
|
|
"entropy": 6.753203821182251,
|
|
"epoch": 0.319091400757166,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.000147,
|
|
"loss": 6.4336,
|
|
"mean_token_accuracy": 0.13378573432564736,
|
|
"num_tokens": 656832.0,
|
|
"step": 295
|
|
},
|
|
{
|
|
"entropy": 6.682645654678344,
|
|
"epoch": 0.32449972958355866,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.0001495,
|
|
"loss": 6.3984,
|
|
"mean_token_accuracy": 0.13327668309211732,
|
|
"num_tokens": 668499.0,
|
|
"step": 300
|
|
},
|
|
{
|
|
"entropy": 6.722540235519409,
|
|
"epoch": 0.3299080584099513,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.000152,
|
|
"loss": 6.4665,
|
|
"mean_token_accuracy": 0.1349737487733364,
|
|
"num_tokens": 679962.0,
|
|
"step": 305
|
|
},
|
|
{
|
|
"entropy": 6.740982961654663,
|
|
"epoch": 0.335316387236344,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.00015450000000000001,
|
|
"loss": 6.4479,
|
|
"mean_token_accuracy": 0.13650912493467332,
|
|
"num_tokens": 692170.0,
|
|
"step": 310
|
|
},
|
|
{
|
|
"entropy": 6.57421088218689,
|
|
"epoch": 0.34072471606273663,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.000157,
|
|
"loss": 6.3711,
|
|
"mean_token_accuracy": 0.13764476627111435,
|
|
"num_tokens": 702886.0,
|
|
"step": 315
|
|
},
|
|
{
|
|
"entropy": 6.688414525985718,
|
|
"epoch": 0.34613304488912927,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0001595,
|
|
"loss": 6.4313,
|
|
"mean_token_accuracy": 0.13261876478791237,
|
|
"num_tokens": 714257.0,
|
|
"step": 320
|
|
},
|
|
{
|
|
"entropy": 6.638928413391113,
|
|
"epoch": 0.3515413737155219,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.000162,
|
|
"loss": 6.4197,
|
|
"mean_token_accuracy": 0.13729432821273804,
|
|
"num_tokens": 725751.0,
|
|
"step": 325
|
|
},
|
|
{
|
|
"entropy": 6.782710266113281,
|
|
"epoch": 0.35694970254191455,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.00016450000000000001,
|
|
"loss": 6.4891,
|
|
"mean_token_accuracy": 0.1316055290400982,
|
|
"num_tokens": 737147.0,
|
|
"step": 330
|
|
},
|
|
{
|
|
"entropy": 6.616734218597412,
|
|
"epoch": 0.3623580313683072,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.00016700000000000002,
|
|
"loss": 6.3442,
|
|
"mean_token_accuracy": 0.14010964184999466,
|
|
"num_tokens": 748439.0,
|
|
"step": 335
|
|
},
|
|
{
|
|
"entropy": 6.645461893081665,
|
|
"epoch": 0.3677663601946998,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00016950000000000003,
|
|
"loss": 6.3558,
|
|
"mean_token_accuracy": 0.1416398137807846,
|
|
"num_tokens": 760380.0,
|
|
"step": 340
|
|
},
|
|
{
|
|
"entropy": 6.582087898254395,
|
|
"epoch": 0.37317468902109246,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00017199999999999998,
|
|
"loss": 6.3419,
|
|
"mean_token_accuracy": 0.13614206165075302,
|
|
"num_tokens": 770827.0,
|
|
"step": 345
|
|
},
|
|
{
|
|
"entropy": 6.588772773742676,
|
|
"epoch": 0.3785830178474851,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.00017449999999999999,
|
|
"loss": 6.371,
|
|
"mean_token_accuracy": 0.130119176954031,
|
|
"num_tokens": 781887.0,
|
|
"step": 350
|
|
},
|
|
{
|
|
"entropy": 6.6461952209472654,
|
|
"epoch": 0.3839913466738778,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.000177,
|
|
"loss": 6.3707,
|
|
"mean_token_accuracy": 0.12962670475244523,
|
|
"num_tokens": 792676.0,
|
|
"step": 355
|
|
},
|
|
{
|
|
"entropy": 6.811271715164184,
|
|
"epoch": 0.38939967550027044,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0001795,
|
|
"loss": 6.5791,
|
|
"mean_token_accuracy": 0.13036322295665742,
|
|
"num_tokens": 804148.0,
|
|
"step": 360
|
|
},
|
|
{
|
|
"entropy": 6.647534465789795,
|
|
"epoch": 0.3948080043266631,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.000182,
|
|
"loss": 6.3464,
|
|
"mean_token_accuracy": 0.13733255341649056,
|
|
"num_tokens": 815835.0,
|
|
"step": 365
|
|
},
|
|
{
|
|
"entropy": 6.539557218551636,
|
|
"epoch": 0.4002163331530557,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0001845,
|
|
"loss": 6.2902,
|
|
"mean_token_accuracy": 0.14055102020502092,
|
|
"num_tokens": 827975.0,
|
|
"step": 370
|
|
},
|
|
{
|
|
"entropy": 6.627246284484864,
|
|
"epoch": 0.40562466197944835,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.000187,
|
|
"loss": 6.3392,
|
|
"mean_token_accuracy": 0.13682809248566627,
|
|
"num_tokens": 838982.0,
|
|
"step": 375
|
|
},
|
|
{
|
|
"entropy": 6.624072790145874,
|
|
"epoch": 0.411032990805841,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0001895,
|
|
"loss": 6.4402,
|
|
"mean_token_accuracy": 0.13047717586159707,
|
|
"num_tokens": 851377.0,
|
|
"step": 380
|
|
},
|
|
{
|
|
"entropy": 6.7495063781738285,
|
|
"epoch": 0.41644131963223363,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.000192,
|
|
"loss": 6.4657,
|
|
"mean_token_accuracy": 0.13667654022574424,
|
|
"num_tokens": 862593.0,
|
|
"step": 385
|
|
},
|
|
{
|
|
"entropy": 6.551447343826294,
|
|
"epoch": 0.42184964845862627,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0001945,
|
|
"loss": 6.3196,
|
|
"mean_token_accuracy": 0.1354401208460331,
|
|
"num_tokens": 873906.0,
|
|
"step": 390
|
|
},
|
|
{
|
|
"entropy": 6.712440156936646,
|
|
"epoch": 0.4272579772850189,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.00019700000000000002,
|
|
"loss": 6.4657,
|
|
"mean_token_accuracy": 0.1353951647877693,
|
|
"num_tokens": 884477.0,
|
|
"step": 395
|
|
},
|
|
{
|
|
"entropy": 6.659290027618408,
|
|
"epoch": 0.43266630611141155,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00019950000000000002,
|
|
"loss": 6.3206,
|
|
"mean_token_accuracy": 0.13656646832823754,
|
|
"num_tokens": 896151.0,
|
|
"step": 400
|
|
},
|
|
{
|
|
"entropy": 6.6360023021698,
|
|
"epoch": 0.43807463493780424,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.000202,
|
|
"loss": 6.4024,
|
|
"mean_token_accuracy": 0.13927194178104402,
|
|
"num_tokens": 907580.0,
|
|
"step": 405
|
|
},
|
|
{
|
|
"entropy": 6.59203953742981,
|
|
"epoch": 0.4434829637641969,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00020449999999999998,
|
|
"loss": 6.3489,
|
|
"mean_token_accuracy": 0.13741599917411804,
|
|
"num_tokens": 918141.0,
|
|
"step": 410
|
|
},
|
|
{
|
|
"entropy": 6.65588059425354,
|
|
"epoch": 0.4488912925905895,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.000207,
|
|
"loss": 6.3899,
|
|
"mean_token_accuracy": 0.14542332291603088,
|
|
"num_tokens": 929868.0,
|
|
"step": 415
|
|
},
|
|
{
|
|
"entropy": 6.4867551803588865,
|
|
"epoch": 0.45429962141698216,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0002095,
|
|
"loss": 6.2806,
|
|
"mean_token_accuracy": 0.13965032547712325,
|
|
"num_tokens": 940582.0,
|
|
"step": 420
|
|
},
|
|
{
|
|
"entropy": 6.6291666507720945,
|
|
"epoch": 0.4597079502433748,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.000212,
|
|
"loss": 6.3463,
|
|
"mean_token_accuracy": 0.13679536208510398,
|
|
"num_tokens": 952233.0,
|
|
"step": 425
|
|
},
|
|
{
|
|
"entropy": 6.669621229171753,
|
|
"epoch": 0.46511627906976744,
|
|
"grad_norm": 1.515625,
|
|
"learning_rate": 0.0002145,
|
|
"loss": 6.4395,
|
|
"mean_token_accuracy": 0.13214596956968308,
|
|
"num_tokens": 964252.0,
|
|
"step": 430
|
|
},
|
|
{
|
|
"entropy": 6.623089265823364,
|
|
"epoch": 0.4705246078961601,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00021700000000000002,
|
|
"loss": 6.3381,
|
|
"mean_token_accuracy": 0.1373963512480259,
|
|
"num_tokens": 974692.0,
|
|
"step": 435
|
|
},
|
|
{
|
|
"entropy": 6.575704860687256,
|
|
"epoch": 0.4759329367225527,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0002195,
|
|
"loss": 6.354,
|
|
"mean_token_accuracy": 0.13740625306963922,
|
|
"num_tokens": 986019.0,
|
|
"step": 440
|
|
},
|
|
{
|
|
"entropy": 6.479989528656006,
|
|
"epoch": 0.48134126554894535,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 0.000222,
|
|
"loss": 6.2588,
|
|
"mean_token_accuracy": 0.1383764624595642,
|
|
"num_tokens": 996701.0,
|
|
"step": 445
|
|
},
|
|
{
|
|
"entropy": 6.638360166549683,
|
|
"epoch": 0.48674959437533805,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0002245,
|
|
"loss": 6.3562,
|
|
"mean_token_accuracy": 0.1420356035232544,
|
|
"num_tokens": 1008596.0,
|
|
"step": 450
|
|
},
|
|
{
|
|
"entropy": 6.603897285461426,
|
|
"epoch": 0.4921579232017307,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00022700000000000002,
|
|
"loss": 6.3896,
|
|
"mean_token_accuracy": 0.13321260511875152,
|
|
"num_tokens": 1019263.0,
|
|
"step": 455
|
|
},
|
|
{
|
|
"entropy": 6.627950143814087,
|
|
"epoch": 0.4975662520281233,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.00022950000000000002,
|
|
"loss": 6.3281,
|
|
"mean_token_accuracy": 0.13852308169007302,
|
|
"num_tokens": 1029460.0,
|
|
"step": 460
|
|
},
|
|
{
|
|
"entropy": 6.532049703598022,
|
|
"epoch": 0.502974580854516,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00023200000000000003,
|
|
"loss": 6.3947,
|
|
"mean_token_accuracy": 0.13395455181598664,
|
|
"num_tokens": 1041747.0,
|
|
"step": 465
|
|
},
|
|
{
|
|
"entropy": 6.580554580688476,
|
|
"epoch": 0.5083829096809086,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.00023449999999999998,
|
|
"loss": 6.2302,
|
|
"mean_token_accuracy": 0.13726723864674567,
|
|
"num_tokens": 1051645.0,
|
|
"step": 470
|
|
},
|
|
{
|
|
"entropy": 6.394359159469604,
|
|
"epoch": 0.5137912385073012,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.000237,
|
|
"loss": 6.1471,
|
|
"mean_token_accuracy": 0.14182863682508468,
|
|
"num_tokens": 1062358.0,
|
|
"step": 475
|
|
},
|
|
{
|
|
"entropy": 6.6230544090271,
|
|
"epoch": 0.5191995673336939,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0002395,
|
|
"loss": 6.3291,
|
|
"mean_token_accuracy": 0.13732218518853187,
|
|
"num_tokens": 1074234.0,
|
|
"step": 480
|
|
},
|
|
{
|
|
"entropy": 6.400064849853516,
|
|
"epoch": 0.5246078961600865,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.000242,
|
|
"loss": 6.257,
|
|
"mean_token_accuracy": 0.1385449767112732,
|
|
"num_tokens": 1086608.0,
|
|
"step": 485
|
|
},
|
|
{
|
|
"entropy": 6.640989637374878,
|
|
"epoch": 0.5300162249864792,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0002445,
|
|
"loss": 6.3092,
|
|
"mean_token_accuracy": 0.1422146663069725,
|
|
"num_tokens": 1096878.0,
|
|
"step": 490
|
|
},
|
|
{
|
|
"entropy": 6.501981782913208,
|
|
"epoch": 0.5354245538128718,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.000247,
|
|
"loss": 6.3667,
|
|
"mean_token_accuracy": 0.14159199818968773,
|
|
"num_tokens": 1108089.0,
|
|
"step": 495
|
|
},
|
|
{
|
|
"entropy": 6.608476877212524,
|
|
"epoch": 0.5408328826392644,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0002495,
|
|
"loss": 6.3983,
|
|
"mean_token_accuracy": 0.13436152264475823,
|
|
"num_tokens": 1120910.0,
|
|
"step": 500
|
|
},
|
|
{
|
|
"entropy": 6.558342504501343,
|
|
"epoch": 0.5462412114656571,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.000252,
|
|
"loss": 6.2966,
|
|
"mean_token_accuracy": 0.13886259347200394,
|
|
"num_tokens": 1131685.0,
|
|
"step": 505
|
|
},
|
|
{
|
|
"entropy": 6.493104648590088,
|
|
"epoch": 0.5516495402920497,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0002545,
|
|
"loss": 6.337,
|
|
"mean_token_accuracy": 0.13808612152934074,
|
|
"num_tokens": 1142273.0,
|
|
"step": 510
|
|
},
|
|
{
|
|
"entropy": 6.593916702270508,
|
|
"epoch": 0.5570578691184424,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.000257,
|
|
"loss": 6.212,
|
|
"mean_token_accuracy": 0.1403546467423439,
|
|
"num_tokens": 1152818.0,
|
|
"step": 515
|
|
},
|
|
{
|
|
"entropy": 6.4184082508087155,
|
|
"epoch": 0.5624661979448351,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0002595,
|
|
"loss": 6.2539,
|
|
"mean_token_accuracy": 0.14156585782766343,
|
|
"num_tokens": 1163398.0,
|
|
"step": 520
|
|
},
|
|
{
|
|
"entropy": 6.639800310134888,
|
|
"epoch": 0.5678745267712277,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.000262,
|
|
"loss": 6.3113,
|
|
"mean_token_accuracy": 0.14177494123578072,
|
|
"num_tokens": 1174493.0,
|
|
"step": 525
|
|
},
|
|
{
|
|
"entropy": 6.449878311157226,
|
|
"epoch": 0.5732828555976204,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.00026450000000000003,
|
|
"loss": 6.2964,
|
|
"mean_token_accuracy": 0.14197195023298265,
|
|
"num_tokens": 1185534.0,
|
|
"step": 530
|
|
},
|
|
{
|
|
"entropy": 6.524397659301758,
|
|
"epoch": 0.578691184424013,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 0.00026700000000000004,
|
|
"loss": 6.2393,
|
|
"mean_token_accuracy": 0.14146455824375154,
|
|
"num_tokens": 1196488.0,
|
|
"step": 535
|
|
},
|
|
{
|
|
"entropy": 6.451419448852539,
|
|
"epoch": 0.5840995132504057,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.00026950000000000005,
|
|
"loss": 6.3155,
|
|
"mean_token_accuracy": 0.139084542542696,
|
|
"num_tokens": 1208116.0,
|
|
"step": 540
|
|
},
|
|
{
|
|
"entropy": 6.48581862449646,
|
|
"epoch": 0.5895078420767983,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00027200000000000005,
|
|
"loss": 6.3035,
|
|
"mean_token_accuracy": 0.14370152205228806,
|
|
"num_tokens": 1219571.0,
|
|
"step": 545
|
|
},
|
|
{
|
|
"entropy": 6.518029594421387,
|
|
"epoch": 0.5949161709031909,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0002745,
|
|
"loss": 6.2869,
|
|
"mean_token_accuracy": 0.13986791446805,
|
|
"num_tokens": 1231049.0,
|
|
"step": 550
|
|
},
|
|
{
|
|
"entropy": 6.475363636016846,
|
|
"epoch": 0.6003244997295836,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.000277,
|
|
"loss": 6.3097,
|
|
"mean_token_accuracy": 0.1364640511572361,
|
|
"num_tokens": 1242507.0,
|
|
"step": 555
|
|
},
|
|
{
|
|
"entropy": 6.44856014251709,
|
|
"epoch": 0.6057328285559762,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0002795,
|
|
"loss": 6.2934,
|
|
"mean_token_accuracy": 0.13697041645646096,
|
|
"num_tokens": 1253607.0,
|
|
"step": 560
|
|
},
|
|
{
|
|
"entropy": 6.528074312210083,
|
|
"epoch": 0.6111411573823688,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00028199999999999997,
|
|
"loss": 6.3358,
|
|
"mean_token_accuracy": 0.13758110031485557,
|
|
"num_tokens": 1266604.0,
|
|
"step": 565
|
|
},
|
|
{
|
|
"entropy": 6.573901605606079,
|
|
"epoch": 0.6165494862087615,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0002845,
|
|
"loss": 6.3815,
|
|
"mean_token_accuracy": 0.13712944313883782,
|
|
"num_tokens": 1276930.0,
|
|
"step": 570
|
|
},
|
|
{
|
|
"entropy": 6.598294305801391,
|
|
"epoch": 0.6219578150351541,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.000287,
|
|
"loss": 6.3853,
|
|
"mean_token_accuracy": 0.13915850892663,
|
|
"num_tokens": 1288326.0,
|
|
"step": 575
|
|
},
|
|
{
|
|
"entropy": 6.450491666793823,
|
|
"epoch": 0.6273661438615468,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.0002895,
|
|
"loss": 6.3287,
|
|
"mean_token_accuracy": 0.13975025117397308,
|
|
"num_tokens": 1298950.0,
|
|
"step": 580
|
|
},
|
|
{
|
|
"entropy": 6.524539470672607,
|
|
"epoch": 0.6327744726879394,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.000292,
|
|
"loss": 6.3231,
|
|
"mean_token_accuracy": 0.13521830812096597,
|
|
"num_tokens": 1311254.0,
|
|
"step": 585
|
|
},
|
|
{
|
|
"entropy": 6.515868997573852,
|
|
"epoch": 0.638182801514332,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0002945,
|
|
"loss": 6.2362,
|
|
"mean_token_accuracy": 0.13961164206266402,
|
|
"num_tokens": 1322723.0,
|
|
"step": 590
|
|
},
|
|
{
|
|
"entropy": 6.4743040084838865,
|
|
"epoch": 0.6435911303407247,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.000297,
|
|
"loss": 6.2488,
|
|
"mean_token_accuracy": 0.14040838554501534,
|
|
"num_tokens": 1333998.0,
|
|
"step": 595
|
|
},
|
|
{
|
|
"entropy": 6.309730291366577,
|
|
"epoch": 0.6489994591671173,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0002995,
|
|
"loss": 6.1926,
|
|
"mean_token_accuracy": 0.14279944226145744,
|
|
"num_tokens": 1345113.0,
|
|
"step": 600
|
|
},
|
|
{
|
|
"entropy": 6.439900350570679,
|
|
"epoch": 0.65440778799351,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.000302,
|
|
"loss": 6.2886,
|
|
"mean_token_accuracy": 0.14252566993236543,
|
|
"num_tokens": 1356850.0,
|
|
"step": 605
|
|
},
|
|
{
|
|
"entropy": 6.550169944763184,
|
|
"epoch": 0.6598161168199026,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0003045,
|
|
"loss": 6.3744,
|
|
"mean_token_accuracy": 0.1397650845348835,
|
|
"num_tokens": 1369671.0,
|
|
"step": 610
|
|
},
|
|
{
|
|
"entropy": 6.427625703811645,
|
|
"epoch": 0.6652244456462953,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.000307,
|
|
"loss": 6.2835,
|
|
"mean_token_accuracy": 0.13882820978760718,
|
|
"num_tokens": 1380298.0,
|
|
"step": 615
|
|
},
|
|
{
|
|
"entropy": 6.527406787872314,
|
|
"epoch": 0.670632774472688,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0003095,
|
|
"loss": 6.2763,
|
|
"mean_token_accuracy": 0.13872483968734742,
|
|
"num_tokens": 1391617.0,
|
|
"step": 620
|
|
},
|
|
{
|
|
"entropy": 6.535118579864502,
|
|
"epoch": 0.6760411032990806,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.000312,
|
|
"loss": 6.3461,
|
|
"mean_token_accuracy": 0.14173057228326796,
|
|
"num_tokens": 1403509.0,
|
|
"step": 625
|
|
},
|
|
{
|
|
"entropy": 6.511589908599854,
|
|
"epoch": 0.6814494321254733,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0003145,
|
|
"loss": 6.4039,
|
|
"mean_token_accuracy": 0.13432303741574286,
|
|
"num_tokens": 1415125.0,
|
|
"step": 630
|
|
},
|
|
{
|
|
"entropy": 6.580691337585449,
|
|
"epoch": 0.6868577609518659,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.000317,
|
|
"loss": 6.402,
|
|
"mean_token_accuracy": 0.13456533700227738,
|
|
"num_tokens": 1426785.0,
|
|
"step": 635
|
|
},
|
|
{
|
|
"entropy": 6.480119514465332,
|
|
"epoch": 0.6922660897782585,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0003195,
|
|
"loss": 6.3605,
|
|
"mean_token_accuracy": 0.12881308048963547,
|
|
"num_tokens": 1439013.0,
|
|
"step": 640
|
|
},
|
|
{
|
|
"entropy": 6.417783641815186,
|
|
"epoch": 0.6976744186046512,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.000322,
|
|
"loss": 6.2202,
|
|
"mean_token_accuracy": 0.14642192423343658,
|
|
"num_tokens": 1449818.0,
|
|
"step": 645
|
|
},
|
|
{
|
|
"entropy": 6.413159942626953,
|
|
"epoch": 0.7030827474310438,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00032450000000000003,
|
|
"loss": 6.1358,
|
|
"mean_token_accuracy": 0.1415444567799568,
|
|
"num_tokens": 1460681.0,
|
|
"step": 650
|
|
},
|
|
{
|
|
"entropy": 6.338744592666626,
|
|
"epoch": 0.7084910762574365,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00032700000000000003,
|
|
"loss": 6.2476,
|
|
"mean_token_accuracy": 0.13981930315494537,
|
|
"num_tokens": 1471840.0,
|
|
"step": 655
|
|
},
|
|
{
|
|
"entropy": 6.466752004623413,
|
|
"epoch": 0.7138994050838291,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.00032950000000000004,
|
|
"loss": 6.2436,
|
|
"mean_token_accuracy": 0.14259599149227142,
|
|
"num_tokens": 1482326.0,
|
|
"step": 660
|
|
},
|
|
{
|
|
"entropy": 6.328251123428345,
|
|
"epoch": 0.7193077339102217,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00033200000000000005,
|
|
"loss": 6.1715,
|
|
"mean_token_accuracy": 0.14127768352627754,
|
|
"num_tokens": 1493277.0,
|
|
"step": 665
|
|
},
|
|
{
|
|
"entropy": 6.4282067775726315,
|
|
"epoch": 0.7247160627366144,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.00033450000000000005,
|
|
"loss": 6.2511,
|
|
"mean_token_accuracy": 0.14475265368819237,
|
|
"num_tokens": 1504563.0,
|
|
"step": 670
|
|
},
|
|
{
|
|
"entropy": 6.372472429275513,
|
|
"epoch": 0.730124391563007,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.000337,
|
|
"loss": 6.2369,
|
|
"mean_token_accuracy": 0.1476322367787361,
|
|
"num_tokens": 1516311.0,
|
|
"step": 675
|
|
},
|
|
{
|
|
"entropy": 6.354723262786865,
|
|
"epoch": 0.7355327203893997,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0003395,
|
|
"loss": 6.1563,
|
|
"mean_token_accuracy": 0.14649124294519425,
|
|
"num_tokens": 1527391.0,
|
|
"step": 680
|
|
},
|
|
{
|
|
"entropy": 6.439003276824951,
|
|
"epoch": 0.7409410492157923,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.000342,
|
|
"loss": 6.2846,
|
|
"mean_token_accuracy": 0.14316972196102143,
|
|
"num_tokens": 1537755.0,
|
|
"step": 685
|
|
},
|
|
{
|
|
"entropy": 6.466528415679932,
|
|
"epoch": 0.7463493780421849,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00034449999999999997,
|
|
"loss": 6.3203,
|
|
"mean_token_accuracy": 0.1379350833594799,
|
|
"num_tokens": 1550525.0,
|
|
"step": 690
|
|
},
|
|
{
|
|
"entropy": 6.425952291488647,
|
|
"epoch": 0.7517577068685776,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.000347,
|
|
"loss": 6.2344,
|
|
"mean_token_accuracy": 0.14136113673448564,
|
|
"num_tokens": 1561995.0,
|
|
"step": 695
|
|
},
|
|
{
|
|
"entropy": 6.384309434890747,
|
|
"epoch": 0.7571660356949702,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0003495,
|
|
"loss": 6.2363,
|
|
"mean_token_accuracy": 0.13751797899603843,
|
|
"num_tokens": 1573137.0,
|
|
"step": 700
|
|
},
|
|
{
|
|
"entropy": 6.332474660873413,
|
|
"epoch": 0.7625743645213628,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.000352,
|
|
"loss": 6.2516,
|
|
"mean_token_accuracy": 0.1449413001537323,
|
|
"num_tokens": 1584938.0,
|
|
"step": 705
|
|
},
|
|
{
|
|
"entropy": 6.549186563491821,
|
|
"epoch": 0.7679826933477556,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0003545,
|
|
"loss": 6.308,
|
|
"mean_token_accuracy": 0.1355679027736187,
|
|
"num_tokens": 1596306.0,
|
|
"step": 710
|
|
},
|
|
{
|
|
"entropy": 6.34313998222351,
|
|
"epoch": 0.7733910221741482,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.000357,
|
|
"loss": 6.2934,
|
|
"mean_token_accuracy": 0.14217483699321748,
|
|
"num_tokens": 1608112.0,
|
|
"step": 715
|
|
},
|
|
{
|
|
"entropy": 6.5022155284881595,
|
|
"epoch": 0.7787993510005409,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0003595,
|
|
"loss": 6.2833,
|
|
"mean_token_accuracy": 0.14302016869187356,
|
|
"num_tokens": 1618635.0,
|
|
"step": 720
|
|
},
|
|
{
|
|
"entropy": 6.277605819702148,
|
|
"epoch": 0.7842076798269335,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.000362,
|
|
"loss": 6.1878,
|
|
"mean_token_accuracy": 0.14160637855529784,
|
|
"num_tokens": 1629476.0,
|
|
"step": 725
|
|
},
|
|
{
|
|
"entropy": 6.544418144226074,
|
|
"epoch": 0.7896160086533262,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0003645,
|
|
"loss": 6.2851,
|
|
"mean_token_accuracy": 0.14023412466049195,
|
|
"num_tokens": 1641305.0,
|
|
"step": 730
|
|
},
|
|
{
|
|
"entropy": 6.323581790924072,
|
|
"epoch": 0.7950243374797188,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.000367,
|
|
"loss": 6.228,
|
|
"mean_token_accuracy": 0.1453120455145836,
|
|
"num_tokens": 1653424.0,
|
|
"step": 735
|
|
},
|
|
{
|
|
"entropy": 6.338683032989502,
|
|
"epoch": 0.8004326663061114,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.0003695,
|
|
"loss": 6.2738,
|
|
"mean_token_accuracy": 0.13886456340551376,
|
|
"num_tokens": 1664222.0,
|
|
"step": 740
|
|
},
|
|
{
|
|
"entropy": 6.45950026512146,
|
|
"epoch": 0.8058409951325041,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.000372,
|
|
"loss": 6.3182,
|
|
"mean_token_accuracy": 0.13927288502454757,
|
|
"num_tokens": 1676829.0,
|
|
"step": 745
|
|
},
|
|
{
|
|
"entropy": 6.389509057998657,
|
|
"epoch": 0.8112493239588967,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0003745,
|
|
"loss": 6.2171,
|
|
"mean_token_accuracy": 0.13743837997317315,
|
|
"num_tokens": 1688534.0,
|
|
"step": 750
|
|
},
|
|
{
|
|
"entropy": 6.2615196228027346,
|
|
"epoch": 0.8166576527852893,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.000377,
|
|
"loss": 6.1995,
|
|
"mean_token_accuracy": 0.14325060099363326,
|
|
"num_tokens": 1699051.0,
|
|
"step": 755
|
|
},
|
|
{
|
|
"entropy": 6.446281814575196,
|
|
"epoch": 0.822065981611682,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0003795,
|
|
"loss": 6.2276,
|
|
"mean_token_accuracy": 0.13753046318888665,
|
|
"num_tokens": 1709849.0,
|
|
"step": 760
|
|
},
|
|
{
|
|
"entropy": 6.236609411239624,
|
|
"epoch": 0.8274743104380746,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.000382,
|
|
"loss": 6.0689,
|
|
"mean_token_accuracy": 0.15064243003726005,
|
|
"num_tokens": 1721956.0,
|
|
"step": 765
|
|
},
|
|
{
|
|
"entropy": 6.327112913131714,
|
|
"epoch": 0.8328826392644673,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0003845,
|
|
"loss": 6.0921,
|
|
"mean_token_accuracy": 0.15326208472251893,
|
|
"num_tokens": 1733302.0,
|
|
"step": 770
|
|
},
|
|
{
|
|
"entropy": 6.198913812637329,
|
|
"epoch": 0.8382909680908599,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00038700000000000003,
|
|
"loss": 6.041,
|
|
"mean_token_accuracy": 0.15577499121427535,
|
|
"num_tokens": 1744835.0,
|
|
"step": 775
|
|
},
|
|
{
|
|
"entropy": 6.3341676712036135,
|
|
"epoch": 0.8436992969172525,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00038950000000000003,
|
|
"loss": 6.1797,
|
|
"mean_token_accuracy": 0.14762855991721152,
|
|
"num_tokens": 1755174.0,
|
|
"step": 780
|
|
},
|
|
{
|
|
"entropy": 6.381376791000366,
|
|
"epoch": 0.8491076257436452,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00039200000000000004,
|
|
"loss": 6.3989,
|
|
"mean_token_accuracy": 0.13875442296266555,
|
|
"num_tokens": 1767572.0,
|
|
"step": 785
|
|
},
|
|
{
|
|
"entropy": 6.218066310882568,
|
|
"epoch": 0.8545159545700378,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00039450000000000005,
|
|
"loss": 6.1405,
|
|
"mean_token_accuracy": 0.1449118934571743,
|
|
"num_tokens": 1777537.0,
|
|
"step": 790
|
|
},
|
|
{
|
|
"entropy": 6.425797414779663,
|
|
"epoch": 0.8599242833964305,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00039700000000000005,
|
|
"loss": 6.1712,
|
|
"mean_token_accuracy": 0.14846592620015145,
|
|
"num_tokens": 1789731.0,
|
|
"step": 795
|
|
},
|
|
{
|
|
"entropy": 6.419421625137329,
|
|
"epoch": 0.8653326122228231,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0003995,
|
|
"loss": 6.3029,
|
|
"mean_token_accuracy": 0.14081404209136963,
|
|
"num_tokens": 1800754.0,
|
|
"step": 800
|
|
},
|
|
{
|
|
"entropy": 6.272062110900879,
|
|
"epoch": 0.8707409410492158,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.000402,
|
|
"loss": 6.2734,
|
|
"mean_token_accuracy": 0.1466397300362587,
|
|
"num_tokens": 1811496.0,
|
|
"step": 805
|
|
},
|
|
{
|
|
"entropy": 6.3589723110198975,
|
|
"epoch": 0.8761492698756085,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004045,
|
|
"loss": 6.184,
|
|
"mean_token_accuracy": 0.1434461772441864,
|
|
"num_tokens": 1822733.0,
|
|
"step": 810
|
|
},
|
|
{
|
|
"entropy": 6.342323112487793,
|
|
"epoch": 0.8815575987020011,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00040699999999999997,
|
|
"loss": 6.1623,
|
|
"mean_token_accuracy": 0.14631599932909012,
|
|
"num_tokens": 1834121.0,
|
|
"step": 815
|
|
},
|
|
{
|
|
"entropy": 6.243607139587402,
|
|
"epoch": 0.8869659275283938,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0004095,
|
|
"loss": 6.0895,
|
|
"mean_token_accuracy": 0.1486702710390091,
|
|
"num_tokens": 1844674.0,
|
|
"step": 820
|
|
},
|
|
{
|
|
"entropy": 6.2104573249816895,
|
|
"epoch": 0.8923742563547864,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.000412,
|
|
"loss": 6.0988,
|
|
"mean_token_accuracy": 0.1491689234972,
|
|
"num_tokens": 1856692.0,
|
|
"step": 825
|
|
},
|
|
{
|
|
"entropy": 6.453680181503296,
|
|
"epoch": 0.897782585181179,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004145,
|
|
"loss": 6.3707,
|
|
"mean_token_accuracy": 0.1408935658633709,
|
|
"num_tokens": 1867888.0,
|
|
"step": 830
|
|
},
|
|
{
|
|
"entropy": 6.105977869033813,
|
|
"epoch": 0.9031909140075717,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.000417,
|
|
"loss": 6.043,
|
|
"mean_token_accuracy": 0.15483584851026536,
|
|
"num_tokens": 1877869.0,
|
|
"step": 835
|
|
},
|
|
{
|
|
"entropy": 6.322730207443238,
|
|
"epoch": 0.9085992428339643,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004195,
|
|
"loss": 6.1548,
|
|
"mean_token_accuracy": 0.1412374958395958,
|
|
"num_tokens": 1887975.0,
|
|
"step": 840
|
|
},
|
|
{
|
|
"entropy": 6.305921459197998,
|
|
"epoch": 0.914007571660357,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.000422,
|
|
"loss": 6.1018,
|
|
"mean_token_accuracy": 0.14518715515732766,
|
|
"num_tokens": 1898289.0,
|
|
"step": 845
|
|
},
|
|
{
|
|
"entropy": 6.211407423019409,
|
|
"epoch": 0.9194159004867496,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0004245,
|
|
"loss": 6.2213,
|
|
"mean_token_accuracy": 0.15009732991456987,
|
|
"num_tokens": 1910038.0,
|
|
"step": 850
|
|
},
|
|
{
|
|
"entropy": 6.209096813201905,
|
|
"epoch": 0.9248242293131422,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.000427,
|
|
"loss": 6.0914,
|
|
"mean_token_accuracy": 0.15314256697893142,
|
|
"num_tokens": 1920774.0,
|
|
"step": 855
|
|
},
|
|
{
|
|
"entropy": 6.293406915664673,
|
|
"epoch": 0.9302325581395349,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0004295,
|
|
"loss": 6.1251,
|
|
"mean_token_accuracy": 0.15404994785785675,
|
|
"num_tokens": 1932085.0,
|
|
"step": 860
|
|
},
|
|
{
|
|
"entropy": 6.232555866241455,
|
|
"epoch": 0.9356408869659275,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.000432,
|
|
"loss": 6.1331,
|
|
"mean_token_accuracy": 0.15166230872273445,
|
|
"num_tokens": 1943949.0,
|
|
"step": 865
|
|
},
|
|
{
|
|
"entropy": 6.28867917060852,
|
|
"epoch": 0.9410492157923201,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004345,
|
|
"loss": 6.1927,
|
|
"mean_token_accuracy": 0.14988541305065156,
|
|
"num_tokens": 1956051.0,
|
|
"step": 870
|
|
},
|
|
{
|
|
"entropy": 6.260223913192749,
|
|
"epoch": 0.9464575446187128,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.000437,
|
|
"loss": 6.1868,
|
|
"mean_token_accuracy": 0.14389916732907296,
|
|
"num_tokens": 1967804.0,
|
|
"step": 875
|
|
},
|
|
{
|
|
"entropy": 6.208997774124145,
|
|
"epoch": 0.9518658734451054,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0004395,
|
|
"loss": 6.2995,
|
|
"mean_token_accuracy": 0.13391195982694626,
|
|
"num_tokens": 1979222.0,
|
|
"step": 880
|
|
},
|
|
{
|
|
"entropy": 6.381609487533569,
|
|
"epoch": 0.9572742022714981,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.000442,
|
|
"loss": 6.2248,
|
|
"mean_token_accuracy": 0.14088413566350938,
|
|
"num_tokens": 1988998.0,
|
|
"step": 885
|
|
},
|
|
{
|
|
"entropy": 6.245026969909668,
|
|
"epoch": 0.9626825310978907,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004445,
|
|
"loss": 6.1451,
|
|
"mean_token_accuracy": 0.14165820479393004,
|
|
"num_tokens": 2000539.0,
|
|
"step": 890
|
|
},
|
|
{
|
|
"entropy": 6.321556282043457,
|
|
"epoch": 0.9680908599242833,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.000447,
|
|
"loss": 6.2385,
|
|
"mean_token_accuracy": 0.14436768293380736,
|
|
"num_tokens": 2012321.0,
|
|
"step": 895
|
|
},
|
|
{
|
|
"entropy": 6.173920106887818,
|
|
"epoch": 0.9734991887506761,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00044950000000000003,
|
|
"loss": 6.1231,
|
|
"mean_token_accuracy": 0.14439835995435715,
|
|
"num_tokens": 2023330.0,
|
|
"step": 900
|
|
},
|
|
{
|
|
"entropy": 6.284840297698975,
|
|
"epoch": 0.9789075175770687,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00045200000000000004,
|
|
"loss": 6.1095,
|
|
"mean_token_accuracy": 0.13921767249703407,
|
|
"num_tokens": 2034655.0,
|
|
"step": 905
|
|
},
|
|
{
|
|
"entropy": 6.110538482666016,
|
|
"epoch": 0.9843158464034614,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00045450000000000004,
|
|
"loss": 6.1513,
|
|
"mean_token_accuracy": 0.1441517509520054,
|
|
"num_tokens": 2045785.0,
|
|
"step": 910
|
|
},
|
|
{
|
|
"entropy": 6.445047616958618,
|
|
"epoch": 0.989724175229854,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00045700000000000005,
|
|
"loss": 6.2424,
|
|
"mean_token_accuracy": 0.14532435238361358,
|
|
"num_tokens": 2056038.0,
|
|
"step": 915
|
|
},
|
|
{
|
|
"entropy": 6.129134559631348,
|
|
"epoch": 0.9951325040562466,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.00045950000000000006,
|
|
"loss": 6.1023,
|
|
"mean_token_accuracy": 0.15468567311763765,
|
|
"num_tokens": 2066803.0,
|
|
"step": 920
|
|
},
|
|
{
|
|
"entropy": 6.241815196143256,
|
|
"epoch": 1.0,
|
|
"grad_norm": 1.90625,
|
|
"learning_rate": 0.000462,
|
|
"loss": 6.2124,
|
|
"mean_token_accuracy": 0.14124820878108343,
|
|
"num_tokens": 2076889.0,
|
|
"step": 925
|
|
},
|
|
{
|
|
"entropy": 6.257176446914673,
|
|
"epoch": 1.0054083288263926,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004645,
|
|
"loss": 5.9752,
|
|
"mean_token_accuracy": 0.14727601259946824,
|
|
"num_tokens": 2089019.0,
|
|
"step": 930
|
|
},
|
|
{
|
|
"entropy": 6.028801822662354,
|
|
"epoch": 1.0108166576527853,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.000467,
|
|
"loss": 5.8447,
|
|
"mean_token_accuracy": 0.16022417545318604,
|
|
"num_tokens": 2099849.0,
|
|
"step": 935
|
|
},
|
|
{
|
|
"entropy": 6.177911376953125,
|
|
"epoch": 1.016224986479178,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0004695,
|
|
"loss": 6.0094,
|
|
"mean_token_accuracy": 0.1548767253756523,
|
|
"num_tokens": 2110671.0,
|
|
"step": 940
|
|
},
|
|
{
|
|
"entropy": 6.136840963363648,
|
|
"epoch": 1.0216333153055706,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.000472,
|
|
"loss": 6.0524,
|
|
"mean_token_accuracy": 0.1497804716229439,
|
|
"num_tokens": 2122357.0,
|
|
"step": 945
|
|
},
|
|
{
|
|
"entropy": 6.268298530578614,
|
|
"epoch": 1.0270416441319632,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004745,
|
|
"loss": 5.9944,
|
|
"mean_token_accuracy": 0.14714996218681337,
|
|
"num_tokens": 2133878.0,
|
|
"step": 950
|
|
},
|
|
{
|
|
"entropy": 6.203853130340576,
|
|
"epoch": 1.0324499729583558,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.000477,
|
|
"loss": 6.0033,
|
|
"mean_token_accuracy": 0.15483788400888443,
|
|
"num_tokens": 2145565.0,
|
|
"step": 955
|
|
},
|
|
{
|
|
"entropy": 6.0750096321105955,
|
|
"epoch": 1.0378583017847485,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004795,
|
|
"loss": 5.9273,
|
|
"mean_token_accuracy": 0.14823657721281053,
|
|
"num_tokens": 2157393.0,
|
|
"step": 960
|
|
},
|
|
{
|
|
"entropy": 6.056691598892212,
|
|
"epoch": 1.043266630611141,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.000482,
|
|
"loss": 5.7809,
|
|
"mean_token_accuracy": 0.1595247745513916,
|
|
"num_tokens": 2169318.0,
|
|
"step": 965
|
|
},
|
|
{
|
|
"entropy": 6.050301027297974,
|
|
"epoch": 1.0486749594375337,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004845,
|
|
"loss": 5.8674,
|
|
"mean_token_accuracy": 0.15364039540290833,
|
|
"num_tokens": 2179727.0,
|
|
"step": 970
|
|
},
|
|
{
|
|
"entropy": 6.027638483047485,
|
|
"epoch": 1.0540832882639264,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.000487,
|
|
"loss": 5.9021,
|
|
"mean_token_accuracy": 0.1545193985104561,
|
|
"num_tokens": 2190119.0,
|
|
"step": 975
|
|
},
|
|
{
|
|
"entropy": 6.070952320098877,
|
|
"epoch": 1.059491617090319,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004895,
|
|
"loss": 5.9234,
|
|
"mean_token_accuracy": 0.15558279752731324,
|
|
"num_tokens": 2201077.0,
|
|
"step": 980
|
|
},
|
|
{
|
|
"entropy": 6.101561832427978,
|
|
"epoch": 1.0648999459167117,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.000492,
|
|
"loss": 5.9922,
|
|
"mean_token_accuracy": 0.15358568280935286,
|
|
"num_tokens": 2211572.0,
|
|
"step": 985
|
|
},
|
|
{
|
|
"entropy": 6.181616640090942,
|
|
"epoch": 1.0703082747431043,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004945,
|
|
"loss": 6.0144,
|
|
"mean_token_accuracy": 0.1533959075808525,
|
|
"num_tokens": 2223372.0,
|
|
"step": 990
|
|
},
|
|
{
|
|
"entropy": 5.968746328353882,
|
|
"epoch": 1.075716603569497,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.000497,
|
|
"loss": 5.886,
|
|
"mean_token_accuracy": 0.154812690615654,
|
|
"num_tokens": 2234946.0,
|
|
"step": 995
|
|
},
|
|
{
|
|
"entropy": 6.149488687515259,
|
|
"epoch": 1.0811249323958896,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004995,
|
|
"loss": 5.969,
|
|
"mean_token_accuracy": 0.14452582895755767,
|
|
"num_tokens": 2246608.0,
|
|
"step": 1000
|
|
},
|
|
{
|
|
"epoch": 1.0811249323958896,
|
|
"eval_entropy": 5.931731963157654,
|
|
"eval_loss": 6.293067455291748,
|
|
"eval_mean_token_accuracy": 0.14824318431995132,
|
|
"eval_num_tokens": 2246608.0,
|
|
"eval_runtime": 2.567,
|
|
"eval_samples_per_second": 1369.326,
|
|
"eval_steps_per_second": 171.409,
|
|
"step": 1000
|
|
},
|
|
{
|
|
"entropy": 6.084950351715088,
|
|
"epoch": 1.0865332612222822,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004999997383518051,
|
|
"loss": 6.0811,
|
|
"mean_token_accuracy": 0.14338656812906264,
|
|
"num_tokens": 2258473.0,
|
|
"step": 1005
|
|
},
|
|
{
|
|
"entropy": 6.1302765846252445,
|
|
"epoch": 1.0919415900486749,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004999986754070562,
|
|
"loss": 5.9806,
|
|
"mean_token_accuracy": 0.15734953135252,
|
|
"num_tokens": 2269235.0,
|
|
"step": 1010
|
|
},
|
|
{
|
|
"entropy": 6.098620748519897,
|
|
"epoch": 1.0973499188750675,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004999967948166009,
|
|
"loss": 5.9067,
|
|
"mean_token_accuracy": 0.15507067888975143,
|
|
"num_tokens": 2280369.0,
|
|
"step": 1015
|
|
},
|
|
{
|
|
"entropy": 5.965772438049316,
|
|
"epoch": 1.1027582477014604,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0004999940965872734,
|
|
"loss": 5.8955,
|
|
"mean_token_accuracy": 0.16817984730005264,
|
|
"num_tokens": 2289701.0,
|
|
"step": 1020
|
|
},
|
|
{
|
|
"entropy": 6.086247968673706,
|
|
"epoch": 1.1081665765278528,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004999905807288788,
|
|
"loss": 5.9501,
|
|
"mean_token_accuracy": 0.15449455082416536,
|
|
"num_tokens": 2300820.0,
|
|
"step": 1025
|
|
},
|
|
{
|
|
"entropy": 6.2378397464752195,
|
|
"epoch": 1.1135749053542456,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.000499986247254194,
|
|
"loss": 6.0194,
|
|
"mean_token_accuracy": 0.14141876846551896,
|
|
"num_tokens": 2311710.0,
|
|
"step": 1030
|
|
},
|
|
{
|
|
"entropy": 6.080769062042236,
|
|
"epoch": 1.1189832341806383,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0004999810961789667,
|
|
"loss": 6.0102,
|
|
"mean_token_accuracy": 0.15261175036430358,
|
|
"num_tokens": 2324472.0,
|
|
"step": 1035
|
|
},
|
|
{
|
|
"entropy": 6.025978469848633,
|
|
"epoch": 1.124391563007031,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.000499975127521916,
|
|
"loss": 5.8953,
|
|
"mean_token_accuracy": 0.15188806802034377,
|
|
"num_tokens": 2336016.0,
|
|
"step": 1040
|
|
},
|
|
{
|
|
"entropy": 6.085336542129516,
|
|
"epoch": 1.1297998918334236,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004999683413047319,
|
|
"loss": 5.9726,
|
|
"mean_token_accuracy": 0.15661023557186127,
|
|
"num_tokens": 2346433.0,
|
|
"step": 1045
|
|
},
|
|
{
|
|
"entropy": 6.114025735855103,
|
|
"epoch": 1.1352082206598162,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004999607375520759,
|
|
"loss": 5.9346,
|
|
"mean_token_accuracy": 0.16011944636702538,
|
|
"num_tokens": 2357171.0,
|
|
"step": 1050
|
|
},
|
|
{
|
|
"entropy": 5.95264163017273,
|
|
"epoch": 1.1406165494862088,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0004999523162915794,
|
|
"loss": 5.9868,
|
|
"mean_token_accuracy": 0.1551058605313301,
|
|
"num_tokens": 2367918.0,
|
|
"step": 1055
|
|
},
|
|
{
|
|
"entropy": 6.105375480651856,
|
|
"epoch": 1.1460248783126015,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004999430775538459,
|
|
"loss": 5.8611,
|
|
"mean_token_accuracy": 0.1594705879688263,
|
|
"num_tokens": 2378588.0,
|
|
"step": 1060
|
|
},
|
|
{
|
|
"entropy": 5.9998544216156,
|
|
"epoch": 1.151433207138994,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004999330213724487,
|
|
"loss": 5.9136,
|
|
"mean_token_accuracy": 0.15627419352531433,
|
|
"num_tokens": 2390339.0,
|
|
"step": 1065
|
|
},
|
|
{
|
|
"entropy": 6.131874227523804,
|
|
"epoch": 1.1568415359653867,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004999221477839319,
|
|
"loss": 6.0764,
|
|
"mean_token_accuracy": 0.14559624195098878,
|
|
"num_tokens": 2401855.0,
|
|
"step": 1070
|
|
},
|
|
{
|
|
"entropy": 6.033861970901489,
|
|
"epoch": 1.1622498647917794,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004999104568278104,
|
|
"loss": 5.9031,
|
|
"mean_token_accuracy": 0.15754418671131135,
|
|
"num_tokens": 2411902.0,
|
|
"step": 1075
|
|
},
|
|
{
|
|
"entropy": 6.130727386474609,
|
|
"epoch": 1.167658193618172,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.000499897948546569,
|
|
"loss": 6.003,
|
|
"mean_token_accuracy": 0.15505098104476928,
|
|
"num_tokens": 2423275.0,
|
|
"step": 1080
|
|
},
|
|
{
|
|
"entropy": 5.969374370574951,
|
|
"epoch": 1.1730665224445647,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004998846229856629,
|
|
"loss": 5.9628,
|
|
"mean_token_accuracy": 0.15772853493690492,
|
|
"num_tokens": 2434347.0,
|
|
"step": 1085
|
|
},
|
|
{
|
|
"entropy": 6.132894992828369,
|
|
"epoch": 1.1784748512709573,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004998704801935171,
|
|
"loss": 6.0229,
|
|
"mean_token_accuracy": 0.1508957713842392,
|
|
"num_tokens": 2446486.0,
|
|
"step": 1090
|
|
},
|
|
{
|
|
"entropy": 5.953886795043945,
|
|
"epoch": 1.18388318009735,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.0004998555202215267,
|
|
"loss": 5.886,
|
|
"mean_token_accuracy": 0.15241267830133437,
|
|
"num_tokens": 2458864.0,
|
|
"step": 1095
|
|
},
|
|
{
|
|
"entropy": 6.058213758468628,
|
|
"epoch": 1.1892915089237426,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0004998397431240561,
|
|
"loss": 5.8926,
|
|
"mean_token_accuracy": 0.15482796281576156,
|
|
"num_tokens": 2471225.0,
|
|
"step": 1100
|
|
},
|
|
{
|
|
"entropy": 5.991312265396118,
|
|
"epoch": 1.1946998377501352,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004998231489584395,
|
|
"loss": 5.9081,
|
|
"mean_token_accuracy": 0.15361883193254472,
|
|
"num_tokens": 2481914.0,
|
|
"step": 1105
|
|
},
|
|
{
|
|
"entropy": 6.007622146606446,
|
|
"epoch": 1.2001081665765279,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00049980573778498,
|
|
"loss": 5.9317,
|
|
"mean_token_accuracy": 0.1619701385498047,
|
|
"num_tokens": 2493391.0,
|
|
"step": 1110
|
|
},
|
|
{
|
|
"entropy": 5.986660623550415,
|
|
"epoch": 1.2055164954029205,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004997875096669498,
|
|
"loss": 5.8213,
|
|
"mean_token_accuracy": 0.15980194956064225,
|
|
"num_tokens": 2504576.0,
|
|
"step": 1115
|
|
},
|
|
{
|
|
"entropy": 5.949508237838745,
|
|
"epoch": 1.2109248242293131,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004997684646705901,
|
|
"loss": 5.8822,
|
|
"mean_token_accuracy": 0.15818627998232843,
|
|
"num_tokens": 2516364.0,
|
|
"step": 1120
|
|
},
|
|
{
|
|
"entropy": 6.021165227890014,
|
|
"epoch": 1.2163331530557058,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004997486028651103,
|
|
"loss": 5.949,
|
|
"mean_token_accuracy": 0.15565033853054047,
|
|
"num_tokens": 2526296.0,
|
|
"step": 1125
|
|
},
|
|
{
|
|
"entropy": 5.929991960525513,
|
|
"epoch": 1.2217414818820984,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004997279243226884,
|
|
"loss": 5.8364,
|
|
"mean_token_accuracy": 0.16595554798841478,
|
|
"num_tokens": 2537558.0,
|
|
"step": 1130
|
|
},
|
|
{
|
|
"entropy": 6.006711053848266,
|
|
"epoch": 1.227149810708491,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004997064291184701,
|
|
"loss": 5.9242,
|
|
"mean_token_accuracy": 0.15124313682317733,
|
|
"num_tokens": 2549109.0,
|
|
"step": 1135
|
|
},
|
|
{
|
|
"entropy": 6.145928907394409,
|
|
"epoch": 1.2325581395348837,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0004996841173305691,
|
|
"loss": 6.0694,
|
|
"mean_token_accuracy": 0.15124114975333214,
|
|
"num_tokens": 2560019.0,
|
|
"step": 1140
|
|
},
|
|
{
|
|
"entropy": 5.955758571624756,
|
|
"epoch": 1.2379664683612763,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004996609890400665,
|
|
"loss": 5.9005,
|
|
"mean_token_accuracy": 0.15468142032623292,
|
|
"num_tokens": 2571455.0,
|
|
"step": 1145
|
|
},
|
|
{
|
|
"entropy": 5.977803087234497,
|
|
"epoch": 1.243374797187669,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004996370443310107,
|
|
"loss": 5.8316,
|
|
"mean_token_accuracy": 0.1626493364572525,
|
|
"num_tokens": 2582827.0,
|
|
"step": 1150
|
|
},
|
|
{
|
|
"entropy": 5.962737560272217,
|
|
"epoch": 1.2487831260140616,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004996122832904165,
|
|
"loss": 5.9224,
|
|
"mean_token_accuracy": 0.15286874324083327,
|
|
"num_tokens": 2594980.0,
|
|
"step": 1155
|
|
},
|
|
{
|
|
"entropy": 6.072302770614624,
|
|
"epoch": 1.2541914548404542,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004995867060082658,
|
|
"loss": 5.9808,
|
|
"mean_token_accuracy": 0.15695970505475998,
|
|
"num_tokens": 2605697.0,
|
|
"step": 1160
|
|
},
|
|
{
|
|
"entropy": 6.013327169418335,
|
|
"epoch": 1.2595997836668469,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0004995603125775065,
|
|
"loss": 5.9401,
|
|
"mean_token_accuracy": 0.1553099974989891,
|
|
"num_tokens": 2617515.0,
|
|
"step": 1165
|
|
},
|
|
{
|
|
"entropy": 5.9621072769165036,
|
|
"epoch": 1.2650081124932395,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004995331030940523,
|
|
"loss": 5.9188,
|
|
"mean_token_accuracy": 0.1621383920311928,
|
|
"num_tokens": 2628293.0,
|
|
"step": 1170
|
|
},
|
|
{
|
|
"entropy": 5.955429220199585,
|
|
"epoch": 1.2704164413196322,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004995050776567826,
|
|
"loss": 5.8808,
|
|
"mean_token_accuracy": 0.14956496506929398,
|
|
"num_tokens": 2639949.0,
|
|
"step": 1175
|
|
},
|
|
{
|
|
"entropy": 6.067929220199585,
|
|
"epoch": 1.2758247701460248,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004994762363675421,
|
|
"loss": 6.0005,
|
|
"mean_token_accuracy": 0.15124383419752122,
|
|
"num_tokens": 2651186.0,
|
|
"step": 1180
|
|
},
|
|
{
|
|
"entropy": 6.039377021789551,
|
|
"epoch": 1.2812330989724177,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004994465793311396,
|
|
"loss": 5.9522,
|
|
"mean_token_accuracy": 0.14760056138038635,
|
|
"num_tokens": 2662452.0,
|
|
"step": 1185
|
|
},
|
|
{
|
|
"entropy": 5.962746095657349,
|
|
"epoch": 1.28664142779881,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004994161066553493,
|
|
"loss": 5.889,
|
|
"mean_token_accuracy": 0.15765392333269118,
|
|
"num_tokens": 2673117.0,
|
|
"step": 1190
|
|
},
|
|
{
|
|
"entropy": 6.005440950393677,
|
|
"epoch": 1.292049756625203,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004993848184509086,
|
|
"loss": 5.8946,
|
|
"mean_token_accuracy": 0.15160483941435815,
|
|
"num_tokens": 2685634.0,
|
|
"step": 1195
|
|
},
|
|
{
|
|
"entropy": 6.03985481262207,
|
|
"epoch": 1.2974580854515954,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004993527148315193,
|
|
"loss": 5.7672,
|
|
"mean_token_accuracy": 0.15762777477502823,
|
|
"num_tokens": 2695890.0,
|
|
"step": 1200
|
|
},
|
|
{
|
|
"entropy": 5.909327554702759,
|
|
"epoch": 1.3028664142779882,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004993197959138458,
|
|
"loss": 5.9199,
|
|
"mean_token_accuracy": 0.16145165413618087,
|
|
"num_tokens": 2707169.0,
|
|
"step": 1205
|
|
},
|
|
{
|
|
"entropy": 5.963200855255127,
|
|
"epoch": 1.3082747431043806,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.0004992860618175156,
|
|
"loss": 5.8768,
|
|
"mean_token_accuracy": 0.1663581445813179,
|
|
"num_tokens": 2718118.0,
|
|
"step": 1210
|
|
},
|
|
{
|
|
"entropy": 5.981848621368409,
|
|
"epoch": 1.3136830719307735,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004992515126651184,
|
|
"loss": 5.8184,
|
|
"mean_token_accuracy": 0.1567670851945877,
|
|
"num_tokens": 2728351.0,
|
|
"step": 1215
|
|
},
|
|
{
|
|
"entropy": 5.87762303352356,
|
|
"epoch": 1.319091400757166,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004992161485822059,
|
|
"loss": 5.8697,
|
|
"mean_token_accuracy": 0.16071014404296874,
|
|
"num_tokens": 2739084.0,
|
|
"step": 1220
|
|
},
|
|
{
|
|
"entropy": 5.946296977996826,
|
|
"epoch": 1.3244997295835588,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004991799696972913,
|
|
"loss": 5.8888,
|
|
"mean_token_accuracy": 0.15838139951229097,
|
|
"num_tokens": 2750715.0,
|
|
"step": 1225
|
|
},
|
|
{
|
|
"entropy": 5.898415899276733,
|
|
"epoch": 1.3299080584099512,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004991429761418488,
|
|
"loss": 5.8427,
|
|
"mean_token_accuracy": 0.16084625273942948,
|
|
"num_tokens": 2761483.0,
|
|
"step": 1230
|
|
},
|
|
{
|
|
"entropy": 6.078216409683227,
|
|
"epoch": 1.335316387236344,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.000499105168050313,
|
|
"loss": 5.9922,
|
|
"mean_token_accuracy": 0.14723649471998215,
|
|
"num_tokens": 2774053.0,
|
|
"step": 1235
|
|
},
|
|
{
|
|
"entropy": 5.825717401504517,
|
|
"epoch": 1.3407247160627367,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004990665455600787,
|
|
"loss": 5.751,
|
|
"mean_token_accuracy": 0.16435801833868027,
|
|
"num_tokens": 2784928.0,
|
|
"step": 1240
|
|
},
|
|
{
|
|
"entropy": 6.0135369300842285,
|
|
"epoch": 1.3461330448891293,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004990271088114999,
|
|
"loss": 5.8566,
|
|
"mean_token_accuracy": 0.1591189458966255,
|
|
"num_tokens": 2795839.0,
|
|
"step": 1245
|
|
},
|
|
{
|
|
"entropy": 5.885397672653198,
|
|
"epoch": 1.351541373715522,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004989868579478901,
|
|
"loss": 5.7649,
|
|
"mean_token_accuracy": 0.1652156174182892,
|
|
"num_tokens": 2807624.0,
|
|
"step": 1250
|
|
},
|
|
{
|
|
"entropy": 5.896845531463623,
|
|
"epoch": 1.3569497025419146,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004989457931155209,
|
|
"loss": 5.8639,
|
|
"mean_token_accuracy": 0.15702212899923323,
|
|
"num_tokens": 2819740.0,
|
|
"step": 1255
|
|
},
|
|
{
|
|
"entropy": 5.957349491119385,
|
|
"epoch": 1.3623580313683072,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004989039144636219,
|
|
"loss": 5.9088,
|
|
"mean_token_accuracy": 0.16128307580947876,
|
|
"num_tokens": 2830467.0,
|
|
"step": 1260
|
|
},
|
|
{
|
|
"entropy": 6.03181004524231,
|
|
"epoch": 1.3677663601946999,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004988612221443804,
|
|
"loss": 6.0047,
|
|
"mean_token_accuracy": 0.15610331892967225,
|
|
"num_tokens": 2841978.0,
|
|
"step": 1265
|
|
},
|
|
{
|
|
"entropy": 5.989248514175415,
|
|
"epoch": 1.3731746890210925,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.0004988177163129403,
|
|
"loss": 5.899,
|
|
"mean_token_accuracy": 0.15807392299175263,
|
|
"num_tokens": 2853760.0,
|
|
"step": 1270
|
|
},
|
|
{
|
|
"entropy": 5.99000825881958,
|
|
"epoch": 1.3785830178474852,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004987733971274018,
|
|
"loss": 5.9337,
|
|
"mean_token_accuracy": 0.15205859392881393,
|
|
"num_tokens": 2865734.0,
|
|
"step": 1275
|
|
},
|
|
{
|
|
"entropy": 6.0495459079742435,
|
|
"epoch": 1.3839913466738778,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004987282647488211,
|
|
"loss": 5.9673,
|
|
"mean_token_accuracy": 0.15523016154766084,
|
|
"num_tokens": 2877872.0,
|
|
"step": 1280
|
|
},
|
|
{
|
|
"entropy": 5.842286205291748,
|
|
"epoch": 1.3893996755002704,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004986823193412093,
|
|
"loss": 5.8175,
|
|
"mean_token_accuracy": 0.15781135559082032,
|
|
"num_tokens": 2888544.0,
|
|
"step": 1285
|
|
},
|
|
{
|
|
"entropy": 5.940902042388916,
|
|
"epoch": 1.394808004326663,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.000498635561071532,
|
|
"loss": 5.8806,
|
|
"mean_token_accuracy": 0.1593789353966713,
|
|
"num_tokens": 2899635.0,
|
|
"step": 1290
|
|
},
|
|
{
|
|
"entropy": 6.046967172622681,
|
|
"epoch": 1.4002163331530557,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.000498587990109709,
|
|
"loss": 5.8925,
|
|
"mean_token_accuracy": 0.15153441727161407,
|
|
"num_tokens": 2911514.0,
|
|
"step": 1295
|
|
},
|
|
{
|
|
"entropy": 5.935166358947754,
|
|
"epoch": 1.4056246619794484,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.0004985396066286133,
|
|
"loss": 5.9422,
|
|
"mean_token_accuracy": 0.1631091997027397,
|
|
"num_tokens": 2922894.0,
|
|
"step": 1300
|
|
},
|
|
{
|
|
"entropy": 5.971725797653198,
|
|
"epoch": 1.411032990805841,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004984904108040706,
|
|
"loss": 5.9614,
|
|
"mean_token_accuracy": 0.15326455384492874,
|
|
"num_tokens": 2934563.0,
|
|
"step": 1305
|
|
},
|
|
{
|
|
"entropy": 5.957499170303345,
|
|
"epoch": 1.4164413196322336,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004984404028148585,
|
|
"loss": 5.8413,
|
|
"mean_token_accuracy": 0.15767469108104706,
|
|
"num_tokens": 2946101.0,
|
|
"step": 1310
|
|
},
|
|
{
|
|
"entropy": 5.75806155204773,
|
|
"epoch": 1.4218496484586263,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004983895828427062,
|
|
"loss": 5.8233,
|
|
"mean_token_accuracy": 0.15837134867906572,
|
|
"num_tokens": 2957110.0,
|
|
"step": 1315
|
|
},
|
|
{
|
|
"entropy": 6.118568181991577,
|
|
"epoch": 1.427257977285019,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.0004983379510722935,
|
|
"loss": 5.8945,
|
|
"mean_token_accuracy": 0.16046863794326782,
|
|
"num_tokens": 2968110.0,
|
|
"step": 1320
|
|
},
|
|
{
|
|
"entropy": 5.905016231536865,
|
|
"epoch": 1.4326663061114115,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0004982855076912506,
|
|
"loss": 5.8924,
|
|
"mean_token_accuracy": 0.1579983189702034,
|
|
"num_tokens": 2979176.0,
|
|
"step": 1325
|
|
},
|
|
{
|
|
"entropy": 5.90566782951355,
|
|
"epoch": 1.4380746349378042,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004982322528901568,
|
|
"loss": 5.8431,
|
|
"mean_token_accuracy": 0.16347377896308898,
|
|
"num_tokens": 2990613.0,
|
|
"step": 1330
|
|
},
|
|
{
|
|
"entropy": 6.004480457305908,
|
|
"epoch": 1.4434829637641968,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.00049817818686254,
|
|
"loss": 5.8586,
|
|
"mean_token_accuracy": 0.1688141405582428,
|
|
"num_tokens": 3002469.0,
|
|
"step": 1335
|
|
},
|
|
{
|
|
"entropy": 5.884701061248779,
|
|
"epoch": 1.4488912925905895,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.0004981233098048765,
|
|
"loss": 5.8874,
|
|
"mean_token_accuracy": 0.1575832858681679,
|
|
"num_tokens": 3013458.0,
|
|
"step": 1340
|
|
},
|
|
{
|
|
"entropy": 5.908089876174927,
|
|
"epoch": 1.454299621416982,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004980676219165894,
|
|
"loss": 5.7819,
|
|
"mean_token_accuracy": 0.16221198439598083,
|
|
"num_tokens": 3023435.0,
|
|
"step": 1345
|
|
},
|
|
{
|
|
"entropy": 5.851230573654175,
|
|
"epoch": 1.4597079502433747,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.000498011123400049,
|
|
"loss": 5.7953,
|
|
"mean_token_accuracy": 0.16473986059427262,
|
|
"num_tokens": 3035124.0,
|
|
"step": 1350
|
|
},
|
|
{
|
|
"entropy": 5.867345571517944,
|
|
"epoch": 1.4651162790697674,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.0004979538144605707,
|
|
"loss": 5.7913,
|
|
"mean_token_accuracy": 0.16175651252269746,
|
|
"num_tokens": 3046978.0,
|
|
"step": 1355
|
|
},
|
|
{
|
|
"entropy": 5.878073263168335,
|
|
"epoch": 1.47052460789616,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004978956953064154,
|
|
"loss": 5.7709,
|
|
"mean_token_accuracy": 0.16673534065485002,
|
|
"num_tokens": 3057915.0,
|
|
"step": 1360
|
|
},
|
|
{
|
|
"entropy": 5.918510389328003,
|
|
"epoch": 1.4759329367225527,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004978367661487883,
|
|
"loss": 5.9289,
|
|
"mean_token_accuracy": 0.15895457044243813,
|
|
"num_tokens": 3069600.0,
|
|
"step": 1365
|
|
},
|
|
{
|
|
"entropy": 5.804135656356811,
|
|
"epoch": 1.4813412655489453,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.0004977770272018379,
|
|
"loss": 5.7364,
|
|
"mean_token_accuracy": 0.16775057166814805,
|
|
"num_tokens": 3081057.0,
|
|
"step": 1370
|
|
},
|
|
{
|
|
"entropy": 5.953877735137939,
|
|
"epoch": 1.486749594375338,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.000497716478682656,
|
|
"loss": 5.8342,
|
|
"mean_token_accuracy": 0.15982251316308976,
|
|
"num_tokens": 3092967.0,
|
|
"step": 1375
|
|
},
|
|
{
|
|
"entropy": 5.905659866333008,
|
|
"epoch": 1.4921579232017308,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.0004976551208112759,
|
|
"loss": 5.8947,
|
|
"mean_token_accuracy": 0.15754662826657295,
|
|
"num_tokens": 3104728.0,
|
|
"step": 1380
|
|
},
|
|
{
|
|
"entropy": 5.974631023406983,
|
|
"epoch": 1.4975662520281232,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.0004975929538106721,
|
|
"loss": 5.8642,
|
|
"mean_token_accuracy": 0.15649076998233796,
|
|
"num_tokens": 3115946.0,
|
|
"step": 1385
|
|
},
|
|
{
|
|
"entropy": 5.901013946533203,
|
|
"epoch": 1.502974580854516,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004975299779067598,
|
|
"loss": 5.8748,
|
|
"mean_token_accuracy": 0.16528355479240417,
|
|
"num_tokens": 3126880.0,
|
|
"step": 1390
|
|
},
|
|
{
|
|
"entropy": 5.802594184875488,
|
|
"epoch": 1.5083829096809085,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0004974661933283936,
|
|
"loss": 5.8,
|
|
"mean_token_accuracy": 0.16498437374830247,
|
|
"num_tokens": 3137820.0,
|
|
"step": 1395
|
|
},
|
|
{
|
|
"entropy": 5.792008113861084,
|
|
"epoch": 1.5137912385073014,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004974016003073667,
|
|
"loss": 5.7453,
|
|
"mean_token_accuracy": 0.16289967000484468,
|
|
"num_tokens": 3149620.0,
|
|
"step": 1400
|
|
},
|
|
{
|
|
"entropy": 5.800507736206055,
|
|
"epoch": 1.5191995673336938,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004973361990784104,
|
|
"loss": 5.737,
|
|
"mean_token_accuracy": 0.16973724961280823,
|
|
"num_tokens": 3160205.0,
|
|
"step": 1405
|
|
},
|
|
{
|
|
"entropy": 5.9592376232147215,
|
|
"epoch": 1.5246078961600866,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004972699898791927,
|
|
"loss": 5.9833,
|
|
"mean_token_accuracy": 0.16072821915149688,
|
|
"num_tokens": 3171749.0,
|
|
"step": 1410
|
|
},
|
|
{
|
|
"entropy": 5.9620068073272705,
|
|
"epoch": 1.530016224986479,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004972029729503182,
|
|
"loss": 5.9394,
|
|
"mean_token_accuracy": 0.1557013750076294,
|
|
"num_tokens": 3183303.0,
|
|
"step": 1415
|
|
},
|
|
{
|
|
"entropy": 6.018831586837768,
|
|
"epoch": 1.535424553812872,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.0004971351485353265,
|
|
"loss": 5.9681,
|
|
"mean_token_accuracy": 0.1568077340722084,
|
|
"num_tokens": 3194784.0,
|
|
"step": 1420
|
|
},
|
|
{
|
|
"entropy": 5.939594316482544,
|
|
"epoch": 1.5408328826392643,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004970665168806917,
|
|
"loss": 5.7919,
|
|
"mean_token_accuracy": 0.1602090999484062,
|
|
"num_tokens": 3205732.0,
|
|
"step": 1425
|
|
},
|
|
{
|
|
"entropy": 5.892387580871582,
|
|
"epoch": 1.5462412114656572,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004969970782358214,
|
|
"loss": 5.8812,
|
|
"mean_token_accuracy": 0.15621185600757598,
|
|
"num_tokens": 3216927.0,
|
|
"step": 1430
|
|
},
|
|
{
|
|
"entropy": 5.9382976531982425,
|
|
"epoch": 1.5516495402920496,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004969268328530557,
|
|
"loss": 5.8656,
|
|
"mean_token_accuracy": 0.16953830569982528,
|
|
"num_tokens": 3227464.0,
|
|
"step": 1435
|
|
},
|
|
{
|
|
"entropy": 5.889416885375977,
|
|
"epoch": 1.5570578691184425,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.0004968557809876666,
|
|
"loss": 5.892,
|
|
"mean_token_accuracy": 0.1629958361387253,
|
|
"num_tokens": 3239357.0,
|
|
"step": 1440
|
|
},
|
|
{
|
|
"entropy": 5.872169113159179,
|
|
"epoch": 1.562466197944835,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004967839228978568,
|
|
"loss": 5.6692,
|
|
"mean_token_accuracy": 0.16706007570028306,
|
|
"num_tokens": 3250893.0,
|
|
"step": 1445
|
|
},
|
|
{
|
|
"entropy": 5.700922346115112,
|
|
"epoch": 1.5678745267712277,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004967112588447585,
|
|
"loss": 5.7193,
|
|
"mean_token_accuracy": 0.17445658445358275,
|
|
"num_tokens": 3262081.0,
|
|
"step": 1450
|
|
},
|
|
{
|
|
"entropy": 5.831270933151245,
|
|
"epoch": 1.5732828555976204,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004966377890924332,
|
|
"loss": 5.8279,
|
|
"mean_token_accuracy": 0.17075785547494887,
|
|
"num_tokens": 3273059.0,
|
|
"step": 1455
|
|
},
|
|
{
|
|
"entropy": 5.984502220153809,
|
|
"epoch": 1.578691184424013,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004965635139078704,
|
|
"loss": 5.8425,
|
|
"mean_token_accuracy": 0.1614866703748703,
|
|
"num_tokens": 3283901.0,
|
|
"step": 1460
|
|
},
|
|
{
|
|
"entropy": 5.857378387451172,
|
|
"epoch": 1.5840995132504057,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.0004964884335609857,
|
|
"loss": 5.9535,
|
|
"mean_token_accuracy": 0.15531671792268753,
|
|
"num_tokens": 3295687.0,
|
|
"step": 1465
|
|
},
|
|
{
|
|
"entropy": 5.899958944320678,
|
|
"epoch": 1.5895078420767983,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004964125483246218,
|
|
"loss": 5.781,
|
|
"mean_token_accuracy": 0.16107384413480758,
|
|
"num_tokens": 3305600.0,
|
|
"step": 1470
|
|
},
|
|
{
|
|
"entropy": 5.8675659656524655,
|
|
"epoch": 1.594916170903191,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004963358584745457,
|
|
"loss": 5.8908,
|
|
"mean_token_accuracy": 0.15747047811746598,
|
|
"num_tokens": 3316337.0,
|
|
"step": 1475
|
|
},
|
|
{
|
|
"entropy": 5.928437662124634,
|
|
"epoch": 1.6003244997295836,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004962583642894482,
|
|
"loss": 5.9135,
|
|
"mean_token_accuracy": 0.16109205186367034,
|
|
"num_tokens": 3327214.0,
|
|
"step": 1480
|
|
},
|
|
{
|
|
"entropy": 5.892904615402221,
|
|
"epoch": 1.6057328285559762,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.0004961800660509437,
|
|
"loss": 5.8,
|
|
"mean_token_accuracy": 0.15795575678348542,
|
|
"num_tokens": 3338663.0,
|
|
"step": 1485
|
|
},
|
|
{
|
|
"entropy": 5.8454772472381595,
|
|
"epoch": 1.6111411573823688,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.000496100964043568,
|
|
"loss": 5.73,
|
|
"mean_token_accuracy": 0.16322666704654692,
|
|
"num_tokens": 3351278.0,
|
|
"step": 1490
|
|
},
|
|
{
|
|
"entropy": 5.931005859375,
|
|
"epoch": 1.6165494862087615,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.000496021058554778,
|
|
"loss": 5.8335,
|
|
"mean_token_accuracy": 0.16325978934764862,
|
|
"num_tokens": 3363144.0,
|
|
"step": 1495
|
|
},
|
|
{
|
|
"entropy": 5.68018856048584,
|
|
"epoch": 1.6219578150351541,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004959403498749505,
|
|
"loss": 5.761,
|
|
"mean_token_accuracy": 0.16344596147537233,
|
|
"num_tokens": 3373565.0,
|
|
"step": 1500
|
|
},
|
|
{
|
|
"entropy": 5.926155233383179,
|
|
"epoch": 1.6273661438615468,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004958588382973809,
|
|
"loss": 5.8746,
|
|
"mean_token_accuracy": 0.16343246549367904,
|
|
"num_tokens": 3384486.0,
|
|
"step": 1505
|
|
},
|
|
{
|
|
"entropy": 5.84269151687622,
|
|
"epoch": 1.6327744726879394,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004957765241182826,
|
|
"loss": 5.8588,
|
|
"mean_token_accuracy": 0.15702430605888368,
|
|
"num_tokens": 3395808.0,
|
|
"step": 1510
|
|
},
|
|
{
|
|
"entropy": 5.915395021438599,
|
|
"epoch": 1.638182801514332,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004956934076367854,
|
|
"loss": 5.7329,
|
|
"mean_token_accuracy": 0.16698796004056932,
|
|
"num_tokens": 3406515.0,
|
|
"step": 1515
|
|
},
|
|
{
|
|
"entropy": 5.708258962631225,
|
|
"epoch": 1.6435911303407247,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.000495609489154935,
|
|
"loss": 5.8782,
|
|
"mean_token_accuracy": 0.15216176956892014,
|
|
"num_tokens": 3416507.0,
|
|
"step": 1520
|
|
},
|
|
{
|
|
"entropy": 6.006617736816406,
|
|
"epoch": 1.6489994591671173,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004955247689776911,
|
|
"loss": 5.8751,
|
|
"mean_token_accuracy": 0.16319621950387955,
|
|
"num_tokens": 3428195.0,
|
|
"step": 1525
|
|
},
|
|
{
|
|
"entropy": 5.8480085849761965,
|
|
"epoch": 1.65440778799351,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.000495439247412927,
|
|
"loss": 5.8367,
|
|
"mean_token_accuracy": 0.15666660219430922,
|
|
"num_tokens": 3439500.0,
|
|
"step": 1530
|
|
},
|
|
{
|
|
"entropy": 5.699786853790283,
|
|
"epoch": 1.6598161168199026,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004953529247714285,
|
|
"loss": 5.6818,
|
|
"mean_token_accuracy": 0.16468058079481124,
|
|
"num_tokens": 3451042.0,
|
|
"step": 1535
|
|
},
|
|
{
|
|
"entropy": 5.882201433181763,
|
|
"epoch": 1.6652244456462952,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004952658013668922,
|
|
"loss": 5.9044,
|
|
"mean_token_accuracy": 0.16032216250896453,
|
|
"num_tokens": 3462286.0,
|
|
"step": 1540
|
|
},
|
|
{
|
|
"entropy": 5.886834716796875,
|
|
"epoch": 1.670632774472688,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004951778775159246,
|
|
"loss": 5.794,
|
|
"mean_token_accuracy": 0.1650930419564247,
|
|
"num_tokens": 3473309.0,
|
|
"step": 1545
|
|
},
|
|
{
|
|
"entropy": 5.836314010620117,
|
|
"epoch": 1.6760411032990805,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004950891535380414,
|
|
"loss": 5.8509,
|
|
"mean_token_accuracy": 0.16708696037530898,
|
|
"num_tokens": 3485733.0,
|
|
"step": 1550
|
|
},
|
|
{
|
|
"entropy": 5.806645298004151,
|
|
"epoch": 1.6814494321254734,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004949996297556656,
|
|
"loss": 5.6799,
|
|
"mean_token_accuracy": 0.17222748547792435,
|
|
"num_tokens": 3495585.0,
|
|
"step": 1555
|
|
},
|
|
{
|
|
"entropy": 5.823585128784179,
|
|
"epoch": 1.6868577609518658,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.0004949093064941268,
|
|
"loss": 5.919,
|
|
"mean_token_accuracy": 0.1641972318291664,
|
|
"num_tokens": 3507973.0,
|
|
"step": 1560
|
|
},
|
|
{
|
|
"entropy": 5.878605794906616,
|
|
"epoch": 1.6922660897782587,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004948181840816601,
|
|
"loss": 5.8549,
|
|
"mean_token_accuracy": 0.15803509652614595,
|
|
"num_tokens": 3518276.0,
|
|
"step": 1565
|
|
},
|
|
{
|
|
"entropy": 5.7111487865448,
|
|
"epoch": 1.697674418604651,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004947262628494045,
|
|
"loss": 5.5794,
|
|
"mean_token_accuracy": 0.16848823577165603,
|
|
"num_tokens": 3529786.0,
|
|
"step": 1570
|
|
},
|
|
{
|
|
"entropy": 5.778642225265503,
|
|
"epoch": 1.703082747431044,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0004946335431314018,
|
|
"loss": 5.6825,
|
|
"mean_token_accuracy": 0.17200134098529815,
|
|
"num_tokens": 3540884.0,
|
|
"step": 1575
|
|
},
|
|
{
|
|
"entropy": 5.810184478759766,
|
|
"epoch": 1.7084910762574363,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.0004945400252645959,
|
|
"loss": 5.8803,
|
|
"mean_token_accuracy": 0.16829971969127655,
|
|
"num_tokens": 3553246.0,
|
|
"step": 1580
|
|
},
|
|
{
|
|
"entropy": 5.857252788543701,
|
|
"epoch": 1.7138994050838292,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004944457095888308,
|
|
"loss": 5.7839,
|
|
"mean_token_accuracy": 0.16421065777540206,
|
|
"num_tokens": 3563626.0,
|
|
"step": 1585
|
|
},
|
|
{
|
|
"entropy": 5.899531316757202,
|
|
"epoch": 1.7193077339102216,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00049435059644685,
|
|
"loss": 5.7919,
|
|
"mean_token_accuracy": 0.16754550635814666,
|
|
"num_tokens": 3574221.0,
|
|
"step": 1590
|
|
},
|
|
{
|
|
"entropy": 5.7845847606658936,
|
|
"epoch": 1.7247160627366145,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004942546861842947,
|
|
"loss": 5.8729,
|
|
"mean_token_accuracy": 0.1651529476046562,
|
|
"num_tokens": 3585111.0,
|
|
"step": 1595
|
|
},
|
|
{
|
|
"entropy": 5.907976865768433,
|
|
"epoch": 1.730124391563007,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004941579791497032,
|
|
"loss": 5.8713,
|
|
"mean_token_accuracy": 0.1592499554157257,
|
|
"num_tokens": 3595614.0,
|
|
"step": 1600
|
|
},
|
|
{
|
|
"entropy": 5.924918222427368,
|
|
"epoch": 1.7355327203893998,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004940604756945091,
|
|
"loss": 5.8245,
|
|
"mean_token_accuracy": 0.15840010195970536,
|
|
"num_tokens": 3606280.0,
|
|
"step": 1605
|
|
},
|
|
{
|
|
"entropy": 5.925652408599854,
|
|
"epoch": 1.7409410492157922,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0004939621761730399,
|
|
"loss": 6.0454,
|
|
"mean_token_accuracy": 0.15688003301620485,
|
|
"num_tokens": 3618212.0,
|
|
"step": 1610
|
|
},
|
|
{
|
|
"entropy": 5.800121688842774,
|
|
"epoch": 1.746349378042185,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004938630809425166,
|
|
"loss": 5.7711,
|
|
"mean_token_accuracy": 0.16920888274908066,
|
|
"num_tokens": 3629869.0,
|
|
"step": 1615
|
|
},
|
|
{
|
|
"entropy": 5.8043921947479244,
|
|
"epoch": 1.7517577068685775,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004937631903630513,
|
|
"loss": 5.7201,
|
|
"mean_token_accuracy": 0.16540371924638747,
|
|
"num_tokens": 3640522.0,
|
|
"step": 1620
|
|
},
|
|
{
|
|
"entropy": 5.8789771556854244,
|
|
"epoch": 1.7571660356949703,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.0004936625047976468,
|
|
"loss": 5.9076,
|
|
"mean_token_accuracy": 0.15947771072387695,
|
|
"num_tokens": 3652407.0,
|
|
"step": 1625
|
|
},
|
|
{
|
|
"entropy": 5.766597938537598,
|
|
"epoch": 1.7625743645213627,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004935610246121944,
|
|
"loss": 5.6778,
|
|
"mean_token_accuracy": 0.16362657248973847,
|
|
"num_tokens": 3663256.0,
|
|
"step": 1630
|
|
},
|
|
{
|
|
"entropy": 5.953878927230835,
|
|
"epoch": 1.7679826933477556,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004934587501754736,
|
|
"loss": 5.9086,
|
|
"mean_token_accuracy": 0.15510267913341522,
|
|
"num_tokens": 3675029.0,
|
|
"step": 1635
|
|
},
|
|
{
|
|
"entropy": 5.794557094573975,
|
|
"epoch": 1.7733910221741482,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004933556818591498,
|
|
"loss": 5.6824,
|
|
"mean_token_accuracy": 0.1662204995751381,
|
|
"num_tokens": 3685565.0,
|
|
"step": 1640
|
|
},
|
|
{
|
|
"entropy": 5.892733764648438,
|
|
"epoch": 1.7787993510005409,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004932518200377736,
|
|
"loss": 5.973,
|
|
"mean_token_accuracy": 0.15337257981300353,
|
|
"num_tokens": 3697189.0,
|
|
"step": 1645
|
|
},
|
|
{
|
|
"entropy": 5.782190942764283,
|
|
"epoch": 1.7842076798269335,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.0004931471650887789,
|
|
"loss": 5.7113,
|
|
"mean_token_accuracy": 0.16868968158960343,
|
|
"num_tokens": 3708212.0,
|
|
"step": 1650
|
|
},
|
|
{
|
|
"entropy": 5.789211988449097,
|
|
"epoch": 1.7896160086533262,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.0004930417173924822,
|
|
"loss": 5.8201,
|
|
"mean_token_accuracy": 0.16540355384349822,
|
|
"num_tokens": 3720282.0,
|
|
"step": 1655
|
|
},
|
|
{
|
|
"entropy": 5.806392335891724,
|
|
"epoch": 1.7950243374797188,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 0.0004929354773320806,
|
|
"loss": 5.7492,
|
|
"mean_token_accuracy": 0.17258062809705735,
|
|
"num_tokens": 3731466.0,
|
|
"step": 1660
|
|
},
|
|
{
|
|
"entropy": 5.8481114387512205,
|
|
"epoch": 1.8004326663061114,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004928284452936506,
|
|
"loss": 5.7884,
|
|
"mean_token_accuracy": 0.15631649047136306,
|
|
"num_tokens": 3742875.0,
|
|
"step": 1665
|
|
},
|
|
{
|
|
"entropy": 5.81857213973999,
|
|
"epoch": 1.805840995132504,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004927206216661473,
|
|
"loss": 5.7782,
|
|
"mean_token_accuracy": 0.16983126550912858,
|
|
"num_tokens": 3754127.0,
|
|
"step": 1670
|
|
},
|
|
{
|
|
"entropy": 5.814593744277954,
|
|
"epoch": 1.8112493239588967,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.0004926120068414015,
|
|
"loss": 5.7363,
|
|
"mean_token_accuracy": 0.1717712476849556,
|
|
"num_tokens": 3766287.0,
|
|
"step": 1675
|
|
},
|
|
{
|
|
"entropy": 5.832261562347412,
|
|
"epoch": 1.8166576527852893,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.0004925026012141201,
|
|
"loss": 5.7533,
|
|
"mean_token_accuracy": 0.16840974539518355,
|
|
"num_tokens": 3777701.0,
|
|
"step": 1680
|
|
},
|
|
{
|
|
"entropy": 5.688795137405395,
|
|
"epoch": 1.822065981611682,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004923924051818832,
|
|
"loss": 5.77,
|
|
"mean_token_accuracy": 0.16398487389087676,
|
|
"num_tokens": 3789545.0,
|
|
"step": 1685
|
|
},
|
|
{
|
|
"entropy": 5.87932186126709,
|
|
"epoch": 1.8274743104380746,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004922814191451435,
|
|
"loss": 5.7877,
|
|
"mean_token_accuracy": 0.1675479829311371,
|
|
"num_tokens": 3799937.0,
|
|
"step": 1690
|
|
},
|
|
{
|
|
"entropy": 5.675029563903808,
|
|
"epoch": 1.8328826392644673,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.0004921696435072245,
|
|
"loss": 5.7024,
|
|
"mean_token_accuracy": 0.16483644843101503,
|
|
"num_tokens": 3811066.0,
|
|
"step": 1695
|
|
},
|
|
{
|
|
"entropy": 5.856202793121338,
|
|
"epoch": 1.83829096809086,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.0004920570786743191,
|
|
"loss": 5.8093,
|
|
"mean_token_accuracy": 0.16380842924118041,
|
|
"num_tokens": 3823409.0,
|
|
"step": 1700
|
|
},
|
|
{
|
|
"entropy": 5.8508154392242435,
|
|
"epoch": 1.8436992969172525,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.0004919437250554882,
|
|
"loss": 5.7945,
|
|
"mean_token_accuracy": 0.1685192406177521,
|
|
"num_tokens": 3835375.0,
|
|
"step": 1705
|
|
},
|
|
{
|
|
"entropy": 5.687268495559692,
|
|
"epoch": 1.8491076257436452,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004918295830626592,
|
|
"loss": 5.6199,
|
|
"mean_token_accuracy": 0.17425741553306578,
|
|
"num_tokens": 3845807.0,
|
|
"step": 1710
|
|
},
|
|
{
|
|
"entropy": 5.788436841964722,
|
|
"epoch": 1.8545159545700378,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0004917146531106242,
|
|
"loss": 5.6934,
|
|
"mean_token_accuracy": 0.16580729633569719,
|
|
"num_tokens": 3857391.0,
|
|
"step": 1715
|
|
},
|
|
{
|
|
"entropy": 5.771870946884155,
|
|
"epoch": 1.8599242833964305,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.0004915989356170389,
|
|
"loss": 5.7494,
|
|
"mean_token_accuracy": 0.17230032980442048,
|
|
"num_tokens": 3869101.0,
|
|
"step": 1720
|
|
},
|
|
{
|
|
"entropy": 5.770860576629639,
|
|
"epoch": 1.865332612222823,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004914824310024213,
|
|
"loss": 5.7552,
|
|
"mean_token_accuracy": 0.17646077275276184,
|
|
"num_tokens": 3880516.0,
|
|
"step": 1725
|
|
},
|
|
{
|
|
"entropy": 5.802186679840088,
|
|
"epoch": 1.870740941049216,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004913651396901489,
|
|
"loss": 5.7375,
|
|
"mean_token_accuracy": 0.17009686082601547,
|
|
"num_tokens": 3891869.0,
|
|
"step": 1730
|
|
},
|
|
{
|
|
"entropy": 5.660962438583374,
|
|
"epoch": 1.8761492698756084,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.000491247062106459,
|
|
"loss": 5.6714,
|
|
"mean_token_accuracy": 0.17097828686237335,
|
|
"num_tokens": 3902621.0,
|
|
"step": 1735
|
|
},
|
|
{
|
|
"entropy": 5.697124576568603,
|
|
"epoch": 1.8815575987020012,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004911281986804455,
|
|
"loss": 5.6599,
|
|
"mean_token_accuracy": 0.1695478856563568,
|
|
"num_tokens": 3913052.0,
|
|
"step": 1740
|
|
},
|
|
{
|
|
"entropy": 5.864525413513183,
|
|
"epoch": 1.8869659275283936,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004910085498440587,
|
|
"loss": 5.8739,
|
|
"mean_token_accuracy": 0.16169072985649108,
|
|
"num_tokens": 3924727.0,
|
|
"step": 1745
|
|
},
|
|
{
|
|
"entropy": 5.882341718673706,
|
|
"epoch": 1.8923742563547865,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.0004908881160321025,
|
|
"loss": 5.8919,
|
|
"mean_token_accuracy": 0.15799911320209503,
|
|
"num_tokens": 3938053.0,
|
|
"step": 1750
|
|
},
|
|
{
|
|
"entropy": 5.737301301956177,
|
|
"epoch": 1.897782585181179,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004907668976822338,
|
|
"loss": 5.7302,
|
|
"mean_token_accuracy": 0.16925743073225022,
|
|
"num_tokens": 3949265.0,
|
|
"step": 1755
|
|
},
|
|
{
|
|
"entropy": 5.788043117523193,
|
|
"epoch": 1.9031909140075718,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004906448952349603,
|
|
"loss": 5.7029,
|
|
"mean_token_accuracy": 0.16863157749176025,
|
|
"num_tokens": 3958808.0,
|
|
"step": 1760
|
|
},
|
|
{
|
|
"entropy": 5.826327991485596,
|
|
"epoch": 1.9085992428339642,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004905221091336392,
|
|
"loss": 5.6841,
|
|
"mean_token_accuracy": 0.16804007589817047,
|
|
"num_tokens": 3970593.0,
|
|
"step": 1765
|
|
},
|
|
{
|
|
"entropy": 5.780668926239014,
|
|
"epoch": 1.914007571660357,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004903985398244753,
|
|
"loss": 5.7403,
|
|
"mean_token_accuracy": 0.16854489743709564,
|
|
"num_tokens": 3981552.0,
|
|
"step": 1770
|
|
},
|
|
{
|
|
"entropy": 5.681759595870972,
|
|
"epoch": 1.9194159004867495,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004902741877565201,
|
|
"loss": 5.6348,
|
|
"mean_token_accuracy": 0.17166891396045686,
|
|
"num_tokens": 3991932.0,
|
|
"step": 1775
|
|
},
|
|
{
|
|
"entropy": 5.894567060470581,
|
|
"epoch": 1.9248242293131423,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.000490149053381669,
|
|
"loss": 5.8364,
|
|
"mean_token_accuracy": 0.1588580071926117,
|
|
"num_tokens": 4002234.0,
|
|
"step": 1780
|
|
},
|
|
{
|
|
"entropy": 5.816265201568603,
|
|
"epoch": 1.9302325581395348,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004900231371546608,
|
|
"loss": 5.669,
|
|
"mean_token_accuracy": 0.1731552764773369,
|
|
"num_tokens": 4011800.0,
|
|
"step": 1785
|
|
},
|
|
{
|
|
"entropy": 5.7900268077850345,
|
|
"epoch": 1.9356408869659276,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004898964395330753,
|
|
"loss": 5.8816,
|
|
"mean_token_accuracy": 0.1661091312766075,
|
|
"num_tokens": 4022503.0,
|
|
"step": 1790
|
|
},
|
|
{
|
|
"entropy": 5.808759117126465,
|
|
"epoch": 1.94104921579232,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004897689609773318,
|
|
"loss": 5.7556,
|
|
"mean_token_accuracy": 0.16821117252111434,
|
|
"num_tokens": 4032310.0,
|
|
"step": 1795
|
|
},
|
|
{
|
|
"entropy": 5.823995923995971,
|
|
"epoch": 1.946457544618713,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004896407019506879,
|
|
"loss": 5.7947,
|
|
"mean_token_accuracy": 0.16529604643583298,
|
|
"num_tokens": 4043290.0,
|
|
"step": 1800
|
|
},
|
|
{
|
|
"entropy": 5.788540172576904,
|
|
"epoch": 1.9518658734451053,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004895116629192371,
|
|
"loss": 5.8935,
|
|
"mean_token_accuracy": 0.15940507650375366,
|
|
"num_tokens": 4054550.0,
|
|
"step": 1805
|
|
},
|
|
{
|
|
"entropy": 5.859425354003906,
|
|
"epoch": 1.9572742022714982,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004893818443519074,
|
|
"loss": 5.6579,
|
|
"mean_token_accuracy": 0.17276726216077803,
|
|
"num_tokens": 4064740.0,
|
|
"step": 1810
|
|
},
|
|
{
|
|
"entropy": 5.77848072052002,
|
|
"epoch": 1.9626825310978906,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.00048925124672046,
|
|
"loss": 5.8104,
|
|
"mean_token_accuracy": 0.16045169085264205,
|
|
"num_tokens": 4075466.0,
|
|
"step": 1815
|
|
},
|
|
{
|
|
"entropy": 5.7506016254425045,
|
|
"epoch": 1.9680908599242835,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0004891198704994868,
|
|
"loss": 5.7746,
|
|
"mean_token_accuracy": 0.16419024467468263,
|
|
"num_tokens": 4085794.0,
|
|
"step": 1820
|
|
},
|
|
{
|
|
"entropy": 5.774007272720337,
|
|
"epoch": 1.973499188750676,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004889877161664096,
|
|
"loss": 5.776,
|
|
"mean_token_accuracy": 0.16607008278369903,
|
|
"num_tokens": 4097587.0,
|
|
"step": 1825
|
|
},
|
|
{
|
|
"entropy": 5.8042127132415775,
|
|
"epoch": 1.9789075175770687,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.0004888547842014771,
|
|
"loss": 5.7397,
|
|
"mean_token_accuracy": 0.16423825323581695,
|
|
"num_tokens": 4110194.0,
|
|
"step": 1830
|
|
},
|
|
{
|
|
"entropy": 5.843971633911133,
|
|
"epoch": 1.9843158464034614,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.0004887210750877648,
|
|
"loss": 5.788,
|
|
"mean_token_accuracy": 0.16245697140693666,
|
|
"num_tokens": 4121967.0,
|
|
"step": 1835
|
|
},
|
|
{
|
|
"entropy": 5.6416247367858885,
|
|
"epoch": 1.989724175229854,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004885865893111716,
|
|
"loss": 5.6734,
|
|
"mean_token_accuracy": 0.17218596786260604,
|
|
"num_tokens": 4131457.0,
|
|
"step": 1840
|
|
},
|
|
{
|
|
"entropy": 5.8589592456817625,
|
|
"epoch": 1.9951325040562466,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004884513273604195,
|
|
"loss": 5.795,
|
|
"mean_token_accuracy": 0.1732928141951561,
|
|
"num_tokens": 4143820.0,
|
|
"step": 1845
|
|
},
|
|
{
|
|
"entropy": 5.841017987993029,
|
|
"epoch": 2.0,
|
|
"grad_norm": 1.8359375,
|
|
"learning_rate": 0.0004883152897270502,
|
|
"loss": 5.8574,
|
|
"mean_token_accuracy": 0.163099843594763,
|
|
"num_tokens": 4153778.0,
|
|
"step": 1850
|
|
},
|
|
{
|
|
"entropy": 5.737104320526123,
|
|
"epoch": 2.005408328826393,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.0004881784769054253,
|
|
"loss": 5.4329,
|
|
"mean_token_accuracy": 0.1771388202905655,
|
|
"num_tokens": 4166682.0,
|
|
"step": 1855
|
|
},
|
|
{
|
|
"entropy": 5.7277398109436035,
|
|
"epoch": 2.0108166576527853,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.0004880408893927226,
|
|
"loss": 5.4478,
|
|
"mean_token_accuracy": 0.17328148931264878,
|
|
"num_tokens": 4178621.0,
|
|
"step": 1860
|
|
},
|
|
{
|
|
"entropy": 5.772768115997314,
|
|
"epoch": 2.016224986479178,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.0004879025276889355,
|
|
"loss": 5.3683,
|
|
"mean_token_accuracy": 0.18826774805784224,
|
|
"num_tokens": 4189956.0,
|
|
"step": 1865
|
|
},
|
|
{
|
|
"entropy": 5.555465173721314,
|
|
"epoch": 2.0216333153055706,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 0.00048776339229687077,
|
|
"loss": 5.3996,
|
|
"mean_token_accuracy": 0.17681935131549836,
|
|
"num_tokens": 4202547.0,
|
|
"step": 1870
|
|
},
|
|
{
|
|
"entropy": 5.801024436950684,
|
|
"epoch": 2.0270416441319634,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00048762348372214683,
|
|
"loss": 5.3898,
|
|
"mean_token_accuracy": 0.18697095662355423,
|
|
"num_tokens": 4212416.0,
|
|
"step": 1875
|
|
},
|
|
{
|
|
"entropy": 5.594231700897216,
|
|
"epoch": 2.032449972958356,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00048748280247319165,
|
|
"loss": 5.3488,
|
|
"mean_token_accuracy": 0.17242017537355422,
|
|
"num_tokens": 4223710.0,
|
|
"step": 1880
|
|
},
|
|
{
|
|
"entropy": 5.726772785186768,
|
|
"epoch": 2.0378583017847487,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004873413490612412,
|
|
"loss": 5.4429,
|
|
"mean_token_accuracy": 0.17841096520423888,
|
|
"num_tokens": 4235245.0,
|
|
"step": 1885
|
|
},
|
|
{
|
|
"entropy": 5.665938758850098,
|
|
"epoch": 2.043266630611141,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00048719912400033757,
|
|
"loss": 5.3764,
|
|
"mean_token_accuracy": 0.18664392828941345,
|
|
"num_tokens": 4247113.0,
|
|
"step": 1890
|
|
},
|
|
{
|
|
"entropy": 5.736206531524658,
|
|
"epoch": 2.048674959437534,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 0.000487056127807327,
|
|
"loss": 5.4366,
|
|
"mean_token_accuracy": 0.1796937808394432,
|
|
"num_tokens": 4259413.0,
|
|
"step": 1895
|
|
},
|
|
{
|
|
"entropy": 5.617617559432984,
|
|
"epoch": 2.0540832882639264,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00048691236100185795,
|
|
"loss": 5.3371,
|
|
"mean_token_accuracy": 0.1845716044306755,
|
|
"num_tokens": 4269413.0,
|
|
"step": 1900
|
|
},
|
|
{
|
|
"entropy": 5.596398448944091,
|
|
"epoch": 2.0594916170903192,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004867678241063792,
|
|
"loss": 5.3148,
|
|
"mean_token_accuracy": 0.19401925355195998,
|
|
"num_tokens": 4279453.0,
|
|
"step": 1905
|
|
},
|
|
{
|
|
"entropy": 5.688255643844604,
|
|
"epoch": 2.0648999459167117,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00048662251764613833,
|
|
"loss": 5.4226,
|
|
"mean_token_accuracy": 0.18174491822719574,
|
|
"num_tokens": 4290958.0,
|
|
"step": 1910
|
|
},
|
|
{
|
|
"entropy": 5.5896929740905765,
|
|
"epoch": 2.0703082747431045,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004864764421491793,
|
|
"loss": 5.3235,
|
|
"mean_token_accuracy": 0.18415751457214355,
|
|
"num_tokens": 4301867.0,
|
|
"step": 1915
|
|
},
|
|
{
|
|
"entropy": 5.628929805755615,
|
|
"epoch": 2.075716603569497,
|
|
"grad_norm": 0.9765625,
|
|
"learning_rate": 0.0004863295981463408,
|
|
"loss": 5.3725,
|
|
"mean_token_accuracy": 0.17780343294143677,
|
|
"num_tokens": 4314890.0,
|
|
"step": 1920
|
|
},
|
|
{
|
|
"entropy": 5.734420442581177,
|
|
"epoch": 2.08112493239589,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004861819861712543,
|
|
"loss": 5.5296,
|
|
"mean_token_accuracy": 0.1750368744134903,
|
|
"num_tokens": 4325368.0,
|
|
"step": 1925
|
|
},
|
|
{
|
|
"entropy": 5.699685955047608,
|
|
"epoch": 2.086533261222282,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00048603360676034203,
|
|
"loss": 5.4862,
|
|
"mean_token_accuracy": 0.17520413398742676,
|
|
"num_tokens": 4337469.0,
|
|
"step": 1930
|
|
},
|
|
{
|
|
"entropy": 5.71870493888855,
|
|
"epoch": 2.091941590048675,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00048588446045281505,
|
|
"loss": 5.411,
|
|
"mean_token_accuracy": 0.18186349123716355,
|
|
"num_tokens": 4349115.0,
|
|
"step": 1935
|
|
},
|
|
{
|
|
"entropy": 5.632260799407959,
|
|
"epoch": 2.0973499188750675,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004857345477906714,
|
|
"loss": 5.3729,
|
|
"mean_token_accuracy": 0.18043224960565568,
|
|
"num_tokens": 4360287.0,
|
|
"step": 1940
|
|
},
|
|
{
|
|
"entropy": 5.676126623153687,
|
|
"epoch": 2.1027582477014604,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00048558386931869417,
|
|
"loss": 5.5284,
|
|
"mean_token_accuracy": 0.17184396237134933,
|
|
"num_tokens": 4371966.0,
|
|
"step": 1945
|
|
},
|
|
{
|
|
"entropy": 5.658498477935791,
|
|
"epoch": 2.1081665765278528,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004854324255844492,
|
|
"loss": 5.4212,
|
|
"mean_token_accuracy": 0.18277220278978348,
|
|
"num_tokens": 4382837.0,
|
|
"step": 1950
|
|
},
|
|
{
|
|
"entropy": 5.5803807258605955,
|
|
"epoch": 2.1135749053542456,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.00048528021713828336,
|
|
"loss": 5.385,
|
|
"mean_token_accuracy": 0.18133683502674103,
|
|
"num_tokens": 4393970.0,
|
|
"step": 1955
|
|
},
|
|
{
|
|
"entropy": 5.634076642990112,
|
|
"epoch": 2.118983234180638,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004851272445333225,
|
|
"loss": 5.3915,
|
|
"mean_token_accuracy": 0.1862371161580086,
|
|
"num_tokens": 4404450.0,
|
|
"step": 1960
|
|
},
|
|
{
|
|
"entropy": 5.712316226959229,
|
|
"epoch": 2.124391563007031,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00048497350832546937,
|
|
"loss": 5.5442,
|
|
"mean_token_accuracy": 0.1754376158118248,
|
|
"num_tokens": 4417203.0,
|
|
"step": 1965
|
|
},
|
|
{
|
|
"entropy": 5.699717664718628,
|
|
"epoch": 2.1297998918334233,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004848190090734018,
|
|
"loss": 5.4613,
|
|
"mean_token_accuracy": 0.17721105217933655,
|
|
"num_tokens": 4429458.0,
|
|
"step": 1970
|
|
},
|
|
{
|
|
"entropy": 5.758607196807861,
|
|
"epoch": 2.135208220659816,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.00048466374733857035,
|
|
"loss": 5.5414,
|
|
"mean_token_accuracy": 0.16932629495859147,
|
|
"num_tokens": 4441445.0,
|
|
"step": 1975
|
|
},
|
|
{
|
|
"entropy": 5.592848825454712,
|
|
"epoch": 2.1406165494862086,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0004845077236851966,
|
|
"loss": 5.425,
|
|
"mean_token_accuracy": 0.17384567111730576,
|
|
"num_tokens": 4453152.0,
|
|
"step": 1980
|
|
},
|
|
{
|
|
"entropy": 5.719186878204345,
|
|
"epoch": 2.1460248783126015,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.00048435093868027076,
|
|
"loss": 5.3971,
|
|
"mean_token_accuracy": 0.18340317606925965,
|
|
"num_tokens": 4464478.0,
|
|
"step": 1985
|
|
},
|
|
{
|
|
"entropy": 5.505934143066407,
|
|
"epoch": 2.151433207138994,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00048419339289354995,
|
|
"loss": 5.4474,
|
|
"mean_token_accuracy": 0.17782567739486693,
|
|
"num_tokens": 4476253.0,
|
|
"step": 1990
|
|
},
|
|
{
|
|
"entropy": 5.706979608535766,
|
|
"epoch": 2.1568415359653867,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.000484035086897556,
|
|
"loss": 5.4232,
|
|
"mean_token_accuracy": 0.18010570853948593,
|
|
"num_tokens": 4488209.0,
|
|
"step": 1995
|
|
},
|
|
{
|
|
"entropy": 5.565637159347534,
|
|
"epoch": 2.162249864791779,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004838760212675732,
|
|
"loss": 5.365,
|
|
"mean_token_accuracy": 0.18658868819475175,
|
|
"num_tokens": 4499937.0,
|
|
"step": 2000
|
|
},
|
|
{
|
|
"epoch": 2.162249864791779,
|
|
"eval_entropy": 5.472852083769712,
|
|
"eval_loss": 6.006684303283691,
|
|
"eval_mean_token_accuracy": 0.16748105433176863,
|
|
"eval_num_tokens": 4499937.0,
|
|
"eval_runtime": 2.6965,
|
|
"eval_samples_per_second": 1303.524,
|
|
"eval_steps_per_second": 163.172,
|
|
"step": 2000
|
|
},
|
|
{
|
|
"entropy": 5.576435613632202,
|
|
"epoch": 2.167658193618172,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004837161965816464,
|
|
"loss": 5.4196,
|
|
"mean_token_accuracy": 0.16989136040210723,
|
|
"num_tokens": 4510567.0,
|
|
"step": 2005
|
|
},
|
|
{
|
|
"entropy": 5.540714836120605,
|
|
"epoch": 2.1730665224445644,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.00048355561342057886,
|
|
"loss": 5.351,
|
|
"mean_token_accuracy": 0.18173110485076904,
|
|
"num_tokens": 4522695.0,
|
|
"step": 2010
|
|
},
|
|
{
|
|
"entropy": 5.63709716796875,
|
|
"epoch": 2.1784748512709573,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00048339427236793024,
|
|
"loss": 5.3435,
|
|
"mean_token_accuracy": 0.18755321353673934,
|
|
"num_tokens": 4534642.0,
|
|
"step": 2015
|
|
},
|
|
{
|
|
"entropy": 5.672750425338745,
|
|
"epoch": 2.1838831800973497,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004832321740100143,
|
|
"loss": 5.474,
|
|
"mean_token_accuracy": 0.17547187954187393,
|
|
"num_tokens": 4546021.0,
|
|
"step": 2020
|
|
},
|
|
{
|
|
"entropy": 5.571087646484375,
|
|
"epoch": 2.1892915089237426,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.00048306931893589666,
|
|
"loss": 5.3209,
|
|
"mean_token_accuracy": 0.17968493103981018,
|
|
"num_tokens": 4556814.0,
|
|
"step": 2025
|
|
},
|
|
{
|
|
"entropy": 5.581038284301758,
|
|
"epoch": 2.194699837750135,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00048290570773739327,
|
|
"loss": 5.3348,
|
|
"mean_token_accuracy": 0.18085583597421645,
|
|
"num_tokens": 4568595.0,
|
|
"step": 2030
|
|
},
|
|
{
|
|
"entropy": 5.618092823028564,
|
|
"epoch": 2.200108166576528,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00048274134100906747,
|
|
"loss": 5.4454,
|
|
"mean_token_accuracy": 0.18696052879095076,
|
|
"num_tokens": 4579536.0,
|
|
"step": 2035
|
|
},
|
|
{
|
|
"entropy": 5.591726541519165,
|
|
"epoch": 2.2055164954029207,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.00048257621934822835,
|
|
"loss": 5.3825,
|
|
"mean_token_accuracy": 0.19023619443178177,
|
|
"num_tokens": 4590497.0,
|
|
"step": 2040
|
|
},
|
|
{
|
|
"entropy": 5.658607339859008,
|
|
"epoch": 2.210924824229313,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0004824103433549285,
|
|
"loss": 5.48,
|
|
"mean_token_accuracy": 0.1759459152817726,
|
|
"num_tokens": 4601699.0,
|
|
"step": 2045
|
|
},
|
|
{
|
|
"entropy": 5.565668439865112,
|
|
"epoch": 2.2163331530557056,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004822437136319616,
|
|
"loss": 5.3915,
|
|
"mean_token_accuracy": 0.17944610118865967,
|
|
"num_tokens": 4611857.0,
|
|
"step": 2050
|
|
},
|
|
{
|
|
"entropy": 5.6317449569702145,
|
|
"epoch": 2.2217414818820984,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004820763307848604,
|
|
"loss": 5.4326,
|
|
"mean_token_accuracy": 0.18303177803754805,
|
|
"num_tokens": 4623042.0,
|
|
"step": 2055
|
|
},
|
|
{
|
|
"entropy": 5.515517139434815,
|
|
"epoch": 2.2271498107084913,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00048190819542189456,
|
|
"loss": 5.4309,
|
|
"mean_token_accuracy": 0.1750242218375206,
|
|
"num_tokens": 4634398.0,
|
|
"step": 2060
|
|
},
|
|
{
|
|
"entropy": 5.572394561767578,
|
|
"epoch": 2.2325581395348837,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00048173930815406847,
|
|
"loss": 5.3289,
|
|
"mean_token_accuracy": 0.1918608710169792,
|
|
"num_tokens": 4645140.0,
|
|
"step": 2065
|
|
},
|
|
{
|
|
"entropy": 5.510449647903442,
|
|
"epoch": 2.2379664683612766,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004815696695951187,
|
|
"loss": 5.3579,
|
|
"mean_token_accuracy": 0.17949569076299668,
|
|
"num_tokens": 4657490.0,
|
|
"step": 2070
|
|
},
|
|
{
|
|
"entropy": 5.617029333114624,
|
|
"epoch": 2.243374797187669,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004813992803615123,
|
|
"loss": 5.3953,
|
|
"mean_token_accuracy": 0.1817226678133011,
|
|
"num_tokens": 4670109.0,
|
|
"step": 2075
|
|
},
|
|
{
|
|
"entropy": 5.497842073440552,
|
|
"epoch": 2.248783126014062,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00048122814107244414,
|
|
"loss": 5.325,
|
|
"mean_token_accuracy": 0.19015913605690002,
|
|
"num_tokens": 4681498.0,
|
|
"step": 2080
|
|
},
|
|
{
|
|
"entropy": 5.674573040008545,
|
|
"epoch": 2.2541914548404542,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.00048105625234983466,
|
|
"loss": 5.5858,
|
|
"mean_token_accuracy": 0.1682846337556839,
|
|
"num_tokens": 4693351.0,
|
|
"step": 2085
|
|
},
|
|
{
|
|
"entropy": 5.653087711334228,
|
|
"epoch": 2.259599783666847,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.00048088361481832807,
|
|
"loss": 5.522,
|
|
"mean_token_accuracy": 0.17714594304561615,
|
|
"num_tokens": 4705088.0,
|
|
"step": 2090
|
|
},
|
|
{
|
|
"entropy": 5.638476133346558,
|
|
"epoch": 2.2650081124932395,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.00048071022910528934,
|
|
"loss": 5.4,
|
|
"mean_token_accuracy": 0.18836630284786224,
|
|
"num_tokens": 4716834.0,
|
|
"step": 2095
|
|
},
|
|
{
|
|
"entropy": 5.64174747467041,
|
|
"epoch": 2.2704164413196324,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.00048053609584080274,
|
|
"loss": 5.4491,
|
|
"mean_token_accuracy": 0.17846577763557434,
|
|
"num_tokens": 4728286.0,
|
|
"step": 2100
|
|
},
|
|
{
|
|
"entropy": 5.576927280426025,
|
|
"epoch": 2.275824770146025,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00048036121565766876,
|
|
"loss": 5.3714,
|
|
"mean_token_accuracy": 0.18769163638353348,
|
|
"num_tokens": 4739296.0,
|
|
"step": 2105
|
|
},
|
|
{
|
|
"entropy": 5.574035024642944,
|
|
"epoch": 2.2812330989724177,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004801855891914026,
|
|
"loss": 5.3497,
|
|
"mean_token_accuracy": 0.19533850848674775,
|
|
"num_tokens": 4749526.0,
|
|
"step": 2110
|
|
},
|
|
{
|
|
"entropy": 5.5547194480896,
|
|
"epoch": 2.28664142779881,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00048000921708023117,
|
|
"loss": 5.3854,
|
|
"mean_token_accuracy": 0.18343230336904526,
|
|
"num_tokens": 4760496.0,
|
|
"step": 2115
|
|
},
|
|
{
|
|
"entropy": 5.5593877792358395,
|
|
"epoch": 2.292049756625203,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004798320999650911,
|
|
"loss": 5.3665,
|
|
"mean_token_accuracy": 0.1883173793554306,
|
|
"num_tokens": 4771079.0,
|
|
"step": 2120
|
|
},
|
|
{
|
|
"entropy": 5.538218402862549,
|
|
"epoch": 2.2974580854515954,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00047965423848962636,
|
|
"loss": 5.3897,
|
|
"mean_token_accuracy": 0.19219416081905366,
|
|
"num_tokens": 4781960.0,
|
|
"step": 2125
|
|
},
|
|
{
|
|
"entropy": 5.5187544345855715,
|
|
"epoch": 2.302866414277988,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.000479475633300186,
|
|
"loss": 5.304,
|
|
"mean_token_accuracy": 0.18261959850788118,
|
|
"num_tokens": 4793174.0,
|
|
"step": 2130
|
|
},
|
|
{
|
|
"entropy": 5.629965209960938,
|
|
"epoch": 2.3082747431043806,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00047929628504582173,
|
|
"loss": 5.4836,
|
|
"mean_token_accuracy": 0.1778162494301796,
|
|
"num_tokens": 4804344.0,
|
|
"step": 2135
|
|
},
|
|
{
|
|
"entropy": 5.6045232772827145,
|
|
"epoch": 2.3136830719307735,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004791161943782856,
|
|
"loss": 5.4379,
|
|
"mean_token_accuracy": 0.18713171631097794,
|
|
"num_tokens": 4815838.0,
|
|
"step": 2140
|
|
},
|
|
{
|
|
"entropy": 5.535661602020264,
|
|
"epoch": 2.319091400757166,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00047893536195202726,
|
|
"loss": 5.3257,
|
|
"mean_token_accuracy": 0.18756370097398758,
|
|
"num_tokens": 4826153.0,
|
|
"step": 2145
|
|
},
|
|
{
|
|
"entropy": 5.4889808177948,
|
|
"epoch": 2.3244997295835588,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004787537884241923,
|
|
"loss": 5.4147,
|
|
"mean_token_accuracy": 0.1823410928249359,
|
|
"num_tokens": 4838647.0,
|
|
"step": 2150
|
|
},
|
|
{
|
|
"entropy": 5.69741678237915,
|
|
"epoch": 2.329908058409951,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00047857147445461943,
|
|
"loss": 5.5028,
|
|
"mean_token_accuracy": 0.174128720164299,
|
|
"num_tokens": 4849320.0,
|
|
"step": 2155
|
|
},
|
|
{
|
|
"entropy": 5.574743413925171,
|
|
"epoch": 2.335316387236344,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004783884207058379,
|
|
"loss": 5.3685,
|
|
"mean_token_accuracy": 0.1826545551419258,
|
|
"num_tokens": 4860079.0,
|
|
"step": 2160
|
|
},
|
|
{
|
|
"entropy": 5.509880256652832,
|
|
"epoch": 2.3407247160627365,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00047820462784306555,
|
|
"loss": 5.3293,
|
|
"mean_token_accuracy": 0.1828920543193817,
|
|
"num_tokens": 4871073.0,
|
|
"step": 2165
|
|
},
|
|
{
|
|
"entropy": 5.555741643905639,
|
|
"epoch": 2.3461330448891293,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.000478020096534206,
|
|
"loss": 5.3453,
|
|
"mean_token_accuracy": 0.18160604387521745,
|
|
"num_tokens": 4881517.0,
|
|
"step": 2170
|
|
},
|
|
{
|
|
"entropy": 5.546141862869263,
|
|
"epoch": 2.3515413737155217,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00047783482744984644,
|
|
"loss": 5.4308,
|
|
"mean_token_accuracy": 0.1774826467037201,
|
|
"num_tokens": 4892554.0,
|
|
"step": 2175
|
|
},
|
|
{
|
|
"entropy": 5.581753587722778,
|
|
"epoch": 2.3569497025419146,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00047764882126325527,
|
|
"loss": 5.4502,
|
|
"mean_token_accuracy": 0.17918796688318253,
|
|
"num_tokens": 4903168.0,
|
|
"step": 2180
|
|
},
|
|
{
|
|
"entropy": 5.592440605163574,
|
|
"epoch": 2.362358031368307,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004774620786503793,
|
|
"loss": 5.4973,
|
|
"mean_token_accuracy": 0.17680401653051375,
|
|
"num_tokens": 4914213.0,
|
|
"step": 2185
|
|
},
|
|
{
|
|
"entropy": 5.670473623275757,
|
|
"epoch": 2.3677663601947,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004772746002898417,
|
|
"loss": 5.4517,
|
|
"mean_token_accuracy": 0.18014305382966994,
|
|
"num_tokens": 4926271.0,
|
|
"step": 2190
|
|
},
|
|
{
|
|
"entropy": 5.532607746124268,
|
|
"epoch": 2.3731746890210923,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00047708638686293903,
|
|
"loss": 5.3515,
|
|
"mean_token_accuracy": 0.19012952744960784,
|
|
"num_tokens": 4938386.0,
|
|
"step": 2195
|
|
},
|
|
{
|
|
"entropy": 5.573096704483032,
|
|
"epoch": 2.378583017847485,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00047689743905363963,
|
|
"loss": 5.3258,
|
|
"mean_token_accuracy": 0.18657357543706893,
|
|
"num_tokens": 4949920.0,
|
|
"step": 2200
|
|
},
|
|
{
|
|
"entropy": 5.493396759033203,
|
|
"epoch": 2.383991346673878,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004767077575485801,
|
|
"loss": 5.4508,
|
|
"mean_token_accuracy": 0.17724529951810836,
|
|
"num_tokens": 4961639.0,
|
|
"step": 2205
|
|
},
|
|
{
|
|
"entropy": 5.576059484481812,
|
|
"epoch": 2.3893996755002704,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004765173430370635,
|
|
"loss": 5.3795,
|
|
"mean_token_accuracy": 0.1817702829837799,
|
|
"num_tokens": 4972863.0,
|
|
"step": 2210
|
|
},
|
|
{
|
|
"entropy": 5.557861566543579,
|
|
"epoch": 2.394808004326663,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004763261962110567,
|
|
"loss": 5.3465,
|
|
"mean_token_accuracy": 0.18829651176929474,
|
|
"num_tokens": 4982767.0,
|
|
"step": 2215
|
|
},
|
|
{
|
|
"entropy": 5.482148265838623,
|
|
"epoch": 2.4002163331530557,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004761343177651875,
|
|
"loss": 5.3647,
|
|
"mean_token_accuracy": 0.181600858271122,
|
|
"num_tokens": 4993610.0,
|
|
"step": 2220
|
|
},
|
|
{
|
|
"entropy": 5.647186183929444,
|
|
"epoch": 2.4056246619794486,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004759417083967428,
|
|
"loss": 5.4748,
|
|
"mean_token_accuracy": 0.18320268392562866,
|
|
"num_tokens": 5004443.0,
|
|
"step": 2225
|
|
},
|
|
{
|
|
"entropy": 5.47214641571045,
|
|
"epoch": 2.411032990805841,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00047574836880566544,
|
|
"loss": 5.322,
|
|
"mean_token_accuracy": 0.18720456659793855,
|
|
"num_tokens": 5014551.0,
|
|
"step": 2230
|
|
},
|
|
{
|
|
"entropy": 5.606646919250489,
|
|
"epoch": 2.4164413196322334,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004755542996945519,
|
|
"loss": 5.4073,
|
|
"mean_token_accuracy": 0.18585125505924224,
|
|
"num_tokens": 5025561.0,
|
|
"step": 2235
|
|
},
|
|
{
|
|
"entropy": 5.571566343307495,
|
|
"epoch": 2.4218496484586263,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00047535950176864976,
|
|
"loss": 5.3324,
|
|
"mean_token_accuracy": 0.19187741875648498,
|
|
"num_tokens": 5036515.0,
|
|
"step": 2240
|
|
},
|
|
{
|
|
"entropy": 5.440071678161621,
|
|
"epoch": 2.427257977285019,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.00047516397573585525,
|
|
"loss": 5.3935,
|
|
"mean_token_accuracy": 0.17414860427379608,
|
|
"num_tokens": 5048228.0,
|
|
"step": 2245
|
|
},
|
|
{
|
|
"entropy": 5.583653306961059,
|
|
"epoch": 2.4326663061114115,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00047496772230671034,
|
|
"loss": 5.4135,
|
|
"mean_token_accuracy": 0.17929787188768387,
|
|
"num_tokens": 5059574.0,
|
|
"step": 2250
|
|
},
|
|
{
|
|
"entropy": 5.500989532470703,
|
|
"epoch": 2.4380746349378044,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004747707421944004,
|
|
"loss": 5.345,
|
|
"mean_token_accuracy": 0.1873723477125168,
|
|
"num_tokens": 5070675.0,
|
|
"step": 2255
|
|
},
|
|
{
|
|
"entropy": 5.499913167953491,
|
|
"epoch": 2.443482963764197,
|
|
"grad_norm": 0.92578125,
|
|
"learning_rate": 0.0004745730361147517,
|
|
"loss": 5.3294,
|
|
"mean_token_accuracy": 0.18599451929330826,
|
|
"num_tokens": 5082620.0,
|
|
"step": 2260
|
|
},
|
|
{
|
|
"entropy": 5.598516607284546,
|
|
"epoch": 2.4488912925905897,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004743746047862286,
|
|
"loss": 5.3919,
|
|
"mean_token_accuracy": 0.1780677855014801,
|
|
"num_tokens": 5094120.0,
|
|
"step": 2265
|
|
},
|
|
{
|
|
"entropy": 5.5201959133148195,
|
|
"epoch": 2.454299621416982,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004741754489299309,
|
|
"loss": 5.3842,
|
|
"mean_token_accuracy": 0.184432190656662,
|
|
"num_tokens": 5104681.0,
|
|
"step": 2270
|
|
},
|
|
{
|
|
"entropy": 5.505268478393555,
|
|
"epoch": 2.459707950243375,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00047397556926959155,
|
|
"loss": 5.3815,
|
|
"mean_token_accuracy": 0.19052304178476334,
|
|
"num_tokens": 5114901.0,
|
|
"step": 2275
|
|
},
|
|
{
|
|
"entropy": 5.483372545242309,
|
|
"epoch": 2.4651162790697674,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00047377496653157374,
|
|
"loss": 5.3595,
|
|
"mean_token_accuracy": 0.18044475913047792,
|
|
"num_tokens": 5125947.0,
|
|
"step": 2280
|
|
},
|
|
{
|
|
"entropy": 5.68227915763855,
|
|
"epoch": 2.4705246078961602,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00047357364144486806,
|
|
"loss": 5.4893,
|
|
"mean_token_accuracy": 0.17698677629232407,
|
|
"num_tokens": 5137905.0,
|
|
"step": 2285
|
|
},
|
|
{
|
|
"entropy": 5.558288478851319,
|
|
"epoch": 2.4759329367225527,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.00047337159474109057,
|
|
"loss": 5.4702,
|
|
"mean_token_accuracy": 0.17549121230840684,
|
|
"num_tokens": 5150266.0,
|
|
"step": 2290
|
|
},
|
|
{
|
|
"entropy": 5.514402580261231,
|
|
"epoch": 2.4813412655489455,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00047316882715447934,
|
|
"loss": 5.4259,
|
|
"mean_token_accuracy": 0.18137722760438918,
|
|
"num_tokens": 5160909.0,
|
|
"step": 2295
|
|
},
|
|
{
|
|
"entropy": 5.480083179473877,
|
|
"epoch": 2.486749594375338,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004729653394218922,
|
|
"loss": 5.4046,
|
|
"mean_token_accuracy": 0.18145928680896758,
|
|
"num_tokens": 5173645.0,
|
|
"step": 2300
|
|
},
|
|
{
|
|
"entropy": 5.62817873954773,
|
|
"epoch": 2.492157923201731,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00047276113228280427,
|
|
"loss": 5.5656,
|
|
"mean_token_accuracy": 0.16851997673511504,
|
|
"num_tokens": 5186269.0,
|
|
"step": 2305
|
|
},
|
|
{
|
|
"entropy": 5.606264257431031,
|
|
"epoch": 2.497566252028123,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004725562064793045,
|
|
"loss": 5.3757,
|
|
"mean_token_accuracy": 0.19015525728464128,
|
|
"num_tokens": 5197061.0,
|
|
"step": 2310
|
|
},
|
|
{
|
|
"entropy": 5.458608961105346,
|
|
"epoch": 2.502974580854516,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00047235056275609397,
|
|
"loss": 5.3967,
|
|
"mean_token_accuracy": 0.18642975986003876,
|
|
"num_tokens": 5207182.0,
|
|
"step": 2315
|
|
},
|
|
{
|
|
"entropy": 5.570804214477539,
|
|
"epoch": 2.5083829096809085,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004721442018604822,
|
|
"loss": 5.4118,
|
|
"mean_token_accuracy": 0.18205344974994658,
|
|
"num_tokens": 5218381.0,
|
|
"step": 2320
|
|
},
|
|
{
|
|
"entropy": 5.588907957077026,
|
|
"epoch": 2.5137912385073014,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004719371245423853,
|
|
"loss": 5.2995,
|
|
"mean_token_accuracy": 0.19421885162591934,
|
|
"num_tokens": 5228504.0,
|
|
"step": 2325
|
|
},
|
|
{
|
|
"entropy": 5.47154221534729,
|
|
"epoch": 2.5191995673336938,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00047172933155432273,
|
|
"loss": 5.4011,
|
|
"mean_token_accuracy": 0.1852772742509842,
|
|
"num_tokens": 5239145.0,
|
|
"step": 2330
|
|
},
|
|
{
|
|
"entropy": 5.434785079956055,
|
|
"epoch": 2.5246078961600866,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.00047152082365141466,
|
|
"loss": 5.2518,
|
|
"mean_token_accuracy": 0.19392025023698806,
|
|
"num_tokens": 5250697.0,
|
|
"step": 2335
|
|
},
|
|
{
|
|
"entropy": 5.573790073394775,
|
|
"epoch": 2.530016224986479,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004713116015913794,
|
|
"loss": 5.4118,
|
|
"mean_token_accuracy": 0.18861660957336426,
|
|
"num_tokens": 5262876.0,
|
|
"step": 2340
|
|
},
|
|
{
|
|
"entropy": 5.401359987258911,
|
|
"epoch": 2.535424553812872,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.00047110166613453016,
|
|
"loss": 5.3265,
|
|
"mean_token_accuracy": 0.18738412708044053,
|
|
"num_tokens": 5273813.0,
|
|
"step": 2345
|
|
},
|
|
{
|
|
"entropy": 5.584725189208984,
|
|
"epoch": 2.5408328826392643,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00047089101804377305,
|
|
"loss": 5.5047,
|
|
"mean_token_accuracy": 0.17414041757583618,
|
|
"num_tokens": 5285053.0,
|
|
"step": 2350
|
|
},
|
|
{
|
|
"entropy": 5.498822641372681,
|
|
"epoch": 2.546241211465657,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004706796580846037,
|
|
"loss": 5.3338,
|
|
"mean_token_accuracy": 0.19276315420866014,
|
|
"num_tokens": 5295227.0,
|
|
"step": 2355
|
|
},
|
|
{
|
|
"entropy": 5.618280839920044,
|
|
"epoch": 2.5516495402920496,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00047046758702510465,
|
|
"loss": 5.4182,
|
|
"mean_token_accuracy": 0.17885240763425828,
|
|
"num_tokens": 5306787.0,
|
|
"step": 2360
|
|
},
|
|
{
|
|
"entropy": 5.500233221054077,
|
|
"epoch": 2.5570578691184425,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00047025480563594264,
|
|
"loss": 5.442,
|
|
"mean_token_accuracy": 0.1758480668067932,
|
|
"num_tokens": 5317809.0,
|
|
"step": 2365
|
|
},
|
|
{
|
|
"entropy": 5.597690486907959,
|
|
"epoch": 2.5624661979448353,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.00047004131469036576,
|
|
"loss": 5.4075,
|
|
"mean_token_accuracy": 0.18495803326368332,
|
|
"num_tokens": 5327738.0,
|
|
"step": 2370
|
|
},
|
|
{
|
|
"entropy": 5.4438732147216795,
|
|
"epoch": 2.5678745267712277,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00046982711496420057,
|
|
"loss": 5.3914,
|
|
"mean_token_accuracy": 0.18428546339273452,
|
|
"num_tokens": 5339700.0,
|
|
"step": 2375
|
|
},
|
|
{
|
|
"entropy": 5.552294492721558,
|
|
"epoch": 2.57328285559762,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00046961220723584925,
|
|
"loss": 5.4092,
|
|
"mean_token_accuracy": 0.17879543006420134,
|
|
"num_tokens": 5350934.0,
|
|
"step": 2380
|
|
},
|
|
{
|
|
"entropy": 5.463089847564698,
|
|
"epoch": 2.578691184424013,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00046939659228628725,
|
|
"loss": 5.3289,
|
|
"mean_token_accuracy": 0.19285490959882737,
|
|
"num_tokens": 5361364.0,
|
|
"step": 2385
|
|
},
|
|
{
|
|
"entropy": 5.589974069595337,
|
|
"epoch": 2.584099513250406,
|
|
"grad_norm": 0.96875,
|
|
"learning_rate": 0.00046918027089905956,
|
|
"loss": 5.5364,
|
|
"mean_token_accuracy": 0.18631306886672974,
|
|
"num_tokens": 5373376.0,
|
|
"step": 2390
|
|
},
|
|
{
|
|
"entropy": 5.527939748764038,
|
|
"epoch": 2.5895078420767983,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.00046896324386027873,
|
|
"loss": 5.419,
|
|
"mean_token_accuracy": 0.1782801240682602,
|
|
"num_tokens": 5384422.0,
|
|
"step": 2395
|
|
},
|
|
{
|
|
"entropy": 5.6619553565979,
|
|
"epoch": 2.5949161709031907,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00046874551195862145,
|
|
"loss": 5.4323,
|
|
"mean_token_accuracy": 0.18902574479579926,
|
|
"num_tokens": 5395834.0,
|
|
"step": 2400
|
|
},
|
|
{
|
|
"entropy": 5.517275857925415,
|
|
"epoch": 2.6003244997295836,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.000468527075985326,
|
|
"loss": 5.5484,
|
|
"mean_token_accuracy": 0.17533761113882065,
|
|
"num_tokens": 5407749.0,
|
|
"step": 2405
|
|
},
|
|
{
|
|
"entropy": 5.563359642028809,
|
|
"epoch": 2.6057328285559764,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00046830793673418924,
|
|
"loss": 5.4235,
|
|
"mean_token_accuracy": 0.18526053428649902,
|
|
"num_tokens": 5418035.0,
|
|
"step": 2410
|
|
},
|
|
{
|
|
"entropy": 5.5195565700531,
|
|
"epoch": 2.611141157382369,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.00046808809500156355,
|
|
"loss": 5.3512,
|
|
"mean_token_accuracy": 0.1831403434276581,
|
|
"num_tokens": 5429027.0,
|
|
"step": 2415
|
|
},
|
|
{
|
|
"entropy": 5.454291677474975,
|
|
"epoch": 2.6165494862087613,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004678675515863545,
|
|
"loss": 5.3162,
|
|
"mean_token_accuracy": 0.1908747971057892,
|
|
"num_tokens": 5440312.0,
|
|
"step": 2420
|
|
},
|
|
{
|
|
"entropy": 5.524546337127686,
|
|
"epoch": 2.621957815035154,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004676463072900173,
|
|
"loss": 5.3406,
|
|
"mean_token_accuracy": 0.1890124186873436,
|
|
"num_tokens": 5451281.0,
|
|
"step": 2425
|
|
},
|
|
{
|
|
"entropy": 5.481093072891236,
|
|
"epoch": 2.627366143861547,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00046742436291655415,
|
|
"loss": 5.3896,
|
|
"mean_token_accuracy": 0.1857441246509552,
|
|
"num_tokens": 5462958.0,
|
|
"step": 2430
|
|
},
|
|
{
|
|
"entropy": 5.560990715026856,
|
|
"epoch": 2.6327744726879394,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00046720171927251155,
|
|
"loss": 5.3997,
|
|
"mean_token_accuracy": 0.18795904368162156,
|
|
"num_tokens": 5473364.0,
|
|
"step": 2435
|
|
},
|
|
{
|
|
"entropy": 5.525981903076172,
|
|
"epoch": 2.638182801514332,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004669783771669769,
|
|
"loss": 5.3372,
|
|
"mean_token_accuracy": 0.186283440887928,
|
|
"num_tokens": 5485141.0,
|
|
"step": 2440
|
|
},
|
|
{
|
|
"entropy": 5.501952028274536,
|
|
"epoch": 2.6435911303407247,
|
|
"grad_norm": 0.94921875,
|
|
"learning_rate": 0.000466754337411576,
|
|
"loss": 5.4608,
|
|
"mean_token_accuracy": 0.17689261436462403,
|
|
"num_tokens": 5497802.0,
|
|
"step": 2445
|
|
},
|
|
{
|
|
"entropy": 5.52817325592041,
|
|
"epoch": 2.6489994591671175,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00046652960082046985,
|
|
"loss": 5.3104,
|
|
"mean_token_accuracy": 0.18938876837491989,
|
|
"num_tokens": 5507735.0,
|
|
"step": 2450
|
|
},
|
|
{
|
|
"entropy": 5.457919502258301,
|
|
"epoch": 2.65440778799351,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00046630416821035164,
|
|
"loss": 5.4141,
|
|
"mean_token_accuracy": 0.18110267370939254,
|
|
"num_tokens": 5519625.0,
|
|
"step": 2455
|
|
},
|
|
{
|
|
"entropy": 5.532788038253784,
|
|
"epoch": 2.6598161168199024,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.0004660780404004441,
|
|
"loss": 5.3051,
|
|
"mean_token_accuracy": 0.18533146679401397,
|
|
"num_tokens": 5531223.0,
|
|
"step": 2460
|
|
},
|
|
{
|
|
"entropy": 5.4125641822814945,
|
|
"epoch": 2.6652244456462952,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00046585121821249623,
|
|
"loss": 5.3335,
|
|
"mean_token_accuracy": 0.1871636375784874,
|
|
"num_tokens": 5543250.0,
|
|
"step": 2465
|
|
},
|
|
{
|
|
"entropy": 5.4998725891113285,
|
|
"epoch": 2.670632774472688,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00046562370247078025,
|
|
"loss": 5.3436,
|
|
"mean_token_accuracy": 0.18235380053520203,
|
|
"num_tokens": 5554817.0,
|
|
"step": 2470
|
|
},
|
|
{
|
|
"entropy": 5.529648303985596,
|
|
"epoch": 2.6760411032990805,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.000465395494002089,
|
|
"loss": 5.4474,
|
|
"mean_token_accuracy": 0.1817679688334465,
|
|
"num_tokens": 5567716.0,
|
|
"step": 2475
|
|
},
|
|
{
|
|
"entropy": 5.515621042251587,
|
|
"epoch": 2.6814494321254734,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004651665936357325,
|
|
"loss": 5.4621,
|
|
"mean_token_accuracy": 0.18281052708625795,
|
|
"num_tokens": 5579357.0,
|
|
"step": 2480
|
|
},
|
|
{
|
|
"entropy": 5.485055685043335,
|
|
"epoch": 2.686857760951866,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004649370022035354,
|
|
"loss": 5.3676,
|
|
"mean_token_accuracy": 0.19052984565496445,
|
|
"num_tokens": 5590206.0,
|
|
"step": 2485
|
|
},
|
|
{
|
|
"entropy": 5.473781728744507,
|
|
"epoch": 2.6922660897782587,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004647067205398332,
|
|
"loss": 5.3773,
|
|
"mean_token_accuracy": 0.1808069244027138,
|
|
"num_tokens": 5601639.0,
|
|
"step": 2490
|
|
},
|
|
{
|
|
"entropy": 5.437832450866699,
|
|
"epoch": 2.697674418604651,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00046447574948147027,
|
|
"loss": 5.3071,
|
|
"mean_token_accuracy": 0.18197673112154006,
|
|
"num_tokens": 5612915.0,
|
|
"step": 2495
|
|
},
|
|
{
|
|
"entropy": 5.569986343383789,
|
|
"epoch": 2.703082747431044,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00046424408986779587,
|
|
"loss": 5.4836,
|
|
"mean_token_accuracy": 0.17870566844940186,
|
|
"num_tokens": 5623919.0,
|
|
"step": 2500
|
|
},
|
|
{
|
|
"entropy": 5.550902223587036,
|
|
"epoch": 2.7084910762574363,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004640117425406615,
|
|
"loss": 5.3881,
|
|
"mean_token_accuracy": 0.18566381186246872,
|
|
"num_tokens": 5635334.0,
|
|
"step": 2505
|
|
},
|
|
{
|
|
"entropy": 5.503871917724609,
|
|
"epoch": 2.713899405083829,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.000463778708344418,
|
|
"loss": 5.3808,
|
|
"mean_token_accuracy": 0.18955522179603576,
|
|
"num_tokens": 5646053.0,
|
|
"step": 2510
|
|
},
|
|
{
|
|
"entropy": 5.507321166992187,
|
|
"epoch": 2.7193077339102216,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00046354498812591207,
|
|
"loss": 5.3922,
|
|
"mean_token_accuracy": 0.18845376521348953,
|
|
"num_tokens": 5656445.0,
|
|
"step": 2515
|
|
},
|
|
{
|
|
"entropy": 5.598144817352295,
|
|
"epoch": 2.7247160627366145,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00046331058273448364,
|
|
"loss": 5.3921,
|
|
"mean_token_accuracy": 0.1822582095861435,
|
|
"num_tokens": 5667324.0,
|
|
"step": 2520
|
|
},
|
|
{
|
|
"entropy": 5.447207260131836,
|
|
"epoch": 2.730124391563007,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004630754930219624,
|
|
"loss": 5.3905,
|
|
"mean_token_accuracy": 0.18877604305744172,
|
|
"num_tokens": 5677557.0,
|
|
"step": 2525
|
|
},
|
|
{
|
|
"entropy": 5.402798748016357,
|
|
"epoch": 2.7355327203893998,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0004628397198426648,
|
|
"loss": 5.2329,
|
|
"mean_token_accuracy": 0.1926985576748848,
|
|
"num_tokens": 5688444.0,
|
|
"step": 2530
|
|
},
|
|
{
|
|
"entropy": 5.5604699611663815,
|
|
"epoch": 2.740941049215792,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.00046260326405339126,
|
|
"loss": 5.5044,
|
|
"mean_token_accuracy": 0.17508567720651627,
|
|
"num_tokens": 5699194.0,
|
|
"step": 2535
|
|
},
|
|
{
|
|
"entropy": 5.569923686981201,
|
|
"epoch": 2.746349378042185,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.0004623661265134226,
|
|
"loss": 5.4671,
|
|
"mean_token_accuracy": 0.17520037144422532,
|
|
"num_tokens": 5710831.0,
|
|
"step": 2540
|
|
},
|
|
{
|
|
"entropy": 5.584377336502075,
|
|
"epoch": 2.7517577068685775,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004621283080845172,
|
|
"loss": 5.347,
|
|
"mean_token_accuracy": 0.19738965332508088,
|
|
"num_tokens": 5721781.0,
|
|
"step": 2545
|
|
},
|
|
{
|
|
"entropy": 5.4828346252441404,
|
|
"epoch": 2.7571660356949703,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.00046188980963090783,
|
|
"loss": 5.3729,
|
|
"mean_token_accuracy": 0.18409281522035598,
|
|
"num_tokens": 5733303.0,
|
|
"step": 2550
|
|
},
|
|
{
|
|
"entropy": 5.446268129348755,
|
|
"epoch": 2.7625743645213627,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00046165063201929825,
|
|
"loss": 5.3689,
|
|
"mean_token_accuracy": 0.18689175695180893,
|
|
"num_tokens": 5743978.0,
|
|
"step": 2555
|
|
},
|
|
{
|
|
"entropy": 5.46161675453186,
|
|
"epoch": 2.7679826933477556,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00046141077611886074,
|
|
"loss": 5.3696,
|
|
"mean_token_accuracy": 0.18578916043043137,
|
|
"num_tokens": 5755465.0,
|
|
"step": 2560
|
|
},
|
|
{
|
|
"entropy": 5.4774675369262695,
|
|
"epoch": 2.773391022174148,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.0004611702428012319,
|
|
"loss": 5.3051,
|
|
"mean_token_accuracy": 0.19155556112527847,
|
|
"num_tokens": 5767132.0,
|
|
"step": 2565
|
|
},
|
|
{
|
|
"entropy": 5.469518041610717,
|
|
"epoch": 2.778799351000541,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00046092903294051057,
|
|
"loss": 5.3605,
|
|
"mean_token_accuracy": 0.19294181615114211,
|
|
"num_tokens": 5777954.0,
|
|
"step": 2570
|
|
},
|
|
{
|
|
"entropy": 5.462495136260986,
|
|
"epoch": 2.7842076798269337,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.00046068714741325385,
|
|
"loss": 5.3367,
|
|
"mean_token_accuracy": 0.1882034182548523,
|
|
"num_tokens": 5789482.0,
|
|
"step": 2575
|
|
},
|
|
{
|
|
"entropy": 5.498905038833618,
|
|
"epoch": 2.789616008653326,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004604445870984743,
|
|
"loss": 5.3336,
|
|
"mean_token_accuracy": 0.18698014914989472,
|
|
"num_tokens": 5800624.0,
|
|
"step": 2580
|
|
},
|
|
{
|
|
"entropy": 5.48365159034729,
|
|
"epoch": 2.7950243374797186,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004602013528776367,
|
|
"loss": 5.3472,
|
|
"mean_token_accuracy": 0.19222134351730347,
|
|
"num_tokens": 5810402.0,
|
|
"step": 2585
|
|
},
|
|
{
|
|
"entropy": 5.55194730758667,
|
|
"epoch": 2.8004326663061114,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.0004599574456346548,
|
|
"loss": 5.4827,
|
|
"mean_token_accuracy": 0.18214652687311172,
|
|
"num_tokens": 5822596.0,
|
|
"step": 2590
|
|
},
|
|
{
|
|
"entropy": 5.495826387405396,
|
|
"epoch": 2.8058409951325043,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00045971286625588796,
|
|
"loss": 5.3741,
|
|
"mean_token_accuracy": 0.18433350175619126,
|
|
"num_tokens": 5834201.0,
|
|
"step": 2595
|
|
},
|
|
{
|
|
"entropy": 5.492666625976563,
|
|
"epoch": 2.8112493239588967,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0004594676156301383,
|
|
"loss": 5.3005,
|
|
"mean_token_accuracy": 0.1921772375702858,
|
|
"num_tokens": 5846440.0,
|
|
"step": 2600
|
|
},
|
|
{
|
|
"entropy": 5.438047790527344,
|
|
"epoch": 2.816657652785289,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00045922169464864725,
|
|
"loss": 5.4765,
|
|
"mean_token_accuracy": 0.1770583361387253,
|
|
"num_tokens": 5858917.0,
|
|
"step": 2605
|
|
},
|
|
{
|
|
"entropy": 5.5323127746582035,
|
|
"epoch": 2.822065981611682,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.000458975104205092,
|
|
"loss": 5.3066,
|
|
"mean_token_accuracy": 0.19467224478721618,
|
|
"num_tokens": 5869834.0,
|
|
"step": 2610
|
|
},
|
|
{
|
|
"entropy": 5.5151975631713865,
|
|
"epoch": 2.827474310438075,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.00045872784519558304,
|
|
"loss": 5.4022,
|
|
"mean_token_accuracy": 0.18480263352394105,
|
|
"num_tokens": 5881895.0,
|
|
"step": 2615
|
|
},
|
|
{
|
|
"entropy": 5.438316297531128,
|
|
"epoch": 2.8328826392644673,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004584799185186599,
|
|
"loss": 5.3402,
|
|
"mean_token_accuracy": 0.18830967247486113,
|
|
"num_tokens": 5892929.0,
|
|
"step": 2620
|
|
},
|
|
{
|
|
"entropy": 5.462751626968384,
|
|
"epoch": 2.8382909680908597,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00045823132507528903,
|
|
"loss": 5.3173,
|
|
"mean_token_accuracy": 0.1983159974217415,
|
|
"num_tokens": 5903347.0,
|
|
"step": 2625
|
|
},
|
|
{
|
|
"entropy": 5.605246448516846,
|
|
"epoch": 2.8436992969172525,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.0004579820657688593,
|
|
"loss": 5.4603,
|
|
"mean_token_accuracy": 0.18683298975229262,
|
|
"num_tokens": 5915025.0,
|
|
"step": 2630
|
|
},
|
|
{
|
|
"entropy": 5.528272914886474,
|
|
"epoch": 2.8491076257436454,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004577321415051798,
|
|
"loss": 5.3377,
|
|
"mean_token_accuracy": 0.19072499722242356,
|
|
"num_tokens": 5925953.0,
|
|
"step": 2635
|
|
},
|
|
{
|
|
"entropy": 5.530864620208741,
|
|
"epoch": 2.854515954570038,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00045748155319247564,
|
|
"loss": 5.4823,
|
|
"mean_token_accuracy": 0.1815452367067337,
|
|
"num_tokens": 5938589.0,
|
|
"step": 2640
|
|
},
|
|
{
|
|
"entropy": 5.572798442840576,
|
|
"epoch": 2.8599242833964302,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004572303017413856,
|
|
"loss": 5.4122,
|
|
"mean_token_accuracy": 0.17687317728996277,
|
|
"num_tokens": 5949546.0,
|
|
"step": 2645
|
|
},
|
|
{
|
|
"entropy": 5.337789869308471,
|
|
"epoch": 2.865332612222823,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004569783880649578,
|
|
"loss": 5.3594,
|
|
"mean_token_accuracy": 0.18260867148637772,
|
|
"num_tokens": 5960395.0,
|
|
"step": 2650
|
|
},
|
|
{
|
|
"entropy": 5.551058387756347,
|
|
"epoch": 2.870740941049216,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004567258130786474,
|
|
"loss": 5.4024,
|
|
"mean_token_accuracy": 0.18948372900485994,
|
|
"num_tokens": 5969642.0,
|
|
"step": 2655
|
|
},
|
|
{
|
|
"entropy": 5.4566559314727785,
|
|
"epoch": 2.8761492698756084,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00045647257770031215,
|
|
"loss": 5.3139,
|
|
"mean_token_accuracy": 0.18019493967294692,
|
|
"num_tokens": 5979001.0,
|
|
"step": 2660
|
|
},
|
|
{
|
|
"entropy": 5.621964836120606,
|
|
"epoch": 2.8815575987020012,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00045621868285021023,
|
|
"loss": 5.5441,
|
|
"mean_token_accuracy": 0.17837482690811157,
|
|
"num_tokens": 5991511.0,
|
|
"step": 2665
|
|
},
|
|
{
|
|
"entropy": 5.444990110397339,
|
|
"epoch": 2.8869659275283936,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00045596412945099615,
|
|
"loss": 5.2747,
|
|
"mean_token_accuracy": 0.1955416664481163,
|
|
"num_tokens": 6001902.0,
|
|
"step": 2670
|
|
},
|
|
{
|
|
"entropy": 5.40801887512207,
|
|
"epoch": 2.8923742563547865,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00045570891842771727,
|
|
"loss": 5.3791,
|
|
"mean_token_accuracy": 0.191572804749012,
|
|
"num_tokens": 6012220.0,
|
|
"step": 2675
|
|
},
|
|
{
|
|
"entropy": 5.503115224838257,
|
|
"epoch": 2.897782585181179,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00045545305070781135,
|
|
"loss": 5.3874,
|
|
"mean_token_accuracy": 0.18666007816791536,
|
|
"num_tokens": 6023795.0,
|
|
"step": 2680
|
|
},
|
|
{
|
|
"entropy": 5.490363645553589,
|
|
"epoch": 2.903190914007572,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00045519652722110206,
|
|
"loss": 5.34,
|
|
"mean_token_accuracy": 0.1851412460207939,
|
|
"num_tokens": 6034335.0,
|
|
"step": 2685
|
|
},
|
|
{
|
|
"entropy": 5.5544792175292965,
|
|
"epoch": 2.908599242833964,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00045493934889979655,
|
|
"loss": 5.4185,
|
|
"mean_token_accuracy": 0.18491135239601136,
|
|
"num_tokens": 6045435.0,
|
|
"step": 2690
|
|
},
|
|
{
|
|
"entropy": 5.475643587112427,
|
|
"epoch": 2.914007571660357,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00045468151667848116,
|
|
"loss": 5.444,
|
|
"mean_token_accuracy": 0.18254784345626832,
|
|
"num_tokens": 6057130.0,
|
|
"step": 2695
|
|
},
|
|
{
|
|
"entropy": 5.632959985733033,
|
|
"epoch": 2.9194159004867495,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.000454423031494119,
|
|
"loss": 5.4365,
|
|
"mean_token_accuracy": 0.1868360236287117,
|
|
"num_tokens": 6068382.0,
|
|
"step": 2700
|
|
},
|
|
{
|
|
"entropy": 5.513478803634643,
|
|
"epoch": 2.9248242293131423,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004541638942860458,
|
|
"loss": 5.4198,
|
|
"mean_token_accuracy": 0.18837159723043442,
|
|
"num_tokens": 6078958.0,
|
|
"step": 2705
|
|
},
|
|
{
|
|
"entropy": 5.526330518722534,
|
|
"epoch": 2.9302325581395348,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.0004539041059959667,
|
|
"loss": 5.4401,
|
|
"mean_token_accuracy": 0.18759401738643647,
|
|
"num_tokens": 6091054.0,
|
|
"step": 2710
|
|
},
|
|
{
|
|
"entropy": 5.538228273391724,
|
|
"epoch": 2.9356408869659276,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00045364366756795295,
|
|
"loss": 5.3236,
|
|
"mean_token_accuracy": 0.18440162241458893,
|
|
"num_tokens": 6102371.0,
|
|
"step": 2715
|
|
},
|
|
{
|
|
"entropy": 5.423747777938843,
|
|
"epoch": 2.94104921579232,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00045338257994843845,
|
|
"loss": 5.3537,
|
|
"mean_token_accuracy": 0.19029029160737992,
|
|
"num_tokens": 6113468.0,
|
|
"step": 2720
|
|
},
|
|
{
|
|
"entropy": 5.476720857620239,
|
|
"epoch": 2.946457544618713,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0004531208440862162,
|
|
"loss": 5.4001,
|
|
"mean_token_accuracy": 0.1901046320796013,
|
|
"num_tokens": 6125205.0,
|
|
"step": 2725
|
|
},
|
|
{
|
|
"entropy": 5.478125047683716,
|
|
"epoch": 2.9518658734451053,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00045285846093243485,
|
|
"loss": 5.3179,
|
|
"mean_token_accuracy": 0.18634466975927352,
|
|
"num_tokens": 6134831.0,
|
|
"step": 2730
|
|
},
|
|
{
|
|
"entropy": 5.560326480865479,
|
|
"epoch": 2.957274202271498,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00045259543144059557,
|
|
"loss": 5.4177,
|
|
"mean_token_accuracy": 0.18014927655458451,
|
|
"num_tokens": 6145927.0,
|
|
"step": 2735
|
|
},
|
|
{
|
|
"entropy": 5.476049375534058,
|
|
"epoch": 2.9626825310978906,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0004523317565665479,
|
|
"loss": 5.4213,
|
|
"mean_token_accuracy": 0.18212687522172927,
|
|
"num_tokens": 6156054.0,
|
|
"step": 2740
|
|
},
|
|
{
|
|
"entropy": 5.437103366851806,
|
|
"epoch": 2.9680908599242835,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.00045206743726848716,
|
|
"loss": 5.3387,
|
|
"mean_token_accuracy": 0.18745884001255037,
|
|
"num_tokens": 6166157.0,
|
|
"step": 2745
|
|
},
|
|
{
|
|
"entropy": 5.491754388809204,
|
|
"epoch": 2.973499188750676,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004518024745069502,
|
|
"loss": 5.366,
|
|
"mean_token_accuracy": 0.18674905002117156,
|
|
"num_tokens": 6178462.0,
|
|
"step": 2750
|
|
},
|
|
{
|
|
"entropy": 5.453402280807495,
|
|
"epoch": 2.9789075175770687,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004515368692448123,
|
|
"loss": 5.3232,
|
|
"mean_token_accuracy": 0.18855093717575072,
|
|
"num_tokens": 6189018.0,
|
|
"step": 2755
|
|
},
|
|
{
|
|
"entropy": 5.590845823287964,
|
|
"epoch": 2.9843158464034616,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00045127062244728353,
|
|
"loss": 5.4735,
|
|
"mean_token_accuracy": 0.18126190304756165,
|
|
"num_tokens": 6199911.0,
|
|
"step": 2760
|
|
},
|
|
{
|
|
"entropy": 5.487865018844604,
|
|
"epoch": 2.989724175229854,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004510037350819055,
|
|
"loss": 5.3803,
|
|
"mean_token_accuracy": 0.18124324083328247,
|
|
"num_tokens": 6211822.0,
|
|
"step": 2765
|
|
},
|
|
{
|
|
"entropy": 5.42392144203186,
|
|
"epoch": 2.9951325040562464,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.00045073620811854744,
|
|
"loss": 5.2865,
|
|
"mean_token_accuracy": 0.1973293974995613,
|
|
"num_tokens": 6222365.0,
|
|
"step": 2770
|
|
},
|
|
{
|
|
"entropy": 5.446313963996039,
|
|
"epoch": 3.0,
|
|
"grad_norm": 2.078125,
|
|
"learning_rate": 0.00045046804252940294,
|
|
"loss": 5.3448,
|
|
"mean_token_accuracy": 0.19321518474155003,
|
|
"num_tokens": 6230667.0,
|
|
"step": 2775
|
|
},
|
|
{
|
|
"entropy": 5.500533962249756,
|
|
"epoch": 3.005408328826393,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 0.00045019923928898644,
|
|
"loss": 5.0612,
|
|
"mean_token_accuracy": 0.19457762837409973,
|
|
"num_tokens": 6241678.0,
|
|
"step": 2780
|
|
},
|
|
{
|
|
"entropy": 5.321163845062256,
|
|
"epoch": 3.0108166576527853,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004499297993741294,
|
|
"loss": 5.0075,
|
|
"mean_token_accuracy": 0.19694564640522003,
|
|
"num_tokens": 6253541.0,
|
|
"step": 2785
|
|
},
|
|
{
|
|
"entropy": 5.432270860671997,
|
|
"epoch": 3.016224986479178,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004496597237639773,
|
|
"loss": 5.0,
|
|
"mean_token_accuracy": 0.19926079362630844,
|
|
"num_tokens": 6265590.0,
|
|
"step": 2790
|
|
},
|
|
{
|
|
"entropy": 5.444063663482666,
|
|
"epoch": 3.0216333153055706,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00044938901343998536,
|
|
"loss": 5.0456,
|
|
"mean_token_accuracy": 0.20204200297594072,
|
|
"num_tokens": 6276129.0,
|
|
"step": 2795
|
|
},
|
|
{
|
|
"entropy": 5.414129114151001,
|
|
"epoch": 3.0270416441319634,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004491176693859156,
|
|
"loss": 4.9712,
|
|
"mean_token_accuracy": 0.2101418912410736,
|
|
"num_tokens": 6286770.0,
|
|
"step": 2800
|
|
},
|
|
{
|
|
"entropy": 5.4351158618927,
|
|
"epoch": 3.032449972958356,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004488456925878329,
|
|
"loss": 5.0645,
|
|
"mean_token_accuracy": 0.19975790232419968,
|
|
"num_tokens": 6298276.0,
|
|
"step": 2805
|
|
},
|
|
{
|
|
"entropy": 5.424533796310425,
|
|
"epoch": 3.0378583017847487,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00044857308403410163,
|
|
"loss": 5.0436,
|
|
"mean_token_accuracy": 0.20333951115608215,
|
|
"num_tokens": 6308856.0,
|
|
"step": 2810
|
|
},
|
|
{
|
|
"entropy": 5.381372022628784,
|
|
"epoch": 3.043266630611141,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00044829984471538183,
|
|
"loss": 5.0321,
|
|
"mean_token_accuracy": 0.2041509985923767,
|
|
"num_tokens": 6320386.0,
|
|
"step": 2815
|
|
},
|
|
{
|
|
"entropy": 5.4244366645812985,
|
|
"epoch": 3.048674959437534,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0004480259756246258,
|
|
"loss": 4.9969,
|
|
"mean_token_accuracy": 0.19859097748994828,
|
|
"num_tokens": 6332164.0,
|
|
"step": 2820
|
|
},
|
|
{
|
|
"entropy": 5.294694423675537,
|
|
"epoch": 3.0540832882639264,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00044775147775707465,
|
|
"loss": 5.0078,
|
|
"mean_token_accuracy": 0.20580752789974213,
|
|
"num_tokens": 6343828.0,
|
|
"step": 2825
|
|
},
|
|
{
|
|
"entropy": 5.371400594711304,
|
|
"epoch": 3.0594916170903192,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.000447476352110254,
|
|
"loss": 5.0844,
|
|
"mean_token_accuracy": 0.19515798091888428,
|
|
"num_tokens": 6355366.0,
|
|
"step": 2830
|
|
},
|
|
{
|
|
"entropy": 5.433107185363769,
|
|
"epoch": 3.0648999459167117,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004472005996839712,
|
|
"loss": 5.0519,
|
|
"mean_token_accuracy": 0.21033187359571456,
|
|
"num_tokens": 6365270.0,
|
|
"step": 2835
|
|
},
|
|
{
|
|
"entropy": 5.351367807388305,
|
|
"epoch": 3.0703082747431045,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0004469242214803112,
|
|
"loss": 5.0275,
|
|
"mean_token_accuracy": 0.21128651946783067,
|
|
"num_tokens": 6376180.0,
|
|
"step": 2840
|
|
},
|
|
{
|
|
"entropy": 5.407835197448731,
|
|
"epoch": 3.075716603569497,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004466472185036331,
|
|
"loss": 4.9536,
|
|
"mean_token_accuracy": 0.2117062970995903,
|
|
"num_tokens": 6387068.0,
|
|
"step": 2845
|
|
},
|
|
{
|
|
"entropy": 5.414833641052246,
|
|
"epoch": 3.08112493239589,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004463695917605663,
|
|
"loss": 5.021,
|
|
"mean_token_accuracy": 0.20732709020376205,
|
|
"num_tokens": 6397540.0,
|
|
"step": 2850
|
|
},
|
|
{
|
|
"entropy": 5.340751600265503,
|
|
"epoch": 3.086533261222282,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.000446091342260007,
|
|
"loss": 5.1168,
|
|
"mean_token_accuracy": 0.19058479368686676,
|
|
"num_tokens": 6410039.0,
|
|
"step": 2855
|
|
},
|
|
{
|
|
"entropy": 5.416444110870361,
|
|
"epoch": 3.091941590048675,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004458124710131145,
|
|
"loss": 4.9762,
|
|
"mean_token_accuracy": 0.20852354317903518,
|
|
"num_tokens": 6420964.0,
|
|
"step": 2860
|
|
},
|
|
{
|
|
"entropy": 5.380699825286865,
|
|
"epoch": 3.0973499188750675,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00044553297903330766,
|
|
"loss": 5.1075,
|
|
"mean_token_accuracy": 0.19606724083423616,
|
|
"num_tokens": 6432752.0,
|
|
"step": 2865
|
|
},
|
|
{
|
|
"entropy": 5.475742959976197,
|
|
"epoch": 3.1027582477014604,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00044525286733626085,
|
|
"loss": 5.0334,
|
|
"mean_token_accuracy": 0.2051415890455246,
|
|
"num_tokens": 6443899.0,
|
|
"step": 2870
|
|
},
|
|
{
|
|
"entropy": 5.429310083389282,
|
|
"epoch": 3.1081665765278528,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004449721369399008,
|
|
"loss": 5.1134,
|
|
"mean_token_accuracy": 0.1922602593898773,
|
|
"num_tokens": 6454133.0,
|
|
"step": 2875
|
|
},
|
|
{
|
|
"entropy": 5.352643203735352,
|
|
"epoch": 3.1135749053542456,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.00044469078886440227,
|
|
"loss": 5.0354,
|
|
"mean_token_accuracy": 0.19823043793439865,
|
|
"num_tokens": 6467574.0,
|
|
"step": 2880
|
|
},
|
|
{
|
|
"entropy": 5.444091510772705,
|
|
"epoch": 3.118983234180638,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00044440882413218484,
|
|
"loss": 5.074,
|
|
"mean_token_accuracy": 0.19586091190576554,
|
|
"num_tokens": 6479399.0,
|
|
"step": 2885
|
|
},
|
|
{
|
|
"entropy": 5.340216112136841,
|
|
"epoch": 3.124391563007031,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00044412624376790905,
|
|
"loss": 4.8886,
|
|
"mean_token_accuracy": 0.21345536708831786,
|
|
"num_tokens": 6489590.0,
|
|
"step": 2890
|
|
},
|
|
{
|
|
"entropy": 5.401822757720947,
|
|
"epoch": 3.1297998918334233,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004438430487984726,
|
|
"loss": 5.0282,
|
|
"mean_token_accuracy": 0.20397695451974868,
|
|
"num_tokens": 6500689.0,
|
|
"step": 2895
|
|
},
|
|
{
|
|
"entropy": 5.340320634841919,
|
|
"epoch": 3.135208220659816,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004435592402530066,
|
|
"loss": 5.0095,
|
|
"mean_token_accuracy": 0.20189974159002305,
|
|
"num_tokens": 6511190.0,
|
|
"step": 2900
|
|
},
|
|
{
|
|
"entropy": 5.328754806518555,
|
|
"epoch": 3.1406165494862086,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.000443274819162872,
|
|
"loss": 4.9895,
|
|
"mean_token_accuracy": 0.20199992805719375,
|
|
"num_tokens": 6522288.0,
|
|
"step": 2905
|
|
},
|
|
{
|
|
"entropy": 5.396235084533691,
|
|
"epoch": 3.1460248783126015,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004429897865616557,
|
|
"loss": 5.0095,
|
|
"mean_token_accuracy": 0.2032381221652031,
|
|
"num_tokens": 6534391.0,
|
|
"step": 2910
|
|
},
|
|
{
|
|
"entropy": 5.3877345561981205,
|
|
"epoch": 3.151433207138994,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004427041434851668,
|
|
"loss": 4.9899,
|
|
"mean_token_accuracy": 0.207269649207592,
|
|
"num_tokens": 6546191.0,
|
|
"step": 2915
|
|
},
|
|
{
|
|
"entropy": 5.385879850387573,
|
|
"epoch": 3.1568415359653867,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00044241789097143293,
|
|
"loss": 5.1539,
|
|
"mean_token_accuracy": 0.18838376700878143,
|
|
"num_tokens": 6558118.0,
|
|
"step": 2920
|
|
},
|
|
{
|
|
"entropy": 5.319383335113526,
|
|
"epoch": 3.162249864791779,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00044213103006069635,
|
|
"loss": 5.0371,
|
|
"mean_token_accuracy": 0.20676176995038986,
|
|
"num_tokens": 6568636.0,
|
|
"step": 2925
|
|
},
|
|
{
|
|
"entropy": 5.447977113723755,
|
|
"epoch": 3.167658193618172,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00044184356179541035,
|
|
"loss": 5.0624,
|
|
"mean_token_accuracy": 0.20269704908132552,
|
|
"num_tokens": 6579710.0,
|
|
"step": 2930
|
|
},
|
|
{
|
|
"entropy": 5.385798645019531,
|
|
"epoch": 3.1730665224445644,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004415554872202352,
|
|
"loss": 5.0467,
|
|
"mean_token_accuracy": 0.20548543632030486,
|
|
"num_tokens": 6590574.0,
|
|
"step": 2935
|
|
},
|
|
{
|
|
"entropy": 5.405917978286743,
|
|
"epoch": 3.1784748512709573,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00044126680738203466,
|
|
"loss": 5.1356,
|
|
"mean_token_accuracy": 0.19349176585674285,
|
|
"num_tokens": 6601637.0,
|
|
"step": 2940
|
|
},
|
|
{
|
|
"entropy": 5.360622119903565,
|
|
"epoch": 3.1838831800973497,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004409775233298718,
|
|
"loss": 4.9065,
|
|
"mean_token_accuracy": 0.21671828478574753,
|
|
"num_tokens": 6611958.0,
|
|
"step": 2945
|
|
},
|
|
{
|
|
"entropy": 5.419522380828857,
|
|
"epoch": 3.1892915089237426,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004406876361150056,
|
|
"loss": 5.1699,
|
|
"mean_token_accuracy": 0.1909557670354843,
|
|
"num_tokens": 6623228.0,
|
|
"step": 2950
|
|
},
|
|
{
|
|
"entropy": 5.399460935592652,
|
|
"epoch": 3.194699837750135,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004403971467908869,
|
|
"loss": 5.0989,
|
|
"mean_token_accuracy": 0.199129718542099,
|
|
"num_tokens": 6633437.0,
|
|
"step": 2955
|
|
},
|
|
{
|
|
"entropy": 5.443213653564453,
|
|
"epoch": 3.200108166576528,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004401060564131545,
|
|
"loss": 5.0749,
|
|
"mean_token_accuracy": 0.19572130888700484,
|
|
"num_tokens": 6644605.0,
|
|
"step": 2960
|
|
},
|
|
{
|
|
"entropy": 5.34327507019043,
|
|
"epoch": 3.2055164954029207,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004398143660396315,
|
|
"loss": 5.1341,
|
|
"mean_token_accuracy": 0.19737862199544906,
|
|
"num_tokens": 6656457.0,
|
|
"step": 2965
|
|
},
|
|
{
|
|
"entropy": 5.454725503921509,
|
|
"epoch": 3.210924824229313,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004395220767303215,
|
|
"loss": 5.0676,
|
|
"mean_token_accuracy": 0.20159655213356018,
|
|
"num_tokens": 6667741.0,
|
|
"step": 2970
|
|
},
|
|
{
|
|
"entropy": 5.313960456848145,
|
|
"epoch": 3.2163331530557056,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004392291895474045,
|
|
"loss": 5.0565,
|
|
"mean_token_accuracy": 0.20246104747056962,
|
|
"num_tokens": 6679111.0,
|
|
"step": 2975
|
|
},
|
|
{
|
|
"entropy": 5.359478759765625,
|
|
"epoch": 3.2217414818820984,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004389357055552331,
|
|
"loss": 4.9841,
|
|
"mean_token_accuracy": 0.2107232466340065,
|
|
"num_tokens": 6689960.0,
|
|
"step": 2980
|
|
},
|
|
{
|
|
"entropy": 5.3306825160980225,
|
|
"epoch": 3.2271498107084913,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.00043864162582032897,
|
|
"loss": 5.0199,
|
|
"mean_token_accuracy": 0.19566542357206346,
|
|
"num_tokens": 6701163.0,
|
|
"step": 2985
|
|
},
|
|
{
|
|
"entropy": 5.3011407375335695,
|
|
"epoch": 3.2325581395348837,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004383469514113784,
|
|
"loss": 5.0126,
|
|
"mean_token_accuracy": 0.20581124275922774,
|
|
"num_tokens": 6712466.0,
|
|
"step": 2990
|
|
},
|
|
{
|
|
"entropy": 5.294154405593872,
|
|
"epoch": 3.2379664683612766,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0004380516833992289,
|
|
"loss": 5.1264,
|
|
"mean_token_accuracy": 0.19787818789482117,
|
|
"num_tokens": 6724772.0,
|
|
"step": 2995
|
|
},
|
|
{
|
|
"entropy": 5.3787847518920895,
|
|
"epoch": 3.243374797187669,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.000437755822856885,
|
|
"loss": 5.02,
|
|
"mean_token_accuracy": 0.20379386097192764,
|
|
"num_tokens": 6733953.0,
|
|
"step": 3000
|
|
},
|
|
{
|
|
"epoch": 3.243374797187669,
|
|
"eval_entropy": 5.224143935333599,
|
|
"eval_loss": 5.921028137207031,
|
|
"eval_mean_token_accuracy": 0.17506341190839356,
|
|
"eval_num_tokens": 6733953.0,
|
|
"eval_runtime": 2.5049,
|
|
"eval_samples_per_second": 1403.274,
|
|
"eval_steps_per_second": 175.659,
|
|
"step": 3000
|
|
},
|
|
{
|
|
"entropy": 5.2676568031311035,
|
|
"epoch": 3.248783126014062,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0004374593708595049,
|
|
"loss": 5.0449,
|
|
"mean_token_accuracy": 0.2021145209670067,
|
|
"num_tokens": 6744547.0,
|
|
"step": 3005
|
|
},
|
|
{
|
|
"entropy": 5.396162366867065,
|
|
"epoch": 3.2541914548404542,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00043716232848439555,
|
|
"loss": 5.0455,
|
|
"mean_token_accuracy": 0.1995744898915291,
|
|
"num_tokens": 6754449.0,
|
|
"step": 3010
|
|
},
|
|
{
|
|
"entropy": 5.330850076675415,
|
|
"epoch": 3.259599783666847,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00043686469681100985,
|
|
"loss": 5.0196,
|
|
"mean_token_accuracy": 0.2076788067817688,
|
|
"num_tokens": 6765928.0,
|
|
"step": 3015
|
|
},
|
|
{
|
|
"entropy": 5.3013042449951175,
|
|
"epoch": 3.2650081124932395,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.00043656647692094186,
|
|
"loss": 5.0802,
|
|
"mean_token_accuracy": 0.20154703706502913,
|
|
"num_tokens": 6776908.0,
|
|
"step": 3020
|
|
},
|
|
{
|
|
"entropy": 5.408453559875488,
|
|
"epoch": 3.2704164413196324,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004362676698979233,
|
|
"loss": 5.1558,
|
|
"mean_token_accuracy": 0.19500250667333602,
|
|
"num_tokens": 6788175.0,
|
|
"step": 3025
|
|
},
|
|
{
|
|
"entropy": 5.39493317604065,
|
|
"epoch": 3.275824770146025,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00043596827682781974,
|
|
"loss": 5.1343,
|
|
"mean_token_accuracy": 0.19319070726633072,
|
|
"num_tokens": 6799560.0,
|
|
"step": 3030
|
|
},
|
|
{
|
|
"entropy": 5.305244255065918,
|
|
"epoch": 3.2812330989724177,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0004356682987986262,
|
|
"loss": 4.9697,
|
|
"mean_token_accuracy": 0.20725639313459396,
|
|
"num_tokens": 6810145.0,
|
|
"step": 3035
|
|
},
|
|
{
|
|
"entropy": 5.386528778076172,
|
|
"epoch": 3.28664142779881,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004353677369004635,
|
|
"loss": 5.0744,
|
|
"mean_token_accuracy": 0.1908457398414612,
|
|
"num_tokens": 6821739.0,
|
|
"step": 3040
|
|
},
|
|
{
|
|
"entropy": 5.338420581817627,
|
|
"epoch": 3.292049756625203,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.00043506659222557426,
|
|
"loss": 5.0048,
|
|
"mean_token_accuracy": 0.20620973855257035,
|
|
"num_tokens": 6832887.0,
|
|
"step": 3045
|
|
},
|
|
{
|
|
"entropy": 5.4134704113006595,
|
|
"epoch": 3.2974580854515954,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.000434764865868319,
|
|
"loss": 5.2144,
|
|
"mean_token_accuracy": 0.19106176495552063,
|
|
"num_tokens": 6845213.0,
|
|
"step": 3050
|
|
},
|
|
{
|
|
"entropy": 5.34263505935669,
|
|
"epoch": 3.302866414277988,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.000434462558925172,
|
|
"loss": 4.9743,
|
|
"mean_token_accuracy": 0.21372029185295105,
|
|
"num_tokens": 6854995.0,
|
|
"step": 3055
|
|
},
|
|
{
|
|
"entropy": 5.4191022396087645,
|
|
"epoch": 3.3082747431043806,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00043415967249471734,
|
|
"loss": 5.1243,
|
|
"mean_token_accuracy": 0.1946757912635803,
|
|
"num_tokens": 6866955.0,
|
|
"step": 3060
|
|
},
|
|
{
|
|
"entropy": 5.406048107147217,
|
|
"epoch": 3.3136830719307735,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.000433856207677645,
|
|
"loss": 5.0856,
|
|
"mean_token_accuracy": 0.20235285609960557,
|
|
"num_tokens": 6878616.0,
|
|
"step": 3065
|
|
},
|
|
{
|
|
"entropy": 5.3204652786254885,
|
|
"epoch": 3.319091400757166,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.000433552165576747,
|
|
"loss": 5.0321,
|
|
"mean_token_accuracy": 0.2025593638420105,
|
|
"num_tokens": 6888782.0,
|
|
"step": 3070
|
|
},
|
|
{
|
|
"entropy": 5.351485919952393,
|
|
"epoch": 3.3244997295835588,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.00043324754729691275,
|
|
"loss": 5.093,
|
|
"mean_token_accuracy": 0.1974854663014412,
|
|
"num_tokens": 6902210.0,
|
|
"step": 3075
|
|
},
|
|
{
|
|
"entropy": 5.401188325881958,
|
|
"epoch": 3.329908058409951,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00043294235394512594,
|
|
"loss": 5.0887,
|
|
"mean_token_accuracy": 0.19142452329397203,
|
|
"num_tokens": 6913401.0,
|
|
"step": 3080
|
|
},
|
|
{
|
|
"entropy": 5.354645013809204,
|
|
"epoch": 3.335316387236344,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0004326365866304599,
|
|
"loss": 5.0617,
|
|
"mean_token_accuracy": 0.20191515386104583,
|
|
"num_tokens": 6924856.0,
|
|
"step": 3085
|
|
},
|
|
{
|
|
"entropy": 5.309537315368653,
|
|
"epoch": 3.3407247160627365,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0004323302464640738,
|
|
"loss": 5.0893,
|
|
"mean_token_accuracy": 0.20091366916894912,
|
|
"num_tokens": 6935302.0,
|
|
"step": 3090
|
|
},
|
|
{
|
|
"entropy": 5.381866455078125,
|
|
"epoch": 3.3461330448891293,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00043202333455920843,
|
|
"loss": 5.0717,
|
|
"mean_token_accuracy": 0.198678158223629,
|
|
"num_tokens": 6945837.0,
|
|
"step": 3095
|
|
},
|
|
{
|
|
"entropy": 5.398984670639038,
|
|
"epoch": 3.3515413737155217,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004317158520311824,
|
|
"loss": 5.1032,
|
|
"mean_token_accuracy": 0.2020411342382431,
|
|
"num_tokens": 6956221.0,
|
|
"step": 3100
|
|
},
|
|
{
|
|
"entropy": 5.310973501205444,
|
|
"epoch": 3.3569497025419146,
|
|
"grad_norm": 0.9921875,
|
|
"learning_rate": 0.0004314077999973879,
|
|
"loss": 5.0103,
|
|
"mean_token_accuracy": 0.20416862070560454,
|
|
"num_tokens": 6968317.0,
|
|
"step": 3105
|
|
},
|
|
{
|
|
"entropy": 5.393985843658447,
|
|
"epoch": 3.362358031368307,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004310991795772869,
|
|
"loss": 5.0689,
|
|
"mean_token_accuracy": 0.20844984501600267,
|
|
"num_tokens": 6978304.0,
|
|
"step": 3110
|
|
},
|
|
{
|
|
"entropy": 5.438141393661499,
|
|
"epoch": 3.3677663601947,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004307899918924065,
|
|
"loss": 5.1503,
|
|
"mean_token_accuracy": 0.1999391123652458,
|
|
"num_tokens": 6989063.0,
|
|
"step": 3115
|
|
},
|
|
{
|
|
"entropy": 5.347791481018066,
|
|
"epoch": 3.3731746890210923,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004304802380663356,
|
|
"loss": 5.0554,
|
|
"mean_token_accuracy": 0.20068423449993134,
|
|
"num_tokens": 7000762.0,
|
|
"step": 3120
|
|
},
|
|
{
|
|
"entropy": 5.448616695404053,
|
|
"epoch": 3.378583017847485,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.00043016991922472015,
|
|
"loss": 5.2142,
|
|
"mean_token_accuracy": 0.1960676819086075,
|
|
"num_tokens": 7012238.0,
|
|
"step": 3125
|
|
},
|
|
{
|
|
"entropy": 5.358468246459961,
|
|
"epoch": 3.383991346673878,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00042985903649525977,
|
|
"loss": 5.0209,
|
|
"mean_token_accuracy": 0.21026236861944197,
|
|
"num_tokens": 7024349.0,
|
|
"step": 3130
|
|
},
|
|
{
|
|
"entropy": 5.253860092163086,
|
|
"epoch": 3.3893996755002704,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00042954759100770275,
|
|
"loss": 4.9976,
|
|
"mean_token_accuracy": 0.19977659732103348,
|
|
"num_tokens": 7035281.0,
|
|
"step": 3135
|
|
},
|
|
{
|
|
"entropy": 5.226740074157715,
|
|
"epoch": 3.394808004326663,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00042923558389384303,
|
|
"loss": 4.9486,
|
|
"mean_token_accuracy": 0.20696604996919632,
|
|
"num_tokens": 7046450.0,
|
|
"step": 3140
|
|
},
|
|
{
|
|
"entropy": 5.278026151657104,
|
|
"epoch": 3.4002163331530557,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0004289230162875149,
|
|
"loss": 4.9932,
|
|
"mean_token_accuracy": 0.20639362037181855,
|
|
"num_tokens": 7056723.0,
|
|
"step": 3145
|
|
},
|
|
{
|
|
"entropy": 5.331745910644531,
|
|
"epoch": 3.4056246619794486,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.00042860988932458987,
|
|
"loss": 5.1214,
|
|
"mean_token_accuracy": 0.19809407293796538,
|
|
"num_tokens": 7068983.0,
|
|
"step": 3150
|
|
},
|
|
{
|
|
"entropy": 5.285477256774902,
|
|
"epoch": 3.411032990805841,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0004282962041429721,
|
|
"loss": 5.0399,
|
|
"mean_token_accuracy": 0.19926306158304213,
|
|
"num_tokens": 7079544.0,
|
|
"step": 3155
|
|
},
|
|
{
|
|
"entropy": 5.311891651153564,
|
|
"epoch": 3.4164413196322334,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00042798196188259427,
|
|
"loss": 5.0566,
|
|
"mean_token_accuracy": 0.20001289993524551,
|
|
"num_tokens": 7091845.0,
|
|
"step": 3160
|
|
},
|
|
{
|
|
"entropy": 5.391391372680664,
|
|
"epoch": 3.4218496484586263,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004276671636854133,
|
|
"loss": 5.1254,
|
|
"mean_token_accuracy": 0.20151020288467408,
|
|
"num_tokens": 7103780.0,
|
|
"step": 3165
|
|
},
|
|
{
|
|
"entropy": 5.327012395858764,
|
|
"epoch": 3.427257977285019,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00042735181069540677,
|
|
"loss": 5.0259,
|
|
"mean_token_accuracy": 0.20835089385509492,
|
|
"num_tokens": 7116346.0,
|
|
"step": 3170
|
|
},
|
|
{
|
|
"entropy": 5.413862466812134,
|
|
"epoch": 3.4326663061114115,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 0.0004270359040585681,
|
|
"loss": 5.1559,
|
|
"mean_token_accuracy": 0.20038951337337493,
|
|
"num_tokens": 7128383.0,
|
|
"step": 3175
|
|
},
|
|
{
|
|
"entropy": 5.378864908218384,
|
|
"epoch": 3.4380746349378044,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00042671944492290277,
|
|
"loss": 5.0952,
|
|
"mean_token_accuracy": 0.19952357262372972,
|
|
"num_tokens": 7139841.0,
|
|
"step": 3180
|
|
},
|
|
{
|
|
"entropy": 5.44992504119873,
|
|
"epoch": 3.443482963764197,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.0004264024344384239,
|
|
"loss": 5.2175,
|
|
"mean_token_accuracy": 0.1943944960832596,
|
|
"num_tokens": 7152363.0,
|
|
"step": 3185
|
|
},
|
|
{
|
|
"entropy": 5.180116653442383,
|
|
"epoch": 3.4488912925905897,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00042608487375714847,
|
|
"loss": 4.9129,
|
|
"mean_token_accuracy": 0.20698372423648834,
|
|
"num_tokens": 7162500.0,
|
|
"step": 3190
|
|
},
|
|
{
|
|
"entropy": 5.3649712085723875,
|
|
"epoch": 3.454299621416982,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.00042576676403309265,
|
|
"loss": 5.1567,
|
|
"mean_token_accuracy": 0.19376561939716339,
|
|
"num_tokens": 7174996.0,
|
|
"step": 3195
|
|
},
|
|
{
|
|
"entropy": 5.329015827178955,
|
|
"epoch": 3.459707950243375,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004254481064222679,
|
|
"loss": 4.9916,
|
|
"mean_token_accuracy": 0.2082139164209366,
|
|
"num_tokens": 7185078.0,
|
|
"step": 3200
|
|
},
|
|
{
|
|
"entropy": 5.402175378799439,
|
|
"epoch": 3.4651162790697674,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00042512890208267677,
|
|
"loss": 5.1729,
|
|
"mean_token_accuracy": 0.19327713102102279,
|
|
"num_tokens": 7196268.0,
|
|
"step": 3205
|
|
},
|
|
{
|
|
"entropy": 5.340206575393677,
|
|
"epoch": 3.4705246078961602,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00042480915217430853,
|
|
"loss": 5.1294,
|
|
"mean_token_accuracy": 0.20094281882047654,
|
|
"num_tokens": 7207597.0,
|
|
"step": 3210
|
|
},
|
|
{
|
|
"entropy": 5.35001311302185,
|
|
"epoch": 3.4759329367225527,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00042448885785913507,
|
|
"loss": 5.0338,
|
|
"mean_token_accuracy": 0.20565392225980758,
|
|
"num_tokens": 7218765.0,
|
|
"step": 3215
|
|
},
|
|
{
|
|
"entropy": 5.23657193183899,
|
|
"epoch": 3.4813412655489455,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00042416802030110677,
|
|
"loss": 5.0378,
|
|
"mean_token_accuracy": 0.20561073273420333,
|
|
"num_tokens": 7231242.0,
|
|
"step": 3220
|
|
},
|
|
{
|
|
"entropy": 5.378603458404541,
|
|
"epoch": 3.486749594375338,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00042384664066614787,
|
|
"loss": 5.0778,
|
|
"mean_token_accuracy": 0.19592965245246888,
|
|
"num_tokens": 7241689.0,
|
|
"step": 3225
|
|
},
|
|
{
|
|
"entropy": 5.362082147598267,
|
|
"epoch": 3.492157923201731,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004235247201221528,
|
|
"loss": 5.1541,
|
|
"mean_token_accuracy": 0.19654099494218827,
|
|
"num_tokens": 7252565.0,
|
|
"step": 3230
|
|
},
|
|
{
|
|
"entropy": 5.372237586975098,
|
|
"epoch": 3.497566252028123,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004232022598389816,
|
|
"loss": 5.0981,
|
|
"mean_token_accuracy": 0.19729824960231782,
|
|
"num_tokens": 7264520.0,
|
|
"step": 3235
|
|
},
|
|
{
|
|
"entropy": 5.373393726348877,
|
|
"epoch": 3.502974580854516,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004228792609884557,
|
|
"loss": 5.1104,
|
|
"mean_token_accuracy": 0.1994604468345642,
|
|
"num_tokens": 7276119.0,
|
|
"step": 3240
|
|
},
|
|
{
|
|
"entropy": 5.356141376495361,
|
|
"epoch": 3.5083829096809085,
|
|
"grad_norm": 0.98828125,
|
|
"learning_rate": 0.00042255572474435364,
|
|
"loss": 5.0909,
|
|
"mean_token_accuracy": 0.1965806797146797,
|
|
"num_tokens": 7288181.0,
|
|
"step": 3245
|
|
},
|
|
{
|
|
"entropy": 5.311535978317261,
|
|
"epoch": 3.5137912385073014,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0004222316522824069,
|
|
"loss": 5.0918,
|
|
"mean_token_accuracy": 0.20014596432447435,
|
|
"num_tokens": 7299975.0,
|
|
"step": 3250
|
|
},
|
|
{
|
|
"entropy": 5.421269941329956,
|
|
"epoch": 3.5191995673336938,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0004219070447802955,
|
|
"loss": 5.0964,
|
|
"mean_token_accuracy": 0.1998756691813469,
|
|
"num_tokens": 7310345.0,
|
|
"step": 3255
|
|
},
|
|
{
|
|
"entropy": 5.257654047012329,
|
|
"epoch": 3.5246078961600866,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00042158190341764384,
|
|
"loss": 5.0198,
|
|
"mean_token_accuracy": 0.20225510150194168,
|
|
"num_tokens": 7321018.0,
|
|
"step": 3260
|
|
},
|
|
{
|
|
"entropy": 5.247340106964112,
|
|
"epoch": 3.530016224986479,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00042125622937601645,
|
|
"loss": 5.005,
|
|
"mean_token_accuracy": 0.21300950646400452,
|
|
"num_tokens": 7331509.0,
|
|
"step": 3265
|
|
},
|
|
{
|
|
"entropy": 5.320905113220215,
|
|
"epoch": 3.535424553812872,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004209300238389135,
|
|
"loss": 4.9758,
|
|
"mean_token_accuracy": 0.2097022145986557,
|
|
"num_tokens": 7342523.0,
|
|
"step": 3270
|
|
},
|
|
{
|
|
"entropy": 5.285821199417114,
|
|
"epoch": 3.5408328826392643,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004206032879917667,
|
|
"loss": 5.0686,
|
|
"mean_token_accuracy": 0.20199986696243286,
|
|
"num_tokens": 7353758.0,
|
|
"step": 3275
|
|
},
|
|
{
|
|
"entropy": 5.298578596115112,
|
|
"epoch": 3.546241211465657,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004202760230219348,
|
|
"loss": 5.1172,
|
|
"mean_token_accuracy": 0.19739769995212555,
|
|
"num_tokens": 7366119.0,
|
|
"step": 3280
|
|
},
|
|
{
|
|
"entropy": 5.390467166900635,
|
|
"epoch": 3.5516495402920496,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00041994823011869955,
|
|
"loss": 5.2313,
|
|
"mean_token_accuracy": 0.19639483392238616,
|
|
"num_tokens": 7379464.0,
|
|
"step": 3285
|
|
},
|
|
{
|
|
"entropy": 5.360622501373291,
|
|
"epoch": 3.5570578691184425,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00041961991047326116,
|
|
"loss": 5.0752,
|
|
"mean_token_accuracy": 0.2024195298552513,
|
|
"num_tokens": 7391825.0,
|
|
"step": 3290
|
|
},
|
|
{
|
|
"entropy": 5.323080968856812,
|
|
"epoch": 3.5624661979448353,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0004192910652787338,
|
|
"loss": 5.0443,
|
|
"mean_token_accuracy": 0.20436202883720397,
|
|
"num_tokens": 7403187.0,
|
|
"step": 3295
|
|
},
|
|
{
|
|
"entropy": 5.304663610458374,
|
|
"epoch": 3.5678745267712277,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0004189616957301419,
|
|
"loss": 5.0547,
|
|
"mean_token_accuracy": 0.1995916932821274,
|
|
"num_tokens": 7414927.0,
|
|
"step": 3300
|
|
},
|
|
{
|
|
"entropy": 5.342061185836792,
|
|
"epoch": 3.57328285559762,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0004186318030244149,
|
|
"loss": 5.0948,
|
|
"mean_token_accuracy": 0.1974277138710022,
|
|
"num_tokens": 7426894.0,
|
|
"step": 3305
|
|
},
|
|
{
|
|
"entropy": 5.338034200668335,
|
|
"epoch": 3.578691184424013,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00041830138836038383,
|
|
"loss": 4.951,
|
|
"mean_token_accuracy": 0.21454257369041443,
|
|
"num_tokens": 7437209.0,
|
|
"step": 3310
|
|
},
|
|
{
|
|
"entropy": 5.381253337860107,
|
|
"epoch": 3.584099513250406,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0004179704529387763,
|
|
"loss": 5.084,
|
|
"mean_token_accuracy": 0.20151952058076858,
|
|
"num_tokens": 7448560.0,
|
|
"step": 3315
|
|
},
|
|
{
|
|
"entropy": 5.238864994049072,
|
|
"epoch": 3.5895078420767983,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004176389979622125,
|
|
"loss": 5.0282,
|
|
"mean_token_accuracy": 0.20845210552215576,
|
|
"num_tokens": 7460843.0,
|
|
"step": 3320
|
|
},
|
|
{
|
|
"entropy": 5.29174280166626,
|
|
"epoch": 3.5949161709031907,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004173070246352003,
|
|
"loss": 5.0307,
|
|
"mean_token_accuracy": 0.20860967934131622,
|
|
"num_tokens": 7472924.0,
|
|
"step": 3325
|
|
},
|
|
{
|
|
"entropy": 5.322065830230713,
|
|
"epoch": 3.6003244997295836,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00041697453416413184,
|
|
"loss": 5.112,
|
|
"mean_token_accuracy": 0.1986359804868698,
|
|
"num_tokens": 7485189.0,
|
|
"step": 3330
|
|
},
|
|
{
|
|
"entropy": 5.290145492553711,
|
|
"epoch": 3.6057328285559764,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.000416641527757278,
|
|
"loss": 5.0885,
|
|
"mean_token_accuracy": 0.2006947621703148,
|
|
"num_tokens": 7495608.0,
|
|
"step": 3335
|
|
},
|
|
{
|
|
"entropy": 5.35534701347351,
|
|
"epoch": 3.611141157382369,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.00041630800662478514,
|
|
"loss": 5.0863,
|
|
"mean_token_accuracy": 0.2016560599207878,
|
|
"num_tokens": 7506867.0,
|
|
"step": 3340
|
|
},
|
|
{
|
|
"entropy": 5.293708848953247,
|
|
"epoch": 3.6165494862087613,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00041597397197866957,
|
|
"loss": 5.1283,
|
|
"mean_token_accuracy": 0.19478587061166763,
|
|
"num_tokens": 7517923.0,
|
|
"step": 3345
|
|
},
|
|
{
|
|
"entropy": 5.360723495483398,
|
|
"epoch": 3.621957815035154,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004156394250328141,
|
|
"loss": 5.1438,
|
|
"mean_token_accuracy": 0.19603629857301713,
|
|
"num_tokens": 7528205.0,
|
|
"step": 3350
|
|
},
|
|
{
|
|
"entropy": 5.372031354904175,
|
|
"epoch": 3.627366143861547,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.000415304367002963,
|
|
"loss": 5.0791,
|
|
"mean_token_accuracy": 0.2009880319237709,
|
|
"num_tokens": 7539846.0,
|
|
"step": 3355
|
|
},
|
|
{
|
|
"entropy": 5.323767900466919,
|
|
"epoch": 3.6327744726879394,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00041496879910671796,
|
|
"loss": 5.0552,
|
|
"mean_token_accuracy": 0.20095243453979492,
|
|
"num_tokens": 7550731.0,
|
|
"step": 3360
|
|
},
|
|
{
|
|
"entropy": 5.3896807670593265,
|
|
"epoch": 3.638182801514332,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0004146327225635336,
|
|
"loss": 5.12,
|
|
"mean_token_accuracy": 0.19738423079252243,
|
|
"num_tokens": 7562283.0,
|
|
"step": 3365
|
|
},
|
|
{
|
|
"entropy": 5.3548308372497555,
|
|
"epoch": 3.6435911303407247,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.0004142961385947127,
|
|
"loss": 5.1471,
|
|
"mean_token_accuracy": 0.19754419326782227,
|
|
"num_tokens": 7574361.0,
|
|
"step": 3370
|
|
},
|
|
{
|
|
"entropy": 5.3689981460571286,
|
|
"epoch": 3.6489994591671175,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00041395904842340215,
|
|
"loss": 5.0956,
|
|
"mean_token_accuracy": 0.2011457070708275,
|
|
"num_tokens": 7583870.0,
|
|
"step": 3375
|
|
},
|
|
{
|
|
"entropy": 5.447643852233886,
|
|
"epoch": 3.65440778799351,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004136214532745887,
|
|
"loss": 5.2105,
|
|
"mean_token_accuracy": 0.19217262268066407,
|
|
"num_tokens": 7595827.0,
|
|
"step": 3380
|
|
},
|
|
{
|
|
"entropy": 5.277579689025879,
|
|
"epoch": 3.6598161168199024,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0004132833543750936,
|
|
"loss": 5.0448,
|
|
"mean_token_accuracy": 0.20935163497924805,
|
|
"num_tokens": 7606294.0,
|
|
"step": 3385
|
|
},
|
|
{
|
|
"entropy": 5.250435018539429,
|
|
"epoch": 3.6652244456462952,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00041294475295356917,
|
|
"loss": 5.0797,
|
|
"mean_token_accuracy": 0.1973802253603935,
|
|
"num_tokens": 7617920.0,
|
|
"step": 3390
|
|
},
|
|
{
|
|
"entropy": 5.290333986282349,
|
|
"epoch": 3.670632774472688,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004126056502404937,
|
|
"loss": 5.0066,
|
|
"mean_token_accuracy": 0.20787014961242675,
|
|
"num_tokens": 7628983.0,
|
|
"step": 3395
|
|
},
|
|
{
|
|
"entropy": 5.309329795837402,
|
|
"epoch": 3.6760411032990805,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004122660474681672,
|
|
"loss": 5.0881,
|
|
"mean_token_accuracy": 0.20126838088035584,
|
|
"num_tokens": 7639596.0,
|
|
"step": 3400
|
|
},
|
|
{
|
|
"entropy": 5.291783237457276,
|
|
"epoch": 3.6814494321254734,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00041192594587070706,
|
|
"loss": 5.0608,
|
|
"mean_token_accuracy": 0.20146431177854537,
|
|
"num_tokens": 7650019.0,
|
|
"step": 3405
|
|
},
|
|
{
|
|
"entropy": 5.334015846252441,
|
|
"epoch": 3.686857760951866,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00041158534668404325,
|
|
"loss": 5.0673,
|
|
"mean_token_accuracy": 0.20519835948944093,
|
|
"num_tokens": 7661534.0,
|
|
"step": 3410
|
|
},
|
|
{
|
|
"entropy": 5.354724931716919,
|
|
"epoch": 3.6922660897782587,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.00041124425114591386,
|
|
"loss": 5.0111,
|
|
"mean_token_accuracy": 0.1982477307319641,
|
|
"num_tokens": 7672716.0,
|
|
"step": 3415
|
|
},
|
|
{
|
|
"entropy": 5.270970296859741,
|
|
"epoch": 3.697674418604651,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00041090266049586107,
|
|
"loss": 5.1092,
|
|
"mean_token_accuracy": 0.20256560146808625,
|
|
"num_tokens": 7684228.0,
|
|
"step": 3420
|
|
},
|
|
{
|
|
"entropy": 5.381613397598267,
|
|
"epoch": 3.703082747431044,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0004105605759752258,
|
|
"loss": 5.0739,
|
|
"mean_token_accuracy": 0.19580450654029846,
|
|
"num_tokens": 7695983.0,
|
|
"step": 3425
|
|
},
|
|
{
|
|
"entropy": 5.276859521865845,
|
|
"epoch": 3.7084910762574363,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 0.00041021799882714436,
|
|
"loss": 5.0764,
|
|
"mean_token_accuracy": 0.20103933662176132,
|
|
"num_tokens": 7708201.0,
|
|
"step": 3430
|
|
},
|
|
{
|
|
"entropy": 5.229123497009278,
|
|
"epoch": 3.713899405083829,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004098749302965426,
|
|
"loss": 5.0339,
|
|
"mean_token_accuracy": 0.19539251774549485,
|
|
"num_tokens": 7719041.0,
|
|
"step": 3435
|
|
},
|
|
{
|
|
"entropy": 5.294345092773438,
|
|
"epoch": 3.7193077339102216,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004095313716301324,
|
|
"loss": 5.0497,
|
|
"mean_token_accuracy": 0.20264862477779388,
|
|
"num_tokens": 7729751.0,
|
|
"step": 3440
|
|
},
|
|
{
|
|
"entropy": 5.243863487243653,
|
|
"epoch": 3.7247160627366145,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004091873240764069,
|
|
"loss": 4.9812,
|
|
"mean_token_accuracy": 0.21261585354804993,
|
|
"num_tokens": 7740898.0,
|
|
"step": 3445
|
|
},
|
|
{
|
|
"entropy": 5.3098616123199465,
|
|
"epoch": 3.730124391563007,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00040884278888563566,
|
|
"loss": 5.1706,
|
|
"mean_token_accuracy": 0.20178489983081818,
|
|
"num_tokens": 7752214.0,
|
|
"step": 3450
|
|
},
|
|
{
|
|
"entropy": 5.315207862854004,
|
|
"epoch": 3.7355327203893998,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00040849776730986014,
|
|
"loss": 5.0101,
|
|
"mean_token_accuracy": 0.20696818232536315,
|
|
"num_tokens": 7763221.0,
|
|
"step": 3455
|
|
},
|
|
{
|
|
"entropy": 5.355162048339844,
|
|
"epoch": 3.740941049215792,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0004081522606028899,
|
|
"loss": 5.0738,
|
|
"mean_token_accuracy": 0.20055561661720275,
|
|
"num_tokens": 7774046.0,
|
|
"step": 3460
|
|
},
|
|
{
|
|
"entropy": 5.327772903442383,
|
|
"epoch": 3.746349378042185,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00040780627002029674,
|
|
"loss": 5.1525,
|
|
"mean_token_accuracy": 0.2019985407590866,
|
|
"num_tokens": 7784796.0,
|
|
"step": 3465
|
|
},
|
|
{
|
|
"entropy": 5.29678316116333,
|
|
"epoch": 3.7517577068685775,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004074597968194116,
|
|
"loss": 5.0818,
|
|
"mean_token_accuracy": 0.20466591268777848,
|
|
"num_tokens": 7795370.0,
|
|
"step": 3470
|
|
},
|
|
{
|
|
"entropy": 5.4258557796478275,
|
|
"epoch": 3.7571660356949703,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0004071128422593186,
|
|
"loss": 5.1186,
|
|
"mean_token_accuracy": 0.2024161234498024,
|
|
"num_tokens": 7805634.0,
|
|
"step": 3475
|
|
},
|
|
{
|
|
"entropy": 5.327988815307617,
|
|
"epoch": 3.7625743645213627,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0004067654076008515,
|
|
"loss": 5.0653,
|
|
"mean_token_accuracy": 0.19686893969774247,
|
|
"num_tokens": 7817074.0,
|
|
"step": 3480
|
|
},
|
|
{
|
|
"entropy": 5.344467544555664,
|
|
"epoch": 3.7679826933477556,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00040641749410658877,
|
|
"loss": 5.1357,
|
|
"mean_token_accuracy": 0.2029123544692993,
|
|
"num_tokens": 7828794.0,
|
|
"step": 3485
|
|
},
|
|
{
|
|
"entropy": 5.44368314743042,
|
|
"epoch": 3.773391022174148,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004060691030408487,
|
|
"loss": 5.1243,
|
|
"mean_token_accuracy": 0.20569152384996414,
|
|
"num_tokens": 7838994.0,
|
|
"step": 3490
|
|
},
|
|
{
|
|
"entropy": 5.246509265899658,
|
|
"epoch": 3.778799351000541,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00040572023566968536,
|
|
"loss": 5.0218,
|
|
"mean_token_accuracy": 0.21003881245851516,
|
|
"num_tokens": 7850360.0,
|
|
"step": 3495
|
|
},
|
|
{
|
|
"entropy": 5.295813512802124,
|
|
"epoch": 3.7842076798269337,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00040537089326088345,
|
|
"loss": 5.0342,
|
|
"mean_token_accuracy": 0.1982029601931572,
|
|
"num_tokens": 7860917.0,
|
|
"step": 3500
|
|
},
|
|
{
|
|
"entropy": 5.247469043731689,
|
|
"epoch": 3.789616008653326,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0004050210770839541,
|
|
"loss": 4.9153,
|
|
"mean_token_accuracy": 0.21182919889688492,
|
|
"num_tokens": 7873389.0,
|
|
"step": 3505
|
|
},
|
|
{
|
|
"entropy": 5.186233282089233,
|
|
"epoch": 3.7950243374797186,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004046707884101303,
|
|
"loss": 4.9773,
|
|
"mean_token_accuracy": 0.1983470067381859,
|
|
"num_tokens": 7884589.0,
|
|
"step": 3510
|
|
},
|
|
{
|
|
"entropy": 5.26288743019104,
|
|
"epoch": 3.8004326663061114,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00040432002851236164,
|
|
"loss": 5.0575,
|
|
"mean_token_accuracy": 0.20026906132698058,
|
|
"num_tokens": 7896338.0,
|
|
"step": 3515
|
|
},
|
|
{
|
|
"entropy": 5.402217388153076,
|
|
"epoch": 3.8058409951325043,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0004039687986653106,
|
|
"loss": 5.0755,
|
|
"mean_token_accuracy": 0.2025588259100914,
|
|
"num_tokens": 7907063.0,
|
|
"step": 3520
|
|
},
|
|
{
|
|
"entropy": 5.2639538764953615,
|
|
"epoch": 3.8112493239588967,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 0.00040361710014534714,
|
|
"loss": 5.0043,
|
|
"mean_token_accuracy": 0.21064664721488952,
|
|
"num_tokens": 7919723.0,
|
|
"step": 3525
|
|
},
|
|
{
|
|
"entropy": 5.139606237411499,
|
|
"epoch": 3.816657652785289,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0004032649342305445,
|
|
"loss": 4.9906,
|
|
"mean_token_accuracy": 0.2104376509785652,
|
|
"num_tokens": 7930369.0,
|
|
"step": 3530
|
|
},
|
|
{
|
|
"entropy": 5.287723398208618,
|
|
"epoch": 3.822065981611682,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004029123022006745,
|
|
"loss": 5.0108,
|
|
"mean_token_accuracy": 0.20607363879680635,
|
|
"num_tokens": 7941726.0,
|
|
"step": 3535
|
|
},
|
|
{
|
|
"entropy": 5.347914600372315,
|
|
"epoch": 3.827474310438075,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0004025592053372027,
|
|
"loss": 5.0657,
|
|
"mean_token_accuracy": 0.2048034265637398,
|
|
"num_tokens": 7952406.0,
|
|
"step": 3540
|
|
},
|
|
{
|
|
"entropy": 5.305616569519043,
|
|
"epoch": 3.8328826392644673,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004022056449232839,
|
|
"loss": 5.0799,
|
|
"mean_token_accuracy": 0.2043195441365242,
|
|
"num_tokens": 7964536.0,
|
|
"step": 3545
|
|
},
|
|
{
|
|
"entropy": 5.163705921173095,
|
|
"epoch": 3.8382909680908597,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0004018516222437575,
|
|
"loss": 4.9109,
|
|
"mean_token_accuracy": 0.21903975456953048,
|
|
"num_tokens": 7974419.0,
|
|
"step": 3550
|
|
},
|
|
{
|
|
"entropy": 5.305897521972656,
|
|
"epoch": 3.8436992969172525,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0004014971385851428,
|
|
"loss": 5.0233,
|
|
"mean_token_accuracy": 0.20912724435329438,
|
|
"num_tokens": 7985128.0,
|
|
"step": 3555
|
|
},
|
|
{
|
|
"entropy": 5.375169992446899,
|
|
"epoch": 3.8491076257436454,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.000401142195235634,
|
|
"loss": 5.139,
|
|
"mean_token_accuracy": 0.19376973956823348,
|
|
"num_tokens": 7997574.0,
|
|
"step": 3560
|
|
},
|
|
{
|
|
"entropy": 5.273523044586182,
|
|
"epoch": 3.854515954570038,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0004007867934850963,
|
|
"loss": 5.09,
|
|
"mean_token_accuracy": 0.20342953950166703,
|
|
"num_tokens": 8008498.0,
|
|
"step": 3565
|
|
},
|
|
{
|
|
"entropy": 5.305679798126221,
|
|
"epoch": 3.8599242833964302,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0004004309346250603,
|
|
"loss": 4.9803,
|
|
"mean_token_accuracy": 0.21326489895582199,
|
|
"num_tokens": 8020016.0,
|
|
"step": 3570
|
|
},
|
|
{
|
|
"entropy": 5.2902507305145265,
|
|
"epoch": 3.865332612222823,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.0004000746199487181,
|
|
"loss": 5.0793,
|
|
"mean_token_accuracy": 0.1975437581539154,
|
|
"num_tokens": 8031454.0,
|
|
"step": 3575
|
|
},
|
|
{
|
|
"entropy": 5.194978713989258,
|
|
"epoch": 3.870740941049216,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.000399717850750918,
|
|
"loss": 4.9924,
|
|
"mean_token_accuracy": 0.21084818989038467,
|
|
"num_tokens": 8041659.0,
|
|
"step": 3580
|
|
},
|
|
{
|
|
"entropy": 5.25621485710144,
|
|
"epoch": 3.8761492698756084,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00039936062832816,
|
|
"loss": 4.989,
|
|
"mean_token_accuracy": 0.20333430916070938,
|
|
"num_tokens": 8051814.0,
|
|
"step": 3585
|
|
},
|
|
{
|
|
"entropy": 5.353120231628418,
|
|
"epoch": 3.8815575987020012,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0003990029539785913,
|
|
"loss": 5.1131,
|
|
"mean_token_accuracy": 0.19526639878749846,
|
|
"num_tokens": 8061843.0,
|
|
"step": 3590
|
|
},
|
|
{
|
|
"entropy": 5.270770263671875,
|
|
"epoch": 3.8869659275283936,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00039864482900200135,
|
|
"loss": 5.111,
|
|
"mean_token_accuracy": 0.20148807913064956,
|
|
"num_tokens": 8074372.0,
|
|
"step": 3595
|
|
},
|
|
{
|
|
"entropy": 5.3175578117370605,
|
|
"epoch": 3.8923742563547865,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0003982862546998169,
|
|
"loss": 4.9626,
|
|
"mean_token_accuracy": 0.21317742615938187,
|
|
"num_tokens": 8085256.0,
|
|
"step": 3600
|
|
},
|
|
{
|
|
"entropy": 5.216775178909302,
|
|
"epoch": 3.897782585181179,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0003979272323750981,
|
|
"loss": 4.9782,
|
|
"mean_token_accuracy": 0.20454428046941758,
|
|
"num_tokens": 8095606.0,
|
|
"step": 3605
|
|
},
|
|
{
|
|
"entropy": 5.2997715950012205,
|
|
"epoch": 3.903190914007572,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0003975677633325327,
|
|
"loss": 5.0947,
|
|
"mean_token_accuracy": 0.19973311722278594,
|
|
"num_tokens": 8106674.0,
|
|
"step": 3610
|
|
},
|
|
{
|
|
"entropy": 5.351229858398438,
|
|
"epoch": 3.908599242833964,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0003972078488784321,
|
|
"loss": 5.0187,
|
|
"mean_token_accuracy": 0.20516136288642883,
|
|
"num_tokens": 8117669.0,
|
|
"step": 3615
|
|
},
|
|
{
|
|
"entropy": 5.253053617477417,
|
|
"epoch": 3.914007571660357,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0003968474903207263,
|
|
"loss": 5.0907,
|
|
"mean_token_accuracy": 0.2001551553606987,
|
|
"num_tokens": 8128740.0,
|
|
"step": 3620
|
|
},
|
|
{
|
|
"entropy": 5.258902215957642,
|
|
"epoch": 3.9194159004867495,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0003964866889689592,
|
|
"loss": 5.1405,
|
|
"mean_token_accuracy": 0.20075008571147918,
|
|
"num_tokens": 8140890.0,
|
|
"step": 3625
|
|
},
|
|
{
|
|
"entropy": 5.254501914978027,
|
|
"epoch": 3.9248242293131423,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0003961254461342834,
|
|
"loss": 4.9654,
|
|
"mean_token_accuracy": 0.21354712396860123,
|
|
"num_tokens": 8152239.0,
|
|
"step": 3630
|
|
},
|
|
{
|
|
"entropy": 5.210498380661011,
|
|
"epoch": 3.9302325581395348,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0003957637631294566,
|
|
"loss": 4.9818,
|
|
"mean_token_accuracy": 0.2099222257733345,
|
|
"num_tokens": 8162715.0,
|
|
"step": 3635
|
|
},
|
|
{
|
|
"entropy": 5.2807506084442135,
|
|
"epoch": 3.9356408869659276,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00039540164126883554,
|
|
"loss": 5.113,
|
|
"mean_token_accuracy": 0.19963123500347138,
|
|
"num_tokens": 8174022.0,
|
|
"step": 3640
|
|
},
|
|
{
|
|
"entropy": 5.280143976211548,
|
|
"epoch": 3.94104921579232,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0003950390818683718,
|
|
"loss": 5.0794,
|
|
"mean_token_accuracy": 0.20172633826732636,
|
|
"num_tokens": 8185319.0,
|
|
"step": 3645
|
|
},
|
|
{
|
|
"entropy": 5.372960758209229,
|
|
"epoch": 3.946457544618713,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0003946760862456071,
|
|
"loss": 5.1052,
|
|
"mean_token_accuracy": 0.20131509602069855,
|
|
"num_tokens": 8196325.0,
|
|
"step": 3650
|
|
},
|
|
{
|
|
"entropy": 5.294921064376831,
|
|
"epoch": 3.9518658734451053,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0003943126557196685,
|
|
"loss": 5.1891,
|
|
"mean_token_accuracy": 0.19643608778715133,
|
|
"num_tokens": 8207475.0,
|
|
"step": 3655
|
|
},
|
|
{
|
|
"entropy": 5.32238187789917,
|
|
"epoch": 3.957274202271498,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.00039394879161126333,
|
|
"loss": 5.0477,
|
|
"mean_token_accuracy": 0.21232580095529557,
|
|
"num_tokens": 8217991.0,
|
|
"step": 3660
|
|
},
|
|
{
|
|
"entropy": 5.4003208637237545,
|
|
"epoch": 3.9626825310978906,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.0003935844952426745,
|
|
"loss": 5.1582,
|
|
"mean_token_accuracy": 0.20134422481060027,
|
|
"num_tokens": 8229967.0,
|
|
"step": 3665
|
|
},
|
|
{
|
|
"entropy": 5.329679679870606,
|
|
"epoch": 3.9680908599242835,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00039321976793775586,
|
|
"loss": 5.0814,
|
|
"mean_token_accuracy": 0.2050641193985939,
|
|
"num_tokens": 8240888.0,
|
|
"step": 3670
|
|
},
|
|
{
|
|
"entropy": 5.269544649124145,
|
|
"epoch": 3.973499188750676,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0003928546110219275,
|
|
"loss": 5.022,
|
|
"mean_token_accuracy": 0.20496581494808197,
|
|
"num_tokens": 8251578.0,
|
|
"step": 3675
|
|
},
|
|
{
|
|
"entropy": 5.335589170455933,
|
|
"epoch": 3.9789075175770687,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00039248902582217024,
|
|
"loss": 5.1652,
|
|
"mean_token_accuracy": 0.19284765124320985,
|
|
"num_tokens": 8263211.0,
|
|
"step": 3680
|
|
},
|
|
{
|
|
"entropy": 5.292235565185547,
|
|
"epoch": 3.9843158464034616,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00039212301366702153,
|
|
"loss": 5.0577,
|
|
"mean_token_accuracy": 0.2027981922030449,
|
|
"num_tokens": 8274962.0,
|
|
"step": 3685
|
|
},
|
|
{
|
|
"entropy": 5.321161985397339,
|
|
"epoch": 3.989724175229854,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00039175657588657063,
|
|
"loss": 5.1145,
|
|
"mean_token_accuracy": 0.19505583643913268,
|
|
"num_tokens": 8286664.0,
|
|
"step": 3690
|
|
},
|
|
{
|
|
"entropy": 5.40333046913147,
|
|
"epoch": 3.9951325040562464,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0003913897138124531,
|
|
"loss": 5.1478,
|
|
"mean_token_accuracy": 0.20666071623563767,
|
|
"num_tokens": 8298308.0,
|
|
"step": 3695
|
|
},
|
|
{
|
|
"entropy": 5.259542094336616,
|
|
"epoch": 4.0,
|
|
"grad_norm": 2.171875,
|
|
"learning_rate": 0.0003910224287778466,
|
|
"loss": 4.9737,
|
|
"mean_token_accuracy": 0.20988202922874027,
|
|
"num_tokens": 8307556.0,
|
|
"step": 3700
|
|
},
|
|
{
|
|
"entropy": 5.228936624526978,
|
|
"epoch": 4.005408328826393,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00039065472211746586,
|
|
"loss": 4.7918,
|
|
"mean_token_accuracy": 0.21572422236204147,
|
|
"num_tokens": 8317317.0,
|
|
"step": 3705
|
|
},
|
|
{
|
|
"entropy": 5.381158876419067,
|
|
"epoch": 4.010816657652786,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0003902865951675576,
|
|
"loss": 4.8113,
|
|
"mean_token_accuracy": 0.21779844611883165,
|
|
"num_tokens": 8329205.0,
|
|
"step": 3710
|
|
},
|
|
{
|
|
"entropy": 5.202475833892822,
|
|
"epoch": 4.016224986479178,
|
|
"grad_norm": 1.0078125,
|
|
"learning_rate": 0.00038991804926589616,
|
|
"loss": 4.7601,
|
|
"mean_token_accuracy": 0.20786229223012925,
|
|
"num_tokens": 8341942.0,
|
|
"step": 3715
|
|
},
|
|
{
|
|
"entropy": 5.306916856765747,
|
|
"epoch": 4.0216333153055706,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.000389549085751778,
|
|
"loss": 4.7264,
|
|
"mean_token_accuracy": 0.22169105857610702,
|
|
"num_tokens": 8352842.0,
|
|
"step": 3720
|
|
},
|
|
{
|
|
"entropy": 5.215069007873535,
|
|
"epoch": 4.027041644131963,
|
|
"grad_norm": 0.98046875,
|
|
"learning_rate": 0.00038917970596601765,
|
|
"loss": 4.7444,
|
|
"mean_token_accuracy": 0.22096059173345567,
|
|
"num_tokens": 8365701.0,
|
|
"step": 3725
|
|
},
|
|
{
|
|
"entropy": 5.271167230606079,
|
|
"epoch": 4.032449972958356,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0003888099112509419,
|
|
"loss": 4.8085,
|
|
"mean_token_accuracy": 0.21960905939340591,
|
|
"num_tokens": 8377845.0,
|
|
"step": 3730
|
|
},
|
|
{
|
|
"entropy": 5.1842145919799805,
|
|
"epoch": 4.037858301784748,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00038843970295038564,
|
|
"loss": 4.7136,
|
|
"mean_token_accuracy": 0.22443787753582,
|
|
"num_tokens": 8388264.0,
|
|
"step": 3735
|
|
},
|
|
{
|
|
"entropy": 5.317769527435303,
|
|
"epoch": 4.043266630611141,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.00038806908240968666,
|
|
"loss": 4.7959,
|
|
"mean_token_accuracy": 0.21819601207971573,
|
|
"num_tokens": 8400293.0,
|
|
"step": 3740
|
|
},
|
|
{
|
|
"entropy": 5.253559303283692,
|
|
"epoch": 4.048674959437534,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.000387698050975681,
|
|
"loss": 4.7784,
|
|
"mean_token_accuracy": 0.2145900920033455,
|
|
"num_tokens": 8413206.0,
|
|
"step": 3745
|
|
},
|
|
{
|
|
"entropy": 5.1965256690979,
|
|
"epoch": 4.054083288263927,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0003873266099966976,
|
|
"loss": 4.7324,
|
|
"mean_token_accuracy": 0.22217119485139847,
|
|
"num_tokens": 8423730.0,
|
|
"step": 3750
|
|
},
|
|
{
|
|
"entropy": 5.2491833686828615,
|
|
"epoch": 4.059491617090319,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.00038695476082255395,
|
|
"loss": 4.8268,
|
|
"mean_token_accuracy": 0.2125288128852844,
|
|
"num_tokens": 8432836.0,
|
|
"step": 3755
|
|
},
|
|
{
|
|
"entropy": 5.265499591827393,
|
|
"epoch": 4.064899945916712,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0003865825048045507,
|
|
"loss": 4.7144,
|
|
"mean_token_accuracy": 0.22184101939201356,
|
|
"num_tokens": 8443373.0,
|
|
"step": 3760
|
|
},
|
|
{
|
|
"entropy": 5.241724443435669,
|
|
"epoch": 4.0703082747431045,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0003862098432954672,
|
|
"loss": 4.7008,
|
|
"mean_token_accuracy": 0.22234428226947783,
|
|
"num_tokens": 8455034.0,
|
|
"step": 3765
|
|
},
|
|
{
|
|
"entropy": 5.170835065841675,
|
|
"epoch": 4.075716603569497,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0003858367776495561,
|
|
"loss": 4.7516,
|
|
"mean_token_accuracy": 0.22083321064710618,
|
|
"num_tokens": 8466597.0,
|
|
"step": 3770
|
|
},
|
|
{
|
|
"entropy": 5.351025867462158,
|
|
"epoch": 4.081124932395889,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00038546330922253886,
|
|
"loss": 4.8063,
|
|
"mean_token_accuracy": 0.21793835312128068,
|
|
"num_tokens": 8478289.0,
|
|
"step": 3775
|
|
},
|
|
{
|
|
"entropy": 5.156632709503174,
|
|
"epoch": 4.086533261222282,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0003850894393716007,
|
|
"loss": 4.737,
|
|
"mean_token_accuracy": 0.2260276660323143,
|
|
"num_tokens": 8490369.0,
|
|
"step": 3780
|
|
},
|
|
{
|
|
"entropy": 5.268509292602539,
|
|
"epoch": 4.091941590048675,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0003847151694553855,
|
|
"loss": 4.8549,
|
|
"mean_token_accuracy": 0.21624237447977065,
|
|
"num_tokens": 8502055.0,
|
|
"step": 3785
|
|
},
|
|
{
|
|
"entropy": 5.186176681518555,
|
|
"epoch": 4.097349918875068,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0003843405008339908,
|
|
"loss": 4.6884,
|
|
"mean_token_accuracy": 0.2291273519396782,
|
|
"num_tokens": 8512700.0,
|
|
"step": 3790
|
|
},
|
|
{
|
|
"entropy": 5.248280239105225,
|
|
"epoch": 4.10275824770146,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00038396543486896354,
|
|
"loss": 4.7324,
|
|
"mean_token_accuracy": 0.22924015969038009,
|
|
"num_tokens": 8524393.0,
|
|
"step": 3795
|
|
},
|
|
{
|
|
"entropy": 5.247825384140015,
|
|
"epoch": 4.108166576527853,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00038358997292329406,
|
|
"loss": 4.7592,
|
|
"mean_token_accuracy": 0.22061702758073806,
|
|
"num_tokens": 8535064.0,
|
|
"step": 3800
|
|
},
|
|
{
|
|
"entropy": 5.158923149108887,
|
|
"epoch": 4.113574905354246,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00038321411636141214,
|
|
"loss": 4.8143,
|
|
"mean_token_accuracy": 0.21571891009807587,
|
|
"num_tokens": 8546371.0,
|
|
"step": 3805
|
|
},
|
|
{
|
|
"entropy": 5.194771432876587,
|
|
"epoch": 4.1189832341806385,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0003828378665491811,
|
|
"loss": 4.7083,
|
|
"mean_token_accuracy": 0.2260413110256195,
|
|
"num_tokens": 8557524.0,
|
|
"step": 3810
|
|
},
|
|
{
|
|
"entropy": 5.111932849884033,
|
|
"epoch": 4.1243915630070305,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.000382461224853894,
|
|
"loss": 4.7448,
|
|
"mean_token_accuracy": 0.21652544736862184,
|
|
"num_tokens": 8568161.0,
|
|
"step": 3815
|
|
},
|
|
{
|
|
"entropy": 5.222511100769043,
|
|
"epoch": 4.129799891833423,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0003820841926442674,
|
|
"loss": 4.7716,
|
|
"mean_token_accuracy": 0.21885205805301666,
|
|
"num_tokens": 8579483.0,
|
|
"step": 3820
|
|
},
|
|
{
|
|
"entropy": 5.30679235458374,
|
|
"epoch": 4.135208220659816,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0003817067712904372,
|
|
"loss": 4.8601,
|
|
"mean_token_accuracy": 0.21630595177412032,
|
|
"num_tokens": 8590698.0,
|
|
"step": 3825
|
|
},
|
|
{
|
|
"entropy": 5.289760875701904,
|
|
"epoch": 4.140616549486209,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00038132896216395355,
|
|
"loss": 4.8865,
|
|
"mean_token_accuracy": 0.20356166660785674,
|
|
"num_tokens": 8602669.0,
|
|
"step": 3830
|
|
},
|
|
{
|
|
"entropy": 5.177745962142945,
|
|
"epoch": 4.146024878312601,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0003809507666377758,
|
|
"loss": 4.7264,
|
|
"mean_token_accuracy": 0.2210530236363411,
|
|
"num_tokens": 8614401.0,
|
|
"step": 3835
|
|
},
|
|
{
|
|
"entropy": 5.225433874130249,
|
|
"epoch": 4.151433207138994,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00038057218608626714,
|
|
"loss": 4.8641,
|
|
"mean_token_accuracy": 0.2134488642215729,
|
|
"num_tokens": 8627274.0,
|
|
"step": 3840
|
|
},
|
|
{
|
|
"entropy": 5.227169942855835,
|
|
"epoch": 4.156841535965387,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0003801932218851903,
|
|
"loss": 4.8251,
|
|
"mean_token_accuracy": 0.21174139380455018,
|
|
"num_tokens": 8638103.0,
|
|
"step": 3845
|
|
},
|
|
{
|
|
"entropy": 5.228398609161377,
|
|
"epoch": 4.16224986479178,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.000379813875411702,
|
|
"loss": 4.7647,
|
|
"mean_token_accuracy": 0.22324918657541276,
|
|
"num_tokens": 8649073.0,
|
|
"step": 3850
|
|
},
|
|
{
|
|
"entropy": 5.227480363845825,
|
|
"epoch": 4.167658193618172,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00037943414804434826,
|
|
"loss": 4.7319,
|
|
"mean_token_accuracy": 0.2177593544125557,
|
|
"num_tokens": 8660037.0,
|
|
"step": 3855
|
|
},
|
|
{
|
|
"entropy": 5.297253751754761,
|
|
"epoch": 4.173066522444564,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0003790540411630592,
|
|
"loss": 4.8496,
|
|
"mean_token_accuracy": 0.21644241660833358,
|
|
"num_tokens": 8670900.0,
|
|
"step": 3860
|
|
},
|
|
{
|
|
"entropy": 5.229861164093018,
|
|
"epoch": 4.178474851270957,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00037867355614914404,
|
|
"loss": 4.8664,
|
|
"mean_token_accuracy": 0.21475912481546403,
|
|
"num_tokens": 8682646.0,
|
|
"step": 3865
|
|
},
|
|
{
|
|
"entropy": 5.198261260986328,
|
|
"epoch": 4.18388318009735,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0003782926943852864,
|
|
"loss": 4.7489,
|
|
"mean_token_accuracy": 0.2238985478878021,
|
|
"num_tokens": 8692508.0,
|
|
"step": 3870
|
|
},
|
|
{
|
|
"entropy": 5.222509908676147,
|
|
"epoch": 4.189291508923742,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00037791145725553853,
|
|
"loss": 4.725,
|
|
"mean_token_accuracy": 0.22145478129386903,
|
|
"num_tokens": 8703711.0,
|
|
"step": 3875
|
|
},
|
|
{
|
|
"entropy": 5.162336206436157,
|
|
"epoch": 4.194699837750135,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0003775298461453172,
|
|
"loss": 4.7062,
|
|
"mean_token_accuracy": 0.22696628868579866,
|
|
"num_tokens": 8715531.0,
|
|
"step": 3880
|
|
},
|
|
{
|
|
"entropy": 5.172789764404297,
|
|
"epoch": 4.200108166576528,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.000377147862441398,
|
|
"loss": 4.711,
|
|
"mean_token_accuracy": 0.2265646681189537,
|
|
"num_tokens": 8726182.0,
|
|
"step": 3885
|
|
},
|
|
{
|
|
"entropy": 5.22358455657959,
|
|
"epoch": 4.205516495402921,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00037676550753191075,
|
|
"loss": 4.7829,
|
|
"mean_token_accuracy": 0.2251006320118904,
|
|
"num_tokens": 8736223.0,
|
|
"step": 3890
|
|
},
|
|
{
|
|
"entropy": 5.1700376033782955,
|
|
"epoch": 4.210924824229313,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0003763827828063339,
|
|
"loss": 4.8159,
|
|
"mean_token_accuracy": 0.22132253646850586,
|
|
"num_tokens": 8747723.0,
|
|
"step": 3895
|
|
},
|
|
{
|
|
"entropy": 5.291456031799316,
|
|
"epoch": 4.2163331530557056,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00037599968965549,
|
|
"loss": 4.7976,
|
|
"mean_token_accuracy": 0.21205141991376877,
|
|
"num_tokens": 8757756.0,
|
|
"step": 3900
|
|
},
|
|
{
|
|
"entropy": 5.209738683700562,
|
|
"epoch": 4.221741481882098,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0003756162294715405,
|
|
"loss": 4.7399,
|
|
"mean_token_accuracy": 0.22141652256250383,
|
|
"num_tokens": 8768226.0,
|
|
"step": 3905
|
|
},
|
|
{
|
|
"entropy": 5.168905258178711,
|
|
"epoch": 4.227149810708491,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00037523240364798063,
|
|
"loss": 4.7764,
|
|
"mean_token_accuracy": 0.22340039312839508,
|
|
"num_tokens": 8778920.0,
|
|
"step": 3910
|
|
},
|
|
{
|
|
"entropy": 5.258641767501831,
|
|
"epoch": 4.232558139534884,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00037484821357963423,
|
|
"loss": 4.8927,
|
|
"mean_token_accuracy": 0.21655535995960234,
|
|
"num_tokens": 8790784.0,
|
|
"step": 3915
|
|
},
|
|
{
|
|
"entropy": 5.218029928207398,
|
|
"epoch": 4.237966468361276,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.000374463660662649,
|
|
"loss": 4.7659,
|
|
"mean_token_accuracy": 0.2183724746108055,
|
|
"num_tokens": 8801596.0,
|
|
"step": 3920
|
|
},
|
|
{
|
|
"entropy": 5.2418529987335205,
|
|
"epoch": 4.243374797187669,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.000374078746294491,
|
|
"loss": 4.793,
|
|
"mean_token_accuracy": 0.21937247067689897,
|
|
"num_tokens": 8813159.0,
|
|
"step": 3925
|
|
},
|
|
{
|
|
"entropy": 5.2435462474823,
|
|
"epoch": 4.248783126014062,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00037369347187393996,
|
|
"loss": 4.7462,
|
|
"mean_token_accuracy": 0.22190145701169967,
|
|
"num_tokens": 8824100.0,
|
|
"step": 3930
|
|
},
|
|
{
|
|
"entropy": 5.145112037658691,
|
|
"epoch": 4.254191454840455,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0003733078388010842,
|
|
"loss": 4.7415,
|
|
"mean_token_accuracy": 0.22087637037038804,
|
|
"num_tokens": 8835768.0,
|
|
"step": 3935
|
|
},
|
|
{
|
|
"entropy": 5.190743255615234,
|
|
"epoch": 4.259599783666847,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.0003729218484773149,
|
|
"loss": 4.8552,
|
|
"mean_token_accuracy": 0.21553286612033845,
|
|
"num_tokens": 8848301.0,
|
|
"step": 3940
|
|
},
|
|
{
|
|
"entropy": 5.148532962799072,
|
|
"epoch": 4.2650081124932395,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0003725355023053221,
|
|
"loss": 4.7084,
|
|
"mean_token_accuracy": 0.23386980593204498,
|
|
"num_tokens": 8859948.0,
|
|
"step": 3945
|
|
},
|
|
{
|
|
"entropy": 5.2061621189117435,
|
|
"epoch": 4.270416441319632,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0003721488016890884,
|
|
"loss": 4.825,
|
|
"mean_token_accuracy": 0.2174012243747711,
|
|
"num_tokens": 8870795.0,
|
|
"step": 3950
|
|
},
|
|
{
|
|
"entropy": 5.173050451278686,
|
|
"epoch": 4.275824770146025,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00037176174803388496,
|
|
"loss": 4.7727,
|
|
"mean_token_accuracy": 0.21645693480968475,
|
|
"num_tokens": 8881084.0,
|
|
"step": 3955
|
|
},
|
|
{
|
|
"entropy": 5.291169023513794,
|
|
"epoch": 4.281233098972417,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00037137434274626545,
|
|
"loss": 4.8955,
|
|
"mean_token_accuracy": 0.2193419650197029,
|
|
"num_tokens": 8892156.0,
|
|
"step": 3960
|
|
},
|
|
{
|
|
"entropy": 5.180820178985596,
|
|
"epoch": 4.28664142779881,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0003709865872340618,
|
|
"loss": 4.8171,
|
|
"mean_token_accuracy": 0.21348263025283815,
|
|
"num_tokens": 8903073.0,
|
|
"step": 3965
|
|
},
|
|
{
|
|
"entropy": 5.253063774108886,
|
|
"epoch": 4.292049756625203,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0003705984829063782,
|
|
"loss": 4.7986,
|
|
"mean_token_accuracy": 0.2177883967757225,
|
|
"num_tokens": 8913745.0,
|
|
"step": 3970
|
|
},
|
|
{
|
|
"entropy": 5.223085021972656,
|
|
"epoch": 4.297458085451596,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0003702100311735869,
|
|
"loss": 4.7537,
|
|
"mean_token_accuracy": 0.2223805844783783,
|
|
"num_tokens": 8925136.0,
|
|
"step": 3975
|
|
},
|
|
{
|
|
"entropy": 5.176297569274903,
|
|
"epoch": 4.302866414277988,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00036982123344732223,
|
|
"loss": 4.8206,
|
|
"mean_token_accuracy": 0.21707260906696318,
|
|
"num_tokens": 8935875.0,
|
|
"step": 3980
|
|
},
|
|
{
|
|
"entropy": 5.200548839569092,
|
|
"epoch": 4.308274743104381,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00036943209114047613,
|
|
"loss": 4.7444,
|
|
"mean_token_accuracy": 0.21994930505752563,
|
|
"num_tokens": 8946504.0,
|
|
"step": 3985
|
|
},
|
|
{
|
|
"entropy": 5.295788955688477,
|
|
"epoch": 4.3136830719307735,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0003690426056671926,
|
|
"loss": 4.9146,
|
|
"mean_token_accuracy": 0.21547133475542068,
|
|
"num_tokens": 8957515.0,
|
|
"step": 3990
|
|
},
|
|
{
|
|
"entropy": 5.2737537860870365,
|
|
"epoch": 4.319091400757166,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0003686527784428627,
|
|
"loss": 4.909,
|
|
"mean_token_accuracy": 0.21105027496814727,
|
|
"num_tokens": 8967774.0,
|
|
"step": 3995
|
|
},
|
|
{
|
|
"entropy": 5.2086974620819095,
|
|
"epoch": 4.324499729583558,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00036826261088411955,
|
|
"loss": 4.8259,
|
|
"mean_token_accuracy": 0.21815041452646255,
|
|
"num_tokens": 8979209.0,
|
|
"step": 4000
|
|
},
|
|
{
|
|
"epoch": 4.324499729583558,
|
|
"eval_entropy": 5.129207630590959,
|
|
"eval_loss": 5.875708103179932,
|
|
"eval_mean_token_accuracy": 0.17788886231454937,
|
|
"eval_num_tokens": 8979209.0,
|
|
"eval_runtime": 2.5205,
|
|
"eval_samples_per_second": 1394.552,
|
|
"eval_steps_per_second": 174.567,
|
|
"step": 4000
|
|
},
|
|
{
|
|
"entropy": 5.1698521137237545,
|
|
"epoch": 4.329908058409951,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0003678721044088329,
|
|
"loss": 4.7449,
|
|
"mean_token_accuracy": 0.22811723202466966,
|
|
"num_tokens": 8990858.0,
|
|
"step": 4005
|
|
},
|
|
{
|
|
"entropy": 5.2381916522979735,
|
|
"epoch": 4.335316387236344,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0003674812604361043,
|
|
"loss": 4.7611,
|
|
"mean_token_accuracy": 0.22092103958129883,
|
|
"num_tokens": 9001955.0,
|
|
"step": 4010
|
|
},
|
|
{
|
|
"entropy": 5.2503519535064695,
|
|
"epoch": 4.340724716062737,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0003670900803862615,
|
|
"loss": 4.8644,
|
|
"mean_token_accuracy": 0.21506840288639067,
|
|
"num_tokens": 9015109.0,
|
|
"step": 4015
|
|
},
|
|
{
|
|
"entropy": 5.179874420166016,
|
|
"epoch": 4.346133044889129,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0003666985656808537,
|
|
"loss": 4.7549,
|
|
"mean_token_accuracy": 0.2173784926533699,
|
|
"num_tokens": 9025927.0,
|
|
"step": 4020
|
|
},
|
|
{
|
|
"entropy": 5.110817241668701,
|
|
"epoch": 4.351541373715522,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00036630671774264635,
|
|
"loss": 4.8007,
|
|
"mean_token_accuracy": 0.22302627563476562,
|
|
"num_tokens": 9037327.0,
|
|
"step": 4025
|
|
},
|
|
{
|
|
"entropy": 5.264145946502685,
|
|
"epoch": 4.356949702541915,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0003659145379956158,
|
|
"loss": 4.8265,
|
|
"mean_token_accuracy": 0.21460790187120438,
|
|
"num_tokens": 9048521.0,
|
|
"step": 4030
|
|
},
|
|
{
|
|
"entropy": 5.249226665496826,
|
|
"epoch": 4.3623580313683075,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00036552202786494393,
|
|
"loss": 4.8533,
|
|
"mean_token_accuracy": 0.21577533483505248,
|
|
"num_tokens": 9060097.0,
|
|
"step": 4035
|
|
},
|
|
{
|
|
"entropy": 5.1628114700317385,
|
|
"epoch": 4.367766360194699,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00036512918877701367,
|
|
"loss": 4.7656,
|
|
"mean_token_accuracy": 0.21338739693164827,
|
|
"num_tokens": 9071073.0,
|
|
"step": 4040
|
|
},
|
|
{
|
|
"entropy": 5.196001434326172,
|
|
"epoch": 4.373174689021092,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00036473602215940316,
|
|
"loss": 4.7359,
|
|
"mean_token_accuracy": 0.22415471374988555,
|
|
"num_tokens": 9082208.0,
|
|
"step": 4045
|
|
},
|
|
{
|
|
"entropy": 5.269560050964356,
|
|
"epoch": 4.378583017847485,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0003643425294408807,
|
|
"loss": 4.8195,
|
|
"mean_token_accuracy": 0.2192169427871704,
|
|
"num_tokens": 9093318.0,
|
|
"step": 4050
|
|
},
|
|
{
|
|
"entropy": 5.236953926086426,
|
|
"epoch": 4.383991346673878,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00036394871205139984,
|
|
"loss": 4.8381,
|
|
"mean_token_accuracy": 0.2181643858551979,
|
|
"num_tokens": 9104297.0,
|
|
"step": 4055
|
|
},
|
|
{
|
|
"entropy": 5.172978925704956,
|
|
"epoch": 4.38939967550027,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0003635545714220938,
|
|
"loss": 4.7626,
|
|
"mean_token_accuracy": 0.22120705395936965,
|
|
"num_tokens": 9115740.0,
|
|
"step": 4060
|
|
},
|
|
{
|
|
"entropy": 5.214205312728882,
|
|
"epoch": 4.394808004326663,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0003631601089852706,
|
|
"loss": 4.7844,
|
|
"mean_token_accuracy": 0.22138622105121614,
|
|
"num_tokens": 9127471.0,
|
|
"step": 4065
|
|
},
|
|
{
|
|
"entropy": 5.2109921932220455,
|
|
"epoch": 4.400216333153056,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0003627653261744075,
|
|
"loss": 4.8677,
|
|
"mean_token_accuracy": 0.2143697664141655,
|
|
"num_tokens": 9139797.0,
|
|
"step": 4070
|
|
},
|
|
{
|
|
"entropy": 5.2805290699005125,
|
|
"epoch": 4.405624661979449,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00036237022442414636,
|
|
"loss": 4.9033,
|
|
"mean_token_accuracy": 0.2102605313062668,
|
|
"num_tokens": 9151414.0,
|
|
"step": 4075
|
|
},
|
|
{
|
|
"entropy": 5.274412536621094,
|
|
"epoch": 4.411032990805841,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0003619748051702878,
|
|
"loss": 4.8679,
|
|
"mean_token_accuracy": 0.21292463988065718,
|
|
"num_tokens": 9164326.0,
|
|
"step": 4080
|
|
},
|
|
{
|
|
"entropy": 5.282187271118164,
|
|
"epoch": 4.416441319632233,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0003615790698497862,
|
|
"loss": 4.8784,
|
|
"mean_token_accuracy": 0.21291628181934358,
|
|
"num_tokens": 9174523.0,
|
|
"step": 4085
|
|
},
|
|
{
|
|
"entropy": 5.2507611274719235,
|
|
"epoch": 4.421849648458626,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00036118301990074463,
|
|
"loss": 4.8805,
|
|
"mean_token_accuracy": 0.21525037586688994,
|
|
"num_tokens": 9185744.0,
|
|
"step": 4090
|
|
},
|
|
{
|
|
"entropy": 5.246658611297607,
|
|
"epoch": 4.427257977285019,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0003607866567624097,
|
|
"loss": 4.8474,
|
|
"mean_token_accuracy": 0.21757164001464843,
|
|
"num_tokens": 9195986.0,
|
|
"step": 4095
|
|
},
|
|
{
|
|
"entropy": 5.207152605056763,
|
|
"epoch": 4.432666306111411,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00036038998187516583,
|
|
"loss": 4.8821,
|
|
"mean_token_accuracy": 0.20915853083133698,
|
|
"num_tokens": 9207054.0,
|
|
"step": 4100
|
|
},
|
|
{
|
|
"entropy": 5.142826938629151,
|
|
"epoch": 4.438074634937804,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00035999299668053043,
|
|
"loss": 4.7944,
|
|
"mean_token_accuracy": 0.21401069164276124,
|
|
"num_tokens": 9218021.0,
|
|
"step": 4105
|
|
},
|
|
{
|
|
"entropy": 5.110489463806152,
|
|
"epoch": 4.443482963764197,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0003595957026211487,
|
|
"loss": 4.6857,
|
|
"mean_token_accuracy": 0.23302003294229506,
|
|
"num_tokens": 9229580.0,
|
|
"step": 4110
|
|
},
|
|
{
|
|
"entropy": 5.204845714569092,
|
|
"epoch": 4.44889129259059,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00035919810114078815,
|
|
"loss": 4.7612,
|
|
"mean_token_accuracy": 0.21849105954170228,
|
|
"num_tokens": 9241378.0,
|
|
"step": 4115
|
|
},
|
|
{
|
|
"entropy": 5.2413819313049315,
|
|
"epoch": 4.4542996214169825,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00035880019368433354,
|
|
"loss": 4.8832,
|
|
"mean_token_accuracy": 0.20542484670877456,
|
|
"num_tokens": 9253807.0,
|
|
"step": 4120
|
|
},
|
|
{
|
|
"entropy": 5.197515153884888,
|
|
"epoch": 4.4597079502433745,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0003584019816977813,
|
|
"loss": 4.811,
|
|
"mean_token_accuracy": 0.2168327286839485,
|
|
"num_tokens": 9264610.0,
|
|
"step": 4125
|
|
},
|
|
{
|
|
"entropy": 5.247724866867065,
|
|
"epoch": 4.465116279069767,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00035800346662823493,
|
|
"loss": 4.8376,
|
|
"mean_token_accuracy": 0.22170430123806,
|
|
"num_tokens": 9275013.0,
|
|
"step": 4130
|
|
},
|
|
{
|
|
"entropy": 5.259762144088745,
|
|
"epoch": 4.47052460789616,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.000357604649923899,
|
|
"loss": 4.8675,
|
|
"mean_token_accuracy": 0.21409146785736083,
|
|
"num_tokens": 9287010.0,
|
|
"step": 4135
|
|
},
|
|
{
|
|
"entropy": 5.179459762573242,
|
|
"epoch": 4.475932936722553,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0003572055330340744,
|
|
"loss": 4.8077,
|
|
"mean_token_accuracy": 0.2238604962825775,
|
|
"num_tokens": 9299542.0,
|
|
"step": 4140
|
|
},
|
|
{
|
|
"entropy": 5.142919921875,
|
|
"epoch": 4.481341265548945,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00035680611740915264,
|
|
"loss": 4.8939,
|
|
"mean_token_accuracy": 0.20940080732107164,
|
|
"num_tokens": 9311469.0,
|
|
"step": 4145
|
|
},
|
|
{
|
|
"entropy": 5.196005821228027,
|
|
"epoch": 4.486749594375338,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0003564064045006113,
|
|
"loss": 4.7827,
|
|
"mean_token_accuracy": 0.222554050385952,
|
|
"num_tokens": 9323235.0,
|
|
"step": 4150
|
|
},
|
|
{
|
|
"entropy": 5.153643465042114,
|
|
"epoch": 4.492157923201731,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00035600639576100786,
|
|
"loss": 4.7639,
|
|
"mean_token_accuracy": 0.22529457211494447,
|
|
"num_tokens": 9334072.0,
|
|
"step": 4155
|
|
},
|
|
{
|
|
"entropy": 5.200942420959473,
|
|
"epoch": 4.497566252028124,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00035560609264397497,
|
|
"loss": 4.7556,
|
|
"mean_token_accuracy": 0.22053186744451522,
|
|
"num_tokens": 9344554.0,
|
|
"step": 4160
|
|
},
|
|
{
|
|
"entropy": 5.288739442825317,
|
|
"epoch": 4.502974580854516,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00035520549660421515,
|
|
"loss": 4.8634,
|
|
"mean_token_accuracy": 0.22072732746601104,
|
|
"num_tokens": 9354652.0,
|
|
"step": 4165
|
|
},
|
|
{
|
|
"entropy": 5.143185806274414,
|
|
"epoch": 4.5083829096809085,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0003548046090974954,
|
|
"loss": 4.7859,
|
|
"mean_token_accuracy": 0.22373250871896744,
|
|
"num_tokens": 9366827.0,
|
|
"step": 4170
|
|
},
|
|
{
|
|
"entropy": 5.1459380149841305,
|
|
"epoch": 4.513791238507301,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00035440343158064176,
|
|
"loss": 4.8365,
|
|
"mean_token_accuracy": 0.21650842428207398,
|
|
"num_tokens": 9378454.0,
|
|
"step": 4175
|
|
},
|
|
{
|
|
"entropy": 5.274607515335083,
|
|
"epoch": 4.519199567333694,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0003540019655115341,
|
|
"loss": 4.8221,
|
|
"mean_token_accuracy": 0.22054063826799392,
|
|
"num_tokens": 9389811.0,
|
|
"step": 4180
|
|
},
|
|
{
|
|
"entropy": 5.11309962272644,
|
|
"epoch": 4.524607896160086,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00035360021234910133,
|
|
"loss": 4.7699,
|
|
"mean_token_accuracy": 0.21781020611524582,
|
|
"num_tokens": 9402131.0,
|
|
"step": 4185
|
|
},
|
|
{
|
|
"entropy": 5.157134628295898,
|
|
"epoch": 4.530016224986479,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00035319817355331537,
|
|
"loss": 4.7534,
|
|
"mean_token_accuracy": 0.21301970779895782,
|
|
"num_tokens": 9413349.0,
|
|
"step": 4190
|
|
},
|
|
{
|
|
"entropy": 5.244472408294678,
|
|
"epoch": 4.535424553812872,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0003527958505851858,
|
|
"loss": 4.8331,
|
|
"mean_token_accuracy": 0.2209853559732437,
|
|
"num_tokens": 9424166.0,
|
|
"step": 4195
|
|
},
|
|
{
|
|
"entropy": 5.098556661605835,
|
|
"epoch": 4.540832882639265,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.00035239324490675546,
|
|
"loss": 4.7108,
|
|
"mean_token_accuracy": 0.22704413086175917,
|
|
"num_tokens": 9434170.0,
|
|
"step": 4200
|
|
},
|
|
{
|
|
"entropy": 5.143066167831421,
|
|
"epoch": 4.546241211465657,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0003519903579810943,
|
|
"loss": 4.7103,
|
|
"mean_token_accuracy": 0.22983715683221817,
|
|
"num_tokens": 9445895.0,
|
|
"step": 4205
|
|
},
|
|
{
|
|
"entropy": 5.150725650787353,
|
|
"epoch": 4.55164954029205,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0003515871912722944,
|
|
"loss": 4.7056,
|
|
"mean_token_accuracy": 0.2305183231830597,
|
|
"num_tokens": 9456541.0,
|
|
"step": 4210
|
|
},
|
|
{
|
|
"entropy": 5.135134935379028,
|
|
"epoch": 4.5570578691184425,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0003511837462454643,
|
|
"loss": 4.77,
|
|
"mean_token_accuracy": 0.21956500113010408,
|
|
"num_tokens": 9468371.0,
|
|
"step": 4215
|
|
},
|
|
{
|
|
"entropy": 5.230216598510742,
|
|
"epoch": 4.562466197944835,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00035078002436672443,
|
|
"loss": 4.8215,
|
|
"mean_token_accuracy": 0.21773815304040908,
|
|
"num_tokens": 9479836.0,
|
|
"step": 4220
|
|
},
|
|
{
|
|
"entropy": 5.1390351295471195,
|
|
"epoch": 4.567874526771227,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0003503760271032007,
|
|
"loss": 4.7523,
|
|
"mean_token_accuracy": 0.22365643382072448,
|
|
"num_tokens": 9491513.0,
|
|
"step": 4225
|
|
},
|
|
{
|
|
"entropy": 5.174953603744507,
|
|
"epoch": 4.57328285559762,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0003499717559230205,
|
|
"loss": 4.9148,
|
|
"mean_token_accuracy": 0.2128012552857399,
|
|
"num_tokens": 9502294.0,
|
|
"step": 4230
|
|
},
|
|
{
|
|
"entropy": 5.200818967819214,
|
|
"epoch": 4.578691184424013,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00034956721229530586,
|
|
"loss": 4.7697,
|
|
"mean_token_accuracy": 0.21208871603012086,
|
|
"num_tokens": 9514171.0,
|
|
"step": 4235
|
|
},
|
|
{
|
|
"entropy": 5.15206356048584,
|
|
"epoch": 4.584099513250406,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0003491623976901695,
|
|
"loss": 4.7765,
|
|
"mean_token_accuracy": 0.2192790687084198,
|
|
"num_tokens": 9525856.0,
|
|
"step": 4240
|
|
},
|
|
{
|
|
"entropy": 5.19573826789856,
|
|
"epoch": 4.589507842076799,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0003487573135787085,
|
|
"loss": 4.7754,
|
|
"mean_token_accuracy": 0.22540073245763778,
|
|
"num_tokens": 9536879.0,
|
|
"step": 4245
|
|
},
|
|
{
|
|
"entropy": 5.1057915687561035,
|
|
"epoch": 4.594916170903191,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00034835196143299956,
|
|
"loss": 4.7776,
|
|
"mean_token_accuracy": 0.22640183717012405,
|
|
"num_tokens": 9548753.0,
|
|
"step": 4250
|
|
},
|
|
{
|
|
"entropy": 5.186993169784546,
|
|
"epoch": 4.600324499729584,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00034794634272609313,
|
|
"loss": 4.8709,
|
|
"mean_token_accuracy": 0.2171752020716667,
|
|
"num_tokens": 9560360.0,
|
|
"step": 4255
|
|
},
|
|
{
|
|
"entropy": 5.20418152809143,
|
|
"epoch": 4.605732828555976,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0003475404589320089,
|
|
"loss": 4.7735,
|
|
"mean_token_accuracy": 0.2225883737206459,
|
|
"num_tokens": 9571933.0,
|
|
"step": 4260
|
|
},
|
|
{
|
|
"entropy": 5.1791015625,
|
|
"epoch": 4.611141157382368,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0003471343115257291,
|
|
"loss": 4.88,
|
|
"mean_token_accuracy": 0.214799465239048,
|
|
"num_tokens": 9582574.0,
|
|
"step": 4265
|
|
},
|
|
{
|
|
"entropy": 5.2256396293640135,
|
|
"epoch": 4.616549486208761,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00034672790198319453,
|
|
"loss": 4.7891,
|
|
"mean_token_accuracy": 0.21801409721374512,
|
|
"num_tokens": 9594099.0,
|
|
"step": 4270
|
|
},
|
|
{
|
|
"entropy": 5.227209234237671,
|
|
"epoch": 4.621957815035154,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0003463212317812985,
|
|
"loss": 4.827,
|
|
"mean_token_accuracy": 0.21566763818264006,
|
|
"num_tokens": 9605453.0,
|
|
"step": 4275
|
|
},
|
|
{
|
|
"entropy": 5.073718786239624,
|
|
"epoch": 4.627366143861547,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0003459143023978813,
|
|
"loss": 4.7178,
|
|
"mean_token_accuracy": 0.22432279735803604,
|
|
"num_tokens": 9615792.0,
|
|
"step": 4280
|
|
},
|
|
{
|
|
"entropy": 5.141191101074218,
|
|
"epoch": 4.63277447268794,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0003455071153117252,
|
|
"loss": 4.814,
|
|
"mean_token_accuracy": 0.21015540808439254,
|
|
"num_tokens": 9626742.0,
|
|
"step": 4285
|
|
},
|
|
{
|
|
"entropy": 5.218060779571533,
|
|
"epoch": 4.638182801514332,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0003450996720025493,
|
|
"loss": 4.8498,
|
|
"mean_token_accuracy": 0.2157706916332245,
|
|
"num_tokens": 9636771.0,
|
|
"step": 4290
|
|
},
|
|
{
|
|
"entropy": 5.262406253814698,
|
|
"epoch": 4.643591130340725,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00034469197395100323,
|
|
"loss": 4.8317,
|
|
"mean_token_accuracy": 0.21994881480932235,
|
|
"num_tokens": 9649231.0,
|
|
"step": 4295
|
|
},
|
|
{
|
|
"entropy": 5.263737440109253,
|
|
"epoch": 4.6489994591671175,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.00034428402263866285,
|
|
"loss": 4.8637,
|
|
"mean_token_accuracy": 0.20947184562683105,
|
|
"num_tokens": 9659716.0,
|
|
"step": 4300
|
|
},
|
|
{
|
|
"entropy": 5.1370399475097654,
|
|
"epoch": 4.6544077879935095,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00034387581954802406,
|
|
"loss": 4.7669,
|
|
"mean_token_accuracy": 0.21796492636203765,
|
|
"num_tokens": 9670421.0,
|
|
"step": 4305
|
|
},
|
|
{
|
|
"entropy": 5.223067378997802,
|
|
"epoch": 4.659816116819902,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00034346736616249786,
|
|
"loss": 4.8372,
|
|
"mean_token_accuracy": 0.2140335828065872,
|
|
"num_tokens": 9680720.0,
|
|
"step": 4310
|
|
},
|
|
{
|
|
"entropy": 5.19291124343872,
|
|
"epoch": 4.665224445646295,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00034305866396640473,
|
|
"loss": 4.7321,
|
|
"mean_token_accuracy": 0.2318376526236534,
|
|
"num_tokens": 9693521.0,
|
|
"step": 4315
|
|
},
|
|
{
|
|
"entropy": 5.1591602802276615,
|
|
"epoch": 4.670632774472688,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00034264971444496954,
|
|
"loss": 4.8524,
|
|
"mean_token_accuracy": 0.21431104838848114,
|
|
"num_tokens": 9704537.0,
|
|
"step": 4320
|
|
},
|
|
{
|
|
"entropy": 5.142458295822143,
|
|
"epoch": 4.676041103299081,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00034224051908431574,
|
|
"loss": 4.7847,
|
|
"mean_token_accuracy": 0.22502675354480745,
|
|
"num_tokens": 9715562.0,
|
|
"step": 4325
|
|
},
|
|
{
|
|
"entropy": 5.166618824005127,
|
|
"epoch": 4.681449432125473,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0003418310793714602,
|
|
"loss": 4.7389,
|
|
"mean_token_accuracy": 0.22202754467725755,
|
|
"num_tokens": 9726598.0,
|
|
"step": 4330
|
|
},
|
|
{
|
|
"entropy": 5.2268894672393795,
|
|
"epoch": 4.686857760951866,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0003414213967943077,
|
|
"loss": 4.8569,
|
|
"mean_token_accuracy": 0.21525177955627442,
|
|
"num_tokens": 9737088.0,
|
|
"step": 4335
|
|
},
|
|
{
|
|
"entropy": 5.222609567642212,
|
|
"epoch": 4.692266089778259,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00034101147284164583,
|
|
"loss": 4.7656,
|
|
"mean_token_accuracy": 0.22113731503486633,
|
|
"num_tokens": 9746651.0,
|
|
"step": 4340
|
|
},
|
|
{
|
|
"entropy": 5.157958173751831,
|
|
"epoch": 4.6976744186046515,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00034060130900313905,
|
|
"loss": 4.8145,
|
|
"mean_token_accuracy": 0.21096471697092056,
|
|
"num_tokens": 9757622.0,
|
|
"step": 4345
|
|
},
|
|
{
|
|
"entropy": 5.127590084075928,
|
|
"epoch": 4.7030827474310435,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00034019090676932383,
|
|
"loss": 4.7697,
|
|
"mean_token_accuracy": 0.22989437878131866,
|
|
"num_tokens": 9767759.0,
|
|
"step": 4350
|
|
},
|
|
{
|
|
"entropy": 5.3040358543396,
|
|
"epoch": 4.708491076257436,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0003397802676316027,
|
|
"loss": 4.9098,
|
|
"mean_token_accuracy": 0.21758915334939957,
|
|
"num_tokens": 9778817.0,
|
|
"step": 4355
|
|
},
|
|
{
|
|
"entropy": 5.113615083694458,
|
|
"epoch": 4.713899405083829,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00033936939308223935,
|
|
"loss": 4.7139,
|
|
"mean_token_accuracy": 0.22662854045629502,
|
|
"num_tokens": 9788535.0,
|
|
"step": 4360
|
|
},
|
|
{
|
|
"entropy": 5.159414005279541,
|
|
"epoch": 4.719307733910222,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00033895828461435275,
|
|
"loss": 4.7933,
|
|
"mean_token_accuracy": 0.22037333399057388,
|
|
"num_tokens": 9800032.0,
|
|
"step": 4365
|
|
},
|
|
{
|
|
"entropy": 5.065600967407226,
|
|
"epoch": 4.724716062736614,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0003385469437219121,
|
|
"loss": 4.7444,
|
|
"mean_token_accuracy": 0.21907117813825608,
|
|
"num_tokens": 9811101.0,
|
|
"step": 4370
|
|
},
|
|
{
|
|
"entropy": 5.1119468212127686,
|
|
"epoch": 4.730124391563007,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.00033813537189973105,
|
|
"loss": 4.7389,
|
|
"mean_token_accuracy": 0.22492649555206298,
|
|
"num_tokens": 9821228.0,
|
|
"step": 4375
|
|
},
|
|
{
|
|
"entropy": 5.118333959579468,
|
|
"epoch": 4.7355327203894,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.00033772357064346266,
|
|
"loss": 4.7554,
|
|
"mean_token_accuracy": 0.21604670733213424,
|
|
"num_tokens": 9832842.0,
|
|
"step": 4380
|
|
},
|
|
{
|
|
"entropy": 5.185558414459228,
|
|
"epoch": 4.740941049215793,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0003373115414495935,
|
|
"loss": 4.9157,
|
|
"mean_token_accuracy": 0.21205592453479766,
|
|
"num_tokens": 9843489.0,
|
|
"step": 4385
|
|
},
|
|
{
|
|
"entropy": 5.2465376377105715,
|
|
"epoch": 4.746349378042185,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0003368992858154389,
|
|
"loss": 4.8342,
|
|
"mean_token_accuracy": 0.2219047337770462,
|
|
"num_tokens": 9854361.0,
|
|
"step": 4390
|
|
},
|
|
{
|
|
"entropy": 5.184808301925659,
|
|
"epoch": 4.7517577068685775,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00033648680523913643,
|
|
"loss": 4.7954,
|
|
"mean_token_accuracy": 0.21774271577596666,
|
|
"num_tokens": 9864793.0,
|
|
"step": 4395
|
|
},
|
|
{
|
|
"entropy": 5.1303857326507565,
|
|
"epoch": 4.75716603569497,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0003360741012196417,
|
|
"loss": 4.7389,
|
|
"mean_token_accuracy": 0.22457690089941024,
|
|
"num_tokens": 9875541.0,
|
|
"step": 4400
|
|
},
|
|
{
|
|
"entropy": 5.162422370910645,
|
|
"epoch": 4.762574364521363,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.000335661175256722,
|
|
"loss": 4.7913,
|
|
"mean_token_accuracy": 0.22141399681568147,
|
|
"num_tokens": 9887619.0,
|
|
"step": 4405
|
|
},
|
|
{
|
|
"entropy": 5.29186224937439,
|
|
"epoch": 4.767982693347756,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0003352480288509513,
|
|
"loss": 4.921,
|
|
"mean_token_accuracy": 0.2129698932170868,
|
|
"num_tokens": 9898515.0,
|
|
"step": 4410
|
|
},
|
|
{
|
|
"entropy": 5.172016716003418,
|
|
"epoch": 4.773391022174148,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00033483466350370445,
|
|
"loss": 4.7444,
|
|
"mean_token_accuracy": 0.2318284034729004,
|
|
"num_tokens": 9909006.0,
|
|
"step": 4415
|
|
},
|
|
{
|
|
"entropy": 5.111044120788574,
|
|
"epoch": 4.778799351000541,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00033442108071715215,
|
|
"loss": 4.7707,
|
|
"mean_token_accuracy": 0.22435135990381241,
|
|
"num_tokens": 9919645.0,
|
|
"step": 4420
|
|
},
|
|
{
|
|
"entropy": 5.134038972854614,
|
|
"epoch": 4.784207679826934,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00033400728199425525,
|
|
"loss": 4.7727,
|
|
"mean_token_accuracy": 0.2211101233959198,
|
|
"num_tokens": 9930990.0,
|
|
"step": 4425
|
|
},
|
|
{
|
|
"entropy": 5.129887247085572,
|
|
"epoch": 4.789616008653326,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.00033359326883875917,
|
|
"loss": 4.7372,
|
|
"mean_token_accuracy": 0.22077507078647612,
|
|
"num_tokens": 9942481.0,
|
|
"step": 4430
|
|
},
|
|
{
|
|
"entropy": 5.16159348487854,
|
|
"epoch": 4.795024337479719,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00033317904275518873,
|
|
"loss": 4.7505,
|
|
"mean_token_accuracy": 0.22420234084129334,
|
|
"num_tokens": 9953908.0,
|
|
"step": 4435
|
|
},
|
|
{
|
|
"entropy": 5.121800756454467,
|
|
"epoch": 4.800432666306111,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0003327646052488425,
|
|
"loss": 4.6676,
|
|
"mean_token_accuracy": 0.23189338743686677,
|
|
"num_tokens": 9965356.0,
|
|
"step": 4440
|
|
},
|
|
{
|
|
"entropy": 5.14687933921814,
|
|
"epoch": 4.805840995132504,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0003323499578257873,
|
|
"loss": 4.83,
|
|
"mean_token_accuracy": 0.21911503374576569,
|
|
"num_tokens": 9977054.0,
|
|
"step": 4445
|
|
},
|
|
{
|
|
"entropy": 5.1645159244537355,
|
|
"epoch": 4.811249323958897,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00033193510199285286,
|
|
"loss": 4.8405,
|
|
"mean_token_accuracy": 0.2151738703250885,
|
|
"num_tokens": 9988051.0,
|
|
"step": 4450
|
|
},
|
|
{
|
|
"entropy": 5.200753784179687,
|
|
"epoch": 4.816657652785289,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00033152003925762615,
|
|
"loss": 4.7953,
|
|
"mean_token_accuracy": 0.21726018637418748,
|
|
"num_tokens": 9999056.0,
|
|
"step": 4455
|
|
},
|
|
{
|
|
"entropy": 5.282358074188233,
|
|
"epoch": 4.822065981611682,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0003311047711284462,
|
|
"loss": 4.8817,
|
|
"mean_token_accuracy": 0.21626786291599273,
|
|
"num_tokens": 10011109.0,
|
|
"step": 4460
|
|
},
|
|
{
|
|
"entropy": 5.221546268463134,
|
|
"epoch": 4.827474310438075,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0003306892991143983,
|
|
"loss": 4.9284,
|
|
"mean_token_accuracy": 0.21169961094856263,
|
|
"num_tokens": 10023170.0,
|
|
"step": 4465
|
|
},
|
|
{
|
|
"entropy": 5.22047266960144,
|
|
"epoch": 4.832882639264467,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0003302736247253087,
|
|
"loss": 4.8359,
|
|
"mean_token_accuracy": 0.21632813811302185,
|
|
"num_tokens": 10034607.0,
|
|
"step": 4470
|
|
},
|
|
{
|
|
"entropy": 5.145314455032349,
|
|
"epoch": 4.83829096809086,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.0003298577494717391,
|
|
"loss": 4.8211,
|
|
"mean_token_accuracy": 0.22303362488746642,
|
|
"num_tokens": 10047024.0,
|
|
"step": 4475
|
|
},
|
|
{
|
|
"entropy": 5.175536298751831,
|
|
"epoch": 4.8436992969172525,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0003294416748649812,
|
|
"loss": 4.7401,
|
|
"mean_token_accuracy": 0.21645448803901673,
|
|
"num_tokens": 10057693.0,
|
|
"step": 4480
|
|
},
|
|
{
|
|
"entropy": 5.120831727981567,
|
|
"epoch": 4.849107625743645,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.00032902540241705106,
|
|
"loss": 4.7641,
|
|
"mean_token_accuracy": 0.22694476693868637,
|
|
"num_tokens": 10069879.0,
|
|
"step": 4485
|
|
},
|
|
{
|
|
"entropy": 5.150848150253296,
|
|
"epoch": 4.854515954570038,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0003286089336406837,
|
|
"loss": 4.763,
|
|
"mean_token_accuracy": 0.2268701270222664,
|
|
"num_tokens": 10081045.0,
|
|
"step": 4490
|
|
},
|
|
{
|
|
"entropy": 5.233510255813599,
|
|
"epoch": 4.85992428339643,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00032819227004932745,
|
|
"loss": 4.8957,
|
|
"mean_token_accuracy": 0.2167412057518959,
|
|
"num_tokens": 10092156.0,
|
|
"step": 4495
|
|
},
|
|
{
|
|
"entropy": 5.207941675186158,
|
|
"epoch": 4.865332612222823,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.000327775413157139,
|
|
"loss": 4.8607,
|
|
"mean_token_accuracy": 0.21476806700229645,
|
|
"num_tokens": 10104338.0,
|
|
"step": 4500
|
|
},
|
|
{
|
|
"entropy": 5.146008253097534,
|
|
"epoch": 4.870740941049216,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0003273583644789772,
|
|
"loss": 4.7749,
|
|
"mean_token_accuracy": 0.2180731102824211,
|
|
"num_tokens": 10116374.0,
|
|
"step": 4505
|
|
},
|
|
{
|
|
"entropy": 5.24061598777771,
|
|
"epoch": 4.876149269875609,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.00032694112553039795,
|
|
"loss": 4.8887,
|
|
"mean_token_accuracy": 0.20935787856578827,
|
|
"num_tokens": 10128213.0,
|
|
"step": 4510
|
|
},
|
|
{
|
|
"entropy": 5.141972494125366,
|
|
"epoch": 4.881557598702001,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0003265236978276484,
|
|
"loss": 4.8019,
|
|
"mean_token_accuracy": 0.22588060796260834,
|
|
"num_tokens": 10139404.0,
|
|
"step": 4515
|
|
},
|
|
{
|
|
"entropy": 5.122133207321167,
|
|
"epoch": 4.886965927528394,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00032610608288766185,
|
|
"loss": 4.7715,
|
|
"mean_token_accuracy": 0.2216072142124176,
|
|
"num_tokens": 10150745.0,
|
|
"step": 4520
|
|
},
|
|
{
|
|
"entropy": 5.1891453742980955,
|
|
"epoch": 4.8923742563547865,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00032568828222805216,
|
|
"loss": 4.7483,
|
|
"mean_token_accuracy": 0.2245130404829979,
|
|
"num_tokens": 10162734.0,
|
|
"step": 4525
|
|
},
|
|
{
|
|
"entropy": 5.132432842254639,
|
|
"epoch": 4.897782585181179,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0003252702973671075,
|
|
"loss": 4.7191,
|
|
"mean_token_accuracy": 0.23531586676836014,
|
|
"num_tokens": 10174126.0,
|
|
"step": 4530
|
|
},
|
|
{
|
|
"entropy": 5.225213718414307,
|
|
"epoch": 4.903190914007571,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00032485212982378615,
|
|
"loss": 4.8914,
|
|
"mean_token_accuracy": 0.21589030772447587,
|
|
"num_tokens": 10185765.0,
|
|
"step": 4535
|
|
},
|
|
{
|
|
"entropy": 5.208063983917237,
|
|
"epoch": 4.908599242833964,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0003244337811177098,
|
|
"loss": 4.7643,
|
|
"mean_token_accuracy": 0.2168218731880188,
|
|
"num_tokens": 10196970.0,
|
|
"step": 4540
|
|
},
|
|
{
|
|
"entropy": 5.170761585235596,
|
|
"epoch": 4.914007571660357,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0003240152527691586,
|
|
"loss": 4.8783,
|
|
"mean_token_accuracy": 0.2151995062828064,
|
|
"num_tokens": 10209377.0,
|
|
"step": 4545
|
|
},
|
|
{
|
|
"entropy": 5.244362926483154,
|
|
"epoch": 4.91941590048675,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00032359654629906555,
|
|
"loss": 4.8713,
|
|
"mean_token_accuracy": 0.21505070626735687,
|
|
"num_tokens": 10219932.0,
|
|
"step": 4550
|
|
},
|
|
{
|
|
"entropy": 5.170259094238281,
|
|
"epoch": 4.924824229313142,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00032317766322901106,
|
|
"loss": 4.7427,
|
|
"mean_token_accuracy": 0.22210992872714996,
|
|
"num_tokens": 10231242.0,
|
|
"step": 4555
|
|
},
|
|
{
|
|
"entropy": 5.135043525695801,
|
|
"epoch": 4.930232558139535,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.000322758605081217,
|
|
"loss": 4.8041,
|
|
"mean_token_accuracy": 0.21644930690526962,
|
|
"num_tokens": 10241837.0,
|
|
"step": 4560
|
|
},
|
|
{
|
|
"entropy": 5.175659132003784,
|
|
"epoch": 4.935640886965928,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00032233937337854167,
|
|
"loss": 4.8148,
|
|
"mean_token_accuracy": 0.223362535238266,
|
|
"num_tokens": 10253037.0,
|
|
"step": 4565
|
|
},
|
|
{
|
|
"entropy": 5.2676169872283936,
|
|
"epoch": 4.9410492157923205,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.0003219199696444741,
|
|
"loss": 4.8368,
|
|
"mean_token_accuracy": 0.21570803821086884,
|
|
"num_tokens": 10265286.0,
|
|
"step": 4570
|
|
},
|
|
{
|
|
"entropy": 5.232824230194092,
|
|
"epoch": 4.9464575446187125,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00032150039540312843,
|
|
"loss": 4.8861,
|
|
"mean_token_accuracy": 0.22036712020635604,
|
|
"num_tokens": 10275563.0,
|
|
"step": 4575
|
|
},
|
|
{
|
|
"entropy": 5.112751483917236,
|
|
"epoch": 4.951865873445105,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00032108065217923836,
|
|
"loss": 4.8189,
|
|
"mean_token_accuracy": 0.21947121322155,
|
|
"num_tokens": 10287335.0,
|
|
"step": 4580
|
|
},
|
|
{
|
|
"entropy": 5.149396467208862,
|
|
"epoch": 4.957274202271498,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00032066074149815184,
|
|
"loss": 4.8412,
|
|
"mean_token_accuracy": 0.2221337303519249,
|
|
"num_tokens": 10298816.0,
|
|
"step": 4585
|
|
},
|
|
{
|
|
"entropy": 5.192917919158935,
|
|
"epoch": 4.962682531097891,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00032024066488582517,
|
|
"loss": 4.7764,
|
|
"mean_token_accuracy": 0.22156908065080644,
|
|
"num_tokens": 10309018.0,
|
|
"step": 4590
|
|
},
|
|
{
|
|
"entropy": 5.179701280593872,
|
|
"epoch": 4.968090859924283,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0003198204238688178,
|
|
"loss": 4.8037,
|
|
"mean_token_accuracy": 0.22356087863445281,
|
|
"num_tokens": 10320653.0,
|
|
"step": 4595
|
|
},
|
|
{
|
|
"entropy": 5.1929848194122314,
|
|
"epoch": 4.973499188750676,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00031940001997428645,
|
|
"loss": 4.8014,
|
|
"mean_token_accuracy": 0.22206042110919952,
|
|
"num_tokens": 10330978.0,
|
|
"step": 4600
|
|
},
|
|
{
|
|
"entropy": 5.131814289093017,
|
|
"epoch": 4.978907517577069,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00031897945472997996,
|
|
"loss": 4.8089,
|
|
"mean_token_accuracy": 0.22218139320611954,
|
|
"num_tokens": 10342395.0,
|
|
"step": 4605
|
|
},
|
|
{
|
|
"entropy": 5.196309185028076,
|
|
"epoch": 4.984315846403462,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0003185587296642333,
|
|
"loss": 4.8273,
|
|
"mean_token_accuracy": 0.2258658915758133,
|
|
"num_tokens": 10353737.0,
|
|
"step": 4610
|
|
},
|
|
{
|
|
"entropy": 5.211770248413086,
|
|
"epoch": 4.9897241752298545,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0003181378463059625,
|
|
"loss": 4.7893,
|
|
"mean_token_accuracy": 0.2209434911608696,
|
|
"num_tokens": 10363697.0,
|
|
"step": 4615
|
|
},
|
|
{
|
|
"entropy": 5.174803876876831,
|
|
"epoch": 4.995132504056246,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0003177168061846584,
|
|
"loss": 4.8957,
|
|
"mean_token_accuracy": 0.2160748139023781,
|
|
"num_tokens": 10375319.0,
|
|
"step": 4620
|
|
},
|
|
{
|
|
"entropy": 5.116295708550347,
|
|
"epoch": 5.0,
|
|
"grad_norm": 1.921875,
|
|
"learning_rate": 0.0003172956108303819,
|
|
"loss": 4.814,
|
|
"mean_token_accuracy": 0.2170393533176846,
|
|
"num_tokens": 10384445.0,
|
|
"step": 4625
|
|
},
|
|
{
|
|
"entropy": 5.238847255706787,
|
|
"epoch": 5.005408328826393,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.0003168742617737579,
|
|
"loss": 4.5691,
|
|
"mean_token_accuracy": 0.23728263676166533,
|
|
"num_tokens": 10396437.0,
|
|
"step": 4630
|
|
},
|
|
{
|
|
"entropy": 5.204702138900757,
|
|
"epoch": 5.010816657652786,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00031645276054597006,
|
|
"loss": 4.5667,
|
|
"mean_token_accuracy": 0.2375429168343544,
|
|
"num_tokens": 10407369.0,
|
|
"step": 4635
|
|
},
|
|
{
|
|
"entropy": 5.085882234573364,
|
|
"epoch": 5.016224986479178,
|
|
"grad_norm": 1.015625,
|
|
"learning_rate": 0.00031603110867875435,
|
|
"loss": 4.4558,
|
|
"mean_token_accuracy": 0.23949326425790787,
|
|
"num_tokens": 10417527.0,
|
|
"step": 4640
|
|
},
|
|
{
|
|
"entropy": 5.012197780609131,
|
|
"epoch": 5.0216333153055706,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.000315609307704395,
|
|
"loss": 4.4689,
|
|
"mean_token_accuracy": 0.24451786577701567,
|
|
"num_tokens": 10428281.0,
|
|
"step": 4645
|
|
},
|
|
{
|
|
"entropy": 5.044778108596802,
|
|
"epoch": 5.027041644131963,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0003151873591557176,
|
|
"loss": 4.4426,
|
|
"mean_token_accuracy": 0.243398953974247,
|
|
"num_tokens": 10439366.0,
|
|
"step": 4650
|
|
},
|
|
{
|
|
"entropy": 5.113741016387939,
|
|
"epoch": 5.032449972958356,
|
|
"grad_norm": 1.0234375,
|
|
"learning_rate": 0.00031476526456608415,
|
|
"loss": 4.575,
|
|
"mean_token_accuracy": 0.23537073731422425,
|
|
"num_tokens": 10452074.0,
|
|
"step": 4655
|
|
},
|
|
{
|
|
"entropy": 5.181456089019775,
|
|
"epoch": 5.037858301784748,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0003143430254693873,
|
|
"loss": 4.5527,
|
|
"mean_token_accuracy": 0.23576689809560775,
|
|
"num_tokens": 10461940.0,
|
|
"step": 4660
|
|
},
|
|
{
|
|
"entropy": 5.082711887359619,
|
|
"epoch": 5.043266630611141,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0003139206434000451,
|
|
"loss": 4.5211,
|
|
"mean_token_accuracy": 0.23467014580965043,
|
|
"num_tokens": 10473175.0,
|
|
"step": 4665
|
|
},
|
|
{
|
|
"entropy": 5.158622694015503,
|
|
"epoch": 5.048674959437534,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0003134981198929948,
|
|
"loss": 4.5545,
|
|
"mean_token_accuracy": 0.22886019051074982,
|
|
"num_tokens": 10484977.0,
|
|
"step": 4670
|
|
},
|
|
{
|
|
"entropy": 5.163059234619141,
|
|
"epoch": 5.054083288263927,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00031307545648368777,
|
|
"loss": 4.5321,
|
|
"mean_token_accuracy": 0.23974120765924453,
|
|
"num_tokens": 10495924.0,
|
|
"step": 4675
|
|
},
|
|
{
|
|
"entropy": 5.099232864379883,
|
|
"epoch": 5.059491617090319,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00031265265470808393,
|
|
"loss": 4.5614,
|
|
"mean_token_accuracy": 0.23395949751138687,
|
|
"num_tokens": 10508374.0,
|
|
"step": 4680
|
|
},
|
|
{
|
|
"entropy": 5.054331731796265,
|
|
"epoch": 5.064899945916712,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00031222971610264595,
|
|
"loss": 4.4745,
|
|
"mean_token_accuracy": 0.24568151980638503,
|
|
"num_tokens": 10519704.0,
|
|
"step": 4685
|
|
},
|
|
{
|
|
"entropy": 5.145371770858764,
|
|
"epoch": 5.0703082747431045,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00031180664220433347,
|
|
"loss": 4.5883,
|
|
"mean_token_accuracy": 0.23278012424707412,
|
|
"num_tokens": 10531717.0,
|
|
"step": 4690
|
|
},
|
|
{
|
|
"entropy": 5.085246515274048,
|
|
"epoch": 5.075716603569497,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00031138343455059823,
|
|
"loss": 4.5455,
|
|
"mean_token_accuracy": 0.23857734203338624,
|
|
"num_tokens": 10542941.0,
|
|
"step": 4695
|
|
},
|
|
{
|
|
"entropy": 5.108962059020996,
|
|
"epoch": 5.081124932395889,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0003109600946793778,
|
|
"loss": 4.4763,
|
|
"mean_token_accuracy": 0.24454210102558135,
|
|
"num_tokens": 10553877.0,
|
|
"step": 4700
|
|
},
|
|
{
|
|
"entropy": 5.1225074291229244,
|
|
"epoch": 5.086533261222282,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00031053662412909024,
|
|
"loss": 4.4652,
|
|
"mean_token_accuracy": 0.2461608022451401,
|
|
"num_tokens": 10566123.0,
|
|
"step": 4705
|
|
},
|
|
{
|
|
"entropy": 5.052347564697266,
|
|
"epoch": 5.091941590048675,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0003101130244386283,
|
|
"loss": 4.5075,
|
|
"mean_token_accuracy": 0.24042530804872514,
|
|
"num_tokens": 10576972.0,
|
|
"step": 4710
|
|
},
|
|
{
|
|
"entropy": 5.133987617492676,
|
|
"epoch": 5.097349918875068,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00030968929714735456,
|
|
"loss": 4.5264,
|
|
"mean_token_accuracy": 0.2366169273853302,
|
|
"num_tokens": 10588708.0,
|
|
"step": 4715
|
|
},
|
|
{
|
|
"entropy": 5.115154647827149,
|
|
"epoch": 5.10275824770146,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0003092654437950947,
|
|
"loss": 4.5441,
|
|
"mean_token_accuracy": 0.23340435177087784,
|
|
"num_tokens": 10599410.0,
|
|
"step": 4720
|
|
},
|
|
{
|
|
"entropy": 5.219666385650635,
|
|
"epoch": 5.108166576527853,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0003088414659221331,
|
|
"loss": 4.6635,
|
|
"mean_token_accuracy": 0.22346747666597366,
|
|
"num_tokens": 10612284.0,
|
|
"step": 4725
|
|
},
|
|
{
|
|
"entropy": 5.0701343536376955,
|
|
"epoch": 5.113574905354246,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.000308417365069206,
|
|
"loss": 4.5183,
|
|
"mean_token_accuracy": 0.24242762327194214,
|
|
"num_tokens": 10623065.0,
|
|
"step": 4730
|
|
},
|
|
{
|
|
"entropy": 5.147444248199463,
|
|
"epoch": 5.1189832341806385,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00030799314277749697,
|
|
"loss": 4.5371,
|
|
"mean_token_accuracy": 0.24343049228191377,
|
|
"num_tokens": 10634574.0,
|
|
"step": 4735
|
|
},
|
|
{
|
|
"entropy": 5.171050119400024,
|
|
"epoch": 5.1243915630070305,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00030756880058863085,
|
|
"loss": 4.6206,
|
|
"mean_token_accuracy": 0.23264120370149613,
|
|
"num_tokens": 10645765.0,
|
|
"step": 4740
|
|
},
|
|
{
|
|
"entropy": 5.119320726394653,
|
|
"epoch": 5.129799891833423,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.00030714434004466823,
|
|
"loss": 4.5116,
|
|
"mean_token_accuracy": 0.24276455491781235,
|
|
"num_tokens": 10655901.0,
|
|
"step": 4745
|
|
},
|
|
{
|
|
"entropy": 5.227843856811523,
|
|
"epoch": 5.135208220659816,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00030671976268809947,
|
|
"loss": 4.7132,
|
|
"mean_token_accuracy": 0.22757336050271987,
|
|
"num_tokens": 10668030.0,
|
|
"step": 4750
|
|
},
|
|
{
|
|
"entropy": 5.1313238620758055,
|
|
"epoch": 5.140616549486209,
|
|
"grad_norm": 1.0625,
|
|
"learning_rate": 0.00030629507006183995,
|
|
"loss": 4.6016,
|
|
"mean_token_accuracy": 0.23523004949092866,
|
|
"num_tokens": 10681056.0,
|
|
"step": 4755
|
|
},
|
|
{
|
|
"entropy": 5.189333391189575,
|
|
"epoch": 5.146024878312601,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0003058702637092234,
|
|
"loss": 4.6499,
|
|
"mean_token_accuracy": 0.2233363226056099,
|
|
"num_tokens": 10692160.0,
|
|
"step": 4760
|
|
},
|
|
{
|
|
"entropy": 5.162896585464478,
|
|
"epoch": 5.151433207138994,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00030544534517399724,
|
|
"loss": 4.57,
|
|
"mean_token_accuracy": 0.23276271671056747,
|
|
"num_tokens": 10703253.0,
|
|
"step": 4765
|
|
},
|
|
{
|
|
"entropy": 5.137832689285278,
|
|
"epoch": 5.156841535965387,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0003050203160003163,
|
|
"loss": 4.5672,
|
|
"mean_token_accuracy": 0.23495166301727294,
|
|
"num_tokens": 10714154.0,
|
|
"step": 4770
|
|
},
|
|
{
|
|
"entropy": 5.098254823684693,
|
|
"epoch": 5.16224986479178,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0003045951777327377,
|
|
"loss": 4.4893,
|
|
"mean_token_accuracy": 0.2435910999774933,
|
|
"num_tokens": 10726735.0,
|
|
"step": 4775
|
|
},
|
|
{
|
|
"entropy": 5.097394609451294,
|
|
"epoch": 5.167658193618172,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0003041699319162148,
|
|
"loss": 4.5748,
|
|
"mean_token_accuracy": 0.24261797219514847,
|
|
"num_tokens": 10737536.0,
|
|
"step": 4780
|
|
},
|
|
{
|
|
"entropy": 4.9923089981079105,
|
|
"epoch": 5.173066522444564,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.00030374458009609193,
|
|
"loss": 4.5363,
|
|
"mean_token_accuracy": 0.23299431949853897,
|
|
"num_tokens": 10747354.0,
|
|
"step": 4785
|
|
},
|
|
{
|
|
"entropy": 5.16452956199646,
|
|
"epoch": 5.178474851270957,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.0003033191238180985,
|
|
"loss": 4.5927,
|
|
"mean_token_accuracy": 0.23733182847499848,
|
|
"num_tokens": 10757022.0,
|
|
"step": 4790
|
|
},
|
|
{
|
|
"entropy": 5.186676454544068,
|
|
"epoch": 5.18388318009735,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0003028935646283438,
|
|
"loss": 4.6015,
|
|
"mean_token_accuracy": 0.2369183361530304,
|
|
"num_tokens": 10768485.0,
|
|
"step": 4795
|
|
},
|
|
{
|
|
"entropy": 5.111834764480591,
|
|
"epoch": 5.189291508923742,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00030246790407331063,
|
|
"loss": 4.5177,
|
|
"mean_token_accuracy": 0.23588780611753463,
|
|
"num_tokens": 10779164.0,
|
|
"step": 4800
|
|
},
|
|
{
|
|
"entropy": 5.110886144638061,
|
|
"epoch": 5.194699837750135,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00030204214369985066,
|
|
"loss": 4.611,
|
|
"mean_token_accuracy": 0.23651799112558364,
|
|
"num_tokens": 10790986.0,
|
|
"step": 4805
|
|
},
|
|
{
|
|
"entropy": 5.150386667251587,
|
|
"epoch": 5.200108166576528,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00030161628505517797,
|
|
"loss": 4.567,
|
|
"mean_token_accuracy": 0.24198322594165803,
|
|
"num_tokens": 10803456.0,
|
|
"step": 4810
|
|
},
|
|
{
|
|
"entropy": 5.091692543029785,
|
|
"epoch": 5.205516495402921,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.00030119032968686397,
|
|
"loss": 4.5264,
|
|
"mean_token_accuracy": 0.24162456393241882,
|
|
"num_tokens": 10814884.0,
|
|
"step": 4815
|
|
},
|
|
{
|
|
"entropy": 5.146925687789917,
|
|
"epoch": 5.210924824229313,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00030076427914283127,
|
|
"loss": 4.5666,
|
|
"mean_token_accuracy": 0.23257468938827514,
|
|
"num_tokens": 10825006.0,
|
|
"step": 4820
|
|
},
|
|
{
|
|
"entropy": 5.039157390594482,
|
|
"epoch": 5.2163331530557056,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.00030033813497134864,
|
|
"loss": 4.5203,
|
|
"mean_token_accuracy": 0.24057147949934005,
|
|
"num_tokens": 10834697.0,
|
|
"step": 4825
|
|
},
|
|
{
|
|
"entropy": 5.098128366470337,
|
|
"epoch": 5.221741481882098,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.000299911898721025,
|
|
"loss": 4.599,
|
|
"mean_token_accuracy": 0.23328943699598312,
|
|
"num_tokens": 10845954.0,
|
|
"step": 4830
|
|
},
|
|
{
|
|
"entropy": 5.17861156463623,
|
|
"epoch": 5.227149810708491,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00029948557194080385,
|
|
"loss": 4.5884,
|
|
"mean_token_accuracy": 0.23492339104413987,
|
|
"num_tokens": 10858463.0,
|
|
"step": 4835
|
|
},
|
|
{
|
|
"entropy": 5.1870606422424315,
|
|
"epoch": 5.232558139534884,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 0.0002990591561799576,
|
|
"loss": 4.6591,
|
|
"mean_token_accuracy": 0.22013484686613083,
|
|
"num_tokens": 10870329.0,
|
|
"step": 4840
|
|
},
|
|
{
|
|
"entropy": 5.102496337890625,
|
|
"epoch": 5.237966468361276,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0002986326529880823,
|
|
"loss": 4.5555,
|
|
"mean_token_accuracy": 0.23047195971012116,
|
|
"num_tokens": 10881443.0,
|
|
"step": 4845
|
|
},
|
|
{
|
|
"entropy": 5.122408819198609,
|
|
"epoch": 5.243374797187669,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.0002982060639150913,
|
|
"loss": 4.6344,
|
|
"mean_token_accuracy": 0.22991830259561538,
|
|
"num_tokens": 10894102.0,
|
|
"step": 4850
|
|
},
|
|
{
|
|
"entropy": 5.168514251708984,
|
|
"epoch": 5.248783126014062,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0002977793905112106,
|
|
"loss": 4.625,
|
|
"mean_token_accuracy": 0.23717804998159409,
|
|
"num_tokens": 10904914.0,
|
|
"step": 4855
|
|
},
|
|
{
|
|
"entropy": 5.074016523361206,
|
|
"epoch": 5.254191454840455,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00029735263432697183,
|
|
"loss": 4.468,
|
|
"mean_token_accuracy": 0.24763923585414888,
|
|
"num_tokens": 10916036.0,
|
|
"step": 4860
|
|
},
|
|
{
|
|
"entropy": 5.112421274185181,
|
|
"epoch": 5.259599783666847,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.0002969257969132085,
|
|
"loss": 4.6181,
|
|
"mean_token_accuracy": 0.23973572254180908,
|
|
"num_tokens": 10926852.0,
|
|
"step": 4865
|
|
},
|
|
{
|
|
"entropy": 5.091146469116211,
|
|
"epoch": 5.2650081124932395,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 0.0002964988798210485,
|
|
"loss": 4.5821,
|
|
"mean_token_accuracy": 0.2380119353532791,
|
|
"num_tokens": 10937370.0,
|
|
"step": 4870
|
|
},
|
|
{
|
|
"entropy": 5.145650339126587,
|
|
"epoch": 5.270416441319632,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0002960718846019095,
|
|
"loss": 4.5625,
|
|
"mean_token_accuracy": 0.24356661587953568,
|
|
"num_tokens": 10948835.0,
|
|
"step": 4875
|
|
},
|
|
{
|
|
"entropy": 5.092243242263794,
|
|
"epoch": 5.275824770146025,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0002956448128074931,
|
|
"loss": 4.5043,
|
|
"mean_token_accuracy": 0.23767364025115967,
|
|
"num_tokens": 10958553.0,
|
|
"step": 4880
|
|
},
|
|
{
|
|
"entropy": 5.024548006057739,
|
|
"epoch": 5.281233098972417,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0002952176659897794,
|
|
"loss": 4.5111,
|
|
"mean_token_accuracy": 0.2386179208755493,
|
|
"num_tokens": 10970063.0,
|
|
"step": 4885
|
|
},
|
|
{
|
|
"entropy": 5.1151021957397464,
|
|
"epoch": 5.28664142779881,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0002947904457010207,
|
|
"loss": 4.5561,
|
|
"mean_token_accuracy": 0.23923205584287643,
|
|
"num_tokens": 10981011.0,
|
|
"step": 4890
|
|
},
|
|
{
|
|
"entropy": 5.198963975906372,
|
|
"epoch": 5.292049756625203,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0002943631534937366,
|
|
"loss": 4.6142,
|
|
"mean_token_accuracy": 0.22557153850793837,
|
|
"num_tokens": 10993337.0,
|
|
"step": 4895
|
|
},
|
|
{
|
|
"entropy": 5.0785270690917965,
|
|
"epoch": 5.297458085451596,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0002939357909207079,
|
|
"loss": 4.5482,
|
|
"mean_token_accuracy": 0.2385883703827858,
|
|
"num_tokens": 11003646.0,
|
|
"step": 4900
|
|
},
|
|
{
|
|
"entropy": 5.081256151199341,
|
|
"epoch": 5.302866414277988,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0002935083595349713,
|
|
"loss": 4.5205,
|
|
"mean_token_accuracy": 0.24443619400262834,
|
|
"num_tokens": 11014249.0,
|
|
"step": 4905
|
|
},
|
|
{
|
|
"entropy": 5.134830904006958,
|
|
"epoch": 5.308274743104381,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00029308086088981335,
|
|
"loss": 4.5709,
|
|
"mean_token_accuracy": 0.23936382979154586,
|
|
"num_tokens": 11025997.0,
|
|
"step": 4910
|
|
},
|
|
{
|
|
"entropy": 5.095680618286133,
|
|
"epoch": 5.3136830719307735,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00029265329653876515,
|
|
"loss": 4.4915,
|
|
"mean_token_accuracy": 0.2470926374197006,
|
|
"num_tokens": 11036815.0,
|
|
"step": 4915
|
|
},
|
|
{
|
|
"entropy": 5.1458740234375,
|
|
"epoch": 5.319091400757166,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0002922256680355965,
|
|
"loss": 4.6738,
|
|
"mean_token_accuracy": 0.2303202599287033,
|
|
"num_tokens": 11048390.0,
|
|
"step": 4920
|
|
},
|
|
{
|
|
"entropy": 5.0420708656311035,
|
|
"epoch": 5.324499729583558,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.00029179797693431046,
|
|
"loss": 4.5042,
|
|
"mean_token_accuracy": 0.24472840279340743,
|
|
"num_tokens": 11059410.0,
|
|
"step": 4925
|
|
},
|
|
{
|
|
"entropy": 5.162745952606201,
|
|
"epoch": 5.329908058409951,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0002913702247891374,
|
|
"loss": 4.5853,
|
|
"mean_token_accuracy": 0.22566224187612532,
|
|
"num_tokens": 11069509.0,
|
|
"step": 4930
|
|
},
|
|
{
|
|
"entropy": 5.071948909759522,
|
|
"epoch": 5.335316387236344,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0002909424131545296,
|
|
"loss": 4.479,
|
|
"mean_token_accuracy": 0.24245238155126572,
|
|
"num_tokens": 11080204.0,
|
|
"step": 4935
|
|
},
|
|
{
|
|
"entropy": 5.166419792175293,
|
|
"epoch": 5.340724716062737,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00029051454358515553,
|
|
"loss": 4.6862,
|
|
"mean_token_accuracy": 0.22651290148496628,
|
|
"num_tokens": 11091130.0,
|
|
"step": 4940
|
|
},
|
|
{
|
|
"entropy": 5.118738889694214,
|
|
"epoch": 5.346133044889129,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00029008661763589436,
|
|
"loss": 4.6062,
|
|
"mean_token_accuracy": 0.2306537449359894,
|
|
"num_tokens": 11101853.0,
|
|
"step": 4945
|
|
},
|
|
{
|
|
"entropy": 5.130676221847534,
|
|
"epoch": 5.351541373715522,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0002896586368618297,
|
|
"loss": 4.5585,
|
|
"mean_token_accuracy": 0.234729540348053,
|
|
"num_tokens": 11113092.0,
|
|
"step": 4950
|
|
},
|
|
{
|
|
"entropy": 5.10734806060791,
|
|
"epoch": 5.356949702541915,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00028923060281824483,
|
|
"loss": 4.6407,
|
|
"mean_token_accuracy": 0.2330939382314682,
|
|
"num_tokens": 11123756.0,
|
|
"step": 4955
|
|
},
|
|
{
|
|
"entropy": 5.1769123554229735,
|
|
"epoch": 5.3623580313683075,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0002888025170606165,
|
|
"loss": 4.6028,
|
|
"mean_token_accuracy": 0.22955313324928284,
|
|
"num_tokens": 11135493.0,
|
|
"step": 4960
|
|
},
|
|
{
|
|
"entropy": 5.083680295944214,
|
|
"epoch": 5.367766360194699,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00028837438114460924,
|
|
"loss": 4.5537,
|
|
"mean_token_accuracy": 0.23917055875062943,
|
|
"num_tokens": 11146323.0,
|
|
"step": 4965
|
|
},
|
|
{
|
|
"entropy": 5.0477190017700195,
|
|
"epoch": 5.373174689021092,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0002879461966260699,
|
|
"loss": 4.5592,
|
|
"mean_token_accuracy": 0.23870966732501983,
|
|
"num_tokens": 11157434.0,
|
|
"step": 4970
|
|
},
|
|
{
|
|
"entropy": 5.092014265060425,
|
|
"epoch": 5.378583017847485,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00028751796506102224,
|
|
"loss": 4.579,
|
|
"mean_token_accuracy": 0.23468010872602463,
|
|
"num_tokens": 11169096.0,
|
|
"step": 4975
|
|
},
|
|
{
|
|
"entropy": 5.095512008666992,
|
|
"epoch": 5.383991346673878,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00028708968800566056,
|
|
"loss": 4.5154,
|
|
"mean_token_accuracy": 0.23920983970165252,
|
|
"num_tokens": 11180260.0,
|
|
"step": 4980
|
|
},
|
|
{
|
|
"entropy": 5.107637786865235,
|
|
"epoch": 5.38939967550027,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00028666136701634474,
|
|
"loss": 4.5426,
|
|
"mean_token_accuracy": 0.24653149843215943,
|
|
"num_tokens": 11191843.0,
|
|
"step": 4985
|
|
},
|
|
{
|
|
"entropy": 5.098368978500366,
|
|
"epoch": 5.394808004326663,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0002862330036495942,
|
|
"loss": 4.5658,
|
|
"mean_token_accuracy": 0.24045238494873047,
|
|
"num_tokens": 11202850.0,
|
|
"step": 4990
|
|
},
|
|
{
|
|
"entropy": 5.0349040031433105,
|
|
"epoch": 5.400216333153056,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0002858045994620825,
|
|
"loss": 4.4996,
|
|
"mean_token_accuracy": 0.23996165841817857,
|
|
"num_tokens": 11215030.0,
|
|
"step": 4995
|
|
},
|
|
{
|
|
"entropy": 5.007499742507934,
|
|
"epoch": 5.405624661979449,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00028537615601063133,
|
|
"loss": 4.444,
|
|
"mean_token_accuracy": 0.24101929515600204,
|
|
"num_tokens": 11225917.0,
|
|
"step": 5000
|
|
},
|
|
{
|
|
"epoch": 5.405624661979449,
|
|
"eval_entropy": 5.025897739150308,
|
|
"eval_loss": 5.854259490966797,
|
|
"eval_mean_token_accuracy": 0.18258314691483973,
|
|
"eval_num_tokens": 11225917.0,
|
|
"eval_runtime": 2.501,
|
|
"eval_samples_per_second": 1405.414,
|
|
"eval_steps_per_second": 175.927,
|
|
"step": 5000
|
|
},
|
|
{
|
|
"entropy": 5.093756628036499,
|
|
"epoch": 5.411032990805841,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0002849476748522052,
|
|
"loss": 4.6827,
|
|
"mean_token_accuracy": 0.22344067245721816,
|
|
"num_tokens": 11237744.0,
|
|
"step": 5005
|
|
},
|
|
{
|
|
"entropy": 5.166733264923096,
|
|
"epoch": 5.416441319632233,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0002845191575439057,
|
|
"loss": 4.5608,
|
|
"mean_token_accuracy": 0.23659120351076127,
|
|
"num_tokens": 11248294.0,
|
|
"step": 5010
|
|
},
|
|
{
|
|
"entropy": 5.071858692169189,
|
|
"epoch": 5.421849648458626,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.0002840906056429658,
|
|
"loss": 4.543,
|
|
"mean_token_accuracy": 0.2445327654480934,
|
|
"num_tokens": 11259483.0,
|
|
"step": 5015
|
|
},
|
|
{
|
|
"entropy": 5.0410778522491455,
|
|
"epoch": 5.427257977285019,
|
|
"grad_norm": 1.0390625,
|
|
"learning_rate": 0.0002836620207067439,
|
|
"loss": 4.6533,
|
|
"mean_token_accuracy": 0.23245096653699876,
|
|
"num_tokens": 11270965.0,
|
|
"step": 5020
|
|
},
|
|
{
|
|
"entropy": 5.1253478050231935,
|
|
"epoch": 5.432666306111411,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00028323340429271875,
|
|
"loss": 4.5916,
|
|
"mean_token_accuracy": 0.2355559289455414,
|
|
"num_tokens": 11281390.0,
|
|
"step": 5025
|
|
},
|
|
{
|
|
"entropy": 5.158014965057373,
|
|
"epoch": 5.438074634937804,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.0002828047579584833,
|
|
"loss": 4.5996,
|
|
"mean_token_accuracy": 0.235298053920269,
|
|
"num_tokens": 11291801.0,
|
|
"step": 5030
|
|
},
|
|
{
|
|
"entropy": 5.028060054779052,
|
|
"epoch": 5.443482963764197,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00028237608326173944,
|
|
"loss": 4.5475,
|
|
"mean_token_accuracy": 0.23873327672481537,
|
|
"num_tokens": 11302807.0,
|
|
"step": 5035
|
|
},
|
|
{
|
|
"entropy": 5.133496522903442,
|
|
"epoch": 5.44889129259059,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00028194738176029206,
|
|
"loss": 4.5827,
|
|
"mean_token_accuracy": 0.237274831533432,
|
|
"num_tokens": 11314690.0,
|
|
"step": 5040
|
|
},
|
|
{
|
|
"entropy": 5.043130207061767,
|
|
"epoch": 5.4542996214169825,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00028151865501204316,
|
|
"loss": 4.5561,
|
|
"mean_token_accuracy": 0.23939095735549926,
|
|
"num_tokens": 11325887.0,
|
|
"step": 5045
|
|
},
|
|
{
|
|
"entropy": 5.0096173763275145,
|
|
"epoch": 5.4597079502433745,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00028108990457498696,
|
|
"loss": 4.6158,
|
|
"mean_token_accuracy": 0.23323608338832855,
|
|
"num_tokens": 11337609.0,
|
|
"step": 5050
|
|
},
|
|
{
|
|
"entropy": 5.127987098693848,
|
|
"epoch": 5.465116279069767,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00028066113200720343,
|
|
"loss": 4.4907,
|
|
"mean_token_accuracy": 0.2452102333307266,
|
|
"num_tokens": 11348982.0,
|
|
"step": 5055
|
|
},
|
|
{
|
|
"entropy": 5.180063676834107,
|
|
"epoch": 5.47052460789616,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00028023233886685314,
|
|
"loss": 4.6829,
|
|
"mean_token_accuracy": 0.2316138207912445,
|
|
"num_tokens": 11362029.0,
|
|
"step": 5060
|
|
},
|
|
{
|
|
"entropy": 5.082441329956055,
|
|
"epoch": 5.475932936722553,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0002798035267121713,
|
|
"loss": 4.5652,
|
|
"mean_token_accuracy": 0.23488624393939972,
|
|
"num_tokens": 11372557.0,
|
|
"step": 5065
|
|
},
|
|
{
|
|
"entropy": 5.116550159454346,
|
|
"epoch": 5.481341265548945,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0002793746971014623,
|
|
"loss": 4.5782,
|
|
"mean_token_accuracy": 0.23954371213912964,
|
|
"num_tokens": 11383420.0,
|
|
"step": 5070
|
|
},
|
|
{
|
|
"entropy": 5.0962498664855955,
|
|
"epoch": 5.486749594375338,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0002789458515930939,
|
|
"loss": 4.5219,
|
|
"mean_token_accuracy": 0.23744451254606247,
|
|
"num_tokens": 11395253.0,
|
|
"step": 5075
|
|
},
|
|
{
|
|
"entropy": 5.032715129852295,
|
|
"epoch": 5.492157923201731,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00027851699174549164,
|
|
"loss": 4.5773,
|
|
"mean_token_accuracy": 0.2320207104086876,
|
|
"num_tokens": 11407411.0,
|
|
"step": 5080
|
|
},
|
|
{
|
|
"entropy": 5.140994262695313,
|
|
"epoch": 5.497566252028124,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0002780881191171333,
|
|
"loss": 4.615,
|
|
"mean_token_accuracy": 0.22736505120992662,
|
|
"num_tokens": 11417742.0,
|
|
"step": 5085
|
|
},
|
|
{
|
|
"entropy": 5.0546506404876705,
|
|
"epoch": 5.502974580854516,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00027765923526654304,
|
|
"loss": 4.5209,
|
|
"mean_token_accuracy": 0.23477157056331635,
|
|
"num_tokens": 11428948.0,
|
|
"step": 5090
|
|
},
|
|
{
|
|
"entropy": 5.054863119125367,
|
|
"epoch": 5.5083829096809085,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00027723034175228554,
|
|
"loss": 4.5463,
|
|
"mean_token_accuracy": 0.23661569207906724,
|
|
"num_tokens": 11440246.0,
|
|
"step": 5095
|
|
},
|
|
{
|
|
"entropy": 5.048584794998169,
|
|
"epoch": 5.513791238507301,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.000276801440132961,
|
|
"loss": 4.5329,
|
|
"mean_token_accuracy": 0.24560239017009736,
|
|
"num_tokens": 11451984.0,
|
|
"step": 5100
|
|
},
|
|
{
|
|
"entropy": 5.17749514579773,
|
|
"epoch": 5.519199567333694,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0002763725319671989,
|
|
"loss": 4.6634,
|
|
"mean_token_accuracy": 0.23412647545337678,
|
|
"num_tokens": 11462763.0,
|
|
"step": 5105
|
|
},
|
|
{
|
|
"entropy": 5.152378559112549,
|
|
"epoch": 5.524607896160086,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0002759436188136525,
|
|
"loss": 4.6209,
|
|
"mean_token_accuracy": 0.2340094581246376,
|
|
"num_tokens": 11474375.0,
|
|
"step": 5110
|
|
},
|
|
{
|
|
"entropy": 5.162030458450317,
|
|
"epoch": 5.530016224986479,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00027551470223099306,
|
|
"loss": 4.5804,
|
|
"mean_token_accuracy": 0.23582287579774858,
|
|
"num_tokens": 11484846.0,
|
|
"step": 5115
|
|
},
|
|
{
|
|
"entropy": 5.085168123245239,
|
|
"epoch": 5.535424553812872,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0002750857837779045,
|
|
"loss": 4.6125,
|
|
"mean_token_accuracy": 0.2338113233447075,
|
|
"num_tokens": 11495970.0,
|
|
"step": 5120
|
|
},
|
|
{
|
|
"entropy": 5.131478214263916,
|
|
"epoch": 5.540832882639265,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0002746568650130775,
|
|
"loss": 4.602,
|
|
"mean_token_accuracy": 0.239996737241745,
|
|
"num_tokens": 11507172.0,
|
|
"step": 5125
|
|
},
|
|
{
|
|
"entropy": 5.063758850097656,
|
|
"epoch": 5.546241211465657,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0002742279474952039,
|
|
"loss": 4.5921,
|
|
"mean_token_accuracy": 0.2350480154156685,
|
|
"num_tokens": 11518400.0,
|
|
"step": 5130
|
|
},
|
|
{
|
|
"entropy": 5.166097927093506,
|
|
"epoch": 5.55164954029205,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00027379903278297086,
|
|
"loss": 4.6047,
|
|
"mean_token_accuracy": 0.23305439949035645,
|
|
"num_tokens": 11528993.0,
|
|
"step": 5135
|
|
},
|
|
{
|
|
"entropy": 5.123815202713013,
|
|
"epoch": 5.5570578691184425,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.00027337012243505536,
|
|
"loss": 4.6256,
|
|
"mean_token_accuracy": 0.2337266683578491,
|
|
"num_tokens": 11540783.0,
|
|
"step": 5140
|
|
},
|
|
{
|
|
"entropy": 5.022006273269653,
|
|
"epoch": 5.562466197944835,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00027294121801011887,
|
|
"loss": 4.5714,
|
|
"mean_token_accuracy": 0.23104532063007355,
|
|
"num_tokens": 11551758.0,
|
|
"step": 5145
|
|
},
|
|
{
|
|
"entropy": 5.148687028884888,
|
|
"epoch": 5.567874526771227,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.00027251232106680084,
|
|
"loss": 4.5551,
|
|
"mean_token_accuracy": 0.24146983176469802,
|
|
"num_tokens": 11562593.0,
|
|
"step": 5150
|
|
},
|
|
{
|
|
"entropy": 5.116436004638672,
|
|
"epoch": 5.57328285559762,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00027208343316371383,
|
|
"loss": 4.6198,
|
|
"mean_token_accuracy": 0.2371422365307808,
|
|
"num_tokens": 11574301.0,
|
|
"step": 5155
|
|
},
|
|
{
|
|
"entropy": 5.048832607269287,
|
|
"epoch": 5.578691184424013,
|
|
"grad_norm": 1.03125,
|
|
"learning_rate": 0.0002716545558594373,
|
|
"loss": 4.5523,
|
|
"mean_token_accuracy": 0.2403918370604515,
|
|
"num_tokens": 11585216.0,
|
|
"step": 5160
|
|
},
|
|
{
|
|
"entropy": 5.152141761779785,
|
|
"epoch": 5.584099513250406,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0002712256907125126,
|
|
"loss": 4.6551,
|
|
"mean_token_accuracy": 0.23105957508087158,
|
|
"num_tokens": 11597079.0,
|
|
"step": 5165
|
|
},
|
|
{
|
|
"entropy": 5.142142248153687,
|
|
"epoch": 5.589507842076799,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0002707968392814366,
|
|
"loss": 4.6106,
|
|
"mean_token_accuracy": 0.23629478067159654,
|
|
"num_tokens": 11608225.0,
|
|
"step": 5170
|
|
},
|
|
{
|
|
"entropy": 5.111922550201416,
|
|
"epoch": 5.594916170903191,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00027036800312465635,
|
|
"loss": 4.6008,
|
|
"mean_token_accuracy": 0.23783642500638963,
|
|
"num_tokens": 11620530.0,
|
|
"step": 5175
|
|
},
|
|
{
|
|
"entropy": 5.055934715270996,
|
|
"epoch": 5.600324499729584,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0002699391838005634,
|
|
"loss": 4.6192,
|
|
"mean_token_accuracy": 0.24495489299297332,
|
|
"num_tokens": 11632409.0,
|
|
"step": 5180
|
|
},
|
|
{
|
|
"entropy": 5.066023874282837,
|
|
"epoch": 5.605732828555976,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.00026951038286748824,
|
|
"loss": 4.525,
|
|
"mean_token_accuracy": 0.24540913552045823,
|
|
"num_tokens": 11644294.0,
|
|
"step": 5185
|
|
},
|
|
{
|
|
"entropy": 5.129907131195068,
|
|
"epoch": 5.611141157382368,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0002690816018836945,
|
|
"loss": 4.5763,
|
|
"mean_token_accuracy": 0.24038067907094957,
|
|
"num_tokens": 11655370.0,
|
|
"step": 5190
|
|
},
|
|
{
|
|
"entropy": 5.1079496383667,
|
|
"epoch": 5.616549486208761,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0002686528424073731,
|
|
"loss": 4.5601,
|
|
"mean_token_accuracy": 0.24266224652528762,
|
|
"num_tokens": 11666947.0,
|
|
"step": 5195
|
|
},
|
|
{
|
|
"entropy": 5.076470422744751,
|
|
"epoch": 5.621957815035154,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00026822410599663704,
|
|
"loss": 4.5016,
|
|
"mean_token_accuracy": 0.24484066516160966,
|
|
"num_tokens": 11677281.0,
|
|
"step": 5200
|
|
},
|
|
{
|
|
"entropy": 5.092998456954956,
|
|
"epoch": 5.627366143861547,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00026779539420951554,
|
|
"loss": 4.5803,
|
|
"mean_token_accuracy": 0.22966374903917314,
|
|
"num_tokens": 11688582.0,
|
|
"step": 5205
|
|
},
|
|
{
|
|
"entropy": 5.0741111755371096,
|
|
"epoch": 5.63277447268794,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0002673667086039481,
|
|
"loss": 4.6049,
|
|
"mean_token_accuracy": 0.23013100028038025,
|
|
"num_tokens": 11698691.0,
|
|
"step": 5210
|
|
},
|
|
{
|
|
"entropy": 5.139614248275757,
|
|
"epoch": 5.638182801514332,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0002669380507377792,
|
|
"loss": 4.6618,
|
|
"mean_token_accuracy": 0.22901782542467117,
|
|
"num_tokens": 11710993.0,
|
|
"step": 5215
|
|
},
|
|
{
|
|
"entropy": 5.100244331359863,
|
|
"epoch": 5.643591130340725,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0002665094221687525,
|
|
"loss": 4.536,
|
|
"mean_token_accuracy": 0.243090358376503,
|
|
"num_tokens": 11722146.0,
|
|
"step": 5220
|
|
},
|
|
{
|
|
"entropy": 5.205877304077148,
|
|
"epoch": 5.6489994591671175,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0002660808244545054,
|
|
"loss": 4.7094,
|
|
"mean_token_accuracy": 0.22805256843566896,
|
|
"num_tokens": 11732756.0,
|
|
"step": 5225
|
|
},
|
|
{
|
|
"entropy": 5.10625467300415,
|
|
"epoch": 5.6544077879935095,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00026565225915256276,
|
|
"loss": 4.5216,
|
|
"mean_token_accuracy": 0.2445647433400154,
|
|
"num_tokens": 11744409.0,
|
|
"step": 5230
|
|
},
|
|
{
|
|
"entropy": 5.014366579055786,
|
|
"epoch": 5.659816116819902,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.000265223727820332,
|
|
"loss": 4.4623,
|
|
"mean_token_accuracy": 0.2480989769101143,
|
|
"num_tokens": 11754351.0,
|
|
"step": 5235
|
|
},
|
|
{
|
|
"entropy": 5.090316534042358,
|
|
"epoch": 5.665224445646295,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0002647952320150969,
|
|
"loss": 4.5905,
|
|
"mean_token_accuracy": 0.24032554179430007,
|
|
"num_tokens": 11765800.0,
|
|
"step": 5240
|
|
},
|
|
{
|
|
"entropy": 5.095514488220215,
|
|
"epoch": 5.670632774472688,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0002643667732940122,
|
|
"loss": 4.5841,
|
|
"mean_token_accuracy": 0.23553522378206254,
|
|
"num_tokens": 11777305.0,
|
|
"step": 5245
|
|
},
|
|
{
|
|
"entropy": 5.1290380477905275,
|
|
"epoch": 5.676041103299081,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00026393835321409796,
|
|
"loss": 4.6418,
|
|
"mean_token_accuracy": 0.23847149312496185,
|
|
"num_tokens": 11788289.0,
|
|
"step": 5250
|
|
},
|
|
{
|
|
"entropy": 5.075438165664673,
|
|
"epoch": 5.681449432125473,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.00026350997333223375,
|
|
"loss": 4.5344,
|
|
"mean_token_accuracy": 0.24352279901504517,
|
|
"num_tokens": 11798759.0,
|
|
"step": 5255
|
|
},
|
|
{
|
|
"entropy": 5.111510705947876,
|
|
"epoch": 5.686857760951866,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00026308163520515293,
|
|
"loss": 4.6373,
|
|
"mean_token_accuracy": 0.22892093807458877,
|
|
"num_tokens": 11809940.0,
|
|
"step": 5260
|
|
},
|
|
{
|
|
"entropy": 5.087829494476319,
|
|
"epoch": 5.692266089778259,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00026265334038943735,
|
|
"loss": 4.5126,
|
|
"mean_token_accuracy": 0.24585696309804916,
|
|
"num_tokens": 11821145.0,
|
|
"step": 5265
|
|
},
|
|
{
|
|
"entropy": 5.110506916046143,
|
|
"epoch": 5.6976744186046515,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0002622250904415113,
|
|
"loss": 4.59,
|
|
"mean_token_accuracy": 0.23473258018493653,
|
|
"num_tokens": 11832007.0,
|
|
"step": 5270
|
|
},
|
|
{
|
|
"entropy": 5.237685108184815,
|
|
"epoch": 5.7030827474310435,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0002617968869176362,
|
|
"loss": 4.6741,
|
|
"mean_token_accuracy": 0.2271284654736519,
|
|
"num_tokens": 11844356.0,
|
|
"step": 5275
|
|
},
|
|
{
|
|
"entropy": 5.044270324707031,
|
|
"epoch": 5.708491076257436,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0002613687313739044,
|
|
"loss": 4.5494,
|
|
"mean_token_accuracy": 0.2323143571615219,
|
|
"num_tokens": 11855294.0,
|
|
"step": 5280
|
|
},
|
|
{
|
|
"entropy": 5.0990400314331055,
|
|
"epoch": 5.713899405083829,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0002609406253662344,
|
|
"loss": 4.66,
|
|
"mean_token_accuracy": 0.2284865841269493,
|
|
"num_tokens": 11865825.0,
|
|
"step": 5285
|
|
},
|
|
{
|
|
"entropy": 5.070143222808838,
|
|
"epoch": 5.719307733910222,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.0002605125704503643,
|
|
"loss": 4.5325,
|
|
"mean_token_accuracy": 0.2336326465010643,
|
|
"num_tokens": 11876265.0,
|
|
"step": 5290
|
|
},
|
|
{
|
|
"entropy": 5.146752786636353,
|
|
"epoch": 5.724716062736614,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0002600845681818467,
|
|
"loss": 4.5812,
|
|
"mean_token_accuracy": 0.24262797832489014,
|
|
"num_tokens": 11888220.0,
|
|
"step": 5295
|
|
},
|
|
{
|
|
"entropy": 5.1307909965515135,
|
|
"epoch": 5.730124391563007,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0002596566201160427,
|
|
"loss": 4.617,
|
|
"mean_token_accuracy": 0.2428817257285118,
|
|
"num_tokens": 11899809.0,
|
|
"step": 5300
|
|
},
|
|
{
|
|
"entropy": 5.049868202209472,
|
|
"epoch": 5.7355327203894,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00025922872780811664,
|
|
"loss": 4.6322,
|
|
"mean_token_accuracy": 0.23154927641153336,
|
|
"num_tokens": 11911046.0,
|
|
"step": 5305
|
|
},
|
|
{
|
|
"entropy": 5.063149118423462,
|
|
"epoch": 5.740941049215793,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.00025880089281303027,
|
|
"loss": 4.6075,
|
|
"mean_token_accuracy": 0.224050635099411,
|
|
"num_tokens": 11922061.0,
|
|
"step": 5310
|
|
},
|
|
{
|
|
"entropy": 5.14631233215332,
|
|
"epoch": 5.746349378042185,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00025837311668553683,
|
|
"loss": 4.5437,
|
|
"mean_token_accuracy": 0.24232044517993928,
|
|
"num_tokens": 11932199.0,
|
|
"step": 5315
|
|
},
|
|
{
|
|
"entropy": 5.150130701065064,
|
|
"epoch": 5.7517577068685775,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0002579454009801757,
|
|
"loss": 4.6041,
|
|
"mean_token_accuracy": 0.23508304208517075,
|
|
"num_tokens": 11941511.0,
|
|
"step": 5320
|
|
},
|
|
{
|
|
"entropy": 5.047831583023071,
|
|
"epoch": 5.75716603569497,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0002575177472512669,
|
|
"loss": 4.5769,
|
|
"mean_token_accuracy": 0.23659766018390654,
|
|
"num_tokens": 11953430.0,
|
|
"step": 5325
|
|
},
|
|
{
|
|
"entropy": 5.156755590438843,
|
|
"epoch": 5.762574364521363,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.000257090157052905,
|
|
"loss": 4.5968,
|
|
"mean_token_accuracy": 0.2341006264090538,
|
|
"num_tokens": 11964167.0,
|
|
"step": 5330
|
|
},
|
|
{
|
|
"entropy": 5.130202865600586,
|
|
"epoch": 5.767982693347756,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00025666263193895375,
|
|
"loss": 4.6579,
|
|
"mean_token_accuracy": 0.24266277700662614,
|
|
"num_tokens": 11975428.0,
|
|
"step": 5335
|
|
},
|
|
{
|
|
"entropy": 5.105318927764893,
|
|
"epoch": 5.773391022174148,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.00025623517346304027,
|
|
"loss": 4.6352,
|
|
"mean_token_accuracy": 0.23468518555164336,
|
|
"num_tokens": 11986358.0,
|
|
"step": 5340
|
|
},
|
|
{
|
|
"entropy": 5.004417848587036,
|
|
"epoch": 5.778799351000541,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.00025580778317855,
|
|
"loss": 4.4355,
|
|
"mean_token_accuracy": 0.24805232286453247,
|
|
"num_tokens": 11997295.0,
|
|
"step": 5345
|
|
},
|
|
{
|
|
"entropy": 5.111599063873291,
|
|
"epoch": 5.784207679826934,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.0002553804626386199,
|
|
"loss": 4.5501,
|
|
"mean_token_accuracy": 0.2441372111439705,
|
|
"num_tokens": 12008348.0,
|
|
"step": 5350
|
|
},
|
|
{
|
|
"entropy": 5.093307590484619,
|
|
"epoch": 5.789616008653326,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0002549532133961339,
|
|
"loss": 4.615,
|
|
"mean_token_accuracy": 0.237824247777462,
|
|
"num_tokens": 12019698.0,
|
|
"step": 5355
|
|
},
|
|
{
|
|
"entropy": 5.145287132263183,
|
|
"epoch": 5.795024337479719,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00025452603700371675,
|
|
"loss": 4.6236,
|
|
"mean_token_accuracy": 0.2315625086426735,
|
|
"num_tokens": 12030969.0,
|
|
"step": 5360
|
|
},
|
|
{
|
|
"entropy": 5.072210025787354,
|
|
"epoch": 5.800432666306111,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0002540989350137285,
|
|
"loss": 4.5114,
|
|
"mean_token_accuracy": 0.2476600378751755,
|
|
"num_tokens": 12042695.0,
|
|
"step": 5365
|
|
},
|
|
{
|
|
"entropy": 5.129029321670532,
|
|
"epoch": 5.805840995132504,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.00025367190897825873,
|
|
"loss": 4.6611,
|
|
"mean_token_accuracy": 0.2307037815451622,
|
|
"num_tokens": 12054016.0,
|
|
"step": 5370
|
|
},
|
|
{
|
|
"entropy": 5.071478796005249,
|
|
"epoch": 5.811249323958897,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0002532449604491209,
|
|
"loss": 4.5983,
|
|
"mean_token_accuracy": 0.23205728828907013,
|
|
"num_tokens": 12065759.0,
|
|
"step": 5375
|
|
},
|
|
{
|
|
"entropy": 5.070323419570923,
|
|
"epoch": 5.816657652785289,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0002528180909778471,
|
|
"loss": 4.583,
|
|
"mean_token_accuracy": 0.24318053275346757,
|
|
"num_tokens": 12077475.0,
|
|
"step": 5380
|
|
},
|
|
{
|
|
"entropy": 5.059966135025024,
|
|
"epoch": 5.822065981611682,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00025239130211568206,
|
|
"loss": 4.5393,
|
|
"mean_token_accuracy": 0.22720250636339187,
|
|
"num_tokens": 12088965.0,
|
|
"step": 5385
|
|
},
|
|
{
|
|
"entropy": 5.065695285797119,
|
|
"epoch": 5.827474310438075,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00025196459541357725,
|
|
"loss": 4.5739,
|
|
"mean_token_accuracy": 0.23207562863826753,
|
|
"num_tokens": 12101215.0,
|
|
"step": 5390
|
|
},
|
|
{
|
|
"entropy": 5.1242262840271,
|
|
"epoch": 5.832882639264467,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00025153797242218604,
|
|
"loss": 4.5841,
|
|
"mean_token_accuracy": 0.23600030988454818,
|
|
"num_tokens": 12112172.0,
|
|
"step": 5395
|
|
},
|
|
{
|
|
"entropy": 5.056416463851929,
|
|
"epoch": 5.83829096809086,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00025111143469185715,
|
|
"loss": 4.5646,
|
|
"mean_token_accuracy": 0.2433018684387207,
|
|
"num_tokens": 12123461.0,
|
|
"step": 5400
|
|
},
|
|
{
|
|
"entropy": 5.055309772491455,
|
|
"epoch": 5.8436992969172525,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0002506849837726299,
|
|
"loss": 4.533,
|
|
"mean_token_accuracy": 0.2430558145046234,
|
|
"num_tokens": 12134671.0,
|
|
"step": 5405
|
|
},
|
|
{
|
|
"entropy": 4.994070053100586,
|
|
"epoch": 5.849107625743645,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0002502586212142278,
|
|
"loss": 4.4498,
|
|
"mean_token_accuracy": 0.24918071776628495,
|
|
"num_tokens": 12145861.0,
|
|
"step": 5410
|
|
},
|
|
{
|
|
"entropy": 5.170055198669433,
|
|
"epoch": 5.854515954570038,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.00024983234856605337,
|
|
"loss": 4.633,
|
|
"mean_token_accuracy": 0.22511566430330276,
|
|
"num_tokens": 12157577.0,
|
|
"step": 5415
|
|
},
|
|
{
|
|
"entropy": 5.065318202972412,
|
|
"epoch": 5.85992428339643,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00024940616737718235,
|
|
"loss": 4.6324,
|
|
"mean_token_accuracy": 0.23299359530210495,
|
|
"num_tokens": 12169786.0,
|
|
"step": 5420
|
|
},
|
|
{
|
|
"entropy": 5.115573406219482,
|
|
"epoch": 5.865332612222823,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0002489800791963583,
|
|
"loss": 4.6011,
|
|
"mean_token_accuracy": 0.24409506767988204,
|
|
"num_tokens": 12181008.0,
|
|
"step": 5425
|
|
},
|
|
{
|
|
"entropy": 5.143574523925781,
|
|
"epoch": 5.870740941049216,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00024855408557198657,
|
|
"loss": 4.6714,
|
|
"mean_token_accuracy": 0.23293209373950957,
|
|
"num_tokens": 12192832.0,
|
|
"step": 5430
|
|
},
|
|
{
|
|
"entropy": 5.102931022644043,
|
|
"epoch": 5.876149269875609,
|
|
"grad_norm": 1.046875,
|
|
"learning_rate": 0.000248128188052129,
|
|
"loss": 4.6233,
|
|
"mean_token_accuracy": 0.23675554990768433,
|
|
"num_tokens": 12205599.0,
|
|
"step": 5435
|
|
},
|
|
{
|
|
"entropy": 5.220578622817993,
|
|
"epoch": 5.881557598702001,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.00024770238818449804,
|
|
"loss": 4.684,
|
|
"mean_token_accuracy": 0.22862893342971802,
|
|
"num_tokens": 12217527.0,
|
|
"step": 5440
|
|
},
|
|
{
|
|
"entropy": 5.1017098903656,
|
|
"epoch": 5.886965927528394,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00024727668751645164,
|
|
"loss": 4.5677,
|
|
"mean_token_accuracy": 0.237183278799057,
|
|
"num_tokens": 12228640.0,
|
|
"step": 5445
|
|
},
|
|
{
|
|
"entropy": 5.125553989410401,
|
|
"epoch": 5.8923742563547865,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0002468510875949868,
|
|
"loss": 4.5683,
|
|
"mean_token_accuracy": 0.23590999841690063,
|
|
"num_tokens": 12239392.0,
|
|
"step": 5450
|
|
},
|
|
{
|
|
"entropy": 5.1401652812957765,
|
|
"epoch": 5.897782585181179,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00024642558996673474,
|
|
"loss": 4.6272,
|
|
"mean_token_accuracy": 0.23644618541002274,
|
|
"num_tokens": 12251507.0,
|
|
"step": 5455
|
|
},
|
|
{
|
|
"entropy": 5.1105822086334225,
|
|
"epoch": 5.903190914007571,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00024600019617795465,
|
|
"loss": 4.6395,
|
|
"mean_token_accuracy": 0.23106056004762648,
|
|
"num_tokens": 12263117.0,
|
|
"step": 5460
|
|
},
|
|
{
|
|
"entropy": 5.1196410179138185,
|
|
"epoch": 5.908599242833964,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0002455749077745288,
|
|
"loss": 4.644,
|
|
"mean_token_accuracy": 0.23821934461593627,
|
|
"num_tokens": 12274187.0,
|
|
"step": 5465
|
|
},
|
|
{
|
|
"entropy": 5.084873628616333,
|
|
"epoch": 5.914007571660357,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.00024514972630195603,
|
|
"loss": 4.5598,
|
|
"mean_token_accuracy": 0.24169430881738663,
|
|
"num_tokens": 12285392.0,
|
|
"step": 5470
|
|
},
|
|
{
|
|
"entropy": 5.2031793117523195,
|
|
"epoch": 5.91941590048675,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0002447246533053469,
|
|
"loss": 4.6387,
|
|
"mean_token_accuracy": 0.23779407441616057,
|
|
"num_tokens": 12297634.0,
|
|
"step": 5475
|
|
},
|
|
{
|
|
"entropy": 5.040070056915283,
|
|
"epoch": 5.924824229313142,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00024429969032941756,
|
|
"loss": 4.5473,
|
|
"mean_token_accuracy": 0.23564749956130981,
|
|
"num_tokens": 12309067.0,
|
|
"step": 5480
|
|
},
|
|
{
|
|
"entropy": 5.029923391342163,
|
|
"epoch": 5.930232558139535,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00024387483891848456,
|
|
"loss": 4.5424,
|
|
"mean_token_accuracy": 0.24335149377584459,
|
|
"num_tokens": 12320422.0,
|
|
"step": 5485
|
|
},
|
|
{
|
|
"entropy": 5.086775493621826,
|
|
"epoch": 5.935640886965928,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00024345010061645889,
|
|
"loss": 4.6787,
|
|
"mean_token_accuracy": 0.22812491655349731,
|
|
"num_tokens": 12331531.0,
|
|
"step": 5490
|
|
},
|
|
{
|
|
"entropy": 5.101256275177002,
|
|
"epoch": 5.9410492157923205,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00024302547696684047,
|
|
"loss": 4.5111,
|
|
"mean_token_accuracy": 0.24030095785856248,
|
|
"num_tokens": 12342295.0,
|
|
"step": 5495
|
|
},
|
|
{
|
|
"entropy": 5.082580518722534,
|
|
"epoch": 5.9464575446187125,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00024260096951271253,
|
|
"loss": 4.5247,
|
|
"mean_token_accuracy": 0.24051147550344468,
|
|
"num_tokens": 12352934.0,
|
|
"step": 5500
|
|
},
|
|
{
|
|
"entropy": 5.1216014385223385,
|
|
"epoch": 5.951865873445105,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00024217657979673634,
|
|
"loss": 4.651,
|
|
"mean_token_accuracy": 0.22875461131334304,
|
|
"num_tokens": 12364016.0,
|
|
"step": 5505
|
|
},
|
|
{
|
|
"entropy": 5.105373048782349,
|
|
"epoch": 5.957274202271498,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00024175230936114507,
|
|
"loss": 4.5926,
|
|
"mean_token_accuracy": 0.23197882771492004,
|
|
"num_tokens": 12374666.0,
|
|
"step": 5510
|
|
},
|
|
{
|
|
"entropy": 5.120679092407227,
|
|
"epoch": 5.962682531097891,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0002413281597477384,
|
|
"loss": 4.5327,
|
|
"mean_token_accuracy": 0.23745722472667694,
|
|
"num_tokens": 12384454.0,
|
|
"step": 5515
|
|
},
|
|
{
|
|
"entropy": 5.059133577346802,
|
|
"epoch": 5.968090859924283,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00024090413249787696,
|
|
"loss": 4.5813,
|
|
"mean_token_accuracy": 0.2395591676235199,
|
|
"num_tokens": 12396466.0,
|
|
"step": 5520
|
|
},
|
|
{
|
|
"entropy": 5.038516426086426,
|
|
"epoch": 5.973499188750676,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.0002404802291524768,
|
|
"loss": 4.5223,
|
|
"mean_token_accuracy": 0.24070528745651246,
|
|
"num_tokens": 12407424.0,
|
|
"step": 5525
|
|
},
|
|
{
|
|
"entropy": 5.059326648712158,
|
|
"epoch": 5.978907517577069,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00024005645125200375,
|
|
"loss": 4.5352,
|
|
"mean_token_accuracy": 0.2425309121608734,
|
|
"num_tokens": 12417788.0,
|
|
"step": 5530
|
|
},
|
|
{
|
|
"entropy": 5.0759850025177,
|
|
"epoch": 5.984315846403462,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0002396328003364675,
|
|
"loss": 4.6445,
|
|
"mean_token_accuracy": 0.2318225994706154,
|
|
"num_tokens": 12429735.0,
|
|
"step": 5535
|
|
},
|
|
{
|
|
"entropy": 5.121332359313965,
|
|
"epoch": 5.9897241752298545,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.00023920927794541665,
|
|
"loss": 4.585,
|
|
"mean_token_accuracy": 0.23201659172773362,
|
|
"num_tokens": 12440281.0,
|
|
"step": 5540
|
|
},
|
|
{
|
|
"entropy": 5.1707377433776855,
|
|
"epoch": 5.995132504056246,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.0002387858856179324,
|
|
"loss": 4.6484,
|
|
"mean_token_accuracy": 0.22764950394630432,
|
|
"num_tokens": 12452127.0,
|
|
"step": 5545
|
|
},
|
|
{
|
|
"entropy": 5.083885563744439,
|
|
"epoch": 6.0,
|
|
"grad_norm": 2.328125,
|
|
"learning_rate": 0.00023836262489262361,
|
|
"loss": 4.5888,
|
|
"mean_token_accuracy": 0.24051977197329202,
|
|
"num_tokens": 12461334.0,
|
|
"step": 5550
|
|
},
|
|
{
|
|
"entropy": 5.086653184890747,
|
|
"epoch": 6.005408328826393,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00023793949730762049,
|
|
"loss": 4.3569,
|
|
"mean_token_accuracy": 0.25400849133729936,
|
|
"num_tokens": 12472411.0,
|
|
"step": 5555
|
|
},
|
|
{
|
|
"entropy": 5.042824792861938,
|
|
"epoch": 6.010816657652786,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00023751650440056982,
|
|
"loss": 4.3451,
|
|
"mean_token_accuracy": 0.25822981745004653,
|
|
"num_tokens": 12482829.0,
|
|
"step": 5560
|
|
},
|
|
{
|
|
"entropy": 5.073545742034912,
|
|
"epoch": 6.016224986479178,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00023709364770862885,
|
|
"loss": 4.4078,
|
|
"mean_token_accuracy": 0.25036914795637133,
|
|
"num_tokens": 12494939.0,
|
|
"step": 5565
|
|
},
|
|
{
|
|
"entropy": 5.015249872207642,
|
|
"epoch": 6.0216333153055706,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00023667092876845976,
|
|
"loss": 4.2981,
|
|
"mean_token_accuracy": 0.2621407866477966,
|
|
"num_tokens": 12505608.0,
|
|
"step": 5570
|
|
},
|
|
{
|
|
"entropy": 5.015564060211181,
|
|
"epoch": 6.027041644131963,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0002362483491162239,
|
|
"loss": 4.3161,
|
|
"mean_token_accuracy": 0.264655539393425,
|
|
"num_tokens": 12516110.0,
|
|
"step": 5575
|
|
},
|
|
{
|
|
"entropy": 5.150920104980469,
|
|
"epoch": 6.032449972958356,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00023582591028757706,
|
|
"loss": 4.3775,
|
|
"mean_token_accuracy": 0.2547082617878914,
|
|
"num_tokens": 12526877.0,
|
|
"step": 5580
|
|
},
|
|
{
|
|
"entropy": 5.085649013519287,
|
|
"epoch": 6.037858301784748,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00023540361381766274,
|
|
"loss": 4.3703,
|
|
"mean_token_accuracy": 0.2546262010931969,
|
|
"num_tokens": 12538574.0,
|
|
"step": 5585
|
|
},
|
|
{
|
|
"entropy": 5.063450002670288,
|
|
"epoch": 6.043266630611141,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0002349814612411073,
|
|
"loss": 4.4194,
|
|
"mean_token_accuracy": 0.2511056512594223,
|
|
"num_tokens": 12550313.0,
|
|
"step": 5590
|
|
},
|
|
{
|
|
"entropy": 5.080852222442627,
|
|
"epoch": 6.048674959437534,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00023455945409201411,
|
|
"loss": 4.3648,
|
|
"mean_token_accuracy": 0.251961413025856,
|
|
"num_tokens": 12561750.0,
|
|
"step": 5595
|
|
},
|
|
{
|
|
"entropy": 5.085720157623291,
|
|
"epoch": 6.054083288263927,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00023413759390395828,
|
|
"loss": 4.428,
|
|
"mean_token_accuracy": 0.24815989136695862,
|
|
"num_tokens": 12573915.0,
|
|
"step": 5600
|
|
},
|
|
{
|
|
"entropy": 5.135279798507691,
|
|
"epoch": 6.059491617090319,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0002337158822099807,
|
|
"loss": 4.4059,
|
|
"mean_token_accuracy": 0.2509478613734245,
|
|
"num_tokens": 12585254.0,
|
|
"step": 5605
|
|
},
|
|
{
|
|
"entropy": 5.075468826293945,
|
|
"epoch": 6.064899945916712,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0002332943205425825,
|
|
"loss": 4.4093,
|
|
"mean_token_accuracy": 0.2519256502389908,
|
|
"num_tokens": 12596633.0,
|
|
"step": 5610
|
|
},
|
|
{
|
|
"entropy": 5.025220966339111,
|
|
"epoch": 6.0703082747431045,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.00023287291043371978,
|
|
"loss": 4.353,
|
|
"mean_token_accuracy": 0.2512174382805824,
|
|
"num_tokens": 12607332.0,
|
|
"step": 5615
|
|
},
|
|
{
|
|
"entropy": 5.049488353729248,
|
|
"epoch": 6.075716603569497,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00023245165341479796,
|
|
"loss": 4.3871,
|
|
"mean_token_accuracy": 0.2563488602638245,
|
|
"num_tokens": 12618591.0,
|
|
"step": 5620
|
|
},
|
|
{
|
|
"entropy": 5.075482940673828,
|
|
"epoch": 6.081124932395889,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.00023203055101666593,
|
|
"loss": 4.3661,
|
|
"mean_token_accuracy": 0.2556263044476509,
|
|
"num_tokens": 12629014.0,
|
|
"step": 5625
|
|
},
|
|
{
|
|
"entropy": 5.092593860626221,
|
|
"epoch": 6.086533261222282,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.0002316096047696108,
|
|
"loss": 4.3925,
|
|
"mean_token_accuracy": 0.2469010606408119,
|
|
"num_tokens": 12640135.0,
|
|
"step": 5630
|
|
},
|
|
{
|
|
"entropy": 5.05594654083252,
|
|
"epoch": 6.091941590048675,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0002311888162033522,
|
|
"loss": 4.4137,
|
|
"mean_token_accuracy": 0.2506154954433441,
|
|
"num_tokens": 12651005.0,
|
|
"step": 5635
|
|
},
|
|
{
|
|
"entropy": 5.118357706069946,
|
|
"epoch": 6.097349918875068,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00023076818684703682,
|
|
"loss": 4.4637,
|
|
"mean_token_accuracy": 0.2449328362941742,
|
|
"num_tokens": 12662947.0,
|
|
"step": 5640
|
|
},
|
|
{
|
|
"entropy": 5.085834980010986,
|
|
"epoch": 6.10275824770146,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00023034771822923268,
|
|
"loss": 4.3923,
|
|
"mean_token_accuracy": 0.2475297763943672,
|
|
"num_tokens": 12673638.0,
|
|
"step": 5645
|
|
},
|
|
{
|
|
"entropy": 5.037565851211548,
|
|
"epoch": 6.108166576527853,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0002299274118779236,
|
|
"loss": 4.3473,
|
|
"mean_token_accuracy": 0.2588935747742653,
|
|
"num_tokens": 12684036.0,
|
|
"step": 5650
|
|
},
|
|
{
|
|
"entropy": 5.023610210418701,
|
|
"epoch": 6.113574905354246,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.00022950726932050386,
|
|
"loss": 4.4207,
|
|
"mean_token_accuracy": 0.2527086704969406,
|
|
"num_tokens": 12695574.0,
|
|
"step": 5655
|
|
},
|
|
{
|
|
"entropy": 5.132417106628418,
|
|
"epoch": 6.1189832341806385,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00022908729208377267,
|
|
"loss": 4.4485,
|
|
"mean_token_accuracy": 0.24634739011526108,
|
|
"num_tokens": 12707017.0,
|
|
"step": 5660
|
|
},
|
|
{
|
|
"entropy": 5.057981491088867,
|
|
"epoch": 6.1243915630070305,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00022866748169392815,
|
|
"loss": 4.32,
|
|
"mean_token_accuracy": 0.26268827319145205,
|
|
"num_tokens": 12717368.0,
|
|
"step": 5665
|
|
},
|
|
{
|
|
"entropy": 5.024951505661011,
|
|
"epoch": 6.129799891833423,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00022824783967656208,
|
|
"loss": 4.3196,
|
|
"mean_token_accuracy": 0.25522277057170867,
|
|
"num_tokens": 12727957.0,
|
|
"step": 5670
|
|
},
|
|
{
|
|
"entropy": 5.033692264556885,
|
|
"epoch": 6.135208220659816,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00022782836755665475,
|
|
"loss": 4.3266,
|
|
"mean_token_accuracy": 0.2628965064883232,
|
|
"num_tokens": 12739041.0,
|
|
"step": 5675
|
|
},
|
|
{
|
|
"entropy": 5.1106596946716305,
|
|
"epoch": 6.140616549486209,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.00022740906685856876,
|
|
"loss": 4.3241,
|
|
"mean_token_accuracy": 0.26627043038606646,
|
|
"num_tokens": 12750468.0,
|
|
"step": 5680
|
|
},
|
|
{
|
|
"entropy": 5.056627321243286,
|
|
"epoch": 6.146024878312601,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00022698993910604383,
|
|
"loss": 4.4088,
|
|
"mean_token_accuracy": 0.24593029916286469,
|
|
"num_tokens": 12762320.0,
|
|
"step": 5685
|
|
},
|
|
{
|
|
"entropy": 5.13172607421875,
|
|
"epoch": 6.151433207138994,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.000226570985822191,
|
|
"loss": 4.4362,
|
|
"mean_token_accuracy": 0.24388669580221176,
|
|
"num_tokens": 12773481.0,
|
|
"step": 5690
|
|
},
|
|
{
|
|
"entropy": 5.061193323135376,
|
|
"epoch": 6.156841535965387,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00022615220852948765,
|
|
"loss": 4.3764,
|
|
"mean_token_accuracy": 0.254576013982296,
|
|
"num_tokens": 12785925.0,
|
|
"step": 5695
|
|
},
|
|
{
|
|
"entropy": 5.026907873153687,
|
|
"epoch": 6.16224986479178,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00022573360874977145,
|
|
"loss": 4.3965,
|
|
"mean_token_accuracy": 0.2550534322857857,
|
|
"num_tokens": 12798017.0,
|
|
"step": 5700
|
|
},
|
|
{
|
|
"entropy": 5.0545814514160154,
|
|
"epoch": 6.167658193618172,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00022531518800423484,
|
|
"loss": 4.4231,
|
|
"mean_token_accuracy": 0.2518355429172516,
|
|
"num_tokens": 12809454.0,
|
|
"step": 5705
|
|
},
|
|
{
|
|
"entropy": 5.036812353134155,
|
|
"epoch": 6.173066522444564,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0002248969478134199,
|
|
"loss": 4.3683,
|
|
"mean_token_accuracy": 0.25098541378974915,
|
|
"num_tokens": 12820259.0,
|
|
"step": 5710
|
|
},
|
|
{
|
|
"entropy": 5.0702924728393555,
|
|
"epoch": 6.178474851270957,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00022447888969721232,
|
|
"loss": 4.4206,
|
|
"mean_token_accuracy": 0.24790642857551576,
|
|
"num_tokens": 12832215.0,
|
|
"step": 5715
|
|
},
|
|
{
|
|
"entropy": 5.0459705829620365,
|
|
"epoch": 6.18388318009735,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00022406101517483636,
|
|
"loss": 4.3903,
|
|
"mean_token_accuracy": 0.25190104097127913,
|
|
"num_tokens": 12843375.0,
|
|
"step": 5720
|
|
},
|
|
{
|
|
"entropy": 5.102580308914185,
|
|
"epoch": 6.189291508923742,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.00022364332576484897,
|
|
"loss": 4.4213,
|
|
"mean_token_accuracy": 0.2548479750752449,
|
|
"num_tokens": 12855500.0,
|
|
"step": 5725
|
|
},
|
|
{
|
|
"entropy": 5.0764915466308596,
|
|
"epoch": 6.194699837750135,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0002232258229851345,
|
|
"loss": 4.4262,
|
|
"mean_token_accuracy": 0.25448043942451476,
|
|
"num_tokens": 12865625.0,
|
|
"step": 5730
|
|
},
|
|
{
|
|
"entropy": 5.107598114013672,
|
|
"epoch": 6.200108166576528,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00022280850835289885,
|
|
"loss": 4.3947,
|
|
"mean_token_accuracy": 0.25172959715127946,
|
|
"num_tokens": 12876752.0,
|
|
"step": 5735
|
|
},
|
|
{
|
|
"entropy": 5.053556346893311,
|
|
"epoch": 6.205516495402921,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.00022239138338466452,
|
|
"loss": 4.3435,
|
|
"mean_token_accuracy": 0.26145315170288086,
|
|
"num_tokens": 12887729.0,
|
|
"step": 5740
|
|
},
|
|
{
|
|
"entropy": 4.977486562728882,
|
|
"epoch": 6.210924824229313,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.00022197444959626451,
|
|
"loss": 4.3719,
|
|
"mean_token_accuracy": 0.26408295780420304,
|
|
"num_tokens": 12898075.0,
|
|
"step": 5745
|
|
},
|
|
{
|
|
"entropy": 5.059645128250122,
|
|
"epoch": 6.2163331530557056,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00022155770850283723,
|
|
"loss": 4.4001,
|
|
"mean_token_accuracy": 0.24792602509260178,
|
|
"num_tokens": 12909360.0,
|
|
"step": 5750
|
|
},
|
|
{
|
|
"entropy": 5.078243732452393,
|
|
"epoch": 6.221741481882098,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.00022114116161882065,
|
|
"loss": 4.3778,
|
|
"mean_token_accuracy": 0.25061326026916503,
|
|
"num_tokens": 12920135.0,
|
|
"step": 5755
|
|
},
|
|
{
|
|
"entropy": 5.075050258636475,
|
|
"epoch": 6.227149810708491,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00022072481045794733,
|
|
"loss": 4.4257,
|
|
"mean_token_accuracy": 0.25036286264657975,
|
|
"num_tokens": 12930892.0,
|
|
"step": 5760
|
|
},
|
|
{
|
|
"entropy": 5.103361415863037,
|
|
"epoch": 6.232558139534884,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.00022030865653323823,
|
|
"loss": 4.4604,
|
|
"mean_token_accuracy": 0.24151381254196166,
|
|
"num_tokens": 12941881.0,
|
|
"step": 5765
|
|
},
|
|
{
|
|
"entropy": 5.207461261749268,
|
|
"epoch": 6.237966468361276,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0002198927013569977,
|
|
"loss": 4.4521,
|
|
"mean_token_accuracy": 0.25455030649900434,
|
|
"num_tokens": 12954190.0,
|
|
"step": 5770
|
|
},
|
|
{
|
|
"entropy": 5.121049594879151,
|
|
"epoch": 6.243374797187669,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0002194769464408076,
|
|
"loss": 4.4668,
|
|
"mean_token_accuracy": 0.24447044730186462,
|
|
"num_tokens": 12964796.0,
|
|
"step": 5775
|
|
},
|
|
{
|
|
"entropy": 5.032493925094604,
|
|
"epoch": 6.248783126014062,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0002190613932955226,
|
|
"loss": 4.3051,
|
|
"mean_token_accuracy": 0.2618804663419724,
|
|
"num_tokens": 12975989.0,
|
|
"step": 5780
|
|
},
|
|
{
|
|
"entropy": 4.998596620559693,
|
|
"epoch": 6.254191454840455,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00021864604343126365,
|
|
"loss": 4.3264,
|
|
"mean_token_accuracy": 0.24551878571510316,
|
|
"num_tokens": 12987720.0,
|
|
"step": 5785
|
|
},
|
|
{
|
|
"entropy": 4.9964025020599365,
|
|
"epoch": 6.259599783666847,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00021823089835741312,
|
|
"loss": 4.2749,
|
|
"mean_token_accuracy": 0.2673639252781868,
|
|
"num_tokens": 12999014.0,
|
|
"step": 5790
|
|
},
|
|
{
|
|
"entropy": 5.1089273452758786,
|
|
"epoch": 6.2650081124932395,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.000217815959582609,
|
|
"loss": 4.4525,
|
|
"mean_token_accuracy": 0.24347484856843948,
|
|
"num_tokens": 13009229.0,
|
|
"step": 5795
|
|
},
|
|
{
|
|
"entropy": 5.061414766311645,
|
|
"epoch": 6.270416441319632,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00021740122861473992,
|
|
"loss": 4.3525,
|
|
"mean_token_accuracy": 0.2591205403208733,
|
|
"num_tokens": 13020753.0,
|
|
"step": 5800
|
|
},
|
|
{
|
|
"entropy": 5.006845378875733,
|
|
"epoch": 6.275824770146025,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00021698670696093932,
|
|
"loss": 4.3339,
|
|
"mean_token_accuracy": 0.25727398246526717,
|
|
"num_tokens": 13032007.0,
|
|
"step": 5805
|
|
},
|
|
{
|
|
"entropy": 4.958788251876831,
|
|
"epoch": 6.281233098972417,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00021657239612757963,
|
|
"loss": 4.2785,
|
|
"mean_token_accuracy": 0.2635518029332161,
|
|
"num_tokens": 13042827.0,
|
|
"step": 5810
|
|
},
|
|
{
|
|
"entropy": 4.9195812225341795,
|
|
"epoch": 6.28664142779881,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.00021615829762026734,
|
|
"loss": 4.338,
|
|
"mean_token_accuracy": 0.2562535762786865,
|
|
"num_tokens": 13053146.0,
|
|
"step": 5815
|
|
},
|
|
{
|
|
"entropy": 5.105458784103393,
|
|
"epoch": 6.292049756625203,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00021574441294383752,
|
|
"loss": 4.4892,
|
|
"mean_token_accuracy": 0.24603179544210435,
|
|
"num_tokens": 13064334.0,
|
|
"step": 5820
|
|
},
|
|
{
|
|
"entropy": 5.083749628067016,
|
|
"epoch": 6.297458085451596,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.00021533074360234806,
|
|
"loss": 4.3459,
|
|
"mean_token_accuracy": 0.26156525909900663,
|
|
"num_tokens": 13075265.0,
|
|
"step": 5825
|
|
},
|
|
{
|
|
"entropy": 5.059867477416992,
|
|
"epoch": 6.302866414277988,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00021491729109907414,
|
|
"loss": 4.3997,
|
|
"mean_token_accuracy": 0.2572763070464134,
|
|
"num_tokens": 13088442.0,
|
|
"step": 5830
|
|
},
|
|
{
|
|
"entropy": 5.026959466934204,
|
|
"epoch": 6.308274743104381,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00021450405693650333,
|
|
"loss": 4.3343,
|
|
"mean_token_accuracy": 0.25450841784477235,
|
|
"num_tokens": 13099211.0,
|
|
"step": 5835
|
|
},
|
|
{
|
|
"entropy": 5.108422946929932,
|
|
"epoch": 6.3136830719307735,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.00021409104261632932,
|
|
"loss": 4.4476,
|
|
"mean_token_accuracy": 0.25354350805282594,
|
|
"num_tokens": 13110516.0,
|
|
"step": 5840
|
|
},
|
|
{
|
|
"entropy": 5.082192850112915,
|
|
"epoch": 6.319091400757166,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00021367824963944727,
|
|
"loss": 4.3867,
|
|
"mean_token_accuracy": 0.2537351742386818,
|
|
"num_tokens": 13122696.0,
|
|
"step": 5845
|
|
},
|
|
{
|
|
"entropy": 5.041290283203125,
|
|
"epoch": 6.324499729583558,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.00021326567950594766,
|
|
"loss": 4.4152,
|
|
"mean_token_accuracy": 0.25945159047842026,
|
|
"num_tokens": 13133500.0,
|
|
"step": 5850
|
|
},
|
|
{
|
|
"entropy": 5.067854738235473,
|
|
"epoch": 6.329908058409951,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0002128533337151114,
|
|
"loss": 4.4082,
|
|
"mean_token_accuracy": 0.2557085111737251,
|
|
"num_tokens": 13144444.0,
|
|
"step": 5855
|
|
},
|
|
{
|
|
"entropy": 5.038957166671753,
|
|
"epoch": 6.335316387236344,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0002124412137654041,
|
|
"loss": 4.3997,
|
|
"mean_token_accuracy": 0.25047909915447236,
|
|
"num_tokens": 13156087.0,
|
|
"step": 5860
|
|
},
|
|
{
|
|
"entropy": 5.107436847686768,
|
|
"epoch": 6.340724716062737,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00021202932115447056,
|
|
"loss": 4.4288,
|
|
"mean_token_accuracy": 0.25145320892333983,
|
|
"num_tokens": 13167343.0,
|
|
"step": 5865
|
|
},
|
|
{
|
|
"entropy": 5.11137318611145,
|
|
"epoch": 6.346133044889129,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.00021161765737912937,
|
|
"loss": 4.5034,
|
|
"mean_token_accuracy": 0.23796405047178268,
|
|
"num_tokens": 13179197.0,
|
|
"step": 5870
|
|
},
|
|
{
|
|
"entropy": 5.083620691299439,
|
|
"epoch": 6.351541373715522,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.00021120622393536775,
|
|
"loss": 4.445,
|
|
"mean_token_accuracy": 0.2475633889436722,
|
|
"num_tokens": 13189759.0,
|
|
"step": 5875
|
|
},
|
|
{
|
|
"entropy": 5.044642686843872,
|
|
"epoch": 6.356949702541915,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00021079502231833585,
|
|
"loss": 4.3604,
|
|
"mean_token_accuracy": 0.2547649756073952,
|
|
"num_tokens": 13200634.0,
|
|
"step": 5880
|
|
},
|
|
{
|
|
"entropy": 5.065172815322876,
|
|
"epoch": 6.3623580313683075,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00021038405402234116,
|
|
"loss": 4.4369,
|
|
"mean_token_accuracy": 0.24777600169181824,
|
|
"num_tokens": 13212599.0,
|
|
"step": 5885
|
|
},
|
|
{
|
|
"entropy": 5.102966547012329,
|
|
"epoch": 6.367766360194699,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0002099733205408435,
|
|
"loss": 4.5189,
|
|
"mean_token_accuracy": 0.24546874314546585,
|
|
"num_tokens": 13224491.0,
|
|
"step": 5890
|
|
},
|
|
{
|
|
"entropy": 5.129796361923217,
|
|
"epoch": 6.373174689021092,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0002095628233664492,
|
|
"loss": 4.4202,
|
|
"mean_token_accuracy": 0.2585400566458702,
|
|
"num_tokens": 13236655.0,
|
|
"step": 5895
|
|
},
|
|
{
|
|
"entropy": 5.128116798400879,
|
|
"epoch": 6.378583017847485,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0002091525639909061,
|
|
"loss": 4.4435,
|
|
"mean_token_accuracy": 0.25246652215719223,
|
|
"num_tokens": 13247986.0,
|
|
"step": 5900
|
|
},
|
|
{
|
|
"entropy": 5.15279712677002,
|
|
"epoch": 6.383991346673878,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00020874254390509757,
|
|
"loss": 4.4916,
|
|
"mean_token_accuracy": 0.2485489323735237,
|
|
"num_tokens": 13259949.0,
|
|
"step": 5905
|
|
},
|
|
{
|
|
"entropy": 4.978144693374634,
|
|
"epoch": 6.38939967550027,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00020833276459903766,
|
|
"loss": 4.3761,
|
|
"mean_token_accuracy": 0.2529650777578354,
|
|
"num_tokens": 13270840.0,
|
|
"step": 5910
|
|
},
|
|
{
|
|
"entropy": 5.02023549079895,
|
|
"epoch": 6.394808004326663,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0002079232275618651,
|
|
"loss": 4.3945,
|
|
"mean_token_accuracy": 0.2529839798808098,
|
|
"num_tokens": 13281895.0,
|
|
"step": 5915
|
|
},
|
|
{
|
|
"entropy": 5.073026037216186,
|
|
"epoch": 6.400216333153056,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0002075139342818388,
|
|
"loss": 4.3994,
|
|
"mean_token_accuracy": 0.2498616933822632,
|
|
"num_tokens": 13292505.0,
|
|
"step": 5920
|
|
},
|
|
{
|
|
"entropy": 5.084267520904541,
|
|
"epoch": 6.405624661979449,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00020710488624633118,
|
|
"loss": 4.4115,
|
|
"mean_token_accuracy": 0.2495535284280777,
|
|
"num_tokens": 13304457.0,
|
|
"step": 5925
|
|
},
|
|
{
|
|
"entropy": 5.026647090911865,
|
|
"epoch": 6.411032990805841,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00020669608494182384,
|
|
"loss": 4.4381,
|
|
"mean_token_accuracy": 0.24386645257472991,
|
|
"num_tokens": 13316228.0,
|
|
"step": 5930
|
|
},
|
|
{
|
|
"entropy": 5.135671138763428,
|
|
"epoch": 6.416441319632233,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00020628753185390164,
|
|
"loss": 4.4866,
|
|
"mean_token_accuracy": 0.24633659720420836,
|
|
"num_tokens": 13327980.0,
|
|
"step": 5935
|
|
},
|
|
{
|
|
"entropy": 5.08243088722229,
|
|
"epoch": 6.421849648458626,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0002058792284672475,
|
|
"loss": 4.4853,
|
|
"mean_token_accuracy": 0.24394746273756027,
|
|
"num_tokens": 13339869.0,
|
|
"step": 5940
|
|
},
|
|
{
|
|
"entropy": 5.071419811248779,
|
|
"epoch": 6.427257977285019,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0002054711762656369,
|
|
"loss": 4.4195,
|
|
"mean_token_accuracy": 0.2557200253009796,
|
|
"num_tokens": 13350766.0,
|
|
"step": 5945
|
|
},
|
|
{
|
|
"entropy": 4.979526567459106,
|
|
"epoch": 6.432666306111411,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00020506337673193236,
|
|
"loss": 4.2973,
|
|
"mean_token_accuracy": 0.26564027220010755,
|
|
"num_tokens": 13362913.0,
|
|
"step": 5950
|
|
},
|
|
{
|
|
"entropy": 5.071963262557984,
|
|
"epoch": 6.438074634937804,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00020465583134807836,
|
|
"loss": 4.4282,
|
|
"mean_token_accuracy": 0.24921981245279312,
|
|
"num_tokens": 13374663.0,
|
|
"step": 5955
|
|
},
|
|
{
|
|
"entropy": 4.964849519729614,
|
|
"epoch": 6.443482963764197,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00020424854159509587,
|
|
"loss": 4.2875,
|
|
"mean_token_accuracy": 0.259347477555275,
|
|
"num_tokens": 13386201.0,
|
|
"step": 5960
|
|
},
|
|
{
|
|
"entropy": 5.019578218460083,
|
|
"epoch": 6.44889129259059,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0002038415089530767,
|
|
"loss": 4.3867,
|
|
"mean_token_accuracy": 0.2532976076006889,
|
|
"num_tokens": 13397079.0,
|
|
"step": 5965
|
|
},
|
|
{
|
|
"entropy": 5.100378894805909,
|
|
"epoch": 6.4542996214169825,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00020343473490117846,
|
|
"loss": 4.4254,
|
|
"mean_token_accuracy": 0.24831065237522126,
|
|
"num_tokens": 13409811.0,
|
|
"step": 5970
|
|
},
|
|
{
|
|
"entropy": 5.061957883834839,
|
|
"epoch": 6.4597079502433745,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.00020302822091761884,
|
|
"loss": 4.3451,
|
|
"mean_token_accuracy": 0.2666120633482933,
|
|
"num_tokens": 13419725.0,
|
|
"step": 5975
|
|
},
|
|
{
|
|
"entropy": 4.976794242858887,
|
|
"epoch": 6.465116279069767,
|
|
"grad_norm": 1.109375,
|
|
"learning_rate": 0.00020262196847967091,
|
|
"loss": 4.3184,
|
|
"mean_token_accuracy": 0.2538869589567184,
|
|
"num_tokens": 13430411.0,
|
|
"step": 5980
|
|
},
|
|
{
|
|
"entropy": 5.048067808151245,
|
|
"epoch": 6.47052460789616,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00020221597906365667,
|
|
"loss": 4.4166,
|
|
"mean_token_accuracy": 0.2553139790892601,
|
|
"num_tokens": 13440964.0,
|
|
"step": 5985
|
|
},
|
|
{
|
|
"entropy": 5.088424491882324,
|
|
"epoch": 6.475932936722553,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00020181025414494285,
|
|
"loss": 4.3973,
|
|
"mean_token_accuracy": 0.25630178302526474,
|
|
"num_tokens": 13451640.0,
|
|
"step": 5990
|
|
},
|
|
{
|
|
"entropy": 5.103601169586182,
|
|
"epoch": 6.481341265548945,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0002014047951979344,
|
|
"loss": 4.4259,
|
|
"mean_token_accuracy": 0.2498370200395584,
|
|
"num_tokens": 13463185.0,
|
|
"step": 5995
|
|
},
|
|
{
|
|
"entropy": 4.955135202407837,
|
|
"epoch": 6.486749594375338,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.0002009996036960704,
|
|
"loss": 4.2997,
|
|
"mean_token_accuracy": 0.2633310094475746,
|
|
"num_tokens": 13474675.0,
|
|
"step": 6000
|
|
},
|
|
{
|
|
"epoch": 6.486749594375338,
|
|
"eval_entropy": 4.99499137618325,
|
|
"eval_loss": 5.836542129516602,
|
|
"eval_mean_token_accuracy": 0.18491305688565426,
|
|
"eval_num_tokens": 13474675.0,
|
|
"eval_runtime": 2.519,
|
|
"eval_samples_per_second": 1395.391,
|
|
"eval_steps_per_second": 174.672,
|
|
"step": 6000
|
|
},
|
|
{
|
|
"entropy": 5.051985883712769,
|
|
"epoch": 6.492157923201731,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00020059468111181757,
|
|
"loss": 4.4725,
|
|
"mean_token_accuracy": 0.2510630890727043,
|
|
"num_tokens": 13485251.0,
|
|
"step": 6005
|
|
},
|
|
{
|
|
"entropy": 5.028152656555176,
|
|
"epoch": 6.497566252028124,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00020019002891666555,
|
|
"loss": 4.3506,
|
|
"mean_token_accuracy": 0.2615659937262535,
|
|
"num_tokens": 13496215.0,
|
|
"step": 6010
|
|
},
|
|
{
|
|
"entropy": 5.149411821365357,
|
|
"epoch": 6.502974580854516,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00019978564858112125,
|
|
"loss": 4.4626,
|
|
"mean_token_accuracy": 0.25140666365623476,
|
|
"num_tokens": 13507765.0,
|
|
"step": 6015
|
|
},
|
|
{
|
|
"entropy": 5.070692253112793,
|
|
"epoch": 6.5083829096809085,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.00019938154157470378,
|
|
"loss": 4.4209,
|
|
"mean_token_accuracy": 0.24932610988616943,
|
|
"num_tokens": 13517939.0,
|
|
"step": 6020
|
|
},
|
|
{
|
|
"entropy": 5.065640163421631,
|
|
"epoch": 6.513791238507301,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00019897770936593912,
|
|
"loss": 4.4342,
|
|
"mean_token_accuracy": 0.256855009496212,
|
|
"num_tokens": 13528660.0,
|
|
"step": 6025
|
|
},
|
|
{
|
|
"entropy": 5.124540376663208,
|
|
"epoch": 6.519199567333694,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0001985741534223543,
|
|
"loss": 4.5258,
|
|
"mean_token_accuracy": 0.2442253828048706,
|
|
"num_tokens": 13540887.0,
|
|
"step": 6030
|
|
},
|
|
{
|
|
"entropy": 5.059391450881958,
|
|
"epoch": 6.524607896160086,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00019817087521047244,
|
|
"loss": 4.3847,
|
|
"mean_token_accuracy": 0.2532155230641365,
|
|
"num_tokens": 13552358.0,
|
|
"step": 6035
|
|
},
|
|
{
|
|
"entropy": 5.036891746520996,
|
|
"epoch": 6.530016224986479,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00019776787619580767,
|
|
"loss": 4.3267,
|
|
"mean_token_accuracy": 0.2663475826382637,
|
|
"num_tokens": 13563041.0,
|
|
"step": 6040
|
|
},
|
|
{
|
|
"entropy": 5.037642621994019,
|
|
"epoch": 6.535424553812872,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0001973651578428593,
|
|
"loss": 4.3866,
|
|
"mean_token_accuracy": 0.25927049070596697,
|
|
"num_tokens": 13573762.0,
|
|
"step": 6045
|
|
},
|
|
{
|
|
"entropy": 5.018430423736572,
|
|
"epoch": 6.540832882639265,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00019696272161510663,
|
|
"loss": 4.307,
|
|
"mean_token_accuracy": 0.2604650154709816,
|
|
"num_tokens": 13584375.0,
|
|
"step": 6050
|
|
},
|
|
{
|
|
"entropy": 4.997407341003418,
|
|
"epoch": 6.546241211465657,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00019656056897500408,
|
|
"loss": 4.4501,
|
|
"mean_token_accuracy": 0.2437127023935318,
|
|
"num_tokens": 13595284.0,
|
|
"step": 6055
|
|
},
|
|
{
|
|
"entropy": 5.001697254180908,
|
|
"epoch": 6.55164954029205,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00019615870138397506,
|
|
"loss": 4.3411,
|
|
"mean_token_accuracy": 0.25979588478803634,
|
|
"num_tokens": 13605309.0,
|
|
"step": 6060
|
|
},
|
|
{
|
|
"entropy": 5.089562225341797,
|
|
"epoch": 6.5570578691184425,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0001957571203024075,
|
|
"loss": 4.4247,
|
|
"mean_token_accuracy": 0.24507840424776078,
|
|
"num_tokens": 13616779.0,
|
|
"step": 6065
|
|
},
|
|
{
|
|
"entropy": 5.062054443359375,
|
|
"epoch": 6.562466197944835,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.00019535582718964773,
|
|
"loss": 4.3915,
|
|
"mean_token_accuracy": 0.25523719787597654,
|
|
"num_tokens": 13626780.0,
|
|
"step": 6070
|
|
},
|
|
{
|
|
"entropy": 4.994085264205933,
|
|
"epoch": 6.567874526771227,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00019495482350399612,
|
|
"loss": 4.3342,
|
|
"mean_token_accuracy": 0.2563098341226578,
|
|
"num_tokens": 13637475.0,
|
|
"step": 6075
|
|
},
|
|
{
|
|
"entropy": 5.031903076171875,
|
|
"epoch": 6.57328285559762,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.0001945541107027009,
|
|
"loss": 4.3988,
|
|
"mean_token_accuracy": 0.256773878633976,
|
|
"num_tokens": 13649427.0,
|
|
"step": 6080
|
|
},
|
|
{
|
|
"entropy": 5.070287370681763,
|
|
"epoch": 6.578691184424013,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0001941536902419533,
|
|
"loss": 4.3717,
|
|
"mean_token_accuracy": 0.25241320580244064,
|
|
"num_tokens": 13661080.0,
|
|
"step": 6085
|
|
},
|
|
{
|
|
"entropy": 5.083251667022705,
|
|
"epoch": 6.584099513250406,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00019375356357688206,
|
|
"loss": 4.4781,
|
|
"mean_token_accuracy": 0.24630598723888397,
|
|
"num_tokens": 13673056.0,
|
|
"step": 6090
|
|
},
|
|
{
|
|
"entropy": 5.078111028671264,
|
|
"epoch": 6.589507842076799,
|
|
"grad_norm": 1.0859375,
|
|
"learning_rate": 0.00019335373216154862,
|
|
"loss": 4.4042,
|
|
"mean_token_accuracy": 0.2559408724308014,
|
|
"num_tokens": 13684301.0,
|
|
"step": 6095
|
|
},
|
|
{
|
|
"entropy": 5.078533029556274,
|
|
"epoch": 6.594916170903191,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00019295419744894116,
|
|
"loss": 4.4343,
|
|
"mean_token_accuracy": 0.25495272874832153,
|
|
"num_tokens": 13696302.0,
|
|
"step": 6100
|
|
},
|
|
{
|
|
"entropy": 4.987753963470459,
|
|
"epoch": 6.600324499729584,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.00019255496089096985,
|
|
"loss": 4.3148,
|
|
"mean_token_accuracy": 0.25428665429353714,
|
|
"num_tokens": 13708483.0,
|
|
"step": 6105
|
|
},
|
|
{
|
|
"entropy": 4.978847980499268,
|
|
"epoch": 6.605732828555976,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00019215602393846104,
|
|
"loss": 4.3049,
|
|
"mean_token_accuracy": 0.26385919451713563,
|
|
"num_tokens": 13719990.0,
|
|
"step": 6110
|
|
},
|
|
{
|
|
"entropy": 5.0188313007354735,
|
|
"epoch": 6.611141157382368,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00019175738804115279,
|
|
"loss": 4.3819,
|
|
"mean_token_accuracy": 0.24871505349874495,
|
|
"num_tokens": 13730277.0,
|
|
"step": 6115
|
|
},
|
|
{
|
|
"entropy": 4.979892730712891,
|
|
"epoch": 6.616549486208761,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00019135905464768882,
|
|
"loss": 4.3128,
|
|
"mean_token_accuracy": 0.2639435723423958,
|
|
"num_tokens": 13741380.0,
|
|
"step": 6120
|
|
},
|
|
{
|
|
"entropy": 5.031826114654541,
|
|
"epoch": 6.621957815035154,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.00019096102520561344,
|
|
"loss": 4.3917,
|
|
"mean_token_accuracy": 0.2596174836158752,
|
|
"num_tokens": 13752195.0,
|
|
"step": 6125
|
|
},
|
|
{
|
|
"entropy": 5.041347646713257,
|
|
"epoch": 6.627366143861547,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00019056330116136666,
|
|
"loss": 4.4845,
|
|
"mean_token_accuracy": 0.24363041520118714,
|
|
"num_tokens": 13763677.0,
|
|
"step": 6130
|
|
},
|
|
{
|
|
"entropy": 5.080750179290772,
|
|
"epoch": 6.63277447268794,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00019016588396027862,
|
|
"loss": 4.3602,
|
|
"mean_token_accuracy": 0.2618069052696228,
|
|
"num_tokens": 13776170.0,
|
|
"step": 6135
|
|
},
|
|
{
|
|
"entropy": 5.119608068466187,
|
|
"epoch": 6.638182801514332,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00018976877504656438,
|
|
"loss": 4.4695,
|
|
"mean_token_accuracy": 0.25052051693201066,
|
|
"num_tokens": 13787971.0,
|
|
"step": 6140
|
|
},
|
|
{
|
|
"entropy": 5.064221668243408,
|
|
"epoch": 6.643591130340725,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0001893719758633185,
|
|
"loss": 4.4041,
|
|
"mean_token_accuracy": 0.2470262587070465,
|
|
"num_tokens": 13797744.0,
|
|
"step": 6145
|
|
},
|
|
{
|
|
"entropy": 4.9794238090515135,
|
|
"epoch": 6.6489994591671175,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00018897548785251018,
|
|
"loss": 4.3843,
|
|
"mean_token_accuracy": 0.2539071038365364,
|
|
"num_tokens": 13808454.0,
|
|
"step": 6150
|
|
},
|
|
{
|
|
"entropy": 5.070931673049927,
|
|
"epoch": 6.6544077879935095,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0001885793124549779,
|
|
"loss": 4.4354,
|
|
"mean_token_accuracy": 0.25262498706579206,
|
|
"num_tokens": 13818447.0,
|
|
"step": 6155
|
|
},
|
|
{
|
|
"entropy": 5.062826013565063,
|
|
"epoch": 6.659816116819902,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.00018818345111042383,
|
|
"loss": 4.4366,
|
|
"mean_token_accuracy": 0.2508914113044739,
|
|
"num_tokens": 13829861.0,
|
|
"step": 6160
|
|
},
|
|
{
|
|
"entropy": 5.080803251266479,
|
|
"epoch": 6.665224445646295,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00018778790525740907,
|
|
"loss": 4.4193,
|
|
"mean_token_accuracy": 0.24584500193595887,
|
|
"num_tokens": 13840954.0,
|
|
"step": 6165
|
|
},
|
|
{
|
|
"entropy": 5.07553882598877,
|
|
"epoch": 6.670632774472688,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00018739267633334806,
|
|
"loss": 4.4203,
|
|
"mean_token_accuracy": 0.2539111986756325,
|
|
"num_tokens": 13851925.0,
|
|
"step": 6170
|
|
},
|
|
{
|
|
"entropy": 5.066948080062867,
|
|
"epoch": 6.676041103299081,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00018699776577450378,
|
|
"loss": 4.4634,
|
|
"mean_token_accuracy": 0.2510394036769867,
|
|
"num_tokens": 13863461.0,
|
|
"step": 6175
|
|
},
|
|
{
|
|
"entropy": 5.086579990386963,
|
|
"epoch": 6.681449432125473,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00018660317501598212,
|
|
"loss": 4.4375,
|
|
"mean_token_accuracy": 0.24805576503276824,
|
|
"num_tokens": 13875542.0,
|
|
"step": 6180
|
|
},
|
|
{
|
|
"entropy": 5.043572902679443,
|
|
"epoch": 6.686857760951866,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0001862089054917266,
|
|
"loss": 4.4302,
|
|
"mean_token_accuracy": 0.2491949215531349,
|
|
"num_tokens": 13886730.0,
|
|
"step": 6185
|
|
},
|
|
{
|
|
"entropy": 5.034563159942627,
|
|
"epoch": 6.692266089778259,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0001858149586345137,
|
|
"loss": 4.3659,
|
|
"mean_token_accuracy": 0.2481128305196762,
|
|
"num_tokens": 13897738.0,
|
|
"step": 6190
|
|
},
|
|
{
|
|
"entropy": 4.981719589233398,
|
|
"epoch": 6.6976744186046515,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00018542133587594735,
|
|
"loss": 4.407,
|
|
"mean_token_accuracy": 0.2527224957942963,
|
|
"num_tokens": 13909833.0,
|
|
"step": 6195
|
|
},
|
|
{
|
|
"entropy": 4.99197359085083,
|
|
"epoch": 6.7030827474310435,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00018502803864645334,
|
|
"loss": 4.4097,
|
|
"mean_token_accuracy": 0.25448833853006364,
|
|
"num_tokens": 13920713.0,
|
|
"step": 6200
|
|
},
|
|
{
|
|
"entropy": 5.083625650405883,
|
|
"epoch": 6.708491076257436,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00018463506837527484,
|
|
"loss": 4.4081,
|
|
"mean_token_accuracy": 0.25269451141357424,
|
|
"num_tokens": 13931058.0,
|
|
"step": 6205
|
|
},
|
|
{
|
|
"entropy": 5.100012874603271,
|
|
"epoch": 6.713899405083829,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00018424242649046663,
|
|
"loss": 4.3938,
|
|
"mean_token_accuracy": 0.24803317189216614,
|
|
"num_tokens": 13941817.0,
|
|
"step": 6210
|
|
},
|
|
{
|
|
"entropy": 5.045680332183838,
|
|
"epoch": 6.719307733910222,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.00018385011441889037,
|
|
"loss": 4.3818,
|
|
"mean_token_accuracy": 0.25096606016159057,
|
|
"num_tokens": 13952440.0,
|
|
"step": 6215
|
|
},
|
|
{
|
|
"entropy": 5.0478486061096195,
|
|
"epoch": 6.724716062736614,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00018345813358620894,
|
|
"loss": 4.4759,
|
|
"mean_token_accuracy": 0.24573649615049362,
|
|
"num_tokens": 13963527.0,
|
|
"step": 6220
|
|
},
|
|
{
|
|
"entropy": 4.995173454284668,
|
|
"epoch": 6.730124391563007,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0001830664854168816,
|
|
"loss": 4.3442,
|
|
"mean_token_accuracy": 0.2552725374698639,
|
|
"num_tokens": 13974438.0,
|
|
"step": 6225
|
|
},
|
|
{
|
|
"entropy": 5.07252869606018,
|
|
"epoch": 6.7355327203894,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00018267517133415862,
|
|
"loss": 4.4854,
|
|
"mean_token_accuracy": 0.2412521317601204,
|
|
"num_tokens": 13985700.0,
|
|
"step": 6230
|
|
},
|
|
{
|
|
"entropy": 5.082022190093994,
|
|
"epoch": 6.740941049215793,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.00018228419276007646,
|
|
"loss": 4.438,
|
|
"mean_token_accuracy": 0.25020346492528917,
|
|
"num_tokens": 13996506.0,
|
|
"step": 6235
|
|
},
|
|
{
|
|
"entropy": 5.065981721878051,
|
|
"epoch": 6.746349378042185,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.00018189355111545208,
|
|
"loss": 4.3584,
|
|
"mean_token_accuracy": 0.26188009828329084,
|
|
"num_tokens": 14006200.0,
|
|
"step": 6240
|
|
},
|
|
{
|
|
"entropy": 4.97220401763916,
|
|
"epoch": 6.7517577068685775,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0001815032478198781,
|
|
"loss": 4.336,
|
|
"mean_token_accuracy": 0.2542742371559143,
|
|
"num_tokens": 14019034.0,
|
|
"step": 6245
|
|
},
|
|
{
|
|
"entropy": 4.926880121231079,
|
|
"epoch": 6.75716603569497,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00018111328429171747,
|
|
"loss": 4.2936,
|
|
"mean_token_accuracy": 0.2622652530670166,
|
|
"num_tokens": 14029120.0,
|
|
"step": 6250
|
|
},
|
|
{
|
|
"entropy": 5.0433652877807615,
|
|
"epoch": 6.762574364521363,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00018072366194809886,
|
|
"loss": 4.3725,
|
|
"mean_token_accuracy": 0.2598146826028824,
|
|
"num_tokens": 14039815.0,
|
|
"step": 6255
|
|
},
|
|
{
|
|
"entropy": 5.043849277496338,
|
|
"epoch": 6.767982693347756,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.00018033438220491055,
|
|
"loss": 4.4102,
|
|
"mean_token_accuracy": 0.25299872606992724,
|
|
"num_tokens": 14050872.0,
|
|
"step": 6260
|
|
},
|
|
{
|
|
"entropy": 5.051742458343506,
|
|
"epoch": 6.773391022174148,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.000179945446476796,
|
|
"loss": 4.4016,
|
|
"mean_token_accuracy": 0.25750668793916703,
|
|
"num_tokens": 14063037.0,
|
|
"step": 6265
|
|
},
|
|
{
|
|
"entropy": 5.011670827865601,
|
|
"epoch": 6.778799351000541,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00017955685617714867,
|
|
"loss": 4.3649,
|
|
"mean_token_accuracy": 0.2531865179538727,
|
|
"num_tokens": 14074552.0,
|
|
"step": 6270
|
|
},
|
|
{
|
|
"entropy": 5.034688186645508,
|
|
"epoch": 6.784207679826934,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0001791686127181066,
|
|
"loss": 4.4154,
|
|
"mean_token_accuracy": 0.24566543251276016,
|
|
"num_tokens": 14086573.0,
|
|
"step": 6275
|
|
},
|
|
{
|
|
"entropy": 4.992395114898682,
|
|
"epoch": 6.789616008653326,
|
|
"grad_norm": 0.984375,
|
|
"learning_rate": 0.00017878071751054736,
|
|
"loss": 4.3329,
|
|
"mean_token_accuracy": 0.26362760215997694,
|
|
"num_tokens": 14098462.0,
|
|
"step": 6280
|
|
},
|
|
{
|
|
"entropy": 4.978204870223999,
|
|
"epoch": 6.795024337479719,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00017839317196408305,
|
|
"loss": 4.3378,
|
|
"mean_token_accuracy": 0.2639243483543396,
|
|
"num_tokens": 14110829.0,
|
|
"step": 6285
|
|
},
|
|
{
|
|
"entropy": 5.04187650680542,
|
|
"epoch": 6.800432666306111,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00017800597748705494,
|
|
"loss": 4.3598,
|
|
"mean_token_accuracy": 0.25356006622314453,
|
|
"num_tokens": 14121498.0,
|
|
"step": 6290
|
|
},
|
|
{
|
|
"entropy": 4.968077707290649,
|
|
"epoch": 6.805840995132504,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0001776191354865289,
|
|
"loss": 4.3714,
|
|
"mean_token_accuracy": 0.25659865885972977,
|
|
"num_tokens": 14132281.0,
|
|
"step": 6295
|
|
},
|
|
{
|
|
"entropy": 5.01002836227417,
|
|
"epoch": 6.811249323958897,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00017723264736828952,
|
|
"loss": 4.3759,
|
|
"mean_token_accuracy": 0.258736626803875,
|
|
"num_tokens": 14143735.0,
|
|
"step": 6300
|
|
},
|
|
{
|
|
"entropy": 5.004378175735473,
|
|
"epoch": 6.816657652785289,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.00017684651453683554,
|
|
"loss": 4.3616,
|
|
"mean_token_accuracy": 0.2643740698695183,
|
|
"num_tokens": 14156528.0,
|
|
"step": 6305
|
|
},
|
|
{
|
|
"entropy": 5.080388975143433,
|
|
"epoch": 6.822065981611682,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00017646073839537458,
|
|
"loss": 4.4164,
|
|
"mean_token_accuracy": 0.25163800567388533,
|
|
"num_tokens": 14167549.0,
|
|
"step": 6310
|
|
},
|
|
{
|
|
"entropy": 4.987241172790528,
|
|
"epoch": 6.827474310438075,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00017607532034581797,
|
|
"loss": 4.3787,
|
|
"mean_token_accuracy": 0.2616769775748253,
|
|
"num_tokens": 14179163.0,
|
|
"step": 6315
|
|
},
|
|
{
|
|
"entropy": 5.087628602981567,
|
|
"epoch": 6.832882639264467,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00017569026178877584,
|
|
"loss": 4.4934,
|
|
"mean_token_accuracy": 0.23831370919942857,
|
|
"num_tokens": 14190410.0,
|
|
"step": 6320
|
|
},
|
|
{
|
|
"entropy": 5.103442668914795,
|
|
"epoch": 6.83829096809086,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0001753055641235519,
|
|
"loss": 4.4662,
|
|
"mean_token_accuracy": 0.2572033628821373,
|
|
"num_tokens": 14201359.0,
|
|
"step": 6325
|
|
},
|
|
{
|
|
"entropy": 5.032428455352783,
|
|
"epoch": 6.8436992969172525,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.00017492122874813824,
|
|
"loss": 4.4362,
|
|
"mean_token_accuracy": 0.2550900116562843,
|
|
"num_tokens": 14213199.0,
|
|
"step": 6330
|
|
},
|
|
{
|
|
"entropy": 5.013171529769897,
|
|
"epoch": 6.849107625743645,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0001745372570592107,
|
|
"loss": 4.3387,
|
|
"mean_token_accuracy": 0.2530654102563858,
|
|
"num_tokens": 14223908.0,
|
|
"step": 6335
|
|
},
|
|
{
|
|
"entropy": 4.984734153747558,
|
|
"epoch": 6.854515954570038,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00017415365045212312,
|
|
"loss": 4.2719,
|
|
"mean_token_accuracy": 0.2703628957271576,
|
|
"num_tokens": 14234172.0,
|
|
"step": 6340
|
|
},
|
|
{
|
|
"entropy": 5.106651687622071,
|
|
"epoch": 6.85992428339643,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00017377041032090278,
|
|
"loss": 4.4782,
|
|
"mean_token_accuracy": 0.2443339854478836,
|
|
"num_tokens": 14245987.0,
|
|
"step": 6345
|
|
},
|
|
{
|
|
"entropy": 5.006739091873169,
|
|
"epoch": 6.865332612222823,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.00017338753805824536,
|
|
"loss": 4.3987,
|
|
"mean_token_accuracy": 0.25435530990362165,
|
|
"num_tokens": 14257498.0,
|
|
"step": 6350
|
|
},
|
|
{
|
|
"entropy": 5.003452920913697,
|
|
"epoch": 6.870740941049216,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.00017300503505550939,
|
|
"loss": 4.2676,
|
|
"mean_token_accuracy": 0.26885790675878524,
|
|
"num_tokens": 14268292.0,
|
|
"step": 6355
|
|
},
|
|
{
|
|
"entropy": 5.032485866546631,
|
|
"epoch": 6.876149269875609,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00017262290270271175,
|
|
"loss": 4.3963,
|
|
"mean_token_accuracy": 0.25891978293657303,
|
|
"num_tokens": 14278915.0,
|
|
"step": 6360
|
|
},
|
|
{
|
|
"entropy": 5.050757598876953,
|
|
"epoch": 6.881557598702001,
|
|
"grad_norm": 1.15625,
|
|
"learning_rate": 0.00017224114238852234,
|
|
"loss": 4.5123,
|
|
"mean_token_accuracy": 0.23922555446624755,
|
|
"num_tokens": 14290621.0,
|
|
"step": 6365
|
|
},
|
|
{
|
|
"entropy": 5.0953703880310055,
|
|
"epoch": 6.886965927528394,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.0001718597555002588,
|
|
"loss": 4.403,
|
|
"mean_token_accuracy": 0.25237501561641695,
|
|
"num_tokens": 14300524.0,
|
|
"step": 6370
|
|
},
|
|
{
|
|
"entropy": 5.072704172134399,
|
|
"epoch": 6.8923742563547865,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.00017147874342388227,
|
|
"loss": 4.4032,
|
|
"mean_token_accuracy": 0.25021582692861555,
|
|
"num_tokens": 14313026.0,
|
|
"step": 6375
|
|
},
|
|
{
|
|
"entropy": 5.037555932998657,
|
|
"epoch": 6.897782585181179,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0001710981075439913,
|
|
"loss": 4.351,
|
|
"mean_token_accuracy": 0.256275562942028,
|
|
"num_tokens": 14324705.0,
|
|
"step": 6380
|
|
},
|
|
{
|
|
"entropy": 5.082475900650024,
|
|
"epoch": 6.903190914007571,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00017071784924381766,
|
|
"loss": 4.4762,
|
|
"mean_token_accuracy": 0.2436447933316231,
|
|
"num_tokens": 14335818.0,
|
|
"step": 6385
|
|
},
|
|
{
|
|
"entropy": 4.951475000381469,
|
|
"epoch": 6.908599242833964,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00017033796990522081,
|
|
"loss": 4.3767,
|
|
"mean_token_accuracy": 0.2630766794085503,
|
|
"num_tokens": 14347339.0,
|
|
"step": 6390
|
|
},
|
|
{
|
|
"entropy": 5.0039839267730715,
|
|
"epoch": 6.914007571660357,
|
|
"grad_norm": 1.078125,
|
|
"learning_rate": 0.00016995847090868322,
|
|
"loss": 4.4159,
|
|
"mean_token_accuracy": 0.2499029144644737,
|
|
"num_tokens": 14359080.0,
|
|
"step": 6395
|
|
},
|
|
{
|
|
"entropy": 5.109274244308471,
|
|
"epoch": 6.91941590048675,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.00016957935363330506,
|
|
"loss": 4.4179,
|
|
"mean_token_accuracy": 0.25004090517759325,
|
|
"num_tokens": 14370661.0,
|
|
"step": 6400
|
|
},
|
|
{
|
|
"entropy": 5.071283388137817,
|
|
"epoch": 6.924824229313142,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00016920061945679951,
|
|
"loss": 4.4489,
|
|
"mean_token_accuracy": 0.24825301319360732,
|
|
"num_tokens": 14382674.0,
|
|
"step": 6405
|
|
},
|
|
{
|
|
"entropy": 5.030256605148315,
|
|
"epoch": 6.930232558139535,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0001688222697554872,
|
|
"loss": 4.4376,
|
|
"mean_token_accuracy": 0.24543880224227904,
|
|
"num_tokens": 14393469.0,
|
|
"step": 6410
|
|
},
|
|
{
|
|
"entropy": 5.0154882907867435,
|
|
"epoch": 6.935640886965928,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.000168444305904292,
|
|
"loss": 4.424,
|
|
"mean_token_accuracy": 0.24721497893333436,
|
|
"num_tokens": 14403934.0,
|
|
"step": 6415
|
|
},
|
|
{
|
|
"entropy": 5.087857961654663,
|
|
"epoch": 6.9410492157923205,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.00016806672927673552,
|
|
"loss": 4.4505,
|
|
"mean_token_accuracy": 0.24524039328098296,
|
|
"num_tokens": 14415244.0,
|
|
"step": 6420
|
|
},
|
|
{
|
|
"entropy": 5.064149379730225,
|
|
"epoch": 6.9464575446187125,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.00016768954124493188,
|
|
"loss": 4.4485,
|
|
"mean_token_accuracy": 0.24874307513236998,
|
|
"num_tokens": 14425996.0,
|
|
"step": 6425
|
|
},
|
|
{
|
|
"entropy": 5.081220245361328,
|
|
"epoch": 6.951865873445105,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00016731274317958333,
|
|
"loss": 4.4,
|
|
"mean_token_accuracy": 0.24960332363843918,
|
|
"num_tokens": 14437133.0,
|
|
"step": 6430
|
|
},
|
|
{
|
|
"entropy": 5.005716848373413,
|
|
"epoch": 6.957274202271498,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0001669363364499749,
|
|
"loss": 4.3384,
|
|
"mean_token_accuracy": 0.260642284154892,
|
|
"num_tokens": 14447475.0,
|
|
"step": 6435
|
|
},
|
|
{
|
|
"entropy": 5.038949298858642,
|
|
"epoch": 6.962682531097891,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00016656032242396958,
|
|
"loss": 4.3229,
|
|
"mean_token_accuracy": 0.2627637773752213,
|
|
"num_tokens": 14458096.0,
|
|
"step": 6440
|
|
},
|
|
{
|
|
"entropy": 5.082088422775269,
|
|
"epoch": 6.968090859924283,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00016618470246800322,
|
|
"loss": 4.4153,
|
|
"mean_token_accuracy": 0.25560260862112044,
|
|
"num_tokens": 14468743.0,
|
|
"step": 6445
|
|
},
|
|
{
|
|
"entropy": 5.108864164352417,
|
|
"epoch": 6.973499188750676,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00016580947794707937,
|
|
"loss": 4.4584,
|
|
"mean_token_accuracy": 0.2501847818493843,
|
|
"num_tokens": 14480762.0,
|
|
"step": 6450
|
|
},
|
|
{
|
|
"entropy": 5.0405871868133545,
|
|
"epoch": 6.978907517577069,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.00016543465022476512,
|
|
"loss": 4.4645,
|
|
"mean_token_accuracy": 0.24302249699831008,
|
|
"num_tokens": 14493335.0,
|
|
"step": 6455
|
|
},
|
|
{
|
|
"entropy": 5.066973733901977,
|
|
"epoch": 6.984315846403462,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0001650602206631852,
|
|
"loss": 4.3629,
|
|
"mean_token_accuracy": 0.25677103698253634,
|
|
"num_tokens": 14504030.0,
|
|
"step": 6460
|
|
},
|
|
{
|
|
"entropy": 4.922259902954101,
|
|
"epoch": 6.9897241752298545,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.00016468619062301739,
|
|
"loss": 4.2964,
|
|
"mean_token_accuracy": 0.26251343786716463,
|
|
"num_tokens": 14515248.0,
|
|
"step": 6465
|
|
},
|
|
{
|
|
"entropy": 5.073311281204224,
|
|
"epoch": 6.995132504056246,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0001643125614634877,
|
|
"loss": 4.4481,
|
|
"mean_token_accuracy": 0.25071563571691513,
|
|
"num_tokens": 14528199.0,
|
|
"step": 6470
|
|
},
|
|
{
|
|
"entropy": 5.015670564439562,
|
|
"epoch": 7.0,
|
|
"grad_norm": 2.21875,
|
|
"learning_rate": 0.0001639393345423656,
|
|
"loss": 4.4295,
|
|
"mean_token_accuracy": 0.23796683053175607,
|
|
"num_tokens": 14538223.0,
|
|
"step": 6475
|
|
},
|
|
{
|
|
"entropy": 5.023006820678711,
|
|
"epoch": 7.005408328826393,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.00016356651121595832,
|
|
"loss": 4.2597,
|
|
"mean_token_accuracy": 0.27105399668216706,
|
|
"num_tokens": 14548193.0,
|
|
"step": 6480
|
|
},
|
|
{
|
|
"entropy": 5.025756549835205,
|
|
"epoch": 7.010816657652786,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0001631940928391068,
|
|
"loss": 4.3001,
|
|
"mean_token_accuracy": 0.2477104991674423,
|
|
"num_tokens": 14560091.0,
|
|
"step": 6485
|
|
},
|
|
{
|
|
"entropy": 5.083572196960449,
|
|
"epoch": 7.016224986479178,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00016282208076518032,
|
|
"loss": 4.3227,
|
|
"mean_token_accuracy": 0.2601667821407318,
|
|
"num_tokens": 14572500.0,
|
|
"step": 6490
|
|
},
|
|
{
|
|
"entropy": 5.049762535095215,
|
|
"epoch": 7.0216333153055706,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00016245047634607155,
|
|
"loss": 4.2265,
|
|
"mean_token_accuracy": 0.27163512259721756,
|
|
"num_tokens": 14583710.0,
|
|
"step": 6495
|
|
},
|
|
{
|
|
"entropy": 5.093182706832886,
|
|
"epoch": 7.027041644131963,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.0001620792809321919,
|
|
"loss": 4.3369,
|
|
"mean_token_accuracy": 0.2588976681232452,
|
|
"num_tokens": 14594261.0,
|
|
"step": 6500
|
|
},
|
|
{
|
|
"entropy": 5.090839481353759,
|
|
"epoch": 7.032449972958356,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00016170849587246623,
|
|
"loss": 4.2884,
|
|
"mean_token_accuracy": 0.2641767144203186,
|
|
"num_tokens": 14606831.0,
|
|
"step": 6505
|
|
},
|
|
{
|
|
"entropy": 4.983487319946289,
|
|
"epoch": 7.037858301784748,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.00016133812251432826,
|
|
"loss": 4.1764,
|
|
"mean_token_accuracy": 0.2790094017982483,
|
|
"num_tokens": 14617883.0,
|
|
"step": 6510
|
|
},
|
|
{
|
|
"entropy": 5.084652423858643,
|
|
"epoch": 7.043266630611141,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0001609681622037159,
|
|
"loss": 4.286,
|
|
"mean_token_accuracy": 0.2671323537826538,
|
|
"num_tokens": 14629808.0,
|
|
"step": 6515
|
|
},
|
|
{
|
|
"entropy": 5.007026100158692,
|
|
"epoch": 7.048674959437534,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.00016059861628506557,
|
|
"loss": 4.2297,
|
|
"mean_token_accuracy": 0.2650361075997353,
|
|
"num_tokens": 14641311.0,
|
|
"step": 6520
|
|
},
|
|
{
|
|
"entropy": 4.958455038070679,
|
|
"epoch": 7.054083288263927,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.00016022948610130804,
|
|
"loss": 4.1835,
|
|
"mean_token_accuracy": 0.2756687641143799,
|
|
"num_tokens": 14653251.0,
|
|
"step": 6525
|
|
},
|
|
{
|
|
"entropy": 5.0243387699127195,
|
|
"epoch": 7.059491617090319,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0001598607729938632,
|
|
"loss": 4.2587,
|
|
"mean_token_accuracy": 0.2588470131158829,
|
|
"num_tokens": 14664519.0,
|
|
"step": 6530
|
|
},
|
|
{
|
|
"entropy": 5.073196601867676,
|
|
"epoch": 7.064899945916712,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.00015949247830263538,
|
|
"loss": 4.3162,
|
|
"mean_token_accuracy": 0.2613358452916145,
|
|
"num_tokens": 14676121.0,
|
|
"step": 6535
|
|
},
|
|
{
|
|
"entropy": 5.11065788269043,
|
|
"epoch": 7.0703082747431045,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00015912460336600838,
|
|
"loss": 4.3342,
|
|
"mean_token_accuracy": 0.2617495536804199,
|
|
"num_tokens": 14686812.0,
|
|
"step": 6540
|
|
},
|
|
{
|
|
"entropy": 5.012769794464111,
|
|
"epoch": 7.075716603569497,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00015875714952084054,
|
|
"loss": 4.2213,
|
|
"mean_token_accuracy": 0.267040154337883,
|
|
"num_tokens": 14699261.0,
|
|
"step": 6545
|
|
},
|
|
{
|
|
"entropy": 5.0103431224823,
|
|
"epoch": 7.081124932395889,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.00015839011810245984,
|
|
"loss": 4.2486,
|
|
"mean_token_accuracy": 0.2597258597612381,
|
|
"num_tokens": 14710292.0,
|
|
"step": 6550
|
|
},
|
|
{
|
|
"entropy": 4.977768993377685,
|
|
"epoch": 7.086533261222282,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0001580235104446596,
|
|
"loss": 4.2033,
|
|
"mean_token_accuracy": 0.2763218477368355,
|
|
"num_tokens": 14721541.0,
|
|
"step": 6555
|
|
},
|
|
{
|
|
"entropy": 5.003844451904297,
|
|
"epoch": 7.091941590048675,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00015765732787969267,
|
|
"loss": 4.2226,
|
|
"mean_token_accuracy": 0.27141197621822355,
|
|
"num_tokens": 14734741.0,
|
|
"step": 6560
|
|
},
|
|
{
|
|
"entropy": 5.039033842086792,
|
|
"epoch": 7.097349918875068,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.00015729157173826724,
|
|
"loss": 4.2267,
|
|
"mean_token_accuracy": 0.266393680870533,
|
|
"num_tokens": 14745131.0,
|
|
"step": 6565
|
|
},
|
|
{
|
|
"entropy": 5.06445345878601,
|
|
"epoch": 7.10275824770146,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00015692624334954236,
|
|
"loss": 4.2578,
|
|
"mean_token_accuracy": 0.2641780063509941,
|
|
"num_tokens": 14756874.0,
|
|
"step": 6570
|
|
},
|
|
{
|
|
"entropy": 4.95060453414917,
|
|
"epoch": 7.108166576527853,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0001565613440411219,
|
|
"loss": 4.246,
|
|
"mean_token_accuracy": 0.2585922464728355,
|
|
"num_tokens": 14769275.0,
|
|
"step": 6575
|
|
},
|
|
{
|
|
"entropy": 5.018890810012818,
|
|
"epoch": 7.113574905354246,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.0001561968751390509,
|
|
"loss": 4.3103,
|
|
"mean_token_accuracy": 0.2543923735618591,
|
|
"num_tokens": 14780631.0,
|
|
"step": 6580
|
|
},
|
|
{
|
|
"entropy": 5.090313386917114,
|
|
"epoch": 7.1189832341806385,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 0.00015583283796781022,
|
|
"loss": 4.3077,
|
|
"mean_token_accuracy": 0.2603401944041252,
|
|
"num_tokens": 14790881.0,
|
|
"step": 6585
|
|
},
|
|
{
|
|
"entropy": 5.074099731445313,
|
|
"epoch": 7.1243915630070305,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00015546923385031169,
|
|
"loss": 4.2245,
|
|
"mean_token_accuracy": 0.2835828512907028,
|
|
"num_tokens": 14800688.0,
|
|
"step": 6590
|
|
},
|
|
{
|
|
"entropy": 5.0965980052947994,
|
|
"epoch": 7.129799891833423,
|
|
"grad_norm": 1.171875,
|
|
"learning_rate": 0.00015510606410789368,
|
|
"loss": 4.2824,
|
|
"mean_token_accuracy": 0.27382891774177553,
|
|
"num_tokens": 14812137.0,
|
|
"step": 6595
|
|
},
|
|
{
|
|
"entropy": 5.070303916931152,
|
|
"epoch": 7.135208220659816,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.0001547433300603157,
|
|
"loss": 4.3349,
|
|
"mean_token_accuracy": 0.26968000680208204,
|
|
"num_tokens": 14824106.0,
|
|
"step": 6600
|
|
},
|
|
{
|
|
"entropy": 4.939570713043213,
|
|
"epoch": 7.140616549486209,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00015438103302575413,
|
|
"loss": 4.2008,
|
|
"mean_token_accuracy": 0.26423227936029436,
|
|
"num_tokens": 14835391.0,
|
|
"step": 6605
|
|
},
|
|
{
|
|
"entropy": 4.966554927825928,
|
|
"epoch": 7.146024878312601,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0001540191743207974,
|
|
"loss": 4.2692,
|
|
"mean_token_accuracy": 0.26084975600242616,
|
|
"num_tokens": 14846371.0,
|
|
"step": 6610
|
|
},
|
|
{
|
|
"entropy": 5.008520650863647,
|
|
"epoch": 7.151433207138994,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.0001536577552604407,
|
|
"loss": 4.2917,
|
|
"mean_token_accuracy": 0.2573446035385132,
|
|
"num_tokens": 14857492.0,
|
|
"step": 6615
|
|
},
|
|
{
|
|
"entropy": 5.059720373153686,
|
|
"epoch": 7.156841535965387,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00015329677715808176,
|
|
"loss": 4.2785,
|
|
"mean_token_accuracy": 0.2709147557616234,
|
|
"num_tokens": 14868740.0,
|
|
"step": 6620
|
|
},
|
|
{
|
|
"entropy": 5.0221700191497805,
|
|
"epoch": 7.16224986479178,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 0.00015293624132551591,
|
|
"loss": 4.2784,
|
|
"mean_token_accuracy": 0.27195259630680085,
|
|
"num_tokens": 14880049.0,
|
|
"step": 6625
|
|
},
|
|
{
|
|
"entropy": 4.951564359664917,
|
|
"epoch": 7.167658193618172,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.0001525761490729312,
|
|
"loss": 4.1726,
|
|
"mean_token_accuracy": 0.2827020436525345,
|
|
"num_tokens": 14890836.0,
|
|
"step": 6630
|
|
},
|
|
{
|
|
"entropy": 4.990854120254516,
|
|
"epoch": 7.173066522444564,
|
|
"grad_norm": 1.2734375,
|
|
"learning_rate": 0.0001522165017089036,
|
|
"loss": 4.2819,
|
|
"mean_token_accuracy": 0.2647485643625259,
|
|
"num_tokens": 14901666.0,
|
|
"step": 6635
|
|
},
|
|
{
|
|
"entropy": 4.981500816345215,
|
|
"epoch": 7.178474851270957,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 0.00015185730054039266,
|
|
"loss": 4.2603,
|
|
"mean_token_accuracy": 0.26483319103717806,
|
|
"num_tokens": 14911833.0,
|
|
"step": 6640
|
|
},
|
|
{
|
|
"entropy": 5.054026460647583,
|
|
"epoch": 7.18388318009735,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 0.00015149854687273594,
|
|
"loss": 4.2057,
|
|
"mean_token_accuracy": 0.2744983181357384,
|
|
"num_tokens": 14922323.0,
|
|
"step": 6645
|
|
},
|
|
{
|
|
"entropy": 5.035484457015992,
|
|
"epoch": 7.189291508923742,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0001511402420096455,
|
|
"loss": 4.2413,
|
|
"mean_token_accuracy": 0.2737511217594147,
|
|
"num_tokens": 14932622.0,
|
|
"step": 6650
|
|
},
|
|
{
|
|
"entropy": 5.023272895812989,
|
|
"epoch": 7.194699837750135,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 0.0001507823872532017,
|
|
"loss": 4.1815,
|
|
"mean_token_accuracy": 0.27663699686527254,
|
|
"num_tokens": 14943189.0,
|
|
"step": 6655
|
|
},
|
|
{
|
|
"entropy": 5.001503944396973,
|
|
"epoch": 7.200108166576528,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.00015042498390384966,
|
|
"loss": 4.2483,
|
|
"mean_token_accuracy": 0.26443515717983246,
|
|
"num_tokens": 14955454.0,
|
|
"step": 6660
|
|
},
|
|
{
|
|
"entropy": 4.960481977462768,
|
|
"epoch": 7.205516495402921,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00015006803326039403,
|
|
"loss": 4.1764,
|
|
"mean_token_accuracy": 0.2749644502997398,
|
|
"num_tokens": 14966223.0,
|
|
"step": 6665
|
|
},
|
|
{
|
|
"entropy": 5.052805852890015,
|
|
"epoch": 7.210924824229313,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00014971153661999425,
|
|
"loss": 4.2525,
|
|
"mean_token_accuracy": 0.26388299465179443,
|
|
"num_tokens": 14977204.0,
|
|
"step": 6670
|
|
},
|
|
{
|
|
"entropy": 5.052019119262695,
|
|
"epoch": 7.2163331530557056,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 0.0001493554952781599,
|
|
"loss": 4.2652,
|
|
"mean_token_accuracy": 0.2602526187896729,
|
|
"num_tokens": 14988099.0,
|
|
"step": 6675
|
|
},
|
|
{
|
|
"entropy": 5.009830665588379,
|
|
"epoch": 7.221741481882098,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.00014899991052874618,
|
|
"loss": 4.2668,
|
|
"mean_token_accuracy": 0.2652207508683205,
|
|
"num_tokens": 14999050.0,
|
|
"step": 6680
|
|
},
|
|
{
|
|
"entropy": 5.044862699508667,
|
|
"epoch": 7.227149810708491,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 0.00014864478366394853,
|
|
"loss": 4.3068,
|
|
"mean_token_accuracy": 0.2553206592798233,
|
|
"num_tokens": 15009238.0,
|
|
"step": 6685
|
|
},
|
|
{
|
|
"entropy": 4.957525587081909,
|
|
"epoch": 7.232558139534884,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0001482901159742992,
|
|
"loss": 4.2749,
|
|
"mean_token_accuracy": 0.2612550541758537,
|
|
"num_tokens": 15020435.0,
|
|
"step": 6690
|
|
},
|
|
{
|
|
"entropy": 5.01455717086792,
|
|
"epoch": 7.237966468361276,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.0001479359087486613,
|
|
"loss": 4.2623,
|
|
"mean_token_accuracy": 0.2640676528215408,
|
|
"num_tokens": 15032598.0,
|
|
"step": 6695
|
|
},
|
|
{
|
|
"entropy": 5.099628496170044,
|
|
"epoch": 7.243374797187669,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.00014758216327422457,
|
|
"loss": 4.3705,
|
|
"mean_token_accuracy": 0.2597100049257278,
|
|
"num_tokens": 15043573.0,
|
|
"step": 6700
|
|
},
|
|
{
|
|
"entropy": 4.965485143661499,
|
|
"epoch": 7.248783126014062,
|
|
"grad_norm": 1.125,
|
|
"learning_rate": 0.00014722888083650094,
|
|
"loss": 4.1811,
|
|
"mean_token_accuracy": 0.28044322431087493,
|
|
"num_tokens": 15054767.0,
|
|
"step": 6705
|
|
},
|
|
{
|
|
"entropy": 5.059692478179931,
|
|
"epoch": 7.254191454840455,
|
|
"grad_norm": 1.1328125,
|
|
"learning_rate": 0.00014687606271931961,
|
|
"loss": 4.3384,
|
|
"mean_token_accuracy": 0.26423509865999223,
|
|
"num_tokens": 15067145.0,
|
|
"step": 6710
|
|
},
|
|
{
|
|
"entropy": 5.0344031810760494,
|
|
"epoch": 7.259599783666847,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 0.00014652371020482246,
|
|
"loss": 4.1975,
|
|
"mean_token_accuracy": 0.27816148698329923,
|
|
"num_tokens": 15077177.0,
|
|
"step": 6715
|
|
},
|
|
{
|
|
"entropy": 5.043815326690674,
|
|
"epoch": 7.2650081124932395,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.0001461718245734594,
|
|
"loss": 4.2647,
|
|
"mean_token_accuracy": 0.2639755129814148,
|
|
"num_tokens": 15087751.0,
|
|
"step": 6720
|
|
},
|
|
{
|
|
"entropy": 4.950041007995606,
|
|
"epoch": 7.270416441319632,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0001458204071039834,
|
|
"loss": 4.1968,
|
|
"mean_token_accuracy": 0.27858618944883345,
|
|
"num_tokens": 15098536.0,
|
|
"step": 6725
|
|
},
|
|
{
|
|
"entropy": 5.070917463302612,
|
|
"epoch": 7.275824770146025,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0001454694590734466,
|
|
"loss": 4.2826,
|
|
"mean_token_accuracy": 0.26164352893829346,
|
|
"num_tokens": 15108845.0,
|
|
"step": 6730
|
|
},
|
|
{
|
|
"entropy": 5.049303817749023,
|
|
"epoch": 7.281233098972417,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0001451189817571949,
|
|
"loss": 4.2407,
|
|
"mean_token_accuracy": 0.27201560139656067,
|
|
"num_tokens": 15119779.0,
|
|
"step": 6735
|
|
},
|
|
{
|
|
"entropy": 5.102979707717895,
|
|
"epoch": 7.28664142779881,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00014476897642886355,
|
|
"loss": 4.3475,
|
|
"mean_token_accuracy": 0.2534364700317383,
|
|
"num_tokens": 15131511.0,
|
|
"step": 6740
|
|
},
|
|
{
|
|
"entropy": 4.830473804473877,
|
|
"epoch": 7.292049756625203,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00014441944436037287,
|
|
"loss": 4.1286,
|
|
"mean_token_accuracy": 0.28372336328029635,
|
|
"num_tokens": 15142622.0,
|
|
"step": 6745
|
|
},
|
|
{
|
|
"entropy": 4.998630523681641,
|
|
"epoch": 7.297458085451596,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00014407038682192312,
|
|
"loss": 4.2332,
|
|
"mean_token_accuracy": 0.2728223592042923,
|
|
"num_tokens": 15154969.0,
|
|
"step": 6750
|
|
},
|
|
{
|
|
"entropy": 5.045762634277343,
|
|
"epoch": 7.302866414277988,
|
|
"grad_norm": 1.1015625,
|
|
"learning_rate": 0.0001437218050819902,
|
|
"loss": 4.3448,
|
|
"mean_token_accuracy": 0.2519604280591011,
|
|
"num_tokens": 15166450.0,
|
|
"step": 6755
|
|
},
|
|
{
|
|
"entropy": 5.046361923217773,
|
|
"epoch": 7.308274743104381,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.000143373700407321,
|
|
"loss": 4.2698,
|
|
"mean_token_accuracy": 0.2674436420202255,
|
|
"num_tokens": 15176434.0,
|
|
"step": 6760
|
|
},
|
|
{
|
|
"entropy": 5.0676041603088375,
|
|
"epoch": 7.3136830719307735,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00014302607406292873,
|
|
"loss": 4.2624,
|
|
"mean_token_accuracy": 0.2635492652654648,
|
|
"num_tokens": 15187900.0,
|
|
"step": 6765
|
|
},
|
|
{
|
|
"entropy": 5.015168333053589,
|
|
"epoch": 7.319091400757166,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00014267892731208826,
|
|
"loss": 4.2677,
|
|
"mean_token_accuracy": 0.2644525170326233,
|
|
"num_tokens": 15199437.0,
|
|
"step": 6770
|
|
},
|
|
{
|
|
"entropy": 5.066521167755127,
|
|
"epoch": 7.324499729583558,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.0001423322614163318,
|
|
"loss": 4.3584,
|
|
"mean_token_accuracy": 0.2588640064001083,
|
|
"num_tokens": 15211060.0,
|
|
"step": 6775
|
|
},
|
|
{
|
|
"entropy": 4.994303560256958,
|
|
"epoch": 7.329908058409951,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 0.00014198607763544392,
|
|
"loss": 4.2768,
|
|
"mean_token_accuracy": 0.27038374841213225,
|
|
"num_tokens": 15222559.0,
|
|
"step": 6780
|
|
},
|
|
{
|
|
"entropy": 5.050819396972656,
|
|
"epoch": 7.335316387236344,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00014164037722745715,
|
|
"loss": 4.3059,
|
|
"mean_token_accuracy": 0.2649446323513985,
|
|
"num_tokens": 15235441.0,
|
|
"step": 6785
|
|
},
|
|
{
|
|
"entropy": 4.9687828540802,
|
|
"epoch": 7.340724716062737,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0001412951614486479,
|
|
"loss": 4.2529,
|
|
"mean_token_accuracy": 0.2694339320063591,
|
|
"num_tokens": 15246670.0,
|
|
"step": 6790
|
|
},
|
|
{
|
|
"entropy": 5.008908462524414,
|
|
"epoch": 7.346133044889129,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00014095043155353085,
|
|
"loss": 4.2144,
|
|
"mean_token_accuracy": 0.27128606140613554,
|
|
"num_tokens": 15257217.0,
|
|
"step": 6795
|
|
},
|
|
{
|
|
"entropy": 4.991886901855469,
|
|
"epoch": 7.351541373715522,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0001406061887948553,
|
|
"loss": 4.2521,
|
|
"mean_token_accuracy": 0.2668360397219658,
|
|
"num_tokens": 15267675.0,
|
|
"step": 6800
|
|
},
|
|
{
|
|
"entropy": 4.939211320877075,
|
|
"epoch": 7.356949702541915,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.00014026243442360025,
|
|
"loss": 4.2531,
|
|
"mean_token_accuracy": 0.260979962348938,
|
|
"num_tokens": 15279159.0,
|
|
"step": 6805
|
|
},
|
|
{
|
|
"entropy": 5.040650844573975,
|
|
"epoch": 7.3623580313683075,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0001399191696889699,
|
|
"loss": 4.2517,
|
|
"mean_token_accuracy": 0.25706988871097564,
|
|
"num_tokens": 15288904.0,
|
|
"step": 6810
|
|
},
|
|
{
|
|
"entropy": 5.065714645385742,
|
|
"epoch": 7.367766360194699,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.0001395763958383891,
|
|
"loss": 4.3228,
|
|
"mean_token_accuracy": 0.2615349903702736,
|
|
"num_tokens": 15300511.0,
|
|
"step": 6815
|
|
},
|
|
{
|
|
"entropy": 4.996272182464599,
|
|
"epoch": 7.373174689021092,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.0001392341141174987,
|
|
"loss": 4.1779,
|
|
"mean_token_accuracy": 0.27628254890441895,
|
|
"num_tokens": 15312053.0,
|
|
"step": 6820
|
|
},
|
|
{
|
|
"entropy": 4.97712459564209,
|
|
"epoch": 7.378583017847485,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.00013889232577015125,
|
|
"loss": 4.2516,
|
|
"mean_token_accuracy": 0.26793107837438584,
|
|
"num_tokens": 15324133.0,
|
|
"step": 6825
|
|
},
|
|
{
|
|
"entropy": 4.953416109085083,
|
|
"epoch": 7.383991346673878,
|
|
"grad_norm": 1.1875,
|
|
"learning_rate": 0.00013855103203840673,
|
|
"loss": 4.1932,
|
|
"mean_token_accuracy": 0.2714993879199028,
|
|
"num_tokens": 15335010.0,
|
|
"step": 6830
|
|
},
|
|
{
|
|
"entropy": 4.99472188949585,
|
|
"epoch": 7.38939967550027,
|
|
"grad_norm": 1.1484375,
|
|
"learning_rate": 0.00013821023416252693,
|
|
"loss": 4.2268,
|
|
"mean_token_accuracy": 0.2669704005122185,
|
|
"num_tokens": 15345979.0,
|
|
"step": 6835
|
|
},
|
|
{
|
|
"entropy": 5.069944667816162,
|
|
"epoch": 7.394808004326663,
|
|
"grad_norm": 1.09375,
|
|
"learning_rate": 0.00013786993338097236,
|
|
"loss": 4.3456,
|
|
"mean_token_accuracy": 0.2568314164876938,
|
|
"num_tokens": 15358073.0,
|
|
"step": 6840
|
|
},
|
|
{
|
|
"entropy": 5.0448637962341305,
|
|
"epoch": 7.400216333153056,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.00013753013093039673,
|
|
"loss": 4.251,
|
|
"mean_token_accuracy": 0.26637195944786074,
|
|
"num_tokens": 15368810.0,
|
|
"step": 6845
|
|
},
|
|
{
|
|
"entropy": 4.9495562553405765,
|
|
"epoch": 7.405624661979449,
|
|
"grad_norm": 1.140625,
|
|
"learning_rate": 0.000137190828045643,
|
|
"loss": 4.1875,
|
|
"mean_token_accuracy": 0.27293744385242463,
|
|
"num_tokens": 15380096.0,
|
|
"step": 6850
|
|
},
|
|
{
|
|
"entropy": 4.986986446380615,
|
|
"epoch": 7.411032990805841,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00013685202595973861,
|
|
"loss": 4.2012,
|
|
"mean_token_accuracy": 0.27250736206769943,
|
|
"num_tokens": 15391402.0,
|
|
"step": 6855
|
|
},
|
|
{
|
|
"entropy": 5.00455904006958,
|
|
"epoch": 7.416441319632233,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 0.00013651372590389122,
|
|
"loss": 4.2533,
|
|
"mean_token_accuracy": 0.26506281942129134,
|
|
"num_tokens": 15402852.0,
|
|
"step": 6860
|
|
},
|
|
{
|
|
"entropy": 5.046366882324219,
|
|
"epoch": 7.421849648458626,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.00013617592910748378,
|
|
"loss": 4.3249,
|
|
"mean_token_accuracy": 0.25670602917671204,
|
|
"num_tokens": 15414433.0,
|
|
"step": 6865
|
|
},
|
|
{
|
|
"entropy": 5.0525243282318115,
|
|
"epoch": 7.427257977285019,
|
|
"grad_norm": 1.3046875,
|
|
"learning_rate": 0.00013583863679807092,
|
|
"loss": 4.2751,
|
|
"mean_token_accuracy": 0.2622839018702507,
|
|
"num_tokens": 15424415.0,
|
|
"step": 6870
|
|
},
|
|
{
|
|
"entropy": 5.06031813621521,
|
|
"epoch": 7.432666306111411,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.00013550185020137344,
|
|
"loss": 4.3309,
|
|
"mean_token_accuracy": 0.264856281876564,
|
|
"num_tokens": 15435990.0,
|
|
"step": 6875
|
|
},
|
|
{
|
|
"entropy": 5.007588529586792,
|
|
"epoch": 7.438074634937804,
|
|
"grad_norm": 1.0703125,
|
|
"learning_rate": 0.0001351655705412747,
|
|
"loss": 4.2677,
|
|
"mean_token_accuracy": 0.2667671352624893,
|
|
"num_tokens": 15447657.0,
|
|
"step": 6880
|
|
},
|
|
{
|
|
"entropy": 5.022168254852295,
|
|
"epoch": 7.443482963764197,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0001348297990398158,
|
|
"loss": 4.2615,
|
|
"mean_token_accuracy": 0.2649192944169044,
|
|
"num_tokens": 15458727.0,
|
|
"step": 6885
|
|
},
|
|
{
|
|
"entropy": 5.070149326324463,
|
|
"epoch": 7.44889129259059,
|
|
"grad_norm": 1.1171875,
|
|
"learning_rate": 0.00013449453691719108,
|
|
"loss": 4.3402,
|
|
"mean_token_accuracy": 0.26120847910642625,
|
|
"num_tokens": 15472087.0,
|
|
"step": 6890
|
|
},
|
|
{
|
|
"entropy": 5.025625467300415,
|
|
"epoch": 7.4542996214169825,
|
|
"grad_norm": 1.2578125,
|
|
"learning_rate": 0.0001341597853917439,
|
|
"loss": 4.3214,
|
|
"mean_token_accuracy": 0.2622173339128494,
|
|
"num_tokens": 15482260.0,
|
|
"step": 6895
|
|
},
|
|
{
|
|
"entropy": 4.956448268890381,
|
|
"epoch": 7.4597079502433745,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00013382554567996214,
|
|
"loss": 4.2156,
|
|
"mean_token_accuracy": 0.2694877624511719,
|
|
"num_tokens": 15494663.0,
|
|
"step": 6900
|
|
},
|
|
{
|
|
"entropy": 4.979565000534057,
|
|
"epoch": 7.465116279069767,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00013349181899647346,
|
|
"loss": 4.2134,
|
|
"mean_token_accuracy": 0.27296215295791626,
|
|
"num_tokens": 15506013.0,
|
|
"step": 6905
|
|
},
|
|
{
|
|
"entropy": 5.011082506179809,
|
|
"epoch": 7.47052460789616,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.00013315860655404167,
|
|
"loss": 4.1946,
|
|
"mean_token_accuracy": 0.26652430593967436,
|
|
"num_tokens": 15516933.0,
|
|
"step": 6910
|
|
},
|
|
{
|
|
"entropy": 5.0386481285095215,
|
|
"epoch": 7.475932936722553,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0001328259095635615,
|
|
"loss": 4.2746,
|
|
"mean_token_accuracy": 0.26832125037908555,
|
|
"num_tokens": 15528648.0,
|
|
"step": 6915
|
|
},
|
|
{
|
|
"entropy": 4.998604202270508,
|
|
"epoch": 7.481341265548945,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 0.0001324937292340545,
|
|
"loss": 4.2646,
|
|
"mean_token_accuracy": 0.26929744631052016,
|
|
"num_tokens": 15540293.0,
|
|
"step": 6920
|
|
},
|
|
{
|
|
"entropy": 5.002014827728272,
|
|
"epoch": 7.486749594375338,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.00013216206677266475,
|
|
"loss": 4.3341,
|
|
"mean_token_accuracy": 0.26107640862464904,
|
|
"num_tokens": 15552256.0,
|
|
"step": 6925
|
|
},
|
|
{
|
|
"entropy": 5.032458209991455,
|
|
"epoch": 7.492157923201731,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.0001318309233846544,
|
|
"loss": 4.3187,
|
|
"mean_token_accuracy": 0.25722243189811705,
|
|
"num_tokens": 15563691.0,
|
|
"step": 6930
|
|
},
|
|
{
|
|
"entropy": 5.090255451202393,
|
|
"epoch": 7.497566252028124,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.00013150030027339935,
|
|
"loss": 4.3221,
|
|
"mean_token_accuracy": 0.262165766954422,
|
|
"num_tokens": 15575772.0,
|
|
"step": 6935
|
|
},
|
|
{
|
|
"entropy": 5.028495645523071,
|
|
"epoch": 7.502974580854516,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00013117019864038483,
|
|
"loss": 4.2583,
|
|
"mean_token_accuracy": 0.2664205700159073,
|
|
"num_tokens": 15587311.0,
|
|
"step": 6940
|
|
},
|
|
{
|
|
"entropy": 4.970461463928222,
|
|
"epoch": 7.5083829096809085,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.00013084061968520063,
|
|
"loss": 4.2326,
|
|
"mean_token_accuracy": 0.2720017582178116,
|
|
"num_tokens": 15598598.0,
|
|
"step": 6945
|
|
},
|
|
{
|
|
"entropy": 4.991307067871094,
|
|
"epoch": 7.513791238507301,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.00013051156460553776,
|
|
"loss": 4.2119,
|
|
"mean_token_accuracy": 0.27289891242980957,
|
|
"num_tokens": 15608309.0,
|
|
"step": 6950
|
|
},
|
|
{
|
|
"entropy": 5.006105375289917,
|
|
"epoch": 7.519199567333694,
|
|
"grad_norm": 1.328125,
|
|
"learning_rate": 0.00013018303459718305,
|
|
"loss": 4.2523,
|
|
"mean_token_accuracy": 0.2640357792377472,
|
|
"num_tokens": 15617762.0,
|
|
"step": 6955
|
|
},
|
|
{
|
|
"entropy": 5.080791473388672,
|
|
"epoch": 7.524607896160086,
|
|
"grad_norm": 1.2109375,
|
|
"learning_rate": 0.00012985503085401523,
|
|
"loss": 4.3117,
|
|
"mean_token_accuracy": 0.2659886971116066,
|
|
"num_tokens": 15629587.0,
|
|
"step": 6960
|
|
},
|
|
{
|
|
"entropy": 5.088359928131103,
|
|
"epoch": 7.530016224986479,
|
|
"grad_norm": 1.203125,
|
|
"learning_rate": 0.00012952755456800067,
|
|
"loss": 4.3381,
|
|
"mean_token_accuracy": 0.2640778049826622,
|
|
"num_tokens": 15640774.0,
|
|
"step": 6965
|
|
},
|
|
{
|
|
"entropy": 5.0523895740509035,
|
|
"epoch": 7.535424553812872,
|
|
"grad_norm": 1.2890625,
|
|
"learning_rate": 0.000129200606929189,
|
|
"loss": 4.3244,
|
|
"mean_token_accuracy": 0.25774885416030885,
|
|
"num_tokens": 15652284.0,
|
|
"step": 6970
|
|
},
|
|
{
|
|
"entropy": 5.010451555252075,
|
|
"epoch": 7.540832882639265,
|
|
"grad_norm": 1.1796875,
|
|
"learning_rate": 0.0001288741891257087,
|
|
"loss": 4.2866,
|
|
"mean_token_accuracy": 0.2572501480579376,
|
|
"num_tokens": 15664427.0,
|
|
"step": 6975
|
|
},
|
|
{
|
|
"entropy": 4.958106565475464,
|
|
"epoch": 7.546241211465657,
|
|
"grad_norm": 1.1953125,
|
|
"learning_rate": 0.00012854830234376277,
|
|
"loss": 4.2112,
|
|
"mean_token_accuracy": 0.265127994120121,
|
|
"num_tokens": 15675668.0,
|
|
"step": 6980
|
|
},
|
|
{
|
|
"entropy": 4.991118431091309,
|
|
"epoch": 7.55164954029205,
|
|
"grad_norm": 1.21875,
|
|
"learning_rate": 0.0001282229477676246,
|
|
"loss": 4.294,
|
|
"mean_token_accuracy": 0.26283299922943115,
|
|
"num_tokens": 15687312.0,
|
|
"step": 6985
|
|
},
|
|
{
|
|
"entropy": 4.999907350540161,
|
|
"epoch": 7.5570578691184425,
|
|
"grad_norm": 1.28125,
|
|
"learning_rate": 0.0001278981265796334,
|
|
"loss": 4.167,
|
|
"mean_token_accuracy": 0.2726974591612816,
|
|
"num_tokens": 15698965.0,
|
|
"step": 6990
|
|
},
|
|
{
|
|
"entropy": 4.9757753849029545,
|
|
"epoch": 7.562466197944835,
|
|
"grad_norm": 1.2265625,
|
|
"learning_rate": 0.00012757383996019024,
|
|
"loss": 4.2439,
|
|
"mean_token_accuracy": 0.26597432643175123,
|
|
"num_tokens": 15709811.0,
|
|
"step": 6995
|
|
},
|
|
{
|
|
"entropy": 4.936731815338135,
|
|
"epoch": 7.567874526771227,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0001272500890877533,
|
|
"loss": 4.2069,
|
|
"mean_token_accuracy": 0.2731840804219246,
|
|
"num_tokens": 15720932.0,
|
|
"step": 7000
|
|
},
|
|
{
|
|
"epoch": 7.567874526771227,
|
|
"eval_entropy": 5.0102989543568,
|
|
"eval_loss": 5.836738109588623,
|
|
"eval_mean_token_accuracy": 0.18650588301772422,
|
|
"eval_num_tokens": 15720932.0,
|
|
"eval_runtime": 2.5152,
|
|
"eval_samples_per_second": 1397.501,
|
|
"eval_steps_per_second": 174.936,
|
|
"step": 7000
|
|
}
|
|
],
|
|
"logging_steps": 5,
|
|
"max_steps": 9240,
|
|
"num_input_tokens_seen": 0,
|
|
"num_train_epochs": 10,
|
|
"save_steps": 1000,
|
|
"stateful_callbacks": {
|
|
"TrainerControl": {
|
|
"args": {
|
|
"should_epoch_stop": false,
|
|
"should_evaluate": false,
|
|
"should_log": false,
|
|
"should_save": true,
|
|
"should_training_stop": false
|
|
},
|
|
"attributes": {}
|
|
}
|
|
},
|
|
"total_flos": 2.4636192777216e+16,
|
|
"train_batch_size": 16,
|
|
"trial_name": null,
|
|
"trial_params": null
|
|
}
|