Files
eng-latn-100mb-after-ppt-Dp…/checkpoint-1000/trainer_state.json
ModelHub XC dc2b462e34 初始化项目,由ModelHub XC社区提供模型
Model: fpadovani/eng-latn-100mb-after-ppt-Dp-10mb-ckpt500_seed455
Source: Original Platform
2026-08-21 19:11:17 +08:00

2046 lines
54 KiB
JSON

{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 1.0811249323958896,
"eval_steps": 1000,
"global_step": 1000,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"entropy": 6.745217990875244,
"epoch": 0.005408328826392645,
"grad_norm": 1.1875,
"learning_rate": 2e-06,
"loss": 6.4399,
"mean_token_accuracy": 0.12539481073617936,
"num_tokens": 9564.0,
"step": 5
},
{
"entropy": 6.7341703414917,
"epoch": 0.01081665765278529,
"grad_norm": 1.1484375,
"learning_rate": 4.5e-06,
"loss": 6.4966,
"mean_token_accuracy": 0.12570957243442535,
"num_tokens": 20265.0,
"step": 10
},
{
"entropy": 6.810567569732666,
"epoch": 0.016224986479177934,
"grad_norm": 1.171875,
"learning_rate": 7e-06,
"loss": 6.6044,
"mean_token_accuracy": 0.12070711851119995,
"num_tokens": 30733.0,
"step": 15
},
{
"entropy": 6.691426467895508,
"epoch": 0.02163331530557058,
"grad_norm": 1.1015625,
"learning_rate": 9.5e-06,
"loss": 6.5463,
"mean_token_accuracy": 0.1250626839697361,
"num_tokens": 41633.0,
"step": 20
},
{
"entropy": 6.713900947570801,
"epoch": 0.02704164413196322,
"grad_norm": 1.1484375,
"learning_rate": 1.2e-05,
"loss": 6.6055,
"mean_token_accuracy": 0.12766451835632325,
"num_tokens": 53776.0,
"step": 25
},
{
"entropy": 6.794030284881591,
"epoch": 0.03244997295835587,
"grad_norm": 1.1796875,
"learning_rate": 1.4500000000000002e-05,
"loss": 6.55,
"mean_token_accuracy": 0.13146025240421294,
"num_tokens": 64936.0,
"step": 30
},
{
"entropy": 6.735936450958252,
"epoch": 0.03785830178474851,
"grad_norm": 1.0859375,
"learning_rate": 1.7000000000000003e-05,
"loss": 6.5551,
"mean_token_accuracy": 0.12577222511172295,
"num_tokens": 76664.0,
"step": 35
},
{
"entropy": 6.720685720443726,
"epoch": 0.04326663061114116,
"grad_norm": 1.1171875,
"learning_rate": 1.95e-05,
"loss": 6.4589,
"mean_token_accuracy": 0.12645927220582961,
"num_tokens": 87188.0,
"step": 40
},
{
"entropy": 6.770437097549438,
"epoch": 0.048674959437533805,
"grad_norm": 1.0859375,
"learning_rate": 2.2e-05,
"loss": 6.6097,
"mean_token_accuracy": 0.1324235811829567,
"num_tokens": 99337.0,
"step": 45
},
{
"entropy": 6.7956713199615475,
"epoch": 0.05408328826392644,
"grad_norm": 1.0625,
"learning_rate": 2.4500000000000003e-05,
"loss": 6.5528,
"mean_token_accuracy": 0.1259615793824196,
"num_tokens": 110870.0,
"step": 50
},
{
"entropy": 6.821929407119751,
"epoch": 0.05949161709031909,
"grad_norm": 1.0625,
"learning_rate": 2.7e-05,
"loss": 6.4581,
"mean_token_accuracy": 0.13586550429463387,
"num_tokens": 122183.0,
"step": 55
},
{
"entropy": 6.810019540786743,
"epoch": 0.06489994591671173,
"grad_norm": 1.078125,
"learning_rate": 2.95e-05,
"loss": 6.471,
"mean_token_accuracy": 0.134011822193861,
"num_tokens": 133676.0,
"step": 60
},
{
"entropy": 6.7516721248626705,
"epoch": 0.07030827474310439,
"grad_norm": 1.046875,
"learning_rate": 3.2e-05,
"loss": 6.5101,
"mean_token_accuracy": 0.13094406202435493,
"num_tokens": 144821.0,
"step": 65
},
{
"entropy": 6.73709626197815,
"epoch": 0.07571660356949703,
"grad_norm": 0.98828125,
"learning_rate": 3.4500000000000005e-05,
"loss": 6.4945,
"mean_token_accuracy": 0.13041364997625352,
"num_tokens": 156873.0,
"step": 70
},
{
"entropy": 6.649084663391113,
"epoch": 0.08112493239588967,
"grad_norm": 1.0546875,
"learning_rate": 3.7e-05,
"loss": 6.4459,
"mean_token_accuracy": 0.12853534668684005,
"num_tokens": 168794.0,
"step": 75
},
{
"entropy": 6.839602088928222,
"epoch": 0.08653326122228232,
"grad_norm": 1.0078125,
"learning_rate": 3.95e-05,
"loss": 6.603,
"mean_token_accuracy": 0.12388623431324959,
"num_tokens": 180756.0,
"step": 80
},
{
"entropy": 6.882611703872681,
"epoch": 0.09194159004867496,
"grad_norm": 1.125,
"learning_rate": 4.2000000000000004e-05,
"loss": 6.5729,
"mean_token_accuracy": 0.12938066497445105,
"num_tokens": 191127.0,
"step": 85
},
{
"entropy": 6.704812479019165,
"epoch": 0.09734991887506761,
"grad_norm": 0.90625,
"learning_rate": 4.45e-05,
"loss": 6.455,
"mean_token_accuracy": 0.13043807074427605,
"num_tokens": 203352.0,
"step": 90
},
{
"entropy": 6.752549362182617,
"epoch": 0.10275824770146025,
"grad_norm": 1.2265625,
"learning_rate": 4.7000000000000004e-05,
"loss": 6.4423,
"mean_token_accuracy": 0.1375568687915802,
"num_tokens": 213810.0,
"step": 95
},
{
"entropy": 6.83305549621582,
"epoch": 0.10816657652785289,
"grad_norm": 1.015625,
"learning_rate": 4.9500000000000004e-05,
"loss": 6.5476,
"mean_token_accuracy": 0.1357502222061157,
"num_tokens": 225310.0,
"step": 100
},
{
"entropy": 6.757467412948609,
"epoch": 0.11357490535424554,
"grad_norm": 1.0234375,
"learning_rate": 5.2e-05,
"loss": 6.3829,
"mean_token_accuracy": 0.13580593466758728,
"num_tokens": 236676.0,
"step": 105
},
{
"entropy": 6.749653005599976,
"epoch": 0.11898323418063818,
"grad_norm": 1.1640625,
"learning_rate": 5.45e-05,
"loss": 6.4842,
"mean_token_accuracy": 0.13619382083415985,
"num_tokens": 247453.0,
"step": 110
},
{
"entropy": 6.7436058044433596,
"epoch": 0.12439156300703083,
"grad_norm": 1.2265625,
"learning_rate": 5.7e-05,
"loss": 6.4908,
"mean_token_accuracy": 0.1296382687985897,
"num_tokens": 258267.0,
"step": 115
},
{
"entropy": 6.699334526062012,
"epoch": 0.12979989183342347,
"grad_norm": 1.125,
"learning_rate": 5.9499999999999996e-05,
"loss": 6.5306,
"mean_token_accuracy": 0.1270687237381935,
"num_tokens": 269839.0,
"step": 120
},
{
"entropy": 6.761990737915039,
"epoch": 0.1352082206598161,
"grad_norm": 1.0703125,
"learning_rate": 6.2e-05,
"loss": 6.5192,
"mean_token_accuracy": 0.13135910406708717,
"num_tokens": 281748.0,
"step": 125
},
{
"entropy": 6.810469007492065,
"epoch": 0.14061654948620878,
"grad_norm": 1.0703125,
"learning_rate": 6.450000000000001e-05,
"loss": 6.5302,
"mean_token_accuracy": 0.12570069655776023,
"num_tokens": 292592.0,
"step": 130
},
{
"entropy": 6.8416718482971195,
"epoch": 0.1460248783126014,
"grad_norm": 1.1953125,
"learning_rate": 6.7e-05,
"loss": 6.4401,
"mean_token_accuracy": 0.13145631179213524,
"num_tokens": 303122.0,
"step": 135
},
{
"entropy": 6.692539358139038,
"epoch": 0.15143320713899405,
"grad_norm": 1.1875,
"learning_rate": 6.950000000000001e-05,
"loss": 6.3644,
"mean_token_accuracy": 0.13424549549818038,
"num_tokens": 314728.0,
"step": 140
},
{
"entropy": 6.719494438171386,
"epoch": 0.1568415359653867,
"grad_norm": 1.1328125,
"learning_rate": 7.2e-05,
"loss": 6.5632,
"mean_token_accuracy": 0.13301948606967925,
"num_tokens": 325292.0,
"step": 145
},
{
"entropy": 6.830582857131958,
"epoch": 0.16224986479177933,
"grad_norm": 1.03125,
"learning_rate": 7.45e-05,
"loss": 6.5829,
"mean_token_accuracy": 0.1278594434261322,
"num_tokens": 336140.0,
"step": 150
},
{
"entropy": 6.741078948974609,
"epoch": 0.167658193618172,
"grad_norm": 1.1484375,
"learning_rate": 7.7e-05,
"loss": 6.4212,
"mean_token_accuracy": 0.13609526231884955,
"num_tokens": 346885.0,
"step": 155
},
{
"entropy": 6.667781114578247,
"epoch": 0.17306652244456464,
"grad_norm": 1.203125,
"learning_rate": 7.950000000000001e-05,
"loss": 6.4422,
"mean_token_accuracy": 0.13269152715802193,
"num_tokens": 356630.0,
"step": 160
},
{
"entropy": 6.826272296905517,
"epoch": 0.17847485127095727,
"grad_norm": 1.1015625,
"learning_rate": 8.2e-05,
"loss": 6.4434,
"mean_token_accuracy": 0.13844147995114325,
"num_tokens": 366693.0,
"step": 165
},
{
"entropy": 6.623198461532593,
"epoch": 0.1838831800973499,
"grad_norm": 1.0703125,
"learning_rate": 8.450000000000001e-05,
"loss": 6.3919,
"mean_token_accuracy": 0.12981215193867685,
"num_tokens": 377779.0,
"step": 170
},
{
"entropy": 6.907767629623413,
"epoch": 0.18929150892374255,
"grad_norm": 1.015625,
"learning_rate": 8.7e-05,
"loss": 6.5139,
"mean_token_accuracy": 0.1325360544025898,
"num_tokens": 388482.0,
"step": 175
},
{
"entropy": 6.72784013748169,
"epoch": 0.19469983775013522,
"grad_norm": 1.234375,
"learning_rate": 8.95e-05,
"loss": 6.577,
"mean_token_accuracy": 0.13030516654253005,
"num_tokens": 400110.0,
"step": 180
},
{
"entropy": 6.742452812194824,
"epoch": 0.20010816657652786,
"grad_norm": 1.109375,
"learning_rate": 9.2e-05,
"loss": 6.3125,
"mean_token_accuracy": 0.13682465478777886,
"num_tokens": 412535.0,
"step": 185
},
{
"entropy": 6.676760053634643,
"epoch": 0.2055164954029205,
"grad_norm": 1.1796875,
"learning_rate": 9.45e-05,
"loss": 6.4502,
"mean_token_accuracy": 0.13751535415649413,
"num_tokens": 424309.0,
"step": 190
},
{
"entropy": 6.74865140914917,
"epoch": 0.21092482422931313,
"grad_norm": 1.25,
"learning_rate": 9.7e-05,
"loss": 6.4565,
"mean_token_accuracy": 0.13581018298864364,
"num_tokens": 435592.0,
"step": 195
},
{
"entropy": 6.591330480575562,
"epoch": 0.21633315305570577,
"grad_norm": 1.1328125,
"learning_rate": 9.95e-05,
"loss": 6.3516,
"mean_token_accuracy": 0.1346059188246727,
"num_tokens": 446767.0,
"step": 200
},
{
"entropy": 6.724362230300903,
"epoch": 0.22174148188209844,
"grad_norm": 1.1875,
"learning_rate": 0.000102,
"loss": 6.3719,
"mean_token_accuracy": 0.1348101980984211,
"num_tokens": 457959.0,
"step": 205
},
{
"entropy": 6.5875874042510985,
"epoch": 0.22714981070849108,
"grad_norm": 1.2421875,
"learning_rate": 0.00010449999999999999,
"loss": 6.3364,
"mean_token_accuracy": 0.14194149523973465,
"num_tokens": 468107.0,
"step": 210
},
{
"entropy": 6.896349143981934,
"epoch": 0.23255813953488372,
"grad_norm": 1.2109375,
"learning_rate": 0.000107,
"loss": 6.5223,
"mean_token_accuracy": 0.13508757278323175,
"num_tokens": 478954.0,
"step": 215
},
{
"entropy": 6.597625112533569,
"epoch": 0.23796646836127636,
"grad_norm": 1.1171875,
"learning_rate": 0.0001095,
"loss": 6.436,
"mean_token_accuracy": 0.12944695577025414,
"num_tokens": 490297.0,
"step": 220
},
{
"entropy": 6.734339427947998,
"epoch": 0.24337479718766902,
"grad_norm": 1.2421875,
"learning_rate": 0.000112,
"loss": 6.4306,
"mean_token_accuracy": 0.1379121758043766,
"num_tokens": 501597.0,
"step": 225
},
{
"entropy": 6.699416732788086,
"epoch": 0.24878312601406166,
"grad_norm": 1.1328125,
"learning_rate": 0.0001145,
"loss": 6.4431,
"mean_token_accuracy": 0.13053352981805802,
"num_tokens": 514182.0,
"step": 230
},
{
"entropy": 6.637861156463623,
"epoch": 0.2541914548404543,
"grad_norm": 1.0703125,
"learning_rate": 0.00011700000000000001,
"loss": 6.3907,
"mean_token_accuracy": 0.1391088232398033,
"num_tokens": 525972.0,
"step": 235
},
{
"entropy": 6.706511783599853,
"epoch": 0.25959978366684694,
"grad_norm": 1.140625,
"learning_rate": 0.00011949999999999999,
"loss": 6.3833,
"mean_token_accuracy": 0.1393005795776844,
"num_tokens": 537445.0,
"step": 240
},
{
"entropy": 6.676162910461426,
"epoch": 0.2650081124932396,
"grad_norm": 1.078125,
"learning_rate": 0.000122,
"loss": 6.4325,
"mean_token_accuracy": 0.13711966052651406,
"num_tokens": 548599.0,
"step": 245
},
{
"entropy": 6.67521448135376,
"epoch": 0.2704164413196322,
"grad_norm": 1.21875,
"learning_rate": 0.0001245,
"loss": 6.3094,
"mean_token_accuracy": 0.1379949890077114,
"num_tokens": 559222.0,
"step": 250
},
{
"entropy": 6.713015365600586,
"epoch": 0.27582477014602486,
"grad_norm": 1.3125,
"learning_rate": 0.000127,
"loss": 6.4632,
"mean_token_accuracy": 0.12452752217650413,
"num_tokens": 568949.0,
"step": 255
},
{
"entropy": 6.779383373260498,
"epoch": 0.28123309897241755,
"grad_norm": 1.0625,
"learning_rate": 0.0001295,
"loss": 6.4922,
"mean_token_accuracy": 0.13144948631525039,
"num_tokens": 580029.0,
"step": 260
},
{
"entropy": 6.726202201843262,
"epoch": 0.2866414277988102,
"grad_norm": 1.125,
"learning_rate": 0.000132,
"loss": 6.4077,
"mean_token_accuracy": 0.1364477679133415,
"num_tokens": 591633.0,
"step": 265
},
{
"entropy": 6.753827857971191,
"epoch": 0.2920497566252028,
"grad_norm": 1.25,
"learning_rate": 0.00013450000000000002,
"loss": 6.4197,
"mean_token_accuracy": 0.1380621761083603,
"num_tokens": 602511.0,
"step": 270
},
{
"entropy": 6.733678150177002,
"epoch": 0.29745808545159547,
"grad_norm": 1.265625,
"learning_rate": 0.00013700000000000002,
"loss": 6.4977,
"mean_token_accuracy": 0.1339564248919487,
"num_tokens": 613318.0,
"step": 275
},
{
"entropy": 6.607444524765015,
"epoch": 0.3028664142779881,
"grad_norm": 1.3515625,
"learning_rate": 0.0001395,
"loss": 6.3873,
"mean_token_accuracy": 0.13400006145238877,
"num_tokens": 624043.0,
"step": 280
},
{
"entropy": 6.67069182395935,
"epoch": 0.30827474310438074,
"grad_norm": 1.328125,
"learning_rate": 0.00014199999999999998,
"loss": 6.3469,
"mean_token_accuracy": 0.14132973700761794,
"num_tokens": 634713.0,
"step": 285
},
{
"entropy": 6.528910064697266,
"epoch": 0.3136830719307734,
"grad_norm": 1.125,
"learning_rate": 0.0001445,
"loss": 6.2954,
"mean_token_accuracy": 0.13748166486620902,
"num_tokens": 645491.0,
"step": 290
},
{
"entropy": 6.753203821182251,
"epoch": 0.319091400757166,
"grad_norm": 1.1796875,
"learning_rate": 0.000147,
"loss": 6.4336,
"mean_token_accuracy": 0.13378573432564736,
"num_tokens": 656832.0,
"step": 295
},
{
"entropy": 6.682645654678344,
"epoch": 0.32449972958355866,
"grad_norm": 1.421875,
"learning_rate": 0.0001495,
"loss": 6.3984,
"mean_token_accuracy": 0.13327668309211732,
"num_tokens": 668499.0,
"step": 300
},
{
"entropy": 6.722540235519409,
"epoch": 0.3299080584099513,
"grad_norm": 1.1484375,
"learning_rate": 0.000152,
"loss": 6.4665,
"mean_token_accuracy": 0.1349737487733364,
"num_tokens": 679962.0,
"step": 305
},
{
"entropy": 6.740982961654663,
"epoch": 0.335316387236344,
"grad_norm": 1.0390625,
"learning_rate": 0.00015450000000000001,
"loss": 6.4479,
"mean_token_accuracy": 0.13650912493467332,
"num_tokens": 692170.0,
"step": 310
},
{
"entropy": 6.57421088218689,
"epoch": 0.34072471606273663,
"grad_norm": 1.1875,
"learning_rate": 0.000157,
"loss": 6.3711,
"mean_token_accuracy": 0.13764476627111435,
"num_tokens": 702886.0,
"step": 315
},
{
"entropy": 6.688414525985718,
"epoch": 0.34613304488912927,
"grad_norm": 1.25,
"learning_rate": 0.0001595,
"loss": 6.4313,
"mean_token_accuracy": 0.13261876478791237,
"num_tokens": 714257.0,
"step": 320
},
{
"entropy": 6.638928413391113,
"epoch": 0.3515413737155219,
"grad_norm": 1.1796875,
"learning_rate": 0.000162,
"loss": 6.4197,
"mean_token_accuracy": 0.13729432821273804,
"num_tokens": 725751.0,
"step": 325
},
{
"entropy": 6.782710266113281,
"epoch": 0.35694970254191455,
"grad_norm": 1.234375,
"learning_rate": 0.00016450000000000001,
"loss": 6.4891,
"mean_token_accuracy": 0.1316055290400982,
"num_tokens": 737147.0,
"step": 330
},
{
"entropy": 6.616734218597412,
"epoch": 0.3623580313683072,
"grad_norm": 1.3203125,
"learning_rate": 0.00016700000000000002,
"loss": 6.3442,
"mean_token_accuracy": 0.14010964184999466,
"num_tokens": 748439.0,
"step": 335
},
{
"entropy": 6.645461893081665,
"epoch": 0.3677663601946998,
"grad_norm": 1.171875,
"learning_rate": 0.00016950000000000003,
"loss": 6.3558,
"mean_token_accuracy": 0.1416398137807846,
"num_tokens": 760380.0,
"step": 340
},
{
"entropy": 6.582087898254395,
"epoch": 0.37317468902109246,
"grad_norm": 1.203125,
"learning_rate": 0.00017199999999999998,
"loss": 6.3419,
"mean_token_accuracy": 0.13614206165075302,
"num_tokens": 770827.0,
"step": 345
},
{
"entropy": 6.588772773742676,
"epoch": 0.3785830178474851,
"grad_norm": 1.2890625,
"learning_rate": 0.00017449999999999999,
"loss": 6.371,
"mean_token_accuracy": 0.130119176954031,
"num_tokens": 781887.0,
"step": 350
},
{
"entropy": 6.6461952209472654,
"epoch": 0.3839913466738778,
"grad_norm": 1.296875,
"learning_rate": 0.000177,
"loss": 6.3707,
"mean_token_accuracy": 0.12962670475244523,
"num_tokens": 792676.0,
"step": 355
},
{
"entropy": 6.811271715164184,
"epoch": 0.38939967550027044,
"grad_norm": 1.2734375,
"learning_rate": 0.0001795,
"loss": 6.5791,
"mean_token_accuracy": 0.13036322295665742,
"num_tokens": 804148.0,
"step": 360
},
{
"entropy": 6.647534465789795,
"epoch": 0.3948080043266631,
"grad_norm": 1.1328125,
"learning_rate": 0.000182,
"loss": 6.3464,
"mean_token_accuracy": 0.13733255341649056,
"num_tokens": 815835.0,
"step": 365
},
{
"entropy": 6.539557218551636,
"epoch": 0.4002163331530557,
"grad_norm": 1.1953125,
"learning_rate": 0.0001845,
"loss": 6.2902,
"mean_token_accuracy": 0.14055102020502092,
"num_tokens": 827975.0,
"step": 370
},
{
"entropy": 6.627246284484864,
"epoch": 0.40562466197944835,
"grad_norm": 1.25,
"learning_rate": 0.000187,
"loss": 6.3392,
"mean_token_accuracy": 0.13682809248566627,
"num_tokens": 838982.0,
"step": 375
},
{
"entropy": 6.624072790145874,
"epoch": 0.411032990805841,
"grad_norm": 1.1875,
"learning_rate": 0.0001895,
"loss": 6.4402,
"mean_token_accuracy": 0.13047717586159707,
"num_tokens": 851377.0,
"step": 380
},
{
"entropy": 6.7495063781738285,
"epoch": 0.41644131963223363,
"grad_norm": 1.296875,
"learning_rate": 0.000192,
"loss": 6.4657,
"mean_token_accuracy": 0.13667654022574424,
"num_tokens": 862593.0,
"step": 385
},
{
"entropy": 6.551447343826294,
"epoch": 0.42184964845862627,
"grad_norm": 1.171875,
"learning_rate": 0.0001945,
"loss": 6.3196,
"mean_token_accuracy": 0.1354401208460331,
"num_tokens": 873906.0,
"step": 390
},
{
"entropy": 6.712440156936646,
"epoch": 0.4272579772850189,
"grad_norm": 1.4296875,
"learning_rate": 0.00019700000000000002,
"loss": 6.4657,
"mean_token_accuracy": 0.1353951647877693,
"num_tokens": 884477.0,
"step": 395
},
{
"entropy": 6.659290027618408,
"epoch": 0.43266630611141155,
"grad_norm": 1.1484375,
"learning_rate": 0.00019950000000000002,
"loss": 6.3206,
"mean_token_accuracy": 0.13656646832823754,
"num_tokens": 896151.0,
"step": 400
},
{
"entropy": 6.6360023021698,
"epoch": 0.43807463493780424,
"grad_norm": 1.2890625,
"learning_rate": 0.000202,
"loss": 6.4024,
"mean_token_accuracy": 0.13927194178104402,
"num_tokens": 907580.0,
"step": 405
},
{
"entropy": 6.59203953742981,
"epoch": 0.4434829637641969,
"grad_norm": 1.25,
"learning_rate": 0.00020449999999999998,
"loss": 6.3489,
"mean_token_accuracy": 0.13741599917411804,
"num_tokens": 918141.0,
"step": 410
},
{
"entropy": 6.65588059425354,
"epoch": 0.4488912925905895,
"grad_norm": 1.203125,
"learning_rate": 0.000207,
"loss": 6.3899,
"mean_token_accuracy": 0.14542332291603088,
"num_tokens": 929868.0,
"step": 415
},
{
"entropy": 6.4867551803588865,
"epoch": 0.45429962141698216,
"grad_norm": 1.09375,
"learning_rate": 0.0002095,
"loss": 6.2806,
"mean_token_accuracy": 0.13965032547712325,
"num_tokens": 940582.0,
"step": 420
},
{
"entropy": 6.6291666507720945,
"epoch": 0.4597079502433748,
"grad_norm": 1.0390625,
"learning_rate": 0.000212,
"loss": 6.3463,
"mean_token_accuracy": 0.13679536208510398,
"num_tokens": 952233.0,
"step": 425
},
{
"entropy": 6.669621229171753,
"epoch": 0.46511627906976744,
"grad_norm": 1.515625,
"learning_rate": 0.0002145,
"loss": 6.4395,
"mean_token_accuracy": 0.13214596956968308,
"num_tokens": 964252.0,
"step": 430
},
{
"entropy": 6.623089265823364,
"epoch": 0.4705246078961601,
"grad_norm": 1.1484375,
"learning_rate": 0.00021700000000000002,
"loss": 6.3381,
"mean_token_accuracy": 0.1373963512480259,
"num_tokens": 974692.0,
"step": 435
},
{
"entropy": 6.575704860687256,
"epoch": 0.4759329367225527,
"grad_norm": 1.1328125,
"learning_rate": 0.0002195,
"loss": 6.354,
"mean_token_accuracy": 0.13740625306963922,
"num_tokens": 986019.0,
"step": 440
},
{
"entropy": 6.479989528656006,
"epoch": 0.48134126554894535,
"grad_norm": 1.4453125,
"learning_rate": 0.000222,
"loss": 6.2588,
"mean_token_accuracy": 0.1383764624595642,
"num_tokens": 996701.0,
"step": 445
},
{
"entropy": 6.638360166549683,
"epoch": 0.48674959437533805,
"grad_norm": 1.1484375,
"learning_rate": 0.0002245,
"loss": 6.3562,
"mean_token_accuracy": 0.1420356035232544,
"num_tokens": 1008596.0,
"step": 450
},
{
"entropy": 6.603897285461426,
"epoch": 0.4921579232017307,
"grad_norm": 1.15625,
"learning_rate": 0.00022700000000000002,
"loss": 6.3896,
"mean_token_accuracy": 0.13321260511875152,
"num_tokens": 1019263.0,
"step": 455
},
{
"entropy": 6.627950143814087,
"epoch": 0.4975662520281233,
"grad_norm": 1.296875,
"learning_rate": 0.00022950000000000002,
"loss": 6.3281,
"mean_token_accuracy": 0.13852308169007302,
"num_tokens": 1029460.0,
"step": 460
},
{
"entropy": 6.532049703598022,
"epoch": 0.502974580854516,
"grad_norm": 1.1796875,
"learning_rate": 0.00023200000000000003,
"loss": 6.3947,
"mean_token_accuracy": 0.13395455181598664,
"num_tokens": 1041747.0,
"step": 465
},
{
"entropy": 6.580554580688476,
"epoch": 0.5083829096809086,
"grad_norm": 1.234375,
"learning_rate": 0.00023449999999999998,
"loss": 6.2302,
"mean_token_accuracy": 0.13726723864674567,
"num_tokens": 1051645.0,
"step": 470
},
{
"entropy": 6.394359159469604,
"epoch": 0.5137912385073012,
"grad_norm": 1.3046875,
"learning_rate": 0.000237,
"loss": 6.1471,
"mean_token_accuracy": 0.14182863682508468,
"num_tokens": 1062358.0,
"step": 475
},
{
"entropy": 6.6230544090271,
"epoch": 0.5191995673336939,
"grad_norm": 1.171875,
"learning_rate": 0.0002395,
"loss": 6.3291,
"mean_token_accuracy": 0.13732218518853187,
"num_tokens": 1074234.0,
"step": 480
},
{
"entropy": 6.400064849853516,
"epoch": 0.5246078961600865,
"grad_norm": 1.1640625,
"learning_rate": 0.000242,
"loss": 6.257,
"mean_token_accuracy": 0.1385449767112732,
"num_tokens": 1086608.0,
"step": 485
},
{
"entropy": 6.640989637374878,
"epoch": 0.5300162249864792,
"grad_norm": 1.234375,
"learning_rate": 0.0002445,
"loss": 6.3092,
"mean_token_accuracy": 0.1422146663069725,
"num_tokens": 1096878.0,
"step": 490
},
{
"entropy": 6.501981782913208,
"epoch": 0.5354245538128718,
"grad_norm": 1.125,
"learning_rate": 0.000247,
"loss": 6.3667,
"mean_token_accuracy": 0.14159199818968773,
"num_tokens": 1108089.0,
"step": 495
},
{
"entropy": 6.608476877212524,
"epoch": 0.5408328826392644,
"grad_norm": 1.1796875,
"learning_rate": 0.0002495,
"loss": 6.3983,
"mean_token_accuracy": 0.13436152264475823,
"num_tokens": 1120910.0,
"step": 500
},
{
"entropy": 6.558342504501343,
"epoch": 0.5462412114656571,
"grad_norm": 1.4140625,
"learning_rate": 0.000252,
"loss": 6.2966,
"mean_token_accuracy": 0.13886259347200394,
"num_tokens": 1131685.0,
"step": 505
},
{
"entropy": 6.493104648590088,
"epoch": 0.5516495402920497,
"grad_norm": 1.2578125,
"learning_rate": 0.0002545,
"loss": 6.337,
"mean_token_accuracy": 0.13808612152934074,
"num_tokens": 1142273.0,
"step": 510
},
{
"entropy": 6.593916702270508,
"epoch": 0.5570578691184424,
"grad_norm": 1.3203125,
"learning_rate": 0.000257,
"loss": 6.212,
"mean_token_accuracy": 0.1403546467423439,
"num_tokens": 1152818.0,
"step": 515
},
{
"entropy": 6.4184082508087155,
"epoch": 0.5624661979448351,
"grad_norm": 1.1328125,
"learning_rate": 0.0002595,
"loss": 6.2539,
"mean_token_accuracy": 0.14156585782766343,
"num_tokens": 1163398.0,
"step": 520
},
{
"entropy": 6.639800310134888,
"epoch": 0.5678745267712277,
"grad_norm": 1.2265625,
"learning_rate": 0.000262,
"loss": 6.3113,
"mean_token_accuracy": 0.14177494123578072,
"num_tokens": 1174493.0,
"step": 525
},
{
"entropy": 6.449878311157226,
"epoch": 0.5732828555976204,
"grad_norm": 1.4296875,
"learning_rate": 0.00026450000000000003,
"loss": 6.2964,
"mean_token_accuracy": 0.14197195023298265,
"num_tokens": 1185534.0,
"step": 530
},
{
"entropy": 6.524397659301758,
"epoch": 0.578691184424013,
"grad_norm": 1.46875,
"learning_rate": 0.00026700000000000004,
"loss": 6.2393,
"mean_token_accuracy": 0.14146455824375154,
"num_tokens": 1196488.0,
"step": 535
},
{
"entropy": 6.451419448852539,
"epoch": 0.5840995132504057,
"grad_norm": 1.2578125,
"learning_rate": 0.00026950000000000005,
"loss": 6.3155,
"mean_token_accuracy": 0.139084542542696,
"num_tokens": 1208116.0,
"step": 540
},
{
"entropy": 6.48581862449646,
"epoch": 0.5895078420767983,
"grad_norm": 1.1171875,
"learning_rate": 0.00027200000000000005,
"loss": 6.3035,
"mean_token_accuracy": 0.14370152205228806,
"num_tokens": 1219571.0,
"step": 545
},
{
"entropy": 6.518029594421387,
"epoch": 0.5949161709031909,
"grad_norm": 1.265625,
"learning_rate": 0.0002745,
"loss": 6.2869,
"mean_token_accuracy": 0.13986791446805,
"num_tokens": 1231049.0,
"step": 550
},
{
"entropy": 6.475363636016846,
"epoch": 0.6003244997295836,
"grad_norm": 1.1640625,
"learning_rate": 0.000277,
"loss": 6.3097,
"mean_token_accuracy": 0.1364640511572361,
"num_tokens": 1242507.0,
"step": 555
},
{
"entropy": 6.44856014251709,
"epoch": 0.6057328285559762,
"grad_norm": 1.2578125,
"learning_rate": 0.0002795,
"loss": 6.2934,
"mean_token_accuracy": 0.13697041645646096,
"num_tokens": 1253607.0,
"step": 560
},
{
"entropy": 6.528074312210083,
"epoch": 0.6111411573823688,
"grad_norm": 1.203125,
"learning_rate": 0.00028199999999999997,
"loss": 6.3358,
"mean_token_accuracy": 0.13758110031485557,
"num_tokens": 1266604.0,
"step": 565
},
{
"entropy": 6.573901605606079,
"epoch": 0.6165494862087615,
"grad_norm": 1.234375,
"learning_rate": 0.0002845,
"loss": 6.3815,
"mean_token_accuracy": 0.13712944313883782,
"num_tokens": 1276930.0,
"step": 570
},
{
"entropy": 6.598294305801391,
"epoch": 0.6219578150351541,
"grad_norm": 1.2421875,
"learning_rate": 0.000287,
"loss": 6.3853,
"mean_token_accuracy": 0.13915850892663,
"num_tokens": 1288326.0,
"step": 575
},
{
"entropy": 6.450491666793823,
"epoch": 0.6273661438615468,
"grad_norm": 1.3046875,
"learning_rate": 0.0002895,
"loss": 6.3287,
"mean_token_accuracy": 0.13975025117397308,
"num_tokens": 1298950.0,
"step": 580
},
{
"entropy": 6.524539470672607,
"epoch": 0.6327744726879394,
"grad_norm": 1.1875,
"learning_rate": 0.000292,
"loss": 6.3231,
"mean_token_accuracy": 0.13521830812096597,
"num_tokens": 1311254.0,
"step": 585
},
{
"entropy": 6.515868997573852,
"epoch": 0.638182801514332,
"grad_norm": 1.25,
"learning_rate": 0.0002945,
"loss": 6.2362,
"mean_token_accuracy": 0.13961164206266402,
"num_tokens": 1322723.0,
"step": 590
},
{
"entropy": 6.4743040084838865,
"epoch": 0.6435911303407247,
"grad_norm": 1.1640625,
"learning_rate": 0.000297,
"loss": 6.2488,
"mean_token_accuracy": 0.14040838554501534,
"num_tokens": 1333998.0,
"step": 595
},
{
"entropy": 6.309730291366577,
"epoch": 0.6489994591671173,
"grad_norm": 1.2265625,
"learning_rate": 0.0002995,
"loss": 6.1926,
"mean_token_accuracy": 0.14279944226145744,
"num_tokens": 1345113.0,
"step": 600
},
{
"entropy": 6.439900350570679,
"epoch": 0.65440778799351,
"grad_norm": 1.171875,
"learning_rate": 0.000302,
"loss": 6.2886,
"mean_token_accuracy": 0.14252566993236543,
"num_tokens": 1356850.0,
"step": 605
},
{
"entropy": 6.550169944763184,
"epoch": 0.6598161168199026,
"grad_norm": 1.265625,
"learning_rate": 0.0003045,
"loss": 6.3744,
"mean_token_accuracy": 0.1397650845348835,
"num_tokens": 1369671.0,
"step": 610
},
{
"entropy": 6.427625703811645,
"epoch": 0.6652244456462953,
"grad_norm": 1.2109375,
"learning_rate": 0.000307,
"loss": 6.2835,
"mean_token_accuracy": 0.13882820978760718,
"num_tokens": 1380298.0,
"step": 615
},
{
"entropy": 6.527406787872314,
"epoch": 0.670632774472688,
"grad_norm": 1.15625,
"learning_rate": 0.0003095,
"loss": 6.2763,
"mean_token_accuracy": 0.13872483968734742,
"num_tokens": 1391617.0,
"step": 620
},
{
"entropy": 6.535118579864502,
"epoch": 0.6760411032990806,
"grad_norm": 1.375,
"learning_rate": 0.000312,
"loss": 6.3461,
"mean_token_accuracy": 0.14173057228326796,
"num_tokens": 1403509.0,
"step": 625
},
{
"entropy": 6.511589908599854,
"epoch": 0.6814494321254733,
"grad_norm": 1.21875,
"learning_rate": 0.0003145,
"loss": 6.4039,
"mean_token_accuracy": 0.13432303741574286,
"num_tokens": 1415125.0,
"step": 630
},
{
"entropy": 6.580691337585449,
"epoch": 0.6868577609518659,
"grad_norm": 1.28125,
"learning_rate": 0.000317,
"loss": 6.402,
"mean_token_accuracy": 0.13456533700227738,
"num_tokens": 1426785.0,
"step": 635
},
{
"entropy": 6.480119514465332,
"epoch": 0.6922660897782585,
"grad_norm": 1.1953125,
"learning_rate": 0.0003195,
"loss": 6.3605,
"mean_token_accuracy": 0.12881308048963547,
"num_tokens": 1439013.0,
"step": 640
},
{
"entropy": 6.417783641815186,
"epoch": 0.6976744186046512,
"grad_norm": 1.1953125,
"learning_rate": 0.000322,
"loss": 6.2202,
"mean_token_accuracy": 0.14642192423343658,
"num_tokens": 1449818.0,
"step": 645
},
{
"entropy": 6.413159942626953,
"epoch": 0.7030827474310438,
"grad_norm": 1.1875,
"learning_rate": 0.00032450000000000003,
"loss": 6.1358,
"mean_token_accuracy": 0.1415444567799568,
"num_tokens": 1460681.0,
"step": 650
},
{
"entropy": 6.338744592666626,
"epoch": 0.7084910762574365,
"grad_norm": 1.0859375,
"learning_rate": 0.00032700000000000003,
"loss": 6.2476,
"mean_token_accuracy": 0.13981930315494537,
"num_tokens": 1471840.0,
"step": 655
},
{
"entropy": 6.466752004623413,
"epoch": 0.7138994050838291,
"grad_norm": 1.328125,
"learning_rate": 0.00032950000000000004,
"loss": 6.2436,
"mean_token_accuracy": 0.14259599149227142,
"num_tokens": 1482326.0,
"step": 660
},
{
"entropy": 6.328251123428345,
"epoch": 0.7193077339102217,
"grad_norm": 1.203125,
"learning_rate": 0.00033200000000000005,
"loss": 6.1715,
"mean_token_accuracy": 0.14127768352627754,
"num_tokens": 1493277.0,
"step": 665
},
{
"entropy": 6.4282067775726315,
"epoch": 0.7247160627366144,
"grad_norm": 1.3203125,
"learning_rate": 0.00033450000000000005,
"loss": 6.2511,
"mean_token_accuracy": 0.14475265368819237,
"num_tokens": 1504563.0,
"step": 670
},
{
"entropy": 6.372472429275513,
"epoch": 0.730124391563007,
"grad_norm": 1.2109375,
"learning_rate": 0.000337,
"loss": 6.2369,
"mean_token_accuracy": 0.1476322367787361,
"num_tokens": 1516311.0,
"step": 675
},
{
"entropy": 6.354723262786865,
"epoch": 0.7355327203893997,
"grad_norm": 1.1953125,
"learning_rate": 0.0003395,
"loss": 6.1563,
"mean_token_accuracy": 0.14649124294519425,
"num_tokens": 1527391.0,
"step": 680
},
{
"entropy": 6.439003276824951,
"epoch": 0.7409410492157923,
"grad_norm": 1.1328125,
"learning_rate": 0.000342,
"loss": 6.2846,
"mean_token_accuracy": 0.14316972196102143,
"num_tokens": 1537755.0,
"step": 685
},
{
"entropy": 6.466528415679932,
"epoch": 0.7463493780421849,
"grad_norm": 1.125,
"learning_rate": 0.00034449999999999997,
"loss": 6.3203,
"mean_token_accuracy": 0.1379350833594799,
"num_tokens": 1550525.0,
"step": 690
},
{
"entropy": 6.425952291488647,
"epoch": 0.7517577068685776,
"grad_norm": 1.1953125,
"learning_rate": 0.000347,
"loss": 6.2344,
"mean_token_accuracy": 0.14136113673448564,
"num_tokens": 1561995.0,
"step": 695
},
{
"entropy": 6.384309434890747,
"epoch": 0.7571660356949702,
"grad_norm": 1.078125,
"learning_rate": 0.0003495,
"loss": 6.2363,
"mean_token_accuracy": 0.13751797899603843,
"num_tokens": 1573137.0,
"step": 700
},
{
"entropy": 6.332474660873413,
"epoch": 0.7625743645213628,
"grad_norm": 1.234375,
"learning_rate": 0.000352,
"loss": 6.2516,
"mean_token_accuracy": 0.1449413001537323,
"num_tokens": 1584938.0,
"step": 705
},
{
"entropy": 6.549186563491821,
"epoch": 0.7679826933477556,
"grad_norm": 1.328125,
"learning_rate": 0.0003545,
"loss": 6.308,
"mean_token_accuracy": 0.1355679027736187,
"num_tokens": 1596306.0,
"step": 710
},
{
"entropy": 6.34313998222351,
"epoch": 0.7733910221741482,
"grad_norm": 1.15625,
"learning_rate": 0.000357,
"loss": 6.2934,
"mean_token_accuracy": 0.14217483699321748,
"num_tokens": 1608112.0,
"step": 715
},
{
"entropy": 6.5022155284881595,
"epoch": 0.7787993510005409,
"grad_norm": 1.0625,
"learning_rate": 0.0003595,
"loss": 6.2833,
"mean_token_accuracy": 0.14302016869187356,
"num_tokens": 1618635.0,
"step": 720
},
{
"entropy": 6.277605819702148,
"epoch": 0.7842076798269335,
"grad_norm": 1.171875,
"learning_rate": 0.000362,
"loss": 6.1878,
"mean_token_accuracy": 0.14160637855529784,
"num_tokens": 1629476.0,
"step": 725
},
{
"entropy": 6.544418144226074,
"epoch": 0.7896160086533262,
"grad_norm": 1.1484375,
"learning_rate": 0.0003645,
"loss": 6.2851,
"mean_token_accuracy": 0.14023412466049195,
"num_tokens": 1641305.0,
"step": 730
},
{
"entropy": 6.323581790924072,
"epoch": 0.7950243374797188,
"grad_norm": 1.046875,
"learning_rate": 0.000367,
"loss": 6.228,
"mean_token_accuracy": 0.1453120455145836,
"num_tokens": 1653424.0,
"step": 735
},
{
"entropy": 6.338683032989502,
"epoch": 0.8004326663061114,
"grad_norm": 1.3359375,
"learning_rate": 0.0003695,
"loss": 6.2738,
"mean_token_accuracy": 0.13886456340551376,
"num_tokens": 1664222.0,
"step": 740
},
{
"entropy": 6.45950026512146,
"epoch": 0.8058409951325041,
"grad_norm": 1.21875,
"learning_rate": 0.000372,
"loss": 6.3182,
"mean_token_accuracy": 0.13927288502454757,
"num_tokens": 1676829.0,
"step": 745
},
{
"entropy": 6.389509057998657,
"epoch": 0.8112493239588967,
"grad_norm": 1.1640625,
"learning_rate": 0.0003745,
"loss": 6.2171,
"mean_token_accuracy": 0.13743837997317315,
"num_tokens": 1688534.0,
"step": 750
},
{
"entropy": 6.2615196228027346,
"epoch": 0.8166576527852893,
"grad_norm": 1.171875,
"learning_rate": 0.000377,
"loss": 6.1995,
"mean_token_accuracy": 0.14325060099363326,
"num_tokens": 1699051.0,
"step": 755
},
{
"entropy": 6.446281814575196,
"epoch": 0.822065981611682,
"grad_norm": 1.1796875,
"learning_rate": 0.0003795,
"loss": 6.2276,
"mean_token_accuracy": 0.13753046318888665,
"num_tokens": 1709849.0,
"step": 760
},
{
"entropy": 6.236609411239624,
"epoch": 0.8274743104380746,
"grad_norm": 1.109375,
"learning_rate": 0.000382,
"loss": 6.0689,
"mean_token_accuracy": 0.15064243003726005,
"num_tokens": 1721956.0,
"step": 765
},
{
"entropy": 6.327112913131714,
"epoch": 0.8328826392644673,
"grad_norm": 1.1640625,
"learning_rate": 0.0003845,
"loss": 6.0921,
"mean_token_accuracy": 0.15326208472251893,
"num_tokens": 1733302.0,
"step": 770
},
{
"entropy": 6.198913812637329,
"epoch": 0.8382909680908599,
"grad_norm": 1.140625,
"learning_rate": 0.00038700000000000003,
"loss": 6.041,
"mean_token_accuracy": 0.15577499121427535,
"num_tokens": 1744835.0,
"step": 775
},
{
"entropy": 6.3341676712036135,
"epoch": 0.8436992969172525,
"grad_norm": 1.2109375,
"learning_rate": 0.00038950000000000003,
"loss": 6.1797,
"mean_token_accuracy": 0.14762855991721152,
"num_tokens": 1755174.0,
"step": 780
},
{
"entropy": 6.381376791000366,
"epoch": 0.8491076257436452,
"grad_norm": 1.09375,
"learning_rate": 0.00039200000000000004,
"loss": 6.3989,
"mean_token_accuracy": 0.13875442296266555,
"num_tokens": 1767572.0,
"step": 785
},
{
"entropy": 6.218066310882568,
"epoch": 0.8545159545700378,
"grad_norm": 1.1640625,
"learning_rate": 0.00039450000000000005,
"loss": 6.1405,
"mean_token_accuracy": 0.1449118934571743,
"num_tokens": 1777537.0,
"step": 790
},
{
"entropy": 6.425797414779663,
"epoch": 0.8599242833964305,
"grad_norm": 1.171875,
"learning_rate": 0.00039700000000000005,
"loss": 6.1712,
"mean_token_accuracy": 0.14846592620015145,
"num_tokens": 1789731.0,
"step": 795
},
{
"entropy": 6.419421625137329,
"epoch": 0.8653326122228231,
"grad_norm": 1.1875,
"learning_rate": 0.0003995,
"loss": 6.3029,
"mean_token_accuracy": 0.14081404209136963,
"num_tokens": 1800754.0,
"step": 800
},
{
"entropy": 6.272062110900879,
"epoch": 0.8707409410492158,
"grad_norm": 1.28125,
"learning_rate": 0.000402,
"loss": 6.2734,
"mean_token_accuracy": 0.1466397300362587,
"num_tokens": 1811496.0,
"step": 805
},
{
"entropy": 6.3589723110198975,
"epoch": 0.8761492698756085,
"grad_norm": 1.0703125,
"learning_rate": 0.0004045,
"loss": 6.184,
"mean_token_accuracy": 0.1434461772441864,
"num_tokens": 1822733.0,
"step": 810
},
{
"entropy": 6.342323112487793,
"epoch": 0.8815575987020011,
"grad_norm": 1.1796875,
"learning_rate": 0.00040699999999999997,
"loss": 6.1623,
"mean_token_accuracy": 0.14631599932909012,
"num_tokens": 1834121.0,
"step": 815
},
{
"entropy": 6.243607139587402,
"epoch": 0.8869659275283938,
"grad_norm": 1.28125,
"learning_rate": 0.0004095,
"loss": 6.0895,
"mean_token_accuracy": 0.1486702710390091,
"num_tokens": 1844674.0,
"step": 820
},
{
"entropy": 6.2104573249816895,
"epoch": 0.8923742563547864,
"grad_norm": 1.1015625,
"learning_rate": 0.000412,
"loss": 6.0988,
"mean_token_accuracy": 0.1491689234972,
"num_tokens": 1856692.0,
"step": 825
},
{
"entropy": 6.453680181503296,
"epoch": 0.897782585181179,
"grad_norm": 1.1953125,
"learning_rate": 0.0004145,
"loss": 6.3707,
"mean_token_accuracy": 0.1408935658633709,
"num_tokens": 1867888.0,
"step": 830
},
{
"entropy": 6.105977869033813,
"epoch": 0.9031909140075717,
"grad_norm": 1.2109375,
"learning_rate": 0.000417,
"loss": 6.043,
"mean_token_accuracy": 0.15483584851026536,
"num_tokens": 1877869.0,
"step": 835
},
{
"entropy": 6.322730207443238,
"epoch": 0.9085992428339643,
"grad_norm": 1.2109375,
"learning_rate": 0.0004195,
"loss": 6.1548,
"mean_token_accuracy": 0.1412374958395958,
"num_tokens": 1887975.0,
"step": 840
},
{
"entropy": 6.305921459197998,
"epoch": 0.914007571660357,
"grad_norm": 1.0078125,
"learning_rate": 0.000422,
"loss": 6.1018,
"mean_token_accuracy": 0.14518715515732766,
"num_tokens": 1898289.0,
"step": 845
},
{
"entropy": 6.211407423019409,
"epoch": 0.9194159004867496,
"grad_norm": 1.25,
"learning_rate": 0.0004245,
"loss": 6.2213,
"mean_token_accuracy": 0.15009732991456987,
"num_tokens": 1910038.0,
"step": 850
},
{
"entropy": 6.209096813201905,
"epoch": 0.9248242293131422,
"grad_norm": 1.1640625,
"learning_rate": 0.000427,
"loss": 6.0914,
"mean_token_accuracy": 0.15314256697893142,
"num_tokens": 1920774.0,
"step": 855
},
{
"entropy": 6.293406915664673,
"epoch": 0.9302325581395349,
"grad_norm": 1.203125,
"learning_rate": 0.0004295,
"loss": 6.1251,
"mean_token_accuracy": 0.15404994785785675,
"num_tokens": 1932085.0,
"step": 860
},
{
"entropy": 6.232555866241455,
"epoch": 0.9356408869659275,
"grad_norm": 1.109375,
"learning_rate": 0.000432,
"loss": 6.1331,
"mean_token_accuracy": 0.15166230872273445,
"num_tokens": 1943949.0,
"step": 865
},
{
"entropy": 6.28867917060852,
"epoch": 0.9410492157923201,
"grad_norm": 1.0546875,
"learning_rate": 0.0004345,
"loss": 6.1927,
"mean_token_accuracy": 0.14988541305065156,
"num_tokens": 1956051.0,
"step": 870
},
{
"entropy": 6.260223913192749,
"epoch": 0.9464575446187128,
"grad_norm": 1.140625,
"learning_rate": 0.000437,
"loss": 6.1868,
"mean_token_accuracy": 0.14389916732907296,
"num_tokens": 1967804.0,
"step": 875
},
{
"entropy": 6.208997774124145,
"epoch": 0.9518658734451054,
"grad_norm": 1.1875,
"learning_rate": 0.0004395,
"loss": 6.2995,
"mean_token_accuracy": 0.13391195982694626,
"num_tokens": 1979222.0,
"step": 880
},
{
"entropy": 6.381609487533569,
"epoch": 0.9572742022714981,
"grad_norm": 1.140625,
"learning_rate": 0.000442,
"loss": 6.2248,
"mean_token_accuracy": 0.14088413566350938,
"num_tokens": 1988998.0,
"step": 885
},
{
"entropy": 6.245026969909668,
"epoch": 0.9626825310978907,
"grad_norm": 1.09375,
"learning_rate": 0.0004445,
"loss": 6.1451,
"mean_token_accuracy": 0.14165820479393004,
"num_tokens": 2000539.0,
"step": 890
},
{
"entropy": 6.321556282043457,
"epoch": 0.9680908599242833,
"grad_norm": 1.1171875,
"learning_rate": 0.000447,
"loss": 6.2385,
"mean_token_accuracy": 0.14436768293380736,
"num_tokens": 2012321.0,
"step": 895
},
{
"entropy": 6.173920106887818,
"epoch": 0.9734991887506761,
"grad_norm": 1.09375,
"learning_rate": 0.00044950000000000003,
"loss": 6.1231,
"mean_token_accuracy": 0.14439835995435715,
"num_tokens": 2023330.0,
"step": 900
},
{
"entropy": 6.284840297698975,
"epoch": 0.9789075175770687,
"grad_norm": 1.0703125,
"learning_rate": 0.00045200000000000004,
"loss": 6.1095,
"mean_token_accuracy": 0.13921767249703407,
"num_tokens": 2034655.0,
"step": 905
},
{
"entropy": 6.110538482666016,
"epoch": 0.9843158464034614,
"grad_norm": 1.0625,
"learning_rate": 0.00045450000000000004,
"loss": 6.1513,
"mean_token_accuracy": 0.1441517509520054,
"num_tokens": 2045785.0,
"step": 910
},
{
"entropy": 6.445047616958618,
"epoch": 0.989724175229854,
"grad_norm": 1.03125,
"learning_rate": 0.00045700000000000005,
"loss": 6.2424,
"mean_token_accuracy": 0.14532435238361358,
"num_tokens": 2056038.0,
"step": 915
},
{
"entropy": 6.129134559631348,
"epoch": 0.9951325040562466,
"grad_norm": 1.34375,
"learning_rate": 0.00045950000000000006,
"loss": 6.1023,
"mean_token_accuracy": 0.15468567311763765,
"num_tokens": 2066803.0,
"step": 920
},
{
"entropy": 6.241815196143256,
"epoch": 1.0,
"grad_norm": 1.90625,
"learning_rate": 0.000462,
"loss": 6.2124,
"mean_token_accuracy": 0.14124820878108343,
"num_tokens": 2076889.0,
"step": 925
},
{
"entropy": 6.257176446914673,
"epoch": 1.0054083288263926,
"grad_norm": 1.0625,
"learning_rate": 0.0004645,
"loss": 5.9752,
"mean_token_accuracy": 0.14727601259946824,
"num_tokens": 2089019.0,
"step": 930
},
{
"entropy": 6.028801822662354,
"epoch": 1.0108166576527853,
"grad_norm": 1.1953125,
"learning_rate": 0.000467,
"loss": 5.8447,
"mean_token_accuracy": 0.16022417545318604,
"num_tokens": 2099849.0,
"step": 935
},
{
"entropy": 6.177911376953125,
"epoch": 1.016224986479178,
"grad_norm": 1.234375,
"learning_rate": 0.0004695,
"loss": 6.0094,
"mean_token_accuracy": 0.1548767253756523,
"num_tokens": 2110671.0,
"step": 940
},
{
"entropy": 6.136840963363648,
"epoch": 1.0216333153055706,
"grad_norm": 1.125,
"learning_rate": 0.000472,
"loss": 6.0524,
"mean_token_accuracy": 0.1497804716229439,
"num_tokens": 2122357.0,
"step": 945
},
{
"entropy": 6.268298530578614,
"epoch": 1.0270416441319632,
"grad_norm": 1.1171875,
"learning_rate": 0.0004745,
"loss": 5.9944,
"mean_token_accuracy": 0.14714996218681337,
"num_tokens": 2133878.0,
"step": 950
},
{
"entropy": 6.203853130340576,
"epoch": 1.0324499729583558,
"grad_norm": 1.1171875,
"learning_rate": 0.000477,
"loss": 6.0033,
"mean_token_accuracy": 0.15483788400888443,
"num_tokens": 2145565.0,
"step": 955
},
{
"entropy": 6.0750096321105955,
"epoch": 1.0378583017847485,
"grad_norm": 1.0390625,
"learning_rate": 0.0004795,
"loss": 5.9273,
"mean_token_accuracy": 0.14823657721281053,
"num_tokens": 2157393.0,
"step": 960
},
{
"entropy": 6.056691598892212,
"epoch": 1.043266630611141,
"grad_norm": 1.03125,
"learning_rate": 0.000482,
"loss": 5.7809,
"mean_token_accuracy": 0.1595247745513916,
"num_tokens": 2169318.0,
"step": 965
},
{
"entropy": 6.050301027297974,
"epoch": 1.0486749594375337,
"grad_norm": 1.1015625,
"learning_rate": 0.0004845,
"loss": 5.8674,
"mean_token_accuracy": 0.15364039540290833,
"num_tokens": 2179727.0,
"step": 970
},
{
"entropy": 6.027638483047485,
"epoch": 1.0540832882639264,
"grad_norm": 1.1328125,
"learning_rate": 0.000487,
"loss": 5.9021,
"mean_token_accuracy": 0.1545193985104561,
"num_tokens": 2190119.0,
"step": 975
},
{
"entropy": 6.070952320098877,
"epoch": 1.059491617090319,
"grad_norm": 1.09375,
"learning_rate": 0.0004895,
"loss": 5.9234,
"mean_token_accuracy": 0.15558279752731324,
"num_tokens": 2201077.0,
"step": 980
},
{
"entropy": 6.101561832427978,
"epoch": 1.0648999459167117,
"grad_norm": 1.3203125,
"learning_rate": 0.000492,
"loss": 5.9922,
"mean_token_accuracy": 0.15358568280935286,
"num_tokens": 2211572.0,
"step": 985
},
{
"entropy": 6.181616640090942,
"epoch": 1.0703082747431043,
"grad_norm": 1.0,
"learning_rate": 0.0004945,
"loss": 6.0144,
"mean_token_accuracy": 0.1533959075808525,
"num_tokens": 2223372.0,
"step": 990
},
{
"entropy": 5.968746328353882,
"epoch": 1.075716603569497,
"grad_norm": 1.1171875,
"learning_rate": 0.000497,
"loss": 5.886,
"mean_token_accuracy": 0.154812690615654,
"num_tokens": 2234946.0,
"step": 995
},
{
"entropy": 6.149488687515259,
"epoch": 1.0811249323958896,
"grad_norm": 1.0859375,
"learning_rate": 0.0004995,
"loss": 5.969,
"mean_token_accuracy": 0.14452582895755767,
"num_tokens": 2246608.0,
"step": 1000
},
{
"epoch": 1.0811249323958896,
"eval_entropy": 5.931731963157654,
"eval_loss": 6.293067455291748,
"eval_mean_token_accuracy": 0.14824318431995132,
"eval_num_tokens": 2246608.0,
"eval_runtime": 2.567,
"eval_samples_per_second": 1369.326,
"eval_steps_per_second": 171.409,
"step": 1000
}
],
"logging_steps": 5,
"max_steps": 9240,
"num_input_tokens_seen": 0,
"num_train_epochs": 10,
"save_steps": 1000,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 3536848945152000.0,
"train_batch_size": 16,
"trial_name": null,
"trial_params": null
}