Files
ModelHub XC ca53e5c0cb 初始化项目,由ModelHub XC社区提供模型
Model: fpadovani/eng-latn-100mb-ppt-Dp-10mb_seed3407
Source: Original Platform
2026-07-13 10:15:11 +08:00

2035 lines
54 KiB
JSON

{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.010746563786229353,
"eval_steps": 500,
"global_step": 1000,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"entropy": 10.691944599151611,
"epoch": 5.3732818931146765e-05,
"grad_norm": 15.4375,
"learning_rate": 2e-06,
"loss": 10.867,
"mean_token_accuracy": 0.0,
"num_tokens": 12868.0,
"step": 5
},
{
"entropy": 10.691931915283202,
"epoch": 0.00010746563786229353,
"grad_norm": 13.1875,
"learning_rate": 4.5e-06,
"loss": 10.7713,
"mean_token_accuracy": 0.0,
"num_tokens": 23808.0,
"step": 10
},
{
"entropy": 10.69122085571289,
"epoch": 0.0001611984567934403,
"grad_norm": 10.5625,
"learning_rate": 7e-06,
"loss": 10.4885,
"mean_token_accuracy": 0.017395494051743298,
"num_tokens": 34239.0,
"step": 15
},
{
"entropy": 10.684881401062011,
"epoch": 0.00021493127572458706,
"grad_norm": 6.15625,
"learning_rate": 9.5e-06,
"loss": 10.1795,
"mean_token_accuracy": 0.03431609831750393,
"num_tokens": 45311.0,
"step": 20
},
{
"entropy": 10.651975917816163,
"epoch": 0.00026866409465573383,
"grad_norm": 4.0625,
"learning_rate": 1.2e-05,
"loss": 9.8328,
"mean_token_accuracy": 0.039574161358177665,
"num_tokens": 56105.0,
"step": 25
},
{
"entropy": 10.609530162811279,
"epoch": 0.0003223969135868806,
"grad_norm": 3.078125,
"learning_rate": 1.4500000000000002e-05,
"loss": 9.7804,
"mean_token_accuracy": 0.03973569292575121,
"num_tokens": 68382.0,
"step": 30
},
{
"entropy": 10.593698596954345,
"epoch": 0.00037612973251802736,
"grad_norm": 2.921875,
"learning_rate": 1.7000000000000003e-05,
"loss": 9.619,
"mean_token_accuracy": 0.04424203187227249,
"num_tokens": 81209.0,
"step": 35
},
{
"entropy": 10.5916898727417,
"epoch": 0.0004298625514491741,
"grad_norm": 2.65625,
"learning_rate": 1.95e-05,
"loss": 9.5786,
"mean_token_accuracy": 0.03825619481503963,
"num_tokens": 94148.0,
"step": 40
},
{
"entropy": 10.594180679321289,
"epoch": 0.0004835953703803209,
"grad_norm": 2.6875,
"learning_rate": 2.2e-05,
"loss": 9.526,
"mean_token_accuracy": 0.048027387261390685,
"num_tokens": 106398.0,
"step": 45
},
{
"entropy": 10.578767490386962,
"epoch": 0.0005373281893114677,
"grad_norm": 2.34375,
"learning_rate": 2.4500000000000003e-05,
"loss": 9.5403,
"mean_token_accuracy": 0.04592233560979366,
"num_tokens": 118963.0,
"step": 50
},
{
"entropy": 10.581397247314452,
"epoch": 0.0005910610082426144,
"grad_norm": 2.53125,
"learning_rate": 2.7e-05,
"loss": 9.4431,
"mean_token_accuracy": 0.045610013604164126,
"num_tokens": 129302.0,
"step": 55
},
{
"entropy": 10.57803840637207,
"epoch": 0.0006447938271737612,
"grad_norm": 2.515625,
"learning_rate": 2.95e-05,
"loss": 9.3236,
"mean_token_accuracy": 0.05025259889662266,
"num_tokens": 139595.0,
"step": 60
},
{
"entropy": 10.486345100402833,
"epoch": 0.000698526646104908,
"grad_norm": 2.5,
"learning_rate": 3.2e-05,
"loss": 9.2169,
"mean_token_accuracy": 0.060793956741690636,
"num_tokens": 150436.0,
"step": 65
},
{
"entropy": 10.35349416732788,
"epoch": 0.0007522594650360547,
"grad_norm": 2.359375,
"learning_rate": 3.4500000000000005e-05,
"loss": 9.1404,
"mean_token_accuracy": 0.06265294775366784,
"num_tokens": 161692.0,
"step": 70
},
{
"entropy": 10.434385204315186,
"epoch": 0.0008059922839672015,
"grad_norm": 2.296875,
"learning_rate": 3.7e-05,
"loss": 9.0866,
"mean_token_accuracy": 0.06112063825130463,
"num_tokens": 173914.0,
"step": 75
},
{
"entropy": 10.437462615966798,
"epoch": 0.0008597251028983482,
"grad_norm": 2.171875,
"learning_rate": 3.95e-05,
"loss": 8.9348,
"mean_token_accuracy": 0.06636513993144036,
"num_tokens": 185793.0,
"step": 80
},
{
"entropy": 10.385666561126708,
"epoch": 0.000913457921829495,
"grad_norm": 2.484375,
"learning_rate": 4.2000000000000004e-05,
"loss": 8.9272,
"mean_token_accuracy": 0.06668606549501419,
"num_tokens": 199762.0,
"step": 85
},
{
"entropy": 10.262327003479005,
"epoch": 0.0009671907407606418,
"grad_norm": 2.734375,
"learning_rate": 4.45e-05,
"loss": 8.7491,
"mean_token_accuracy": 0.06684565916657448,
"num_tokens": 211760.0,
"step": 90
},
{
"entropy": 10.279810237884522,
"epoch": 0.0010209235596917885,
"grad_norm": 3.0,
"learning_rate": 4.7000000000000004e-05,
"loss": 8.6214,
"mean_token_accuracy": 0.07119264826178551,
"num_tokens": 222654.0,
"step": 95
},
{
"entropy": 10.154211807250977,
"epoch": 0.0010746563786229353,
"grad_norm": 2.03125,
"learning_rate": 4.9500000000000004e-05,
"loss": 8.605,
"mean_token_accuracy": 0.07087584175169467,
"num_tokens": 234906.0,
"step": 100
},
{
"entropy": 10.154182243347169,
"epoch": 0.001128389197554082,
"grad_norm": 1.96875,
"learning_rate": 5.2e-05,
"loss": 8.4204,
"mean_token_accuracy": 0.08174400329589844,
"num_tokens": 246419.0,
"step": 105
},
{
"entropy": 9.984860038757324,
"epoch": 0.0011821220164852288,
"grad_norm": 1.8828125,
"learning_rate": 5.45e-05,
"loss": 8.2827,
"mean_token_accuracy": 0.08357185944914818,
"num_tokens": 257878.0,
"step": 110
},
{
"entropy": 9.92540111541748,
"epoch": 0.0012358548354163756,
"grad_norm": 1.8515625,
"learning_rate": 5.7e-05,
"loss": 8.1352,
"mean_token_accuracy": 0.08523289784789086,
"num_tokens": 269180.0,
"step": 115
},
{
"entropy": 9.790580940246581,
"epoch": 0.0012895876543475224,
"grad_norm": 1.6875,
"learning_rate": 5.9499999999999996e-05,
"loss": 8.1268,
"mean_token_accuracy": 0.0837685689330101,
"num_tokens": 281482.0,
"step": 120
},
{
"entropy": 9.689721870422364,
"epoch": 0.0013433204732786691,
"grad_norm": 1.71875,
"learning_rate": 6.2e-05,
"loss": 7.9125,
"mean_token_accuracy": 0.08588041439652443,
"num_tokens": 292289.0,
"step": 125
},
{
"entropy": 9.55999813079834,
"epoch": 0.001397053292209816,
"grad_norm": 1.78125,
"learning_rate": 6.450000000000001e-05,
"loss": 7.8259,
"mean_token_accuracy": 0.08231885209679604,
"num_tokens": 303274.0,
"step": 130
},
{
"entropy": 9.327935886383056,
"epoch": 0.0014507861111409627,
"grad_norm": 1.625,
"learning_rate": 6.7e-05,
"loss": 7.6719,
"mean_token_accuracy": 0.0838103786110878,
"num_tokens": 314933.0,
"step": 135
},
{
"entropy": 9.111929130554199,
"epoch": 0.0015045189300721094,
"grad_norm": 1.4296875,
"learning_rate": 6.950000000000001e-05,
"loss": 7.5777,
"mean_token_accuracy": 0.08480807095766067,
"num_tokens": 327450.0,
"step": 140
},
{
"entropy": 8.934065532684325,
"epoch": 0.0015582517490032562,
"grad_norm": 1.234375,
"learning_rate": 7.2e-05,
"loss": 7.4816,
"mean_token_accuracy": 0.08673194646835328,
"num_tokens": 339409.0,
"step": 145
},
{
"entropy": 8.693235874176025,
"epoch": 0.001611984567934403,
"grad_norm": 1.1640625,
"learning_rate": 7.45e-05,
"loss": 7.4587,
"mean_token_accuracy": 0.08729644715785981,
"num_tokens": 352374.0,
"step": 150
},
{
"entropy": 8.44670124053955,
"epoch": 0.0016657173868655497,
"grad_norm": 1.4140625,
"learning_rate": 7.7e-05,
"loss": 7.3175,
"mean_token_accuracy": 0.09196643233299255,
"num_tokens": 363653.0,
"step": 155
},
{
"entropy": 8.291356182098388,
"epoch": 0.0017194502057966965,
"grad_norm": 1.5625,
"learning_rate": 7.950000000000001e-05,
"loss": 7.3101,
"mean_token_accuracy": 0.08862848281860351,
"num_tokens": 374982.0,
"step": 160
},
{
"entropy": 8.183576679229736,
"epoch": 0.0017731830247278433,
"grad_norm": 1.28125,
"learning_rate": 8.2e-05,
"loss": 7.2019,
"mean_token_accuracy": 0.08939464986324311,
"num_tokens": 387794.0,
"step": 165
},
{
"entropy": 8.042083930969238,
"epoch": 0.00182691584365899,
"grad_norm": 1.3671875,
"learning_rate": 8.450000000000001e-05,
"loss": 7.2703,
"mean_token_accuracy": 0.08938254192471504,
"num_tokens": 399993.0,
"step": 170
},
{
"entropy": 7.948488187789917,
"epoch": 0.0018806486625901368,
"grad_norm": 1.234375,
"learning_rate": 8.7e-05,
"loss": 7.1802,
"mean_token_accuracy": 0.10024765953421592,
"num_tokens": 410864.0,
"step": 175
},
{
"entropy": 7.877219009399414,
"epoch": 0.0019343814815212836,
"grad_norm": 1.25,
"learning_rate": 8.95e-05,
"loss": 7.2057,
"mean_token_accuracy": 0.09488844051957131,
"num_tokens": 422376.0,
"step": 180
},
{
"entropy": 7.852542734146118,
"epoch": 0.0019881143004524303,
"grad_norm": 1.2265625,
"learning_rate": 9.2e-05,
"loss": 7.1815,
"mean_token_accuracy": 0.10110960602760315,
"num_tokens": 434301.0,
"step": 185
},
{
"entropy": 7.8157186031341555,
"epoch": 0.002041847119383577,
"grad_norm": 1.5,
"learning_rate": 9.45e-05,
"loss": 7.1695,
"mean_token_accuracy": 0.09449249878525734,
"num_tokens": 446159.0,
"step": 190
},
{
"entropy": 7.741145420074463,
"epoch": 0.002095579938314724,
"grad_norm": 1.25,
"learning_rate": 9.7e-05,
"loss": 7.1823,
"mean_token_accuracy": 0.0965780720114708,
"num_tokens": 458376.0,
"step": 195
},
{
"entropy": 7.750446844100952,
"epoch": 0.0021493127572458706,
"grad_norm": 1.671875,
"learning_rate": 9.95e-05,
"loss": 7.1192,
"mean_token_accuracy": 0.10175004899501801,
"num_tokens": 469082.0,
"step": 200
},
{
"entropy": 7.683127355575562,
"epoch": 0.0022030455761770174,
"grad_norm": 1.3984375,
"learning_rate": 0.000102,
"loss": 7.0011,
"mean_token_accuracy": 0.10132882818579673,
"num_tokens": 480149.0,
"step": 205
},
{
"entropy": 7.6684812068939205,
"epoch": 0.002256778395108164,
"grad_norm": 1.3125,
"learning_rate": 0.00010449999999999999,
"loss": 7.1455,
"mean_token_accuracy": 0.0962664932012558,
"num_tokens": 493074.0,
"step": 210
},
{
"entropy": 7.615740251541138,
"epoch": 0.002310511214039311,
"grad_norm": 1.25,
"learning_rate": 0.000107,
"loss": 7.0009,
"mean_token_accuracy": 0.10513110086321831,
"num_tokens": 504647.0,
"step": 215
},
{
"entropy": 7.548989009857178,
"epoch": 0.0023642440329704577,
"grad_norm": 1.4375,
"learning_rate": 0.0001095,
"loss": 7.0833,
"mean_token_accuracy": 0.09757705479860306,
"num_tokens": 516304.0,
"step": 220
},
{
"entropy": 7.63504056930542,
"epoch": 0.0024179768519016044,
"grad_norm": 1.3125,
"learning_rate": 0.000112,
"loss": 7.0133,
"mean_token_accuracy": 0.1059924952685833,
"num_tokens": 526467.0,
"step": 225
},
{
"entropy": 7.553870820999146,
"epoch": 0.002471709670832751,
"grad_norm": 1.203125,
"learning_rate": 0.0001145,
"loss": 7.059,
"mean_token_accuracy": 0.10098145231604576,
"num_tokens": 539109.0,
"step": 230
},
{
"entropy": 7.517747688293457,
"epoch": 0.002525442489763898,
"grad_norm": 1.3984375,
"learning_rate": 0.00011700000000000001,
"loss": 6.9522,
"mean_token_accuracy": 0.09978492632508278,
"num_tokens": 550142.0,
"step": 235
},
{
"entropy": 7.522121000289917,
"epoch": 0.0025791753086950447,
"grad_norm": 1.125,
"learning_rate": 0.00011949999999999999,
"loss": 7.0176,
"mean_token_accuracy": 0.10614465549588203,
"num_tokens": 561639.0,
"step": 240
},
{
"entropy": 7.508337593078613,
"epoch": 0.0026329081276261915,
"grad_norm": 1.234375,
"learning_rate": 0.000122,
"loss": 6.9533,
"mean_token_accuracy": 0.10177289620041848,
"num_tokens": 573849.0,
"step": 245
},
{
"entropy": 7.48092360496521,
"epoch": 0.0026866409465573383,
"grad_norm": 1.3671875,
"learning_rate": 0.0001245,
"loss": 6.9289,
"mean_token_accuracy": 0.10615592449903488,
"num_tokens": 584572.0,
"step": 250
},
{
"entropy": 7.391205263137818,
"epoch": 0.002740373765488485,
"grad_norm": 1.203125,
"learning_rate": 0.000127,
"loss": 6.9508,
"mean_token_accuracy": 0.11110179796814919,
"num_tokens": 595314.0,
"step": 255
},
{
"entropy": 7.482128667831421,
"epoch": 0.002794106584419632,
"grad_norm": 1.3046875,
"learning_rate": 0.0001295,
"loss": 7.0476,
"mean_token_accuracy": 0.10385493785142899,
"num_tokens": 605689.0,
"step": 260
},
{
"entropy": 7.351570653915405,
"epoch": 0.0028478394033507786,
"grad_norm": 1.234375,
"learning_rate": 0.000132,
"loss": 6.8358,
"mean_token_accuracy": 0.11294776201248169,
"num_tokens": 617057.0,
"step": 265
},
{
"entropy": 7.4075196266174315,
"epoch": 0.0029015722222819253,
"grad_norm": 1.4140625,
"learning_rate": 0.00013450000000000002,
"loss": 6.9324,
"mean_token_accuracy": 0.10447231009602546,
"num_tokens": 628111.0,
"step": 270
},
{
"entropy": 7.342596530914307,
"epoch": 0.002955305041213072,
"grad_norm": 1.375,
"learning_rate": 0.00013700000000000002,
"loss": 6.8379,
"mean_token_accuracy": 0.1141952745616436,
"num_tokens": 639254.0,
"step": 275
},
{
"entropy": 7.35143084526062,
"epoch": 0.003009037860144219,
"grad_norm": 1.1171875,
"learning_rate": 0.0001395,
"loss": 6.9304,
"mean_token_accuracy": 0.1006052739918232,
"num_tokens": 651096.0,
"step": 280
},
{
"entropy": 7.301223182678223,
"epoch": 0.0030627706790753656,
"grad_norm": 1.1796875,
"learning_rate": 0.00014199999999999998,
"loss": 6.9238,
"mean_token_accuracy": 0.10944507122039795,
"num_tokens": 663132.0,
"step": 285
},
{
"entropy": 7.29386534690857,
"epoch": 0.0031165034980065124,
"grad_norm": 1.640625,
"learning_rate": 0.0001445,
"loss": 6.7711,
"mean_token_accuracy": 0.11792795732617378,
"num_tokens": 674160.0,
"step": 290
},
{
"entropy": 7.214638614654541,
"epoch": 0.003170236316937659,
"grad_norm": 1.578125,
"learning_rate": 0.000147,
"loss": 6.8337,
"mean_token_accuracy": 0.10255614519119263,
"num_tokens": 685284.0,
"step": 295
},
{
"entropy": 7.2078382015228275,
"epoch": 0.003223969135868806,
"grad_norm": 1.2578125,
"learning_rate": 0.0001495,
"loss": 6.7865,
"mean_token_accuracy": 0.10231738537549973,
"num_tokens": 696789.0,
"step": 300
},
{
"entropy": 7.242858171463013,
"epoch": 0.0032777019547999527,
"grad_norm": 1.4375,
"learning_rate": 0.000152,
"loss": 6.8906,
"mean_token_accuracy": 0.1063354529440403,
"num_tokens": 708083.0,
"step": 305
},
{
"entropy": 7.285495710372925,
"epoch": 0.0033314347737310995,
"grad_norm": 1.125,
"learning_rate": 0.00015450000000000001,
"loss": 6.8254,
"mean_token_accuracy": 0.11012862473726273,
"num_tokens": 720232.0,
"step": 310
},
{
"entropy": 7.072454166412354,
"epoch": 0.0033851675926622462,
"grad_norm": 1.34375,
"learning_rate": 0.000157,
"loss": 6.7098,
"mean_token_accuracy": 0.11381540670990944,
"num_tokens": 731264.0,
"step": 315
},
{
"entropy": 7.268528461456299,
"epoch": 0.003438900411593393,
"grad_norm": 1.3359375,
"learning_rate": 0.0001595,
"loss": 6.6929,
"mean_token_accuracy": 0.11482961028814316,
"num_tokens": 742158.0,
"step": 320
},
{
"entropy": 7.142989206314087,
"epoch": 0.0034926332305245398,
"grad_norm": 1.234375,
"learning_rate": 0.000162,
"loss": 6.776,
"mean_token_accuracy": 0.11389129087328911,
"num_tokens": 753330.0,
"step": 325
},
{
"entropy": 7.2236439228057865,
"epoch": 0.0035463660494556865,
"grad_norm": 1.390625,
"learning_rate": 0.00016450000000000001,
"loss": 6.7643,
"mean_token_accuracy": 0.11012546345591545,
"num_tokens": 765052.0,
"step": 330
},
{
"entropy": 7.140369892120361,
"epoch": 0.0036000988683868333,
"grad_norm": 1.359375,
"learning_rate": 0.00016700000000000002,
"loss": 6.7135,
"mean_token_accuracy": 0.11338407099246979,
"num_tokens": 775120.0,
"step": 335
},
{
"entropy": 7.167498207092285,
"epoch": 0.00365383168731798,
"grad_norm": 1.296875,
"learning_rate": 0.00016950000000000003,
"loss": 6.8179,
"mean_token_accuracy": 0.10822930335998535,
"num_tokens": 786442.0,
"step": 340
},
{
"entropy": 7.1545287609100345,
"epoch": 0.003707564506249127,
"grad_norm": 1.453125,
"learning_rate": 0.00017199999999999998,
"loss": 6.7217,
"mean_token_accuracy": 0.11315969750285149,
"num_tokens": 796526.0,
"step": 345
},
{
"entropy": 7.073437261581421,
"epoch": 0.0037612973251802736,
"grad_norm": 1.1484375,
"learning_rate": 0.00017449999999999999,
"loss": 6.7366,
"mean_token_accuracy": 0.11096625924110412,
"num_tokens": 808296.0,
"step": 350
},
{
"entropy": 7.14297833442688,
"epoch": 0.0038150301441114204,
"grad_norm": 1.34375,
"learning_rate": 0.000177,
"loss": 6.8753,
"mean_token_accuracy": 0.10760819539427757,
"num_tokens": 820142.0,
"step": 355
},
{
"entropy": 7.075785732269287,
"epoch": 0.003868762963042567,
"grad_norm": 1.4296875,
"learning_rate": 0.0001795,
"loss": 6.6351,
"mean_token_accuracy": 0.1149467647075653,
"num_tokens": 830656.0,
"step": 360
},
{
"entropy": 7.124733304977417,
"epoch": 0.003922495781973714,
"grad_norm": 1.203125,
"learning_rate": 0.000182,
"loss": 6.8206,
"mean_token_accuracy": 0.11161701381206512,
"num_tokens": 841948.0,
"step": 365
},
{
"entropy": 7.07345609664917,
"epoch": 0.003976228600904861,
"grad_norm": 1.2578125,
"learning_rate": 0.0001845,
"loss": 6.7821,
"mean_token_accuracy": 0.11786900460720062,
"num_tokens": 854207.0,
"step": 370
},
{
"entropy": 7.170615530014038,
"epoch": 0.004029961419836007,
"grad_norm": 1.1953125,
"learning_rate": 0.000187,
"loss": 6.8525,
"mean_token_accuracy": 0.12062755227088928,
"num_tokens": 866747.0,
"step": 375
},
{
"entropy": 7.042162704467773,
"epoch": 0.004083694238767154,
"grad_norm": 1.2421875,
"learning_rate": 0.0001895,
"loss": 6.7051,
"mean_token_accuracy": 0.11747116073966027,
"num_tokens": 877961.0,
"step": 380
},
{
"entropy": 7.085628366470337,
"epoch": 0.004137427057698301,
"grad_norm": 1.28125,
"learning_rate": 0.000192,
"loss": 6.7507,
"mean_token_accuracy": 0.10921004936099052,
"num_tokens": 888869.0,
"step": 385
},
{
"entropy": 7.034130811691284,
"epoch": 0.004191159876629448,
"grad_norm": 1.203125,
"learning_rate": 0.0001945,
"loss": 6.7366,
"mean_token_accuracy": 0.11664599329233169,
"num_tokens": 899408.0,
"step": 390
},
{
"entropy": 6.982698535919189,
"epoch": 0.0042448926955605945,
"grad_norm": 1.265625,
"learning_rate": 0.00019700000000000002,
"loss": 6.6711,
"mean_token_accuracy": 0.1158648207783699,
"num_tokens": 910457.0,
"step": 395
},
{
"entropy": 7.062652063369751,
"epoch": 0.004298625514491741,
"grad_norm": 1.2890625,
"learning_rate": 0.00019950000000000002,
"loss": 6.7841,
"mean_token_accuracy": 0.11403620392084121,
"num_tokens": 922772.0,
"step": 400
},
{
"entropy": 6.986512184143066,
"epoch": 0.004352358333422888,
"grad_norm": 1.25,
"learning_rate": 0.000202,
"loss": 6.6783,
"mean_token_accuracy": 0.11563151925802231,
"num_tokens": 933820.0,
"step": 405
},
{
"entropy": 7.02769365310669,
"epoch": 0.004406091152354035,
"grad_norm": 1.2421875,
"learning_rate": 0.00020449999999999998,
"loss": 6.6902,
"mean_token_accuracy": 0.12013663202524186,
"num_tokens": 945044.0,
"step": 410
},
{
"entropy": 6.937658596038818,
"epoch": 0.0044598239712851815,
"grad_norm": 1.2265625,
"learning_rate": 0.000207,
"loss": 6.6422,
"mean_token_accuracy": 0.11966706290841103,
"num_tokens": 956140.0,
"step": 415
},
{
"entropy": 6.904023456573486,
"epoch": 0.004513556790216328,
"grad_norm": 1.2734375,
"learning_rate": 0.0002095,
"loss": 6.5249,
"mean_token_accuracy": 0.11787364035844802,
"num_tokens": 967386.0,
"step": 420
},
{
"entropy": 6.979593801498413,
"epoch": 0.004567289609147475,
"grad_norm": 1.109375,
"learning_rate": 0.000212,
"loss": 6.7215,
"mean_token_accuracy": 0.11483194008469581,
"num_tokens": 980381.0,
"step": 425
},
{
"entropy": 6.9800636768341064,
"epoch": 0.004621022428078622,
"grad_norm": 1.15625,
"learning_rate": 0.0002145,
"loss": 6.6044,
"mean_token_accuracy": 0.11717872545123101,
"num_tokens": 992279.0,
"step": 430
},
{
"entropy": 6.966359424591064,
"epoch": 0.004674755247009769,
"grad_norm": 1.390625,
"learning_rate": 0.00021700000000000002,
"loss": 6.755,
"mean_token_accuracy": 0.11651304587721825,
"num_tokens": 1005046.0,
"step": 435
},
{
"entropy": 6.898645305633545,
"epoch": 0.004728488065940915,
"grad_norm": 1.5,
"learning_rate": 0.0002195,
"loss": 6.7279,
"mean_token_accuracy": 0.11459456831216812,
"num_tokens": 1018636.0,
"step": 440
},
{
"entropy": 6.968531131744385,
"epoch": 0.004782220884872062,
"grad_norm": 1.1015625,
"learning_rate": 0.000222,
"loss": 6.6579,
"mean_token_accuracy": 0.11964940950274468,
"num_tokens": 1030293.0,
"step": 445
},
{
"entropy": 6.921095752716065,
"epoch": 0.004835953703803209,
"grad_norm": 1.1796875,
"learning_rate": 0.0002245,
"loss": 6.6835,
"mean_token_accuracy": 0.11620648130774498,
"num_tokens": 1041853.0,
"step": 450
},
{
"entropy": 6.953577375411987,
"epoch": 0.004889686522734356,
"grad_norm": 1.109375,
"learning_rate": 0.00022700000000000002,
"loss": 6.7021,
"mean_token_accuracy": 0.12079041078686714,
"num_tokens": 1052959.0,
"step": 455
},
{
"entropy": 6.906730604171753,
"epoch": 0.004943419341665502,
"grad_norm": 1.3046875,
"learning_rate": 0.00022950000000000002,
"loss": 6.5797,
"mean_token_accuracy": 0.1155982829630375,
"num_tokens": 1064200.0,
"step": 460
},
{
"entropy": 6.912591934204102,
"epoch": 0.004997152160596649,
"grad_norm": 1.4140625,
"learning_rate": 0.00023200000000000003,
"loss": 6.7112,
"mean_token_accuracy": 0.11692484319210053,
"num_tokens": 1075643.0,
"step": 465
},
{
"entropy": 6.884953784942627,
"epoch": 0.005050884979527796,
"grad_norm": 1.0859375,
"learning_rate": 0.00023449999999999998,
"loss": 6.6495,
"mean_token_accuracy": 0.11548735648393631,
"num_tokens": 1086641.0,
"step": 470
},
{
"entropy": 6.768892002105713,
"epoch": 0.005104617798458943,
"grad_norm": 1.1796875,
"learning_rate": 0.000237,
"loss": 6.6014,
"mean_token_accuracy": 0.12133783251047134,
"num_tokens": 1098862.0,
"step": 475
},
{
"entropy": 6.882342195510864,
"epoch": 0.0051583506173900895,
"grad_norm": 1.3203125,
"learning_rate": 0.0002395,
"loss": 6.5766,
"mean_token_accuracy": 0.12126556858420372,
"num_tokens": 1110243.0,
"step": 480
},
{
"entropy": 6.835430574417114,
"epoch": 0.005212083436321236,
"grad_norm": 1.1484375,
"learning_rate": 0.000242,
"loss": 6.5728,
"mean_token_accuracy": 0.11558629795908928,
"num_tokens": 1122573.0,
"step": 485
},
{
"entropy": 6.88542947769165,
"epoch": 0.005265816255252383,
"grad_norm": 1.140625,
"learning_rate": 0.0002445,
"loss": 6.6432,
"mean_token_accuracy": 0.12129139229655266,
"num_tokens": 1133979.0,
"step": 490
},
{
"entropy": 6.83654465675354,
"epoch": 0.00531954907418353,
"grad_norm": 1.1875,
"learning_rate": 0.000247,
"loss": 6.646,
"mean_token_accuracy": 0.11814743131399155,
"num_tokens": 1145732.0,
"step": 495
},
{
"entropy": 6.817767333984375,
"epoch": 0.0053732818931146765,
"grad_norm": 1.25,
"learning_rate": 0.0002495,
"loss": 6.5869,
"mean_token_accuracy": 0.12479080557823181,
"num_tokens": 1156209.0,
"step": 500
},
{
"entropy": 6.783105134963989,
"epoch": 0.005427014712045823,
"grad_norm": 1.3125,
"learning_rate": 0.000252,
"loss": 6.6071,
"mean_token_accuracy": 0.1158917598426342,
"num_tokens": 1168746.0,
"step": 505
},
{
"entropy": 6.877445030212402,
"epoch": 0.00548074753097697,
"grad_norm": 1.4140625,
"learning_rate": 0.0002545,
"loss": 6.5415,
"mean_token_accuracy": 0.11388759389519691,
"num_tokens": 1179953.0,
"step": 510
},
{
"entropy": 6.709407901763916,
"epoch": 0.005534480349908117,
"grad_norm": 1.21875,
"learning_rate": 0.000257,
"loss": 6.617,
"mean_token_accuracy": 0.12177695706486702,
"num_tokens": 1190376.0,
"step": 515
},
{
"entropy": 6.774854850769043,
"epoch": 0.005588213168839264,
"grad_norm": 1.109375,
"learning_rate": 0.0002595,
"loss": 6.5396,
"mean_token_accuracy": 0.11766837164759636,
"num_tokens": 1203342.0,
"step": 520
},
{
"entropy": 6.747042798995972,
"epoch": 0.00564194598777041,
"grad_norm": 1.1015625,
"learning_rate": 0.000262,
"loss": 6.4918,
"mean_token_accuracy": 0.12500829100608826,
"num_tokens": 1214788.0,
"step": 525
},
{
"entropy": 6.805994987487793,
"epoch": 0.005695678806701557,
"grad_norm": 1.421875,
"learning_rate": 0.00026450000000000003,
"loss": 6.5081,
"mean_token_accuracy": 0.1282237909734249,
"num_tokens": 1225573.0,
"step": 530
},
{
"entropy": 6.804644536972046,
"epoch": 0.005749411625632704,
"grad_norm": 1.2265625,
"learning_rate": 0.00026700000000000004,
"loss": 6.5936,
"mean_token_accuracy": 0.11719024851918221,
"num_tokens": 1236657.0,
"step": 535
},
{
"entropy": 6.639275121688843,
"epoch": 0.005803144444563851,
"grad_norm": 1.21875,
"learning_rate": 0.00026950000000000005,
"loss": 6.4455,
"mean_token_accuracy": 0.11846009120345116,
"num_tokens": 1248011.0,
"step": 540
},
{
"entropy": 6.6572366714477536,
"epoch": 0.0058568772634949974,
"grad_norm": 1.2421875,
"learning_rate": 0.00027200000000000005,
"loss": 6.3932,
"mean_token_accuracy": 0.13050461709499359,
"num_tokens": 1258617.0,
"step": 545
},
{
"entropy": 6.6567902088165285,
"epoch": 0.005910610082426144,
"grad_norm": 1.2109375,
"learning_rate": 0.0002745,
"loss": 6.4417,
"mean_token_accuracy": 0.12405583187937737,
"num_tokens": 1269719.0,
"step": 550
},
{
"entropy": 6.666623926162719,
"epoch": 0.005964342901357291,
"grad_norm": 0.9296875,
"learning_rate": 0.000277,
"loss": 6.4288,
"mean_token_accuracy": 0.13184549435973167,
"num_tokens": 1282345.0,
"step": 555
},
{
"entropy": 6.707080411911011,
"epoch": 0.006018075720288438,
"grad_norm": 1.21875,
"learning_rate": 0.0002795,
"loss": 6.5392,
"mean_token_accuracy": 0.12187965363264083,
"num_tokens": 1294488.0,
"step": 560
},
{
"entropy": 6.804266262054443,
"epoch": 0.0060718085392195845,
"grad_norm": 1.2421875,
"learning_rate": 0.00028199999999999997,
"loss": 6.5314,
"mean_token_accuracy": 0.1263057641685009,
"num_tokens": 1305263.0,
"step": 565
},
{
"entropy": 6.658360242843628,
"epoch": 0.006125541358150731,
"grad_norm": 1.171875,
"learning_rate": 0.0002845,
"loss": 6.6029,
"mean_token_accuracy": 0.1247408226132393,
"num_tokens": 1316859.0,
"step": 570
},
{
"entropy": 6.709363222122192,
"epoch": 0.006179274177081878,
"grad_norm": 1.265625,
"learning_rate": 0.000287,
"loss": 6.5673,
"mean_token_accuracy": 0.12827861905097962,
"num_tokens": 1327435.0,
"step": 575
},
{
"entropy": 6.7831621170043945,
"epoch": 0.006233006996013025,
"grad_norm": 1.109375,
"learning_rate": 0.0002895,
"loss": 6.5586,
"mean_token_accuracy": 0.12109960541129113,
"num_tokens": 1338911.0,
"step": 580
},
{
"entropy": 6.719960689544678,
"epoch": 0.0062867398149441716,
"grad_norm": 1.1875,
"learning_rate": 0.000292,
"loss": 6.5855,
"mean_token_accuracy": 0.11691064387559891,
"num_tokens": 1350469.0,
"step": 585
},
{
"entropy": 6.635077476501465,
"epoch": 0.006340472633875318,
"grad_norm": 1.2578125,
"learning_rate": 0.0002945,
"loss": 6.4145,
"mean_token_accuracy": 0.1246449775993824,
"num_tokens": 1361563.0,
"step": 590
},
{
"entropy": 6.695048713684082,
"epoch": 0.006394205452806465,
"grad_norm": 1.15625,
"learning_rate": 0.000297,
"loss": 6.4567,
"mean_token_accuracy": 0.13043742775917053,
"num_tokens": 1371164.0,
"step": 595
},
{
"entropy": 6.710860776901245,
"epoch": 0.006447938271737612,
"grad_norm": 1.203125,
"learning_rate": 0.0002995,
"loss": 6.6258,
"mean_token_accuracy": 0.12364646792411804,
"num_tokens": 1383812.0,
"step": 600
},
{
"entropy": 6.557053899765014,
"epoch": 0.006501671090668759,
"grad_norm": 1.1796875,
"learning_rate": 0.000302,
"loss": 6.4506,
"mean_token_accuracy": 0.1240703359246254,
"num_tokens": 1395949.0,
"step": 605
},
{
"entropy": 6.697274923324585,
"epoch": 0.006555403909599905,
"grad_norm": 1.1796875,
"learning_rate": 0.0003045,
"loss": 6.5407,
"mean_token_accuracy": 0.12706615030765533,
"num_tokens": 1407555.0,
"step": 610
},
{
"entropy": 6.680358648300171,
"epoch": 0.006609136728531052,
"grad_norm": 1.0859375,
"learning_rate": 0.000307,
"loss": 6.479,
"mean_token_accuracy": 0.12326432690024376,
"num_tokens": 1419366.0,
"step": 615
},
{
"entropy": 6.542993068695068,
"epoch": 0.006662869547462199,
"grad_norm": 1.15625,
"learning_rate": 0.0003095,
"loss": 6.4081,
"mean_token_accuracy": 0.1296963684260845,
"num_tokens": 1431029.0,
"step": 620
},
{
"entropy": 6.630553913116455,
"epoch": 0.006716602366393346,
"grad_norm": 1.234375,
"learning_rate": 0.000312,
"loss": 6.4554,
"mean_token_accuracy": 0.12751922383904457,
"num_tokens": 1443373.0,
"step": 625
},
{
"entropy": 6.652616214752197,
"epoch": 0.0067703351853244925,
"grad_norm": 1.1015625,
"learning_rate": 0.0003145,
"loss": 6.4876,
"mean_token_accuracy": 0.11779244169592858,
"num_tokens": 1455825.0,
"step": 630
},
{
"entropy": 6.5543968200683596,
"epoch": 0.006824068004255639,
"grad_norm": 1.171875,
"learning_rate": 0.000317,
"loss": 6.4883,
"mean_token_accuracy": 0.12101165652275085,
"num_tokens": 1468565.0,
"step": 635
},
{
"entropy": 6.7368861675262455,
"epoch": 0.006877800823186786,
"grad_norm": 1.2109375,
"learning_rate": 0.0003195,
"loss": 6.532,
"mean_token_accuracy": 0.11934061422944069,
"num_tokens": 1480349.0,
"step": 640
},
{
"entropy": 6.685069799423218,
"epoch": 0.006931533642117933,
"grad_norm": 0.98828125,
"learning_rate": 0.000322,
"loss": 6.5136,
"mean_token_accuracy": 0.12378246709704399,
"num_tokens": 1492546.0,
"step": 645
},
{
"entropy": 6.648138904571534,
"epoch": 0.0069852664610490795,
"grad_norm": 1.265625,
"learning_rate": 0.00032450000000000003,
"loss": 6.4985,
"mean_token_accuracy": 0.12411848902702331,
"num_tokens": 1505470.0,
"step": 650
},
{
"entropy": 6.578639078140259,
"epoch": 0.007038999279980226,
"grad_norm": 1.109375,
"learning_rate": 0.00032700000000000003,
"loss": 6.4716,
"mean_token_accuracy": 0.1275963857769966,
"num_tokens": 1517651.0,
"step": 655
},
{
"entropy": 6.597443866729736,
"epoch": 0.007092732098911373,
"grad_norm": 1.203125,
"learning_rate": 0.00032950000000000004,
"loss": 6.4648,
"mean_token_accuracy": 0.1221590779721737,
"num_tokens": 1528344.0,
"step": 660
},
{
"entropy": 6.656521511077881,
"epoch": 0.00714646491784252,
"grad_norm": 1.15625,
"learning_rate": 0.00033200000000000005,
"loss": 6.5515,
"mean_token_accuracy": 0.12132448479533195,
"num_tokens": 1540901.0,
"step": 665
},
{
"entropy": 6.798276329040528,
"epoch": 0.007200197736773667,
"grad_norm": 1.03125,
"learning_rate": 0.00033450000000000005,
"loss": 6.7276,
"mean_token_accuracy": 0.11917936131358146,
"num_tokens": 1553948.0,
"step": 670
},
{
"entropy": 6.652810382843017,
"epoch": 0.007253930555704813,
"grad_norm": 1.1328125,
"learning_rate": 0.000337,
"loss": 6.4356,
"mean_token_accuracy": 0.1323891557753086,
"num_tokens": 1564939.0,
"step": 675
},
{
"entropy": 6.4081744194030765,
"epoch": 0.00730766337463596,
"grad_norm": 1.0546875,
"learning_rate": 0.0003395,
"loss": 6.2896,
"mean_token_accuracy": 0.13150809779763223,
"num_tokens": 1575701.0,
"step": 680
},
{
"entropy": 6.666033411026001,
"epoch": 0.007361396193567107,
"grad_norm": 1.0859375,
"learning_rate": 0.000342,
"loss": 6.505,
"mean_token_accuracy": 0.12376334965229034,
"num_tokens": 1588302.0,
"step": 685
},
{
"entropy": 6.663384532928466,
"epoch": 0.007415129012498254,
"grad_norm": 0.94140625,
"learning_rate": 0.00034449999999999997,
"loss": 6.5337,
"mean_token_accuracy": 0.12307745441794396,
"num_tokens": 1600687.0,
"step": 690
},
{
"entropy": 6.546121740341187,
"epoch": 0.0074688618314294,
"grad_norm": 1.1875,
"learning_rate": 0.000347,
"loss": 6.3835,
"mean_token_accuracy": 0.12949468046426774,
"num_tokens": 1612911.0,
"step": 695
},
{
"entropy": 6.483590793609619,
"epoch": 0.007522594650360547,
"grad_norm": 1.1484375,
"learning_rate": 0.0003495,
"loss": 6.3987,
"mean_token_accuracy": 0.1250015176832676,
"num_tokens": 1625407.0,
"step": 700
},
{
"entropy": 6.515925741195678,
"epoch": 0.007576327469291694,
"grad_norm": 1.125,
"learning_rate": 0.000352,
"loss": 6.4381,
"mean_token_accuracy": 0.1255468212068081,
"num_tokens": 1636438.0,
"step": 705
},
{
"entropy": 6.521837043762207,
"epoch": 0.007630060288222841,
"grad_norm": 1.140625,
"learning_rate": 0.0003545,
"loss": 6.3278,
"mean_token_accuracy": 0.13161946684122086,
"num_tokens": 1646852.0,
"step": 710
},
{
"entropy": 6.5727705478668215,
"epoch": 0.0076837931071539875,
"grad_norm": 1.0390625,
"learning_rate": 0.000357,
"loss": 6.4295,
"mean_token_accuracy": 0.122813381254673,
"num_tokens": 1657497.0,
"step": 715
},
{
"entropy": 6.496736717224121,
"epoch": 0.007737525926085134,
"grad_norm": 1.1953125,
"learning_rate": 0.0003595,
"loss": 6.3579,
"mean_token_accuracy": 0.133344866335392,
"num_tokens": 1668576.0,
"step": 720
},
{
"entropy": 6.37104172706604,
"epoch": 0.007791258745016281,
"grad_norm": 1.328125,
"learning_rate": 0.000362,
"loss": 6.2756,
"mean_token_accuracy": 0.13716673478484154,
"num_tokens": 1678897.0,
"step": 725
},
{
"entropy": 6.4941541194915775,
"epoch": 0.007844991563947428,
"grad_norm": 1.1015625,
"learning_rate": 0.0003645,
"loss": 6.4019,
"mean_token_accuracy": 0.12680666893720627,
"num_tokens": 1690334.0,
"step": 730
},
{
"entropy": 6.580505418777466,
"epoch": 0.007898724382878575,
"grad_norm": 1.1640625,
"learning_rate": 0.000367,
"loss": 6.3362,
"mean_token_accuracy": 0.13649081885814668,
"num_tokens": 1701173.0,
"step": 735
},
{
"entropy": 6.443411922454834,
"epoch": 0.007952457201809721,
"grad_norm": 1.140625,
"learning_rate": 0.0003695,
"loss": 6.378,
"mean_token_accuracy": 0.13125211074948312,
"num_tokens": 1713081.0,
"step": 740
},
{
"entropy": 6.535996913909912,
"epoch": 0.008006190020740869,
"grad_norm": 1.265625,
"learning_rate": 0.000372,
"loss": 6.4182,
"mean_token_accuracy": 0.12619447186589242,
"num_tokens": 1725061.0,
"step": 745
},
{
"entropy": 6.4850883960723875,
"epoch": 0.008059922839672015,
"grad_norm": 1.1484375,
"learning_rate": 0.0003745,
"loss": 6.396,
"mean_token_accuracy": 0.12616196647286415,
"num_tokens": 1735374.0,
"step": 750
},
{
"entropy": 6.572152376174927,
"epoch": 0.008113655658603162,
"grad_norm": 1.1484375,
"learning_rate": 0.000377,
"loss": 6.4018,
"mean_token_accuracy": 0.13052576184272766,
"num_tokens": 1747100.0,
"step": 755
},
{
"entropy": 6.337621402740479,
"epoch": 0.008167388477534308,
"grad_norm": 1.1171875,
"learning_rate": 0.0003795,
"loss": 6.2472,
"mean_token_accuracy": 0.13288816586136817,
"num_tokens": 1758577.0,
"step": 760
},
{
"entropy": 6.557423830032349,
"epoch": 0.008221121296465456,
"grad_norm": 0.921875,
"learning_rate": 0.000382,
"loss": 6.5367,
"mean_token_accuracy": 0.12673259526491165,
"num_tokens": 1771127.0,
"step": 765
},
{
"entropy": 6.495845079421997,
"epoch": 0.008274854115396602,
"grad_norm": 1.1640625,
"learning_rate": 0.0003845,
"loss": 6.3796,
"mean_token_accuracy": 0.1309738650918007,
"num_tokens": 1782061.0,
"step": 770
},
{
"entropy": 6.395338773727417,
"epoch": 0.00832858693432775,
"grad_norm": 1.1953125,
"learning_rate": 0.00038700000000000003,
"loss": 6.3638,
"mean_token_accuracy": 0.13038457557559013,
"num_tokens": 1794632.0,
"step": 775
},
{
"entropy": 6.519541597366333,
"epoch": 0.008382319753258895,
"grad_norm": 1.203125,
"learning_rate": 0.00038950000000000003,
"loss": 6.3885,
"mean_token_accuracy": 0.13315627053380014,
"num_tokens": 1805414.0,
"step": 780
},
{
"entropy": 6.398904037475586,
"epoch": 0.008436052572190043,
"grad_norm": 1.0703125,
"learning_rate": 0.00039200000000000004,
"loss": 6.2914,
"mean_token_accuracy": 0.13453604951500892,
"num_tokens": 1816781.0,
"step": 785
},
{
"entropy": 6.494039821624756,
"epoch": 0.008489785391121189,
"grad_norm": 0.98046875,
"learning_rate": 0.00039450000000000005,
"loss": 6.4496,
"mean_token_accuracy": 0.12688224837183953,
"num_tokens": 1828791.0,
"step": 790
},
{
"entropy": 6.386651563644409,
"epoch": 0.008543518210052337,
"grad_norm": 1.21875,
"learning_rate": 0.00039700000000000005,
"loss": 6.3269,
"mean_token_accuracy": 0.13748010098934174,
"num_tokens": 1840092.0,
"step": 795
},
{
"entropy": 6.476310205459595,
"epoch": 0.008597251028983482,
"grad_norm": 1.0,
"learning_rate": 0.0003995,
"loss": 6.334,
"mean_token_accuracy": 0.13396526053547858,
"num_tokens": 1851569.0,
"step": 800
},
{
"entropy": 6.375878381729126,
"epoch": 0.00865098384791463,
"grad_norm": 1.109375,
"learning_rate": 0.000402,
"loss": 6.2508,
"mean_token_accuracy": 0.13404305949807166,
"num_tokens": 1861939.0,
"step": 805
},
{
"entropy": 6.49393253326416,
"epoch": 0.008704716666845776,
"grad_norm": 1.2109375,
"learning_rate": 0.0004045,
"loss": 6.4467,
"mean_token_accuracy": 0.12742400392889977,
"num_tokens": 1873545.0,
"step": 810
},
{
"entropy": 6.360756969451904,
"epoch": 0.008758449485776924,
"grad_norm": 0.9609375,
"learning_rate": 0.00040699999999999997,
"loss": 6.4065,
"mean_token_accuracy": 0.12780992686748505,
"num_tokens": 1885870.0,
"step": 815
},
{
"entropy": 6.523135995864868,
"epoch": 0.00881218230470807,
"grad_norm": 1.1171875,
"learning_rate": 0.0004095,
"loss": 6.472,
"mean_token_accuracy": 0.12656911313533784,
"num_tokens": 1898118.0,
"step": 820
},
{
"entropy": 6.408415365219116,
"epoch": 0.008865915123639217,
"grad_norm": 1.078125,
"learning_rate": 0.000412,
"loss": 6.2098,
"mean_token_accuracy": 0.13449918180704118,
"num_tokens": 1907638.0,
"step": 825
},
{
"entropy": 6.37138261795044,
"epoch": 0.008919647942570363,
"grad_norm": 1.0234375,
"learning_rate": 0.0004145,
"loss": 6.3885,
"mean_token_accuracy": 0.12769241705536843,
"num_tokens": 1919814.0,
"step": 830
},
{
"entropy": 6.42969536781311,
"epoch": 0.00897338076150151,
"grad_norm": 1.0390625,
"learning_rate": 0.000417,
"loss": 6.305,
"mean_token_accuracy": 0.12873108088970184,
"num_tokens": 1930090.0,
"step": 835
},
{
"entropy": 6.503070831298828,
"epoch": 0.009027113580432657,
"grad_norm": 1.0546875,
"learning_rate": 0.0004195,
"loss": 6.4575,
"mean_token_accuracy": 0.12877310812473297,
"num_tokens": 1941916.0,
"step": 840
},
{
"entropy": 6.373751020431518,
"epoch": 0.009080846399363804,
"grad_norm": 1.25,
"learning_rate": 0.000422,
"loss": 6.3835,
"mean_token_accuracy": 0.13241996690630914,
"num_tokens": 1953356.0,
"step": 845
},
{
"entropy": 6.532479238510132,
"epoch": 0.00913457921829495,
"grad_norm": 1.0859375,
"learning_rate": 0.0004245,
"loss": 6.4746,
"mean_token_accuracy": 0.1252823568880558,
"num_tokens": 1964043.0,
"step": 850
},
{
"entropy": 6.503678846359253,
"epoch": 0.009188312037226098,
"grad_norm": 1.1328125,
"learning_rate": 0.000427,
"loss": 6.4102,
"mean_token_accuracy": 0.13039419800043106,
"num_tokens": 1975971.0,
"step": 855
},
{
"entropy": 6.328308725357056,
"epoch": 0.009242044856157244,
"grad_norm": 0.98828125,
"learning_rate": 0.0004295,
"loss": 6.4012,
"mean_token_accuracy": 0.13699360191822052,
"num_tokens": 1987882.0,
"step": 860
},
{
"entropy": 6.5440106868743895,
"epoch": 0.009295777675088391,
"grad_norm": 1.125,
"learning_rate": 0.000432,
"loss": 6.4144,
"mean_token_accuracy": 0.13187188804149627,
"num_tokens": 1999586.0,
"step": 865
},
{
"entropy": 6.467750215530396,
"epoch": 0.009349510494019537,
"grad_norm": 1.0625,
"learning_rate": 0.0004345,
"loss": 6.4583,
"mean_token_accuracy": 0.13001283928751944,
"num_tokens": 2011867.0,
"step": 870
},
{
"entropy": 6.408541107177735,
"epoch": 0.009403243312950685,
"grad_norm": 1.078125,
"learning_rate": 0.000437,
"loss": 6.3552,
"mean_token_accuracy": 0.13619493544101716,
"num_tokens": 2023372.0,
"step": 875
},
{
"entropy": 6.344149351119995,
"epoch": 0.00945697613188183,
"grad_norm": 1.140625,
"learning_rate": 0.0004395,
"loss": 6.3217,
"mean_token_accuracy": 0.1275565542280674,
"num_tokens": 2035896.0,
"step": 880
},
{
"entropy": 6.362127685546875,
"epoch": 0.009510708950812978,
"grad_norm": 1.140625,
"learning_rate": 0.000442,
"loss": 6.2448,
"mean_token_accuracy": 0.13719155937433242,
"num_tokens": 2046912.0,
"step": 885
},
{
"entropy": 6.278013896942139,
"epoch": 0.009564441769744124,
"grad_norm": 1.15625,
"learning_rate": 0.0004445,
"loss": 6.2975,
"mean_token_accuracy": 0.13730109632015228,
"num_tokens": 2058322.0,
"step": 890
},
{
"entropy": 6.478695487976074,
"epoch": 0.009618174588675272,
"grad_norm": 1.0625,
"learning_rate": 0.000447,
"loss": 6.3322,
"mean_token_accuracy": 0.13603856638073922,
"num_tokens": 2069755.0,
"step": 895
},
{
"entropy": 6.3329634189605715,
"epoch": 0.009671907407606418,
"grad_norm": 1.2734375,
"learning_rate": 0.00044950000000000003,
"loss": 6.347,
"mean_token_accuracy": 0.131291563808918,
"num_tokens": 2080453.0,
"step": 900
},
{
"entropy": 6.4724616527557375,
"epoch": 0.009725640226537565,
"grad_norm": 1.0625,
"learning_rate": 0.00045200000000000004,
"loss": 6.4294,
"mean_token_accuracy": 0.13204899728298186,
"num_tokens": 2090847.0,
"step": 905
},
{
"entropy": 6.4222029685974125,
"epoch": 0.009779373045468711,
"grad_norm": 1.2109375,
"learning_rate": 0.00045450000000000004,
"loss": 6.4368,
"mean_token_accuracy": 0.137455066293478,
"num_tokens": 2104254.0,
"step": 910
},
{
"entropy": 6.344487428665161,
"epoch": 0.009833105864399859,
"grad_norm": 1.0234375,
"learning_rate": 0.00045700000000000005,
"loss": 6.3289,
"mean_token_accuracy": 0.1320524349808693,
"num_tokens": 2115392.0,
"step": 915
},
{
"entropy": 6.50238618850708,
"epoch": 0.009886838683331005,
"grad_norm": 0.8984375,
"learning_rate": 0.00045950000000000006,
"loss": 6.5063,
"mean_token_accuracy": 0.12493504136800766,
"num_tokens": 2128388.0,
"step": 920
},
{
"entropy": 6.358483028411865,
"epoch": 0.009940571502262152,
"grad_norm": 1.140625,
"learning_rate": 0.000462,
"loss": 6.2882,
"mean_token_accuracy": 0.13589850142598153,
"num_tokens": 2139023.0,
"step": 925
},
{
"entropy": 6.373326253890991,
"epoch": 0.009994304321193298,
"grad_norm": 1.0390625,
"learning_rate": 0.0004645,
"loss": 6.2663,
"mean_token_accuracy": 0.13531995043158532,
"num_tokens": 2150693.0,
"step": 930
},
{
"entropy": 6.279564762115479,
"epoch": 0.010048037140124446,
"grad_norm": 0.9609375,
"learning_rate": 0.000467,
"loss": 6.2776,
"mean_token_accuracy": 0.13068829327821732,
"num_tokens": 2163192.0,
"step": 935
},
{
"entropy": 6.234259986877442,
"epoch": 0.010101769959055592,
"grad_norm": 1.15625,
"learning_rate": 0.0004695,
"loss": 6.1662,
"mean_token_accuracy": 0.14027160853147508,
"num_tokens": 2173700.0,
"step": 940
},
{
"entropy": 6.339089107513428,
"epoch": 0.01015550277798674,
"grad_norm": 1.0078125,
"learning_rate": 0.000472,
"loss": 6.3379,
"mean_token_accuracy": 0.1347230739891529,
"num_tokens": 2185500.0,
"step": 945
},
{
"entropy": 6.227807855606079,
"epoch": 0.010209235596917885,
"grad_norm": 1.03125,
"learning_rate": 0.0004745,
"loss": 6.2689,
"mean_token_accuracy": 0.1386742152273655,
"num_tokens": 2197363.0,
"step": 950
},
{
"entropy": 6.333368492126465,
"epoch": 0.010262968415849033,
"grad_norm": 0.95703125,
"learning_rate": 0.000477,
"loss": 6.3467,
"mean_token_accuracy": 0.13571017980575562,
"num_tokens": 2209173.0,
"step": 955
},
{
"entropy": 6.408475399017334,
"epoch": 0.010316701234780179,
"grad_norm": 1.078125,
"learning_rate": 0.0004795,
"loss": 6.3941,
"mean_token_accuracy": 0.1270724914968014,
"num_tokens": 2220469.0,
"step": 960
},
{
"entropy": 6.429714393615723,
"epoch": 0.010370434053711327,
"grad_norm": 1.0625,
"learning_rate": 0.000482,
"loss": 6.389,
"mean_token_accuracy": 0.13281712904572487,
"num_tokens": 2232426.0,
"step": 965
},
{
"entropy": 6.21214656829834,
"epoch": 0.010424166872642473,
"grad_norm": 1.0703125,
"learning_rate": 0.0004845,
"loss": 6.3173,
"mean_token_accuracy": 0.13897231221199036,
"num_tokens": 2243763.0,
"step": 970
},
{
"entropy": 6.33380913734436,
"epoch": 0.01047789969157362,
"grad_norm": 0.94140625,
"learning_rate": 0.000487,
"loss": 6.2468,
"mean_token_accuracy": 0.1297723114490509,
"num_tokens": 2255987.0,
"step": 975
},
{
"entropy": 6.272552013397217,
"epoch": 0.010531632510504766,
"grad_norm": 1.09375,
"learning_rate": 0.0004895,
"loss": 6.1886,
"mean_token_accuracy": 0.13993587493896484,
"num_tokens": 2266701.0,
"step": 980
},
{
"entropy": 6.254857301712036,
"epoch": 0.010585365329435914,
"grad_norm": 1.1015625,
"learning_rate": 0.000492,
"loss": 6.2448,
"mean_token_accuracy": 0.13452961146831513,
"num_tokens": 2278162.0,
"step": 985
},
{
"entropy": 6.207320690155029,
"epoch": 0.01063909814836706,
"grad_norm": 1.125,
"learning_rate": 0.0004945,
"loss": 6.2815,
"mean_token_accuracy": 0.13594236746430396,
"num_tokens": 2289478.0,
"step": 990
},
{
"entropy": 6.288606119155884,
"epoch": 0.010692830967298207,
"grad_norm": 1.0390625,
"learning_rate": 0.000497,
"loss": 6.3368,
"mean_token_accuracy": 0.13813528120517732,
"num_tokens": 2301283.0,
"step": 995
},
{
"entropy": 6.375607204437256,
"epoch": 0.010746563786229353,
"grad_norm": 1.21875,
"learning_rate": 0.0004995,
"loss": 6.2796,
"mean_token_accuracy": 0.13963441848754882,
"num_tokens": 2312620.0,
"step": 1000
}
],
"logging_steps": 5,
"max_steps": 4000,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 3673145401344000.0,
"train_batch_size": 16,
"trial_name": null,
"trial_params": null
}