Files
OLMo-0H-7D-50F-distractor/trainer_state.json

1667 lines
41 KiB
JSON
Raw Permalink Normal View History

{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 28.571428571428573,
"eval_steps": 500,
"global_step": 2000,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.14285714285714285,
"grad_norm": 10.9375,
"learning_rate": 1.8e-05,
"loss": 2.708388328552246,
"loss_d0": 4.110811305046082,
"step": 10
},
{
"epoch": 0.2857142857142857,
"grad_norm": 6.375,
"learning_rate": 3.8e-05,
"loss": 1.2063720703125,
"loss_d0": 1.8877601504325867,
"step": 20
},
{
"epoch": 0.42857142857142855,
"grad_norm": 4.375,
"learning_rate": 5.8e-05,
"loss": 0.8983614921569825,
"loss_d0": 1.4538785099983216,
"step": 30
},
{
"epoch": 0.5714285714285714,
"grad_norm": 4.5,
"learning_rate": 7.800000000000001e-05,
"loss": 0.8970762252807617,
"loss_d0": 1.425518774986267,
"step": 40
},
{
"epoch": 0.7142857142857143,
"grad_norm": 4.4375,
"learning_rate": 9.8e-05,
"loss": 0.7297840118408203,
"loss_d0": 1.340456622838974,
"step": 50
},
{
"epoch": 0.8571428571428571,
"grad_norm": 3.390625,
"learning_rate": 0.000118,
"loss": 0.6489387512207031,
"loss_d0": 1.0164853096008302,
"step": 60
},
{
"epoch": 1.0,
"grad_norm": 3.84375,
"learning_rate": 0.000138,
"loss": 0.6557669162750244,
"loss_d0": 0.9850718915462494,
"step": 70
},
{
"epoch": 1.1428571428571428,
"grad_norm": 3.640625,
"learning_rate": 0.00015800000000000002,
"loss": 0.5417943000793457,
"loss_d0": 0.7510321617126465,
"step": 80
},
{
"epoch": 1.2857142857142856,
"grad_norm": 3.171875,
"learning_rate": 0.00017800000000000002,
"loss": 0.5557333469390869,
"loss_d0": 0.726891279220581,
"step": 90
},
{
"epoch": 1.4285714285714286,
"grad_norm": 3.1875,
"learning_rate": 0.00019800000000000002,
"loss": 0.5609831809997559,
"loss_d0": 0.7925398766994476,
"step": 100
},
{
"epoch": 1.5714285714285714,
"grad_norm": 4.625,
"learning_rate": 0.0002,
"loss": 0.49335689544677735,
"loss_d0": 0.7104986011981964,
"step": 110
},
{
"epoch": 1.7142857142857144,
"grad_norm": 2.921875,
"learning_rate": 0.0002,
"loss": 0.468343448638916,
"loss_d0": 0.6982269883155823,
"step": 120
},
{
"epoch": 1.8571428571428572,
"grad_norm": 2.46875,
"learning_rate": 0.0002,
"loss": 0.45113506317138674,
"loss_d0": 0.6743539869785309,
"step": 130
},
{
"epoch": 2.0,
"grad_norm": 2.609375,
"learning_rate": 0.0002,
"loss": 0.4742081642150879,
"loss_d0": 0.7392071902751922,
"step": 140
},
{
"epoch": 2.142857142857143,
"grad_norm": 2.640625,
"learning_rate": 0.0002,
"loss": 0.4260121822357178,
"loss_d0": 0.6589436203241348,
"step": 150
},
{
"epoch": 2.2857142857142856,
"grad_norm": 1.953125,
"learning_rate": 0.0002,
"loss": 0.39026267528533937,
"loss_d0": 0.6157096266746521,
"step": 160
},
{
"epoch": 2.4285714285714284,
"grad_norm": 2.09375,
"learning_rate": 0.0002,
"loss": 0.40253314971923826,
"loss_d0": 0.6893241822719574,
"step": 170
},
{
"epoch": 2.571428571428571,
"grad_norm": 2.203125,
"learning_rate": 0.0002,
"loss": 0.3850980758666992,
"loss_d0": 0.623932832479477,
"step": 180
},
{
"epoch": 2.7142857142857144,
"grad_norm": 1.875,
"learning_rate": 0.0002,
"loss": 0.3460643768310547,
"loss_d0": 0.6405902057886124,
"step": 190
},
{
"epoch": 2.857142857142857,
"grad_norm": 1.453125,
"learning_rate": 0.0002,
"loss": 0.3911351203918457,
"loss_d0": 0.6420928090810776,
"step": 200
},
{
"epoch": 3.0,
"grad_norm": 1.3984375,
"learning_rate": 0.0002,
"loss": 0.3302267074584961,
"loss_d0": 0.5826890021562576,
"step": 210
},
{
"epoch": 3.142857142857143,
"grad_norm": 2.421875,
"learning_rate": 0.0002,
"loss": 0.3666944980621338,
"loss_d0": 0.6297772079706192,
"step": 220
},
{
"epoch": 3.2857142857142856,
"grad_norm": 1.40625,
"learning_rate": 0.0002,
"loss": 0.3350435495376587,
"loss_d0": 0.5840106904506683,
"step": 230
},
{
"epoch": 3.4285714285714284,
"grad_norm": 1.0390625,
"learning_rate": 0.0002,
"loss": 0.31048002243041994,
"loss_d0": 0.5492438584566116,
"step": 240
},
{
"epoch": 3.571428571428571,
"grad_norm": 2.234375,
"learning_rate": 0.0002,
"loss": 0.3417187690734863,
"loss_d0": 0.6671169877052308,
"step": 250
},
{
"epoch": 3.7142857142857144,
"grad_norm": 1.7578125,
"learning_rate": 0.0002,
"loss": 0.31016125679016116,
"loss_d0": 0.5638339132070541,
"step": 260
},
{
"epoch": 3.857142857142857,
"grad_norm": 1.7421875,
"learning_rate": 0.0002,
"loss": 0.3462181806564331,
"loss_d0": 0.6273518323898315,
"step": 270
},
{
"epoch": 4.0,
"grad_norm": 1.8828125,
"learning_rate": 0.0002,
"loss": 0.37842116355895994,
"loss_d0": 0.6331767499446869,
"step": 280
},
{
"epoch": 4.142857142857143,
"grad_norm": 1.3515625,
"learning_rate": 0.0002,
"loss": 0.2758188247680664,
"loss_d0": 0.5233808279037475,
"step": 290
},
{
"epoch": 4.285714285714286,
"grad_norm": 1.59375,
"learning_rate": 0.0002,
"loss": 0.2679539680480957,
"loss_d0": 0.512147718667984,
"step": 300
},
{
"epoch": 4.428571428571429,
"grad_norm": 1.53125,
"learning_rate": 0.0002,
"loss": 0.2771256446838379,
"loss_d0": 0.5529826283454895,
"step": 310
},
{
"epoch": 4.571428571428571,
"grad_norm": 1.21875,
"learning_rate": 0.0002,
"loss": 0.2626373767852783,
"loss_d0": 0.4893135607242584,
"step": 320
},
{
"epoch": 4.714285714285714,
"grad_norm": 1.5625,
"learning_rate": 0.0002,
"loss": 0.29569981098175047,
"loss_d0": 0.5720477998256683,
"step": 330
},
{
"epoch": 4.857142857142857,
"grad_norm": 1.1640625,
"learning_rate": 0.0002,
"loss": 0.2952061653137207,
"loss_d0": 0.5526792675256729,
"step": 340
},
{
"epoch": 5.0,
"grad_norm": 1.78125,
"learning_rate": 0.0002,
"loss": 0.3209908723831177,
"loss_d0": 0.6238142669200897,
"step": 350
},
{
"epoch": 5.142857142857143,
"grad_norm": 1.5390625,
"learning_rate": 0.0002,
"loss": 0.2546632528305054,
"loss_d0": 0.497738191485405,
"step": 360
},
{
"epoch": 5.285714285714286,
"grad_norm": 1.0234375,
"learning_rate": 0.0002,
"loss": 0.2360783815383911,
"loss_d0": 0.43793114721775056,
"step": 370
},
{
"epoch": 5.428571428571429,
"grad_norm": 1.109375,
"learning_rate": 0.0002,
"loss": 0.23914880752563478,
"loss_d0": 0.46601290702819825,
"step": 380
},
{
"epoch": 5.571428571428571,
"grad_norm": 1.1484375,
"learning_rate": 0.0002,
"loss": 0.24625580310821532,
"loss_d0": 0.5180164843797683,
"step": 390
},
{
"epoch": 5.714285714285714,
"grad_norm": 1.515625,
"learning_rate": 0.0002,
"loss": 0.30511114597320554,
"loss_d0": 0.570301228761673,
"step": 400
},
{
"epoch": 5.857142857142857,
"grad_norm": 1.1015625,
"learning_rate": 0.0002,
"loss": 0.26278665065765383,
"loss_d0": 0.5415922611951828,
"step": 410
},
{
"epoch": 6.0,
"grad_norm": 1.234375,
"learning_rate": 0.0002,
"loss": 0.2830559015274048,
"loss_d0": 0.5763564020395279,
"step": 420
},
{
"epoch": 6.142857142857143,
"grad_norm": 1.546875,
"learning_rate": 0.0002,
"loss": 0.23301992416381836,
"loss_d0": 0.47966580390930175,
"step": 430
},
{
"epoch": 6.285714285714286,
"grad_norm": 1.1875,
"learning_rate": 0.0002,
"loss": 0.2130380630493164,
"loss_d0": 0.4446234554052353,
"step": 440
},
{
"epoch": 6.428571428571429,
"grad_norm": 1.671875,
"learning_rate": 0.0002,
"loss": 0.2604910612106323,
"loss_d0": 0.5528126150369644,
"step": 450
},
{
"epoch": 6.571428571428571,
"grad_norm": 1.3984375,
"learning_rate": 0.0002,
"loss": 0.2402413845062256,
"loss_d0": 0.4986030846834183,
"step": 460
},
{
"epoch": 6.714285714285714,
"grad_norm": 1.9609375,
"learning_rate": 0.0002,
"loss": 0.24624488353729249,
"loss_d0": 0.5280796885490417,
"step": 470
},
{
"epoch": 6.857142857142857,
"grad_norm": 1.2890625,
"learning_rate": 0.0002,
"loss": 0.2268777847290039,
"loss_d0": 0.4914736434817314,
"step": 480
},
{
"epoch": 7.0,
"grad_norm": 1.21875,
"learning_rate": 0.0002,
"loss": 0.25430734157562257,
"loss_d0": 0.5139662355184555,
"step": 490
},
{
"epoch": 7.142857142857143,
"grad_norm": 1.359375,
"learning_rate": 0.0002,
"loss": 0.19951030015945434,
"loss_d0": 0.45199823677539824,
"step": 500
},
{
"epoch": 7.142857142857143,
"eval_loss": 8.546619415283203,
"eval_runtime": 0.3482,
"eval_samples_per_second": 718.039,
"eval_steps_per_second": 71.804,
"step": 500
},
{
"epoch": 7.285714285714286,
"grad_norm": 0.87890625,
"learning_rate": 0.0002,
"loss": 0.19481804370880126,
"loss_d0": 0.45815878808498384,
"step": 510
},
{
"epoch": 7.428571428571429,
"grad_norm": 1.3046875,
"learning_rate": 0.0002,
"loss": 0.2255556106567383,
"loss_d0": 0.5097730100154877,
"step": 520
},
{
"epoch": 7.571428571428571,
"grad_norm": 1.1953125,
"learning_rate": 0.0002,
"loss": 0.22788920402526855,
"loss_d0": 0.44859754145145414,
"step": 530
},
{
"epoch": 7.714285714285714,
"grad_norm": 1.4375,
"learning_rate": 0.0002,
"loss": 0.2295910358428955,
"loss_d0": 0.469280743598938,
"step": 540
},
{
"epoch": 7.857142857142857,
"grad_norm": 0.96484375,
"learning_rate": 0.0002,
"loss": 0.22432618141174315,
"loss_d0": 0.4931183695793152,
"step": 550
},
{
"epoch": 8.0,
"grad_norm": 3.34375,
"learning_rate": 0.0002,
"loss": 0.22481327056884765,
"loss_d0": 0.4790141642093658,
"step": 560
},
{
"epoch": 8.142857142857142,
"grad_norm": 1.078125,
"learning_rate": 0.0002,
"loss": 0.1898207187652588,
"loss_d0": 0.45880764722824097,
"step": 570
},
{
"epoch": 8.285714285714286,
"grad_norm": 1.1015625,
"learning_rate": 0.0002,
"loss": 0.16722708940505981,
"loss_d0": 0.39154875874519346,
"step": 580
},
{
"epoch": 8.428571428571429,
"grad_norm": 1.0703125,
"learning_rate": 0.0002,
"loss": 0.20029706954956056,
"loss_d0": 0.4694953829050064,
"step": 590
},
{
"epoch": 8.571428571428571,
"grad_norm": 1.1640625,
"learning_rate": 0.0002,
"loss": 0.1980130195617676,
"loss_d0": 0.429129758477211,
"step": 600
},
{
"epoch": 8.714285714285714,
"grad_norm": 1.171875,
"learning_rate": 0.0002,
"loss": 0.21289968490600586,
"loss_d0": 0.5128728121519088,
"step": 610
},
{
"epoch": 8.857142857142858,
"grad_norm": 1.1484375,
"learning_rate": 0.0002,
"loss": 0.20417430400848388,
"loss_d0": 0.4555791884660721,
"step": 620
},
{
"epoch": 9.0,
"grad_norm": 0.9921875,
"learning_rate": 0.0002,
"loss": 0.2080092191696167,
"loss_d0": 0.48112956881523133,
"step": 630
},
{
"epoch": 9.142857142857142,
"grad_norm": 1.125,
"learning_rate": 0.0002,
"loss": 0.17301057577133178,
"loss_d0": 0.3914658397436142,
"step": 640
},
{
"epoch": 9.285714285714286,
"grad_norm": 1.0078125,
"learning_rate": 0.0002,
"loss": 0.16326009035110473,
"loss_d0": 0.3957242280244827,
"step": 650
},
{
"epoch": 9.428571428571429,
"grad_norm": 1.03125,
"learning_rate": 0.0002,
"loss": 0.23928072452545165,
"loss_d0": 0.47887236177921294,
"step": 660
},
{
"epoch": 9.571428571428571,
"grad_norm": 1.125,
"learning_rate": 0.0002,
"loss": 0.21262478828430176,
"loss_d0": 0.49389356970787046,
"step": 670
},
{
"epoch": 9.714285714285714,
"grad_norm": 1.2421875,
"learning_rate": 0.0002,
"loss": 0.21038594245910644,
"loss_d0": 0.4909708023071289,
"step": 680
},
{
"epoch": 9.857142857142858,
"grad_norm": 0.84375,
"learning_rate": 0.0002,
"loss": 0.19068275690078734,
"loss_d0": 0.43951269090175626,
"step": 690
},
{
"epoch": 10.0,
"grad_norm": 1.2265625,
"learning_rate": 0.0002,
"loss": 0.20882303714752198,
"loss_d0": 0.4652249127626419,
"step": 700
},
{
"epoch": 10.142857142857142,
"grad_norm": 0.7578125,
"learning_rate": 0.0002,
"loss": 0.16138590574264527,
"loss_d0": 0.40691248178482053,
"step": 710
},
{
"epoch": 10.285714285714286,
"grad_norm": 0.98828125,
"learning_rate": 0.0002,
"loss": 0.1708214044570923,
"loss_d0": 0.44721868336200715,
"step": 720
},
{
"epoch": 10.428571428571429,
"grad_norm": 0.92578125,
"learning_rate": 0.0002,
"loss": 0.16305239200592042,
"loss_d0": 0.411194321513176,
"step": 730
},
{
"epoch": 10.571428571428571,
"grad_norm": 1.2421875,
"learning_rate": 0.0002,
"loss": 0.18613686561584472,
"loss_d0": 0.46029442846775054,
"step": 740
},
{
"epoch": 10.714285714285714,
"grad_norm": 1.3984375,
"learning_rate": 0.0002,
"loss": 0.17803105115890502,
"loss_d0": 0.4383477747440338,
"step": 750
},
{
"epoch": 10.857142857142858,
"grad_norm": 1.0625,
"learning_rate": 0.0002,
"loss": 0.2087890625,
"loss_d0": 0.4998590737581253,
"step": 760
},
{
"epoch": 11.0,
"grad_norm": 1.8203125,
"learning_rate": 0.0002,
"loss": 0.19215229749679566,
"loss_d0": 0.4216267496347427,
"step": 770
},
{
"epoch": 11.142857142857142,
"grad_norm": 1.03125,
"learning_rate": 0.0002,
"loss": 0.161735200881958,
"loss_d0": 0.40338513553142546,
"step": 780
},
{
"epoch": 11.285714285714286,
"grad_norm": 1.1015625,
"learning_rate": 0.0002,
"loss": 0.16771552562713624,
"loss_d0": 0.42275542616844175,
"step": 790
},
{
"epoch": 11.428571428571429,
"grad_norm": 1.1640625,
"learning_rate": 0.0002,
"loss": 0.15335218906402587,
"loss_d0": 0.3944630563259125,
"step": 800
},
{
"epoch": 11.571428571428571,
"grad_norm": 0.97265625,
"learning_rate": 0.0002,
"loss": 0.16975181102752684,
"loss_d0": 0.42211559414863586,
"step": 810
},
{
"epoch": 11.714285714285714,
"grad_norm": 0.80859375,
"learning_rate": 0.0002,
"loss": 0.18913717269897462,
"loss_d0": 0.43886401802301406,
"step": 820
},
{
"epoch": 11.857142857142858,
"grad_norm": 1.234375,
"learning_rate": 0.0002,
"loss": 0.22327446937561035,
"loss_d0": 0.5353886485099792,
"step": 830
},
{
"epoch": 12.0,
"grad_norm": 1.0390625,
"learning_rate": 0.0002,
"loss": 0.15874338150024414,
"loss_d0": 0.38432416021823884,
"step": 840
},
{
"epoch": 12.142857142857142,
"grad_norm": 0.8125,
"learning_rate": 0.0002,
"loss": 0.1377707004547119,
"loss_d0": 0.3911532461643219,
"step": 850
},
{
"epoch": 12.285714285714286,
"grad_norm": 1.03125,
"learning_rate": 0.0002,
"loss": 0.16991720199584961,
"loss_d0": 0.4460686922073364,
"step": 860
},
{
"epoch": 12.428571428571429,
"grad_norm": 1.0234375,
"learning_rate": 0.0002,
"loss": 0.16523797512054444,
"loss_d0": 0.43365546464920046,
"step": 870
},
{
"epoch": 12.571428571428571,
"grad_norm": 0.9921875,
"learning_rate": 0.0002,
"loss": 0.15238118171691895,
"loss_d0": 0.42346865832805636,
"step": 880
},
{
"epoch": 12.714285714285714,
"grad_norm": 0.74609375,
"learning_rate": 0.0002,
"loss": 0.14495233297348023,
"loss_d0": 0.35719306766986847,
"step": 890
},
{
"epoch": 12.857142857142858,
"grad_norm": 1.2265625,
"learning_rate": 0.0002,
"loss": 0.17073333263397217,
"loss_d0": 0.43814408481121064,
"step": 900
},
{
"epoch": 13.0,
"grad_norm": 0.83203125,
"learning_rate": 0.0002,
"loss": 0.1850340723991394,
"loss_d0": 0.482748007774353,
"step": 910
},
{
"epoch": 13.142857142857142,
"grad_norm": 1.0625,
"learning_rate": 0.0002,
"loss": 0.13537302017211914,
"loss_d0": 0.34865332692861556,
"step": 920
},
{
"epoch": 13.285714285714286,
"grad_norm": 0.91015625,
"learning_rate": 0.0002,
"loss": 0.1343899965286255,
"loss_d0": 0.3968281477689743,
"step": 930
},
{
"epoch": 13.428571428571429,
"grad_norm": 1.1640625,
"learning_rate": 0.0002,
"loss": 0.1584508538246155,
"loss_d0": 0.4577269285917282,
"step": 940
},
{
"epoch": 13.571428571428571,
"grad_norm": 0.95703125,
"learning_rate": 0.0002,
"loss": 0.14411535263061523,
"loss_d0": 0.3959138482809067,
"step": 950
},
{
"epoch": 13.714285714285714,
"grad_norm": 0.94921875,
"learning_rate": 0.0002,
"loss": 0.17094615697860718,
"loss_d0": 0.46275514960289,
"step": 960
},
{
"epoch": 13.857142857142858,
"grad_norm": 0.94921875,
"learning_rate": 0.0002,
"loss": 0.15647470951080322,
"loss_d0": 0.43458292484283445,
"step": 970
},
{
"epoch": 14.0,
"grad_norm": 0.8203125,
"learning_rate": 0.0002,
"loss": 0.16071619987487792,
"loss_d0": 0.4134894758462906,
"step": 980
},
{
"epoch": 14.142857142857142,
"grad_norm": 0.92578125,
"learning_rate": 0.0002,
"loss": 0.14269460439682008,
"loss_d0": 0.4106316104531288,
"step": 990
},
{
"epoch": 14.285714285714286,
"grad_norm": 0.8984375,
"learning_rate": 0.0002,
"loss": 0.15636165142059327,
"loss_d0": 0.42688301801681516,
"step": 1000
},
{
"epoch": 14.285714285714286,
"eval_loss": 9.74100399017334,
"eval_runtime": 0.3462,
"eval_samples_per_second": 722.046,
"eval_steps_per_second": 72.205,
"step": 1000
},
{
"epoch": 14.428571428571429,
"grad_norm": 0.76953125,
"learning_rate": 0.0002,
"loss": 0.1325446605682373,
"loss_d0": 0.38657407015562056,
"step": 1010
},
{
"epoch": 14.571428571428571,
"grad_norm": 0.82421875,
"learning_rate": 0.0002,
"loss": 0.14686695337295533,
"loss_d0": 0.4054566860198975,
"step": 1020
},
{
"epoch": 14.714285714285714,
"grad_norm": 1.0234375,
"learning_rate": 0.0002,
"loss": 0.13976905345916749,
"loss_d0": 0.38684512078762057,
"step": 1030
},
{
"epoch": 14.857142857142858,
"grad_norm": 0.9921875,
"learning_rate": 0.0002,
"loss": 0.1563257694244385,
"loss_d0": 0.4456890881061554,
"step": 1040
},
{
"epoch": 15.0,
"grad_norm": 0.890625,
"learning_rate": 0.0002,
"loss": 0.1601293206214905,
"loss_d0": 0.4465105265378952,
"step": 1050
},
{
"epoch": 15.142857142857142,
"grad_norm": 0.75390625,
"learning_rate": 0.0002,
"loss": 0.15074552297592164,
"loss_d0": 0.41963100135326387,
"step": 1060
},
{
"epoch": 15.285714285714286,
"grad_norm": 1.3984375,
"learning_rate": 0.0002,
"loss": 0.15185041427612306,
"loss_d0": 0.41460293233394624,
"step": 1070
},
{
"epoch": 15.428571428571429,
"grad_norm": 0.8359375,
"learning_rate": 0.0002,
"loss": 0.13449288606643678,
"loss_d0": 0.40143118500709535,
"step": 1080
},
{
"epoch": 15.571428571428571,
"grad_norm": 1.5234375,
"learning_rate": 0.0002,
"loss": 0.16524744033813477,
"loss_d0": 0.44636636078357694,
"step": 1090
},
{
"epoch": 15.714285714285714,
"grad_norm": 0.93359375,
"learning_rate": 0.0002,
"loss": 0.1261012315750122,
"loss_d0": 0.35532553046941756,
"step": 1100
},
{
"epoch": 15.857142857142858,
"grad_norm": 0.79296875,
"learning_rate": 0.0002,
"loss": 0.16132652759552002,
"loss_d0": 0.45412015467882155,
"step": 1110
},
{
"epoch": 16.0,
"grad_norm": 0.875,
"learning_rate": 0.0002,
"loss": 0.1498228430747986,
"loss_d0": 0.3984955310821533,
"step": 1120
},
{
"epoch": 16.142857142857142,
"grad_norm": 0.90625,
"learning_rate": 0.0002,
"loss": 0.11573998928070069,
"loss_d0": 0.3429853171110153,
"step": 1130
},
{
"epoch": 16.285714285714285,
"grad_norm": 0.69921875,
"learning_rate": 0.0002,
"loss": 0.13562896251678466,
"loss_d0": 0.3974081426858902,
"step": 1140
},
{
"epoch": 16.428571428571427,
"grad_norm": 1.03125,
"learning_rate": 0.0002,
"loss": 0.14604614973068236,
"loss_d0": 0.43393263816833494,
"step": 1150
},
{
"epoch": 16.571428571428573,
"grad_norm": 1.6875,
"learning_rate": 0.0002,
"loss": 0.12731246948242186,
"loss_d0": 0.36327935606241224,
"step": 1160
},
{
"epoch": 16.714285714285715,
"grad_norm": 1.46875,
"learning_rate": 0.0002,
"loss": 0.14498001337051392,
"loss_d0": 0.4154079735279083,
"step": 1170
},
{
"epoch": 16.857142857142858,
"grad_norm": 1.046875,
"learning_rate": 0.0002,
"loss": 0.16311801671981813,
"loss_d0": 0.45202054679393766,
"step": 1180
},
{
"epoch": 17.0,
"grad_norm": 1.125,
"learning_rate": 0.0002,
"loss": 0.15291047096252441,
"loss_d0": 0.4574140697717667,
"step": 1190
},
{
"epoch": 17.142857142857142,
"grad_norm": 1.0703125,
"learning_rate": 0.0002,
"loss": 0.11962804794311524,
"loss_d0": 0.35834813863039017,
"step": 1200
},
{
"epoch": 17.285714285714285,
"grad_norm": 1.0390625,
"learning_rate": 0.0002,
"loss": 0.14257519245147704,
"loss_d0": 0.40999800264835357,
"step": 1210
},
{
"epoch": 17.428571428571427,
"grad_norm": 1.203125,
"learning_rate": 0.0002,
"loss": 0.12993460893630981,
"loss_d0": 0.3714532881975174,
"step": 1220
},
{
"epoch": 17.571428571428573,
"grad_norm": 0.984375,
"learning_rate": 0.0002,
"loss": 0.13073623180389404,
"loss_d0": 0.3804581880569458,
"step": 1230
},
{
"epoch": 17.714285714285715,
"grad_norm": 1.4140625,
"learning_rate": 0.0002,
"loss": 0.13893918991088866,
"loss_d0": 0.40951029658317567,
"step": 1240
},
{
"epoch": 17.857142857142858,
"grad_norm": 0.9375,
"learning_rate": 0.0002,
"loss": 0.13479981422424317,
"loss_d0": 0.4055067300796509,
"step": 1250
},
{
"epoch": 18.0,
"grad_norm": 1.1171875,
"learning_rate": 0.0002,
"loss": 0.14387743473052977,
"loss_d0": 0.45950326323509216,
"step": 1260
},
{
"epoch": 18.142857142857142,
"grad_norm": 0.86328125,
"learning_rate": 0.0002,
"loss": 0.12405726909637452,
"loss_d0": 0.37750509530305865,
"step": 1270
},
{
"epoch": 18.285714285714285,
"grad_norm": 0.84765625,
"learning_rate": 0.0002,
"loss": 0.12020995616912841,
"loss_d0": 0.3599585384130478,
"step": 1280
},
{
"epoch": 18.428571428571427,
"grad_norm": 0.80078125,
"learning_rate": 0.0002,
"loss": 0.1472527027130127,
"loss_d0": 0.3992807060480118,
"step": 1290
},
{
"epoch": 18.571428571428573,
"grad_norm": 0.82421875,
"learning_rate": 0.0002,
"loss": 0.15526074171066284,
"loss_d0": 0.457242825627327,
"step": 1300
},
{
"epoch": 18.714285714285715,
"grad_norm": 0.96484375,
"learning_rate": 0.0002,
"loss": 0.14091994762420654,
"loss_d0": 0.4314684599637985,
"step": 1310
},
{
"epoch": 18.857142857142858,
"grad_norm": 0.8359375,
"learning_rate": 0.0002,
"loss": 0.1281859755516052,
"loss_d0": 0.36913466453552246,
"step": 1320
},
{
"epoch": 19.0,
"grad_norm": 0.828125,
"learning_rate": 0.0002,
"loss": 0.1549570679664612,
"loss_d0": 0.43077765703201293,
"step": 1330
},
{
"epoch": 19.142857142857142,
"grad_norm": 0.73828125,
"learning_rate": 0.0002,
"loss": 0.11442582607269287,
"loss_d0": 0.374704709649086,
"step": 1340
},
{
"epoch": 19.285714285714285,
"grad_norm": 0.99609375,
"learning_rate": 0.0002,
"loss": 0.1251933455467224,
"loss_d0": 0.37866236865520475,
"step": 1350
},
{
"epoch": 19.428571428571427,
"grad_norm": 0.6953125,
"learning_rate": 0.0002,
"loss": 0.12533226013183593,
"loss_d0": 0.38566732704639434,
"step": 1360
},
{
"epoch": 19.571428571428573,
"grad_norm": 1.2578125,
"learning_rate": 0.0002,
"loss": 0.13898290395736695,
"loss_d0": 0.41185433566570284,
"step": 1370
},
{
"epoch": 19.714285714285715,
"grad_norm": 0.56640625,
"learning_rate": 0.0002,
"loss": 0.14139026403427124,
"loss_d0": 0.3994438648223877,
"step": 1380
},
{
"epoch": 19.857142857142858,
"grad_norm": 1.1328125,
"learning_rate": 0.0002,
"loss": 0.14629528522491456,
"loss_d0": 0.45764580070972444,
"step": 1390
},
{
"epoch": 20.0,
"grad_norm": 0.74609375,
"learning_rate": 0.0002,
"loss": 0.13958772420883178,
"loss_d0": 0.41138762086629865,
"step": 1400
},
{
"epoch": 20.142857142857142,
"grad_norm": 0.75390625,
"learning_rate": 0.0002,
"loss": 0.10666416883468628,
"loss_d0": 0.35182701647281645,
"step": 1410
},
{
"epoch": 20.285714285714285,
"grad_norm": 0.89453125,
"learning_rate": 0.0002,
"loss": 0.12388570308685302,
"loss_d0": 0.3976111799478531,
"step": 1420
},
{
"epoch": 20.428571428571427,
"grad_norm": 1.0859375,
"learning_rate": 0.0002,
"loss": 0.12193892002105713,
"loss_d0": 0.3856766760349274,
"step": 1430
},
{
"epoch": 20.571428571428573,
"grad_norm": 0.62890625,
"learning_rate": 0.0002,
"loss": 0.12145572900772095,
"loss_d0": 0.3665471762418747,
"step": 1440
},
{
"epoch": 20.714285714285715,
"grad_norm": 0.79296875,
"learning_rate": 0.0002,
"loss": 0.13988080024719238,
"loss_d0": 0.39173959791660307,
"step": 1450
},
{
"epoch": 20.857142857142858,
"grad_norm": 0.77734375,
"learning_rate": 0.0002,
"loss": 0.1655336618423462,
"loss_d0": 0.4761664211750031,
"step": 1460
},
{
"epoch": 21.0,
"grad_norm": 0.8125,
"learning_rate": 0.0002,
"loss": 0.13238286972045898,
"loss_d0": 0.42673201858997345,
"step": 1470
},
{
"epoch": 21.142857142857142,
"grad_norm": 0.9375,
"learning_rate": 0.0002,
"loss": 0.11268144845962524,
"loss_d0": 0.38569384068250656,
"step": 1480
},
{
"epoch": 21.285714285714285,
"grad_norm": 0.96875,
"learning_rate": 0.0002,
"loss": 0.1253903865814209,
"loss_d0": 0.4076909214258194,
"step": 1490
},
{
"epoch": 21.428571428571427,
"grad_norm": 0.91796875,
"learning_rate": 0.0002,
"loss": 0.13616844415664672,
"loss_d0": 0.43757488429546354,
"step": 1500
},
{
"epoch": 21.428571428571427,
"eval_loss": 8.753684043884277,
"eval_runtime": 0.3463,
"eval_samples_per_second": 721.916,
"eval_steps_per_second": 72.192,
"step": 1500
},
{
"epoch": 21.571428571428573,
"grad_norm": 0.69140625,
"learning_rate": 0.0002,
"loss": 0.13126761913299562,
"loss_d0": 0.3969725713133812,
"step": 1510
},
{
"epoch": 21.714285714285715,
"grad_norm": 0.68359375,
"learning_rate": 0.0002,
"loss": 0.12211315631866455,
"loss_d0": 0.394762022793293,
"step": 1520
},
{
"epoch": 21.857142857142858,
"grad_norm": 1.1875,
"learning_rate": 0.0002,
"loss": 0.13277941942214966,
"loss_d0": 0.37962048798799514,
"step": 1530
},
{
"epoch": 22.0,
"grad_norm": 1.1796875,
"learning_rate": 0.0002,
"loss": 0.11672606468200683,
"loss_d0": 0.36649424582719803,
"step": 1540
},
{
"epoch": 22.142857142857142,
"grad_norm": 1.3359375,
"learning_rate": 0.0002,
"loss": 0.10678048133850097,
"loss_d0": 0.3356593608856201,
"step": 1550
},
{
"epoch": 22.285714285714285,
"grad_norm": 0.734375,
"learning_rate": 0.0002,
"loss": 0.10783629417419434,
"loss_d0": 0.35811730176210405,
"step": 1560
},
{
"epoch": 22.428571428571427,
"grad_norm": 0.71875,
"learning_rate": 0.0002,
"loss": 0.12049505710601807,
"loss_d0": 0.37791029214859007,
"step": 1570
},
{
"epoch": 22.571428571428573,
"grad_norm": 0.70703125,
"learning_rate": 0.0002,
"loss": 0.17957345247268677,
"loss_d0": 0.39931109845638274,
"step": 1580
},
{
"epoch": 22.714285714285715,
"grad_norm": 0.64453125,
"learning_rate": 0.0002,
"loss": 0.13404223918914795,
"loss_d0": 0.41865653693675997,
"step": 1590
},
{
"epoch": 22.857142857142858,
"grad_norm": 1.453125,
"learning_rate": 0.0002,
"loss": 0.1373995065689087,
"loss_d0": 0.41133707463741304,
"step": 1600
},
{
"epoch": 23.0,
"grad_norm": 1.015625,
"learning_rate": 0.0001999900348908142,
"loss": 0.1371894121170044,
"loss_d0": 0.43064315617084503,
"step": 1610
},
{
"epoch": 23.142857142857142,
"grad_norm": 0.76171875,
"learning_rate": 0.00019995559043291586,
"loss": 0.09948145151138306,
"loss_d0": 0.3413606286048889,
"step": 1620
},
{
"epoch": 23.285714285714285,
"grad_norm": 1.1015625,
"learning_rate": 0.0001998965530147941,
"loss": 0.12103539705276489,
"loss_d0": 0.4073850393295288,
"step": 1630
},
{
"epoch": 23.428571428571427,
"grad_norm": 0.80859375,
"learning_rate": 0.00019981293877668964,
"loss": 0.13946337699890138,
"loss_d0": 0.44305639564990995,
"step": 1640
},
{
"epoch": 23.571428571428573,
"grad_norm": 0.93359375,
"learning_rate": 0.00019970477057790025,
"loss": 0.12069251537322997,
"loss_d0": 0.3936402976512909,
"step": 1650
},
{
"epoch": 23.714285714285715,
"grad_norm": 0.98828125,
"learning_rate": 0.0001995720779905314,
"loss": 0.11377420425415039,
"loss_d0": 0.3999328136444092,
"step": 1660
},
{
"epoch": 23.857142857142858,
"grad_norm": 0.62890625,
"learning_rate": 0.0001994148972914116,
"loss": 0.12190061807632446,
"loss_d0": 0.3969143331050873,
"step": 1670
},
{
"epoch": 24.0,
"grad_norm": 0.6796875,
"learning_rate": 0.0001992332714521745,
"loss": 0.13412773609161377,
"loss_d0": 0.3998068705201149,
"step": 1680
},
{
"epoch": 24.142857142857142,
"grad_norm": 0.96484375,
"learning_rate": 0.0001990272501275111,
"loss": 0.11265419721603394,
"loss_d0": 0.3656838908791542,
"step": 1690
},
{
"epoch": 24.285714285714285,
"grad_norm": 0.7734375,
"learning_rate": 0.00019879688964159436,
"loss": 0.10430265665054321,
"loss_d0": 0.34578651189804077,
"step": 1700
},
{
"epoch": 24.428571428571427,
"grad_norm": 0.546875,
"learning_rate": 0.00019854225297268106,
"loss": 0.1179135799407959,
"loss_d0": 0.37750212103128433,
"step": 1710
},
{
"epoch": 24.571428571428573,
"grad_norm": 0.65234375,
"learning_rate": 0.0001982634097358939,
"loss": 0.1166454792022705,
"loss_d0": 0.39225142896175386,
"step": 1720
},
{
"epoch": 24.714285714285715,
"grad_norm": 0.80078125,
"learning_rate": 0.00019796043616418963,
"loss": 0.11532022953033447,
"loss_d0": 0.3840861052274704,
"step": 1730
},
{
"epoch": 24.857142857142858,
"grad_norm": 1.8984375,
"learning_rate": 0.00019763341508751762,
"loss": 0.14431958198547362,
"loss_d0": 0.42472186088562014,
"step": 1740
},
{
"epoch": 25.0,
"grad_norm": 0.859375,
"learning_rate": 0.00019728243591017483,
"loss": 0.14231926202774048,
"loss_d0": 0.4452060103416443,
"step": 1750
},
{
"epoch": 25.142857142857142,
"grad_norm": 0.79296875,
"learning_rate": 0.0001969075945863639,
"loss": 0.12176300287246704,
"loss_d0": 0.3826014012098312,
"step": 1760
},
{
"epoch": 25.285714285714285,
"grad_norm": 0.71484375,
"learning_rate": 0.00019650899359396003,
"loss": 0.10076014995574951,
"loss_d0": 0.3468409776687622,
"step": 1770
},
{
"epoch": 25.428571428571427,
"grad_norm": 0.73046875,
"learning_rate": 0.00019608674190649446,
"loss": 0.1326352596282959,
"loss_d0": 0.41551732271909714,
"step": 1780
},
{
"epoch": 25.571428571428573,
"grad_norm": 0.85546875,
"learning_rate": 0.00019564095496336245,
"loss": 0.1203911304473877,
"loss_d0": 0.3934634208679199,
"step": 1790
},
{
"epoch": 25.714285714285715,
"grad_norm": 0.51953125,
"learning_rate": 0.0001951717546382631,
"loss": 0.12641458511352538,
"loss_d0": 0.3750816985964775,
"step": 1800
},
{
"epoch": 25.857142857142858,
"grad_norm": 0.91796875,
"learning_rate": 0.0001946792692058803,
"loss": 0.13473284244537354,
"loss_d0": 0.4147344782948494,
"step": 1810
},
{
"epoch": 26.0,
"grad_norm": 0.671875,
"learning_rate": 0.00019416363330681388,
"loss": 0.12597525119781494,
"loss_d0": 0.41172686219215393,
"step": 1820
},
{
"epoch": 26.142857142857142,
"grad_norm": 0.99609375,
"learning_rate": 0.00019362498791077002,
"loss": 0.13244423866271973,
"loss_d0": 0.4096812799572945,
"step": 1830
},
{
"epoch": 26.285714285714285,
"grad_norm": 0.640625,
"learning_rate": 0.00019306348027802166,
"loss": 0.10660384893417359,
"loss_d0": 0.3657086730003357,
"step": 1840
},
{
"epoch": 26.428571428571427,
"grad_norm": 0.9375,
"learning_rate": 0.000192479263919149,
"loss": 0.10279349088668824,
"loss_d0": 0.3708105951547623,
"step": 1850
},
{
"epoch": 26.571428571428573,
"grad_norm": 0.91796875,
"learning_rate": 0.00019187249855307114,
"loss": 0.11480600833892822,
"loss_d0": 0.3930380791425705,
"step": 1860
},
{
"epoch": 26.714285714285715,
"grad_norm": 0.65625,
"learning_rate": 0.00019124335006338072,
"loss": 0.11895076036453248,
"loss_d0": 0.39364840239286425,
"step": 1870
},
{
"epoch": 26.857142857142858,
"grad_norm": 0.625,
"learning_rate": 0.00019059199045299278,
"loss": 0.1063655138015747,
"loss_d0": 0.36443009227514267,
"step": 1880
},
{
"epoch": 27.0,
"grad_norm": 1.21875,
"learning_rate": 0.00018991859779712102,
"loss": 0.12195394039154053,
"loss_d0": 0.42418347895145414,
"step": 1890
},
{
"epoch": 27.142857142857142,
"grad_norm": 0.66796875,
"learning_rate": 0.00018922335619459373,
"loss": 0.09252588152885437,
"loss_d0": 0.3217478543519974,
"step": 1900
},
{
"epoch": 27.285714285714285,
"grad_norm": 0.50390625,
"learning_rate": 0.00018850645571752317,
"loss": 0.10999109745025634,
"loss_d0": 0.36287291944026945,
"step": 1910
},
{
"epoch": 27.428571428571427,
"grad_norm": 0.8046875,
"learning_rate": 0.0001877680923593415,
"loss": 0.10641486644744873,
"loss_d0": 0.3734027534723282,
"step": 1920
},
{
"epoch": 27.571428571428573,
"grad_norm": 0.72265625,
"learning_rate": 0.00018700846798121838,
"loss": 0.11276865005493164,
"loss_d0": 0.392790412902832,
"step": 1930
},
{
"epoch": 27.714285714285715,
"grad_norm": 0.6640625,
"learning_rate": 0.00018622779025687395,
"loss": 0.11621142625808716,
"loss_d0": 0.4068701401352882,
"step": 1940
},
{
"epoch": 27.857142857142858,
"grad_norm": 0.84375,
"learning_rate": 0.00018542627261580302,
"loss": 0.10486786365509033,
"loss_d0": 0.3720921754837036,
"step": 1950
},
{
"epoch": 28.0,
"grad_norm": 0.9375,
"learning_rate": 0.00018460413418492565,
"loss": 0.125832998752594,
"loss_d0": 0.4209293022751808,
"step": 1960
},
{
"epoch": 28.142857142857142,
"grad_norm": 0.60546875,
"learning_rate": 0.0001837615997286797,
"loss": 0.09495269060134888,
"loss_d0": 0.32309970781207087,
"step": 1970
},
{
"epoch": 28.285714285714285,
"grad_norm": 0.80859375,
"learning_rate": 0.00018289889958757294,
"loss": 0.1047176718711853,
"loss_d0": 0.35154553800821303,
"step": 1980
},
{
"epoch": 28.428571428571427,
"grad_norm": 0.484375,
"learning_rate": 0.00018201626961520997,
"loss": 0.10913280248641968,
"loss_d0": 0.3813262224197388,
"step": 1990
},
{
"epoch": 28.571428571428573,
"grad_norm": 0.62890625,
"learning_rate": 0.00018111395111381214,
"loss": 0.11296517848968506,
"loss_d0": 0.4021457523107529,
"step": 2000
},
{
"epoch": 28.571428571428573,
"eval_loss": 9.778786659240723,
"eval_runtime": 0.3465,
"eval_samples_per_second": 721.509,
"eval_steps_per_second": 72.151,
"step": 2000
}
],
"logging_steps": 10,
"max_steps": 3500,
"num_input_tokens_seen": 0,
"num_train_epochs": 50,
"save_steps": 1000,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 2.577720168579072e+16,
"train_batch_size": 10,
"trial_name": null,
"trial_params": null
}