1667 lines
40 KiB
JSON
1667 lines
40 KiB
JSON
{
|
|
"best_global_step": null,
|
|
"best_metric": null,
|
|
"best_model_checkpoint": null,
|
|
"epoch": 133.33333333333334,
|
|
"eval_steps": 500,
|
|
"global_step": 2000,
|
|
"is_hyper_param_search": false,
|
|
"is_local_process_zero": true,
|
|
"is_world_process_zero": true,
|
|
"log_history": [
|
|
{
|
|
"epoch": 0.6666666666666666,
|
|
"grad_norm": 8.4375,
|
|
"learning_rate": 1.8e-05,
|
|
"loss": 2.421918487548828,
|
|
"loss_d0": 2.4261313915252685,
|
|
"step": 10
|
|
},
|
|
{
|
|
"epoch": 1.3333333333333333,
|
|
"grad_norm": 4.46875,
|
|
"learning_rate": 3.8e-05,
|
|
"loss": 1.0088010787963868,
|
|
"loss_d0": 1.0096346318721772,
|
|
"step": 20
|
|
},
|
|
{
|
|
"epoch": 2.0,
|
|
"grad_norm": 3.46875,
|
|
"learning_rate": 5.8e-05,
|
|
"loss": 0.6839343547821045,
|
|
"loss_d0": 0.6862720727920533,
|
|
"step": 30
|
|
},
|
|
{
|
|
"epoch": 2.6666666666666665,
|
|
"grad_norm": 2.6875,
|
|
"learning_rate": 7.800000000000001e-05,
|
|
"loss": 0.5316455841064454,
|
|
"loss_d0": 0.5327951699495316,
|
|
"step": 40
|
|
},
|
|
{
|
|
"epoch": 3.3333333333333335,
|
|
"grad_norm": 2.578125,
|
|
"learning_rate": 9.8e-05,
|
|
"loss": 0.4549861907958984,
|
|
"loss_d0": 0.45541533529758454,
|
|
"step": 50
|
|
},
|
|
{
|
|
"epoch": 4.0,
|
|
"grad_norm": 2.859375,
|
|
"learning_rate": 0.000118,
|
|
"loss": 0.44201197624206545,
|
|
"loss_d0": 0.4438814163208008,
|
|
"step": 60
|
|
},
|
|
{
|
|
"epoch": 4.666666666666667,
|
|
"grad_norm": 2.390625,
|
|
"learning_rate": 0.000138,
|
|
"loss": 0.37986207008361816,
|
|
"loss_d0": 0.3805710881948471,
|
|
"step": 70
|
|
},
|
|
{
|
|
"epoch": 5.333333333333333,
|
|
"grad_norm": 2.265625,
|
|
"learning_rate": 0.00015800000000000002,
|
|
"loss": 0.34696829319000244,
|
|
"loss_d0": 0.34865956008434296,
|
|
"step": 80
|
|
},
|
|
{
|
|
"epoch": 6.0,
|
|
"grad_norm": 2.40625,
|
|
"learning_rate": 0.00017800000000000002,
|
|
"loss": 0.317075777053833,
|
|
"loss_d0": 0.3180476576089859,
|
|
"step": 90
|
|
},
|
|
{
|
|
"epoch": 6.666666666666667,
|
|
"grad_norm": 3.140625,
|
|
"learning_rate": 0.00019800000000000002,
|
|
"loss": 0.2434556484222412,
|
|
"loss_d0": 0.24281310737133027,
|
|
"step": 100
|
|
},
|
|
{
|
|
"epoch": 7.333333333333333,
|
|
"grad_norm": 1.5546875,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.2385166883468628,
|
|
"loss_d0": 0.23866758197546006,
|
|
"step": 110
|
|
},
|
|
{
|
|
"epoch": 8.0,
|
|
"grad_norm": 1.640625,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.2383056879043579,
|
|
"loss_d0": 0.23965298384428024,
|
|
"step": 120
|
|
},
|
|
{
|
|
"epoch": 8.666666666666666,
|
|
"grad_norm": 1.2421875,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.18352937698364258,
|
|
"loss_d0": 0.18375806659460067,
|
|
"step": 130
|
|
},
|
|
{
|
|
"epoch": 9.333333333333334,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.17268719673156738,
|
|
"loss_d0": 0.17244660705327988,
|
|
"step": 140
|
|
},
|
|
{
|
|
"epoch": 10.0,
|
|
"grad_norm": 1.234375,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.16329215764999389,
|
|
"loss_d0": 0.16274539306759833,
|
|
"step": 150
|
|
},
|
|
{
|
|
"epoch": 10.666666666666666,
|
|
"grad_norm": 0.9453125,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.1369275689125061,
|
|
"loss_d0": 0.13629038035869598,
|
|
"step": 160
|
|
},
|
|
{
|
|
"epoch": 11.333333333333334,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.1421137571334839,
|
|
"loss_d0": 0.14217186272144317,
|
|
"step": 170
|
|
},
|
|
{
|
|
"epoch": 12.0,
|
|
"grad_norm": 0.9375,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.12057076692581177,
|
|
"loss_d0": 0.12064153775572777,
|
|
"step": 180
|
|
},
|
|
{
|
|
"epoch": 12.666666666666666,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.10163921117782593,
|
|
"loss_d0": 0.10211396664381027,
|
|
"step": 190
|
|
},
|
|
{
|
|
"epoch": 13.333333333333334,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.10858856439590454,
|
|
"loss_d0": 0.10898089408874512,
|
|
"step": 200
|
|
},
|
|
{
|
|
"epoch": 14.0,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.10204042196273803,
|
|
"loss_d0": 0.10232478231191636,
|
|
"step": 210
|
|
},
|
|
{
|
|
"epoch": 14.666666666666666,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.10013020038604736,
|
|
"loss_d0": 0.09980085715651513,
|
|
"step": 220
|
|
},
|
|
{
|
|
"epoch": 15.333333333333334,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.0953938364982605,
|
|
"loss_d0": 0.09604288935661316,
|
|
"step": 230
|
|
},
|
|
{
|
|
"epoch": 16.0,
|
|
"grad_norm": 0.921875,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.1123003602027893,
|
|
"loss_d0": 0.11246004849672317,
|
|
"step": 240
|
|
},
|
|
{
|
|
"epoch": 16.666666666666668,
|
|
"grad_norm": 0.6640625,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.08821422457695008,
|
|
"loss_d0": 0.0882071614265442,
|
|
"step": 250
|
|
},
|
|
{
|
|
"epoch": 17.333333333333332,
|
|
"grad_norm": 0.6484375,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.09300093650817871,
|
|
"loss_d0": 0.09352065548300743,
|
|
"step": 260
|
|
},
|
|
{
|
|
"epoch": 18.0,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.10097719430923462,
|
|
"loss_d0": 0.10090216547250748,
|
|
"step": 270
|
|
},
|
|
{
|
|
"epoch": 18.666666666666668,
|
|
"grad_norm": 0.65234375,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.08017570972442627,
|
|
"loss_d0": 0.08063347972929477,
|
|
"step": 280
|
|
},
|
|
{
|
|
"epoch": 19.333333333333332,
|
|
"grad_norm": 0.78125,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.10115858316421508,
|
|
"loss_d0": 0.10044149123132229,
|
|
"step": 290
|
|
},
|
|
{
|
|
"epoch": 20.0,
|
|
"grad_norm": 0.66796875,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.08694071173667908,
|
|
"loss_d0": 0.08698893040418625,
|
|
"step": 300
|
|
},
|
|
{
|
|
"epoch": 20.666666666666668,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.07665915489196777,
|
|
"loss_d0": 0.07681619115173817,
|
|
"step": 310
|
|
},
|
|
{
|
|
"epoch": 21.333333333333332,
|
|
"grad_norm": 0.490234375,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.07436910271644592,
|
|
"loss_d0": 0.07468437291681766,
|
|
"step": 320
|
|
},
|
|
{
|
|
"epoch": 22.0,
|
|
"grad_norm": 0.65234375,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.07695708870887756,
|
|
"loss_d0": 0.07751730270683765,
|
|
"step": 330
|
|
},
|
|
{
|
|
"epoch": 22.666666666666668,
|
|
"grad_norm": 0.7109375,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.0652268648147583,
|
|
"loss_d0": 0.06546519137918949,
|
|
"step": 340
|
|
},
|
|
{
|
|
"epoch": 23.333333333333332,
|
|
"grad_norm": 0.5546875,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.08022255301475525,
|
|
"loss_d0": 0.08006507605314254,
|
|
"step": 350
|
|
},
|
|
{
|
|
"epoch": 24.0,
|
|
"grad_norm": 0.60546875,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.07555531263351441,
|
|
"loss_d0": 0.07582116462290286,
|
|
"step": 360
|
|
},
|
|
{
|
|
"epoch": 24.666666666666668,
|
|
"grad_norm": 0.49609375,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.07231236100196839,
|
|
"loss_d0": 0.07194333672523498,
|
|
"step": 370
|
|
},
|
|
{
|
|
"epoch": 25.333333333333332,
|
|
"grad_norm": 0.953125,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.07199368476867676,
|
|
"loss_d0": 0.07204384617507457,
|
|
"step": 380
|
|
},
|
|
{
|
|
"epoch": 26.0,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.07506105303764343,
|
|
"loss_d0": 0.07531274408102036,
|
|
"step": 390
|
|
},
|
|
{
|
|
"epoch": 26.666666666666668,
|
|
"grad_norm": 0.5078125,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.07074097394943238,
|
|
"loss_d0": 0.0710180252790451,
|
|
"step": 400
|
|
},
|
|
{
|
|
"epoch": 27.333333333333332,
|
|
"grad_norm": 0.50390625,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.06964531540870667,
|
|
"loss_d0": 0.06979148238897323,
|
|
"step": 410
|
|
},
|
|
{
|
|
"epoch": 28.0,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.07868674993515015,
|
|
"loss_d0": 0.0794119793921709,
|
|
"step": 420
|
|
},
|
|
{
|
|
"epoch": 28.666666666666668,
|
|
"grad_norm": 0.5390625,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.06261486411094666,
|
|
"loss_d0": 0.06317082270979882,
|
|
"step": 430
|
|
},
|
|
{
|
|
"epoch": 29.333333333333332,
|
|
"grad_norm": 0.458984375,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.0674104392528534,
|
|
"loss_d0": 0.0678918220102787,
|
|
"step": 440
|
|
},
|
|
{
|
|
"epoch": 30.0,
|
|
"grad_norm": 0.6171875,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.06300061345100402,
|
|
"loss_d0": 0.06334730759263038,
|
|
"step": 450
|
|
},
|
|
{
|
|
"epoch": 30.666666666666668,
|
|
"grad_norm": 0.609375,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.05827343463897705,
|
|
"loss_d0": 0.059002993255853654,
|
|
"step": 460
|
|
},
|
|
{
|
|
"epoch": 31.333333333333332,
|
|
"grad_norm": 0.48046875,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.06440277695655823,
|
|
"loss_d0": 0.06487237587571144,
|
|
"step": 470
|
|
},
|
|
{
|
|
"epoch": 32.0,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.061999541521072385,
|
|
"loss_d0": 0.06224808767437935,
|
|
"step": 480
|
|
},
|
|
{
|
|
"epoch": 32.666666666666664,
|
|
"grad_norm": 0.51171875,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.0600206196308136,
|
|
"loss_d0": 0.059911682084202764,
|
|
"step": 490
|
|
},
|
|
{
|
|
"epoch": 33.333333333333336,
|
|
"grad_norm": 0.4453125,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.06044428944587708,
|
|
"loss_d0": 0.060578780993819234,
|
|
"step": 500
|
|
},
|
|
{
|
|
"epoch": 33.333333333333336,
|
|
"eval_loss": 9.13845443725586,
|
|
"eval_runtime": 0.3444,
|
|
"eval_samples_per_second": 725.913,
|
|
"eval_steps_per_second": 72.591,
|
|
"step": 500
|
|
},
|
|
{
|
|
"epoch": 34.0,
|
|
"grad_norm": 0.56640625,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.07208179235458374,
|
|
"loss_d0": 0.07209460139274597,
|
|
"step": 510
|
|
},
|
|
{
|
|
"epoch": 34.666666666666664,
|
|
"grad_norm": 0.73046875,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.07059242129325867,
|
|
"loss_d0": 0.07045452818274497,
|
|
"step": 520
|
|
},
|
|
{
|
|
"epoch": 35.333333333333336,
|
|
"grad_norm": 0.53515625,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.07173002958297729,
|
|
"loss_d0": 0.07224260158836841,
|
|
"step": 530
|
|
},
|
|
{
|
|
"epoch": 36.0,
|
|
"grad_norm": 0.53125,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.07025443315505982,
|
|
"loss_d0": 0.07014151066541671,
|
|
"step": 540
|
|
},
|
|
{
|
|
"epoch": 36.666666666666664,
|
|
"grad_norm": 0.41796875,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.05598782300949097,
|
|
"loss_d0": 0.05618280619382858,
|
|
"step": 550
|
|
},
|
|
{
|
|
"epoch": 37.333333333333336,
|
|
"grad_norm": 1.1640625,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.06106951236724854,
|
|
"loss_d0": 0.06142581254243851,
|
|
"step": 560
|
|
},
|
|
{
|
|
"epoch": 38.0,
|
|
"grad_norm": 0.625,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.06448903679847717,
|
|
"loss_d0": 0.06502410359680652,
|
|
"step": 570
|
|
},
|
|
{
|
|
"epoch": 38.666666666666664,
|
|
"grad_norm": 0.69921875,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.055691033601760864,
|
|
"loss_d0": 0.05563758760690689,
|
|
"step": 580
|
|
},
|
|
{
|
|
"epoch": 39.333333333333336,
|
|
"grad_norm": 0.4609375,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.05428870916366577,
|
|
"loss_d0": 0.05440036803483963,
|
|
"step": 590
|
|
},
|
|
{
|
|
"epoch": 40.0,
|
|
"grad_norm": 0.4765625,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.06395597457885742,
|
|
"loss_d0": 0.06434712558984756,
|
|
"step": 600
|
|
},
|
|
{
|
|
"epoch": 40.666666666666664,
|
|
"grad_norm": 0.55078125,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.051587647199630736,
|
|
"loss_d0": 0.0515783254057169,
|
|
"step": 610
|
|
},
|
|
{
|
|
"epoch": 41.333333333333336,
|
|
"grad_norm": 0.458984375,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.054391658306121825,
|
|
"loss_d0": 0.054683629795908927,
|
|
"step": 620
|
|
},
|
|
{
|
|
"epoch": 42.0,
|
|
"grad_norm": 0.54296875,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.06491554975509643,
|
|
"loss_d0": 0.06520816497504711,
|
|
"step": 630
|
|
},
|
|
{
|
|
"epoch": 42.666666666666664,
|
|
"grad_norm": 0.57421875,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.04977795779705048,
|
|
"loss_d0": 0.05002000890672207,
|
|
"step": 640
|
|
},
|
|
{
|
|
"epoch": 43.333333333333336,
|
|
"grad_norm": 0.4609375,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.057679593563079834,
|
|
"loss_d0": 0.05779850967228413,
|
|
"step": 650
|
|
},
|
|
{
|
|
"epoch": 44.0,
|
|
"grad_norm": 0.4140625,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.0639065682888031,
|
|
"loss_d0": 0.0639431532472372,
|
|
"step": 660
|
|
},
|
|
{
|
|
"epoch": 44.666666666666664,
|
|
"grad_norm": 0.42578125,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.055676817893981934,
|
|
"loss_d0": 0.055718598142266276,
|
|
"step": 670
|
|
},
|
|
{
|
|
"epoch": 45.333333333333336,
|
|
"grad_norm": 0.439453125,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.0558148443698883,
|
|
"loss_d0": 0.056852447986602786,
|
|
"step": 680
|
|
},
|
|
{
|
|
"epoch": 46.0,
|
|
"grad_norm": 0.4140625,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.056142383813858034,
|
|
"loss_d0": 0.056708256527781484,
|
|
"step": 690
|
|
},
|
|
{
|
|
"epoch": 46.666666666666664,
|
|
"grad_norm": 0.494140625,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.06292087435722352,
|
|
"loss_d0": 0.06391938552260398,
|
|
"step": 700
|
|
},
|
|
{
|
|
"epoch": 47.333333333333336,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.07009355425834655,
|
|
"loss_d0": 0.07109628617763519,
|
|
"step": 710
|
|
},
|
|
{
|
|
"epoch": 48.0,
|
|
"grad_norm": 0.5,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.06265608072280884,
|
|
"loss_d0": 0.06324342675507069,
|
|
"step": 720
|
|
},
|
|
{
|
|
"epoch": 48.666666666666664,
|
|
"grad_norm": 0.51171875,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.058049452304840085,
|
|
"loss_d0": 0.05832450538873672,
|
|
"step": 730
|
|
},
|
|
{
|
|
"epoch": 49.333333333333336,
|
|
"grad_norm": 0.4296875,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.05005338191986084,
|
|
"loss_d0": 0.05029585137963295,
|
|
"step": 740
|
|
},
|
|
{
|
|
"epoch": 50.0,
|
|
"grad_norm": 0.5390625,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.05678691864013672,
|
|
"loss_d0": 0.05686194933950901,
|
|
"step": 750
|
|
},
|
|
{
|
|
"epoch": 50.666666666666664,
|
|
"grad_norm": 0.353515625,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.04778255820274353,
|
|
"loss_d0": 0.047693025320768356,
|
|
"step": 760
|
|
},
|
|
{
|
|
"epoch": 51.333333333333336,
|
|
"grad_norm": 0.3125,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.045951011776924136,
|
|
"loss_d0": 0.04612946212291717,
|
|
"step": 770
|
|
},
|
|
{
|
|
"epoch": 52.0,
|
|
"grad_norm": 0.47265625,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.05352128744125366,
|
|
"loss_d0": 0.053439998626708986,
|
|
"step": 780
|
|
},
|
|
{
|
|
"epoch": 52.666666666666664,
|
|
"grad_norm": 0.57421875,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.05216069221496582,
|
|
"loss_d0": 0.05224486216902733,
|
|
"step": 790
|
|
},
|
|
{
|
|
"epoch": 53.333333333333336,
|
|
"grad_norm": 0.396484375,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.0503743052482605,
|
|
"loss_d0": 0.050616535171866414,
|
|
"step": 800
|
|
},
|
|
{
|
|
"epoch": 54.0,
|
|
"grad_norm": 0.55859375,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.05828244090080261,
|
|
"loss_d0": 0.058245481178164485,
|
|
"step": 810
|
|
},
|
|
{
|
|
"epoch": 54.666666666666664,
|
|
"grad_norm": 0.375,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.04754224717617035,
|
|
"loss_d0": 0.0475747250020504,
|
|
"step": 820
|
|
},
|
|
{
|
|
"epoch": 55.333333333333336,
|
|
"grad_norm": 0.5546875,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.05868909358978271,
|
|
"loss_d0": 0.05892425253987312,
|
|
"step": 830
|
|
},
|
|
{
|
|
"epoch": 56.0,
|
|
"grad_norm": 0.353515625,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.051529550552368165,
|
|
"loss_d0": 0.052010980620980266,
|
|
"step": 840
|
|
},
|
|
{
|
|
"epoch": 56.666666666666664,
|
|
"grad_norm": 0.51953125,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.05249919891357422,
|
|
"loss_d0": 0.05275176502764225,
|
|
"step": 850
|
|
},
|
|
{
|
|
"epoch": 57.333333333333336,
|
|
"grad_norm": 3.71875,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.045993578433990476,
|
|
"loss_d0": 0.04613303802907467,
|
|
"step": 860
|
|
},
|
|
{
|
|
"epoch": 58.0,
|
|
"grad_norm": 0.423828125,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.048613247275352475,
|
|
"loss_d0": 0.04909844733774662,
|
|
"step": 870
|
|
},
|
|
{
|
|
"epoch": 58.666666666666664,
|
|
"grad_norm": 0.56640625,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.04930594861507416,
|
|
"loss_d0": 0.049551048502326014,
|
|
"step": 880
|
|
},
|
|
{
|
|
"epoch": 59.333333333333336,
|
|
"grad_norm": 0.37109375,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.04568036198616028,
|
|
"loss_d0": 0.045924583449959755,
|
|
"step": 890
|
|
},
|
|
{
|
|
"epoch": 60.0,
|
|
"grad_norm": 0.46484375,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.049495384097099304,
|
|
"loss_d0": 0.04955673180520535,
|
|
"step": 900
|
|
},
|
|
{
|
|
"epoch": 60.666666666666664,
|
|
"grad_norm": 0.51953125,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.04855587482452393,
|
|
"loss_d0": 0.04888010248541832,
|
|
"step": 910
|
|
},
|
|
{
|
|
"epoch": 61.333333333333336,
|
|
"grad_norm": 0.41015625,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.05594310164451599,
|
|
"loss_d0": 0.05649171769618988,
|
|
"step": 920
|
|
},
|
|
{
|
|
"epoch": 62.0,
|
|
"grad_norm": 0.392578125,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.053293424844741824,
|
|
"loss_d0": 0.05361198410391808,
|
|
"step": 930
|
|
},
|
|
{
|
|
"epoch": 62.666666666666664,
|
|
"grad_norm": 0.349609375,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.043917146325111386,
|
|
"loss_d0": 0.04403241015970707,
|
|
"step": 940
|
|
},
|
|
{
|
|
"epoch": 63.333333333333336,
|
|
"grad_norm": 0.3828125,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.05403507351875305,
|
|
"loss_d0": 0.0540801115334034,
|
|
"step": 950
|
|
},
|
|
{
|
|
"epoch": 64.0,
|
|
"grad_norm": 0.3203125,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.05340455770492554,
|
|
"loss_d0": 0.05345079451799393,
|
|
"step": 960
|
|
},
|
|
{
|
|
"epoch": 64.66666666666667,
|
|
"grad_norm": 0.32421875,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.04586577713489533,
|
|
"loss_d0": 0.045774953439831734,
|
|
"step": 970
|
|
},
|
|
{
|
|
"epoch": 65.33333333333333,
|
|
"grad_norm": 0.40234375,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.049886322021484374,
|
|
"loss_d0": 0.04972761459648609,
|
|
"step": 980
|
|
},
|
|
{
|
|
"epoch": 66.0,
|
|
"grad_norm": 0.55859375,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.05277968049049377,
|
|
"loss_d0": 0.052887840569019316,
|
|
"step": 990
|
|
},
|
|
{
|
|
"epoch": 66.66666666666667,
|
|
"grad_norm": 0.416015625,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.04409850537776947,
|
|
"loss_d0": 0.04421806111931801,
|
|
"step": 1000
|
|
},
|
|
{
|
|
"epoch": 66.66666666666667,
|
|
"eval_loss": 9.554409980773926,
|
|
"eval_runtime": 0.3424,
|
|
"eval_samples_per_second": 730.235,
|
|
"eval_steps_per_second": 73.023,
|
|
"step": 1000
|
|
},
|
|
{
|
|
"epoch": 67.33333333333333,
|
|
"grad_norm": 0.41015625,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.051329106092453,
|
|
"loss_d0": 0.05161194391548633,
|
|
"step": 1010
|
|
},
|
|
{
|
|
"epoch": 68.0,
|
|
"grad_norm": 0.4609375,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.055698972940444944,
|
|
"loss_d0": 0.05587228611111641,
|
|
"step": 1020
|
|
},
|
|
{
|
|
"epoch": 68.66666666666667,
|
|
"grad_norm": 0.4765625,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.054827362298965454,
|
|
"loss_d0": 0.05480644553899765,
|
|
"step": 1030
|
|
},
|
|
{
|
|
"epoch": 69.33333333333333,
|
|
"grad_norm": 0.498046875,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.04891992211341858,
|
|
"loss_d0": 0.049376576021313665,
|
|
"step": 1040
|
|
},
|
|
{
|
|
"epoch": 70.0,
|
|
"grad_norm": 0.478515625,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.04819425940513611,
|
|
"loss_d0": 0.048350128903985025,
|
|
"step": 1050
|
|
},
|
|
{
|
|
"epoch": 70.66666666666667,
|
|
"grad_norm": 0.365234375,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.04239584505558014,
|
|
"loss_d0": 0.04294496588408947,
|
|
"step": 1060
|
|
},
|
|
{
|
|
"epoch": 71.33333333333333,
|
|
"grad_norm": 0.283203125,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.042692375183105466,
|
|
"loss_d0": 0.04297511279582977,
|
|
"step": 1070
|
|
},
|
|
{
|
|
"epoch": 72.0,
|
|
"grad_norm": 0.35546875,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.055435746908187866,
|
|
"loss_d0": 0.05571254044771194,
|
|
"step": 1080
|
|
},
|
|
{
|
|
"epoch": 72.66666666666667,
|
|
"grad_norm": 0.439453125,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.04335896372795105,
|
|
"loss_d0": 0.04351166188716889,
|
|
"step": 1090
|
|
},
|
|
{
|
|
"epoch": 73.33333333333333,
|
|
"grad_norm": 0.451171875,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.04509307742118836,
|
|
"loss_d0": 0.044969082623720166,
|
|
"step": 1100
|
|
},
|
|
{
|
|
"epoch": 74.0,
|
|
"grad_norm": 0.37109375,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.044564899802207944,
|
|
"loss_d0": 0.04485626481473446,
|
|
"step": 1110
|
|
},
|
|
{
|
|
"epoch": 74.66666666666667,
|
|
"grad_norm": 0.54296875,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.04501199722290039,
|
|
"loss_d0": 0.04522300362586975,
|
|
"step": 1120
|
|
},
|
|
{
|
|
"epoch": 75.33333333333333,
|
|
"grad_norm": 0.439453125,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.05590890645980835,
|
|
"loss_d0": 0.0560966432094574,
|
|
"step": 1130
|
|
},
|
|
{
|
|
"epoch": 76.0,
|
|
"grad_norm": 0.458984375,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.049013379216194156,
|
|
"loss_d0": 0.049229244515299794,
|
|
"step": 1140
|
|
},
|
|
{
|
|
"epoch": 76.66666666666667,
|
|
"grad_norm": 0.328125,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.04398736655712128,
|
|
"loss_d0": 0.043927453085780145,
|
|
"step": 1150
|
|
},
|
|
{
|
|
"epoch": 77.33333333333333,
|
|
"grad_norm": 0.36328125,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.04898269176483154,
|
|
"loss_d0": 0.04949351362884045,
|
|
"step": 1160
|
|
},
|
|
{
|
|
"epoch": 78.0,
|
|
"grad_norm": 0.419921875,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.05980457663536072,
|
|
"loss_d0": 0.059818652272224423,
|
|
"step": 1170
|
|
},
|
|
{
|
|
"epoch": 78.66666666666667,
|
|
"grad_norm": 0.451171875,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.0436438798904419,
|
|
"loss_d0": 0.044009941071271895,
|
|
"step": 1180
|
|
},
|
|
{
|
|
"epoch": 79.33333333333333,
|
|
"grad_norm": 0.38671875,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.044889166951179504,
|
|
"loss_d0": 0.045293374732136724,
|
|
"step": 1190
|
|
},
|
|
{
|
|
"epoch": 80.0,
|
|
"grad_norm": 0.314453125,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.044912150502204894,
|
|
"loss_d0": 0.04536973163485527,
|
|
"step": 1200
|
|
},
|
|
{
|
|
"epoch": 80.66666666666667,
|
|
"grad_norm": 0.462890625,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.04134044647216797,
|
|
"loss_d0": 0.041844359040260314,
|
|
"step": 1210
|
|
},
|
|
{
|
|
"epoch": 81.33333333333333,
|
|
"grad_norm": 0.341796875,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.047313326597213747,
|
|
"loss_d0": 0.047366232797503474,
|
|
"step": 1220
|
|
},
|
|
{
|
|
"epoch": 82.0,
|
|
"grad_norm": 0.427734375,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.04856643080711365,
|
|
"loss_d0": 0.04906500242650509,
|
|
"step": 1230
|
|
},
|
|
{
|
|
"epoch": 82.66666666666667,
|
|
"grad_norm": 0.419921875,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.04484961330890656,
|
|
"loss_d0": 0.04493558183312416,
|
|
"step": 1240
|
|
},
|
|
{
|
|
"epoch": 83.33333333333333,
|
|
"grad_norm": 0.435546875,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.05269008278846741,
|
|
"loss_d0": 0.05286562293767929,
|
|
"step": 1250
|
|
},
|
|
{
|
|
"epoch": 84.0,
|
|
"grad_norm": 0.384765625,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.04922019243240357,
|
|
"loss_d0": 0.049464859440922736,
|
|
"step": 1260
|
|
},
|
|
{
|
|
"epoch": 84.66666666666667,
|
|
"grad_norm": 0.26953125,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.04535785913467407,
|
|
"loss_d0": 0.04530546180903912,
|
|
"step": 1270
|
|
},
|
|
{
|
|
"epoch": 85.33333333333333,
|
|
"grad_norm": 0.3359375,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.047830259799957274,
|
|
"loss_d0": 0.047826096042990686,
|
|
"step": 1280
|
|
},
|
|
{
|
|
"epoch": 86.0,
|
|
"grad_norm": 0.3984375,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.05323054194450379,
|
|
"loss_d0": 0.053975147753953935,
|
|
"step": 1290
|
|
},
|
|
{
|
|
"epoch": 86.66666666666667,
|
|
"grad_norm": 0.4765625,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.050776940584182736,
|
|
"loss_d0": 0.05129864476621151,
|
|
"step": 1300
|
|
},
|
|
{
|
|
"epoch": 87.33333333333333,
|
|
"grad_norm": 0.3984375,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.04532744288444519,
|
|
"loss_d0": 0.04567943811416626,
|
|
"step": 1310
|
|
},
|
|
{
|
|
"epoch": 88.0,
|
|
"grad_norm": 0.484375,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.06010772585868836,
|
|
"loss_d0": 0.06063029356300831,
|
|
"step": 1320
|
|
},
|
|
{
|
|
"epoch": 88.66666666666667,
|
|
"grad_norm": 0.3125,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.043328261375427245,
|
|
"loss_d0": 0.04347851127386093,
|
|
"step": 1330
|
|
},
|
|
{
|
|
"epoch": 89.33333333333333,
|
|
"grad_norm": 0.328125,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.04670845866203308,
|
|
"loss_d0": 0.04659775644540787,
|
|
"step": 1340
|
|
},
|
|
{
|
|
"epoch": 90.0,
|
|
"grad_norm": 0.52734375,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.05301305651664734,
|
|
"loss_d0": 0.05338775292038918,
|
|
"step": 1350
|
|
},
|
|
{
|
|
"epoch": 90.66666666666667,
|
|
"grad_norm": 0.341796875,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.04126462042331695,
|
|
"loss_d0": 0.04134646132588386,
|
|
"step": 1360
|
|
},
|
|
{
|
|
"epoch": 91.33333333333333,
|
|
"grad_norm": 0.3359375,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.042479926347732545,
|
|
"loss_d0": 0.042819247022271155,
|
|
"step": 1370
|
|
},
|
|
{
|
|
"epoch": 92.0,
|
|
"grad_norm": 0.39453125,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.04254147410392761,
|
|
"loss_d0": 0.04261952787637711,
|
|
"step": 1380
|
|
},
|
|
{
|
|
"epoch": 92.66666666666667,
|
|
"grad_norm": 0.515625,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.038986426591873166,
|
|
"loss_d0": 0.03929588571190834,
|
|
"step": 1390
|
|
},
|
|
{
|
|
"epoch": 93.33333333333333,
|
|
"grad_norm": 0.423828125,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.04420076608657837,
|
|
"loss_d0": 0.044338321685791014,
|
|
"step": 1400
|
|
},
|
|
{
|
|
"epoch": 94.0,
|
|
"grad_norm": 0.400390625,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.046999228000640866,
|
|
"loss_d0": 0.04723503813147545,
|
|
"step": 1410
|
|
},
|
|
{
|
|
"epoch": 94.66666666666667,
|
|
"grad_norm": 0.498046875,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.05544422864913941,
|
|
"loss_d0": 0.0563637163490057,
|
|
"step": 1420
|
|
},
|
|
{
|
|
"epoch": 95.33333333333333,
|
|
"grad_norm": 0.423828125,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.045566269755363466,
|
|
"loss_d0": 0.045789827778935435,
|
|
"step": 1430
|
|
},
|
|
{
|
|
"epoch": 96.0,
|
|
"grad_norm": 0.404296875,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.04692624509334564,
|
|
"loss_d0": 0.04704286605119705,
|
|
"step": 1440
|
|
},
|
|
{
|
|
"epoch": 96.66666666666667,
|
|
"grad_norm": 0.337890625,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.043477731943130496,
|
|
"loss_d0": 0.04375685676932335,
|
|
"step": 1450
|
|
},
|
|
{
|
|
"epoch": 97.33333333333333,
|
|
"grad_norm": 0.3515625,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.04227950870990753,
|
|
"loss_d0": 0.042465734481811526,
|
|
"step": 1460
|
|
},
|
|
{
|
|
"epoch": 98.0,
|
|
"grad_norm": 0.50390625,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.04512187242507935,
|
|
"loss_d0": 0.045345602184534074,
|
|
"step": 1470
|
|
},
|
|
{
|
|
"epoch": 98.66666666666667,
|
|
"grad_norm": 0.384765625,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.04291306138038635,
|
|
"loss_d0": 0.0432887252420187,
|
|
"step": 1480
|
|
},
|
|
{
|
|
"epoch": 99.33333333333333,
|
|
"grad_norm": 0.32421875,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.04566190540790558,
|
|
"loss_d0": 0.04579663462936878,
|
|
"step": 1490
|
|
},
|
|
{
|
|
"epoch": 100.0,
|
|
"grad_norm": 0.421875,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.04533307552337647,
|
|
"loss_d0": 0.045655245706439015,
|
|
"step": 1500
|
|
},
|
|
{
|
|
"epoch": 100.0,
|
|
"eval_loss": 9.061501502990723,
|
|
"eval_runtime": 0.3426,
|
|
"eval_samples_per_second": 729.805,
|
|
"eval_steps_per_second": 72.98,
|
|
"step": 1500
|
|
},
|
|
{
|
|
"epoch": 100.66666666666667,
|
|
"grad_norm": 0.349609375,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.04723888635635376,
|
|
"loss_d0": 0.04738225191831589,
|
|
"step": 1510
|
|
},
|
|
{
|
|
"epoch": 101.33333333333333,
|
|
"grad_norm": 0.578125,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.04693470299243927,
|
|
"loss_d0": 0.047307074815034864,
|
|
"step": 1520
|
|
},
|
|
{
|
|
"epoch": 102.0,
|
|
"grad_norm": 0.3671875,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.048088711500167844,
|
|
"loss_d0": 0.048354702070355415,
|
|
"step": 1530
|
|
},
|
|
{
|
|
"epoch": 102.66666666666667,
|
|
"grad_norm": 0.470703125,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.05237179398536682,
|
|
"loss_d0": 0.05234827287495136,
|
|
"step": 1540
|
|
},
|
|
{
|
|
"epoch": 103.33333333333333,
|
|
"grad_norm": 0.353515625,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.052333736419677736,
|
|
"loss_d0": 0.05217711813747883,
|
|
"step": 1550
|
|
},
|
|
{
|
|
"epoch": 104.0,
|
|
"grad_norm": 0.43359375,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.05047644972801209,
|
|
"loss_d0": 0.05079820305109024,
|
|
"step": 1560
|
|
},
|
|
{
|
|
"epoch": 104.66666666666667,
|
|
"grad_norm": 0.34765625,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.04338579475879669,
|
|
"loss_d0": 0.04358413964509964,
|
|
"step": 1570
|
|
},
|
|
{
|
|
"epoch": 105.33333333333333,
|
|
"grad_norm": 0.5703125,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.04220978915691376,
|
|
"loss_d0": 0.042595018073916434,
|
|
"step": 1580
|
|
},
|
|
{
|
|
"epoch": 106.0,
|
|
"grad_norm": 0.3125,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.04199954867362976,
|
|
"loss_d0": 0.04210015088319778,
|
|
"step": 1590
|
|
},
|
|
{
|
|
"epoch": 106.66666666666667,
|
|
"grad_norm": 0.5,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.04109792709350586,
|
|
"loss_d0": 0.04124586768448353,
|
|
"step": 1600
|
|
},
|
|
{
|
|
"epoch": 107.33333333333333,
|
|
"grad_norm": 0.369140625,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.04061601459980011,
|
|
"loss_d0": 0.04075535014271736,
|
|
"step": 1610
|
|
},
|
|
{
|
|
"epoch": 108.0,
|
|
"grad_norm": 0.337890625,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.04082033038139343,
|
|
"loss_d0": 0.04100315794348717,
|
|
"step": 1620
|
|
},
|
|
{
|
|
"epoch": 108.66666666666667,
|
|
"grad_norm": 0.33984375,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.04076948165893555,
|
|
"loss_d0": 0.04087142236530781,
|
|
"step": 1630
|
|
},
|
|
{
|
|
"epoch": 109.33333333333333,
|
|
"grad_norm": 0.2412109375,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.044005772471427916,
|
|
"loss_d0": 0.0444443590939045,
|
|
"step": 1640
|
|
},
|
|
{
|
|
"epoch": 110.0,
|
|
"grad_norm": 0.267578125,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.04620983600616455,
|
|
"loss_d0": 0.046199577301740645,
|
|
"step": 1650
|
|
},
|
|
{
|
|
"epoch": 110.66666666666667,
|
|
"grad_norm": 0.46484375,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.04348172545433045,
|
|
"loss_d0": 0.043485574424266815,
|
|
"step": 1660
|
|
},
|
|
{
|
|
"epoch": 111.33333333333333,
|
|
"grad_norm": 0.484375,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.0493613988161087,
|
|
"loss_d0": 0.049395665526390076,
|
|
"step": 1670
|
|
},
|
|
{
|
|
"epoch": 112.0,
|
|
"grad_norm": 0.306640625,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.048318523168563846,
|
|
"loss_d0": 0.048244457319378854,
|
|
"step": 1680
|
|
},
|
|
{
|
|
"epoch": 112.66666666666667,
|
|
"grad_norm": 0.39453125,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.0416848361492157,
|
|
"loss_d0": 0.04183990061283112,
|
|
"step": 1690
|
|
},
|
|
{
|
|
"epoch": 113.33333333333333,
|
|
"grad_norm": 0.36328125,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.042894893884658815,
|
|
"loss_d0": 0.043047336116433146,
|
|
"step": 1700
|
|
},
|
|
{
|
|
"epoch": 114.0,
|
|
"grad_norm": 0.314453125,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.04120970368385315,
|
|
"loss_d0": 0.04166660569608212,
|
|
"step": 1710
|
|
},
|
|
{
|
|
"epoch": 114.66666666666667,
|
|
"grad_norm": 0.359375,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.03811361193656922,
|
|
"loss_d0": 0.03826403059065342,
|
|
"step": 1720
|
|
},
|
|
{
|
|
"epoch": 115.33333333333333,
|
|
"grad_norm": 0.474609375,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.04223992526531219,
|
|
"loss_d0": 0.04242944307625294,
|
|
"step": 1730
|
|
},
|
|
{
|
|
"epoch": 116.0,
|
|
"grad_norm": 0.39453125,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.04587743282318115,
|
|
"loss_d0": 0.04566792957484722,
|
|
"step": 1740
|
|
},
|
|
{
|
|
"epoch": 116.66666666666667,
|
|
"grad_norm": 0.337890625,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.04407768249511719,
|
|
"loss_d0": 0.04438020028173924,
|
|
"step": 1750
|
|
},
|
|
{
|
|
"epoch": 117.33333333333333,
|
|
"grad_norm": 0.34765625,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.04488096237182617,
|
|
"loss_d0": 0.044961581379175185,
|
|
"step": 1760
|
|
},
|
|
{
|
|
"epoch": 118.0,
|
|
"grad_norm": 0.396484375,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.04814847707748413,
|
|
"loss_d0": 0.048101956397295,
|
|
"step": 1770
|
|
},
|
|
{
|
|
"epoch": 118.66666666666667,
|
|
"grad_norm": 0.412109375,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.051658463478088376,
|
|
"loss_d0": 0.052022571489214894,
|
|
"step": 1780
|
|
},
|
|
{
|
|
"epoch": 119.33333333333333,
|
|
"grad_norm": 0.283203125,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.04125940203666687,
|
|
"loss_d0": 0.04183415174484253,
|
|
"step": 1790
|
|
},
|
|
{
|
|
"epoch": 120.0,
|
|
"grad_norm": 0.93359375,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.04704998135566711,
|
|
"loss_d0": 0.04690146148204803,
|
|
"step": 1800
|
|
},
|
|
{
|
|
"epoch": 120.66666666666667,
|
|
"grad_norm": 0.447265625,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.03837161362171173,
|
|
"loss_d0": 0.038679466024041174,
|
|
"step": 1810
|
|
},
|
|
{
|
|
"epoch": 121.33333333333333,
|
|
"grad_norm": 0.26171875,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.041628694534301756,
|
|
"loss_d0": 0.04210329055786133,
|
|
"step": 1820
|
|
},
|
|
{
|
|
"epoch": 122.0,
|
|
"grad_norm": 0.5625,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.04221533536911011,
|
|
"loss_d0": 0.042480390146374704,
|
|
"step": 1830
|
|
},
|
|
{
|
|
"epoch": 122.66666666666667,
|
|
"grad_norm": 0.29296875,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.043410655856132505,
|
|
"loss_d0": 0.043429945781826976,
|
|
"step": 1840
|
|
},
|
|
{
|
|
"epoch": 123.33333333333333,
|
|
"grad_norm": 0.44140625,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.041653552651405336,
|
|
"loss_d0": 0.04193488694727421,
|
|
"step": 1850
|
|
},
|
|
{
|
|
"epoch": 124.0,
|
|
"grad_norm": 0.2890625,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.0399824857711792,
|
|
"loss_d0": 0.04024950861930847,
|
|
"step": 1860
|
|
},
|
|
{
|
|
"epoch": 124.66666666666667,
|
|
"grad_norm": 0.36328125,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.04130673706531525,
|
|
"loss_d0": 0.04133395403623581,
|
|
"step": 1870
|
|
},
|
|
{
|
|
"epoch": 125.33333333333333,
|
|
"grad_norm": 0.3125,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.039680573344230655,
|
|
"loss_d0": 0.040023022517561915,
|
|
"step": 1880
|
|
},
|
|
{
|
|
"epoch": 126.0,
|
|
"grad_norm": 0.412109375,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.04459331929683685,
|
|
"loss_d0": 0.044731929898262024,
|
|
"step": 1890
|
|
},
|
|
{
|
|
"epoch": 126.66666666666667,
|
|
"grad_norm": 0.52734375,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.03877157270908356,
|
|
"loss_d0": 0.03899230137467384,
|
|
"step": 1900
|
|
},
|
|
{
|
|
"epoch": 127.33333333333333,
|
|
"grad_norm": 0.40625,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.04177733063697815,
|
|
"loss_d0": 0.04159155897796154,
|
|
"step": 1910
|
|
},
|
|
{
|
|
"epoch": 128.0,
|
|
"grad_norm": 0.318359375,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.039029103517532346,
|
|
"loss_d0": 0.039202263578772545,
|
|
"step": 1920
|
|
},
|
|
{
|
|
"epoch": 128.66666666666666,
|
|
"grad_norm": 0.33203125,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.03842213749885559,
|
|
"loss_d0": 0.0387143149971962,
|
|
"step": 1930
|
|
},
|
|
{
|
|
"epoch": 129.33333333333334,
|
|
"grad_norm": 0.70703125,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.04641495645046234,
|
|
"loss_d0": 0.0463741198182106,
|
|
"step": 1940
|
|
},
|
|
{
|
|
"epoch": 130.0,
|
|
"grad_norm": 0.37109375,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.04674426913261413,
|
|
"loss_d0": 0.04691287837922573,
|
|
"step": 1950
|
|
},
|
|
{
|
|
"epoch": 130.66666666666666,
|
|
"grad_norm": 0.458984375,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.0411600261926651,
|
|
"loss_d0": 0.04125998429954052,
|
|
"step": 1960
|
|
},
|
|
{
|
|
"epoch": 131.33333333333334,
|
|
"grad_norm": 0.21484375,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.04273697435855865,
|
|
"loss_d0": 0.04304400980472565,
|
|
"step": 1970
|
|
},
|
|
{
|
|
"epoch": 132.0,
|
|
"grad_norm": 0.36328125,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.04320941269397736,
|
|
"loss_d0": 0.04327214397490024,
|
|
"step": 1980
|
|
},
|
|
{
|
|
"epoch": 132.66666666666666,
|
|
"grad_norm": 0.33984375,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.038457101583480834,
|
|
"loss_d0": 0.03848358802497387,
|
|
"step": 1990
|
|
},
|
|
{
|
|
"epoch": 133.33333333333334,
|
|
"grad_norm": 0.33203125,
|
|
"learning_rate": 0.0002,
|
|
"loss": 0.04049345552921295,
|
|
"loss_d0": 0.04078166633844375,
|
|
"step": 2000
|
|
},
|
|
{
|
|
"epoch": 133.33333333333334,
|
|
"eval_loss": 9.509454727172852,
|
|
"eval_runtime": 0.3426,
|
|
"eval_samples_per_second": 729.644,
|
|
"eval_steps_per_second": 72.964,
|
|
"step": 2000
|
|
}
|
|
],
|
|
"logging_steps": 10,
|
|
"max_steps": 4500,
|
|
"num_input_tokens_seen": 0,
|
|
"num_train_epochs": 300,
|
|
"save_steps": 1000,
|
|
"stateful_callbacks": {
|
|
"TrainerControl": {
|
|
"args": {
|
|
"should_epoch_stop": false,
|
|
"should_evaluate": false,
|
|
"should_log": false,
|
|
"should_save": true,
|
|
"should_training_stop": false
|
|
},
|
|
"attributes": {}
|
|
}
|
|
},
|
|
"total_flos": 2.630938952269824e+16,
|
|
"train_batch_size": 10,
|
|
"trial_name": null,
|
|
"trial_params": null
|
|
}
|