Files
OLMo-0H-3D-50F-v2/trainer_state.json

1667 lines
40 KiB
JSON
Raw Normal View History

{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 133.33333333333334,
"eval_steps": 500,
"global_step": 2000,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.6666666666666666,
"grad_norm": 8.4375,
"learning_rate": 1.8e-05,
"loss": 2.421918487548828,
"loss_d0": 2.4261313915252685,
"step": 10
},
{
"epoch": 1.3333333333333333,
"grad_norm": 4.46875,
"learning_rate": 3.8e-05,
"loss": 1.0088010787963868,
"loss_d0": 1.0096346318721772,
"step": 20
},
{
"epoch": 2.0,
"grad_norm": 3.46875,
"learning_rate": 5.8e-05,
"loss": 0.6839343547821045,
"loss_d0": 0.6862720727920533,
"step": 30
},
{
"epoch": 2.6666666666666665,
"grad_norm": 2.6875,
"learning_rate": 7.800000000000001e-05,
"loss": 0.5316455841064454,
"loss_d0": 0.5327951699495316,
"step": 40
},
{
"epoch": 3.3333333333333335,
"grad_norm": 2.578125,
"learning_rate": 9.8e-05,
"loss": 0.4549861907958984,
"loss_d0": 0.45541533529758454,
"step": 50
},
{
"epoch": 4.0,
"grad_norm": 2.859375,
"learning_rate": 0.000118,
"loss": 0.44201197624206545,
"loss_d0": 0.4438814163208008,
"step": 60
},
{
"epoch": 4.666666666666667,
"grad_norm": 2.390625,
"learning_rate": 0.000138,
"loss": 0.37986207008361816,
"loss_d0": 0.3805710881948471,
"step": 70
},
{
"epoch": 5.333333333333333,
"grad_norm": 2.265625,
"learning_rate": 0.00015800000000000002,
"loss": 0.34696829319000244,
"loss_d0": 0.34865956008434296,
"step": 80
},
{
"epoch": 6.0,
"grad_norm": 2.40625,
"learning_rate": 0.00017800000000000002,
"loss": 0.317075777053833,
"loss_d0": 0.3180476576089859,
"step": 90
},
{
"epoch": 6.666666666666667,
"grad_norm": 3.140625,
"learning_rate": 0.00019800000000000002,
"loss": 0.2434556484222412,
"loss_d0": 0.24281310737133027,
"step": 100
},
{
"epoch": 7.333333333333333,
"grad_norm": 1.5546875,
"learning_rate": 0.0002,
"loss": 0.2385166883468628,
"loss_d0": 0.23866758197546006,
"step": 110
},
{
"epoch": 8.0,
"grad_norm": 1.640625,
"learning_rate": 0.0002,
"loss": 0.2383056879043579,
"loss_d0": 0.23965298384428024,
"step": 120
},
{
"epoch": 8.666666666666666,
"grad_norm": 1.2421875,
"learning_rate": 0.0002,
"loss": 0.18352937698364258,
"loss_d0": 0.18375806659460067,
"step": 130
},
{
"epoch": 9.333333333333334,
"grad_norm": 1.4453125,
"learning_rate": 0.0002,
"loss": 0.17268719673156738,
"loss_d0": 0.17244660705327988,
"step": 140
},
{
"epoch": 10.0,
"grad_norm": 1.234375,
"learning_rate": 0.0002,
"loss": 0.16329215764999389,
"loss_d0": 0.16274539306759833,
"step": 150
},
{
"epoch": 10.666666666666666,
"grad_norm": 0.9453125,
"learning_rate": 0.0002,
"loss": 0.1369275689125061,
"loss_d0": 0.13629038035869598,
"step": 160
},
{
"epoch": 11.333333333333334,
"grad_norm": 1.265625,
"learning_rate": 0.0002,
"loss": 0.1421137571334839,
"loss_d0": 0.14217186272144317,
"step": 170
},
{
"epoch": 12.0,
"grad_norm": 0.9375,
"learning_rate": 0.0002,
"loss": 0.12057076692581177,
"loss_d0": 0.12064153775572777,
"step": 180
},
{
"epoch": 12.666666666666666,
"grad_norm": 0.85546875,
"learning_rate": 0.0002,
"loss": 0.10163921117782593,
"loss_d0": 0.10211396664381027,
"step": 190
},
{
"epoch": 13.333333333333334,
"grad_norm": 0.7578125,
"learning_rate": 0.0002,
"loss": 0.10858856439590454,
"loss_d0": 0.10898089408874512,
"step": 200
},
{
"epoch": 14.0,
"grad_norm": 0.81640625,
"learning_rate": 0.0002,
"loss": 0.10204042196273803,
"loss_d0": 0.10232478231191636,
"step": 210
},
{
"epoch": 14.666666666666666,
"grad_norm": 0.74609375,
"learning_rate": 0.0002,
"loss": 0.10013020038604736,
"loss_d0": 0.09980085715651513,
"step": 220
},
{
"epoch": 15.333333333333334,
"grad_norm": 0.8046875,
"learning_rate": 0.0002,
"loss": 0.0953938364982605,
"loss_d0": 0.09604288935661316,
"step": 230
},
{
"epoch": 16.0,
"grad_norm": 0.921875,
"learning_rate": 0.0002,
"loss": 0.1123003602027893,
"loss_d0": 0.11246004849672317,
"step": 240
},
{
"epoch": 16.666666666666668,
"grad_norm": 0.6640625,
"learning_rate": 0.0002,
"loss": 0.08821422457695008,
"loss_d0": 0.0882071614265442,
"step": 250
},
{
"epoch": 17.333333333333332,
"grad_norm": 0.6484375,
"learning_rate": 0.0002,
"loss": 0.09300093650817871,
"loss_d0": 0.09352065548300743,
"step": 260
},
{
"epoch": 18.0,
"grad_norm": 1.4296875,
"learning_rate": 0.0002,
"loss": 0.10097719430923462,
"loss_d0": 0.10090216547250748,
"step": 270
},
{
"epoch": 18.666666666666668,
"grad_norm": 0.65234375,
"learning_rate": 0.0002,
"loss": 0.08017570972442627,
"loss_d0": 0.08063347972929477,
"step": 280
},
{
"epoch": 19.333333333333332,
"grad_norm": 0.78125,
"learning_rate": 0.0002,
"loss": 0.10115858316421508,
"loss_d0": 0.10044149123132229,
"step": 290
},
{
"epoch": 20.0,
"grad_norm": 0.66796875,
"learning_rate": 0.0002,
"loss": 0.08694071173667908,
"loss_d0": 0.08698893040418625,
"step": 300
},
{
"epoch": 20.666666666666668,
"grad_norm": 0.69921875,
"learning_rate": 0.0002,
"loss": 0.07665915489196777,
"loss_d0": 0.07681619115173817,
"step": 310
},
{
"epoch": 21.333333333333332,
"grad_norm": 0.490234375,
"learning_rate": 0.0002,
"loss": 0.07436910271644592,
"loss_d0": 0.07468437291681766,
"step": 320
},
{
"epoch": 22.0,
"grad_norm": 0.65234375,
"learning_rate": 0.0002,
"loss": 0.07695708870887756,
"loss_d0": 0.07751730270683765,
"step": 330
},
{
"epoch": 22.666666666666668,
"grad_norm": 0.7109375,
"learning_rate": 0.0002,
"loss": 0.0652268648147583,
"loss_d0": 0.06546519137918949,
"step": 340
},
{
"epoch": 23.333333333333332,
"grad_norm": 0.5546875,
"learning_rate": 0.0002,
"loss": 0.08022255301475525,
"loss_d0": 0.08006507605314254,
"step": 350
},
{
"epoch": 24.0,
"grad_norm": 0.60546875,
"learning_rate": 0.0002,
"loss": 0.07555531263351441,
"loss_d0": 0.07582116462290286,
"step": 360
},
{
"epoch": 24.666666666666668,
"grad_norm": 0.49609375,
"learning_rate": 0.0002,
"loss": 0.07231236100196839,
"loss_d0": 0.07194333672523498,
"step": 370
},
{
"epoch": 25.333333333333332,
"grad_norm": 0.953125,
"learning_rate": 0.0002,
"loss": 0.07199368476867676,
"loss_d0": 0.07204384617507457,
"step": 380
},
{
"epoch": 26.0,
"grad_norm": 0.80078125,
"learning_rate": 0.0002,
"loss": 0.07506105303764343,
"loss_d0": 0.07531274408102036,
"step": 390
},
{
"epoch": 26.666666666666668,
"grad_norm": 0.5078125,
"learning_rate": 0.0002,
"loss": 0.07074097394943238,
"loss_d0": 0.0710180252790451,
"step": 400
},
{
"epoch": 27.333333333333332,
"grad_norm": 0.50390625,
"learning_rate": 0.0002,
"loss": 0.06964531540870667,
"loss_d0": 0.06979148238897323,
"step": 410
},
{
"epoch": 28.0,
"grad_norm": 0.80078125,
"learning_rate": 0.0002,
"loss": 0.07868674993515015,
"loss_d0": 0.0794119793921709,
"step": 420
},
{
"epoch": 28.666666666666668,
"grad_norm": 0.5390625,
"learning_rate": 0.0002,
"loss": 0.06261486411094666,
"loss_d0": 0.06317082270979882,
"step": 430
},
{
"epoch": 29.333333333333332,
"grad_norm": 0.458984375,
"learning_rate": 0.0002,
"loss": 0.0674104392528534,
"loss_d0": 0.0678918220102787,
"step": 440
},
{
"epoch": 30.0,
"grad_norm": 0.6171875,
"learning_rate": 0.0002,
"loss": 0.06300061345100402,
"loss_d0": 0.06334730759263038,
"step": 450
},
{
"epoch": 30.666666666666668,
"grad_norm": 0.609375,
"learning_rate": 0.0002,
"loss": 0.05827343463897705,
"loss_d0": 0.059002993255853654,
"step": 460
},
{
"epoch": 31.333333333333332,
"grad_norm": 0.48046875,
"learning_rate": 0.0002,
"loss": 0.06440277695655823,
"loss_d0": 0.06487237587571144,
"step": 470
},
{
"epoch": 32.0,
"grad_norm": 0.73828125,
"learning_rate": 0.0002,
"loss": 0.061999541521072385,
"loss_d0": 0.06224808767437935,
"step": 480
},
{
"epoch": 32.666666666666664,
"grad_norm": 0.51171875,
"learning_rate": 0.0002,
"loss": 0.0600206196308136,
"loss_d0": 0.059911682084202764,
"step": 490
},
{
"epoch": 33.333333333333336,
"grad_norm": 0.4453125,
"learning_rate": 0.0002,
"loss": 0.06044428944587708,
"loss_d0": 0.060578780993819234,
"step": 500
},
{
"epoch": 33.333333333333336,
"eval_loss": 9.13845443725586,
"eval_runtime": 0.3444,
"eval_samples_per_second": 725.913,
"eval_steps_per_second": 72.591,
"step": 500
},
{
"epoch": 34.0,
"grad_norm": 0.56640625,
"learning_rate": 0.0002,
"loss": 0.07208179235458374,
"loss_d0": 0.07209460139274597,
"step": 510
},
{
"epoch": 34.666666666666664,
"grad_norm": 0.73046875,
"learning_rate": 0.0002,
"loss": 0.07059242129325867,
"loss_d0": 0.07045452818274497,
"step": 520
},
{
"epoch": 35.333333333333336,
"grad_norm": 0.53515625,
"learning_rate": 0.0002,
"loss": 0.07173002958297729,
"loss_d0": 0.07224260158836841,
"step": 530
},
{
"epoch": 36.0,
"grad_norm": 0.53125,
"learning_rate": 0.0002,
"loss": 0.07025443315505982,
"loss_d0": 0.07014151066541671,
"step": 540
},
{
"epoch": 36.666666666666664,
"grad_norm": 0.41796875,
"learning_rate": 0.0002,
"loss": 0.05598782300949097,
"loss_d0": 0.05618280619382858,
"step": 550
},
{
"epoch": 37.333333333333336,
"grad_norm": 1.1640625,
"learning_rate": 0.0002,
"loss": 0.06106951236724854,
"loss_d0": 0.06142581254243851,
"step": 560
},
{
"epoch": 38.0,
"grad_norm": 0.625,
"learning_rate": 0.0002,
"loss": 0.06448903679847717,
"loss_d0": 0.06502410359680652,
"step": 570
},
{
"epoch": 38.666666666666664,
"grad_norm": 0.69921875,
"learning_rate": 0.0002,
"loss": 0.055691033601760864,
"loss_d0": 0.05563758760690689,
"step": 580
},
{
"epoch": 39.333333333333336,
"grad_norm": 0.4609375,
"learning_rate": 0.0002,
"loss": 0.05428870916366577,
"loss_d0": 0.05440036803483963,
"step": 590
},
{
"epoch": 40.0,
"grad_norm": 0.4765625,
"learning_rate": 0.0002,
"loss": 0.06395597457885742,
"loss_d0": 0.06434712558984756,
"step": 600
},
{
"epoch": 40.666666666666664,
"grad_norm": 0.55078125,
"learning_rate": 0.0002,
"loss": 0.051587647199630736,
"loss_d0": 0.0515783254057169,
"step": 610
},
{
"epoch": 41.333333333333336,
"grad_norm": 0.458984375,
"learning_rate": 0.0002,
"loss": 0.054391658306121825,
"loss_d0": 0.054683629795908927,
"step": 620
},
{
"epoch": 42.0,
"grad_norm": 0.54296875,
"learning_rate": 0.0002,
"loss": 0.06491554975509643,
"loss_d0": 0.06520816497504711,
"step": 630
},
{
"epoch": 42.666666666666664,
"grad_norm": 0.57421875,
"learning_rate": 0.0002,
"loss": 0.04977795779705048,
"loss_d0": 0.05002000890672207,
"step": 640
},
{
"epoch": 43.333333333333336,
"grad_norm": 0.4609375,
"learning_rate": 0.0002,
"loss": 0.057679593563079834,
"loss_d0": 0.05779850967228413,
"step": 650
},
{
"epoch": 44.0,
"grad_norm": 0.4140625,
"learning_rate": 0.0002,
"loss": 0.0639065682888031,
"loss_d0": 0.0639431532472372,
"step": 660
},
{
"epoch": 44.666666666666664,
"grad_norm": 0.42578125,
"learning_rate": 0.0002,
"loss": 0.055676817893981934,
"loss_d0": 0.055718598142266276,
"step": 670
},
{
"epoch": 45.333333333333336,
"grad_norm": 0.439453125,
"learning_rate": 0.0002,
"loss": 0.0558148443698883,
"loss_d0": 0.056852447986602786,
"step": 680
},
{
"epoch": 46.0,
"grad_norm": 0.4140625,
"learning_rate": 0.0002,
"loss": 0.056142383813858034,
"loss_d0": 0.056708256527781484,
"step": 690
},
{
"epoch": 46.666666666666664,
"grad_norm": 0.494140625,
"learning_rate": 0.0002,
"loss": 0.06292087435722352,
"loss_d0": 0.06391938552260398,
"step": 700
},
{
"epoch": 47.333333333333336,
"grad_norm": 1.421875,
"learning_rate": 0.0002,
"loss": 0.07009355425834655,
"loss_d0": 0.07109628617763519,
"step": 710
},
{
"epoch": 48.0,
"grad_norm": 0.5,
"learning_rate": 0.0002,
"loss": 0.06265608072280884,
"loss_d0": 0.06324342675507069,
"step": 720
},
{
"epoch": 48.666666666666664,
"grad_norm": 0.51171875,
"learning_rate": 0.0002,
"loss": 0.058049452304840085,
"loss_d0": 0.05832450538873672,
"step": 730
},
{
"epoch": 49.333333333333336,
"grad_norm": 0.4296875,
"learning_rate": 0.0002,
"loss": 0.05005338191986084,
"loss_d0": 0.05029585137963295,
"step": 740
},
{
"epoch": 50.0,
"grad_norm": 0.5390625,
"learning_rate": 0.0002,
"loss": 0.05678691864013672,
"loss_d0": 0.05686194933950901,
"step": 750
},
{
"epoch": 50.666666666666664,
"grad_norm": 0.353515625,
"learning_rate": 0.0002,
"loss": 0.04778255820274353,
"loss_d0": 0.047693025320768356,
"step": 760
},
{
"epoch": 51.333333333333336,
"grad_norm": 0.3125,
"learning_rate": 0.0002,
"loss": 0.045951011776924136,
"loss_d0": 0.04612946212291717,
"step": 770
},
{
"epoch": 52.0,
"grad_norm": 0.47265625,
"learning_rate": 0.0002,
"loss": 0.05352128744125366,
"loss_d0": 0.053439998626708986,
"step": 780
},
{
"epoch": 52.666666666666664,
"grad_norm": 0.57421875,
"learning_rate": 0.0002,
"loss": 0.05216069221496582,
"loss_d0": 0.05224486216902733,
"step": 790
},
{
"epoch": 53.333333333333336,
"grad_norm": 0.396484375,
"learning_rate": 0.0002,
"loss": 0.0503743052482605,
"loss_d0": 0.050616535171866414,
"step": 800
},
{
"epoch": 54.0,
"grad_norm": 0.55859375,
"learning_rate": 0.0002,
"loss": 0.05828244090080261,
"loss_d0": 0.058245481178164485,
"step": 810
},
{
"epoch": 54.666666666666664,
"grad_norm": 0.375,
"learning_rate": 0.0002,
"loss": 0.04754224717617035,
"loss_d0": 0.0475747250020504,
"step": 820
},
{
"epoch": 55.333333333333336,
"grad_norm": 0.5546875,
"learning_rate": 0.0002,
"loss": 0.05868909358978271,
"loss_d0": 0.05892425253987312,
"step": 830
},
{
"epoch": 56.0,
"grad_norm": 0.353515625,
"learning_rate": 0.0002,
"loss": 0.051529550552368165,
"loss_d0": 0.052010980620980266,
"step": 840
},
{
"epoch": 56.666666666666664,
"grad_norm": 0.51953125,
"learning_rate": 0.0002,
"loss": 0.05249919891357422,
"loss_d0": 0.05275176502764225,
"step": 850
},
{
"epoch": 57.333333333333336,
"grad_norm": 3.71875,
"learning_rate": 0.0002,
"loss": 0.045993578433990476,
"loss_d0": 0.04613303802907467,
"step": 860
},
{
"epoch": 58.0,
"grad_norm": 0.423828125,
"learning_rate": 0.0002,
"loss": 0.048613247275352475,
"loss_d0": 0.04909844733774662,
"step": 870
},
{
"epoch": 58.666666666666664,
"grad_norm": 0.56640625,
"learning_rate": 0.0002,
"loss": 0.04930594861507416,
"loss_d0": 0.049551048502326014,
"step": 880
},
{
"epoch": 59.333333333333336,
"grad_norm": 0.37109375,
"learning_rate": 0.0002,
"loss": 0.04568036198616028,
"loss_d0": 0.045924583449959755,
"step": 890
},
{
"epoch": 60.0,
"grad_norm": 0.46484375,
"learning_rate": 0.0002,
"loss": 0.049495384097099304,
"loss_d0": 0.04955673180520535,
"step": 900
},
{
"epoch": 60.666666666666664,
"grad_norm": 0.51953125,
"learning_rate": 0.0002,
"loss": 0.04855587482452393,
"loss_d0": 0.04888010248541832,
"step": 910
},
{
"epoch": 61.333333333333336,
"grad_norm": 0.41015625,
"learning_rate": 0.0002,
"loss": 0.05594310164451599,
"loss_d0": 0.05649171769618988,
"step": 920
},
{
"epoch": 62.0,
"grad_norm": 0.392578125,
"learning_rate": 0.0002,
"loss": 0.053293424844741824,
"loss_d0": 0.05361198410391808,
"step": 930
},
{
"epoch": 62.666666666666664,
"grad_norm": 0.349609375,
"learning_rate": 0.0002,
"loss": 0.043917146325111386,
"loss_d0": 0.04403241015970707,
"step": 940
},
{
"epoch": 63.333333333333336,
"grad_norm": 0.3828125,
"learning_rate": 0.0002,
"loss": 0.05403507351875305,
"loss_d0": 0.0540801115334034,
"step": 950
},
{
"epoch": 64.0,
"grad_norm": 0.3203125,
"learning_rate": 0.0002,
"loss": 0.05340455770492554,
"loss_d0": 0.05345079451799393,
"step": 960
},
{
"epoch": 64.66666666666667,
"grad_norm": 0.32421875,
"learning_rate": 0.0002,
"loss": 0.04586577713489533,
"loss_d0": 0.045774953439831734,
"step": 970
},
{
"epoch": 65.33333333333333,
"grad_norm": 0.40234375,
"learning_rate": 0.0002,
"loss": 0.049886322021484374,
"loss_d0": 0.04972761459648609,
"step": 980
},
{
"epoch": 66.0,
"grad_norm": 0.55859375,
"learning_rate": 0.0002,
"loss": 0.05277968049049377,
"loss_d0": 0.052887840569019316,
"step": 990
},
{
"epoch": 66.66666666666667,
"grad_norm": 0.416015625,
"learning_rate": 0.0002,
"loss": 0.04409850537776947,
"loss_d0": 0.04421806111931801,
"step": 1000
},
{
"epoch": 66.66666666666667,
"eval_loss": 9.554409980773926,
"eval_runtime": 0.3424,
"eval_samples_per_second": 730.235,
"eval_steps_per_second": 73.023,
"step": 1000
},
{
"epoch": 67.33333333333333,
"grad_norm": 0.41015625,
"learning_rate": 0.0002,
"loss": 0.051329106092453,
"loss_d0": 0.05161194391548633,
"step": 1010
},
{
"epoch": 68.0,
"grad_norm": 0.4609375,
"learning_rate": 0.0002,
"loss": 0.055698972940444944,
"loss_d0": 0.05587228611111641,
"step": 1020
},
{
"epoch": 68.66666666666667,
"grad_norm": 0.4765625,
"learning_rate": 0.0002,
"loss": 0.054827362298965454,
"loss_d0": 0.05480644553899765,
"step": 1030
},
{
"epoch": 69.33333333333333,
"grad_norm": 0.498046875,
"learning_rate": 0.0002,
"loss": 0.04891992211341858,
"loss_d0": 0.049376576021313665,
"step": 1040
},
{
"epoch": 70.0,
"grad_norm": 0.478515625,
"learning_rate": 0.0002,
"loss": 0.04819425940513611,
"loss_d0": 0.048350128903985025,
"step": 1050
},
{
"epoch": 70.66666666666667,
"grad_norm": 0.365234375,
"learning_rate": 0.0002,
"loss": 0.04239584505558014,
"loss_d0": 0.04294496588408947,
"step": 1060
},
{
"epoch": 71.33333333333333,
"grad_norm": 0.283203125,
"learning_rate": 0.0002,
"loss": 0.042692375183105466,
"loss_d0": 0.04297511279582977,
"step": 1070
},
{
"epoch": 72.0,
"grad_norm": 0.35546875,
"learning_rate": 0.0002,
"loss": 0.055435746908187866,
"loss_d0": 0.05571254044771194,
"step": 1080
},
{
"epoch": 72.66666666666667,
"grad_norm": 0.439453125,
"learning_rate": 0.0002,
"loss": 0.04335896372795105,
"loss_d0": 0.04351166188716889,
"step": 1090
},
{
"epoch": 73.33333333333333,
"grad_norm": 0.451171875,
"learning_rate": 0.0002,
"loss": 0.04509307742118836,
"loss_d0": 0.044969082623720166,
"step": 1100
},
{
"epoch": 74.0,
"grad_norm": 0.37109375,
"learning_rate": 0.0002,
"loss": 0.044564899802207944,
"loss_d0": 0.04485626481473446,
"step": 1110
},
{
"epoch": 74.66666666666667,
"grad_norm": 0.54296875,
"learning_rate": 0.0002,
"loss": 0.04501199722290039,
"loss_d0": 0.04522300362586975,
"step": 1120
},
{
"epoch": 75.33333333333333,
"grad_norm": 0.439453125,
"learning_rate": 0.0002,
"loss": 0.05590890645980835,
"loss_d0": 0.0560966432094574,
"step": 1130
},
{
"epoch": 76.0,
"grad_norm": 0.458984375,
"learning_rate": 0.0002,
"loss": 0.049013379216194156,
"loss_d0": 0.049229244515299794,
"step": 1140
},
{
"epoch": 76.66666666666667,
"grad_norm": 0.328125,
"learning_rate": 0.0002,
"loss": 0.04398736655712128,
"loss_d0": 0.043927453085780145,
"step": 1150
},
{
"epoch": 77.33333333333333,
"grad_norm": 0.36328125,
"learning_rate": 0.0002,
"loss": 0.04898269176483154,
"loss_d0": 0.04949351362884045,
"step": 1160
},
{
"epoch": 78.0,
"grad_norm": 0.419921875,
"learning_rate": 0.0002,
"loss": 0.05980457663536072,
"loss_d0": 0.059818652272224423,
"step": 1170
},
{
"epoch": 78.66666666666667,
"grad_norm": 0.451171875,
"learning_rate": 0.0002,
"loss": 0.0436438798904419,
"loss_d0": 0.044009941071271895,
"step": 1180
},
{
"epoch": 79.33333333333333,
"grad_norm": 0.38671875,
"learning_rate": 0.0002,
"loss": 0.044889166951179504,
"loss_d0": 0.045293374732136724,
"step": 1190
},
{
"epoch": 80.0,
"grad_norm": 0.314453125,
"learning_rate": 0.0002,
"loss": 0.044912150502204894,
"loss_d0": 0.04536973163485527,
"step": 1200
},
{
"epoch": 80.66666666666667,
"grad_norm": 0.462890625,
"learning_rate": 0.0002,
"loss": 0.04134044647216797,
"loss_d0": 0.041844359040260314,
"step": 1210
},
{
"epoch": 81.33333333333333,
"grad_norm": 0.341796875,
"learning_rate": 0.0002,
"loss": 0.047313326597213747,
"loss_d0": 0.047366232797503474,
"step": 1220
},
{
"epoch": 82.0,
"grad_norm": 0.427734375,
"learning_rate": 0.0002,
"loss": 0.04856643080711365,
"loss_d0": 0.04906500242650509,
"step": 1230
},
{
"epoch": 82.66666666666667,
"grad_norm": 0.419921875,
"learning_rate": 0.0002,
"loss": 0.04484961330890656,
"loss_d0": 0.04493558183312416,
"step": 1240
},
{
"epoch": 83.33333333333333,
"grad_norm": 0.435546875,
"learning_rate": 0.0002,
"loss": 0.05269008278846741,
"loss_d0": 0.05286562293767929,
"step": 1250
},
{
"epoch": 84.0,
"grad_norm": 0.384765625,
"learning_rate": 0.0002,
"loss": 0.04922019243240357,
"loss_d0": 0.049464859440922736,
"step": 1260
},
{
"epoch": 84.66666666666667,
"grad_norm": 0.26953125,
"learning_rate": 0.0002,
"loss": 0.04535785913467407,
"loss_d0": 0.04530546180903912,
"step": 1270
},
{
"epoch": 85.33333333333333,
"grad_norm": 0.3359375,
"learning_rate": 0.0002,
"loss": 0.047830259799957274,
"loss_d0": 0.047826096042990686,
"step": 1280
},
{
"epoch": 86.0,
"grad_norm": 0.3984375,
"learning_rate": 0.0002,
"loss": 0.05323054194450379,
"loss_d0": 0.053975147753953935,
"step": 1290
},
{
"epoch": 86.66666666666667,
"grad_norm": 0.4765625,
"learning_rate": 0.0002,
"loss": 0.050776940584182736,
"loss_d0": 0.05129864476621151,
"step": 1300
},
{
"epoch": 87.33333333333333,
"grad_norm": 0.3984375,
"learning_rate": 0.0002,
"loss": 0.04532744288444519,
"loss_d0": 0.04567943811416626,
"step": 1310
},
{
"epoch": 88.0,
"grad_norm": 0.484375,
"learning_rate": 0.0002,
"loss": 0.06010772585868836,
"loss_d0": 0.06063029356300831,
"step": 1320
},
{
"epoch": 88.66666666666667,
"grad_norm": 0.3125,
"learning_rate": 0.0002,
"loss": 0.043328261375427245,
"loss_d0": 0.04347851127386093,
"step": 1330
},
{
"epoch": 89.33333333333333,
"grad_norm": 0.328125,
"learning_rate": 0.0002,
"loss": 0.04670845866203308,
"loss_d0": 0.04659775644540787,
"step": 1340
},
{
"epoch": 90.0,
"grad_norm": 0.52734375,
"learning_rate": 0.0002,
"loss": 0.05301305651664734,
"loss_d0": 0.05338775292038918,
"step": 1350
},
{
"epoch": 90.66666666666667,
"grad_norm": 0.341796875,
"learning_rate": 0.0002,
"loss": 0.04126462042331695,
"loss_d0": 0.04134646132588386,
"step": 1360
},
{
"epoch": 91.33333333333333,
"grad_norm": 0.3359375,
"learning_rate": 0.0002,
"loss": 0.042479926347732545,
"loss_d0": 0.042819247022271155,
"step": 1370
},
{
"epoch": 92.0,
"grad_norm": 0.39453125,
"learning_rate": 0.0002,
"loss": 0.04254147410392761,
"loss_d0": 0.04261952787637711,
"step": 1380
},
{
"epoch": 92.66666666666667,
"grad_norm": 0.515625,
"learning_rate": 0.0002,
"loss": 0.038986426591873166,
"loss_d0": 0.03929588571190834,
"step": 1390
},
{
"epoch": 93.33333333333333,
"grad_norm": 0.423828125,
"learning_rate": 0.0002,
"loss": 0.04420076608657837,
"loss_d0": 0.044338321685791014,
"step": 1400
},
{
"epoch": 94.0,
"grad_norm": 0.400390625,
"learning_rate": 0.0002,
"loss": 0.046999228000640866,
"loss_d0": 0.04723503813147545,
"step": 1410
},
{
"epoch": 94.66666666666667,
"grad_norm": 0.498046875,
"learning_rate": 0.0002,
"loss": 0.05544422864913941,
"loss_d0": 0.0563637163490057,
"step": 1420
},
{
"epoch": 95.33333333333333,
"grad_norm": 0.423828125,
"learning_rate": 0.0002,
"loss": 0.045566269755363466,
"loss_d0": 0.045789827778935435,
"step": 1430
},
{
"epoch": 96.0,
"grad_norm": 0.404296875,
"learning_rate": 0.0002,
"loss": 0.04692624509334564,
"loss_d0": 0.04704286605119705,
"step": 1440
},
{
"epoch": 96.66666666666667,
"grad_norm": 0.337890625,
"learning_rate": 0.0002,
"loss": 0.043477731943130496,
"loss_d0": 0.04375685676932335,
"step": 1450
},
{
"epoch": 97.33333333333333,
"grad_norm": 0.3515625,
"learning_rate": 0.0002,
"loss": 0.04227950870990753,
"loss_d0": 0.042465734481811526,
"step": 1460
},
{
"epoch": 98.0,
"grad_norm": 0.50390625,
"learning_rate": 0.0002,
"loss": 0.04512187242507935,
"loss_d0": 0.045345602184534074,
"step": 1470
},
{
"epoch": 98.66666666666667,
"grad_norm": 0.384765625,
"learning_rate": 0.0002,
"loss": 0.04291306138038635,
"loss_d0": 0.0432887252420187,
"step": 1480
},
{
"epoch": 99.33333333333333,
"grad_norm": 0.32421875,
"learning_rate": 0.0002,
"loss": 0.04566190540790558,
"loss_d0": 0.04579663462936878,
"step": 1490
},
{
"epoch": 100.0,
"grad_norm": 0.421875,
"learning_rate": 0.0002,
"loss": 0.04533307552337647,
"loss_d0": 0.045655245706439015,
"step": 1500
},
{
"epoch": 100.0,
"eval_loss": 9.061501502990723,
"eval_runtime": 0.3426,
"eval_samples_per_second": 729.805,
"eval_steps_per_second": 72.98,
"step": 1500
},
{
"epoch": 100.66666666666667,
"grad_norm": 0.349609375,
"learning_rate": 0.0002,
"loss": 0.04723888635635376,
"loss_d0": 0.04738225191831589,
"step": 1510
},
{
"epoch": 101.33333333333333,
"grad_norm": 0.578125,
"learning_rate": 0.0002,
"loss": 0.04693470299243927,
"loss_d0": 0.047307074815034864,
"step": 1520
},
{
"epoch": 102.0,
"grad_norm": 0.3671875,
"learning_rate": 0.0002,
"loss": 0.048088711500167844,
"loss_d0": 0.048354702070355415,
"step": 1530
},
{
"epoch": 102.66666666666667,
"grad_norm": 0.470703125,
"learning_rate": 0.0002,
"loss": 0.05237179398536682,
"loss_d0": 0.05234827287495136,
"step": 1540
},
{
"epoch": 103.33333333333333,
"grad_norm": 0.353515625,
"learning_rate": 0.0002,
"loss": 0.052333736419677736,
"loss_d0": 0.05217711813747883,
"step": 1550
},
{
"epoch": 104.0,
"grad_norm": 0.43359375,
"learning_rate": 0.0002,
"loss": 0.05047644972801209,
"loss_d0": 0.05079820305109024,
"step": 1560
},
{
"epoch": 104.66666666666667,
"grad_norm": 0.34765625,
"learning_rate": 0.0002,
"loss": 0.04338579475879669,
"loss_d0": 0.04358413964509964,
"step": 1570
},
{
"epoch": 105.33333333333333,
"grad_norm": 0.5703125,
"learning_rate": 0.0002,
"loss": 0.04220978915691376,
"loss_d0": 0.042595018073916434,
"step": 1580
},
{
"epoch": 106.0,
"grad_norm": 0.3125,
"learning_rate": 0.0002,
"loss": 0.04199954867362976,
"loss_d0": 0.04210015088319778,
"step": 1590
},
{
"epoch": 106.66666666666667,
"grad_norm": 0.5,
"learning_rate": 0.0002,
"loss": 0.04109792709350586,
"loss_d0": 0.04124586768448353,
"step": 1600
},
{
"epoch": 107.33333333333333,
"grad_norm": 0.369140625,
"learning_rate": 0.0002,
"loss": 0.04061601459980011,
"loss_d0": 0.04075535014271736,
"step": 1610
},
{
"epoch": 108.0,
"grad_norm": 0.337890625,
"learning_rate": 0.0002,
"loss": 0.04082033038139343,
"loss_d0": 0.04100315794348717,
"step": 1620
},
{
"epoch": 108.66666666666667,
"grad_norm": 0.33984375,
"learning_rate": 0.0002,
"loss": 0.04076948165893555,
"loss_d0": 0.04087142236530781,
"step": 1630
},
{
"epoch": 109.33333333333333,
"grad_norm": 0.2412109375,
"learning_rate": 0.0002,
"loss": 0.044005772471427916,
"loss_d0": 0.0444443590939045,
"step": 1640
},
{
"epoch": 110.0,
"grad_norm": 0.267578125,
"learning_rate": 0.0002,
"loss": 0.04620983600616455,
"loss_d0": 0.046199577301740645,
"step": 1650
},
{
"epoch": 110.66666666666667,
"grad_norm": 0.46484375,
"learning_rate": 0.0002,
"loss": 0.04348172545433045,
"loss_d0": 0.043485574424266815,
"step": 1660
},
{
"epoch": 111.33333333333333,
"grad_norm": 0.484375,
"learning_rate": 0.0002,
"loss": 0.0493613988161087,
"loss_d0": 0.049395665526390076,
"step": 1670
},
{
"epoch": 112.0,
"grad_norm": 0.306640625,
"learning_rate": 0.0002,
"loss": 0.048318523168563846,
"loss_d0": 0.048244457319378854,
"step": 1680
},
{
"epoch": 112.66666666666667,
"grad_norm": 0.39453125,
"learning_rate": 0.0002,
"loss": 0.0416848361492157,
"loss_d0": 0.04183990061283112,
"step": 1690
},
{
"epoch": 113.33333333333333,
"grad_norm": 0.36328125,
"learning_rate": 0.0002,
"loss": 0.042894893884658815,
"loss_d0": 0.043047336116433146,
"step": 1700
},
{
"epoch": 114.0,
"grad_norm": 0.314453125,
"learning_rate": 0.0002,
"loss": 0.04120970368385315,
"loss_d0": 0.04166660569608212,
"step": 1710
},
{
"epoch": 114.66666666666667,
"grad_norm": 0.359375,
"learning_rate": 0.0002,
"loss": 0.03811361193656922,
"loss_d0": 0.03826403059065342,
"step": 1720
},
{
"epoch": 115.33333333333333,
"grad_norm": 0.474609375,
"learning_rate": 0.0002,
"loss": 0.04223992526531219,
"loss_d0": 0.04242944307625294,
"step": 1730
},
{
"epoch": 116.0,
"grad_norm": 0.39453125,
"learning_rate": 0.0002,
"loss": 0.04587743282318115,
"loss_d0": 0.04566792957484722,
"step": 1740
},
{
"epoch": 116.66666666666667,
"grad_norm": 0.337890625,
"learning_rate": 0.0002,
"loss": 0.04407768249511719,
"loss_d0": 0.04438020028173924,
"step": 1750
},
{
"epoch": 117.33333333333333,
"grad_norm": 0.34765625,
"learning_rate": 0.0002,
"loss": 0.04488096237182617,
"loss_d0": 0.044961581379175185,
"step": 1760
},
{
"epoch": 118.0,
"grad_norm": 0.396484375,
"learning_rate": 0.0002,
"loss": 0.04814847707748413,
"loss_d0": 0.048101956397295,
"step": 1770
},
{
"epoch": 118.66666666666667,
"grad_norm": 0.412109375,
"learning_rate": 0.0002,
"loss": 0.051658463478088376,
"loss_d0": 0.052022571489214894,
"step": 1780
},
{
"epoch": 119.33333333333333,
"grad_norm": 0.283203125,
"learning_rate": 0.0002,
"loss": 0.04125940203666687,
"loss_d0": 0.04183415174484253,
"step": 1790
},
{
"epoch": 120.0,
"grad_norm": 0.93359375,
"learning_rate": 0.0002,
"loss": 0.04704998135566711,
"loss_d0": 0.04690146148204803,
"step": 1800
},
{
"epoch": 120.66666666666667,
"grad_norm": 0.447265625,
"learning_rate": 0.0002,
"loss": 0.03837161362171173,
"loss_d0": 0.038679466024041174,
"step": 1810
},
{
"epoch": 121.33333333333333,
"grad_norm": 0.26171875,
"learning_rate": 0.0002,
"loss": 0.041628694534301756,
"loss_d0": 0.04210329055786133,
"step": 1820
},
{
"epoch": 122.0,
"grad_norm": 0.5625,
"learning_rate": 0.0002,
"loss": 0.04221533536911011,
"loss_d0": 0.042480390146374704,
"step": 1830
},
{
"epoch": 122.66666666666667,
"grad_norm": 0.29296875,
"learning_rate": 0.0002,
"loss": 0.043410655856132505,
"loss_d0": 0.043429945781826976,
"step": 1840
},
{
"epoch": 123.33333333333333,
"grad_norm": 0.44140625,
"learning_rate": 0.0002,
"loss": 0.041653552651405336,
"loss_d0": 0.04193488694727421,
"step": 1850
},
{
"epoch": 124.0,
"grad_norm": 0.2890625,
"learning_rate": 0.0002,
"loss": 0.0399824857711792,
"loss_d0": 0.04024950861930847,
"step": 1860
},
{
"epoch": 124.66666666666667,
"grad_norm": 0.36328125,
"learning_rate": 0.0002,
"loss": 0.04130673706531525,
"loss_d0": 0.04133395403623581,
"step": 1870
},
{
"epoch": 125.33333333333333,
"grad_norm": 0.3125,
"learning_rate": 0.0002,
"loss": 0.039680573344230655,
"loss_d0": 0.040023022517561915,
"step": 1880
},
{
"epoch": 126.0,
"grad_norm": 0.412109375,
"learning_rate": 0.0002,
"loss": 0.04459331929683685,
"loss_d0": 0.044731929898262024,
"step": 1890
},
{
"epoch": 126.66666666666667,
"grad_norm": 0.52734375,
"learning_rate": 0.0002,
"loss": 0.03877157270908356,
"loss_d0": 0.03899230137467384,
"step": 1900
},
{
"epoch": 127.33333333333333,
"grad_norm": 0.40625,
"learning_rate": 0.0002,
"loss": 0.04177733063697815,
"loss_d0": 0.04159155897796154,
"step": 1910
},
{
"epoch": 128.0,
"grad_norm": 0.318359375,
"learning_rate": 0.0002,
"loss": 0.039029103517532346,
"loss_d0": 0.039202263578772545,
"step": 1920
},
{
"epoch": 128.66666666666666,
"grad_norm": 0.33203125,
"learning_rate": 0.0002,
"loss": 0.03842213749885559,
"loss_d0": 0.0387143149971962,
"step": 1930
},
{
"epoch": 129.33333333333334,
"grad_norm": 0.70703125,
"learning_rate": 0.0002,
"loss": 0.04641495645046234,
"loss_d0": 0.0463741198182106,
"step": 1940
},
{
"epoch": 130.0,
"grad_norm": 0.37109375,
"learning_rate": 0.0002,
"loss": 0.04674426913261413,
"loss_d0": 0.04691287837922573,
"step": 1950
},
{
"epoch": 130.66666666666666,
"grad_norm": 0.458984375,
"learning_rate": 0.0002,
"loss": 0.0411600261926651,
"loss_d0": 0.04125998429954052,
"step": 1960
},
{
"epoch": 131.33333333333334,
"grad_norm": 0.21484375,
"learning_rate": 0.0002,
"loss": 0.04273697435855865,
"loss_d0": 0.04304400980472565,
"step": 1970
},
{
"epoch": 132.0,
"grad_norm": 0.36328125,
"learning_rate": 0.0002,
"loss": 0.04320941269397736,
"loss_d0": 0.04327214397490024,
"step": 1980
},
{
"epoch": 132.66666666666666,
"grad_norm": 0.33984375,
"learning_rate": 0.0002,
"loss": 0.038457101583480834,
"loss_d0": 0.03848358802497387,
"step": 1990
},
{
"epoch": 133.33333333333334,
"grad_norm": 0.33203125,
"learning_rate": 0.0002,
"loss": 0.04049345552921295,
"loss_d0": 0.04078166633844375,
"step": 2000
},
{
"epoch": 133.33333333333334,
"eval_loss": 9.509454727172852,
"eval_runtime": 0.3426,
"eval_samples_per_second": 729.644,
"eval_steps_per_second": 72.964,
"step": 2000
}
],
"logging_steps": 10,
"max_steps": 4500,
"num_input_tokens_seen": 0,
"num_train_epochs": 300,
"save_steps": 1000,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 2.630938952269824e+16,
"train_batch_size": 10,
"trial_name": null,
"trial_params": null
}