{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 133.33333333333334, "eval_steps": 500, "global_step": 2000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.6666666666666666, "grad_norm": 8.4375, "learning_rate": 1.8e-05, "loss": 2.421918487548828, "loss_d0": 2.4261313915252685, "step": 10 }, { "epoch": 1.3333333333333333, "grad_norm": 4.46875, "learning_rate": 3.8e-05, "loss": 1.0088010787963868, "loss_d0": 1.0096346318721772, "step": 20 }, { "epoch": 2.0, "grad_norm": 3.46875, "learning_rate": 5.8e-05, "loss": 0.6839343547821045, "loss_d0": 0.6862720727920533, "step": 30 }, { "epoch": 2.6666666666666665, "grad_norm": 2.6875, "learning_rate": 7.800000000000001e-05, "loss": 0.5316455841064454, "loss_d0": 0.5327951699495316, "step": 40 }, { "epoch": 3.3333333333333335, "grad_norm": 2.578125, "learning_rate": 9.8e-05, "loss": 0.4549861907958984, "loss_d0": 0.45541533529758454, "step": 50 }, { "epoch": 4.0, "grad_norm": 2.859375, "learning_rate": 0.000118, "loss": 0.44201197624206545, "loss_d0": 0.4438814163208008, "step": 60 }, { "epoch": 4.666666666666667, "grad_norm": 2.390625, "learning_rate": 0.000138, "loss": 0.37986207008361816, "loss_d0": 0.3805710881948471, "step": 70 }, { "epoch": 5.333333333333333, "grad_norm": 2.265625, "learning_rate": 0.00015800000000000002, "loss": 0.34696829319000244, "loss_d0": 0.34865956008434296, "step": 80 }, { "epoch": 6.0, "grad_norm": 2.40625, "learning_rate": 0.00017800000000000002, "loss": 0.317075777053833, "loss_d0": 0.3180476576089859, "step": 90 }, { "epoch": 6.666666666666667, "grad_norm": 3.140625, "learning_rate": 0.00019800000000000002, "loss": 0.2434556484222412, "loss_d0": 0.24281310737133027, "step": 100 }, { "epoch": 7.333333333333333, "grad_norm": 1.5546875, "learning_rate": 0.0002, "loss": 0.2385166883468628, "loss_d0": 0.23866758197546006, "step": 110 }, { "epoch": 8.0, "grad_norm": 1.640625, "learning_rate": 0.0002, "loss": 0.2383056879043579, "loss_d0": 0.23965298384428024, "step": 120 }, { "epoch": 8.666666666666666, "grad_norm": 1.2421875, "learning_rate": 0.0002, "loss": 0.18352937698364258, "loss_d0": 0.18375806659460067, "step": 130 }, { "epoch": 9.333333333333334, "grad_norm": 1.4453125, "learning_rate": 0.0002, "loss": 0.17268719673156738, "loss_d0": 0.17244660705327988, "step": 140 }, { "epoch": 10.0, "grad_norm": 1.234375, "learning_rate": 0.0002, "loss": 0.16329215764999389, "loss_d0": 0.16274539306759833, "step": 150 }, { "epoch": 10.666666666666666, "grad_norm": 0.9453125, "learning_rate": 0.0002, "loss": 0.1369275689125061, "loss_d0": 0.13629038035869598, "step": 160 }, { "epoch": 11.333333333333334, "grad_norm": 1.265625, "learning_rate": 0.0002, "loss": 0.1421137571334839, "loss_d0": 0.14217186272144317, "step": 170 }, { "epoch": 12.0, "grad_norm": 0.9375, "learning_rate": 0.0002, "loss": 0.12057076692581177, "loss_d0": 0.12064153775572777, "step": 180 }, { "epoch": 12.666666666666666, "grad_norm": 0.85546875, "learning_rate": 0.0002, "loss": 0.10163921117782593, "loss_d0": 0.10211396664381027, "step": 190 }, { "epoch": 13.333333333333334, "grad_norm": 0.7578125, "learning_rate": 0.0002, "loss": 0.10858856439590454, "loss_d0": 0.10898089408874512, "step": 200 }, { "epoch": 14.0, "grad_norm": 0.81640625, "learning_rate": 0.0002, "loss": 0.10204042196273803, "loss_d0": 0.10232478231191636, "step": 210 }, { "epoch": 14.666666666666666, "grad_norm": 0.74609375, "learning_rate": 0.0002, "loss": 0.10013020038604736, "loss_d0": 0.09980085715651513, "step": 220 }, { "epoch": 15.333333333333334, "grad_norm": 0.8046875, "learning_rate": 0.0002, "loss": 0.0953938364982605, "loss_d0": 0.09604288935661316, "step": 230 }, { "epoch": 16.0, "grad_norm": 0.921875, "learning_rate": 0.0002, "loss": 0.1123003602027893, "loss_d0": 0.11246004849672317, "step": 240 }, { "epoch": 16.666666666666668, "grad_norm": 0.6640625, "learning_rate": 0.0002, "loss": 0.08821422457695008, "loss_d0": 0.0882071614265442, "step": 250 }, { "epoch": 17.333333333333332, "grad_norm": 0.6484375, "learning_rate": 0.0002, "loss": 0.09300093650817871, "loss_d0": 0.09352065548300743, "step": 260 }, { "epoch": 18.0, "grad_norm": 1.4296875, "learning_rate": 0.0002, "loss": 0.10097719430923462, "loss_d0": 0.10090216547250748, "step": 270 }, { "epoch": 18.666666666666668, "grad_norm": 0.65234375, "learning_rate": 0.0002, "loss": 0.08017570972442627, "loss_d0": 0.08063347972929477, "step": 280 }, { "epoch": 19.333333333333332, "grad_norm": 0.78125, "learning_rate": 0.0002, "loss": 0.10115858316421508, "loss_d0": 0.10044149123132229, "step": 290 }, { "epoch": 20.0, "grad_norm": 0.66796875, "learning_rate": 0.0002, "loss": 0.08694071173667908, "loss_d0": 0.08698893040418625, "step": 300 }, { "epoch": 20.666666666666668, "grad_norm": 0.69921875, "learning_rate": 0.0002, "loss": 0.07665915489196777, "loss_d0": 0.07681619115173817, "step": 310 }, { "epoch": 21.333333333333332, "grad_norm": 0.490234375, "learning_rate": 0.0002, "loss": 0.07436910271644592, "loss_d0": 0.07468437291681766, "step": 320 }, { "epoch": 22.0, "grad_norm": 0.65234375, "learning_rate": 0.0002, "loss": 0.07695708870887756, "loss_d0": 0.07751730270683765, "step": 330 }, { "epoch": 22.666666666666668, "grad_norm": 0.7109375, "learning_rate": 0.0002, "loss": 0.0652268648147583, "loss_d0": 0.06546519137918949, "step": 340 }, { "epoch": 23.333333333333332, "grad_norm": 0.5546875, "learning_rate": 0.0002, "loss": 0.08022255301475525, "loss_d0": 0.08006507605314254, "step": 350 }, { "epoch": 24.0, "grad_norm": 0.60546875, "learning_rate": 0.0002, "loss": 0.07555531263351441, "loss_d0": 0.07582116462290286, "step": 360 }, { "epoch": 24.666666666666668, "grad_norm": 0.49609375, "learning_rate": 0.0002, "loss": 0.07231236100196839, "loss_d0": 0.07194333672523498, "step": 370 }, { "epoch": 25.333333333333332, "grad_norm": 0.953125, "learning_rate": 0.0002, "loss": 0.07199368476867676, "loss_d0": 0.07204384617507457, "step": 380 }, { "epoch": 26.0, "grad_norm": 0.80078125, "learning_rate": 0.0002, "loss": 0.07506105303764343, "loss_d0": 0.07531274408102036, "step": 390 }, { "epoch": 26.666666666666668, "grad_norm": 0.5078125, "learning_rate": 0.0002, "loss": 0.07074097394943238, "loss_d0": 0.0710180252790451, "step": 400 }, { "epoch": 27.333333333333332, "grad_norm": 0.50390625, "learning_rate": 0.0002, "loss": 0.06964531540870667, "loss_d0": 0.06979148238897323, "step": 410 }, { "epoch": 28.0, "grad_norm": 0.80078125, "learning_rate": 0.0002, "loss": 0.07868674993515015, "loss_d0": 0.0794119793921709, "step": 420 }, { "epoch": 28.666666666666668, "grad_norm": 0.5390625, "learning_rate": 0.0002, "loss": 0.06261486411094666, "loss_d0": 0.06317082270979882, "step": 430 }, { "epoch": 29.333333333333332, "grad_norm": 0.458984375, "learning_rate": 0.0002, "loss": 0.0674104392528534, "loss_d0": 0.0678918220102787, "step": 440 }, { "epoch": 30.0, "grad_norm": 0.6171875, "learning_rate": 0.0002, "loss": 0.06300061345100402, "loss_d0": 0.06334730759263038, "step": 450 }, { "epoch": 30.666666666666668, "grad_norm": 0.609375, "learning_rate": 0.0002, "loss": 0.05827343463897705, "loss_d0": 0.059002993255853654, "step": 460 }, { "epoch": 31.333333333333332, "grad_norm": 0.48046875, "learning_rate": 0.0002, "loss": 0.06440277695655823, "loss_d0": 0.06487237587571144, "step": 470 }, { "epoch": 32.0, "grad_norm": 0.73828125, "learning_rate": 0.0002, "loss": 0.061999541521072385, "loss_d0": 0.06224808767437935, "step": 480 }, { "epoch": 32.666666666666664, "grad_norm": 0.51171875, "learning_rate": 0.0002, "loss": 0.0600206196308136, "loss_d0": 0.059911682084202764, "step": 490 }, { "epoch": 33.333333333333336, "grad_norm": 0.4453125, "learning_rate": 0.0002, "loss": 0.06044428944587708, "loss_d0": 0.060578780993819234, "step": 500 }, { "epoch": 33.333333333333336, "eval_loss": 9.13845443725586, "eval_runtime": 0.3444, "eval_samples_per_second": 725.913, "eval_steps_per_second": 72.591, "step": 500 }, { "epoch": 34.0, "grad_norm": 0.56640625, "learning_rate": 0.0002, "loss": 0.07208179235458374, "loss_d0": 0.07209460139274597, "step": 510 }, { "epoch": 34.666666666666664, "grad_norm": 0.73046875, "learning_rate": 0.0002, "loss": 0.07059242129325867, "loss_d0": 0.07045452818274497, "step": 520 }, { "epoch": 35.333333333333336, "grad_norm": 0.53515625, "learning_rate": 0.0002, "loss": 0.07173002958297729, "loss_d0": 0.07224260158836841, "step": 530 }, { "epoch": 36.0, "grad_norm": 0.53125, "learning_rate": 0.0002, "loss": 0.07025443315505982, "loss_d0": 0.07014151066541671, "step": 540 }, { "epoch": 36.666666666666664, "grad_norm": 0.41796875, "learning_rate": 0.0002, "loss": 0.05598782300949097, "loss_d0": 0.05618280619382858, "step": 550 }, { "epoch": 37.333333333333336, "grad_norm": 1.1640625, "learning_rate": 0.0002, "loss": 0.06106951236724854, "loss_d0": 0.06142581254243851, "step": 560 }, { "epoch": 38.0, "grad_norm": 0.625, "learning_rate": 0.0002, "loss": 0.06448903679847717, "loss_d0": 0.06502410359680652, "step": 570 }, { "epoch": 38.666666666666664, "grad_norm": 0.69921875, "learning_rate": 0.0002, "loss": 0.055691033601760864, "loss_d0": 0.05563758760690689, "step": 580 }, { "epoch": 39.333333333333336, "grad_norm": 0.4609375, "learning_rate": 0.0002, "loss": 0.05428870916366577, "loss_d0": 0.05440036803483963, "step": 590 }, { "epoch": 40.0, "grad_norm": 0.4765625, "learning_rate": 0.0002, "loss": 0.06395597457885742, "loss_d0": 0.06434712558984756, "step": 600 }, { "epoch": 40.666666666666664, "grad_norm": 0.55078125, "learning_rate": 0.0002, "loss": 0.051587647199630736, "loss_d0": 0.0515783254057169, "step": 610 }, { "epoch": 41.333333333333336, "grad_norm": 0.458984375, "learning_rate": 0.0002, "loss": 0.054391658306121825, "loss_d0": 0.054683629795908927, "step": 620 }, { "epoch": 42.0, "grad_norm": 0.54296875, "learning_rate": 0.0002, "loss": 0.06491554975509643, "loss_d0": 0.06520816497504711, "step": 630 }, { "epoch": 42.666666666666664, "grad_norm": 0.57421875, "learning_rate": 0.0002, "loss": 0.04977795779705048, "loss_d0": 0.05002000890672207, "step": 640 }, { "epoch": 43.333333333333336, "grad_norm": 0.4609375, "learning_rate": 0.0002, "loss": 0.057679593563079834, "loss_d0": 0.05779850967228413, "step": 650 }, { "epoch": 44.0, "grad_norm": 0.4140625, "learning_rate": 0.0002, "loss": 0.0639065682888031, "loss_d0": 0.0639431532472372, "step": 660 }, { "epoch": 44.666666666666664, "grad_norm": 0.42578125, "learning_rate": 0.0002, "loss": 0.055676817893981934, "loss_d0": 0.055718598142266276, "step": 670 }, { "epoch": 45.333333333333336, "grad_norm": 0.439453125, "learning_rate": 0.0002, "loss": 0.0558148443698883, "loss_d0": 0.056852447986602786, "step": 680 }, { "epoch": 46.0, "grad_norm": 0.4140625, "learning_rate": 0.0002, "loss": 0.056142383813858034, "loss_d0": 0.056708256527781484, "step": 690 }, { "epoch": 46.666666666666664, "grad_norm": 0.494140625, "learning_rate": 0.0002, "loss": 0.06292087435722352, "loss_d0": 0.06391938552260398, "step": 700 }, { "epoch": 47.333333333333336, "grad_norm": 1.421875, "learning_rate": 0.0002, "loss": 0.07009355425834655, "loss_d0": 0.07109628617763519, "step": 710 }, { "epoch": 48.0, "grad_norm": 0.5, "learning_rate": 0.0002, "loss": 0.06265608072280884, "loss_d0": 0.06324342675507069, "step": 720 }, { "epoch": 48.666666666666664, "grad_norm": 0.51171875, "learning_rate": 0.0002, "loss": 0.058049452304840085, "loss_d0": 0.05832450538873672, "step": 730 }, { "epoch": 49.333333333333336, "grad_norm": 0.4296875, "learning_rate": 0.0002, "loss": 0.05005338191986084, "loss_d0": 0.05029585137963295, "step": 740 }, { "epoch": 50.0, "grad_norm": 0.5390625, "learning_rate": 0.0002, "loss": 0.05678691864013672, "loss_d0": 0.05686194933950901, "step": 750 }, { "epoch": 50.666666666666664, "grad_norm": 0.353515625, "learning_rate": 0.0002, "loss": 0.04778255820274353, "loss_d0": 0.047693025320768356, "step": 760 }, { "epoch": 51.333333333333336, "grad_norm": 0.3125, "learning_rate": 0.0002, "loss": 0.045951011776924136, "loss_d0": 0.04612946212291717, "step": 770 }, { "epoch": 52.0, "grad_norm": 0.47265625, "learning_rate": 0.0002, "loss": 0.05352128744125366, "loss_d0": 0.053439998626708986, "step": 780 }, { "epoch": 52.666666666666664, "grad_norm": 0.57421875, "learning_rate": 0.0002, "loss": 0.05216069221496582, "loss_d0": 0.05224486216902733, "step": 790 }, { "epoch": 53.333333333333336, "grad_norm": 0.396484375, "learning_rate": 0.0002, "loss": 0.0503743052482605, "loss_d0": 0.050616535171866414, "step": 800 }, { "epoch": 54.0, "grad_norm": 0.55859375, "learning_rate": 0.0002, "loss": 0.05828244090080261, "loss_d0": 0.058245481178164485, "step": 810 }, { "epoch": 54.666666666666664, "grad_norm": 0.375, "learning_rate": 0.0002, "loss": 0.04754224717617035, "loss_d0": 0.0475747250020504, "step": 820 }, { "epoch": 55.333333333333336, "grad_norm": 0.5546875, "learning_rate": 0.0002, "loss": 0.05868909358978271, "loss_d0": 0.05892425253987312, "step": 830 }, { "epoch": 56.0, "grad_norm": 0.353515625, "learning_rate": 0.0002, "loss": 0.051529550552368165, "loss_d0": 0.052010980620980266, "step": 840 }, { "epoch": 56.666666666666664, "grad_norm": 0.51953125, "learning_rate": 0.0002, "loss": 0.05249919891357422, "loss_d0": 0.05275176502764225, "step": 850 }, { "epoch": 57.333333333333336, "grad_norm": 3.71875, "learning_rate": 0.0002, "loss": 0.045993578433990476, "loss_d0": 0.04613303802907467, "step": 860 }, { "epoch": 58.0, "grad_norm": 0.423828125, "learning_rate": 0.0002, "loss": 0.048613247275352475, "loss_d0": 0.04909844733774662, "step": 870 }, { "epoch": 58.666666666666664, "grad_norm": 0.56640625, "learning_rate": 0.0002, "loss": 0.04930594861507416, "loss_d0": 0.049551048502326014, "step": 880 }, { "epoch": 59.333333333333336, "grad_norm": 0.37109375, "learning_rate": 0.0002, "loss": 0.04568036198616028, "loss_d0": 0.045924583449959755, "step": 890 }, { "epoch": 60.0, "grad_norm": 0.46484375, "learning_rate": 0.0002, "loss": 0.049495384097099304, "loss_d0": 0.04955673180520535, "step": 900 }, { "epoch": 60.666666666666664, "grad_norm": 0.51953125, "learning_rate": 0.0002, "loss": 0.04855587482452393, "loss_d0": 0.04888010248541832, "step": 910 }, { "epoch": 61.333333333333336, "grad_norm": 0.41015625, "learning_rate": 0.0002, "loss": 0.05594310164451599, "loss_d0": 0.05649171769618988, "step": 920 }, { "epoch": 62.0, "grad_norm": 0.392578125, "learning_rate": 0.0002, "loss": 0.053293424844741824, "loss_d0": 0.05361198410391808, "step": 930 }, { "epoch": 62.666666666666664, "grad_norm": 0.349609375, "learning_rate": 0.0002, "loss": 0.043917146325111386, "loss_d0": 0.04403241015970707, "step": 940 }, { "epoch": 63.333333333333336, "grad_norm": 0.3828125, "learning_rate": 0.0002, "loss": 0.05403507351875305, "loss_d0": 0.0540801115334034, "step": 950 }, { "epoch": 64.0, "grad_norm": 0.3203125, "learning_rate": 0.0002, "loss": 0.05340455770492554, "loss_d0": 0.05345079451799393, "step": 960 }, { "epoch": 64.66666666666667, "grad_norm": 0.32421875, "learning_rate": 0.0002, "loss": 0.04586577713489533, "loss_d0": 0.045774953439831734, "step": 970 }, { "epoch": 65.33333333333333, "grad_norm": 0.40234375, "learning_rate": 0.0002, "loss": 0.049886322021484374, "loss_d0": 0.04972761459648609, "step": 980 }, { "epoch": 66.0, "grad_norm": 0.55859375, "learning_rate": 0.0002, "loss": 0.05277968049049377, "loss_d0": 0.052887840569019316, "step": 990 }, { "epoch": 66.66666666666667, "grad_norm": 0.416015625, "learning_rate": 0.0002, "loss": 0.04409850537776947, "loss_d0": 0.04421806111931801, "step": 1000 }, { "epoch": 66.66666666666667, "eval_loss": 9.554409980773926, "eval_runtime": 0.3424, "eval_samples_per_second": 730.235, "eval_steps_per_second": 73.023, "step": 1000 }, { "epoch": 67.33333333333333, "grad_norm": 0.41015625, "learning_rate": 0.0002, "loss": 0.051329106092453, "loss_d0": 0.05161194391548633, "step": 1010 }, { "epoch": 68.0, "grad_norm": 0.4609375, "learning_rate": 0.0002, "loss": 0.055698972940444944, "loss_d0": 0.05587228611111641, "step": 1020 }, { "epoch": 68.66666666666667, "grad_norm": 0.4765625, "learning_rate": 0.0002, "loss": 0.054827362298965454, "loss_d0": 0.05480644553899765, "step": 1030 }, { "epoch": 69.33333333333333, "grad_norm": 0.498046875, "learning_rate": 0.0002, "loss": 0.04891992211341858, "loss_d0": 0.049376576021313665, "step": 1040 }, { "epoch": 70.0, "grad_norm": 0.478515625, "learning_rate": 0.0002, "loss": 0.04819425940513611, "loss_d0": 0.048350128903985025, "step": 1050 }, { "epoch": 70.66666666666667, "grad_norm": 0.365234375, "learning_rate": 0.0002, "loss": 0.04239584505558014, "loss_d0": 0.04294496588408947, "step": 1060 }, { "epoch": 71.33333333333333, "grad_norm": 0.283203125, "learning_rate": 0.0002, "loss": 0.042692375183105466, "loss_d0": 0.04297511279582977, "step": 1070 }, { "epoch": 72.0, "grad_norm": 0.35546875, "learning_rate": 0.0002, "loss": 0.055435746908187866, "loss_d0": 0.05571254044771194, "step": 1080 }, { "epoch": 72.66666666666667, "grad_norm": 0.439453125, "learning_rate": 0.0002, "loss": 0.04335896372795105, "loss_d0": 0.04351166188716889, "step": 1090 }, { "epoch": 73.33333333333333, "grad_norm": 0.451171875, "learning_rate": 0.0002, "loss": 0.04509307742118836, "loss_d0": 0.044969082623720166, "step": 1100 }, { "epoch": 74.0, "grad_norm": 0.37109375, "learning_rate": 0.0002, "loss": 0.044564899802207944, "loss_d0": 0.04485626481473446, "step": 1110 }, { "epoch": 74.66666666666667, "grad_norm": 0.54296875, "learning_rate": 0.0002, "loss": 0.04501199722290039, "loss_d0": 0.04522300362586975, "step": 1120 }, { "epoch": 75.33333333333333, "grad_norm": 0.439453125, "learning_rate": 0.0002, "loss": 0.05590890645980835, "loss_d0": 0.0560966432094574, "step": 1130 }, { "epoch": 76.0, "grad_norm": 0.458984375, "learning_rate": 0.0002, "loss": 0.049013379216194156, "loss_d0": 0.049229244515299794, "step": 1140 }, { "epoch": 76.66666666666667, "grad_norm": 0.328125, "learning_rate": 0.0002, "loss": 0.04398736655712128, "loss_d0": 0.043927453085780145, "step": 1150 }, { "epoch": 77.33333333333333, "grad_norm": 0.36328125, "learning_rate": 0.0002, "loss": 0.04898269176483154, "loss_d0": 0.04949351362884045, "step": 1160 }, { "epoch": 78.0, "grad_norm": 0.419921875, "learning_rate": 0.0002, "loss": 0.05980457663536072, "loss_d0": 0.059818652272224423, "step": 1170 }, { "epoch": 78.66666666666667, "grad_norm": 0.451171875, "learning_rate": 0.0002, "loss": 0.0436438798904419, "loss_d0": 0.044009941071271895, "step": 1180 }, { "epoch": 79.33333333333333, "grad_norm": 0.38671875, "learning_rate": 0.0002, "loss": 0.044889166951179504, "loss_d0": 0.045293374732136724, "step": 1190 }, { "epoch": 80.0, "grad_norm": 0.314453125, "learning_rate": 0.0002, "loss": 0.044912150502204894, "loss_d0": 0.04536973163485527, "step": 1200 }, { "epoch": 80.66666666666667, "grad_norm": 0.462890625, "learning_rate": 0.0002, "loss": 0.04134044647216797, "loss_d0": 0.041844359040260314, "step": 1210 }, { "epoch": 81.33333333333333, "grad_norm": 0.341796875, "learning_rate": 0.0002, "loss": 0.047313326597213747, "loss_d0": 0.047366232797503474, "step": 1220 }, { "epoch": 82.0, "grad_norm": 0.427734375, "learning_rate": 0.0002, "loss": 0.04856643080711365, "loss_d0": 0.04906500242650509, "step": 1230 }, { "epoch": 82.66666666666667, "grad_norm": 0.419921875, "learning_rate": 0.0002, "loss": 0.04484961330890656, "loss_d0": 0.04493558183312416, "step": 1240 }, { "epoch": 83.33333333333333, "grad_norm": 0.435546875, "learning_rate": 0.0002, "loss": 0.05269008278846741, "loss_d0": 0.05286562293767929, "step": 1250 }, { "epoch": 84.0, "grad_norm": 0.384765625, "learning_rate": 0.0002, "loss": 0.04922019243240357, "loss_d0": 0.049464859440922736, "step": 1260 }, { "epoch": 84.66666666666667, "grad_norm": 0.26953125, "learning_rate": 0.0002, "loss": 0.04535785913467407, "loss_d0": 0.04530546180903912, "step": 1270 }, { "epoch": 85.33333333333333, "grad_norm": 0.3359375, "learning_rate": 0.0002, "loss": 0.047830259799957274, "loss_d0": 0.047826096042990686, "step": 1280 }, { "epoch": 86.0, "grad_norm": 0.3984375, "learning_rate": 0.0002, "loss": 0.05323054194450379, "loss_d0": 0.053975147753953935, "step": 1290 }, { "epoch": 86.66666666666667, "grad_norm": 0.4765625, "learning_rate": 0.0002, "loss": 0.050776940584182736, "loss_d0": 0.05129864476621151, "step": 1300 }, { "epoch": 87.33333333333333, "grad_norm": 0.3984375, "learning_rate": 0.0002, "loss": 0.04532744288444519, "loss_d0": 0.04567943811416626, "step": 1310 }, { "epoch": 88.0, "grad_norm": 0.484375, "learning_rate": 0.0002, "loss": 0.06010772585868836, "loss_d0": 0.06063029356300831, "step": 1320 }, { "epoch": 88.66666666666667, "grad_norm": 0.3125, "learning_rate": 0.0002, "loss": 0.043328261375427245, "loss_d0": 0.04347851127386093, "step": 1330 }, { "epoch": 89.33333333333333, "grad_norm": 0.328125, "learning_rate": 0.0002, "loss": 0.04670845866203308, "loss_d0": 0.04659775644540787, "step": 1340 }, { "epoch": 90.0, "grad_norm": 0.52734375, "learning_rate": 0.0002, "loss": 0.05301305651664734, "loss_d0": 0.05338775292038918, "step": 1350 }, { "epoch": 90.66666666666667, "grad_norm": 0.341796875, "learning_rate": 0.0002, "loss": 0.04126462042331695, "loss_d0": 0.04134646132588386, "step": 1360 }, { "epoch": 91.33333333333333, "grad_norm": 0.3359375, "learning_rate": 0.0002, "loss": 0.042479926347732545, "loss_d0": 0.042819247022271155, "step": 1370 }, { "epoch": 92.0, "grad_norm": 0.39453125, "learning_rate": 0.0002, "loss": 0.04254147410392761, "loss_d0": 0.04261952787637711, "step": 1380 }, { "epoch": 92.66666666666667, "grad_norm": 0.515625, "learning_rate": 0.0002, "loss": 0.038986426591873166, "loss_d0": 0.03929588571190834, "step": 1390 }, { "epoch": 93.33333333333333, "grad_norm": 0.423828125, "learning_rate": 0.0002, "loss": 0.04420076608657837, "loss_d0": 0.044338321685791014, "step": 1400 }, { "epoch": 94.0, "grad_norm": 0.400390625, "learning_rate": 0.0002, "loss": 0.046999228000640866, "loss_d0": 0.04723503813147545, "step": 1410 }, { "epoch": 94.66666666666667, "grad_norm": 0.498046875, "learning_rate": 0.0002, "loss": 0.05544422864913941, "loss_d0": 0.0563637163490057, "step": 1420 }, { "epoch": 95.33333333333333, "grad_norm": 0.423828125, "learning_rate": 0.0002, "loss": 0.045566269755363466, "loss_d0": 0.045789827778935435, "step": 1430 }, { "epoch": 96.0, "grad_norm": 0.404296875, "learning_rate": 0.0002, "loss": 0.04692624509334564, "loss_d0": 0.04704286605119705, "step": 1440 }, { "epoch": 96.66666666666667, "grad_norm": 0.337890625, "learning_rate": 0.0002, "loss": 0.043477731943130496, "loss_d0": 0.04375685676932335, "step": 1450 }, { "epoch": 97.33333333333333, "grad_norm": 0.3515625, "learning_rate": 0.0002, "loss": 0.04227950870990753, "loss_d0": 0.042465734481811526, "step": 1460 }, { "epoch": 98.0, "grad_norm": 0.50390625, "learning_rate": 0.0002, "loss": 0.04512187242507935, "loss_d0": 0.045345602184534074, "step": 1470 }, { "epoch": 98.66666666666667, "grad_norm": 0.384765625, "learning_rate": 0.0002, "loss": 0.04291306138038635, "loss_d0": 0.0432887252420187, "step": 1480 }, { "epoch": 99.33333333333333, "grad_norm": 0.32421875, "learning_rate": 0.0002, "loss": 0.04566190540790558, "loss_d0": 0.04579663462936878, "step": 1490 }, { "epoch": 100.0, "grad_norm": 0.421875, "learning_rate": 0.0002, "loss": 0.04533307552337647, "loss_d0": 0.045655245706439015, "step": 1500 }, { "epoch": 100.0, "eval_loss": 9.061501502990723, "eval_runtime": 0.3426, "eval_samples_per_second": 729.805, "eval_steps_per_second": 72.98, "step": 1500 }, { "epoch": 100.66666666666667, "grad_norm": 0.349609375, "learning_rate": 0.0002, "loss": 0.04723888635635376, "loss_d0": 0.04738225191831589, "step": 1510 }, { "epoch": 101.33333333333333, "grad_norm": 0.578125, "learning_rate": 0.0002, "loss": 0.04693470299243927, "loss_d0": 0.047307074815034864, "step": 1520 }, { "epoch": 102.0, "grad_norm": 0.3671875, "learning_rate": 0.0002, "loss": 0.048088711500167844, "loss_d0": 0.048354702070355415, "step": 1530 }, { "epoch": 102.66666666666667, "grad_norm": 0.470703125, "learning_rate": 0.0002, "loss": 0.05237179398536682, "loss_d0": 0.05234827287495136, "step": 1540 }, { "epoch": 103.33333333333333, "grad_norm": 0.353515625, "learning_rate": 0.0002, "loss": 0.052333736419677736, "loss_d0": 0.05217711813747883, "step": 1550 }, { "epoch": 104.0, "grad_norm": 0.43359375, "learning_rate": 0.0002, "loss": 0.05047644972801209, "loss_d0": 0.05079820305109024, "step": 1560 }, { "epoch": 104.66666666666667, "grad_norm": 0.34765625, "learning_rate": 0.0002, "loss": 0.04338579475879669, "loss_d0": 0.04358413964509964, "step": 1570 }, { "epoch": 105.33333333333333, "grad_norm": 0.5703125, "learning_rate": 0.0002, "loss": 0.04220978915691376, "loss_d0": 0.042595018073916434, "step": 1580 }, { "epoch": 106.0, "grad_norm": 0.3125, "learning_rate": 0.0002, "loss": 0.04199954867362976, "loss_d0": 0.04210015088319778, "step": 1590 }, { "epoch": 106.66666666666667, "grad_norm": 0.5, "learning_rate": 0.0002, "loss": 0.04109792709350586, "loss_d0": 0.04124586768448353, "step": 1600 }, { "epoch": 107.33333333333333, "grad_norm": 0.369140625, "learning_rate": 0.0002, "loss": 0.04061601459980011, "loss_d0": 0.04075535014271736, "step": 1610 }, { "epoch": 108.0, "grad_norm": 0.337890625, "learning_rate": 0.0002, "loss": 0.04082033038139343, "loss_d0": 0.04100315794348717, "step": 1620 }, { "epoch": 108.66666666666667, "grad_norm": 0.33984375, "learning_rate": 0.0002, "loss": 0.04076948165893555, "loss_d0": 0.04087142236530781, "step": 1630 }, { "epoch": 109.33333333333333, "grad_norm": 0.2412109375, "learning_rate": 0.0002, "loss": 0.044005772471427916, "loss_d0": 0.0444443590939045, "step": 1640 }, { "epoch": 110.0, "grad_norm": 0.267578125, "learning_rate": 0.0002, "loss": 0.04620983600616455, "loss_d0": 0.046199577301740645, "step": 1650 }, { "epoch": 110.66666666666667, "grad_norm": 0.46484375, "learning_rate": 0.0002, "loss": 0.04348172545433045, "loss_d0": 0.043485574424266815, "step": 1660 }, { "epoch": 111.33333333333333, "grad_norm": 0.484375, "learning_rate": 0.0002, "loss": 0.0493613988161087, "loss_d0": 0.049395665526390076, "step": 1670 }, { "epoch": 112.0, "grad_norm": 0.306640625, "learning_rate": 0.0002, "loss": 0.048318523168563846, "loss_d0": 0.048244457319378854, "step": 1680 }, { "epoch": 112.66666666666667, "grad_norm": 0.39453125, "learning_rate": 0.0002, "loss": 0.0416848361492157, "loss_d0": 0.04183990061283112, "step": 1690 }, { "epoch": 113.33333333333333, "grad_norm": 0.36328125, "learning_rate": 0.0002, "loss": 0.042894893884658815, "loss_d0": 0.043047336116433146, "step": 1700 }, { "epoch": 114.0, "grad_norm": 0.314453125, "learning_rate": 0.0002, "loss": 0.04120970368385315, "loss_d0": 0.04166660569608212, "step": 1710 }, { "epoch": 114.66666666666667, "grad_norm": 0.359375, "learning_rate": 0.0002, "loss": 0.03811361193656922, "loss_d0": 0.03826403059065342, "step": 1720 }, { "epoch": 115.33333333333333, "grad_norm": 0.474609375, "learning_rate": 0.0002, "loss": 0.04223992526531219, "loss_d0": 0.04242944307625294, "step": 1730 }, { "epoch": 116.0, "grad_norm": 0.39453125, "learning_rate": 0.0002, "loss": 0.04587743282318115, "loss_d0": 0.04566792957484722, "step": 1740 }, { "epoch": 116.66666666666667, "grad_norm": 0.337890625, "learning_rate": 0.0002, "loss": 0.04407768249511719, "loss_d0": 0.04438020028173924, "step": 1750 }, { "epoch": 117.33333333333333, "grad_norm": 0.34765625, "learning_rate": 0.0002, "loss": 0.04488096237182617, "loss_d0": 0.044961581379175185, "step": 1760 }, { "epoch": 118.0, "grad_norm": 0.396484375, "learning_rate": 0.0002, "loss": 0.04814847707748413, "loss_d0": 0.048101956397295, "step": 1770 }, { "epoch": 118.66666666666667, "grad_norm": 0.412109375, "learning_rate": 0.0002, "loss": 0.051658463478088376, "loss_d0": 0.052022571489214894, "step": 1780 }, { "epoch": 119.33333333333333, "grad_norm": 0.283203125, "learning_rate": 0.0002, "loss": 0.04125940203666687, "loss_d0": 0.04183415174484253, "step": 1790 }, { "epoch": 120.0, "grad_norm": 0.93359375, "learning_rate": 0.0002, "loss": 0.04704998135566711, "loss_d0": 0.04690146148204803, "step": 1800 }, { "epoch": 120.66666666666667, "grad_norm": 0.447265625, "learning_rate": 0.0002, "loss": 0.03837161362171173, "loss_d0": 0.038679466024041174, "step": 1810 }, { "epoch": 121.33333333333333, "grad_norm": 0.26171875, "learning_rate": 0.0002, "loss": 0.041628694534301756, "loss_d0": 0.04210329055786133, "step": 1820 }, { "epoch": 122.0, "grad_norm": 0.5625, "learning_rate": 0.0002, "loss": 0.04221533536911011, "loss_d0": 0.042480390146374704, "step": 1830 }, { "epoch": 122.66666666666667, "grad_norm": 0.29296875, "learning_rate": 0.0002, "loss": 0.043410655856132505, "loss_d0": 0.043429945781826976, "step": 1840 }, { "epoch": 123.33333333333333, "grad_norm": 0.44140625, "learning_rate": 0.0002, "loss": 0.041653552651405336, "loss_d0": 0.04193488694727421, "step": 1850 }, { "epoch": 124.0, "grad_norm": 0.2890625, "learning_rate": 0.0002, "loss": 0.0399824857711792, "loss_d0": 0.04024950861930847, "step": 1860 }, { "epoch": 124.66666666666667, "grad_norm": 0.36328125, "learning_rate": 0.0002, "loss": 0.04130673706531525, "loss_d0": 0.04133395403623581, "step": 1870 }, { "epoch": 125.33333333333333, "grad_norm": 0.3125, "learning_rate": 0.0002, "loss": 0.039680573344230655, "loss_d0": 0.040023022517561915, "step": 1880 }, { "epoch": 126.0, "grad_norm": 0.412109375, "learning_rate": 0.0002, "loss": 0.04459331929683685, "loss_d0": 0.044731929898262024, "step": 1890 }, { "epoch": 126.66666666666667, "grad_norm": 0.52734375, "learning_rate": 0.0002, "loss": 0.03877157270908356, "loss_d0": 0.03899230137467384, "step": 1900 }, { "epoch": 127.33333333333333, "grad_norm": 0.40625, "learning_rate": 0.0002, "loss": 0.04177733063697815, "loss_d0": 0.04159155897796154, "step": 1910 }, { "epoch": 128.0, "grad_norm": 0.318359375, "learning_rate": 0.0002, "loss": 0.039029103517532346, "loss_d0": 0.039202263578772545, "step": 1920 }, { "epoch": 128.66666666666666, "grad_norm": 0.33203125, "learning_rate": 0.0002, "loss": 0.03842213749885559, "loss_d0": 0.0387143149971962, "step": 1930 }, { "epoch": 129.33333333333334, "grad_norm": 0.70703125, "learning_rate": 0.0002, "loss": 0.04641495645046234, "loss_d0": 0.0463741198182106, "step": 1940 }, { "epoch": 130.0, "grad_norm": 0.37109375, "learning_rate": 0.0002, "loss": 0.04674426913261413, "loss_d0": 0.04691287837922573, "step": 1950 }, { "epoch": 130.66666666666666, "grad_norm": 0.458984375, "learning_rate": 0.0002, "loss": 0.0411600261926651, "loss_d0": 0.04125998429954052, "step": 1960 }, { "epoch": 131.33333333333334, "grad_norm": 0.21484375, "learning_rate": 0.0002, "loss": 0.04273697435855865, "loss_d0": 0.04304400980472565, "step": 1970 }, { "epoch": 132.0, "grad_norm": 0.36328125, "learning_rate": 0.0002, "loss": 0.04320941269397736, "loss_d0": 0.04327214397490024, "step": 1980 }, { "epoch": 132.66666666666666, "grad_norm": 0.33984375, "learning_rate": 0.0002, "loss": 0.038457101583480834, "loss_d0": 0.03848358802497387, "step": 1990 }, { "epoch": 133.33333333333334, "grad_norm": 0.33203125, "learning_rate": 0.0002, "loss": 0.04049345552921295, "loss_d0": 0.04078166633844375, "step": 2000 }, { "epoch": 133.33333333333334, "eval_loss": 9.509454727172852, "eval_runtime": 0.3426, "eval_samples_per_second": 729.644, "eval_steps_per_second": 72.964, "step": 2000 } ], "logging_steps": 10, "max_steps": 4500, "num_input_tokens_seen": 0, "num_train_epochs": 300, "save_steps": 1000, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 2.630938952269824e+16, "train_batch_size": 10, "trial_name": null, "trial_params": null }