{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 75.0, "eval_steps": 500, "global_step": 3000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.25, "grad_norm": 9.3125, "learning_rate": 1.8e-05, "loss": 2.419099235534668, "loss_d0": 2.4237823486328125, "step": 10 }, { "epoch": 0.5, "grad_norm": 4.46875, "learning_rate": 3.8e-05, "loss": 1.016735553741455, "loss_d0": 1.0169126868247986, "step": 20 }, { "epoch": 0.75, "grad_norm": 3.03125, "learning_rate": 5.8e-05, "loss": 0.7163782119750977, "loss_d0": 0.7170086741447449, "step": 30 }, { "epoch": 1.0, "grad_norm": 3.015625, "learning_rate": 7.800000000000001e-05, "loss": 0.5825047969818116, "loss_d0": 0.5834829866886139, "step": 40 }, { "epoch": 1.25, "grad_norm": 2.640625, "learning_rate": 9.8e-05, "loss": 0.5070408821105957, "loss_d0": 0.5083645194768905, "step": 50 }, { "epoch": 1.5, "grad_norm": 2.625, "learning_rate": 0.000118, "loss": 0.5112638473510742, "loss_d0": 0.5115580916404724, "step": 60 }, { "epoch": 1.75, "grad_norm": 2.25, "learning_rate": 0.000138, "loss": 0.4753141403198242, "loss_d0": 0.4750445276498795, "step": 70 }, { "epoch": 2.0, "grad_norm": 2.453125, "learning_rate": 0.00015800000000000002, "loss": 0.44187202453613283, "loss_d0": 0.4409120589494705, "step": 80 }, { "epoch": 2.25, "grad_norm": 2.109375, "learning_rate": 0.00017800000000000002, "loss": 0.3495074510574341, "loss_d0": 0.3506994903087616, "step": 90 }, { "epoch": 2.5, "grad_norm": 1.6015625, "learning_rate": 0.00019800000000000002, "loss": 0.355522608757019, "loss_d0": 0.3573369801044464, "step": 100 }, { "epoch": 2.75, "grad_norm": 2.40625, "learning_rate": 0.0002, "loss": 0.36629390716552734, "loss_d0": 0.36523382663726806, "step": 110 }, { "epoch": 3.0, "grad_norm": 2.3125, "learning_rate": 0.0002, "loss": 0.32001023292541503, "loss_d0": 0.3198924452066422, "step": 120 }, { "epoch": 3.25, "grad_norm": 1.3828125, "learning_rate": 0.0002, "loss": 0.2629648923873901, "loss_d0": 0.26279704421758654, "step": 130 }, { "epoch": 3.5, "grad_norm": 1.3359375, "learning_rate": 0.0002, "loss": 0.2764778137207031, "loss_d0": 0.27699622362852094, "step": 140 }, { "epoch": 3.75, "grad_norm": 1.4609375, "learning_rate": 0.0002, "loss": 0.2808023691177368, "loss_d0": 0.27955625057220457, "step": 150 }, { "epoch": 4.0, "grad_norm": 1.09375, "learning_rate": 0.0002, "loss": 0.2766923666000366, "loss_d0": 0.2778839275240898, "step": 160 }, { "epoch": 4.25, "grad_norm": 0.91015625, "learning_rate": 0.0002, "loss": 0.2177126407623291, "loss_d0": 0.21817942708730698, "step": 170 }, { "epoch": 4.5, "grad_norm": 1.0625, "learning_rate": 0.0002, "loss": 0.22354187965393066, "loss_d0": 0.2253672033548355, "step": 180 }, { "epoch": 4.75, "grad_norm": 1.078125, "learning_rate": 0.0002, "loss": 0.2261255979537964, "loss_d0": 0.22708745449781417, "step": 190 }, { "epoch": 5.0, "grad_norm": 1.0625, "learning_rate": 0.0002, "loss": 0.23856868743896484, "loss_d0": 0.2382099911570549, "step": 200 }, { "epoch": 5.25, "grad_norm": 0.98046875, "learning_rate": 0.0002, "loss": 0.1836856484413147, "loss_d0": 0.18439767211675645, "step": 210 }, { "epoch": 5.5, "grad_norm": 0.97265625, "learning_rate": 0.0002, "loss": 0.20460774898529052, "loss_d0": 0.2053621456027031, "step": 220 }, { "epoch": 5.75, "grad_norm": 1.125, "learning_rate": 0.0002, "loss": 0.20773332118988036, "loss_d0": 0.2081416815519333, "step": 230 }, { "epoch": 6.0, "grad_norm": 1.375, "learning_rate": 0.0002, "loss": 0.20451078414916993, "loss_d0": 0.20580717772245408, "step": 240 }, { "epoch": 6.25, "grad_norm": 1.015625, "learning_rate": 0.0002, "loss": 0.16367343664169312, "loss_d0": 0.1637965440750122, "step": 250 }, { "epoch": 6.5, "grad_norm": 0.94921875, "learning_rate": 0.0002, "loss": 0.1768767476081848, "loss_d0": 0.17705970853567124, "step": 260 }, { "epoch": 6.75, "grad_norm": 1.15625, "learning_rate": 0.0002, "loss": 0.19422578811645508, "loss_d0": 0.1945399060845375, "step": 270 }, { "epoch": 7.0, "grad_norm": 0.84375, "learning_rate": 0.0002, "loss": 0.19753103256225585, "loss_d0": 0.1971623793244362, "step": 280 }, { "epoch": 7.25, "grad_norm": 0.80859375, "learning_rate": 0.0002, "loss": 0.14055638313293456, "loss_d0": 0.1412511058151722, "step": 290 }, { "epoch": 7.5, "grad_norm": 0.91015625, "learning_rate": 0.0002, "loss": 0.15400553941726686, "loss_d0": 0.15403806418180466, "step": 300 }, { "epoch": 7.75, "grad_norm": 0.8828125, "learning_rate": 0.0002, "loss": 0.1660689115524292, "loss_d0": 0.16630121916532517, "step": 310 }, { "epoch": 8.0, "grad_norm": 1.03125, "learning_rate": 0.0002, "loss": 0.1730404496192932, "loss_d0": 0.17368634641170502, "step": 320 }, { "epoch": 8.25, "grad_norm": 0.89453125, "learning_rate": 0.0002, "loss": 0.1311247706413269, "loss_d0": 0.13191080316901208, "step": 330 }, { "epoch": 8.5, "grad_norm": 0.87890625, "learning_rate": 0.0002, "loss": 0.13660377264022827, "loss_d0": 0.13707814514636993, "step": 340 }, { "epoch": 8.75, "grad_norm": 1.6796875, "learning_rate": 0.0002, "loss": 0.16057606935501098, "loss_d0": 0.16095266342163086, "step": 350 }, { "epoch": 9.0, "grad_norm": 0.8046875, "learning_rate": 0.0002, "loss": 0.15158145427703856, "loss_d0": 0.1519700437784195, "step": 360 }, { "epoch": 9.25, "grad_norm": 0.7578125, "learning_rate": 0.0002, "loss": 0.12598543167114257, "loss_d0": 0.12593471333384515, "step": 370 }, { "epoch": 9.5, "grad_norm": 0.8125, "learning_rate": 0.0002, "loss": 0.12625789642333984, "loss_d0": 0.12605250850319863, "step": 380 }, { "epoch": 9.75, "grad_norm": 1.2890625, "learning_rate": 0.0002, "loss": 0.15585073232650756, "loss_d0": 0.15560536012053489, "step": 390 }, { "epoch": 10.0, "grad_norm": 0.91796875, "learning_rate": 0.0002, "loss": 0.15288279056549073, "loss_d0": 0.15293605029582977, "step": 400 }, { "epoch": 10.25, "grad_norm": 0.7890625, "learning_rate": 0.0002, "loss": 0.1126750111579895, "loss_d0": 0.11266628131270409, "step": 410 }, { "epoch": 10.5, "grad_norm": 11.75, "learning_rate": 0.0002, "loss": 0.1392864465713501, "loss_d0": 0.13897545784711837, "step": 420 }, { "epoch": 10.75, "grad_norm": 0.80078125, "learning_rate": 0.0002, "loss": 0.1241998553276062, "loss_d0": 0.12495879083871841, "step": 430 }, { "epoch": 11.0, "grad_norm": 0.77734375, "learning_rate": 0.0002, "loss": 0.13399370908737182, "loss_d0": 0.1345785766839981, "step": 440 }, { "epoch": 11.25, "grad_norm": 1.5625, "learning_rate": 0.0002, "loss": 0.11483274698257447, "loss_d0": 0.11512825042009353, "step": 450 }, { "epoch": 11.5, "grad_norm": 0.65234375, "learning_rate": 0.0002, "loss": 0.115890634059906, "loss_d0": 0.11643885746598244, "step": 460 }, { "epoch": 11.75, "grad_norm": 0.703125, "learning_rate": 0.0002, "loss": 0.12420456409454346, "loss_d0": 0.12463393807411194, "step": 470 }, { "epoch": 12.0, "grad_norm": 0.83984375, "learning_rate": 0.0002, "loss": 0.12463445663452148, "loss_d0": 0.12508776113390924, "step": 480 }, { "epoch": 12.25, "grad_norm": 0.66015625, "learning_rate": 0.0002, "loss": 0.08669283390045165, "loss_d0": 0.08694541230797767, "step": 490 }, { "epoch": 12.5, "grad_norm": 0.83203125, "learning_rate": 0.0002, "loss": 0.10650432109832764, "loss_d0": 0.10702361688017845, "step": 500 }, { "epoch": 12.5, "eval_loss": 7.686856746673584, "eval_runtime": 0.346, "eval_samples_per_second": 722.458, "eval_steps_per_second": 72.246, "step": 500 }, { "epoch": 12.75, "grad_norm": 0.63671875, "learning_rate": 0.0002, "loss": 0.11304057836532592, "loss_d0": 0.11300384327769279, "step": 510 }, { "epoch": 13.0, "grad_norm": 0.765625, "learning_rate": 0.0002, "loss": 0.12059590816497803, "loss_d0": 0.12071148529648781, "step": 520 }, { "epoch": 13.25, "grad_norm": 0.53125, "learning_rate": 0.0002, "loss": 0.08754821419715882, "loss_d0": 0.08753191828727722, "step": 530 }, { "epoch": 13.5, "grad_norm": 0.69140625, "learning_rate": 0.0002, "loss": 0.09736397266387939, "loss_d0": 0.09748184978961945, "step": 540 }, { "epoch": 13.75, "grad_norm": 0.703125, "learning_rate": 0.0002, "loss": 0.10162832736968994, "loss_d0": 0.10216130167245865, "step": 550 }, { "epoch": 14.0, "grad_norm": 0.8046875, "learning_rate": 0.0002, "loss": 0.11431772708892822, "loss_d0": 0.11476395502686501, "step": 560 }, { "epoch": 14.25, "grad_norm": 0.66015625, "learning_rate": 0.0002, "loss": 0.09515688419342042, "loss_d0": 0.09562777429819107, "step": 570 }, { "epoch": 14.5, "grad_norm": 0.671875, "learning_rate": 0.0002, "loss": 0.10088273286819457, "loss_d0": 0.10082438737154006, "step": 580 }, { "epoch": 14.75, "grad_norm": 0.71484375, "learning_rate": 0.0002, "loss": 0.10143396854400635, "loss_d0": 0.10186150297522545, "step": 590 }, { "epoch": 15.0, "grad_norm": 0.66796875, "learning_rate": 0.0002, "loss": 0.11544075012207031, "loss_d0": 0.11603940427303314, "step": 600 }, { "epoch": 15.25, "grad_norm": 0.57421875, "learning_rate": 0.0002, "loss": 0.08207579851150512, "loss_d0": 0.08233651667833328, "step": 610 }, { "epoch": 15.5, "grad_norm": 0.671875, "learning_rate": 0.0002, "loss": 0.09775862693786622, "loss_d0": 0.09806842431426048, "step": 620 }, { "epoch": 15.75, "grad_norm": 0.703125, "learning_rate": 0.0002, "loss": 0.0941968321800232, "loss_d0": 0.09450600519776345, "step": 630 }, { "epoch": 16.0, "grad_norm": 0.63671875, "learning_rate": 0.0002, "loss": 0.11077705621719361, "loss_d0": 0.111270122975111, "step": 640 }, { "epoch": 16.25, "grad_norm": 0.65234375, "learning_rate": 0.0002, "loss": 0.08216186165809632, "loss_d0": 0.08217487558722496, "step": 650 }, { "epoch": 16.5, "grad_norm": 0.578125, "learning_rate": 0.0002, "loss": 0.08583685159683227, "loss_d0": 0.08590926378965377, "step": 660 }, { "epoch": 16.75, "grad_norm": 0.59765625, "learning_rate": 0.0002, "loss": 0.10179605484008789, "loss_d0": 0.10241870805621148, "step": 670 }, { "epoch": 17.0, "grad_norm": 0.75390625, "learning_rate": 0.0002, "loss": 0.11323529481887817, "loss_d0": 0.11270172968506813, "step": 680 }, { "epoch": 17.25, "grad_norm": 0.80078125, "learning_rate": 0.0002, "loss": 0.07983130812644959, "loss_d0": 0.07931971848011017, "step": 690 }, { "epoch": 17.5, "grad_norm": 0.64453125, "learning_rate": 0.0002, "loss": 0.08101434707641601, "loss_d0": 0.0811703234910965, "step": 700 }, { "epoch": 17.75, "grad_norm": 0.52734375, "learning_rate": 0.0002, "loss": 0.08358389735221863, "loss_d0": 0.08354934751987457, "step": 710 }, { "epoch": 18.0, "grad_norm": 0.60546875, "learning_rate": 0.0002, "loss": 0.09092987775802612, "loss_d0": 0.09135034829378127, "step": 720 }, { "epoch": 18.25, "grad_norm": 0.56640625, "learning_rate": 0.0002, "loss": 0.0751054584980011, "loss_d0": 0.07558580189943313, "step": 730 }, { "epoch": 18.5, "grad_norm": 0.625, "learning_rate": 0.0002, "loss": 0.08020662069320679, "loss_d0": 0.08090231120586396, "step": 740 }, { "epoch": 18.75, "grad_norm": 0.4921875, "learning_rate": 0.0002, "loss": 0.08230118155479431, "loss_d0": 0.08202177286148071, "step": 750 }, { "epoch": 19.0, "grad_norm": 0.65625, "learning_rate": 0.0002, "loss": 0.0855340838432312, "loss_d0": 0.0853975273668766, "step": 760 }, { "epoch": 19.25, "grad_norm": 0.5546875, "learning_rate": 0.0002, "loss": 0.07504370212554931, "loss_d0": 0.0755705066025257, "step": 770 }, { "epoch": 19.5, "grad_norm": 0.63671875, "learning_rate": 0.0002, "loss": 0.07457044124603271, "loss_d0": 0.07485715299844742, "step": 780 }, { "epoch": 19.75, "grad_norm": 0.58203125, "learning_rate": 0.0002, "loss": 0.08841861486434936, "loss_d0": 0.08899671211838722, "step": 790 }, { "epoch": 20.0, "grad_norm": 0.61328125, "learning_rate": 0.0002, "loss": 0.08840059638023376, "loss_d0": 0.08874272927641869, "step": 800 }, { "epoch": 20.25, "grad_norm": 0.470703125, "learning_rate": 0.0002, "loss": 0.07279248833656311, "loss_d0": 0.0725507315248251, "step": 810 }, { "epoch": 20.5, "grad_norm": 0.62109375, "learning_rate": 0.0002, "loss": 0.07490698099136353, "loss_d0": 0.07517094723880291, "step": 820 }, { "epoch": 20.75, "grad_norm": 0.466796875, "learning_rate": 0.0002, "loss": 0.07984906435012817, "loss_d0": 0.08029644414782525, "step": 830 }, { "epoch": 21.0, "grad_norm": 0.61328125, "learning_rate": 0.0002, "loss": 0.08839969038963318, "loss_d0": 0.08827509433031082, "step": 840 }, { "epoch": 21.25, "grad_norm": 0.478515625, "learning_rate": 0.0002, "loss": 0.0686249315738678, "loss_d0": 0.06923733800649642, "step": 850 }, { "epoch": 21.5, "grad_norm": 0.466796875, "learning_rate": 0.0002, "loss": 0.08188758492469787, "loss_d0": 0.08173562847077846, "step": 860 }, { "epoch": 21.75, "grad_norm": 0.443359375, "learning_rate": 0.0002, "loss": 0.0769996166229248, "loss_d0": 0.07713011205196381, "step": 870 }, { "epoch": 22.0, "grad_norm": 0.48046875, "learning_rate": 0.0002, "loss": 0.07695686221122741, "loss_d0": 0.07774162963032723, "step": 880 }, { "epoch": 22.25, "grad_norm": 0.478515625, "learning_rate": 0.0002, "loss": 0.07001073360443115, "loss_d0": 0.0701629150658846, "step": 890 }, { "epoch": 22.5, "grad_norm": 0.5234375, "learning_rate": 0.0002, "loss": 0.07286003232002258, "loss_d0": 0.07322507128119468, "step": 900 }, { "epoch": 22.75, "grad_norm": 0.52734375, "learning_rate": 0.0002, "loss": 0.07836406230926514, "loss_d0": 0.07865607067942619, "step": 910 }, { "epoch": 23.0, "grad_norm": 0.70703125, "learning_rate": 0.0002, "loss": 0.08143852353096008, "loss_d0": 0.08168832883238793, "step": 920 }, { "epoch": 23.25, "grad_norm": 0.59375, "learning_rate": 0.0002, "loss": 0.07572694420814514, "loss_d0": 0.07592412531375885, "step": 930 }, { "epoch": 23.5, "grad_norm": 0.47265625, "learning_rate": 0.0002, "loss": 0.07522768378257752, "loss_d0": 0.07555339634418487, "step": 940 }, { "epoch": 23.75, "grad_norm": 0.5703125, "learning_rate": 0.0002, "loss": 0.07778022289276124, "loss_d0": 0.0778064027428627, "step": 950 }, { "epoch": 24.0, "grad_norm": 0.65625, "learning_rate": 0.0002, "loss": 0.07971324920654296, "loss_d0": 0.08017545640468597, "step": 960 }, { "epoch": 24.25, "grad_norm": 0.7109375, "learning_rate": 0.0002, "loss": 0.06289821863174438, "loss_d0": 0.06302815079689025, "step": 970 }, { "epoch": 24.5, "grad_norm": 0.57421875, "learning_rate": 0.0002, "loss": 0.0684018850326538, "loss_d0": 0.06837239749729633, "step": 980 }, { "epoch": 24.75, "grad_norm": 0.59375, "learning_rate": 0.0002, "loss": 0.0713754415512085, "loss_d0": 0.07187536023557187, "step": 990 }, { "epoch": 25.0, "grad_norm": 0.5078125, "learning_rate": 0.0002, "loss": 0.07395302653312683, "loss_d0": 0.07426370158791543, "step": 1000 }, { "epoch": 25.0, "eval_loss": 9.472062110900879, "eval_runtime": 0.3448, "eval_samples_per_second": 725.044, "eval_steps_per_second": 72.504, "step": 1000 }, { "epoch": 25.25, "grad_norm": 0.4765625, "learning_rate": 0.0002, "loss": 0.06430479884147644, "loss_d0": 0.06464392952620983, "step": 1010 }, { "epoch": 25.5, "grad_norm": 0.51171875, "learning_rate": 0.0002, "loss": 0.0726861834526062, "loss_d0": 0.07402807176113128, "step": 1020 }, { "epoch": 25.75, "grad_norm": 0.609375, "learning_rate": 0.0002, "loss": 0.0761205494403839, "loss_d0": 0.07630706876516342, "step": 1030 }, { "epoch": 26.0, "grad_norm": 0.546875, "learning_rate": 0.0002, "loss": 0.07697510123252868, "loss_d0": 0.07700100690126419, "step": 1040 }, { "epoch": 26.25, "grad_norm": 0.48046875, "learning_rate": 0.0002, "loss": 0.06419612169265747, "loss_d0": 0.06443683132529258, "step": 1050 }, { "epoch": 26.5, "grad_norm": 0.47265625, "learning_rate": 0.0002, "loss": 0.0656801700592041, "loss_d0": 0.06635799780488014, "step": 1060 }, { "epoch": 26.75, "grad_norm": 0.546875, "learning_rate": 0.0002, "loss": 0.07432531118392945, "loss_d0": 0.07482590526342392, "step": 1070 }, { "epoch": 27.0, "grad_norm": 0.48046875, "learning_rate": 0.0002, "loss": 0.07460427880287171, "loss_d0": 0.07486905790865421, "step": 1080 }, { "epoch": 27.25, "grad_norm": 0.57421875, "learning_rate": 0.0002, "loss": 0.062262147665023804, "loss_d0": 0.06270815506577491, "step": 1090 }, { "epoch": 27.5, "grad_norm": 0.482421875, "learning_rate": 0.0002, "loss": 0.07988451719284058, "loss_d0": 0.07888436727225781, "step": 1100 }, { "epoch": 27.75, "grad_norm": 0.51171875, "learning_rate": 0.0002, "loss": 0.06685459613800049, "loss_d0": 0.06692123860120773, "step": 1110 }, { "epoch": 28.0, "grad_norm": 0.7265625, "learning_rate": 0.0002, "loss": 0.08263227939605713, "loss_d0": 0.08312211632728576, "step": 1120 }, { "epoch": 28.25, "grad_norm": 0.40234375, "learning_rate": 0.0002, "loss": 0.05786241292953491, "loss_d0": 0.05830040462315082, "step": 1130 }, { "epoch": 28.5, "grad_norm": 0.416015625, "learning_rate": 0.0002, "loss": 0.06246680021286011, "loss_d0": 0.06251397952437401, "step": 1140 }, { "epoch": 28.75, "grad_norm": 0.482421875, "learning_rate": 0.0002, "loss": 0.06916601657867431, "loss_d0": 0.0696951575577259, "step": 1150 }, { "epoch": 29.0, "grad_norm": 0.5703125, "learning_rate": 0.0002, "loss": 0.07527051568031311, "loss_d0": 0.07468223795294762, "step": 1160 }, { "epoch": 29.25, "grad_norm": 0.482421875, "learning_rate": 0.0002, "loss": 0.0581015408039093, "loss_d0": 0.05824718400835991, "step": 1170 }, { "epoch": 29.5, "grad_norm": 0.466796875, "learning_rate": 0.0002, "loss": 0.060128825902938846, "loss_d0": 0.06012755185365677, "step": 1180 }, { "epoch": 29.75, "grad_norm": 0.5, "learning_rate": 0.0002, "loss": 0.0673996388912201, "loss_d0": 0.06763093918561935, "step": 1190 }, { "epoch": 30.0, "grad_norm": 0.40625, "learning_rate": 0.0002, "loss": 0.07309567928314209, "loss_d0": 0.07359372191131115, "step": 1200 }, { "epoch": 30.25, "grad_norm": 0.38671875, "learning_rate": 0.0002, "loss": 0.05833629965782165, "loss_d0": 0.05870196744799614, "step": 1210 }, { "epoch": 30.5, "grad_norm": 0.55859375, "learning_rate": 0.0002, "loss": 0.06625040769577026, "loss_d0": 0.06676065064966678, "step": 1220 }, { "epoch": 30.75, "grad_norm": 0.6171875, "learning_rate": 0.0002, "loss": 0.06969956159591675, "loss_d0": 0.07000019364058971, "step": 1230 }, { "epoch": 31.0, "grad_norm": 0.482421875, "learning_rate": 0.0002, "loss": 0.06795068383216858, "loss_d0": 0.06837498843669891, "step": 1240 }, { "epoch": 31.25, "grad_norm": 0.474609375, "learning_rate": 0.0002, "loss": 0.058440542221069335, "loss_d0": 0.05858158580958843, "step": 1250 }, { "epoch": 31.5, "grad_norm": 0.4140625, "learning_rate": 0.0002, "loss": 0.06397214531898499, "loss_d0": 0.06426840759813786, "step": 1260 }, { "epoch": 31.75, "grad_norm": 0.423828125, "learning_rate": 0.0002, "loss": 0.06345818042755128, "loss_d0": 0.06368137337267399, "step": 1270 }, { "epoch": 32.0, "grad_norm": 0.50390625, "learning_rate": 0.0002, "loss": 0.06745975017547608, "loss_d0": 0.0678976308554411, "step": 1280 }, { "epoch": 32.25, "grad_norm": 0.5234375, "learning_rate": 0.0002, "loss": 0.059911799430847165, "loss_d0": 0.060089119151234625, "step": 1290 }, { "epoch": 32.5, "grad_norm": 0.48046875, "learning_rate": 0.0002, "loss": 0.06502289175987244, "loss_d0": 0.06520598568022251, "step": 1300 }, { "epoch": 32.75, "grad_norm": 0.546875, "learning_rate": 0.0002, "loss": 0.06437732577323914, "loss_d0": 0.06469985544681549, "step": 1310 }, { "epoch": 33.0, "grad_norm": 0.51953125, "learning_rate": 0.0002, "loss": 0.06933318376541138, "loss_d0": 0.06987486742436885, "step": 1320 }, { "epoch": 33.25, "grad_norm": 0.5, "learning_rate": 0.0002, "loss": 0.06083628535270691, "loss_d0": 0.06119122616946697, "step": 1330 }, { "epoch": 33.5, "grad_norm": 0.546875, "learning_rate": 0.0002, "loss": 0.06731333136558533, "loss_d0": 0.06779481768608094, "step": 1340 }, { "epoch": 33.75, "grad_norm": 0.4453125, "learning_rate": 0.0002, "loss": 0.06366108655929566, "loss_d0": 0.06400349549949169, "step": 1350 }, { "epoch": 34.0, "grad_norm": 0.53125, "learning_rate": 0.0002, "loss": 0.07252717018127441, "loss_d0": 0.07273228801786899, "step": 1360 }, { "epoch": 34.25, "grad_norm": 0.44921875, "learning_rate": 0.0002, "loss": 0.057601267099380495, "loss_d0": 0.057797104492783545, "step": 1370 }, { "epoch": 34.5, "grad_norm": 0.302734375, "learning_rate": 0.0002, "loss": 0.06590864658355713, "loss_d0": 0.06650126352906227, "step": 1380 }, { "epoch": 34.75, "grad_norm": 0.458984375, "learning_rate": 0.0002, "loss": 0.06279119253158569, "loss_d0": 0.06243448853492737, "step": 1390 }, { "epoch": 35.0, "grad_norm": 0.51953125, "learning_rate": 0.0002, "loss": 0.06743443608283997, "loss_d0": 0.06724736131727696, "step": 1400 }, { "epoch": 35.25, "grad_norm": 0.5625, "learning_rate": 0.0002, "loss": 0.06006784439086914, "loss_d0": 0.06038782335817814, "step": 1410 }, { "epoch": 35.5, "grad_norm": 0.373046875, "learning_rate": 0.0002, "loss": 0.06705097556114196, "loss_d0": 0.06722290031611919, "step": 1420 }, { "epoch": 35.75, "grad_norm": 0.50390625, "learning_rate": 0.0002, "loss": 0.0643904447555542, "loss_d0": 0.0645883984863758, "step": 1430 }, { "epoch": 36.0, "grad_norm": 0.5390625, "learning_rate": 0.0002, "loss": 0.06919337511062622, "loss_d0": 0.06933849938213825, "step": 1440 }, { "epoch": 36.25, "grad_norm": 0.353515625, "learning_rate": 0.0002, "loss": 0.05321390628814697, "loss_d0": 0.0534587811678648, "step": 1450 }, { "epoch": 36.5, "grad_norm": 0.41796875, "learning_rate": 0.0002, "loss": 0.05641515254974365, "loss_d0": 0.05651510432362557, "step": 1460 }, { "epoch": 36.75, "grad_norm": 0.54296875, "learning_rate": 0.0002, "loss": 0.056172966957092285, "loss_d0": 0.05633020140230656, "step": 1470 }, { "epoch": 37.0, "grad_norm": 0.498046875, "learning_rate": 0.0002, "loss": 0.071669602394104, "loss_d0": 0.07104928344488144, "step": 1480 }, { "epoch": 37.25, "grad_norm": 0.337890625, "learning_rate": 0.0002, "loss": 0.057771342992782596, "loss_d0": 0.05772700011730194, "step": 1490 }, { "epoch": 37.5, "grad_norm": 0.4921875, "learning_rate": 0.0002, "loss": 0.05799049735069275, "loss_d0": 0.058008070290088656, "step": 1500 }, { "epoch": 37.5, "eval_loss": 10.0471773147583, "eval_runtime": 0.3455, "eval_samples_per_second": 723.591, "eval_steps_per_second": 72.359, "step": 1500 }, { "epoch": 37.75, "grad_norm": 0.62890625, "learning_rate": 0.0002, "loss": 0.060436797142028806, "loss_d0": 0.06095544844865799, "step": 1510 }, { "epoch": 38.0, "grad_norm": 0.462890625, "learning_rate": 0.0002, "loss": 0.06353324055671691, "loss_d0": 0.06384937241673469, "step": 1520 }, { "epoch": 38.25, "grad_norm": 0.486328125, "learning_rate": 0.0002, "loss": 0.05317062735557556, "loss_d0": 0.0535169318318367, "step": 1530 }, { "epoch": 38.5, "grad_norm": 0.49609375, "learning_rate": 0.0002, "loss": 0.0576020359992981, "loss_d0": 0.05768560767173767, "step": 1540 }, { "epoch": 38.75, "grad_norm": 0.51171875, "learning_rate": 0.0002, "loss": 0.06362175345420837, "loss_d0": 0.06413243673741817, "step": 1550 }, { "epoch": 39.0, "grad_norm": 0.5, "learning_rate": 0.0002, "loss": 0.061510562896728516, "loss_d0": 0.061782880872488025, "step": 1560 }, { "epoch": 39.25, "grad_norm": 0.54296875, "learning_rate": 0.0002, "loss": 0.05666018724441528, "loss_d0": 0.05692802034318447, "step": 1570 }, { "epoch": 39.5, "grad_norm": 0.52734375, "learning_rate": 0.0002, "loss": 0.06202887296676636, "loss_d0": 0.06217095740139485, "step": 1580 }, { "epoch": 39.75, "grad_norm": 0.71875, "learning_rate": 0.0002, "loss": 0.06877539157867432, "loss_d0": 0.0693345170468092, "step": 1590 }, { "epoch": 40.0, "grad_norm": 0.69921875, "learning_rate": 0.0002, "loss": 0.05825335383415222, "loss_d0": 0.0583782933652401, "step": 1600 }, { "epoch": 40.25, "grad_norm": 0.466796875, "learning_rate": 0.0002, "loss": 0.05497481226921082, "loss_d0": 0.0551537461578846, "step": 1610 }, { "epoch": 40.5, "grad_norm": 0.703125, "learning_rate": 0.0002, "loss": 0.060857725143432614, "loss_d0": 0.06165114678442478, "step": 1620 }, { "epoch": 40.75, "grad_norm": 0.50390625, "learning_rate": 0.0002, "loss": 0.07385790944099427, "loss_d0": 0.07406756728887558, "step": 1630 }, { "epoch": 41.0, "grad_norm": 0.45703125, "learning_rate": 0.0002, "loss": 0.0629690408706665, "loss_d0": 0.06308388896286488, "step": 1640 }, { "epoch": 41.25, "grad_norm": 0.4296875, "learning_rate": 0.0002, "loss": 0.054850274324417116, "loss_d0": 0.05506519712507725, "step": 1650 }, { "epoch": 41.5, "grad_norm": 0.478515625, "learning_rate": 0.0002, "loss": 0.054468965530395506, "loss_d0": 0.054471854120492935, "step": 1660 }, { "epoch": 41.75, "grad_norm": 0.41796875, "learning_rate": 0.0002, "loss": 0.05796172022819519, "loss_d0": 0.0579277478158474, "step": 1670 }, { "epoch": 42.0, "grad_norm": 0.41796875, "learning_rate": 0.0002, "loss": 0.05630323886871338, "loss_d0": 0.05661703534424305, "step": 1680 }, { "epoch": 42.25, "grad_norm": 0.416015625, "learning_rate": 0.0002, "loss": 0.054699838161468506, "loss_d0": 0.05516020208597183, "step": 1690 }, { "epoch": 42.5, "grad_norm": 0.39453125, "learning_rate": 0.0002, "loss": 0.058293914794921874, "loss_d0": 0.058815288543701175, "step": 1700 }, { "epoch": 42.75, "grad_norm": 0.42578125, "learning_rate": 0.0002, "loss": 0.057288384437561034, "loss_d0": 0.057978134229779245, "step": 1710 }, { "epoch": 43.0, "grad_norm": 0.474609375, "learning_rate": 0.0002, "loss": 0.061647933721542356, "loss_d0": 0.061975281313061716, "step": 1720 }, { "epoch": 43.25, "grad_norm": 0.392578125, "learning_rate": 0.0002, "loss": 0.05214250087738037, "loss_d0": 0.05246074721217155, "step": 1730 }, { "epoch": 43.5, "grad_norm": 0.490234375, "learning_rate": 0.0002, "loss": 0.05976005792617798, "loss_d0": 0.0598691787570715, "step": 1740 }, { "epoch": 43.75, "grad_norm": 0.44921875, "learning_rate": 0.0002, "loss": 0.0638785719871521, "loss_d0": 0.06381307877600192, "step": 1750 }, { "epoch": 44.0, "grad_norm": 0.435546875, "learning_rate": 0.0002, "loss": 0.06142584681510925, "loss_d0": 0.06180475577712059, "step": 1760 }, { "epoch": 44.25, "grad_norm": 0.39453125, "learning_rate": 0.0002, "loss": 0.05517058372497559, "loss_d0": 0.05530419759452343, "step": 1770 }, { "epoch": 44.5, "grad_norm": 0.482421875, "learning_rate": 0.0002, "loss": 0.05579268932342529, "loss_d0": 0.056095103919506076, "step": 1780 }, { "epoch": 44.75, "grad_norm": 0.474609375, "learning_rate": 0.0002, "loss": 0.06274228096008301, "loss_d0": 0.0628600399941206, "step": 1790 }, { "epoch": 45.0, "grad_norm": 0.5859375, "learning_rate": 0.0002, "loss": 0.0648037850856781, "loss_d0": 0.06492549628019333, "step": 1800 }, { "epoch": 45.25, "grad_norm": 0.58203125, "learning_rate": 0.0002, "loss": 0.059372180700302125, "loss_d0": 0.059330419450998303, "step": 1810 }, { "epoch": 45.5, "grad_norm": 0.51171875, "learning_rate": 0.0002, "loss": 0.05512714982032776, "loss_d0": 0.055520417913794515, "step": 1820 }, { "epoch": 45.75, "grad_norm": 0.419921875, "learning_rate": 0.0002, "loss": 0.05914598107337952, "loss_d0": 0.05946195349097252, "step": 1830 }, { "epoch": 46.0, "grad_norm": 0.6015625, "learning_rate": 0.0002, "loss": 0.057545202970504764, "loss_d0": 0.057726585492491725, "step": 1840 }, { "epoch": 46.25, "grad_norm": 0.5, "learning_rate": 0.0002, "loss": 0.05496026873588562, "loss_d0": 0.0549175962805748, "step": 1850 }, { "epoch": 46.5, "grad_norm": 0.39453125, "learning_rate": 0.0002, "loss": 0.058978724479675296, "loss_d0": 0.05935865454375744, "step": 1860 }, { "epoch": 46.75, "grad_norm": 0.453125, "learning_rate": 0.0002, "loss": 0.05748326778411865, "loss_d0": 0.05784638747572899, "step": 1870 }, { "epoch": 47.0, "grad_norm": 0.38671875, "learning_rate": 0.0002, "loss": 0.06152337193489075, "loss_d0": 0.061656130105257036, "step": 1880 }, { "epoch": 47.25, "grad_norm": 0.44921875, "learning_rate": 0.0002, "loss": 0.05365397334098816, "loss_d0": 0.053687059134244916, "step": 1890 }, { "epoch": 47.5, "grad_norm": 0.31640625, "learning_rate": 0.0002, "loss": 0.05964898467063904, "loss_d0": 0.059862629324197766, "step": 1900 }, { "epoch": 47.75, "grad_norm": 0.486328125, "learning_rate": 0.0002, "loss": 0.06160618662834168, "loss_d0": 0.061931657046079634, "step": 1910 }, { "epoch": 48.0, "grad_norm": 0.419921875, "learning_rate": 0.0002, "loss": 0.061159104108810425, "loss_d0": 0.06127244271337986, "step": 1920 }, { "epoch": 48.25, "grad_norm": 0.3828125, "learning_rate": 0.0002, "loss": 0.05568260550498962, "loss_d0": 0.056041232869029046, "step": 1930 }, { "epoch": 48.5, "grad_norm": 0.515625, "learning_rate": 0.0002, "loss": 0.05307339429855347, "loss_d0": 0.053248926252126697, "step": 1940 }, { "epoch": 48.75, "grad_norm": 0.44140625, "learning_rate": 0.0002, "loss": 0.05676477551460266, "loss_d0": 0.057009470835328105, "step": 1950 }, { "epoch": 49.0, "grad_norm": 0.51953125, "learning_rate": 0.0002, "loss": 0.06322442889213561, "loss_d0": 0.0632315531373024, "step": 1960 }, { "epoch": 49.25, "grad_norm": 0.294921875, "learning_rate": 0.0002, "loss": 0.05208069682121277, "loss_d0": 0.05217769481241703, "step": 1970 }, { "epoch": 49.5, "grad_norm": 0.45703125, "learning_rate": 0.0002, "loss": 0.05972009301185608, "loss_d0": 0.06001131311058998, "step": 1980 }, { "epoch": 49.75, "grad_norm": 0.431640625, "learning_rate": 0.0002, "loss": 0.06118760108947754, "loss_d0": 0.061306034401059153, "step": 1990 }, { "epoch": 50.0, "grad_norm": 0.48046875, "learning_rate": 0.0002, "loss": 0.056265789270401004, "loss_d0": 0.056443619355559346, "step": 2000 }, { "epoch": 50.0, "eval_loss": 9.570272445678711, "eval_runtime": 0.3452, "eval_samples_per_second": 724.138, "eval_steps_per_second": 72.414, "step": 2000 }, { "epoch": 50.25, "grad_norm": 0.5625, "learning_rate": 0.0002, "loss": 0.05579528212547302, "loss_d0": 0.05573404803872108, "step": 2010 }, { "epoch": 50.5, "grad_norm": 0.42578125, "learning_rate": 0.0002, "loss": 0.05709593892097473, "loss_d0": 0.05716409236192703, "step": 2020 }, { "epoch": 50.75, "grad_norm": 0.4140625, "learning_rate": 0.0002, "loss": 0.05737549662590027, "loss_d0": 0.05729088075459003, "step": 2030 }, { "epoch": 51.0, "grad_norm": 0.5703125, "learning_rate": 0.0002, "loss": 0.05552052855491638, "loss_d0": 0.05591188482940197, "step": 2040 }, { "epoch": 51.25, "grad_norm": 0.349609375, "learning_rate": 0.0002, "loss": 0.050293844938278195, "loss_d0": 0.05039510801434517, "step": 2050 }, { "epoch": 51.5, "grad_norm": 0.453125, "learning_rate": 0.0002, "loss": 0.05217458605766297, "loss_d0": 0.05254131220281124, "step": 2060 }, { "epoch": 51.75, "grad_norm": 0.337890625, "learning_rate": 0.0002, "loss": 0.05404587984085083, "loss_d0": 0.05422148145735264, "step": 2070 }, { "epoch": 52.0, "grad_norm": 0.431640625, "learning_rate": 0.0002, "loss": 0.05949082374572754, "loss_d0": 0.05948565229773521, "step": 2080 }, { "epoch": 52.25, "grad_norm": 0.63671875, "learning_rate": 0.0002, "loss": 0.057565832138061525, "loss_d0": 0.05814546495676041, "step": 2090 }, { "epoch": 52.5, "grad_norm": 0.388671875, "learning_rate": 0.0002, "loss": 0.052321404218673706, "loss_d0": 0.052815460786223414, "step": 2100 }, { "epoch": 52.75, "grad_norm": 0.4140625, "learning_rate": 0.0002, "loss": 0.058062076568603516, "loss_d0": 0.05846084877848625, "step": 2110 }, { "epoch": 53.0, "grad_norm": 0.486328125, "learning_rate": 0.0002, "loss": 0.06171013712882996, "loss_d0": 0.06212322488427162, "step": 2120 }, { "epoch": 53.25, "grad_norm": 0.43359375, "learning_rate": 0.0002, "loss": 0.05460226535797119, "loss_d0": 0.05509419105947018, "step": 2130 }, { "epoch": 53.5, "grad_norm": 0.34765625, "learning_rate": 0.0002, "loss": 0.055398589372634886, "loss_d0": 0.055659336224198344, "step": 2140 }, { "epoch": 53.75, "grad_norm": 0.45703125, "learning_rate": 0.0002, "loss": 0.05847206711769104, "loss_d0": 0.05927353985607624, "step": 2150 }, { "epoch": 54.0, "grad_norm": 0.392578125, "learning_rate": 0.0002, "loss": 0.06233756542205811, "loss_d0": 0.06288112588226795, "step": 2160 }, { "epoch": 54.25, "grad_norm": 0.46484375, "learning_rate": 0.0002, "loss": 0.05393359065055847, "loss_d0": 0.054285747557878496, "step": 2170 }, { "epoch": 54.5, "grad_norm": 0.37890625, "learning_rate": 0.0002, "loss": 0.05169063210487366, "loss_d0": 0.052193207666277885, "step": 2180 }, { "epoch": 54.75, "grad_norm": 0.37890625, "learning_rate": 0.0002, "loss": 0.0548134446144104, "loss_d0": 0.05492622479796409, "step": 2190 }, { "epoch": 55.0, "grad_norm": 0.4296875, "learning_rate": 0.0002, "loss": 0.05885629057884216, "loss_d0": 0.05889065600931644, "step": 2200 }, { "epoch": 55.25, "grad_norm": 0.287109375, "learning_rate": 0.0002, "loss": 0.0550631582736969, "loss_d0": 0.05513200797140598, "step": 2210 }, { "epoch": 55.5, "grad_norm": 0.40625, "learning_rate": 0.0002, "loss": 0.050622057914733884, "loss_d0": 0.051012787595391275, "step": 2220 }, { "epoch": 55.75, "grad_norm": 0.4140625, "learning_rate": 0.0002, "loss": 0.058926552534103394, "loss_d0": 0.05910953395068645, "step": 2230 }, { "epoch": 56.0, "grad_norm": 0.359375, "learning_rate": 0.0002, "loss": 0.05983954071998596, "loss_d0": 0.05987398028373718, "step": 2240 }, { "epoch": 56.25, "grad_norm": 0.51171875, "learning_rate": 0.0002, "loss": 0.04893695116043091, "loss_d0": 0.04906199313700199, "step": 2250 }, { "epoch": 56.5, "grad_norm": 0.52734375, "learning_rate": 0.0002, "loss": 0.05469831228256226, "loss_d0": 0.054801841452717784, "step": 2260 }, { "epoch": 56.75, "grad_norm": 0.453125, "learning_rate": 0.0002, "loss": 0.05877939462661743, "loss_d0": 0.058909759670495984, "step": 2270 }, { "epoch": 57.0, "grad_norm": 0.470703125, "learning_rate": 0.0002, "loss": 0.05709148049354553, "loss_d0": 0.057506448775529864, "step": 2280 }, { "epoch": 57.25, "grad_norm": 0.44140625, "learning_rate": 0.0002, "loss": 0.05298535823822022, "loss_d0": 0.05313003920018673, "step": 2290 }, { "epoch": 57.5, "grad_norm": 0.431640625, "learning_rate": 0.0002, "loss": 0.05260106325149536, "loss_d0": 0.052703161165118216, "step": 2300 }, { "epoch": 57.75, "grad_norm": 0.46875, "learning_rate": 0.0002, "loss": 0.05661575794219971, "loss_d0": 0.05684591718018055, "step": 2310 }, { "epoch": 58.0, "grad_norm": 0.41015625, "learning_rate": 0.0002, "loss": 0.05907288193702698, "loss_d0": 0.05924911350011826, "step": 2320 }, { "epoch": 58.25, "grad_norm": 0.41015625, "learning_rate": 0.0002, "loss": 0.05050989389419556, "loss_d0": 0.050834688171744344, "step": 2330 }, { "epoch": 58.5, "grad_norm": 0.451171875, "learning_rate": 0.0002, "loss": 0.053637123107910155, "loss_d0": 0.05371711477637291, "step": 2340 }, { "epoch": 58.75, "grad_norm": 0.46484375, "learning_rate": 0.0002, "loss": 0.056911373138427736, "loss_d0": 0.05702054724097252, "step": 2350 }, { "epoch": 59.0, "grad_norm": 0.412109375, "learning_rate": 0.0002, "loss": 0.05872758030891419, "loss_d0": 0.0589618481695652, "step": 2360 }, { "epoch": 59.25, "grad_norm": 0.345703125, "learning_rate": 0.0002, "loss": 0.05019079446792603, "loss_d0": 0.050407799705862996, "step": 2370 }, { "epoch": 59.5, "grad_norm": 0.3515625, "learning_rate": 0.0002, "loss": 0.052620303630828855, "loss_d0": 0.05305602438747883, "step": 2380 }, { "epoch": 59.75, "grad_norm": 0.3046875, "learning_rate": 0.0002, "loss": 0.05450937747955322, "loss_d0": 0.05496942400932312, "step": 2390 }, { "epoch": 60.0, "grad_norm": 0.47265625, "learning_rate": 0.0002, "loss": 0.05744432806968689, "loss_d0": 0.05768766738474369, "step": 2400 }, { "epoch": 60.25, "grad_norm": 0.32421875, "learning_rate": 0.0002, "loss": 0.051724094152450564, "loss_d0": 0.05191577039659023, "step": 2410 }, { "epoch": 60.5, "grad_norm": 0.423828125, "learning_rate": 0.0002, "loss": 0.053571826219558714, "loss_d0": 0.053789060562849045, "step": 2420 }, { "epoch": 60.75, "grad_norm": 0.3828125, "learning_rate": 0.0002, "loss": 0.0588623046875, "loss_d0": 0.059234515950083735, "step": 2430 }, { "epoch": 61.0, "grad_norm": 0.48828125, "learning_rate": 0.0002, "loss": 0.058709746599197386, "loss_d0": 0.059247952327132224, "step": 2440 }, { "epoch": 61.25, "grad_norm": 0.392578125, "learning_rate": 0.0002, "loss": 0.059135335683822635, "loss_d0": 0.0596803393214941, "step": 2450 }, { "epoch": 61.5, "grad_norm": 0.51953125, "learning_rate": 0.0002, "loss": 0.05420001745223999, "loss_d0": 0.05439855307340622, "step": 2460 }, { "epoch": 61.75, "grad_norm": 0.36328125, "learning_rate": 0.0002, "loss": 0.051242280006408694, "loss_d0": 0.05156247094273567, "step": 2470 }, { "epoch": 62.0, "grad_norm": 0.330078125, "learning_rate": 0.0002, "loss": 0.05718609094619751, "loss_d0": 0.05745496265590191, "step": 2480 }, { "epoch": 62.25, "grad_norm": 0.35546875, "learning_rate": 0.0002, "loss": 0.04888695478439331, "loss_d0": 0.04925457388162613, "step": 2490 }, { "epoch": 62.5, "grad_norm": 0.38671875, "learning_rate": 0.0002, "loss": 0.051664423942565915, "loss_d0": 0.05186402052640915, "step": 2500 }, { "epoch": 62.5, "eval_loss": 8.208417892456055, "eval_runtime": 0.3448, "eval_samples_per_second": 725.048, "eval_steps_per_second": 72.505, "step": 2500 }, { "epoch": 62.75, "grad_norm": 0.51953125, "learning_rate": 0.0002, "loss": 0.05614182949066162, "loss_d0": 0.05651816315948963, "step": 2510 }, { "epoch": 63.0, "grad_norm": 0.423828125, "learning_rate": 0.0002, "loss": 0.053869009017944336, "loss_d0": 0.05419423021376133, "step": 2520 }, { "epoch": 63.25, "grad_norm": 0.310546875, "learning_rate": 0.0002, "loss": 0.05018726587295532, "loss_d0": 0.05073915831744671, "step": 2530 }, { "epoch": 63.5, "grad_norm": 0.38671875, "learning_rate": 0.0002, "loss": 0.05394603013992309, "loss_d0": 0.05411759801208973, "step": 2540 }, { "epoch": 63.75, "grad_norm": 0.390625, "learning_rate": 0.0002, "loss": 0.05712904930114746, "loss_d0": 0.057449503988027575, "step": 2550 }, { "epoch": 64.0, "grad_norm": 0.416015625, "learning_rate": 0.0002, "loss": 0.05660791397094726, "loss_d0": 0.05653563365340233, "step": 2560 }, { "epoch": 64.25, "grad_norm": 0.392578125, "learning_rate": 0.0002, "loss": 0.053469395637512206, "loss_d0": 0.05360211282968521, "step": 2570 }, { "epoch": 64.5, "grad_norm": 0.361328125, "learning_rate": 0.0002, "loss": 0.05392343997955322, "loss_d0": 0.0542771577835083, "step": 2580 }, { "epoch": 64.75, "grad_norm": 0.474609375, "learning_rate": 0.0002, "loss": 0.05510370135307312, "loss_d0": 0.0556726049631834, "step": 2590 }, { "epoch": 65.0, "grad_norm": 0.44921875, "learning_rate": 0.0002, "loss": 0.05375306606292725, "loss_d0": 0.054018044471740724, "step": 2600 }, { "epoch": 65.25, "grad_norm": 0.3671875, "learning_rate": 0.0002, "loss": 0.04939930737018585, "loss_d0": 0.04965954720973968, "step": 2610 }, { "epoch": 65.5, "grad_norm": 0.365234375, "learning_rate": 0.0002, "loss": 0.04847543239593506, "loss_d0": 0.04878879524767399, "step": 2620 }, { "epoch": 65.75, "grad_norm": 0.6171875, "learning_rate": 0.0002, "loss": 0.05529288053512573, "loss_d0": 0.05569577738642693, "step": 2630 }, { "epoch": 66.0, "grad_norm": 0.5625, "learning_rate": 0.0002, "loss": 0.058045816421508786, "loss_d0": 0.058395038917660715, "step": 2640 }, { "epoch": 66.25, "grad_norm": 0.31640625, "learning_rate": 0.0002, "loss": 0.050916659832000735, "loss_d0": 0.05154414139688015, "step": 2650 }, { "epoch": 66.5, "grad_norm": 0.42578125, "learning_rate": 0.0002, "loss": 0.05039163827896118, "loss_d0": 0.050868920236825946, "step": 2660 }, { "epoch": 66.75, "grad_norm": 0.359375, "learning_rate": 0.0002, "loss": 0.0557156503200531, "loss_d0": 0.05598639473319054, "step": 2670 }, { "epoch": 67.0, "grad_norm": 0.435546875, "learning_rate": 0.0002, "loss": 0.05896541476249695, "loss_d0": 0.059347905591130255, "step": 2680 }, { "epoch": 67.25, "grad_norm": 0.46484375, "learning_rate": 0.0002, "loss": 0.04818243384361267, "loss_d0": 0.0484800923615694, "step": 2690 }, { "epoch": 67.5, "grad_norm": 0.39453125, "learning_rate": 0.0002, "loss": 0.055252212285995486, "loss_d0": 0.05612879283726215, "step": 2700 }, { "epoch": 67.75, "grad_norm": 0.37109375, "learning_rate": 0.0002, "loss": 0.05248673558235169, "loss_d0": 0.05283830314874649, "step": 2710 }, { "epoch": 68.0, "grad_norm": 0.62109375, "learning_rate": 0.0002, "loss": 0.05527347922325134, "loss_d0": 0.055605581402778624, "step": 2720 }, { "epoch": 68.25, "grad_norm": 0.53515625, "learning_rate": 0.0002, "loss": 0.05481758713722229, "loss_d0": 0.055027333274483684, "step": 2730 }, { "epoch": 68.5, "grad_norm": 0.380859375, "learning_rate": 0.0002, "loss": 0.05644075870513916, "loss_d0": 0.056725147366523745, "step": 2740 }, { "epoch": 68.75, "grad_norm": 0.51171875, "learning_rate": 0.0002, "loss": 0.057813364267349246, "loss_d0": 0.05852428674697876, "step": 2750 }, { "epoch": 69.0, "grad_norm": 0.49609375, "learning_rate": 0.0002, "loss": 0.059580165147781375, "loss_d0": 0.06016777530312538, "step": 2760 }, { "epoch": 69.25, "grad_norm": 0.38671875, "learning_rate": 0.0002, "loss": 0.05708110332489014, "loss_d0": 0.05751705914735794, "step": 2770 }, { "epoch": 69.5, "grad_norm": 0.44140625, "learning_rate": 0.0002, "loss": 0.05195104479789734, "loss_d0": 0.052196959406137465, "step": 2780 }, { "epoch": 69.75, "grad_norm": 0.484375, "learning_rate": 0.0002, "loss": 0.05186697244644165, "loss_d0": 0.05212553851306438, "step": 2790 }, { "epoch": 70.0, "grad_norm": 0.482421875, "learning_rate": 0.0002, "loss": 0.05758950710296631, "loss_d0": 0.05797795578837395, "step": 2800 }, { "epoch": 70.25, "grad_norm": 0.353515625, "learning_rate": 0.0002, "loss": 0.04725401401519776, "loss_d0": 0.047584396228194235, "step": 2810 }, { "epoch": 70.5, "grad_norm": 0.33203125, "learning_rate": 0.0002, "loss": 0.05146564841270447, "loss_d0": 0.05187108106911183, "step": 2820 }, { "epoch": 70.75, "grad_norm": 0.5078125, "learning_rate": 0.0002, "loss": 0.05590651035308838, "loss_d0": 0.056247909739613536, "step": 2830 }, { "epoch": 71.0, "grad_norm": 0.43359375, "learning_rate": 0.0002, "loss": 0.055702883005142215, "loss_d0": 0.05585823506116867, "step": 2840 }, { "epoch": 71.25, "grad_norm": 0.4140625, "learning_rate": 0.0002, "loss": 0.0496380478143692, "loss_d0": 0.04990372993052006, "step": 2850 }, { "epoch": 71.5, "grad_norm": 0.384765625, "learning_rate": 0.0002, "loss": 0.0478007048368454, "loss_d0": 0.048089010268449785, "step": 2860 }, { "epoch": 71.75, "grad_norm": 0.421875, "learning_rate": 0.0002, "loss": 0.05283045768737793, "loss_d0": 0.05304308496415615, "step": 2870 }, { "epoch": 72.0, "grad_norm": 0.35546875, "learning_rate": 0.0002, "loss": 0.05530112385749817, "loss_d0": 0.055600708723068236, "step": 2880 }, { "epoch": 72.25, "grad_norm": 0.333984375, "learning_rate": 0.0002, "loss": 0.04873108565807342, "loss_d0": 0.049191296473145484, "step": 2890 }, { "epoch": 72.5, "grad_norm": 0.326171875, "learning_rate": 0.0002, "loss": 0.046818670630455014, "loss_d0": 0.04713470712304115, "step": 2900 }, { "epoch": 72.75, "grad_norm": 0.431640625, "learning_rate": 0.0002, "loss": 0.0500145673751831, "loss_d0": 0.05044983923435211, "step": 2910 }, { "epoch": 73.0, "grad_norm": 0.396484375, "learning_rate": 0.0002, "loss": 0.052328604459762576, "loss_d0": 0.052925263345241544, "step": 2920 }, { "epoch": 73.25, "grad_norm": 0.478515625, "learning_rate": 0.0002, "loss": 0.05180770754814148, "loss_d0": 0.05192505940794945, "step": 2930 }, { "epoch": 73.5, "grad_norm": 0.375, "learning_rate": 0.0002, "loss": 0.0494821310043335, "loss_d0": 0.049676749110221866, "step": 2940 }, { "epoch": 73.75, "grad_norm": 0.466796875, "learning_rate": 0.0002, "loss": 0.052517324686050415, "loss_d0": 0.05272014886140823, "step": 2950 }, { "epoch": 74.0, "grad_norm": 0.49609375, "learning_rate": 0.0002, "loss": 0.05500271916389465, "loss_d0": 0.0552448246628046, "step": 2960 }, { "epoch": 74.25, "grad_norm": 0.33203125, "learning_rate": 0.0002, "loss": 0.05111870765686035, "loss_d0": 0.05123648978769779, "step": 2970 }, { "epoch": 74.5, "grad_norm": 0.609375, "learning_rate": 0.0002, "loss": 0.05168828368186951, "loss_d0": 0.05195821598172188, "step": 2980 }, { "epoch": 74.75, "grad_norm": 0.55078125, "learning_rate": 0.0002, "loss": 0.06273810863494873, "loss_d0": 0.06293985731899739, "step": 2990 }, { "epoch": 75.0, "grad_norm": 0.3515625, "learning_rate": 0.0002, "loss": 0.061145073175430296, "loss_d0": 0.06176314204931259, "step": 3000 }, { "epoch": 75.0, "eval_loss": 9.752898216247559, "eval_runtime": 0.3445, "eval_samples_per_second": 725.747, "eval_steps_per_second": 72.575, "step": 3000 } ], "logging_steps": 10, "max_steps": 8000, "num_input_tokens_seen": 0, "num_train_epochs": 200, "save_steps": 1000, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 3.99653793349632e+16, "train_batch_size": 10, "trial_name": null, "trial_params": null }