{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 400.0, "eval_steps": 500, "global_step": 2000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 2.0, "grad_norm": 9.0625, "learning_rate": 1.8e-05, "loss": 2.418994331359863, "loss_d0": 2.423280668258667, "step": 10 }, { "epoch": 4.0, "grad_norm": 4.53125, "learning_rate": 3.8e-05, "loss": 0.9471499443054199, "loss_d0": 0.9483950972557068, "step": 20 }, { "epoch": 6.0, "grad_norm": 3.734375, "learning_rate": 5.8e-05, "loss": 0.5623598098754883, "loss_d0": 0.56459439098835, "step": 30 }, { "epoch": 8.0, "grad_norm": 4.0, "learning_rate": 7.800000000000001e-05, "loss": 0.40128116607666015, "loss_d0": 0.4030485600233078, "step": 40 }, { "epoch": 10.0, "grad_norm": 2.65625, "learning_rate": 9.8e-05, "loss": 0.28589348793029784, "loss_d0": 0.28680678009986876, "step": 50 }, { "epoch": 12.0, "grad_norm": 2.578125, "learning_rate": 0.000118, "loss": 0.2765557527542114, "loss_d0": 0.27714781165122987, "step": 60 }, { "epoch": 14.0, "grad_norm": 2.921875, "learning_rate": 0.000138, "loss": 0.24961316585540771, "loss_d0": 0.2508685752749443, "step": 70 }, { "epoch": 16.0, "grad_norm": 2.625, "learning_rate": 0.00015800000000000002, "loss": 0.22726972103118898, "loss_d0": 0.22790100574493408, "step": 80 }, { "epoch": 18.0, "grad_norm": 1.9453125, "learning_rate": 0.00017800000000000002, "loss": 0.17535831928253173, "loss_d0": 0.17523229271173477, "step": 90 }, { "epoch": 20.0, "grad_norm": 1.8125, "learning_rate": 0.00019800000000000002, "loss": 0.13673940896987916, "loss_d0": 0.13673204109072684, "step": 100 }, { "epoch": 22.0, "grad_norm": 1.3828125, "learning_rate": 0.0002, "loss": 0.11648437976837159, "loss_d0": 0.11471812278032303, "step": 110 }, { "epoch": 24.0, "grad_norm": 1.328125, "learning_rate": 0.0002, "loss": 0.1015650749206543, "loss_d0": 0.10103901475667953, "step": 120 }, { "epoch": 26.0, "grad_norm": 1.1875, "learning_rate": 0.0002, "loss": 0.08723539113998413, "loss_d0": 0.08815691880881786, "step": 130 }, { "epoch": 28.0, "grad_norm": 0.8828125, "learning_rate": 0.0002, "loss": 0.08241847753524781, "loss_d0": 0.08273882381618022, "step": 140 }, { "epoch": 30.0, "grad_norm": 1.7421875, "learning_rate": 0.0002, "loss": 0.08337835669517517, "loss_d0": 0.08354556560516357, "step": 150 }, { "epoch": 32.0, "grad_norm": 1.1953125, "learning_rate": 0.0002, "loss": 0.06866609454154968, "loss_d0": 0.06860040538012982, "step": 160 }, { "epoch": 34.0, "grad_norm": 0.74609375, "learning_rate": 0.0002, "loss": 0.053651779890060425, "loss_d0": 0.0539071150124073, "step": 170 }, { "epoch": 36.0, "grad_norm": 0.6328125, "learning_rate": 0.0002, "loss": 0.05598109364509583, "loss_d0": 0.05669083409011364, "step": 180 }, { "epoch": 38.0, "grad_norm": 1.421875, "learning_rate": 0.0002, "loss": 0.0645066499710083, "loss_d0": 0.06387052945792675, "step": 190 }, { "epoch": 40.0, "grad_norm": 0.734375, "learning_rate": 0.0002, "loss": 0.05241028070449829, "loss_d0": 0.05293848738074303, "step": 200 }, { "epoch": 42.0, "grad_norm": 0.5390625, "learning_rate": 0.0002, "loss": 0.05211336016654968, "loss_d0": 0.052401353046298026, "step": 210 }, { "epoch": 44.0, "grad_norm": 0.57421875, "learning_rate": 0.0002, "loss": 0.05016546249389649, "loss_d0": 0.050755372270941734, "step": 220 }, { "epoch": 46.0, "grad_norm": 0.71875, "learning_rate": 0.0002, "loss": 0.041543081402778625, "loss_d0": 0.042144207283854485, "step": 230 }, { "epoch": 48.0, "grad_norm": 0.78515625, "learning_rate": 0.0002, "loss": 0.05228267908096314, "loss_d0": 0.05261162966489792, "step": 240 }, { "epoch": 50.0, "grad_norm": 0.66796875, "learning_rate": 0.0002, "loss": 0.05244388580322266, "loss_d0": 0.05229940041899681, "step": 250 }, { "epoch": 52.0, "grad_norm": 0.88671875, "learning_rate": 0.0002, "loss": 0.05073425769805908, "loss_d0": 0.051067108660936354, "step": 260 }, { "epoch": 54.0, "grad_norm": 0.71875, "learning_rate": 0.0002, "loss": 0.06447980999946594, "loss_d0": 0.06431438736617565, "step": 270 }, { "epoch": 56.0, "grad_norm": 0.47265625, "learning_rate": 0.0002, "loss": 0.05653516054153442, "loss_d0": 0.05646625086665154, "step": 280 }, { "epoch": 58.0, "grad_norm": 0.578125, "learning_rate": 0.0002, "loss": 0.04778359830379486, "loss_d0": 0.04764467999339104, "step": 290 }, { "epoch": 60.0, "grad_norm": 0.73828125, "learning_rate": 0.0002, "loss": 0.054469555616378784, "loss_d0": 0.055085692554712296, "step": 300 }, { "epoch": 62.0, "grad_norm": 0.609375, "learning_rate": 0.0002, "loss": 0.041742435097694396, "loss_d0": 0.04279345571994782, "step": 310 }, { "epoch": 64.0, "grad_norm": 0.55078125, "learning_rate": 0.0002, "loss": 0.042937666177749634, "loss_d0": 0.0437875846400857, "step": 320 }, { "epoch": 66.0, "grad_norm": 0.5078125, "learning_rate": 0.0002, "loss": 0.041009509563446046, "loss_d0": 0.0414072010666132, "step": 330 }, { "epoch": 68.0, "grad_norm": 0.625, "learning_rate": 0.0002, "loss": 0.048875680565834044, "loss_d0": 0.04988762177526951, "step": 340 }, { "epoch": 70.0, "grad_norm": 0.578125, "learning_rate": 0.0002, "loss": 0.04380723237991333, "loss_d0": 0.04455060698091984, "step": 350 }, { "epoch": 72.0, "grad_norm": 0.359375, "learning_rate": 0.0002, "loss": 0.040441864728927614, "loss_d0": 0.04014628697186708, "step": 360 }, { "epoch": 74.0, "grad_norm": 0.265625, "learning_rate": 0.0002, "loss": 0.030716186761856078, "loss_d0": 0.0307559696957469, "step": 370 }, { "epoch": 76.0, "grad_norm": 0.32421875, "learning_rate": 0.0002, "loss": 0.028968781232833862, "loss_d0": 0.029201462492346765, "step": 380 }, { "epoch": 78.0, "grad_norm": 0.244140625, "learning_rate": 0.0002, "loss": 0.029742777347564697, "loss_d0": 0.029923729598522186, "step": 390 }, { "epoch": 80.0, "grad_norm": 0.2421875, "learning_rate": 0.0002, "loss": 0.028669720888137816, "loss_d0": 0.028858649916946887, "step": 400 }, { "epoch": 82.0, "grad_norm": 0.240234375, "learning_rate": 0.0002, "loss": 0.028132319450378418, "loss_d0": 0.02834435775876045, "step": 410 }, { "epoch": 84.0, "grad_norm": 0.380859375, "learning_rate": 0.0002, "loss": 0.02881980538368225, "loss_d0": 0.029026586934924124, "step": 420 }, { "epoch": 86.0, "grad_norm": 0.2080078125, "learning_rate": 0.0002, "loss": 0.028524792194366454, "loss_d0": 0.028784673288464548, "step": 430 }, { "epoch": 88.0, "grad_norm": 0.380859375, "learning_rate": 0.0002, "loss": 0.029756176471710204, "loss_d0": 0.0299751091748476, "step": 440 }, { "epoch": 90.0, "grad_norm": 0.2099609375, "learning_rate": 0.0002, "loss": 0.02948334515094757, "loss_d0": 0.029621412977576256, "step": 450 }, { "epoch": 92.0, "grad_norm": 0.28515625, "learning_rate": 0.0002, "loss": 0.030714261531829833, "loss_d0": 0.030979700013995172, "step": 460 }, { "epoch": 94.0, "grad_norm": 0.294921875, "learning_rate": 0.0002, "loss": 0.030224135518074034, "loss_d0": 0.030322908796370028, "step": 470 }, { "epoch": 96.0, "grad_norm": 0.59375, "learning_rate": 0.0002, "loss": 0.04414036273956299, "loss_d0": 0.04425068683922291, "step": 480 }, { "epoch": 98.0, "grad_norm": 1.078125, "learning_rate": 0.0002, "loss": 0.04671807289123535, "loss_d0": 0.046425480581820014, "step": 490 }, { "epoch": 100.0, "grad_norm": 0.73828125, "learning_rate": 0.0002, "loss": 0.07045136690139771, "loss_d0": 0.07064050324261188, "step": 500 }, { "epoch": 100.0, "eval_loss": 8.959203720092773, "eval_runtime": 0.3447, "eval_samples_per_second": 725.191, "eval_steps_per_second": 72.519, "step": 500 }, { "epoch": 102.0, "grad_norm": 0.6875, "learning_rate": 0.0002, "loss": 0.06712871193885803, "loss_d0": 0.06785535477101803, "step": 510 }, { "epoch": 104.0, "grad_norm": 0.4375, "learning_rate": 0.0002, "loss": 0.04896087944507599, "loss_d0": 0.04912064522504807, "step": 520 }, { "epoch": 106.0, "grad_norm": 0.5390625, "learning_rate": 0.0002, "loss": 0.05117716193199158, "loss_d0": 0.05100610740482807, "step": 530 }, { "epoch": 108.0, "grad_norm": 0.921875, "learning_rate": 0.0002, "loss": 0.05128544569015503, "loss_d0": 0.05223123952746391, "step": 540 }, { "epoch": 110.0, "grad_norm": 0.76953125, "learning_rate": 0.0002, "loss": 0.04075254797935486, "loss_d0": 0.04160372149199247, "step": 550 }, { "epoch": 112.0, "grad_norm": 0.51171875, "learning_rate": 0.0002, "loss": 0.03934467732906342, "loss_d0": 0.039441941492259505, "step": 560 }, { "epoch": 114.0, "grad_norm": 0.431640625, "learning_rate": 0.0002, "loss": 0.033867093920707705, "loss_d0": 0.03388459365814924, "step": 570 }, { "epoch": 116.0, "grad_norm": 0.337890625, "learning_rate": 0.0002, "loss": 0.0360151618719101, "loss_d0": 0.03605454880744219, "step": 580 }, { "epoch": 118.0, "grad_norm": 0.255859375, "learning_rate": 0.0002, "loss": 0.030016973614692688, "loss_d0": 0.030266443826258184, "step": 590 }, { "epoch": 120.0, "grad_norm": 0.86328125, "learning_rate": 0.0002, "loss": 0.029359149932861327, "loss_d0": 0.029560688696801663, "step": 600 }, { "epoch": 122.0, "grad_norm": 0.267578125, "learning_rate": 0.0002, "loss": 0.02911534309387207, "loss_d0": 0.029265684261918067, "step": 610 }, { "epoch": 124.0, "grad_norm": 0.19921875, "learning_rate": 0.0002, "loss": 0.02807998061180115, "loss_d0": 0.028299786895513535, "step": 620 }, { "epoch": 126.0, "grad_norm": 0.384765625, "learning_rate": 0.0002, "loss": 0.027643266320228576, "loss_d0": 0.02785799019038677, "step": 630 }, { "epoch": 128.0, "grad_norm": 0.2470703125, "learning_rate": 0.0002, "loss": 0.027844372391700744, "loss_d0": 0.028002014197409154, "step": 640 }, { "epoch": 130.0, "grad_norm": 0.240234375, "learning_rate": 0.0002, "loss": 0.027933624386787415, "loss_d0": 0.02816301938146353, "step": 650 }, { "epoch": 132.0, "grad_norm": 0.32421875, "learning_rate": 0.0002, "loss": 0.028434035181999207, "loss_d0": 0.028620816953480243, "step": 660 }, { "epoch": 134.0, "grad_norm": 0.2216796875, "learning_rate": 0.0002, "loss": 0.028094932436943054, "loss_d0": 0.028314914368093014, "step": 670 }, { "epoch": 136.0, "grad_norm": 0.2294921875, "learning_rate": 0.0002, "loss": 0.028378623723983764, "loss_d0": 0.028593042865395546, "step": 680 }, { "epoch": 138.0, "grad_norm": 0.2734375, "learning_rate": 0.0002, "loss": 0.028746598958969118, "loss_d0": 0.028957749716937542, "step": 690 }, { "epoch": 140.0, "grad_norm": 0.455078125, "learning_rate": 0.0002, "loss": 0.028535950183868408, "loss_d0": 0.028712566196918487, "step": 700 }, { "epoch": 142.0, "grad_norm": 0.2314453125, "learning_rate": 0.0002, "loss": 0.028533819317817687, "loss_d0": 0.028727527521550656, "step": 710 }, { "epoch": 144.0, "grad_norm": 0.337890625, "learning_rate": 0.0002, "loss": 0.028585079312324523, "loss_d0": 0.02878807336091995, "step": 720 }, { "epoch": 146.0, "grad_norm": 0.26953125, "learning_rate": 0.0002, "loss": 0.028488412499427795, "loss_d0": 0.028675549291074277, "step": 730 }, { "epoch": 148.0, "grad_norm": 0.298828125, "learning_rate": 0.0002, "loss": 0.028854280710220337, "loss_d0": 0.029053621739149094, "step": 740 }, { "epoch": 150.0, "grad_norm": 0.2119140625, "learning_rate": 0.0002, "loss": 0.02862183153629303, "loss_d0": 0.028778632916510106, "step": 750 }, { "epoch": 152.0, "grad_norm": 0.275390625, "learning_rate": 0.0002, "loss": 0.028436908125877382, "loss_d0": 0.028733734413981436, "step": 760 }, { "epoch": 154.0, "grad_norm": 0.21875, "learning_rate": 0.0002, "loss": 0.027613097429275514, "loss_d0": 0.027862665802240373, "step": 770 }, { "epoch": 156.0, "grad_norm": 0.2734375, "learning_rate": 0.0002, "loss": 0.027435335516929626, "loss_d0": 0.027639228850603104, "step": 780 }, { "epoch": 158.0, "grad_norm": 0.220703125, "learning_rate": 0.0002, "loss": 0.0274164617061615, "loss_d0": 0.027649453654885293, "step": 790 }, { "epoch": 160.0, "grad_norm": 0.35546875, "learning_rate": 0.0002, "loss": 0.027769792079925536, "loss_d0": 0.02795196920633316, "step": 800 }, { "epoch": 162.0, "grad_norm": 0.2578125, "learning_rate": 0.0002, "loss": 0.028336551785469056, "loss_d0": 0.028514006175100803, "step": 810 }, { "epoch": 164.0, "grad_norm": 0.296875, "learning_rate": 0.0002, "loss": 0.027915754914283754, "loss_d0": 0.028118485398590565, "step": 820 }, { "epoch": 166.0, "grad_norm": 0.326171875, "learning_rate": 0.0002, "loss": 0.02842898666858673, "loss_d0": 0.028575334511697293, "step": 830 }, { "epoch": 168.0, "grad_norm": 0.40625, "learning_rate": 0.0002, "loss": 0.028567203879356386, "loss_d0": 0.028683514893054964, "step": 840 }, { "epoch": 170.0, "grad_norm": 0.240234375, "learning_rate": 0.0002, "loss": 0.02767796516418457, "loss_d0": 0.02789214290678501, "step": 850 }, { "epoch": 172.0, "grad_norm": 0.3828125, "learning_rate": 0.0002, "loss": 0.027684780955314636, "loss_d0": 0.02787543125450611, "step": 860 }, { "epoch": 174.0, "grad_norm": 0.2890625, "learning_rate": 0.0002, "loss": 0.0280588835477829, "loss_d0": 0.028297702036798, "step": 870 }, { "epoch": 176.0, "grad_norm": 0.28515625, "learning_rate": 0.0002, "loss": 0.027783623337745665, "loss_d0": 0.028036702796816824, "step": 880 }, { "epoch": 178.0, "grad_norm": 0.33984375, "learning_rate": 0.0002, "loss": 0.02792365550994873, "loss_d0": 0.028142866864800452, "step": 890 }, { "epoch": 180.0, "grad_norm": 0.255859375, "learning_rate": 0.0002, "loss": 0.027568233013153077, "loss_d0": 0.027781904488801957, "step": 900 }, { "epoch": 182.0, "grad_norm": 0.337890625, "learning_rate": 0.0002, "loss": 0.0276969313621521, "loss_d0": 0.027824966609477995, "step": 910 }, { "epoch": 184.0, "grad_norm": 0.41015625, "learning_rate": 0.0002, "loss": 0.028015774488449097, "loss_d0": 0.02823227122426033, "step": 920 }, { "epoch": 186.0, "grad_norm": 0.33203125, "learning_rate": 0.0002, "loss": 0.02751585841178894, "loss_d0": 0.027756123058497905, "step": 930 }, { "epoch": 188.0, "grad_norm": 0.29296875, "learning_rate": 0.0002, "loss": 0.0278137743473053, "loss_d0": 0.0280290137976408, "step": 940 }, { "epoch": 190.0, "grad_norm": 0.21484375, "learning_rate": 0.0002, "loss": 0.02724808156490326, "loss_d0": 0.027457468770444395, "step": 950 }, { "epoch": 192.0, "grad_norm": 0.359375, "learning_rate": 0.0002, "loss": 0.02748032510280609, "loss_d0": 0.027659581601619722, "step": 960 }, { "epoch": 194.0, "grad_norm": 0.2138671875, "learning_rate": 0.0002, "loss": 0.027248311042785644, "loss_d0": 0.027455149777233602, "step": 970 }, { "epoch": 196.0, "grad_norm": 0.234375, "learning_rate": 0.0002, "loss": 0.027402669191360474, "loss_d0": 0.02764355856925249, "step": 980 }, { "epoch": 198.0, "grad_norm": 0.251953125, "learning_rate": 0.0002, "loss": 0.027301329374313354, "loss_d0": 0.027496096305549146, "step": 990 }, { "epoch": 200.0, "grad_norm": 0.2890625, "learning_rate": 0.0002, "loss": 0.02728489935398102, "loss_d0": 0.027470245584845544, "step": 1000 }, { "epoch": 200.0, "eval_loss": 11.642775535583496, "eval_runtime": 0.3432, "eval_samples_per_second": 728.437, "eval_steps_per_second": 72.844, "step": 1000 }, { "epoch": 202.0, "grad_norm": 0.29296875, "learning_rate": 0.0002, "loss": 0.02735854685306549, "loss_d0": 0.027549722604453562, "step": 1010 }, { "epoch": 204.0, "grad_norm": 0.2431640625, "learning_rate": 0.0002, "loss": 0.027801865339279176, "loss_d0": 0.028005635365843773, "step": 1020 }, { "epoch": 206.0, "grad_norm": 0.369140625, "learning_rate": 0.0002, "loss": 0.027131298184394838, "loss_d0": 0.027335867658257483, "step": 1030 }, { "epoch": 208.0, "grad_norm": 0.29296875, "learning_rate": 0.0002, "loss": 0.027349919080734253, "loss_d0": 0.02756602894514799, "step": 1040 }, { "epoch": 210.0, "grad_norm": 0.236328125, "learning_rate": 0.0002, "loss": 0.027464228868484496, "loss_d0": 0.027678760513663293, "step": 1050 }, { "epoch": 212.0, "grad_norm": 0.341796875, "learning_rate": 0.0002, "loss": 0.027161532640457155, "loss_d0": 0.02738652192056179, "step": 1060 }, { "epoch": 214.0, "grad_norm": 0.23046875, "learning_rate": 0.0002, "loss": 0.027511611580848694, "loss_d0": 0.02768396809697151, "step": 1070 }, { "epoch": 216.0, "grad_norm": 0.33203125, "learning_rate": 0.0002, "loss": 0.027651122212409972, "loss_d0": 0.027797568403184415, "step": 1080 }, { "epoch": 218.0, "grad_norm": 0.267578125, "learning_rate": 0.0002, "loss": 0.02745751440525055, "loss_d0": 0.027669144794344902, "step": 1090 }, { "epoch": 220.0, "grad_norm": 0.296875, "learning_rate": 0.0002, "loss": 0.027723565697669983, "loss_d0": 0.02790863234549761, "step": 1100 }, { "epoch": 222.0, "grad_norm": 0.255859375, "learning_rate": 0.0002, "loss": 0.02735493779182434, "loss_d0": 0.027564115822315216, "step": 1110 }, { "epoch": 224.0, "grad_norm": 0.2421875, "learning_rate": 0.0002, "loss": 0.026864311099052428, "loss_d0": 0.027068359963595866, "step": 1120 }, { "epoch": 226.0, "grad_norm": 0.34765625, "learning_rate": 0.0002, "loss": 0.02702401876449585, "loss_d0": 0.02721490990370512, "step": 1130 }, { "epoch": 228.0, "grad_norm": 0.38671875, "learning_rate": 0.0002, "loss": 0.027210086584091187, "loss_d0": 0.027409385330975054, "step": 1140 }, { "epoch": 230.0, "grad_norm": 0.3828125, "learning_rate": 0.0002, "loss": 0.02788194715976715, "loss_d0": 0.028096820414066314, "step": 1150 }, { "epoch": 232.0, "grad_norm": 0.25390625, "learning_rate": 0.0002, "loss": 0.02745024561882019, "loss_d0": 0.02763645313680172, "step": 1160 }, { "epoch": 234.0, "grad_norm": 0.29296875, "learning_rate": 0.0002, "loss": 0.027583950757980348, "loss_d0": 0.027757029607892038, "step": 1170 }, { "epoch": 236.0, "grad_norm": 0.35546875, "learning_rate": 0.0002, "loss": 0.027706864476203918, "loss_d0": 0.027875961363315584, "step": 1180 }, { "epoch": 238.0, "grad_norm": 0.412109375, "learning_rate": 0.0002, "loss": 0.027233675122261047, "loss_d0": 0.027483156137168407, "step": 1190 }, { "epoch": 240.0, "grad_norm": 0.484375, "learning_rate": 0.0002, "loss": 0.028237748146057128, "loss_d0": 0.028435330465435983, "step": 1200 }, { "epoch": 242.0, "grad_norm": 0.341796875, "learning_rate": 0.0002, "loss": 0.028385213017463683, "loss_d0": 0.02854954022914171, "step": 1210 }, { "epoch": 244.0, "grad_norm": 1.4765625, "learning_rate": 0.0002, "loss": 0.07820796370506286, "loss_d0": 0.07887713219970464, "step": 1220 }, { "epoch": 246.0, "grad_norm": 0.55078125, "learning_rate": 0.0002, "loss": 0.06436525583267212, "loss_d0": 0.06421407721936703, "step": 1230 }, { "epoch": 248.0, "grad_norm": 0.796875, "learning_rate": 0.0002, "loss": 0.04631165564060211, "loss_d0": 0.04691880084574222, "step": 1240 }, { "epoch": 250.0, "grad_norm": 0.3671875, "learning_rate": 0.0002, "loss": 0.04134821593761444, "loss_d0": 0.04087922126054764, "step": 1250 }, { "epoch": 252.0, "grad_norm": 0.2470703125, "learning_rate": 0.0002, "loss": 0.0302289217710495, "loss_d0": 0.03042766097933054, "step": 1260 }, { "epoch": 254.0, "grad_norm": 0.29296875, "learning_rate": 0.0002, "loss": 0.02885407507419586, "loss_d0": 0.029020925983786583, "step": 1270 }, { "epoch": 256.0, "grad_norm": 0.2890625, "learning_rate": 0.0002, "loss": 0.02922482490539551, "loss_d0": 0.029606640711426734, "step": 1280 }, { "epoch": 258.0, "grad_norm": 0.2333984375, "learning_rate": 0.0002, "loss": 0.027226346731185912, "loss_d0": 0.027418379485607148, "step": 1290 }, { "epoch": 260.0, "grad_norm": 0.31640625, "learning_rate": 0.0002, "loss": 0.027053937315940857, "loss_d0": 0.027259073778986932, "step": 1300 }, { "epoch": 262.0, "grad_norm": 0.29296875, "learning_rate": 0.0002, "loss": 0.027176541090011597, "loss_d0": 0.02738271653652191, "step": 1310 }, { "epoch": 264.0, "grad_norm": 0.28515625, "learning_rate": 0.0002, "loss": 0.026905521750450134, "loss_d0": 0.027155109308660032, "step": 1320 }, { "epoch": 266.0, "grad_norm": 0.26171875, "learning_rate": 0.0002, "loss": 0.0273532897233963, "loss_d0": 0.027509130537509918, "step": 1330 }, { "epoch": 268.0, "grad_norm": 0.294921875, "learning_rate": 0.0002, "loss": 0.02710416615009308, "loss_d0": 0.027293745800852774, "step": 1340 }, { "epoch": 270.0, "grad_norm": 0.2236328125, "learning_rate": 0.0002, "loss": 0.02694128155708313, "loss_d0": 0.027170353196561338, "step": 1350 }, { "epoch": 272.0, "grad_norm": 0.2421875, "learning_rate": 0.0002, "loss": 0.02707500457763672, "loss_d0": 0.027278581261634828, "step": 1360 }, { "epoch": 274.0, "grad_norm": 0.2216796875, "learning_rate": 0.0002, "loss": 0.02710617482662201, "loss_d0": 0.02733020707964897, "step": 1370 }, { "epoch": 276.0, "grad_norm": 0.265625, "learning_rate": 0.0002, "loss": 0.026942601799964903, "loss_d0": 0.027134068310260773, "step": 1380 }, { "epoch": 278.0, "grad_norm": 0.314453125, "learning_rate": 0.0002, "loss": 0.026836836338043214, "loss_d0": 0.02706842515617609, "step": 1390 }, { "epoch": 280.0, "grad_norm": 0.2890625, "learning_rate": 0.0002, "loss": 0.027437672019004822, "loss_d0": 0.027645259350538253, "step": 1400 }, { "epoch": 282.0, "grad_norm": 0.302734375, "learning_rate": 0.0002, "loss": 0.0270478755235672, "loss_d0": 0.02722824104130268, "step": 1410 }, { "epoch": 284.0, "grad_norm": 0.21875, "learning_rate": 0.0002, "loss": 0.02693583369255066, "loss_d0": 0.02716414462774992, "step": 1420 }, { "epoch": 286.0, "grad_norm": 0.28515625, "learning_rate": 0.0002, "loss": 0.027086949348449706, "loss_d0": 0.02727580312639475, "step": 1430 }, { "epoch": 288.0, "grad_norm": 0.22265625, "learning_rate": 0.0002, "loss": 0.026997911930084228, "loss_d0": 0.027215636894106866, "step": 1440 }, { "epoch": 290.0, "grad_norm": 0.2314453125, "learning_rate": 0.0002, "loss": 0.027128046751022337, "loss_d0": 0.027313951589167117, "step": 1450 }, { "epoch": 292.0, "grad_norm": 0.2734375, "learning_rate": 0.0002, "loss": 0.02703723907470703, "loss_d0": 0.02727229129523039, "step": 1460 }, { "epoch": 294.0, "grad_norm": 0.26171875, "learning_rate": 0.0002, "loss": 0.02702658772468567, "loss_d0": 0.027214765176177026, "step": 1470 }, { "epoch": 296.0, "grad_norm": 0.5, "learning_rate": 0.0002, "loss": 0.02745291292667389, "loss_d0": 0.027677034400403498, "step": 1480 }, { "epoch": 298.0, "grad_norm": 0.26953125, "learning_rate": 0.0002, "loss": 0.026951307058334352, "loss_d0": 0.027119937352836132, "step": 1490 }, { "epoch": 300.0, "grad_norm": 0.30859375, "learning_rate": 0.0002, "loss": 0.027886945009231567, "loss_d0": 0.028050208278000355, "step": 1500 }, { "epoch": 300.0, "eval_loss": 11.753874778747559, "eval_runtime": 0.3443, "eval_samples_per_second": 726.204, "eval_steps_per_second": 72.62, "step": 1500 }, { "epoch": 302.0, "grad_norm": 0.326171875, "learning_rate": 0.0002, "loss": 0.027407735586166382, "loss_d0": 0.027636309526860713, "step": 1510 }, { "epoch": 304.0, "grad_norm": 0.3671875, "learning_rate": 0.0002, "loss": 0.02735218107700348, "loss_d0": 0.02756862100213766, "step": 1520 }, { "epoch": 306.0, "grad_norm": 0.32421875, "learning_rate": 0.0002, "loss": 0.02719148397445679, "loss_d0": 0.027414854615926743, "step": 1530 }, { "epoch": 308.0, "grad_norm": 0.2353515625, "learning_rate": 0.0002, "loss": 0.027126818895339966, "loss_d0": 0.027357102558016776, "step": 1540 }, { "epoch": 310.0, "grad_norm": 0.2470703125, "learning_rate": 0.0002, "loss": 0.02752436101436615, "loss_d0": 0.027706788294017314, "step": 1550 }, { "epoch": 312.0, "grad_norm": 1.0859375, "learning_rate": 0.0002, "loss": 0.03637430667877197, "loss_d0": 0.0361976170912385, "step": 1560 }, { "epoch": 314.0, "grad_norm": 0.59765625, "learning_rate": 0.0002, "loss": 0.05565944910049438, "loss_d0": 0.05626031719148159, "step": 1570 }, { "epoch": 316.0, "grad_norm": 0.79296875, "learning_rate": 0.0002, "loss": 0.06168928146362305, "loss_d0": 0.06206231936812401, "step": 1580 }, { "epoch": 318.0, "grad_norm": 0.400390625, "learning_rate": 0.0002, "loss": 0.05846645832061768, "loss_d0": 0.060188758000731465, "step": 1590 }, { "epoch": 320.0, "grad_norm": 0.6875, "learning_rate": 0.0002, "loss": 0.05034934282302857, "loss_d0": 0.05091057028621435, "step": 1600 }, { "epoch": 322.0, "grad_norm": 0.310546875, "learning_rate": 0.00019995559043291586, "loss": 0.0373257964849472, "loss_d0": 0.03773617539554834, "step": 1610 }, { "epoch": 324.0, "grad_norm": 0.3125, "learning_rate": 0.0001998021321462845, "loss": 0.029404985904693603, "loss_d0": 0.02956023495644331, "step": 1620 }, { "epoch": 326.0, "grad_norm": 0.28515625, "learning_rate": 0.00019953926379459095, "loss": 0.029057389497756957, "loss_d0": 0.029157786443829537, "step": 1630 }, { "epoch": 328.0, "grad_norm": 0.328125, "learning_rate": 0.00019916730564242994, "loss": 0.03261968493461609, "loss_d0": 0.032432263158261775, "step": 1640 }, { "epoch": 330.0, "grad_norm": 0.271484375, "learning_rate": 0.00019868671086351413, "loss": 0.028703576326370238, "loss_d0": 0.02889830097556114, "step": 1650 }, { "epoch": 332.0, "grad_norm": 0.31640625, "learning_rate": 0.00019809806498855166, "loss": 0.027686920762062073, "loss_d0": 0.02781019788235426, "step": 1660 }, { "epoch": 334.0, "grad_norm": 0.26171875, "learning_rate": 0.00019740208519186726, "loss": 0.027178701758384705, "loss_d0": 0.027357110008597373, "step": 1670 }, { "epoch": 336.0, "grad_norm": 0.26171875, "learning_rate": 0.0001965996194176357, "loss": 0.027020579576492308, "loss_d0": 0.027211257629096507, "step": 1680 }, { "epoch": 338.0, "grad_norm": 0.2294921875, "learning_rate": 0.00019569164534679248, "loss": 0.027001625299453734, "loss_d0": 0.027210658043622972, "step": 1690 }, { "epoch": 340.0, "grad_norm": 0.2578125, "learning_rate": 0.0001946792692058803, "loss": 0.02686695158481598, "loss_d0": 0.02705973945558071, "step": 1700 }, { "epoch": 342.0, "grad_norm": 0.283203125, "learning_rate": 0.00019356372441928221, "loss": 0.02691388428211212, "loss_d0": 0.027120614424347878, "step": 1710 }, { "epoch": 344.0, "grad_norm": 0.322265625, "learning_rate": 0.00019234637010648426, "loss": 0.027087369561195375, "loss_d0": 0.02729078847914934, "step": 1720 }, { "epoch": 346.0, "grad_norm": 0.294921875, "learning_rate": 0.00019102868942619743, "loss": 0.027006912231445312, "loss_d0": 0.027164803072810172, "step": 1730 }, { "epoch": 348.0, "grad_norm": 0.2001953125, "learning_rate": 0.00018961228776935755, "loss": 0.026824173331260682, "loss_d0": 0.027049205265939236, "step": 1740 }, { "epoch": 350.0, "grad_norm": 0.35546875, "learning_rate": 0.00018809889080320357, "loss": 0.027346810698509215, "loss_d0": 0.02754506915807724, "step": 1750 }, { "epoch": 352.0, "grad_norm": 0.20703125, "learning_rate": 0.00018649034236881777, "loss": 0.026931869983673095, "loss_d0": 0.027164109982550144, "step": 1760 }, { "epoch": 354.0, "grad_norm": 0.248046875, "learning_rate": 0.00018478860223468955, "loss": 0.026971223950386047, "loss_d0": 0.027155683562159538, "step": 1770 }, { "epoch": 356.0, "grad_norm": 0.2451171875, "learning_rate": 0.0001829957437090394, "loss": 0.026918986439704896, "loss_d0": 0.027109501883387566, "step": 1780 }, { "epoch": 358.0, "grad_norm": 0.232421875, "learning_rate": 0.00018111395111381214, "loss": 0.026931074261665345, "loss_d0": 0.027130777202546596, "step": 1790 }, { "epoch": 360.0, "grad_norm": 0.2099609375, "learning_rate": 0.00017914551712341713, "loss": 0.026917403936386107, "loss_d0": 0.027093666046857832, "step": 1800 }, { "epoch": 362.0, "grad_norm": 0.251953125, "learning_rate": 0.0001770928399714576, "loss": 0.026946458220481872, "loss_d0": 0.027147732861340045, "step": 1810 }, { "epoch": 364.0, "grad_norm": 0.263671875, "learning_rate": 0.0001749584205288526, "loss": 0.026951560378074647, "loss_d0": 0.027163142152130604, "step": 1820 }, { "epoch": 366.0, "grad_norm": 0.2373046875, "learning_rate": 0.00017274485925691083, "loss": 0.026931411027908324, "loss_d0": 0.027134256064891817, "step": 1830 }, { "epoch": 368.0, "grad_norm": 0.294921875, "learning_rate": 0.00017045485303906913, "loss": 0.02700725793838501, "loss_d0": 0.02721524015069008, "step": 1840 }, { "epoch": 370.0, "grad_norm": 0.302734375, "learning_rate": 0.00016809119189515557, "loss": 0.026832824945449828, "loss_d0": 0.0270213108509779, "step": 1850 }, { "epoch": 372.0, "grad_norm": 0.251953125, "learning_rate": 0.00016565675558217989, "loss": 0.02687087655067444, "loss_d0": 0.027065552584826947, "step": 1860 }, { "epoch": 374.0, "grad_norm": 0.2001953125, "learning_rate": 0.00016315451008579328, "loss": 0.026832956075668334, "loss_d0": 0.027041353285312653, "step": 1870 }, { "epoch": 376.0, "grad_norm": 0.21875, "learning_rate": 0.00016058750400669178, "loss": 0.026945966482162475, "loss_d0": 0.027109875157475472, "step": 1880 }, { "epoch": 378.0, "grad_norm": 0.1962890625, "learning_rate": 0.0001579588648463657, "loss": 0.026940566301345826, "loss_d0": 0.02715429160743952, "step": 1890 }, { "epoch": 380.0, "grad_norm": 0.248046875, "learning_rate": 0.00015527179519672117, "loss": 0.026649385690689087, "loss_d0": 0.026848485693335533, "step": 1900 }, { "epoch": 382.0, "grad_norm": 0.37109375, "learning_rate": 0.00015252956883821488, "loss": 0.026962289214134218, "loss_d0": 0.02715070601552725, "step": 1910 }, { "epoch": 384.0, "grad_norm": 0.2412109375, "learning_rate": 0.00014973552675125708, "loss": 0.02674136757850647, "loss_d0": 0.026959112286567687, "step": 1920 }, { "epoch": 386.0, "grad_norm": 0.275390625, "learning_rate": 0.00014689307304574154, "loss": 0.026704049110412596, "loss_d0": 0.026865163631737233, "step": 1930 }, { "epoch": 388.0, "grad_norm": 0.2060546875, "learning_rate": 0.00014400567081366205, "loss": 0.026654690504074097, "loss_d0": 0.026883286982774736, "step": 1940 }, { "epoch": 390.0, "grad_norm": 0.291015625, "learning_rate": 0.00014107683790986813, "loss": 0.026780441403388977, "loss_d0": 0.026964642107486725, "step": 1950 }, { "epoch": 392.0, "grad_norm": 0.26171875, "learning_rate": 0.00013811014266610096, "loss": 0.026698926091194154, "loss_d0": 0.0269396111369133, "step": 1960 }, { "epoch": 394.0, "grad_norm": 0.283203125, "learning_rate": 0.00013510919954353066, "loss": 0.026647239923477173, "loss_d0": 0.026839211583137512, "step": 1970 }, { "epoch": 396.0, "grad_norm": 0.2470703125, "learning_rate": 0.00013207766472909225, "loss": 0.0267528235912323, "loss_d0": 0.026924306713044643, "step": 1980 }, { "epoch": 398.0, "grad_norm": 0.2431640625, "learning_rate": 0.000129019231680985, "loss": 0.026655691862106323, "loss_d0": 0.026865272782742977, "step": 1990 }, { "epoch": 400.0, "grad_norm": 0.25, "learning_rate": 0.0001259376266287625, "loss": 0.02653391659259796, "loss_d0": 0.026740485802292824, "step": 2000 }, { "epoch": 400.0, "eval_loss": 12.447556495666504, "eval_runtime": 0.3446, "eval_samples_per_second": 725.445, "eval_steps_per_second": 72.544, "step": 2000 } ], "logging_steps": 10, "max_steps": 2500, "num_input_tokens_seen": 0, "num_train_epochs": 500, "save_steps": 1000, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 2.638372371529728e+16, "train_batch_size": 10, "trial_name": null, "trial_params": null }