{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 28.571428571428573, "eval_steps": 500, "global_step": 2000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.14285714285714285, "grad_norm": 10.9375, "learning_rate": 1.8e-05, "loss": 2.708388328552246, "loss_d0": 4.110811305046082, "step": 10 }, { "epoch": 0.2857142857142857, "grad_norm": 6.375, "learning_rate": 3.8e-05, "loss": 1.2063720703125, "loss_d0": 1.8877601504325867, "step": 20 }, { "epoch": 0.42857142857142855, "grad_norm": 4.375, "learning_rate": 5.8e-05, "loss": 0.8983614921569825, "loss_d0": 1.4538785099983216, "step": 30 }, { "epoch": 0.5714285714285714, "grad_norm": 4.5, "learning_rate": 7.800000000000001e-05, "loss": 0.8970762252807617, "loss_d0": 1.425518774986267, "step": 40 }, { "epoch": 0.7142857142857143, "grad_norm": 4.4375, "learning_rate": 9.8e-05, "loss": 0.7297840118408203, "loss_d0": 1.340456622838974, "step": 50 }, { "epoch": 0.8571428571428571, "grad_norm": 3.390625, "learning_rate": 0.000118, "loss": 0.6489387512207031, "loss_d0": 1.0164853096008302, "step": 60 }, { "epoch": 1.0, "grad_norm": 3.84375, "learning_rate": 0.000138, "loss": 0.6557669162750244, "loss_d0": 0.9850718915462494, "step": 70 }, { "epoch": 1.1428571428571428, "grad_norm": 3.640625, "learning_rate": 0.00015800000000000002, "loss": 0.5417943000793457, "loss_d0": 0.7510321617126465, "step": 80 }, { "epoch": 1.2857142857142856, "grad_norm": 3.171875, "learning_rate": 0.00017800000000000002, "loss": 0.5557333469390869, "loss_d0": 0.726891279220581, "step": 90 }, { "epoch": 1.4285714285714286, "grad_norm": 3.1875, "learning_rate": 0.00019800000000000002, "loss": 0.5609831809997559, "loss_d0": 0.7925398766994476, "step": 100 }, { "epoch": 1.5714285714285714, "grad_norm": 4.625, "learning_rate": 0.0002, "loss": 0.49335689544677735, "loss_d0": 0.7104986011981964, "step": 110 }, { "epoch": 1.7142857142857144, "grad_norm": 2.921875, "learning_rate": 0.0002, "loss": 0.468343448638916, "loss_d0": 0.6982269883155823, "step": 120 }, { "epoch": 1.8571428571428572, "grad_norm": 2.46875, "learning_rate": 0.0002, "loss": 0.45113506317138674, "loss_d0": 0.6743539869785309, "step": 130 }, { "epoch": 2.0, "grad_norm": 2.609375, "learning_rate": 0.0002, "loss": 0.4742081642150879, "loss_d0": 0.7392071902751922, "step": 140 }, { "epoch": 2.142857142857143, "grad_norm": 2.640625, "learning_rate": 0.0002, "loss": 0.4260121822357178, "loss_d0": 0.6589436203241348, "step": 150 }, { "epoch": 2.2857142857142856, "grad_norm": 1.953125, "learning_rate": 0.0002, "loss": 0.39026267528533937, "loss_d0": 0.6157096266746521, "step": 160 }, { "epoch": 2.4285714285714284, "grad_norm": 2.09375, "learning_rate": 0.0002, "loss": 0.40253314971923826, "loss_d0": 0.6893241822719574, "step": 170 }, { "epoch": 2.571428571428571, "grad_norm": 2.203125, "learning_rate": 0.0002, "loss": 0.3850980758666992, "loss_d0": 0.623932832479477, "step": 180 }, { "epoch": 2.7142857142857144, "grad_norm": 1.875, "learning_rate": 0.0002, "loss": 0.3460643768310547, "loss_d0": 0.6405902057886124, "step": 190 }, { "epoch": 2.857142857142857, "grad_norm": 1.453125, "learning_rate": 0.0002, "loss": 0.3911351203918457, "loss_d0": 0.6420928090810776, "step": 200 }, { "epoch": 3.0, "grad_norm": 1.3984375, "learning_rate": 0.0002, "loss": 0.3302267074584961, "loss_d0": 0.5826890021562576, "step": 210 }, { "epoch": 3.142857142857143, "grad_norm": 2.421875, "learning_rate": 0.0002, "loss": 0.3666944980621338, "loss_d0": 0.6297772079706192, "step": 220 }, { "epoch": 3.2857142857142856, "grad_norm": 1.40625, "learning_rate": 0.0002, "loss": 0.3350435495376587, "loss_d0": 0.5840106904506683, "step": 230 }, { "epoch": 3.4285714285714284, "grad_norm": 1.0390625, "learning_rate": 0.0002, "loss": 0.31048002243041994, "loss_d0": 0.5492438584566116, "step": 240 }, { "epoch": 3.571428571428571, "grad_norm": 2.234375, "learning_rate": 0.0002, "loss": 0.3417187690734863, "loss_d0": 0.6671169877052308, "step": 250 }, { "epoch": 3.7142857142857144, "grad_norm": 1.7578125, "learning_rate": 0.0002, "loss": 0.31016125679016116, "loss_d0": 0.5638339132070541, "step": 260 }, { "epoch": 3.857142857142857, "grad_norm": 1.7421875, "learning_rate": 0.0002, "loss": 0.3462181806564331, "loss_d0": 0.6273518323898315, "step": 270 }, { "epoch": 4.0, "grad_norm": 1.8828125, "learning_rate": 0.0002, "loss": 0.37842116355895994, "loss_d0": 0.6331767499446869, "step": 280 }, { "epoch": 4.142857142857143, "grad_norm": 1.3515625, "learning_rate": 0.0002, "loss": 0.2758188247680664, "loss_d0": 0.5233808279037475, "step": 290 }, { "epoch": 4.285714285714286, "grad_norm": 1.59375, "learning_rate": 0.0002, "loss": 0.2679539680480957, "loss_d0": 0.512147718667984, "step": 300 }, { "epoch": 4.428571428571429, "grad_norm": 1.53125, "learning_rate": 0.0002, "loss": 0.2771256446838379, "loss_d0": 0.5529826283454895, "step": 310 }, { "epoch": 4.571428571428571, "grad_norm": 1.21875, "learning_rate": 0.0002, "loss": 0.2626373767852783, "loss_d0": 0.4893135607242584, "step": 320 }, { "epoch": 4.714285714285714, "grad_norm": 1.5625, "learning_rate": 0.0002, "loss": 0.29569981098175047, "loss_d0": 0.5720477998256683, "step": 330 }, { "epoch": 4.857142857142857, "grad_norm": 1.1640625, "learning_rate": 0.0002, "loss": 0.2952061653137207, "loss_d0": 0.5526792675256729, "step": 340 }, { "epoch": 5.0, "grad_norm": 1.78125, "learning_rate": 0.0002, "loss": 0.3209908723831177, "loss_d0": 0.6238142669200897, "step": 350 }, { "epoch": 5.142857142857143, "grad_norm": 1.5390625, "learning_rate": 0.0002, "loss": 0.2546632528305054, "loss_d0": 0.497738191485405, "step": 360 }, { "epoch": 5.285714285714286, "grad_norm": 1.0234375, "learning_rate": 0.0002, "loss": 0.2360783815383911, "loss_d0": 0.43793114721775056, "step": 370 }, { "epoch": 5.428571428571429, "grad_norm": 1.109375, "learning_rate": 0.0002, "loss": 0.23914880752563478, "loss_d0": 0.46601290702819825, "step": 380 }, { "epoch": 5.571428571428571, "grad_norm": 1.1484375, "learning_rate": 0.0002, "loss": 0.24625580310821532, "loss_d0": 0.5180164843797683, "step": 390 }, { "epoch": 5.714285714285714, "grad_norm": 1.515625, "learning_rate": 0.0002, "loss": 0.30511114597320554, "loss_d0": 0.570301228761673, "step": 400 }, { "epoch": 5.857142857142857, "grad_norm": 1.1015625, "learning_rate": 0.0002, "loss": 0.26278665065765383, "loss_d0": 0.5415922611951828, "step": 410 }, { "epoch": 6.0, "grad_norm": 1.234375, "learning_rate": 0.0002, "loss": 0.2830559015274048, "loss_d0": 0.5763564020395279, "step": 420 }, { "epoch": 6.142857142857143, "grad_norm": 1.546875, "learning_rate": 0.0002, "loss": 0.23301992416381836, "loss_d0": 0.47966580390930175, "step": 430 }, { "epoch": 6.285714285714286, "grad_norm": 1.1875, "learning_rate": 0.0002, "loss": 0.2130380630493164, "loss_d0": 0.4446234554052353, "step": 440 }, { "epoch": 6.428571428571429, "grad_norm": 1.671875, "learning_rate": 0.0002, "loss": 0.2604910612106323, "loss_d0": 0.5528126150369644, "step": 450 }, { "epoch": 6.571428571428571, "grad_norm": 1.3984375, "learning_rate": 0.0002, "loss": 0.2402413845062256, "loss_d0": 0.4986030846834183, "step": 460 }, { "epoch": 6.714285714285714, "grad_norm": 1.9609375, "learning_rate": 0.0002, "loss": 0.24624488353729249, "loss_d0": 0.5280796885490417, "step": 470 }, { "epoch": 6.857142857142857, "grad_norm": 1.2890625, "learning_rate": 0.0002, "loss": 0.2268777847290039, "loss_d0": 0.4914736434817314, "step": 480 }, { "epoch": 7.0, "grad_norm": 1.21875, "learning_rate": 0.0002, "loss": 0.25430734157562257, "loss_d0": 0.5139662355184555, "step": 490 }, { "epoch": 7.142857142857143, "grad_norm": 1.359375, "learning_rate": 0.0002, "loss": 0.19951030015945434, "loss_d0": 0.45199823677539824, "step": 500 }, { "epoch": 7.142857142857143, "eval_loss": 8.546619415283203, "eval_runtime": 0.3482, "eval_samples_per_second": 718.039, "eval_steps_per_second": 71.804, "step": 500 }, { "epoch": 7.285714285714286, "grad_norm": 0.87890625, "learning_rate": 0.0002, "loss": 0.19481804370880126, "loss_d0": 0.45815878808498384, "step": 510 }, { "epoch": 7.428571428571429, "grad_norm": 1.3046875, "learning_rate": 0.0002, "loss": 0.2255556106567383, "loss_d0": 0.5097730100154877, "step": 520 }, { "epoch": 7.571428571428571, "grad_norm": 1.1953125, "learning_rate": 0.0002, "loss": 0.22788920402526855, "loss_d0": 0.44859754145145414, "step": 530 }, { "epoch": 7.714285714285714, "grad_norm": 1.4375, "learning_rate": 0.0002, "loss": 0.2295910358428955, "loss_d0": 0.469280743598938, "step": 540 }, { "epoch": 7.857142857142857, "grad_norm": 0.96484375, "learning_rate": 0.0002, "loss": 0.22432618141174315, "loss_d0": 0.4931183695793152, "step": 550 }, { "epoch": 8.0, "grad_norm": 3.34375, "learning_rate": 0.0002, "loss": 0.22481327056884765, "loss_d0": 0.4790141642093658, "step": 560 }, { "epoch": 8.142857142857142, "grad_norm": 1.078125, "learning_rate": 0.0002, "loss": 0.1898207187652588, "loss_d0": 0.45880764722824097, "step": 570 }, { "epoch": 8.285714285714286, "grad_norm": 1.1015625, "learning_rate": 0.0002, "loss": 0.16722708940505981, "loss_d0": 0.39154875874519346, "step": 580 }, { "epoch": 8.428571428571429, "grad_norm": 1.0703125, "learning_rate": 0.0002, "loss": 0.20029706954956056, "loss_d0": 0.4694953829050064, "step": 590 }, { "epoch": 8.571428571428571, "grad_norm": 1.1640625, "learning_rate": 0.0002, "loss": 0.1980130195617676, "loss_d0": 0.429129758477211, "step": 600 }, { "epoch": 8.714285714285714, "grad_norm": 1.171875, "learning_rate": 0.0002, "loss": 0.21289968490600586, "loss_d0": 0.5128728121519088, "step": 610 }, { "epoch": 8.857142857142858, "grad_norm": 1.1484375, "learning_rate": 0.0002, "loss": 0.20417430400848388, "loss_d0": 0.4555791884660721, "step": 620 }, { "epoch": 9.0, "grad_norm": 0.9921875, "learning_rate": 0.0002, "loss": 0.2080092191696167, "loss_d0": 0.48112956881523133, "step": 630 }, { "epoch": 9.142857142857142, "grad_norm": 1.125, "learning_rate": 0.0002, "loss": 0.17301057577133178, "loss_d0": 0.3914658397436142, "step": 640 }, { "epoch": 9.285714285714286, "grad_norm": 1.0078125, "learning_rate": 0.0002, "loss": 0.16326009035110473, "loss_d0": 0.3957242280244827, "step": 650 }, { "epoch": 9.428571428571429, "grad_norm": 1.03125, "learning_rate": 0.0002, "loss": 0.23928072452545165, "loss_d0": 0.47887236177921294, "step": 660 }, { "epoch": 9.571428571428571, "grad_norm": 1.125, "learning_rate": 0.0002, "loss": 0.21262478828430176, "loss_d0": 0.49389356970787046, "step": 670 }, { "epoch": 9.714285714285714, "grad_norm": 1.2421875, "learning_rate": 0.0002, "loss": 0.21038594245910644, "loss_d0": 0.4909708023071289, "step": 680 }, { "epoch": 9.857142857142858, "grad_norm": 0.84375, "learning_rate": 0.0002, "loss": 0.19068275690078734, "loss_d0": 0.43951269090175626, "step": 690 }, { "epoch": 10.0, "grad_norm": 1.2265625, "learning_rate": 0.0002, "loss": 0.20882303714752198, "loss_d0": 0.4652249127626419, "step": 700 }, { "epoch": 10.142857142857142, "grad_norm": 0.7578125, "learning_rate": 0.0002, "loss": 0.16138590574264527, "loss_d0": 0.40691248178482053, "step": 710 }, { "epoch": 10.285714285714286, "grad_norm": 0.98828125, "learning_rate": 0.0002, "loss": 0.1708214044570923, "loss_d0": 0.44721868336200715, "step": 720 }, { "epoch": 10.428571428571429, "grad_norm": 0.92578125, "learning_rate": 0.0002, "loss": 0.16305239200592042, "loss_d0": 0.411194321513176, "step": 730 }, { "epoch": 10.571428571428571, "grad_norm": 1.2421875, "learning_rate": 0.0002, "loss": 0.18613686561584472, "loss_d0": 0.46029442846775054, "step": 740 }, { "epoch": 10.714285714285714, "grad_norm": 1.3984375, "learning_rate": 0.0002, "loss": 0.17803105115890502, "loss_d0": 0.4383477747440338, "step": 750 }, { "epoch": 10.857142857142858, "grad_norm": 1.0625, "learning_rate": 0.0002, "loss": 0.2087890625, "loss_d0": 0.4998590737581253, "step": 760 }, { "epoch": 11.0, "grad_norm": 1.8203125, "learning_rate": 0.0002, "loss": 0.19215229749679566, "loss_d0": 0.4216267496347427, "step": 770 }, { "epoch": 11.142857142857142, "grad_norm": 1.03125, "learning_rate": 0.0002, "loss": 0.161735200881958, "loss_d0": 0.40338513553142546, "step": 780 }, { "epoch": 11.285714285714286, "grad_norm": 1.1015625, "learning_rate": 0.0002, "loss": 0.16771552562713624, "loss_d0": 0.42275542616844175, "step": 790 }, { "epoch": 11.428571428571429, "grad_norm": 1.1640625, "learning_rate": 0.0002, "loss": 0.15335218906402587, "loss_d0": 0.3944630563259125, "step": 800 }, { "epoch": 11.571428571428571, "grad_norm": 0.97265625, "learning_rate": 0.0002, "loss": 0.16975181102752684, "loss_d0": 0.42211559414863586, "step": 810 }, { "epoch": 11.714285714285714, "grad_norm": 0.80859375, "learning_rate": 0.0002, "loss": 0.18913717269897462, "loss_d0": 0.43886401802301406, "step": 820 }, { "epoch": 11.857142857142858, "grad_norm": 1.234375, "learning_rate": 0.0002, "loss": 0.22327446937561035, "loss_d0": 0.5353886485099792, "step": 830 }, { "epoch": 12.0, "grad_norm": 1.0390625, "learning_rate": 0.0002, "loss": 0.15874338150024414, "loss_d0": 0.38432416021823884, "step": 840 }, { "epoch": 12.142857142857142, "grad_norm": 0.8125, "learning_rate": 0.0002, "loss": 0.1377707004547119, "loss_d0": 0.3911532461643219, "step": 850 }, { "epoch": 12.285714285714286, "grad_norm": 1.03125, "learning_rate": 0.0002, "loss": 0.16991720199584961, "loss_d0": 0.4460686922073364, "step": 860 }, { "epoch": 12.428571428571429, "grad_norm": 1.0234375, "learning_rate": 0.0002, "loss": 0.16523797512054444, "loss_d0": 0.43365546464920046, "step": 870 }, { "epoch": 12.571428571428571, "grad_norm": 0.9921875, "learning_rate": 0.0002, "loss": 0.15238118171691895, "loss_d0": 0.42346865832805636, "step": 880 }, { "epoch": 12.714285714285714, "grad_norm": 0.74609375, "learning_rate": 0.0002, "loss": 0.14495233297348023, "loss_d0": 0.35719306766986847, "step": 890 }, { "epoch": 12.857142857142858, "grad_norm": 1.2265625, "learning_rate": 0.0002, "loss": 0.17073333263397217, "loss_d0": 0.43814408481121064, "step": 900 }, { "epoch": 13.0, "grad_norm": 0.83203125, "learning_rate": 0.0002, "loss": 0.1850340723991394, "loss_d0": 0.482748007774353, "step": 910 }, { "epoch": 13.142857142857142, "grad_norm": 1.0625, "learning_rate": 0.0002, "loss": 0.13537302017211914, "loss_d0": 0.34865332692861556, "step": 920 }, { "epoch": 13.285714285714286, "grad_norm": 0.91015625, "learning_rate": 0.0002, "loss": 0.1343899965286255, "loss_d0": 0.3968281477689743, "step": 930 }, { "epoch": 13.428571428571429, "grad_norm": 1.1640625, "learning_rate": 0.0002, "loss": 0.1584508538246155, "loss_d0": 0.4577269285917282, "step": 940 }, { "epoch": 13.571428571428571, "grad_norm": 0.95703125, "learning_rate": 0.0002, "loss": 0.14411535263061523, "loss_d0": 0.3959138482809067, "step": 950 }, { "epoch": 13.714285714285714, "grad_norm": 0.94921875, "learning_rate": 0.0002, "loss": 0.17094615697860718, "loss_d0": 0.46275514960289, "step": 960 }, { "epoch": 13.857142857142858, "grad_norm": 0.94921875, "learning_rate": 0.0002, "loss": 0.15647470951080322, "loss_d0": 0.43458292484283445, "step": 970 }, { "epoch": 14.0, "grad_norm": 0.8203125, "learning_rate": 0.0002, "loss": 0.16071619987487792, "loss_d0": 0.4134894758462906, "step": 980 }, { "epoch": 14.142857142857142, "grad_norm": 0.92578125, "learning_rate": 0.0002, "loss": 0.14269460439682008, "loss_d0": 0.4106316104531288, "step": 990 }, { "epoch": 14.285714285714286, "grad_norm": 0.8984375, "learning_rate": 0.0002, "loss": 0.15636165142059327, "loss_d0": 0.42688301801681516, "step": 1000 }, { "epoch": 14.285714285714286, "eval_loss": 9.74100399017334, "eval_runtime": 0.3462, "eval_samples_per_second": 722.046, "eval_steps_per_second": 72.205, "step": 1000 }, { "epoch": 14.428571428571429, "grad_norm": 0.76953125, "learning_rate": 0.0002, "loss": 0.1325446605682373, "loss_d0": 0.38657407015562056, "step": 1010 }, { "epoch": 14.571428571428571, "grad_norm": 0.82421875, "learning_rate": 0.0002, "loss": 0.14686695337295533, "loss_d0": 0.4054566860198975, "step": 1020 }, { "epoch": 14.714285714285714, "grad_norm": 1.0234375, "learning_rate": 0.0002, "loss": 0.13976905345916749, "loss_d0": 0.38684512078762057, "step": 1030 }, { "epoch": 14.857142857142858, "grad_norm": 0.9921875, "learning_rate": 0.0002, "loss": 0.1563257694244385, "loss_d0": 0.4456890881061554, "step": 1040 }, { "epoch": 15.0, "grad_norm": 0.890625, "learning_rate": 0.0002, "loss": 0.1601293206214905, "loss_d0": 0.4465105265378952, "step": 1050 }, { "epoch": 15.142857142857142, "grad_norm": 0.75390625, "learning_rate": 0.0002, "loss": 0.15074552297592164, "loss_d0": 0.41963100135326387, "step": 1060 }, { "epoch": 15.285714285714286, "grad_norm": 1.3984375, "learning_rate": 0.0002, "loss": 0.15185041427612306, "loss_d0": 0.41460293233394624, "step": 1070 }, { "epoch": 15.428571428571429, "grad_norm": 0.8359375, "learning_rate": 0.0002, "loss": 0.13449288606643678, "loss_d0": 0.40143118500709535, "step": 1080 }, { "epoch": 15.571428571428571, "grad_norm": 1.5234375, "learning_rate": 0.0002, "loss": 0.16524744033813477, "loss_d0": 0.44636636078357694, "step": 1090 }, { "epoch": 15.714285714285714, "grad_norm": 0.93359375, "learning_rate": 0.0002, "loss": 0.1261012315750122, "loss_d0": 0.35532553046941756, "step": 1100 }, { "epoch": 15.857142857142858, "grad_norm": 0.79296875, "learning_rate": 0.0002, "loss": 0.16132652759552002, "loss_d0": 0.45412015467882155, "step": 1110 }, { "epoch": 16.0, "grad_norm": 0.875, "learning_rate": 0.0002, "loss": 0.1498228430747986, "loss_d0": 0.3984955310821533, "step": 1120 }, { "epoch": 16.142857142857142, "grad_norm": 0.90625, "learning_rate": 0.0002, "loss": 0.11573998928070069, "loss_d0": 0.3429853171110153, "step": 1130 }, { "epoch": 16.285714285714285, "grad_norm": 0.69921875, "learning_rate": 0.0002, "loss": 0.13562896251678466, "loss_d0": 0.3974081426858902, "step": 1140 }, { "epoch": 16.428571428571427, "grad_norm": 1.03125, "learning_rate": 0.0002, "loss": 0.14604614973068236, "loss_d0": 0.43393263816833494, "step": 1150 }, { "epoch": 16.571428571428573, "grad_norm": 1.6875, "learning_rate": 0.0002, "loss": 0.12731246948242186, "loss_d0": 0.36327935606241224, "step": 1160 }, { "epoch": 16.714285714285715, "grad_norm": 1.46875, "learning_rate": 0.0002, "loss": 0.14498001337051392, "loss_d0": 0.4154079735279083, "step": 1170 }, { "epoch": 16.857142857142858, "grad_norm": 1.046875, "learning_rate": 0.0002, "loss": 0.16311801671981813, "loss_d0": 0.45202054679393766, "step": 1180 }, { "epoch": 17.0, "grad_norm": 1.125, "learning_rate": 0.0002, "loss": 0.15291047096252441, "loss_d0": 0.4574140697717667, "step": 1190 }, { "epoch": 17.142857142857142, "grad_norm": 1.0703125, "learning_rate": 0.0002, "loss": 0.11962804794311524, "loss_d0": 0.35834813863039017, "step": 1200 }, { "epoch": 17.285714285714285, "grad_norm": 1.0390625, "learning_rate": 0.0002, "loss": 0.14257519245147704, "loss_d0": 0.40999800264835357, "step": 1210 }, { "epoch": 17.428571428571427, "grad_norm": 1.203125, "learning_rate": 0.0002, "loss": 0.12993460893630981, "loss_d0": 0.3714532881975174, "step": 1220 }, { "epoch": 17.571428571428573, "grad_norm": 0.984375, "learning_rate": 0.0002, "loss": 0.13073623180389404, "loss_d0": 0.3804581880569458, "step": 1230 }, { "epoch": 17.714285714285715, "grad_norm": 1.4140625, "learning_rate": 0.0002, "loss": 0.13893918991088866, "loss_d0": 0.40951029658317567, "step": 1240 }, { "epoch": 17.857142857142858, "grad_norm": 0.9375, "learning_rate": 0.0002, "loss": 0.13479981422424317, "loss_d0": 0.4055067300796509, "step": 1250 }, { "epoch": 18.0, "grad_norm": 1.1171875, "learning_rate": 0.0002, "loss": 0.14387743473052977, "loss_d0": 0.45950326323509216, "step": 1260 }, { "epoch": 18.142857142857142, "grad_norm": 0.86328125, "learning_rate": 0.0002, "loss": 0.12405726909637452, "loss_d0": 0.37750509530305865, "step": 1270 }, { "epoch": 18.285714285714285, "grad_norm": 0.84765625, "learning_rate": 0.0002, "loss": 0.12020995616912841, "loss_d0": 0.3599585384130478, "step": 1280 }, { "epoch": 18.428571428571427, "grad_norm": 0.80078125, "learning_rate": 0.0002, "loss": 0.1472527027130127, "loss_d0": 0.3992807060480118, "step": 1290 }, { "epoch": 18.571428571428573, "grad_norm": 0.82421875, "learning_rate": 0.0002, "loss": 0.15526074171066284, "loss_d0": 0.457242825627327, "step": 1300 }, { "epoch": 18.714285714285715, "grad_norm": 0.96484375, "learning_rate": 0.0002, "loss": 0.14091994762420654, "loss_d0": 0.4314684599637985, "step": 1310 }, { "epoch": 18.857142857142858, "grad_norm": 0.8359375, "learning_rate": 0.0002, "loss": 0.1281859755516052, "loss_d0": 0.36913466453552246, "step": 1320 }, { "epoch": 19.0, "grad_norm": 0.828125, "learning_rate": 0.0002, "loss": 0.1549570679664612, "loss_d0": 0.43077765703201293, "step": 1330 }, { "epoch": 19.142857142857142, "grad_norm": 0.73828125, "learning_rate": 0.0002, "loss": 0.11442582607269287, "loss_d0": 0.374704709649086, "step": 1340 }, { "epoch": 19.285714285714285, "grad_norm": 0.99609375, "learning_rate": 0.0002, "loss": 0.1251933455467224, "loss_d0": 0.37866236865520475, "step": 1350 }, { "epoch": 19.428571428571427, "grad_norm": 0.6953125, "learning_rate": 0.0002, "loss": 0.12533226013183593, "loss_d0": 0.38566732704639434, "step": 1360 }, { "epoch": 19.571428571428573, "grad_norm": 1.2578125, "learning_rate": 0.0002, "loss": 0.13898290395736695, "loss_d0": 0.41185433566570284, "step": 1370 }, { "epoch": 19.714285714285715, "grad_norm": 0.56640625, "learning_rate": 0.0002, "loss": 0.14139026403427124, "loss_d0": 0.3994438648223877, "step": 1380 }, { "epoch": 19.857142857142858, "grad_norm": 1.1328125, "learning_rate": 0.0002, "loss": 0.14629528522491456, "loss_d0": 0.45764580070972444, "step": 1390 }, { "epoch": 20.0, "grad_norm": 0.74609375, "learning_rate": 0.0002, "loss": 0.13958772420883178, "loss_d0": 0.41138762086629865, "step": 1400 }, { "epoch": 20.142857142857142, "grad_norm": 0.75390625, "learning_rate": 0.0002, "loss": 0.10666416883468628, "loss_d0": 0.35182701647281645, "step": 1410 }, { "epoch": 20.285714285714285, "grad_norm": 0.89453125, "learning_rate": 0.0002, "loss": 0.12388570308685302, "loss_d0": 0.3976111799478531, "step": 1420 }, { "epoch": 20.428571428571427, "grad_norm": 1.0859375, "learning_rate": 0.0002, "loss": 0.12193892002105713, "loss_d0": 0.3856766760349274, "step": 1430 }, { "epoch": 20.571428571428573, "grad_norm": 0.62890625, "learning_rate": 0.0002, "loss": 0.12145572900772095, "loss_d0": 0.3665471762418747, "step": 1440 }, { "epoch": 20.714285714285715, "grad_norm": 0.79296875, "learning_rate": 0.0002, "loss": 0.13988080024719238, "loss_d0": 0.39173959791660307, "step": 1450 }, { "epoch": 20.857142857142858, "grad_norm": 0.77734375, "learning_rate": 0.0002, "loss": 0.1655336618423462, "loss_d0": 0.4761664211750031, "step": 1460 }, { "epoch": 21.0, "grad_norm": 0.8125, "learning_rate": 0.0002, "loss": 0.13238286972045898, "loss_d0": 0.42673201858997345, "step": 1470 }, { "epoch": 21.142857142857142, "grad_norm": 0.9375, "learning_rate": 0.0002, "loss": 0.11268144845962524, "loss_d0": 0.38569384068250656, "step": 1480 }, { "epoch": 21.285714285714285, "grad_norm": 0.96875, "learning_rate": 0.0002, "loss": 0.1253903865814209, "loss_d0": 0.4076909214258194, "step": 1490 }, { "epoch": 21.428571428571427, "grad_norm": 0.91796875, "learning_rate": 0.0002, "loss": 0.13616844415664672, "loss_d0": 0.43757488429546354, "step": 1500 }, { "epoch": 21.428571428571427, "eval_loss": 8.753684043884277, "eval_runtime": 0.3463, "eval_samples_per_second": 721.916, "eval_steps_per_second": 72.192, "step": 1500 }, { "epoch": 21.571428571428573, "grad_norm": 0.69140625, "learning_rate": 0.0002, "loss": 0.13126761913299562, "loss_d0": 0.3969725713133812, "step": 1510 }, { "epoch": 21.714285714285715, "grad_norm": 0.68359375, "learning_rate": 0.0002, "loss": 0.12211315631866455, "loss_d0": 0.394762022793293, "step": 1520 }, { "epoch": 21.857142857142858, "grad_norm": 1.1875, "learning_rate": 0.0002, "loss": 0.13277941942214966, "loss_d0": 0.37962048798799514, "step": 1530 }, { "epoch": 22.0, "grad_norm": 1.1796875, "learning_rate": 0.0002, "loss": 0.11672606468200683, "loss_d0": 0.36649424582719803, "step": 1540 }, { "epoch": 22.142857142857142, "grad_norm": 1.3359375, "learning_rate": 0.0002, "loss": 0.10678048133850097, "loss_d0": 0.3356593608856201, "step": 1550 }, { "epoch": 22.285714285714285, "grad_norm": 0.734375, "learning_rate": 0.0002, "loss": 0.10783629417419434, "loss_d0": 0.35811730176210405, "step": 1560 }, { "epoch": 22.428571428571427, "grad_norm": 0.71875, "learning_rate": 0.0002, "loss": 0.12049505710601807, "loss_d0": 0.37791029214859007, "step": 1570 }, { "epoch": 22.571428571428573, "grad_norm": 0.70703125, "learning_rate": 0.0002, "loss": 0.17957345247268677, "loss_d0": 0.39931109845638274, "step": 1580 }, { "epoch": 22.714285714285715, "grad_norm": 0.64453125, "learning_rate": 0.0002, "loss": 0.13404223918914795, "loss_d0": 0.41865653693675997, "step": 1590 }, { "epoch": 22.857142857142858, "grad_norm": 1.453125, "learning_rate": 0.0002, "loss": 0.1373995065689087, "loss_d0": 0.41133707463741304, "step": 1600 }, { "epoch": 23.0, "grad_norm": 1.015625, "learning_rate": 0.0001999900348908142, "loss": 0.1371894121170044, "loss_d0": 0.43064315617084503, "step": 1610 }, { "epoch": 23.142857142857142, "grad_norm": 0.76171875, "learning_rate": 0.00019995559043291586, "loss": 0.09948145151138306, "loss_d0": 0.3413606286048889, "step": 1620 }, { "epoch": 23.285714285714285, "grad_norm": 1.1015625, "learning_rate": 0.0001998965530147941, "loss": 0.12103539705276489, "loss_d0": 0.4073850393295288, "step": 1630 }, { "epoch": 23.428571428571427, "grad_norm": 0.80859375, "learning_rate": 0.00019981293877668964, "loss": 0.13946337699890138, "loss_d0": 0.44305639564990995, "step": 1640 }, { "epoch": 23.571428571428573, "grad_norm": 0.93359375, "learning_rate": 0.00019970477057790025, "loss": 0.12069251537322997, "loss_d0": 0.3936402976512909, "step": 1650 }, { "epoch": 23.714285714285715, "grad_norm": 0.98828125, "learning_rate": 0.0001995720779905314, "loss": 0.11377420425415039, "loss_d0": 0.3999328136444092, "step": 1660 }, { "epoch": 23.857142857142858, "grad_norm": 0.62890625, "learning_rate": 0.0001994148972914116, "loss": 0.12190061807632446, "loss_d0": 0.3969143331050873, "step": 1670 }, { "epoch": 24.0, "grad_norm": 0.6796875, "learning_rate": 0.0001992332714521745, "loss": 0.13412773609161377, "loss_d0": 0.3998068705201149, "step": 1680 }, { "epoch": 24.142857142857142, "grad_norm": 0.96484375, "learning_rate": 0.0001990272501275111, "loss": 0.11265419721603394, "loss_d0": 0.3656838908791542, "step": 1690 }, { "epoch": 24.285714285714285, "grad_norm": 0.7734375, "learning_rate": 0.00019879688964159436, "loss": 0.10430265665054321, "loss_d0": 0.34578651189804077, "step": 1700 }, { "epoch": 24.428571428571427, "grad_norm": 0.546875, "learning_rate": 0.00019854225297268106, "loss": 0.1179135799407959, "loss_d0": 0.37750212103128433, "step": 1710 }, { "epoch": 24.571428571428573, "grad_norm": 0.65234375, "learning_rate": 0.0001982634097358939, "loss": 0.1166454792022705, "loss_d0": 0.39225142896175386, "step": 1720 }, { "epoch": 24.714285714285715, "grad_norm": 0.80078125, "learning_rate": 0.00019796043616418963, "loss": 0.11532022953033447, "loss_d0": 0.3840861052274704, "step": 1730 }, { "epoch": 24.857142857142858, "grad_norm": 1.8984375, "learning_rate": 0.00019763341508751762, "loss": 0.14431958198547362, "loss_d0": 0.42472186088562014, "step": 1740 }, { "epoch": 25.0, "grad_norm": 0.859375, "learning_rate": 0.00019728243591017483, "loss": 0.14231926202774048, "loss_d0": 0.4452060103416443, "step": 1750 }, { "epoch": 25.142857142857142, "grad_norm": 0.79296875, "learning_rate": 0.0001969075945863639, "loss": 0.12176300287246704, "loss_d0": 0.3826014012098312, "step": 1760 }, { "epoch": 25.285714285714285, "grad_norm": 0.71484375, "learning_rate": 0.00019650899359396003, "loss": 0.10076014995574951, "loss_d0": 0.3468409776687622, "step": 1770 }, { "epoch": 25.428571428571427, "grad_norm": 0.73046875, "learning_rate": 0.00019608674190649446, "loss": 0.1326352596282959, "loss_d0": 0.41551732271909714, "step": 1780 }, { "epoch": 25.571428571428573, "grad_norm": 0.85546875, "learning_rate": 0.00019564095496336245, "loss": 0.1203911304473877, "loss_d0": 0.3934634208679199, "step": 1790 }, { "epoch": 25.714285714285715, "grad_norm": 0.51953125, "learning_rate": 0.0001951717546382631, "loss": 0.12641458511352538, "loss_d0": 0.3750816985964775, "step": 1800 }, { "epoch": 25.857142857142858, "grad_norm": 0.91796875, "learning_rate": 0.0001946792692058803, "loss": 0.13473284244537354, "loss_d0": 0.4147344782948494, "step": 1810 }, { "epoch": 26.0, "grad_norm": 0.671875, "learning_rate": 0.00019416363330681388, "loss": 0.12597525119781494, "loss_d0": 0.41172686219215393, "step": 1820 }, { "epoch": 26.142857142857142, "grad_norm": 0.99609375, "learning_rate": 0.00019362498791077002, "loss": 0.13244423866271973, "loss_d0": 0.4096812799572945, "step": 1830 }, { "epoch": 26.285714285714285, "grad_norm": 0.640625, "learning_rate": 0.00019306348027802166, "loss": 0.10660384893417359, "loss_d0": 0.3657086730003357, "step": 1840 }, { "epoch": 26.428571428571427, "grad_norm": 0.9375, "learning_rate": 0.000192479263919149, "loss": 0.10279349088668824, "loss_d0": 0.3708105951547623, "step": 1850 }, { "epoch": 26.571428571428573, "grad_norm": 0.91796875, "learning_rate": 0.00019187249855307114, "loss": 0.11480600833892822, "loss_d0": 0.3930380791425705, "step": 1860 }, { "epoch": 26.714285714285715, "grad_norm": 0.65625, "learning_rate": 0.00019124335006338072, "loss": 0.11895076036453248, "loss_d0": 0.39364840239286425, "step": 1870 }, { "epoch": 26.857142857142858, "grad_norm": 0.625, "learning_rate": 0.00019059199045299278, "loss": 0.1063655138015747, "loss_d0": 0.36443009227514267, "step": 1880 }, { "epoch": 27.0, "grad_norm": 1.21875, "learning_rate": 0.00018991859779712102, "loss": 0.12195394039154053, "loss_d0": 0.42418347895145414, "step": 1890 }, { "epoch": 27.142857142857142, "grad_norm": 0.66796875, "learning_rate": 0.00018922335619459373, "loss": 0.09252588152885437, "loss_d0": 0.3217478543519974, "step": 1900 }, { "epoch": 27.285714285714285, "grad_norm": 0.50390625, "learning_rate": 0.00018850645571752317, "loss": 0.10999109745025634, "loss_d0": 0.36287291944026945, "step": 1910 }, { "epoch": 27.428571428571427, "grad_norm": 0.8046875, "learning_rate": 0.0001877680923593415, "loss": 0.10641486644744873, "loss_d0": 0.3734027534723282, "step": 1920 }, { "epoch": 27.571428571428573, "grad_norm": 0.72265625, "learning_rate": 0.00018700846798121838, "loss": 0.11276865005493164, "loss_d0": 0.392790412902832, "step": 1930 }, { "epoch": 27.714285714285715, "grad_norm": 0.6640625, "learning_rate": 0.00018622779025687395, "loss": 0.11621142625808716, "loss_d0": 0.4068701401352882, "step": 1940 }, { "epoch": 27.857142857142858, "grad_norm": 0.84375, "learning_rate": 0.00018542627261580302, "loss": 0.10486786365509033, "loss_d0": 0.3720921754837036, "step": 1950 }, { "epoch": 28.0, "grad_norm": 0.9375, "learning_rate": 0.00018460413418492565, "loss": 0.125832998752594, "loss_d0": 0.4209293022751808, "step": 1960 }, { "epoch": 28.142857142857142, "grad_norm": 0.60546875, "learning_rate": 0.0001837615997286797, "loss": 0.09495269060134888, "loss_d0": 0.32309970781207087, "step": 1970 }, { "epoch": 28.285714285714285, "grad_norm": 0.80859375, "learning_rate": 0.00018289889958757294, "loss": 0.1047176718711853, "loss_d0": 0.35154553800821303, "step": 1980 }, { "epoch": 28.428571428571427, "grad_norm": 0.484375, "learning_rate": 0.00018201626961520997, "loss": 0.10913280248641968, "loss_d0": 0.3813262224197388, "step": 1990 }, { "epoch": 28.571428571428573, "grad_norm": 0.62890625, "learning_rate": 0.00018111395111381214, "loss": 0.11296517848968506, "loss_d0": 0.4021457523107529, "step": 2000 }, { "epoch": 28.571428571428573, "eval_loss": 9.778786659240723, "eval_runtime": 0.3465, "eval_samples_per_second": 721.509, "eval_steps_per_second": 72.151, "step": 2000 } ], "logging_steps": 10, "max_steps": 3500, "num_input_tokens_seen": 0, "num_train_epochs": 50, "save_steps": 1000, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 2.577720168579072e+16, "train_batch_size": 10, "trial_name": null, "trial_params": null }