{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.3500724287783679, "eval_steps": 100, "global_step": 10150, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.0007595898214963919, "grad_norm": 4.34375, "learning_rate": 0.0, "loss": 4.160505771636963, "step": 1 }, { "epoch": 0.007595898214963919, "grad_norm": 1.5078125, "learning_rate": 2.2499999999999998e-05, "loss": 4.129366980658637, "step": 10 }, { "epoch": 0.015191796429927839, "grad_norm": 0.65625, "learning_rate": 4.75e-05, "loss": 4.0021720886230465, "step": 20 }, { "epoch": 0.02278769464489176, "grad_norm": 0.341796875, "learning_rate": 7.25e-05, "loss": 3.8429046630859376, "step": 30 }, { "epoch": 0.030383592859855677, "grad_norm": 0.2490234375, "learning_rate": 9.750000000000001e-05, "loss": 3.714479446411133, "step": 40 }, { "epoch": 0.0379794910748196, "grad_norm": 0.279296875, "learning_rate": 0.0001225, "loss": 3.6400478363037108, "step": 50 }, { "epoch": 0.04557538928978352, "grad_norm": 0.244140625, "learning_rate": 0.0001475, "loss": 3.551565933227539, "step": 60 }, { "epoch": 0.053171287504747436, "grad_norm": 0.3046875, "learning_rate": 0.0001725, "loss": 3.4914886474609377, "step": 70 }, { "epoch": 0.060767185719711354, "grad_norm": 0.255859375, "learning_rate": 0.0001975, "loss": 3.4572845458984376, "step": 80 }, { "epoch": 0.06836308393467527, "grad_norm": 0.30078125, "learning_rate": 0.00022250000000000001, "loss": 3.41595573425293, "step": 90 }, { "epoch": 0.0759589821496392, "grad_norm": 0.55078125, "learning_rate": 0.0002475, "loss": 3.356405258178711, "step": 100 }, { "epoch": 0.0759589821496392, "eval_loss": 3.321293830871582, "eval_runtime": 6.4337, "eval_samples_per_second": 50.826, "eval_steps_per_second": 1.71, "step": 100 }, { "epoch": 0.08355488036460311, "grad_norm": 0.326171875, "learning_rate": 0.0002725, "loss": 3.3377449035644533, "step": 110 }, { "epoch": 0.09115077857956703, "grad_norm": 0.35546875, "learning_rate": 0.00029749999999999997, "loss": 3.2930694580078126, "step": 120 }, { "epoch": 0.09874667679453095, "grad_norm": 0.423828125, "learning_rate": 0.00032250000000000003, "loss": 3.28686637878418, "step": 130 }, { "epoch": 0.10634257500949487, "grad_norm": 0.337890625, "learning_rate": 0.0003475, "loss": 3.260041046142578, "step": 140 }, { "epoch": 0.1139384732244588, "grad_norm": 0.38671875, "learning_rate": 0.0003725, "loss": 3.230126953125, "step": 150 }, { "epoch": 0.12153437143942271, "grad_norm": 0.396484375, "learning_rate": 0.0003975, "loss": 3.247303009033203, "step": 160 }, { "epoch": 0.12913026965438662, "grad_norm": 0.69921875, "learning_rate": 0.00042249999999999997, "loss": 3.215043640136719, "step": 170 }, { "epoch": 0.13672616786935055, "grad_norm": 0.416015625, "learning_rate": 0.00044750000000000004, "loss": 3.1772716522216795, "step": 180 }, { "epoch": 0.14432206608431447, "grad_norm": 0.625, "learning_rate": 0.0004725, "loss": 3.1748157501220704, "step": 190 }, { "epoch": 0.1519179642992784, "grad_norm": 0.365234375, "learning_rate": 0.0004975, "loss": 3.162751388549805, "step": 200 }, { "epoch": 0.1519179642992784, "eval_loss": 3.1788299083709717, "eval_runtime": 6.3407, "eval_samples_per_second": 51.571, "eval_steps_per_second": 1.735, "step": 200 }, { "epoch": 0.15951386251424232, "grad_norm": 0.390625, "learning_rate": 0.000499923916786539, "loss": 3.1491827011108398, "step": 210 }, { "epoch": 0.16710976072920622, "grad_norm": 0.48046875, "learning_rate": 0.0004996609756683134, "loss": 3.1373762130737304, "step": 220 }, { "epoch": 0.17470565894417014, "grad_norm": 0.349609375, "learning_rate": 0.0004992104452776705, "loss": 3.1026805877685546, "step": 230 }, { "epoch": 0.18230155715913407, "grad_norm": 0.318359375, "learning_rate": 0.0004985726819745386, "loss": 3.097637748718262, "step": 240 }, { "epoch": 0.189897455374098, "grad_norm": 0.33984375, "learning_rate": 0.0004977481902160848, "loss": 3.074860191345215, "step": 250 }, { "epoch": 0.1974933535890619, "grad_norm": 0.361328125, "learning_rate": 0.0004967376221577013, "loss": 3.0807043075561524, "step": 260 }, { "epoch": 0.20508925180402582, "grad_norm": 0.40625, "learning_rate": 0.0004955417771371639, "loss": 3.074227142333984, "step": 270 }, { "epoch": 0.21268515001898974, "grad_norm": 0.353515625, "learning_rate": 0.0004941616010423732, "loss": 3.05371036529541, "step": 280 }, { "epoch": 0.22028104823395367, "grad_norm": 0.322265625, "learning_rate": 0.0004925981855631768, "loss": 3.0531679153442384, "step": 290 }, { "epoch": 0.2278769464489176, "grad_norm": 0.33984375, "learning_rate": 0.0004908527673278665, "loss": 3.044694709777832, "step": 300 }, { "epoch": 0.2278769464489176, "eval_loss": 3.135857105255127, "eval_runtime": 6.4068, "eval_samples_per_second": 51.04, "eval_steps_per_second": 1.717, "step": 300 }, { "epoch": 0.2354728446638815, "grad_norm": 0.310546875, "learning_rate": 0.0004889267269250315, "loss": 3.0244071960449217, "step": 310 }, { "epoch": 0.24306874287884542, "grad_norm": 0.310546875, "learning_rate": 0.0004868215878115427, "loss": 3.0274925231933594, "step": 320 }, { "epoch": 0.25066464109380937, "grad_norm": 0.421875, "learning_rate": 0.00048453901510752973, "loss": 3.0219192504882812, "step": 330 }, { "epoch": 0.25826053930877324, "grad_norm": 0.298828125, "learning_rate": 0.0004820808142793077, "loss": 3.0148666381835936, "step": 340 }, { "epoch": 0.26585643752373717, "grad_norm": 0.267578125, "learning_rate": 0.00047944892971129113, "loss": 2.9982091903686525, "step": 350 }, { "epoch": 0.2734523357387011, "grad_norm": 0.34375, "learning_rate": 0.0004766454431680274, "loss": 2.986362266540527, "step": 360 }, { "epoch": 0.281048233953665, "grad_norm": 0.30859375, "learning_rate": 0.00047367257214756583, "loss": 2.9878061294555662, "step": 370 }, { "epoch": 0.28864413216862894, "grad_norm": 0.267578125, "learning_rate": 0.0004705326681274636, "loss": 2.9845380783081055, "step": 380 }, { "epoch": 0.29624003038359287, "grad_norm": 0.30078125, "learning_rate": 0.00046722821470481706, "loss": 2.9719078063964846, "step": 390 }, { "epoch": 0.3038359285985568, "grad_norm": 0.291015625, "learning_rate": 0.00046376182563179013, "loss": 2.9487117767333983, "step": 400 }, { "epoch": 0.3038359285985568, "eval_loss": 3.0641255378723145, "eval_runtime": 6.3681, "eval_samples_per_second": 51.35, "eval_steps_per_second": 1.727, "step": 400 }, { "epoch": 0.3114318268135207, "grad_norm": 0.291015625, "learning_rate": 0.0004601362427481912, "loss": 2.9743417739868163, "step": 410 }, { "epoch": 0.31902772502848464, "grad_norm": 0.29296875, "learning_rate": 0.000456354333812737, "loss": 2.9637521743774413, "step": 420 }, { "epoch": 0.3266236232434485, "grad_norm": 0.298828125, "learning_rate": 0.00045241909023471626, "loss": 2.9459299087524413, "step": 430 }, { "epoch": 0.33421952145841244, "grad_norm": 0.294921875, "learning_rate": 0.000448333624707849, "loss": 2.9349159240722655, "step": 440 }, { "epoch": 0.34181541967337636, "grad_norm": 0.326171875, "learning_rate": 0.00044410116874821204, "loss": 2.939449119567871, "step": 450 }, { "epoch": 0.3494113178883403, "grad_norm": 0.275390625, "learning_rate": 0.00043972507013817876, "loss": 2.923619270324707, "step": 460 }, { "epoch": 0.3570072161033042, "grad_norm": 0.31640625, "learning_rate": 0.0004352087902783947, "loss": 2.923044967651367, "step": 470 }, { "epoch": 0.36460311431826814, "grad_norm": 0.2578125, "learning_rate": 0.00043055590144988365, "loss": 2.921802520751953, "step": 480 }, { "epoch": 0.37219901253323207, "grad_norm": 0.328125, "learning_rate": 0.0004257700839884492, "loss": 2.9253984451293946, "step": 490 }, { "epoch": 0.379794910748196, "grad_norm": 0.310546875, "learning_rate": 0.0004208551233736077, "loss": 2.910613441467285, "step": 500 }, { "epoch": 0.379794910748196, "eval_loss": 3.0285699367523193, "eval_runtime": 6.4137, "eval_samples_per_second": 50.984, "eval_steps_per_second": 1.715, "step": 500 }, { "epoch": 0.3873908089631599, "grad_norm": 0.29296875, "learning_rate": 0.00041581490723435527, "loss": 2.9117815017700197, "step": 510 }, { "epoch": 0.3949867071781238, "grad_norm": 0.2734375, "learning_rate": 0.00041065342227413534, "loss": 2.8861461639404298, "step": 520 }, { "epoch": 0.4025826053930877, "grad_norm": 0.244140625, "learning_rate": 0.00040537475111744196, "loss": 2.918853759765625, "step": 530 }, { "epoch": 0.41017850360805164, "grad_norm": 0.310546875, "learning_rate": 0.00039998306908055066, "loss": 2.8889438629150392, "step": 540 }, { "epoch": 0.41777440182301556, "grad_norm": 0.2578125, "learning_rate": 0.0003944826408689321, "loss": 2.8760492324829103, "step": 550 }, { "epoch": 0.4253703000379795, "grad_norm": 0.2470703125, "learning_rate": 0.00038887781720396166, "loss": 2.8791513442993164, "step": 560 }, { "epoch": 0.4329661982529434, "grad_norm": 0.2578125, "learning_rate": 0.000383173031381591, "loss": 2.8855258941650392, "step": 570 }, { "epoch": 0.44056209646790734, "grad_norm": 0.255859375, "learning_rate": 0.0003773727957657058, "loss": 2.868224334716797, "step": 580 }, { "epoch": 0.44815799468287126, "grad_norm": 0.287109375, "learning_rate": 0.0003714816982189424, "loss": 2.871646690368652, "step": 590 }, { "epoch": 0.4557538928978352, "grad_norm": 0.228515625, "learning_rate": 0.00036550439847378576, "loss": 2.8556640625, "step": 600 }, { "epoch": 0.4557538928978352, "eval_loss": 2.9900174140930176, "eval_runtime": 6.3879, "eval_samples_per_second": 51.191, "eval_steps_per_second": 1.722, "step": 600 }, { "epoch": 0.4633497911127991, "grad_norm": 0.2578125, "learning_rate": 0.00035944562444682114, "loss": 2.8718791961669923, "step": 610 }, { "epoch": 0.470945689327763, "grad_norm": 0.27734375, "learning_rate": 0.0003533101684990526, "loss": 2.8613565444946287, "step": 620 }, { "epoch": 0.4785415875427269, "grad_norm": 0.265625, "learning_rate": 0.0003471028836452474, "loss": 2.8642951965332033, "step": 630 }, { "epoch": 0.48613748575769083, "grad_norm": 0.236328125, "learning_rate": 0.0003408286797153057, "loss": 2.861553764343262, "step": 640 }, { "epoch": 0.49373338397265476, "grad_norm": 0.2734375, "learning_rate": 0.00033449251947068867, "loss": 2.8493188858032226, "step": 650 }, { "epoch": 0.5013292821876187, "grad_norm": 0.2578125, "learning_rate": 0.00032809941467898114, "loss": 2.846090316772461, "step": 660 }, { "epoch": 0.5089251804025826, "grad_norm": 0.31640625, "learning_rate": 0.0003216544221496897, "loss": 2.8381746292114256, "step": 670 }, { "epoch": 0.5165210786175465, "grad_norm": 0.2734375, "learning_rate": 0.00031516263973441466, "loss": 2.844132995605469, "step": 680 }, { "epoch": 0.5241169768325105, "grad_norm": 0.240234375, "learning_rate": 0.00030862920229455756, "loss": 2.8329984664916994, "step": 690 }, { "epoch": 0.5317128750474743, "grad_norm": 0.28125, "learning_rate": 0.00030205927763975616, "loss": 2.830152130126953, "step": 700 }, { "epoch": 0.5317128750474743, "eval_loss": 2.963874578475952, "eval_runtime": 6.3886, "eval_samples_per_second": 51.185, "eval_steps_per_second": 1.722, "step": 700 }, { "epoch": 0.5393087732624383, "grad_norm": 0.27734375, "learning_rate": 0.0002954580624402567, "loss": 2.8245569229125977, "step": 710 }, { "epoch": 0.5469046714774022, "grad_norm": 0.21875, "learning_rate": 0.00028883077811645876, "loss": 2.84329776763916, "step": 720 }, { "epoch": 0.5545005696923662, "grad_norm": 0.2392578125, "learning_rate": 0.00028218266670888316, "loss": 2.835365104675293, "step": 730 }, { "epoch": 0.56209646790733, "grad_norm": 0.25, "learning_rate": 0.0002755189867318296, "loss": 2.809566116333008, "step": 740 }, { "epoch": 0.569692366122294, "grad_norm": 0.2578125, "learning_rate": 0.0002688450090140041, "loss": 2.8277103424072267, "step": 750 }, { "epoch": 0.5772882643372579, "grad_norm": 0.2392578125, "learning_rate": 0.0002621660125294062, "loss": 2.8039220809936523, "step": 760 }, { "epoch": 0.5848841625522218, "grad_norm": 0.25390625, "learning_rate": 0.0002554872802217726, "loss": 2.8002191543579102, "step": 770 }, { "epoch": 0.5924800607671857, "grad_norm": 0.23828125, "learning_rate": 0.00024881409482588177, "loss": 2.813232421875, "step": 780 }, { "epoch": 0.6000759589821496, "grad_norm": 0.248046875, "learning_rate": 0.00024215173468902332, "loss": 2.8190376281738283, "step": 790 }, { "epoch": 0.6076718571971136, "grad_norm": 0.216796875, "learning_rate": 0.00023550546959593793, "loss": 2.8102094650268556, "step": 800 }, { "epoch": 0.6076718571971136, "eval_loss": 2.933663845062256, "eval_runtime": 6.4064, "eval_samples_per_second": 51.042, "eval_steps_per_second": 1.717, "step": 800 }, { "epoch": 0.6152677554120775, "grad_norm": 0.2197265625, "learning_rate": 0.00022888055660052993, "loss": 2.7970836639404295, "step": 810 }, { "epoch": 0.6228636536270414, "grad_norm": 0.21484375, "learning_rate": 0.0002222822358676499, "loss": 2.8055255889892576, "step": 820 }, { "epoch": 0.6304595518420053, "grad_norm": 0.2275390625, "learning_rate": 0.00021571572652823615, "loss": 2.793012809753418, "step": 830 }, { "epoch": 0.6380554500569693, "grad_norm": 0.212890625, "learning_rate": 0.00020918622255109334, "loss": 2.7924644470214846, "step": 840 }, { "epoch": 0.6456513482719332, "grad_norm": 0.21484375, "learning_rate": 0.000202698888634574, "loss": 2.7925525665283204, "step": 850 }, { "epoch": 0.653247246486897, "grad_norm": 0.2099609375, "learning_rate": 0.00019625885612141222, "loss": 2.7974515914916993, "step": 860 }, { "epoch": 0.660843144701861, "grad_norm": 0.2353515625, "learning_rate": 0.00018987121893994128, "loss": 2.794886016845703, "step": 870 }, { "epoch": 0.6684390429168249, "grad_norm": 0.1962890625, "learning_rate": 0.00018354102957490476, "loss": 2.77576904296875, "step": 880 }, { "epoch": 0.6760349411317889, "grad_norm": 0.1865234375, "learning_rate": 0.00017727329507104896, "loss": 2.781934356689453, "step": 890 }, { "epoch": 0.6836308393467527, "grad_norm": 0.1982421875, "learning_rate": 0.00017107297307265726, "loss": 2.775553894042969, "step": 900 }, { "epoch": 0.6836308393467527, "eval_loss": 2.9109058380126953, "eval_runtime": 6.3905, "eval_samples_per_second": 51.17, "eval_steps_per_second": 1.721, "step": 900 }, { "epoch": 0.6912267375617167, "grad_norm": 0.1787109375, "learning_rate": 0.0001649449679021595, "loss": 2.780860710144043, "step": 910 }, { "epoch": 0.6988226357766806, "grad_norm": 0.203125, "learning_rate": 0.00015889412668091725, "loss": 2.7567111968994142, "step": 920 }, { "epoch": 0.7064185339916446, "grad_norm": 0.2109375, "learning_rate": 0.00015292523549525436, "loss": 2.771552085876465, "step": 930 }, { "epoch": 0.7140144322066084, "grad_norm": 0.2236328125, "learning_rate": 0.00014704301561076487, "loss": 2.7714685440063476, "step": 940 }, { "epoch": 0.7216103304215723, "grad_norm": 0.208984375, "learning_rate": 0.00014125211973789242, "loss": 2.7673364639282227, "step": 950 }, { "epoch": 0.7292062286365363, "grad_norm": 0.197265625, "learning_rate": 0.00013555712835173575, "loss": 2.7799705505371093, "step": 960 }, { "epoch": 0.7368021268515001, "grad_norm": 0.1982421875, "learning_rate": 0.00012996254606899047, "loss": 2.778921699523926, "step": 970 }, { "epoch": 0.7443980250664641, "grad_norm": 0.2060546875, "learning_rate": 0.0001244727980848934, "loss": 2.767135810852051, "step": 980 }, { "epoch": 0.751993923281428, "grad_norm": 0.185546875, "learning_rate": 0.00011909222667298774, "loss": 2.776322937011719, "step": 990 }, { "epoch": 0.759589821496392, "grad_norm": 0.1787109375, "learning_rate": 0.00011382508775047693, "loss": 2.767734336853027, "step": 1000 }, { "epoch": 0.759589821496392, "eval_loss": 2.8951478004455566, "eval_runtime": 6.4384, "eval_samples_per_second": 50.789, "eval_steps_per_second": 1.709, "step": 1000 }, { "epoch": 0.7671857197113559, "grad_norm": 0.1826171875, "learning_rate": 0.00010867554751188518, "loss": 2.762259674072266, "step": 1010 }, { "epoch": 0.7747816179263198, "grad_norm": 0.16796875, "learning_rate": 0.00010364767913368654, "loss": 2.768287467956543, "step": 1020 }, { "epoch": 0.7823775161412837, "grad_norm": 0.1748046875, "learning_rate": 9.874545955250897e-05, "loss": 2.765730857849121, "step": 1030 }, { "epoch": 0.7899734143562476, "grad_norm": 0.185546875, "learning_rate": 9.397276631946256e-05, "loss": 2.7567041397094725, "step": 1040 }, { "epoch": 0.7975693125712116, "grad_norm": 0.1806640625, "learning_rate": 8.933337453307916e-05, "loss": 2.746847152709961, "step": 1050 }, { "epoch": 0.8051652107861754, "grad_norm": 0.177734375, "learning_rate": 8.483095385328999e-05, "loss": 2.747633361816406, "step": 1060 }, { "epoch": 0.8127611090011394, "grad_norm": 0.189453125, "learning_rate": 8.046906559880302e-05, "loss": 2.7606531143188477, "step": 1070 }, { "epoch": 0.8203570072161033, "grad_norm": 0.1865234375, "learning_rate": 7.625115993017566e-05, "loss": 2.758637619018555, "step": 1080 }, { "epoch": 0.8279529054310673, "grad_norm": 0.1806640625, "learning_rate": 7.218057312081155e-05, "loss": 2.761465644836426, "step": 1090 }, { "epoch": 0.8355488036460311, "grad_norm": 0.1708984375, "learning_rate": 6.826052491803939e-05, "loss": 2.7564212799072267, "step": 1100 }, { "epoch": 0.8355488036460311, "eval_loss": 2.88885760307312, "eval_runtime": 6.3901, "eval_samples_per_second": 51.173, "eval_steps_per_second": 1.721, "step": 1100 }, { "epoch": 0.8431447018609951, "grad_norm": 0.166015625, "learning_rate": 6.449411599636155e-05, "loss": 2.747487258911133, "step": 1110 }, { "epoch": 0.850740600075959, "grad_norm": 0.1669921875, "learning_rate": 6.0884325504886556e-05, "loss": 2.7676666259765623, "step": 1120 }, { "epoch": 0.858336498290923, "grad_norm": 0.1728515625, "learning_rate": 5.743400871088574e-05, "loss": 2.7493162155151367, "step": 1130 }, { "epoch": 0.8659323965058868, "grad_norm": 0.1630859375, "learning_rate": 5.414589474133783e-05, "loss": 2.7586923599243165, "step": 1140 }, { "epoch": 0.8735282947208507, "grad_norm": 0.169921875, "learning_rate": 5.1022584424247705e-05, "loss": 2.7609556198120115, "step": 1150 }, { "epoch": 0.8811241929358147, "grad_norm": 0.1630859375, "learning_rate": 4.8066548231446775e-05, "loss": 2.7444868087768555, "step": 1160 }, { "epoch": 0.8887200911507785, "grad_norm": 0.169921875, "learning_rate": 4.528012432450273e-05, "loss": 2.750021553039551, "step": 1170 }, { "epoch": 0.8963159893657425, "grad_norm": 0.1640625, "learning_rate": 4.266551670528335e-05, "loss": 2.768070411682129, "step": 1180 }, { "epoch": 0.9039118875807064, "grad_norm": 0.162109375, "learning_rate": 4.0224793472638234e-05, "loss": 2.7698774337768555, "step": 1190 }, { "epoch": 0.9115077857956704, "grad_norm": 0.16015625, "learning_rate": 3.7959885186576626e-05, "loss": 2.7517560958862304, "step": 1200 }, { "epoch": 0.9115077857956704, "eval_loss": 2.8854928016662598, "eval_runtime": 6.4263, "eval_samples_per_second": 50.885, "eval_steps_per_second": 1.712, "step": 1200 }, { "epoch": 0.9191036840106342, "grad_norm": 0.1669921875, "learning_rate": 3.5872583341235727e-05, "loss": 2.761515235900879, "step": 1210 }, { "epoch": 0.9266995822255982, "grad_norm": 0.166015625, "learning_rate": 3.3964538947846945e-05, "loss": 2.7607538223266603, "step": 1220 }, { "epoch": 0.9342954804405621, "grad_norm": 0.171875, "learning_rate": 3.223726122882127e-05, "loss": 2.74609375, "step": 1230 }, { "epoch": 0.941891378655526, "grad_norm": 0.162109375, "learning_rate": 3.069211642398656e-05, "loss": 2.7672258377075196, "step": 1240 }, { "epoch": 0.94948727687049, "grad_norm": 0.15625, "learning_rate": 2.9330326709921017e-05, "loss": 2.750092697143555, "step": 1250 }, { "epoch": 0.9570831750854538, "grad_norm": 0.1552734375, "learning_rate": 2.8152969233237523e-05, "loss": 2.739312934875488, "step": 1260 }, { "epoch": 0.9646790733004178, "grad_norm": 0.1708984375, "learning_rate": 2.7160975258583626e-05, "loss": 2.7647802352905275, "step": 1270 }, { "epoch": 0.9722749715153817, "grad_norm": 0.162109375, "learning_rate": 2.6355129432031147e-05, "loss": 2.74219970703125, "step": 1280 }, { "epoch": 0.9798708697303457, "grad_norm": 0.15625, "learning_rate": 2.5736069160437846e-05, "loss": 2.751408576965332, "step": 1290 }, { "epoch": 0.9874667679453095, "grad_norm": 0.162109375, "learning_rate": 2.5304284107272224e-05, "loss": 2.748354911804199, "step": 1300 }, { "epoch": 0.9874667679453095, "eval_loss": 2.884568452835083, "eval_runtime": 6.3925, "eval_samples_per_second": 51.154, "eval_steps_per_second": 1.721, "step": 1300 }, { "epoch": 0.9950626661602735, "grad_norm": 0.1591796875, "learning_rate": 2.5060115805300056e-05, "loss": 2.7556131362915037, "step": 1310 }, { "epoch": 1.0, "eval_loss": 2.884584665298462, "eval_runtime": 6.2983, "eval_samples_per_second": 51.919, "eval_steps_per_second": 1.747, "step": 1317 }, { "epoch": 0.04552666068841829, "grad_norm": 8.5625, "learning_rate": 0.0004995606766654085, "loss": 3.94569460550944, "step": 1320 }, { "epoch": 0.045871559633027525, "grad_norm": 0.4375, "learning_rate": 0.0004995527919860256, "loss": 3.688318634033203, "step": 1330 }, { "epoch": 0.04621645857763675, "grad_norm": 0.267578125, "learning_rate": 0.0004995448372467478, "loss": 3.4252037048339843, "step": 1340 }, { "epoch": 0.04656135752224598, "grad_norm": 0.279296875, "learning_rate": 0.0004995368124499263, "loss": 3.3581897735595705, "step": 1350 }, { "epoch": 0.046906256466855215, "grad_norm": 0.267578125, "learning_rate": 0.0004995287175979324, "loss": 3.306211471557617, "step": 1360 }, { "epoch": 0.04725115541146444, "grad_norm": 0.24609375, "learning_rate": 0.0004995205526931589, "loss": 3.3056015014648437, "step": 1370 }, { "epoch": 0.04759605435607367, "grad_norm": 0.2451171875, "learning_rate": 0.0004995123177380185, "loss": 3.2437950134277345, "step": 1380 }, { "epoch": 0.0479409533006829, "grad_norm": 0.279296875, "learning_rate": 0.0004995040127349455, "loss": 3.2430068969726564, "step": 1390 }, { "epoch": 0.04828585224529213, "grad_norm": 0.283203125, "learning_rate": 0.0004994956376863939, "loss": 3.2402618408203123, "step": 1400 }, { "epoch": 0.04828585224529213, "eval_loss": 3.1775357723236084, "eval_runtime": 6.7497, "eval_samples_per_second": 48.447, "eval_steps_per_second": 1.63, "step": 1400 }, { "epoch": 0.04863075118990136, "grad_norm": 0.30859375, "learning_rate": 0.0004994871925948393, "loss": 3.22863883972168, "step": 1410 }, { "epoch": 0.048975650134510586, "grad_norm": 0.2451171875, "learning_rate": 0.0004994786774627774, "loss": 3.2331768035888673, "step": 1420 }, { "epoch": 0.04932054907911982, "grad_norm": 0.244140625, "learning_rate": 0.0004994700922927248, "loss": 3.1989618301391602, "step": 1430 }, { "epoch": 0.04966544802372905, "grad_norm": 0.263671875, "learning_rate": 0.0004994614370872189, "loss": 3.168655204772949, "step": 1440 }, { "epoch": 0.050010346968338275, "grad_norm": 0.275390625, "learning_rate": 0.0004994527118488177, "loss": 3.2157833099365236, "step": 1450 }, { "epoch": 0.05035524591294751, "grad_norm": 0.255859375, "learning_rate": 0.0004994439165800999, "loss": 3.186210060119629, "step": 1460 }, { "epoch": 0.050700144857556736, "grad_norm": 0.28125, "learning_rate": 0.0004994350512836648, "loss": 3.1895734786987306, "step": 1470 }, { "epoch": 0.051045043802165964, "grad_norm": 0.2314453125, "learning_rate": 0.0004994261159621327, "loss": 3.1697080612182615, "step": 1480 }, { "epoch": 0.0513899427467752, "grad_norm": 0.275390625, "learning_rate": 0.0004994171106181441, "loss": 3.1745536804199217, "step": 1490 }, { "epoch": 0.051734841691384426, "grad_norm": 0.255859375, "learning_rate": 0.0004994080352543608, "loss": 3.1699466705322266, "step": 1500 }, { "epoch": 0.051734841691384426, "eval_loss": 3.178737163543701, "eval_runtime": 6.7276, "eval_samples_per_second": 48.606, "eval_steps_per_second": 1.635, "step": 1500 }, { "epoch": 0.05207974063599365, "grad_norm": 0.265625, "learning_rate": 0.0004993988898734648, "loss": 3.1477949142456056, "step": 1510 }, { "epoch": 0.05242463958060288, "grad_norm": 0.296875, "learning_rate": 0.000499389674478159, "loss": 3.176782989501953, "step": 1520 }, { "epoch": 0.052769538525212115, "grad_norm": 0.271484375, "learning_rate": 0.000499380389071167, "loss": 3.1550008773803713, "step": 1530 }, { "epoch": 0.05311443746982134, "grad_norm": 0.283203125, "learning_rate": 0.0004993710336552331, "loss": 3.16734619140625, "step": 1540 }, { "epoch": 0.05345933641443057, "grad_norm": 0.29296875, "learning_rate": 0.0004993616082331221, "loss": 3.117188835144043, "step": 1550 }, { "epoch": 0.053804235359039804, "grad_norm": 0.265625, "learning_rate": 0.0004993521128076199, "loss": 3.1880640029907226, "step": 1560 }, { "epoch": 0.05414913430364903, "grad_norm": 0.23046875, "learning_rate": 0.0004993425473815325, "loss": 3.1521093368530275, "step": 1570 }, { "epoch": 0.05449403324825826, "grad_norm": 0.263671875, "learning_rate": 0.0004993329119576872, "loss": 3.1449941635131835, "step": 1580 }, { "epoch": 0.05483893219286749, "grad_norm": 0.267578125, "learning_rate": 0.0004993232065389315, "loss": 3.164867401123047, "step": 1590 }, { "epoch": 0.05518383113747672, "grad_norm": 0.333984375, "learning_rate": 0.0004993134311281341, "loss": 3.1254270553588865, "step": 1600 }, { "epoch": 0.05518383113747672, "eval_loss": 3.1886394023895264, "eval_runtime": 6.7151, "eval_samples_per_second": 48.696, "eval_steps_per_second": 1.638, "step": 1600 }, { "epoch": 0.05552873008208595, "grad_norm": 0.28125, "learning_rate": 0.0004993035857281838, "loss": 3.158915901184082, "step": 1610 }, { "epoch": 0.055873629026695175, "grad_norm": 0.255859375, "learning_rate": 0.0004992936703419904, "loss": 3.1532636642456056, "step": 1620 }, { "epoch": 0.05621852797130441, "grad_norm": 0.2578125, "learning_rate": 0.0004992836849724843, "loss": 3.1459360122680664, "step": 1630 }, { "epoch": 0.05656342691591364, "grad_norm": 0.263671875, "learning_rate": 0.0004992736296226168, "loss": 3.1383129119873048, "step": 1640 }, { "epoch": 0.056908325860522864, "grad_norm": 0.240234375, "learning_rate": 0.0004992635042953597, "loss": 3.1324377059936523, "step": 1650 }, { "epoch": 0.0572532248051321, "grad_norm": 0.2431640625, "learning_rate": 0.0004992533089937053, "loss": 3.164575958251953, "step": 1660 }, { "epoch": 0.057598123749741326, "grad_norm": 0.283203125, "learning_rate": 0.000499243043720667, "loss": 3.15883846282959, "step": 1670 }, { "epoch": 0.05794302269435055, "grad_norm": 0.28125, "learning_rate": 0.0004992327084792785, "loss": 3.123383140563965, "step": 1680 }, { "epoch": 0.05828792163895979, "grad_norm": 0.2431640625, "learning_rate": 0.0004992223032725944, "loss": 3.1440086364746094, "step": 1690 }, { "epoch": 0.058632820583569015, "grad_norm": 0.216796875, "learning_rate": 0.00049921182810369, "loss": 3.112078857421875, "step": 1700 }, { "epoch": 0.058632820583569015, "eval_loss": 3.211069345474243, "eval_runtime": 6.7281, "eval_samples_per_second": 48.602, "eval_steps_per_second": 1.635, "step": 1700 }, { "epoch": 0.05897771952817824, "grad_norm": 0.2412109375, "learning_rate": 0.0004992012829756609, "loss": 3.171876335144043, "step": 1710 }, { "epoch": 0.059322618472787476, "grad_norm": 0.2314453125, "learning_rate": 0.000499190667891624, "loss": 3.1190860748291014, "step": 1720 }, { "epoch": 0.059667517417396704, "grad_norm": 0.216796875, "learning_rate": 0.0004991799828547164, "loss": 3.1243335723876955, "step": 1730 }, { "epoch": 0.06001241636200593, "grad_norm": 0.2314453125, "learning_rate": 0.000499169227868096, "loss": 3.105545234680176, "step": 1740 }, { "epoch": 0.06035731530661516, "grad_norm": 0.2197265625, "learning_rate": 0.0004991584029349413, "loss": 3.104082489013672, "step": 1750 }, { "epoch": 0.06070221425122439, "grad_norm": 0.2578125, "learning_rate": 0.0004991475080584518, "loss": 3.1014020919799803, "step": 1760 }, { "epoch": 0.06104711319583362, "grad_norm": 0.2353515625, "learning_rate": 0.0004991365432418472, "loss": 3.1070577621459963, "step": 1770 }, { "epoch": 0.06139201214044285, "grad_norm": 0.224609375, "learning_rate": 0.0004991255084883683, "loss": 3.12465763092041, "step": 1780 }, { "epoch": 0.06173691108505208, "grad_norm": 0.294921875, "learning_rate": 0.0004991144038012762, "loss": 3.110963249206543, "step": 1790 }, { "epoch": 0.06208181002966131, "grad_norm": 0.265625, "learning_rate": 0.000499103229183853, "loss": 3.1210065841674806, "step": 1800 }, { "epoch": 0.06208181002966131, "eval_loss": 3.2403862476348877, "eval_runtime": 6.8085, "eval_samples_per_second": 48.028, "eval_steps_per_second": 1.616, "step": 1800 }, { "epoch": 0.06242670897427054, "grad_norm": 0.2421875, "learning_rate": 0.0004990919846394012, "loss": 3.111033058166504, "step": 1810 }, { "epoch": 0.06277160791887977, "grad_norm": 0.244140625, "learning_rate": 0.000499080670171244, "loss": 3.0953065872192385, "step": 1820 }, { "epoch": 0.06311650686348899, "grad_norm": 0.2373046875, "learning_rate": 0.0004990692857827254, "loss": 3.094102478027344, "step": 1830 }, { "epoch": 0.06346140580809823, "grad_norm": 0.244140625, "learning_rate": 0.0004990578314772101, "loss": 3.1337677001953126, "step": 1840 }, { "epoch": 0.06380630475270746, "grad_norm": 0.2490234375, "learning_rate": 0.0004990463072580834, "loss": 3.075612258911133, "step": 1850 }, { "epoch": 0.06415120369731668, "grad_norm": 0.251953125, "learning_rate": 0.000499034713128751, "loss": 3.121097755432129, "step": 1860 }, { "epoch": 0.06449610264192591, "grad_norm": 0.28515625, "learning_rate": 0.0004990230490926398, "loss": 3.1022356033325194, "step": 1870 }, { "epoch": 0.06484100158653515, "grad_norm": 0.251953125, "learning_rate": 0.0004990113151531968, "loss": 3.106301116943359, "step": 1880 }, { "epoch": 0.06518590053114437, "grad_norm": 0.22265625, "learning_rate": 0.00049899951131389, "loss": 3.0839033126831055, "step": 1890 }, { "epoch": 0.0655307994757536, "grad_norm": 0.255859375, "learning_rate": 0.0004989876375782079, "loss": 3.116221618652344, "step": 1900 }, { "epoch": 0.0655307994757536, "eval_loss": 3.2191734313964844, "eval_runtime": 6.7393, "eval_samples_per_second": 48.522, "eval_steps_per_second": 1.632, "step": 1900 }, { "epoch": 0.06587569842036284, "grad_norm": 0.2197265625, "learning_rate": 0.00049897569394966, "loss": 3.105671501159668, "step": 1910 }, { "epoch": 0.06622059736497206, "grad_norm": 0.244140625, "learning_rate": 0.0004989636804317758, "loss": 3.0686840057373046, "step": 1920 }, { "epoch": 0.06656549630958129, "grad_norm": 0.251953125, "learning_rate": 0.0004989515970281061, "loss": 3.1332202911376954, "step": 1930 }, { "epoch": 0.06691039525419053, "grad_norm": 0.2373046875, "learning_rate": 0.000498939443742222, "loss": 3.108740043640137, "step": 1940 }, { "epoch": 0.06725529419879975, "grad_norm": 0.2431640625, "learning_rate": 0.0004989272205777154, "loss": 3.076454925537109, "step": 1950 }, { "epoch": 0.06760019314340898, "grad_norm": 0.2431640625, "learning_rate": 0.0004989149275381987, "loss": 3.068858337402344, "step": 1960 }, { "epoch": 0.06794509208801822, "grad_norm": 0.30078125, "learning_rate": 0.0004989025646273054, "loss": 3.072835922241211, "step": 1970 }, { "epoch": 0.06828999103262744, "grad_norm": 0.224609375, "learning_rate": 0.0004988901318486889, "loss": 3.0758934020996094, "step": 1980 }, { "epoch": 0.06863488997723667, "grad_norm": 0.2373046875, "learning_rate": 0.0004988776292060235, "loss": 3.069691848754883, "step": 1990 }, { "epoch": 0.0689797889218459, "grad_norm": 0.25, "learning_rate": 0.000498865056703005, "loss": 3.071276092529297, "step": 2000 }, { "epoch": 0.0689797889218459, "eval_loss": 3.195521593093872, "eval_runtime": 6.7353, "eval_samples_per_second": 48.55, "eval_steps_per_second": 1.633, "step": 2000 }, { "epoch": 0.06932468786645513, "grad_norm": 0.23828125, "learning_rate": 0.0004988524143433485, "loss": 3.095376205444336, "step": 2010 }, { "epoch": 0.06966958681106436, "grad_norm": 0.240234375, "learning_rate": 0.0004988397021307906, "loss": 3.0992828369140626, "step": 2020 }, { "epoch": 0.0700144857556736, "grad_norm": 0.2578125, "learning_rate": 0.0004988269200690886, "loss": 3.0559410095214843, "step": 2030 }, { "epoch": 0.07035938470028281, "grad_norm": 0.248046875, "learning_rate": 0.0004988140681620196, "loss": 3.0838075637817384, "step": 2040 }, { "epoch": 0.07070428364489205, "grad_norm": 0.2421875, "learning_rate": 0.0004988011464133826, "loss": 3.0631616592407225, "step": 2050 }, { "epoch": 0.07104918258950127, "grad_norm": 0.220703125, "learning_rate": 0.0004987881548269961, "loss": 3.130056953430176, "step": 2060 }, { "epoch": 0.0713940815341105, "grad_norm": 0.23828125, "learning_rate": 0.0004987750934066998, "loss": 3.1007272720336916, "step": 2070 }, { "epoch": 0.07173898047871974, "grad_norm": 0.2294921875, "learning_rate": 0.0004987619621563541, "loss": 3.115607261657715, "step": 2080 }, { "epoch": 0.07208387942332896, "grad_norm": 0.2177734375, "learning_rate": 0.0004987487610798396, "loss": 3.0787405014038085, "step": 2090 }, { "epoch": 0.07242877836793819, "grad_norm": 0.212890625, "learning_rate": 0.0004987354901810581, "loss": 3.0954341888427734, "step": 2100 }, { "epoch": 0.07242877836793819, "eval_loss": 3.2088491916656494, "eval_runtime": 6.7313, "eval_samples_per_second": 48.579, "eval_steps_per_second": 1.634, "step": 2100 }, { "epoch": 0.07277367731254743, "grad_norm": 0.2451171875, "learning_rate": 0.0004987221494639316, "loss": 3.0991601943969727, "step": 2110 }, { "epoch": 0.07311857625715665, "grad_norm": 0.236328125, "learning_rate": 0.000498708738932403, "loss": 3.0792991638183596, "step": 2120 }, { "epoch": 0.07346347520176588, "grad_norm": 0.2392578125, "learning_rate": 0.0004986952585904356, "loss": 3.063749885559082, "step": 2130 }, { "epoch": 0.07380837414637512, "grad_norm": 0.2333984375, "learning_rate": 0.0004986817084420136, "loss": 3.064266395568848, "step": 2140 }, { "epoch": 0.07415327309098434, "grad_norm": 0.232421875, "learning_rate": 0.0004986680884911415, "loss": 3.0542619705200194, "step": 2150 }, { "epoch": 0.07449817203559357, "grad_norm": 0.236328125, "learning_rate": 0.0004986543987418446, "loss": 3.0570451736450197, "step": 2160 }, { "epoch": 0.0748430709802028, "grad_norm": 0.2294921875, "learning_rate": 0.0004986406391981692, "loss": 3.0890731811523438, "step": 2170 }, { "epoch": 0.07518796992481203, "grad_norm": 0.2470703125, "learning_rate": 0.0004986268098641814, "loss": 3.0486711502075194, "step": 2180 }, { "epoch": 0.07553286886942126, "grad_norm": 0.267578125, "learning_rate": 0.0004986129107439688, "loss": 3.065072250366211, "step": 2190 }, { "epoch": 0.0758777678140305, "grad_norm": 0.2177734375, "learning_rate": 0.0004985989418416389, "loss": 3.0860727310180662, "step": 2200 }, { "epoch": 0.0758777678140305, "eval_loss": 3.2100729942321777, "eval_runtime": 6.7308, "eval_samples_per_second": 48.583, "eval_steps_per_second": 1.634, "step": 2200 }, { "epoch": 0.07622266675863971, "grad_norm": 0.259765625, "learning_rate": 0.0004985849031613204, "loss": 3.0380903244018556, "step": 2210 }, { "epoch": 0.07656756570324895, "grad_norm": 0.2392578125, "learning_rate": 0.0004985707947071623, "loss": 3.094039535522461, "step": 2220 }, { "epoch": 0.07691246464785818, "grad_norm": 0.23828125, "learning_rate": 0.0004985566164833342, "loss": 3.078387451171875, "step": 2230 }, { "epoch": 0.0772573635924674, "grad_norm": 0.232421875, "learning_rate": 0.0004985423684940263, "loss": 3.0869937896728517, "step": 2240 }, { "epoch": 0.07760226253707664, "grad_norm": 0.21875, "learning_rate": 0.00049852805074345, "loss": 3.0973333358764648, "step": 2250 }, { "epoch": 0.07794716148168587, "grad_norm": 0.291015625, "learning_rate": 0.0004985136632358363, "loss": 3.063151168823242, "step": 2260 }, { "epoch": 0.0782920604262951, "grad_norm": 0.2451171875, "learning_rate": 0.0004984992059754378, "loss": 3.056650733947754, "step": 2270 }, { "epoch": 0.07863695937090433, "grad_norm": 0.2353515625, "learning_rate": 0.0004984846789665269, "loss": 3.066288375854492, "step": 2280 }, { "epoch": 0.07898185831551355, "grad_norm": 0.2333984375, "learning_rate": 0.0004984700822133972, "loss": 3.03564510345459, "step": 2290 }, { "epoch": 0.07932675726012278, "grad_norm": 0.224609375, "learning_rate": 0.0004984554157203628, "loss": 3.049472618103027, "step": 2300 }, { "epoch": 0.07932675726012278, "eval_loss": 3.1962928771972656, "eval_runtime": 6.7335, "eval_samples_per_second": 48.563, "eval_steps_per_second": 1.634, "step": 2300 }, { "epoch": 0.07967165620473202, "grad_norm": 0.2080078125, "learning_rate": 0.0004984406794917581, "loss": 3.0810522079467773, "step": 2310 }, { "epoch": 0.08001655514934124, "grad_norm": 0.23828125, "learning_rate": 0.0004984258735319384, "loss": 3.054339790344238, "step": 2320 }, { "epoch": 0.08036145409395047, "grad_norm": 0.2255859375, "learning_rate": 0.0004984109978452797, "loss": 3.071099281311035, "step": 2330 }, { "epoch": 0.0807063530385597, "grad_norm": 0.224609375, "learning_rate": 0.0004983960524361782, "loss": 3.032479476928711, "step": 2340 }, { "epoch": 0.08105125198316893, "grad_norm": 0.20703125, "learning_rate": 0.0004983810373090511, "loss": 3.066059875488281, "step": 2350 }, { "epoch": 0.08139615092777816, "grad_norm": 0.25, "learning_rate": 0.000498365952468336, "loss": 3.063777542114258, "step": 2360 }, { "epoch": 0.0817410498723874, "grad_norm": 0.2177734375, "learning_rate": 0.0004983507979184911, "loss": 3.063796806335449, "step": 2370 }, { "epoch": 0.08208594881699662, "grad_norm": 0.248046875, "learning_rate": 0.0004983355736639955, "loss": 3.021498107910156, "step": 2380 }, { "epoch": 0.08243084776160585, "grad_norm": 0.28125, "learning_rate": 0.0004983202797093483, "loss": 3.0589014053344727, "step": 2390 }, { "epoch": 0.08277574670621508, "grad_norm": 0.23828125, "learning_rate": 0.0004983049160590698, "loss": 3.033548355102539, "step": 2400 }, { "epoch": 0.08277574670621508, "eval_loss": 3.197201728820801, "eval_runtime": 6.8331, "eval_samples_per_second": 47.855, "eval_steps_per_second": 1.61, "step": 2400 }, { "epoch": 0.0831206456508243, "grad_norm": 0.2412109375, "learning_rate": 0.0004982894827177006, "loss": 3.038789749145508, "step": 2410 }, { "epoch": 0.08346554459543354, "grad_norm": 0.2099609375, "learning_rate": 0.000498273979689802, "loss": 3.0522674560546874, "step": 2420 }, { "epoch": 0.08381044354004277, "grad_norm": 0.291015625, "learning_rate": 0.0004982584069799557, "loss": 3.0577108383178713, "step": 2430 }, { "epoch": 0.084155342484652, "grad_norm": 0.25, "learning_rate": 0.0004982427645927644, "loss": 3.0683292388916015, "step": 2440 }, { "epoch": 0.08450024142926123, "grad_norm": 0.248046875, "learning_rate": 0.0004982270525328509, "loss": 3.0640302658081056, "step": 2450 }, { "epoch": 0.08484514037387046, "grad_norm": 0.2431640625, "learning_rate": 0.0004982112708048588, "loss": 3.061013412475586, "step": 2460 }, { "epoch": 0.08519003931847968, "grad_norm": 0.251953125, "learning_rate": 0.0004981954194134526, "loss": 3.0707763671875, "step": 2470 }, { "epoch": 0.08553493826308892, "grad_norm": 0.2578125, "learning_rate": 0.000498179498363317, "loss": 3.0547483444213865, "step": 2480 }, { "epoch": 0.08587983720769815, "grad_norm": 0.236328125, "learning_rate": 0.0004981635076591573, "loss": 3.0435951232910154, "step": 2490 }, { "epoch": 0.08622473615230737, "grad_norm": 0.263671875, "learning_rate": 0.0004981474473056994, "loss": 3.091439628601074, "step": 2500 }, { "epoch": 0.08622473615230737, "eval_loss": 3.1967952251434326, "eval_runtime": 6.8075, "eval_samples_per_second": 48.035, "eval_steps_per_second": 1.616, "step": 2500 }, { "epoch": 0.0865696350969166, "grad_norm": 0.2294921875, "learning_rate": 0.00049813131730769, "loss": 3.0426443099975584, "step": 2510 }, { "epoch": 0.08691453404152583, "grad_norm": 0.265625, "learning_rate": 0.0004981151176698963, "loss": 3.080913543701172, "step": 2520 }, { "epoch": 0.08725943298613506, "grad_norm": 0.2431640625, "learning_rate": 0.000498098848397106, "loss": 3.0481851577758787, "step": 2530 }, { "epoch": 0.0876043319307443, "grad_norm": 0.232421875, "learning_rate": 0.0004980825094941274, "loss": 3.01617431640625, "step": 2540 }, { "epoch": 0.08794923087535352, "grad_norm": 0.224609375, "learning_rate": 0.0004980661009657894, "loss": 3.0407470703125, "step": 2550 }, { "epoch": 0.08829412981996275, "grad_norm": 0.2490234375, "learning_rate": 0.0004980496228169413, "loss": 3.0526084899902344, "step": 2560 }, { "epoch": 0.08863902876457198, "grad_norm": 0.21875, "learning_rate": 0.0004980330750524533, "loss": 3.0630365371704102, "step": 2570 }, { "epoch": 0.0889839277091812, "grad_norm": 0.220703125, "learning_rate": 0.0004980164576772161, "loss": 3.017895317077637, "step": 2580 }, { "epoch": 0.08932882665379044, "grad_norm": 0.2373046875, "learning_rate": 0.0004979997706961407, "loss": 3.0463420867919924, "step": 2590 }, { "epoch": 0.08967372559839967, "grad_norm": 0.251953125, "learning_rate": 0.0004979830141141591, "loss": 3.0082685470581056, "step": 2600 }, { "epoch": 0.08967372559839967, "eval_loss": 3.186363935470581, "eval_runtime": 6.7325, "eval_samples_per_second": 48.57, "eval_steps_per_second": 1.634, "step": 2600 }, { "epoch": 0.0900186245430089, "grad_norm": 0.2421875, "learning_rate": 0.0004979661879362233, "loss": 3.026647758483887, "step": 2610 }, { "epoch": 0.09036352348761813, "grad_norm": 0.255859375, "learning_rate": 0.0004979492921673064, "loss": 3.0578779220581054, "step": 2620 }, { "epoch": 0.09070842243222736, "grad_norm": 0.25, "learning_rate": 0.000497932326812402, "loss": 3.0211202621459963, "step": 2630 }, { "epoch": 0.09105332137683658, "grad_norm": 0.259765625, "learning_rate": 0.0004979152918765239, "loss": 3.0802417755126954, "step": 2640 }, { "epoch": 0.09139822032144582, "grad_norm": 0.2314453125, "learning_rate": 0.0004978981873647068, "loss": 3.041337013244629, "step": 2650 }, { "epoch": 0.09174311926605505, "grad_norm": 0.25390625, "learning_rate": 0.0004978810132820059, "loss": 3.0317039489746094, "step": 2660 }, { "epoch": 0.09208801821066427, "grad_norm": 0.2333984375, "learning_rate": 0.0004978637696334969, "loss": 3.043722915649414, "step": 2670 }, { "epoch": 0.0924329171552735, "grad_norm": 0.220703125, "learning_rate": 0.0004978464564242759, "loss": 3.0568105697631838, "step": 2680 }, { "epoch": 0.09277781609988274, "grad_norm": 0.2236328125, "learning_rate": 0.0004978290736594599, "loss": 3.0359878540039062, "step": 2690 }, { "epoch": 0.09312271504449196, "grad_norm": 0.2275390625, "learning_rate": 0.0004978116213441864, "loss": 2.9945466995239256, "step": 2700 }, { "epoch": 0.09312271504449196, "eval_loss": 3.198932409286499, "eval_runtime": 6.7314, "eval_samples_per_second": 48.579, "eval_steps_per_second": 1.634, "step": 2700 }, { "epoch": 0.0934676139891012, "grad_norm": 0.2255859375, "learning_rate": 0.0004977940994836133, "loss": 3.0619199752807615, "step": 2710 }, { "epoch": 0.09381251293371043, "grad_norm": 0.248046875, "learning_rate": 0.0004977765080829191, "loss": 3.055706787109375, "step": 2720 }, { "epoch": 0.09415741187831965, "grad_norm": 0.2373046875, "learning_rate": 0.0004977588471473026, "loss": 3.0402034759521483, "step": 2730 }, { "epoch": 0.09450231082292888, "grad_norm": 0.2236328125, "learning_rate": 0.0004977411166819837, "loss": 3.0405792236328124, "step": 2740 }, { "epoch": 0.09484720976753812, "grad_norm": 0.212890625, "learning_rate": 0.0004977233166922026, "loss": 3.0502443313598633, "step": 2750 }, { "epoch": 0.09519210871214734, "grad_norm": 0.234375, "learning_rate": 0.0004977054471832199, "loss": 3.0309206008911134, "step": 2760 }, { "epoch": 0.09553700765675657, "grad_norm": 0.23828125, "learning_rate": 0.0004976875081603168, "loss": 3.0458982467651365, "step": 2770 }, { "epoch": 0.0958819066013658, "grad_norm": 0.21875, "learning_rate": 0.0004976694996287951, "loss": 3.0382736206054686, "step": 2780 }, { "epoch": 0.09622680554597503, "grad_norm": 0.2138671875, "learning_rate": 0.0004976514215939773, "loss": 3.0607757568359375, "step": 2790 }, { "epoch": 0.09657170449058426, "grad_norm": 0.26171875, "learning_rate": 0.0004976332740612061, "loss": 3.040727424621582, "step": 2800 }, { "epoch": 0.09657170449058426, "eval_loss": 3.1886744499206543, "eval_runtime": 6.7372, "eval_samples_per_second": 48.536, "eval_steps_per_second": 1.633, "step": 2800 }, { "epoch": 0.09691660343519348, "grad_norm": 0.2216796875, "learning_rate": 0.0004976150570358451, "loss": 3.071457862854004, "step": 2810 }, { "epoch": 0.09726150237980272, "grad_norm": 0.2314453125, "learning_rate": 0.000497596770523278, "loss": 3.0482696533203124, "step": 2820 }, { "epoch": 0.09760640132441195, "grad_norm": 0.2197265625, "learning_rate": 0.0004975784145289096, "loss": 3.0346181869506834, "step": 2830 }, { "epoch": 0.09795130026902117, "grad_norm": 0.2373046875, "learning_rate": 0.0004975599890581646, "loss": 3.004329490661621, "step": 2840 }, { "epoch": 0.0982961992136304, "grad_norm": 0.2421875, "learning_rate": 0.0004975414941164889, "loss": 3.023432159423828, "step": 2850 }, { "epoch": 0.09864109815823964, "grad_norm": 0.234375, "learning_rate": 0.0004975229297093485, "loss": 3.028712844848633, "step": 2860 }, { "epoch": 0.09898599710284886, "grad_norm": 0.228515625, "learning_rate": 0.0004975042958422298, "loss": 2.9909120559692384, "step": 2870 }, { "epoch": 0.0993308960474581, "grad_norm": 0.28125, "learning_rate": 0.0004974855925206403, "loss": 3.0135841369628906, "step": 2880 }, { "epoch": 0.09967579499206733, "grad_norm": 0.2177734375, "learning_rate": 0.0004974668197501074, "loss": 3.0275318145751955, "step": 2890 }, { "epoch": 0.10002069393667655, "grad_norm": 0.2294921875, "learning_rate": 0.0004974479775361795, "loss": 3.0700860977172852, "step": 2900 }, { "epoch": 0.10002069393667655, "eval_loss": 3.197871208190918, "eval_runtime": 6.7314, "eval_samples_per_second": 48.578, "eval_steps_per_second": 1.634, "step": 2900 }, { "epoch": 0.10036559288128578, "grad_norm": 0.2353515625, "learning_rate": 0.0004974290658844253, "loss": 3.0187602996826173, "step": 2910 }, { "epoch": 0.10071049182589502, "grad_norm": 0.2373046875, "learning_rate": 0.0004974100848004339, "loss": 3.013742446899414, "step": 2920 }, { "epoch": 0.10105539077050424, "grad_norm": 0.234375, "learning_rate": 0.0004973910342898153, "loss": 3.039021110534668, "step": 2930 }, { "epoch": 0.10140028971511347, "grad_norm": 0.2255859375, "learning_rate": 0.0004973719143581996, "loss": 3.036471366882324, "step": 2940 }, { "epoch": 0.10174518865972271, "grad_norm": 0.255859375, "learning_rate": 0.0004973527250112377, "loss": 2.9922014236450196, "step": 2950 }, { "epoch": 0.10209008760433193, "grad_norm": 0.2470703125, "learning_rate": 0.0004973334662546009, "loss": 2.987853240966797, "step": 2960 }, { "epoch": 0.10243498654894116, "grad_norm": 0.2265625, "learning_rate": 0.0004973141380939811, "loss": 3.023481750488281, "step": 2970 }, { "epoch": 0.1027798854935504, "grad_norm": 0.232421875, "learning_rate": 0.0004972947405350906, "loss": 3.0309520721435548, "step": 2980 }, { "epoch": 0.10312478443815962, "grad_norm": 0.248046875, "learning_rate": 0.0004972752735836623, "loss": 3.034584617614746, "step": 2990 }, { "epoch": 0.10346968338276885, "grad_norm": 0.2353515625, "learning_rate": 0.0004972557372454495, "loss": 3.0353445053100585, "step": 3000 }, { "epoch": 0.10346968338276885, "eval_loss": 3.1815316677093506, "eval_runtime": 6.8396, "eval_samples_per_second": 47.81, "eval_steps_per_second": 1.608, "step": 3000 }, { "epoch": 0.10381458232737807, "grad_norm": 0.23828125, "learning_rate": 0.0004972361315262261, "loss": 3.035526466369629, "step": 3010 }, { "epoch": 0.1041594812719873, "grad_norm": 0.220703125, "learning_rate": 0.0004972164564317865, "loss": 3.0296043395996093, "step": 3020 }, { "epoch": 0.10450438021659654, "grad_norm": 0.2470703125, "learning_rate": 0.0004971967119679456, "loss": 3.041478729248047, "step": 3030 }, { "epoch": 0.10484927916120576, "grad_norm": 0.2275390625, "learning_rate": 0.0004971768981405388, "loss": 3.001759719848633, "step": 3040 }, { "epoch": 0.105194178105815, "grad_norm": 0.236328125, "learning_rate": 0.000497157014955422, "loss": 3.0119159698486326, "step": 3050 }, { "epoch": 0.10553907705042423, "grad_norm": 0.23046875, "learning_rate": 0.0004971370624184715, "loss": 3.0216413497924806, "step": 3060 }, { "epoch": 0.10588397599503345, "grad_norm": 0.205078125, "learning_rate": 0.0004971170405355843, "loss": 3.0348670959472654, "step": 3070 }, { "epoch": 0.10622887493964268, "grad_norm": 0.2275390625, "learning_rate": 0.0004970969493126777, "loss": 3.0531684875488283, "step": 3080 }, { "epoch": 0.10657377388425192, "grad_norm": 0.25390625, "learning_rate": 0.0004970767887556895, "loss": 3.0255355834960938, "step": 3090 }, { "epoch": 0.10691867282886114, "grad_norm": 0.23828125, "learning_rate": 0.0004970565588705781, "loss": 3.016491508483887, "step": 3100 }, { "epoch": 0.10691867282886114, "eval_loss": 3.174170732498169, "eval_runtime": 6.7372, "eval_samples_per_second": 48.537, "eval_steps_per_second": 1.633, "step": 3100 }, { "epoch": 0.10726357177347037, "grad_norm": 0.2138671875, "learning_rate": 0.0004970362596633225, "loss": 2.9967432022094727, "step": 3110 }, { "epoch": 0.10760847071807961, "grad_norm": 0.236328125, "learning_rate": 0.0004970158911399219, "loss": 2.985181999206543, "step": 3120 }, { "epoch": 0.10795336966268883, "grad_norm": 0.228515625, "learning_rate": 0.0004969954533063962, "loss": 3.00512752532959, "step": 3130 }, { "epoch": 0.10829826860729806, "grad_norm": 0.2216796875, "learning_rate": 0.0004969749461687856, "loss": 3.0171781539916993, "step": 3140 }, { "epoch": 0.1086431675519073, "grad_norm": 0.2392578125, "learning_rate": 0.0004969543697331511, "loss": 3.0024200439453126, "step": 3150 }, { "epoch": 0.10898806649651652, "grad_norm": 0.2216796875, "learning_rate": 0.0004969337240055738, "loss": 3.0367971420288087, "step": 3160 }, { "epoch": 0.10933296544112575, "grad_norm": 0.25, "learning_rate": 0.0004969130089921554, "loss": 3.029571533203125, "step": 3170 }, { "epoch": 0.10967786438573499, "grad_norm": 0.2392578125, "learning_rate": 0.0004968922246990184, "loss": 3.0332483291625976, "step": 3180 }, { "epoch": 0.1100227633303442, "grad_norm": 0.216796875, "learning_rate": 0.0004968713711323051, "loss": 3.008295249938965, "step": 3190 }, { "epoch": 0.11036766227495344, "grad_norm": 0.2353515625, "learning_rate": 0.0004968504482981791, "loss": 3.026075553894043, "step": 3200 }, { "epoch": 0.11036766227495344, "eval_loss": 3.172048568725586, "eval_runtime": 6.7364, "eval_samples_per_second": 48.542, "eval_steps_per_second": 1.633, "step": 3200 }, { "epoch": 0.11071256121956267, "grad_norm": 0.2275390625, "learning_rate": 0.0004968294562028237, "loss": 3.0314558029174803, "step": 3210 }, { "epoch": 0.1110574601641719, "grad_norm": 0.27734375, "learning_rate": 0.0004968083948524433, "loss": 3.0183042526245116, "step": 3220 }, { "epoch": 0.11140235910878113, "grad_norm": 0.2373046875, "learning_rate": 0.0004967872642532623, "loss": 3.0487560272216796, "step": 3230 }, { "epoch": 0.11174725805339035, "grad_norm": 0.296875, "learning_rate": 0.000496766064411526, "loss": 3.0047475814819338, "step": 3240 }, { "epoch": 0.11209215699799958, "grad_norm": 0.2373046875, "learning_rate": 0.0004967447953334995, "loss": 3.037026023864746, "step": 3250 }, { "epoch": 0.11243705594260882, "grad_norm": 0.2392578125, "learning_rate": 0.0004967234570254691, "loss": 3.0033973693847655, "step": 3260 }, { "epoch": 0.11278195488721804, "grad_norm": 0.2353515625, "learning_rate": 0.0004967020494937413, "loss": 3.0388776779174806, "step": 3270 }, { "epoch": 0.11312685383182727, "grad_norm": 0.248046875, "learning_rate": 0.0004966805727446426, "loss": 3.014145088195801, "step": 3280 }, { "epoch": 0.11347175277643651, "grad_norm": 0.2177734375, "learning_rate": 0.0004966590267845208, "loss": 3.0064775466918947, "step": 3290 }, { "epoch": 0.11381665172104573, "grad_norm": 0.23046875, "learning_rate": 0.0004966374116197435, "loss": 3.054228591918945, "step": 3300 }, { "epoch": 0.11381665172104573, "eval_loss": 3.1683712005615234, "eval_runtime": 6.7192, "eval_samples_per_second": 48.666, "eval_steps_per_second": 1.637, "step": 3300 }, { "epoch": 0.11416155066565496, "grad_norm": 0.2197265625, "learning_rate": 0.0004966157272566989, "loss": 2.9828277587890626, "step": 3310 }, { "epoch": 0.1145064496102642, "grad_norm": 0.2470703125, "learning_rate": 0.000496593973701796, "loss": 2.992258071899414, "step": 3320 }, { "epoch": 0.11485134855487342, "grad_norm": 0.2177734375, "learning_rate": 0.0004965721509614636, "loss": 3.021725654602051, "step": 3330 }, { "epoch": 0.11519624749948265, "grad_norm": 0.220703125, "learning_rate": 0.0004965502590421517, "loss": 3.032084083557129, "step": 3340 }, { "epoch": 0.11554114644409189, "grad_norm": 0.2578125, "learning_rate": 0.00049652829795033, "loss": 3.017766571044922, "step": 3350 }, { "epoch": 0.1158860453887011, "grad_norm": 0.21484375, "learning_rate": 0.0004965062676924892, "loss": 3.025203514099121, "step": 3360 }, { "epoch": 0.11623094433331034, "grad_norm": 0.251953125, "learning_rate": 0.0004964841682751402, "loss": 3.0111839294433596, "step": 3370 }, { "epoch": 0.11657584327791957, "grad_norm": 0.2353515625, "learning_rate": 0.0004964619997048143, "loss": 3.0000905990600586, "step": 3380 }, { "epoch": 0.1169207422225288, "grad_norm": 0.251953125, "learning_rate": 0.0004964397619880635, "loss": 3.0158496856689454, "step": 3390 }, { "epoch": 0.11726564116713803, "grad_norm": 0.267578125, "learning_rate": 0.00049641745513146, "loss": 3.0142328262329103, "step": 3400 }, { "epoch": 0.11726564116713803, "eval_loss": 3.1717991828918457, "eval_runtime": 6.7287, "eval_samples_per_second": 48.598, "eval_steps_per_second": 1.635, "step": 3400 }, { "epoch": 0.11761054011174726, "grad_norm": 0.2314453125, "learning_rate": 0.0004963950791415963, "loss": 3.0468318939208983, "step": 3410 }, { "epoch": 0.11795543905635648, "grad_norm": 0.2275390625, "learning_rate": 0.0004963726340250858, "loss": 3.0026397705078125, "step": 3420 }, { "epoch": 0.11830033800096572, "grad_norm": 0.220703125, "learning_rate": 0.000496350119788562, "loss": 3.01328067779541, "step": 3430 }, { "epoch": 0.11864523694557495, "grad_norm": 0.271484375, "learning_rate": 0.0004963275364386787, "loss": 3.022497367858887, "step": 3440 }, { "epoch": 0.11899013589018417, "grad_norm": 0.236328125, "learning_rate": 0.0004963048839821105, "loss": 3.036116027832031, "step": 3450 }, { "epoch": 0.11933503483479341, "grad_norm": 0.234375, "learning_rate": 0.0004962821624255521, "loss": 2.98995361328125, "step": 3460 }, { "epoch": 0.11967993377940264, "grad_norm": 0.2080078125, "learning_rate": 0.0004962593717757188, "loss": 3.0167715072631838, "step": 3470 }, { "epoch": 0.12002483272401186, "grad_norm": 0.208984375, "learning_rate": 0.0004962365120393463, "loss": 2.9596494674682616, "step": 3480 }, { "epoch": 0.1203697316686211, "grad_norm": 0.240234375, "learning_rate": 0.0004962135832231908, "loss": 3.0237884521484375, "step": 3490 }, { "epoch": 0.12071463061323032, "grad_norm": 0.2158203125, "learning_rate": 0.0004961905853340285, "loss": 2.9989990234375, "step": 3500 }, { "epoch": 0.12071463061323032, "eval_loss": 3.165252685546875, "eval_runtime": 6.723, "eval_samples_per_second": 48.639, "eval_steps_per_second": 1.636, "step": 3500 }, { "epoch": 0.12105952955783955, "grad_norm": 0.255859375, "learning_rate": 0.0004961675183786567, "loss": 2.991859245300293, "step": 3510 }, { "epoch": 0.12140442850244879, "grad_norm": 0.2265625, "learning_rate": 0.0004961443823638924, "loss": 3.0180643081665037, "step": 3520 }, { "epoch": 0.121749327447058, "grad_norm": 0.2890625, "learning_rate": 0.0004961211772965736, "loss": 3.033351516723633, "step": 3530 }, { "epoch": 0.12209422639166724, "grad_norm": 0.234375, "learning_rate": 0.0004960979031835582, "loss": 2.9912784576416014, "step": 3540 }, { "epoch": 0.12243912533627647, "grad_norm": 0.2275390625, "learning_rate": 0.000496074560031725, "loss": 3.0393821716308596, "step": 3550 }, { "epoch": 0.1227840242808857, "grad_norm": 0.244140625, "learning_rate": 0.0004960511478479729, "loss": 3.0030418395996095, "step": 3560 }, { "epoch": 0.12312892322549493, "grad_norm": 0.248046875, "learning_rate": 0.0004960276666392213, "loss": 3.0119344711303713, "step": 3570 }, { "epoch": 0.12347382217010416, "grad_norm": 0.2314453125, "learning_rate": 0.0004960041164124097, "loss": 2.9897686004638673, "step": 3580 }, { "epoch": 0.12381872111471338, "grad_norm": 0.267578125, "learning_rate": 0.0004959804971744987, "loss": 3.045718193054199, "step": 3590 }, { "epoch": 0.12416362005932262, "grad_norm": 0.21484375, "learning_rate": 0.0004959568089324684, "loss": 2.9756067276000975, "step": 3600 }, { "epoch": 0.12416362005932262, "eval_loss": 3.1751327514648438, "eval_runtime": 6.7661, "eval_samples_per_second": 48.329, "eval_steps_per_second": 1.626, "step": 3600 }, { "epoch": 0.12450851900393185, "grad_norm": 0.2177734375, "learning_rate": 0.0004959330516933201, "loss": 2.989982032775879, "step": 3610 }, { "epoch": 0.12485341794854107, "grad_norm": 0.2412109375, "learning_rate": 0.0004959092254640751, "loss": 2.9974496841430662, "step": 3620 }, { "epoch": 0.1251983168931503, "grad_norm": 0.2177734375, "learning_rate": 0.000495885330251775, "loss": 3.0266117095947265, "step": 3630 }, { "epoch": 0.12554321583775954, "grad_norm": 0.2119140625, "learning_rate": 0.000495861366063482, "loss": 2.9926311492919924, "step": 3640 }, { "epoch": 0.12588811478236878, "grad_norm": 0.2490234375, "learning_rate": 0.0004958373329062787, "loss": 2.9860143661499023, "step": 3650 }, { "epoch": 0.12623301372697798, "grad_norm": 0.232421875, "learning_rate": 0.0004958132307872677, "loss": 3.0157192230224608, "step": 3660 }, { "epoch": 0.12657791267158722, "grad_norm": 0.2314453125, "learning_rate": 0.0004957890597135726, "loss": 3.013762664794922, "step": 3670 }, { "epoch": 0.12692281161619645, "grad_norm": 0.2099609375, "learning_rate": 0.0004957648196923368, "loss": 2.9722711563110353, "step": 3680 }, { "epoch": 0.12726771056080569, "grad_norm": 0.2265625, "learning_rate": 0.0004957405107307245, "loss": 3.0043930053710937, "step": 3690 }, { "epoch": 0.12761260950541492, "grad_norm": 0.234375, "learning_rate": 0.0004957161328359201, "loss": 2.991504096984863, "step": 3700 }, { "epoch": 0.12761260950541492, "eval_loss": 3.159167766571045, "eval_runtime": 6.7318, "eval_samples_per_second": 48.576, "eval_steps_per_second": 1.634, "step": 3700 }, { "epoch": 0.12795750845002415, "grad_norm": 0.28125, "learning_rate": 0.0004956916860151283, "loss": 3.0034387588500975, "step": 3710 }, { "epoch": 0.12830240739463336, "grad_norm": 0.220703125, "learning_rate": 0.0004956671702755743, "loss": 2.9816072463989256, "step": 3720 }, { "epoch": 0.1286473063392426, "grad_norm": 0.240234375, "learning_rate": 0.0004956425856245036, "loss": 3.000564956665039, "step": 3730 }, { "epoch": 0.12899220528385183, "grad_norm": 0.21875, "learning_rate": 0.000495617932069182, "loss": 3.005902862548828, "step": 3740 }, { "epoch": 0.12933710422846106, "grad_norm": 0.224609375, "learning_rate": 0.000495593209616896, "loss": 3.0049072265625, "step": 3750 }, { "epoch": 0.1296820031730703, "grad_norm": 0.216796875, "learning_rate": 0.0004955684182749519, "loss": 2.9935598373413086, "step": 3760 }, { "epoch": 0.13002690211767953, "grad_norm": 0.244140625, "learning_rate": 0.0004955435580506768, "loss": 2.9739862442016602, "step": 3770 }, { "epoch": 0.13037180106228874, "grad_norm": 0.251953125, "learning_rate": 0.0004955186289514182, "loss": 2.9983901977539062, "step": 3780 }, { "epoch": 0.13071670000689797, "grad_norm": 0.232421875, "learning_rate": 0.0004954936309845434, "loss": 3.004456901550293, "step": 3790 }, { "epoch": 0.1310615989515072, "grad_norm": 0.2294921875, "learning_rate": 0.0004954685641574408, "loss": 2.960996627807617, "step": 3800 }, { "epoch": 0.1310615989515072, "eval_loss": 3.164684534072876, "eval_runtime": 6.7202, "eval_samples_per_second": 48.659, "eval_steps_per_second": 1.637, "step": 3800 }, { "epoch": 0.13140649789611644, "grad_norm": 0.25390625, "learning_rate": 0.0004954434284775187, "loss": 2.950288772583008, "step": 3810 }, { "epoch": 0.13175139684072568, "grad_norm": 0.2265625, "learning_rate": 0.0004954182239522056, "loss": 2.9668479919433595, "step": 3820 }, { "epoch": 0.1320962957853349, "grad_norm": 0.21875, "learning_rate": 0.000495392950588951, "loss": 2.977401351928711, "step": 3830 }, { "epoch": 0.13244119472994412, "grad_norm": 0.228515625, "learning_rate": 0.000495367608395224, "loss": 3.0218761444091795, "step": 3840 }, { "epoch": 0.13278609367455335, "grad_norm": 0.228515625, "learning_rate": 0.0004953421973785144, "loss": 2.9925100326538088, "step": 3850 }, { "epoch": 0.13313099261916259, "grad_norm": 0.244140625, "learning_rate": 0.0004953167175463324, "loss": 2.9722568511962892, "step": 3860 }, { "epoch": 0.13347589156377182, "grad_norm": 0.275390625, "learning_rate": 0.0004952911689062085, "loss": 3.006439781188965, "step": 3870 }, { "epoch": 0.13382079050838105, "grad_norm": 0.2177734375, "learning_rate": 0.0004952655514656934, "loss": 2.983469009399414, "step": 3880 }, { "epoch": 0.13416568945299026, "grad_norm": 0.21875, "learning_rate": 0.0004952398652323583, "loss": 3.0055164337158202, "step": 3890 }, { "epoch": 0.1345105883975995, "grad_norm": 0.2451171875, "learning_rate": 0.0004952141102137946, "loss": 3.028909683227539, "step": 3900 }, { "epoch": 0.1345105883975995, "eval_loss": 3.1625843048095703, "eval_runtime": 6.722, "eval_samples_per_second": 48.646, "eval_steps_per_second": 1.636, "step": 3900 }, { "epoch": 0.13485548734220873, "grad_norm": 0.24609375, "learning_rate": 0.0004951882864176139, "loss": 2.9902904510498045, "step": 3910 }, { "epoch": 0.13520038628681796, "grad_norm": 0.220703125, "learning_rate": 0.0004951623938514487, "loss": 3.0018278121948243, "step": 3920 }, { "epoch": 0.1355452852314272, "grad_norm": 0.251953125, "learning_rate": 0.0004951364325229511, "loss": 2.9799169540405273, "step": 3930 }, { "epoch": 0.13589018417603643, "grad_norm": 0.22265625, "learning_rate": 0.000495110402439794, "loss": 2.9893619537353517, "step": 3940 }, { "epoch": 0.13623508312064564, "grad_norm": 0.2412109375, "learning_rate": 0.0004950843036096705, "loss": 2.962021255493164, "step": 3950 }, { "epoch": 0.13657998206525487, "grad_norm": 0.2197265625, "learning_rate": 0.0004950581360402938, "loss": 2.977663040161133, "step": 3960 }, { "epoch": 0.1369248810098641, "grad_norm": 0.21484375, "learning_rate": 0.0004950318997393978, "loss": 2.9969497680664063, "step": 3970 }, { "epoch": 0.13726977995447334, "grad_norm": 0.2197265625, "learning_rate": 0.0004950055947147366, "loss": 3.00067138671875, "step": 3980 }, { "epoch": 0.13761467889908258, "grad_norm": 0.2333984375, "learning_rate": 0.0004949792209740843, "loss": 2.9823270797729493, "step": 3990 }, { "epoch": 0.1379595778436918, "grad_norm": 0.205078125, "learning_rate": 0.0004949527785252357, "loss": 2.982051658630371, "step": 4000 }, { "epoch": 0.1379595778436918, "eval_loss": 3.1498098373413086, "eval_runtime": 6.7185, "eval_samples_per_second": 48.672, "eval_steps_per_second": 1.637, "step": 4000 }, { "epoch": 0.13830447678830102, "grad_norm": 0.228515625, "learning_rate": 0.0004949262673760056, "loss": 3.0193693161010744, "step": 4010 }, { "epoch": 0.13864937573291025, "grad_norm": 0.236328125, "learning_rate": 0.0004948996875342293, "loss": 2.989998626708984, "step": 4020 }, { "epoch": 0.13899427467751949, "grad_norm": 0.251953125, "learning_rate": 0.0004948730390077627, "loss": 3.002806282043457, "step": 4030 }, { "epoch": 0.13933917362212872, "grad_norm": 0.2138671875, "learning_rate": 0.0004948463218044811, "loss": 3.029488182067871, "step": 4040 }, { "epoch": 0.13968407256673795, "grad_norm": 0.26171875, "learning_rate": 0.0004948195359322809, "loss": 2.9810775756835937, "step": 4050 }, { "epoch": 0.1400289715113472, "grad_norm": 0.2353515625, "learning_rate": 0.0004947926813990785, "loss": 2.9854259490966797, "step": 4060 }, { "epoch": 0.1403738704559564, "grad_norm": 0.2099609375, "learning_rate": 0.0004947657582128109, "loss": 2.96386661529541, "step": 4070 }, { "epoch": 0.14071876940056563, "grad_norm": 0.25390625, "learning_rate": 0.0004947387663814348, "loss": 2.9897836685180663, "step": 4080 }, { "epoch": 0.14106366834517486, "grad_norm": 0.2294921875, "learning_rate": 0.0004947117059129276, "loss": 2.9781829833984377, "step": 4090 }, { "epoch": 0.1414085672897841, "grad_norm": 0.201171875, "learning_rate": 0.0004946845768152868, "loss": 3.002536392211914, "step": 4100 }, { "epoch": 0.1414085672897841, "eval_loss": 3.1550486087799072, "eval_runtime": 6.7271, "eval_samples_per_second": 48.609, "eval_steps_per_second": 1.635, "step": 4100 }, { "epoch": 0.14175346623439333, "grad_norm": 0.240234375, "learning_rate": 0.0004946573790965307, "loss": 2.987820625305176, "step": 4110 }, { "epoch": 0.14209836517900254, "grad_norm": 0.22265625, "learning_rate": 0.0004946301127646969, "loss": 2.972881317138672, "step": 4120 }, { "epoch": 0.14244326412361177, "grad_norm": 0.23828125, "learning_rate": 0.0004946027778278443, "loss": 3.0019201278686523, "step": 4130 }, { "epoch": 0.142788163068221, "grad_norm": 0.265625, "learning_rate": 0.0004945753742940514, "loss": 2.988333892822266, "step": 4140 }, { "epoch": 0.14313306201283024, "grad_norm": 0.2275390625, "learning_rate": 0.0004945479021714171, "loss": 2.9953964233398436, "step": 4150 }, { "epoch": 0.14347796095743948, "grad_norm": 0.2353515625, "learning_rate": 0.0004945203614680609, "loss": 2.982470893859863, "step": 4160 }, { "epoch": 0.1438228599020487, "grad_norm": 0.2265625, "learning_rate": 0.0004944927521921223, "loss": 3.003155517578125, "step": 4170 }, { "epoch": 0.14416775884665792, "grad_norm": 0.2392578125, "learning_rate": 0.0004944650743517609, "loss": 2.9850168228149414, "step": 4180 }, { "epoch": 0.14451265779126715, "grad_norm": 0.203125, "learning_rate": 0.000494437327955157, "loss": 2.984214019775391, "step": 4190 }, { "epoch": 0.14485755673587639, "grad_norm": 0.24609375, "learning_rate": 0.0004944095130105106, "loss": 2.952581596374512, "step": 4200 }, { "epoch": 0.14485755673587639, "eval_loss": 3.1441195011138916, "eval_runtime": 6.72, "eval_samples_per_second": 48.661, "eval_steps_per_second": 1.637, "step": 4200 }, { "epoch": 0.14520245568048562, "grad_norm": 0.2294921875, "learning_rate": 0.0004943816295260426, "loss": 2.9667022705078123, "step": 4210 }, { "epoch": 0.14554735462509485, "grad_norm": 0.2314453125, "learning_rate": 0.0004943536775099937, "loss": 2.9970605850219725, "step": 4220 }, { "epoch": 0.1458922535697041, "grad_norm": 0.25390625, "learning_rate": 0.0004943256569706251, "loss": 2.9807682037353516, "step": 4230 }, { "epoch": 0.1462371525143133, "grad_norm": 0.2451171875, "learning_rate": 0.0004942975679162182, "loss": 3.0138120651245117, "step": 4240 }, { "epoch": 0.14658205145892253, "grad_norm": 0.263671875, "learning_rate": 0.0004942694103550742, "loss": 2.976573371887207, "step": 4250 }, { "epoch": 0.14692695040353176, "grad_norm": 0.2578125, "learning_rate": 0.0004942411842955153, "loss": 2.9844640731811523, "step": 4260 }, { "epoch": 0.147271849348141, "grad_norm": 0.2197265625, "learning_rate": 0.0004942128897458835, "loss": 2.9822599411010744, "step": 4270 }, { "epoch": 0.14761674829275023, "grad_norm": 0.25390625, "learning_rate": 0.0004941845267145412, "loss": 2.996249961853027, "step": 4280 }, { "epoch": 0.14796164723735947, "grad_norm": 0.2392578125, "learning_rate": 0.0004941560952098707, "loss": 3.0042388916015623, "step": 4290 }, { "epoch": 0.14830654618196867, "grad_norm": 0.2099609375, "learning_rate": 0.0004941275952402752, "loss": 2.9566108703613283, "step": 4300 }, { "epoch": 0.14830654618196867, "eval_loss": 3.1496925354003906, "eval_runtime": 6.7198, "eval_samples_per_second": 48.662, "eval_steps_per_second": 1.637, "step": 4300 }, { "epoch": 0.1486514451265779, "grad_norm": 0.25390625, "learning_rate": 0.0004940990268141773, "loss": 2.979448127746582, "step": 4310 }, { "epoch": 0.14899634407118714, "grad_norm": 0.31640625, "learning_rate": 0.0004940703899400207, "loss": 2.9457590103149416, "step": 4320 }, { "epoch": 0.14934124301579638, "grad_norm": 0.2265625, "learning_rate": 0.0004940416846262686, "loss": 2.98935546875, "step": 4330 }, { "epoch": 0.1496861419604056, "grad_norm": 0.203125, "learning_rate": 0.0004940129108814049, "loss": 3.0102176666259766, "step": 4340 }, { "epoch": 0.15003104090501482, "grad_norm": 0.2392578125, "learning_rate": 0.0004939840687139334, "loss": 2.9817178726196287, "step": 4350 }, { "epoch": 0.15037593984962405, "grad_norm": 0.244140625, "learning_rate": 0.0004939551581323783, "loss": 2.972992706298828, "step": 4360 }, { "epoch": 0.15072083879423329, "grad_norm": 0.212890625, "learning_rate": 0.0004939261791452842, "loss": 2.992824363708496, "step": 4370 }, { "epoch": 0.15106573773884252, "grad_norm": 0.2578125, "learning_rate": 0.0004938971317612155, "loss": 2.992608833312988, "step": 4380 }, { "epoch": 0.15141063668345175, "grad_norm": 0.2470703125, "learning_rate": 0.000493868015988757, "loss": 2.982779312133789, "step": 4390 }, { "epoch": 0.151755535628061, "grad_norm": 0.2197265625, "learning_rate": 0.000493838831836514, "loss": 2.9856546401977537, "step": 4400 }, { "epoch": 0.151755535628061, "eval_loss": 3.153886318206787, "eval_runtime": 6.7252, "eval_samples_per_second": 48.623, "eval_steps_per_second": 1.636, "step": 4400 }, { "epoch": 0.1521004345726702, "grad_norm": 0.2490234375, "learning_rate": 0.0004938095793131115, "loss": 2.9966169357299806, "step": 4410 }, { "epoch": 0.15244533351727943, "grad_norm": 0.2275390625, "learning_rate": 0.0004937802584271949, "loss": 2.9869657516479493, "step": 4420 }, { "epoch": 0.15279023246188866, "grad_norm": 0.2138671875, "learning_rate": 0.0004937508691874301, "loss": 2.972144889831543, "step": 4430 }, { "epoch": 0.1531351314064979, "grad_norm": 0.244140625, "learning_rate": 0.0004937214116025028, "loss": 2.9536251068115233, "step": 4440 }, { "epoch": 0.15348003035110713, "grad_norm": 0.236328125, "learning_rate": 0.000493691885681119, "loss": 2.983636665344238, "step": 4450 }, { "epoch": 0.15382492929571637, "grad_norm": 0.232421875, "learning_rate": 0.0004936622914320052, "loss": 2.9705886840820312, "step": 4460 }, { "epoch": 0.15416982824032557, "grad_norm": 0.2236328125, "learning_rate": 0.0004936326288639076, "loss": 2.9875600814819334, "step": 4470 }, { "epoch": 0.1545147271849348, "grad_norm": 0.234375, "learning_rate": 0.0004936028979855929, "loss": 2.972930145263672, "step": 4480 }, { "epoch": 0.15485962612954404, "grad_norm": 0.232421875, "learning_rate": 0.000493573098805848, "loss": 2.9791515350341795, "step": 4490 }, { "epoch": 0.15520452507415328, "grad_norm": 0.2265625, "learning_rate": 0.00049354323133348, "loss": 3.0023319244384767, "step": 4500 }, { "epoch": 0.15520452507415328, "eval_loss": 3.1520376205444336, "eval_runtime": 6.73, "eval_samples_per_second": 48.589, "eval_steps_per_second": 1.634, "step": 4500 }, { "epoch": 0.1555494240187625, "grad_norm": 0.22265625, "learning_rate": 0.0004935132955773159, "loss": 2.9401525497436523, "step": 4510 }, { "epoch": 0.15589432296337175, "grad_norm": 0.2158203125, "learning_rate": 0.000493483291546203, "loss": 2.9643228530883787, "step": 4520 }, { "epoch": 0.15623922190798095, "grad_norm": 0.2177734375, "learning_rate": 0.0004934532192490092, "loss": 2.958892059326172, "step": 4530 }, { "epoch": 0.1565841208525902, "grad_norm": 0.236328125, "learning_rate": 0.000493423078694622, "loss": 2.983892250061035, "step": 4540 }, { "epoch": 0.15692901979719942, "grad_norm": 0.2333984375, "learning_rate": 0.0004933928698919492, "loss": 2.9624845504760744, "step": 4550 }, { "epoch": 0.15727391874180865, "grad_norm": 0.2333984375, "learning_rate": 0.0004933625928499192, "loss": 2.9689382553100585, "step": 4560 }, { "epoch": 0.1576188176864179, "grad_norm": 0.236328125, "learning_rate": 0.00049333224757748, "loss": 2.9538814544677736, "step": 4570 }, { "epoch": 0.1579637166310271, "grad_norm": 0.224609375, "learning_rate": 0.0004933018340836002, "loss": 2.969583511352539, "step": 4580 }, { "epoch": 0.15830861557563633, "grad_norm": 0.2265625, "learning_rate": 0.000493271352377268, "loss": 2.977361297607422, "step": 4590 }, { "epoch": 0.15865351452024556, "grad_norm": 0.22265625, "learning_rate": 0.0004932408024674926, "loss": 2.9521629333496096, "step": 4600 }, { "epoch": 0.15865351452024556, "eval_loss": 3.150723695755005, "eval_runtime": 6.7238, "eval_samples_per_second": 48.633, "eval_steps_per_second": 1.636, "step": 4600 }, { "epoch": 0.1589984134648548, "grad_norm": 0.2431640625, "learning_rate": 0.0004932101843633026, "loss": 2.9743833541870117, "step": 4610 }, { "epoch": 0.15934331240946403, "grad_norm": 0.26953125, "learning_rate": 0.0004931794980737472, "loss": 2.949156951904297, "step": 4620 }, { "epoch": 0.15968821135407327, "grad_norm": 0.22265625, "learning_rate": 0.0004931487436078954, "loss": 2.957554244995117, "step": 4630 }, { "epoch": 0.16003311029868247, "grad_norm": 0.2294921875, "learning_rate": 0.0004931179209748368, "loss": 2.9589775085449217, "step": 4640 }, { "epoch": 0.1603780092432917, "grad_norm": 0.25390625, "learning_rate": 0.0004930870301836807, "loss": 2.9749269485473633, "step": 4650 }, { "epoch": 0.16072290818790094, "grad_norm": 0.2197265625, "learning_rate": 0.0004930560712435567, "loss": 2.9557363510131838, "step": 4660 }, { "epoch": 0.16106780713251018, "grad_norm": 0.2216796875, "learning_rate": 0.0004930250441636147, "loss": 2.9683906555175783, "step": 4670 }, { "epoch": 0.1614127060771194, "grad_norm": 0.2451171875, "learning_rate": 0.0004929939489530246, "loss": 2.9600408554077147, "step": 4680 }, { "epoch": 0.16175760502172865, "grad_norm": 0.244140625, "learning_rate": 0.0004929627856209765, "loss": 2.970965576171875, "step": 4690 }, { "epoch": 0.16210250396633785, "grad_norm": 0.2265625, "learning_rate": 0.0004929315541766804, "loss": 2.961244010925293, "step": 4700 }, { "epoch": 0.16210250396633785, "eval_loss": 3.1319401264190674, "eval_runtime": 6.7399, "eval_samples_per_second": 48.517, "eval_steps_per_second": 1.632, "step": 4700 }, { "epoch": 0.1624474029109471, "grad_norm": 0.216796875, "learning_rate": 0.0004929002546293667, "loss": 2.9594139099121093, "step": 4710 }, { "epoch": 0.16279230185555632, "grad_norm": 0.228515625, "learning_rate": 0.000492868886988286, "loss": 2.9610084533691405, "step": 4720 }, { "epoch": 0.16313720080016555, "grad_norm": 0.22265625, "learning_rate": 0.0004928374512627087, "loss": 2.985554313659668, "step": 4730 }, { "epoch": 0.1634820997447748, "grad_norm": 0.248046875, "learning_rate": 0.0004928059474619255, "loss": 2.994824981689453, "step": 4740 }, { "epoch": 0.16382699868938402, "grad_norm": 0.275390625, "learning_rate": 0.0004927743755952473, "loss": 2.9625144958496095, "step": 4750 }, { "epoch": 0.16417189763399323, "grad_norm": 0.25, "learning_rate": 0.0004927427356720049, "loss": 2.984906005859375, "step": 4760 }, { "epoch": 0.16451679657860246, "grad_norm": 0.2216796875, "learning_rate": 0.0004927110277015493, "loss": 2.969473457336426, "step": 4770 }, { "epoch": 0.1648616955232117, "grad_norm": 0.208984375, "learning_rate": 0.0004926792516932518, "loss": 2.964279365539551, "step": 4780 }, { "epoch": 0.16520659446782093, "grad_norm": 0.236328125, "learning_rate": 0.0004926474076565037, "loss": 2.9810308456420898, "step": 4790 }, { "epoch": 0.16555149341243017, "grad_norm": 0.23828125, "learning_rate": 0.0004926154956007162, "loss": 2.9619462966918944, "step": 4800 }, { "epoch": 0.16555149341243017, "eval_loss": 3.1518521308898926, "eval_runtime": 6.7386, "eval_samples_per_second": 48.527, "eval_steps_per_second": 1.632, "step": 4800 }, { "epoch": 0.16589639235703937, "grad_norm": 0.25, "learning_rate": 0.0004925835155353208, "loss": 2.9949432373046876, "step": 4810 }, { "epoch": 0.1662412913016486, "grad_norm": 0.2109375, "learning_rate": 0.0004925514674697692, "loss": 2.9820219039916993, "step": 4820 }, { "epoch": 0.16658619024625784, "grad_norm": 0.236328125, "learning_rate": 0.0004925193514135329, "loss": 2.971327209472656, "step": 4830 }, { "epoch": 0.16693108919086708, "grad_norm": 0.2392578125, "learning_rate": 0.0004924871673761038, "loss": 2.954444694519043, "step": 4840 }, { "epoch": 0.1672759881354763, "grad_norm": 0.216796875, "learning_rate": 0.0004924549153669935, "loss": 2.9767589569091797, "step": 4850 }, { "epoch": 0.16762088708008555, "grad_norm": 0.224609375, "learning_rate": 0.0004924225953957342, "loss": 2.9760509490966798, "step": 4860 }, { "epoch": 0.16796578602469475, "grad_norm": 0.255859375, "learning_rate": 0.0004923902074718778, "loss": 2.952646255493164, "step": 4870 }, { "epoch": 0.168310684969304, "grad_norm": 0.228515625, "learning_rate": 0.0004923577516049964, "loss": 2.9636226654052735, "step": 4880 }, { "epoch": 0.16865558391391322, "grad_norm": 0.2275390625, "learning_rate": 0.0004923252278046822, "loss": 2.9538818359375, "step": 4890 }, { "epoch": 0.16900048285852245, "grad_norm": 0.2314453125, "learning_rate": 0.0004922926360805476, "loss": 2.9321662902832033, "step": 4900 }, { "epoch": 0.16900048285852245, "eval_loss": 3.1576976776123047, "eval_runtime": 6.803, "eval_samples_per_second": 48.067, "eval_steps_per_second": 1.617, "step": 4900 }, { "epoch": 0.1693453818031317, "grad_norm": 0.2109375, "learning_rate": 0.0004922599764422247, "loss": 2.94467830657959, "step": 4910 }, { "epoch": 0.16969028074774092, "grad_norm": 0.236328125, "learning_rate": 0.000492227248899366, "loss": 2.9843250274658204, "step": 4920 }, { "epoch": 0.17003517969235013, "grad_norm": 0.263671875, "learning_rate": 0.0004921944534616443, "loss": 2.939727020263672, "step": 4930 }, { "epoch": 0.17038007863695936, "grad_norm": 0.21875, "learning_rate": 0.0004921615901387515, "loss": 2.953375816345215, "step": 4940 }, { "epoch": 0.1707249775815686, "grad_norm": 0.228515625, "learning_rate": 0.0004921286589404007, "loss": 2.9527448654174804, "step": 4950 }, { "epoch": 0.17106987652617783, "grad_norm": 0.2080078125, "learning_rate": 0.0004920956598763245, "loss": 2.9727285385131834, "step": 4960 }, { "epoch": 0.17141477547078707, "grad_norm": 0.2421875, "learning_rate": 0.0004920625929562756, "loss": 2.972251319885254, "step": 4970 }, { "epoch": 0.1717596744153963, "grad_norm": 0.236328125, "learning_rate": 0.0004920294581900266, "loss": 2.9452888488769533, "step": 4980 }, { "epoch": 0.1721045733600055, "grad_norm": 0.2236328125, "learning_rate": 0.0004919962555873705, "loss": 2.9507394790649415, "step": 4990 }, { "epoch": 0.17244947230461474, "grad_norm": 0.26953125, "learning_rate": 0.0004919629851581202, "loss": 2.9617536544799803, "step": 5000 }, { "epoch": 0.17244947230461474, "eval_loss": 3.145920991897583, "eval_runtime": 6.8224, "eval_samples_per_second": 47.93, "eval_steps_per_second": 1.612, "step": 5000 }, { "epoch": 0.17279437124922398, "grad_norm": 0.2041015625, "learning_rate": 0.0004919296469121084, "loss": 2.9821300506591797, "step": 5010 }, { "epoch": 0.1731392701938332, "grad_norm": 0.212890625, "learning_rate": 0.0004918962408591885, "loss": 2.9879783630371093, "step": 5020 }, { "epoch": 0.17348416913844245, "grad_norm": 0.2177734375, "learning_rate": 0.0004918627670092332, "loss": 2.9563671112060548, "step": 5030 }, { "epoch": 0.17382906808305165, "grad_norm": 0.2578125, "learning_rate": 0.0004918292253721355, "loss": 2.949415397644043, "step": 5040 }, { "epoch": 0.1741739670276609, "grad_norm": 0.232421875, "learning_rate": 0.0004917956159578087, "loss": 2.982105255126953, "step": 5050 }, { "epoch": 0.17451886597227012, "grad_norm": 0.26953125, "learning_rate": 0.0004917619387761858, "loss": 2.95444278717041, "step": 5060 }, { "epoch": 0.17486376491687936, "grad_norm": 0.2197265625, "learning_rate": 0.0004917281938372198, "loss": 2.9795372009277346, "step": 5070 }, { "epoch": 0.1752086638614886, "grad_norm": 0.240234375, "learning_rate": 0.0004916943811508842, "loss": 2.9851028442382814, "step": 5080 }, { "epoch": 0.17555356280609782, "grad_norm": 0.2578125, "learning_rate": 0.0004916605007271718, "loss": 2.970852088928223, "step": 5090 }, { "epoch": 0.17589846175070703, "grad_norm": 0.2255859375, "learning_rate": 0.0004916265525760961, "loss": 2.958824348449707, "step": 5100 }, { "epoch": 0.17589846175070703, "eval_loss": 3.1318001747131348, "eval_runtime": 6.8104, "eval_samples_per_second": 48.014, "eval_steps_per_second": 1.615, "step": 5100 }, { "epoch": 0.17624336069531626, "grad_norm": 0.22265625, "learning_rate": 0.0004915925367076903, "loss": 2.916763687133789, "step": 5110 }, { "epoch": 0.1765882596399255, "grad_norm": 0.244140625, "learning_rate": 0.0004915584531320075, "loss": 2.942286491394043, "step": 5120 }, { "epoch": 0.17693315858453473, "grad_norm": 0.216796875, "learning_rate": 0.0004915243018591209, "loss": 2.973043441772461, "step": 5130 }, { "epoch": 0.17727805752914397, "grad_norm": 0.2216796875, "learning_rate": 0.000491490082899124, "loss": 2.979201889038086, "step": 5140 }, { "epoch": 0.1776229564737532, "grad_norm": 0.232421875, "learning_rate": 0.00049145579626213, "loss": 2.9672853469848635, "step": 5150 }, { "epoch": 0.1779678554183624, "grad_norm": 0.236328125, "learning_rate": 0.000491421441958272, "loss": 2.9649829864501953, "step": 5160 }, { "epoch": 0.17831275436297164, "grad_norm": 0.2236328125, "learning_rate": 0.0004913870199977034, "loss": 2.9548431396484376, "step": 5170 }, { "epoch": 0.17865765330758088, "grad_norm": 0.255859375, "learning_rate": 0.0004913525303905973, "loss": 2.9435720443725586, "step": 5180 }, { "epoch": 0.1790025522521901, "grad_norm": 0.236328125, "learning_rate": 0.0004913179731471472, "loss": 2.950910186767578, "step": 5190 }, { "epoch": 0.17934745119679935, "grad_norm": 0.2099609375, "learning_rate": 0.0004912833482775662, "loss": 2.9732566833496095, "step": 5200 }, { "epoch": 0.17934745119679935, "eval_loss": 3.1375985145568848, "eval_runtime": 6.7966, "eval_samples_per_second": 48.112, "eval_steps_per_second": 1.618, "step": 5200 }, { "epoch": 0.17969235014140858, "grad_norm": 0.2275390625, "learning_rate": 0.0004912486557920874, "loss": 2.9639122009277346, "step": 5210 }, { "epoch": 0.1800372490860178, "grad_norm": 0.2392578125, "learning_rate": 0.0004912138957009642, "loss": 2.904903602600098, "step": 5220 }, { "epoch": 0.18038214803062702, "grad_norm": 0.2197265625, "learning_rate": 0.0004911790680144697, "loss": 2.937609100341797, "step": 5230 }, { "epoch": 0.18072704697523626, "grad_norm": 0.21484375, "learning_rate": 0.0004911441727428971, "loss": 2.9472780227661133, "step": 5240 }, { "epoch": 0.1810719459198455, "grad_norm": 0.216796875, "learning_rate": 0.0004911092098965596, "loss": 2.9447872161865236, "step": 5250 }, { "epoch": 0.18141684486445472, "grad_norm": 0.2236328125, "learning_rate": 0.0004910741794857903, "loss": 2.9409147262573243, "step": 5260 }, { "epoch": 0.18176174380906396, "grad_norm": 0.244140625, "learning_rate": 0.0004910390815209421, "loss": 2.9940746307373045, "step": 5270 }, { "epoch": 0.18210664275367316, "grad_norm": 0.2333984375, "learning_rate": 0.0004910039160123882, "loss": 2.9786664962768556, "step": 5280 }, { "epoch": 0.1824515416982824, "grad_norm": 0.2109375, "learning_rate": 0.0004909686829705217, "loss": 2.948029708862305, "step": 5290 }, { "epoch": 0.18279644064289163, "grad_norm": 0.2392578125, "learning_rate": 0.0004909333824057552, "loss": 2.9685604095458986, "step": 5300 }, { "epoch": 0.18279644064289163, "eval_loss": 3.136223077774048, "eval_runtime": 6.8053, "eval_samples_per_second": 48.051, "eval_steps_per_second": 1.616, "step": 5300 }, { "epoch": 0.18314133958750087, "grad_norm": 0.2353515625, "learning_rate": 0.0004908980143285221, "loss": 2.944846343994141, "step": 5310 }, { "epoch": 0.1834862385321101, "grad_norm": 0.240234375, "learning_rate": 0.0004908625787492751, "loss": 2.944388008117676, "step": 5320 }, { "epoch": 0.1838311374767193, "grad_norm": 0.228515625, "learning_rate": 0.0004908270756784868, "loss": 2.961709213256836, "step": 5330 }, { "epoch": 0.18417603642132854, "grad_norm": 0.2216796875, "learning_rate": 0.0004907915051266502, "loss": 2.9545183181762695, "step": 5340 }, { "epoch": 0.18452093536593778, "grad_norm": 0.2216796875, "learning_rate": 0.0004907558671042781, "loss": 2.945513153076172, "step": 5350 }, { "epoch": 0.184865834310547, "grad_norm": 0.2119140625, "learning_rate": 0.0004907201616219029, "loss": 2.9108417510986326, "step": 5360 }, { "epoch": 0.18521073325515625, "grad_norm": 0.244140625, "learning_rate": 0.0004906843886900773, "loss": 2.960129165649414, "step": 5370 }, { "epoch": 0.18555563219976548, "grad_norm": 0.21875, "learning_rate": 0.000490648548319374, "loss": 2.9885751724243166, "step": 5380 }, { "epoch": 0.1859005311443747, "grad_norm": 0.236328125, "learning_rate": 0.0004906126405203853, "loss": 2.950654220581055, "step": 5390 }, { "epoch": 0.18624543008898392, "grad_norm": 0.244140625, "learning_rate": 0.0004905766653037235, "loss": 2.9581636428833007, "step": 5400 }, { "epoch": 0.18624543008898392, "eval_loss": 3.147744655609131, "eval_runtime": 6.8204, "eval_samples_per_second": 47.944, "eval_steps_per_second": 1.613, "step": 5400 }, { "epoch": 0.18659032903359316, "grad_norm": 0.255859375, "learning_rate": 0.0004905406226800212, "loss": 2.948745918273926, "step": 5410 }, { "epoch": 0.1869352279782024, "grad_norm": 0.23828125, "learning_rate": 0.0004905045126599302, "loss": 2.9636159896850587, "step": 5420 }, { "epoch": 0.18728012692281162, "grad_norm": 0.203125, "learning_rate": 0.0004904683352541232, "loss": 2.9364925384521485, "step": 5430 }, { "epoch": 0.18762502586742086, "grad_norm": 0.220703125, "learning_rate": 0.0004904320904732919, "loss": 2.946030044555664, "step": 5440 }, { "epoch": 0.18796992481203006, "grad_norm": 0.236328125, "learning_rate": 0.0004903957783281483, "loss": 2.955285835266113, "step": 5450 }, { "epoch": 0.1883148237566393, "grad_norm": 0.263671875, "learning_rate": 0.0004903593988294245, "loss": 2.968264579772949, "step": 5460 }, { "epoch": 0.18865972270124853, "grad_norm": 0.2265625, "learning_rate": 0.000490322951987872, "loss": 2.933293342590332, "step": 5470 }, { "epoch": 0.18900462164585777, "grad_norm": 0.27734375, "learning_rate": 0.0004902864378142628, "loss": 2.9185680389404296, "step": 5480 }, { "epoch": 0.189349520590467, "grad_norm": 0.220703125, "learning_rate": 0.0004902498563193882, "loss": 2.9825998306274415, "step": 5490 }, { "epoch": 0.18969441953507624, "grad_norm": 0.23828125, "learning_rate": 0.0004902132075140601, "loss": 2.9420900344848633, "step": 5500 }, { "epoch": 0.18969441953507624, "eval_loss": 3.130540370941162, "eval_runtime": 6.813, "eval_samples_per_second": 47.996, "eval_steps_per_second": 1.615, "step": 5500 }, { "epoch": 0.19003931847968544, "grad_norm": 0.2119140625, "learning_rate": 0.0004901764914091095, "loss": 2.940257263183594, "step": 5510 }, { "epoch": 0.19038421742429468, "grad_norm": 0.2060546875, "learning_rate": 0.0004901397080153878, "loss": 2.967739486694336, "step": 5520 }, { "epoch": 0.1907291163689039, "grad_norm": 0.220703125, "learning_rate": 0.0004901028573437663, "loss": 2.9387725830078124, "step": 5530 }, { "epoch": 0.19107401531351315, "grad_norm": 0.2236328125, "learning_rate": 0.0004900659394051359, "loss": 2.9443140029907227, "step": 5540 }, { "epoch": 0.19141891425812238, "grad_norm": 0.2216796875, "learning_rate": 0.0004900289542104075, "loss": 2.941057586669922, "step": 5550 }, { "epoch": 0.1917638132027316, "grad_norm": 0.2421875, "learning_rate": 0.0004899919017705122, "loss": 2.9690261840820313, "step": 5560 }, { "epoch": 0.19210871214734082, "grad_norm": 0.23828125, "learning_rate": 0.0004899547820964004, "loss": 2.933773994445801, "step": 5570 }, { "epoch": 0.19245361109195006, "grad_norm": 0.2333984375, "learning_rate": 0.0004899175951990427, "loss": 2.9384889602661133, "step": 5580 }, { "epoch": 0.1927985100365593, "grad_norm": 0.2412109375, "learning_rate": 0.0004898803410894295, "loss": 2.924280548095703, "step": 5590 }, { "epoch": 0.19314340898116852, "grad_norm": 0.2216796875, "learning_rate": 0.0004898430197785713, "loss": 2.946701240539551, "step": 5600 }, { "epoch": 0.19314340898116852, "eval_loss": 3.126265048980713, "eval_runtime": 6.8128, "eval_samples_per_second": 47.998, "eval_steps_per_second": 1.615, "step": 5600 }, { "epoch": 0.19348830792577776, "grad_norm": 0.234375, "learning_rate": 0.0004898056312774979, "loss": 2.9281982421875, "step": 5610 }, { "epoch": 0.19383320687038696, "grad_norm": 0.216796875, "learning_rate": 0.0004897681755972596, "loss": 2.924086570739746, "step": 5620 }, { "epoch": 0.1941781058149962, "grad_norm": 0.220703125, "learning_rate": 0.0004897306527489262, "loss": 2.937215042114258, "step": 5630 }, { "epoch": 0.19452300475960543, "grad_norm": 0.2353515625, "learning_rate": 0.0004896930627435873, "loss": 2.8927446365356446, "step": 5640 }, { "epoch": 0.19486790370421467, "grad_norm": 0.21875, "learning_rate": 0.0004896554055923525, "loss": 2.9507640838623046, "step": 5650 }, { "epoch": 0.1952128026488239, "grad_norm": 0.255859375, "learning_rate": 0.0004896176813063512, "loss": 2.9396808624267576, "step": 5660 }, { "epoch": 0.19555770159343314, "grad_norm": 0.2470703125, "learning_rate": 0.0004895798898967327, "loss": 2.9674518585205076, "step": 5670 }, { "epoch": 0.19590260053804234, "grad_norm": 0.224609375, "learning_rate": 0.0004895420313746661, "loss": 2.9632637023925783, "step": 5680 }, { "epoch": 0.19624749948265158, "grad_norm": 0.2255859375, "learning_rate": 0.0004895041057513403, "loss": 2.967760467529297, "step": 5690 }, { "epoch": 0.1965923984272608, "grad_norm": 0.216796875, "learning_rate": 0.0004894661130379639, "loss": 2.9013383865356444, "step": 5700 }, { "epoch": 0.1965923984272608, "eval_loss": 3.121634006500244, "eval_runtime": 6.8291, "eval_samples_per_second": 47.884, "eval_steps_per_second": 1.611, "step": 5700 }, { "epoch": 0.19693729737187005, "grad_norm": 0.2109375, "learning_rate": 0.0004894280532457656, "loss": 2.918315124511719, "step": 5710 }, { "epoch": 0.19728219631647928, "grad_norm": 0.232421875, "learning_rate": 0.0004893899263859939, "loss": 2.9516460418701174, "step": 5720 }, { "epoch": 0.19762709526108851, "grad_norm": 0.267578125, "learning_rate": 0.0004893517324699168, "loss": 2.911311912536621, "step": 5730 }, { "epoch": 0.19797199420569772, "grad_norm": 0.21875, "learning_rate": 0.0004893134715088224, "loss": 2.972389030456543, "step": 5740 }, { "epoch": 0.19831689315030696, "grad_norm": 0.2451171875, "learning_rate": 0.0004892751435140189, "loss": 2.9304439544677736, "step": 5750 }, { "epoch": 0.1986617920949162, "grad_norm": 0.212890625, "learning_rate": 0.0004892367484968335, "loss": 2.9385852813720703, "step": 5760 }, { "epoch": 0.19900669103952542, "grad_norm": 0.23046875, "learning_rate": 0.0004891982864686138, "loss": 2.9378582000732423, "step": 5770 }, { "epoch": 0.19935158998413466, "grad_norm": 0.234375, "learning_rate": 0.0004891597574407273, "loss": 2.9304388046264647, "step": 5780 }, { "epoch": 0.19969648892874386, "grad_norm": 0.224609375, "learning_rate": 0.0004891211614245608, "loss": 2.948497009277344, "step": 5790 }, { "epoch": 0.2000413878733531, "grad_norm": 0.23828125, "learning_rate": 0.0004890824984315214, "loss": 2.9190345764160157, "step": 5800 }, { "epoch": 0.2000413878733531, "eval_loss": 3.122713804244995, "eval_runtime": 6.8165, "eval_samples_per_second": 47.972, "eval_steps_per_second": 1.614, "step": 5800 }, { "epoch": 0.20038628681796233, "grad_norm": 0.2412109375, "learning_rate": 0.0004890437684730355, "loss": 2.957596778869629, "step": 5810 }, { "epoch": 0.20073118576257157, "grad_norm": 0.228515625, "learning_rate": 0.0004890049715605499, "loss": 2.9663761138916014, "step": 5820 }, { "epoch": 0.2010760847071808, "grad_norm": 0.25390625, "learning_rate": 0.0004889661077055307, "loss": 2.9496397018432616, "step": 5830 }, { "epoch": 0.20142098365179004, "grad_norm": 0.22265625, "learning_rate": 0.0004889271769194639, "loss": 2.9407833099365233, "step": 5840 }, { "epoch": 0.20176588259639924, "grad_norm": 0.2333984375, "learning_rate": 0.0004888881792138554, "loss": 2.972163963317871, "step": 5850 }, { "epoch": 0.20211078154100848, "grad_norm": 0.23046875, "learning_rate": 0.0004888491146002306, "loss": 2.9447059631347656, "step": 5860 }, { "epoch": 0.2024556804856177, "grad_norm": 0.2255859375, "learning_rate": 0.0004888099830901352, "loss": 2.9304573059082033, "step": 5870 }, { "epoch": 0.20280057943022695, "grad_norm": 0.216796875, "learning_rate": 0.0004887707846951341, "loss": 2.9314733505249024, "step": 5880 }, { "epoch": 0.20314547837483618, "grad_norm": 0.2119140625, "learning_rate": 0.0004887315194268123, "loss": 2.9163957595825196, "step": 5890 }, { "epoch": 0.20349037731944541, "grad_norm": 0.248046875, "learning_rate": 0.0004886921872967745, "loss": 2.9023399353027344, "step": 5900 }, { "epoch": 0.20349037731944541, "eval_loss": 3.111980438232422, "eval_runtime": 6.7925, "eval_samples_per_second": 48.141, "eval_steps_per_second": 1.619, "step": 5900 }, { "epoch": 0.20383527626405462, "grad_norm": 0.2197265625, "learning_rate": 0.000488652788316645, "loss": 2.9696720123291014, "step": 5910 }, { "epoch": 0.20418017520866386, "grad_norm": 0.2373046875, "learning_rate": 0.0004886133224980681, "loss": 2.96008243560791, "step": 5920 }, { "epoch": 0.2045250741532731, "grad_norm": 0.2109375, "learning_rate": 0.0004885737898527078, "loss": 2.9522701263427735, "step": 5930 }, { "epoch": 0.20486997309788232, "grad_norm": 0.2099609375, "learning_rate": 0.0004885341903922476, "loss": 2.9466459274291994, "step": 5940 }, { "epoch": 0.20521487204249156, "grad_norm": 0.240234375, "learning_rate": 0.0004884945241283913, "loss": 2.9266565322875975, "step": 5950 }, { "epoch": 0.2055597709871008, "grad_norm": 0.2109375, "learning_rate": 0.0004884547910728617, "loss": 2.910065269470215, "step": 5960 }, { "epoch": 0.20590466993171, "grad_norm": 0.22265625, "learning_rate": 0.0004884149912374019, "loss": 2.970027542114258, "step": 5970 }, { "epoch": 0.20624956887631923, "grad_norm": 0.21875, "learning_rate": 0.0004883751246337746, "loss": 2.926654815673828, "step": 5980 }, { "epoch": 0.20659446782092847, "grad_norm": 0.21875, "learning_rate": 0.000488335191273762, "loss": 2.9630802154541014, "step": 5990 }, { "epoch": 0.2069393667655377, "grad_norm": 0.2265625, "learning_rate": 0.0004882951911691666, "loss": 2.9407182693481446, "step": 6000 }, { "epoch": 0.2069393667655377, "eval_loss": 3.115058660507202, "eval_runtime": 6.867, "eval_samples_per_second": 47.619, "eval_steps_per_second": 1.602, "step": 6000 }, { "epoch": 0.20728426571014694, "grad_norm": 0.2119140625, "learning_rate": 0.0004882551243318099, "loss": 2.9117368698120116, "step": 6010 }, { "epoch": 0.20762916465475614, "grad_norm": 0.236328125, "learning_rate": 0.0004882149907735336, "loss": 2.944511604309082, "step": 6020 }, { "epoch": 0.20797406359936538, "grad_norm": 0.2392578125, "learning_rate": 0.000488174790506199, "loss": 2.947153663635254, "step": 6030 }, { "epoch": 0.2083189625439746, "grad_norm": 0.25390625, "learning_rate": 0.0004881345235416871, "loss": 2.93719596862793, "step": 6040 }, { "epoch": 0.20866386148858385, "grad_norm": 0.26171875, "learning_rate": 0.00048809418989189865, "loss": 2.9408388137817383, "step": 6050 }, { "epoch": 0.20900876043319308, "grad_norm": 0.2265625, "learning_rate": 0.0004880537895687541, "loss": 2.954499053955078, "step": 6060 }, { "epoch": 0.20935365937780231, "grad_norm": 0.2265625, "learning_rate": 0.00048801332258419344, "loss": 2.9254438400268556, "step": 6070 }, { "epoch": 0.20969855832241152, "grad_norm": 0.234375, "learning_rate": 0.00048797278895017666, "loss": 2.931148338317871, "step": 6080 }, { "epoch": 0.21004345726702076, "grad_norm": 0.255859375, "learning_rate": 0.0004879321886786832, "loss": 2.927779769897461, "step": 6090 }, { "epoch": 0.21038835621163, "grad_norm": 0.240234375, "learning_rate": 0.00048789152178171235, "loss": 2.9477685928344726, "step": 6100 }, { "epoch": 0.21038835621163, "eval_loss": 3.1181752681732178, "eval_runtime": 6.8071, "eval_samples_per_second": 48.038, "eval_steps_per_second": 1.616, "step": 6100 }, { "epoch": 0.21073325515623922, "grad_norm": 0.232421875, "learning_rate": 0.0004878507882712831, "loss": 2.9507234573364256, "step": 6110 }, { "epoch": 0.21107815410084846, "grad_norm": 0.212890625, "learning_rate": 0.0004878099881594339, "loss": 2.9332416534423826, "step": 6120 }, { "epoch": 0.2114230530454577, "grad_norm": 0.234375, "learning_rate": 0.0004877691214582232, "loss": 2.9169775009155274, "step": 6130 }, { "epoch": 0.2117679519900669, "grad_norm": 0.2333984375, "learning_rate": 0.00048772818817972873, "loss": 2.9464527130126954, "step": 6140 }, { "epoch": 0.21211285093467613, "grad_norm": 0.2265625, "learning_rate": 0.00048768718833604836, "loss": 2.94616813659668, "step": 6150 }, { "epoch": 0.21245774987928537, "grad_norm": 0.23828125, "learning_rate": 0.00048764612193929937, "loss": 2.948628044128418, "step": 6160 }, { "epoch": 0.2128026488238946, "grad_norm": 0.224609375, "learning_rate": 0.00048760498900161865, "loss": 2.9061281204223635, "step": 6170 }, { "epoch": 0.21314754776850384, "grad_norm": 0.2333984375, "learning_rate": 0.00048756378953516294, "loss": 2.938188171386719, "step": 6180 }, { "epoch": 0.21349244671311307, "grad_norm": 0.255859375, "learning_rate": 0.00048752252355210857, "loss": 2.9095922470092774, "step": 6190 }, { "epoch": 0.21383734565772228, "grad_norm": 0.23046875, "learning_rate": 0.00048748119106465157, "loss": 2.9191511154174803, "step": 6200 }, { "epoch": 0.21383734565772228, "eval_loss": 3.1247401237487793, "eval_runtime": 6.8096, "eval_samples_per_second": 48.021, "eval_steps_per_second": 1.615, "step": 6200 }, { "epoch": 0.2141822446023315, "grad_norm": 0.255859375, "learning_rate": 0.0004874397920850074, "loss": 2.9448171615600587, "step": 6210 }, { "epoch": 0.21452714354694075, "grad_norm": 0.224609375, "learning_rate": 0.00048739832662541145, "loss": 2.9186744689941406, "step": 6220 }, { "epoch": 0.21487204249154998, "grad_norm": 0.25, "learning_rate": 0.00048735679469811866, "loss": 2.88161563873291, "step": 6230 }, { "epoch": 0.21521694143615921, "grad_norm": 0.2158203125, "learning_rate": 0.00048731519631540354, "loss": 2.919352722167969, "step": 6240 }, { "epoch": 0.21556184038076842, "grad_norm": 0.2119140625, "learning_rate": 0.00048727353148956046, "loss": 2.9212326049804687, "step": 6250 }, { "epoch": 0.21590673932537766, "grad_norm": 0.216796875, "learning_rate": 0.000487231800232903, "loss": 2.921360397338867, "step": 6260 }, { "epoch": 0.2162516382699869, "grad_norm": 0.2314453125, "learning_rate": 0.0004871900025577649, "loss": 2.9270441055297853, "step": 6270 }, { "epoch": 0.21659653721459612, "grad_norm": 0.2451171875, "learning_rate": 0.00048714813847649917, "loss": 2.9321136474609375, "step": 6280 }, { "epoch": 0.21694143615920536, "grad_norm": 0.23046875, "learning_rate": 0.0004871062080014786, "loss": 2.935541534423828, "step": 6290 }, { "epoch": 0.2172863351038146, "grad_norm": 0.2470703125, "learning_rate": 0.0004870642111450956, "loss": 2.914782905578613, "step": 6300 }, { "epoch": 0.2172863351038146, "eval_loss": 3.1243624687194824, "eval_runtime": 6.8131, "eval_samples_per_second": 47.996, "eval_steps_per_second": 1.615, "step": 6300 }, { "epoch": 0.2176312340484238, "grad_norm": 0.2333984375, "learning_rate": 0.000487022147919762, "loss": 2.941673469543457, "step": 6310 }, { "epoch": 0.21797613299303303, "grad_norm": 0.2158203125, "learning_rate": 0.00048698001833790945, "loss": 2.935510444641113, "step": 6320 }, { "epoch": 0.21832103193764227, "grad_norm": 0.2431640625, "learning_rate": 0.00048693782241198926, "loss": 2.9452632904052733, "step": 6330 }, { "epoch": 0.2186659308822515, "grad_norm": 0.2177734375, "learning_rate": 0.0004868955601544721, "loss": 2.9349176406860353, "step": 6340 }, { "epoch": 0.21901082982686074, "grad_norm": 0.2412109375, "learning_rate": 0.0004868532315778485, "loss": 2.9314014434814455, "step": 6350 }, { "epoch": 0.21935572877146997, "grad_norm": 0.2294921875, "learning_rate": 0.00048681083669462847, "loss": 2.923857879638672, "step": 6360 }, { "epoch": 0.21970062771607918, "grad_norm": 0.2197265625, "learning_rate": 0.00048676837551734156, "loss": 2.9235401153564453, "step": 6370 }, { "epoch": 0.2200455266606884, "grad_norm": 0.21875, "learning_rate": 0.00048672584805853705, "loss": 2.9105674743652346, "step": 6380 }, { "epoch": 0.22039042560529765, "grad_norm": 0.2353515625, "learning_rate": 0.00048668325433078377, "loss": 2.9641794204711913, "step": 6390 }, { "epoch": 0.22073532454990688, "grad_norm": 0.25390625, "learning_rate": 0.00048664059434666996, "loss": 2.9338321685791016, "step": 6400 }, { "epoch": 0.22073532454990688, "eval_loss": 3.118654489517212, "eval_runtime": 6.8272, "eval_samples_per_second": 47.897, "eval_steps_per_second": 1.611, "step": 6400 }, { "epoch": 0.22108022349451611, "grad_norm": 0.232421875, "learning_rate": 0.0004865978681188038, "loss": 2.9640241622924806, "step": 6410 }, { "epoch": 0.22142512243912535, "grad_norm": 0.2177734375, "learning_rate": 0.0004865550756598126, "loss": 2.9090980529785155, "step": 6420 }, { "epoch": 0.22177002138373456, "grad_norm": 0.2265625, "learning_rate": 0.00048651221698234364, "loss": 2.939912223815918, "step": 6430 }, { "epoch": 0.2221149203283438, "grad_norm": 0.216796875, "learning_rate": 0.0004864692920990636, "loss": 2.934763526916504, "step": 6440 }, { "epoch": 0.22245981927295302, "grad_norm": 0.3046875, "learning_rate": 0.0004864263010226587, "loss": 2.936397743225098, "step": 6450 }, { "epoch": 0.22280471821756226, "grad_norm": 0.23828125, "learning_rate": 0.00048638324376583484, "loss": 2.9405590057373048, "step": 6460 }, { "epoch": 0.2231496171621715, "grad_norm": 0.2275390625, "learning_rate": 0.00048634012034131724, "loss": 2.8913330078125, "step": 6470 }, { "epoch": 0.2234945161067807, "grad_norm": 0.240234375, "learning_rate": 0.00048629693076185094, "loss": 2.9031755447387697, "step": 6480 }, { "epoch": 0.22383941505138993, "grad_norm": 0.2119140625, "learning_rate": 0.0004862536750402004, "loss": 2.9500730514526365, "step": 6490 }, { "epoch": 0.22418431399599917, "grad_norm": 0.2373046875, "learning_rate": 0.0004862103531891497, "loss": 2.9305023193359374, "step": 6500 }, { "epoch": 0.22418431399599917, "eval_loss": 3.1145131587982178, "eval_runtime": 6.8166, "eval_samples_per_second": 47.971, "eval_steps_per_second": 1.614, "step": 6500 }, { "epoch": 0.2245292129406084, "grad_norm": 0.2392578125, "learning_rate": 0.00048616696522150234, "loss": 2.9475831985473633, "step": 6510 }, { "epoch": 0.22487411188521764, "grad_norm": 0.2099609375, "learning_rate": 0.00048612351115008155, "loss": 2.9322816848754885, "step": 6520 }, { "epoch": 0.22521901082982687, "grad_norm": 0.21484375, "learning_rate": 0.00048607999098772986, "loss": 2.9325334548950197, "step": 6530 }, { "epoch": 0.22556390977443608, "grad_norm": 0.248046875, "learning_rate": 0.0004860364047473096, "loss": 2.9308235168457033, "step": 6540 }, { "epoch": 0.2259088087190453, "grad_norm": 0.216796875, "learning_rate": 0.00048599275244170235, "loss": 2.9516983032226562, "step": 6550 }, { "epoch": 0.22625370766365455, "grad_norm": 0.2216796875, "learning_rate": 0.00048594903408380946, "loss": 2.9532941818237304, "step": 6560 }, { "epoch": 0.22659860660826378, "grad_norm": 0.26171875, "learning_rate": 0.0004859052496865516, "loss": 2.938241386413574, "step": 6570 }, { "epoch": 0.22694350555287301, "grad_norm": 0.232421875, "learning_rate": 0.00048586139926286916, "loss": 2.9100818634033203, "step": 6580 }, { "epoch": 0.22728840449748225, "grad_norm": 0.23046875, "learning_rate": 0.0004858174828257219, "loss": 2.921408462524414, "step": 6590 }, { "epoch": 0.22763330344209146, "grad_norm": 0.216796875, "learning_rate": 0.00048577350038808904, "loss": 2.9440067291259764, "step": 6600 }, { "epoch": 0.22763330344209146, "eval_loss": 3.090876817703247, "eval_runtime": 6.8316, "eval_samples_per_second": 47.866, "eval_steps_per_second": 1.61, "step": 6600 }, { "epoch": 0.2279782023867007, "grad_norm": 0.2353515625, "learning_rate": 0.00048572945196296945, "loss": 2.8909435272216797, "step": 6610 }, { "epoch": 0.22832310133130992, "grad_norm": 0.220703125, "learning_rate": 0.00048568533756338157, "loss": 2.9205949783325194, "step": 6620 }, { "epoch": 0.22866800027591916, "grad_norm": 0.236328125, "learning_rate": 0.0004856411572023631, "loss": 2.9317556381225587, "step": 6630 }, { "epoch": 0.2290128992205284, "grad_norm": 0.228515625, "learning_rate": 0.00048559691089297127, "loss": 2.9168882369995117, "step": 6640 }, { "epoch": 0.22935779816513763, "grad_norm": 0.2451171875, "learning_rate": 0.00048555259864828295, "loss": 2.946694183349609, "step": 6650 }, { "epoch": 0.22970269710974683, "grad_norm": 0.2431640625, "learning_rate": 0.0004855082204813945, "loss": 2.9441465377807616, "step": 6660 }, { "epoch": 0.23004759605435607, "grad_norm": 0.2255859375, "learning_rate": 0.00048546377640542156, "loss": 2.956826400756836, "step": 6670 }, { "epoch": 0.2303924949989653, "grad_norm": 0.236328125, "learning_rate": 0.00048541926643349957, "loss": 2.9312650680541994, "step": 6680 }, { "epoch": 0.23073739394357454, "grad_norm": 0.2255859375, "learning_rate": 0.00048537469057878297, "loss": 2.93796443939209, "step": 6690 }, { "epoch": 0.23108229288818377, "grad_norm": 0.2158203125, "learning_rate": 0.0004853300488544463, "loss": 2.9332632064819335, "step": 6700 }, { "epoch": 0.23108229288818377, "eval_loss": 3.1144378185272217, "eval_runtime": 6.8187, "eval_samples_per_second": 47.956, "eval_steps_per_second": 1.613, "step": 6700 }, { "epoch": 0.23142719183279298, "grad_norm": 0.23828125, "learning_rate": 0.00048528534127368283, "loss": 2.8993963241577148, "step": 6710 }, { "epoch": 0.2317720907774022, "grad_norm": 0.2314453125, "learning_rate": 0.00048524056784970596, "loss": 2.9221208572387694, "step": 6720 }, { "epoch": 0.23211698972201145, "grad_norm": 0.2314453125, "learning_rate": 0.0004851957285957483, "loss": 2.917343330383301, "step": 6730 }, { "epoch": 0.23246188866662068, "grad_norm": 0.267578125, "learning_rate": 0.0004851508235250617, "loss": 2.9634822845458983, "step": 6740 }, { "epoch": 0.23280678761122992, "grad_norm": 0.259765625, "learning_rate": 0.0004851058526509178, "loss": 2.910009002685547, "step": 6750 }, { "epoch": 0.23315168655583915, "grad_norm": 0.2177734375, "learning_rate": 0.0004850608159866075, "loss": 2.9299671173095705, "step": 6760 }, { "epoch": 0.23349658550044836, "grad_norm": 0.2216796875, "learning_rate": 0.0004850157135454411, "loss": 2.9386728286743162, "step": 6770 }, { "epoch": 0.2338414844450576, "grad_norm": 0.224609375, "learning_rate": 0.00048497054534074857, "loss": 2.928000259399414, "step": 6780 }, { "epoch": 0.23418638338966682, "grad_norm": 0.2373046875, "learning_rate": 0.00048492531138587914, "loss": 2.9296024322509764, "step": 6790 }, { "epoch": 0.23453128233427606, "grad_norm": 0.228515625, "learning_rate": 0.0004848800116942014, "loss": 2.9159997940063476, "step": 6800 }, { "epoch": 0.23453128233427606, "eval_loss": 3.1205053329467773, "eval_runtime": 6.8376, "eval_samples_per_second": 47.824, "eval_steps_per_second": 1.609, "step": 6800 }, { "epoch": 0.2348761812788853, "grad_norm": 0.2158203125, "learning_rate": 0.00048483464627910354, "loss": 2.915631103515625, "step": 6810 }, { "epoch": 0.23522108022349453, "grad_norm": 0.2236328125, "learning_rate": 0.00048478921515399316, "loss": 2.921986961364746, "step": 6820 }, { "epoch": 0.23556597916810373, "grad_norm": 0.20703125, "learning_rate": 0.0004847437183322971, "loss": 2.9156558990478514, "step": 6830 }, { "epoch": 0.23591087811271297, "grad_norm": 0.24609375, "learning_rate": 0.0004846981558274619, "loss": 2.9449398040771486, "step": 6840 }, { "epoch": 0.2362557770573222, "grad_norm": 0.23046875, "learning_rate": 0.00048465252765295325, "loss": 2.916766548156738, "step": 6850 }, { "epoch": 0.23660067600193144, "grad_norm": 0.236328125, "learning_rate": 0.0004846068338222564, "loss": 2.9411689758300783, "step": 6860 }, { "epoch": 0.23694557494654067, "grad_norm": 0.2333984375, "learning_rate": 0.00048456107434887585, "loss": 2.9139921188354494, "step": 6870 }, { "epoch": 0.2372904738911499, "grad_norm": 0.240234375, "learning_rate": 0.00048451524924633573, "loss": 2.9304178237915037, "step": 6880 }, { "epoch": 0.2376353728357591, "grad_norm": 0.2265625, "learning_rate": 0.00048446935852817943, "loss": 2.9133159637451174, "step": 6890 }, { "epoch": 0.23798027178036835, "grad_norm": 0.220703125, "learning_rate": 0.00048442340220796967, "loss": 2.8832542419433596, "step": 6900 }, { "epoch": 0.23798027178036835, "eval_loss": 3.121171236038208, "eval_runtime": 6.8337, "eval_samples_per_second": 47.851, "eval_steps_per_second": 1.61, "step": 6900 }, { "epoch": 0.23832517072497758, "grad_norm": 0.228515625, "learning_rate": 0.0004843773802992887, "loss": 2.9310277938842773, "step": 6910 }, { "epoch": 0.23867006966958682, "grad_norm": 0.2177734375, "learning_rate": 0.00048433129281573814, "loss": 2.9636621475219727, "step": 6920 }, { "epoch": 0.23901496861419605, "grad_norm": 0.24609375, "learning_rate": 0.0004842851397709388, "loss": 2.9365089416503904, "step": 6930 }, { "epoch": 0.23935986755880528, "grad_norm": 0.220703125, "learning_rate": 0.00048423892117853114, "loss": 2.94277400970459, "step": 6940 }, { "epoch": 0.2397047665034145, "grad_norm": 0.2265625, "learning_rate": 0.0004841926370521748, "loss": 2.9524927139282227, "step": 6950 }, { "epoch": 0.24004966544802372, "grad_norm": 0.2158203125, "learning_rate": 0.0004841462874055487, "loss": 2.9277170181274412, "step": 6960 }, { "epoch": 0.24039456439263296, "grad_norm": 0.236328125, "learning_rate": 0.00048409987225235166, "loss": 2.962260627746582, "step": 6970 }, { "epoch": 0.2407394633372422, "grad_norm": 0.21484375, "learning_rate": 0.00048405339160630107, "loss": 2.914175033569336, "step": 6980 }, { "epoch": 0.24108436228185143, "grad_norm": 0.205078125, "learning_rate": 0.00048400684548113426, "loss": 2.922310447692871, "step": 6990 }, { "epoch": 0.24142926122646063, "grad_norm": 0.2578125, "learning_rate": 0.00048396023389060775, "loss": 2.9141109466552733, "step": 7000 }, { "epoch": 0.24142926122646063, "eval_loss": 3.116530418395996, "eval_runtime": 6.8526, "eval_samples_per_second": 47.719, "eval_steps_per_second": 1.605, "step": 7000 }, { "epoch": 0.24177416017106987, "grad_norm": 0.224609375, "learning_rate": 0.0004839135568484973, "loss": 2.9708431243896483, "step": 7010 }, { "epoch": 0.2421190591156791, "grad_norm": 0.2265625, "learning_rate": 0.0004838668143685981, "loss": 2.9161773681640626, "step": 7020 }, { "epoch": 0.24246395806028834, "grad_norm": 0.259765625, "learning_rate": 0.00048382000646472485, "loss": 2.923369216918945, "step": 7030 }, { "epoch": 0.24280885700489757, "grad_norm": 0.251953125, "learning_rate": 0.0004837731331507113, "loss": 2.877602958679199, "step": 7040 }, { "epoch": 0.2431537559495068, "grad_norm": 0.248046875, "learning_rate": 0.0004837261944404105, "loss": 2.921415901184082, "step": 7050 }, { "epoch": 0.243498654894116, "grad_norm": 0.2099609375, "learning_rate": 0.0004836791903476953, "loss": 2.9126455307006838, "step": 7060 }, { "epoch": 0.24384355383872525, "grad_norm": 0.267578125, "learning_rate": 0.00048363212088645726, "loss": 2.9458139419555662, "step": 7070 }, { "epoch": 0.24418845278333448, "grad_norm": 0.26953125, "learning_rate": 0.0004835849860706076, "loss": 2.92777042388916, "step": 7080 }, { "epoch": 0.24453335172794372, "grad_norm": 0.208984375, "learning_rate": 0.000483537785914077, "loss": 2.939556884765625, "step": 7090 }, { "epoch": 0.24487825067255295, "grad_norm": 0.236328125, "learning_rate": 0.0004834905204308151, "loss": 2.9306768417358398, "step": 7100 }, { "epoch": 0.24487825067255295, "eval_loss": 3.126533269882202, "eval_runtime": 6.8424, "eval_samples_per_second": 47.79, "eval_steps_per_second": 1.608, "step": 7100 }, { "epoch": 0.24522314961716218, "grad_norm": 0.224609375, "learning_rate": 0.000483443189634791, "loss": 2.911077880859375, "step": 7110 }, { "epoch": 0.2455680485617714, "grad_norm": 0.2265625, "learning_rate": 0.00048339579353999306, "loss": 2.9036911010742186, "step": 7120 }, { "epoch": 0.24591294750638062, "grad_norm": 0.20703125, "learning_rate": 0.00048334833216042913, "loss": 2.957064628601074, "step": 7130 }, { "epoch": 0.24625784645098986, "grad_norm": 0.2138671875, "learning_rate": 0.00048330080551012614, "loss": 2.943134880065918, "step": 7140 }, { "epoch": 0.2466027453955991, "grad_norm": 0.2490234375, "learning_rate": 0.00048325321360313036, "loss": 2.9274309158325194, "step": 7150 }, { "epoch": 0.24694764434020833, "grad_norm": 0.216796875, "learning_rate": 0.00048320555645350736, "loss": 2.9225950241088867, "step": 7160 }, { "epoch": 0.24729254328481756, "grad_norm": 0.23046875, "learning_rate": 0.00048315783407534195, "loss": 2.9422739028930662, "step": 7170 }, { "epoch": 0.24763744222942677, "grad_norm": 0.216796875, "learning_rate": 0.00048311004648273837, "loss": 2.9058792114257814, "step": 7180 }, { "epoch": 0.247982341174036, "grad_norm": 0.2392578125, "learning_rate": 0.0004830621936898201, "loss": 2.9241222381591796, "step": 7190 }, { "epoch": 0.24832724011864524, "grad_norm": 0.212890625, "learning_rate": 0.00048301427571072956, "loss": 2.9027957916259766, "step": 7200 }, { "epoch": 0.24832724011864524, "eval_loss": 3.1183176040649414, "eval_runtime": 6.8372, "eval_samples_per_second": 47.827, "eval_steps_per_second": 1.609, "step": 7200 }, { "epoch": 0.24867213906325447, "grad_norm": 0.2177734375, "learning_rate": 0.0004829662925596289, "loss": 2.898910713195801, "step": 7210 }, { "epoch": 0.2490170380078637, "grad_norm": 0.21484375, "learning_rate": 0.00048291824425069935, "loss": 2.9299800872802733, "step": 7220 }, { "epoch": 0.2493619369524729, "grad_norm": 0.220703125, "learning_rate": 0.00048287013079814124, "loss": 2.9169307708740235, "step": 7230 }, { "epoch": 0.24970683589708215, "grad_norm": 0.2265625, "learning_rate": 0.0004828219522161743, "loss": 2.90466251373291, "step": 7240 }, { "epoch": 0.2500517348416914, "grad_norm": 0.232421875, "learning_rate": 0.0004827737085190376, "loss": 2.9335451126098633, "step": 7250 }, { "epoch": 0.2503966337863006, "grad_norm": 0.2373046875, "learning_rate": 0.0004827253997209892, "loss": 2.9106502532958984, "step": 7260 }, { "epoch": 0.2507415327309098, "grad_norm": 0.2353515625, "learning_rate": 0.0004826770258363067, "loss": 2.9364431381225584, "step": 7270 }, { "epoch": 0.2510864316755191, "grad_norm": 0.2421875, "learning_rate": 0.00048262858687928673, "loss": 2.9522266387939453, "step": 7280 }, { "epoch": 0.2514313306201283, "grad_norm": 0.2158203125, "learning_rate": 0.0004825800828642452, "loss": 2.9148534774780273, "step": 7290 }, { "epoch": 0.25177622956473755, "grad_norm": 0.271484375, "learning_rate": 0.0004825315138055172, "loss": 2.9190120697021484, "step": 7300 }, { "epoch": 0.25177622956473755, "eval_loss": 3.09189510345459, "eval_runtime": 6.8373, "eval_samples_per_second": 47.826, "eval_steps_per_second": 1.609, "step": 7300 }, { "epoch": 0.25212112850934676, "grad_norm": 0.2119140625, "learning_rate": 0.0004824828797174572, "loss": 2.907255172729492, "step": 7310 }, { "epoch": 0.25246602745395597, "grad_norm": 0.2314453125, "learning_rate": 0.0004824341806144387, "loss": 2.9031770706176756, "step": 7320 }, { "epoch": 0.2528109263985652, "grad_norm": 0.2373046875, "learning_rate": 0.00048238541651085456, "loss": 2.894978332519531, "step": 7330 }, { "epoch": 0.25315582534317443, "grad_norm": 0.2119140625, "learning_rate": 0.0004823365874211167, "loss": 2.895108222961426, "step": 7340 }, { "epoch": 0.2535007242877837, "grad_norm": 0.21484375, "learning_rate": 0.0004822876933596566, "loss": 2.904713249206543, "step": 7350 }, { "epoch": 0.2538456232323929, "grad_norm": 0.2177734375, "learning_rate": 0.00048223873434092435, "loss": 2.9330770492553713, "step": 7360 }, { "epoch": 0.25419052217700217, "grad_norm": 0.25, "learning_rate": 0.00048218971037938975, "loss": 2.909575843811035, "step": 7370 }, { "epoch": 0.25453542112161137, "grad_norm": 0.22265625, "learning_rate": 0.00048214062148954157, "loss": 2.9293270111083984, "step": 7380 }, { "epoch": 0.2548803200662206, "grad_norm": 0.2333984375, "learning_rate": 0.0004820914676858879, "loss": 2.934307670593262, "step": 7390 }, { "epoch": 0.25522521901082984, "grad_norm": 0.2275390625, "learning_rate": 0.00048204224898295574, "loss": 2.9084339141845703, "step": 7400 }, { "epoch": 0.25522521901082984, "eval_loss": 3.1125600337982178, "eval_runtime": 6.8026, "eval_samples_per_second": 48.07, "eval_steps_per_second": 1.617, "step": 7400 }, { "epoch": 0.25557011795543905, "grad_norm": 0.224609375, "learning_rate": 0.0004819929653952916, "loss": 2.9171512603759764, "step": 7410 }, { "epoch": 0.2559150169000483, "grad_norm": 0.232421875, "learning_rate": 0.000481943616937461, "loss": 2.9008132934570314, "step": 7420 }, { "epoch": 0.2562599158446575, "grad_norm": 0.24609375, "learning_rate": 0.0004818942036240487, "loss": 2.924310874938965, "step": 7430 }, { "epoch": 0.2566048147892667, "grad_norm": 0.240234375, "learning_rate": 0.00048184472546965846, "loss": 2.8931264877319336, "step": 7440 }, { "epoch": 0.256949713733876, "grad_norm": 0.240234375, "learning_rate": 0.00048179518248891333, "loss": 2.9353042602539063, "step": 7450 }, { "epoch": 0.2572946126784852, "grad_norm": 0.228515625, "learning_rate": 0.0004817455746964557, "loss": 2.9459924697875977, "step": 7460 }, { "epoch": 0.25763951162309445, "grad_norm": 0.21484375, "learning_rate": 0.00048169590210694684, "loss": 2.9280765533447264, "step": 7470 }, { "epoch": 0.25798441056770366, "grad_norm": 0.240234375, "learning_rate": 0.0004816461647350672, "loss": 2.931351661682129, "step": 7480 }, { "epoch": 0.25832930951231287, "grad_norm": 0.232421875, "learning_rate": 0.0004815963625955164, "loss": 2.8771490097045898, "step": 7490 }, { "epoch": 0.25867420845692213, "grad_norm": 0.2236328125, "learning_rate": 0.0004815464957030134, "loss": 2.897832489013672, "step": 7500 }, { "epoch": 0.25867420845692213, "eval_loss": 3.104717969894409, "eval_runtime": 6.8403, "eval_samples_per_second": 47.805, "eval_steps_per_second": 1.608, "step": 7500 }, { "epoch": 0.25901910740153133, "grad_norm": 0.2021484375, "learning_rate": 0.0004814965640722961, "loss": 2.9176025390625, "step": 7510 }, { "epoch": 0.2593640063461406, "grad_norm": 0.2236328125, "learning_rate": 0.00048144656771812144, "loss": 2.918319892883301, "step": 7520 }, { "epoch": 0.2597089052907498, "grad_norm": 0.2373046875, "learning_rate": 0.00048139650665526574, "loss": 2.891171455383301, "step": 7530 }, { "epoch": 0.26005380423535907, "grad_norm": 0.244140625, "learning_rate": 0.00048134638089852426, "loss": 2.8993497848510743, "step": 7540 }, { "epoch": 0.26039870317996827, "grad_norm": 0.232421875, "learning_rate": 0.00048129619046271156, "loss": 2.8940078735351564, "step": 7550 }, { "epoch": 0.2607436021245775, "grad_norm": 0.236328125, "learning_rate": 0.000481245935362661, "loss": 2.9011760711669923, "step": 7560 }, { "epoch": 0.26108850106918674, "grad_norm": 0.2216796875, "learning_rate": 0.0004811956156132255, "loss": 2.9280242919921875, "step": 7570 }, { "epoch": 0.26143340001379595, "grad_norm": 0.24609375, "learning_rate": 0.00048114523122927665, "loss": 2.9348657608032225, "step": 7580 }, { "epoch": 0.2617782989584052, "grad_norm": 0.2275390625, "learning_rate": 0.0004810947822257053, "loss": 2.877024269104004, "step": 7590 }, { "epoch": 0.2621231979030144, "grad_norm": 0.201171875, "learning_rate": 0.00048104426861742157, "loss": 2.9315607070922853, "step": 7600 }, { "epoch": 0.2621231979030144, "eval_loss": 3.1030023097991943, "eval_runtime": 6.8297, "eval_samples_per_second": 47.879, "eval_steps_per_second": 1.611, "step": 7600 }, { "epoch": 0.2624680968476236, "grad_norm": 0.224609375, "learning_rate": 0.0004809936904193545, "loss": 2.88507194519043, "step": 7610 }, { "epoch": 0.2628129957922329, "grad_norm": 0.2294921875, "learning_rate": 0.0004809430476464521, "loss": 2.9259174346923826, "step": 7620 }, { "epoch": 0.2631578947368421, "grad_norm": 0.23828125, "learning_rate": 0.0004808923403136819, "loss": 2.8806646347045897, "step": 7630 }, { "epoch": 0.26350279368145135, "grad_norm": 0.2431640625, "learning_rate": 0.00048084156843602994, "loss": 2.9029253005981444, "step": 7640 }, { "epoch": 0.26384769262606056, "grad_norm": 0.2734375, "learning_rate": 0.0004807907320285018, "loss": 2.8839141845703127, "step": 7650 }, { "epoch": 0.2641925915706698, "grad_norm": 0.216796875, "learning_rate": 0.0004807398311061219, "loss": 2.89400634765625, "step": 7660 }, { "epoch": 0.26453749051527903, "grad_norm": 0.2333984375, "learning_rate": 0.0004806888656839338, "loss": 2.890558624267578, "step": 7670 }, { "epoch": 0.26488238945988823, "grad_norm": 0.2216796875, "learning_rate": 0.00048063783577700003, "loss": 2.9174373626708983, "step": 7680 }, { "epoch": 0.2652272884044975, "grad_norm": 0.2177734375, "learning_rate": 0.0004805867414004023, "loss": 2.8800275802612303, "step": 7690 }, { "epoch": 0.2655721873491067, "grad_norm": 0.25, "learning_rate": 0.0004805355825692414, "loss": 2.900164031982422, "step": 7700 }, { "epoch": 0.2655721873491067, "eval_loss": 3.0969250202178955, "eval_runtime": 6.8276, "eval_samples_per_second": 47.894, "eval_steps_per_second": 1.611, "step": 7700 }, { "epoch": 0.26591708629371597, "grad_norm": 0.28125, "learning_rate": 0.00048048435929863695, "loss": 2.921148109436035, "step": 7710 }, { "epoch": 0.26626198523832517, "grad_norm": 0.2158203125, "learning_rate": 0.0004804330716037278, "loss": 2.8917718887329102, "step": 7720 }, { "epoch": 0.2666068841829344, "grad_norm": 0.208984375, "learning_rate": 0.0004803817194996719, "loss": 2.890752983093262, "step": 7730 }, { "epoch": 0.26695178312754364, "grad_norm": 0.2236328125, "learning_rate": 0.000480330303001646, "loss": 2.9210477828979493, "step": 7740 }, { "epoch": 0.26729668207215285, "grad_norm": 0.2255859375, "learning_rate": 0.00048027882212484617, "loss": 2.882546043395996, "step": 7750 }, { "epoch": 0.2676415810167621, "grad_norm": 0.224609375, "learning_rate": 0.0004802272768844873, "loss": 2.9026378631591796, "step": 7760 }, { "epoch": 0.2679864799613713, "grad_norm": 0.27734375, "learning_rate": 0.00048017566729580314, "loss": 2.891184616088867, "step": 7770 }, { "epoch": 0.2683313789059805, "grad_norm": 0.25390625, "learning_rate": 0.000480123993374047, "loss": 2.9190244674682617, "step": 7780 }, { "epoch": 0.2686762778505898, "grad_norm": 0.2099609375, "learning_rate": 0.0004800722551344907, "loss": 2.9181575775146484, "step": 7790 }, { "epoch": 0.269021176795199, "grad_norm": 0.2080078125, "learning_rate": 0.0004800204525924253, "loss": 2.9071882247924803, "step": 7800 }, { "epoch": 0.269021176795199, "eval_loss": 3.1101934909820557, "eval_runtime": 6.9299, "eval_samples_per_second": 47.187, "eval_steps_per_second": 1.587, "step": 7800 }, { "epoch": 0.26936607573980825, "grad_norm": 0.2470703125, "learning_rate": 0.0004799685857631608, "loss": 2.920227813720703, "step": 7810 }, { "epoch": 0.26971097468441746, "grad_norm": 0.2255859375, "learning_rate": 0.0004799166546620261, "loss": 2.9081161499023436, "step": 7820 }, { "epoch": 0.2700558736290267, "grad_norm": 0.2490234375, "learning_rate": 0.0004798646593043694, "loss": 2.9441673278808596, "step": 7830 }, { "epoch": 0.27040077257363593, "grad_norm": 0.20703125, "learning_rate": 0.0004798125997055576, "loss": 2.8898330688476563, "step": 7840 }, { "epoch": 0.27074567151824513, "grad_norm": 0.205078125, "learning_rate": 0.0004797604758809765, "loss": 2.919536590576172, "step": 7850 }, { "epoch": 0.2710905704628544, "grad_norm": 0.224609375, "learning_rate": 0.0004797082878460315, "loss": 2.9212438583374025, "step": 7860 }, { "epoch": 0.2714354694074636, "grad_norm": 0.236328125, "learning_rate": 0.0004796560356161461, "loss": 2.9245223999023438, "step": 7870 }, { "epoch": 0.27178036835207287, "grad_norm": 0.2373046875, "learning_rate": 0.00047960371920676353, "loss": 2.868524932861328, "step": 7880 }, { "epoch": 0.27212526729668207, "grad_norm": 0.236328125, "learning_rate": 0.0004795513386333455, "loss": 2.9088613510131838, "step": 7890 }, { "epoch": 0.2724701662412913, "grad_norm": 0.216796875, "learning_rate": 0.00047949889391137284, "loss": 2.884700965881348, "step": 7900 }, { "epoch": 0.2724701662412913, "eval_loss": 3.1060330867767334, "eval_runtime": 6.8273, "eval_samples_per_second": 47.896, "eval_steps_per_second": 1.611, "step": 7900 }, { "epoch": 0.27281506518590054, "grad_norm": 0.2451171875, "learning_rate": 0.0004794463850563454, "loss": 2.9303298950195313, "step": 7910 }, { "epoch": 0.27315996413050975, "grad_norm": 0.23828125, "learning_rate": 0.00047939381208378205, "loss": 2.8783666610717775, "step": 7920 }, { "epoch": 0.273504863075119, "grad_norm": 0.2353515625, "learning_rate": 0.0004793411750092203, "loss": 2.8956361770629884, "step": 7930 }, { "epoch": 0.2738497620197282, "grad_norm": 0.22265625, "learning_rate": 0.000479288473848217, "loss": 2.8841411590576174, "step": 7940 }, { "epoch": 0.2741946609643374, "grad_norm": 0.21484375, "learning_rate": 0.00047923570861634757, "loss": 2.925836753845215, "step": 7950 }, { "epoch": 0.2745395599089467, "grad_norm": 0.2177734375, "learning_rate": 0.00047918287932920654, "loss": 2.887011909484863, "step": 7960 }, { "epoch": 0.2748844588535559, "grad_norm": 0.2255859375, "learning_rate": 0.0004791299860024076, "loss": 2.8862180709838867, "step": 7970 }, { "epoch": 0.27522935779816515, "grad_norm": 0.2138671875, "learning_rate": 0.00047907702865158285, "loss": 2.888905715942383, "step": 7980 }, { "epoch": 0.27557425674277436, "grad_norm": 0.2255859375, "learning_rate": 0.00047902400729238375, "loss": 2.9060813903808596, "step": 7990 }, { "epoch": 0.2759191556873836, "grad_norm": 0.208984375, "learning_rate": 0.0004789709219404805, "loss": 2.8980886459350588, "step": 8000 }, { "epoch": 0.2759191556873836, "eval_loss": 3.1027467250823975, "eval_runtime": 6.8446, "eval_samples_per_second": 47.775, "eval_steps_per_second": 1.607, "step": 8000 }, { "epoch": 0.27626405463199283, "grad_norm": 0.228515625, "learning_rate": 0.0004789177726115622, "loss": 2.9022424697875975, "step": 8010 }, { "epoch": 0.27660895357660203, "grad_norm": 0.21875, "learning_rate": 0.00047886455932133704, "loss": 2.9184452056884767, "step": 8020 }, { "epoch": 0.2769538525212113, "grad_norm": 0.2080078125, "learning_rate": 0.0004788112820855318, "loss": 2.9035671234130858, "step": 8030 }, { "epoch": 0.2772987514658205, "grad_norm": 0.228515625, "learning_rate": 0.0004787579409198924, "loss": 2.9065969467163084, "step": 8040 }, { "epoch": 0.27764365041042977, "grad_norm": 0.2158203125, "learning_rate": 0.0004787045358401836, "loss": 2.9058074951171875, "step": 8050 }, { "epoch": 0.27798854935503897, "grad_norm": 0.2412109375, "learning_rate": 0.000478651066862189, "loss": 2.9324623107910157, "step": 8060 }, { "epoch": 0.2783334482996482, "grad_norm": 0.251953125, "learning_rate": 0.0004785975340017111, "loss": 2.915102005004883, "step": 8070 }, { "epoch": 0.27867834724425744, "grad_norm": 0.259765625, "learning_rate": 0.0004785439372745714, "loss": 2.8882448196411135, "step": 8080 }, { "epoch": 0.27902324618886665, "grad_norm": 0.2158203125, "learning_rate": 0.0004784902766966101, "loss": 2.909399223327637, "step": 8090 }, { "epoch": 0.2793681451334759, "grad_norm": 0.2216796875, "learning_rate": 0.0004784365522836863, "loss": 2.9289169311523438, "step": 8100 }, { "epoch": 0.2793681451334759, "eval_loss": 3.0956976413726807, "eval_runtime": 6.849, "eval_samples_per_second": 47.744, "eval_steps_per_second": 1.606, "step": 8100 }, { "epoch": 0.2797130440780851, "grad_norm": 0.248046875, "learning_rate": 0.00047838276405167806, "loss": 2.8941259384155273, "step": 8110 }, { "epoch": 0.2800579430226944, "grad_norm": 0.234375, "learning_rate": 0.0004783289120164822, "loss": 2.8998798370361327, "step": 8120 }, { "epoch": 0.2804028419673036, "grad_norm": 0.240234375, "learning_rate": 0.00047827499619401454, "loss": 2.905199432373047, "step": 8130 }, { "epoch": 0.2807477409119128, "grad_norm": 0.22265625, "learning_rate": 0.0004782210166002096, "loss": 2.9012819290161134, "step": 8140 }, { "epoch": 0.28109263985652205, "grad_norm": 0.2412109375, "learning_rate": 0.0004781669732510209, "loss": 2.8945152282714846, "step": 8150 }, { "epoch": 0.28143753880113126, "grad_norm": 0.228515625, "learning_rate": 0.0004781128661624206, "loss": 2.8935155868530273, "step": 8160 }, { "epoch": 0.2817824377457405, "grad_norm": 0.220703125, "learning_rate": 0.00047805869535039983, "loss": 2.911442756652832, "step": 8170 }, { "epoch": 0.28212733669034973, "grad_norm": 0.2109375, "learning_rate": 0.00047800446083096846, "loss": 2.887200355529785, "step": 8180 }, { "epoch": 0.28247223563495893, "grad_norm": 0.2373046875, "learning_rate": 0.00047795016262015545, "loss": 2.9261764526367187, "step": 8190 }, { "epoch": 0.2828171345795682, "grad_norm": 0.22265625, "learning_rate": 0.0004778958007340083, "loss": 2.9135900497436524, "step": 8200 }, { "epoch": 0.2828171345795682, "eval_loss": 3.097870349884033, "eval_runtime": 6.84, "eval_samples_per_second": 47.807, "eval_steps_per_second": 1.608, "step": 8200 }, { "epoch": 0.2831620335241774, "grad_norm": 0.2265625, "learning_rate": 0.00047784137518859336, "loss": 2.9153194427490234, "step": 8210 }, { "epoch": 0.28350693246878667, "grad_norm": 0.232421875, "learning_rate": 0.000477786885999996, "loss": 2.9038772583007812, "step": 8220 }, { "epoch": 0.28385183141339587, "grad_norm": 0.244140625, "learning_rate": 0.00047773233318432006, "loss": 2.8880935668945313, "step": 8230 }, { "epoch": 0.2841967303580051, "grad_norm": 0.224609375, "learning_rate": 0.00047767771675768855, "loss": 2.8845342636108398, "step": 8240 }, { "epoch": 0.28454162930261434, "grad_norm": 0.244140625, "learning_rate": 0.000477623036736243, "loss": 2.9379093170166017, "step": 8250 }, { "epoch": 0.28488652824722355, "grad_norm": 0.216796875, "learning_rate": 0.00047756829313614404, "loss": 2.8892704010009767, "step": 8260 }, { "epoch": 0.2852314271918328, "grad_norm": 0.232421875, "learning_rate": 0.00047751348597357057, "loss": 2.898004341125488, "step": 8270 }, { "epoch": 0.285576326136442, "grad_norm": 0.224609375, "learning_rate": 0.0004774586152647209, "loss": 2.9427114486694337, "step": 8280 }, { "epoch": 0.2859212250810513, "grad_norm": 0.224609375, "learning_rate": 0.00047740368102581164, "loss": 2.923950958251953, "step": 8290 }, { "epoch": 0.2862661240256605, "grad_norm": 0.259765625, "learning_rate": 0.0004773486832730785, "loss": 2.898242378234863, "step": 8300 }, { "epoch": 0.2862661240256605, "eval_loss": 3.0847926139831543, "eval_runtime": 6.9364, "eval_samples_per_second": 47.143, "eval_steps_per_second": 1.586, "step": 8300 }, { "epoch": 0.2866110229702697, "grad_norm": 0.228515625, "learning_rate": 0.00047729362202277573, "loss": 2.9224609375, "step": 8310 }, { "epoch": 0.28695592191487895, "grad_norm": 0.228515625, "learning_rate": 0.0004772384972911764, "loss": 2.9071815490722654, "step": 8320 }, { "epoch": 0.28730082085948816, "grad_norm": 0.2109375, "learning_rate": 0.0004771833090945725, "loss": 2.9216276168823243, "step": 8330 }, { "epoch": 0.2876457198040974, "grad_norm": 0.220703125, "learning_rate": 0.0004771280574492745, "loss": 2.9011404037475588, "step": 8340 }, { "epoch": 0.28799061874870663, "grad_norm": 0.2197265625, "learning_rate": 0.0004770727423716119, "loss": 2.9012659072875975, "step": 8350 }, { "epoch": 0.28833551769331583, "grad_norm": 0.244140625, "learning_rate": 0.0004770173638779329, "loss": 2.899481773376465, "step": 8360 }, { "epoch": 0.2886804166379251, "grad_norm": 0.2236328125, "learning_rate": 0.00047696192198460404, "loss": 2.8808507919311523, "step": 8370 }, { "epoch": 0.2890253155825343, "grad_norm": 0.2314453125, "learning_rate": 0.00047690641670801134, "loss": 2.9292137145996096, "step": 8380 }, { "epoch": 0.28937021452714357, "grad_norm": 0.2236328125, "learning_rate": 0.00047685084806455886, "loss": 2.891880989074707, "step": 8390 }, { "epoch": 0.28971511347175277, "grad_norm": 0.2216796875, "learning_rate": 0.00047679521607066973, "loss": 2.932229995727539, "step": 8400 }, { "epoch": 0.28971511347175277, "eval_loss": 3.08143949508667, "eval_runtime": 6.8365, "eval_samples_per_second": 47.831, "eval_steps_per_second": 1.609, "step": 8400 }, { "epoch": 0.290060012416362, "grad_norm": 0.22265625, "learning_rate": 0.00047673952074278576, "loss": 2.896831512451172, "step": 8410 }, { "epoch": 0.29040491136097124, "grad_norm": 0.224609375, "learning_rate": 0.0004766837620973674, "loss": 2.9042150497436525, "step": 8420 }, { "epoch": 0.29074981030558045, "grad_norm": 0.2392578125, "learning_rate": 0.000476627940150894, "loss": 2.896987533569336, "step": 8430 }, { "epoch": 0.2910947092501897, "grad_norm": 0.2353515625, "learning_rate": 0.0004765720549198634, "loss": 2.901259994506836, "step": 8440 }, { "epoch": 0.2914396081947989, "grad_norm": 0.216796875, "learning_rate": 0.00047651610642079217, "loss": 2.9245439529418946, "step": 8450 }, { "epoch": 0.2917845071394082, "grad_norm": 0.2236328125, "learning_rate": 0.00047646009467021573, "loss": 2.9156162261962892, "step": 8460 }, { "epoch": 0.2921294060840174, "grad_norm": 0.2099609375, "learning_rate": 0.0004764040196846881, "loss": 2.9000455856323244, "step": 8470 }, { "epoch": 0.2924743050286266, "grad_norm": 0.26171875, "learning_rate": 0.0004763478814807819, "loss": 2.891794967651367, "step": 8480 }, { "epoch": 0.29281920397323585, "grad_norm": 0.2265625, "learning_rate": 0.0004762916800750887, "loss": 2.906112289428711, "step": 8490 }, { "epoch": 0.29316410291784506, "grad_norm": 0.19921875, "learning_rate": 0.00047623541548421836, "loss": 2.914089584350586, "step": 8500 }, { "epoch": 0.29316410291784506, "eval_loss": 3.0853705406188965, "eval_runtime": 6.8412, "eval_samples_per_second": 47.799, "eval_steps_per_second": 1.608, "step": 8500 }, { "epoch": 0.2935090018624543, "grad_norm": 0.2099609375, "learning_rate": 0.0004761790877247997, "loss": 2.913014602661133, "step": 8510 }, { "epoch": 0.29385390080706353, "grad_norm": 0.236328125, "learning_rate": 0.00047612269681348034, "loss": 2.9043367385864256, "step": 8520 }, { "epoch": 0.29419879975167273, "grad_norm": 0.21875, "learning_rate": 0.00047606624276692606, "loss": 2.8908466339111327, "step": 8530 }, { "epoch": 0.294543698696282, "grad_norm": 0.2421875, "learning_rate": 0.0004760097256018218, "loss": 2.899244689941406, "step": 8540 }, { "epoch": 0.2948885976408912, "grad_norm": 0.2255859375, "learning_rate": 0.0004759531453348709, "loss": 2.8998796463012697, "step": 8550 }, { "epoch": 0.29523349658550047, "grad_norm": 0.2265625, "learning_rate": 0.00047589650198279535, "loss": 2.9302436828613283, "step": 8560 }, { "epoch": 0.29557839553010967, "grad_norm": 0.2333984375, "learning_rate": 0.00047583979556233593, "loss": 2.8846467971801757, "step": 8570 }, { "epoch": 0.29592329447471893, "grad_norm": 0.212890625, "learning_rate": 0.0004757830260902519, "loss": 2.9151865005493165, "step": 8580 }, { "epoch": 0.29626819341932814, "grad_norm": 0.2265625, "learning_rate": 0.0004757261935833212, "loss": 2.953875923156738, "step": 8590 }, { "epoch": 0.29661309236393735, "grad_norm": 0.2138671875, "learning_rate": 0.0004756692980583406, "loss": 2.9121395111083985, "step": 8600 }, { "epoch": 0.29661309236393735, "eval_loss": 3.0825328826904297, "eval_runtime": 6.8313, "eval_samples_per_second": 47.868, "eval_steps_per_second": 1.61, "step": 8600 }, { "epoch": 0.2969579913085466, "grad_norm": 0.2451171875, "learning_rate": 0.0004756123395321251, "loss": 2.9110280990600588, "step": 8610 }, { "epoch": 0.2973028902531558, "grad_norm": 0.234375, "learning_rate": 0.00047555531802150866, "loss": 2.8566871643066407, "step": 8620 }, { "epoch": 0.2976477891977651, "grad_norm": 0.2236328125, "learning_rate": 0.0004754982335433437, "loss": 2.878468132019043, "step": 8630 }, { "epoch": 0.2979926881423743, "grad_norm": 0.2119140625, "learning_rate": 0.0004754410861145013, "loss": 2.9155420303344726, "step": 8640 }, { "epoch": 0.2983375870869835, "grad_norm": 0.22265625, "learning_rate": 0.00047538387575187115, "loss": 2.9016794204711913, "step": 8650 }, { "epoch": 0.29868248603159275, "grad_norm": 0.248046875, "learning_rate": 0.0004753266024723614, "loss": 2.9032976150512697, "step": 8660 }, { "epoch": 0.29902738497620196, "grad_norm": 0.2451171875, "learning_rate": 0.0004752692662928991, "loss": 2.8761463165283203, "step": 8670 }, { "epoch": 0.2993722839208112, "grad_norm": 0.21875, "learning_rate": 0.0004752118672304295, "loss": 2.8870811462402344, "step": 8680 }, { "epoch": 0.29971718286542043, "grad_norm": 0.2333984375, "learning_rate": 0.0004751544053019168, "loss": 2.891538619995117, "step": 8690 }, { "epoch": 0.30006208181002963, "grad_norm": 0.22265625, "learning_rate": 0.00047509688052434354, "loss": 2.8946979522705076, "step": 8700 }, { "epoch": 0.30006208181002963, "eval_loss": 3.0811736583709717, "eval_runtime": 6.8493, "eval_samples_per_second": 47.742, "eval_steps_per_second": 1.606, "step": 8700 }, { "epoch": 0.3004069807546389, "grad_norm": 0.228515625, "learning_rate": 0.0004750392929147109, "loss": 2.876332473754883, "step": 8710 }, { "epoch": 0.3007518796992481, "grad_norm": 0.22265625, "learning_rate": 0.00047498164249003863, "loss": 2.8564647674560546, "step": 8720 }, { "epoch": 0.30109677864385737, "grad_norm": 0.2294921875, "learning_rate": 0.0004749239292673652, "loss": 2.893986129760742, "step": 8730 }, { "epoch": 0.30144167758846657, "grad_norm": 0.220703125, "learning_rate": 0.0004748661532637473, "loss": 2.878702926635742, "step": 8740 }, { "epoch": 0.30178657653307583, "grad_norm": 0.2236328125, "learning_rate": 0.00047480831449626037, "loss": 2.860252571105957, "step": 8750 }, { "epoch": 0.30213147547768504, "grad_norm": 0.26953125, "learning_rate": 0.0004747504129819986, "loss": 2.8820051193237304, "step": 8760 }, { "epoch": 0.30247637442229425, "grad_norm": 0.2255859375, "learning_rate": 0.0004746924487380744, "loss": 2.881456184387207, "step": 8770 }, { "epoch": 0.3028212733669035, "grad_norm": 0.23828125, "learning_rate": 0.00047463442178161884, "loss": 2.893559455871582, "step": 8780 }, { "epoch": 0.3031661723115127, "grad_norm": 0.220703125, "learning_rate": 0.00047457633212978157, "loss": 2.918229675292969, "step": 8790 }, { "epoch": 0.303511071256122, "grad_norm": 0.2294921875, "learning_rate": 0.0004745181797997306, "loss": 2.884060096740723, "step": 8800 }, { "epoch": 0.303511071256122, "eval_loss": 3.0883822441101074, "eval_runtime": 6.84, "eval_samples_per_second": 47.807, "eval_steps_per_second": 1.608, "step": 8800 }, { "epoch": 0.3038559702007312, "grad_norm": 0.212890625, "learning_rate": 0.0004744599648086528, "loss": 2.899524688720703, "step": 8810 }, { "epoch": 0.3042008691453404, "grad_norm": 0.2333984375, "learning_rate": 0.0004744016871737532, "loss": 2.9101129531860352, "step": 8820 }, { "epoch": 0.30454576808994965, "grad_norm": 0.22265625, "learning_rate": 0.0004743433469122555, "loss": 2.8809268951416014, "step": 8830 }, { "epoch": 0.30489066703455886, "grad_norm": 0.21875, "learning_rate": 0.00047428494404140196, "loss": 2.9337669372558595, "step": 8840 }, { "epoch": 0.3052355659791681, "grad_norm": 0.2197265625, "learning_rate": 0.0004742264785784533, "loss": 2.88265438079834, "step": 8850 }, { "epoch": 0.30558046492377733, "grad_norm": 0.2451171875, "learning_rate": 0.00047416795054068875, "loss": 2.892649459838867, "step": 8860 }, { "epoch": 0.30592536386838654, "grad_norm": 0.2109375, "learning_rate": 0.0004741093599454058, "loss": 2.914415168762207, "step": 8870 }, { "epoch": 0.3062702628129958, "grad_norm": 0.23828125, "learning_rate": 0.00047405070680992087, "loss": 2.884738540649414, "step": 8880 }, { "epoch": 0.306615161757605, "grad_norm": 0.2109375, "learning_rate": 0.00047399199115156853, "loss": 2.8966169357299805, "step": 8890 }, { "epoch": 0.30696006070221427, "grad_norm": 0.2412109375, "learning_rate": 0.00047393321298770197, "loss": 2.9124738693237306, "step": 8900 }, { "epoch": 0.30696006070221427, "eval_loss": 3.09952449798584, "eval_runtime": 6.9427, "eval_samples_per_second": 47.1, "eval_steps_per_second": 1.584, "step": 8900 }, { "epoch": 0.3073049596468235, "grad_norm": 0.23828125, "learning_rate": 0.0004738743723356929, "loss": 2.883900260925293, "step": 8910 }, { "epoch": 0.30764985859143273, "grad_norm": 0.2392578125, "learning_rate": 0.00047381546921293114, "loss": 2.9006317138671873, "step": 8920 }, { "epoch": 0.30799475753604194, "grad_norm": 0.263671875, "learning_rate": 0.0004737565036368255, "loss": 2.8863780975341795, "step": 8930 }, { "epoch": 0.30833965648065115, "grad_norm": 0.21875, "learning_rate": 0.0004736974756248029, "loss": 2.88758544921875, "step": 8940 }, { "epoch": 0.3086845554252604, "grad_norm": 0.24609375, "learning_rate": 0.00047363838519430887, "loss": 2.882228660583496, "step": 8950 }, { "epoch": 0.3090294543698696, "grad_norm": 0.232421875, "learning_rate": 0.0004735792323628071, "loss": 2.890774726867676, "step": 8960 }, { "epoch": 0.3093743533144789, "grad_norm": 0.2265625, "learning_rate": 0.00047352001714778027, "loss": 2.884100341796875, "step": 8970 }, { "epoch": 0.3097192522590881, "grad_norm": 0.22265625, "learning_rate": 0.00047346073956672897, "loss": 2.893174743652344, "step": 8980 }, { "epoch": 0.3100641512036973, "grad_norm": 0.2197265625, "learning_rate": 0.0004734013996371725, "loss": 2.9126157760620117, "step": 8990 }, { "epoch": 0.31040905014830655, "grad_norm": 0.205078125, "learning_rate": 0.00047334199737664845, "loss": 2.9093223571777345, "step": 9000 }, { "epoch": 0.31040905014830655, "eval_loss": 3.086381435394287, "eval_runtime": 6.8327, "eval_samples_per_second": 47.858, "eval_steps_per_second": 1.61, "step": 9000 }, { "epoch": 0.31075394909291576, "grad_norm": 0.232421875, "learning_rate": 0.000473282532802713, "loss": 2.891655921936035, "step": 9010 }, { "epoch": 0.311098848037525, "grad_norm": 0.263671875, "learning_rate": 0.0004732230059329405, "loss": 2.8674449920654297, "step": 9020 }, { "epoch": 0.31144374698213423, "grad_norm": 0.2255859375, "learning_rate": 0.00047316341678492387, "loss": 2.8836734771728514, "step": 9030 }, { "epoch": 0.3117886459267435, "grad_norm": 0.2177734375, "learning_rate": 0.0004731037653762745, "loss": 2.891972541809082, "step": 9040 }, { "epoch": 0.3121335448713527, "grad_norm": 0.228515625, "learning_rate": 0.00047304405172462214, "loss": 2.900237464904785, "step": 9050 }, { "epoch": 0.3124784438159619, "grad_norm": 0.2177734375, "learning_rate": 0.00047298427584761474, "loss": 2.923178482055664, "step": 9060 }, { "epoch": 0.31282334276057117, "grad_norm": 0.2177734375, "learning_rate": 0.00047292443776291885, "loss": 2.8529937744140623, "step": 9070 }, { "epoch": 0.3131682417051804, "grad_norm": 0.220703125, "learning_rate": 0.0004728645374882194, "loss": 2.892356109619141, "step": 9080 }, { "epoch": 0.31351314064978963, "grad_norm": 0.232421875, "learning_rate": 0.00047280457504121957, "loss": 2.8949756622314453, "step": 9090 }, { "epoch": 0.31385803959439884, "grad_norm": 0.2255859375, "learning_rate": 0.0004727445504396411, "loss": 2.9034751892089843, "step": 9100 }, { "epoch": 0.31385803959439884, "eval_loss": 3.0865285396575928, "eval_runtime": 6.8406, "eval_samples_per_second": 47.803, "eval_steps_per_second": 1.608, "step": 9100 }, { "epoch": 0.31420293853900805, "grad_norm": 0.2177734375, "learning_rate": 0.00047268446370122387, "loss": 2.8904367446899415, "step": 9110 }, { "epoch": 0.3145478374836173, "grad_norm": 0.25, "learning_rate": 0.0004726243148437264, "loss": 2.8654937744140625, "step": 9120 }, { "epoch": 0.3148927364282265, "grad_norm": 0.2470703125, "learning_rate": 0.0004725641038849252, "loss": 2.8933300018310546, "step": 9130 }, { "epoch": 0.3152376353728358, "grad_norm": 0.232421875, "learning_rate": 0.00047250383084261556, "loss": 2.868818664550781, "step": 9140 }, { "epoch": 0.315582534317445, "grad_norm": 0.23046875, "learning_rate": 0.0004724434957346108, "loss": 2.863626480102539, "step": 9150 }, { "epoch": 0.3159274332620542, "grad_norm": 0.21484375, "learning_rate": 0.0004723830985787427, "loss": 2.873278999328613, "step": 9160 }, { "epoch": 0.31627233220666345, "grad_norm": 0.2197265625, "learning_rate": 0.0004723226393928615, "loss": 2.8583749771118163, "step": 9170 }, { "epoch": 0.31661723115127266, "grad_norm": 0.255859375, "learning_rate": 0.0004722621181948354, "loss": 2.8726430892944337, "step": 9180 }, { "epoch": 0.3169621300958819, "grad_norm": 0.232421875, "learning_rate": 0.0004722015350025513, "loss": 2.8634578704833986, "step": 9190 }, { "epoch": 0.31730702904049113, "grad_norm": 0.2421875, "learning_rate": 0.00047214088983391436, "loss": 2.9009580612182617, "step": 9200 }, { "epoch": 0.31730702904049113, "eval_loss": 3.0831668376922607, "eval_runtime": 6.842, "eval_samples_per_second": 47.793, "eval_steps_per_second": 1.608, "step": 9200 }, { "epoch": 0.3176519279851004, "grad_norm": 0.228515625, "learning_rate": 0.0004720801827068479, "loss": 2.8945308685302735, "step": 9210 }, { "epoch": 0.3179968269297096, "grad_norm": 0.212890625, "learning_rate": 0.0004720194136392936, "loss": 2.8950809478759765, "step": 9220 }, { "epoch": 0.3183417258743188, "grad_norm": 0.2138671875, "learning_rate": 0.0004719585826492116, "loss": 2.8906280517578127, "step": 9230 }, { "epoch": 0.31868662481892807, "grad_norm": 0.216796875, "learning_rate": 0.0004718976897545802, "loss": 2.882951545715332, "step": 9240 }, { "epoch": 0.3190315237635373, "grad_norm": 0.2275390625, "learning_rate": 0.00047183673497339595, "loss": 2.8714506149291994, "step": 9250 }, { "epoch": 0.31937642270814653, "grad_norm": 0.212890625, "learning_rate": 0.00047177571832367383, "loss": 2.9083600997924806, "step": 9260 }, { "epoch": 0.31972132165275574, "grad_norm": 0.2353515625, "learning_rate": 0.000471714639823447, "loss": 2.8847978591918944, "step": 9270 }, { "epoch": 0.32006622059736495, "grad_norm": 0.224609375, "learning_rate": 0.000471653499490767, "loss": 2.8744651794433596, "step": 9280 }, { "epoch": 0.3204111195419742, "grad_norm": 0.255859375, "learning_rate": 0.00047159229734370354, "loss": 2.8778450012207033, "step": 9290 }, { "epoch": 0.3207560184865834, "grad_norm": 0.21875, "learning_rate": 0.0004715310334003446, "loss": 2.876936149597168, "step": 9300 }, { "epoch": 0.3207560184865834, "eval_loss": 3.0836637020111084, "eval_runtime": 6.8451, "eval_samples_per_second": 47.772, "eval_steps_per_second": 1.607, "step": 9300 }, { "epoch": 0.3211009174311927, "grad_norm": 0.2265625, "learning_rate": 0.00047146970767879655, "loss": 2.889265441894531, "step": 9310 }, { "epoch": 0.3214458163758019, "grad_norm": 0.2294921875, "learning_rate": 0.0004714083201971839, "loss": 2.8701702117919923, "step": 9320 }, { "epoch": 0.32179071532041115, "grad_norm": 0.228515625, "learning_rate": 0.0004713468709736494, "loss": 2.8872251510620117, "step": 9330 }, { "epoch": 0.32213561426502035, "grad_norm": 0.267578125, "learning_rate": 0.0004712853600263541, "loss": 2.915439224243164, "step": 9340 }, { "epoch": 0.32248051320962956, "grad_norm": 0.234375, "learning_rate": 0.0004712237873734774, "loss": 2.890000343322754, "step": 9350 }, { "epoch": 0.3228254121542388, "grad_norm": 0.236328125, "learning_rate": 0.00047116215303321665, "loss": 2.9059385299682616, "step": 9360 }, { "epoch": 0.32317031109884803, "grad_norm": 0.24609375, "learning_rate": 0.00047110045702378775, "loss": 2.8583507537841797, "step": 9370 }, { "epoch": 0.3235152100434573, "grad_norm": 0.24609375, "learning_rate": 0.0004710386993634246, "loss": 2.895582389831543, "step": 9380 }, { "epoch": 0.3238601089880665, "grad_norm": 0.2138671875, "learning_rate": 0.00047097688007037943, "loss": 2.8871803283691406, "step": 9390 }, { "epoch": 0.3242050079326757, "grad_norm": 0.22265625, "learning_rate": 0.00047091499916292277, "loss": 2.873086929321289, "step": 9400 }, { "epoch": 0.3242050079326757, "eval_loss": 3.0859570503234863, "eval_runtime": 6.8444, "eval_samples_per_second": 47.776, "eval_steps_per_second": 1.607, "step": 9400 }, { "epoch": 0.32454990687728497, "grad_norm": 0.2373046875, "learning_rate": 0.00047085305665934293, "loss": 2.8721101760864256, "step": 9410 }, { "epoch": 0.3248948058218942, "grad_norm": 0.2255859375, "learning_rate": 0.000470791052577947, "loss": 2.8789905548095702, "step": 9420 }, { "epoch": 0.32523970476650343, "grad_norm": 0.2197265625, "learning_rate": 0.00047072898693706003, "loss": 2.8888473510742188, "step": 9430 }, { "epoch": 0.32558460371111264, "grad_norm": 0.2333984375, "learning_rate": 0.0004706668597550251, "loss": 2.8772443771362304, "step": 9440 }, { "epoch": 0.32592950265572185, "grad_norm": 0.25, "learning_rate": 0.00047060467105020364, "loss": 2.874882698059082, "step": 9450 }, { "epoch": 0.3262744016003311, "grad_norm": 0.216796875, "learning_rate": 0.00047054242084097536, "loss": 2.907251739501953, "step": 9460 }, { "epoch": 0.3266193005449403, "grad_norm": 0.2373046875, "learning_rate": 0.000470480109145738, "loss": 2.8861087799072265, "step": 9470 }, { "epoch": 0.3269641994895496, "grad_norm": 0.2392578125, "learning_rate": 0.0004704177359829073, "loss": 2.89605712890625, "step": 9480 }, { "epoch": 0.3273090984341588, "grad_norm": 0.2236328125, "learning_rate": 0.00047035530137091763, "loss": 2.8671310424804686, "step": 9490 }, { "epoch": 0.32765399737876805, "grad_norm": 0.228515625, "learning_rate": 0.00047029280532822124, "loss": 2.8878786087036135, "step": 9500 }, { "epoch": 0.32765399737876805, "eval_loss": 3.0768001079559326, "eval_runtime": 6.8365, "eval_samples_per_second": 47.832, "eval_steps_per_second": 1.609, "step": 9500 }, { "epoch": 0.32799889632337725, "grad_norm": 0.2177734375, "learning_rate": 0.00047023024787328833, "loss": 2.897165870666504, "step": 9510 }, { "epoch": 0.32834379526798646, "grad_norm": 0.2392578125, "learning_rate": 0.0004701676290246077, "loss": 2.896839714050293, "step": 9520 }, { "epoch": 0.3286886942125957, "grad_norm": 0.2236328125, "learning_rate": 0.000470104948800686, "loss": 2.8711565017700194, "step": 9530 }, { "epoch": 0.32903359315720493, "grad_norm": 0.25390625, "learning_rate": 0.0004700422072200481, "loss": 2.887459564208984, "step": 9540 }, { "epoch": 0.3293784921018142, "grad_norm": 0.2236328125, "learning_rate": 0.0004699794043012369, "loss": 2.8840200424194338, "step": 9550 }, { "epoch": 0.3297233910464234, "grad_norm": 0.25, "learning_rate": 0.0004699165400628137, "loss": 2.8814922332763673, "step": 9560 }, { "epoch": 0.3300682899910326, "grad_norm": 0.2275390625, "learning_rate": 0.00046985361452335755, "loss": 2.9127830505371093, "step": 9570 }, { "epoch": 0.33041318893564187, "grad_norm": 0.251953125, "learning_rate": 0.00046979062770146604, "loss": 2.8633771896362306, "step": 9580 }, { "epoch": 0.3307580878802511, "grad_norm": 0.2265625, "learning_rate": 0.00046972757961575445, "loss": 2.899677848815918, "step": 9590 }, { "epoch": 0.33110298682486033, "grad_norm": 0.25390625, "learning_rate": 0.00046966447028485637, "loss": 2.8629825592041014, "step": 9600 }, { "epoch": 0.33110298682486033, "eval_loss": 3.079789400100708, "eval_runtime": 6.8222, "eval_samples_per_second": 47.932, "eval_steps_per_second": 1.612, "step": 9600 }, { "epoch": 0.33144788576946954, "grad_norm": 0.224609375, "learning_rate": 0.0004696012997274236, "loss": 2.8848873138427735, "step": 9610 }, { "epoch": 0.33179278471407875, "grad_norm": 0.216796875, "learning_rate": 0.0004695380679621258, "loss": 2.8816598892211913, "step": 9620 }, { "epoch": 0.332137683658688, "grad_norm": 0.2255859375, "learning_rate": 0.000469474775007651, "loss": 2.8526987075805663, "step": 9630 }, { "epoch": 0.3324825826032972, "grad_norm": 0.25, "learning_rate": 0.00046941142088270497, "loss": 2.9084049224853517, "step": 9640 }, { "epoch": 0.3328274815479065, "grad_norm": 0.224609375, "learning_rate": 0.00046934800560601177, "loss": 2.8614824295043944, "step": 9650 }, { "epoch": 0.3331723804925157, "grad_norm": 0.275390625, "learning_rate": 0.0004692845291963136, "loss": 2.921006774902344, "step": 9660 }, { "epoch": 0.33351727943712495, "grad_norm": 0.21484375, "learning_rate": 0.00046922099167237053, "loss": 2.856806755065918, "step": 9670 }, { "epoch": 0.33386217838173415, "grad_norm": 0.2216796875, "learning_rate": 0.0004691573930529609, "loss": 2.8948123931884764, "step": 9680 }, { "epoch": 0.33420707732634336, "grad_norm": 0.2236328125, "learning_rate": 0.0004690937333568809, "loss": 2.8706531524658203, "step": 9690 }, { "epoch": 0.3345519762709526, "grad_norm": 0.2392578125, "learning_rate": 0.0004690300126029449, "loss": 2.88925838470459, "step": 9700 }, { "epoch": 0.3345519762709526, "eval_loss": 3.0771496295928955, "eval_runtime": 6.8444, "eval_samples_per_second": 47.776, "eval_steps_per_second": 1.607, "step": 9700 }, { "epoch": 0.33489687521556183, "grad_norm": 0.2490234375, "learning_rate": 0.00046896623080998524, "loss": 2.8900306701660154, "step": 9710 }, { "epoch": 0.3352417741601711, "grad_norm": 0.265625, "learning_rate": 0.0004689023879968524, "loss": 2.872745323181152, "step": 9720 }, { "epoch": 0.3355866731047803, "grad_norm": 0.2265625, "learning_rate": 0.0004688384841824148, "loss": 2.909883499145508, "step": 9730 }, { "epoch": 0.3359315720493895, "grad_norm": 0.2138671875, "learning_rate": 0.00046877451938555906, "loss": 2.8921176910400392, "step": 9740 }, { "epoch": 0.33627647099399877, "grad_norm": 0.2060546875, "learning_rate": 0.0004687104936251895, "loss": 2.901247024536133, "step": 9750 }, { "epoch": 0.336621369938608, "grad_norm": 0.2490234375, "learning_rate": 0.0004686464069202287, "loss": 2.8688276290893553, "step": 9760 }, { "epoch": 0.33696626888321723, "grad_norm": 0.23828125, "learning_rate": 0.00046858225928961733, "loss": 2.874532699584961, "step": 9770 }, { "epoch": 0.33731116782782644, "grad_norm": 0.2265625, "learning_rate": 0.00046851805075231377, "loss": 2.871516799926758, "step": 9780 }, { "epoch": 0.3376560667724357, "grad_norm": 0.2265625, "learning_rate": 0.00046845378132729466, "loss": 2.8817909240722654, "step": 9790 }, { "epoch": 0.3380009657170449, "grad_norm": 0.212890625, "learning_rate": 0.0004683894510335545, "loss": 2.911819267272949, "step": 9800 }, { "epoch": 0.3380009657170449, "eval_loss": 3.0750601291656494, "eval_runtime": 6.8376, "eval_samples_per_second": 47.824, "eval_steps_per_second": 1.609, "step": 9800 }, { "epoch": 0.3383458646616541, "grad_norm": 0.2255859375, "learning_rate": 0.00046832505989010585, "loss": 2.889698600769043, "step": 9810 }, { "epoch": 0.3386907636062634, "grad_norm": 0.2275390625, "learning_rate": 0.00046826060791597924, "loss": 2.872812843322754, "step": 9820 }, { "epoch": 0.3390356625508726, "grad_norm": 0.21875, "learning_rate": 0.0004681960951302231, "loss": 2.880837821960449, "step": 9830 }, { "epoch": 0.33938056149548185, "grad_norm": 0.2412109375, "learning_rate": 0.0004681315215519039, "loss": 2.8398786544799806, "step": 9840 }, { "epoch": 0.33972546044009105, "grad_norm": 0.205078125, "learning_rate": 0.00046806688720010613, "loss": 2.899904251098633, "step": 9850 }, { "epoch": 0.34007035938470026, "grad_norm": 0.220703125, "learning_rate": 0.0004680021920939322, "loss": 2.90311222076416, "step": 9860 }, { "epoch": 0.3404152583293095, "grad_norm": 0.2353515625, "learning_rate": 0.0004679374362525024, "loss": 2.8610860824584963, "step": 9870 }, { "epoch": 0.34076015727391873, "grad_norm": 0.216796875, "learning_rate": 0.00046787261969495505, "loss": 2.8810659408569337, "step": 9880 }, { "epoch": 0.341105056218528, "grad_norm": 0.2197265625, "learning_rate": 0.0004678077424404464, "loss": 2.8866769790649416, "step": 9890 }, { "epoch": 0.3414499551631372, "grad_norm": 0.2255859375, "learning_rate": 0.0004677428045081506, "loss": 2.8884346008300783, "step": 9900 }, { "epoch": 0.3414499551631372, "eval_loss": 3.075286865234375, "eval_runtime": 6.8522, "eval_samples_per_second": 47.722, "eval_steps_per_second": 1.605, "step": 9900 }, { "epoch": 0.3417948541077464, "grad_norm": 0.2353515625, "learning_rate": 0.0004676778059172598, "loss": 2.873636245727539, "step": 9910 }, { "epoch": 0.34213975305235567, "grad_norm": 0.208984375, "learning_rate": 0.000467612746686984, "loss": 2.892445755004883, "step": 9920 }, { "epoch": 0.3424846519969649, "grad_norm": 0.228515625, "learning_rate": 0.00046754762683655127, "loss": 2.8829296112060545, "step": 9930 }, { "epoch": 0.34282955094157413, "grad_norm": 0.216796875, "learning_rate": 0.0004674824463852074, "loss": 2.8889898300170898, "step": 9940 }, { "epoch": 0.34317444988618334, "grad_norm": 0.2041015625, "learning_rate": 0.00046741720535221616, "loss": 2.8747501373291016, "step": 9950 }, { "epoch": 0.3435193488307926, "grad_norm": 0.26171875, "learning_rate": 0.00046735190375685935, "loss": 2.8482076644897463, "step": 9960 }, { "epoch": 0.3438642477754018, "grad_norm": 0.234375, "learning_rate": 0.00046728654161843643, "loss": 2.8706937789916993, "step": 9970 }, { "epoch": 0.344209146720011, "grad_norm": 0.26171875, "learning_rate": 0.00046722111895626506, "loss": 2.8873790740966796, "step": 9980 }, { "epoch": 0.3445540456646203, "grad_norm": 0.26171875, "learning_rate": 0.00046715563578968053, "loss": 2.866537666320801, "step": 9990 }, { "epoch": 0.3448989446092295, "grad_norm": 0.234375, "learning_rate": 0.000467090092138036, "loss": 2.8902517318725587, "step": 10000 }, { "epoch": 0.3448989446092295, "eval_loss": 3.0738189220428467, "eval_runtime": 6.8486, "eval_samples_per_second": 47.747, "eval_steps_per_second": 1.606, "step": 10000 }, { "epoch": 0.34524384355383875, "grad_norm": 0.228515625, "learning_rate": 0.0004670244880207027, "loss": 2.9031728744506835, "step": 10010 }, { "epoch": 0.34558874249844795, "grad_norm": 0.22265625, "learning_rate": 0.00046695882345706963, "loss": 2.8672115325927736, "step": 10020 }, { "epoch": 0.34593364144305716, "grad_norm": 0.232421875, "learning_rate": 0.00046689309846654364, "loss": 2.8815147399902346, "step": 10030 }, { "epoch": 0.3462785403876664, "grad_norm": 0.2265625, "learning_rate": 0.0004668273130685495, "loss": 2.8637039184570314, "step": 10040 }, { "epoch": 0.34662343933227563, "grad_norm": 0.28125, "learning_rate": 0.0004667614672825298, "loss": 2.8640941619873046, "step": 10050 }, { "epoch": 0.3469683382768849, "grad_norm": 0.2353515625, "learning_rate": 0.0004666955611279449, "loss": 2.855289077758789, "step": 10060 }, { "epoch": 0.3473132372214941, "grad_norm": 0.21484375, "learning_rate": 0.0004666295946242731, "loss": 2.8919794082641603, "step": 10070 }, { "epoch": 0.3476581361661033, "grad_norm": 0.201171875, "learning_rate": 0.00046656356779101047, "loss": 2.8786876678466795, "step": 10080 }, { "epoch": 0.34800303511071257, "grad_norm": 0.25390625, "learning_rate": 0.000466497480647671, "loss": 2.878182601928711, "step": 10090 }, { "epoch": 0.3483479340553218, "grad_norm": 0.2333984375, "learning_rate": 0.00046643133321378643, "loss": 2.876922035217285, "step": 10100 }, { "epoch": 0.3483479340553218, "eval_loss": 3.0728087425231934, "eval_runtime": 6.8468, "eval_samples_per_second": 47.76, "eval_steps_per_second": 1.607, "step": 10100 }, { "epoch": 0.34869283299993103, "grad_norm": 0.2353515625, "learning_rate": 0.0004663651255089064, "loss": 2.8738582611083983, "step": 10110 }, { "epoch": 0.34903773194454024, "grad_norm": 0.2236328125, "learning_rate": 0.00046629885755259813, "loss": 2.8597055435180665, "step": 10120 }, { "epoch": 0.3493826308891495, "grad_norm": 0.2373046875, "learning_rate": 0.000466232529364447, "loss": 2.86612548828125, "step": 10130 }, { "epoch": 0.3497275298337587, "grad_norm": 0.2353515625, "learning_rate": 0.0004661661409640559, "loss": 2.857718086242676, "step": 10140 }, { "epoch": 0.3500724287783679, "grad_norm": 0.2275390625, "learning_rate": 0.00046609969237104573, "loss": 2.860115623474121, "step": 10150 } ], "logging_steps": 10, "max_steps": 57988, "num_input_tokens_seen": 0, "num_train_epochs": 2, "save_steps": 50, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 9.810306083258892e+18, "train_batch_size": 32, "trial_name": null, "trial_params": null }