{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.3906892183314476, "eval_steps": 100, "global_step": 10100, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 7.736345350456444e-05, "grad_norm": 8.75, "learning_rate": 0.0, "loss": 10.56122875213623, "step": 1 }, { "epoch": 0.0007736345350456444, "grad_norm": 6.9375, "learning_rate": 2.2499999999999998e-05, "loss": 10.371153089735243, "step": 10 }, { "epoch": 0.0015472690700912889, "grad_norm": 1.65625, "learning_rate": 4.75e-05, "loss": 9.225128936767579, "step": 20 }, { "epoch": 0.002320903605136933, "grad_norm": 1.2421875, "learning_rate": 7.25e-05, "loss": 8.501903533935547, "step": 30 }, { "epoch": 0.0030945381401825778, "grad_norm": 0.8984375, "learning_rate": 9.750000000000001e-05, "loss": 7.907857513427734, "step": 40 }, { "epoch": 0.0038681726752282223, "grad_norm": 0.65234375, "learning_rate": 0.0001225, "loss": 7.374447631835937, "step": 50 }, { "epoch": 0.004641807210273866, "grad_norm": 1.703125, "learning_rate": 0.0001475, "loss": 7.100068664550781, "step": 60 }, { "epoch": 0.005415441745319511, "grad_norm": 0.80859375, "learning_rate": 0.0001725, "loss": 6.936636352539063, "step": 70 }, { "epoch": 0.0061890762803651555, "grad_norm": 0.6484375, "learning_rate": 0.0001975, "loss": 6.7047271728515625, "step": 80 }, { "epoch": 0.0069627108154108, "grad_norm": 0.72265625, "learning_rate": 0.00022250000000000001, "loss": 6.5551597595214846, "step": 90 }, { "epoch": 0.007736345350456445, "grad_norm": 0.8984375, "learning_rate": 0.0002475, "loss": 6.410359191894531, "step": 100 }, { "epoch": 0.007736345350456445, "eval_loss": 6.641254425048828, "eval_runtime": 8.5584, "eval_samples_per_second": 38.208, "eval_steps_per_second": 1.285, "step": 100 }, { "epoch": 0.00850997988550209, "grad_norm": 0.83984375, "learning_rate": 0.0002725, "loss": 6.291374969482422, "step": 110 }, { "epoch": 0.009283614420547733, "grad_norm": 1.40625, "learning_rate": 0.00029749999999999997, "loss": 6.181984710693359, "step": 120 }, { "epoch": 0.010057248955593378, "grad_norm": 0.67578125, "learning_rate": 0.00032250000000000003, "loss": 6.108818435668946, "step": 130 }, { "epoch": 0.010830883490639022, "grad_norm": 1.109375, "learning_rate": 0.0003475, "loss": 6.005937576293945, "step": 140 }, { "epoch": 0.011604518025684667, "grad_norm": 0.73046875, "learning_rate": 0.0003725, "loss": 5.927522277832031, "step": 150 }, { "epoch": 0.012378152560730311, "grad_norm": 1.015625, "learning_rate": 0.0003975, "loss": 5.850825500488281, "step": 160 }, { "epoch": 0.013151787095775955, "grad_norm": 1.296875, "learning_rate": 0.00042249999999999997, "loss": 5.774515533447266, "step": 170 }, { "epoch": 0.0139254216308216, "grad_norm": 0.7890625, "learning_rate": 0.00044750000000000004, "loss": 5.700082015991211, "step": 180 }, { "epoch": 0.014699056165867244, "grad_norm": 1.0546875, "learning_rate": 0.0004725, "loss": 5.627538681030273, "step": 190 }, { "epoch": 0.01547269070091289, "grad_norm": 0.859375, "learning_rate": 0.0004975, "loss": 5.560461044311523, "step": 200 }, { "epoch": 0.01547269070091289, "eval_loss": 6.039037227630615, "eval_runtime": 8.5816, "eval_samples_per_second": 38.105, "eval_steps_per_second": 1.282, "step": 200 }, { "epoch": 0.016246325235958533, "grad_norm": 1.375, "learning_rate": 0.000499999413815452, "loss": 5.472032928466797, "step": 210 }, { "epoch": 0.01701995977100418, "grad_norm": 0.95703125, "learning_rate": 0.000499997387502211, "loss": 5.414741897583008, "step": 220 }, { "epoch": 0.017793594306049824, "grad_norm": 0.8359375, "learning_rate": 0.0004999939138357763, "loss": 5.374539947509765, "step": 230 }, { "epoch": 0.018567228841095466, "grad_norm": 0.482421875, "learning_rate": 0.0004999889928373172, "loss": 5.2854866027832035, "step": 240 }, { "epoch": 0.01934086337614111, "grad_norm": 0.97265625, "learning_rate": 0.0004999826245368231, "loss": 5.209839630126953, "step": 250 }, { "epoch": 0.020114497911186757, "grad_norm": 0.69921875, "learning_rate": 0.0004999748089731037, "loss": 5.24133071899414, "step": 260 }, { "epoch": 0.0208881324462324, "grad_norm": 0.328125, "learning_rate": 0.0004999655461937884, "loss": 5.189028549194336, "step": 270 }, { "epoch": 0.021661766981278044, "grad_norm": 0.294921875, "learning_rate": 0.0004999548362553265, "loss": 5.089565658569336, "step": 280 }, { "epoch": 0.02243540151632369, "grad_norm": 0.96484375, "learning_rate": 0.0004999426792229862, "loss": 5.108868789672852, "step": 290 }, { "epoch": 0.023209036051369335, "grad_norm": 0.30859375, "learning_rate": 0.0004999290751708547, "loss": 5.045867919921875, "step": 300 }, { "epoch": 0.023209036051369335, "eval_loss": 5.63018274307251, "eval_runtime": 8.5483, "eval_samples_per_second": 38.253, "eval_steps_per_second": 1.287, "step": 300 }, { "epoch": 0.023982670586414977, "grad_norm": 0.55859375, "learning_rate": 0.0004999140241818376, "loss": 4.964016342163086, "step": 310 }, { "epoch": 0.024756305121460622, "grad_norm": 0.96484375, "learning_rate": 0.0004998975263476584, "loss": 4.973379516601563, "step": 320 }, { "epoch": 0.025529939656506268, "grad_norm": 0.341796875, "learning_rate": 0.0004998795817688582, "loss": 4.920859909057617, "step": 330 }, { "epoch": 0.02630357419155191, "grad_norm": 0.318359375, "learning_rate": 0.0004998601905547944, "loss": 4.873758316040039, "step": 340 }, { "epoch": 0.027077208726597555, "grad_norm": 0.7109375, "learning_rate": 0.0004998393528236405, "loss": 4.859211349487305, "step": 350 }, { "epoch": 0.0278508432616432, "grad_norm": 0.328125, "learning_rate": 0.000499817068702386, "loss": 4.848406219482422, "step": 360 }, { "epoch": 0.028624477796688846, "grad_norm": 0.29296875, "learning_rate": 0.0004997933383268339, "loss": 4.7945610046386715, "step": 370 }, { "epoch": 0.029398112331734488, "grad_norm": 0.75, "learning_rate": 0.0004997681618416019, "loss": 4.757486343383789, "step": 380 }, { "epoch": 0.030171746866780133, "grad_norm": 0.369140625, "learning_rate": 0.0004997415394001201, "loss": 4.792052459716797, "step": 390 }, { "epoch": 0.03094538140182578, "grad_norm": 0.2373046875, "learning_rate": 0.0004997134711646306, "loss": 4.726931381225586, "step": 400 }, { "epoch": 0.03094538140182578, "eval_loss": 5.367307662963867, "eval_runtime": 8.5603, "eval_samples_per_second": 38.2, "eval_steps_per_second": 1.285, "step": 400 }, { "epoch": 0.031719015936871424, "grad_norm": 0.65234375, "learning_rate": 0.0004996839573061863, "loss": 4.671530151367188, "step": 410 }, { "epoch": 0.032492650471917066, "grad_norm": 0.427734375, "learning_rate": 0.0004996529980046502, "loss": 4.672796630859375, "step": 420 }, { "epoch": 0.03326628500696271, "grad_norm": 0.30859375, "learning_rate": 0.0004996205934486943, "loss": 4.658016204833984, "step": 430 }, { "epoch": 0.03403991954200836, "grad_norm": 0.38671875, "learning_rate": 0.0004995867438357975, "loss": 4.623857498168945, "step": 440 }, { "epoch": 0.034813554077054, "grad_norm": 0.578125, "learning_rate": 0.000499551449372246, "loss": 4.6056865692138675, "step": 450 }, { "epoch": 0.03558718861209965, "grad_norm": 0.5, "learning_rate": 0.0004995147102731307, "loss": 4.593499374389649, "step": 460 }, { "epoch": 0.03636082314714529, "grad_norm": 0.27734375, "learning_rate": 0.0004994765267623465, "loss": 4.58136100769043, "step": 470 }, { "epoch": 0.03713445768219093, "grad_norm": 0.294921875, "learning_rate": 0.0004994368990725909, "loss": 4.534087753295898, "step": 480 }, { "epoch": 0.03790809221723658, "grad_norm": 0.50390625, "learning_rate": 0.0004993958274453623, "loss": 4.540646743774414, "step": 490 }, { "epoch": 0.03868172675228222, "grad_norm": 0.6171875, "learning_rate": 0.0004993533121309587, "loss": 4.509712219238281, "step": 500 }, { "epoch": 0.03868172675228222, "eval_loss": 5.2208099365234375, "eval_runtime": 8.5343, "eval_samples_per_second": 38.316, "eval_steps_per_second": 1.289, "step": 500 }, { "epoch": 0.039455361287327864, "grad_norm": 0.2431640625, "learning_rate": 0.0004993093533884765, "loss": 4.509745407104492, "step": 510 }, { "epoch": 0.04022899582237351, "grad_norm": 0.3359375, "learning_rate": 0.0004992639514858084, "loss": 4.446602249145508, "step": 520 }, { "epoch": 0.041002630357419155, "grad_norm": 0.33984375, "learning_rate": 0.0004992171066996421, "loss": 4.452914428710938, "step": 530 }, { "epoch": 0.0417762648924648, "grad_norm": 0.263671875, "learning_rate": 0.0004991688193154583, "loss": 4.4591011047363285, "step": 540 }, { "epoch": 0.042549899427510446, "grad_norm": 0.455078125, "learning_rate": 0.0004991190896275294, "loss": 4.453225326538086, "step": 550 }, { "epoch": 0.04332353396255609, "grad_norm": 0.318359375, "learning_rate": 0.0004990679179389172, "loss": 4.408919143676758, "step": 560 }, { "epoch": 0.04409716849760173, "grad_norm": 0.2373046875, "learning_rate": 0.0004990153045614716, "loss": 4.396371078491211, "step": 570 }, { "epoch": 0.04487080303264738, "grad_norm": 0.3203125, "learning_rate": 0.0004989612498158283, "loss": 4.394485855102539, "step": 580 }, { "epoch": 0.04564443756769302, "grad_norm": 0.453125, "learning_rate": 0.0004989057540314069, "loss": 4.370931625366211, "step": 590 }, { "epoch": 0.04641807210273867, "grad_norm": 0.248046875, "learning_rate": 0.0004988488175464091, "loss": 4.387384033203125, "step": 600 }, { "epoch": 0.04641807210273867, "eval_loss": 5.092612266540527, "eval_runtime": 8.6148, "eval_samples_per_second": 37.958, "eval_steps_per_second": 1.277, "step": 600 }, { "epoch": 0.04719170663778431, "grad_norm": 0.306640625, "learning_rate": 0.0004987904407078164, "loss": 4.3401447296142575, "step": 610 }, { "epoch": 0.04796534117282995, "grad_norm": 0.328125, "learning_rate": 0.000498730623871388, "loss": 4.367118835449219, "step": 620 }, { "epoch": 0.0487389757078756, "grad_norm": 0.26171875, "learning_rate": 0.0004986693674016589, "loss": 4.342254257202148, "step": 630 }, { "epoch": 0.049512610242921244, "grad_norm": 0.36328125, "learning_rate": 0.0004986066716719372, "loss": 4.318671798706054, "step": 640 }, { "epoch": 0.050286244777966886, "grad_norm": 0.27734375, "learning_rate": 0.0004985425370643027, "loss": 4.326435089111328, "step": 650 }, { "epoch": 0.051059879313012535, "grad_norm": 0.275390625, "learning_rate": 0.0004984769639696033, "loss": 4.320156860351562, "step": 660 }, { "epoch": 0.05183351384805818, "grad_norm": 0.283203125, "learning_rate": 0.0004984099527874539, "loss": 4.2882133483886715, "step": 670 }, { "epoch": 0.05260714838310382, "grad_norm": 0.224609375, "learning_rate": 0.0004983415039262328, "loss": 4.269629669189453, "step": 680 }, { "epoch": 0.05338078291814947, "grad_norm": 0.30859375, "learning_rate": 0.0004982716178030802, "loss": 4.244283676147461, "step": 690 }, { "epoch": 0.05415441745319511, "grad_norm": 0.33984375, "learning_rate": 0.000498200294843895, "loss": 4.2871452331542965, "step": 700 }, { "epoch": 0.05415441745319511, "eval_loss": 4.956212043762207, "eval_runtime": 8.6126, "eval_samples_per_second": 37.968, "eval_steps_per_second": 1.277, "step": 700 }, { "epoch": 0.05492805198824075, "grad_norm": 0.294921875, "learning_rate": 0.0004981275354833328, "loss": 4.227527236938476, "step": 710 }, { "epoch": 0.0557016865232864, "grad_norm": 0.263671875, "learning_rate": 0.0004980533401648026, "loss": 4.238017654418945, "step": 720 }, { "epoch": 0.05647532105833204, "grad_norm": 0.283203125, "learning_rate": 0.0004979777093404642, "loss": 4.230612945556641, "step": 730 }, { "epoch": 0.05724895559337769, "grad_norm": 0.302734375, "learning_rate": 0.0004979006434712263, "loss": 4.228169250488281, "step": 740 }, { "epoch": 0.05802259012842333, "grad_norm": 0.375, "learning_rate": 0.0004978221430267422, "loss": 4.209581756591797, "step": 750 }, { "epoch": 0.058796224663468975, "grad_norm": 0.29296875, "learning_rate": 0.0004977422084854085, "loss": 4.2135154724121096, "step": 760 }, { "epoch": 0.059569859198514624, "grad_norm": 0.234375, "learning_rate": 0.000497660840334361, "loss": 4.225874710083008, "step": 770 }, { "epoch": 0.060343493733560266, "grad_norm": 0.251953125, "learning_rate": 0.0004975780390694723, "loss": 4.196949768066406, "step": 780 }, { "epoch": 0.06111712826860591, "grad_norm": 0.265625, "learning_rate": 0.0004974938051953488, "loss": 4.196494674682617, "step": 790 }, { "epoch": 0.06189076280365156, "grad_norm": 0.228515625, "learning_rate": 0.0004974081392253274, "loss": 4.1752674102783205, "step": 800 }, { "epoch": 0.06189076280365156, "eval_loss": 4.886258602142334, "eval_runtime": 8.574, "eval_samples_per_second": 38.138, "eval_steps_per_second": 1.283, "step": 800 }, { "epoch": 0.0626643973386972, "grad_norm": 0.310546875, "learning_rate": 0.0004973210416814722, "loss": 4.171138763427734, "step": 810 }, { "epoch": 0.06343803187374285, "grad_norm": 0.205078125, "learning_rate": 0.000497232513094572, "loss": 4.168529891967774, "step": 820 }, { "epoch": 0.06421166640878849, "grad_norm": 0.302734375, "learning_rate": 0.0004971425540041365, "loss": 4.1555931091308596, "step": 830 }, { "epoch": 0.06498530094383413, "grad_norm": 0.275390625, "learning_rate": 0.000497051164958393, "loss": 4.1395000457763675, "step": 840 }, { "epoch": 0.06575893547887977, "grad_norm": 0.2734375, "learning_rate": 0.0004969583465142832, "loss": 4.131367111206055, "step": 850 }, { "epoch": 0.06653257001392542, "grad_norm": 0.240234375, "learning_rate": 0.0004968640992374602, "loss": 4.145170211791992, "step": 860 }, { "epoch": 0.06730620454897107, "grad_norm": 0.26953125, "learning_rate": 0.0004967684237022843, "loss": 4.137904357910156, "step": 870 }, { "epoch": 0.06807983908401671, "grad_norm": 0.2373046875, "learning_rate": 0.0004966713204918199, "loss": 4.099301528930664, "step": 880 }, { "epoch": 0.06885347361906236, "grad_norm": 0.2333984375, "learning_rate": 0.0004965727901978322, "loss": 4.081951522827149, "step": 890 }, { "epoch": 0.069627108154108, "grad_norm": 0.2275390625, "learning_rate": 0.0004964728334207829, "loss": 4.109021377563477, "step": 900 }, { "epoch": 0.069627108154108, "eval_loss": 4.80100154876709, "eval_runtime": 8.5773, "eval_samples_per_second": 38.124, "eval_steps_per_second": 1.282, "step": 900 }, { "epoch": 0.07040074268915364, "grad_norm": 0.23046875, "learning_rate": 0.0004963714507698272, "loss": 4.122850036621093, "step": 910 }, { "epoch": 0.0711743772241993, "grad_norm": 0.302734375, "learning_rate": 0.0004962686428628099, "loss": 4.123403930664063, "step": 920 }, { "epoch": 0.07194801175924494, "grad_norm": 0.1953125, "learning_rate": 0.0004961644103262615, "loss": 4.103722763061524, "step": 930 }, { "epoch": 0.07272164629429058, "grad_norm": 0.208984375, "learning_rate": 0.0004960587537953944, "loss": 4.106454086303711, "step": 940 }, { "epoch": 0.07349528082933622, "grad_norm": 0.2294921875, "learning_rate": 0.000495951673914099, "loss": 4.093786239624023, "step": 950 }, { "epoch": 0.07426891536438186, "grad_norm": 0.224609375, "learning_rate": 0.0004958431713349402, "loss": 4.103993225097656, "step": 960 }, { "epoch": 0.0750425498994275, "grad_norm": 0.228515625, "learning_rate": 0.0004957332467191527, "loss": 4.083438491821289, "step": 970 }, { "epoch": 0.07581618443447316, "grad_norm": 0.2294921875, "learning_rate": 0.0004956219007366376, "loss": 4.068552780151367, "step": 980 }, { "epoch": 0.0765898189695188, "grad_norm": 0.275390625, "learning_rate": 0.000495509134065958, "loss": 4.07377815246582, "step": 990 }, { "epoch": 0.07736345350456444, "grad_norm": 0.2265625, "learning_rate": 0.0004953949473943349, "loss": 4.056775283813477, "step": 1000 }, { "epoch": 0.07736345350456444, "eval_loss": 4.741029739379883, "eval_runtime": 8.5971, "eval_samples_per_second": 38.036, "eval_steps_per_second": 1.279, "step": 1000 }, { "epoch": 0.07813708803961009, "grad_norm": 0.255859375, "learning_rate": 0.0004952793414176431, "loss": 4.064179992675781, "step": 1010 }, { "epoch": 0.07891072257465573, "grad_norm": 0.2392578125, "learning_rate": 0.0004951623168404069, "loss": 4.05681266784668, "step": 1020 }, { "epoch": 0.07968435710970137, "grad_norm": 0.201171875, "learning_rate": 0.0004950438743757959, "loss": 4.0333606719970705, "step": 1030 }, { "epoch": 0.08045799164474703, "grad_norm": 0.2421875, "learning_rate": 0.0004949240147456203, "loss": 4.008632659912109, "step": 1040 }, { "epoch": 0.08123162617979267, "grad_norm": 0.232421875, "learning_rate": 0.0004948027386803271, "loss": 4.046485900878906, "step": 1050 }, { "epoch": 0.08200526071483831, "grad_norm": 0.20703125, "learning_rate": 0.0004946800469189951, "loss": 4.016164016723633, "step": 1060 }, { "epoch": 0.08277889524988395, "grad_norm": 0.24609375, "learning_rate": 0.0004945559402093307, "loss": 4.027731704711914, "step": 1070 }, { "epoch": 0.0835525297849296, "grad_norm": 0.216796875, "learning_rate": 0.0004944304193076633, "loss": 4.006626892089844, "step": 1080 }, { "epoch": 0.08432616431997525, "grad_norm": 0.2578125, "learning_rate": 0.0004943034849789404, "loss": 4.007661056518555, "step": 1090 }, { "epoch": 0.08509979885502089, "grad_norm": 0.216796875, "learning_rate": 0.0004941751379967235, "loss": 4.004118347167969, "step": 1100 }, { "epoch": 0.08509979885502089, "eval_loss": 4.684783935546875, "eval_runtime": 8.5416, "eval_samples_per_second": 38.283, "eval_steps_per_second": 1.288, "step": 1100 }, { "epoch": 0.08587343339006653, "grad_norm": 0.2431640625, "learning_rate": 0.0004940453791431831, "loss": 3.999224090576172, "step": 1110 }, { "epoch": 0.08664706792511218, "grad_norm": 0.2060546875, "learning_rate": 0.0004939142092090935, "loss": 3.9808334350585937, "step": 1120 }, { "epoch": 0.08742070246015782, "grad_norm": 0.2109375, "learning_rate": 0.0004937816289938288, "loss": 4.003896331787109, "step": 1130 }, { "epoch": 0.08819433699520346, "grad_norm": 0.26953125, "learning_rate": 0.0004936476393053574, "loss": 3.9906829833984374, "step": 1140 }, { "epoch": 0.08896797153024912, "grad_norm": 0.212890625, "learning_rate": 0.0004935122409602374, "loss": 3.9897789001464843, "step": 1150 }, { "epoch": 0.08974160606529476, "grad_norm": 0.236328125, "learning_rate": 0.0004933754347836115, "loss": 3.9780765533447267, "step": 1160 }, { "epoch": 0.0905152406003404, "grad_norm": 0.23828125, "learning_rate": 0.0004932372216092017, "loss": 3.976204681396484, "step": 1170 }, { "epoch": 0.09128887513538604, "grad_norm": 0.216796875, "learning_rate": 0.0004930976022793051, "loss": 3.9825729370117187, "step": 1180 }, { "epoch": 0.09206250967043168, "grad_norm": 0.2255859375, "learning_rate": 0.0004929565776447875, "loss": 3.956177520751953, "step": 1190 }, { "epoch": 0.09283614420547734, "grad_norm": 0.2236328125, "learning_rate": 0.0004928141485650795, "loss": 3.9746784210205077, "step": 1200 }, { "epoch": 0.09283614420547734, "eval_loss": 4.6136932373046875, "eval_runtime": 8.5763, "eval_samples_per_second": 38.129, "eval_steps_per_second": 1.283, "step": 1200 }, { "epoch": 0.09360977874052298, "grad_norm": 0.2216796875, "learning_rate": 0.0004926703159081702, "loss": 3.9590415954589844, "step": 1210 }, { "epoch": 0.09438341327556862, "grad_norm": 0.25390625, "learning_rate": 0.0004925250805506026, "loss": 3.9336162567138673, "step": 1220 }, { "epoch": 0.09515704781061426, "grad_norm": 0.251953125, "learning_rate": 0.0004923784433774679, "loss": 3.9630496978759764, "step": 1230 }, { "epoch": 0.0959306823456599, "grad_norm": 0.2333984375, "learning_rate": 0.0004922304052824003, "loss": 3.9313884735107423, "step": 1240 }, { "epoch": 0.09670431688070555, "grad_norm": 0.2216796875, "learning_rate": 0.0004920809671675715, "loss": 3.9482696533203123, "step": 1250 }, { "epoch": 0.0974779514157512, "grad_norm": 0.248046875, "learning_rate": 0.000491930129943685, "loss": 3.9435379028320314, "step": 1260 }, { "epoch": 0.09825158595079685, "grad_norm": 0.2158203125, "learning_rate": 0.0004917778945299709, "loss": 3.9084590911865233, "step": 1270 }, { "epoch": 0.09902522048584249, "grad_norm": 0.2236328125, "learning_rate": 0.0004916242618541802, "loss": 3.91564826965332, "step": 1280 }, { "epoch": 0.09979885502088813, "grad_norm": 0.236328125, "learning_rate": 0.0004914692328525788, "loss": 3.931330108642578, "step": 1290 }, { "epoch": 0.10057248955593377, "grad_norm": 0.26171875, "learning_rate": 0.0004913128084699424, "loss": 3.928493881225586, "step": 1300 }, { "epoch": 0.10057248955593377, "eval_loss": 4.577918529510498, "eval_runtime": 8.5374, "eval_samples_per_second": 38.302, "eval_steps_per_second": 1.288, "step": 1300 }, { "epoch": 0.10134612409097943, "grad_norm": 0.21875, "learning_rate": 0.0004911549896595501, "loss": 3.922897720336914, "step": 1310 }, { "epoch": 0.10211975862602507, "grad_norm": 0.2373046875, "learning_rate": 0.0004909957773831791, "loss": 3.927952194213867, "step": 1320 }, { "epoch": 0.10289339316107071, "grad_norm": 0.1982421875, "learning_rate": 0.0004908351726110987, "loss": 3.9283069610595702, "step": 1330 }, { "epoch": 0.10366702769611635, "grad_norm": 0.2734375, "learning_rate": 0.000490673176322064, "loss": 3.9404796600341796, "step": 1340 }, { "epoch": 0.104440662231162, "grad_norm": 0.2412109375, "learning_rate": 0.0004905097895033106, "loss": 3.9214569091796876, "step": 1350 }, { "epoch": 0.10521429676620764, "grad_norm": 0.208984375, "learning_rate": 0.000490345013150548, "loss": 3.9170085906982424, "step": 1360 }, { "epoch": 0.1059879313012533, "grad_norm": 0.24609375, "learning_rate": 0.0004901788482679542, "loss": 3.899140167236328, "step": 1370 }, { "epoch": 0.10676156583629894, "grad_norm": 0.236328125, "learning_rate": 0.0004900112958681686, "loss": 3.913042449951172, "step": 1380 }, { "epoch": 0.10753520037134458, "grad_norm": 0.216796875, "learning_rate": 0.0004898423569722866, "loss": 3.9000522613525392, "step": 1390 }, { "epoch": 0.10830883490639022, "grad_norm": 0.2060546875, "learning_rate": 0.0004896720326098534, "loss": 3.907938003540039, "step": 1400 }, { "epoch": 0.10830883490639022, "eval_loss": 4.5124287605285645, "eval_runtime": 8.581, "eval_samples_per_second": 38.108, "eval_steps_per_second": 1.282, "step": 1400 }, { "epoch": 0.10908246944143586, "grad_norm": 0.2412109375, "learning_rate": 0.0004895003238188572, "loss": 3.896725082397461, "step": 1410 }, { "epoch": 0.1098561039764815, "grad_norm": 0.25, "learning_rate": 0.0004893272316457232, "loss": 3.887255859375, "step": 1420 }, { "epoch": 0.11062973851152716, "grad_norm": 0.212890625, "learning_rate": 0.0004891527571453074, "loss": 3.899026107788086, "step": 1430 }, { "epoch": 0.1114033730465728, "grad_norm": 0.2294921875, "learning_rate": 0.0004889769013808898, "loss": 3.9211231231689454, "step": 1440 }, { "epoch": 0.11217700758161844, "grad_norm": 0.2099609375, "learning_rate": 0.000488799665424168, "loss": 3.8967121124267576, "step": 1450 }, { "epoch": 0.11295064211666409, "grad_norm": 0.216796875, "learning_rate": 0.0004886210503552508, "loss": 3.8699275970458986, "step": 1460 }, { "epoch": 0.11372427665170973, "grad_norm": 0.2275390625, "learning_rate": 0.0004884410572626518, "loss": 3.8598350524902343, "step": 1470 }, { "epoch": 0.11449791118675538, "grad_norm": 0.201171875, "learning_rate": 0.0004882596872432822, "loss": 3.90062255859375, "step": 1480 }, { "epoch": 0.11527154572180102, "grad_norm": 0.2158203125, "learning_rate": 0.0004880769414024446, "loss": 3.8603435516357423, "step": 1490 }, { "epoch": 0.11604518025684667, "grad_norm": 0.2275390625, "learning_rate": 0.0004878928208538261, "loss": 3.8940032958984374, "step": 1500 }, { "epoch": 0.11604518025684667, "eval_loss": 4.474898338317871, "eval_runtime": 8.5376, "eval_samples_per_second": 38.301, "eval_steps_per_second": 1.288, "step": 1500 }, { "epoch": 0.11681881479189231, "grad_norm": 0.279296875, "learning_rate": 0.0004877073267194916, "loss": 3.8529014587402344, "step": 1510 }, { "epoch": 0.11759244932693795, "grad_norm": 0.2236328125, "learning_rate": 0.00048752046012987677, "loss": 3.888753128051758, "step": 1520 }, { "epoch": 0.11836608386198359, "grad_norm": 0.22265625, "learning_rate": 0.0004873322222237812, "loss": 3.856996536254883, "step": 1530 }, { "epoch": 0.11913971839702925, "grad_norm": 0.25, "learning_rate": 0.0004871426141483618, "loss": 3.841297149658203, "step": 1540 }, { "epoch": 0.11991335293207489, "grad_norm": 0.263671875, "learning_rate": 0.0004869516370591253, "loss": 3.838258743286133, "step": 1550 }, { "epoch": 0.12068698746712053, "grad_norm": 0.251953125, "learning_rate": 0.0004867592921199217, "loss": 3.852222442626953, "step": 1560 }, { "epoch": 0.12146062200216617, "grad_norm": 0.26953125, "learning_rate": 0.0004865655805029366, "loss": 3.8498695373535154, "step": 1570 }, { "epoch": 0.12223425653721182, "grad_norm": 0.2470703125, "learning_rate": 0.0004863705033886847, "loss": 3.8373653411865236, "step": 1580 }, { "epoch": 0.12300789107225747, "grad_norm": 0.22265625, "learning_rate": 0.0004861740619660022, "loss": 3.8427047729492188, "step": 1590 }, { "epoch": 0.12378152560730311, "grad_norm": 0.240234375, "learning_rate": 0.0004859762574320395, "loss": 3.864556884765625, "step": 1600 }, { "epoch": 0.12378152560730311, "eval_loss": 4.4412994384765625, "eval_runtime": 9.5955, "eval_samples_per_second": 34.079, "eval_steps_per_second": 1.146, "step": 1600 }, { "epoch": 0.12455516014234876, "grad_norm": 0.2001953125, "learning_rate": 0.0004857770909922542, "loss": 3.816178894042969, "step": 1610 }, { "epoch": 0.1253287946773944, "grad_norm": 0.2373046875, "learning_rate": 0.0004855765638604036, "loss": 3.8218841552734375, "step": 1620 }, { "epoch": 0.12610242921244005, "grad_norm": 0.265625, "learning_rate": 0.00048537467725853734, "loss": 3.8202373504638674, "step": 1630 }, { "epoch": 0.1268760637474857, "grad_norm": 0.201171875, "learning_rate": 0.00048517143241698986, "loss": 3.8387172698974608, "step": 1640 }, { "epoch": 0.12764969828253134, "grad_norm": 0.2177734375, "learning_rate": 0.0004849668305743729, "loss": 3.8024673461914062, "step": 1650 }, { "epoch": 0.12842333281757698, "grad_norm": 0.2177734375, "learning_rate": 0.000484760872977568, "loss": 3.8411659240722655, "step": 1660 }, { "epoch": 0.12919696735262262, "grad_norm": 0.2294921875, "learning_rate": 0.0004845535608817193, "loss": 3.828306198120117, "step": 1670 }, { "epoch": 0.12997060188766826, "grad_norm": 0.19921875, "learning_rate": 0.000484344895550225, "loss": 3.8343215942382813, "step": 1680 }, { "epoch": 0.1307442364227139, "grad_norm": 0.212890625, "learning_rate": 0.00048413487825473044, "loss": 3.829656219482422, "step": 1690 }, { "epoch": 0.13151787095775955, "grad_norm": 0.232421875, "learning_rate": 0.0004839235102751201, "loss": 3.825642776489258, "step": 1700 }, { "epoch": 0.13151787095775955, "eval_loss": 4.401412010192871, "eval_runtime": 8.6836, "eval_samples_per_second": 37.657, "eval_steps_per_second": 1.267, "step": 1700 }, { "epoch": 0.1322915054928052, "grad_norm": 0.2177734375, "learning_rate": 0.00048371079289950966, "loss": 3.8195194244384765, "step": 1710 }, { "epoch": 0.13306514002785083, "grad_norm": 0.248046875, "learning_rate": 0.0004834967274242383, "loss": 3.786629867553711, "step": 1720 }, { "epoch": 0.1338387745628965, "grad_norm": 0.228515625, "learning_rate": 0.0004832813151538607, "loss": 3.798793411254883, "step": 1730 }, { "epoch": 0.13461240909794214, "grad_norm": 0.255859375, "learning_rate": 0.00048306455740113936, "loss": 3.7926116943359376, "step": 1740 }, { "epoch": 0.13538604363298778, "grad_norm": 0.228515625, "learning_rate": 0.0004828464554870363, "loss": 3.812264633178711, "step": 1750 }, { "epoch": 0.13615967816803343, "grad_norm": 0.2138671875, "learning_rate": 0.00048262701074070516, "loss": 3.7819557189941406, "step": 1760 }, { "epoch": 0.13693331270307907, "grad_norm": 0.2314453125, "learning_rate": 0.00048240622449948275, "loss": 3.772268295288086, "step": 1770 }, { "epoch": 0.1377069472381247, "grad_norm": 0.208984375, "learning_rate": 0.00048218409810888156, "loss": 3.7845218658447264, "step": 1780 }, { "epoch": 0.13848058177317035, "grad_norm": 0.201171875, "learning_rate": 0.00048196063292258123, "loss": 3.7898277282714843, "step": 1790 }, { "epoch": 0.139254216308216, "grad_norm": 0.23046875, "learning_rate": 0.0004817358303024199, "loss": 3.7971900939941405, "step": 1800 }, { "epoch": 0.139254216308216, "eval_loss": 4.37278413772583, "eval_runtime": 8.6618, "eval_samples_per_second": 37.752, "eval_steps_per_second": 1.27, "step": 1800 }, { "epoch": 0.14002785084326164, "grad_norm": 0.24609375, "learning_rate": 0.0004815096916183866, "loss": 3.7643463134765627, "step": 1810 }, { "epoch": 0.14080148537830728, "grad_norm": 0.216796875, "learning_rate": 0.00048128221824861236, "loss": 3.777587890625, "step": 1820 }, { "epoch": 0.14157511991335292, "grad_norm": 0.244140625, "learning_rate": 0.0004810534115793623, "loss": 3.775267791748047, "step": 1830 }, { "epoch": 0.1423487544483986, "grad_norm": 0.2255859375, "learning_rate": 0.00048082327300502664, "loss": 3.7802684783935545, "step": 1840 }, { "epoch": 0.14312238898344423, "grad_norm": 0.25, "learning_rate": 0.00048059180392811266, "loss": 3.8166263580322264, "step": 1850 }, { "epoch": 0.14389602351848987, "grad_norm": 0.2421875, "learning_rate": 0.0004803590057592359, "loss": 3.7695087432861327, "step": 1860 }, { "epoch": 0.14466965805353552, "grad_norm": 0.2119140625, "learning_rate": 0.0004801248799171116, "loss": 3.7461666107177733, "step": 1870 }, { "epoch": 0.14544329258858116, "grad_norm": 0.25390625, "learning_rate": 0.00047988942782854624, "loss": 3.7527397155761717, "step": 1880 }, { "epoch": 0.1462169271236268, "grad_norm": 0.2412109375, "learning_rate": 0.00047965265092842846, "loss": 3.74096565246582, "step": 1890 }, { "epoch": 0.14699056165867244, "grad_norm": 0.2578125, "learning_rate": 0.00047941455065972073, "loss": 3.7666641235351563, "step": 1900 }, { "epoch": 0.14699056165867244, "eval_loss": 4.354757785797119, "eval_runtime": 8.7304, "eval_samples_per_second": 37.455, "eval_steps_per_second": 1.26, "step": 1900 }, { "epoch": 0.14776419619371808, "grad_norm": 0.20703125, "learning_rate": 0.0004791751284734504, "loss": 3.752808380126953, "step": 1910 }, { "epoch": 0.14853783072876373, "grad_norm": 0.2578125, "learning_rate": 0.0004789343858287005, "loss": 3.744313049316406, "step": 1920 }, { "epoch": 0.14931146526380937, "grad_norm": 0.212890625, "learning_rate": 0.00047869232419260165, "loss": 3.738627243041992, "step": 1930 }, { "epoch": 0.150085099798855, "grad_norm": 0.2255859375, "learning_rate": 0.0004784489450403224, "loss": 3.769034194946289, "step": 1940 }, { "epoch": 0.15085873433390065, "grad_norm": 0.244140625, "learning_rate": 0.0004782042498550604, "loss": 3.754560089111328, "step": 1950 }, { "epoch": 0.15163236886894632, "grad_norm": 0.2138671875, "learning_rate": 0.00047795824012803357, "loss": 3.7514068603515627, "step": 1960 }, { "epoch": 0.15240600340399196, "grad_norm": 0.2734375, "learning_rate": 0.000477710917358471, "loss": 3.7632373809814452, "step": 1970 }, { "epoch": 0.1531796379390376, "grad_norm": 0.23046875, "learning_rate": 0.00047746228305360345, "loss": 3.7417659759521484, "step": 1980 }, { "epoch": 0.15395327247408325, "grad_norm": 0.21484375, "learning_rate": 0.00047721233872865463, "loss": 3.7318050384521486, "step": 1990 }, { "epoch": 0.1547269070091289, "grad_norm": 0.2119140625, "learning_rate": 0.00047696108590683175, "loss": 3.7479320526123048, "step": 2000 }, { "epoch": 0.1547269070091289, "eval_loss": 4.3264288902282715, "eval_runtime": 8.7274, "eval_samples_per_second": 37.468, "eval_steps_per_second": 1.26, "step": 2000 }, { "epoch": 0.15550054154417453, "grad_norm": 0.26171875, "learning_rate": 0.0004767085261193161, "loss": 3.711147689819336, "step": 2010 }, { "epoch": 0.15627417607922017, "grad_norm": 0.220703125, "learning_rate": 0.0004764546609052538, "loss": 3.749440002441406, "step": 2020 }, { "epoch": 0.15704781061426581, "grad_norm": 0.2275390625, "learning_rate": 0.0004761994918117469, "loss": 3.7327606201171877, "step": 2030 }, { "epoch": 0.15782144514931146, "grad_norm": 0.267578125, "learning_rate": 0.000475943020393843, "loss": 3.7557136535644533, "step": 2040 }, { "epoch": 0.1585950796843571, "grad_norm": 0.2138671875, "learning_rate": 0.0004756852482145268, "loss": 3.723508834838867, "step": 2050 }, { "epoch": 0.15936871421940274, "grad_norm": 0.2158203125, "learning_rate": 0.00047542617684470965, "loss": 3.732291412353516, "step": 2060 }, { "epoch": 0.1601423487544484, "grad_norm": 0.21484375, "learning_rate": 0.0004751658078632206, "loss": 3.7624893188476562, "step": 2070 }, { "epoch": 0.16091598328949405, "grad_norm": 0.2080078125, "learning_rate": 0.00047490414285679666, "loss": 3.7248538970947265, "step": 2080 }, { "epoch": 0.1616896178245397, "grad_norm": 0.2578125, "learning_rate": 0.000474641183420073, "loss": 3.732358932495117, "step": 2090 }, { "epoch": 0.16246325235958534, "grad_norm": 0.28515625, "learning_rate": 0.0004743769311555732, "loss": 3.7347564697265625, "step": 2100 }, { "epoch": 0.16246325235958534, "eval_loss": 4.292186260223389, "eval_runtime": 8.7033, "eval_samples_per_second": 37.572, "eval_steps_per_second": 1.264, "step": 2100 }, { "epoch": 0.16323688689463098, "grad_norm": 0.2197265625, "learning_rate": 0.0004741113876736997, "loss": 3.7274330139160154, "step": 2110 }, { "epoch": 0.16401052142967662, "grad_norm": 0.2265625, "learning_rate": 0.00047384455459272386, "loss": 3.7328311920166017, "step": 2120 }, { "epoch": 0.16478415596472226, "grad_norm": 0.25, "learning_rate": 0.0004735764335387758, "loss": 3.7267345428466796, "step": 2130 }, { "epoch": 0.1655577904997679, "grad_norm": 0.2421875, "learning_rate": 0.0004733070261458353, "loss": 3.7383796691894533, "step": 2140 }, { "epoch": 0.16633142503481355, "grad_norm": 0.259765625, "learning_rate": 0.00047303633405572094, "loss": 3.714567184448242, "step": 2150 }, { "epoch": 0.1671050595698592, "grad_norm": 0.2578125, "learning_rate": 0.0004727643589180806, "loss": 3.752973175048828, "step": 2160 }, { "epoch": 0.16787869410490483, "grad_norm": 0.212890625, "learning_rate": 0.00047249110239038123, "loss": 3.6907588958740236, "step": 2170 }, { "epoch": 0.1686523286399505, "grad_norm": 0.2265625, "learning_rate": 0.00047221656613789895, "loss": 3.73446044921875, "step": 2180 }, { "epoch": 0.16942596317499614, "grad_norm": 0.2373046875, "learning_rate": 0.00047194075183370864, "loss": 3.679473876953125, "step": 2190 }, { "epoch": 0.17019959771004178, "grad_norm": 0.216796875, "learning_rate": 0.0004716636611586739, "loss": 3.7257465362548827, "step": 2200 }, { "epoch": 0.17019959771004178, "eval_loss": 4.27129602432251, "eval_runtime": 8.7096, "eval_samples_per_second": 37.545, "eval_steps_per_second": 1.263, "step": 2200 }, { "epoch": 0.17097323224508743, "grad_norm": 0.2216796875, "learning_rate": 0.00047138529580143673, "loss": 3.7073875427246095, "step": 2210 }, { "epoch": 0.17174686678013307, "grad_norm": 0.21875, "learning_rate": 0.0004711056574584075, "loss": 3.71368522644043, "step": 2220 }, { "epoch": 0.1725205013151787, "grad_norm": 0.2197265625, "learning_rate": 0.00047082474783375396, "loss": 3.7186820983886717, "step": 2230 }, { "epoch": 0.17329413585022435, "grad_norm": 0.212890625, "learning_rate": 0.00047054256863939177, "loss": 3.705561065673828, "step": 2240 }, { "epoch": 0.17406777038527, "grad_norm": 0.220703125, "learning_rate": 0.0004702591215949732, "loss": 3.709010696411133, "step": 2250 }, { "epoch": 0.17484140492031564, "grad_norm": 0.2373046875, "learning_rate": 0.00046997440842787725, "loss": 3.7188438415527343, "step": 2260 }, { "epoch": 0.17561503945536128, "grad_norm": 0.26953125, "learning_rate": 0.0004696884308731988, "loss": 3.707378387451172, "step": 2270 }, { "epoch": 0.17638867399040692, "grad_norm": 0.240234375, "learning_rate": 0.00046940119067373823, "loss": 3.697579193115234, "step": 2280 }, { "epoch": 0.1771623085254526, "grad_norm": 0.2353515625, "learning_rate": 0.0004691126895799907, "loss": 3.7102542877197267, "step": 2290 }, { "epoch": 0.17793594306049823, "grad_norm": 0.2255859375, "learning_rate": 0.0004688229293501354, "loss": 3.682720947265625, "step": 2300 }, { "epoch": 0.17793594306049823, "eval_loss": 4.244110584259033, "eval_runtime": 8.6768, "eval_samples_per_second": 37.687, "eval_steps_per_second": 1.268, "step": 2300 }, { "epoch": 0.17870957759554387, "grad_norm": 0.2001953125, "learning_rate": 0.000468531911750025, "loss": 3.6973262786865235, "step": 2310 }, { "epoch": 0.17948321213058951, "grad_norm": 0.2265625, "learning_rate": 0.00046823963855317487, "loss": 3.682568359375, "step": 2320 }, { "epoch": 0.18025684666563516, "grad_norm": 0.22265625, "learning_rate": 0.00046794611154075207, "loss": 3.6916324615478517, "step": 2330 }, { "epoch": 0.1810304812006808, "grad_norm": 0.2255859375, "learning_rate": 0.0004676513325015648, "loss": 3.6971084594726564, "step": 2340 }, { "epoch": 0.18180411573572644, "grad_norm": 0.22265625, "learning_rate": 0.0004673553032320512, "loss": 3.680620574951172, "step": 2350 }, { "epoch": 0.18257775027077208, "grad_norm": 0.24609375, "learning_rate": 0.00046705802553626875, "loss": 3.6823448181152343, "step": 2360 }, { "epoch": 0.18335138480581772, "grad_norm": 0.2177734375, "learning_rate": 0.0004667595012258829, "loss": 3.6814292907714843, "step": 2370 }, { "epoch": 0.18412501934086337, "grad_norm": 0.248046875, "learning_rate": 0.0004664597321201562, "loss": 3.6852691650390623, "step": 2380 }, { "epoch": 0.184898653875909, "grad_norm": 0.2099609375, "learning_rate": 0.0004661587200459373, "loss": 3.7072521209716798, "step": 2390 }, { "epoch": 0.18567228841095468, "grad_norm": 0.240234375, "learning_rate": 0.0004658564668376496, "loss": 3.6736068725585938, "step": 2400 }, { "epoch": 0.18567228841095468, "eval_loss": 4.224212646484375, "eval_runtime": 8.6258, "eval_samples_per_second": 37.91, "eval_steps_per_second": 1.275, "step": 2400 }, { "epoch": 0.18644592294600032, "grad_norm": 0.2421875, "learning_rate": 0.0004655529743372805, "loss": 3.674551010131836, "step": 2410 }, { "epoch": 0.18721955748104596, "grad_norm": 0.244140625, "learning_rate": 0.00046524824439436946, "loss": 3.676839065551758, "step": 2420 }, { "epoch": 0.1879931920160916, "grad_norm": 0.2275390625, "learning_rate": 0.00046494227886599744, "loss": 3.6566898345947267, "step": 2430 }, { "epoch": 0.18876682655113725, "grad_norm": 0.22265625, "learning_rate": 0.0004646350796167753, "loss": 3.6999538421630858, "step": 2440 }, { "epoch": 0.1895404610861829, "grad_norm": 0.2099609375, "learning_rate": 0.0004643266485188321, "loss": 3.6581405639648437, "step": 2450 }, { "epoch": 0.19031409562122853, "grad_norm": 0.2890625, "learning_rate": 0.00046401698745180444, "loss": 3.7002613067626955, "step": 2460 }, { "epoch": 0.19108773015627417, "grad_norm": 0.201171875, "learning_rate": 0.00046370609830282425, "loss": 3.684235763549805, "step": 2470 }, { "epoch": 0.1918613646913198, "grad_norm": 0.20703125, "learning_rate": 0.00046339398296650787, "loss": 3.6899051666259766, "step": 2480 }, { "epoch": 0.19263499922636546, "grad_norm": 0.23828125, "learning_rate": 0.000463080643344944, "loss": 3.6608238220214844, "step": 2490 }, { "epoch": 0.1934086337614111, "grad_norm": 0.2236328125, "learning_rate": 0.0004627660813476826, "loss": 3.6702159881591796, "step": 2500 }, { "epoch": 0.1934086337614111, "eval_loss": 4.213615417480469, "eval_runtime": 8.692, "eval_samples_per_second": 37.621, "eval_steps_per_second": 1.266, "step": 2500 }, { "epoch": 0.19418226829645677, "grad_norm": 0.2314453125, "learning_rate": 0.0004624502988917229, "loss": 3.6737674713134765, "step": 2510 }, { "epoch": 0.1949559028315024, "grad_norm": 0.25, "learning_rate": 0.00046213329790150185, "loss": 3.662728500366211, "step": 2520 }, { "epoch": 0.19572953736654805, "grad_norm": 0.2021484375, "learning_rate": 0.00046181508030888223, "loss": 3.6636001586914064, "step": 2530 }, { "epoch": 0.1965031719015937, "grad_norm": 0.255859375, "learning_rate": 0.00046149564805314134, "loss": 3.666353225708008, "step": 2540 }, { "epoch": 0.19727680643663933, "grad_norm": 0.298828125, "learning_rate": 0.00046117500308095853, "loss": 3.670008087158203, "step": 2550 }, { "epoch": 0.19805044097168498, "grad_norm": 0.2080078125, "learning_rate": 0.000460853147346404, "loss": 3.6724533081054687, "step": 2560 }, { "epoch": 0.19882407550673062, "grad_norm": 0.236328125, "learning_rate": 0.00046053008281092626, "loss": 3.656665802001953, "step": 2570 }, { "epoch": 0.19959771004177626, "grad_norm": 0.2060546875, "learning_rate": 0.0004602058114433405, "loss": 3.6695487976074217, "step": 2580 }, { "epoch": 0.2003713445768219, "grad_norm": 0.2255859375, "learning_rate": 0.0004598803352198169, "loss": 3.6759658813476563, "step": 2590 }, { "epoch": 0.20114497911186754, "grad_norm": 0.2236328125, "learning_rate": 0.0004595536561238677, "loss": 3.6256980895996094, "step": 2600 }, { "epoch": 0.20114497911186754, "eval_loss": 4.193091869354248, "eval_runtime": 8.6853, "eval_samples_per_second": 37.65, "eval_steps_per_second": 1.267, "step": 2600 }, { "epoch": 0.2019186136469132, "grad_norm": 0.248046875, "learning_rate": 0.00045922577614633634, "loss": 3.6532318115234377, "step": 2610 }, { "epoch": 0.20269224818195886, "grad_norm": 0.2421875, "learning_rate": 0.00045889669728538414, "loss": 3.640882873535156, "step": 2620 }, { "epoch": 0.2034658827170045, "grad_norm": 0.2216796875, "learning_rate": 0.0004585664215464788, "loss": 3.6541816711425783, "step": 2630 }, { "epoch": 0.20423951725205014, "grad_norm": 0.228515625, "learning_rate": 0.000458234950942382, "loss": 3.62015380859375, "step": 2640 }, { "epoch": 0.20501315178709578, "grad_norm": 0.265625, "learning_rate": 0.0004579022874931372, "loss": 3.660184860229492, "step": 2650 }, { "epoch": 0.20578678632214142, "grad_norm": 0.189453125, "learning_rate": 0.0004575684332260573, "loss": 3.646562957763672, "step": 2660 }, { "epoch": 0.20656042085718707, "grad_norm": 0.20703125, "learning_rate": 0.00045723339017571214, "loss": 3.66490478515625, "step": 2670 }, { "epoch": 0.2073340553922327, "grad_norm": 0.2275390625, "learning_rate": 0.00045689716038391643, "loss": 3.6182834625244142, "step": 2680 }, { "epoch": 0.20810768992727835, "grad_norm": 0.2490234375, "learning_rate": 0.00045655974589971677, "loss": 3.638666534423828, "step": 2690 }, { "epoch": 0.208881324462324, "grad_norm": 0.232421875, "learning_rate": 0.00045622114877937986, "loss": 3.660610580444336, "step": 2700 }, { "epoch": 0.208881324462324, "eval_loss": 4.197894096374512, "eval_runtime": 8.6595, "eval_samples_per_second": 37.762, "eval_steps_per_second": 1.27, "step": 2700 }, { "epoch": 0.20965495899736963, "grad_norm": 0.2333984375, "learning_rate": 0.00045588137108637934, "loss": 3.6198894500732424, "step": 2710 }, { "epoch": 0.21042859353241528, "grad_norm": 0.326171875, "learning_rate": 0.00045554041489138367, "loss": 3.651480865478516, "step": 2720 }, { "epoch": 0.21120222806746092, "grad_norm": 0.24609375, "learning_rate": 0.0004551982822722432, "loss": 3.6471332550048827, "step": 2730 }, { "epoch": 0.2119758626025066, "grad_norm": 0.2177734375, "learning_rate": 0.0004548549753139776, "loss": 3.6430343627929687, "step": 2740 }, { "epoch": 0.21274949713755223, "grad_norm": 0.228515625, "learning_rate": 0.0004545104961087634, "loss": 3.628376007080078, "step": 2750 }, { "epoch": 0.21352313167259787, "grad_norm": 0.228515625, "learning_rate": 0.00045416484675592065, "loss": 3.663385009765625, "step": 2760 }, { "epoch": 0.2142967662076435, "grad_norm": 0.234375, "learning_rate": 0.0004538180293619009, "loss": 3.6373767852783203, "step": 2770 }, { "epoch": 0.21507040074268916, "grad_norm": 0.2314453125, "learning_rate": 0.0004534700460402737, "loss": 3.626949691772461, "step": 2780 }, { "epoch": 0.2158440352777348, "grad_norm": 0.232421875, "learning_rate": 0.000453120898911714, "loss": 3.621552276611328, "step": 2790 }, { "epoch": 0.21661766981278044, "grad_norm": 0.232421875, "learning_rate": 0.00045277059010398934, "loss": 3.6465320587158203, "step": 2800 }, { "epoch": 0.21661766981278044, "eval_loss": 4.1806182861328125, "eval_runtime": 8.853, "eval_samples_per_second": 36.937, "eval_steps_per_second": 1.243, "step": 2800 }, { "epoch": 0.21739130434782608, "grad_norm": 0.2353515625, "learning_rate": 0.0004524191217519466, "loss": 3.646443557739258, "step": 2810 }, { "epoch": 0.21816493888287172, "grad_norm": 0.2294921875, "learning_rate": 0.00045206649599749914, "loss": 3.6304691314697264, "step": 2820 }, { "epoch": 0.21893857341791736, "grad_norm": 0.2314453125, "learning_rate": 0.000451712714989614, "loss": 3.629531478881836, "step": 2830 }, { "epoch": 0.219712207952963, "grad_norm": 0.22265625, "learning_rate": 0.0004513577808842982, "loss": 3.610256576538086, "step": 2840 }, { "epoch": 0.22048584248800868, "grad_norm": 0.2216796875, "learning_rate": 0.00045100169584458614, "loss": 3.6422473907470705, "step": 2850 }, { "epoch": 0.22125947702305432, "grad_norm": 0.23046875, "learning_rate": 0.00045064446204052616, "loss": 3.6097373962402344, "step": 2860 }, { "epoch": 0.22203311155809996, "grad_norm": 0.2275390625, "learning_rate": 0.0004502860816491675, "loss": 3.650621032714844, "step": 2870 }, { "epoch": 0.2228067460931456, "grad_norm": 0.2421875, "learning_rate": 0.00044992655685454676, "loss": 3.6009265899658205, "step": 2880 }, { "epoch": 0.22358038062819124, "grad_norm": 0.2177734375, "learning_rate": 0.0004495658898476749, "loss": 3.6009990692138674, "step": 2890 }, { "epoch": 0.2243540151632369, "grad_norm": 0.224609375, "learning_rate": 0.00044920408282652356, "loss": 3.6231040954589844, "step": 2900 }, { "epoch": 0.2243540151632369, "eval_loss": 4.175409317016602, "eval_runtime": 8.6708, "eval_samples_per_second": 37.713, "eval_steps_per_second": 1.269, "step": 2900 }, { "epoch": 0.22512764969828253, "grad_norm": 0.205078125, "learning_rate": 0.0004488411379960119, "loss": 3.641431427001953, "step": 2910 }, { "epoch": 0.22590128423332817, "grad_norm": 0.2265625, "learning_rate": 0.0004484770575679933, "loss": 3.6043201446533204, "step": 2920 }, { "epoch": 0.2266749187683738, "grad_norm": 0.2333984375, "learning_rate": 0.0004481118437612414, "loss": 3.5940608978271484, "step": 2930 }, { "epoch": 0.22744855330341945, "grad_norm": 0.2197265625, "learning_rate": 0.00044774549880143694, "loss": 3.632985305786133, "step": 2940 }, { "epoch": 0.2282221878384651, "grad_norm": 0.259765625, "learning_rate": 0.0004473780249211542, "loss": 3.5861167907714844, "step": 2950 }, { "epoch": 0.22899582237351077, "grad_norm": 0.2470703125, "learning_rate": 0.0004470094243598474, "loss": 3.6033992767333984, "step": 2960 }, { "epoch": 0.2297694569085564, "grad_norm": 0.2236328125, "learning_rate": 0.00044663969936383657, "loss": 3.5815731048583985, "step": 2970 }, { "epoch": 0.23054309144360205, "grad_norm": 0.228515625, "learning_rate": 0.00044626885218629467, "loss": 3.6179901123046876, "step": 2980 }, { "epoch": 0.2313167259786477, "grad_norm": 0.203125, "learning_rate": 0.00044589688508723326, "loss": 3.6054702758789063, "step": 2990 }, { "epoch": 0.23209036051369333, "grad_norm": 0.2333984375, "learning_rate": 0.0004455238003334889, "loss": 3.618684005737305, "step": 3000 }, { "epoch": 0.23209036051369333, "eval_loss": 4.147392272949219, "eval_runtime": 8.7049, "eval_samples_per_second": 37.565, "eval_steps_per_second": 1.264, "step": 3000 }, { "epoch": 0.23286399504873898, "grad_norm": 0.2236328125, "learning_rate": 0.00044514960019870935, "loss": 3.6089691162109374, "step": 3010 }, { "epoch": 0.23363762958378462, "grad_norm": 0.2412109375, "learning_rate": 0.0004447742869633398, "loss": 3.612302780151367, "step": 3020 }, { "epoch": 0.23441126411883026, "grad_norm": 0.2578125, "learning_rate": 0.0004443978629146089, "loss": 3.6134407043457033, "step": 3030 }, { "epoch": 0.2351848986538759, "grad_norm": 0.263671875, "learning_rate": 0.00044402033034651457, "loss": 3.6229934692382812, "step": 3040 }, { "epoch": 0.23595853318892154, "grad_norm": 0.2412109375, "learning_rate": 0.00044364169155981044, "loss": 3.6341014862060548, "step": 3050 }, { "epoch": 0.23673216772396719, "grad_norm": 0.2431640625, "learning_rate": 0.00044326194886199166, "loss": 3.617625427246094, "step": 3060 }, { "epoch": 0.23750580225901285, "grad_norm": 0.259765625, "learning_rate": 0.0004428811045672808, "loss": 3.5775123596191407, "step": 3070 }, { "epoch": 0.2382794367940585, "grad_norm": 0.2275390625, "learning_rate": 0.0004424991609966135, "loss": 3.6077903747558593, "step": 3080 }, { "epoch": 0.23905307132910414, "grad_norm": 0.216796875, "learning_rate": 0.0004421161204776251, "loss": 3.611967849731445, "step": 3090 }, { "epoch": 0.23982670586414978, "grad_norm": 0.2158203125, "learning_rate": 0.00044173198534463553, "loss": 3.607320022583008, "step": 3100 }, { "epoch": 0.23982670586414978, "eval_loss": 4.136959075927734, "eval_runtime": 8.702, "eval_samples_per_second": 37.578, "eval_steps_per_second": 1.264, "step": 3100 }, { "epoch": 0.12030133356542594, "grad_norm": 0.40234375, "learning_rate": 0.00048508648785485544, "loss": 3.5898792266845705, "step": 3110 }, { "epoch": 0.12068815457367489, "grad_norm": 0.283203125, "learning_rate": 0.00048498487415469285, "loss": 3.6180370330810545, "step": 3120 }, { "epoch": 0.12107497558192386, "grad_norm": 0.283203125, "learning_rate": 0.0004848829267533682, "loss": 3.61370849609375, "step": 3130 }, { "epoch": 0.12146179659017281, "grad_norm": 0.34765625, "learning_rate": 0.0004847806458037906, "loss": 3.632701873779297, "step": 3140 }, { "epoch": 0.12184861759842178, "grad_norm": 0.296875, "learning_rate": 0.0004846780314593695, "loss": 3.6194690704345702, "step": 3150 }, { "epoch": 0.12223543860667073, "grad_norm": 0.298828125, "learning_rate": 0.0004845750838740143, "loss": 3.6185939788818358, "step": 3160 }, { "epoch": 0.12262225961491968, "grad_norm": 0.28515625, "learning_rate": 0.00048447180320213424, "loss": 3.6234817504882812, "step": 3170 }, { "epoch": 0.12300908062316865, "grad_norm": 0.3046875, "learning_rate": 0.0004843681895986383, "loss": 3.633131408691406, "step": 3180 }, { "epoch": 0.1233959016314176, "grad_norm": 0.29296875, "learning_rate": 0.00048426424321893467, "loss": 3.6763965606689455, "step": 3190 }, { "epoch": 0.12378272263966655, "grad_norm": 0.27734375, "learning_rate": 0.00048415996421893073, "loss": 3.6260562896728517, "step": 3200 }, { "epoch": 0.12378272263966655, "eval_loss": 4.193098068237305, "eval_runtime": 10.1228, "eval_samples_per_second": 32.303, "eval_steps_per_second": 2.075, "step": 3200 }, { "epoch": 0.12416954364791552, "grad_norm": 0.298828125, "learning_rate": 0.0004840553527550326, "loss": 3.604556655883789, "step": 3210 }, { "epoch": 0.12455636465616447, "grad_norm": 0.28515625, "learning_rate": 0.0004839504089841453, "loss": 3.6034366607666017, "step": 3220 }, { "epoch": 0.12494318566441344, "grad_norm": 0.279296875, "learning_rate": 0.0004838451330636721, "loss": 3.6195159912109376, "step": 3230 }, { "epoch": 0.1253300066726624, "grad_norm": 0.298828125, "learning_rate": 0.00048373952515151446, "loss": 3.6002643585205076, "step": 3240 }, { "epoch": 0.12571682768091136, "grad_norm": 0.275390625, "learning_rate": 0.00048363358540607206, "loss": 3.6441097259521484, "step": 3250 }, { "epoch": 0.1261036486891603, "grad_norm": 0.28515625, "learning_rate": 0.00048352731398624177, "loss": 3.5857906341552734, "step": 3260 }, { "epoch": 0.12649046969740926, "grad_norm": 0.302734375, "learning_rate": 0.00048342071105141846, "loss": 3.603062057495117, "step": 3270 }, { "epoch": 0.12687729070565823, "grad_norm": 0.271484375, "learning_rate": 0.00048331377676149386, "loss": 3.6648319244384764, "step": 3280 }, { "epoch": 0.12726411171390717, "grad_norm": 0.263671875, "learning_rate": 0.00048320651127685687, "loss": 3.589703369140625, "step": 3290 }, { "epoch": 0.12765093272215614, "grad_norm": 0.2734375, "learning_rate": 0.0004830989147583931, "loss": 3.6127429962158204, "step": 3300 }, { "epoch": 0.12765093272215614, "eval_loss": 4.191071033477783, "eval_runtime": 9.955, "eval_samples_per_second": 32.848, "eval_steps_per_second": 2.109, "step": 3300 }, { "epoch": 0.1280377537304051, "grad_norm": 0.27734375, "learning_rate": 0.00048299098736748474, "loss": 3.6267929077148438, "step": 3310 }, { "epoch": 0.12842457473865407, "grad_norm": 0.298828125, "learning_rate": 0.0004828827292660102, "loss": 3.654584503173828, "step": 3320 }, { "epoch": 0.128811395746903, "grad_norm": 0.29296875, "learning_rate": 0.0004827741406163438, "loss": 3.642983245849609, "step": 3330 }, { "epoch": 0.12919821675515197, "grad_norm": 0.30859375, "learning_rate": 0.00048266522158135587, "loss": 3.6135555267333985, "step": 3340 }, { "epoch": 0.12958503776340094, "grad_norm": 0.283203125, "learning_rate": 0.00048255597232441214, "loss": 3.655533218383789, "step": 3350 }, { "epoch": 0.12997185877164988, "grad_norm": 0.26171875, "learning_rate": 0.00048244639300937356, "loss": 3.620559310913086, "step": 3360 }, { "epoch": 0.13035867977989885, "grad_norm": 0.2578125, "learning_rate": 0.0004823364838005963, "loss": 3.651724624633789, "step": 3370 }, { "epoch": 0.1307455007881478, "grad_norm": 0.283203125, "learning_rate": 0.0004822262448629312, "loss": 3.620151901245117, "step": 3380 }, { "epoch": 0.13113232179639675, "grad_norm": 0.279296875, "learning_rate": 0.0004821156763617238, "loss": 3.657820129394531, "step": 3390 }, { "epoch": 0.13151914280464572, "grad_norm": 0.275390625, "learning_rate": 0.0004820047784628138, "loss": 3.6077507019042967, "step": 3400 }, { "epoch": 0.13151914280464572, "eval_loss": 4.1888580322265625, "eval_runtime": 9.9816, "eval_samples_per_second": 32.76, "eval_steps_per_second": 2.104, "step": 3400 }, { "epoch": 0.13190596381289468, "grad_norm": 0.265625, "learning_rate": 0.000481893551332535, "loss": 3.6212406158447266, "step": 3410 }, { "epoch": 0.13229278482114365, "grad_norm": 0.2734375, "learning_rate": 0.0004817819951377151, "loss": 3.6335296630859375, "step": 3420 }, { "epoch": 0.1326796058293926, "grad_norm": 0.287109375, "learning_rate": 0.0004816701100456752, "loss": 3.587704086303711, "step": 3430 }, { "epoch": 0.13306642683764155, "grad_norm": 0.275390625, "learning_rate": 0.00048155789622422984, "loss": 3.6036140441894533, "step": 3440 }, { "epoch": 0.13345324784589052, "grad_norm": 0.314453125, "learning_rate": 0.00048144535384168647, "loss": 3.5965343475341798, "step": 3450 }, { "epoch": 0.13384006885413946, "grad_norm": 0.298828125, "learning_rate": 0.0004813324830668456, "loss": 3.6275421142578126, "step": 3460 }, { "epoch": 0.13422688986238843, "grad_norm": 0.25390625, "learning_rate": 0.00048121928406899995, "loss": 3.646040344238281, "step": 3470 }, { "epoch": 0.1346137108706374, "grad_norm": 0.259765625, "learning_rate": 0.00048110575701793484, "loss": 3.568130111694336, "step": 3480 }, { "epoch": 0.13500053187888633, "grad_norm": 0.287109375, "learning_rate": 0.0004809919020839274, "loss": 3.634757232666016, "step": 3490 }, { "epoch": 0.1353873528871353, "grad_norm": 0.27734375, "learning_rate": 0.0004808777194377468, "loss": 3.6164390563964846, "step": 3500 }, { "epoch": 0.1353873528871353, "eval_loss": 4.202503204345703, "eval_runtime": 9.9788, "eval_samples_per_second": 32.77, "eval_steps_per_second": 2.104, "step": 3500 }, { "epoch": 0.13577417389538426, "grad_norm": 0.26171875, "learning_rate": 0.00048076320925065336, "loss": 3.591604995727539, "step": 3510 }, { "epoch": 0.1361609949036332, "grad_norm": 0.251953125, "learning_rate": 0.00048064837169439913, "loss": 3.6058467864990233, "step": 3520 }, { "epoch": 0.13654781591188217, "grad_norm": 0.259765625, "learning_rate": 0.00048053320694122685, "loss": 3.5918128967285154, "step": 3530 }, { "epoch": 0.13693463692013114, "grad_norm": 0.28125, "learning_rate": 0.0004804177151638701, "loss": 3.591669464111328, "step": 3540 }, { "epoch": 0.1373214579283801, "grad_norm": 0.2578125, "learning_rate": 0.000480301896535553, "loss": 3.610728073120117, "step": 3550 }, { "epoch": 0.13770827893662904, "grad_norm": 0.271484375, "learning_rate": 0.00048018575122998983, "loss": 3.5977199554443358, "step": 3560 }, { "epoch": 0.138095099944878, "grad_norm": 0.294921875, "learning_rate": 0.000480069279421385, "loss": 3.6169082641601564, "step": 3570 }, { "epoch": 0.13848192095312697, "grad_norm": 0.283203125, "learning_rate": 0.00047995248128443246, "loss": 3.602222442626953, "step": 3580 }, { "epoch": 0.1388687419613759, "grad_norm": 0.259765625, "learning_rate": 0.00047983535699431564, "loss": 3.6134090423583984, "step": 3590 }, { "epoch": 0.13925556296962488, "grad_norm": 0.27734375, "learning_rate": 0.0004797179067267073, "loss": 3.630051040649414, "step": 3600 }, { "epoch": 0.13925556296962488, "eval_loss": 4.196789741516113, "eval_runtime": 9.999, "eval_samples_per_second": 32.703, "eval_steps_per_second": 2.1, "step": 3600 }, { "epoch": 0.13964238397787385, "grad_norm": 0.26953125, "learning_rate": 0.0004796001306577691, "loss": 3.5645401000976564, "step": 3610 }, { "epoch": 0.14002920498612278, "grad_norm": 0.26171875, "learning_rate": 0.00047948202896415105, "loss": 3.6082618713378904, "step": 3620 }, { "epoch": 0.14041602599437175, "grad_norm": 0.259765625, "learning_rate": 0.00047936360182299206, "loss": 3.6071346282958983, "step": 3630 }, { "epoch": 0.14080284700262072, "grad_norm": 0.27734375, "learning_rate": 0.0004792448494119189, "loss": 3.5989688873291015, "step": 3640 }, { "epoch": 0.14118966801086966, "grad_norm": 0.26171875, "learning_rate": 0.000479125771909046, "loss": 3.560350799560547, "step": 3650 }, { "epoch": 0.14157648901911862, "grad_norm": 0.275390625, "learning_rate": 0.00047900636949297585, "loss": 3.6439186096191407, "step": 3660 }, { "epoch": 0.1419633100273676, "grad_norm": 0.265625, "learning_rate": 0.00047888664234279797, "loss": 3.6126590728759767, "step": 3670 }, { "epoch": 0.14235013103561656, "grad_norm": 0.291015625, "learning_rate": 0.000478766590638089, "loss": 3.6033699035644533, "step": 3680 }, { "epoch": 0.1427369520438655, "grad_norm": 0.248046875, "learning_rate": 0.0004786462145589124, "loss": 3.6775360107421875, "step": 3690 }, { "epoch": 0.14312377305211446, "grad_norm": 0.2734375, "learning_rate": 0.00047852551428581813, "loss": 3.6169353485107423, "step": 3700 }, { "epoch": 0.14312377305211446, "eval_loss": 4.196775436401367, "eval_runtime": 9.9813, "eval_samples_per_second": 32.761, "eval_steps_per_second": 2.104, "step": 3700 }, { "epoch": 0.14351059406036343, "grad_norm": 0.28125, "learning_rate": 0.0004784044899998425, "loss": 3.5898075103759766, "step": 3710 }, { "epoch": 0.14389741506861237, "grad_norm": 0.263671875, "learning_rate": 0.00047828314188250756, "loss": 3.6066890716552735, "step": 3720 }, { "epoch": 0.14428423607686133, "grad_norm": 0.255859375, "learning_rate": 0.0004781614701158213, "loss": 3.596193313598633, "step": 3730 }, { "epoch": 0.1446710570851103, "grad_norm": 0.27734375, "learning_rate": 0.00047803947488227704, "loss": 3.559587860107422, "step": 3740 }, { "epoch": 0.14505787809335924, "grad_norm": 0.267578125, "learning_rate": 0.00047791715636485337, "loss": 3.5958782196044923, "step": 3750 }, { "epoch": 0.1454446991016082, "grad_norm": 0.24609375, "learning_rate": 0.0004777945147470137, "loss": 3.5777961730957033, "step": 3760 }, { "epoch": 0.14583152010985717, "grad_norm": 0.326171875, "learning_rate": 0.0004776715502127058, "loss": 3.5617481231689454, "step": 3770 }, { "epoch": 0.14621834111810614, "grad_norm": 0.25, "learning_rate": 0.0004775482629463624, "loss": 3.5838111877441405, "step": 3780 }, { "epoch": 0.14660516212635508, "grad_norm": 0.265625, "learning_rate": 0.00047742465313289955, "loss": 3.590658950805664, "step": 3790 }, { "epoch": 0.14699198313460404, "grad_norm": 0.25390625, "learning_rate": 0.00047730072095771773, "loss": 3.6110076904296875, "step": 3800 }, { "epoch": 0.14699198313460404, "eval_loss": 4.168724060058594, "eval_runtime": 9.992, "eval_samples_per_second": 32.726, "eval_steps_per_second": 2.102, "step": 3800 }, { "epoch": 0.147378804142853, "grad_norm": 0.296875, "learning_rate": 0.0004771764666067005, "loss": 3.5836368560791017, "step": 3810 }, { "epoch": 0.14776562515110195, "grad_norm": 0.283203125, "learning_rate": 0.00047705189026621474, "loss": 3.5947208404541016, "step": 3820 }, { "epoch": 0.14815244615935091, "grad_norm": 0.28515625, "learning_rate": 0.0004769269921231104, "loss": 3.5821369171142576, "step": 3830 }, { "epoch": 0.14853926716759988, "grad_norm": 0.267578125, "learning_rate": 0.00047680177236472004, "loss": 3.5839427947998046, "step": 3840 }, { "epoch": 0.14892608817584882, "grad_norm": 0.265625, "learning_rate": 0.0004766762311788585, "loss": 3.555724334716797, "step": 3850 }, { "epoch": 0.1493129091840978, "grad_norm": 0.27734375, "learning_rate": 0.0004765503687538228, "loss": 3.597983551025391, "step": 3860 }, { "epoch": 0.14969973019234675, "grad_norm": 0.26171875, "learning_rate": 0.00047642418527839184, "loss": 3.621683120727539, "step": 3870 }, { "epoch": 0.1500865512005957, "grad_norm": 0.28515625, "learning_rate": 0.0004762976809418259, "loss": 3.5982799530029297, "step": 3880 }, { "epoch": 0.15047337220884466, "grad_norm": 0.255859375, "learning_rate": 0.0004761708559338668, "loss": 3.5660633087158202, "step": 3890 }, { "epoch": 0.15086019321709362, "grad_norm": 0.279296875, "learning_rate": 0.000476043710444737, "loss": 3.6209995269775392, "step": 3900 }, { "epoch": 0.15086019321709362, "eval_loss": 4.184715747833252, "eval_runtime": 10.0083, "eval_samples_per_second": 32.673, "eval_steps_per_second": 2.098, "step": 3900 }, { "epoch": 0.1512470142253426, "grad_norm": 0.255859375, "learning_rate": 0.0004759162446651398, "loss": 3.6069480895996096, "step": 3910 }, { "epoch": 0.15163383523359153, "grad_norm": 0.26171875, "learning_rate": 0.00047578845878625903, "loss": 3.5772022247314452, "step": 3920 }, { "epoch": 0.1520206562418405, "grad_norm": 0.26171875, "learning_rate": 0.00047566035299975826, "loss": 3.5811866760253905, "step": 3930 }, { "epoch": 0.15240747725008946, "grad_norm": 0.2470703125, "learning_rate": 0.0004755319274977812, "loss": 3.6295467376708985, "step": 3940 }, { "epoch": 0.1527942982583384, "grad_norm": 0.244140625, "learning_rate": 0.00047540318247295125, "loss": 3.5914112091064454, "step": 3950 }, { "epoch": 0.15318111926658737, "grad_norm": 0.287109375, "learning_rate": 0.0004752741181183704, "loss": 3.5724857330322264, "step": 3960 }, { "epoch": 0.15356794027483633, "grad_norm": 0.2734375, "learning_rate": 0.00047514473462762034, "loss": 3.592438507080078, "step": 3970 }, { "epoch": 0.15395476128308527, "grad_norm": 0.26953125, "learning_rate": 0.0004750150321947609, "loss": 3.5568592071533205, "step": 3980 }, { "epoch": 0.15434158229133424, "grad_norm": 0.255859375, "learning_rate": 0.00047488501101433065, "loss": 3.589873123168945, "step": 3990 }, { "epoch": 0.1547284032995832, "grad_norm": 0.2470703125, "learning_rate": 0.00047475467128134586, "loss": 3.5943378448486327, "step": 4000 }, { "epoch": 0.1547284032995832, "eval_loss": 4.1639275550842285, "eval_runtime": 10.0126, "eval_samples_per_second": 32.659, "eval_steps_per_second": 2.097, "step": 4000 }, { "epoch": 0.15511522430783214, "grad_norm": 0.291015625, "learning_rate": 0.0004746240131913011, "loss": 3.5330867767333984, "step": 4010 }, { "epoch": 0.1555020453160811, "grad_norm": 0.26171875, "learning_rate": 0.0004744930369401679, "loss": 3.5745521545410157, "step": 4020 }, { "epoch": 0.15588886632433008, "grad_norm": 0.26171875, "learning_rate": 0.00047436174272439535, "loss": 3.5994407653808596, "step": 4030 }, { "epoch": 0.15627568733257904, "grad_norm": 0.283203125, "learning_rate": 0.00047423013074090933, "loss": 3.5939708709716798, "step": 4040 }, { "epoch": 0.15666250834082798, "grad_norm": 0.2421875, "learning_rate": 0.0004740982011871123, "loss": 3.5709758758544923, "step": 4050 }, { "epoch": 0.15704932934907695, "grad_norm": 0.259765625, "learning_rate": 0.00047396595426088317, "loss": 3.596474456787109, "step": 4060 }, { "epoch": 0.15743615035732592, "grad_norm": 0.263671875, "learning_rate": 0.00047383339016057675, "loss": 3.6182701110839846, "step": 4070 }, { "epoch": 0.15782297136557485, "grad_norm": 0.279296875, "learning_rate": 0.00047370050908502367, "loss": 3.5875564575195313, "step": 4080 }, { "epoch": 0.15820979237382382, "grad_norm": 0.27734375, "learning_rate": 0.0004735673112335297, "loss": 3.5575897216796877, "step": 4090 }, { "epoch": 0.1585966133820728, "grad_norm": 0.29296875, "learning_rate": 0.0004734337968058762, "loss": 3.5939361572265627, "step": 4100 }, { "epoch": 0.1585966133820728, "eval_loss": 4.146914958953857, "eval_runtime": 10.0531, "eval_samples_per_second": 32.527, "eval_steps_per_second": 2.089, "step": 4100 }, { "epoch": 0.15898343439032173, "grad_norm": 0.265625, "learning_rate": 0.00047329996600231904, "loss": 3.564817428588867, "step": 4110 }, { "epoch": 0.1593702553985707, "grad_norm": 0.2578125, "learning_rate": 0.00047316581902358875, "loss": 3.6007923126220702, "step": 4120 }, { "epoch": 0.15975707640681966, "grad_norm": 0.275390625, "learning_rate": 0.00047303135607088995, "loss": 3.6004383087158205, "step": 4130 }, { "epoch": 0.16014389741506863, "grad_norm": 0.28515625, "learning_rate": 0.0004728965773459013, "loss": 3.631551742553711, "step": 4140 }, { "epoch": 0.16053071842331756, "grad_norm": 0.271484375, "learning_rate": 0.0004727614830507749, "loss": 3.5560813903808595, "step": 4150 }, { "epoch": 0.16091753943156653, "grad_norm": 0.275390625, "learning_rate": 0.00047262607338813663, "loss": 3.601303482055664, "step": 4160 }, { "epoch": 0.1613043604398155, "grad_norm": 0.275390625, "learning_rate": 0.0004724903485610848, "loss": 3.589255523681641, "step": 4170 }, { "epoch": 0.16169118144806444, "grad_norm": 0.2578125, "learning_rate": 0.00047235430877319085, "loss": 3.5800621032714846, "step": 4180 }, { "epoch": 0.1620780024563134, "grad_norm": 0.25390625, "learning_rate": 0.00047221795422849845, "loss": 3.6015853881835938, "step": 4190 }, { "epoch": 0.16246482346456237, "grad_norm": 0.27734375, "learning_rate": 0.0004720812851315233, "loss": 3.5746341705322267, "step": 4200 }, { "epoch": 0.16246482346456237, "eval_loss": 4.151747226715088, "eval_runtime": 10.061, "eval_samples_per_second": 32.502, "eval_steps_per_second": 2.087, "step": 4200 }, { "epoch": 0.1628516444728113, "grad_norm": 0.2734375, "learning_rate": 0.000471944301687253, "loss": 3.585940933227539, "step": 4210 }, { "epoch": 0.16323846548106027, "grad_norm": 0.2431640625, "learning_rate": 0.0004718070041011467, "loss": 3.5748485565185546, "step": 4220 }, { "epoch": 0.16362528648930924, "grad_norm": 0.279296875, "learning_rate": 0.0004716693925791346, "loss": 3.604657745361328, "step": 4230 }, { "epoch": 0.16401210749755818, "grad_norm": 0.271484375, "learning_rate": 0.00047153146732761776, "loss": 3.570362091064453, "step": 4240 }, { "epoch": 0.16439892850580715, "grad_norm": 0.279296875, "learning_rate": 0.00047139322855346794, "loss": 3.5857212066650392, "step": 4250 }, { "epoch": 0.1647857495140561, "grad_norm": 0.25390625, "learning_rate": 0.000471254676464027, "loss": 3.5793018341064453, "step": 4260 }, { "epoch": 0.16517257052230508, "grad_norm": 0.271484375, "learning_rate": 0.00047111581126710675, "loss": 3.617490768432617, "step": 4270 }, { "epoch": 0.16555939153055402, "grad_norm": 0.26171875, "learning_rate": 0.00047097663317098874, "loss": 3.5748958587646484, "step": 4280 }, { "epoch": 0.16594621253880298, "grad_norm": 0.251953125, "learning_rate": 0.0004708371423844237, "loss": 3.5808582305908203, "step": 4290 }, { "epoch": 0.16633303354705195, "grad_norm": 0.271484375, "learning_rate": 0.0004706973391166315, "loss": 3.565126419067383, "step": 4300 }, { "epoch": 0.16633303354705195, "eval_loss": 4.144286155700684, "eval_runtime": 10.0708, "eval_samples_per_second": 32.47, "eval_steps_per_second": 2.085, "step": 4300 }, { "epoch": 0.1667198545553009, "grad_norm": 0.2431640625, "learning_rate": 0.00047055722357730053, "loss": 3.601681137084961, "step": 4310 }, { "epoch": 0.16710667556354986, "grad_norm": 0.26171875, "learning_rate": 0.00047041679597658773, "loss": 3.619378662109375, "step": 4320 }, { "epoch": 0.16749349657179882, "grad_norm": 0.267578125, "learning_rate": 0.0004702760565251178, "loss": 3.5644298553466798, "step": 4330 }, { "epoch": 0.16788031758004776, "grad_norm": 0.279296875, "learning_rate": 0.0004701350054339835, "loss": 3.5358177185058595, "step": 4340 }, { "epoch": 0.16826713858829673, "grad_norm": 0.283203125, "learning_rate": 0.00046999364291474486, "loss": 3.5819393157958985, "step": 4350 }, { "epoch": 0.1686539595965457, "grad_norm": 0.25390625, "learning_rate": 0.00046985196917942923, "loss": 3.6105266571044923, "step": 4360 }, { "epoch": 0.16904078060479463, "grad_norm": 0.26953125, "learning_rate": 0.00046970998444053025, "loss": 3.5382503509521483, "step": 4370 }, { "epoch": 0.1694276016130436, "grad_norm": 0.2451171875, "learning_rate": 0.0004695676889110086, "loss": 3.5398067474365233, "step": 4380 }, { "epoch": 0.16981442262129257, "grad_norm": 0.263671875, "learning_rate": 0.0004694250828042906, "loss": 3.573816680908203, "step": 4390 }, { "epoch": 0.17020124362954153, "grad_norm": 0.2734375, "learning_rate": 0.0004692821663342689, "loss": 3.5996776580810548, "step": 4400 }, { "epoch": 0.17020124362954153, "eval_loss": 4.145204544067383, "eval_runtime": 10.0751, "eval_samples_per_second": 32.456, "eval_steps_per_second": 2.084, "step": 4400 }, { "epoch": 0.17058806463779047, "grad_norm": 0.291015625, "learning_rate": 0.0004691389397153013, "loss": 3.5502437591552733, "step": 4410 }, { "epoch": 0.17097488564603944, "grad_norm": 0.2734375, "learning_rate": 0.00046899540316221086, "loss": 3.591476821899414, "step": 4420 }, { "epoch": 0.1713617066542884, "grad_norm": 0.271484375, "learning_rate": 0.0004688515568902855, "loss": 3.563010406494141, "step": 4430 }, { "epoch": 0.17174852766253734, "grad_norm": 0.259765625, "learning_rate": 0.0004687074011152779, "loss": 3.5925624847412108, "step": 4440 }, { "epoch": 0.1721353486707863, "grad_norm": 0.265625, "learning_rate": 0.00046856293605340466, "loss": 3.576287841796875, "step": 4450 }, { "epoch": 0.17252216967903528, "grad_norm": 0.255859375, "learning_rate": 0.00046841816192134635, "loss": 3.5883880615234376, "step": 4460 }, { "epoch": 0.17290899068728421, "grad_norm": 0.27734375, "learning_rate": 0.00046827307893624725, "loss": 3.557068634033203, "step": 4470 }, { "epoch": 0.17329581169553318, "grad_norm": 0.265625, "learning_rate": 0.0004681276873157147, "loss": 3.5829254150390626, "step": 4480 }, { "epoch": 0.17368263270378215, "grad_norm": 0.25, "learning_rate": 0.00046798198727781914, "loss": 3.5822193145751955, "step": 4490 }, { "epoch": 0.1740694537120311, "grad_norm": 0.26171875, "learning_rate": 0.0004678359790410934, "loss": 3.570149230957031, "step": 4500 }, { "epoch": 0.1740694537120311, "eval_loss": 4.142066955566406, "eval_runtime": 10.0399, "eval_samples_per_second": 32.57, "eval_steps_per_second": 2.092, "step": 4500 }, { "epoch": 0.17445627472028005, "grad_norm": 0.2451171875, "learning_rate": 0.00046768966282453276, "loss": 3.5578567504882814, "step": 4510 }, { "epoch": 0.17484309572852902, "grad_norm": 0.2734375, "learning_rate": 0.00046754303884759436, "loss": 3.614657974243164, "step": 4520 }, { "epoch": 0.17522991673677799, "grad_norm": 0.2734375, "learning_rate": 0.0004673961073301968, "loss": 3.5728389739990236, "step": 4530 }, { "epoch": 0.17561673774502692, "grad_norm": 0.28125, "learning_rate": 0.0004672488684927202, "loss": 3.5710781097412108, "step": 4540 }, { "epoch": 0.1760035587532759, "grad_norm": 0.248046875, "learning_rate": 0.0004671013225560054, "loss": 3.5570396423339843, "step": 4550 }, { "epoch": 0.17639037976152486, "grad_norm": 0.25390625, "learning_rate": 0.00046695346974135414, "loss": 3.571766662597656, "step": 4560 }, { "epoch": 0.1767772007697738, "grad_norm": 0.25390625, "learning_rate": 0.0004668053102705281, "loss": 3.5966800689697265, "step": 4570 }, { "epoch": 0.17716402177802276, "grad_norm": 0.283203125, "learning_rate": 0.0004666568443657492, "loss": 3.5605045318603517, "step": 4580 }, { "epoch": 0.17755084278627173, "grad_norm": 0.275390625, "learning_rate": 0.0004665080722496988, "loss": 3.546836090087891, "step": 4590 }, { "epoch": 0.17793766379452067, "grad_norm": 0.275390625, "learning_rate": 0.0004663589941455176, "loss": 3.5560222625732423, "step": 4600 }, { "epoch": 0.17793766379452067, "eval_loss": 4.123315811157227, "eval_runtime": 10.0373, "eval_samples_per_second": 32.579, "eval_steps_per_second": 2.092, "step": 4600 }, { "epoch": 0.17832448480276963, "grad_norm": 0.263671875, "learning_rate": 0.0004662096102768052, "loss": 3.5690940856933593, "step": 4610 }, { "epoch": 0.1787113058110186, "grad_norm": 0.26171875, "learning_rate": 0.0004660599208676198, "loss": 3.566990280151367, "step": 4620 }, { "epoch": 0.17909812681926757, "grad_norm": 0.267578125, "learning_rate": 0.000465909926142478, "loss": 3.563935089111328, "step": 4630 }, { "epoch": 0.1794849478275165, "grad_norm": 0.27734375, "learning_rate": 0.0004657596263263542, "loss": 3.535744857788086, "step": 4640 }, { "epoch": 0.17987176883576547, "grad_norm": 0.265625, "learning_rate": 0.00046560902164468053, "loss": 3.558307647705078, "step": 4650 }, { "epoch": 0.18025858984401444, "grad_norm": 0.267578125, "learning_rate": 0.0004654581123233464, "loss": 3.5660072326660157, "step": 4660 }, { "epoch": 0.18064541085226338, "grad_norm": 0.263671875, "learning_rate": 0.0004653068985886977, "loss": 3.5773242950439452, "step": 4670 }, { "epoch": 0.18103223186051234, "grad_norm": 0.259765625, "learning_rate": 0.00046515538066753767, "loss": 3.5603591918945314, "step": 4680 }, { "epoch": 0.1814190528687613, "grad_norm": 0.251953125, "learning_rate": 0.0004650035587871252, "loss": 3.5422637939453123, "step": 4690 }, { "epoch": 0.18180587387701025, "grad_norm": 0.283203125, "learning_rate": 0.00046485143317517516, "loss": 3.5612777709960937, "step": 4700 }, { "epoch": 0.18180587387701025, "eval_loss": 4.127031326293945, "eval_runtime": 10.0536, "eval_samples_per_second": 32.526, "eval_steps_per_second": 2.089, "step": 4700 }, { "epoch": 0.18219269488525922, "grad_norm": 0.259765625, "learning_rate": 0.0004646990040598583, "loss": 3.562766265869141, "step": 4710 }, { "epoch": 0.18257951589350818, "grad_norm": 0.255859375, "learning_rate": 0.00046454627166980024, "loss": 3.5492530822753907, "step": 4720 }, { "epoch": 0.18296633690175712, "grad_norm": 0.25, "learning_rate": 0.0004643932362340817, "loss": 3.55328254699707, "step": 4730 }, { "epoch": 0.1833531579100061, "grad_norm": 0.279296875, "learning_rate": 0.0004642398979822377, "loss": 3.553334426879883, "step": 4740 }, { "epoch": 0.18373997891825505, "grad_norm": 0.267578125, "learning_rate": 0.0004640862571442578, "loss": 3.556576156616211, "step": 4750 }, { "epoch": 0.18412679992650402, "grad_norm": 0.2470703125, "learning_rate": 0.00046393231395058505, "loss": 3.5628944396972657, "step": 4760 }, { "epoch": 0.18451362093475296, "grad_norm": 0.2578125, "learning_rate": 0.0004637780686321162, "loss": 3.5898536682128905, "step": 4770 }, { "epoch": 0.18490044194300193, "grad_norm": 0.25, "learning_rate": 0.00046362352142020105, "loss": 3.578490447998047, "step": 4780 }, { "epoch": 0.1852872629512509, "grad_norm": 0.279296875, "learning_rate": 0.0004634686725466424, "loss": 3.546381378173828, "step": 4790 }, { "epoch": 0.18567408395949983, "grad_norm": 0.265625, "learning_rate": 0.0004633135222436951, "loss": 3.5513580322265623, "step": 4800 }, { "epoch": 0.18567408395949983, "eval_loss": 4.12771463394165, "eval_runtime": 10.0643, "eval_samples_per_second": 32.491, "eval_steps_per_second": 2.087, "step": 4800 }, { "epoch": 0.1860609049677488, "grad_norm": 0.2470703125, "learning_rate": 0.0004631580707440666, "loss": 3.5534221649169924, "step": 4810 }, { "epoch": 0.18644772597599776, "grad_norm": 0.26171875, "learning_rate": 0.00046300231828091585, "loss": 3.5446445465087892, "step": 4820 }, { "epoch": 0.1868345469842467, "grad_norm": 0.248046875, "learning_rate": 0.00046284626508785314, "loss": 3.5525463104248045, "step": 4830 }, { "epoch": 0.18722136799249567, "grad_norm": 0.2734375, "learning_rate": 0.00046268991139893995, "loss": 3.5511096954345702, "step": 4840 }, { "epoch": 0.18760818900074464, "grad_norm": 0.2578125, "learning_rate": 0.0004625332574486885, "loss": 3.5215126037597657, "step": 4850 }, { "epoch": 0.1879950100089936, "grad_norm": 0.259765625, "learning_rate": 0.0004623763034720613, "loss": 3.546421432495117, "step": 4860 }, { "epoch": 0.18838183101724254, "grad_norm": 0.25, "learning_rate": 0.0004622190497044707, "loss": 3.551416778564453, "step": 4870 }, { "epoch": 0.1887686520254915, "grad_norm": 0.259765625, "learning_rate": 0.0004620614963817791, "loss": 3.605236053466797, "step": 4880 }, { "epoch": 0.18915547303374047, "grad_norm": 0.2578125, "learning_rate": 0.00046190364374029783, "loss": 3.5282737731933596, "step": 4890 }, { "epoch": 0.1895422940419894, "grad_norm": 0.25, "learning_rate": 0.00046174549201678734, "loss": 3.544286346435547, "step": 4900 }, { "epoch": 0.1895422940419894, "eval_loss": 4.114104270935059, "eval_runtime": 9.9575, "eval_samples_per_second": 32.84, "eval_steps_per_second": 2.109, "step": 4900 }, { "epoch": 0.18992911505023838, "grad_norm": 0.283203125, "learning_rate": 0.00046158704144845666, "loss": 3.5649555206298826, "step": 4910 }, { "epoch": 0.19031593605848734, "grad_norm": 0.287109375, "learning_rate": 0.00046142829227296294, "loss": 3.5907196044921874, "step": 4920 }, { "epoch": 0.19070275706673628, "grad_norm": 0.2734375, "learning_rate": 0.0004612692447284113, "loss": 3.5507247924804686, "step": 4930 }, { "epoch": 0.19108957807498525, "grad_norm": 0.244140625, "learning_rate": 0.00046110989905335435, "loss": 3.5793888092041017, "step": 4940 }, { "epoch": 0.19147639908323422, "grad_norm": 0.25, "learning_rate": 0.000460950255486792, "loss": 3.5635608673095702, "step": 4950 }, { "epoch": 0.19186322009148316, "grad_norm": 0.275390625, "learning_rate": 0.00046079031426817077, "loss": 3.5769954681396485, "step": 4960 }, { "epoch": 0.19225004109973212, "grad_norm": 0.25, "learning_rate": 0.0004606300756373836, "loss": 3.543282699584961, "step": 4970 }, { "epoch": 0.1926368621079811, "grad_norm": 0.263671875, "learning_rate": 0.00046046953983476963, "loss": 3.534237289428711, "step": 4980 }, { "epoch": 0.19302368311623005, "grad_norm": 0.2578125, "learning_rate": 0.00046030870710111387, "loss": 3.5499801635742188, "step": 4990 }, { "epoch": 0.193410504124479, "grad_norm": 0.27734375, "learning_rate": 0.0004601475776776463, "loss": 3.551239013671875, "step": 5000 }, { "epoch": 0.193410504124479, "eval_loss": 4.095266342163086, "eval_runtime": 10.0836, "eval_samples_per_second": 32.429, "eval_steps_per_second": 2.083, "step": 5000 }, { "epoch": 0.19379732513272796, "grad_norm": 0.283203125, "learning_rate": 0.0004599861518060422, "loss": 3.5352596282958983, "step": 5010 }, { "epoch": 0.19418414614097693, "grad_norm": 0.2734375, "learning_rate": 0.0004598244297284214, "loss": 3.5772289276123046, "step": 5020 }, { "epoch": 0.19457096714922587, "grad_norm": 0.267578125, "learning_rate": 0.00045966241168734806, "loss": 3.574796676635742, "step": 5030 }, { "epoch": 0.19495778815747483, "grad_norm": 0.25, "learning_rate": 0.00045950009792583015, "loss": 3.5158466339111327, "step": 5040 }, { "epoch": 0.1953446091657238, "grad_norm": 0.2392578125, "learning_rate": 0.00045933748868731916, "loss": 3.533673858642578, "step": 5050 }, { "epoch": 0.19573143017397274, "grad_norm": 0.24609375, "learning_rate": 0.00045917458421571, "loss": 3.5585952758789063, "step": 5060 }, { "epoch": 0.1961182511822217, "grad_norm": 0.28515625, "learning_rate": 0.0004590113847553402, "loss": 3.532826232910156, "step": 5070 }, { "epoch": 0.19650507219047067, "grad_norm": 0.27734375, "learning_rate": 0.00045884789055098963, "loss": 3.566379928588867, "step": 5080 }, { "epoch": 0.1968918931987196, "grad_norm": 0.259765625, "learning_rate": 0.00045868410184788045, "loss": 3.5672889709472657, "step": 5090 }, { "epoch": 0.19727871420696858, "grad_norm": 0.28125, "learning_rate": 0.00045852001889167655, "loss": 3.5408248901367188, "step": 5100 }, { "epoch": 0.19727871420696858, "eval_loss": 4.099873065948486, "eval_runtime": 10.0832, "eval_samples_per_second": 32.43, "eval_steps_per_second": 2.083, "step": 5100 }, { "epoch": 0.19766553521521754, "grad_norm": 0.2734375, "learning_rate": 0.00045835564192848294, "loss": 3.5583164215087892, "step": 5110 }, { "epoch": 0.1980523562234665, "grad_norm": 0.267578125, "learning_rate": 0.00045819097120484585, "loss": 3.556626892089844, "step": 5120 }, { "epoch": 0.19843917723171545, "grad_norm": 0.2578125, "learning_rate": 0.00045802600696775195, "loss": 3.545968246459961, "step": 5130 }, { "epoch": 0.1988259982399644, "grad_norm": 0.25, "learning_rate": 0.0004578607494646283, "loss": 3.536521148681641, "step": 5140 }, { "epoch": 0.19921281924821338, "grad_norm": 0.255859375, "learning_rate": 0.00045769519894334166, "loss": 3.571156692504883, "step": 5150 }, { "epoch": 0.19959964025646232, "grad_norm": 0.263671875, "learning_rate": 0.00045752935565219826, "loss": 3.5418251037597654, "step": 5160 }, { "epoch": 0.19998646126471128, "grad_norm": 0.265625, "learning_rate": 0.0004573632198399437, "loss": 3.5485843658447265, "step": 5170 }, { "epoch": 0.20037328227296025, "grad_norm": 0.2490234375, "learning_rate": 0.0004571967917557621, "loss": 3.5757156372070313, "step": 5180 }, { "epoch": 0.2007601032812092, "grad_norm": 0.25390625, "learning_rate": 0.00045703007164927606, "loss": 3.5134517669677736, "step": 5190 }, { "epoch": 0.20114692428945816, "grad_norm": 0.26171875, "learning_rate": 0.00045686305977054616, "loss": 3.5113853454589843, "step": 5200 }, { "epoch": 0.20114692428945816, "eval_loss": 4.089205741882324, "eval_runtime": 10.0508, "eval_samples_per_second": 32.535, "eval_steps_per_second": 2.089, "step": 5200 }, { "epoch": 0.20153374529770712, "grad_norm": 0.2490234375, "learning_rate": 0.00045669575637007054, "loss": 3.5599761962890626, "step": 5210 }, { "epoch": 0.2019205663059561, "grad_norm": 0.265625, "learning_rate": 0.00045652816169878467, "loss": 3.5213069915771484, "step": 5220 }, { "epoch": 0.20230738731420503, "grad_norm": 0.2470703125, "learning_rate": 0.0004563602760080608, "loss": 3.510356140136719, "step": 5230 }, { "epoch": 0.202694208322454, "grad_norm": 0.25, "learning_rate": 0.0004561920995497078, "loss": 3.5470203399658202, "step": 5240 }, { "epoch": 0.20308102933070296, "grad_norm": 0.255859375, "learning_rate": 0.0004560236325759705, "loss": 3.5547637939453125, "step": 5250 }, { "epoch": 0.2034678503389519, "grad_norm": 0.25390625, "learning_rate": 0.00045585487533952976, "loss": 3.5266292572021483, "step": 5260 }, { "epoch": 0.20385467134720087, "grad_norm": 0.27734375, "learning_rate": 0.0004556858280935013, "loss": 3.5063777923583985, "step": 5270 }, { "epoch": 0.20424149235544983, "grad_norm": 0.265625, "learning_rate": 0.00045551649109143644, "loss": 3.5121044158935546, "step": 5280 }, { "epoch": 0.20462831336369877, "grad_norm": 0.29296875, "learning_rate": 0.00045534686458732055, "loss": 3.539692687988281, "step": 5290 }, { "epoch": 0.20501513437194774, "grad_norm": 0.26953125, "learning_rate": 0.0004551769488355736, "loss": 3.555554962158203, "step": 5300 }, { "epoch": 0.20501513437194774, "eval_loss": 4.082935333251953, "eval_runtime": 10.0668, "eval_samples_per_second": 32.483, "eval_steps_per_second": 2.086, "step": 5300 }, { "epoch": 0.2054019553801967, "grad_norm": 0.275390625, "learning_rate": 0.00045500674409104907, "loss": 3.5431640625, "step": 5310 }, { "epoch": 0.20578877638844564, "grad_norm": 0.259765625, "learning_rate": 0.0004548362506090342, "loss": 3.528326416015625, "step": 5320 }, { "epoch": 0.2061755973966946, "grad_norm": 0.283203125, "learning_rate": 0.0004546654686452493, "loss": 3.5564811706542967, "step": 5330 }, { "epoch": 0.20656241840494358, "grad_norm": 0.25390625, "learning_rate": 0.00045449439845584693, "loss": 3.5544174194335936, "step": 5340 }, { "epoch": 0.20694923941319254, "grad_norm": 0.267578125, "learning_rate": 0.00045432304029741245, "loss": 3.493732452392578, "step": 5350 }, { "epoch": 0.20733606042144148, "grad_norm": 0.25, "learning_rate": 0.00045415139442696296, "loss": 3.5211856842041014, "step": 5360 }, { "epoch": 0.20772288142969045, "grad_norm": 0.26953125, "learning_rate": 0.0004539794611019471, "loss": 3.521197509765625, "step": 5370 }, { "epoch": 0.20810970243793941, "grad_norm": 0.2470703125, "learning_rate": 0.00045380724058024466, "loss": 3.5391448974609374, "step": 5380 }, { "epoch": 0.20849652344618835, "grad_norm": 0.3046875, "learning_rate": 0.0004536347331201661, "loss": 3.550646209716797, "step": 5390 }, { "epoch": 0.20888334445443732, "grad_norm": 0.25, "learning_rate": 0.00045346193898045237, "loss": 3.5525577545166014, "step": 5400 }, { "epoch": 0.20888334445443732, "eval_loss": 4.085052490234375, "eval_runtime": 10.0705, "eval_samples_per_second": 32.471, "eval_steps_per_second": 2.085, "step": 5400 }, { "epoch": 0.2092701654626863, "grad_norm": 0.26171875, "learning_rate": 0.0004532888584202743, "loss": 3.520841598510742, "step": 5410 }, { "epoch": 0.20965698647093522, "grad_norm": 0.291015625, "learning_rate": 0.0004531154916992326, "loss": 3.5018367767333984, "step": 5420 }, { "epoch": 0.2100438074791842, "grad_norm": 0.265625, "learning_rate": 0.00045294183907735675, "loss": 3.531473922729492, "step": 5430 }, { "epoch": 0.21043062848743316, "grad_norm": 0.267578125, "learning_rate": 0.0004527679008151054, "loss": 3.554092788696289, "step": 5440 }, { "epoch": 0.21081744949568212, "grad_norm": 0.2470703125, "learning_rate": 0.00045259367717336545, "loss": 3.5328224182128904, "step": 5450 }, { "epoch": 0.21120427050393106, "grad_norm": 0.255859375, "learning_rate": 0.00045241916841345193, "loss": 3.5440658569335937, "step": 5460 }, { "epoch": 0.21159109151218003, "grad_norm": 0.251953125, "learning_rate": 0.00045224437479710744, "loss": 3.5399906158447267, "step": 5470 }, { "epoch": 0.211977912520429, "grad_norm": 0.25390625, "learning_rate": 0.00045206929658650187, "loss": 3.533125305175781, "step": 5480 }, { "epoch": 0.21236473352867793, "grad_norm": 0.2451171875, "learning_rate": 0.00045189393404423197, "loss": 3.531673812866211, "step": 5490 }, { "epoch": 0.2127515545369269, "grad_norm": 0.287109375, "learning_rate": 0.00045171828743332084, "loss": 3.516398620605469, "step": 5500 }, { "epoch": 0.2127515545369269, "eval_loss": 4.070333957672119, "eval_runtime": 10.0591, "eval_samples_per_second": 32.508, "eval_steps_per_second": 2.088, "step": 5500 }, { "epoch": 0.21313837554517587, "grad_norm": 0.26953125, "learning_rate": 0.00045154235701721785, "loss": 3.5363746643066407, "step": 5510 }, { "epoch": 0.2135251965534248, "grad_norm": 0.26171875, "learning_rate": 0.00045136614305979803, "loss": 3.5801647186279295, "step": 5520 }, { "epoch": 0.21391201756167377, "grad_norm": 0.2431640625, "learning_rate": 0.00045118964582536135, "loss": 3.555461120605469, "step": 5530 }, { "epoch": 0.21429883856992274, "grad_norm": 0.259765625, "learning_rate": 0.00045101286557863317, "loss": 3.507638168334961, "step": 5540 }, { "epoch": 0.21468565957817168, "grad_norm": 0.2470703125, "learning_rate": 0.00045083580258476304, "loss": 3.5301235198974608, "step": 5550 }, { "epoch": 0.21507248058642064, "grad_norm": 0.251953125, "learning_rate": 0.0004506584571093245, "loss": 3.5175750732421873, "step": 5560 }, { "epoch": 0.2154593015946696, "grad_norm": 0.25390625, "learning_rate": 0.000450480829418315, "loss": 3.504682159423828, "step": 5570 }, { "epoch": 0.21584612260291858, "grad_norm": 0.26171875, "learning_rate": 0.00045030291977815525, "loss": 3.527938461303711, "step": 5580 }, { "epoch": 0.21623294361116752, "grad_norm": 0.267578125, "learning_rate": 0.00045012472845568877, "loss": 3.536154937744141, "step": 5590 }, { "epoch": 0.21661976461941648, "grad_norm": 0.24609375, "learning_rate": 0.00044994625571818155, "loss": 3.54614143371582, "step": 5600 }, { "epoch": 0.21661976461941648, "eval_loss": 4.063368320465088, "eval_runtime": 10.054, "eval_samples_per_second": 32.524, "eval_steps_per_second": 2.089, "step": 5600 }, { "epoch": 0.21700658562766545, "grad_norm": 0.2431640625, "learning_rate": 0.00044976750183332165, "loss": 3.5452247619628907, "step": 5610 }, { "epoch": 0.2173934066359144, "grad_norm": 0.2490234375, "learning_rate": 0.00044958846706921914, "loss": 3.5369388580322267, "step": 5620 }, { "epoch": 0.21778022764416335, "grad_norm": 0.2890625, "learning_rate": 0.00044940915169440493, "loss": 3.5290111541748046, "step": 5630 }, { "epoch": 0.21816704865241232, "grad_norm": 0.259765625, "learning_rate": 0.0004492295559778311, "loss": 3.5256011962890623, "step": 5640 }, { "epoch": 0.21855386966066126, "grad_norm": 0.263671875, "learning_rate": 0.00044904968018887, "loss": 3.537184143066406, "step": 5650 }, { "epoch": 0.21894069066891023, "grad_norm": 0.25390625, "learning_rate": 0.0004488695245973143, "loss": 3.5146228790283205, "step": 5660 }, { "epoch": 0.2193275116771592, "grad_norm": 0.287109375, "learning_rate": 0.0004486890894733762, "loss": 3.4976150512695314, "step": 5670 }, { "epoch": 0.21971433268540813, "grad_norm": 0.2392578125, "learning_rate": 0.00044850837508768706, "loss": 3.51986083984375, "step": 5680 }, { "epoch": 0.2201011536936571, "grad_norm": 0.244140625, "learning_rate": 0.0004483273817112973, "loss": 3.507583236694336, "step": 5690 }, { "epoch": 0.22048797470190606, "grad_norm": 0.28515625, "learning_rate": 0.00044814610961567566, "loss": 3.5720191955566407, "step": 5700 }, { "epoch": 0.22048797470190606, "eval_loss": 4.055907249450684, "eval_runtime": 10.0576, "eval_samples_per_second": 32.513, "eval_steps_per_second": 2.088, "step": 5700 }, { "epoch": 0.22087479571015503, "grad_norm": 0.265625, "learning_rate": 0.00044796455907270905, "loss": 3.508076477050781, "step": 5710 }, { "epoch": 0.22126161671840397, "grad_norm": 0.251953125, "learning_rate": 0.000447782730354702, "loss": 3.5065277099609373, "step": 5720 }, { "epoch": 0.22164843772665294, "grad_norm": 0.26953125, "learning_rate": 0.00044760062373437604, "loss": 3.5399009704589846, "step": 5730 }, { "epoch": 0.2220352587349019, "grad_norm": 0.2734375, "learning_rate": 0.0004474182394848698, "loss": 3.561381149291992, "step": 5740 }, { "epoch": 0.22242207974315084, "grad_norm": 0.26953125, "learning_rate": 0.00044723557787973824, "loss": 3.4996368408203127, "step": 5750 }, { "epoch": 0.2228089007513998, "grad_norm": 0.28515625, "learning_rate": 0.0004470526391929523, "loss": 3.500721740722656, "step": 5760 }, { "epoch": 0.22319572175964877, "grad_norm": 0.2578125, "learning_rate": 0.0004468694236988985, "loss": 3.485240936279297, "step": 5770 }, { "epoch": 0.2235825427678977, "grad_norm": 0.259765625, "learning_rate": 0.00044668593167237846, "loss": 3.5129344940185545, "step": 5780 }, { "epoch": 0.22396936377614668, "grad_norm": 0.26171875, "learning_rate": 0.00044650216338860873, "loss": 3.4915618896484375, "step": 5790 }, { "epoch": 0.22435618478439565, "grad_norm": 0.255859375, "learning_rate": 0.0004463181191232202, "loss": 3.551679229736328, "step": 5800 }, { "epoch": 0.22435618478439565, "eval_loss": 4.072558879852295, "eval_runtime": 10.1948, "eval_samples_per_second": 32.075, "eval_steps_per_second": 2.06, "step": 5800 }, { "epoch": 0.2247430057926446, "grad_norm": 0.2421875, "learning_rate": 0.0004461337991522574, "loss": 3.5697952270507813, "step": 5810 }, { "epoch": 0.22512982680089355, "grad_norm": 0.26171875, "learning_rate": 0.00044594920375217893, "loss": 3.513915252685547, "step": 5820 }, { "epoch": 0.22551664780914252, "grad_norm": 0.279296875, "learning_rate": 0.000445764333199856, "loss": 3.4932785034179688, "step": 5830 }, { "epoch": 0.22590346881739148, "grad_norm": 0.251953125, "learning_rate": 0.0004455791877725728, "loss": 3.512582778930664, "step": 5840 }, { "epoch": 0.22629028982564042, "grad_norm": 0.2490234375, "learning_rate": 0.0004453937677480257, "loss": 3.4789451599121093, "step": 5850 }, { "epoch": 0.2266771108338894, "grad_norm": 0.2431640625, "learning_rate": 0.0004452080734043228, "loss": 3.5080036163330077, "step": 5860 }, { "epoch": 0.22706393184213836, "grad_norm": 0.287109375, "learning_rate": 0.0004450221050199841, "loss": 3.5435367584228517, "step": 5870 }, { "epoch": 0.2274507528503873, "grad_norm": 0.255859375, "learning_rate": 0.00044483586287394, "loss": 3.5231910705566407, "step": 5880 }, { "epoch": 0.22783757385863626, "grad_norm": 0.24609375, "learning_rate": 0.0004446493472455319, "loss": 3.475141906738281, "step": 5890 }, { "epoch": 0.22822439486688523, "grad_norm": 0.263671875, "learning_rate": 0.0004444625584145114, "loss": 3.4972454071044923, "step": 5900 }, { "epoch": 0.22822439486688523, "eval_loss": 4.064547061920166, "eval_runtime": 10.2047, "eval_samples_per_second": 32.044, "eval_steps_per_second": 2.058, "step": 5900 }, { "epoch": 0.22861121587513417, "grad_norm": 0.267578125, "learning_rate": 0.0004442754966610398, "loss": 3.512071228027344, "step": 5910 }, { "epoch": 0.22899803688338313, "grad_norm": 0.25390625, "learning_rate": 0.0004440881622656878, "loss": 3.4975730895996096, "step": 5920 }, { "epoch": 0.2293848578916321, "grad_norm": 0.275390625, "learning_rate": 0.0004439005555094348, "loss": 3.477853012084961, "step": 5930 }, { "epoch": 0.22977167889988107, "grad_norm": 0.2578125, "learning_rate": 0.00044371267667366894, "loss": 3.4883792877197264, "step": 5940 }, { "epoch": 0.23015849990813, "grad_norm": 0.2451171875, "learning_rate": 0.0004435245260401865, "loss": 3.5253154754638674, "step": 5950 }, { "epoch": 0.23054532091637897, "grad_norm": 0.25390625, "learning_rate": 0.0004433361038911912, "loss": 3.518881988525391, "step": 5960 }, { "epoch": 0.23093214192462794, "grad_norm": 0.255859375, "learning_rate": 0.00044314741050929406, "loss": 3.510706329345703, "step": 5970 }, { "epoch": 0.23131896293287688, "grad_norm": 0.248046875, "learning_rate": 0.00044295844617751325, "loss": 3.5086299896240236, "step": 5980 }, { "epoch": 0.23170578394112584, "grad_norm": 0.259765625, "learning_rate": 0.00044276921117927283, "loss": 3.5073486328125, "step": 5990 }, { "epoch": 0.2320926049493748, "grad_norm": 0.259765625, "learning_rate": 0.0004425797057984031, "loss": 3.537984085083008, "step": 6000 }, { "epoch": 0.2320926049493748, "eval_loss": 4.064856052398682, "eval_runtime": 10.2355, "eval_samples_per_second": 31.947, "eval_steps_per_second": 2.052, "step": 6000 }, { "epoch": 0.23247942595762375, "grad_norm": 0.26953125, "learning_rate": 0.0004423899303191399, "loss": 3.527267074584961, "step": 6010 }, { "epoch": 0.23286624696587271, "grad_norm": 0.25390625, "learning_rate": 0.000442199885026124, "loss": 3.499089813232422, "step": 6020 }, { "epoch": 0.23325306797412168, "grad_norm": 0.25390625, "learning_rate": 0.00044200957020440126, "loss": 3.498735046386719, "step": 6030 }, { "epoch": 0.23363988898237062, "grad_norm": 0.2431640625, "learning_rate": 0.0004418189861394213, "loss": 3.5322608947753906, "step": 6040 }, { "epoch": 0.23402670999061959, "grad_norm": 0.271484375, "learning_rate": 0.0004416281331170379, "loss": 3.5282882690429687, "step": 6050 }, { "epoch": 0.23441353099886855, "grad_norm": 0.259765625, "learning_rate": 0.0004414370114235082, "loss": 3.5092117309570314, "step": 6060 }, { "epoch": 0.23480035200711752, "grad_norm": 0.279296875, "learning_rate": 0.0004412456213454923, "loss": 3.5284473419189455, "step": 6070 }, { "epoch": 0.23518717301536646, "grad_norm": 0.25, "learning_rate": 0.00044105396317005273, "loss": 3.5273303985595703, "step": 6080 }, { "epoch": 0.23557399402361542, "grad_norm": 0.263671875, "learning_rate": 0.0004408620371846543, "loss": 3.5467586517333984, "step": 6090 }, { "epoch": 0.2359608150318644, "grad_norm": 0.25, "learning_rate": 0.00044066984367716343, "loss": 3.5320247650146483, "step": 6100 }, { "epoch": 0.2359608150318644, "eval_loss": 4.048551082611084, "eval_runtime": 10.2354, "eval_samples_per_second": 31.948, "eval_steps_per_second": 2.052, "step": 6100 }, { "epoch": 0.23634763604011333, "grad_norm": 0.25, "learning_rate": 0.0004404773829358478, "loss": 3.526265335083008, "step": 6110 }, { "epoch": 0.2367344570483623, "grad_norm": 0.2431640625, "learning_rate": 0.00044028465524937574, "loss": 3.5211910247802733, "step": 6120 }, { "epoch": 0.23712127805661126, "grad_norm": 0.248046875, "learning_rate": 0.00044009166090681635, "loss": 3.4782859802246096, "step": 6130 }, { "epoch": 0.2375080990648602, "grad_norm": 0.24609375, "learning_rate": 0.0004398984001976383, "loss": 3.4879383087158202, "step": 6140 }, { "epoch": 0.23789492007310917, "grad_norm": 0.28125, "learning_rate": 0.00043970487341171016, "loss": 3.519879913330078, "step": 6150 }, { "epoch": 0.23828174108135813, "grad_norm": 0.259765625, "learning_rate": 0.0004395110808392991, "loss": 3.5101585388183594, "step": 6160 }, { "epoch": 0.2386685620896071, "grad_norm": 0.296875, "learning_rate": 0.00043931702277107127, "loss": 3.529031753540039, "step": 6170 }, { "epoch": 0.23905538309785604, "grad_norm": 0.2421875, "learning_rate": 0.00043912269949809114, "loss": 3.50939826965332, "step": 6180 }, { "epoch": 0.239442204106105, "grad_norm": 0.2578125, "learning_rate": 0.00043892811131182054, "loss": 3.4897247314453126, "step": 6190 }, { "epoch": 0.23982902511435397, "grad_norm": 0.2578125, "learning_rate": 0.000438733258504119, "loss": 3.5406448364257814, "step": 6200 }, { "epoch": 0.23982902511435397, "eval_loss": 4.047799587249756, "eval_runtime": 10.117, "eval_samples_per_second": 32.322, "eval_steps_per_second": 2.076, "step": 6200 }, { "epoch": 0.2402158461226029, "grad_norm": 0.265625, "learning_rate": 0.00043853814136724287, "loss": 3.5504226684570312, "step": 6210 }, { "epoch": 0.24060266713085188, "grad_norm": 0.265625, "learning_rate": 0.0004383427601938448, "loss": 3.514726257324219, "step": 6220 }, { "epoch": 0.24098948813910084, "grad_norm": 0.25, "learning_rate": 0.0004381471152769737, "loss": 3.538137435913086, "step": 6230 }, { "epoch": 0.24137630914734978, "grad_norm": 0.275390625, "learning_rate": 0.00043795120691007394, "loss": 3.47631950378418, "step": 6240 }, { "epoch": 0.24176313015559875, "grad_norm": 0.251953125, "learning_rate": 0.00043775503538698497, "loss": 3.522532272338867, "step": 6250 }, { "epoch": 0.24214995116384772, "grad_norm": 0.255859375, "learning_rate": 0.0004375586010019411, "loss": 3.5053829193115233, "step": 6260 }, { "epoch": 0.24253677217209665, "grad_norm": 0.259765625, "learning_rate": 0.0004373619040495707, "loss": 3.4885364532470704, "step": 6270 }, { "epoch": 0.24292359318034562, "grad_norm": 0.2421875, "learning_rate": 0.00043716494482489614, "loss": 3.55185546875, "step": 6280 }, { "epoch": 0.2433104141885946, "grad_norm": 0.27734375, "learning_rate": 0.0004369677236233332, "loss": 3.5000751495361326, "step": 6290 }, { "epoch": 0.24369723519684355, "grad_norm": 0.2734375, "learning_rate": 0.00043677024074069036, "loss": 3.5143280029296875, "step": 6300 }, { "epoch": 0.24369723519684355, "eval_loss": 4.032617568969727, "eval_runtime": 10.0951, "eval_samples_per_second": 32.392, "eval_steps_per_second": 2.08, "step": 6300 }, { "epoch": 0.2440840562050925, "grad_norm": 0.25390625, "learning_rate": 0.0004365724964731689, "loss": 3.5079113006591798, "step": 6310 }, { "epoch": 0.24447087721334146, "grad_norm": 0.26171875, "learning_rate": 0.0004363744911173619, "loss": 3.562195587158203, "step": 6320 }, { "epoch": 0.24485769822159043, "grad_norm": 0.2421875, "learning_rate": 0.0004361762249702541, "loss": 3.4940654754638674, "step": 6330 }, { "epoch": 0.24524451922983936, "grad_norm": 0.265625, "learning_rate": 0.0004359776983292213, "loss": 3.495630645751953, "step": 6340 }, { "epoch": 0.24563134023808833, "grad_norm": 0.25390625, "learning_rate": 0.00043577891149203035, "loss": 3.5518524169921877, "step": 6350 }, { "epoch": 0.2460181612463373, "grad_norm": 0.25390625, "learning_rate": 0.00043557986475683803, "loss": 3.51075439453125, "step": 6360 }, { "epoch": 0.24640498225458624, "grad_norm": 0.25390625, "learning_rate": 0.000435380558422191, "loss": 3.53402099609375, "step": 6370 }, { "epoch": 0.2467918032628352, "grad_norm": 0.283203125, "learning_rate": 0.00043518099278702546, "loss": 3.5189449310302736, "step": 6380 }, { "epoch": 0.24717862427108417, "grad_norm": 0.2392578125, "learning_rate": 0.0004349811681506663, "loss": 3.520494842529297, "step": 6390 }, { "epoch": 0.2475654452793331, "grad_norm": 0.267578125, "learning_rate": 0.0004347810848128271, "loss": 3.544877624511719, "step": 6400 }, { "epoch": 0.2475654452793331, "eval_loss": 4.026139259338379, "eval_runtime": 10.078, "eval_samples_per_second": 32.447, "eval_steps_per_second": 2.084, "step": 6400 }, { "epoch": 0.24795226628758207, "grad_norm": 0.2734375, "learning_rate": 0.0004345807430736092, "loss": 3.5174510955810545, "step": 6410 }, { "epoch": 0.24833908729583104, "grad_norm": 0.26953125, "learning_rate": 0.0004343801432335019, "loss": 3.4823192596435546, "step": 6420 }, { "epoch": 0.24872590830408, "grad_norm": 0.251953125, "learning_rate": 0.0004341792855933811, "loss": 3.5113250732421877, "step": 6430 }, { "epoch": 0.24911272931232895, "grad_norm": 0.263671875, "learning_rate": 0.00043397817045450984, "loss": 3.514263153076172, "step": 6440 }, { "epoch": 0.2494995503205779, "grad_norm": 0.2431640625, "learning_rate": 0.0004337767981185371, "loss": 3.496726226806641, "step": 6450 }, { "epoch": 0.24988637132882688, "grad_norm": 0.25390625, "learning_rate": 0.00043357516888749775, "loss": 3.512440490722656, "step": 6460 }, { "epoch": 0.25027319233707584, "grad_norm": 0.27734375, "learning_rate": 0.00043337328306381195, "loss": 3.501117706298828, "step": 6470 }, { "epoch": 0.2506600133453248, "grad_norm": 0.2734375, "learning_rate": 0.0004331711409502847, "loss": 3.460781478881836, "step": 6480 }, { "epoch": 0.2510468343535737, "grad_norm": 0.2421875, "learning_rate": 0.0004329687428501054, "loss": 3.499040222167969, "step": 6490 }, { "epoch": 0.2514336553618227, "grad_norm": 0.2412109375, "learning_rate": 0.00043276608906684744, "loss": 3.504185104370117, "step": 6500 }, { "epoch": 0.2514336553618227, "eval_loss": 4.024904727935791, "eval_runtime": 9.9985, "eval_samples_per_second": 32.705, "eval_steps_per_second": 2.1, "step": 6500 }, { "epoch": 0.25182047637007166, "grad_norm": 0.259765625, "learning_rate": 0.0004325631799044677, "loss": 3.5370899200439454, "step": 6510 }, { "epoch": 0.2522072973783206, "grad_norm": 0.26171875, "learning_rate": 0.00043236001566730585, "loss": 3.4886333465576174, "step": 6520 }, { "epoch": 0.2525941183865696, "grad_norm": 0.251953125, "learning_rate": 0.00043215659666008473, "loss": 3.4799739837646486, "step": 6530 }, { "epoch": 0.2529809393948185, "grad_norm": 0.23828125, "learning_rate": 0.00043195292318790876, "loss": 3.540454864501953, "step": 6540 }, { "epoch": 0.25336776040306747, "grad_norm": 0.26171875, "learning_rate": 0.00043174899555626414, "loss": 3.525778961181641, "step": 6550 }, { "epoch": 0.25375458141131646, "grad_norm": 0.2451171875, "learning_rate": 0.00043154481407101845, "loss": 3.524898147583008, "step": 6560 }, { "epoch": 0.2541414024195654, "grad_norm": 0.2578125, "learning_rate": 0.0004313403790384199, "loss": 3.485614776611328, "step": 6570 }, { "epoch": 0.25452822342781434, "grad_norm": 0.2373046875, "learning_rate": 0.000431135690765097, "loss": 3.520885467529297, "step": 6580 }, { "epoch": 0.25491504443606333, "grad_norm": 0.251953125, "learning_rate": 0.00043093074955805803, "loss": 3.5210807800292967, "step": 6590 }, { "epoch": 0.25530186544431227, "grad_norm": 0.2578125, "learning_rate": 0.0004307255557246909, "loss": 3.5233665466308595, "step": 6600 }, { "epoch": 0.25530186544431227, "eval_loss": 3.993399143218994, "eval_runtime": 9.9822, "eval_samples_per_second": 32.758, "eval_steps_per_second": 2.104, "step": 6600 }, { "epoch": 0.25568868645256126, "grad_norm": 0.2412109375, "learning_rate": 0.00043052010957276204, "loss": 3.497217559814453, "step": 6610 }, { "epoch": 0.2560755074608102, "grad_norm": 0.255859375, "learning_rate": 0.0004303144114104167, "loss": 3.4751991271972655, "step": 6620 }, { "epoch": 0.25646232846905914, "grad_norm": 0.267578125, "learning_rate": 0.00043010846154617775, "loss": 3.567796325683594, "step": 6630 }, { "epoch": 0.25684914947730814, "grad_norm": 0.26171875, "learning_rate": 0.000429902260288946, "loss": 3.522159957885742, "step": 6640 }, { "epoch": 0.2572359704855571, "grad_norm": 0.25390625, "learning_rate": 0.000429695807947999, "loss": 3.5400524139404297, "step": 6650 }, { "epoch": 0.257622791493806, "grad_norm": 0.251953125, "learning_rate": 0.00042948910483299105, "loss": 3.4918754577636717, "step": 6660 }, { "epoch": 0.258009612502055, "grad_norm": 0.271484375, "learning_rate": 0.00042928215125395236, "loss": 3.524504470825195, "step": 6670 }, { "epoch": 0.25839643351030395, "grad_norm": 0.2734375, "learning_rate": 0.0004290749475212892, "loss": 3.5244983673095702, "step": 6680 }, { "epoch": 0.2587832545185529, "grad_norm": 0.265625, "learning_rate": 0.00042886749394578254, "loss": 3.4681201934814454, "step": 6690 }, { "epoch": 0.2591700755268019, "grad_norm": 0.2490234375, "learning_rate": 0.0004286597908385887, "loss": 3.499583435058594, "step": 6700 }, { "epoch": 0.2591700755268019, "eval_loss": 4.000979900360107, "eval_runtime": 9.9625, "eval_samples_per_second": 32.823, "eval_steps_per_second": 2.108, "step": 6700 }, { "epoch": 0.2595568965350508, "grad_norm": 0.267578125, "learning_rate": 0.0004284518385112377, "loss": 3.544001007080078, "step": 6710 }, { "epoch": 0.25994371754329976, "grad_norm": 0.275390625, "learning_rate": 0.0004282436372756337, "loss": 3.491320037841797, "step": 6720 }, { "epoch": 0.26033053855154875, "grad_norm": 0.2421875, "learning_rate": 0.0004280351874440539, "loss": 3.492382049560547, "step": 6730 }, { "epoch": 0.2607173595597977, "grad_norm": 0.25, "learning_rate": 0.0004278264893291487, "loss": 3.547830581665039, "step": 6740 }, { "epoch": 0.26110418056804663, "grad_norm": 0.25390625, "learning_rate": 0.0004276175432439408, "loss": 3.5104396820068358, "step": 6750 }, { "epoch": 0.2614910015762956, "grad_norm": 0.25, "learning_rate": 0.00042740834950182467, "loss": 3.5236995697021483, "step": 6760 }, { "epoch": 0.26187782258454456, "grad_norm": 0.248046875, "learning_rate": 0.00042719890841656636, "loss": 3.5166088104248048, "step": 6770 }, { "epoch": 0.2622646435927935, "grad_norm": 0.2470703125, "learning_rate": 0.00042698922030230284, "loss": 3.4963302612304688, "step": 6780 }, { "epoch": 0.2626514646010425, "grad_norm": 0.2392578125, "learning_rate": 0.00042677928547354174, "loss": 3.5068523406982424, "step": 6790 }, { "epoch": 0.26303828560929143, "grad_norm": 0.255859375, "learning_rate": 0.00042656910424516053, "loss": 3.524884796142578, "step": 6800 }, { "epoch": 0.26303828560929143, "eval_loss": 3.9918432235717773, "eval_runtime": 9.9656, "eval_samples_per_second": 32.813, "eval_steps_per_second": 2.107, "step": 6800 }, { "epoch": 0.26342510661754037, "grad_norm": 0.259765625, "learning_rate": 0.00042635867693240634, "loss": 3.4992977142333985, "step": 6810 }, { "epoch": 0.26381192762578937, "grad_norm": 0.248046875, "learning_rate": 0.00042614800385089546, "loss": 3.48309440612793, "step": 6820 }, { "epoch": 0.2641987486340383, "grad_norm": 0.26953125, "learning_rate": 0.00042593708531661275, "loss": 3.520304870605469, "step": 6830 }, { "epoch": 0.2645855696422873, "grad_norm": 0.259765625, "learning_rate": 0.0004257259216459113, "loss": 3.541963577270508, "step": 6840 }, { "epoch": 0.26497239065053624, "grad_norm": 0.27734375, "learning_rate": 0.0004255145131555116, "loss": 3.474831771850586, "step": 6850 }, { "epoch": 0.2653592116587852, "grad_norm": 0.259765625, "learning_rate": 0.00042530286016250173, "loss": 3.475337600708008, "step": 6860 }, { "epoch": 0.26574603266703417, "grad_norm": 0.271484375, "learning_rate": 0.0004250909629843362, "loss": 3.512445831298828, "step": 6870 }, { "epoch": 0.2661328536752831, "grad_norm": 0.2431640625, "learning_rate": 0.00042487882193883585, "loss": 3.528004837036133, "step": 6880 }, { "epoch": 0.26651967468353205, "grad_norm": 0.25, "learning_rate": 0.00042466643734418737, "loss": 3.446039581298828, "step": 6890 }, { "epoch": 0.26690649569178104, "grad_norm": 0.28125, "learning_rate": 0.0004244538095189427, "loss": 3.4687259674072264, "step": 6900 }, { "epoch": 0.26690649569178104, "eval_loss": 3.9921114444732666, "eval_runtime": 10.0839, "eval_samples_per_second": 32.428, "eval_steps_per_second": 2.083, "step": 6900 }, { "epoch": 0.26729331670003, "grad_norm": 0.2490234375, "learning_rate": 0.0004242409387820186, "loss": 3.5139041900634767, "step": 6910 }, { "epoch": 0.2676801377082789, "grad_norm": 0.240234375, "learning_rate": 0.00042402782545269605, "loss": 3.4841732025146483, "step": 6920 }, { "epoch": 0.2680669587165279, "grad_norm": 0.2421875, "learning_rate": 0.0004238144698506201, "loss": 3.5189540863037108, "step": 6930 }, { "epoch": 0.26845377972477685, "grad_norm": 0.265625, "learning_rate": 0.00042360087229579907, "loss": 3.499907684326172, "step": 6940 }, { "epoch": 0.2688406007330258, "grad_norm": 0.283203125, "learning_rate": 0.00042338703310860413, "loss": 3.4943309783935548, "step": 6950 }, { "epoch": 0.2692274217412748, "grad_norm": 0.259765625, "learning_rate": 0.000423172952609769, "loss": 3.4940841674804686, "step": 6960 }, { "epoch": 0.2696142427495237, "grad_norm": 0.240234375, "learning_rate": 0.0004229586311203892, "loss": 3.459016799926758, "step": 6970 }, { "epoch": 0.27000106375777266, "grad_norm": 0.259765625, "learning_rate": 0.0004227440689619218, "loss": 3.5130611419677735, "step": 6980 }, { "epoch": 0.27038788476602166, "grad_norm": 0.265625, "learning_rate": 0.00042252926645618485, "loss": 3.500564956665039, "step": 6990 }, { "epoch": 0.2707747057742706, "grad_norm": 0.2470703125, "learning_rate": 0.0004223142239253568, "loss": 3.495101547241211, "step": 7000 }, { "epoch": 0.2707747057742706, "eval_loss": 3.983806848526001, "eval_runtime": 10.0108, "eval_samples_per_second": 32.665, "eval_steps_per_second": 2.098, "step": 7000 }, { "epoch": 0.27116152678251954, "grad_norm": 0.2890625, "learning_rate": 0.0004220989416919762, "loss": 3.4596118927001953, "step": 7010 }, { "epoch": 0.27154834779076853, "grad_norm": 0.291015625, "learning_rate": 0.00042188342007894115, "loss": 3.479116439819336, "step": 7020 }, { "epoch": 0.27193516879901747, "grad_norm": 0.267578125, "learning_rate": 0.00042166765940950874, "loss": 3.5550628662109376, "step": 7030 }, { "epoch": 0.2723219898072664, "grad_norm": 0.26171875, "learning_rate": 0.0004214516600072944, "loss": 3.4750045776367187, "step": 7040 }, { "epoch": 0.2727088108155154, "grad_norm": 0.265625, "learning_rate": 0.00042123542219627214, "loss": 3.492919921875, "step": 7050 }, { "epoch": 0.27309563182376434, "grad_norm": 0.244140625, "learning_rate": 0.00042101894630077315, "loss": 3.5046051025390623, "step": 7060 }, { "epoch": 0.27348245283201333, "grad_norm": 0.244140625, "learning_rate": 0.0004208022326454858, "loss": 3.478554916381836, "step": 7070 }, { "epoch": 0.2738692738402623, "grad_norm": 0.255859375, "learning_rate": 0.00042058528155545507, "loss": 3.5061058044433593, "step": 7080 }, { "epoch": 0.2742560948485112, "grad_norm": 0.2734375, "learning_rate": 0.00042036809335608215, "loss": 3.463357162475586, "step": 7090 }, { "epoch": 0.2746429158567602, "grad_norm": 0.275390625, "learning_rate": 0.0004201506683731238, "loss": 3.52327880859375, "step": 7100 }, { "epoch": 0.2746429158567602, "eval_loss": 4.0028395652771, "eval_runtime": 10.0008, "eval_samples_per_second": 32.697, "eval_steps_per_second": 2.1, "step": 7100 }, { "epoch": 0.27502973686500914, "grad_norm": 0.259765625, "learning_rate": 0.00041993300693269204, "loss": 3.5009181976318358, "step": 7110 }, { "epoch": 0.2754165578732581, "grad_norm": 0.2421875, "learning_rate": 0.00041971510936125326, "loss": 3.4968143463134767, "step": 7120 }, { "epoch": 0.2758033788815071, "grad_norm": 0.251953125, "learning_rate": 0.00041949697598562836, "loss": 3.509387969970703, "step": 7130 }, { "epoch": 0.276190199889756, "grad_norm": 0.259765625, "learning_rate": 0.00041927860713299165, "loss": 3.505107116699219, "step": 7140 }, { "epoch": 0.27657702089800495, "grad_norm": 0.2890625, "learning_rate": 0.0004190600031308709, "loss": 3.4760673522949217, "step": 7150 }, { "epoch": 0.27696384190625395, "grad_norm": 0.25390625, "learning_rate": 0.0004188411643071462, "loss": 3.471649932861328, "step": 7160 }, { "epoch": 0.2773506629145029, "grad_norm": 0.2490234375, "learning_rate": 0.0004186220909900503, "loss": 3.5090023040771485, "step": 7170 }, { "epoch": 0.2777374839227518, "grad_norm": 0.25390625, "learning_rate": 0.00041840278350816726, "loss": 3.485765075683594, "step": 7180 }, { "epoch": 0.2781243049310008, "grad_norm": 0.26171875, "learning_rate": 0.00041818324219043256, "loss": 3.48890380859375, "step": 7190 }, { "epoch": 0.27851112593924976, "grad_norm": 0.255859375, "learning_rate": 0.0004179634673661324, "loss": 3.4805828094482423, "step": 7200 }, { "epoch": 0.27851112593924976, "eval_loss": 3.9834365844726562, "eval_runtime": 10.0054, "eval_samples_per_second": 32.682, "eval_steps_per_second": 2.099, "step": 7200 }, { "epoch": 0.2788979469474987, "grad_norm": 0.259765625, "learning_rate": 0.0004177434593649032, "loss": 3.4678180694580076, "step": 7210 }, { "epoch": 0.2792847679557477, "grad_norm": 0.259765625, "learning_rate": 0.00041752321851673107, "loss": 3.498748779296875, "step": 7220 }, { "epoch": 0.27967158896399663, "grad_norm": 0.2578125, "learning_rate": 0.0004173027451519514, "loss": 3.492596435546875, "step": 7230 }, { "epoch": 0.28005840997224557, "grad_norm": 0.279296875, "learning_rate": 0.00041708203960124843, "loss": 3.5052108764648438, "step": 7240 }, { "epoch": 0.28044523098049456, "grad_norm": 0.2734375, "learning_rate": 0.00041686110219565437, "loss": 3.4743038177490235, "step": 7250 }, { "epoch": 0.2808320519887435, "grad_norm": 0.271484375, "learning_rate": 0.00041663993326654944, "loss": 3.508194351196289, "step": 7260 }, { "epoch": 0.28121887299699244, "grad_norm": 0.263671875, "learning_rate": 0.000416418533145661, "loss": 3.5267372131347656, "step": 7270 }, { "epoch": 0.28160569400524144, "grad_norm": 0.259765625, "learning_rate": 0.00041619690216506333, "loss": 3.5127063751220704, "step": 7280 }, { "epoch": 0.2819925150134904, "grad_norm": 0.265625, "learning_rate": 0.0004159750406571768, "loss": 3.4871360778808596, "step": 7290 }, { "epoch": 0.2823793360217393, "grad_norm": 0.2451171875, "learning_rate": 0.0004157529489547675, "loss": 3.4671897888183594, "step": 7300 }, { "epoch": 0.2823793360217393, "eval_loss": 3.978560447692871, "eval_runtime": 10.004, "eval_samples_per_second": 32.687, "eval_steps_per_second": 2.099, "step": 7300 }, { "epoch": 0.2827661570299883, "grad_norm": 0.265625, "learning_rate": 0.000415530627390947, "loss": 3.4803470611572265, "step": 7310 }, { "epoch": 0.28315297803823725, "grad_norm": 0.251953125, "learning_rate": 0.0004153080762991714, "loss": 3.490553283691406, "step": 7320 }, { "epoch": 0.28353979904648624, "grad_norm": 0.259765625, "learning_rate": 0.0004150852960132413, "loss": 3.523568344116211, "step": 7330 }, { "epoch": 0.2839266200547352, "grad_norm": 0.25390625, "learning_rate": 0.0004148622868673009, "loss": 3.4703395843505858, "step": 7340 }, { "epoch": 0.2843134410629841, "grad_norm": 0.27734375, "learning_rate": 0.0004146390491958377, "loss": 3.493512725830078, "step": 7350 }, { "epoch": 0.2847002620712331, "grad_norm": 0.263671875, "learning_rate": 0.0004144155833336819, "loss": 3.459734344482422, "step": 7360 }, { "epoch": 0.28508708307948205, "grad_norm": 0.259765625, "learning_rate": 0.00041419188961600614, "loss": 3.442743682861328, "step": 7370 }, { "epoch": 0.285473904087731, "grad_norm": 0.248046875, "learning_rate": 0.00041396796837832474, "loss": 3.4958415985107423, "step": 7380 }, { "epoch": 0.28586072509598, "grad_norm": 0.259765625, "learning_rate": 0.00041374381995649306, "loss": 3.4780853271484373, "step": 7390 }, { "epoch": 0.2862475461042289, "grad_norm": 0.2333984375, "learning_rate": 0.00041351944468670754, "loss": 3.48729248046875, "step": 7400 }, { "epoch": 0.2862475461042289, "eval_loss": 3.9693050384521484, "eval_runtime": 9.9899, "eval_samples_per_second": 32.733, "eval_steps_per_second": 2.102, "step": 7400 }, { "epoch": 0.28663436711247786, "grad_norm": 0.287109375, "learning_rate": 0.00041329484290550454, "loss": 3.464725112915039, "step": 7410 }, { "epoch": 0.28702118812072686, "grad_norm": 0.279296875, "learning_rate": 0.00041307001494976064, "loss": 3.5638668060302736, "step": 7420 }, { "epoch": 0.2874080091289758, "grad_norm": 0.251953125, "learning_rate": 0.00041284496115669107, "loss": 3.4758174896240233, "step": 7430 }, { "epoch": 0.28779483013722473, "grad_norm": 0.259765625, "learning_rate": 0.0004126196818638502, "loss": 3.4785606384277346, "step": 7440 }, { "epoch": 0.2881816511454737, "grad_norm": 0.2490234375, "learning_rate": 0.0004123941774091304, "loss": 3.492573928833008, "step": 7450 }, { "epoch": 0.28856847215372267, "grad_norm": 0.25390625, "learning_rate": 0.00041216844813076197, "loss": 3.510224533081055, "step": 7460 }, { "epoch": 0.2889552931619716, "grad_norm": 0.25, "learning_rate": 0.0004119424943673122, "loss": 3.469999313354492, "step": 7470 }, { "epoch": 0.2893421141702206, "grad_norm": 0.26953125, "learning_rate": 0.00041171631645768527, "loss": 3.4652854919433596, "step": 7480 }, { "epoch": 0.28972893517846954, "grad_norm": 0.26953125, "learning_rate": 0.00041148991474112135, "loss": 3.445465850830078, "step": 7490 }, { "epoch": 0.2901157561867185, "grad_norm": 0.267578125, "learning_rate": 0.00041126328955719645, "loss": 3.483041000366211, "step": 7500 }, { "epoch": 0.2901157561867185, "eval_loss": 3.9702155590057373, "eval_runtime": 10.0085, "eval_samples_per_second": 32.672, "eval_steps_per_second": 2.098, "step": 7500 }, { "epoch": 0.29050257719496747, "grad_norm": 0.251953125, "learning_rate": 0.0004110364412458217, "loss": 3.4610855102539064, "step": 7510 }, { "epoch": 0.2908893982032164, "grad_norm": 0.2451171875, "learning_rate": 0.000410809370147243, "loss": 3.4661144256591796, "step": 7520 }, { "epoch": 0.29127621921146535, "grad_norm": 0.275390625, "learning_rate": 0.0004105820766020402, "loss": 3.4697357177734376, "step": 7530 }, { "epoch": 0.29166304021971434, "grad_norm": 0.25390625, "learning_rate": 0.00041035456095112684, "loss": 3.451828384399414, "step": 7540 }, { "epoch": 0.2920498612279633, "grad_norm": 0.251953125, "learning_rate": 0.00041012682353574976, "loss": 3.4903900146484377, "step": 7550 }, { "epoch": 0.2924366822362123, "grad_norm": 0.2431640625, "learning_rate": 0.00040989886469748843, "loss": 3.44178466796875, "step": 7560 }, { "epoch": 0.2928235032444612, "grad_norm": 0.251953125, "learning_rate": 0.0004096706847782541, "loss": 3.491189956665039, "step": 7570 }, { "epoch": 0.29321032425271015, "grad_norm": 0.275390625, "learning_rate": 0.00040944228412029, "loss": 3.4560359954833983, "step": 7580 }, { "epoch": 0.29359714526095915, "grad_norm": 0.267578125, "learning_rate": 0.0004092136630661701, "loss": 3.491283416748047, "step": 7590 }, { "epoch": 0.2939839662692081, "grad_norm": 0.251953125, "learning_rate": 0.00040898482195879935, "loss": 3.469133758544922, "step": 7600 }, { "epoch": 0.2939839662692081, "eval_loss": 3.961404800415039, "eval_runtime": 10.1106, "eval_samples_per_second": 32.342, "eval_steps_per_second": 2.077, "step": 7600 }, { "epoch": 0.294370787277457, "grad_norm": 0.25390625, "learning_rate": 0.0004087557611414122, "loss": 3.47923583984375, "step": 7610 }, { "epoch": 0.294757608285706, "grad_norm": 0.2431640625, "learning_rate": 0.00040852648095757323, "loss": 3.5196529388427735, "step": 7620 }, { "epoch": 0.29514442929395496, "grad_norm": 0.25, "learning_rate": 0.0004082969817511755, "loss": 3.4972084045410154, "step": 7630 }, { "epoch": 0.2955312503022039, "grad_norm": 0.271484375, "learning_rate": 0.0004080672638664412, "loss": 3.453374481201172, "step": 7640 }, { "epoch": 0.2959180713104529, "grad_norm": 0.265625, "learning_rate": 0.0004078373276479199, "loss": 3.4950233459472657, "step": 7650 }, { "epoch": 0.29630489231870183, "grad_norm": 0.240234375, "learning_rate": 0.00040760717344048896, "loss": 3.462534713745117, "step": 7660 }, { "epoch": 0.29669171332695077, "grad_norm": 0.25390625, "learning_rate": 0.00040737680158935277, "loss": 3.496277618408203, "step": 7670 }, { "epoch": 0.29707853433519976, "grad_norm": 0.248046875, "learning_rate": 0.0004071462124400417, "loss": 3.4707130432128905, "step": 7680 }, { "epoch": 0.2974653553434487, "grad_norm": 0.2451171875, "learning_rate": 0.00040691540633841267, "loss": 3.4735038757324217, "step": 7690 }, { "epoch": 0.29785217635169764, "grad_norm": 0.279296875, "learning_rate": 0.0004066843836306477, "loss": 3.4587879180908203, "step": 7700 }, { "epoch": 0.29785217635169764, "eval_loss": 3.9454445838928223, "eval_runtime": 10.0538, "eval_samples_per_second": 32.525, "eval_steps_per_second": 2.089, "step": 7700 }, { "epoch": 0.29823899735994663, "grad_norm": 0.255859375, "learning_rate": 0.0004064531446632535, "loss": 3.4567310333251955, "step": 7710 }, { "epoch": 0.2986258183681956, "grad_norm": 0.2431640625, "learning_rate": 0.0004062216897830615, "loss": 3.5064525604248047, "step": 7720 }, { "epoch": 0.2990126393764445, "grad_norm": 0.28125, "learning_rate": 0.00040599001933722687, "loss": 3.4508167266845704, "step": 7730 }, { "epoch": 0.2993994603846935, "grad_norm": 0.28515625, "learning_rate": 0.00040575813367322786, "loss": 3.5213436126708983, "step": 7740 }, { "epoch": 0.29978628139294244, "grad_norm": 0.275390625, "learning_rate": 0.00040552603313886575, "loss": 3.44835205078125, "step": 7750 }, { "epoch": 0.3001731024011914, "grad_norm": 0.25390625, "learning_rate": 0.0004052937180822642, "loss": 3.47521858215332, "step": 7760 }, { "epoch": 0.3005599234094404, "grad_norm": 0.259765625, "learning_rate": 0.00040506118885186846, "loss": 3.5136672973632814, "step": 7770 }, { "epoch": 0.3009467444176893, "grad_norm": 0.259765625, "learning_rate": 0.0004048284457964449, "loss": 3.455365753173828, "step": 7780 }, { "epoch": 0.3013335654259383, "grad_norm": 0.263671875, "learning_rate": 0.00040459548926508087, "loss": 3.4851306915283202, "step": 7790 }, { "epoch": 0.30172038643418725, "grad_norm": 0.28515625, "learning_rate": 0.0004043623196071838, "loss": 3.4420330047607424, "step": 7800 }, { "epoch": 0.30172038643418725, "eval_loss": 3.977670907974243, "eval_runtime": 10.0649, "eval_samples_per_second": 32.489, "eval_steps_per_second": 2.086, "step": 7800 }, { "epoch": 0.3021072074424362, "grad_norm": 0.251953125, "learning_rate": 0.0004041289371724808, "loss": 3.486972427368164, "step": 7810 }, { "epoch": 0.3024940284506852, "grad_norm": 0.2470703125, "learning_rate": 0.0004038953423110179, "loss": 3.4616844177246096, "step": 7820 }, { "epoch": 0.3028808494589341, "grad_norm": 0.2421875, "learning_rate": 0.00040366153537316007, "loss": 3.5070659637451174, "step": 7830 }, { "epoch": 0.30326767046718306, "grad_norm": 0.251953125, "learning_rate": 0.0004034275167095902, "loss": 3.4858856201171875, "step": 7840 }, { "epoch": 0.30365449147543205, "grad_norm": 0.228515625, "learning_rate": 0.00040319328667130897, "loss": 3.471744155883789, "step": 7850 }, { "epoch": 0.304041312483681, "grad_norm": 0.2578125, "learning_rate": 0.00040295884560963356, "loss": 3.455038833618164, "step": 7860 }, { "epoch": 0.30442813349192993, "grad_norm": 0.26953125, "learning_rate": 0.0004027241938761983, "loss": 3.491812896728516, "step": 7870 }, { "epoch": 0.3048149545001789, "grad_norm": 0.279296875, "learning_rate": 0.0004024893318229531, "loss": 3.4919559478759767, "step": 7880 }, { "epoch": 0.30520177550842786, "grad_norm": 0.26953125, "learning_rate": 0.0004022542598021635, "loss": 3.4516735076904297, "step": 7890 }, { "epoch": 0.3055885965166768, "grad_norm": 0.26953125, "learning_rate": 0.00040201897816640977, "loss": 3.4588272094726564, "step": 7900 }, { "epoch": 0.3055885965166768, "eval_loss": 3.9536006450653076, "eval_runtime": 10.3723, "eval_samples_per_second": 31.526, "eval_steps_per_second": 2.025, "step": 7900 }, { "epoch": 0.3059754175249258, "grad_norm": 0.263671875, "learning_rate": 0.00040178348726858677, "loss": 3.482456588745117, "step": 7910 }, { "epoch": 0.30636223853317474, "grad_norm": 0.251953125, "learning_rate": 0.00040154778746190323, "loss": 3.4793769836425783, "step": 7920 }, { "epoch": 0.3067490595414237, "grad_norm": 0.2412109375, "learning_rate": 0.00040131187909988117, "loss": 3.4581600189208985, "step": 7930 }, { "epoch": 0.30713588054967267, "grad_norm": 0.251953125, "learning_rate": 0.0004010757625363552, "loss": 3.4720085144042967, "step": 7940 }, { "epoch": 0.3075227015579216, "grad_norm": 0.251953125, "learning_rate": 0.0004008394381254727, "loss": 3.4618335723876954, "step": 7950 }, { "epoch": 0.30790952256617055, "grad_norm": 0.248046875, "learning_rate": 0.00040060290622169226, "loss": 3.474958038330078, "step": 7960 }, { "epoch": 0.30829634357441954, "grad_norm": 0.23828125, "learning_rate": 0.00040036616717978416, "loss": 3.4388957977294923, "step": 7970 }, { "epoch": 0.3086831645826685, "grad_norm": 0.26171875, "learning_rate": 0.000400129221354829, "loss": 3.456399917602539, "step": 7980 }, { "epoch": 0.3090699855909174, "grad_norm": 0.26953125, "learning_rate": 0.0003998920691022176, "loss": 3.4763534545898436, "step": 7990 }, { "epoch": 0.3094568065991664, "grad_norm": 0.25, "learning_rate": 0.00039965471077765065, "loss": 3.444426345825195, "step": 8000 }, { "epoch": 0.3094568065991664, "eval_loss": 3.954042673110962, "eval_runtime": 10.8919, "eval_samples_per_second": 30.022, "eval_steps_per_second": 1.928, "step": 8000 }, { "epoch": 0.30984362760741535, "grad_norm": 0.2578125, "learning_rate": 0.00039941714673713763, "loss": 3.4891815185546875, "step": 8010 }, { "epoch": 0.3102304486156643, "grad_norm": 0.2392578125, "learning_rate": 0.0003991793773369967, "loss": 3.4721736907958984, "step": 8020 }, { "epoch": 0.3106172696239133, "grad_norm": 0.25390625, "learning_rate": 0.000398941402933854, "loss": 3.4296173095703124, "step": 8030 }, { "epoch": 0.3110040906321622, "grad_norm": 0.263671875, "learning_rate": 0.0003987032238846432, "loss": 3.4733917236328127, "step": 8040 }, { "epoch": 0.3113909116404112, "grad_norm": 0.263671875, "learning_rate": 0.00039846484054660493, "loss": 3.4510936737060547, "step": 8050 }, { "epoch": 0.31177773264866016, "grad_norm": 0.2392578125, "learning_rate": 0.0003982262532772861, "loss": 3.4586532592773436, "step": 8060 }, { "epoch": 0.3121645536569091, "grad_norm": 0.251953125, "learning_rate": 0.0003979874624345395, "loss": 3.48809700012207, "step": 8070 }, { "epoch": 0.3125513746651581, "grad_norm": 0.255859375, "learning_rate": 0.0003977484683765234, "loss": 3.4487079620361327, "step": 8080 }, { "epoch": 0.312938195673407, "grad_norm": 0.25390625, "learning_rate": 0.0003975092714617009, "loss": 3.4913402557373048, "step": 8090 }, { "epoch": 0.31332501668165597, "grad_norm": 0.2734375, "learning_rate": 0.00039726987204883907, "loss": 3.465750503540039, "step": 8100 }, { "epoch": 0.31332501668165597, "eval_loss": 3.945279598236084, "eval_runtime": 10.1775, "eval_samples_per_second": 32.13, "eval_steps_per_second": 2.063, "step": 8100 }, { "epoch": 0.31371183768990496, "grad_norm": 0.267578125, "learning_rate": 0.000397030270497009, "loss": 3.459657669067383, "step": 8110 }, { "epoch": 0.3140986586981539, "grad_norm": 0.255859375, "learning_rate": 0.0003967904671655849, "loss": 3.453855514526367, "step": 8120 }, { "epoch": 0.31448547970640284, "grad_norm": 0.2421875, "learning_rate": 0.0003965504624142435, "loss": 3.485597610473633, "step": 8130 }, { "epoch": 0.31487230071465183, "grad_norm": 0.263671875, "learning_rate": 0.00039631025660296384, "loss": 3.4898101806640627, "step": 8140 }, { "epoch": 0.31525912172290077, "grad_norm": 0.2578125, "learning_rate": 0.00039606985009202616, "loss": 3.437654495239258, "step": 8150 }, { "epoch": 0.3156459427311497, "grad_norm": 0.263671875, "learning_rate": 0.0003958292432420122, "loss": 3.4521121978759766, "step": 8160 }, { "epoch": 0.3160327637393987, "grad_norm": 0.259765625, "learning_rate": 0.00039558843641380385, "loss": 3.446636199951172, "step": 8170 }, { "epoch": 0.31641958474764764, "grad_norm": 0.251953125, "learning_rate": 0.00039534742996858314, "loss": 3.5297615051269533, "step": 8180 }, { "epoch": 0.3168064057558966, "grad_norm": 0.25390625, "learning_rate": 0.0003951062242678313, "loss": 3.4837715148925783, "step": 8190 }, { "epoch": 0.3171932267641456, "grad_norm": 0.2373046875, "learning_rate": 0.0003948648196733286, "loss": 3.4503883361816405, "step": 8200 }, { "epoch": 0.3171932267641456, "eval_loss": 3.947329044342041, "eval_runtime": 10.1317, "eval_samples_per_second": 32.275, "eval_steps_per_second": 2.073, "step": 8200 }, { "epoch": 0.3175800477723945, "grad_norm": 0.26171875, "learning_rate": 0.00039462321654715356, "loss": 3.4455516815185545, "step": 8210 }, { "epoch": 0.31796686878064345, "grad_norm": 0.2470703125, "learning_rate": 0.00039438141525168245, "loss": 3.4772762298583983, "step": 8220 }, { "epoch": 0.31835368978889245, "grad_norm": 0.27734375, "learning_rate": 0.00039413941614958875, "loss": 3.480706787109375, "step": 8230 }, { "epoch": 0.3187405107971414, "grad_norm": 0.275390625, "learning_rate": 0.0003938972196038428, "loss": 3.443967819213867, "step": 8240 }, { "epoch": 0.3191273318053903, "grad_norm": 0.251953125, "learning_rate": 0.0003936548259777107, "loss": 3.4702228546142577, "step": 8250 }, { "epoch": 0.3195141528136393, "grad_norm": 0.23828125, "learning_rate": 0.0003934122356347548, "loss": 3.467062759399414, "step": 8260 }, { "epoch": 0.31990097382188826, "grad_norm": 0.263671875, "learning_rate": 0.0003931694489388317, "loss": 3.4245067596435548, "step": 8270 }, { "epoch": 0.32028779483013725, "grad_norm": 0.234375, "learning_rate": 0.00039292646625409315, "loss": 3.4993412017822267, "step": 8280 }, { "epoch": 0.3206746158383862, "grad_norm": 0.265625, "learning_rate": 0.00039268328794498454, "loss": 3.4476173400878904, "step": 8290 }, { "epoch": 0.32106143684663513, "grad_norm": 0.259765625, "learning_rate": 0.0003924399143762448, "loss": 3.467058563232422, "step": 8300 }, { "epoch": 0.32106143684663513, "eval_loss": 3.9062752723693848, "eval_runtime": 10.0398, "eval_samples_per_second": 32.57, "eval_steps_per_second": 2.092, "step": 8300 }, { "epoch": 0.3214482578548841, "grad_norm": 0.2470703125, "learning_rate": 0.0003921963459129056, "loss": 3.4350086212158204, "step": 8310 }, { "epoch": 0.32183507886313306, "grad_norm": 0.265625, "learning_rate": 0.0003919525829202911, "loss": 3.4416141510009766, "step": 8320 }, { "epoch": 0.322221899871382, "grad_norm": 0.255859375, "learning_rate": 0.000391708625764017, "loss": 3.4725067138671877, "step": 8330 }, { "epoch": 0.322608720879631, "grad_norm": 0.259765625, "learning_rate": 0.0003914644748099905, "loss": 3.448748779296875, "step": 8340 }, { "epoch": 0.32299554188787993, "grad_norm": 0.2470703125, "learning_rate": 0.00039122013042440935, "loss": 3.446158218383789, "step": 8350 }, { "epoch": 0.32338236289612887, "grad_norm": 0.240234375, "learning_rate": 0.00039097559297376124, "loss": 3.4900192260742187, "step": 8360 }, { "epoch": 0.32376918390437787, "grad_norm": 0.240234375, "learning_rate": 0.0003907308628248238, "loss": 3.457179641723633, "step": 8370 }, { "epoch": 0.3241560049126268, "grad_norm": 0.255859375, "learning_rate": 0.0003904859403446633, "loss": 3.431169891357422, "step": 8380 }, { "epoch": 0.32454282592087574, "grad_norm": 0.26953125, "learning_rate": 0.0003902408259006348, "loss": 3.4472503662109375, "step": 8390 }, { "epoch": 0.32492964692912474, "grad_norm": 0.2490234375, "learning_rate": 0.0003899955198603812, "loss": 3.439772033691406, "step": 8400 }, { "epoch": 0.32492964692912474, "eval_loss": 3.9217541217803955, "eval_runtime": 10.0191, "eval_samples_per_second": 32.638, "eval_steps_per_second": 2.096, "step": 8400 }, { "epoch": 0.3253164679373737, "grad_norm": 0.244140625, "learning_rate": 0.0003897500225918326, "loss": 3.4198753356933596, "step": 8410 }, { "epoch": 0.3257032889456226, "grad_norm": 0.25390625, "learning_rate": 0.00038950433446320614, "loss": 3.4733913421630858, "step": 8420 }, { "epoch": 0.3260901099538716, "grad_norm": 0.255859375, "learning_rate": 0.0003892584558430051, "loss": 3.438296890258789, "step": 8430 }, { "epoch": 0.32647693096212055, "grad_norm": 0.3125, "learning_rate": 0.00038901238710001854, "loss": 3.4649559020996095, "step": 8440 }, { "epoch": 0.3268637519703695, "grad_norm": 0.25, "learning_rate": 0.00038876612860332056, "loss": 3.4911937713623047, "step": 8450 }, { "epoch": 0.3272505729786185, "grad_norm": 0.2578125, "learning_rate": 0.00038851968072227004, "loss": 3.4624607086181642, "step": 8460 }, { "epoch": 0.3276373939868674, "grad_norm": 0.2470703125, "learning_rate": 0.00038827304382651, "loss": 3.4401573181152343, "step": 8470 }, { "epoch": 0.32802421499511636, "grad_norm": 0.28515625, "learning_rate": 0.0003880262182859664, "loss": 3.456196975708008, "step": 8480 }, { "epoch": 0.32841103600336535, "grad_norm": 0.26953125, "learning_rate": 0.0003877792044708489, "loss": 3.4427886962890626, "step": 8490 }, { "epoch": 0.3287978570116143, "grad_norm": 0.2578125, "learning_rate": 0.00038753200275164895, "loss": 3.4402111053466795, "step": 8500 }, { "epoch": 0.3287978570116143, "eval_loss": 3.931530237197876, "eval_runtime": 10.0521, "eval_samples_per_second": 32.531, "eval_steps_per_second": 2.089, "step": 8500 }, { "epoch": 0.3291846780198633, "grad_norm": 0.244140625, "learning_rate": 0.0003872846134991402, "loss": 3.4195785522460938, "step": 8510 }, { "epoch": 0.3295714990281122, "grad_norm": 0.259765625, "learning_rate": 0.0003870370370843775, "loss": 3.474544906616211, "step": 8520 }, { "epoch": 0.32995832003636116, "grad_norm": 0.244140625, "learning_rate": 0.0003867892738786963, "loss": 3.4477092742919924, "step": 8530 }, { "epoch": 0.33034514104461016, "grad_norm": 0.2578125, "learning_rate": 0.00038654132425371227, "loss": 3.4963069915771485, "step": 8540 }, { "epoch": 0.3307319620528591, "grad_norm": 0.255859375, "learning_rate": 0.0003862931885813207, "loss": 3.4387706756591796, "step": 8550 }, { "epoch": 0.33111878306110804, "grad_norm": 0.267578125, "learning_rate": 0.00038604486723369604, "loss": 3.4153343200683595, "step": 8560 }, { "epoch": 0.33150560406935703, "grad_norm": 0.26953125, "learning_rate": 0.000385796360583291, "loss": 3.4407272338867188, "step": 8570 }, { "epoch": 0.33189242507760597, "grad_norm": 0.263671875, "learning_rate": 0.0003855476690028364, "loss": 3.442066192626953, "step": 8580 }, { "epoch": 0.3322792460858549, "grad_norm": 0.28125, "learning_rate": 0.0003852987928653404, "loss": 3.4434627532958983, "step": 8590 }, { "epoch": 0.3326660670941039, "grad_norm": 0.251953125, "learning_rate": 0.00038504973254408794, "loss": 3.4483291625976564, "step": 8600 }, { "epoch": 0.3326660670941039, "eval_loss": 3.9131031036376953, "eval_runtime": 10.038, "eval_samples_per_second": 32.576, "eval_steps_per_second": 2.092, "step": 8600 }, { "epoch": 0.33305288810235284, "grad_norm": 0.25390625, "learning_rate": 0.0003848004884126403, "loss": 3.4154125213623048, "step": 8610 }, { "epoch": 0.3334397091106018, "grad_norm": 0.3046875, "learning_rate": 0.0003845510608448342, "loss": 3.478801727294922, "step": 8620 }, { "epoch": 0.3338265301188508, "grad_norm": 0.298828125, "learning_rate": 0.0003843014502147818, "loss": 3.4299625396728515, "step": 8630 }, { "epoch": 0.3342133511270997, "grad_norm": 0.2578125, "learning_rate": 0.00038405165689686964, "loss": 3.4181446075439452, "step": 8640 }, { "epoch": 0.33460017213534865, "grad_norm": 0.27734375, "learning_rate": 0.00038380168126575845, "loss": 3.451136016845703, "step": 8650 }, { "epoch": 0.33498699314359764, "grad_norm": 0.251953125, "learning_rate": 0.0003835515236963822, "loss": 3.4648101806640623, "step": 8660 }, { "epoch": 0.3353738141518466, "grad_norm": 0.265625, "learning_rate": 0.0003833011845639479, "loss": 3.4500274658203125, "step": 8670 }, { "epoch": 0.3357606351600955, "grad_norm": 0.26953125, "learning_rate": 0.0003830506642439348, "loss": 3.415103530883789, "step": 8680 }, { "epoch": 0.3361474561683445, "grad_norm": 0.255859375, "learning_rate": 0.00038279996311209395, "loss": 3.4284832000732424, "step": 8690 }, { "epoch": 0.33653427717659345, "grad_norm": 0.2421875, "learning_rate": 0.00038254908154444756, "loss": 3.4471145629882813, "step": 8700 }, { "epoch": 0.33653427717659345, "eval_loss": 3.9201772212982178, "eval_runtime": 10.102, "eval_samples_per_second": 32.37, "eval_steps_per_second": 2.079, "step": 8700 }, { "epoch": 0.3369210981848424, "grad_norm": 0.267578125, "learning_rate": 0.0003822980199172885, "loss": 3.421375274658203, "step": 8710 }, { "epoch": 0.3373079191930914, "grad_norm": 0.26953125, "learning_rate": 0.0003820467786071798, "loss": 3.4209850311279295, "step": 8720 }, { "epoch": 0.3376947402013403, "grad_norm": 0.26953125, "learning_rate": 0.0003817953579909537, "loss": 3.4273170471191405, "step": 8730 }, { "epoch": 0.33808156120958927, "grad_norm": 0.267578125, "learning_rate": 0.00038154375844571176, "loss": 3.4581871032714844, "step": 8740 }, { "epoch": 0.33846838221783826, "grad_norm": 0.2734375, "learning_rate": 0.00038129198034882357, "loss": 3.4375110626220704, "step": 8750 }, { "epoch": 0.3388552032260872, "grad_norm": 0.271484375, "learning_rate": 0.0003810400240779268, "loss": 3.405530548095703, "step": 8760 }, { "epoch": 0.3392420242343362, "grad_norm": 0.26171875, "learning_rate": 0.0003807878900109262, "loss": 3.433206558227539, "step": 8770 }, { "epoch": 0.33962884524258513, "grad_norm": 0.248046875, "learning_rate": 0.0003805355785259932, "loss": 3.458090591430664, "step": 8780 }, { "epoch": 0.34001566625083407, "grad_norm": 0.2373046875, "learning_rate": 0.0003802830900015655, "loss": 3.4461318969726564, "step": 8790 }, { "epoch": 0.34040248725908306, "grad_norm": 0.275390625, "learning_rate": 0.000380030424816346, "loss": 3.477490234375, "step": 8800 }, { "epoch": 0.34040248725908306, "eval_loss": 3.9167301654815674, "eval_runtime": 10.047, "eval_samples_per_second": 32.547, "eval_steps_per_second": 2.09, "step": 8800 }, { "epoch": 0.340789308267332, "grad_norm": 0.263671875, "learning_rate": 0.000379777583349303, "loss": 3.421334075927734, "step": 8810 }, { "epoch": 0.34117612927558094, "grad_norm": 0.251953125, "learning_rate": 0.0003795245659796689, "loss": 3.440085601806641, "step": 8820 }, { "epoch": 0.34156295028382994, "grad_norm": 0.265625, "learning_rate": 0.0003792713730869399, "loss": 3.457305145263672, "step": 8830 }, { "epoch": 0.3419497712920789, "grad_norm": 0.2470703125, "learning_rate": 0.0003790180050508758, "loss": 3.4464256286621096, "step": 8840 }, { "epoch": 0.3423365923003278, "grad_norm": 0.251953125, "learning_rate": 0.0003787644622514987, "loss": 3.4250965118408203, "step": 8850 }, { "epoch": 0.3427234133085768, "grad_norm": 0.251953125, "learning_rate": 0.0003785107450690931, "loss": 3.4989051818847656, "step": 8860 }, { "epoch": 0.34311023431682575, "grad_norm": 0.251953125, "learning_rate": 0.00037825685388420487, "loss": 3.43200569152832, "step": 8870 }, { "epoch": 0.3434970553250747, "grad_norm": 0.2421875, "learning_rate": 0.000378002789077641, "loss": 3.435445022583008, "step": 8880 }, { "epoch": 0.3438838763333237, "grad_norm": 0.26953125, "learning_rate": 0.0003777485510304688, "loss": 3.4056018829345702, "step": 8890 }, { "epoch": 0.3442706973415726, "grad_norm": 0.25390625, "learning_rate": 0.00037749414012401555, "loss": 3.4461997985839843, "step": 8900 }, { "epoch": 0.3442706973415726, "eval_loss": 3.903242349624634, "eval_runtime": 10.0386, "eval_samples_per_second": 32.574, "eval_steps_per_second": 2.092, "step": 8900 }, { "epoch": 0.34465751834982156, "grad_norm": 0.2578125, "learning_rate": 0.00037723955673986767, "loss": 3.462035369873047, "step": 8910 }, { "epoch": 0.34504433935807055, "grad_norm": 0.2578125, "learning_rate": 0.00037698480125987027, "loss": 3.432913589477539, "step": 8920 }, { "epoch": 0.3454311603663195, "grad_norm": 0.25390625, "learning_rate": 0.00037672987406612657, "loss": 3.4201942443847657, "step": 8930 }, { "epoch": 0.34581798137456843, "grad_norm": 0.26171875, "learning_rate": 0.00037647477554099765, "loss": 3.4594268798828125, "step": 8940 }, { "epoch": 0.3462048023828174, "grad_norm": 0.2578125, "learning_rate": 0.000376219506067101, "loss": 3.445780944824219, "step": 8950 }, { "epoch": 0.34659162339106636, "grad_norm": 0.255859375, "learning_rate": 0.000375964066027311, "loss": 3.429423522949219, "step": 8960 }, { "epoch": 0.3469784443993153, "grad_norm": 0.25, "learning_rate": 0.00037570845580475764, "loss": 3.437569427490234, "step": 8970 }, { "epoch": 0.3473652654075643, "grad_norm": 0.25, "learning_rate": 0.00037545267578282626, "loss": 3.408824157714844, "step": 8980 }, { "epoch": 0.34775208641581323, "grad_norm": 0.263671875, "learning_rate": 0.0003751967263451568, "loss": 3.465847396850586, "step": 8990 }, { "epoch": 0.3481389074240622, "grad_norm": 0.2451171875, "learning_rate": 0.00037494060787564336, "loss": 3.425415802001953, "step": 9000 }, { "epoch": 0.3481389074240622, "eval_loss": 3.908496856689453, "eval_runtime": 10.0504, "eval_samples_per_second": 32.536, "eval_steps_per_second": 2.089, "step": 9000 }, { "epoch": 0.34852572843231117, "grad_norm": 0.2578125, "learning_rate": 0.0003746843207584335, "loss": 3.4315727233886717, "step": 9010 }, { "epoch": 0.3489125494405601, "grad_norm": 0.25, "learning_rate": 0.0003744278653779278, "loss": 3.414052200317383, "step": 9020 }, { "epoch": 0.3492993704488091, "grad_norm": 0.2734375, "learning_rate": 0.0003741712421187792, "loss": 3.411752700805664, "step": 9030 }, { "epoch": 0.34968619145705804, "grad_norm": 0.25390625, "learning_rate": 0.0003739144513658923, "loss": 3.409000015258789, "step": 9040 }, { "epoch": 0.350073012465307, "grad_norm": 0.2578125, "learning_rate": 0.00037365749350442326, "loss": 3.440891647338867, "step": 9050 }, { "epoch": 0.35045983347355597, "grad_norm": 0.271484375, "learning_rate": 0.00037340036891977854, "loss": 3.4279243469238283, "step": 9060 }, { "epoch": 0.3508466544818049, "grad_norm": 0.259765625, "learning_rate": 0.0003731430779976148, "loss": 3.432322692871094, "step": 9070 }, { "epoch": 0.35123347549005385, "grad_norm": 0.259765625, "learning_rate": 0.0003728856211238383, "loss": 3.427559661865234, "step": 9080 }, { "epoch": 0.35162029649830284, "grad_norm": 0.234375, "learning_rate": 0.000372627998684604, "loss": 3.4577556610107423, "step": 9090 }, { "epoch": 0.3520071175065518, "grad_norm": 0.2890625, "learning_rate": 0.0003723702110663151, "loss": 3.441410446166992, "step": 9100 }, { "epoch": 0.3520071175065518, "eval_loss": 3.9001352787017822, "eval_runtime": 10.1074, "eval_samples_per_second": 32.352, "eval_steps_per_second": 2.078, "step": 9100 }, { "epoch": 0.3523939385148007, "grad_norm": 0.26953125, "learning_rate": 0.000372112258655623, "loss": 3.4635162353515625, "step": 9110 }, { "epoch": 0.3527807595230497, "grad_norm": 0.26953125, "learning_rate": 0.0003718541418394259, "loss": 3.392826461791992, "step": 9120 }, { "epoch": 0.35316758053129865, "grad_norm": 0.265625, "learning_rate": 0.0003715958610048687, "loss": 3.457368087768555, "step": 9130 }, { "epoch": 0.3535544015395476, "grad_norm": 0.25390625, "learning_rate": 0.00037133741653934226, "loss": 3.4322399139404296, "step": 9140 }, { "epoch": 0.3539412225477966, "grad_norm": 0.26171875, "learning_rate": 0.000371078808830483, "loss": 3.4189102172851564, "step": 9150 }, { "epoch": 0.3543280435560455, "grad_norm": 0.28125, "learning_rate": 0.000370820038266172, "loss": 3.4366641998291017, "step": 9160 }, { "epoch": 0.35471486456429446, "grad_norm": 0.267578125, "learning_rate": 0.00037056110523453473, "loss": 3.4128700256347657, "step": 9170 }, { "epoch": 0.35510168557254346, "grad_norm": 0.2734375, "learning_rate": 0.0003703020101239403, "loss": 3.4295944213867187, "step": 9180 }, { "epoch": 0.3554885065807924, "grad_norm": 0.2392578125, "learning_rate": 0.0003700427533230009, "loss": 3.4191574096679687, "step": 9190 }, { "epoch": 0.35587532758904133, "grad_norm": 0.271484375, "learning_rate": 0.0003697833352205712, "loss": 3.4229095458984373, "step": 9200 }, { "epoch": 0.35587532758904133, "eval_loss": 3.8868236541748047, "eval_runtime": 10.0499, "eval_samples_per_second": 32.538, "eval_steps_per_second": 2.09, "step": 9200 }, { "epoch": 0.35626214859729033, "grad_norm": 0.244140625, "learning_rate": 0.00036952375620574794, "loss": 3.4355594635009767, "step": 9210 }, { "epoch": 0.35664896960553927, "grad_norm": 0.2734375, "learning_rate": 0.0003692640166678692, "loss": 3.431700897216797, "step": 9220 }, { "epoch": 0.35703579061378826, "grad_norm": 0.255859375, "learning_rate": 0.0003690041169965136, "loss": 3.4387435913085938, "step": 9230 }, { "epoch": 0.3574226116220372, "grad_norm": 0.25390625, "learning_rate": 0.00036874405758150023, "loss": 3.432315444946289, "step": 9240 }, { "epoch": 0.35780943263028614, "grad_norm": 0.26171875, "learning_rate": 0.0003684838388128876, "loss": 3.4304718017578124, "step": 9250 }, { "epoch": 0.35819625363853513, "grad_norm": 0.279296875, "learning_rate": 0.00036822346108097325, "loss": 3.3982025146484376, "step": 9260 }, { "epoch": 0.3585830746467841, "grad_norm": 0.26171875, "learning_rate": 0.0003679629247762933, "loss": 3.4113441467285157, "step": 9270 }, { "epoch": 0.358969895655033, "grad_norm": 0.2734375, "learning_rate": 0.00036770223028962144, "loss": 3.4584545135498046, "step": 9280 }, { "epoch": 0.359356716663282, "grad_norm": 0.248046875, "learning_rate": 0.0003674413780119688, "loss": 3.469136047363281, "step": 9290 }, { "epoch": 0.35974353767153094, "grad_norm": 0.2490234375, "learning_rate": 0.0003671803683345832, "loss": 3.3828174591064455, "step": 9300 }, { "epoch": 0.35974353767153094, "eval_loss": 3.91288423538208, "eval_runtime": 10.0525, "eval_samples_per_second": 32.529, "eval_steps_per_second": 2.089, "step": 9300 }, { "epoch": 0.3601303586797799, "grad_norm": 0.265625, "learning_rate": 0.0003669192016489484, "loss": 3.386565399169922, "step": 9310 }, { "epoch": 0.3605171796880289, "grad_norm": 0.25390625, "learning_rate": 0.0003666578783467837, "loss": 3.4089500427246096, "step": 9320 }, { "epoch": 0.3609040006962778, "grad_norm": 0.265625, "learning_rate": 0.0003663963988200435, "loss": 3.418537902832031, "step": 9330 }, { "epoch": 0.36129082170452675, "grad_norm": 0.2734375, "learning_rate": 0.00036613476346091623, "loss": 3.421380615234375, "step": 9340 }, { "epoch": 0.36167764271277575, "grad_norm": 0.255859375, "learning_rate": 0.0003658729726618242, "loss": 3.441343307495117, "step": 9350 }, { "epoch": 0.3620644637210247, "grad_norm": 0.2431640625, "learning_rate": 0.0003656110268154228, "loss": 3.3920360565185548, "step": 9360 }, { "epoch": 0.3624512847292736, "grad_norm": 0.287109375, "learning_rate": 0.0003653489263146001, "loss": 3.4329292297363283, "step": 9370 }, { "epoch": 0.3628381057375226, "grad_norm": 0.25390625, "learning_rate": 0.00036508667155247604, "loss": 3.4128143310546877, "step": 9380 }, { "epoch": 0.36322492674577156, "grad_norm": 0.2353515625, "learning_rate": 0.00036482426292240187, "loss": 3.453541564941406, "step": 9390 }, { "epoch": 0.3636117477540205, "grad_norm": 0.267578125, "learning_rate": 0.00036456170081795977, "loss": 3.422444152832031, "step": 9400 }, { "epoch": 0.3636117477540205, "eval_loss": 3.9018635749816895, "eval_runtime": 10.0801, "eval_samples_per_second": 32.44, "eval_steps_per_second": 2.083, "step": 9400 }, { "epoch": 0.3639985687622695, "grad_norm": 0.25, "learning_rate": 0.00036429898563296195, "loss": 3.4397987365722655, "step": 9410 }, { "epoch": 0.36438538977051843, "grad_norm": 0.263671875, "learning_rate": 0.00036403611776145037, "loss": 3.4169151306152346, "step": 9420 }, { "epoch": 0.36477221077876737, "grad_norm": 0.267578125, "learning_rate": 0.00036377309759769594, "loss": 3.412881088256836, "step": 9430 }, { "epoch": 0.36515903178701636, "grad_norm": 0.25, "learning_rate": 0.00036350992553619795, "loss": 3.4701351165771483, "step": 9440 }, { "epoch": 0.3655458527952653, "grad_norm": 0.26171875, "learning_rate": 0.0003632466019716836, "loss": 3.4168781280517577, "step": 9450 }, { "epoch": 0.36593267380351424, "grad_norm": 0.255859375, "learning_rate": 0.00036298312729910734, "loss": 3.415391540527344, "step": 9460 }, { "epoch": 0.36631949481176324, "grad_norm": 0.26953125, "learning_rate": 0.00036271950191365, "loss": 3.4176471710205076, "step": 9470 }, { "epoch": 0.3667063158200122, "grad_norm": 0.26171875, "learning_rate": 0.00036245572621071897, "loss": 3.3979991912841796, "step": 9480 }, { "epoch": 0.36709313682826117, "grad_norm": 0.263671875, "learning_rate": 0.0003621918005859466, "loss": 3.4499542236328127, "step": 9490 }, { "epoch": 0.3674799578365101, "grad_norm": 0.265625, "learning_rate": 0.00036192772543519044, "loss": 3.3763500213623048, "step": 9500 }, { "epoch": 0.3674799578365101, "eval_loss": 3.875546932220459, "eval_runtime": 10.0346, "eval_samples_per_second": 32.587, "eval_steps_per_second": 2.093, "step": 9500 }, { "epoch": 0.36786677884475905, "grad_norm": 0.25390625, "learning_rate": 0.000361663501154532, "loss": 3.4191715240478517, "step": 9510 }, { "epoch": 0.36825359985300804, "grad_norm": 0.259765625, "learning_rate": 0.0003613991281402768, "loss": 3.4267364501953126, "step": 9520 }, { "epoch": 0.368640420861257, "grad_norm": 0.267578125, "learning_rate": 0.0003611346067889533, "loss": 3.4404712677001954, "step": 9530 }, { "epoch": 0.3690272418695059, "grad_norm": 0.2734375, "learning_rate": 0.0003608699374973123, "loss": 3.358293151855469, "step": 9540 }, { "epoch": 0.3694140628777549, "grad_norm": 0.265625, "learning_rate": 0.0003606051206623267, "loss": 3.370107650756836, "step": 9550 }, { "epoch": 0.36980088388600385, "grad_norm": 0.26171875, "learning_rate": 0.00036034015668119065, "loss": 3.4077564239501954, "step": 9560 }, { "epoch": 0.3701877048942528, "grad_norm": 0.2451171875, "learning_rate": 0.0003600750459513189, "loss": 3.4234764099121096, "step": 9570 }, { "epoch": 0.3705745259025018, "grad_norm": 0.271484375, "learning_rate": 0.0003598097888703466, "loss": 3.3569828033447267, "step": 9580 }, { "epoch": 0.3709613469107507, "grad_norm": 0.267578125, "learning_rate": 0.0003595443858361279, "loss": 3.4103553771972654, "step": 9590 }, { "epoch": 0.37134816791899966, "grad_norm": 0.2890625, "learning_rate": 0.00035927883724673644, "loss": 3.4405521392822265, "step": 9600 }, { "epoch": 0.37134816791899966, "eval_loss": 3.883023738861084, "eval_runtime": 10.0477, "eval_samples_per_second": 32.545, "eval_steps_per_second": 2.09, "step": 9600 }, { "epoch": 0.37173498892724866, "grad_norm": 0.27734375, "learning_rate": 0.0003590131435004636, "loss": 3.419297790527344, "step": 9610 }, { "epoch": 0.3721218099354976, "grad_norm": 0.296875, "learning_rate": 0.0003587473049958191, "loss": 3.4245758056640625, "step": 9620 }, { "epoch": 0.37250863094374653, "grad_norm": 0.25390625, "learning_rate": 0.0003584813221315292, "loss": 3.40887336730957, "step": 9630 }, { "epoch": 0.3728954519519955, "grad_norm": 0.267578125, "learning_rate": 0.00035821519530653695, "loss": 3.4069156646728516, "step": 9640 }, { "epoch": 0.37328227296024447, "grad_norm": 0.25, "learning_rate": 0.0003579489249200014, "loss": 3.4280853271484375, "step": 9650 }, { "epoch": 0.3736690939684934, "grad_norm": 0.25390625, "learning_rate": 0.0003576825113712968, "loss": 3.422659683227539, "step": 9660 }, { "epoch": 0.3740559149767424, "grad_norm": 0.267578125, "learning_rate": 0.00035741595506001223, "loss": 3.39489631652832, "step": 9670 }, { "epoch": 0.37444273598499134, "grad_norm": 0.2373046875, "learning_rate": 0.0003571492563859508, "loss": 3.4341705322265623, "step": 9680 }, { "epoch": 0.3748295569932403, "grad_norm": 0.271484375, "learning_rate": 0.000356882415749129, "loss": 3.4342811584472654, "step": 9690 }, { "epoch": 0.37521637800148927, "grad_norm": 0.248046875, "learning_rate": 0.0003566154335497767, "loss": 3.4240440368652343, "step": 9700 }, { "epoch": 0.37521637800148927, "eval_loss": 3.8837051391601562, "eval_runtime": 10.0201, "eval_samples_per_second": 32.634, "eval_steps_per_second": 2.096, "step": 9700 }, { "epoch": 0.3756031990097382, "grad_norm": 0.251953125, "learning_rate": 0.0003563483101883356, "loss": 3.4255138397216798, "step": 9710 }, { "epoch": 0.3759900200179872, "grad_norm": 0.265625, "learning_rate": 0.0003560810460654595, "loss": 3.4189659118652345, "step": 9720 }, { "epoch": 0.37637684102623614, "grad_norm": 0.2578125, "learning_rate": 0.0003558136415820131, "loss": 3.4093570709228516, "step": 9730 }, { "epoch": 0.3767636620344851, "grad_norm": 0.25390625, "learning_rate": 0.0003555460971390717, "loss": 3.3877967834472655, "step": 9740 }, { "epoch": 0.3771504830427341, "grad_norm": 0.2578125, "learning_rate": 0.00035527841313792046, "loss": 3.4528697967529296, "step": 9750 }, { "epoch": 0.377537304050983, "grad_norm": 0.265625, "learning_rate": 0.000355010589980054, "loss": 3.4023715972900392, "step": 9760 }, { "epoch": 0.37792412505923195, "grad_norm": 0.25, "learning_rate": 0.0003547426280671756, "loss": 3.4020904541015624, "step": 9770 }, { "epoch": 0.37831094606748095, "grad_norm": 0.255859375, "learning_rate": 0.00035447452780119654, "loss": 3.3937957763671873, "step": 9780 }, { "epoch": 0.3786977670757299, "grad_norm": 0.25390625, "learning_rate": 0.0003542062895842358, "loss": 3.420269775390625, "step": 9790 }, { "epoch": 0.3790845880839788, "grad_norm": 0.25, "learning_rate": 0.0003539379138186191, "loss": 3.3751293182373048, "step": 9800 }, { "epoch": 0.3790845880839788, "eval_loss": 3.911559820175171, "eval_runtime": 10.0374, "eval_samples_per_second": 32.578, "eval_steps_per_second": 2.092, "step": 9800 }, { "epoch": 0.3794714090922278, "grad_norm": 0.255859375, "learning_rate": 0.00035366940090687864, "loss": 3.405370330810547, "step": 9810 }, { "epoch": 0.37985823010047676, "grad_norm": 0.251953125, "learning_rate": 0.00035340075125175213, "loss": 3.389670181274414, "step": 9820 }, { "epoch": 0.3802450511087257, "grad_norm": 0.25390625, "learning_rate": 0.0003531319652561825, "loss": 3.3794952392578126, "step": 9830 }, { "epoch": 0.3806318721169747, "grad_norm": 0.26953125, "learning_rate": 0.00035286304332331724, "loss": 3.402521514892578, "step": 9840 }, { "epoch": 0.38101869312522363, "grad_norm": 0.2451171875, "learning_rate": 0.0003525939858565076, "loss": 3.430156707763672, "step": 9850 }, { "epoch": 0.38140551413347257, "grad_norm": 0.251953125, "learning_rate": 0.0003523247932593081, "loss": 3.4212566375732423, "step": 9860 }, { "epoch": 0.38179233514172156, "grad_norm": 0.251953125, "learning_rate": 0.00035205546593547606, "loss": 3.4265159606933593, "step": 9870 }, { "epoch": 0.3821791561499705, "grad_norm": 0.259765625, "learning_rate": 0.00035178600428897075, "loss": 3.4060302734375, "step": 9880 }, { "epoch": 0.38256597715821944, "grad_norm": 0.2490234375, "learning_rate": 0.0003515164087239529, "loss": 3.4170459747314452, "step": 9890 }, { "epoch": 0.38295279816646843, "grad_norm": 0.26171875, "learning_rate": 0.00035124667964478434, "loss": 3.3865825653076174, "step": 9900 }, { "epoch": 0.38295279816646843, "eval_loss": 3.8762545585632324, "eval_runtime": 10.0396, "eval_samples_per_second": 32.571, "eval_steps_per_second": 2.092, "step": 9900 }, { "epoch": 0.38333961917471737, "grad_norm": 0.25390625, "learning_rate": 0.00035097681745602705, "loss": 3.4357513427734374, "step": 9910 }, { "epoch": 0.3837264401829663, "grad_norm": 0.2734375, "learning_rate": 0.0003507068225624423, "loss": 3.393326187133789, "step": 9920 }, { "epoch": 0.3841132611912153, "grad_norm": 0.255859375, "learning_rate": 0.00035043669536899104, "loss": 3.4443363189697265, "step": 9930 }, { "epoch": 0.38450008219946424, "grad_norm": 0.255859375, "learning_rate": 0.00035016643628083194, "loss": 3.415657806396484, "step": 9940 }, { "epoch": 0.38488690320771324, "grad_norm": 0.267578125, "learning_rate": 0.00034989604570332224, "loss": 3.425619125366211, "step": 9950 }, { "epoch": 0.3852737242159622, "grad_norm": 0.26953125, "learning_rate": 0.00034962552404201573, "loss": 3.3953113555908203, "step": 9960 }, { "epoch": 0.3856605452242111, "grad_norm": 0.267578125, "learning_rate": 0.0003493548717026633, "loss": 3.4209903717041015, "step": 9970 }, { "epoch": 0.3860473662324601, "grad_norm": 0.26171875, "learning_rate": 0.00034908408909121145, "loss": 3.3913738250732424, "step": 9980 }, { "epoch": 0.38643418724070905, "grad_norm": 0.267578125, "learning_rate": 0.0003488131766138026, "loss": 3.3826934814453127, "step": 9990 }, { "epoch": 0.386821008248958, "grad_norm": 0.2421875, "learning_rate": 0.0003485421346767733, "loss": 3.424589157104492, "step": 10000 }, { "epoch": 0.386821008248958, "eval_loss": 3.8753442764282227, "eval_runtime": 10.0275, "eval_samples_per_second": 32.61, "eval_steps_per_second": 2.094, "step": 10000 }, { "epoch": 0.387207829257207, "grad_norm": 0.314453125, "learning_rate": 0.0003482709636866547, "loss": 3.408251953125, "step": 10010 }, { "epoch": 0.3875946502654559, "grad_norm": 0.2734375, "learning_rate": 0.0003479996640501714, "loss": 3.392727279663086, "step": 10020 }, { "epoch": 0.38798147127370486, "grad_norm": 0.232421875, "learning_rate": 0.00034772823617424103, "loss": 3.420479583740234, "step": 10030 }, { "epoch": 0.38836829228195385, "grad_norm": 0.30078125, "learning_rate": 0.0003474566804659735, "loss": 3.4015888214111327, "step": 10040 }, { "epoch": 0.3887551132902028, "grad_norm": 0.2734375, "learning_rate": 0.0003471849973326705, "loss": 3.4193763732910156, "step": 10050 }, { "epoch": 0.38914193429845173, "grad_norm": 0.26171875, "learning_rate": 0.0003469131871818247, "loss": 3.402726745605469, "step": 10060 }, { "epoch": 0.3895287553067007, "grad_norm": 0.2578125, "learning_rate": 0.00034664125042111935, "loss": 3.384511947631836, "step": 10070 }, { "epoch": 0.38991557631494966, "grad_norm": 0.26171875, "learning_rate": 0.0003463691874584277, "loss": 3.396898651123047, "step": 10080 }, { "epoch": 0.3903023973231986, "grad_norm": 0.2392578125, "learning_rate": 0.0003460969987018123, "loss": 3.417254638671875, "step": 10090 }, { "epoch": 0.3906892183314476, "grad_norm": 0.26953125, "learning_rate": 0.0003458246845595241, "loss": 3.3982513427734373, "step": 10100 }, { "epoch": 0.3906892183314476, "eval_loss": 3.85249662399292, "eval_runtime": 10.0512, "eval_samples_per_second": 32.533, "eval_steps_per_second": 2.089, "step": 10100 } ], "logging_steps": 10, "max_steps": 25852, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 100, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 6.379493380639949e+18, "train_batch_size": 32, "trial_name": null, "trial_params": null }