Files
vintage-LLM-340m-v1-base/trainer_state.json

7920 lines
198 KiB
JSON
Raw Permalink Normal View History

{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.3906892183314476,
"eval_steps": 100,
"global_step": 10100,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 7.736345350456444e-05,
"grad_norm": 8.75,
"learning_rate": 0.0,
"loss": 10.56122875213623,
"step": 1
},
{
"epoch": 0.0007736345350456444,
"grad_norm": 6.9375,
"learning_rate": 2.2499999999999998e-05,
"loss": 10.371153089735243,
"step": 10
},
{
"epoch": 0.0015472690700912889,
"grad_norm": 1.65625,
"learning_rate": 4.75e-05,
"loss": 9.225128936767579,
"step": 20
},
{
"epoch": 0.002320903605136933,
"grad_norm": 1.2421875,
"learning_rate": 7.25e-05,
"loss": 8.501903533935547,
"step": 30
},
{
"epoch": 0.0030945381401825778,
"grad_norm": 0.8984375,
"learning_rate": 9.750000000000001e-05,
"loss": 7.907857513427734,
"step": 40
},
{
"epoch": 0.0038681726752282223,
"grad_norm": 0.65234375,
"learning_rate": 0.0001225,
"loss": 7.374447631835937,
"step": 50
},
{
"epoch": 0.004641807210273866,
"grad_norm": 1.703125,
"learning_rate": 0.0001475,
"loss": 7.100068664550781,
"step": 60
},
{
"epoch": 0.005415441745319511,
"grad_norm": 0.80859375,
"learning_rate": 0.0001725,
"loss": 6.936636352539063,
"step": 70
},
{
"epoch": 0.0061890762803651555,
"grad_norm": 0.6484375,
"learning_rate": 0.0001975,
"loss": 6.7047271728515625,
"step": 80
},
{
"epoch": 0.0069627108154108,
"grad_norm": 0.72265625,
"learning_rate": 0.00022250000000000001,
"loss": 6.5551597595214846,
"step": 90
},
{
"epoch": 0.007736345350456445,
"grad_norm": 0.8984375,
"learning_rate": 0.0002475,
"loss": 6.410359191894531,
"step": 100
},
{
"epoch": 0.007736345350456445,
"eval_loss": 6.641254425048828,
"eval_runtime": 8.5584,
"eval_samples_per_second": 38.208,
"eval_steps_per_second": 1.285,
"step": 100
},
{
"epoch": 0.00850997988550209,
"grad_norm": 0.83984375,
"learning_rate": 0.0002725,
"loss": 6.291374969482422,
"step": 110
},
{
"epoch": 0.009283614420547733,
"grad_norm": 1.40625,
"learning_rate": 0.00029749999999999997,
"loss": 6.181984710693359,
"step": 120
},
{
"epoch": 0.010057248955593378,
"grad_norm": 0.67578125,
"learning_rate": 0.00032250000000000003,
"loss": 6.108818435668946,
"step": 130
},
{
"epoch": 0.010830883490639022,
"grad_norm": 1.109375,
"learning_rate": 0.0003475,
"loss": 6.005937576293945,
"step": 140
},
{
"epoch": 0.011604518025684667,
"grad_norm": 0.73046875,
"learning_rate": 0.0003725,
"loss": 5.927522277832031,
"step": 150
},
{
"epoch": 0.012378152560730311,
"grad_norm": 1.015625,
"learning_rate": 0.0003975,
"loss": 5.850825500488281,
"step": 160
},
{
"epoch": 0.013151787095775955,
"grad_norm": 1.296875,
"learning_rate": 0.00042249999999999997,
"loss": 5.774515533447266,
"step": 170
},
{
"epoch": 0.0139254216308216,
"grad_norm": 0.7890625,
"learning_rate": 0.00044750000000000004,
"loss": 5.700082015991211,
"step": 180
},
{
"epoch": 0.014699056165867244,
"grad_norm": 1.0546875,
"learning_rate": 0.0004725,
"loss": 5.627538681030273,
"step": 190
},
{
"epoch": 0.01547269070091289,
"grad_norm": 0.859375,
"learning_rate": 0.0004975,
"loss": 5.560461044311523,
"step": 200
},
{
"epoch": 0.01547269070091289,
"eval_loss": 6.039037227630615,
"eval_runtime": 8.5816,
"eval_samples_per_second": 38.105,
"eval_steps_per_second": 1.282,
"step": 200
},
{
"epoch": 0.016246325235958533,
"grad_norm": 1.375,
"learning_rate": 0.000499999413815452,
"loss": 5.472032928466797,
"step": 210
},
{
"epoch": 0.01701995977100418,
"grad_norm": 0.95703125,
"learning_rate": 0.000499997387502211,
"loss": 5.414741897583008,
"step": 220
},
{
"epoch": 0.017793594306049824,
"grad_norm": 0.8359375,
"learning_rate": 0.0004999939138357763,
"loss": 5.374539947509765,
"step": 230
},
{
"epoch": 0.018567228841095466,
"grad_norm": 0.482421875,
"learning_rate": 0.0004999889928373172,
"loss": 5.2854866027832035,
"step": 240
},
{
"epoch": 0.01934086337614111,
"grad_norm": 0.97265625,
"learning_rate": 0.0004999826245368231,
"loss": 5.209839630126953,
"step": 250
},
{
"epoch": 0.020114497911186757,
"grad_norm": 0.69921875,
"learning_rate": 0.0004999748089731037,
"loss": 5.24133071899414,
"step": 260
},
{
"epoch": 0.0208881324462324,
"grad_norm": 0.328125,
"learning_rate": 0.0004999655461937884,
"loss": 5.189028549194336,
"step": 270
},
{
"epoch": 0.021661766981278044,
"grad_norm": 0.294921875,
"learning_rate": 0.0004999548362553265,
"loss": 5.089565658569336,
"step": 280
},
{
"epoch": 0.02243540151632369,
"grad_norm": 0.96484375,
"learning_rate": 0.0004999426792229862,
"loss": 5.108868789672852,
"step": 290
},
{
"epoch": 0.023209036051369335,
"grad_norm": 0.30859375,
"learning_rate": 0.0004999290751708547,
"loss": 5.045867919921875,
"step": 300
},
{
"epoch": 0.023209036051369335,
"eval_loss": 5.63018274307251,
"eval_runtime": 8.5483,
"eval_samples_per_second": 38.253,
"eval_steps_per_second": 1.287,
"step": 300
},
{
"epoch": 0.023982670586414977,
"grad_norm": 0.55859375,
"learning_rate": 0.0004999140241818376,
"loss": 4.964016342163086,
"step": 310
},
{
"epoch": 0.024756305121460622,
"grad_norm": 0.96484375,
"learning_rate": 0.0004998975263476584,
"loss": 4.973379516601563,
"step": 320
},
{
"epoch": 0.025529939656506268,
"grad_norm": 0.341796875,
"learning_rate": 0.0004998795817688582,
"loss": 4.920859909057617,
"step": 330
},
{
"epoch": 0.02630357419155191,
"grad_norm": 0.318359375,
"learning_rate": 0.0004998601905547944,
"loss": 4.873758316040039,
"step": 340
},
{
"epoch": 0.027077208726597555,
"grad_norm": 0.7109375,
"learning_rate": 0.0004998393528236405,
"loss": 4.859211349487305,
"step": 350
},
{
"epoch": 0.0278508432616432,
"grad_norm": 0.328125,
"learning_rate": 0.000499817068702386,
"loss": 4.848406219482422,
"step": 360
},
{
"epoch": 0.028624477796688846,
"grad_norm": 0.29296875,
"learning_rate": 0.0004997933383268339,
"loss": 4.7945610046386715,
"step": 370
},
{
"epoch": 0.029398112331734488,
"grad_norm": 0.75,
"learning_rate": 0.0004997681618416019,
"loss": 4.757486343383789,
"step": 380
},
{
"epoch": 0.030171746866780133,
"grad_norm": 0.369140625,
"learning_rate": 0.0004997415394001201,
"loss": 4.792052459716797,
"step": 390
},
{
"epoch": 0.03094538140182578,
"grad_norm": 0.2373046875,
"learning_rate": 0.0004997134711646306,
"loss": 4.726931381225586,
"step": 400
},
{
"epoch": 0.03094538140182578,
"eval_loss": 5.367307662963867,
"eval_runtime": 8.5603,
"eval_samples_per_second": 38.2,
"eval_steps_per_second": 1.285,
"step": 400
},
{
"epoch": 0.031719015936871424,
"grad_norm": 0.65234375,
"learning_rate": 0.0004996839573061863,
"loss": 4.671530151367188,
"step": 410
},
{
"epoch": 0.032492650471917066,
"grad_norm": 0.427734375,
"learning_rate": 0.0004996529980046502,
"loss": 4.672796630859375,
"step": 420
},
{
"epoch": 0.03326628500696271,
"grad_norm": 0.30859375,
"learning_rate": 0.0004996205934486943,
"loss": 4.658016204833984,
"step": 430
},
{
"epoch": 0.03403991954200836,
"grad_norm": 0.38671875,
"learning_rate": 0.0004995867438357975,
"loss": 4.623857498168945,
"step": 440
},
{
"epoch": 0.034813554077054,
"grad_norm": 0.578125,
"learning_rate": 0.000499551449372246,
"loss": 4.6056865692138675,
"step": 450
},
{
"epoch": 0.03558718861209965,
"grad_norm": 0.5,
"learning_rate": 0.0004995147102731307,
"loss": 4.593499374389649,
"step": 460
},
{
"epoch": 0.03636082314714529,
"grad_norm": 0.27734375,
"learning_rate": 0.0004994765267623465,
"loss": 4.58136100769043,
"step": 470
},
{
"epoch": 0.03713445768219093,
"grad_norm": 0.294921875,
"learning_rate": 0.0004994368990725909,
"loss": 4.534087753295898,
"step": 480
},
{
"epoch": 0.03790809221723658,
"grad_norm": 0.50390625,
"learning_rate": 0.0004993958274453623,
"loss": 4.540646743774414,
"step": 490
},
{
"epoch": 0.03868172675228222,
"grad_norm": 0.6171875,
"learning_rate": 0.0004993533121309587,
"loss": 4.509712219238281,
"step": 500
},
{
"epoch": 0.03868172675228222,
"eval_loss": 5.2208099365234375,
"eval_runtime": 8.5343,
"eval_samples_per_second": 38.316,
"eval_steps_per_second": 1.289,
"step": 500
},
{
"epoch": 0.039455361287327864,
"grad_norm": 0.2431640625,
"learning_rate": 0.0004993093533884765,
"loss": 4.509745407104492,
"step": 510
},
{
"epoch": 0.04022899582237351,
"grad_norm": 0.3359375,
"learning_rate": 0.0004992639514858084,
"loss": 4.446602249145508,
"step": 520
},
{
"epoch": 0.041002630357419155,
"grad_norm": 0.33984375,
"learning_rate": 0.0004992171066996421,
"loss": 4.452914428710938,
"step": 530
},
{
"epoch": 0.0417762648924648,
"grad_norm": 0.263671875,
"learning_rate": 0.0004991688193154583,
"loss": 4.4591011047363285,
"step": 540
},
{
"epoch": 0.042549899427510446,
"grad_norm": 0.455078125,
"learning_rate": 0.0004991190896275294,
"loss": 4.453225326538086,
"step": 550
},
{
"epoch": 0.04332353396255609,
"grad_norm": 0.318359375,
"learning_rate": 0.0004990679179389172,
"loss": 4.408919143676758,
"step": 560
},
{
"epoch": 0.04409716849760173,
"grad_norm": 0.2373046875,
"learning_rate": 0.0004990153045614716,
"loss": 4.396371078491211,
"step": 570
},
{
"epoch": 0.04487080303264738,
"grad_norm": 0.3203125,
"learning_rate": 0.0004989612498158283,
"loss": 4.394485855102539,
"step": 580
},
{
"epoch": 0.04564443756769302,
"grad_norm": 0.453125,
"learning_rate": 0.0004989057540314069,
"loss": 4.370931625366211,
"step": 590
},
{
"epoch": 0.04641807210273867,
"grad_norm": 0.248046875,
"learning_rate": 0.0004988488175464091,
"loss": 4.387384033203125,
"step": 600
},
{
"epoch": 0.04641807210273867,
"eval_loss": 5.092612266540527,
"eval_runtime": 8.6148,
"eval_samples_per_second": 37.958,
"eval_steps_per_second": 1.277,
"step": 600
},
{
"epoch": 0.04719170663778431,
"grad_norm": 0.306640625,
"learning_rate": 0.0004987904407078164,
"loss": 4.3401447296142575,
"step": 610
},
{
"epoch": 0.04796534117282995,
"grad_norm": 0.328125,
"learning_rate": 0.000498730623871388,
"loss": 4.367118835449219,
"step": 620
},
{
"epoch": 0.0487389757078756,
"grad_norm": 0.26171875,
"learning_rate": 0.0004986693674016589,
"loss": 4.342254257202148,
"step": 630
},
{
"epoch": 0.049512610242921244,
"grad_norm": 0.36328125,
"learning_rate": 0.0004986066716719372,
"loss": 4.318671798706054,
"step": 640
},
{
"epoch": 0.050286244777966886,
"grad_norm": 0.27734375,
"learning_rate": 0.0004985425370643027,
"loss": 4.326435089111328,
"step": 650
},
{
"epoch": 0.051059879313012535,
"grad_norm": 0.275390625,
"learning_rate": 0.0004984769639696033,
"loss": 4.320156860351562,
"step": 660
},
{
"epoch": 0.05183351384805818,
"grad_norm": 0.283203125,
"learning_rate": 0.0004984099527874539,
"loss": 4.2882133483886715,
"step": 670
},
{
"epoch": 0.05260714838310382,
"grad_norm": 0.224609375,
"learning_rate": 0.0004983415039262328,
"loss": 4.269629669189453,
"step": 680
},
{
"epoch": 0.05338078291814947,
"grad_norm": 0.30859375,
"learning_rate": 0.0004982716178030802,
"loss": 4.244283676147461,
"step": 690
},
{
"epoch": 0.05415441745319511,
"grad_norm": 0.33984375,
"learning_rate": 0.000498200294843895,
"loss": 4.2871452331542965,
"step": 700
},
{
"epoch": 0.05415441745319511,
"eval_loss": 4.956212043762207,
"eval_runtime": 8.6126,
"eval_samples_per_second": 37.968,
"eval_steps_per_second": 1.277,
"step": 700
},
{
"epoch": 0.05492805198824075,
"grad_norm": 0.294921875,
"learning_rate": 0.0004981275354833328,
"loss": 4.227527236938476,
"step": 710
},
{
"epoch": 0.0557016865232864,
"grad_norm": 0.263671875,
"learning_rate": 0.0004980533401648026,
"loss": 4.238017654418945,
"step": 720
},
{
"epoch": 0.05647532105833204,
"grad_norm": 0.283203125,
"learning_rate": 0.0004979777093404642,
"loss": 4.230612945556641,
"step": 730
},
{
"epoch": 0.05724895559337769,
"grad_norm": 0.302734375,
"learning_rate": 0.0004979006434712263,
"loss": 4.228169250488281,
"step": 740
},
{
"epoch": 0.05802259012842333,
"grad_norm": 0.375,
"learning_rate": 0.0004978221430267422,
"loss": 4.209581756591797,
"step": 750
},
{
"epoch": 0.058796224663468975,
"grad_norm": 0.29296875,
"learning_rate": 0.0004977422084854085,
"loss": 4.2135154724121096,
"step": 760
},
{
"epoch": 0.059569859198514624,
"grad_norm": 0.234375,
"learning_rate": 0.000497660840334361,
"loss": 4.225874710083008,
"step": 770
},
{
"epoch": 0.060343493733560266,
"grad_norm": 0.251953125,
"learning_rate": 0.0004975780390694723,
"loss": 4.196949768066406,
"step": 780
},
{
"epoch": 0.06111712826860591,
"grad_norm": 0.265625,
"learning_rate": 0.0004974938051953488,
"loss": 4.196494674682617,
"step": 790
},
{
"epoch": 0.06189076280365156,
"grad_norm": 0.228515625,
"learning_rate": 0.0004974081392253274,
"loss": 4.1752674102783205,
"step": 800
},
{
"epoch": 0.06189076280365156,
"eval_loss": 4.886258602142334,
"eval_runtime": 8.574,
"eval_samples_per_second": 38.138,
"eval_steps_per_second": 1.283,
"step": 800
},
{
"epoch": 0.0626643973386972,
"grad_norm": 0.310546875,
"learning_rate": 0.0004973210416814722,
"loss": 4.171138763427734,
"step": 810
},
{
"epoch": 0.06343803187374285,
"grad_norm": 0.205078125,
"learning_rate": 0.000497232513094572,
"loss": 4.168529891967774,
"step": 820
},
{
"epoch": 0.06421166640878849,
"grad_norm": 0.302734375,
"learning_rate": 0.0004971425540041365,
"loss": 4.1555931091308596,
"step": 830
},
{
"epoch": 0.06498530094383413,
"grad_norm": 0.275390625,
"learning_rate": 0.000497051164958393,
"loss": 4.1395000457763675,
"step": 840
},
{
"epoch": 0.06575893547887977,
"grad_norm": 0.2734375,
"learning_rate": 0.0004969583465142832,
"loss": 4.131367111206055,
"step": 850
},
{
"epoch": 0.06653257001392542,
"grad_norm": 0.240234375,
"learning_rate": 0.0004968640992374602,
"loss": 4.145170211791992,
"step": 860
},
{
"epoch": 0.06730620454897107,
"grad_norm": 0.26953125,
"learning_rate": 0.0004967684237022843,
"loss": 4.137904357910156,
"step": 870
},
{
"epoch": 0.06807983908401671,
"grad_norm": 0.2373046875,
"learning_rate": 0.0004966713204918199,
"loss": 4.099301528930664,
"step": 880
},
{
"epoch": 0.06885347361906236,
"grad_norm": 0.2333984375,
"learning_rate": 0.0004965727901978322,
"loss": 4.081951522827149,
"step": 890
},
{
"epoch": 0.069627108154108,
"grad_norm": 0.2275390625,
"learning_rate": 0.0004964728334207829,
"loss": 4.109021377563477,
"step": 900
},
{
"epoch": 0.069627108154108,
"eval_loss": 4.80100154876709,
"eval_runtime": 8.5773,
"eval_samples_per_second": 38.124,
"eval_steps_per_second": 1.282,
"step": 900
},
{
"epoch": 0.07040074268915364,
"grad_norm": 0.23046875,
"learning_rate": 0.0004963714507698272,
"loss": 4.122850036621093,
"step": 910
},
{
"epoch": 0.0711743772241993,
"grad_norm": 0.302734375,
"learning_rate": 0.0004962686428628099,
"loss": 4.123403930664063,
"step": 920
},
{
"epoch": 0.07194801175924494,
"grad_norm": 0.1953125,
"learning_rate": 0.0004961644103262615,
"loss": 4.103722763061524,
"step": 930
},
{
"epoch": 0.07272164629429058,
"grad_norm": 0.208984375,
"learning_rate": 0.0004960587537953944,
"loss": 4.106454086303711,
"step": 940
},
{
"epoch": 0.07349528082933622,
"grad_norm": 0.2294921875,
"learning_rate": 0.000495951673914099,
"loss": 4.093786239624023,
"step": 950
},
{
"epoch": 0.07426891536438186,
"grad_norm": 0.224609375,
"learning_rate": 0.0004958431713349402,
"loss": 4.103993225097656,
"step": 960
},
{
"epoch": 0.0750425498994275,
"grad_norm": 0.228515625,
"learning_rate": 0.0004957332467191527,
"loss": 4.083438491821289,
"step": 970
},
{
"epoch": 0.07581618443447316,
"grad_norm": 0.2294921875,
"learning_rate": 0.0004956219007366376,
"loss": 4.068552780151367,
"step": 980
},
{
"epoch": 0.0765898189695188,
"grad_norm": 0.275390625,
"learning_rate": 0.000495509134065958,
"loss": 4.07377815246582,
"step": 990
},
{
"epoch": 0.07736345350456444,
"grad_norm": 0.2265625,
"learning_rate": 0.0004953949473943349,
"loss": 4.056775283813477,
"step": 1000
},
{
"epoch": 0.07736345350456444,
"eval_loss": 4.741029739379883,
"eval_runtime": 8.5971,
"eval_samples_per_second": 38.036,
"eval_steps_per_second": 1.279,
"step": 1000
},
{
"epoch": 0.07813708803961009,
"grad_norm": 0.255859375,
"learning_rate": 0.0004952793414176431,
"loss": 4.064179992675781,
"step": 1010
},
{
"epoch": 0.07891072257465573,
"grad_norm": 0.2392578125,
"learning_rate": 0.0004951623168404069,
"loss": 4.05681266784668,
"step": 1020
},
{
"epoch": 0.07968435710970137,
"grad_norm": 0.201171875,
"learning_rate": 0.0004950438743757959,
"loss": 4.0333606719970705,
"step": 1030
},
{
"epoch": 0.08045799164474703,
"grad_norm": 0.2421875,
"learning_rate": 0.0004949240147456203,
"loss": 4.008632659912109,
"step": 1040
},
{
"epoch": 0.08123162617979267,
"grad_norm": 0.232421875,
"learning_rate": 0.0004948027386803271,
"loss": 4.046485900878906,
"step": 1050
},
{
"epoch": 0.08200526071483831,
"grad_norm": 0.20703125,
"learning_rate": 0.0004946800469189951,
"loss": 4.016164016723633,
"step": 1060
},
{
"epoch": 0.08277889524988395,
"grad_norm": 0.24609375,
"learning_rate": 0.0004945559402093307,
"loss": 4.027731704711914,
"step": 1070
},
{
"epoch": 0.0835525297849296,
"grad_norm": 0.216796875,
"learning_rate": 0.0004944304193076633,
"loss": 4.006626892089844,
"step": 1080
},
{
"epoch": 0.08432616431997525,
"grad_norm": 0.2578125,
"learning_rate": 0.0004943034849789404,
"loss": 4.007661056518555,
"step": 1090
},
{
"epoch": 0.08509979885502089,
"grad_norm": 0.216796875,
"learning_rate": 0.0004941751379967235,
"loss": 4.004118347167969,
"step": 1100
},
{
"epoch": 0.08509979885502089,
"eval_loss": 4.684783935546875,
"eval_runtime": 8.5416,
"eval_samples_per_second": 38.283,
"eval_steps_per_second": 1.288,
"step": 1100
},
{
"epoch": 0.08587343339006653,
"grad_norm": 0.2431640625,
"learning_rate": 0.0004940453791431831,
"loss": 3.999224090576172,
"step": 1110
},
{
"epoch": 0.08664706792511218,
"grad_norm": 0.2060546875,
"learning_rate": 0.0004939142092090935,
"loss": 3.9808334350585937,
"step": 1120
},
{
"epoch": 0.08742070246015782,
"grad_norm": 0.2109375,
"learning_rate": 0.0004937816289938288,
"loss": 4.003896331787109,
"step": 1130
},
{
"epoch": 0.08819433699520346,
"grad_norm": 0.26953125,
"learning_rate": 0.0004936476393053574,
"loss": 3.9906829833984374,
"step": 1140
},
{
"epoch": 0.08896797153024912,
"grad_norm": 0.212890625,
"learning_rate": 0.0004935122409602374,
"loss": 3.9897789001464843,
"step": 1150
},
{
"epoch": 0.08974160606529476,
"grad_norm": 0.236328125,
"learning_rate": 0.0004933754347836115,
"loss": 3.9780765533447267,
"step": 1160
},
{
"epoch": 0.0905152406003404,
"grad_norm": 0.23828125,
"learning_rate": 0.0004932372216092017,
"loss": 3.976204681396484,
"step": 1170
},
{
"epoch": 0.09128887513538604,
"grad_norm": 0.216796875,
"learning_rate": 0.0004930976022793051,
"loss": 3.9825729370117187,
"step": 1180
},
{
"epoch": 0.09206250967043168,
"grad_norm": 0.2255859375,
"learning_rate": 0.0004929565776447875,
"loss": 3.956177520751953,
"step": 1190
},
{
"epoch": 0.09283614420547734,
"grad_norm": 0.2236328125,
"learning_rate": 0.0004928141485650795,
"loss": 3.9746784210205077,
"step": 1200
},
{
"epoch": 0.09283614420547734,
"eval_loss": 4.6136932373046875,
"eval_runtime": 8.5763,
"eval_samples_per_second": 38.129,
"eval_steps_per_second": 1.283,
"step": 1200
},
{
"epoch": 0.09360977874052298,
"grad_norm": 0.2216796875,
"learning_rate": 0.0004926703159081702,
"loss": 3.9590415954589844,
"step": 1210
},
{
"epoch": 0.09438341327556862,
"grad_norm": 0.25390625,
"learning_rate": 0.0004925250805506026,
"loss": 3.9336162567138673,
"step": 1220
},
{
"epoch": 0.09515704781061426,
"grad_norm": 0.251953125,
"learning_rate": 0.0004923784433774679,
"loss": 3.9630496978759764,
"step": 1230
},
{
"epoch": 0.0959306823456599,
"grad_norm": 0.2333984375,
"learning_rate": 0.0004922304052824003,
"loss": 3.9313884735107423,
"step": 1240
},
{
"epoch": 0.09670431688070555,
"grad_norm": 0.2216796875,
"learning_rate": 0.0004920809671675715,
"loss": 3.9482696533203123,
"step": 1250
},
{
"epoch": 0.0974779514157512,
"grad_norm": 0.248046875,
"learning_rate": 0.000491930129943685,
"loss": 3.9435379028320314,
"step": 1260
},
{
"epoch": 0.09825158595079685,
"grad_norm": 0.2158203125,
"learning_rate": 0.0004917778945299709,
"loss": 3.9084590911865233,
"step": 1270
},
{
"epoch": 0.09902522048584249,
"grad_norm": 0.2236328125,
"learning_rate": 0.0004916242618541802,
"loss": 3.91564826965332,
"step": 1280
},
{
"epoch": 0.09979885502088813,
"grad_norm": 0.236328125,
"learning_rate": 0.0004914692328525788,
"loss": 3.931330108642578,
"step": 1290
},
{
"epoch": 0.10057248955593377,
"grad_norm": 0.26171875,
"learning_rate": 0.0004913128084699424,
"loss": 3.928493881225586,
"step": 1300
},
{
"epoch": 0.10057248955593377,
"eval_loss": 4.577918529510498,
"eval_runtime": 8.5374,
"eval_samples_per_second": 38.302,
"eval_steps_per_second": 1.288,
"step": 1300
},
{
"epoch": 0.10134612409097943,
"grad_norm": 0.21875,
"learning_rate": 0.0004911549896595501,
"loss": 3.922897720336914,
"step": 1310
},
{
"epoch": 0.10211975862602507,
"grad_norm": 0.2373046875,
"learning_rate": 0.0004909957773831791,
"loss": 3.927952194213867,
"step": 1320
},
{
"epoch": 0.10289339316107071,
"grad_norm": 0.1982421875,
"learning_rate": 0.0004908351726110987,
"loss": 3.9283069610595702,
"step": 1330
},
{
"epoch": 0.10366702769611635,
"grad_norm": 0.2734375,
"learning_rate": 0.000490673176322064,
"loss": 3.9404796600341796,
"step": 1340
},
{
"epoch": 0.104440662231162,
"grad_norm": 0.2412109375,
"learning_rate": 0.0004905097895033106,
"loss": 3.9214569091796876,
"step": 1350
},
{
"epoch": 0.10521429676620764,
"grad_norm": 0.208984375,
"learning_rate": 0.000490345013150548,
"loss": 3.9170085906982424,
"step": 1360
},
{
"epoch": 0.1059879313012533,
"grad_norm": 0.24609375,
"learning_rate": 0.0004901788482679542,
"loss": 3.899140167236328,
"step": 1370
},
{
"epoch": 0.10676156583629894,
"grad_norm": 0.236328125,
"learning_rate": 0.0004900112958681686,
"loss": 3.913042449951172,
"step": 1380
},
{
"epoch": 0.10753520037134458,
"grad_norm": 0.216796875,
"learning_rate": 0.0004898423569722866,
"loss": 3.9000522613525392,
"step": 1390
},
{
"epoch": 0.10830883490639022,
"grad_norm": 0.2060546875,
"learning_rate": 0.0004896720326098534,
"loss": 3.907938003540039,
"step": 1400
},
{
"epoch": 0.10830883490639022,
"eval_loss": 4.5124287605285645,
"eval_runtime": 8.581,
"eval_samples_per_second": 38.108,
"eval_steps_per_second": 1.282,
"step": 1400
},
{
"epoch": 0.10908246944143586,
"grad_norm": 0.2412109375,
"learning_rate": 0.0004895003238188572,
"loss": 3.896725082397461,
"step": 1410
},
{
"epoch": 0.1098561039764815,
"grad_norm": 0.25,
"learning_rate": 0.0004893272316457232,
"loss": 3.887255859375,
"step": 1420
},
{
"epoch": 0.11062973851152716,
"grad_norm": 0.212890625,
"learning_rate": 0.0004891527571453074,
"loss": 3.899026107788086,
"step": 1430
},
{
"epoch": 0.1114033730465728,
"grad_norm": 0.2294921875,
"learning_rate": 0.0004889769013808898,
"loss": 3.9211231231689454,
"step": 1440
},
{
"epoch": 0.11217700758161844,
"grad_norm": 0.2099609375,
"learning_rate": 0.000488799665424168,
"loss": 3.8967121124267576,
"step": 1450
},
{
"epoch": 0.11295064211666409,
"grad_norm": 0.216796875,
"learning_rate": 0.0004886210503552508,
"loss": 3.8699275970458986,
"step": 1460
},
{
"epoch": 0.11372427665170973,
"grad_norm": 0.2275390625,
"learning_rate": 0.0004884410572626518,
"loss": 3.8598350524902343,
"step": 1470
},
{
"epoch": 0.11449791118675538,
"grad_norm": 0.201171875,
"learning_rate": 0.0004882596872432822,
"loss": 3.90062255859375,
"step": 1480
},
{
"epoch": 0.11527154572180102,
"grad_norm": 0.2158203125,
"learning_rate": 0.0004880769414024446,
"loss": 3.8603435516357423,
"step": 1490
},
{
"epoch": 0.11604518025684667,
"grad_norm": 0.2275390625,
"learning_rate": 0.0004878928208538261,
"loss": 3.8940032958984374,
"step": 1500
},
{
"epoch": 0.11604518025684667,
"eval_loss": 4.474898338317871,
"eval_runtime": 8.5376,
"eval_samples_per_second": 38.301,
"eval_steps_per_second": 1.288,
"step": 1500
},
{
"epoch": 0.11681881479189231,
"grad_norm": 0.279296875,
"learning_rate": 0.0004877073267194916,
"loss": 3.8529014587402344,
"step": 1510
},
{
"epoch": 0.11759244932693795,
"grad_norm": 0.2236328125,
"learning_rate": 0.00048752046012987677,
"loss": 3.888753128051758,
"step": 1520
},
{
"epoch": 0.11836608386198359,
"grad_norm": 0.22265625,
"learning_rate": 0.0004873322222237812,
"loss": 3.856996536254883,
"step": 1530
},
{
"epoch": 0.11913971839702925,
"grad_norm": 0.25,
"learning_rate": 0.0004871426141483618,
"loss": 3.841297149658203,
"step": 1540
},
{
"epoch": 0.11991335293207489,
"grad_norm": 0.263671875,
"learning_rate": 0.0004869516370591253,
"loss": 3.838258743286133,
"step": 1550
},
{
"epoch": 0.12068698746712053,
"grad_norm": 0.251953125,
"learning_rate": 0.0004867592921199217,
"loss": 3.852222442626953,
"step": 1560
},
{
"epoch": 0.12146062200216617,
"grad_norm": 0.26953125,
"learning_rate": 0.0004865655805029366,
"loss": 3.8498695373535154,
"step": 1570
},
{
"epoch": 0.12223425653721182,
"grad_norm": 0.2470703125,
"learning_rate": 0.0004863705033886847,
"loss": 3.8373653411865236,
"step": 1580
},
{
"epoch": 0.12300789107225747,
"grad_norm": 0.22265625,
"learning_rate": 0.0004861740619660022,
"loss": 3.8427047729492188,
"step": 1590
},
{
"epoch": 0.12378152560730311,
"grad_norm": 0.240234375,
"learning_rate": 0.0004859762574320395,
"loss": 3.864556884765625,
"step": 1600
},
{
"epoch": 0.12378152560730311,
"eval_loss": 4.4412994384765625,
"eval_runtime": 9.5955,
"eval_samples_per_second": 34.079,
"eval_steps_per_second": 1.146,
"step": 1600
},
{
"epoch": 0.12455516014234876,
"grad_norm": 0.2001953125,
"learning_rate": 0.0004857770909922542,
"loss": 3.816178894042969,
"step": 1610
},
{
"epoch": 0.1253287946773944,
"grad_norm": 0.2373046875,
"learning_rate": 0.0004855765638604036,
"loss": 3.8218841552734375,
"step": 1620
},
{
"epoch": 0.12610242921244005,
"grad_norm": 0.265625,
"learning_rate": 0.00048537467725853734,
"loss": 3.8202373504638674,
"step": 1630
},
{
"epoch": 0.1268760637474857,
"grad_norm": 0.201171875,
"learning_rate": 0.00048517143241698986,
"loss": 3.8387172698974608,
"step": 1640
},
{
"epoch": 0.12764969828253134,
"grad_norm": 0.2177734375,
"learning_rate": 0.0004849668305743729,
"loss": 3.8024673461914062,
"step": 1650
},
{
"epoch": 0.12842333281757698,
"grad_norm": 0.2177734375,
"learning_rate": 0.000484760872977568,
"loss": 3.8411659240722655,
"step": 1660
},
{
"epoch": 0.12919696735262262,
"grad_norm": 0.2294921875,
"learning_rate": 0.0004845535608817193,
"loss": 3.828306198120117,
"step": 1670
},
{
"epoch": 0.12997060188766826,
"grad_norm": 0.19921875,
"learning_rate": 0.000484344895550225,
"loss": 3.8343215942382813,
"step": 1680
},
{
"epoch": 0.1307442364227139,
"grad_norm": 0.212890625,
"learning_rate": 0.00048413487825473044,
"loss": 3.829656219482422,
"step": 1690
},
{
"epoch": 0.13151787095775955,
"grad_norm": 0.232421875,
"learning_rate": 0.0004839235102751201,
"loss": 3.825642776489258,
"step": 1700
},
{
"epoch": 0.13151787095775955,
"eval_loss": 4.401412010192871,
"eval_runtime": 8.6836,
"eval_samples_per_second": 37.657,
"eval_steps_per_second": 1.267,
"step": 1700
},
{
"epoch": 0.1322915054928052,
"grad_norm": 0.2177734375,
"learning_rate": 0.00048371079289950966,
"loss": 3.8195194244384765,
"step": 1710
},
{
"epoch": 0.13306514002785083,
"grad_norm": 0.248046875,
"learning_rate": 0.0004834967274242383,
"loss": 3.786629867553711,
"step": 1720
},
{
"epoch": 0.1338387745628965,
"grad_norm": 0.228515625,
"learning_rate": 0.0004832813151538607,
"loss": 3.798793411254883,
"step": 1730
},
{
"epoch": 0.13461240909794214,
"grad_norm": 0.255859375,
"learning_rate": 0.00048306455740113936,
"loss": 3.7926116943359376,
"step": 1740
},
{
"epoch": 0.13538604363298778,
"grad_norm": 0.228515625,
"learning_rate": 0.0004828464554870363,
"loss": 3.812264633178711,
"step": 1750
},
{
"epoch": 0.13615967816803343,
"grad_norm": 0.2138671875,
"learning_rate": 0.00048262701074070516,
"loss": 3.7819557189941406,
"step": 1760
},
{
"epoch": 0.13693331270307907,
"grad_norm": 0.2314453125,
"learning_rate": 0.00048240622449948275,
"loss": 3.772268295288086,
"step": 1770
},
{
"epoch": 0.1377069472381247,
"grad_norm": 0.208984375,
"learning_rate": 0.00048218409810888156,
"loss": 3.7845218658447264,
"step": 1780
},
{
"epoch": 0.13848058177317035,
"grad_norm": 0.201171875,
"learning_rate": 0.00048196063292258123,
"loss": 3.7898277282714843,
"step": 1790
},
{
"epoch": 0.139254216308216,
"grad_norm": 0.23046875,
"learning_rate": 0.0004817358303024199,
"loss": 3.7971900939941405,
"step": 1800
},
{
"epoch": 0.139254216308216,
"eval_loss": 4.37278413772583,
"eval_runtime": 8.6618,
"eval_samples_per_second": 37.752,
"eval_steps_per_second": 1.27,
"step": 1800
},
{
"epoch": 0.14002785084326164,
"grad_norm": 0.24609375,
"learning_rate": 0.0004815096916183866,
"loss": 3.7643463134765627,
"step": 1810
},
{
"epoch": 0.14080148537830728,
"grad_norm": 0.216796875,
"learning_rate": 0.00048128221824861236,
"loss": 3.777587890625,
"step": 1820
},
{
"epoch": 0.14157511991335292,
"grad_norm": 0.244140625,
"learning_rate": 0.0004810534115793623,
"loss": 3.775267791748047,
"step": 1830
},
{
"epoch": 0.1423487544483986,
"grad_norm": 0.2255859375,
"learning_rate": 0.00048082327300502664,
"loss": 3.7802684783935545,
"step": 1840
},
{
"epoch": 0.14312238898344423,
"grad_norm": 0.25,
"learning_rate": 0.00048059180392811266,
"loss": 3.8166263580322264,
"step": 1850
},
{
"epoch": 0.14389602351848987,
"grad_norm": 0.2421875,
"learning_rate": 0.0004803590057592359,
"loss": 3.7695087432861327,
"step": 1860
},
{
"epoch": 0.14466965805353552,
"grad_norm": 0.2119140625,
"learning_rate": 0.0004801248799171116,
"loss": 3.7461666107177733,
"step": 1870
},
{
"epoch": 0.14544329258858116,
"grad_norm": 0.25390625,
"learning_rate": 0.00047988942782854624,
"loss": 3.7527397155761717,
"step": 1880
},
{
"epoch": 0.1462169271236268,
"grad_norm": 0.2412109375,
"learning_rate": 0.00047965265092842846,
"loss": 3.74096565246582,
"step": 1890
},
{
"epoch": 0.14699056165867244,
"grad_norm": 0.2578125,
"learning_rate": 0.00047941455065972073,
"loss": 3.7666641235351563,
"step": 1900
},
{
"epoch": 0.14699056165867244,
"eval_loss": 4.354757785797119,
"eval_runtime": 8.7304,
"eval_samples_per_second": 37.455,
"eval_steps_per_second": 1.26,
"step": 1900
},
{
"epoch": 0.14776419619371808,
"grad_norm": 0.20703125,
"learning_rate": 0.0004791751284734504,
"loss": 3.752808380126953,
"step": 1910
},
{
"epoch": 0.14853783072876373,
"grad_norm": 0.2578125,
"learning_rate": 0.0004789343858287005,
"loss": 3.744313049316406,
"step": 1920
},
{
"epoch": 0.14931146526380937,
"grad_norm": 0.212890625,
"learning_rate": 0.00047869232419260165,
"loss": 3.738627243041992,
"step": 1930
},
{
"epoch": 0.150085099798855,
"grad_norm": 0.2255859375,
"learning_rate": 0.0004784489450403224,
"loss": 3.769034194946289,
"step": 1940
},
{
"epoch": 0.15085873433390065,
"grad_norm": 0.244140625,
"learning_rate": 0.0004782042498550604,
"loss": 3.754560089111328,
"step": 1950
},
{
"epoch": 0.15163236886894632,
"grad_norm": 0.2138671875,
"learning_rate": 0.00047795824012803357,
"loss": 3.7514068603515627,
"step": 1960
},
{
"epoch": 0.15240600340399196,
"grad_norm": 0.2734375,
"learning_rate": 0.000477710917358471,
"loss": 3.7632373809814452,
"step": 1970
},
{
"epoch": 0.1531796379390376,
"grad_norm": 0.23046875,
"learning_rate": 0.00047746228305360345,
"loss": 3.7417659759521484,
"step": 1980
},
{
"epoch": 0.15395327247408325,
"grad_norm": 0.21484375,
"learning_rate": 0.00047721233872865463,
"loss": 3.7318050384521486,
"step": 1990
},
{
"epoch": 0.1547269070091289,
"grad_norm": 0.2119140625,
"learning_rate": 0.00047696108590683175,
"loss": 3.7479320526123048,
"step": 2000
},
{
"epoch": 0.1547269070091289,
"eval_loss": 4.3264288902282715,
"eval_runtime": 8.7274,
"eval_samples_per_second": 37.468,
"eval_steps_per_second": 1.26,
"step": 2000
},
{
"epoch": 0.15550054154417453,
"grad_norm": 0.26171875,
"learning_rate": 0.0004767085261193161,
"loss": 3.711147689819336,
"step": 2010
},
{
"epoch": 0.15627417607922017,
"grad_norm": 0.220703125,
"learning_rate": 0.0004764546609052538,
"loss": 3.749440002441406,
"step": 2020
},
{
"epoch": 0.15704781061426581,
"grad_norm": 0.2275390625,
"learning_rate": 0.0004761994918117469,
"loss": 3.7327606201171877,
"step": 2030
},
{
"epoch": 0.15782144514931146,
"grad_norm": 0.267578125,
"learning_rate": 0.000475943020393843,
"loss": 3.7557136535644533,
"step": 2040
},
{
"epoch": 0.1585950796843571,
"grad_norm": 0.2138671875,
"learning_rate": 0.0004756852482145268,
"loss": 3.723508834838867,
"step": 2050
},
{
"epoch": 0.15936871421940274,
"grad_norm": 0.2158203125,
"learning_rate": 0.00047542617684470965,
"loss": 3.732291412353516,
"step": 2060
},
{
"epoch": 0.1601423487544484,
"grad_norm": 0.21484375,
"learning_rate": 0.0004751658078632206,
"loss": 3.7624893188476562,
"step": 2070
},
{
"epoch": 0.16091598328949405,
"grad_norm": 0.2080078125,
"learning_rate": 0.00047490414285679666,
"loss": 3.7248538970947265,
"step": 2080
},
{
"epoch": 0.1616896178245397,
"grad_norm": 0.2578125,
"learning_rate": 0.000474641183420073,
"loss": 3.732358932495117,
"step": 2090
},
{
"epoch": 0.16246325235958534,
"grad_norm": 0.28515625,
"learning_rate": 0.0004743769311555732,
"loss": 3.7347564697265625,
"step": 2100
},
{
"epoch": 0.16246325235958534,
"eval_loss": 4.292186260223389,
"eval_runtime": 8.7033,
"eval_samples_per_second": 37.572,
"eval_steps_per_second": 1.264,
"step": 2100
},
{
"epoch": 0.16323688689463098,
"grad_norm": 0.2197265625,
"learning_rate": 0.0004741113876736997,
"loss": 3.7274330139160154,
"step": 2110
},
{
"epoch": 0.16401052142967662,
"grad_norm": 0.2265625,
"learning_rate": 0.00047384455459272386,
"loss": 3.7328311920166017,
"step": 2120
},
{
"epoch": 0.16478415596472226,
"grad_norm": 0.25,
"learning_rate": 0.0004735764335387758,
"loss": 3.7267345428466796,
"step": 2130
},
{
"epoch": 0.1655577904997679,
"grad_norm": 0.2421875,
"learning_rate": 0.0004733070261458353,
"loss": 3.7383796691894533,
"step": 2140
},
{
"epoch": 0.16633142503481355,
"grad_norm": 0.259765625,
"learning_rate": 0.00047303633405572094,
"loss": 3.714567184448242,
"step": 2150
},
{
"epoch": 0.1671050595698592,
"grad_norm": 0.2578125,
"learning_rate": 0.0004727643589180806,
"loss": 3.752973175048828,
"step": 2160
},
{
"epoch": 0.16787869410490483,
"grad_norm": 0.212890625,
"learning_rate": 0.00047249110239038123,
"loss": 3.6907588958740236,
"step": 2170
},
{
"epoch": 0.1686523286399505,
"grad_norm": 0.2265625,
"learning_rate": 0.00047221656613789895,
"loss": 3.73446044921875,
"step": 2180
},
{
"epoch": 0.16942596317499614,
"grad_norm": 0.2373046875,
"learning_rate": 0.00047194075183370864,
"loss": 3.679473876953125,
"step": 2190
},
{
"epoch": 0.17019959771004178,
"grad_norm": 0.216796875,
"learning_rate": 0.0004716636611586739,
"loss": 3.7257465362548827,
"step": 2200
},
{
"epoch": 0.17019959771004178,
"eval_loss": 4.27129602432251,
"eval_runtime": 8.7096,
"eval_samples_per_second": 37.545,
"eval_steps_per_second": 1.263,
"step": 2200
},
{
"epoch": 0.17097323224508743,
"grad_norm": 0.2216796875,
"learning_rate": 0.00047138529580143673,
"loss": 3.7073875427246095,
"step": 2210
},
{
"epoch": 0.17174686678013307,
"grad_norm": 0.21875,
"learning_rate": 0.0004711056574584075,
"loss": 3.71368522644043,
"step": 2220
},
{
"epoch": 0.1725205013151787,
"grad_norm": 0.2197265625,
"learning_rate": 0.00047082474783375396,
"loss": 3.7186820983886717,
"step": 2230
},
{
"epoch": 0.17329413585022435,
"grad_norm": 0.212890625,
"learning_rate": 0.00047054256863939177,
"loss": 3.705561065673828,
"step": 2240
},
{
"epoch": 0.17406777038527,
"grad_norm": 0.220703125,
"learning_rate": 0.0004702591215949732,
"loss": 3.709010696411133,
"step": 2250
},
{
"epoch": 0.17484140492031564,
"grad_norm": 0.2373046875,
"learning_rate": 0.00046997440842787725,
"loss": 3.7188438415527343,
"step": 2260
},
{
"epoch": 0.17561503945536128,
"grad_norm": 0.26953125,
"learning_rate": 0.0004696884308731988,
"loss": 3.707378387451172,
"step": 2270
},
{
"epoch": 0.17638867399040692,
"grad_norm": 0.240234375,
"learning_rate": 0.00046940119067373823,
"loss": 3.697579193115234,
"step": 2280
},
{
"epoch": 0.1771623085254526,
"grad_norm": 0.2353515625,
"learning_rate": 0.0004691126895799907,
"loss": 3.7102542877197267,
"step": 2290
},
{
"epoch": 0.17793594306049823,
"grad_norm": 0.2255859375,
"learning_rate": 0.0004688229293501354,
"loss": 3.682720947265625,
"step": 2300
},
{
"epoch": 0.17793594306049823,
"eval_loss": 4.244110584259033,
"eval_runtime": 8.6768,
"eval_samples_per_second": 37.687,
"eval_steps_per_second": 1.268,
"step": 2300
},
{
"epoch": 0.17870957759554387,
"grad_norm": 0.2001953125,
"learning_rate": 0.000468531911750025,
"loss": 3.6973262786865235,
"step": 2310
},
{
"epoch": 0.17948321213058951,
"grad_norm": 0.2265625,
"learning_rate": 0.00046823963855317487,
"loss": 3.682568359375,
"step": 2320
},
{
"epoch": 0.18025684666563516,
"grad_norm": 0.22265625,
"learning_rate": 0.00046794611154075207,
"loss": 3.6916324615478517,
"step": 2330
},
{
"epoch": 0.1810304812006808,
"grad_norm": 0.2255859375,
"learning_rate": 0.0004676513325015648,
"loss": 3.6971084594726564,
"step": 2340
},
{
"epoch": 0.18180411573572644,
"grad_norm": 0.22265625,
"learning_rate": 0.0004673553032320512,
"loss": 3.680620574951172,
"step": 2350
},
{
"epoch": 0.18257775027077208,
"grad_norm": 0.24609375,
"learning_rate": 0.00046705802553626875,
"loss": 3.6823448181152343,
"step": 2360
},
{
"epoch": 0.18335138480581772,
"grad_norm": 0.2177734375,
"learning_rate": 0.0004667595012258829,
"loss": 3.6814292907714843,
"step": 2370
},
{
"epoch": 0.18412501934086337,
"grad_norm": 0.248046875,
"learning_rate": 0.0004664597321201562,
"loss": 3.6852691650390623,
"step": 2380
},
{
"epoch": 0.184898653875909,
"grad_norm": 0.2099609375,
"learning_rate": 0.0004661587200459373,
"loss": 3.7072521209716798,
"step": 2390
},
{
"epoch": 0.18567228841095468,
"grad_norm": 0.240234375,
"learning_rate": 0.0004658564668376496,
"loss": 3.6736068725585938,
"step": 2400
},
{
"epoch": 0.18567228841095468,
"eval_loss": 4.224212646484375,
"eval_runtime": 8.6258,
"eval_samples_per_second": 37.91,
"eval_steps_per_second": 1.275,
"step": 2400
},
{
"epoch": 0.18644592294600032,
"grad_norm": 0.2421875,
"learning_rate": 0.0004655529743372805,
"loss": 3.674551010131836,
"step": 2410
},
{
"epoch": 0.18721955748104596,
"grad_norm": 0.244140625,
"learning_rate": 0.00046524824439436946,
"loss": 3.676839065551758,
"step": 2420
},
{
"epoch": 0.1879931920160916,
"grad_norm": 0.2275390625,
"learning_rate": 0.00046494227886599744,
"loss": 3.6566898345947267,
"step": 2430
},
{
"epoch": 0.18876682655113725,
"grad_norm": 0.22265625,
"learning_rate": 0.0004646350796167753,
"loss": 3.6999538421630858,
"step": 2440
},
{
"epoch": 0.1895404610861829,
"grad_norm": 0.2099609375,
"learning_rate": 0.0004643266485188321,
"loss": 3.6581405639648437,
"step": 2450
},
{
"epoch": 0.19031409562122853,
"grad_norm": 0.2890625,
"learning_rate": 0.00046401698745180444,
"loss": 3.7002613067626955,
"step": 2460
},
{
"epoch": 0.19108773015627417,
"grad_norm": 0.201171875,
"learning_rate": 0.00046370609830282425,
"loss": 3.684235763549805,
"step": 2470
},
{
"epoch": 0.1918613646913198,
"grad_norm": 0.20703125,
"learning_rate": 0.00046339398296650787,
"loss": 3.6899051666259766,
"step": 2480
},
{
"epoch": 0.19263499922636546,
"grad_norm": 0.23828125,
"learning_rate": 0.000463080643344944,
"loss": 3.6608238220214844,
"step": 2490
},
{
"epoch": 0.1934086337614111,
"grad_norm": 0.2236328125,
"learning_rate": 0.0004627660813476826,
"loss": 3.6702159881591796,
"step": 2500
},
{
"epoch": 0.1934086337614111,
"eval_loss": 4.213615417480469,
"eval_runtime": 8.692,
"eval_samples_per_second": 37.621,
"eval_steps_per_second": 1.266,
"step": 2500
},
{
"epoch": 0.19418226829645677,
"grad_norm": 0.2314453125,
"learning_rate": 0.0004624502988917229,
"loss": 3.6737674713134765,
"step": 2510
},
{
"epoch": 0.1949559028315024,
"grad_norm": 0.25,
"learning_rate": 0.00046213329790150185,
"loss": 3.662728500366211,
"step": 2520
},
{
"epoch": 0.19572953736654805,
"grad_norm": 0.2021484375,
"learning_rate": 0.00046181508030888223,
"loss": 3.6636001586914064,
"step": 2530
},
{
"epoch": 0.1965031719015937,
"grad_norm": 0.255859375,
"learning_rate": 0.00046149564805314134,
"loss": 3.666353225708008,
"step": 2540
},
{
"epoch": 0.19727680643663933,
"grad_norm": 0.298828125,
"learning_rate": 0.00046117500308095853,
"loss": 3.670008087158203,
"step": 2550
},
{
"epoch": 0.19805044097168498,
"grad_norm": 0.2080078125,
"learning_rate": 0.000460853147346404,
"loss": 3.6724533081054687,
"step": 2560
},
{
"epoch": 0.19882407550673062,
"grad_norm": 0.236328125,
"learning_rate": 0.00046053008281092626,
"loss": 3.656665802001953,
"step": 2570
},
{
"epoch": 0.19959771004177626,
"grad_norm": 0.2060546875,
"learning_rate": 0.0004602058114433405,
"loss": 3.6695487976074217,
"step": 2580
},
{
"epoch": 0.2003713445768219,
"grad_norm": 0.2255859375,
"learning_rate": 0.0004598803352198169,
"loss": 3.6759658813476563,
"step": 2590
},
{
"epoch": 0.20114497911186754,
"grad_norm": 0.2236328125,
"learning_rate": 0.0004595536561238677,
"loss": 3.6256980895996094,
"step": 2600
},
{
"epoch": 0.20114497911186754,
"eval_loss": 4.193091869354248,
"eval_runtime": 8.6853,
"eval_samples_per_second": 37.65,
"eval_steps_per_second": 1.267,
"step": 2600
},
{
"epoch": 0.2019186136469132,
"grad_norm": 0.248046875,
"learning_rate": 0.00045922577614633634,
"loss": 3.6532318115234377,
"step": 2610
},
{
"epoch": 0.20269224818195886,
"grad_norm": 0.2421875,
"learning_rate": 0.00045889669728538414,
"loss": 3.640882873535156,
"step": 2620
},
{
"epoch": 0.2034658827170045,
"grad_norm": 0.2216796875,
"learning_rate": 0.0004585664215464788,
"loss": 3.6541816711425783,
"step": 2630
},
{
"epoch": 0.20423951725205014,
"grad_norm": 0.228515625,
"learning_rate": 0.000458234950942382,
"loss": 3.62015380859375,
"step": 2640
},
{
"epoch": 0.20501315178709578,
"grad_norm": 0.265625,
"learning_rate": 0.0004579022874931372,
"loss": 3.660184860229492,
"step": 2650
},
{
"epoch": 0.20578678632214142,
"grad_norm": 0.189453125,
"learning_rate": 0.0004575684332260573,
"loss": 3.646562957763672,
"step": 2660
},
{
"epoch": 0.20656042085718707,
"grad_norm": 0.20703125,
"learning_rate": 0.00045723339017571214,
"loss": 3.66490478515625,
"step": 2670
},
{
"epoch": 0.2073340553922327,
"grad_norm": 0.2275390625,
"learning_rate": 0.00045689716038391643,
"loss": 3.6182834625244142,
"step": 2680
},
{
"epoch": 0.20810768992727835,
"grad_norm": 0.2490234375,
"learning_rate": 0.00045655974589971677,
"loss": 3.638666534423828,
"step": 2690
},
{
"epoch": 0.208881324462324,
"grad_norm": 0.232421875,
"learning_rate": 0.00045622114877937986,
"loss": 3.660610580444336,
"step": 2700
},
{
"epoch": 0.208881324462324,
"eval_loss": 4.197894096374512,
"eval_runtime": 8.6595,
"eval_samples_per_second": 37.762,
"eval_steps_per_second": 1.27,
"step": 2700
},
{
"epoch": 0.20965495899736963,
"grad_norm": 0.2333984375,
"learning_rate": 0.00045588137108637934,
"loss": 3.6198894500732424,
"step": 2710
},
{
"epoch": 0.21042859353241528,
"grad_norm": 0.326171875,
"learning_rate": 0.00045554041489138367,
"loss": 3.651480865478516,
"step": 2720
},
{
"epoch": 0.21120222806746092,
"grad_norm": 0.24609375,
"learning_rate": 0.0004551982822722432,
"loss": 3.6471332550048827,
"step": 2730
},
{
"epoch": 0.2119758626025066,
"grad_norm": 0.2177734375,
"learning_rate": 0.0004548549753139776,
"loss": 3.6430343627929687,
"step": 2740
},
{
"epoch": 0.21274949713755223,
"grad_norm": 0.228515625,
"learning_rate": 0.0004545104961087634,
"loss": 3.628376007080078,
"step": 2750
},
{
"epoch": 0.21352313167259787,
"grad_norm": 0.228515625,
"learning_rate": 0.00045416484675592065,
"loss": 3.663385009765625,
"step": 2760
},
{
"epoch": 0.2142967662076435,
"grad_norm": 0.234375,
"learning_rate": 0.0004538180293619009,
"loss": 3.6373767852783203,
"step": 2770
},
{
"epoch": 0.21507040074268916,
"grad_norm": 0.2314453125,
"learning_rate": 0.0004534700460402737,
"loss": 3.626949691772461,
"step": 2780
},
{
"epoch": 0.2158440352777348,
"grad_norm": 0.232421875,
"learning_rate": 0.000453120898911714,
"loss": 3.621552276611328,
"step": 2790
},
{
"epoch": 0.21661766981278044,
"grad_norm": 0.232421875,
"learning_rate": 0.00045277059010398934,
"loss": 3.6465320587158203,
"step": 2800
},
{
"epoch": 0.21661766981278044,
"eval_loss": 4.1806182861328125,
"eval_runtime": 8.853,
"eval_samples_per_second": 36.937,
"eval_steps_per_second": 1.243,
"step": 2800
},
{
"epoch": 0.21739130434782608,
"grad_norm": 0.2353515625,
"learning_rate": 0.0004524191217519466,
"loss": 3.646443557739258,
"step": 2810
},
{
"epoch": 0.21816493888287172,
"grad_norm": 0.2294921875,
"learning_rate": 0.00045206649599749914,
"loss": 3.6304691314697264,
"step": 2820
},
{
"epoch": 0.21893857341791736,
"grad_norm": 0.2314453125,
"learning_rate": 0.000451712714989614,
"loss": 3.629531478881836,
"step": 2830
},
{
"epoch": 0.219712207952963,
"grad_norm": 0.22265625,
"learning_rate": 0.0004513577808842982,
"loss": 3.610256576538086,
"step": 2840
},
{
"epoch": 0.22048584248800868,
"grad_norm": 0.2216796875,
"learning_rate": 0.00045100169584458614,
"loss": 3.6422473907470705,
"step": 2850
},
{
"epoch": 0.22125947702305432,
"grad_norm": 0.23046875,
"learning_rate": 0.00045064446204052616,
"loss": 3.6097373962402344,
"step": 2860
},
{
"epoch": 0.22203311155809996,
"grad_norm": 0.2275390625,
"learning_rate": 0.0004502860816491675,
"loss": 3.650621032714844,
"step": 2870
},
{
"epoch": 0.2228067460931456,
"grad_norm": 0.2421875,
"learning_rate": 0.00044992655685454676,
"loss": 3.6009265899658205,
"step": 2880
},
{
"epoch": 0.22358038062819124,
"grad_norm": 0.2177734375,
"learning_rate": 0.0004495658898476749,
"loss": 3.6009990692138674,
"step": 2890
},
{
"epoch": 0.2243540151632369,
"grad_norm": 0.224609375,
"learning_rate": 0.00044920408282652356,
"loss": 3.6231040954589844,
"step": 2900
},
{
"epoch": 0.2243540151632369,
"eval_loss": 4.175409317016602,
"eval_runtime": 8.6708,
"eval_samples_per_second": 37.713,
"eval_steps_per_second": 1.269,
"step": 2900
},
{
"epoch": 0.22512764969828253,
"grad_norm": 0.205078125,
"learning_rate": 0.0004488411379960119,
"loss": 3.641431427001953,
"step": 2910
},
{
"epoch": 0.22590128423332817,
"grad_norm": 0.2265625,
"learning_rate": 0.0004484770575679933,
"loss": 3.6043201446533204,
"step": 2920
},
{
"epoch": 0.2266749187683738,
"grad_norm": 0.2333984375,
"learning_rate": 0.0004481118437612414,
"loss": 3.5940608978271484,
"step": 2930
},
{
"epoch": 0.22744855330341945,
"grad_norm": 0.2197265625,
"learning_rate": 0.00044774549880143694,
"loss": 3.632985305786133,
"step": 2940
},
{
"epoch": 0.2282221878384651,
"grad_norm": 0.259765625,
"learning_rate": 0.0004473780249211542,
"loss": 3.5861167907714844,
"step": 2950
},
{
"epoch": 0.22899582237351077,
"grad_norm": 0.2470703125,
"learning_rate": 0.0004470094243598474,
"loss": 3.6033992767333984,
"step": 2960
},
{
"epoch": 0.2297694569085564,
"grad_norm": 0.2236328125,
"learning_rate": 0.00044663969936383657,
"loss": 3.5815731048583985,
"step": 2970
},
{
"epoch": 0.23054309144360205,
"grad_norm": 0.228515625,
"learning_rate": 0.00044626885218629467,
"loss": 3.6179901123046876,
"step": 2980
},
{
"epoch": 0.2313167259786477,
"grad_norm": 0.203125,
"learning_rate": 0.00044589688508723326,
"loss": 3.6054702758789063,
"step": 2990
},
{
"epoch": 0.23209036051369333,
"grad_norm": 0.2333984375,
"learning_rate": 0.0004455238003334889,
"loss": 3.618684005737305,
"step": 3000
},
{
"epoch": 0.23209036051369333,
"eval_loss": 4.147392272949219,
"eval_runtime": 8.7049,
"eval_samples_per_second": 37.565,
"eval_steps_per_second": 1.264,
"step": 3000
},
{
"epoch": 0.23286399504873898,
"grad_norm": 0.2236328125,
"learning_rate": 0.00044514960019870935,
"loss": 3.6089691162109374,
"step": 3010
},
{
"epoch": 0.23363762958378462,
"grad_norm": 0.2412109375,
"learning_rate": 0.0004447742869633398,
"loss": 3.612302780151367,
"step": 3020
},
{
"epoch": 0.23441126411883026,
"grad_norm": 0.2578125,
"learning_rate": 0.0004443978629146089,
"loss": 3.6134407043457033,
"step": 3030
},
{
"epoch": 0.2351848986538759,
"grad_norm": 0.263671875,
"learning_rate": 0.00044402033034651457,
"loss": 3.6229934692382812,
"step": 3040
},
{
"epoch": 0.23595853318892154,
"grad_norm": 0.2412109375,
"learning_rate": 0.00044364169155981044,
"loss": 3.6341014862060548,
"step": 3050
},
{
"epoch": 0.23673216772396719,
"grad_norm": 0.2431640625,
"learning_rate": 0.00044326194886199166,
"loss": 3.617625427246094,
"step": 3060
},
{
"epoch": 0.23750580225901285,
"grad_norm": 0.259765625,
"learning_rate": 0.0004428811045672808,
"loss": 3.5775123596191407,
"step": 3070
},
{
"epoch": 0.2382794367940585,
"grad_norm": 0.2275390625,
"learning_rate": 0.0004424991609966135,
"loss": 3.6077903747558593,
"step": 3080
},
{
"epoch": 0.23905307132910414,
"grad_norm": 0.216796875,
"learning_rate": 0.0004421161204776251,
"loss": 3.611967849731445,
"step": 3090
},
{
"epoch": 0.23982670586414978,
"grad_norm": 0.2158203125,
"learning_rate": 0.00044173198534463553,
"loss": 3.607320022583008,
"step": 3100
},
{
"epoch": 0.23982670586414978,
"eval_loss": 4.136959075927734,
"eval_runtime": 8.702,
"eval_samples_per_second": 37.578,
"eval_steps_per_second": 1.264,
"step": 3100
},
{
"epoch": 0.12030133356542594,
"grad_norm": 0.40234375,
"learning_rate": 0.00048508648785485544,
"loss": 3.5898792266845705,
"step": 3110
},
{
"epoch": 0.12068815457367489,
"grad_norm": 0.283203125,
"learning_rate": 0.00048498487415469285,
"loss": 3.6180370330810545,
"step": 3120
},
{
"epoch": 0.12107497558192386,
"grad_norm": 0.283203125,
"learning_rate": 0.0004848829267533682,
"loss": 3.61370849609375,
"step": 3130
},
{
"epoch": 0.12146179659017281,
"grad_norm": 0.34765625,
"learning_rate": 0.0004847806458037906,
"loss": 3.632701873779297,
"step": 3140
},
{
"epoch": 0.12184861759842178,
"grad_norm": 0.296875,
"learning_rate": 0.0004846780314593695,
"loss": 3.6194690704345702,
"step": 3150
},
{
"epoch": 0.12223543860667073,
"grad_norm": 0.298828125,
"learning_rate": 0.0004845750838740143,
"loss": 3.6185939788818358,
"step": 3160
},
{
"epoch": 0.12262225961491968,
"grad_norm": 0.28515625,
"learning_rate": 0.00048447180320213424,
"loss": 3.6234817504882812,
"step": 3170
},
{
"epoch": 0.12300908062316865,
"grad_norm": 0.3046875,
"learning_rate": 0.0004843681895986383,
"loss": 3.633131408691406,
"step": 3180
},
{
"epoch": 0.1233959016314176,
"grad_norm": 0.29296875,
"learning_rate": 0.00048426424321893467,
"loss": 3.6763965606689455,
"step": 3190
},
{
"epoch": 0.12378272263966655,
"grad_norm": 0.27734375,
"learning_rate": 0.00048415996421893073,
"loss": 3.6260562896728517,
"step": 3200
},
{
"epoch": 0.12378272263966655,
"eval_loss": 4.193098068237305,
"eval_runtime": 10.1228,
"eval_samples_per_second": 32.303,
"eval_steps_per_second": 2.075,
"step": 3200
},
{
"epoch": 0.12416954364791552,
"grad_norm": 0.298828125,
"learning_rate": 0.0004840553527550326,
"loss": 3.604556655883789,
"step": 3210
},
{
"epoch": 0.12455636465616447,
"grad_norm": 0.28515625,
"learning_rate": 0.0004839504089841453,
"loss": 3.6034366607666017,
"step": 3220
},
{
"epoch": 0.12494318566441344,
"grad_norm": 0.279296875,
"learning_rate": 0.0004838451330636721,
"loss": 3.6195159912109376,
"step": 3230
},
{
"epoch": 0.1253300066726624,
"grad_norm": 0.298828125,
"learning_rate": 0.00048373952515151446,
"loss": 3.6002643585205076,
"step": 3240
},
{
"epoch": 0.12571682768091136,
"grad_norm": 0.275390625,
"learning_rate": 0.00048363358540607206,
"loss": 3.6441097259521484,
"step": 3250
},
{
"epoch": 0.1261036486891603,
"grad_norm": 0.28515625,
"learning_rate": 0.00048352731398624177,
"loss": 3.5857906341552734,
"step": 3260
},
{
"epoch": 0.12649046969740926,
"grad_norm": 0.302734375,
"learning_rate": 0.00048342071105141846,
"loss": 3.603062057495117,
"step": 3270
},
{
"epoch": 0.12687729070565823,
"grad_norm": 0.271484375,
"learning_rate": 0.00048331377676149386,
"loss": 3.6648319244384764,
"step": 3280
},
{
"epoch": 0.12726411171390717,
"grad_norm": 0.263671875,
"learning_rate": 0.00048320651127685687,
"loss": 3.589703369140625,
"step": 3290
},
{
"epoch": 0.12765093272215614,
"grad_norm": 0.2734375,
"learning_rate": 0.0004830989147583931,
"loss": 3.6127429962158204,
"step": 3300
},
{
"epoch": 0.12765093272215614,
"eval_loss": 4.191071033477783,
"eval_runtime": 9.955,
"eval_samples_per_second": 32.848,
"eval_steps_per_second": 2.109,
"step": 3300
},
{
"epoch": 0.1280377537304051,
"grad_norm": 0.27734375,
"learning_rate": 0.00048299098736748474,
"loss": 3.6267929077148438,
"step": 3310
},
{
"epoch": 0.12842457473865407,
"grad_norm": 0.298828125,
"learning_rate": 0.0004828827292660102,
"loss": 3.654584503173828,
"step": 3320
},
{
"epoch": 0.128811395746903,
"grad_norm": 0.29296875,
"learning_rate": 0.0004827741406163438,
"loss": 3.642983245849609,
"step": 3330
},
{
"epoch": 0.12919821675515197,
"grad_norm": 0.30859375,
"learning_rate": 0.00048266522158135587,
"loss": 3.6135555267333985,
"step": 3340
},
{
"epoch": 0.12958503776340094,
"grad_norm": 0.283203125,
"learning_rate": 0.00048255597232441214,
"loss": 3.655533218383789,
"step": 3350
},
{
"epoch": 0.12997185877164988,
"grad_norm": 0.26171875,
"learning_rate": 0.00048244639300937356,
"loss": 3.620559310913086,
"step": 3360
},
{
"epoch": 0.13035867977989885,
"grad_norm": 0.2578125,
"learning_rate": 0.0004823364838005963,
"loss": 3.651724624633789,
"step": 3370
},
{
"epoch": 0.1307455007881478,
"grad_norm": 0.283203125,
"learning_rate": 0.0004822262448629312,
"loss": 3.620151901245117,
"step": 3380
},
{
"epoch": 0.13113232179639675,
"grad_norm": 0.279296875,
"learning_rate": 0.0004821156763617238,
"loss": 3.657820129394531,
"step": 3390
},
{
"epoch": 0.13151914280464572,
"grad_norm": 0.275390625,
"learning_rate": 0.0004820047784628138,
"loss": 3.6077507019042967,
"step": 3400
},
{
"epoch": 0.13151914280464572,
"eval_loss": 4.1888580322265625,
"eval_runtime": 9.9816,
"eval_samples_per_second": 32.76,
"eval_steps_per_second": 2.104,
"step": 3400
},
{
"epoch": 0.13190596381289468,
"grad_norm": 0.265625,
"learning_rate": 0.000481893551332535,
"loss": 3.6212406158447266,
"step": 3410
},
{
"epoch": 0.13229278482114365,
"grad_norm": 0.2734375,
"learning_rate": 0.0004817819951377151,
"loss": 3.6335296630859375,
"step": 3420
},
{
"epoch": 0.1326796058293926,
"grad_norm": 0.287109375,
"learning_rate": 0.0004816701100456752,
"loss": 3.587704086303711,
"step": 3430
},
{
"epoch": 0.13306642683764155,
"grad_norm": 0.275390625,
"learning_rate": 0.00048155789622422984,
"loss": 3.6036140441894533,
"step": 3440
},
{
"epoch": 0.13345324784589052,
"grad_norm": 0.314453125,
"learning_rate": 0.00048144535384168647,
"loss": 3.5965343475341798,
"step": 3450
},
{
"epoch": 0.13384006885413946,
"grad_norm": 0.298828125,
"learning_rate": 0.0004813324830668456,
"loss": 3.6275421142578126,
"step": 3460
},
{
"epoch": 0.13422688986238843,
"grad_norm": 0.25390625,
"learning_rate": 0.00048121928406899995,
"loss": 3.646040344238281,
"step": 3470
},
{
"epoch": 0.1346137108706374,
"grad_norm": 0.259765625,
"learning_rate": 0.00048110575701793484,
"loss": 3.568130111694336,
"step": 3480
},
{
"epoch": 0.13500053187888633,
"grad_norm": 0.287109375,
"learning_rate": 0.0004809919020839274,
"loss": 3.634757232666016,
"step": 3490
},
{
"epoch": 0.1353873528871353,
"grad_norm": 0.27734375,
"learning_rate": 0.0004808777194377468,
"loss": 3.6164390563964846,
"step": 3500
},
{
"epoch": 0.1353873528871353,
"eval_loss": 4.202503204345703,
"eval_runtime": 9.9788,
"eval_samples_per_second": 32.77,
"eval_steps_per_second": 2.104,
"step": 3500
},
{
"epoch": 0.13577417389538426,
"grad_norm": 0.26171875,
"learning_rate": 0.00048076320925065336,
"loss": 3.591604995727539,
"step": 3510
},
{
"epoch": 0.1361609949036332,
"grad_norm": 0.251953125,
"learning_rate": 0.00048064837169439913,
"loss": 3.6058467864990233,
"step": 3520
},
{
"epoch": 0.13654781591188217,
"grad_norm": 0.259765625,
"learning_rate": 0.00048053320694122685,
"loss": 3.5918128967285154,
"step": 3530
},
{
"epoch": 0.13693463692013114,
"grad_norm": 0.28125,
"learning_rate": 0.0004804177151638701,
"loss": 3.591669464111328,
"step": 3540
},
{
"epoch": 0.1373214579283801,
"grad_norm": 0.2578125,
"learning_rate": 0.000480301896535553,
"loss": 3.610728073120117,
"step": 3550
},
{
"epoch": 0.13770827893662904,
"grad_norm": 0.271484375,
"learning_rate": 0.00048018575122998983,
"loss": 3.5977199554443358,
"step": 3560
},
{
"epoch": 0.138095099944878,
"grad_norm": 0.294921875,
"learning_rate": 0.000480069279421385,
"loss": 3.6169082641601564,
"step": 3570
},
{
"epoch": 0.13848192095312697,
"grad_norm": 0.283203125,
"learning_rate": 0.00047995248128443246,
"loss": 3.602222442626953,
"step": 3580
},
{
"epoch": 0.1388687419613759,
"grad_norm": 0.259765625,
"learning_rate": 0.00047983535699431564,
"loss": 3.6134090423583984,
"step": 3590
},
{
"epoch": 0.13925556296962488,
"grad_norm": 0.27734375,
"learning_rate": 0.0004797179067267073,
"loss": 3.630051040649414,
"step": 3600
},
{
"epoch": 0.13925556296962488,
"eval_loss": 4.196789741516113,
"eval_runtime": 9.999,
"eval_samples_per_second": 32.703,
"eval_steps_per_second": 2.1,
"step": 3600
},
{
"epoch": 0.13964238397787385,
"grad_norm": 0.26953125,
"learning_rate": 0.0004796001306577691,
"loss": 3.5645401000976564,
"step": 3610
},
{
"epoch": 0.14002920498612278,
"grad_norm": 0.26171875,
"learning_rate": 0.00047948202896415105,
"loss": 3.6082618713378904,
"step": 3620
},
{
"epoch": 0.14041602599437175,
"grad_norm": 0.259765625,
"learning_rate": 0.00047936360182299206,
"loss": 3.6071346282958983,
"step": 3630
},
{
"epoch": 0.14080284700262072,
"grad_norm": 0.27734375,
"learning_rate": 0.0004792448494119189,
"loss": 3.5989688873291015,
"step": 3640
},
{
"epoch": 0.14118966801086966,
"grad_norm": 0.26171875,
"learning_rate": 0.000479125771909046,
"loss": 3.560350799560547,
"step": 3650
},
{
"epoch": 0.14157648901911862,
"grad_norm": 0.275390625,
"learning_rate": 0.00047900636949297585,
"loss": 3.6439186096191407,
"step": 3660
},
{
"epoch": 0.1419633100273676,
"grad_norm": 0.265625,
"learning_rate": 0.00047888664234279797,
"loss": 3.6126590728759767,
"step": 3670
},
{
"epoch": 0.14235013103561656,
"grad_norm": 0.291015625,
"learning_rate": 0.000478766590638089,
"loss": 3.6033699035644533,
"step": 3680
},
{
"epoch": 0.1427369520438655,
"grad_norm": 0.248046875,
"learning_rate": 0.0004786462145589124,
"loss": 3.6775360107421875,
"step": 3690
},
{
"epoch": 0.14312377305211446,
"grad_norm": 0.2734375,
"learning_rate": 0.00047852551428581813,
"loss": 3.6169353485107423,
"step": 3700
},
{
"epoch": 0.14312377305211446,
"eval_loss": 4.196775436401367,
"eval_runtime": 9.9813,
"eval_samples_per_second": 32.761,
"eval_steps_per_second": 2.104,
"step": 3700
},
{
"epoch": 0.14351059406036343,
"grad_norm": 0.28125,
"learning_rate": 0.0004784044899998425,
"loss": 3.5898075103759766,
"step": 3710
},
{
"epoch": 0.14389741506861237,
"grad_norm": 0.263671875,
"learning_rate": 0.00047828314188250756,
"loss": 3.6066890716552735,
"step": 3720
},
{
"epoch": 0.14428423607686133,
"grad_norm": 0.255859375,
"learning_rate": 0.0004781614701158213,
"loss": 3.596193313598633,
"step": 3730
},
{
"epoch": 0.1446710570851103,
"grad_norm": 0.27734375,
"learning_rate": 0.00047803947488227704,
"loss": 3.559587860107422,
"step": 3740
},
{
"epoch": 0.14505787809335924,
"grad_norm": 0.267578125,
"learning_rate": 0.00047791715636485337,
"loss": 3.5958782196044923,
"step": 3750
},
{
"epoch": 0.1454446991016082,
"grad_norm": 0.24609375,
"learning_rate": 0.0004777945147470137,
"loss": 3.5777961730957033,
"step": 3760
},
{
"epoch": 0.14583152010985717,
"grad_norm": 0.326171875,
"learning_rate": 0.0004776715502127058,
"loss": 3.5617481231689454,
"step": 3770
},
{
"epoch": 0.14621834111810614,
"grad_norm": 0.25,
"learning_rate": 0.0004775482629463624,
"loss": 3.5838111877441405,
"step": 3780
},
{
"epoch": 0.14660516212635508,
"grad_norm": 0.265625,
"learning_rate": 0.00047742465313289955,
"loss": 3.590658950805664,
"step": 3790
},
{
"epoch": 0.14699198313460404,
"grad_norm": 0.25390625,
"learning_rate": 0.00047730072095771773,
"loss": 3.6110076904296875,
"step": 3800
},
{
"epoch": 0.14699198313460404,
"eval_loss": 4.168724060058594,
"eval_runtime": 9.992,
"eval_samples_per_second": 32.726,
"eval_steps_per_second": 2.102,
"step": 3800
},
{
"epoch": 0.147378804142853,
"grad_norm": 0.296875,
"learning_rate": 0.0004771764666067005,
"loss": 3.5836368560791017,
"step": 3810
},
{
"epoch": 0.14776562515110195,
"grad_norm": 0.283203125,
"learning_rate": 0.00047705189026621474,
"loss": 3.5947208404541016,
"step": 3820
},
{
"epoch": 0.14815244615935091,
"grad_norm": 0.28515625,
"learning_rate": 0.0004769269921231104,
"loss": 3.5821369171142576,
"step": 3830
},
{
"epoch": 0.14853926716759988,
"grad_norm": 0.267578125,
"learning_rate": 0.00047680177236472004,
"loss": 3.5839427947998046,
"step": 3840
},
{
"epoch": 0.14892608817584882,
"grad_norm": 0.265625,
"learning_rate": 0.0004766762311788585,
"loss": 3.555724334716797,
"step": 3850
},
{
"epoch": 0.1493129091840978,
"grad_norm": 0.27734375,
"learning_rate": 0.0004765503687538228,
"loss": 3.597983551025391,
"step": 3860
},
{
"epoch": 0.14969973019234675,
"grad_norm": 0.26171875,
"learning_rate": 0.00047642418527839184,
"loss": 3.621683120727539,
"step": 3870
},
{
"epoch": 0.1500865512005957,
"grad_norm": 0.28515625,
"learning_rate": 0.0004762976809418259,
"loss": 3.5982799530029297,
"step": 3880
},
{
"epoch": 0.15047337220884466,
"grad_norm": 0.255859375,
"learning_rate": 0.0004761708559338668,
"loss": 3.5660633087158202,
"step": 3890
},
{
"epoch": 0.15086019321709362,
"grad_norm": 0.279296875,
"learning_rate": 0.000476043710444737,
"loss": 3.6209995269775392,
"step": 3900
},
{
"epoch": 0.15086019321709362,
"eval_loss": 4.184715747833252,
"eval_runtime": 10.0083,
"eval_samples_per_second": 32.673,
"eval_steps_per_second": 2.098,
"step": 3900
},
{
"epoch": 0.1512470142253426,
"grad_norm": 0.255859375,
"learning_rate": 0.0004759162446651398,
"loss": 3.6069480895996096,
"step": 3910
},
{
"epoch": 0.15163383523359153,
"grad_norm": 0.26171875,
"learning_rate": 0.00047578845878625903,
"loss": 3.5772022247314452,
"step": 3920
},
{
"epoch": 0.1520206562418405,
"grad_norm": 0.26171875,
"learning_rate": 0.00047566035299975826,
"loss": 3.5811866760253905,
"step": 3930
},
{
"epoch": 0.15240747725008946,
"grad_norm": 0.2470703125,
"learning_rate": 0.0004755319274977812,
"loss": 3.6295467376708985,
"step": 3940
},
{
"epoch": 0.1527942982583384,
"grad_norm": 0.244140625,
"learning_rate": 0.00047540318247295125,
"loss": 3.5914112091064454,
"step": 3950
},
{
"epoch": 0.15318111926658737,
"grad_norm": 0.287109375,
"learning_rate": 0.0004752741181183704,
"loss": 3.5724857330322264,
"step": 3960
},
{
"epoch": 0.15356794027483633,
"grad_norm": 0.2734375,
"learning_rate": 0.00047514473462762034,
"loss": 3.592438507080078,
"step": 3970
},
{
"epoch": 0.15395476128308527,
"grad_norm": 0.26953125,
"learning_rate": 0.0004750150321947609,
"loss": 3.5568592071533205,
"step": 3980
},
{
"epoch": 0.15434158229133424,
"grad_norm": 0.255859375,
"learning_rate": 0.00047488501101433065,
"loss": 3.589873123168945,
"step": 3990
},
{
"epoch": 0.1547284032995832,
"grad_norm": 0.2470703125,
"learning_rate": 0.00047475467128134586,
"loss": 3.5943378448486327,
"step": 4000
},
{
"epoch": 0.1547284032995832,
"eval_loss": 4.1639275550842285,
"eval_runtime": 10.0126,
"eval_samples_per_second": 32.659,
"eval_steps_per_second": 2.097,
"step": 4000
},
{
"epoch": 0.15511522430783214,
"grad_norm": 0.291015625,
"learning_rate": 0.0004746240131913011,
"loss": 3.5330867767333984,
"step": 4010
},
{
"epoch": 0.1555020453160811,
"grad_norm": 0.26171875,
"learning_rate": 0.0004744930369401679,
"loss": 3.5745521545410157,
"step": 4020
},
{
"epoch": 0.15588886632433008,
"grad_norm": 0.26171875,
"learning_rate": 0.00047436174272439535,
"loss": 3.5994407653808596,
"step": 4030
},
{
"epoch": 0.15627568733257904,
"grad_norm": 0.283203125,
"learning_rate": 0.00047423013074090933,
"loss": 3.5939708709716798,
"step": 4040
},
{
"epoch": 0.15666250834082798,
"grad_norm": 0.2421875,
"learning_rate": 0.0004740982011871123,
"loss": 3.5709758758544923,
"step": 4050
},
{
"epoch": 0.15704932934907695,
"grad_norm": 0.259765625,
"learning_rate": 0.00047396595426088317,
"loss": 3.596474456787109,
"step": 4060
},
{
"epoch": 0.15743615035732592,
"grad_norm": 0.263671875,
"learning_rate": 0.00047383339016057675,
"loss": 3.6182701110839846,
"step": 4070
},
{
"epoch": 0.15782297136557485,
"grad_norm": 0.279296875,
"learning_rate": 0.00047370050908502367,
"loss": 3.5875564575195313,
"step": 4080
},
{
"epoch": 0.15820979237382382,
"grad_norm": 0.27734375,
"learning_rate": 0.0004735673112335297,
"loss": 3.5575897216796877,
"step": 4090
},
{
"epoch": 0.1585966133820728,
"grad_norm": 0.29296875,
"learning_rate": 0.0004734337968058762,
"loss": 3.5939361572265627,
"step": 4100
},
{
"epoch": 0.1585966133820728,
"eval_loss": 4.146914958953857,
"eval_runtime": 10.0531,
"eval_samples_per_second": 32.527,
"eval_steps_per_second": 2.089,
"step": 4100
},
{
"epoch": 0.15898343439032173,
"grad_norm": 0.265625,
"learning_rate": 0.00047329996600231904,
"loss": 3.564817428588867,
"step": 4110
},
{
"epoch": 0.1593702553985707,
"grad_norm": 0.2578125,
"learning_rate": 0.00047316581902358875,
"loss": 3.6007923126220702,
"step": 4120
},
{
"epoch": 0.15975707640681966,
"grad_norm": 0.275390625,
"learning_rate": 0.00047303135607088995,
"loss": 3.6004383087158205,
"step": 4130
},
{
"epoch": 0.16014389741506863,
"grad_norm": 0.28515625,
"learning_rate": 0.0004728965773459013,
"loss": 3.631551742553711,
"step": 4140
},
{
"epoch": 0.16053071842331756,
"grad_norm": 0.271484375,
"learning_rate": 0.0004727614830507749,
"loss": 3.5560813903808595,
"step": 4150
},
{
"epoch": 0.16091753943156653,
"grad_norm": 0.275390625,
"learning_rate": 0.00047262607338813663,
"loss": 3.601303482055664,
"step": 4160
},
{
"epoch": 0.1613043604398155,
"grad_norm": 0.275390625,
"learning_rate": 0.0004724903485610848,
"loss": 3.589255523681641,
"step": 4170
},
{
"epoch": 0.16169118144806444,
"grad_norm": 0.2578125,
"learning_rate": 0.00047235430877319085,
"loss": 3.5800621032714846,
"step": 4180
},
{
"epoch": 0.1620780024563134,
"grad_norm": 0.25390625,
"learning_rate": 0.00047221795422849845,
"loss": 3.6015853881835938,
"step": 4190
},
{
"epoch": 0.16246482346456237,
"grad_norm": 0.27734375,
"learning_rate": 0.0004720812851315233,
"loss": 3.5746341705322267,
"step": 4200
},
{
"epoch": 0.16246482346456237,
"eval_loss": 4.151747226715088,
"eval_runtime": 10.061,
"eval_samples_per_second": 32.502,
"eval_steps_per_second": 2.087,
"step": 4200
},
{
"epoch": 0.1628516444728113,
"grad_norm": 0.2734375,
"learning_rate": 0.000471944301687253,
"loss": 3.585940933227539,
"step": 4210
},
{
"epoch": 0.16323846548106027,
"grad_norm": 0.2431640625,
"learning_rate": 0.0004718070041011467,
"loss": 3.5748485565185546,
"step": 4220
},
{
"epoch": 0.16362528648930924,
"grad_norm": 0.279296875,
"learning_rate": 0.0004716693925791346,
"loss": 3.604657745361328,
"step": 4230
},
{
"epoch": 0.16401210749755818,
"grad_norm": 0.271484375,
"learning_rate": 0.00047153146732761776,
"loss": 3.570362091064453,
"step": 4240
},
{
"epoch": 0.16439892850580715,
"grad_norm": 0.279296875,
"learning_rate": 0.00047139322855346794,
"loss": 3.5857212066650392,
"step": 4250
},
{
"epoch": 0.1647857495140561,
"grad_norm": 0.25390625,
"learning_rate": 0.000471254676464027,
"loss": 3.5793018341064453,
"step": 4260
},
{
"epoch": 0.16517257052230508,
"grad_norm": 0.271484375,
"learning_rate": 0.00047111581126710675,
"loss": 3.617490768432617,
"step": 4270
},
{
"epoch": 0.16555939153055402,
"grad_norm": 0.26171875,
"learning_rate": 0.00047097663317098874,
"loss": 3.5748958587646484,
"step": 4280
},
{
"epoch": 0.16594621253880298,
"grad_norm": 0.251953125,
"learning_rate": 0.0004708371423844237,
"loss": 3.5808582305908203,
"step": 4290
},
{
"epoch": 0.16633303354705195,
"grad_norm": 0.271484375,
"learning_rate": 0.0004706973391166315,
"loss": 3.565126419067383,
"step": 4300
},
{
"epoch": 0.16633303354705195,
"eval_loss": 4.144286155700684,
"eval_runtime": 10.0708,
"eval_samples_per_second": 32.47,
"eval_steps_per_second": 2.085,
"step": 4300
},
{
"epoch": 0.1667198545553009,
"grad_norm": 0.2431640625,
"learning_rate": 0.00047055722357730053,
"loss": 3.601681137084961,
"step": 4310
},
{
"epoch": 0.16710667556354986,
"grad_norm": 0.26171875,
"learning_rate": 0.00047041679597658773,
"loss": 3.619378662109375,
"step": 4320
},
{
"epoch": 0.16749349657179882,
"grad_norm": 0.267578125,
"learning_rate": 0.0004702760565251178,
"loss": 3.5644298553466798,
"step": 4330
},
{
"epoch": 0.16788031758004776,
"grad_norm": 0.279296875,
"learning_rate": 0.0004701350054339835,
"loss": 3.5358177185058595,
"step": 4340
},
{
"epoch": 0.16826713858829673,
"grad_norm": 0.283203125,
"learning_rate": 0.00046999364291474486,
"loss": 3.5819393157958985,
"step": 4350
},
{
"epoch": 0.1686539595965457,
"grad_norm": 0.25390625,
"learning_rate": 0.00046985196917942923,
"loss": 3.6105266571044923,
"step": 4360
},
{
"epoch": 0.16904078060479463,
"grad_norm": 0.26953125,
"learning_rate": 0.00046970998444053025,
"loss": 3.5382503509521483,
"step": 4370
},
{
"epoch": 0.1694276016130436,
"grad_norm": 0.2451171875,
"learning_rate": 0.0004695676889110086,
"loss": 3.5398067474365233,
"step": 4380
},
{
"epoch": 0.16981442262129257,
"grad_norm": 0.263671875,
"learning_rate": 0.0004694250828042906,
"loss": 3.573816680908203,
"step": 4390
},
{
"epoch": 0.17020124362954153,
"grad_norm": 0.2734375,
"learning_rate": 0.0004692821663342689,
"loss": 3.5996776580810548,
"step": 4400
},
{
"epoch": 0.17020124362954153,
"eval_loss": 4.145204544067383,
"eval_runtime": 10.0751,
"eval_samples_per_second": 32.456,
"eval_steps_per_second": 2.084,
"step": 4400
},
{
"epoch": 0.17058806463779047,
"grad_norm": 0.291015625,
"learning_rate": 0.0004691389397153013,
"loss": 3.5502437591552733,
"step": 4410
},
{
"epoch": 0.17097488564603944,
"grad_norm": 0.2734375,
"learning_rate": 0.00046899540316221086,
"loss": 3.591476821899414,
"step": 4420
},
{
"epoch": 0.1713617066542884,
"grad_norm": 0.271484375,
"learning_rate": 0.0004688515568902855,
"loss": 3.563010406494141,
"step": 4430
},
{
"epoch": 0.17174852766253734,
"grad_norm": 0.259765625,
"learning_rate": 0.0004687074011152779,
"loss": 3.5925624847412108,
"step": 4440
},
{
"epoch": 0.1721353486707863,
"grad_norm": 0.265625,
"learning_rate": 0.00046856293605340466,
"loss": 3.576287841796875,
"step": 4450
},
{
"epoch": 0.17252216967903528,
"grad_norm": 0.255859375,
"learning_rate": 0.00046841816192134635,
"loss": 3.5883880615234376,
"step": 4460
},
{
"epoch": 0.17290899068728421,
"grad_norm": 0.27734375,
"learning_rate": 0.00046827307893624725,
"loss": 3.557068634033203,
"step": 4470
},
{
"epoch": 0.17329581169553318,
"grad_norm": 0.265625,
"learning_rate": 0.0004681276873157147,
"loss": 3.5829254150390626,
"step": 4480
},
{
"epoch": 0.17368263270378215,
"grad_norm": 0.25,
"learning_rate": 0.00046798198727781914,
"loss": 3.5822193145751955,
"step": 4490
},
{
"epoch": 0.1740694537120311,
"grad_norm": 0.26171875,
"learning_rate": 0.0004678359790410934,
"loss": 3.570149230957031,
"step": 4500
},
{
"epoch": 0.1740694537120311,
"eval_loss": 4.142066955566406,
"eval_runtime": 10.0399,
"eval_samples_per_second": 32.57,
"eval_steps_per_second": 2.092,
"step": 4500
},
{
"epoch": 0.17445627472028005,
"grad_norm": 0.2451171875,
"learning_rate": 0.00046768966282453276,
"loss": 3.5578567504882814,
"step": 4510
},
{
"epoch": 0.17484309572852902,
"grad_norm": 0.2734375,
"learning_rate": 0.00046754303884759436,
"loss": 3.614657974243164,
"step": 4520
},
{
"epoch": 0.17522991673677799,
"grad_norm": 0.2734375,
"learning_rate": 0.0004673961073301968,
"loss": 3.5728389739990236,
"step": 4530
},
{
"epoch": 0.17561673774502692,
"grad_norm": 0.28125,
"learning_rate": 0.0004672488684927202,
"loss": 3.5710781097412108,
"step": 4540
},
{
"epoch": 0.1760035587532759,
"grad_norm": 0.248046875,
"learning_rate": 0.0004671013225560054,
"loss": 3.5570396423339843,
"step": 4550
},
{
"epoch": 0.17639037976152486,
"grad_norm": 0.25390625,
"learning_rate": 0.00046695346974135414,
"loss": 3.571766662597656,
"step": 4560
},
{
"epoch": 0.1767772007697738,
"grad_norm": 0.25390625,
"learning_rate": 0.0004668053102705281,
"loss": 3.5966800689697265,
"step": 4570
},
{
"epoch": 0.17716402177802276,
"grad_norm": 0.283203125,
"learning_rate": 0.0004666568443657492,
"loss": 3.5605045318603517,
"step": 4580
},
{
"epoch": 0.17755084278627173,
"grad_norm": 0.275390625,
"learning_rate": 0.0004665080722496988,
"loss": 3.546836090087891,
"step": 4590
},
{
"epoch": 0.17793766379452067,
"grad_norm": 0.275390625,
"learning_rate": 0.0004663589941455176,
"loss": 3.5560222625732423,
"step": 4600
},
{
"epoch": 0.17793766379452067,
"eval_loss": 4.123315811157227,
"eval_runtime": 10.0373,
"eval_samples_per_second": 32.579,
"eval_steps_per_second": 2.092,
"step": 4600
},
{
"epoch": 0.17832448480276963,
"grad_norm": 0.263671875,
"learning_rate": 0.0004662096102768052,
"loss": 3.5690940856933593,
"step": 4610
},
{
"epoch": 0.1787113058110186,
"grad_norm": 0.26171875,
"learning_rate": 0.0004660599208676198,
"loss": 3.566990280151367,
"step": 4620
},
{
"epoch": 0.17909812681926757,
"grad_norm": 0.267578125,
"learning_rate": 0.000465909926142478,
"loss": 3.563935089111328,
"step": 4630
},
{
"epoch": 0.1794849478275165,
"grad_norm": 0.27734375,
"learning_rate": 0.0004657596263263542,
"loss": 3.535744857788086,
"step": 4640
},
{
"epoch": 0.17987176883576547,
"grad_norm": 0.265625,
"learning_rate": 0.00046560902164468053,
"loss": 3.558307647705078,
"step": 4650
},
{
"epoch": 0.18025858984401444,
"grad_norm": 0.267578125,
"learning_rate": 0.0004654581123233464,
"loss": 3.5660072326660157,
"step": 4660
},
{
"epoch": 0.18064541085226338,
"grad_norm": 0.263671875,
"learning_rate": 0.0004653068985886977,
"loss": 3.5773242950439452,
"step": 4670
},
{
"epoch": 0.18103223186051234,
"grad_norm": 0.259765625,
"learning_rate": 0.00046515538066753767,
"loss": 3.5603591918945314,
"step": 4680
},
{
"epoch": 0.1814190528687613,
"grad_norm": 0.251953125,
"learning_rate": 0.0004650035587871252,
"loss": 3.5422637939453123,
"step": 4690
},
{
"epoch": 0.18180587387701025,
"grad_norm": 0.283203125,
"learning_rate": 0.00046485143317517516,
"loss": 3.5612777709960937,
"step": 4700
},
{
"epoch": 0.18180587387701025,
"eval_loss": 4.127031326293945,
"eval_runtime": 10.0536,
"eval_samples_per_second": 32.526,
"eval_steps_per_second": 2.089,
"step": 4700
},
{
"epoch": 0.18219269488525922,
"grad_norm": 0.259765625,
"learning_rate": 0.0004646990040598583,
"loss": 3.562766265869141,
"step": 4710
},
{
"epoch": 0.18257951589350818,
"grad_norm": 0.255859375,
"learning_rate": 0.00046454627166980024,
"loss": 3.5492530822753907,
"step": 4720
},
{
"epoch": 0.18296633690175712,
"grad_norm": 0.25,
"learning_rate": 0.0004643932362340817,
"loss": 3.55328254699707,
"step": 4730
},
{
"epoch": 0.1833531579100061,
"grad_norm": 0.279296875,
"learning_rate": 0.0004642398979822377,
"loss": 3.553334426879883,
"step": 4740
},
{
"epoch": 0.18373997891825505,
"grad_norm": 0.267578125,
"learning_rate": 0.0004640862571442578,
"loss": 3.556576156616211,
"step": 4750
},
{
"epoch": 0.18412679992650402,
"grad_norm": 0.2470703125,
"learning_rate": 0.00046393231395058505,
"loss": 3.5628944396972657,
"step": 4760
},
{
"epoch": 0.18451362093475296,
"grad_norm": 0.2578125,
"learning_rate": 0.0004637780686321162,
"loss": 3.5898536682128905,
"step": 4770
},
{
"epoch": 0.18490044194300193,
"grad_norm": 0.25,
"learning_rate": 0.00046362352142020105,
"loss": 3.578490447998047,
"step": 4780
},
{
"epoch": 0.1852872629512509,
"grad_norm": 0.279296875,
"learning_rate": 0.0004634686725466424,
"loss": 3.546381378173828,
"step": 4790
},
{
"epoch": 0.18567408395949983,
"grad_norm": 0.265625,
"learning_rate": 0.0004633135222436951,
"loss": 3.5513580322265623,
"step": 4800
},
{
"epoch": 0.18567408395949983,
"eval_loss": 4.12771463394165,
"eval_runtime": 10.0643,
"eval_samples_per_second": 32.491,
"eval_steps_per_second": 2.087,
"step": 4800
},
{
"epoch": 0.1860609049677488,
"grad_norm": 0.2470703125,
"learning_rate": 0.0004631580707440666,
"loss": 3.5534221649169924,
"step": 4810
},
{
"epoch": 0.18644772597599776,
"grad_norm": 0.26171875,
"learning_rate": 0.00046300231828091585,
"loss": 3.5446445465087892,
"step": 4820
},
{
"epoch": 0.1868345469842467,
"grad_norm": 0.248046875,
"learning_rate": 0.00046284626508785314,
"loss": 3.5525463104248045,
"step": 4830
},
{
"epoch": 0.18722136799249567,
"grad_norm": 0.2734375,
"learning_rate": 0.00046268991139893995,
"loss": 3.5511096954345702,
"step": 4840
},
{
"epoch": 0.18760818900074464,
"grad_norm": 0.2578125,
"learning_rate": 0.0004625332574486885,
"loss": 3.5215126037597657,
"step": 4850
},
{
"epoch": 0.1879950100089936,
"grad_norm": 0.259765625,
"learning_rate": 0.0004623763034720613,
"loss": 3.546421432495117,
"step": 4860
},
{
"epoch": 0.18838183101724254,
"grad_norm": 0.25,
"learning_rate": 0.0004622190497044707,
"loss": 3.551416778564453,
"step": 4870
},
{
"epoch": 0.1887686520254915,
"grad_norm": 0.259765625,
"learning_rate": 0.0004620614963817791,
"loss": 3.605236053466797,
"step": 4880
},
{
"epoch": 0.18915547303374047,
"grad_norm": 0.2578125,
"learning_rate": 0.00046190364374029783,
"loss": 3.5282737731933596,
"step": 4890
},
{
"epoch": 0.1895422940419894,
"grad_norm": 0.25,
"learning_rate": 0.00046174549201678734,
"loss": 3.544286346435547,
"step": 4900
},
{
"epoch": 0.1895422940419894,
"eval_loss": 4.114104270935059,
"eval_runtime": 9.9575,
"eval_samples_per_second": 32.84,
"eval_steps_per_second": 2.109,
"step": 4900
},
{
"epoch": 0.18992911505023838,
"grad_norm": 0.283203125,
"learning_rate": 0.00046158704144845666,
"loss": 3.5649555206298826,
"step": 4910
},
{
"epoch": 0.19031593605848734,
"grad_norm": 0.287109375,
"learning_rate": 0.00046142829227296294,
"loss": 3.5907196044921874,
"step": 4920
},
{
"epoch": 0.19070275706673628,
"grad_norm": 0.2734375,
"learning_rate": 0.0004612692447284113,
"loss": 3.5507247924804686,
"step": 4930
},
{
"epoch": 0.19108957807498525,
"grad_norm": 0.244140625,
"learning_rate": 0.00046110989905335435,
"loss": 3.5793888092041017,
"step": 4940
},
{
"epoch": 0.19147639908323422,
"grad_norm": 0.25,
"learning_rate": 0.000460950255486792,
"loss": 3.5635608673095702,
"step": 4950
},
{
"epoch": 0.19186322009148316,
"grad_norm": 0.275390625,
"learning_rate": 0.00046079031426817077,
"loss": 3.5769954681396485,
"step": 4960
},
{
"epoch": 0.19225004109973212,
"grad_norm": 0.25,
"learning_rate": 0.0004606300756373836,
"loss": 3.543282699584961,
"step": 4970
},
{
"epoch": 0.1926368621079811,
"grad_norm": 0.263671875,
"learning_rate": 0.00046046953983476963,
"loss": 3.534237289428711,
"step": 4980
},
{
"epoch": 0.19302368311623005,
"grad_norm": 0.2578125,
"learning_rate": 0.00046030870710111387,
"loss": 3.5499801635742188,
"step": 4990
},
{
"epoch": 0.193410504124479,
"grad_norm": 0.27734375,
"learning_rate": 0.0004601475776776463,
"loss": 3.551239013671875,
"step": 5000
},
{
"epoch": 0.193410504124479,
"eval_loss": 4.095266342163086,
"eval_runtime": 10.0836,
"eval_samples_per_second": 32.429,
"eval_steps_per_second": 2.083,
"step": 5000
},
{
"epoch": 0.19379732513272796,
"grad_norm": 0.283203125,
"learning_rate": 0.0004599861518060422,
"loss": 3.5352596282958983,
"step": 5010
},
{
"epoch": 0.19418414614097693,
"grad_norm": 0.2734375,
"learning_rate": 0.0004598244297284214,
"loss": 3.5772289276123046,
"step": 5020
},
{
"epoch": 0.19457096714922587,
"grad_norm": 0.267578125,
"learning_rate": 0.00045966241168734806,
"loss": 3.574796676635742,
"step": 5030
},
{
"epoch": 0.19495778815747483,
"grad_norm": 0.25,
"learning_rate": 0.00045950009792583015,
"loss": 3.5158466339111327,
"step": 5040
},
{
"epoch": 0.1953446091657238,
"grad_norm": 0.2392578125,
"learning_rate": 0.00045933748868731916,
"loss": 3.533673858642578,
"step": 5050
},
{
"epoch": 0.19573143017397274,
"grad_norm": 0.24609375,
"learning_rate": 0.00045917458421571,
"loss": 3.5585952758789063,
"step": 5060
},
{
"epoch": 0.1961182511822217,
"grad_norm": 0.28515625,
"learning_rate": 0.0004590113847553402,
"loss": 3.532826232910156,
"step": 5070
},
{
"epoch": 0.19650507219047067,
"grad_norm": 0.27734375,
"learning_rate": 0.00045884789055098963,
"loss": 3.566379928588867,
"step": 5080
},
{
"epoch": 0.1968918931987196,
"grad_norm": 0.259765625,
"learning_rate": 0.00045868410184788045,
"loss": 3.5672889709472657,
"step": 5090
},
{
"epoch": 0.19727871420696858,
"grad_norm": 0.28125,
"learning_rate": 0.00045852001889167655,
"loss": 3.5408248901367188,
"step": 5100
},
{
"epoch": 0.19727871420696858,
"eval_loss": 4.099873065948486,
"eval_runtime": 10.0832,
"eval_samples_per_second": 32.43,
"eval_steps_per_second": 2.083,
"step": 5100
},
{
"epoch": 0.19766553521521754,
"grad_norm": 0.2734375,
"learning_rate": 0.00045835564192848294,
"loss": 3.5583164215087892,
"step": 5110
},
{
"epoch": 0.1980523562234665,
"grad_norm": 0.267578125,
"learning_rate": 0.00045819097120484585,
"loss": 3.556626892089844,
"step": 5120
},
{
"epoch": 0.19843917723171545,
"grad_norm": 0.2578125,
"learning_rate": 0.00045802600696775195,
"loss": 3.545968246459961,
"step": 5130
},
{
"epoch": 0.1988259982399644,
"grad_norm": 0.25,
"learning_rate": 0.0004578607494646283,
"loss": 3.536521148681641,
"step": 5140
},
{
"epoch": 0.19921281924821338,
"grad_norm": 0.255859375,
"learning_rate": 0.00045769519894334166,
"loss": 3.571156692504883,
"step": 5150
},
{
"epoch": 0.19959964025646232,
"grad_norm": 0.263671875,
"learning_rate": 0.00045752935565219826,
"loss": 3.5418251037597654,
"step": 5160
},
{
"epoch": 0.19998646126471128,
"grad_norm": 0.265625,
"learning_rate": 0.0004573632198399437,
"loss": 3.5485843658447265,
"step": 5170
},
{
"epoch": 0.20037328227296025,
"grad_norm": 0.2490234375,
"learning_rate": 0.0004571967917557621,
"loss": 3.5757156372070313,
"step": 5180
},
{
"epoch": 0.2007601032812092,
"grad_norm": 0.25390625,
"learning_rate": 0.00045703007164927606,
"loss": 3.5134517669677736,
"step": 5190
},
{
"epoch": 0.20114692428945816,
"grad_norm": 0.26171875,
"learning_rate": 0.00045686305977054616,
"loss": 3.5113853454589843,
"step": 5200
},
{
"epoch": 0.20114692428945816,
"eval_loss": 4.089205741882324,
"eval_runtime": 10.0508,
"eval_samples_per_second": 32.535,
"eval_steps_per_second": 2.089,
"step": 5200
},
{
"epoch": 0.20153374529770712,
"grad_norm": 0.2490234375,
"learning_rate": 0.00045669575637007054,
"loss": 3.5599761962890626,
"step": 5210
},
{
"epoch": 0.2019205663059561,
"grad_norm": 0.265625,
"learning_rate": 0.00045652816169878467,
"loss": 3.5213069915771484,
"step": 5220
},
{
"epoch": 0.20230738731420503,
"grad_norm": 0.2470703125,
"learning_rate": 0.0004563602760080608,
"loss": 3.510356140136719,
"step": 5230
},
{
"epoch": 0.202694208322454,
"grad_norm": 0.25,
"learning_rate": 0.0004561920995497078,
"loss": 3.5470203399658202,
"step": 5240
},
{
"epoch": 0.20308102933070296,
"grad_norm": 0.255859375,
"learning_rate": 0.0004560236325759705,
"loss": 3.5547637939453125,
"step": 5250
},
{
"epoch": 0.2034678503389519,
"grad_norm": 0.25390625,
"learning_rate": 0.00045585487533952976,
"loss": 3.5266292572021483,
"step": 5260
},
{
"epoch": 0.20385467134720087,
"grad_norm": 0.27734375,
"learning_rate": 0.0004556858280935013,
"loss": 3.5063777923583985,
"step": 5270
},
{
"epoch": 0.20424149235544983,
"grad_norm": 0.265625,
"learning_rate": 0.00045551649109143644,
"loss": 3.5121044158935546,
"step": 5280
},
{
"epoch": 0.20462831336369877,
"grad_norm": 0.29296875,
"learning_rate": 0.00045534686458732055,
"loss": 3.539692687988281,
"step": 5290
},
{
"epoch": 0.20501513437194774,
"grad_norm": 0.26953125,
"learning_rate": 0.0004551769488355736,
"loss": 3.555554962158203,
"step": 5300
},
{
"epoch": 0.20501513437194774,
"eval_loss": 4.082935333251953,
"eval_runtime": 10.0668,
"eval_samples_per_second": 32.483,
"eval_steps_per_second": 2.086,
"step": 5300
},
{
"epoch": 0.2054019553801967,
"grad_norm": 0.275390625,
"learning_rate": 0.00045500674409104907,
"loss": 3.5431640625,
"step": 5310
},
{
"epoch": 0.20578877638844564,
"grad_norm": 0.259765625,
"learning_rate": 0.0004548362506090342,
"loss": 3.528326416015625,
"step": 5320
},
{
"epoch": 0.2061755973966946,
"grad_norm": 0.283203125,
"learning_rate": 0.0004546654686452493,
"loss": 3.5564811706542967,
"step": 5330
},
{
"epoch": 0.20656241840494358,
"grad_norm": 0.25390625,
"learning_rate": 0.00045449439845584693,
"loss": 3.5544174194335936,
"step": 5340
},
{
"epoch": 0.20694923941319254,
"grad_norm": 0.267578125,
"learning_rate": 0.00045432304029741245,
"loss": 3.493732452392578,
"step": 5350
},
{
"epoch": 0.20733606042144148,
"grad_norm": 0.25,
"learning_rate": 0.00045415139442696296,
"loss": 3.5211856842041014,
"step": 5360
},
{
"epoch": 0.20772288142969045,
"grad_norm": 0.26953125,
"learning_rate": 0.0004539794611019471,
"loss": 3.521197509765625,
"step": 5370
},
{
"epoch": 0.20810970243793941,
"grad_norm": 0.2470703125,
"learning_rate": 0.00045380724058024466,
"loss": 3.5391448974609374,
"step": 5380
},
{
"epoch": 0.20849652344618835,
"grad_norm": 0.3046875,
"learning_rate": 0.0004536347331201661,
"loss": 3.550646209716797,
"step": 5390
},
{
"epoch": 0.20888334445443732,
"grad_norm": 0.25,
"learning_rate": 0.00045346193898045237,
"loss": 3.5525577545166014,
"step": 5400
},
{
"epoch": 0.20888334445443732,
"eval_loss": 4.085052490234375,
"eval_runtime": 10.0705,
"eval_samples_per_second": 32.471,
"eval_steps_per_second": 2.085,
"step": 5400
},
{
"epoch": 0.2092701654626863,
"grad_norm": 0.26171875,
"learning_rate": 0.0004532888584202743,
"loss": 3.520841598510742,
"step": 5410
},
{
"epoch": 0.20965698647093522,
"grad_norm": 0.291015625,
"learning_rate": 0.0004531154916992326,
"loss": 3.5018367767333984,
"step": 5420
},
{
"epoch": 0.2100438074791842,
"grad_norm": 0.265625,
"learning_rate": 0.00045294183907735675,
"loss": 3.531473922729492,
"step": 5430
},
{
"epoch": 0.21043062848743316,
"grad_norm": 0.267578125,
"learning_rate": 0.0004527679008151054,
"loss": 3.554092788696289,
"step": 5440
},
{
"epoch": 0.21081744949568212,
"grad_norm": 0.2470703125,
"learning_rate": 0.00045259367717336545,
"loss": 3.5328224182128904,
"step": 5450
},
{
"epoch": 0.21120427050393106,
"grad_norm": 0.255859375,
"learning_rate": 0.00045241916841345193,
"loss": 3.5440658569335937,
"step": 5460
},
{
"epoch": 0.21159109151218003,
"grad_norm": 0.251953125,
"learning_rate": 0.00045224437479710744,
"loss": 3.5399906158447267,
"step": 5470
},
{
"epoch": 0.211977912520429,
"grad_norm": 0.25390625,
"learning_rate": 0.00045206929658650187,
"loss": 3.533125305175781,
"step": 5480
},
{
"epoch": 0.21236473352867793,
"grad_norm": 0.2451171875,
"learning_rate": 0.00045189393404423197,
"loss": 3.531673812866211,
"step": 5490
},
{
"epoch": 0.2127515545369269,
"grad_norm": 0.287109375,
"learning_rate": 0.00045171828743332084,
"loss": 3.516398620605469,
"step": 5500
},
{
"epoch": 0.2127515545369269,
"eval_loss": 4.070333957672119,
"eval_runtime": 10.0591,
"eval_samples_per_second": 32.508,
"eval_steps_per_second": 2.088,
"step": 5500
},
{
"epoch": 0.21313837554517587,
"grad_norm": 0.26953125,
"learning_rate": 0.00045154235701721785,
"loss": 3.5363746643066407,
"step": 5510
},
{
"epoch": 0.2135251965534248,
"grad_norm": 0.26171875,
"learning_rate": 0.00045136614305979803,
"loss": 3.5801647186279295,
"step": 5520
},
{
"epoch": 0.21391201756167377,
"grad_norm": 0.2431640625,
"learning_rate": 0.00045118964582536135,
"loss": 3.555461120605469,
"step": 5530
},
{
"epoch": 0.21429883856992274,
"grad_norm": 0.259765625,
"learning_rate": 0.00045101286557863317,
"loss": 3.507638168334961,
"step": 5540
},
{
"epoch": 0.21468565957817168,
"grad_norm": 0.2470703125,
"learning_rate": 0.00045083580258476304,
"loss": 3.5301235198974608,
"step": 5550
},
{
"epoch": 0.21507248058642064,
"grad_norm": 0.251953125,
"learning_rate": 0.0004506584571093245,
"loss": 3.5175750732421873,
"step": 5560
},
{
"epoch": 0.2154593015946696,
"grad_norm": 0.25390625,
"learning_rate": 0.000450480829418315,
"loss": 3.504682159423828,
"step": 5570
},
{
"epoch": 0.21584612260291858,
"grad_norm": 0.26171875,
"learning_rate": 0.00045030291977815525,
"loss": 3.527938461303711,
"step": 5580
},
{
"epoch": 0.21623294361116752,
"grad_norm": 0.267578125,
"learning_rate": 0.00045012472845568877,
"loss": 3.536154937744141,
"step": 5590
},
{
"epoch": 0.21661976461941648,
"grad_norm": 0.24609375,
"learning_rate": 0.00044994625571818155,
"loss": 3.54614143371582,
"step": 5600
},
{
"epoch": 0.21661976461941648,
"eval_loss": 4.063368320465088,
"eval_runtime": 10.054,
"eval_samples_per_second": 32.524,
"eval_steps_per_second": 2.089,
"step": 5600
},
{
"epoch": 0.21700658562766545,
"grad_norm": 0.2431640625,
"learning_rate": 0.00044976750183332165,
"loss": 3.5452247619628907,
"step": 5610
},
{
"epoch": 0.2173934066359144,
"grad_norm": 0.2490234375,
"learning_rate": 0.00044958846706921914,
"loss": 3.5369388580322267,
"step": 5620
},
{
"epoch": 0.21778022764416335,
"grad_norm": 0.2890625,
"learning_rate": 0.00044940915169440493,
"loss": 3.5290111541748046,
"step": 5630
},
{
"epoch": 0.21816704865241232,
"grad_norm": 0.259765625,
"learning_rate": 0.0004492295559778311,
"loss": 3.5256011962890623,
"step": 5640
},
{
"epoch": 0.21855386966066126,
"grad_norm": 0.263671875,
"learning_rate": 0.00044904968018887,
"loss": 3.537184143066406,
"step": 5650
},
{
"epoch": 0.21894069066891023,
"grad_norm": 0.25390625,
"learning_rate": 0.0004488695245973143,
"loss": 3.5146228790283205,
"step": 5660
},
{
"epoch": 0.2193275116771592,
"grad_norm": 0.287109375,
"learning_rate": 0.0004486890894733762,
"loss": 3.4976150512695314,
"step": 5670
},
{
"epoch": 0.21971433268540813,
"grad_norm": 0.2392578125,
"learning_rate": 0.00044850837508768706,
"loss": 3.51986083984375,
"step": 5680
},
{
"epoch": 0.2201011536936571,
"grad_norm": 0.244140625,
"learning_rate": 0.0004483273817112973,
"loss": 3.507583236694336,
"step": 5690
},
{
"epoch": 0.22048797470190606,
"grad_norm": 0.28515625,
"learning_rate": 0.00044814610961567566,
"loss": 3.5720191955566407,
"step": 5700
},
{
"epoch": 0.22048797470190606,
"eval_loss": 4.055907249450684,
"eval_runtime": 10.0576,
"eval_samples_per_second": 32.513,
"eval_steps_per_second": 2.088,
"step": 5700
},
{
"epoch": 0.22087479571015503,
"grad_norm": 0.265625,
"learning_rate": 0.00044796455907270905,
"loss": 3.508076477050781,
"step": 5710
},
{
"epoch": 0.22126161671840397,
"grad_norm": 0.251953125,
"learning_rate": 0.000447782730354702,
"loss": 3.5065277099609373,
"step": 5720
},
{
"epoch": 0.22164843772665294,
"grad_norm": 0.26953125,
"learning_rate": 0.00044760062373437604,
"loss": 3.5399009704589846,
"step": 5730
},
{
"epoch": 0.2220352587349019,
"grad_norm": 0.2734375,
"learning_rate": 0.0004474182394848698,
"loss": 3.561381149291992,
"step": 5740
},
{
"epoch": 0.22242207974315084,
"grad_norm": 0.26953125,
"learning_rate": 0.00044723557787973824,
"loss": 3.4996368408203127,
"step": 5750
},
{
"epoch": 0.2228089007513998,
"grad_norm": 0.28515625,
"learning_rate": 0.0004470526391929523,
"loss": 3.500721740722656,
"step": 5760
},
{
"epoch": 0.22319572175964877,
"grad_norm": 0.2578125,
"learning_rate": 0.0004468694236988985,
"loss": 3.485240936279297,
"step": 5770
},
{
"epoch": 0.2235825427678977,
"grad_norm": 0.259765625,
"learning_rate": 0.00044668593167237846,
"loss": 3.5129344940185545,
"step": 5780
},
{
"epoch": 0.22396936377614668,
"grad_norm": 0.26171875,
"learning_rate": 0.00044650216338860873,
"loss": 3.4915618896484375,
"step": 5790
},
{
"epoch": 0.22435618478439565,
"grad_norm": 0.255859375,
"learning_rate": 0.0004463181191232202,
"loss": 3.551679229736328,
"step": 5800
},
{
"epoch": 0.22435618478439565,
"eval_loss": 4.072558879852295,
"eval_runtime": 10.1948,
"eval_samples_per_second": 32.075,
"eval_steps_per_second": 2.06,
"step": 5800
},
{
"epoch": 0.2247430057926446,
"grad_norm": 0.2421875,
"learning_rate": 0.0004461337991522574,
"loss": 3.5697952270507813,
"step": 5810
},
{
"epoch": 0.22512982680089355,
"grad_norm": 0.26171875,
"learning_rate": 0.00044594920375217893,
"loss": 3.513915252685547,
"step": 5820
},
{
"epoch": 0.22551664780914252,
"grad_norm": 0.279296875,
"learning_rate": 0.000445764333199856,
"loss": 3.4932785034179688,
"step": 5830
},
{
"epoch": 0.22590346881739148,
"grad_norm": 0.251953125,
"learning_rate": 0.0004455791877725728,
"loss": 3.512582778930664,
"step": 5840
},
{
"epoch": 0.22629028982564042,
"grad_norm": 0.2490234375,
"learning_rate": 0.0004453937677480257,
"loss": 3.4789451599121093,
"step": 5850
},
{
"epoch": 0.2266771108338894,
"grad_norm": 0.2431640625,
"learning_rate": 0.0004452080734043228,
"loss": 3.5080036163330077,
"step": 5860
},
{
"epoch": 0.22706393184213836,
"grad_norm": 0.287109375,
"learning_rate": 0.0004450221050199841,
"loss": 3.5435367584228517,
"step": 5870
},
{
"epoch": 0.2274507528503873,
"grad_norm": 0.255859375,
"learning_rate": 0.00044483586287394,
"loss": 3.5231910705566407,
"step": 5880
},
{
"epoch": 0.22783757385863626,
"grad_norm": 0.24609375,
"learning_rate": 0.0004446493472455319,
"loss": 3.475141906738281,
"step": 5890
},
{
"epoch": 0.22822439486688523,
"grad_norm": 0.263671875,
"learning_rate": 0.0004444625584145114,
"loss": 3.4972454071044923,
"step": 5900
},
{
"epoch": 0.22822439486688523,
"eval_loss": 4.064547061920166,
"eval_runtime": 10.2047,
"eval_samples_per_second": 32.044,
"eval_steps_per_second": 2.058,
"step": 5900
},
{
"epoch": 0.22861121587513417,
"grad_norm": 0.267578125,
"learning_rate": 0.0004442754966610398,
"loss": 3.512071228027344,
"step": 5910
},
{
"epoch": 0.22899803688338313,
"grad_norm": 0.25390625,
"learning_rate": 0.0004440881622656878,
"loss": 3.4975730895996096,
"step": 5920
},
{
"epoch": 0.2293848578916321,
"grad_norm": 0.275390625,
"learning_rate": 0.0004439005555094348,
"loss": 3.477853012084961,
"step": 5930
},
{
"epoch": 0.22977167889988107,
"grad_norm": 0.2578125,
"learning_rate": 0.00044371267667366894,
"loss": 3.4883792877197264,
"step": 5940
},
{
"epoch": 0.23015849990813,
"grad_norm": 0.2451171875,
"learning_rate": 0.0004435245260401865,
"loss": 3.5253154754638674,
"step": 5950
},
{
"epoch": 0.23054532091637897,
"grad_norm": 0.25390625,
"learning_rate": 0.0004433361038911912,
"loss": 3.518881988525391,
"step": 5960
},
{
"epoch": 0.23093214192462794,
"grad_norm": 0.255859375,
"learning_rate": 0.00044314741050929406,
"loss": 3.510706329345703,
"step": 5970
},
{
"epoch": 0.23131896293287688,
"grad_norm": 0.248046875,
"learning_rate": 0.00044295844617751325,
"loss": 3.5086299896240236,
"step": 5980
},
{
"epoch": 0.23170578394112584,
"grad_norm": 0.259765625,
"learning_rate": 0.00044276921117927283,
"loss": 3.5073486328125,
"step": 5990
},
{
"epoch": 0.2320926049493748,
"grad_norm": 0.259765625,
"learning_rate": 0.0004425797057984031,
"loss": 3.537984085083008,
"step": 6000
},
{
"epoch": 0.2320926049493748,
"eval_loss": 4.064856052398682,
"eval_runtime": 10.2355,
"eval_samples_per_second": 31.947,
"eval_steps_per_second": 2.052,
"step": 6000
},
{
"epoch": 0.23247942595762375,
"grad_norm": 0.26953125,
"learning_rate": 0.0004423899303191399,
"loss": 3.527267074584961,
"step": 6010
},
{
"epoch": 0.23286624696587271,
"grad_norm": 0.25390625,
"learning_rate": 0.000442199885026124,
"loss": 3.499089813232422,
"step": 6020
},
{
"epoch": 0.23325306797412168,
"grad_norm": 0.25390625,
"learning_rate": 0.00044200957020440126,
"loss": 3.498735046386719,
"step": 6030
},
{
"epoch": 0.23363988898237062,
"grad_norm": 0.2431640625,
"learning_rate": 0.0004418189861394213,
"loss": 3.5322608947753906,
"step": 6040
},
{
"epoch": 0.23402670999061959,
"grad_norm": 0.271484375,
"learning_rate": 0.0004416281331170379,
"loss": 3.5282882690429687,
"step": 6050
},
{
"epoch": 0.23441353099886855,
"grad_norm": 0.259765625,
"learning_rate": 0.0004414370114235082,
"loss": 3.5092117309570314,
"step": 6060
},
{
"epoch": 0.23480035200711752,
"grad_norm": 0.279296875,
"learning_rate": 0.0004412456213454923,
"loss": 3.5284473419189455,
"step": 6070
},
{
"epoch": 0.23518717301536646,
"grad_norm": 0.25,
"learning_rate": 0.00044105396317005273,
"loss": 3.5273303985595703,
"step": 6080
},
{
"epoch": 0.23557399402361542,
"grad_norm": 0.263671875,
"learning_rate": 0.0004408620371846543,
"loss": 3.5467586517333984,
"step": 6090
},
{
"epoch": 0.2359608150318644,
"grad_norm": 0.25,
"learning_rate": 0.00044066984367716343,
"loss": 3.5320247650146483,
"step": 6100
},
{
"epoch": 0.2359608150318644,
"eval_loss": 4.048551082611084,
"eval_runtime": 10.2354,
"eval_samples_per_second": 31.948,
"eval_steps_per_second": 2.052,
"step": 6100
},
{
"epoch": 0.23634763604011333,
"grad_norm": 0.25,
"learning_rate": 0.0004404773829358478,
"loss": 3.526265335083008,
"step": 6110
},
{
"epoch": 0.2367344570483623,
"grad_norm": 0.2431640625,
"learning_rate": 0.00044028465524937574,
"loss": 3.5211910247802733,
"step": 6120
},
{
"epoch": 0.23712127805661126,
"grad_norm": 0.248046875,
"learning_rate": 0.00044009166090681635,
"loss": 3.4782859802246096,
"step": 6130
},
{
"epoch": 0.2375080990648602,
"grad_norm": 0.24609375,
"learning_rate": 0.0004398984001976383,
"loss": 3.4879383087158202,
"step": 6140
},
{
"epoch": 0.23789492007310917,
"grad_norm": 0.28125,
"learning_rate": 0.00043970487341171016,
"loss": 3.519879913330078,
"step": 6150
},
{
"epoch": 0.23828174108135813,
"grad_norm": 0.259765625,
"learning_rate": 0.0004395110808392991,
"loss": 3.5101585388183594,
"step": 6160
},
{
"epoch": 0.2386685620896071,
"grad_norm": 0.296875,
"learning_rate": 0.00043931702277107127,
"loss": 3.529031753540039,
"step": 6170
},
{
"epoch": 0.23905538309785604,
"grad_norm": 0.2421875,
"learning_rate": 0.00043912269949809114,
"loss": 3.50939826965332,
"step": 6180
},
{
"epoch": 0.239442204106105,
"grad_norm": 0.2578125,
"learning_rate": 0.00043892811131182054,
"loss": 3.4897247314453126,
"step": 6190
},
{
"epoch": 0.23982902511435397,
"grad_norm": 0.2578125,
"learning_rate": 0.000438733258504119,
"loss": 3.5406448364257814,
"step": 6200
},
{
"epoch": 0.23982902511435397,
"eval_loss": 4.047799587249756,
"eval_runtime": 10.117,
"eval_samples_per_second": 32.322,
"eval_steps_per_second": 2.076,
"step": 6200
},
{
"epoch": 0.2402158461226029,
"grad_norm": 0.265625,
"learning_rate": 0.00043853814136724287,
"loss": 3.5504226684570312,
"step": 6210
},
{
"epoch": 0.24060266713085188,
"grad_norm": 0.265625,
"learning_rate": 0.0004383427601938448,
"loss": 3.514726257324219,
"step": 6220
},
{
"epoch": 0.24098948813910084,
"grad_norm": 0.25,
"learning_rate": 0.0004381471152769737,
"loss": 3.538137435913086,
"step": 6230
},
{
"epoch": 0.24137630914734978,
"grad_norm": 0.275390625,
"learning_rate": 0.00043795120691007394,
"loss": 3.47631950378418,
"step": 6240
},
{
"epoch": 0.24176313015559875,
"grad_norm": 0.251953125,
"learning_rate": 0.00043775503538698497,
"loss": 3.522532272338867,
"step": 6250
},
{
"epoch": 0.24214995116384772,
"grad_norm": 0.255859375,
"learning_rate": 0.0004375586010019411,
"loss": 3.5053829193115233,
"step": 6260
},
{
"epoch": 0.24253677217209665,
"grad_norm": 0.259765625,
"learning_rate": 0.0004373619040495707,
"loss": 3.4885364532470704,
"step": 6270
},
{
"epoch": 0.24292359318034562,
"grad_norm": 0.2421875,
"learning_rate": 0.00043716494482489614,
"loss": 3.55185546875,
"step": 6280
},
{
"epoch": 0.2433104141885946,
"grad_norm": 0.27734375,
"learning_rate": 0.0004369677236233332,
"loss": 3.5000751495361326,
"step": 6290
},
{
"epoch": 0.24369723519684355,
"grad_norm": 0.2734375,
"learning_rate": 0.00043677024074069036,
"loss": 3.5143280029296875,
"step": 6300
},
{
"epoch": 0.24369723519684355,
"eval_loss": 4.032617568969727,
"eval_runtime": 10.0951,
"eval_samples_per_second": 32.392,
"eval_steps_per_second": 2.08,
"step": 6300
},
{
"epoch": 0.2440840562050925,
"grad_norm": 0.25390625,
"learning_rate": 0.0004365724964731689,
"loss": 3.5079113006591798,
"step": 6310
},
{
"epoch": 0.24447087721334146,
"grad_norm": 0.26171875,
"learning_rate": 0.0004363744911173619,
"loss": 3.562195587158203,
"step": 6320
},
{
"epoch": 0.24485769822159043,
"grad_norm": 0.2421875,
"learning_rate": 0.0004361762249702541,
"loss": 3.4940654754638674,
"step": 6330
},
{
"epoch": 0.24524451922983936,
"grad_norm": 0.265625,
"learning_rate": 0.0004359776983292213,
"loss": 3.495630645751953,
"step": 6340
},
{
"epoch": 0.24563134023808833,
"grad_norm": 0.25390625,
"learning_rate": 0.00043577891149203035,
"loss": 3.5518524169921877,
"step": 6350
},
{
"epoch": 0.2460181612463373,
"grad_norm": 0.25390625,
"learning_rate": 0.00043557986475683803,
"loss": 3.51075439453125,
"step": 6360
},
{
"epoch": 0.24640498225458624,
"grad_norm": 0.25390625,
"learning_rate": 0.000435380558422191,
"loss": 3.53402099609375,
"step": 6370
},
{
"epoch": 0.2467918032628352,
"grad_norm": 0.283203125,
"learning_rate": 0.00043518099278702546,
"loss": 3.5189449310302736,
"step": 6380
},
{
"epoch": 0.24717862427108417,
"grad_norm": 0.2392578125,
"learning_rate": 0.0004349811681506663,
"loss": 3.520494842529297,
"step": 6390
},
{
"epoch": 0.2475654452793331,
"grad_norm": 0.267578125,
"learning_rate": 0.0004347810848128271,
"loss": 3.544877624511719,
"step": 6400
},
{
"epoch": 0.2475654452793331,
"eval_loss": 4.026139259338379,
"eval_runtime": 10.078,
"eval_samples_per_second": 32.447,
"eval_steps_per_second": 2.084,
"step": 6400
},
{
"epoch": 0.24795226628758207,
"grad_norm": 0.2734375,
"learning_rate": 0.0004345807430736092,
"loss": 3.5174510955810545,
"step": 6410
},
{
"epoch": 0.24833908729583104,
"grad_norm": 0.26953125,
"learning_rate": 0.0004343801432335019,
"loss": 3.4823192596435546,
"step": 6420
},
{
"epoch": 0.24872590830408,
"grad_norm": 0.251953125,
"learning_rate": 0.0004341792855933811,
"loss": 3.5113250732421877,
"step": 6430
},
{
"epoch": 0.24911272931232895,
"grad_norm": 0.263671875,
"learning_rate": 0.00043397817045450984,
"loss": 3.514263153076172,
"step": 6440
},
{
"epoch": 0.2494995503205779,
"grad_norm": 0.2431640625,
"learning_rate": 0.0004337767981185371,
"loss": 3.496726226806641,
"step": 6450
},
{
"epoch": 0.24988637132882688,
"grad_norm": 0.25390625,
"learning_rate": 0.00043357516888749775,
"loss": 3.512440490722656,
"step": 6460
},
{
"epoch": 0.25027319233707584,
"grad_norm": 0.27734375,
"learning_rate": 0.00043337328306381195,
"loss": 3.501117706298828,
"step": 6470
},
{
"epoch": 0.2506600133453248,
"grad_norm": 0.2734375,
"learning_rate": 0.0004331711409502847,
"loss": 3.460781478881836,
"step": 6480
},
{
"epoch": 0.2510468343535737,
"grad_norm": 0.2421875,
"learning_rate": 0.0004329687428501054,
"loss": 3.499040222167969,
"step": 6490
},
{
"epoch": 0.2514336553618227,
"grad_norm": 0.2412109375,
"learning_rate": 0.00043276608906684744,
"loss": 3.504185104370117,
"step": 6500
},
{
"epoch": 0.2514336553618227,
"eval_loss": 4.024904727935791,
"eval_runtime": 9.9985,
"eval_samples_per_second": 32.705,
"eval_steps_per_second": 2.1,
"step": 6500
},
{
"epoch": 0.25182047637007166,
"grad_norm": 0.259765625,
"learning_rate": 0.0004325631799044677,
"loss": 3.5370899200439454,
"step": 6510
},
{
"epoch": 0.2522072973783206,
"grad_norm": 0.26171875,
"learning_rate": 0.00043236001566730585,
"loss": 3.4886333465576174,
"step": 6520
},
{
"epoch": 0.2525941183865696,
"grad_norm": 0.251953125,
"learning_rate": 0.00043215659666008473,
"loss": 3.4799739837646486,
"step": 6530
},
{
"epoch": 0.2529809393948185,
"grad_norm": 0.23828125,
"learning_rate": 0.00043195292318790876,
"loss": 3.540454864501953,
"step": 6540
},
{
"epoch": 0.25336776040306747,
"grad_norm": 0.26171875,
"learning_rate": 0.00043174899555626414,
"loss": 3.525778961181641,
"step": 6550
},
{
"epoch": 0.25375458141131646,
"grad_norm": 0.2451171875,
"learning_rate": 0.00043154481407101845,
"loss": 3.524898147583008,
"step": 6560
},
{
"epoch": 0.2541414024195654,
"grad_norm": 0.2578125,
"learning_rate": 0.0004313403790384199,
"loss": 3.485614776611328,
"step": 6570
},
{
"epoch": 0.25452822342781434,
"grad_norm": 0.2373046875,
"learning_rate": 0.000431135690765097,
"loss": 3.520885467529297,
"step": 6580
},
{
"epoch": 0.25491504443606333,
"grad_norm": 0.251953125,
"learning_rate": 0.00043093074955805803,
"loss": 3.5210807800292967,
"step": 6590
},
{
"epoch": 0.25530186544431227,
"grad_norm": 0.2578125,
"learning_rate": 0.0004307255557246909,
"loss": 3.5233665466308595,
"step": 6600
},
{
"epoch": 0.25530186544431227,
"eval_loss": 3.993399143218994,
"eval_runtime": 9.9822,
"eval_samples_per_second": 32.758,
"eval_steps_per_second": 2.104,
"step": 6600
},
{
"epoch": 0.25568868645256126,
"grad_norm": 0.2412109375,
"learning_rate": 0.00043052010957276204,
"loss": 3.497217559814453,
"step": 6610
},
{
"epoch": 0.2560755074608102,
"grad_norm": 0.255859375,
"learning_rate": 0.0004303144114104167,
"loss": 3.4751991271972655,
"step": 6620
},
{
"epoch": 0.25646232846905914,
"grad_norm": 0.267578125,
"learning_rate": 0.00043010846154617775,
"loss": 3.567796325683594,
"step": 6630
},
{
"epoch": 0.25684914947730814,
"grad_norm": 0.26171875,
"learning_rate": 0.000429902260288946,
"loss": 3.522159957885742,
"step": 6640
},
{
"epoch": 0.2572359704855571,
"grad_norm": 0.25390625,
"learning_rate": 0.000429695807947999,
"loss": 3.5400524139404297,
"step": 6650
},
{
"epoch": 0.257622791493806,
"grad_norm": 0.251953125,
"learning_rate": 0.00042948910483299105,
"loss": 3.4918754577636717,
"step": 6660
},
{
"epoch": 0.258009612502055,
"grad_norm": 0.271484375,
"learning_rate": 0.00042928215125395236,
"loss": 3.524504470825195,
"step": 6670
},
{
"epoch": 0.25839643351030395,
"grad_norm": 0.2734375,
"learning_rate": 0.0004290749475212892,
"loss": 3.5244983673095702,
"step": 6680
},
{
"epoch": 0.2587832545185529,
"grad_norm": 0.265625,
"learning_rate": 0.00042886749394578254,
"loss": 3.4681201934814454,
"step": 6690
},
{
"epoch": 0.2591700755268019,
"grad_norm": 0.2490234375,
"learning_rate": 0.0004286597908385887,
"loss": 3.499583435058594,
"step": 6700
},
{
"epoch": 0.2591700755268019,
"eval_loss": 4.000979900360107,
"eval_runtime": 9.9625,
"eval_samples_per_second": 32.823,
"eval_steps_per_second": 2.108,
"step": 6700
},
{
"epoch": 0.2595568965350508,
"grad_norm": 0.267578125,
"learning_rate": 0.0004284518385112377,
"loss": 3.544001007080078,
"step": 6710
},
{
"epoch": 0.25994371754329976,
"grad_norm": 0.275390625,
"learning_rate": 0.0004282436372756337,
"loss": 3.491320037841797,
"step": 6720
},
{
"epoch": 0.26033053855154875,
"grad_norm": 0.2421875,
"learning_rate": 0.0004280351874440539,
"loss": 3.492382049560547,
"step": 6730
},
{
"epoch": 0.2607173595597977,
"grad_norm": 0.25,
"learning_rate": 0.0004278264893291487,
"loss": 3.547830581665039,
"step": 6740
},
{
"epoch": 0.26110418056804663,
"grad_norm": 0.25390625,
"learning_rate": 0.0004276175432439408,
"loss": 3.5104396820068358,
"step": 6750
},
{
"epoch": 0.2614910015762956,
"grad_norm": 0.25,
"learning_rate": 0.00042740834950182467,
"loss": 3.5236995697021483,
"step": 6760
},
{
"epoch": 0.26187782258454456,
"grad_norm": 0.248046875,
"learning_rate": 0.00042719890841656636,
"loss": 3.5166088104248048,
"step": 6770
},
{
"epoch": 0.2622646435927935,
"grad_norm": 0.2470703125,
"learning_rate": 0.00042698922030230284,
"loss": 3.4963302612304688,
"step": 6780
},
{
"epoch": 0.2626514646010425,
"grad_norm": 0.2392578125,
"learning_rate": 0.00042677928547354174,
"loss": 3.5068523406982424,
"step": 6790
},
{
"epoch": 0.26303828560929143,
"grad_norm": 0.255859375,
"learning_rate": 0.00042656910424516053,
"loss": 3.524884796142578,
"step": 6800
},
{
"epoch": 0.26303828560929143,
"eval_loss": 3.9918432235717773,
"eval_runtime": 9.9656,
"eval_samples_per_second": 32.813,
"eval_steps_per_second": 2.107,
"step": 6800
},
{
"epoch": 0.26342510661754037,
"grad_norm": 0.259765625,
"learning_rate": 0.00042635867693240634,
"loss": 3.4992977142333985,
"step": 6810
},
{
"epoch": 0.26381192762578937,
"grad_norm": 0.248046875,
"learning_rate": 0.00042614800385089546,
"loss": 3.48309440612793,
"step": 6820
},
{
"epoch": 0.2641987486340383,
"grad_norm": 0.26953125,
"learning_rate": 0.00042593708531661275,
"loss": 3.520304870605469,
"step": 6830
},
{
"epoch": 0.2645855696422873,
"grad_norm": 0.259765625,
"learning_rate": 0.0004257259216459113,
"loss": 3.541963577270508,
"step": 6840
},
{
"epoch": 0.26497239065053624,
"grad_norm": 0.27734375,
"learning_rate": 0.0004255145131555116,
"loss": 3.474831771850586,
"step": 6850
},
{
"epoch": 0.2653592116587852,
"grad_norm": 0.259765625,
"learning_rate": 0.00042530286016250173,
"loss": 3.475337600708008,
"step": 6860
},
{
"epoch": 0.26574603266703417,
"grad_norm": 0.271484375,
"learning_rate": 0.0004250909629843362,
"loss": 3.512445831298828,
"step": 6870
},
{
"epoch": 0.2661328536752831,
"grad_norm": 0.2431640625,
"learning_rate": 0.00042487882193883585,
"loss": 3.528004837036133,
"step": 6880
},
{
"epoch": 0.26651967468353205,
"grad_norm": 0.25,
"learning_rate": 0.00042466643734418737,
"loss": 3.446039581298828,
"step": 6890
},
{
"epoch": 0.26690649569178104,
"grad_norm": 0.28125,
"learning_rate": 0.0004244538095189427,
"loss": 3.4687259674072264,
"step": 6900
},
{
"epoch": 0.26690649569178104,
"eval_loss": 3.9921114444732666,
"eval_runtime": 10.0839,
"eval_samples_per_second": 32.428,
"eval_steps_per_second": 2.083,
"step": 6900
},
{
"epoch": 0.26729331670003,
"grad_norm": 0.2490234375,
"learning_rate": 0.0004242409387820186,
"loss": 3.5139041900634767,
"step": 6910
},
{
"epoch": 0.2676801377082789,
"grad_norm": 0.240234375,
"learning_rate": 0.00042402782545269605,
"loss": 3.4841732025146483,
"step": 6920
},
{
"epoch": 0.2680669587165279,
"grad_norm": 0.2421875,
"learning_rate": 0.0004238144698506201,
"loss": 3.5189540863037108,
"step": 6930
},
{
"epoch": 0.26845377972477685,
"grad_norm": 0.265625,
"learning_rate": 0.00042360087229579907,
"loss": 3.499907684326172,
"step": 6940
},
{
"epoch": 0.2688406007330258,
"grad_norm": 0.283203125,
"learning_rate": 0.00042338703310860413,
"loss": 3.4943309783935548,
"step": 6950
},
{
"epoch": 0.2692274217412748,
"grad_norm": 0.259765625,
"learning_rate": 0.000423172952609769,
"loss": 3.4940841674804686,
"step": 6960
},
{
"epoch": 0.2696142427495237,
"grad_norm": 0.240234375,
"learning_rate": 0.0004229586311203892,
"loss": 3.459016799926758,
"step": 6970
},
{
"epoch": 0.27000106375777266,
"grad_norm": 0.259765625,
"learning_rate": 0.0004227440689619218,
"loss": 3.5130611419677735,
"step": 6980
},
{
"epoch": 0.27038788476602166,
"grad_norm": 0.265625,
"learning_rate": 0.00042252926645618485,
"loss": 3.500564956665039,
"step": 6990
},
{
"epoch": 0.2707747057742706,
"grad_norm": 0.2470703125,
"learning_rate": 0.0004223142239253568,
"loss": 3.495101547241211,
"step": 7000
},
{
"epoch": 0.2707747057742706,
"eval_loss": 3.983806848526001,
"eval_runtime": 10.0108,
"eval_samples_per_second": 32.665,
"eval_steps_per_second": 2.098,
"step": 7000
},
{
"epoch": 0.27116152678251954,
"grad_norm": 0.2890625,
"learning_rate": 0.0004220989416919762,
"loss": 3.4596118927001953,
"step": 7010
},
{
"epoch": 0.27154834779076853,
"grad_norm": 0.291015625,
"learning_rate": 0.00042188342007894115,
"loss": 3.479116439819336,
"step": 7020
},
{
"epoch": 0.27193516879901747,
"grad_norm": 0.267578125,
"learning_rate": 0.00042166765940950874,
"loss": 3.5550628662109376,
"step": 7030
},
{
"epoch": 0.2723219898072664,
"grad_norm": 0.26171875,
"learning_rate": 0.0004214516600072944,
"loss": 3.4750045776367187,
"step": 7040
},
{
"epoch": 0.2727088108155154,
"grad_norm": 0.265625,
"learning_rate": 0.00042123542219627214,
"loss": 3.492919921875,
"step": 7050
},
{
"epoch": 0.27309563182376434,
"grad_norm": 0.244140625,
"learning_rate": 0.00042101894630077315,
"loss": 3.5046051025390623,
"step": 7060
},
{
"epoch": 0.27348245283201333,
"grad_norm": 0.244140625,
"learning_rate": 0.0004208022326454858,
"loss": 3.478554916381836,
"step": 7070
},
{
"epoch": 0.2738692738402623,
"grad_norm": 0.255859375,
"learning_rate": 0.00042058528155545507,
"loss": 3.5061058044433593,
"step": 7080
},
{
"epoch": 0.2742560948485112,
"grad_norm": 0.2734375,
"learning_rate": 0.00042036809335608215,
"loss": 3.463357162475586,
"step": 7090
},
{
"epoch": 0.2746429158567602,
"grad_norm": 0.275390625,
"learning_rate": 0.0004201506683731238,
"loss": 3.52327880859375,
"step": 7100
},
{
"epoch": 0.2746429158567602,
"eval_loss": 4.0028395652771,
"eval_runtime": 10.0008,
"eval_samples_per_second": 32.697,
"eval_steps_per_second": 2.1,
"step": 7100
},
{
"epoch": 0.27502973686500914,
"grad_norm": 0.259765625,
"learning_rate": 0.00041993300693269204,
"loss": 3.5009181976318358,
"step": 7110
},
{
"epoch": 0.2754165578732581,
"grad_norm": 0.2421875,
"learning_rate": 0.00041971510936125326,
"loss": 3.4968143463134767,
"step": 7120
},
{
"epoch": 0.2758033788815071,
"grad_norm": 0.251953125,
"learning_rate": 0.00041949697598562836,
"loss": 3.509387969970703,
"step": 7130
},
{
"epoch": 0.276190199889756,
"grad_norm": 0.259765625,
"learning_rate": 0.00041927860713299165,
"loss": 3.505107116699219,
"step": 7140
},
{
"epoch": 0.27657702089800495,
"grad_norm": 0.2890625,
"learning_rate": 0.0004190600031308709,
"loss": 3.4760673522949217,
"step": 7150
},
{
"epoch": 0.27696384190625395,
"grad_norm": 0.25390625,
"learning_rate": 0.0004188411643071462,
"loss": 3.471649932861328,
"step": 7160
},
{
"epoch": 0.2773506629145029,
"grad_norm": 0.2490234375,
"learning_rate": 0.0004186220909900503,
"loss": 3.5090023040771485,
"step": 7170
},
{
"epoch": 0.2777374839227518,
"grad_norm": 0.25390625,
"learning_rate": 0.00041840278350816726,
"loss": 3.485765075683594,
"step": 7180
},
{
"epoch": 0.2781243049310008,
"grad_norm": 0.26171875,
"learning_rate": 0.00041818324219043256,
"loss": 3.48890380859375,
"step": 7190
},
{
"epoch": 0.27851112593924976,
"grad_norm": 0.255859375,
"learning_rate": 0.0004179634673661324,
"loss": 3.4805828094482423,
"step": 7200
},
{
"epoch": 0.27851112593924976,
"eval_loss": 3.9834365844726562,
"eval_runtime": 10.0054,
"eval_samples_per_second": 32.682,
"eval_steps_per_second": 2.099,
"step": 7200
},
{
"epoch": 0.2788979469474987,
"grad_norm": 0.259765625,
"learning_rate": 0.0004177434593649032,
"loss": 3.4678180694580076,
"step": 7210
},
{
"epoch": 0.2792847679557477,
"grad_norm": 0.259765625,
"learning_rate": 0.00041752321851673107,
"loss": 3.498748779296875,
"step": 7220
},
{
"epoch": 0.27967158896399663,
"grad_norm": 0.2578125,
"learning_rate": 0.0004173027451519514,
"loss": 3.492596435546875,
"step": 7230
},
{
"epoch": 0.28005840997224557,
"grad_norm": 0.279296875,
"learning_rate": 0.00041708203960124843,
"loss": 3.5052108764648438,
"step": 7240
},
{
"epoch": 0.28044523098049456,
"grad_norm": 0.2734375,
"learning_rate": 0.00041686110219565437,
"loss": 3.4743038177490235,
"step": 7250
},
{
"epoch": 0.2808320519887435,
"grad_norm": 0.271484375,
"learning_rate": 0.00041663993326654944,
"loss": 3.508194351196289,
"step": 7260
},
{
"epoch": 0.28121887299699244,
"grad_norm": 0.263671875,
"learning_rate": 0.000416418533145661,
"loss": 3.5267372131347656,
"step": 7270
},
{
"epoch": 0.28160569400524144,
"grad_norm": 0.259765625,
"learning_rate": 0.00041619690216506333,
"loss": 3.5127063751220704,
"step": 7280
},
{
"epoch": 0.2819925150134904,
"grad_norm": 0.265625,
"learning_rate": 0.0004159750406571768,
"loss": 3.4871360778808596,
"step": 7290
},
{
"epoch": 0.2823793360217393,
"grad_norm": 0.2451171875,
"learning_rate": 0.0004157529489547675,
"loss": 3.4671897888183594,
"step": 7300
},
{
"epoch": 0.2823793360217393,
"eval_loss": 3.978560447692871,
"eval_runtime": 10.004,
"eval_samples_per_second": 32.687,
"eval_steps_per_second": 2.099,
"step": 7300
},
{
"epoch": 0.2827661570299883,
"grad_norm": 0.265625,
"learning_rate": 0.000415530627390947,
"loss": 3.4803470611572265,
"step": 7310
},
{
"epoch": 0.28315297803823725,
"grad_norm": 0.251953125,
"learning_rate": 0.0004153080762991714,
"loss": 3.490553283691406,
"step": 7320
},
{
"epoch": 0.28353979904648624,
"grad_norm": 0.259765625,
"learning_rate": 0.0004150852960132413,
"loss": 3.523568344116211,
"step": 7330
},
{
"epoch": 0.2839266200547352,
"grad_norm": 0.25390625,
"learning_rate": 0.0004148622868673009,
"loss": 3.4703395843505858,
"step": 7340
},
{
"epoch": 0.2843134410629841,
"grad_norm": 0.27734375,
"learning_rate": 0.0004146390491958377,
"loss": 3.493512725830078,
"step": 7350
},
{
"epoch": 0.2847002620712331,
"grad_norm": 0.263671875,
"learning_rate": 0.0004144155833336819,
"loss": 3.459734344482422,
"step": 7360
},
{
"epoch": 0.28508708307948205,
"grad_norm": 0.259765625,
"learning_rate": 0.00041419188961600614,
"loss": 3.442743682861328,
"step": 7370
},
{
"epoch": 0.285473904087731,
"grad_norm": 0.248046875,
"learning_rate": 0.00041396796837832474,
"loss": 3.4958415985107423,
"step": 7380
},
{
"epoch": 0.28586072509598,
"grad_norm": 0.259765625,
"learning_rate": 0.00041374381995649306,
"loss": 3.4780853271484373,
"step": 7390
},
{
"epoch": 0.2862475461042289,
"grad_norm": 0.2333984375,
"learning_rate": 0.00041351944468670754,
"loss": 3.48729248046875,
"step": 7400
},
{
"epoch": 0.2862475461042289,
"eval_loss": 3.9693050384521484,
"eval_runtime": 9.9899,
"eval_samples_per_second": 32.733,
"eval_steps_per_second": 2.102,
"step": 7400
},
{
"epoch": 0.28663436711247786,
"grad_norm": 0.287109375,
"learning_rate": 0.00041329484290550454,
"loss": 3.464725112915039,
"step": 7410
},
{
"epoch": 0.28702118812072686,
"grad_norm": 0.279296875,
"learning_rate": 0.00041307001494976064,
"loss": 3.5638668060302736,
"step": 7420
},
{
"epoch": 0.2874080091289758,
"grad_norm": 0.251953125,
"learning_rate": 0.00041284496115669107,
"loss": 3.4758174896240233,
"step": 7430
},
{
"epoch": 0.28779483013722473,
"grad_norm": 0.259765625,
"learning_rate": 0.0004126196818638502,
"loss": 3.4785606384277346,
"step": 7440
},
{
"epoch": 0.2881816511454737,
"grad_norm": 0.2490234375,
"learning_rate": 0.0004123941774091304,
"loss": 3.492573928833008,
"step": 7450
},
{
"epoch": 0.28856847215372267,
"grad_norm": 0.25390625,
"learning_rate": 0.00041216844813076197,
"loss": 3.510224533081055,
"step": 7460
},
{
"epoch": 0.2889552931619716,
"grad_norm": 0.25,
"learning_rate": 0.0004119424943673122,
"loss": 3.469999313354492,
"step": 7470
},
{
"epoch": 0.2893421141702206,
"grad_norm": 0.26953125,
"learning_rate": 0.00041171631645768527,
"loss": 3.4652854919433596,
"step": 7480
},
{
"epoch": 0.28972893517846954,
"grad_norm": 0.26953125,
"learning_rate": 0.00041148991474112135,
"loss": 3.445465850830078,
"step": 7490
},
{
"epoch": 0.2901157561867185,
"grad_norm": 0.267578125,
"learning_rate": 0.00041126328955719645,
"loss": 3.483041000366211,
"step": 7500
},
{
"epoch": 0.2901157561867185,
"eval_loss": 3.9702155590057373,
"eval_runtime": 10.0085,
"eval_samples_per_second": 32.672,
"eval_steps_per_second": 2.098,
"step": 7500
},
{
"epoch": 0.29050257719496747,
"grad_norm": 0.251953125,
"learning_rate": 0.0004110364412458217,
"loss": 3.4610855102539064,
"step": 7510
},
{
"epoch": 0.2908893982032164,
"grad_norm": 0.2451171875,
"learning_rate": 0.000410809370147243,
"loss": 3.4661144256591796,
"step": 7520
},
{
"epoch": 0.29127621921146535,
"grad_norm": 0.275390625,
"learning_rate": 0.0004105820766020402,
"loss": 3.4697357177734376,
"step": 7530
},
{
"epoch": 0.29166304021971434,
"grad_norm": 0.25390625,
"learning_rate": 0.00041035456095112684,
"loss": 3.451828384399414,
"step": 7540
},
{
"epoch": 0.2920498612279633,
"grad_norm": 0.251953125,
"learning_rate": 0.00041012682353574976,
"loss": 3.4903900146484377,
"step": 7550
},
{
"epoch": 0.2924366822362123,
"grad_norm": 0.2431640625,
"learning_rate": 0.00040989886469748843,
"loss": 3.44178466796875,
"step": 7560
},
{
"epoch": 0.2928235032444612,
"grad_norm": 0.251953125,
"learning_rate": 0.0004096706847782541,
"loss": 3.491189956665039,
"step": 7570
},
{
"epoch": 0.29321032425271015,
"grad_norm": 0.275390625,
"learning_rate": 0.00040944228412029,
"loss": 3.4560359954833983,
"step": 7580
},
{
"epoch": 0.29359714526095915,
"grad_norm": 0.267578125,
"learning_rate": 0.0004092136630661701,
"loss": 3.491283416748047,
"step": 7590
},
{
"epoch": 0.2939839662692081,
"grad_norm": 0.251953125,
"learning_rate": 0.00040898482195879935,
"loss": 3.469133758544922,
"step": 7600
},
{
"epoch": 0.2939839662692081,
"eval_loss": 3.961404800415039,
"eval_runtime": 10.1106,
"eval_samples_per_second": 32.342,
"eval_steps_per_second": 2.077,
"step": 7600
},
{
"epoch": 0.294370787277457,
"grad_norm": 0.25390625,
"learning_rate": 0.0004087557611414122,
"loss": 3.47923583984375,
"step": 7610
},
{
"epoch": 0.294757608285706,
"grad_norm": 0.2431640625,
"learning_rate": 0.00040852648095757323,
"loss": 3.5196529388427735,
"step": 7620
},
{
"epoch": 0.29514442929395496,
"grad_norm": 0.25,
"learning_rate": 0.0004082969817511755,
"loss": 3.4972084045410154,
"step": 7630
},
{
"epoch": 0.2955312503022039,
"grad_norm": 0.271484375,
"learning_rate": 0.0004080672638664412,
"loss": 3.453374481201172,
"step": 7640
},
{
"epoch": 0.2959180713104529,
"grad_norm": 0.265625,
"learning_rate": 0.0004078373276479199,
"loss": 3.4950233459472657,
"step": 7650
},
{
"epoch": 0.29630489231870183,
"grad_norm": 0.240234375,
"learning_rate": 0.00040760717344048896,
"loss": 3.462534713745117,
"step": 7660
},
{
"epoch": 0.29669171332695077,
"grad_norm": 0.25390625,
"learning_rate": 0.00040737680158935277,
"loss": 3.496277618408203,
"step": 7670
},
{
"epoch": 0.29707853433519976,
"grad_norm": 0.248046875,
"learning_rate": 0.0004071462124400417,
"loss": 3.4707130432128905,
"step": 7680
},
{
"epoch": 0.2974653553434487,
"grad_norm": 0.2451171875,
"learning_rate": 0.00040691540633841267,
"loss": 3.4735038757324217,
"step": 7690
},
{
"epoch": 0.29785217635169764,
"grad_norm": 0.279296875,
"learning_rate": 0.0004066843836306477,
"loss": 3.4587879180908203,
"step": 7700
},
{
"epoch": 0.29785217635169764,
"eval_loss": 3.9454445838928223,
"eval_runtime": 10.0538,
"eval_samples_per_second": 32.525,
"eval_steps_per_second": 2.089,
"step": 7700
},
{
"epoch": 0.29823899735994663,
"grad_norm": 0.255859375,
"learning_rate": 0.0004064531446632535,
"loss": 3.4567310333251955,
"step": 7710
},
{
"epoch": 0.2986258183681956,
"grad_norm": 0.2431640625,
"learning_rate": 0.0004062216897830615,
"loss": 3.5064525604248047,
"step": 7720
},
{
"epoch": 0.2990126393764445,
"grad_norm": 0.28125,
"learning_rate": 0.00040599001933722687,
"loss": 3.4508167266845704,
"step": 7730
},
{
"epoch": 0.2993994603846935,
"grad_norm": 0.28515625,
"learning_rate": 0.00040575813367322786,
"loss": 3.5213436126708983,
"step": 7740
},
{
"epoch": 0.29978628139294244,
"grad_norm": 0.275390625,
"learning_rate": 0.00040552603313886575,
"loss": 3.44835205078125,
"step": 7750
},
{
"epoch": 0.3001731024011914,
"grad_norm": 0.25390625,
"learning_rate": 0.0004052937180822642,
"loss": 3.47521858215332,
"step": 7760
},
{
"epoch": 0.3005599234094404,
"grad_norm": 0.259765625,
"learning_rate": 0.00040506118885186846,
"loss": 3.5136672973632814,
"step": 7770
},
{
"epoch": 0.3009467444176893,
"grad_norm": 0.259765625,
"learning_rate": 0.0004048284457964449,
"loss": 3.455365753173828,
"step": 7780
},
{
"epoch": 0.3013335654259383,
"grad_norm": 0.263671875,
"learning_rate": 0.00040459548926508087,
"loss": 3.4851306915283202,
"step": 7790
},
{
"epoch": 0.30172038643418725,
"grad_norm": 0.28515625,
"learning_rate": 0.0004043623196071838,
"loss": 3.4420330047607424,
"step": 7800
},
{
"epoch": 0.30172038643418725,
"eval_loss": 3.977670907974243,
"eval_runtime": 10.0649,
"eval_samples_per_second": 32.489,
"eval_steps_per_second": 2.086,
"step": 7800
},
{
"epoch": 0.3021072074424362,
"grad_norm": 0.251953125,
"learning_rate": 0.0004041289371724808,
"loss": 3.486972427368164,
"step": 7810
},
{
"epoch": 0.3024940284506852,
"grad_norm": 0.2470703125,
"learning_rate": 0.0004038953423110179,
"loss": 3.4616844177246096,
"step": 7820
},
{
"epoch": 0.3028808494589341,
"grad_norm": 0.2421875,
"learning_rate": 0.00040366153537316007,
"loss": 3.5070659637451174,
"step": 7830
},
{
"epoch": 0.30326767046718306,
"grad_norm": 0.251953125,
"learning_rate": 0.0004034275167095902,
"loss": 3.4858856201171875,
"step": 7840
},
{
"epoch": 0.30365449147543205,
"grad_norm": 0.228515625,
"learning_rate": 0.00040319328667130897,
"loss": 3.471744155883789,
"step": 7850
},
{
"epoch": 0.304041312483681,
"grad_norm": 0.2578125,
"learning_rate": 0.00040295884560963356,
"loss": 3.455038833618164,
"step": 7860
},
{
"epoch": 0.30442813349192993,
"grad_norm": 0.26953125,
"learning_rate": 0.0004027241938761983,
"loss": 3.491812896728516,
"step": 7870
},
{
"epoch": 0.3048149545001789,
"grad_norm": 0.279296875,
"learning_rate": 0.0004024893318229531,
"loss": 3.4919559478759767,
"step": 7880
},
{
"epoch": 0.30520177550842786,
"grad_norm": 0.26953125,
"learning_rate": 0.0004022542598021635,
"loss": 3.4516735076904297,
"step": 7890
},
{
"epoch": 0.3055885965166768,
"grad_norm": 0.26953125,
"learning_rate": 0.00040201897816640977,
"loss": 3.4588272094726564,
"step": 7900
},
{
"epoch": 0.3055885965166768,
"eval_loss": 3.9536006450653076,
"eval_runtime": 10.3723,
"eval_samples_per_second": 31.526,
"eval_steps_per_second": 2.025,
"step": 7900
},
{
"epoch": 0.3059754175249258,
"grad_norm": 0.263671875,
"learning_rate": 0.00040178348726858677,
"loss": 3.482456588745117,
"step": 7910
},
{
"epoch": 0.30636223853317474,
"grad_norm": 0.251953125,
"learning_rate": 0.00040154778746190323,
"loss": 3.4793769836425783,
"step": 7920
},
{
"epoch": 0.3067490595414237,
"grad_norm": 0.2412109375,
"learning_rate": 0.00040131187909988117,
"loss": 3.4581600189208985,
"step": 7930
},
{
"epoch": 0.30713588054967267,
"grad_norm": 0.251953125,
"learning_rate": 0.0004010757625363552,
"loss": 3.4720085144042967,
"step": 7940
},
{
"epoch": 0.3075227015579216,
"grad_norm": 0.251953125,
"learning_rate": 0.0004008394381254727,
"loss": 3.4618335723876954,
"step": 7950
},
{
"epoch": 0.30790952256617055,
"grad_norm": 0.248046875,
"learning_rate": 0.00040060290622169226,
"loss": 3.474958038330078,
"step": 7960
},
{
"epoch": 0.30829634357441954,
"grad_norm": 0.23828125,
"learning_rate": 0.00040036616717978416,
"loss": 3.4388957977294923,
"step": 7970
},
{
"epoch": 0.3086831645826685,
"grad_norm": 0.26171875,
"learning_rate": 0.000400129221354829,
"loss": 3.456399917602539,
"step": 7980
},
{
"epoch": 0.3090699855909174,
"grad_norm": 0.26953125,
"learning_rate": 0.0003998920691022176,
"loss": 3.4763534545898436,
"step": 7990
},
{
"epoch": 0.3094568065991664,
"grad_norm": 0.25,
"learning_rate": 0.00039965471077765065,
"loss": 3.444426345825195,
"step": 8000
},
{
"epoch": 0.3094568065991664,
"eval_loss": 3.954042673110962,
"eval_runtime": 10.8919,
"eval_samples_per_second": 30.022,
"eval_steps_per_second": 1.928,
"step": 8000
},
{
"epoch": 0.30984362760741535,
"grad_norm": 0.2578125,
"learning_rate": 0.00039941714673713763,
"loss": 3.4891815185546875,
"step": 8010
},
{
"epoch": 0.3102304486156643,
"grad_norm": 0.2392578125,
"learning_rate": 0.0003991793773369967,
"loss": 3.4721736907958984,
"step": 8020
},
{
"epoch": 0.3106172696239133,
"grad_norm": 0.25390625,
"learning_rate": 0.000398941402933854,
"loss": 3.4296173095703124,
"step": 8030
},
{
"epoch": 0.3110040906321622,
"grad_norm": 0.263671875,
"learning_rate": 0.0003987032238846432,
"loss": 3.4733917236328127,
"step": 8040
},
{
"epoch": 0.3113909116404112,
"grad_norm": 0.263671875,
"learning_rate": 0.00039846484054660493,
"loss": 3.4510936737060547,
"step": 8050
},
{
"epoch": 0.31177773264866016,
"grad_norm": 0.2392578125,
"learning_rate": 0.0003982262532772861,
"loss": 3.4586532592773436,
"step": 8060
},
{
"epoch": 0.3121645536569091,
"grad_norm": 0.251953125,
"learning_rate": 0.0003979874624345395,
"loss": 3.48809700012207,
"step": 8070
},
{
"epoch": 0.3125513746651581,
"grad_norm": 0.255859375,
"learning_rate": 0.0003977484683765234,
"loss": 3.4487079620361327,
"step": 8080
},
{
"epoch": 0.312938195673407,
"grad_norm": 0.25390625,
"learning_rate": 0.0003975092714617009,
"loss": 3.4913402557373048,
"step": 8090
},
{
"epoch": 0.31332501668165597,
"grad_norm": 0.2734375,
"learning_rate": 0.00039726987204883907,
"loss": 3.465750503540039,
"step": 8100
},
{
"epoch": 0.31332501668165597,
"eval_loss": 3.945279598236084,
"eval_runtime": 10.1775,
"eval_samples_per_second": 32.13,
"eval_steps_per_second": 2.063,
"step": 8100
},
{
"epoch": 0.31371183768990496,
"grad_norm": 0.267578125,
"learning_rate": 0.000397030270497009,
"loss": 3.459657669067383,
"step": 8110
},
{
"epoch": 0.3140986586981539,
"grad_norm": 0.255859375,
"learning_rate": 0.0003967904671655849,
"loss": 3.453855514526367,
"step": 8120
},
{
"epoch": 0.31448547970640284,
"grad_norm": 0.2421875,
"learning_rate": 0.0003965504624142435,
"loss": 3.485597610473633,
"step": 8130
},
{
"epoch": 0.31487230071465183,
"grad_norm": 0.263671875,
"learning_rate": 0.00039631025660296384,
"loss": 3.4898101806640627,
"step": 8140
},
{
"epoch": 0.31525912172290077,
"grad_norm": 0.2578125,
"learning_rate": 0.00039606985009202616,
"loss": 3.437654495239258,
"step": 8150
},
{
"epoch": 0.3156459427311497,
"grad_norm": 0.263671875,
"learning_rate": 0.0003958292432420122,
"loss": 3.4521121978759766,
"step": 8160
},
{
"epoch": 0.3160327637393987,
"grad_norm": 0.259765625,
"learning_rate": 0.00039558843641380385,
"loss": 3.446636199951172,
"step": 8170
},
{
"epoch": 0.31641958474764764,
"grad_norm": 0.251953125,
"learning_rate": 0.00039534742996858314,
"loss": 3.5297615051269533,
"step": 8180
},
{
"epoch": 0.3168064057558966,
"grad_norm": 0.25390625,
"learning_rate": 0.0003951062242678313,
"loss": 3.4837715148925783,
"step": 8190
},
{
"epoch": 0.3171932267641456,
"grad_norm": 0.2373046875,
"learning_rate": 0.0003948648196733286,
"loss": 3.4503883361816405,
"step": 8200
},
{
"epoch": 0.3171932267641456,
"eval_loss": 3.947329044342041,
"eval_runtime": 10.1317,
"eval_samples_per_second": 32.275,
"eval_steps_per_second": 2.073,
"step": 8200
},
{
"epoch": 0.3175800477723945,
"grad_norm": 0.26171875,
"learning_rate": 0.00039462321654715356,
"loss": 3.4455516815185545,
"step": 8210
},
{
"epoch": 0.31796686878064345,
"grad_norm": 0.2470703125,
"learning_rate": 0.00039438141525168245,
"loss": 3.4772762298583983,
"step": 8220
},
{
"epoch": 0.31835368978889245,
"grad_norm": 0.27734375,
"learning_rate": 0.00039413941614958875,
"loss": 3.480706787109375,
"step": 8230
},
{
"epoch": 0.3187405107971414,
"grad_norm": 0.275390625,
"learning_rate": 0.0003938972196038428,
"loss": 3.443967819213867,
"step": 8240
},
{
"epoch": 0.3191273318053903,
"grad_norm": 0.251953125,
"learning_rate": 0.0003936548259777107,
"loss": 3.4702228546142577,
"step": 8250
},
{
"epoch": 0.3195141528136393,
"grad_norm": 0.23828125,
"learning_rate": 0.0003934122356347548,
"loss": 3.467062759399414,
"step": 8260
},
{
"epoch": 0.31990097382188826,
"grad_norm": 0.263671875,
"learning_rate": 0.0003931694489388317,
"loss": 3.4245067596435548,
"step": 8270
},
{
"epoch": 0.32028779483013725,
"grad_norm": 0.234375,
"learning_rate": 0.00039292646625409315,
"loss": 3.4993412017822267,
"step": 8280
},
{
"epoch": 0.3206746158383862,
"grad_norm": 0.265625,
"learning_rate": 0.00039268328794498454,
"loss": 3.4476173400878904,
"step": 8290
},
{
"epoch": 0.32106143684663513,
"grad_norm": 0.259765625,
"learning_rate": 0.0003924399143762448,
"loss": 3.467058563232422,
"step": 8300
},
{
"epoch": 0.32106143684663513,
"eval_loss": 3.9062752723693848,
"eval_runtime": 10.0398,
"eval_samples_per_second": 32.57,
"eval_steps_per_second": 2.092,
"step": 8300
},
{
"epoch": 0.3214482578548841,
"grad_norm": 0.2470703125,
"learning_rate": 0.0003921963459129056,
"loss": 3.4350086212158204,
"step": 8310
},
{
"epoch": 0.32183507886313306,
"grad_norm": 0.265625,
"learning_rate": 0.0003919525829202911,
"loss": 3.4416141510009766,
"step": 8320
},
{
"epoch": 0.322221899871382,
"grad_norm": 0.255859375,
"learning_rate": 0.000391708625764017,
"loss": 3.4725067138671877,
"step": 8330
},
{
"epoch": 0.322608720879631,
"grad_norm": 0.259765625,
"learning_rate": 0.0003914644748099905,
"loss": 3.448748779296875,
"step": 8340
},
{
"epoch": 0.32299554188787993,
"grad_norm": 0.2470703125,
"learning_rate": 0.00039122013042440935,
"loss": 3.446158218383789,
"step": 8350
},
{
"epoch": 0.32338236289612887,
"grad_norm": 0.240234375,
"learning_rate": 0.00039097559297376124,
"loss": 3.4900192260742187,
"step": 8360
},
{
"epoch": 0.32376918390437787,
"grad_norm": 0.240234375,
"learning_rate": 0.0003907308628248238,
"loss": 3.457179641723633,
"step": 8370
},
{
"epoch": 0.3241560049126268,
"grad_norm": 0.255859375,
"learning_rate": 0.0003904859403446633,
"loss": 3.431169891357422,
"step": 8380
},
{
"epoch": 0.32454282592087574,
"grad_norm": 0.26953125,
"learning_rate": 0.0003902408259006348,
"loss": 3.4472503662109375,
"step": 8390
},
{
"epoch": 0.32492964692912474,
"grad_norm": 0.2490234375,
"learning_rate": 0.0003899955198603812,
"loss": 3.439772033691406,
"step": 8400
},
{
"epoch": 0.32492964692912474,
"eval_loss": 3.9217541217803955,
"eval_runtime": 10.0191,
"eval_samples_per_second": 32.638,
"eval_steps_per_second": 2.096,
"step": 8400
},
{
"epoch": 0.3253164679373737,
"grad_norm": 0.244140625,
"learning_rate": 0.0003897500225918326,
"loss": 3.4198753356933596,
"step": 8410
},
{
"epoch": 0.3257032889456226,
"grad_norm": 0.25390625,
"learning_rate": 0.00038950433446320614,
"loss": 3.4733913421630858,
"step": 8420
},
{
"epoch": 0.3260901099538716,
"grad_norm": 0.255859375,
"learning_rate": 0.0003892584558430051,
"loss": 3.438296890258789,
"step": 8430
},
{
"epoch": 0.32647693096212055,
"grad_norm": 0.3125,
"learning_rate": 0.00038901238710001854,
"loss": 3.4649559020996095,
"step": 8440
},
{
"epoch": 0.3268637519703695,
"grad_norm": 0.25,
"learning_rate": 0.00038876612860332056,
"loss": 3.4911937713623047,
"step": 8450
},
{
"epoch": 0.3272505729786185,
"grad_norm": 0.2578125,
"learning_rate": 0.00038851968072227004,
"loss": 3.4624607086181642,
"step": 8460
},
{
"epoch": 0.3276373939868674,
"grad_norm": 0.2470703125,
"learning_rate": 0.00038827304382651,
"loss": 3.4401573181152343,
"step": 8470
},
{
"epoch": 0.32802421499511636,
"grad_norm": 0.28515625,
"learning_rate": 0.0003880262182859664,
"loss": 3.456196975708008,
"step": 8480
},
{
"epoch": 0.32841103600336535,
"grad_norm": 0.26953125,
"learning_rate": 0.0003877792044708489,
"loss": 3.4427886962890626,
"step": 8490
},
{
"epoch": 0.3287978570116143,
"grad_norm": 0.2578125,
"learning_rate": 0.00038753200275164895,
"loss": 3.4402111053466795,
"step": 8500
},
{
"epoch": 0.3287978570116143,
"eval_loss": 3.931530237197876,
"eval_runtime": 10.0521,
"eval_samples_per_second": 32.531,
"eval_steps_per_second": 2.089,
"step": 8500
},
{
"epoch": 0.3291846780198633,
"grad_norm": 0.244140625,
"learning_rate": 0.0003872846134991402,
"loss": 3.4195785522460938,
"step": 8510
},
{
"epoch": 0.3295714990281122,
"grad_norm": 0.259765625,
"learning_rate": 0.0003870370370843775,
"loss": 3.474544906616211,
"step": 8520
},
{
"epoch": 0.32995832003636116,
"grad_norm": 0.244140625,
"learning_rate": 0.0003867892738786963,
"loss": 3.4477092742919924,
"step": 8530
},
{
"epoch": 0.33034514104461016,
"grad_norm": 0.2578125,
"learning_rate": 0.00038654132425371227,
"loss": 3.4963069915771485,
"step": 8540
},
{
"epoch": 0.3307319620528591,
"grad_norm": 0.255859375,
"learning_rate": 0.0003862931885813207,
"loss": 3.4387706756591796,
"step": 8550
},
{
"epoch": 0.33111878306110804,
"grad_norm": 0.267578125,
"learning_rate": 0.00038604486723369604,
"loss": 3.4153343200683595,
"step": 8560
},
{
"epoch": 0.33150560406935703,
"grad_norm": 0.26953125,
"learning_rate": 0.000385796360583291,
"loss": 3.4407272338867188,
"step": 8570
},
{
"epoch": 0.33189242507760597,
"grad_norm": 0.263671875,
"learning_rate": 0.0003855476690028364,
"loss": 3.442066192626953,
"step": 8580
},
{
"epoch": 0.3322792460858549,
"grad_norm": 0.28125,
"learning_rate": 0.0003852987928653404,
"loss": 3.4434627532958983,
"step": 8590
},
{
"epoch": 0.3326660670941039,
"grad_norm": 0.251953125,
"learning_rate": 0.00038504973254408794,
"loss": 3.4483291625976564,
"step": 8600
},
{
"epoch": 0.3326660670941039,
"eval_loss": 3.9131031036376953,
"eval_runtime": 10.038,
"eval_samples_per_second": 32.576,
"eval_steps_per_second": 2.092,
"step": 8600
},
{
"epoch": 0.33305288810235284,
"grad_norm": 0.25390625,
"learning_rate": 0.0003848004884126403,
"loss": 3.4154125213623048,
"step": 8610
},
{
"epoch": 0.3334397091106018,
"grad_norm": 0.3046875,
"learning_rate": 0.0003845510608448342,
"loss": 3.478801727294922,
"step": 8620
},
{
"epoch": 0.3338265301188508,
"grad_norm": 0.298828125,
"learning_rate": 0.0003843014502147818,
"loss": 3.4299625396728515,
"step": 8630
},
{
"epoch": 0.3342133511270997,
"grad_norm": 0.2578125,
"learning_rate": 0.00038405165689686964,
"loss": 3.4181446075439452,
"step": 8640
},
{
"epoch": 0.33460017213534865,
"grad_norm": 0.27734375,
"learning_rate": 0.00038380168126575845,
"loss": 3.451136016845703,
"step": 8650
},
{
"epoch": 0.33498699314359764,
"grad_norm": 0.251953125,
"learning_rate": 0.0003835515236963822,
"loss": 3.4648101806640623,
"step": 8660
},
{
"epoch": 0.3353738141518466,
"grad_norm": 0.265625,
"learning_rate": 0.0003833011845639479,
"loss": 3.4500274658203125,
"step": 8670
},
{
"epoch": 0.3357606351600955,
"grad_norm": 0.26953125,
"learning_rate": 0.0003830506642439348,
"loss": 3.415103530883789,
"step": 8680
},
{
"epoch": 0.3361474561683445,
"grad_norm": 0.255859375,
"learning_rate": 0.00038279996311209395,
"loss": 3.4284832000732424,
"step": 8690
},
{
"epoch": 0.33653427717659345,
"grad_norm": 0.2421875,
"learning_rate": 0.00038254908154444756,
"loss": 3.4471145629882813,
"step": 8700
},
{
"epoch": 0.33653427717659345,
"eval_loss": 3.9201772212982178,
"eval_runtime": 10.102,
"eval_samples_per_second": 32.37,
"eval_steps_per_second": 2.079,
"step": 8700
},
{
"epoch": 0.3369210981848424,
"grad_norm": 0.267578125,
"learning_rate": 0.0003822980199172885,
"loss": 3.421375274658203,
"step": 8710
},
{
"epoch": 0.3373079191930914,
"grad_norm": 0.26953125,
"learning_rate": 0.0003820467786071798,
"loss": 3.4209850311279295,
"step": 8720
},
{
"epoch": 0.3376947402013403,
"grad_norm": 0.26953125,
"learning_rate": 0.0003817953579909537,
"loss": 3.4273170471191405,
"step": 8730
},
{
"epoch": 0.33808156120958927,
"grad_norm": 0.267578125,
"learning_rate": 0.00038154375844571176,
"loss": 3.4581871032714844,
"step": 8740
},
{
"epoch": 0.33846838221783826,
"grad_norm": 0.2734375,
"learning_rate": 0.00038129198034882357,
"loss": 3.4375110626220704,
"step": 8750
},
{
"epoch": 0.3388552032260872,
"grad_norm": 0.271484375,
"learning_rate": 0.0003810400240779268,
"loss": 3.405530548095703,
"step": 8760
},
{
"epoch": 0.3392420242343362,
"grad_norm": 0.26171875,
"learning_rate": 0.0003807878900109262,
"loss": 3.433206558227539,
"step": 8770
},
{
"epoch": 0.33962884524258513,
"grad_norm": 0.248046875,
"learning_rate": 0.0003805355785259932,
"loss": 3.458090591430664,
"step": 8780
},
{
"epoch": 0.34001566625083407,
"grad_norm": 0.2373046875,
"learning_rate": 0.0003802830900015655,
"loss": 3.4461318969726564,
"step": 8790
},
{
"epoch": 0.34040248725908306,
"grad_norm": 0.275390625,
"learning_rate": 0.000380030424816346,
"loss": 3.477490234375,
"step": 8800
},
{
"epoch": 0.34040248725908306,
"eval_loss": 3.9167301654815674,
"eval_runtime": 10.047,
"eval_samples_per_second": 32.547,
"eval_steps_per_second": 2.09,
"step": 8800
},
{
"epoch": 0.340789308267332,
"grad_norm": 0.263671875,
"learning_rate": 0.000379777583349303,
"loss": 3.421334075927734,
"step": 8810
},
{
"epoch": 0.34117612927558094,
"grad_norm": 0.251953125,
"learning_rate": 0.0003795245659796689,
"loss": 3.440085601806641,
"step": 8820
},
{
"epoch": 0.34156295028382994,
"grad_norm": 0.265625,
"learning_rate": 0.0003792713730869399,
"loss": 3.457305145263672,
"step": 8830
},
{
"epoch": 0.3419497712920789,
"grad_norm": 0.2470703125,
"learning_rate": 0.0003790180050508758,
"loss": 3.4464256286621096,
"step": 8840
},
{
"epoch": 0.3423365923003278,
"grad_norm": 0.251953125,
"learning_rate": 0.0003787644622514987,
"loss": 3.4250965118408203,
"step": 8850
},
{
"epoch": 0.3427234133085768,
"grad_norm": 0.251953125,
"learning_rate": 0.0003785107450690931,
"loss": 3.4989051818847656,
"step": 8860
},
{
"epoch": 0.34311023431682575,
"grad_norm": 0.251953125,
"learning_rate": 0.00037825685388420487,
"loss": 3.43200569152832,
"step": 8870
},
{
"epoch": 0.3434970553250747,
"grad_norm": 0.2421875,
"learning_rate": 0.000378002789077641,
"loss": 3.435445022583008,
"step": 8880
},
{
"epoch": 0.3438838763333237,
"grad_norm": 0.26953125,
"learning_rate": 0.0003777485510304688,
"loss": 3.4056018829345702,
"step": 8890
},
{
"epoch": 0.3442706973415726,
"grad_norm": 0.25390625,
"learning_rate": 0.00037749414012401555,
"loss": 3.4461997985839843,
"step": 8900
},
{
"epoch": 0.3442706973415726,
"eval_loss": 3.903242349624634,
"eval_runtime": 10.0386,
"eval_samples_per_second": 32.574,
"eval_steps_per_second": 2.092,
"step": 8900
},
{
"epoch": 0.34465751834982156,
"grad_norm": 0.2578125,
"learning_rate": 0.00037723955673986767,
"loss": 3.462035369873047,
"step": 8910
},
{
"epoch": 0.34504433935807055,
"grad_norm": 0.2578125,
"learning_rate": 0.00037698480125987027,
"loss": 3.432913589477539,
"step": 8920
},
{
"epoch": 0.3454311603663195,
"grad_norm": 0.25390625,
"learning_rate": 0.00037672987406612657,
"loss": 3.4201942443847657,
"step": 8930
},
{
"epoch": 0.34581798137456843,
"grad_norm": 0.26171875,
"learning_rate": 0.00037647477554099765,
"loss": 3.4594268798828125,
"step": 8940
},
{
"epoch": 0.3462048023828174,
"grad_norm": 0.2578125,
"learning_rate": 0.000376219506067101,
"loss": 3.445780944824219,
"step": 8950
},
{
"epoch": 0.34659162339106636,
"grad_norm": 0.255859375,
"learning_rate": 0.000375964066027311,
"loss": 3.429423522949219,
"step": 8960
},
{
"epoch": 0.3469784443993153,
"grad_norm": 0.25,
"learning_rate": 0.00037570845580475764,
"loss": 3.437569427490234,
"step": 8970
},
{
"epoch": 0.3473652654075643,
"grad_norm": 0.25,
"learning_rate": 0.00037545267578282626,
"loss": 3.408824157714844,
"step": 8980
},
{
"epoch": 0.34775208641581323,
"grad_norm": 0.263671875,
"learning_rate": 0.0003751967263451568,
"loss": 3.465847396850586,
"step": 8990
},
{
"epoch": 0.3481389074240622,
"grad_norm": 0.2451171875,
"learning_rate": 0.00037494060787564336,
"loss": 3.425415802001953,
"step": 9000
},
{
"epoch": 0.3481389074240622,
"eval_loss": 3.908496856689453,
"eval_runtime": 10.0504,
"eval_samples_per_second": 32.536,
"eval_steps_per_second": 2.089,
"step": 9000
},
{
"epoch": 0.34852572843231117,
"grad_norm": 0.2578125,
"learning_rate": 0.0003746843207584335,
"loss": 3.4315727233886717,
"step": 9010
},
{
"epoch": 0.3489125494405601,
"grad_norm": 0.25,
"learning_rate": 0.0003744278653779278,
"loss": 3.414052200317383,
"step": 9020
},
{
"epoch": 0.3492993704488091,
"grad_norm": 0.2734375,
"learning_rate": 0.0003741712421187792,
"loss": 3.411752700805664,
"step": 9030
},
{
"epoch": 0.34968619145705804,
"grad_norm": 0.25390625,
"learning_rate": 0.0003739144513658923,
"loss": 3.409000015258789,
"step": 9040
},
{
"epoch": 0.350073012465307,
"grad_norm": 0.2578125,
"learning_rate": 0.00037365749350442326,
"loss": 3.440891647338867,
"step": 9050
},
{
"epoch": 0.35045983347355597,
"grad_norm": 0.271484375,
"learning_rate": 0.00037340036891977854,
"loss": 3.4279243469238283,
"step": 9060
},
{
"epoch": 0.3508466544818049,
"grad_norm": 0.259765625,
"learning_rate": 0.0003731430779976148,
"loss": 3.432322692871094,
"step": 9070
},
{
"epoch": 0.35123347549005385,
"grad_norm": 0.259765625,
"learning_rate": 0.0003728856211238383,
"loss": 3.427559661865234,
"step": 9080
},
{
"epoch": 0.35162029649830284,
"grad_norm": 0.234375,
"learning_rate": 0.000372627998684604,
"loss": 3.4577556610107423,
"step": 9090
},
{
"epoch": 0.3520071175065518,
"grad_norm": 0.2890625,
"learning_rate": 0.0003723702110663151,
"loss": 3.441410446166992,
"step": 9100
},
{
"epoch": 0.3520071175065518,
"eval_loss": 3.9001352787017822,
"eval_runtime": 10.1074,
"eval_samples_per_second": 32.352,
"eval_steps_per_second": 2.078,
"step": 9100
},
{
"epoch": 0.3523939385148007,
"grad_norm": 0.26953125,
"learning_rate": 0.000372112258655623,
"loss": 3.4635162353515625,
"step": 9110
},
{
"epoch": 0.3527807595230497,
"grad_norm": 0.26953125,
"learning_rate": 0.0003718541418394259,
"loss": 3.392826461791992,
"step": 9120
},
{
"epoch": 0.35316758053129865,
"grad_norm": 0.265625,
"learning_rate": 0.0003715958610048687,
"loss": 3.457368087768555,
"step": 9130
},
{
"epoch": 0.3535544015395476,
"grad_norm": 0.25390625,
"learning_rate": 0.00037133741653934226,
"loss": 3.4322399139404296,
"step": 9140
},
{
"epoch": 0.3539412225477966,
"grad_norm": 0.26171875,
"learning_rate": 0.000371078808830483,
"loss": 3.4189102172851564,
"step": 9150
},
{
"epoch": 0.3543280435560455,
"grad_norm": 0.28125,
"learning_rate": 0.000370820038266172,
"loss": 3.4366641998291017,
"step": 9160
},
{
"epoch": 0.35471486456429446,
"grad_norm": 0.267578125,
"learning_rate": 0.00037056110523453473,
"loss": 3.4128700256347657,
"step": 9170
},
{
"epoch": 0.35510168557254346,
"grad_norm": 0.2734375,
"learning_rate": 0.0003703020101239403,
"loss": 3.4295944213867187,
"step": 9180
},
{
"epoch": 0.3554885065807924,
"grad_norm": 0.2392578125,
"learning_rate": 0.0003700427533230009,
"loss": 3.4191574096679687,
"step": 9190
},
{
"epoch": 0.35587532758904133,
"grad_norm": 0.271484375,
"learning_rate": 0.0003697833352205712,
"loss": 3.4229095458984373,
"step": 9200
},
{
"epoch": 0.35587532758904133,
"eval_loss": 3.8868236541748047,
"eval_runtime": 10.0499,
"eval_samples_per_second": 32.538,
"eval_steps_per_second": 2.09,
"step": 9200
},
{
"epoch": 0.35626214859729033,
"grad_norm": 0.244140625,
"learning_rate": 0.00036952375620574794,
"loss": 3.4355594635009767,
"step": 9210
},
{
"epoch": 0.35664896960553927,
"grad_norm": 0.2734375,
"learning_rate": 0.0003692640166678692,
"loss": 3.431700897216797,
"step": 9220
},
{
"epoch": 0.35703579061378826,
"grad_norm": 0.255859375,
"learning_rate": 0.0003690041169965136,
"loss": 3.4387435913085938,
"step": 9230
},
{
"epoch": 0.3574226116220372,
"grad_norm": 0.25390625,
"learning_rate": 0.00036874405758150023,
"loss": 3.432315444946289,
"step": 9240
},
{
"epoch": 0.35780943263028614,
"grad_norm": 0.26171875,
"learning_rate": 0.0003684838388128876,
"loss": 3.4304718017578124,
"step": 9250
},
{
"epoch": 0.35819625363853513,
"grad_norm": 0.279296875,
"learning_rate": 0.00036822346108097325,
"loss": 3.3982025146484376,
"step": 9260
},
{
"epoch": 0.3585830746467841,
"grad_norm": 0.26171875,
"learning_rate": 0.0003679629247762933,
"loss": 3.4113441467285157,
"step": 9270
},
{
"epoch": 0.358969895655033,
"grad_norm": 0.2734375,
"learning_rate": 0.00036770223028962144,
"loss": 3.4584545135498046,
"step": 9280
},
{
"epoch": 0.359356716663282,
"grad_norm": 0.248046875,
"learning_rate": 0.0003674413780119688,
"loss": 3.469136047363281,
"step": 9290
},
{
"epoch": 0.35974353767153094,
"grad_norm": 0.2490234375,
"learning_rate": 0.0003671803683345832,
"loss": 3.3828174591064455,
"step": 9300
},
{
"epoch": 0.35974353767153094,
"eval_loss": 3.91288423538208,
"eval_runtime": 10.0525,
"eval_samples_per_second": 32.529,
"eval_steps_per_second": 2.089,
"step": 9300
},
{
"epoch": 0.3601303586797799,
"grad_norm": 0.265625,
"learning_rate": 0.0003669192016489484,
"loss": 3.386565399169922,
"step": 9310
},
{
"epoch": 0.3605171796880289,
"grad_norm": 0.25390625,
"learning_rate": 0.0003666578783467837,
"loss": 3.4089500427246096,
"step": 9320
},
{
"epoch": 0.3609040006962778,
"grad_norm": 0.265625,
"learning_rate": 0.0003663963988200435,
"loss": 3.418537902832031,
"step": 9330
},
{
"epoch": 0.36129082170452675,
"grad_norm": 0.2734375,
"learning_rate": 0.00036613476346091623,
"loss": 3.421380615234375,
"step": 9340
},
{
"epoch": 0.36167764271277575,
"grad_norm": 0.255859375,
"learning_rate": 0.0003658729726618242,
"loss": 3.441343307495117,
"step": 9350
},
{
"epoch": 0.3620644637210247,
"grad_norm": 0.2431640625,
"learning_rate": 0.0003656110268154228,
"loss": 3.3920360565185548,
"step": 9360
},
{
"epoch": 0.3624512847292736,
"grad_norm": 0.287109375,
"learning_rate": 0.0003653489263146001,
"loss": 3.4329292297363283,
"step": 9370
},
{
"epoch": 0.3628381057375226,
"grad_norm": 0.25390625,
"learning_rate": 0.00036508667155247604,
"loss": 3.4128143310546877,
"step": 9380
},
{
"epoch": 0.36322492674577156,
"grad_norm": 0.2353515625,
"learning_rate": 0.00036482426292240187,
"loss": 3.453541564941406,
"step": 9390
},
{
"epoch": 0.3636117477540205,
"grad_norm": 0.267578125,
"learning_rate": 0.00036456170081795977,
"loss": 3.422444152832031,
"step": 9400
},
{
"epoch": 0.3636117477540205,
"eval_loss": 3.9018635749816895,
"eval_runtime": 10.0801,
"eval_samples_per_second": 32.44,
"eval_steps_per_second": 2.083,
"step": 9400
},
{
"epoch": 0.3639985687622695,
"grad_norm": 0.25,
"learning_rate": 0.00036429898563296195,
"loss": 3.4397987365722655,
"step": 9410
},
{
"epoch": 0.36438538977051843,
"grad_norm": 0.263671875,
"learning_rate": 0.00036403611776145037,
"loss": 3.4169151306152346,
"step": 9420
},
{
"epoch": 0.36477221077876737,
"grad_norm": 0.267578125,
"learning_rate": 0.00036377309759769594,
"loss": 3.412881088256836,
"step": 9430
},
{
"epoch": 0.36515903178701636,
"grad_norm": 0.25,
"learning_rate": 0.00036350992553619795,
"loss": 3.4701351165771483,
"step": 9440
},
{
"epoch": 0.3655458527952653,
"grad_norm": 0.26171875,
"learning_rate": 0.0003632466019716836,
"loss": 3.4168781280517577,
"step": 9450
},
{
"epoch": 0.36593267380351424,
"grad_norm": 0.255859375,
"learning_rate": 0.00036298312729910734,
"loss": 3.415391540527344,
"step": 9460
},
{
"epoch": 0.36631949481176324,
"grad_norm": 0.26953125,
"learning_rate": 0.00036271950191365,
"loss": 3.4176471710205076,
"step": 9470
},
{
"epoch": 0.3667063158200122,
"grad_norm": 0.26171875,
"learning_rate": 0.00036245572621071897,
"loss": 3.3979991912841796,
"step": 9480
},
{
"epoch": 0.36709313682826117,
"grad_norm": 0.263671875,
"learning_rate": 0.0003621918005859466,
"loss": 3.4499542236328127,
"step": 9490
},
{
"epoch": 0.3674799578365101,
"grad_norm": 0.265625,
"learning_rate": 0.00036192772543519044,
"loss": 3.3763500213623048,
"step": 9500
},
{
"epoch": 0.3674799578365101,
"eval_loss": 3.875546932220459,
"eval_runtime": 10.0346,
"eval_samples_per_second": 32.587,
"eval_steps_per_second": 2.093,
"step": 9500
},
{
"epoch": 0.36786677884475905,
"grad_norm": 0.25390625,
"learning_rate": 0.000361663501154532,
"loss": 3.4191715240478517,
"step": 9510
},
{
"epoch": 0.36825359985300804,
"grad_norm": 0.259765625,
"learning_rate": 0.0003613991281402768,
"loss": 3.4267364501953126,
"step": 9520
},
{
"epoch": 0.368640420861257,
"grad_norm": 0.267578125,
"learning_rate": 0.0003611346067889533,
"loss": 3.4404712677001954,
"step": 9530
},
{
"epoch": 0.3690272418695059,
"grad_norm": 0.2734375,
"learning_rate": 0.0003608699374973123,
"loss": 3.358293151855469,
"step": 9540
},
{
"epoch": 0.3694140628777549,
"grad_norm": 0.265625,
"learning_rate": 0.0003606051206623267,
"loss": 3.370107650756836,
"step": 9550
},
{
"epoch": 0.36980088388600385,
"grad_norm": 0.26171875,
"learning_rate": 0.00036034015668119065,
"loss": 3.4077564239501954,
"step": 9560
},
{
"epoch": 0.3701877048942528,
"grad_norm": 0.2451171875,
"learning_rate": 0.0003600750459513189,
"loss": 3.4234764099121096,
"step": 9570
},
{
"epoch": 0.3705745259025018,
"grad_norm": 0.271484375,
"learning_rate": 0.0003598097888703466,
"loss": 3.3569828033447267,
"step": 9580
},
{
"epoch": 0.3709613469107507,
"grad_norm": 0.267578125,
"learning_rate": 0.0003595443858361279,
"loss": 3.4103553771972654,
"step": 9590
},
{
"epoch": 0.37134816791899966,
"grad_norm": 0.2890625,
"learning_rate": 0.00035927883724673644,
"loss": 3.4405521392822265,
"step": 9600
},
{
"epoch": 0.37134816791899966,
"eval_loss": 3.883023738861084,
"eval_runtime": 10.0477,
"eval_samples_per_second": 32.545,
"eval_steps_per_second": 2.09,
"step": 9600
},
{
"epoch": 0.37173498892724866,
"grad_norm": 0.27734375,
"learning_rate": 0.0003590131435004636,
"loss": 3.419297790527344,
"step": 9610
},
{
"epoch": 0.3721218099354976,
"grad_norm": 0.296875,
"learning_rate": 0.0003587473049958191,
"loss": 3.4245758056640625,
"step": 9620
},
{
"epoch": 0.37250863094374653,
"grad_norm": 0.25390625,
"learning_rate": 0.0003584813221315292,
"loss": 3.40887336730957,
"step": 9630
},
{
"epoch": 0.3728954519519955,
"grad_norm": 0.267578125,
"learning_rate": 0.00035821519530653695,
"loss": 3.4069156646728516,
"step": 9640
},
{
"epoch": 0.37328227296024447,
"grad_norm": 0.25,
"learning_rate": 0.0003579489249200014,
"loss": 3.4280853271484375,
"step": 9650
},
{
"epoch": 0.3736690939684934,
"grad_norm": 0.25390625,
"learning_rate": 0.0003576825113712968,
"loss": 3.422659683227539,
"step": 9660
},
{
"epoch": 0.3740559149767424,
"grad_norm": 0.267578125,
"learning_rate": 0.00035741595506001223,
"loss": 3.39489631652832,
"step": 9670
},
{
"epoch": 0.37444273598499134,
"grad_norm": 0.2373046875,
"learning_rate": 0.0003571492563859508,
"loss": 3.4341705322265623,
"step": 9680
},
{
"epoch": 0.3748295569932403,
"grad_norm": 0.271484375,
"learning_rate": 0.000356882415749129,
"loss": 3.4342811584472654,
"step": 9690
},
{
"epoch": 0.37521637800148927,
"grad_norm": 0.248046875,
"learning_rate": 0.0003566154335497767,
"loss": 3.4240440368652343,
"step": 9700
},
{
"epoch": 0.37521637800148927,
"eval_loss": 3.8837051391601562,
"eval_runtime": 10.0201,
"eval_samples_per_second": 32.634,
"eval_steps_per_second": 2.096,
"step": 9700
},
{
"epoch": 0.3756031990097382,
"grad_norm": 0.251953125,
"learning_rate": 0.0003563483101883356,
"loss": 3.4255138397216798,
"step": 9710
},
{
"epoch": 0.3759900200179872,
"grad_norm": 0.265625,
"learning_rate": 0.0003560810460654595,
"loss": 3.4189659118652345,
"step": 9720
},
{
"epoch": 0.37637684102623614,
"grad_norm": 0.2578125,
"learning_rate": 0.0003558136415820131,
"loss": 3.4093570709228516,
"step": 9730
},
{
"epoch": 0.3767636620344851,
"grad_norm": 0.25390625,
"learning_rate": 0.0003555460971390717,
"loss": 3.3877967834472655,
"step": 9740
},
{
"epoch": 0.3771504830427341,
"grad_norm": 0.2578125,
"learning_rate": 0.00035527841313792046,
"loss": 3.4528697967529296,
"step": 9750
},
{
"epoch": 0.377537304050983,
"grad_norm": 0.265625,
"learning_rate": 0.000355010589980054,
"loss": 3.4023715972900392,
"step": 9760
},
{
"epoch": 0.37792412505923195,
"grad_norm": 0.25,
"learning_rate": 0.0003547426280671756,
"loss": 3.4020904541015624,
"step": 9770
},
{
"epoch": 0.37831094606748095,
"grad_norm": 0.255859375,
"learning_rate": 0.00035447452780119654,
"loss": 3.3937957763671873,
"step": 9780
},
{
"epoch": 0.3786977670757299,
"grad_norm": 0.25390625,
"learning_rate": 0.0003542062895842358,
"loss": 3.420269775390625,
"step": 9790
},
{
"epoch": 0.3790845880839788,
"grad_norm": 0.25,
"learning_rate": 0.0003539379138186191,
"loss": 3.3751293182373048,
"step": 9800
},
{
"epoch": 0.3790845880839788,
"eval_loss": 3.911559820175171,
"eval_runtime": 10.0374,
"eval_samples_per_second": 32.578,
"eval_steps_per_second": 2.092,
"step": 9800
},
{
"epoch": 0.3794714090922278,
"grad_norm": 0.255859375,
"learning_rate": 0.00035366940090687864,
"loss": 3.405370330810547,
"step": 9810
},
{
"epoch": 0.37985823010047676,
"grad_norm": 0.251953125,
"learning_rate": 0.00035340075125175213,
"loss": 3.389670181274414,
"step": 9820
},
{
"epoch": 0.3802450511087257,
"grad_norm": 0.25390625,
"learning_rate": 0.0003531319652561825,
"loss": 3.3794952392578126,
"step": 9830
},
{
"epoch": 0.3806318721169747,
"grad_norm": 0.26953125,
"learning_rate": 0.00035286304332331724,
"loss": 3.402521514892578,
"step": 9840
},
{
"epoch": 0.38101869312522363,
"grad_norm": 0.2451171875,
"learning_rate": 0.0003525939858565076,
"loss": 3.430156707763672,
"step": 9850
},
{
"epoch": 0.38140551413347257,
"grad_norm": 0.251953125,
"learning_rate": 0.0003523247932593081,
"loss": 3.4212566375732423,
"step": 9860
},
{
"epoch": 0.38179233514172156,
"grad_norm": 0.251953125,
"learning_rate": 0.00035205546593547606,
"loss": 3.4265159606933593,
"step": 9870
},
{
"epoch": 0.3821791561499705,
"grad_norm": 0.259765625,
"learning_rate": 0.00035178600428897075,
"loss": 3.4060302734375,
"step": 9880
},
{
"epoch": 0.38256597715821944,
"grad_norm": 0.2490234375,
"learning_rate": 0.0003515164087239529,
"loss": 3.4170459747314452,
"step": 9890
},
{
"epoch": 0.38295279816646843,
"grad_norm": 0.26171875,
"learning_rate": 0.00035124667964478434,
"loss": 3.3865825653076174,
"step": 9900
},
{
"epoch": 0.38295279816646843,
"eval_loss": 3.8762545585632324,
"eval_runtime": 10.0396,
"eval_samples_per_second": 32.571,
"eval_steps_per_second": 2.092,
"step": 9900
},
{
"epoch": 0.38333961917471737,
"grad_norm": 0.25390625,
"learning_rate": 0.00035097681745602705,
"loss": 3.4357513427734374,
"step": 9910
},
{
"epoch": 0.3837264401829663,
"grad_norm": 0.2734375,
"learning_rate": 0.0003507068225624423,
"loss": 3.393326187133789,
"step": 9920
},
{
"epoch": 0.3841132611912153,
"grad_norm": 0.255859375,
"learning_rate": 0.00035043669536899104,
"loss": 3.4443363189697265,
"step": 9930
},
{
"epoch": 0.38450008219946424,
"grad_norm": 0.255859375,
"learning_rate": 0.00035016643628083194,
"loss": 3.415657806396484,
"step": 9940
},
{
"epoch": 0.38488690320771324,
"grad_norm": 0.267578125,
"learning_rate": 0.00034989604570332224,
"loss": 3.425619125366211,
"step": 9950
},
{
"epoch": 0.3852737242159622,
"grad_norm": 0.26953125,
"learning_rate": 0.00034962552404201573,
"loss": 3.3953113555908203,
"step": 9960
},
{
"epoch": 0.3856605452242111,
"grad_norm": 0.267578125,
"learning_rate": 0.0003493548717026633,
"loss": 3.4209903717041015,
"step": 9970
},
{
"epoch": 0.3860473662324601,
"grad_norm": 0.26171875,
"learning_rate": 0.00034908408909121145,
"loss": 3.3913738250732424,
"step": 9980
},
{
"epoch": 0.38643418724070905,
"grad_norm": 0.267578125,
"learning_rate": 0.0003488131766138026,
"loss": 3.3826934814453127,
"step": 9990
},
{
"epoch": 0.386821008248958,
"grad_norm": 0.2421875,
"learning_rate": 0.0003485421346767733,
"loss": 3.424589157104492,
"step": 10000
},
{
"epoch": 0.386821008248958,
"eval_loss": 3.8753442764282227,
"eval_runtime": 10.0275,
"eval_samples_per_second": 32.61,
"eval_steps_per_second": 2.094,
"step": 10000
},
{
"epoch": 0.387207829257207,
"grad_norm": 0.314453125,
"learning_rate": 0.0003482709636866547,
"loss": 3.408251953125,
"step": 10010
},
{
"epoch": 0.3875946502654559,
"grad_norm": 0.2734375,
"learning_rate": 0.0003479996640501714,
"loss": 3.392727279663086,
"step": 10020
},
{
"epoch": 0.38798147127370486,
"grad_norm": 0.232421875,
"learning_rate": 0.00034772823617424103,
"loss": 3.420479583740234,
"step": 10030
},
{
"epoch": 0.38836829228195385,
"grad_norm": 0.30078125,
"learning_rate": 0.0003474566804659735,
"loss": 3.4015888214111327,
"step": 10040
},
{
"epoch": 0.3887551132902028,
"grad_norm": 0.2734375,
"learning_rate": 0.0003471849973326705,
"loss": 3.4193763732910156,
"step": 10050
},
{
"epoch": 0.38914193429845173,
"grad_norm": 0.26171875,
"learning_rate": 0.0003469131871818247,
"loss": 3.402726745605469,
"step": 10060
},
{
"epoch": 0.3895287553067007,
"grad_norm": 0.2578125,
"learning_rate": 0.00034664125042111935,
"loss": 3.384511947631836,
"step": 10070
},
{
"epoch": 0.38991557631494966,
"grad_norm": 0.26171875,
"learning_rate": 0.0003463691874584277,
"loss": 3.396898651123047,
"step": 10080
},
{
"epoch": 0.3903023973231986,
"grad_norm": 0.2392578125,
"learning_rate": 0.0003460969987018123,
"loss": 3.417254638671875,
"step": 10090
},
{
"epoch": 0.3906892183314476,
"grad_norm": 0.26953125,
"learning_rate": 0.0003458246845595241,
"loss": 3.3982513427734373,
"step": 10100
},
{
"epoch": 0.3906892183314476,
"eval_loss": 3.85249662399292,
"eval_runtime": 10.0512,
"eval_samples_per_second": 32.533,
"eval_steps_per_second": 2.089,
"step": 10100
}
],
"logging_steps": 10,
"max_steps": 25852,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 100,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 6.379493380639949e+18,
"train_batch_size": 32,
"trial_name": null,
"trial_params": null
}