Files
ZeliDesk-sLM-1B/last-checkpoint/trainer_state.json

6371 lines
166 KiB
JSON
Raw Normal View History

{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.5767182763987876,
"eval_steps": 2000,
"global_step": 44000,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.000655361677725895,
"grad_norm": 0.8467476963996887,
"learning_rate": 9.800000000000001e-06,
"loss": 10.180188598632812,
"step": 50
},
{
"epoch": 0.00131072335545179,
"grad_norm": 0.9815138578414917,
"learning_rate": 1.9800000000000004e-05,
"loss": 8.96072021484375,
"step": 100
},
{
"epoch": 0.001966085033177685,
"grad_norm": 0.9080342650413513,
"learning_rate": 2.98e-05,
"loss": 8.427459106445312,
"step": 150
},
{
"epoch": 0.00262144671090358,
"grad_norm": 1.0856770277023315,
"learning_rate": 3.9800000000000005e-05,
"loss": 8.004227294921876,
"step": 200
},
{
"epoch": 0.003276808388629475,
"grad_norm": 1.2208398580551147,
"learning_rate": 4.9800000000000004e-05,
"loss": 7.468403930664063,
"step": 250
},
{
"epoch": 0.00393217006635537,
"grad_norm": 1.3048540353775024,
"learning_rate": 5.9800000000000003e-05,
"loss": 7.054309692382812,
"step": 300
},
{
"epoch": 0.004587531744081265,
"grad_norm": 1.3516727685928345,
"learning_rate": 6.98e-05,
"loss": 6.717307739257812,
"step": 350
},
{
"epoch": 0.00524289342180716,
"grad_norm": 1.4339897632598877,
"learning_rate": 7.98e-05,
"loss": 6.44216552734375,
"step": 400
},
{
"epoch": 0.005898255099533055,
"grad_norm": 1.5168559551239014,
"learning_rate": 8.98e-05,
"loss": 6.2303076171875,
"step": 450
},
{
"epoch": 0.00655361677725895,
"grad_norm": 1.279758334159851,
"learning_rate": 9.98e-05,
"loss": 6.04508056640625,
"step": 500
},
{
"epoch": 0.0072089784549848445,
"grad_norm": 1.05825936794281,
"learning_rate": 0.00010980000000000001,
"loss": 5.892017211914062,
"step": 550
},
{
"epoch": 0.00786434013271074,
"grad_norm": 0.8929133415222168,
"learning_rate": 0.0001198,
"loss": 5.74849609375,
"step": 600
},
{
"epoch": 0.008519701810436636,
"grad_norm": 0.8807085752487183,
"learning_rate": 0.0001298,
"loss": 5.602015991210937,
"step": 650
},
{
"epoch": 0.00917506348816253,
"grad_norm": 0.9188336730003357,
"learning_rate": 0.0001398,
"loss": 5.464683227539062,
"step": 700
},
{
"epoch": 0.009830425165888425,
"grad_norm": 0.9099339842796326,
"learning_rate": 0.0001498,
"loss": 5.345360107421875,
"step": 750
},
{
"epoch": 0.01048578684361432,
"grad_norm": 0.6145728826522827,
"learning_rate": 0.0001598,
"loss": 5.22587158203125,
"step": 800
},
{
"epoch": 0.011141148521340214,
"grad_norm": 0.5609785318374634,
"learning_rate": 0.0001698,
"loss": 5.094062194824219,
"step": 850
},
{
"epoch": 0.01179651019906611,
"grad_norm": 0.6819213628768921,
"learning_rate": 0.0001798,
"loss": 4.966111145019531,
"step": 900
},
{
"epoch": 0.012451871876792005,
"grad_norm": 0.5285196304321289,
"learning_rate": 0.0001898,
"loss": 4.863562927246094,
"step": 950
},
{
"epoch": 0.0131072335545179,
"grad_norm": 0.5692344903945923,
"learning_rate": 0.0001998,
"loss": 4.752896118164062,
"step": 1000
},
{
"epoch": 0.013762595232243794,
"grad_norm": 0.4370023310184479,
"learning_rate": 0.0002098,
"loss": 4.660392761230469,
"step": 1050
},
{
"epoch": 0.014417956909969689,
"grad_norm": 0.47209805250167847,
"learning_rate": 0.0002198,
"loss": 4.578724670410156,
"step": 1100
},
{
"epoch": 0.015073318587695584,
"grad_norm": 0.5490202903747559,
"learning_rate": 0.0002298,
"loss": 4.496038513183594,
"step": 1150
},
{
"epoch": 0.01572868026542148,
"grad_norm": 0.36493241786956787,
"learning_rate": 0.00023980000000000003,
"loss": 4.431192321777344,
"step": 1200
},
{
"epoch": 0.016384041943147375,
"grad_norm": 0.36698517203330994,
"learning_rate": 0.00024980000000000005,
"loss": 4.366851806640625,
"step": 1250
},
{
"epoch": 0.01703940362087327,
"grad_norm": 0.34887444972991943,
"learning_rate": 0.00025979999999999997,
"loss": 4.331812438964843,
"step": 1300
},
{
"epoch": 0.017694765298599164,
"grad_norm": 0.367520272731781,
"learning_rate": 0.0002698,
"loss": 4.279182739257813,
"step": 1350
},
{
"epoch": 0.01835012697632506,
"grad_norm": 0.3470223844051361,
"learning_rate": 0.0002798,
"loss": 4.249953918457031,
"step": 1400
},
{
"epoch": 0.019005488654050953,
"grad_norm": 0.3077870309352875,
"learning_rate": 0.00028980000000000005,
"loss": 4.197932739257812,
"step": 1450
},
{
"epoch": 0.01966085033177685,
"grad_norm": 0.39390048384666443,
"learning_rate": 0.0002998,
"loss": 4.161753234863281,
"step": 1500
},
{
"epoch": 0.020316212009502746,
"grad_norm": 0.31337419152259827,
"learning_rate": 0.0003098,
"loss": 4.123833923339844,
"step": 1550
},
{
"epoch": 0.02097157368722864,
"grad_norm": 0.29740896821022034,
"learning_rate": 0.0003198,
"loss": 4.100555419921875,
"step": 1600
},
{
"epoch": 0.021626935364954535,
"grad_norm": 0.2615343928337097,
"learning_rate": 0.0003298,
"loss": 4.061597290039063,
"step": 1650
},
{
"epoch": 0.022282297042680428,
"grad_norm": 0.26902270317077637,
"learning_rate": 0.0003398,
"loss": 4.043543395996093,
"step": 1700
},
{
"epoch": 0.022937658720406325,
"grad_norm": 0.25607913732528687,
"learning_rate": 0.00034980000000000005,
"loss": 4.0114984130859375,
"step": 1750
},
{
"epoch": 0.02359302039813222,
"grad_norm": 0.27139875292778015,
"learning_rate": 0.0003598,
"loss": 3.991943359375,
"step": 1800
},
{
"epoch": 0.024248382075858114,
"grad_norm": 0.2561239004135132,
"learning_rate": 0.0003698,
"loss": 3.9760098266601562,
"step": 1850
},
{
"epoch": 0.02490374375358401,
"grad_norm": 0.2643027603626251,
"learning_rate": 0.0003798,
"loss": 3.9419815063476564,
"step": 1900
},
{
"epoch": 0.025559105431309903,
"grad_norm": 0.26799383759498596,
"learning_rate": 0.00038980000000000004,
"loss": 3.9217547607421874,
"step": 1950
},
{
"epoch": 0.0262144671090358,
"grad_norm": 0.24854837357997894,
"learning_rate": 0.0003998,
"loss": 3.9029278564453125,
"step": 2000
},
{
"epoch": 0.0262144671090358,
"eval_loss": 3.6972527503967285,
"eval_runtime": 5.7053,
"eval_samples_per_second": 44.87,
"eval_steps_per_second": 5.609,
"step": 2000
},
{
"epoch": 0.026869828786761696,
"grad_norm": 0.2584347128868103,
"learning_rate": 0.00039999957066533194,
"loss": 3.886022644042969,
"step": 2050
},
{
"epoch": 0.02752519046448759,
"grad_norm": 0.24325698614120483,
"learning_rate": 0.00039999824743671737,
"loss": 3.862571105957031,
"step": 2100
},
{
"epoch": 0.028180552142213485,
"grad_norm": 0.24973207712173462,
"learning_rate": 0.00039999603014125647,
"loss": 3.8482586669921877,
"step": 2150
},
{
"epoch": 0.028835913819939378,
"grad_norm": 0.23583084344863892,
"learning_rate": 0.0003999929187888615,
"loss": 3.8230856323242186,
"step": 2200
},
{
"epoch": 0.029491275497665274,
"grad_norm": 0.2415408194065094,
"learning_rate": 0.00039998891339344133,
"loss": 3.8136712646484376,
"step": 2250
},
{
"epoch": 0.030146637175391167,
"grad_norm": 0.2631337642669678,
"learning_rate": 0.0003999840139729017,
"loss": 3.7838894653320314,
"step": 2300
},
{
"epoch": 0.030801998853117064,
"grad_norm": 0.22226187586784363,
"learning_rate": 0.0003999782205491446,
"loss": 3.7657183837890624,
"step": 2350
},
{
"epoch": 0.03145736053084296,
"grad_norm": 0.23696529865264893,
"learning_rate": 0.000399971533148069,
"loss": 3.7568017578125,
"step": 2400
},
{
"epoch": 0.03211272220856885,
"grad_norm": 0.23273636400699615,
"learning_rate": 0.00039996395179957,
"loss": 3.743465576171875,
"step": 2450
},
{
"epoch": 0.03276808388629475,
"grad_norm": 0.23096396028995514,
"learning_rate": 0.00039995547653753905,
"loss": 3.7067642211914062,
"step": 2500
},
{
"epoch": 0.033423445564020646,
"grad_norm": 0.2173779308795929,
"learning_rate": 0.00039994610739986383,
"loss": 3.703720703125,
"step": 2550
},
{
"epoch": 0.03407880724174654,
"grad_norm": 0.21475356817245483,
"learning_rate": 0.00039993584442842776,
"loss": 3.6886892700195313,
"step": 2600
},
{
"epoch": 0.03473416891947243,
"grad_norm": 0.22239187359809875,
"learning_rate": 0.0003999246876691102,
"loss": 3.676330871582031,
"step": 2650
},
{
"epoch": 0.03538953059719833,
"grad_norm": 0.23763835430145264,
"learning_rate": 0.0003999126371717861,
"loss": 3.6614373779296874,
"step": 2700
},
{
"epoch": 0.036044892274924224,
"grad_norm": 0.20816709101200104,
"learning_rate": 0.0003998996929903255,
"loss": 3.6537326049804686,
"step": 2750
},
{
"epoch": 0.03670025395265012,
"grad_norm": 0.21410858631134033,
"learning_rate": 0.00039988585518259395,
"loss": 3.638464050292969,
"step": 2800
},
{
"epoch": 0.03735561563037602,
"grad_norm": 0.20823006331920624,
"learning_rate": 0.0003998711238104515,
"loss": 3.620465087890625,
"step": 2850
},
{
"epoch": 0.038010977308101906,
"grad_norm": 0.2275841236114502,
"learning_rate": 0.00039985549893975286,
"loss": 3.605263366699219,
"step": 2900
},
{
"epoch": 0.0386663389858278,
"grad_norm": 0.2017376720905304,
"learning_rate": 0.0003998389806403471,
"loss": 3.584982604980469,
"step": 2950
},
{
"epoch": 0.0393217006635537,
"grad_norm": 0.21403516829013824,
"learning_rate": 0.00039982156898607713,
"loss": 3.600724182128906,
"step": 3000
},
{
"epoch": 0.039977062341279596,
"grad_norm": 0.2169589102268219,
"learning_rate": 0.00039980326405477957,
"loss": 3.588856201171875,
"step": 3050
},
{
"epoch": 0.04063242401900549,
"grad_norm": 0.21386539936065674,
"learning_rate": 0.00039978406592828435,
"loss": 3.576596374511719,
"step": 3100
},
{
"epoch": 0.04128778569673138,
"grad_norm": 0.20095941424369812,
"learning_rate": 0.00039976397469241416,
"loss": 3.558380126953125,
"step": 3150
},
{
"epoch": 0.04194314737445728,
"grad_norm": 0.20533066987991333,
"learning_rate": 0.00039974299043698446,
"loss": 3.5680126953125,
"step": 3200
},
{
"epoch": 0.042598509052183174,
"grad_norm": 0.23280708491802216,
"learning_rate": 0.0003997211132558026,
"loss": 3.548220520019531,
"step": 3250
},
{
"epoch": 0.04325387072990907,
"grad_norm": 0.21237953007221222,
"learning_rate": 0.0003996983432466678,
"loss": 3.5354214477539063,
"step": 3300
},
{
"epoch": 0.04390923240763497,
"grad_norm": 0.21332086622714996,
"learning_rate": 0.00039967468051137044,
"loss": 3.52345458984375,
"step": 3350
},
{
"epoch": 0.044564594085360856,
"grad_norm": 0.2084880918264389,
"learning_rate": 0.0003996501251556918,
"loss": 3.5277310180664063,
"step": 3400
},
{
"epoch": 0.04521995576308675,
"grad_norm": 0.20562036335468292,
"learning_rate": 0.0003996246772894036,
"loss": 3.4971243286132814,
"step": 3450
},
{
"epoch": 0.04587531744081265,
"grad_norm": 0.22141627967357635,
"learning_rate": 0.00039959833702626717,
"loss": 3.50343994140625,
"step": 3500
},
{
"epoch": 0.046530679118538545,
"grad_norm": 0.20655743777751923,
"learning_rate": 0.00039957110448403334,
"loss": 3.490086669921875,
"step": 3550
},
{
"epoch": 0.04718604079626444,
"grad_norm": 0.21529725193977356,
"learning_rate": 0.00039954297978444186,
"loss": 3.490438232421875,
"step": 3600
},
{
"epoch": 0.04784140247399033,
"grad_norm": 0.21352700889110565,
"learning_rate": 0.0003995139630532205,
"loss": 3.476470642089844,
"step": 3650
},
{
"epoch": 0.04849676415171623,
"grad_norm": 0.21655848622322083,
"learning_rate": 0.00039948405442008495,
"loss": 3.4527011108398438,
"step": 3700
},
{
"epoch": 0.049152125829442124,
"grad_norm": 0.20387986302375793,
"learning_rate": 0.0003994532540187379,
"loss": 3.4542727661132813,
"step": 3750
},
{
"epoch": 0.04980748750716802,
"grad_norm": 0.20096465945243835,
"learning_rate": 0.0003994215619868688,
"loss": 3.4588165283203125,
"step": 3800
},
{
"epoch": 0.05046284918489392,
"grad_norm": 0.2160736620426178,
"learning_rate": 0.0003993889784661527,
"loss": 3.4502923583984373,
"step": 3850
},
{
"epoch": 0.051118210862619806,
"grad_norm": 0.2020275592803955,
"learning_rate": 0.0003993555036022502,
"loss": 3.4401654052734374,
"step": 3900
},
{
"epoch": 0.0517735725403457,
"grad_norm": 0.19931048154830933,
"learning_rate": 0.00039932113754480634,
"loss": 3.4484799194335936,
"step": 3950
},
{
"epoch": 0.0524289342180716,
"grad_norm": 0.19830818474292755,
"learning_rate": 0.0003992858804474504,
"loss": 3.4245230102539064,
"step": 4000
},
{
"epoch": 0.0524289342180716,
"eval_loss": 3.2663216590881348,
"eval_runtime": 5.674,
"eval_samples_per_second": 45.118,
"eval_steps_per_second": 5.64,
"step": 4000
},
{
"epoch": 0.053084295895797495,
"grad_norm": 0.18688614666461945,
"learning_rate": 0.0003992497324677946,
"loss": 3.429587707519531,
"step": 4050
},
{
"epoch": 0.05373965757352339,
"grad_norm": 0.19800157845020294,
"learning_rate": 0.000399212693767434,
"loss": 3.424355163574219,
"step": 4100
},
{
"epoch": 0.05439501925124928,
"grad_norm": 0.19706763327121735,
"learning_rate": 0.0003991747645119454,
"loss": 3.4139633178710938,
"step": 4150
},
{
"epoch": 0.05505038092897518,
"grad_norm": 0.19184838235378265,
"learning_rate": 0.0003991359448708868,
"loss": 3.4140423583984374,
"step": 4200
},
{
"epoch": 0.055705742606701074,
"grad_norm": 0.20454014837741852,
"learning_rate": 0.00039909623501779634,
"loss": 3.387943115234375,
"step": 4250
},
{
"epoch": 0.05636110428442697,
"grad_norm": 0.19917985796928406,
"learning_rate": 0.000399055635130192,
"loss": 3.39353271484375,
"step": 4300
},
{
"epoch": 0.05701646596215286,
"grad_norm": 0.20870596170425415,
"learning_rate": 0.00039901414538957044,
"loss": 3.3786090087890623,
"step": 4350
},
{
"epoch": 0.057671827639878756,
"grad_norm": 0.2232063114643097,
"learning_rate": 0.00039897176598140626,
"loss": 3.38660400390625,
"step": 4400
},
{
"epoch": 0.05832718931760465,
"grad_norm": 0.21013037860393524,
"learning_rate": 0.0003989284970951512,
"loss": 3.38319580078125,
"step": 4450
},
{
"epoch": 0.05898255099533055,
"grad_norm": 0.20042237639427185,
"learning_rate": 0.0003988843389242334,
"loss": 3.3772076416015624,
"step": 4500
},
{
"epoch": 0.059637912673056445,
"grad_norm": 0.19974368810653687,
"learning_rate": 0.0003988392916660564,
"loss": 3.3711737060546874,
"step": 4550
},
{
"epoch": 0.060293274350782335,
"grad_norm": 0.2119089514017105,
"learning_rate": 0.0003987933555219982,
"loss": 3.36796630859375,
"step": 4600
},
{
"epoch": 0.06094863602850823,
"grad_norm": 0.1994011104106903,
"learning_rate": 0.0003987465306974105,
"loss": 3.359444274902344,
"step": 4650
},
{
"epoch": 0.06160399770623413,
"grad_norm": 0.1967809796333313,
"learning_rate": 0.00039869881740161786,
"loss": 3.3589797973632813,
"step": 4700
},
{
"epoch": 0.062259359383960024,
"grad_norm": 0.19793909788131714,
"learning_rate": 0.0003986502158479164,
"loss": 3.3393264770507813,
"step": 4750
},
{
"epoch": 0.06291472106168591,
"grad_norm": 0.20088161528110504,
"learning_rate": 0.0003986007262535733,
"loss": 3.338782958984375,
"step": 4800
},
{
"epoch": 0.06357008273941181,
"grad_norm": 0.20041196048259735,
"learning_rate": 0.00039855034883982547,
"loss": 3.3399884033203127,
"step": 4850
},
{
"epoch": 0.0642254444171377,
"grad_norm": 0.2128470093011856,
"learning_rate": 0.00039849908383187885,
"loss": 3.3452932739257815,
"step": 4900
},
{
"epoch": 0.0648808060948636,
"grad_norm": 0.1939639002084732,
"learning_rate": 0.000398446931458907,
"loss": 3.3381222534179686,
"step": 4950
},
{
"epoch": 0.0655361677725895,
"grad_norm": 0.2114746868610382,
"learning_rate": 0.00039839389195405075,
"loss": 3.308692626953125,
"step": 5000
},
{
"epoch": 0.0661915294503154,
"grad_norm": 0.19832944869995117,
"learning_rate": 0.00039833996555441626,
"loss": 3.3209320068359376,
"step": 5050
},
{
"epoch": 0.06684689112804129,
"grad_norm": 0.19068177044391632,
"learning_rate": 0.0003982851525010748,
"loss": 3.328127746582031,
"step": 5100
},
{
"epoch": 0.06750225280576719,
"grad_norm": 0.21301378309726715,
"learning_rate": 0.0003982294530390611,
"loss": 3.306401672363281,
"step": 5150
},
{
"epoch": 0.06815761448349308,
"grad_norm": 0.20991812646389008,
"learning_rate": 0.00039817286741737265,
"loss": 3.3046035766601562,
"step": 5200
},
{
"epoch": 0.06881297616121897,
"grad_norm": 0.20005056262016296,
"learning_rate": 0.00039811539588896825,
"loss": 3.3102703857421876,
"step": 5250
},
{
"epoch": 0.06946833783894486,
"grad_norm": 0.21483618021011353,
"learning_rate": 0.00039805703871076707,
"loss": 3.3117401123046877,
"step": 5300
},
{
"epoch": 0.07012369951667076,
"grad_norm": 0.19281916320323944,
"learning_rate": 0.0003979977961436475,
"loss": 3.3061758422851564,
"step": 5350
},
{
"epoch": 0.07077906119439666,
"grad_norm": 0.186942458152771,
"learning_rate": 0.000397937668452446,
"loss": 3.310947265625,
"step": 5400
},
{
"epoch": 0.07143442287212255,
"grad_norm": 0.19823694229125977,
"learning_rate": 0.00039787665590595577,
"loss": 3.2919235229492188,
"step": 5450
},
{
"epoch": 0.07208978454984845,
"grad_norm": 0.2860555052757263,
"learning_rate": 0.00039781475877692565,
"loss": 3.275509033203125,
"step": 5500
},
{
"epoch": 0.07274514622757434,
"grad_norm": 0.19441960752010345,
"learning_rate": 0.0003977519773420589,
"loss": 3.280601806640625,
"step": 5550
},
{
"epoch": 0.07340050790530024,
"grad_norm": 0.20171615481376648,
"learning_rate": 0.000397688311882012,
"loss": 3.285462646484375,
"step": 5600
},
{
"epoch": 0.07405586958302614,
"grad_norm": 0.19068685173988342,
"learning_rate": 0.0003976237626813934,
"loss": 3.288756103515625,
"step": 5650
},
{
"epoch": 0.07471123126075203,
"grad_norm": 0.2156117856502533,
"learning_rate": 0.0003975583300287621,
"loss": 3.267852783203125,
"step": 5700
},
{
"epoch": 0.07536659293847792,
"grad_norm": 0.20415465533733368,
"learning_rate": 0.00039749201421662635,
"loss": 3.2689089965820313,
"step": 5750
},
{
"epoch": 0.07602195461620381,
"grad_norm": 0.2025226503610611,
"learning_rate": 0.00039742481554144276,
"loss": 3.2593511962890624,
"step": 5800
},
{
"epoch": 0.07667731629392971,
"grad_norm": 0.18992702662944794,
"learning_rate": 0.0003973567343036144,
"loss": 3.2599560546875,
"step": 5850
},
{
"epoch": 0.0773326779716556,
"grad_norm": 0.18822775781154633,
"learning_rate": 0.0003972877708074899,
"loss": 3.2602944946289063,
"step": 5900
},
{
"epoch": 0.0779880396493815,
"grad_norm": 0.19722387194633484,
"learning_rate": 0.0003972179253613618,
"loss": 3.260631408691406,
"step": 5950
},
{
"epoch": 0.0786434013271074,
"grad_norm": 0.19092944264411926,
"learning_rate": 0.00039714719827746534,
"loss": 3.2433346557617186,
"step": 6000
},
{
"epoch": 0.0786434013271074,
"eval_loss": 3.1140191555023193,
"eval_runtime": 5.6684,
"eval_samples_per_second": 45.163,
"eval_steps_per_second": 5.645,
"step": 6000
},
{
"epoch": 0.0792987630048333,
"grad_norm": 0.19689856469631195,
"learning_rate": 0.00039707558987197694,
"loss": 3.2530856323242188,
"step": 6050
},
{
"epoch": 0.07995412468255919,
"grad_norm": 0.1850554198026657,
"learning_rate": 0.000397003100465013,
"loss": 3.2497039794921876,
"step": 6100
},
{
"epoch": 0.08060948636028509,
"grad_norm": 0.18944397568702698,
"learning_rate": 0.0003969297303806282,
"loss": 3.234462890625,
"step": 6150
},
{
"epoch": 0.08126484803801098,
"grad_norm": 0.2015562802553177,
"learning_rate": 0.00039685547994681416,
"loss": 3.2522567749023437,
"step": 6200
},
{
"epoch": 0.08192020971573687,
"grad_norm": 0.17497248947620392,
"learning_rate": 0.00039678034949549814,
"loss": 3.2265985107421873,
"step": 6250
},
{
"epoch": 0.08257557139346276,
"grad_norm": 0.19131280481815338,
"learning_rate": 0.0003967043393625412,
"loss": 3.2425271606445314,
"step": 6300
},
{
"epoch": 0.08323093307118866,
"grad_norm": 0.18608218431472778,
"learning_rate": 0.0003966274498877371,
"loss": 3.2364862060546873,
"step": 6350
},
{
"epoch": 0.08388629474891456,
"grad_norm": 0.1833186149597168,
"learning_rate": 0.00039654968141481054,
"loss": 3.21429443359375,
"step": 6400
},
{
"epoch": 0.08454165642664045,
"grad_norm": 0.20810578763484955,
"learning_rate": 0.00039647103429141554,
"loss": 3.2309637451171875,
"step": 6450
},
{
"epoch": 0.08519701810436635,
"grad_norm": 0.17244310677051544,
"learning_rate": 0.0003963915088691342,
"loss": 3.22532470703125,
"step": 6500
},
{
"epoch": 0.08585237978209224,
"grad_norm": 0.1906498372554779,
"learning_rate": 0.0003963111055034747,
"loss": 3.2140386962890624,
"step": 6550
},
{
"epoch": 0.08650774145981814,
"grad_norm": 0.18736179172992706,
"learning_rate": 0.00039622982455387023,
"loss": 3.209306335449219,
"step": 6600
},
{
"epoch": 0.08716310313754404,
"grad_norm": 0.18322816491127014,
"learning_rate": 0.000396147666383677,
"loss": 3.217623596191406,
"step": 6650
},
{
"epoch": 0.08781846481526993,
"grad_norm": 0.20019809901714325,
"learning_rate": 0.00039606463136017265,
"loss": 3.2175857543945314,
"step": 6700
},
{
"epoch": 0.08847382649299582,
"grad_norm": 0.186569482088089,
"learning_rate": 0.0003959807198545547,
"loss": 3.224698486328125,
"step": 6750
},
{
"epoch": 0.08912918817072171,
"grad_norm": 0.1946743130683899,
"learning_rate": 0.0003958959322419391,
"loss": 3.2008099365234375,
"step": 6800
},
{
"epoch": 0.08978454984844761,
"grad_norm": 0.19748519361019135,
"learning_rate": 0.0003958102689013579,
"loss": 3.2152249145507814,
"step": 6850
},
{
"epoch": 0.0904399115261735,
"grad_norm": 0.21013770997524261,
"learning_rate": 0.00039572373021575836,
"loss": 3.2081793212890624,
"step": 6900
},
{
"epoch": 0.0910952732038994,
"grad_norm": 0.1917051523923874,
"learning_rate": 0.0003956363165720007,
"loss": 3.2136236572265626,
"step": 6950
},
{
"epoch": 0.0917506348816253,
"grad_norm": 0.19501028954982758,
"learning_rate": 0.00039554802836085654,
"loss": 3.2055865478515626,
"step": 7000
},
{
"epoch": 0.0924059965593512,
"grad_norm": 0.18697288632392883,
"learning_rate": 0.0003954588659770071,
"loss": 3.208973693847656,
"step": 7050
},
{
"epoch": 0.09306135823707709,
"grad_norm": 0.20416851341724396,
"learning_rate": 0.0003953688298190416,
"loss": 3.195947265625,
"step": 7100
},
{
"epoch": 0.09371671991480299,
"grad_norm": 0.18846778571605682,
"learning_rate": 0.00039527792028945535,
"loss": 3.196394348144531,
"step": 7150
},
{
"epoch": 0.09437208159252888,
"grad_norm": 0.18293488025665283,
"learning_rate": 0.0003951861377946477,
"loss": 3.1826910400390624,
"step": 7200
},
{
"epoch": 0.09502744327025477,
"grad_norm": 0.18307985365390778,
"learning_rate": 0.0003950934827449208,
"loss": 3.190108337402344,
"step": 7250
},
{
"epoch": 0.09568280494798066,
"grad_norm": 0.19038031995296478,
"learning_rate": 0.0003949999555544774,
"loss": 3.1824240112304687,
"step": 7300
},
{
"epoch": 0.09633816662570656,
"grad_norm": 0.18110263347625732,
"learning_rate": 0.00039490555664141875,
"loss": 3.1771340942382813,
"step": 7350
},
{
"epoch": 0.09699352830343246,
"grad_norm": 0.19195981323719025,
"learning_rate": 0.00039481028642774344,
"loss": 3.166077880859375,
"step": 7400
},
{
"epoch": 0.09764888998115835,
"grad_norm": 0.1789332777261734,
"learning_rate": 0.00039471414533934473,
"loss": 3.184651184082031,
"step": 7450
},
{
"epoch": 0.09830425165888425,
"grad_norm": 0.1829993724822998,
"learning_rate": 0.0003946171338060093,
"loss": 3.1751388549804687,
"step": 7500
},
{
"epoch": 0.09895961333661014,
"grad_norm": 0.19253574311733246,
"learning_rate": 0.0003945192522614149,
"loss": 3.1733053588867186,
"step": 7550
},
{
"epoch": 0.09961497501433604,
"grad_norm": 0.18893469870090485,
"learning_rate": 0.0003944205011431286,
"loss": 3.1753680419921877,
"step": 7600
},
{
"epoch": 0.10027033669206194,
"grad_norm": 0.1826004981994629,
"learning_rate": 0.00039432088089260477,
"loss": 3.1660992431640627,
"step": 7650
},
{
"epoch": 0.10092569836978783,
"grad_norm": 0.18192994594573975,
"learning_rate": 0.0003942203919551831,
"loss": 3.1639108276367187,
"step": 7700
},
{
"epoch": 0.10158106004751372,
"grad_norm": 0.18050242960453033,
"learning_rate": 0.00039411903478008665,
"loss": 3.1753009033203123,
"step": 7750
},
{
"epoch": 0.10223642172523961,
"grad_norm": 0.18302783370018005,
"learning_rate": 0.0003940168098204199,
"loss": 3.174813232421875,
"step": 7800
},
{
"epoch": 0.10289178340296551,
"grad_norm": 0.190107062458992,
"learning_rate": 0.00039391371753316653,
"loss": 3.162717590332031,
"step": 7850
},
{
"epoch": 0.1035471450806914,
"grad_norm": 0.19132424890995026,
"learning_rate": 0.00039380975837918753,
"loss": 3.1576858520507813,
"step": 7900
},
{
"epoch": 0.1042025067584173,
"grad_norm": 0.1888846904039383,
"learning_rate": 0.00039370493282321926,
"loss": 3.1505615234375,
"step": 7950
},
{
"epoch": 0.1048578684361432,
"grad_norm": 0.23212771117687225,
"learning_rate": 0.0003935992413338711,
"loss": 3.153447570800781,
"step": 8000
},
{
"epoch": 0.1048578684361432,
"eval_loss": 3.030266284942627,
"eval_runtime": 5.6687,
"eval_samples_per_second": 45.16,
"eval_steps_per_second": 5.645,
"step": 8000
},
{
"epoch": 0.1055132301138691,
"grad_norm": 0.18021260201931,
"learning_rate": 0.0003934926843836233,
"loss": 3.1522039794921874,
"step": 8050
},
{
"epoch": 0.10616859179159499,
"grad_norm": 0.1841682493686676,
"learning_rate": 0.00039338526244882537,
"loss": 3.1465692138671875,
"step": 8100
},
{
"epoch": 0.10682395346932089,
"grad_norm": 0.1825447380542755,
"learning_rate": 0.0003932769760096934,
"loss": 3.140274963378906,
"step": 8150
},
{
"epoch": 0.10747931514704678,
"grad_norm": 0.19171936810016632,
"learning_rate": 0.0003931678255503083,
"loss": 3.1448828125,
"step": 8200
},
{
"epoch": 0.10813467682477267,
"grad_norm": 0.17011715471744537,
"learning_rate": 0.00039305781155861316,
"loss": 3.137694091796875,
"step": 8250
},
{
"epoch": 0.10879003850249856,
"grad_norm": 0.18459941446781158,
"learning_rate": 0.0003929469345264119,
"loss": 3.1533859252929686,
"step": 8300
},
{
"epoch": 0.10944540018022446,
"grad_norm": 0.21103478968143463,
"learning_rate": 0.000392835194949366,
"loss": 3.1345169067382814,
"step": 8350
},
{
"epoch": 0.11010076185795035,
"grad_norm": 0.17616821825504303,
"learning_rate": 0.00039272259332699325,
"loss": 3.133195495605469,
"step": 8400
},
{
"epoch": 0.11075612353567625,
"grad_norm": 0.18857717514038086,
"learning_rate": 0.00039260913016266486,
"loss": 3.14027099609375,
"step": 8450
},
{
"epoch": 0.11141148521340215,
"grad_norm": 0.19104991853237152,
"learning_rate": 0.00039249480596360365,
"loss": 3.1366796875,
"step": 8500
},
{
"epoch": 0.11206684689112804,
"grad_norm": 0.21827660501003265,
"learning_rate": 0.0003923796212408814,
"loss": 3.1296182250976563,
"step": 8550
},
{
"epoch": 0.11272220856885394,
"grad_norm": 0.17744766175746918,
"learning_rate": 0.0003922635765094168,
"loss": 3.1384088134765626,
"step": 8600
},
{
"epoch": 0.11337757024657984,
"grad_norm": 0.1751570999622345,
"learning_rate": 0.0003921466722879732,
"loss": 3.1423275756835936,
"step": 8650
},
{
"epoch": 0.11403293192430572,
"grad_norm": 0.19907452166080475,
"learning_rate": 0.0003920289090991561,
"loss": 3.1503741455078127,
"step": 8700
},
{
"epoch": 0.11468829360203162,
"grad_norm": 0.1859847456216812,
"learning_rate": 0.0003919102874694109,
"loss": 3.1316952514648437,
"step": 8750
},
{
"epoch": 0.11534365527975751,
"grad_norm": 0.20440617203712463,
"learning_rate": 0.0003917908079290206,
"loss": 3.121751708984375,
"step": 8800
},
{
"epoch": 0.11599901695748341,
"grad_norm": 0.18676170706748962,
"learning_rate": 0.00039167047101210334,
"loss": 3.1222894287109373,
"step": 8850
},
{
"epoch": 0.1166543786352093,
"grad_norm": 0.17034347355365753,
"learning_rate": 0.00039154927725661013,
"loss": 3.1269760131835938,
"step": 8900
},
{
"epoch": 0.1173097403129352,
"grad_norm": 0.17997117340564728,
"learning_rate": 0.00039142722720432227,
"loss": 3.108952941894531,
"step": 8950
},
{
"epoch": 0.1179651019906611,
"grad_norm": 0.17934370040893555,
"learning_rate": 0.00039130432140084906,
"loss": 3.1181689453125,
"step": 9000
},
{
"epoch": 0.118620463668387,
"grad_norm": 0.18724671006202698,
"learning_rate": 0.0003911805603956254,
"loss": 3.111900634765625,
"step": 9050
},
{
"epoch": 0.11927582534611289,
"grad_norm": 0.18042142689228058,
"learning_rate": 0.00039105594474190907,
"loss": 3.1231924438476564,
"step": 9100
},
{
"epoch": 0.11993118702383879,
"grad_norm": 0.19561563432216644,
"learning_rate": 0.00039093047499677867,
"loss": 3.1188885498046877,
"step": 9150
},
{
"epoch": 0.12058654870156467,
"grad_norm": 0.1706327497959137,
"learning_rate": 0.0003908041517211308,
"loss": 3.121850891113281,
"step": 9200
},
{
"epoch": 0.12124191037929057,
"grad_norm": 0.1827847957611084,
"learning_rate": 0.0003906769754796777,
"loss": 3.1112911987304686,
"step": 9250
},
{
"epoch": 0.12189727205701646,
"grad_norm": 0.1799037903547287,
"learning_rate": 0.00039054894684094457,
"loss": 3.105826721191406,
"step": 9300
},
{
"epoch": 0.12255263373474236,
"grad_norm": 0.16809692978858948,
"learning_rate": 0.0003904200663772673,
"loss": 3.1074072265625,
"step": 9350
},
{
"epoch": 0.12320799541246825,
"grad_norm": 0.18500255048274994,
"learning_rate": 0.00039029033466478965,
"loss": 3.1086190795898436,
"step": 9400
},
{
"epoch": 0.12386335709019415,
"grad_norm": 0.18889391422271729,
"learning_rate": 0.00039015975228346084,
"loss": 3.114319152832031,
"step": 9450
},
{
"epoch": 0.12451871876792005,
"grad_norm": 0.1791427731513977,
"learning_rate": 0.00039002831981703283,
"loss": 3.1086251831054685,
"step": 9500
},
{
"epoch": 0.12517408044564593,
"grad_norm": 0.17623098194599152,
"learning_rate": 0.0003898960378530579,
"loss": 3.100244445800781,
"step": 9550
},
{
"epoch": 0.12582944212337183,
"grad_norm": 0.17946070432662964,
"learning_rate": 0.0003897629069828858,
"loss": 3.1039193725585936,
"step": 9600
},
{
"epoch": 0.12648480380109772,
"grad_norm": 0.18811431527137756,
"learning_rate": 0.00038962892780166123,
"loss": 3.0974887084960936,
"step": 9650
},
{
"epoch": 0.12714016547882362,
"grad_norm": 0.1763724833726883,
"learning_rate": 0.0003894941009083211,
"loss": 3.09368408203125,
"step": 9700
},
{
"epoch": 0.12779552715654952,
"grad_norm": 0.1800798773765564,
"learning_rate": 0.00038935842690559206,
"loss": 3.090147705078125,
"step": 9750
},
{
"epoch": 0.1284508888342754,
"grad_norm": 0.17083688080310822,
"learning_rate": 0.0003892219063999875,
"loss": 3.0878085327148437,
"step": 9800
},
{
"epoch": 0.1291062505120013,
"grad_norm": 0.1893988847732544,
"learning_rate": 0.00038908454000180503,
"loss": 3.0839697265625,
"step": 9850
},
{
"epoch": 0.1297616121897272,
"grad_norm": 0.18590691685676575,
"learning_rate": 0.00038894632832512386,
"loss": 3.0866567993164065,
"step": 9900
},
{
"epoch": 0.1304169738674531,
"grad_norm": 0.17768535017967224,
"learning_rate": 0.00038880727198780166,
"loss": 3.09480224609375,
"step": 9950
},
{
"epoch": 0.131072335545179,
"grad_norm": 0.17305518686771393,
"learning_rate": 0.00038866737161147226,
"loss": 3.089879455566406,
"step": 10000
},
{
"epoch": 0.131072335545179,
"eval_loss": 2.964634895324707,
"eval_runtime": 5.6793,
"eval_samples_per_second": 45.076,
"eval_steps_per_second": 5.634,
"step": 10000
},
{
"epoch": 0.1317276972229049,
"grad_norm": 0.17475514113903046,
"learning_rate": 0.00038852662782154257,
"loss": 3.083099365234375,
"step": 10050
},
{
"epoch": 0.1323830589006308,
"grad_norm": 0.1707238256931305,
"learning_rate": 0.0003883850412471899,
"loss": 3.09041259765625,
"step": 10100
},
{
"epoch": 0.1330384205783567,
"grad_norm": 0.17580024898052216,
"learning_rate": 0.00038824261252135906,
"loss": 3.0782601928710935,
"step": 10150
},
{
"epoch": 0.13369378225608258,
"grad_norm": 0.181544229388237,
"learning_rate": 0.00038809934228075966,
"loss": 3.0771636962890625,
"step": 10200
},
{
"epoch": 0.13434914393380848,
"grad_norm": 0.18768192827701569,
"learning_rate": 0.0003879552311658632,
"loss": 3.0775961303710937,
"step": 10250
},
{
"epoch": 0.13500450561153438,
"grad_norm": 0.17648795247077942,
"learning_rate": 0.00038781027982090016,
"loss": 3.075372619628906,
"step": 10300
},
{
"epoch": 0.13565986728926027,
"grad_norm": 0.17668746411800385,
"learning_rate": 0.0003876644888938571,
"loss": 3.0861465454101564,
"step": 10350
},
{
"epoch": 0.13631522896698617,
"grad_norm": 0.17767569422721863,
"learning_rate": 0.00038751785903647404,
"loss": 3.078529968261719,
"step": 10400
},
{
"epoch": 0.13697059064471204,
"grad_norm": 0.17861232161521912,
"learning_rate": 0.0003873703909042411,
"loss": 3.06550537109375,
"step": 10450
},
{
"epoch": 0.13762595232243793,
"grad_norm": 0.17755211889743805,
"learning_rate": 0.00038722208515639593,
"loss": 3.08282958984375,
"step": 10500
},
{
"epoch": 0.13828131400016383,
"grad_norm": 0.16997002065181732,
"learning_rate": 0.0003870729424559206,
"loss": 3.0684124755859377,
"step": 10550
},
{
"epoch": 0.13893667567788973,
"grad_norm": 0.1739063411951065,
"learning_rate": 0.0003869229634695387,
"loss": 3.0850872802734375,
"step": 10600
},
{
"epoch": 0.13959203735561562,
"grad_norm": 0.18006552755832672,
"learning_rate": 0.00038677214886771223,
"loss": 3.077156982421875,
"step": 10650
},
{
"epoch": 0.14024739903334152,
"grad_norm": 0.19680453836917877,
"learning_rate": 0.00038662049932463883,
"loss": 3.0760400390625,
"step": 10700
},
{
"epoch": 0.14090276071106742,
"grad_norm": 0.17581500113010406,
"learning_rate": 0.0003864680155182485,
"loss": 3.081645202636719,
"step": 10750
},
{
"epoch": 0.1415581223887933,
"grad_norm": 0.16959214210510254,
"learning_rate": 0.0003863146981302009,
"loss": 3.0582818603515625,
"step": 10800
},
{
"epoch": 0.1422134840665192,
"grad_norm": 0.18207167088985443,
"learning_rate": 0.000386160547845882,
"loss": 3.072328796386719,
"step": 10850
},
{
"epoch": 0.1428688457442451,
"grad_norm": 0.17250484228134155,
"learning_rate": 0.00038600556535440107,
"loss": 3.06542236328125,
"step": 10900
},
{
"epoch": 0.143524207421971,
"grad_norm": 0.1710938960313797,
"learning_rate": 0.00038584975134858774,
"loss": 3.0559844970703125,
"step": 10950
},
{
"epoch": 0.1441795690996969,
"grad_norm": 0.18157102167606354,
"learning_rate": 0.0003856931065249888,
"loss": 3.0589913940429687,
"step": 11000
},
{
"epoch": 0.1448349307774228,
"grad_norm": 0.1723930984735489,
"learning_rate": 0.0003855356315838651,
"loss": 3.071495361328125,
"step": 11050
},
{
"epoch": 0.1454902924551487,
"grad_norm": 0.16851253807544708,
"learning_rate": 0.00038537732722918847,
"loss": 3.056437683105469,
"step": 11100
},
{
"epoch": 0.1461456541328746,
"grad_norm": 0.17625807225704193,
"learning_rate": 0.0003852181941686384,
"loss": 3.047527160644531,
"step": 11150
},
{
"epoch": 0.14680101581060048,
"grad_norm": 0.20426708459854126,
"learning_rate": 0.0003850582331135992,
"loss": 3.057506103515625,
"step": 11200
},
{
"epoch": 0.14745637748832638,
"grad_norm": 0.16924306750297546,
"learning_rate": 0.0003848974447791564,
"loss": 3.0567062377929686,
"step": 11250
},
{
"epoch": 0.14811173916605228,
"grad_norm": 0.17206047475337982,
"learning_rate": 0.00038473582988409393,
"loss": 3.0577032470703127,
"step": 11300
},
{
"epoch": 0.14876710084377817,
"grad_norm": 0.17455650866031647,
"learning_rate": 0.00038457338915089085,
"loss": 3.052936706542969,
"step": 11350
},
{
"epoch": 0.14942246252150407,
"grad_norm": 0.1741814911365509,
"learning_rate": 0.00038441012330571765,
"loss": 3.057178649902344,
"step": 11400
},
{
"epoch": 0.15007782419922994,
"grad_norm": 0.17035724222660065,
"learning_rate": 0.00038424603307843385,
"loss": 3.0449142456054688,
"step": 11450
},
{
"epoch": 0.15073318587695583,
"grad_norm": 0.1668204665184021,
"learning_rate": 0.00038408111920258393,
"loss": 3.07284912109375,
"step": 11500
},
{
"epoch": 0.15138854755468173,
"grad_norm": 0.17877808213233948,
"learning_rate": 0.00038391538241539446,
"loss": 3.0634539794921873,
"step": 11550
},
{
"epoch": 0.15204390923240763,
"grad_norm": 0.17286644876003265,
"learning_rate": 0.0003837488234577709,
"loss": 3.0476004028320314,
"step": 11600
},
{
"epoch": 0.15269927091013352,
"grad_norm": 0.19057217240333557,
"learning_rate": 0.00038358144307429386,
"loss": 3.0427459716796874,
"step": 11650
},
{
"epoch": 0.15335463258785942,
"grad_norm": 0.18744225800037384,
"learning_rate": 0.00038341324201321615,
"loss": 3.0610775756835937,
"step": 11700
},
{
"epoch": 0.15400999426558531,
"grad_norm": 0.18148574233055115,
"learning_rate": 0.0003832442210264594,
"loss": 3.0462969970703124,
"step": 11750
},
{
"epoch": 0.1546653559433112,
"grad_norm": 0.1851021647453308,
"learning_rate": 0.00038307438086961044,
"loss": 3.0692657470703124,
"step": 11800
},
{
"epoch": 0.1553207176210371,
"grad_norm": 0.1772390455007553,
"learning_rate": 0.00038290372230191834,
"loss": 3.0441015625,
"step": 11850
},
{
"epoch": 0.155976079298763,
"grad_norm": 0.1643557995557785,
"learning_rate": 0.00038273224608629045,
"loss": 3.0395452880859377,
"step": 11900
},
{
"epoch": 0.1566314409764889,
"grad_norm": 0.17523615062236786,
"learning_rate": 0.00038255995298928957,
"loss": 3.0324087524414063,
"step": 11950
},
{
"epoch": 0.1572868026542148,
"grad_norm": 0.1734519898891449,
"learning_rate": 0.0003823868437811302,
"loss": 3.035924987792969,
"step": 12000
},
{
"epoch": 0.1572868026542148,
"eval_loss": 2.9189553260803223,
"eval_runtime": 5.6766,
"eval_samples_per_second": 45.098,
"eval_steps_per_second": 5.637,
"step": 12000
},
{
"epoch": 0.1579421643319407,
"grad_norm": 0.16464713215827942,
"learning_rate": 0.00038221291923567515,
"loss": 3.0323388671875,
"step": 12050
},
{
"epoch": 0.1585975260096666,
"grad_norm": 0.17450423538684845,
"learning_rate": 0.00038203818013043196,
"loss": 3.03869384765625,
"step": 12100
},
{
"epoch": 0.15925288768739249,
"grad_norm": 0.18363073468208313,
"learning_rate": 0.00038186262724654985,
"loss": 3.0385845947265624,
"step": 12150
},
{
"epoch": 0.15990824936511838,
"grad_norm": 0.17136621475219727,
"learning_rate": 0.0003816862613688156,
"loss": 3.037435302734375,
"step": 12200
},
{
"epoch": 0.16056361104284428,
"grad_norm": 0.17278067767620087,
"learning_rate": 0.0003815090832856506,
"loss": 3.0334677124023437,
"step": 12250
},
{
"epoch": 0.16121897272057018,
"grad_norm": 0.18040911853313446,
"learning_rate": 0.0003813310937891072,
"loss": 3.051009521484375,
"step": 12300
},
{
"epoch": 0.16187433439829607,
"grad_norm": 0.1648985892534256,
"learning_rate": 0.0003811522936748646,
"loss": 3.0288815307617187,
"step": 12350
},
{
"epoch": 0.16252969607602197,
"grad_norm": 0.17963039875030518,
"learning_rate": 0.00038097268374222634,
"loss": 3.044788513183594,
"step": 12400
},
{
"epoch": 0.16318505775374784,
"grad_norm": 0.1665796935558319,
"learning_rate": 0.00038079226479411575,
"loss": 3.0326351928710937,
"step": 12450
},
{
"epoch": 0.16384041943147373,
"grad_norm": 0.17408335208892822,
"learning_rate": 0.000380611037637073,
"loss": 3.025340270996094,
"step": 12500
},
{
"epoch": 0.16449578110919963,
"grad_norm": 0.1731732189655304,
"learning_rate": 0.000380429003081251,
"loss": 3.0255218505859376,
"step": 12550
},
{
"epoch": 0.16515114278692553,
"grad_norm": 0.16398881375789642,
"learning_rate": 0.0003802461619404123,
"loss": 3.0350070190429688,
"step": 12600
},
{
"epoch": 0.16580650446465142,
"grad_norm": 0.1704774647951126,
"learning_rate": 0.00038006251503192506,
"loss": 3.02690673828125,
"step": 12650
},
{
"epoch": 0.16646186614237732,
"grad_norm": 0.17014211416244507,
"learning_rate": 0.0003798780631767595,
"loss": 3.0244546508789063,
"step": 12700
},
{
"epoch": 0.16711722782010321,
"grad_norm": 0.1683683842420578,
"learning_rate": 0.00037969280719948433,
"loss": 3.022377624511719,
"step": 12750
},
{
"epoch": 0.1677725894978291,
"grad_norm": 0.1796732097864151,
"learning_rate": 0.00037950674792826294,
"loss": 3.027694091796875,
"step": 12800
},
{
"epoch": 0.168427951175555,
"grad_norm": 0.16469725966453552,
"learning_rate": 0.00037931988619484974,
"loss": 3.0360150146484375,
"step": 12850
},
{
"epoch": 0.1690833128532809,
"grad_norm": 0.1586015522480011,
"learning_rate": 0.0003791322228345864,
"loss": 3.0196652221679687,
"step": 12900
},
{
"epoch": 0.1697386745310068,
"grad_norm": 0.18051502108573914,
"learning_rate": 0.00037894375868639834,
"loss": 3.0329571533203126,
"step": 12950
},
{
"epoch": 0.1703940362087327,
"grad_norm": 0.16774311661720276,
"learning_rate": 0.0003787544945927906,
"loss": 3.0260247802734375,
"step": 13000
},
{
"epoch": 0.1710493978864586,
"grad_norm": 0.17393845319747925,
"learning_rate": 0.00037856443139984425,
"loss": 3.035395202636719,
"step": 13050
},
{
"epoch": 0.1717047595641845,
"grad_norm": 0.17306984961032867,
"learning_rate": 0.00037837356995721287,
"loss": 3.0191970825195313,
"step": 13100
},
{
"epoch": 0.17236012124191039,
"grad_norm": 0.1667943298816681,
"learning_rate": 0.0003781819111181184,
"loss": 3.0191571044921877,
"step": 13150
},
{
"epoch": 0.17301548291963628,
"grad_norm": 0.16538003087043762,
"learning_rate": 0.00037798945573934726,
"loss": 3.014737243652344,
"step": 13200
},
{
"epoch": 0.17367084459736218,
"grad_norm": 0.1665930300951004,
"learning_rate": 0.000377796204681247,
"loss": 3.0187252807617186,
"step": 13250
},
{
"epoch": 0.17432620627508807,
"grad_norm": 0.1760169267654419,
"learning_rate": 0.00037760215880772196,
"loss": 3.016280517578125,
"step": 13300
},
{
"epoch": 0.17498156795281397,
"grad_norm": 0.16998058557510376,
"learning_rate": 0.0003774073189862297,
"loss": 3.01614990234375,
"step": 13350
},
{
"epoch": 0.17563692963053987,
"grad_norm": 0.18504323065280914,
"learning_rate": 0.0003772116860877769,
"loss": 3.0107766723632814,
"step": 13400
},
{
"epoch": 0.17629229130826574,
"grad_norm": 0.18150901794433594,
"learning_rate": 0.00037701526098691564,
"loss": 3.0088739013671875,
"step": 13450
},
{
"epoch": 0.17694765298599163,
"grad_norm": 0.17311416566371918,
"learning_rate": 0.00037681804456173956,
"loss": 3.0030789184570312,
"step": 13500
},
{
"epoch": 0.17760301466371753,
"grad_norm": 0.1601880043745041,
"learning_rate": 0.0003766200376938797,
"loss": 3.0118267822265623,
"step": 13550
},
{
"epoch": 0.17825837634144343,
"grad_norm": 0.16208156943321228,
"learning_rate": 0.00037642124126850067,
"loss": 3.01557373046875,
"step": 13600
},
{
"epoch": 0.17891373801916932,
"grad_norm": 0.1766621470451355,
"learning_rate": 0.00037622165617429674,
"loss": 3.006506042480469,
"step": 13650
},
{
"epoch": 0.17956909969689522,
"grad_norm": 0.16724593937397003,
"learning_rate": 0.0003760212833034878,
"loss": 3.0231564331054686,
"step": 13700
},
{
"epoch": 0.18022446137462111,
"grad_norm": 0.1700139045715332,
"learning_rate": 0.0003758201235518154,
"loss": 3.0107156372070314,
"step": 13750
},
{
"epoch": 0.180879823052347,
"grad_norm": 0.17110072076320648,
"learning_rate": 0.00037561817781853874,
"loss": 3.00603515625,
"step": 13800
},
{
"epoch": 0.1815351847300729,
"grad_norm": 0.17613136768341064,
"learning_rate": 0.00037541544700643066,
"loss": 2.9850637817382815,
"step": 13850
},
{
"epoch": 0.1821905464077988,
"grad_norm": 0.18742725253105164,
"learning_rate": 0.0003752119320217736,
"loss": 2.994374084472656,
"step": 13900
},
{
"epoch": 0.1828459080855247,
"grad_norm": 0.161526620388031,
"learning_rate": 0.0003750076337743555,
"loss": 2.9907281494140623,
"step": 13950
},
{
"epoch": 0.1835012697632506,
"grad_norm": 0.16326123476028442,
"learning_rate": 0.00037480255317746595,
"loss": 2.9954653930664064,
"step": 14000
},
{
"epoch": 0.1835012697632506,
"eval_loss": 2.889880657196045,
"eval_runtime": 5.6697,
"eval_samples_per_second": 45.152,
"eval_steps_per_second": 5.644,
"step": 14000
},
{
"epoch": 0.1841566314409765,
"grad_norm": 0.1709296703338623,
"learning_rate": 0.00037459669114789157,
"loss": 3.005021667480469,
"step": 14050
},
{
"epoch": 0.1848119931187024,
"grad_norm": 0.17104662954807281,
"learning_rate": 0.00037439004860591264,
"loss": 3.006434326171875,
"step": 14100
},
{
"epoch": 0.18546735479642829,
"grad_norm": 0.1657409965991974,
"learning_rate": 0.0003741826264752985,
"loss": 2.998061218261719,
"step": 14150
},
{
"epoch": 0.18612271647415418,
"grad_norm": 0.16134639084339142,
"learning_rate": 0.0003739744256833034,
"loss": 3.0036053466796875,
"step": 14200
},
{
"epoch": 0.18677807815188008,
"grad_norm": 0.16234835982322693,
"learning_rate": 0.0003737654471606628,
"loss": 3.000784606933594,
"step": 14250
},
{
"epoch": 0.18743343982960597,
"grad_norm": 0.1607351154088974,
"learning_rate": 0.00037355569184158865,
"loss": 2.99138427734375,
"step": 14300
},
{
"epoch": 0.18808880150733187,
"grad_norm": 0.16982115805149078,
"learning_rate": 0.0003733451606637655,
"loss": 2.998489990234375,
"step": 14350
},
{
"epoch": 0.18874416318505777,
"grad_norm": 0.17614851891994476,
"learning_rate": 0.0003731338545683464,
"loss": 2.997017822265625,
"step": 14400
},
{
"epoch": 0.18939952486278364,
"grad_norm": 0.16362133622169495,
"learning_rate": 0.0003729217744999484,
"loss": 2.994207763671875,
"step": 14450
},
{
"epoch": 0.19005488654050953,
"grad_norm": 0.19033735990524292,
"learning_rate": 0.0003727089214066487,
"loss": 2.995988464355469,
"step": 14500
},
{
"epoch": 0.19071024821823543,
"grad_norm": 0.1774059385061264,
"learning_rate": 0.0003724952962399801,
"loss": 3.0040826416015625,
"step": 14550
},
{
"epoch": 0.19136560989596132,
"grad_norm": 0.166715607047081,
"learning_rate": 0.00037228089995492683,
"loss": 3.0081997680664063,
"step": 14600
},
{
"epoch": 0.19202097157368722,
"grad_norm": 0.17395304143428802,
"learning_rate": 0.0003720657335099203,
"loss": 2.9944384765625,
"step": 14650
},
{
"epoch": 0.19267633325141312,
"grad_norm": 0.16293704509735107,
"learning_rate": 0.000371849797866835,
"loss": 2.989776611328125,
"step": 14700
},
{
"epoch": 0.19333169492913901,
"grad_norm": 0.17767402529716492,
"learning_rate": 0.00037163309399098374,
"loss": 2.9949606323242186,
"step": 14750
},
{
"epoch": 0.1939870566068649,
"grad_norm": 0.17059318721294403,
"learning_rate": 0.00037141562285111383,
"loss": 2.9945269775390626,
"step": 14800
},
{
"epoch": 0.1946424182845908,
"grad_norm": 0.1627851277589798,
"learning_rate": 0.0003711973854194025,
"loss": 3.0009130859375,
"step": 14850
},
{
"epoch": 0.1952977799623167,
"grad_norm": 0.17671069502830505,
"learning_rate": 0.0003709783826714524,
"loss": 2.9911029052734377,
"step": 14900
},
{
"epoch": 0.1959531416400426,
"grad_norm": 0.17029069364070892,
"learning_rate": 0.00037075861558628773,
"loss": 2.9930645751953127,
"step": 14950
},
{
"epoch": 0.1966085033177685,
"grad_norm": 0.16299958527088165,
"learning_rate": 0.0003705380851463495,
"loss": 2.9891592407226564,
"step": 15000
},
{
"epoch": 0.1972638649954944,
"grad_norm": 0.16672609746456146,
"learning_rate": 0.00037031679233749096,
"loss": 2.992725830078125,
"step": 15050
},
{
"epoch": 0.1979192266732203,
"grad_norm": 0.16228234767913818,
"learning_rate": 0.0003700947381489737,
"loss": 2.98245849609375,
"step": 15100
},
{
"epoch": 0.19857458835094619,
"grad_norm": 0.16550038754940033,
"learning_rate": 0.0003698719235734628,
"loss": 2.9848651123046874,
"step": 15150
},
{
"epoch": 0.19922995002867208,
"grad_norm": 0.161213219165802,
"learning_rate": 0.0003696483496070226,
"loss": 2.97513427734375,
"step": 15200
},
{
"epoch": 0.19988531170639798,
"grad_norm": 0.17817705869674683,
"learning_rate": 0.00036942401724911233,
"loss": 2.994375,
"step": 15250
},
{
"epoch": 0.20054067338412387,
"grad_norm": 0.16282308101654053,
"learning_rate": 0.00036919892750258125,
"loss": 2.9792022705078125,
"step": 15300
},
{
"epoch": 0.20119603506184977,
"grad_norm": 0.1685405969619751,
"learning_rate": 0.0003689730813736646,
"loss": 2.9886865234375,
"step": 15350
},
{
"epoch": 0.20185139673957567,
"grad_norm": 0.16668137907981873,
"learning_rate": 0.00036874647987197905,
"loss": 2.987052307128906,
"step": 15400
},
{
"epoch": 0.20250675841730154,
"grad_norm": 0.17567269504070282,
"learning_rate": 0.00036851912401051777,
"loss": 2.980907287597656,
"step": 15450
},
{
"epoch": 0.20316212009502743,
"grad_norm": 0.1649779975414276,
"learning_rate": 0.00036829101480564643,
"loss": 2.9836410522460937,
"step": 15500
},
{
"epoch": 0.20381748177275333,
"grad_norm": 0.1699378341436386,
"learning_rate": 0.0003680621532770983,
"loss": 2.9875668334960936,
"step": 15550
},
{
"epoch": 0.20447284345047922,
"grad_norm": 0.17719361186027527,
"learning_rate": 0.00036783254044796997,
"loss": 2.972999267578125,
"step": 15600
},
{
"epoch": 0.20512820512820512,
"grad_norm": 0.1705351024866104,
"learning_rate": 0.00036760217734471635,
"loss": 2.9795477294921877,
"step": 15650
},
{
"epoch": 0.20578356680593102,
"grad_norm": 0.16368424892425537,
"learning_rate": 0.0003673710649971468,
"loss": 2.9701177978515627,
"step": 15700
},
{
"epoch": 0.2064389284836569,
"grad_norm": 0.16247059404850006,
"learning_rate": 0.00036713920443841953,
"loss": 2.970295715332031,
"step": 15750
},
{
"epoch": 0.2070942901613828,
"grad_norm": 0.17079515755176544,
"learning_rate": 0.00036690659670503793,
"loss": 2.9753347778320314,
"step": 15800
},
{
"epoch": 0.2077496518391087,
"grad_norm": 0.16564437747001648,
"learning_rate": 0.0003666732428368455,
"loss": 2.980135803222656,
"step": 15850
},
{
"epoch": 0.2084050135168346,
"grad_norm": 0.16519832611083984,
"learning_rate": 0.000366439143877021,
"loss": 2.9655020141601565,
"step": 15900
},
{
"epoch": 0.2090603751945605,
"grad_norm": 0.17662176489830017,
"learning_rate": 0.0003662043008720744,
"loss": 2.972510986328125,
"step": 15950
},
{
"epoch": 0.2097157368722864,
"grad_norm": 0.1710946410894394,
"learning_rate": 0.00036596871487184145,
"loss": 2.981545104980469,
"step": 16000
},
{
"epoch": 0.2097157368722864,
"eval_loss": 2.853026866912842,
"eval_runtime": 5.6866,
"eval_samples_per_second": 45.018,
"eval_steps_per_second": 5.627,
"step": 16000
},
{
"epoch": 0.2103710985500123,
"grad_norm": 0.17311525344848633,
"learning_rate": 0.00036573238692947963,
"loss": 2.9721026611328125,
"step": 16050
},
{
"epoch": 0.2110264602277382,
"grad_norm": 0.17193837463855743,
"learning_rate": 0.0003654953181014631,
"loss": 2.9612271118164064,
"step": 16100
},
{
"epoch": 0.21168182190546408,
"grad_norm": 0.15974758565425873,
"learning_rate": 0.0003652575094475779,
"loss": 2.964639892578125,
"step": 16150
},
{
"epoch": 0.21233718358318998,
"grad_norm": 0.16985274851322174,
"learning_rate": 0.00036501896203091765,
"loss": 2.971280212402344,
"step": 16200
},
{
"epoch": 0.21299254526091588,
"grad_norm": 0.17480714619159698,
"learning_rate": 0.00036477967691787844,
"loss": 2.9641796875,
"step": 16250
},
{
"epoch": 0.21364790693864177,
"grad_norm": 0.17796620726585388,
"learning_rate": 0.0003645396551781539,
"loss": 2.967604675292969,
"step": 16300
},
{
"epoch": 0.21430326861636767,
"grad_norm": 0.17216642200946808,
"learning_rate": 0.0003642988978847309,
"loss": 2.9698138427734375,
"step": 16350
},
{
"epoch": 0.21495863029409357,
"grad_norm": 0.17040376365184784,
"learning_rate": 0.00036405740611388453,
"loss": 2.9496453857421874,
"step": 16400
},
{
"epoch": 0.21561399197181944,
"grad_norm": 0.17587760090827942,
"learning_rate": 0.00036381518094517304,
"loss": 2.976742858886719,
"step": 16450
},
{
"epoch": 0.21626935364954533,
"grad_norm": 0.16672401130199432,
"learning_rate": 0.0003635722234614335,
"loss": 2.9690167236328127,
"step": 16500
},
{
"epoch": 0.21692471532727123,
"grad_norm": 0.18230868875980377,
"learning_rate": 0.00036332853474877646,
"loss": 2.9572824096679686,
"step": 16550
},
{
"epoch": 0.21758007700499712,
"grad_norm": 0.16422739624977112,
"learning_rate": 0.0003630841158965816,
"loss": 2.9669424438476564,
"step": 16600
},
{
"epoch": 0.21823543868272302,
"grad_norm": 0.1664307862520218,
"learning_rate": 0.0003628389679974923,
"loss": 2.971185302734375,
"step": 16650
},
{
"epoch": 0.21889080036044892,
"grad_norm": 0.16268014907836914,
"learning_rate": 0.00036259309214741137,
"loss": 2.9690753173828126,
"step": 16700
},
{
"epoch": 0.2195461620381748,
"grad_norm": 0.16984225809574127,
"learning_rate": 0.00036234648944549557,
"loss": 2.9561288452148435,
"step": 16750
},
{
"epoch": 0.2202015237159007,
"grad_norm": 0.1729847639799118,
"learning_rate": 0.00036209916099415107,
"loss": 2.9591754150390623,
"step": 16800
},
{
"epoch": 0.2208568853936266,
"grad_norm": 0.1633663773536682,
"learning_rate": 0.00036185110789902847,
"loss": 2.9606512451171874,
"step": 16850
},
{
"epoch": 0.2215122470713525,
"grad_norm": 0.16496390104293823,
"learning_rate": 0.0003616023312690176,
"loss": 2.9580755615234375,
"step": 16900
},
{
"epoch": 0.2221676087490784,
"grad_norm": 0.16967622935771942,
"learning_rate": 0.00036135283221624297,
"loss": 2.9615908813476564,
"step": 16950
},
{
"epoch": 0.2228229704268043,
"grad_norm": 0.16690337657928467,
"learning_rate": 0.0003611026118560585,
"loss": 2.967689208984375,
"step": 17000
},
{
"epoch": 0.2234783321045302,
"grad_norm": 0.1804627776145935,
"learning_rate": 0.00036085167130704265,
"loss": 2.9619107055664062,
"step": 17050
},
{
"epoch": 0.2241336937822561,
"grad_norm": 0.16530460119247437,
"learning_rate": 0.0003606000116909934,
"loss": 2.947933349609375,
"step": 17100
},
{
"epoch": 0.22478905545998198,
"grad_norm": 0.1713293045759201,
"learning_rate": 0.00036034763413292316,
"loss": 2.953694152832031,
"step": 17150
},
{
"epoch": 0.22544441713770788,
"grad_norm": 0.19740426540374756,
"learning_rate": 0.00036009453976105387,
"loss": 2.953554992675781,
"step": 17200
},
{
"epoch": 0.22609977881543378,
"grad_norm": 0.17386682331562042,
"learning_rate": 0.00035984072970681184,
"loss": 2.962462158203125,
"step": 17250
},
{
"epoch": 0.22675514049315967,
"grad_norm": 0.16382843255996704,
"learning_rate": 0.0003595862051048229,
"loss": 2.952059631347656,
"step": 17300
},
{
"epoch": 0.22741050217088557,
"grad_norm": 0.16030673682689667,
"learning_rate": 0.0003593309670929069,
"loss": 2.9529986572265625,
"step": 17350
},
{
"epoch": 0.22806586384861144,
"grad_norm": 0.16156207025051117,
"learning_rate": 0.00035907501681207315,
"loss": 2.966947326660156,
"step": 17400
},
{
"epoch": 0.22872122552633734,
"grad_norm": 0.16727951169013977,
"learning_rate": 0.00035881835540651493,
"loss": 2.944144592285156,
"step": 17450
},
{
"epoch": 0.22937658720406323,
"grad_norm": 0.1671253740787506,
"learning_rate": 0.0003585609840236047,
"loss": 2.9477142333984374,
"step": 17500
},
{
"epoch": 0.23003194888178913,
"grad_norm": 0.16537418961524963,
"learning_rate": 0.0003583029038138885,
"loss": 2.9334161376953123,
"step": 17550
},
{
"epoch": 0.23068731055951502,
"grad_norm": 0.17597432434558868,
"learning_rate": 0.0003580441159310812,
"loss": 2.9473776245117187,
"step": 17600
},
{
"epoch": 0.23134267223724092,
"grad_norm": 0.1576494574546814,
"learning_rate": 0.00035778462153206143,
"loss": 2.9393209838867187,
"step": 17650
},
{
"epoch": 0.23199803391496682,
"grad_norm": 0.16597570478916168,
"learning_rate": 0.000357524421776866,
"loss": 2.9506546020507813,
"step": 17700
},
{
"epoch": 0.2326533955926927,
"grad_norm": 0.1723046600818634,
"learning_rate": 0.00035726351782868485,
"loss": 2.9406094360351562,
"step": 17750
},
{
"epoch": 0.2333087572704186,
"grad_norm": 0.1716579645872116,
"learning_rate": 0.0003570019108538562,
"loss": 2.9499716186523437,
"step": 17800
},
{
"epoch": 0.2339641189481445,
"grad_norm": 0.15708179771900177,
"learning_rate": 0.00035673960202186087,
"loss": 2.9578228759765626,
"step": 17850
},
{
"epoch": 0.2346194806258704,
"grad_norm": 0.16328568756580353,
"learning_rate": 0.00035647659250531726,
"loss": 2.95954345703125,
"step": 17900
},
{
"epoch": 0.2352748423035963,
"grad_norm": 0.16919036209583282,
"learning_rate": 0.00035621288347997615,
"loss": 2.9405422973632813,
"step": 17950
},
{
"epoch": 0.2359302039813222,
"grad_norm": 0.16000254452228546,
"learning_rate": 0.0003559484761247153,
"loss": 2.9441262817382814,
"step": 18000
},
{
"epoch": 0.2359302039813222,
"eval_loss": 2.8356666564941406,
"eval_runtime": 5.6169,
"eval_samples_per_second": 45.577,
"eval_steps_per_second": 5.697,
"step": 18000
},
{
"epoch": 0.2365855656590481,
"grad_norm": 0.15846964716911316,
"learning_rate": 0.00035568337162153436,
"loss": 2.94470947265625,
"step": 18050
},
{
"epoch": 0.237240927336774,
"grad_norm": 0.17656207084655762,
"learning_rate": 0.0003554175711555494,
"loss": 2.955001220703125,
"step": 18100
},
{
"epoch": 0.23789628901449988,
"grad_norm": 0.18552245199680328,
"learning_rate": 0.00035515107591498784,
"loss": 2.94719482421875,
"step": 18150
},
{
"epoch": 0.23855165069222578,
"grad_norm": 0.16341136395931244,
"learning_rate": 0.0003548838870911829,
"loss": 2.9372512817382814,
"step": 18200
},
{
"epoch": 0.23920701236995168,
"grad_norm": 0.17305275797843933,
"learning_rate": 0.00035461600587856834,
"loss": 2.945079345703125,
"step": 18250
},
{
"epoch": 0.23986237404767757,
"grad_norm": 0.16552510857582092,
"learning_rate": 0.00035434743347467323,
"loss": 2.937655334472656,
"step": 18300
},
{
"epoch": 0.24051773572540347,
"grad_norm": 0.1825156956911087,
"learning_rate": 0.00035407817108011657,
"loss": 2.937855224609375,
"step": 18350
},
{
"epoch": 0.24117309740312934,
"grad_norm": 0.17092622816562653,
"learning_rate": 0.00035380821989860166,
"loss": 2.9338644409179686,
"step": 18400
},
{
"epoch": 0.24182845908085523,
"grad_norm": 0.16524964570999146,
"learning_rate": 0.0003535375811369112,
"loss": 2.9492312622070314,
"step": 18450
},
{
"epoch": 0.24248382075858113,
"grad_norm": 0.1624523550271988,
"learning_rate": 0.00035326625600490144,
"loss": 2.932850646972656,
"step": 18500
},
{
"epoch": 0.24313918243630703,
"grad_norm": 0.18123026192188263,
"learning_rate": 0.00035299424571549713,
"loss": 2.9296615600585936,
"step": 18550
},
{
"epoch": 0.24379454411403292,
"grad_norm": 0.16326972842216492,
"learning_rate": 0.00035272155148468573,
"loss": 2.943739318847656,
"step": 18600
},
{
"epoch": 0.24444990579175882,
"grad_norm": 0.16651879251003265,
"learning_rate": 0.00035244817453151234,
"loss": 2.9403271484375,
"step": 18650
},
{
"epoch": 0.24510526746948472,
"grad_norm": 0.16745640337467194,
"learning_rate": 0.000352174116078074,
"loss": 2.9465298461914062,
"step": 18700
},
{
"epoch": 0.2457606291472106,
"grad_norm": 0.1711357980966568,
"learning_rate": 0.00035189937734951435,
"loss": 2.9347296142578125,
"step": 18750
},
{
"epoch": 0.2464159908249365,
"grad_norm": 0.17086179554462433,
"learning_rate": 0.0003516239595740181,
"loss": 2.943296203613281,
"step": 18800
},
{
"epoch": 0.2470713525026624,
"grad_norm": 0.1674569994211197,
"learning_rate": 0.0003513478639828055,
"loss": 2.940770568847656,
"step": 18850
},
{
"epoch": 0.2477267141803883,
"grad_norm": 0.1676352471113205,
"learning_rate": 0.00035107109181012694,
"loss": 2.932267761230469,
"step": 18900
},
{
"epoch": 0.2483820758581142,
"grad_norm": 0.16538666188716888,
"learning_rate": 0.00035079364429325743,
"loss": 2.930003356933594,
"step": 18950
},
{
"epoch": 0.2490374375358401,
"grad_norm": 0.16590271890163422,
"learning_rate": 0.00035051552267249093,
"loss": 2.917630920410156,
"step": 19000
},
{
"epoch": 0.249692799213566,
"grad_norm": 0.162932351231575,
"learning_rate": 0.00035023672819113497,
"loss": 2.9294354248046877,
"step": 19050
},
{
"epoch": 0.25034816089129186,
"grad_norm": 0.1639566868543625,
"learning_rate": 0.00034995726209550494,
"loss": 2.919949645996094,
"step": 19100
},
{
"epoch": 0.25100352256901776,
"grad_norm": 0.17636246979236603,
"learning_rate": 0.0003496771256349187,
"loss": 2.9191375732421876,
"step": 19150
},
{
"epoch": 0.25165888424674365,
"grad_norm": 0.17443478107452393,
"learning_rate": 0.00034939632006169083,
"loss": 2.9225927734375,
"step": 19200
},
{
"epoch": 0.25231424592446955,
"grad_norm": 0.16307416558265686,
"learning_rate": 0.00034911484663112695,
"loss": 2.939248352050781,
"step": 19250
},
{
"epoch": 0.25296960760219545,
"grad_norm": 0.17640097439289093,
"learning_rate": 0.00034883270660151865,
"loss": 2.939591979980469,
"step": 19300
},
{
"epoch": 0.25362496927992134,
"grad_norm": 0.16904355585575104,
"learning_rate": 0.000348549901234137,
"loss": 2.9406097412109373,
"step": 19350
},
{
"epoch": 0.25428033095764724,
"grad_norm": 0.1602356731891632,
"learning_rate": 0.0003482664317932277,
"loss": 2.9330703735351564,
"step": 19400
},
{
"epoch": 0.25493569263537313,
"grad_norm": 0.1665678471326828,
"learning_rate": 0.000347982299546005,
"loss": 2.9257583618164062,
"step": 19450
},
{
"epoch": 0.25559105431309903,
"grad_norm": 0.16372360289096832,
"learning_rate": 0.00034769750576264607,
"loss": 2.934087829589844,
"step": 19500
},
{
"epoch": 0.2562464159908249,
"grad_norm": 0.1673424243927002,
"learning_rate": 0.0003474120517162855,
"loss": 2.9333615112304687,
"step": 19550
},
{
"epoch": 0.2569017776685508,
"grad_norm": 0.16466358304023743,
"learning_rate": 0.0003471259386830095,
"loss": 2.92653564453125,
"step": 19600
},
{
"epoch": 0.2575571393462767,
"grad_norm": 0.16957812011241913,
"learning_rate": 0.00034683916794185014,
"loss": 2.92204833984375,
"step": 19650
},
{
"epoch": 0.2582125010240026,
"grad_norm": 0.37738633155822754,
"learning_rate": 0.00034655174077477974,
"loss": 2.9285052490234373,
"step": 19700
},
{
"epoch": 0.2588678627017285,
"grad_norm": 0.19091728329658508,
"learning_rate": 0.00034626365846670507,
"loss": 2.9339923095703124,
"step": 19750
},
{
"epoch": 0.2595232243794544,
"grad_norm": 0.15751948952674866,
"learning_rate": 0.00034597492230546153,
"loss": 2.9218170166015627,
"step": 19800
},
{
"epoch": 0.2601785860571803,
"grad_norm": 0.17233611643314362,
"learning_rate": 0.0003456855335818076,
"loss": 2.921619567871094,
"step": 19850
},
{
"epoch": 0.2608339477349062,
"grad_norm": 0.15899398922920227,
"learning_rate": 0.00034539549358941903,
"loss": 2.9232144165039062,
"step": 19900
},
{
"epoch": 0.2614893094126321,
"grad_norm": 0.16905060410499573,
"learning_rate": 0.00034510480362488283,
"loss": 2.920394287109375,
"step": 19950
},
{
"epoch": 0.262144671090358,
"grad_norm": 0.16366197168827057,
"learning_rate": 0.00034481346498769165,
"loss": 2.9306982421875,
"step": 20000
},
{
"epoch": 0.262144671090358,
"eval_loss": 2.81449556350708,
"eval_runtime": 5.6159,
"eval_samples_per_second": 45.585,
"eval_steps_per_second": 5.698,
"step": 20000
},
{
"epoch": 0.2628000327680839,
"grad_norm": 0.17698407173156738,
"learning_rate": 0.000344521478980238,
"loss": 2.9228225708007813,
"step": 20050
},
{
"epoch": 0.2634553944458098,
"grad_norm": 0.16128091514110565,
"learning_rate": 0.0003442288469078084,
"loss": 2.921625671386719,
"step": 20100
},
{
"epoch": 0.2641107561235357,
"grad_norm": 0.17322736978530884,
"learning_rate": 0.00034393557007857746,
"loss": 2.9051715087890626,
"step": 20150
},
{
"epoch": 0.2647661178012616,
"grad_norm": 0.16672293841838837,
"learning_rate": 0.0003436416498036021,
"loss": 2.905989074707031,
"step": 20200
},
{
"epoch": 0.2654214794789875,
"grad_norm": 0.1662411391735077,
"learning_rate": 0.00034334708739681573,
"loss": 2.9157171630859375,
"step": 20250
},
{
"epoch": 0.2660768411567134,
"grad_norm": 0.17029765248298645,
"learning_rate": 0.0003430518841750223,
"loss": 2.9236849975585937,
"step": 20300
},
{
"epoch": 0.26673220283443927,
"grad_norm": 0.17488430440425873,
"learning_rate": 0.00034275604145789045,
"loss": 2.9190850830078126,
"step": 20350
},
{
"epoch": 0.26738756451216517,
"grad_norm": 0.16289661824703217,
"learning_rate": 0.00034245956056794757,
"loss": 2.939029541015625,
"step": 20400
},
{
"epoch": 0.26804292618989106,
"grad_norm": 0.15870621800422668,
"learning_rate": 0.0003421624428305739,
"loss": 2.9206527709960937,
"step": 20450
},
{
"epoch": 0.26869828786761696,
"grad_norm": 0.1745336502790451,
"learning_rate": 0.00034186468957399675,
"loss": 2.9202276611328126,
"step": 20500
},
{
"epoch": 0.26935364954534285,
"grad_norm": 0.16943217813968658,
"learning_rate": 0.00034156630212928433,
"loss": 2.922879638671875,
"step": 20550
},
{
"epoch": 0.27000901122306875,
"grad_norm": 0.17059074342250824,
"learning_rate": 0.00034126728183034,
"loss": 2.929295959472656,
"step": 20600
},
{
"epoch": 0.27066437290079465,
"grad_norm": 0.16384802758693695,
"learning_rate": 0.000340967630013896,
"loss": 2.9163818359375,
"step": 20650
},
{
"epoch": 0.27131973457852054,
"grad_norm": 0.16749094426631927,
"learning_rate": 0.00034066734801950797,
"loss": 2.9128497314453123,
"step": 20700
},
{
"epoch": 0.27197509625624644,
"grad_norm": 0.16414383053779602,
"learning_rate": 0.00034036643718954855,
"loss": 2.91092529296875,
"step": 20750
},
{
"epoch": 0.27263045793397234,
"grad_norm": 0.1656002253293991,
"learning_rate": 0.0003400648988692014,
"loss": 2.9259710693359375,
"step": 20800
},
{
"epoch": 0.27328581961169823,
"grad_norm": 0.16639083623886108,
"learning_rate": 0.0003397627344064555,
"loss": 2.9061215209960936,
"step": 20850
},
{
"epoch": 0.2739411812894241,
"grad_norm": 0.16125813126564026,
"learning_rate": 0.0003394599451520988,
"loss": 2.9067236328125,
"step": 20900
},
{
"epoch": 0.27459654296714997,
"grad_norm": 0.1701466590166092,
"learning_rate": 0.0003391565324597124,
"loss": 2.919434814453125,
"step": 20950
},
{
"epoch": 0.27525190464487587,
"grad_norm": 0.16901464760303497,
"learning_rate": 0.0003388524976856642,
"loss": 2.9094332885742187,
"step": 21000
},
{
"epoch": 0.27590726632260176,
"grad_norm": 0.16743549704551697,
"learning_rate": 0.00033854784218910326,
"loss": 2.8981332397460937,
"step": 21050
},
{
"epoch": 0.27656262800032766,
"grad_norm": 0.1666753739118576,
"learning_rate": 0.00033824256733195343,
"loss": 2.908269958496094,
"step": 21100
},
{
"epoch": 0.27721798967805356,
"grad_norm": 0.16418272256851196,
"learning_rate": 0.0003379366744789072,
"loss": 2.904945068359375,
"step": 21150
},
{
"epoch": 0.27787335135577945,
"grad_norm": 0.17084458470344543,
"learning_rate": 0.0003376301649974199,
"loss": 2.905140075683594,
"step": 21200
},
{
"epoch": 0.27852871303350535,
"grad_norm": 0.15967530012130737,
"learning_rate": 0.00033732304025770347,
"loss": 2.9149737548828125,
"step": 21250
},
{
"epoch": 0.27918407471123124,
"grad_norm": 0.1575414389371872,
"learning_rate": 0.00033701530163272,
"loss": 2.9153677368164064,
"step": 21300
},
{
"epoch": 0.27983943638895714,
"grad_norm": 0.16802668571472168,
"learning_rate": 0.00033670695049817624,
"loss": 2.9067037963867186,
"step": 21350
},
{
"epoch": 0.28049479806668304,
"grad_norm": 0.16015572845935822,
"learning_rate": 0.0003363979882325167,
"loss": 2.905437316894531,
"step": 21400
},
{
"epoch": 0.28115015974440893,
"grad_norm": 0.1805601418018341,
"learning_rate": 0.0003360884162169182,
"loss": 2.9042816162109375,
"step": 21450
},
{
"epoch": 0.28180552142213483,
"grad_norm": 0.17479462921619415,
"learning_rate": 0.0003357782358352832,
"loss": 2.903084411621094,
"step": 21500
},
{
"epoch": 0.2824608830998607,
"grad_norm": 0.16734828054904938,
"learning_rate": 0.0003354674484742339,
"loss": 2.8991748046875,
"step": 21550
},
{
"epoch": 0.2831162447775866,
"grad_norm": 0.162786602973938,
"learning_rate": 0.0003351560555231058,
"loss": 2.912698059082031,
"step": 21600
},
{
"epoch": 0.2837716064553125,
"grad_norm": 0.16262491047382355,
"learning_rate": 0.00033484405837394163,
"loss": 2.9023361206054688,
"step": 21650
},
{
"epoch": 0.2844269681330384,
"grad_norm": 0.15931487083435059,
"learning_rate": 0.0003345314584214853,
"loss": 2.911702880859375,
"step": 21700
},
{
"epoch": 0.2850823298107643,
"grad_norm": 0.16067153215408325,
"learning_rate": 0.00033421825706317506,
"loss": 2.905905456542969,
"step": 21750
},
{
"epoch": 0.2857376914884902,
"grad_norm": 0.15914632380008698,
"learning_rate": 0.00033390445569913814,
"loss": 2.908511047363281,
"step": 21800
},
{
"epoch": 0.2863930531662161,
"grad_norm": 0.16032442450523376,
"learning_rate": 0.0003335900557321838,
"loss": 2.890833740234375,
"step": 21850
},
{
"epoch": 0.287048414843942,
"grad_norm": 0.1664697378873825,
"learning_rate": 0.0003332750585677972,
"loss": 2.9062545776367186,
"step": 21900
},
{
"epoch": 0.2877037765216679,
"grad_norm": 0.1664905548095703,
"learning_rate": 0.00033295946561413337,
"loss": 2.906546936035156,
"step": 21950
},
{
"epoch": 0.2883591381993938,
"grad_norm": 0.1684502363204956,
"learning_rate": 0.00033264327828201053,
"loss": 2.9020489501953124,
"step": 22000
},
{
"epoch": 0.2883591381993938,
"eval_loss": 2.796187400817871,
"eval_runtime": 5.6169,
"eval_samples_per_second": 45.577,
"eval_steps_per_second": 5.697,
"step": 22000
},
{
"epoch": 0.2890144998771197,
"grad_norm": 0.16601231694221497,
"learning_rate": 0.0003323264979849043,
"loss": 2.896151428222656,
"step": 22050
},
{
"epoch": 0.2896698615548456,
"grad_norm": 0.16857431828975677,
"learning_rate": 0.0003320091261389408,
"loss": 2.9083993530273435,
"step": 22100
},
{
"epoch": 0.2903252232325715,
"grad_norm": 0.164560005068779,
"learning_rate": 0.0003316911641628907,
"loss": 2.89151123046875,
"step": 22150
},
{
"epoch": 0.2909805849102974,
"grad_norm": 0.18173231184482574,
"learning_rate": 0.00033137261347816266,
"loss": 2.889531555175781,
"step": 22200
},
{
"epoch": 0.2916359465880233,
"grad_norm": 0.16515697538852692,
"learning_rate": 0.0003310534755087974,
"loss": 2.9188613891601562,
"step": 22250
},
{
"epoch": 0.2922913082657492,
"grad_norm": 0.1700158566236496,
"learning_rate": 0.00033073375168146067,
"loss": 2.901234130859375,
"step": 22300
},
{
"epoch": 0.29294666994347507,
"grad_norm": 0.1752876192331314,
"learning_rate": 0.0003304134434254373,
"loss": 2.9004412841796876,
"step": 22350
},
{
"epoch": 0.29360203162120097,
"grad_norm": 0.16704712808132172,
"learning_rate": 0.00033009255217262504,
"loss": 2.9062249755859373,
"step": 22400
},
{
"epoch": 0.29425739329892686,
"grad_norm": 0.1657305359840393,
"learning_rate": 0.00032977107935752736,
"loss": 2.8917669677734374,
"step": 22450
},
{
"epoch": 0.29491275497665276,
"grad_norm": 0.16843761503696442,
"learning_rate": 0.00032944902641724794,
"loss": 2.895186767578125,
"step": 22500
},
{
"epoch": 0.29556811665437865,
"grad_norm": 0.15913957357406616,
"learning_rate": 0.00032912639479148353,
"loss": 2.900753173828125,
"step": 22550
},
{
"epoch": 0.29622347833210455,
"grad_norm": 0.1725219488143921,
"learning_rate": 0.0003288031859225181,
"loss": 2.903765869140625,
"step": 22600
},
{
"epoch": 0.29687884000983045,
"grad_norm": 0.17508095502853394,
"learning_rate": 0.000328479401255216,
"loss": 2.888994140625,
"step": 22650
},
{
"epoch": 0.29753420168755634,
"grad_norm": 0.1644352525472641,
"learning_rate": 0.00032815504223701554,
"loss": 2.891235656738281,
"step": 22700
},
{
"epoch": 0.29818956336528224,
"grad_norm": 0.17649006843566895,
"learning_rate": 0.0003278301103179226,
"loss": 2.8886343383789064,
"step": 22750
},
{
"epoch": 0.29884492504300814,
"grad_norm": 0.16421149671077728,
"learning_rate": 0.00032750460695050423,
"loss": 2.885317687988281,
"step": 22800
},
{
"epoch": 0.29950028672073403,
"grad_norm": 0.16478657722473145,
"learning_rate": 0.00032717853358988204,
"loss": 2.8880078125,
"step": 22850
},
{
"epoch": 0.3001556483984599,
"grad_norm": 0.16170595586299896,
"learning_rate": 0.0003268518916937257,
"loss": 2.8843978881835937,
"step": 22900
},
{
"epoch": 0.30081101007618577,
"grad_norm": 0.1687058061361313,
"learning_rate": 0.0003265246827222465,
"loss": 2.881629638671875,
"step": 22950
},
{
"epoch": 0.30146637175391167,
"grad_norm": 0.16480441391468048,
"learning_rate": 0.00032619690813819063,
"loss": 2.8956643676757814,
"step": 23000
},
{
"epoch": 0.30212173343163756,
"grad_norm": 0.1655932515859604,
"learning_rate": 0.00032586856940683293,
"loss": 2.8865670776367187,
"step": 23050
},
{
"epoch": 0.30277709510936346,
"grad_norm": 0.1749807894229889,
"learning_rate": 0.00032553966799597013,
"loss": 2.893671569824219,
"step": 23100
},
{
"epoch": 0.30343245678708936,
"grad_norm": 0.1644655168056488,
"learning_rate": 0.0003252102053759144,
"loss": 2.89248779296875,
"step": 23150
},
{
"epoch": 0.30408781846481525,
"grad_norm": 0.16707414388656616,
"learning_rate": 0.00032488018301948655,
"loss": 2.8796505737304687,
"step": 23200
},
{
"epoch": 0.30474318014254115,
"grad_norm": 0.19084422290325165,
"learning_rate": 0.0003245496024020098,
"loss": 2.88592529296875,
"step": 23250
},
{
"epoch": 0.30539854182026704,
"grad_norm": 0.17173467576503754,
"learning_rate": 0.00032421846500130307,
"loss": 2.8847064208984374,
"step": 23300
},
{
"epoch": 0.30605390349799294,
"grad_norm": 0.1604858785867691,
"learning_rate": 0.000323886772297674,
"loss": 2.8930450439453126,
"step": 23350
},
{
"epoch": 0.30670926517571884,
"grad_norm": 0.16557107865810394,
"learning_rate": 0.000323554525773913,
"loss": 2.8819793701171874,
"step": 23400
},
{
"epoch": 0.30736462685344473,
"grad_norm": 0.204323872923851,
"learning_rate": 0.00032322172691528594,
"loss": 2.88242431640625,
"step": 23450
},
{
"epoch": 0.30801998853117063,
"grad_norm": 0.16907712817192078,
"learning_rate": 0.000322888377209528,
"loss": 2.891842041015625,
"step": 23500
},
{
"epoch": 0.3086753502088965,
"grad_norm": 0.16979140043258667,
"learning_rate": 0.00032255447814683697,
"loss": 2.883805236816406,
"step": 23550
},
{
"epoch": 0.3093307118866224,
"grad_norm": 0.1563098430633545,
"learning_rate": 0.0003222200312198663,
"loss": 2.885360107421875,
"step": 23600
},
{
"epoch": 0.3099860735643483,
"grad_norm": 0.16310341656208038,
"learning_rate": 0.0003218850379237186,
"loss": 2.890566711425781,
"step": 23650
},
{
"epoch": 0.3106414352420742,
"grad_norm": 0.1629946082830429,
"learning_rate": 0.0003215494997559389,
"loss": 2.8732879638671873,
"step": 23700
},
{
"epoch": 0.3112967969198001,
"grad_norm": 0.1653667688369751,
"learning_rate": 0.00032121341821650823,
"loss": 2.881226806640625,
"step": 23750
},
{
"epoch": 0.311952158597526,
"grad_norm": 0.1685699075460434,
"learning_rate": 0.00032087679480783657,
"loss": 2.8805133056640626,
"step": 23800
},
{
"epoch": 0.3126075202752519,
"grad_norm": 0.17066118121147156,
"learning_rate": 0.00032053963103475613,
"loss": 2.886652526855469,
"step": 23850
},
{
"epoch": 0.3132628819529778,
"grad_norm": 0.16027726233005524,
"learning_rate": 0.00032020192840451504,
"loss": 2.8923110961914062,
"step": 23900
},
{
"epoch": 0.3139182436307037,
"grad_norm": 0.16547393798828125,
"learning_rate": 0.0003198636884267701,
"loss": 2.89369384765625,
"step": 23950
},
{
"epoch": 0.3145736053084296,
"grad_norm": 0.16015562415122986,
"learning_rate": 0.00031952491261358026,
"loss": 2.877950439453125,
"step": 24000
},
{
"epoch": 0.3145736053084296,
"eval_loss": 2.778181791305542,
"eval_runtime": 5.616,
"eval_samples_per_second": 45.584,
"eval_steps_per_second": 5.698,
"step": 24000
},
{
"epoch": 0.3152289669861555,
"grad_norm": 0.16715121269226074,
"learning_rate": 0.00031918560247939985,
"loss": 2.880118713378906,
"step": 24050
},
{
"epoch": 0.3158843286638814,
"grad_norm": 0.16754445433616638,
"learning_rate": 0.0003188457595410721,
"loss": 2.8914349365234373,
"step": 24100
},
{
"epoch": 0.3165396903416073,
"grad_norm": 0.19116008281707764,
"learning_rate": 0.0003185053853178215,
"loss": 2.8875491333007814,
"step": 24150
},
{
"epoch": 0.3171950520193332,
"grad_norm": 0.16489428281784058,
"learning_rate": 0.00031816448133124825,
"loss": 2.8749118041992188,
"step": 24200
},
{
"epoch": 0.3178504136970591,
"grad_norm": 0.17722296714782715,
"learning_rate": 0.0003178230491053203,
"loss": 2.8853085327148436,
"step": 24250
},
{
"epoch": 0.31850577537478497,
"grad_norm": 0.15979646146297455,
"learning_rate": 0.0003174810901663672,
"loss": 2.8683929443359375,
"step": 24300
},
{
"epoch": 0.31916113705251087,
"grad_norm": 0.1667044758796692,
"learning_rate": 0.00031713860604307316,
"loss": 2.8776849365234374,
"step": 24350
},
{
"epoch": 0.31981649873023676,
"grad_norm": 0.16185647249221802,
"learning_rate": 0.0003167955982664701,
"loss": 2.87613037109375,
"step": 24400
},
{
"epoch": 0.32047186040796266,
"grad_norm": 0.1726047247648239,
"learning_rate": 0.00031645206836993075,
"loss": 2.8837716674804685,
"step": 24450
},
{
"epoch": 0.32112722208568856,
"grad_norm": 0.17750437557697296,
"learning_rate": 0.00031610801788916216,
"loss": 2.8910455322265625,
"step": 24500
},
{
"epoch": 0.32178258376341445,
"grad_norm": 0.15907230973243713,
"learning_rate": 0.00031576344836219827,
"loss": 2.861527404785156,
"step": 24550
},
{
"epoch": 0.32243794544114035,
"grad_norm": 0.1666170060634613,
"learning_rate": 0.00031541836132939374,
"loss": 2.8740643310546874,
"step": 24600
},
{
"epoch": 0.32309330711886625,
"grad_norm": 0.1731458157300949,
"learning_rate": 0.0003150727583334163,
"loss": 2.863931884765625,
"step": 24650
},
{
"epoch": 0.32374866879659214,
"grad_norm": 0.16576217114925385,
"learning_rate": 0.0003147266409192405,
"loss": 2.8724874877929687,
"step": 24700
},
{
"epoch": 0.32440403047431804,
"grad_norm": 0.1662430316209793,
"learning_rate": 0.0003143800106341404,
"loss": 2.875974426269531,
"step": 24750
},
{
"epoch": 0.32505939215204394,
"grad_norm": 0.16906322538852692,
"learning_rate": 0.0003140328690276827,
"loss": 2.8751229858398437,
"step": 24800
},
{
"epoch": 0.32571475382976983,
"grad_norm": 0.16612815856933594,
"learning_rate": 0.00031368521765172023,
"loss": 2.8631072998046876,
"step": 24850
},
{
"epoch": 0.3263701155074957,
"grad_norm": 0.16437558829784393,
"learning_rate": 0.0003133370580603842,
"loss": 2.873352355957031,
"step": 24900
},
{
"epoch": 0.32702547718522157,
"grad_norm": 0.17101678252220154,
"learning_rate": 0.00031298839181007814,
"loss": 2.879327392578125,
"step": 24950
},
{
"epoch": 0.32768083886294747,
"grad_norm": 0.16352784633636475,
"learning_rate": 0.0003126392204594703,
"loss": 2.8836636352539062,
"step": 25000
},
{
"epoch": 0.32833620054067336,
"grad_norm": 0.1749923825263977,
"learning_rate": 0.0003122895455694871,
"loss": 2.869687805175781,
"step": 25050
},
{
"epoch": 0.32899156221839926,
"grad_norm": 0.1622343212366104,
"learning_rate": 0.00031193936870330585,
"loss": 2.872605285644531,
"step": 25100
},
{
"epoch": 0.32964692389612515,
"grad_norm": 0.16456149518489838,
"learning_rate": 0.00031158869142634783,
"loss": 2.869576721191406,
"step": 25150
},
{
"epoch": 0.33030228557385105,
"grad_norm": 0.16276663541793823,
"learning_rate": 0.0003112375153062714,
"loss": 2.8689425659179686,
"step": 25200
},
{
"epoch": 0.33095764725157695,
"grad_norm": 0.16324755549430847,
"learning_rate": 0.000310885841912965,
"loss": 2.869568176269531,
"step": 25250
},
{
"epoch": 0.33161300892930284,
"grad_norm": 0.1659940779209137,
"learning_rate": 0.00031053367281854,
"loss": 2.8857525634765624,
"step": 25300
},
{
"epoch": 0.33226837060702874,
"grad_norm": 0.16136540472507477,
"learning_rate": 0.0003101810095973239,
"loss": 2.8704763793945314,
"step": 25350
},
{
"epoch": 0.33292373228475464,
"grad_norm": 0.16203349828720093,
"learning_rate": 0.0003098278538258527,
"loss": 2.863424987792969,
"step": 25400
},
{
"epoch": 0.33357909396248053,
"grad_norm": 0.16347667574882507,
"learning_rate": 0.0003094742070828648,
"loss": 2.866216735839844,
"step": 25450
},
{
"epoch": 0.33423445564020643,
"grad_norm": 0.17400585114955902,
"learning_rate": 0.00030912007094929307,
"loss": 2.873335876464844,
"step": 25500
},
{
"epoch": 0.3348898173179323,
"grad_norm": 0.17542989552021027,
"learning_rate": 0.0003087654470082583,
"loss": 2.8602264404296873,
"step": 25550
},
{
"epoch": 0.3355451789956582,
"grad_norm": 0.1677759736776352,
"learning_rate": 0.00030841033684506194,
"loss": 2.8877227783203123,
"step": 25600
},
{
"epoch": 0.3362005406733841,
"grad_norm": 0.17618481814861298,
"learning_rate": 0.00030805474204717895,
"loss": 2.8600778198242187,
"step": 25650
},
{
"epoch": 0.33685590235111,
"grad_norm": 0.16586273908615112,
"learning_rate": 0.000307698664204251,
"loss": 2.8646295166015623,
"step": 25700
},
{
"epoch": 0.3375112640288359,
"grad_norm": 0.16388046741485596,
"learning_rate": 0.0003073421049080788,
"loss": 2.8601580810546876,
"step": 25750
},
{
"epoch": 0.3381666257065618,
"grad_norm": 0.17032526433467865,
"learning_rate": 0.00030698506575261577,
"loss": 2.8719058227539063,
"step": 25800
},
{
"epoch": 0.3388219873842877,
"grad_norm": 0.16430498659610748,
"learning_rate": 0.0003066275483339601,
"loss": 2.8737896728515624,
"step": 25850
},
{
"epoch": 0.3394773490620136,
"grad_norm": 0.1652543693780899,
"learning_rate": 0.00030626955425034827,
"loss": 2.8628781127929686,
"step": 25900
},
{
"epoch": 0.3401327107397395,
"grad_norm": 0.1694687157869339,
"learning_rate": 0.0003059110851021474,
"loss": 2.8618533325195314,
"step": 25950
},
{
"epoch": 0.3407880724174654,
"grad_norm": 0.16747811436653137,
"learning_rate": 0.00030555214249184846,
"loss": 2.8647122192382812,
"step": 26000
},
{
"epoch": 0.3407880724174654,
"eval_loss": 2.760092258453369,
"eval_runtime": 5.616,
"eval_samples_per_second": 45.584,
"eval_steps_per_second": 5.698,
"step": 26000
},
{
"epoch": 0.3414434340951913,
"grad_norm": 0.17128542065620422,
"learning_rate": 0.000305192728024059,
"loss": 2.8614712524414063,
"step": 26050
},
{
"epoch": 0.3420987957729172,
"grad_norm": 0.15930184721946716,
"learning_rate": 0.0003048328433054958,
"loss": 2.8513519287109377,
"step": 26100
},
{
"epoch": 0.3427541574506431,
"grad_norm": 0.17308135330677032,
"learning_rate": 0.00030447248994497806,
"loss": 2.8601043701171873,
"step": 26150
},
{
"epoch": 0.343409519128369,
"grad_norm": 0.16418837010860443,
"learning_rate": 0.0003041116695534198,
"loss": 2.861378479003906,
"step": 26200
},
{
"epoch": 0.3440648808060949,
"grad_norm": 0.16440536081790924,
"learning_rate": 0.00030375038374382294,
"loss": 2.8726483154296876,
"step": 26250
},
{
"epoch": 0.34472024248382077,
"grad_norm": 0.16608873009681702,
"learning_rate": 0.0003033886341312698,
"loss": 2.8549679565429686,
"step": 26300
},
{
"epoch": 0.34537560416154667,
"grad_norm": 0.17383836209774017,
"learning_rate": 0.0003030264223329164,
"loss": 2.8473080444335936,
"step": 26350
},
{
"epoch": 0.34603096583927256,
"grad_norm": 0.16997350752353668,
"learning_rate": 0.00030266374996798463,
"loss": 2.8568194580078123,
"step": 26400
},
{
"epoch": 0.34668632751699846,
"grad_norm": 0.1665136218070984,
"learning_rate": 0.0003023006186577554,
"loss": 2.8553912353515627,
"step": 26450
},
{
"epoch": 0.34734168919472436,
"grad_norm": 0.17019817233085632,
"learning_rate": 0.00030193703002556136,
"loss": 2.847229309082031,
"step": 26500
},
{
"epoch": 0.34799705087245025,
"grad_norm": 0.17223548889160156,
"learning_rate": 0.0003015729856967794,
"loss": 2.8694729614257812,
"step": 26550
},
{
"epoch": 0.34865241255017615,
"grad_norm": 0.17163468897342682,
"learning_rate": 0.0003012084872988236,
"loss": 2.8532672119140625,
"step": 26600
},
{
"epoch": 0.34930777422790205,
"grad_norm": 0.17218372225761414,
"learning_rate": 0.00030084353646113785,
"loss": 2.8651300048828126,
"step": 26650
},
{
"epoch": 0.34996313590562794,
"grad_norm": 0.1624092161655426,
"learning_rate": 0.00030047813481518876,
"loss": 2.8567745971679686,
"step": 26700
},
{
"epoch": 0.35061849758335384,
"grad_norm": 0.15907767415046692,
"learning_rate": 0.00030011228399445805,
"loss": 2.8517111206054686,
"step": 26750
},
{
"epoch": 0.35127385926107974,
"grad_norm": 0.16822992265224457,
"learning_rate": 0.0002997459856344356,
"loss": 2.841147155761719,
"step": 26800
},
{
"epoch": 0.3519292209388056,
"grad_norm": 0.16562947630882263,
"learning_rate": 0.0002993792413726117,
"loss": 2.860273742675781,
"step": 26850
},
{
"epoch": 0.3525845826165315,
"grad_norm": 0.16309036314487457,
"learning_rate": 0.0002990120528484703,
"loss": 2.8507235717773436,
"step": 26900
},
{
"epoch": 0.35323994429425737,
"grad_norm": 0.17814874649047852,
"learning_rate": 0.00029864442170348114,
"loss": 2.8636123657226564,
"step": 26950
},
{
"epoch": 0.35389530597198327,
"grad_norm": 0.16494058072566986,
"learning_rate": 0.0002982763495810927,
"loss": 2.8643087768554687,
"step": 27000
},
{
"epoch": 0.35455066764970916,
"grad_norm": 0.1739949882030487,
"learning_rate": 0.0002979078381267248,
"loss": 2.851215515136719,
"step": 27050
},
{
"epoch": 0.35520602932743506,
"grad_norm": 0.16151410341262817,
"learning_rate": 0.0002975388889877613,
"loss": 2.8670965576171876,
"step": 27100
},
{
"epoch": 0.35586139100516095,
"grad_norm": 0.17844350636005402,
"learning_rate": 0.0002971695038135426,
"loss": 2.854617004394531,
"step": 27150
},
{
"epoch": 0.35651675268288685,
"grad_norm": 0.16785629093647003,
"learning_rate": 0.00029679968425535836,
"loss": 2.845762939453125,
"step": 27200
},
{
"epoch": 0.35717211436061275,
"grad_norm": 0.1797703206539154,
"learning_rate": 0.0002964294319664401,
"loss": 2.8437564086914064,
"step": 27250
},
{
"epoch": 0.35782747603833864,
"grad_norm": 0.16604545712471008,
"learning_rate": 0.0002960587486019538,
"loss": 2.8505609130859373,
"step": 27300
},
{
"epoch": 0.35848283771606454,
"grad_norm": 0.17395423352718353,
"learning_rate": 0.0002956876358189925,
"loss": 2.836902770996094,
"step": 27350
},
{
"epoch": 0.35913819939379044,
"grad_norm": 0.16572467982769012,
"learning_rate": 0.0002953160952765689,
"loss": 2.850990905761719,
"step": 27400
},
{
"epoch": 0.35979356107151633,
"grad_norm": 0.1628977656364441,
"learning_rate": 0.00029494412863560797,
"loss": 2.838858337402344,
"step": 27450
},
{
"epoch": 0.36044892274924223,
"grad_norm": 0.16777564585208893,
"learning_rate": 0.0002945717375589395,
"loss": 2.860260009765625,
"step": 27500
},
{
"epoch": 0.3611042844269681,
"grad_norm": 0.16922368109226227,
"learning_rate": 0.0002941989237112907,
"loss": 2.836827392578125,
"step": 27550
},
{
"epoch": 0.361759646104694,
"grad_norm": 0.1663396805524826,
"learning_rate": 0.0002938256887592786,
"loss": 2.848780212402344,
"step": 27600
},
{
"epoch": 0.3624150077824199,
"grad_norm": 0.16718782484531403,
"learning_rate": 0.00029345203437140284,
"loss": 2.860242919921875,
"step": 27650
},
{
"epoch": 0.3630703694601458,
"grad_norm": 0.17059361934661865,
"learning_rate": 0.00029307796221803804,
"loss": 2.8508291625976563,
"step": 27700
},
{
"epoch": 0.3637257311378717,
"grad_norm": 0.18459787964820862,
"learning_rate": 0.0002927034739714265,
"loss": 2.8464505004882814,
"step": 27750
},
{
"epoch": 0.3643810928155976,
"grad_norm": 0.16627541184425354,
"learning_rate": 0.00029232857130567037,
"loss": 2.8501925659179688,
"step": 27800
},
{
"epoch": 0.3650364544933235,
"grad_norm": 0.1738003045320511,
"learning_rate": 0.0002919532558967246,
"loss": 2.8482626342773436,
"step": 27850
},
{
"epoch": 0.3656918161710494,
"grad_norm": 0.1718655824661255,
"learning_rate": 0.0002915775294223893,
"loss": 2.839765930175781,
"step": 27900
},
{
"epoch": 0.3663471778487753,
"grad_norm": 0.1667184978723526,
"learning_rate": 0.000291201393562302,
"loss": 2.8416326904296874,
"step": 27950
},
{
"epoch": 0.3670025395265012,
"grad_norm": 0.1784234195947647,
"learning_rate": 0.00029082484999793057,
"loss": 2.8398696899414064,
"step": 28000
},
{
"epoch": 0.3670025395265012,
"eval_loss": 2.7462053298950195,
"eval_runtime": 5.6334,
"eval_samples_per_second": 45.443,
"eval_steps_per_second": 5.68,
"step": 28000
},
{
"epoch": 0.3676579012042271,
"grad_norm": 0.1778552532196045,
"learning_rate": 0.00029044790041256525,
"loss": 2.839460754394531,
"step": 28050
},
{
"epoch": 0.368313262881953,
"grad_norm": 0.1757296919822693,
"learning_rate": 0.00029007054649131137,
"loss": 2.8534088134765625,
"step": 28100
},
{
"epoch": 0.3689686245596789,
"grad_norm": 0.18028011918067932,
"learning_rate": 0.000289692789921082,
"loss": 2.843622131347656,
"step": 28150
},
{
"epoch": 0.3696239862374048,
"grad_norm": 0.1780552715063095,
"learning_rate": 0.00028931463239059,
"loss": 2.8517025756835936,
"step": 28200
},
{
"epoch": 0.3702793479151307,
"grad_norm": 0.17192409932613373,
"learning_rate": 0.00028893607559034084,
"loss": 2.8490667724609375,
"step": 28250
},
{
"epoch": 0.37093470959285657,
"grad_norm": 0.16289013624191284,
"learning_rate": 0.0002885571212126246,
"loss": 2.826349792480469,
"step": 28300
},
{
"epoch": 0.37159007127058247,
"grad_norm": 0.16572405397891998,
"learning_rate": 0.00028817777095150893,
"loss": 2.8444940185546876,
"step": 28350
},
{
"epoch": 0.37224543294830836,
"grad_norm": 0.16589975357055664,
"learning_rate": 0.0002877980265028312,
"loss": 2.832040100097656,
"step": 28400
},
{
"epoch": 0.37290079462603426,
"grad_norm": 0.1663692146539688,
"learning_rate": 0.0002874178895641908,
"loss": 2.857304992675781,
"step": 28450
},
{
"epoch": 0.37355615630376016,
"grad_norm": 0.1679500788450241,
"learning_rate": 0.00028703736183494186,
"loss": 2.8356668090820314,
"step": 28500
},
{
"epoch": 0.37421151798148605,
"grad_norm": 0.16978515684604645,
"learning_rate": 0.00028665644501618546,
"loss": 2.8382525634765625,
"step": 28550
},
{
"epoch": 0.37486687965921195,
"grad_norm": 0.16526511311531067,
"learning_rate": 0.0002862751408107619,
"loss": 2.8394024658203123,
"step": 28600
},
{
"epoch": 0.37552224133693785,
"grad_norm": 0.16590842604637146,
"learning_rate": 0.00028589345092324336,
"loss": 2.82974853515625,
"step": 28650
},
{
"epoch": 0.37617760301466374,
"grad_norm": 0.16279539465904236,
"learning_rate": 0.0002855113770599263,
"loss": 2.843247985839844,
"step": 28700
},
{
"epoch": 0.37683296469238964,
"grad_norm": 0.16308841109275818,
"learning_rate": 0.00028512892092882343,
"loss": 2.83541748046875,
"step": 28750
},
{
"epoch": 0.37748832637011553,
"grad_norm": 0.1651703268289566,
"learning_rate": 0.0002847460842396566,
"loss": 2.8418438720703123,
"step": 28800
},
{
"epoch": 0.3781436880478414,
"grad_norm": 0.18129302561283112,
"learning_rate": 0.0002843628687038486,
"loss": 2.844976501464844,
"step": 28850
},
{
"epoch": 0.37879904972556727,
"grad_norm": 0.16951687633991241,
"learning_rate": 0.000283979276034516,
"loss": 2.8369122314453126,
"step": 28900
},
{
"epoch": 0.37945441140329317,
"grad_norm": 0.1697331666946411,
"learning_rate": 0.00028359530794646134,
"loss": 2.830364074707031,
"step": 28950
},
{
"epoch": 0.38010977308101906,
"grad_norm": 0.17072273790836334,
"learning_rate": 0.0002832109661561654,
"loss": 2.8385586547851562,
"step": 29000
},
{
"epoch": 0.38076513475874496,
"grad_norm": 0.17905867099761963,
"learning_rate": 0.0002828262523817793,
"loss": 2.839949035644531,
"step": 29050
},
{
"epoch": 0.38142049643647086,
"grad_norm": 0.16875913739204407,
"learning_rate": 0.00028244116834311747,
"loss": 2.8411624145507814,
"step": 29100
},
{
"epoch": 0.38207585811419675,
"grad_norm": 0.1666332483291626,
"learning_rate": 0.00028205571576164925,
"loss": 2.826195068359375,
"step": 29150
},
{
"epoch": 0.38273121979192265,
"grad_norm": 0.17406296730041504,
"learning_rate": 0.00028166989636049154,
"loss": 2.8342266845703126,
"step": 29200
},
{
"epoch": 0.38338658146964855,
"grad_norm": 0.1711699664592743,
"learning_rate": 0.0002812837118644013,
"loss": 2.8359359741210937,
"step": 29250
},
{
"epoch": 0.38404194314737444,
"grad_norm": 0.16621212661266327,
"learning_rate": 0.00028089716399976733,
"loss": 2.8418655395507812,
"step": 29300
},
{
"epoch": 0.38469730482510034,
"grad_norm": 0.18042895197868347,
"learning_rate": 0.00028051025449460295,
"loss": 2.83731689453125,
"step": 29350
},
{
"epoch": 0.38535266650282624,
"grad_norm": 0.1787901371717453,
"learning_rate": 0.00028012298507853805,
"loss": 2.825347595214844,
"step": 29400
},
{
"epoch": 0.38600802818055213,
"grad_norm": 0.17395256459712982,
"learning_rate": 0.00027973535748281167,
"loss": 2.8272149658203123,
"step": 29450
},
{
"epoch": 0.38666338985827803,
"grad_norm": 0.16953957080841064,
"learning_rate": 0.0002793473734402638,
"loss": 2.8245559692382813,
"step": 29500
},
{
"epoch": 0.3873187515360039,
"grad_norm": 0.175005242228508,
"learning_rate": 0.00027895903468532797,
"loss": 2.8402670288085936,
"step": 29550
},
{
"epoch": 0.3879741132137298,
"grad_norm": 0.16615919768810272,
"learning_rate": 0.0002785703429540234,
"loss": 2.8355352783203127,
"step": 29600
},
{
"epoch": 0.3886294748914557,
"grad_norm": 0.17405115067958832,
"learning_rate": 0.00027818129998394747,
"loss": 2.844706726074219,
"step": 29650
},
{
"epoch": 0.3892848365691816,
"grad_norm": 0.18288710713386536,
"learning_rate": 0.00027779190751426734,
"loss": 2.8442514038085935,
"step": 29700
},
{
"epoch": 0.3899401982469075,
"grad_norm": 0.16797401010990143,
"learning_rate": 0.0002774021672857128,
"loss": 2.8279486083984375,
"step": 29750
},
{
"epoch": 0.3905955599246334,
"grad_norm": 0.1715455949306488,
"learning_rate": 0.0002770120810405682,
"loss": 2.8107513427734374,
"step": 29800
},
{
"epoch": 0.3912509216023593,
"grad_norm": 0.18629951775074005,
"learning_rate": 0.00027662165052266466,
"loss": 2.8249465942382814,
"step": 29850
},
{
"epoch": 0.3919062832800852,
"grad_norm": 0.17281003296375275,
"learning_rate": 0.0002762308774773724,
"loss": 2.847117919921875,
"step": 29900
},
{
"epoch": 0.3925616449578111,
"grad_norm": 0.19374391436576843,
"learning_rate": 0.000275839763651593,
"loss": 2.817379150390625,
"step": 29950
},
{
"epoch": 0.393217006635537,
"grad_norm": 0.1770227700471878,
"learning_rate": 0.00027544831079375116,
"loss": 2.8242953491210936,
"step": 30000
},
{
"epoch": 0.393217006635537,
"eval_loss": 2.7334699630737305,
"eval_runtime": 5.6282,
"eval_samples_per_second": 45.485,
"eval_steps_per_second": 5.686,
"step": 30000
},
{
"epoch": 0.3938723683132629,
"grad_norm": 0.16634820401668549,
"learning_rate": 0.0002750565206537873,
"loss": 2.835488586425781,
"step": 30050
},
{
"epoch": 0.3945277299909888,
"grad_norm": 0.16967199742794037,
"learning_rate": 0.00027466439498314974,
"loss": 2.8210269165039064,
"step": 30100
},
{
"epoch": 0.3951830916687147,
"grad_norm": 0.16936033964157104,
"learning_rate": 0.0002742719355347866,
"loss": 2.8276303100585936,
"step": 30150
},
{
"epoch": 0.3958384533464406,
"grad_norm": 0.17753078043460846,
"learning_rate": 0.0002738791440631382,
"loss": 2.8287417602539064,
"step": 30200
},
{
"epoch": 0.3964938150241665,
"grad_norm": 0.16175499558448792,
"learning_rate": 0.000273486022324129,
"loss": 2.8373623657226563,
"step": 30250
},
{
"epoch": 0.39714917670189237,
"grad_norm": 0.17284804582595825,
"learning_rate": 0.00027309257207516,
"loss": 2.822721252441406,
"step": 30300
},
{
"epoch": 0.39780453837961827,
"grad_norm": 0.1730196475982666,
"learning_rate": 0.0002726987950751008,
"loss": 2.8194964599609373,
"step": 30350
},
{
"epoch": 0.39845990005734416,
"grad_norm": 0.16746480762958527,
"learning_rate": 0.0002723046930842816,
"loss": 2.829527587890625,
"step": 30400
},
{
"epoch": 0.39911526173507006,
"grad_norm": 0.1649184376001358,
"learning_rate": 0.00027191026786448536,
"loss": 2.823794250488281,
"step": 30450
},
{
"epoch": 0.39977062341279596,
"grad_norm": 0.16962015628814697,
"learning_rate": 0.00027151552117894023,
"loss": 2.829914855957031,
"step": 30500
},
{
"epoch": 0.40042598509052185,
"grad_norm": 0.18736493587493896,
"learning_rate": 0.0002711204547923112,
"loss": 2.828226318359375,
"step": 30550
},
{
"epoch": 0.40108134676824775,
"grad_norm": 0.16586989164352417,
"learning_rate": 0.0002707250704706926,
"loss": 2.824659729003906,
"step": 30600
},
{
"epoch": 0.40173670844597364,
"grad_norm": 0.17056018114089966,
"learning_rate": 0.0002703293699815999,
"loss": 2.8372531127929688,
"step": 30650
},
{
"epoch": 0.40239207012369954,
"grad_norm": 0.16926118731498718,
"learning_rate": 0.00026993335509396213,
"loss": 2.83315185546875,
"step": 30700
},
{
"epoch": 0.40304743180142544,
"grad_norm": 0.191090390086174,
"learning_rate": 0.0002695370275781137,
"loss": 2.8144259643554688,
"step": 30750
},
{
"epoch": 0.40370279347915133,
"grad_norm": 0.17509372532367706,
"learning_rate": 0.00026914038920578654,
"loss": 2.8302740478515624,
"step": 30800
},
{
"epoch": 0.4043581551568772,
"grad_norm": 0.16718317568302155,
"learning_rate": 0.0002687434417501023,
"loss": 2.8344842529296876,
"step": 30850
},
{
"epoch": 0.40501351683460307,
"grad_norm": 0.17425920069217682,
"learning_rate": 0.00026834618698556444,
"loss": 2.8232431030273437,
"step": 30900
},
{
"epoch": 0.40566887851232897,
"grad_norm": 0.1662057638168335,
"learning_rate": 0.00026794862668804993,
"loss": 2.8317330932617186,
"step": 30950
},
{
"epoch": 0.40632424019005486,
"grad_norm": 0.16697368025779724,
"learning_rate": 0.00026755076263480185,
"loss": 2.8197427368164063,
"step": 31000
},
{
"epoch": 0.40697960186778076,
"grad_norm": 0.16639693081378937,
"learning_rate": 0.000267152596604421,
"loss": 2.812342529296875,
"step": 31050
},
{
"epoch": 0.40763496354550666,
"grad_norm": 0.17759492993354797,
"learning_rate": 0.0002667541303768583,
"loss": 2.8243289184570313,
"step": 31100
},
{
"epoch": 0.40829032522323255,
"grad_norm": 0.17533797025680542,
"learning_rate": 0.0002663553657334066,
"loss": 2.81999755859375,
"step": 31150
},
{
"epoch": 0.40894568690095845,
"grad_norm": 0.1649777889251709,
"learning_rate": 0.00026595630445669263,
"loss": 2.817077941894531,
"step": 31200
},
{
"epoch": 0.40960104857868435,
"grad_norm": 0.17240998148918152,
"learning_rate": 0.0002655569483306694,
"loss": 2.8211968994140624,
"step": 31250
},
{
"epoch": 0.41025641025641024,
"grad_norm": 0.1674206405878067,
"learning_rate": 0.00026515729914060787,
"loss": 2.8189727783203127,
"step": 31300
},
{
"epoch": 0.41091177193413614,
"grad_norm": 0.16847915947437286,
"learning_rate": 0.0002647573586730892,
"loss": 2.8135391235351563,
"step": 31350
},
{
"epoch": 0.41156713361186203,
"grad_norm": 0.1722840517759323,
"learning_rate": 0.0002643571287159965,
"loss": 2.811943359375,
"step": 31400
},
{
"epoch": 0.41222249528958793,
"grad_norm": 0.16438116133213043,
"learning_rate": 0.0002639566110585073,
"loss": 2.8182452392578123,
"step": 31450
},
{
"epoch": 0.4128778569673138,
"grad_norm": 0.18781812489032745,
"learning_rate": 0.000263555807491085,
"loss": 2.8164569091796876,
"step": 31500
},
{
"epoch": 0.4135332186450397,
"grad_norm": 0.16678261756896973,
"learning_rate": 0.0002631547198054713,
"loss": 2.8184609985351563,
"step": 31550
},
{
"epoch": 0.4141885803227656,
"grad_norm": 0.1720782369375229,
"learning_rate": 0.0002627533497946777,
"loss": 2.8144097900390626,
"step": 31600
},
{
"epoch": 0.4148439420004915,
"grad_norm": 0.16864459216594696,
"learning_rate": 0.00026235169925297813,
"loss": 2.812674255371094,
"step": 31650
},
{
"epoch": 0.4154993036782174,
"grad_norm": 0.17222043871879578,
"learning_rate": 0.0002619497699759006,
"loss": 2.821094665527344,
"step": 31700
},
{
"epoch": 0.4161546653559433,
"grad_norm": 0.16629502177238464,
"learning_rate": 0.0002615475637602189,
"loss": 2.8109759521484374,
"step": 31750
},
{
"epoch": 0.4168100270336692,
"grad_norm": 0.17321209609508514,
"learning_rate": 0.0002611450824039451,
"loss": 2.814797058105469,
"step": 31800
},
{
"epoch": 0.4174653887113951,
"grad_norm": 0.17162896692752838,
"learning_rate": 0.0002607423277063211,
"loss": 2.8209078979492186,
"step": 31850
},
{
"epoch": 0.418120750389121,
"grad_norm": 0.17003057897090912,
"learning_rate": 0.0002603393014678109,
"loss": 2.8202694702148436,
"step": 31900
},
{
"epoch": 0.4187761120668469,
"grad_norm": 0.17229196429252625,
"learning_rate": 0.0002599360054900921,
"loss": 2.81719482421875,
"step": 31950
},
{
"epoch": 0.4194314737445728,
"grad_norm": 0.1804068684577942,
"learning_rate": 0.00025953244157604844,
"loss": 2.8250640869140624,
"step": 32000
},
{
"epoch": 0.4194314737445728,
"eval_loss": 2.717702627182007,
"eval_runtime": 5.6337,
"eval_samples_per_second": 45.441,
"eval_steps_per_second": 5.68,
"step": 32000
},
{
"epoch": 0.4200868354222987,
"grad_norm": 0.176468625664711,
"learning_rate": 0.00025912861152976125,
"loss": 2.8299920654296873,
"step": 32050
},
{
"epoch": 0.4207421971000246,
"grad_norm": 0.1754460632801056,
"learning_rate": 0.0002587245171565017,
"loss": 2.8209994506835936,
"step": 32100
},
{
"epoch": 0.4213975587777505,
"grad_norm": 0.17093075811862946,
"learning_rate": 0.0002583201602627224,
"loss": 2.8095404052734376,
"step": 32150
},
{
"epoch": 0.4220529204554764,
"grad_norm": 0.1822441816329956,
"learning_rate": 0.0002579155426560498,
"loss": 2.822154846191406,
"step": 32200
},
{
"epoch": 0.4227082821332023,
"grad_norm": 0.18130874633789062,
"learning_rate": 0.0002575106661452756,
"loss": 2.809761962890625,
"step": 32250
},
{
"epoch": 0.42336364381092817,
"grad_norm": 0.1693905144929886,
"learning_rate": 0.000257105532540349,
"loss": 2.8077737426757814,
"step": 32300
},
{
"epoch": 0.42401900548865407,
"grad_norm": 0.18007878959178925,
"learning_rate": 0.0002567001436523685,
"loss": 2.81089111328125,
"step": 32350
},
{
"epoch": 0.42467436716637996,
"grad_norm": 0.1728648990392685,
"learning_rate": 0.00025629450129357377,
"loss": 2.802657470703125,
"step": 32400
},
{
"epoch": 0.42532972884410586,
"grad_norm": 0.17816440761089325,
"learning_rate": 0.0002558886072773377,
"loss": 2.803893737792969,
"step": 32450
},
{
"epoch": 0.42598509052183176,
"grad_norm": 0.18097521364688873,
"learning_rate": 0.00025548246341815803,
"loss": 2.8021725463867186,
"step": 32500
},
{
"epoch": 0.42664045219955765,
"grad_norm": 0.17604602873325348,
"learning_rate": 0.0002550760715316495,
"loss": 2.816082763671875,
"step": 32550
},
{
"epoch": 0.42729581387728355,
"grad_norm": 0.1719379723072052,
"learning_rate": 0.00025466943343453556,
"loss": 2.8063009643554686,
"step": 32600
},
{
"epoch": 0.42795117555500944,
"grad_norm": 0.17087644338607788,
"learning_rate": 0.0002542625509446404,
"loss": 2.8064715576171877,
"step": 32650
},
{
"epoch": 0.42860653723273534,
"grad_norm": 0.17209365963935852,
"learning_rate": 0.0002538554258808806,
"loss": 2.80179931640625,
"step": 32700
},
{
"epoch": 0.42926189891046124,
"grad_norm": 0.18274058401584625,
"learning_rate": 0.0002534480600632574,
"loss": 2.7945367431640626,
"step": 32750
},
{
"epoch": 0.42991726058818713,
"grad_norm": 0.16481061279773712,
"learning_rate": 0.0002530404553128479,
"loss": 2.7970880126953124,
"step": 32800
},
{
"epoch": 0.430572622265913,
"grad_norm": 0.17738571763038635,
"learning_rate": 0.00025263261345179764,
"loss": 2.8090081787109376,
"step": 32850
},
{
"epoch": 0.43122798394363887,
"grad_norm": 0.17695216834545135,
"learning_rate": 0.000252224536303312,
"loss": 2.8089175415039063,
"step": 32900
},
{
"epoch": 0.43188334562136477,
"grad_norm": 0.17872895300388336,
"learning_rate": 0.00025181622569164823,
"loss": 2.8115353393554687,
"step": 32950
},
{
"epoch": 0.43253870729909066,
"grad_norm": 0.17590855062007904,
"learning_rate": 0.00025140768344210715,
"loss": 2.7916915893554686,
"step": 33000
},
{
"epoch": 0.43319406897681656,
"grad_norm": 0.1776922196149826,
"learning_rate": 0.0002509989113810253,
"loss": 2.80749267578125,
"step": 33050
},
{
"epoch": 0.43384943065454246,
"grad_norm": 0.18435806035995483,
"learning_rate": 0.00025058991133576636,
"loss": 2.796802978515625,
"step": 33100
},
{
"epoch": 0.43450479233226835,
"grad_norm": 0.17670029401779175,
"learning_rate": 0.00025018068513471325,
"loss": 2.8053240966796875,
"step": 33150
},
{
"epoch": 0.43516015400999425,
"grad_norm": 0.17623840272426605,
"learning_rate": 0.00024977123460726,
"loss": 2.801173095703125,
"step": 33200
},
{
"epoch": 0.43581551568772015,
"grad_norm": 0.179827019572258,
"learning_rate": 0.00024936156158380314,
"loss": 2.8053884887695313,
"step": 33250
},
{
"epoch": 0.43647087736544604,
"grad_norm": 0.17555275559425354,
"learning_rate": 0.00024895166789573424,
"loss": 2.810987854003906,
"step": 33300
},
{
"epoch": 0.43712623904317194,
"grad_norm": 0.17330294847488403,
"learning_rate": 0.0002485415553754311,
"loss": 2.8079879760742186,
"step": 33350
},
{
"epoch": 0.43778160072089783,
"grad_norm": 0.17602059245109558,
"learning_rate": 0.00024813122585624984,
"loss": 2.796018371582031,
"step": 33400
},
{
"epoch": 0.43843696239862373,
"grad_norm": 0.17282463610172272,
"learning_rate": 0.0002477206811725165,
"loss": 2.810688781738281,
"step": 33450
},
{
"epoch": 0.4390923240763496,
"grad_norm": 0.178282231092453,
"learning_rate": 0.00024730992315951934,
"loss": 2.8140521240234375,
"step": 33500
},
{
"epoch": 0.4397476857540755,
"grad_norm": 0.17066040635108948,
"learning_rate": 0.0002468989536534998,
"loss": 2.8120108032226563,
"step": 33550
},
{
"epoch": 0.4404030474318014,
"grad_norm": 0.17559479176998138,
"learning_rate": 0.0002464877744916453,
"loss": 2.8078497314453124,
"step": 33600
},
{
"epoch": 0.4410584091095273,
"grad_norm": 0.16767553985118866,
"learning_rate": 0.00024607638751207995,
"loss": 2.800149230957031,
"step": 33650
},
{
"epoch": 0.4417137707872532,
"grad_norm": 0.17333918809890747,
"learning_rate": 0.0002456647945538574,
"loss": 2.801031494140625,
"step": 33700
},
{
"epoch": 0.4423691324649791,
"grad_norm": 0.17710992693901062,
"learning_rate": 0.0002452529974569517,
"loss": 2.8102236938476564,
"step": 33750
},
{
"epoch": 0.443024494142705,
"grad_norm": 0.17319464683532715,
"learning_rate": 0.0002448409980622498,
"loss": 2.8082546997070312,
"step": 33800
},
{
"epoch": 0.4436798558204309,
"grad_norm": 0.17829981446266174,
"learning_rate": 0.00024442879821154264,
"loss": 2.8040924072265625,
"step": 33850
},
{
"epoch": 0.4443352174981568,
"grad_norm": 0.17057716846466064,
"learning_rate": 0.00024401639974751764,
"loss": 2.791195983886719,
"step": 33900
},
{
"epoch": 0.4449905791758827,
"grad_norm": 0.1765124499797821,
"learning_rate": 0.00024360380451374987,
"loss": 2.798342590332031,
"step": 33950
},
{
"epoch": 0.4456459408536086,
"grad_norm": 0.1741255223751068,
"learning_rate": 0.00024319101435469405,
"loss": 2.7992514038085936,
"step": 34000
},
{
"epoch": 0.4456459408536086,
"eval_loss": 2.7010598182678223,
"eval_runtime": 5.6413,
"eval_samples_per_second": 45.38,
"eval_steps_per_second": 5.672,
"step": 34000
},
{
"epoch": 0.4463013025313345,
"grad_norm": 0.17199166119098663,
"learning_rate": 0.00024277803111567639,
"loss": 2.807195739746094,
"step": 34050
},
{
"epoch": 0.4469566642090604,
"grad_norm": 0.18042199313640594,
"learning_rate": 0.0002423648566428861,
"loss": 2.7887872314453124,
"step": 34100
},
{
"epoch": 0.4476120258867863,
"grad_norm": 0.17163442075252533,
"learning_rate": 0.0002419514927833674,
"loss": 2.7897579956054686,
"step": 34150
},
{
"epoch": 0.4482673875645122,
"grad_norm": 0.17765183746814728,
"learning_rate": 0.0002415379413850111,
"loss": 2.796370849609375,
"step": 34200
},
{
"epoch": 0.4489227492422381,
"grad_norm": 0.17288920283317566,
"learning_rate": 0.00024112420429654637,
"loss": 2.791212158203125,
"step": 34250
},
{
"epoch": 0.44957811091996397,
"grad_norm": 0.170242041349411,
"learning_rate": 0.0002407102833675325,
"loss": 2.7980722045898436,
"step": 34300
},
{
"epoch": 0.45023347259768987,
"grad_norm": 0.17800791561603546,
"learning_rate": 0.00024029618044835055,
"loss": 2.7813229370117187,
"step": 34350
},
{
"epoch": 0.45088883427541576,
"grad_norm": 0.18201598525047302,
"learning_rate": 0.00023988189739019528,
"loss": 2.7982821655273438,
"step": 34400
},
{
"epoch": 0.45154419595314166,
"grad_norm": 0.18433402478694916,
"learning_rate": 0.00023946743604506655,
"loss": 2.79675537109375,
"step": 34450
},
{
"epoch": 0.45219955763086755,
"grad_norm": 0.17122547328472137,
"learning_rate": 0.00023905279826576145,
"loss": 2.795926208496094,
"step": 34500
},
{
"epoch": 0.45285491930859345,
"grad_norm": 0.17384587228298187,
"learning_rate": 0.0002386379859058656,
"loss": 2.799088439941406,
"step": 34550
},
{
"epoch": 0.45351028098631935,
"grad_norm": 0.1749262809753418,
"learning_rate": 0.0002382230008197452,
"loss": 2.7881915283203127,
"step": 34600
},
{
"epoch": 0.45416564266404524,
"grad_norm": 0.1834869384765625,
"learning_rate": 0.00023780784486253844,
"loss": 2.7956793212890627,
"step": 34650
},
{
"epoch": 0.45482100434177114,
"grad_norm": 0.18870288133621216,
"learning_rate": 0.00023739251989014757,
"loss": 2.787125244140625,
"step": 34700
},
{
"epoch": 0.45547636601949704,
"grad_norm": 0.19213400781154633,
"learning_rate": 0.00023697702775923025,
"loss": 2.799786376953125,
"step": 34750
},
{
"epoch": 0.4561317276972229,
"grad_norm": 0.17894001305103302,
"learning_rate": 0.00023656137032719148,
"loss": 2.7863839721679686,
"step": 34800
},
{
"epoch": 0.4567870893749488,
"grad_norm": 0.17298947274684906,
"learning_rate": 0.0002361455494521752,
"loss": 2.786640319824219,
"step": 34850
},
{
"epoch": 0.45744245105267467,
"grad_norm": 0.18126356601715088,
"learning_rate": 0.00023572956699305592,
"loss": 2.7873745727539063,
"step": 34900
},
{
"epoch": 0.45809781273040057,
"grad_norm": 0.17106208205223083,
"learning_rate": 0.00023531342480943065,
"loss": 2.7961822509765626,
"step": 34950
},
{
"epoch": 0.45875317440812646,
"grad_norm": 0.1805909126996994,
"learning_rate": 0.00023489712476161025,
"loss": 2.7936129760742188,
"step": 35000
},
{
"epoch": 0.45940853608585236,
"grad_norm": 0.1737130731344223,
"learning_rate": 0.0002344806687106115,
"loss": 2.810494689941406,
"step": 35050
},
{
"epoch": 0.46006389776357826,
"grad_norm": 0.1769523024559021,
"learning_rate": 0.00023406405851814834,
"loss": 2.7846115112304686,
"step": 35100
},
{
"epoch": 0.46071925944130415,
"grad_norm": 0.18160481750965118,
"learning_rate": 0.00023364729604662392,
"loss": 2.7967404174804686,
"step": 35150
},
{
"epoch": 0.46137462111903005,
"grad_norm": 0.1708821803331375,
"learning_rate": 0.00023323038315912218,
"loss": 2.772400207519531,
"step": 35200
},
{
"epoch": 0.46202998279675594,
"grad_norm": 0.1701134294271469,
"learning_rate": 0.00023281332171939934,
"loss": 2.780820617675781,
"step": 35250
},
{
"epoch": 0.46268534447448184,
"grad_norm": 0.1778147965669632,
"learning_rate": 0.0002323961135918758,
"loss": 2.7782827758789064,
"step": 35300
},
{
"epoch": 0.46334070615220774,
"grad_norm": 0.1716746836900711,
"learning_rate": 0.00023197876064162757,
"loss": 2.771509704589844,
"step": 35350
},
{
"epoch": 0.46399606782993363,
"grad_norm": 0.1749267429113388,
"learning_rate": 0.00023156126473437838,
"loss": 2.7943505859375,
"step": 35400
},
{
"epoch": 0.46465142950765953,
"grad_norm": 0.17798985540866852,
"learning_rate": 0.00023114362773649064,
"loss": 2.7937997436523436,
"step": 35450
},
{
"epoch": 0.4653067911853854,
"grad_norm": 0.17478112876415253,
"learning_rate": 0.00023072585151495779,
"loss": 2.78129150390625,
"step": 35500
},
{
"epoch": 0.4659621528631113,
"grad_norm": 0.18205077946186066,
"learning_rate": 0.0002303079379373955,
"loss": 2.7831829833984374,
"step": 35550
},
{
"epoch": 0.4666175145408372,
"grad_norm": 0.19633878767490387,
"learning_rate": 0.0002298898888720335,
"loss": 2.7940487670898437,
"step": 35600
},
{
"epoch": 0.4672728762185631,
"grad_norm": 0.18207716941833496,
"learning_rate": 0.00022947170618770727,
"loss": 2.777283935546875,
"step": 35650
},
{
"epoch": 0.467928237896289,
"grad_norm": 0.17792396247386932,
"learning_rate": 0.0002290533917538495,
"loss": 2.794576416015625,
"step": 35700
},
{
"epoch": 0.4685835995740149,
"grad_norm": 0.18311934173107147,
"learning_rate": 0.000228634947440482,
"loss": 2.784618225097656,
"step": 35750
},
{
"epoch": 0.4692389612517408,
"grad_norm": 0.18091702461242676,
"learning_rate": 0.00022821637511820692,
"loss": 2.779443664550781,
"step": 35800
},
{
"epoch": 0.4698943229294667,
"grad_norm": 0.17822156846523285,
"learning_rate": 0.00022779767665819902,
"loss": 2.7834317016601564,
"step": 35850
},
{
"epoch": 0.4705496846071926,
"grad_norm": 0.1831509917974472,
"learning_rate": 0.00022737885393219663,
"loss": 2.78453125,
"step": 35900
},
{
"epoch": 0.4712050462849185,
"grad_norm": 0.1775432676076889,
"learning_rate": 0.00022695990881249384,
"loss": 2.7866787719726562,
"step": 35950
},
{
"epoch": 0.4718604079626444,
"grad_norm": 0.18006455898284912,
"learning_rate": 0.00022654084317193167,
"loss": 2.788680114746094,
"step": 36000
},
{
"epoch": 0.4718604079626444,
"eval_loss": 2.688542127609253,
"eval_runtime": 5.63,
"eval_samples_per_second": 45.47,
"eval_steps_per_second": 5.684,
"step": 36000
},
{
"epoch": 0.4725157696403703,
"grad_norm": 0.17572930455207825,
"learning_rate": 0.0002261216588838901,
"loss": 2.7965884399414063,
"step": 36050
},
{
"epoch": 0.4731711313180962,
"grad_norm": 0.1913042813539505,
"learning_rate": 0.00022570235782227936,
"loss": 2.7751339721679686,
"step": 36100
},
{
"epoch": 0.4738264929958221,
"grad_norm": 0.1840689331293106,
"learning_rate": 0.0002252829418615318,
"loss": 2.7817181396484374,
"step": 36150
},
{
"epoch": 0.474481854673548,
"grad_norm": 0.18235161900520325,
"learning_rate": 0.00022486341287659333,
"loss": 2.775789489746094,
"step": 36200
},
{
"epoch": 0.47513721635127387,
"grad_norm": 0.17426715791225433,
"learning_rate": 0.0002244437727429152,
"loss": 2.7855352783203124,
"step": 36250
},
{
"epoch": 0.47579257802899977,
"grad_norm": 0.18308281898498535,
"learning_rate": 0.0002240240233364455,
"loss": 2.773079528808594,
"step": 36300
},
{
"epoch": 0.47644793970672566,
"grad_norm": 0.1761571168899536,
"learning_rate": 0.00022360416653362087,
"loss": 2.7845745849609376,
"step": 36350
},
{
"epoch": 0.47710330138445156,
"grad_norm": 0.18568705022335052,
"learning_rate": 0.00022318420421135792,
"loss": 2.7646163940429687,
"step": 36400
},
{
"epoch": 0.47775866306217746,
"grad_norm": 0.17748695611953735,
"learning_rate": 0.00022276413824704502,
"loss": 2.775191345214844,
"step": 36450
},
{
"epoch": 0.47841402473990335,
"grad_norm": 0.17191524803638458,
"learning_rate": 0.00022234397051853398,
"loss": 2.783917236328125,
"step": 36500
},
{
"epoch": 0.47906938641762925,
"grad_norm": 0.17897158861160278,
"learning_rate": 0.00022192370290413137,
"loss": 2.7766815185546876,
"step": 36550
},
{
"epoch": 0.47972474809535515,
"grad_norm": 0.17524339258670807,
"learning_rate": 0.00022150333728259035,
"loss": 2.779471740722656,
"step": 36600
},
{
"epoch": 0.48038010977308104,
"grad_norm": 0.1740463525056839,
"learning_rate": 0.00022108287553310228,
"loss": 2.783061828613281,
"step": 36650
},
{
"epoch": 0.48103547145080694,
"grad_norm": 0.19177548587322235,
"learning_rate": 0.00022066231953528812,
"loss": 2.770576171875,
"step": 36700
},
{
"epoch": 0.48169083312853284,
"grad_norm": 0.18529212474822998,
"learning_rate": 0.00022024167116919025,
"loss": 2.7833587646484377,
"step": 36750
},
{
"epoch": 0.4823461948062587,
"grad_norm": 0.18035073578357697,
"learning_rate": 0.00021982093231526394,
"loss": 2.7897509765625,
"step": 36800
},
{
"epoch": 0.4830015564839846,
"grad_norm": 0.1930634081363678,
"learning_rate": 0.00021940010485436891,
"loss": 2.7712725830078124,
"step": 36850
},
{
"epoch": 0.48365691816171047,
"grad_norm": 0.1875726878643036,
"learning_rate": 0.00021897919066776113,
"loss": 2.7792849731445313,
"step": 36900
},
{
"epoch": 0.48431227983943637,
"grad_norm": 0.19788779318332672,
"learning_rate": 0.00021855819163708415,
"loss": 2.778841857910156,
"step": 36950
},
{
"epoch": 0.48496764151716226,
"grad_norm": 0.1755739152431488,
"learning_rate": 0.00021813710964436092,
"loss": 2.77288818359375,
"step": 37000
},
{
"epoch": 0.48562300319488816,
"grad_norm": 0.18156370520591736,
"learning_rate": 0.00021771594657198505,
"loss": 2.7773919677734376,
"step": 37050
},
{
"epoch": 0.48627836487261406,
"grad_norm": 0.17398156225681305,
"learning_rate": 0.00021729470430271276,
"loss": 2.7756591796875,
"step": 37100
},
{
"epoch": 0.48693372655033995,
"grad_norm": 0.17524923384189606,
"learning_rate": 0.00021687338471965432,
"loss": 2.7676190185546874,
"step": 37150
},
{
"epoch": 0.48758908822806585,
"grad_norm": 0.1739235818386078,
"learning_rate": 0.00021645198970626566,
"loss": 2.766216125488281,
"step": 37200
},
{
"epoch": 0.48824444990579174,
"grad_norm": 0.17425961792469025,
"learning_rate": 0.00021603052114633968,
"loss": 2.777612609863281,
"step": 37250
},
{
"epoch": 0.48889981158351764,
"grad_norm": 0.20634113252162933,
"learning_rate": 0.00021560898092399836,
"loss": 2.7745510864257814,
"step": 37300
},
{
"epoch": 0.48955517326124354,
"grad_norm": 0.18285129964351654,
"learning_rate": 0.00021518737092368384,
"loss": 2.766454162597656,
"step": 37350
},
{
"epoch": 0.49021053493896943,
"grad_norm": 0.17791612446308136,
"learning_rate": 0.00021476569303015026,
"loss": 2.7686627197265623,
"step": 37400
},
{
"epoch": 0.49086589661669533,
"grad_norm": 0.17872479557991028,
"learning_rate": 0.00021434394912845525,
"loss": 2.7785491943359375,
"step": 37450
},
{
"epoch": 0.4915212582944212,
"grad_norm": 0.1808568388223648,
"learning_rate": 0.00021392214110395165,
"loss": 2.76978515625,
"step": 37500
},
{
"epoch": 0.4921766199721471,
"grad_norm": 0.18766574561595917,
"learning_rate": 0.00021350027084227863,
"loss": 2.7707400512695313,
"step": 37550
},
{
"epoch": 0.492831981649873,
"grad_norm": 0.1850651353597641,
"learning_rate": 0.00021307834022935392,
"loss": 2.7726034545898437,
"step": 37600
},
{
"epoch": 0.4934873433275989,
"grad_norm": 0.18099629878997803,
"learning_rate": 0.00021265635115136485,
"loss": 2.783136901855469,
"step": 37650
},
{
"epoch": 0.4941427050053248,
"grad_norm": 0.1758628934621811,
"learning_rate": 0.0002122343054947602,
"loss": 2.762894592285156,
"step": 37700
},
{
"epoch": 0.4947980666830507,
"grad_norm": 0.18514783680438995,
"learning_rate": 0.00021181220514624163,
"loss": 2.7843386840820314,
"step": 37750
},
{
"epoch": 0.4954534283607766,
"grad_norm": 0.19134601950645447,
"learning_rate": 0.00021139005199275536,
"loss": 2.7828628540039064,
"step": 37800
},
{
"epoch": 0.4961087900385025,
"grad_norm": 0.18108375370502472,
"learning_rate": 0.0002109678479214836,
"loss": 2.763644104003906,
"step": 37850
},
{
"epoch": 0.4967641517162284,
"grad_norm": 0.1854194849729538,
"learning_rate": 0.00021054559481983618,
"loss": 2.7671295166015626,
"step": 37900
},
{
"epoch": 0.4974195133939543,
"grad_norm": 0.17926497757434845,
"learning_rate": 0.00021012329457544216,
"loss": 2.761571350097656,
"step": 37950
},
{
"epoch": 0.4980748750716802,
"grad_norm": 0.17533256113529205,
"learning_rate": 0.00020970094907614125,
"loss": 2.756622619628906,
"step": 38000
},
{
"epoch": 0.4980748750716802,
"eval_loss": 2.675839900970459,
"eval_runtime": 5.6302,
"eval_samples_per_second": 45.469,
"eval_steps_per_second": 5.684,
"step": 38000
},
{
"epoch": 0.4987302367494061,
"grad_norm": 0.1715238392353058,
"learning_rate": 0.00020927856020997566,
"loss": 2.763541259765625,
"step": 38050
},
{
"epoch": 0.499385598427132,
"grad_norm": 0.1891726553440094,
"learning_rate": 0.0002088561298651812,
"loss": 2.7599969482421876,
"step": 38100
},
{
"epoch": 0.5000409601048579,
"grad_norm": 0.1891585737466812,
"learning_rate": 0.00020843365993017946,
"loss": 2.767780456542969,
"step": 38150
},
{
"epoch": 0.5006963217825837,
"grad_norm": 0.18187370896339417,
"learning_rate": 0.00020801115229356857,
"loss": 2.758955993652344,
"step": 38200
},
{
"epoch": 0.5013516834603097,
"grad_norm": 0.180680513381958,
"learning_rate": 0.00020758860884411554,
"loss": 2.773992004394531,
"step": 38250
},
{
"epoch": 0.5020070451380355,
"grad_norm": 0.17935651540756226,
"learning_rate": 0.00020716603147074737,
"loss": 2.760301208496094,
"step": 38300
},
{
"epoch": 0.5026624068157615,
"grad_norm": 0.17484623193740845,
"learning_rate": 0.0002067434220625427,
"loss": 2.762476806640625,
"step": 38350
},
{
"epoch": 0.5033177684934873,
"grad_norm": 0.1851634383201599,
"learning_rate": 0.00020632078250872336,
"loss": 2.7775283813476563,
"step": 38400
},
{
"epoch": 0.5039731301712133,
"grad_norm": 0.18199287354946136,
"learning_rate": 0.00020589811469864602,
"loss": 2.7696572875976564,
"step": 38450
},
{
"epoch": 0.5046284918489391,
"grad_norm": 0.1790669709444046,
"learning_rate": 0.0002054754205217936,
"loss": 2.766701965332031,
"step": 38500
},
{
"epoch": 0.505283853526665,
"grad_norm": 0.18057458102703094,
"learning_rate": 0.0002050527018677669,
"loss": 2.763885498046875,
"step": 38550
},
{
"epoch": 0.5059392152043909,
"grad_norm": 0.17684859037399292,
"learning_rate": 0.00020462996062627613,
"loss": 2.76280517578125,
"step": 38600
},
{
"epoch": 0.5065945768821168,
"grad_norm": 0.17858350276947021,
"learning_rate": 0.00020420719868713256,
"loss": 2.76749755859375,
"step": 38650
},
{
"epoch": 0.5072499385598427,
"grad_norm": 0.18191659450531006,
"learning_rate": 0.0002037844179402398,
"loss": 2.7653994750976563,
"step": 38700
},
{
"epoch": 0.5079053002375686,
"grad_norm": 0.17849008738994598,
"learning_rate": 0.00020336162027558582,
"loss": 2.7564956665039064,
"step": 38750
},
{
"epoch": 0.5085606619152945,
"grad_norm": 0.18029668927192688,
"learning_rate": 0.00020293880758323396,
"loss": 2.75717529296875,
"step": 38800
},
{
"epoch": 0.5092160235930204,
"grad_norm": 0.179390087723732,
"learning_rate": 0.00020251598175331477,
"loss": 2.761173095703125,
"step": 38850
},
{
"epoch": 0.5098713852707463,
"grad_norm": 0.18294206261634827,
"learning_rate": 0.0002020931446760177,
"loss": 2.7567578125,
"step": 38900
},
{
"epoch": 0.5105267469484722,
"grad_norm": 0.19343997538089752,
"learning_rate": 0.00020167029824158235,
"loss": 2.764580078125,
"step": 38950
},
{
"epoch": 0.5111821086261981,
"grad_norm": 0.17865416407585144,
"learning_rate": 0.00020124744434029011,
"loss": 2.7580584716796874,
"step": 39000
},
{
"epoch": 0.511837470303924,
"grad_norm": 0.17839521169662476,
"learning_rate": 0.0002008245848624559,
"loss": 2.7663525390625,
"step": 39050
},
{
"epoch": 0.5124928319816499,
"grad_norm": 0.18171542882919312,
"learning_rate": 0.00020040172169841949,
"loss": 2.7568914794921877,
"step": 39100
},
{
"epoch": 0.5131481936593758,
"grad_norm": 0.205347940325737,
"learning_rate": 0.00019997885673853704,
"loss": 2.75294189453125,
"step": 39150
},
{
"epoch": 0.5138035553371016,
"grad_norm": 0.18756859004497528,
"learning_rate": 0.0001995559918731729,
"loss": 2.7669851684570315,
"step": 39200
},
{
"epoch": 0.5144589170148276,
"grad_norm": 0.1893216073513031,
"learning_rate": 0.00019913312899269084,
"loss": 2.7494488525390626,
"step": 39250
},
{
"epoch": 0.5151142786925534,
"grad_norm": 0.18761029839515686,
"learning_rate": 0.0001987102699874459,
"loss": 2.7610733032226564,
"step": 39300
},
{
"epoch": 0.5157696403702794,
"grad_norm": 0.17655566334724426,
"learning_rate": 0.0001982874167477757,
"loss": 2.7527294921875,
"step": 39350
},
{
"epoch": 0.5164250020480052,
"grad_norm": 0.18693533539772034,
"learning_rate": 0.0001978645711639921,
"loss": 2.7658511352539064,
"step": 39400
},
{
"epoch": 0.5170803637257312,
"grad_norm": 0.1764882355928421,
"learning_rate": 0.00019744173512637286,
"loss": 2.742279052734375,
"step": 39450
},
{
"epoch": 0.517735725403457,
"grad_norm": 0.17796702682971954,
"learning_rate": 0.0001970189105251528,
"loss": 2.7436346435546874,
"step": 39500
},
{
"epoch": 0.518391087081183,
"grad_norm": 0.1804492175579071,
"learning_rate": 0.00019659609925051582,
"loss": 2.762234802246094,
"step": 39550
},
{
"epoch": 0.5190464487589088,
"grad_norm": 0.18773473799228668,
"learning_rate": 0.00019617330319258628,
"loss": 2.7488772583007814,
"step": 39600
},
{
"epoch": 0.5197018104366348,
"grad_norm": 0.18577367067337036,
"learning_rate": 0.00019575052424142034,
"loss": 2.7631631469726563,
"step": 39650
},
{
"epoch": 0.5203571721143606,
"grad_norm": 0.18235595524311066,
"learning_rate": 0.0001953277642869978,
"loss": 2.754354248046875,
"step": 39700
},
{
"epoch": 0.5210125337920866,
"grad_norm": 0.18477827310562134,
"learning_rate": 0.00019490502521921356,
"loss": 2.75442138671875,
"step": 39750
},
{
"epoch": 0.5216678954698124,
"grad_norm": 0.1838875561952591,
"learning_rate": 0.00019448230892786907,
"loss": 2.7684317016601563,
"step": 39800
},
{
"epoch": 0.5223232571475382,
"grad_norm": 0.17940661311149597,
"learning_rate": 0.000194059617302664,
"loss": 2.7501370239257814,
"step": 39850
},
{
"epoch": 0.5229786188252642,
"grad_norm": 0.185946524143219,
"learning_rate": 0.00019363695223318774,
"loss": 2.753255615234375,
"step": 39900
},
{
"epoch": 0.52363398050299,
"grad_norm": 0.18180282413959503,
"learning_rate": 0.00019321431560891098,
"loss": 2.7671429443359377,
"step": 39950
},
{
"epoch": 0.524289342180716,
"grad_norm": 0.181806281208992,
"learning_rate": 0.00019279170931917728,
"loss": 2.7551083374023437,
"step": 40000
},
{
"epoch": 0.524289342180716,
"eval_loss": 2.665051221847534,
"eval_runtime": 5.6315,
"eval_samples_per_second": 45.458,
"eval_steps_per_second": 5.682,
"step": 40000
},
{
"epoch": 0.5249447038584418,
"grad_norm": 0.1850646734237671,
"learning_rate": 0.0001923691352531945,
"loss": 2.7553775024414064,
"step": 40050
},
{
"epoch": 0.5256000655361678,
"grad_norm": 0.1765211522579193,
"learning_rate": 0.0001919465953000266,
"loss": 2.75322265625,
"step": 40100
},
{
"epoch": 0.5262554272138936,
"grad_norm": 0.1793850064277649,
"learning_rate": 0.00019152409134858486,
"loss": 2.756124267578125,
"step": 40150
},
{
"epoch": 0.5269107888916196,
"grad_norm": 0.18779806792736053,
"learning_rate": 0.00019110162528761967,
"loss": 2.740491943359375,
"step": 40200
},
{
"epoch": 0.5275661505693454,
"grad_norm": 0.1876293271780014,
"learning_rate": 0.00019067919900571219,
"loss": 2.747510986328125,
"step": 40250
},
{
"epoch": 0.5282215122470714,
"grad_norm": 0.18507513403892517,
"learning_rate": 0.00019025681439126555,
"loss": 2.7438848876953124,
"step": 40300
},
{
"epoch": 0.5288768739247972,
"grad_norm": 0.17805354297161102,
"learning_rate": 0.00018983447333249673,
"loss": 2.753096618652344,
"step": 40350
},
{
"epoch": 0.5295322356025232,
"grad_norm": 0.17969100177288055,
"learning_rate": 0.00018941217771742798,
"loss": 2.742714538574219,
"step": 40400
},
{
"epoch": 0.530187597280249,
"grad_norm": 0.18937169015407562,
"learning_rate": 0.00018898992943387836,
"loss": 2.750940856933594,
"step": 40450
},
{
"epoch": 0.530842958957975,
"grad_norm": 0.18194428086280823,
"learning_rate": 0.0001885677303694554,
"loss": 2.7457281494140626,
"step": 40500
},
{
"epoch": 0.5314983206357008,
"grad_norm": 0.1870952844619751,
"learning_rate": 0.00018814558241154653,
"loss": 2.750302429199219,
"step": 40550
},
{
"epoch": 0.5321536823134267,
"grad_norm": 0.18458783626556396,
"learning_rate": 0.00018772348744731075,
"loss": 2.7554135131835937,
"step": 40600
},
{
"epoch": 0.5328090439911526,
"grad_norm": 0.18436960875988007,
"learning_rate": 0.0001873014473636702,
"loss": 2.760242614746094,
"step": 40650
},
{
"epoch": 0.5334644056688785,
"grad_norm": 0.1771363466978073,
"learning_rate": 0.0001868794640473016,
"loss": 2.7394308471679687,
"step": 40700
},
{
"epoch": 0.5341197673466044,
"grad_norm": 0.18486769497394562,
"learning_rate": 0.00018645753938462798,
"loss": 2.7567718505859373,
"step": 40750
},
{
"epoch": 0.5347751290243303,
"grad_norm": 0.1842900663614273,
"learning_rate": 0.00018603567526181015,
"loss": 2.749614562988281,
"step": 40800
},
{
"epoch": 0.5354304907020562,
"grad_norm": 0.18352243304252625,
"learning_rate": 0.00018561387356473823,
"loss": 2.74935302734375,
"step": 40850
},
{
"epoch": 0.5360858523797821,
"grad_norm": 0.18941424787044525,
"learning_rate": 0.0001851921361790233,
"loss": 2.7365756225585938,
"step": 40900
},
{
"epoch": 0.536741214057508,
"grad_norm": 0.1833369880914688,
"learning_rate": 0.000184770464989989,
"loss": 2.7419009399414063,
"step": 40950
},
{
"epoch": 0.5373965757352339,
"grad_norm": 0.17406857013702393,
"learning_rate": 0.00018434886188266293,
"loss": 2.7479153442382813,
"step": 41000
},
{
"epoch": 0.5380519374129598,
"grad_norm": 0.1794329434633255,
"learning_rate": 0.00018392732874176847,
"loss": 2.7448220825195313,
"step": 41050
},
{
"epoch": 0.5387072990906857,
"grad_norm": 0.1862756609916687,
"learning_rate": 0.00018350586745171618,
"loss": 2.7439501953125,
"step": 41100
},
{
"epoch": 0.5393626607684116,
"grad_norm": 0.18455125391483307,
"learning_rate": 0.0001830844798965953,
"loss": 2.7480377197265624,
"step": 41150
},
{
"epoch": 0.5400180224461375,
"grad_norm": 0.18274185061454773,
"learning_rate": 0.00018266316796016564,
"loss": 2.757599182128906,
"step": 41200
},
{
"epoch": 0.5406733841238633,
"grad_norm": 0.1809069663286209,
"learning_rate": 0.0001822419335258488,
"loss": 2.739791259765625,
"step": 41250
},
{
"epoch": 0.5413287458015893,
"grad_norm": 0.18559743463993073,
"learning_rate": 0.0001818207784767201,
"loss": 2.7440814208984374,
"step": 41300
},
{
"epoch": 0.5419841074793151,
"grad_norm": 0.1843985766172409,
"learning_rate": 0.00018139970469549976,
"loss": 2.7467135620117187,
"step": 41350
},
{
"epoch": 0.5426394691570411,
"grad_norm": 0.18807105720043182,
"learning_rate": 0.00018097871406454487,
"loss": 2.7514608764648436,
"step": 41400
},
{
"epoch": 0.5432948308347669,
"grad_norm": 0.18305730819702148,
"learning_rate": 0.00018055780846584074,
"loss": 2.7453659057617186,
"step": 41450
},
{
"epoch": 0.5439501925124929,
"grad_norm": 0.1893676221370697,
"learning_rate": 0.00018013698978099256,
"loss": 2.749328918457031,
"step": 41500
},
{
"epoch": 0.5446055541902187,
"grad_norm": 0.1865210384130478,
"learning_rate": 0.00017971625989121698,
"loss": 2.7399996948242187,
"step": 41550
},
{
"epoch": 0.5452609158679447,
"grad_norm": 0.18489766120910645,
"learning_rate": 0.00017929562067733374,
"loss": 2.7390927124023436,
"step": 41600
},
{
"epoch": 0.5459162775456705,
"grad_norm": 0.1855878233909607,
"learning_rate": 0.00017887507401975717,
"loss": 2.7417999267578126,
"step": 41650
},
{
"epoch": 0.5465716392233965,
"grad_norm": 0.18664325773715973,
"learning_rate": 0.00017845462179848793,
"loss": 2.7299310302734376,
"step": 41700
},
{
"epoch": 0.5472270009011223,
"grad_norm": 0.18547379970550537,
"learning_rate": 0.0001780342658931043,
"loss": 2.7381558227539062,
"step": 41750
},
{
"epoch": 0.5478823625788481,
"grad_norm": 0.1792854517698288,
"learning_rate": 0.00017761400818275426,
"loss": 2.736330871582031,
"step": 41800
},
{
"epoch": 0.5485377242565741,
"grad_norm": 0.1798439770936966,
"learning_rate": 0.00017719385054614667,
"loss": 2.720264587402344,
"step": 41850
},
{
"epoch": 0.5491930859342999,
"grad_norm": 0.18211401998996735,
"learning_rate": 0.000176773794861543,
"loss": 2.7482330322265627,
"step": 41900
},
{
"epoch": 0.5498484476120259,
"grad_norm": 0.19189517199993134,
"learning_rate": 0.00017635384300674912,
"loss": 2.7439309692382814,
"step": 41950
},
{
"epoch": 0.5505038092897517,
"grad_norm": 0.19059494137763977,
"learning_rate": 0.00017593399685910657,
"loss": 2.753132019042969,
"step": 42000
},
{
"epoch": 0.5505038092897517,
"eval_loss": 2.6511430740356445,
"eval_runtime": 5.6331,
"eval_samples_per_second": 45.446,
"eval_steps_per_second": 5.681,
"step": 42000
},
{
"epoch": 0.5511591709674777,
"grad_norm": 0.19615179300308228,
"learning_rate": 0.00017551425829548438,
"loss": 2.7426458740234376,
"step": 42050
},
{
"epoch": 0.5518145326452035,
"grad_norm": 0.1869739294052124,
"learning_rate": 0.0001750946291922707,
"loss": 2.741033935546875,
"step": 42100
},
{
"epoch": 0.5524698943229295,
"grad_norm": 0.18508747220039368,
"learning_rate": 0.0001746751114253643,
"loss": 2.743408508300781,
"step": 42150
},
{
"epoch": 0.5531252560006553,
"grad_norm": 0.19253212213516235,
"learning_rate": 0.00017425570687016625,
"loss": 2.731234436035156,
"step": 42200
},
{
"epoch": 0.5537806176783813,
"grad_norm": 0.18232983350753784,
"learning_rate": 0.0001738364174015715,
"loss": 2.728257751464844,
"step": 42250
},
{
"epoch": 0.5544359793561071,
"grad_norm": 0.1846272051334381,
"learning_rate": 0.0001734172448939606,
"loss": 2.74490966796875,
"step": 42300
},
{
"epoch": 0.5550913410338331,
"grad_norm": 0.1905668079853058,
"learning_rate": 0.00017299819122119114,
"loss": 2.743033447265625,
"step": 42350
},
{
"epoch": 0.5557467027115589,
"grad_norm": 0.18363609910011292,
"learning_rate": 0.00017257925825658947,
"loss": 2.730335998535156,
"step": 42400
},
{
"epoch": 0.5564020643892849,
"grad_norm": 0.18854916095733643,
"learning_rate": 0.00017216044787294243,
"loss": 2.7323513793945313,
"step": 42450
},
{
"epoch": 0.5570574260670107,
"grad_norm": 0.1898990124464035,
"learning_rate": 0.0001717417619424888,
"loss": 2.7401559448242185,
"step": 42500
},
{
"epoch": 0.5577127877447366,
"grad_norm": 0.22384728491306305,
"learning_rate": 0.00017132320233691103,
"loss": 2.7380230712890623,
"step": 42550
},
{
"epoch": 0.5583681494224625,
"grad_norm": 0.19281762838363647,
"learning_rate": 0.00017090477092732687,
"loss": 2.7371759033203125,
"step": 42600
},
{
"epoch": 0.5590235111001884,
"grad_norm": 0.19027961790561676,
"learning_rate": 0.0001704864695842809,
"loss": 2.72266845703125,
"step": 42650
},
{
"epoch": 0.5596788727779143,
"grad_norm": 0.18994921445846558,
"learning_rate": 0.0001700683001777364,
"loss": 2.7218927001953124,
"step": 42700
},
{
"epoch": 0.5603342344556402,
"grad_norm": 0.1878528594970703,
"learning_rate": 0.00016965026457706675,
"loss": 2.7415142822265626,
"step": 42750
},
{
"epoch": 0.5609895961333661,
"grad_norm": 0.18615955114364624,
"learning_rate": 0.0001692323646510471,
"loss": 2.7404815673828127,
"step": 42800
},
{
"epoch": 0.561644957811092,
"grad_norm": 0.18635711073875427,
"learning_rate": 0.00016881460226784626,
"loss": 2.7431069946289064,
"step": 42850
},
{
"epoch": 0.5623003194888179,
"grad_norm": 0.19009113311767578,
"learning_rate": 0.00016839697929501806,
"loss": 2.7207156372070314,
"step": 42900
},
{
"epoch": 0.5629556811665438,
"grad_norm": 0.19169089198112488,
"learning_rate": 0.00016797949759949306,
"loss": 2.727295227050781,
"step": 42950
},
{
"epoch": 0.5636110428442697,
"grad_norm": 0.18418191373348236,
"learning_rate": 0.00016756215904757048,
"loss": 2.7204159545898436,
"step": 43000
},
{
"epoch": 0.5642664045219956,
"grad_norm": 0.19322168827056885,
"learning_rate": 0.0001671449655049093,
"loss": 2.734036865234375,
"step": 43050
},
{
"epoch": 0.5649217661997215,
"grad_norm": 0.1920599639415741,
"learning_rate": 0.00016672791883652055,
"loss": 2.7286300659179688,
"step": 43100
},
{
"epoch": 0.5655771278774474,
"grad_norm": 0.19389255344867706,
"learning_rate": 0.00016631102090675852,
"loss": 2.7239443969726564,
"step": 43150
},
{
"epoch": 0.5662324895551732,
"grad_norm": 0.1882966160774231,
"learning_rate": 0.00016589427357931264,
"loss": 2.7253955078125,
"step": 43200
},
{
"epoch": 0.5668878512328992,
"grad_norm": 0.19289398193359375,
"learning_rate": 0.0001654776787171991,
"loss": 2.7315249633789063,
"step": 43250
},
{
"epoch": 0.567543212910625,
"grad_norm": 0.1930937021970749,
"learning_rate": 0.00016506123818275245,
"loss": 2.733201599121094,
"step": 43300
},
{
"epoch": 0.568198574588351,
"grad_norm": 0.18936358392238617,
"learning_rate": 0.00016464495383761743,
"loss": 2.7308929443359373,
"step": 43350
},
{
"epoch": 0.5688539362660768,
"grad_norm": 0.19116507470607758,
"learning_rate": 0.00016422882754274048,
"loss": 2.7391571044921874,
"step": 43400
},
{
"epoch": 0.5695092979438028,
"grad_norm": 0.1958114206790924,
"learning_rate": 0.0001638128611583615,
"loss": 2.742430419921875,
"step": 43450
},
{
"epoch": 0.5701646596215286,
"grad_norm": 0.1928686648607254,
"learning_rate": 0.00016339705654400556,
"loss": 2.716089172363281,
"step": 43500
},
{
"epoch": 0.5708200212992546,
"grad_norm": 0.1955578476190567,
"learning_rate": 0.0001629814155584746,
"loss": 2.727280578613281,
"step": 43550
},
{
"epoch": 0.5714753829769804,
"grad_norm": 0.18764206767082214,
"learning_rate": 0.00016256594005983896,
"loss": 2.7315338134765623,
"step": 43600
},
{
"epoch": 0.5721307446547064,
"grad_norm": 0.1953878253698349,
"learning_rate": 0.00016215063190542933,
"loss": 2.7350732421875,
"step": 43650
},
{
"epoch": 0.5727861063324322,
"grad_norm": 0.18109111487865448,
"learning_rate": 0.00016173549295182818,
"loss": 2.7308255004882813,
"step": 43700
},
{
"epoch": 0.573441468010158,
"grad_norm": 0.1942085325717926,
"learning_rate": 0.00016132052505486166,
"loss": 2.72094482421875,
"step": 43750
},
{
"epoch": 0.574096829687884,
"grad_norm": 0.19263774156570435,
"learning_rate": 0.0001609057300695912,
"loss": 2.7240130615234377,
"step": 43800
},
{
"epoch": 0.5747521913656098,
"grad_norm": 0.18805767595767975,
"learning_rate": 0.0001604911098503053,
"loss": 2.721449279785156,
"step": 43850
},
{
"epoch": 0.5754075530433358,
"grad_norm": 0.190931499004364,
"learning_rate": 0.00016007666625051119,
"loss": 2.7199191284179687,
"step": 43900
},
{
"epoch": 0.5760629147210616,
"grad_norm": 0.18973998725414276,
"learning_rate": 0.00015966240112292646,
"loss": 2.7312277221679686,
"step": 43950
},
{
"epoch": 0.5767182763987876,
"grad_norm": 0.18965263664722443,
"learning_rate": 0.00015924831631947093,
"loss": 2.741227111816406,
"step": 44000
},
{
"epoch": 0.5767182763987876,
"eval_loss": 2.636690139770508,
"eval_runtime": 5.6334,
"eval_samples_per_second": 45.443,
"eval_steps_per_second": 5.68,
"step": 44000
}
],
"logging_steps": 50,
"max_steps": 76293,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 1000,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 6.734756539740979e+19,
"train_batch_size": 8,
"trial_name": null,
"trial_params": null
}