{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.5767182763987876, "eval_steps": 2000, "global_step": 44000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.000655361677725895, "grad_norm": 0.8467476963996887, "learning_rate": 9.800000000000001e-06, "loss": 10.180188598632812, "step": 50 }, { "epoch": 0.00131072335545179, "grad_norm": 0.9815138578414917, "learning_rate": 1.9800000000000004e-05, "loss": 8.96072021484375, "step": 100 }, { "epoch": 0.001966085033177685, "grad_norm": 0.9080342650413513, "learning_rate": 2.98e-05, "loss": 8.427459106445312, "step": 150 }, { "epoch": 0.00262144671090358, "grad_norm": 1.0856770277023315, "learning_rate": 3.9800000000000005e-05, "loss": 8.004227294921876, "step": 200 }, { "epoch": 0.003276808388629475, "grad_norm": 1.2208398580551147, "learning_rate": 4.9800000000000004e-05, "loss": 7.468403930664063, "step": 250 }, { "epoch": 0.00393217006635537, "grad_norm": 1.3048540353775024, "learning_rate": 5.9800000000000003e-05, "loss": 7.054309692382812, "step": 300 }, { "epoch": 0.004587531744081265, "grad_norm": 1.3516727685928345, "learning_rate": 6.98e-05, "loss": 6.717307739257812, "step": 350 }, { "epoch": 0.00524289342180716, "grad_norm": 1.4339897632598877, "learning_rate": 7.98e-05, "loss": 6.44216552734375, "step": 400 }, { "epoch": 0.005898255099533055, "grad_norm": 1.5168559551239014, "learning_rate": 8.98e-05, "loss": 6.2303076171875, "step": 450 }, { "epoch": 0.00655361677725895, "grad_norm": 1.279758334159851, "learning_rate": 9.98e-05, "loss": 6.04508056640625, "step": 500 }, { "epoch": 0.0072089784549848445, "grad_norm": 1.05825936794281, "learning_rate": 0.00010980000000000001, "loss": 5.892017211914062, "step": 550 }, { "epoch": 0.00786434013271074, "grad_norm": 0.8929133415222168, "learning_rate": 0.0001198, "loss": 5.74849609375, "step": 600 }, { "epoch": 0.008519701810436636, "grad_norm": 0.8807085752487183, "learning_rate": 0.0001298, "loss": 5.602015991210937, "step": 650 }, { "epoch": 0.00917506348816253, "grad_norm": 0.9188336730003357, "learning_rate": 0.0001398, "loss": 5.464683227539062, "step": 700 }, { "epoch": 0.009830425165888425, "grad_norm": 0.9099339842796326, "learning_rate": 0.0001498, "loss": 5.345360107421875, "step": 750 }, { "epoch": 0.01048578684361432, "grad_norm": 0.6145728826522827, "learning_rate": 0.0001598, "loss": 5.22587158203125, "step": 800 }, { "epoch": 0.011141148521340214, "grad_norm": 0.5609785318374634, "learning_rate": 0.0001698, "loss": 5.094062194824219, "step": 850 }, { "epoch": 0.01179651019906611, "grad_norm": 0.6819213628768921, "learning_rate": 0.0001798, "loss": 4.966111145019531, "step": 900 }, { "epoch": 0.012451871876792005, "grad_norm": 0.5285196304321289, "learning_rate": 0.0001898, "loss": 4.863562927246094, "step": 950 }, { "epoch": 0.0131072335545179, "grad_norm": 0.5692344903945923, "learning_rate": 0.0001998, "loss": 4.752896118164062, "step": 1000 }, { "epoch": 0.013762595232243794, "grad_norm": 0.4370023310184479, "learning_rate": 0.0002098, "loss": 4.660392761230469, "step": 1050 }, { "epoch": 0.014417956909969689, "grad_norm": 0.47209805250167847, "learning_rate": 0.0002198, "loss": 4.578724670410156, "step": 1100 }, { "epoch": 0.015073318587695584, "grad_norm": 0.5490202903747559, "learning_rate": 0.0002298, "loss": 4.496038513183594, "step": 1150 }, { "epoch": 0.01572868026542148, "grad_norm": 0.36493241786956787, "learning_rate": 0.00023980000000000003, "loss": 4.431192321777344, "step": 1200 }, { "epoch": 0.016384041943147375, "grad_norm": 0.36698517203330994, "learning_rate": 0.00024980000000000005, "loss": 4.366851806640625, "step": 1250 }, { "epoch": 0.01703940362087327, "grad_norm": 0.34887444972991943, "learning_rate": 0.00025979999999999997, "loss": 4.331812438964843, "step": 1300 }, { "epoch": 0.017694765298599164, "grad_norm": 0.367520272731781, "learning_rate": 0.0002698, "loss": 4.279182739257813, "step": 1350 }, { "epoch": 0.01835012697632506, "grad_norm": 0.3470223844051361, "learning_rate": 0.0002798, "loss": 4.249953918457031, "step": 1400 }, { "epoch": 0.019005488654050953, "grad_norm": 0.3077870309352875, "learning_rate": 0.00028980000000000005, "loss": 4.197932739257812, "step": 1450 }, { "epoch": 0.01966085033177685, "grad_norm": 0.39390048384666443, "learning_rate": 0.0002998, "loss": 4.161753234863281, "step": 1500 }, { "epoch": 0.020316212009502746, "grad_norm": 0.31337419152259827, "learning_rate": 0.0003098, "loss": 4.123833923339844, "step": 1550 }, { "epoch": 0.02097157368722864, "grad_norm": 0.29740896821022034, "learning_rate": 0.0003198, "loss": 4.100555419921875, "step": 1600 }, { "epoch": 0.021626935364954535, "grad_norm": 0.2615343928337097, "learning_rate": 0.0003298, "loss": 4.061597290039063, "step": 1650 }, { "epoch": 0.022282297042680428, "grad_norm": 0.26902270317077637, "learning_rate": 0.0003398, "loss": 4.043543395996093, "step": 1700 }, { "epoch": 0.022937658720406325, "grad_norm": 0.25607913732528687, "learning_rate": 0.00034980000000000005, "loss": 4.0114984130859375, "step": 1750 }, { "epoch": 0.02359302039813222, "grad_norm": 0.27139875292778015, "learning_rate": 0.0003598, "loss": 3.991943359375, "step": 1800 }, { "epoch": 0.024248382075858114, "grad_norm": 0.2561239004135132, "learning_rate": 0.0003698, "loss": 3.9760098266601562, "step": 1850 }, { "epoch": 0.02490374375358401, "grad_norm": 0.2643027603626251, "learning_rate": 0.0003798, "loss": 3.9419815063476564, "step": 1900 }, { "epoch": 0.025559105431309903, "grad_norm": 0.26799383759498596, "learning_rate": 0.00038980000000000004, "loss": 3.9217547607421874, "step": 1950 }, { "epoch": 0.0262144671090358, "grad_norm": 0.24854837357997894, "learning_rate": 0.0003998, "loss": 3.9029278564453125, "step": 2000 }, { "epoch": 0.0262144671090358, "eval_loss": 3.6972527503967285, "eval_runtime": 5.7053, "eval_samples_per_second": 44.87, "eval_steps_per_second": 5.609, "step": 2000 }, { "epoch": 0.026869828786761696, "grad_norm": 0.2584347128868103, "learning_rate": 0.00039999957066533194, "loss": 3.886022644042969, "step": 2050 }, { "epoch": 0.02752519046448759, "grad_norm": 0.24325698614120483, "learning_rate": 0.00039999824743671737, "loss": 3.862571105957031, "step": 2100 }, { "epoch": 0.028180552142213485, "grad_norm": 0.24973207712173462, "learning_rate": 0.00039999603014125647, "loss": 3.8482586669921877, "step": 2150 }, { "epoch": 0.028835913819939378, "grad_norm": 0.23583084344863892, "learning_rate": 0.0003999929187888615, "loss": 3.8230856323242186, "step": 2200 }, { "epoch": 0.029491275497665274, "grad_norm": 0.2415408194065094, "learning_rate": 0.00039998891339344133, "loss": 3.8136712646484376, "step": 2250 }, { "epoch": 0.030146637175391167, "grad_norm": 0.2631337642669678, "learning_rate": 0.0003999840139729017, "loss": 3.7838894653320314, "step": 2300 }, { "epoch": 0.030801998853117064, "grad_norm": 0.22226187586784363, "learning_rate": 0.0003999782205491446, "loss": 3.7657183837890624, "step": 2350 }, { "epoch": 0.03145736053084296, "grad_norm": 0.23696529865264893, "learning_rate": 0.000399971533148069, "loss": 3.7568017578125, "step": 2400 }, { "epoch": 0.03211272220856885, "grad_norm": 0.23273636400699615, "learning_rate": 0.00039996395179957, "loss": 3.743465576171875, "step": 2450 }, { "epoch": 0.03276808388629475, "grad_norm": 0.23096396028995514, "learning_rate": 0.00039995547653753905, "loss": 3.7067642211914062, "step": 2500 }, { "epoch": 0.033423445564020646, "grad_norm": 0.2173779308795929, "learning_rate": 0.00039994610739986383, "loss": 3.703720703125, "step": 2550 }, { "epoch": 0.03407880724174654, "grad_norm": 0.21475356817245483, "learning_rate": 0.00039993584442842776, "loss": 3.6886892700195313, "step": 2600 }, { "epoch": 0.03473416891947243, "grad_norm": 0.22239187359809875, "learning_rate": 0.0003999246876691102, "loss": 3.676330871582031, "step": 2650 }, { "epoch": 0.03538953059719833, "grad_norm": 0.23763835430145264, "learning_rate": 0.0003999126371717861, "loss": 3.6614373779296874, "step": 2700 }, { "epoch": 0.036044892274924224, "grad_norm": 0.20816709101200104, "learning_rate": 0.0003998996929903255, "loss": 3.6537326049804686, "step": 2750 }, { "epoch": 0.03670025395265012, "grad_norm": 0.21410858631134033, "learning_rate": 0.00039988585518259395, "loss": 3.638464050292969, "step": 2800 }, { "epoch": 0.03735561563037602, "grad_norm": 0.20823006331920624, "learning_rate": 0.0003998711238104515, "loss": 3.620465087890625, "step": 2850 }, { "epoch": 0.038010977308101906, "grad_norm": 0.2275841236114502, "learning_rate": 0.00039985549893975286, "loss": 3.605263366699219, "step": 2900 }, { "epoch": 0.0386663389858278, "grad_norm": 0.2017376720905304, "learning_rate": 0.0003998389806403471, "loss": 3.584982604980469, "step": 2950 }, { "epoch": 0.0393217006635537, "grad_norm": 0.21403516829013824, "learning_rate": 0.00039982156898607713, "loss": 3.600724182128906, "step": 3000 }, { "epoch": 0.039977062341279596, "grad_norm": 0.2169589102268219, "learning_rate": 0.00039980326405477957, "loss": 3.588856201171875, "step": 3050 }, { "epoch": 0.04063242401900549, "grad_norm": 0.21386539936065674, "learning_rate": 0.00039978406592828435, "loss": 3.576596374511719, "step": 3100 }, { "epoch": 0.04128778569673138, "grad_norm": 0.20095941424369812, "learning_rate": 0.00039976397469241416, "loss": 3.558380126953125, "step": 3150 }, { "epoch": 0.04194314737445728, "grad_norm": 0.20533066987991333, "learning_rate": 0.00039974299043698446, "loss": 3.5680126953125, "step": 3200 }, { "epoch": 0.042598509052183174, "grad_norm": 0.23280708491802216, "learning_rate": 0.0003997211132558026, "loss": 3.548220520019531, "step": 3250 }, { "epoch": 0.04325387072990907, "grad_norm": 0.21237953007221222, "learning_rate": 0.0003996983432466678, "loss": 3.5354214477539063, "step": 3300 }, { "epoch": 0.04390923240763497, "grad_norm": 0.21332086622714996, "learning_rate": 0.00039967468051137044, "loss": 3.52345458984375, "step": 3350 }, { "epoch": 0.044564594085360856, "grad_norm": 0.2084880918264389, "learning_rate": 0.0003996501251556918, "loss": 3.5277310180664063, "step": 3400 }, { "epoch": 0.04521995576308675, "grad_norm": 0.20562036335468292, "learning_rate": 0.0003996246772894036, "loss": 3.4971243286132814, "step": 3450 }, { "epoch": 0.04587531744081265, "grad_norm": 0.22141627967357635, "learning_rate": 0.00039959833702626717, "loss": 3.50343994140625, "step": 3500 }, { "epoch": 0.046530679118538545, "grad_norm": 0.20655743777751923, "learning_rate": 0.00039957110448403334, "loss": 3.490086669921875, "step": 3550 }, { "epoch": 0.04718604079626444, "grad_norm": 0.21529725193977356, "learning_rate": 0.00039954297978444186, "loss": 3.490438232421875, "step": 3600 }, { "epoch": 0.04784140247399033, "grad_norm": 0.21352700889110565, "learning_rate": 0.0003995139630532205, "loss": 3.476470642089844, "step": 3650 }, { "epoch": 0.04849676415171623, "grad_norm": 0.21655848622322083, "learning_rate": 0.00039948405442008495, "loss": 3.4527011108398438, "step": 3700 }, { "epoch": 0.049152125829442124, "grad_norm": 0.20387986302375793, "learning_rate": 0.0003994532540187379, "loss": 3.4542727661132813, "step": 3750 }, { "epoch": 0.04980748750716802, "grad_norm": 0.20096465945243835, "learning_rate": 0.0003994215619868688, "loss": 3.4588165283203125, "step": 3800 }, { "epoch": 0.05046284918489392, "grad_norm": 0.2160736620426178, "learning_rate": 0.0003993889784661527, "loss": 3.4502923583984373, "step": 3850 }, { "epoch": 0.051118210862619806, "grad_norm": 0.2020275592803955, "learning_rate": 0.0003993555036022502, "loss": 3.4401654052734374, "step": 3900 }, { "epoch": 0.0517735725403457, "grad_norm": 0.19931048154830933, "learning_rate": 0.00039932113754480634, "loss": 3.4484799194335936, "step": 3950 }, { "epoch": 0.0524289342180716, "grad_norm": 0.19830818474292755, "learning_rate": 0.0003992858804474504, "loss": 3.4245230102539064, "step": 4000 }, { "epoch": 0.0524289342180716, "eval_loss": 3.2663216590881348, "eval_runtime": 5.674, "eval_samples_per_second": 45.118, "eval_steps_per_second": 5.64, "step": 4000 }, { "epoch": 0.053084295895797495, "grad_norm": 0.18688614666461945, "learning_rate": 0.0003992497324677946, "loss": 3.429587707519531, "step": 4050 }, { "epoch": 0.05373965757352339, "grad_norm": 0.19800157845020294, "learning_rate": 0.000399212693767434, "loss": 3.424355163574219, "step": 4100 }, { "epoch": 0.05439501925124928, "grad_norm": 0.19706763327121735, "learning_rate": 0.0003991747645119454, "loss": 3.4139633178710938, "step": 4150 }, { "epoch": 0.05505038092897518, "grad_norm": 0.19184838235378265, "learning_rate": 0.0003991359448708868, "loss": 3.4140423583984374, "step": 4200 }, { "epoch": 0.055705742606701074, "grad_norm": 0.20454014837741852, "learning_rate": 0.00039909623501779634, "loss": 3.387943115234375, "step": 4250 }, { "epoch": 0.05636110428442697, "grad_norm": 0.19917985796928406, "learning_rate": 0.000399055635130192, "loss": 3.39353271484375, "step": 4300 }, { "epoch": 0.05701646596215286, "grad_norm": 0.20870596170425415, "learning_rate": 0.00039901414538957044, "loss": 3.3786090087890623, "step": 4350 }, { "epoch": 0.057671827639878756, "grad_norm": 0.2232063114643097, "learning_rate": 0.00039897176598140626, "loss": 3.38660400390625, "step": 4400 }, { "epoch": 0.05832718931760465, "grad_norm": 0.21013037860393524, "learning_rate": 0.0003989284970951512, "loss": 3.38319580078125, "step": 4450 }, { "epoch": 0.05898255099533055, "grad_norm": 0.20042237639427185, "learning_rate": 0.0003988843389242334, "loss": 3.3772076416015624, "step": 4500 }, { "epoch": 0.059637912673056445, "grad_norm": 0.19974368810653687, "learning_rate": 0.0003988392916660564, "loss": 3.3711737060546874, "step": 4550 }, { "epoch": 0.060293274350782335, "grad_norm": 0.2119089514017105, "learning_rate": 0.0003987933555219982, "loss": 3.36796630859375, "step": 4600 }, { "epoch": 0.06094863602850823, "grad_norm": 0.1994011104106903, "learning_rate": 0.0003987465306974105, "loss": 3.359444274902344, "step": 4650 }, { "epoch": 0.06160399770623413, "grad_norm": 0.1967809796333313, "learning_rate": 0.00039869881740161786, "loss": 3.3589797973632813, "step": 4700 }, { "epoch": 0.062259359383960024, "grad_norm": 0.19793909788131714, "learning_rate": 0.0003986502158479164, "loss": 3.3393264770507813, "step": 4750 }, { "epoch": 0.06291472106168591, "grad_norm": 0.20088161528110504, "learning_rate": 0.0003986007262535733, "loss": 3.338782958984375, "step": 4800 }, { "epoch": 0.06357008273941181, "grad_norm": 0.20041196048259735, "learning_rate": 0.00039855034883982547, "loss": 3.3399884033203127, "step": 4850 }, { "epoch": 0.0642254444171377, "grad_norm": 0.2128470093011856, "learning_rate": 0.00039849908383187885, "loss": 3.3452932739257815, "step": 4900 }, { "epoch": 0.0648808060948636, "grad_norm": 0.1939639002084732, "learning_rate": 0.000398446931458907, "loss": 3.3381222534179686, "step": 4950 }, { "epoch": 0.0655361677725895, "grad_norm": 0.2114746868610382, "learning_rate": 0.00039839389195405075, "loss": 3.308692626953125, "step": 5000 }, { "epoch": 0.0661915294503154, "grad_norm": 0.19832944869995117, "learning_rate": 0.00039833996555441626, "loss": 3.3209320068359376, "step": 5050 }, { "epoch": 0.06684689112804129, "grad_norm": 0.19068177044391632, "learning_rate": 0.0003982851525010748, "loss": 3.328127746582031, "step": 5100 }, { "epoch": 0.06750225280576719, "grad_norm": 0.21301378309726715, "learning_rate": 0.0003982294530390611, "loss": 3.306401672363281, "step": 5150 }, { "epoch": 0.06815761448349308, "grad_norm": 0.20991812646389008, "learning_rate": 0.00039817286741737265, "loss": 3.3046035766601562, "step": 5200 }, { "epoch": 0.06881297616121897, "grad_norm": 0.20005056262016296, "learning_rate": 0.00039811539588896825, "loss": 3.3102703857421876, "step": 5250 }, { "epoch": 0.06946833783894486, "grad_norm": 0.21483618021011353, "learning_rate": 0.00039805703871076707, "loss": 3.3117401123046877, "step": 5300 }, { "epoch": 0.07012369951667076, "grad_norm": 0.19281916320323944, "learning_rate": 0.0003979977961436475, "loss": 3.3061758422851564, "step": 5350 }, { "epoch": 0.07077906119439666, "grad_norm": 0.186942458152771, "learning_rate": 0.000397937668452446, "loss": 3.310947265625, "step": 5400 }, { "epoch": 0.07143442287212255, "grad_norm": 0.19823694229125977, "learning_rate": 0.00039787665590595577, "loss": 3.2919235229492188, "step": 5450 }, { "epoch": 0.07208978454984845, "grad_norm": 0.2860555052757263, "learning_rate": 0.00039781475877692565, "loss": 3.275509033203125, "step": 5500 }, { "epoch": 0.07274514622757434, "grad_norm": 0.19441960752010345, "learning_rate": 0.0003977519773420589, "loss": 3.280601806640625, "step": 5550 }, { "epoch": 0.07340050790530024, "grad_norm": 0.20171615481376648, "learning_rate": 0.000397688311882012, "loss": 3.285462646484375, "step": 5600 }, { "epoch": 0.07405586958302614, "grad_norm": 0.19068685173988342, "learning_rate": 0.0003976237626813934, "loss": 3.288756103515625, "step": 5650 }, { "epoch": 0.07471123126075203, "grad_norm": 0.2156117856502533, "learning_rate": 0.0003975583300287621, "loss": 3.267852783203125, "step": 5700 }, { "epoch": 0.07536659293847792, "grad_norm": 0.20415465533733368, "learning_rate": 0.00039749201421662635, "loss": 3.2689089965820313, "step": 5750 }, { "epoch": 0.07602195461620381, "grad_norm": 0.2025226503610611, "learning_rate": 0.00039742481554144276, "loss": 3.2593511962890624, "step": 5800 }, { "epoch": 0.07667731629392971, "grad_norm": 0.18992702662944794, "learning_rate": 0.0003973567343036144, "loss": 3.2599560546875, "step": 5850 }, { "epoch": 0.0773326779716556, "grad_norm": 0.18822775781154633, "learning_rate": 0.0003972877708074899, "loss": 3.2602944946289063, "step": 5900 }, { "epoch": 0.0779880396493815, "grad_norm": 0.19722387194633484, "learning_rate": 0.0003972179253613618, "loss": 3.260631408691406, "step": 5950 }, { "epoch": 0.0786434013271074, "grad_norm": 0.19092944264411926, "learning_rate": 0.00039714719827746534, "loss": 3.2433346557617186, "step": 6000 }, { "epoch": 0.0786434013271074, "eval_loss": 3.1140191555023193, "eval_runtime": 5.6684, "eval_samples_per_second": 45.163, "eval_steps_per_second": 5.645, "step": 6000 }, { "epoch": 0.0792987630048333, "grad_norm": 0.19689856469631195, "learning_rate": 0.00039707558987197694, "loss": 3.2530856323242188, "step": 6050 }, { "epoch": 0.07995412468255919, "grad_norm": 0.1850554198026657, "learning_rate": 0.000397003100465013, "loss": 3.2497039794921876, "step": 6100 }, { "epoch": 0.08060948636028509, "grad_norm": 0.18944397568702698, "learning_rate": 0.0003969297303806282, "loss": 3.234462890625, "step": 6150 }, { "epoch": 0.08126484803801098, "grad_norm": 0.2015562802553177, "learning_rate": 0.00039685547994681416, "loss": 3.2522567749023437, "step": 6200 }, { "epoch": 0.08192020971573687, "grad_norm": 0.17497248947620392, "learning_rate": 0.00039678034949549814, "loss": 3.2265985107421873, "step": 6250 }, { "epoch": 0.08257557139346276, "grad_norm": 0.19131280481815338, "learning_rate": 0.0003967043393625412, "loss": 3.2425271606445314, "step": 6300 }, { "epoch": 0.08323093307118866, "grad_norm": 0.18608218431472778, "learning_rate": 0.0003966274498877371, "loss": 3.2364862060546873, "step": 6350 }, { "epoch": 0.08388629474891456, "grad_norm": 0.1833186149597168, "learning_rate": 0.00039654968141481054, "loss": 3.21429443359375, "step": 6400 }, { "epoch": 0.08454165642664045, "grad_norm": 0.20810578763484955, "learning_rate": 0.00039647103429141554, "loss": 3.2309637451171875, "step": 6450 }, { "epoch": 0.08519701810436635, "grad_norm": 0.17244310677051544, "learning_rate": 0.0003963915088691342, "loss": 3.22532470703125, "step": 6500 }, { "epoch": 0.08585237978209224, "grad_norm": 0.1906498372554779, "learning_rate": 0.0003963111055034747, "loss": 3.2140386962890624, "step": 6550 }, { "epoch": 0.08650774145981814, "grad_norm": 0.18736179172992706, "learning_rate": 0.00039622982455387023, "loss": 3.209306335449219, "step": 6600 }, { "epoch": 0.08716310313754404, "grad_norm": 0.18322816491127014, "learning_rate": 0.000396147666383677, "loss": 3.217623596191406, "step": 6650 }, { "epoch": 0.08781846481526993, "grad_norm": 0.20019809901714325, "learning_rate": 0.00039606463136017265, "loss": 3.2175857543945314, "step": 6700 }, { "epoch": 0.08847382649299582, "grad_norm": 0.186569482088089, "learning_rate": 0.0003959807198545547, "loss": 3.224698486328125, "step": 6750 }, { "epoch": 0.08912918817072171, "grad_norm": 0.1946743130683899, "learning_rate": 0.0003958959322419391, "loss": 3.2008099365234375, "step": 6800 }, { "epoch": 0.08978454984844761, "grad_norm": 0.19748519361019135, "learning_rate": 0.0003958102689013579, "loss": 3.2152249145507814, "step": 6850 }, { "epoch": 0.0904399115261735, "grad_norm": 0.21013770997524261, "learning_rate": 0.00039572373021575836, "loss": 3.2081793212890624, "step": 6900 }, { "epoch": 0.0910952732038994, "grad_norm": 0.1917051523923874, "learning_rate": 0.0003956363165720007, "loss": 3.2136236572265626, "step": 6950 }, { "epoch": 0.0917506348816253, "grad_norm": 0.19501028954982758, "learning_rate": 0.00039554802836085654, "loss": 3.2055865478515626, "step": 7000 }, { "epoch": 0.0924059965593512, "grad_norm": 0.18697288632392883, "learning_rate": 0.0003954588659770071, "loss": 3.208973693847656, "step": 7050 }, { "epoch": 0.09306135823707709, "grad_norm": 0.20416851341724396, "learning_rate": 0.0003953688298190416, "loss": 3.195947265625, "step": 7100 }, { "epoch": 0.09371671991480299, "grad_norm": 0.18846778571605682, "learning_rate": 0.00039527792028945535, "loss": 3.196394348144531, "step": 7150 }, { "epoch": 0.09437208159252888, "grad_norm": 0.18293488025665283, "learning_rate": 0.0003951861377946477, "loss": 3.1826910400390624, "step": 7200 }, { "epoch": 0.09502744327025477, "grad_norm": 0.18307985365390778, "learning_rate": 0.0003950934827449208, "loss": 3.190108337402344, "step": 7250 }, { "epoch": 0.09568280494798066, "grad_norm": 0.19038031995296478, "learning_rate": 0.0003949999555544774, "loss": 3.1824240112304687, "step": 7300 }, { "epoch": 0.09633816662570656, "grad_norm": 0.18110263347625732, "learning_rate": 0.00039490555664141875, "loss": 3.1771340942382813, "step": 7350 }, { "epoch": 0.09699352830343246, "grad_norm": 0.19195981323719025, "learning_rate": 0.00039481028642774344, "loss": 3.166077880859375, "step": 7400 }, { "epoch": 0.09764888998115835, "grad_norm": 0.1789332777261734, "learning_rate": 0.00039471414533934473, "loss": 3.184651184082031, "step": 7450 }, { "epoch": 0.09830425165888425, "grad_norm": 0.1829993724822998, "learning_rate": 0.0003946171338060093, "loss": 3.1751388549804687, "step": 7500 }, { "epoch": 0.09895961333661014, "grad_norm": 0.19253574311733246, "learning_rate": 0.0003945192522614149, "loss": 3.1733053588867186, "step": 7550 }, { "epoch": 0.09961497501433604, "grad_norm": 0.18893469870090485, "learning_rate": 0.0003944205011431286, "loss": 3.1753680419921877, "step": 7600 }, { "epoch": 0.10027033669206194, "grad_norm": 0.1826004981994629, "learning_rate": 0.00039432088089260477, "loss": 3.1660992431640627, "step": 7650 }, { "epoch": 0.10092569836978783, "grad_norm": 0.18192994594573975, "learning_rate": 0.0003942203919551831, "loss": 3.1639108276367187, "step": 7700 }, { "epoch": 0.10158106004751372, "grad_norm": 0.18050242960453033, "learning_rate": 0.00039411903478008665, "loss": 3.1753009033203123, "step": 7750 }, { "epoch": 0.10223642172523961, "grad_norm": 0.18302783370018005, "learning_rate": 0.0003940168098204199, "loss": 3.174813232421875, "step": 7800 }, { "epoch": 0.10289178340296551, "grad_norm": 0.190107062458992, "learning_rate": 0.00039391371753316653, "loss": 3.162717590332031, "step": 7850 }, { "epoch": 0.1035471450806914, "grad_norm": 0.19132424890995026, "learning_rate": 0.00039380975837918753, "loss": 3.1576858520507813, "step": 7900 }, { "epoch": 0.1042025067584173, "grad_norm": 0.1888846904039383, "learning_rate": 0.00039370493282321926, "loss": 3.1505615234375, "step": 7950 }, { "epoch": 0.1048578684361432, "grad_norm": 0.23212771117687225, "learning_rate": 0.0003935992413338711, "loss": 3.153447570800781, "step": 8000 }, { "epoch": 0.1048578684361432, "eval_loss": 3.030266284942627, "eval_runtime": 5.6687, "eval_samples_per_second": 45.16, "eval_steps_per_second": 5.645, "step": 8000 }, { "epoch": 0.1055132301138691, "grad_norm": 0.18021260201931, "learning_rate": 0.0003934926843836233, "loss": 3.1522039794921874, "step": 8050 }, { "epoch": 0.10616859179159499, "grad_norm": 0.1841682493686676, "learning_rate": 0.00039338526244882537, "loss": 3.1465692138671875, "step": 8100 }, { "epoch": 0.10682395346932089, "grad_norm": 0.1825447380542755, "learning_rate": 0.0003932769760096934, "loss": 3.140274963378906, "step": 8150 }, { "epoch": 0.10747931514704678, "grad_norm": 0.19171936810016632, "learning_rate": 0.0003931678255503083, "loss": 3.1448828125, "step": 8200 }, { "epoch": 0.10813467682477267, "grad_norm": 0.17011715471744537, "learning_rate": 0.00039305781155861316, "loss": 3.137694091796875, "step": 8250 }, { "epoch": 0.10879003850249856, "grad_norm": 0.18459941446781158, "learning_rate": 0.0003929469345264119, "loss": 3.1533859252929686, "step": 8300 }, { "epoch": 0.10944540018022446, "grad_norm": 0.21103478968143463, "learning_rate": 0.000392835194949366, "loss": 3.1345169067382814, "step": 8350 }, { "epoch": 0.11010076185795035, "grad_norm": 0.17616821825504303, "learning_rate": 0.00039272259332699325, "loss": 3.133195495605469, "step": 8400 }, { "epoch": 0.11075612353567625, "grad_norm": 0.18857717514038086, "learning_rate": 0.00039260913016266486, "loss": 3.14027099609375, "step": 8450 }, { "epoch": 0.11141148521340215, "grad_norm": 0.19104991853237152, "learning_rate": 0.00039249480596360365, "loss": 3.1366796875, "step": 8500 }, { "epoch": 0.11206684689112804, "grad_norm": 0.21827660501003265, "learning_rate": 0.0003923796212408814, "loss": 3.1296182250976563, "step": 8550 }, { "epoch": 0.11272220856885394, "grad_norm": 0.17744766175746918, "learning_rate": 0.0003922635765094168, "loss": 3.1384088134765626, "step": 8600 }, { "epoch": 0.11337757024657984, "grad_norm": 0.1751570999622345, "learning_rate": 0.0003921466722879732, "loss": 3.1423275756835936, "step": 8650 }, { "epoch": 0.11403293192430572, "grad_norm": 0.19907452166080475, "learning_rate": 0.0003920289090991561, "loss": 3.1503741455078127, "step": 8700 }, { "epoch": 0.11468829360203162, "grad_norm": 0.1859847456216812, "learning_rate": 0.0003919102874694109, "loss": 3.1316952514648437, "step": 8750 }, { "epoch": 0.11534365527975751, "grad_norm": 0.20440617203712463, "learning_rate": 0.0003917908079290206, "loss": 3.121751708984375, "step": 8800 }, { "epoch": 0.11599901695748341, "grad_norm": 0.18676170706748962, "learning_rate": 0.00039167047101210334, "loss": 3.1222894287109373, "step": 8850 }, { "epoch": 0.1166543786352093, "grad_norm": 0.17034347355365753, "learning_rate": 0.00039154927725661013, "loss": 3.1269760131835938, "step": 8900 }, { "epoch": 0.1173097403129352, "grad_norm": 0.17997117340564728, "learning_rate": 0.00039142722720432227, "loss": 3.108952941894531, "step": 8950 }, { "epoch": 0.1179651019906611, "grad_norm": 0.17934370040893555, "learning_rate": 0.00039130432140084906, "loss": 3.1181689453125, "step": 9000 }, { "epoch": 0.118620463668387, "grad_norm": 0.18724671006202698, "learning_rate": 0.0003911805603956254, "loss": 3.111900634765625, "step": 9050 }, { "epoch": 0.11927582534611289, "grad_norm": 0.18042142689228058, "learning_rate": 0.00039105594474190907, "loss": 3.1231924438476564, "step": 9100 }, { "epoch": 0.11993118702383879, "grad_norm": 0.19561563432216644, "learning_rate": 0.00039093047499677867, "loss": 3.1188885498046877, "step": 9150 }, { "epoch": 0.12058654870156467, "grad_norm": 0.1706327497959137, "learning_rate": 0.0003908041517211308, "loss": 3.121850891113281, "step": 9200 }, { "epoch": 0.12124191037929057, "grad_norm": 0.1827847957611084, "learning_rate": 0.0003906769754796777, "loss": 3.1112911987304686, "step": 9250 }, { "epoch": 0.12189727205701646, "grad_norm": 0.1799037903547287, "learning_rate": 0.00039054894684094457, "loss": 3.105826721191406, "step": 9300 }, { "epoch": 0.12255263373474236, "grad_norm": 0.16809692978858948, "learning_rate": 0.0003904200663772673, "loss": 3.1074072265625, "step": 9350 }, { "epoch": 0.12320799541246825, "grad_norm": 0.18500255048274994, "learning_rate": 0.00039029033466478965, "loss": 3.1086190795898436, "step": 9400 }, { "epoch": 0.12386335709019415, "grad_norm": 0.18889391422271729, "learning_rate": 0.00039015975228346084, "loss": 3.114319152832031, "step": 9450 }, { "epoch": 0.12451871876792005, "grad_norm": 0.1791427731513977, "learning_rate": 0.00039002831981703283, "loss": 3.1086251831054685, "step": 9500 }, { "epoch": 0.12517408044564593, "grad_norm": 0.17623098194599152, "learning_rate": 0.0003898960378530579, "loss": 3.100244445800781, "step": 9550 }, { "epoch": 0.12582944212337183, "grad_norm": 0.17946070432662964, "learning_rate": 0.0003897629069828858, "loss": 3.1039193725585936, "step": 9600 }, { "epoch": 0.12648480380109772, "grad_norm": 0.18811431527137756, "learning_rate": 0.00038962892780166123, "loss": 3.0974887084960936, "step": 9650 }, { "epoch": 0.12714016547882362, "grad_norm": 0.1763724833726883, "learning_rate": 0.0003894941009083211, "loss": 3.09368408203125, "step": 9700 }, { "epoch": 0.12779552715654952, "grad_norm": 0.1800798773765564, "learning_rate": 0.00038935842690559206, "loss": 3.090147705078125, "step": 9750 }, { "epoch": 0.1284508888342754, "grad_norm": 0.17083688080310822, "learning_rate": 0.0003892219063999875, "loss": 3.0878085327148437, "step": 9800 }, { "epoch": 0.1291062505120013, "grad_norm": 0.1893988847732544, "learning_rate": 0.00038908454000180503, "loss": 3.0839697265625, "step": 9850 }, { "epoch": 0.1297616121897272, "grad_norm": 0.18590691685676575, "learning_rate": 0.00038894632832512386, "loss": 3.0866567993164065, "step": 9900 }, { "epoch": 0.1304169738674531, "grad_norm": 0.17768535017967224, "learning_rate": 0.00038880727198780166, "loss": 3.09480224609375, "step": 9950 }, { "epoch": 0.131072335545179, "grad_norm": 0.17305518686771393, "learning_rate": 0.00038866737161147226, "loss": 3.089879455566406, "step": 10000 }, { "epoch": 0.131072335545179, "eval_loss": 2.964634895324707, "eval_runtime": 5.6793, "eval_samples_per_second": 45.076, "eval_steps_per_second": 5.634, "step": 10000 }, { "epoch": 0.1317276972229049, "grad_norm": 0.17475514113903046, "learning_rate": 0.00038852662782154257, "loss": 3.083099365234375, "step": 10050 }, { "epoch": 0.1323830589006308, "grad_norm": 0.1707238256931305, "learning_rate": 0.0003883850412471899, "loss": 3.09041259765625, "step": 10100 }, { "epoch": 0.1330384205783567, "grad_norm": 0.17580024898052216, "learning_rate": 0.00038824261252135906, "loss": 3.0782601928710935, "step": 10150 }, { "epoch": 0.13369378225608258, "grad_norm": 0.181544229388237, "learning_rate": 0.00038809934228075966, "loss": 3.0771636962890625, "step": 10200 }, { "epoch": 0.13434914393380848, "grad_norm": 0.18768192827701569, "learning_rate": 0.0003879552311658632, "loss": 3.0775961303710937, "step": 10250 }, { "epoch": 0.13500450561153438, "grad_norm": 0.17648795247077942, "learning_rate": 0.00038781027982090016, "loss": 3.075372619628906, "step": 10300 }, { "epoch": 0.13565986728926027, "grad_norm": 0.17668746411800385, "learning_rate": 0.0003876644888938571, "loss": 3.0861465454101564, "step": 10350 }, { "epoch": 0.13631522896698617, "grad_norm": 0.17767569422721863, "learning_rate": 0.00038751785903647404, "loss": 3.078529968261719, "step": 10400 }, { "epoch": 0.13697059064471204, "grad_norm": 0.17861232161521912, "learning_rate": 0.0003873703909042411, "loss": 3.06550537109375, "step": 10450 }, { "epoch": 0.13762595232243793, "grad_norm": 0.17755211889743805, "learning_rate": 0.00038722208515639593, "loss": 3.08282958984375, "step": 10500 }, { "epoch": 0.13828131400016383, "grad_norm": 0.16997002065181732, "learning_rate": 0.0003870729424559206, "loss": 3.0684124755859377, "step": 10550 }, { "epoch": 0.13893667567788973, "grad_norm": 0.1739063411951065, "learning_rate": 0.0003869229634695387, "loss": 3.0850872802734375, "step": 10600 }, { "epoch": 0.13959203735561562, "grad_norm": 0.18006552755832672, "learning_rate": 0.00038677214886771223, "loss": 3.077156982421875, "step": 10650 }, { "epoch": 0.14024739903334152, "grad_norm": 0.19680453836917877, "learning_rate": 0.00038662049932463883, "loss": 3.0760400390625, "step": 10700 }, { "epoch": 0.14090276071106742, "grad_norm": 0.17581500113010406, "learning_rate": 0.0003864680155182485, "loss": 3.081645202636719, "step": 10750 }, { "epoch": 0.1415581223887933, "grad_norm": 0.16959214210510254, "learning_rate": 0.0003863146981302009, "loss": 3.0582818603515625, "step": 10800 }, { "epoch": 0.1422134840665192, "grad_norm": 0.18207167088985443, "learning_rate": 0.000386160547845882, "loss": 3.072328796386719, "step": 10850 }, { "epoch": 0.1428688457442451, "grad_norm": 0.17250484228134155, "learning_rate": 0.00038600556535440107, "loss": 3.06542236328125, "step": 10900 }, { "epoch": 0.143524207421971, "grad_norm": 0.1710938960313797, "learning_rate": 0.00038584975134858774, "loss": 3.0559844970703125, "step": 10950 }, { "epoch": 0.1441795690996969, "grad_norm": 0.18157102167606354, "learning_rate": 0.0003856931065249888, "loss": 3.0589913940429687, "step": 11000 }, { "epoch": 0.1448349307774228, "grad_norm": 0.1723930984735489, "learning_rate": 0.0003855356315838651, "loss": 3.071495361328125, "step": 11050 }, { "epoch": 0.1454902924551487, "grad_norm": 0.16851253807544708, "learning_rate": 0.00038537732722918847, "loss": 3.056437683105469, "step": 11100 }, { "epoch": 0.1461456541328746, "grad_norm": 0.17625807225704193, "learning_rate": 0.0003852181941686384, "loss": 3.047527160644531, "step": 11150 }, { "epoch": 0.14680101581060048, "grad_norm": 0.20426708459854126, "learning_rate": 0.0003850582331135992, "loss": 3.057506103515625, "step": 11200 }, { "epoch": 0.14745637748832638, "grad_norm": 0.16924306750297546, "learning_rate": 0.0003848974447791564, "loss": 3.0567062377929686, "step": 11250 }, { "epoch": 0.14811173916605228, "grad_norm": 0.17206047475337982, "learning_rate": 0.00038473582988409393, "loss": 3.0577032470703127, "step": 11300 }, { "epoch": 0.14876710084377817, "grad_norm": 0.17455650866031647, "learning_rate": 0.00038457338915089085, "loss": 3.052936706542969, "step": 11350 }, { "epoch": 0.14942246252150407, "grad_norm": 0.1741814911365509, "learning_rate": 0.00038441012330571765, "loss": 3.057178649902344, "step": 11400 }, { "epoch": 0.15007782419922994, "grad_norm": 0.17035724222660065, "learning_rate": 0.00038424603307843385, "loss": 3.0449142456054688, "step": 11450 }, { "epoch": 0.15073318587695583, "grad_norm": 0.1668204665184021, "learning_rate": 0.00038408111920258393, "loss": 3.07284912109375, "step": 11500 }, { "epoch": 0.15138854755468173, "grad_norm": 0.17877808213233948, "learning_rate": 0.00038391538241539446, "loss": 3.0634539794921873, "step": 11550 }, { "epoch": 0.15204390923240763, "grad_norm": 0.17286644876003265, "learning_rate": 0.0003837488234577709, "loss": 3.0476004028320314, "step": 11600 }, { "epoch": 0.15269927091013352, "grad_norm": 0.19057217240333557, "learning_rate": 0.00038358144307429386, "loss": 3.0427459716796874, "step": 11650 }, { "epoch": 0.15335463258785942, "grad_norm": 0.18744225800037384, "learning_rate": 0.00038341324201321615, "loss": 3.0610775756835937, "step": 11700 }, { "epoch": 0.15400999426558531, "grad_norm": 0.18148574233055115, "learning_rate": 0.0003832442210264594, "loss": 3.0462969970703124, "step": 11750 }, { "epoch": 0.1546653559433112, "grad_norm": 0.1851021647453308, "learning_rate": 0.00038307438086961044, "loss": 3.0692657470703124, "step": 11800 }, { "epoch": 0.1553207176210371, "grad_norm": 0.1772390455007553, "learning_rate": 0.00038290372230191834, "loss": 3.0441015625, "step": 11850 }, { "epoch": 0.155976079298763, "grad_norm": 0.1643557995557785, "learning_rate": 0.00038273224608629045, "loss": 3.0395452880859377, "step": 11900 }, { "epoch": 0.1566314409764889, "grad_norm": 0.17523615062236786, "learning_rate": 0.00038255995298928957, "loss": 3.0324087524414063, "step": 11950 }, { "epoch": 0.1572868026542148, "grad_norm": 0.1734519898891449, "learning_rate": 0.0003823868437811302, "loss": 3.035924987792969, "step": 12000 }, { "epoch": 0.1572868026542148, "eval_loss": 2.9189553260803223, "eval_runtime": 5.6766, "eval_samples_per_second": 45.098, "eval_steps_per_second": 5.637, "step": 12000 }, { "epoch": 0.1579421643319407, "grad_norm": 0.16464713215827942, "learning_rate": 0.00038221291923567515, "loss": 3.0323388671875, "step": 12050 }, { "epoch": 0.1585975260096666, "grad_norm": 0.17450423538684845, "learning_rate": 0.00038203818013043196, "loss": 3.03869384765625, "step": 12100 }, { "epoch": 0.15925288768739249, "grad_norm": 0.18363073468208313, "learning_rate": 0.00038186262724654985, "loss": 3.0385845947265624, "step": 12150 }, { "epoch": 0.15990824936511838, "grad_norm": 0.17136621475219727, "learning_rate": 0.0003816862613688156, "loss": 3.037435302734375, "step": 12200 }, { "epoch": 0.16056361104284428, "grad_norm": 0.17278067767620087, "learning_rate": 0.0003815090832856506, "loss": 3.0334677124023437, "step": 12250 }, { "epoch": 0.16121897272057018, "grad_norm": 0.18040911853313446, "learning_rate": 0.0003813310937891072, "loss": 3.051009521484375, "step": 12300 }, { "epoch": 0.16187433439829607, "grad_norm": 0.1648985892534256, "learning_rate": 0.0003811522936748646, "loss": 3.0288815307617187, "step": 12350 }, { "epoch": 0.16252969607602197, "grad_norm": 0.17963039875030518, "learning_rate": 0.00038097268374222634, "loss": 3.044788513183594, "step": 12400 }, { "epoch": 0.16318505775374784, "grad_norm": 0.1665796935558319, "learning_rate": 0.00038079226479411575, "loss": 3.0326351928710937, "step": 12450 }, { "epoch": 0.16384041943147373, "grad_norm": 0.17408335208892822, "learning_rate": 0.000380611037637073, "loss": 3.025340270996094, "step": 12500 }, { "epoch": 0.16449578110919963, "grad_norm": 0.1731732189655304, "learning_rate": 0.000380429003081251, "loss": 3.0255218505859376, "step": 12550 }, { "epoch": 0.16515114278692553, "grad_norm": 0.16398881375789642, "learning_rate": 0.0003802461619404123, "loss": 3.0350070190429688, "step": 12600 }, { "epoch": 0.16580650446465142, "grad_norm": 0.1704774647951126, "learning_rate": 0.00038006251503192506, "loss": 3.02690673828125, "step": 12650 }, { "epoch": 0.16646186614237732, "grad_norm": 0.17014211416244507, "learning_rate": 0.0003798780631767595, "loss": 3.0244546508789063, "step": 12700 }, { "epoch": 0.16711722782010321, "grad_norm": 0.1683683842420578, "learning_rate": 0.00037969280719948433, "loss": 3.022377624511719, "step": 12750 }, { "epoch": 0.1677725894978291, "grad_norm": 0.1796732097864151, "learning_rate": 0.00037950674792826294, "loss": 3.027694091796875, "step": 12800 }, { "epoch": 0.168427951175555, "grad_norm": 0.16469725966453552, "learning_rate": 0.00037931988619484974, "loss": 3.0360150146484375, "step": 12850 }, { "epoch": 0.1690833128532809, "grad_norm": 0.1586015522480011, "learning_rate": 0.0003791322228345864, "loss": 3.0196652221679687, "step": 12900 }, { "epoch": 0.1697386745310068, "grad_norm": 0.18051502108573914, "learning_rate": 0.00037894375868639834, "loss": 3.0329571533203126, "step": 12950 }, { "epoch": 0.1703940362087327, "grad_norm": 0.16774311661720276, "learning_rate": 0.0003787544945927906, "loss": 3.0260247802734375, "step": 13000 }, { "epoch": 0.1710493978864586, "grad_norm": 0.17393845319747925, "learning_rate": 0.00037856443139984425, "loss": 3.035395202636719, "step": 13050 }, { "epoch": 0.1717047595641845, "grad_norm": 0.17306984961032867, "learning_rate": 0.00037837356995721287, "loss": 3.0191970825195313, "step": 13100 }, { "epoch": 0.17236012124191039, "grad_norm": 0.1667943298816681, "learning_rate": 0.0003781819111181184, "loss": 3.0191571044921877, "step": 13150 }, { "epoch": 0.17301548291963628, "grad_norm": 0.16538003087043762, "learning_rate": 0.00037798945573934726, "loss": 3.014737243652344, "step": 13200 }, { "epoch": 0.17367084459736218, "grad_norm": 0.1665930300951004, "learning_rate": 0.000377796204681247, "loss": 3.0187252807617186, "step": 13250 }, { "epoch": 0.17432620627508807, "grad_norm": 0.1760169267654419, "learning_rate": 0.00037760215880772196, "loss": 3.016280517578125, "step": 13300 }, { "epoch": 0.17498156795281397, "grad_norm": 0.16998058557510376, "learning_rate": 0.0003774073189862297, "loss": 3.01614990234375, "step": 13350 }, { "epoch": 0.17563692963053987, "grad_norm": 0.18504323065280914, "learning_rate": 0.0003772116860877769, "loss": 3.0107766723632814, "step": 13400 }, { "epoch": 0.17629229130826574, "grad_norm": 0.18150901794433594, "learning_rate": 0.00037701526098691564, "loss": 3.0088739013671875, "step": 13450 }, { "epoch": 0.17694765298599163, "grad_norm": 0.17311416566371918, "learning_rate": 0.00037681804456173956, "loss": 3.0030789184570312, "step": 13500 }, { "epoch": 0.17760301466371753, "grad_norm": 0.1601880043745041, "learning_rate": 0.0003766200376938797, "loss": 3.0118267822265623, "step": 13550 }, { "epoch": 0.17825837634144343, "grad_norm": 0.16208156943321228, "learning_rate": 0.00037642124126850067, "loss": 3.01557373046875, "step": 13600 }, { "epoch": 0.17891373801916932, "grad_norm": 0.1766621470451355, "learning_rate": 0.00037622165617429674, "loss": 3.006506042480469, "step": 13650 }, { "epoch": 0.17956909969689522, "grad_norm": 0.16724593937397003, "learning_rate": 0.0003760212833034878, "loss": 3.0231564331054686, "step": 13700 }, { "epoch": 0.18022446137462111, "grad_norm": 0.1700139045715332, "learning_rate": 0.0003758201235518154, "loss": 3.0107156372070314, "step": 13750 }, { "epoch": 0.180879823052347, "grad_norm": 0.17110072076320648, "learning_rate": 0.00037561817781853874, "loss": 3.00603515625, "step": 13800 }, { "epoch": 0.1815351847300729, "grad_norm": 0.17613136768341064, "learning_rate": 0.00037541544700643066, "loss": 2.9850637817382815, "step": 13850 }, { "epoch": 0.1821905464077988, "grad_norm": 0.18742725253105164, "learning_rate": 0.0003752119320217736, "loss": 2.994374084472656, "step": 13900 }, { "epoch": 0.1828459080855247, "grad_norm": 0.161526620388031, "learning_rate": 0.0003750076337743555, "loss": 2.9907281494140623, "step": 13950 }, { "epoch": 0.1835012697632506, "grad_norm": 0.16326123476028442, "learning_rate": 0.00037480255317746595, "loss": 2.9954653930664064, "step": 14000 }, { "epoch": 0.1835012697632506, "eval_loss": 2.889880657196045, "eval_runtime": 5.6697, "eval_samples_per_second": 45.152, "eval_steps_per_second": 5.644, "step": 14000 }, { "epoch": 0.1841566314409765, "grad_norm": 0.1709296703338623, "learning_rate": 0.00037459669114789157, "loss": 3.005021667480469, "step": 14050 }, { "epoch": 0.1848119931187024, "grad_norm": 0.17104662954807281, "learning_rate": 0.00037439004860591264, "loss": 3.006434326171875, "step": 14100 }, { "epoch": 0.18546735479642829, "grad_norm": 0.1657409965991974, "learning_rate": 0.0003741826264752985, "loss": 2.998061218261719, "step": 14150 }, { "epoch": 0.18612271647415418, "grad_norm": 0.16134639084339142, "learning_rate": 0.0003739744256833034, "loss": 3.0036053466796875, "step": 14200 }, { "epoch": 0.18677807815188008, "grad_norm": 0.16234835982322693, "learning_rate": 0.0003737654471606628, "loss": 3.000784606933594, "step": 14250 }, { "epoch": 0.18743343982960597, "grad_norm": 0.1607351154088974, "learning_rate": 0.00037355569184158865, "loss": 2.99138427734375, "step": 14300 }, { "epoch": 0.18808880150733187, "grad_norm": 0.16982115805149078, "learning_rate": 0.0003733451606637655, "loss": 2.998489990234375, "step": 14350 }, { "epoch": 0.18874416318505777, "grad_norm": 0.17614851891994476, "learning_rate": 0.0003731338545683464, "loss": 2.997017822265625, "step": 14400 }, { "epoch": 0.18939952486278364, "grad_norm": 0.16362133622169495, "learning_rate": 0.0003729217744999484, "loss": 2.994207763671875, "step": 14450 }, { "epoch": 0.19005488654050953, "grad_norm": 0.19033735990524292, "learning_rate": 0.0003727089214066487, "loss": 2.995988464355469, "step": 14500 }, { "epoch": 0.19071024821823543, "grad_norm": 0.1774059385061264, "learning_rate": 0.0003724952962399801, "loss": 3.0040826416015625, "step": 14550 }, { "epoch": 0.19136560989596132, "grad_norm": 0.166715607047081, "learning_rate": 0.00037228089995492683, "loss": 3.0081997680664063, "step": 14600 }, { "epoch": 0.19202097157368722, "grad_norm": 0.17395304143428802, "learning_rate": 0.0003720657335099203, "loss": 2.9944384765625, "step": 14650 }, { "epoch": 0.19267633325141312, "grad_norm": 0.16293704509735107, "learning_rate": 0.000371849797866835, "loss": 2.989776611328125, "step": 14700 }, { "epoch": 0.19333169492913901, "grad_norm": 0.17767402529716492, "learning_rate": 0.00037163309399098374, "loss": 2.9949606323242186, "step": 14750 }, { "epoch": 0.1939870566068649, "grad_norm": 0.17059318721294403, "learning_rate": 0.00037141562285111383, "loss": 2.9945269775390626, "step": 14800 }, { "epoch": 0.1946424182845908, "grad_norm": 0.1627851277589798, "learning_rate": 0.0003711973854194025, "loss": 3.0009130859375, "step": 14850 }, { "epoch": 0.1952977799623167, "grad_norm": 0.17671069502830505, "learning_rate": 0.0003709783826714524, "loss": 2.9911029052734377, "step": 14900 }, { "epoch": 0.1959531416400426, "grad_norm": 0.17029069364070892, "learning_rate": 0.00037075861558628773, "loss": 2.9930645751953127, "step": 14950 }, { "epoch": 0.1966085033177685, "grad_norm": 0.16299958527088165, "learning_rate": 0.0003705380851463495, "loss": 2.9891592407226564, "step": 15000 }, { "epoch": 0.1972638649954944, "grad_norm": 0.16672609746456146, "learning_rate": 0.00037031679233749096, "loss": 2.992725830078125, "step": 15050 }, { "epoch": 0.1979192266732203, "grad_norm": 0.16228234767913818, "learning_rate": 0.0003700947381489737, "loss": 2.98245849609375, "step": 15100 }, { "epoch": 0.19857458835094619, "grad_norm": 0.16550038754940033, "learning_rate": 0.0003698719235734628, "loss": 2.9848651123046874, "step": 15150 }, { "epoch": 0.19922995002867208, "grad_norm": 0.161213219165802, "learning_rate": 0.0003696483496070226, "loss": 2.97513427734375, "step": 15200 }, { "epoch": 0.19988531170639798, "grad_norm": 0.17817705869674683, "learning_rate": 0.00036942401724911233, "loss": 2.994375, "step": 15250 }, { "epoch": 0.20054067338412387, "grad_norm": 0.16282308101654053, "learning_rate": 0.00036919892750258125, "loss": 2.9792022705078125, "step": 15300 }, { "epoch": 0.20119603506184977, "grad_norm": 0.1685405969619751, "learning_rate": 0.0003689730813736646, "loss": 2.9886865234375, "step": 15350 }, { "epoch": 0.20185139673957567, "grad_norm": 0.16668137907981873, "learning_rate": 0.00036874647987197905, "loss": 2.987052307128906, "step": 15400 }, { "epoch": 0.20250675841730154, "grad_norm": 0.17567269504070282, "learning_rate": 0.00036851912401051777, "loss": 2.980907287597656, "step": 15450 }, { "epoch": 0.20316212009502743, "grad_norm": 0.1649779975414276, "learning_rate": 0.00036829101480564643, "loss": 2.9836410522460937, "step": 15500 }, { "epoch": 0.20381748177275333, "grad_norm": 0.1699378341436386, "learning_rate": 0.0003680621532770983, "loss": 2.9875668334960936, "step": 15550 }, { "epoch": 0.20447284345047922, "grad_norm": 0.17719361186027527, "learning_rate": 0.00036783254044796997, "loss": 2.972999267578125, "step": 15600 }, { "epoch": 0.20512820512820512, "grad_norm": 0.1705351024866104, "learning_rate": 0.00036760217734471635, "loss": 2.9795477294921877, "step": 15650 }, { "epoch": 0.20578356680593102, "grad_norm": 0.16368424892425537, "learning_rate": 0.0003673710649971468, "loss": 2.9701177978515627, "step": 15700 }, { "epoch": 0.2064389284836569, "grad_norm": 0.16247059404850006, "learning_rate": 0.00036713920443841953, "loss": 2.970295715332031, "step": 15750 }, { "epoch": 0.2070942901613828, "grad_norm": 0.17079515755176544, "learning_rate": 0.00036690659670503793, "loss": 2.9753347778320314, "step": 15800 }, { "epoch": 0.2077496518391087, "grad_norm": 0.16564437747001648, "learning_rate": 0.0003666732428368455, "loss": 2.980135803222656, "step": 15850 }, { "epoch": 0.2084050135168346, "grad_norm": 0.16519832611083984, "learning_rate": 0.000366439143877021, "loss": 2.9655020141601565, "step": 15900 }, { "epoch": 0.2090603751945605, "grad_norm": 0.17662176489830017, "learning_rate": 0.0003662043008720744, "loss": 2.972510986328125, "step": 15950 }, { "epoch": 0.2097157368722864, "grad_norm": 0.1710946410894394, "learning_rate": 0.00036596871487184145, "loss": 2.981545104980469, "step": 16000 }, { "epoch": 0.2097157368722864, "eval_loss": 2.853026866912842, "eval_runtime": 5.6866, "eval_samples_per_second": 45.018, "eval_steps_per_second": 5.627, "step": 16000 }, { "epoch": 0.2103710985500123, "grad_norm": 0.17311525344848633, "learning_rate": 0.00036573238692947963, "loss": 2.9721026611328125, "step": 16050 }, { "epoch": 0.2110264602277382, "grad_norm": 0.17193837463855743, "learning_rate": 0.0003654953181014631, "loss": 2.9612271118164064, "step": 16100 }, { "epoch": 0.21168182190546408, "grad_norm": 0.15974758565425873, "learning_rate": 0.0003652575094475779, "loss": 2.964639892578125, "step": 16150 }, { "epoch": 0.21233718358318998, "grad_norm": 0.16985274851322174, "learning_rate": 0.00036501896203091765, "loss": 2.971280212402344, "step": 16200 }, { "epoch": 0.21299254526091588, "grad_norm": 0.17480714619159698, "learning_rate": 0.00036477967691787844, "loss": 2.9641796875, "step": 16250 }, { "epoch": 0.21364790693864177, "grad_norm": 0.17796620726585388, "learning_rate": 0.0003645396551781539, "loss": 2.967604675292969, "step": 16300 }, { "epoch": 0.21430326861636767, "grad_norm": 0.17216642200946808, "learning_rate": 0.0003642988978847309, "loss": 2.9698138427734375, "step": 16350 }, { "epoch": 0.21495863029409357, "grad_norm": 0.17040376365184784, "learning_rate": 0.00036405740611388453, "loss": 2.9496453857421874, "step": 16400 }, { "epoch": 0.21561399197181944, "grad_norm": 0.17587760090827942, "learning_rate": 0.00036381518094517304, "loss": 2.976742858886719, "step": 16450 }, { "epoch": 0.21626935364954533, "grad_norm": 0.16672401130199432, "learning_rate": 0.0003635722234614335, "loss": 2.9690167236328127, "step": 16500 }, { "epoch": 0.21692471532727123, "grad_norm": 0.18230868875980377, "learning_rate": 0.00036332853474877646, "loss": 2.9572824096679686, "step": 16550 }, { "epoch": 0.21758007700499712, "grad_norm": 0.16422739624977112, "learning_rate": 0.0003630841158965816, "loss": 2.9669424438476564, "step": 16600 }, { "epoch": 0.21823543868272302, "grad_norm": 0.1664307862520218, "learning_rate": 0.0003628389679974923, "loss": 2.971185302734375, "step": 16650 }, { "epoch": 0.21889080036044892, "grad_norm": 0.16268014907836914, "learning_rate": 0.00036259309214741137, "loss": 2.9690753173828126, "step": 16700 }, { "epoch": 0.2195461620381748, "grad_norm": 0.16984225809574127, "learning_rate": 0.00036234648944549557, "loss": 2.9561288452148435, "step": 16750 }, { "epoch": 0.2202015237159007, "grad_norm": 0.1729847639799118, "learning_rate": 0.00036209916099415107, "loss": 2.9591754150390623, "step": 16800 }, { "epoch": 0.2208568853936266, "grad_norm": 0.1633663773536682, "learning_rate": 0.00036185110789902847, "loss": 2.9606512451171874, "step": 16850 }, { "epoch": 0.2215122470713525, "grad_norm": 0.16496390104293823, "learning_rate": 0.0003616023312690176, "loss": 2.9580755615234375, "step": 16900 }, { "epoch": 0.2221676087490784, "grad_norm": 0.16967622935771942, "learning_rate": 0.00036135283221624297, "loss": 2.9615908813476564, "step": 16950 }, { "epoch": 0.2228229704268043, "grad_norm": 0.16690337657928467, "learning_rate": 0.0003611026118560585, "loss": 2.967689208984375, "step": 17000 }, { "epoch": 0.2234783321045302, "grad_norm": 0.1804627776145935, "learning_rate": 0.00036085167130704265, "loss": 2.9619107055664062, "step": 17050 }, { "epoch": 0.2241336937822561, "grad_norm": 0.16530460119247437, "learning_rate": 0.0003606000116909934, "loss": 2.947933349609375, "step": 17100 }, { "epoch": 0.22478905545998198, "grad_norm": 0.1713293045759201, "learning_rate": 0.00036034763413292316, "loss": 2.953694152832031, "step": 17150 }, { "epoch": 0.22544441713770788, "grad_norm": 0.19740426540374756, "learning_rate": 0.00036009453976105387, "loss": 2.953554992675781, "step": 17200 }, { "epoch": 0.22609977881543378, "grad_norm": 0.17386682331562042, "learning_rate": 0.00035984072970681184, "loss": 2.962462158203125, "step": 17250 }, { "epoch": 0.22675514049315967, "grad_norm": 0.16382843255996704, "learning_rate": 0.0003595862051048229, "loss": 2.952059631347656, "step": 17300 }, { "epoch": 0.22741050217088557, "grad_norm": 0.16030673682689667, "learning_rate": 0.0003593309670929069, "loss": 2.9529986572265625, "step": 17350 }, { "epoch": 0.22806586384861144, "grad_norm": 0.16156207025051117, "learning_rate": 0.00035907501681207315, "loss": 2.966947326660156, "step": 17400 }, { "epoch": 0.22872122552633734, "grad_norm": 0.16727951169013977, "learning_rate": 0.00035881835540651493, "loss": 2.944144592285156, "step": 17450 }, { "epoch": 0.22937658720406323, "grad_norm": 0.1671253740787506, "learning_rate": 0.0003585609840236047, "loss": 2.9477142333984374, "step": 17500 }, { "epoch": 0.23003194888178913, "grad_norm": 0.16537418961524963, "learning_rate": 0.0003583029038138885, "loss": 2.9334161376953123, "step": 17550 }, { "epoch": 0.23068731055951502, "grad_norm": 0.17597432434558868, "learning_rate": 0.0003580441159310812, "loss": 2.9473776245117187, "step": 17600 }, { "epoch": 0.23134267223724092, "grad_norm": 0.1576494574546814, "learning_rate": 0.00035778462153206143, "loss": 2.9393209838867187, "step": 17650 }, { "epoch": 0.23199803391496682, "grad_norm": 0.16597570478916168, "learning_rate": 0.000357524421776866, "loss": 2.9506546020507813, "step": 17700 }, { "epoch": 0.2326533955926927, "grad_norm": 0.1723046600818634, "learning_rate": 0.00035726351782868485, "loss": 2.9406094360351562, "step": 17750 }, { "epoch": 0.2333087572704186, "grad_norm": 0.1716579645872116, "learning_rate": 0.0003570019108538562, "loss": 2.9499716186523437, "step": 17800 }, { "epoch": 0.2339641189481445, "grad_norm": 0.15708179771900177, "learning_rate": 0.00035673960202186087, "loss": 2.9578228759765626, "step": 17850 }, { "epoch": 0.2346194806258704, "grad_norm": 0.16328568756580353, "learning_rate": 0.00035647659250531726, "loss": 2.95954345703125, "step": 17900 }, { "epoch": 0.2352748423035963, "grad_norm": 0.16919036209583282, "learning_rate": 0.00035621288347997615, "loss": 2.9405422973632813, "step": 17950 }, { "epoch": 0.2359302039813222, "grad_norm": 0.16000254452228546, "learning_rate": 0.0003559484761247153, "loss": 2.9441262817382814, "step": 18000 }, { "epoch": 0.2359302039813222, "eval_loss": 2.8356666564941406, "eval_runtime": 5.6169, "eval_samples_per_second": 45.577, "eval_steps_per_second": 5.697, "step": 18000 }, { "epoch": 0.2365855656590481, "grad_norm": 0.15846964716911316, "learning_rate": 0.00035568337162153436, "loss": 2.94470947265625, "step": 18050 }, { "epoch": 0.237240927336774, "grad_norm": 0.17656207084655762, "learning_rate": 0.0003554175711555494, "loss": 2.955001220703125, "step": 18100 }, { "epoch": 0.23789628901449988, "grad_norm": 0.18552245199680328, "learning_rate": 0.00035515107591498784, "loss": 2.94719482421875, "step": 18150 }, { "epoch": 0.23855165069222578, "grad_norm": 0.16341136395931244, "learning_rate": 0.0003548838870911829, "loss": 2.9372512817382814, "step": 18200 }, { "epoch": 0.23920701236995168, "grad_norm": 0.17305275797843933, "learning_rate": 0.00035461600587856834, "loss": 2.945079345703125, "step": 18250 }, { "epoch": 0.23986237404767757, "grad_norm": 0.16552510857582092, "learning_rate": 0.00035434743347467323, "loss": 2.937655334472656, "step": 18300 }, { "epoch": 0.24051773572540347, "grad_norm": 0.1825156956911087, "learning_rate": 0.00035407817108011657, "loss": 2.937855224609375, "step": 18350 }, { "epoch": 0.24117309740312934, "grad_norm": 0.17092622816562653, "learning_rate": 0.00035380821989860166, "loss": 2.9338644409179686, "step": 18400 }, { "epoch": 0.24182845908085523, "grad_norm": 0.16524964570999146, "learning_rate": 0.0003535375811369112, "loss": 2.9492312622070314, "step": 18450 }, { "epoch": 0.24248382075858113, "grad_norm": 0.1624523550271988, "learning_rate": 0.00035326625600490144, "loss": 2.932850646972656, "step": 18500 }, { "epoch": 0.24313918243630703, "grad_norm": 0.18123026192188263, "learning_rate": 0.00035299424571549713, "loss": 2.9296615600585936, "step": 18550 }, { "epoch": 0.24379454411403292, "grad_norm": 0.16326972842216492, "learning_rate": 0.00035272155148468573, "loss": 2.943739318847656, "step": 18600 }, { "epoch": 0.24444990579175882, "grad_norm": 0.16651879251003265, "learning_rate": 0.00035244817453151234, "loss": 2.9403271484375, "step": 18650 }, { "epoch": 0.24510526746948472, "grad_norm": 0.16745640337467194, "learning_rate": 0.000352174116078074, "loss": 2.9465298461914062, "step": 18700 }, { "epoch": 0.2457606291472106, "grad_norm": 0.1711357980966568, "learning_rate": 0.00035189937734951435, "loss": 2.9347296142578125, "step": 18750 }, { "epoch": 0.2464159908249365, "grad_norm": 0.17086179554462433, "learning_rate": 0.0003516239595740181, "loss": 2.943296203613281, "step": 18800 }, { "epoch": 0.2470713525026624, "grad_norm": 0.1674569994211197, "learning_rate": 0.0003513478639828055, "loss": 2.940770568847656, "step": 18850 }, { "epoch": 0.2477267141803883, "grad_norm": 0.1676352471113205, "learning_rate": 0.00035107109181012694, "loss": 2.932267761230469, "step": 18900 }, { "epoch": 0.2483820758581142, "grad_norm": 0.16538666188716888, "learning_rate": 0.00035079364429325743, "loss": 2.930003356933594, "step": 18950 }, { "epoch": 0.2490374375358401, "grad_norm": 0.16590271890163422, "learning_rate": 0.00035051552267249093, "loss": 2.917630920410156, "step": 19000 }, { "epoch": 0.249692799213566, "grad_norm": 0.162932351231575, "learning_rate": 0.00035023672819113497, "loss": 2.9294354248046877, "step": 19050 }, { "epoch": 0.25034816089129186, "grad_norm": 0.1639566868543625, "learning_rate": 0.00034995726209550494, "loss": 2.919949645996094, "step": 19100 }, { "epoch": 0.25100352256901776, "grad_norm": 0.17636246979236603, "learning_rate": 0.0003496771256349187, "loss": 2.9191375732421876, "step": 19150 }, { "epoch": 0.25165888424674365, "grad_norm": 0.17443478107452393, "learning_rate": 0.00034939632006169083, "loss": 2.9225927734375, "step": 19200 }, { "epoch": 0.25231424592446955, "grad_norm": 0.16307416558265686, "learning_rate": 0.00034911484663112695, "loss": 2.939248352050781, "step": 19250 }, { "epoch": 0.25296960760219545, "grad_norm": 0.17640097439289093, "learning_rate": 0.00034883270660151865, "loss": 2.939591979980469, "step": 19300 }, { "epoch": 0.25362496927992134, "grad_norm": 0.16904355585575104, "learning_rate": 0.000348549901234137, "loss": 2.9406097412109373, "step": 19350 }, { "epoch": 0.25428033095764724, "grad_norm": 0.1602356731891632, "learning_rate": 0.0003482664317932277, "loss": 2.9330703735351564, "step": 19400 }, { "epoch": 0.25493569263537313, "grad_norm": 0.1665678471326828, "learning_rate": 0.000347982299546005, "loss": 2.9257583618164062, "step": 19450 }, { "epoch": 0.25559105431309903, "grad_norm": 0.16372360289096832, "learning_rate": 0.00034769750576264607, "loss": 2.934087829589844, "step": 19500 }, { "epoch": 0.2562464159908249, "grad_norm": 0.1673424243927002, "learning_rate": 0.0003474120517162855, "loss": 2.9333615112304687, "step": 19550 }, { "epoch": 0.2569017776685508, "grad_norm": 0.16466358304023743, "learning_rate": 0.0003471259386830095, "loss": 2.92653564453125, "step": 19600 }, { "epoch": 0.2575571393462767, "grad_norm": 0.16957812011241913, "learning_rate": 0.00034683916794185014, "loss": 2.92204833984375, "step": 19650 }, { "epoch": 0.2582125010240026, "grad_norm": 0.37738633155822754, "learning_rate": 0.00034655174077477974, "loss": 2.9285052490234373, "step": 19700 }, { "epoch": 0.2588678627017285, "grad_norm": 0.19091728329658508, "learning_rate": 0.00034626365846670507, "loss": 2.9339923095703124, "step": 19750 }, { "epoch": 0.2595232243794544, "grad_norm": 0.15751948952674866, "learning_rate": 0.00034597492230546153, "loss": 2.9218170166015627, "step": 19800 }, { "epoch": 0.2601785860571803, "grad_norm": 0.17233611643314362, "learning_rate": 0.0003456855335818076, "loss": 2.921619567871094, "step": 19850 }, { "epoch": 0.2608339477349062, "grad_norm": 0.15899398922920227, "learning_rate": 0.00034539549358941903, "loss": 2.9232144165039062, "step": 19900 }, { "epoch": 0.2614893094126321, "grad_norm": 0.16905060410499573, "learning_rate": 0.00034510480362488283, "loss": 2.920394287109375, "step": 19950 }, { "epoch": 0.262144671090358, "grad_norm": 0.16366197168827057, "learning_rate": 0.00034481346498769165, "loss": 2.9306982421875, "step": 20000 }, { "epoch": 0.262144671090358, "eval_loss": 2.81449556350708, "eval_runtime": 5.6159, "eval_samples_per_second": 45.585, "eval_steps_per_second": 5.698, "step": 20000 }, { "epoch": 0.2628000327680839, "grad_norm": 0.17698407173156738, "learning_rate": 0.000344521478980238, "loss": 2.9228225708007813, "step": 20050 }, { "epoch": 0.2634553944458098, "grad_norm": 0.16128091514110565, "learning_rate": 0.0003442288469078084, "loss": 2.921625671386719, "step": 20100 }, { "epoch": 0.2641107561235357, "grad_norm": 0.17322736978530884, "learning_rate": 0.00034393557007857746, "loss": 2.9051715087890626, "step": 20150 }, { "epoch": 0.2647661178012616, "grad_norm": 0.16672293841838837, "learning_rate": 0.0003436416498036021, "loss": 2.905989074707031, "step": 20200 }, { "epoch": 0.2654214794789875, "grad_norm": 0.1662411391735077, "learning_rate": 0.00034334708739681573, "loss": 2.9157171630859375, "step": 20250 }, { "epoch": 0.2660768411567134, "grad_norm": 0.17029765248298645, "learning_rate": 0.0003430518841750223, "loss": 2.9236849975585937, "step": 20300 }, { "epoch": 0.26673220283443927, "grad_norm": 0.17488430440425873, "learning_rate": 0.00034275604145789045, "loss": 2.9190850830078126, "step": 20350 }, { "epoch": 0.26738756451216517, "grad_norm": 0.16289661824703217, "learning_rate": 0.00034245956056794757, "loss": 2.939029541015625, "step": 20400 }, { "epoch": 0.26804292618989106, "grad_norm": 0.15870621800422668, "learning_rate": 0.0003421624428305739, "loss": 2.9206527709960937, "step": 20450 }, { "epoch": 0.26869828786761696, "grad_norm": 0.1745336502790451, "learning_rate": 0.00034186468957399675, "loss": 2.9202276611328126, "step": 20500 }, { "epoch": 0.26935364954534285, "grad_norm": 0.16943217813968658, "learning_rate": 0.00034156630212928433, "loss": 2.922879638671875, "step": 20550 }, { "epoch": 0.27000901122306875, "grad_norm": 0.17059074342250824, "learning_rate": 0.00034126728183034, "loss": 2.929295959472656, "step": 20600 }, { "epoch": 0.27066437290079465, "grad_norm": 0.16384802758693695, "learning_rate": 0.000340967630013896, "loss": 2.9163818359375, "step": 20650 }, { "epoch": 0.27131973457852054, "grad_norm": 0.16749094426631927, "learning_rate": 0.00034066734801950797, "loss": 2.9128497314453123, "step": 20700 }, { "epoch": 0.27197509625624644, "grad_norm": 0.16414383053779602, "learning_rate": 0.00034036643718954855, "loss": 2.91092529296875, "step": 20750 }, { "epoch": 0.27263045793397234, "grad_norm": 0.1656002253293991, "learning_rate": 0.0003400648988692014, "loss": 2.9259710693359375, "step": 20800 }, { "epoch": 0.27328581961169823, "grad_norm": 0.16639083623886108, "learning_rate": 0.0003397627344064555, "loss": 2.9061215209960936, "step": 20850 }, { "epoch": 0.2739411812894241, "grad_norm": 0.16125813126564026, "learning_rate": 0.0003394599451520988, "loss": 2.9067236328125, "step": 20900 }, { "epoch": 0.27459654296714997, "grad_norm": 0.1701466590166092, "learning_rate": 0.0003391565324597124, "loss": 2.919434814453125, "step": 20950 }, { "epoch": 0.27525190464487587, "grad_norm": 0.16901464760303497, "learning_rate": 0.0003388524976856642, "loss": 2.9094332885742187, "step": 21000 }, { "epoch": 0.27590726632260176, "grad_norm": 0.16743549704551697, "learning_rate": 0.00033854784218910326, "loss": 2.8981332397460937, "step": 21050 }, { "epoch": 0.27656262800032766, "grad_norm": 0.1666753739118576, "learning_rate": 0.00033824256733195343, "loss": 2.908269958496094, "step": 21100 }, { "epoch": 0.27721798967805356, "grad_norm": 0.16418272256851196, "learning_rate": 0.0003379366744789072, "loss": 2.904945068359375, "step": 21150 }, { "epoch": 0.27787335135577945, "grad_norm": 0.17084458470344543, "learning_rate": 0.0003376301649974199, "loss": 2.905140075683594, "step": 21200 }, { "epoch": 0.27852871303350535, "grad_norm": 0.15967530012130737, "learning_rate": 0.00033732304025770347, "loss": 2.9149737548828125, "step": 21250 }, { "epoch": 0.27918407471123124, "grad_norm": 0.1575414389371872, "learning_rate": 0.00033701530163272, "loss": 2.9153677368164064, "step": 21300 }, { "epoch": 0.27983943638895714, "grad_norm": 0.16802668571472168, "learning_rate": 0.00033670695049817624, "loss": 2.9067037963867186, "step": 21350 }, { "epoch": 0.28049479806668304, "grad_norm": 0.16015572845935822, "learning_rate": 0.0003363979882325167, "loss": 2.905437316894531, "step": 21400 }, { "epoch": 0.28115015974440893, "grad_norm": 0.1805601418018341, "learning_rate": 0.0003360884162169182, "loss": 2.9042816162109375, "step": 21450 }, { "epoch": 0.28180552142213483, "grad_norm": 0.17479462921619415, "learning_rate": 0.0003357782358352832, "loss": 2.903084411621094, "step": 21500 }, { "epoch": 0.2824608830998607, "grad_norm": 0.16734828054904938, "learning_rate": 0.0003354674484742339, "loss": 2.8991748046875, "step": 21550 }, { "epoch": 0.2831162447775866, "grad_norm": 0.162786602973938, "learning_rate": 0.0003351560555231058, "loss": 2.912698059082031, "step": 21600 }, { "epoch": 0.2837716064553125, "grad_norm": 0.16262491047382355, "learning_rate": 0.00033484405837394163, "loss": 2.9023361206054688, "step": 21650 }, { "epoch": 0.2844269681330384, "grad_norm": 0.15931487083435059, "learning_rate": 0.0003345314584214853, "loss": 2.911702880859375, "step": 21700 }, { "epoch": 0.2850823298107643, "grad_norm": 0.16067153215408325, "learning_rate": 0.00033421825706317506, "loss": 2.905905456542969, "step": 21750 }, { "epoch": 0.2857376914884902, "grad_norm": 0.15914632380008698, "learning_rate": 0.00033390445569913814, "loss": 2.908511047363281, "step": 21800 }, { "epoch": 0.2863930531662161, "grad_norm": 0.16032442450523376, "learning_rate": 0.0003335900557321838, "loss": 2.890833740234375, "step": 21850 }, { "epoch": 0.287048414843942, "grad_norm": 0.1664697378873825, "learning_rate": 0.0003332750585677972, "loss": 2.9062545776367186, "step": 21900 }, { "epoch": 0.2877037765216679, "grad_norm": 0.1664905548095703, "learning_rate": 0.00033295946561413337, "loss": 2.906546936035156, "step": 21950 }, { "epoch": 0.2883591381993938, "grad_norm": 0.1684502363204956, "learning_rate": 0.00033264327828201053, "loss": 2.9020489501953124, "step": 22000 }, { "epoch": 0.2883591381993938, "eval_loss": 2.796187400817871, "eval_runtime": 5.6169, "eval_samples_per_second": 45.577, "eval_steps_per_second": 5.697, "step": 22000 }, { "epoch": 0.2890144998771197, "grad_norm": 0.16601231694221497, "learning_rate": 0.0003323264979849043, "loss": 2.896151428222656, "step": 22050 }, { "epoch": 0.2896698615548456, "grad_norm": 0.16857431828975677, "learning_rate": 0.0003320091261389408, "loss": 2.9083993530273435, "step": 22100 }, { "epoch": 0.2903252232325715, "grad_norm": 0.164560005068779, "learning_rate": 0.0003316911641628907, "loss": 2.89151123046875, "step": 22150 }, { "epoch": 0.2909805849102974, "grad_norm": 0.18173231184482574, "learning_rate": 0.00033137261347816266, "loss": 2.889531555175781, "step": 22200 }, { "epoch": 0.2916359465880233, "grad_norm": 0.16515697538852692, "learning_rate": 0.0003310534755087974, "loss": 2.9188613891601562, "step": 22250 }, { "epoch": 0.2922913082657492, "grad_norm": 0.1700158566236496, "learning_rate": 0.00033073375168146067, "loss": 2.901234130859375, "step": 22300 }, { "epoch": 0.29294666994347507, "grad_norm": 0.1752876192331314, "learning_rate": 0.0003304134434254373, "loss": 2.9004412841796876, "step": 22350 }, { "epoch": 0.29360203162120097, "grad_norm": 0.16704712808132172, "learning_rate": 0.00033009255217262504, "loss": 2.9062249755859373, "step": 22400 }, { "epoch": 0.29425739329892686, "grad_norm": 0.1657305359840393, "learning_rate": 0.00032977107935752736, "loss": 2.8917669677734374, "step": 22450 }, { "epoch": 0.29491275497665276, "grad_norm": 0.16843761503696442, "learning_rate": 0.00032944902641724794, "loss": 2.895186767578125, "step": 22500 }, { "epoch": 0.29556811665437865, "grad_norm": 0.15913957357406616, "learning_rate": 0.00032912639479148353, "loss": 2.900753173828125, "step": 22550 }, { "epoch": 0.29622347833210455, "grad_norm": 0.1725219488143921, "learning_rate": 0.0003288031859225181, "loss": 2.903765869140625, "step": 22600 }, { "epoch": 0.29687884000983045, "grad_norm": 0.17508095502853394, "learning_rate": 0.000328479401255216, "loss": 2.888994140625, "step": 22650 }, { "epoch": 0.29753420168755634, "grad_norm": 0.1644352525472641, "learning_rate": 0.00032815504223701554, "loss": 2.891235656738281, "step": 22700 }, { "epoch": 0.29818956336528224, "grad_norm": 0.17649006843566895, "learning_rate": 0.0003278301103179226, "loss": 2.8886343383789064, "step": 22750 }, { "epoch": 0.29884492504300814, "grad_norm": 0.16421149671077728, "learning_rate": 0.00032750460695050423, "loss": 2.885317687988281, "step": 22800 }, { "epoch": 0.29950028672073403, "grad_norm": 0.16478657722473145, "learning_rate": 0.00032717853358988204, "loss": 2.8880078125, "step": 22850 }, { "epoch": 0.3001556483984599, "grad_norm": 0.16170595586299896, "learning_rate": 0.0003268518916937257, "loss": 2.8843978881835937, "step": 22900 }, { "epoch": 0.30081101007618577, "grad_norm": 0.1687058061361313, "learning_rate": 0.0003265246827222465, "loss": 2.881629638671875, "step": 22950 }, { "epoch": 0.30146637175391167, "grad_norm": 0.16480441391468048, "learning_rate": 0.00032619690813819063, "loss": 2.8956643676757814, "step": 23000 }, { "epoch": 0.30212173343163756, "grad_norm": 0.1655932515859604, "learning_rate": 0.00032586856940683293, "loss": 2.8865670776367187, "step": 23050 }, { "epoch": 0.30277709510936346, "grad_norm": 0.1749807894229889, "learning_rate": 0.00032553966799597013, "loss": 2.893671569824219, "step": 23100 }, { "epoch": 0.30343245678708936, "grad_norm": 0.1644655168056488, "learning_rate": 0.0003252102053759144, "loss": 2.89248779296875, "step": 23150 }, { "epoch": 0.30408781846481525, "grad_norm": 0.16707414388656616, "learning_rate": 0.00032488018301948655, "loss": 2.8796505737304687, "step": 23200 }, { "epoch": 0.30474318014254115, "grad_norm": 0.19084422290325165, "learning_rate": 0.0003245496024020098, "loss": 2.88592529296875, "step": 23250 }, { "epoch": 0.30539854182026704, "grad_norm": 0.17173467576503754, "learning_rate": 0.00032421846500130307, "loss": 2.8847064208984374, "step": 23300 }, { "epoch": 0.30605390349799294, "grad_norm": 0.1604858785867691, "learning_rate": 0.000323886772297674, "loss": 2.8930450439453126, "step": 23350 }, { "epoch": 0.30670926517571884, "grad_norm": 0.16557107865810394, "learning_rate": 0.000323554525773913, "loss": 2.8819793701171874, "step": 23400 }, { "epoch": 0.30736462685344473, "grad_norm": 0.204323872923851, "learning_rate": 0.00032322172691528594, "loss": 2.88242431640625, "step": 23450 }, { "epoch": 0.30801998853117063, "grad_norm": 0.16907712817192078, "learning_rate": 0.000322888377209528, "loss": 2.891842041015625, "step": 23500 }, { "epoch": 0.3086753502088965, "grad_norm": 0.16979140043258667, "learning_rate": 0.00032255447814683697, "loss": 2.883805236816406, "step": 23550 }, { "epoch": 0.3093307118866224, "grad_norm": 0.1563098430633545, "learning_rate": 0.0003222200312198663, "loss": 2.885360107421875, "step": 23600 }, { "epoch": 0.3099860735643483, "grad_norm": 0.16310341656208038, "learning_rate": 0.0003218850379237186, "loss": 2.890566711425781, "step": 23650 }, { "epoch": 0.3106414352420742, "grad_norm": 0.1629946082830429, "learning_rate": 0.0003215494997559389, "loss": 2.8732879638671873, "step": 23700 }, { "epoch": 0.3112967969198001, "grad_norm": 0.1653667688369751, "learning_rate": 0.00032121341821650823, "loss": 2.881226806640625, "step": 23750 }, { "epoch": 0.311952158597526, "grad_norm": 0.1685699075460434, "learning_rate": 0.00032087679480783657, "loss": 2.8805133056640626, "step": 23800 }, { "epoch": 0.3126075202752519, "grad_norm": 0.17066118121147156, "learning_rate": 0.00032053963103475613, "loss": 2.886652526855469, "step": 23850 }, { "epoch": 0.3132628819529778, "grad_norm": 0.16027726233005524, "learning_rate": 0.00032020192840451504, "loss": 2.8923110961914062, "step": 23900 }, { "epoch": 0.3139182436307037, "grad_norm": 0.16547393798828125, "learning_rate": 0.0003198636884267701, "loss": 2.89369384765625, "step": 23950 }, { "epoch": 0.3145736053084296, "grad_norm": 0.16015562415122986, "learning_rate": 0.00031952491261358026, "loss": 2.877950439453125, "step": 24000 }, { "epoch": 0.3145736053084296, "eval_loss": 2.778181791305542, "eval_runtime": 5.616, "eval_samples_per_second": 45.584, "eval_steps_per_second": 5.698, "step": 24000 }, { "epoch": 0.3152289669861555, "grad_norm": 0.16715121269226074, "learning_rate": 0.00031918560247939985, "loss": 2.880118713378906, "step": 24050 }, { "epoch": 0.3158843286638814, "grad_norm": 0.16754445433616638, "learning_rate": 0.0003188457595410721, "loss": 2.8914349365234373, "step": 24100 }, { "epoch": 0.3165396903416073, "grad_norm": 0.19116008281707764, "learning_rate": 0.0003185053853178215, "loss": 2.8875491333007814, "step": 24150 }, { "epoch": 0.3171950520193332, "grad_norm": 0.16489428281784058, "learning_rate": 0.00031816448133124825, "loss": 2.8749118041992188, "step": 24200 }, { "epoch": 0.3178504136970591, "grad_norm": 0.17722296714782715, "learning_rate": 0.0003178230491053203, "loss": 2.8853085327148436, "step": 24250 }, { "epoch": 0.31850577537478497, "grad_norm": 0.15979646146297455, "learning_rate": 0.0003174810901663672, "loss": 2.8683929443359375, "step": 24300 }, { "epoch": 0.31916113705251087, "grad_norm": 0.1667044758796692, "learning_rate": 0.00031713860604307316, "loss": 2.8776849365234374, "step": 24350 }, { "epoch": 0.31981649873023676, "grad_norm": 0.16185647249221802, "learning_rate": 0.0003167955982664701, "loss": 2.87613037109375, "step": 24400 }, { "epoch": 0.32047186040796266, "grad_norm": 0.1726047247648239, "learning_rate": 0.00031645206836993075, "loss": 2.8837716674804685, "step": 24450 }, { "epoch": 0.32112722208568856, "grad_norm": 0.17750437557697296, "learning_rate": 0.00031610801788916216, "loss": 2.8910455322265625, "step": 24500 }, { "epoch": 0.32178258376341445, "grad_norm": 0.15907230973243713, "learning_rate": 0.00031576344836219827, "loss": 2.861527404785156, "step": 24550 }, { "epoch": 0.32243794544114035, "grad_norm": 0.1666170060634613, "learning_rate": 0.00031541836132939374, "loss": 2.8740643310546874, "step": 24600 }, { "epoch": 0.32309330711886625, "grad_norm": 0.1731458157300949, "learning_rate": 0.0003150727583334163, "loss": 2.863931884765625, "step": 24650 }, { "epoch": 0.32374866879659214, "grad_norm": 0.16576217114925385, "learning_rate": 0.0003147266409192405, "loss": 2.8724874877929687, "step": 24700 }, { "epoch": 0.32440403047431804, "grad_norm": 0.1662430316209793, "learning_rate": 0.0003143800106341404, "loss": 2.875974426269531, "step": 24750 }, { "epoch": 0.32505939215204394, "grad_norm": 0.16906322538852692, "learning_rate": 0.0003140328690276827, "loss": 2.8751229858398437, "step": 24800 }, { "epoch": 0.32571475382976983, "grad_norm": 0.16612815856933594, "learning_rate": 0.00031368521765172023, "loss": 2.8631072998046876, "step": 24850 }, { "epoch": 0.3263701155074957, "grad_norm": 0.16437558829784393, "learning_rate": 0.0003133370580603842, "loss": 2.873352355957031, "step": 24900 }, { "epoch": 0.32702547718522157, "grad_norm": 0.17101678252220154, "learning_rate": 0.00031298839181007814, "loss": 2.879327392578125, "step": 24950 }, { "epoch": 0.32768083886294747, "grad_norm": 0.16352784633636475, "learning_rate": 0.0003126392204594703, "loss": 2.8836636352539062, "step": 25000 }, { "epoch": 0.32833620054067336, "grad_norm": 0.1749923825263977, "learning_rate": 0.0003122895455694871, "loss": 2.869687805175781, "step": 25050 }, { "epoch": 0.32899156221839926, "grad_norm": 0.1622343212366104, "learning_rate": 0.00031193936870330585, "loss": 2.872605285644531, "step": 25100 }, { "epoch": 0.32964692389612515, "grad_norm": 0.16456149518489838, "learning_rate": 0.00031158869142634783, "loss": 2.869576721191406, "step": 25150 }, { "epoch": 0.33030228557385105, "grad_norm": 0.16276663541793823, "learning_rate": 0.0003112375153062714, "loss": 2.8689425659179686, "step": 25200 }, { "epoch": 0.33095764725157695, "grad_norm": 0.16324755549430847, "learning_rate": 0.000310885841912965, "loss": 2.869568176269531, "step": 25250 }, { "epoch": 0.33161300892930284, "grad_norm": 0.1659940779209137, "learning_rate": 0.00031053367281854, "loss": 2.8857525634765624, "step": 25300 }, { "epoch": 0.33226837060702874, "grad_norm": 0.16136540472507477, "learning_rate": 0.0003101810095973239, "loss": 2.8704763793945314, "step": 25350 }, { "epoch": 0.33292373228475464, "grad_norm": 0.16203349828720093, "learning_rate": 0.0003098278538258527, "loss": 2.863424987792969, "step": 25400 }, { "epoch": 0.33357909396248053, "grad_norm": 0.16347667574882507, "learning_rate": 0.0003094742070828648, "loss": 2.866216735839844, "step": 25450 }, { "epoch": 0.33423445564020643, "grad_norm": 0.17400585114955902, "learning_rate": 0.00030912007094929307, "loss": 2.873335876464844, "step": 25500 }, { "epoch": 0.3348898173179323, "grad_norm": 0.17542989552021027, "learning_rate": 0.0003087654470082583, "loss": 2.8602264404296873, "step": 25550 }, { "epoch": 0.3355451789956582, "grad_norm": 0.1677759736776352, "learning_rate": 0.00030841033684506194, "loss": 2.8877227783203123, "step": 25600 }, { "epoch": 0.3362005406733841, "grad_norm": 0.17618481814861298, "learning_rate": 0.00030805474204717895, "loss": 2.8600778198242187, "step": 25650 }, { "epoch": 0.33685590235111, "grad_norm": 0.16586273908615112, "learning_rate": 0.000307698664204251, "loss": 2.8646295166015623, "step": 25700 }, { "epoch": 0.3375112640288359, "grad_norm": 0.16388046741485596, "learning_rate": 0.0003073421049080788, "loss": 2.8601580810546876, "step": 25750 }, { "epoch": 0.3381666257065618, "grad_norm": 0.17032526433467865, "learning_rate": 0.00030698506575261577, "loss": 2.8719058227539063, "step": 25800 }, { "epoch": 0.3388219873842877, "grad_norm": 0.16430498659610748, "learning_rate": 0.0003066275483339601, "loss": 2.8737896728515624, "step": 25850 }, { "epoch": 0.3394773490620136, "grad_norm": 0.1652543693780899, "learning_rate": 0.00030626955425034827, "loss": 2.8628781127929686, "step": 25900 }, { "epoch": 0.3401327107397395, "grad_norm": 0.1694687157869339, "learning_rate": 0.0003059110851021474, "loss": 2.8618533325195314, "step": 25950 }, { "epoch": 0.3407880724174654, "grad_norm": 0.16747811436653137, "learning_rate": 0.00030555214249184846, "loss": 2.8647122192382812, "step": 26000 }, { "epoch": 0.3407880724174654, "eval_loss": 2.760092258453369, "eval_runtime": 5.616, "eval_samples_per_second": 45.584, "eval_steps_per_second": 5.698, "step": 26000 }, { "epoch": 0.3414434340951913, "grad_norm": 0.17128542065620422, "learning_rate": 0.000305192728024059, "loss": 2.8614712524414063, "step": 26050 }, { "epoch": 0.3420987957729172, "grad_norm": 0.15930184721946716, "learning_rate": 0.0003048328433054958, "loss": 2.8513519287109377, "step": 26100 }, { "epoch": 0.3427541574506431, "grad_norm": 0.17308135330677032, "learning_rate": 0.00030447248994497806, "loss": 2.8601043701171873, "step": 26150 }, { "epoch": 0.343409519128369, "grad_norm": 0.16418837010860443, "learning_rate": 0.0003041116695534198, "loss": 2.861378479003906, "step": 26200 }, { "epoch": 0.3440648808060949, "grad_norm": 0.16440536081790924, "learning_rate": 0.00030375038374382294, "loss": 2.8726483154296876, "step": 26250 }, { "epoch": 0.34472024248382077, "grad_norm": 0.16608873009681702, "learning_rate": 0.0003033886341312698, "loss": 2.8549679565429686, "step": 26300 }, { "epoch": 0.34537560416154667, "grad_norm": 0.17383836209774017, "learning_rate": 0.0003030264223329164, "loss": 2.8473080444335936, "step": 26350 }, { "epoch": 0.34603096583927256, "grad_norm": 0.16997350752353668, "learning_rate": 0.00030266374996798463, "loss": 2.8568194580078123, "step": 26400 }, { "epoch": 0.34668632751699846, "grad_norm": 0.1665136218070984, "learning_rate": 0.0003023006186577554, "loss": 2.8553912353515627, "step": 26450 }, { "epoch": 0.34734168919472436, "grad_norm": 0.17019817233085632, "learning_rate": 0.00030193703002556136, "loss": 2.847229309082031, "step": 26500 }, { "epoch": 0.34799705087245025, "grad_norm": 0.17223548889160156, "learning_rate": 0.0003015729856967794, "loss": 2.8694729614257812, "step": 26550 }, { "epoch": 0.34865241255017615, "grad_norm": 0.17163468897342682, "learning_rate": 0.0003012084872988236, "loss": 2.8532672119140625, "step": 26600 }, { "epoch": 0.34930777422790205, "grad_norm": 0.17218372225761414, "learning_rate": 0.00030084353646113785, "loss": 2.8651300048828126, "step": 26650 }, { "epoch": 0.34996313590562794, "grad_norm": 0.1624092161655426, "learning_rate": 0.00030047813481518876, "loss": 2.8567745971679686, "step": 26700 }, { "epoch": 0.35061849758335384, "grad_norm": 0.15907767415046692, "learning_rate": 0.00030011228399445805, "loss": 2.8517111206054686, "step": 26750 }, { "epoch": 0.35127385926107974, "grad_norm": 0.16822992265224457, "learning_rate": 0.0002997459856344356, "loss": 2.841147155761719, "step": 26800 }, { "epoch": 0.3519292209388056, "grad_norm": 0.16562947630882263, "learning_rate": 0.0002993792413726117, "loss": 2.860273742675781, "step": 26850 }, { "epoch": 0.3525845826165315, "grad_norm": 0.16309036314487457, "learning_rate": 0.0002990120528484703, "loss": 2.8507235717773436, "step": 26900 }, { "epoch": 0.35323994429425737, "grad_norm": 0.17814874649047852, "learning_rate": 0.00029864442170348114, "loss": 2.8636123657226564, "step": 26950 }, { "epoch": 0.35389530597198327, "grad_norm": 0.16494058072566986, "learning_rate": 0.0002982763495810927, "loss": 2.8643087768554687, "step": 27000 }, { "epoch": 0.35455066764970916, "grad_norm": 0.1739949882030487, "learning_rate": 0.0002979078381267248, "loss": 2.851215515136719, "step": 27050 }, { "epoch": 0.35520602932743506, "grad_norm": 0.16151410341262817, "learning_rate": 0.0002975388889877613, "loss": 2.8670965576171876, "step": 27100 }, { "epoch": 0.35586139100516095, "grad_norm": 0.17844350636005402, "learning_rate": 0.0002971695038135426, "loss": 2.854617004394531, "step": 27150 }, { "epoch": 0.35651675268288685, "grad_norm": 0.16785629093647003, "learning_rate": 0.00029679968425535836, "loss": 2.845762939453125, "step": 27200 }, { "epoch": 0.35717211436061275, "grad_norm": 0.1797703206539154, "learning_rate": 0.0002964294319664401, "loss": 2.8437564086914064, "step": 27250 }, { "epoch": 0.35782747603833864, "grad_norm": 0.16604545712471008, "learning_rate": 0.0002960587486019538, "loss": 2.8505609130859373, "step": 27300 }, { "epoch": 0.35848283771606454, "grad_norm": 0.17395423352718353, "learning_rate": 0.0002956876358189925, "loss": 2.836902770996094, "step": 27350 }, { "epoch": 0.35913819939379044, "grad_norm": 0.16572467982769012, "learning_rate": 0.0002953160952765689, "loss": 2.850990905761719, "step": 27400 }, { "epoch": 0.35979356107151633, "grad_norm": 0.1628977656364441, "learning_rate": 0.00029494412863560797, "loss": 2.838858337402344, "step": 27450 }, { "epoch": 0.36044892274924223, "grad_norm": 0.16777564585208893, "learning_rate": 0.0002945717375589395, "loss": 2.860260009765625, "step": 27500 }, { "epoch": 0.3611042844269681, "grad_norm": 0.16922368109226227, "learning_rate": 0.0002941989237112907, "loss": 2.836827392578125, "step": 27550 }, { "epoch": 0.361759646104694, "grad_norm": 0.1663396805524826, "learning_rate": 0.0002938256887592786, "loss": 2.848780212402344, "step": 27600 }, { "epoch": 0.3624150077824199, "grad_norm": 0.16718782484531403, "learning_rate": 0.00029345203437140284, "loss": 2.860242919921875, "step": 27650 }, { "epoch": 0.3630703694601458, "grad_norm": 0.17059361934661865, "learning_rate": 0.00029307796221803804, "loss": 2.8508291625976563, "step": 27700 }, { "epoch": 0.3637257311378717, "grad_norm": 0.18459787964820862, "learning_rate": 0.0002927034739714265, "loss": 2.8464505004882814, "step": 27750 }, { "epoch": 0.3643810928155976, "grad_norm": 0.16627541184425354, "learning_rate": 0.00029232857130567037, "loss": 2.8501925659179688, "step": 27800 }, { "epoch": 0.3650364544933235, "grad_norm": 0.1738003045320511, "learning_rate": 0.0002919532558967246, "loss": 2.8482626342773436, "step": 27850 }, { "epoch": 0.3656918161710494, "grad_norm": 0.1718655824661255, "learning_rate": 0.0002915775294223893, "loss": 2.839765930175781, "step": 27900 }, { "epoch": 0.3663471778487753, "grad_norm": 0.1667184978723526, "learning_rate": 0.000291201393562302, "loss": 2.8416326904296874, "step": 27950 }, { "epoch": 0.3670025395265012, "grad_norm": 0.1784234195947647, "learning_rate": 0.00029082484999793057, "loss": 2.8398696899414064, "step": 28000 }, { "epoch": 0.3670025395265012, "eval_loss": 2.7462053298950195, "eval_runtime": 5.6334, "eval_samples_per_second": 45.443, "eval_steps_per_second": 5.68, "step": 28000 }, { "epoch": 0.3676579012042271, "grad_norm": 0.1778552532196045, "learning_rate": 0.00029044790041256525, "loss": 2.839460754394531, "step": 28050 }, { "epoch": 0.368313262881953, "grad_norm": 0.1757296919822693, "learning_rate": 0.00029007054649131137, "loss": 2.8534088134765625, "step": 28100 }, { "epoch": 0.3689686245596789, "grad_norm": 0.18028011918067932, "learning_rate": 0.000289692789921082, "loss": 2.843622131347656, "step": 28150 }, { "epoch": 0.3696239862374048, "grad_norm": 0.1780552715063095, "learning_rate": 0.00028931463239059, "loss": 2.8517025756835936, "step": 28200 }, { "epoch": 0.3702793479151307, "grad_norm": 0.17192409932613373, "learning_rate": 0.00028893607559034084, "loss": 2.8490667724609375, "step": 28250 }, { "epoch": 0.37093470959285657, "grad_norm": 0.16289013624191284, "learning_rate": 0.0002885571212126246, "loss": 2.826349792480469, "step": 28300 }, { "epoch": 0.37159007127058247, "grad_norm": 0.16572405397891998, "learning_rate": 0.00028817777095150893, "loss": 2.8444940185546876, "step": 28350 }, { "epoch": 0.37224543294830836, "grad_norm": 0.16589975357055664, "learning_rate": 0.0002877980265028312, "loss": 2.832040100097656, "step": 28400 }, { "epoch": 0.37290079462603426, "grad_norm": 0.1663692146539688, "learning_rate": 0.0002874178895641908, "loss": 2.857304992675781, "step": 28450 }, { "epoch": 0.37355615630376016, "grad_norm": 0.1679500788450241, "learning_rate": 0.00028703736183494186, "loss": 2.8356668090820314, "step": 28500 }, { "epoch": 0.37421151798148605, "grad_norm": 0.16978515684604645, "learning_rate": 0.00028665644501618546, "loss": 2.8382525634765625, "step": 28550 }, { "epoch": 0.37486687965921195, "grad_norm": 0.16526511311531067, "learning_rate": 0.0002862751408107619, "loss": 2.8394024658203123, "step": 28600 }, { "epoch": 0.37552224133693785, "grad_norm": 0.16590842604637146, "learning_rate": 0.00028589345092324336, "loss": 2.82974853515625, "step": 28650 }, { "epoch": 0.37617760301466374, "grad_norm": 0.16279539465904236, "learning_rate": 0.0002855113770599263, "loss": 2.843247985839844, "step": 28700 }, { "epoch": 0.37683296469238964, "grad_norm": 0.16308841109275818, "learning_rate": 0.00028512892092882343, "loss": 2.83541748046875, "step": 28750 }, { "epoch": 0.37748832637011553, "grad_norm": 0.1651703268289566, "learning_rate": 0.0002847460842396566, "loss": 2.8418438720703123, "step": 28800 }, { "epoch": 0.3781436880478414, "grad_norm": 0.18129302561283112, "learning_rate": 0.0002843628687038486, "loss": 2.844976501464844, "step": 28850 }, { "epoch": 0.37879904972556727, "grad_norm": 0.16951687633991241, "learning_rate": 0.000283979276034516, "loss": 2.8369122314453126, "step": 28900 }, { "epoch": 0.37945441140329317, "grad_norm": 0.1697331666946411, "learning_rate": 0.00028359530794646134, "loss": 2.830364074707031, "step": 28950 }, { "epoch": 0.38010977308101906, "grad_norm": 0.17072273790836334, "learning_rate": 0.0002832109661561654, "loss": 2.8385586547851562, "step": 29000 }, { "epoch": 0.38076513475874496, "grad_norm": 0.17905867099761963, "learning_rate": 0.0002828262523817793, "loss": 2.839949035644531, "step": 29050 }, { "epoch": 0.38142049643647086, "grad_norm": 0.16875913739204407, "learning_rate": 0.00028244116834311747, "loss": 2.8411624145507814, "step": 29100 }, { "epoch": 0.38207585811419675, "grad_norm": 0.1666332483291626, "learning_rate": 0.00028205571576164925, "loss": 2.826195068359375, "step": 29150 }, { "epoch": 0.38273121979192265, "grad_norm": 0.17406296730041504, "learning_rate": 0.00028166989636049154, "loss": 2.8342266845703126, "step": 29200 }, { "epoch": 0.38338658146964855, "grad_norm": 0.1711699664592743, "learning_rate": 0.0002812837118644013, "loss": 2.8359359741210937, "step": 29250 }, { "epoch": 0.38404194314737444, "grad_norm": 0.16621212661266327, "learning_rate": 0.00028089716399976733, "loss": 2.8418655395507812, "step": 29300 }, { "epoch": 0.38469730482510034, "grad_norm": 0.18042895197868347, "learning_rate": 0.00028051025449460295, "loss": 2.83731689453125, "step": 29350 }, { "epoch": 0.38535266650282624, "grad_norm": 0.1787901371717453, "learning_rate": 0.00028012298507853805, "loss": 2.825347595214844, "step": 29400 }, { "epoch": 0.38600802818055213, "grad_norm": 0.17395256459712982, "learning_rate": 0.00027973535748281167, "loss": 2.8272149658203123, "step": 29450 }, { "epoch": 0.38666338985827803, "grad_norm": 0.16953957080841064, "learning_rate": 0.0002793473734402638, "loss": 2.8245559692382813, "step": 29500 }, { "epoch": 0.3873187515360039, "grad_norm": 0.175005242228508, "learning_rate": 0.00027895903468532797, "loss": 2.8402670288085936, "step": 29550 }, { "epoch": 0.3879741132137298, "grad_norm": 0.16615919768810272, "learning_rate": 0.0002785703429540234, "loss": 2.8355352783203127, "step": 29600 }, { "epoch": 0.3886294748914557, "grad_norm": 0.17405115067958832, "learning_rate": 0.00027818129998394747, "loss": 2.844706726074219, "step": 29650 }, { "epoch": 0.3892848365691816, "grad_norm": 0.18288710713386536, "learning_rate": 0.00027779190751426734, "loss": 2.8442514038085935, "step": 29700 }, { "epoch": 0.3899401982469075, "grad_norm": 0.16797401010990143, "learning_rate": 0.0002774021672857128, "loss": 2.8279486083984375, "step": 29750 }, { "epoch": 0.3905955599246334, "grad_norm": 0.1715455949306488, "learning_rate": 0.0002770120810405682, "loss": 2.8107513427734374, "step": 29800 }, { "epoch": 0.3912509216023593, "grad_norm": 0.18629951775074005, "learning_rate": 0.00027662165052266466, "loss": 2.8249465942382814, "step": 29850 }, { "epoch": 0.3919062832800852, "grad_norm": 0.17281003296375275, "learning_rate": 0.0002762308774773724, "loss": 2.847117919921875, "step": 29900 }, { "epoch": 0.3925616449578111, "grad_norm": 0.19374391436576843, "learning_rate": 0.000275839763651593, "loss": 2.817379150390625, "step": 29950 }, { "epoch": 0.393217006635537, "grad_norm": 0.1770227700471878, "learning_rate": 0.00027544831079375116, "loss": 2.8242953491210936, "step": 30000 }, { "epoch": 0.393217006635537, "eval_loss": 2.7334699630737305, "eval_runtime": 5.6282, "eval_samples_per_second": 45.485, "eval_steps_per_second": 5.686, "step": 30000 }, { "epoch": 0.3938723683132629, "grad_norm": 0.16634820401668549, "learning_rate": 0.0002750565206537873, "loss": 2.835488586425781, "step": 30050 }, { "epoch": 0.3945277299909888, "grad_norm": 0.16967199742794037, "learning_rate": 0.00027466439498314974, "loss": 2.8210269165039064, "step": 30100 }, { "epoch": 0.3951830916687147, "grad_norm": 0.16936033964157104, "learning_rate": 0.0002742719355347866, "loss": 2.8276303100585936, "step": 30150 }, { "epoch": 0.3958384533464406, "grad_norm": 0.17753078043460846, "learning_rate": 0.0002738791440631382, "loss": 2.8287417602539064, "step": 30200 }, { "epoch": 0.3964938150241665, "grad_norm": 0.16175499558448792, "learning_rate": 0.000273486022324129, "loss": 2.8373623657226563, "step": 30250 }, { "epoch": 0.39714917670189237, "grad_norm": 0.17284804582595825, "learning_rate": 0.00027309257207516, "loss": 2.822721252441406, "step": 30300 }, { "epoch": 0.39780453837961827, "grad_norm": 0.1730196475982666, "learning_rate": 0.0002726987950751008, "loss": 2.8194964599609373, "step": 30350 }, { "epoch": 0.39845990005734416, "grad_norm": 0.16746480762958527, "learning_rate": 0.0002723046930842816, "loss": 2.829527587890625, "step": 30400 }, { "epoch": 0.39911526173507006, "grad_norm": 0.1649184376001358, "learning_rate": 0.00027191026786448536, "loss": 2.823794250488281, "step": 30450 }, { "epoch": 0.39977062341279596, "grad_norm": 0.16962015628814697, "learning_rate": 0.00027151552117894023, "loss": 2.829914855957031, "step": 30500 }, { "epoch": 0.40042598509052185, "grad_norm": 0.18736493587493896, "learning_rate": 0.0002711204547923112, "loss": 2.828226318359375, "step": 30550 }, { "epoch": 0.40108134676824775, "grad_norm": 0.16586989164352417, "learning_rate": 0.0002707250704706926, "loss": 2.824659729003906, "step": 30600 }, { "epoch": 0.40173670844597364, "grad_norm": 0.17056018114089966, "learning_rate": 0.0002703293699815999, "loss": 2.8372531127929688, "step": 30650 }, { "epoch": 0.40239207012369954, "grad_norm": 0.16926118731498718, "learning_rate": 0.00026993335509396213, "loss": 2.83315185546875, "step": 30700 }, { "epoch": 0.40304743180142544, "grad_norm": 0.191090390086174, "learning_rate": 0.0002695370275781137, "loss": 2.8144259643554688, "step": 30750 }, { "epoch": 0.40370279347915133, "grad_norm": 0.17509372532367706, "learning_rate": 0.00026914038920578654, "loss": 2.8302740478515624, "step": 30800 }, { "epoch": 0.4043581551568772, "grad_norm": 0.16718317568302155, "learning_rate": 0.0002687434417501023, "loss": 2.8344842529296876, "step": 30850 }, { "epoch": 0.40501351683460307, "grad_norm": 0.17425920069217682, "learning_rate": 0.00026834618698556444, "loss": 2.8232431030273437, "step": 30900 }, { "epoch": 0.40566887851232897, "grad_norm": 0.1662057638168335, "learning_rate": 0.00026794862668804993, "loss": 2.8317330932617186, "step": 30950 }, { "epoch": 0.40632424019005486, "grad_norm": 0.16697368025779724, "learning_rate": 0.00026755076263480185, "loss": 2.8197427368164063, "step": 31000 }, { "epoch": 0.40697960186778076, "grad_norm": 0.16639693081378937, "learning_rate": 0.000267152596604421, "loss": 2.812342529296875, "step": 31050 }, { "epoch": 0.40763496354550666, "grad_norm": 0.17759492993354797, "learning_rate": 0.0002667541303768583, "loss": 2.8243289184570313, "step": 31100 }, { "epoch": 0.40829032522323255, "grad_norm": 0.17533797025680542, "learning_rate": 0.0002663553657334066, "loss": 2.81999755859375, "step": 31150 }, { "epoch": 0.40894568690095845, "grad_norm": 0.1649777889251709, "learning_rate": 0.00026595630445669263, "loss": 2.817077941894531, "step": 31200 }, { "epoch": 0.40960104857868435, "grad_norm": 0.17240998148918152, "learning_rate": 0.0002655569483306694, "loss": 2.8211968994140624, "step": 31250 }, { "epoch": 0.41025641025641024, "grad_norm": 0.1674206405878067, "learning_rate": 0.00026515729914060787, "loss": 2.8189727783203127, "step": 31300 }, { "epoch": 0.41091177193413614, "grad_norm": 0.16847915947437286, "learning_rate": 0.0002647573586730892, "loss": 2.8135391235351563, "step": 31350 }, { "epoch": 0.41156713361186203, "grad_norm": 0.1722840517759323, "learning_rate": 0.0002643571287159965, "loss": 2.811943359375, "step": 31400 }, { "epoch": 0.41222249528958793, "grad_norm": 0.16438116133213043, "learning_rate": 0.0002639566110585073, "loss": 2.8182452392578123, "step": 31450 }, { "epoch": 0.4128778569673138, "grad_norm": 0.18781812489032745, "learning_rate": 0.000263555807491085, "loss": 2.8164569091796876, "step": 31500 }, { "epoch": 0.4135332186450397, "grad_norm": 0.16678261756896973, "learning_rate": 0.0002631547198054713, "loss": 2.8184609985351563, "step": 31550 }, { "epoch": 0.4141885803227656, "grad_norm": 0.1720782369375229, "learning_rate": 0.0002627533497946777, "loss": 2.8144097900390626, "step": 31600 }, { "epoch": 0.4148439420004915, "grad_norm": 0.16864459216594696, "learning_rate": 0.00026235169925297813, "loss": 2.812674255371094, "step": 31650 }, { "epoch": 0.4154993036782174, "grad_norm": 0.17222043871879578, "learning_rate": 0.0002619497699759006, "loss": 2.821094665527344, "step": 31700 }, { "epoch": 0.4161546653559433, "grad_norm": 0.16629502177238464, "learning_rate": 0.0002615475637602189, "loss": 2.8109759521484374, "step": 31750 }, { "epoch": 0.4168100270336692, "grad_norm": 0.17321209609508514, "learning_rate": 0.0002611450824039451, "loss": 2.814797058105469, "step": 31800 }, { "epoch": 0.4174653887113951, "grad_norm": 0.17162896692752838, "learning_rate": 0.0002607423277063211, "loss": 2.8209078979492186, "step": 31850 }, { "epoch": 0.418120750389121, "grad_norm": 0.17003057897090912, "learning_rate": 0.0002603393014678109, "loss": 2.8202694702148436, "step": 31900 }, { "epoch": 0.4187761120668469, "grad_norm": 0.17229196429252625, "learning_rate": 0.0002599360054900921, "loss": 2.81719482421875, "step": 31950 }, { "epoch": 0.4194314737445728, "grad_norm": 0.1804068684577942, "learning_rate": 0.00025953244157604844, "loss": 2.8250640869140624, "step": 32000 }, { "epoch": 0.4194314737445728, "eval_loss": 2.717702627182007, "eval_runtime": 5.6337, "eval_samples_per_second": 45.441, "eval_steps_per_second": 5.68, "step": 32000 }, { "epoch": 0.4200868354222987, "grad_norm": 0.176468625664711, "learning_rate": 0.00025912861152976125, "loss": 2.8299920654296873, "step": 32050 }, { "epoch": 0.4207421971000246, "grad_norm": 0.1754460632801056, "learning_rate": 0.0002587245171565017, "loss": 2.8209994506835936, "step": 32100 }, { "epoch": 0.4213975587777505, "grad_norm": 0.17093075811862946, "learning_rate": 0.0002583201602627224, "loss": 2.8095404052734376, "step": 32150 }, { "epoch": 0.4220529204554764, "grad_norm": 0.1822441816329956, "learning_rate": 0.0002579155426560498, "loss": 2.822154846191406, "step": 32200 }, { "epoch": 0.4227082821332023, "grad_norm": 0.18130874633789062, "learning_rate": 0.0002575106661452756, "loss": 2.809761962890625, "step": 32250 }, { "epoch": 0.42336364381092817, "grad_norm": 0.1693905144929886, "learning_rate": 0.000257105532540349, "loss": 2.8077737426757814, "step": 32300 }, { "epoch": 0.42401900548865407, "grad_norm": 0.18007878959178925, "learning_rate": 0.0002567001436523685, "loss": 2.81089111328125, "step": 32350 }, { "epoch": 0.42467436716637996, "grad_norm": 0.1728648990392685, "learning_rate": 0.00025629450129357377, "loss": 2.802657470703125, "step": 32400 }, { "epoch": 0.42532972884410586, "grad_norm": 0.17816440761089325, "learning_rate": 0.0002558886072773377, "loss": 2.803893737792969, "step": 32450 }, { "epoch": 0.42598509052183176, "grad_norm": 0.18097521364688873, "learning_rate": 0.00025548246341815803, "loss": 2.8021725463867186, "step": 32500 }, { "epoch": 0.42664045219955765, "grad_norm": 0.17604602873325348, "learning_rate": 0.0002550760715316495, "loss": 2.816082763671875, "step": 32550 }, { "epoch": 0.42729581387728355, "grad_norm": 0.1719379723072052, "learning_rate": 0.00025466943343453556, "loss": 2.8063009643554686, "step": 32600 }, { "epoch": 0.42795117555500944, "grad_norm": 0.17087644338607788, "learning_rate": 0.0002542625509446404, "loss": 2.8064715576171877, "step": 32650 }, { "epoch": 0.42860653723273534, "grad_norm": 0.17209365963935852, "learning_rate": 0.0002538554258808806, "loss": 2.80179931640625, "step": 32700 }, { "epoch": 0.42926189891046124, "grad_norm": 0.18274058401584625, "learning_rate": 0.0002534480600632574, "loss": 2.7945367431640626, "step": 32750 }, { "epoch": 0.42991726058818713, "grad_norm": 0.16481061279773712, "learning_rate": 0.0002530404553128479, "loss": 2.7970880126953124, "step": 32800 }, { "epoch": 0.430572622265913, "grad_norm": 0.17738571763038635, "learning_rate": 0.00025263261345179764, "loss": 2.8090081787109376, "step": 32850 }, { "epoch": 0.43122798394363887, "grad_norm": 0.17695216834545135, "learning_rate": 0.000252224536303312, "loss": 2.8089175415039063, "step": 32900 }, { "epoch": 0.43188334562136477, "grad_norm": 0.17872895300388336, "learning_rate": 0.00025181622569164823, "loss": 2.8115353393554687, "step": 32950 }, { "epoch": 0.43253870729909066, "grad_norm": 0.17590855062007904, "learning_rate": 0.00025140768344210715, "loss": 2.7916915893554686, "step": 33000 }, { "epoch": 0.43319406897681656, "grad_norm": 0.1776922196149826, "learning_rate": 0.0002509989113810253, "loss": 2.80749267578125, "step": 33050 }, { "epoch": 0.43384943065454246, "grad_norm": 0.18435806035995483, "learning_rate": 0.00025058991133576636, "loss": 2.796802978515625, "step": 33100 }, { "epoch": 0.43450479233226835, "grad_norm": 0.17670029401779175, "learning_rate": 0.00025018068513471325, "loss": 2.8053240966796875, "step": 33150 }, { "epoch": 0.43516015400999425, "grad_norm": 0.17623840272426605, "learning_rate": 0.00024977123460726, "loss": 2.801173095703125, "step": 33200 }, { "epoch": 0.43581551568772015, "grad_norm": 0.179827019572258, "learning_rate": 0.00024936156158380314, "loss": 2.8053884887695313, "step": 33250 }, { "epoch": 0.43647087736544604, "grad_norm": 0.17555275559425354, "learning_rate": 0.00024895166789573424, "loss": 2.810987854003906, "step": 33300 }, { "epoch": 0.43712623904317194, "grad_norm": 0.17330294847488403, "learning_rate": 0.0002485415553754311, "loss": 2.8079879760742186, "step": 33350 }, { "epoch": 0.43778160072089783, "grad_norm": 0.17602059245109558, "learning_rate": 0.00024813122585624984, "loss": 2.796018371582031, "step": 33400 }, { "epoch": 0.43843696239862373, "grad_norm": 0.17282463610172272, "learning_rate": 0.0002477206811725165, "loss": 2.810688781738281, "step": 33450 }, { "epoch": 0.4390923240763496, "grad_norm": 0.178282231092453, "learning_rate": 0.00024730992315951934, "loss": 2.8140521240234375, "step": 33500 }, { "epoch": 0.4397476857540755, "grad_norm": 0.17066040635108948, "learning_rate": 0.0002468989536534998, "loss": 2.8120108032226563, "step": 33550 }, { "epoch": 0.4404030474318014, "grad_norm": 0.17559479176998138, "learning_rate": 0.0002464877744916453, "loss": 2.8078497314453124, "step": 33600 }, { "epoch": 0.4410584091095273, "grad_norm": 0.16767553985118866, "learning_rate": 0.00024607638751207995, "loss": 2.800149230957031, "step": 33650 }, { "epoch": 0.4417137707872532, "grad_norm": 0.17333918809890747, "learning_rate": 0.0002456647945538574, "loss": 2.801031494140625, "step": 33700 }, { "epoch": 0.4423691324649791, "grad_norm": 0.17710992693901062, "learning_rate": 0.0002452529974569517, "loss": 2.8102236938476564, "step": 33750 }, { "epoch": 0.443024494142705, "grad_norm": 0.17319464683532715, "learning_rate": 0.0002448409980622498, "loss": 2.8082546997070312, "step": 33800 }, { "epoch": 0.4436798558204309, "grad_norm": 0.17829981446266174, "learning_rate": 0.00024442879821154264, "loss": 2.8040924072265625, "step": 33850 }, { "epoch": 0.4443352174981568, "grad_norm": 0.17057716846466064, "learning_rate": 0.00024401639974751764, "loss": 2.791195983886719, "step": 33900 }, { "epoch": 0.4449905791758827, "grad_norm": 0.1765124499797821, "learning_rate": 0.00024360380451374987, "loss": 2.798342590332031, "step": 33950 }, { "epoch": 0.4456459408536086, "grad_norm": 0.1741255223751068, "learning_rate": 0.00024319101435469405, "loss": 2.7992514038085936, "step": 34000 }, { "epoch": 0.4456459408536086, "eval_loss": 2.7010598182678223, "eval_runtime": 5.6413, "eval_samples_per_second": 45.38, "eval_steps_per_second": 5.672, "step": 34000 }, { "epoch": 0.4463013025313345, "grad_norm": 0.17199166119098663, "learning_rate": 0.00024277803111567639, "loss": 2.807195739746094, "step": 34050 }, { "epoch": 0.4469566642090604, "grad_norm": 0.18042199313640594, "learning_rate": 0.0002423648566428861, "loss": 2.7887872314453124, "step": 34100 }, { "epoch": 0.4476120258867863, "grad_norm": 0.17163442075252533, "learning_rate": 0.0002419514927833674, "loss": 2.7897579956054686, "step": 34150 }, { "epoch": 0.4482673875645122, "grad_norm": 0.17765183746814728, "learning_rate": 0.0002415379413850111, "loss": 2.796370849609375, "step": 34200 }, { "epoch": 0.4489227492422381, "grad_norm": 0.17288920283317566, "learning_rate": 0.00024112420429654637, "loss": 2.791212158203125, "step": 34250 }, { "epoch": 0.44957811091996397, "grad_norm": 0.170242041349411, "learning_rate": 0.0002407102833675325, "loss": 2.7980722045898436, "step": 34300 }, { "epoch": 0.45023347259768987, "grad_norm": 0.17800791561603546, "learning_rate": 0.00024029618044835055, "loss": 2.7813229370117187, "step": 34350 }, { "epoch": 0.45088883427541576, "grad_norm": 0.18201598525047302, "learning_rate": 0.00023988189739019528, "loss": 2.7982821655273438, "step": 34400 }, { "epoch": 0.45154419595314166, "grad_norm": 0.18433402478694916, "learning_rate": 0.00023946743604506655, "loss": 2.79675537109375, "step": 34450 }, { "epoch": 0.45219955763086755, "grad_norm": 0.17122547328472137, "learning_rate": 0.00023905279826576145, "loss": 2.795926208496094, "step": 34500 }, { "epoch": 0.45285491930859345, "grad_norm": 0.17384587228298187, "learning_rate": 0.0002386379859058656, "loss": 2.799088439941406, "step": 34550 }, { "epoch": 0.45351028098631935, "grad_norm": 0.1749262809753418, "learning_rate": 0.0002382230008197452, "loss": 2.7881915283203127, "step": 34600 }, { "epoch": 0.45416564266404524, "grad_norm": 0.1834869384765625, "learning_rate": 0.00023780784486253844, "loss": 2.7956793212890627, "step": 34650 }, { "epoch": 0.45482100434177114, "grad_norm": 0.18870288133621216, "learning_rate": 0.00023739251989014757, "loss": 2.787125244140625, "step": 34700 }, { "epoch": 0.45547636601949704, "grad_norm": 0.19213400781154633, "learning_rate": 0.00023697702775923025, "loss": 2.799786376953125, "step": 34750 }, { "epoch": 0.4561317276972229, "grad_norm": 0.17894001305103302, "learning_rate": 0.00023656137032719148, "loss": 2.7863839721679686, "step": 34800 }, { "epoch": 0.4567870893749488, "grad_norm": 0.17298947274684906, "learning_rate": 0.0002361455494521752, "loss": 2.786640319824219, "step": 34850 }, { "epoch": 0.45744245105267467, "grad_norm": 0.18126356601715088, "learning_rate": 0.00023572956699305592, "loss": 2.7873745727539063, "step": 34900 }, { "epoch": 0.45809781273040057, "grad_norm": 0.17106208205223083, "learning_rate": 0.00023531342480943065, "loss": 2.7961822509765626, "step": 34950 }, { "epoch": 0.45875317440812646, "grad_norm": 0.1805909126996994, "learning_rate": 0.00023489712476161025, "loss": 2.7936129760742188, "step": 35000 }, { "epoch": 0.45940853608585236, "grad_norm": 0.1737130731344223, "learning_rate": 0.0002344806687106115, "loss": 2.810494689941406, "step": 35050 }, { "epoch": 0.46006389776357826, "grad_norm": 0.1769523024559021, "learning_rate": 0.00023406405851814834, "loss": 2.7846115112304686, "step": 35100 }, { "epoch": 0.46071925944130415, "grad_norm": 0.18160481750965118, "learning_rate": 0.00023364729604662392, "loss": 2.7967404174804686, "step": 35150 }, { "epoch": 0.46137462111903005, "grad_norm": 0.1708821803331375, "learning_rate": 0.00023323038315912218, "loss": 2.772400207519531, "step": 35200 }, { "epoch": 0.46202998279675594, "grad_norm": 0.1701134294271469, "learning_rate": 0.00023281332171939934, "loss": 2.780820617675781, "step": 35250 }, { "epoch": 0.46268534447448184, "grad_norm": 0.1778147965669632, "learning_rate": 0.0002323961135918758, "loss": 2.7782827758789064, "step": 35300 }, { "epoch": 0.46334070615220774, "grad_norm": 0.1716746836900711, "learning_rate": 0.00023197876064162757, "loss": 2.771509704589844, "step": 35350 }, { "epoch": 0.46399606782993363, "grad_norm": 0.1749267429113388, "learning_rate": 0.00023156126473437838, "loss": 2.7943505859375, "step": 35400 }, { "epoch": 0.46465142950765953, "grad_norm": 0.17798985540866852, "learning_rate": 0.00023114362773649064, "loss": 2.7937997436523436, "step": 35450 }, { "epoch": 0.4653067911853854, "grad_norm": 0.17478112876415253, "learning_rate": 0.00023072585151495779, "loss": 2.78129150390625, "step": 35500 }, { "epoch": 0.4659621528631113, "grad_norm": 0.18205077946186066, "learning_rate": 0.0002303079379373955, "loss": 2.7831829833984374, "step": 35550 }, { "epoch": 0.4666175145408372, "grad_norm": 0.19633878767490387, "learning_rate": 0.0002298898888720335, "loss": 2.7940487670898437, "step": 35600 }, { "epoch": 0.4672728762185631, "grad_norm": 0.18207716941833496, "learning_rate": 0.00022947170618770727, "loss": 2.777283935546875, "step": 35650 }, { "epoch": 0.467928237896289, "grad_norm": 0.17792396247386932, "learning_rate": 0.0002290533917538495, "loss": 2.794576416015625, "step": 35700 }, { "epoch": 0.4685835995740149, "grad_norm": 0.18311934173107147, "learning_rate": 0.000228634947440482, "loss": 2.784618225097656, "step": 35750 }, { "epoch": 0.4692389612517408, "grad_norm": 0.18091702461242676, "learning_rate": 0.00022821637511820692, "loss": 2.779443664550781, "step": 35800 }, { "epoch": 0.4698943229294667, "grad_norm": 0.17822156846523285, "learning_rate": 0.00022779767665819902, "loss": 2.7834317016601564, "step": 35850 }, { "epoch": 0.4705496846071926, "grad_norm": 0.1831509917974472, "learning_rate": 0.00022737885393219663, "loss": 2.78453125, "step": 35900 }, { "epoch": 0.4712050462849185, "grad_norm": 0.1775432676076889, "learning_rate": 0.00022695990881249384, "loss": 2.7866787719726562, "step": 35950 }, { "epoch": 0.4718604079626444, "grad_norm": 0.18006455898284912, "learning_rate": 0.00022654084317193167, "loss": 2.788680114746094, "step": 36000 }, { "epoch": 0.4718604079626444, "eval_loss": 2.688542127609253, "eval_runtime": 5.63, "eval_samples_per_second": 45.47, "eval_steps_per_second": 5.684, "step": 36000 }, { "epoch": 0.4725157696403703, "grad_norm": 0.17572930455207825, "learning_rate": 0.0002261216588838901, "loss": 2.7965884399414063, "step": 36050 }, { "epoch": 0.4731711313180962, "grad_norm": 0.1913042813539505, "learning_rate": 0.00022570235782227936, "loss": 2.7751339721679686, "step": 36100 }, { "epoch": 0.4738264929958221, "grad_norm": 0.1840689331293106, "learning_rate": 0.0002252829418615318, "loss": 2.7817181396484374, "step": 36150 }, { "epoch": 0.474481854673548, "grad_norm": 0.18235161900520325, "learning_rate": 0.00022486341287659333, "loss": 2.775789489746094, "step": 36200 }, { "epoch": 0.47513721635127387, "grad_norm": 0.17426715791225433, "learning_rate": 0.0002244437727429152, "loss": 2.7855352783203124, "step": 36250 }, { "epoch": 0.47579257802899977, "grad_norm": 0.18308281898498535, "learning_rate": 0.0002240240233364455, "loss": 2.773079528808594, "step": 36300 }, { "epoch": 0.47644793970672566, "grad_norm": 0.1761571168899536, "learning_rate": 0.00022360416653362087, "loss": 2.7845745849609376, "step": 36350 }, { "epoch": 0.47710330138445156, "grad_norm": 0.18568705022335052, "learning_rate": 0.00022318420421135792, "loss": 2.7646163940429687, "step": 36400 }, { "epoch": 0.47775866306217746, "grad_norm": 0.17748695611953735, "learning_rate": 0.00022276413824704502, "loss": 2.775191345214844, "step": 36450 }, { "epoch": 0.47841402473990335, "grad_norm": 0.17191524803638458, "learning_rate": 0.00022234397051853398, "loss": 2.783917236328125, "step": 36500 }, { "epoch": 0.47906938641762925, "grad_norm": 0.17897158861160278, "learning_rate": 0.00022192370290413137, "loss": 2.7766815185546876, "step": 36550 }, { "epoch": 0.47972474809535515, "grad_norm": 0.17524339258670807, "learning_rate": 0.00022150333728259035, "loss": 2.779471740722656, "step": 36600 }, { "epoch": 0.48038010977308104, "grad_norm": 0.1740463525056839, "learning_rate": 0.00022108287553310228, "loss": 2.783061828613281, "step": 36650 }, { "epoch": 0.48103547145080694, "grad_norm": 0.19177548587322235, "learning_rate": 0.00022066231953528812, "loss": 2.770576171875, "step": 36700 }, { "epoch": 0.48169083312853284, "grad_norm": 0.18529212474822998, "learning_rate": 0.00022024167116919025, "loss": 2.7833587646484377, "step": 36750 }, { "epoch": 0.4823461948062587, "grad_norm": 0.18035073578357697, "learning_rate": 0.00021982093231526394, "loss": 2.7897509765625, "step": 36800 }, { "epoch": 0.4830015564839846, "grad_norm": 0.1930634081363678, "learning_rate": 0.00021940010485436891, "loss": 2.7712725830078124, "step": 36850 }, { "epoch": 0.48365691816171047, "grad_norm": 0.1875726878643036, "learning_rate": 0.00021897919066776113, "loss": 2.7792849731445313, "step": 36900 }, { "epoch": 0.48431227983943637, "grad_norm": 0.19788779318332672, "learning_rate": 0.00021855819163708415, "loss": 2.778841857910156, "step": 36950 }, { "epoch": 0.48496764151716226, "grad_norm": 0.1755739152431488, "learning_rate": 0.00021813710964436092, "loss": 2.77288818359375, "step": 37000 }, { "epoch": 0.48562300319488816, "grad_norm": 0.18156370520591736, "learning_rate": 0.00021771594657198505, "loss": 2.7773919677734376, "step": 37050 }, { "epoch": 0.48627836487261406, "grad_norm": 0.17398156225681305, "learning_rate": 0.00021729470430271276, "loss": 2.7756591796875, "step": 37100 }, { "epoch": 0.48693372655033995, "grad_norm": 0.17524923384189606, "learning_rate": 0.00021687338471965432, "loss": 2.7676190185546874, "step": 37150 }, { "epoch": 0.48758908822806585, "grad_norm": 0.1739235818386078, "learning_rate": 0.00021645198970626566, "loss": 2.766216125488281, "step": 37200 }, { "epoch": 0.48824444990579174, "grad_norm": 0.17425961792469025, "learning_rate": 0.00021603052114633968, "loss": 2.777612609863281, "step": 37250 }, { "epoch": 0.48889981158351764, "grad_norm": 0.20634113252162933, "learning_rate": 0.00021560898092399836, "loss": 2.7745510864257814, "step": 37300 }, { "epoch": 0.48955517326124354, "grad_norm": 0.18285129964351654, "learning_rate": 0.00021518737092368384, "loss": 2.766454162597656, "step": 37350 }, { "epoch": 0.49021053493896943, "grad_norm": 0.17791612446308136, "learning_rate": 0.00021476569303015026, "loss": 2.7686627197265623, "step": 37400 }, { "epoch": 0.49086589661669533, "grad_norm": 0.17872479557991028, "learning_rate": 0.00021434394912845525, "loss": 2.7785491943359375, "step": 37450 }, { "epoch": 0.4915212582944212, "grad_norm": 0.1808568388223648, "learning_rate": 0.00021392214110395165, "loss": 2.76978515625, "step": 37500 }, { "epoch": 0.4921766199721471, "grad_norm": 0.18766574561595917, "learning_rate": 0.00021350027084227863, "loss": 2.7707400512695313, "step": 37550 }, { "epoch": 0.492831981649873, "grad_norm": 0.1850651353597641, "learning_rate": 0.00021307834022935392, "loss": 2.7726034545898437, "step": 37600 }, { "epoch": 0.4934873433275989, "grad_norm": 0.18099629878997803, "learning_rate": 0.00021265635115136485, "loss": 2.783136901855469, "step": 37650 }, { "epoch": 0.4941427050053248, "grad_norm": 0.1758628934621811, "learning_rate": 0.0002122343054947602, "loss": 2.762894592285156, "step": 37700 }, { "epoch": 0.4947980666830507, "grad_norm": 0.18514783680438995, "learning_rate": 0.00021181220514624163, "loss": 2.7843386840820314, "step": 37750 }, { "epoch": 0.4954534283607766, "grad_norm": 0.19134601950645447, "learning_rate": 0.00021139005199275536, "loss": 2.7828628540039064, "step": 37800 }, { "epoch": 0.4961087900385025, "grad_norm": 0.18108375370502472, "learning_rate": 0.0002109678479214836, "loss": 2.763644104003906, "step": 37850 }, { "epoch": 0.4967641517162284, "grad_norm": 0.1854194849729538, "learning_rate": 0.00021054559481983618, "loss": 2.7671295166015626, "step": 37900 }, { "epoch": 0.4974195133939543, "grad_norm": 0.17926497757434845, "learning_rate": 0.00021012329457544216, "loss": 2.761571350097656, "step": 37950 }, { "epoch": 0.4980748750716802, "grad_norm": 0.17533256113529205, "learning_rate": 0.00020970094907614125, "loss": 2.756622619628906, "step": 38000 }, { "epoch": 0.4980748750716802, "eval_loss": 2.675839900970459, "eval_runtime": 5.6302, "eval_samples_per_second": 45.469, "eval_steps_per_second": 5.684, "step": 38000 }, { "epoch": 0.4987302367494061, "grad_norm": 0.1715238392353058, "learning_rate": 0.00020927856020997566, "loss": 2.763541259765625, "step": 38050 }, { "epoch": 0.499385598427132, "grad_norm": 0.1891726553440094, "learning_rate": 0.0002088561298651812, "loss": 2.7599969482421876, "step": 38100 }, { "epoch": 0.5000409601048579, "grad_norm": 0.1891585737466812, "learning_rate": 0.00020843365993017946, "loss": 2.767780456542969, "step": 38150 }, { "epoch": 0.5006963217825837, "grad_norm": 0.18187370896339417, "learning_rate": 0.00020801115229356857, "loss": 2.758955993652344, "step": 38200 }, { "epoch": 0.5013516834603097, "grad_norm": 0.180680513381958, "learning_rate": 0.00020758860884411554, "loss": 2.773992004394531, "step": 38250 }, { "epoch": 0.5020070451380355, "grad_norm": 0.17935651540756226, "learning_rate": 0.00020716603147074737, "loss": 2.760301208496094, "step": 38300 }, { "epoch": 0.5026624068157615, "grad_norm": 0.17484623193740845, "learning_rate": 0.0002067434220625427, "loss": 2.762476806640625, "step": 38350 }, { "epoch": 0.5033177684934873, "grad_norm": 0.1851634383201599, "learning_rate": 0.00020632078250872336, "loss": 2.7775283813476563, "step": 38400 }, { "epoch": 0.5039731301712133, "grad_norm": 0.18199287354946136, "learning_rate": 0.00020589811469864602, "loss": 2.7696572875976564, "step": 38450 }, { "epoch": 0.5046284918489391, "grad_norm": 0.1790669709444046, "learning_rate": 0.0002054754205217936, "loss": 2.766701965332031, "step": 38500 }, { "epoch": 0.505283853526665, "grad_norm": 0.18057458102703094, "learning_rate": 0.0002050527018677669, "loss": 2.763885498046875, "step": 38550 }, { "epoch": 0.5059392152043909, "grad_norm": 0.17684859037399292, "learning_rate": 0.00020462996062627613, "loss": 2.76280517578125, "step": 38600 }, { "epoch": 0.5065945768821168, "grad_norm": 0.17858350276947021, "learning_rate": 0.00020420719868713256, "loss": 2.76749755859375, "step": 38650 }, { "epoch": 0.5072499385598427, "grad_norm": 0.18191659450531006, "learning_rate": 0.0002037844179402398, "loss": 2.7653994750976563, "step": 38700 }, { "epoch": 0.5079053002375686, "grad_norm": 0.17849008738994598, "learning_rate": 0.00020336162027558582, "loss": 2.7564956665039064, "step": 38750 }, { "epoch": 0.5085606619152945, "grad_norm": 0.18029668927192688, "learning_rate": 0.00020293880758323396, "loss": 2.75717529296875, "step": 38800 }, { "epoch": 0.5092160235930204, "grad_norm": 0.179390087723732, "learning_rate": 0.00020251598175331477, "loss": 2.761173095703125, "step": 38850 }, { "epoch": 0.5098713852707463, "grad_norm": 0.18294206261634827, "learning_rate": 0.0002020931446760177, "loss": 2.7567578125, "step": 38900 }, { "epoch": 0.5105267469484722, "grad_norm": 0.19343997538089752, "learning_rate": 0.00020167029824158235, "loss": 2.764580078125, "step": 38950 }, { "epoch": 0.5111821086261981, "grad_norm": 0.17865416407585144, "learning_rate": 0.00020124744434029011, "loss": 2.7580584716796874, "step": 39000 }, { "epoch": 0.511837470303924, "grad_norm": 0.17839521169662476, "learning_rate": 0.0002008245848624559, "loss": 2.7663525390625, "step": 39050 }, { "epoch": 0.5124928319816499, "grad_norm": 0.18171542882919312, "learning_rate": 0.00020040172169841949, "loss": 2.7568914794921877, "step": 39100 }, { "epoch": 0.5131481936593758, "grad_norm": 0.205347940325737, "learning_rate": 0.00019997885673853704, "loss": 2.75294189453125, "step": 39150 }, { "epoch": 0.5138035553371016, "grad_norm": 0.18756859004497528, "learning_rate": 0.0001995559918731729, "loss": 2.7669851684570315, "step": 39200 }, { "epoch": 0.5144589170148276, "grad_norm": 0.1893216073513031, "learning_rate": 0.00019913312899269084, "loss": 2.7494488525390626, "step": 39250 }, { "epoch": 0.5151142786925534, "grad_norm": 0.18761029839515686, "learning_rate": 0.0001987102699874459, "loss": 2.7610733032226564, "step": 39300 }, { "epoch": 0.5157696403702794, "grad_norm": 0.17655566334724426, "learning_rate": 0.0001982874167477757, "loss": 2.7527294921875, "step": 39350 }, { "epoch": 0.5164250020480052, "grad_norm": 0.18693533539772034, "learning_rate": 0.0001978645711639921, "loss": 2.7658511352539064, "step": 39400 }, { "epoch": 0.5170803637257312, "grad_norm": 0.1764882355928421, "learning_rate": 0.00019744173512637286, "loss": 2.742279052734375, "step": 39450 }, { "epoch": 0.517735725403457, "grad_norm": 0.17796702682971954, "learning_rate": 0.0001970189105251528, "loss": 2.7436346435546874, "step": 39500 }, { "epoch": 0.518391087081183, "grad_norm": 0.1804492175579071, "learning_rate": 0.00019659609925051582, "loss": 2.762234802246094, "step": 39550 }, { "epoch": 0.5190464487589088, "grad_norm": 0.18773473799228668, "learning_rate": 0.00019617330319258628, "loss": 2.7488772583007814, "step": 39600 }, { "epoch": 0.5197018104366348, "grad_norm": 0.18577367067337036, "learning_rate": 0.00019575052424142034, "loss": 2.7631631469726563, "step": 39650 }, { "epoch": 0.5203571721143606, "grad_norm": 0.18235595524311066, "learning_rate": 0.0001953277642869978, "loss": 2.754354248046875, "step": 39700 }, { "epoch": 0.5210125337920866, "grad_norm": 0.18477827310562134, "learning_rate": 0.00019490502521921356, "loss": 2.75442138671875, "step": 39750 }, { "epoch": 0.5216678954698124, "grad_norm": 0.1838875561952591, "learning_rate": 0.00019448230892786907, "loss": 2.7684317016601563, "step": 39800 }, { "epoch": 0.5223232571475382, "grad_norm": 0.17940661311149597, "learning_rate": 0.000194059617302664, "loss": 2.7501370239257814, "step": 39850 }, { "epoch": 0.5229786188252642, "grad_norm": 0.185946524143219, "learning_rate": 0.00019363695223318774, "loss": 2.753255615234375, "step": 39900 }, { "epoch": 0.52363398050299, "grad_norm": 0.18180282413959503, "learning_rate": 0.00019321431560891098, "loss": 2.7671429443359377, "step": 39950 }, { "epoch": 0.524289342180716, "grad_norm": 0.181806281208992, "learning_rate": 0.00019279170931917728, "loss": 2.7551083374023437, "step": 40000 }, { "epoch": 0.524289342180716, "eval_loss": 2.665051221847534, "eval_runtime": 5.6315, "eval_samples_per_second": 45.458, "eval_steps_per_second": 5.682, "step": 40000 }, { "epoch": 0.5249447038584418, "grad_norm": 0.1850646734237671, "learning_rate": 0.0001923691352531945, "loss": 2.7553775024414064, "step": 40050 }, { "epoch": 0.5256000655361678, "grad_norm": 0.1765211522579193, "learning_rate": 0.0001919465953000266, "loss": 2.75322265625, "step": 40100 }, { "epoch": 0.5262554272138936, "grad_norm": 0.1793850064277649, "learning_rate": 0.00019152409134858486, "loss": 2.756124267578125, "step": 40150 }, { "epoch": 0.5269107888916196, "grad_norm": 0.18779806792736053, "learning_rate": 0.00019110162528761967, "loss": 2.740491943359375, "step": 40200 }, { "epoch": 0.5275661505693454, "grad_norm": 0.1876293271780014, "learning_rate": 0.00019067919900571219, "loss": 2.747510986328125, "step": 40250 }, { "epoch": 0.5282215122470714, "grad_norm": 0.18507513403892517, "learning_rate": 0.00019025681439126555, "loss": 2.7438848876953124, "step": 40300 }, { "epoch": 0.5288768739247972, "grad_norm": 0.17805354297161102, "learning_rate": 0.00018983447333249673, "loss": 2.753096618652344, "step": 40350 }, { "epoch": 0.5295322356025232, "grad_norm": 0.17969100177288055, "learning_rate": 0.00018941217771742798, "loss": 2.742714538574219, "step": 40400 }, { "epoch": 0.530187597280249, "grad_norm": 0.18937169015407562, "learning_rate": 0.00018898992943387836, "loss": 2.750940856933594, "step": 40450 }, { "epoch": 0.530842958957975, "grad_norm": 0.18194428086280823, "learning_rate": 0.0001885677303694554, "loss": 2.7457281494140626, "step": 40500 }, { "epoch": 0.5314983206357008, "grad_norm": 0.1870952844619751, "learning_rate": 0.00018814558241154653, "loss": 2.750302429199219, "step": 40550 }, { "epoch": 0.5321536823134267, "grad_norm": 0.18458783626556396, "learning_rate": 0.00018772348744731075, "loss": 2.7554135131835937, "step": 40600 }, { "epoch": 0.5328090439911526, "grad_norm": 0.18436960875988007, "learning_rate": 0.0001873014473636702, "loss": 2.760242614746094, "step": 40650 }, { "epoch": 0.5334644056688785, "grad_norm": 0.1771363466978073, "learning_rate": 0.0001868794640473016, "loss": 2.7394308471679687, "step": 40700 }, { "epoch": 0.5341197673466044, "grad_norm": 0.18486769497394562, "learning_rate": 0.00018645753938462798, "loss": 2.7567718505859373, "step": 40750 }, { "epoch": 0.5347751290243303, "grad_norm": 0.1842900663614273, "learning_rate": 0.00018603567526181015, "loss": 2.749614562988281, "step": 40800 }, { "epoch": 0.5354304907020562, "grad_norm": 0.18352243304252625, "learning_rate": 0.00018561387356473823, "loss": 2.74935302734375, "step": 40850 }, { "epoch": 0.5360858523797821, "grad_norm": 0.18941424787044525, "learning_rate": 0.0001851921361790233, "loss": 2.7365756225585938, "step": 40900 }, { "epoch": 0.536741214057508, "grad_norm": 0.1833369880914688, "learning_rate": 0.000184770464989989, "loss": 2.7419009399414063, "step": 40950 }, { "epoch": 0.5373965757352339, "grad_norm": 0.17406857013702393, "learning_rate": 0.00018434886188266293, "loss": 2.7479153442382813, "step": 41000 }, { "epoch": 0.5380519374129598, "grad_norm": 0.1794329434633255, "learning_rate": 0.00018392732874176847, "loss": 2.7448220825195313, "step": 41050 }, { "epoch": 0.5387072990906857, "grad_norm": 0.1862756609916687, "learning_rate": 0.00018350586745171618, "loss": 2.7439501953125, "step": 41100 }, { "epoch": 0.5393626607684116, "grad_norm": 0.18455125391483307, "learning_rate": 0.0001830844798965953, "loss": 2.7480377197265624, "step": 41150 }, { "epoch": 0.5400180224461375, "grad_norm": 0.18274185061454773, "learning_rate": 0.00018266316796016564, "loss": 2.757599182128906, "step": 41200 }, { "epoch": 0.5406733841238633, "grad_norm": 0.1809069663286209, "learning_rate": 0.0001822419335258488, "loss": 2.739791259765625, "step": 41250 }, { "epoch": 0.5413287458015893, "grad_norm": 0.18559743463993073, "learning_rate": 0.0001818207784767201, "loss": 2.7440814208984374, "step": 41300 }, { "epoch": 0.5419841074793151, "grad_norm": 0.1843985766172409, "learning_rate": 0.00018139970469549976, "loss": 2.7467135620117187, "step": 41350 }, { "epoch": 0.5426394691570411, "grad_norm": 0.18807105720043182, "learning_rate": 0.00018097871406454487, "loss": 2.7514608764648436, "step": 41400 }, { "epoch": 0.5432948308347669, "grad_norm": 0.18305730819702148, "learning_rate": 0.00018055780846584074, "loss": 2.7453659057617186, "step": 41450 }, { "epoch": 0.5439501925124929, "grad_norm": 0.1893676221370697, "learning_rate": 0.00018013698978099256, "loss": 2.749328918457031, "step": 41500 }, { "epoch": 0.5446055541902187, "grad_norm": 0.1865210384130478, "learning_rate": 0.00017971625989121698, "loss": 2.7399996948242187, "step": 41550 }, { "epoch": 0.5452609158679447, "grad_norm": 0.18489766120910645, "learning_rate": 0.00017929562067733374, "loss": 2.7390927124023436, "step": 41600 }, { "epoch": 0.5459162775456705, "grad_norm": 0.1855878233909607, "learning_rate": 0.00017887507401975717, "loss": 2.7417999267578126, "step": 41650 }, { "epoch": 0.5465716392233965, "grad_norm": 0.18664325773715973, "learning_rate": 0.00017845462179848793, "loss": 2.7299310302734376, "step": 41700 }, { "epoch": 0.5472270009011223, "grad_norm": 0.18547379970550537, "learning_rate": 0.0001780342658931043, "loss": 2.7381558227539062, "step": 41750 }, { "epoch": 0.5478823625788481, "grad_norm": 0.1792854517698288, "learning_rate": 0.00017761400818275426, "loss": 2.736330871582031, "step": 41800 }, { "epoch": 0.5485377242565741, "grad_norm": 0.1798439770936966, "learning_rate": 0.00017719385054614667, "loss": 2.720264587402344, "step": 41850 }, { "epoch": 0.5491930859342999, "grad_norm": 0.18211401998996735, "learning_rate": 0.000176773794861543, "loss": 2.7482330322265627, "step": 41900 }, { "epoch": 0.5498484476120259, "grad_norm": 0.19189517199993134, "learning_rate": 0.00017635384300674912, "loss": 2.7439309692382814, "step": 41950 }, { "epoch": 0.5505038092897517, "grad_norm": 0.19059494137763977, "learning_rate": 0.00017593399685910657, "loss": 2.753132019042969, "step": 42000 }, { "epoch": 0.5505038092897517, "eval_loss": 2.6511430740356445, "eval_runtime": 5.6331, "eval_samples_per_second": 45.446, "eval_steps_per_second": 5.681, "step": 42000 }, { "epoch": 0.5511591709674777, "grad_norm": 0.19615179300308228, "learning_rate": 0.00017551425829548438, "loss": 2.7426458740234376, "step": 42050 }, { "epoch": 0.5518145326452035, "grad_norm": 0.1869739294052124, "learning_rate": 0.0001750946291922707, "loss": 2.741033935546875, "step": 42100 }, { "epoch": 0.5524698943229295, "grad_norm": 0.18508747220039368, "learning_rate": 0.0001746751114253643, "loss": 2.743408508300781, "step": 42150 }, { "epoch": 0.5531252560006553, "grad_norm": 0.19253212213516235, "learning_rate": 0.00017425570687016625, "loss": 2.731234436035156, "step": 42200 }, { "epoch": 0.5537806176783813, "grad_norm": 0.18232983350753784, "learning_rate": 0.0001738364174015715, "loss": 2.728257751464844, "step": 42250 }, { "epoch": 0.5544359793561071, "grad_norm": 0.1846272051334381, "learning_rate": 0.0001734172448939606, "loss": 2.74490966796875, "step": 42300 }, { "epoch": 0.5550913410338331, "grad_norm": 0.1905668079853058, "learning_rate": 0.00017299819122119114, "loss": 2.743033447265625, "step": 42350 }, { "epoch": 0.5557467027115589, "grad_norm": 0.18363609910011292, "learning_rate": 0.00017257925825658947, "loss": 2.730335998535156, "step": 42400 }, { "epoch": 0.5564020643892849, "grad_norm": 0.18854916095733643, "learning_rate": 0.00017216044787294243, "loss": 2.7323513793945313, "step": 42450 }, { "epoch": 0.5570574260670107, "grad_norm": 0.1898990124464035, "learning_rate": 0.0001717417619424888, "loss": 2.7401559448242185, "step": 42500 }, { "epoch": 0.5577127877447366, "grad_norm": 0.22384728491306305, "learning_rate": 0.00017132320233691103, "loss": 2.7380230712890623, "step": 42550 }, { "epoch": 0.5583681494224625, "grad_norm": 0.19281762838363647, "learning_rate": 0.00017090477092732687, "loss": 2.7371759033203125, "step": 42600 }, { "epoch": 0.5590235111001884, "grad_norm": 0.19027961790561676, "learning_rate": 0.0001704864695842809, "loss": 2.72266845703125, "step": 42650 }, { "epoch": 0.5596788727779143, "grad_norm": 0.18994921445846558, "learning_rate": 0.0001700683001777364, "loss": 2.7218927001953124, "step": 42700 }, { "epoch": 0.5603342344556402, "grad_norm": 0.1878528594970703, "learning_rate": 0.00016965026457706675, "loss": 2.7415142822265626, "step": 42750 }, { "epoch": 0.5609895961333661, "grad_norm": 0.18615955114364624, "learning_rate": 0.0001692323646510471, "loss": 2.7404815673828127, "step": 42800 }, { "epoch": 0.561644957811092, "grad_norm": 0.18635711073875427, "learning_rate": 0.00016881460226784626, "loss": 2.7431069946289064, "step": 42850 }, { "epoch": 0.5623003194888179, "grad_norm": 0.19009113311767578, "learning_rate": 0.00016839697929501806, "loss": 2.7207156372070314, "step": 42900 }, { "epoch": 0.5629556811665438, "grad_norm": 0.19169089198112488, "learning_rate": 0.00016797949759949306, "loss": 2.727295227050781, "step": 42950 }, { "epoch": 0.5636110428442697, "grad_norm": 0.18418191373348236, "learning_rate": 0.00016756215904757048, "loss": 2.7204159545898436, "step": 43000 }, { "epoch": 0.5642664045219956, "grad_norm": 0.19322168827056885, "learning_rate": 0.0001671449655049093, "loss": 2.734036865234375, "step": 43050 }, { "epoch": 0.5649217661997215, "grad_norm": 0.1920599639415741, "learning_rate": 0.00016672791883652055, "loss": 2.7286300659179688, "step": 43100 }, { "epoch": 0.5655771278774474, "grad_norm": 0.19389255344867706, "learning_rate": 0.00016631102090675852, "loss": 2.7239443969726564, "step": 43150 }, { "epoch": 0.5662324895551732, "grad_norm": 0.1882966160774231, "learning_rate": 0.00016589427357931264, "loss": 2.7253955078125, "step": 43200 }, { "epoch": 0.5668878512328992, "grad_norm": 0.19289398193359375, "learning_rate": 0.0001654776787171991, "loss": 2.7315249633789063, "step": 43250 }, { "epoch": 0.567543212910625, "grad_norm": 0.1930937021970749, "learning_rate": 0.00016506123818275245, "loss": 2.733201599121094, "step": 43300 }, { "epoch": 0.568198574588351, "grad_norm": 0.18936358392238617, "learning_rate": 0.00016464495383761743, "loss": 2.7308929443359373, "step": 43350 }, { "epoch": 0.5688539362660768, "grad_norm": 0.19116507470607758, "learning_rate": 0.00016422882754274048, "loss": 2.7391571044921874, "step": 43400 }, { "epoch": 0.5695092979438028, "grad_norm": 0.1958114206790924, "learning_rate": 0.0001638128611583615, "loss": 2.742430419921875, "step": 43450 }, { "epoch": 0.5701646596215286, "grad_norm": 0.1928686648607254, "learning_rate": 0.00016339705654400556, "loss": 2.716089172363281, "step": 43500 }, { "epoch": 0.5708200212992546, "grad_norm": 0.1955578476190567, "learning_rate": 0.0001629814155584746, "loss": 2.727280578613281, "step": 43550 }, { "epoch": 0.5714753829769804, "grad_norm": 0.18764206767082214, "learning_rate": 0.00016256594005983896, "loss": 2.7315338134765623, "step": 43600 }, { "epoch": 0.5721307446547064, "grad_norm": 0.1953878253698349, "learning_rate": 0.00016215063190542933, "loss": 2.7350732421875, "step": 43650 }, { "epoch": 0.5727861063324322, "grad_norm": 0.18109111487865448, "learning_rate": 0.00016173549295182818, "loss": 2.7308255004882813, "step": 43700 }, { "epoch": 0.573441468010158, "grad_norm": 0.1942085325717926, "learning_rate": 0.00016132052505486166, "loss": 2.72094482421875, "step": 43750 }, { "epoch": 0.574096829687884, "grad_norm": 0.19263774156570435, "learning_rate": 0.0001609057300695912, "loss": 2.7240130615234377, "step": 43800 }, { "epoch": 0.5747521913656098, "grad_norm": 0.18805767595767975, "learning_rate": 0.0001604911098503053, "loss": 2.721449279785156, "step": 43850 }, { "epoch": 0.5754075530433358, "grad_norm": 0.190931499004364, "learning_rate": 0.00016007666625051119, "loss": 2.7199191284179687, "step": 43900 }, { "epoch": 0.5760629147210616, "grad_norm": 0.18973998725414276, "learning_rate": 0.00015966240112292646, "loss": 2.7312277221679686, "step": 43950 }, { "epoch": 0.5767182763987876, "grad_norm": 0.18965263664722443, "learning_rate": 0.00015924831631947093, "loss": 2.741227111816406, "step": 44000 }, { "epoch": 0.5767182763987876, "eval_loss": 2.636690139770508, "eval_runtime": 5.6334, "eval_samples_per_second": 45.443, "eval_steps_per_second": 5.68, "step": 44000 } ], "logging_steps": 50, "max_steps": 76293, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 1000, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 6.734756539740979e+19, "train_batch_size": 8, "trial_name": null, "trial_params": null }