{ "best_metric": 3.759232521057129, "best_model_checkpoint": "/scratch/cl5625/exceptions/models/100M_low_1000_6910/checkpoint-10000", "epoch": 1.0781671159029649, "eval_steps": 1000, "global_step": 10000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.005390835579514825, "grad_norm": 4.540576457977295, "learning_rate": 0.000276, "loss": 9.0234, "step": 50 }, { "epoch": 0.01078167115902965, "grad_norm": 1.3573050498962402, "learning_rate": 0.0005759999999999999, "loss": 6.9351, "step": 100 }, { "epoch": 0.016172506738544475, "grad_norm": 1.575430989265442, "learning_rate": 0.000599702104695089, "loss": 6.533, "step": 150 }, { "epoch": 0.0215633423180593, "grad_norm": 1.919303297996521, "learning_rate": 0.0005993783054506205, "loss": 6.2466, "step": 200 }, { "epoch": 0.026954177897574125, "grad_norm": 1.5167046785354614, "learning_rate": 0.0005990545062061521, "loss": 6.0902, "step": 250 }, { "epoch": 0.03234501347708895, "grad_norm": 2.198723793029785, "learning_rate": 0.0005987307069616836, "loss": 5.9584, "step": 300 }, { "epoch": 0.03773584905660377, "grad_norm": 1.1930028200149536, "learning_rate": 0.0005984069077172153, "loss": 5.8824, "step": 350 }, { "epoch": 0.0431266846361186, "grad_norm": 1.5988584756851196, "learning_rate": 0.0005980831084727469, "loss": 5.8242, "step": 400 }, { "epoch": 0.04851752021563342, "grad_norm": 1.7518678903579712, "learning_rate": 0.0005977593092282784, "loss": 5.7575, "step": 450 }, { "epoch": 0.05390835579514825, "grad_norm": 1.542738914489746, "learning_rate": 0.00059743550998381, "loss": 5.65, "step": 500 }, { "epoch": 0.05929919137466307, "grad_norm": 1.1888893842697144, "learning_rate": 0.0005971117107393416, "loss": 5.6048, "step": 550 }, { "epoch": 0.0646900269541779, "grad_norm": 1.1427416801452637, "learning_rate": 0.0005967879114948732, "loss": 5.5294, "step": 600 }, { "epoch": 0.07008086253369272, "grad_norm": 1.5147260427474976, "learning_rate": 0.0005964641122504047, "loss": 5.4641, "step": 650 }, { "epoch": 0.07547169811320754, "grad_norm": 1.2342205047607422, "learning_rate": 0.0005961403130059363, "loss": 5.3932, "step": 700 }, { "epoch": 0.08086253369272237, "grad_norm": 0.8510802388191223, "learning_rate": 0.0005958165137614678, "loss": 5.3301, "step": 750 }, { "epoch": 0.0862533692722372, "grad_norm": 1.226401686668396, "learning_rate": 0.0005954927145169995, "loss": 5.2543, "step": 800 }, { "epoch": 0.09164420485175202, "grad_norm": 1.0827720165252686, "learning_rate": 0.0005951689152725309, "loss": 5.2325, "step": 850 }, { "epoch": 0.09703504043126684, "grad_norm": 1.071048378944397, "learning_rate": 0.0005948451160280626, "loss": 5.1791, "step": 900 }, { "epoch": 0.10242587601078167, "grad_norm": 0.8528303503990173, "learning_rate": 0.0005945213167835941, "loss": 5.1133, "step": 950 }, { "epoch": 0.1078167115902965, "grad_norm": 1.1848195791244507, "learning_rate": 0.0005941975175391257, "loss": 5.1184, "step": 1000 }, { "epoch": 0.1078167115902965, "eval_accuracy": 0.22659494561977292, "eval_loss": 5.030709743499756, "eval_runtime": 186.5313, "eval_samples_per_second": 96.558, "eval_steps_per_second": 6.037, "step": 1000 }, { "epoch": 0.11320754716981132, "grad_norm": 1.076619029045105, "learning_rate": 0.0005938737182946572, "loss": 5.052, "step": 1050 }, { "epoch": 0.11859838274932614, "grad_norm": 1.5022995471954346, "learning_rate": 0.0005935499190501888, "loss": 5.0099, "step": 1100 }, { "epoch": 0.12398921832884097, "grad_norm": 0.9214362502098083, "learning_rate": 0.0005932261198057204, "loss": 5.017, "step": 1150 }, { "epoch": 0.1293800539083558, "grad_norm": 1.1205987930297852, "learning_rate": 0.000592902320561252, "loss": 4.9733, "step": 1200 }, { "epoch": 0.1347708894878706, "grad_norm": 1.3065948486328125, "learning_rate": 0.0005925785213167835, "loss": 4.9494, "step": 1250 }, { "epoch": 0.14016172506738545, "grad_norm": 1.0144490003585815, "learning_rate": 0.0005922547220723151, "loss": 4.9026, "step": 1300 }, { "epoch": 0.14555256064690028, "grad_norm": 0.8630505204200745, "learning_rate": 0.0005919309228278468, "loss": 4.8527, "step": 1350 }, { "epoch": 0.1509433962264151, "grad_norm": 0.9217053651809692, "learning_rate": 0.0005916071235833783, "loss": 4.8597, "step": 1400 }, { "epoch": 0.15633423180592992, "grad_norm": 1.303423523902893, "learning_rate": 0.0005912833243389097, "loss": 4.816, "step": 1450 }, { "epoch": 0.16172506738544473, "grad_norm": 0.9101192951202393, "learning_rate": 0.0005909595250944414, "loss": 4.8184, "step": 1500 }, { "epoch": 0.16711590296495957, "grad_norm": 1.0290004014968872, "learning_rate": 0.000590635725849973, "loss": 4.7953, "step": 1550 }, { "epoch": 0.1725067385444744, "grad_norm": 0.9769102334976196, "learning_rate": 0.0005903119266055045, "loss": 4.7756, "step": 1600 }, { "epoch": 0.1778975741239892, "grad_norm": 1.380980134010315, "learning_rate": 0.0005899881273610361, "loss": 4.7469, "step": 1650 }, { "epoch": 0.18328840970350405, "grad_norm": 1.0679956674575806, "learning_rate": 0.0005896643281165677, "loss": 4.728, "step": 1700 }, { "epoch": 0.18867924528301888, "grad_norm": 0.9642156362533569, "learning_rate": 0.0005893405288720993, "loss": 4.6778, "step": 1750 }, { "epoch": 0.1940700808625337, "grad_norm": 0.9266220927238464, "learning_rate": 0.0005890167296276308, "loss": 4.7051, "step": 1800 }, { "epoch": 0.19946091644204852, "grad_norm": 1.5473623275756836, "learning_rate": 0.0005886929303831624, "loss": 4.6514, "step": 1850 }, { "epoch": 0.20485175202156333, "grad_norm": 0.8920683860778809, "learning_rate": 0.0005883691311386939, "loss": 4.6281, "step": 1900 }, { "epoch": 0.21024258760107817, "grad_norm": 0.6964493989944458, "learning_rate": 0.0005880453318942256, "loss": 4.6063, "step": 1950 }, { "epoch": 0.215633423180593, "grad_norm": 0.9296350479125977, "learning_rate": 0.0005877215326497571, "loss": 4.5882, "step": 2000 }, { "epoch": 0.215633423180593, "eval_accuracy": 0.2696204026654292, "eval_loss": 4.511911392211914, "eval_runtime": 186.0484, "eval_samples_per_second": 96.808, "eval_steps_per_second": 6.052, "step": 2000 }, { "epoch": 0.2210242587601078, "grad_norm": 0.8285171389579773, "learning_rate": 0.0005873977334052887, "loss": 4.5739, "step": 2050 }, { "epoch": 0.22641509433962265, "grad_norm": 1.025179386138916, "learning_rate": 0.0005870739341608202, "loss": 4.5558, "step": 2100 }, { "epoch": 0.23180592991913745, "grad_norm": 0.9890318512916565, "learning_rate": 0.0005867501349163519, "loss": 4.53, "step": 2150 }, { "epoch": 0.2371967654986523, "grad_norm": 1.0426075458526611, "learning_rate": 0.0005864263356718833, "loss": 4.5316, "step": 2200 }, { "epoch": 0.24258760107816713, "grad_norm": 0.7025043964385986, "learning_rate": 0.000586102536427415, "loss": 4.5041, "step": 2250 }, { "epoch": 0.24797843665768193, "grad_norm": 0.8847193717956543, "learning_rate": 0.0005857787371829465, "loss": 4.4971, "step": 2300 }, { "epoch": 0.25336927223719674, "grad_norm": 0.9764680862426758, "learning_rate": 0.0005854549379384781, "loss": 4.4769, "step": 2350 }, { "epoch": 0.2587601078167116, "grad_norm": 0.9064006805419922, "learning_rate": 0.0005851311386940096, "loss": 4.4604, "step": 2400 }, { "epoch": 0.2641509433962264, "grad_norm": 0.8132376074790955, "learning_rate": 0.0005848073394495412, "loss": 4.4506, "step": 2450 }, { "epoch": 0.2695417789757412, "grad_norm": 0.7548365592956543, "learning_rate": 0.0005844835402050728, "loss": 4.4258, "step": 2500 }, { "epoch": 0.2749326145552561, "grad_norm": 0.824798047542572, "learning_rate": 0.0005841597409606044, "loss": 4.3996, "step": 2550 }, { "epoch": 0.2803234501347709, "grad_norm": 0.9818605184555054, "learning_rate": 0.000583835941716136, "loss": 4.4099, "step": 2600 }, { "epoch": 0.2857142857142857, "grad_norm": 0.8206386566162109, "learning_rate": 0.0005835121424716675, "loss": 4.3904, "step": 2650 }, { "epoch": 0.29110512129380056, "grad_norm": 0.8314753770828247, "learning_rate": 0.0005831883432271992, "loss": 4.3802, "step": 2700 }, { "epoch": 0.29649595687331537, "grad_norm": 0.8359651565551758, "learning_rate": 0.0005828645439827307, "loss": 4.3767, "step": 2750 }, { "epoch": 0.3018867924528302, "grad_norm": 0.673989474773407, "learning_rate": 0.0005825407447382622, "loss": 4.3286, "step": 2800 }, { "epoch": 0.30727762803234504, "grad_norm": 0.7831907868385315, "learning_rate": 0.0005822169454937938, "loss": 4.3547, "step": 2850 }, { "epoch": 0.31266846361185985, "grad_norm": 0.8069139719009399, "learning_rate": 0.0005818931462493254, "loss": 4.3245, "step": 2900 }, { "epoch": 0.31805929919137466, "grad_norm": 0.8398146033287048, "learning_rate": 0.0005815693470048569, "loss": 4.3271, "step": 2950 }, { "epoch": 0.32345013477088946, "grad_norm": 0.7504966855049133, "learning_rate": 0.0005812455477603885, "loss": 4.3179, "step": 3000 }, { "epoch": 0.32345013477088946, "eval_accuracy": 0.29801085898691393, "eval_loss": 4.238383769989014, "eval_runtime": 185.9371, "eval_samples_per_second": 96.866, "eval_steps_per_second": 6.056, "step": 3000 }, { "epoch": 0.3288409703504043, "grad_norm": 0.7269638180732727, "learning_rate": 0.0005809217485159201, "loss": 4.3182, "step": 3050 }, { "epoch": 0.33423180592991913, "grad_norm": 0.826326847076416, "learning_rate": 0.0005805979492714517, "loss": 4.2988, "step": 3100 }, { "epoch": 0.33962264150943394, "grad_norm": 0.9023220539093018, "learning_rate": 0.0005802741500269832, "loss": 4.2764, "step": 3150 }, { "epoch": 0.3450134770889488, "grad_norm": 0.7048584222793579, "learning_rate": 0.0005799503507825148, "loss": 4.2794, "step": 3200 }, { "epoch": 0.3504043126684636, "grad_norm": 0.8540084362030029, "learning_rate": 0.0005796265515380463, "loss": 4.2674, "step": 3250 }, { "epoch": 0.3557951482479784, "grad_norm": 0.9496080875396729, "learning_rate": 0.000579302752293578, "loss": 4.276, "step": 3300 }, { "epoch": 0.3611859838274933, "grad_norm": 0.8834256529808044, "learning_rate": 0.0005789789530491095, "loss": 4.251, "step": 3350 }, { "epoch": 0.3665768194070081, "grad_norm": 0.8843632340431213, "learning_rate": 0.0005786551538046411, "loss": 4.2396, "step": 3400 }, { "epoch": 0.3719676549865229, "grad_norm": 0.6297584176063538, "learning_rate": 0.0005783313545601726, "loss": 4.2318, "step": 3450 }, { "epoch": 0.37735849056603776, "grad_norm": 0.8427825570106506, "learning_rate": 0.0005780075553157043, "loss": 4.2304, "step": 3500 }, { "epoch": 0.38274932614555257, "grad_norm": 0.6668996810913086, "learning_rate": 0.0005776837560712357, "loss": 4.2258, "step": 3550 }, { "epoch": 0.3881401617250674, "grad_norm": 0.7428986430168152, "learning_rate": 0.0005773599568267673, "loss": 4.2192, "step": 3600 }, { "epoch": 0.3935309973045822, "grad_norm": 0.7153974175453186, "learning_rate": 0.0005770361575822989, "loss": 4.205, "step": 3650 }, { "epoch": 0.39892183288409705, "grad_norm": 0.7248367667198181, "learning_rate": 0.0005767123583378305, "loss": 4.1946, "step": 3700 }, { "epoch": 0.40431266846361186, "grad_norm": 0.6670223474502563, "learning_rate": 0.000576388559093362, "loss": 4.1958, "step": 3750 }, { "epoch": 0.40970350404312667, "grad_norm": 0.6554595232009888, "learning_rate": 0.0005760647598488936, "loss": 4.1611, "step": 3800 }, { "epoch": 0.41509433962264153, "grad_norm": 0.6678674221038818, "learning_rate": 0.0005757409606044253, "loss": 4.1724, "step": 3850 }, { "epoch": 0.42048517520215634, "grad_norm": 0.7696819305419922, "learning_rate": 0.0005754171613599568, "loss": 4.1913, "step": 3900 }, { "epoch": 0.42587601078167114, "grad_norm": 1.3464781045913696, "learning_rate": 0.0005750933621154884, "loss": 4.1607, "step": 3950 }, { "epoch": 0.431266846361186, "grad_norm": 0.7259769439697266, "learning_rate": 0.0005747695628710199, "loss": 4.1615, "step": 4000 }, { "epoch": 0.431266846361186, "eval_accuracy": 0.3115824738980451, "eval_loss": 4.0961432456970215, "eval_runtime": 185.8978, "eval_samples_per_second": 96.887, "eval_steps_per_second": 6.057, "step": 4000 }, { "epoch": 0.4366576819407008, "grad_norm": 0.7618716359138489, "learning_rate": 0.0005744457636265515, "loss": 4.1695, "step": 4050 }, { "epoch": 0.4420485175202156, "grad_norm": 0.6841301321983337, "learning_rate": 0.0005741219643820831, "loss": 4.1634, "step": 4100 }, { "epoch": 0.4474393530997305, "grad_norm": 0.591198205947876, "learning_rate": 0.0005737981651376146, "loss": 4.1427, "step": 4150 }, { "epoch": 0.4528301886792453, "grad_norm": 0.6859827637672424, "learning_rate": 0.0005734743658931462, "loss": 4.1505, "step": 4200 }, { "epoch": 0.4582210242587601, "grad_norm": 0.6032926440238953, "learning_rate": 0.0005731505666486778, "loss": 4.138, "step": 4250 }, { "epoch": 0.4636118598382749, "grad_norm": 0.6650081872940063, "learning_rate": 0.0005728267674042093, "loss": 4.1412, "step": 4300 }, { "epoch": 0.46900269541778977, "grad_norm": 0.8347264528274536, "learning_rate": 0.0005725029681597409, "loss": 4.1275, "step": 4350 }, { "epoch": 0.4743935309973046, "grad_norm": 0.6658074855804443, "learning_rate": 0.0005721791689152725, "loss": 4.1125, "step": 4400 }, { "epoch": 0.4797843665768194, "grad_norm": 0.6057379245758057, "learning_rate": 0.0005718553696708041, "loss": 4.1205, "step": 4450 }, { "epoch": 0.48517520215633425, "grad_norm": 0.6311624050140381, "learning_rate": 0.0005715315704263356, "loss": 4.1149, "step": 4500 }, { "epoch": 0.49056603773584906, "grad_norm": 0.7309545278549194, "learning_rate": 0.0005712077711818672, "loss": 4.125, "step": 4550 }, { "epoch": 0.49595687331536387, "grad_norm": 0.8806862235069275, "learning_rate": 0.0005708839719373987, "loss": 4.1193, "step": 4600 }, { "epoch": 0.5013477088948787, "grad_norm": 0.7140979170799255, "learning_rate": 0.0005705601726929304, "loss": 4.075, "step": 4650 }, { "epoch": 0.5067385444743935, "grad_norm": 0.738926112651825, "learning_rate": 0.0005702363734484619, "loss": 4.0752, "step": 4700 }, { "epoch": 0.5121293800539084, "grad_norm": 0.5916194319725037, "learning_rate": 0.0005699125742039935, "loss": 4.083, "step": 4750 }, { "epoch": 0.5175202156334232, "grad_norm": 0.7595686912536621, "learning_rate": 0.000569588774959525, "loss": 4.0794, "step": 4800 }, { "epoch": 0.522911051212938, "grad_norm": 0.6311149597167969, "learning_rate": 0.0005692649757150567, "loss": 4.0744, "step": 4850 }, { "epoch": 0.5283018867924528, "grad_norm": 0.7534050941467285, "learning_rate": 0.0005689411764705881, "loss": 4.0754, "step": 4900 }, { "epoch": 0.5336927223719676, "grad_norm": 0.7457841038703918, "learning_rate": 0.0005686173772261197, "loss": 4.0669, "step": 4950 }, { "epoch": 0.5390835579514824, "grad_norm": 0.7841017842292786, "learning_rate": 0.0005682935779816514, "loss": 4.0664, "step": 5000 }, { "epoch": 0.5390835579514824, "eval_accuracy": 0.32084295952647335, "eval_loss": 3.998095750808716, "eval_runtime": 185.8924, "eval_samples_per_second": 96.889, "eval_steps_per_second": 6.057, "step": 5000 }, { "epoch": 0.5444743935309974, "grad_norm": 0.6891273856163025, "learning_rate": 0.0005679697787371829, "loss": 4.0733, "step": 5050 }, { "epoch": 0.5498652291105122, "grad_norm": 0.5636075735092163, "learning_rate": 0.0005676459794927145, "loss": 4.0588, "step": 5100 }, { "epoch": 0.555256064690027, "grad_norm": 0.7175034880638123, "learning_rate": 0.000567322180248246, "loss": 4.0517, "step": 5150 }, { "epoch": 0.5606469002695418, "grad_norm": 0.7910956144332886, "learning_rate": 0.0005669983810037777, "loss": 4.0616, "step": 5200 }, { "epoch": 0.5660377358490566, "grad_norm": 0.6039184331893921, "learning_rate": 0.0005666745817593092, "loss": 4.0371, "step": 5250 }, { "epoch": 0.5714285714285714, "grad_norm": 0.5606033205986023, "learning_rate": 0.0005663507825148408, "loss": 4.039, "step": 5300 }, { "epoch": 0.5768194070080862, "grad_norm": 0.7192058563232422, "learning_rate": 0.0005660269832703723, "loss": 4.0264, "step": 5350 }, { "epoch": 0.5822102425876011, "grad_norm": 0.596314549446106, "learning_rate": 0.0005657031840259039, "loss": 4.0295, "step": 5400 }, { "epoch": 0.5876010781671159, "grad_norm": 0.7095101475715637, "learning_rate": 0.0005653793847814355, "loss": 4.0314, "step": 5450 }, { "epoch": 0.5929919137466307, "grad_norm": 0.688493013381958, "learning_rate": 0.000565055585536967, "loss": 4.0088, "step": 5500 }, { "epoch": 0.5983827493261455, "grad_norm": 0.6665045619010925, "learning_rate": 0.0005647317862924986, "loss": 4.0332, "step": 5550 }, { "epoch": 0.6037735849056604, "grad_norm": 0.6965456008911133, "learning_rate": 0.0005644079870480302, "loss": 3.9809, "step": 5600 }, { "epoch": 0.6091644204851752, "grad_norm": 0.625882625579834, "learning_rate": 0.0005640841878035617, "loss": 4.0153, "step": 5650 }, { "epoch": 0.6145552560646901, "grad_norm": 0.6585850715637207, "learning_rate": 0.0005637603885590933, "loss": 4.0181, "step": 5700 }, { "epoch": 0.6199460916442049, "grad_norm": 0.6237135529518127, "learning_rate": 0.0005634365893146248, "loss": 4.0169, "step": 5750 }, { "epoch": 0.6253369272237197, "grad_norm": 0.6779605150222778, "learning_rate": 0.0005631127900701565, "loss": 4.0086, "step": 5800 }, { "epoch": 0.6307277628032345, "grad_norm": 0.6086890697479248, "learning_rate": 0.000562788990825688, "loss": 3.9814, "step": 5850 }, { "epoch": 0.6361185983827493, "grad_norm": 0.6210436820983887, "learning_rate": 0.0005624651915812196, "loss": 3.9972, "step": 5900 }, { "epoch": 0.6415094339622641, "grad_norm": 0.7014210820198059, "learning_rate": 0.0005621413923367511, "loss": 3.9997, "step": 5950 }, { "epoch": 0.6469002695417789, "grad_norm": 0.6019284725189209, "learning_rate": 0.0005618175930922828, "loss": 4.0053, "step": 6000 }, { "epoch": 0.6469002695417789, "eval_accuracy": 0.32752848036658616, "eval_loss": 3.9227378368377686, "eval_runtime": 185.8855, "eval_samples_per_second": 96.893, "eval_steps_per_second": 6.057, "step": 6000 }, { "epoch": 0.6522911051212938, "grad_norm": 0.6057129502296448, "learning_rate": 0.0005614937938478143, "loss": 3.9961, "step": 6050 }, { "epoch": 0.6576819407008087, "grad_norm": 0.6797792911529541, "learning_rate": 0.0005611699946033459, "loss": 3.9911, "step": 6100 }, { "epoch": 0.6630727762803235, "grad_norm": 0.5967230200767517, "learning_rate": 0.0005608461953588774, "loss": 3.9835, "step": 6150 }, { "epoch": 0.6684636118598383, "grad_norm": 0.6430239677429199, "learning_rate": 0.000560522396114409, "loss": 3.9776, "step": 6200 }, { "epoch": 0.6738544474393531, "grad_norm": 0.6402201056480408, "learning_rate": 0.0005601985968699405, "loss": 3.9578, "step": 6250 }, { "epoch": 0.6792452830188679, "grad_norm": 0.6837700009346008, "learning_rate": 0.0005598747976254721, "loss": 3.9743, "step": 6300 }, { "epoch": 0.6846361185983828, "grad_norm": 0.5868032574653625, "learning_rate": 0.0005595509983810038, "loss": 3.9487, "step": 6350 }, { "epoch": 0.6900269541778976, "grad_norm": 0.6631322503089905, "learning_rate": 0.0005592271991365353, "loss": 3.9597, "step": 6400 }, { "epoch": 0.6954177897574124, "grad_norm": 0.6614171862602234, "learning_rate": 0.0005589033998920669, "loss": 3.976, "step": 6450 }, { "epoch": 0.7008086253369272, "grad_norm": 0.6480840444564819, "learning_rate": 0.0005585796006475984, "loss": 3.9484, "step": 6500 }, { "epoch": 0.706199460916442, "grad_norm": 0.6667515635490417, "learning_rate": 0.0005582558014031301, "loss": 3.9724, "step": 6550 }, { "epoch": 0.7115902964959568, "grad_norm": 0.5956810116767883, "learning_rate": 0.0005579320021586616, "loss": 3.9531, "step": 6600 }, { "epoch": 0.7169811320754716, "grad_norm": 0.7182953357696533, "learning_rate": 0.0005576082029141932, "loss": 3.9483, "step": 6650 }, { "epoch": 0.7223719676549866, "grad_norm": 0.540218710899353, "learning_rate": 0.0005572844036697247, "loss": 3.9354, "step": 6700 }, { "epoch": 0.7277628032345014, "grad_norm": 0.5549564957618713, "learning_rate": 0.0005569606044252563, "loss": 3.9416, "step": 6750 }, { "epoch": 0.7331536388140162, "grad_norm": 0.955643355846405, "learning_rate": 0.0005566368051807879, "loss": 3.9594, "step": 6800 }, { "epoch": 0.738544474393531, "grad_norm": 0.7693118453025818, "learning_rate": 0.0005563130059363194, "loss": 3.945, "step": 6850 }, { "epoch": 0.7439353099730458, "grad_norm": 0.587993860244751, "learning_rate": 0.000555989206691851, "loss": 3.9435, "step": 6900 }, { "epoch": 0.7493261455525606, "grad_norm": 0.5942090749740601, "learning_rate": 0.0005556654074473826, "loss": 3.9466, "step": 6950 }, { "epoch": 0.7547169811320755, "grad_norm": 0.6959335207939148, "learning_rate": 0.0005553416082029141, "loss": 3.9311, "step": 7000 }, { "epoch": 0.7547169811320755, "eval_accuracy": 0.3327442535932325, "eval_loss": 3.868434190750122, "eval_runtime": 185.8133, "eval_samples_per_second": 96.931, "eval_steps_per_second": 6.06, "step": 7000 }, { "epoch": 0.7601078167115903, "grad_norm": 0.6941900253295898, "learning_rate": 0.0005550178089584457, "loss": 3.9224, "step": 7050 }, { "epoch": 0.7654986522911051, "grad_norm": 0.5540989637374878, "learning_rate": 0.0005546940097139772, "loss": 3.9235, "step": 7100 }, { "epoch": 0.77088948787062, "grad_norm": 0.6097570061683655, "learning_rate": 0.0005543702104695089, "loss": 3.9264, "step": 7150 }, { "epoch": 0.7762803234501348, "grad_norm": 0.5658494830131531, "learning_rate": 0.0005540464112250404, "loss": 3.9229, "step": 7200 }, { "epoch": 0.7816711590296496, "grad_norm": 0.6700815558433533, "learning_rate": 0.000553722611980572, "loss": 3.9357, "step": 7250 }, { "epoch": 0.7870619946091644, "grad_norm": 0.5885155200958252, "learning_rate": 0.0005533988127361035, "loss": 3.9183, "step": 7300 }, { "epoch": 0.7924528301886793, "grad_norm": 0.5735599398612976, "learning_rate": 0.0005530750134916352, "loss": 3.9369, "step": 7350 }, { "epoch": 0.7978436657681941, "grad_norm": 0.6089330911636353, "learning_rate": 0.0005527512142471668, "loss": 3.9099, "step": 7400 }, { "epoch": 0.8032345013477089, "grad_norm": 0.6232162714004517, "learning_rate": 0.0005524274150026982, "loss": 3.9112, "step": 7450 }, { "epoch": 0.8086253369272237, "grad_norm": 0.606532096862793, "learning_rate": 0.0005521036157582299, "loss": 3.9004, "step": 7500 }, { "epoch": 0.8140161725067385, "grad_norm": 0.7327796816825867, "learning_rate": 0.0005517798165137614, "loss": 3.9057, "step": 7550 }, { "epoch": 0.8194070080862533, "grad_norm": 0.5931469202041626, "learning_rate": 0.000551456017269293, "loss": 3.881, "step": 7600 }, { "epoch": 0.8247978436657682, "grad_norm": 0.6132405400276184, "learning_rate": 0.0005511322180248245, "loss": 3.8988, "step": 7650 }, { "epoch": 0.8301886792452831, "grad_norm": 0.5921282172203064, "learning_rate": 0.0005508084187803562, "loss": 3.9097, "step": 7700 }, { "epoch": 0.8355795148247979, "grad_norm": 0.6329267024993896, "learning_rate": 0.0005504846195358877, "loss": 3.9026, "step": 7750 }, { "epoch": 0.8409703504043127, "grad_norm": 0.6082526445388794, "learning_rate": 0.0005501608202914193, "loss": 3.8919, "step": 7800 }, { "epoch": 0.8463611859838275, "grad_norm": 0.5989628434181213, "learning_rate": 0.0005498370210469508, "loss": 3.895, "step": 7850 }, { "epoch": 0.8517520215633423, "grad_norm": 0.592002809047699, "learning_rate": 0.0005495132218024824, "loss": 3.88, "step": 7900 }, { "epoch": 0.8571428571428571, "grad_norm": 0.5714187026023865, "learning_rate": 0.000549189422558014, "loss": 3.8903, "step": 7950 }, { "epoch": 0.862533692722372, "grad_norm": 0.6176041960716248, "learning_rate": 0.0005488656233135456, "loss": 3.8888, "step": 8000 }, { "epoch": 0.862533692722372, "eval_accuracy": 0.3374015509765124, "eval_loss": 3.820584535598755, "eval_runtime": 185.9631, "eval_samples_per_second": 96.853, "eval_steps_per_second": 6.055, "step": 8000 }, { "epoch": 0.8679245283018868, "grad_norm": 0.6291443109512329, "learning_rate": 0.0005485418240690771, "loss": 3.8699, "step": 8050 }, { "epoch": 0.8733153638814016, "grad_norm": 0.6424714922904968, "learning_rate": 0.0005482180248246087, "loss": 3.8858, "step": 8100 }, { "epoch": 0.8787061994609164, "grad_norm": 0.6014903783798218, "learning_rate": 0.0005478942255801403, "loss": 3.8827, "step": 8150 }, { "epoch": 0.8840970350404312, "grad_norm": 0.5504648089408875, "learning_rate": 0.0005475704263356718, "loss": 3.8694, "step": 8200 }, { "epoch": 0.889487870619946, "grad_norm": 0.5945785045623779, "learning_rate": 0.0005472466270912034, "loss": 3.8799, "step": 8250 }, { "epoch": 0.894878706199461, "grad_norm": 0.5891640186309814, "learning_rate": 0.000546922827846735, "loss": 3.8689, "step": 8300 }, { "epoch": 0.9002695417789758, "grad_norm": 0.5595161318778992, "learning_rate": 0.0005465990286022665, "loss": 3.8689, "step": 8350 }, { "epoch": 0.9056603773584906, "grad_norm": 0.5921164155006409, "learning_rate": 0.0005462752293577981, "loss": 3.8853, "step": 8400 }, { "epoch": 0.9110512129380054, "grad_norm": 0.5961281657218933, "learning_rate": 0.0005459514301133296, "loss": 3.8789, "step": 8450 }, { "epoch": 0.9164420485175202, "grad_norm": 0.5500056147575378, "learning_rate": 0.0005456276308688613, "loss": 3.875, "step": 8500 }, { "epoch": 0.921832884097035, "grad_norm": 0.5573350787162781, "learning_rate": 0.0005453038316243929, "loss": 3.868, "step": 8550 }, { "epoch": 0.9272237196765498, "grad_norm": 0.5513932108879089, "learning_rate": 0.0005449800323799244, "loss": 3.8786, "step": 8600 }, { "epoch": 0.9326145552560647, "grad_norm": 0.5722886323928833, "learning_rate": 0.000544656233135456, "loss": 3.8585, "step": 8650 }, { "epoch": 0.9380053908355795, "grad_norm": 0.6074110269546509, "learning_rate": 0.0005443324338909875, "loss": 3.8613, "step": 8700 }, { "epoch": 0.9433962264150944, "grad_norm": 0.5840967893600464, "learning_rate": 0.0005440086346465192, "loss": 3.8728, "step": 8750 }, { "epoch": 0.9487870619946092, "grad_norm": 0.580897867679596, "learning_rate": 0.0005436848354020506, "loss": 3.8535, "step": 8800 }, { "epoch": 0.954177897574124, "grad_norm": 0.5885988473892212, "learning_rate": 0.0005433610361575823, "loss": 3.8595, "step": 8850 }, { "epoch": 0.9595687331536388, "grad_norm": 0.568071186542511, "learning_rate": 0.0005430372369131138, "loss": 3.8457, "step": 8900 }, { "epoch": 0.9649595687331537, "grad_norm": 0.612762987613678, "learning_rate": 0.0005427134376686454, "loss": 3.857, "step": 8950 }, { "epoch": 0.9703504043126685, "grad_norm": 0.6389222145080566, "learning_rate": 0.0005423896384241769, "loss": 3.8417, "step": 9000 }, { "epoch": 0.9703504043126685, "eval_accuracy": 0.3407095967989121, "eval_loss": 3.7826406955718994, "eval_runtime": 185.8291, "eval_samples_per_second": 96.922, "eval_steps_per_second": 6.059, "step": 9000 }, { "epoch": 0.9757412398921833, "grad_norm": 0.6433724761009216, "learning_rate": 0.0005420658391797086, "loss": 3.8386, "step": 9050 }, { "epoch": 0.9811320754716981, "grad_norm": 0.616686999797821, "learning_rate": 0.0005417420399352401, "loss": 3.8486, "step": 9100 }, { "epoch": 0.9865229110512129, "grad_norm": 0.6407685875892639, "learning_rate": 0.0005414182406907717, "loss": 3.8421, "step": 9150 }, { "epoch": 0.9919137466307277, "grad_norm": 0.731094479560852, "learning_rate": 0.0005410944414463032, "loss": 3.8593, "step": 9200 }, { "epoch": 0.9973045822102425, "grad_norm": 0.617189884185791, "learning_rate": 0.0005407706422018348, "loss": 3.8551, "step": 9250 }, { "epoch": 1.0026954177897573, "grad_norm": 0.5850970149040222, "learning_rate": 0.0005404468429573664, "loss": 3.8018, "step": 9300 }, { "epoch": 1.0080862533692723, "grad_norm": 0.6619550585746765, "learning_rate": 0.000540123043712898, "loss": 3.7742, "step": 9350 }, { "epoch": 1.013477088948787, "grad_norm": 0.5740201473236084, "learning_rate": 0.0005397992444684295, "loss": 3.7547, "step": 9400 }, { "epoch": 1.0188679245283019, "grad_norm": 0.6828320622444153, "learning_rate": 0.0005394754452239611, "loss": 3.7691, "step": 9450 }, { "epoch": 1.0242587601078168, "grad_norm": 0.5637569427490234, "learning_rate": 0.0005391516459794927, "loss": 3.7799, "step": 9500 }, { "epoch": 1.0296495956873315, "grad_norm": 0.5780271887779236, "learning_rate": 0.0005388278467350242, "loss": 3.7877, "step": 9550 }, { "epoch": 1.0350404312668464, "grad_norm": 0.5565044283866882, "learning_rate": 0.0005385040474905557, "loss": 3.7821, "step": 9600 }, { "epoch": 1.0404312668463611, "grad_norm": 0.6038862466812134, "learning_rate": 0.0005381802482460874, "loss": 3.7916, "step": 9650 }, { "epoch": 1.045822102425876, "grad_norm": 0.5745878219604492, "learning_rate": 0.000537856449001619, "loss": 3.7901, "step": 9700 }, { "epoch": 1.0512129380053907, "grad_norm": 0.5736984014511108, "learning_rate": 0.0005375326497571505, "loss": 3.763, "step": 9750 }, { "epoch": 1.0566037735849056, "grad_norm": 0.6319218277931213, "learning_rate": 0.000537208850512682, "loss": 3.7697, "step": 9800 }, { "epoch": 1.0619946091644206, "grad_norm": 0.5360982418060303, "learning_rate": 0.0005368850512682137, "loss": 3.7678, "step": 9850 }, { "epoch": 1.0673854447439353, "grad_norm": 0.5352616906166077, "learning_rate": 0.0005365612520237453, "loss": 3.7801, "step": 9900 }, { "epoch": 1.0727762803234502, "grad_norm": 0.6189696788787842, "learning_rate": 0.0005362374527792768, "loss": 3.7794, "step": 9950 }, { "epoch": 1.0781671159029649, "grad_norm": 0.6562055945396423, "learning_rate": 0.0005359136535348084, "loss": 3.7812, "step": 10000 }, { "epoch": 1.0781671159029649, "eval_accuracy": 0.34422147543885173, "eval_loss": 3.759232521057129, "eval_runtime": 185.6272, "eval_samples_per_second": 97.028, "eval_steps_per_second": 6.066, "step": 10000 } ], "logging_steps": 50, "max_steps": 92750, "num_input_tokens_seen": 0, "num_train_epochs": 10, "save_steps": 10000, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 8.36069179392e+16, "train_batch_size": 32, "trial_name": null, "trial_params": null }