{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.06903693476009665, "eval_steps": 500, "global_step": 200, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.00034518467380048324, "grad_norm": 164.25050354003906, "learning_rate": 0.0, "loss": 1.9257, "step": 1 }, { "epoch": 0.0006903693476009665, "grad_norm": 116.43001556396484, "learning_rate": 2e-05, "loss": 1.8201, "step": 2 }, { "epoch": 0.0010355540214014498, "grad_norm": 111.98278045654297, "learning_rate": 2e-05, "loss": 1.9652, "step": 3 }, { "epoch": 0.001380738695201933, "grad_norm": 312.7107238769531, "learning_rate": 2e-05, "loss": 1.6971, "step": 4 }, { "epoch": 0.0017259233690024164, "grad_norm": 124.51359558105469, "learning_rate": 2e-05, "loss": 1.7228, "step": 5 }, { "epoch": 0.0020711080428028996, "grad_norm": 117.87893676757812, "learning_rate": 2e-05, "loss": 1.7254, "step": 6 }, { "epoch": 0.002416292716603383, "grad_norm": 59.12928771972656, "learning_rate": 2e-05, "loss": 1.473, "step": 7 }, { "epoch": 0.002761477390403866, "grad_norm": 24.38951873779297, "learning_rate": 2e-05, "loss": 1.5216, "step": 8 }, { "epoch": 0.0031066620642043494, "grad_norm": 57.787757873535156, "learning_rate": 2e-05, "loss": 1.5563, "step": 9 }, { "epoch": 0.0034518467380048328, "grad_norm": 21.435535430908203, "learning_rate": 2e-05, "loss": 1.4052, "step": 10 }, { "epoch": 0.0037970314118053157, "grad_norm": 25.76114273071289, "learning_rate": 2e-05, "loss": 1.4289, "step": 11 }, { "epoch": 0.004142216085605799, "grad_norm": 16.697547912597656, "learning_rate": 2e-05, "loss": 1.5014, "step": 12 }, { "epoch": 0.0044874007594062825, "grad_norm": 10.946109771728516, "learning_rate": 2e-05, "loss": 1.4236, "step": 13 }, { "epoch": 0.004832585433206766, "grad_norm": 9.638275146484375, "learning_rate": 2e-05, "loss": 1.4098, "step": 14 }, { "epoch": 0.0051777701070072485, "grad_norm": 17.02400016784668, "learning_rate": 2e-05, "loss": 1.4035, "step": 15 }, { "epoch": 0.005522954780807732, "grad_norm": 7.689630508422852, "learning_rate": 2e-05, "loss": 1.3273, "step": 16 }, { "epoch": 0.005868139454608215, "grad_norm": 7.028171539306641, "learning_rate": 2e-05, "loss": 1.3675, "step": 17 }, { "epoch": 0.006213324128408699, "grad_norm": 8.425003051757812, "learning_rate": 2e-05, "loss": 1.3065, "step": 18 }, { "epoch": 0.006558508802209182, "grad_norm": 7.860549449920654, "learning_rate": 2e-05, "loss": 1.2914, "step": 19 }, { "epoch": 0.0069036934760096655, "grad_norm": 5.793131351470947, "learning_rate": 2e-05, "loss": 1.2639, "step": 20 }, { "epoch": 0.007248878149810148, "grad_norm": 6.066828727722168, "learning_rate": 2e-05, "loss": 1.2845, "step": 21 }, { "epoch": 0.0075940628236106315, "grad_norm": 6.9683074951171875, "learning_rate": 2e-05, "loss": 1.2839, "step": 22 }, { "epoch": 0.007939247497411116, "grad_norm": 7.026453018188477, "learning_rate": 2e-05, "loss": 1.3129, "step": 23 }, { "epoch": 0.008284432171211598, "grad_norm": 6.011166095733643, "learning_rate": 2e-05, "loss": 1.2021, "step": 24 }, { "epoch": 0.00862961684501208, "grad_norm": 6.688496112823486, "learning_rate": 2e-05, "loss": 1.2988, "step": 25 }, { "epoch": 0.008974801518812565, "grad_norm": 5.536924839019775, "learning_rate": 2e-05, "loss": 1.2529, "step": 26 }, { "epoch": 0.009319986192613048, "grad_norm": 6.189913749694824, "learning_rate": 2e-05, "loss": 1.2541, "step": 27 }, { "epoch": 0.009665170866413532, "grad_norm": 5.186566352844238, "learning_rate": 2e-05, "loss": 1.1685, "step": 28 }, { "epoch": 0.010010355540214014, "grad_norm": 5.111907482147217, "learning_rate": 2e-05, "loss": 1.1647, "step": 29 }, { "epoch": 0.010355540214014497, "grad_norm": 7.816215515136719, "learning_rate": 2e-05, "loss": 1.1613, "step": 30 }, { "epoch": 0.010700724887814981, "grad_norm": 6.994287014007568, "learning_rate": 2e-05, "loss": 1.1798, "step": 31 }, { "epoch": 0.011045909561615464, "grad_norm": 6.679455280303955, "learning_rate": 2e-05, "loss": 1.1356, "step": 32 }, { "epoch": 0.011391094235415948, "grad_norm": 5.451405048370361, "learning_rate": 2e-05, "loss": 1.1679, "step": 33 }, { "epoch": 0.01173627890921643, "grad_norm": 5.443926811218262, "learning_rate": 2e-05, "loss": 1.1729, "step": 34 }, { "epoch": 0.012081463583016915, "grad_norm": 5.605351448059082, "learning_rate": 2e-05, "loss": 1.1808, "step": 35 }, { "epoch": 0.012426648256817397, "grad_norm": 5.121994972229004, "learning_rate": 2e-05, "loss": 1.1379, "step": 36 }, { "epoch": 0.01277183293061788, "grad_norm": 4.825695037841797, "learning_rate": 2e-05, "loss": 1.1291, "step": 37 }, { "epoch": 0.013117017604418364, "grad_norm": 4.905743598937988, "learning_rate": 2e-05, "loss": 1.1687, "step": 38 }, { "epoch": 0.013462202278218847, "grad_norm": 5.373997688293457, "learning_rate": 2e-05, "loss": 1.2164, "step": 39 }, { "epoch": 0.013807386952019331, "grad_norm": 4.702381134033203, "learning_rate": 2e-05, "loss": 1.1769, "step": 40 }, { "epoch": 0.014152571625819814, "grad_norm": 5.017072677612305, "learning_rate": 2e-05, "loss": 1.1081, "step": 41 }, { "epoch": 0.014497756299620296, "grad_norm": 4.598694801330566, "learning_rate": 2e-05, "loss": 1.0872, "step": 42 }, { "epoch": 0.01484294097342078, "grad_norm": 4.88613224029541, "learning_rate": 2e-05, "loss": 1.166, "step": 43 }, { "epoch": 0.015188125647221263, "grad_norm": 4.172844886779785, "learning_rate": 2e-05, "loss": 1.1078, "step": 44 }, { "epoch": 0.015533310321021747, "grad_norm": 4.9598612785339355, "learning_rate": 2e-05, "loss": 1.1068, "step": 45 }, { "epoch": 0.01587849499482223, "grad_norm": 4.003320693969727, "learning_rate": 2e-05, "loss": 1.0951, "step": 46 }, { "epoch": 0.016223679668622714, "grad_norm": 4.30601692199707, "learning_rate": 2e-05, "loss": 1.1088, "step": 47 }, { "epoch": 0.016568864342423197, "grad_norm": 4.957517623901367, "learning_rate": 2e-05, "loss": 1.1152, "step": 48 }, { "epoch": 0.01691404901622368, "grad_norm": 5.051650047302246, "learning_rate": 2e-05, "loss": 1.0514, "step": 49 }, { "epoch": 0.01725923369002416, "grad_norm": 4.508876800537109, "learning_rate": 2e-05, "loss": 1.1081, "step": 50 }, { "epoch": 0.017604418363824648, "grad_norm": 4.666370391845703, "learning_rate": 2e-05, "loss": 1.0889, "step": 51 }, { "epoch": 0.01794960303762513, "grad_norm": 4.62983512878418, "learning_rate": 2e-05, "loss": 1.0561, "step": 52 }, { "epoch": 0.018294787711425613, "grad_norm": 3.8194386959075928, "learning_rate": 2e-05, "loss": 1.0314, "step": 53 }, { "epoch": 0.018639972385226095, "grad_norm": 4.9420695304870605, "learning_rate": 2e-05, "loss": 1.1218, "step": 54 }, { "epoch": 0.018985157059026578, "grad_norm": 4.9239068031311035, "learning_rate": 2e-05, "loss": 1.0647, "step": 55 }, { "epoch": 0.019330341732827064, "grad_norm": 4.308078289031982, "learning_rate": 2e-05, "loss": 1.0469, "step": 56 }, { "epoch": 0.019675526406627546, "grad_norm": 4.183582782745361, "learning_rate": 2e-05, "loss": 1.101, "step": 57 }, { "epoch": 0.02002071108042803, "grad_norm": 5.259477138519287, "learning_rate": 2e-05, "loss": 1.1166, "step": 58 }, { "epoch": 0.02036589575422851, "grad_norm": 4.483434677124023, "learning_rate": 2e-05, "loss": 1.0173, "step": 59 }, { "epoch": 0.020711080428028994, "grad_norm": 4.112723350524902, "learning_rate": 2e-05, "loss": 1.062, "step": 60 }, { "epoch": 0.02105626510182948, "grad_norm": 4.924528121948242, "learning_rate": 2e-05, "loss": 1.0574, "step": 61 }, { "epoch": 0.021401449775629963, "grad_norm": 3.717799663543701, "learning_rate": 2e-05, "loss": 1.0268, "step": 62 }, { "epoch": 0.021746634449430445, "grad_norm": 4.5001044273376465, "learning_rate": 2e-05, "loss": 1.057, "step": 63 }, { "epoch": 0.022091819123230928, "grad_norm": 4.214874267578125, "learning_rate": 2e-05, "loss": 1.1244, "step": 64 }, { "epoch": 0.02243700379703141, "grad_norm": 4.098433494567871, "learning_rate": 2e-05, "loss": 1.0685, "step": 65 }, { "epoch": 0.022782188470831896, "grad_norm": 3.9524285793304443, "learning_rate": 2e-05, "loss": 1.0642, "step": 66 }, { "epoch": 0.02312737314463238, "grad_norm": 4.906257152557373, "learning_rate": 2e-05, "loss": 1.0543, "step": 67 }, { "epoch": 0.02347255781843286, "grad_norm": 5.597499847412109, "learning_rate": 2e-05, "loss": 1.0525, "step": 68 }, { "epoch": 0.023817742492233344, "grad_norm": 3.9120569229125977, "learning_rate": 2e-05, "loss": 1.0316, "step": 69 }, { "epoch": 0.02416292716603383, "grad_norm": 3.9987313747406006, "learning_rate": 2e-05, "loss": 1.0415, "step": 70 }, { "epoch": 0.024508111839834312, "grad_norm": 3.854943037033081, "learning_rate": 2e-05, "loss": 1.0162, "step": 71 }, { "epoch": 0.024853296513634795, "grad_norm": 4.38804292678833, "learning_rate": 2e-05, "loss": 0.9893, "step": 72 }, { "epoch": 0.025198481187435277, "grad_norm": 3.375614881515503, "learning_rate": 2e-05, "loss": 1.0135, "step": 73 }, { "epoch": 0.02554366586123576, "grad_norm": 3.9334664344787598, "learning_rate": 2e-05, "loss": 1.0267, "step": 74 }, { "epoch": 0.025888850535036246, "grad_norm": 3.8816137313842773, "learning_rate": 2e-05, "loss": 1.0347, "step": 75 }, { "epoch": 0.02623403520883673, "grad_norm": 3.884535551071167, "learning_rate": 2e-05, "loss": 0.9914, "step": 76 }, { "epoch": 0.02657921988263721, "grad_norm": 3.833580493927002, "learning_rate": 2e-05, "loss": 1.021, "step": 77 }, { "epoch": 0.026924404556437694, "grad_norm": 3.6896729469299316, "learning_rate": 2e-05, "loss": 0.9915, "step": 78 }, { "epoch": 0.027269589230238176, "grad_norm": 3.8832285404205322, "learning_rate": 2e-05, "loss": 1.0081, "step": 79 }, { "epoch": 0.027614773904038662, "grad_norm": 4.00054931640625, "learning_rate": 2e-05, "loss": 0.9723, "step": 80 }, { "epoch": 0.027959958577839145, "grad_norm": 3.9635231494903564, "learning_rate": 2e-05, "loss": 1.0677, "step": 81 }, { "epoch": 0.028305143251639627, "grad_norm": 4.25091552734375, "learning_rate": 2e-05, "loss": 0.9683, "step": 82 }, { "epoch": 0.02865032792544011, "grad_norm": 4.387684345245361, "learning_rate": 2e-05, "loss": 1.0273, "step": 83 }, { "epoch": 0.028995512599240592, "grad_norm": 4.047482013702393, "learning_rate": 2e-05, "loss": 1.0372, "step": 84 }, { "epoch": 0.029340697273041078, "grad_norm": 4.226908206939697, "learning_rate": 2e-05, "loss": 1.0192, "step": 85 }, { "epoch": 0.02968588194684156, "grad_norm": 4.123228073120117, "learning_rate": 2e-05, "loss": 0.9915, "step": 86 }, { "epoch": 0.030031066620642043, "grad_norm": 6.669504165649414, "learning_rate": 2e-05, "loss": 0.9531, "step": 87 }, { "epoch": 0.030376251294442526, "grad_norm": 4.364908695220947, "learning_rate": 2e-05, "loss": 1.0042, "step": 88 }, { "epoch": 0.03072143596824301, "grad_norm": 3.7988955974578857, "learning_rate": 2e-05, "loss": 0.9767, "step": 89 }, { "epoch": 0.031066620642043494, "grad_norm": 3.547370433807373, "learning_rate": 2e-05, "loss": 1.0045, "step": 90 }, { "epoch": 0.03141180531584398, "grad_norm": 4.054666042327881, "learning_rate": 2e-05, "loss": 0.9679, "step": 91 }, { "epoch": 0.03175698998964446, "grad_norm": 4.089395523071289, "learning_rate": 2e-05, "loss": 1.009, "step": 92 }, { "epoch": 0.03210217466344494, "grad_norm": 3.888781785964966, "learning_rate": 2e-05, "loss": 0.9993, "step": 93 }, { "epoch": 0.03244735933724543, "grad_norm": 4.337654113769531, "learning_rate": 2e-05, "loss": 1.0637, "step": 94 }, { "epoch": 0.03279254401104591, "grad_norm": 3.9866831302642822, "learning_rate": 2e-05, "loss": 1.0415, "step": 95 }, { "epoch": 0.03313772868484639, "grad_norm": 3.694230556488037, "learning_rate": 2e-05, "loss": 1.0111, "step": 96 }, { "epoch": 0.03348291335864688, "grad_norm": 3.8903889656066895, "learning_rate": 2e-05, "loss": 1.0113, "step": 97 }, { "epoch": 0.03382809803244736, "grad_norm": 4.173677444458008, "learning_rate": 2e-05, "loss": 0.9969, "step": 98 }, { "epoch": 0.034173282706247844, "grad_norm": 3.679419755935669, "learning_rate": 2e-05, "loss": 1.0401, "step": 99 }, { "epoch": 0.03451846738004832, "grad_norm": 4.073668003082275, "learning_rate": 2e-05, "loss": 1.0062, "step": 100 }, { "epoch": 0.03486365205384881, "grad_norm": 3.659552574157715, "learning_rate": 2e-05, "loss": 0.9113, "step": 101 }, { "epoch": 0.035208836727649295, "grad_norm": 3.581220865249634, "learning_rate": 2e-05, "loss": 1.0402, "step": 102 }, { "epoch": 0.035554021401449774, "grad_norm": 3.6875903606414795, "learning_rate": 2e-05, "loss": 1.0051, "step": 103 }, { "epoch": 0.03589920607525026, "grad_norm": 3.3204426765441895, "learning_rate": 2e-05, "loss": 1.0041, "step": 104 }, { "epoch": 0.03624439074905074, "grad_norm": 3.408184766769409, "learning_rate": 2e-05, "loss": 0.9501, "step": 105 }, { "epoch": 0.036589575422851225, "grad_norm": 3.7698254585266113, "learning_rate": 2e-05, "loss": 0.9487, "step": 106 }, { "epoch": 0.03693476009665171, "grad_norm": 4.5543694496154785, "learning_rate": 2e-05, "loss": 1.0095, "step": 107 }, { "epoch": 0.03727994477045219, "grad_norm": 4.206326961517334, "learning_rate": 2e-05, "loss": 0.9307, "step": 108 }, { "epoch": 0.037625129444252677, "grad_norm": 3.7120132446289062, "learning_rate": 2e-05, "loss": 0.9017, "step": 109 }, { "epoch": 0.037970314118053156, "grad_norm": 3.6532175540924072, "learning_rate": 2e-05, "loss": 0.9544, "step": 110 }, { "epoch": 0.03831549879185364, "grad_norm": 3.4927427768707275, "learning_rate": 2e-05, "loss": 0.97, "step": 111 }, { "epoch": 0.03866068346565413, "grad_norm": 4.344557762145996, "learning_rate": 2e-05, "loss": 0.9311, "step": 112 }, { "epoch": 0.03900586813945461, "grad_norm": 3.0494396686553955, "learning_rate": 2e-05, "loss": 1.0055, "step": 113 }, { "epoch": 0.03935105281325509, "grad_norm": 3.7052459716796875, "learning_rate": 2e-05, "loss": 0.9356, "step": 114 }, { "epoch": 0.03969623748705557, "grad_norm": 4.43536376953125, "learning_rate": 2e-05, "loss": 0.9695, "step": 115 }, { "epoch": 0.04004142216085606, "grad_norm": 3.6565682888031006, "learning_rate": 2e-05, "loss": 1.0503, "step": 116 }, { "epoch": 0.040386606834656544, "grad_norm": 3.5132741928100586, "learning_rate": 2e-05, "loss": 0.959, "step": 117 }, { "epoch": 0.04073179150845702, "grad_norm": 4.00861120223999, "learning_rate": 2e-05, "loss": 0.8973, "step": 118 }, { "epoch": 0.04107697618225751, "grad_norm": 4.118383407592773, "learning_rate": 2e-05, "loss": 0.961, "step": 119 }, { "epoch": 0.04142216085605799, "grad_norm": 3.6368112564086914, "learning_rate": 2e-05, "loss": 1.0302, "step": 120 }, { "epoch": 0.041767345529858474, "grad_norm": 3.668741226196289, "learning_rate": 2e-05, "loss": 0.9267, "step": 121 }, { "epoch": 0.04211253020365896, "grad_norm": 3.392117500305176, "learning_rate": 2e-05, "loss": 1.0133, "step": 122 }, { "epoch": 0.04245771487745944, "grad_norm": 3.939965009689331, "learning_rate": 2e-05, "loss": 0.9151, "step": 123 }, { "epoch": 0.042802899551259925, "grad_norm": 3.3222975730895996, "learning_rate": 2e-05, "loss": 0.9028, "step": 124 }, { "epoch": 0.043148084225060404, "grad_norm": 3.639970541000366, "learning_rate": 2e-05, "loss": 0.9709, "step": 125 }, { "epoch": 0.04349326889886089, "grad_norm": 3.2109615802764893, "learning_rate": 2e-05, "loss": 0.9867, "step": 126 }, { "epoch": 0.043838453572661376, "grad_norm": 3.3262574672698975, "learning_rate": 2e-05, "loss": 0.964, "step": 127 }, { "epoch": 0.044183638246461855, "grad_norm": 5.754081726074219, "learning_rate": 2e-05, "loss": 0.8765, "step": 128 }, { "epoch": 0.04452882292026234, "grad_norm": 3.367676019668579, "learning_rate": 2e-05, "loss": 0.9724, "step": 129 }, { "epoch": 0.04487400759406282, "grad_norm": 3.8047783374786377, "learning_rate": 2e-05, "loss": 0.9596, "step": 130 }, { "epoch": 0.045219192267863306, "grad_norm": 3.5262019634246826, "learning_rate": 2e-05, "loss": 0.8931, "step": 131 }, { "epoch": 0.04556437694166379, "grad_norm": 3.1185085773468018, "learning_rate": 2e-05, "loss": 0.891, "step": 132 }, { "epoch": 0.04590956161546427, "grad_norm": 3.795315980911255, "learning_rate": 2e-05, "loss": 0.9536, "step": 133 }, { "epoch": 0.04625474628926476, "grad_norm": 3.698105812072754, "learning_rate": 2e-05, "loss": 0.918, "step": 134 }, { "epoch": 0.04659993096306524, "grad_norm": 4.450272560119629, "learning_rate": 2e-05, "loss": 0.9075, "step": 135 }, { "epoch": 0.04694511563686572, "grad_norm": 3.3076443672180176, "learning_rate": 2e-05, "loss": 0.9334, "step": 136 }, { "epoch": 0.04729030031066621, "grad_norm": 3.551239252090454, "learning_rate": 2e-05, "loss": 0.9221, "step": 137 }, { "epoch": 0.04763548498446669, "grad_norm": 3.3865537643432617, "learning_rate": 2e-05, "loss": 0.96, "step": 138 }, { "epoch": 0.047980669658267174, "grad_norm": 3.477189302444458, "learning_rate": 2e-05, "loss": 0.9794, "step": 139 }, { "epoch": 0.04832585433206766, "grad_norm": 3.2932441234588623, "learning_rate": 2e-05, "loss": 0.9078, "step": 140 }, { "epoch": 0.04867103900586814, "grad_norm": 3.095069646835327, "learning_rate": 2e-05, "loss": 0.9045, "step": 141 }, { "epoch": 0.049016223679668625, "grad_norm": 3.386526107788086, "learning_rate": 2e-05, "loss": 0.937, "step": 142 }, { "epoch": 0.049361408353469104, "grad_norm": 3.274214267730713, "learning_rate": 2e-05, "loss": 0.9356, "step": 143 }, { "epoch": 0.04970659302726959, "grad_norm": 3.472280263900757, "learning_rate": 2e-05, "loss": 0.8798, "step": 144 }, { "epoch": 0.050051777701070076, "grad_norm": 3.4150500297546387, "learning_rate": 2e-05, "loss": 1.0118, "step": 145 }, { "epoch": 0.050396962374870555, "grad_norm": 3.7823333740234375, "learning_rate": 2e-05, "loss": 0.9675, "step": 146 }, { "epoch": 0.05074214704867104, "grad_norm": 3.460674524307251, "learning_rate": 2e-05, "loss": 0.9366, "step": 147 }, { "epoch": 0.05108733172247152, "grad_norm": 4.081386089324951, "learning_rate": 2e-05, "loss": 0.9596, "step": 148 }, { "epoch": 0.051432516396272006, "grad_norm": 3.5548624992370605, "learning_rate": 2e-05, "loss": 0.9369, "step": 149 }, { "epoch": 0.05177770107007249, "grad_norm": 3.713184118270874, "learning_rate": 2e-05, "loss": 0.9645, "step": 150 }, { "epoch": 0.05212288574387297, "grad_norm": 9.342556953430176, "learning_rate": 2e-05, "loss": 0.953, "step": 151 }, { "epoch": 0.05246807041767346, "grad_norm": 3.330892562866211, "learning_rate": 2e-05, "loss": 0.9851, "step": 152 }, { "epoch": 0.052813255091473936, "grad_norm": 3.2820513248443604, "learning_rate": 2e-05, "loss": 0.9881, "step": 153 }, { "epoch": 0.05315843976527442, "grad_norm": 3.08601713180542, "learning_rate": 2e-05, "loss": 0.8678, "step": 154 }, { "epoch": 0.05350362443907491, "grad_norm": 3.466398239135742, "learning_rate": 2e-05, "loss": 0.9688, "step": 155 }, { "epoch": 0.05384880911287539, "grad_norm": 3.8165998458862305, "learning_rate": 2e-05, "loss": 0.9516, "step": 156 }, { "epoch": 0.05419399378667587, "grad_norm": 3.843984365463257, "learning_rate": 2e-05, "loss": 0.8846, "step": 157 }, { "epoch": 0.05453917846047635, "grad_norm": 3.6460742950439453, "learning_rate": 2e-05, "loss": 0.9738, "step": 158 }, { "epoch": 0.05488436313427684, "grad_norm": 3.6064538955688477, "learning_rate": 2e-05, "loss": 0.8974, "step": 159 }, { "epoch": 0.055229547808077324, "grad_norm": 3.8065435886383057, "learning_rate": 2e-05, "loss": 0.9804, "step": 160 }, { "epoch": 0.0555747324818778, "grad_norm": 3.020841121673584, "learning_rate": 2e-05, "loss": 0.9037, "step": 161 }, { "epoch": 0.05591991715567829, "grad_norm": 3.5063493251800537, "learning_rate": 2e-05, "loss": 0.892, "step": 162 }, { "epoch": 0.05626510182947877, "grad_norm": 3.2224860191345215, "learning_rate": 2e-05, "loss": 0.8995, "step": 163 }, { "epoch": 0.056610286503279254, "grad_norm": 3.520097494125366, "learning_rate": 2e-05, "loss": 0.9791, "step": 164 }, { "epoch": 0.05695547117707974, "grad_norm": 3.435135841369629, "learning_rate": 2e-05, "loss": 1.0013, "step": 165 }, { "epoch": 0.05730065585088022, "grad_norm": 3.173973321914673, "learning_rate": 2e-05, "loss": 0.9146, "step": 166 }, { "epoch": 0.057645840524680705, "grad_norm": 3.4863386154174805, "learning_rate": 2e-05, "loss": 0.9885, "step": 167 }, { "epoch": 0.057991025198481184, "grad_norm": 3.2673957347869873, "learning_rate": 2e-05, "loss": 0.9354, "step": 168 }, { "epoch": 0.05833620987228167, "grad_norm": 3.613051652908325, "learning_rate": 2e-05, "loss": 0.9169, "step": 169 }, { "epoch": 0.058681394546082156, "grad_norm": 3.6220316886901855, "learning_rate": 2e-05, "loss": 0.9123, "step": 170 }, { "epoch": 0.059026579219882636, "grad_norm": 2.9920058250427246, "learning_rate": 2e-05, "loss": 0.9228, "step": 171 }, { "epoch": 0.05937176389368312, "grad_norm": 3.1163201332092285, "learning_rate": 2e-05, "loss": 0.9196, "step": 172 }, { "epoch": 0.0597169485674836, "grad_norm": 3.5045080184936523, "learning_rate": 2e-05, "loss": 0.9711, "step": 173 }, { "epoch": 0.06006213324128409, "grad_norm": 3.3398544788360596, "learning_rate": 2e-05, "loss": 0.8714, "step": 174 }, { "epoch": 0.06040731791508457, "grad_norm": 2.9095466136932373, "learning_rate": 2e-05, "loss": 0.8746, "step": 175 }, { "epoch": 0.06075250258888505, "grad_norm": 3.1426031589508057, "learning_rate": 2e-05, "loss": 0.8826, "step": 176 }, { "epoch": 0.06109768726268554, "grad_norm": 4.104501724243164, "learning_rate": 2e-05, "loss": 0.9346, "step": 177 }, { "epoch": 0.06144287193648602, "grad_norm": 2.990579128265381, "learning_rate": 2e-05, "loss": 0.9675, "step": 178 }, { "epoch": 0.0617880566102865, "grad_norm": 3.756319284439087, "learning_rate": 2e-05, "loss": 0.9229, "step": 179 }, { "epoch": 0.06213324128408699, "grad_norm": 3.5764338970184326, "learning_rate": 2e-05, "loss": 0.9925, "step": 180 }, { "epoch": 0.06247842595788747, "grad_norm": 3.068021774291992, "learning_rate": 2e-05, "loss": 0.8987, "step": 181 }, { "epoch": 0.06282361063168795, "grad_norm": 3.2142879962921143, "learning_rate": 2e-05, "loss": 0.8418, "step": 182 }, { "epoch": 0.06316879530548844, "grad_norm": 3.3960886001586914, "learning_rate": 2e-05, "loss": 0.8892, "step": 183 }, { "epoch": 0.06351397997928893, "grad_norm": 4.435737609863281, "learning_rate": 2e-05, "loss": 0.9485, "step": 184 }, { "epoch": 0.0638591646530894, "grad_norm": 11.62714958190918, "learning_rate": 2e-05, "loss": 0.8685, "step": 185 }, { "epoch": 0.06420434932688988, "grad_norm": 3.0193748474121094, "learning_rate": 2e-05, "loss": 0.9131, "step": 186 }, { "epoch": 0.06454953400069037, "grad_norm": 3.1290862560272217, "learning_rate": 2e-05, "loss": 0.9776, "step": 187 }, { "epoch": 0.06489471867449086, "grad_norm": 3.153416872024536, "learning_rate": 2e-05, "loss": 0.9031, "step": 188 }, { "epoch": 0.06523990334829134, "grad_norm": 3.450758457183838, "learning_rate": 2e-05, "loss": 0.8928, "step": 189 }, { "epoch": 0.06558508802209181, "grad_norm": 3.281147003173828, "learning_rate": 2e-05, "loss": 1.0054, "step": 190 }, { "epoch": 0.0659302726958923, "grad_norm": 3.1141176223754883, "learning_rate": 2e-05, "loss": 0.913, "step": 191 }, { "epoch": 0.06627545736969279, "grad_norm": 2.945939064025879, "learning_rate": 2e-05, "loss": 0.895, "step": 192 }, { "epoch": 0.06662064204349327, "grad_norm": 3.141927719116211, "learning_rate": 2e-05, "loss": 0.9336, "step": 193 }, { "epoch": 0.06696582671729376, "grad_norm": 3.6074554920196533, "learning_rate": 2e-05, "loss": 0.9821, "step": 194 }, { "epoch": 0.06731101139109423, "grad_norm": 2.96323823928833, "learning_rate": 2e-05, "loss": 0.9417, "step": 195 }, { "epoch": 0.06765619606489472, "grad_norm": 3.4270036220550537, "learning_rate": 2e-05, "loss": 0.9268, "step": 196 }, { "epoch": 0.0680013807386952, "grad_norm": 3.006737232208252, "learning_rate": 2e-05, "loss": 0.9125, "step": 197 }, { "epoch": 0.06834656541249569, "grad_norm": 3.3677432537078857, "learning_rate": 2e-05, "loss": 0.9403, "step": 198 }, { "epoch": 0.06869175008629617, "grad_norm": 3.6785035133361816, "learning_rate": 2e-05, "loss": 0.8477, "step": 199 }, { "epoch": 0.06903693476009665, "grad_norm": 3.1328837871551514, "learning_rate": 2e-05, "loss": 0.8866, "step": 200 } ], "logging_steps": 1.0, "max_steps": 14485, "num_input_tokens_seen": 0, "num_train_epochs": 5, "save_steps": 200, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 125627793408000.0, "train_batch_size": 12, "trial_name": null, "trial_params": null }