{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.06903693476009665, "eval_steps": 500, "global_step": 200, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.00034518467380048324, "grad_norm": 25.833335876464844, "learning_rate": 0.0, "loss": 2.2926, "step": 1 }, { "epoch": 0.0006903693476009665, "grad_norm": 23.58083724975586, "learning_rate": 2e-05, "loss": 2.1943, "step": 2 }, { "epoch": 0.0010355540214014498, "grad_norm": 24.2187442779541, "learning_rate": 2e-05, "loss": 2.3772, "step": 3 }, { "epoch": 0.001380738695201933, "grad_norm": 14.579557418823242, "learning_rate": 2e-05, "loss": 2.0945, "step": 4 }, { "epoch": 0.0017259233690024164, "grad_norm": 15.069305419921875, "learning_rate": 2e-05, "loss": 2.1537, "step": 5 }, { "epoch": 0.0020711080428028996, "grad_norm": 14.385339736938477, "learning_rate": 2e-05, "loss": 2.1585, "step": 6 }, { "epoch": 0.002416292716603383, "grad_norm": 9.95476245880127, "learning_rate": 2e-05, "loss": 1.8333, "step": 7 }, { "epoch": 0.002761477390403866, "grad_norm": 9.15005111694336, "learning_rate": 2e-05, "loss": 1.937, "step": 8 }, { "epoch": 0.0031066620642043494, "grad_norm": 7.361661911010742, "learning_rate": 2e-05, "loss": 1.9484, "step": 9 }, { "epoch": 0.0034518467380048328, "grad_norm": 5.931179046630859, "learning_rate": 2e-05, "loss": 1.7668, "step": 10 }, { "epoch": 0.0037970314118053157, "grad_norm": 8.192151069641113, "learning_rate": 2e-05, "loss": 1.8234, "step": 11 }, { "epoch": 0.004142216085605799, "grad_norm": 6.827078342437744, "learning_rate": 2e-05, "loss": 1.9133, "step": 12 }, { "epoch": 0.0044874007594062825, "grad_norm": 7.808759689331055, "learning_rate": 2e-05, "loss": 1.8314, "step": 13 }, { "epoch": 0.004832585433206766, "grad_norm": 7.531504154205322, "learning_rate": 2e-05, "loss": 1.7961, "step": 14 }, { "epoch": 0.0051777701070072485, "grad_norm": 6.617609977722168, "learning_rate": 2e-05, "loss": 1.7624, "step": 15 }, { "epoch": 0.005522954780807732, "grad_norm": 4.966954708099365, "learning_rate": 2e-05, "loss": 1.7034, "step": 16 }, { "epoch": 0.005868139454608215, "grad_norm": 5.566157817840576, "learning_rate": 2e-05, "loss": 1.7722, "step": 17 }, { "epoch": 0.006213324128408699, "grad_norm": 4.915079593658447, "learning_rate": 2e-05, "loss": 1.6602, "step": 18 }, { "epoch": 0.006558508802209182, "grad_norm": 4.77263069152832, "learning_rate": 2e-05, "loss": 1.6854, "step": 19 }, { "epoch": 0.0069036934760096655, "grad_norm": 4.299682140350342, "learning_rate": 2e-05, "loss": 1.6217, "step": 20 }, { "epoch": 0.007248878149810148, "grad_norm": 4.1203694343566895, "learning_rate": 2e-05, "loss": 1.6546, "step": 21 }, { "epoch": 0.0075940628236106315, "grad_norm": 4.058311939239502, "learning_rate": 2e-05, "loss": 1.6795, "step": 22 }, { "epoch": 0.007939247497411116, "grad_norm": 3.668001651763916, "learning_rate": 2e-05, "loss": 1.7228, "step": 23 }, { "epoch": 0.008284432171211598, "grad_norm": 3.397109270095825, "learning_rate": 2e-05, "loss": 1.555, "step": 24 }, { "epoch": 0.00862961684501208, "grad_norm": 4.351656436920166, "learning_rate": 2e-05, "loss": 1.6977, "step": 25 }, { "epoch": 0.008974801518812565, "grad_norm": 3.7789554595947266, "learning_rate": 2e-05, "loss": 1.6534, "step": 26 }, { "epoch": 0.009319986192613048, "grad_norm": 3.4693193435668945, "learning_rate": 2e-05, "loss": 1.6248, "step": 27 }, { "epoch": 0.009665170866413532, "grad_norm": 2.6027116775512695, "learning_rate": 2e-05, "loss": 1.4901, "step": 28 }, { "epoch": 0.010010355540214014, "grad_norm": 2.6816513538360596, "learning_rate": 2e-05, "loss": 1.4964, "step": 29 }, { "epoch": 0.010355540214014497, "grad_norm": 5.244405746459961, "learning_rate": 2e-05, "loss": 1.5238, "step": 30 }, { "epoch": 0.010700724887814981, "grad_norm": 4.071628570556641, "learning_rate": 2e-05, "loss": 1.5401, "step": 31 }, { "epoch": 0.011045909561615464, "grad_norm": 3.897395372390747, "learning_rate": 2e-05, "loss": 1.4759, "step": 32 }, { "epoch": 0.011391094235415948, "grad_norm": 2.9609882831573486, "learning_rate": 2e-05, "loss": 1.4919, "step": 33 }, { "epoch": 0.01173627890921643, "grad_norm": 3.1106183528900146, "learning_rate": 2e-05, "loss": 1.5436, "step": 34 }, { "epoch": 0.012081463583016915, "grad_norm": 3.7441351413726807, "learning_rate": 2e-05, "loss": 1.5496, "step": 35 }, { "epoch": 0.012426648256817397, "grad_norm": 3.6406350135803223, "learning_rate": 2e-05, "loss": 1.4531, "step": 36 }, { "epoch": 0.01277183293061788, "grad_norm": 2.915447950363159, "learning_rate": 2e-05, "loss": 1.48, "step": 37 }, { "epoch": 0.013117017604418364, "grad_norm": 2.8513331413269043, "learning_rate": 2e-05, "loss": 1.5192, "step": 38 }, { "epoch": 0.013462202278218847, "grad_norm": 3.2347466945648193, "learning_rate": 2e-05, "loss": 1.5727, "step": 39 }, { "epoch": 0.013807386952019331, "grad_norm": 2.82135272026062, "learning_rate": 2e-05, "loss": 1.5098, "step": 40 }, { "epoch": 0.014152571625819814, "grad_norm": 2.694873809814453, "learning_rate": 2e-05, "loss": 1.4223, "step": 41 }, { "epoch": 0.014497756299620296, "grad_norm": 2.7129478454589844, "learning_rate": 2e-05, "loss": 1.4062, "step": 42 }, { "epoch": 0.01484294097342078, "grad_norm": 2.6555328369140625, "learning_rate": 2e-05, "loss": 1.4993, "step": 43 }, { "epoch": 0.015188125647221263, "grad_norm": 2.3439159393310547, "learning_rate": 2e-05, "loss": 1.4281, "step": 44 }, { "epoch": 0.015533310321021747, "grad_norm": 2.40368914604187, "learning_rate": 2e-05, "loss": 1.4261, "step": 45 }, { "epoch": 0.01587849499482223, "grad_norm": 2.3288614749908447, "learning_rate": 2e-05, "loss": 1.3958, "step": 46 }, { "epoch": 0.016223679668622714, "grad_norm": 2.474519968032837, "learning_rate": 2e-05, "loss": 1.4246, "step": 47 }, { "epoch": 0.016568864342423197, "grad_norm": 2.680997371673584, "learning_rate": 2e-05, "loss": 1.4318, "step": 48 }, { "epoch": 0.01691404901622368, "grad_norm": 2.6899235248565674, "learning_rate": 2e-05, "loss": 1.3581, "step": 49 }, { "epoch": 0.01725923369002416, "grad_norm": 2.5045225620269775, "learning_rate": 2e-05, "loss": 1.3983, "step": 50 }, { "epoch": 0.017604418363824648, "grad_norm": 2.650184154510498, "learning_rate": 2e-05, "loss": 1.4005, "step": 51 }, { "epoch": 0.01794960303762513, "grad_norm": 2.560302495956421, "learning_rate": 2e-05, "loss": 1.3706, "step": 52 }, { "epoch": 0.018294787711425613, "grad_norm": 2.116626739501953, "learning_rate": 2e-05, "loss": 1.2987, "step": 53 }, { "epoch": 0.018639972385226095, "grad_norm": 3.0732431411743164, "learning_rate": 2e-05, "loss": 1.4394, "step": 54 }, { "epoch": 0.018985157059026578, "grad_norm": 2.880014657974243, "learning_rate": 2e-05, "loss": 1.3772, "step": 55 }, { "epoch": 0.019330341732827064, "grad_norm": 2.65002179145813, "learning_rate": 2e-05, "loss": 1.344, "step": 56 }, { "epoch": 0.019675526406627546, "grad_norm": 2.4109294414520264, "learning_rate": 2e-05, "loss": 1.3818, "step": 57 }, { "epoch": 0.02002071108042803, "grad_norm": 3.318305730819702, "learning_rate": 2e-05, "loss": 1.4488, "step": 58 }, { "epoch": 0.02036589575422851, "grad_norm": 2.9551541805267334, "learning_rate": 2e-05, "loss": 1.3245, "step": 59 }, { "epoch": 0.020711080428028994, "grad_norm": 2.512965679168701, "learning_rate": 2e-05, "loss": 1.3476, "step": 60 }, { "epoch": 0.02105626510182948, "grad_norm": 2.608680248260498, "learning_rate": 2e-05, "loss": 1.335, "step": 61 }, { "epoch": 0.021401449775629963, "grad_norm": 2.2880616188049316, "learning_rate": 2e-05, "loss": 1.2781, "step": 62 }, { "epoch": 0.021746634449430445, "grad_norm": 2.7310123443603516, "learning_rate": 2e-05, "loss": 1.3449, "step": 63 }, { "epoch": 0.022091819123230928, "grad_norm": 2.5008130073547363, "learning_rate": 2e-05, "loss": 1.4042, "step": 64 }, { "epoch": 0.02243700379703141, "grad_norm": 3.5907320976257324, "learning_rate": 2e-05, "loss": 1.344, "step": 65 }, { "epoch": 0.022782188470831896, "grad_norm": 2.4797489643096924, "learning_rate": 2e-05, "loss": 1.3342, "step": 66 }, { "epoch": 0.02312737314463238, "grad_norm": 2.556204319000244, "learning_rate": 2e-05, "loss": 1.3244, "step": 67 }, { "epoch": 0.02347255781843286, "grad_norm": 5.068964004516602, "learning_rate": 2e-05, "loss": 1.3041, "step": 68 }, { "epoch": 0.023817742492233344, "grad_norm": 2.165076494216919, "learning_rate": 2e-05, "loss": 1.2727, "step": 69 }, { "epoch": 0.02416292716603383, "grad_norm": 2.202164649963379, "learning_rate": 2e-05, "loss": 1.2887, "step": 70 }, { "epoch": 0.024508111839834312, "grad_norm": 2.3834869861602783, "learning_rate": 2e-05, "loss": 1.2694, "step": 71 }, { "epoch": 0.024853296513634795, "grad_norm": 2.5316550731658936, "learning_rate": 2e-05, "loss": 1.2514, "step": 72 }, { "epoch": 0.025198481187435277, "grad_norm": 1.9449459314346313, "learning_rate": 2e-05, "loss": 1.26, "step": 73 }, { "epoch": 0.02554366586123576, "grad_norm": 2.2826900482177734, "learning_rate": 2e-05, "loss": 1.2931, "step": 74 }, { "epoch": 0.025888850535036246, "grad_norm": 2.260650396347046, "learning_rate": 2e-05, "loss": 1.2732, "step": 75 }, { "epoch": 0.02623403520883673, "grad_norm": 2.356182336807251, "learning_rate": 2e-05, "loss": 1.2449, "step": 76 }, { "epoch": 0.02657921988263721, "grad_norm": 2.199906826019287, "learning_rate": 2e-05, "loss": 1.2733, "step": 77 }, { "epoch": 0.026924404556437694, "grad_norm": 2.3083510398864746, "learning_rate": 2e-05, "loss": 1.2257, "step": 78 }, { "epoch": 0.027269589230238176, "grad_norm": 2.2658169269561768, "learning_rate": 2e-05, "loss": 1.2525, "step": 79 }, { "epoch": 0.027614773904038662, "grad_norm": 2.352308988571167, "learning_rate": 2e-05, "loss": 1.2202, "step": 80 }, { "epoch": 0.027959958577839145, "grad_norm": 2.523381471633911, "learning_rate": 2e-05, "loss": 1.2996, "step": 81 }, { "epoch": 0.028305143251639627, "grad_norm": 2.4327428340911865, "learning_rate": 2e-05, "loss": 1.2135, "step": 82 }, { "epoch": 0.02865032792544011, "grad_norm": 2.4549570083618164, "learning_rate": 2e-05, "loss": 1.2813, "step": 83 }, { "epoch": 0.028995512599240592, "grad_norm": 2.4394640922546387, "learning_rate": 2e-05, "loss": 1.2828, "step": 84 }, { "epoch": 0.029340697273041078, "grad_norm": 2.4780633449554443, "learning_rate": 2e-05, "loss": 1.2517, "step": 85 }, { "epoch": 0.02968588194684156, "grad_norm": 2.326880931854248, "learning_rate": 2e-05, "loss": 1.2288, "step": 86 }, { "epoch": 0.030031066620642043, "grad_norm": 3.1833627223968506, "learning_rate": 2e-05, "loss": 1.1978, "step": 87 }, { "epoch": 0.030376251294442526, "grad_norm": 2.624091625213623, "learning_rate": 2e-05, "loss": 1.2534, "step": 88 }, { "epoch": 0.03072143596824301, "grad_norm": 2.531895160675049, "learning_rate": 2e-05, "loss": 1.2263, "step": 89 }, { "epoch": 0.031066620642043494, "grad_norm": 2.2346715927124023, "learning_rate": 2e-05, "loss": 1.2301, "step": 90 }, { "epoch": 0.03141180531584398, "grad_norm": 2.237839698791504, "learning_rate": 2e-05, "loss": 1.1897, "step": 91 }, { "epoch": 0.03175698998964446, "grad_norm": 2.4267807006835938, "learning_rate": 2e-05, "loss": 1.2508, "step": 92 }, { "epoch": 0.03210217466344494, "grad_norm": 2.2506682872772217, "learning_rate": 2e-05, "loss": 1.2262, "step": 93 }, { "epoch": 0.03244735933724543, "grad_norm": 2.5266077518463135, "learning_rate": 2e-05, "loss": 1.3139, "step": 94 }, { "epoch": 0.03279254401104591, "grad_norm": 2.2002406120300293, "learning_rate": 2e-05, "loss": 1.2755, "step": 95 }, { "epoch": 0.03313772868484639, "grad_norm": 2.20263409614563, "learning_rate": 2e-05, "loss": 1.2388, "step": 96 }, { "epoch": 0.03348291335864688, "grad_norm": 2.297576665878296, "learning_rate": 2e-05, "loss": 1.2406, "step": 97 }, { "epoch": 0.03382809803244736, "grad_norm": 2.3951361179351807, "learning_rate": 2e-05, "loss": 1.2244, "step": 98 }, { "epoch": 0.034173282706247844, "grad_norm": 2.2707271575927734, "learning_rate": 2e-05, "loss": 1.2719, "step": 99 }, { "epoch": 0.03451846738004832, "grad_norm": 2.2766411304473877, "learning_rate": 2e-05, "loss": 1.23, "step": 100 }, { "epoch": 0.03486365205384881, "grad_norm": 2.253887414932251, "learning_rate": 2e-05, "loss": 1.1369, "step": 101 }, { "epoch": 0.035208836727649295, "grad_norm": 2.0003821849823, "learning_rate": 2e-05, "loss": 1.2547, "step": 102 }, { "epoch": 0.035554021401449774, "grad_norm": 2.277153253555298, "learning_rate": 2e-05, "loss": 1.2244, "step": 103 }, { "epoch": 0.03589920607525026, "grad_norm": 2.1561081409454346, "learning_rate": 2e-05, "loss": 1.2222, "step": 104 }, { "epoch": 0.03624439074905074, "grad_norm": 2.0002012252807617, "learning_rate": 2e-05, "loss": 1.1599, "step": 105 }, { "epoch": 0.036589575422851225, "grad_norm": 2.3313021659851074, "learning_rate": 2e-05, "loss": 1.1658, "step": 106 }, { "epoch": 0.03693476009665171, "grad_norm": 2.58686900138855, "learning_rate": 2e-05, "loss": 1.2282, "step": 107 }, { "epoch": 0.03727994477045219, "grad_norm": 2.485671043395996, "learning_rate": 2e-05, "loss": 1.1537, "step": 108 }, { "epoch": 0.037625129444252677, "grad_norm": 2.3962278366088867, "learning_rate": 2e-05, "loss": 1.133, "step": 109 }, { "epoch": 0.037970314118053156, "grad_norm": 2.118319034576416, "learning_rate": 2e-05, "loss": 1.1769, "step": 110 }, { "epoch": 0.03831549879185364, "grad_norm": 2.095940113067627, "learning_rate": 2e-05, "loss": 1.1763, "step": 111 }, { "epoch": 0.03866068346565413, "grad_norm": 2.0862512588500977, "learning_rate": 2e-05, "loss": 1.1356, "step": 112 }, { "epoch": 0.03900586813945461, "grad_norm": 1.9276546239852905, "learning_rate": 2e-05, "loss": 1.2068, "step": 113 }, { "epoch": 0.03935105281325509, "grad_norm": 2.5604825019836426, "learning_rate": 2e-05, "loss": 1.16, "step": 114 }, { "epoch": 0.03969623748705557, "grad_norm": 2.200289726257324, "learning_rate": 2e-05, "loss": 1.1811, "step": 115 }, { "epoch": 0.04004142216085606, "grad_norm": 2.2654318809509277, "learning_rate": 2e-05, "loss": 1.2745, "step": 116 }, { "epoch": 0.040386606834656544, "grad_norm": 2.194129228591919, "learning_rate": 2e-05, "loss": 1.1633, "step": 117 }, { "epoch": 0.04073179150845702, "grad_norm": 2.267609119415283, "learning_rate": 2e-05, "loss": 1.1025, "step": 118 }, { "epoch": 0.04107697618225751, "grad_norm": 2.3966379165649414, "learning_rate": 2e-05, "loss": 1.1624, "step": 119 }, { "epoch": 0.04142216085605799, "grad_norm": 2.3428127765655518, "learning_rate": 2e-05, "loss": 1.2521, "step": 120 }, { "epoch": 0.041767345529858474, "grad_norm": 2.257154941558838, "learning_rate": 2e-05, "loss": 1.1427, "step": 121 }, { "epoch": 0.04211253020365896, "grad_norm": 2.4615261554718018, "learning_rate": 2e-05, "loss": 1.209, "step": 122 }, { "epoch": 0.04245771487745944, "grad_norm": 2.215366840362549, "learning_rate": 2e-05, "loss": 1.1213, "step": 123 }, { "epoch": 0.042802899551259925, "grad_norm": 2.293936014175415, "learning_rate": 2e-05, "loss": 1.1118, "step": 124 }, { "epoch": 0.043148084225060404, "grad_norm": 2.351991653442383, "learning_rate": 2e-05, "loss": 1.1849, "step": 125 }, { "epoch": 0.04349326889886089, "grad_norm": 2.118906259536743, "learning_rate": 2e-05, "loss": 1.1905, "step": 126 }, { "epoch": 0.043838453572661376, "grad_norm": 2.1108460426330566, "learning_rate": 2e-05, "loss": 1.1787, "step": 127 }, { "epoch": 0.044183638246461855, "grad_norm": 2.560715436935425, "learning_rate": 2e-05, "loss": 1.0727, "step": 128 }, { "epoch": 0.04452882292026234, "grad_norm": 1.9983900785446167, "learning_rate": 2e-05, "loss": 1.1665, "step": 129 }, { "epoch": 0.04487400759406282, "grad_norm": 2.3714847564697266, "learning_rate": 2e-05, "loss": 1.1488, "step": 130 }, { "epoch": 0.045219192267863306, "grad_norm": 2.243546724319458, "learning_rate": 2e-05, "loss": 1.0965, "step": 131 }, { "epoch": 0.04556437694166379, "grad_norm": 1.989858627319336, "learning_rate": 2e-05, "loss": 1.0833, "step": 132 }, { "epoch": 0.04590956161546427, "grad_norm": 2.298943519592285, "learning_rate": 2e-05, "loss": 1.1548, "step": 133 }, { "epoch": 0.04625474628926476, "grad_norm": 2.256289005279541, "learning_rate": 2e-05, "loss": 1.1139, "step": 134 }, { "epoch": 0.04659993096306524, "grad_norm": 2.386530876159668, "learning_rate": 2e-05, "loss": 1.1245, "step": 135 }, { "epoch": 0.04694511563686572, "grad_norm": 2.073687791824341, "learning_rate": 2e-05, "loss": 1.1337, "step": 136 }, { "epoch": 0.04729030031066621, "grad_norm": 2.307697057723999, "learning_rate": 2e-05, "loss": 1.1325, "step": 137 }, { "epoch": 0.04763548498446669, "grad_norm": 2.1158194541931152, "learning_rate": 2e-05, "loss": 1.1637, "step": 138 }, { "epoch": 0.047980669658267174, "grad_norm": 2.21449613571167, "learning_rate": 2e-05, "loss": 1.1802, "step": 139 }, { "epoch": 0.04832585433206766, "grad_norm": 2.041476249694824, "learning_rate": 2e-05, "loss": 1.1007, "step": 140 }, { "epoch": 0.04867103900586814, "grad_norm": 2.262849807739258, "learning_rate": 2e-05, "loss": 1.1006, "step": 141 }, { "epoch": 0.049016223679668625, "grad_norm": 2.207761287689209, "learning_rate": 2e-05, "loss": 1.133, "step": 142 }, { "epoch": 0.049361408353469104, "grad_norm": 2.083613872528076, "learning_rate": 2e-05, "loss": 1.1319, "step": 143 }, { "epoch": 0.04970659302726959, "grad_norm": 2.1225838661193848, "learning_rate": 2e-05, "loss": 1.0786, "step": 144 }, { "epoch": 0.050051777701070076, "grad_norm": 2.17154598236084, "learning_rate": 2e-05, "loss": 1.2138, "step": 145 }, { "epoch": 0.050396962374870555, "grad_norm": 2.655251979827881, "learning_rate": 2e-05, "loss": 1.1639, "step": 146 }, { "epoch": 0.05074214704867104, "grad_norm": 2.241605758666992, "learning_rate": 2e-05, "loss": 1.1345, "step": 147 }, { "epoch": 0.05108733172247152, "grad_norm": 2.397520065307617, "learning_rate": 2e-05, "loss": 1.1592, "step": 148 }, { "epoch": 0.051432516396272006, "grad_norm": 2.2444629669189453, "learning_rate": 2e-05, "loss": 1.134, "step": 149 }, { "epoch": 0.05177770107007249, "grad_norm": 2.179332971572876, "learning_rate": 2e-05, "loss": 1.1726, "step": 150 }, { "epoch": 0.05212288574387297, "grad_norm": 2.1803085803985596, "learning_rate": 2e-05, "loss": 1.1458, "step": 151 }, { "epoch": 0.05246807041767346, "grad_norm": 2.06752872467041, "learning_rate": 2e-05, "loss": 1.1741, "step": 152 }, { "epoch": 0.052813255091473936, "grad_norm": 1.9567921161651611, "learning_rate": 2e-05, "loss": 1.1783, "step": 153 }, { "epoch": 0.05315843976527442, "grad_norm": 1.8780710697174072, "learning_rate": 2e-05, "loss": 1.0461, "step": 154 }, { "epoch": 0.05350362443907491, "grad_norm": 2.142355442047119, "learning_rate": 2e-05, "loss": 1.1683, "step": 155 }, { "epoch": 0.05384880911287539, "grad_norm": 2.404834270477295, "learning_rate": 2e-05, "loss": 1.1367, "step": 156 }, { "epoch": 0.05419399378667587, "grad_norm": 2.467586040496826, "learning_rate": 2e-05, "loss": 1.0616, "step": 157 }, { "epoch": 0.05453917846047635, "grad_norm": 2.428678035736084, "learning_rate": 2e-05, "loss": 1.1587, "step": 158 }, { "epoch": 0.05488436313427684, "grad_norm": 1.9721519947052002, "learning_rate": 2e-05, "loss": 1.0864, "step": 159 }, { "epoch": 0.055229547808077324, "grad_norm": 2.282735586166382, "learning_rate": 2e-05, "loss": 1.1805, "step": 160 }, { "epoch": 0.0555747324818778, "grad_norm": 2.136899471282959, "learning_rate": 2e-05, "loss": 1.0941, "step": 161 }, { "epoch": 0.05591991715567829, "grad_norm": 2.0251846313476562, "learning_rate": 2e-05, "loss": 1.0796, "step": 162 }, { "epoch": 0.05626510182947877, "grad_norm": 2.1328299045562744, "learning_rate": 2e-05, "loss": 1.0917, "step": 163 }, { "epoch": 0.056610286503279254, "grad_norm": 2.205331802368164, "learning_rate": 2e-05, "loss": 1.1792, "step": 164 }, { "epoch": 0.05695547117707974, "grad_norm": 2.0339744091033936, "learning_rate": 2e-05, "loss": 1.1874, "step": 165 }, { "epoch": 0.05730065585088022, "grad_norm": 1.8030365705490112, "learning_rate": 2e-05, "loss": 1.0929, "step": 166 }, { "epoch": 0.057645840524680705, "grad_norm": 2.1905670166015625, "learning_rate": 2e-05, "loss": 1.1831, "step": 167 }, { "epoch": 0.057991025198481184, "grad_norm": 2.142336845397949, "learning_rate": 2e-05, "loss": 1.1237, "step": 168 }, { "epoch": 0.05833620987228167, "grad_norm": 2.3521053791046143, "learning_rate": 2e-05, "loss": 1.1077, "step": 169 }, { "epoch": 0.058681394546082156, "grad_norm": 2.105743408203125, "learning_rate": 2e-05, "loss": 1.1048, "step": 170 }, { "epoch": 0.059026579219882636, "grad_norm": 1.9414738416671753, "learning_rate": 2e-05, "loss": 1.112, "step": 171 }, { "epoch": 0.05937176389368312, "grad_norm": 1.9606658220291138, "learning_rate": 2e-05, "loss": 1.1109, "step": 172 }, { "epoch": 0.0597169485674836, "grad_norm": 2.3274831771850586, "learning_rate": 2e-05, "loss": 1.1803, "step": 173 }, { "epoch": 0.06006213324128409, "grad_norm": 2.1384570598602295, "learning_rate": 2e-05, "loss": 1.0515, "step": 174 }, { "epoch": 0.06040731791508457, "grad_norm": 2.0795719623565674, "learning_rate": 2e-05, "loss": 1.0581, "step": 175 }, { "epoch": 0.06075250258888505, "grad_norm": 2.0180423259735107, "learning_rate": 2e-05, "loss": 1.0686, "step": 176 }, { "epoch": 0.06109768726268554, "grad_norm": 2.0913267135620117, "learning_rate": 2e-05, "loss": 1.117, "step": 177 }, { "epoch": 0.06144287193648602, "grad_norm": 2.0325934886932373, "learning_rate": 2e-05, "loss": 1.1526, "step": 178 }, { "epoch": 0.0617880566102865, "grad_norm": 2.222254991531372, "learning_rate": 2e-05, "loss": 1.113, "step": 179 }, { "epoch": 0.06213324128408699, "grad_norm": 2.2039270401000977, "learning_rate": 2e-05, "loss": 1.1886, "step": 180 }, { "epoch": 0.06247842595788747, "grad_norm": 2.0291781425476074, "learning_rate": 2e-05, "loss": 1.0884, "step": 181 }, { "epoch": 0.06282361063168795, "grad_norm": 2.2183430194854736, "learning_rate": 2e-05, "loss": 1.0223, "step": 182 }, { "epoch": 0.06316879530548844, "grad_norm": 2.37440824508667, "learning_rate": 2e-05, "loss": 1.0775, "step": 183 }, { "epoch": 0.06351397997928893, "grad_norm": 1.8214384317398071, "learning_rate": 2e-05, "loss": 1.1279, "step": 184 }, { "epoch": 0.0638591646530894, "grad_norm": 2.205291271209717, "learning_rate": 2e-05, "loss": 1.0396, "step": 185 }, { "epoch": 0.06420434932688988, "grad_norm": 2.137577533721924, "learning_rate": 2e-05, "loss": 1.0861, "step": 186 }, { "epoch": 0.06454953400069037, "grad_norm": 1.982663869857788, "learning_rate": 2e-05, "loss": 1.1612, "step": 187 }, { "epoch": 0.06489471867449086, "grad_norm": 21.140506744384766, "learning_rate": 2e-05, "loss": 1.0824, "step": 188 }, { "epoch": 0.06523990334829134, "grad_norm": 2.2611193656921387, "learning_rate": 2e-05, "loss": 1.0795, "step": 189 }, { "epoch": 0.06558508802209181, "grad_norm": 2.0905325412750244, "learning_rate": 2e-05, "loss": 1.1989, "step": 190 }, { "epoch": 0.0659302726958923, "grad_norm": 1.9430997371673584, "learning_rate": 2e-05, "loss": 1.0885, "step": 191 }, { "epoch": 0.06627545736969279, "grad_norm": 1.8876497745513916, "learning_rate": 2e-05, "loss": 1.0708, "step": 192 }, { "epoch": 0.06662064204349327, "grad_norm": 2.0716099739074707, "learning_rate": 2e-05, "loss": 1.124, "step": 193 }, { "epoch": 0.06696582671729376, "grad_norm": 2.413959503173828, "learning_rate": 2e-05, "loss": 1.1856, "step": 194 }, { "epoch": 0.06731101139109423, "grad_norm": 1.8021107912063599, "learning_rate": 2e-05, "loss": 1.1284, "step": 195 }, { "epoch": 0.06765619606489472, "grad_norm": 2.2795395851135254, "learning_rate": 2e-05, "loss": 1.1101, "step": 196 }, { "epoch": 0.0680013807386952, "grad_norm": 1.936448097229004, "learning_rate": 2e-05, "loss": 1.0921, "step": 197 }, { "epoch": 0.06834656541249569, "grad_norm": 1.940928339958191, "learning_rate": 2e-05, "loss": 1.1236, "step": 198 }, { "epoch": 0.06869175008629617, "grad_norm": 2.1147520542144775, "learning_rate": 2e-05, "loss": 1.0332, "step": 199 }, { "epoch": 0.06903693476009665, "grad_norm": 1.9784513711929321, "learning_rate": 2e-05, "loss": 1.0644, "step": 200 } ], "logging_steps": 1.0, "max_steps": 14485, "num_input_tokens_seen": 0, "num_train_epochs": 5, "save_steps": 200, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 82624433356800.0, "train_batch_size": 12, "trial_name": null, "trial_params": null }