{ "best_global_step": 2931, "best_metric": 0.8352677822113037, "best_model_checkpoint": "/workspace/MT_En_Ukrainian/checkpoint-2931", "epoch": 3.0, "eval_steps": 5000, "global_step": 2931, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.01024, "grad_norm": 2.453125, "learning_rate": 4.9977515176118345e-05, "loss": 1.942220687866211, "num_input_tokens_seen": 1145728, "step": 10, "train_runtime": 55.0006, "train_tokens_per_second": 20831.189 }, { "epoch": 0.02048, "grad_norm": 1.859375, "learning_rate": 4.9952567580506e-05, "loss": 1.3728597640991211, "num_input_tokens_seen": 2258496, "step": 20, "train_runtime": 104.7954, "train_tokens_per_second": 21551.485 }, { "epoch": 0.03072, "grad_norm": 1.7734375, "learning_rate": 4.992765730738634e-05, "loss": 1.2849248886108398, "num_input_tokens_seen": 3382784, "step": 30, "train_runtime": 157.2016, "train_tokens_per_second": 21518.764 }, { "epoch": 0.04096, "grad_norm": 1.6953125, "learning_rate": 4.9902784263792476e-05, "loss": 1.2331731796264649, "num_input_tokens_seen": 4511424, "step": 40, "train_runtime": 208.2613, "train_tokens_per_second": 21662.324 }, { "epoch": 0.0512, "grad_norm": 1.703125, "learning_rate": 4.987794835708133e-05, "loss": 1.2049736022949218, "num_input_tokens_seen": 5639296, "step": 50, "train_runtime": 259.7804, "train_tokens_per_second": 21707.936 }, { "epoch": 0.06144, "grad_norm": 1.6328125, "learning_rate": 4.985314949493234e-05, "loss": 1.1723523139953613, "num_input_tokens_seen": 6769920, "step": 60, "train_runtime": 312.433, "train_tokens_per_second": 21668.387 }, { "epoch": 0.07168, "grad_norm": 1.6171875, "learning_rate": 4.982838758534584e-05, "loss": 1.1766769409179687, "num_input_tokens_seen": 7888320, "step": 70, "train_runtime": 362.5602, "train_tokens_per_second": 21757.267 }, { "epoch": 0.08192, "grad_norm": 1.71875, "learning_rate": 4.980366253664179e-05, "loss": 1.1496356010437012, "num_input_tokens_seen": 8977472, "step": 80, "train_runtime": 410.6394, "train_tokens_per_second": 21862.179 }, { "epoch": 0.09216, "grad_norm": 1.7578125, "learning_rate": 4.977897425745825e-05, "loss": 1.137571430206299, "num_input_tokens_seen": 10075968, "step": 90, "train_runtime": 460.2896, "train_tokens_per_second": 21890.499 }, { "epoch": 0.1024, "grad_norm": 1.7421875, "learning_rate": 4.975432265674997e-05, "loss": 1.1251113891601563, "num_input_tokens_seen": 11202944, "step": 100, "train_runtime": 513.0638, "train_tokens_per_second": 21835.384 }, { "epoch": 0.11264, "grad_norm": 1.8125, "learning_rate": 4.972970764378705e-05, "loss": 1.1137601852416992, "num_input_tokens_seen": 12323840, "step": 110, "train_runtime": 563.4486, "train_tokens_per_second": 21872.164 }, { "epoch": 0.12288, "grad_norm": 1.6875, "learning_rate": 4.970512912815344e-05, "loss": 1.1156309127807618, "num_input_tokens_seen": 13415296, "step": 120, "train_runtime": 611.3984, "train_tokens_per_second": 21941.987 }, { "epoch": 0.13312, "grad_norm": 1.625, "learning_rate": 4.968058701974564e-05, "loss": 1.0775527954101562, "num_input_tokens_seen": 14525376, "step": 130, "train_runtime": 661.1947, "train_tokens_per_second": 21968.378 }, { "epoch": 0.14336, "grad_norm": 1.5078125, "learning_rate": 4.96560812287712e-05, "loss": 1.0942869186401367, "num_input_tokens_seen": 15666688, "step": 140, "train_runtime": 713.2845, "train_tokens_per_second": 21964.151 }, { "epoch": 0.1536, "grad_norm": 1.6484375, "learning_rate": 4.963161166574748e-05, "loss": 1.0775710105895997, "num_input_tokens_seen": 16793216, "step": 150, "train_runtime": 764.6867, "train_tokens_per_second": 21960.91 }, { "epoch": 0.16384, "grad_norm": 1.609375, "learning_rate": 4.960717824150013e-05, "loss": 1.085141944885254, "num_input_tokens_seen": 17913856, "step": 160, "train_runtime": 815.3899, "train_tokens_per_second": 21969.68 }, { "epoch": 0.17408, "grad_norm": 1.6171875, "learning_rate": 4.9582780867161893e-05, "loss": 1.0794735908508302, "num_input_tokens_seen": 19033472, "step": 170, "train_runtime": 867.281, "train_tokens_per_second": 21946.141 }, { "epoch": 0.18432, "grad_norm": 1.6328125, "learning_rate": 4.955841945417105e-05, "loss": 1.045860481262207, "num_input_tokens_seen": 20146688, "step": 180, "train_runtime": 918.094, "train_tokens_per_second": 21944.036 }, { "epoch": 0.19456, "grad_norm": 1.6953125, "learning_rate": 4.953409391427024e-05, "loss": 1.0552400588989257, "num_input_tokens_seen": 21293184, "step": 190, "train_runtime": 971.8022, "train_tokens_per_second": 21911.027 }, { "epoch": 0.2048, "grad_norm": 1.6015625, "learning_rate": 4.950980415950502e-05, "loss": 1.0574710845947266, "num_input_tokens_seen": 22405824, "step": 200, "train_runtime": 1021.2273, "train_tokens_per_second": 21940.094 }, { "epoch": 0.21504, "grad_norm": 1.5078125, "learning_rate": 4.9485550102222575e-05, "loss": 1.047713565826416, "num_input_tokens_seen": 23526720, "step": 210, "train_runtime": 1072.7388, "train_tokens_per_second": 21931.452 }, { "epoch": 0.22528, "grad_norm": 1.546875, "learning_rate": 4.946133165507037e-05, "loss": 1.037226676940918, "num_input_tokens_seen": 24651328, "step": 220, "train_runtime": 1124.4387, "train_tokens_per_second": 21923.229 }, { "epoch": 0.23552, "grad_norm": 1.6171875, "learning_rate": 4.943714873099483e-05, "loss": 1.035720443725586, "num_input_tokens_seen": 25753088, "step": 230, "train_runtime": 1173.7005, "train_tokens_per_second": 21941.788 }, { "epoch": 0.24576, "grad_norm": 1.546875, "learning_rate": 4.9413001243240024e-05, "loss": 1.0342046737670898, "num_input_tokens_seen": 26905856, "step": 240, "train_runtime": 1226.2471, "train_tokens_per_second": 21941.627 }, { "epoch": 0.256, "grad_norm": 1.484375, "learning_rate": 4.938888910534637e-05, "loss": 1.0358741760253907, "num_input_tokens_seen": 28028864, "step": 250, "train_runtime": 1276.4532, "train_tokens_per_second": 21958.396 }, { "epoch": 0.26624, "grad_norm": 1.46875, "learning_rate": 4.936481223114932e-05, "loss": 1.038590431213379, "num_input_tokens_seen": 29126976, "step": 260, "train_runtime": 1327.1722, "train_tokens_per_second": 21946.643 }, { "epoch": 0.27648, "grad_norm": 1.59375, "learning_rate": 4.934077053477808e-05, "loss": 1.0328522682189942, "num_input_tokens_seen": 30254208, "step": 270, "train_runtime": 1378.9466, "train_tokens_per_second": 21940.087 }, { "epoch": 0.28672, "grad_norm": 1.59375, "learning_rate": 4.931676393065431e-05, "loss": 1.0223213195800782, "num_input_tokens_seen": 31405888, "step": 280, "train_runtime": 1432.0252, "train_tokens_per_second": 21931.1 }, { "epoch": 0.29696, "grad_norm": 1.4609375, "learning_rate": 4.929279233349088e-05, "loss": 1.0172260284423829, "num_input_tokens_seen": 32506432, "step": 290, "train_runtime": 1481.5865, "train_tokens_per_second": 21940.286 }, { "epoch": 0.3072, "grad_norm": 1.5625, "learning_rate": 4.926885565829051e-05, "loss": 1.016135025024414, "num_input_tokens_seen": 33610176, "step": 300, "train_runtime": 1531.0711, "train_tokens_per_second": 21952.067 }, { "epoch": 0.31744, "grad_norm": 1.4453125, "learning_rate": 4.924495382034461e-05, "loss": 1.0107959747314452, "num_input_tokens_seen": 34707264, "step": 310, "train_runtime": 1580.5249, "train_tokens_per_second": 21959.327 }, { "epoch": 0.32768, "grad_norm": 1.5078125, "learning_rate": 4.9221086735231975e-05, "loss": 1.002080535888672, "num_input_tokens_seen": 35822272, "step": 320, "train_runtime": 1631.8076, "train_tokens_per_second": 21952.51 }, { "epoch": 0.33792, "grad_norm": 1.5703125, "learning_rate": 4.919725431881751e-05, "loss": 1.0000602722167968, "num_input_tokens_seen": 36959680, "step": 330, "train_runtime": 1685.6469, "train_tokens_per_second": 21926.11 }, { "epoch": 0.34816, "grad_norm": 1.5390625, "learning_rate": 4.917345648725101e-05, "loss": 1.0111896514892578, "num_input_tokens_seen": 38092160, "step": 340, "train_runtime": 1736.6097, "train_tokens_per_second": 21934.785 }, { "epoch": 0.3584, "grad_norm": 1.4453125, "learning_rate": 4.914969315696596e-05, "loss": 1.010312271118164, "num_input_tokens_seen": 39182848, "step": 350, "train_runtime": 1785.0368, "train_tokens_per_second": 21950.723 }, { "epoch": 0.36864, "grad_norm": 1.5625, "learning_rate": 4.912596424467818e-05, "loss": 0.9806657791137695, "num_input_tokens_seen": 40318272, "step": 360, "train_runtime": 1838.6514, "train_tokens_per_second": 21928.176 }, { "epoch": 0.37888, "grad_norm": 1.390625, "learning_rate": 4.910226966738475e-05, "loss": 0.9908489227294922, "num_input_tokens_seen": 41443072, "step": 370, "train_runtime": 1888.8124, "train_tokens_per_second": 21941.338 }, { "epoch": 0.38912, "grad_norm": 1.421875, "learning_rate": 4.9078609342362666e-05, "loss": 0.973599624633789, "num_input_tokens_seen": 42587392, "step": 380, "train_runtime": 1944.2016, "train_tokens_per_second": 21904.823 }, { "epoch": 0.39936, "grad_norm": 1.5703125, "learning_rate": 4.905498318716775e-05, "loss": 0.9856637954711914, "num_input_tokens_seen": 43704832, "step": 390, "train_runtime": 1994.7284, "train_tokens_per_second": 21910.167 }, { "epoch": 0.4096, "grad_norm": 1.46875, "learning_rate": 4.9031391119633295e-05, "loss": 0.9691889762878418, "num_input_tokens_seen": 44831360, "step": 400, "train_runtime": 2045.3596, "train_tokens_per_second": 21918.571 }, { "epoch": 0.41984, "grad_norm": 1.546875, "learning_rate": 4.9007833057869e-05, "loss": 0.9910012245178222, "num_input_tokens_seen": 45943168, "step": 410, "train_runtime": 2095.8494, "train_tokens_per_second": 21921.025 }, { "epoch": 0.43008, "grad_norm": 1.5, "learning_rate": 4.898430892025967e-05, "loss": 0.9832890510559082, "num_input_tokens_seen": 47060288, "step": 420, "train_runtime": 2146.7011, "train_tokens_per_second": 21922.143 }, { "epoch": 0.44032, "grad_norm": 1.4453125, "learning_rate": 4.896081862546415e-05, "loss": 0.9752557754516602, "num_input_tokens_seen": 48185472, "step": 430, "train_runtime": 2198.7956, "train_tokens_per_second": 21914.485 }, { "epoch": 0.45056, "grad_norm": 1.453125, "learning_rate": 4.8937362092414e-05, "loss": 0.9778125762939454, "num_input_tokens_seen": 49256448, "step": 440, "train_runtime": 2246.1336, "train_tokens_per_second": 21929.438 }, { "epoch": 0.4608, "grad_norm": 1.4921875, "learning_rate": 4.891393924031244e-05, "loss": 0.9636163711547852, "num_input_tokens_seen": 50374592, "step": 450, "train_runtime": 2296.6263, "train_tokens_per_second": 21934.17 }, { "epoch": 0.47104, "grad_norm": 1.515625, "learning_rate": 4.8890549988633095e-05, "loss": 0.9704037666320801, "num_input_tokens_seen": 51485248, "step": 460, "train_runtime": 2346.8324, "train_tokens_per_second": 21938.187 }, { "epoch": 0.48128, "grad_norm": 1.453125, "learning_rate": 4.8867194257118907e-05, "loss": 0.9702651977539063, "num_input_tokens_seen": 52604160, "step": 470, "train_runtime": 2397.7165, "train_tokens_per_second": 21939.274 }, { "epoch": 0.49152, "grad_norm": 1.4609375, "learning_rate": 4.884387196578093e-05, "loss": 0.9792324066162109, "num_input_tokens_seen": 53710144, "step": 480, "train_runtime": 2448.6532, "train_tokens_per_second": 21934.566 }, { "epoch": 0.50176, "grad_norm": 1.4140625, "learning_rate": 4.882058303489718e-05, "loss": 0.9673162460327148, "num_input_tokens_seen": 54830272, "step": 490, "train_runtime": 2500.2972, "train_tokens_per_second": 21929.502 }, { "epoch": 0.512, "grad_norm": 1.5703125, "learning_rate": 4.8797327385011496e-05, "loss": 0.9507923126220703, "num_input_tokens_seen": 55928384, "step": 500, "train_runtime": 2549.596, "train_tokens_per_second": 21936.175 }, { "epoch": 0.52224, "grad_norm": 1.53125, "learning_rate": 4.8774104936932425e-05, "loss": 0.9491652488708496, "num_input_tokens_seen": 57048704, "step": 510, "train_runtime": 2597.7871, "train_tokens_per_second": 21960.5 }, { "epoch": 0.53248, "grad_norm": 1.4375, "learning_rate": 4.8750915611732076e-05, "loss": 0.9639401435852051, "num_input_tokens_seen": 58140160, "step": 520, "train_runtime": 2646.0597, "train_tokens_per_second": 21972.353 }, { "epoch": 0.54272, "grad_norm": 1.5625, "learning_rate": 4.8727759330744986e-05, "loss": 0.9479743957519531, "num_input_tokens_seen": 59267200, "step": 530, "train_runtime": 2698.4747, "train_tokens_per_second": 21963.222 }, { "epoch": 0.55296, "grad_norm": 1.375, "learning_rate": 4.870463601556696e-05, "loss": 0.9524721145629883, "num_input_tokens_seen": 60421504, "step": 540, "train_runtime": 2750.3842, "train_tokens_per_second": 21968.387 }, { "epoch": 0.5632, "grad_norm": 1.4140625, "learning_rate": 4.8681545588054075e-05, "loss": 0.962583065032959, "num_input_tokens_seen": 61505280, "step": 550, "train_runtime": 2798.047, "train_tokens_per_second": 21981.504 }, { "epoch": 0.57344, "grad_norm": 1.4296875, "learning_rate": 4.8658487970321404e-05, "loss": 0.9441762924194336, "num_input_tokens_seen": 62611136, "step": 560, "train_runtime": 2847.1648, "train_tokens_per_second": 21990.696 }, { "epoch": 0.58368, "grad_norm": 1.4453125, "learning_rate": 4.863546308474209e-05, "loss": 0.9428766250610352, "num_input_tokens_seen": 63731712, "step": 570, "train_runtime": 2898.5894, "train_tokens_per_second": 21987.147 }, { "epoch": 0.59392, "grad_norm": 1.4296875, "learning_rate": 4.86124708539461e-05, "loss": 0.9273331642150879, "num_input_tokens_seen": 64828608, "step": 580, "train_runtime": 2948.7617, "train_tokens_per_second": 21985.028 }, { "epoch": 0.60416, "grad_norm": 1.4453125, "learning_rate": 4.8589511200819216e-05, "loss": 0.9427030563354493, "num_input_tokens_seen": 65924608, "step": 590, "train_runtime": 2996.6383, "train_tokens_per_second": 21999.521 }, { "epoch": 0.6144, "grad_norm": 1.4375, "learning_rate": 4.8566584048501926e-05, "loss": 0.9379173278808594, "num_input_tokens_seen": 67042624, "step": 600, "train_runtime": 3048.7405, "train_tokens_per_second": 21990.269 }, { "epoch": 0.62464, "grad_norm": 1.34375, "learning_rate": 4.854368932038835e-05, "loss": 0.9400325775146484, "num_input_tokens_seen": 68149376, "step": 610, "train_runtime": 3097.9096, "train_tokens_per_second": 21998.503 }, { "epoch": 0.63488, "grad_norm": 1.5234375, "learning_rate": 4.8520826940125144e-05, "loss": 0.9410287857055664, "num_input_tokens_seen": 69264256, "step": 620, "train_runtime": 3149.7216, "train_tokens_per_second": 21990.596 }, { "epoch": 0.64512, "grad_norm": 1.40625, "learning_rate": 4.849799683161046e-05, "loss": 0.9263475418090821, "num_input_tokens_seen": 70435904, "step": 630, "train_runtime": 3202.5382, "train_tokens_per_second": 21993.775 }, { "epoch": 0.65536, "grad_norm": 1.4375, "learning_rate": 4.8475198918992835e-05, "loss": 0.9329448699951172, "num_input_tokens_seen": 71552896, "step": 640, "train_runtime": 3253.1308, "train_tokens_per_second": 21995.088 }, { "epoch": 0.6656, "grad_norm": 1.3203125, "learning_rate": 4.845243312667023e-05, "loss": 0.9400642395019532, "num_input_tokens_seen": 72646400, "step": 650, "train_runtime": 3302.0912, "train_tokens_per_second": 22000.119 }, { "epoch": 0.67584, "grad_norm": 1.4375, "learning_rate": 4.842969937928884e-05, "loss": 0.9307914733886719, "num_input_tokens_seen": 73760192, "step": 660, "train_runtime": 3351.4596, "train_tokens_per_second": 22008.379 }, { "epoch": 0.68608, "grad_norm": 1.421875, "learning_rate": 4.840699760174217e-05, "loss": 0.9233476638793945, "num_input_tokens_seen": 74882496, "step": 670, "train_runtime": 3402.821, "train_tokens_per_second": 22006.005 }, { "epoch": 0.69632, "grad_norm": 1.34375, "learning_rate": 4.8384327719169906e-05, "loss": 0.9302739143371582, "num_input_tokens_seen": 76004736, "step": 680, "train_runtime": 3455.3873, "train_tokens_per_second": 21996.011 }, { "epoch": 0.70656, "grad_norm": 1.40625, "learning_rate": 4.836168965695694e-05, "loss": 0.9305820465087891, "num_input_tokens_seen": 77100736, "step": 690, "train_runtime": 3503.451, "train_tokens_per_second": 22007.083 }, { "epoch": 0.7168, "grad_norm": 1.390625, "learning_rate": 4.8339083340732304e-05, "loss": 0.9203786849975586, "num_input_tokens_seen": 78219136, "step": 700, "train_runtime": 3553.2121, "train_tokens_per_second": 22013.641 }, { "epoch": 0.72704, "grad_norm": 1.484375, "learning_rate": 4.8316508696368154e-05, "loss": 0.9239031791687011, "num_input_tokens_seen": 79310848, "step": 710, "train_runtime": 3602.0368, "train_tokens_per_second": 22018.334 }, { "epoch": 0.73728, "grad_norm": 1.3828125, "learning_rate": 4.8293965649978714e-05, "loss": 0.9024551391601563, "num_input_tokens_seen": 80425728, "step": 720, "train_runtime": 3653.6123, "train_tokens_per_second": 22012.66 }, { "epoch": 0.74752, "grad_norm": 1.4453125, "learning_rate": 4.8271454127919364e-05, "loss": 0.9112434387207031, "num_input_tokens_seen": 81496320, "step": 730, "train_runtime": 3699.8035, "train_tokens_per_second": 22027.202 }, { "epoch": 0.75776, "grad_norm": 1.390625, "learning_rate": 4.824897405678549e-05, "loss": 0.9149089813232422, "num_input_tokens_seen": 82645120, "step": 740, "train_runtime": 3753.9121, "train_tokens_per_second": 22015.731 }, { "epoch": 0.768, "grad_norm": 1.359375, "learning_rate": 4.8226525363411576e-05, "loss": 0.9063904762268067, "num_input_tokens_seen": 83764288, "step": 750, "train_runtime": 3806.5124, "train_tokens_per_second": 22005.521 }, { "epoch": 0.77824, "grad_norm": 1.453125, "learning_rate": 4.820410797487017e-05, "loss": 0.9081829071044922, "num_input_tokens_seen": 84887744, "step": 760, "train_runtime": 3859.7215, "train_tokens_per_second": 21993.23 }, { "epoch": 0.78848, "grad_norm": 1.359375, "learning_rate": 4.818172181847091e-05, "loss": 0.8958653450012207, "num_input_tokens_seen": 86004992, "step": 770, "train_runtime": 3911.8203, "train_tokens_per_second": 21985.926 }, { "epoch": 0.79872, "grad_norm": 1.46875, "learning_rate": 4.81593668217595e-05, "loss": 0.9148517608642578, "num_input_tokens_seen": 87105216, "step": 780, "train_runtime": 3961.6794, "train_tokens_per_second": 21986.942 }, { "epoch": 0.80896, "grad_norm": 1.40625, "learning_rate": 4.813704291251675e-05, "loss": 0.9078433990478516, "num_input_tokens_seen": 88239680, "step": 790, "train_runtime": 4013.5881, "train_tokens_per_second": 21985.236 }, { "epoch": 0.8192, "grad_norm": 1.421875, "learning_rate": 4.811475001875759e-05, "loss": 0.9124856948852539, "num_input_tokens_seen": 89349568, "step": 800, "train_runtime": 4062.7697, "train_tokens_per_second": 21992.28 }, { "epoch": 0.82944, "grad_norm": 1.4375, "learning_rate": 4.8092488068730105e-05, "loss": 0.9061111450195313, "num_input_tokens_seen": 90469312, "step": 810, "train_runtime": 4115.7452, "train_tokens_per_second": 21981.271 }, { "epoch": 0.83968, "grad_norm": 1.3984375, "learning_rate": 4.807025699091452e-05, "loss": 0.8909177780151367, "num_input_tokens_seen": 91591424, "step": 820, "train_runtime": 4167.5795, "train_tokens_per_second": 21977.127 }, { "epoch": 0.84992, "grad_norm": 1.4609375, "learning_rate": 4.8048056714022325e-05, "loss": 0.8970900535583496, "num_input_tokens_seen": 92718336, "step": 830, "train_runtime": 4219.1054, "train_tokens_per_second": 21975.828 }, { "epoch": 0.86016, "grad_norm": 1.3984375, "learning_rate": 4.802588716699519e-05, "loss": 0.9085554122924805, "num_input_tokens_seen": 93814400, "step": 840, "train_runtime": 4268.8362, "train_tokens_per_second": 21976.575 }, { "epoch": 0.8704, "grad_norm": 1.3359375, "learning_rate": 4.8003748279004156e-05, "loss": 0.8963174819946289, "num_input_tokens_seen": 94937408, "step": 850, "train_runtime": 4321.9061, "train_tokens_per_second": 21966.56 }, { "epoch": 0.88064, "grad_norm": 1.4765625, "learning_rate": 4.798163997944854e-05, "loss": 0.9105907440185547, "num_input_tokens_seen": 96048512, "step": 860, "train_runtime": 4371.8613, "train_tokens_per_second": 21969.707 }, { "epoch": 0.89088, "grad_norm": 1.4609375, "learning_rate": 4.79595621979551e-05, "loss": 0.877834415435791, "num_input_tokens_seen": 97193472, "step": 870, "train_runtime": 4425.9231, "train_tokens_per_second": 21960.046 }, { "epoch": 0.90112, "grad_norm": 1.3828125, "learning_rate": 4.793751486437702e-05, "loss": 0.8991375923156738, "num_input_tokens_seen": 98317184, "step": 880, "train_runtime": 4476.7825, "train_tokens_per_second": 21961.573 }, { "epoch": 0.91136, "grad_norm": 1.515625, "learning_rate": 4.7915497908793064e-05, "loss": 0.8886856079101563, "num_input_tokens_seen": 99450688, "step": 890, "train_runtime": 4529.0422, "train_tokens_per_second": 21958.437 }, { "epoch": 0.9216, "grad_norm": 1.3515625, "learning_rate": 4.7893511261506516e-05, "loss": 0.902672004699707, "num_input_tokens_seen": 100563840, "step": 900, "train_runtime": 4579.192, "train_tokens_per_second": 21961.045 }, { "epoch": 0.93184, "grad_norm": 1.4453125, "learning_rate": 4.787155485304435e-05, "loss": 0.8937115669250488, "num_input_tokens_seen": 101656640, "step": 910, "train_runtime": 4627.8649, "train_tokens_per_second": 21966.208 }, { "epoch": 0.94208, "grad_norm": 1.375, "learning_rate": 4.784962861415629e-05, "loss": 0.9013708114624024, "num_input_tokens_seen": 102780288, "step": 920, "train_runtime": 4679.0445, "train_tokens_per_second": 21966.085 }, { "epoch": 0.95232, "grad_norm": 1.296875, "learning_rate": 4.7827732475813884e-05, "loss": 0.8749137878417969, "num_input_tokens_seen": 103933056, "step": 930, "train_runtime": 4732.6015, "train_tokens_per_second": 21961.083 }, { "epoch": 0.96256, "grad_norm": 1.3984375, "learning_rate": 4.7805866369209576e-05, "loss": 0.8961335182189941, "num_input_tokens_seen": 105038016, "step": 940, "train_runtime": 4782.7459, "train_tokens_per_second": 21961.864 }, { "epoch": 0.9728, "grad_norm": 1.3515625, "learning_rate": 4.778403022575583e-05, "loss": 0.874142074584961, "num_input_tokens_seen": 106174336, "step": 950, "train_runtime": 4836.32, "train_tokens_per_second": 21953.538 }, { "epoch": 0.98304, "grad_norm": 1.390625, "learning_rate": 4.7762223977084195e-05, "loss": 0.8942262649536132, "num_input_tokens_seen": 107277440, "step": 960, "train_runtime": 4886.8487, "train_tokens_per_second": 21952.273 }, { "epoch": 0.99328, "grad_norm": 1.3125, "learning_rate": 4.774044755504444e-05, "loss": 0.8799090385437012, "num_input_tokens_seen": 108394496, "step": 970, "train_runtime": 4938.6396, "train_tokens_per_second": 21948.25 }, { "epoch": 1.003072, "grad_norm": 1.25, "learning_rate": 4.7718700891703616e-05, "loss": 0.8489143371582031, "num_input_tokens_seen": 109453888, "step": 980, "train_runtime": 4987.1553, "train_tokens_per_second": 21947.158 }, { "epoch": 1.013312, "grad_norm": 1.40625, "learning_rate": 4.7696983919345215e-05, "loss": 0.7443439483642578, "num_input_tokens_seen": 110580736, "step": 990, "train_runtime": 5038.9713, "train_tokens_per_second": 21945.101 }, { "epoch": 1.023552, "grad_norm": 1.3671875, "learning_rate": 4.7675296570468216e-05, "loss": 0.7479698181152343, "num_input_tokens_seen": 111723136, "step": 1000, "train_runtime": 5092.4363, "train_tokens_per_second": 21939.034 }, { "epoch": 1.033792, "grad_norm": 1.5, "learning_rate": 4.76536387777863e-05, "loss": 0.7372268676757813, "num_input_tokens_seen": 112836800, "step": 1010, "train_runtime": 5144.5655, "train_tokens_per_second": 21933.203 }, { "epoch": 1.044032, "grad_norm": 1.3828125, "learning_rate": 4.7632010474226915e-05, "loss": 0.7579574584960938, "num_input_tokens_seen": 113961088, "step": 1020, "train_runtime": 5195.725, "train_tokens_per_second": 21933.626 }, { "epoch": 1.054272, "grad_norm": 1.59375, "learning_rate": 4.761041159293035e-05, "loss": 0.7489605903625488, "num_input_tokens_seen": 115089984, "step": 1030, "train_runtime": 5247.5552, "train_tokens_per_second": 21932.115 }, { "epoch": 1.064512, "grad_norm": 1.4140625, "learning_rate": 4.7588842067249e-05, "loss": 0.7482340812683106, "num_input_tokens_seen": 116217216, "step": 1040, "train_runtime": 5299.9058, "train_tokens_per_second": 21928.167 }, { "epoch": 1.074752, "grad_norm": 1.5078125, "learning_rate": 4.756730183074637e-05, "loss": 0.7579518318176269, "num_input_tokens_seen": 117347648, "step": 1050, "train_runtime": 5351.066, "train_tokens_per_second": 21929.77 }, { "epoch": 1.084992, "grad_norm": 1.4921875, "learning_rate": 4.7545790817196314e-05, "loss": 0.7438392639160156, "num_input_tokens_seen": 118493632, "step": 1060, "train_runtime": 5405.5478, "train_tokens_per_second": 21920.744 }, { "epoch": 1.095232, "grad_norm": 1.4296875, "learning_rate": 4.752430896058212e-05, "loss": 0.7573630332946777, "num_input_tokens_seen": 119595776, "step": 1070, "train_runtime": 5455.0034, "train_tokens_per_second": 21924.052 }, { "epoch": 1.105472, "grad_norm": 1.4765625, "learning_rate": 4.750285619509567e-05, "loss": 0.7446182250976563, "num_input_tokens_seen": 120728576, "step": 1080, "train_runtime": 5507.7373, "train_tokens_per_second": 21919.814 }, { "epoch": 1.115712, "grad_norm": 1.40625, "learning_rate": 4.7481432455136644e-05, "loss": 0.7489546775817871, "num_input_tokens_seen": 121851968, "step": 1090, "train_runtime": 5559.0243, "train_tokens_per_second": 21919.668 }, { "epoch": 1.125952, "grad_norm": 1.4609375, "learning_rate": 4.7460037675311584e-05, "loss": 0.757651948928833, "num_input_tokens_seen": 122954752, "step": 1100, "train_runtime": 5608.2123, "train_tokens_per_second": 21924.054 }, { "epoch": 1.136192, "grad_norm": 1.375, "learning_rate": 4.7438671790433126e-05, "loss": 0.7577178955078125, "num_input_tokens_seen": 124052416, "step": 1110, "train_runtime": 5657.5424, "train_tokens_per_second": 21926.909 }, { "epoch": 1.146432, "grad_norm": 1.4296875, "learning_rate": 4.741733473551915e-05, "loss": 0.7523440361022949, "num_input_tokens_seen": 125165248, "step": 1120, "train_runtime": 5707.4101, "train_tokens_per_second": 21930.306 }, { "epoch": 1.156672, "grad_norm": 1.4375, "learning_rate": 4.7396026445791966e-05, "loss": 0.7425838470458984, "num_input_tokens_seen": 126283840, "step": 1130, "train_runtime": 5759.366, "train_tokens_per_second": 21926.691 }, { "epoch": 1.166912, "grad_norm": 1.4609375, "learning_rate": 4.737474685667742e-05, "loss": 0.7449512004852294, "num_input_tokens_seen": 127421952, "step": 1140, "train_runtime": 5811.4353, "train_tokens_per_second": 21926.072 }, { "epoch": 1.177152, "grad_norm": 1.4140625, "learning_rate": 4.7353495903804165e-05, "loss": 0.761650562286377, "num_input_tokens_seen": 128504576, "step": 1150, "train_runtime": 5859.1852, "train_tokens_per_second": 21932.158 }, { "epoch": 1.187392, "grad_norm": 1.484375, "learning_rate": 4.733227352300277e-05, "loss": 0.7624397277832031, "num_input_tokens_seen": 129617728, "step": 1160, "train_runtime": 5908.742, "train_tokens_per_second": 21936.603 }, { "epoch": 1.197632, "grad_norm": 1.5234375, "learning_rate": 4.731107965030496e-05, "loss": 0.756078052520752, "num_input_tokens_seen": 130713728, "step": 1170, "train_runtime": 5959.2042, "train_tokens_per_second": 21934.762 }, { "epoch": 1.207872, "grad_norm": 1.3515625, "learning_rate": 4.728991422194278e-05, "loss": 0.7492989063262939, "num_input_tokens_seen": 131802368, "step": 1180, "train_runtime": 6008.2874, "train_tokens_per_second": 21936.762 }, { "epoch": 1.218112, "grad_norm": 1.4375, "learning_rate": 4.726877717434773e-05, "loss": 0.7438122749328613, "num_input_tokens_seen": 132905472, "step": 1190, "train_runtime": 6057.8828, "train_tokens_per_second": 21939.261 }, { "epoch": 1.228352, "grad_norm": 1.3671875, "learning_rate": 4.724766844415013e-05, "loss": 0.7444162368774414, "num_input_tokens_seen": 134023296, "step": 1200, "train_runtime": 6107.5979, "train_tokens_per_second": 21943.7 }, { "epoch": 1.238592, "grad_norm": 1.390625, "learning_rate": 4.722658796817813e-05, "loss": 0.7356367588043213, "num_input_tokens_seen": 135165312, "step": 1210, "train_runtime": 6160.1499, "train_tokens_per_second": 21941.887 }, { "epoch": 1.248832, "grad_norm": 1.359375, "learning_rate": 4.7205535683457044e-05, "loss": 0.7440855026245117, "num_input_tokens_seen": 136319808, "step": 1220, "train_runtime": 6214.3559, "train_tokens_per_second": 21936.273 }, { "epoch": 1.259072, "grad_norm": 1.453125, "learning_rate": 4.7184511527208484e-05, "loss": 0.7333660125732422, "num_input_tokens_seen": 137441088, "step": 1230, "train_runtime": 6264.8424, "train_tokens_per_second": 21938.475 }, { "epoch": 1.269312, "grad_norm": 1.5390625, "learning_rate": 4.7163515436849644e-05, "loss": 0.7524197101593018, "num_input_tokens_seen": 138549568, "step": 1240, "train_runtime": 6313.7128, "train_tokens_per_second": 21944.23 }, { "epoch": 1.279552, "grad_norm": 1.484375, "learning_rate": 4.714254734999245e-05, "loss": 0.7486214637756348, "num_input_tokens_seen": 139628416, "step": 1250, "train_runtime": 6361.0684, "train_tokens_per_second": 21950.466 }, { "epoch": 1.289792, "grad_norm": 1.578125, "learning_rate": 4.712160720444284e-05, "loss": 0.7422505378723144, "num_input_tokens_seen": 140751552, "step": 1260, "train_runtime": 6412.2087, "train_tokens_per_second": 21950.557 }, { "epoch": 1.300032, "grad_norm": 1.4921875, "learning_rate": 4.710069493819992e-05, "loss": 0.7394045352935791, "num_input_tokens_seen": 141875392, "step": 1270, "train_runtime": 6463.2897, "train_tokens_per_second": 21950.957 }, { "epoch": 1.3102719999999999, "grad_norm": 1.4375, "learning_rate": 4.70798104894553e-05, "loss": 0.7524402618408204, "num_input_tokens_seen": 142968768, "step": 1280, "train_runtime": 6512.8407, "train_tokens_per_second": 21951.829 }, { "epoch": 1.320512, "grad_norm": 1.3671875, "learning_rate": 4.705895379659219e-05, "loss": 0.73507719039917, "num_input_tokens_seen": 144088448, "step": 1290, "train_runtime": 6563.9326, "train_tokens_per_second": 21951.543 }, { "epoch": 1.330752, "grad_norm": 1.4140625, "learning_rate": 4.7038124798184766e-05, "loss": 0.744103193283081, "num_input_tokens_seen": 145166528, "step": 1300, "train_runtime": 6612.2717, "train_tokens_per_second": 21954.108 }, { "epoch": 1.340992, "grad_norm": 1.4609375, "learning_rate": 4.7017323432997304e-05, "loss": 0.7421403884887695, "num_input_tokens_seen": 146277888, "step": 1310, "train_runtime": 6663.7474, "train_tokens_per_second": 21951.296 }, { "epoch": 1.351232, "grad_norm": 1.4453125, "learning_rate": 4.6996549639983506e-05, "loss": 0.7422142505645752, "num_input_tokens_seen": 147402112, "step": 1320, "train_runtime": 6713.9776, "train_tokens_per_second": 21954.513 }, { "epoch": 1.361472, "grad_norm": 1.4140625, "learning_rate": 4.697580335828569e-05, "loss": 0.747988224029541, "num_input_tokens_seen": 148498816, "step": 1330, "train_runtime": 6762.7236, "train_tokens_per_second": 21958.433 }, { "epoch": 1.371712, "grad_norm": 1.4140625, "learning_rate": 4.6955084527234076e-05, "loss": 0.7415881633758545, "num_input_tokens_seen": 149633024, "step": 1340, "train_runtime": 6813.6204, "train_tokens_per_second": 21960.869 }, { "epoch": 1.381952, "grad_norm": 1.3984375, "learning_rate": 4.6934393086346034e-05, "loss": 0.7278687953948975, "num_input_tokens_seen": 150743424, "step": 1350, "train_runtime": 6865.1777, "train_tokens_per_second": 21957.687 }, { "epoch": 1.392192, "grad_norm": 1.484375, "learning_rate": 4.6913728975325324e-05, "loss": 0.7370668411254883, "num_input_tokens_seen": 151865536, "step": 1360, "train_runtime": 6915.0272, "train_tokens_per_second": 21961.669 }, { "epoch": 1.4024320000000001, "grad_norm": 1.4765625, "learning_rate": 4.6893092134061393e-05, "loss": 0.7397951126098633, "num_input_tokens_seen": 152997504, "step": 1370, "train_runtime": 6966.2008, "train_tokens_per_second": 21962.833 }, { "epoch": 1.412672, "grad_norm": 1.4453125, "learning_rate": 4.687248250262859e-05, "loss": 0.7369170188903809, "num_input_tokens_seen": 154098752, "step": 1380, "train_runtime": 7017.463, "train_tokens_per_second": 21959.325 }, { "epoch": 1.422912, "grad_norm": 1.4453125, "learning_rate": 4.685190002128548e-05, "loss": 0.7380311965942383, "num_input_tokens_seen": 155218880, "step": 1390, "train_runtime": 7069.234, "train_tokens_per_second": 21956.959 }, { "epoch": 1.433152, "grad_norm": 1.3359375, "learning_rate": 4.6831344630474114e-05, "loss": 0.719688892364502, "num_input_tokens_seen": 156365696, "step": 1400, "train_runtime": 7121.6519, "train_tokens_per_second": 21956.38 }, { "epoch": 1.443392, "grad_norm": 1.4765625, "learning_rate": 4.6810816270819276e-05, "loss": 0.7329507827758789, "num_input_tokens_seen": 157494784, "step": 1410, "train_runtime": 7171.9905, "train_tokens_per_second": 21959.703 }, { "epoch": 1.453632, "grad_norm": 1.421875, "learning_rate": 4.679031488312777e-05, "loss": 0.7250077247619628, "num_input_tokens_seen": 158633216, "step": 1420, "train_runtime": 7223.042, "train_tokens_per_second": 21962.106 }, { "epoch": 1.463872, "grad_norm": 1.4453125, "learning_rate": 4.6769840408387717e-05, "loss": 0.7379475116729737, "num_input_tokens_seen": 159750208, "step": 1430, "train_runtime": 7274.4145, "train_tokens_per_second": 21960.559 }, { "epoch": 1.4741119999999999, "grad_norm": 1.46875, "learning_rate": 4.674939278776787e-05, "loss": 0.7261748313903809, "num_input_tokens_seen": 160865344, "step": 1440, "train_runtime": 7324.4445, "train_tokens_per_second": 21962.805 }, { "epoch": 1.484352, "grad_norm": 1.390625, "learning_rate": 4.672897196261683e-05, "loss": 0.718736219406128, "num_input_tokens_seen": 162000640, "step": 1450, "train_runtime": 7376.9389, "train_tokens_per_second": 21960.415 }, { "epoch": 1.494592, "grad_norm": 1.421875, "learning_rate": 4.670857787446238e-05, "loss": 0.7371679782867432, "num_input_tokens_seen": 163120704, "step": 1460, "train_runtime": 7426.1512, "train_tokens_per_second": 21965.713 }, { "epoch": 1.504832, "grad_norm": 1.3984375, "learning_rate": 4.668821046501082e-05, "loss": 0.7367044448852539, "num_input_tokens_seen": 164228160, "step": 1470, "train_runtime": 7474.0997, "train_tokens_per_second": 21972.969 }, { "epoch": 1.515072, "grad_norm": 1.5390625, "learning_rate": 4.6667869676146194e-05, "loss": 0.7399471282958985, "num_input_tokens_seen": 165347456, "step": 1480, "train_runtime": 7525.5655, "train_tokens_per_second": 21971.433 }, { "epoch": 1.525312, "grad_norm": 1.390625, "learning_rate": 4.6647555449929645e-05, "loss": 0.7276147842407227, "num_input_tokens_seen": 166452672, "step": 1490, "train_runtime": 7575.6639, "train_tokens_per_second": 21972.024 }, { "epoch": 1.535552, "grad_norm": 1.4453125, "learning_rate": 4.662726772859869e-05, "loss": 0.7368722915649414, "num_input_tokens_seen": 167547520, "step": 1500, "train_runtime": 7624.3614, "train_tokens_per_second": 21975.286 }, { "epoch": 1.545792, "grad_norm": 1.3984375, "learning_rate": 4.660700645456655e-05, "loss": 0.7236470222473145, "num_input_tokens_seen": 168664320, "step": 1510, "train_runtime": 7674.9645, "train_tokens_per_second": 21975.909 }, { "epoch": 1.556032, "grad_norm": 1.4453125, "learning_rate": 4.658677157042149e-05, "loss": 0.7258675575256348, "num_input_tokens_seen": 169775168, "step": 1520, "train_runtime": 7726.0187, "train_tokens_per_second": 21974.47 }, { "epoch": 1.566272, "grad_norm": 1.5, "learning_rate": 4.656656301892605e-05, "loss": 0.7226676940917969, "num_input_tokens_seen": 170910912, "step": 1530, "train_runtime": 7777.3904, "train_tokens_per_second": 21975.355 }, { "epoch": 1.5765120000000001, "grad_norm": 1.5, "learning_rate": 4.6546380743016465e-05, "loss": 0.7360187530517578, "num_input_tokens_seen": 172011072, "step": 1540, "train_runtime": 7824.7246, "train_tokens_per_second": 21983.019 }, { "epoch": 1.5867520000000002, "grad_norm": 1.46875, "learning_rate": 4.652622468580193e-05, "loss": 0.7214366912841796, "num_input_tokens_seen": 173135616, "step": 1550, "train_runtime": 7875.7668, "train_tokens_per_second": 21983.335 }, { "epoch": 1.596992, "grad_norm": 1.4921875, "learning_rate": 4.650609479056392e-05, "loss": 0.7311969757080078, "num_input_tokens_seen": 174239232, "step": 1560, "train_runtime": 7923.3292, "train_tokens_per_second": 21990.659 }, { "epoch": 1.607232, "grad_norm": 1.4609375, "learning_rate": 4.648599100075556e-05, "loss": 0.7286062240600586, "num_input_tokens_seen": 175335168, "step": 1570, "train_runtime": 7972.5819, "train_tokens_per_second": 21992.269 }, { "epoch": 1.617472, "grad_norm": 1.4765625, "learning_rate": 4.6465913260000945e-05, "loss": 0.7191134929656983, "num_input_tokens_seen": 176463680, "step": 1580, "train_runtime": 8025.3812, "train_tokens_per_second": 21988.199 }, { "epoch": 1.627712, "grad_norm": 1.609375, "learning_rate": 4.644586151209444e-05, "loss": 0.7198073387145996, "num_input_tokens_seen": 177578176, "step": 1590, "train_runtime": 8076.0558, "train_tokens_per_second": 21988.23 }, { "epoch": 1.6379519999999999, "grad_norm": 1.5390625, "learning_rate": 4.6425835701000084e-05, "loss": 0.7295777320861816, "num_input_tokens_seen": 178670912, "step": 1600, "train_runtime": 8124.634, "train_tokens_per_second": 21991.257 }, { "epoch": 1.6481919999999999, "grad_norm": 1.4765625, "learning_rate": 4.640583577085084e-05, "loss": 0.7139708518981933, "num_input_tokens_seen": 179777600, "step": 1610, "train_runtime": 8174.4495, "train_tokens_per_second": 21992.625 }, { "epoch": 1.658432, "grad_norm": 1.578125, "learning_rate": 4.638586166594806e-05, "loss": 0.733104658126831, "num_input_tokens_seen": 180869504, "step": 1620, "train_runtime": 8223.6421, "train_tokens_per_second": 21993.844 }, { "epoch": 1.668672, "grad_norm": 1.4921875, "learning_rate": 4.6365913330760726e-05, "loss": 0.7275556564331055, "num_input_tokens_seen": 182019072, "step": 1630, "train_runtime": 8275.8793, "train_tokens_per_second": 21993.925 }, { "epoch": 1.678912, "grad_norm": 1.4453125, "learning_rate": 4.6345990709924855e-05, "loss": 0.7281203269958496, "num_input_tokens_seen": 183130112, "step": 1640, "train_runtime": 8325.9976, "train_tokens_per_second": 21994.975 }, { "epoch": 1.689152, "grad_norm": 1.46875, "learning_rate": 4.632609374824284e-05, "loss": 0.7167181968688965, "num_input_tokens_seen": 184265024, "step": 1650, "train_runtime": 8379.0993, "train_tokens_per_second": 21991.03 }, { "epoch": 1.699392, "grad_norm": 1.609375, "learning_rate": 4.630622239068285e-05, "loss": 0.7205727100372314, "num_input_tokens_seen": 185403968, "step": 1660, "train_runtime": 8431.432, "train_tokens_per_second": 21989.618 }, { "epoch": 1.709632, "grad_norm": 1.4375, "learning_rate": 4.628637658237808e-05, "loss": 0.7173449039459229, "num_input_tokens_seen": 186535552, "step": 1670, "train_runtime": 8482.4669, "train_tokens_per_second": 21990.72 }, { "epoch": 1.719872, "grad_norm": 1.4140625, "learning_rate": 4.626655626862625e-05, "loss": 0.7150672912597656, "num_input_tokens_seen": 187648448, "step": 1680, "train_runtime": 8533.219, "train_tokens_per_second": 21990.347 }, { "epoch": 1.730112, "grad_norm": 1.4375, "learning_rate": 4.624676139488888e-05, "loss": 0.7177637577056885, "num_input_tokens_seen": 188770624, "step": 1690, "train_runtime": 8582.5231, "train_tokens_per_second": 21994.77 }, { "epoch": 1.7403520000000001, "grad_norm": 1.4296875, "learning_rate": 4.6226991906790686e-05, "loss": 0.7107383728027343, "num_input_tokens_seen": 189905536, "step": 1700, "train_runtime": 8635.4296, "train_tokens_per_second": 21991.441 }, { "epoch": 1.7505920000000001, "grad_norm": 1.453125, "learning_rate": 4.620724775011897e-05, "loss": 0.7159247398376465, "num_input_tokens_seen": 191047360, "step": 1710, "train_runtime": 8688.7592, "train_tokens_per_second": 21987.876 }, { "epoch": 1.760832, "grad_norm": 1.5, "learning_rate": 4.618752887082297e-05, "loss": 0.7231245517730713, "num_input_tokens_seen": 192176448, "step": 1720, "train_runtime": 8739.8956, "train_tokens_per_second": 21988.415 }, { "epoch": 1.771072, "grad_norm": 1.6015625, "learning_rate": 4.616783521501325e-05, "loss": 0.7093376159667969, "num_input_tokens_seen": 193282496, "step": 1730, "train_runtime": 8789.6819, "train_tokens_per_second": 21989.703 }, { "epoch": 1.781312, "grad_norm": 1.5078125, "learning_rate": 4.614816672896108e-05, "loss": 0.7214728832244873, "num_input_tokens_seen": 194367808, "step": 1740, "train_runtime": 8838.9917, "train_tokens_per_second": 21989.817 }, { "epoch": 1.791552, "grad_norm": 1.484375, "learning_rate": 4.612852335909782e-05, "loss": 0.7111657619476318, "num_input_tokens_seen": 195472320, "step": 1750, "train_runtime": 8890.2997, "train_tokens_per_second": 21987.146 }, { "epoch": 1.8017919999999998, "grad_norm": 1.5078125, "learning_rate": 4.6108905052014323e-05, "loss": 0.7161635398864746, "num_input_tokens_seen": 196566912, "step": 1760, "train_runtime": 8939.6068, "train_tokens_per_second": 21988.317 }, { "epoch": 1.8120319999999999, "grad_norm": 1.453125, "learning_rate": 4.608931175446027e-05, "loss": 0.7039215087890625, "num_input_tokens_seen": 197692864, "step": 1770, "train_runtime": 8991.4052, "train_tokens_per_second": 21986.871 }, { "epoch": 1.822272, "grad_norm": 1.53125, "learning_rate": 4.606974341334367e-05, "loss": 0.7046633720397949, "num_input_tokens_seen": 198851136, "step": 1780, "train_runtime": 9045.7861, "train_tokens_per_second": 21982.737 }, { "epoch": 1.832512, "grad_norm": 1.421875, "learning_rate": 4.605019997573011e-05, "loss": 0.7108986854553223, "num_input_tokens_seen": 199991616, "step": 1790, "train_runtime": 9098.4241, "train_tokens_per_second": 21980.907 }, { "epoch": 1.842752, "grad_norm": 1.515625, "learning_rate": 4.603068138884229e-05, "loss": 0.7045407295227051, "num_input_tokens_seen": 201125312, "step": 1800, "train_runtime": 9149.6357, "train_tokens_per_second": 21981.784 }, { "epoch": 1.852992, "grad_norm": 1.46875, "learning_rate": 4.6011187600059345e-05, "loss": 0.7162825584411621, "num_input_tokens_seen": 202239936, "step": 1810, "train_runtime": 9199.9174, "train_tokens_per_second": 21982.799 }, { "epoch": 1.863232, "grad_norm": 1.421875, "learning_rate": 4.599171855691629e-05, "loss": 0.7169035911560059, "num_input_tokens_seen": 203321984, "step": 1820, "train_runtime": 9247.0534, "train_tokens_per_second": 21987.759 }, { "epoch": 1.873472, "grad_norm": 1.5390625, "learning_rate": 4.597227420710335e-05, "loss": 0.6997568130493164, "num_input_tokens_seen": 204444032, "step": 1830, "train_runtime": 9300.3822, "train_tokens_per_second": 21982.326 }, { "epoch": 1.883712, "grad_norm": 1.4453125, "learning_rate": 4.595285449846551e-05, "loss": 0.7147369861602784, "num_input_tokens_seen": 205551872, "step": 1840, "train_runtime": 9350.726, "train_tokens_per_second": 21982.451 }, { "epoch": 1.893952, "grad_norm": 1.4140625, "learning_rate": 4.593345937900178e-05, "loss": 0.700528621673584, "num_input_tokens_seen": 206680128, "step": 1850, "train_runtime": 9402.0793, "train_tokens_per_second": 21982.385 }, { "epoch": 1.904192, "grad_norm": 1.4140625, "learning_rate": 4.591408879686472e-05, "loss": 0.707237434387207, "num_input_tokens_seen": 207813696, "step": 1860, "train_runtime": 9454.3191, "train_tokens_per_second": 21980.821 }, { "epoch": 1.9144320000000001, "grad_norm": 1.5390625, "learning_rate": 4.5894742700359775e-05, "loss": 0.7043401718139648, "num_input_tokens_seen": 208895808, "step": 1870, "train_runtime": 9502.5318, "train_tokens_per_second": 21983.174 }, { "epoch": 1.9246720000000002, "grad_norm": 1.4140625, "learning_rate": 4.587542103794477e-05, "loss": 0.7066624641418457, "num_input_tokens_seen": 210025600, "step": 1880, "train_runtime": 9553.8388, "train_tokens_per_second": 21983.373 }, { "epoch": 1.934912, "grad_norm": 1.515625, "learning_rate": 4.5856123758229247e-05, "loss": 0.7068476676940918, "num_input_tokens_seen": 211141184, "step": 1890, "train_runtime": 9604.6551, "train_tokens_per_second": 21983.214 }, { "epoch": 1.945152, "grad_norm": 1.484375, "learning_rate": 4.5836850809973993e-05, "loss": 0.7084201812744141, "num_input_tokens_seen": 212250112, "step": 1900, "train_runtime": 9653.8675, "train_tokens_per_second": 21986.019 }, { "epoch": 1.955392, "grad_norm": 1.3984375, "learning_rate": 4.5817602142090385e-05, "loss": 0.6999262809753418, "num_input_tokens_seen": 213370240, "step": 1910, "train_runtime": 9704.8849, "train_tokens_per_second": 21985.86 }, { "epoch": 1.965632, "grad_norm": 1.4375, "learning_rate": 4.579837770363989e-05, "loss": 0.7026149749755859, "num_input_tokens_seen": 214511104, "step": 1920, "train_runtime": 9757.8534, "train_tokens_per_second": 21983.432 }, { "epoch": 1.9758719999999999, "grad_norm": 1.5234375, "learning_rate": 4.57791774438334e-05, "loss": 0.7023416042327881, "num_input_tokens_seen": 215629504, "step": 1930, "train_runtime": 9807.0125, "train_tokens_per_second": 21987.277 }, { "epoch": 1.9861119999999999, "grad_norm": 1.46875, "learning_rate": 4.576000131203078e-05, "loss": 0.7092232704162598, "num_input_tokens_seen": 216746880, "step": 1940, "train_runtime": 9858.8618, "train_tokens_per_second": 21984.98 }, { "epoch": 1.996352, "grad_norm": 1.5078125, "learning_rate": 4.574084925774023e-05, "loss": 0.6931307792663575, "num_input_tokens_seen": 217858496, "step": 1950, "train_runtime": 9908.0458, "train_tokens_per_second": 21988.039 }, { "epoch": 2.006144, "grad_norm": 2.203125, "learning_rate": 4.5721721230617795e-05, "loss": 0.6160273551940918, "num_input_tokens_seen": 218918208, "step": 1960, "train_runtime": 9957.3271, "train_tokens_per_second": 21985.64 }, { "epoch": 2.016384, "grad_norm": 1.5625, "learning_rate": 4.57026171804667e-05, "loss": 0.5476226806640625, "num_input_tokens_seen": 220009600, "step": 1970, "train_runtime": 10005.4786, "train_tokens_per_second": 21988.913 }, { "epoch": 2.026624, "grad_norm": 1.578125, "learning_rate": 4.568353705723692e-05, "loss": 0.5443649768829346, "num_input_tokens_seen": 221112448, "step": 1980, "train_runtime": 10053.8591, "train_tokens_per_second": 21992.794 }, { "epoch": 2.036864, "grad_norm": 1.6953125, "learning_rate": 4.566448081102455e-05, "loss": 0.530079698562622, "num_input_tokens_seen": 222236352, "step": 1990, "train_runtime": 10106.2355, "train_tokens_per_second": 21990.023 }, { "epoch": 2.047104, "grad_norm": 1.5859375, "learning_rate": 4.564544839207128e-05, "loss": 0.5314745426177978, "num_input_tokens_seen": 223371840, "step": 2000, "train_runtime": 10157.507, "train_tokens_per_second": 21990.813 }, { "epoch": 2.057344, "grad_norm": 1.703125, "learning_rate": 4.562643975076387e-05, "loss": 0.536113691329956, "num_input_tokens_seen": 224505152, "step": 2010, "train_runtime": 10210.6596, "train_tokens_per_second": 21987.331 }, { "epoch": 2.067584, "grad_norm": 1.6640625, "learning_rate": 4.560745483763357e-05, "loss": 0.537871265411377, "num_input_tokens_seen": 225609024, "step": 2020, "train_runtime": 10260.9136, "train_tokens_per_second": 21987.226 }, { "epoch": 2.077824, "grad_norm": 1.7109375, "learning_rate": 4.5588493603355595e-05, "loss": 0.5416299819946289, "num_input_tokens_seen": 226721728, "step": 2030, "train_runtime": 10310.4748, "train_tokens_per_second": 21989.456 }, { "epoch": 2.088064, "grad_norm": 1.5703125, "learning_rate": 4.556955599874859e-05, "loss": 0.5329193592071533, "num_input_tokens_seen": 227839680, "step": 2040, "train_runtime": 10362.1302, "train_tokens_per_second": 21987.726 }, { "epoch": 2.098304, "grad_norm": 1.5234375, "learning_rate": 4.555064197477409e-05, "loss": 0.5448167800903321, "num_input_tokens_seen": 228945344, "step": 2050, "train_runtime": 10411.8833, "train_tokens_per_second": 21988.85 }, { "epoch": 2.108544, "grad_norm": 1.6015625, "learning_rate": 4.5531751482536e-05, "loss": 0.5400659084320069, "num_input_tokens_seen": 230068608, "step": 2060, "train_runtime": 10461.9263, "train_tokens_per_second": 21991.037 }, { "epoch": 2.118784, "grad_norm": 1.6015625, "learning_rate": 4.5512884473280024e-05, "loss": 0.5294137954711914, "num_input_tokens_seen": 231161728, "step": 2070, "train_runtime": 10511.7551, "train_tokens_per_second": 21990.783 }, { "epoch": 2.129024, "grad_norm": 1.65625, "learning_rate": 4.549404089839322e-05, "loss": 0.535043478012085, "num_input_tokens_seen": 232286656, "step": 2080, "train_runtime": 10562.4846, "train_tokens_per_second": 21991.668 }, { "epoch": 2.139264, "grad_norm": 1.6875, "learning_rate": 4.547522070940335e-05, "loss": 0.5406003952026367, "num_input_tokens_seen": 233403328, "step": 2090, "train_runtime": 10614.5795, "train_tokens_per_second": 21988.938 }, { "epoch": 2.149504, "grad_norm": 1.65625, "learning_rate": 4.545642385797848e-05, "loss": 0.5352214813232422, "num_input_tokens_seen": 234542400, "step": 2100, "train_runtime": 10668.2079, "train_tokens_per_second": 21985.173 }, { "epoch": 2.159744, "grad_norm": 1.59375, "learning_rate": 4.543765029592637e-05, "loss": 0.5299077987670898, "num_input_tokens_seen": 235650624, "step": 2110, "train_runtime": 10718.8559, "train_tokens_per_second": 21984.681 }, { "epoch": 2.169984, "grad_norm": 1.6640625, "learning_rate": 4.541889997519403e-05, "loss": 0.5387727737426757, "num_input_tokens_seen": 236777600, "step": 2120, "train_runtime": 10769.6328, "train_tokens_per_second": 21985.671 }, { "epoch": 2.180224, "grad_norm": 1.625, "learning_rate": 4.5400172847867095e-05, "loss": 0.5402078628540039, "num_input_tokens_seen": 237897728, "step": 2130, "train_runtime": 10820.7737, "train_tokens_per_second": 21985.279 }, { "epoch": 2.190464, "grad_norm": 1.6484375, "learning_rate": 4.5381468866169466e-05, "loss": 0.5417552947998047, "num_input_tokens_seen": 238992704, "step": 2140, "train_runtime": 10869.1633, "train_tokens_per_second": 21988.142 }, { "epoch": 2.200704, "grad_norm": 1.7109375, "learning_rate": 4.5362787982462616e-05, "loss": 0.530327320098877, "num_input_tokens_seen": 240146496, "step": 2150, "train_runtime": 10922.9566, "train_tokens_per_second": 21985.485 }, { "epoch": 2.210944, "grad_norm": 1.671875, "learning_rate": 4.5344130149245275e-05, "loss": 0.5349247932434082, "num_input_tokens_seen": 241241856, "step": 2160, "train_runtime": 10972.6208, "train_tokens_per_second": 21985.801 }, { "epoch": 2.221184, "grad_norm": 1.6328125, "learning_rate": 4.5325495319152715e-05, "loss": 0.5235861301422119, "num_input_tokens_seen": 242377600, "step": 2170, "train_runtime": 11025.3999, "train_tokens_per_second": 21983.565 }, { "epoch": 2.231424, "grad_norm": 1.640625, "learning_rate": 4.530688344495644e-05, "loss": 0.5335872173309326, "num_input_tokens_seen": 243525248, "step": 2180, "train_runtime": 11078.0924, "train_tokens_per_second": 21982.598 }, { "epoch": 2.241664, "grad_norm": 1.6328125, "learning_rate": 4.528829447956357e-05, "loss": 0.5255549430847168, "num_input_tokens_seen": 244661248, "step": 2190, "train_runtime": 11129.5816, "train_tokens_per_second": 21982.969 }, { "epoch": 2.251904, "grad_norm": 1.734375, "learning_rate": 4.526972837601633e-05, "loss": 0.5395485877990722, "num_input_tokens_seen": 245780800, "step": 2200, "train_runtime": 11180.2882, "train_tokens_per_second": 21983.405 }, { "epoch": 2.262144, "grad_norm": 1.7734375, "learning_rate": 4.525118508749165e-05, "loss": 0.5427422523498535, "num_input_tokens_seen": 246870912, "step": 2210, "train_runtime": 11229.0191, "train_tokens_per_second": 21985.083 }, { "epoch": 2.272384, "grad_norm": 1.6796875, "learning_rate": 4.5232664567300546e-05, "loss": 0.5383429527282715, "num_input_tokens_seen": 247963136, "step": 2220, "train_runtime": 11278.2198, "train_tokens_per_second": 21986.017 }, { "epoch": 2.282624, "grad_norm": 1.703125, "learning_rate": 4.521416676888773e-05, "loss": 0.5311496257781982, "num_input_tokens_seen": 249098240, "step": 2230, "train_runtime": 11331.4261, "train_tokens_per_second": 21982.956 }, { "epoch": 2.292864, "grad_norm": 1.65625, "learning_rate": 4.519569164583107e-05, "loss": 0.5386343479156495, "num_input_tokens_seen": 250219840, "step": 2240, "train_runtime": 11382.8605, "train_tokens_per_second": 21982.158 }, { "epoch": 2.303104, "grad_norm": 1.671875, "learning_rate": 4.517723915184109e-05, "loss": 0.5370828628540039, "num_input_tokens_seen": 251317952, "step": 2250, "train_runtime": 11431.9094, "train_tokens_per_second": 21983.9 }, { "epoch": 2.313344, "grad_norm": 1.6875, "learning_rate": 4.5158809240760506e-05, "loss": 0.5292394638061524, "num_input_tokens_seen": 252466688, "step": 2260, "train_runtime": 11485.1849, "train_tokens_per_second": 21981.944 }, { "epoch": 2.323584, "grad_norm": 1.6640625, "learning_rate": 4.514040186656375e-05, "loss": 0.5335429191589356, "num_input_tokens_seen": 253612992, "step": 2270, "train_runtime": 11538.6494, "train_tokens_per_second": 21979.435 }, { "epoch": 2.333824, "grad_norm": 1.625, "learning_rate": 4.512201698335644e-05, "loss": 0.5375387668609619, "num_input_tokens_seen": 254732480, "step": 2280, "train_runtime": 11590.0261, "train_tokens_per_second": 21978.594 }, { "epoch": 2.344064, "grad_norm": 1.75, "learning_rate": 4.510365454537496e-05, "loss": 0.5277575492858887, "num_input_tokens_seen": 255856448, "step": 2290, "train_runtime": 11640.5446, "train_tokens_per_second": 21979.766 }, { "epoch": 2.354304, "grad_norm": 1.65625, "learning_rate": 4.5085314506985945e-05, "loss": 0.523950719833374, "num_input_tokens_seen": 256999168, "step": 2300, "train_runtime": 11692.6859, "train_tokens_per_second": 21979.481 }, { "epoch": 2.364544, "grad_norm": 1.625, "learning_rate": 4.50669968226858e-05, "loss": 0.5421285629272461, "num_input_tokens_seen": 258137984, "step": 2310, "train_runtime": 11745.5264, "train_tokens_per_second": 21977.558 }, { "epoch": 2.374784, "grad_norm": 1.6953125, "learning_rate": 4.504870144710027e-05, "loss": 0.5283915996551514, "num_input_tokens_seen": 259258496, "step": 2320, "train_runtime": 11796.224, "train_tokens_per_second": 21978.092 }, { "epoch": 2.385024, "grad_norm": 1.65625, "learning_rate": 4.5030428334983884e-05, "loss": 0.5356220245361328, "num_input_tokens_seen": 260398080, "step": 2330, "train_runtime": 11850.3858, "train_tokens_per_second": 21973.806 }, { "epoch": 2.395264, "grad_norm": 1.5859375, "learning_rate": 4.501217744121959e-05, "loss": 0.5268114089965821, "num_input_tokens_seen": 261541440, "step": 2340, "train_runtime": 11903.3512, "train_tokens_per_second": 21972.085 }, { "epoch": 2.405504, "grad_norm": 1.75, "learning_rate": 4.499394872081821e-05, "loss": 0.5375988960266114, "num_input_tokens_seen": 262635264, "step": 2350, "train_runtime": 11951.8181, "train_tokens_per_second": 21974.503 }, { "epoch": 2.415744, "grad_norm": 1.7578125, "learning_rate": 4.4975742128918e-05, "loss": 0.5376396656036377, "num_input_tokens_seen": 263740288, "step": 2360, "train_runtime": 12000.2326, "train_tokens_per_second": 21977.931 }, { "epoch": 2.425984, "grad_norm": 1.6953125, "learning_rate": 4.495755762078418e-05, "loss": 0.5323172569274902, "num_input_tokens_seen": 264867968, "step": 2370, "train_runtime": 12050.7407, "train_tokens_per_second": 21979.393 }, { "epoch": 2.436224, "grad_norm": 1.7578125, "learning_rate": 4.49393951518085e-05, "loss": 0.5391307830810547, "num_input_tokens_seen": 265965440, "step": 2380, "train_runtime": 12099.6065, "train_tokens_per_second": 21981.33 }, { "epoch": 2.446464, "grad_norm": 1.6171875, "learning_rate": 4.4921254677508716e-05, "loss": 0.5373844146728516, "num_input_tokens_seen": 267080128, "step": 2390, "train_runtime": 12149.1708, "train_tokens_per_second": 21983.404 }, { "epoch": 2.456704, "grad_norm": 1.7578125, "learning_rate": 4.490313615352821e-05, "loss": 0.5455498218536377, "num_input_tokens_seen": 268188096, "step": 2400, "train_runtime": 12200.2497, "train_tokens_per_second": 21982.181 }, { "epoch": 2.466944, "grad_norm": 1.734375, "learning_rate": 4.48850395356355e-05, "loss": 0.5363270759582519, "num_input_tokens_seen": 269321984, "step": 2410, "train_runtime": 12254.3616, "train_tokens_per_second": 21977.643 }, { "epoch": 2.477184, "grad_norm": 1.75, "learning_rate": 4.486696477972375e-05, "loss": 0.5418241024017334, "num_input_tokens_seen": 270419776, "step": 2420, "train_runtime": 12303.7844, "train_tokens_per_second": 21978.585 }, { "epoch": 2.487424, "grad_norm": 1.7890625, "learning_rate": 4.484891184181041e-05, "loss": 0.5297726631164551, "num_input_tokens_seen": 271548736, "step": 2430, "train_runtime": 12354.5613, "train_tokens_per_second": 21979.634 }, { "epoch": 2.497664, "grad_norm": 1.7734375, "learning_rate": 4.483088067803662e-05, "loss": 0.5376968383789062, "num_input_tokens_seen": 272650816, "step": 2440, "train_runtime": 12403.0155, "train_tokens_per_second": 21982.623 }, { "epoch": 2.507904, "grad_norm": 1.7734375, "learning_rate": 4.481287124466697e-05, "loss": 0.5285521507263183, "num_input_tokens_seen": 273744576, "step": 2450, "train_runtime": 12451.1849, "train_tokens_per_second": 21985.424 }, { "epoch": 2.518144, "grad_norm": 1.6640625, "learning_rate": 4.479488349808885e-05, "loss": 0.5299195289611817, "num_input_tokens_seen": 274848640, "step": 2460, "train_runtime": 12503.3338, "train_tokens_per_second": 21982.029 }, { "epoch": 2.528384, "grad_norm": 1.71875, "learning_rate": 4.4776917394812114e-05, "loss": 0.5259761810302734, "num_input_tokens_seen": 275977600, "step": 2470, "train_runtime": 12556.4141, "train_tokens_per_second": 21979.014 }, { "epoch": 2.538624, "grad_norm": 1.765625, "learning_rate": 4.475897289146862e-05, "loss": 0.5346611022949219, "num_input_tokens_seen": 277115072, "step": 2480, "train_runtime": 12607.8823, "train_tokens_per_second": 21979.51 }, { "epoch": 2.548864, "grad_norm": 1.7109375, "learning_rate": 4.4741049944811806e-05, "loss": 0.5369565963745118, "num_input_tokens_seen": 278210816, "step": 2490, "train_runtime": 12655.8676, "train_tokens_per_second": 21982.753 }, { "epoch": 2.559104, "grad_norm": 1.703125, "learning_rate": 4.472314851171621e-05, "loss": 0.5275493621826172, "num_input_tokens_seen": 279331968, "step": 2500, "train_runtime": 12707.0061, "train_tokens_per_second": 21982.516 }, { "epoch": 2.569344, "grad_norm": 1.6796875, "learning_rate": 4.4705268549177084e-05, "loss": 0.5220746040344239, "num_input_tokens_seen": 280461056, "step": 2510, "train_runtime": 12758.6493, "train_tokens_per_second": 21982.033 }, { "epoch": 2.579584, "grad_norm": 1.7890625, "learning_rate": 4.468741001430989e-05, "loss": 0.5226367950439453, "num_input_tokens_seen": 281572608, "step": 2520, "train_runtime": 12809.5121, "train_tokens_per_second": 21981.525 }, { "epoch": 2.589824, "grad_norm": 1.6328125, "learning_rate": 4.466957286434997e-05, "loss": 0.515837574005127, "num_input_tokens_seen": 282737216, "step": 2530, "train_runtime": 12865.3707, "train_tokens_per_second": 21976.609 }, { "epoch": 2.600064, "grad_norm": 1.8046875, "learning_rate": 4.4651757056652e-05, "loss": 0.5301560401916504, "num_input_tokens_seen": 283827008, "step": 2540, "train_runtime": 12913.3246, "train_tokens_per_second": 21979.391 }, { "epoch": 2.610304, "grad_norm": 1.65625, "learning_rate": 4.463396254868968e-05, "loss": 0.5253063201904297, "num_input_tokens_seen": 284983680, "step": 2550, "train_runtime": 12967.0493, "train_tokens_per_second": 21977.527 }, { "epoch": 2.6205439999999998, "grad_norm": 1.765625, "learning_rate": 4.461618929805519e-05, "loss": 0.5248900890350342, "num_input_tokens_seen": 286077504, "step": 2560, "train_runtime": 13015.9506, "train_tokens_per_second": 21978.994 }, { "epoch": 2.6307840000000002, "grad_norm": 1.5390625, "learning_rate": 4.459843726245888e-05, "loss": 0.53463134765625, "num_input_tokens_seen": 287207168, "step": 2570, "train_runtime": 13067.1302, "train_tokens_per_second": 21979.361 }, { "epoch": 2.641024, "grad_norm": 1.9140625, "learning_rate": 4.458070639972875e-05, "loss": 0.5340803146362305, "num_input_tokens_seen": 288307776, "step": 2580, "train_runtime": 13115.1727, "train_tokens_per_second": 21982.766 }, { "epoch": 2.651264, "grad_norm": 1.6875, "learning_rate": 4.456299666781007e-05, "loss": 0.5143898963928223, "num_input_tokens_seen": 289491392, "step": 2590, "train_runtime": 13173.1381, "train_tokens_per_second": 21975.887 }, { "epoch": 2.661504, "grad_norm": 1.7421875, "learning_rate": 4.4545308024764984e-05, "loss": 0.5279585838317871, "num_input_tokens_seen": 290588288, "step": 2600, "train_runtime": 13222.1712, "train_tokens_per_second": 21977.35 }, { "epoch": 2.671744, "grad_norm": 1.7890625, "learning_rate": 4.452764042877207e-05, "loss": 0.5243070602416993, "num_input_tokens_seen": 291706432, "step": 2610, "train_runtime": 13274.0598, "train_tokens_per_second": 21975.676 }, { "epoch": 2.681984, "grad_norm": 1.7265625, "learning_rate": 4.45099938381259e-05, "loss": 0.525565767288208, "num_input_tokens_seen": 292825664, "step": 2620, "train_runtime": 13324.5762, "train_tokens_per_second": 21976.359 }, { "epoch": 2.692224, "grad_norm": 1.828125, "learning_rate": 4.449236821123667e-05, "loss": 0.5281280040740967, "num_input_tokens_seen": 293933504, "step": 2630, "train_runtime": 13375.6314, "train_tokens_per_second": 21975.299 }, { "epoch": 2.702464, "grad_norm": 1.65625, "learning_rate": 4.447476350662976e-05, "loss": 0.5201663017272949, "num_input_tokens_seen": 295024000, "step": 2640, "train_runtime": 13424.3426, "train_tokens_per_second": 21976.793 }, { "epoch": 2.712704, "grad_norm": 1.859375, "learning_rate": 4.4457179682945346e-05, "loss": 0.5273939609527588, "num_input_tokens_seen": 296126464, "step": 2650, "train_runtime": 13473.9229, "train_tokens_per_second": 21977.747 }, { "epoch": 2.722944, "grad_norm": 1.7109375, "learning_rate": 4.443961669893798e-05, "loss": 0.5174345970153809, "num_input_tokens_seen": 297259712, "step": 2660, "train_runtime": 13524.4385, "train_tokens_per_second": 21979.449 }, { "epoch": 2.733184, "grad_norm": 1.8046875, "learning_rate": 4.4422074513476155e-05, "loss": 0.528529167175293, "num_input_tokens_seen": 298367680, "step": 2670, "train_runtime": 13574.6209, "train_tokens_per_second": 21979.817 }, { "epoch": 2.743424, "grad_norm": 1.859375, "learning_rate": 4.4404553085541955e-05, "loss": 0.5198683738708496, "num_input_tokens_seen": 299497536, "step": 2680, "train_runtime": 13624.3324, "train_tokens_per_second": 21982.548 }, { "epoch": 2.753664, "grad_norm": 1.71875, "learning_rate": 4.438705237423063e-05, "loss": 0.5379956245422364, "num_input_tokens_seen": 300608512, "step": 2690, "train_runtime": 13673.7031, "train_tokens_per_second": 21984.426 }, { "epoch": 2.763904, "grad_norm": 1.734375, "learning_rate": 4.436957233875017e-05, "loss": 0.5276507377624512, "num_input_tokens_seen": 301702976, "step": 2700, "train_runtime": 13722.51, "train_tokens_per_second": 21985.991 }, { "epoch": 2.774144, "grad_norm": 1.734375, "learning_rate": 4.4352112938420956e-05, "loss": 0.5213168144226075, "num_input_tokens_seen": 302851072, "step": 2710, "train_runtime": 13775.4093, "train_tokens_per_second": 21984.906 }, { "epoch": 2.784384, "grad_norm": 1.78125, "learning_rate": 4.433467413267529e-05, "loss": 0.5262949943542481, "num_input_tokens_seen": 303937408, "step": 2720, "train_runtime": 13823.4103, "train_tokens_per_second": 21987.151 }, { "epoch": 2.7946239999999998, "grad_norm": 1.8125, "learning_rate": 4.431725588105708e-05, "loss": 0.5267552852630615, "num_input_tokens_seen": 305070272, "step": 2730, "train_runtime": 13876.6879, "train_tokens_per_second": 21984.372 }, { "epoch": 2.8048640000000002, "grad_norm": 1.7265625, "learning_rate": 4.4299858143221377e-05, "loss": 0.5038492202758789, "num_input_tokens_seen": 306205888, "step": 2740, "train_runtime": 13927.2204, "train_tokens_per_second": 21986.145 }, { "epoch": 2.815104, "grad_norm": 1.8515625, "learning_rate": 4.4282480878934065e-05, "loss": 0.5188664436340332, "num_input_tokens_seen": 307332736, "step": 2750, "train_runtime": 13978.2805, "train_tokens_per_second": 21986.448 }, { "epoch": 2.825344, "grad_norm": 1.671875, "learning_rate": 4.4265124048071346e-05, "loss": 0.5213587760925293, "num_input_tokens_seen": 308433152, "step": 2760, "train_runtime": 14028.0474, "train_tokens_per_second": 21986.891 }, { "epoch": 2.835584, "grad_norm": 1.7890625, "learning_rate": 4.4247787610619477e-05, "loss": 0.5300797462463379, "num_input_tokens_seen": 309529920, "step": 2770, "train_runtime": 14076.4147, "train_tokens_per_second": 21989.258 }, { "epoch": 2.845824, "grad_norm": 1.859375, "learning_rate": 4.42304715266743e-05, "loss": 0.5275647640228271, "num_input_tokens_seen": 310620032, "step": 2780, "train_runtime": 14125.9713, "train_tokens_per_second": 21989.287 }, { "epoch": 2.856064, "grad_norm": 1.828125, "learning_rate": 4.421317575644092e-05, "loss": 0.5151683807373046, "num_input_tokens_seen": 311744704, "step": 2790, "train_runtime": 14177.2729, "train_tokens_per_second": 21989.046 }, { "epoch": 2.866304, "grad_norm": 1.890625, "learning_rate": 4.419590026023325e-05, "loss": 0.5277010440826416, "num_input_tokens_seen": 312862848, "step": 2800, "train_runtime": 14228.7469, "train_tokens_per_second": 21988.082 }, { "epoch": 2.876544, "grad_norm": 1.765625, "learning_rate": 4.417864499847368e-05, "loss": 0.5130796432495117, "num_input_tokens_seen": 313974848, "step": 2810, "train_runtime": 14277.693, "train_tokens_per_second": 21990.587 }, { "epoch": 2.886784, "grad_norm": 1.796875, "learning_rate": 4.4161409931692676e-05, "loss": 0.5243385791778564, "num_input_tokens_seen": 315060032, "step": 2820, "train_runtime": 14325.4746, "train_tokens_per_second": 21992.991 }, { "epoch": 2.897024, "grad_norm": 1.734375, "learning_rate": 4.414419502052841e-05, "loss": 0.5174403667449952, "num_input_tokens_seen": 316182976, "step": 2830, "train_runtime": 14374.9907, "train_tokens_per_second": 21995.352 }, { "epoch": 2.907264, "grad_norm": 1.78125, "learning_rate": 4.412700022572637e-05, "loss": 0.5114859580993653, "num_input_tokens_seen": 317286656, "step": 2840, "train_runtime": 14423.521, "train_tokens_per_second": 21997.864 }, { "epoch": 2.917504, "grad_norm": 1.890625, "learning_rate": 4.410982550813902e-05, "loss": 0.5237509727478027, "num_input_tokens_seen": 318388160, "step": 2850, "train_runtime": 14473.9697, "train_tokens_per_second": 21997.293 }, { "epoch": 2.927744, "grad_norm": 1.78125, "learning_rate": 4.409267082872535e-05, "loss": 0.5249311447143554, "num_input_tokens_seen": 319492928, "step": 2860, "train_runtime": 14523.7571, "train_tokens_per_second": 21997.953 }, { "epoch": 2.937984, "grad_norm": 1.828125, "learning_rate": 4.407553614855059e-05, "loss": 0.515770959854126, "num_input_tokens_seen": 320622336, "step": 2870, "train_runtime": 14577.3266, "train_tokens_per_second": 21994.591 }, { "epoch": 2.9482239999999997, "grad_norm": 1.796875, "learning_rate": 4.405842142878579e-05, "loss": 0.5268994331359863, "num_input_tokens_seen": 321735488, "step": 2880, "train_runtime": 14627.1239, "train_tokens_per_second": 21995.813 }, { "epoch": 2.958464, "grad_norm": 1.765625, "learning_rate": 4.404132663070745e-05, "loss": 0.5111500740051269, "num_input_tokens_seen": 322857728, "step": 2890, "train_runtime": 14678.6828, "train_tokens_per_second": 21995.007 }, { "epoch": 2.968704, "grad_norm": 1.78125, "learning_rate": 4.402425171569716e-05, "loss": 0.5016695499420166, "num_input_tokens_seen": 323996736, "step": 2900, "train_runtime": 14731.4275, "train_tokens_per_second": 21993.574 }, { "epoch": 2.9789440000000003, "grad_norm": 1.75, "learning_rate": 4.400719664524127e-05, "loss": 0.5131624221801758, "num_input_tokens_seen": 325130944, "step": 2910, "train_runtime": 14783.7526, "train_tokens_per_second": 21992.45 }, { "epoch": 2.989184, "grad_norm": 1.8203125, "learning_rate": 4.399016138093044e-05, "loss": 0.5178108215332031, "num_input_tokens_seen": 326241984, "step": 2920, "train_runtime": 14834.9455, "train_tokens_per_second": 21991.451 }, { "epoch": 2.999424, "grad_norm": 1.765625, "learning_rate": 4.397314588445937e-05, "loss": 0.5120769500732422, "num_input_tokens_seen": 327359424, "step": 2930, "train_runtime": 14885.5036, "train_tokens_per_second": 21991.827 }, { "epoch": 3.0, "eval_loss": 0.8352677822113037, "eval_runtime": 1.2873, "eval_samples_per_second": 774.519, "eval_steps_per_second": 6.215, "num_input_tokens_seen": 327416064, "step": 2931 }, { "epoch": 3.0, "num_input_tokens_seen": 327416064, "step": 2931, "total_flos": 5.451032989129507e+18, "train_loss": 0.7516615965776337, "train_runtime": 14909.6648, "train_samples_per_second": 201.212, "train_steps_per_second": 0.197 } ], "logging_steps": 10, "max_steps": 2931, "num_input_tokens_seen": 327416064, "num_train_epochs": 3, "save_steps": 5000, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 5.451032989129507e+18, "train_batch_size": 8, "trial_name": null, "trial_params": null }