Files
QwenTranslate_English_Ukrai…/trainer_state.json
ModelHub XC 96a932fdaf 初始化项目,由ModelHub XC社区提供模型
Model: baban/QwenTranslate_English_Ukrainian
Source: Original Platform
2026-07-07 19:43:19 +08:00

2984 lines
83 KiB
JSON

{
"best_global_step": 2931,
"best_metric": 0.8352677822113037,
"best_model_checkpoint": "/workspace/MT_En_Ukrainian/checkpoint-2931",
"epoch": 3.0,
"eval_steps": 5000,
"global_step": 2931,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.01024,
"grad_norm": 2.453125,
"learning_rate": 4.9977515176118345e-05,
"loss": 1.942220687866211,
"num_input_tokens_seen": 1145728,
"step": 10,
"train_runtime": 55.0006,
"train_tokens_per_second": 20831.189
},
{
"epoch": 0.02048,
"grad_norm": 1.859375,
"learning_rate": 4.9952567580506e-05,
"loss": 1.3728597640991211,
"num_input_tokens_seen": 2258496,
"step": 20,
"train_runtime": 104.7954,
"train_tokens_per_second": 21551.485
},
{
"epoch": 0.03072,
"grad_norm": 1.7734375,
"learning_rate": 4.992765730738634e-05,
"loss": 1.2849248886108398,
"num_input_tokens_seen": 3382784,
"step": 30,
"train_runtime": 157.2016,
"train_tokens_per_second": 21518.764
},
{
"epoch": 0.04096,
"grad_norm": 1.6953125,
"learning_rate": 4.9902784263792476e-05,
"loss": 1.2331731796264649,
"num_input_tokens_seen": 4511424,
"step": 40,
"train_runtime": 208.2613,
"train_tokens_per_second": 21662.324
},
{
"epoch": 0.0512,
"grad_norm": 1.703125,
"learning_rate": 4.987794835708133e-05,
"loss": 1.2049736022949218,
"num_input_tokens_seen": 5639296,
"step": 50,
"train_runtime": 259.7804,
"train_tokens_per_second": 21707.936
},
{
"epoch": 0.06144,
"grad_norm": 1.6328125,
"learning_rate": 4.985314949493234e-05,
"loss": 1.1723523139953613,
"num_input_tokens_seen": 6769920,
"step": 60,
"train_runtime": 312.433,
"train_tokens_per_second": 21668.387
},
{
"epoch": 0.07168,
"grad_norm": 1.6171875,
"learning_rate": 4.982838758534584e-05,
"loss": 1.1766769409179687,
"num_input_tokens_seen": 7888320,
"step": 70,
"train_runtime": 362.5602,
"train_tokens_per_second": 21757.267
},
{
"epoch": 0.08192,
"grad_norm": 1.71875,
"learning_rate": 4.980366253664179e-05,
"loss": 1.1496356010437012,
"num_input_tokens_seen": 8977472,
"step": 80,
"train_runtime": 410.6394,
"train_tokens_per_second": 21862.179
},
{
"epoch": 0.09216,
"grad_norm": 1.7578125,
"learning_rate": 4.977897425745825e-05,
"loss": 1.137571430206299,
"num_input_tokens_seen": 10075968,
"step": 90,
"train_runtime": 460.2896,
"train_tokens_per_second": 21890.499
},
{
"epoch": 0.1024,
"grad_norm": 1.7421875,
"learning_rate": 4.975432265674997e-05,
"loss": 1.1251113891601563,
"num_input_tokens_seen": 11202944,
"step": 100,
"train_runtime": 513.0638,
"train_tokens_per_second": 21835.384
},
{
"epoch": 0.11264,
"grad_norm": 1.8125,
"learning_rate": 4.972970764378705e-05,
"loss": 1.1137601852416992,
"num_input_tokens_seen": 12323840,
"step": 110,
"train_runtime": 563.4486,
"train_tokens_per_second": 21872.164
},
{
"epoch": 0.12288,
"grad_norm": 1.6875,
"learning_rate": 4.970512912815344e-05,
"loss": 1.1156309127807618,
"num_input_tokens_seen": 13415296,
"step": 120,
"train_runtime": 611.3984,
"train_tokens_per_second": 21941.987
},
{
"epoch": 0.13312,
"grad_norm": 1.625,
"learning_rate": 4.968058701974564e-05,
"loss": 1.0775527954101562,
"num_input_tokens_seen": 14525376,
"step": 130,
"train_runtime": 661.1947,
"train_tokens_per_second": 21968.378
},
{
"epoch": 0.14336,
"grad_norm": 1.5078125,
"learning_rate": 4.96560812287712e-05,
"loss": 1.0942869186401367,
"num_input_tokens_seen": 15666688,
"step": 140,
"train_runtime": 713.2845,
"train_tokens_per_second": 21964.151
},
{
"epoch": 0.1536,
"grad_norm": 1.6484375,
"learning_rate": 4.963161166574748e-05,
"loss": 1.0775710105895997,
"num_input_tokens_seen": 16793216,
"step": 150,
"train_runtime": 764.6867,
"train_tokens_per_second": 21960.91
},
{
"epoch": 0.16384,
"grad_norm": 1.609375,
"learning_rate": 4.960717824150013e-05,
"loss": 1.085141944885254,
"num_input_tokens_seen": 17913856,
"step": 160,
"train_runtime": 815.3899,
"train_tokens_per_second": 21969.68
},
{
"epoch": 0.17408,
"grad_norm": 1.6171875,
"learning_rate": 4.9582780867161893e-05,
"loss": 1.0794735908508302,
"num_input_tokens_seen": 19033472,
"step": 170,
"train_runtime": 867.281,
"train_tokens_per_second": 21946.141
},
{
"epoch": 0.18432,
"grad_norm": 1.6328125,
"learning_rate": 4.955841945417105e-05,
"loss": 1.045860481262207,
"num_input_tokens_seen": 20146688,
"step": 180,
"train_runtime": 918.094,
"train_tokens_per_second": 21944.036
},
{
"epoch": 0.19456,
"grad_norm": 1.6953125,
"learning_rate": 4.953409391427024e-05,
"loss": 1.0552400588989257,
"num_input_tokens_seen": 21293184,
"step": 190,
"train_runtime": 971.8022,
"train_tokens_per_second": 21911.027
},
{
"epoch": 0.2048,
"grad_norm": 1.6015625,
"learning_rate": 4.950980415950502e-05,
"loss": 1.0574710845947266,
"num_input_tokens_seen": 22405824,
"step": 200,
"train_runtime": 1021.2273,
"train_tokens_per_second": 21940.094
},
{
"epoch": 0.21504,
"grad_norm": 1.5078125,
"learning_rate": 4.9485550102222575e-05,
"loss": 1.047713565826416,
"num_input_tokens_seen": 23526720,
"step": 210,
"train_runtime": 1072.7388,
"train_tokens_per_second": 21931.452
},
{
"epoch": 0.22528,
"grad_norm": 1.546875,
"learning_rate": 4.946133165507037e-05,
"loss": 1.037226676940918,
"num_input_tokens_seen": 24651328,
"step": 220,
"train_runtime": 1124.4387,
"train_tokens_per_second": 21923.229
},
{
"epoch": 0.23552,
"grad_norm": 1.6171875,
"learning_rate": 4.943714873099483e-05,
"loss": 1.035720443725586,
"num_input_tokens_seen": 25753088,
"step": 230,
"train_runtime": 1173.7005,
"train_tokens_per_second": 21941.788
},
{
"epoch": 0.24576,
"grad_norm": 1.546875,
"learning_rate": 4.9413001243240024e-05,
"loss": 1.0342046737670898,
"num_input_tokens_seen": 26905856,
"step": 240,
"train_runtime": 1226.2471,
"train_tokens_per_second": 21941.627
},
{
"epoch": 0.256,
"grad_norm": 1.484375,
"learning_rate": 4.938888910534637e-05,
"loss": 1.0358741760253907,
"num_input_tokens_seen": 28028864,
"step": 250,
"train_runtime": 1276.4532,
"train_tokens_per_second": 21958.396
},
{
"epoch": 0.26624,
"grad_norm": 1.46875,
"learning_rate": 4.936481223114932e-05,
"loss": 1.038590431213379,
"num_input_tokens_seen": 29126976,
"step": 260,
"train_runtime": 1327.1722,
"train_tokens_per_second": 21946.643
},
{
"epoch": 0.27648,
"grad_norm": 1.59375,
"learning_rate": 4.934077053477808e-05,
"loss": 1.0328522682189942,
"num_input_tokens_seen": 30254208,
"step": 270,
"train_runtime": 1378.9466,
"train_tokens_per_second": 21940.087
},
{
"epoch": 0.28672,
"grad_norm": 1.59375,
"learning_rate": 4.931676393065431e-05,
"loss": 1.0223213195800782,
"num_input_tokens_seen": 31405888,
"step": 280,
"train_runtime": 1432.0252,
"train_tokens_per_second": 21931.1
},
{
"epoch": 0.29696,
"grad_norm": 1.4609375,
"learning_rate": 4.929279233349088e-05,
"loss": 1.0172260284423829,
"num_input_tokens_seen": 32506432,
"step": 290,
"train_runtime": 1481.5865,
"train_tokens_per_second": 21940.286
},
{
"epoch": 0.3072,
"grad_norm": 1.5625,
"learning_rate": 4.926885565829051e-05,
"loss": 1.016135025024414,
"num_input_tokens_seen": 33610176,
"step": 300,
"train_runtime": 1531.0711,
"train_tokens_per_second": 21952.067
},
{
"epoch": 0.31744,
"grad_norm": 1.4453125,
"learning_rate": 4.924495382034461e-05,
"loss": 1.0107959747314452,
"num_input_tokens_seen": 34707264,
"step": 310,
"train_runtime": 1580.5249,
"train_tokens_per_second": 21959.327
},
{
"epoch": 0.32768,
"grad_norm": 1.5078125,
"learning_rate": 4.9221086735231975e-05,
"loss": 1.002080535888672,
"num_input_tokens_seen": 35822272,
"step": 320,
"train_runtime": 1631.8076,
"train_tokens_per_second": 21952.51
},
{
"epoch": 0.33792,
"grad_norm": 1.5703125,
"learning_rate": 4.919725431881751e-05,
"loss": 1.0000602722167968,
"num_input_tokens_seen": 36959680,
"step": 330,
"train_runtime": 1685.6469,
"train_tokens_per_second": 21926.11
},
{
"epoch": 0.34816,
"grad_norm": 1.5390625,
"learning_rate": 4.917345648725101e-05,
"loss": 1.0111896514892578,
"num_input_tokens_seen": 38092160,
"step": 340,
"train_runtime": 1736.6097,
"train_tokens_per_second": 21934.785
},
{
"epoch": 0.3584,
"grad_norm": 1.4453125,
"learning_rate": 4.914969315696596e-05,
"loss": 1.010312271118164,
"num_input_tokens_seen": 39182848,
"step": 350,
"train_runtime": 1785.0368,
"train_tokens_per_second": 21950.723
},
{
"epoch": 0.36864,
"grad_norm": 1.5625,
"learning_rate": 4.912596424467818e-05,
"loss": 0.9806657791137695,
"num_input_tokens_seen": 40318272,
"step": 360,
"train_runtime": 1838.6514,
"train_tokens_per_second": 21928.176
},
{
"epoch": 0.37888,
"grad_norm": 1.390625,
"learning_rate": 4.910226966738475e-05,
"loss": 0.9908489227294922,
"num_input_tokens_seen": 41443072,
"step": 370,
"train_runtime": 1888.8124,
"train_tokens_per_second": 21941.338
},
{
"epoch": 0.38912,
"grad_norm": 1.421875,
"learning_rate": 4.9078609342362666e-05,
"loss": 0.973599624633789,
"num_input_tokens_seen": 42587392,
"step": 380,
"train_runtime": 1944.2016,
"train_tokens_per_second": 21904.823
},
{
"epoch": 0.39936,
"grad_norm": 1.5703125,
"learning_rate": 4.905498318716775e-05,
"loss": 0.9856637954711914,
"num_input_tokens_seen": 43704832,
"step": 390,
"train_runtime": 1994.7284,
"train_tokens_per_second": 21910.167
},
{
"epoch": 0.4096,
"grad_norm": 1.46875,
"learning_rate": 4.9031391119633295e-05,
"loss": 0.9691889762878418,
"num_input_tokens_seen": 44831360,
"step": 400,
"train_runtime": 2045.3596,
"train_tokens_per_second": 21918.571
},
{
"epoch": 0.41984,
"grad_norm": 1.546875,
"learning_rate": 4.9007833057869e-05,
"loss": 0.9910012245178222,
"num_input_tokens_seen": 45943168,
"step": 410,
"train_runtime": 2095.8494,
"train_tokens_per_second": 21921.025
},
{
"epoch": 0.43008,
"grad_norm": 1.5,
"learning_rate": 4.898430892025967e-05,
"loss": 0.9832890510559082,
"num_input_tokens_seen": 47060288,
"step": 420,
"train_runtime": 2146.7011,
"train_tokens_per_second": 21922.143
},
{
"epoch": 0.44032,
"grad_norm": 1.4453125,
"learning_rate": 4.896081862546415e-05,
"loss": 0.9752557754516602,
"num_input_tokens_seen": 48185472,
"step": 430,
"train_runtime": 2198.7956,
"train_tokens_per_second": 21914.485
},
{
"epoch": 0.45056,
"grad_norm": 1.453125,
"learning_rate": 4.8937362092414e-05,
"loss": 0.9778125762939454,
"num_input_tokens_seen": 49256448,
"step": 440,
"train_runtime": 2246.1336,
"train_tokens_per_second": 21929.438
},
{
"epoch": 0.4608,
"grad_norm": 1.4921875,
"learning_rate": 4.891393924031244e-05,
"loss": 0.9636163711547852,
"num_input_tokens_seen": 50374592,
"step": 450,
"train_runtime": 2296.6263,
"train_tokens_per_second": 21934.17
},
{
"epoch": 0.47104,
"grad_norm": 1.515625,
"learning_rate": 4.8890549988633095e-05,
"loss": 0.9704037666320801,
"num_input_tokens_seen": 51485248,
"step": 460,
"train_runtime": 2346.8324,
"train_tokens_per_second": 21938.187
},
{
"epoch": 0.48128,
"grad_norm": 1.453125,
"learning_rate": 4.8867194257118907e-05,
"loss": 0.9702651977539063,
"num_input_tokens_seen": 52604160,
"step": 470,
"train_runtime": 2397.7165,
"train_tokens_per_second": 21939.274
},
{
"epoch": 0.49152,
"grad_norm": 1.4609375,
"learning_rate": 4.884387196578093e-05,
"loss": 0.9792324066162109,
"num_input_tokens_seen": 53710144,
"step": 480,
"train_runtime": 2448.6532,
"train_tokens_per_second": 21934.566
},
{
"epoch": 0.50176,
"grad_norm": 1.4140625,
"learning_rate": 4.882058303489718e-05,
"loss": 0.9673162460327148,
"num_input_tokens_seen": 54830272,
"step": 490,
"train_runtime": 2500.2972,
"train_tokens_per_second": 21929.502
},
{
"epoch": 0.512,
"grad_norm": 1.5703125,
"learning_rate": 4.8797327385011496e-05,
"loss": 0.9507923126220703,
"num_input_tokens_seen": 55928384,
"step": 500,
"train_runtime": 2549.596,
"train_tokens_per_second": 21936.175
},
{
"epoch": 0.52224,
"grad_norm": 1.53125,
"learning_rate": 4.8774104936932425e-05,
"loss": 0.9491652488708496,
"num_input_tokens_seen": 57048704,
"step": 510,
"train_runtime": 2597.7871,
"train_tokens_per_second": 21960.5
},
{
"epoch": 0.53248,
"grad_norm": 1.4375,
"learning_rate": 4.8750915611732076e-05,
"loss": 0.9639401435852051,
"num_input_tokens_seen": 58140160,
"step": 520,
"train_runtime": 2646.0597,
"train_tokens_per_second": 21972.353
},
{
"epoch": 0.54272,
"grad_norm": 1.5625,
"learning_rate": 4.8727759330744986e-05,
"loss": 0.9479743957519531,
"num_input_tokens_seen": 59267200,
"step": 530,
"train_runtime": 2698.4747,
"train_tokens_per_second": 21963.222
},
{
"epoch": 0.55296,
"grad_norm": 1.375,
"learning_rate": 4.870463601556696e-05,
"loss": 0.9524721145629883,
"num_input_tokens_seen": 60421504,
"step": 540,
"train_runtime": 2750.3842,
"train_tokens_per_second": 21968.387
},
{
"epoch": 0.5632,
"grad_norm": 1.4140625,
"learning_rate": 4.8681545588054075e-05,
"loss": 0.962583065032959,
"num_input_tokens_seen": 61505280,
"step": 550,
"train_runtime": 2798.047,
"train_tokens_per_second": 21981.504
},
{
"epoch": 0.57344,
"grad_norm": 1.4296875,
"learning_rate": 4.8658487970321404e-05,
"loss": 0.9441762924194336,
"num_input_tokens_seen": 62611136,
"step": 560,
"train_runtime": 2847.1648,
"train_tokens_per_second": 21990.696
},
{
"epoch": 0.58368,
"grad_norm": 1.4453125,
"learning_rate": 4.863546308474209e-05,
"loss": 0.9428766250610352,
"num_input_tokens_seen": 63731712,
"step": 570,
"train_runtime": 2898.5894,
"train_tokens_per_second": 21987.147
},
{
"epoch": 0.59392,
"grad_norm": 1.4296875,
"learning_rate": 4.86124708539461e-05,
"loss": 0.9273331642150879,
"num_input_tokens_seen": 64828608,
"step": 580,
"train_runtime": 2948.7617,
"train_tokens_per_second": 21985.028
},
{
"epoch": 0.60416,
"grad_norm": 1.4453125,
"learning_rate": 4.8589511200819216e-05,
"loss": 0.9427030563354493,
"num_input_tokens_seen": 65924608,
"step": 590,
"train_runtime": 2996.6383,
"train_tokens_per_second": 21999.521
},
{
"epoch": 0.6144,
"grad_norm": 1.4375,
"learning_rate": 4.8566584048501926e-05,
"loss": 0.9379173278808594,
"num_input_tokens_seen": 67042624,
"step": 600,
"train_runtime": 3048.7405,
"train_tokens_per_second": 21990.269
},
{
"epoch": 0.62464,
"grad_norm": 1.34375,
"learning_rate": 4.854368932038835e-05,
"loss": 0.9400325775146484,
"num_input_tokens_seen": 68149376,
"step": 610,
"train_runtime": 3097.9096,
"train_tokens_per_second": 21998.503
},
{
"epoch": 0.63488,
"grad_norm": 1.5234375,
"learning_rate": 4.8520826940125144e-05,
"loss": 0.9410287857055664,
"num_input_tokens_seen": 69264256,
"step": 620,
"train_runtime": 3149.7216,
"train_tokens_per_second": 21990.596
},
{
"epoch": 0.64512,
"grad_norm": 1.40625,
"learning_rate": 4.849799683161046e-05,
"loss": 0.9263475418090821,
"num_input_tokens_seen": 70435904,
"step": 630,
"train_runtime": 3202.5382,
"train_tokens_per_second": 21993.775
},
{
"epoch": 0.65536,
"grad_norm": 1.4375,
"learning_rate": 4.8475198918992835e-05,
"loss": 0.9329448699951172,
"num_input_tokens_seen": 71552896,
"step": 640,
"train_runtime": 3253.1308,
"train_tokens_per_second": 21995.088
},
{
"epoch": 0.6656,
"grad_norm": 1.3203125,
"learning_rate": 4.845243312667023e-05,
"loss": 0.9400642395019532,
"num_input_tokens_seen": 72646400,
"step": 650,
"train_runtime": 3302.0912,
"train_tokens_per_second": 22000.119
},
{
"epoch": 0.67584,
"grad_norm": 1.4375,
"learning_rate": 4.842969937928884e-05,
"loss": 0.9307914733886719,
"num_input_tokens_seen": 73760192,
"step": 660,
"train_runtime": 3351.4596,
"train_tokens_per_second": 22008.379
},
{
"epoch": 0.68608,
"grad_norm": 1.421875,
"learning_rate": 4.840699760174217e-05,
"loss": 0.9233476638793945,
"num_input_tokens_seen": 74882496,
"step": 670,
"train_runtime": 3402.821,
"train_tokens_per_second": 22006.005
},
{
"epoch": 0.69632,
"grad_norm": 1.34375,
"learning_rate": 4.8384327719169906e-05,
"loss": 0.9302739143371582,
"num_input_tokens_seen": 76004736,
"step": 680,
"train_runtime": 3455.3873,
"train_tokens_per_second": 21996.011
},
{
"epoch": 0.70656,
"grad_norm": 1.40625,
"learning_rate": 4.836168965695694e-05,
"loss": 0.9305820465087891,
"num_input_tokens_seen": 77100736,
"step": 690,
"train_runtime": 3503.451,
"train_tokens_per_second": 22007.083
},
{
"epoch": 0.7168,
"grad_norm": 1.390625,
"learning_rate": 4.8339083340732304e-05,
"loss": 0.9203786849975586,
"num_input_tokens_seen": 78219136,
"step": 700,
"train_runtime": 3553.2121,
"train_tokens_per_second": 22013.641
},
{
"epoch": 0.72704,
"grad_norm": 1.484375,
"learning_rate": 4.8316508696368154e-05,
"loss": 0.9239031791687011,
"num_input_tokens_seen": 79310848,
"step": 710,
"train_runtime": 3602.0368,
"train_tokens_per_second": 22018.334
},
{
"epoch": 0.73728,
"grad_norm": 1.3828125,
"learning_rate": 4.8293965649978714e-05,
"loss": 0.9024551391601563,
"num_input_tokens_seen": 80425728,
"step": 720,
"train_runtime": 3653.6123,
"train_tokens_per_second": 22012.66
},
{
"epoch": 0.74752,
"grad_norm": 1.4453125,
"learning_rate": 4.8271454127919364e-05,
"loss": 0.9112434387207031,
"num_input_tokens_seen": 81496320,
"step": 730,
"train_runtime": 3699.8035,
"train_tokens_per_second": 22027.202
},
{
"epoch": 0.75776,
"grad_norm": 1.390625,
"learning_rate": 4.824897405678549e-05,
"loss": 0.9149089813232422,
"num_input_tokens_seen": 82645120,
"step": 740,
"train_runtime": 3753.9121,
"train_tokens_per_second": 22015.731
},
{
"epoch": 0.768,
"grad_norm": 1.359375,
"learning_rate": 4.8226525363411576e-05,
"loss": 0.9063904762268067,
"num_input_tokens_seen": 83764288,
"step": 750,
"train_runtime": 3806.5124,
"train_tokens_per_second": 22005.521
},
{
"epoch": 0.77824,
"grad_norm": 1.453125,
"learning_rate": 4.820410797487017e-05,
"loss": 0.9081829071044922,
"num_input_tokens_seen": 84887744,
"step": 760,
"train_runtime": 3859.7215,
"train_tokens_per_second": 21993.23
},
{
"epoch": 0.78848,
"grad_norm": 1.359375,
"learning_rate": 4.818172181847091e-05,
"loss": 0.8958653450012207,
"num_input_tokens_seen": 86004992,
"step": 770,
"train_runtime": 3911.8203,
"train_tokens_per_second": 21985.926
},
{
"epoch": 0.79872,
"grad_norm": 1.46875,
"learning_rate": 4.81593668217595e-05,
"loss": 0.9148517608642578,
"num_input_tokens_seen": 87105216,
"step": 780,
"train_runtime": 3961.6794,
"train_tokens_per_second": 21986.942
},
{
"epoch": 0.80896,
"grad_norm": 1.40625,
"learning_rate": 4.813704291251675e-05,
"loss": 0.9078433990478516,
"num_input_tokens_seen": 88239680,
"step": 790,
"train_runtime": 4013.5881,
"train_tokens_per_second": 21985.236
},
{
"epoch": 0.8192,
"grad_norm": 1.421875,
"learning_rate": 4.811475001875759e-05,
"loss": 0.9124856948852539,
"num_input_tokens_seen": 89349568,
"step": 800,
"train_runtime": 4062.7697,
"train_tokens_per_second": 21992.28
},
{
"epoch": 0.82944,
"grad_norm": 1.4375,
"learning_rate": 4.8092488068730105e-05,
"loss": 0.9061111450195313,
"num_input_tokens_seen": 90469312,
"step": 810,
"train_runtime": 4115.7452,
"train_tokens_per_second": 21981.271
},
{
"epoch": 0.83968,
"grad_norm": 1.3984375,
"learning_rate": 4.807025699091452e-05,
"loss": 0.8909177780151367,
"num_input_tokens_seen": 91591424,
"step": 820,
"train_runtime": 4167.5795,
"train_tokens_per_second": 21977.127
},
{
"epoch": 0.84992,
"grad_norm": 1.4609375,
"learning_rate": 4.8048056714022325e-05,
"loss": 0.8970900535583496,
"num_input_tokens_seen": 92718336,
"step": 830,
"train_runtime": 4219.1054,
"train_tokens_per_second": 21975.828
},
{
"epoch": 0.86016,
"grad_norm": 1.3984375,
"learning_rate": 4.802588716699519e-05,
"loss": 0.9085554122924805,
"num_input_tokens_seen": 93814400,
"step": 840,
"train_runtime": 4268.8362,
"train_tokens_per_second": 21976.575
},
{
"epoch": 0.8704,
"grad_norm": 1.3359375,
"learning_rate": 4.8003748279004156e-05,
"loss": 0.8963174819946289,
"num_input_tokens_seen": 94937408,
"step": 850,
"train_runtime": 4321.9061,
"train_tokens_per_second": 21966.56
},
{
"epoch": 0.88064,
"grad_norm": 1.4765625,
"learning_rate": 4.798163997944854e-05,
"loss": 0.9105907440185547,
"num_input_tokens_seen": 96048512,
"step": 860,
"train_runtime": 4371.8613,
"train_tokens_per_second": 21969.707
},
{
"epoch": 0.89088,
"grad_norm": 1.4609375,
"learning_rate": 4.79595621979551e-05,
"loss": 0.877834415435791,
"num_input_tokens_seen": 97193472,
"step": 870,
"train_runtime": 4425.9231,
"train_tokens_per_second": 21960.046
},
{
"epoch": 0.90112,
"grad_norm": 1.3828125,
"learning_rate": 4.793751486437702e-05,
"loss": 0.8991375923156738,
"num_input_tokens_seen": 98317184,
"step": 880,
"train_runtime": 4476.7825,
"train_tokens_per_second": 21961.573
},
{
"epoch": 0.91136,
"grad_norm": 1.515625,
"learning_rate": 4.7915497908793064e-05,
"loss": 0.8886856079101563,
"num_input_tokens_seen": 99450688,
"step": 890,
"train_runtime": 4529.0422,
"train_tokens_per_second": 21958.437
},
{
"epoch": 0.9216,
"grad_norm": 1.3515625,
"learning_rate": 4.7893511261506516e-05,
"loss": 0.902672004699707,
"num_input_tokens_seen": 100563840,
"step": 900,
"train_runtime": 4579.192,
"train_tokens_per_second": 21961.045
},
{
"epoch": 0.93184,
"grad_norm": 1.4453125,
"learning_rate": 4.787155485304435e-05,
"loss": 0.8937115669250488,
"num_input_tokens_seen": 101656640,
"step": 910,
"train_runtime": 4627.8649,
"train_tokens_per_second": 21966.208
},
{
"epoch": 0.94208,
"grad_norm": 1.375,
"learning_rate": 4.784962861415629e-05,
"loss": 0.9013708114624024,
"num_input_tokens_seen": 102780288,
"step": 920,
"train_runtime": 4679.0445,
"train_tokens_per_second": 21966.085
},
{
"epoch": 0.95232,
"grad_norm": 1.296875,
"learning_rate": 4.7827732475813884e-05,
"loss": 0.8749137878417969,
"num_input_tokens_seen": 103933056,
"step": 930,
"train_runtime": 4732.6015,
"train_tokens_per_second": 21961.083
},
{
"epoch": 0.96256,
"grad_norm": 1.3984375,
"learning_rate": 4.7805866369209576e-05,
"loss": 0.8961335182189941,
"num_input_tokens_seen": 105038016,
"step": 940,
"train_runtime": 4782.7459,
"train_tokens_per_second": 21961.864
},
{
"epoch": 0.9728,
"grad_norm": 1.3515625,
"learning_rate": 4.778403022575583e-05,
"loss": 0.874142074584961,
"num_input_tokens_seen": 106174336,
"step": 950,
"train_runtime": 4836.32,
"train_tokens_per_second": 21953.538
},
{
"epoch": 0.98304,
"grad_norm": 1.390625,
"learning_rate": 4.7762223977084195e-05,
"loss": 0.8942262649536132,
"num_input_tokens_seen": 107277440,
"step": 960,
"train_runtime": 4886.8487,
"train_tokens_per_second": 21952.273
},
{
"epoch": 0.99328,
"grad_norm": 1.3125,
"learning_rate": 4.774044755504444e-05,
"loss": 0.8799090385437012,
"num_input_tokens_seen": 108394496,
"step": 970,
"train_runtime": 4938.6396,
"train_tokens_per_second": 21948.25
},
{
"epoch": 1.003072,
"grad_norm": 1.25,
"learning_rate": 4.7718700891703616e-05,
"loss": 0.8489143371582031,
"num_input_tokens_seen": 109453888,
"step": 980,
"train_runtime": 4987.1553,
"train_tokens_per_second": 21947.158
},
{
"epoch": 1.013312,
"grad_norm": 1.40625,
"learning_rate": 4.7696983919345215e-05,
"loss": 0.7443439483642578,
"num_input_tokens_seen": 110580736,
"step": 990,
"train_runtime": 5038.9713,
"train_tokens_per_second": 21945.101
},
{
"epoch": 1.023552,
"grad_norm": 1.3671875,
"learning_rate": 4.7675296570468216e-05,
"loss": 0.7479698181152343,
"num_input_tokens_seen": 111723136,
"step": 1000,
"train_runtime": 5092.4363,
"train_tokens_per_second": 21939.034
},
{
"epoch": 1.033792,
"grad_norm": 1.5,
"learning_rate": 4.76536387777863e-05,
"loss": 0.7372268676757813,
"num_input_tokens_seen": 112836800,
"step": 1010,
"train_runtime": 5144.5655,
"train_tokens_per_second": 21933.203
},
{
"epoch": 1.044032,
"grad_norm": 1.3828125,
"learning_rate": 4.7632010474226915e-05,
"loss": 0.7579574584960938,
"num_input_tokens_seen": 113961088,
"step": 1020,
"train_runtime": 5195.725,
"train_tokens_per_second": 21933.626
},
{
"epoch": 1.054272,
"grad_norm": 1.59375,
"learning_rate": 4.761041159293035e-05,
"loss": 0.7489605903625488,
"num_input_tokens_seen": 115089984,
"step": 1030,
"train_runtime": 5247.5552,
"train_tokens_per_second": 21932.115
},
{
"epoch": 1.064512,
"grad_norm": 1.4140625,
"learning_rate": 4.7588842067249e-05,
"loss": 0.7482340812683106,
"num_input_tokens_seen": 116217216,
"step": 1040,
"train_runtime": 5299.9058,
"train_tokens_per_second": 21928.167
},
{
"epoch": 1.074752,
"grad_norm": 1.5078125,
"learning_rate": 4.756730183074637e-05,
"loss": 0.7579518318176269,
"num_input_tokens_seen": 117347648,
"step": 1050,
"train_runtime": 5351.066,
"train_tokens_per_second": 21929.77
},
{
"epoch": 1.084992,
"grad_norm": 1.4921875,
"learning_rate": 4.7545790817196314e-05,
"loss": 0.7438392639160156,
"num_input_tokens_seen": 118493632,
"step": 1060,
"train_runtime": 5405.5478,
"train_tokens_per_second": 21920.744
},
{
"epoch": 1.095232,
"grad_norm": 1.4296875,
"learning_rate": 4.752430896058212e-05,
"loss": 0.7573630332946777,
"num_input_tokens_seen": 119595776,
"step": 1070,
"train_runtime": 5455.0034,
"train_tokens_per_second": 21924.052
},
{
"epoch": 1.105472,
"grad_norm": 1.4765625,
"learning_rate": 4.750285619509567e-05,
"loss": 0.7446182250976563,
"num_input_tokens_seen": 120728576,
"step": 1080,
"train_runtime": 5507.7373,
"train_tokens_per_second": 21919.814
},
{
"epoch": 1.115712,
"grad_norm": 1.40625,
"learning_rate": 4.7481432455136644e-05,
"loss": 0.7489546775817871,
"num_input_tokens_seen": 121851968,
"step": 1090,
"train_runtime": 5559.0243,
"train_tokens_per_second": 21919.668
},
{
"epoch": 1.125952,
"grad_norm": 1.4609375,
"learning_rate": 4.7460037675311584e-05,
"loss": 0.757651948928833,
"num_input_tokens_seen": 122954752,
"step": 1100,
"train_runtime": 5608.2123,
"train_tokens_per_second": 21924.054
},
{
"epoch": 1.136192,
"grad_norm": 1.375,
"learning_rate": 4.7438671790433126e-05,
"loss": 0.7577178955078125,
"num_input_tokens_seen": 124052416,
"step": 1110,
"train_runtime": 5657.5424,
"train_tokens_per_second": 21926.909
},
{
"epoch": 1.146432,
"grad_norm": 1.4296875,
"learning_rate": 4.741733473551915e-05,
"loss": 0.7523440361022949,
"num_input_tokens_seen": 125165248,
"step": 1120,
"train_runtime": 5707.4101,
"train_tokens_per_second": 21930.306
},
{
"epoch": 1.156672,
"grad_norm": 1.4375,
"learning_rate": 4.7396026445791966e-05,
"loss": 0.7425838470458984,
"num_input_tokens_seen": 126283840,
"step": 1130,
"train_runtime": 5759.366,
"train_tokens_per_second": 21926.691
},
{
"epoch": 1.166912,
"grad_norm": 1.4609375,
"learning_rate": 4.737474685667742e-05,
"loss": 0.7449512004852294,
"num_input_tokens_seen": 127421952,
"step": 1140,
"train_runtime": 5811.4353,
"train_tokens_per_second": 21926.072
},
{
"epoch": 1.177152,
"grad_norm": 1.4140625,
"learning_rate": 4.7353495903804165e-05,
"loss": 0.761650562286377,
"num_input_tokens_seen": 128504576,
"step": 1150,
"train_runtime": 5859.1852,
"train_tokens_per_second": 21932.158
},
{
"epoch": 1.187392,
"grad_norm": 1.484375,
"learning_rate": 4.733227352300277e-05,
"loss": 0.7624397277832031,
"num_input_tokens_seen": 129617728,
"step": 1160,
"train_runtime": 5908.742,
"train_tokens_per_second": 21936.603
},
{
"epoch": 1.197632,
"grad_norm": 1.5234375,
"learning_rate": 4.731107965030496e-05,
"loss": 0.756078052520752,
"num_input_tokens_seen": 130713728,
"step": 1170,
"train_runtime": 5959.2042,
"train_tokens_per_second": 21934.762
},
{
"epoch": 1.207872,
"grad_norm": 1.3515625,
"learning_rate": 4.728991422194278e-05,
"loss": 0.7492989063262939,
"num_input_tokens_seen": 131802368,
"step": 1180,
"train_runtime": 6008.2874,
"train_tokens_per_second": 21936.762
},
{
"epoch": 1.218112,
"grad_norm": 1.4375,
"learning_rate": 4.726877717434773e-05,
"loss": 0.7438122749328613,
"num_input_tokens_seen": 132905472,
"step": 1190,
"train_runtime": 6057.8828,
"train_tokens_per_second": 21939.261
},
{
"epoch": 1.228352,
"grad_norm": 1.3671875,
"learning_rate": 4.724766844415013e-05,
"loss": 0.7444162368774414,
"num_input_tokens_seen": 134023296,
"step": 1200,
"train_runtime": 6107.5979,
"train_tokens_per_second": 21943.7
},
{
"epoch": 1.238592,
"grad_norm": 1.390625,
"learning_rate": 4.722658796817813e-05,
"loss": 0.7356367588043213,
"num_input_tokens_seen": 135165312,
"step": 1210,
"train_runtime": 6160.1499,
"train_tokens_per_second": 21941.887
},
{
"epoch": 1.248832,
"grad_norm": 1.359375,
"learning_rate": 4.7205535683457044e-05,
"loss": 0.7440855026245117,
"num_input_tokens_seen": 136319808,
"step": 1220,
"train_runtime": 6214.3559,
"train_tokens_per_second": 21936.273
},
{
"epoch": 1.259072,
"grad_norm": 1.453125,
"learning_rate": 4.7184511527208484e-05,
"loss": 0.7333660125732422,
"num_input_tokens_seen": 137441088,
"step": 1230,
"train_runtime": 6264.8424,
"train_tokens_per_second": 21938.475
},
{
"epoch": 1.269312,
"grad_norm": 1.5390625,
"learning_rate": 4.7163515436849644e-05,
"loss": 0.7524197101593018,
"num_input_tokens_seen": 138549568,
"step": 1240,
"train_runtime": 6313.7128,
"train_tokens_per_second": 21944.23
},
{
"epoch": 1.279552,
"grad_norm": 1.484375,
"learning_rate": 4.714254734999245e-05,
"loss": 0.7486214637756348,
"num_input_tokens_seen": 139628416,
"step": 1250,
"train_runtime": 6361.0684,
"train_tokens_per_second": 21950.466
},
{
"epoch": 1.289792,
"grad_norm": 1.578125,
"learning_rate": 4.712160720444284e-05,
"loss": 0.7422505378723144,
"num_input_tokens_seen": 140751552,
"step": 1260,
"train_runtime": 6412.2087,
"train_tokens_per_second": 21950.557
},
{
"epoch": 1.300032,
"grad_norm": 1.4921875,
"learning_rate": 4.710069493819992e-05,
"loss": 0.7394045352935791,
"num_input_tokens_seen": 141875392,
"step": 1270,
"train_runtime": 6463.2897,
"train_tokens_per_second": 21950.957
},
{
"epoch": 1.3102719999999999,
"grad_norm": 1.4375,
"learning_rate": 4.70798104894553e-05,
"loss": 0.7524402618408204,
"num_input_tokens_seen": 142968768,
"step": 1280,
"train_runtime": 6512.8407,
"train_tokens_per_second": 21951.829
},
{
"epoch": 1.320512,
"grad_norm": 1.3671875,
"learning_rate": 4.705895379659219e-05,
"loss": 0.73507719039917,
"num_input_tokens_seen": 144088448,
"step": 1290,
"train_runtime": 6563.9326,
"train_tokens_per_second": 21951.543
},
{
"epoch": 1.330752,
"grad_norm": 1.4140625,
"learning_rate": 4.7038124798184766e-05,
"loss": 0.744103193283081,
"num_input_tokens_seen": 145166528,
"step": 1300,
"train_runtime": 6612.2717,
"train_tokens_per_second": 21954.108
},
{
"epoch": 1.340992,
"grad_norm": 1.4609375,
"learning_rate": 4.7017323432997304e-05,
"loss": 0.7421403884887695,
"num_input_tokens_seen": 146277888,
"step": 1310,
"train_runtime": 6663.7474,
"train_tokens_per_second": 21951.296
},
{
"epoch": 1.351232,
"grad_norm": 1.4453125,
"learning_rate": 4.6996549639983506e-05,
"loss": 0.7422142505645752,
"num_input_tokens_seen": 147402112,
"step": 1320,
"train_runtime": 6713.9776,
"train_tokens_per_second": 21954.513
},
{
"epoch": 1.361472,
"grad_norm": 1.4140625,
"learning_rate": 4.697580335828569e-05,
"loss": 0.747988224029541,
"num_input_tokens_seen": 148498816,
"step": 1330,
"train_runtime": 6762.7236,
"train_tokens_per_second": 21958.433
},
{
"epoch": 1.371712,
"grad_norm": 1.4140625,
"learning_rate": 4.6955084527234076e-05,
"loss": 0.7415881633758545,
"num_input_tokens_seen": 149633024,
"step": 1340,
"train_runtime": 6813.6204,
"train_tokens_per_second": 21960.869
},
{
"epoch": 1.381952,
"grad_norm": 1.3984375,
"learning_rate": 4.6934393086346034e-05,
"loss": 0.7278687953948975,
"num_input_tokens_seen": 150743424,
"step": 1350,
"train_runtime": 6865.1777,
"train_tokens_per_second": 21957.687
},
{
"epoch": 1.392192,
"grad_norm": 1.484375,
"learning_rate": 4.6913728975325324e-05,
"loss": 0.7370668411254883,
"num_input_tokens_seen": 151865536,
"step": 1360,
"train_runtime": 6915.0272,
"train_tokens_per_second": 21961.669
},
{
"epoch": 1.4024320000000001,
"grad_norm": 1.4765625,
"learning_rate": 4.6893092134061393e-05,
"loss": 0.7397951126098633,
"num_input_tokens_seen": 152997504,
"step": 1370,
"train_runtime": 6966.2008,
"train_tokens_per_second": 21962.833
},
{
"epoch": 1.412672,
"grad_norm": 1.4453125,
"learning_rate": 4.687248250262859e-05,
"loss": 0.7369170188903809,
"num_input_tokens_seen": 154098752,
"step": 1380,
"train_runtime": 7017.463,
"train_tokens_per_second": 21959.325
},
{
"epoch": 1.422912,
"grad_norm": 1.4453125,
"learning_rate": 4.685190002128548e-05,
"loss": 0.7380311965942383,
"num_input_tokens_seen": 155218880,
"step": 1390,
"train_runtime": 7069.234,
"train_tokens_per_second": 21956.959
},
{
"epoch": 1.433152,
"grad_norm": 1.3359375,
"learning_rate": 4.6831344630474114e-05,
"loss": 0.719688892364502,
"num_input_tokens_seen": 156365696,
"step": 1400,
"train_runtime": 7121.6519,
"train_tokens_per_second": 21956.38
},
{
"epoch": 1.443392,
"grad_norm": 1.4765625,
"learning_rate": 4.6810816270819276e-05,
"loss": 0.7329507827758789,
"num_input_tokens_seen": 157494784,
"step": 1410,
"train_runtime": 7171.9905,
"train_tokens_per_second": 21959.703
},
{
"epoch": 1.453632,
"grad_norm": 1.421875,
"learning_rate": 4.679031488312777e-05,
"loss": 0.7250077247619628,
"num_input_tokens_seen": 158633216,
"step": 1420,
"train_runtime": 7223.042,
"train_tokens_per_second": 21962.106
},
{
"epoch": 1.463872,
"grad_norm": 1.4453125,
"learning_rate": 4.6769840408387717e-05,
"loss": 0.7379475116729737,
"num_input_tokens_seen": 159750208,
"step": 1430,
"train_runtime": 7274.4145,
"train_tokens_per_second": 21960.559
},
{
"epoch": 1.4741119999999999,
"grad_norm": 1.46875,
"learning_rate": 4.674939278776787e-05,
"loss": 0.7261748313903809,
"num_input_tokens_seen": 160865344,
"step": 1440,
"train_runtime": 7324.4445,
"train_tokens_per_second": 21962.805
},
{
"epoch": 1.484352,
"grad_norm": 1.390625,
"learning_rate": 4.672897196261683e-05,
"loss": 0.718736219406128,
"num_input_tokens_seen": 162000640,
"step": 1450,
"train_runtime": 7376.9389,
"train_tokens_per_second": 21960.415
},
{
"epoch": 1.494592,
"grad_norm": 1.421875,
"learning_rate": 4.670857787446238e-05,
"loss": 0.7371679782867432,
"num_input_tokens_seen": 163120704,
"step": 1460,
"train_runtime": 7426.1512,
"train_tokens_per_second": 21965.713
},
{
"epoch": 1.504832,
"grad_norm": 1.3984375,
"learning_rate": 4.668821046501082e-05,
"loss": 0.7367044448852539,
"num_input_tokens_seen": 164228160,
"step": 1470,
"train_runtime": 7474.0997,
"train_tokens_per_second": 21972.969
},
{
"epoch": 1.515072,
"grad_norm": 1.5390625,
"learning_rate": 4.6667869676146194e-05,
"loss": 0.7399471282958985,
"num_input_tokens_seen": 165347456,
"step": 1480,
"train_runtime": 7525.5655,
"train_tokens_per_second": 21971.433
},
{
"epoch": 1.525312,
"grad_norm": 1.390625,
"learning_rate": 4.6647555449929645e-05,
"loss": 0.7276147842407227,
"num_input_tokens_seen": 166452672,
"step": 1490,
"train_runtime": 7575.6639,
"train_tokens_per_second": 21972.024
},
{
"epoch": 1.535552,
"grad_norm": 1.4453125,
"learning_rate": 4.662726772859869e-05,
"loss": 0.7368722915649414,
"num_input_tokens_seen": 167547520,
"step": 1500,
"train_runtime": 7624.3614,
"train_tokens_per_second": 21975.286
},
{
"epoch": 1.545792,
"grad_norm": 1.3984375,
"learning_rate": 4.660700645456655e-05,
"loss": 0.7236470222473145,
"num_input_tokens_seen": 168664320,
"step": 1510,
"train_runtime": 7674.9645,
"train_tokens_per_second": 21975.909
},
{
"epoch": 1.556032,
"grad_norm": 1.4453125,
"learning_rate": 4.658677157042149e-05,
"loss": 0.7258675575256348,
"num_input_tokens_seen": 169775168,
"step": 1520,
"train_runtime": 7726.0187,
"train_tokens_per_second": 21974.47
},
{
"epoch": 1.566272,
"grad_norm": 1.5,
"learning_rate": 4.656656301892605e-05,
"loss": 0.7226676940917969,
"num_input_tokens_seen": 170910912,
"step": 1530,
"train_runtime": 7777.3904,
"train_tokens_per_second": 21975.355
},
{
"epoch": 1.5765120000000001,
"grad_norm": 1.5,
"learning_rate": 4.6546380743016465e-05,
"loss": 0.7360187530517578,
"num_input_tokens_seen": 172011072,
"step": 1540,
"train_runtime": 7824.7246,
"train_tokens_per_second": 21983.019
},
{
"epoch": 1.5867520000000002,
"grad_norm": 1.46875,
"learning_rate": 4.652622468580193e-05,
"loss": 0.7214366912841796,
"num_input_tokens_seen": 173135616,
"step": 1550,
"train_runtime": 7875.7668,
"train_tokens_per_second": 21983.335
},
{
"epoch": 1.596992,
"grad_norm": 1.4921875,
"learning_rate": 4.650609479056392e-05,
"loss": 0.7311969757080078,
"num_input_tokens_seen": 174239232,
"step": 1560,
"train_runtime": 7923.3292,
"train_tokens_per_second": 21990.659
},
{
"epoch": 1.607232,
"grad_norm": 1.4609375,
"learning_rate": 4.648599100075556e-05,
"loss": 0.7286062240600586,
"num_input_tokens_seen": 175335168,
"step": 1570,
"train_runtime": 7972.5819,
"train_tokens_per_second": 21992.269
},
{
"epoch": 1.617472,
"grad_norm": 1.4765625,
"learning_rate": 4.6465913260000945e-05,
"loss": 0.7191134929656983,
"num_input_tokens_seen": 176463680,
"step": 1580,
"train_runtime": 8025.3812,
"train_tokens_per_second": 21988.199
},
{
"epoch": 1.627712,
"grad_norm": 1.609375,
"learning_rate": 4.644586151209444e-05,
"loss": 0.7198073387145996,
"num_input_tokens_seen": 177578176,
"step": 1590,
"train_runtime": 8076.0558,
"train_tokens_per_second": 21988.23
},
{
"epoch": 1.6379519999999999,
"grad_norm": 1.5390625,
"learning_rate": 4.6425835701000084e-05,
"loss": 0.7295777320861816,
"num_input_tokens_seen": 178670912,
"step": 1600,
"train_runtime": 8124.634,
"train_tokens_per_second": 21991.257
},
{
"epoch": 1.6481919999999999,
"grad_norm": 1.4765625,
"learning_rate": 4.640583577085084e-05,
"loss": 0.7139708518981933,
"num_input_tokens_seen": 179777600,
"step": 1610,
"train_runtime": 8174.4495,
"train_tokens_per_second": 21992.625
},
{
"epoch": 1.658432,
"grad_norm": 1.578125,
"learning_rate": 4.638586166594806e-05,
"loss": 0.733104658126831,
"num_input_tokens_seen": 180869504,
"step": 1620,
"train_runtime": 8223.6421,
"train_tokens_per_second": 21993.844
},
{
"epoch": 1.668672,
"grad_norm": 1.4921875,
"learning_rate": 4.6365913330760726e-05,
"loss": 0.7275556564331055,
"num_input_tokens_seen": 182019072,
"step": 1630,
"train_runtime": 8275.8793,
"train_tokens_per_second": 21993.925
},
{
"epoch": 1.678912,
"grad_norm": 1.4453125,
"learning_rate": 4.6345990709924855e-05,
"loss": 0.7281203269958496,
"num_input_tokens_seen": 183130112,
"step": 1640,
"train_runtime": 8325.9976,
"train_tokens_per_second": 21994.975
},
{
"epoch": 1.689152,
"grad_norm": 1.46875,
"learning_rate": 4.632609374824284e-05,
"loss": 0.7167181968688965,
"num_input_tokens_seen": 184265024,
"step": 1650,
"train_runtime": 8379.0993,
"train_tokens_per_second": 21991.03
},
{
"epoch": 1.699392,
"grad_norm": 1.609375,
"learning_rate": 4.630622239068285e-05,
"loss": 0.7205727100372314,
"num_input_tokens_seen": 185403968,
"step": 1660,
"train_runtime": 8431.432,
"train_tokens_per_second": 21989.618
},
{
"epoch": 1.709632,
"grad_norm": 1.4375,
"learning_rate": 4.628637658237808e-05,
"loss": 0.7173449039459229,
"num_input_tokens_seen": 186535552,
"step": 1670,
"train_runtime": 8482.4669,
"train_tokens_per_second": 21990.72
},
{
"epoch": 1.719872,
"grad_norm": 1.4140625,
"learning_rate": 4.626655626862625e-05,
"loss": 0.7150672912597656,
"num_input_tokens_seen": 187648448,
"step": 1680,
"train_runtime": 8533.219,
"train_tokens_per_second": 21990.347
},
{
"epoch": 1.730112,
"grad_norm": 1.4375,
"learning_rate": 4.624676139488888e-05,
"loss": 0.7177637577056885,
"num_input_tokens_seen": 188770624,
"step": 1690,
"train_runtime": 8582.5231,
"train_tokens_per_second": 21994.77
},
{
"epoch": 1.7403520000000001,
"grad_norm": 1.4296875,
"learning_rate": 4.6226991906790686e-05,
"loss": 0.7107383728027343,
"num_input_tokens_seen": 189905536,
"step": 1700,
"train_runtime": 8635.4296,
"train_tokens_per_second": 21991.441
},
{
"epoch": 1.7505920000000001,
"grad_norm": 1.453125,
"learning_rate": 4.620724775011897e-05,
"loss": 0.7159247398376465,
"num_input_tokens_seen": 191047360,
"step": 1710,
"train_runtime": 8688.7592,
"train_tokens_per_second": 21987.876
},
{
"epoch": 1.760832,
"grad_norm": 1.5,
"learning_rate": 4.618752887082297e-05,
"loss": 0.7231245517730713,
"num_input_tokens_seen": 192176448,
"step": 1720,
"train_runtime": 8739.8956,
"train_tokens_per_second": 21988.415
},
{
"epoch": 1.771072,
"grad_norm": 1.6015625,
"learning_rate": 4.616783521501325e-05,
"loss": 0.7093376159667969,
"num_input_tokens_seen": 193282496,
"step": 1730,
"train_runtime": 8789.6819,
"train_tokens_per_second": 21989.703
},
{
"epoch": 1.781312,
"grad_norm": 1.5078125,
"learning_rate": 4.614816672896108e-05,
"loss": 0.7214728832244873,
"num_input_tokens_seen": 194367808,
"step": 1740,
"train_runtime": 8838.9917,
"train_tokens_per_second": 21989.817
},
{
"epoch": 1.791552,
"grad_norm": 1.484375,
"learning_rate": 4.612852335909782e-05,
"loss": 0.7111657619476318,
"num_input_tokens_seen": 195472320,
"step": 1750,
"train_runtime": 8890.2997,
"train_tokens_per_second": 21987.146
},
{
"epoch": 1.8017919999999998,
"grad_norm": 1.5078125,
"learning_rate": 4.6108905052014323e-05,
"loss": 0.7161635398864746,
"num_input_tokens_seen": 196566912,
"step": 1760,
"train_runtime": 8939.6068,
"train_tokens_per_second": 21988.317
},
{
"epoch": 1.8120319999999999,
"grad_norm": 1.453125,
"learning_rate": 4.608931175446027e-05,
"loss": 0.7039215087890625,
"num_input_tokens_seen": 197692864,
"step": 1770,
"train_runtime": 8991.4052,
"train_tokens_per_second": 21986.871
},
{
"epoch": 1.822272,
"grad_norm": 1.53125,
"learning_rate": 4.606974341334367e-05,
"loss": 0.7046633720397949,
"num_input_tokens_seen": 198851136,
"step": 1780,
"train_runtime": 9045.7861,
"train_tokens_per_second": 21982.737
},
{
"epoch": 1.832512,
"grad_norm": 1.421875,
"learning_rate": 4.605019997573011e-05,
"loss": 0.7108986854553223,
"num_input_tokens_seen": 199991616,
"step": 1790,
"train_runtime": 9098.4241,
"train_tokens_per_second": 21980.907
},
{
"epoch": 1.842752,
"grad_norm": 1.515625,
"learning_rate": 4.603068138884229e-05,
"loss": 0.7045407295227051,
"num_input_tokens_seen": 201125312,
"step": 1800,
"train_runtime": 9149.6357,
"train_tokens_per_second": 21981.784
},
{
"epoch": 1.852992,
"grad_norm": 1.46875,
"learning_rate": 4.6011187600059345e-05,
"loss": 0.7162825584411621,
"num_input_tokens_seen": 202239936,
"step": 1810,
"train_runtime": 9199.9174,
"train_tokens_per_second": 21982.799
},
{
"epoch": 1.863232,
"grad_norm": 1.421875,
"learning_rate": 4.599171855691629e-05,
"loss": 0.7169035911560059,
"num_input_tokens_seen": 203321984,
"step": 1820,
"train_runtime": 9247.0534,
"train_tokens_per_second": 21987.759
},
{
"epoch": 1.873472,
"grad_norm": 1.5390625,
"learning_rate": 4.597227420710335e-05,
"loss": 0.6997568130493164,
"num_input_tokens_seen": 204444032,
"step": 1830,
"train_runtime": 9300.3822,
"train_tokens_per_second": 21982.326
},
{
"epoch": 1.883712,
"grad_norm": 1.4453125,
"learning_rate": 4.595285449846551e-05,
"loss": 0.7147369861602784,
"num_input_tokens_seen": 205551872,
"step": 1840,
"train_runtime": 9350.726,
"train_tokens_per_second": 21982.451
},
{
"epoch": 1.893952,
"grad_norm": 1.4140625,
"learning_rate": 4.593345937900178e-05,
"loss": 0.700528621673584,
"num_input_tokens_seen": 206680128,
"step": 1850,
"train_runtime": 9402.0793,
"train_tokens_per_second": 21982.385
},
{
"epoch": 1.904192,
"grad_norm": 1.4140625,
"learning_rate": 4.591408879686472e-05,
"loss": 0.707237434387207,
"num_input_tokens_seen": 207813696,
"step": 1860,
"train_runtime": 9454.3191,
"train_tokens_per_second": 21980.821
},
{
"epoch": 1.9144320000000001,
"grad_norm": 1.5390625,
"learning_rate": 4.5894742700359775e-05,
"loss": 0.7043401718139648,
"num_input_tokens_seen": 208895808,
"step": 1870,
"train_runtime": 9502.5318,
"train_tokens_per_second": 21983.174
},
{
"epoch": 1.9246720000000002,
"grad_norm": 1.4140625,
"learning_rate": 4.587542103794477e-05,
"loss": 0.7066624641418457,
"num_input_tokens_seen": 210025600,
"step": 1880,
"train_runtime": 9553.8388,
"train_tokens_per_second": 21983.373
},
{
"epoch": 1.934912,
"grad_norm": 1.515625,
"learning_rate": 4.5856123758229247e-05,
"loss": 0.7068476676940918,
"num_input_tokens_seen": 211141184,
"step": 1890,
"train_runtime": 9604.6551,
"train_tokens_per_second": 21983.214
},
{
"epoch": 1.945152,
"grad_norm": 1.484375,
"learning_rate": 4.5836850809973993e-05,
"loss": 0.7084201812744141,
"num_input_tokens_seen": 212250112,
"step": 1900,
"train_runtime": 9653.8675,
"train_tokens_per_second": 21986.019
},
{
"epoch": 1.955392,
"grad_norm": 1.3984375,
"learning_rate": 4.5817602142090385e-05,
"loss": 0.6999262809753418,
"num_input_tokens_seen": 213370240,
"step": 1910,
"train_runtime": 9704.8849,
"train_tokens_per_second": 21985.86
},
{
"epoch": 1.965632,
"grad_norm": 1.4375,
"learning_rate": 4.579837770363989e-05,
"loss": 0.7026149749755859,
"num_input_tokens_seen": 214511104,
"step": 1920,
"train_runtime": 9757.8534,
"train_tokens_per_second": 21983.432
},
{
"epoch": 1.9758719999999999,
"grad_norm": 1.5234375,
"learning_rate": 4.57791774438334e-05,
"loss": 0.7023416042327881,
"num_input_tokens_seen": 215629504,
"step": 1930,
"train_runtime": 9807.0125,
"train_tokens_per_second": 21987.277
},
{
"epoch": 1.9861119999999999,
"grad_norm": 1.46875,
"learning_rate": 4.576000131203078e-05,
"loss": 0.7092232704162598,
"num_input_tokens_seen": 216746880,
"step": 1940,
"train_runtime": 9858.8618,
"train_tokens_per_second": 21984.98
},
{
"epoch": 1.996352,
"grad_norm": 1.5078125,
"learning_rate": 4.574084925774023e-05,
"loss": 0.6931307792663575,
"num_input_tokens_seen": 217858496,
"step": 1950,
"train_runtime": 9908.0458,
"train_tokens_per_second": 21988.039
},
{
"epoch": 2.006144,
"grad_norm": 2.203125,
"learning_rate": 4.5721721230617795e-05,
"loss": 0.6160273551940918,
"num_input_tokens_seen": 218918208,
"step": 1960,
"train_runtime": 9957.3271,
"train_tokens_per_second": 21985.64
},
{
"epoch": 2.016384,
"grad_norm": 1.5625,
"learning_rate": 4.57026171804667e-05,
"loss": 0.5476226806640625,
"num_input_tokens_seen": 220009600,
"step": 1970,
"train_runtime": 10005.4786,
"train_tokens_per_second": 21988.913
},
{
"epoch": 2.026624,
"grad_norm": 1.578125,
"learning_rate": 4.568353705723692e-05,
"loss": 0.5443649768829346,
"num_input_tokens_seen": 221112448,
"step": 1980,
"train_runtime": 10053.8591,
"train_tokens_per_second": 21992.794
},
{
"epoch": 2.036864,
"grad_norm": 1.6953125,
"learning_rate": 4.566448081102455e-05,
"loss": 0.530079698562622,
"num_input_tokens_seen": 222236352,
"step": 1990,
"train_runtime": 10106.2355,
"train_tokens_per_second": 21990.023
},
{
"epoch": 2.047104,
"grad_norm": 1.5859375,
"learning_rate": 4.564544839207128e-05,
"loss": 0.5314745426177978,
"num_input_tokens_seen": 223371840,
"step": 2000,
"train_runtime": 10157.507,
"train_tokens_per_second": 21990.813
},
{
"epoch": 2.057344,
"grad_norm": 1.703125,
"learning_rate": 4.562643975076387e-05,
"loss": 0.536113691329956,
"num_input_tokens_seen": 224505152,
"step": 2010,
"train_runtime": 10210.6596,
"train_tokens_per_second": 21987.331
},
{
"epoch": 2.067584,
"grad_norm": 1.6640625,
"learning_rate": 4.560745483763357e-05,
"loss": 0.537871265411377,
"num_input_tokens_seen": 225609024,
"step": 2020,
"train_runtime": 10260.9136,
"train_tokens_per_second": 21987.226
},
{
"epoch": 2.077824,
"grad_norm": 1.7109375,
"learning_rate": 4.5588493603355595e-05,
"loss": 0.5416299819946289,
"num_input_tokens_seen": 226721728,
"step": 2030,
"train_runtime": 10310.4748,
"train_tokens_per_second": 21989.456
},
{
"epoch": 2.088064,
"grad_norm": 1.5703125,
"learning_rate": 4.556955599874859e-05,
"loss": 0.5329193592071533,
"num_input_tokens_seen": 227839680,
"step": 2040,
"train_runtime": 10362.1302,
"train_tokens_per_second": 21987.726
},
{
"epoch": 2.098304,
"grad_norm": 1.5234375,
"learning_rate": 4.555064197477409e-05,
"loss": 0.5448167800903321,
"num_input_tokens_seen": 228945344,
"step": 2050,
"train_runtime": 10411.8833,
"train_tokens_per_second": 21988.85
},
{
"epoch": 2.108544,
"grad_norm": 1.6015625,
"learning_rate": 4.5531751482536e-05,
"loss": 0.5400659084320069,
"num_input_tokens_seen": 230068608,
"step": 2060,
"train_runtime": 10461.9263,
"train_tokens_per_second": 21991.037
},
{
"epoch": 2.118784,
"grad_norm": 1.6015625,
"learning_rate": 4.5512884473280024e-05,
"loss": 0.5294137954711914,
"num_input_tokens_seen": 231161728,
"step": 2070,
"train_runtime": 10511.7551,
"train_tokens_per_second": 21990.783
},
{
"epoch": 2.129024,
"grad_norm": 1.65625,
"learning_rate": 4.549404089839322e-05,
"loss": 0.535043478012085,
"num_input_tokens_seen": 232286656,
"step": 2080,
"train_runtime": 10562.4846,
"train_tokens_per_second": 21991.668
},
{
"epoch": 2.139264,
"grad_norm": 1.6875,
"learning_rate": 4.547522070940335e-05,
"loss": 0.5406003952026367,
"num_input_tokens_seen": 233403328,
"step": 2090,
"train_runtime": 10614.5795,
"train_tokens_per_second": 21988.938
},
{
"epoch": 2.149504,
"grad_norm": 1.65625,
"learning_rate": 4.545642385797848e-05,
"loss": 0.5352214813232422,
"num_input_tokens_seen": 234542400,
"step": 2100,
"train_runtime": 10668.2079,
"train_tokens_per_second": 21985.173
},
{
"epoch": 2.159744,
"grad_norm": 1.59375,
"learning_rate": 4.543765029592637e-05,
"loss": 0.5299077987670898,
"num_input_tokens_seen": 235650624,
"step": 2110,
"train_runtime": 10718.8559,
"train_tokens_per_second": 21984.681
},
{
"epoch": 2.169984,
"grad_norm": 1.6640625,
"learning_rate": 4.541889997519403e-05,
"loss": 0.5387727737426757,
"num_input_tokens_seen": 236777600,
"step": 2120,
"train_runtime": 10769.6328,
"train_tokens_per_second": 21985.671
},
{
"epoch": 2.180224,
"grad_norm": 1.625,
"learning_rate": 4.5400172847867095e-05,
"loss": 0.5402078628540039,
"num_input_tokens_seen": 237897728,
"step": 2130,
"train_runtime": 10820.7737,
"train_tokens_per_second": 21985.279
},
{
"epoch": 2.190464,
"grad_norm": 1.6484375,
"learning_rate": 4.5381468866169466e-05,
"loss": 0.5417552947998047,
"num_input_tokens_seen": 238992704,
"step": 2140,
"train_runtime": 10869.1633,
"train_tokens_per_second": 21988.142
},
{
"epoch": 2.200704,
"grad_norm": 1.7109375,
"learning_rate": 4.5362787982462616e-05,
"loss": 0.530327320098877,
"num_input_tokens_seen": 240146496,
"step": 2150,
"train_runtime": 10922.9566,
"train_tokens_per_second": 21985.485
},
{
"epoch": 2.210944,
"grad_norm": 1.671875,
"learning_rate": 4.5344130149245275e-05,
"loss": 0.5349247932434082,
"num_input_tokens_seen": 241241856,
"step": 2160,
"train_runtime": 10972.6208,
"train_tokens_per_second": 21985.801
},
{
"epoch": 2.221184,
"grad_norm": 1.6328125,
"learning_rate": 4.5325495319152715e-05,
"loss": 0.5235861301422119,
"num_input_tokens_seen": 242377600,
"step": 2170,
"train_runtime": 11025.3999,
"train_tokens_per_second": 21983.565
},
{
"epoch": 2.231424,
"grad_norm": 1.640625,
"learning_rate": 4.530688344495644e-05,
"loss": 0.5335872173309326,
"num_input_tokens_seen": 243525248,
"step": 2180,
"train_runtime": 11078.0924,
"train_tokens_per_second": 21982.598
},
{
"epoch": 2.241664,
"grad_norm": 1.6328125,
"learning_rate": 4.528829447956357e-05,
"loss": 0.5255549430847168,
"num_input_tokens_seen": 244661248,
"step": 2190,
"train_runtime": 11129.5816,
"train_tokens_per_second": 21982.969
},
{
"epoch": 2.251904,
"grad_norm": 1.734375,
"learning_rate": 4.526972837601633e-05,
"loss": 0.5395485877990722,
"num_input_tokens_seen": 245780800,
"step": 2200,
"train_runtime": 11180.2882,
"train_tokens_per_second": 21983.405
},
{
"epoch": 2.262144,
"grad_norm": 1.7734375,
"learning_rate": 4.525118508749165e-05,
"loss": 0.5427422523498535,
"num_input_tokens_seen": 246870912,
"step": 2210,
"train_runtime": 11229.0191,
"train_tokens_per_second": 21985.083
},
{
"epoch": 2.272384,
"grad_norm": 1.6796875,
"learning_rate": 4.5232664567300546e-05,
"loss": 0.5383429527282715,
"num_input_tokens_seen": 247963136,
"step": 2220,
"train_runtime": 11278.2198,
"train_tokens_per_second": 21986.017
},
{
"epoch": 2.282624,
"grad_norm": 1.703125,
"learning_rate": 4.521416676888773e-05,
"loss": 0.5311496257781982,
"num_input_tokens_seen": 249098240,
"step": 2230,
"train_runtime": 11331.4261,
"train_tokens_per_second": 21982.956
},
{
"epoch": 2.292864,
"grad_norm": 1.65625,
"learning_rate": 4.519569164583107e-05,
"loss": 0.5386343479156495,
"num_input_tokens_seen": 250219840,
"step": 2240,
"train_runtime": 11382.8605,
"train_tokens_per_second": 21982.158
},
{
"epoch": 2.303104,
"grad_norm": 1.671875,
"learning_rate": 4.517723915184109e-05,
"loss": 0.5370828628540039,
"num_input_tokens_seen": 251317952,
"step": 2250,
"train_runtime": 11431.9094,
"train_tokens_per_second": 21983.9
},
{
"epoch": 2.313344,
"grad_norm": 1.6875,
"learning_rate": 4.5158809240760506e-05,
"loss": 0.5292394638061524,
"num_input_tokens_seen": 252466688,
"step": 2260,
"train_runtime": 11485.1849,
"train_tokens_per_second": 21981.944
},
{
"epoch": 2.323584,
"grad_norm": 1.6640625,
"learning_rate": 4.514040186656375e-05,
"loss": 0.5335429191589356,
"num_input_tokens_seen": 253612992,
"step": 2270,
"train_runtime": 11538.6494,
"train_tokens_per_second": 21979.435
},
{
"epoch": 2.333824,
"grad_norm": 1.625,
"learning_rate": 4.512201698335644e-05,
"loss": 0.5375387668609619,
"num_input_tokens_seen": 254732480,
"step": 2280,
"train_runtime": 11590.0261,
"train_tokens_per_second": 21978.594
},
{
"epoch": 2.344064,
"grad_norm": 1.75,
"learning_rate": 4.510365454537496e-05,
"loss": 0.5277575492858887,
"num_input_tokens_seen": 255856448,
"step": 2290,
"train_runtime": 11640.5446,
"train_tokens_per_second": 21979.766
},
{
"epoch": 2.354304,
"grad_norm": 1.65625,
"learning_rate": 4.5085314506985945e-05,
"loss": 0.523950719833374,
"num_input_tokens_seen": 256999168,
"step": 2300,
"train_runtime": 11692.6859,
"train_tokens_per_second": 21979.481
},
{
"epoch": 2.364544,
"grad_norm": 1.625,
"learning_rate": 4.50669968226858e-05,
"loss": 0.5421285629272461,
"num_input_tokens_seen": 258137984,
"step": 2310,
"train_runtime": 11745.5264,
"train_tokens_per_second": 21977.558
},
{
"epoch": 2.374784,
"grad_norm": 1.6953125,
"learning_rate": 4.504870144710027e-05,
"loss": 0.5283915996551514,
"num_input_tokens_seen": 259258496,
"step": 2320,
"train_runtime": 11796.224,
"train_tokens_per_second": 21978.092
},
{
"epoch": 2.385024,
"grad_norm": 1.65625,
"learning_rate": 4.5030428334983884e-05,
"loss": 0.5356220245361328,
"num_input_tokens_seen": 260398080,
"step": 2330,
"train_runtime": 11850.3858,
"train_tokens_per_second": 21973.806
},
{
"epoch": 2.395264,
"grad_norm": 1.5859375,
"learning_rate": 4.501217744121959e-05,
"loss": 0.5268114089965821,
"num_input_tokens_seen": 261541440,
"step": 2340,
"train_runtime": 11903.3512,
"train_tokens_per_second": 21972.085
},
{
"epoch": 2.405504,
"grad_norm": 1.75,
"learning_rate": 4.499394872081821e-05,
"loss": 0.5375988960266114,
"num_input_tokens_seen": 262635264,
"step": 2350,
"train_runtime": 11951.8181,
"train_tokens_per_second": 21974.503
},
{
"epoch": 2.415744,
"grad_norm": 1.7578125,
"learning_rate": 4.4975742128918e-05,
"loss": 0.5376396656036377,
"num_input_tokens_seen": 263740288,
"step": 2360,
"train_runtime": 12000.2326,
"train_tokens_per_second": 21977.931
},
{
"epoch": 2.425984,
"grad_norm": 1.6953125,
"learning_rate": 4.495755762078418e-05,
"loss": 0.5323172569274902,
"num_input_tokens_seen": 264867968,
"step": 2370,
"train_runtime": 12050.7407,
"train_tokens_per_second": 21979.393
},
{
"epoch": 2.436224,
"grad_norm": 1.7578125,
"learning_rate": 4.49393951518085e-05,
"loss": 0.5391307830810547,
"num_input_tokens_seen": 265965440,
"step": 2380,
"train_runtime": 12099.6065,
"train_tokens_per_second": 21981.33
},
{
"epoch": 2.446464,
"grad_norm": 1.6171875,
"learning_rate": 4.4921254677508716e-05,
"loss": 0.5373844146728516,
"num_input_tokens_seen": 267080128,
"step": 2390,
"train_runtime": 12149.1708,
"train_tokens_per_second": 21983.404
},
{
"epoch": 2.456704,
"grad_norm": 1.7578125,
"learning_rate": 4.490313615352821e-05,
"loss": 0.5455498218536377,
"num_input_tokens_seen": 268188096,
"step": 2400,
"train_runtime": 12200.2497,
"train_tokens_per_second": 21982.181
},
{
"epoch": 2.466944,
"grad_norm": 1.734375,
"learning_rate": 4.48850395356355e-05,
"loss": 0.5363270759582519,
"num_input_tokens_seen": 269321984,
"step": 2410,
"train_runtime": 12254.3616,
"train_tokens_per_second": 21977.643
},
{
"epoch": 2.477184,
"grad_norm": 1.75,
"learning_rate": 4.486696477972375e-05,
"loss": 0.5418241024017334,
"num_input_tokens_seen": 270419776,
"step": 2420,
"train_runtime": 12303.7844,
"train_tokens_per_second": 21978.585
},
{
"epoch": 2.487424,
"grad_norm": 1.7890625,
"learning_rate": 4.484891184181041e-05,
"loss": 0.5297726631164551,
"num_input_tokens_seen": 271548736,
"step": 2430,
"train_runtime": 12354.5613,
"train_tokens_per_second": 21979.634
},
{
"epoch": 2.497664,
"grad_norm": 1.7734375,
"learning_rate": 4.483088067803662e-05,
"loss": 0.5376968383789062,
"num_input_tokens_seen": 272650816,
"step": 2440,
"train_runtime": 12403.0155,
"train_tokens_per_second": 21982.623
},
{
"epoch": 2.507904,
"grad_norm": 1.7734375,
"learning_rate": 4.481287124466697e-05,
"loss": 0.5285521507263183,
"num_input_tokens_seen": 273744576,
"step": 2450,
"train_runtime": 12451.1849,
"train_tokens_per_second": 21985.424
},
{
"epoch": 2.518144,
"grad_norm": 1.6640625,
"learning_rate": 4.479488349808885e-05,
"loss": 0.5299195289611817,
"num_input_tokens_seen": 274848640,
"step": 2460,
"train_runtime": 12503.3338,
"train_tokens_per_second": 21982.029
},
{
"epoch": 2.528384,
"grad_norm": 1.71875,
"learning_rate": 4.4776917394812114e-05,
"loss": 0.5259761810302734,
"num_input_tokens_seen": 275977600,
"step": 2470,
"train_runtime": 12556.4141,
"train_tokens_per_second": 21979.014
},
{
"epoch": 2.538624,
"grad_norm": 1.765625,
"learning_rate": 4.475897289146862e-05,
"loss": 0.5346611022949219,
"num_input_tokens_seen": 277115072,
"step": 2480,
"train_runtime": 12607.8823,
"train_tokens_per_second": 21979.51
},
{
"epoch": 2.548864,
"grad_norm": 1.7109375,
"learning_rate": 4.4741049944811806e-05,
"loss": 0.5369565963745118,
"num_input_tokens_seen": 278210816,
"step": 2490,
"train_runtime": 12655.8676,
"train_tokens_per_second": 21982.753
},
{
"epoch": 2.559104,
"grad_norm": 1.703125,
"learning_rate": 4.472314851171621e-05,
"loss": 0.5275493621826172,
"num_input_tokens_seen": 279331968,
"step": 2500,
"train_runtime": 12707.0061,
"train_tokens_per_second": 21982.516
},
{
"epoch": 2.569344,
"grad_norm": 1.6796875,
"learning_rate": 4.4705268549177084e-05,
"loss": 0.5220746040344239,
"num_input_tokens_seen": 280461056,
"step": 2510,
"train_runtime": 12758.6493,
"train_tokens_per_second": 21982.033
},
{
"epoch": 2.579584,
"grad_norm": 1.7890625,
"learning_rate": 4.468741001430989e-05,
"loss": 0.5226367950439453,
"num_input_tokens_seen": 281572608,
"step": 2520,
"train_runtime": 12809.5121,
"train_tokens_per_second": 21981.525
},
{
"epoch": 2.589824,
"grad_norm": 1.6328125,
"learning_rate": 4.466957286434997e-05,
"loss": 0.515837574005127,
"num_input_tokens_seen": 282737216,
"step": 2530,
"train_runtime": 12865.3707,
"train_tokens_per_second": 21976.609
},
{
"epoch": 2.600064,
"grad_norm": 1.8046875,
"learning_rate": 4.4651757056652e-05,
"loss": 0.5301560401916504,
"num_input_tokens_seen": 283827008,
"step": 2540,
"train_runtime": 12913.3246,
"train_tokens_per_second": 21979.391
},
{
"epoch": 2.610304,
"grad_norm": 1.65625,
"learning_rate": 4.463396254868968e-05,
"loss": 0.5253063201904297,
"num_input_tokens_seen": 284983680,
"step": 2550,
"train_runtime": 12967.0493,
"train_tokens_per_second": 21977.527
},
{
"epoch": 2.6205439999999998,
"grad_norm": 1.765625,
"learning_rate": 4.461618929805519e-05,
"loss": 0.5248900890350342,
"num_input_tokens_seen": 286077504,
"step": 2560,
"train_runtime": 13015.9506,
"train_tokens_per_second": 21978.994
},
{
"epoch": 2.6307840000000002,
"grad_norm": 1.5390625,
"learning_rate": 4.459843726245888e-05,
"loss": 0.53463134765625,
"num_input_tokens_seen": 287207168,
"step": 2570,
"train_runtime": 13067.1302,
"train_tokens_per_second": 21979.361
},
{
"epoch": 2.641024,
"grad_norm": 1.9140625,
"learning_rate": 4.458070639972875e-05,
"loss": 0.5340803146362305,
"num_input_tokens_seen": 288307776,
"step": 2580,
"train_runtime": 13115.1727,
"train_tokens_per_second": 21982.766
},
{
"epoch": 2.651264,
"grad_norm": 1.6875,
"learning_rate": 4.456299666781007e-05,
"loss": 0.5143898963928223,
"num_input_tokens_seen": 289491392,
"step": 2590,
"train_runtime": 13173.1381,
"train_tokens_per_second": 21975.887
},
{
"epoch": 2.661504,
"grad_norm": 1.7421875,
"learning_rate": 4.4545308024764984e-05,
"loss": 0.5279585838317871,
"num_input_tokens_seen": 290588288,
"step": 2600,
"train_runtime": 13222.1712,
"train_tokens_per_second": 21977.35
},
{
"epoch": 2.671744,
"grad_norm": 1.7890625,
"learning_rate": 4.452764042877207e-05,
"loss": 0.5243070602416993,
"num_input_tokens_seen": 291706432,
"step": 2610,
"train_runtime": 13274.0598,
"train_tokens_per_second": 21975.676
},
{
"epoch": 2.681984,
"grad_norm": 1.7265625,
"learning_rate": 4.45099938381259e-05,
"loss": 0.525565767288208,
"num_input_tokens_seen": 292825664,
"step": 2620,
"train_runtime": 13324.5762,
"train_tokens_per_second": 21976.359
},
{
"epoch": 2.692224,
"grad_norm": 1.828125,
"learning_rate": 4.449236821123667e-05,
"loss": 0.5281280040740967,
"num_input_tokens_seen": 293933504,
"step": 2630,
"train_runtime": 13375.6314,
"train_tokens_per_second": 21975.299
},
{
"epoch": 2.702464,
"grad_norm": 1.65625,
"learning_rate": 4.447476350662976e-05,
"loss": 0.5201663017272949,
"num_input_tokens_seen": 295024000,
"step": 2640,
"train_runtime": 13424.3426,
"train_tokens_per_second": 21976.793
},
{
"epoch": 2.712704,
"grad_norm": 1.859375,
"learning_rate": 4.4457179682945346e-05,
"loss": 0.5273939609527588,
"num_input_tokens_seen": 296126464,
"step": 2650,
"train_runtime": 13473.9229,
"train_tokens_per_second": 21977.747
},
{
"epoch": 2.722944,
"grad_norm": 1.7109375,
"learning_rate": 4.443961669893798e-05,
"loss": 0.5174345970153809,
"num_input_tokens_seen": 297259712,
"step": 2660,
"train_runtime": 13524.4385,
"train_tokens_per_second": 21979.449
},
{
"epoch": 2.733184,
"grad_norm": 1.8046875,
"learning_rate": 4.4422074513476155e-05,
"loss": 0.528529167175293,
"num_input_tokens_seen": 298367680,
"step": 2670,
"train_runtime": 13574.6209,
"train_tokens_per_second": 21979.817
},
{
"epoch": 2.743424,
"grad_norm": 1.859375,
"learning_rate": 4.4404553085541955e-05,
"loss": 0.5198683738708496,
"num_input_tokens_seen": 299497536,
"step": 2680,
"train_runtime": 13624.3324,
"train_tokens_per_second": 21982.548
},
{
"epoch": 2.753664,
"grad_norm": 1.71875,
"learning_rate": 4.438705237423063e-05,
"loss": 0.5379956245422364,
"num_input_tokens_seen": 300608512,
"step": 2690,
"train_runtime": 13673.7031,
"train_tokens_per_second": 21984.426
},
{
"epoch": 2.763904,
"grad_norm": 1.734375,
"learning_rate": 4.436957233875017e-05,
"loss": 0.5276507377624512,
"num_input_tokens_seen": 301702976,
"step": 2700,
"train_runtime": 13722.51,
"train_tokens_per_second": 21985.991
},
{
"epoch": 2.774144,
"grad_norm": 1.734375,
"learning_rate": 4.4352112938420956e-05,
"loss": 0.5213168144226075,
"num_input_tokens_seen": 302851072,
"step": 2710,
"train_runtime": 13775.4093,
"train_tokens_per_second": 21984.906
},
{
"epoch": 2.784384,
"grad_norm": 1.78125,
"learning_rate": 4.433467413267529e-05,
"loss": 0.5262949943542481,
"num_input_tokens_seen": 303937408,
"step": 2720,
"train_runtime": 13823.4103,
"train_tokens_per_second": 21987.151
},
{
"epoch": 2.7946239999999998,
"grad_norm": 1.8125,
"learning_rate": 4.431725588105708e-05,
"loss": 0.5267552852630615,
"num_input_tokens_seen": 305070272,
"step": 2730,
"train_runtime": 13876.6879,
"train_tokens_per_second": 21984.372
},
{
"epoch": 2.8048640000000002,
"grad_norm": 1.7265625,
"learning_rate": 4.4299858143221377e-05,
"loss": 0.5038492202758789,
"num_input_tokens_seen": 306205888,
"step": 2740,
"train_runtime": 13927.2204,
"train_tokens_per_second": 21986.145
},
{
"epoch": 2.815104,
"grad_norm": 1.8515625,
"learning_rate": 4.4282480878934065e-05,
"loss": 0.5188664436340332,
"num_input_tokens_seen": 307332736,
"step": 2750,
"train_runtime": 13978.2805,
"train_tokens_per_second": 21986.448
},
{
"epoch": 2.825344,
"grad_norm": 1.671875,
"learning_rate": 4.4265124048071346e-05,
"loss": 0.5213587760925293,
"num_input_tokens_seen": 308433152,
"step": 2760,
"train_runtime": 14028.0474,
"train_tokens_per_second": 21986.891
},
{
"epoch": 2.835584,
"grad_norm": 1.7890625,
"learning_rate": 4.4247787610619477e-05,
"loss": 0.5300797462463379,
"num_input_tokens_seen": 309529920,
"step": 2770,
"train_runtime": 14076.4147,
"train_tokens_per_second": 21989.258
},
{
"epoch": 2.845824,
"grad_norm": 1.859375,
"learning_rate": 4.42304715266743e-05,
"loss": 0.5275647640228271,
"num_input_tokens_seen": 310620032,
"step": 2780,
"train_runtime": 14125.9713,
"train_tokens_per_second": 21989.287
},
{
"epoch": 2.856064,
"grad_norm": 1.828125,
"learning_rate": 4.421317575644092e-05,
"loss": 0.5151683807373046,
"num_input_tokens_seen": 311744704,
"step": 2790,
"train_runtime": 14177.2729,
"train_tokens_per_second": 21989.046
},
{
"epoch": 2.866304,
"grad_norm": 1.890625,
"learning_rate": 4.419590026023325e-05,
"loss": 0.5277010440826416,
"num_input_tokens_seen": 312862848,
"step": 2800,
"train_runtime": 14228.7469,
"train_tokens_per_second": 21988.082
},
{
"epoch": 2.876544,
"grad_norm": 1.765625,
"learning_rate": 4.417864499847368e-05,
"loss": 0.5130796432495117,
"num_input_tokens_seen": 313974848,
"step": 2810,
"train_runtime": 14277.693,
"train_tokens_per_second": 21990.587
},
{
"epoch": 2.886784,
"grad_norm": 1.796875,
"learning_rate": 4.4161409931692676e-05,
"loss": 0.5243385791778564,
"num_input_tokens_seen": 315060032,
"step": 2820,
"train_runtime": 14325.4746,
"train_tokens_per_second": 21992.991
},
{
"epoch": 2.897024,
"grad_norm": 1.734375,
"learning_rate": 4.414419502052841e-05,
"loss": 0.5174403667449952,
"num_input_tokens_seen": 316182976,
"step": 2830,
"train_runtime": 14374.9907,
"train_tokens_per_second": 21995.352
},
{
"epoch": 2.907264,
"grad_norm": 1.78125,
"learning_rate": 4.412700022572637e-05,
"loss": 0.5114859580993653,
"num_input_tokens_seen": 317286656,
"step": 2840,
"train_runtime": 14423.521,
"train_tokens_per_second": 21997.864
},
{
"epoch": 2.917504,
"grad_norm": 1.890625,
"learning_rate": 4.410982550813902e-05,
"loss": 0.5237509727478027,
"num_input_tokens_seen": 318388160,
"step": 2850,
"train_runtime": 14473.9697,
"train_tokens_per_second": 21997.293
},
{
"epoch": 2.927744,
"grad_norm": 1.78125,
"learning_rate": 4.409267082872535e-05,
"loss": 0.5249311447143554,
"num_input_tokens_seen": 319492928,
"step": 2860,
"train_runtime": 14523.7571,
"train_tokens_per_second": 21997.953
},
{
"epoch": 2.937984,
"grad_norm": 1.828125,
"learning_rate": 4.407553614855059e-05,
"loss": 0.515770959854126,
"num_input_tokens_seen": 320622336,
"step": 2870,
"train_runtime": 14577.3266,
"train_tokens_per_second": 21994.591
},
{
"epoch": 2.9482239999999997,
"grad_norm": 1.796875,
"learning_rate": 4.405842142878579e-05,
"loss": 0.5268994331359863,
"num_input_tokens_seen": 321735488,
"step": 2880,
"train_runtime": 14627.1239,
"train_tokens_per_second": 21995.813
},
{
"epoch": 2.958464,
"grad_norm": 1.765625,
"learning_rate": 4.404132663070745e-05,
"loss": 0.5111500740051269,
"num_input_tokens_seen": 322857728,
"step": 2890,
"train_runtime": 14678.6828,
"train_tokens_per_second": 21995.007
},
{
"epoch": 2.968704,
"grad_norm": 1.78125,
"learning_rate": 4.402425171569716e-05,
"loss": 0.5016695499420166,
"num_input_tokens_seen": 323996736,
"step": 2900,
"train_runtime": 14731.4275,
"train_tokens_per_second": 21993.574
},
{
"epoch": 2.9789440000000003,
"grad_norm": 1.75,
"learning_rate": 4.400719664524127e-05,
"loss": 0.5131624221801758,
"num_input_tokens_seen": 325130944,
"step": 2910,
"train_runtime": 14783.7526,
"train_tokens_per_second": 21992.45
},
{
"epoch": 2.989184,
"grad_norm": 1.8203125,
"learning_rate": 4.399016138093044e-05,
"loss": 0.5178108215332031,
"num_input_tokens_seen": 326241984,
"step": 2920,
"train_runtime": 14834.9455,
"train_tokens_per_second": 21991.451
},
{
"epoch": 2.999424,
"grad_norm": 1.765625,
"learning_rate": 4.397314588445937e-05,
"loss": 0.5120769500732422,
"num_input_tokens_seen": 327359424,
"step": 2930,
"train_runtime": 14885.5036,
"train_tokens_per_second": 21991.827
},
{
"epoch": 3.0,
"eval_loss": 0.8352677822113037,
"eval_runtime": 1.2873,
"eval_samples_per_second": 774.519,
"eval_steps_per_second": 6.215,
"num_input_tokens_seen": 327416064,
"step": 2931
},
{
"epoch": 3.0,
"num_input_tokens_seen": 327416064,
"step": 2931,
"total_flos": 5.451032989129507e+18,
"train_loss": 0.7516615965776337,
"train_runtime": 14909.6648,
"train_samples_per_second": 201.212,
"train_steps_per_second": 0.197
}
],
"logging_steps": 10,
"max_steps": 2931,
"num_input_tokens_seen": 327416064,
"num_train_epochs": 3,
"save_steps": 5000,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 5.451032989129507e+18,
"train_batch_size": 8,
"trial_name": null,
"trial_params": null
}