2984 lines
83 KiB
JSON
2984 lines
83 KiB
JSON
{
|
|
"best_global_step": 2931,
|
|
"best_metric": 0.8352677822113037,
|
|
"best_model_checkpoint": "/workspace/MT_En_Ukrainian/checkpoint-2931",
|
|
"epoch": 3.0,
|
|
"eval_steps": 5000,
|
|
"global_step": 2931,
|
|
"is_hyper_param_search": false,
|
|
"is_local_process_zero": true,
|
|
"is_world_process_zero": true,
|
|
"log_history": [
|
|
{
|
|
"epoch": 0.01024,
|
|
"grad_norm": 2.453125,
|
|
"learning_rate": 4.9977515176118345e-05,
|
|
"loss": 1.942220687866211,
|
|
"num_input_tokens_seen": 1145728,
|
|
"step": 10,
|
|
"train_runtime": 55.0006,
|
|
"train_tokens_per_second": 20831.189
|
|
},
|
|
{
|
|
"epoch": 0.02048,
|
|
"grad_norm": 1.859375,
|
|
"learning_rate": 4.9952567580506e-05,
|
|
"loss": 1.3728597640991211,
|
|
"num_input_tokens_seen": 2258496,
|
|
"step": 20,
|
|
"train_runtime": 104.7954,
|
|
"train_tokens_per_second": 21551.485
|
|
},
|
|
{
|
|
"epoch": 0.03072,
|
|
"grad_norm": 1.7734375,
|
|
"learning_rate": 4.992765730738634e-05,
|
|
"loss": 1.2849248886108398,
|
|
"num_input_tokens_seen": 3382784,
|
|
"step": 30,
|
|
"train_runtime": 157.2016,
|
|
"train_tokens_per_second": 21518.764
|
|
},
|
|
{
|
|
"epoch": 0.04096,
|
|
"grad_norm": 1.6953125,
|
|
"learning_rate": 4.9902784263792476e-05,
|
|
"loss": 1.2331731796264649,
|
|
"num_input_tokens_seen": 4511424,
|
|
"step": 40,
|
|
"train_runtime": 208.2613,
|
|
"train_tokens_per_second": 21662.324
|
|
},
|
|
{
|
|
"epoch": 0.0512,
|
|
"grad_norm": 1.703125,
|
|
"learning_rate": 4.987794835708133e-05,
|
|
"loss": 1.2049736022949218,
|
|
"num_input_tokens_seen": 5639296,
|
|
"step": 50,
|
|
"train_runtime": 259.7804,
|
|
"train_tokens_per_second": 21707.936
|
|
},
|
|
{
|
|
"epoch": 0.06144,
|
|
"grad_norm": 1.6328125,
|
|
"learning_rate": 4.985314949493234e-05,
|
|
"loss": 1.1723523139953613,
|
|
"num_input_tokens_seen": 6769920,
|
|
"step": 60,
|
|
"train_runtime": 312.433,
|
|
"train_tokens_per_second": 21668.387
|
|
},
|
|
{
|
|
"epoch": 0.07168,
|
|
"grad_norm": 1.6171875,
|
|
"learning_rate": 4.982838758534584e-05,
|
|
"loss": 1.1766769409179687,
|
|
"num_input_tokens_seen": 7888320,
|
|
"step": 70,
|
|
"train_runtime": 362.5602,
|
|
"train_tokens_per_second": 21757.267
|
|
},
|
|
{
|
|
"epoch": 0.08192,
|
|
"grad_norm": 1.71875,
|
|
"learning_rate": 4.980366253664179e-05,
|
|
"loss": 1.1496356010437012,
|
|
"num_input_tokens_seen": 8977472,
|
|
"step": 80,
|
|
"train_runtime": 410.6394,
|
|
"train_tokens_per_second": 21862.179
|
|
},
|
|
{
|
|
"epoch": 0.09216,
|
|
"grad_norm": 1.7578125,
|
|
"learning_rate": 4.977897425745825e-05,
|
|
"loss": 1.137571430206299,
|
|
"num_input_tokens_seen": 10075968,
|
|
"step": 90,
|
|
"train_runtime": 460.2896,
|
|
"train_tokens_per_second": 21890.499
|
|
},
|
|
{
|
|
"epoch": 0.1024,
|
|
"grad_norm": 1.7421875,
|
|
"learning_rate": 4.975432265674997e-05,
|
|
"loss": 1.1251113891601563,
|
|
"num_input_tokens_seen": 11202944,
|
|
"step": 100,
|
|
"train_runtime": 513.0638,
|
|
"train_tokens_per_second": 21835.384
|
|
},
|
|
{
|
|
"epoch": 0.11264,
|
|
"grad_norm": 1.8125,
|
|
"learning_rate": 4.972970764378705e-05,
|
|
"loss": 1.1137601852416992,
|
|
"num_input_tokens_seen": 12323840,
|
|
"step": 110,
|
|
"train_runtime": 563.4486,
|
|
"train_tokens_per_second": 21872.164
|
|
},
|
|
{
|
|
"epoch": 0.12288,
|
|
"grad_norm": 1.6875,
|
|
"learning_rate": 4.970512912815344e-05,
|
|
"loss": 1.1156309127807618,
|
|
"num_input_tokens_seen": 13415296,
|
|
"step": 120,
|
|
"train_runtime": 611.3984,
|
|
"train_tokens_per_second": 21941.987
|
|
},
|
|
{
|
|
"epoch": 0.13312,
|
|
"grad_norm": 1.625,
|
|
"learning_rate": 4.968058701974564e-05,
|
|
"loss": 1.0775527954101562,
|
|
"num_input_tokens_seen": 14525376,
|
|
"step": 130,
|
|
"train_runtime": 661.1947,
|
|
"train_tokens_per_second": 21968.378
|
|
},
|
|
{
|
|
"epoch": 0.14336,
|
|
"grad_norm": 1.5078125,
|
|
"learning_rate": 4.96560812287712e-05,
|
|
"loss": 1.0942869186401367,
|
|
"num_input_tokens_seen": 15666688,
|
|
"step": 140,
|
|
"train_runtime": 713.2845,
|
|
"train_tokens_per_second": 21964.151
|
|
},
|
|
{
|
|
"epoch": 0.1536,
|
|
"grad_norm": 1.6484375,
|
|
"learning_rate": 4.963161166574748e-05,
|
|
"loss": 1.0775710105895997,
|
|
"num_input_tokens_seen": 16793216,
|
|
"step": 150,
|
|
"train_runtime": 764.6867,
|
|
"train_tokens_per_second": 21960.91
|
|
},
|
|
{
|
|
"epoch": 0.16384,
|
|
"grad_norm": 1.609375,
|
|
"learning_rate": 4.960717824150013e-05,
|
|
"loss": 1.085141944885254,
|
|
"num_input_tokens_seen": 17913856,
|
|
"step": 160,
|
|
"train_runtime": 815.3899,
|
|
"train_tokens_per_second": 21969.68
|
|
},
|
|
{
|
|
"epoch": 0.17408,
|
|
"grad_norm": 1.6171875,
|
|
"learning_rate": 4.9582780867161893e-05,
|
|
"loss": 1.0794735908508302,
|
|
"num_input_tokens_seen": 19033472,
|
|
"step": 170,
|
|
"train_runtime": 867.281,
|
|
"train_tokens_per_second": 21946.141
|
|
},
|
|
{
|
|
"epoch": 0.18432,
|
|
"grad_norm": 1.6328125,
|
|
"learning_rate": 4.955841945417105e-05,
|
|
"loss": 1.045860481262207,
|
|
"num_input_tokens_seen": 20146688,
|
|
"step": 180,
|
|
"train_runtime": 918.094,
|
|
"train_tokens_per_second": 21944.036
|
|
},
|
|
{
|
|
"epoch": 0.19456,
|
|
"grad_norm": 1.6953125,
|
|
"learning_rate": 4.953409391427024e-05,
|
|
"loss": 1.0552400588989257,
|
|
"num_input_tokens_seen": 21293184,
|
|
"step": 190,
|
|
"train_runtime": 971.8022,
|
|
"train_tokens_per_second": 21911.027
|
|
},
|
|
{
|
|
"epoch": 0.2048,
|
|
"grad_norm": 1.6015625,
|
|
"learning_rate": 4.950980415950502e-05,
|
|
"loss": 1.0574710845947266,
|
|
"num_input_tokens_seen": 22405824,
|
|
"step": 200,
|
|
"train_runtime": 1021.2273,
|
|
"train_tokens_per_second": 21940.094
|
|
},
|
|
{
|
|
"epoch": 0.21504,
|
|
"grad_norm": 1.5078125,
|
|
"learning_rate": 4.9485550102222575e-05,
|
|
"loss": 1.047713565826416,
|
|
"num_input_tokens_seen": 23526720,
|
|
"step": 210,
|
|
"train_runtime": 1072.7388,
|
|
"train_tokens_per_second": 21931.452
|
|
},
|
|
{
|
|
"epoch": 0.22528,
|
|
"grad_norm": 1.546875,
|
|
"learning_rate": 4.946133165507037e-05,
|
|
"loss": 1.037226676940918,
|
|
"num_input_tokens_seen": 24651328,
|
|
"step": 220,
|
|
"train_runtime": 1124.4387,
|
|
"train_tokens_per_second": 21923.229
|
|
},
|
|
{
|
|
"epoch": 0.23552,
|
|
"grad_norm": 1.6171875,
|
|
"learning_rate": 4.943714873099483e-05,
|
|
"loss": 1.035720443725586,
|
|
"num_input_tokens_seen": 25753088,
|
|
"step": 230,
|
|
"train_runtime": 1173.7005,
|
|
"train_tokens_per_second": 21941.788
|
|
},
|
|
{
|
|
"epoch": 0.24576,
|
|
"grad_norm": 1.546875,
|
|
"learning_rate": 4.9413001243240024e-05,
|
|
"loss": 1.0342046737670898,
|
|
"num_input_tokens_seen": 26905856,
|
|
"step": 240,
|
|
"train_runtime": 1226.2471,
|
|
"train_tokens_per_second": 21941.627
|
|
},
|
|
{
|
|
"epoch": 0.256,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 4.938888910534637e-05,
|
|
"loss": 1.0358741760253907,
|
|
"num_input_tokens_seen": 28028864,
|
|
"step": 250,
|
|
"train_runtime": 1276.4532,
|
|
"train_tokens_per_second": 21958.396
|
|
},
|
|
{
|
|
"epoch": 0.26624,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 4.936481223114932e-05,
|
|
"loss": 1.038590431213379,
|
|
"num_input_tokens_seen": 29126976,
|
|
"step": 260,
|
|
"train_runtime": 1327.1722,
|
|
"train_tokens_per_second": 21946.643
|
|
},
|
|
{
|
|
"epoch": 0.27648,
|
|
"grad_norm": 1.59375,
|
|
"learning_rate": 4.934077053477808e-05,
|
|
"loss": 1.0328522682189942,
|
|
"num_input_tokens_seen": 30254208,
|
|
"step": 270,
|
|
"train_runtime": 1378.9466,
|
|
"train_tokens_per_second": 21940.087
|
|
},
|
|
{
|
|
"epoch": 0.28672,
|
|
"grad_norm": 1.59375,
|
|
"learning_rate": 4.931676393065431e-05,
|
|
"loss": 1.0223213195800782,
|
|
"num_input_tokens_seen": 31405888,
|
|
"step": 280,
|
|
"train_runtime": 1432.0252,
|
|
"train_tokens_per_second": 21931.1
|
|
},
|
|
{
|
|
"epoch": 0.29696,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 4.929279233349088e-05,
|
|
"loss": 1.0172260284423829,
|
|
"num_input_tokens_seen": 32506432,
|
|
"step": 290,
|
|
"train_runtime": 1481.5865,
|
|
"train_tokens_per_second": 21940.286
|
|
},
|
|
{
|
|
"epoch": 0.3072,
|
|
"grad_norm": 1.5625,
|
|
"learning_rate": 4.926885565829051e-05,
|
|
"loss": 1.016135025024414,
|
|
"num_input_tokens_seen": 33610176,
|
|
"step": 300,
|
|
"train_runtime": 1531.0711,
|
|
"train_tokens_per_second": 21952.067
|
|
},
|
|
{
|
|
"epoch": 0.31744,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 4.924495382034461e-05,
|
|
"loss": 1.0107959747314452,
|
|
"num_input_tokens_seen": 34707264,
|
|
"step": 310,
|
|
"train_runtime": 1580.5249,
|
|
"train_tokens_per_second": 21959.327
|
|
},
|
|
{
|
|
"epoch": 0.32768,
|
|
"grad_norm": 1.5078125,
|
|
"learning_rate": 4.9221086735231975e-05,
|
|
"loss": 1.002080535888672,
|
|
"num_input_tokens_seen": 35822272,
|
|
"step": 320,
|
|
"train_runtime": 1631.8076,
|
|
"train_tokens_per_second": 21952.51
|
|
},
|
|
{
|
|
"epoch": 0.33792,
|
|
"grad_norm": 1.5703125,
|
|
"learning_rate": 4.919725431881751e-05,
|
|
"loss": 1.0000602722167968,
|
|
"num_input_tokens_seen": 36959680,
|
|
"step": 330,
|
|
"train_runtime": 1685.6469,
|
|
"train_tokens_per_second": 21926.11
|
|
},
|
|
{
|
|
"epoch": 0.34816,
|
|
"grad_norm": 1.5390625,
|
|
"learning_rate": 4.917345648725101e-05,
|
|
"loss": 1.0111896514892578,
|
|
"num_input_tokens_seen": 38092160,
|
|
"step": 340,
|
|
"train_runtime": 1736.6097,
|
|
"train_tokens_per_second": 21934.785
|
|
},
|
|
{
|
|
"epoch": 0.3584,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 4.914969315696596e-05,
|
|
"loss": 1.010312271118164,
|
|
"num_input_tokens_seen": 39182848,
|
|
"step": 350,
|
|
"train_runtime": 1785.0368,
|
|
"train_tokens_per_second": 21950.723
|
|
},
|
|
{
|
|
"epoch": 0.36864,
|
|
"grad_norm": 1.5625,
|
|
"learning_rate": 4.912596424467818e-05,
|
|
"loss": 0.9806657791137695,
|
|
"num_input_tokens_seen": 40318272,
|
|
"step": 360,
|
|
"train_runtime": 1838.6514,
|
|
"train_tokens_per_second": 21928.176
|
|
},
|
|
{
|
|
"epoch": 0.37888,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 4.910226966738475e-05,
|
|
"loss": 0.9908489227294922,
|
|
"num_input_tokens_seen": 41443072,
|
|
"step": 370,
|
|
"train_runtime": 1888.8124,
|
|
"train_tokens_per_second": 21941.338
|
|
},
|
|
{
|
|
"epoch": 0.38912,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 4.9078609342362666e-05,
|
|
"loss": 0.973599624633789,
|
|
"num_input_tokens_seen": 42587392,
|
|
"step": 380,
|
|
"train_runtime": 1944.2016,
|
|
"train_tokens_per_second": 21904.823
|
|
},
|
|
{
|
|
"epoch": 0.39936,
|
|
"grad_norm": 1.5703125,
|
|
"learning_rate": 4.905498318716775e-05,
|
|
"loss": 0.9856637954711914,
|
|
"num_input_tokens_seen": 43704832,
|
|
"step": 390,
|
|
"train_runtime": 1994.7284,
|
|
"train_tokens_per_second": 21910.167
|
|
},
|
|
{
|
|
"epoch": 0.4096,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 4.9031391119633295e-05,
|
|
"loss": 0.9691889762878418,
|
|
"num_input_tokens_seen": 44831360,
|
|
"step": 400,
|
|
"train_runtime": 2045.3596,
|
|
"train_tokens_per_second": 21918.571
|
|
},
|
|
{
|
|
"epoch": 0.41984,
|
|
"grad_norm": 1.546875,
|
|
"learning_rate": 4.9007833057869e-05,
|
|
"loss": 0.9910012245178222,
|
|
"num_input_tokens_seen": 45943168,
|
|
"step": 410,
|
|
"train_runtime": 2095.8494,
|
|
"train_tokens_per_second": 21921.025
|
|
},
|
|
{
|
|
"epoch": 0.43008,
|
|
"grad_norm": 1.5,
|
|
"learning_rate": 4.898430892025967e-05,
|
|
"loss": 0.9832890510559082,
|
|
"num_input_tokens_seen": 47060288,
|
|
"step": 420,
|
|
"train_runtime": 2146.7011,
|
|
"train_tokens_per_second": 21922.143
|
|
},
|
|
{
|
|
"epoch": 0.44032,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 4.896081862546415e-05,
|
|
"loss": 0.9752557754516602,
|
|
"num_input_tokens_seen": 48185472,
|
|
"step": 430,
|
|
"train_runtime": 2198.7956,
|
|
"train_tokens_per_second": 21914.485
|
|
},
|
|
{
|
|
"epoch": 0.45056,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 4.8937362092414e-05,
|
|
"loss": 0.9778125762939454,
|
|
"num_input_tokens_seen": 49256448,
|
|
"step": 440,
|
|
"train_runtime": 2246.1336,
|
|
"train_tokens_per_second": 21929.438
|
|
},
|
|
{
|
|
"epoch": 0.4608,
|
|
"grad_norm": 1.4921875,
|
|
"learning_rate": 4.891393924031244e-05,
|
|
"loss": 0.9636163711547852,
|
|
"num_input_tokens_seen": 50374592,
|
|
"step": 450,
|
|
"train_runtime": 2296.6263,
|
|
"train_tokens_per_second": 21934.17
|
|
},
|
|
{
|
|
"epoch": 0.47104,
|
|
"grad_norm": 1.515625,
|
|
"learning_rate": 4.8890549988633095e-05,
|
|
"loss": 0.9704037666320801,
|
|
"num_input_tokens_seen": 51485248,
|
|
"step": 460,
|
|
"train_runtime": 2346.8324,
|
|
"train_tokens_per_second": 21938.187
|
|
},
|
|
{
|
|
"epoch": 0.48128,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 4.8867194257118907e-05,
|
|
"loss": 0.9702651977539063,
|
|
"num_input_tokens_seen": 52604160,
|
|
"step": 470,
|
|
"train_runtime": 2397.7165,
|
|
"train_tokens_per_second": 21939.274
|
|
},
|
|
{
|
|
"epoch": 0.49152,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 4.884387196578093e-05,
|
|
"loss": 0.9792324066162109,
|
|
"num_input_tokens_seen": 53710144,
|
|
"step": 480,
|
|
"train_runtime": 2448.6532,
|
|
"train_tokens_per_second": 21934.566
|
|
},
|
|
{
|
|
"epoch": 0.50176,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 4.882058303489718e-05,
|
|
"loss": 0.9673162460327148,
|
|
"num_input_tokens_seen": 54830272,
|
|
"step": 490,
|
|
"train_runtime": 2500.2972,
|
|
"train_tokens_per_second": 21929.502
|
|
},
|
|
{
|
|
"epoch": 0.512,
|
|
"grad_norm": 1.5703125,
|
|
"learning_rate": 4.8797327385011496e-05,
|
|
"loss": 0.9507923126220703,
|
|
"num_input_tokens_seen": 55928384,
|
|
"step": 500,
|
|
"train_runtime": 2549.596,
|
|
"train_tokens_per_second": 21936.175
|
|
},
|
|
{
|
|
"epoch": 0.52224,
|
|
"grad_norm": 1.53125,
|
|
"learning_rate": 4.8774104936932425e-05,
|
|
"loss": 0.9491652488708496,
|
|
"num_input_tokens_seen": 57048704,
|
|
"step": 510,
|
|
"train_runtime": 2597.7871,
|
|
"train_tokens_per_second": 21960.5
|
|
},
|
|
{
|
|
"epoch": 0.53248,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 4.8750915611732076e-05,
|
|
"loss": 0.9639401435852051,
|
|
"num_input_tokens_seen": 58140160,
|
|
"step": 520,
|
|
"train_runtime": 2646.0597,
|
|
"train_tokens_per_second": 21972.353
|
|
},
|
|
{
|
|
"epoch": 0.54272,
|
|
"grad_norm": 1.5625,
|
|
"learning_rate": 4.8727759330744986e-05,
|
|
"loss": 0.9479743957519531,
|
|
"num_input_tokens_seen": 59267200,
|
|
"step": 530,
|
|
"train_runtime": 2698.4747,
|
|
"train_tokens_per_second": 21963.222
|
|
},
|
|
{
|
|
"epoch": 0.55296,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 4.870463601556696e-05,
|
|
"loss": 0.9524721145629883,
|
|
"num_input_tokens_seen": 60421504,
|
|
"step": 540,
|
|
"train_runtime": 2750.3842,
|
|
"train_tokens_per_second": 21968.387
|
|
},
|
|
{
|
|
"epoch": 0.5632,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 4.8681545588054075e-05,
|
|
"loss": 0.962583065032959,
|
|
"num_input_tokens_seen": 61505280,
|
|
"step": 550,
|
|
"train_runtime": 2798.047,
|
|
"train_tokens_per_second": 21981.504
|
|
},
|
|
{
|
|
"epoch": 0.57344,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 4.8658487970321404e-05,
|
|
"loss": 0.9441762924194336,
|
|
"num_input_tokens_seen": 62611136,
|
|
"step": 560,
|
|
"train_runtime": 2847.1648,
|
|
"train_tokens_per_second": 21990.696
|
|
},
|
|
{
|
|
"epoch": 0.58368,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 4.863546308474209e-05,
|
|
"loss": 0.9428766250610352,
|
|
"num_input_tokens_seen": 63731712,
|
|
"step": 570,
|
|
"train_runtime": 2898.5894,
|
|
"train_tokens_per_second": 21987.147
|
|
},
|
|
{
|
|
"epoch": 0.59392,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 4.86124708539461e-05,
|
|
"loss": 0.9273331642150879,
|
|
"num_input_tokens_seen": 64828608,
|
|
"step": 580,
|
|
"train_runtime": 2948.7617,
|
|
"train_tokens_per_second": 21985.028
|
|
},
|
|
{
|
|
"epoch": 0.60416,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 4.8589511200819216e-05,
|
|
"loss": 0.9427030563354493,
|
|
"num_input_tokens_seen": 65924608,
|
|
"step": 590,
|
|
"train_runtime": 2996.6383,
|
|
"train_tokens_per_second": 21999.521
|
|
},
|
|
{
|
|
"epoch": 0.6144,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 4.8566584048501926e-05,
|
|
"loss": 0.9379173278808594,
|
|
"num_input_tokens_seen": 67042624,
|
|
"step": 600,
|
|
"train_runtime": 3048.7405,
|
|
"train_tokens_per_second": 21990.269
|
|
},
|
|
{
|
|
"epoch": 0.62464,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 4.854368932038835e-05,
|
|
"loss": 0.9400325775146484,
|
|
"num_input_tokens_seen": 68149376,
|
|
"step": 610,
|
|
"train_runtime": 3097.9096,
|
|
"train_tokens_per_second": 21998.503
|
|
},
|
|
{
|
|
"epoch": 0.63488,
|
|
"grad_norm": 1.5234375,
|
|
"learning_rate": 4.8520826940125144e-05,
|
|
"loss": 0.9410287857055664,
|
|
"num_input_tokens_seen": 69264256,
|
|
"step": 620,
|
|
"train_runtime": 3149.7216,
|
|
"train_tokens_per_second": 21990.596
|
|
},
|
|
{
|
|
"epoch": 0.64512,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 4.849799683161046e-05,
|
|
"loss": 0.9263475418090821,
|
|
"num_input_tokens_seen": 70435904,
|
|
"step": 630,
|
|
"train_runtime": 3202.5382,
|
|
"train_tokens_per_second": 21993.775
|
|
},
|
|
{
|
|
"epoch": 0.65536,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 4.8475198918992835e-05,
|
|
"loss": 0.9329448699951172,
|
|
"num_input_tokens_seen": 71552896,
|
|
"step": 640,
|
|
"train_runtime": 3253.1308,
|
|
"train_tokens_per_second": 21995.088
|
|
},
|
|
{
|
|
"epoch": 0.6656,
|
|
"grad_norm": 1.3203125,
|
|
"learning_rate": 4.845243312667023e-05,
|
|
"loss": 0.9400642395019532,
|
|
"num_input_tokens_seen": 72646400,
|
|
"step": 650,
|
|
"train_runtime": 3302.0912,
|
|
"train_tokens_per_second": 22000.119
|
|
},
|
|
{
|
|
"epoch": 0.67584,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 4.842969937928884e-05,
|
|
"loss": 0.9307914733886719,
|
|
"num_input_tokens_seen": 73760192,
|
|
"step": 660,
|
|
"train_runtime": 3351.4596,
|
|
"train_tokens_per_second": 22008.379
|
|
},
|
|
{
|
|
"epoch": 0.68608,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 4.840699760174217e-05,
|
|
"loss": 0.9233476638793945,
|
|
"num_input_tokens_seen": 74882496,
|
|
"step": 670,
|
|
"train_runtime": 3402.821,
|
|
"train_tokens_per_second": 22006.005
|
|
},
|
|
{
|
|
"epoch": 0.69632,
|
|
"grad_norm": 1.34375,
|
|
"learning_rate": 4.8384327719169906e-05,
|
|
"loss": 0.9302739143371582,
|
|
"num_input_tokens_seen": 76004736,
|
|
"step": 680,
|
|
"train_runtime": 3455.3873,
|
|
"train_tokens_per_second": 21996.011
|
|
},
|
|
{
|
|
"epoch": 0.70656,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 4.836168965695694e-05,
|
|
"loss": 0.9305820465087891,
|
|
"num_input_tokens_seen": 77100736,
|
|
"step": 690,
|
|
"train_runtime": 3503.451,
|
|
"train_tokens_per_second": 22007.083
|
|
},
|
|
{
|
|
"epoch": 0.7168,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 4.8339083340732304e-05,
|
|
"loss": 0.9203786849975586,
|
|
"num_input_tokens_seen": 78219136,
|
|
"step": 700,
|
|
"train_runtime": 3553.2121,
|
|
"train_tokens_per_second": 22013.641
|
|
},
|
|
{
|
|
"epoch": 0.72704,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 4.8316508696368154e-05,
|
|
"loss": 0.9239031791687011,
|
|
"num_input_tokens_seen": 79310848,
|
|
"step": 710,
|
|
"train_runtime": 3602.0368,
|
|
"train_tokens_per_second": 22018.334
|
|
},
|
|
{
|
|
"epoch": 0.73728,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 4.8293965649978714e-05,
|
|
"loss": 0.9024551391601563,
|
|
"num_input_tokens_seen": 80425728,
|
|
"step": 720,
|
|
"train_runtime": 3653.6123,
|
|
"train_tokens_per_second": 22012.66
|
|
},
|
|
{
|
|
"epoch": 0.74752,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 4.8271454127919364e-05,
|
|
"loss": 0.9112434387207031,
|
|
"num_input_tokens_seen": 81496320,
|
|
"step": 730,
|
|
"train_runtime": 3699.8035,
|
|
"train_tokens_per_second": 22027.202
|
|
},
|
|
{
|
|
"epoch": 0.75776,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 4.824897405678549e-05,
|
|
"loss": 0.9149089813232422,
|
|
"num_input_tokens_seen": 82645120,
|
|
"step": 740,
|
|
"train_runtime": 3753.9121,
|
|
"train_tokens_per_second": 22015.731
|
|
},
|
|
{
|
|
"epoch": 0.768,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 4.8226525363411576e-05,
|
|
"loss": 0.9063904762268067,
|
|
"num_input_tokens_seen": 83764288,
|
|
"step": 750,
|
|
"train_runtime": 3806.5124,
|
|
"train_tokens_per_second": 22005.521
|
|
},
|
|
{
|
|
"epoch": 0.77824,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 4.820410797487017e-05,
|
|
"loss": 0.9081829071044922,
|
|
"num_input_tokens_seen": 84887744,
|
|
"step": 760,
|
|
"train_runtime": 3859.7215,
|
|
"train_tokens_per_second": 21993.23
|
|
},
|
|
{
|
|
"epoch": 0.78848,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 4.818172181847091e-05,
|
|
"loss": 0.8958653450012207,
|
|
"num_input_tokens_seen": 86004992,
|
|
"step": 770,
|
|
"train_runtime": 3911.8203,
|
|
"train_tokens_per_second": 21985.926
|
|
},
|
|
{
|
|
"epoch": 0.79872,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 4.81593668217595e-05,
|
|
"loss": 0.9148517608642578,
|
|
"num_input_tokens_seen": 87105216,
|
|
"step": 780,
|
|
"train_runtime": 3961.6794,
|
|
"train_tokens_per_second": 21986.942
|
|
},
|
|
{
|
|
"epoch": 0.80896,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 4.813704291251675e-05,
|
|
"loss": 0.9078433990478516,
|
|
"num_input_tokens_seen": 88239680,
|
|
"step": 790,
|
|
"train_runtime": 4013.5881,
|
|
"train_tokens_per_second": 21985.236
|
|
},
|
|
{
|
|
"epoch": 0.8192,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 4.811475001875759e-05,
|
|
"loss": 0.9124856948852539,
|
|
"num_input_tokens_seen": 89349568,
|
|
"step": 800,
|
|
"train_runtime": 4062.7697,
|
|
"train_tokens_per_second": 21992.28
|
|
},
|
|
{
|
|
"epoch": 0.82944,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 4.8092488068730105e-05,
|
|
"loss": 0.9061111450195313,
|
|
"num_input_tokens_seen": 90469312,
|
|
"step": 810,
|
|
"train_runtime": 4115.7452,
|
|
"train_tokens_per_second": 21981.271
|
|
},
|
|
{
|
|
"epoch": 0.83968,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 4.807025699091452e-05,
|
|
"loss": 0.8909177780151367,
|
|
"num_input_tokens_seen": 91591424,
|
|
"step": 820,
|
|
"train_runtime": 4167.5795,
|
|
"train_tokens_per_second": 21977.127
|
|
},
|
|
{
|
|
"epoch": 0.84992,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 4.8048056714022325e-05,
|
|
"loss": 0.8970900535583496,
|
|
"num_input_tokens_seen": 92718336,
|
|
"step": 830,
|
|
"train_runtime": 4219.1054,
|
|
"train_tokens_per_second": 21975.828
|
|
},
|
|
{
|
|
"epoch": 0.86016,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 4.802588716699519e-05,
|
|
"loss": 0.9085554122924805,
|
|
"num_input_tokens_seen": 93814400,
|
|
"step": 840,
|
|
"train_runtime": 4268.8362,
|
|
"train_tokens_per_second": 21976.575
|
|
},
|
|
{
|
|
"epoch": 0.8704,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 4.8003748279004156e-05,
|
|
"loss": 0.8963174819946289,
|
|
"num_input_tokens_seen": 94937408,
|
|
"step": 850,
|
|
"train_runtime": 4321.9061,
|
|
"train_tokens_per_second": 21966.56
|
|
},
|
|
{
|
|
"epoch": 0.88064,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 4.798163997944854e-05,
|
|
"loss": 0.9105907440185547,
|
|
"num_input_tokens_seen": 96048512,
|
|
"step": 860,
|
|
"train_runtime": 4371.8613,
|
|
"train_tokens_per_second": 21969.707
|
|
},
|
|
{
|
|
"epoch": 0.89088,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 4.79595621979551e-05,
|
|
"loss": 0.877834415435791,
|
|
"num_input_tokens_seen": 97193472,
|
|
"step": 870,
|
|
"train_runtime": 4425.9231,
|
|
"train_tokens_per_second": 21960.046
|
|
},
|
|
{
|
|
"epoch": 0.90112,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 4.793751486437702e-05,
|
|
"loss": 0.8991375923156738,
|
|
"num_input_tokens_seen": 98317184,
|
|
"step": 880,
|
|
"train_runtime": 4476.7825,
|
|
"train_tokens_per_second": 21961.573
|
|
},
|
|
{
|
|
"epoch": 0.91136,
|
|
"grad_norm": 1.515625,
|
|
"learning_rate": 4.7915497908793064e-05,
|
|
"loss": 0.8886856079101563,
|
|
"num_input_tokens_seen": 99450688,
|
|
"step": 890,
|
|
"train_runtime": 4529.0422,
|
|
"train_tokens_per_second": 21958.437
|
|
},
|
|
{
|
|
"epoch": 0.9216,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 4.7893511261506516e-05,
|
|
"loss": 0.902672004699707,
|
|
"num_input_tokens_seen": 100563840,
|
|
"step": 900,
|
|
"train_runtime": 4579.192,
|
|
"train_tokens_per_second": 21961.045
|
|
},
|
|
{
|
|
"epoch": 0.93184,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 4.787155485304435e-05,
|
|
"loss": 0.8937115669250488,
|
|
"num_input_tokens_seen": 101656640,
|
|
"step": 910,
|
|
"train_runtime": 4627.8649,
|
|
"train_tokens_per_second": 21966.208
|
|
},
|
|
{
|
|
"epoch": 0.94208,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 4.784962861415629e-05,
|
|
"loss": 0.9013708114624024,
|
|
"num_input_tokens_seen": 102780288,
|
|
"step": 920,
|
|
"train_runtime": 4679.0445,
|
|
"train_tokens_per_second": 21966.085
|
|
},
|
|
{
|
|
"epoch": 0.95232,
|
|
"grad_norm": 1.296875,
|
|
"learning_rate": 4.7827732475813884e-05,
|
|
"loss": 0.8749137878417969,
|
|
"num_input_tokens_seen": 103933056,
|
|
"step": 930,
|
|
"train_runtime": 4732.6015,
|
|
"train_tokens_per_second": 21961.083
|
|
},
|
|
{
|
|
"epoch": 0.96256,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 4.7805866369209576e-05,
|
|
"loss": 0.8961335182189941,
|
|
"num_input_tokens_seen": 105038016,
|
|
"step": 940,
|
|
"train_runtime": 4782.7459,
|
|
"train_tokens_per_second": 21961.864
|
|
},
|
|
{
|
|
"epoch": 0.9728,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 4.778403022575583e-05,
|
|
"loss": 0.874142074584961,
|
|
"num_input_tokens_seen": 106174336,
|
|
"step": 950,
|
|
"train_runtime": 4836.32,
|
|
"train_tokens_per_second": 21953.538
|
|
},
|
|
{
|
|
"epoch": 0.98304,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 4.7762223977084195e-05,
|
|
"loss": 0.8942262649536132,
|
|
"num_input_tokens_seen": 107277440,
|
|
"step": 960,
|
|
"train_runtime": 4886.8487,
|
|
"train_tokens_per_second": 21952.273
|
|
},
|
|
{
|
|
"epoch": 0.99328,
|
|
"grad_norm": 1.3125,
|
|
"learning_rate": 4.774044755504444e-05,
|
|
"loss": 0.8799090385437012,
|
|
"num_input_tokens_seen": 108394496,
|
|
"step": 970,
|
|
"train_runtime": 4938.6396,
|
|
"train_tokens_per_second": 21948.25
|
|
},
|
|
{
|
|
"epoch": 1.003072,
|
|
"grad_norm": 1.25,
|
|
"learning_rate": 4.7718700891703616e-05,
|
|
"loss": 0.8489143371582031,
|
|
"num_input_tokens_seen": 109453888,
|
|
"step": 980,
|
|
"train_runtime": 4987.1553,
|
|
"train_tokens_per_second": 21947.158
|
|
},
|
|
{
|
|
"epoch": 1.013312,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 4.7696983919345215e-05,
|
|
"loss": 0.7443439483642578,
|
|
"num_input_tokens_seen": 110580736,
|
|
"step": 990,
|
|
"train_runtime": 5038.9713,
|
|
"train_tokens_per_second": 21945.101
|
|
},
|
|
{
|
|
"epoch": 1.023552,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 4.7675296570468216e-05,
|
|
"loss": 0.7479698181152343,
|
|
"num_input_tokens_seen": 111723136,
|
|
"step": 1000,
|
|
"train_runtime": 5092.4363,
|
|
"train_tokens_per_second": 21939.034
|
|
},
|
|
{
|
|
"epoch": 1.033792,
|
|
"grad_norm": 1.5,
|
|
"learning_rate": 4.76536387777863e-05,
|
|
"loss": 0.7372268676757813,
|
|
"num_input_tokens_seen": 112836800,
|
|
"step": 1010,
|
|
"train_runtime": 5144.5655,
|
|
"train_tokens_per_second": 21933.203
|
|
},
|
|
{
|
|
"epoch": 1.044032,
|
|
"grad_norm": 1.3828125,
|
|
"learning_rate": 4.7632010474226915e-05,
|
|
"loss": 0.7579574584960938,
|
|
"num_input_tokens_seen": 113961088,
|
|
"step": 1020,
|
|
"train_runtime": 5195.725,
|
|
"train_tokens_per_second": 21933.626
|
|
},
|
|
{
|
|
"epoch": 1.054272,
|
|
"grad_norm": 1.59375,
|
|
"learning_rate": 4.761041159293035e-05,
|
|
"loss": 0.7489605903625488,
|
|
"num_input_tokens_seen": 115089984,
|
|
"step": 1030,
|
|
"train_runtime": 5247.5552,
|
|
"train_tokens_per_second": 21932.115
|
|
},
|
|
{
|
|
"epoch": 1.064512,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 4.7588842067249e-05,
|
|
"loss": 0.7482340812683106,
|
|
"num_input_tokens_seen": 116217216,
|
|
"step": 1040,
|
|
"train_runtime": 5299.9058,
|
|
"train_tokens_per_second": 21928.167
|
|
},
|
|
{
|
|
"epoch": 1.074752,
|
|
"grad_norm": 1.5078125,
|
|
"learning_rate": 4.756730183074637e-05,
|
|
"loss": 0.7579518318176269,
|
|
"num_input_tokens_seen": 117347648,
|
|
"step": 1050,
|
|
"train_runtime": 5351.066,
|
|
"train_tokens_per_second": 21929.77
|
|
},
|
|
{
|
|
"epoch": 1.084992,
|
|
"grad_norm": 1.4921875,
|
|
"learning_rate": 4.7545790817196314e-05,
|
|
"loss": 0.7438392639160156,
|
|
"num_input_tokens_seen": 118493632,
|
|
"step": 1060,
|
|
"train_runtime": 5405.5478,
|
|
"train_tokens_per_second": 21920.744
|
|
},
|
|
{
|
|
"epoch": 1.095232,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 4.752430896058212e-05,
|
|
"loss": 0.7573630332946777,
|
|
"num_input_tokens_seen": 119595776,
|
|
"step": 1070,
|
|
"train_runtime": 5455.0034,
|
|
"train_tokens_per_second": 21924.052
|
|
},
|
|
{
|
|
"epoch": 1.105472,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 4.750285619509567e-05,
|
|
"loss": 0.7446182250976563,
|
|
"num_input_tokens_seen": 120728576,
|
|
"step": 1080,
|
|
"train_runtime": 5507.7373,
|
|
"train_tokens_per_second": 21919.814
|
|
},
|
|
{
|
|
"epoch": 1.115712,
|
|
"grad_norm": 1.40625,
|
|
"learning_rate": 4.7481432455136644e-05,
|
|
"loss": 0.7489546775817871,
|
|
"num_input_tokens_seen": 121851968,
|
|
"step": 1090,
|
|
"train_runtime": 5559.0243,
|
|
"train_tokens_per_second": 21919.668
|
|
},
|
|
{
|
|
"epoch": 1.125952,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 4.7460037675311584e-05,
|
|
"loss": 0.757651948928833,
|
|
"num_input_tokens_seen": 122954752,
|
|
"step": 1100,
|
|
"train_runtime": 5608.2123,
|
|
"train_tokens_per_second": 21924.054
|
|
},
|
|
{
|
|
"epoch": 1.136192,
|
|
"grad_norm": 1.375,
|
|
"learning_rate": 4.7438671790433126e-05,
|
|
"loss": 0.7577178955078125,
|
|
"num_input_tokens_seen": 124052416,
|
|
"step": 1110,
|
|
"train_runtime": 5657.5424,
|
|
"train_tokens_per_second": 21926.909
|
|
},
|
|
{
|
|
"epoch": 1.146432,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 4.741733473551915e-05,
|
|
"loss": 0.7523440361022949,
|
|
"num_input_tokens_seen": 125165248,
|
|
"step": 1120,
|
|
"train_runtime": 5707.4101,
|
|
"train_tokens_per_second": 21930.306
|
|
},
|
|
{
|
|
"epoch": 1.156672,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 4.7396026445791966e-05,
|
|
"loss": 0.7425838470458984,
|
|
"num_input_tokens_seen": 126283840,
|
|
"step": 1130,
|
|
"train_runtime": 5759.366,
|
|
"train_tokens_per_second": 21926.691
|
|
},
|
|
{
|
|
"epoch": 1.166912,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 4.737474685667742e-05,
|
|
"loss": 0.7449512004852294,
|
|
"num_input_tokens_seen": 127421952,
|
|
"step": 1140,
|
|
"train_runtime": 5811.4353,
|
|
"train_tokens_per_second": 21926.072
|
|
},
|
|
{
|
|
"epoch": 1.177152,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 4.7353495903804165e-05,
|
|
"loss": 0.761650562286377,
|
|
"num_input_tokens_seen": 128504576,
|
|
"step": 1150,
|
|
"train_runtime": 5859.1852,
|
|
"train_tokens_per_second": 21932.158
|
|
},
|
|
{
|
|
"epoch": 1.187392,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 4.733227352300277e-05,
|
|
"loss": 0.7624397277832031,
|
|
"num_input_tokens_seen": 129617728,
|
|
"step": 1160,
|
|
"train_runtime": 5908.742,
|
|
"train_tokens_per_second": 21936.603
|
|
},
|
|
{
|
|
"epoch": 1.197632,
|
|
"grad_norm": 1.5234375,
|
|
"learning_rate": 4.731107965030496e-05,
|
|
"loss": 0.756078052520752,
|
|
"num_input_tokens_seen": 130713728,
|
|
"step": 1170,
|
|
"train_runtime": 5959.2042,
|
|
"train_tokens_per_second": 21934.762
|
|
},
|
|
{
|
|
"epoch": 1.207872,
|
|
"grad_norm": 1.3515625,
|
|
"learning_rate": 4.728991422194278e-05,
|
|
"loss": 0.7492989063262939,
|
|
"num_input_tokens_seen": 131802368,
|
|
"step": 1180,
|
|
"train_runtime": 6008.2874,
|
|
"train_tokens_per_second": 21936.762
|
|
},
|
|
{
|
|
"epoch": 1.218112,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 4.726877717434773e-05,
|
|
"loss": 0.7438122749328613,
|
|
"num_input_tokens_seen": 132905472,
|
|
"step": 1190,
|
|
"train_runtime": 6057.8828,
|
|
"train_tokens_per_second": 21939.261
|
|
},
|
|
{
|
|
"epoch": 1.228352,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 4.724766844415013e-05,
|
|
"loss": 0.7444162368774414,
|
|
"num_input_tokens_seen": 134023296,
|
|
"step": 1200,
|
|
"train_runtime": 6107.5979,
|
|
"train_tokens_per_second": 21943.7
|
|
},
|
|
{
|
|
"epoch": 1.238592,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 4.722658796817813e-05,
|
|
"loss": 0.7356367588043213,
|
|
"num_input_tokens_seen": 135165312,
|
|
"step": 1210,
|
|
"train_runtime": 6160.1499,
|
|
"train_tokens_per_second": 21941.887
|
|
},
|
|
{
|
|
"epoch": 1.248832,
|
|
"grad_norm": 1.359375,
|
|
"learning_rate": 4.7205535683457044e-05,
|
|
"loss": 0.7440855026245117,
|
|
"num_input_tokens_seen": 136319808,
|
|
"step": 1220,
|
|
"train_runtime": 6214.3559,
|
|
"train_tokens_per_second": 21936.273
|
|
},
|
|
{
|
|
"epoch": 1.259072,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 4.7184511527208484e-05,
|
|
"loss": 0.7333660125732422,
|
|
"num_input_tokens_seen": 137441088,
|
|
"step": 1230,
|
|
"train_runtime": 6264.8424,
|
|
"train_tokens_per_second": 21938.475
|
|
},
|
|
{
|
|
"epoch": 1.269312,
|
|
"grad_norm": 1.5390625,
|
|
"learning_rate": 4.7163515436849644e-05,
|
|
"loss": 0.7524197101593018,
|
|
"num_input_tokens_seen": 138549568,
|
|
"step": 1240,
|
|
"train_runtime": 6313.7128,
|
|
"train_tokens_per_second": 21944.23
|
|
},
|
|
{
|
|
"epoch": 1.279552,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 4.714254734999245e-05,
|
|
"loss": 0.7486214637756348,
|
|
"num_input_tokens_seen": 139628416,
|
|
"step": 1250,
|
|
"train_runtime": 6361.0684,
|
|
"train_tokens_per_second": 21950.466
|
|
},
|
|
{
|
|
"epoch": 1.289792,
|
|
"grad_norm": 1.578125,
|
|
"learning_rate": 4.712160720444284e-05,
|
|
"loss": 0.7422505378723144,
|
|
"num_input_tokens_seen": 140751552,
|
|
"step": 1260,
|
|
"train_runtime": 6412.2087,
|
|
"train_tokens_per_second": 21950.557
|
|
},
|
|
{
|
|
"epoch": 1.300032,
|
|
"grad_norm": 1.4921875,
|
|
"learning_rate": 4.710069493819992e-05,
|
|
"loss": 0.7394045352935791,
|
|
"num_input_tokens_seen": 141875392,
|
|
"step": 1270,
|
|
"train_runtime": 6463.2897,
|
|
"train_tokens_per_second": 21950.957
|
|
},
|
|
{
|
|
"epoch": 1.3102719999999999,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 4.70798104894553e-05,
|
|
"loss": 0.7524402618408204,
|
|
"num_input_tokens_seen": 142968768,
|
|
"step": 1280,
|
|
"train_runtime": 6512.8407,
|
|
"train_tokens_per_second": 21951.829
|
|
},
|
|
{
|
|
"epoch": 1.320512,
|
|
"grad_norm": 1.3671875,
|
|
"learning_rate": 4.705895379659219e-05,
|
|
"loss": 0.73507719039917,
|
|
"num_input_tokens_seen": 144088448,
|
|
"step": 1290,
|
|
"train_runtime": 6563.9326,
|
|
"train_tokens_per_second": 21951.543
|
|
},
|
|
{
|
|
"epoch": 1.330752,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 4.7038124798184766e-05,
|
|
"loss": 0.744103193283081,
|
|
"num_input_tokens_seen": 145166528,
|
|
"step": 1300,
|
|
"train_runtime": 6612.2717,
|
|
"train_tokens_per_second": 21954.108
|
|
},
|
|
{
|
|
"epoch": 1.340992,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 4.7017323432997304e-05,
|
|
"loss": 0.7421403884887695,
|
|
"num_input_tokens_seen": 146277888,
|
|
"step": 1310,
|
|
"train_runtime": 6663.7474,
|
|
"train_tokens_per_second": 21951.296
|
|
},
|
|
{
|
|
"epoch": 1.351232,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 4.6996549639983506e-05,
|
|
"loss": 0.7422142505645752,
|
|
"num_input_tokens_seen": 147402112,
|
|
"step": 1320,
|
|
"train_runtime": 6713.9776,
|
|
"train_tokens_per_second": 21954.513
|
|
},
|
|
{
|
|
"epoch": 1.361472,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 4.697580335828569e-05,
|
|
"loss": 0.747988224029541,
|
|
"num_input_tokens_seen": 148498816,
|
|
"step": 1330,
|
|
"train_runtime": 6762.7236,
|
|
"train_tokens_per_second": 21958.433
|
|
},
|
|
{
|
|
"epoch": 1.371712,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 4.6955084527234076e-05,
|
|
"loss": 0.7415881633758545,
|
|
"num_input_tokens_seen": 149633024,
|
|
"step": 1340,
|
|
"train_runtime": 6813.6204,
|
|
"train_tokens_per_second": 21960.869
|
|
},
|
|
{
|
|
"epoch": 1.381952,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 4.6934393086346034e-05,
|
|
"loss": 0.7278687953948975,
|
|
"num_input_tokens_seen": 150743424,
|
|
"step": 1350,
|
|
"train_runtime": 6865.1777,
|
|
"train_tokens_per_second": 21957.687
|
|
},
|
|
{
|
|
"epoch": 1.392192,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 4.6913728975325324e-05,
|
|
"loss": 0.7370668411254883,
|
|
"num_input_tokens_seen": 151865536,
|
|
"step": 1360,
|
|
"train_runtime": 6915.0272,
|
|
"train_tokens_per_second": 21961.669
|
|
},
|
|
{
|
|
"epoch": 1.4024320000000001,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 4.6893092134061393e-05,
|
|
"loss": 0.7397951126098633,
|
|
"num_input_tokens_seen": 152997504,
|
|
"step": 1370,
|
|
"train_runtime": 6966.2008,
|
|
"train_tokens_per_second": 21962.833
|
|
},
|
|
{
|
|
"epoch": 1.412672,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 4.687248250262859e-05,
|
|
"loss": 0.7369170188903809,
|
|
"num_input_tokens_seen": 154098752,
|
|
"step": 1380,
|
|
"train_runtime": 7017.463,
|
|
"train_tokens_per_second": 21959.325
|
|
},
|
|
{
|
|
"epoch": 1.422912,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 4.685190002128548e-05,
|
|
"loss": 0.7380311965942383,
|
|
"num_input_tokens_seen": 155218880,
|
|
"step": 1390,
|
|
"train_runtime": 7069.234,
|
|
"train_tokens_per_second": 21956.959
|
|
},
|
|
{
|
|
"epoch": 1.433152,
|
|
"grad_norm": 1.3359375,
|
|
"learning_rate": 4.6831344630474114e-05,
|
|
"loss": 0.719688892364502,
|
|
"num_input_tokens_seen": 156365696,
|
|
"step": 1400,
|
|
"train_runtime": 7121.6519,
|
|
"train_tokens_per_second": 21956.38
|
|
},
|
|
{
|
|
"epoch": 1.443392,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 4.6810816270819276e-05,
|
|
"loss": 0.7329507827758789,
|
|
"num_input_tokens_seen": 157494784,
|
|
"step": 1410,
|
|
"train_runtime": 7171.9905,
|
|
"train_tokens_per_second": 21959.703
|
|
},
|
|
{
|
|
"epoch": 1.453632,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 4.679031488312777e-05,
|
|
"loss": 0.7250077247619628,
|
|
"num_input_tokens_seen": 158633216,
|
|
"step": 1420,
|
|
"train_runtime": 7223.042,
|
|
"train_tokens_per_second": 21962.106
|
|
},
|
|
{
|
|
"epoch": 1.463872,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 4.6769840408387717e-05,
|
|
"loss": 0.7379475116729737,
|
|
"num_input_tokens_seen": 159750208,
|
|
"step": 1430,
|
|
"train_runtime": 7274.4145,
|
|
"train_tokens_per_second": 21960.559
|
|
},
|
|
{
|
|
"epoch": 1.4741119999999999,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 4.674939278776787e-05,
|
|
"loss": 0.7261748313903809,
|
|
"num_input_tokens_seen": 160865344,
|
|
"step": 1440,
|
|
"train_runtime": 7324.4445,
|
|
"train_tokens_per_second": 21962.805
|
|
},
|
|
{
|
|
"epoch": 1.484352,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 4.672897196261683e-05,
|
|
"loss": 0.718736219406128,
|
|
"num_input_tokens_seen": 162000640,
|
|
"step": 1450,
|
|
"train_runtime": 7376.9389,
|
|
"train_tokens_per_second": 21960.415
|
|
},
|
|
{
|
|
"epoch": 1.494592,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 4.670857787446238e-05,
|
|
"loss": 0.7371679782867432,
|
|
"num_input_tokens_seen": 163120704,
|
|
"step": 1460,
|
|
"train_runtime": 7426.1512,
|
|
"train_tokens_per_second": 21965.713
|
|
},
|
|
{
|
|
"epoch": 1.504832,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 4.668821046501082e-05,
|
|
"loss": 0.7367044448852539,
|
|
"num_input_tokens_seen": 164228160,
|
|
"step": 1470,
|
|
"train_runtime": 7474.0997,
|
|
"train_tokens_per_second": 21972.969
|
|
},
|
|
{
|
|
"epoch": 1.515072,
|
|
"grad_norm": 1.5390625,
|
|
"learning_rate": 4.6667869676146194e-05,
|
|
"loss": 0.7399471282958985,
|
|
"num_input_tokens_seen": 165347456,
|
|
"step": 1480,
|
|
"train_runtime": 7525.5655,
|
|
"train_tokens_per_second": 21971.433
|
|
},
|
|
{
|
|
"epoch": 1.525312,
|
|
"grad_norm": 1.390625,
|
|
"learning_rate": 4.6647555449929645e-05,
|
|
"loss": 0.7276147842407227,
|
|
"num_input_tokens_seen": 166452672,
|
|
"step": 1490,
|
|
"train_runtime": 7575.6639,
|
|
"train_tokens_per_second": 21972.024
|
|
},
|
|
{
|
|
"epoch": 1.535552,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 4.662726772859869e-05,
|
|
"loss": 0.7368722915649414,
|
|
"num_input_tokens_seen": 167547520,
|
|
"step": 1500,
|
|
"train_runtime": 7624.3614,
|
|
"train_tokens_per_second": 21975.286
|
|
},
|
|
{
|
|
"epoch": 1.545792,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 4.660700645456655e-05,
|
|
"loss": 0.7236470222473145,
|
|
"num_input_tokens_seen": 168664320,
|
|
"step": 1510,
|
|
"train_runtime": 7674.9645,
|
|
"train_tokens_per_second": 21975.909
|
|
},
|
|
{
|
|
"epoch": 1.556032,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 4.658677157042149e-05,
|
|
"loss": 0.7258675575256348,
|
|
"num_input_tokens_seen": 169775168,
|
|
"step": 1520,
|
|
"train_runtime": 7726.0187,
|
|
"train_tokens_per_second": 21974.47
|
|
},
|
|
{
|
|
"epoch": 1.566272,
|
|
"grad_norm": 1.5,
|
|
"learning_rate": 4.656656301892605e-05,
|
|
"loss": 0.7226676940917969,
|
|
"num_input_tokens_seen": 170910912,
|
|
"step": 1530,
|
|
"train_runtime": 7777.3904,
|
|
"train_tokens_per_second": 21975.355
|
|
},
|
|
{
|
|
"epoch": 1.5765120000000001,
|
|
"grad_norm": 1.5,
|
|
"learning_rate": 4.6546380743016465e-05,
|
|
"loss": 0.7360187530517578,
|
|
"num_input_tokens_seen": 172011072,
|
|
"step": 1540,
|
|
"train_runtime": 7824.7246,
|
|
"train_tokens_per_second": 21983.019
|
|
},
|
|
{
|
|
"epoch": 1.5867520000000002,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 4.652622468580193e-05,
|
|
"loss": 0.7214366912841796,
|
|
"num_input_tokens_seen": 173135616,
|
|
"step": 1550,
|
|
"train_runtime": 7875.7668,
|
|
"train_tokens_per_second": 21983.335
|
|
},
|
|
{
|
|
"epoch": 1.596992,
|
|
"grad_norm": 1.4921875,
|
|
"learning_rate": 4.650609479056392e-05,
|
|
"loss": 0.7311969757080078,
|
|
"num_input_tokens_seen": 174239232,
|
|
"step": 1560,
|
|
"train_runtime": 7923.3292,
|
|
"train_tokens_per_second": 21990.659
|
|
},
|
|
{
|
|
"epoch": 1.607232,
|
|
"grad_norm": 1.4609375,
|
|
"learning_rate": 4.648599100075556e-05,
|
|
"loss": 0.7286062240600586,
|
|
"num_input_tokens_seen": 175335168,
|
|
"step": 1570,
|
|
"train_runtime": 7972.5819,
|
|
"train_tokens_per_second": 21992.269
|
|
},
|
|
{
|
|
"epoch": 1.617472,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 4.6465913260000945e-05,
|
|
"loss": 0.7191134929656983,
|
|
"num_input_tokens_seen": 176463680,
|
|
"step": 1580,
|
|
"train_runtime": 8025.3812,
|
|
"train_tokens_per_second": 21988.199
|
|
},
|
|
{
|
|
"epoch": 1.627712,
|
|
"grad_norm": 1.609375,
|
|
"learning_rate": 4.644586151209444e-05,
|
|
"loss": 0.7198073387145996,
|
|
"num_input_tokens_seen": 177578176,
|
|
"step": 1590,
|
|
"train_runtime": 8076.0558,
|
|
"train_tokens_per_second": 21988.23
|
|
},
|
|
{
|
|
"epoch": 1.6379519999999999,
|
|
"grad_norm": 1.5390625,
|
|
"learning_rate": 4.6425835701000084e-05,
|
|
"loss": 0.7295777320861816,
|
|
"num_input_tokens_seen": 178670912,
|
|
"step": 1600,
|
|
"train_runtime": 8124.634,
|
|
"train_tokens_per_second": 21991.257
|
|
},
|
|
{
|
|
"epoch": 1.6481919999999999,
|
|
"grad_norm": 1.4765625,
|
|
"learning_rate": 4.640583577085084e-05,
|
|
"loss": 0.7139708518981933,
|
|
"num_input_tokens_seen": 179777600,
|
|
"step": 1610,
|
|
"train_runtime": 8174.4495,
|
|
"train_tokens_per_second": 21992.625
|
|
},
|
|
{
|
|
"epoch": 1.658432,
|
|
"grad_norm": 1.578125,
|
|
"learning_rate": 4.638586166594806e-05,
|
|
"loss": 0.733104658126831,
|
|
"num_input_tokens_seen": 180869504,
|
|
"step": 1620,
|
|
"train_runtime": 8223.6421,
|
|
"train_tokens_per_second": 21993.844
|
|
},
|
|
{
|
|
"epoch": 1.668672,
|
|
"grad_norm": 1.4921875,
|
|
"learning_rate": 4.6365913330760726e-05,
|
|
"loss": 0.7275556564331055,
|
|
"num_input_tokens_seen": 182019072,
|
|
"step": 1630,
|
|
"train_runtime": 8275.8793,
|
|
"train_tokens_per_second": 21993.925
|
|
},
|
|
{
|
|
"epoch": 1.678912,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 4.6345990709924855e-05,
|
|
"loss": 0.7281203269958496,
|
|
"num_input_tokens_seen": 183130112,
|
|
"step": 1640,
|
|
"train_runtime": 8325.9976,
|
|
"train_tokens_per_second": 21994.975
|
|
},
|
|
{
|
|
"epoch": 1.689152,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 4.632609374824284e-05,
|
|
"loss": 0.7167181968688965,
|
|
"num_input_tokens_seen": 184265024,
|
|
"step": 1650,
|
|
"train_runtime": 8379.0993,
|
|
"train_tokens_per_second": 21991.03
|
|
},
|
|
{
|
|
"epoch": 1.699392,
|
|
"grad_norm": 1.609375,
|
|
"learning_rate": 4.630622239068285e-05,
|
|
"loss": 0.7205727100372314,
|
|
"num_input_tokens_seen": 185403968,
|
|
"step": 1660,
|
|
"train_runtime": 8431.432,
|
|
"train_tokens_per_second": 21989.618
|
|
},
|
|
{
|
|
"epoch": 1.709632,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 4.628637658237808e-05,
|
|
"loss": 0.7173449039459229,
|
|
"num_input_tokens_seen": 186535552,
|
|
"step": 1670,
|
|
"train_runtime": 8482.4669,
|
|
"train_tokens_per_second": 21990.72
|
|
},
|
|
{
|
|
"epoch": 1.719872,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 4.626655626862625e-05,
|
|
"loss": 0.7150672912597656,
|
|
"num_input_tokens_seen": 187648448,
|
|
"step": 1680,
|
|
"train_runtime": 8533.219,
|
|
"train_tokens_per_second": 21990.347
|
|
},
|
|
{
|
|
"epoch": 1.730112,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 4.624676139488888e-05,
|
|
"loss": 0.7177637577056885,
|
|
"num_input_tokens_seen": 188770624,
|
|
"step": 1690,
|
|
"train_runtime": 8582.5231,
|
|
"train_tokens_per_second": 21994.77
|
|
},
|
|
{
|
|
"epoch": 1.7403520000000001,
|
|
"grad_norm": 1.4296875,
|
|
"learning_rate": 4.6226991906790686e-05,
|
|
"loss": 0.7107383728027343,
|
|
"num_input_tokens_seen": 189905536,
|
|
"step": 1700,
|
|
"train_runtime": 8635.4296,
|
|
"train_tokens_per_second": 21991.441
|
|
},
|
|
{
|
|
"epoch": 1.7505920000000001,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 4.620724775011897e-05,
|
|
"loss": 0.7159247398376465,
|
|
"num_input_tokens_seen": 191047360,
|
|
"step": 1710,
|
|
"train_runtime": 8688.7592,
|
|
"train_tokens_per_second": 21987.876
|
|
},
|
|
{
|
|
"epoch": 1.760832,
|
|
"grad_norm": 1.5,
|
|
"learning_rate": 4.618752887082297e-05,
|
|
"loss": 0.7231245517730713,
|
|
"num_input_tokens_seen": 192176448,
|
|
"step": 1720,
|
|
"train_runtime": 8739.8956,
|
|
"train_tokens_per_second": 21988.415
|
|
},
|
|
{
|
|
"epoch": 1.771072,
|
|
"grad_norm": 1.6015625,
|
|
"learning_rate": 4.616783521501325e-05,
|
|
"loss": 0.7093376159667969,
|
|
"num_input_tokens_seen": 193282496,
|
|
"step": 1730,
|
|
"train_runtime": 8789.6819,
|
|
"train_tokens_per_second": 21989.703
|
|
},
|
|
{
|
|
"epoch": 1.781312,
|
|
"grad_norm": 1.5078125,
|
|
"learning_rate": 4.614816672896108e-05,
|
|
"loss": 0.7214728832244873,
|
|
"num_input_tokens_seen": 194367808,
|
|
"step": 1740,
|
|
"train_runtime": 8838.9917,
|
|
"train_tokens_per_second": 21989.817
|
|
},
|
|
{
|
|
"epoch": 1.791552,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 4.612852335909782e-05,
|
|
"loss": 0.7111657619476318,
|
|
"num_input_tokens_seen": 195472320,
|
|
"step": 1750,
|
|
"train_runtime": 8890.2997,
|
|
"train_tokens_per_second": 21987.146
|
|
},
|
|
{
|
|
"epoch": 1.8017919999999998,
|
|
"grad_norm": 1.5078125,
|
|
"learning_rate": 4.6108905052014323e-05,
|
|
"loss": 0.7161635398864746,
|
|
"num_input_tokens_seen": 196566912,
|
|
"step": 1760,
|
|
"train_runtime": 8939.6068,
|
|
"train_tokens_per_second": 21988.317
|
|
},
|
|
{
|
|
"epoch": 1.8120319999999999,
|
|
"grad_norm": 1.453125,
|
|
"learning_rate": 4.608931175446027e-05,
|
|
"loss": 0.7039215087890625,
|
|
"num_input_tokens_seen": 197692864,
|
|
"step": 1770,
|
|
"train_runtime": 8991.4052,
|
|
"train_tokens_per_second": 21986.871
|
|
},
|
|
{
|
|
"epoch": 1.822272,
|
|
"grad_norm": 1.53125,
|
|
"learning_rate": 4.606974341334367e-05,
|
|
"loss": 0.7046633720397949,
|
|
"num_input_tokens_seen": 198851136,
|
|
"step": 1780,
|
|
"train_runtime": 9045.7861,
|
|
"train_tokens_per_second": 21982.737
|
|
},
|
|
{
|
|
"epoch": 1.832512,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 4.605019997573011e-05,
|
|
"loss": 0.7108986854553223,
|
|
"num_input_tokens_seen": 199991616,
|
|
"step": 1790,
|
|
"train_runtime": 9098.4241,
|
|
"train_tokens_per_second": 21980.907
|
|
},
|
|
{
|
|
"epoch": 1.842752,
|
|
"grad_norm": 1.515625,
|
|
"learning_rate": 4.603068138884229e-05,
|
|
"loss": 0.7045407295227051,
|
|
"num_input_tokens_seen": 201125312,
|
|
"step": 1800,
|
|
"train_runtime": 9149.6357,
|
|
"train_tokens_per_second": 21981.784
|
|
},
|
|
{
|
|
"epoch": 1.852992,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 4.6011187600059345e-05,
|
|
"loss": 0.7162825584411621,
|
|
"num_input_tokens_seen": 202239936,
|
|
"step": 1810,
|
|
"train_runtime": 9199.9174,
|
|
"train_tokens_per_second": 21982.799
|
|
},
|
|
{
|
|
"epoch": 1.863232,
|
|
"grad_norm": 1.421875,
|
|
"learning_rate": 4.599171855691629e-05,
|
|
"loss": 0.7169035911560059,
|
|
"num_input_tokens_seen": 203321984,
|
|
"step": 1820,
|
|
"train_runtime": 9247.0534,
|
|
"train_tokens_per_second": 21987.759
|
|
},
|
|
{
|
|
"epoch": 1.873472,
|
|
"grad_norm": 1.5390625,
|
|
"learning_rate": 4.597227420710335e-05,
|
|
"loss": 0.6997568130493164,
|
|
"num_input_tokens_seen": 204444032,
|
|
"step": 1830,
|
|
"train_runtime": 9300.3822,
|
|
"train_tokens_per_second": 21982.326
|
|
},
|
|
{
|
|
"epoch": 1.883712,
|
|
"grad_norm": 1.4453125,
|
|
"learning_rate": 4.595285449846551e-05,
|
|
"loss": 0.7147369861602784,
|
|
"num_input_tokens_seen": 205551872,
|
|
"step": 1840,
|
|
"train_runtime": 9350.726,
|
|
"train_tokens_per_second": 21982.451
|
|
},
|
|
{
|
|
"epoch": 1.893952,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 4.593345937900178e-05,
|
|
"loss": 0.700528621673584,
|
|
"num_input_tokens_seen": 206680128,
|
|
"step": 1850,
|
|
"train_runtime": 9402.0793,
|
|
"train_tokens_per_second": 21982.385
|
|
},
|
|
{
|
|
"epoch": 1.904192,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 4.591408879686472e-05,
|
|
"loss": 0.707237434387207,
|
|
"num_input_tokens_seen": 207813696,
|
|
"step": 1860,
|
|
"train_runtime": 9454.3191,
|
|
"train_tokens_per_second": 21980.821
|
|
},
|
|
{
|
|
"epoch": 1.9144320000000001,
|
|
"grad_norm": 1.5390625,
|
|
"learning_rate": 4.5894742700359775e-05,
|
|
"loss": 0.7043401718139648,
|
|
"num_input_tokens_seen": 208895808,
|
|
"step": 1870,
|
|
"train_runtime": 9502.5318,
|
|
"train_tokens_per_second": 21983.174
|
|
},
|
|
{
|
|
"epoch": 1.9246720000000002,
|
|
"grad_norm": 1.4140625,
|
|
"learning_rate": 4.587542103794477e-05,
|
|
"loss": 0.7066624641418457,
|
|
"num_input_tokens_seen": 210025600,
|
|
"step": 1880,
|
|
"train_runtime": 9553.8388,
|
|
"train_tokens_per_second": 21983.373
|
|
},
|
|
{
|
|
"epoch": 1.934912,
|
|
"grad_norm": 1.515625,
|
|
"learning_rate": 4.5856123758229247e-05,
|
|
"loss": 0.7068476676940918,
|
|
"num_input_tokens_seen": 211141184,
|
|
"step": 1890,
|
|
"train_runtime": 9604.6551,
|
|
"train_tokens_per_second": 21983.214
|
|
},
|
|
{
|
|
"epoch": 1.945152,
|
|
"grad_norm": 1.484375,
|
|
"learning_rate": 4.5836850809973993e-05,
|
|
"loss": 0.7084201812744141,
|
|
"num_input_tokens_seen": 212250112,
|
|
"step": 1900,
|
|
"train_runtime": 9653.8675,
|
|
"train_tokens_per_second": 21986.019
|
|
},
|
|
{
|
|
"epoch": 1.955392,
|
|
"grad_norm": 1.3984375,
|
|
"learning_rate": 4.5817602142090385e-05,
|
|
"loss": 0.6999262809753418,
|
|
"num_input_tokens_seen": 213370240,
|
|
"step": 1910,
|
|
"train_runtime": 9704.8849,
|
|
"train_tokens_per_second": 21985.86
|
|
},
|
|
{
|
|
"epoch": 1.965632,
|
|
"grad_norm": 1.4375,
|
|
"learning_rate": 4.579837770363989e-05,
|
|
"loss": 0.7026149749755859,
|
|
"num_input_tokens_seen": 214511104,
|
|
"step": 1920,
|
|
"train_runtime": 9757.8534,
|
|
"train_tokens_per_second": 21983.432
|
|
},
|
|
{
|
|
"epoch": 1.9758719999999999,
|
|
"grad_norm": 1.5234375,
|
|
"learning_rate": 4.57791774438334e-05,
|
|
"loss": 0.7023416042327881,
|
|
"num_input_tokens_seen": 215629504,
|
|
"step": 1930,
|
|
"train_runtime": 9807.0125,
|
|
"train_tokens_per_second": 21987.277
|
|
},
|
|
{
|
|
"epoch": 1.9861119999999999,
|
|
"grad_norm": 1.46875,
|
|
"learning_rate": 4.576000131203078e-05,
|
|
"loss": 0.7092232704162598,
|
|
"num_input_tokens_seen": 216746880,
|
|
"step": 1940,
|
|
"train_runtime": 9858.8618,
|
|
"train_tokens_per_second": 21984.98
|
|
},
|
|
{
|
|
"epoch": 1.996352,
|
|
"grad_norm": 1.5078125,
|
|
"learning_rate": 4.574084925774023e-05,
|
|
"loss": 0.6931307792663575,
|
|
"num_input_tokens_seen": 217858496,
|
|
"step": 1950,
|
|
"train_runtime": 9908.0458,
|
|
"train_tokens_per_second": 21988.039
|
|
},
|
|
{
|
|
"epoch": 2.006144,
|
|
"grad_norm": 2.203125,
|
|
"learning_rate": 4.5721721230617795e-05,
|
|
"loss": 0.6160273551940918,
|
|
"num_input_tokens_seen": 218918208,
|
|
"step": 1960,
|
|
"train_runtime": 9957.3271,
|
|
"train_tokens_per_second": 21985.64
|
|
},
|
|
{
|
|
"epoch": 2.016384,
|
|
"grad_norm": 1.5625,
|
|
"learning_rate": 4.57026171804667e-05,
|
|
"loss": 0.5476226806640625,
|
|
"num_input_tokens_seen": 220009600,
|
|
"step": 1970,
|
|
"train_runtime": 10005.4786,
|
|
"train_tokens_per_second": 21988.913
|
|
},
|
|
{
|
|
"epoch": 2.026624,
|
|
"grad_norm": 1.578125,
|
|
"learning_rate": 4.568353705723692e-05,
|
|
"loss": 0.5443649768829346,
|
|
"num_input_tokens_seen": 221112448,
|
|
"step": 1980,
|
|
"train_runtime": 10053.8591,
|
|
"train_tokens_per_second": 21992.794
|
|
},
|
|
{
|
|
"epoch": 2.036864,
|
|
"grad_norm": 1.6953125,
|
|
"learning_rate": 4.566448081102455e-05,
|
|
"loss": 0.530079698562622,
|
|
"num_input_tokens_seen": 222236352,
|
|
"step": 1990,
|
|
"train_runtime": 10106.2355,
|
|
"train_tokens_per_second": 21990.023
|
|
},
|
|
{
|
|
"epoch": 2.047104,
|
|
"grad_norm": 1.5859375,
|
|
"learning_rate": 4.564544839207128e-05,
|
|
"loss": 0.5314745426177978,
|
|
"num_input_tokens_seen": 223371840,
|
|
"step": 2000,
|
|
"train_runtime": 10157.507,
|
|
"train_tokens_per_second": 21990.813
|
|
},
|
|
{
|
|
"epoch": 2.057344,
|
|
"grad_norm": 1.703125,
|
|
"learning_rate": 4.562643975076387e-05,
|
|
"loss": 0.536113691329956,
|
|
"num_input_tokens_seen": 224505152,
|
|
"step": 2010,
|
|
"train_runtime": 10210.6596,
|
|
"train_tokens_per_second": 21987.331
|
|
},
|
|
{
|
|
"epoch": 2.067584,
|
|
"grad_norm": 1.6640625,
|
|
"learning_rate": 4.560745483763357e-05,
|
|
"loss": 0.537871265411377,
|
|
"num_input_tokens_seen": 225609024,
|
|
"step": 2020,
|
|
"train_runtime": 10260.9136,
|
|
"train_tokens_per_second": 21987.226
|
|
},
|
|
{
|
|
"epoch": 2.077824,
|
|
"grad_norm": 1.7109375,
|
|
"learning_rate": 4.5588493603355595e-05,
|
|
"loss": 0.5416299819946289,
|
|
"num_input_tokens_seen": 226721728,
|
|
"step": 2030,
|
|
"train_runtime": 10310.4748,
|
|
"train_tokens_per_second": 21989.456
|
|
},
|
|
{
|
|
"epoch": 2.088064,
|
|
"grad_norm": 1.5703125,
|
|
"learning_rate": 4.556955599874859e-05,
|
|
"loss": 0.5329193592071533,
|
|
"num_input_tokens_seen": 227839680,
|
|
"step": 2040,
|
|
"train_runtime": 10362.1302,
|
|
"train_tokens_per_second": 21987.726
|
|
},
|
|
{
|
|
"epoch": 2.098304,
|
|
"grad_norm": 1.5234375,
|
|
"learning_rate": 4.555064197477409e-05,
|
|
"loss": 0.5448167800903321,
|
|
"num_input_tokens_seen": 228945344,
|
|
"step": 2050,
|
|
"train_runtime": 10411.8833,
|
|
"train_tokens_per_second": 21988.85
|
|
},
|
|
{
|
|
"epoch": 2.108544,
|
|
"grad_norm": 1.6015625,
|
|
"learning_rate": 4.5531751482536e-05,
|
|
"loss": 0.5400659084320069,
|
|
"num_input_tokens_seen": 230068608,
|
|
"step": 2060,
|
|
"train_runtime": 10461.9263,
|
|
"train_tokens_per_second": 21991.037
|
|
},
|
|
{
|
|
"epoch": 2.118784,
|
|
"grad_norm": 1.6015625,
|
|
"learning_rate": 4.5512884473280024e-05,
|
|
"loss": 0.5294137954711914,
|
|
"num_input_tokens_seen": 231161728,
|
|
"step": 2070,
|
|
"train_runtime": 10511.7551,
|
|
"train_tokens_per_second": 21990.783
|
|
},
|
|
{
|
|
"epoch": 2.129024,
|
|
"grad_norm": 1.65625,
|
|
"learning_rate": 4.549404089839322e-05,
|
|
"loss": 0.535043478012085,
|
|
"num_input_tokens_seen": 232286656,
|
|
"step": 2080,
|
|
"train_runtime": 10562.4846,
|
|
"train_tokens_per_second": 21991.668
|
|
},
|
|
{
|
|
"epoch": 2.139264,
|
|
"grad_norm": 1.6875,
|
|
"learning_rate": 4.547522070940335e-05,
|
|
"loss": 0.5406003952026367,
|
|
"num_input_tokens_seen": 233403328,
|
|
"step": 2090,
|
|
"train_runtime": 10614.5795,
|
|
"train_tokens_per_second": 21988.938
|
|
},
|
|
{
|
|
"epoch": 2.149504,
|
|
"grad_norm": 1.65625,
|
|
"learning_rate": 4.545642385797848e-05,
|
|
"loss": 0.5352214813232422,
|
|
"num_input_tokens_seen": 234542400,
|
|
"step": 2100,
|
|
"train_runtime": 10668.2079,
|
|
"train_tokens_per_second": 21985.173
|
|
},
|
|
{
|
|
"epoch": 2.159744,
|
|
"grad_norm": 1.59375,
|
|
"learning_rate": 4.543765029592637e-05,
|
|
"loss": 0.5299077987670898,
|
|
"num_input_tokens_seen": 235650624,
|
|
"step": 2110,
|
|
"train_runtime": 10718.8559,
|
|
"train_tokens_per_second": 21984.681
|
|
},
|
|
{
|
|
"epoch": 2.169984,
|
|
"grad_norm": 1.6640625,
|
|
"learning_rate": 4.541889997519403e-05,
|
|
"loss": 0.5387727737426757,
|
|
"num_input_tokens_seen": 236777600,
|
|
"step": 2120,
|
|
"train_runtime": 10769.6328,
|
|
"train_tokens_per_second": 21985.671
|
|
},
|
|
{
|
|
"epoch": 2.180224,
|
|
"grad_norm": 1.625,
|
|
"learning_rate": 4.5400172847867095e-05,
|
|
"loss": 0.5402078628540039,
|
|
"num_input_tokens_seen": 237897728,
|
|
"step": 2130,
|
|
"train_runtime": 10820.7737,
|
|
"train_tokens_per_second": 21985.279
|
|
},
|
|
{
|
|
"epoch": 2.190464,
|
|
"grad_norm": 1.6484375,
|
|
"learning_rate": 4.5381468866169466e-05,
|
|
"loss": 0.5417552947998047,
|
|
"num_input_tokens_seen": 238992704,
|
|
"step": 2140,
|
|
"train_runtime": 10869.1633,
|
|
"train_tokens_per_second": 21988.142
|
|
},
|
|
{
|
|
"epoch": 2.200704,
|
|
"grad_norm": 1.7109375,
|
|
"learning_rate": 4.5362787982462616e-05,
|
|
"loss": 0.530327320098877,
|
|
"num_input_tokens_seen": 240146496,
|
|
"step": 2150,
|
|
"train_runtime": 10922.9566,
|
|
"train_tokens_per_second": 21985.485
|
|
},
|
|
{
|
|
"epoch": 2.210944,
|
|
"grad_norm": 1.671875,
|
|
"learning_rate": 4.5344130149245275e-05,
|
|
"loss": 0.5349247932434082,
|
|
"num_input_tokens_seen": 241241856,
|
|
"step": 2160,
|
|
"train_runtime": 10972.6208,
|
|
"train_tokens_per_second": 21985.801
|
|
},
|
|
{
|
|
"epoch": 2.221184,
|
|
"grad_norm": 1.6328125,
|
|
"learning_rate": 4.5325495319152715e-05,
|
|
"loss": 0.5235861301422119,
|
|
"num_input_tokens_seen": 242377600,
|
|
"step": 2170,
|
|
"train_runtime": 11025.3999,
|
|
"train_tokens_per_second": 21983.565
|
|
},
|
|
{
|
|
"epoch": 2.231424,
|
|
"grad_norm": 1.640625,
|
|
"learning_rate": 4.530688344495644e-05,
|
|
"loss": 0.5335872173309326,
|
|
"num_input_tokens_seen": 243525248,
|
|
"step": 2180,
|
|
"train_runtime": 11078.0924,
|
|
"train_tokens_per_second": 21982.598
|
|
},
|
|
{
|
|
"epoch": 2.241664,
|
|
"grad_norm": 1.6328125,
|
|
"learning_rate": 4.528829447956357e-05,
|
|
"loss": 0.5255549430847168,
|
|
"num_input_tokens_seen": 244661248,
|
|
"step": 2190,
|
|
"train_runtime": 11129.5816,
|
|
"train_tokens_per_second": 21982.969
|
|
},
|
|
{
|
|
"epoch": 2.251904,
|
|
"grad_norm": 1.734375,
|
|
"learning_rate": 4.526972837601633e-05,
|
|
"loss": 0.5395485877990722,
|
|
"num_input_tokens_seen": 245780800,
|
|
"step": 2200,
|
|
"train_runtime": 11180.2882,
|
|
"train_tokens_per_second": 21983.405
|
|
},
|
|
{
|
|
"epoch": 2.262144,
|
|
"grad_norm": 1.7734375,
|
|
"learning_rate": 4.525118508749165e-05,
|
|
"loss": 0.5427422523498535,
|
|
"num_input_tokens_seen": 246870912,
|
|
"step": 2210,
|
|
"train_runtime": 11229.0191,
|
|
"train_tokens_per_second": 21985.083
|
|
},
|
|
{
|
|
"epoch": 2.272384,
|
|
"grad_norm": 1.6796875,
|
|
"learning_rate": 4.5232664567300546e-05,
|
|
"loss": 0.5383429527282715,
|
|
"num_input_tokens_seen": 247963136,
|
|
"step": 2220,
|
|
"train_runtime": 11278.2198,
|
|
"train_tokens_per_second": 21986.017
|
|
},
|
|
{
|
|
"epoch": 2.282624,
|
|
"grad_norm": 1.703125,
|
|
"learning_rate": 4.521416676888773e-05,
|
|
"loss": 0.5311496257781982,
|
|
"num_input_tokens_seen": 249098240,
|
|
"step": 2230,
|
|
"train_runtime": 11331.4261,
|
|
"train_tokens_per_second": 21982.956
|
|
},
|
|
{
|
|
"epoch": 2.292864,
|
|
"grad_norm": 1.65625,
|
|
"learning_rate": 4.519569164583107e-05,
|
|
"loss": 0.5386343479156495,
|
|
"num_input_tokens_seen": 250219840,
|
|
"step": 2240,
|
|
"train_runtime": 11382.8605,
|
|
"train_tokens_per_second": 21982.158
|
|
},
|
|
{
|
|
"epoch": 2.303104,
|
|
"grad_norm": 1.671875,
|
|
"learning_rate": 4.517723915184109e-05,
|
|
"loss": 0.5370828628540039,
|
|
"num_input_tokens_seen": 251317952,
|
|
"step": 2250,
|
|
"train_runtime": 11431.9094,
|
|
"train_tokens_per_second": 21983.9
|
|
},
|
|
{
|
|
"epoch": 2.313344,
|
|
"grad_norm": 1.6875,
|
|
"learning_rate": 4.5158809240760506e-05,
|
|
"loss": 0.5292394638061524,
|
|
"num_input_tokens_seen": 252466688,
|
|
"step": 2260,
|
|
"train_runtime": 11485.1849,
|
|
"train_tokens_per_second": 21981.944
|
|
},
|
|
{
|
|
"epoch": 2.323584,
|
|
"grad_norm": 1.6640625,
|
|
"learning_rate": 4.514040186656375e-05,
|
|
"loss": 0.5335429191589356,
|
|
"num_input_tokens_seen": 253612992,
|
|
"step": 2270,
|
|
"train_runtime": 11538.6494,
|
|
"train_tokens_per_second": 21979.435
|
|
},
|
|
{
|
|
"epoch": 2.333824,
|
|
"grad_norm": 1.625,
|
|
"learning_rate": 4.512201698335644e-05,
|
|
"loss": 0.5375387668609619,
|
|
"num_input_tokens_seen": 254732480,
|
|
"step": 2280,
|
|
"train_runtime": 11590.0261,
|
|
"train_tokens_per_second": 21978.594
|
|
},
|
|
{
|
|
"epoch": 2.344064,
|
|
"grad_norm": 1.75,
|
|
"learning_rate": 4.510365454537496e-05,
|
|
"loss": 0.5277575492858887,
|
|
"num_input_tokens_seen": 255856448,
|
|
"step": 2290,
|
|
"train_runtime": 11640.5446,
|
|
"train_tokens_per_second": 21979.766
|
|
},
|
|
{
|
|
"epoch": 2.354304,
|
|
"grad_norm": 1.65625,
|
|
"learning_rate": 4.5085314506985945e-05,
|
|
"loss": 0.523950719833374,
|
|
"num_input_tokens_seen": 256999168,
|
|
"step": 2300,
|
|
"train_runtime": 11692.6859,
|
|
"train_tokens_per_second": 21979.481
|
|
},
|
|
{
|
|
"epoch": 2.364544,
|
|
"grad_norm": 1.625,
|
|
"learning_rate": 4.50669968226858e-05,
|
|
"loss": 0.5421285629272461,
|
|
"num_input_tokens_seen": 258137984,
|
|
"step": 2310,
|
|
"train_runtime": 11745.5264,
|
|
"train_tokens_per_second": 21977.558
|
|
},
|
|
{
|
|
"epoch": 2.374784,
|
|
"grad_norm": 1.6953125,
|
|
"learning_rate": 4.504870144710027e-05,
|
|
"loss": 0.5283915996551514,
|
|
"num_input_tokens_seen": 259258496,
|
|
"step": 2320,
|
|
"train_runtime": 11796.224,
|
|
"train_tokens_per_second": 21978.092
|
|
},
|
|
{
|
|
"epoch": 2.385024,
|
|
"grad_norm": 1.65625,
|
|
"learning_rate": 4.5030428334983884e-05,
|
|
"loss": 0.5356220245361328,
|
|
"num_input_tokens_seen": 260398080,
|
|
"step": 2330,
|
|
"train_runtime": 11850.3858,
|
|
"train_tokens_per_second": 21973.806
|
|
},
|
|
{
|
|
"epoch": 2.395264,
|
|
"grad_norm": 1.5859375,
|
|
"learning_rate": 4.501217744121959e-05,
|
|
"loss": 0.5268114089965821,
|
|
"num_input_tokens_seen": 261541440,
|
|
"step": 2340,
|
|
"train_runtime": 11903.3512,
|
|
"train_tokens_per_second": 21972.085
|
|
},
|
|
{
|
|
"epoch": 2.405504,
|
|
"grad_norm": 1.75,
|
|
"learning_rate": 4.499394872081821e-05,
|
|
"loss": 0.5375988960266114,
|
|
"num_input_tokens_seen": 262635264,
|
|
"step": 2350,
|
|
"train_runtime": 11951.8181,
|
|
"train_tokens_per_second": 21974.503
|
|
},
|
|
{
|
|
"epoch": 2.415744,
|
|
"grad_norm": 1.7578125,
|
|
"learning_rate": 4.4975742128918e-05,
|
|
"loss": 0.5376396656036377,
|
|
"num_input_tokens_seen": 263740288,
|
|
"step": 2360,
|
|
"train_runtime": 12000.2326,
|
|
"train_tokens_per_second": 21977.931
|
|
},
|
|
{
|
|
"epoch": 2.425984,
|
|
"grad_norm": 1.6953125,
|
|
"learning_rate": 4.495755762078418e-05,
|
|
"loss": 0.5323172569274902,
|
|
"num_input_tokens_seen": 264867968,
|
|
"step": 2370,
|
|
"train_runtime": 12050.7407,
|
|
"train_tokens_per_second": 21979.393
|
|
},
|
|
{
|
|
"epoch": 2.436224,
|
|
"grad_norm": 1.7578125,
|
|
"learning_rate": 4.49393951518085e-05,
|
|
"loss": 0.5391307830810547,
|
|
"num_input_tokens_seen": 265965440,
|
|
"step": 2380,
|
|
"train_runtime": 12099.6065,
|
|
"train_tokens_per_second": 21981.33
|
|
},
|
|
{
|
|
"epoch": 2.446464,
|
|
"grad_norm": 1.6171875,
|
|
"learning_rate": 4.4921254677508716e-05,
|
|
"loss": 0.5373844146728516,
|
|
"num_input_tokens_seen": 267080128,
|
|
"step": 2390,
|
|
"train_runtime": 12149.1708,
|
|
"train_tokens_per_second": 21983.404
|
|
},
|
|
{
|
|
"epoch": 2.456704,
|
|
"grad_norm": 1.7578125,
|
|
"learning_rate": 4.490313615352821e-05,
|
|
"loss": 0.5455498218536377,
|
|
"num_input_tokens_seen": 268188096,
|
|
"step": 2400,
|
|
"train_runtime": 12200.2497,
|
|
"train_tokens_per_second": 21982.181
|
|
},
|
|
{
|
|
"epoch": 2.466944,
|
|
"grad_norm": 1.734375,
|
|
"learning_rate": 4.48850395356355e-05,
|
|
"loss": 0.5363270759582519,
|
|
"num_input_tokens_seen": 269321984,
|
|
"step": 2410,
|
|
"train_runtime": 12254.3616,
|
|
"train_tokens_per_second": 21977.643
|
|
},
|
|
{
|
|
"epoch": 2.477184,
|
|
"grad_norm": 1.75,
|
|
"learning_rate": 4.486696477972375e-05,
|
|
"loss": 0.5418241024017334,
|
|
"num_input_tokens_seen": 270419776,
|
|
"step": 2420,
|
|
"train_runtime": 12303.7844,
|
|
"train_tokens_per_second": 21978.585
|
|
},
|
|
{
|
|
"epoch": 2.487424,
|
|
"grad_norm": 1.7890625,
|
|
"learning_rate": 4.484891184181041e-05,
|
|
"loss": 0.5297726631164551,
|
|
"num_input_tokens_seen": 271548736,
|
|
"step": 2430,
|
|
"train_runtime": 12354.5613,
|
|
"train_tokens_per_second": 21979.634
|
|
},
|
|
{
|
|
"epoch": 2.497664,
|
|
"grad_norm": 1.7734375,
|
|
"learning_rate": 4.483088067803662e-05,
|
|
"loss": 0.5376968383789062,
|
|
"num_input_tokens_seen": 272650816,
|
|
"step": 2440,
|
|
"train_runtime": 12403.0155,
|
|
"train_tokens_per_second": 21982.623
|
|
},
|
|
{
|
|
"epoch": 2.507904,
|
|
"grad_norm": 1.7734375,
|
|
"learning_rate": 4.481287124466697e-05,
|
|
"loss": 0.5285521507263183,
|
|
"num_input_tokens_seen": 273744576,
|
|
"step": 2450,
|
|
"train_runtime": 12451.1849,
|
|
"train_tokens_per_second": 21985.424
|
|
},
|
|
{
|
|
"epoch": 2.518144,
|
|
"grad_norm": 1.6640625,
|
|
"learning_rate": 4.479488349808885e-05,
|
|
"loss": 0.5299195289611817,
|
|
"num_input_tokens_seen": 274848640,
|
|
"step": 2460,
|
|
"train_runtime": 12503.3338,
|
|
"train_tokens_per_second": 21982.029
|
|
},
|
|
{
|
|
"epoch": 2.528384,
|
|
"grad_norm": 1.71875,
|
|
"learning_rate": 4.4776917394812114e-05,
|
|
"loss": 0.5259761810302734,
|
|
"num_input_tokens_seen": 275977600,
|
|
"step": 2470,
|
|
"train_runtime": 12556.4141,
|
|
"train_tokens_per_second": 21979.014
|
|
},
|
|
{
|
|
"epoch": 2.538624,
|
|
"grad_norm": 1.765625,
|
|
"learning_rate": 4.475897289146862e-05,
|
|
"loss": 0.5346611022949219,
|
|
"num_input_tokens_seen": 277115072,
|
|
"step": 2480,
|
|
"train_runtime": 12607.8823,
|
|
"train_tokens_per_second": 21979.51
|
|
},
|
|
{
|
|
"epoch": 2.548864,
|
|
"grad_norm": 1.7109375,
|
|
"learning_rate": 4.4741049944811806e-05,
|
|
"loss": 0.5369565963745118,
|
|
"num_input_tokens_seen": 278210816,
|
|
"step": 2490,
|
|
"train_runtime": 12655.8676,
|
|
"train_tokens_per_second": 21982.753
|
|
},
|
|
{
|
|
"epoch": 2.559104,
|
|
"grad_norm": 1.703125,
|
|
"learning_rate": 4.472314851171621e-05,
|
|
"loss": 0.5275493621826172,
|
|
"num_input_tokens_seen": 279331968,
|
|
"step": 2500,
|
|
"train_runtime": 12707.0061,
|
|
"train_tokens_per_second": 21982.516
|
|
},
|
|
{
|
|
"epoch": 2.569344,
|
|
"grad_norm": 1.6796875,
|
|
"learning_rate": 4.4705268549177084e-05,
|
|
"loss": 0.5220746040344239,
|
|
"num_input_tokens_seen": 280461056,
|
|
"step": 2510,
|
|
"train_runtime": 12758.6493,
|
|
"train_tokens_per_second": 21982.033
|
|
},
|
|
{
|
|
"epoch": 2.579584,
|
|
"grad_norm": 1.7890625,
|
|
"learning_rate": 4.468741001430989e-05,
|
|
"loss": 0.5226367950439453,
|
|
"num_input_tokens_seen": 281572608,
|
|
"step": 2520,
|
|
"train_runtime": 12809.5121,
|
|
"train_tokens_per_second": 21981.525
|
|
},
|
|
{
|
|
"epoch": 2.589824,
|
|
"grad_norm": 1.6328125,
|
|
"learning_rate": 4.466957286434997e-05,
|
|
"loss": 0.515837574005127,
|
|
"num_input_tokens_seen": 282737216,
|
|
"step": 2530,
|
|
"train_runtime": 12865.3707,
|
|
"train_tokens_per_second": 21976.609
|
|
},
|
|
{
|
|
"epoch": 2.600064,
|
|
"grad_norm": 1.8046875,
|
|
"learning_rate": 4.4651757056652e-05,
|
|
"loss": 0.5301560401916504,
|
|
"num_input_tokens_seen": 283827008,
|
|
"step": 2540,
|
|
"train_runtime": 12913.3246,
|
|
"train_tokens_per_second": 21979.391
|
|
},
|
|
{
|
|
"epoch": 2.610304,
|
|
"grad_norm": 1.65625,
|
|
"learning_rate": 4.463396254868968e-05,
|
|
"loss": 0.5253063201904297,
|
|
"num_input_tokens_seen": 284983680,
|
|
"step": 2550,
|
|
"train_runtime": 12967.0493,
|
|
"train_tokens_per_second": 21977.527
|
|
},
|
|
{
|
|
"epoch": 2.6205439999999998,
|
|
"grad_norm": 1.765625,
|
|
"learning_rate": 4.461618929805519e-05,
|
|
"loss": 0.5248900890350342,
|
|
"num_input_tokens_seen": 286077504,
|
|
"step": 2560,
|
|
"train_runtime": 13015.9506,
|
|
"train_tokens_per_second": 21978.994
|
|
},
|
|
{
|
|
"epoch": 2.6307840000000002,
|
|
"grad_norm": 1.5390625,
|
|
"learning_rate": 4.459843726245888e-05,
|
|
"loss": 0.53463134765625,
|
|
"num_input_tokens_seen": 287207168,
|
|
"step": 2570,
|
|
"train_runtime": 13067.1302,
|
|
"train_tokens_per_second": 21979.361
|
|
},
|
|
{
|
|
"epoch": 2.641024,
|
|
"grad_norm": 1.9140625,
|
|
"learning_rate": 4.458070639972875e-05,
|
|
"loss": 0.5340803146362305,
|
|
"num_input_tokens_seen": 288307776,
|
|
"step": 2580,
|
|
"train_runtime": 13115.1727,
|
|
"train_tokens_per_second": 21982.766
|
|
},
|
|
{
|
|
"epoch": 2.651264,
|
|
"grad_norm": 1.6875,
|
|
"learning_rate": 4.456299666781007e-05,
|
|
"loss": 0.5143898963928223,
|
|
"num_input_tokens_seen": 289491392,
|
|
"step": 2590,
|
|
"train_runtime": 13173.1381,
|
|
"train_tokens_per_second": 21975.887
|
|
},
|
|
{
|
|
"epoch": 2.661504,
|
|
"grad_norm": 1.7421875,
|
|
"learning_rate": 4.4545308024764984e-05,
|
|
"loss": 0.5279585838317871,
|
|
"num_input_tokens_seen": 290588288,
|
|
"step": 2600,
|
|
"train_runtime": 13222.1712,
|
|
"train_tokens_per_second": 21977.35
|
|
},
|
|
{
|
|
"epoch": 2.671744,
|
|
"grad_norm": 1.7890625,
|
|
"learning_rate": 4.452764042877207e-05,
|
|
"loss": 0.5243070602416993,
|
|
"num_input_tokens_seen": 291706432,
|
|
"step": 2610,
|
|
"train_runtime": 13274.0598,
|
|
"train_tokens_per_second": 21975.676
|
|
},
|
|
{
|
|
"epoch": 2.681984,
|
|
"grad_norm": 1.7265625,
|
|
"learning_rate": 4.45099938381259e-05,
|
|
"loss": 0.525565767288208,
|
|
"num_input_tokens_seen": 292825664,
|
|
"step": 2620,
|
|
"train_runtime": 13324.5762,
|
|
"train_tokens_per_second": 21976.359
|
|
},
|
|
{
|
|
"epoch": 2.692224,
|
|
"grad_norm": 1.828125,
|
|
"learning_rate": 4.449236821123667e-05,
|
|
"loss": 0.5281280040740967,
|
|
"num_input_tokens_seen": 293933504,
|
|
"step": 2630,
|
|
"train_runtime": 13375.6314,
|
|
"train_tokens_per_second": 21975.299
|
|
},
|
|
{
|
|
"epoch": 2.702464,
|
|
"grad_norm": 1.65625,
|
|
"learning_rate": 4.447476350662976e-05,
|
|
"loss": 0.5201663017272949,
|
|
"num_input_tokens_seen": 295024000,
|
|
"step": 2640,
|
|
"train_runtime": 13424.3426,
|
|
"train_tokens_per_second": 21976.793
|
|
},
|
|
{
|
|
"epoch": 2.712704,
|
|
"grad_norm": 1.859375,
|
|
"learning_rate": 4.4457179682945346e-05,
|
|
"loss": 0.5273939609527588,
|
|
"num_input_tokens_seen": 296126464,
|
|
"step": 2650,
|
|
"train_runtime": 13473.9229,
|
|
"train_tokens_per_second": 21977.747
|
|
},
|
|
{
|
|
"epoch": 2.722944,
|
|
"grad_norm": 1.7109375,
|
|
"learning_rate": 4.443961669893798e-05,
|
|
"loss": 0.5174345970153809,
|
|
"num_input_tokens_seen": 297259712,
|
|
"step": 2660,
|
|
"train_runtime": 13524.4385,
|
|
"train_tokens_per_second": 21979.449
|
|
},
|
|
{
|
|
"epoch": 2.733184,
|
|
"grad_norm": 1.8046875,
|
|
"learning_rate": 4.4422074513476155e-05,
|
|
"loss": 0.528529167175293,
|
|
"num_input_tokens_seen": 298367680,
|
|
"step": 2670,
|
|
"train_runtime": 13574.6209,
|
|
"train_tokens_per_second": 21979.817
|
|
},
|
|
{
|
|
"epoch": 2.743424,
|
|
"grad_norm": 1.859375,
|
|
"learning_rate": 4.4404553085541955e-05,
|
|
"loss": 0.5198683738708496,
|
|
"num_input_tokens_seen": 299497536,
|
|
"step": 2680,
|
|
"train_runtime": 13624.3324,
|
|
"train_tokens_per_second": 21982.548
|
|
},
|
|
{
|
|
"epoch": 2.753664,
|
|
"grad_norm": 1.71875,
|
|
"learning_rate": 4.438705237423063e-05,
|
|
"loss": 0.5379956245422364,
|
|
"num_input_tokens_seen": 300608512,
|
|
"step": 2690,
|
|
"train_runtime": 13673.7031,
|
|
"train_tokens_per_second": 21984.426
|
|
},
|
|
{
|
|
"epoch": 2.763904,
|
|
"grad_norm": 1.734375,
|
|
"learning_rate": 4.436957233875017e-05,
|
|
"loss": 0.5276507377624512,
|
|
"num_input_tokens_seen": 301702976,
|
|
"step": 2700,
|
|
"train_runtime": 13722.51,
|
|
"train_tokens_per_second": 21985.991
|
|
},
|
|
{
|
|
"epoch": 2.774144,
|
|
"grad_norm": 1.734375,
|
|
"learning_rate": 4.4352112938420956e-05,
|
|
"loss": 0.5213168144226075,
|
|
"num_input_tokens_seen": 302851072,
|
|
"step": 2710,
|
|
"train_runtime": 13775.4093,
|
|
"train_tokens_per_second": 21984.906
|
|
},
|
|
{
|
|
"epoch": 2.784384,
|
|
"grad_norm": 1.78125,
|
|
"learning_rate": 4.433467413267529e-05,
|
|
"loss": 0.5262949943542481,
|
|
"num_input_tokens_seen": 303937408,
|
|
"step": 2720,
|
|
"train_runtime": 13823.4103,
|
|
"train_tokens_per_second": 21987.151
|
|
},
|
|
{
|
|
"epoch": 2.7946239999999998,
|
|
"grad_norm": 1.8125,
|
|
"learning_rate": 4.431725588105708e-05,
|
|
"loss": 0.5267552852630615,
|
|
"num_input_tokens_seen": 305070272,
|
|
"step": 2730,
|
|
"train_runtime": 13876.6879,
|
|
"train_tokens_per_second": 21984.372
|
|
},
|
|
{
|
|
"epoch": 2.8048640000000002,
|
|
"grad_norm": 1.7265625,
|
|
"learning_rate": 4.4299858143221377e-05,
|
|
"loss": 0.5038492202758789,
|
|
"num_input_tokens_seen": 306205888,
|
|
"step": 2740,
|
|
"train_runtime": 13927.2204,
|
|
"train_tokens_per_second": 21986.145
|
|
},
|
|
{
|
|
"epoch": 2.815104,
|
|
"grad_norm": 1.8515625,
|
|
"learning_rate": 4.4282480878934065e-05,
|
|
"loss": 0.5188664436340332,
|
|
"num_input_tokens_seen": 307332736,
|
|
"step": 2750,
|
|
"train_runtime": 13978.2805,
|
|
"train_tokens_per_second": 21986.448
|
|
},
|
|
{
|
|
"epoch": 2.825344,
|
|
"grad_norm": 1.671875,
|
|
"learning_rate": 4.4265124048071346e-05,
|
|
"loss": 0.5213587760925293,
|
|
"num_input_tokens_seen": 308433152,
|
|
"step": 2760,
|
|
"train_runtime": 14028.0474,
|
|
"train_tokens_per_second": 21986.891
|
|
},
|
|
{
|
|
"epoch": 2.835584,
|
|
"grad_norm": 1.7890625,
|
|
"learning_rate": 4.4247787610619477e-05,
|
|
"loss": 0.5300797462463379,
|
|
"num_input_tokens_seen": 309529920,
|
|
"step": 2770,
|
|
"train_runtime": 14076.4147,
|
|
"train_tokens_per_second": 21989.258
|
|
},
|
|
{
|
|
"epoch": 2.845824,
|
|
"grad_norm": 1.859375,
|
|
"learning_rate": 4.42304715266743e-05,
|
|
"loss": 0.5275647640228271,
|
|
"num_input_tokens_seen": 310620032,
|
|
"step": 2780,
|
|
"train_runtime": 14125.9713,
|
|
"train_tokens_per_second": 21989.287
|
|
},
|
|
{
|
|
"epoch": 2.856064,
|
|
"grad_norm": 1.828125,
|
|
"learning_rate": 4.421317575644092e-05,
|
|
"loss": 0.5151683807373046,
|
|
"num_input_tokens_seen": 311744704,
|
|
"step": 2790,
|
|
"train_runtime": 14177.2729,
|
|
"train_tokens_per_second": 21989.046
|
|
},
|
|
{
|
|
"epoch": 2.866304,
|
|
"grad_norm": 1.890625,
|
|
"learning_rate": 4.419590026023325e-05,
|
|
"loss": 0.5277010440826416,
|
|
"num_input_tokens_seen": 312862848,
|
|
"step": 2800,
|
|
"train_runtime": 14228.7469,
|
|
"train_tokens_per_second": 21988.082
|
|
},
|
|
{
|
|
"epoch": 2.876544,
|
|
"grad_norm": 1.765625,
|
|
"learning_rate": 4.417864499847368e-05,
|
|
"loss": 0.5130796432495117,
|
|
"num_input_tokens_seen": 313974848,
|
|
"step": 2810,
|
|
"train_runtime": 14277.693,
|
|
"train_tokens_per_second": 21990.587
|
|
},
|
|
{
|
|
"epoch": 2.886784,
|
|
"grad_norm": 1.796875,
|
|
"learning_rate": 4.4161409931692676e-05,
|
|
"loss": 0.5243385791778564,
|
|
"num_input_tokens_seen": 315060032,
|
|
"step": 2820,
|
|
"train_runtime": 14325.4746,
|
|
"train_tokens_per_second": 21992.991
|
|
},
|
|
{
|
|
"epoch": 2.897024,
|
|
"grad_norm": 1.734375,
|
|
"learning_rate": 4.414419502052841e-05,
|
|
"loss": 0.5174403667449952,
|
|
"num_input_tokens_seen": 316182976,
|
|
"step": 2830,
|
|
"train_runtime": 14374.9907,
|
|
"train_tokens_per_second": 21995.352
|
|
},
|
|
{
|
|
"epoch": 2.907264,
|
|
"grad_norm": 1.78125,
|
|
"learning_rate": 4.412700022572637e-05,
|
|
"loss": 0.5114859580993653,
|
|
"num_input_tokens_seen": 317286656,
|
|
"step": 2840,
|
|
"train_runtime": 14423.521,
|
|
"train_tokens_per_second": 21997.864
|
|
},
|
|
{
|
|
"epoch": 2.917504,
|
|
"grad_norm": 1.890625,
|
|
"learning_rate": 4.410982550813902e-05,
|
|
"loss": 0.5237509727478027,
|
|
"num_input_tokens_seen": 318388160,
|
|
"step": 2850,
|
|
"train_runtime": 14473.9697,
|
|
"train_tokens_per_second": 21997.293
|
|
},
|
|
{
|
|
"epoch": 2.927744,
|
|
"grad_norm": 1.78125,
|
|
"learning_rate": 4.409267082872535e-05,
|
|
"loss": 0.5249311447143554,
|
|
"num_input_tokens_seen": 319492928,
|
|
"step": 2860,
|
|
"train_runtime": 14523.7571,
|
|
"train_tokens_per_second": 21997.953
|
|
},
|
|
{
|
|
"epoch": 2.937984,
|
|
"grad_norm": 1.828125,
|
|
"learning_rate": 4.407553614855059e-05,
|
|
"loss": 0.515770959854126,
|
|
"num_input_tokens_seen": 320622336,
|
|
"step": 2870,
|
|
"train_runtime": 14577.3266,
|
|
"train_tokens_per_second": 21994.591
|
|
},
|
|
{
|
|
"epoch": 2.9482239999999997,
|
|
"grad_norm": 1.796875,
|
|
"learning_rate": 4.405842142878579e-05,
|
|
"loss": 0.5268994331359863,
|
|
"num_input_tokens_seen": 321735488,
|
|
"step": 2880,
|
|
"train_runtime": 14627.1239,
|
|
"train_tokens_per_second": 21995.813
|
|
},
|
|
{
|
|
"epoch": 2.958464,
|
|
"grad_norm": 1.765625,
|
|
"learning_rate": 4.404132663070745e-05,
|
|
"loss": 0.5111500740051269,
|
|
"num_input_tokens_seen": 322857728,
|
|
"step": 2890,
|
|
"train_runtime": 14678.6828,
|
|
"train_tokens_per_second": 21995.007
|
|
},
|
|
{
|
|
"epoch": 2.968704,
|
|
"grad_norm": 1.78125,
|
|
"learning_rate": 4.402425171569716e-05,
|
|
"loss": 0.5016695499420166,
|
|
"num_input_tokens_seen": 323996736,
|
|
"step": 2900,
|
|
"train_runtime": 14731.4275,
|
|
"train_tokens_per_second": 21993.574
|
|
},
|
|
{
|
|
"epoch": 2.9789440000000003,
|
|
"grad_norm": 1.75,
|
|
"learning_rate": 4.400719664524127e-05,
|
|
"loss": 0.5131624221801758,
|
|
"num_input_tokens_seen": 325130944,
|
|
"step": 2910,
|
|
"train_runtime": 14783.7526,
|
|
"train_tokens_per_second": 21992.45
|
|
},
|
|
{
|
|
"epoch": 2.989184,
|
|
"grad_norm": 1.8203125,
|
|
"learning_rate": 4.399016138093044e-05,
|
|
"loss": 0.5178108215332031,
|
|
"num_input_tokens_seen": 326241984,
|
|
"step": 2920,
|
|
"train_runtime": 14834.9455,
|
|
"train_tokens_per_second": 21991.451
|
|
},
|
|
{
|
|
"epoch": 2.999424,
|
|
"grad_norm": 1.765625,
|
|
"learning_rate": 4.397314588445937e-05,
|
|
"loss": 0.5120769500732422,
|
|
"num_input_tokens_seen": 327359424,
|
|
"step": 2930,
|
|
"train_runtime": 14885.5036,
|
|
"train_tokens_per_second": 21991.827
|
|
},
|
|
{
|
|
"epoch": 3.0,
|
|
"eval_loss": 0.8352677822113037,
|
|
"eval_runtime": 1.2873,
|
|
"eval_samples_per_second": 774.519,
|
|
"eval_steps_per_second": 6.215,
|
|
"num_input_tokens_seen": 327416064,
|
|
"step": 2931
|
|
},
|
|
{
|
|
"epoch": 3.0,
|
|
"num_input_tokens_seen": 327416064,
|
|
"step": 2931,
|
|
"total_flos": 5.451032989129507e+18,
|
|
"train_loss": 0.7516615965776337,
|
|
"train_runtime": 14909.6648,
|
|
"train_samples_per_second": 201.212,
|
|
"train_steps_per_second": 0.197
|
|
}
|
|
],
|
|
"logging_steps": 10,
|
|
"max_steps": 2931,
|
|
"num_input_tokens_seen": 327416064,
|
|
"num_train_epochs": 3,
|
|
"save_steps": 5000,
|
|
"stateful_callbacks": {
|
|
"TrainerControl": {
|
|
"args": {
|
|
"should_epoch_stop": false,
|
|
"should_evaluate": false,
|
|
"should_log": false,
|
|
"should_save": true,
|
|
"should_training_stop": true
|
|
},
|
|
"attributes": {}
|
|
}
|
|
},
|
|
"total_flos": 5.451032989129507e+18,
|
|
"train_batch_size": 8,
|
|
"trial_name": null,
|
|
"trial_params": null
|
|
}
|