2984 lines
84 KiB
JSON
2984 lines
84 KiB
JSON
{
|
|
"best_global_step": 2931,
|
|
"best_metric": 0.7842721939086914,
|
|
"best_model_checkpoint": "/workspace/MT_En_German/checkpoint-2931",
|
|
"epoch": 3.0,
|
|
"eval_steps": 5000,
|
|
"global_step": 2931,
|
|
"is_hyper_param_search": false,
|
|
"is_local_process_zero": true,
|
|
"is_world_process_zero": true,
|
|
"log_history": [
|
|
{
|
|
"epoch": 0.01024,
|
|
"grad_norm": 1.265625,
|
|
"learning_rate": 4.9977515176118345e-05,
|
|
"loss": 1.1904024124145507,
|
|
"num_input_tokens_seen": 1968640,
|
|
"step": 10,
|
|
"train_runtime": 62.1897,
|
|
"train_tokens_per_second": 31655.416
|
|
},
|
|
{
|
|
"epoch": 0.02048,
|
|
"grad_norm": 1.0,
|
|
"learning_rate": 4.9952567580506e-05,
|
|
"loss": 0.9794286727905274,
|
|
"num_input_tokens_seen": 3921472,
|
|
"step": 20,
|
|
"train_runtime": 122.7357,
|
|
"train_tokens_per_second": 31950.542
|
|
},
|
|
{
|
|
"epoch": 0.03072,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 4.992765730738634e-05,
|
|
"loss": 0.9411283493041992,
|
|
"num_input_tokens_seen": 5895808,
|
|
"step": 30,
|
|
"train_runtime": 182.5361,
|
|
"train_tokens_per_second": 32299.411
|
|
},
|
|
{
|
|
"epoch": 0.04096,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 4.9902784263792476e-05,
|
|
"loss": 0.9153067588806152,
|
|
"num_input_tokens_seen": 7829440,
|
|
"step": 40,
|
|
"train_runtime": 241.2587,
|
|
"train_tokens_per_second": 32452.462
|
|
},
|
|
{
|
|
"epoch": 0.0512,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 4.987794835708133e-05,
|
|
"loss": 0.9085355758666992,
|
|
"num_input_tokens_seen": 9781120,
|
|
"step": 50,
|
|
"train_runtime": 300.3299,
|
|
"train_tokens_per_second": 32567.92
|
|
},
|
|
{
|
|
"epoch": 0.06144,
|
|
"grad_norm": 0.97265625,
|
|
"learning_rate": 4.985314949493234e-05,
|
|
"loss": 0.882135009765625,
|
|
"num_input_tokens_seen": 11720320,
|
|
"step": 60,
|
|
"train_runtime": 359.9362,
|
|
"train_tokens_per_second": 32562.216
|
|
},
|
|
{
|
|
"epoch": 0.07168,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 4.982838758534584e-05,
|
|
"loss": 0.8795860290527344,
|
|
"num_input_tokens_seen": 13679552,
|
|
"step": 70,
|
|
"train_runtime": 419.4261,
|
|
"train_tokens_per_second": 32614.926
|
|
},
|
|
{
|
|
"epoch": 0.08192,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 4.980366253664179e-05,
|
|
"loss": 0.8663822174072265,
|
|
"num_input_tokens_seen": 15625216,
|
|
"step": 80,
|
|
"train_runtime": 478.1635,
|
|
"train_tokens_per_second": 32677.56
|
|
},
|
|
{
|
|
"epoch": 0.09216,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 4.977897425745825e-05,
|
|
"loss": 0.8581996917724609,
|
|
"num_input_tokens_seen": 17576768,
|
|
"step": 90,
|
|
"train_runtime": 537.8615,
|
|
"train_tokens_per_second": 32678.982
|
|
},
|
|
{
|
|
"epoch": 0.1024,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 4.975432265674997e-05,
|
|
"loss": 0.8557216644287109,
|
|
"num_input_tokens_seen": 19528128,
|
|
"step": 100,
|
|
"train_runtime": 597.3347,
|
|
"train_tokens_per_second": 32692.105
|
|
},
|
|
{
|
|
"epoch": 0.11264,
|
|
"grad_norm": 0.94140625,
|
|
"learning_rate": 4.972970764378705e-05,
|
|
"loss": 0.8523456573486328,
|
|
"num_input_tokens_seen": 21496192,
|
|
"step": 110,
|
|
"train_runtime": 657.7204,
|
|
"train_tokens_per_second": 32682.873
|
|
},
|
|
{
|
|
"epoch": 0.12288,
|
|
"grad_norm": 0.8984375,
|
|
"learning_rate": 4.970512912815344e-05,
|
|
"loss": 0.8425041198730469,
|
|
"num_input_tokens_seen": 23459072,
|
|
"step": 120,
|
|
"train_runtime": 718.986,
|
|
"train_tokens_per_second": 32627.995
|
|
},
|
|
{
|
|
"epoch": 0.13312,
|
|
"grad_norm": 0.96484375,
|
|
"learning_rate": 4.968058701974564e-05,
|
|
"loss": 0.8385295867919922,
|
|
"num_input_tokens_seen": 25415040,
|
|
"step": 130,
|
|
"train_runtime": 779.0018,
|
|
"train_tokens_per_second": 32625.137
|
|
},
|
|
{
|
|
"epoch": 0.14336,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 4.96560812287712e-05,
|
|
"loss": 0.8344181060791016,
|
|
"num_input_tokens_seen": 27346432,
|
|
"step": 140,
|
|
"train_runtime": 837.7523,
|
|
"train_tokens_per_second": 32642.623
|
|
},
|
|
{
|
|
"epoch": 0.1536,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 4.963161166574748e-05,
|
|
"loss": 0.8336277961730957,
|
|
"num_input_tokens_seen": 29300736,
|
|
"step": 150,
|
|
"train_runtime": 897.3115,
|
|
"train_tokens_per_second": 32653.917
|
|
},
|
|
{
|
|
"epoch": 0.16384,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 4.960717824150013e-05,
|
|
"loss": 0.8235919952392579,
|
|
"num_input_tokens_seen": 31242688,
|
|
"step": 160,
|
|
"train_runtime": 955.3403,
|
|
"train_tokens_per_second": 32703.204
|
|
},
|
|
{
|
|
"epoch": 0.17408,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 4.9582780867161893e-05,
|
|
"loss": 0.8172248840332031,
|
|
"num_input_tokens_seen": 33196160,
|
|
"step": 170,
|
|
"train_runtime": 1015.3247,
|
|
"train_tokens_per_second": 32695.119
|
|
},
|
|
{
|
|
"epoch": 0.18432,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 4.955841945417105e-05,
|
|
"loss": 0.8182367324829102,
|
|
"num_input_tokens_seen": 35131136,
|
|
"step": 180,
|
|
"train_runtime": 1074.222,
|
|
"train_tokens_per_second": 32703.794
|
|
},
|
|
{
|
|
"epoch": 0.19456,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 4.953409391427024e-05,
|
|
"loss": 0.8155080795288085,
|
|
"num_input_tokens_seen": 37082176,
|
|
"step": 190,
|
|
"train_runtime": 1134.3854,
|
|
"train_tokens_per_second": 32689.222
|
|
},
|
|
{
|
|
"epoch": 0.2048,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 4.950980415950502e-05,
|
|
"loss": 0.8091486930847168,
|
|
"num_input_tokens_seen": 39060608,
|
|
"step": 200,
|
|
"train_runtime": 1195.0649,
|
|
"train_tokens_per_second": 32684.926
|
|
},
|
|
{
|
|
"epoch": 0.21504,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 4.9485550102222575e-05,
|
|
"loss": 0.8105871200561523,
|
|
"num_input_tokens_seen": 40996800,
|
|
"step": 210,
|
|
"train_runtime": 1253.1394,
|
|
"train_tokens_per_second": 32715.274
|
|
},
|
|
{
|
|
"epoch": 0.22528,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 4.946133165507037e-05,
|
|
"loss": 0.8007206916809082,
|
|
"num_input_tokens_seen": 42929728,
|
|
"step": 220,
|
|
"train_runtime": 1311.4585,
|
|
"train_tokens_per_second": 32734.339
|
|
},
|
|
{
|
|
"epoch": 0.23552,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 4.943714873099483e-05,
|
|
"loss": 0.7916994571685791,
|
|
"num_input_tokens_seen": 44892288,
|
|
"step": 230,
|
|
"train_runtime": 1370.4772,
|
|
"train_tokens_per_second": 32756.683
|
|
},
|
|
{
|
|
"epoch": 0.24576,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 4.9413001243240024e-05,
|
|
"loss": 0.7964269638061523,
|
|
"num_input_tokens_seen": 46831872,
|
|
"step": 240,
|
|
"train_runtime": 1431.941,
|
|
"train_tokens_per_second": 32705.169
|
|
},
|
|
{
|
|
"epoch": 0.256,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 4.938888910534637e-05,
|
|
"loss": 0.7994860172271728,
|
|
"num_input_tokens_seen": 48793472,
|
|
"step": 250,
|
|
"train_runtime": 1490.9713,
|
|
"train_tokens_per_second": 32725.963
|
|
},
|
|
{
|
|
"epoch": 0.26624,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 4.936481223114932e-05,
|
|
"loss": 0.7954794883728027,
|
|
"num_input_tokens_seen": 50764800,
|
|
"step": 260,
|
|
"train_runtime": 1552.5757,
|
|
"train_tokens_per_second": 32697.15
|
|
},
|
|
{
|
|
"epoch": 0.27648,
|
|
"grad_norm": 0.890625,
|
|
"learning_rate": 4.934077053477808e-05,
|
|
"loss": 0.7914528369903564,
|
|
"num_input_tokens_seen": 52729152,
|
|
"step": 270,
|
|
"train_runtime": 1612.3049,
|
|
"train_tokens_per_second": 32704.207
|
|
},
|
|
{
|
|
"epoch": 0.28672,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 4.931676393065431e-05,
|
|
"loss": 0.7908175468444825,
|
|
"num_input_tokens_seen": 54695872,
|
|
"step": 280,
|
|
"train_runtime": 1672.5661,
|
|
"train_tokens_per_second": 32701.771
|
|
},
|
|
{
|
|
"epoch": 0.29696,
|
|
"grad_norm": 0.88671875,
|
|
"learning_rate": 4.929279233349088e-05,
|
|
"loss": 0.7946252822875977,
|
|
"num_input_tokens_seen": 56652544,
|
|
"step": 290,
|
|
"train_runtime": 1732.0781,
|
|
"train_tokens_per_second": 32707.847
|
|
},
|
|
{
|
|
"epoch": 0.3072,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 4.926885565829051e-05,
|
|
"loss": 0.7933988571166992,
|
|
"num_input_tokens_seen": 58611264,
|
|
"step": 300,
|
|
"train_runtime": 1791.0492,
|
|
"train_tokens_per_second": 32724.541
|
|
},
|
|
{
|
|
"epoch": 0.31744,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 4.924495382034461e-05,
|
|
"loss": 0.7868727684020996,
|
|
"num_input_tokens_seen": 60538816,
|
|
"step": 310,
|
|
"train_runtime": 1849.7842,
|
|
"train_tokens_per_second": 32727.503
|
|
},
|
|
{
|
|
"epoch": 0.32768,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 4.9221086735231975e-05,
|
|
"loss": 0.7884368896484375,
|
|
"num_input_tokens_seen": 62490560,
|
|
"step": 320,
|
|
"train_runtime": 1908.601,
|
|
"train_tokens_per_second": 32741.553
|
|
},
|
|
{
|
|
"epoch": 0.33792,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 4.919725431881751e-05,
|
|
"loss": 0.7792404174804688,
|
|
"num_input_tokens_seen": 64459392,
|
|
"step": 330,
|
|
"train_runtime": 1969.989,
|
|
"train_tokens_per_second": 32720.686
|
|
},
|
|
{
|
|
"epoch": 0.34816,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 4.917345648725101e-05,
|
|
"loss": 0.7801454067230225,
|
|
"num_input_tokens_seen": 66416320,
|
|
"step": 340,
|
|
"train_runtime": 2030.4427,
|
|
"train_tokens_per_second": 32710.266
|
|
},
|
|
{
|
|
"epoch": 0.3584,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 4.914969315696596e-05,
|
|
"loss": 0.7781849861145019,
|
|
"num_input_tokens_seen": 68379008,
|
|
"step": 350,
|
|
"train_runtime": 2089.8446,
|
|
"train_tokens_per_second": 32719.661
|
|
},
|
|
{
|
|
"epoch": 0.36864,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 4.912596424467818e-05,
|
|
"loss": 0.7765862941741943,
|
|
"num_input_tokens_seen": 70328768,
|
|
"step": 360,
|
|
"train_runtime": 2149.5587,
|
|
"train_tokens_per_second": 32717.77
|
|
},
|
|
{
|
|
"epoch": 0.37888,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 4.910226966738475e-05,
|
|
"loss": 0.7737765312194824,
|
|
"num_input_tokens_seen": 72280640,
|
|
"step": 370,
|
|
"train_runtime": 2209.3771,
|
|
"train_tokens_per_second": 32715.394
|
|
},
|
|
{
|
|
"epoch": 0.38912,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 4.9078609342362666e-05,
|
|
"loss": 0.777079963684082,
|
|
"num_input_tokens_seen": 74217408,
|
|
"step": 380,
|
|
"train_runtime": 2268.2278,
|
|
"train_tokens_per_second": 32720.438
|
|
},
|
|
{
|
|
"epoch": 0.39936,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 4.905498318716775e-05,
|
|
"loss": 0.7765676498413085,
|
|
"num_input_tokens_seen": 76174784,
|
|
"step": 390,
|
|
"train_runtime": 2327.2347,
|
|
"train_tokens_per_second": 32731.888
|
|
},
|
|
{
|
|
"epoch": 0.4096,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 4.9031391119633295e-05,
|
|
"loss": 0.7736555099487304,
|
|
"num_input_tokens_seen": 78158016,
|
|
"step": 400,
|
|
"train_runtime": 2388.4766,
|
|
"train_tokens_per_second": 32722.957
|
|
},
|
|
{
|
|
"epoch": 0.41984,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 4.9007833057869e-05,
|
|
"loss": 0.7716507911682129,
|
|
"num_input_tokens_seen": 80110400,
|
|
"step": 410,
|
|
"train_runtime": 2448.6314,
|
|
"train_tokens_per_second": 32716.398
|
|
},
|
|
{
|
|
"epoch": 0.43008,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 4.898430892025967e-05,
|
|
"loss": 0.7716224193572998,
|
|
"num_input_tokens_seen": 82056960,
|
|
"step": 420,
|
|
"train_runtime": 2507.3071,
|
|
"train_tokens_per_second": 32727.128
|
|
},
|
|
{
|
|
"epoch": 0.44032,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 4.896081862546415e-05,
|
|
"loss": 0.7601117134094239,
|
|
"num_input_tokens_seen": 84000832,
|
|
"step": 430,
|
|
"train_runtime": 2566.4159,
|
|
"train_tokens_per_second": 32730.795
|
|
},
|
|
{
|
|
"epoch": 0.45056,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 4.8937362092414e-05,
|
|
"loss": 0.7689449310302734,
|
|
"num_input_tokens_seen": 85945600,
|
|
"step": 440,
|
|
"train_runtime": 2626.5603,
|
|
"train_tokens_per_second": 32721.731
|
|
},
|
|
{
|
|
"epoch": 0.4608,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 4.891393924031244e-05,
|
|
"loss": 0.7667889595031738,
|
|
"num_input_tokens_seen": 87886144,
|
|
"step": 450,
|
|
"train_runtime": 2684.8831,
|
|
"train_tokens_per_second": 32733.695
|
|
},
|
|
{
|
|
"epoch": 0.47104,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 4.8890549988633095e-05,
|
|
"loss": 0.7657638549804687,
|
|
"num_input_tokens_seen": 89839744,
|
|
"step": 460,
|
|
"train_runtime": 2744.7649,
|
|
"train_tokens_per_second": 32731.308
|
|
},
|
|
{
|
|
"epoch": 0.48128,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 4.8867194257118907e-05,
|
|
"loss": 0.7696039199829101,
|
|
"num_input_tokens_seen": 91805440,
|
|
"step": 470,
|
|
"train_runtime": 2804.7588,
|
|
"train_tokens_per_second": 32732.027
|
|
},
|
|
{
|
|
"epoch": 0.49152,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 4.884387196578093e-05,
|
|
"loss": 0.7688661575317383,
|
|
"num_input_tokens_seen": 93770240,
|
|
"step": 480,
|
|
"train_runtime": 2862.8593,
|
|
"train_tokens_per_second": 32754.052
|
|
},
|
|
{
|
|
"epoch": 0.50176,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 4.882058303489718e-05,
|
|
"loss": 0.7624212265014648,
|
|
"num_input_tokens_seen": 95708096,
|
|
"step": 490,
|
|
"train_runtime": 2921.2238,
|
|
"train_tokens_per_second": 32763.014
|
|
},
|
|
{
|
|
"epoch": 0.512,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 4.8797327385011496e-05,
|
|
"loss": 0.7568993091583252,
|
|
"num_input_tokens_seen": 97676928,
|
|
"step": 500,
|
|
"train_runtime": 2982.1166,
|
|
"train_tokens_per_second": 32754.228
|
|
},
|
|
{
|
|
"epoch": 0.52224,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 4.8774104936932425e-05,
|
|
"loss": 0.7545355796813965,
|
|
"num_input_tokens_seen": 99627776,
|
|
"step": 510,
|
|
"train_runtime": 3041.6074,
|
|
"train_tokens_per_second": 32754.976
|
|
},
|
|
{
|
|
"epoch": 0.53248,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 4.8750915611732076e-05,
|
|
"loss": 0.7593323707580566,
|
|
"num_input_tokens_seen": 101565696,
|
|
"step": 520,
|
|
"train_runtime": 3101.9144,
|
|
"train_tokens_per_second": 32742.908
|
|
},
|
|
{
|
|
"epoch": 0.54272,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 4.8727759330744986e-05,
|
|
"loss": 0.760127067565918,
|
|
"num_input_tokens_seen": 103508992,
|
|
"step": 530,
|
|
"train_runtime": 3161.5479,
|
|
"train_tokens_per_second": 32739.972
|
|
},
|
|
{
|
|
"epoch": 0.55296,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 4.870463601556696e-05,
|
|
"loss": 0.7561708450317383,
|
|
"num_input_tokens_seen": 105456832,
|
|
"step": 540,
|
|
"train_runtime": 3220.8796,
|
|
"train_tokens_per_second": 32741.625
|
|
},
|
|
{
|
|
"epoch": 0.5632,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 4.8681545588054075e-05,
|
|
"loss": 0.7509193420410156,
|
|
"num_input_tokens_seen": 107417344,
|
|
"step": 550,
|
|
"train_runtime": 3280.9845,
|
|
"train_tokens_per_second": 32739.363
|
|
},
|
|
{
|
|
"epoch": 0.57344,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 4.8658487970321404e-05,
|
|
"loss": 0.7538685321807861,
|
|
"num_input_tokens_seen": 109377984,
|
|
"step": 560,
|
|
"train_runtime": 3341.5225,
|
|
"train_tokens_per_second": 32732.978
|
|
},
|
|
{
|
|
"epoch": 0.58368,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 4.863546308474209e-05,
|
|
"loss": 0.7577058792114257,
|
|
"num_input_tokens_seen": 111360832,
|
|
"step": 570,
|
|
"train_runtime": 3401.7812,
|
|
"train_tokens_per_second": 32736.036
|
|
},
|
|
{
|
|
"epoch": 0.59392,
|
|
"grad_norm": 0.76171875,
|
|
"learning_rate": 4.86124708539461e-05,
|
|
"loss": 0.7539366722106934,
|
|
"num_input_tokens_seen": 113337536,
|
|
"step": 580,
|
|
"train_runtime": 3462.9489,
|
|
"train_tokens_per_second": 32728.619
|
|
},
|
|
{
|
|
"epoch": 0.60416,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 4.8589511200819216e-05,
|
|
"loss": 0.7477821826934814,
|
|
"num_input_tokens_seen": 115270336,
|
|
"step": 590,
|
|
"train_runtime": 3521.2998,
|
|
"train_tokens_per_second": 32735.167
|
|
},
|
|
{
|
|
"epoch": 0.6144,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 4.8566584048501926e-05,
|
|
"loss": 0.7609129905700683,
|
|
"num_input_tokens_seen": 117224512,
|
|
"step": 600,
|
|
"train_runtime": 3580.6982,
|
|
"train_tokens_per_second": 32737.892
|
|
},
|
|
{
|
|
"epoch": 0.62464,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 4.854368932038835e-05,
|
|
"loss": 0.7430164337158203,
|
|
"num_input_tokens_seen": 119167552,
|
|
"step": 610,
|
|
"train_runtime": 3640.7229,
|
|
"train_tokens_per_second": 32731.838
|
|
},
|
|
{
|
|
"epoch": 0.63488,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 4.8520826940125144e-05,
|
|
"loss": 0.7435213088989258,
|
|
"num_input_tokens_seen": 121128896,
|
|
"step": 620,
|
|
"train_runtime": 3700.6762,
|
|
"train_tokens_per_second": 32731.558
|
|
},
|
|
{
|
|
"epoch": 0.64512,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 4.849799683161046e-05,
|
|
"loss": 0.7433882713317871,
|
|
"num_input_tokens_seen": 123088256,
|
|
"step": 630,
|
|
"train_runtime": 3760.5434,
|
|
"train_tokens_per_second": 32731.508
|
|
},
|
|
{
|
|
"epoch": 0.65536,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 4.8475198918992835e-05,
|
|
"loss": 0.7475492477416992,
|
|
"num_input_tokens_seen": 125038592,
|
|
"step": 640,
|
|
"train_runtime": 3819.9405,
|
|
"train_tokens_per_second": 32733.126
|
|
},
|
|
{
|
|
"epoch": 0.6656,
|
|
"grad_norm": 0.78125,
|
|
"learning_rate": 4.845243312667023e-05,
|
|
"loss": 0.7479681968688965,
|
|
"num_input_tokens_seen": 126982208,
|
|
"step": 650,
|
|
"train_runtime": 3879.7352,
|
|
"train_tokens_per_second": 32729.607
|
|
},
|
|
{
|
|
"epoch": 0.67584,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 4.842969937928884e-05,
|
|
"loss": 0.7469013214111329,
|
|
"num_input_tokens_seen": 128906880,
|
|
"step": 660,
|
|
"train_runtime": 3936.8159,
|
|
"train_tokens_per_second": 32743.944
|
|
},
|
|
{
|
|
"epoch": 0.68608,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 4.840699760174217e-05,
|
|
"loss": 0.7478948593139648,
|
|
"num_input_tokens_seen": 130882496,
|
|
"step": 670,
|
|
"train_runtime": 3996.7869,
|
|
"train_tokens_per_second": 32746.929
|
|
},
|
|
{
|
|
"epoch": 0.69632,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 4.8384327719169906e-05,
|
|
"loss": 0.7461132049560547,
|
|
"num_input_tokens_seen": 132826752,
|
|
"step": 680,
|
|
"train_runtime": 4055.0975,
|
|
"train_tokens_per_second": 32755.502
|
|
},
|
|
{
|
|
"epoch": 0.70656,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 4.836168965695694e-05,
|
|
"loss": 0.7483083724975585,
|
|
"num_input_tokens_seen": 134780160,
|
|
"step": 690,
|
|
"train_runtime": 4115.1829,
|
|
"train_tokens_per_second": 32751.925
|
|
},
|
|
{
|
|
"epoch": 0.7168,
|
|
"grad_norm": 0.77734375,
|
|
"learning_rate": 4.8339083340732304e-05,
|
|
"loss": 0.7420180320739747,
|
|
"num_input_tokens_seen": 136754944,
|
|
"step": 700,
|
|
"train_runtime": 4177.0113,
|
|
"train_tokens_per_second": 32739.903
|
|
},
|
|
{
|
|
"epoch": 0.72704,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 4.8316508696368154e-05,
|
|
"loss": 0.7432499885559082,
|
|
"num_input_tokens_seen": 138696768,
|
|
"step": 710,
|
|
"train_runtime": 4235.2965,
|
|
"train_tokens_per_second": 32747.83
|
|
},
|
|
{
|
|
"epoch": 0.73728,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 4.8293965649978714e-05,
|
|
"loss": 0.7435853481292725,
|
|
"num_input_tokens_seen": 140653120,
|
|
"step": 720,
|
|
"train_runtime": 4295.3175,
|
|
"train_tokens_per_second": 32745.687
|
|
},
|
|
{
|
|
"epoch": 0.74752,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 4.8271454127919364e-05,
|
|
"loss": 0.7337657928466796,
|
|
"num_input_tokens_seen": 142610880,
|
|
"step": 730,
|
|
"train_runtime": 4354.6033,
|
|
"train_tokens_per_second": 32749.454
|
|
},
|
|
{
|
|
"epoch": 0.75776,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 4.824897405678549e-05,
|
|
"loss": 0.7439666748046875,
|
|
"num_input_tokens_seen": 144560448,
|
|
"step": 740,
|
|
"train_runtime": 4414.809,
|
|
"train_tokens_per_second": 32744.44
|
|
},
|
|
{
|
|
"epoch": 0.768,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 4.8226525363411576e-05,
|
|
"loss": 0.7391902923583984,
|
|
"num_input_tokens_seen": 146522432,
|
|
"step": 750,
|
|
"train_runtime": 4475.754,
|
|
"train_tokens_per_second": 32736.927
|
|
},
|
|
{
|
|
"epoch": 0.77824,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 4.820410797487017e-05,
|
|
"loss": 0.7402773857116699,
|
|
"num_input_tokens_seen": 148465152,
|
|
"step": 760,
|
|
"train_runtime": 4535.4981,
|
|
"train_tokens_per_second": 32734.035
|
|
},
|
|
{
|
|
"epoch": 0.78848,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 4.818172181847091e-05,
|
|
"loss": 0.7375380039215088,
|
|
"num_input_tokens_seen": 150407040,
|
|
"step": 770,
|
|
"train_runtime": 4594.3335,
|
|
"train_tokens_per_second": 32737.51
|
|
},
|
|
{
|
|
"epoch": 0.79872,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 4.81593668217595e-05,
|
|
"loss": 0.7325362205505371,
|
|
"num_input_tokens_seen": 152340608,
|
|
"step": 780,
|
|
"train_runtime": 4654.271,
|
|
"train_tokens_per_second": 32731.357
|
|
},
|
|
{
|
|
"epoch": 0.80896,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 4.813704291251675e-05,
|
|
"loss": 0.7388778686523437,
|
|
"num_input_tokens_seen": 154283968,
|
|
"step": 790,
|
|
"train_runtime": 4713.1072,
|
|
"train_tokens_per_second": 32735.086
|
|
},
|
|
{
|
|
"epoch": 0.8192,
|
|
"grad_norm": 0.77734375,
|
|
"learning_rate": 4.811475001875759e-05,
|
|
"loss": 0.734052324295044,
|
|
"num_input_tokens_seen": 156195392,
|
|
"step": 800,
|
|
"train_runtime": 4770.6972,
|
|
"train_tokens_per_second": 32740.58
|
|
},
|
|
{
|
|
"epoch": 0.82944,
|
|
"grad_norm": 0.76953125,
|
|
"learning_rate": 4.8092488068730105e-05,
|
|
"loss": 0.7394464015960693,
|
|
"num_input_tokens_seen": 158142080,
|
|
"step": 810,
|
|
"train_runtime": 4829.3439,
|
|
"train_tokens_per_second": 32746.08
|
|
},
|
|
{
|
|
"epoch": 0.83968,
|
|
"grad_norm": 0.76953125,
|
|
"learning_rate": 4.807025699091452e-05,
|
|
"loss": 0.7330001831054688,
|
|
"num_input_tokens_seen": 160100224,
|
|
"step": 820,
|
|
"train_runtime": 4889.6473,
|
|
"train_tokens_per_second": 32742.694
|
|
},
|
|
{
|
|
"epoch": 0.84992,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 4.8048056714022325e-05,
|
|
"loss": 0.7365771293640136,
|
|
"num_input_tokens_seen": 162014592,
|
|
"step": 830,
|
|
"train_runtime": 4946.8066,
|
|
"train_tokens_per_second": 32751.35
|
|
},
|
|
{
|
|
"epoch": 0.86016,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 4.802588716699519e-05,
|
|
"loss": 0.7319395065307617,
|
|
"num_input_tokens_seen": 163967296,
|
|
"step": 840,
|
|
"train_runtime": 5006.7801,
|
|
"train_tokens_per_second": 32749.051
|
|
},
|
|
{
|
|
"epoch": 0.8704,
|
|
"grad_norm": 0.77734375,
|
|
"learning_rate": 4.8003748279004156e-05,
|
|
"loss": 0.736358642578125,
|
|
"num_input_tokens_seen": 165888128,
|
|
"step": 850,
|
|
"train_runtime": 5065.2211,
|
|
"train_tokens_per_second": 32750.422
|
|
},
|
|
{
|
|
"epoch": 0.88064,
|
|
"grad_norm": 0.77734375,
|
|
"learning_rate": 4.798163997944854e-05,
|
|
"loss": 0.728258752822876,
|
|
"num_input_tokens_seen": 167838720,
|
|
"step": 860,
|
|
"train_runtime": 5125.0456,
|
|
"train_tokens_per_second": 32748.727
|
|
},
|
|
{
|
|
"epoch": 0.89088,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 4.79595621979551e-05,
|
|
"loss": 0.7310397624969482,
|
|
"num_input_tokens_seen": 169801024,
|
|
"step": 870,
|
|
"train_runtime": 5184.7795,
|
|
"train_tokens_per_second": 32749.903
|
|
},
|
|
{
|
|
"epoch": 0.90112,
|
|
"grad_norm": 0.76953125,
|
|
"learning_rate": 4.793751486437702e-05,
|
|
"loss": 0.7326676845550537,
|
|
"num_input_tokens_seen": 171754432,
|
|
"step": 880,
|
|
"train_runtime": 5243.9099,
|
|
"train_tokens_per_second": 32753.124
|
|
},
|
|
{
|
|
"epoch": 0.91136,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 4.7915497908793064e-05,
|
|
"loss": 0.7294478416442871,
|
|
"num_input_tokens_seen": 173709952,
|
|
"step": 890,
|
|
"train_runtime": 5303.6797,
|
|
"train_tokens_per_second": 32752.723
|
|
},
|
|
{
|
|
"epoch": 0.9216,
|
|
"grad_norm": 0.76171875,
|
|
"learning_rate": 4.7893511261506516e-05,
|
|
"loss": 0.7317845344543457,
|
|
"num_input_tokens_seen": 175665088,
|
|
"step": 900,
|
|
"train_runtime": 5362.9004,
|
|
"train_tokens_per_second": 32755.613
|
|
},
|
|
{
|
|
"epoch": 0.93184,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 4.787155485304435e-05,
|
|
"loss": 0.7250267028808594,
|
|
"num_input_tokens_seen": 177597184,
|
|
"step": 910,
|
|
"train_runtime": 5421.8024,
|
|
"train_tokens_per_second": 32756.115
|
|
},
|
|
{
|
|
"epoch": 0.94208,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 4.784962861415629e-05,
|
|
"loss": 0.7249749183654786,
|
|
"num_input_tokens_seen": 179556736,
|
|
"step": 920,
|
|
"train_runtime": 5481.4833,
|
|
"train_tokens_per_second": 32756.961
|
|
},
|
|
{
|
|
"epoch": 0.95232,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 4.7827732475813884e-05,
|
|
"loss": 0.724465274810791,
|
|
"num_input_tokens_seen": 181523520,
|
|
"step": 930,
|
|
"train_runtime": 5543.5703,
|
|
"train_tokens_per_second": 32744.876
|
|
},
|
|
{
|
|
"epoch": 0.96256,
|
|
"grad_norm": 0.76953125,
|
|
"learning_rate": 4.7805866369209576e-05,
|
|
"loss": 0.7229520797729492,
|
|
"num_input_tokens_seen": 183456256,
|
|
"step": 940,
|
|
"train_runtime": 5602.4662,
|
|
"train_tokens_per_second": 32745.624
|
|
},
|
|
{
|
|
"epoch": 0.9728,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 4.778403022575583e-05,
|
|
"loss": 0.727871322631836,
|
|
"num_input_tokens_seen": 185424896,
|
|
"step": 950,
|
|
"train_runtime": 5663.4738,
|
|
"train_tokens_per_second": 32740.488
|
|
},
|
|
{
|
|
"epoch": 0.98304,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 4.7762223977084195e-05,
|
|
"loss": 0.7236977577209472,
|
|
"num_input_tokens_seen": 187388480,
|
|
"step": 960,
|
|
"train_runtime": 5723.3955,
|
|
"train_tokens_per_second": 32740.788
|
|
},
|
|
{
|
|
"epoch": 0.99328,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 4.774044755504444e-05,
|
|
"loss": 0.7206878185272216,
|
|
"num_input_tokens_seen": 189339648,
|
|
"step": 970,
|
|
"train_runtime": 5782.3102,
|
|
"train_tokens_per_second": 32744.637
|
|
},
|
|
{
|
|
"epoch": 1.003072,
|
|
"grad_norm": 0.7421875,
|
|
"learning_rate": 4.7718700891703616e-05,
|
|
"loss": 0.710568618774414,
|
|
"num_input_tokens_seen": 191208640,
|
|
"step": 980,
|
|
"train_runtime": 5839.7659,
|
|
"train_tokens_per_second": 32742.518
|
|
},
|
|
{
|
|
"epoch": 1.013312,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 4.7696983919345215e-05,
|
|
"loss": 0.6669343948364258,
|
|
"num_input_tokens_seen": 193176512,
|
|
"step": 990,
|
|
"train_runtime": 5899.6765,
|
|
"train_tokens_per_second": 32743.577
|
|
},
|
|
{
|
|
"epoch": 1.023552,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 4.7675296570468216e-05,
|
|
"loss": 0.6645569801330566,
|
|
"num_input_tokens_seen": 195141440,
|
|
"step": 1000,
|
|
"train_runtime": 5960.2946,
|
|
"train_tokens_per_second": 32740.234
|
|
},
|
|
{
|
|
"epoch": 1.033792,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 4.76536387777863e-05,
|
|
"loss": 0.6675229549407959,
|
|
"num_input_tokens_seen": 197092032,
|
|
"step": 1010,
|
|
"train_runtime": 6019.6761,
|
|
"train_tokens_per_second": 32741.302
|
|
},
|
|
{
|
|
"epoch": 1.044032,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 4.7632010474226915e-05,
|
|
"loss": 0.6588812828063965,
|
|
"num_input_tokens_seen": 199066240,
|
|
"step": 1020,
|
|
"train_runtime": 6079.3007,
|
|
"train_tokens_per_second": 32744.924
|
|
},
|
|
{
|
|
"epoch": 1.054272,
|
|
"grad_norm": 0.73828125,
|
|
"learning_rate": 4.761041159293035e-05,
|
|
"loss": 0.6624051094055176,
|
|
"num_input_tokens_seen": 201031808,
|
|
"step": 1030,
|
|
"train_runtime": 6139.0449,
|
|
"train_tokens_per_second": 32746.431
|
|
},
|
|
{
|
|
"epoch": 1.064512,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 4.7588842067249e-05,
|
|
"loss": 0.6641523361206054,
|
|
"num_input_tokens_seen": 202982784,
|
|
"step": 1040,
|
|
"train_runtime": 6200.7013,
|
|
"train_tokens_per_second": 32735.456
|
|
},
|
|
{
|
|
"epoch": 1.074752,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 4.756730183074637e-05,
|
|
"loss": 0.6600203037261962,
|
|
"num_input_tokens_seen": 204943872,
|
|
"step": 1050,
|
|
"train_runtime": 6261.3422,
|
|
"train_tokens_per_second": 32731.62
|
|
},
|
|
{
|
|
"epoch": 1.084992,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 4.7545790817196314e-05,
|
|
"loss": 0.6627418041229248,
|
|
"num_input_tokens_seen": 206907648,
|
|
"step": 1060,
|
|
"train_runtime": 6321.396,
|
|
"train_tokens_per_second": 32731.322
|
|
},
|
|
{
|
|
"epoch": 1.095232,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 4.752430896058212e-05,
|
|
"loss": 0.665987491607666,
|
|
"num_input_tokens_seen": 208866176,
|
|
"step": 1070,
|
|
"train_runtime": 6380.9787,
|
|
"train_tokens_per_second": 32732.624
|
|
},
|
|
{
|
|
"epoch": 1.105472,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 4.750285619509567e-05,
|
|
"loss": 0.6638533115386963,
|
|
"num_input_tokens_seen": 210821184,
|
|
"step": 1080,
|
|
"train_runtime": 6441.6646,
|
|
"train_tokens_per_second": 32727.749
|
|
},
|
|
{
|
|
"epoch": 1.115712,
|
|
"grad_norm": 0.78125,
|
|
"learning_rate": 4.7481432455136644e-05,
|
|
"loss": 0.6705752372741699,
|
|
"num_input_tokens_seen": 212772928,
|
|
"step": 1090,
|
|
"train_runtime": 6499.8174,
|
|
"train_tokens_per_second": 32735.216
|
|
},
|
|
{
|
|
"epoch": 1.125952,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 4.7460037675311584e-05,
|
|
"loss": 0.6647239208221436,
|
|
"num_input_tokens_seen": 214713728,
|
|
"step": 1100,
|
|
"train_runtime": 6558.5813,
|
|
"train_tokens_per_second": 32737.831
|
|
},
|
|
{
|
|
"epoch": 1.136192,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 4.7438671790433126e-05,
|
|
"loss": 0.6651959419250488,
|
|
"num_input_tokens_seen": 216668864,
|
|
"step": 1110,
|
|
"train_runtime": 6617.9492,
|
|
"train_tokens_per_second": 32739.578
|
|
},
|
|
{
|
|
"epoch": 1.146432,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 4.741733473551915e-05,
|
|
"loss": 0.6629802703857421,
|
|
"num_input_tokens_seen": 218629056,
|
|
"step": 1120,
|
|
"train_runtime": 6677.486,
|
|
"train_tokens_per_second": 32741.223
|
|
},
|
|
{
|
|
"epoch": 1.156672,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 4.7396026445791966e-05,
|
|
"loss": 0.6651780605316162,
|
|
"num_input_tokens_seen": 220590464,
|
|
"step": 1130,
|
|
"train_runtime": 6737.0253,
|
|
"train_tokens_per_second": 32743.007
|
|
},
|
|
{
|
|
"epoch": 1.166912,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 4.737474685667742e-05,
|
|
"loss": 0.6648248672485352,
|
|
"num_input_tokens_seen": 222559552,
|
|
"step": 1140,
|
|
"train_runtime": 6796.7448,
|
|
"train_tokens_per_second": 32745.021
|
|
},
|
|
{
|
|
"epoch": 1.177152,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 4.7353495903804165e-05,
|
|
"loss": 0.6667553901672363,
|
|
"num_input_tokens_seen": 224513216,
|
|
"step": 1150,
|
|
"train_runtime": 6856.6383,
|
|
"train_tokens_per_second": 32743.92
|
|
},
|
|
{
|
|
"epoch": 1.187392,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 4.733227352300277e-05,
|
|
"loss": 0.6689923286437989,
|
|
"num_input_tokens_seen": 226447168,
|
|
"step": 1160,
|
|
"train_runtime": 6915.0248,
|
|
"train_tokens_per_second": 32747.123
|
|
},
|
|
{
|
|
"epoch": 1.197632,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 4.731107965030496e-05,
|
|
"loss": 0.6637516021728516,
|
|
"num_input_tokens_seen": 228394368,
|
|
"step": 1170,
|
|
"train_runtime": 6973.9487,
|
|
"train_tokens_per_second": 32749.649
|
|
},
|
|
{
|
|
"epoch": 1.207872,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 4.728991422194278e-05,
|
|
"loss": 0.6736277580261231,
|
|
"num_input_tokens_seen": 230336512,
|
|
"step": 1180,
|
|
"train_runtime": 7032.2836,
|
|
"train_tokens_per_second": 32754.156
|
|
},
|
|
{
|
|
"epoch": 1.218112,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 4.726877717434773e-05,
|
|
"loss": 0.6644347190856934,
|
|
"num_input_tokens_seen": 232273792,
|
|
"step": 1190,
|
|
"train_runtime": 7091.4876,
|
|
"train_tokens_per_second": 32753.888
|
|
},
|
|
{
|
|
"epoch": 1.228352,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 4.724766844415013e-05,
|
|
"loss": 0.662445068359375,
|
|
"num_input_tokens_seen": 234234368,
|
|
"step": 1200,
|
|
"train_runtime": 7151.1612,
|
|
"train_tokens_per_second": 32754.732
|
|
},
|
|
{
|
|
"epoch": 1.238592,
|
|
"grad_norm": 0.7734375,
|
|
"learning_rate": 4.722658796817813e-05,
|
|
"loss": 0.6602650165557862,
|
|
"num_input_tokens_seen": 236184128,
|
|
"step": 1210,
|
|
"train_runtime": 7211.6529,
|
|
"train_tokens_per_second": 32750.346
|
|
},
|
|
{
|
|
"epoch": 1.248832,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 4.7205535683457044e-05,
|
|
"loss": 0.6661070823669434,
|
|
"num_input_tokens_seen": 238148992,
|
|
"step": 1220,
|
|
"train_runtime": 7272.0994,
|
|
"train_tokens_per_second": 32748.314
|
|
},
|
|
{
|
|
"epoch": 1.259072,
|
|
"grad_norm": 0.78125,
|
|
"learning_rate": 4.7184511527208484e-05,
|
|
"loss": 0.6634117603302002,
|
|
"num_input_tokens_seen": 240113216,
|
|
"step": 1230,
|
|
"train_runtime": 7332.2674,
|
|
"train_tokens_per_second": 32747.471
|
|
},
|
|
{
|
|
"epoch": 1.269312,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 4.7163515436849644e-05,
|
|
"loss": 0.659183406829834,
|
|
"num_input_tokens_seen": 242056192,
|
|
"step": 1240,
|
|
"train_runtime": 7391.9286,
|
|
"train_tokens_per_second": 32746.013
|
|
},
|
|
{
|
|
"epoch": 1.279552,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 4.714254734999245e-05,
|
|
"loss": 0.6668022632598877,
|
|
"num_input_tokens_seen": 244001472,
|
|
"step": 1250,
|
|
"train_runtime": 7450.765,
|
|
"train_tokens_per_second": 32748.512
|
|
},
|
|
{
|
|
"epoch": 1.289792,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 4.712160720444284e-05,
|
|
"loss": 0.6643959999084472,
|
|
"num_input_tokens_seen": 245958592,
|
|
"step": 1260,
|
|
"train_runtime": 7510.6075,
|
|
"train_tokens_per_second": 32748.162
|
|
},
|
|
{
|
|
"epoch": 1.300032,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 4.710069493819992e-05,
|
|
"loss": 0.6648179054260254,
|
|
"num_input_tokens_seen": 247917248,
|
|
"step": 1270,
|
|
"train_runtime": 7570.2595,
|
|
"train_tokens_per_second": 32748.844
|
|
},
|
|
{
|
|
"epoch": 1.3102719999999999,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 4.70798104894553e-05,
|
|
"loss": 0.6611180305480957,
|
|
"num_input_tokens_seen": 249863104,
|
|
"step": 1280,
|
|
"train_runtime": 7629.8975,
|
|
"train_tokens_per_second": 32747.898
|
|
},
|
|
{
|
|
"epoch": 1.320512,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 4.705895379659219e-05,
|
|
"loss": 0.663090705871582,
|
|
"num_input_tokens_seen": 251816832,
|
|
"step": 1290,
|
|
"train_runtime": 7690.1349,
|
|
"train_tokens_per_second": 32745.438
|
|
},
|
|
{
|
|
"epoch": 1.330752,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 4.7038124798184766e-05,
|
|
"loss": 0.6652997016906739,
|
|
"num_input_tokens_seen": 253758592,
|
|
"step": 1300,
|
|
"train_runtime": 7750.7327,
|
|
"train_tokens_per_second": 32739.949
|
|
},
|
|
{
|
|
"epoch": 1.340992,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 4.7017323432997304e-05,
|
|
"loss": 0.6616836547851562,
|
|
"num_input_tokens_seen": 255687360,
|
|
"step": 1310,
|
|
"train_runtime": 7809.8266,
|
|
"train_tokens_per_second": 32739.185
|
|
},
|
|
{
|
|
"epoch": 1.351232,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 4.6996549639983506e-05,
|
|
"loss": 0.6657767295837402,
|
|
"num_input_tokens_seen": 257640064,
|
|
"step": 1320,
|
|
"train_runtime": 7867.9946,
|
|
"train_tokens_per_second": 32745.328
|
|
},
|
|
{
|
|
"epoch": 1.361472,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 4.697580335828569e-05,
|
|
"loss": 0.6621747970581054,
|
|
"num_input_tokens_seen": 259595136,
|
|
"step": 1330,
|
|
"train_runtime": 7927.9177,
|
|
"train_tokens_per_second": 32744.429
|
|
},
|
|
{
|
|
"epoch": 1.371712,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 4.6955084527234076e-05,
|
|
"loss": 0.6663068771362305,
|
|
"num_input_tokens_seen": 261559488,
|
|
"step": 1340,
|
|
"train_runtime": 7988.0773,
|
|
"train_tokens_per_second": 32743.735
|
|
},
|
|
{
|
|
"epoch": 1.381952,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 4.6934393086346034e-05,
|
|
"loss": 0.6628549098968506,
|
|
"num_input_tokens_seen": 263504960,
|
|
"step": 1350,
|
|
"train_runtime": 8047.4348,
|
|
"train_tokens_per_second": 32743.97
|
|
},
|
|
{
|
|
"epoch": 1.392192,
|
|
"grad_norm": 0.77734375,
|
|
"learning_rate": 4.6913728975325324e-05,
|
|
"loss": 0.6543691158294678,
|
|
"num_input_tokens_seen": 265475904,
|
|
"step": 1360,
|
|
"train_runtime": 8108.7462,
|
|
"train_tokens_per_second": 32739.451
|
|
},
|
|
{
|
|
"epoch": 1.4024320000000001,
|
|
"grad_norm": 0.7734375,
|
|
"learning_rate": 4.6893092134061393e-05,
|
|
"loss": 0.6563886165618896,
|
|
"num_input_tokens_seen": 267417152,
|
|
"step": 1370,
|
|
"train_runtime": 8167.6607,
|
|
"train_tokens_per_second": 32740.972
|
|
},
|
|
{
|
|
"epoch": 1.412672,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 4.687248250262859e-05,
|
|
"loss": 0.6647259712219238,
|
|
"num_input_tokens_seen": 269353152,
|
|
"step": 1380,
|
|
"train_runtime": 8226.112,
|
|
"train_tokens_per_second": 32743.677
|
|
},
|
|
{
|
|
"epoch": 1.422912,
|
|
"grad_norm": 0.77734375,
|
|
"learning_rate": 4.685190002128548e-05,
|
|
"loss": 0.6596537113189698,
|
|
"num_input_tokens_seen": 271311872,
|
|
"step": 1390,
|
|
"train_runtime": 8285.6877,
|
|
"train_tokens_per_second": 32744.641
|
|
},
|
|
{
|
|
"epoch": 1.433152,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 4.6831344630474114e-05,
|
|
"loss": 0.6623442649841309,
|
|
"num_input_tokens_seen": 273284288,
|
|
"step": 1400,
|
|
"train_runtime": 8345.7692,
|
|
"train_tokens_per_second": 32745.249
|
|
},
|
|
{
|
|
"epoch": 1.443392,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 4.6810816270819276e-05,
|
|
"loss": 0.6568885803222656,
|
|
"num_input_tokens_seen": 275251328,
|
|
"step": 1410,
|
|
"train_runtime": 8404.8193,
|
|
"train_tokens_per_second": 32749.226
|
|
},
|
|
{
|
|
"epoch": 1.453632,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 4.679031488312777e-05,
|
|
"loss": 0.6608157157897949,
|
|
"num_input_tokens_seen": 277202496,
|
|
"step": 1420,
|
|
"train_runtime": 8465.0573,
|
|
"train_tokens_per_second": 32746.677
|
|
},
|
|
{
|
|
"epoch": 1.463872,
|
|
"grad_norm": 0.7265625,
|
|
"learning_rate": 4.6769840408387717e-05,
|
|
"loss": 0.6612616539001465,
|
|
"num_input_tokens_seen": 279162944,
|
|
"step": 1430,
|
|
"train_runtime": 8526.0479,
|
|
"train_tokens_per_second": 32742.362
|
|
},
|
|
{
|
|
"epoch": 1.4741119999999999,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 4.674939278776787e-05,
|
|
"loss": 0.6639165878295898,
|
|
"num_input_tokens_seen": 281109696,
|
|
"step": 1440,
|
|
"train_runtime": 8585.1435,
|
|
"train_tokens_per_second": 32743.739
|
|
},
|
|
{
|
|
"epoch": 1.484352,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 4.672897196261683e-05,
|
|
"loss": 0.6613688945770264,
|
|
"num_input_tokens_seen": 283056064,
|
|
"step": 1450,
|
|
"train_runtime": 8643.8923,
|
|
"train_tokens_per_second": 32746.366
|
|
},
|
|
{
|
|
"epoch": 1.494592,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 4.670857787446238e-05,
|
|
"loss": 0.6640623569488525,
|
|
"num_input_tokens_seen": 285002496,
|
|
"step": 1460,
|
|
"train_runtime": 8703.5414,
|
|
"train_tokens_per_second": 32745.578
|
|
},
|
|
{
|
|
"epoch": 1.504832,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 4.668821046501082e-05,
|
|
"loss": 0.6640773773193359,
|
|
"num_input_tokens_seen": 286959616,
|
|
"step": 1470,
|
|
"train_runtime": 8763.9486,
|
|
"train_tokens_per_second": 32743.188
|
|
},
|
|
{
|
|
"epoch": 1.515072,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 4.6667869676146194e-05,
|
|
"loss": 0.6624667167663574,
|
|
"num_input_tokens_seen": 288905280,
|
|
"step": 1480,
|
|
"train_runtime": 8822.4748,
|
|
"train_tokens_per_second": 32746.512
|
|
},
|
|
{
|
|
"epoch": 1.525312,
|
|
"grad_norm": 0.77734375,
|
|
"learning_rate": 4.6647555449929645e-05,
|
|
"loss": 0.6601789474487305,
|
|
"num_input_tokens_seen": 290846400,
|
|
"step": 1490,
|
|
"train_runtime": 8881.7856,
|
|
"train_tokens_per_second": 32746.388
|
|
},
|
|
{
|
|
"epoch": 1.535552,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 4.662726772859869e-05,
|
|
"loss": 0.6581646919250488,
|
|
"num_input_tokens_seen": 292768064,
|
|
"step": 1500,
|
|
"train_runtime": 8939.6828,
|
|
"train_tokens_per_second": 32749.268
|
|
},
|
|
{
|
|
"epoch": 1.545792,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 4.660700645456655e-05,
|
|
"loss": 0.6602959632873535,
|
|
"num_input_tokens_seen": 294723392,
|
|
"step": 1510,
|
|
"train_runtime": 8999.2269,
|
|
"train_tokens_per_second": 32749.857
|
|
},
|
|
{
|
|
"epoch": 1.556032,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 4.658677157042149e-05,
|
|
"loss": 0.6587230682373046,
|
|
"num_input_tokens_seen": 296664896,
|
|
"step": 1520,
|
|
"train_runtime": 9057.6637,
|
|
"train_tokens_per_second": 32752.916
|
|
},
|
|
{
|
|
"epoch": 1.566272,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 4.656656301892605e-05,
|
|
"loss": 0.6597561836242676,
|
|
"num_input_tokens_seen": 298606592,
|
|
"step": 1530,
|
|
"train_runtime": 9116.7544,
|
|
"train_tokens_per_second": 32753.607
|
|
},
|
|
{
|
|
"epoch": 1.5765120000000001,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 4.6546380743016465e-05,
|
|
"loss": 0.6614864349365235,
|
|
"num_input_tokens_seen": 300562496,
|
|
"step": 1540,
|
|
"train_runtime": 9177.0472,
|
|
"train_tokens_per_second": 32751.547
|
|
},
|
|
{
|
|
"epoch": 1.5867520000000002,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 4.652622468580193e-05,
|
|
"loss": 0.6568780422210694,
|
|
"num_input_tokens_seen": 302519104,
|
|
"step": 1550,
|
|
"train_runtime": 9236.6099,
|
|
"train_tokens_per_second": 32752.179
|
|
},
|
|
{
|
|
"epoch": 1.596992,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 4.650609479056392e-05,
|
|
"loss": 0.6616767883300781,
|
|
"num_input_tokens_seen": 304449152,
|
|
"step": 1560,
|
|
"train_runtime": 9296.2427,
|
|
"train_tokens_per_second": 32749.699
|
|
},
|
|
{
|
|
"epoch": 1.607232,
|
|
"grad_norm": 0.7734375,
|
|
"learning_rate": 4.648599100075556e-05,
|
|
"loss": 0.6637643814086914,
|
|
"num_input_tokens_seen": 306388224,
|
|
"step": 1570,
|
|
"train_runtime": 9355.7549,
|
|
"train_tokens_per_second": 32748.637
|
|
},
|
|
{
|
|
"epoch": 1.617472,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 4.6465913260000945e-05,
|
|
"loss": 0.6638627052307129,
|
|
"num_input_tokens_seen": 308336512,
|
|
"step": 1580,
|
|
"train_runtime": 9414.6843,
|
|
"train_tokens_per_second": 32750.595
|
|
},
|
|
{
|
|
"epoch": 1.627712,
|
|
"grad_norm": 0.7734375,
|
|
"learning_rate": 4.644586151209444e-05,
|
|
"loss": 0.661181640625,
|
|
"num_input_tokens_seen": 310314752,
|
|
"step": 1590,
|
|
"train_runtime": 9476.2434,
|
|
"train_tokens_per_second": 32746.6
|
|
},
|
|
{
|
|
"epoch": 1.6379519999999999,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 4.6425835701000084e-05,
|
|
"loss": 0.6550232887268066,
|
|
"num_input_tokens_seen": 312281088,
|
|
"step": 1600,
|
|
"train_runtime": 9537.1306,
|
|
"train_tokens_per_second": 32743.715
|
|
},
|
|
{
|
|
"epoch": 1.6481919999999999,
|
|
"grad_norm": 0.74609375,
|
|
"learning_rate": 4.640583577085084e-05,
|
|
"loss": 0.6569297790527344,
|
|
"num_input_tokens_seen": 314245824,
|
|
"step": 1610,
|
|
"train_runtime": 9597.5734,
|
|
"train_tokens_per_second": 32742.216
|
|
},
|
|
{
|
|
"epoch": 1.658432,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 4.638586166594806e-05,
|
|
"loss": 0.652769947052002,
|
|
"num_input_tokens_seen": 316216768,
|
|
"step": 1620,
|
|
"train_runtime": 9658.3636,
|
|
"train_tokens_per_second": 32740.201
|
|
},
|
|
{
|
|
"epoch": 1.668672,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 4.6365913330760726e-05,
|
|
"loss": 0.6508107662200928,
|
|
"num_input_tokens_seen": 318168448,
|
|
"step": 1630,
|
|
"train_runtime": 9716.9225,
|
|
"train_tokens_per_second": 32743.747
|
|
},
|
|
{
|
|
"epoch": 1.678912,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 4.6345990709924855e-05,
|
|
"loss": 0.6558364868164063,
|
|
"num_input_tokens_seen": 320136128,
|
|
"step": 1640,
|
|
"train_runtime": 9776.5171,
|
|
"train_tokens_per_second": 32745.417
|
|
},
|
|
{
|
|
"epoch": 1.689152,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 4.632609374824284e-05,
|
|
"loss": 0.6574318885803223,
|
|
"num_input_tokens_seen": 322099456,
|
|
"step": 1650,
|
|
"train_runtime": 9836.4836,
|
|
"train_tokens_per_second": 32745.387
|
|
},
|
|
{
|
|
"epoch": 1.699392,
|
|
"grad_norm": 0.7734375,
|
|
"learning_rate": 4.630622239068285e-05,
|
|
"loss": 0.6548179626464844,
|
|
"num_input_tokens_seen": 324049408,
|
|
"step": 1660,
|
|
"train_runtime": 9895.3464,
|
|
"train_tokens_per_second": 32747.657
|
|
},
|
|
{
|
|
"epoch": 1.709632,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 4.628637658237808e-05,
|
|
"loss": 0.6559741497039795,
|
|
"num_input_tokens_seen": 325990016,
|
|
"step": 1670,
|
|
"train_runtime": 9953.6672,
|
|
"train_tokens_per_second": 32750.745
|
|
},
|
|
{
|
|
"epoch": 1.719872,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 4.626655626862625e-05,
|
|
"loss": 0.6587584495544434,
|
|
"num_input_tokens_seen": 327937472,
|
|
"step": 1680,
|
|
"train_runtime": 10012.7266,
|
|
"train_tokens_per_second": 32752.065
|
|
},
|
|
{
|
|
"epoch": 1.730112,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 4.624676139488888e-05,
|
|
"loss": 0.656014347076416,
|
|
"num_input_tokens_seen": 329908352,
|
|
"step": 1690,
|
|
"train_runtime": 10072.9189,
|
|
"train_tokens_per_second": 32752.011
|
|
},
|
|
{
|
|
"epoch": 1.7403520000000001,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 4.6226991906790686e-05,
|
|
"loss": 0.658781623840332,
|
|
"num_input_tokens_seen": 331853696,
|
|
"step": 1700,
|
|
"train_runtime": 10131.69,
|
|
"train_tokens_per_second": 32754.032
|
|
},
|
|
{
|
|
"epoch": 1.7505920000000001,
|
|
"grad_norm": 0.78125,
|
|
"learning_rate": 4.620724775011897e-05,
|
|
"loss": 0.6597333908081054,
|
|
"num_input_tokens_seen": 333782656,
|
|
"step": 1710,
|
|
"train_runtime": 10190.1862,
|
|
"train_tokens_per_second": 32755.305
|
|
},
|
|
{
|
|
"epoch": 1.760832,
|
|
"grad_norm": 0.76953125,
|
|
"learning_rate": 4.618752887082297e-05,
|
|
"loss": 0.6641686439514161,
|
|
"num_input_tokens_seen": 335741568,
|
|
"step": 1720,
|
|
"train_runtime": 10248.8549,
|
|
"train_tokens_per_second": 32758.935
|
|
},
|
|
{
|
|
"epoch": 1.771072,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 4.616783521501325e-05,
|
|
"loss": 0.6582834720611572,
|
|
"num_input_tokens_seen": 337673856,
|
|
"step": 1730,
|
|
"train_runtime": 10308.2562,
|
|
"train_tokens_per_second": 32757.612
|
|
},
|
|
{
|
|
"epoch": 1.781312,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 4.614816672896108e-05,
|
|
"loss": 0.6613027572631835,
|
|
"num_input_tokens_seen": 339633088,
|
|
"step": 1740,
|
|
"train_runtime": 10368.3354,
|
|
"train_tokens_per_second": 32756.761
|
|
},
|
|
{
|
|
"epoch": 1.791552,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 4.612852335909782e-05,
|
|
"loss": 0.6542655467987061,
|
|
"num_input_tokens_seen": 341581696,
|
|
"step": 1750,
|
|
"train_runtime": 10428.6115,
|
|
"train_tokens_per_second": 32754.283
|
|
},
|
|
{
|
|
"epoch": 1.8017919999999998,
|
|
"grad_norm": 0.7734375,
|
|
"learning_rate": 4.6108905052014323e-05,
|
|
"loss": 0.6533420562744141,
|
|
"num_input_tokens_seen": 343534720,
|
|
"step": 1760,
|
|
"train_runtime": 10488.0364,
|
|
"train_tokens_per_second": 32754.913
|
|
},
|
|
{
|
|
"epoch": 1.8120319999999999,
|
|
"grad_norm": 0.76171875,
|
|
"learning_rate": 4.608931175446027e-05,
|
|
"loss": 0.6449230194091797,
|
|
"num_input_tokens_seen": 345495296,
|
|
"step": 1770,
|
|
"train_runtime": 10547.857,
|
|
"train_tokens_per_second": 32755.023
|
|
},
|
|
{
|
|
"epoch": 1.822272,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 4.606974341334367e-05,
|
|
"loss": 0.6538689613342286,
|
|
"num_input_tokens_seen": 347431552,
|
|
"step": 1780,
|
|
"train_runtime": 10606.573,
|
|
"train_tokens_per_second": 32756.25
|
|
},
|
|
{
|
|
"epoch": 1.832512,
|
|
"grad_norm": 0.7734375,
|
|
"learning_rate": 4.605019997573011e-05,
|
|
"loss": 0.6490047454833985,
|
|
"num_input_tokens_seen": 349382976,
|
|
"step": 1790,
|
|
"train_runtime": 10666.3471,
|
|
"train_tokens_per_second": 32755.635
|
|
},
|
|
{
|
|
"epoch": 1.842752,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 4.603068138884229e-05,
|
|
"loss": 0.6522298812866211,
|
|
"num_input_tokens_seen": 351343680,
|
|
"step": 1800,
|
|
"train_runtime": 10726.0131,
|
|
"train_tokens_per_second": 32756.223
|
|
},
|
|
{
|
|
"epoch": 1.852992,
|
|
"grad_norm": 0.765625,
|
|
"learning_rate": 4.6011187600059345e-05,
|
|
"loss": 0.6543211936950684,
|
|
"num_input_tokens_seen": 353284096,
|
|
"step": 1810,
|
|
"train_runtime": 10785.9291,
|
|
"train_tokens_per_second": 32754.165
|
|
},
|
|
{
|
|
"epoch": 1.863232,
|
|
"grad_norm": 0.7734375,
|
|
"learning_rate": 4.599171855691629e-05,
|
|
"loss": 0.6490991115570068,
|
|
"num_input_tokens_seen": 355207296,
|
|
"step": 1820,
|
|
"train_runtime": 10845.1553,
|
|
"train_tokens_per_second": 32752.624
|
|
},
|
|
{
|
|
"epoch": 1.873472,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 4.597227420710335e-05,
|
|
"loss": 0.6518874168395996,
|
|
"num_input_tokens_seen": 357148288,
|
|
"step": 1830,
|
|
"train_runtime": 10904.8516,
|
|
"train_tokens_per_second": 32751.32
|
|
},
|
|
{
|
|
"epoch": 1.883712,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 4.595285449846551e-05,
|
|
"loss": 0.6608992099761963,
|
|
"num_input_tokens_seen": 359101824,
|
|
"step": 1840,
|
|
"train_runtime": 10964.5719,
|
|
"train_tokens_per_second": 32751.103
|
|
},
|
|
{
|
|
"epoch": 1.893952,
|
|
"grad_norm": 0.76171875,
|
|
"learning_rate": 4.593345937900178e-05,
|
|
"loss": 0.6517756462097168,
|
|
"num_input_tokens_seen": 361063168,
|
|
"step": 1850,
|
|
"train_runtime": 11023.8575,
|
|
"train_tokens_per_second": 32752.888
|
|
},
|
|
{
|
|
"epoch": 1.904192,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 4.591408879686472e-05,
|
|
"loss": 0.6512045860290527,
|
|
"num_input_tokens_seen": 362991872,
|
|
"step": 1860,
|
|
"train_runtime": 11081.5644,
|
|
"train_tokens_per_second": 32756.374
|
|
},
|
|
{
|
|
"epoch": 1.9144320000000001,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 4.5894742700359775e-05,
|
|
"loss": 0.6591498374938964,
|
|
"num_input_tokens_seen": 364946688,
|
|
"step": 1870,
|
|
"train_runtime": 11140.0845,
|
|
"train_tokens_per_second": 32759.777
|
|
},
|
|
{
|
|
"epoch": 1.9246720000000002,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 4.587542103794477e-05,
|
|
"loss": 0.6532726287841797,
|
|
"num_input_tokens_seen": 366891072,
|
|
"step": 1880,
|
|
"train_runtime": 11198.9489,
|
|
"train_tokens_per_second": 32761.206
|
|
},
|
|
{
|
|
"epoch": 1.934912,
|
|
"grad_norm": 0.7578125,
|
|
"learning_rate": 4.5856123758229247e-05,
|
|
"loss": 0.6575124740600586,
|
|
"num_input_tokens_seen": 368845632,
|
|
"step": 1890,
|
|
"train_runtime": 11258.7243,
|
|
"train_tokens_per_second": 32760.873
|
|
},
|
|
{
|
|
"epoch": 1.945152,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 4.5836850809973993e-05,
|
|
"loss": 0.6555071830749511,
|
|
"num_input_tokens_seen": 370797568,
|
|
"step": 1900,
|
|
"train_runtime": 11318.3367,
|
|
"train_tokens_per_second": 32760.783
|
|
},
|
|
{
|
|
"epoch": 1.955392,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 4.5817602142090385e-05,
|
|
"loss": 0.6574622631072998,
|
|
"num_input_tokens_seen": 372745728,
|
|
"step": 1910,
|
|
"train_runtime": 11376.6941,
|
|
"train_tokens_per_second": 32763.976
|
|
},
|
|
{
|
|
"epoch": 1.965632,
|
|
"grad_norm": 0.76953125,
|
|
"learning_rate": 4.579837770363989e-05,
|
|
"loss": 0.6541840553283691,
|
|
"num_input_tokens_seen": 374707904,
|
|
"step": 1920,
|
|
"train_runtime": 11435.9496,
|
|
"train_tokens_per_second": 32765.788
|
|
},
|
|
{
|
|
"epoch": 1.9758719999999999,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 4.57791774438334e-05,
|
|
"loss": 0.6511831283569336,
|
|
"num_input_tokens_seen": 376672064,
|
|
"step": 1930,
|
|
"train_runtime": 11495.5055,
|
|
"train_tokens_per_second": 32766.899
|
|
},
|
|
{
|
|
"epoch": 1.9861119999999999,
|
|
"grad_norm": 0.75390625,
|
|
"learning_rate": 4.576000131203078e-05,
|
|
"loss": 0.653932523727417,
|
|
"num_input_tokens_seen": 378613568,
|
|
"step": 1940,
|
|
"train_runtime": 11555.2052,
|
|
"train_tokens_per_second": 32765.629
|
|
},
|
|
{
|
|
"epoch": 1.996352,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 4.574084925774023e-05,
|
|
"loss": 0.6487459659576416,
|
|
"num_input_tokens_seen": 380541952,
|
|
"step": 1950,
|
|
"train_runtime": 11613.8196,
|
|
"train_tokens_per_second": 32766.305
|
|
},
|
|
{
|
|
"epoch": 2.006144,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 4.5721721230617795e-05,
|
|
"loss": 0.6155517578125,
|
|
"num_input_tokens_seen": 382413824,
|
|
"step": 1960,
|
|
"train_runtime": 11670.483,
|
|
"train_tokens_per_second": 32767.609
|
|
},
|
|
{
|
|
"epoch": 2.016384,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 4.57026171804667e-05,
|
|
"loss": 0.5954423427581788,
|
|
"num_input_tokens_seen": 384361152,
|
|
"step": 1970,
|
|
"train_runtime": 11729.6669,
|
|
"train_tokens_per_second": 32768.292
|
|
},
|
|
{
|
|
"epoch": 2.026624,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 4.568353705723692e-05,
|
|
"loss": 0.5828520774841308,
|
|
"num_input_tokens_seen": 386292032,
|
|
"step": 1980,
|
|
"train_runtime": 11788.2977,
|
|
"train_tokens_per_second": 32769.111
|
|
},
|
|
{
|
|
"epoch": 2.036864,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 4.566448081102455e-05,
|
|
"loss": 0.5893785953521729,
|
|
"num_input_tokens_seen": 388221376,
|
|
"step": 1990,
|
|
"train_runtime": 11845.8075,
|
|
"train_tokens_per_second": 32772.893
|
|
},
|
|
{
|
|
"epoch": 2.047104,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 4.564544839207128e-05,
|
|
"loss": 0.5838380813598633,
|
|
"num_input_tokens_seen": 390196224,
|
|
"step": 2000,
|
|
"train_runtime": 11907.5584,
|
|
"train_tokens_per_second": 32768.785
|
|
},
|
|
{
|
|
"epoch": 2.057344,
|
|
"grad_norm": 0.78125,
|
|
"learning_rate": 4.562643975076387e-05,
|
|
"loss": 0.5901473999023438,
|
|
"num_input_tokens_seen": 392126976,
|
|
"step": 2010,
|
|
"train_runtime": 11965.9242,
|
|
"train_tokens_per_second": 32770.304
|
|
},
|
|
{
|
|
"epoch": 2.067584,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 4.560745483763357e-05,
|
|
"loss": 0.5894758224487304,
|
|
"num_input_tokens_seen": 394095104,
|
|
"step": 2020,
|
|
"train_runtime": 12026.1967,
|
|
"train_tokens_per_second": 32769.72
|
|
},
|
|
{
|
|
"epoch": 2.077824,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 4.5588493603355595e-05,
|
|
"loss": 0.5862543106079101,
|
|
"num_input_tokens_seen": 396042368,
|
|
"step": 2030,
|
|
"train_runtime": 12085.3433,
|
|
"train_tokens_per_second": 32770.469
|
|
},
|
|
{
|
|
"epoch": 2.088064,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 4.556955599874859e-05,
|
|
"loss": 0.5956791400909424,
|
|
"num_input_tokens_seen": 397981952,
|
|
"step": 2040,
|
|
"train_runtime": 12144.0426,
|
|
"train_tokens_per_second": 32771.785
|
|
},
|
|
{
|
|
"epoch": 2.098304,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 4.555064197477409e-05,
|
|
"loss": 0.5897563934326172,
|
|
"num_input_tokens_seen": 399907072,
|
|
"step": 2050,
|
|
"train_runtime": 12201.9828,
|
|
"train_tokens_per_second": 32773.942
|
|
},
|
|
{
|
|
"epoch": 2.108544,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 4.5531751482536e-05,
|
|
"loss": 0.5853563785552979,
|
|
"num_input_tokens_seen": 401862848,
|
|
"step": 2060,
|
|
"train_runtime": 12262.5862,
|
|
"train_tokens_per_second": 32771.46
|
|
},
|
|
{
|
|
"epoch": 2.118784,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 4.5512884473280024e-05,
|
|
"loss": 0.5935741424560547,
|
|
"num_input_tokens_seen": 403810240,
|
|
"step": 2070,
|
|
"train_runtime": 12322.1702,
|
|
"train_tokens_per_second": 32771.033
|
|
},
|
|
{
|
|
"epoch": 2.129024,
|
|
"grad_norm": 0.87890625,
|
|
"learning_rate": 4.549404089839322e-05,
|
|
"loss": 0.59158935546875,
|
|
"num_input_tokens_seen": 405776256,
|
|
"step": 2080,
|
|
"train_runtime": 12383.1293,
|
|
"train_tokens_per_second": 32768.475
|
|
},
|
|
{
|
|
"epoch": 2.139264,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 4.547522070940335e-05,
|
|
"loss": 0.5877013206481934,
|
|
"num_input_tokens_seen": 407735744,
|
|
"step": 2090,
|
|
"train_runtime": 12443.2739,
|
|
"train_tokens_per_second": 32767.562
|
|
},
|
|
{
|
|
"epoch": 2.149504,
|
|
"grad_norm": 0.99609375,
|
|
"learning_rate": 4.545642385797848e-05,
|
|
"loss": 0.5920863628387452,
|
|
"num_input_tokens_seen": 409688064,
|
|
"step": 2100,
|
|
"train_runtime": 12503.2878,
|
|
"train_tokens_per_second": 32766.427
|
|
},
|
|
{
|
|
"epoch": 2.159744,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 4.543765029592637e-05,
|
|
"loss": 0.5942326545715332,
|
|
"num_input_tokens_seen": 411607680,
|
|
"step": 2110,
|
|
"train_runtime": 12561.0265,
|
|
"train_tokens_per_second": 32768.634
|
|
},
|
|
{
|
|
"epoch": 2.169984,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 4.541889997519403e-05,
|
|
"loss": 0.5903902053833008,
|
|
"num_input_tokens_seen": 413559232,
|
|
"step": 2120,
|
|
"train_runtime": 12620.5344,
|
|
"train_tokens_per_second": 32768.758
|
|
},
|
|
{
|
|
"epoch": 2.180224,
|
|
"grad_norm": 1.0546875,
|
|
"learning_rate": 4.5400172847867095e-05,
|
|
"loss": 0.5925062656402588,
|
|
"num_input_tokens_seen": 415502272,
|
|
"step": 2130,
|
|
"train_runtime": 12679.2897,
|
|
"train_tokens_per_second": 32770.154
|
|
},
|
|
{
|
|
"epoch": 2.190464,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 4.5381468866169466e-05,
|
|
"loss": 0.5988312244415284,
|
|
"num_input_tokens_seen": 417454208,
|
|
"step": 2140,
|
|
"train_runtime": 12738.0225,
|
|
"train_tokens_per_second": 32772.293
|
|
},
|
|
{
|
|
"epoch": 2.200704,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 4.5362787982462616e-05,
|
|
"loss": 0.5885556221008301,
|
|
"num_input_tokens_seen": 419408384,
|
|
"step": 2150,
|
|
"train_runtime": 12798.0808,
|
|
"train_tokens_per_second": 32771.194
|
|
},
|
|
{
|
|
"epoch": 2.210944,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 4.5344130149245275e-05,
|
|
"loss": 0.5948306560516358,
|
|
"num_input_tokens_seen": 421340992,
|
|
"step": 2160,
|
|
"train_runtime": 12857.292,
|
|
"train_tokens_per_second": 32770.586
|
|
},
|
|
{
|
|
"epoch": 2.221184,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 4.5325495319152715e-05,
|
|
"loss": 0.595841646194458,
|
|
"num_input_tokens_seen": 423294080,
|
|
"step": 2170,
|
|
"train_runtime": 12915.8392,
|
|
"train_tokens_per_second": 32773.254
|
|
},
|
|
{
|
|
"epoch": 2.231424,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 4.530688344495644e-05,
|
|
"loss": 0.5914995193481445,
|
|
"num_input_tokens_seen": 425247872,
|
|
"step": 2180,
|
|
"train_runtime": 12976.1802,
|
|
"train_tokens_per_second": 32771.422
|
|
},
|
|
{
|
|
"epoch": 2.241664,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 4.528829447956357e-05,
|
|
"loss": 0.5963719367980957,
|
|
"num_input_tokens_seen": 427203328,
|
|
"step": 2190,
|
|
"train_runtime": 13034.7435,
|
|
"train_tokens_per_second": 32774.203
|
|
},
|
|
{
|
|
"epoch": 2.251904,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 4.526972837601633e-05,
|
|
"loss": 0.5922994613647461,
|
|
"num_input_tokens_seen": 429173888,
|
|
"step": 2200,
|
|
"train_runtime": 13094.3153,
|
|
"train_tokens_per_second": 32775.588
|
|
},
|
|
{
|
|
"epoch": 2.262144,
|
|
"grad_norm": 0.9609375,
|
|
"learning_rate": 4.525118508749165e-05,
|
|
"loss": 0.5888791561126709,
|
|
"num_input_tokens_seen": 431118720,
|
|
"step": 2210,
|
|
"train_runtime": 13154.6565,
|
|
"train_tokens_per_second": 32773.088
|
|
},
|
|
{
|
|
"epoch": 2.272384,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 4.5232664567300546e-05,
|
|
"loss": 0.5937693119049072,
|
|
"num_input_tokens_seen": 433071488,
|
|
"step": 2220,
|
|
"train_runtime": 13213.6282,
|
|
"train_tokens_per_second": 32774.608
|
|
},
|
|
{
|
|
"epoch": 2.282624,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 4.521416676888773e-05,
|
|
"loss": 0.5958268165588378,
|
|
"num_input_tokens_seen": 435030464,
|
|
"step": 2230,
|
|
"train_runtime": 13273.5292,
|
|
"train_tokens_per_second": 32774.288
|
|
},
|
|
{
|
|
"epoch": 2.292864,
|
|
"grad_norm": 0.91796875,
|
|
"learning_rate": 4.519569164583107e-05,
|
|
"loss": 0.5926674842834473,
|
|
"num_input_tokens_seen": 436981504,
|
|
"step": 2240,
|
|
"train_runtime": 13333.8604,
|
|
"train_tokens_per_second": 32772.317
|
|
},
|
|
{
|
|
"epoch": 2.303104,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 4.517723915184109e-05,
|
|
"loss": 0.5918882846832275,
|
|
"num_input_tokens_seen": 438963648,
|
|
"step": 2250,
|
|
"train_runtime": 13394.8028,
|
|
"train_tokens_per_second": 32771.191
|
|
},
|
|
{
|
|
"epoch": 2.313344,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 4.5158809240760506e-05,
|
|
"loss": 0.5919432163238525,
|
|
"num_input_tokens_seen": 440906176,
|
|
"step": 2260,
|
|
"train_runtime": 13454.508,
|
|
"train_tokens_per_second": 32770.145
|
|
},
|
|
{
|
|
"epoch": 2.323584,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 4.514040186656375e-05,
|
|
"loss": 0.5900529384613037,
|
|
"num_input_tokens_seen": 442885504,
|
|
"step": 2270,
|
|
"train_runtime": 13515.0748,
|
|
"train_tokens_per_second": 32769.741
|
|
},
|
|
{
|
|
"epoch": 2.333824,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 4.512201698335644e-05,
|
|
"loss": 0.5980159759521484,
|
|
"num_input_tokens_seen": 444823488,
|
|
"step": 2280,
|
|
"train_runtime": 13575.1652,
|
|
"train_tokens_per_second": 32767.446
|
|
},
|
|
{
|
|
"epoch": 2.344064,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 4.510365454537496e-05,
|
|
"loss": 0.5917848587036133,
|
|
"num_input_tokens_seen": 446776320,
|
|
"step": 2290,
|
|
"train_runtime": 13634.2022,
|
|
"train_tokens_per_second": 32768.791
|
|
},
|
|
{
|
|
"epoch": 2.354304,
|
|
"grad_norm": 0.78125,
|
|
"learning_rate": 4.5085314506985945e-05,
|
|
"loss": 0.6014077186584472,
|
|
"num_input_tokens_seen": 448734784,
|
|
"step": 2300,
|
|
"train_runtime": 13693.3577,
|
|
"train_tokens_per_second": 32770.252
|
|
},
|
|
{
|
|
"epoch": 2.364544,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 4.50669968226858e-05,
|
|
"loss": 0.5941033363342285,
|
|
"num_input_tokens_seen": 450674688,
|
|
"step": 2310,
|
|
"train_runtime": 13751.6852,
|
|
"train_tokens_per_second": 32772.324
|
|
},
|
|
{
|
|
"epoch": 2.374784,
|
|
"grad_norm": 0.86328125,
|
|
"learning_rate": 4.504870144710027e-05,
|
|
"loss": 0.5903738021850586,
|
|
"num_input_tokens_seen": 452620544,
|
|
"step": 2320,
|
|
"train_runtime": 13810.0811,
|
|
"train_tokens_per_second": 32774.648
|
|
},
|
|
{
|
|
"epoch": 2.385024,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 4.5030428334983884e-05,
|
|
"loss": 0.59536771774292,
|
|
"num_input_tokens_seen": 454586752,
|
|
"step": 2330,
|
|
"train_runtime": 13870.4679,
|
|
"train_tokens_per_second": 32773.714
|
|
},
|
|
{
|
|
"epoch": 2.395264,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 4.501217744121959e-05,
|
|
"loss": 0.5988545417785645,
|
|
"num_input_tokens_seen": 456539968,
|
|
"step": 2340,
|
|
"train_runtime": 13931.2089,
|
|
"train_tokens_per_second": 32771.023
|
|
},
|
|
{
|
|
"epoch": 2.405504,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 4.499394872081821e-05,
|
|
"loss": 0.5976475715637207,
|
|
"num_input_tokens_seen": 458487936,
|
|
"step": 2350,
|
|
"train_runtime": 13991.1659,
|
|
"train_tokens_per_second": 32769.816
|
|
},
|
|
{
|
|
"epoch": 2.415744,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 4.4975742128918e-05,
|
|
"loss": 0.5921101570129395,
|
|
"num_input_tokens_seen": 460446336,
|
|
"step": 2360,
|
|
"train_runtime": 14051.3115,
|
|
"train_tokens_per_second": 32768.922
|
|
},
|
|
{
|
|
"epoch": 2.425984,
|
|
"grad_norm": 0.85546875,
|
|
"learning_rate": 4.495755762078418e-05,
|
|
"loss": 0.5958994388580322,
|
|
"num_input_tokens_seen": 462432640,
|
|
"step": 2370,
|
|
"train_runtime": 14112.7434,
|
|
"train_tokens_per_second": 32767.027
|
|
},
|
|
{
|
|
"epoch": 2.436224,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 4.49393951518085e-05,
|
|
"loss": 0.5889082908630371,
|
|
"num_input_tokens_seen": 464370368,
|
|
"step": 2380,
|
|
"train_runtime": 14172.1972,
|
|
"train_tokens_per_second": 32766.293
|
|
},
|
|
{
|
|
"epoch": 2.446464,
|
|
"grad_norm": 0.79296875,
|
|
"learning_rate": 4.4921254677508716e-05,
|
|
"loss": 0.5928831100463867,
|
|
"num_input_tokens_seen": 466318912,
|
|
"step": 2390,
|
|
"train_runtime": 14232.8255,
|
|
"train_tokens_per_second": 32763.622
|
|
},
|
|
{
|
|
"epoch": 2.456704,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 4.490313615352821e-05,
|
|
"loss": 0.5945481777191162,
|
|
"num_input_tokens_seen": 468270848,
|
|
"step": 2400,
|
|
"train_runtime": 14292.55,
|
|
"train_tokens_per_second": 32763.282
|
|
},
|
|
{
|
|
"epoch": 2.466944,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 4.48850395356355e-05,
|
|
"loss": 0.5897410392761231,
|
|
"num_input_tokens_seen": 470260224,
|
|
"step": 2410,
|
|
"train_runtime": 14353.7153,
|
|
"train_tokens_per_second": 32762.265
|
|
},
|
|
{
|
|
"epoch": 2.477184,
|
|
"grad_norm": 0.8515625,
|
|
"learning_rate": 4.486696477972375e-05,
|
|
"loss": 0.5936931133270263,
|
|
"num_input_tokens_seen": 472188416,
|
|
"step": 2420,
|
|
"train_runtime": 14411.0634,
|
|
"train_tokens_per_second": 32765.689
|
|
},
|
|
{
|
|
"epoch": 2.487424,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 4.484891184181041e-05,
|
|
"loss": 0.5995767116546631,
|
|
"num_input_tokens_seen": 474117824,
|
|
"step": 2430,
|
|
"train_runtime": 14469.5287,
|
|
"train_tokens_per_second": 32766.639
|
|
},
|
|
{
|
|
"epoch": 2.497664,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 4.483088067803662e-05,
|
|
"loss": 0.6011977195739746,
|
|
"num_input_tokens_seen": 476069504,
|
|
"step": 2440,
|
|
"train_runtime": 14528.4206,
|
|
"train_tokens_per_second": 32768.153
|
|
},
|
|
{
|
|
"epoch": 2.507904,
|
|
"grad_norm": 0.77734375,
|
|
"learning_rate": 4.481287124466697e-05,
|
|
"loss": 0.5965440273284912,
|
|
"num_input_tokens_seen": 478029056,
|
|
"step": 2450,
|
|
"train_runtime": 14588.4906,
|
|
"train_tokens_per_second": 32767.547
|
|
},
|
|
{
|
|
"epoch": 2.518144,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 4.479488349808885e-05,
|
|
"loss": 0.5970401763916016,
|
|
"num_input_tokens_seen": 479992832,
|
|
"step": 2460,
|
|
"train_runtime": 14648.8001,
|
|
"train_tokens_per_second": 32766.7
|
|
},
|
|
{
|
|
"epoch": 2.528384,
|
|
"grad_norm": 0.7890625,
|
|
"learning_rate": 4.4776917394812114e-05,
|
|
"loss": 0.5875445365905761,
|
|
"num_input_tokens_seen": 481965248,
|
|
"step": 2470,
|
|
"train_runtime": 14709.6035,
|
|
"train_tokens_per_second": 32765.346
|
|
},
|
|
{
|
|
"epoch": 2.538624,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 4.475897289146862e-05,
|
|
"loss": 0.5980213165283204,
|
|
"num_input_tokens_seen": 483911872,
|
|
"step": 2480,
|
|
"train_runtime": 14768.9505,
|
|
"train_tokens_per_second": 32765.488
|
|
},
|
|
{
|
|
"epoch": 2.548864,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 4.4741049944811806e-05,
|
|
"loss": 0.5927760601043701,
|
|
"num_input_tokens_seen": 485858560,
|
|
"step": 2490,
|
|
"train_runtime": 14828.1435,
|
|
"train_tokens_per_second": 32765.974
|
|
},
|
|
{
|
|
"epoch": 2.559104,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 4.472314851171621e-05,
|
|
"loss": 0.5933934211730957,
|
|
"num_input_tokens_seen": 487808832,
|
|
"step": 2500,
|
|
"train_runtime": 14886.7134,
|
|
"train_tokens_per_second": 32768.068
|
|
},
|
|
{
|
|
"epoch": 2.569344,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 4.4705268549177084e-05,
|
|
"loss": 0.5965798854827881,
|
|
"num_input_tokens_seen": 489736832,
|
|
"step": 2510,
|
|
"train_runtime": 14944.9788,
|
|
"train_tokens_per_second": 32769.323
|
|
},
|
|
{
|
|
"epoch": 2.579584,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 4.468741001430989e-05,
|
|
"loss": 0.5946637153625488,
|
|
"num_input_tokens_seen": 491707968,
|
|
"step": 2520,
|
|
"train_runtime": 15005.5446,
|
|
"train_tokens_per_second": 32768.419
|
|
},
|
|
{
|
|
"epoch": 2.589824,
|
|
"grad_norm": 0.90625,
|
|
"learning_rate": 4.466957286434997e-05,
|
|
"loss": 0.5971454620361328,
|
|
"num_input_tokens_seen": 493661504,
|
|
"step": 2530,
|
|
"train_runtime": 15065.0579,
|
|
"train_tokens_per_second": 32768.643
|
|
},
|
|
{
|
|
"epoch": 2.600064,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 4.4651757056652e-05,
|
|
"loss": 0.6013389587402344,
|
|
"num_input_tokens_seen": 495603392,
|
|
"step": 2540,
|
|
"train_runtime": 15124.1333,
|
|
"train_tokens_per_second": 32769.044
|
|
},
|
|
{
|
|
"epoch": 2.610304,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 4.463396254868968e-05,
|
|
"loss": 0.5951766014099121,
|
|
"num_input_tokens_seen": 497553920,
|
|
"step": 2550,
|
|
"train_runtime": 15183.8819,
|
|
"train_tokens_per_second": 32768.558
|
|
},
|
|
{
|
|
"epoch": 2.6205439999999998,
|
|
"grad_norm": 0.828125,
|
|
"learning_rate": 4.461618929805519e-05,
|
|
"loss": 0.5954748153686523,
|
|
"num_input_tokens_seen": 499495872,
|
|
"step": 2560,
|
|
"train_runtime": 15243.1326,
|
|
"train_tokens_per_second": 32768.584
|
|
},
|
|
{
|
|
"epoch": 2.6307840000000002,
|
|
"grad_norm": 0.859375,
|
|
"learning_rate": 4.459843726245888e-05,
|
|
"loss": 0.586335563659668,
|
|
"num_input_tokens_seen": 501455808,
|
|
"step": 2570,
|
|
"train_runtime": 15302.5352,
|
|
"train_tokens_per_second": 32769.46
|
|
},
|
|
{
|
|
"epoch": 2.641024,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 4.458070639972875e-05,
|
|
"loss": 0.5931864738464355,
|
|
"num_input_tokens_seen": 503391232,
|
|
"step": 2580,
|
|
"train_runtime": 15361.7014,
|
|
"train_tokens_per_second": 32769.237
|
|
},
|
|
{
|
|
"epoch": 2.651264,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 4.456299666781007e-05,
|
|
"loss": 0.5972167015075683,
|
|
"num_input_tokens_seen": 505354624,
|
|
"step": 2590,
|
|
"train_runtime": 15422.5101,
|
|
"train_tokens_per_second": 32767.34
|
|
},
|
|
{
|
|
"epoch": 2.661504,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 4.4545308024764984e-05,
|
|
"loss": 0.597212266921997,
|
|
"num_input_tokens_seen": 507291008,
|
|
"step": 2600,
|
|
"train_runtime": 15482.1176,
|
|
"train_tokens_per_second": 32766.255
|
|
},
|
|
{
|
|
"epoch": 2.671744,
|
|
"grad_norm": 0.80078125,
|
|
"learning_rate": 4.452764042877207e-05,
|
|
"loss": 0.59915771484375,
|
|
"num_input_tokens_seen": 509231104,
|
|
"step": 2610,
|
|
"train_runtime": 15541.0581,
|
|
"train_tokens_per_second": 32766.823
|
|
},
|
|
{
|
|
"epoch": 2.681984,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 4.45099938381259e-05,
|
|
"loss": 0.5966706275939941,
|
|
"num_input_tokens_seen": 511185152,
|
|
"step": 2620,
|
|
"train_runtime": 15601.7043,
|
|
"train_tokens_per_second": 32764.699
|
|
},
|
|
{
|
|
"epoch": 2.692224,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 4.449236821123667e-05,
|
|
"loss": 0.5944993019104003,
|
|
"num_input_tokens_seen": 513121152,
|
|
"step": 2630,
|
|
"train_runtime": 15660.022,
|
|
"train_tokens_per_second": 32766.311
|
|
},
|
|
{
|
|
"epoch": 2.702464,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 4.447476350662976e-05,
|
|
"loss": 0.5976039409637451,
|
|
"num_input_tokens_seen": 515076928,
|
|
"step": 2640,
|
|
"train_runtime": 15719.1649,
|
|
"train_tokens_per_second": 32767.449
|
|
},
|
|
{
|
|
"epoch": 2.712704,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 4.4457179682945346e-05,
|
|
"loss": 0.5955704689025879,
|
|
"num_input_tokens_seen": 517031488,
|
|
"step": 2650,
|
|
"train_runtime": 15778.7122,
|
|
"train_tokens_per_second": 32767.661
|
|
},
|
|
{
|
|
"epoch": 2.722944,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 4.443961669893798e-05,
|
|
"loss": 0.5922414779663085,
|
|
"num_input_tokens_seen": 518978880,
|
|
"step": 2660,
|
|
"train_runtime": 15838.7635,
|
|
"train_tokens_per_second": 32766.376
|
|
},
|
|
{
|
|
"epoch": 2.733184,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 4.4422074513476155e-05,
|
|
"loss": 0.5948915481567383,
|
|
"num_input_tokens_seen": 520932416,
|
|
"step": 2670,
|
|
"train_runtime": 15898.2387,
|
|
"train_tokens_per_second": 32766.675
|
|
},
|
|
{
|
|
"epoch": 2.743424,
|
|
"grad_norm": 0.90234375,
|
|
"learning_rate": 4.4404553085541955e-05,
|
|
"loss": 0.603402853012085,
|
|
"num_input_tokens_seen": 522866176,
|
|
"step": 2680,
|
|
"train_runtime": 15956.9495,
|
|
"train_tokens_per_second": 32767.302
|
|
},
|
|
{
|
|
"epoch": 2.753664,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 4.438705237423063e-05,
|
|
"loss": 0.5967090606689454,
|
|
"num_input_tokens_seen": 524830528,
|
|
"step": 2690,
|
|
"train_runtime": 16016.5448,
|
|
"train_tokens_per_second": 32768.024
|
|
},
|
|
{
|
|
"epoch": 2.763904,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 4.436957233875017e-05,
|
|
"loss": 0.5950541496276855,
|
|
"num_input_tokens_seen": 526763648,
|
|
"step": 2700,
|
|
"train_runtime": 16074.8455,
|
|
"train_tokens_per_second": 32769.438
|
|
},
|
|
{
|
|
"epoch": 2.774144,
|
|
"grad_norm": 0.8359375,
|
|
"learning_rate": 4.4352112938420956e-05,
|
|
"loss": 0.5917387962341308,
|
|
"num_input_tokens_seen": 528714368,
|
|
"step": 2710,
|
|
"train_runtime": 16134.1716,
|
|
"train_tokens_per_second": 32769.849
|
|
},
|
|
{
|
|
"epoch": 2.784384,
|
|
"grad_norm": 0.77734375,
|
|
"learning_rate": 4.433467413267529e-05,
|
|
"loss": 0.592765474319458,
|
|
"num_input_tokens_seen": 530652416,
|
|
"step": 2720,
|
|
"train_runtime": 16192.9592,
|
|
"train_tokens_per_second": 32770.565
|
|
},
|
|
{
|
|
"epoch": 2.7946239999999998,
|
|
"grad_norm": 0.87109375,
|
|
"learning_rate": 4.431725588105708e-05,
|
|
"loss": 0.5953330993652344,
|
|
"num_input_tokens_seen": 532596928,
|
|
"step": 2730,
|
|
"train_runtime": 16251.8008,
|
|
"train_tokens_per_second": 32771.564
|
|
},
|
|
{
|
|
"epoch": 2.8048640000000002,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 4.4299858143221377e-05,
|
|
"loss": 0.5934776306152344,
|
|
"num_input_tokens_seen": 534571776,
|
|
"step": 2740,
|
|
"train_runtime": 16311.457,
|
|
"train_tokens_per_second": 32772.779
|
|
},
|
|
{
|
|
"epoch": 2.815104,
|
|
"grad_norm": 0.8125,
|
|
"learning_rate": 4.4282480878934065e-05,
|
|
"loss": 0.5929346561431885,
|
|
"num_input_tokens_seen": 536513472,
|
|
"step": 2750,
|
|
"train_runtime": 16370.5136,
|
|
"train_tokens_per_second": 32773.161
|
|
},
|
|
{
|
|
"epoch": 2.825344,
|
|
"grad_norm": 0.8203125,
|
|
"learning_rate": 4.4265124048071346e-05,
|
|
"loss": 0.5918947219848633,
|
|
"num_input_tokens_seen": 538483968,
|
|
"step": 2760,
|
|
"train_runtime": 16430.5232,
|
|
"train_tokens_per_second": 32773.391
|
|
},
|
|
{
|
|
"epoch": 2.835584,
|
|
"grad_norm": 0.82421875,
|
|
"learning_rate": 4.4247787610619477e-05,
|
|
"loss": 0.594475269317627,
|
|
"num_input_tokens_seen": 540438592,
|
|
"step": 2770,
|
|
"train_runtime": 16489.7455,
|
|
"train_tokens_per_second": 32774.223
|
|
},
|
|
{
|
|
"epoch": 2.845824,
|
|
"grad_norm": 0.84375,
|
|
"learning_rate": 4.42304715266743e-05,
|
|
"loss": 0.5964062690734864,
|
|
"num_input_tokens_seen": 542392128,
|
|
"step": 2780,
|
|
"train_runtime": 16549.9267,
|
|
"train_tokens_per_second": 32773.083
|
|
},
|
|
{
|
|
"epoch": 2.856064,
|
|
"grad_norm": 0.83203125,
|
|
"learning_rate": 4.421317575644092e-05,
|
|
"loss": 0.5967954635620117,
|
|
"num_input_tokens_seen": 544377664,
|
|
"step": 2790,
|
|
"train_runtime": 16610.0177,
|
|
"train_tokens_per_second": 32774.057
|
|
},
|
|
{
|
|
"epoch": 2.866304,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 4.419590026023325e-05,
|
|
"loss": 0.5921245098114014,
|
|
"num_input_tokens_seen": 546344448,
|
|
"step": 2800,
|
|
"train_runtime": 16668.9664,
|
|
"train_tokens_per_second": 32776.144
|
|
},
|
|
{
|
|
"epoch": 2.876544,
|
|
"grad_norm": 0.78515625,
|
|
"learning_rate": 4.417864499847368e-05,
|
|
"loss": 0.5939229965209961,
|
|
"num_input_tokens_seen": 548293568,
|
|
"step": 2810,
|
|
"train_runtime": 16728.7214,
|
|
"train_tokens_per_second": 32775.581
|
|
},
|
|
{
|
|
"epoch": 2.886784,
|
|
"grad_norm": 0.8828125,
|
|
"learning_rate": 4.4161409931692676e-05,
|
|
"loss": 0.6008837699890137,
|
|
"num_input_tokens_seen": 550250688,
|
|
"step": 2820,
|
|
"train_runtime": 16788.0142,
|
|
"train_tokens_per_second": 32776.401
|
|
},
|
|
{
|
|
"epoch": 2.897024,
|
|
"grad_norm": 0.875,
|
|
"learning_rate": 4.414419502052841e-05,
|
|
"loss": 0.5984635353088379,
|
|
"num_input_tokens_seen": 552207104,
|
|
"step": 2830,
|
|
"train_runtime": 16846.6414,
|
|
"train_tokens_per_second": 32778.469
|
|
},
|
|
{
|
|
"epoch": 2.907264,
|
|
"grad_norm": 0.81640625,
|
|
"learning_rate": 4.412700022572637e-05,
|
|
"loss": 0.5894341945648194,
|
|
"num_input_tokens_seen": 554150528,
|
|
"step": 2840,
|
|
"train_runtime": 16906.9041,
|
|
"train_tokens_per_second": 32776.582
|
|
},
|
|
{
|
|
"epoch": 2.917504,
|
|
"grad_norm": 0.77734375,
|
|
"learning_rate": 4.410982550813902e-05,
|
|
"loss": 0.5969189643859864,
|
|
"num_input_tokens_seen": 556108544,
|
|
"step": 2850,
|
|
"train_runtime": 16966.3284,
|
|
"train_tokens_per_second": 32777.189
|
|
},
|
|
{
|
|
"epoch": 2.927744,
|
|
"grad_norm": 0.84765625,
|
|
"learning_rate": 4.409267082872535e-05,
|
|
"loss": 0.5878054618835449,
|
|
"num_input_tokens_seen": 558057216,
|
|
"step": 2860,
|
|
"train_runtime": 17025.2622,
|
|
"train_tokens_per_second": 32778.186
|
|
},
|
|
{
|
|
"epoch": 2.937984,
|
|
"grad_norm": 0.796875,
|
|
"learning_rate": 4.407553614855059e-05,
|
|
"loss": 0.5897252082824707,
|
|
"num_input_tokens_seen": 560011008,
|
|
"step": 2870,
|
|
"train_runtime": 17084.3194,
|
|
"train_tokens_per_second": 32779.24
|
|
},
|
|
{
|
|
"epoch": 2.9482239999999997,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 4.405842142878579e-05,
|
|
"loss": 0.5927898406982421,
|
|
"num_input_tokens_seen": 561967104,
|
|
"step": 2880,
|
|
"train_runtime": 17144.0476,
|
|
"train_tokens_per_second": 32779.138
|
|
},
|
|
{
|
|
"epoch": 2.958464,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 4.404132663070745e-05,
|
|
"loss": 0.5948840141296386,
|
|
"num_input_tokens_seen": 563924032,
|
|
"step": 2890,
|
|
"train_runtime": 17203.5627,
|
|
"train_tokens_per_second": 32779.491
|
|
},
|
|
{
|
|
"epoch": 2.968704,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 4.402425171569716e-05,
|
|
"loss": 0.5974791526794434,
|
|
"num_input_tokens_seen": 565866240,
|
|
"step": 2900,
|
|
"train_runtime": 17264.9688,
|
|
"train_tokens_per_second": 32775.399
|
|
},
|
|
{
|
|
"epoch": 2.9789440000000003,
|
|
"grad_norm": 0.83984375,
|
|
"learning_rate": 4.400719664524127e-05,
|
|
"loss": 0.5980208396911622,
|
|
"num_input_tokens_seen": 567839616,
|
|
"step": 2910,
|
|
"train_runtime": 17324.5301,
|
|
"train_tokens_per_second": 32776.624
|
|
},
|
|
{
|
|
"epoch": 2.989184,
|
|
"grad_norm": 0.80859375,
|
|
"learning_rate": 4.399016138093044e-05,
|
|
"loss": 0.5934501647949219,
|
|
"num_input_tokens_seen": 569804928,
|
|
"step": 2920,
|
|
"train_runtime": 17384.4555,
|
|
"train_tokens_per_second": 32776.691
|
|
},
|
|
{
|
|
"epoch": 2.999424,
|
|
"grad_norm": 0.8046875,
|
|
"learning_rate": 4.397314588445937e-05,
|
|
"loss": 0.5971685409545898,
|
|
"num_input_tokens_seen": 571794176,
|
|
"step": 2930,
|
|
"train_runtime": 17444.6674,
|
|
"train_tokens_per_second": 32777.591
|
|
},
|
|
{
|
|
"epoch": 3.0,
|
|
"eval_loss": 0.7842721939086914,
|
|
"eval_runtime": 1.0376,
|
|
"eval_samples_per_second": 960.831,
|
|
"eval_steps_per_second": 7.71,
|
|
"num_input_tokens_seen": 571898240,
|
|
"step": 2931
|
|
},
|
|
{
|
|
"epoch": 3.0,
|
|
"num_input_tokens_seen": 571898240,
|
|
"step": 2931,
|
|
"total_flos": 9.521329376839336e+18,
|
|
"train_loss": 0.6782078807039174,
|
|
"train_runtime": 17469.688,
|
|
"train_samples_per_second": 171.726,
|
|
"train_steps_per_second": 0.168
|
|
}
|
|
],
|
|
"logging_steps": 10,
|
|
"max_steps": 2931,
|
|
"num_input_tokens_seen": 571898240,
|
|
"num_train_epochs": 3,
|
|
"save_steps": 5000,
|
|
"stateful_callbacks": {
|
|
"TrainerControl": {
|
|
"args": {
|
|
"should_epoch_stop": false,
|
|
"should_evaluate": false,
|
|
"should_log": false,
|
|
"should_save": true,
|
|
"should_training_stop": true
|
|
},
|
|
"attributes": {}
|
|
}
|
|
},
|
|
"total_flos": 9.521329376839336e+18,
|
|
"train_batch_size": 8,
|
|
"trial_name": null,
|
|
"trial_params": null
|
|
}
|