2965 lines
84 KiB
JSON
2965 lines
84 KiB
JSON
{
|
|
"best_global_step": 780,
|
|
"best_metric": 0.21140252,
|
|
"best_model_checkpoint": "/data/home/scyb089/CODE/scripts/ms-swift/3b-new/v35-20250515-190329/checkpoint-780",
|
|
"epoch": 2.9984321103794294,
|
|
"eval_steps": 20,
|
|
"global_step": 1194,
|
|
"is_hyper_param_search": false,
|
|
"is_local_process_zero": true,
|
|
"is_world_process_zero": true,
|
|
"log_history": [
|
|
{
|
|
"epoch": 0.002508623392913139,
|
|
"grad_norm": 2.42844295501709,
|
|
"learning_rate": 9.999982692639099e-06,
|
|
"loss": 0.3909474313259125,
|
|
"memory(GiB)": 27.73,
|
|
"step": 1,
|
|
"token_acc": 0.894524376358555,
|
|
"train_speed(iter/s)": 0.067547
|
|
},
|
|
{
|
|
"epoch": 0.012543116964565695,
|
|
"grad_norm": 1.4327075481414795,
|
|
"learning_rate": 9.999567321968297e-06,
|
|
"loss": 0.3400489389896393,
|
|
"memory(GiB)": 27.77,
|
|
"step": 5,
|
|
"token_acc": 0.8959139922567434,
|
|
"train_speed(iter/s)": 0.120631
|
|
},
|
|
{
|
|
"epoch": 0.02508623392913139,
|
|
"grad_norm": 1.0735282897949219,
|
|
"learning_rate": 9.998269362757298e-06,
|
|
"loss": 0.29977970123291015,
|
|
"memory(GiB)": 27.77,
|
|
"step": 10,
|
|
"token_acc": 0.9025726353513375,
|
|
"train_speed(iter/s)": 0.135778
|
|
},
|
|
{
|
|
"epoch": 0.03762935089369708,
|
|
"grad_norm": 1.0521410703659058,
|
|
"learning_rate": 9.996106347006378e-06,
|
|
"loss": 0.29440090656280515,
|
|
"memory(GiB)": 27.77,
|
|
"step": 15,
|
|
"token_acc": 0.9007310504040016,
|
|
"train_speed(iter/s)": 0.142102
|
|
},
|
|
{
|
|
"epoch": 0.05017246785826278,
|
|
"grad_norm": 0.9543823599815369,
|
|
"learning_rate": 9.993078649071297e-06,
|
|
"loss": 0.2636571884155273,
|
|
"memory(GiB)": 27.77,
|
|
"step": 20,
|
|
"token_acc": 0.9062953050072488,
|
|
"train_speed(iter/s)": 0.1454
|
|
},
|
|
{
|
|
"epoch": 0.05017246785826278,
|
|
"eval_loss": 0.2918511629104614,
|
|
"eval_runtime": 15.4309,
|
|
"eval_samples_per_second": 16.655,
|
|
"eval_steps_per_second": 4.212,
|
|
"eval_token_acc": 0.9070563316178273,
|
|
"step": 20
|
|
},
|
|
{
|
|
"epoch": 0.06271558482282848,
|
|
"grad_norm": 0.832170307636261,
|
|
"learning_rate": 9.989186792959408e-06,
|
|
"loss": 0.2766774892807007,
|
|
"memory(GiB)": 27.77,
|
|
"step": 25,
|
|
"token_acc": 0.906058171787138,
|
|
"train_speed(iter/s)": 0.125214
|
|
},
|
|
{
|
|
"epoch": 0.07525870178739416,
|
|
"grad_norm": 0.9243336319923401,
|
|
"learning_rate": 9.984431452238968e-06,
|
|
"loss": 0.2811694383621216,
|
|
"memory(GiB)": 27.77,
|
|
"step": 30,
|
|
"token_acc": 0.903684501937887,
|
|
"train_speed(iter/s)": 0.129949
|
|
},
|
|
{
|
|
"epoch": 0.08780181875195986,
|
|
"grad_norm": 0.8159760236740112,
|
|
"learning_rate": 9.97881344992256e-06,
|
|
"loss": 0.27519750595092773,
|
|
"memory(GiB)": 27.77,
|
|
"step": 35,
|
|
"token_acc": 0.9162855786290827,
|
|
"train_speed(iter/s)": 0.1336
|
|
},
|
|
{
|
|
"epoch": 0.10034493571652556,
|
|
"grad_norm": 0.7792373895645142,
|
|
"learning_rate": 9.97233375832466e-06,
|
|
"loss": 0.2597078561782837,
|
|
"memory(GiB)": 29.52,
|
|
"step": 40,
|
|
"token_acc": 0.9129214970091578,
|
|
"train_speed(iter/s)": 0.136712
|
|
},
|
|
{
|
|
"epoch": 0.10034493571652556,
|
|
"eval_loss": 0.2732233703136444,
|
|
"eval_runtime": 15.3078,
|
|
"eval_samples_per_second": 16.789,
|
|
"eval_steps_per_second": 4.246,
|
|
"eval_token_acc": 0.9114851381157442,
|
|
"step": 40
|
|
},
|
|
{
|
|
"epoch": 0.11288805268109126,
|
|
"grad_norm": 0.8562310934066772,
|
|
"learning_rate": 9.964993498893349e-06,
|
|
"loss": 0.2654439449310303,
|
|
"memory(GiB)": 29.52,
|
|
"step": 45,
|
|
"token_acc": 0.9112415484062709,
|
|
"train_speed(iter/s)": 0.12778
|
|
},
|
|
{
|
|
"epoch": 0.12543116964565695,
|
|
"grad_norm": 0.6892139911651611,
|
|
"learning_rate": 9.95679394201623e-06,
|
|
"loss": 0.2535998821258545,
|
|
"memory(GiB)": 29.52,
|
|
"step": 50,
|
|
"token_acc": 0.9140140785820456,
|
|
"train_speed(iter/s)": 0.129639
|
|
},
|
|
{
|
|
"epoch": 0.13797428661022265,
|
|
"grad_norm": 0.7636090517044067,
|
|
"learning_rate": 9.947736506800554e-06,
|
|
"loss": 0.25037508010864257,
|
|
"memory(GiB)": 29.52,
|
|
"step": 55,
|
|
"token_acc": 0.9177434445090652,
|
|
"train_speed(iter/s)": 0.131231
|
|
},
|
|
{
|
|
"epoch": 0.15051740357478832,
|
|
"grad_norm": 0.8940523862838745,
|
|
"learning_rate": 9.93782276082762e-06,
|
|
"loss": 0.266965389251709,
|
|
"memory(GiB)": 29.52,
|
|
"step": 60,
|
|
"token_acc": 0.9066724143239832,
|
|
"train_speed(iter/s)": 0.13265
|
|
},
|
|
{
|
|
"epoch": 0.15051740357478832,
|
|
"eval_loss": 0.2631765604019165,
|
|
"eval_runtime": 15.3396,
|
|
"eval_samples_per_second": 16.754,
|
|
"eval_steps_per_second": 4.237,
|
|
"eval_token_acc": 0.9138133249308547,
|
|
"step": 60
|
|
},
|
|
{
|
|
"epoch": 0.16306052053935402,
|
|
"grad_norm": 0.7258597016334534,
|
|
"learning_rate": 9.927054419881462e-06,
|
|
"loss": 0.26306581497192383,
|
|
"memory(GiB)": 29.52,
|
|
"step": 65,
|
|
"token_acc": 0.909740298154283,
|
|
"train_speed(iter/s)": 0.127128
|
|
},
|
|
{
|
|
"epoch": 0.17560363750391972,
|
|
"grad_norm": 0.7783539891242981,
|
|
"learning_rate": 9.915433347651909e-06,
|
|
"loss": 0.25382609367370607,
|
|
"memory(GiB)": 29.52,
|
|
"step": 70,
|
|
"token_acc": 0.9123886777468944,
|
|
"train_speed(iter/s)": 0.1281
|
|
},
|
|
{
|
|
"epoch": 0.18814675446848542,
|
|
"grad_norm": 1.1043397188186646,
|
|
"learning_rate": 9.90296155541202e-06,
|
|
"loss": 0.23381214141845702,
|
|
"memory(GiB)": 29.52,
|
|
"step": 75,
|
|
"token_acc": 0.9195295753432594,
|
|
"train_speed(iter/s)": 0.129783
|
|
},
|
|
{
|
|
"epoch": 0.20068987143305111,
|
|
"grad_norm": 0.7191760540008545,
|
|
"learning_rate": 9.88964120167001e-06,
|
|
"loss": 0.24255027770996093,
|
|
"memory(GiB)": 29.52,
|
|
"step": 80,
|
|
"token_acc": 0.9175339800100245,
|
|
"train_speed(iter/s)": 0.130834
|
|
},
|
|
{
|
|
"epoch": 0.20068987143305111,
|
|
"eval_loss": 0.2570763826370239,
|
|
"eval_runtime": 15.3498,
|
|
"eval_samples_per_second": 16.743,
|
|
"eval_steps_per_second": 4.235,
|
|
"eval_token_acc": 0.9149861709204216,
|
|
"step": 80
|
|
},
|
|
{
|
|
"epoch": 0.2132329883976168,
|
|
"grad_norm": 0.8330841660499573,
|
|
"learning_rate": 9.875474591795648e-06,
|
|
"loss": 0.25277366638183596,
|
|
"memory(GiB)": 29.52,
|
|
"step": 85,
|
|
"token_acc": 0.9098456609469825,
|
|
"train_speed(iter/s)": 0.126852
|
|
},
|
|
{
|
|
"epoch": 0.2257761053621825,
|
|
"grad_norm": 0.8644626140594482,
|
|
"learning_rate": 9.860464177621286e-06,
|
|
"loss": 0.24066619873046874,
|
|
"memory(GiB)": 29.52,
|
|
"step": 90,
|
|
"token_acc": 0.916673759468891,
|
|
"train_speed(iter/s)": 0.128058
|
|
},
|
|
{
|
|
"epoch": 0.2383192223267482,
|
|
"grad_norm": 0.7505571246147156,
|
|
"learning_rate": 9.84461255701751e-06,
|
|
"loss": 0.23320527076721193,
|
|
"memory(GiB)": 29.52,
|
|
"step": 95,
|
|
"token_acc": 0.9196099359596351,
|
|
"train_speed(iter/s)": 0.129334
|
|
},
|
|
{
|
|
"epoch": 0.2508623392913139,
|
|
"grad_norm": 0.7608115673065186,
|
|
"learning_rate": 9.827922473443518e-06,
|
|
"loss": 0.24348812103271483,
|
|
"memory(GiB)": 29.52,
|
|
"step": 100,
|
|
"token_acc": 0.9140099444281954,
|
|
"train_speed(iter/s)": 0.130537
|
|
},
|
|
{
|
|
"epoch": 0.2508623392913139,
|
|
"eval_loss": 0.25154590606689453,
|
|
"eval_runtime": 15.3221,
|
|
"eval_samples_per_second": 16.773,
|
|
"eval_steps_per_second": 4.242,
|
|
"eval_token_acc": 0.9158176662115324,
|
|
"step": 100
|
|
},
|
|
{
|
|
"epoch": 0.2634054562558796,
|
|
"grad_norm": 0.7926483154296875,
|
|
"learning_rate": 9.810396815472316e-06,
|
|
"loss": 0.23999102115631105,
|
|
"memory(GiB)": 29.52,
|
|
"step": 105,
|
|
"token_acc": 0.9220618814590141,
|
|
"train_speed(iter/s)": 0.127275
|
|
},
|
|
{
|
|
"epoch": 0.2759485732204453,
|
|
"grad_norm": 0.9673748016357422,
|
|
"learning_rate": 9.79203861629078e-06,
|
|
"loss": 0.23904500007629395,
|
|
"memory(GiB)": 29.52,
|
|
"step": 110,
|
|
"token_acc": 0.9187058260355363,
|
|
"train_speed(iter/s)": 0.128262
|
|
},
|
|
{
|
|
"epoch": 0.288491690185011,
|
|
"grad_norm": 0.7872106432914734,
|
|
"learning_rate": 9.772851053174708e-06,
|
|
"loss": 0.26188173294067385,
|
|
"memory(GiB)": 29.52,
|
|
"step": 115,
|
|
"token_acc": 0.9111253401632784,
|
|
"train_speed(iter/s)": 0.129
|
|
},
|
|
{
|
|
"epoch": 0.30103480714957664,
|
|
"grad_norm": 0.7694645524024963,
|
|
"learning_rate": 9.752837446938915e-06,
|
|
"loss": 0.24416761398315429,
|
|
"memory(GiB)": 29.52,
|
|
"step": 120,
|
|
"token_acc": 0.9147327249022165,
|
|
"train_speed(iter/s)": 0.130005
|
|
},
|
|
{
|
|
"epoch": 0.30103480714957664,
|
|
"eval_loss": 0.24855056405067444,
|
|
"eval_runtime": 15.3887,
|
|
"eval_samples_per_second": 16.701,
|
|
"eval_steps_per_second": 4.224,
|
|
"eval_token_acc": 0.9167979553968421,
|
|
"step": 120
|
|
},
|
|
{
|
|
"epoch": 0.31357792411414237,
|
|
"grad_norm": 0.7051243185997009,
|
|
"learning_rate": 9.732001261362503e-06,
|
|
"loss": 0.23072781562805175,
|
|
"memory(GiB)": 29.52,
|
|
"step": 125,
|
|
"token_acc": 0.9187640553279319,
|
|
"train_speed(iter/s)": 0.127297
|
|
},
|
|
{
|
|
"epoch": 0.32612104107870804,
|
|
"grad_norm": 0.803512454032898,
|
|
"learning_rate": 9.710346102589376e-06,
|
|
"loss": 0.25793311595916746,
|
|
"memory(GiB)": 29.52,
|
|
"step": 130,
|
|
"token_acc": 0.9111067822473297,
|
|
"train_speed(iter/s)": 0.12833
|
|
},
|
|
{
|
|
"epoch": 0.33866415804327377,
|
|
"grad_norm": 0.7955958247184753,
|
|
"learning_rate": 9.687875718504126e-06,
|
|
"loss": 0.24592311382293702,
|
|
"memory(GiB)": 29.52,
|
|
"step": 135,
|
|
"token_acc": 0.9190104465618184,
|
|
"train_speed(iter/s)": 0.129138
|
|
},
|
|
{
|
|
"epoch": 0.35120727500783944,
|
|
"grad_norm": 0.678006112575531,
|
|
"learning_rate": 9.664593998083374e-06,
|
|
"loss": 0.22953214645385742,
|
|
"memory(GiB)": 29.52,
|
|
"step": 140,
|
|
"token_acc": 0.9226280527339529,
|
|
"train_speed(iter/s)": 0.129642
|
|
},
|
|
{
|
|
"epoch": 0.35120727500783944,
|
|
"eval_loss": 0.24559736251831055,
|
|
"eval_runtime": 15.3298,
|
|
"eval_samples_per_second": 16.765,
|
|
"eval_steps_per_second": 4.24,
|
|
"eval_token_acc": 0.9174456464657074,
|
|
"step": 140
|
|
},
|
|
{
|
|
"epoch": 0.36375039197240516,
|
|
"grad_norm": 0.7531142830848694,
|
|
"learning_rate": 9.640504970722708e-06,
|
|
"loss": 0.23890395164489747,
|
|
"memory(GiB)": 29.52,
|
|
"step": 145,
|
|
"token_acc": 0.9222668078822143,
|
|
"train_speed(iter/s)": 0.12752
|
|
},
|
|
{
|
|
"epoch": 0.37629350893697083,
|
|
"grad_norm": 0.8114349842071533,
|
|
"learning_rate": 9.615612805539305e-06,
|
|
"loss": 0.23889353275299072,
|
|
"memory(GiB)": 29.52,
|
|
"step": 150,
|
|
"token_acc": 0.9085244337160019,
|
|
"train_speed(iter/s)": 0.128096
|
|
},
|
|
{
|
|
"epoch": 0.38883662590153656,
|
|
"grad_norm": 0.7049622535705566,
|
|
"learning_rate": 9.589921810650379e-06,
|
|
"loss": 0.232946515083313,
|
|
"memory(GiB)": 29.52,
|
|
"step": 155,
|
|
"token_acc": 0.9203438851593387,
|
|
"train_speed(iter/s)": 0.128953
|
|
},
|
|
{
|
|
"epoch": 0.40137974286610223,
|
|
"grad_norm": 0.7752684354782104,
|
|
"learning_rate": 9.563436432427571e-06,
|
|
"loss": 0.23360769748687743,
|
|
"memory(GiB)": 29.52,
|
|
"step": 160,
|
|
"token_acc": 0.9222483562302881,
|
|
"train_speed(iter/s)": 0.129792
|
|
},
|
|
{
|
|
"epoch": 0.40137974286610223,
|
|
"eval_loss": 0.24146369099617004,
|
|
"eval_runtime": 15.3815,
|
|
"eval_samples_per_second": 16.708,
|
|
"eval_steps_per_second": 4.226,
|
|
"eval_token_acc": 0.9184959563071106,
|
|
"step": 160
|
|
},
|
|
{
|
|
"epoch": 0.4139228598306679,
|
|
"grad_norm": 0.7400842308998108,
|
|
"learning_rate": 9.536161254727407e-06,
|
|
"loss": 0.2393019676208496,
|
|
"memory(GiB)": 29.52,
|
|
"step": 165,
|
|
"token_acc": 0.9168263867036645,
|
|
"train_speed(iter/s)": 0.127877
|
|
},
|
|
{
|
|
"epoch": 0.4264659767952336,
|
|
"grad_norm": 0.7236588597297668,
|
|
"learning_rate": 9.508100998097971e-06,
|
|
"loss": 0.2513608455657959,
|
|
"memory(GiB)": 29.52,
|
|
"step": 170,
|
|
"token_acc": 0.9139457376451596,
|
|
"train_speed(iter/s)": 0.128605
|
|
},
|
|
{
|
|
"epoch": 0.4390090937597993,
|
|
"grad_norm": 0.8037694692611694,
|
|
"learning_rate": 9.479260518961904e-06,
|
|
"loss": 0.2478844165802002,
|
|
"memory(GiB)": 29.52,
|
|
"step": 175,
|
|
"token_acc": 0.9115485013051696,
|
|
"train_speed(iter/s)": 0.129344
|
|
},
|
|
{
|
|
"epoch": 0.451552210724365,
|
|
"grad_norm": 0.9048113822937012,
|
|
"learning_rate": 9.449644808775902e-06,
|
|
"loss": 0.23607170581817627,
|
|
"memory(GiB)": 29.52,
|
|
"step": 180,
|
|
"token_acc": 0.9241437498352097,
|
|
"train_speed(iter/s)": 0.130046
|
|
},
|
|
{
|
|
"epoch": 0.451552210724365,
|
|
"eval_loss": 0.2386324554681778,
|
|
"eval_runtime": 15.3252,
|
|
"eval_samples_per_second": 16.77,
|
|
"eval_steps_per_second": 4.241,
|
|
"eval_token_acc": 0.9196863074607009,
|
|
"step": 180
|
|
},
|
|
{
|
|
"epoch": 0.4640953276889307,
|
|
"grad_norm": 0.7141282558441162,
|
|
"learning_rate": 9.419258993166846e-06,
|
|
"loss": 0.20708115100860597,
|
|
"memory(GiB)": 29.52,
|
|
"step": 185,
|
|
"token_acc": 0.9238369894099848,
|
|
"train_speed(iter/s)": 0.128063
|
|
},
|
|
{
|
|
"epoch": 0.4766384446534964,
|
|
"grad_norm": 0.7230116724967957,
|
|
"learning_rate": 9.388108331044687e-06,
|
|
"loss": 0.23321809768676757,
|
|
"memory(GiB)": 29.52,
|
|
"step": 190,
|
|
"token_acc": 0.9096602473774855,
|
|
"train_speed(iter/s)": 0.128687
|
|
},
|
|
{
|
|
"epoch": 0.4891815616180621,
|
|
"grad_norm": 0.7285059094429016,
|
|
"learning_rate": 9.356198213692297e-06,
|
|
"loss": 0.23624110221862793,
|
|
"memory(GiB)": 29.52,
|
|
"step": 195,
|
|
"token_acc": 0.920982395600248,
|
|
"train_speed(iter/s)": 0.129409
|
|
},
|
|
{
|
|
"epoch": 0.5017246785826278,
|
|
"grad_norm": 0.7466290593147278,
|
|
"learning_rate": 9.323534163832387e-06,
|
|
"loss": 0.24186329841613768,
|
|
"memory(GiB)": 29.52,
|
|
"step": 200,
|
|
"token_acc": 0.9228281640452741,
|
|
"train_speed(iter/s)": 0.129868
|
|
},
|
|
{
|
|
"epoch": 0.5017246785826278,
|
|
"eval_loss": 0.23571519553661346,
|
|
"eval_runtime": 15.3374,
|
|
"eval_samples_per_second": 16.756,
|
|
"eval_steps_per_second": 4.238,
|
|
"eval_token_acc": 0.9199576375030634,
|
|
"step": 200
|
|
},
|
|
{
|
|
"epoch": 0.5142677955471935,
|
|
"grad_norm": 0.7634557485580444,
|
|
"learning_rate": 9.290121834671669e-06,
|
|
"loss": 0.21729581356048583,
|
|
"memory(GiB)": 29.52,
|
|
"step": 205,
|
|
"token_acc": 0.9223603414707204,
|
|
"train_speed(iter/s)": 0.128301
|
|
},
|
|
{
|
|
"epoch": 0.5268109125117592,
|
|
"grad_norm": 0.7724491357803345,
|
|
"learning_rate": 9.255967008922475e-06,
|
|
"loss": 0.2301187515258789,
|
|
"memory(GiB)": 29.52,
|
|
"step": 210,
|
|
"token_acc": 0.9205742490820442,
|
|
"train_speed(iter/s)": 0.128765
|
|
},
|
|
{
|
|
"epoch": 0.5393540294763248,
|
|
"grad_norm": 0.7458897233009338,
|
|
"learning_rate": 9.221075597801912e-06,
|
|
"loss": 0.232729172706604,
|
|
"memory(GiB)": 29.52,
|
|
"step": 215,
|
|
"token_acc": 0.9231800040784223,
|
|
"train_speed(iter/s)": 0.129189
|
|
},
|
|
{
|
|
"epoch": 0.5518971464408906,
|
|
"grad_norm": 0.7217942476272583,
|
|
"learning_rate": 9.18545364000882e-06,
|
|
"loss": 0.2349705934524536,
|
|
"memory(GiB)": 29.52,
|
|
"step": 220,
|
|
"token_acc": 0.928037487448399,
|
|
"train_speed(iter/s)": 0.1297
|
|
},
|
|
{
|
|
"epoch": 0.5518971464408906,
|
|
"eval_loss": 0.2342594563961029,
|
|
"eval_runtime": 15.3349,
|
|
"eval_samples_per_second": 16.759,
|
|
"eval_steps_per_second": 4.239,
|
|
"eval_token_acc": 0.9202202149634142,
|
|
"step": 220
|
|
},
|
|
{
|
|
"epoch": 0.5644402634054563,
|
|
"grad_norm": 0.7608616352081299,
|
|
"learning_rate": 9.14910730067863e-06,
|
|
"loss": 0.21356439590454102,
|
|
"memory(GiB)": 29.52,
|
|
"step": 225,
|
|
"token_acc": 0.9212297890244635,
|
|
"train_speed(iter/s)": 0.128148
|
|
},
|
|
{
|
|
"epoch": 0.576983380370022,
|
|
"grad_norm": 0.8077455759048462,
|
|
"learning_rate": 9.112042870316365e-06,
|
|
"loss": 0.2328458309173584,
|
|
"memory(GiB)": 29.52,
|
|
"step": 230,
|
|
"token_acc": 0.9207193449011296,
|
|
"train_speed(iter/s)": 0.128672
|
|
},
|
|
{
|
|
"epoch": 0.5895264973345876,
|
|
"grad_norm": 0.7404952049255371,
|
|
"learning_rate": 9.074266763707937e-06,
|
|
"loss": 0.22884457111358641,
|
|
"memory(GiB)": 29.52,
|
|
"step": 235,
|
|
"token_acc": 0.9248362445414847,
|
|
"train_speed(iter/s)": 0.129176
|
|
},
|
|
{
|
|
"epoch": 0.6020696142991533,
|
|
"grad_norm": 0.7511395215988159,
|
|
"learning_rate": 9.035785518809928e-06,
|
|
"loss": 0.2402876615524292,
|
|
"memory(GiB)": 29.52,
|
|
"step": 240,
|
|
"token_acc": 0.9122142796598197,
|
|
"train_speed(iter/s)": 0.129623
|
|
},
|
|
{
|
|
"epoch": 0.6020696142991533,
|
|
"eval_loss": 0.23062308132648468,
|
|
"eval_runtime": 15.3592,
|
|
"eval_samples_per_second": 16.733,
|
|
"eval_steps_per_second": 4.232,
|
|
"eval_token_acc": 0.9214718341910864,
|
|
"step": 240
|
|
},
|
|
{
|
|
"epoch": 0.6146127312637191,
|
|
"grad_norm": 0.7077146172523499,
|
|
"learning_rate": 8.996605795618054e-06,
|
|
"loss": 0.23445332050323486,
|
|
"memory(GiB)": 29.52,
|
|
"step": 245,
|
|
"token_acc": 0.9197372222813607,
|
|
"train_speed(iter/s)": 0.128267
|
|
},
|
|
{
|
|
"epoch": 0.6271558482282847,
|
|
"grad_norm": 0.7274831533432007,
|
|
"learning_rate": 8.956734375014525e-06,
|
|
"loss": 0.23018431663513184,
|
|
"memory(GiB)": 29.52,
|
|
"step": 250,
|
|
"token_acc": 0.9160428120247982,
|
|
"train_speed(iter/s)": 0.128573
|
|
},
|
|
{
|
|
"epoch": 0.6396989651928504,
|
|
"grad_norm": 0.80959552526474,
|
|
"learning_rate": 8.916178157594453e-06,
|
|
"loss": 0.23876335620880126,
|
|
"memory(GiB)": 29.52,
|
|
"step": 255,
|
|
"token_acc": 0.9136212624584718,
|
|
"train_speed(iter/s)": 0.129029
|
|
},
|
|
{
|
|
"epoch": 0.6522420821574161,
|
|
"grad_norm": 0.712291955947876,
|
|
"learning_rate": 8.87494416247157e-06,
|
|
"loss": 0.22411136627197265,
|
|
"memory(GiB)": 29.52,
|
|
"step": 260,
|
|
"token_acc": 0.9208987563444243,
|
|
"train_speed(iter/s)": 0.129407
|
|
},
|
|
{
|
|
"epoch": 0.6522420821574161,
|
|
"eval_loss": 0.22862213850021362,
|
|
"eval_runtime": 15.3722,
|
|
"eval_samples_per_second": 16.718,
|
|
"eval_steps_per_second": 4.228,
|
|
"eval_token_acc": 0.9216206280852851,
|
|
"step": 260
|
|
},
|
|
{
|
|
"epoch": 0.6647851991219819,
|
|
"grad_norm": 0.7888270616531372,
|
|
"learning_rate": 8.833039526063414e-06,
|
|
"loss": 0.2441627025604248,
|
|
"memory(GiB)": 29.52,
|
|
"step": 265,
|
|
"token_acc": 0.9171242536081855,
|
|
"train_speed(iter/s)": 0.128365
|
|
},
|
|
{
|
|
"epoch": 0.6773283160865475,
|
|
"grad_norm": 0.7412445545196533,
|
|
"learning_rate": 8.790471500856229e-06,
|
|
"loss": 0.22171931266784667,
|
|
"memory(GiB)": 29.52,
|
|
"step": 270,
|
|
"token_acc": 0.9284303020849581,
|
|
"train_speed(iter/s)": 0.128765
|
|
},
|
|
{
|
|
"epoch": 0.6898714330511132,
|
|
"grad_norm": 0.7740799784660339,
|
|
"learning_rate": 8.747247454149754e-06,
|
|
"loss": 0.22348260879516602,
|
|
"memory(GiB)": 29.52,
|
|
"step": 275,
|
|
"token_acc": 0.9197459900366781,
|
|
"train_speed(iter/s)": 0.129119
|
|
},
|
|
{
|
|
"epoch": 0.7024145500156789,
|
|
"grad_norm": 0.7354733943939209,
|
|
"learning_rate": 8.703374866782172e-06,
|
|
"loss": 0.22540512084960937,
|
|
"memory(GiB)": 29.52,
|
|
"step": 280,
|
|
"token_acc": 0.9234182832509192,
|
|
"train_speed(iter/s)": 0.129642
|
|
},
|
|
{
|
|
"epoch": 0.7024145500156789,
|
|
"eval_loss": 0.2274494767189026,
|
|
"eval_runtime": 15.3359,
|
|
"eval_samples_per_second": 16.758,
|
|
"eval_steps_per_second": 4.238,
|
|
"eval_token_acc": 0.9218744529636242,
|
|
"step": 280
|
|
},
|
|
{
|
|
"epoch": 0.7149576669802445,
|
|
"grad_norm": 0.7532041072845459,
|
|
"learning_rate": 8.658861331835384e-06,
|
|
"loss": 0.23445098400115966,
|
|
"memory(GiB)": 29.52,
|
|
"step": 285,
|
|
"token_acc": 0.9171991760513615,
|
|
"train_speed(iter/s)": 0.128533
|
|
},
|
|
{
|
|
"epoch": 0.7275007839448103,
|
|
"grad_norm": 0.7499911189079285,
|
|
"learning_rate": 8.613714553320863e-06,
|
|
"loss": 0.2278836727142334,
|
|
"memory(GiB)": 29.52,
|
|
"step": 290,
|
|
"token_acc": 0.9228026662532941,
|
|
"train_speed(iter/s)": 0.128913
|
|
},
|
|
{
|
|
"epoch": 0.740043900909376,
|
|
"grad_norm": 0.6617085337638855,
|
|
"learning_rate": 8.567942344846311e-06,
|
|
"loss": 0.2379608631134033,
|
|
"memory(GiB)": 31.81,
|
|
"step": 295,
|
|
"token_acc": 0.927406815051757,
|
|
"train_speed(iter/s)": 0.129437
|
|
},
|
|
{
|
|
"epoch": 0.7525870178739417,
|
|
"grad_norm": 0.7833521366119385,
|
|
"learning_rate": 8.521552628263362e-06,
|
|
"loss": 0.22896957397460938,
|
|
"memory(GiB)": 31.81,
|
|
"step": 300,
|
|
"token_acc": 0.9195584489102746,
|
|
"train_speed(iter/s)": 0.129723
|
|
},
|
|
{
|
|
"epoch": 0.7525870178739417,
|
|
"eval_loss": 0.22518841922283173,
|
|
"eval_runtime": 15.3817,
|
|
"eval_samples_per_second": 16.708,
|
|
"eval_steps_per_second": 4.226,
|
|
"eval_token_acc": 0.9226796905087,
|
|
"step": 300
|
|
},
|
|
{
|
|
"epoch": 0.7651301348385073,
|
|
"grad_norm": 0.6266347169876099,
|
|
"learning_rate": 8.474553432296517e-06,
|
|
"loss": 0.2120736598968506,
|
|
"memory(GiB)": 31.81,
|
|
"step": 305,
|
|
"token_acc": 0.919751809720786,
|
|
"train_speed(iter/s)": 0.12866
|
|
},
|
|
{
|
|
"epoch": 0.7776732518030731,
|
|
"grad_norm": 0.7510045170783997,
|
|
"learning_rate": 8.426952891153617e-06,
|
|
"loss": 0.22617723941802978,
|
|
"memory(GiB)": 31.81,
|
|
"step": 310,
|
|
"token_acc": 0.9176977822402032,
|
|
"train_speed(iter/s)": 0.12898
|
|
},
|
|
{
|
|
"epoch": 0.7902163687676388,
|
|
"grad_norm": 0.7557322978973389,
|
|
"learning_rate": 8.378759243118044e-06,
|
|
"loss": 0.2307964563369751,
|
|
"memory(GiB)": 31.81,
|
|
"step": 315,
|
|
"token_acc": 0.9214413607878246,
|
|
"train_speed(iter/s)": 0.129388
|
|
},
|
|
{
|
|
"epoch": 0.8027594857322045,
|
|
"grad_norm": 0.802083432674408,
|
|
"learning_rate": 8.329980829122907e-06,
|
|
"loss": 0.23063960075378417,
|
|
"memory(GiB)": 31.81,
|
|
"step": 320,
|
|
"token_acc": 0.9320303956481507,
|
|
"train_speed(iter/s)": 0.129686
|
|
},
|
|
{
|
|
"epoch": 0.8027594857322045,
|
|
"eval_loss": 0.22348652780056,
|
|
"eval_runtime": 15.4058,
|
|
"eval_samples_per_second": 16.682,
|
|
"eval_steps_per_second": 4.219,
|
|
"eval_token_acc": 0.9227497111647937,
|
|
"step": 320
|
|
},
|
|
{
|
|
"epoch": 0.8153026026967701,
|
|
"grad_norm": 0.7171165943145752,
|
|
"learning_rate": 8.280626091307466e-06,
|
|
"loss": 0.22461018562316895,
|
|
"memory(GiB)": 31.81,
|
|
"step": 325,
|
|
"token_acc": 0.9275779995411791,
|
|
"train_speed(iter/s)": 0.128615
|
|
},
|
|
{
|
|
"epoch": 0.8278457196613358,
|
|
"grad_norm": 0.68876051902771,
|
|
"learning_rate": 8.23070357155605e-06,
|
|
"loss": 0.2177454948425293,
|
|
"memory(GiB)": 31.81,
|
|
"step": 330,
|
|
"token_acc": 0.9271033235989431,
|
|
"train_speed(iter/s)": 0.128983
|
|
},
|
|
{
|
|
"epoch": 0.8403888366259016,
|
|
"grad_norm": 0.6879884600639343,
|
|
"learning_rate": 8.18022191001969e-06,
|
|
"loss": 0.22483336925506592,
|
|
"memory(GiB)": 31.81,
|
|
"step": 335,
|
|
"token_acc": 0.9234863606121091,
|
|
"train_speed(iter/s)": 0.129291
|
|
},
|
|
{
|
|
"epoch": 0.8529319535904673,
|
|
"grad_norm": 0.7674379348754883,
|
|
"learning_rate": 8.129189843620766e-06,
|
|
"loss": 0.23122897148132324,
|
|
"memory(GiB)": 31.81,
|
|
"step": 340,
|
|
"token_acc": 0.920080478399374,
|
|
"train_speed(iter/s)": 0.129653
|
|
},
|
|
{
|
|
"epoch": 0.8529319535904673,
|
|
"eval_loss": 0.2233850359916687,
|
|
"eval_runtime": 15.3643,
|
|
"eval_samples_per_second": 16.727,
|
|
"eval_steps_per_second": 4.231,
|
|
"eval_token_acc": 0.9229860308791094,
|
|
"step": 340
|
|
},
|
|
{
|
|
"epoch": 0.8654750705550329,
|
|
"grad_norm": 0.7207924723625183,
|
|
"learning_rate": 8.077616204540897e-06,
|
|
"loss": 0.21113083362579346,
|
|
"memory(GiB)": 31.81,
|
|
"step": 345,
|
|
"token_acc": 0.9231676937196801,
|
|
"train_speed(iter/s)": 0.128783
|
|
},
|
|
{
|
|
"epoch": 0.8780181875195986,
|
|
"grad_norm": 0.720832109451294,
|
|
"learning_rate": 8.02550991869234e-06,
|
|
"loss": 0.22612943649291992,
|
|
"memory(GiB)": 31.81,
|
|
"step": 350,
|
|
"token_acc": 0.9200727685110807,
|
|
"train_speed(iter/s)": 0.129034
|
|
},
|
|
{
|
|
"epoch": 0.8905613044841643,
|
|
"grad_norm": 0.70830237865448,
|
|
"learning_rate": 7.972880004173175e-06,
|
|
"loss": 0.2191091537475586,
|
|
"memory(GiB)": 31.81,
|
|
"step": 355,
|
|
"token_acc": 0.92017787659811,
|
|
"train_speed(iter/s)": 0.129291
|
|
},
|
|
{
|
|
"epoch": 0.90310442144873,
|
|
"grad_norm": 0.7826217412948608,
|
|
"learning_rate": 7.919735569706533e-06,
|
|
"loss": 0.23212652206420897,
|
|
"memory(GiB)": 31.81,
|
|
"step": 360,
|
|
"token_acc": 0.9170923379174852,
|
|
"train_speed(iter/s)": 0.129652
|
|
},
|
|
{
|
|
"epoch": 0.90310442144873,
|
|
"eval_loss": 0.22133058309555054,
|
|
"eval_runtime": 15.4085,
|
|
"eval_samples_per_second": 16.679,
|
|
"eval_steps_per_second": 4.218,
|
|
"eval_token_acc": 0.9237912684241851,
|
|
"step": 360
|
|
},
|
|
{
|
|
"epoch": 0.9156475384132957,
|
|
"grad_norm": 0.7471039295196533,
|
|
"learning_rate": 7.86608581306413e-06,
|
|
"loss": 0.22391505241394044,
|
|
"memory(GiB)": 31.81,
|
|
"step": 365,
|
|
"token_acc": 0.9232560554146457,
|
|
"train_speed(iter/s)": 0.128776
|
|
},
|
|
{
|
|
"epoch": 0.9281906553778614,
|
|
"grad_norm": 0.7498065233230591,
|
|
"learning_rate": 7.811940019474414e-06,
|
|
"loss": 0.21148476600646973,
|
|
"memory(GiB)": 31.81,
|
|
"step": 370,
|
|
"token_acc": 0.9247934832491969,
|
|
"train_speed(iter/s)": 0.129029
|
|
},
|
|
{
|
|
"epoch": 0.940733772342427,
|
|
"grad_norm": 0.7913779616355896,
|
|
"learning_rate": 7.757307560015539e-06,
|
|
"loss": 0.2337519645690918,
|
|
"memory(GiB)": 31.81,
|
|
"step": 375,
|
|
"token_acc": 0.9195318016403237,
|
|
"train_speed(iter/s)": 0.129291
|
|
},
|
|
{
|
|
"epoch": 0.9532768893069928,
|
|
"grad_norm": 0.7540809512138367,
|
|
"learning_rate": 7.702197889993515e-06,
|
|
"loss": 0.22583358287811278,
|
|
"memory(GiB)": 31.81,
|
|
"step": 380,
|
|
"token_acc": 0.912510441085334,
|
|
"train_speed(iter/s)": 0.129502
|
|
},
|
|
{
|
|
"epoch": 0.9532768893069928,
|
|
"eval_loss": 0.22044962644577026,
|
|
"eval_runtime": 15.3936,
|
|
"eval_samples_per_second": 16.695,
|
|
"eval_steps_per_second": 4.223,
|
|
"eval_token_acc": 0.9241851346147113,
|
|
"step": 380
|
|
},
|
|
{
|
|
"epoch": 0.9658200062715585,
|
|
"grad_norm": 0.6508920192718506,
|
|
"learning_rate": 7.646620547305765e-06,
|
|
"loss": 0.21882102489471436,
|
|
"memory(GiB)": 31.81,
|
|
"step": 385,
|
|
"token_acc": 0.929311731244602,
|
|
"train_speed(iter/s)": 0.128683
|
|
},
|
|
{
|
|
"epoch": 0.9783631232361242,
|
|
"grad_norm": 0.724659264087677,
|
|
"learning_rate": 7.590585150790388e-06,
|
|
"loss": 0.22737913131713866,
|
|
"memory(GiB)": 31.81,
|
|
"step": 390,
|
|
"token_acc": 0.9233074204946996,
|
|
"train_speed(iter/s)": 0.128946
|
|
},
|
|
{
|
|
"epoch": 0.9909062402006898,
|
|
"grad_norm": 0.7416620254516602,
|
|
"learning_rate": 7.5341013985614064e-06,
|
|
"loss": 0.21617236137390136,
|
|
"memory(GiB)": 31.81,
|
|
"step": 395,
|
|
"token_acc": 0.9227556855964889,
|
|
"train_speed(iter/s)": 0.129211
|
|
},
|
|
{
|
|
"epoch": 1.0050172467858263,
|
|
"grad_norm": 0.7598711252212524,
|
|
"learning_rate": 7.47717906633032e-06,
|
|
"loss": 0.24872393608093263,
|
|
"memory(GiB)": 31.81,
|
|
"step": 400,
|
|
"token_acc": 0.9263680772819584,
|
|
"train_speed(iter/s)": 0.129375
|
|
},
|
|
{
|
|
"epoch": 1.0050172467858263,
|
|
"eval_loss": 0.21866728365421295,
|
|
"eval_runtime": 15.3428,
|
|
"eval_samples_per_second": 16.75,
|
|
"eval_steps_per_second": 4.237,
|
|
"eval_token_acc": 0.9249028463396702,
|
|
"step": 400
|
|
},
|
|
{
|
|
"epoch": 1.017560363750392,
|
|
"grad_norm": 0.7288981676101685,
|
|
"learning_rate": 7.419828005714195e-06,
|
|
"loss": 0.15233672857284547,
|
|
"memory(GiB)": 31.81,
|
|
"step": 405,
|
|
"token_acc": 0.9344547117883116,
|
|
"train_speed(iter/s)": 0.128614
|
|
},
|
|
{
|
|
"epoch": 1.0301034807149576,
|
|
"grad_norm": 0.7562277317047119,
|
|
"learning_rate": 7.362058142530639e-06,
|
|
"loss": 0.15367655754089354,
|
|
"memory(GiB)": 31.81,
|
|
"step": 410,
|
|
"token_acc": 0.9494212236984662,
|
|
"train_speed(iter/s)": 0.128849
|
|
},
|
|
{
|
|
"epoch": 1.0426465976795234,
|
|
"grad_norm": 0.6314442753791809,
|
|
"learning_rate": 7.303879475079931e-06,
|
|
"loss": 0.16216965913772582,
|
|
"memory(GiB)": 31.81,
|
|
"step": 415,
|
|
"token_acc": 0.9469148079746176,
|
|
"train_speed(iter/s)": 0.129162
|
|
},
|
|
{
|
|
"epoch": 1.055189714644089,
|
|
"grad_norm": 0.78495854139328,
|
|
"learning_rate": 7.245302072414602e-06,
|
|
"loss": 0.1717313528060913,
|
|
"memory(GiB)": 31.81,
|
|
"step": 420,
|
|
"token_acc": 0.9351895455615729,
|
|
"train_speed(iter/s)": 0.129404
|
|
},
|
|
{
|
|
"epoch": 1.055189714644089,
|
|
"eval_loss": 0.22395090758800507,
|
|
"eval_runtime": 15.3916,
|
|
"eval_samples_per_second": 16.697,
|
|
"eval_steps_per_second": 4.223,
|
|
"eval_token_acc": 0.9238000210061968,
|
|
"step": 420
|
|
},
|
|
{
|
|
"epoch": 1.0677328316086547,
|
|
"grad_norm": 0.6953550577163696,
|
|
"learning_rate": 7.1863360725967615e-06,
|
|
"loss": 0.1437358021736145,
|
|
"memory(GiB)": 31.81,
|
|
"step": 425,
|
|
"token_acc": 0.9337246309594255,
|
|
"train_speed(iter/s)": 0.128699
|
|
},
|
|
{
|
|
"epoch": 1.0802759485732205,
|
|
"grad_norm": 0.6609600186347961,
|
|
"learning_rate": 7.126991680943508e-06,
|
|
"loss": 0.15338196754455566,
|
|
"memory(GiB)": 31.81,
|
|
"step": 430,
|
|
"token_acc": 0.945504234651081,
|
|
"train_speed(iter/s)": 0.12898
|
|
},
|
|
{
|
|
"epoch": 1.092819065537786,
|
|
"grad_norm": 0.7515889406204224,
|
|
"learning_rate": 7.067279168260671e-06,
|
|
"loss": 0.1485868811607361,
|
|
"memory(GiB)": 31.81,
|
|
"step": 435,
|
|
"token_acc": 0.949219850166169,
|
|
"train_speed(iter/s)": 0.129246
|
|
},
|
|
{
|
|
"epoch": 1.1053621825023519,
|
|
"grad_norm": 0.6615680456161499,
|
|
"learning_rate": 7.007208869065232e-06,
|
|
"loss": 0.15130412578582764,
|
|
"memory(GiB)": 31.81,
|
|
"step": 440,
|
|
"token_acc": 0.9493087557603687,
|
|
"train_speed(iter/s)": 0.129455
|
|
},
|
|
{
|
|
"epoch": 1.1053621825023519,
|
|
"eval_loss": 0.2233077436685562,
|
|
"eval_runtime": 15.3696,
|
|
"eval_samples_per_second": 16.721,
|
|
"eval_steps_per_second": 4.229,
|
|
"eval_token_acc": 0.9245002275671323,
|
|
"step": 440
|
|
},
|
|
{
|
|
"epoch": 1.1179052994669174,
|
|
"grad_norm": 0.7569933533668518,
|
|
"learning_rate": 6.946791179796718e-06,
|
|
"loss": 0.15562827587127687,
|
|
"memory(GiB)": 31.81,
|
|
"step": 445,
|
|
"token_acc": 0.9341226472374013,
|
|
"train_speed(iter/s)": 0.12878
|
|
},
|
|
{
|
|
"epoch": 1.1304484164314832,
|
|
"grad_norm": 0.6801967024803162,
|
|
"learning_rate": 6.886036557017881e-06,
|
|
"loss": 0.15977808237075805,
|
|
"memory(GiB)": 31.81,
|
|
"step": 450,
|
|
"token_acc": 0.9431299171995168,
|
|
"train_speed(iter/s)": 0.129107
|
|
},
|
|
{
|
|
"epoch": 1.142991533396049,
|
|
"grad_norm": 0.7558472752571106,
|
|
"learning_rate": 6.824955515604957e-06,
|
|
"loss": 0.16626831293106079,
|
|
"memory(GiB)": 31.81,
|
|
"step": 455,
|
|
"token_acc": 0.9411939411939412,
|
|
"train_speed(iter/s)": 0.129394
|
|
},
|
|
{
|
|
"epoch": 1.1555346503606145,
|
|
"grad_norm": 0.7011389136314392,
|
|
"learning_rate": 6.76355862692786e-06,
|
|
"loss": 0.16757216453552246,
|
|
"memory(GiB)": 31.81,
|
|
"step": 460,
|
|
"token_acc": 0.9417196619914626,
|
|
"train_speed(iter/s)": 0.129606
|
|
},
|
|
{
|
|
"epoch": 1.1555346503606145,
|
|
"eval_loss": 0.22205203771591187,
|
|
"eval_runtime": 15.3552,
|
|
"eval_samples_per_second": 16.737,
|
|
"eval_steps_per_second": 4.233,
|
|
"eval_token_acc": 0.9254892693344536,
|
|
"step": 460
|
|
},
|
|
{
|
|
"epoch": 1.1680777673251803,
|
|
"grad_norm": 0.8131189942359924,
|
|
"learning_rate": 6.701856517020565e-06,
|
|
"loss": 0.1730912446975708,
|
|
"memory(GiB)": 31.81,
|
|
"step": 465,
|
|
"token_acc": 0.9293166877751643,
|
|
"train_speed(iter/s)": 0.128975
|
|
},
|
|
{
|
|
"epoch": 1.180620884289746,
|
|
"grad_norm": 0.6982389092445374,
|
|
"learning_rate": 6.639859864742058e-06,
|
|
"loss": 0.16429152488708496,
|
|
"memory(GiB)": 31.81,
|
|
"step": 470,
|
|
"token_acc": 0.9323867882229862,
|
|
"train_speed(iter/s)": 0.129168
|
|
},
|
|
{
|
|
"epoch": 1.1931640012543117,
|
|
"grad_norm": 0.7796806693077087,
|
|
"learning_rate": 6.5775793999281345e-06,
|
|
"loss": 0.16015057563781737,
|
|
"memory(GiB)": 31.81,
|
|
"step": 475,
|
|
"token_acc": 0.9489819908778859,
|
|
"train_speed(iter/s)": 0.129368
|
|
},
|
|
{
|
|
"epoch": 1.2057071182188774,
|
|
"grad_norm": 0.7008464336395264,
|
|
"learning_rate": 6.515025901534364e-06,
|
|
"loss": 0.15645363330841064,
|
|
"memory(GiB)": 31.81,
|
|
"step": 480,
|
|
"token_acc": 0.9448942141623489,
|
|
"train_speed(iter/s)": 0.129561
|
|
},
|
|
{
|
|
"epoch": 1.2057071182188774,
|
|
"eval_loss": 0.2242305725812912,
|
|
"eval_runtime": 15.3471,
|
|
"eval_samples_per_second": 16.746,
|
|
"eval_steps_per_second": 4.235,
|
|
"eval_token_acc": 0.9244127017470154,
|
|
"step": 480
|
|
},
|
|
{
|
|
"epoch": 1.218250235183443,
|
|
"grad_norm": 0.7552674412727356,
|
|
"learning_rate": 6.452210195770571e-06,
|
|
"loss": 0.1517507791519165,
|
|
"memory(GiB)": 31.81,
|
|
"step": 485,
|
|
"token_acc": 0.9361768149057109,
|
|
"train_speed(iter/s)": 0.128932
|
|
},
|
|
{
|
|
"epoch": 1.2307933521480088,
|
|
"grad_norm": 0.7274335622787476,
|
|
"learning_rate": 6.389143154227128e-06,
|
|
"loss": 0.16204409599304198,
|
|
"memory(GiB)": 31.81,
|
|
"step": 490,
|
|
"token_acc": 0.9486543909348442,
|
|
"train_speed(iter/s)": 0.129125
|
|
},
|
|
{
|
|
"epoch": 1.2433364691125746,
|
|
"grad_norm": 0.748831570148468,
|
|
"learning_rate": 6.325835691993394e-06,
|
|
"loss": 0.15379858016967773,
|
|
"memory(GiB)": 31.81,
|
|
"step": 495,
|
|
"token_acc": 0.9465945037564255,
|
|
"train_speed(iter/s)": 0.129385
|
|
},
|
|
{
|
|
"epoch": 1.2558795860771401,
|
|
"grad_norm": 0.893355667591095,
|
|
"learning_rate": 6.2622987657686305e-06,
|
|
"loss": 0.1658052921295166,
|
|
"memory(GiB)": 31.81,
|
|
"step": 500,
|
|
"token_acc": 0.947743023038022,
|
|
"train_speed(iter/s)": 0.129623
|
|
},
|
|
{
|
|
"epoch": 1.2558795860771401,
|
|
"eval_loss": 0.22251112759113312,
|
|
"eval_runtime": 15.3679,
|
|
"eval_samples_per_second": 16.723,
|
|
"eval_steps_per_second": 4.23,
|
|
"eval_token_acc": 0.9248678360116235,
|
|
"step": 500
|
|
},
|
|
{
|
|
"epoch": 1.268422703041706,
|
|
"grad_norm": 0.7303951978683472,
|
|
"learning_rate": 6.198543371965711e-06,
|
|
"loss": 0.16348928213119507,
|
|
"memory(GiB)": 31.81,
|
|
"step": 505,
|
|
"token_acc": 0.9349806335063304,
|
|
"train_speed(iter/s)": 0.129005
|
|
},
|
|
{
|
|
"epoch": 1.2809658200062715,
|
|
"grad_norm": 0.8302243947982788,
|
|
"learning_rate": 6.134580544807951e-06,
|
|
"loss": 0.1597007393836975,
|
|
"memory(GiB)": 31.81,
|
|
"step": 510,
|
|
"token_acc": 0.9454098648411444,
|
|
"train_speed(iter/s)": 0.129135
|
|
},
|
|
{
|
|
"epoch": 1.2935089369708372,
|
|
"grad_norm": 0.7296594381332397,
|
|
"learning_rate": 6.070421354419418e-06,
|
|
"loss": 0.16336345672607422,
|
|
"memory(GiB)": 31.81,
|
|
"step": 515,
|
|
"token_acc": 0.9398956481184598,
|
|
"train_speed(iter/s)": 0.129324
|
|
},
|
|
{
|
|
"epoch": 1.306052053935403,
|
|
"grad_norm": 0.7305130958557129,
|
|
"learning_rate": 6.006076904908996e-06,
|
|
"loss": 0.15892908573150635,
|
|
"memory(GiB)": 31.81,
|
|
"step": 520,
|
|
"token_acc": 0.9507138423339541,
|
|
"train_speed(iter/s)": 0.129551
|
|
},
|
|
{
|
|
"epoch": 1.306052053935403,
|
|
"eval_loss": 0.22138828039169312,
|
|
"eval_runtime": 15.3657,
|
|
"eval_samples_per_second": 16.726,
|
|
"eval_steps_per_second": 4.23,
|
|
"eval_token_acc": 0.9247190421174246,
|
|
"step": 520
|
|
},
|
|
{
|
|
"epoch": 1.3185951708999686,
|
|
"grad_norm": 0.7403632998466492,
|
|
"learning_rate": 5.9415583324485895e-06,
|
|
"loss": 0.16314858198165894,
|
|
"memory(GiB)": 31.81,
|
|
"step": 525,
|
|
"token_acc": 0.931472803221991,
|
|
"train_speed(iter/s)": 0.129018
|
|
},
|
|
{
|
|
"epoch": 1.3311382878645344,
|
|
"grad_norm": 0.7020546793937683,
|
|
"learning_rate": 5.876876803345777e-06,
|
|
"loss": 0.15857114791870117,
|
|
"memory(GiB)": 31.81,
|
|
"step": 530,
|
|
"token_acc": 0.9462052151791392,
|
|
"train_speed(iter/s)": 0.129237
|
|
},
|
|
{
|
|
"epoch": 1.3436814048291001,
|
|
"grad_norm": 0.6946777701377869,
|
|
"learning_rate": 5.812043512111237e-06,
|
|
"loss": 0.16228172779083253,
|
|
"memory(GiB)": 31.81,
|
|
"step": 535,
|
|
"token_acc": 0.9411285875587533,
|
|
"train_speed(iter/s)": 0.129436
|
|
},
|
|
{
|
|
"epoch": 1.3562245217936657,
|
|
"grad_norm": 0.711567223072052,
|
|
"learning_rate": 5.747069679521306e-06,
|
|
"loss": 0.16026302576065063,
|
|
"memory(GiB)": 31.81,
|
|
"step": 540,
|
|
"token_acc": 0.9492771873268524,
|
|
"train_speed(iter/s)": 0.129674
|
|
},
|
|
{
|
|
"epoch": 1.3562245217936657,
|
|
"eval_loss": 0.2199857234954834,
|
|
"eval_runtime": 15.3525,
|
|
"eval_samples_per_second": 16.74,
|
|
"eval_steps_per_second": 4.234,
|
|
"eval_token_acc": 0.9259444035990617,
|
|
"step": 540
|
|
},
|
|
{
|
|
"epoch": 1.3687676387582315,
|
|
"grad_norm": 0.7763009071350098,
|
|
"learning_rate": 5.681966550675981e-06,
|
|
"loss": 0.15383946895599365,
|
|
"memory(GiB)": 31.81,
|
|
"step": 545,
|
|
"token_acc": 0.9333074612277752,
|
|
"train_speed(iter/s)": 0.129103
|
|
},
|
|
{
|
|
"epoch": 1.381310755722797,
|
|
"grad_norm": 0.754088282585144,
|
|
"learning_rate": 5.616745393052725e-06,
|
|
"loss": 0.15939451456069947,
|
|
"memory(GiB)": 31.81,
|
|
"step": 550,
|
|
"token_acc": 0.9464760826493065,
|
|
"train_speed(iter/s)": 0.129287
|
|
},
|
|
{
|
|
"epoch": 1.3938538726873628,
|
|
"grad_norm": 0.7275711894035339,
|
|
"learning_rate": 5.551417494556376e-06,
|
|
"loss": 0.15393273830413817,
|
|
"memory(GiB)": 31.81,
|
|
"step": 555,
|
|
"token_acc": 0.9460861238928638,
|
|
"train_speed(iter/s)": 0.129442
|
|
},
|
|
{
|
|
"epoch": 1.4063969896519284,
|
|
"grad_norm": 0.6778993010520935,
|
|
"learning_rate": 5.4859941615655495e-06,
|
|
"loss": 0.16530011892318724,
|
|
"memory(GiB)": 31.81,
|
|
"step": 560,
|
|
"token_acc": 0.9377745897964673,
|
|
"train_speed(iter/s)": 0.129634
|
|
},
|
|
{
|
|
"epoch": 1.4063969896519284,
|
|
"eval_loss": 0.21840627491474152,
|
|
"eval_runtime": 15.3572,
|
|
"eval_samples_per_second": 16.735,
|
|
"eval_steps_per_second": 4.233,
|
|
"eval_token_acc": 0.925795609704863,
|
|
"step": 560
|
|
},
|
|
{
|
|
"epoch": 1.4189401066164942,
|
|
"grad_norm": 0.7403908371925354,
|
|
"learning_rate": 5.4204867169758265e-06,
|
|
"loss": 0.14913086891174315,
|
|
"memory(GiB)": 31.81,
|
|
"step": 565,
|
|
"token_acc": 0.9394371658864914,
|
|
"train_speed(iter/s)": 0.129028
|
|
},
|
|
{
|
|
"epoch": 1.43148322358106,
|
|
"grad_norm": 0.7867358922958374,
|
|
"learning_rate": 5.35490649824008e-06,
|
|
"loss": 0.17901339530944824,
|
|
"memory(GiB)": 31.81,
|
|
"step": 570,
|
|
"token_acc": 0.9368613331921427,
|
|
"train_speed(iter/s)": 0.129242
|
|
},
|
|
{
|
|
"epoch": 1.4440263405456255,
|
|
"grad_norm": 0.7289626002311707,
|
|
"learning_rate": 5.289264855406295e-06,
|
|
"loss": 0.1573652982711792,
|
|
"memory(GiB)": 31.81,
|
|
"step": 575,
|
|
"token_acc": 0.9441503874276983,
|
|
"train_speed(iter/s)": 0.129439
|
|
},
|
|
{
|
|
"epoch": 1.4565694575101913,
|
|
"grad_norm": 0.723175585269928,
|
|
"learning_rate": 5.223573149153197e-06,
|
|
"loss": 0.1556238889694214,
|
|
"memory(GiB)": 31.81,
|
|
"step": 580,
|
|
"token_acc": 0.9394716940363008,
|
|
"train_speed(iter/s)": 0.129619
|
|
},
|
|
{
|
|
"epoch": 1.4565694575101913,
|
|
"eval_loss": 0.21749961376190186,
|
|
"eval_runtime": 15.3632,
|
|
"eval_samples_per_second": 16.728,
|
|
"eval_steps_per_second": 4.231,
|
|
"eval_token_acc": 0.9257430942127928,
|
|
"step": 580
|
|
},
|
|
{
|
|
"epoch": 1.469112574474757,
|
|
"grad_norm": 0.7443521022796631,
|
|
"learning_rate": 5.157842748824053e-06,
|
|
"loss": 0.15476609468460084,
|
|
"memory(GiB)": 31.81,
|
|
"step": 585,
|
|
"token_acc": 0.9340939774111758,
|
|
"train_speed(iter/s)": 0.129067
|
|
},
|
|
{
|
|
"epoch": 1.4816556914393226,
|
|
"grad_norm": 0.8059399127960205,
|
|
"learning_rate": 5.092085030458957e-06,
|
|
"loss": 0.15709525346755981,
|
|
"memory(GiB)": 31.81,
|
|
"step": 590,
|
|
"token_acc": 0.9359229370311435,
|
|
"train_speed(iter/s)": 0.129147
|
|
},
|
|
{
|
|
"epoch": 1.4941988084038884,
|
|
"grad_norm": 0.7224918007850647,
|
|
"learning_rate": 5.026311374825969e-06,
|
|
"loss": 0.14287755489349366,
|
|
"memory(GiB)": 31.81,
|
|
"step": 595,
|
|
"token_acc": 0.9447071216835298,
|
|
"train_speed(iter/s)": 0.12923
|
|
},
|
|
{
|
|
"epoch": 1.5067419253684542,
|
|
"grad_norm": 0.7575579881668091,
|
|
"learning_rate": 4.960533165451435e-06,
|
|
"loss": 0.16114065647125245,
|
|
"memory(GiB)": 31.81,
|
|
"step": 600,
|
|
"token_acc": 0.9444704368676531,
|
|
"train_speed(iter/s)": 0.129449
|
|
},
|
|
{
|
|
"epoch": 1.5067419253684542,
|
|
"eval_loss": 0.2169800102710724,
|
|
"eval_runtime": 15.3901,
|
|
"eval_samples_per_second": 16.699,
|
|
"eval_steps_per_second": 4.223,
|
|
"eval_token_acc": 0.9261544655673424,
|
|
"step": 600
|
|
},
|
|
{
|
|
"epoch": 1.5192850423330198,
|
|
"grad_norm": 0.6867368817329407,
|
|
"learning_rate": 4.894761786649815e-06,
|
|
"loss": 0.1530630111694336,
|
|
"memory(GiB)": 31.81,
|
|
"step": 605,
|
|
"token_acc": 0.9384248996465161,
|
|
"train_speed(iter/s)": 0.128875
|
|
},
|
|
{
|
|
"epoch": 1.5318281592975853,
|
|
"grad_norm": 0.7576408386230469,
|
|
"learning_rate": 4.829008621553401e-06,
|
|
"loss": 0.15166678428649902,
|
|
"memory(GiB)": 31.81,
|
|
"step": 610,
|
|
"token_acc": 0.9431903961818492,
|
|
"train_speed(iter/s)": 0.129109
|
|
},
|
|
{
|
|
"epoch": 1.544371276262151,
|
|
"grad_norm": 0.7608903050422668,
|
|
"learning_rate": 4.763285050142211e-06,
|
|
"loss": 0.17192583084106444,
|
|
"memory(GiB)": 31.81,
|
|
"step": 615,
|
|
"token_acc": 0.93989472085843,
|
|
"train_speed(iter/s)": 0.129365
|
|
},
|
|
{
|
|
"epoch": 1.5569143932267169,
|
|
"grad_norm": 0.7976657152175903,
|
|
"learning_rate": 4.697602447274454e-06,
|
|
"loss": 0.16986348628997802,
|
|
"memory(GiB)": 31.81,
|
|
"step": 620,
|
|
"token_acc": 0.9434366754617414,
|
|
"train_speed(iter/s)": 0.129534
|
|
},
|
|
{
|
|
"epoch": 1.5569143932267169,
|
|
"eval_loss": 0.21612223982810974,
|
|
"eval_runtime": 15.3679,
|
|
"eval_samples_per_second": 16.723,
|
|
"eval_steps_per_second": 4.23,
|
|
"eval_token_acc": 0.9266708679060323,
|
|
"step": 620
|
|
},
|
|
{
|
|
"epoch": 1.5694575101912824,
|
|
"grad_norm": 0.6765289306640625,
|
|
"learning_rate": 4.631972180717859e-06,
|
|
"loss": 0.14983587265014647,
|
|
"memory(GiB)": 31.81,
|
|
"step": 625,
|
|
"token_acc": 0.931841074426413,
|
|
"train_speed(iter/s)": 0.12904
|
|
},
|
|
{
|
|
"epoch": 1.5820006271558482,
|
|
"grad_norm": 0.726507306098938,
|
|
"learning_rate": 4.566405609182247e-06,
|
|
"loss": 0.16202863454818725,
|
|
"memory(GiB)": 31.81,
|
|
"step": 630,
|
|
"token_acc": 0.9474066189278111,
|
|
"train_speed(iter/s)": 0.129215
|
|
},
|
|
{
|
|
"epoch": 1.594543744120414,
|
|
"grad_norm": 0.7189328670501709,
|
|
"learning_rate": 4.500914080353666e-06,
|
|
"loss": 0.1547753095626831,
|
|
"memory(GiB)": 31.81,
|
|
"step": 635,
|
|
"token_acc": 0.9415881650524082,
|
|
"train_speed(iter/s)": 0.129409
|
|
},
|
|
{
|
|
"epoch": 1.6070868610849796,
|
|
"grad_norm": 0.6717737317085266,
|
|
"learning_rate": 4.435508928930431e-06,
|
|
"loss": 0.1501192569732666,
|
|
"memory(GiB)": 31.81,
|
|
"step": 640,
|
|
"token_acc": 0.9476487510324988,
|
|
"train_speed(iter/s)": 0.129518
|
|
},
|
|
{
|
|
"epoch": 1.6070868610849796,
|
|
"eval_loss": 0.21533308923244476,
|
|
"eval_runtime": 15.3725,
|
|
"eval_samples_per_second": 16.718,
|
|
"eval_steps_per_second": 4.228,
|
|
"eval_token_acc": 0.9266883730700557,
|
|
"step": 640
|
|
},
|
|
{
|
|
"epoch": 1.6196299780495453,
|
|
"grad_norm": 0.7199254035949707,
|
|
"learning_rate": 4.3702014746614135e-06,
|
|
"loss": 0.1601256847381592,
|
|
"memory(GiB)": 31.81,
|
|
"step": 645,
|
|
"token_acc": 0.9370883453415381,
|
|
"train_speed(iter/s)": 0.128942
|
|
},
|
|
{
|
|
"epoch": 1.6321730950141111,
|
|
"grad_norm": 0.7428786754608154,
|
|
"learning_rate": 4.305003020386922e-06,
|
|
"loss": 0.16339280605316162,
|
|
"memory(GiB)": 31.81,
|
|
"step": 650,
|
|
"token_acc": 0.9402134435938985,
|
|
"train_speed(iter/s)": 0.129165
|
|
},
|
|
{
|
|
"epoch": 1.6447162119786767,
|
|
"grad_norm": 0.6674877405166626,
|
|
"learning_rate": 4.239924850082501e-06,
|
|
"loss": 0.15751969814300537,
|
|
"memory(GiB)": 31.81,
|
|
"step": 655,
|
|
"token_acc": 0.9428207992057582,
|
|
"train_speed(iter/s)": 0.129329
|
|
},
|
|
{
|
|
"epoch": 1.6572593289432422,
|
|
"grad_norm": 0.7335858345031738,
|
|
"learning_rate": 4.1749782269060045e-06,
|
|
"loss": 0.1551824688911438,
|
|
"memory(GiB)": 31.81,
|
|
"step": 660,
|
|
"token_acc": 0.9432031679047316,
|
|
"train_speed(iter/s)": 0.129436
|
|
},
|
|
{
|
|
"epoch": 1.6572593289432422,
|
|
"eval_loss": 0.21479374170303345,
|
|
"eval_runtime": 15.3588,
|
|
"eval_samples_per_second": 16.733,
|
|
"eval_steps_per_second": 4.232,
|
|
"eval_token_acc": 0.9272660434828275,
|
|
"step": 660
|
|
},
|
|
{
|
|
"epoch": 1.6698024459078082,
|
|
"grad_norm": 0.7220312356948853,
|
|
"learning_rate": 4.110174391248268e-06,
|
|
"loss": 0.15914130210876465,
|
|
"memory(GiB)": 31.81,
|
|
"step": 665,
|
|
"token_acc": 0.9325106594877222,
|
|
"train_speed(iter/s)": 0.12899
|
|
},
|
|
{
|
|
"epoch": 1.6823455628723738,
|
|
"grad_norm": 0.6705756187438965,
|
|
"learning_rate": 4.045524558787712e-06,
|
|
"loss": 0.1455508589744568,
|
|
"memory(GiB)": 31.81,
|
|
"step": 670,
|
|
"token_acc": 0.95000137661408,
|
|
"train_speed(iter/s)": 0.129143
|
|
},
|
|
{
|
|
"epoch": 1.6948886798369394,
|
|
"grad_norm": 0.7751862406730652,
|
|
"learning_rate": 3.9810399185492406e-06,
|
|
"loss": 0.16772797107696533,
|
|
"memory(GiB)": 31.81,
|
|
"step": 675,
|
|
"token_acc": 0.9432926683124416,
|
|
"train_speed(iter/s)": 0.129298
|
|
},
|
|
{
|
|
"epoch": 1.7074317968015051,
|
|
"grad_norm": 0.6835960149765015,
|
|
"learning_rate": 3.916731630967741e-06,
|
|
"loss": 0.148516845703125,
|
|
"memory(GiB)": 31.81,
|
|
"step": 680,
|
|
"token_acc": 0.9397804716241481,
|
|
"train_speed(iter/s)": 0.129488
|
|
},
|
|
{
|
|
"epoch": 1.7074317968015051,
|
|
"eval_loss": 0.21434009075164795,
|
|
"eval_runtime": 15.3644,
|
|
"eval_samples_per_second": 16.727,
|
|
"eval_steps_per_second": 4.231,
|
|
"eval_token_acc": 0.9270209711865001,
|
|
"step": 680
|
|
},
|
|
{
|
|
"epoch": 1.719974913766071,
|
|
"grad_norm": 0.7121639251708984,
|
|
"learning_rate": 3.852610825956529e-06,
|
|
"loss": 0.15527284145355225,
|
|
"memory(GiB)": 31.81,
|
|
"step": 685,
|
|
"token_acc": 0.9362297584483223,
|
|
"train_speed(iter/s)": 0.129069
|
|
},
|
|
{
|
|
"epoch": 1.7325180307306365,
|
|
"grad_norm": 0.70497727394104,
|
|
"learning_rate": 3.788688600981085e-06,
|
|
"loss": 0.15706214904785157,
|
|
"memory(GiB)": 31.81,
|
|
"step": 690,
|
|
"token_acc": 0.945192257525956,
|
|
"train_speed(iter/s)": 0.129196
|
|
},
|
|
{
|
|
"epoch": 1.7450611476952023,
|
|
"grad_norm": 0.6827052235603333,
|
|
"learning_rate": 3.7249760191384055e-06,
|
|
"loss": 0.14694638252258302,
|
|
"memory(GiB)": 31.81,
|
|
"step": 695,
|
|
"token_acc": 0.9522423156598174,
|
|
"train_speed(iter/s)": 0.129354
|
|
},
|
|
{
|
|
"epoch": 1.757604264659768,
|
|
"grad_norm": 0.7271601557731628,
|
|
"learning_rate": 3.6614841072422913e-06,
|
|
"loss": 0.1638465404510498,
|
|
"memory(GiB)": 31.81,
|
|
"step": 700,
|
|
"token_acc": 0.9435711526461237,
|
|
"train_speed(iter/s)": 0.129542
|
|
},
|
|
{
|
|
"epoch": 1.757604264659768,
|
|
"eval_loss": 0.2132289856672287,
|
|
"eval_runtime": 15.3732,
|
|
"eval_samples_per_second": 16.717,
|
|
"eval_steps_per_second": 4.228,
|
|
"eval_token_acc": 0.927563631271225,
|
|
"step": 700
|
|
},
|
|
{
|
|
"epoch": 1.7701473816243336,
|
|
"grad_norm": 0.7114645838737488,
|
|
"learning_rate": 3.5982238539149287e-06,
|
|
"loss": 0.15001455545425416,
|
|
"memory(GiB)": 31.81,
|
|
"step": 705,
|
|
"token_acc": 0.9358007313453388,
|
|
"train_speed(iter/s)": 0.129143
|
|
},
|
|
{
|
|
"epoch": 1.7826904985888994,
|
|
"grad_norm": 0.7541443705558777,
|
|
"learning_rate": 3.535206207685079e-06,
|
|
"loss": 0.15614376068115235,
|
|
"memory(GiB)": 31.81,
|
|
"step": 710,
|
|
"token_acc": 0.9451783170888374,
|
|
"train_speed(iter/s)": 0.129254
|
|
},
|
|
{
|
|
"epoch": 1.7952336155534652,
|
|
"grad_norm": 0.7407529950141907,
|
|
"learning_rate": 3.472442075093192e-06,
|
|
"loss": 0.1589871883392334,
|
|
"memory(GiB)": 31.81,
|
|
"step": 715,
|
|
"token_acc": 0.9350007719623282,
|
|
"train_speed(iter/s)": 0.129419
|
|
},
|
|
{
|
|
"epoch": 1.8077767325180307,
|
|
"grad_norm": 0.7716948390007019,
|
|
"learning_rate": 3.4099423188038094e-06,
|
|
"loss": 0.15787534713745116,
|
|
"memory(GiB)": 31.81,
|
|
"step": 720,
|
|
"token_acc": 0.9492842652647219,
|
|
"train_speed(iter/s)": 0.129594
|
|
},
|
|
{
|
|
"epoch": 1.8077767325180307,
|
|
"eval_loss": 0.21319042146205902,
|
|
"eval_runtime": 15.3493,
|
|
"eval_samples_per_second": 16.743,
|
|
"eval_steps_per_second": 4.235,
|
|
"eval_token_acc": 0.9274848580331198,
|
|
"step": 720
|
|
},
|
|
{
|
|
"epoch": 1.8203198494825963,
|
|
"grad_norm": 0.744939923286438,
|
|
"learning_rate": 3.347717755725547e-06,
|
|
"loss": 0.15603610277175903,
|
|
"memory(GiB)": 31.81,
|
|
"step": 725,
|
|
"token_acc": 0.9345954499920149,
|
|
"train_speed(iter/s)": 0.129224
|
|
},
|
|
{
|
|
"epoch": 1.832862966447162,
|
|
"grad_norm": 0.7879869937896729,
|
|
"learning_rate": 3.2857791551389907e-06,
|
|
"loss": 0.1529020071029663,
|
|
"memory(GiB)": 31.81,
|
|
"step": 730,
|
|
"token_acc": 0.9493445833961127,
|
|
"train_speed(iter/s)": 0.129406
|
|
},
|
|
{
|
|
"epoch": 1.8454060834117278,
|
|
"grad_norm": 0.6601085662841797,
|
|
"learning_rate": 3.224137236832859e-06,
|
|
"loss": 0.14167948961257934,
|
|
"memory(GiB)": 31.81,
|
|
"step": 735,
|
|
"token_acc": 0.9515996958530737,
|
|
"train_speed(iter/s)": 0.129532
|
|
},
|
|
{
|
|
"epoch": 1.8579492003762934,
|
|
"grad_norm": 0.6988480687141418,
|
|
"learning_rate": 3.1628026692487053e-06,
|
|
"loss": 0.1586320996284485,
|
|
"memory(GiB)": 31.81,
|
|
"step": 740,
|
|
"token_acc": 0.9414518601086805,
|
|
"train_speed(iter/s)": 0.129659
|
|
},
|
|
{
|
|
"epoch": 1.8579492003762934,
|
|
"eval_loss": 0.21269367635250092,
|
|
"eval_runtime": 15.37,
|
|
"eval_samples_per_second": 16.721,
|
|
"eval_steps_per_second": 4.229,
|
|
"eval_token_acc": 0.9280625284458915,
|
|
"step": 740
|
|
},
|
|
{
|
|
"epoch": 1.8704923173408592,
|
|
"grad_norm": 0.727496325969696,
|
|
"learning_rate": 3.1017860676345184e-06,
|
|
"loss": 0.16212354898452758,
|
|
"memory(GiB)": 31.81,
|
|
"step": 745,
|
|
"token_acc": 0.9331751365641573,
|
|
"train_speed(iter/s)": 0.129252
|
|
},
|
|
{
|
|
"epoch": 1.883035434305425,
|
|
"grad_norm": 0.6366550922393799,
|
|
"learning_rate": 3.0410979922075344e-06,
|
|
"loss": 0.15711357593536376,
|
|
"memory(GiB)": 31.81,
|
|
"step": 750,
|
|
"token_acc": 0.9437845985913663,
|
|
"train_speed(iter/s)": 0.129389
|
|
},
|
|
{
|
|
"epoch": 1.8955785512699905,
|
|
"grad_norm": 0.7146003246307373,
|
|
"learning_rate": 2.980748946326564e-06,
|
|
"loss": 0.1518003225326538,
|
|
"memory(GiB)": 31.81,
|
|
"step": 755,
|
|
"token_acc": 0.9483841528881254,
|
|
"train_speed(iter/s)": 0.129526
|
|
},
|
|
{
|
|
"epoch": 1.9081216682345563,
|
|
"grad_norm": 0.6720646619796753,
|
|
"learning_rate": 2.920749374674161e-06,
|
|
"loss": 0.15349475145339966,
|
|
"memory(GiB)": 31.81,
|
|
"step": 760,
|
|
"token_acc": 0.945,
|
|
"train_speed(iter/s)": 0.129667
|
|
},
|
|
{
|
|
"epoch": 1.9081216682345563,
|
|
"eval_loss": 0.21246011555194855,
|
|
"eval_runtime": 15.3545,
|
|
"eval_samples_per_second": 16.738,
|
|
"eval_steps_per_second": 4.233,
|
|
"eval_token_acc": 0.9276336519273186,
|
|
"step": 760
|
|
},
|
|
{
|
|
"epoch": 1.920664785199122,
|
|
"grad_norm": 0.7045518755912781,
|
|
"learning_rate": 2.861109661448952e-06,
|
|
"loss": 0.15071908235549927,
|
|
"memory(GiB)": 31.81,
|
|
"step": 765,
|
|
"token_acc": 0.937086689912228,
|
|
"train_speed(iter/s)": 0.129279
|
|
},
|
|
{
|
|
"epoch": 1.9332079021636877,
|
|
"grad_norm": 0.70011967420578,
|
|
"learning_rate": 2.8018401285684284e-06,
|
|
"loss": 0.1453996181488037,
|
|
"memory(GiB)": 31.81,
|
|
"step": 770,
|
|
"token_acc": 0.9489197957797842,
|
|
"train_speed(iter/s)": 0.12943
|
|
},
|
|
{
|
|
"epoch": 1.9457510191282532,
|
|
"grad_norm": 0.7138105630874634,
|
|
"learning_rate": 2.7429510338825206e-06,
|
|
"loss": 0.14368767738342286,
|
|
"memory(GiB)": 31.81,
|
|
"step": 775,
|
|
"token_acc": 0.9417082448253717,
|
|
"train_speed(iter/s)": 0.129571
|
|
},
|
|
{
|
|
"epoch": 1.9582941360928192,
|
|
"grad_norm": 0.7411118149757385,
|
|
"learning_rate": 2.6844525693982614e-06,
|
|
"loss": 0.1606222152709961,
|
|
"memory(GiB)": 31.81,
|
|
"step": 780,
|
|
"token_acc": 0.944643557880968,
|
|
"train_speed(iter/s)": 0.129663
|
|
},
|
|
{
|
|
"epoch": 1.9582941360928192,
|
|
"eval_loss": 0.2114025205373764,
|
|
"eval_runtime": 15.379,
|
|
"eval_samples_per_second": 16.711,
|
|
"eval_steps_per_second": 4.227,
|
|
"eval_token_acc": 0.928220074922102,
|
|
"step": 780
|
|
},
|
|
{
|
|
"epoch": 1.9708372530573848,
|
|
"grad_norm": 0.7422724366188049,
|
|
"learning_rate": 2.6263548595158374e-06,
|
|
"loss": 0.15853983163833618,
|
|
"memory(GiB)": 31.81,
|
|
"step": 785,
|
|
"token_acc": 0.9366524932354078,
|
|
"train_speed(iter/s)": 0.129249
|
|
},
|
|
{
|
|
"epoch": 1.9833803700219503,
|
|
"grad_norm": 0.7750598192214966,
|
|
"learning_rate": 2.568667959276351e-06,
|
|
"loss": 0.15706416368484497,
|
|
"memory(GiB)": 31.81,
|
|
"step": 790,
|
|
"token_acc": 0.9499685404959753,
|
|
"train_speed(iter/s)": 0.12939
|
|
},
|
|
{
|
|
"epoch": 1.9959234869865161,
|
|
"grad_norm": 0.6972166895866394,
|
|
"learning_rate": 2.5114018526215843e-06,
|
|
"loss": 0.15649087429046632,
|
|
"memory(GiB)": 31.81,
|
|
"step": 795,
|
|
"token_acc": 0.9408999669690271,
|
|
"train_speed(iter/s)": 0.129553
|
|
},
|
|
{
|
|
"epoch": 2.0100344935716525,
|
|
"grad_norm": 0.6763654351234436,
|
|
"learning_rate": 2.454566450666061e-06,
|
|
"loss": 0.15049003362655639,
|
|
"memory(GiB)": 31.81,
|
|
"step": 800,
|
|
"token_acc": 0.9530306241390273,
|
|
"train_speed(iter/s)": 0.129615
|
|
},
|
|
{
|
|
"epoch": 2.0100344935716525,
|
|
"eval_loss": 0.21210120618343353,
|
|
"eval_runtime": 15.3555,
|
|
"eval_samples_per_second": 16.737,
|
|
"eval_steps_per_second": 4.233,
|
|
"eval_token_acc": 0.9283163533242307,
|
|
"step": 800
|
|
},
|
|
{
|
|
"epoch": 2.022577610536218,
|
|
"grad_norm": 0.6350038647651672,
|
|
"learning_rate": 2.398171589981721e-06,
|
|
"loss": 0.10892703533172607,
|
|
"memory(GiB)": 31.81,
|
|
"step": 805,
|
|
"token_acc": 0.9476837338906304,
|
|
"train_speed(iter/s)": 0.12922
|
|
},
|
|
{
|
|
"epoch": 2.035120727500784,
|
|
"grad_norm": 0.6500776410102844,
|
|
"learning_rate": 2.3422270308954936e-06,
|
|
"loss": 0.1064380407333374,
|
|
"memory(GiB)": 31.81,
|
|
"step": 810,
|
|
"token_acc": 0.9628300589097216,
|
|
"train_speed(iter/s)": 0.129369
|
|
},
|
|
{
|
|
"epoch": 2.0476638444653497,
|
|
"grad_norm": 0.6957349181175232,
|
|
"learning_rate": 2.286742455800059e-06,
|
|
"loss": 0.10609914064407348,
|
|
"memory(GiB)": 31.81,
|
|
"step": 815,
|
|
"token_acc": 0.9647304470327791,
|
|
"train_speed(iter/s)": 0.129502
|
|
},
|
|
{
|
|
"epoch": 2.060206961429915,
|
|
"grad_norm": 0.7038280963897705,
|
|
"learning_rate": 2.2317274674781158e-06,
|
|
"loss": 0.1041153073310852,
|
|
"memory(GiB)": 31.81,
|
|
"step": 820,
|
|
"token_acc": 0.9643880707130899,
|
|
"train_speed(iter/s)": 0.129593
|
|
},
|
|
{
|
|
"epoch": 2.060206961429915,
|
|
"eval_loss": 0.23022687435150146,
|
|
"eval_runtime": 15.3909,
|
|
"eval_samples_per_second": 16.698,
|
|
"eval_steps_per_second": 4.223,
|
|
"eval_token_acc": 0.9276424045093302,
|
|
"step": 820
|
|
},
|
|
{
|
|
"epoch": 2.072750078394481,
|
|
"grad_norm": 0.8562469482421875,
|
|
"learning_rate": 2.1771915874404094e-06,
|
|
"loss": 0.11885223388671876,
|
|
"memory(GiB)": 31.81,
|
|
"step": 825,
|
|
"token_acc": 0.9438533042412649,
|
|
"train_speed(iter/s)": 0.12923
|
|
},
|
|
{
|
|
"epoch": 2.085293195359047,
|
|
"grad_norm": 0.6420326828956604,
|
|
"learning_rate": 2.1231442542778317e-06,
|
|
"loss": 0.11257556676864625,
|
|
"memory(GiB)": 31.81,
|
|
"step": 830,
|
|
"token_acc": 0.9660501458879382,
|
|
"train_speed(iter/s)": 0.129354
|
|
},
|
|
{
|
|
"epoch": 2.0978363123236123,
|
|
"grad_norm": 0.6728197932243347,
|
|
"learning_rate": 2.0695948220278756e-06,
|
|
"loss": 0.11477745771408081,
|
|
"memory(GiB)": 31.81,
|
|
"step": 835,
|
|
"token_acc": 0.9606660351961713,
|
|
"train_speed(iter/s)": 0.12949
|
|
},
|
|
{
|
|
"epoch": 2.110379429288178,
|
|
"grad_norm": 0.7246009111404419,
|
|
"learning_rate": 2.0165525585557205e-06,
|
|
"loss": 0.11393618583679199,
|
|
"memory(GiB)": 31.81,
|
|
"step": 840,
|
|
"token_acc": 0.9608159022995972,
|
|
"train_speed(iter/s)": 0.129643
|
|
},
|
|
{
|
|
"epoch": 2.110379429288178,
|
|
"eval_loss": 0.22520191967487335,
|
|
"eval_runtime": 15.3743,
|
|
"eval_samples_per_second": 16.716,
|
|
"eval_steps_per_second": 4.228,
|
|
"eval_token_acc": 0.9278262087315758,
|
|
"step": 840
|
|
},
|
|
{
|
|
"epoch": 2.122922546252744,
|
|
"grad_norm": 0.7262341380119324,
|
|
"learning_rate": 1.964026643950226e-06,
|
|
"loss": 0.10375577211380005,
|
|
"memory(GiB)": 31.81,
|
|
"step": 845,
|
|
"token_acc": 0.9489552718925005,
|
|
"train_speed(iter/s)": 0.129239
|
|
},
|
|
{
|
|
"epoch": 2.1354656632173095,
|
|
"grad_norm": 0.7589318752288818,
|
|
"learning_rate": 1.9120261689351317e-06,
|
|
"loss": 0.11369407176971436,
|
|
"memory(GiB)": 31.81,
|
|
"step": 850,
|
|
"token_acc": 0.9638739431206764,
|
|
"train_speed(iter/s)": 0.129365
|
|
},
|
|
{
|
|
"epoch": 2.148008780181875,
|
|
"grad_norm": 0.7323006391525269,
|
|
"learning_rate": 1.860560133295708e-06,
|
|
"loss": 0.11056618690490723,
|
|
"memory(GiB)": 31.81,
|
|
"step": 855,
|
|
"token_acc": 0.9616726487788961,
|
|
"train_speed(iter/s)": 0.129496
|
|
},
|
|
{
|
|
"epoch": 2.160551897146441,
|
|
"grad_norm": 0.6986774206161499,
|
|
"learning_rate": 1.8096374443211545e-06,
|
|
"loss": 0.10637121200561524,
|
|
"memory(GiB)": 31.81,
|
|
"step": 860,
|
|
"token_acc": 0.9640018078855714,
|
|
"train_speed(iter/s)": 0.129604
|
|
},
|
|
{
|
|
"epoch": 2.160551897146441,
|
|
"eval_loss": 0.22789862751960754,
|
|
"eval_runtime": 15.3904,
|
|
"eval_samples_per_second": 16.699,
|
|
"eval_steps_per_second": 4.223,
|
|
"eval_token_acc": 0.9274586002870847,
|
|
"step": 860
|
|
},
|
|
{
|
|
"epoch": 2.1730950141110066,
|
|
"grad_norm": 0.6732742786407471,
|
|
"learning_rate": 1.7592669152630082e-06,
|
|
"loss": 0.10579054355621338,
|
|
"memory(GiB)": 31.81,
|
|
"step": 865,
|
|
"token_acc": 0.9454877249898618,
|
|
"train_speed(iter/s)": 0.129231
|
|
},
|
|
{
|
|
"epoch": 2.185638131075572,
|
|
"grad_norm": 0.7679221034049988,
|
|
"learning_rate": 1.7094572638098122e-06,
|
|
"loss": 0.10716142654418945,
|
|
"memory(GiB)": 31.81,
|
|
"step": 870,
|
|
"token_acc": 0.9636935391652373,
|
|
"train_speed(iter/s)": 0.129367
|
|
},
|
|
{
|
|
"epoch": 2.198181248040138,
|
|
"grad_norm": 0.7014066576957703,
|
|
"learning_rate": 1.6602171105783488e-06,
|
|
"loss": 0.1035423994064331,
|
|
"memory(GiB)": 31.81,
|
|
"step": 875,
|
|
"token_acc": 0.9624011843906254,
|
|
"train_speed(iter/s)": 0.12952
|
|
},
|
|
{
|
|
"epoch": 2.2107243650047037,
|
|
"grad_norm": 0.7253413200378418,
|
|
"learning_rate": 1.61155497762165e-06,
|
|
"loss": 0.10561528205871581,
|
|
"memory(GiB)": 31.81,
|
|
"step": 880,
|
|
"token_acc": 0.9681256194898012,
|
|
"train_speed(iter/s)": 0.129624
|
|
},
|
|
{
|
|
"epoch": 2.2107243650047037,
|
|
"eval_loss": 0.22809092700481415,
|
|
"eval_runtime": 15.3879,
|
|
"eval_samples_per_second": 16.701,
|
|
"eval_steps_per_second": 4.224,
|
|
"eval_token_acc": 0.927423589959038,
|
|
"step": 880
|
|
},
|
|
{
|
|
"epoch": 2.2232674819692693,
|
|
"grad_norm": 0.6759311556816101,
|
|
"learning_rate": 1.5634792869540782e-06,
|
|
"loss": 0.11813747882843018,
|
|
"memory(GiB)": 31.81,
|
|
"step": 885,
|
|
"token_acc": 0.9463408677719589,
|
|
"train_speed(iter/s)": 0.12928
|
|
},
|
|
{
|
|
"epoch": 2.235810598933835,
|
|
"grad_norm": 0.6786462664604187,
|
|
"learning_rate": 1.5159983590937183e-06,
|
|
"loss": 0.09899504780769348,
|
|
"memory(GiB)": 31.81,
|
|
"step": 890,
|
|
"token_acc": 0.9641708663306936,
|
|
"train_speed(iter/s)": 0.129383
|
|
},
|
|
{
|
|
"epoch": 2.248353715898401,
|
|
"grad_norm": 0.7053468823432922,
|
|
"learning_rate": 1.4691204116223357e-06,
|
|
"loss": 0.11507067680358887,
|
|
"memory(GiB)": 31.81,
|
|
"step": 895,
|
|
"token_acc": 0.9575259738401214,
|
|
"train_speed(iter/s)": 0.129501
|
|
},
|
|
{
|
|
"epoch": 2.2608968328629664,
|
|
"grad_norm": 0.7843905687332153,
|
|
"learning_rate": 1.4228535577631442e-06,
|
|
"loss": 0.10749893188476563,
|
|
"memory(GiB)": 31.81,
|
|
"step": 900,
|
|
"token_acc": 0.9568620265424181,
|
|
"train_speed(iter/s)": 0.129634
|
|
},
|
|
{
|
|
"epoch": 2.2608968328629664,
|
|
"eval_loss": 0.2279745191335678,
|
|
"eval_runtime": 15.3783,
|
|
"eval_samples_per_second": 16.712,
|
|
"eval_steps_per_second": 4.227,
|
|
"eval_token_acc": 0.9276336519273186,
|
|
"step": 900
|
|
},
|
|
{
|
|
"epoch": 2.273439949827532,
|
|
"grad_norm": 0.7689437866210938,
|
|
"learning_rate": 1.3772058049766491e-06,
|
|
"loss": 0.10860542058944703,
|
|
"memory(GiB)": 31.81,
|
|
"step": 905,
|
|
"token_acc": 0.9446734581062939,
|
|
"train_speed(iter/s)": 0.129286
|
|
},
|
|
{
|
|
"epoch": 2.285983066792098,
|
|
"grad_norm": 0.8241957426071167,
|
|
"learning_rate": 1.3321850535747822e-06,
|
|
"loss": 0.12034444808959961,
|
|
"memory(GiB)": 31.81,
|
|
"step": 910,
|
|
"token_acc": 0.9542774256614007,
|
|
"train_speed(iter/s)": 0.129401
|
|
},
|
|
{
|
|
"epoch": 2.2985261837566635,
|
|
"grad_norm": 0.6636318564414978,
|
|
"learning_rate": 1.2877990953535841e-06,
|
|
"loss": 0.10744799375534057,
|
|
"memory(GiB)": 31.81,
|
|
"step": 915,
|
|
"token_acc": 0.9670476136460312,
|
|
"train_speed(iter/s)": 0.129533
|
|
},
|
|
{
|
|
"epoch": 2.311069300721229,
|
|
"grad_norm": 0.696555495262146,
|
|
"learning_rate": 1.2440556122446701e-06,
|
|
"loss": 0.11220449209213257,
|
|
"memory(GiB)": 31.81,
|
|
"step": 920,
|
|
"token_acc": 0.9617257008561356,
|
|
"train_speed(iter/s)": 0.129627
|
|
},
|
|
{
|
|
"epoch": 2.311069300721229,
|
|
"eval_loss": 0.22779622673988342,
|
|
"eval_runtime": 15.4115,
|
|
"eval_samples_per_second": 16.676,
|
|
"eval_steps_per_second": 4.218,
|
|
"eval_token_acc": 0.9276511570913419,
|
|
"step": 920
|
|
},
|
|
{
|
|
"epoch": 2.323612417685795,
|
|
"grad_norm": 0.7180680632591248,
|
|
"learning_rate": 1.2009621749857103e-06,
|
|
"loss": 0.10242276191711426,
|
|
"memory(GiB)": 31.81,
|
|
"step": 925,
|
|
"token_acc": 0.9447967352064041,
|
|
"train_speed(iter/s)": 0.129303
|
|
},
|
|
{
|
|
"epoch": 2.3361555346503606,
|
|
"grad_norm": 0.7456693649291992,
|
|
"learning_rate": 1.1585262418101468e-06,
|
|
"loss": 0.10643236637115479,
|
|
"memory(GiB)": 31.81,
|
|
"step": 930,
|
|
"token_acc": 0.9578788036953912,
|
|
"train_speed(iter/s)": 0.129454
|
|
},
|
|
{
|
|
"epoch": 2.348698651614926,
|
|
"grad_norm": 0.7959876656532288,
|
|
"learning_rate": 1.1167551571563967e-06,
|
|
"loss": 0.10762505531311035,
|
|
"memory(GiB)": 31.81,
|
|
"step": 935,
|
|
"token_acc": 0.9615673799884327,
|
|
"train_speed(iter/s)": 0.129587
|
|
},
|
|
{
|
|
"epoch": 2.361241768579492,
|
|
"grad_norm": 0.7502437233924866,
|
|
"learning_rate": 1.0756561503967366e-06,
|
|
"loss": 0.11327018737792968,
|
|
"memory(GiB)": 31.81,
|
|
"step": 940,
|
|
"token_acc": 0.9572353022167148,
|
|
"train_speed(iter/s)": 0.129692
|
|
},
|
|
{
|
|
"epoch": 2.361241768579492,
|
|
"eval_loss": 0.2275438755750656,
|
|
"eval_runtime": 15.3749,
|
|
"eval_samples_per_second": 16.716,
|
|
"eval_steps_per_second": 4.228,
|
|
"eval_token_acc": 0.9278612190596226,
|
|
"step": 940
|
|
},
|
|
{
|
|
"epoch": 2.3737848855440578,
|
|
"grad_norm": 0.7785040736198425,
|
|
"learning_rate": 1.0352363345861067e-06,
|
|
"loss": 0.1163412094116211,
|
|
"memory(GiB)": 31.81,
|
|
"step": 945,
|
|
"token_acc": 0.9469440871152063,
|
|
"train_speed(iter/s)": 0.129374
|
|
},
|
|
{
|
|
"epoch": 2.3863280025086233,
|
|
"grad_norm": 0.7529416680335999,
|
|
"learning_rate": 9.955027052310445e-07,
|
|
"loss": 0.1082146406173706,
|
|
"memory(GiB)": 31.81,
|
|
"step": 950,
|
|
"token_acc": 0.9666347763692896,
|
|
"train_speed(iter/s)": 0.12948
|
|
},
|
|
{
|
|
"epoch": 2.3988711194731893,
|
|
"grad_norm": 0.7093843221664429,
|
|
"learning_rate": 9.564621390789692e-07,
|
|
"loss": 0.10433540344238282,
|
|
"memory(GiB)": 31.81,
|
|
"step": 955,
|
|
"token_acc": 0.9620772386038232,
|
|
"train_speed(iter/s)": 0.129551
|
|
},
|
|
{
|
|
"epoch": 2.411414236437755,
|
|
"grad_norm": 0.7402180433273315,
|
|
"learning_rate": 9.181213929280047e-07,
|
|
"loss": 0.1084256649017334,
|
|
"memory(GiB)": 31.81,
|
|
"step": 960,
|
|
"token_acc": 0.9655060201757241,
|
|
"train_speed(iter/s)": 0.12968
|
|
},
|
|
{
|
|
"epoch": 2.411414236437755,
|
|
"eval_loss": 0.22712615132331848,
|
|
"eval_runtime": 15.3736,
|
|
"eval_samples_per_second": 16.717,
|
|
"eval_steps_per_second": 4.228,
|
|
"eval_token_acc": 0.9277211777474355,
|
|
"step": 960
|
|
},
|
|
{
|
|
"epoch": 2.4239573534023204,
|
|
"grad_norm": 0.7065171599388123,
|
|
"learning_rate": 8.804871024575851e-07,
|
|
"loss": 0.1058305025100708,
|
|
"memory(GiB)": 31.81,
|
|
"step": 965,
|
|
"token_acc": 0.9411054200749178,
|
|
"train_speed(iter/s)": 0.129327
|
|
},
|
|
{
|
|
"epoch": 2.436500470366886,
|
|
"grad_norm": 0.7312522530555725,
|
|
"learning_rate": 8.435657810799991e-07,
|
|
"loss": 0.11365176439285278,
|
|
"memory(GiB)": 31.81,
|
|
"step": 970,
|
|
"token_acc": 0.9554801532746365,
|
|
"train_speed(iter/s)": 0.129412
|
|
},
|
|
{
|
|
"epoch": 2.449043587331452,
|
|
"grad_norm": 0.7271402478218079,
|
|
"learning_rate": 8.073638188131128e-07,
|
|
"loss": 0.11030232906341553,
|
|
"memory(GiB)": 31.81,
|
|
"step": 975,
|
|
"token_acc": 0.9618299257450921,
|
|
"train_speed(iter/s)": 0.129519
|
|
},
|
|
{
|
|
"epoch": 2.4615867042960176,
|
|
"grad_norm": 0.729744017124176,
|
|
"learning_rate": 7.71887481174437e-07,
|
|
"loss": 0.10576653480529785,
|
|
"memory(GiB)": 31.81,
|
|
"step": 980,
|
|
"token_acc": 0.9634010868586184,
|
|
"train_speed(iter/s)": 0.129607
|
|
},
|
|
{
|
|
"epoch": 2.4615867042960176,
|
|
"eval_loss": 0.22756896913051605,
|
|
"eval_runtime": 15.389,
|
|
"eval_samples_per_second": 16.7,
|
|
"eval_steps_per_second": 4.224,
|
|
"eval_token_acc": 0.9279312397157161,
|
|
"step": 980
|
|
},
|
|
{
|
|
"epoch": 2.474129821260583,
|
|
"grad_norm": 0.8634856343269348,
|
|
"learning_rate": 7.371429080967468e-07,
|
|
"loss": 0.09780678153038025,
|
|
"memory(GiB)": 31.81,
|
|
"step": 985,
|
|
"token_acc": 0.9456286316041047,
|
|
"train_speed(iter/s)": 0.129279
|
|
},
|
|
{
|
|
"epoch": 2.486672938225149,
|
|
"grad_norm": 0.672733724117279,
|
|
"learning_rate": 7.031361128654402e-07,
|
|
"loss": 0.10667885541915893,
|
|
"memory(GiB)": 31.81,
|
|
"step": 990,
|
|
"token_acc": 0.9594269307734694,
|
|
"train_speed(iter/s)": 0.129407
|
|
},
|
|
{
|
|
"epoch": 2.4992160551897147,
|
|
"grad_norm": 0.760313093662262,
|
|
"learning_rate": 6.698729810778065e-07,
|
|
"loss": 0.11521060466766357,
|
|
"memory(GiB)": 31.81,
|
|
"step": 995,
|
|
"token_acc": 0.9575349257736169,
|
|
"train_speed(iter/s)": 0.12955
|
|
},
|
|
{
|
|
"epoch": 2.5117591721542802,
|
|
"grad_norm": 0.702035665512085,
|
|
"learning_rate": 6.373592696244024e-07,
|
|
"loss": 0.11087181568145751,
|
|
"memory(GiB)": 31.81,
|
|
"step": 1000,
|
|
"token_acc": 0.9578573542468186,
|
|
"train_speed(iter/s)": 0.129663
|
|
},
|
|
{
|
|
"epoch": 2.5117591721542802,
|
|
"eval_loss": 0.227799654006958,
|
|
"eval_runtime": 15.3792,
|
|
"eval_samples_per_second": 16.711,
|
|
"eval_steps_per_second": 4.227,
|
|
"eval_token_acc": 0.9277299303294472,
|
|
"step": 1000
|
|
},
|
|
{
|
|
"epoch": 2.524302289118846,
|
|
"grad_norm": 0.7296103835105896,
|
|
"learning_rate": 6.056006056926978e-07,
|
|
"loss": 0.10585801601409912,
|
|
"memory(GiB)": 31.81,
|
|
"step": 1005,
|
|
"token_acc": 0.948129963898917,
|
|
"train_speed(iter/s)": 0.129334
|
|
},
|
|
{
|
|
"epoch": 2.536845406083412,
|
|
"grad_norm": 0.6856093406677246,
|
|
"learning_rate": 5.746024857931732e-07,
|
|
"loss": 0.10559420585632324,
|
|
"memory(GiB)": 31.81,
|
|
"step": 1010,
|
|
"token_acc": 0.9610920907561075,
|
|
"train_speed(iter/s)": 0.129436
|
|
},
|
|
{
|
|
"epoch": 2.5493885230479774,
|
|
"grad_norm": 0.6898284554481506,
|
|
"learning_rate": 5.443702748080288e-07,
|
|
"loss": 0.10710105895996094,
|
|
"memory(GiB)": 31.81,
|
|
"step": 1015,
|
|
"token_acc": 0.9610382616656346,
|
|
"train_speed(iter/s)": 0.129565
|
|
},
|
|
{
|
|
"epoch": 2.561931640012543,
|
|
"grad_norm": 0.7101157307624817,
|
|
"learning_rate": 5.149092050626825e-07,
|
|
"loss": 0.10318450927734375,
|
|
"memory(GiB)": 31.81,
|
|
"step": 1020,
|
|
"token_acc": 0.9633534136546185,
|
|
"train_speed(iter/s)": 0.12963
|
|
},
|
|
{
|
|
"epoch": 2.561931640012543,
|
|
"eval_loss": 0.22718214988708496,
|
|
"eval_runtime": 15.3905,
|
|
"eval_samples_per_second": 16.699,
|
|
"eval_steps_per_second": 4.223,
|
|
"eval_token_acc": 0.9277911984035291,
|
|
"step": 1020
|
|
},
|
|
{
|
|
"epoch": 2.574474756977109,
|
|
"grad_norm": 0.7209934592247009,
|
|
"learning_rate": 4.862243754202023e-07,
|
|
"loss": 0.11119084358215332,
|
|
"memory(GiB)": 31.81,
|
|
"step": 1025,
|
|
"token_acc": 0.9460293899361734,
|
|
"train_speed(iter/s)": 0.129349
|
|
},
|
|
{
|
|
"epoch": 2.5870178739416745,
|
|
"grad_norm": 0.7095735669136047,
|
|
"learning_rate": 4.5832075039884014e-07,
|
|
"loss": 0.1083114743232727,
|
|
"memory(GiB)": 31.81,
|
|
"step": 1030,
|
|
"token_acc": 0.9631125846265288,
|
|
"train_speed(iter/s)": 0.129447
|
|
},
|
|
{
|
|
"epoch": 2.59956099090624,
|
|
"grad_norm": 0.7213476896286011,
|
|
"learning_rate": 4.3120315931281633e-07,
|
|
"loss": 0.10071847438812256,
|
|
"memory(GiB)": 31.81,
|
|
"step": 1035,
|
|
"token_acc": 0.9633851013424586,
|
|
"train_speed(iter/s)": 0.129568
|
|
},
|
|
{
|
|
"epoch": 2.612104107870806,
|
|
"grad_norm": 0.772677481174469,
|
|
"learning_rate": 4.048762954365054e-07,
|
|
"loss": 0.11145726442337037,
|
|
"memory(GiB)": 31.81,
|
|
"step": 1040,
|
|
"token_acc": 0.9627473455598455,
|
|
"train_speed(iter/s)": 0.129711
|
|
},
|
|
{
|
|
"epoch": 2.612104107870806,
|
|
"eval_loss": 0.2263808250427246,
|
|
"eval_runtime": 15.3525,
|
|
"eval_samples_per_second": 16.74,
|
|
"eval_steps_per_second": 4.234,
|
|
"eval_token_acc": 0.9280012603718096,
|
|
"step": 1040
|
|
},
|
|
{
|
|
"epoch": 2.6246472248353716,
|
|
"grad_norm": 0.6904744505882263,
|
|
"learning_rate": 3.793447151921642e-07,
|
|
"loss": 0.11429480314254761,
|
|
"memory(GiB)": 31.81,
|
|
"step": 1045,
|
|
"token_acc": 0.945939040519418,
|
|
"train_speed(iter/s)": 0.129419
|
|
},
|
|
{
|
|
"epoch": 2.637190341799937,
|
|
"grad_norm": 0.7401297688484192,
|
|
"learning_rate": 3.546128373613472e-07,
|
|
"loss": 0.10656030178070068,
|
|
"memory(GiB)": 31.81,
|
|
"step": 1050,
|
|
"token_acc": 0.9636875146526349,
|
|
"train_speed(iter/s)": 0.1295
|
|
},
|
|
{
|
|
"epoch": 2.649733458764503,
|
|
"grad_norm": 0.7498672604560852,
|
|
"learning_rate": 3.30684942320143e-07,
|
|
"loss": 0.11416795253753662,
|
|
"memory(GiB)": 31.81,
|
|
"step": 1055,
|
|
"token_acc": 0.9633607254179655,
|
|
"train_speed(iter/s)": 0.129581
|
|
},
|
|
{
|
|
"epoch": 2.6622765757290687,
|
|
"grad_norm": 0.7101024985313416,
|
|
"learning_rate": 3.0756517129836296e-07,
|
|
"loss": 0.1097292423248291,
|
|
"memory(GiB)": 31.81,
|
|
"step": 1060,
|
|
"token_acc": 0.9603677715944834,
|
|
"train_speed(iter/s)": 0.129673
|
|
},
|
|
{
|
|
"epoch": 2.6622765757290687,
|
|
"eval_loss": 0.22645404934883118,
|
|
"eval_runtime": 15.3936,
|
|
"eval_samples_per_second": 16.695,
|
|
"eval_steps_per_second": 4.223,
|
|
"eval_token_acc": 0.9278524664776109,
|
|
"step": 1060
|
|
},
|
|
{
|
|
"epoch": 2.6748196926936343,
|
|
"grad_norm": 0.6467409133911133,
|
|
"learning_rate": 2.8525752566281485e-07,
|
|
"loss": 0.10393040180206299,
|
|
"memory(GiB)": 31.81,
|
|
"step": 1065,
|
|
"token_acc": 0.9449979310564344,
|
|
"train_speed(iter/s)": 0.12935
|
|
},
|
|
{
|
|
"epoch": 2.6873628096582003,
|
|
"grad_norm": 0.7203241586685181,
|
|
"learning_rate": 2.637658662247805e-07,
|
|
"loss": 0.11105575561523437,
|
|
"memory(GiB)": 31.81,
|
|
"step": 1070,
|
|
"token_acc": 0.9642081358609794,
|
|
"train_speed(iter/s)": 0.129437
|
|
},
|
|
{
|
|
"epoch": 2.699905926622766,
|
|
"grad_norm": 0.6585695147514343,
|
|
"learning_rate": 2.430939125718218e-07,
|
|
"loss": 0.11089683771133423,
|
|
"memory(GiB)": 31.81,
|
|
"step": 1075,
|
|
"token_acc": 0.9604440440864773,
|
|
"train_speed(iter/s)": 0.129535
|
|
},
|
|
{
|
|
"epoch": 2.7124490435873314,
|
|
"grad_norm": 0.7210690975189209,
|
|
"learning_rate": 2.232452424240261e-07,
|
|
"loss": 0.10859737396240235,
|
|
"memory(GiB)": 31.81,
|
|
"step": 1080,
|
|
"token_acc": 0.9596657286603565,
|
|
"train_speed(iter/s)": 0.129605
|
|
},
|
|
{
|
|
"epoch": 2.7124490435873314,
|
|
"eval_loss": 0.2266274243593216,
|
|
"eval_runtime": 15.3828,
|
|
"eval_samples_per_second": 16.707,
|
|
"eval_steps_per_second": 4.225,
|
|
"eval_token_acc": 0.928220074922102,
|
|
"step": 1080
|
|
},
|
|
{
|
|
"epoch": 2.7249921605518974,
|
|
"grad_norm": 0.6953999996185303,
|
|
"learning_rate": 2.042232910148051e-07,
|
|
"loss": 0.10121151208877563,
|
|
"memory(GiB)": 31.81,
|
|
"step": 1085,
|
|
"token_acc": 0.9472209455753066,
|
|
"train_speed(iter/s)": 0.129319
|
|
},
|
|
{
|
|
"epoch": 2.737535277516463,
|
|
"grad_norm": 0.6597380638122559,
|
|
"learning_rate": 1.860313504963579e-07,
|
|
"loss": 0.1065935492515564,
|
|
"memory(GiB)": 31.81,
|
|
"step": 1090,
|
|
"token_acc": 0.9662114751443839,
|
|
"train_speed(iter/s)": 0.129415
|
|
},
|
|
{
|
|
"epoch": 2.7500783944810285,
|
|
"grad_norm": 0.6942236423492432,
|
|
"learning_rate": 1.6867256936989097e-07,
|
|
"loss": 0.11052279472351074,
|
|
"memory(GiB)": 31.81,
|
|
"step": 1095,
|
|
"token_acc": 0.9620684756357437,
|
|
"train_speed(iter/s)": 0.129503
|
|
},
|
|
{
|
|
"epoch": 2.762621511445594,
|
|
"grad_norm": 0.7812759280204773,
|
|
"learning_rate": 1.521499519407038e-07,
|
|
"loss": 0.11402370929718017,
|
|
"memory(GiB)": 31.81,
|
|
"step": 1100,
|
|
"token_acc": 0.9662987099348318,
|
|
"train_speed(iter/s)": 0.129613
|
|
},
|
|
{
|
|
"epoch": 2.762621511445594,
|
|
"eval_loss": 0.2265271693468094,
|
|
"eval_runtime": 15.3687,
|
|
"eval_samples_per_second": 16.722,
|
|
"eval_steps_per_second": 4.229,
|
|
"eval_token_acc": 0.9280100129538214,
|
|
"step": 1100
|
|
},
|
|
{
|
|
"epoch": 2.7751646284101597,
|
|
"grad_norm": 0.6834614276885986,
|
|
"learning_rate": 1.364663577982317e-07,
|
|
"loss": 0.09805427193641662,
|
|
"memory(GiB)": 31.81,
|
|
"step": 1105,
|
|
"token_acc": 0.9493173799662525,
|
|
"train_speed(iter/s)": 0.129335
|
|
},
|
|
{
|
|
"epoch": 2.7877077453747257,
|
|
"grad_norm": 0.7146019339561462,
|
|
"learning_rate": 1.2162450132113202e-07,
|
|
"loss": 0.1073993444442749,
|
|
"memory(GiB)": 31.81,
|
|
"step": 1110,
|
|
"token_acc": 0.9588939098284893,
|
|
"train_speed(iter/s)": 0.129429
|
|
},
|
|
{
|
|
"epoch": 2.800250862339291,
|
|
"grad_norm": 0.6562223434448242,
|
|
"learning_rate": 1.07626951207504e-07,
|
|
"loss": 0.0982414186000824,
|
|
"memory(GiB)": 31.81,
|
|
"step": 1115,
|
|
"token_acc": 0.9667602620671213,
|
|
"train_speed(iter/s)": 0.129527
|
|
},
|
|
{
|
|
"epoch": 2.8127939793038568,
|
|
"grad_norm": 0.6855860352516174,
|
|
"learning_rate": 9.447613003032042e-08,
|
|
"loss": 0.10424129962921143,
|
|
"memory(GiB)": 31.81,
|
|
"step": 1120,
|
|
"token_acc": 0.965159977034292,
|
|
"train_speed(iter/s)": 0.129604
|
|
},
|
|
{
|
|
"epoch": 2.8127939793038568,
|
|
"eval_loss": 0.22646446526050568,
|
|
"eval_runtime": 15.3994,
|
|
"eval_samples_per_second": 16.689,
|
|
"eval_steps_per_second": 4.221,
|
|
"eval_token_acc": 0.9282900955781955,
|
|
"step": 1120
|
|
},
|
|
{
|
|
"epoch": 2.8253370962684228,
|
|
"grad_norm": 0.7434061169624329,
|
|
"learning_rate": 8.217431381815078e-08,
|
|
"loss": 0.10303902626037598,
|
|
"memory(GiB)": 31.81,
|
|
"step": 1125,
|
|
"token_acc": 0.9447586580925079,
|
|
"train_speed(iter/s)": 0.129305
|
|
},
|
|
{
|
|
"epoch": 2.8378802132329883,
|
|
"grad_norm": 0.719038724899292,
|
|
"learning_rate": 7.072363166124363e-08,
|
|
"loss": 0.10360879898071289,
|
|
"memory(GiB)": 31.81,
|
|
"step": 1130,
|
|
"token_acc": 0.960933130941919,
|
|
"train_speed(iter/s)": 0.129389
|
|
},
|
|
{
|
|
"epoch": 2.850423330197554,
|
|
"grad_norm": 0.7280715107917786,
|
|
"learning_rate": 6.012606534304688e-08,
|
|
"loss": 0.10378862619400024,
|
|
"memory(GiB)": 31.81,
|
|
"step": 1135,
|
|
"token_acc": 0.9630866449176706,
|
|
"train_speed(iter/s)": 0.12948
|
|
},
|
|
{
|
|
"epoch": 2.86296644716212,
|
|
"grad_norm": 0.7042152881622314,
|
|
"learning_rate": 5.038344899721437e-08,
|
|
"loss": 0.10662559270858765,
|
|
"memory(GiB)": 31.81,
|
|
"step": 1140,
|
|
"token_acc": 0.9665508368922252,
|
|
"train_speed(iter/s)": 0.129586
|
|
},
|
|
{
|
|
"epoch": 2.86296644716212,
|
|
"eval_loss": 0.22645802795886993,
|
|
"eval_runtime": 15.3769,
|
|
"eval_samples_per_second": 16.713,
|
|
"eval_steps_per_second": 4.227,
|
|
"eval_token_acc": 0.928246332668137,
|
|
"step": 1140
|
|
},
|
|
{
|
|
"epoch": 2.8755095641266855,
|
|
"grad_norm": 0.6806672811508179,
|
|
"learning_rate": 4.149746879017147e-08,
|
|
"loss": 0.10936232805252075,
|
|
"memory(GiB)": 31.81,
|
|
"step": 1145,
|
|
"token_acc": 0.9419420343363485,
|
|
"train_speed(iter/s)": 0.129338
|
|
},
|
|
{
|
|
"epoch": 2.888052681091251,
|
|
"grad_norm": 0.7901387810707092,
|
|
"learning_rate": 3.3469662629289635e-08,
|
|
"loss": 0.1104103684425354,
|
|
"memory(GiB)": 31.81,
|
|
"step": 1150,
|
|
"token_acc": 0.96508989778244,
|
|
"train_speed(iter/s)": 0.129455
|
|
},
|
|
{
|
|
"epoch": 2.900595798055817,
|
|
"grad_norm": 0.6709795594215393,
|
|
"learning_rate": 2.630141989671542e-08,
|
|
"loss": 0.10086469650268555,
|
|
"memory(GiB)": 31.81,
|
|
"step": 1155,
|
|
"token_acc": 0.9644157007671202,
|
|
"train_speed(iter/s)": 0.129535
|
|
},
|
|
{
|
|
"epoch": 2.9131389150203826,
|
|
"grad_norm": 0.7060185074806213,
|
|
"learning_rate": 1.999398120891116e-08,
|
|
"loss": 0.09639860391616821,
|
|
"memory(GiB)": 31.81,
|
|
"step": 1160,
|
|
"token_acc": 0.9676043228708827,
|
|
"train_speed(iter/s)": 0.129612
|
|
},
|
|
{
|
|
"epoch": 2.9131389150203826,
|
|
"eval_loss": 0.22671610116958618,
|
|
"eval_runtime": 15.358,
|
|
"eval_samples_per_second": 16.734,
|
|
"eval_steps_per_second": 4.232,
|
|
"eval_token_acc": 0.9280450232818681,
|
|
"step": 1160
|
|
},
|
|
{
|
|
"epoch": 2.925682031984948,
|
|
"grad_norm": 0.67342209815979,
|
|
"learning_rate": 1.4548438201939518e-08,
|
|
"loss": 0.11243362426757812,
|
|
"memory(GiB)": 31.81,
|
|
"step": 1165,
|
|
"token_acc": 0.9444314659938637,
|
|
"train_speed(iter/s)": 0.129336
|
|
},
|
|
{
|
|
"epoch": 2.938225148949514,
|
|
"grad_norm": 0.783845841884613,
|
|
"learning_rate": 9.965733342532925e-09,
|
|
"loss": 0.11067414283752441,
|
|
"memory(GiB)": 31.81,
|
|
"step": 1170,
|
|
"token_acc": 0.9621745865187628,
|
|
"train_speed(iter/s)": 0.129438
|
|
},
|
|
{
|
|
"epoch": 2.9507682659140797,
|
|
"grad_norm": 0.6691847443580627,
|
|
"learning_rate": 6.246659764979068e-09,
|
|
"loss": 0.10967533588409424,
|
|
"memory(GiB)": 31.81,
|
|
"step": 1175,
|
|
"token_acc": 0.9629586146169651,
|
|
"train_speed(iter/s)": 0.129517
|
|
},
|
|
{
|
|
"epoch": 2.9633113828786453,
|
|
"grad_norm": 0.7513623237609863,
|
|
"learning_rate": 3.3918611338507046e-09,
|
|
"loss": 0.11406528949737549,
|
|
"memory(GiB)": 31.81,
|
|
"step": 1180,
|
|
"token_acc": 0.9586087420042644,
|
|
"train_speed(iter/s)": 0.129633
|
|
},
|
|
{
|
|
"epoch": 2.9633113828786453,
|
|
"eval_loss": 0.22674556076526642,
|
|
"eval_runtime": 15.3693,
|
|
"eval_samples_per_second": 16.722,
|
|
"eval_steps_per_second": 4.229,
|
|
"eval_token_acc": 0.9282025697580787,
|
|
"step": 1180
|
|
},
|
|
{
|
|
"epoch": 2.9758544998432113,
|
|
"grad_norm": 0.7102883458137512,
|
|
"learning_rate": 1.4018315326103094e-09,
|
|
"loss": 0.10815140008926391,
|
|
"memory(GiB)": 31.81,
|
|
"step": 1185,
|
|
"token_acc": 0.944656259381567,
|
|
"train_speed(iter/s)": 0.129347
|
|
},
|
|
{
|
|
"epoch": 2.988397616807777,
|
|
"grad_norm": 0.7043233513832092,
|
|
"learning_rate": 2.7691537809293454e-10,
|
|
"loss": 0.10755873918533325,
|
|
"memory(GiB)": 31.81,
|
|
"step": 1190,
|
|
"token_acc": 0.9614810470757584,
|
|
"train_speed(iter/s)": 0.129432
|
|
},
|
|
{
|
|
"epoch": 2.9984321103794294,
|
|
"eval_loss": 0.226530522108078,
|
|
"eval_runtime": 15.3991,
|
|
"eval_samples_per_second": 16.689,
|
|
"eval_steps_per_second": 4.221,
|
|
"eval_token_acc": 0.9283601162342892,
|
|
"step": 1194
|
|
}
|
|
],
|
|
"logging_steps": 5,
|
|
"max_steps": 1194,
|
|
"num_input_tokens_seen": 0,
|
|
"num_train_epochs": 3,
|
|
"save_steps": 20,
|
|
"stateful_callbacks": {
|
|
"TrainerControl": {
|
|
"args": {
|
|
"should_epoch_stop": false,
|
|
"should_evaluate": false,
|
|
"should_log": false,
|
|
"should_save": true,
|
|
"should_training_stop": true
|
|
},
|
|
"attributes": {}
|
|
}
|
|
},
|
|
"total_flos": 1.446724275481346e+18,
|
|
"train_batch_size": 1,
|
|
"trial_name": null,
|
|
"trial_params": null
|
|
}
|