Files
qwen2.5vl-3b-32b-random-25767/trainer_state.json
ModelHub XC bce4c10060 初始化项目,由ModelHub XC社区提供模型
Model: waltonfuture/qwen2.5vl-3b-32b-random-25767
Source: Original Platform
2026-08-02 10:31:13 +08:00

2965 lines
84 KiB
JSON

{
"best_global_step": 780,
"best_metric": 0.21140252,
"best_model_checkpoint": "/data/home/scyb089/CODE/scripts/ms-swift/3b-new/v35-20250515-190329/checkpoint-780",
"epoch": 2.9984321103794294,
"eval_steps": 20,
"global_step": 1194,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.002508623392913139,
"grad_norm": 2.42844295501709,
"learning_rate": 9.999982692639099e-06,
"loss": 0.3909474313259125,
"memory(GiB)": 27.73,
"step": 1,
"token_acc": 0.894524376358555,
"train_speed(iter/s)": 0.067547
},
{
"epoch": 0.012543116964565695,
"grad_norm": 1.4327075481414795,
"learning_rate": 9.999567321968297e-06,
"loss": 0.3400489389896393,
"memory(GiB)": 27.77,
"step": 5,
"token_acc": 0.8959139922567434,
"train_speed(iter/s)": 0.120631
},
{
"epoch": 0.02508623392913139,
"grad_norm": 1.0735282897949219,
"learning_rate": 9.998269362757298e-06,
"loss": 0.29977970123291015,
"memory(GiB)": 27.77,
"step": 10,
"token_acc": 0.9025726353513375,
"train_speed(iter/s)": 0.135778
},
{
"epoch": 0.03762935089369708,
"grad_norm": 1.0521410703659058,
"learning_rate": 9.996106347006378e-06,
"loss": 0.29440090656280515,
"memory(GiB)": 27.77,
"step": 15,
"token_acc": 0.9007310504040016,
"train_speed(iter/s)": 0.142102
},
{
"epoch": 0.05017246785826278,
"grad_norm": 0.9543823599815369,
"learning_rate": 9.993078649071297e-06,
"loss": 0.2636571884155273,
"memory(GiB)": 27.77,
"step": 20,
"token_acc": 0.9062953050072488,
"train_speed(iter/s)": 0.1454
},
{
"epoch": 0.05017246785826278,
"eval_loss": 0.2918511629104614,
"eval_runtime": 15.4309,
"eval_samples_per_second": 16.655,
"eval_steps_per_second": 4.212,
"eval_token_acc": 0.9070563316178273,
"step": 20
},
{
"epoch": 0.06271558482282848,
"grad_norm": 0.832170307636261,
"learning_rate": 9.989186792959408e-06,
"loss": 0.2766774892807007,
"memory(GiB)": 27.77,
"step": 25,
"token_acc": 0.906058171787138,
"train_speed(iter/s)": 0.125214
},
{
"epoch": 0.07525870178739416,
"grad_norm": 0.9243336319923401,
"learning_rate": 9.984431452238968e-06,
"loss": 0.2811694383621216,
"memory(GiB)": 27.77,
"step": 30,
"token_acc": 0.903684501937887,
"train_speed(iter/s)": 0.129949
},
{
"epoch": 0.08780181875195986,
"grad_norm": 0.8159760236740112,
"learning_rate": 9.97881344992256e-06,
"loss": 0.27519750595092773,
"memory(GiB)": 27.77,
"step": 35,
"token_acc": 0.9162855786290827,
"train_speed(iter/s)": 0.1336
},
{
"epoch": 0.10034493571652556,
"grad_norm": 0.7792373895645142,
"learning_rate": 9.97233375832466e-06,
"loss": 0.2597078561782837,
"memory(GiB)": 29.52,
"step": 40,
"token_acc": 0.9129214970091578,
"train_speed(iter/s)": 0.136712
},
{
"epoch": 0.10034493571652556,
"eval_loss": 0.2732233703136444,
"eval_runtime": 15.3078,
"eval_samples_per_second": 16.789,
"eval_steps_per_second": 4.246,
"eval_token_acc": 0.9114851381157442,
"step": 40
},
{
"epoch": 0.11288805268109126,
"grad_norm": 0.8562310934066772,
"learning_rate": 9.964993498893349e-06,
"loss": 0.2654439449310303,
"memory(GiB)": 29.52,
"step": 45,
"token_acc": 0.9112415484062709,
"train_speed(iter/s)": 0.12778
},
{
"epoch": 0.12543116964565695,
"grad_norm": 0.6892139911651611,
"learning_rate": 9.95679394201623e-06,
"loss": 0.2535998821258545,
"memory(GiB)": 29.52,
"step": 50,
"token_acc": 0.9140140785820456,
"train_speed(iter/s)": 0.129639
},
{
"epoch": 0.13797428661022265,
"grad_norm": 0.7636090517044067,
"learning_rate": 9.947736506800554e-06,
"loss": 0.25037508010864257,
"memory(GiB)": 29.52,
"step": 55,
"token_acc": 0.9177434445090652,
"train_speed(iter/s)": 0.131231
},
{
"epoch": 0.15051740357478832,
"grad_norm": 0.8940523862838745,
"learning_rate": 9.93782276082762e-06,
"loss": 0.266965389251709,
"memory(GiB)": 29.52,
"step": 60,
"token_acc": 0.9066724143239832,
"train_speed(iter/s)": 0.13265
},
{
"epoch": 0.15051740357478832,
"eval_loss": 0.2631765604019165,
"eval_runtime": 15.3396,
"eval_samples_per_second": 16.754,
"eval_steps_per_second": 4.237,
"eval_token_acc": 0.9138133249308547,
"step": 60
},
{
"epoch": 0.16306052053935402,
"grad_norm": 0.7258597016334534,
"learning_rate": 9.927054419881462e-06,
"loss": 0.26306581497192383,
"memory(GiB)": 29.52,
"step": 65,
"token_acc": 0.909740298154283,
"train_speed(iter/s)": 0.127128
},
{
"epoch": 0.17560363750391972,
"grad_norm": 0.7783539891242981,
"learning_rate": 9.915433347651909e-06,
"loss": 0.25382609367370607,
"memory(GiB)": 29.52,
"step": 70,
"token_acc": 0.9123886777468944,
"train_speed(iter/s)": 0.1281
},
{
"epoch": 0.18814675446848542,
"grad_norm": 1.1043397188186646,
"learning_rate": 9.90296155541202e-06,
"loss": 0.23381214141845702,
"memory(GiB)": 29.52,
"step": 75,
"token_acc": 0.9195295753432594,
"train_speed(iter/s)": 0.129783
},
{
"epoch": 0.20068987143305111,
"grad_norm": 0.7191760540008545,
"learning_rate": 9.88964120167001e-06,
"loss": 0.24255027770996093,
"memory(GiB)": 29.52,
"step": 80,
"token_acc": 0.9175339800100245,
"train_speed(iter/s)": 0.130834
},
{
"epoch": 0.20068987143305111,
"eval_loss": 0.2570763826370239,
"eval_runtime": 15.3498,
"eval_samples_per_second": 16.743,
"eval_steps_per_second": 4.235,
"eval_token_acc": 0.9149861709204216,
"step": 80
},
{
"epoch": 0.2132329883976168,
"grad_norm": 0.8330841660499573,
"learning_rate": 9.875474591795648e-06,
"loss": 0.25277366638183596,
"memory(GiB)": 29.52,
"step": 85,
"token_acc": 0.9098456609469825,
"train_speed(iter/s)": 0.126852
},
{
"epoch": 0.2257761053621825,
"grad_norm": 0.8644626140594482,
"learning_rate": 9.860464177621286e-06,
"loss": 0.24066619873046874,
"memory(GiB)": 29.52,
"step": 90,
"token_acc": 0.916673759468891,
"train_speed(iter/s)": 0.128058
},
{
"epoch": 0.2383192223267482,
"grad_norm": 0.7505571246147156,
"learning_rate": 9.84461255701751e-06,
"loss": 0.23320527076721193,
"memory(GiB)": 29.52,
"step": 95,
"token_acc": 0.9196099359596351,
"train_speed(iter/s)": 0.129334
},
{
"epoch": 0.2508623392913139,
"grad_norm": 0.7608115673065186,
"learning_rate": 9.827922473443518e-06,
"loss": 0.24348812103271483,
"memory(GiB)": 29.52,
"step": 100,
"token_acc": 0.9140099444281954,
"train_speed(iter/s)": 0.130537
},
{
"epoch": 0.2508623392913139,
"eval_loss": 0.25154590606689453,
"eval_runtime": 15.3221,
"eval_samples_per_second": 16.773,
"eval_steps_per_second": 4.242,
"eval_token_acc": 0.9158176662115324,
"step": 100
},
{
"epoch": 0.2634054562558796,
"grad_norm": 0.7926483154296875,
"learning_rate": 9.810396815472316e-06,
"loss": 0.23999102115631105,
"memory(GiB)": 29.52,
"step": 105,
"token_acc": 0.9220618814590141,
"train_speed(iter/s)": 0.127275
},
{
"epoch": 0.2759485732204453,
"grad_norm": 0.9673748016357422,
"learning_rate": 9.79203861629078e-06,
"loss": 0.23904500007629395,
"memory(GiB)": 29.52,
"step": 110,
"token_acc": 0.9187058260355363,
"train_speed(iter/s)": 0.128262
},
{
"epoch": 0.288491690185011,
"grad_norm": 0.7872106432914734,
"learning_rate": 9.772851053174708e-06,
"loss": 0.26188173294067385,
"memory(GiB)": 29.52,
"step": 115,
"token_acc": 0.9111253401632784,
"train_speed(iter/s)": 0.129
},
{
"epoch": 0.30103480714957664,
"grad_norm": 0.7694645524024963,
"learning_rate": 9.752837446938915e-06,
"loss": 0.24416761398315429,
"memory(GiB)": 29.52,
"step": 120,
"token_acc": 0.9147327249022165,
"train_speed(iter/s)": 0.130005
},
{
"epoch": 0.30103480714957664,
"eval_loss": 0.24855056405067444,
"eval_runtime": 15.3887,
"eval_samples_per_second": 16.701,
"eval_steps_per_second": 4.224,
"eval_token_acc": 0.9167979553968421,
"step": 120
},
{
"epoch": 0.31357792411414237,
"grad_norm": 0.7051243185997009,
"learning_rate": 9.732001261362503e-06,
"loss": 0.23072781562805175,
"memory(GiB)": 29.52,
"step": 125,
"token_acc": 0.9187640553279319,
"train_speed(iter/s)": 0.127297
},
{
"epoch": 0.32612104107870804,
"grad_norm": 0.803512454032898,
"learning_rate": 9.710346102589376e-06,
"loss": 0.25793311595916746,
"memory(GiB)": 29.52,
"step": 130,
"token_acc": 0.9111067822473297,
"train_speed(iter/s)": 0.12833
},
{
"epoch": 0.33866415804327377,
"grad_norm": 0.7955958247184753,
"learning_rate": 9.687875718504126e-06,
"loss": 0.24592311382293702,
"memory(GiB)": 29.52,
"step": 135,
"token_acc": 0.9190104465618184,
"train_speed(iter/s)": 0.129138
},
{
"epoch": 0.35120727500783944,
"grad_norm": 0.678006112575531,
"learning_rate": 9.664593998083374e-06,
"loss": 0.22953214645385742,
"memory(GiB)": 29.52,
"step": 140,
"token_acc": 0.9226280527339529,
"train_speed(iter/s)": 0.129642
},
{
"epoch": 0.35120727500783944,
"eval_loss": 0.24559736251831055,
"eval_runtime": 15.3298,
"eval_samples_per_second": 16.765,
"eval_steps_per_second": 4.24,
"eval_token_acc": 0.9174456464657074,
"step": 140
},
{
"epoch": 0.36375039197240516,
"grad_norm": 0.7531142830848694,
"learning_rate": 9.640504970722708e-06,
"loss": 0.23890395164489747,
"memory(GiB)": 29.52,
"step": 145,
"token_acc": 0.9222668078822143,
"train_speed(iter/s)": 0.12752
},
{
"epoch": 0.37629350893697083,
"grad_norm": 0.8114349842071533,
"learning_rate": 9.615612805539305e-06,
"loss": 0.23889353275299072,
"memory(GiB)": 29.52,
"step": 150,
"token_acc": 0.9085244337160019,
"train_speed(iter/s)": 0.128096
},
{
"epoch": 0.38883662590153656,
"grad_norm": 0.7049622535705566,
"learning_rate": 9.589921810650379e-06,
"loss": 0.232946515083313,
"memory(GiB)": 29.52,
"step": 155,
"token_acc": 0.9203438851593387,
"train_speed(iter/s)": 0.128953
},
{
"epoch": 0.40137974286610223,
"grad_norm": 0.7752684354782104,
"learning_rate": 9.563436432427571e-06,
"loss": 0.23360769748687743,
"memory(GiB)": 29.52,
"step": 160,
"token_acc": 0.9222483562302881,
"train_speed(iter/s)": 0.129792
},
{
"epoch": 0.40137974286610223,
"eval_loss": 0.24146369099617004,
"eval_runtime": 15.3815,
"eval_samples_per_second": 16.708,
"eval_steps_per_second": 4.226,
"eval_token_acc": 0.9184959563071106,
"step": 160
},
{
"epoch": 0.4139228598306679,
"grad_norm": 0.7400842308998108,
"learning_rate": 9.536161254727407e-06,
"loss": 0.2393019676208496,
"memory(GiB)": 29.52,
"step": 165,
"token_acc": 0.9168263867036645,
"train_speed(iter/s)": 0.127877
},
{
"epoch": 0.4264659767952336,
"grad_norm": 0.7236588597297668,
"learning_rate": 9.508100998097971e-06,
"loss": 0.2513608455657959,
"memory(GiB)": 29.52,
"step": 170,
"token_acc": 0.9139457376451596,
"train_speed(iter/s)": 0.128605
},
{
"epoch": 0.4390090937597993,
"grad_norm": 0.8037694692611694,
"learning_rate": 9.479260518961904e-06,
"loss": 0.2478844165802002,
"memory(GiB)": 29.52,
"step": 175,
"token_acc": 0.9115485013051696,
"train_speed(iter/s)": 0.129344
},
{
"epoch": 0.451552210724365,
"grad_norm": 0.9048113822937012,
"learning_rate": 9.449644808775902e-06,
"loss": 0.23607170581817627,
"memory(GiB)": 29.52,
"step": 180,
"token_acc": 0.9241437498352097,
"train_speed(iter/s)": 0.130046
},
{
"epoch": 0.451552210724365,
"eval_loss": 0.2386324554681778,
"eval_runtime": 15.3252,
"eval_samples_per_second": 16.77,
"eval_steps_per_second": 4.241,
"eval_token_acc": 0.9196863074607009,
"step": 180
},
{
"epoch": 0.4640953276889307,
"grad_norm": 0.7141282558441162,
"learning_rate": 9.419258993166846e-06,
"loss": 0.20708115100860597,
"memory(GiB)": 29.52,
"step": 185,
"token_acc": 0.9238369894099848,
"train_speed(iter/s)": 0.128063
},
{
"epoch": 0.4766384446534964,
"grad_norm": 0.7230116724967957,
"learning_rate": 9.388108331044687e-06,
"loss": 0.23321809768676757,
"memory(GiB)": 29.52,
"step": 190,
"token_acc": 0.9096602473774855,
"train_speed(iter/s)": 0.128687
},
{
"epoch": 0.4891815616180621,
"grad_norm": 0.7285059094429016,
"learning_rate": 9.356198213692297e-06,
"loss": 0.23624110221862793,
"memory(GiB)": 29.52,
"step": 195,
"token_acc": 0.920982395600248,
"train_speed(iter/s)": 0.129409
},
{
"epoch": 0.5017246785826278,
"grad_norm": 0.7466290593147278,
"learning_rate": 9.323534163832387e-06,
"loss": 0.24186329841613768,
"memory(GiB)": 29.52,
"step": 200,
"token_acc": 0.9228281640452741,
"train_speed(iter/s)": 0.129868
},
{
"epoch": 0.5017246785826278,
"eval_loss": 0.23571519553661346,
"eval_runtime": 15.3374,
"eval_samples_per_second": 16.756,
"eval_steps_per_second": 4.238,
"eval_token_acc": 0.9199576375030634,
"step": 200
},
{
"epoch": 0.5142677955471935,
"grad_norm": 0.7634557485580444,
"learning_rate": 9.290121834671669e-06,
"loss": 0.21729581356048583,
"memory(GiB)": 29.52,
"step": 205,
"token_acc": 0.9223603414707204,
"train_speed(iter/s)": 0.128301
},
{
"epoch": 0.5268109125117592,
"grad_norm": 0.7724491357803345,
"learning_rate": 9.255967008922475e-06,
"loss": 0.2301187515258789,
"memory(GiB)": 29.52,
"step": 210,
"token_acc": 0.9205742490820442,
"train_speed(iter/s)": 0.128765
},
{
"epoch": 0.5393540294763248,
"grad_norm": 0.7458897233009338,
"learning_rate": 9.221075597801912e-06,
"loss": 0.232729172706604,
"memory(GiB)": 29.52,
"step": 215,
"token_acc": 0.9231800040784223,
"train_speed(iter/s)": 0.129189
},
{
"epoch": 0.5518971464408906,
"grad_norm": 0.7217942476272583,
"learning_rate": 9.18545364000882e-06,
"loss": 0.2349705934524536,
"memory(GiB)": 29.52,
"step": 220,
"token_acc": 0.928037487448399,
"train_speed(iter/s)": 0.1297
},
{
"epoch": 0.5518971464408906,
"eval_loss": 0.2342594563961029,
"eval_runtime": 15.3349,
"eval_samples_per_second": 16.759,
"eval_steps_per_second": 4.239,
"eval_token_acc": 0.9202202149634142,
"step": 220
},
{
"epoch": 0.5644402634054563,
"grad_norm": 0.7608616352081299,
"learning_rate": 9.14910730067863e-06,
"loss": 0.21356439590454102,
"memory(GiB)": 29.52,
"step": 225,
"token_acc": 0.9212297890244635,
"train_speed(iter/s)": 0.128148
},
{
"epoch": 0.576983380370022,
"grad_norm": 0.8077455759048462,
"learning_rate": 9.112042870316365e-06,
"loss": 0.2328458309173584,
"memory(GiB)": 29.52,
"step": 230,
"token_acc": 0.9207193449011296,
"train_speed(iter/s)": 0.128672
},
{
"epoch": 0.5895264973345876,
"grad_norm": 0.7404952049255371,
"learning_rate": 9.074266763707937e-06,
"loss": 0.22884457111358641,
"memory(GiB)": 29.52,
"step": 235,
"token_acc": 0.9248362445414847,
"train_speed(iter/s)": 0.129176
},
{
"epoch": 0.6020696142991533,
"grad_norm": 0.7511395215988159,
"learning_rate": 9.035785518809928e-06,
"loss": 0.2402876615524292,
"memory(GiB)": 29.52,
"step": 240,
"token_acc": 0.9122142796598197,
"train_speed(iter/s)": 0.129623
},
{
"epoch": 0.6020696142991533,
"eval_loss": 0.23062308132648468,
"eval_runtime": 15.3592,
"eval_samples_per_second": 16.733,
"eval_steps_per_second": 4.232,
"eval_token_acc": 0.9214718341910864,
"step": 240
},
{
"epoch": 0.6146127312637191,
"grad_norm": 0.7077146172523499,
"learning_rate": 8.996605795618054e-06,
"loss": 0.23445332050323486,
"memory(GiB)": 29.52,
"step": 245,
"token_acc": 0.9197372222813607,
"train_speed(iter/s)": 0.128267
},
{
"epoch": 0.6271558482282847,
"grad_norm": 0.7274831533432007,
"learning_rate": 8.956734375014525e-06,
"loss": 0.23018431663513184,
"memory(GiB)": 29.52,
"step": 250,
"token_acc": 0.9160428120247982,
"train_speed(iter/s)": 0.128573
},
{
"epoch": 0.6396989651928504,
"grad_norm": 0.80959552526474,
"learning_rate": 8.916178157594453e-06,
"loss": 0.23876335620880126,
"memory(GiB)": 29.52,
"step": 255,
"token_acc": 0.9136212624584718,
"train_speed(iter/s)": 0.129029
},
{
"epoch": 0.6522420821574161,
"grad_norm": 0.712291955947876,
"learning_rate": 8.87494416247157e-06,
"loss": 0.22411136627197265,
"memory(GiB)": 29.52,
"step": 260,
"token_acc": 0.9208987563444243,
"train_speed(iter/s)": 0.129407
},
{
"epoch": 0.6522420821574161,
"eval_loss": 0.22862213850021362,
"eval_runtime": 15.3722,
"eval_samples_per_second": 16.718,
"eval_steps_per_second": 4.228,
"eval_token_acc": 0.9216206280852851,
"step": 260
},
{
"epoch": 0.6647851991219819,
"grad_norm": 0.7888270616531372,
"learning_rate": 8.833039526063414e-06,
"loss": 0.2441627025604248,
"memory(GiB)": 29.52,
"step": 265,
"token_acc": 0.9171242536081855,
"train_speed(iter/s)": 0.128365
},
{
"epoch": 0.6773283160865475,
"grad_norm": 0.7412445545196533,
"learning_rate": 8.790471500856229e-06,
"loss": 0.22171931266784667,
"memory(GiB)": 29.52,
"step": 270,
"token_acc": 0.9284303020849581,
"train_speed(iter/s)": 0.128765
},
{
"epoch": 0.6898714330511132,
"grad_norm": 0.7740799784660339,
"learning_rate": 8.747247454149754e-06,
"loss": 0.22348260879516602,
"memory(GiB)": 29.52,
"step": 275,
"token_acc": 0.9197459900366781,
"train_speed(iter/s)": 0.129119
},
{
"epoch": 0.7024145500156789,
"grad_norm": 0.7354733943939209,
"learning_rate": 8.703374866782172e-06,
"loss": 0.22540512084960937,
"memory(GiB)": 29.52,
"step": 280,
"token_acc": 0.9234182832509192,
"train_speed(iter/s)": 0.129642
},
{
"epoch": 0.7024145500156789,
"eval_loss": 0.2274494767189026,
"eval_runtime": 15.3359,
"eval_samples_per_second": 16.758,
"eval_steps_per_second": 4.238,
"eval_token_acc": 0.9218744529636242,
"step": 280
},
{
"epoch": 0.7149576669802445,
"grad_norm": 0.7532041072845459,
"learning_rate": 8.658861331835384e-06,
"loss": 0.23445098400115966,
"memory(GiB)": 29.52,
"step": 285,
"token_acc": 0.9171991760513615,
"train_speed(iter/s)": 0.128533
},
{
"epoch": 0.7275007839448103,
"grad_norm": 0.7499911189079285,
"learning_rate": 8.613714553320863e-06,
"loss": 0.2278836727142334,
"memory(GiB)": 29.52,
"step": 290,
"token_acc": 0.9228026662532941,
"train_speed(iter/s)": 0.128913
},
{
"epoch": 0.740043900909376,
"grad_norm": 0.6617085337638855,
"learning_rate": 8.567942344846311e-06,
"loss": 0.2379608631134033,
"memory(GiB)": 31.81,
"step": 295,
"token_acc": 0.927406815051757,
"train_speed(iter/s)": 0.129437
},
{
"epoch": 0.7525870178739417,
"grad_norm": 0.7833521366119385,
"learning_rate": 8.521552628263362e-06,
"loss": 0.22896957397460938,
"memory(GiB)": 31.81,
"step": 300,
"token_acc": 0.9195584489102746,
"train_speed(iter/s)": 0.129723
},
{
"epoch": 0.7525870178739417,
"eval_loss": 0.22518841922283173,
"eval_runtime": 15.3817,
"eval_samples_per_second": 16.708,
"eval_steps_per_second": 4.226,
"eval_token_acc": 0.9226796905087,
"step": 300
},
{
"epoch": 0.7651301348385073,
"grad_norm": 0.6266347169876099,
"learning_rate": 8.474553432296517e-06,
"loss": 0.2120736598968506,
"memory(GiB)": 31.81,
"step": 305,
"token_acc": 0.919751809720786,
"train_speed(iter/s)": 0.12866
},
{
"epoch": 0.7776732518030731,
"grad_norm": 0.7510045170783997,
"learning_rate": 8.426952891153617e-06,
"loss": 0.22617723941802978,
"memory(GiB)": 31.81,
"step": 310,
"token_acc": 0.9176977822402032,
"train_speed(iter/s)": 0.12898
},
{
"epoch": 0.7902163687676388,
"grad_norm": 0.7557322978973389,
"learning_rate": 8.378759243118044e-06,
"loss": 0.2307964563369751,
"memory(GiB)": 31.81,
"step": 315,
"token_acc": 0.9214413607878246,
"train_speed(iter/s)": 0.129388
},
{
"epoch": 0.8027594857322045,
"grad_norm": 0.802083432674408,
"learning_rate": 8.329980829122907e-06,
"loss": 0.23063960075378417,
"memory(GiB)": 31.81,
"step": 320,
"token_acc": 0.9320303956481507,
"train_speed(iter/s)": 0.129686
},
{
"epoch": 0.8027594857322045,
"eval_loss": 0.22348652780056,
"eval_runtime": 15.4058,
"eval_samples_per_second": 16.682,
"eval_steps_per_second": 4.219,
"eval_token_acc": 0.9227497111647937,
"step": 320
},
{
"epoch": 0.8153026026967701,
"grad_norm": 0.7171165943145752,
"learning_rate": 8.280626091307466e-06,
"loss": 0.22461018562316895,
"memory(GiB)": 31.81,
"step": 325,
"token_acc": 0.9275779995411791,
"train_speed(iter/s)": 0.128615
},
{
"epoch": 0.8278457196613358,
"grad_norm": 0.68876051902771,
"learning_rate": 8.23070357155605e-06,
"loss": 0.2177454948425293,
"memory(GiB)": 31.81,
"step": 330,
"token_acc": 0.9271033235989431,
"train_speed(iter/s)": 0.128983
},
{
"epoch": 0.8403888366259016,
"grad_norm": 0.6879884600639343,
"learning_rate": 8.18022191001969e-06,
"loss": 0.22483336925506592,
"memory(GiB)": 31.81,
"step": 335,
"token_acc": 0.9234863606121091,
"train_speed(iter/s)": 0.129291
},
{
"epoch": 0.8529319535904673,
"grad_norm": 0.7674379348754883,
"learning_rate": 8.129189843620766e-06,
"loss": 0.23122897148132324,
"memory(GiB)": 31.81,
"step": 340,
"token_acc": 0.920080478399374,
"train_speed(iter/s)": 0.129653
},
{
"epoch": 0.8529319535904673,
"eval_loss": 0.2233850359916687,
"eval_runtime": 15.3643,
"eval_samples_per_second": 16.727,
"eval_steps_per_second": 4.231,
"eval_token_acc": 0.9229860308791094,
"step": 340
},
{
"epoch": 0.8654750705550329,
"grad_norm": 0.7207924723625183,
"learning_rate": 8.077616204540897e-06,
"loss": 0.21113083362579346,
"memory(GiB)": 31.81,
"step": 345,
"token_acc": 0.9231676937196801,
"train_speed(iter/s)": 0.128783
},
{
"epoch": 0.8780181875195986,
"grad_norm": 0.720832109451294,
"learning_rate": 8.02550991869234e-06,
"loss": 0.22612943649291992,
"memory(GiB)": 31.81,
"step": 350,
"token_acc": 0.9200727685110807,
"train_speed(iter/s)": 0.129034
},
{
"epoch": 0.8905613044841643,
"grad_norm": 0.70830237865448,
"learning_rate": 7.972880004173175e-06,
"loss": 0.2191091537475586,
"memory(GiB)": 31.81,
"step": 355,
"token_acc": 0.92017787659811,
"train_speed(iter/s)": 0.129291
},
{
"epoch": 0.90310442144873,
"grad_norm": 0.7826217412948608,
"learning_rate": 7.919735569706533e-06,
"loss": 0.23212652206420897,
"memory(GiB)": 31.81,
"step": 360,
"token_acc": 0.9170923379174852,
"train_speed(iter/s)": 0.129652
},
{
"epoch": 0.90310442144873,
"eval_loss": 0.22133058309555054,
"eval_runtime": 15.4085,
"eval_samples_per_second": 16.679,
"eval_steps_per_second": 4.218,
"eval_token_acc": 0.9237912684241851,
"step": 360
},
{
"epoch": 0.9156475384132957,
"grad_norm": 0.7471039295196533,
"learning_rate": 7.86608581306413e-06,
"loss": 0.22391505241394044,
"memory(GiB)": 31.81,
"step": 365,
"token_acc": 0.9232560554146457,
"train_speed(iter/s)": 0.128776
},
{
"epoch": 0.9281906553778614,
"grad_norm": 0.7498065233230591,
"learning_rate": 7.811940019474414e-06,
"loss": 0.21148476600646973,
"memory(GiB)": 31.81,
"step": 370,
"token_acc": 0.9247934832491969,
"train_speed(iter/s)": 0.129029
},
{
"epoch": 0.940733772342427,
"grad_norm": 0.7913779616355896,
"learning_rate": 7.757307560015539e-06,
"loss": 0.2337519645690918,
"memory(GiB)": 31.81,
"step": 375,
"token_acc": 0.9195318016403237,
"train_speed(iter/s)": 0.129291
},
{
"epoch": 0.9532768893069928,
"grad_norm": 0.7540809512138367,
"learning_rate": 7.702197889993515e-06,
"loss": 0.22583358287811278,
"memory(GiB)": 31.81,
"step": 380,
"token_acc": 0.912510441085334,
"train_speed(iter/s)": 0.129502
},
{
"epoch": 0.9532768893069928,
"eval_loss": 0.22044962644577026,
"eval_runtime": 15.3936,
"eval_samples_per_second": 16.695,
"eval_steps_per_second": 4.223,
"eval_token_acc": 0.9241851346147113,
"step": 380
},
{
"epoch": 0.9658200062715585,
"grad_norm": 0.6508920192718506,
"learning_rate": 7.646620547305765e-06,
"loss": 0.21882102489471436,
"memory(GiB)": 31.81,
"step": 385,
"token_acc": 0.929311731244602,
"train_speed(iter/s)": 0.128683
},
{
"epoch": 0.9783631232361242,
"grad_norm": 0.724659264087677,
"learning_rate": 7.590585150790388e-06,
"loss": 0.22737913131713866,
"memory(GiB)": 31.81,
"step": 390,
"token_acc": 0.9233074204946996,
"train_speed(iter/s)": 0.128946
},
{
"epoch": 0.9909062402006898,
"grad_norm": 0.7416620254516602,
"learning_rate": 7.5341013985614064e-06,
"loss": 0.21617236137390136,
"memory(GiB)": 31.81,
"step": 395,
"token_acc": 0.9227556855964889,
"train_speed(iter/s)": 0.129211
},
{
"epoch": 1.0050172467858263,
"grad_norm": 0.7598711252212524,
"learning_rate": 7.47717906633032e-06,
"loss": 0.24872393608093263,
"memory(GiB)": 31.81,
"step": 400,
"token_acc": 0.9263680772819584,
"train_speed(iter/s)": 0.129375
},
{
"epoch": 1.0050172467858263,
"eval_loss": 0.21866728365421295,
"eval_runtime": 15.3428,
"eval_samples_per_second": 16.75,
"eval_steps_per_second": 4.237,
"eval_token_acc": 0.9249028463396702,
"step": 400
},
{
"epoch": 1.017560363750392,
"grad_norm": 0.7288981676101685,
"learning_rate": 7.419828005714195e-06,
"loss": 0.15233672857284547,
"memory(GiB)": 31.81,
"step": 405,
"token_acc": 0.9344547117883116,
"train_speed(iter/s)": 0.128614
},
{
"epoch": 1.0301034807149576,
"grad_norm": 0.7562277317047119,
"learning_rate": 7.362058142530639e-06,
"loss": 0.15367655754089354,
"memory(GiB)": 31.81,
"step": 410,
"token_acc": 0.9494212236984662,
"train_speed(iter/s)": 0.128849
},
{
"epoch": 1.0426465976795234,
"grad_norm": 0.6314442753791809,
"learning_rate": 7.303879475079931e-06,
"loss": 0.16216965913772582,
"memory(GiB)": 31.81,
"step": 415,
"token_acc": 0.9469148079746176,
"train_speed(iter/s)": 0.129162
},
{
"epoch": 1.055189714644089,
"grad_norm": 0.78495854139328,
"learning_rate": 7.245302072414602e-06,
"loss": 0.1717313528060913,
"memory(GiB)": 31.81,
"step": 420,
"token_acc": 0.9351895455615729,
"train_speed(iter/s)": 0.129404
},
{
"epoch": 1.055189714644089,
"eval_loss": 0.22395090758800507,
"eval_runtime": 15.3916,
"eval_samples_per_second": 16.697,
"eval_steps_per_second": 4.223,
"eval_token_acc": 0.9238000210061968,
"step": 420
},
{
"epoch": 1.0677328316086547,
"grad_norm": 0.6953550577163696,
"learning_rate": 7.1863360725967615e-06,
"loss": 0.1437358021736145,
"memory(GiB)": 31.81,
"step": 425,
"token_acc": 0.9337246309594255,
"train_speed(iter/s)": 0.128699
},
{
"epoch": 1.0802759485732205,
"grad_norm": 0.6609600186347961,
"learning_rate": 7.126991680943508e-06,
"loss": 0.15338196754455566,
"memory(GiB)": 31.81,
"step": 430,
"token_acc": 0.945504234651081,
"train_speed(iter/s)": 0.12898
},
{
"epoch": 1.092819065537786,
"grad_norm": 0.7515889406204224,
"learning_rate": 7.067279168260671e-06,
"loss": 0.1485868811607361,
"memory(GiB)": 31.81,
"step": 435,
"token_acc": 0.949219850166169,
"train_speed(iter/s)": 0.129246
},
{
"epoch": 1.1053621825023519,
"grad_norm": 0.6615680456161499,
"learning_rate": 7.007208869065232e-06,
"loss": 0.15130412578582764,
"memory(GiB)": 31.81,
"step": 440,
"token_acc": 0.9493087557603687,
"train_speed(iter/s)": 0.129455
},
{
"epoch": 1.1053621825023519,
"eval_loss": 0.2233077436685562,
"eval_runtime": 15.3696,
"eval_samples_per_second": 16.721,
"eval_steps_per_second": 4.229,
"eval_token_acc": 0.9245002275671323,
"step": 440
},
{
"epoch": 1.1179052994669174,
"grad_norm": 0.7569933533668518,
"learning_rate": 6.946791179796718e-06,
"loss": 0.15562827587127687,
"memory(GiB)": 31.81,
"step": 445,
"token_acc": 0.9341226472374013,
"train_speed(iter/s)": 0.12878
},
{
"epoch": 1.1304484164314832,
"grad_norm": 0.6801967024803162,
"learning_rate": 6.886036557017881e-06,
"loss": 0.15977808237075805,
"memory(GiB)": 31.81,
"step": 450,
"token_acc": 0.9431299171995168,
"train_speed(iter/s)": 0.129107
},
{
"epoch": 1.142991533396049,
"grad_norm": 0.7558472752571106,
"learning_rate": 6.824955515604957e-06,
"loss": 0.16626831293106079,
"memory(GiB)": 31.81,
"step": 455,
"token_acc": 0.9411939411939412,
"train_speed(iter/s)": 0.129394
},
{
"epoch": 1.1555346503606145,
"grad_norm": 0.7011389136314392,
"learning_rate": 6.76355862692786e-06,
"loss": 0.16757216453552246,
"memory(GiB)": 31.81,
"step": 460,
"token_acc": 0.9417196619914626,
"train_speed(iter/s)": 0.129606
},
{
"epoch": 1.1555346503606145,
"eval_loss": 0.22205203771591187,
"eval_runtime": 15.3552,
"eval_samples_per_second": 16.737,
"eval_steps_per_second": 4.233,
"eval_token_acc": 0.9254892693344536,
"step": 460
},
{
"epoch": 1.1680777673251803,
"grad_norm": 0.8131189942359924,
"learning_rate": 6.701856517020565e-06,
"loss": 0.1730912446975708,
"memory(GiB)": 31.81,
"step": 465,
"token_acc": 0.9293166877751643,
"train_speed(iter/s)": 0.128975
},
{
"epoch": 1.180620884289746,
"grad_norm": 0.6982389092445374,
"learning_rate": 6.639859864742058e-06,
"loss": 0.16429152488708496,
"memory(GiB)": 31.81,
"step": 470,
"token_acc": 0.9323867882229862,
"train_speed(iter/s)": 0.129168
},
{
"epoch": 1.1931640012543117,
"grad_norm": 0.7796806693077087,
"learning_rate": 6.5775793999281345e-06,
"loss": 0.16015057563781737,
"memory(GiB)": 31.81,
"step": 475,
"token_acc": 0.9489819908778859,
"train_speed(iter/s)": 0.129368
},
{
"epoch": 1.2057071182188774,
"grad_norm": 0.7008464336395264,
"learning_rate": 6.515025901534364e-06,
"loss": 0.15645363330841064,
"memory(GiB)": 31.81,
"step": 480,
"token_acc": 0.9448942141623489,
"train_speed(iter/s)": 0.129561
},
{
"epoch": 1.2057071182188774,
"eval_loss": 0.2242305725812912,
"eval_runtime": 15.3471,
"eval_samples_per_second": 16.746,
"eval_steps_per_second": 4.235,
"eval_token_acc": 0.9244127017470154,
"step": 480
},
{
"epoch": 1.218250235183443,
"grad_norm": 0.7552674412727356,
"learning_rate": 6.452210195770571e-06,
"loss": 0.1517507791519165,
"memory(GiB)": 31.81,
"step": 485,
"token_acc": 0.9361768149057109,
"train_speed(iter/s)": 0.128932
},
{
"epoch": 1.2307933521480088,
"grad_norm": 0.7274335622787476,
"learning_rate": 6.389143154227128e-06,
"loss": 0.16204409599304198,
"memory(GiB)": 31.81,
"step": 490,
"token_acc": 0.9486543909348442,
"train_speed(iter/s)": 0.129125
},
{
"epoch": 1.2433364691125746,
"grad_norm": 0.748831570148468,
"learning_rate": 6.325835691993394e-06,
"loss": 0.15379858016967773,
"memory(GiB)": 31.81,
"step": 495,
"token_acc": 0.9465945037564255,
"train_speed(iter/s)": 0.129385
},
{
"epoch": 1.2558795860771401,
"grad_norm": 0.893355667591095,
"learning_rate": 6.2622987657686305e-06,
"loss": 0.1658052921295166,
"memory(GiB)": 31.81,
"step": 500,
"token_acc": 0.947743023038022,
"train_speed(iter/s)": 0.129623
},
{
"epoch": 1.2558795860771401,
"eval_loss": 0.22251112759113312,
"eval_runtime": 15.3679,
"eval_samples_per_second": 16.723,
"eval_steps_per_second": 4.23,
"eval_token_acc": 0.9248678360116235,
"step": 500
},
{
"epoch": 1.268422703041706,
"grad_norm": 0.7303951978683472,
"learning_rate": 6.198543371965711e-06,
"loss": 0.16348928213119507,
"memory(GiB)": 31.81,
"step": 505,
"token_acc": 0.9349806335063304,
"train_speed(iter/s)": 0.129005
},
{
"epoch": 1.2809658200062715,
"grad_norm": 0.8302243947982788,
"learning_rate": 6.134580544807951e-06,
"loss": 0.1597007393836975,
"memory(GiB)": 31.81,
"step": 510,
"token_acc": 0.9454098648411444,
"train_speed(iter/s)": 0.129135
},
{
"epoch": 1.2935089369708372,
"grad_norm": 0.7296594381332397,
"learning_rate": 6.070421354419418e-06,
"loss": 0.16336345672607422,
"memory(GiB)": 31.81,
"step": 515,
"token_acc": 0.9398956481184598,
"train_speed(iter/s)": 0.129324
},
{
"epoch": 1.306052053935403,
"grad_norm": 0.7305130958557129,
"learning_rate": 6.006076904908996e-06,
"loss": 0.15892908573150635,
"memory(GiB)": 31.81,
"step": 520,
"token_acc": 0.9507138423339541,
"train_speed(iter/s)": 0.129551
},
{
"epoch": 1.306052053935403,
"eval_loss": 0.22138828039169312,
"eval_runtime": 15.3657,
"eval_samples_per_second": 16.726,
"eval_steps_per_second": 4.23,
"eval_token_acc": 0.9247190421174246,
"step": 520
},
{
"epoch": 1.3185951708999686,
"grad_norm": 0.7403632998466492,
"learning_rate": 5.9415583324485895e-06,
"loss": 0.16314858198165894,
"memory(GiB)": 31.81,
"step": 525,
"token_acc": 0.931472803221991,
"train_speed(iter/s)": 0.129018
},
{
"epoch": 1.3311382878645344,
"grad_norm": 0.7020546793937683,
"learning_rate": 5.876876803345777e-06,
"loss": 0.15857114791870117,
"memory(GiB)": 31.81,
"step": 530,
"token_acc": 0.9462052151791392,
"train_speed(iter/s)": 0.129237
},
{
"epoch": 1.3436814048291001,
"grad_norm": 0.6946777701377869,
"learning_rate": 5.812043512111237e-06,
"loss": 0.16228172779083253,
"memory(GiB)": 31.81,
"step": 535,
"token_acc": 0.9411285875587533,
"train_speed(iter/s)": 0.129436
},
{
"epoch": 1.3562245217936657,
"grad_norm": 0.711567223072052,
"learning_rate": 5.747069679521306e-06,
"loss": 0.16026302576065063,
"memory(GiB)": 31.81,
"step": 540,
"token_acc": 0.9492771873268524,
"train_speed(iter/s)": 0.129674
},
{
"epoch": 1.3562245217936657,
"eval_loss": 0.2199857234954834,
"eval_runtime": 15.3525,
"eval_samples_per_second": 16.74,
"eval_steps_per_second": 4.234,
"eval_token_acc": 0.9259444035990617,
"step": 540
},
{
"epoch": 1.3687676387582315,
"grad_norm": 0.7763009071350098,
"learning_rate": 5.681966550675981e-06,
"loss": 0.15383946895599365,
"memory(GiB)": 31.81,
"step": 545,
"token_acc": 0.9333074612277752,
"train_speed(iter/s)": 0.129103
},
{
"epoch": 1.381310755722797,
"grad_norm": 0.754088282585144,
"learning_rate": 5.616745393052725e-06,
"loss": 0.15939451456069947,
"memory(GiB)": 31.81,
"step": 550,
"token_acc": 0.9464760826493065,
"train_speed(iter/s)": 0.129287
},
{
"epoch": 1.3938538726873628,
"grad_norm": 0.7275711894035339,
"learning_rate": 5.551417494556376e-06,
"loss": 0.15393273830413817,
"memory(GiB)": 31.81,
"step": 555,
"token_acc": 0.9460861238928638,
"train_speed(iter/s)": 0.129442
},
{
"epoch": 1.4063969896519284,
"grad_norm": 0.6778993010520935,
"learning_rate": 5.4859941615655495e-06,
"loss": 0.16530011892318724,
"memory(GiB)": 31.81,
"step": 560,
"token_acc": 0.9377745897964673,
"train_speed(iter/s)": 0.129634
},
{
"epoch": 1.4063969896519284,
"eval_loss": 0.21840627491474152,
"eval_runtime": 15.3572,
"eval_samples_per_second": 16.735,
"eval_steps_per_second": 4.233,
"eval_token_acc": 0.925795609704863,
"step": 560
},
{
"epoch": 1.4189401066164942,
"grad_norm": 0.7403908371925354,
"learning_rate": 5.4204867169758265e-06,
"loss": 0.14913086891174315,
"memory(GiB)": 31.81,
"step": 565,
"token_acc": 0.9394371658864914,
"train_speed(iter/s)": 0.129028
},
{
"epoch": 1.43148322358106,
"grad_norm": 0.7867358922958374,
"learning_rate": 5.35490649824008e-06,
"loss": 0.17901339530944824,
"memory(GiB)": 31.81,
"step": 570,
"token_acc": 0.9368613331921427,
"train_speed(iter/s)": 0.129242
},
{
"epoch": 1.4440263405456255,
"grad_norm": 0.7289626002311707,
"learning_rate": 5.289264855406295e-06,
"loss": 0.1573652982711792,
"memory(GiB)": 31.81,
"step": 575,
"token_acc": 0.9441503874276983,
"train_speed(iter/s)": 0.129439
},
{
"epoch": 1.4565694575101913,
"grad_norm": 0.723175585269928,
"learning_rate": 5.223573149153197e-06,
"loss": 0.1556238889694214,
"memory(GiB)": 31.81,
"step": 580,
"token_acc": 0.9394716940363008,
"train_speed(iter/s)": 0.129619
},
{
"epoch": 1.4565694575101913,
"eval_loss": 0.21749961376190186,
"eval_runtime": 15.3632,
"eval_samples_per_second": 16.728,
"eval_steps_per_second": 4.231,
"eval_token_acc": 0.9257430942127928,
"step": 580
},
{
"epoch": 1.469112574474757,
"grad_norm": 0.7443521022796631,
"learning_rate": 5.157842748824053e-06,
"loss": 0.15476609468460084,
"memory(GiB)": 31.81,
"step": 585,
"token_acc": 0.9340939774111758,
"train_speed(iter/s)": 0.129067
},
{
"epoch": 1.4816556914393226,
"grad_norm": 0.8059399127960205,
"learning_rate": 5.092085030458957e-06,
"loss": 0.15709525346755981,
"memory(GiB)": 31.81,
"step": 590,
"token_acc": 0.9359229370311435,
"train_speed(iter/s)": 0.129147
},
{
"epoch": 1.4941988084038884,
"grad_norm": 0.7224918007850647,
"learning_rate": 5.026311374825969e-06,
"loss": 0.14287755489349366,
"memory(GiB)": 31.81,
"step": 595,
"token_acc": 0.9447071216835298,
"train_speed(iter/s)": 0.12923
},
{
"epoch": 1.5067419253684542,
"grad_norm": 0.7575579881668091,
"learning_rate": 4.960533165451435e-06,
"loss": 0.16114065647125245,
"memory(GiB)": 31.81,
"step": 600,
"token_acc": 0.9444704368676531,
"train_speed(iter/s)": 0.129449
},
{
"epoch": 1.5067419253684542,
"eval_loss": 0.2169800102710724,
"eval_runtime": 15.3901,
"eval_samples_per_second": 16.699,
"eval_steps_per_second": 4.223,
"eval_token_acc": 0.9261544655673424,
"step": 600
},
{
"epoch": 1.5192850423330198,
"grad_norm": 0.6867368817329407,
"learning_rate": 4.894761786649815e-06,
"loss": 0.1530630111694336,
"memory(GiB)": 31.81,
"step": 605,
"token_acc": 0.9384248996465161,
"train_speed(iter/s)": 0.128875
},
{
"epoch": 1.5318281592975853,
"grad_norm": 0.7576408386230469,
"learning_rate": 4.829008621553401e-06,
"loss": 0.15166678428649902,
"memory(GiB)": 31.81,
"step": 610,
"token_acc": 0.9431903961818492,
"train_speed(iter/s)": 0.129109
},
{
"epoch": 1.544371276262151,
"grad_norm": 0.7608903050422668,
"learning_rate": 4.763285050142211e-06,
"loss": 0.17192583084106444,
"memory(GiB)": 31.81,
"step": 615,
"token_acc": 0.93989472085843,
"train_speed(iter/s)": 0.129365
},
{
"epoch": 1.5569143932267169,
"grad_norm": 0.7976657152175903,
"learning_rate": 4.697602447274454e-06,
"loss": 0.16986348628997802,
"memory(GiB)": 31.81,
"step": 620,
"token_acc": 0.9434366754617414,
"train_speed(iter/s)": 0.129534
},
{
"epoch": 1.5569143932267169,
"eval_loss": 0.21612223982810974,
"eval_runtime": 15.3679,
"eval_samples_per_second": 16.723,
"eval_steps_per_second": 4.23,
"eval_token_acc": 0.9266708679060323,
"step": 620
},
{
"epoch": 1.5694575101912824,
"grad_norm": 0.6765289306640625,
"learning_rate": 4.631972180717859e-06,
"loss": 0.14983587265014647,
"memory(GiB)": 31.81,
"step": 625,
"token_acc": 0.931841074426413,
"train_speed(iter/s)": 0.12904
},
{
"epoch": 1.5820006271558482,
"grad_norm": 0.726507306098938,
"learning_rate": 4.566405609182247e-06,
"loss": 0.16202863454818725,
"memory(GiB)": 31.81,
"step": 630,
"token_acc": 0.9474066189278111,
"train_speed(iter/s)": 0.129215
},
{
"epoch": 1.594543744120414,
"grad_norm": 0.7189328670501709,
"learning_rate": 4.500914080353666e-06,
"loss": 0.1547753095626831,
"memory(GiB)": 31.81,
"step": 635,
"token_acc": 0.9415881650524082,
"train_speed(iter/s)": 0.129409
},
{
"epoch": 1.6070868610849796,
"grad_norm": 0.6717737317085266,
"learning_rate": 4.435508928930431e-06,
"loss": 0.1501192569732666,
"memory(GiB)": 31.81,
"step": 640,
"token_acc": 0.9476487510324988,
"train_speed(iter/s)": 0.129518
},
{
"epoch": 1.6070868610849796,
"eval_loss": 0.21533308923244476,
"eval_runtime": 15.3725,
"eval_samples_per_second": 16.718,
"eval_steps_per_second": 4.228,
"eval_token_acc": 0.9266883730700557,
"step": 640
},
{
"epoch": 1.6196299780495453,
"grad_norm": 0.7199254035949707,
"learning_rate": 4.3702014746614135e-06,
"loss": 0.1601256847381592,
"memory(GiB)": 31.81,
"step": 645,
"token_acc": 0.9370883453415381,
"train_speed(iter/s)": 0.128942
},
{
"epoch": 1.6321730950141111,
"grad_norm": 0.7428786754608154,
"learning_rate": 4.305003020386922e-06,
"loss": 0.16339280605316162,
"memory(GiB)": 31.81,
"step": 650,
"token_acc": 0.9402134435938985,
"train_speed(iter/s)": 0.129165
},
{
"epoch": 1.6447162119786767,
"grad_norm": 0.6674877405166626,
"learning_rate": 4.239924850082501e-06,
"loss": 0.15751969814300537,
"memory(GiB)": 31.81,
"step": 655,
"token_acc": 0.9428207992057582,
"train_speed(iter/s)": 0.129329
},
{
"epoch": 1.6572593289432422,
"grad_norm": 0.7335858345031738,
"learning_rate": 4.1749782269060045e-06,
"loss": 0.1551824688911438,
"memory(GiB)": 31.81,
"step": 660,
"token_acc": 0.9432031679047316,
"train_speed(iter/s)": 0.129436
},
{
"epoch": 1.6572593289432422,
"eval_loss": 0.21479374170303345,
"eval_runtime": 15.3588,
"eval_samples_per_second": 16.733,
"eval_steps_per_second": 4.232,
"eval_token_acc": 0.9272660434828275,
"step": 660
},
{
"epoch": 1.6698024459078082,
"grad_norm": 0.7220312356948853,
"learning_rate": 4.110174391248268e-06,
"loss": 0.15914130210876465,
"memory(GiB)": 31.81,
"step": 665,
"token_acc": 0.9325106594877222,
"train_speed(iter/s)": 0.12899
},
{
"epoch": 1.6823455628723738,
"grad_norm": 0.6705756187438965,
"learning_rate": 4.045524558787712e-06,
"loss": 0.1455508589744568,
"memory(GiB)": 31.81,
"step": 670,
"token_acc": 0.95000137661408,
"train_speed(iter/s)": 0.129143
},
{
"epoch": 1.6948886798369394,
"grad_norm": 0.7751862406730652,
"learning_rate": 3.9810399185492406e-06,
"loss": 0.16772797107696533,
"memory(GiB)": 31.81,
"step": 675,
"token_acc": 0.9432926683124416,
"train_speed(iter/s)": 0.129298
},
{
"epoch": 1.7074317968015051,
"grad_norm": 0.6835960149765015,
"learning_rate": 3.916731630967741e-06,
"loss": 0.148516845703125,
"memory(GiB)": 31.81,
"step": 680,
"token_acc": 0.9397804716241481,
"train_speed(iter/s)": 0.129488
},
{
"epoch": 1.7074317968015051,
"eval_loss": 0.21434009075164795,
"eval_runtime": 15.3644,
"eval_samples_per_second": 16.727,
"eval_steps_per_second": 4.231,
"eval_token_acc": 0.9270209711865001,
"step": 680
},
{
"epoch": 1.719974913766071,
"grad_norm": 0.7121639251708984,
"learning_rate": 3.852610825956529e-06,
"loss": 0.15527284145355225,
"memory(GiB)": 31.81,
"step": 685,
"token_acc": 0.9362297584483223,
"train_speed(iter/s)": 0.129069
},
{
"epoch": 1.7325180307306365,
"grad_norm": 0.70497727394104,
"learning_rate": 3.788688600981085e-06,
"loss": 0.15706214904785157,
"memory(GiB)": 31.81,
"step": 690,
"token_acc": 0.945192257525956,
"train_speed(iter/s)": 0.129196
},
{
"epoch": 1.7450611476952023,
"grad_norm": 0.6827052235603333,
"learning_rate": 3.7249760191384055e-06,
"loss": 0.14694638252258302,
"memory(GiB)": 31.81,
"step": 695,
"token_acc": 0.9522423156598174,
"train_speed(iter/s)": 0.129354
},
{
"epoch": 1.757604264659768,
"grad_norm": 0.7271601557731628,
"learning_rate": 3.6614841072422913e-06,
"loss": 0.1638465404510498,
"memory(GiB)": 31.81,
"step": 700,
"token_acc": 0.9435711526461237,
"train_speed(iter/s)": 0.129542
},
{
"epoch": 1.757604264659768,
"eval_loss": 0.2132289856672287,
"eval_runtime": 15.3732,
"eval_samples_per_second": 16.717,
"eval_steps_per_second": 4.228,
"eval_token_acc": 0.927563631271225,
"step": 700
},
{
"epoch": 1.7701473816243336,
"grad_norm": 0.7114645838737488,
"learning_rate": 3.5982238539149287e-06,
"loss": 0.15001455545425416,
"memory(GiB)": 31.81,
"step": 705,
"token_acc": 0.9358007313453388,
"train_speed(iter/s)": 0.129143
},
{
"epoch": 1.7826904985888994,
"grad_norm": 0.7541443705558777,
"learning_rate": 3.535206207685079e-06,
"loss": 0.15614376068115235,
"memory(GiB)": 31.81,
"step": 710,
"token_acc": 0.9451783170888374,
"train_speed(iter/s)": 0.129254
},
{
"epoch": 1.7952336155534652,
"grad_norm": 0.7407529950141907,
"learning_rate": 3.472442075093192e-06,
"loss": 0.1589871883392334,
"memory(GiB)": 31.81,
"step": 715,
"token_acc": 0.9350007719623282,
"train_speed(iter/s)": 0.129419
},
{
"epoch": 1.8077767325180307,
"grad_norm": 0.7716948390007019,
"learning_rate": 3.4099423188038094e-06,
"loss": 0.15787534713745116,
"memory(GiB)": 31.81,
"step": 720,
"token_acc": 0.9492842652647219,
"train_speed(iter/s)": 0.129594
},
{
"epoch": 1.8077767325180307,
"eval_loss": 0.21319042146205902,
"eval_runtime": 15.3493,
"eval_samples_per_second": 16.743,
"eval_steps_per_second": 4.235,
"eval_token_acc": 0.9274848580331198,
"step": 720
},
{
"epoch": 1.8203198494825963,
"grad_norm": 0.744939923286438,
"learning_rate": 3.347717755725547e-06,
"loss": 0.15603610277175903,
"memory(GiB)": 31.81,
"step": 725,
"token_acc": 0.9345954499920149,
"train_speed(iter/s)": 0.129224
},
{
"epoch": 1.832862966447162,
"grad_norm": 0.7879869937896729,
"learning_rate": 3.2857791551389907e-06,
"loss": 0.1529020071029663,
"memory(GiB)": 31.81,
"step": 730,
"token_acc": 0.9493445833961127,
"train_speed(iter/s)": 0.129406
},
{
"epoch": 1.8454060834117278,
"grad_norm": 0.6601085662841797,
"learning_rate": 3.224137236832859e-06,
"loss": 0.14167948961257934,
"memory(GiB)": 31.81,
"step": 735,
"token_acc": 0.9515996958530737,
"train_speed(iter/s)": 0.129532
},
{
"epoch": 1.8579492003762934,
"grad_norm": 0.6988480687141418,
"learning_rate": 3.1628026692487053e-06,
"loss": 0.1586320996284485,
"memory(GiB)": 31.81,
"step": 740,
"token_acc": 0.9414518601086805,
"train_speed(iter/s)": 0.129659
},
{
"epoch": 1.8579492003762934,
"eval_loss": 0.21269367635250092,
"eval_runtime": 15.37,
"eval_samples_per_second": 16.721,
"eval_steps_per_second": 4.229,
"eval_token_acc": 0.9280625284458915,
"step": 740
},
{
"epoch": 1.8704923173408592,
"grad_norm": 0.727496325969696,
"learning_rate": 3.1017860676345184e-06,
"loss": 0.16212354898452758,
"memory(GiB)": 31.81,
"step": 745,
"token_acc": 0.9331751365641573,
"train_speed(iter/s)": 0.129252
},
{
"epoch": 1.883035434305425,
"grad_norm": 0.6366550922393799,
"learning_rate": 3.0410979922075344e-06,
"loss": 0.15711357593536376,
"memory(GiB)": 31.81,
"step": 750,
"token_acc": 0.9437845985913663,
"train_speed(iter/s)": 0.129389
},
{
"epoch": 1.8955785512699905,
"grad_norm": 0.7146003246307373,
"learning_rate": 2.980748946326564e-06,
"loss": 0.1518003225326538,
"memory(GiB)": 31.81,
"step": 755,
"token_acc": 0.9483841528881254,
"train_speed(iter/s)": 0.129526
},
{
"epoch": 1.9081216682345563,
"grad_norm": 0.6720646619796753,
"learning_rate": 2.920749374674161e-06,
"loss": 0.15349475145339966,
"memory(GiB)": 31.81,
"step": 760,
"token_acc": 0.945,
"train_speed(iter/s)": 0.129667
},
{
"epoch": 1.9081216682345563,
"eval_loss": 0.21246011555194855,
"eval_runtime": 15.3545,
"eval_samples_per_second": 16.738,
"eval_steps_per_second": 4.233,
"eval_token_acc": 0.9276336519273186,
"step": 760
},
{
"epoch": 1.920664785199122,
"grad_norm": 0.7045518755912781,
"learning_rate": 2.861109661448952e-06,
"loss": 0.15071908235549927,
"memory(GiB)": 31.81,
"step": 765,
"token_acc": 0.937086689912228,
"train_speed(iter/s)": 0.129279
},
{
"epoch": 1.9332079021636877,
"grad_norm": 0.70011967420578,
"learning_rate": 2.8018401285684284e-06,
"loss": 0.1453996181488037,
"memory(GiB)": 31.81,
"step": 770,
"token_acc": 0.9489197957797842,
"train_speed(iter/s)": 0.12943
},
{
"epoch": 1.9457510191282532,
"grad_norm": 0.7138105630874634,
"learning_rate": 2.7429510338825206e-06,
"loss": 0.14368767738342286,
"memory(GiB)": 31.81,
"step": 775,
"token_acc": 0.9417082448253717,
"train_speed(iter/s)": 0.129571
},
{
"epoch": 1.9582941360928192,
"grad_norm": 0.7411118149757385,
"learning_rate": 2.6844525693982614e-06,
"loss": 0.1606222152709961,
"memory(GiB)": 31.81,
"step": 780,
"token_acc": 0.944643557880968,
"train_speed(iter/s)": 0.129663
},
{
"epoch": 1.9582941360928192,
"eval_loss": 0.2114025205373764,
"eval_runtime": 15.379,
"eval_samples_per_second": 16.711,
"eval_steps_per_second": 4.227,
"eval_token_acc": 0.928220074922102,
"step": 780
},
{
"epoch": 1.9708372530573848,
"grad_norm": 0.7422724366188049,
"learning_rate": 2.6263548595158374e-06,
"loss": 0.15853983163833618,
"memory(GiB)": 31.81,
"step": 785,
"token_acc": 0.9366524932354078,
"train_speed(iter/s)": 0.129249
},
{
"epoch": 1.9833803700219503,
"grad_norm": 0.7750598192214966,
"learning_rate": 2.568667959276351e-06,
"loss": 0.15706416368484497,
"memory(GiB)": 31.81,
"step": 790,
"token_acc": 0.9499685404959753,
"train_speed(iter/s)": 0.12939
},
{
"epoch": 1.9959234869865161,
"grad_norm": 0.6972166895866394,
"learning_rate": 2.5114018526215843e-06,
"loss": 0.15649087429046632,
"memory(GiB)": 31.81,
"step": 795,
"token_acc": 0.9408999669690271,
"train_speed(iter/s)": 0.129553
},
{
"epoch": 2.0100344935716525,
"grad_norm": 0.6763654351234436,
"learning_rate": 2.454566450666061e-06,
"loss": 0.15049003362655639,
"memory(GiB)": 31.81,
"step": 800,
"token_acc": 0.9530306241390273,
"train_speed(iter/s)": 0.129615
},
{
"epoch": 2.0100344935716525,
"eval_loss": 0.21210120618343353,
"eval_runtime": 15.3555,
"eval_samples_per_second": 16.737,
"eval_steps_per_second": 4.233,
"eval_token_acc": 0.9283163533242307,
"step": 800
},
{
"epoch": 2.022577610536218,
"grad_norm": 0.6350038647651672,
"learning_rate": 2.398171589981721e-06,
"loss": 0.10892703533172607,
"memory(GiB)": 31.81,
"step": 805,
"token_acc": 0.9476837338906304,
"train_speed(iter/s)": 0.12922
},
{
"epoch": 2.035120727500784,
"grad_norm": 0.6500776410102844,
"learning_rate": 2.3422270308954936e-06,
"loss": 0.1064380407333374,
"memory(GiB)": 31.81,
"step": 810,
"token_acc": 0.9628300589097216,
"train_speed(iter/s)": 0.129369
},
{
"epoch": 2.0476638444653497,
"grad_norm": 0.6957349181175232,
"learning_rate": 2.286742455800059e-06,
"loss": 0.10609914064407348,
"memory(GiB)": 31.81,
"step": 815,
"token_acc": 0.9647304470327791,
"train_speed(iter/s)": 0.129502
},
{
"epoch": 2.060206961429915,
"grad_norm": 0.7038280963897705,
"learning_rate": 2.2317274674781158e-06,
"loss": 0.1041153073310852,
"memory(GiB)": 31.81,
"step": 820,
"token_acc": 0.9643880707130899,
"train_speed(iter/s)": 0.129593
},
{
"epoch": 2.060206961429915,
"eval_loss": 0.23022687435150146,
"eval_runtime": 15.3909,
"eval_samples_per_second": 16.698,
"eval_steps_per_second": 4.223,
"eval_token_acc": 0.9276424045093302,
"step": 820
},
{
"epoch": 2.072750078394481,
"grad_norm": 0.8562469482421875,
"learning_rate": 2.1771915874404094e-06,
"loss": 0.11885223388671876,
"memory(GiB)": 31.81,
"step": 825,
"token_acc": 0.9438533042412649,
"train_speed(iter/s)": 0.12923
},
{
"epoch": 2.085293195359047,
"grad_norm": 0.6420326828956604,
"learning_rate": 2.1231442542778317e-06,
"loss": 0.11257556676864625,
"memory(GiB)": 31.81,
"step": 830,
"token_acc": 0.9660501458879382,
"train_speed(iter/s)": 0.129354
},
{
"epoch": 2.0978363123236123,
"grad_norm": 0.6728197932243347,
"learning_rate": 2.0695948220278756e-06,
"loss": 0.11477745771408081,
"memory(GiB)": 31.81,
"step": 835,
"token_acc": 0.9606660351961713,
"train_speed(iter/s)": 0.12949
},
{
"epoch": 2.110379429288178,
"grad_norm": 0.7246009111404419,
"learning_rate": 2.0165525585557205e-06,
"loss": 0.11393618583679199,
"memory(GiB)": 31.81,
"step": 840,
"token_acc": 0.9608159022995972,
"train_speed(iter/s)": 0.129643
},
{
"epoch": 2.110379429288178,
"eval_loss": 0.22520191967487335,
"eval_runtime": 15.3743,
"eval_samples_per_second": 16.716,
"eval_steps_per_second": 4.228,
"eval_token_acc": 0.9278262087315758,
"step": 840
},
{
"epoch": 2.122922546252744,
"grad_norm": 0.7262341380119324,
"learning_rate": 1.964026643950226e-06,
"loss": 0.10375577211380005,
"memory(GiB)": 31.81,
"step": 845,
"token_acc": 0.9489552718925005,
"train_speed(iter/s)": 0.129239
},
{
"epoch": 2.1354656632173095,
"grad_norm": 0.7589318752288818,
"learning_rate": 1.9120261689351317e-06,
"loss": 0.11369407176971436,
"memory(GiB)": 31.81,
"step": 850,
"token_acc": 0.9638739431206764,
"train_speed(iter/s)": 0.129365
},
{
"epoch": 2.148008780181875,
"grad_norm": 0.7323006391525269,
"learning_rate": 1.860560133295708e-06,
"loss": 0.11056618690490723,
"memory(GiB)": 31.81,
"step": 855,
"token_acc": 0.9616726487788961,
"train_speed(iter/s)": 0.129496
},
{
"epoch": 2.160551897146441,
"grad_norm": 0.6986774206161499,
"learning_rate": 1.8096374443211545e-06,
"loss": 0.10637121200561524,
"memory(GiB)": 31.81,
"step": 860,
"token_acc": 0.9640018078855714,
"train_speed(iter/s)": 0.129604
},
{
"epoch": 2.160551897146441,
"eval_loss": 0.22789862751960754,
"eval_runtime": 15.3904,
"eval_samples_per_second": 16.699,
"eval_steps_per_second": 4.223,
"eval_token_acc": 0.9274586002870847,
"step": 860
},
{
"epoch": 2.1730950141110066,
"grad_norm": 0.6732742786407471,
"learning_rate": 1.7592669152630082e-06,
"loss": 0.10579054355621338,
"memory(GiB)": 31.81,
"step": 865,
"token_acc": 0.9454877249898618,
"train_speed(iter/s)": 0.129231
},
{
"epoch": 2.185638131075572,
"grad_norm": 0.7679221034049988,
"learning_rate": 1.7094572638098122e-06,
"loss": 0.10716142654418945,
"memory(GiB)": 31.81,
"step": 870,
"token_acc": 0.9636935391652373,
"train_speed(iter/s)": 0.129367
},
{
"epoch": 2.198181248040138,
"grad_norm": 0.7014066576957703,
"learning_rate": 1.6602171105783488e-06,
"loss": 0.1035423994064331,
"memory(GiB)": 31.81,
"step": 875,
"token_acc": 0.9624011843906254,
"train_speed(iter/s)": 0.12952
},
{
"epoch": 2.2107243650047037,
"grad_norm": 0.7253413200378418,
"learning_rate": 1.61155497762165e-06,
"loss": 0.10561528205871581,
"memory(GiB)": 31.81,
"step": 880,
"token_acc": 0.9681256194898012,
"train_speed(iter/s)": 0.129624
},
{
"epoch": 2.2107243650047037,
"eval_loss": 0.22809092700481415,
"eval_runtime": 15.3879,
"eval_samples_per_second": 16.701,
"eval_steps_per_second": 4.224,
"eval_token_acc": 0.927423589959038,
"step": 880
},
{
"epoch": 2.2232674819692693,
"grad_norm": 0.6759311556816101,
"learning_rate": 1.5634792869540782e-06,
"loss": 0.11813747882843018,
"memory(GiB)": 31.81,
"step": 885,
"token_acc": 0.9463408677719589,
"train_speed(iter/s)": 0.12928
},
{
"epoch": 2.235810598933835,
"grad_norm": 0.6786462664604187,
"learning_rate": 1.5159983590937183e-06,
"loss": 0.09899504780769348,
"memory(GiB)": 31.81,
"step": 890,
"token_acc": 0.9641708663306936,
"train_speed(iter/s)": 0.129383
},
{
"epoch": 2.248353715898401,
"grad_norm": 0.7053468823432922,
"learning_rate": 1.4691204116223357e-06,
"loss": 0.11507067680358887,
"memory(GiB)": 31.81,
"step": 895,
"token_acc": 0.9575259738401214,
"train_speed(iter/s)": 0.129501
},
{
"epoch": 2.2608968328629664,
"grad_norm": 0.7843905687332153,
"learning_rate": 1.4228535577631442e-06,
"loss": 0.10749893188476563,
"memory(GiB)": 31.81,
"step": 900,
"token_acc": 0.9568620265424181,
"train_speed(iter/s)": 0.129634
},
{
"epoch": 2.2608968328629664,
"eval_loss": 0.2279745191335678,
"eval_runtime": 15.3783,
"eval_samples_per_second": 16.712,
"eval_steps_per_second": 4.227,
"eval_token_acc": 0.9276336519273186,
"step": 900
},
{
"epoch": 2.273439949827532,
"grad_norm": 0.7689437866210938,
"learning_rate": 1.3772058049766491e-06,
"loss": 0.10860542058944703,
"memory(GiB)": 31.81,
"step": 905,
"token_acc": 0.9446734581062939,
"train_speed(iter/s)": 0.129286
},
{
"epoch": 2.285983066792098,
"grad_norm": 0.8241957426071167,
"learning_rate": 1.3321850535747822e-06,
"loss": 0.12034444808959961,
"memory(GiB)": 31.81,
"step": 910,
"token_acc": 0.9542774256614007,
"train_speed(iter/s)": 0.129401
},
{
"epoch": 2.2985261837566635,
"grad_norm": 0.6636318564414978,
"learning_rate": 1.2877990953535841e-06,
"loss": 0.10744799375534057,
"memory(GiB)": 31.81,
"step": 915,
"token_acc": 0.9670476136460312,
"train_speed(iter/s)": 0.129533
},
{
"epoch": 2.311069300721229,
"grad_norm": 0.696555495262146,
"learning_rate": 1.2440556122446701e-06,
"loss": 0.11220449209213257,
"memory(GiB)": 31.81,
"step": 920,
"token_acc": 0.9617257008561356,
"train_speed(iter/s)": 0.129627
},
{
"epoch": 2.311069300721229,
"eval_loss": 0.22779622673988342,
"eval_runtime": 15.4115,
"eval_samples_per_second": 16.676,
"eval_steps_per_second": 4.218,
"eval_token_acc": 0.9276511570913419,
"step": 920
},
{
"epoch": 2.323612417685795,
"grad_norm": 0.7180680632591248,
"learning_rate": 1.2009621749857103e-06,
"loss": 0.10242276191711426,
"memory(GiB)": 31.81,
"step": 925,
"token_acc": 0.9447967352064041,
"train_speed(iter/s)": 0.129303
},
{
"epoch": 2.3361555346503606,
"grad_norm": 0.7456693649291992,
"learning_rate": 1.1585262418101468e-06,
"loss": 0.10643236637115479,
"memory(GiB)": 31.81,
"step": 930,
"token_acc": 0.9578788036953912,
"train_speed(iter/s)": 0.129454
},
{
"epoch": 2.348698651614926,
"grad_norm": 0.7959876656532288,
"learning_rate": 1.1167551571563967e-06,
"loss": 0.10762505531311035,
"memory(GiB)": 31.81,
"step": 935,
"token_acc": 0.9615673799884327,
"train_speed(iter/s)": 0.129587
},
{
"epoch": 2.361241768579492,
"grad_norm": 0.7502437233924866,
"learning_rate": 1.0756561503967366e-06,
"loss": 0.11327018737792968,
"memory(GiB)": 31.81,
"step": 940,
"token_acc": 0.9572353022167148,
"train_speed(iter/s)": 0.129692
},
{
"epoch": 2.361241768579492,
"eval_loss": 0.2275438755750656,
"eval_runtime": 15.3749,
"eval_samples_per_second": 16.716,
"eval_steps_per_second": 4.228,
"eval_token_acc": 0.9278612190596226,
"step": 940
},
{
"epoch": 2.3737848855440578,
"grad_norm": 0.7785040736198425,
"learning_rate": 1.0352363345861067e-06,
"loss": 0.1163412094116211,
"memory(GiB)": 31.81,
"step": 945,
"token_acc": 0.9469440871152063,
"train_speed(iter/s)": 0.129374
},
{
"epoch": 2.3863280025086233,
"grad_norm": 0.7529416680335999,
"learning_rate": 9.955027052310445e-07,
"loss": 0.1082146406173706,
"memory(GiB)": 31.81,
"step": 950,
"token_acc": 0.9666347763692896,
"train_speed(iter/s)": 0.12948
},
{
"epoch": 2.3988711194731893,
"grad_norm": 0.7093843221664429,
"learning_rate": 9.564621390789692e-07,
"loss": 0.10433540344238282,
"memory(GiB)": 31.81,
"step": 955,
"token_acc": 0.9620772386038232,
"train_speed(iter/s)": 0.129551
},
{
"epoch": 2.411414236437755,
"grad_norm": 0.7402180433273315,
"learning_rate": 9.181213929280047e-07,
"loss": 0.1084256649017334,
"memory(GiB)": 31.81,
"step": 960,
"token_acc": 0.9655060201757241,
"train_speed(iter/s)": 0.12968
},
{
"epoch": 2.411414236437755,
"eval_loss": 0.22712615132331848,
"eval_runtime": 15.3736,
"eval_samples_per_second": 16.717,
"eval_steps_per_second": 4.228,
"eval_token_acc": 0.9277211777474355,
"step": 960
},
{
"epoch": 2.4239573534023204,
"grad_norm": 0.7065171599388123,
"learning_rate": 8.804871024575851e-07,
"loss": 0.1058305025100708,
"memory(GiB)": 31.81,
"step": 965,
"token_acc": 0.9411054200749178,
"train_speed(iter/s)": 0.129327
},
{
"epoch": 2.436500470366886,
"grad_norm": 0.7312522530555725,
"learning_rate": 8.435657810799991e-07,
"loss": 0.11365176439285278,
"memory(GiB)": 31.81,
"step": 970,
"token_acc": 0.9554801532746365,
"train_speed(iter/s)": 0.129412
},
{
"epoch": 2.449043587331452,
"grad_norm": 0.7271402478218079,
"learning_rate": 8.073638188131128e-07,
"loss": 0.11030232906341553,
"memory(GiB)": 31.81,
"step": 975,
"token_acc": 0.9618299257450921,
"train_speed(iter/s)": 0.129519
},
{
"epoch": 2.4615867042960176,
"grad_norm": 0.729744017124176,
"learning_rate": 7.71887481174437e-07,
"loss": 0.10576653480529785,
"memory(GiB)": 31.81,
"step": 980,
"token_acc": 0.9634010868586184,
"train_speed(iter/s)": 0.129607
},
{
"epoch": 2.4615867042960176,
"eval_loss": 0.22756896913051605,
"eval_runtime": 15.389,
"eval_samples_per_second": 16.7,
"eval_steps_per_second": 4.224,
"eval_token_acc": 0.9279312397157161,
"step": 980
},
{
"epoch": 2.474129821260583,
"grad_norm": 0.8634856343269348,
"learning_rate": 7.371429080967468e-07,
"loss": 0.09780678153038025,
"memory(GiB)": 31.81,
"step": 985,
"token_acc": 0.9456286316041047,
"train_speed(iter/s)": 0.129279
},
{
"epoch": 2.486672938225149,
"grad_norm": 0.672733724117279,
"learning_rate": 7.031361128654402e-07,
"loss": 0.10667885541915893,
"memory(GiB)": 31.81,
"step": 990,
"token_acc": 0.9594269307734694,
"train_speed(iter/s)": 0.129407
},
{
"epoch": 2.4992160551897147,
"grad_norm": 0.760313093662262,
"learning_rate": 6.698729810778065e-07,
"loss": 0.11521060466766357,
"memory(GiB)": 31.81,
"step": 995,
"token_acc": 0.9575349257736169,
"train_speed(iter/s)": 0.12955
},
{
"epoch": 2.5117591721542802,
"grad_norm": 0.702035665512085,
"learning_rate": 6.373592696244024e-07,
"loss": 0.11087181568145751,
"memory(GiB)": 31.81,
"step": 1000,
"token_acc": 0.9578573542468186,
"train_speed(iter/s)": 0.129663
},
{
"epoch": 2.5117591721542802,
"eval_loss": 0.227799654006958,
"eval_runtime": 15.3792,
"eval_samples_per_second": 16.711,
"eval_steps_per_second": 4.227,
"eval_token_acc": 0.9277299303294472,
"step": 1000
},
{
"epoch": 2.524302289118846,
"grad_norm": 0.7296103835105896,
"learning_rate": 6.056006056926978e-07,
"loss": 0.10585801601409912,
"memory(GiB)": 31.81,
"step": 1005,
"token_acc": 0.948129963898917,
"train_speed(iter/s)": 0.129334
},
{
"epoch": 2.536845406083412,
"grad_norm": 0.6856093406677246,
"learning_rate": 5.746024857931732e-07,
"loss": 0.10559420585632324,
"memory(GiB)": 31.81,
"step": 1010,
"token_acc": 0.9610920907561075,
"train_speed(iter/s)": 0.129436
},
{
"epoch": 2.5493885230479774,
"grad_norm": 0.6898284554481506,
"learning_rate": 5.443702748080288e-07,
"loss": 0.10710105895996094,
"memory(GiB)": 31.81,
"step": 1015,
"token_acc": 0.9610382616656346,
"train_speed(iter/s)": 0.129565
},
{
"epoch": 2.561931640012543,
"grad_norm": 0.7101157307624817,
"learning_rate": 5.149092050626825e-07,
"loss": 0.10318450927734375,
"memory(GiB)": 31.81,
"step": 1020,
"token_acc": 0.9633534136546185,
"train_speed(iter/s)": 0.12963
},
{
"epoch": 2.561931640012543,
"eval_loss": 0.22718214988708496,
"eval_runtime": 15.3905,
"eval_samples_per_second": 16.699,
"eval_steps_per_second": 4.223,
"eval_token_acc": 0.9277911984035291,
"step": 1020
},
{
"epoch": 2.574474756977109,
"grad_norm": 0.7209934592247009,
"learning_rate": 4.862243754202023e-07,
"loss": 0.11119084358215332,
"memory(GiB)": 31.81,
"step": 1025,
"token_acc": 0.9460293899361734,
"train_speed(iter/s)": 0.129349
},
{
"epoch": 2.5870178739416745,
"grad_norm": 0.7095735669136047,
"learning_rate": 4.5832075039884014e-07,
"loss": 0.1083114743232727,
"memory(GiB)": 31.81,
"step": 1030,
"token_acc": 0.9631125846265288,
"train_speed(iter/s)": 0.129447
},
{
"epoch": 2.59956099090624,
"grad_norm": 0.7213476896286011,
"learning_rate": 4.3120315931281633e-07,
"loss": 0.10071847438812256,
"memory(GiB)": 31.81,
"step": 1035,
"token_acc": 0.9633851013424586,
"train_speed(iter/s)": 0.129568
},
{
"epoch": 2.612104107870806,
"grad_norm": 0.772677481174469,
"learning_rate": 4.048762954365054e-07,
"loss": 0.11145726442337037,
"memory(GiB)": 31.81,
"step": 1040,
"token_acc": 0.9627473455598455,
"train_speed(iter/s)": 0.129711
},
{
"epoch": 2.612104107870806,
"eval_loss": 0.2263808250427246,
"eval_runtime": 15.3525,
"eval_samples_per_second": 16.74,
"eval_steps_per_second": 4.234,
"eval_token_acc": 0.9280012603718096,
"step": 1040
},
{
"epoch": 2.6246472248353716,
"grad_norm": 0.6904744505882263,
"learning_rate": 3.793447151921642e-07,
"loss": 0.11429480314254761,
"memory(GiB)": 31.81,
"step": 1045,
"token_acc": 0.945939040519418,
"train_speed(iter/s)": 0.129419
},
{
"epoch": 2.637190341799937,
"grad_norm": 0.7401297688484192,
"learning_rate": 3.546128373613472e-07,
"loss": 0.10656030178070068,
"memory(GiB)": 31.81,
"step": 1050,
"token_acc": 0.9636875146526349,
"train_speed(iter/s)": 0.1295
},
{
"epoch": 2.649733458764503,
"grad_norm": 0.7498672604560852,
"learning_rate": 3.30684942320143e-07,
"loss": 0.11416795253753662,
"memory(GiB)": 31.81,
"step": 1055,
"token_acc": 0.9633607254179655,
"train_speed(iter/s)": 0.129581
},
{
"epoch": 2.6622765757290687,
"grad_norm": 0.7101024985313416,
"learning_rate": 3.0756517129836296e-07,
"loss": 0.1097292423248291,
"memory(GiB)": 31.81,
"step": 1060,
"token_acc": 0.9603677715944834,
"train_speed(iter/s)": 0.129673
},
{
"epoch": 2.6622765757290687,
"eval_loss": 0.22645404934883118,
"eval_runtime": 15.3936,
"eval_samples_per_second": 16.695,
"eval_steps_per_second": 4.223,
"eval_token_acc": 0.9278524664776109,
"step": 1060
},
{
"epoch": 2.6748196926936343,
"grad_norm": 0.6467409133911133,
"learning_rate": 2.8525752566281485e-07,
"loss": 0.10393040180206299,
"memory(GiB)": 31.81,
"step": 1065,
"token_acc": 0.9449979310564344,
"train_speed(iter/s)": 0.12935
},
{
"epoch": 2.6873628096582003,
"grad_norm": 0.7203241586685181,
"learning_rate": 2.637658662247805e-07,
"loss": 0.11105575561523437,
"memory(GiB)": 31.81,
"step": 1070,
"token_acc": 0.9642081358609794,
"train_speed(iter/s)": 0.129437
},
{
"epoch": 2.699905926622766,
"grad_norm": 0.6585695147514343,
"learning_rate": 2.430939125718218e-07,
"loss": 0.11089683771133423,
"memory(GiB)": 31.81,
"step": 1075,
"token_acc": 0.9604440440864773,
"train_speed(iter/s)": 0.129535
},
{
"epoch": 2.7124490435873314,
"grad_norm": 0.7210690975189209,
"learning_rate": 2.232452424240261e-07,
"loss": 0.10859737396240235,
"memory(GiB)": 31.81,
"step": 1080,
"token_acc": 0.9596657286603565,
"train_speed(iter/s)": 0.129605
},
{
"epoch": 2.7124490435873314,
"eval_loss": 0.2266274243593216,
"eval_runtime": 15.3828,
"eval_samples_per_second": 16.707,
"eval_steps_per_second": 4.225,
"eval_token_acc": 0.928220074922102,
"step": 1080
},
{
"epoch": 2.7249921605518974,
"grad_norm": 0.6953999996185303,
"learning_rate": 2.042232910148051e-07,
"loss": 0.10121151208877563,
"memory(GiB)": 31.81,
"step": 1085,
"token_acc": 0.9472209455753066,
"train_speed(iter/s)": 0.129319
},
{
"epoch": 2.737535277516463,
"grad_norm": 0.6597380638122559,
"learning_rate": 1.860313504963579e-07,
"loss": 0.1065935492515564,
"memory(GiB)": 31.81,
"step": 1090,
"token_acc": 0.9662114751443839,
"train_speed(iter/s)": 0.129415
},
{
"epoch": 2.7500783944810285,
"grad_norm": 0.6942236423492432,
"learning_rate": 1.6867256936989097e-07,
"loss": 0.11052279472351074,
"memory(GiB)": 31.81,
"step": 1095,
"token_acc": 0.9620684756357437,
"train_speed(iter/s)": 0.129503
},
{
"epoch": 2.762621511445594,
"grad_norm": 0.7812759280204773,
"learning_rate": 1.521499519407038e-07,
"loss": 0.11402370929718017,
"memory(GiB)": 31.81,
"step": 1100,
"token_acc": 0.9662987099348318,
"train_speed(iter/s)": 0.129613
},
{
"epoch": 2.762621511445594,
"eval_loss": 0.2265271693468094,
"eval_runtime": 15.3687,
"eval_samples_per_second": 16.722,
"eval_steps_per_second": 4.229,
"eval_token_acc": 0.9280100129538214,
"step": 1100
},
{
"epoch": 2.7751646284101597,
"grad_norm": 0.6834614276885986,
"learning_rate": 1.364663577982317e-07,
"loss": 0.09805427193641662,
"memory(GiB)": 31.81,
"step": 1105,
"token_acc": 0.9493173799662525,
"train_speed(iter/s)": 0.129335
},
{
"epoch": 2.7877077453747257,
"grad_norm": 0.7146019339561462,
"learning_rate": 1.2162450132113202e-07,
"loss": 0.1073993444442749,
"memory(GiB)": 31.81,
"step": 1110,
"token_acc": 0.9588939098284893,
"train_speed(iter/s)": 0.129429
},
{
"epoch": 2.800250862339291,
"grad_norm": 0.6562223434448242,
"learning_rate": 1.07626951207504e-07,
"loss": 0.0982414186000824,
"memory(GiB)": 31.81,
"step": 1115,
"token_acc": 0.9667602620671213,
"train_speed(iter/s)": 0.129527
},
{
"epoch": 2.8127939793038568,
"grad_norm": 0.6855860352516174,
"learning_rate": 9.447613003032042e-08,
"loss": 0.10424129962921143,
"memory(GiB)": 31.81,
"step": 1120,
"token_acc": 0.965159977034292,
"train_speed(iter/s)": 0.129604
},
{
"epoch": 2.8127939793038568,
"eval_loss": 0.22646446526050568,
"eval_runtime": 15.3994,
"eval_samples_per_second": 16.689,
"eval_steps_per_second": 4.221,
"eval_token_acc": 0.9282900955781955,
"step": 1120
},
{
"epoch": 2.8253370962684228,
"grad_norm": 0.7434061169624329,
"learning_rate": 8.217431381815078e-08,
"loss": 0.10303902626037598,
"memory(GiB)": 31.81,
"step": 1125,
"token_acc": 0.9447586580925079,
"train_speed(iter/s)": 0.129305
},
{
"epoch": 2.8378802132329883,
"grad_norm": 0.719038724899292,
"learning_rate": 7.072363166124363e-08,
"loss": 0.10360879898071289,
"memory(GiB)": 31.81,
"step": 1130,
"token_acc": 0.960933130941919,
"train_speed(iter/s)": 0.129389
},
{
"epoch": 2.850423330197554,
"grad_norm": 0.7280715107917786,
"learning_rate": 6.012606534304688e-08,
"loss": 0.10378862619400024,
"memory(GiB)": 31.81,
"step": 1135,
"token_acc": 0.9630866449176706,
"train_speed(iter/s)": 0.12948
},
{
"epoch": 2.86296644716212,
"grad_norm": 0.7042152881622314,
"learning_rate": 5.038344899721437e-08,
"loss": 0.10662559270858765,
"memory(GiB)": 31.81,
"step": 1140,
"token_acc": 0.9665508368922252,
"train_speed(iter/s)": 0.129586
},
{
"epoch": 2.86296644716212,
"eval_loss": 0.22645802795886993,
"eval_runtime": 15.3769,
"eval_samples_per_second": 16.713,
"eval_steps_per_second": 4.227,
"eval_token_acc": 0.928246332668137,
"step": 1140
},
{
"epoch": 2.8755095641266855,
"grad_norm": 0.6806672811508179,
"learning_rate": 4.149746879017147e-08,
"loss": 0.10936232805252075,
"memory(GiB)": 31.81,
"step": 1145,
"token_acc": 0.9419420343363485,
"train_speed(iter/s)": 0.129338
},
{
"epoch": 2.888052681091251,
"grad_norm": 0.7901387810707092,
"learning_rate": 3.3469662629289635e-08,
"loss": 0.1104103684425354,
"memory(GiB)": 31.81,
"step": 1150,
"token_acc": 0.96508989778244,
"train_speed(iter/s)": 0.129455
},
{
"epoch": 2.900595798055817,
"grad_norm": 0.6709795594215393,
"learning_rate": 2.630141989671542e-08,
"loss": 0.10086469650268555,
"memory(GiB)": 31.81,
"step": 1155,
"token_acc": 0.9644157007671202,
"train_speed(iter/s)": 0.129535
},
{
"epoch": 2.9131389150203826,
"grad_norm": 0.7060185074806213,
"learning_rate": 1.999398120891116e-08,
"loss": 0.09639860391616821,
"memory(GiB)": 31.81,
"step": 1160,
"token_acc": 0.9676043228708827,
"train_speed(iter/s)": 0.129612
},
{
"epoch": 2.9131389150203826,
"eval_loss": 0.22671610116958618,
"eval_runtime": 15.358,
"eval_samples_per_second": 16.734,
"eval_steps_per_second": 4.232,
"eval_token_acc": 0.9280450232818681,
"step": 1160
},
{
"epoch": 2.925682031984948,
"grad_norm": 0.67342209815979,
"learning_rate": 1.4548438201939518e-08,
"loss": 0.11243362426757812,
"memory(GiB)": 31.81,
"step": 1165,
"token_acc": 0.9444314659938637,
"train_speed(iter/s)": 0.129336
},
{
"epoch": 2.938225148949514,
"grad_norm": 0.783845841884613,
"learning_rate": 9.965733342532925e-09,
"loss": 0.11067414283752441,
"memory(GiB)": 31.81,
"step": 1170,
"token_acc": 0.9621745865187628,
"train_speed(iter/s)": 0.129438
},
{
"epoch": 2.9507682659140797,
"grad_norm": 0.6691847443580627,
"learning_rate": 6.246659764979068e-09,
"loss": 0.10967533588409424,
"memory(GiB)": 31.81,
"step": 1175,
"token_acc": 0.9629586146169651,
"train_speed(iter/s)": 0.129517
},
{
"epoch": 2.9633113828786453,
"grad_norm": 0.7513623237609863,
"learning_rate": 3.3918611338507046e-09,
"loss": 0.11406528949737549,
"memory(GiB)": 31.81,
"step": 1180,
"token_acc": 0.9586087420042644,
"train_speed(iter/s)": 0.129633
},
{
"epoch": 2.9633113828786453,
"eval_loss": 0.22674556076526642,
"eval_runtime": 15.3693,
"eval_samples_per_second": 16.722,
"eval_steps_per_second": 4.229,
"eval_token_acc": 0.9282025697580787,
"step": 1180
},
{
"epoch": 2.9758544998432113,
"grad_norm": 0.7102883458137512,
"learning_rate": 1.4018315326103094e-09,
"loss": 0.10815140008926391,
"memory(GiB)": 31.81,
"step": 1185,
"token_acc": 0.944656259381567,
"train_speed(iter/s)": 0.129347
},
{
"epoch": 2.988397616807777,
"grad_norm": 0.7043233513832092,
"learning_rate": 2.7691537809293454e-10,
"loss": 0.10755873918533325,
"memory(GiB)": 31.81,
"step": 1190,
"token_acc": 0.9614810470757584,
"train_speed(iter/s)": 0.129432
},
{
"epoch": 2.9984321103794294,
"eval_loss": 0.226530522108078,
"eval_runtime": 15.3991,
"eval_samples_per_second": 16.689,
"eval_steps_per_second": 4.221,
"eval_token_acc": 0.9283601162342892,
"step": 1194
}
],
"logging_steps": 5,
"max_steps": 1194,
"num_input_tokens_seen": 0,
"num_train_epochs": 3,
"save_steps": 20,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 1.446724275481346e+18,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}