{ "best_global_step": 780, "best_metric": 0.21140252, "best_model_checkpoint": "/data/home/scyb089/CODE/scripts/ms-swift/3b-new/v35-20250515-190329/checkpoint-780", "epoch": 2.9984321103794294, "eval_steps": 20, "global_step": 1194, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.002508623392913139, "grad_norm": 2.42844295501709, "learning_rate": 9.999982692639099e-06, "loss": 0.3909474313259125, "memory(GiB)": 27.73, "step": 1, "token_acc": 0.894524376358555, "train_speed(iter/s)": 0.067547 }, { "epoch": 0.012543116964565695, "grad_norm": 1.4327075481414795, "learning_rate": 9.999567321968297e-06, "loss": 0.3400489389896393, "memory(GiB)": 27.77, "step": 5, "token_acc": 0.8959139922567434, "train_speed(iter/s)": 0.120631 }, { "epoch": 0.02508623392913139, "grad_norm": 1.0735282897949219, "learning_rate": 9.998269362757298e-06, "loss": 0.29977970123291015, "memory(GiB)": 27.77, "step": 10, "token_acc": 0.9025726353513375, "train_speed(iter/s)": 0.135778 }, { "epoch": 0.03762935089369708, "grad_norm": 1.0521410703659058, "learning_rate": 9.996106347006378e-06, "loss": 0.29440090656280515, "memory(GiB)": 27.77, "step": 15, "token_acc": 0.9007310504040016, "train_speed(iter/s)": 0.142102 }, { "epoch": 0.05017246785826278, "grad_norm": 0.9543823599815369, "learning_rate": 9.993078649071297e-06, "loss": 0.2636571884155273, "memory(GiB)": 27.77, "step": 20, "token_acc": 0.9062953050072488, "train_speed(iter/s)": 0.1454 }, { "epoch": 0.05017246785826278, "eval_loss": 0.2918511629104614, "eval_runtime": 15.4309, "eval_samples_per_second": 16.655, "eval_steps_per_second": 4.212, "eval_token_acc": 0.9070563316178273, "step": 20 }, { "epoch": 0.06271558482282848, "grad_norm": 0.832170307636261, "learning_rate": 9.989186792959408e-06, "loss": 0.2766774892807007, "memory(GiB)": 27.77, "step": 25, "token_acc": 0.906058171787138, "train_speed(iter/s)": 0.125214 }, { "epoch": 0.07525870178739416, "grad_norm": 0.9243336319923401, "learning_rate": 9.984431452238968e-06, "loss": 0.2811694383621216, "memory(GiB)": 27.77, "step": 30, "token_acc": 0.903684501937887, "train_speed(iter/s)": 0.129949 }, { "epoch": 0.08780181875195986, "grad_norm": 0.8159760236740112, "learning_rate": 9.97881344992256e-06, "loss": 0.27519750595092773, "memory(GiB)": 27.77, "step": 35, "token_acc": 0.9162855786290827, "train_speed(iter/s)": 0.1336 }, { "epoch": 0.10034493571652556, "grad_norm": 0.7792373895645142, "learning_rate": 9.97233375832466e-06, "loss": 0.2597078561782837, "memory(GiB)": 29.52, "step": 40, "token_acc": 0.9129214970091578, "train_speed(iter/s)": 0.136712 }, { "epoch": 0.10034493571652556, "eval_loss": 0.2732233703136444, "eval_runtime": 15.3078, "eval_samples_per_second": 16.789, "eval_steps_per_second": 4.246, "eval_token_acc": 0.9114851381157442, "step": 40 }, { "epoch": 0.11288805268109126, "grad_norm": 0.8562310934066772, "learning_rate": 9.964993498893349e-06, "loss": 0.2654439449310303, "memory(GiB)": 29.52, "step": 45, "token_acc": 0.9112415484062709, "train_speed(iter/s)": 0.12778 }, { "epoch": 0.12543116964565695, "grad_norm": 0.6892139911651611, "learning_rate": 9.95679394201623e-06, "loss": 0.2535998821258545, "memory(GiB)": 29.52, "step": 50, "token_acc": 0.9140140785820456, "train_speed(iter/s)": 0.129639 }, { "epoch": 0.13797428661022265, "grad_norm": 0.7636090517044067, "learning_rate": 9.947736506800554e-06, "loss": 0.25037508010864257, "memory(GiB)": 29.52, "step": 55, "token_acc": 0.9177434445090652, "train_speed(iter/s)": 0.131231 }, { "epoch": 0.15051740357478832, "grad_norm": 0.8940523862838745, "learning_rate": 9.93782276082762e-06, "loss": 0.266965389251709, "memory(GiB)": 29.52, "step": 60, "token_acc": 0.9066724143239832, "train_speed(iter/s)": 0.13265 }, { "epoch": 0.15051740357478832, "eval_loss": 0.2631765604019165, "eval_runtime": 15.3396, "eval_samples_per_second": 16.754, "eval_steps_per_second": 4.237, "eval_token_acc": 0.9138133249308547, "step": 60 }, { "epoch": 0.16306052053935402, "grad_norm": 0.7258597016334534, "learning_rate": 9.927054419881462e-06, "loss": 0.26306581497192383, "memory(GiB)": 29.52, "step": 65, "token_acc": 0.909740298154283, "train_speed(iter/s)": 0.127128 }, { "epoch": 0.17560363750391972, "grad_norm": 0.7783539891242981, "learning_rate": 9.915433347651909e-06, "loss": 0.25382609367370607, "memory(GiB)": 29.52, "step": 70, "token_acc": 0.9123886777468944, "train_speed(iter/s)": 0.1281 }, { "epoch": 0.18814675446848542, "grad_norm": 1.1043397188186646, "learning_rate": 9.90296155541202e-06, "loss": 0.23381214141845702, "memory(GiB)": 29.52, "step": 75, "token_acc": 0.9195295753432594, "train_speed(iter/s)": 0.129783 }, { "epoch": 0.20068987143305111, "grad_norm": 0.7191760540008545, "learning_rate": 9.88964120167001e-06, "loss": 0.24255027770996093, "memory(GiB)": 29.52, "step": 80, "token_acc": 0.9175339800100245, "train_speed(iter/s)": 0.130834 }, { "epoch": 0.20068987143305111, "eval_loss": 0.2570763826370239, "eval_runtime": 15.3498, "eval_samples_per_second": 16.743, "eval_steps_per_second": 4.235, "eval_token_acc": 0.9149861709204216, "step": 80 }, { "epoch": 0.2132329883976168, "grad_norm": 0.8330841660499573, "learning_rate": 9.875474591795648e-06, "loss": 0.25277366638183596, "memory(GiB)": 29.52, "step": 85, "token_acc": 0.9098456609469825, "train_speed(iter/s)": 0.126852 }, { "epoch": 0.2257761053621825, "grad_norm": 0.8644626140594482, "learning_rate": 9.860464177621286e-06, "loss": 0.24066619873046874, "memory(GiB)": 29.52, "step": 90, "token_acc": 0.916673759468891, "train_speed(iter/s)": 0.128058 }, { "epoch": 0.2383192223267482, "grad_norm": 0.7505571246147156, "learning_rate": 9.84461255701751e-06, "loss": 0.23320527076721193, "memory(GiB)": 29.52, "step": 95, "token_acc": 0.9196099359596351, "train_speed(iter/s)": 0.129334 }, { "epoch": 0.2508623392913139, "grad_norm": 0.7608115673065186, "learning_rate": 9.827922473443518e-06, "loss": 0.24348812103271483, "memory(GiB)": 29.52, "step": 100, "token_acc": 0.9140099444281954, "train_speed(iter/s)": 0.130537 }, { "epoch": 0.2508623392913139, "eval_loss": 0.25154590606689453, "eval_runtime": 15.3221, "eval_samples_per_second": 16.773, "eval_steps_per_second": 4.242, "eval_token_acc": 0.9158176662115324, "step": 100 }, { "epoch": 0.2634054562558796, "grad_norm": 0.7926483154296875, "learning_rate": 9.810396815472316e-06, "loss": 0.23999102115631105, "memory(GiB)": 29.52, "step": 105, "token_acc": 0.9220618814590141, "train_speed(iter/s)": 0.127275 }, { "epoch": 0.2759485732204453, "grad_norm": 0.9673748016357422, "learning_rate": 9.79203861629078e-06, "loss": 0.23904500007629395, "memory(GiB)": 29.52, "step": 110, "token_acc": 0.9187058260355363, "train_speed(iter/s)": 0.128262 }, { "epoch": 0.288491690185011, "grad_norm": 0.7872106432914734, "learning_rate": 9.772851053174708e-06, "loss": 0.26188173294067385, "memory(GiB)": 29.52, "step": 115, "token_acc": 0.9111253401632784, "train_speed(iter/s)": 0.129 }, { "epoch": 0.30103480714957664, "grad_norm": 0.7694645524024963, "learning_rate": 9.752837446938915e-06, "loss": 0.24416761398315429, "memory(GiB)": 29.52, "step": 120, "token_acc": 0.9147327249022165, "train_speed(iter/s)": 0.130005 }, { "epoch": 0.30103480714957664, "eval_loss": 0.24855056405067444, "eval_runtime": 15.3887, "eval_samples_per_second": 16.701, "eval_steps_per_second": 4.224, "eval_token_acc": 0.9167979553968421, "step": 120 }, { "epoch": 0.31357792411414237, "grad_norm": 0.7051243185997009, "learning_rate": 9.732001261362503e-06, "loss": 0.23072781562805175, "memory(GiB)": 29.52, "step": 125, "token_acc": 0.9187640553279319, "train_speed(iter/s)": 0.127297 }, { "epoch": 0.32612104107870804, "grad_norm": 0.803512454032898, "learning_rate": 9.710346102589376e-06, "loss": 0.25793311595916746, "memory(GiB)": 29.52, "step": 130, "token_acc": 0.9111067822473297, "train_speed(iter/s)": 0.12833 }, { "epoch": 0.33866415804327377, "grad_norm": 0.7955958247184753, "learning_rate": 9.687875718504126e-06, "loss": 0.24592311382293702, "memory(GiB)": 29.52, "step": 135, "token_acc": 0.9190104465618184, "train_speed(iter/s)": 0.129138 }, { "epoch": 0.35120727500783944, "grad_norm": 0.678006112575531, "learning_rate": 9.664593998083374e-06, "loss": 0.22953214645385742, "memory(GiB)": 29.52, "step": 140, "token_acc": 0.9226280527339529, "train_speed(iter/s)": 0.129642 }, { "epoch": 0.35120727500783944, "eval_loss": 0.24559736251831055, "eval_runtime": 15.3298, "eval_samples_per_second": 16.765, "eval_steps_per_second": 4.24, "eval_token_acc": 0.9174456464657074, "step": 140 }, { "epoch": 0.36375039197240516, "grad_norm": 0.7531142830848694, "learning_rate": 9.640504970722708e-06, "loss": 0.23890395164489747, "memory(GiB)": 29.52, "step": 145, "token_acc": 0.9222668078822143, "train_speed(iter/s)": 0.12752 }, { "epoch": 0.37629350893697083, "grad_norm": 0.8114349842071533, "learning_rate": 9.615612805539305e-06, "loss": 0.23889353275299072, "memory(GiB)": 29.52, "step": 150, "token_acc": 0.9085244337160019, "train_speed(iter/s)": 0.128096 }, { "epoch": 0.38883662590153656, "grad_norm": 0.7049622535705566, "learning_rate": 9.589921810650379e-06, "loss": 0.232946515083313, "memory(GiB)": 29.52, "step": 155, "token_acc": 0.9203438851593387, "train_speed(iter/s)": 0.128953 }, { "epoch": 0.40137974286610223, "grad_norm": 0.7752684354782104, "learning_rate": 9.563436432427571e-06, "loss": 0.23360769748687743, "memory(GiB)": 29.52, "step": 160, "token_acc": 0.9222483562302881, "train_speed(iter/s)": 0.129792 }, { "epoch": 0.40137974286610223, "eval_loss": 0.24146369099617004, "eval_runtime": 15.3815, "eval_samples_per_second": 16.708, "eval_steps_per_second": 4.226, "eval_token_acc": 0.9184959563071106, "step": 160 }, { "epoch": 0.4139228598306679, "grad_norm": 0.7400842308998108, "learning_rate": 9.536161254727407e-06, "loss": 0.2393019676208496, "memory(GiB)": 29.52, "step": 165, "token_acc": 0.9168263867036645, "train_speed(iter/s)": 0.127877 }, { "epoch": 0.4264659767952336, "grad_norm": 0.7236588597297668, "learning_rate": 9.508100998097971e-06, "loss": 0.2513608455657959, "memory(GiB)": 29.52, "step": 170, "token_acc": 0.9139457376451596, "train_speed(iter/s)": 0.128605 }, { "epoch": 0.4390090937597993, "grad_norm": 0.8037694692611694, "learning_rate": 9.479260518961904e-06, "loss": 0.2478844165802002, "memory(GiB)": 29.52, "step": 175, "token_acc": 0.9115485013051696, "train_speed(iter/s)": 0.129344 }, { "epoch": 0.451552210724365, "grad_norm": 0.9048113822937012, "learning_rate": 9.449644808775902e-06, "loss": 0.23607170581817627, "memory(GiB)": 29.52, "step": 180, "token_acc": 0.9241437498352097, "train_speed(iter/s)": 0.130046 }, { "epoch": 0.451552210724365, "eval_loss": 0.2386324554681778, "eval_runtime": 15.3252, "eval_samples_per_second": 16.77, "eval_steps_per_second": 4.241, "eval_token_acc": 0.9196863074607009, "step": 180 }, { "epoch": 0.4640953276889307, "grad_norm": 0.7141282558441162, "learning_rate": 9.419258993166846e-06, "loss": 0.20708115100860597, "memory(GiB)": 29.52, "step": 185, "token_acc": 0.9238369894099848, "train_speed(iter/s)": 0.128063 }, { "epoch": 0.4766384446534964, "grad_norm": 0.7230116724967957, "learning_rate": 9.388108331044687e-06, "loss": 0.23321809768676757, "memory(GiB)": 29.52, "step": 190, "token_acc": 0.9096602473774855, "train_speed(iter/s)": 0.128687 }, { "epoch": 0.4891815616180621, "grad_norm": 0.7285059094429016, "learning_rate": 9.356198213692297e-06, "loss": 0.23624110221862793, "memory(GiB)": 29.52, "step": 195, "token_acc": 0.920982395600248, "train_speed(iter/s)": 0.129409 }, { "epoch": 0.5017246785826278, "grad_norm": 0.7466290593147278, "learning_rate": 9.323534163832387e-06, "loss": 0.24186329841613768, "memory(GiB)": 29.52, "step": 200, "token_acc": 0.9228281640452741, "train_speed(iter/s)": 0.129868 }, { "epoch": 0.5017246785826278, "eval_loss": 0.23571519553661346, "eval_runtime": 15.3374, "eval_samples_per_second": 16.756, "eval_steps_per_second": 4.238, "eval_token_acc": 0.9199576375030634, "step": 200 }, { "epoch": 0.5142677955471935, "grad_norm": 0.7634557485580444, "learning_rate": 9.290121834671669e-06, "loss": 0.21729581356048583, "memory(GiB)": 29.52, "step": 205, "token_acc": 0.9223603414707204, "train_speed(iter/s)": 0.128301 }, { "epoch": 0.5268109125117592, "grad_norm": 0.7724491357803345, "learning_rate": 9.255967008922475e-06, "loss": 0.2301187515258789, "memory(GiB)": 29.52, "step": 210, "token_acc": 0.9205742490820442, "train_speed(iter/s)": 0.128765 }, { "epoch": 0.5393540294763248, "grad_norm": 0.7458897233009338, "learning_rate": 9.221075597801912e-06, "loss": 0.232729172706604, "memory(GiB)": 29.52, "step": 215, "token_acc": 0.9231800040784223, "train_speed(iter/s)": 0.129189 }, { "epoch": 0.5518971464408906, "grad_norm": 0.7217942476272583, "learning_rate": 9.18545364000882e-06, "loss": 0.2349705934524536, "memory(GiB)": 29.52, "step": 220, "token_acc": 0.928037487448399, "train_speed(iter/s)": 0.1297 }, { "epoch": 0.5518971464408906, "eval_loss": 0.2342594563961029, "eval_runtime": 15.3349, "eval_samples_per_second": 16.759, "eval_steps_per_second": 4.239, "eval_token_acc": 0.9202202149634142, "step": 220 }, { "epoch": 0.5644402634054563, "grad_norm": 0.7608616352081299, "learning_rate": 9.14910730067863e-06, "loss": 0.21356439590454102, "memory(GiB)": 29.52, "step": 225, "token_acc": 0.9212297890244635, "train_speed(iter/s)": 0.128148 }, { "epoch": 0.576983380370022, "grad_norm": 0.8077455759048462, "learning_rate": 9.112042870316365e-06, "loss": 0.2328458309173584, "memory(GiB)": 29.52, "step": 230, "token_acc": 0.9207193449011296, "train_speed(iter/s)": 0.128672 }, { "epoch": 0.5895264973345876, "grad_norm": 0.7404952049255371, "learning_rate": 9.074266763707937e-06, "loss": 0.22884457111358641, "memory(GiB)": 29.52, "step": 235, "token_acc": 0.9248362445414847, "train_speed(iter/s)": 0.129176 }, { "epoch": 0.6020696142991533, "grad_norm": 0.7511395215988159, "learning_rate": 9.035785518809928e-06, "loss": 0.2402876615524292, "memory(GiB)": 29.52, "step": 240, "token_acc": 0.9122142796598197, "train_speed(iter/s)": 0.129623 }, { "epoch": 0.6020696142991533, "eval_loss": 0.23062308132648468, "eval_runtime": 15.3592, "eval_samples_per_second": 16.733, "eval_steps_per_second": 4.232, "eval_token_acc": 0.9214718341910864, "step": 240 }, { "epoch": 0.6146127312637191, "grad_norm": 0.7077146172523499, "learning_rate": 8.996605795618054e-06, "loss": 0.23445332050323486, "memory(GiB)": 29.52, "step": 245, "token_acc": 0.9197372222813607, "train_speed(iter/s)": 0.128267 }, { "epoch": 0.6271558482282847, "grad_norm": 0.7274831533432007, "learning_rate": 8.956734375014525e-06, "loss": 0.23018431663513184, "memory(GiB)": 29.52, "step": 250, "token_acc": 0.9160428120247982, "train_speed(iter/s)": 0.128573 }, { "epoch": 0.6396989651928504, "grad_norm": 0.80959552526474, "learning_rate": 8.916178157594453e-06, "loss": 0.23876335620880126, "memory(GiB)": 29.52, "step": 255, "token_acc": 0.9136212624584718, "train_speed(iter/s)": 0.129029 }, { "epoch": 0.6522420821574161, "grad_norm": 0.712291955947876, "learning_rate": 8.87494416247157e-06, "loss": 0.22411136627197265, "memory(GiB)": 29.52, "step": 260, "token_acc": 0.9208987563444243, "train_speed(iter/s)": 0.129407 }, { "epoch": 0.6522420821574161, "eval_loss": 0.22862213850021362, "eval_runtime": 15.3722, "eval_samples_per_second": 16.718, "eval_steps_per_second": 4.228, "eval_token_acc": 0.9216206280852851, "step": 260 }, { "epoch": 0.6647851991219819, "grad_norm": 0.7888270616531372, "learning_rate": 8.833039526063414e-06, "loss": 0.2441627025604248, "memory(GiB)": 29.52, "step": 265, "token_acc": 0.9171242536081855, "train_speed(iter/s)": 0.128365 }, { "epoch": 0.6773283160865475, "grad_norm": 0.7412445545196533, "learning_rate": 8.790471500856229e-06, "loss": 0.22171931266784667, "memory(GiB)": 29.52, "step": 270, "token_acc": 0.9284303020849581, "train_speed(iter/s)": 0.128765 }, { "epoch": 0.6898714330511132, "grad_norm": 0.7740799784660339, "learning_rate": 8.747247454149754e-06, "loss": 0.22348260879516602, "memory(GiB)": 29.52, "step": 275, "token_acc": 0.9197459900366781, "train_speed(iter/s)": 0.129119 }, { "epoch": 0.7024145500156789, "grad_norm": 0.7354733943939209, "learning_rate": 8.703374866782172e-06, "loss": 0.22540512084960937, "memory(GiB)": 29.52, "step": 280, "token_acc": 0.9234182832509192, "train_speed(iter/s)": 0.129642 }, { "epoch": 0.7024145500156789, "eval_loss": 0.2274494767189026, "eval_runtime": 15.3359, "eval_samples_per_second": 16.758, "eval_steps_per_second": 4.238, "eval_token_acc": 0.9218744529636242, "step": 280 }, { "epoch": 0.7149576669802445, "grad_norm": 0.7532041072845459, "learning_rate": 8.658861331835384e-06, "loss": 0.23445098400115966, "memory(GiB)": 29.52, "step": 285, "token_acc": 0.9171991760513615, "train_speed(iter/s)": 0.128533 }, { "epoch": 0.7275007839448103, "grad_norm": 0.7499911189079285, "learning_rate": 8.613714553320863e-06, "loss": 0.2278836727142334, "memory(GiB)": 29.52, "step": 290, "token_acc": 0.9228026662532941, "train_speed(iter/s)": 0.128913 }, { "epoch": 0.740043900909376, "grad_norm": 0.6617085337638855, "learning_rate": 8.567942344846311e-06, "loss": 0.2379608631134033, "memory(GiB)": 31.81, "step": 295, "token_acc": 0.927406815051757, "train_speed(iter/s)": 0.129437 }, { "epoch": 0.7525870178739417, "grad_norm": 0.7833521366119385, "learning_rate": 8.521552628263362e-06, "loss": 0.22896957397460938, "memory(GiB)": 31.81, "step": 300, "token_acc": 0.9195584489102746, "train_speed(iter/s)": 0.129723 }, { "epoch": 0.7525870178739417, "eval_loss": 0.22518841922283173, "eval_runtime": 15.3817, "eval_samples_per_second": 16.708, "eval_steps_per_second": 4.226, "eval_token_acc": 0.9226796905087, "step": 300 }, { "epoch": 0.7651301348385073, "grad_norm": 0.6266347169876099, "learning_rate": 8.474553432296517e-06, "loss": 0.2120736598968506, "memory(GiB)": 31.81, "step": 305, "token_acc": 0.919751809720786, "train_speed(iter/s)": 0.12866 }, { "epoch": 0.7776732518030731, "grad_norm": 0.7510045170783997, "learning_rate": 8.426952891153617e-06, "loss": 0.22617723941802978, "memory(GiB)": 31.81, "step": 310, "token_acc": 0.9176977822402032, "train_speed(iter/s)": 0.12898 }, { "epoch": 0.7902163687676388, "grad_norm": 0.7557322978973389, "learning_rate": 8.378759243118044e-06, "loss": 0.2307964563369751, "memory(GiB)": 31.81, "step": 315, "token_acc": 0.9214413607878246, "train_speed(iter/s)": 0.129388 }, { "epoch": 0.8027594857322045, "grad_norm": 0.802083432674408, "learning_rate": 8.329980829122907e-06, "loss": 0.23063960075378417, "memory(GiB)": 31.81, "step": 320, "token_acc": 0.9320303956481507, "train_speed(iter/s)": 0.129686 }, { "epoch": 0.8027594857322045, "eval_loss": 0.22348652780056, "eval_runtime": 15.4058, "eval_samples_per_second": 16.682, "eval_steps_per_second": 4.219, "eval_token_acc": 0.9227497111647937, "step": 320 }, { "epoch": 0.8153026026967701, "grad_norm": 0.7171165943145752, "learning_rate": 8.280626091307466e-06, "loss": 0.22461018562316895, "memory(GiB)": 31.81, "step": 325, "token_acc": 0.9275779995411791, "train_speed(iter/s)": 0.128615 }, { "epoch": 0.8278457196613358, "grad_norm": 0.68876051902771, "learning_rate": 8.23070357155605e-06, "loss": 0.2177454948425293, "memory(GiB)": 31.81, "step": 330, "token_acc": 0.9271033235989431, "train_speed(iter/s)": 0.128983 }, { "epoch": 0.8403888366259016, "grad_norm": 0.6879884600639343, "learning_rate": 8.18022191001969e-06, "loss": 0.22483336925506592, "memory(GiB)": 31.81, "step": 335, "token_acc": 0.9234863606121091, "train_speed(iter/s)": 0.129291 }, { "epoch": 0.8529319535904673, "grad_norm": 0.7674379348754883, "learning_rate": 8.129189843620766e-06, "loss": 0.23122897148132324, "memory(GiB)": 31.81, "step": 340, "token_acc": 0.920080478399374, "train_speed(iter/s)": 0.129653 }, { "epoch": 0.8529319535904673, "eval_loss": 0.2233850359916687, "eval_runtime": 15.3643, "eval_samples_per_second": 16.727, "eval_steps_per_second": 4.231, "eval_token_acc": 0.9229860308791094, "step": 340 }, { "epoch": 0.8654750705550329, "grad_norm": 0.7207924723625183, "learning_rate": 8.077616204540897e-06, "loss": 0.21113083362579346, "memory(GiB)": 31.81, "step": 345, "token_acc": 0.9231676937196801, "train_speed(iter/s)": 0.128783 }, { "epoch": 0.8780181875195986, "grad_norm": 0.720832109451294, "learning_rate": 8.02550991869234e-06, "loss": 0.22612943649291992, "memory(GiB)": 31.81, "step": 350, "token_acc": 0.9200727685110807, "train_speed(iter/s)": 0.129034 }, { "epoch": 0.8905613044841643, "grad_norm": 0.70830237865448, "learning_rate": 7.972880004173175e-06, "loss": 0.2191091537475586, "memory(GiB)": 31.81, "step": 355, "token_acc": 0.92017787659811, "train_speed(iter/s)": 0.129291 }, { "epoch": 0.90310442144873, "grad_norm": 0.7826217412948608, "learning_rate": 7.919735569706533e-06, "loss": 0.23212652206420897, "memory(GiB)": 31.81, "step": 360, "token_acc": 0.9170923379174852, "train_speed(iter/s)": 0.129652 }, { "epoch": 0.90310442144873, "eval_loss": 0.22133058309555054, "eval_runtime": 15.4085, "eval_samples_per_second": 16.679, "eval_steps_per_second": 4.218, "eval_token_acc": 0.9237912684241851, "step": 360 }, { "epoch": 0.9156475384132957, "grad_norm": 0.7471039295196533, "learning_rate": 7.86608581306413e-06, "loss": 0.22391505241394044, "memory(GiB)": 31.81, "step": 365, "token_acc": 0.9232560554146457, "train_speed(iter/s)": 0.128776 }, { "epoch": 0.9281906553778614, "grad_norm": 0.7498065233230591, "learning_rate": 7.811940019474414e-06, "loss": 0.21148476600646973, "memory(GiB)": 31.81, "step": 370, "token_acc": 0.9247934832491969, "train_speed(iter/s)": 0.129029 }, { "epoch": 0.940733772342427, "grad_norm": 0.7913779616355896, "learning_rate": 7.757307560015539e-06, "loss": 0.2337519645690918, "memory(GiB)": 31.81, "step": 375, "token_acc": 0.9195318016403237, "train_speed(iter/s)": 0.129291 }, { "epoch": 0.9532768893069928, "grad_norm": 0.7540809512138367, "learning_rate": 7.702197889993515e-06, "loss": 0.22583358287811278, "memory(GiB)": 31.81, "step": 380, "token_acc": 0.912510441085334, "train_speed(iter/s)": 0.129502 }, { "epoch": 0.9532768893069928, "eval_loss": 0.22044962644577026, "eval_runtime": 15.3936, "eval_samples_per_second": 16.695, "eval_steps_per_second": 4.223, "eval_token_acc": 0.9241851346147113, "step": 380 }, { "epoch": 0.9658200062715585, "grad_norm": 0.6508920192718506, "learning_rate": 7.646620547305765e-06, "loss": 0.21882102489471436, "memory(GiB)": 31.81, "step": 385, "token_acc": 0.929311731244602, "train_speed(iter/s)": 0.128683 }, { "epoch": 0.9783631232361242, "grad_norm": 0.724659264087677, "learning_rate": 7.590585150790388e-06, "loss": 0.22737913131713866, "memory(GiB)": 31.81, "step": 390, "token_acc": 0.9233074204946996, "train_speed(iter/s)": 0.128946 }, { "epoch": 0.9909062402006898, "grad_norm": 0.7416620254516602, "learning_rate": 7.5341013985614064e-06, "loss": 0.21617236137390136, "memory(GiB)": 31.81, "step": 395, "token_acc": 0.9227556855964889, "train_speed(iter/s)": 0.129211 }, { "epoch": 1.0050172467858263, "grad_norm": 0.7598711252212524, "learning_rate": 7.47717906633032e-06, "loss": 0.24872393608093263, "memory(GiB)": 31.81, "step": 400, "token_acc": 0.9263680772819584, "train_speed(iter/s)": 0.129375 }, { "epoch": 1.0050172467858263, "eval_loss": 0.21866728365421295, "eval_runtime": 15.3428, "eval_samples_per_second": 16.75, "eval_steps_per_second": 4.237, "eval_token_acc": 0.9249028463396702, "step": 400 }, { "epoch": 1.017560363750392, "grad_norm": 0.7288981676101685, "learning_rate": 7.419828005714195e-06, "loss": 0.15233672857284547, "memory(GiB)": 31.81, "step": 405, "token_acc": 0.9344547117883116, "train_speed(iter/s)": 0.128614 }, { "epoch": 1.0301034807149576, "grad_norm": 0.7562277317047119, "learning_rate": 7.362058142530639e-06, "loss": 0.15367655754089354, "memory(GiB)": 31.81, "step": 410, "token_acc": 0.9494212236984662, "train_speed(iter/s)": 0.128849 }, { "epoch": 1.0426465976795234, "grad_norm": 0.6314442753791809, "learning_rate": 7.303879475079931e-06, "loss": 0.16216965913772582, "memory(GiB)": 31.81, "step": 415, "token_acc": 0.9469148079746176, "train_speed(iter/s)": 0.129162 }, { "epoch": 1.055189714644089, "grad_norm": 0.78495854139328, "learning_rate": 7.245302072414602e-06, "loss": 0.1717313528060913, "memory(GiB)": 31.81, "step": 420, "token_acc": 0.9351895455615729, "train_speed(iter/s)": 0.129404 }, { "epoch": 1.055189714644089, "eval_loss": 0.22395090758800507, "eval_runtime": 15.3916, "eval_samples_per_second": 16.697, "eval_steps_per_second": 4.223, "eval_token_acc": 0.9238000210061968, "step": 420 }, { "epoch": 1.0677328316086547, "grad_norm": 0.6953550577163696, "learning_rate": 7.1863360725967615e-06, "loss": 0.1437358021736145, "memory(GiB)": 31.81, "step": 425, "token_acc": 0.9337246309594255, "train_speed(iter/s)": 0.128699 }, { "epoch": 1.0802759485732205, "grad_norm": 0.6609600186347961, "learning_rate": 7.126991680943508e-06, "loss": 0.15338196754455566, "memory(GiB)": 31.81, "step": 430, "token_acc": 0.945504234651081, "train_speed(iter/s)": 0.12898 }, { "epoch": 1.092819065537786, "grad_norm": 0.7515889406204224, "learning_rate": 7.067279168260671e-06, "loss": 0.1485868811607361, "memory(GiB)": 31.81, "step": 435, "token_acc": 0.949219850166169, "train_speed(iter/s)": 0.129246 }, { "epoch": 1.1053621825023519, "grad_norm": 0.6615680456161499, "learning_rate": 7.007208869065232e-06, "loss": 0.15130412578582764, "memory(GiB)": 31.81, "step": 440, "token_acc": 0.9493087557603687, "train_speed(iter/s)": 0.129455 }, { "epoch": 1.1053621825023519, "eval_loss": 0.2233077436685562, "eval_runtime": 15.3696, "eval_samples_per_second": 16.721, "eval_steps_per_second": 4.229, "eval_token_acc": 0.9245002275671323, "step": 440 }, { "epoch": 1.1179052994669174, "grad_norm": 0.7569933533668518, "learning_rate": 6.946791179796718e-06, "loss": 0.15562827587127687, "memory(GiB)": 31.81, "step": 445, "token_acc": 0.9341226472374013, "train_speed(iter/s)": 0.12878 }, { "epoch": 1.1304484164314832, "grad_norm": 0.6801967024803162, "learning_rate": 6.886036557017881e-06, "loss": 0.15977808237075805, "memory(GiB)": 31.81, "step": 450, "token_acc": 0.9431299171995168, "train_speed(iter/s)": 0.129107 }, { "epoch": 1.142991533396049, "grad_norm": 0.7558472752571106, "learning_rate": 6.824955515604957e-06, "loss": 0.16626831293106079, "memory(GiB)": 31.81, "step": 455, "token_acc": 0.9411939411939412, "train_speed(iter/s)": 0.129394 }, { "epoch": 1.1555346503606145, "grad_norm": 0.7011389136314392, "learning_rate": 6.76355862692786e-06, "loss": 0.16757216453552246, "memory(GiB)": 31.81, "step": 460, "token_acc": 0.9417196619914626, "train_speed(iter/s)": 0.129606 }, { "epoch": 1.1555346503606145, "eval_loss": 0.22205203771591187, "eval_runtime": 15.3552, "eval_samples_per_second": 16.737, "eval_steps_per_second": 4.233, "eval_token_acc": 0.9254892693344536, "step": 460 }, { "epoch": 1.1680777673251803, "grad_norm": 0.8131189942359924, "learning_rate": 6.701856517020565e-06, "loss": 0.1730912446975708, "memory(GiB)": 31.81, "step": 465, "token_acc": 0.9293166877751643, "train_speed(iter/s)": 0.128975 }, { "epoch": 1.180620884289746, "grad_norm": 0.6982389092445374, "learning_rate": 6.639859864742058e-06, "loss": 0.16429152488708496, "memory(GiB)": 31.81, "step": 470, "token_acc": 0.9323867882229862, "train_speed(iter/s)": 0.129168 }, { "epoch": 1.1931640012543117, "grad_norm": 0.7796806693077087, "learning_rate": 6.5775793999281345e-06, "loss": 0.16015057563781737, "memory(GiB)": 31.81, "step": 475, "token_acc": 0.9489819908778859, "train_speed(iter/s)": 0.129368 }, { "epoch": 1.2057071182188774, "grad_norm": 0.7008464336395264, "learning_rate": 6.515025901534364e-06, "loss": 0.15645363330841064, "memory(GiB)": 31.81, "step": 480, "token_acc": 0.9448942141623489, "train_speed(iter/s)": 0.129561 }, { "epoch": 1.2057071182188774, "eval_loss": 0.2242305725812912, "eval_runtime": 15.3471, "eval_samples_per_second": 16.746, "eval_steps_per_second": 4.235, "eval_token_acc": 0.9244127017470154, "step": 480 }, { "epoch": 1.218250235183443, "grad_norm": 0.7552674412727356, "learning_rate": 6.452210195770571e-06, "loss": 0.1517507791519165, "memory(GiB)": 31.81, "step": 485, "token_acc": 0.9361768149057109, "train_speed(iter/s)": 0.128932 }, { "epoch": 1.2307933521480088, "grad_norm": 0.7274335622787476, "learning_rate": 6.389143154227128e-06, "loss": 0.16204409599304198, "memory(GiB)": 31.81, "step": 490, "token_acc": 0.9486543909348442, "train_speed(iter/s)": 0.129125 }, { "epoch": 1.2433364691125746, "grad_norm": 0.748831570148468, "learning_rate": 6.325835691993394e-06, "loss": 0.15379858016967773, "memory(GiB)": 31.81, "step": 495, "token_acc": 0.9465945037564255, "train_speed(iter/s)": 0.129385 }, { "epoch": 1.2558795860771401, "grad_norm": 0.893355667591095, "learning_rate": 6.2622987657686305e-06, "loss": 0.1658052921295166, "memory(GiB)": 31.81, "step": 500, "token_acc": 0.947743023038022, "train_speed(iter/s)": 0.129623 }, { "epoch": 1.2558795860771401, "eval_loss": 0.22251112759113312, "eval_runtime": 15.3679, "eval_samples_per_second": 16.723, "eval_steps_per_second": 4.23, "eval_token_acc": 0.9248678360116235, "step": 500 }, { "epoch": 1.268422703041706, "grad_norm": 0.7303951978683472, "learning_rate": 6.198543371965711e-06, "loss": 0.16348928213119507, "memory(GiB)": 31.81, "step": 505, "token_acc": 0.9349806335063304, "train_speed(iter/s)": 0.129005 }, { "epoch": 1.2809658200062715, "grad_norm": 0.8302243947982788, "learning_rate": 6.134580544807951e-06, "loss": 0.1597007393836975, "memory(GiB)": 31.81, "step": 510, "token_acc": 0.9454098648411444, "train_speed(iter/s)": 0.129135 }, { "epoch": 1.2935089369708372, "grad_norm": 0.7296594381332397, "learning_rate": 6.070421354419418e-06, "loss": 0.16336345672607422, "memory(GiB)": 31.81, "step": 515, "token_acc": 0.9398956481184598, "train_speed(iter/s)": 0.129324 }, { "epoch": 1.306052053935403, "grad_norm": 0.7305130958557129, "learning_rate": 6.006076904908996e-06, "loss": 0.15892908573150635, "memory(GiB)": 31.81, "step": 520, "token_acc": 0.9507138423339541, "train_speed(iter/s)": 0.129551 }, { "epoch": 1.306052053935403, "eval_loss": 0.22138828039169312, "eval_runtime": 15.3657, "eval_samples_per_second": 16.726, "eval_steps_per_second": 4.23, "eval_token_acc": 0.9247190421174246, "step": 520 }, { "epoch": 1.3185951708999686, "grad_norm": 0.7403632998466492, "learning_rate": 5.9415583324485895e-06, "loss": 0.16314858198165894, "memory(GiB)": 31.81, "step": 525, "token_acc": 0.931472803221991, "train_speed(iter/s)": 0.129018 }, { "epoch": 1.3311382878645344, "grad_norm": 0.7020546793937683, "learning_rate": 5.876876803345777e-06, "loss": 0.15857114791870117, "memory(GiB)": 31.81, "step": 530, "token_acc": 0.9462052151791392, "train_speed(iter/s)": 0.129237 }, { "epoch": 1.3436814048291001, "grad_norm": 0.6946777701377869, "learning_rate": 5.812043512111237e-06, "loss": 0.16228172779083253, "memory(GiB)": 31.81, "step": 535, "token_acc": 0.9411285875587533, "train_speed(iter/s)": 0.129436 }, { "epoch": 1.3562245217936657, "grad_norm": 0.711567223072052, "learning_rate": 5.747069679521306e-06, "loss": 0.16026302576065063, "memory(GiB)": 31.81, "step": 540, "token_acc": 0.9492771873268524, "train_speed(iter/s)": 0.129674 }, { "epoch": 1.3562245217936657, "eval_loss": 0.2199857234954834, "eval_runtime": 15.3525, "eval_samples_per_second": 16.74, "eval_steps_per_second": 4.234, "eval_token_acc": 0.9259444035990617, "step": 540 }, { "epoch": 1.3687676387582315, "grad_norm": 0.7763009071350098, "learning_rate": 5.681966550675981e-06, "loss": 0.15383946895599365, "memory(GiB)": 31.81, "step": 545, "token_acc": 0.9333074612277752, "train_speed(iter/s)": 0.129103 }, { "epoch": 1.381310755722797, "grad_norm": 0.754088282585144, "learning_rate": 5.616745393052725e-06, "loss": 0.15939451456069947, "memory(GiB)": 31.81, "step": 550, "token_acc": 0.9464760826493065, "train_speed(iter/s)": 0.129287 }, { "epoch": 1.3938538726873628, "grad_norm": 0.7275711894035339, "learning_rate": 5.551417494556376e-06, "loss": 0.15393273830413817, "memory(GiB)": 31.81, "step": 555, "token_acc": 0.9460861238928638, "train_speed(iter/s)": 0.129442 }, { "epoch": 1.4063969896519284, "grad_norm": 0.6778993010520935, "learning_rate": 5.4859941615655495e-06, "loss": 0.16530011892318724, "memory(GiB)": 31.81, "step": 560, "token_acc": 0.9377745897964673, "train_speed(iter/s)": 0.129634 }, { "epoch": 1.4063969896519284, "eval_loss": 0.21840627491474152, "eval_runtime": 15.3572, "eval_samples_per_second": 16.735, "eval_steps_per_second": 4.233, "eval_token_acc": 0.925795609704863, "step": 560 }, { "epoch": 1.4189401066164942, "grad_norm": 0.7403908371925354, "learning_rate": 5.4204867169758265e-06, "loss": 0.14913086891174315, "memory(GiB)": 31.81, "step": 565, "token_acc": 0.9394371658864914, "train_speed(iter/s)": 0.129028 }, { "epoch": 1.43148322358106, "grad_norm": 0.7867358922958374, "learning_rate": 5.35490649824008e-06, "loss": 0.17901339530944824, "memory(GiB)": 31.81, "step": 570, "token_acc": 0.9368613331921427, "train_speed(iter/s)": 0.129242 }, { "epoch": 1.4440263405456255, "grad_norm": 0.7289626002311707, "learning_rate": 5.289264855406295e-06, "loss": 0.1573652982711792, "memory(GiB)": 31.81, "step": 575, "token_acc": 0.9441503874276983, "train_speed(iter/s)": 0.129439 }, { "epoch": 1.4565694575101913, "grad_norm": 0.723175585269928, "learning_rate": 5.223573149153197e-06, "loss": 0.1556238889694214, "memory(GiB)": 31.81, "step": 580, "token_acc": 0.9394716940363008, "train_speed(iter/s)": 0.129619 }, { "epoch": 1.4565694575101913, "eval_loss": 0.21749961376190186, "eval_runtime": 15.3632, "eval_samples_per_second": 16.728, "eval_steps_per_second": 4.231, "eval_token_acc": 0.9257430942127928, "step": 580 }, { "epoch": 1.469112574474757, "grad_norm": 0.7443521022796631, "learning_rate": 5.157842748824053e-06, "loss": 0.15476609468460084, "memory(GiB)": 31.81, "step": 585, "token_acc": 0.9340939774111758, "train_speed(iter/s)": 0.129067 }, { "epoch": 1.4816556914393226, "grad_norm": 0.8059399127960205, "learning_rate": 5.092085030458957e-06, "loss": 0.15709525346755981, "memory(GiB)": 31.81, "step": 590, "token_acc": 0.9359229370311435, "train_speed(iter/s)": 0.129147 }, { "epoch": 1.4941988084038884, "grad_norm": 0.7224918007850647, "learning_rate": 5.026311374825969e-06, "loss": 0.14287755489349366, "memory(GiB)": 31.81, "step": 595, "token_acc": 0.9447071216835298, "train_speed(iter/s)": 0.12923 }, { "epoch": 1.5067419253684542, "grad_norm": 0.7575579881668091, "learning_rate": 4.960533165451435e-06, "loss": 0.16114065647125245, "memory(GiB)": 31.81, "step": 600, "token_acc": 0.9444704368676531, "train_speed(iter/s)": 0.129449 }, { "epoch": 1.5067419253684542, "eval_loss": 0.2169800102710724, "eval_runtime": 15.3901, "eval_samples_per_second": 16.699, "eval_steps_per_second": 4.223, "eval_token_acc": 0.9261544655673424, "step": 600 }, { "epoch": 1.5192850423330198, "grad_norm": 0.6867368817329407, "learning_rate": 4.894761786649815e-06, "loss": 0.1530630111694336, "memory(GiB)": 31.81, "step": 605, "token_acc": 0.9384248996465161, "train_speed(iter/s)": 0.128875 }, { "epoch": 1.5318281592975853, "grad_norm": 0.7576408386230469, "learning_rate": 4.829008621553401e-06, "loss": 0.15166678428649902, "memory(GiB)": 31.81, "step": 610, "token_acc": 0.9431903961818492, "train_speed(iter/s)": 0.129109 }, { "epoch": 1.544371276262151, "grad_norm": 0.7608903050422668, "learning_rate": 4.763285050142211e-06, "loss": 0.17192583084106444, "memory(GiB)": 31.81, "step": 615, "token_acc": 0.93989472085843, "train_speed(iter/s)": 0.129365 }, { "epoch": 1.5569143932267169, "grad_norm": 0.7976657152175903, "learning_rate": 4.697602447274454e-06, "loss": 0.16986348628997802, "memory(GiB)": 31.81, "step": 620, "token_acc": 0.9434366754617414, "train_speed(iter/s)": 0.129534 }, { "epoch": 1.5569143932267169, "eval_loss": 0.21612223982810974, "eval_runtime": 15.3679, "eval_samples_per_second": 16.723, "eval_steps_per_second": 4.23, "eval_token_acc": 0.9266708679060323, "step": 620 }, { "epoch": 1.5694575101912824, "grad_norm": 0.6765289306640625, "learning_rate": 4.631972180717859e-06, "loss": 0.14983587265014647, "memory(GiB)": 31.81, "step": 625, "token_acc": 0.931841074426413, "train_speed(iter/s)": 0.12904 }, { "epoch": 1.5820006271558482, "grad_norm": 0.726507306098938, "learning_rate": 4.566405609182247e-06, "loss": 0.16202863454818725, "memory(GiB)": 31.81, "step": 630, "token_acc": 0.9474066189278111, "train_speed(iter/s)": 0.129215 }, { "epoch": 1.594543744120414, "grad_norm": 0.7189328670501709, "learning_rate": 4.500914080353666e-06, "loss": 0.1547753095626831, "memory(GiB)": 31.81, "step": 635, "token_acc": 0.9415881650524082, "train_speed(iter/s)": 0.129409 }, { "epoch": 1.6070868610849796, "grad_norm": 0.6717737317085266, "learning_rate": 4.435508928930431e-06, "loss": 0.1501192569732666, "memory(GiB)": 31.81, "step": 640, "token_acc": 0.9476487510324988, "train_speed(iter/s)": 0.129518 }, { "epoch": 1.6070868610849796, "eval_loss": 0.21533308923244476, "eval_runtime": 15.3725, "eval_samples_per_second": 16.718, "eval_steps_per_second": 4.228, "eval_token_acc": 0.9266883730700557, "step": 640 }, { "epoch": 1.6196299780495453, "grad_norm": 0.7199254035949707, "learning_rate": 4.3702014746614135e-06, "loss": 0.1601256847381592, "memory(GiB)": 31.81, "step": 645, "token_acc": 0.9370883453415381, "train_speed(iter/s)": 0.128942 }, { "epoch": 1.6321730950141111, "grad_norm": 0.7428786754608154, "learning_rate": 4.305003020386922e-06, "loss": 0.16339280605316162, "memory(GiB)": 31.81, "step": 650, "token_acc": 0.9402134435938985, "train_speed(iter/s)": 0.129165 }, { "epoch": 1.6447162119786767, "grad_norm": 0.6674877405166626, "learning_rate": 4.239924850082501e-06, "loss": 0.15751969814300537, "memory(GiB)": 31.81, "step": 655, "token_acc": 0.9428207992057582, "train_speed(iter/s)": 0.129329 }, { "epoch": 1.6572593289432422, "grad_norm": 0.7335858345031738, "learning_rate": 4.1749782269060045e-06, "loss": 0.1551824688911438, "memory(GiB)": 31.81, "step": 660, "token_acc": 0.9432031679047316, "train_speed(iter/s)": 0.129436 }, { "epoch": 1.6572593289432422, "eval_loss": 0.21479374170303345, "eval_runtime": 15.3588, "eval_samples_per_second": 16.733, "eval_steps_per_second": 4.232, "eval_token_acc": 0.9272660434828275, "step": 660 }, { "epoch": 1.6698024459078082, "grad_norm": 0.7220312356948853, "learning_rate": 4.110174391248268e-06, "loss": 0.15914130210876465, "memory(GiB)": 31.81, "step": 665, "token_acc": 0.9325106594877222, "train_speed(iter/s)": 0.12899 }, { "epoch": 1.6823455628723738, "grad_norm": 0.6705756187438965, "learning_rate": 4.045524558787712e-06, "loss": 0.1455508589744568, "memory(GiB)": 31.81, "step": 670, "token_acc": 0.95000137661408, "train_speed(iter/s)": 0.129143 }, { "epoch": 1.6948886798369394, "grad_norm": 0.7751862406730652, "learning_rate": 3.9810399185492406e-06, "loss": 0.16772797107696533, "memory(GiB)": 31.81, "step": 675, "token_acc": 0.9432926683124416, "train_speed(iter/s)": 0.129298 }, { "epoch": 1.7074317968015051, "grad_norm": 0.6835960149765015, "learning_rate": 3.916731630967741e-06, "loss": 0.148516845703125, "memory(GiB)": 31.81, "step": 680, "token_acc": 0.9397804716241481, "train_speed(iter/s)": 0.129488 }, { "epoch": 1.7074317968015051, "eval_loss": 0.21434009075164795, "eval_runtime": 15.3644, "eval_samples_per_second": 16.727, "eval_steps_per_second": 4.231, "eval_token_acc": 0.9270209711865001, "step": 680 }, { "epoch": 1.719974913766071, "grad_norm": 0.7121639251708984, "learning_rate": 3.852610825956529e-06, "loss": 0.15527284145355225, "memory(GiB)": 31.81, "step": 685, "token_acc": 0.9362297584483223, "train_speed(iter/s)": 0.129069 }, { "epoch": 1.7325180307306365, "grad_norm": 0.70497727394104, "learning_rate": 3.788688600981085e-06, "loss": 0.15706214904785157, "memory(GiB)": 31.81, "step": 690, "token_acc": 0.945192257525956, "train_speed(iter/s)": 0.129196 }, { "epoch": 1.7450611476952023, "grad_norm": 0.6827052235603333, "learning_rate": 3.7249760191384055e-06, "loss": 0.14694638252258302, "memory(GiB)": 31.81, "step": 695, "token_acc": 0.9522423156598174, "train_speed(iter/s)": 0.129354 }, { "epoch": 1.757604264659768, "grad_norm": 0.7271601557731628, "learning_rate": 3.6614841072422913e-06, "loss": 0.1638465404510498, "memory(GiB)": 31.81, "step": 700, "token_acc": 0.9435711526461237, "train_speed(iter/s)": 0.129542 }, { "epoch": 1.757604264659768, "eval_loss": 0.2132289856672287, "eval_runtime": 15.3732, "eval_samples_per_second": 16.717, "eval_steps_per_second": 4.228, "eval_token_acc": 0.927563631271225, "step": 700 }, { "epoch": 1.7701473816243336, "grad_norm": 0.7114645838737488, "learning_rate": 3.5982238539149287e-06, "loss": 0.15001455545425416, "memory(GiB)": 31.81, "step": 705, "token_acc": 0.9358007313453388, "train_speed(iter/s)": 0.129143 }, { "epoch": 1.7826904985888994, "grad_norm": 0.7541443705558777, "learning_rate": 3.535206207685079e-06, "loss": 0.15614376068115235, "memory(GiB)": 31.81, "step": 710, "token_acc": 0.9451783170888374, "train_speed(iter/s)": 0.129254 }, { "epoch": 1.7952336155534652, "grad_norm": 0.7407529950141907, "learning_rate": 3.472442075093192e-06, "loss": 0.1589871883392334, "memory(GiB)": 31.81, "step": 715, "token_acc": 0.9350007719623282, "train_speed(iter/s)": 0.129419 }, { "epoch": 1.8077767325180307, "grad_norm": 0.7716948390007019, "learning_rate": 3.4099423188038094e-06, "loss": 0.15787534713745116, "memory(GiB)": 31.81, "step": 720, "token_acc": 0.9492842652647219, "train_speed(iter/s)": 0.129594 }, { "epoch": 1.8077767325180307, "eval_loss": 0.21319042146205902, "eval_runtime": 15.3493, "eval_samples_per_second": 16.743, "eval_steps_per_second": 4.235, "eval_token_acc": 0.9274848580331198, "step": 720 }, { "epoch": 1.8203198494825963, "grad_norm": 0.744939923286438, "learning_rate": 3.347717755725547e-06, "loss": 0.15603610277175903, "memory(GiB)": 31.81, "step": 725, "token_acc": 0.9345954499920149, "train_speed(iter/s)": 0.129224 }, { "epoch": 1.832862966447162, "grad_norm": 0.7879869937896729, "learning_rate": 3.2857791551389907e-06, "loss": 0.1529020071029663, "memory(GiB)": 31.81, "step": 730, "token_acc": 0.9493445833961127, "train_speed(iter/s)": 0.129406 }, { "epoch": 1.8454060834117278, "grad_norm": 0.6601085662841797, "learning_rate": 3.224137236832859e-06, "loss": 0.14167948961257934, "memory(GiB)": 31.81, "step": 735, "token_acc": 0.9515996958530737, "train_speed(iter/s)": 0.129532 }, { "epoch": 1.8579492003762934, "grad_norm": 0.6988480687141418, "learning_rate": 3.1628026692487053e-06, "loss": 0.1586320996284485, "memory(GiB)": 31.81, "step": 740, "token_acc": 0.9414518601086805, "train_speed(iter/s)": 0.129659 }, { "epoch": 1.8579492003762934, "eval_loss": 0.21269367635250092, "eval_runtime": 15.37, "eval_samples_per_second": 16.721, "eval_steps_per_second": 4.229, "eval_token_acc": 0.9280625284458915, "step": 740 }, { "epoch": 1.8704923173408592, "grad_norm": 0.727496325969696, "learning_rate": 3.1017860676345184e-06, "loss": 0.16212354898452758, "memory(GiB)": 31.81, "step": 745, "token_acc": 0.9331751365641573, "train_speed(iter/s)": 0.129252 }, { "epoch": 1.883035434305425, "grad_norm": 0.6366550922393799, "learning_rate": 3.0410979922075344e-06, "loss": 0.15711357593536376, "memory(GiB)": 31.81, "step": 750, "token_acc": 0.9437845985913663, "train_speed(iter/s)": 0.129389 }, { "epoch": 1.8955785512699905, "grad_norm": 0.7146003246307373, "learning_rate": 2.980748946326564e-06, "loss": 0.1518003225326538, "memory(GiB)": 31.81, "step": 755, "token_acc": 0.9483841528881254, "train_speed(iter/s)": 0.129526 }, { "epoch": 1.9081216682345563, "grad_norm": 0.6720646619796753, "learning_rate": 2.920749374674161e-06, "loss": 0.15349475145339966, "memory(GiB)": 31.81, "step": 760, "token_acc": 0.945, "train_speed(iter/s)": 0.129667 }, { "epoch": 1.9081216682345563, "eval_loss": 0.21246011555194855, "eval_runtime": 15.3545, "eval_samples_per_second": 16.738, "eval_steps_per_second": 4.233, "eval_token_acc": 0.9276336519273186, "step": 760 }, { "epoch": 1.920664785199122, "grad_norm": 0.7045518755912781, "learning_rate": 2.861109661448952e-06, "loss": 0.15071908235549927, "memory(GiB)": 31.81, "step": 765, "token_acc": 0.937086689912228, "train_speed(iter/s)": 0.129279 }, { "epoch": 1.9332079021636877, "grad_norm": 0.70011967420578, "learning_rate": 2.8018401285684284e-06, "loss": 0.1453996181488037, "memory(GiB)": 31.81, "step": 770, "token_acc": 0.9489197957797842, "train_speed(iter/s)": 0.12943 }, { "epoch": 1.9457510191282532, "grad_norm": 0.7138105630874634, "learning_rate": 2.7429510338825206e-06, "loss": 0.14368767738342286, "memory(GiB)": 31.81, "step": 775, "token_acc": 0.9417082448253717, "train_speed(iter/s)": 0.129571 }, { "epoch": 1.9582941360928192, "grad_norm": 0.7411118149757385, "learning_rate": 2.6844525693982614e-06, "loss": 0.1606222152709961, "memory(GiB)": 31.81, "step": 780, "token_acc": 0.944643557880968, "train_speed(iter/s)": 0.129663 }, { "epoch": 1.9582941360928192, "eval_loss": 0.2114025205373764, "eval_runtime": 15.379, "eval_samples_per_second": 16.711, "eval_steps_per_second": 4.227, "eval_token_acc": 0.928220074922102, "step": 780 }, { "epoch": 1.9708372530573848, "grad_norm": 0.7422724366188049, "learning_rate": 2.6263548595158374e-06, "loss": 0.15853983163833618, "memory(GiB)": 31.81, "step": 785, "token_acc": 0.9366524932354078, "train_speed(iter/s)": 0.129249 }, { "epoch": 1.9833803700219503, "grad_norm": 0.7750598192214966, "learning_rate": 2.568667959276351e-06, "loss": 0.15706416368484497, "memory(GiB)": 31.81, "step": 790, "token_acc": 0.9499685404959753, "train_speed(iter/s)": 0.12939 }, { "epoch": 1.9959234869865161, "grad_norm": 0.6972166895866394, "learning_rate": 2.5114018526215843e-06, "loss": 0.15649087429046632, "memory(GiB)": 31.81, "step": 795, "token_acc": 0.9408999669690271, "train_speed(iter/s)": 0.129553 }, { "epoch": 2.0100344935716525, "grad_norm": 0.6763654351234436, "learning_rate": 2.454566450666061e-06, "loss": 0.15049003362655639, "memory(GiB)": 31.81, "step": 800, "token_acc": 0.9530306241390273, "train_speed(iter/s)": 0.129615 }, { "epoch": 2.0100344935716525, "eval_loss": 0.21210120618343353, "eval_runtime": 15.3555, "eval_samples_per_second": 16.737, "eval_steps_per_second": 4.233, "eval_token_acc": 0.9283163533242307, "step": 800 }, { "epoch": 2.022577610536218, "grad_norm": 0.6350038647651672, "learning_rate": 2.398171589981721e-06, "loss": 0.10892703533172607, "memory(GiB)": 31.81, "step": 805, "token_acc": 0.9476837338906304, "train_speed(iter/s)": 0.12922 }, { "epoch": 2.035120727500784, "grad_norm": 0.6500776410102844, "learning_rate": 2.3422270308954936e-06, "loss": 0.1064380407333374, "memory(GiB)": 31.81, "step": 810, "token_acc": 0.9628300589097216, "train_speed(iter/s)": 0.129369 }, { "epoch": 2.0476638444653497, "grad_norm": 0.6957349181175232, "learning_rate": 2.286742455800059e-06, "loss": 0.10609914064407348, "memory(GiB)": 31.81, "step": 815, "token_acc": 0.9647304470327791, "train_speed(iter/s)": 0.129502 }, { "epoch": 2.060206961429915, "grad_norm": 0.7038280963897705, "learning_rate": 2.2317274674781158e-06, "loss": 0.1041153073310852, "memory(GiB)": 31.81, "step": 820, "token_acc": 0.9643880707130899, "train_speed(iter/s)": 0.129593 }, { "epoch": 2.060206961429915, "eval_loss": 0.23022687435150146, "eval_runtime": 15.3909, "eval_samples_per_second": 16.698, "eval_steps_per_second": 4.223, "eval_token_acc": 0.9276424045093302, "step": 820 }, { "epoch": 2.072750078394481, "grad_norm": 0.8562469482421875, "learning_rate": 2.1771915874404094e-06, "loss": 0.11885223388671876, "memory(GiB)": 31.81, "step": 825, "token_acc": 0.9438533042412649, "train_speed(iter/s)": 0.12923 }, { "epoch": 2.085293195359047, "grad_norm": 0.6420326828956604, "learning_rate": 2.1231442542778317e-06, "loss": 0.11257556676864625, "memory(GiB)": 31.81, "step": 830, "token_acc": 0.9660501458879382, "train_speed(iter/s)": 0.129354 }, { "epoch": 2.0978363123236123, "grad_norm": 0.6728197932243347, "learning_rate": 2.0695948220278756e-06, "loss": 0.11477745771408081, "memory(GiB)": 31.81, "step": 835, "token_acc": 0.9606660351961713, "train_speed(iter/s)": 0.12949 }, { "epoch": 2.110379429288178, "grad_norm": 0.7246009111404419, "learning_rate": 2.0165525585557205e-06, "loss": 0.11393618583679199, "memory(GiB)": 31.81, "step": 840, "token_acc": 0.9608159022995972, "train_speed(iter/s)": 0.129643 }, { "epoch": 2.110379429288178, "eval_loss": 0.22520191967487335, "eval_runtime": 15.3743, "eval_samples_per_second": 16.716, "eval_steps_per_second": 4.228, "eval_token_acc": 0.9278262087315758, "step": 840 }, { "epoch": 2.122922546252744, "grad_norm": 0.7262341380119324, "learning_rate": 1.964026643950226e-06, "loss": 0.10375577211380005, "memory(GiB)": 31.81, "step": 845, "token_acc": 0.9489552718925005, "train_speed(iter/s)": 0.129239 }, { "epoch": 2.1354656632173095, "grad_norm": 0.7589318752288818, "learning_rate": 1.9120261689351317e-06, "loss": 0.11369407176971436, "memory(GiB)": 31.81, "step": 850, "token_acc": 0.9638739431206764, "train_speed(iter/s)": 0.129365 }, { "epoch": 2.148008780181875, "grad_norm": 0.7323006391525269, "learning_rate": 1.860560133295708e-06, "loss": 0.11056618690490723, "memory(GiB)": 31.81, "step": 855, "token_acc": 0.9616726487788961, "train_speed(iter/s)": 0.129496 }, { "epoch": 2.160551897146441, "grad_norm": 0.6986774206161499, "learning_rate": 1.8096374443211545e-06, "loss": 0.10637121200561524, "memory(GiB)": 31.81, "step": 860, "token_acc": 0.9640018078855714, "train_speed(iter/s)": 0.129604 }, { "epoch": 2.160551897146441, "eval_loss": 0.22789862751960754, "eval_runtime": 15.3904, "eval_samples_per_second": 16.699, "eval_steps_per_second": 4.223, "eval_token_acc": 0.9274586002870847, "step": 860 }, { "epoch": 2.1730950141110066, "grad_norm": 0.6732742786407471, "learning_rate": 1.7592669152630082e-06, "loss": 0.10579054355621338, "memory(GiB)": 31.81, "step": 865, "token_acc": 0.9454877249898618, "train_speed(iter/s)": 0.129231 }, { "epoch": 2.185638131075572, "grad_norm": 0.7679221034049988, "learning_rate": 1.7094572638098122e-06, "loss": 0.10716142654418945, "memory(GiB)": 31.81, "step": 870, "token_acc": 0.9636935391652373, "train_speed(iter/s)": 0.129367 }, { "epoch": 2.198181248040138, "grad_norm": 0.7014066576957703, "learning_rate": 1.6602171105783488e-06, "loss": 0.1035423994064331, "memory(GiB)": 31.81, "step": 875, "token_acc": 0.9624011843906254, "train_speed(iter/s)": 0.12952 }, { "epoch": 2.2107243650047037, "grad_norm": 0.7253413200378418, "learning_rate": 1.61155497762165e-06, "loss": 0.10561528205871581, "memory(GiB)": 31.81, "step": 880, "token_acc": 0.9681256194898012, "train_speed(iter/s)": 0.129624 }, { "epoch": 2.2107243650047037, "eval_loss": 0.22809092700481415, "eval_runtime": 15.3879, "eval_samples_per_second": 16.701, "eval_steps_per_second": 4.224, "eval_token_acc": 0.927423589959038, "step": 880 }, { "epoch": 2.2232674819692693, "grad_norm": 0.6759311556816101, "learning_rate": 1.5634792869540782e-06, "loss": 0.11813747882843018, "memory(GiB)": 31.81, "step": 885, "token_acc": 0.9463408677719589, "train_speed(iter/s)": 0.12928 }, { "epoch": 2.235810598933835, "grad_norm": 0.6786462664604187, "learning_rate": 1.5159983590937183e-06, "loss": 0.09899504780769348, "memory(GiB)": 31.81, "step": 890, "token_acc": 0.9641708663306936, "train_speed(iter/s)": 0.129383 }, { "epoch": 2.248353715898401, "grad_norm": 0.7053468823432922, "learning_rate": 1.4691204116223357e-06, "loss": 0.11507067680358887, "memory(GiB)": 31.81, "step": 895, "token_acc": 0.9575259738401214, "train_speed(iter/s)": 0.129501 }, { "epoch": 2.2608968328629664, "grad_norm": 0.7843905687332153, "learning_rate": 1.4228535577631442e-06, "loss": 0.10749893188476563, "memory(GiB)": 31.81, "step": 900, "token_acc": 0.9568620265424181, "train_speed(iter/s)": 0.129634 }, { "epoch": 2.2608968328629664, "eval_loss": 0.2279745191335678, "eval_runtime": 15.3783, "eval_samples_per_second": 16.712, "eval_steps_per_second": 4.227, "eval_token_acc": 0.9276336519273186, "step": 900 }, { "epoch": 2.273439949827532, "grad_norm": 0.7689437866210938, "learning_rate": 1.3772058049766491e-06, "loss": 0.10860542058944703, "memory(GiB)": 31.81, "step": 905, "token_acc": 0.9446734581062939, "train_speed(iter/s)": 0.129286 }, { "epoch": 2.285983066792098, "grad_norm": 0.8241957426071167, "learning_rate": 1.3321850535747822e-06, "loss": 0.12034444808959961, "memory(GiB)": 31.81, "step": 910, "token_acc": 0.9542774256614007, "train_speed(iter/s)": 0.129401 }, { "epoch": 2.2985261837566635, "grad_norm": 0.6636318564414978, "learning_rate": 1.2877990953535841e-06, "loss": 0.10744799375534057, "memory(GiB)": 31.81, "step": 915, "token_acc": 0.9670476136460312, "train_speed(iter/s)": 0.129533 }, { "epoch": 2.311069300721229, "grad_norm": 0.696555495262146, "learning_rate": 1.2440556122446701e-06, "loss": 0.11220449209213257, "memory(GiB)": 31.81, "step": 920, "token_acc": 0.9617257008561356, "train_speed(iter/s)": 0.129627 }, { "epoch": 2.311069300721229, "eval_loss": 0.22779622673988342, "eval_runtime": 15.4115, "eval_samples_per_second": 16.676, "eval_steps_per_second": 4.218, "eval_token_acc": 0.9276511570913419, "step": 920 }, { "epoch": 2.323612417685795, "grad_norm": 0.7180680632591248, "learning_rate": 1.2009621749857103e-06, "loss": 0.10242276191711426, "memory(GiB)": 31.81, "step": 925, "token_acc": 0.9447967352064041, "train_speed(iter/s)": 0.129303 }, { "epoch": 2.3361555346503606, "grad_norm": 0.7456693649291992, "learning_rate": 1.1585262418101468e-06, "loss": 0.10643236637115479, "memory(GiB)": 31.81, "step": 930, "token_acc": 0.9578788036953912, "train_speed(iter/s)": 0.129454 }, { "epoch": 2.348698651614926, "grad_norm": 0.7959876656532288, "learning_rate": 1.1167551571563967e-06, "loss": 0.10762505531311035, "memory(GiB)": 31.81, "step": 935, "token_acc": 0.9615673799884327, "train_speed(iter/s)": 0.129587 }, { "epoch": 2.361241768579492, "grad_norm": 0.7502437233924866, "learning_rate": 1.0756561503967366e-06, "loss": 0.11327018737792968, "memory(GiB)": 31.81, "step": 940, "token_acc": 0.9572353022167148, "train_speed(iter/s)": 0.129692 }, { "epoch": 2.361241768579492, "eval_loss": 0.2275438755750656, "eval_runtime": 15.3749, "eval_samples_per_second": 16.716, "eval_steps_per_second": 4.228, "eval_token_acc": 0.9278612190596226, "step": 940 }, { "epoch": 2.3737848855440578, "grad_norm": 0.7785040736198425, "learning_rate": 1.0352363345861067e-06, "loss": 0.1163412094116211, "memory(GiB)": 31.81, "step": 945, "token_acc": 0.9469440871152063, "train_speed(iter/s)": 0.129374 }, { "epoch": 2.3863280025086233, "grad_norm": 0.7529416680335999, "learning_rate": 9.955027052310445e-07, "loss": 0.1082146406173706, "memory(GiB)": 31.81, "step": 950, "token_acc": 0.9666347763692896, "train_speed(iter/s)": 0.12948 }, { "epoch": 2.3988711194731893, "grad_norm": 0.7093843221664429, "learning_rate": 9.564621390789692e-07, "loss": 0.10433540344238282, "memory(GiB)": 31.81, "step": 955, "token_acc": 0.9620772386038232, "train_speed(iter/s)": 0.129551 }, { "epoch": 2.411414236437755, "grad_norm": 0.7402180433273315, "learning_rate": 9.181213929280047e-07, "loss": 0.1084256649017334, "memory(GiB)": 31.81, "step": 960, "token_acc": 0.9655060201757241, "train_speed(iter/s)": 0.12968 }, { "epoch": 2.411414236437755, "eval_loss": 0.22712615132331848, "eval_runtime": 15.3736, "eval_samples_per_second": 16.717, "eval_steps_per_second": 4.228, "eval_token_acc": 0.9277211777474355, "step": 960 }, { "epoch": 2.4239573534023204, "grad_norm": 0.7065171599388123, "learning_rate": 8.804871024575851e-07, "loss": 0.1058305025100708, "memory(GiB)": 31.81, "step": 965, "token_acc": 0.9411054200749178, "train_speed(iter/s)": 0.129327 }, { "epoch": 2.436500470366886, "grad_norm": 0.7312522530555725, "learning_rate": 8.435657810799991e-07, "loss": 0.11365176439285278, "memory(GiB)": 31.81, "step": 970, "token_acc": 0.9554801532746365, "train_speed(iter/s)": 0.129412 }, { "epoch": 2.449043587331452, "grad_norm": 0.7271402478218079, "learning_rate": 8.073638188131128e-07, "loss": 0.11030232906341553, "memory(GiB)": 31.81, "step": 975, "token_acc": 0.9618299257450921, "train_speed(iter/s)": 0.129519 }, { "epoch": 2.4615867042960176, "grad_norm": 0.729744017124176, "learning_rate": 7.71887481174437e-07, "loss": 0.10576653480529785, "memory(GiB)": 31.81, "step": 980, "token_acc": 0.9634010868586184, "train_speed(iter/s)": 0.129607 }, { "epoch": 2.4615867042960176, "eval_loss": 0.22756896913051605, "eval_runtime": 15.389, "eval_samples_per_second": 16.7, "eval_steps_per_second": 4.224, "eval_token_acc": 0.9279312397157161, "step": 980 }, { "epoch": 2.474129821260583, "grad_norm": 0.8634856343269348, "learning_rate": 7.371429080967468e-07, "loss": 0.09780678153038025, "memory(GiB)": 31.81, "step": 985, "token_acc": 0.9456286316041047, "train_speed(iter/s)": 0.129279 }, { "epoch": 2.486672938225149, "grad_norm": 0.672733724117279, "learning_rate": 7.031361128654402e-07, "loss": 0.10667885541915893, "memory(GiB)": 31.81, "step": 990, "token_acc": 0.9594269307734694, "train_speed(iter/s)": 0.129407 }, { "epoch": 2.4992160551897147, "grad_norm": 0.760313093662262, "learning_rate": 6.698729810778065e-07, "loss": 0.11521060466766357, "memory(GiB)": 31.81, "step": 995, "token_acc": 0.9575349257736169, "train_speed(iter/s)": 0.12955 }, { "epoch": 2.5117591721542802, "grad_norm": 0.702035665512085, "learning_rate": 6.373592696244024e-07, "loss": 0.11087181568145751, "memory(GiB)": 31.81, "step": 1000, "token_acc": 0.9578573542468186, "train_speed(iter/s)": 0.129663 }, { "epoch": 2.5117591721542802, "eval_loss": 0.227799654006958, "eval_runtime": 15.3792, "eval_samples_per_second": 16.711, "eval_steps_per_second": 4.227, "eval_token_acc": 0.9277299303294472, "step": 1000 }, { "epoch": 2.524302289118846, "grad_norm": 0.7296103835105896, "learning_rate": 6.056006056926978e-07, "loss": 0.10585801601409912, "memory(GiB)": 31.81, "step": 1005, "token_acc": 0.948129963898917, "train_speed(iter/s)": 0.129334 }, { "epoch": 2.536845406083412, "grad_norm": 0.6856093406677246, "learning_rate": 5.746024857931732e-07, "loss": 0.10559420585632324, "memory(GiB)": 31.81, "step": 1010, "token_acc": 0.9610920907561075, "train_speed(iter/s)": 0.129436 }, { "epoch": 2.5493885230479774, "grad_norm": 0.6898284554481506, "learning_rate": 5.443702748080288e-07, "loss": 0.10710105895996094, "memory(GiB)": 31.81, "step": 1015, "token_acc": 0.9610382616656346, "train_speed(iter/s)": 0.129565 }, { "epoch": 2.561931640012543, "grad_norm": 0.7101157307624817, "learning_rate": 5.149092050626825e-07, "loss": 0.10318450927734375, "memory(GiB)": 31.81, "step": 1020, "token_acc": 0.9633534136546185, "train_speed(iter/s)": 0.12963 }, { "epoch": 2.561931640012543, "eval_loss": 0.22718214988708496, "eval_runtime": 15.3905, "eval_samples_per_second": 16.699, "eval_steps_per_second": 4.223, "eval_token_acc": 0.9277911984035291, "step": 1020 }, { "epoch": 2.574474756977109, "grad_norm": 0.7209934592247009, "learning_rate": 4.862243754202023e-07, "loss": 0.11119084358215332, "memory(GiB)": 31.81, "step": 1025, "token_acc": 0.9460293899361734, "train_speed(iter/s)": 0.129349 }, { "epoch": 2.5870178739416745, "grad_norm": 0.7095735669136047, "learning_rate": 4.5832075039884014e-07, "loss": 0.1083114743232727, "memory(GiB)": 31.81, "step": 1030, "token_acc": 0.9631125846265288, "train_speed(iter/s)": 0.129447 }, { "epoch": 2.59956099090624, "grad_norm": 0.7213476896286011, "learning_rate": 4.3120315931281633e-07, "loss": 0.10071847438812256, "memory(GiB)": 31.81, "step": 1035, "token_acc": 0.9633851013424586, "train_speed(iter/s)": 0.129568 }, { "epoch": 2.612104107870806, "grad_norm": 0.772677481174469, "learning_rate": 4.048762954365054e-07, "loss": 0.11145726442337037, "memory(GiB)": 31.81, "step": 1040, "token_acc": 0.9627473455598455, "train_speed(iter/s)": 0.129711 }, { "epoch": 2.612104107870806, "eval_loss": 0.2263808250427246, "eval_runtime": 15.3525, "eval_samples_per_second": 16.74, "eval_steps_per_second": 4.234, "eval_token_acc": 0.9280012603718096, "step": 1040 }, { "epoch": 2.6246472248353716, "grad_norm": 0.6904744505882263, "learning_rate": 3.793447151921642e-07, "loss": 0.11429480314254761, "memory(GiB)": 31.81, "step": 1045, "token_acc": 0.945939040519418, "train_speed(iter/s)": 0.129419 }, { "epoch": 2.637190341799937, "grad_norm": 0.7401297688484192, "learning_rate": 3.546128373613472e-07, "loss": 0.10656030178070068, "memory(GiB)": 31.81, "step": 1050, "token_acc": 0.9636875146526349, "train_speed(iter/s)": 0.1295 }, { "epoch": 2.649733458764503, "grad_norm": 0.7498672604560852, "learning_rate": 3.30684942320143e-07, "loss": 0.11416795253753662, "memory(GiB)": 31.81, "step": 1055, "token_acc": 0.9633607254179655, "train_speed(iter/s)": 0.129581 }, { "epoch": 2.6622765757290687, "grad_norm": 0.7101024985313416, "learning_rate": 3.0756517129836296e-07, "loss": 0.1097292423248291, "memory(GiB)": 31.81, "step": 1060, "token_acc": 0.9603677715944834, "train_speed(iter/s)": 0.129673 }, { "epoch": 2.6622765757290687, "eval_loss": 0.22645404934883118, "eval_runtime": 15.3936, "eval_samples_per_second": 16.695, "eval_steps_per_second": 4.223, "eval_token_acc": 0.9278524664776109, "step": 1060 }, { "epoch": 2.6748196926936343, "grad_norm": 0.6467409133911133, "learning_rate": 2.8525752566281485e-07, "loss": 0.10393040180206299, "memory(GiB)": 31.81, "step": 1065, "token_acc": 0.9449979310564344, "train_speed(iter/s)": 0.12935 }, { "epoch": 2.6873628096582003, "grad_norm": 0.7203241586685181, "learning_rate": 2.637658662247805e-07, "loss": 0.11105575561523437, "memory(GiB)": 31.81, "step": 1070, "token_acc": 0.9642081358609794, "train_speed(iter/s)": 0.129437 }, { "epoch": 2.699905926622766, "grad_norm": 0.6585695147514343, "learning_rate": 2.430939125718218e-07, "loss": 0.11089683771133423, "memory(GiB)": 31.81, "step": 1075, "token_acc": 0.9604440440864773, "train_speed(iter/s)": 0.129535 }, { "epoch": 2.7124490435873314, "grad_norm": 0.7210690975189209, "learning_rate": 2.232452424240261e-07, "loss": 0.10859737396240235, "memory(GiB)": 31.81, "step": 1080, "token_acc": 0.9596657286603565, "train_speed(iter/s)": 0.129605 }, { "epoch": 2.7124490435873314, "eval_loss": 0.2266274243593216, "eval_runtime": 15.3828, "eval_samples_per_second": 16.707, "eval_steps_per_second": 4.225, "eval_token_acc": 0.928220074922102, "step": 1080 }, { "epoch": 2.7249921605518974, "grad_norm": 0.6953999996185303, "learning_rate": 2.042232910148051e-07, "loss": 0.10121151208877563, "memory(GiB)": 31.81, "step": 1085, "token_acc": 0.9472209455753066, "train_speed(iter/s)": 0.129319 }, { "epoch": 2.737535277516463, "grad_norm": 0.6597380638122559, "learning_rate": 1.860313504963579e-07, "loss": 0.1065935492515564, "memory(GiB)": 31.81, "step": 1090, "token_acc": 0.9662114751443839, "train_speed(iter/s)": 0.129415 }, { "epoch": 2.7500783944810285, "grad_norm": 0.6942236423492432, "learning_rate": 1.6867256936989097e-07, "loss": 0.11052279472351074, "memory(GiB)": 31.81, "step": 1095, "token_acc": 0.9620684756357437, "train_speed(iter/s)": 0.129503 }, { "epoch": 2.762621511445594, "grad_norm": 0.7812759280204773, "learning_rate": 1.521499519407038e-07, "loss": 0.11402370929718017, "memory(GiB)": 31.81, "step": 1100, "token_acc": 0.9662987099348318, "train_speed(iter/s)": 0.129613 }, { "epoch": 2.762621511445594, "eval_loss": 0.2265271693468094, "eval_runtime": 15.3687, "eval_samples_per_second": 16.722, "eval_steps_per_second": 4.229, "eval_token_acc": 0.9280100129538214, "step": 1100 }, { "epoch": 2.7751646284101597, "grad_norm": 0.6834614276885986, "learning_rate": 1.364663577982317e-07, "loss": 0.09805427193641662, "memory(GiB)": 31.81, "step": 1105, "token_acc": 0.9493173799662525, "train_speed(iter/s)": 0.129335 }, { "epoch": 2.7877077453747257, "grad_norm": 0.7146019339561462, "learning_rate": 1.2162450132113202e-07, "loss": 0.1073993444442749, "memory(GiB)": 31.81, "step": 1110, "token_acc": 0.9588939098284893, "train_speed(iter/s)": 0.129429 }, { "epoch": 2.800250862339291, "grad_norm": 0.6562223434448242, "learning_rate": 1.07626951207504e-07, "loss": 0.0982414186000824, "memory(GiB)": 31.81, "step": 1115, "token_acc": 0.9667602620671213, "train_speed(iter/s)": 0.129527 }, { "epoch": 2.8127939793038568, "grad_norm": 0.6855860352516174, "learning_rate": 9.447613003032042e-08, "loss": 0.10424129962921143, "memory(GiB)": 31.81, "step": 1120, "token_acc": 0.965159977034292, "train_speed(iter/s)": 0.129604 }, { "epoch": 2.8127939793038568, "eval_loss": 0.22646446526050568, "eval_runtime": 15.3994, "eval_samples_per_second": 16.689, "eval_steps_per_second": 4.221, "eval_token_acc": 0.9282900955781955, "step": 1120 }, { "epoch": 2.8253370962684228, "grad_norm": 0.7434061169624329, "learning_rate": 8.217431381815078e-08, "loss": 0.10303902626037598, "memory(GiB)": 31.81, "step": 1125, "token_acc": 0.9447586580925079, "train_speed(iter/s)": 0.129305 }, { "epoch": 2.8378802132329883, "grad_norm": 0.719038724899292, "learning_rate": 7.072363166124363e-08, "loss": 0.10360879898071289, "memory(GiB)": 31.81, "step": 1130, "token_acc": 0.960933130941919, "train_speed(iter/s)": 0.129389 }, { "epoch": 2.850423330197554, "grad_norm": 0.7280715107917786, "learning_rate": 6.012606534304688e-08, "loss": 0.10378862619400024, "memory(GiB)": 31.81, "step": 1135, "token_acc": 0.9630866449176706, "train_speed(iter/s)": 0.12948 }, { "epoch": 2.86296644716212, "grad_norm": 0.7042152881622314, "learning_rate": 5.038344899721437e-08, "loss": 0.10662559270858765, "memory(GiB)": 31.81, "step": 1140, "token_acc": 0.9665508368922252, "train_speed(iter/s)": 0.129586 }, { "epoch": 2.86296644716212, "eval_loss": 0.22645802795886993, "eval_runtime": 15.3769, "eval_samples_per_second": 16.713, "eval_steps_per_second": 4.227, "eval_token_acc": 0.928246332668137, "step": 1140 }, { "epoch": 2.8755095641266855, "grad_norm": 0.6806672811508179, "learning_rate": 4.149746879017147e-08, "loss": 0.10936232805252075, "memory(GiB)": 31.81, "step": 1145, "token_acc": 0.9419420343363485, "train_speed(iter/s)": 0.129338 }, { "epoch": 2.888052681091251, "grad_norm": 0.7901387810707092, "learning_rate": 3.3469662629289635e-08, "loss": 0.1104103684425354, "memory(GiB)": 31.81, "step": 1150, "token_acc": 0.96508989778244, "train_speed(iter/s)": 0.129455 }, { "epoch": 2.900595798055817, "grad_norm": 0.6709795594215393, "learning_rate": 2.630141989671542e-08, "loss": 0.10086469650268555, "memory(GiB)": 31.81, "step": 1155, "token_acc": 0.9644157007671202, "train_speed(iter/s)": 0.129535 }, { "epoch": 2.9131389150203826, "grad_norm": 0.7060185074806213, "learning_rate": 1.999398120891116e-08, "loss": 0.09639860391616821, "memory(GiB)": 31.81, "step": 1160, "token_acc": 0.9676043228708827, "train_speed(iter/s)": 0.129612 }, { "epoch": 2.9131389150203826, "eval_loss": 0.22671610116958618, "eval_runtime": 15.358, "eval_samples_per_second": 16.734, "eval_steps_per_second": 4.232, "eval_token_acc": 0.9280450232818681, "step": 1160 }, { "epoch": 2.925682031984948, "grad_norm": 0.67342209815979, "learning_rate": 1.4548438201939518e-08, "loss": 0.11243362426757812, "memory(GiB)": 31.81, "step": 1165, "token_acc": 0.9444314659938637, "train_speed(iter/s)": 0.129336 }, { "epoch": 2.938225148949514, "grad_norm": 0.783845841884613, "learning_rate": 9.965733342532925e-09, "loss": 0.11067414283752441, "memory(GiB)": 31.81, "step": 1170, "token_acc": 0.9621745865187628, "train_speed(iter/s)": 0.129438 }, { "epoch": 2.9507682659140797, "grad_norm": 0.6691847443580627, "learning_rate": 6.246659764979068e-09, "loss": 0.10967533588409424, "memory(GiB)": 31.81, "step": 1175, "token_acc": 0.9629586146169651, "train_speed(iter/s)": 0.129517 }, { "epoch": 2.9633113828786453, "grad_norm": 0.7513623237609863, "learning_rate": 3.3918611338507046e-09, "loss": 0.11406528949737549, "memory(GiB)": 31.81, "step": 1180, "token_acc": 0.9586087420042644, "train_speed(iter/s)": 0.129633 }, { "epoch": 2.9633113828786453, "eval_loss": 0.22674556076526642, "eval_runtime": 15.3693, "eval_samples_per_second": 16.722, "eval_steps_per_second": 4.229, "eval_token_acc": 0.9282025697580787, "step": 1180 }, { "epoch": 2.9758544998432113, "grad_norm": 0.7102883458137512, "learning_rate": 1.4018315326103094e-09, "loss": 0.10815140008926391, "memory(GiB)": 31.81, "step": 1185, "token_acc": 0.944656259381567, "train_speed(iter/s)": 0.129347 }, { "epoch": 2.988397616807777, "grad_norm": 0.7043233513832092, "learning_rate": 2.7691537809293454e-10, "loss": 0.10755873918533325, "memory(GiB)": 31.81, "step": 1190, "token_acc": 0.9614810470757584, "train_speed(iter/s)": 0.129432 }, { "epoch": 2.9984321103794294, "eval_loss": 0.226530522108078, "eval_runtime": 15.3991, "eval_samples_per_second": 16.689, "eval_steps_per_second": 4.221, "eval_token_acc": 0.9283601162342892, "step": 1194 } ], "logging_steps": 5, "max_steps": 1194, "num_input_tokens_seen": 0, "num_train_epochs": 3, "save_steps": 20, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 1.446724275481346e+18, "train_batch_size": 1, "trial_name": null, "trial_params": null }