{ "best_global_step": 160, "best_metric": 0.22079477, "best_model_checkpoint": "/data/home/scyb089/CODE/scripts/ms-swift/3b/v45-20250505-194439/checkpoint-160", "epoch": 2.0, "eval_steps": 20, "global_step": 160, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.012539184952978056, "grad_norm": 2.091893434524536, "learning_rate": 9.999560724782173e-06, "loss": 0.25682932138442993, "memory(GiB)": 32.08, "step": 1, "token_acc": 0.9157879737817042, "train_speed(iter/s)": 0.066524 }, { "epoch": 0.06269592476489028, "grad_norm": 1.1085962057113647, "learning_rate": 9.989021978333996e-06, "loss": 0.24964354932308197, "memory(GiB)": 32.09, "step": 5, "token_acc": 0.9192554520672421, "train_speed(iter/s)": 0.145692 }, { "epoch": 0.12539184952978055, "grad_norm": 0.7571659088134766, "learning_rate": 9.956136120119858e-06, "loss": 0.24026219844818114, "memory(GiB)": 34.41, "step": 10, "token_acc": 0.9036857680925477, "train_speed(iter/s)": 0.167476 }, { "epoch": 0.18808777429467086, "grad_norm": 0.6683992743492126, "learning_rate": 9.901486834023182e-06, "loss": 0.22075538635253905, "memory(GiB)": 34.41, "step": 15, "token_acc": 0.9231363670994918, "train_speed(iter/s)": 0.179433 }, { "epoch": 0.2507836990595611, "grad_norm": 0.5858739614486694, "learning_rate": 9.825314096462686e-06, "loss": 0.22184286117553711, "memory(GiB)": 34.41, "step": 20, "token_acc": 0.9236703251459961, "train_speed(iter/s)": 0.186854 }, { "epoch": 0.2507836990595611, "eval_loss": 0.24446986615657806, "eval_runtime": 1.7885, "eval_samples_per_second": 28.515, "eval_steps_per_second": 7.269, "eval_token_acc": 0.9234064427690198, "step": 20 }, { "epoch": 0.31347962382445144, "grad_norm": 0.6544387936592102, "learning_rate": 9.72795239782369e-06, "loss": 0.21392316818237306, "memory(GiB)": 34.41, "step": 25, "token_acc": 0.9248752048165225, "train_speed(iter/s)": 0.170828 }, { "epoch": 0.3761755485893417, "grad_norm": 0.5335580110549927, "learning_rate": 9.609829273641034e-06, "loss": 0.2093721866607666, "memory(GiB)": 34.41, "step": 30, "token_acc": 0.924183943537715, "train_speed(iter/s)": 0.176002 }, { "epoch": 0.438871473354232, "grad_norm": 0.5717173218727112, "learning_rate": 9.47146342720133e-06, "loss": 0.22015037536621093, "memory(GiB)": 34.41, "step": 35, "token_acc": 0.9232907930720146, "train_speed(iter/s)": 0.180804 }, { "epoch": 0.5015673981191222, "grad_norm": 0.5479745864868164, "learning_rate": 9.3134624518086e-06, "loss": 0.21302032470703125, "memory(GiB)": 34.41, "step": 40, "token_acc": 0.9254576695445578, "train_speed(iter/s)": 0.183086 }, { "epoch": 0.5015673981191222, "eval_loss": 0.23297670483589172, "eval_runtime": 1.7792, "eval_samples_per_second": 28.665, "eval_steps_per_second": 7.307, "eval_token_acc": 0.9267477724468814, "step": 40 }, { "epoch": 0.5642633228840125, "grad_norm": 0.49755069613456726, "learning_rate": 9.136520162715288e-06, "loss": 0.199961519241333, "memory(GiB)": 34.41, "step": 45, "token_acc": 0.9316015164899882, "train_speed(iter/s)": 0.174455 }, { "epoch": 0.6269592476489029, "grad_norm": 0.48646634817123413, "learning_rate": 8.94141355043471e-06, "loss": 0.19662439823150635, "memory(GiB)": 34.41, "step": 50, "token_acc": 0.9299179785685937, "train_speed(iter/s)": 0.177304 }, { "epoch": 0.6896551724137931, "grad_norm": 0.49679994583129883, "learning_rate": 8.728999368813591e-06, "loss": 0.19584870338439941, "memory(GiB)": 34.41, "step": 55, "token_acc": 0.9341005748968819, "train_speed(iter/s)": 0.17898 }, { "epoch": 0.7523510971786834, "grad_norm": 0.5154221653938293, "learning_rate": 8.500210372847128e-06, "loss": 0.19981801509857178, "memory(GiB)": 34.41, "step": 60, "token_acc": 0.9348041080258653, "train_speed(iter/s)": 0.181111 }, { "epoch": 0.7523510971786834, "eval_loss": 0.22815200686454773, "eval_runtime": 1.7511, "eval_samples_per_second": 29.125, "eval_steps_per_second": 7.424, "eval_token_acc": 0.9284270047978067, "step": 60 }, { "epoch": 0.8150470219435737, "grad_norm": 0.5291805863380432, "learning_rate": 8.256051222757188e-06, "loss": 0.19705500602722167, "memory(GiB)": 34.41, "step": 65, "token_acc": 0.9243072938311218, "train_speed(iter/s)": 0.176403 }, { "epoch": 0.877742946708464, "grad_norm": 0.45992663502693176, "learning_rate": 7.997594072319625e-06, "loss": 0.1907207489013672, "memory(GiB)": 34.41, "step": 70, "token_acc": 0.9308779679734953, "train_speed(iter/s)": 0.177764 }, { "epoch": 0.9404388714733543, "grad_norm": 0.4951237440109253, "learning_rate": 7.725973860813338e-06, "loss": 0.18900766372680664, "memory(GiB)": 34.41, "step": 75, "token_acc": 0.9364724794104445, "train_speed(iter/s)": 0.17972 }, { "epoch": 1.0, "grad_norm": 0.4991217851638794, "learning_rate": 7.442383329265063e-06, "loss": 0.19562691450119019, "memory(GiB)": 34.41, "step": 80, "token_acc": 0.9274175917603906, "train_speed(iter/s)": 0.181252 }, { "epoch": 1.0, "eval_loss": 0.22440873086452484, "eval_runtime": 1.7542, "eval_samples_per_second": 29.073, "eval_steps_per_second": 7.411, "eval_token_acc": 0.9295236463331049, "step": 80 }, { "epoch": 1.0626959247648902, "grad_norm": 0.4953973889350891, "learning_rate": 7.14806778287464e-06, "loss": 0.15403753519058228, "memory(GiB)": 36.85, "step": 85, "token_acc": 0.9448073355780812, "train_speed(iter/s)": 0.177097 }, { "epoch": 1.1253918495297806, "grad_norm": 0.5748655200004578, "learning_rate": 6.844319622620039e-06, "loss": 0.15727436542510986, "memory(GiB)": 36.86, "step": 90, "token_acc": 0.9455813214018034, "train_speed(iter/s)": 0.179283 }, { "epoch": 1.188087774294671, "grad_norm": 0.531531035900116, "learning_rate": 6.532472670054975e-06, "loss": 0.1557020664215088, "memory(GiB)": 36.86, "step": 95, "token_acc": 0.9433259454378778, "train_speed(iter/s)": 0.180272 }, { "epoch": 1.250783699059561, "grad_norm": 0.45460060238838196, "learning_rate": 6.21389631022014e-06, "loss": 0.14166662693023682, "memory(GiB)": 36.86, "step": 100, "token_acc": 0.9515047291487532, "train_speed(iter/s)": 0.180459 }, { "epoch": 1.250783699059561, "eval_loss": 0.22506587207317352, "eval_runtime": 1.7509, "eval_samples_per_second": 29.127, "eval_steps_per_second": 7.425, "eval_token_acc": 0.9305346127484578, "step": 100 }, { "epoch": 1.3134796238244515, "grad_norm": 0.49021536111831665, "learning_rate": 5.8899894783877536e-06, "loss": 0.14903560876846314, "memory(GiB)": 36.86, "step": 105, "token_acc": 0.9457567028584091, "train_speed(iter/s)": 0.177145 }, { "epoch": 1.3761755485893417, "grad_norm": 0.5220884084701538, "learning_rate": 5.562174517044862e-06, "loss": 0.1566535234451294, "memory(GiB)": 36.86, "step": 110, "token_acc": 0.9405845980888139, "train_speed(iter/s)": 0.178381 }, { "epoch": 1.438871473354232, "grad_norm": 0.4888514280319214, "learning_rate": 5.231890930090692e-06, "loss": 0.15283842086791993, "memory(GiB)": 36.86, "step": 115, "token_acc": 0.9439754584742157, "train_speed(iter/s)": 0.179467 }, { "epoch": 1.5015673981191222, "grad_norm": 0.5447772741317749, "learning_rate": 4.900589061674649e-06, "loss": 0.1515485167503357, "memory(GiB)": 36.86, "step": 120, "token_acc": 0.9485051504909061, "train_speed(iter/s)": 0.180611 }, { "epoch": 1.5015673981191222, "eval_loss": 0.22545410692691803, "eval_runtime": 1.7479, "eval_samples_per_second": 29.178, "eval_steps_per_second": 7.438, "eval_token_acc": 0.9306716929403701, "step": 120 }, { "epoch": 1.5642633228840124, "grad_norm": 0.4944928288459778, "learning_rate": 4.569723727432517e-06, "loss": 0.15320810079574584, "memory(GiB)": 36.86, "step": 125, "token_acc": 0.9462398205849373, "train_speed(iter/s)": 0.177824 }, { "epoch": 1.626959247648903, "grad_norm": 0.46054455637931824, "learning_rate": 4.2407478260874294e-06, "loss": 0.14589228630065917, "memory(GiB)": 36.86, "step": 130, "token_acc": 0.9447184839329854, "train_speed(iter/s)": 0.178796 }, { "epoch": 1.6896551724137931, "grad_norm": 0.5193416476249695, "learning_rate": 3.91510595946841e-06, "loss": 0.14716928005218505, "memory(GiB)": 36.86, "step": 135, "token_acc": 0.9455612054223621, "train_speed(iter/s)": 0.17993 }, { "epoch": 1.7523510971786833, "grad_norm": 0.5075722932815552, "learning_rate": 3.5942280889623028e-06, "loss": 0.14302459955215455, "memory(GiB)": 36.86, "step": 140, "token_acc": 0.9484785354216816, "train_speed(iter/s)": 0.180739 }, { "epoch": 1.7523510971786833, "eval_loss": 0.223139688372612, "eval_runtime": 1.7594, "eval_samples_per_second": 28.987, "eval_steps_per_second": 7.389, "eval_token_acc": 0.9318540095956135, "step": 140 }, { "epoch": 1.8150470219435737, "grad_norm": 0.481575608253479, "learning_rate": 3.2795232562549296e-06, "loss": 0.15251123905181885, "memory(GiB)": 36.86, "step": 145, "token_acc": 0.9418931228176711, "train_speed(iter/s)": 0.178609 }, { "epoch": 1.877742946708464, "grad_norm": 0.47559794783592224, "learning_rate": 2.972373395935031e-06, "loss": 0.14418470859527588, "memory(GiB)": 36.86, "step": 150, "token_acc": 0.9478903321419231, "train_speed(iter/s)": 0.179442 }, { "epoch": 1.9404388714733543, "grad_norm": 0.48828890919685364, "learning_rate": 2.674127267131131e-06, "loss": 0.14623172283172609, "memory(GiB)": 36.86, "step": 155, "token_acc": 0.95027281480689, "train_speed(iter/s)": 0.180113 }, { "epoch": 2.0, "grad_norm": 0.5259678959846497, "learning_rate": 2.3860945308287554e-06, "loss": 0.1496202230453491, "memory(GiB)": 36.86, "step": 160, "token_acc": 0.948199613882279, "train_speed(iter/s)": 0.181075 }, { "epoch": 2.0, "eval_loss": 0.22079476714134216, "eval_runtime": 1.7558, "eval_samples_per_second": 29.047, "eval_steps_per_second": 7.404, "eval_token_acc": 0.9325051405071967, "step": 160 } ], "logging_steps": 5, "max_steps": 237, "num_input_tokens_seen": 0, "num_train_epochs": 3, "save_steps": 20, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 2.885208435819807e+17, "train_batch_size": 1, "trial_name": null, "trial_params": null }