Files
qwen2.5vl-3b-32b-longest-5153/trainer_state.json
ModelHub XC 4e73d65c40 初始化项目,由ModelHub XC社区提供模型
Model: waltonfuture/qwen2.5vl-3b-32b-longest-5153
Source: Original Platform
2026-07-01 11:56:13 +08:00

437 lines
12 KiB
JSON

{
"best_global_step": 160,
"best_metric": 0.22079477,
"best_model_checkpoint": "/data/home/scyb089/CODE/scripts/ms-swift/3b/v45-20250505-194439/checkpoint-160",
"epoch": 2.0,
"eval_steps": 20,
"global_step": 160,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.012539184952978056,
"grad_norm": 2.091893434524536,
"learning_rate": 9.999560724782173e-06,
"loss": 0.25682932138442993,
"memory(GiB)": 32.08,
"step": 1,
"token_acc": 0.9157879737817042,
"train_speed(iter/s)": 0.066524
},
{
"epoch": 0.06269592476489028,
"grad_norm": 1.1085962057113647,
"learning_rate": 9.989021978333996e-06,
"loss": 0.24964354932308197,
"memory(GiB)": 32.09,
"step": 5,
"token_acc": 0.9192554520672421,
"train_speed(iter/s)": 0.145692
},
{
"epoch": 0.12539184952978055,
"grad_norm": 0.7571659088134766,
"learning_rate": 9.956136120119858e-06,
"loss": 0.24026219844818114,
"memory(GiB)": 34.41,
"step": 10,
"token_acc": 0.9036857680925477,
"train_speed(iter/s)": 0.167476
},
{
"epoch": 0.18808777429467086,
"grad_norm": 0.6683992743492126,
"learning_rate": 9.901486834023182e-06,
"loss": 0.22075538635253905,
"memory(GiB)": 34.41,
"step": 15,
"token_acc": 0.9231363670994918,
"train_speed(iter/s)": 0.179433
},
{
"epoch": 0.2507836990595611,
"grad_norm": 0.5858739614486694,
"learning_rate": 9.825314096462686e-06,
"loss": 0.22184286117553711,
"memory(GiB)": 34.41,
"step": 20,
"token_acc": 0.9236703251459961,
"train_speed(iter/s)": 0.186854
},
{
"epoch": 0.2507836990595611,
"eval_loss": 0.24446986615657806,
"eval_runtime": 1.7885,
"eval_samples_per_second": 28.515,
"eval_steps_per_second": 7.269,
"eval_token_acc": 0.9234064427690198,
"step": 20
},
{
"epoch": 0.31347962382445144,
"grad_norm": 0.6544387936592102,
"learning_rate": 9.72795239782369e-06,
"loss": 0.21392316818237306,
"memory(GiB)": 34.41,
"step": 25,
"token_acc": 0.9248752048165225,
"train_speed(iter/s)": 0.170828
},
{
"epoch": 0.3761755485893417,
"grad_norm": 0.5335580110549927,
"learning_rate": 9.609829273641034e-06,
"loss": 0.2093721866607666,
"memory(GiB)": 34.41,
"step": 30,
"token_acc": 0.924183943537715,
"train_speed(iter/s)": 0.176002
},
{
"epoch": 0.438871473354232,
"grad_norm": 0.5717173218727112,
"learning_rate": 9.47146342720133e-06,
"loss": 0.22015037536621093,
"memory(GiB)": 34.41,
"step": 35,
"token_acc": 0.9232907930720146,
"train_speed(iter/s)": 0.180804
},
{
"epoch": 0.5015673981191222,
"grad_norm": 0.5479745864868164,
"learning_rate": 9.3134624518086e-06,
"loss": 0.21302032470703125,
"memory(GiB)": 34.41,
"step": 40,
"token_acc": 0.9254576695445578,
"train_speed(iter/s)": 0.183086
},
{
"epoch": 0.5015673981191222,
"eval_loss": 0.23297670483589172,
"eval_runtime": 1.7792,
"eval_samples_per_second": 28.665,
"eval_steps_per_second": 7.307,
"eval_token_acc": 0.9267477724468814,
"step": 40
},
{
"epoch": 0.5642633228840125,
"grad_norm": 0.49755069613456726,
"learning_rate": 9.136520162715288e-06,
"loss": 0.199961519241333,
"memory(GiB)": 34.41,
"step": 45,
"token_acc": 0.9316015164899882,
"train_speed(iter/s)": 0.174455
},
{
"epoch": 0.6269592476489029,
"grad_norm": 0.48646634817123413,
"learning_rate": 8.94141355043471e-06,
"loss": 0.19662439823150635,
"memory(GiB)": 34.41,
"step": 50,
"token_acc": 0.9299179785685937,
"train_speed(iter/s)": 0.177304
},
{
"epoch": 0.6896551724137931,
"grad_norm": 0.49679994583129883,
"learning_rate": 8.728999368813591e-06,
"loss": 0.19584870338439941,
"memory(GiB)": 34.41,
"step": 55,
"token_acc": 0.9341005748968819,
"train_speed(iter/s)": 0.17898
},
{
"epoch": 0.7523510971786834,
"grad_norm": 0.5154221653938293,
"learning_rate": 8.500210372847128e-06,
"loss": 0.19981801509857178,
"memory(GiB)": 34.41,
"step": 60,
"token_acc": 0.9348041080258653,
"train_speed(iter/s)": 0.181111
},
{
"epoch": 0.7523510971786834,
"eval_loss": 0.22815200686454773,
"eval_runtime": 1.7511,
"eval_samples_per_second": 29.125,
"eval_steps_per_second": 7.424,
"eval_token_acc": 0.9284270047978067,
"step": 60
},
{
"epoch": 0.8150470219435737,
"grad_norm": 0.5291805863380432,
"learning_rate": 8.256051222757188e-06,
"loss": 0.19705500602722167,
"memory(GiB)": 34.41,
"step": 65,
"token_acc": 0.9243072938311218,
"train_speed(iter/s)": 0.176403
},
{
"epoch": 0.877742946708464,
"grad_norm": 0.45992663502693176,
"learning_rate": 7.997594072319625e-06,
"loss": 0.1907207489013672,
"memory(GiB)": 34.41,
"step": 70,
"token_acc": 0.9308779679734953,
"train_speed(iter/s)": 0.177764
},
{
"epoch": 0.9404388714733543,
"grad_norm": 0.4951237440109253,
"learning_rate": 7.725973860813338e-06,
"loss": 0.18900766372680664,
"memory(GiB)": 34.41,
"step": 75,
"token_acc": 0.9364724794104445,
"train_speed(iter/s)": 0.17972
},
{
"epoch": 1.0,
"grad_norm": 0.4991217851638794,
"learning_rate": 7.442383329265063e-06,
"loss": 0.19562691450119019,
"memory(GiB)": 34.41,
"step": 80,
"token_acc": 0.9274175917603906,
"train_speed(iter/s)": 0.181252
},
{
"epoch": 1.0,
"eval_loss": 0.22440873086452484,
"eval_runtime": 1.7542,
"eval_samples_per_second": 29.073,
"eval_steps_per_second": 7.411,
"eval_token_acc": 0.9295236463331049,
"step": 80
},
{
"epoch": 1.0626959247648902,
"grad_norm": 0.4953973889350891,
"learning_rate": 7.14806778287464e-06,
"loss": 0.15403753519058228,
"memory(GiB)": 36.85,
"step": 85,
"token_acc": 0.9448073355780812,
"train_speed(iter/s)": 0.177097
},
{
"epoch": 1.1253918495297806,
"grad_norm": 0.5748655200004578,
"learning_rate": 6.844319622620039e-06,
"loss": 0.15727436542510986,
"memory(GiB)": 36.86,
"step": 90,
"token_acc": 0.9455813214018034,
"train_speed(iter/s)": 0.179283
},
{
"epoch": 1.188087774294671,
"grad_norm": 0.531531035900116,
"learning_rate": 6.532472670054975e-06,
"loss": 0.1557020664215088,
"memory(GiB)": 36.86,
"step": 95,
"token_acc": 0.9433259454378778,
"train_speed(iter/s)": 0.180272
},
{
"epoch": 1.250783699059561,
"grad_norm": 0.45460060238838196,
"learning_rate": 6.21389631022014e-06,
"loss": 0.14166662693023682,
"memory(GiB)": 36.86,
"step": 100,
"token_acc": 0.9515047291487532,
"train_speed(iter/s)": 0.180459
},
{
"epoch": 1.250783699059561,
"eval_loss": 0.22506587207317352,
"eval_runtime": 1.7509,
"eval_samples_per_second": 29.127,
"eval_steps_per_second": 7.425,
"eval_token_acc": 0.9305346127484578,
"step": 100
},
{
"epoch": 1.3134796238244515,
"grad_norm": 0.49021536111831665,
"learning_rate": 5.8899894783877536e-06,
"loss": 0.14903560876846314,
"memory(GiB)": 36.86,
"step": 105,
"token_acc": 0.9457567028584091,
"train_speed(iter/s)": 0.177145
},
{
"epoch": 1.3761755485893417,
"grad_norm": 0.5220884084701538,
"learning_rate": 5.562174517044862e-06,
"loss": 0.1566535234451294,
"memory(GiB)": 36.86,
"step": 110,
"token_acc": 0.9405845980888139,
"train_speed(iter/s)": 0.178381
},
{
"epoch": 1.438871473354232,
"grad_norm": 0.4888514280319214,
"learning_rate": 5.231890930090692e-06,
"loss": 0.15283842086791993,
"memory(GiB)": 36.86,
"step": 115,
"token_acc": 0.9439754584742157,
"train_speed(iter/s)": 0.179467
},
{
"epoch": 1.5015673981191222,
"grad_norm": 0.5447772741317749,
"learning_rate": 4.900589061674649e-06,
"loss": 0.1515485167503357,
"memory(GiB)": 36.86,
"step": 120,
"token_acc": 0.9485051504909061,
"train_speed(iter/s)": 0.180611
},
{
"epoch": 1.5015673981191222,
"eval_loss": 0.22545410692691803,
"eval_runtime": 1.7479,
"eval_samples_per_second": 29.178,
"eval_steps_per_second": 7.438,
"eval_token_acc": 0.9306716929403701,
"step": 120
},
{
"epoch": 1.5642633228840124,
"grad_norm": 0.4944928288459778,
"learning_rate": 4.569723727432517e-06,
"loss": 0.15320810079574584,
"memory(GiB)": 36.86,
"step": 125,
"token_acc": 0.9462398205849373,
"train_speed(iter/s)": 0.177824
},
{
"epoch": 1.626959247648903,
"grad_norm": 0.46054455637931824,
"learning_rate": 4.2407478260874294e-06,
"loss": 0.14589228630065917,
"memory(GiB)": 36.86,
"step": 130,
"token_acc": 0.9447184839329854,
"train_speed(iter/s)": 0.178796
},
{
"epoch": 1.6896551724137931,
"grad_norm": 0.5193416476249695,
"learning_rate": 3.91510595946841e-06,
"loss": 0.14716928005218505,
"memory(GiB)": 36.86,
"step": 135,
"token_acc": 0.9455612054223621,
"train_speed(iter/s)": 0.17993
},
{
"epoch": 1.7523510971786833,
"grad_norm": 0.5075722932815552,
"learning_rate": 3.5942280889623028e-06,
"loss": 0.14302459955215455,
"memory(GiB)": 36.86,
"step": 140,
"token_acc": 0.9484785354216816,
"train_speed(iter/s)": 0.180739
},
{
"epoch": 1.7523510971786833,
"eval_loss": 0.223139688372612,
"eval_runtime": 1.7594,
"eval_samples_per_second": 28.987,
"eval_steps_per_second": 7.389,
"eval_token_acc": 0.9318540095956135,
"step": 140
},
{
"epoch": 1.8150470219435737,
"grad_norm": 0.481575608253479,
"learning_rate": 3.2795232562549296e-06,
"loss": 0.15251123905181885,
"memory(GiB)": 36.86,
"step": 145,
"token_acc": 0.9418931228176711,
"train_speed(iter/s)": 0.178609
},
{
"epoch": 1.877742946708464,
"grad_norm": 0.47559794783592224,
"learning_rate": 2.972373395935031e-06,
"loss": 0.14418470859527588,
"memory(GiB)": 36.86,
"step": 150,
"token_acc": 0.9478903321419231,
"train_speed(iter/s)": 0.179442
},
{
"epoch": 1.9404388714733543,
"grad_norm": 0.48828890919685364,
"learning_rate": 2.674127267131131e-06,
"loss": 0.14623172283172609,
"memory(GiB)": 36.86,
"step": 155,
"token_acc": 0.95027281480689,
"train_speed(iter/s)": 0.180113
},
{
"epoch": 2.0,
"grad_norm": 0.5259678959846497,
"learning_rate": 2.3860945308287554e-06,
"loss": 0.1496202230453491,
"memory(GiB)": 36.86,
"step": 160,
"token_acc": 0.948199613882279,
"train_speed(iter/s)": 0.181075
},
{
"epoch": 2.0,
"eval_loss": 0.22079476714134216,
"eval_runtime": 1.7558,
"eval_samples_per_second": 29.047,
"eval_steps_per_second": 7.404,
"eval_token_acc": 0.9325051405071967,
"step": 160
}
],
"logging_steps": 5,
"max_steps": 237,
"num_input_tokens_seen": 0,
"num_train_epochs": 3,
"save_steps": 20,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 2.885208435819807e+17,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}