Files
qwen2.5vl-3b-sampled_5000_q…/trainer_state.json
ModelHub XC 36571859e5 初始化项目,由ModelHub XC社区提供模型
Model: waltonfuture/qwen2.5vl-3b-sampled_5000_qwen2.5vl32b
Source: Original Platform
2026-07-01 11:55:13 +08:00

613 lines
17 KiB
JSON

{
"best_global_step": 80,
"best_metric": 0.2667928,
"best_model_checkpoint": "/data/home/scyb089/CODE/scripts/ms-swift/3b-new/v25-20250507-102354/checkpoint-80",
"epoch": 2.9693053311793216,
"eval_steps": 20,
"global_step": 231,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.012924071082390954,
"grad_norm": 2.2731873989105225,
"learning_rate": 9.999537609289592e-06,
"loss": 0.3403177559375763,
"memory(GiB)": 27.73,
"step": 1,
"token_acc": 0.8868276747170691,
"train_speed(iter/s)": 0.067579
},
{
"epoch": 0.06462035541195477,
"grad_norm": 1.4813389778137207,
"learning_rate": 9.988444507789584e-06,
"loss": 0.31994959712028503,
"memory(GiB)": 27.77,
"step": 5,
"token_acc": 0.9141356099162699,
"train_speed(iter/s)": 0.123592
},
{
"epoch": 0.12924071082390953,
"grad_norm": 1.123345971107483,
"learning_rate": 9.953831442918418e-06,
"loss": 0.30749030113220216,
"memory(GiB)": 27.77,
"step": 10,
"token_acc": 0.9012080197330972,
"train_speed(iter/s)": 0.137122
},
{
"epoch": 0.1938610662358643,
"grad_norm": 0.9020525813102722,
"learning_rate": 9.896320793787106e-06,
"loss": 0.27063722610473634,
"memory(GiB)": 27.77,
"step": 15,
"token_acc": 0.9126837000617931,
"train_speed(iter/s)": 0.141018
},
{
"epoch": 0.25848142164781907,
"grad_norm": 0.8509101867675781,
"learning_rate": 9.816178385938867e-06,
"loss": 0.29023313522338867,
"memory(GiB)": 27.77,
"step": 20,
"token_acc": 0.8872605693216261,
"train_speed(iter/s)": 0.145694
},
{
"epoch": 0.25848142164781907,
"eval_loss": 0.3039485812187195,
"eval_runtime": 3.32,
"eval_samples_per_second": 15.06,
"eval_steps_per_second": 3.916,
"eval_token_acc": 0.903881782090869,
"step": 20
},
{
"epoch": 0.32310177705977383,
"grad_norm": 0.8458644151687622,
"learning_rate": 9.71377465336155e-06,
"loss": 0.25895378589630125,
"memory(GiB)": 27.77,
"step": 25,
"token_acc": 0.9142409095364109,
"train_speed(iter/s)": 0.134983
},
{
"epoch": 0.3877221324717286,
"grad_norm": 0.8199787735939026,
"learning_rate": 9.589582926268798e-06,
"loss": 0.2640843391418457,
"memory(GiB)": 29.72,
"step": 30,
"token_acc": 0.8975557241075579,
"train_speed(iter/s)": 0.139582
},
{
"epoch": 0.45234248788368336,
"grad_norm": 0.8535000681877136,
"learning_rate": 9.444177243274619e-06,
"loss": 0.2773404359817505,
"memory(GiB)": 29.72,
"step": 35,
"token_acc": 0.9044449798229236,
"train_speed(iter/s)": 0.140314
},
{
"epoch": 0.5169628432956381,
"grad_norm": 0.8921259641647339,
"learning_rate": 9.278229698073889e-06,
"loss": 0.25462870597839354,
"memory(GiB)": 31.77,
"step": 40,
"token_acc": 0.9135342035528511,
"train_speed(iter/s)": 0.141326
},
{
"epoch": 0.5169628432956381,
"eval_loss": 0.282864511013031,
"eval_runtime": 3.3133,
"eval_samples_per_second": 15.091,
"eval_steps_per_second": 3.924,
"eval_token_acc": 0.9092192324658138,
"step": 40
},
{
"epoch": 0.5815831987075929,
"grad_norm": 0.8390740752220154,
"learning_rate": 9.092507332892968e-06,
"loss": 0.25777387619018555,
"memory(GiB)": 31.77,
"step": 45,
"token_acc": 0.914298819496415,
"train_speed(iter/s)": 0.136754
},
{
"epoch": 0.6462035541195477,
"grad_norm": 0.7239695191383362,
"learning_rate": 8.88786859306952e-06,
"loss": 0.2546600341796875,
"memory(GiB)": 31.77,
"step": 50,
"token_acc": 0.9075028793945045,
"train_speed(iter/s)": 0.138512
},
{
"epoch": 0.7108239095315024,
"grad_norm": 0.8517793416976929,
"learning_rate": 8.665259359149132e-06,
"loss": 0.25491042137145997,
"memory(GiB)": 31.77,
"step": 55,
"token_acc": 0.916702329277985,
"train_speed(iter/s)": 0.140386
},
{
"epoch": 0.7754442649434572,
"grad_norm": 0.9215121269226074,
"learning_rate": 8.425708574839221e-06,
"loss": 0.26868789196014403,
"memory(GiB)": 31.77,
"step": 60,
"token_acc": 0.9110680686220255,
"train_speed(iter/s)": 0.141043
},
{
"epoch": 0.7754442649434572,
"eval_loss": 0.26870670914649963,
"eval_runtime": 3.2897,
"eval_samples_per_second": 15.199,
"eval_steps_per_second": 3.952,
"eval_token_acc": 0.911821790913101,
"step": 60
},
{
"epoch": 0.840064620355412,
"grad_norm": 0.802850604057312,
"learning_rate": 8.170323491028625e-06,
"loss": 0.2603068113327026,
"memory(GiB)": 31.77,
"step": 65,
"token_acc": 0.9059696255826776,
"train_speed(iter/s)": 0.137781
},
{
"epoch": 0.9046849757673667,
"grad_norm": 0.8318380117416382,
"learning_rate": 7.900284547855992e-06,
"loss": 0.2465101957321167,
"memory(GiB)": 31.77,
"step": 70,
"token_acc": 0.9176682374119765,
"train_speed(iter/s)": 0.138682
},
{
"epoch": 0.9693053311793215,
"grad_norm": 0.8353856205940247,
"learning_rate": 7.616839918483061e-06,
"loss": 0.25543487071990967,
"memory(GiB)": 31.77,
"step": 75,
"token_acc": 0.9149594970756576,
"train_speed(iter/s)": 0.140389
},
{
"epoch": 1.0258481421647818,
"grad_norm": 0.6481645703315735,
"learning_rate": 7.321299739792553e-06,
"loss": 0.2133633613586426,
"memory(GiB)": 31.77,
"step": 80,
"token_acc": 0.9200670765790945,
"train_speed(iter/s)": 0.142321
},
{
"epoch": 1.0258481421647818,
"eval_loss": 0.26679280400276184,
"eval_runtime": 3.2991,
"eval_samples_per_second": 15.156,
"eval_steps_per_second": 3.94,
"eval_token_acc": 0.9134097926775474,
"step": 80
},
{
"epoch": 1.0904684975767367,
"grad_norm": 0.6800863742828369,
"learning_rate": 7.015030056677559e-06,
"loss": 0.1703335762023926,
"memory(GiB)": 31.77,
"step": 85,
"token_acc": 0.9300695500978048,
"train_speed(iter/s)": 0.139427
},
{
"epoch": 1.1550888529886914,
"grad_norm": 0.8568421602249146,
"learning_rate": 6.699446507913083e-06,
"loss": 0.175722873210907,
"memory(GiB)": 31.77,
"step": 90,
"token_acc": 0.9376859286560485,
"train_speed(iter/s)": 0.140237
},
{
"epoch": 1.2197092084006462,
"grad_norm": 0.8131283521652222,
"learning_rate": 6.376007782794926e-06,
"loss": 0.17641785144805908,
"memory(GiB)": 31.77,
"step": 95,
"token_acc": 0.9325422804146208,
"train_speed(iter/s)": 0.140745
},
{
"epoch": 1.284329563812601,
"grad_norm": 0.7293909192085266,
"learning_rate": 6.046208878790543e-06,
"loss": 0.16437745094299316,
"memory(GiB)": 31.77,
"step": 100,
"token_acc": 0.9487982769592246,
"train_speed(iter/s)": 0.14165
},
{
"epoch": 1.284329563812601,
"eval_loss": 0.2724775969982147,
"eval_runtime": 3.3056,
"eval_samples_per_second": 15.126,
"eval_steps_per_second": 3.933,
"eval_token_acc": 0.9131892368769299,
"step": 100
},
{
"epoch": 1.3489499192245558,
"grad_norm": 0.7830442786216736,
"learning_rate": 5.711574191366427e-06,
"loss": 0.17315418720245362,
"memory(GiB)": 31.77,
"step": 105,
"token_acc": 0.9369512600256277,
"train_speed(iter/s)": 0.139592
},
{
"epoch": 1.4135702746365104,
"grad_norm": 1.1301852464675903,
"learning_rate": 5.373650467932122e-06,
"loss": 0.16508615016937256,
"memory(GiB)": 31.77,
"step": 110,
"token_acc": 0.9386117342264068,
"train_speed(iter/s)": 0.139912
},
{
"epoch": 1.4781906300484653,
"grad_norm": 0.8325211405754089,
"learning_rate": 5.033999658469174e-06,
"loss": 0.1674315094947815,
"memory(GiB)": 31.77,
"step": 115,
"token_acc": 0.941469866901816,
"train_speed(iter/s)": 0.14058
},
{
"epoch": 1.5428109854604202,
"grad_norm": 0.7626614570617676,
"learning_rate": 4.694191695890788e-06,
"loss": 0.16333245038986205,
"memory(GiB)": 31.77,
"step": 120,
"token_acc": 0.9416115876810576,
"train_speed(iter/s)": 0.141086
},
{
"epoch": 1.5428109854604202,
"eval_loss": 0.27097609639167786,
"eval_runtime": 3.3164,
"eval_samples_per_second": 15.077,
"eval_steps_per_second": 3.92,
"eval_token_acc": 0.9142479047198941,
"step": 120
},
{
"epoch": 1.6074313408723748,
"grad_norm": 0.7940030097961426,
"learning_rate": 4.355797239502807e-06,
"loss": 0.16428098678588868,
"memory(GiB)": 31.77,
"step": 125,
"token_acc": 0.9428232290430225,
"train_speed(iter/s)": 0.13923
},
{
"epoch": 1.6720516962843295,
"grad_norm": 0.6970264315605164,
"learning_rate": 4.020380415107167e-06,
"loss": 0.16456249952316285,
"memory(GiB)": 31.77,
"step": 130,
"token_acc": 0.9436249926249336,
"train_speed(iter/s)": 0.139781
},
{
"epoch": 1.7366720516962844,
"grad_norm": 0.6929925680160522,
"learning_rate": 3.689491585304491e-06,
"loss": 0.1615690231323242,
"memory(GiB)": 31.77,
"step": 135,
"token_acc": 0.9493547714477678,
"train_speed(iter/s)": 0.140165
},
{
"epoch": 1.8012924071082392,
"grad_norm": 0.7727723121643066,
"learning_rate": 3.3646601834128924e-06,
"loss": 0.15618789196014404,
"memory(GiB)": 31.77,
"step": 140,
"token_acc": 0.9474429805921518,
"train_speed(iter/s)": 0.140829
},
{
"epoch": 1.8012924071082392,
"eval_loss": 0.2697683870792389,
"eval_runtime": 3.3006,
"eval_samples_per_second": 15.149,
"eval_steps_per_second": 3.939,
"eval_token_acc": 0.9146007940008822,
"step": 140
},
{
"epoch": 1.865912762520194,
"grad_norm": 0.8078304529190063,
"learning_rate": 3.0473876441260786e-06,
"loss": 0.16288309097290038,
"memory(GiB)": 31.77,
"step": 145,
"token_acc": 0.9430032977590819,
"train_speed(iter/s)": 0.139196
},
{
"epoch": 1.9305331179321485,
"grad_norm": 0.7410924434661865,
"learning_rate": 2.7391404635865725e-06,
"loss": 0.16929523944854735,
"memory(GiB)": 31.77,
"step": 150,
"token_acc": 0.9406619385342789,
"train_speed(iter/s)": 0.140082
},
{
"epoch": 1.9951534733441034,
"grad_norm": 0.738341748714447,
"learning_rate": 2.4413434209518137e-06,
"loss": 0.16088511943817138,
"memory(GiB)": 31.77,
"step": 155,
"token_acc": 0.9444251174117237,
"train_speed(iter/s)": 0.14054
},
{
"epoch": 2.0516962843295636,
"grad_norm": 0.7186931371688843,
"learning_rate": 2.1553729927843894e-06,
"loss": 0.1285548210144043,
"memory(GiB)": 31.77,
"step": 160,
"token_acc": 0.9580936465597584,
"train_speed(iter/s)": 0.141633
},
{
"epoch": 2.0516962843295636,
"eval_loss": 0.2675042748451233,
"eval_runtime": 3.3322,
"eval_samples_per_second": 15.005,
"eval_steps_per_second": 3.901,
"eval_token_acc": 0.9149977944419938,
"step": 160
},
{
"epoch": 2.1163166397415187,
"grad_norm": 0.6802994012832642,
"learning_rate": 1.8825509907063328e-06,
"loss": 0.11384077072143554,
"memory(GiB)": 31.77,
"step": 165,
"token_acc": 0.9605823375909902,
"train_speed(iter/s)": 0.140187
},
{
"epoch": 2.1809369951534734,
"grad_norm": 0.7430527806282043,
"learning_rate": 1.6241384517255854e-06,
"loss": 0.11673367023468018,
"memory(GiB)": 31.77,
"step": 170,
"token_acc": 0.958113287261973,
"train_speed(iter/s)": 0.14049
},
{
"epoch": 2.245557350565428,
"grad_norm": 0.7527663707733154,
"learning_rate": 1.3813298094746491e-06,
"loss": 0.1161942720413208,
"memory(GiB)": 34.09,
"step": 175,
"token_acc": 0.9589060959341106,
"train_speed(iter/s)": 0.140819
},
{
"epoch": 2.3101777059773827,
"grad_norm": 0.7852010726928711,
"learning_rate": 1.1552473733031893e-06,
"loss": 0.11494719982147217,
"memory(GiB)": 34.09,
"step": 180,
"token_acc": 0.9586355734068701,
"train_speed(iter/s)": 0.141152
},
{
"epoch": 2.3101777059773827,
"eval_loss": 0.29286888241767883,
"eval_runtime": 3.3281,
"eval_samples_per_second": 15.024,
"eval_steps_per_second": 3.906,
"eval_token_acc": 0.9136744596382885,
"step": 180
},
{
"epoch": 2.374798061389338,
"grad_norm": 0.6895999908447266,
"learning_rate": 9.469361407432431e-07,
"loss": 0.11342091560363769,
"memory(GiB)": 34.09,
"step": 185,
"token_acc": 0.9593238350125944,
"train_speed(iter/s)": 0.139994
},
{
"epoch": 2.4394184168012925,
"grad_norm": 0.6789767146110535,
"learning_rate": 7.573589673248833e-07,
"loss": 0.1184342384338379,
"memory(GiB)": 34.09,
"step": 190,
"token_acc": 0.9577452126224939,
"train_speed(iter/s)": 0.14042
},
{
"epoch": 2.504038772213247,
"grad_norm": 0.7090432643890381,
"learning_rate": 5.873921160683943e-07,
"loss": 0.11669770479202271,
"memory(GiB)": 34.09,
"step": 195,
"token_acc": 0.9631506472046268,
"train_speed(iter/s)": 0.140952
},
{
"epoch": 2.568659127625202,
"grad_norm": 0.7863989472389221,
"learning_rate": 4.3782120722406565e-07,
"loss": 0.10347751379013062,
"memory(GiB)": 34.09,
"step": 200,
"token_acc": 0.9619025747020847,
"train_speed(iter/s)": 0.141445
},
{
"epoch": 2.568659127625202,
"eval_loss": 0.28900277614593506,
"eval_runtime": 3.3211,
"eval_samples_per_second": 15.055,
"eval_steps_per_second": 3.914,
"eval_token_acc": 0.9142920158800176,
"step": 200
},
{
"epoch": 2.633279483037157,
"grad_norm": 0.6685696840286255,
"learning_rate": 3.0933758698072023e-07,
"loss": 0.11602609157562256,
"memory(GiB)": 34.09,
"step": 205,
"token_acc": 0.9562507578513398,
"train_speed(iter/s)": 0.14069
},
{
"epoch": 2.6978998384491115,
"grad_norm": 0.6653679013252258,
"learning_rate": 2.0253513192751374e-07,
"loss": 0.11234492063522339,
"memory(GiB)": 34.09,
"step": 210,
"token_acc": 0.9581170175494474,
"train_speed(iter/s)": 0.140892
},
{
"epoch": 2.762520193861066,
"grad_norm": 0.7487311959266663,
"learning_rate": 1.1790750403941231e-07,
"loss": 0.11896169185638428,
"memory(GiB)": 34.09,
"step": 215,
"token_acc": 0.9582668433721905,
"train_speed(iter/s)": 0.141293
},
{
"epoch": 2.827140549273021,
"grad_norm": 0.755111575126648,
"learning_rate": 5.584586887435739e-08,
"loss": 0.1167401671409607,
"memory(GiB)": 34.09,
"step": 220,
"token_acc": 0.9631465104180927,
"train_speed(iter/s)": 0.141655
},
{
"epoch": 2.827140549273021,
"eval_loss": 0.2880306839942932,
"eval_runtime": 3.278,
"eval_samples_per_second": 15.253,
"eval_steps_per_second": 3.966,
"eval_token_acc": 0.9148213498014998,
"step": 220
},
{
"epoch": 2.891760904684976,
"grad_norm": 0.6732391119003296,
"learning_rate": 1.6637087529033925e-08,
"loss": 0.10909011363983154,
"memory(GiB)": 34.09,
"step": 225,
"token_acc": 0.9598257622899813,
"train_speed(iter/s)": 0.140904
},
{
"epoch": 2.9563812600969306,
"grad_norm": 0.6832190155982971,
"learning_rate": 4.623907104084335e-10,
"loss": 0.11326090097427369,
"memory(GiB)": 34.09,
"step": 230,
"token_acc": 0.9568148980574731,
"train_speed(iter/s)": 0.141045
},
{
"epoch": 2.9693053311793216,
"eval_loss": 0.28785240650177,
"eval_runtime": 3.3057,
"eval_samples_per_second": 15.125,
"eval_steps_per_second": 3.933,
"eval_token_acc": 0.9149095721217468,
"step": 231
}
],
"logging_steps": 5,
"max_steps": 231,
"num_input_tokens_seen": 0,
"num_train_epochs": 3,
"save_steps": 20,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 2.8087630551423386e+17,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}