{ "best_global_step": 80, "best_metric": 0.2667928, "best_model_checkpoint": "/data/home/scyb089/CODE/scripts/ms-swift/3b-new/v25-20250507-102354/checkpoint-80", "epoch": 2.9693053311793216, "eval_steps": 20, "global_step": 231, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.012924071082390954, "grad_norm": 2.2731873989105225, "learning_rate": 9.999537609289592e-06, "loss": 0.3403177559375763, "memory(GiB)": 27.73, "step": 1, "token_acc": 0.8868276747170691, "train_speed(iter/s)": 0.067579 }, { "epoch": 0.06462035541195477, "grad_norm": 1.4813389778137207, "learning_rate": 9.988444507789584e-06, "loss": 0.31994959712028503, "memory(GiB)": 27.77, "step": 5, "token_acc": 0.9141356099162699, "train_speed(iter/s)": 0.123592 }, { "epoch": 0.12924071082390953, "grad_norm": 1.123345971107483, "learning_rate": 9.953831442918418e-06, "loss": 0.30749030113220216, "memory(GiB)": 27.77, "step": 10, "token_acc": 0.9012080197330972, "train_speed(iter/s)": 0.137122 }, { "epoch": 0.1938610662358643, "grad_norm": 0.9020525813102722, "learning_rate": 9.896320793787106e-06, "loss": 0.27063722610473634, "memory(GiB)": 27.77, "step": 15, "token_acc": 0.9126837000617931, "train_speed(iter/s)": 0.141018 }, { "epoch": 0.25848142164781907, "grad_norm": 0.8509101867675781, "learning_rate": 9.816178385938867e-06, "loss": 0.29023313522338867, "memory(GiB)": 27.77, "step": 20, "token_acc": 0.8872605693216261, "train_speed(iter/s)": 0.145694 }, { "epoch": 0.25848142164781907, "eval_loss": 0.3039485812187195, "eval_runtime": 3.32, "eval_samples_per_second": 15.06, "eval_steps_per_second": 3.916, "eval_token_acc": 0.903881782090869, "step": 20 }, { "epoch": 0.32310177705977383, "grad_norm": 0.8458644151687622, "learning_rate": 9.71377465336155e-06, "loss": 0.25895378589630125, "memory(GiB)": 27.77, "step": 25, "token_acc": 0.9142409095364109, "train_speed(iter/s)": 0.134983 }, { "epoch": 0.3877221324717286, "grad_norm": 0.8199787735939026, "learning_rate": 9.589582926268798e-06, "loss": 0.2640843391418457, "memory(GiB)": 29.72, "step": 30, "token_acc": 0.8975557241075579, "train_speed(iter/s)": 0.139582 }, { "epoch": 0.45234248788368336, "grad_norm": 0.8535000681877136, "learning_rate": 9.444177243274619e-06, "loss": 0.2773404359817505, "memory(GiB)": 29.72, "step": 35, "token_acc": 0.9044449798229236, "train_speed(iter/s)": 0.140314 }, { "epoch": 0.5169628432956381, "grad_norm": 0.8921259641647339, "learning_rate": 9.278229698073889e-06, "loss": 0.25462870597839354, "memory(GiB)": 31.77, "step": 40, "token_acc": 0.9135342035528511, "train_speed(iter/s)": 0.141326 }, { "epoch": 0.5169628432956381, "eval_loss": 0.282864511013031, "eval_runtime": 3.3133, "eval_samples_per_second": 15.091, "eval_steps_per_second": 3.924, "eval_token_acc": 0.9092192324658138, "step": 40 }, { "epoch": 0.5815831987075929, "grad_norm": 0.8390740752220154, "learning_rate": 9.092507332892968e-06, "loss": 0.25777387619018555, "memory(GiB)": 31.77, "step": 45, "token_acc": 0.914298819496415, "train_speed(iter/s)": 0.136754 }, { "epoch": 0.6462035541195477, "grad_norm": 0.7239695191383362, "learning_rate": 8.88786859306952e-06, "loss": 0.2546600341796875, "memory(GiB)": 31.77, "step": 50, "token_acc": 0.9075028793945045, "train_speed(iter/s)": 0.138512 }, { "epoch": 0.7108239095315024, "grad_norm": 0.8517793416976929, "learning_rate": 8.665259359149132e-06, "loss": 0.25491042137145997, "memory(GiB)": 31.77, "step": 55, "token_acc": 0.916702329277985, "train_speed(iter/s)": 0.140386 }, { "epoch": 0.7754442649434572, "grad_norm": 0.9215121269226074, "learning_rate": 8.425708574839221e-06, "loss": 0.26868789196014403, "memory(GiB)": 31.77, "step": 60, "token_acc": 0.9110680686220255, "train_speed(iter/s)": 0.141043 }, { "epoch": 0.7754442649434572, "eval_loss": 0.26870670914649963, "eval_runtime": 3.2897, "eval_samples_per_second": 15.199, "eval_steps_per_second": 3.952, "eval_token_acc": 0.911821790913101, "step": 60 }, { "epoch": 0.840064620355412, "grad_norm": 0.802850604057312, "learning_rate": 8.170323491028625e-06, "loss": 0.2603068113327026, "memory(GiB)": 31.77, "step": 65, "token_acc": 0.9059696255826776, "train_speed(iter/s)": 0.137781 }, { "epoch": 0.9046849757673667, "grad_norm": 0.8318380117416382, "learning_rate": 7.900284547855992e-06, "loss": 0.2465101957321167, "memory(GiB)": 31.77, "step": 70, "token_acc": 0.9176682374119765, "train_speed(iter/s)": 0.138682 }, { "epoch": 0.9693053311793215, "grad_norm": 0.8353856205940247, "learning_rate": 7.616839918483061e-06, "loss": 0.25543487071990967, "memory(GiB)": 31.77, "step": 75, "token_acc": 0.9149594970756576, "train_speed(iter/s)": 0.140389 }, { "epoch": 1.0258481421647818, "grad_norm": 0.6481645703315735, "learning_rate": 7.321299739792553e-06, "loss": 0.2133633613586426, "memory(GiB)": 31.77, "step": 80, "token_acc": 0.9200670765790945, "train_speed(iter/s)": 0.142321 }, { "epoch": 1.0258481421647818, "eval_loss": 0.26679280400276184, "eval_runtime": 3.2991, "eval_samples_per_second": 15.156, "eval_steps_per_second": 3.94, "eval_token_acc": 0.9134097926775474, "step": 80 }, { "epoch": 1.0904684975767367, "grad_norm": 0.6800863742828369, "learning_rate": 7.015030056677559e-06, "loss": 0.1703335762023926, "memory(GiB)": 31.77, "step": 85, "token_acc": 0.9300695500978048, "train_speed(iter/s)": 0.139427 }, { "epoch": 1.1550888529886914, "grad_norm": 0.8568421602249146, "learning_rate": 6.699446507913083e-06, "loss": 0.175722873210907, "memory(GiB)": 31.77, "step": 90, "token_acc": 0.9376859286560485, "train_speed(iter/s)": 0.140237 }, { "epoch": 1.2197092084006462, "grad_norm": 0.8131283521652222, "learning_rate": 6.376007782794926e-06, "loss": 0.17641785144805908, "memory(GiB)": 31.77, "step": 95, "token_acc": 0.9325422804146208, "train_speed(iter/s)": 0.140745 }, { "epoch": 1.284329563812601, "grad_norm": 0.7293909192085266, "learning_rate": 6.046208878790543e-06, "loss": 0.16437745094299316, "memory(GiB)": 31.77, "step": 100, "token_acc": 0.9487982769592246, "train_speed(iter/s)": 0.14165 }, { "epoch": 1.284329563812601, "eval_loss": 0.2724775969982147, "eval_runtime": 3.3056, "eval_samples_per_second": 15.126, "eval_steps_per_second": 3.933, "eval_token_acc": 0.9131892368769299, "step": 100 }, { "epoch": 1.3489499192245558, "grad_norm": 0.7830442786216736, "learning_rate": 5.711574191366427e-06, "loss": 0.17315418720245362, "memory(GiB)": 31.77, "step": 105, "token_acc": 0.9369512600256277, "train_speed(iter/s)": 0.139592 }, { "epoch": 1.4135702746365104, "grad_norm": 1.1301852464675903, "learning_rate": 5.373650467932122e-06, "loss": 0.16508615016937256, "memory(GiB)": 31.77, "step": 110, "token_acc": 0.9386117342264068, "train_speed(iter/s)": 0.139912 }, { "epoch": 1.4781906300484653, "grad_norm": 0.8325211405754089, "learning_rate": 5.033999658469174e-06, "loss": 0.1674315094947815, "memory(GiB)": 31.77, "step": 115, "token_acc": 0.941469866901816, "train_speed(iter/s)": 0.14058 }, { "epoch": 1.5428109854604202, "grad_norm": 0.7626614570617676, "learning_rate": 4.694191695890788e-06, "loss": 0.16333245038986205, "memory(GiB)": 31.77, "step": 120, "token_acc": 0.9416115876810576, "train_speed(iter/s)": 0.141086 }, { "epoch": 1.5428109854604202, "eval_loss": 0.27097609639167786, "eval_runtime": 3.3164, "eval_samples_per_second": 15.077, "eval_steps_per_second": 3.92, "eval_token_acc": 0.9142479047198941, "step": 120 }, { "epoch": 1.6074313408723748, "grad_norm": 0.7940030097961426, "learning_rate": 4.355797239502807e-06, "loss": 0.16428098678588868, "memory(GiB)": 31.77, "step": 125, "token_acc": 0.9428232290430225, "train_speed(iter/s)": 0.13923 }, { "epoch": 1.6720516962843295, "grad_norm": 0.6970264315605164, "learning_rate": 4.020380415107167e-06, "loss": 0.16456249952316285, "memory(GiB)": 31.77, "step": 130, "token_acc": 0.9436249926249336, "train_speed(iter/s)": 0.139781 }, { "epoch": 1.7366720516962844, "grad_norm": 0.6929925680160522, "learning_rate": 3.689491585304491e-06, "loss": 0.1615690231323242, "memory(GiB)": 31.77, "step": 135, "token_acc": 0.9493547714477678, "train_speed(iter/s)": 0.140165 }, { "epoch": 1.8012924071082392, "grad_norm": 0.7727723121643066, "learning_rate": 3.3646601834128924e-06, "loss": 0.15618789196014404, "memory(GiB)": 31.77, "step": 140, "token_acc": 0.9474429805921518, "train_speed(iter/s)": 0.140829 }, { "epoch": 1.8012924071082392, "eval_loss": 0.2697683870792389, "eval_runtime": 3.3006, "eval_samples_per_second": 15.149, "eval_steps_per_second": 3.939, "eval_token_acc": 0.9146007940008822, "step": 140 }, { "epoch": 1.865912762520194, "grad_norm": 0.8078304529190063, "learning_rate": 3.0473876441260786e-06, "loss": 0.16288309097290038, "memory(GiB)": 31.77, "step": 145, "token_acc": 0.9430032977590819, "train_speed(iter/s)": 0.139196 }, { "epoch": 1.9305331179321485, "grad_norm": 0.7410924434661865, "learning_rate": 2.7391404635865725e-06, "loss": 0.16929523944854735, "memory(GiB)": 31.77, "step": 150, "token_acc": 0.9406619385342789, "train_speed(iter/s)": 0.140082 }, { "epoch": 1.9951534733441034, "grad_norm": 0.738341748714447, "learning_rate": 2.4413434209518137e-06, "loss": 0.16088511943817138, "memory(GiB)": 31.77, "step": 155, "token_acc": 0.9444251174117237, "train_speed(iter/s)": 0.14054 }, { "epoch": 2.0516962843295636, "grad_norm": 0.7186931371688843, "learning_rate": 2.1553729927843894e-06, "loss": 0.1285548210144043, "memory(GiB)": 31.77, "step": 160, "token_acc": 0.9580936465597584, "train_speed(iter/s)": 0.141633 }, { "epoch": 2.0516962843295636, "eval_loss": 0.2675042748451233, "eval_runtime": 3.3322, "eval_samples_per_second": 15.005, "eval_steps_per_second": 3.901, "eval_token_acc": 0.9149977944419938, "step": 160 }, { "epoch": 2.1163166397415187, "grad_norm": 0.6802994012832642, "learning_rate": 1.8825509907063328e-06, "loss": 0.11384077072143554, "memory(GiB)": 31.77, "step": 165, "token_acc": 0.9605823375909902, "train_speed(iter/s)": 0.140187 }, { "epoch": 2.1809369951534734, "grad_norm": 0.7430527806282043, "learning_rate": 1.6241384517255854e-06, "loss": 0.11673367023468018, "memory(GiB)": 31.77, "step": 170, "token_acc": 0.958113287261973, "train_speed(iter/s)": 0.14049 }, { "epoch": 2.245557350565428, "grad_norm": 0.7527663707733154, "learning_rate": 1.3813298094746491e-06, "loss": 0.1161942720413208, "memory(GiB)": 34.09, "step": 175, "token_acc": 0.9589060959341106, "train_speed(iter/s)": 0.140819 }, { "epoch": 2.3101777059773827, "grad_norm": 0.7852010726928711, "learning_rate": 1.1552473733031893e-06, "loss": 0.11494719982147217, "memory(GiB)": 34.09, "step": 180, "token_acc": 0.9586355734068701, "train_speed(iter/s)": 0.141152 }, { "epoch": 2.3101777059773827, "eval_loss": 0.29286888241767883, "eval_runtime": 3.3281, "eval_samples_per_second": 15.024, "eval_steps_per_second": 3.906, "eval_token_acc": 0.9136744596382885, "step": 180 }, { "epoch": 2.374798061389338, "grad_norm": 0.6895999908447266, "learning_rate": 9.469361407432431e-07, "loss": 0.11342091560363769, "memory(GiB)": 34.09, "step": 185, "token_acc": 0.9593238350125944, "train_speed(iter/s)": 0.139994 }, { "epoch": 2.4394184168012925, "grad_norm": 0.6789767146110535, "learning_rate": 7.573589673248833e-07, "loss": 0.1184342384338379, "memory(GiB)": 34.09, "step": 190, "token_acc": 0.9577452126224939, "train_speed(iter/s)": 0.14042 }, { "epoch": 2.504038772213247, "grad_norm": 0.7090432643890381, "learning_rate": 5.873921160683943e-07, "loss": 0.11669770479202271, "memory(GiB)": 34.09, "step": 195, "token_acc": 0.9631506472046268, "train_speed(iter/s)": 0.140952 }, { "epoch": 2.568659127625202, "grad_norm": 0.7863989472389221, "learning_rate": 4.3782120722406565e-07, "loss": 0.10347751379013062, "memory(GiB)": 34.09, "step": 200, "token_acc": 0.9619025747020847, "train_speed(iter/s)": 0.141445 }, { "epoch": 2.568659127625202, "eval_loss": 0.28900277614593506, "eval_runtime": 3.3211, "eval_samples_per_second": 15.055, "eval_steps_per_second": 3.914, "eval_token_acc": 0.9142920158800176, "step": 200 }, { "epoch": 2.633279483037157, "grad_norm": 0.6685696840286255, "learning_rate": 3.0933758698072023e-07, "loss": 0.11602609157562256, "memory(GiB)": 34.09, "step": 205, "token_acc": 0.9562507578513398, "train_speed(iter/s)": 0.14069 }, { "epoch": 2.6978998384491115, "grad_norm": 0.6653679013252258, "learning_rate": 2.0253513192751374e-07, "loss": 0.11234492063522339, "memory(GiB)": 34.09, "step": 210, "token_acc": 0.9581170175494474, "train_speed(iter/s)": 0.140892 }, { "epoch": 2.762520193861066, "grad_norm": 0.7487311959266663, "learning_rate": 1.1790750403941231e-07, "loss": 0.11896169185638428, "memory(GiB)": 34.09, "step": 215, "token_acc": 0.9582668433721905, "train_speed(iter/s)": 0.141293 }, { "epoch": 2.827140549273021, "grad_norm": 0.755111575126648, "learning_rate": 5.584586887435739e-08, "loss": 0.1167401671409607, "memory(GiB)": 34.09, "step": 220, "token_acc": 0.9631465104180927, "train_speed(iter/s)": 0.141655 }, { "epoch": 2.827140549273021, "eval_loss": 0.2880306839942932, "eval_runtime": 3.278, "eval_samples_per_second": 15.253, "eval_steps_per_second": 3.966, "eval_token_acc": 0.9148213498014998, "step": 220 }, { "epoch": 2.891760904684976, "grad_norm": 0.6732391119003296, "learning_rate": 1.6637087529033925e-08, "loss": 0.10909011363983154, "memory(GiB)": 34.09, "step": 225, "token_acc": 0.9598257622899813, "train_speed(iter/s)": 0.140904 }, { "epoch": 2.9563812600969306, "grad_norm": 0.6832190155982971, "learning_rate": 4.623907104084335e-10, "loss": 0.11326090097427369, "memory(GiB)": 34.09, "step": 230, "token_acc": 0.9568148980574731, "train_speed(iter/s)": 0.141045 }, { "epoch": 2.9693053311793216, "eval_loss": 0.28785240650177, "eval_runtime": 3.3057, "eval_samples_per_second": 15.125, "eval_steps_per_second": 3.933, "eval_token_acc": 0.9149095721217468, "step": 231 } ], "logging_steps": 5, "max_steps": 231, "num_input_tokens_seen": 0, "num_train_epochs": 3, "save_steps": 20, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 2.8087630551423386e+17, "train_batch_size": 1, "trial_name": null, "trial_params": null }