Files
qwen3-14b-fft-coding/trainer_state.json
ModelHub XC 896b02ea7c 初始化项目,由ModelHub XC社区提供模型
Model: KKHYA/qwen3-14b-fft-coding
Source: Original Platform
2026-07-17 11:25:11 +08:00

702 lines
18 KiB
JSON

{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 4.0,
"eval_steps": 500,
"global_step": 940,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.042666666666666665,
"grad_norm": 8.999624900584061,
"learning_rate": 9.574468085106384e-07,
"loss": 0.9603355407714844,
"step": 10
},
{
"epoch": 0.08533333333333333,
"grad_norm": 2.636704103036297,
"learning_rate": 2.021276595744681e-06,
"loss": 0.8526813507080078,
"step": 20
},
{
"epoch": 0.128,
"grad_norm": 0.9865915385714896,
"learning_rate": 3.0851063829787237e-06,
"loss": 0.7081204414367676,
"step": 30
},
{
"epoch": 0.17066666666666666,
"grad_norm": 0.7401367462143341,
"learning_rate": 4.148936170212766e-06,
"loss": 0.6635202407836914,
"step": 40
},
{
"epoch": 0.21333333333333335,
"grad_norm": 0.669698985531291,
"learning_rate": 5.212765957446809e-06,
"loss": 0.6683910369873047,
"step": 50
},
{
"epoch": 0.256,
"grad_norm": 0.6360008572056217,
"learning_rate": 6.276595744680851e-06,
"loss": 0.6275049686431885,
"step": 60
},
{
"epoch": 0.2986666666666667,
"grad_norm": 0.555318435827221,
"learning_rate": 7.340425531914894e-06,
"loss": 0.6528850555419922,
"step": 70
},
{
"epoch": 0.3413333333333333,
"grad_norm": 0.6058441604473745,
"learning_rate": 8.404255319148937e-06,
"loss": 0.6439791679382324,
"step": 80
},
{
"epoch": 0.384,
"grad_norm": 0.6475130784871053,
"learning_rate": 9.46808510638298e-06,
"loss": 0.6390511989593506,
"step": 90
},
{
"epoch": 0.4266666666666667,
"grad_norm": 0.574181881803242,
"learning_rate": 9.999138160172624e-06,
"loss": 0.6257343292236328,
"step": 100
},
{
"epoch": 0.4693333333333333,
"grad_norm": 0.5905566490874637,
"learning_rate": 9.99224522409411e-06,
"loss": 0.592672061920166,
"step": 110
},
{
"epoch": 0.512,
"grad_norm": 0.5435503029654155,
"learning_rate": 9.97846885608885e-06,
"loss": 0.6212929725646973,
"step": 120
},
{
"epoch": 0.5546666666666666,
"grad_norm": 0.5730040949967365,
"learning_rate": 9.957828051355817e-06,
"loss": 0.6225690364837646,
"step": 130
},
{
"epoch": 0.5973333333333334,
"grad_norm": 0.5899735213380095,
"learning_rate": 9.930351269950144e-06,
"loss": 0.6189698219299317,
"step": 140
},
{
"epoch": 0.64,
"grad_norm": 0.5525970102466683,
"learning_rate": 9.896076397541676e-06,
"loss": 0.6111098289489746,
"step": 150
},
{
"epoch": 0.6826666666666666,
"grad_norm": 0.5711039837223352,
"learning_rate": 9.855050693177286e-06,
"loss": 0.6421695709228515,
"step": 160
},
{
"epoch": 0.7253333333333334,
"grad_norm": 0.5616230459173172,
"learning_rate": 9.807330724118906e-06,
"loss": 0.6056369781494141,
"step": 170
},
{
"epoch": 0.768,
"grad_norm": 0.5976781995767532,
"learning_rate": 9.752982287847193e-06,
"loss": 0.6315202236175537,
"step": 180
},
{
"epoch": 0.8106666666666666,
"grad_norm": 0.5178875267856328,
"learning_rate": 9.692080321338317e-06,
"loss": 0.6108819961547851,
"step": 190
},
{
"epoch": 0.8533333333333334,
"grad_norm": 0.5372603896789684,
"learning_rate": 9.624708797739002e-06,
"loss": 0.6224051475524902,
"step": 200
},
{
"epoch": 0.896,
"grad_norm": 0.5947283222378256,
"learning_rate": 9.550960610582251e-06,
"loss": 0.6080554485321045,
"step": 210
},
{
"epoch": 0.9386666666666666,
"grad_norm": 0.5535038239517683,
"learning_rate": 9.47093744570344e-06,
"loss": 0.6155075073242188,
"step": 220
},
{
"epoch": 0.9813333333333333,
"grad_norm": 0.6431070900946148,
"learning_rate": 9.384749641033358e-06,
"loss": 0.6900673866271972,
"step": 230
},
{
"epoch": 1.0213333333333334,
"grad_norm": 0.5827801730730351,
"learning_rate": 9.292516034461517e-06,
"loss": 0.5847660064697265,
"step": 240
},
{
"epoch": 1.064,
"grad_norm": 0.5426769543406595,
"learning_rate": 9.194363799979517e-06,
"loss": 0.4798769950866699,
"step": 250
},
{
"epoch": 1.1066666666666667,
"grad_norm": 0.5643710578769041,
"learning_rate": 9.090428272330381e-06,
"loss": 0.5030141830444336,
"step": 260
},
{
"epoch": 1.1493333333333333,
"grad_norm": 0.639872823627873,
"learning_rate": 8.980852760405645e-06,
"loss": 0.5117604255676269,
"step": 270
},
{
"epoch": 1.192,
"grad_norm": 0.586196190491155,
"learning_rate": 8.865788349647496e-06,
"loss": 0.5203066349029541,
"step": 280
},
{
"epoch": 1.2346666666666666,
"grad_norm": 0.5440685701114154,
"learning_rate": 8.745393693728395e-06,
"loss": 0.49484944343566895,
"step": 290
},
{
"epoch": 1.2773333333333334,
"grad_norm": 0.600205428025161,
"learning_rate": 8.619834795795458e-06,
"loss": 0.5042594909667969,
"step": 300
},
{
"epoch": 1.32,
"grad_norm": 0.5811654003465344,
"learning_rate": 8.489284779581179e-06,
"loss": 0.5075913429260254,
"step": 310
},
{
"epoch": 1.3626666666666667,
"grad_norm": 0.5388406938464266,
"learning_rate": 8.353923650696119e-06,
"loss": 0.5113458156585693,
"step": 320
},
{
"epoch": 1.4053333333333333,
"grad_norm": 0.6016476237889334,
"learning_rate": 8.213938048432697e-06,
"loss": 0.5259346961975098,
"step": 330
},
{
"epoch": 1.448,
"grad_norm": 0.588862463698428,
"learning_rate": 8.069520988422292e-06,
"loss": 0.4647953987121582,
"step": 340
},
{
"epoch": 1.4906666666666666,
"grad_norm": 0.6117968442301682,
"learning_rate": 7.920871596500473e-06,
"loss": 0.5107015609741211,
"step": 350
},
{
"epoch": 1.5333333333333332,
"grad_norm": 0.6314351969836132,
"learning_rate": 7.768194834147362e-06,
"loss": 0.4998687744140625,
"step": 360
},
{
"epoch": 1.576,
"grad_norm": 0.5999986531996214,
"learning_rate": 7.611701215881635e-06,
"loss": 0.518181037902832,
"step": 370
},
{
"epoch": 1.6186666666666667,
"grad_norm": 0.5931911048454541,
"learning_rate": 7.4516065189978625e-06,
"loss": 0.5033650398254395,
"step": 380
},
{
"epoch": 1.6613333333333333,
"grad_norm": 0.6266374937456085,
"learning_rate": 7.288131486047414e-06,
"loss": 0.5123775482177735,
"step": 390
},
{
"epoch": 1.704,
"grad_norm": 0.5717503598353061,
"learning_rate": 7.121501520473137e-06,
"loss": 0.4882556438446045,
"step": 400
},
{
"epoch": 1.7466666666666666,
"grad_norm": 0.6003251003283733,
"learning_rate": 6.9519463758174745e-06,
"loss": 0.48767690658569335,
"step": 410
},
{
"epoch": 1.7893333333333334,
"grad_norm": 0.593730463299211,
"learning_rate": 6.77969983893257e-06,
"loss": 0.5198426246643066,
"step": 420
},
{
"epoch": 1.8319999999999999,
"grad_norm": 0.573986464962402,
"learning_rate": 6.604999407629137e-06,
"loss": 0.5152793884277344,
"step": 430
},
{
"epoch": 1.8746666666666667,
"grad_norm": 0.6292349528099412,
"learning_rate": 6.428085963208567e-06,
"loss": 0.521914005279541,
"step": 440
},
{
"epoch": 1.9173333333333333,
"grad_norm": 0.6478722794091921,
"learning_rate": 6.249203438329799e-06,
"loss": 0.5165102481842041,
"step": 450
},
{
"epoch": 1.96,
"grad_norm": 0.5570760020319501,
"learning_rate": 6.0685984806689055e-06,
"loss": 0.49199323654174804,
"step": 460
},
{
"epoch": 2.0,
"grad_norm": 0.9597148964135244,
"learning_rate": 5.886520112835128e-06,
"loss": 0.5182024002075195,
"step": 470
},
{
"epoch": 2.042666666666667,
"grad_norm": 0.7599076030225683,
"learning_rate": 5.703219389012317e-06,
"loss": 0.3669234275817871,
"step": 480
},
{
"epoch": 2.0853333333333333,
"grad_norm": 0.6864314007799437,
"learning_rate": 5.518949048799176e-06,
"loss": 0.3571956634521484,
"step": 490
},
{
"epoch": 2.128,
"grad_norm": 0.6616396360754778,
"learning_rate": 5.3339631687256085e-06,
"loss": 0.35114617347717286,
"step": 500
},
{
"epoch": 2.1706666666666665,
"grad_norm": 0.7257990883487906,
"learning_rate": 5.148516811925684e-06,
"loss": 0.3634940624237061,
"step": 510
},
{
"epoch": 2.2133333333333334,
"grad_norm": 0.7153343933001038,
"learning_rate": 4.962865676450239e-06,
"loss": 0.3606603145599365,
"step": 520
},
{
"epoch": 2.2560000000000002,
"grad_norm": 0.6808533640895508,
"learning_rate": 4.777265742704039e-06,
"loss": 0.3447108745574951,
"step": 530
},
{
"epoch": 2.2986666666666666,
"grad_norm": 0.715150230691381,
"learning_rate": 4.591972920493638e-06,
"loss": 0.37036728858947754,
"step": 540
},
{
"epoch": 2.3413333333333335,
"grad_norm": 0.7301247118374748,
"learning_rate": 4.40724269617256e-06,
"loss": 0.3504173278808594,
"step": 550
},
{
"epoch": 2.384,
"grad_norm": 0.7579764542403585,
"learning_rate": 4.223329780370359e-06,
"loss": 0.3552720069885254,
"step": 560
},
{
"epoch": 2.4266666666666667,
"grad_norm": 0.665681730147191,
"learning_rate": 4.04048775679127e-06,
"loss": 0.34830622673034667,
"step": 570
},
{
"epoch": 2.469333333333333,
"grad_norm": 0.6942115980596211,
"learning_rate": 3.858968732566685e-06,
"loss": 0.3437772512435913,
"step": 580
},
{
"epoch": 2.512,
"grad_norm": 0.7356178016396235,
"learning_rate": 3.6790229906435706e-06,
"loss": 0.3701408624649048,
"step": 590
},
{
"epoch": 2.554666666666667,
"grad_norm": 0.76371891979336,
"learning_rate": 3.5008986446881088e-06,
"loss": 0.3588127613067627,
"step": 600
},
{
"epoch": 2.5973333333333333,
"grad_norm": 0.7924639034556639,
"learning_rate": 3.3248412969804065e-06,
"loss": 0.3826591968536377,
"step": 610
},
{
"epoch": 2.64,
"grad_norm": 0.7415843408514342,
"learning_rate": 3.1510936997719557e-06,
"loss": 0.35985655784606935,
"step": 620
},
{
"epoch": 2.6826666666666665,
"grad_norm": 0.7404620123688074,
"learning_rate": 2.9798954205727886e-06,
"loss": 0.3487427234649658,
"step": 630
},
{
"epoch": 2.7253333333333334,
"grad_norm": 0.7520085742772266,
"learning_rate": 2.811482511829842e-06,
"loss": 0.3587791442871094,
"step": 640
},
{
"epoch": 2.768,
"grad_norm": 0.7426608142495378,
"learning_rate": 2.6460871854519594e-06,
"loss": 0.3492987394332886,
"step": 650
},
{
"epoch": 2.8106666666666666,
"grad_norm": 0.7396983944629798,
"learning_rate": 2.483937492630345e-06,
"loss": 0.33745241165161133,
"step": 660
},
{
"epoch": 2.8533333333333335,
"grad_norm": 0.7484300928063685,
"learning_rate": 2.3252570093959e-06,
"loss": 0.36391506195068357,
"step": 670
},
{
"epoch": 2.896,
"grad_norm": 0.7073190633237699,
"learning_rate": 2.1702645283470238e-06,
"loss": 0.3687248706817627,
"step": 680
},
{
"epoch": 2.9386666666666668,
"grad_norm": 0.7068579075999436,
"learning_rate": 2.0191737569729492e-06,
"loss": 0.36745338439941405,
"step": 690
},
{
"epoch": 2.981333333333333,
"grad_norm": 0.7173146292749063,
"learning_rate": 1.872193022988526e-06,
"loss": 0.34957075119018555,
"step": 700
},
{
"epoch": 3.021333333333333,
"grad_norm": 0.8300783812815867,
"learning_rate": 1.7295249870867898e-06,
"loss": 0.3146792411804199,
"step": 710
},
{
"epoch": 3.064,
"grad_norm": 1.070273747301605,
"learning_rate": 1.5913663635053578e-06,
"loss": 0.2616109371185303,
"step": 720
},
{
"epoch": 3.1066666666666665,
"grad_norm": 0.801956283142561,
"learning_rate": 1.457907648791943e-06,
"loss": 0.2639318466186523,
"step": 730
},
{
"epoch": 3.1493333333333333,
"grad_norm": 0.8000993958690409,
"learning_rate": 1.329332859142967e-06,
"loss": 0.23923878669738768,
"step": 740
},
{
"epoch": 3.192,
"grad_norm": 0.8249305995327736,
"learning_rate": 1.205819276677464e-06,
"loss": 0.2671759605407715,
"step": 750
},
{
"epoch": 3.2346666666666666,
"grad_norm": 0.9324101657605222,
"learning_rate": 1.0875372049960697e-06,
"loss": 0.24742560386657714,
"step": 760
},
{
"epoch": 3.2773333333333334,
"grad_norm": 0.798009630439176,
"learning_rate": 9.746497343621857e-07,
"loss": 0.2519863128662109,
"step": 770
},
{
"epoch": 3.32,
"grad_norm": 0.8369262323406452,
"learning_rate": 8.673125168290713e-07,
"loss": 0.25240919589996336,
"step": 780
},
{
"epoch": 3.3626666666666667,
"grad_norm": 0.7616838883796991,
"learning_rate": 7.656735516229125e-07,
"loss": 0.2599855899810791,
"step": 790
},
{
"epoch": 3.405333333333333,
"grad_norm": 0.8666710182114363,
"learning_rate": 6.698729810778065e-07,
"loss": 0.2527294635772705,
"step": 800
},
{
"epoch": 3.448,
"grad_norm": 0.79311539703412,
"learning_rate": 5.800428974040311e-07,
"loss": 0.2647819995880127,
"step": 810
},
{
"epoch": 3.490666666666667,
"grad_norm": 0.9179905441651993,
"learning_rate": 4.963071605560144e-07,
"loss": 0.2600534915924072,
"step": 820
},
{
"epoch": 3.533333333333333,
"grad_norm": 0.9272013641675249,
"learning_rate": 4.187812274511427e-07,
"loss": 0.2649343252182007,
"step": 830
},
{
"epoch": 3.576,
"grad_norm": 0.8183105373770141,
"learning_rate": 3.4757199277490106e-07,
"loss": 0.2622586965560913,
"step": 840
},
{
"epoch": 3.618666666666667,
"grad_norm": 0.7939545039336852,
"learning_rate": 2.8277764159181484e-07,
"loss": 0.2523667335510254,
"step": 850
},
{
"epoch": 3.6613333333333333,
"grad_norm": 0.9010122576415565,
"learning_rate": 2.2448751396543788e-07,
"loss": 0.26191320419311526,
"step": 860
},
{
"epoch": 3.7039999999999997,
"grad_norm": 0.8710705871093096,
"learning_rate": 1.7278198177405614e-07,
"loss": 0.25244143009185793,
"step": 870
},
{
"epoch": 3.7466666666666666,
"grad_norm": 0.8006138211679082,
"learning_rate": 1.2773233789193816e-07,
"loss": 0.2483151912689209,
"step": 880
},
{
"epoch": 3.7893333333333334,
"grad_norm": 0.8465843943197577,
"learning_rate": 8.940069788894389e-08,
"loss": 0.2665947675704956,
"step": 890
},
{
"epoch": 3.832,
"grad_norm": 0.8011024381853885,
"learning_rate": 5.783991438403802e-08,
"loss": 0.25572938919067384,
"step": 900
},
{
"epoch": 3.8746666666666667,
"grad_norm": 0.799485639611528,
"learning_rate": 3.309350417077972e-08,
"loss": 0.25423431396484375,
"step": 910
},
{
"epoch": 3.9173333333333336,
"grad_norm": 0.8056040335409604,
"learning_rate": 1.5195588215283773e-08,
"loss": 0.2418086051940918,
"step": 920
},
{
"epoch": 3.96,
"grad_norm": 0.8601769661004041,
"learning_rate": 4.170844609387992e-09,
"loss": 0.2599043369293213,
"step": 930
},
{
"epoch": 4.0,
"grad_norm": 1.3803589385885682,
"learning_rate": 3.447454388127991e-11,
"loss": 0.2301353931427002,
"step": 940
},
{
"epoch": 4.0,
"step": 940,
"total_flos": 152338919849984.0,
"train_loss": 0.44427714956567643,
"train_runtime": 18988.0523,
"train_samples_per_second": 6.32,
"train_steps_per_second": 0.05
}
],
"logging_steps": 10,
"max_steps": 940,
"num_input_tokens_seen": 0,
"num_train_epochs": 4,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 152338919849984.0,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}