Files
qwen3-14b-fft-if/trainer_state.json

653 lines
16 KiB
JSON
Raw Normal View History

{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 2.0,
"eval_steps": 500,
"global_step": 874,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.02288329519450801,
"grad_norm": 6.273149490356445,
"learning_rate": 1.0227272727272729e-06,
"loss": 0.9488,
"step": 10
},
{
"epoch": 0.04576659038901602,
"grad_norm": 1.8167459964752197,
"learning_rate": 2.1590909090909092e-06,
"loss": 0.8935,
"step": 20
},
{
"epoch": 0.06864988558352403,
"grad_norm": 1.2105071544647217,
"learning_rate": 3.2954545454545456e-06,
"loss": 0.8345,
"step": 30
},
{
"epoch": 0.09153318077803203,
"grad_norm": 1.0105230808258057,
"learning_rate": 4.4318181818181824e-06,
"loss": 0.7483,
"step": 40
},
{
"epoch": 0.11441647597254005,
"grad_norm": 0.6374103426933289,
"learning_rate": 5.568181818181818e-06,
"loss": 0.7619,
"step": 50
},
{
"epoch": 0.13729977116704806,
"grad_norm": 0.6305025219917297,
"learning_rate": 6.704545454545454e-06,
"loss": 0.7492,
"step": 60
},
{
"epoch": 0.16018306636155608,
"grad_norm": 0.7204020023345947,
"learning_rate": 7.840909090909091e-06,
"loss": 0.7519,
"step": 70
},
{
"epoch": 0.18306636155606407,
"grad_norm": 0.5683720707893372,
"learning_rate": 8.977272727272727e-06,
"loss": 0.7103,
"step": 80
},
{
"epoch": 0.20594965675057209,
"grad_norm": 0.5563637018203735,
"learning_rate": 9.999960061285353e-06,
"loss": 0.7069,
"step": 90
},
{
"epoch": 0.2288329519450801,
"grad_norm": 0.5850629806518555,
"learning_rate": 9.995168187508393e-06,
"loss": 0.7032,
"step": 100
},
{
"epoch": 0.2517162471395881,
"grad_norm": 0.5742172598838806,
"learning_rate": 9.98239734155262e-06,
"loss": 0.7216,
"step": 110
},
{
"epoch": 0.2745995423340961,
"grad_norm": 0.5447644591331482,
"learning_rate": 9.961667922776125e-06,
"loss": 0.7085,
"step": 120
},
{
"epoch": 0.2974828375286041,
"grad_norm": 0.6290788054466248,
"learning_rate": 9.93301304306814e-06,
"loss": 0.7104,
"step": 130
},
{
"epoch": 0.32036613272311215,
"grad_norm": 0.5978163480758667,
"learning_rate": 9.896478473958147e-06,
"loss": 0.6963,
"step": 140
},
{
"epoch": 0.34324942791762014,
"grad_norm": 0.5672498345375061,
"learning_rate": 9.852122573503283e-06,
"loss": 0.6751,
"step": 150
},
{
"epoch": 0.36613272311212813,
"grad_norm": 0.6535360217094421,
"learning_rate": 9.800016193070789e-06,
"loss": 0.6757,
"step": 160
},
{
"epoch": 0.3890160183066362,
"grad_norm": 0.5888985395431519,
"learning_rate": 9.740242564164433e-06,
"loss": 0.7119,
"step": 170
},
{
"epoch": 0.41189931350114417,
"grad_norm": 0.5517858862876892,
"learning_rate": 9.672897165475657e-06,
"loss": 0.6598,
"step": 180
},
{
"epoch": 0.43478260869565216,
"grad_norm": 0.5883446931838989,
"learning_rate": 9.59808757037183e-06,
"loss": 0.713,
"step": 190
},
{
"epoch": 0.4576659038901602,
"grad_norm": 0.5446991920471191,
"learning_rate": 9.515933275065218e-06,
"loss": 0.6708,
"step": 200
},
{
"epoch": 0.4805491990846682,
"grad_norm": 0.5323174595832825,
"learning_rate": 9.426565507737139e-06,
"loss": 0.6929,
"step": 210
},
{
"epoch": 0.5034324942791762,
"grad_norm": 0.5511642098426819,
"learning_rate": 9.330127018922195e-06,
"loss": 0.6417,
"step": 220
},
{
"epoch": 0.5263157894736842,
"grad_norm": 0.5513615608215332,
"learning_rate": 9.226771853487411e-06,
"loss": 0.6499,
"step": 230
},
{
"epoch": 0.5491990846681922,
"grad_norm": 0.6379931569099426,
"learning_rate": 9.116665104570513e-06,
"loss": 0.6627,
"step": 240
},
{
"epoch": 0.5720823798627003,
"grad_norm": 0.5682238340377808,
"learning_rate": 8.999982649870377e-06,
"loss": 0.6766,
"step": 250
},
{
"epoch": 0.5949656750572082,
"grad_norm": 0.6159243583679199,
"learning_rate": 8.876910870710885e-06,
"loss": 0.6843,
"step": 260
},
{
"epoch": 0.6178489702517163,
"grad_norm": 0.6061480641365051,
"learning_rate": 8.747646354326948e-06,
"loss": 0.6844,
"step": 270
},
{
"epoch": 0.6407322654462243,
"grad_norm": 0.5296269059181213,
"learning_rate": 8.612395579848244e-06,
"loss": 0.6511,
"step": 280
},
{
"epoch": 0.6636155606407322,
"grad_norm": 0.6145397424697876,
"learning_rate": 8.47137458848224e-06,
"loss": 0.6631,
"step": 290
},
{
"epoch": 0.6864988558352403,
"grad_norm": 0.7743079662322998,
"learning_rate": 8.324808638423353e-06,
"loss": 0.6871,
"step": 300
},
{
"epoch": 0.7093821510297483,
"grad_norm": 0.5358887314796448,
"learning_rate": 8.172931845039471e-06,
"loss": 0.6249,
"step": 310
},
{
"epoch": 0.7322654462242563,
"grad_norm": 0.5243068933486938,
"learning_rate": 8.01598680691057e-06,
"loss": 0.6492,
"step": 320
},
{
"epoch": 0.7551487414187643,
"grad_norm": 0.543357789516449,
"learning_rate": 7.854224218316761e-06,
"loss": 0.6619,
"step": 330
},
{
"epoch": 0.7780320366132724,
"grad_norm": 0.6806201338768005,
"learning_rate": 7.687902468794803e-06,
"loss": 0.6729,
"step": 340
},
{
"epoch": 0.8009153318077803,
"grad_norm": 0.5173719525337219,
"learning_rate": 7.517287230402639e-06,
"loss": 0.631,
"step": 350
},
{
"epoch": 0.8237986270022883,
"grad_norm": 0.5824826955795288,
"learning_rate": 7.342651033351325e-06,
"loss": 0.6195,
"step": 360
},
{
"epoch": 0.8466819221967964,
"grad_norm": 0.5261944532394409,
"learning_rate": 7.164272830682161e-06,
"loss": 0.6352,
"step": 370
},
{
"epoch": 0.8695652173913043,
"grad_norm": 0.5619760751724243,
"learning_rate": 6.9824375526843705e-06,
"loss": 0.6549,
"step": 380
},
{
"epoch": 0.8924485125858124,
"grad_norm": 0.7826661467552185,
"learning_rate": 6.797435651765123e-06,
"loss": 0.6593,
"step": 390
},
{
"epoch": 0.9153318077803204,
"grad_norm": 0.5557212829589844,
"learning_rate": 6.609562638498845e-06,
"loss": 0.6141,
"step": 400
},
{
"epoch": 0.9382151029748284,
"grad_norm": 0.5369032621383667,
"learning_rate": 6.419118609596948e-06,
"loss": 0.6194,
"step": 410
},
{
"epoch": 0.9610983981693364,
"grad_norm": 0.636508584022522,
"learning_rate": 6.2264077685519246e-06,
"loss": 0.6406,
"step": 420
},
{
"epoch": 0.9839816933638444,
"grad_norm": 0.6025350689888,
"learning_rate": 6.031737939721538e-06,
"loss": 0.6515,
"step": 430
},
{
"epoch": 1.0068649885583525,
"grad_norm": 0.7006174325942993,
"learning_rate": 5.835420076629273e-06,
"loss": 0.6155,
"step": 440
},
{
"epoch": 1.0297482837528604,
"grad_norm": 0.5530907511711121,
"learning_rate": 5.6377677652664345e-06,
"loss": 0.4827,
"step": 450
},
{
"epoch": 1.0526315789473684,
"grad_norm": 0.5725921988487244,
"learning_rate": 5.439096723189316e-06,
"loss": 0.5285,
"step": 460
},
{
"epoch": 1.0755148741418765,
"grad_norm": 0.5810708403587341,
"learning_rate": 5.239724295211541e-06,
"loss": 0.4976,
"step": 470
},
{
"epoch": 1.0983981693363845,
"grad_norm": 0.49420347809791565,
"learning_rate": 5.03996894649711e-06,
"loss": 0.4919,
"step": 480
},
{
"epoch": 1.1212814645308924,
"grad_norm": 0.5970099568367004,
"learning_rate": 4.840149753863887e-06,
"loss": 0.4691,
"step": 490
},
{
"epoch": 1.1441647597254005,
"grad_norm": 0.5820793509483337,
"learning_rate": 4.640585896110054e-06,
"loss": 0.4929,
"step": 500
},
{
"epoch": 1.1670480549199085,
"grad_norm": 0.5207763314247131,
"learning_rate": 4.441596144177681e-06,
"loss": 0.4885,
"step": 510
},
{
"epoch": 1.1899313501144164,
"grad_norm": 0.5545329451560974,
"learning_rate": 4.243498351967761e-06,
"loss": 0.4682,
"step": 520
},
{
"epoch": 1.2128146453089246,
"grad_norm": 0.6203777194023132,
"learning_rate": 4.046608948620098e-06,
"loss": 0.4791,
"step": 530
},
{
"epoch": 1.2356979405034325,
"grad_norm": 0.592488706111908,
"learning_rate": 3.8512424330689855e-06,
"loss": 0.4732,
"step": 540
},
{
"epoch": 1.2585812356979404,
"grad_norm": 0.643437922000885,
"learning_rate": 3.657710871682115e-06,
"loss": 0.4849,
"step": 550
},
{
"epoch": 1.2814645308924484,
"grad_norm": 0.5146209597587585,
"learning_rate": 3.466323399785072e-06,
"loss": 0.4804,
"step": 560
},
{
"epoch": 1.3043478260869565,
"grad_norm": 0.5695487856864929,
"learning_rate": 3.2773857278677414e-06,
"loss": 0.4926,
"step": 570
},
{
"epoch": 1.3272311212814645,
"grad_norm": 0.6413753032684326,
"learning_rate": 3.0911996532612966e-06,
"loss": 0.5041,
"step": 580
},
{
"epoch": 1.3501144164759724,
"grad_norm": 0.6373730897903442,
"learning_rate": 2.9080625780658455e-06,
"loss": 0.473,
"step": 590
},
{
"epoch": 1.3729977116704806,
"grad_norm": 0.5488091111183167,
"learning_rate": 2.7282670340987465e-06,
"loss": 0.4664,
"step": 600
},
{
"epoch": 1.3958810068649885,
"grad_norm": 0.6199346780776978,
"learning_rate": 2.552100215622401e-06,
"loss": 0.4872,
"step": 610
},
{
"epoch": 1.4187643020594964,
"grad_norm": 0.6668885350227356,
"learning_rate": 2.379843520597937e-06,
"loss": 0.5043,
"step": 620
},
{
"epoch": 1.4416475972540046,
"grad_norm": 0.5706750154495239,
"learning_rate": 2.2117721011975366e-06,
"loss": 0.5273,
"step": 630
},
{
"epoch": 1.4645308924485125,
"grad_norm": 0.5967586040496826,
"learning_rate": 2.0481544242934105e-06,
"loss": 0.4862,
"step": 640
},
{
"epoch": 1.4874141876430205,
"grad_norm": 0.5441915988922119,
"learning_rate": 1.8892518426254363e-06,
"loss": 0.4729,
"step": 650
},
{
"epoch": 1.5102974828375286,
"grad_norm": 0.6105183362960815,
"learning_rate": 1.735318177332503e-06,
"loss": 0.5103,
"step": 660
},
{
"epoch": 1.5331807780320366,
"grad_norm": 0.6279262900352478,
"learning_rate": 1.5865993125143297e-06,
"loss": 0.4903,
"step": 670
},
{
"epoch": 1.5560640732265445,
"grad_norm": 0.571307897567749,
"learning_rate": 1.4433328024714583e-06,
"loss": 0.4755,
"step": 680
},
{
"epoch": 1.5789473684210527,
"grad_norm": 0.546181857585907,
"learning_rate": 1.3057474922507124e-06,
"loss": 0.4482,
"step": 690
},
{
"epoch": 1.6018306636155606,
"grad_norm": 0.6069242358207703,
"learning_rate": 1.1740631521023176e-06,
"loss": 0.4944,
"step": 700
},
{
"epoch": 1.6247139588100685,
"grad_norm": 0.6299660205841064,
"learning_rate": 1.0484901264325026e-06,
"loss": 0.4975,
"step": 710
},
{
"epoch": 1.6475972540045767,
"grad_norm": 0.5508016347885132,
"learning_rate": 9.292289978123892e-07,
"loss": 0.4457,
"step": 720
},
{
"epoch": 1.6704805491990846,
"grad_norm": 0.6158504486083984,
"learning_rate": 8.16470266579813e-07,
"loss": 0.4953,
"step": 730
},
{
"epoch": 1.6933638443935926,
"grad_norm": 0.5822216868400574,
"learning_rate": 7.103940465458936e-07,
"loss": 0.4719,
"step": 740
},
{
"epoch": 1.7162471395881007,
"grad_norm": 0.6294801831245422,
"learning_rate": 6.111697772923836e-07,
"loss": 0.4789,
"step": 750
},
{
"epoch": 1.7391304347826086,
"grad_norm": 0.5460816621780396,
"learning_rate": 5.189559535193839e-07,
"loss": 0.4781,
"step": 760
},
{
"epoch": 1.7620137299771166,
"grad_norm": 0.6677026748657227,
"learning_rate": 4.338998718757315e-07,
"loss": 0.4713,
"step": 770
},
{
"epoch": 1.7848970251716247,
"grad_norm": 0.6107152700424194,
"learning_rate": 3.5613739567645246e-07,
"loss": 0.5064,
"step": 780
},
{
"epoch": 1.8077803203661327,
"grad_norm": 0.5857329964637756,
"learning_rate": 2.8579273788312433e-07,
"loss": 0.4907,
"step": 790
},
{
"epoch": 1.8306636155606406,
"grad_norm": 0.5900473594665527,
"learning_rate": 2.2297826269378653e-07,
"loss": 0.4547,
"step": 800
},
{
"epoch": 1.8535469107551488,
"grad_norm": 0.5375809669494629,
"learning_rate": 1.6779430605933233e-07,
"loss": 0.4939,
"step": 810
},
{
"epoch": 1.8764302059496567,
"grad_norm": 0.5968102812767029,
"learning_rate": 1.203290154130754e-07,
"loss": 0.5068,
"step": 820
},
{
"epoch": 1.8993135011441646,
"grad_norm": 0.5544958710670471,
"learning_rate": 8.065820886950404e-08,
"loss": 0.4447,
"step": 830
},
{
"epoch": 1.9221967963386728,
"grad_norm": 0.5510764718055725,
"learning_rate": 4.8845254117120265e-08,
"loss": 0.4844,
"step": 840
},
{
"epoch": 1.9450800915331807,
"grad_norm": 0.6316992044448853,
"learning_rate": 2.4940967198821553e-08,
"loss": 0.4735,
"step": 850
},
{
"epoch": 1.9679633867276887,
"grad_norm": 0.5907024145126343,
"learning_rate": 8.983531341500984e-09,
"loss": 0.457,
"step": 860
},
{
"epoch": 1.9908466819221968,
"grad_norm": 0.6300244927406311,
"learning_rate": 9.984359645276443e-10,
"loss": 0.4556,
"step": 870
},
{
"epoch": 2.0,
"step": 874,
"total_flos": 1.3931784786122113e+19,
"train_loss": 0.5872682382094778,
"train_runtime": 12619.0484,
"train_samples_per_second": 8.865,
"train_steps_per_second": 0.069
}
],
"logging_steps": 10,
"max_steps": 874,
"num_input_tokens_seen": 0,
"num_train_epochs": 2,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 1.3931784786122113e+19,
"train_batch_size": 4,
"trial_name": null,
"trial_params": null
}