Files
qwen3-8b-base-sft-ultrachat…/trainer_state.json

741 lines
18 KiB
JSON
Raw Permalink Normal View History

{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.9994722955145119,
"eval_steps": 200,
"global_step": 947,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.0010554089709762533,
"grad_norm": 4.428989887237549,
"learning_rate": 0.0,
"loss": 1.4444,
"step": 1
},
{
"epoch": 0.010554089709762533,
"grad_norm": 3.5337846279144287,
"learning_rate": 1.8947368421052634e-06,
"loss": 1.4272,
"step": 10
},
{
"epoch": 0.021108179419525065,
"grad_norm": 1.0835645198822021,
"learning_rate": 4.000000000000001e-06,
"loss": 1.3383,
"step": 20
},
{
"epoch": 0.0316622691292876,
"grad_norm": 1.217992901802063,
"learning_rate": 6.105263157894738e-06,
"loss": 1.2714,
"step": 30
},
{
"epoch": 0.04221635883905013,
"grad_norm": 1.7282902002334595,
"learning_rate": 8.210526315789475e-06,
"loss": 1.2262,
"step": 40
},
{
"epoch": 0.052770448548812667,
"grad_norm": 1.640160322189331,
"learning_rate": 1.0315789473684213e-05,
"loss": 1.1945,
"step": 50
},
{
"epoch": 0.0633245382585752,
"grad_norm": 1.4558825492858887,
"learning_rate": 1.2421052631578949e-05,
"loss": 1.1686,
"step": 60
},
{
"epoch": 0.07387862796833773,
"grad_norm": 1.016249656677246,
"learning_rate": 1.4526315789473687e-05,
"loss": 1.1422,
"step": 70
},
{
"epoch": 0.08443271767810026,
"grad_norm": 0.7121432423591614,
"learning_rate": 1.6631578947368423e-05,
"loss": 1.1314,
"step": 80
},
{
"epoch": 0.09498680738786279,
"grad_norm": 0.7841984033584595,
"learning_rate": 1.873684210526316e-05,
"loss": 1.1275,
"step": 90
},
{
"epoch": 0.10554089709762533,
"grad_norm": 0.6388397216796875,
"learning_rate": 1.999891231617599e-05,
"loss": 1.1178,
"step": 100
},
{
"epoch": 0.11609498680738786,
"grad_norm": 0.5346229076385498,
"learning_rate": 1.9986678590325273e-05,
"loss": 1.1205,
"step": 110
},
{
"epoch": 0.1266490765171504,
"grad_norm": 0.6061886548995972,
"learning_rate": 1.996086822074945e-05,
"loss": 1.1135,
"step": 120
},
{
"epoch": 0.13720316622691292,
"grad_norm": 0.5429868698120117,
"learning_rate": 1.9921516296010645e-05,
"loss": 1.1072,
"step": 130
},
{
"epoch": 0.14775725593667546,
"grad_norm": 0.5146633386611938,
"learning_rate": 1.9868676314081907e-05,
"loss": 1.0997,
"step": 140
},
{
"epoch": 0.158311345646438,
"grad_norm": 0.5138978362083435,
"learning_rate": 1.980242010961803e-05,
"loss": 1.0973,
"step": 150
},
{
"epoch": 0.16886543535620052,
"grad_norm": 0.48871827125549316,
"learning_rate": 1.9722837756298112e-05,
"loss": 1.1089,
"step": 160
},
{
"epoch": 0.17941952506596306,
"grad_norm": 0.5564476251602173,
"learning_rate": 1.96300374443726e-05,
"loss": 1.0914,
"step": 170
},
{
"epoch": 0.18997361477572558,
"grad_norm": 0.48119252920150757,
"learning_rate": 1.9524145333581315e-05,
"loss": 1.1018,
"step": 180
},
{
"epoch": 0.20052770448548812,
"grad_norm": 0.45517972111701965,
"learning_rate": 1.9405305381642376e-05,
"loss": 1.0982,
"step": 190
},
{
"epoch": 0.21108179419525067,
"grad_norm": 0.47854238748550415,
"learning_rate": 1.9273679148545246e-05,
"loss": 1.0891,
"step": 200
},
{
"epoch": 0.21108179419525067,
"eval_loss": 1.11018705368042,
"eval_runtime": 269.0491,
"eval_samples_per_second": 49.868,
"eval_steps_per_second": 0.781,
"step": 200
},
{
"epoch": 0.22163588390501318,
"grad_norm": 0.43568843603134155,
"learning_rate": 1.9129445576913886e-05,
"loss": 1.0998,
"step": 210
},
{
"epoch": 0.23218997361477572,
"grad_norm": 0.4271477162837982,
"learning_rate": 1.897280074873868e-05,
"loss": 1.1231,
"step": 220
},
{
"epoch": 0.24274406332453827,
"grad_norm": 0.44812774658203125,
"learning_rate": 1.8803957618807764e-05,
"loss": 1.1038,
"step": 230
},
{
"epoch": 0.2532981530343008,
"grad_norm": 0.4037184417247772,
"learning_rate": 1.862314572520028e-05,
"loss": 1.1104,
"step": 240
},
{
"epoch": 0.2638522427440633,
"grad_norm": 0.44267192482948303,
"learning_rate": 1.843061087723496e-05,
"loss": 1.0939,
"step": 250
},
{
"epoch": 0.27440633245382584,
"grad_norm": 0.44187697768211365,
"learning_rate": 1.8226614821298444e-05,
"loss": 1.1081,
"step": 260
},
{
"epoch": 0.2849604221635884,
"grad_norm": 0.41764840483665466,
"learning_rate": 1.8011434885007482e-05,
"loss": 1.0985,
"step": 270
},
{
"epoch": 0.2955145118733509,
"grad_norm": 0.3874802589416504,
"learning_rate": 1.7785363600188894e-05,
"loss": 1.1005,
"step": 280
},
{
"epoch": 0.30606860158311344,
"grad_norm": 0.3772076666355133,
"learning_rate": 1.7548708305189724e-05,
"loss": 1.09,
"step": 290
},
{
"epoch": 0.316622691292876,
"grad_norm": 0.4143645167350769,
"learning_rate": 1.7301790727058344e-05,
"loss": 1.0849,
"step": 300
},
{
"epoch": 0.32717678100263853,
"grad_norm": 0.43071797490119934,
"learning_rate": 1.7044946544164434e-05,
"loss": 1.0956,
"step": 310
},
{
"epoch": 0.33773087071240104,
"grad_norm": 0.3988950252532959,
"learning_rate": 1.6778524929852513e-05,
"loss": 1.1042,
"step": 320
},
{
"epoch": 0.3482849604221636,
"grad_norm": 0.40434718132019043,
"learning_rate": 1.650288807774937e-05,
"loss": 1.0978,
"step": 330
},
{
"epoch": 0.35883905013192613,
"grad_norm": 0.41674408316612244,
"learning_rate": 1.6218410709370735e-05,
"loss": 1.0914,
"step": 340
},
{
"epoch": 0.36939313984168864,
"grad_norm": 0.395465224981308,
"learning_rate": 1.592547956469662e-05,
"loss": 1.1126,
"step": 350
},
{
"epoch": 0.37994722955145116,
"grad_norm": 0.3750782608985901,
"learning_rate": 1.562449287640781e-05,
"loss": 1.099,
"step": 360
},
{
"epoch": 0.39050131926121373,
"grad_norm": 0.3862684369087219,
"learning_rate": 1.5315859828498353e-05,
"loss": 1.0933,
"step": 370
},
{
"epoch": 0.40105540897097625,
"grad_norm": 0.40379074215888977,
"learning_rate": 1.5000000000000002e-05,
"loss": 1.0905,
"step": 380
},
{
"epoch": 0.41160949868073876,
"grad_norm": 0.3791244328022003,
"learning_rate": 1.4677342794574819e-05,
"loss": 1.0835,
"step": 390
},
{
"epoch": 0.42216358839050133,
"grad_norm": 0.36901775002479553,
"learning_rate": 1.4348326856751496e-05,
"loss": 1.095,
"step": 400
},
{
"epoch": 0.42216358839050133,
"eval_loss": 1.0990158319473267,
"eval_runtime": 269.2071,
"eval_samples_per_second": 49.839,
"eval_steps_per_second": 0.78,
"step": 400
},
{
"epoch": 0.43271767810026385,
"grad_norm": 0.38086214661598206,
"learning_rate": 1.401339947559889e-05,
"loss": 1.1001,
"step": 410
},
{
"epoch": 0.44327176781002636,
"grad_norm": 0.42641252279281616,
"learning_rate": 1.367301597664757e-05,
"loss": 1.085,
"step": 420
},
{
"epoch": 0.45382585751978893,
"grad_norm": 0.37229016423225403,
"learning_rate": 1.3327639102885939e-05,
"loss": 1.0852,
"step": 430
},
{
"epoch": 0.46437994722955145,
"grad_norm": 0.38543465733528137,
"learning_rate": 1.2977738385672558e-05,
"loss": 1.0982,
"step": 440
},
{
"epoch": 0.47493403693931396,
"grad_norm": 0.36999842524528503,
"learning_rate": 1.2623789506419792e-05,
"loss": 1.0844,
"step": 450
},
{
"epoch": 0.48548812664907653,
"grad_norm": 0.3730550706386566,
"learning_rate": 1.2266273649916669e-05,
"loss": 1.0838,
"step": 460
},
{
"epoch": 0.49604221635883905,
"grad_norm": 0.35631632804870605,
"learning_rate": 1.190567685016998e-05,
"loss": 1.076,
"step": 470
},
{
"epoch": 0.5065963060686016,
"grad_norm": 0.3838544487953186,
"learning_rate": 1.1542489329653024e-05,
"loss": 1.0831,
"step": 480
},
{
"epoch": 0.5171503957783641,
"grad_norm": 0.40018004179000854,
"learning_rate": 1.1177204832860214e-05,
"loss": 1.0813,
"step": 490
},
{
"epoch": 0.5277044854881267,
"grad_norm": 0.3892735540866852,
"learning_rate": 1.08103199550736e-05,
"loss": 1.0909,
"step": 500
},
{
"epoch": 0.5382585751978892,
"grad_norm": 0.42785775661468506,
"learning_rate": 1.044233346725379e-05,
"loss": 1.0827,
"step": 510
},
{
"epoch": 0.5488126649076517,
"grad_norm": 0.37400808930397034,
"learning_rate": 1.0073745637973125e-05,
"loss": 1.0896,
"step": 520
},
{
"epoch": 0.5593667546174143,
"grad_norm": 0.38293296098709106,
"learning_rate": 9.705057553312857e-06,
"loss": 1.0847,
"step": 530
},
{
"epoch": 0.5699208443271768,
"grad_norm": 0.39219433069229126,
"learning_rate": 9.336770435648963e-06,
"loss": 1.0833,
"step": 540
},
{
"epoch": 0.5804749340369393,
"grad_norm": 0.3722192645072937,
"learning_rate": 8.969384962252646e-06,
"loss": 1.0823,
"step": 550
},
{
"epoch": 0.5910290237467019,
"grad_norm": 0.4041948914527893,
"learning_rate": 8.60340058463194e-06,
"loss": 1.0733,
"step": 560
},
{
"epoch": 0.6015831134564644,
"grad_norm": 0.36892595887184143,
"learning_rate": 8.239314849539639e-06,
"loss": 1.0618,
"step": 570
},
{
"epoch": 0.6121372031662269,
"grad_norm": 0.3803699314594269,
"learning_rate": 7.877622722570772e-06,
"loss": 1.0896,
"step": 580
},
{
"epoch": 0.6226912928759895,
"grad_norm": 0.3644523620605469,
"learning_rate": 7.518815915269025e-06,
"loss": 1.0819,
"step": 590
},
{
"epoch": 0.633245382585752,
"grad_norm": 0.3542793095111847,
"learning_rate": 7.163382216657033e-06,
"loss": 1.0886,
"step": 600
},
{
"epoch": 0.633245382585752,
"eval_loss": 1.090126872062683,
"eval_runtime": 268.9072,
"eval_samples_per_second": 49.895,
"eval_steps_per_second": 0.781,
"step": 600
},
{
"epoch": 0.6437994722955145,
"grad_norm": 0.3555884063243866,
"learning_rate": 6.811804830099186e-06,
"loss": 1.0655,
"step": 610
},
{
"epoch": 0.6543535620052771,
"grad_norm": 0.3567143380641937,
"learning_rate": 6.464561716398565e-06,
"loss": 1.078,
"step": 620
},
{
"epoch": 0.6649076517150396,
"grad_norm": 0.3770051598548889,
"learning_rate": 6.122124944020978e-06,
"loss": 1.0836,
"step": 630
},
{
"epoch": 0.6754617414248021,
"grad_norm": 0.352397084236145,
"learning_rate": 5.78496004732952e-06,
"loss": 1.0719,
"step": 640
},
{
"epoch": 0.6860158311345647,
"grad_norm": 0.3588451147079468,
"learning_rate": 5.453525393702053e-06,
"loss": 1.0849,
"step": 650
},
{
"epoch": 0.6965699208443272,
"grad_norm": 0.40011218190193176,
"learning_rate": 5.128271560392037e-06,
"loss": 1.082,
"step": 660
},
{
"epoch": 0.7071240105540897,
"grad_norm": 0.34496238827705383,
"learning_rate": 4.809640721979856e-06,
"loss": 1.077,
"step": 670
},
{
"epoch": 0.7176781002638523,
"grad_norm": 0.38083967566490173,
"learning_rate": 4.498066049247344e-06,
"loss": 1.0639,
"step": 680
},
{
"epoch": 0.7282321899736148,
"grad_norm": 0.3846307098865509,
"learning_rate": 4.193971120292793e-06,
"loss": 1.0778,
"step": 690
},
{
"epoch": 0.7387862796833773,
"grad_norm": 0.33913660049438477,
"learning_rate": 3.897769344686929e-06,
"loss": 1.0952,
"step": 700
},
{
"epoch": 0.7493403693931399,
"grad_norm": 0.3537193536758423,
"learning_rate": 3.6098634014527866e-06,
"loss": 1.0853,
"step": 710
},
{
"epoch": 0.7598944591029023,
"grad_norm": 0.3514321446418762,
"learning_rate": 3.330644691633492e-06,
"loss": 1.0786,
"step": 720
},
{
"epoch": 0.7704485488126649,
"grad_norm": 0.34657713770866394,
"learning_rate": 3.0604928061921847e-06,
"loss": 1.0609,
"step": 730
},
{
"epoch": 0.7810026385224275,
"grad_norm": 0.34931546449661255,
"learning_rate": 2.7997750099674282e-06,
"loss": 1.0845,
"step": 740
},
{
"epoch": 0.7915567282321899,
"grad_norm": 0.3565938174724579,
"learning_rate": 2.548845742385717e-06,
"loss": 1.0762,
"step": 750
},
{
"epoch": 0.8021108179419525,
"grad_norm": 0.36780357360839844,
"learning_rate": 2.3080461356097938e-06,
"loss": 1.0719,
"step": 760
},
{
"epoch": 0.8126649076517151,
"grad_norm": 0.3430708348751068,
"learning_rate": 2.077703550777882e-06,
"loss": 1.0945,
"step": 770
},
{
"epoch": 0.8232189973614775,
"grad_norm": 0.361824631690979,
"learning_rate": 1.8581311329642592e-06,
"loss": 1.0916,
"step": 780
},
{
"epoch": 0.8337730870712401,
"grad_norm": 0.3385472893714905,
"learning_rate": 1.6496273854662482e-06,
"loss": 1.084,
"step": 790
},
{
"epoch": 0.8443271767810027,
"grad_norm": 0.3720723092556,
"learning_rate": 1.452475763996326e-06,
"loss": 1.0856,
"step": 800
},
{
"epoch": 0.8443271767810027,
"eval_loss": 1.0849097967147827,
"eval_runtime": 268.3585,
"eval_samples_per_second": 49.997,
"eval_steps_per_second": 0.783,
"step": 800
},
{
"epoch": 0.8548812664907651,
"grad_norm": 0.3724263906478882,
"learning_rate": 1.2669442913310725e-06,
"loss": 1.0773,
"step": 810
},
{
"epoch": 0.8654353562005277,
"grad_norm": 0.38541847467422485,
"learning_rate": 1.0932851929407828e-06,
"loss": 1.0793,
"step": 820
},
{
"epoch": 0.8759894459102903,
"grad_norm": 0.3606375753879547,
"learning_rate": 9.31734554095165e-07,
"loss": 1.0976,
"step": 830
},
{
"epoch": 0.8865435356200527,
"grad_norm": 0.34657078981399536,
"learning_rate": 7.825119989112173e-07,
"loss": 1.0815,
"step": 840
},
{
"epoch": 0.8970976253298153,
"grad_norm": 0.34550759196281433,
"learning_rate": 6.458203917796546e-07,
"loss": 1.0883,
"step": 850
},
{
"epoch": 0.9076517150395779,
"grad_norm": 0.34100624918937683,
"learning_rate": 5.218455615757601e-07,
"loss": 1.0781,
"step": 860
},
{
"epoch": 0.9182058047493403,
"grad_norm": 0.336028516292572,
"learning_rate": 4.107560490295992e-07,
"loss": 1.0716,
"step": 870
},
{
"epoch": 0.9287598944591029,
"grad_norm": 0.35316023230552673,
"learning_rate": 3.127028775990515e-07,
"loss": 1.0755,
"step": 880
},
{
"epoch": 0.9393139841688655,
"grad_norm": 0.3301040232181549,
"learning_rate": 2.2781934815713224e-07,
"loss": 1.0718,
"step": 890
},
{
"epoch": 0.9498680738786279,
"grad_norm": 0.3545936048030853,
"learning_rate": 1.562208577727442e-07,
"loss": 1.0812,
"step": 900
},
{
"epoch": 0.9604221635883905,
"grad_norm": 0.3564644455909729,
"learning_rate": 9.800474283119143e-08,
"loss": 1.0775,
"step": 910
},
{
"epoch": 0.9709762532981531,
"grad_norm": 0.34894269704818726,
"learning_rate": 5.325014670776951e-08,
"loss": 1.0694,
"step": 920
},
{
"epoch": 0.9815303430079155,
"grad_norm": 0.3846621811389923,
"learning_rate": 2.201791217428917e-08,
"loss": 1.0691,
"step": 930
},
{
"epoch": 0.9920844327176781,
"grad_norm": 0.3404500186443329,
"learning_rate": 4.3504986848297295e-09,
"loss": 1.0701,
"step": 940
},
{
"epoch": 0.9994722955145119,
"step": 947,
"total_flos": 2.8182891025525637e+18,
"train_loss": 1.100929617000608,
"train_runtime": 11309.6924,
"train_samples_per_second": 10.721,
"train_steps_per_second": 0.084
}
],
"logging_steps": 10,
"max_steps": 947,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 200,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 2.8182891025525637e+18,
"train_batch_size": 16,
"trial_name": null,
"trial_params": null
}