Files
test08-dpo/checkpoint-100/trainer_state.json
ModelHub XC 47d8655385 初始化项目,由ModelHub XC社区提供模型
Model: wan-wan/test08-dpo
Source: Original Platform
2026-08-15 08:01:18 +08:00

185 lines
5.8 KiB
JSON

{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.6394884092725819,
"eval_steps": 500,
"global_step": 100,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.0639488409272582,
"grad_norm": 34.1801643371582,
"learning_rate": 2.8125e-07,
"logits/chosen": -3.5118160247802734,
"logits/rejected": -5.780074596405029,
"logps/chosen": -185.06735229492188,
"logps/rejected": -44.872135162353516,
"loss": 0.6948,
"rewards/accuracies": 0.3812499940395355,
"rewards/chosen": -0.00896346103399992,
"rewards/margins": -0.0022051387932151556,
"rewards/rejected": -0.006758322007954121,
"step": 10
},
{
"epoch": 0.1278976818545164,
"grad_norm": 31.33914566040039,
"learning_rate": 4.893617021276595e-07,
"logits/chosen": -3.459812641143799,
"logits/rejected": -5.795159816741943,
"logps/chosen": -184.6004180908203,
"logps/rejected": -45.62327575683594,
"loss": 0.6527,
"rewards/accuracies": 0.8374999761581421,
"rewards/chosen": 0.012581730261445045,
"rewards/margins": 0.08460129797458649,
"rewards/rejected": -0.072019562125206,
"step": 20
},
{
"epoch": 0.19184652278177458,
"grad_norm": 25.785869598388672,
"learning_rate": 4.5390070921985813e-07,
"logits/chosen": -3.524862289428711,
"logits/rejected": -5.835035800933838,
"logps/chosen": -185.87277221679688,
"logps/rejected": -48.05480194091797,
"loss": 0.5261,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.04550371319055557,
"rewards/margins": 0.37238603830337524,
"rewards/rejected": -0.32688233256340027,
"step": 30
},
{
"epoch": 0.2557953637090328,
"grad_norm": 17.68821144104004,
"learning_rate": 4.184397163120567e-07,
"logits/chosen": -3.496417999267578,
"logits/rejected": -5.88121223449707,
"logps/chosen": -182.35060119628906,
"logps/rejected": -51.58687210083008,
"loss": 0.3762,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.11964114010334015,
"rewards/margins": 0.7925335168838501,
"rewards/rejected": -0.6728923320770264,
"step": 40
},
{
"epoch": 0.31974420463629094,
"grad_norm": 13.102643966674805,
"learning_rate": 3.829787234042553e-07,
"logits/chosen": -3.518444776535034,
"logits/rejected": -5.8981804847717285,
"logps/chosen": -182.53024291992188,
"logps/rejected": -55.42652130126953,
"loss": 0.2457,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.2259349524974823,
"rewards/margins": 1.2894086837768555,
"rewards/rejected": -1.0634738206863403,
"step": 50
},
{
"epoch": 0.38369304556354916,
"grad_norm": 7.4990034103393555,
"learning_rate": 3.475177304964539e-07,
"logits/chosen": -3.5364508628845215,
"logits/rejected": -5.861163139343262,
"logps/chosen": -182.3606719970703,
"logps/rejected": -59.04890823364258,
"loss": 0.1486,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.42806726694107056,
"rewards/margins": 1.8459545373916626,
"rewards/rejected": -1.4178870916366577,
"step": 60
},
{
"epoch": 0.44764188649080733,
"grad_norm": 4.712187767028809,
"learning_rate": 3.1205673758865245e-07,
"logits/chosen": -3.4948315620422363,
"logits/rejected": -5.790167331695557,
"logps/chosen": -179.1177215576172,
"logps/rejected": -62.539405822753906,
"loss": 0.086,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.6628400683403015,
"rewards/margins": 2.428367853164673,
"rewards/rejected": -1.7655279636383057,
"step": 70
},
{
"epoch": 0.5115907274180655,
"grad_norm": 2.8228342533111572,
"learning_rate": 2.7659574468085106e-07,
"logits/chosen": -3.5341973304748535,
"logits/rejected": -5.6943488121032715,
"logps/chosen": -176.5838165283203,
"logps/rejected": -65.91018676757812,
"loss": 0.0486,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.9148324728012085,
"rewards/margins": 3.0173087120056152,
"rewards/rejected": -2.1024765968322754,
"step": 80
},
{
"epoch": 0.5755395683453237,
"grad_norm": 1.7507271766662598,
"learning_rate": 2.411347517730496e-07,
"logits/chosen": -3.482938289642334,
"logits/rejected": -5.569075584411621,
"logps/chosen": -171.7285919189453,
"logps/rejected": -69.48970031738281,
"loss": 0.0275,
"rewards/accuracies": 1.0,
"rewards/chosen": 1.1483333110809326,
"rewards/margins": 3.605067014694214,
"rewards/rejected": -2.456733465194702,
"step": 90
},
{
"epoch": 0.6394884092725819,
"grad_norm": 1.236215353012085,
"learning_rate": 2.0567375886524822e-07,
"logits/chosen": -3.5123608112335205,
"logits/rejected": -5.456024646759033,
"logps/chosen": -171.9407958984375,
"logps/rejected": -73.64480590820312,
"loss": 0.0153,
"rewards/accuracies": 1.0,
"rewards/chosen": 1.32476007938385,
"rewards/margins": 4.2044148445129395,
"rewards/rejected": -2.8796544075012207,
"step": 100
}
],
"logging_steps": 10,
"max_steps": 157,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 100,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 0.0,
"train_batch_size": 2,
"trial_name": null,
"trial_params": null
}