Files
pythia410m-dpo-beta0.5/checkpoint-63/trainer_state.json
ModelHub XC 65b039506a 初始化项目,由ModelHub XC社区提供模型
Model: MusaKlair/pythia410m-dpo-beta0.5
Source: Original Platform
2026-07-18 06:13:11 +08:00

289 lines
9.6 KiB
JSON

{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 1.0,
"eval_steps": 50,
"global_step": 63,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"entropy": 2.555550271272659,
"epoch": 0.08,
"grad_norm": 175.83624267578125,
"learning_rate": 2.8571428571428573e-06,
"logits/chosen": 0.41239441768472307,
"logits/rejected": 0.4313717963372231,
"logps/chosen": -157.81461162567138,
"logps/rejected": -150.4321650505066,
"loss": 0.6844395637512207,
"mean_token_accuracy": 0.45540447160601616,
"num_tokens": 63280.0,
"rewards/accuracies": 0.55,
"rewards/chosen": 0.09316946864128113,
"rewards/margins": 0.030635011196136475,
"rewards/rejected": 0.06253445744514466,
"step": 5
},
{
"entropy": 2.584770825505257,
"epoch": 0.16,
"grad_norm": 275.8374938964844,
"learning_rate": 4.984280524733107e-06,
"logits/chosen": 0.23018057449154425,
"logits/rejected": 0.4137123508420314,
"logps/chosen": -160.37082138061524,
"logps/rejected": -154.9328401565552,
"loss": 0.848213005065918,
"mean_token_accuracy": 0.4679958797991276,
"num_tokens": 128751.0,
"rewards/accuracies": 0.4625,
"rewards/chosen": 0.06873167753219604,
"rewards/margins": -0.08100449442863464,
"rewards/rejected": 0.1497361719608307,
"step": 10
},
{
"entropy": 2.485997956991196,
"epoch": 0.24,
"grad_norm": 273.0233154296875,
"learning_rate": 4.809698831278217e-06,
"logits/chosen": 0.1816923364201413,
"logits/rejected": 0.23945612540369207,
"logps/chosen": -151.38499155044556,
"logps/rejected": -163.4970989227295,
"loss": 0.8470439910888672,
"mean_token_accuracy": 0.4733552895486355,
"num_tokens": 194142.0,
"rewards/accuracies": 0.45,
"rewards/chosen": -0.32968448400497435,
"rewards/margins": 0.06030769646167755,
"rewards/rejected": -0.3899921804666519,
"step": 15
},
{
"entropy": 2.5318914532661436,
"epoch": 0.32,
"grad_norm": 234.37681579589844,
"learning_rate": 4.454578706170075e-06,
"logits/chosen": 0.07677000825058375,
"logits/rejected": 0.18887137972641857,
"logps/chosen": -135.0070219039917,
"logps/rejected": -135.28493957519532,
"loss": 0.9311827659606934,
"mean_token_accuracy": 0.4595716767013073,
"num_tokens": 254871.0,
"rewards/accuracies": 0.5375,
"rewards/chosen": -0.7181475728750228,
"rewards/margins": 0.2766463726758957,
"rewards/rejected": -0.9947939455509186,
"step": 20
},
{
"entropy": 2.462447080016136,
"epoch": 0.4,
"grad_norm": 250.9570770263672,
"learning_rate": 3.946678240449515e-06,
"logits/chosen": 0.20993061968672994,
"logits/rejected": 0.20386893310256043,
"logps/chosen": -145.39961681365966,
"logps/rejected": -137.4315857887268,
"loss": 0.9580174446105957,
"mean_token_accuracy": 0.45824490338563917,
"num_tokens": 317752.0,
"rewards/accuracies": 0.58125,
"rewards/chosen": -0.7164888560771943,
"rewards/margins": 0.16717674732208251,
"rewards/rejected": -0.8836656033992767,
"step": 25
},
{
"entropy": 2.4387545943260194,
"epoch": 0.48,
"grad_norm": 316.4103088378906,
"learning_rate": 3.3256976548879183e-06,
"logits/chosen": 0.21743581064338796,
"logits/rejected": 0.2765391890690152,
"logps/chosen": -148.74287595748902,
"logps/rejected": -147.26203107833862,
"loss": 0.9910862922668457,
"mean_token_accuracy": 0.4532994642853737,
"num_tokens": 387452.0,
"rewards/accuracies": 0.5125,
"rewards/chosen": -0.2023364007472992,
"rewards/margins": 0.1426894724369049,
"rewards/rejected": -0.3450258731842041,
"step": 30
},
{
"entropy": 2.469076004624367,
"epoch": 0.56,
"grad_norm": 256.6429748535156,
"learning_rate": 2.6401761180929798e-06,
"logits/chosen": 0.18299585651420763,
"logits/rejected": 0.250682400907656,
"logps/chosen": -178.9021216392517,
"logps/rejected": -171.8313166618347,
"loss": 0.8882085800170898,
"mean_token_accuracy": 0.47426797077059746,
"num_tokens": 454873.0,
"rewards/accuracies": 0.53125,
"rewards/chosen": 0.1502027690410614,
"rewards/margins": 0.38659809827804564,
"rewards/rejected": -0.23639532923698425,
"step": 35
},
{
"entropy": 2.4749947816133497,
"epoch": 0.64,
"grad_norm": 248.1305694580078,
"learning_rate": 1.9436976651092143e-06,
"logits/chosen": 0.27816104129128527,
"logits/rejected": 0.37676442462284854,
"logps/chosen": -157.81686353683472,
"logps/rejected": -158.98215370178224,
"loss": 1.0146113395690919,
"mean_token_accuracy": 0.465312571823597,
"num_tokens": 518527.0,
"rewards/accuracies": 0.55625,
"rewards/chosen": 0.05624905824661255,
"rewards/margins": 0.09228863418102265,
"rewards/rejected": -0.036039575934410095,
"step": 40
},
{
"entropy": 2.409931382536888,
"epoch": 0.72,
"grad_norm": 219.939697265625,
"learning_rate": 1.2907027822369006e-06,
"logits/chosen": 0.2784307162908892,
"logits/rejected": 0.3215469827251049,
"logps/chosen": -153.8018159866333,
"logps/rejected": -159.60495262145997,
"loss": 0.921458625793457,
"mean_token_accuracy": 0.4758016161620617,
"num_tokens": 586496.0,
"rewards/accuracies": 0.525,
"rewards/chosen": 0.1898827075958252,
"rewards/margins": 0.46674283146858214,
"rewards/rejected": -0.27686012387275694,
"step": 45
},
{
"entropy": 2.4379068195819853,
"epoch": 0.8,
"grad_norm": 235.46241760253906,
"learning_rate": 7.322330470336314e-07,
"logits/chosen": 0.28584471002719647,
"logits/rejected": 0.3651064125555795,
"logps/chosen": -163.8307611465454,
"logps/rejected": -163.46687126159668,
"loss": 0.979340648651123,
"mean_token_accuracy": 0.4653128065168858,
"num_tokens": 659345.0,
"rewards/accuracies": 0.5,
"rewards/chosen": 0.16986804008483886,
"rewards/margins": 0.1913771450519562,
"rewards/rejected": -0.02150910496711731,
"step": 50
},
{
"epoch": 0.8,
"eval_entropy": 2.5069966416358946,
"eval_logits/chosen": 0.29315065189355716,
"eval_logits/rejected": 0.348470281243937,
"eval_logps/chosen": -161.13176106262208,
"eval_logps/rejected": -153.30834275054931,
"eval_loss": 0.9624814391136169,
"eval_mean_token_accuracy": 0.4618878421783447,
"eval_num_tokens": 659345.0,
"eval_rewards/accuracies": 0.531,
"eval_rewards/chosen": 0.1580237216949463,
"eval_rewards/margins": 0.2344533715248108,
"eval_rewards/rejected": -0.0764296498298645,
"eval_runtime": 203.9137,
"eval_samples_per_second": 4.904,
"eval_steps_per_second": 1.226,
"step": 50
},
{
"entropy": 2.47237910926342,
"epoch": 0.88,
"grad_norm": 254.37533569335938,
"learning_rate": 3.119414452281158e-07,
"logits/chosen": 0.31621869752899623,
"logits/rejected": 0.438719071421892,
"logps/chosen": -148.24002447128296,
"logps/rejected": -142.998854637146,
"loss": 0.9957857131958008,
"mean_token_accuracy": 0.47029968202114103,
"num_tokens": 731475.0,
"rewards/accuracies": 0.59375,
"rewards/chosen": 0.2521739423274994,
"rewards/margins": 0.1846893012523651,
"rewards/rejected": 0.06748464107513427,
"step": 55
},
{
"entropy": 2.4306333363056183,
"epoch": 0.96,
"grad_norm": 226.28863525390625,
"learning_rate": 6.268021954544095e-08,
"logits/chosen": 0.27655188516120244,
"logits/rejected": 0.40121284602477314,
"logps/chosen": -156.78616828918456,
"logps/rejected": -163.7671283721924,
"loss": 0.8905390739440918,
"mean_token_accuracy": 0.4723482772707939,
"num_tokens": 797757.0,
"rewards/accuracies": 0.5125,
"rewards/chosen": 0.2607013940811157,
"rewards/margins": 0.30302430391311647,
"rewards/rejected": -0.04232290983200073,
"step": 60
},
{
"epoch": 1.0,
"eval_entropy": 2.5108700938224793,
"eval_logits/chosen": 0.2960853689074952,
"eval_logits/rejected": 0.35102944673757674,
"eval_logps/chosen": -161.2097156829834,
"eval_logps/rejected": -153.38722127532958,
"eval_loss": 0.9581051468849182,
"eval_mean_token_accuracy": 0.4621651805639267,
"eval_num_tokens": 829784.0,
"eval_rewards/accuracies": 0.532,
"eval_rewards/chosen": 0.11904637241363525,
"eval_rewards/margins": 0.23491560649871826,
"eval_rewards/rejected": -0.11586923408508301,
"eval_runtime": 204.736,
"eval_samples_per_second": 4.884,
"eval_steps_per_second": 1.221,
"step": 63
}
],
"logging_steps": 5,
"max_steps": 63,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 100,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 3267470732328960.0,
"train_batch_size": 4,
"trial_name": null,
"trial_params": null
}