Files
qwen3-8b-simpo-avg-b2p5-g1p…/trainer_state.json
ModelHub XC 3485029f85 初始化项目,由ModelHub XC社区提供模型
Model: promotion/qwen3-8b-simpo-avg-b2p5-g1p0-s42
Source: Original Platform
2026-07-26 06:58:11 +08:00

479 lines
15 KiB
JSON

{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 1.0,
"eval_steps": 500,
"global_step": 292,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.03432003432003432,
"grad_norm": 10.203938715992143,
"learning_rate": 1.5e-07,
"logits/chosen": -1.8046875,
"logits/rejected": -1.734375,
"logps/chosen": -0.28125,
"logps/rejected": -0.283203125,
"loss": 1.3126378059387207,
"rewards/accuracies": 0.84375,
"rewards/chosen": 2.9130210876464844,
"rewards/margins": 0.8968315124511719,
"rewards/rejected": 2.0161895751953125,
"step": 10
},
{
"epoch": 0.06864006864006864,
"grad_norm": 34.812950350142344,
"learning_rate": 3.166666666666666e-07,
"logits/chosen": -1.734375,
"logits/rejected": -1.71875,
"logps/chosen": -0.28515625,
"logps/rejected": -0.296875,
"loss": 1.2969410419464111,
"rewards/accuracies": 0.887499988079071,
"rewards/chosen": 3.2256202697753906,
"rewards/margins": 1.8563461303710938,
"rewards/rejected": 1.3692741394042969,
"step": 20
},
{
"epoch": 0.10296010296010295,
"grad_norm": 18.043733604549054,
"learning_rate": 4.833333333333333e-07,
"logits/chosen": -1.8828125,
"logits/rejected": -1.828125,
"logps/chosen": -0.2578125,
"logps/rejected": -0.27734375,
"loss": 1.2808767557144165,
"rewards/accuracies": 0.8500000238418579,
"rewards/chosen": 2.254518508911133,
"rewards/margins": 0.9522342681884766,
"rewards/rejected": 1.3022842407226562,
"step": 30
},
{
"epoch": 0.13728013728013727,
"grad_norm": 14.522579405037842,
"learning_rate": 4.985456442051682e-07,
"logits/chosen": -1.7421875,
"logits/rejected": -1.7578125,
"logps/chosen": -0.28515625,
"logps/rejected": -0.30078125,
"loss": 1.2971984148025513,
"rewards/accuracies": 0.8687499761581421,
"rewards/chosen": 2.7966461181640625,
"rewards/margins": 0.865142822265625,
"rewards/rejected": 1.9315032958984375,
"step": 40
},
{
"epoch": 0.1716001716001716,
"grad_norm": 9.44153398614957,
"learning_rate": 4.935399618791793e-07,
"logits/chosen": -1.6953125,
"logits/rejected": -1.671875,
"logps/chosen": -0.29296875,
"logps/rejected": -0.314453125,
"loss": 1.2938823699951172,
"rewards/accuracies": 0.84375,
"rewards/chosen": 3.333526611328125,
"rewards/margins": 1.3265352249145508,
"rewards/rejected": 2.006991386413574,
"step": 50
},
{
"epoch": 0.2059202059202059,
"grad_norm": 7.8411658071056864,
"learning_rate": 4.850368660819092e-07,
"logits/chosen": -1.8515625,
"logits/rejected": -1.8046875,
"logps/chosen": -0.291015625,
"logps/rejected": -0.310546875,
"loss": 1.2829803228378296,
"rewards/accuracies": 0.84375,
"rewards/chosen": 1.5130538940429688,
"rewards/margins": 0.6417007446289062,
"rewards/rejected": 0.8713531494140625,
"step": 60
},
{
"epoch": 0.24024024024024024,
"grad_norm": 28.26163110598253,
"learning_rate": 4.731584675403184e-07,
"logits/chosen": -1.65625,
"logits/rejected": -1.640625,
"logps/chosen": -0.30859375,
"logps/rejected": -0.30078125,
"loss": 1.3537184000015259,
"rewards/accuracies": 0.875,
"rewards/chosen": 3.1701087951660156,
"rewards/margins": 1.6411056518554688,
"rewards/rejected": 1.5290031433105469,
"step": 70
},
{
"epoch": 0.27456027456027454,
"grad_norm": 8.444828433926622,
"learning_rate": 4.5807534881817183e-07,
"logits/chosen": -1.7890625,
"logits/rejected": -1.7109375,
"logps/chosen": -0.294921875,
"logps/rejected": -0.3125,
"loss": 1.3036760091781616,
"rewards/accuracies": 0.8812500238418579,
"rewards/chosen": 2.192584991455078,
"rewards/margins": 0.8953938484191895,
"rewards/rejected": 1.2971911430358887,
"step": 80
},
{
"epoch": 0.3088803088803089,
"grad_norm": 20.244100591742612,
"learning_rate": 4.400041146246136e-07,
"logits/chosen": -1.7578125,
"logits/rejected": -1.6875,
"logps/chosen": -0.3125,
"logps/rejected": -0.3203125,
"loss": 1.3008702993392944,
"rewards/accuracies": 0.856249988079071,
"rewards/chosen": 3.269622802734375,
"rewards/margins": 1.627532958984375,
"rewards/rejected": 1.64208984375,
"step": 90
},
{
"epoch": 0.3432003432003432,
"grad_norm": 7.960625256781812,
"learning_rate": 4.1920428121079e-07,
"logits/chosen": -1.71875,
"logits/rejected": -1.6796875,
"logps/chosen": -0.283203125,
"logps/rejected": -0.330078125,
"loss": 1.2717617750167847,
"rewards/accuracies": 0.8687499761581421,
"rewards/chosen": 2.0637588500976562,
"rewards/margins": 1.0487861633300781,
"rewards/rejected": 1.0149726867675781,
"step": 100
},
{
"epoch": 0.37752037752037754,
"grad_norm": 36.274471498701175,
"learning_rate": 3.959745495250818e-07,
"logits/chosen": -1.9921875,
"logits/rejected": -1.9140625,
"logps/chosen": -0.275390625,
"logps/rejected": -0.306640625,
"loss": 1.2781312465667725,
"rewards/accuracies": 0.8812500238418579,
"rewards/chosen": 2.068091630935669,
"rewards/margins": 1.2525169849395752,
"rewards/rejected": 0.8155746459960938,
"step": 110
},
{
"epoch": 0.4118404118404118,
"grad_norm": 32.62769321502908,
"learning_rate": 3.7064851564718353e-07,
"logits/chosen": -1.8203125,
"logits/rejected": -1.7109375,
"logps/chosen": -0.287109375,
"logps/rejected": -0.353515625,
"loss": 1.2694454193115234,
"rewards/accuracies": 0.875,
"rewards/chosen": 3.714447021484375,
"rewards/margins": 2.37420654296875,
"rewards/rejected": 1.340240478515625,
"step": 120
},
{
"epoch": 0.44616044616044614,
"grad_norm": 8.666298132652223,
"learning_rate": 3.4358988010236103e-07,
"logits/chosen": -1.765625,
"logits/rejected": -1.765625,
"logps/chosen": -0.322265625,
"logps/rejected": -0.3046875,
"loss": 1.377197504043579,
"rewards/accuracies": 0.8812500238418579,
"rewards/chosen": 2.362274169921875,
"rewards/margins": 1.509368896484375,
"rewards/rejected": 0.8529052734375,
"step": 130
},
{
"epoch": 0.4804804804804805,
"grad_norm": 17.229310324932,
"learning_rate": 3.1518722485366754e-07,
"logits/chosen": -1.90625,
"logits/rejected": -1.875,
"logps/chosen": -0.294921875,
"logps/rejected": -0.3203125,
"loss": 1.3077561855316162,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": 2.7135581970214844,
"rewards/margins": 1.8327293395996094,
"rewards/rejected": 0.880828857421875,
"step": 140
},
{
"epoch": 0.5148005148005148,
"grad_norm": 8.648271514841943,
"learning_rate": 2.8584843297836277e-07,
"logits/chosen": -1.8203125,
"logits/rejected": -1.8046875,
"logps/chosen": -0.28125,
"logps/rejected": -0.33984375,
"loss": 1.2540769577026367,
"rewards/accuracies": 0.8687499761581421,
"rewards/chosen": 2.5254592895507812,
"rewards/margins": 1.1835556030273438,
"rewards/rejected": 1.3419036865234375,
"step": 150
},
{
"epoch": 0.5491205491205491,
"grad_norm": 49.83862434409446,
"learning_rate": 2.5599483116609544e-07,
"logits/chosen": -1.7734375,
"logits/rejected": -1.6953125,
"logps/chosen": -0.298828125,
"logps/rejected": -0.33203125,
"loss": 1.273056983947754,
"rewards/accuracies": 0.831250011920929,
"rewards/chosen": 2.8408203125,
"rewards/margins": 1.439300537109375,
"rewards/rejected": 1.401519775390625,
"step": 160
},
{
"epoch": 0.5834405834405835,
"grad_norm": 25.723956384719525,
"learning_rate": 2.2605513915689874e-07,
"logits/chosen": -1.796875,
"logits/rejected": -1.7578125,
"logps/chosen": -0.28515625,
"logps/rejected": -0.44140625,
"loss": 1.2432403564453125,
"rewards/accuracies": 0.893750011920929,
"rewards/chosen": 2.3864269256591797,
"rewards/margins": 1.9962539672851562,
"rewards/rejected": 0.39017295837402344,
"step": 170
},
{
"epoch": 0.6177606177606177,
"grad_norm": 73.0500683832465,
"learning_rate": 1.9645931300952795e-07,
"logits/chosen": -1.9296875,
"logits/rejected": -1.8828125,
"logps/chosen": -0.30078125,
"logps/rejected": -0.373046875,
"loss": 1.3145594596862793,
"rewards/accuracies": 0.887499988079071,
"rewards/chosen": 2.933912515640259,
"rewards/margins": 1.966554880142212,
"rewards/rejected": 0.9673576354980469,
"step": 180
},
{
"epoch": 0.6520806520806521,
"grad_norm": 10.570188964120872,
"learning_rate": 1.6763237061535008e-07,
"logits/chosen": -1.8125,
"logits/rejected": -1.78125,
"logps/chosen": -0.279296875,
"logps/rejected": -0.33984375,
"loss": 1.2554752826690674,
"rewards/accuracies": 0.875,
"rewards/chosen": 2.1903152465820312,
"rewards/margins": 1.0904598236083984,
"rewards/rejected": 1.0998554229736328,
"step": 190
},
{
"epoch": 0.6864006864006864,
"grad_norm": 8.018004144482099,
"learning_rate": 1.3998828812795932e-07,
"logits/chosen": -1.7734375,
"logits/rejected": -1.6953125,
"logps/chosen": -0.3046875,
"logps/rejected": -0.349609375,
"loss": 1.2610969543457031,
"rewards/accuracies": 0.862500011920929,
"rewards/chosen": 2.4741287231445312,
"rewards/margins": 1.5025177001953125,
"rewards/rejected": 0.9716110229492188,
"step": 200
},
{
"epoch": 0.7207207207207207,
"grad_norm": 13.917673494093787,
"learning_rate": 1.1392405496029076e-07,
"logits/chosen": -1.859375,
"logits/rejected": -1.828125,
"logps/chosen": -0.291015625,
"logps/rejected": -0.37890625,
"loss": 1.2743440866470337,
"rewards/accuracies": 0.875,
"rewards/chosen": 2.3770370483398438,
"rewards/margins": 1.9193801879882812,
"rewards/rejected": 0.4576568603515625,
"step": 210
},
{
"epoch": 0.7550407550407551,
"grad_norm": 7.293229087932327,
"learning_rate": 8.981397272385738e-08,
"logits/chosen": -1.90625,
"logits/rejected": -1.8203125,
"logps/chosen": -0.296875,
"logps/rejected": -0.359375,
"loss": 1.2591865062713623,
"rewards/accuracies": 0.8999999761581421,
"rewards/chosen": 1.8160285949707031,
"rewards/margins": 1.0967063903808594,
"rewards/rejected": 0.7193222045898438,
"step": 220
},
{
"epoch": 0.7893607893607893,
"grad_norm": 14.94242869882904,
"learning_rate": 6.800427998154968e-08,
"logits/chosen": -1.9609375,
"logits/rejected": -1.875,
"logps/chosen": -0.302734375,
"logps/rejected": -0.439453125,
"loss": 1.2168002128601074,
"rewards/accuracies": 0.862500011920929,
"rewards/chosen": 3.1121368408203125,
"rewards/margins": 1.8566741943359375,
"rewards/rejected": 1.255462646484375,
"step": 230
},
{
"epoch": 0.8236808236808236,
"grad_norm": 6.26084322691984,
"learning_rate": 4.8808180006509356e-08,
"logits/chosen": -1.8671875,
"logits/rejected": -1.78125,
"logps/chosen": -0.2890625,
"logps/rejected": -0.375,
"loss": 1.2628111839294434,
"rewards/accuracies": 0.8687499761581421,
"rewards/chosen": 2.628856658935547,
"rewards/margins": 1.8339424133300781,
"rewards/rejected": 0.7949142456054688,
"step": 240
},
{
"epoch": 0.858000858000858,
"grad_norm": 7.036498888058669,
"learning_rate": 3.250134295213053e-08,
"logits/chosen": -1.8515625,
"logits/rejected": -1.78125,
"logps/chosen": -0.306640625,
"logps/rejected": -0.328125,
"loss": 1.3013354539871216,
"rewards/accuracies": 0.8374999761581421,
"rewards/chosen": 2.027191162109375,
"rewards/margins": 1.3493232727050781,
"rewards/rejected": 0.6778678894042969,
"step": 250
},
{
"epoch": 0.8923208923208923,
"grad_norm": 26.20577632403144,
"learning_rate": 1.9317947025340232e-08,
"logits/chosen": -1.8125,
"logits/rejected": -1.734375,
"logps/chosen": -0.30859375,
"logps/rejected": -0.390625,
"loss": 1.249146819114685,
"rewards/accuracies": 0.887499988079071,
"rewards/chosen": 3.2939453125,
"rewards/margins": 2.5830841064453125,
"rewards/rejected": 0.7108612060546875,
"step": 260
},
{
"epoch": 0.9266409266409267,
"grad_norm": 9.303768228574064,
"learning_rate": 9.447315514833353e-09,
"logits/chosen": -1.8359375,
"logits/rejected": -1.734375,
"logps/chosen": -0.28515625,
"logps/rejected": -0.31640625,
"loss": 1.2721102237701416,
"rewards/accuracies": 0.9125000238418579,
"rewards/chosen": 2.105621337890625,
"rewards/margins": 1.446533203125,
"rewards/rejected": 0.659088134765625,
"step": 270
},
{
"epoch": 0.960960960960961,
"grad_norm": 6.727511885545749,
"learning_rate": 3.0311979690147426e-09,
"logits/chosen": -1.78125,
"logits/rejected": -1.6640625,
"logps/chosen": -0.291015625,
"logps/rejected": -0.33203125,
"loss": 1.2691892385482788,
"rewards/accuracies": 0.90625,
"rewards/chosen": 2.3777236938476562,
"rewards/margins": 1.4847488403320312,
"rewards/rejected": 0.892974853515625,
"step": 280
},
{
"epoch": 0.9952809952809952,
"grad_norm": 6.168691664518052,
"learning_rate": 1.6173456793908135e-10,
"logits/chosen": -1.9140625,
"logits/rejected": -1.8828125,
"logps/chosen": -0.287109375,
"logps/rejected": -0.302734375,
"loss": 1.300573706626892,
"rewards/accuracies": 0.925000011920929,
"rewards/chosen": 2.7515792846679688,
"rewards/margins": 1.7214431762695312,
"rewards/rejected": 1.0301361083984375,
"step": 290
},
{
"epoch": 1.0,
"step": 292,
"total_flos": 0.0,
"train_loss": 1.2802449281085027,
"train_runtime": 10579.5096,
"train_samples_per_second": 1.762,
"train_steps_per_second": 0.028
}
],
"logging_steps": 10,
"max_steps": 292,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 1000,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 0.0,
"train_batch_size": 2,
"trial_name": null,
"trial_params": null
}