Files
Qwen2.5-0.5B-Instruct-Gensy…/trainer_state.json
ModelHub XC 1f8215d277 初始化项目,由ModelHub XC社区提供模型
Model: w34423g2/Qwen2.5-0.5B-Instruct-Gensyn-Swarm-colorful_ferocious_bear
Source: Original Platform
2026-08-30 22:34:05 +08:00

234 lines
8.3 KiB
JSON

{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 5.0,
"eval_steps": 500,
"global_step": 20,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"completion_length": 229.40625,
"epoch": 0.5714285714285714,
"grad_norm": 8.94824504852295,
"kl": 0.0,
"learning_rate": 5e-07,
"loss": -0.0,
"reward": 3.6037507504224777,
"reward_std": 0.3731326290871948,
"rewards/concensus_correctness_reward_func": 0.676999993622303,
"rewards/consensus_reward_func": 0.875,
"rewards/cumulative_reward_2": 0.0,
"rewards/final_correctness_reward_func": 0.0625,
"rewards/question_recreation_reward_func": 0.7892507291398942,
"rewards/soft_format_reward_func": 0.0,
"rewards/strict_format_reward_func": 0.234375,
"rewards/xmlcount_reward_func": 0.9656250048428774,
"step": 2
},
{
"completion_length": 125.875,
"epoch": 1.0,
"grad_norm": 14.84840202331543,
"kl": 0.46425252586292726,
"learning_rate": 4.864543104251586e-07,
"loss": 0.0003,
"reward": 6.8231503168741865,
"reward_std": 0.10737764012689392,
"rewards/concensus_correctness_reward_func": 2.1921666661898294,
"rewards/consensus_reward_func": 1.6666666666666667,
"rewards/cumulative_reward_2": 0.0,
"rewards/final_correctness_reward_func": 0.3333333333333333,
"rewards/question_recreation_reward_func": 0.9018170038859049,
"rewards/soft_format_reward_func": 0.0,
"rewards/strict_format_reward_func": 0.4791666666666667,
"rewards/xmlcount_reward_func": 1.25,
"step": 4
},
{
"completion_length": 132.59375,
"epoch": 1.5714285714285714,
"grad_norm": 254.22254943847656,
"kl": 11.826677680423018,
"learning_rate": 4.472851273490984e-07,
"loss": 0.0118,
"reward": 6.039749294519424,
"reward_std": 0.6479331548325717,
"rewards/concensus_correctness_reward_func": 1.6617499887943268,
"rewards/consensus_reward_func": 1.5,
"rewards/cumulative_reward_2": 0.0,
"rewards/final_correctness_reward_func": 0.25,
"rewards/question_recreation_reward_func": 0.9921555258333683,
"rewards/soft_format_reward_func": 0.0,
"rewards/strict_format_reward_func": 0.40625,
"rewards/xmlcount_reward_func": 1.2295937538146973,
"step": 6
},
{
"completion_length": 171.375,
"epoch": 2.0,
"grad_norm": 19.998477935791016,
"kl": 340.6913535793622,
"learning_rate": 3.867370395306068e-07,
"loss": 0.2555,
"reward": 5.803202708562215,
"reward_std": 0.16267990817626318,
"rewards/concensus_correctness_reward_func": 1.4191666543483734,
"rewards/consensus_reward_func": 1.8333333333333333,
"rewards/cumulative_reward_2": 0.0,
"rewards/final_correctness_reward_func": 0.08333333333333333,
"rewards/question_recreation_reward_func": 0.9248277222116789,
"rewards/soft_format_reward_func": 0.0,
"rewards/strict_format_reward_func": 0.3541666666666667,
"rewards/xmlcount_reward_func": 1.1883750061194103,
"step": 8
},
{
"completion_length": 146.1875,
"epoch": 2.571428571428571,
"grad_norm": 513047.0,
"kl": 35970.45797069557,
"learning_rate": 3.1137137178519977e-07,
"loss": 35.9705,
"reward": 5.927468925714493,
"reward_std": 0.30307131272275,
"rewards/concensus_correctness_reward_func": 1.6851249858736992,
"rewards/consensus_reward_func": 1.5625,
"rewards/cumulative_reward_2": 0.0,
"rewards/final_correctness_reward_func": 0.125,
"rewards/question_recreation_reward_func": 0.9142189472913742,
"rewards/soft_format_reward_func": 0.0,
"rewards/strict_format_reward_func": 0.40625,
"rewards/xmlcount_reward_func": 1.234375,
"step": 10
},
{
"completion_length": 128.20833333333334,
"epoch": 3.0,
"grad_norm": 116.38948822021484,
"kl": 18.222534152989585,
"learning_rate": 2.2935516363191693e-07,
"loss": 0.0137,
"reward": 6.312762300173442,
"reward_std": 0.2930445207554537,
"rewards/concensus_correctness_reward_func": 1.7012499918540318,
"rewards/consensus_reward_func": 1.75,
"rewards/cumulative_reward_2": 0.0,
"rewards/final_correctness_reward_func": 0.16666666666666666,
"rewards/question_recreation_reward_func": 0.9923039476076762,
"rewards/soft_format_reward_func": 0.0,
"rewards/strict_format_reward_func": 0.4583333333333333,
"rewards/xmlcount_reward_func": 1.2442083358764648,
"step": 12
},
{
"completion_length": 153.875,
"epoch": 3.571428571428571,
"grad_norm": 487.3103332519531,
"kl": 15.634163164300844,
"learning_rate": 1.4957614383675767e-07,
"loss": 0.0156,
"reward": 6.4225940108299255,
"reward_std": 0.4366847704950487,
"rewards/concensus_correctness_reward_func": 1.8357499986886978,
"rewards/consensus_reward_func": 1.75,
"rewards/cumulative_reward_2": 0.0,
"rewards/final_correctness_reward_func": 0.3125,
"rewards/question_recreation_reward_func": 0.9323440082371235,
"rewards/soft_format_reward_func": 0.0,
"rewards/strict_format_reward_func": 0.40625,
"rewards/xmlcount_reward_func": 1.185750000178814,
"step": 14
},
{
"completion_length": 143.75,
"epoch": 4.0,
"grad_norm": 32.51670455932617,
"kl": 24.17860255079965,
"learning_rate": 8.067960709356478e-08,
"loss": 0.0181,
"reward": 5.551972270011902,
"reward_std": 0.7521393178030849,
"rewards/concensus_correctness_reward_func": 1.5078333169221878,
"rewards/consensus_reward_func": 1.5,
"rewards/cumulative_reward_2": 0.0,
"rewards/final_correctness_reward_func": 0.0,
"rewards/question_recreation_reward_func": 0.9879722644885381,
"rewards/soft_format_reward_func": 0.0,
"rewards/strict_format_reward_func": 0.3541666666666667,
"rewards/xmlcount_reward_func": 1.2020000020662944,
"step": 16
},
{
"completion_length": 144.78125,
"epoch": 4.571428571428571,
"grad_norm": 15.651232719421387,
"kl": 1.0096438335021958,
"learning_rate": 3.013156219837776e-08,
"loss": 0.001,
"reward": 6.347037583589554,
"reward_std": 0.3279493277950678,
"rewards/concensus_correctness_reward_func": 1.7443749941885471,
"rewards/consensus_reward_func": 1.8125,
"rewards/cumulative_reward_2": 0.0,
"rewards/final_correctness_reward_func": 0.125,
"rewards/question_recreation_reward_func": 0.9502876587212086,
"rewards/soft_format_reward_func": 0.0,
"rewards/strict_format_reward_func": 0.46875,
"rewards/xmlcount_reward_func": 1.2461249977350235,
"step": 18
},
{
"completion_length": 147.58333333333334,
"epoch": 5.0,
"grad_norm": 14.92544937133789,
"kl": 23.108698587554198,
"learning_rate": 3.4096741493194193e-09,
"loss": 0.0173,
"reward": 5.848908384641011,
"reward_std": 0.16538670177881917,
"rewards/concensus_correctness_reward_func": 1.6329999913771946,
"rewards/consensus_reward_func": 1.3333333333333333,
"rewards/cumulative_reward_2": 0.0,
"rewards/final_correctness_reward_func": 0.25,
"rewards/question_recreation_reward_func": 0.9971583286921183,
"rewards/soft_format_reward_func": 0.0,
"rewards/strict_format_reward_func": 0.3958333333333333,
"rewards/xmlcount_reward_func": 1.2395833333333333,
"step": 20
},
{
"epoch": 5.0,
"step": 20,
"total_flos": 0.0,
"train_loss": 3.6303929208574117,
"train_runtime": 122.946,
"train_samples_per_second": 2.603,
"train_steps_per_second": 0.163
}
],
"logging_steps": 2,
"max_steps": 20,
"num_input_tokens_seen": 0,
"num_train_epochs": 7,
"save_steps": 25,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 0.0,
"train_batch_size": 2,
"trial_name": null,
"trial_params": null
}