Files
Qwen2.5-0.5B-Instruct-Gensy…/trainer_state.json
ModelHub XC f7a1b54444 初始化项目,由ModelHub XC社区提供模型
Model: yangchunhua556/Qwen2.5-0.5B-Instruct-Gensyn-Swarm-deft_prehistoric_starfish
Source: Original Platform
2026-08-29 10:00:19 +08:00

234 lines
8.1 KiB
JSON

{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 1.4324324324324325,
"eval_steps": 500,
"global_step": 20,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"completion_length": 8.3125,
"epoch": 0.14414414414414414,
"grad_norm": 19.17816162109375,
"kl": 0.0,
"learning_rate": 5e-07,
"loss": 0.0,
"reward": 1.581678017450031,
"reward_std": 0.09327375888824463,
"rewards/concensus_correctness_reward_func": 0.24056249886052683,
"rewards/consensus_reward_func": 1.3125,
"rewards/cumulative_reward_2": 0.0,
"rewards/final_correctness_reward_func": 0.0,
"rewards/question_recreation_reward_func": 0.02861549676163122,
"rewards/soft_format_reward_func": 0.0,
"rewards/strict_format_reward_func": 0.0,
"rewards/xmlcount_reward_func": 0.0,
"step": 2
},
{
"completion_length": 3.59375,
"epoch": 0.2882882882882883,
"grad_norm": 54.003597259521484,
"kl": 0.0057574408129767995,
"learning_rate": 4.864543104251586e-07,
"loss": 0.0,
"reward": 1.8427463320549577,
"reward_std": 0.08771874010562897,
"rewards/concensus_correctness_reward_func": 0.4990000035613775,
"rewards/consensus_reward_func": 1.3125,
"rewards/cumulative_reward_2": 0.0,
"rewards/final_correctness_reward_func": 0.0,
"rewards/question_recreation_reward_func": 0.031246319558704272,
"rewards/soft_format_reward_func": 0.0,
"rewards/strict_format_reward_func": 0.0,
"rewards/xmlcount_reward_func": 0.0,
"step": 4
},
{
"completion_length": 7.8125,
"epoch": 0.43243243243243246,
"grad_norm": 0.00025395405828021467,
"kl": 0.001715799282113295,
"learning_rate": 4.472851273490984e-07,
"loss": 0.0,
"reward": 2.195782383554615,
"reward_std": 0.0,
"rewards/concensus_correctness_reward_func": 0.41325001046061516,
"rewards/consensus_reward_func": 1.75,
"rewards/cumulative_reward_2": 0.0,
"rewards/final_correctness_reward_func": 0.0,
"rewards/question_recreation_reward_func": 0.03253235557349399,
"rewards/soft_format_reward_func": 0.0,
"rewards/strict_format_reward_func": 0.0,
"rewards/xmlcount_reward_func": 0.0,
"step": 6
},
{
"completion_length": 6.71875,
"epoch": 0.5765765765765766,
"grad_norm": 15.033347129821777,
"kl": 0.037265406065227324,
"learning_rate": 3.867370395306068e-07,
"loss": 0.0,
"reward": 2.0335406224476174,
"reward_std": 0.17979902774095535,
"rewards/concensus_correctness_reward_func": 0.3605000004172325,
"rewards/consensus_reward_func": 1.625,
"rewards/cumulative_reward_2": 0.0,
"rewards/final_correctness_reward_func": 0.0,
"rewards/question_recreation_reward_func": 0.04804061644244939,
"rewards/soft_format_reward_func": 0.0,
"rewards/strict_format_reward_func": 0.0,
"rewards/xmlcount_reward_func": 0.0,
"step": 8
},
{
"completion_length": 11.21875,
"epoch": 0.7207207207207207,
"grad_norm": 3.437758207321167,
"kl": 0.015125086178926495,
"learning_rate": 3.1137137178519977e-07,
"loss": 0.0,
"reward": 1.498489588033408,
"reward_std": 0.09418269171146676,
"rewards/concensus_correctness_reward_func": 0.12400000146590173,
"rewards/consensus_reward_func": 1.3125,
"rewards/cumulative_reward_2": 0.0,
"rewards/final_correctness_reward_func": 0.0,
"rewards/question_recreation_reward_func": 0.06198958713503089,
"rewards/soft_format_reward_func": 0.0,
"rewards/strict_format_reward_func": 0.0,
"rewards/xmlcount_reward_func": 0.0,
"step": 10
},
{
"completion_length": 5.875,
"epoch": 0.8648648648648649,
"grad_norm": 40.72884750366211,
"kl": 0.07916541388276599,
"learning_rate": 2.2935516363191693e-07,
"loss": 0.0001,
"reward": 2.217431016266346,
"reward_std": 0.175310879945755,
"rewards/concensus_correctness_reward_func": 0.4908750057220459,
"rewards/consensus_reward_func": 1.6875,
"rewards/cumulative_reward_2": 0.0,
"rewards/final_correctness_reward_func": 0.0,
"rewards/question_recreation_reward_func": 0.03905599995050579,
"rewards/soft_format_reward_func": 0.0,
"rewards/strict_format_reward_func": 0.0,
"rewards/xmlcount_reward_func": 0.0,
"step": 12
},
{
"completion_length": 4.666666666666667,
"epoch": 1.0,
"grad_norm": 0.0005821126396767795,
"kl": 0.043508860270182484,
"learning_rate": 1.4957614383675767e-07,
"loss": 0.0,
"reward": 3.4743243026236694,
"reward_std": 0.0,
"rewards/concensus_correctness_reward_func": 1.846400006612142,
"rewards/consensus_reward_func": 1.6,
"rewards/cumulative_reward_2": 0.0,
"rewards/final_correctness_reward_func": 0.0,
"rewards/question_recreation_reward_func": 0.027924280675748984,
"rewards/soft_format_reward_func": 0.0,
"rewards/strict_format_reward_func": 0.0,
"rewards/xmlcount_reward_func": 0.0,
"step": 14
},
{
"completion_length": 5.375,
"epoch": 1.1441441441441442,
"grad_norm": 0.007315310183912516,
"kl": 0.0007841990336601157,
"learning_rate": 8.067960709356478e-08,
"loss": 0.0,
"reward": 2.0436925697140396,
"reward_std": 0.0,
"rewards/concensus_correctness_reward_func": 0.37912500463426113,
"rewards/consensus_reward_func": 1.625,
"rewards/cumulative_reward_2": 0.0,
"rewards/final_correctness_reward_func": 0.0,
"rewards/question_recreation_reward_func": 0.039567558211274445,
"rewards/soft_format_reward_func": 0.0,
"rewards/strict_format_reward_func": 0.0,
"rewards/xmlcount_reward_func": 0.0,
"step": 16
},
{
"completion_length": 4.25,
"epoch": 1.2882882882882882,
"grad_norm": 0.015381651930510998,
"kl": 0.0016820762306686277,
"learning_rate": 3.013156219837776e-08,
"loss": 0.0,
"reward": 2.259079163253773,
"reward_std": 0.0,
"rewards/concensus_correctness_reward_func": 0.4855000004172325,
"rewards/consensus_reward_func": 1.75,
"rewards/cumulative_reward_2": 0.0,
"rewards/final_correctness_reward_func": 0.0,
"rewards/question_recreation_reward_func": 0.02357914694584906,
"rewards/soft_format_reward_func": 0.0,
"rewards/strict_format_reward_func": 0.0,
"rewards/xmlcount_reward_func": 0.0,
"step": 18
},
{
"completion_length": 4.5625,
"epoch": 1.4324324324324325,
"grad_norm": 49.89079284667969,
"kl": 0.04839727417565598,
"learning_rate": 3.4096741493194193e-09,
"loss": 0.0,
"reward": 2.2943748831748962,
"reward_std": 0.00014778331387788057,
"rewards/concensus_correctness_reward_func": 0.3815000019967556,
"rewards/consensus_reward_func": 1.875,
"rewards/cumulative_reward_2": 0.0,
"rewards/final_correctness_reward_func": 0.0,
"rewards/question_recreation_reward_func": 0.037874873145483434,
"rewards/soft_format_reward_func": 0.0,
"rewards/strict_format_reward_func": 0.0,
"rewards/xmlcount_reward_func": 0.0,
"step": 20
},
{
"epoch": 1.4324324324324325,
"step": 20,
"total_flos": 0.0,
"train_loss": 2.3087571327096158e-05,
"train_runtime": 1560.9796,
"train_samples_per_second": 0.205,
"train_steps_per_second": 0.013
}
],
"logging_steps": 2,
"max_steps": 20,
"num_input_tokens_seen": 0,
"num_train_epochs": 2,
"save_steps": 25,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 0.0,
"train_batch_size": 2,
"trial_name": null,
"trial_params": null
}