Files
Qwen2.5-0.5B-Instruct-Gensy…/trainer_state.json
ModelHub XC 2d7ec5121c 初始化项目,由ModelHub XC社区提供模型
Model: babycielou/Qwen2.5-0.5B-Instruct-Gensyn-Swarm-scampering_thick_alpaca
Source: Original Platform
2026-08-26 16:30:50 +08:00

1019 lines
41 KiB
JSON

{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 16.571428571428573,
"eval_steps": 500,
"global_step": 50,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 60.0,
"completions/max_terminated_length": 60.0,
"completions/mean_length": 59.25,
"completions/mean_terminated_length": 59.25,
"completions/min_length": 58.5,
"completions/min_terminated_length": 58.5,
"epoch": 0.5714285714285714,
"grad_norm": 0.0,
"kl": 0.0,
"learning_rate": 2.666666666666666e-07,
"loss": 0.0,
"num_tokens": 2522.0,
"reward": 8.320502758026123,
"reward_std": 0.0,
"rewards/concensus_correctness_reward_func/mean": 2.9240000247955322,
"rewards/concensus_correctness_reward_func/std": 0.0,
"rewards/consensus_reward_func/mean": 2.0,
"rewards/consensus_reward_func/std": 0.0,
"rewards/cumulative_reward_2/mean": 0.0,
"rewards/cumulative_reward_2/std": 0.0,
"rewards/final_correctness_reward_func/mean": 1.5,
"rewards/final_correctness_reward_func/std": 0.5773502588272095,
"rewards/question_recreation_reward_func/mean": 0.14650316163897514,
"rewards/question_recreation_reward_func/std": 0.13350021466612816,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"rewards/strict_format_reward_func/mean": 0.5,
"rewards/strict_format_reward_func/std": 0.0,
"rewards/xmlcount_reward_func/mean": 1.25,
"rewards/xmlcount_reward_func/std": 0.0,
"step": 2
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 61.5,
"completions/max_terminated_length": 61.5,
"completions/mean_length": 60.33333396911621,
"completions/mean_terminated_length": 60.33333396911621,
"completions/min_length": 59.5,
"completions/min_terminated_length": 59.5,
"epoch": 1.2857142857142856,
"grad_norm": 0.0,
"kl": 0.0,
"learning_rate": 8e-07,
"loss": 0.0,
"num_tokens": 5054.0,
"reward": 7.801945447921753,
"reward_std": 0.0,
"rewards/concensus_correctness_reward_func/mean": 2.9240000247955322,
"rewards/concensus_correctness_reward_func/std": 0.0,
"rewards/consensus_reward_func/mean": 2.0,
"rewards/consensus_reward_func/std": 0.0,
"rewards/cumulative_reward_2/mean": 0.0,
"rewards/cumulative_reward_2/std": 0.0,
"rewards/final_correctness_reward_func/mean": 1.0,
"rewards/final_correctness_reward_func/std": 0.0,
"rewards/question_recreation_reward_func/mean": 0.12794561684131622,
"rewards/question_recreation_reward_func/std": 0.08619211986660957,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"rewards/strict_format_reward_func/mean": 0.5,
"rewards/strict_format_reward_func/std": 0.0,
"rewards/xmlcount_reward_func/mean": 1.25,
"rewards/xmlcount_reward_func/std": 0.0,
"step": 4
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 64.0,
"completions/max_terminated_length": 64.0,
"completions/mean_length": 61.83333396911621,
"completions/mean_terminated_length": 61.83333396911621,
"completions/min_length": 59.0,
"completions/min_terminated_length": 59.0,
"epoch": 1.8571428571428572,
"grad_norm": 0.0,
"kl": 0.0,
"learning_rate": 7.96430995261912e-07,
"loss": 0.0,
"num_tokens": 7594.0,
"reward": 7.469648122787476,
"reward_std": 0.0,
"rewards/concensus_correctness_reward_func/mean": 2.9230000376701355,
"rewards/concensus_correctness_reward_func/std": 0.0,
"rewards/consensus_reward_func/mean": 2.0,
"rewards/consensus_reward_func/std": 0.0,
"rewards/cumulative_reward_2/mean": 0.0,
"rewards/cumulative_reward_2/std": 0.0,
"rewards/final_correctness_reward_func/mean": 0.5,
"rewards/final_correctness_reward_func/std": 0.5773502588272095,
"rewards/question_recreation_reward_func/mean": 0.29664809443056583,
"rewards/question_recreation_reward_func/std": 0.12906248797662556,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"rewards/strict_format_reward_func/mean": 0.5,
"rewards/strict_format_reward_func/std": 0.0,
"rewards/xmlcount_reward_func/mean": 1.25,
"rewards/xmlcount_reward_func/std": 0.0,
"step": 6
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 62.5,
"completions/max_terminated_length": 62.5,
"completions/mean_length": 60.875,
"completions/mean_terminated_length": 60.875,
"completions/min_length": 59.0,
"completions/min_terminated_length": 59.0,
"epoch": 2.571428571428571,
"grad_norm": 0.0,
"kl": 0.0,
"learning_rate": 7.857876700217506e-07,
"loss": 0.0,
"num_tokens": 10129.0,
"reward": 9.379204273223877,
"reward_std": 0.0,
"rewards/concensus_correctness_reward_func/mean": 3.9240000247955322,
"rewards/concensus_correctness_reward_func/std": 0.0,
"rewards/consensus_reward_func/mean": 2.0,
"rewards/consensus_reward_func/std": 0.0,
"rewards/cumulative_reward_2/mean": 0.0,
"rewards/cumulative_reward_2/std": 0.0,
"rewards/final_correctness_reward_func/mean": 1.5,
"rewards/final_correctness_reward_func/std": 0.5773502588272095,
"rewards/question_recreation_reward_func/mean": 0.20520437508821487,
"rewards/question_recreation_reward_func/std": 0.1838914006948471,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"rewards/strict_format_reward_func/mean": 0.5,
"rewards/strict_format_reward_func/std": 0.0,
"rewards/xmlcount_reward_func/mean": 1.25,
"rewards/xmlcount_reward_func/std": 0.0,
"step": 8
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 64.0,
"completions/max_terminated_length": 64.0,
"completions/mean_length": 61.91666603088379,
"completions/mean_terminated_length": 61.91666603088379,
"completions/min_length": 59.5,
"completions/min_terminated_length": 59.5,
"epoch": 3.2857142857142856,
"grad_norm": 0.0,
"kl": 0.0,
"learning_rate": 7.682599546705714e-07,
"loss": 0.0,
"num_tokens": 12671.0,
"reward": 7.95428204536438,
"reward_std": 0.0,
"rewards/concensus_correctness_reward_func/mean": 2.9230000376701355,
"rewards/concensus_correctness_reward_func/std": 0.0,
"rewards/consensus_reward_func/mean": 2.0,
"rewards/consensus_reward_func/std": 0.0,
"rewards/cumulative_reward_2/mean": 0.0,
"rewards/cumulative_reward_2/std": 0.0,
"rewards/final_correctness_reward_func/mean": 1.0,
"rewards/final_correctness_reward_func/std": 0.0,
"rewards/question_recreation_reward_func/mean": 0.2812819126993418,
"rewards/question_recreation_reward_func/std": 0.1468058144673705,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"rewards/strict_format_reward_func/mean": 0.5,
"rewards/strict_format_reward_func/std": 0.0,
"rewards/xmlcount_reward_func/mean": 1.25,
"rewards/xmlcount_reward_func/std": 0.0,
"step": 10
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 61.5,
"completions/max_terminated_length": 61.5,
"completions/mean_length": 59.54166603088379,
"completions/mean_terminated_length": 59.54166603088379,
"completions/min_length": 58.5,
"completions/min_terminated_length": 58.5,
"epoch": 3.857142857142857,
"grad_norm": 0.0,
"kl": 0.0,
"learning_rate": 7.441606317040557e-07,
"loss": 0.0,
"num_tokens": 15198.0,
"reward": 7.847028970718384,
"reward_std": 0.0,
"rewards/concensus_correctness_reward_func/mean": 2.9240000247955322,
"rewards/concensus_correctness_reward_func/std": 0.0,
"rewards/consensus_reward_func/mean": 2.0,
"rewards/consensus_reward_func/std": 0.0,
"rewards/cumulative_reward_2/mean": 0.0,
"rewards/cumulative_reward_2/std": 0.0,
"rewards/final_correctness_reward_func/mean": 1.0,
"rewards/final_correctness_reward_func/std": 0.0,
"rewards/question_recreation_reward_func/mean": 0.1730293445289135,
"rewards/question_recreation_reward_func/std": 0.1298600658774376,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"rewards/strict_format_reward_func/mean": 0.5,
"rewards/strict_format_reward_func/std": 0.0,
"rewards/xmlcount_reward_func/mean": 1.25,
"rewards/xmlcount_reward_func/std": 0.0,
"step": 12
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 64.0,
"completions/max_terminated_length": 64.0,
"completions/mean_length": 62.25,
"completions/mean_terminated_length": 62.25,
"completions/min_length": 60.5,
"completions/min_terminated_length": 60.5,
"epoch": 4.571428571428571,
"grad_norm": 0.0,
"kl": 0.0,
"learning_rate": 7.139197541114644e-07,
"loss": 0.0,
"num_tokens": 17744.0,
"reward": 7.7899744510650635,
"reward_std": 0.0,
"rewards/concensus_correctness_reward_func/mean": 2.9230000376701355,
"rewards/concensus_correctness_reward_func/std": 0.0,
"rewards/consensus_reward_func/mean": 2.0,
"rewards/consensus_reward_func/std": 0.0,
"rewards/cumulative_reward_2/mean": 0.0,
"rewards/cumulative_reward_2/std": 0.0,
"rewards/final_correctness_reward_func/mean": 1.0,
"rewards/final_correctness_reward_func/std": 0.0,
"rewards/question_recreation_reward_func/mean": 0.11697426624596119,
"rewards/question_recreation_reward_func/std": 0.09874683525413275,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"rewards/strict_format_reward_func/mean": 0.5,
"rewards/strict_format_reward_func/std": 0.0,
"rewards/xmlcount_reward_func/mean": 1.25,
"rewards/xmlcount_reward_func/std": 0.0,
"step": 14
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 62.5,
"completions/max_terminated_length": 62.5,
"completions/mean_length": 60.5,
"completions/mean_terminated_length": 60.5,
"completions/min_length": 58.5,
"completions/min_terminated_length": 58.5,
"epoch": 5.285714285714286,
"grad_norm": 0.0,
"kl": 0.0,
"learning_rate": 6.780769710698569e-07,
"loss": 0.0,
"num_tokens": 20276.0,
"reward": 9.529415130615234,
"reward_std": 0.0,
"rewards/concensus_correctness_reward_func/mean": 3.9240000247955322,
"rewards/concensus_correctness_reward_func/std": 0.0,
"rewards/consensus_reward_func/mean": 2.0,
"rewards/consensus_reward_func/std": 0.0,
"rewards/cumulative_reward_2/mean": 0.0,
"rewards/cumulative_reward_2/std": 0.0,
"rewards/final_correctness_reward_func/mean": 1.5,
"rewards/final_correctness_reward_func/std": 0.5773502588272095,
"rewards/question_recreation_reward_func/mean": 0.35541531443595886,
"rewards/question_recreation_reward_func/std": 0.14058449491858482,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"rewards/strict_format_reward_func/mean": 0.5,
"rewards/strict_format_reward_func/std": 0.0,
"rewards/xmlcount_reward_func/mean": 1.25,
"rewards/xmlcount_reward_func/std": 0.0,
"step": 16
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 60.5,
"completions/max_terminated_length": 60.5,
"completions/mean_length": 60.0,
"completions/mean_terminated_length": 60.0,
"completions/min_length": 59.5,
"completions/min_terminated_length": 59.5,
"epoch": 5.857142857142857,
"grad_norm": 0.0,
"kl": 0.0,
"learning_rate": 6.37271897891742e-07,
"loss": 0.0,
"num_tokens": 22804.0,
"reward": 7.80859112739563,
"reward_std": 0.0,
"rewards/concensus_correctness_reward_func/mean": 2.9230000376701355,
"rewards/concensus_correctness_reward_func/std": 0.0,
"rewards/consensus_reward_func/mean": 2.0,
"rewards/consensus_reward_func/std": 0.0,
"rewards/cumulative_reward_2/mean": 0.0,
"rewards/cumulative_reward_2/std": 0.0,
"rewards/final_correctness_reward_func/mean": 1.0,
"rewards/final_correctness_reward_func/std": 0.0,
"rewards/question_recreation_reward_func/mean": 0.13559100963175297,
"rewards/question_recreation_reward_func/std": 0.10423970874398947,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"rewards/strict_format_reward_func/mean": 0.5,
"rewards/strict_format_reward_func/std": 0.0,
"rewards/xmlcount_reward_func/mean": 1.25,
"rewards/xmlcount_reward_func/std": 0.0,
"step": 18
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 61.5,
"completions/max_terminated_length": 61.5,
"completions/mean_length": 60.5,
"completions/mean_terminated_length": 60.5,
"completions/min_length": 59.5,
"completions/min_terminated_length": 59.5,
"epoch": 6.571428571428571,
"grad_norm": 0.0,
"kl": 0.0,
"learning_rate": 5.922327020746735e-07,
"loss": 0.0,
"num_tokens": 25336.0,
"reward": 6.758650302886963,
"reward_std": 0.0,
"rewards/concensus_correctness_reward_func/mean": 1.9230000376701355,
"rewards/concensus_correctness_reward_func/std": 0.0,
"rewards/consensus_reward_func/mean": 2.0,
"rewards/consensus_reward_func/std": 0.0,
"rewards/cumulative_reward_2/mean": 0.0,
"rewards/cumulative_reward_2/std": 0.0,
"rewards/final_correctness_reward_func/mean": 1.0,
"rewards/final_correctness_reward_func/std": 1.154700517654419,
"rewards/question_recreation_reward_func/mean": 0.08565033413469791,
"rewards/question_recreation_reward_func/std": 0.05564996972680092,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"rewards/strict_format_reward_func/mean": 0.5,
"rewards/strict_format_reward_func/std": 0.0,
"rewards/xmlcount_reward_func/mean": 1.25,
"rewards/xmlcount_reward_func/std": 0.0,
"step": 20
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 59.5,
"completions/max_terminated_length": 59.5,
"completions/mean_length": 59.08333396911621,
"completions/mean_terminated_length": 59.08333396911621,
"completions/min_length": 58.5,
"completions/min_terminated_length": 58.5,
"epoch": 7.285714285714286,
"grad_norm": 0.0,
"kl": 0.0,
"learning_rate": 5.437631091350051e-07,
"loss": 0.0,
"num_tokens": 27856.0,
"reward": 8.844876766204834,
"reward_std": 0.0,
"rewards/concensus_correctness_reward_func/mean": 3.9240000247955322,
"rewards/concensus_correctness_reward_func/std": 0.0,
"rewards/consensus_reward_func/mean": 2.0,
"rewards/consensus_reward_func/std": 0.0,
"rewards/cumulative_reward_2/mean": 0.0,
"rewards/cumulative_reward_2/std": 0.0,
"rewards/final_correctness_reward_func/mean": 1.0,
"rewards/final_correctness_reward_func/std": 1.154700517654419,
"rewards/question_recreation_reward_func/mean": 0.17087683081626892,
"rewards/question_recreation_reward_func/std": 0.14287568256258965,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"rewards/strict_format_reward_func/mean": 0.5,
"rewards/strict_format_reward_func/std": 0.0,
"rewards/xmlcount_reward_func/mean": 1.25,
"rewards/xmlcount_reward_func/std": 0.0,
"step": 22
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 60.5,
"completions/max_terminated_length": 60.5,
"completions/mean_length": 59.91666603088379,
"completions/mean_terminated_length": 59.91666603088379,
"completions/min_length": 59.5,
"completions/min_terminated_length": 59.5,
"epoch": 7.857142857142857,
"grad_norm": 0.0,
"kl": 0.0,
"learning_rate": 4.927280601070113e-07,
"loss": 0.0,
"num_tokens": 30384.0,
"reward": 7.822388648986816,
"reward_std": 0.0,
"rewards/concensus_correctness_reward_func/mean": 2.9240000247955322,
"rewards/concensus_correctness_reward_func/std": 0.0,
"rewards/consensus_reward_func/mean": 2.0,
"rewards/consensus_reward_func/std": 0.0,
"rewards/cumulative_reward_2/mean": 0.0,
"rewards/cumulative_reward_2/std": 0.0,
"rewards/final_correctness_reward_func/mean": 1.0,
"rewards/final_correctness_reward_func/std": 1.154700517654419,
"rewards/question_recreation_reward_func/mean": 0.14838874712586403,
"rewards/question_recreation_reward_func/std": 0.13132291659712791,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"rewards/strict_format_reward_func/mean": 0.5,
"rewards/strict_format_reward_func/std": 0.0,
"rewards/xmlcount_reward_func/mean": 1.25,
"rewards/xmlcount_reward_func/std": 0.0,
"step": 24
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 62.5,
"completions/max_terminated_length": 62.5,
"completions/mean_length": 61.0,
"completions/mean_terminated_length": 61.0,
"completions/min_length": 59.5,
"completions/min_terminated_length": 59.5,
"epoch": 8.571428571428571,
"grad_norm": 0.0,
"kl": 0.0,
"learning_rate": 4.400382766496394e-07,
"loss": 0.0,
"num_tokens": 32920.0,
"reward": 9.513794898986816,
"reward_std": 0.0,
"rewards/concensus_correctness_reward_func/mean": 3.9240000247955322,
"rewards/concensus_correctness_reward_func/std": 0.0,
"rewards/consensus_reward_func/mean": 2.0,
"rewards/consensus_reward_func/std": 0.0,
"rewards/cumulative_reward_2/mean": 0.0,
"rewards/cumulative_reward_2/std": 0.0,
"rewards/final_correctness_reward_func/mean": 1.5,
"rewards/final_correctness_reward_func/std": 0.5773502588272095,
"rewards/question_recreation_reward_func/mean": 0.3397950530052185,
"rewards/question_recreation_reward_func/std": 0.15862121805548668,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"rewards/strict_format_reward_func/mean": 0.5,
"rewards/strict_format_reward_func/std": 0.0,
"rewards/xmlcount_reward_func/mean": 1.25,
"rewards/xmlcount_reward_func/std": 0.0,
"step": 26
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 64.0,
"completions/max_terminated_length": 64.0,
"completions/mean_length": 61.33333396911621,
"completions/mean_terminated_length": 61.33333396911621,
"completions/min_length": 58.0,
"completions/min_terminated_length": 58.0,
"epoch": 9.285714285714286,
"grad_norm": 0.0,
"kl": 0.0,
"learning_rate": 3.866340091969303e-07,
"loss": 0.0,
"num_tokens": 35456.0,
"reward": 6.254339218139648,
"reward_std": 0.0,
"rewards/concensus_correctness_reward_func/mean": 1.9230000376701355,
"rewards/concensus_correctness_reward_func/std": 0.0,
"rewards/consensus_reward_func/mean": 2.0,
"rewards/consensus_reward_func/std": 0.0,
"rewards/cumulative_reward_2/mean": 0.0,
"rewards/cumulative_reward_2/std": 0.0,
"rewards/final_correctness_reward_func/mean": 0.5,
"rewards/final_correctness_reward_func/std": 0.5773502588272095,
"rewards/question_recreation_reward_func/mean": 0.08133926056325436,
"rewards/question_recreation_reward_func/std": 0.04871071805246174,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"rewards/strict_format_reward_func/mean": 0.5,
"rewards/strict_format_reward_func/std": 0.0,
"rewards/xmlcount_reward_func/mean": 1.25,
"rewards/xmlcount_reward_func/std": 0.0,
"step": 28
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 60.5,
"completions/max_terminated_length": 60.5,
"completions/mean_length": 60.125,
"completions/mean_terminated_length": 60.125,
"completions/min_length": 59.5,
"completions/min_terminated_length": 59.5,
"epoch": 9.857142857142858,
"grad_norm": 0.0,
"kl": 0.0,
"learning_rate": 3.33468258166748e-07,
"loss": 0.0,
"num_tokens": 37985.0,
"reward": 8.307038307189941,
"reward_std": 0.0,
"rewards/concensus_correctness_reward_func/mean": 2.9230000376701355,
"rewards/concensus_correctness_reward_func/std": 0.0,
"rewards/consensus_reward_func/mean": 2.0,
"rewards/consensus_reward_func/std": 0.0,
"rewards/cumulative_reward_2/mean": 0.0,
"rewards/cumulative_reward_2/std": 0.0,
"rewards/final_correctness_reward_func/mean": 1.5,
"rewards/final_correctness_reward_func/std": 0.5773502588272095,
"rewards/question_recreation_reward_func/mean": 0.13403821364045143,
"rewards/question_recreation_reward_func/std": 0.10603272262960672,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"rewards/strict_format_reward_func/mean": 0.5,
"rewards/strict_format_reward_func/std": 0.0,
"rewards/xmlcount_reward_func/mean": 1.25,
"rewards/xmlcount_reward_func/std": 0.0,
"step": 30
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 62.5,
"completions/max_terminated_length": 62.5,
"completions/mean_length": 61.0,
"completions/mean_terminated_length": 61.0,
"completions/min_length": 59.5,
"completions/min_terminated_length": 59.5,
"epoch": 10.571428571428571,
"grad_norm": 0.0,
"kl": 0.0,
"learning_rate": 2.8148976764574644e-07,
"loss": 0.0,
"num_tokens": 40521.0,
"reward": 9.50374174118042,
"reward_std": 0.0,
"rewards/concensus_correctness_reward_func/mean": 3.9240000247955322,
"rewards/concensus_correctness_reward_func/std": 0.0,
"rewards/consensus_reward_func/mean": 2.0,
"rewards/consensus_reward_func/std": 0.0,
"rewards/cumulative_reward_2/mean": 0.0,
"rewards/cumulative_reward_2/std": 0.0,
"rewards/final_correctness_reward_func/mean": 1.5,
"rewards/final_correctness_reward_func/std": 0.5773502588272095,
"rewards/question_recreation_reward_func/mean": 0.3297421932220459,
"rewards/question_recreation_reward_func/std": 0.1702292338013649,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"rewards/strict_format_reward_func/mean": 0.5,
"rewards/strict_format_reward_func/std": 0.0,
"rewards/xmlcount_reward_func/mean": 1.25,
"rewards/xmlcount_reward_func/std": 0.0,
"step": 32
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 60.0,
"completions/max_terminated_length": 60.0,
"completions/mean_length": 59.58333396911621,
"completions/mean_terminated_length": 59.58333396911621,
"completions/min_length": 59.0,
"completions/min_terminated_length": 59.0,
"epoch": 11.285714285714286,
"grad_norm": 0.0,
"kl": 0.0,
"learning_rate": 2.3162609502866607e-07,
"loss": 0.0,
"num_tokens": 43045.0,
"reward": 6.792631387710571,
"reward_std": 0.0,
"rewards/concensus_correctness_reward_func/mean": 1.9240000247955322,
"rewards/concensus_correctness_reward_func/std": 0.0,
"rewards/consensus_reward_func/mean": 2.0,
"rewards/consensus_reward_func/std": 0.0,
"rewards/cumulative_reward_2/mean": 0.0,
"rewards/cumulative_reward_2/std": 0.0,
"rewards/final_correctness_reward_func/mean": 1.0,
"rewards/final_correctness_reward_func/std": 1.154700517654419,
"rewards/question_recreation_reward_func/mean": 0.11863159388303757,
"rewards/question_recreation_reward_func/std": 0.0983341597020626,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"rewards/strict_format_reward_func/mean": 0.5,
"rewards/strict_format_reward_func/std": 0.0,
"rewards/xmlcount_reward_func/mean": 1.25,
"rewards/xmlcount_reward_func/std": 0.0,
"step": 34
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 64.0,
"completions/max_terminated_length": 64.0,
"completions/mean_length": 61.41666603088379,
"completions/mean_terminated_length": 61.41666603088379,
"completions/min_length": 60.0,
"completions/min_terminated_length": 60.0,
"epoch": 11.857142857142858,
"grad_norm": 0.0,
"kl": 0.0,
"learning_rate": 1.8476705873465095e-07,
"loss": 0.0,
"num_tokens": 45589.0,
"reward": 9.386459350585938,
"reward_std": 0.0,
"rewards/concensus_correctness_reward_func/mean": 3.9240000247955322,
"rewards/concensus_correctness_reward_func/std": 0.0,
"rewards/consensus_reward_func/mean": 2.0,
"rewards/consensus_reward_func/std": 0.0,
"rewards/cumulative_reward_2/mean": 0.0,
"rewards/cumulative_reward_2/std": 0.0,
"rewards/final_correctness_reward_func/mean": 1.5,
"rewards/final_correctness_reward_func/std": 0.5773502588272095,
"rewards/question_recreation_reward_func/mean": 0.2124595046043396,
"rewards/question_recreation_reward_func/std": 0.17551389336585999,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"rewards/strict_format_reward_func/mean": 0.5,
"rewards/strict_format_reward_func/std": 0.0,
"rewards/xmlcount_reward_func/mean": 1.25,
"rewards/xmlcount_reward_func/std": 0.0,
"step": 36
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 63.0,
"completions/max_terminated_length": 63.0,
"completions/mean_length": 61.5,
"completions/mean_terminated_length": 61.5,
"completions/min_length": 60.0,
"completions/min_terminated_length": 60.0,
"epoch": 12.571428571428571,
"grad_norm": 0.0,
"kl": 0.0,
"learning_rate": 1.41748859376479e-07,
"loss": 0.0,
"num_tokens": 48129.0,
"reward": 9.332355499267578,
"reward_std": 0.0,
"rewards/concensus_correctness_reward_func/mean": 3.9240000247955322,
"rewards/concensus_correctness_reward_func/std": 0.0,
"rewards/consensus_reward_func/mean": 2.0,
"rewards/consensus_reward_func/std": 0.0,
"rewards/cumulative_reward_2/mean": 0.0,
"rewards/cumulative_reward_2/std": 0.0,
"rewards/final_correctness_reward_func/mean": 1.5,
"rewards/final_correctness_reward_func/std": 0.5773502588272095,
"rewards/question_recreation_reward_func/mean": 0.15835533291101456,
"rewards/question_recreation_reward_func/std": 0.13034464046359062,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"rewards/strict_format_reward_func/mean": 0.5,
"rewards/strict_format_reward_func/std": 0.0,
"rewards/xmlcount_reward_func/mean": 1.25,
"rewards/xmlcount_reward_func/std": 0.0,
"step": 38
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 62.0,
"completions/max_terminated_length": 62.0,
"completions/mean_length": 60.75,
"completions/mean_terminated_length": 60.75,
"completions/min_length": 59.0,
"completions/min_terminated_length": 59.0,
"epoch": 13.285714285714286,
"grad_norm": 0.0,
"kl": 0.0,
"learning_rate": 1.0333915774081696e-07,
"loss": 0.0,
"num_tokens": 50661.0,
"reward": 7.8131725788116455,
"reward_std": 0.0,
"rewards/concensus_correctness_reward_func/mean": 2.9230000376701355,
"rewards/concensus_correctness_reward_func/std": 0.0,
"rewards/consensus_reward_func/mean": 2.0,
"rewards/consensus_reward_func/std": 0.0,
"rewards/cumulative_reward_2/mean": 0.0,
"rewards/cumulative_reward_2/std": 0.0,
"rewards/final_correctness_reward_func/mean": 1.0,
"rewards/final_correctness_reward_func/std": 1.154700517654419,
"rewards/question_recreation_reward_func/mean": 0.14017230831086636,
"rewards/question_recreation_reward_func/std": 0.09894967451691628,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"rewards/strict_format_reward_func/mean": 0.5,
"rewards/strict_format_reward_func/std": 0.0,
"rewards/xmlcount_reward_func/mean": 1.25,
"rewards/xmlcount_reward_func/std": 0.0,
"step": 40
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 63.5,
"completions/max_terminated_length": 63.5,
"completions/mean_length": 61.33333396911621,
"completions/mean_terminated_length": 61.33333396911621,
"completions/min_length": 59.0,
"completions/min_terminated_length": 59.0,
"epoch": 13.857142857142858,
"grad_norm": 0.0,
"kl": 0.0,
"learning_rate": 7.022337586329597e-08,
"loss": 0.0,
"num_tokens": 53199.0,
"reward": 7.823443651199341,
"reward_std": 0.0,
"rewards/concensus_correctness_reward_func/mean": 2.9240000247955322,
"rewards/concensus_correctness_reward_func/std": 0.0,
"rewards/consensus_reward_func/mean": 2.0,
"rewards/consensus_reward_func/std": 0.0,
"rewards/cumulative_reward_2/mean": 0.0,
"rewards/cumulative_reward_2/std": 0.0,
"rewards/final_correctness_reward_func/mean": 1.0,
"rewards/final_correctness_reward_func/std": 1.154700517654419,
"rewards/question_recreation_reward_func/mean": 0.14944354072213173,
"rewards/question_recreation_reward_func/std": 0.13010496646165848,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"rewards/strict_format_reward_func/mean": 0.5,
"rewards/strict_format_reward_func/std": 0.0,
"rewards/xmlcount_reward_func/mean": 1.25,
"rewards/xmlcount_reward_func/std": 0.0,
"step": 42
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 60.0,
"completions/max_terminated_length": 60.0,
"completions/mean_length": 59.5,
"completions/mean_terminated_length": 59.5,
"completions/min_length": 59.0,
"completions/min_terminated_length": 59.0,
"epoch": 14.571428571428571,
"grad_norm": 0.0,
"kl": 0.0,
"learning_rate": 4.299246565604755e-08,
"loss": 0.0,
"num_tokens": 55723.0,
"reward": 7.8444740772247314,
"reward_std": 0.0,
"rewards/concensus_correctness_reward_func/mean": 2.9240000247955322,
"rewards/concensus_correctness_reward_func/std": 0.0,
"rewards/consensus_reward_func/mean": 2.0,
"rewards/consensus_reward_func/std": 0.0,
"rewards/cumulative_reward_2/mean": 0.0,
"rewards/cumulative_reward_2/std": 0.0,
"rewards/final_correctness_reward_func/mean": 1.0,
"rewards/final_correctness_reward_func/std": 1.154700517654419,
"rewards/question_recreation_reward_func/mean": 0.1704743131995201,
"rewards/question_recreation_reward_func/std": 0.14472759515047073,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"rewards/strict_format_reward_func/mean": 0.5,
"rewards/strict_format_reward_func/std": 0.0,
"rewards/xmlcount_reward_func/mean": 1.25,
"rewards/xmlcount_reward_func/std": 0.0,
"step": 44
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 62.5,
"completions/max_terminated_length": 62.5,
"completions/mean_length": 61.83333206176758,
"completions/mean_terminated_length": 61.83333206176758,
"completions/min_length": 60.5,
"completions/min_terminated_length": 60.5,
"epoch": 15.285714285714286,
"grad_norm": 0.0,
"kl": 0.0,
"learning_rate": 2.213236335683253e-08,
"loss": 0.0,
"num_tokens": 58263.0,
"reward": 9.4916090965271,
"reward_std": 0.0,
"rewards/concensus_correctness_reward_func/mean": 3.9240000247955322,
"rewards/concensus_correctness_reward_func/std": 0.0,
"rewards/consensus_reward_func/mean": 2.0,
"rewards/consensus_reward_func/std": 0.0,
"rewards/cumulative_reward_2/mean": 0.0,
"rewards/cumulative_reward_2/std": 0.0,
"rewards/final_correctness_reward_func/mean": 1.5,
"rewards/final_correctness_reward_func/std": 0.5773502588272095,
"rewards/question_recreation_reward_func/mean": 0.31760965287685394,
"rewards/question_recreation_reward_func/std": 0.184238713234663,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"rewards/strict_format_reward_func/mean": 0.5,
"rewards/strict_format_reward_func/std": 0.0,
"rewards/xmlcount_reward_func/mean": 1.25,
"rewards/xmlcount_reward_func/std": 0.0,
"step": 46
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 64.0,
"completions/max_terminated_length": 64.0,
"completions/mean_length": 61.83333396911621,
"completions/mean_terminated_length": 61.83333396911621,
"completions/min_length": 59.0,
"completions/min_terminated_length": 59.0,
"epoch": 15.857142857142858,
"grad_norm": 0.0,
"kl": 0.0,
"learning_rate": 8.0153179853653e-09,
"loss": 0.0,
"num_tokens": 60803.0,
"reward": 7.469648122787476,
"reward_std": 0.0,
"rewards/concensus_correctness_reward_func/mean": 2.9230000376701355,
"rewards/concensus_correctness_reward_func/std": 0.0,
"rewards/consensus_reward_func/mean": 2.0,
"rewards/consensus_reward_func/std": 0.0,
"rewards/cumulative_reward_2/mean": 0.0,
"rewards/cumulative_reward_2/std": 0.0,
"rewards/final_correctness_reward_func/mean": 0.5,
"rewards/final_correctness_reward_func/std": 0.5773502588272095,
"rewards/question_recreation_reward_func/mean": 0.29664809443056583,
"rewards/question_recreation_reward_func/std": 0.12906248797662556,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"rewards/strict_format_reward_func/mean": 0.5,
"rewards/strict_format_reward_func/std": 0.0,
"rewards/xmlcount_reward_func/mean": 1.25,
"rewards/xmlcount_reward_func/std": 0.0,
"step": 48
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 63.5,
"completions/max_terminated_length": 63.5,
"completions/mean_length": 61.25,
"completions/mean_terminated_length": 61.25,
"completions/min_length": 59.0,
"completions/min_terminated_length": 59.0,
"epoch": 16.571428571428573,
"grad_norm": 0.0,
"kl": 0.0,
"learning_rate": 8.932485507387344e-10,
"loss": 0.0,
"num_tokens": 63341.0,
"reward": 7.827478647232056,
"reward_std": 0.0,
"rewards/concensus_correctness_reward_func/mean": 2.9240000247955322,
"rewards/concensus_correctness_reward_func/std": 0.0,
"rewards/consensus_reward_func/mean": 2.0,
"rewards/consensus_reward_func/std": 0.0,
"rewards/cumulative_reward_2/mean": 0.0,
"rewards/cumulative_reward_2/std": 0.0,
"rewards/final_correctness_reward_func/mean": 1.0,
"rewards/final_correctness_reward_func/std": 1.154700517654419,
"rewards/question_recreation_reward_func/mean": 0.15347910672426224,
"rewards/question_recreation_reward_func/std": 0.13736233860254288,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"rewards/strict_format_reward_func/mean": 0.5,
"rewards/strict_format_reward_func/std": 0.0,
"rewards/xmlcount_reward_func/mean": 1.25,
"rewards/xmlcount_reward_func/std": 0.0,
"step": 50
},
{
"epoch": 16.571428571428573,
"step": 50,
"total_flos": 0.0,
"train_loss": 0.0,
"train_runtime": 1419.4479,
"train_samples_per_second": 0.141,
"train_steps_per_second": 0.035
}
],
"logging_steps": 2,
"max_steps": 50,
"num_input_tokens_seen": 63341,
"num_train_epochs": 17,
"save_steps": 25,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 0.0,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}