Files
general_knowledge_model/checkpoint-1250/trainer_state.json
ModelHub XC e7f998cf6d 初始化项目,由ModelHub XC社区提供模型
Model: cs-552-2026-the-transformers/general_knowledge_model
Source: Original Platform
2026-07-20 05:53:10 +08:00

3410 lines
120 KiB
JSON

{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 1.0,
"eval_steps": 500,
"global_step": 1250,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00625,
"completions/max_length": 257.1,
"completions/max_terminated_length": 158.3,
"completions/mean_length": 42.925,
"completions/mean_terminated_length": 36.65708351135254,
"completions/min_length": 14.1,
"completions/min_terminated_length": 14.1,
"entropy": 0.7689311370253563,
"epoch": 0.008,
"frac_reward_zero_std": 0.35,
"grad_norm": 6.757325172424316,
"learning_rate": 4.964e-07,
"loss": -0.03516485691070557,
"num_tokens": 14928.0,
"reward": 0.7131250023841857,
"reward_std": 0.4031145960092545,
"rewards/reward_fn/mean": 0.7131250023841857,
"rewards/reward_fn/std": 0.40311461091041567,
"step": 10,
"step_time": 12.329081743443385
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 124.0,
"completions/max_terminated_length": 124.0,
"completions/mean_length": 28.95,
"completions/mean_terminated_length": 28.95,
"completions/min_length": 15.3,
"completions/min_terminated_length": 15.3,
"entropy": 0.74221798684448,
"epoch": 0.016,
"frac_reward_zero_std": 0.4,
"grad_norm": 24.46213722229004,
"learning_rate": 4.923999999999999e-07,
"loss": -0.03677875101566315,
"num_tokens": 27908.0,
"reward": 0.8331249713897705,
"reward_std": 0.4601421281695366,
"rewards/reward_fn/mean": 0.8331249713897705,
"rewards/reward_fn/std": 0.4601421505212784,
"step": 20,
"step_time": 6.713664122438058
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 312.5,
"completions/max_terminated_length": 312.5,
"completions/mean_length": 45.70625,
"completions/mean_terminated_length": 45.70625,
"completions/min_length": 15.9,
"completions/min_terminated_length": 15.9,
"entropy": 0.7767099749296904,
"epoch": 0.024,
"frac_reward_zero_std": 0.475,
"grad_norm": 8.362913131713867,
"learning_rate": 4.884e-07,
"loss": -0.06059606671333313,
"num_tokens": 43689.0,
"reward": 0.8893749833106994,
"reward_std": 0.3755300402641296,
"rewards/reward_fn/mean": 0.8893749833106994,
"rewards/reward_fn/std": 0.3755300521850586,
"step": 30,
"step_time": 14.446745052048936
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 133.3,
"completions/max_terminated_length": 133.3,
"completions/mean_length": 29.8375,
"completions/mean_terminated_length": 29.8375,
"completions/min_length": 16.8,
"completions/min_terminated_length": 16.8,
"entropy": 0.7361419148743152,
"epoch": 0.032,
"frac_reward_zero_std": 0.55,
"grad_norm": 12.163936614990234,
"learning_rate": 4.844e-07,
"loss": -0.03543267250061035,
"num_tokens": 56847.0,
"reward": 0.8531249761581421,
"reward_std": 0.35396517962217333,
"rewards/reward_fn/mean": 0.8531249761581421,
"rewards/reward_fn/std": 0.3539652034640312,
"step": 40,
"step_time": 7.049018428754062
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 108.2,
"completions/max_terminated_length": 108.2,
"completions/mean_length": 27.10625,
"completions/mean_terminated_length": 27.10625,
"completions/min_length": 16.7,
"completions/min_terminated_length": 16.7,
"entropy": 0.5995874460786581,
"epoch": 0.04,
"frac_reward_zero_std": 0.525,
"grad_norm": 8.617820739746094,
"learning_rate": 4.804e-07,
"loss": 0.062236183881759645,
"num_tokens": 69272.0,
"reward": 0.9143749713897705,
"reward_std": 0.35480276346206663,
"rewards/reward_fn/mean": 0.9143749713897705,
"rewards/reward_fn/std": 0.35480278730392456,
"step": 50,
"step_time": 6.082800254039467
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 53.2,
"completions/max_terminated_length": 53.2,
"completions/mean_length": 23.50625,
"completions/mean_terminated_length": 23.50625,
"completions/min_length": 17.5,
"completions/min_terminated_length": 17.5,
"entropy": 0.6239847084507346,
"epoch": 0.048,
"frac_reward_zero_std": 0.7,
"grad_norm": 8.013570785522461,
"learning_rate": 4.7639999999999995e-07,
"loss": -0.007780641317367554,
"num_tokens": 81493.0,
"reward": 0.8724999845027923,
"reward_std": 0.23893336951732635,
"rewards/reward_fn/mean": 0.8724999845027923,
"rewards/reward_fn/std": 0.23893338441848755,
"step": 60,
"step_time": 3.830377937294543
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 47.5,
"completions/max_terminated_length": 47.5,
"completions/mean_length": 21.3125,
"completions/mean_terminated_length": 21.3125,
"completions/min_length": 17.1,
"completions/min_terminated_length": 17.1,
"entropy": 0.526786202006042,
"epoch": 0.056,
"frac_reward_zero_std": 0.8,
"grad_norm": 6.611401081085205,
"learning_rate": 4.7239999999999997e-07,
"loss": 0.0007052101194858551,
"num_tokens": 92903.0,
"reward": 0.954999977350235,
"reward_std": 0.30052519142627715,
"rewards/reward_fn/mean": 0.954999977350235,
"rewards/reward_fn/std": 0.30052521228790285,
"step": 70,
"step_time": 3.6160760662984104
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00625,
"completions/max_length": 201.9,
"completions/max_terminated_length": 112.8,
"completions/mean_length": 34.225,
"completions/mean_terminated_length": 28.01541690826416,
"completions/min_length": 17.3,
"completions/min_terminated_length": 17.3,
"entropy": 0.6730542730540037,
"epoch": 0.064,
"frac_reward_zero_std": 0.725,
"grad_norm": 8.44511890411377,
"learning_rate": 4.684e-07,
"loss": 0.19833827018737793,
"num_tokens": 106795.0,
"reward": 0.8831249833106994,
"reward_std": 0.2491457238793373,
"rewards/reward_fn/mean": 0.8831249833106994,
"rewards/reward_fn/std": 0.24914574027061462,
"step": 80,
"step_time": 10.088793818978592
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 171.4,
"completions/max_terminated_length": 171.4,
"completions/mean_length": 30.21875,
"completions/mean_terminated_length": 30.21875,
"completions/min_length": 17.7,
"completions/min_terminated_length": 17.7,
"entropy": 0.5667739075608551,
"epoch": 0.072,
"frac_reward_zero_std": 0.9,
"grad_norm": 0.0,
"learning_rate": 4.6439999999999995e-07,
"loss": 0.002179677784442902,
"num_tokens": 119930.0,
"reward": 0.9687499701976776,
"reward_std": 0.2984331727027893,
"rewards/reward_fn/mean": 0.9687499701976776,
"rewards/reward_fn/std": 0.2984331905841827,
"step": 90,
"step_time": 8.863318855362014
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 74.8,
"completions/max_terminated_length": 74.8,
"completions/mean_length": 23.96875,
"completions/mean_terminated_length": 23.96875,
"completions/min_length": 17.8,
"completions/min_terminated_length": 17.8,
"entropy": 0.494637239864096,
"epoch": 0.08,
"frac_reward_zero_std": 0.925,
"grad_norm": 0.0,
"learning_rate": 4.6039999999999997e-07,
"loss": 0.001673000119626522,
"num_tokens": 131773.0,
"reward": 0.971874988079071,
"reward_std": 0.1934887498617172,
"rewards/reward_fn/mean": 0.971874988079071,
"rewards/reward_fn/std": 0.19348875880241395,
"step": 100,
"step_time": 4.718112504808232
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 46.2,
"completions/max_terminated_length": 46.2,
"completions/mean_length": 21.71875,
"completions/mean_terminated_length": 21.71875,
"completions/min_length": 17.2,
"completions/min_terminated_length": 17.2,
"entropy": 0.44686332195997236,
"epoch": 0.088,
"frac_reward_zero_std": 0.8,
"grad_norm": 0.0,
"learning_rate": 4.5639999999999993e-07,
"loss": 0.007064198702573776,
"num_tokens": 143140.0,
"reward": 0.9249999701976777,
"reward_std": 0.2545803815126419,
"rewards/reward_fn/mean": 0.9249999701976777,
"rewards/reward_fn/std": 0.2545804023742676,
"step": 110,
"step_time": 3.6042728299740703
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 25.2,
"completions/max_terminated_length": 25.2,
"completions/mean_length": 19.40625,
"completions/mean_terminated_length": 19.40625,
"completions/min_length": 17.1,
"completions/min_terminated_length": 17.1,
"entropy": 0.3366036908584647,
"epoch": 0.096,
"frac_reward_zero_std": 0.775,
"grad_norm": 13.464982986450195,
"learning_rate": 4.524e-07,
"loss": -0.0006624836474657059,
"num_tokens": 154305.0,
"reward": 1.0399999618530273,
"reward_std": 0.34495194256305695,
"rewards/reward_fn/mean": 1.0399999618530273,
"rewards/reward_fn/std": 0.34495197534561156,
"step": 120,
"step_time": 2.747153246589005
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 29.3,
"completions/max_terminated_length": 29.3,
"completions/mean_length": 19.65625,
"completions/mean_terminated_length": 19.65625,
"completions/min_length": 17.2,
"completions/min_terminated_length": 17.2,
"entropy": 0.36671050266595556,
"epoch": 0.104,
"frac_reward_zero_std": 0.8,
"grad_norm": 0.0,
"learning_rate": 4.484e-07,
"loss": 0.017103588581085204,
"num_tokens": 165738.0,
"reward": 0.9574999690055848,
"reward_std": 0.3057817339897156,
"rewards/reward_fn/mean": 0.9574999690055848,
"rewards/reward_fn/std": 0.305781751871109,
"step": 130,
"step_time": 2.903817686345428
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 31.8,
"completions/max_terminated_length": 31.8,
"completions/mean_length": 19.84375,
"completions/mean_terminated_length": 19.84375,
"completions/min_length": 17.4,
"completions/min_terminated_length": 17.4,
"entropy": 0.35206709057092667,
"epoch": 0.112,
"frac_reward_zero_std": 0.75,
"grad_norm": 0.0,
"learning_rate": 4.444e-07,
"loss": 0.0023837201297283173,
"num_tokens": 177529.0,
"reward": 1.003124976158142,
"reward_std": 0.27038749754428865,
"rewards/reward_fn/mean": 1.003124976158142,
"rewards/reward_fn/std": 0.27038750648498533,
"step": 140,
"step_time": 2.9909598857630044
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 33.7,
"completions/max_terminated_length": 33.7,
"completions/mean_length": 20.18125,
"completions/mean_terminated_length": 20.18125,
"completions/min_length": 17.4,
"completions/min_terminated_length": 17.4,
"entropy": 0.34009722527116537,
"epoch": 0.12,
"frac_reward_zero_std": 0.825,
"grad_norm": 4.034805774688721,
"learning_rate": 4.404e-07,
"loss": 0.005604463815689087,
"num_tokens": 188954.0,
"reward": 0.9499999761581421,
"reward_std": 0.25686181485652926,
"rewards/reward_fn/mean": 0.9499999761581421,
"rewards/reward_fn/std": 0.25686182677745817,
"step": 150,
"step_time": 3.0971988524775953
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 64.1,
"completions/max_terminated_length": 64.1,
"completions/mean_length": 22.725,
"completions/mean_terminated_length": 22.725,
"completions/min_length": 17.1,
"completions/min_terminated_length": 17.1,
"entropy": 0.3341391346533783,
"epoch": 0.128,
"frac_reward_zero_std": 0.75,
"grad_norm": 3.904665946960449,
"learning_rate": 4.364e-07,
"loss": 0.0010127602145075798,
"num_tokens": 200770.0,
"reward": 1.0562499642372132,
"reward_std": 0.3720459073781967,
"rewards/reward_fn/mean": 1.0562499642372132,
"rewards/reward_fn/std": 0.37204593122005464,
"step": 160,
"step_time": 4.2844222981948406
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 60.1,
"completions/max_terminated_length": 60.1,
"completions/mean_length": 21.50625,
"completions/mean_terminated_length": 21.50625,
"completions/min_length": 17.4,
"completions/min_terminated_length": 17.4,
"entropy": 0.3025246943347156,
"epoch": 0.136,
"frac_reward_zero_std": 0.8,
"grad_norm": 5.239154815673828,
"learning_rate": 4.324e-07,
"loss": -0.0667100191116333,
"num_tokens": 212767.0,
"reward": 0.9624999642372132,
"reward_std": 0.2936569094657898,
"rewards/reward_fn/mean": 0.9624999642372132,
"rewards/reward_fn/std": 0.2936569362878799,
"step": 170,
"step_time": 4.151584721263498
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 189.7,
"completions/max_terminated_length": 189.7,
"completions/mean_length": 32.33125,
"completions/mean_terminated_length": 32.33125,
"completions/min_length": 17.6,
"completions/min_terminated_length": 17.6,
"entropy": 0.38091158121824265,
"epoch": 0.144,
"frac_reward_zero_std": 0.825,
"grad_norm": 8.872406005859375,
"learning_rate": 4.284e-07,
"loss": -0.008929825574159621,
"num_tokens": 225856.0,
"reward": 1.0249999642372132,
"reward_std": 0.3340115398168564,
"rewards/reward_fn/mean": 1.0249999642372132,
"rewards/reward_fn/std": 0.33401156663894654,
"step": 180,
"step_time": 9.366582131106407
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 355.7,
"completions/max_terminated_length": 355.7,
"completions/mean_length": 68.725,
"completions/mean_terminated_length": 68.725,
"completions/min_length": 17.5,
"completions/min_terminated_length": 17.5,
"entropy": 0.5331769159063697,
"epoch": 0.152,
"frac_reward_zero_std": 0.75,
"grad_norm": 0.0,
"learning_rate": 4.2439999999999996e-07,
"loss": 0.05694311261177063,
"num_tokens": 245108.0,
"reward": 0.9968749701976776,
"reward_std": 0.30177369713783264,
"rewards/reward_fn/mean": 0.9968749701976776,
"rewards/reward_fn/std": 0.3017737179994583,
"step": 190,
"step_time": 16.25606108647771
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 231.7,
"completions/max_terminated_length": 231.7,
"completions/mean_length": 39.475,
"completions/mean_terminated_length": 39.475,
"completions/min_length": 17.6,
"completions/min_terminated_length": 17.6,
"entropy": 0.32137000167858787,
"epoch": 0.16,
"frac_reward_zero_std": 0.675,
"grad_norm": 6.173330307006836,
"learning_rate": 4.204e-07,
"loss": -0.10696818828582763,
"num_tokens": 259512.0,
"reward": 1.012499952316284,
"reward_std": 0.3910213738679886,
"rewards/reward_fn/mean": 1.012499952316284,
"rewards/reward_fn/std": 0.39102140367031096,
"step": 200,
"step_time": 11.044270927784964
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 314.0,
"completions/max_terminated_length": 314.0,
"completions/mean_length": 40.30625,
"completions/mean_terminated_length": 40.30625,
"completions/min_length": 17.1,
"completions/min_terminated_length": 17.1,
"entropy": 0.3382976199500263,
"epoch": 0.168,
"frac_reward_zero_std": 0.775,
"grad_norm": 12.670361518859863,
"learning_rate": 4.164e-07,
"loss": 0.05056280493736267,
"num_tokens": 274317.0,
"reward": 1.0124999582767487,
"reward_std": 0.37820068299770354,
"rewards/reward_fn/mean": 1.0124999582767487,
"rewards/reward_fn/std": 0.37820071876049044,
"step": 210,
"step_time": 14.444551136810333
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 94.8,
"completions/max_terminated_length": 94.8,
"completions/mean_length": 24.9375,
"completions/mean_terminated_length": 24.9375,
"completions/min_length": 17.5,
"completions/min_terminated_length": 17.5,
"entropy": 0.2844417320564389,
"epoch": 0.176,
"frac_reward_zero_std": 0.75,
"grad_norm": 11.695199966430664,
"learning_rate": 4.1239999999999996e-07,
"loss": 0.012198887765407562,
"num_tokens": 286943.0,
"reward": 0.9874999761581421,
"reward_std": 0.2448488086462021,
"rewards/reward_fn/mean": 0.9874999761581421,
"rewards/reward_fn/std": 0.24484881460666658,
"step": 220,
"step_time": 5.559161439398304
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 103.9,
"completions/max_terminated_length": 103.9,
"completions/mean_length": 29.1125,
"completions/mean_terminated_length": 29.1125,
"completions/min_length": 16.6,
"completions/min_terminated_length": 16.6,
"entropy": 0.31354843971785157,
"epoch": 0.184,
"frac_reward_zero_std": 0.775,
"grad_norm": 7.898475646972656,
"learning_rate": 4.084e-07,
"loss": -0.01266075372695923,
"num_tokens": 299829.0,
"reward": 0.9837499558925629,
"reward_std": 0.35773794949054716,
"rewards/reward_fn/mean": 0.9837499558925629,
"rewards/reward_fn/std": 0.3577379733324051,
"step": 230,
"step_time": 5.904518230678514
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 70.4,
"completions/max_terminated_length": 70.4,
"completions/mean_length": 24.5625,
"completions/mean_terminated_length": 24.5625,
"completions/min_length": 17.6,
"completions/min_terminated_length": 17.6,
"entropy": 0.24243622907670215,
"epoch": 0.192,
"frac_reward_zero_std": 0.775,
"grad_norm": 0.0,
"learning_rate": 4.0439999999999994e-07,
"loss": -0.022087261080741882,
"num_tokens": 312139.0,
"reward": 1.081249964237213,
"reward_std": 0.3463846206665039,
"rewards/reward_fn/mean": 1.081249964237213,
"rewards/reward_fn/std": 0.3463846266269684,
"step": 240,
"step_time": 4.509387341840193
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 85.0,
"completions/max_terminated_length": 85.0,
"completions/mean_length": 30.96875,
"completions/mean_terminated_length": 30.96875,
"completions/min_length": 17.7,
"completions/min_terminated_length": 17.7,
"entropy": 0.2872183081228286,
"epoch": 0.2,
"frac_reward_zero_std": 0.875,
"grad_norm": 0.0,
"learning_rate": 4.0039999999999996e-07,
"loss": 0.0037321031093597414,
"num_tokens": 325758.0,
"reward": 0.9562499642372131,
"reward_std": 0.31391805708408355,
"rewards/reward_fn/mean": 0.9562499642372131,
"rewards/reward_fn/std": 0.3139180839061737,
"step": 250,
"step_time": 5.160763737838716
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 127.1,
"completions/max_terminated_length": 127.1,
"completions/mean_length": 29.21875,
"completions/mean_terminated_length": 29.21875,
"completions/min_length": 17.4,
"completions/min_terminated_length": 17.4,
"entropy": 0.23362355224089698,
"epoch": 0.208,
"frac_reward_zero_std": 0.85,
"grad_norm": 6.962454795837402,
"learning_rate": 3.964e-07,
"loss": 0.028215166926383973,
"num_tokens": 338481.0,
"reward": 1.0999999582767486,
"reward_std": 0.42081114947795867,
"rewards/reward_fn/mean": 1.0999999582767486,
"rewards/reward_fn/std": 0.4208111733198166,
"step": 260,
"step_time": 6.7953305871225895
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 116.8,
"completions/max_terminated_length": 116.8,
"completions/mean_length": 30.49375,
"completions/mean_terminated_length": 30.49375,
"completions/min_length": 17.5,
"completions/min_terminated_length": 17.5,
"entropy": 0.2725491218268871,
"epoch": 0.216,
"frac_reward_zero_std": 0.725,
"grad_norm": 5.130438327789307,
"learning_rate": 3.924e-07,
"loss": -0.05285842418670654,
"num_tokens": 351340.0,
"reward": 0.9593749642372131,
"reward_std": 0.30626748204231263,
"rewards/reward_fn/mean": 0.9593749642372131,
"rewards/reward_fn/std": 0.3062675029039383,
"step": 270,
"step_time": 6.392075706832111
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 231.2,
"completions/max_terminated_length": 231.2,
"completions/mean_length": 38.7625,
"completions/mean_terminated_length": 38.7625,
"completions/min_length": 17.2,
"completions/min_terminated_length": 17.2,
"entropy": 0.28721734539140015,
"epoch": 0.224,
"frac_reward_zero_std": 0.825,
"grad_norm": 0.0,
"learning_rate": 3.884e-07,
"loss": -0.011222265660762787,
"num_tokens": 365774.0,
"reward": 0.9218749761581421,
"reward_std": 0.25241841971874235,
"rewards/reward_fn/mean": 0.9218749761581421,
"rewards/reward_fn/std": 0.2524184435606003,
"step": 280,
"step_time": 11.114369830535725
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 255.9,
"completions/max_terminated_length": 255.9,
"completions/mean_length": 41.78125,
"completions/mean_terminated_length": 41.78125,
"completions/min_length": 17.4,
"completions/min_terminated_length": 17.4,
"entropy": 0.28078931191121226,
"epoch": 0.232,
"frac_reward_zero_std": 0.75,
"grad_norm": 0.0,
"learning_rate": 3.8440000000000003e-07,
"loss": -0.07034780383110047,
"num_tokens": 380923.0,
"reward": 0.9999999582767487,
"reward_std": 0.35158316493034364,
"rewards/reward_fn/mean": 0.9999999582767487,
"rewards/reward_fn/std": 0.3515831857919693,
"step": 290,
"step_time": 11.978949176566676
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 331.5,
"completions/max_terminated_length": 331.5,
"completions/mean_length": 78.25625,
"completions/mean_terminated_length": 78.25625,
"completions/min_length": 17.4,
"completions/min_terminated_length": 17.4,
"entropy": 0.34983569611795245,
"epoch": 0.24,
"frac_reward_zero_std": 0.8,
"grad_norm": 6.399377822875977,
"learning_rate": 3.804e-07,
"loss": -0.0407560795545578,
"num_tokens": 401460.0,
"reward": 0.9374999701976776,
"reward_std": 0.25913873612880706,
"rewards/reward_fn/mean": 0.9374999701976776,
"rewards/reward_fn/std": 0.2591387540102005,
"step": 300,
"step_time": 15.129521024413407
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 461.6,
"completions/max_terminated_length": 461.6,
"completions/mean_length": 151.96875,
"completions/mean_terminated_length": 151.96875,
"completions/min_length": 25.0,
"completions/min_terminated_length": 25.0,
"entropy": 0.568750799074769,
"epoch": 0.248,
"frac_reward_zero_std": 0.75,
"grad_norm": 1.8816224336624146,
"learning_rate": 3.764e-07,
"loss": 0.01563715487718582,
"num_tokens": 434015.0,
"reward": 0.9343749523162842,
"reward_std": 0.3420647859573364,
"rewards/reward_fn/mean": 0.9343749523162842,
"rewards/reward_fn/std": 0.3420648217201233,
"step": 310,
"step_time": 21.686344171082602
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 465.6,
"completions/max_terminated_length": 465.6,
"completions/mean_length": 160.825,
"completions/mean_terminated_length": 160.825,
"completions/min_length": 17.6,
"completions/min_terminated_length": 17.6,
"entropy": 0.5512657368555665,
"epoch": 0.256,
"frac_reward_zero_std": 0.75,
"grad_norm": 1.9943861961364746,
"learning_rate": 3.7239999999999997e-07,
"loss": 0.02993807792663574,
"num_tokens": 468327.0,
"reward": 1.0312499523162841,
"reward_std": 0.4049929678440094,
"rewards/reward_fn/mean": 1.0312499523162841,
"rewards/reward_fn/std": 0.404993000626564,
"step": 320,
"step_time": 20.60081666558981
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 409.4,
"completions/max_terminated_length": 409.4,
"completions/mean_length": 139.36875,
"completions/mean_terminated_length": 139.36875,
"completions/min_length": 17.9,
"completions/min_terminated_length": 17.9,
"entropy": 0.4664949773345143,
"epoch": 0.264,
"frac_reward_zero_std": 0.8,
"grad_norm": 3.3355984687805176,
"learning_rate": 3.684e-07,
"loss": -0.015160781145095826,
"num_tokens": 498934.0,
"reward": 1.1312499642372131,
"reward_std": 0.3833997189998627,
"rewards/reward_fn/mean": 1.1312499642372131,
"rewards/reward_fn/std": 0.38339973986148834,
"step": 330,
"step_time": 18.231197547214105
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0125,
"completions/max_length": 521.8,
"completions/max_terminated_length": 471.9,
"completions/mean_length": 219.0875,
"completions/mean_terminated_length": 209.3812515258789,
"completions/min_length": 26.7,
"completions/min_terminated_length": 26.7,
"entropy": 0.5834914448671042,
"epoch": 0.272,
"frac_reward_zero_std": 0.625,
"grad_norm": 2.5507986545562744,
"learning_rate": 3.644e-07,
"loss": 0.030872175097465517,
"num_tokens": 541844.0,
"reward": 1.0062499642372131,
"reward_std": 0.35398963987827303,
"rewards/reward_fn/mean": 1.0062499642372131,
"rewards/reward_fn/std": 0.35398967415094373,
"step": 340,
"step_time": 23.158983804937453
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 589.9,
"completions/max_terminated_length": 589.9,
"completions/mean_length": 213.15,
"completions/mean_terminated_length": 213.15,
"completions/min_length": 19.7,
"completions/min_terminated_length": 19.7,
"entropy": 0.5913283064961433,
"epoch": 0.28,
"frac_reward_zero_std": 0.725,
"grad_norm": 0.0,
"learning_rate": 3.6039999999999997e-07,
"loss": 0.01863671690225601,
"num_tokens": 584100.0,
"reward": 0.974999976158142,
"reward_std": 0.29154602289199827,
"rewards/reward_fn/mean": 0.974999976158142,
"rewards/reward_fn/std": 0.29154603481292723,
"step": 350,
"step_time": 25.847512384923174
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00625,
"completions/max_length": 596.0,
"completions/max_terminated_length": 553.3,
"completions/mean_length": 166.5875,
"completions/mean_terminated_length": 161.59166717529297,
"completions/min_length": 18.1,
"completions/min_terminated_length": 18.1,
"entropy": 0.5305257711559535,
"epoch": 0.288,
"frac_reward_zero_std": 0.7,
"grad_norm": 1.6829164028167725,
"learning_rate": 3.564e-07,
"loss": 0.009494951367378235,
"num_tokens": 619034.0,
"reward": 0.9218749582767487,
"reward_std": 0.30490350127220156,
"rewards/reward_fn/mean": 0.9218749582767487,
"rewards/reward_fn/std": 0.30490352809429166,
"step": 360,
"step_time": 26.364935595309362
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0125,
"completions/max_length": 623.8,
"completions/max_terminated_length": 538.2,
"completions/mean_length": 224.5,
"completions/mean_terminated_length": 214.15750122070312,
"completions/min_length": 51.2,
"completions/min_terminated_length": 51.2,
"entropy": 0.5600679079070687,
"epoch": 0.296,
"frac_reward_zero_std": 0.575,
"grad_norm": 2.4058868885040283,
"learning_rate": 3.5239999999999995e-07,
"loss": 0.059442996978759766,
"num_tokens": 662946.0,
"reward": 1.0337499618530273,
"reward_std": 0.3860698252916336,
"rewards/reward_fn/mean": 1.0337499618530273,
"rewards/reward_fn/std": 0.38606984317302706,
"step": 370,
"step_time": 27.650598523486405
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 471.4,
"completions/max_terminated_length": 471.4,
"completions/mean_length": 211.99375,
"completions/mean_terminated_length": 211.99375,
"completions/min_length": 39.4,
"completions/min_terminated_length": 39.4,
"entropy": 0.523330201394856,
"epoch": 0.304,
"frac_reward_zero_std": 0.8,
"grad_norm": 1.523726463317871,
"learning_rate": 3.4839999999999997e-07,
"loss": -0.017889173328876497,
"num_tokens": 705285.0,
"reward": 0.9249999701976777,
"reward_std": 0.25987376272678375,
"rewards/reward_fn/mean": 0.9249999701976777,
"rewards/reward_fn/std": 0.2598737746477127,
"step": 380,
"step_time": 20.896892397897318
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00625,
"completions/max_length": 584.2,
"completions/max_terminated_length": 520.2,
"completions/mean_length": 251.1375,
"completions/mean_terminated_length": 246.00750122070312,
"completions/min_length": 62.2,
"completions/min_terminated_length": 62.2,
"entropy": 0.5894505500793457,
"epoch": 0.312,
"frac_reward_zero_std": 0.575,
"grad_norm": 2.648047685623169,
"learning_rate": 3.444e-07,
"loss": 0.056687426567077634,
"num_tokens": 753319.0,
"reward": 1.0999999523162842,
"reward_std": 0.4478457897901535,
"rewards/reward_fn/mean": 1.0999999523162842,
"rewards/reward_fn/std": 0.4478458106517792,
"step": 390,
"step_time": 25.831602280260995
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 555.9,
"completions/max_terminated_length": 555.9,
"completions/mean_length": 243.40625,
"completions/mean_terminated_length": 243.40625,
"completions/min_length": 40.4,
"completions/min_terminated_length": 40.4,
"entropy": 0.5201437229756266,
"epoch": 0.32,
"frac_reward_zero_std": 0.675,
"grad_norm": 0.0,
"learning_rate": 3.4039999999999995e-07,
"loss": 0.021798035502433775,
"num_tokens": 800348.0,
"reward": 1.0062499582767486,
"reward_std": 0.37394005358219146,
"rewards/reward_fn/mean": 1.0062499582767486,
"rewards/reward_fn/std": 0.3739400714635849,
"step": 400,
"step_time": 24.329527226556092
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0125,
"completions/max_length": 613.3,
"completions/max_terminated_length": 534.9,
"completions/mean_length": 244.41875,
"completions/mean_terminated_length": 234.8495864868164,
"completions/min_length": 35.6,
"completions/min_terminated_length": 35.6,
"entropy": 0.5379184504970909,
"epoch": 0.328,
"frac_reward_zero_std": 0.75,
"grad_norm": 2.274796962738037,
"learning_rate": 3.3639999999999997e-07,
"loss": 0.06314390301704406,
"num_tokens": 847859.0,
"reward": 0.9687499582767487,
"reward_std": 0.35331138372421267,
"rewards/reward_fn/mean": 0.9687499582767487,
"rewards/reward_fn/std": 0.35331140756607055,
"step": 410,
"step_time": 27.114492582622916
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00625,
"completions/max_length": 594.1,
"completions/max_terminated_length": 562.2,
"completions/mean_length": 268.15,
"completions/mean_terminated_length": 264.0933349609375,
"completions/min_length": 31.0,
"completions/min_terminated_length": 31.0,
"entropy": 0.5545548873022199,
"epoch": 0.336,
"frac_reward_zero_std": 0.625,
"grad_norm": 3.0214762687683105,
"learning_rate": 3.3239999999999993e-07,
"loss": 0.0016927286982536317,
"num_tokens": 899211.0,
"reward": 1.0531249523162842,
"reward_std": 0.4457359969615936,
"rewards/reward_fn/mean": 1.0531249523162842,
"rewards/reward_fn/std": 0.44573602378368377,
"step": 420,
"step_time": 26.21310900649987
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 566.0,
"completions/max_terminated_length": 566.0,
"completions/mean_length": 237.33125,
"completions/mean_terminated_length": 237.33125,
"completions/min_length": 43.4,
"completions/min_terminated_length": 43.4,
"entropy": 0.4608824389986694,
"epoch": 0.344,
"frac_reward_zero_std": 0.675,
"grad_norm": 2.376124858856201,
"learning_rate": 3.284e-07,
"loss": 0.002047058567404747,
"num_tokens": 945568.0,
"reward": 1.2124999523162843,
"reward_std": 0.4772857129573822,
"rewards/reward_fn/mean": 1.2124999523162843,
"rewards/reward_fn/std": 0.47728572487831117,
"step": 430,
"step_time": 24.91375301098451
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0125,
"completions/max_length": 620.7,
"completions/max_terminated_length": 519.3,
"completions/mean_length": 221.89375,
"completions/mean_terminated_length": 212.0312515258789,
"completions/min_length": 18.3,
"completions/min_terminated_length": 18.3,
"entropy": 0.45621285401284695,
"epoch": 0.352,
"frac_reward_zero_std": 0.725,
"grad_norm": 0.0,
"learning_rate": 3.244e-07,
"loss": 0.03366280496120453,
"num_tokens": 989283.0,
"reward": 1.0374999582767486,
"reward_std": 0.37986487746238706,
"rewards/reward_fn/mean": 1.0374999582767486,
"rewards/reward_fn/std": 0.37986490726470945,
"step": 440,
"step_time": 27.54319058242254
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00625,
"completions/max_length": 526.3,
"completions/max_terminated_length": 470.2,
"completions/mean_length": 237.4625,
"completions/mean_terminated_length": 232.41791839599608,
"completions/min_length": 55.9,
"completions/min_terminated_length": 55.9,
"entropy": 0.4685343712568283,
"epoch": 0.36,
"frac_reward_zero_std": 0.8,
"grad_norm": 2.073087692260742,
"learning_rate": 3.204e-07,
"loss": 0.008559707552194595,
"num_tokens": 1035581.0,
"reward": 1.0281249642372132,
"reward_std": 0.3265856146812439,
"rewards/reward_fn/mean": 1.0281249642372132,
"rewards/reward_fn/std": 0.32658563554286957,
"step": 450,
"step_time": 23.314190701860934
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 491.8,
"completions/max_terminated_length": 491.8,
"completions/mean_length": 263.15,
"completions/mean_terminated_length": 263.15,
"completions/min_length": 88.6,
"completions/min_terminated_length": 88.6,
"entropy": 0.5305897884070874,
"epoch": 0.368,
"frac_reward_zero_std": 0.675,
"grad_norm": 1.9565300941467285,
"learning_rate": 3.164e-07,
"loss": 0.028019136190414427,
"num_tokens": 1086409.0,
"reward": 1.093749964237213,
"reward_std": 0.3530050367116928,
"rewards/reward_fn/mean": 1.093749964237213,
"rewards/reward_fn/std": 0.35300505757331846,
"step": 460,
"step_time": 21.788672981457786
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00625,
"completions/max_length": 585.6,
"completions/max_terminated_length": 549.8,
"completions/mean_length": 269.5,
"completions/mean_terminated_length": 264.71583557128906,
"completions/min_length": 81.6,
"completions/min_terminated_length": 81.6,
"entropy": 0.5114285530522465,
"epoch": 0.376,
"frac_reward_zero_std": 0.525,
"grad_norm": 2.9088966846466064,
"learning_rate": 3.124e-07,
"loss": 0.05687993168830872,
"num_tokens": 1137953.0,
"reward": 1.1312499582767486,
"reward_std": 0.42567238211631775,
"rewards/reward_fn/mean": 1.1312499582767486,
"rewards/reward_fn/std": 0.4256723940372467,
"step": 470,
"step_time": 25.771493053948507
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 545.3,
"completions/max_terminated_length": 545.3,
"completions/mean_length": 252.63125,
"completions/mean_terminated_length": 252.63125,
"completions/min_length": 44.2,
"completions/min_terminated_length": 44.2,
"entropy": 0.5523815616965294,
"epoch": 0.384,
"frac_reward_zero_std": 0.775,
"grad_norm": 0.0,
"learning_rate": 3.084e-07,
"loss": 0.023237675428390503,
"num_tokens": 1186658.0,
"reward": 1.0437499582767487,
"reward_std": 0.38032626211643217,
"rewards/reward_fn/mean": 1.0437499582767487,
"rewards/reward_fn/std": 0.3803262859582901,
"step": 480,
"step_time": 23.983928591478616
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 523.6,
"completions/max_terminated_length": 523.6,
"completions/mean_length": 243.5875,
"completions/mean_terminated_length": 243.5875,
"completions/min_length": 57.4,
"completions/min_terminated_length": 57.4,
"entropy": 0.5340582400560379,
"epoch": 0.392,
"frac_reward_zero_std": 0.75,
"grad_norm": 5.369383335113525,
"learning_rate": 3.044e-07,
"loss": 0.031129142642021178,
"num_tokens": 1234168.0,
"reward": 1.1312499701976777,
"reward_std": 0.2945299968123436,
"rewards/reward_fn/mean": 1.1312499701976777,
"rewards/reward_fn/std": 0.29453000277280805,
"step": 490,
"step_time": 23.040811748150738
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 554.0,
"completions/max_terminated_length": 554.0,
"completions/mean_length": 229.5125,
"completions/mean_terminated_length": 229.5125,
"completions/min_length": 25.8,
"completions/min_terminated_length": 25.8,
"entropy": 0.5556849464774132,
"epoch": 0.4,
"frac_reward_zero_std": 0.825,
"grad_norm": 0.0,
"learning_rate": 3.0039999999999996e-07,
"loss": 0.012525177001953125,
"num_tokens": 1279254.0,
"reward": 1.0749999642372132,
"reward_std": 0.32434508502483367,
"rewards/reward_fn/mean": 1.0749999642372132,
"rewards/reward_fn/std": 0.3243451029062271,
"step": 500,
"step_time": 24.467384714726357
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00625,
"completions/max_length": 610.0,
"completions/max_terminated_length": 546.3,
"completions/mean_length": 225.625,
"completions/mean_terminated_length": 220.79625091552734,
"completions/min_length": 41.8,
"completions/min_terminated_length": 41.8,
"entropy": 0.5509622530080378,
"epoch": 0.408,
"frac_reward_zero_std": 0.7,
"grad_norm": 0.0,
"learning_rate": 2.964e-07,
"loss": 0.06597378849983215,
"num_tokens": 1323630.0,
"reward": 0.9843749582767487,
"reward_std": 0.35697369575500487,
"rewards/reward_fn/mean": 0.9843749582767487,
"rewards/reward_fn/std": 0.3569737136363983,
"step": 510,
"step_time": 26.97945318124257
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00625,
"completions/max_length": 546.9,
"completions/max_terminated_length": 496.5,
"completions/mean_length": 213.04375,
"completions/mean_terminated_length": 208.10416717529296,
"completions/min_length": 28.9,
"completions/min_terminated_length": 28.9,
"entropy": 0.5530080372467637,
"epoch": 0.416,
"frac_reward_zero_std": 0.8,
"grad_norm": 0.0,
"learning_rate": 2.924e-07,
"loss": 0.020942620933055878,
"num_tokens": 1365517.0,
"reward": 0.9343749701976776,
"reward_std": 0.27816103398799896,
"rewards/reward_fn/mean": 0.9343749701976776,
"rewards/reward_fn/std": 0.2781610548496246,
"step": 520,
"step_time": 24.255431303568184
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0125,
"completions/max_length": 568.6,
"completions/max_terminated_length": 523.8,
"completions/mean_length": 182.9625,
"completions/mean_terminated_length": 173.29708557128907,
"completions/min_length": 18.0,
"completions/min_terminated_length": 18.0,
"entropy": 0.5604467433411628,
"epoch": 0.424,
"frac_reward_zero_std": 0.75,
"grad_norm": 5.100892066955566,
"learning_rate": 2.8839999999999996e-07,
"loss": 0.050272423028945926,
"num_tokens": 1402911.0,
"reward": 0.8937499821186066,
"reward_std": 0.20596824288368226,
"rewards/reward_fn/mean": 0.8937499821186066,
"rewards/reward_fn/std": 0.2059682548046112,
"step": 530,
"step_time": 25.345189223485068
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 388.3,
"completions/max_terminated_length": 388.3,
"completions/mean_length": 162.04375,
"completions/mean_terminated_length": 162.04375,
"completions/min_length": 36.9,
"completions/min_terminated_length": 36.9,
"entropy": 0.5442286553792656,
"epoch": 0.432,
"frac_reward_zero_std": 0.825,
"grad_norm": 4.153268814086914,
"learning_rate": 2.844e-07,
"loss": -0.00437091588973999,
"num_tokens": 1437314.0,
"reward": 1.093749964237213,
"reward_std": 0.3850394904613495,
"rewards/reward_fn/mean": 1.093749964237213,
"rewards/reward_fn/std": 0.3850395202636719,
"step": 540,
"step_time": 17.517217593453825
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 478.8,
"completions/max_terminated_length": 478.8,
"completions/mean_length": 183.76875,
"completions/mean_terminated_length": 183.76875,
"completions/min_length": 18.3,
"completions/min_terminated_length": 18.3,
"entropy": 0.5666915670037269,
"epoch": 0.44,
"frac_reward_zero_std": 0.8,
"grad_norm": 3.4264976978302,
"learning_rate": 2.804e-07,
"loss": 0.027844130992889404,
"num_tokens": 1475125.0,
"reward": 0.9687499701976776,
"reward_std": 0.2758553087711334,
"rewards/reward_fn/mean": 0.9687499701976776,
"rewards/reward_fn/std": 0.27585532069206237,
"step": 550,
"step_time": 21.227726350305602
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 416.8,
"completions/max_terminated_length": 416.8,
"completions/mean_length": 147.075,
"completions/mean_terminated_length": 147.075,
"completions/min_length": 17.8,
"completions/min_terminated_length": 17.8,
"entropy": 0.49057656023651364,
"epoch": 0.448,
"frac_reward_zero_std": 0.85,
"grad_norm": 3.256361722946167,
"learning_rate": 2.7639999999999996e-07,
"loss": 0.02265160083770752,
"num_tokens": 1506917.0,
"reward": 0.9812499761581421,
"reward_std": 0.2361401915550232,
"rewards/reward_fn/mean": 0.9812499761581421,
"rewards/reward_fn/std": 0.2361402153968811,
"step": 560,
"step_time": 18.685880808066578
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 384.4,
"completions/max_terminated_length": 384.4,
"completions/mean_length": 160.1875,
"completions/mean_terminated_length": 160.1875,
"completions/min_length": 18.3,
"completions/min_terminated_length": 18.3,
"entropy": 0.5117679107002914,
"epoch": 0.456,
"frac_reward_zero_std": 0.8,
"grad_norm": 2.30198073387146,
"learning_rate": 2.724e-07,
"loss": -0.01834808886051178,
"num_tokens": 1540791.0,
"reward": 1.0062499523162842,
"reward_std": 0.3968144774436951,
"rewards/reward_fn/mean": 1.0062499523162842,
"rewards/reward_fn/std": 0.39681450724601747,
"step": 570,
"step_time": 17.398948775697498
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 472.1,
"completions/max_terminated_length": 472.1,
"completions/mean_length": 161.95,
"completions/mean_terminated_length": 161.95,
"completions/min_length": 18.1,
"completions/min_terminated_length": 18.1,
"entropy": 0.47344469791278243,
"epoch": 0.464,
"frac_reward_zero_std": 0.75,
"grad_norm": 2.3436312675476074,
"learning_rate": 2.684e-07,
"loss": -0.026393899321556093,
"num_tokens": 1575619.0,
"reward": 0.9874999761581421,
"reward_std": 0.2700622081756592,
"rewards/reward_fn/mean": 0.9874999761581421,
"rewards/reward_fn/std": 0.27006221413612364,
"step": 580,
"step_time": 20.999267899850384
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00625,
"completions/max_length": 601.7,
"completions/max_terminated_length": 546.1,
"completions/mean_length": 233.43125,
"completions/mean_terminated_length": 228.44708404541015,
"completions/min_length": 47.7,
"completions/min_terminated_length": 47.7,
"entropy": 0.5758602514863014,
"epoch": 0.472,
"frac_reward_zero_std": 0.65,
"grad_norm": 2.945976734161377,
"learning_rate": 2.644e-07,
"loss": 0.0019540391862392426,
"num_tokens": 1621388.0,
"reward": 1.0218749582767486,
"reward_std": 0.3570388913154602,
"rewards/reward_fn/mean": 1.0218749582767486,
"rewards/reward_fn/std": 0.3570389151573181,
"step": 590,
"step_time": 26.790125040663405
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 509.8,
"completions/max_terminated_length": 509.8,
"completions/mean_length": 223.8,
"completions/mean_terminated_length": 223.8,
"completions/min_length": 50.6,
"completions/min_terminated_length": 50.6,
"entropy": 0.5903411463834345,
"epoch": 0.48,
"frac_reward_zero_std": 0.775,
"grad_norm": 2.2895243167877197,
"learning_rate": 2.6040000000000003e-07,
"loss": 0.01556304395198822,
"num_tokens": 1665464.0,
"reward": 1.031249964237213,
"reward_std": 0.3282184362411499,
"rewards/reward_fn/mean": 1.031249964237213,
"rewards/reward_fn/std": 0.32821846306324004,
"step": 600,
"step_time": 22.54900577166118
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 446.0,
"completions/max_terminated_length": 446.0,
"completions/mean_length": 232.44375,
"completions/mean_terminated_length": 232.44375,
"completions/min_length": 68.2,
"completions/min_terminated_length": 68.2,
"entropy": 0.6003101659938693,
"epoch": 0.488,
"frac_reward_zero_std": 0.65,
"grad_norm": 2.4930214881896973,
"learning_rate": 2.564e-07,
"loss": 0.044041958451271054,
"num_tokens": 1711303.0,
"reward": 1.0312499523162841,
"reward_std": 0.3602029472589493,
"rewards/reward_fn/mean": 1.0312499523162841,
"rewards/reward_fn/std": 0.3602029770612717,
"step": 610,
"step_time": 19.94395455373451
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 619.6,
"completions/max_terminated_length": 619.6,
"completions/mean_length": 262.50625,
"completions/mean_terminated_length": 262.50625,
"completions/min_length": 36.9,
"completions/min_terminated_length": 36.9,
"entropy": 0.625312153622508,
"epoch": 0.496,
"frac_reward_zero_std": 0.675,
"grad_norm": 2.5237791538238525,
"learning_rate": 2.524e-07,
"loss": -0.01255713552236557,
"num_tokens": 1761532.0,
"reward": 0.9999999582767487,
"reward_std": 0.3505753219127655,
"rewards/reward_fn/mean": 0.9999999582767487,
"rewards/reward_fn/std": 0.3505753517150879,
"step": 620,
"step_time": 27.551811824087054
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 514.6,
"completions/max_terminated_length": 514.6,
"completions/mean_length": 243.85,
"completions/mean_terminated_length": 243.85,
"completions/min_length": 74.0,
"completions/min_terminated_length": 74.0,
"entropy": 0.5866754692047834,
"epoch": 0.504,
"frac_reward_zero_std": 0.675,
"grad_norm": 2.4999687671661377,
"learning_rate": 2.484e-07,
"loss": 0.015758931636810303,
"num_tokens": 1808952.0,
"reward": 1.0937499582767487,
"reward_std": 0.39699949622154235,
"rewards/reward_fn/mean": 1.0937499582767487,
"rewards/reward_fn/std": 0.39699951112270354,
"step": 630,
"step_time": 22.812671538256108
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00625,
"completions/max_length": 531.3,
"completions/max_terminated_length": 485.5,
"completions/mean_length": 242.3,
"completions/mean_terminated_length": 238.0504180908203,
"completions/min_length": 64.9,
"completions/min_terminated_length": 64.9,
"entropy": 0.6033073195256293,
"epoch": 0.512,
"frac_reward_zero_std": 0.8,
"grad_norm": 0.0,
"learning_rate": 2.444e-07,
"loss": 0.010235734283924103,
"num_tokens": 1856144.0,
"reward": 0.9718749761581421,
"reward_std": 0.26936398148536683,
"rewards/reward_fn/mean": 0.9718749761581421,
"rewards/reward_fn/std": 0.2693639874458313,
"step": 640,
"step_time": 23.65593868405558
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 539.9,
"completions/max_terminated_length": 539.9,
"completions/mean_length": 242.63125,
"completions/mean_terminated_length": 242.63125,
"completions/min_length": 84.8,
"completions/min_terminated_length": 84.8,
"entropy": 0.5526138002052903,
"epoch": 0.52,
"frac_reward_zero_std": 0.675,
"grad_norm": 2.245793342590332,
"learning_rate": 2.404e-07,
"loss": -0.002822137624025345,
"num_tokens": 1903209.0,
"reward": 1.0781249523162841,
"reward_std": 0.43106013536453247,
"rewards/reward_fn/mean": 1.0781249523162841,
"rewards/reward_fn/std": 0.4310601681470871,
"step": 650,
"step_time": 24.121668337099255
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 592.5,
"completions/max_terminated_length": 592.5,
"completions/mean_length": 243.65,
"completions/mean_terminated_length": 243.65,
"completions/min_length": 63.2,
"completions/min_terminated_length": 63.2,
"entropy": 0.557934966403991,
"epoch": 0.528,
"frac_reward_zero_std": 0.8,
"grad_norm": 2.7416722774505615,
"learning_rate": 2.364e-07,
"loss": 0.009367964416742324,
"num_tokens": 1950505.0,
"reward": 0.9874999642372131,
"reward_std": 0.3327379524707794,
"rewards/reward_fn/mean": 0.9874999642372131,
"rewards/reward_fn/std": 0.33273797333240507,
"step": 660,
"step_time": 26.20483476021327
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0125,
"completions/max_length": 606.8,
"completions/max_terminated_length": 487.6,
"completions/mean_length": 262.125,
"completions/mean_terminated_length": 252.27166748046875,
"completions/min_length": 99.2,
"completions/min_terminated_length": 99.2,
"entropy": 0.5527632829733193,
"epoch": 0.536,
"frac_reward_zero_std": 0.75,
"grad_norm": 0.0,
"learning_rate": 2.324e-07,
"loss": 0.03527545630931854,
"num_tokens": 2000653.0,
"reward": 1.0562499582767486,
"reward_std": 0.3691807985305786,
"rewards/reward_fn/mean": 1.0562499582767486,
"rewards/reward_fn/std": 0.3691808253526688,
"step": 670,
"step_time": 27.034338617976754
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 584.8,
"completions/max_terminated_length": 584.8,
"completions/mean_length": 285.025,
"completions/mean_terminated_length": 285.025,
"completions/min_length": 126.6,
"completions/min_terminated_length": 126.6,
"entropy": 0.5860134104266763,
"epoch": 0.544,
"frac_reward_zero_std": 0.775,
"grad_norm": 0.0,
"learning_rate": 2.2839999999999998e-07,
"loss": 0.01230028122663498,
"num_tokens": 2054357.0,
"reward": 1.0124999582767487,
"reward_std": 0.37343316674232485,
"rewards/reward_fn/mean": 1.0124999582767487,
"rewards/reward_fn/std": 0.3734331876039505,
"step": 680,
"step_time": 25.73272733730264
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 535.7,
"completions/max_terminated_length": 535.7,
"completions/mean_length": 258.66875,
"completions/mean_terminated_length": 258.66875,
"completions/min_length": 102.7,
"completions/min_terminated_length": 102.7,
"entropy": 0.5561068987473845,
"epoch": 0.552,
"frac_reward_zero_std": 0.725,
"grad_norm": 2.3947577476501465,
"learning_rate": 2.2439999999999997e-07,
"loss": -0.0206025630235672,
"num_tokens": 2104000.0,
"reward": 1.0562499582767486,
"reward_std": 0.40473316311836244,
"rewards/reward_fn/mean": 1.0562499582767486,
"rewards/reward_fn/std": 0.4047331750392914,
"step": 690,
"step_time": 23.7531999821309
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00625,
"completions/max_length": 543.3,
"completions/max_terminated_length": 508.4,
"completions/mean_length": 255.71875,
"completions/mean_terminated_length": 251.499169921875,
"completions/min_length": 79.4,
"completions/min_terminated_length": 79.4,
"entropy": 0.5383795527275652,
"epoch": 0.56,
"frac_reward_zero_std": 0.675,
"grad_norm": 2.0125722885131836,
"learning_rate": 2.2040000000000001e-07,
"loss": 0.030927711725234987,
"num_tokens": 2153891.0,
"reward": 0.9687499642372132,
"reward_std": 0.31985312402248384,
"rewards/reward_fn/mean": 0.9687499642372132,
"rewards/reward_fn/std": 0.31985313892364503,
"step": 700,
"step_time": 24.29951238576323
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00625,
"completions/max_length": 624.0,
"completions/max_terminated_length": 602.9,
"completions/mean_length": 278.2875,
"completions/mean_terminated_length": 274.3729187011719,
"completions/min_length": 91.9,
"completions/min_terminated_length": 91.9,
"entropy": 0.527317856438458,
"epoch": 0.568,
"frac_reward_zero_std": 0.625,
"grad_norm": 1.9104549884796143,
"learning_rate": 2.164e-07,
"loss": 0.03166455924510956,
"num_tokens": 2206773.0,
"reward": 1.090624952316284,
"reward_std": 0.4429534524679184,
"rewards/reward_fn/mean": 1.090624952316284,
"rewards/reward_fn/std": 0.4429534673690796,
"step": 710,
"step_time": 27.915992458211257
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00625,
"completions/max_length": 548.3,
"completions/max_terminated_length": 527.2,
"completions/mean_length": 273.175,
"completions/mean_terminated_length": 269.2104187011719,
"completions/min_length": 99.8,
"completions/min_terminated_length": 99.8,
"entropy": 0.5130317708477378,
"epoch": 0.576,
"frac_reward_zero_std": 0.7,
"grad_norm": 2.303006410598755,
"learning_rate": 2.124e-07,
"loss": 0.011933594197034835,
"num_tokens": 2258889.0,
"reward": 1.0312499582767487,
"reward_std": 0.39556107819080355,
"rewards/reward_fn/mean": 1.0312499582767487,
"rewards/reward_fn/std": 0.39556109607219697,
"step": 720,
"step_time": 24.53683318160474
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00625,
"completions/max_length": 579.1,
"completions/max_terminated_length": 536.6,
"completions/mean_length": 264.69375,
"completions/mean_terminated_length": 259.7870849609375,
"completions/min_length": 95.5,
"completions/min_terminated_length": 95.5,
"entropy": 0.5283560438081623,
"epoch": 0.584,
"frac_reward_zero_std": 0.75,
"grad_norm": 0.0,
"learning_rate": 2.0839999999999999e-07,
"loss": 0.049981740117073056,
"num_tokens": 2309684.0,
"reward": 1.0218749642372131,
"reward_std": 0.34613644182682035,
"rewards/reward_fn/mean": 1.0218749642372131,
"rewards/reward_fn/std": 0.34613647162914274,
"step": 730,
"step_time": 25.811987762106583
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 547.0,
"completions/max_terminated_length": 547.0,
"completions/mean_length": 241.6,
"completions/mean_terminated_length": 241.6,
"completions/min_length": 64.1,
"completions/min_terminated_length": 64.1,
"entropy": 0.49383773263543845,
"epoch": 0.592,
"frac_reward_zero_std": 0.7,
"grad_norm": 2.562471628189087,
"learning_rate": 2.0439999999999998e-07,
"loss": 0.028516930341720582,
"num_tokens": 2356300.0,
"reward": 1.0249999701976775,
"reward_std": 0.3171436250209808,
"rewards/reward_fn/mean": 1.0249999701976775,
"rewards/reward_fn/std": 0.317143639922142,
"step": 740,
"step_time": 24.14920071642846
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 462.0,
"completions/max_terminated_length": 462.0,
"completions/mean_length": 239.65625,
"completions/mean_terminated_length": 239.65625,
"completions/min_length": 74.7,
"completions/min_terminated_length": 74.7,
"entropy": 0.5035146079957485,
"epoch": 0.6,
"frac_reward_zero_std": 0.775,
"grad_norm": 0.0,
"learning_rate": 2.004e-07,
"loss": -0.014082185924053192,
"num_tokens": 2402669.0,
"reward": 0.9781249642372132,
"reward_std": 0.34400319755077363,
"rewards/reward_fn/mean": 0.9781249642372132,
"rewards/reward_fn/std": 0.3440032213926315,
"step": 750,
"step_time": 20.69694092241116
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 517.6,
"completions/max_terminated_length": 517.6,
"completions/mean_length": 266.775,
"completions/mean_terminated_length": 266.775,
"completions/min_length": 83.0,
"completions/min_terminated_length": 83.0,
"entropy": 0.5417108541354537,
"epoch": 0.608,
"frac_reward_zero_std": 0.75,
"grad_norm": 1.9890964031219482,
"learning_rate": 1.9639999999999999e-07,
"loss": -0.026402422785758974,
"num_tokens": 2453809.0,
"reward": 0.9462499558925629,
"reward_std": 0.3611013382673264,
"rewards/reward_fn/mean": 0.9462499558925629,
"rewards/reward_fn/std": 0.361101371049881,
"step": 760,
"step_time": 22.986824012873694
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00625,
"completions/max_length": 590.4,
"completions/max_terminated_length": 532.4,
"completions/mean_length": 252.18125,
"completions/mean_terminated_length": 247.59083557128906,
"completions/min_length": 101.1,
"completions/min_terminated_length": 101.1,
"entropy": 0.4916321000084281,
"epoch": 0.616,
"frac_reward_zero_std": 0.7,
"grad_norm": 0.0,
"learning_rate": 1.9239999999999998e-07,
"loss": 0.030572971701622008,
"num_tokens": 2502362.0,
"reward": 1.0468749582767487,
"reward_std": 0.415197890996933,
"rewards/reward_fn/mean": 1.0468749582767487,
"rewards/reward_fn/std": 0.41519791185855864,
"step": 770,
"step_time": 26.27881493680179
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 477.3,
"completions/max_terminated_length": 477.3,
"completions/mean_length": 238.68125,
"completions/mean_terminated_length": 238.68125,
"completions/min_length": 94.1,
"completions/min_terminated_length": 94.1,
"entropy": 0.518075543269515,
"epoch": 0.624,
"frac_reward_zero_std": 0.775,
"grad_norm": 0.0,
"learning_rate": 1.884e-07,
"loss": -0.016722193360328673,
"num_tokens": 2548967.0,
"reward": 1.0437499642372132,
"reward_std": 0.35573128461837766,
"rewards/reward_fn/mean": 1.0437499642372132,
"rewards/reward_fn/std": 0.3557313114404678,
"step": 780,
"step_time": 21.362713638367133
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0125,
"completions/max_length": 519.0,
"completions/max_terminated_length": 445.2,
"completions/mean_length": 248.11875,
"completions/mean_terminated_length": 239.45292053222656,
"completions/min_length": 66.9,
"completions/min_terminated_length": 66.9,
"entropy": 0.5092946726828813,
"epoch": 0.632,
"frac_reward_zero_std": 0.7,
"grad_norm": 2.420226573944092,
"learning_rate": 1.844e-07,
"loss": 0.04115874171257019,
"num_tokens": 2596974.0,
"reward": 1.0187499582767487,
"reward_std": 0.3817029446363449,
"rewards/reward_fn/mean": 1.0187499582767487,
"rewards/reward_fn/std": 0.3817029595375061,
"step": 790,
"step_time": 23.515300380950794
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 524.6,
"completions/max_terminated_length": 524.6,
"completions/mean_length": 266.76875,
"completions/mean_terminated_length": 266.76875,
"completions/min_length": 84.8,
"completions/min_terminated_length": 84.8,
"entropy": 0.5524313434958458,
"epoch": 0.64,
"frac_reward_zero_std": 0.8,
"grad_norm": 2.9757630825042725,
"learning_rate": 1.804e-07,
"loss": -0.0031020037829875948,
"num_tokens": 2648317.0,
"reward": 1.0437499642372132,
"reward_std": 0.3630165934562683,
"rewards/reward_fn/mean": 1.0437499642372132,
"rewards/reward_fn/std": 0.3630166083574295,
"step": 800,
"step_time": 23.433115491084756
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00625,
"completions/max_length": 594.1,
"completions/max_terminated_length": 556.5,
"completions/mean_length": 261.55,
"completions/mean_terminated_length": 257.0808349609375,
"completions/min_length": 94.1,
"completions/min_terminated_length": 94.1,
"entropy": 0.5408615570515394,
"epoch": 0.648,
"frac_reward_zero_std": 0.7,
"grad_norm": 0.0,
"learning_rate": 1.764e-07,
"loss": 0.005869099497795105,
"num_tokens": 2698233.0,
"reward": 1.0718749642372132,
"reward_std": 0.3241104021668434,
"rewards/reward_fn/mean": 1.0718749642372132,
"rewards/reward_fn/std": 0.32411042004823687,
"step": 810,
"step_time": 26.462639589840546
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00625,
"completions/max_length": 514.8,
"completions/max_terminated_length": 464.8,
"completions/mean_length": 250.34375,
"completions/mean_terminated_length": 245.92958374023436,
"completions/min_length": 98.0,
"completions/min_terminated_length": 98.0,
"entropy": 0.5274556184187531,
"epoch": 0.656,
"frac_reward_zero_std": 0.7,
"grad_norm": 3.2795684337615967,
"learning_rate": 1.7239999999999998e-07,
"loss": 0.03866562247276306,
"num_tokens": 2746656.0,
"reward": 1.015624964237213,
"reward_std": 0.36523938179016113,
"rewards/reward_fn/mean": 1.015624964237213,
"rewards/reward_fn/std": 0.3652394026517868,
"step": 820,
"step_time": 23.215507409302518
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00625,
"completions/max_length": 604.7,
"completions/max_terminated_length": 557.0,
"completions/mean_length": 284.25,
"completions/mean_terminated_length": 279.5695861816406,
"completions/min_length": 98.3,
"completions/min_terminated_length": 98.3,
"entropy": 0.585433507245034,
"epoch": 0.664,
"frac_reward_zero_std": 0.675,
"grad_norm": 2.278695583343506,
"learning_rate": 1.684e-07,
"loss": 0.027391403913497925,
"num_tokens": 2800636.0,
"reward": 0.9749999582767487,
"reward_std": 0.3571206539869308,
"rewards/reward_fn/mean": 0.9749999582767487,
"rewards/reward_fn/std": 0.357120668888092,
"step": 830,
"step_time": 27.087428363552316
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00625,
"completions/max_length": 605.3,
"completions/max_terminated_length": 541.8,
"completions/mean_length": 256.64375,
"completions/mean_terminated_length": 251.76333465576172,
"completions/min_length": 78.1,
"completions/min_terminated_length": 78.1,
"entropy": 0.5444993877783417,
"epoch": 0.672,
"frac_reward_zero_std": 0.65,
"grad_norm": 2.2607951164245605,
"learning_rate": 1.644e-07,
"loss": 0.022679784893989564,
"num_tokens": 2850327.0,
"reward": 1.034374964237213,
"reward_std": 0.35396216809749603,
"rewards/reward_fn/mean": 1.034374964237213,
"rewards/reward_fn/std": 0.35396219193935397,
"step": 840,
"step_time": 27.1366524099838
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 542.0,
"completions/max_terminated_length": 542.0,
"completions/mean_length": 250.46875,
"completions/mean_terminated_length": 250.46875,
"completions/min_length": 94.7,
"completions/min_terminated_length": 94.7,
"entropy": 0.5348553240299225,
"epoch": 0.68,
"frac_reward_zero_std": 0.75,
"grad_norm": 2.5916006565093994,
"learning_rate": 1.6039999999999998e-07,
"loss": -0.023145222663879396,
"num_tokens": 2899042.0,
"reward": 1.0624999582767487,
"reward_std": 0.38501180410385133,
"rewards/reward_fn/mean": 1.0624999582767487,
"rewards/reward_fn/std": 0.3850118160247803,
"step": 850,
"step_time": 24.06133564542979
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 492.0,
"completions/max_terminated_length": 492.0,
"completions/mean_length": 248.4,
"completions/mean_terminated_length": 248.4,
"completions/min_length": 76.7,
"completions/min_terminated_length": 76.7,
"entropy": 0.5445443953387439,
"epoch": 0.688,
"frac_reward_zero_std": 0.825,
"grad_norm": 0.0,
"learning_rate": 1.564e-07,
"loss": 0.008287916332483292,
"num_tokens": 2946790.0,
"reward": 1.0093749642372132,
"reward_std": 0.35188313722610476,
"rewards/reward_fn/mean": 1.0093749642372132,
"rewards/reward_fn/std": 0.3518831551074982,
"step": 860,
"step_time": 21.985819199867546
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00625,
"completions/max_length": 594.7,
"completions/max_terminated_length": 532.9,
"completions/mean_length": 261.8625,
"completions/mean_terminated_length": 256.7483337402344,
"completions/min_length": 92.5,
"completions/min_terminated_length": 92.5,
"entropy": 0.5800149150192737,
"epoch": 0.696,
"frac_reward_zero_std": 0.75,
"grad_norm": 0.0,
"learning_rate": 1.524e-07,
"loss": 0.04065183401107788,
"num_tokens": 2997048.0,
"reward": 0.9968749701976776,
"reward_std": 0.30479497015476226,
"rewards/reward_fn/mean": 0.9968749701976776,
"rewards/reward_fn/std": 0.30479499995708464,
"step": 870,
"step_time": 26.580935311084612
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 513.3,
"completions/max_terminated_length": 513.3,
"completions/mean_length": 253.06875,
"completions/mean_terminated_length": 253.06875,
"completions/min_length": 77.6,
"completions/min_terminated_length": 77.6,
"entropy": 0.5305031981319189,
"epoch": 0.704,
"frac_reward_zero_std": 0.75,
"grad_norm": 4.454606533050537,
"learning_rate": 1.484e-07,
"loss": 0.022549983859062196,
"num_tokens": 3045711.0,
"reward": 1.0312499582767487,
"reward_std": 0.38086153864860534,
"rewards/reward_fn/mean": 1.0312499582767487,
"rewards/reward_fn/std": 0.3808615684509277,
"step": 880,
"step_time": 23.01209013015032
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 502.9,
"completions/max_terminated_length": 502.9,
"completions/mean_length": 256.13125,
"completions/mean_terminated_length": 256.13125,
"completions/min_length": 66.3,
"completions/min_terminated_length": 66.3,
"entropy": 0.5786763843148947,
"epoch": 0.712,
"frac_reward_zero_std": 0.75,
"grad_norm": 2.9759247303009033,
"learning_rate": 1.444e-07,
"loss": -0.02140951305627823,
"num_tokens": 3094856.0,
"reward": 1.0437499582767487,
"reward_std": 0.3924266636371613,
"rewards/reward_fn/mean": 1.0437499582767487,
"rewards/reward_fn/std": 0.39242667853832247,
"step": 890,
"step_time": 22.476798066869378
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 487.1,
"completions/max_terminated_length": 487.1,
"completions/mean_length": 236.9625,
"completions/mean_terminated_length": 236.9625,
"completions/min_length": 78.6,
"completions/min_terminated_length": 78.6,
"entropy": 0.5970848154276609,
"epoch": 0.72,
"frac_reward_zero_std": 0.7,
"grad_norm": 1.90382719039917,
"learning_rate": 1.4039999999999999e-07,
"loss": 0.013022461533546447,
"num_tokens": 3140922.0,
"reward": 1.0562499523162843,
"reward_std": 0.4089065968990326,
"rewards/reward_fn/mean": 1.0562499523162843,
"rewards/reward_fn/std": 0.40890662670135497,
"step": 900,
"step_time": 21.815543547831474
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 585.1,
"completions/max_terminated_length": 585.1,
"completions/mean_length": 267.65625,
"completions/mean_terminated_length": 267.65625,
"completions/min_length": 83.9,
"completions/min_terminated_length": 83.9,
"entropy": 0.5671312633901835,
"epoch": 0.728,
"frac_reward_zero_std": 0.7,
"grad_norm": 3.2715682983398438,
"learning_rate": 1.3639999999999998e-07,
"loss": -0.008570893108844757,
"num_tokens": 3192063.0,
"reward": 1.0312499582767487,
"reward_std": 0.385887947678566,
"rewards/reward_fn/mean": 1.0312499582767487,
"rewards/reward_fn/std": 0.3858879655599594,
"step": 910,
"step_time": 25.983504464896395
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00625,
"completions/max_length": 597.8,
"completions/max_terminated_length": 572.6,
"completions/mean_length": 280.96875,
"completions/mean_terminated_length": 276.9291687011719,
"completions/min_length": 112.6,
"completions/min_terminated_length": 112.6,
"entropy": 0.5547854236327112,
"epoch": 0.736,
"frac_reward_zero_std": 0.75,
"grad_norm": 2.8137001991271973,
"learning_rate": 1.324e-07,
"loss": -0.0006064340472221374,
"num_tokens": 3245226.0,
"reward": 1.0593749642372132,
"reward_std": 0.3496703714132309,
"rewards/reward_fn/mean": 1.0593749642372132,
"rewards/reward_fn/std": 0.3496703922748566,
"step": 920,
"step_time": 26.724192412989215
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 521.3,
"completions/max_terminated_length": 521.3,
"completions/mean_length": 258.66875,
"completions/mean_terminated_length": 258.66875,
"completions/min_length": 73.2,
"completions/min_terminated_length": 73.2,
"entropy": 0.55043915361166,
"epoch": 0.744,
"frac_reward_zero_std": 0.75,
"grad_norm": 1.9904998540878296,
"learning_rate": 1.2839999999999999e-07,
"loss": 0.002445448562502861,
"num_tokens": 3295165.0,
"reward": 1.0499999582767487,
"reward_std": 0.40058289766311644,
"rewards/reward_fn/mean": 1.0499999582767487,
"rewards/reward_fn/std": 0.40058292746543883,
"step": 930,
"step_time": 23.23095205714926
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 649.2,
"completions/max_terminated_length": 649.2,
"completions/mean_length": 293.1125,
"completions/mean_terminated_length": 293.1125,
"completions/min_length": 63.0,
"completions/min_terminated_length": 63.0,
"entropy": 0.5630233686417341,
"epoch": 0.752,
"frac_reward_zero_std": 0.75,
"grad_norm": 1.8717433214187622,
"learning_rate": 1.244e-07,
"loss": 0.015195921063423157,
"num_tokens": 3350455.0,
"reward": 0.9562499582767486,
"reward_std": 0.3392513394355774,
"rewards/reward_fn/mean": 0.9562499582767486,
"rewards/reward_fn/std": 0.33925136625766755,
"step": 940,
"step_time": 28.78155018389225
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 566.8,
"completions/max_terminated_length": 566.8,
"completions/mean_length": 279.64375,
"completions/mean_terminated_length": 279.64375,
"completions/min_length": 92.6,
"completions/min_terminated_length": 92.6,
"entropy": 0.5822894293814898,
"epoch": 0.76,
"frac_reward_zero_std": 0.725,
"grad_norm": 1.3468974828720093,
"learning_rate": 1.204e-07,
"loss": -0.006339100748300552,
"num_tokens": 3403710.0,
"reward": 1.0437499642372132,
"reward_std": 0.3522812038660049,
"rewards/reward_fn/mean": 1.0437499642372132,
"rewards/reward_fn/std": 0.35228122770786285,
"step": 950,
"step_time": 25.218540608556943
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 550.5,
"completions/max_terminated_length": 550.5,
"completions/mean_length": 267.8625,
"completions/mean_terminated_length": 267.8625,
"completions/min_length": 101.9,
"completions/min_terminated_length": 101.9,
"entropy": 0.5490182695910335,
"epoch": 0.768,
"frac_reward_zero_std": 0.775,
"grad_norm": 2.347418785095215,
"learning_rate": 1.164e-07,
"loss": -0.018277975916862487,
"num_tokens": 3454788.0,
"reward": 1.0874999523162843,
"reward_std": 0.4399394065141678,
"rewards/reward_fn/mean": 1.0874999523162843,
"rewards/reward_fn/std": 0.43993942737579345,
"step": 960,
"step_time": 24.56708482489921
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 563.2,
"completions/max_terminated_length": 563.2,
"completions/mean_length": 286.8625,
"completions/mean_terminated_length": 286.8625,
"completions/min_length": 111.1,
"completions/min_terminated_length": 111.1,
"entropy": 0.5671119350939989,
"epoch": 0.776,
"frac_reward_zero_std": 0.825,
"grad_norm": 0.0,
"learning_rate": 1.124e-07,
"loss": 0.001966666430234909,
"num_tokens": 3508722.0,
"reward": 0.9843749582767487,
"reward_std": 0.3477096170186996,
"rewards/reward_fn/mean": 0.9843749582767487,
"rewards/reward_fn/std": 0.3477096438407898,
"step": 970,
"step_time": 25.104713304387406
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01875,
"completions/max_length": 572.8,
"completions/max_terminated_length": 515.7,
"completions/mean_length": 258.20625,
"completions/mean_terminated_length": 244.45547790527343,
"completions/min_length": 68.6,
"completions/min_terminated_length": 68.6,
"entropy": 0.4816724480129778,
"epoch": 0.784,
"frac_reward_zero_std": 0.75,
"grad_norm": 2.33716082572937,
"learning_rate": 1.0839999999999999e-07,
"loss": 0.021231548488140108,
"num_tokens": 3558171.0,
"reward": 1.0968749582767487,
"reward_std": 0.3681450128555298,
"rewards/reward_fn/mean": 1.0968749582767487,
"rewards/reward_fn/std": 0.3681450396776199,
"step": 980,
"step_time": 25.863722542859612
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 474.4,
"completions/max_terminated_length": 474.4,
"completions/mean_length": 241.725,
"completions/mean_terminated_length": 241.725,
"completions/min_length": 102.0,
"completions/min_terminated_length": 102.0,
"entropy": 0.5186899159103632,
"epoch": 0.792,
"frac_reward_zero_std": 0.775,
"grad_norm": 2.8566486835479736,
"learning_rate": 1.0440000000000001e-07,
"loss": -0.013251829147338866,
"num_tokens": 3604823.0,
"reward": 1.0312499582767487,
"reward_std": 0.3475317031145096,
"rewards/reward_fn/mean": 1.0312499582767487,
"rewards/reward_fn/std": 0.347531720995903,
"step": 990,
"step_time": 21.354597127251328
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00625,
"completions/max_length": 513.8,
"completions/max_terminated_length": 472.6,
"completions/mean_length": 276.25625,
"completions/mean_terminated_length": 271.7895843505859,
"completions/min_length": 129.9,
"completions/min_terminated_length": 129.9,
"entropy": 0.5287249894812703,
"epoch": 0.8,
"frac_reward_zero_std": 0.8,
"grad_norm": 1.7595624923706055,
"learning_rate": 1.004e-07,
"loss": 0.030878221988677977,
"num_tokens": 3657228.0,
"reward": 1.0406249701976775,
"reward_std": 0.31898270547389984,
"rewards/reward_fn/mean": 1.0406249701976775,
"rewards/reward_fn/std": 0.31898272335529326,
"step": 1000,
"step_time": 23.230659662559628
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00625,
"completions/max_length": 557.3,
"completions/max_terminated_length": 491.5,
"completions/mean_length": 266.30625,
"completions/mean_terminated_length": 261.2725006103516,
"completions/min_length": 75.9,
"completions/min_terminated_length": 75.9,
"entropy": 0.5200971383601427,
"epoch": 0.808,
"frac_reward_zero_std": 0.725,
"grad_norm": 2.3148114681243896,
"learning_rate": 9.639999999999999e-08,
"loss": 0.003333679959177971,
"num_tokens": 3708309.0,
"reward": 1.0343749582767487,
"reward_std": 0.3490926504135132,
"rewards/reward_fn/mean": 1.0343749582767487,
"rewards/reward_fn/std": 0.34909267723560333,
"step": 1010,
"step_time": 25.057548108976334
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 537.4,
"completions/max_terminated_length": 537.4,
"completions/mean_length": 272.03125,
"completions/mean_terminated_length": 272.03125,
"completions/min_length": 110.4,
"completions/min_terminated_length": 110.4,
"entropy": 0.5065994596108794,
"epoch": 0.816,
"frac_reward_zero_std": 0.725,
"grad_norm": 3.423994541168213,
"learning_rate": 9.24e-08,
"loss": 0.023444755375385283,
"num_tokens": 3760274.0,
"reward": 1.0218749582767486,
"reward_std": 0.35771805346012114,
"rewards/reward_fn/mean": 1.0218749582767486,
"rewards/reward_fn/std": 0.35771807432174685,
"step": 1020,
"step_time": 23.9467576073017
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 510.8,
"completions/max_terminated_length": 510.8,
"completions/mean_length": 283.375,
"completions/mean_terminated_length": 283.375,
"completions/min_length": 129.7,
"completions/min_terminated_length": 129.7,
"entropy": 0.5147501945495605,
"epoch": 0.824,
"frac_reward_zero_std": 0.675,
"grad_norm": 2.1647582054138184,
"learning_rate": 8.84e-08,
"loss": 0.0007140228524804115,
"num_tokens": 3813922.0,
"reward": 1.199999952316284,
"reward_std": 0.491314160823822,
"rewards/reward_fn/mean": 1.199999952316284,
"rewards/reward_fn/std": 0.49131418466567994,
"step": 1030,
"step_time": 23.01038688295521
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 521.3,
"completions/max_terminated_length": 521.3,
"completions/mean_length": 264.31875,
"completions/mean_terminated_length": 264.31875,
"completions/min_length": 121.5,
"completions/min_terminated_length": 121.5,
"entropy": 0.5070869445800781,
"epoch": 0.832,
"frac_reward_zero_std": 0.625,
"grad_norm": 2.585664749145508,
"learning_rate": 8.44e-08,
"loss": 0.028041335940361022,
"num_tokens": 3864485.0,
"reward": 1.0937499582767487,
"reward_std": 0.4248550355434418,
"rewards/reward_fn/mean": 1.0937499582767487,
"rewards/reward_fn/std": 0.42485505938529966,
"step": 1040,
"step_time": 23.34787617237307
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00625,
"completions/max_length": 549.5,
"completions/max_terminated_length": 502.5,
"completions/mean_length": 267.49375,
"completions/mean_terminated_length": 262.67791748046875,
"completions/min_length": 93.5,
"completions/min_terminated_length": 93.5,
"entropy": 0.5002012770622969,
"epoch": 0.84,
"frac_reward_zero_std": 0.75,
"grad_norm": 0.0,
"learning_rate": 8.039999999999999e-08,
"loss": 0.04210644662380218,
"num_tokens": 3915900.0,
"reward": 1.0968749582767487,
"reward_std": 0.41755713522434235,
"rewards/reward_fn/mean": 1.0968749582767487,
"rewards/reward_fn/std": 0.4175571441650391,
"step": 1050,
"step_time": 24.77414979697205
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.025,
"completions/max_length": 627.7,
"completions/max_terminated_length": 555.7,
"completions/mean_length": 305.38125,
"completions/mean_terminated_length": 289.6212219238281,
"completions/min_length": 135.6,
"completions/min_terminated_length": 135.6,
"entropy": 0.5611137403175235,
"epoch": 0.848,
"frac_reward_zero_std": 0.675,
"grad_norm": 2.05741024017334,
"learning_rate": 7.64e-08,
"loss": 0.0378756046295166,
"num_tokens": 3973093.0,
"reward": 0.9687499642372132,
"reward_std": 0.332451206445694,
"rewards/reward_fn/mean": 0.9687499642372132,
"rewards/reward_fn/std": 0.33245123326778414,
"step": 1060,
"step_time": 28.287785303639247
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0125,
"completions/max_length": 746.1,
"completions/max_terminated_length": 658.4,
"completions/mean_length": 300.1625,
"completions/mean_terminated_length": 290.8487518310547,
"completions/min_length": 116.9,
"completions/min_terminated_length": 116.9,
"entropy": 0.5516405990347266,
"epoch": 0.856,
"frac_reward_zero_std": 0.75,
"grad_norm": 2.4637022018432617,
"learning_rate": 7.24e-08,
"loss": 0.02026980072259903,
"num_tokens": 4029403.0,
"reward": 0.9187499821186066,
"reward_std": 0.22319530844688415,
"rewards/reward_fn/mean": 0.9187499821186066,
"rewards/reward_fn/std": 0.22319531738758086,
"step": 1070,
"step_time": 33.521394540695475
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00625,
"completions/max_length": 534.6,
"completions/max_terminated_length": 488.9,
"completions/mean_length": 263.6125,
"completions/mean_terminated_length": 258.89708557128904,
"completions/min_length": 100.4,
"completions/min_terminated_length": 100.4,
"entropy": 0.5176247822120785,
"epoch": 0.864,
"frac_reward_zero_std": 0.75,
"grad_norm": 3.2136309146881104,
"learning_rate": 6.84e-08,
"loss": 0.035635238885879515,
"num_tokens": 4080145.0,
"reward": 1.015624964237213,
"reward_std": 0.3429378718137741,
"rewards/reward_fn/mean": 1.015624964237213,
"rewards/reward_fn/std": 0.34293788969516753,
"step": 1080,
"step_time": 24.050806782906875
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 542.3,
"completions/max_terminated_length": 542.3,
"completions/mean_length": 260.6125,
"completions/mean_terminated_length": 260.6125,
"completions/min_length": 112.2,
"completions/min_terminated_length": 112.2,
"entropy": 0.5131400337442755,
"epoch": 0.872,
"frac_reward_zero_std": 0.75,
"grad_norm": 0.0,
"learning_rate": 6.44e-08,
"loss": 0.0009937494993209838,
"num_tokens": 4129863.0,
"reward": 0.9937499642372132,
"reward_std": 0.3179366230964661,
"rewards/reward_fn/mean": 0.9937499642372132,
"rewards/reward_fn/std": 0.31793664693832396,
"step": 1090,
"step_time": 24.295423823781313
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01875,
"completions/max_length": 593.4,
"completions/max_terminated_length": 483.5,
"completions/mean_length": 250.2875,
"completions/mean_terminated_length": 235.8367889404297,
"completions/min_length": 98.2,
"completions/min_terminated_length": 98.2,
"entropy": 0.4774348322302103,
"epoch": 0.88,
"frac_reward_zero_std": 0.7,
"grad_norm": 0.0,
"learning_rate": 6.04e-08,
"loss": 0.05956764221191406,
"num_tokens": 4178285.0,
"reward": 1.0656249523162842,
"reward_std": 0.4110028088092804,
"rewards/reward_fn/mean": 1.0656249523162842,
"rewards/reward_fn/std": 0.4110028326511383,
"step": 1100,
"step_time": 26.840810445183887
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00625,
"completions/max_length": 591.2,
"completions/max_terminated_length": 540.6,
"completions/mean_length": 274.45625,
"completions/mean_terminated_length": 269.875,
"completions/min_length": 124.3,
"completions/min_terminated_length": 124.3,
"entropy": 0.5233237653970718,
"epoch": 0.888,
"frac_reward_zero_std": 0.7,
"grad_norm": 4.72261381149292,
"learning_rate": 5.6399999999999995e-08,
"loss": -0.01764392852783203,
"num_tokens": 4230406.0,
"reward": 1.0343749582767487,
"reward_std": 0.40663672983646393,
"rewards/reward_fn/mean": 1.0343749582767487,
"rewards/reward_fn/std": 0.4066367566585541,
"step": 1110,
"step_time": 26.58696360127069
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00625,
"completions/max_length": 544.6,
"completions/max_terminated_length": 486.7,
"completions/mean_length": 264.1125,
"completions/mean_terminated_length": 259.6304168701172,
"completions/min_length": 124.9,
"completions/min_terminated_length": 124.9,
"entropy": 0.49998724516481163,
"epoch": 0.896,
"frac_reward_zero_std": 0.725,
"grad_norm": 0.0,
"learning_rate": 5.24e-08,
"loss": 0.03018750548362732,
"num_tokens": 4280868.0,
"reward": 1.0843749582767486,
"reward_std": 0.4210015803575516,
"rewards/reward_fn/mean": 1.0843749582767486,
"rewards/reward_fn/std": 0.421001598238945,
"step": 1120,
"step_time": 24.553724389290437
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00625,
"completions/max_length": 616.2,
"completions/max_terminated_length": 564.2,
"completions/mean_length": 266.13125,
"completions/mean_terminated_length": 261.57250061035154,
"completions/min_length": 93.2,
"completions/min_terminated_length": 93.2,
"entropy": 0.5146013794466853,
"epoch": 0.904,
"frac_reward_zero_std": 0.65,
"grad_norm": 3.1288528442382812,
"learning_rate": 4.8399999999999997e-08,
"loss": 0.03101418912410736,
"num_tokens": 4331401.0,
"reward": 1.0718749582767486,
"reward_std": 0.37411039769649507,
"rewards/reward_fn/mean": 1.0718749582767486,
"rewards/reward_fn/std": 0.3741104155778885,
"step": 1130,
"step_time": 27.615588352596387
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00625,
"completions/max_length": 624.7,
"completions/max_terminated_length": 591.7,
"completions/mean_length": 291.43125,
"completions/mean_terminated_length": 286.9612518310547,
"completions/min_length": 109.7,
"completions/min_terminated_length": 109.7,
"entropy": 0.528622365463525,
"epoch": 0.912,
"frac_reward_zero_std": 0.7,
"grad_norm": 1.9404244422912598,
"learning_rate": 4.44e-08,
"loss": 0.027211108803749086,
"num_tokens": 4386302.0,
"reward": 1.0781249582767487,
"reward_std": 0.3990673363208771,
"rewards/reward_fn/mean": 1.0781249582767487,
"rewards/reward_fn/std": 0.3990673542022705,
"step": 1140,
"step_time": 27.958656183769925
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 527.2,
"completions/max_terminated_length": 527.2,
"completions/mean_length": 286.13125,
"completions/mean_terminated_length": 286.13125,
"completions/min_length": 135.0,
"completions/min_terminated_length": 135.0,
"entropy": 0.513075502589345,
"epoch": 0.92,
"frac_reward_zero_std": 0.725,
"grad_norm": 1.4120060205459595,
"learning_rate": 4.04e-08,
"loss": -0.000885472446680069,
"num_tokens": 4440643.0,
"reward": 1.062499964237213,
"reward_std": 0.3273422926664352,
"rewards/reward_fn/mean": 1.062499964237213,
"rewards/reward_fn/std": 0.3273423135280609,
"step": 1150,
"step_time": 23.63183649624698
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 599.6,
"completions/max_terminated_length": 599.6,
"completions/mean_length": 280.80625,
"completions/mean_terminated_length": 280.80625,
"completions/min_length": 125.5,
"completions/min_terminated_length": 125.5,
"entropy": 0.5326275195926428,
"epoch": 0.928,
"frac_reward_zero_std": 0.75,
"grad_norm": 2.777073860168457,
"learning_rate": 3.64e-08,
"loss": 0.021264398097991945,
"num_tokens": 4493740.0,
"reward": 1.0749999582767487,
"reward_std": 0.4012425780296326,
"rewards/reward_fn/mean": 1.0749999582767487,
"rewards/reward_fn/std": 0.40124259889125824,
"step": 1160,
"step_time": 27.038261169008912
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0125,
"completions/max_length": 626.3,
"completions/max_terminated_length": 570.1,
"completions/mean_length": 281.4875,
"completions/mean_terminated_length": 272.0464294433594,
"completions/min_length": 88.5,
"completions/min_terminated_length": 88.5,
"entropy": 0.5435919009149075,
"epoch": 0.936,
"frac_reward_zero_std": 0.7,
"grad_norm": 2.009503126144409,
"learning_rate": 3.24e-08,
"loss": 0.014678403735160828,
"num_tokens": 4547326.0,
"reward": 0.9749999642372131,
"reward_std": 0.3376161724328995,
"rewards/reward_fn/mean": 0.9749999642372131,
"rewards/reward_fn/std": 0.33761619329452514,
"step": 1170,
"step_time": 28.00773431826383
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 540.3,
"completions/max_terminated_length": 540.3,
"completions/mean_length": 281.43125,
"completions/mean_terminated_length": 281.43125,
"completions/min_length": 134.6,
"completions/min_terminated_length": 134.6,
"entropy": 0.5330241896212101,
"epoch": 0.944,
"frac_reward_zero_std": 0.75,
"grad_norm": 2.01973557472229,
"learning_rate": 2.84e-08,
"loss": 0.010066453367471695,
"num_tokens": 4600699.0,
"reward": 0.9749999701976776,
"reward_std": 0.30032309591770173,
"rewards/reward_fn/mean": 0.9749999701976776,
"rewards/reward_fn/std": 0.3003231108188629,
"step": 1180,
"step_time": 24.195893923100083
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 531.7,
"completions/max_terminated_length": 531.7,
"completions/mean_length": 278.15,
"completions/mean_terminated_length": 278.15,
"completions/min_length": 110.2,
"completions/min_terminated_length": 110.2,
"entropy": 0.5508426167070866,
"epoch": 0.952,
"frac_reward_zero_std": 0.875,
"grad_norm": 0.0,
"learning_rate": 2.44e-08,
"loss": 0.009711582958698273,
"num_tokens": 4653463.0,
"reward": 1.031249964237213,
"reward_std": 0.34981620609760283,
"rewards/reward_fn/mean": 1.031249964237213,
"rewards/reward_fn/std": 0.34981622397899625,
"step": 1190,
"step_time": 23.97323694275692
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01875,
"completions/max_length": 658.7,
"completions/max_terminated_length": 541.0,
"completions/mean_length": 285.43125,
"completions/mean_terminated_length": 271.64125671386716,
"completions/min_length": 99.9,
"completions/min_terminated_length": 99.9,
"entropy": 0.5076606808230281,
"epoch": 0.96,
"frac_reward_zero_std": 0.725,
"grad_norm": 2.406820774078369,
"learning_rate": 2.04e-08,
"loss": 0.07293225526809692,
"num_tokens": 4707780.0,
"reward": 0.9531249642372132,
"reward_std": 0.3397530823945999,
"rewards/reward_fn/mean": 0.9531249642372132,
"rewards/reward_fn/std": 0.3397530972957611,
"step": 1200,
"step_time": 29.918243083078416
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.025,
"completions/max_length": 778.4,
"completions/max_terminated_length": 598.6,
"completions/mean_length": 298.01875,
"completions/mean_terminated_length": 279.6341720581055,
"completions/min_length": 107.9,
"completions/min_terminated_length": 107.9,
"entropy": 0.4813551393337548,
"epoch": 0.968,
"frac_reward_zero_std": 0.675,
"grad_norm": 0.0,
"learning_rate": 1.64e-08,
"loss": 0.07352781295776367,
"num_tokens": 4763607.0,
"reward": 1.0562499523162843,
"reward_std": 0.444338920712471,
"rewards/reward_fn/mean": 1.0562499523162843,
"rewards/reward_fn/std": 0.44433894753456116,
"step": 1210,
"step_time": 35.2928637356963
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 542.4,
"completions/max_terminated_length": 542.4,
"completions/mean_length": 273.9375,
"completions/mean_terminated_length": 273.9375,
"completions/min_length": 112.5,
"completions/min_terminated_length": 112.5,
"entropy": 0.5351916439831257,
"epoch": 0.976,
"frac_reward_zero_std": 0.7,
"grad_norm": 2.6699888706207275,
"learning_rate": 1.2399999999999999e-08,
"loss": 0.020609369874000548,
"num_tokens": 4815925.0,
"reward": 1.043749952316284,
"reward_std": 0.409377720952034,
"rewards/reward_fn/mean": 1.043749952316284,
"rewards/reward_fn/std": 0.4093777507543564,
"step": 1220,
"step_time": 24.284022097615527
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 555.8,
"completions/max_terminated_length": 555.8,
"completions/mean_length": 295.23125,
"completions/mean_terminated_length": 295.23125,
"completions/min_length": 116.1,
"completions/min_terminated_length": 116.1,
"entropy": 0.5482900742441416,
"epoch": 0.984,
"frac_reward_zero_std": 0.725,
"grad_norm": 1.7745944261550903,
"learning_rate": 8.399999999999999e-09,
"loss": 0.003481149673461914,
"num_tokens": 4871670.0,
"reward": 0.9249999582767486,
"reward_std": 0.30596340596675875,
"rewards/reward_fn/mean": 0.9249999582767486,
"rewards/reward_fn/std": 0.30596343576908114,
"step": 1230,
"step_time": 24.858759614871815
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0125,
"completions/max_length": 614.1,
"completions/max_terminated_length": 498.9,
"completions/mean_length": 273.8625,
"completions/mean_terminated_length": 264.3100021362305,
"completions/min_length": 131.8,
"completions/min_terminated_length": 131.8,
"entropy": 0.5003731534816325,
"epoch": 0.992,
"frac_reward_zero_std": 0.6,
"grad_norm": 2.952770471572876,
"learning_rate": 4.4e-09,
"loss": 0.05144896507263184,
"num_tokens": 4923236.0,
"reward": 1.0687499582767486,
"reward_std": 0.3899788945913315,
"rewards/reward_fn/mean": 1.0687499582767486,
"rewards/reward_fn/std": 0.3899789124727249,
"step": 1240,
"step_time": 27.80349059002474
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 493.7,
"completions/max_terminated_length": 493.7,
"completions/mean_length": 250.225,
"completions/mean_terminated_length": 250.225,
"completions/min_length": 87.9,
"completions/min_terminated_length": 87.9,
"entropy": 0.5107808768749237,
"epoch": 1.0,
"frac_reward_zero_std": 0.75,
"grad_norm": 0.0,
"learning_rate": 4e-10,
"loss": 0.010706515610218048,
"num_tokens": 4971516.0,
"reward": 1.0812499701976777,
"reward_std": 0.31392850875854494,
"rewards/reward_fn/mean": 1.0812499701976777,
"rewards/reward_fn/std": 0.31392852365970614,
"step": 1250,
"step_time": 22.25712463380769
}
],
"logging_steps": 10,
"max_steps": 1250,
"num_input_tokens_seen": 4971516,
"num_train_epochs": 1,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 0.0,
"train_batch_size": 2,
"trial_name": null,
"trial_params": null
}