{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.4166666666666667, "eval_steps": 500, "global_step": 10, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 105.0, "completions/max_terminated_length": 105.0, "completions/mean_length": 79.25, "completions/mean_terminated_length": 79.25, "completions/min_length": 61.0, "completions/min_terminated_length": 61.0, "epoch": 0.041666666666666664, "grad_norm": 19.425622940063477, "kl": 0.0, "learning_rate": 0.0, "loss": -0.0238, "num_tokens": 829.0, "reward": 0.033818572759628296, "reward_std": 0.014064152725040913, "rewards/concensus_correctness_reward_func/mean": 0.0, "rewards/concensus_correctness_reward_func/std": 0.0, "rewards/consensus_reward_func/mean": 0.0, "rewards/consensus_reward_func/std": 0.0, "rewards/cumulative_reward_2/mean": 0.0, "rewards/cumulative_reward_2/std": 0.0, "rewards/final_correctness_reward_func/mean": 0.0, "rewards/final_correctness_reward_func/std": 0.0, "rewards/question_recreation_reward_func/mean": 0.033818572759628296, "rewards/question_recreation_reward_func/std": 0.015592413954436779, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "rewards/strict_format_reward_func/mean": 0.0, "rewards/strict_format_reward_func/std": 0.0, "rewards/xmlcount_reward_func/mean": 0.0, "rewards/xmlcount_reward_func/std": 0.0, "step": 1 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 157.0, "completions/max_terminated_length": 157.0, "completions/mean_length": 62.0, "completions/mean_terminated_length": 62.0, "completions/min_length": 11.0, "completions/min_terminated_length": 11.0, "epoch": 0.08333333333333333, "grad_norm": 10.577459335327148, "kl": 0.0, "learning_rate": 1e-06, "loss": 0.1346, "num_tokens": 1589.0, "reward": 0.02579352632164955, "reward_std": 0.0022206564899533987, "rewards/concensus_correctness_reward_func/mean": 0.0, "rewards/concensus_correctness_reward_func/std": 0.0, "rewards/consensus_reward_func/mean": 0.0, "rewards/consensus_reward_func/std": 0.0, "rewards/cumulative_reward_2/mean": 0.0, "rewards/cumulative_reward_2/std": 0.0, "rewards/final_correctness_reward_func/mean": 0.0, "rewards/final_correctness_reward_func/std": 0.0, "rewards/question_recreation_reward_func/mean": 0.03729352727532387, "rewards/question_recreation_reward_func/std": 0.02176251821219921, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "rewards/strict_format_reward_func/mean": 0.0, "rewards/strict_format_reward_func/std": 0.0, "rewards/xmlcount_reward_func/mean": -0.011500000022351742, "rewards/xmlcount_reward_func/std": 0.023000000044703484, "step": 2 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 60.0, "completions/max_terminated_length": 60.0, "completions/mean_length": 37.75, "completions/mean_terminated_length": 37.75, "completions/min_length": 17.0, "completions/min_terminated_length": 17.0, "epoch": 0.125, "grad_norm": 63.17714309692383, "kl": 0.022556406212970614, "learning_rate": 9.698463103929541e-07, "loss": -0.0353, "num_tokens": 2252.0, "reward": 0.0233759805560112, "reward_std": 0.0036189700476825237, "rewards/concensus_correctness_reward_func/mean": 0.0, "rewards/concensus_correctness_reward_func/std": 0.0, "rewards/consensus_reward_func/mean": 0.0, "rewards/consensus_reward_func/std": 0.0, "rewards/cumulative_reward_2/mean": 0.0, "rewards/cumulative_reward_2/std": 0.0, "rewards/final_correctness_reward_func/mean": 0.0, "rewards/final_correctness_reward_func/std": 0.0, "rewards/question_recreation_reward_func/mean": 0.02337597869336605, "rewards/question_recreation_reward_func/std": 0.006528852041810751, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "rewards/strict_format_reward_func/mean": 0.0, "rewards/strict_format_reward_func/std": 0.0, "rewards/xmlcount_reward_func/mean": 0.0, "rewards/xmlcount_reward_func/std": 0.0, "step": 3 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 49.0, "completions/max_terminated_length": 49.0, "completions/mean_length": 23.75, "completions/mean_terminated_length": 23.75, "completions/min_length": 6.0, "completions/min_terminated_length": 6.0, "epoch": 0.16666666666666666, "grad_norm": 78.41133117675781, "kl": 0.004607599810697138, "learning_rate": 8.83022221559489e-07, "loss": -0.0235, "num_tokens": 2859.0, "reward": 0.120003342628479, "reward_std": 0.01657889410853386, "rewards/concensus_correctness_reward_func/mean": 0.0, "rewards/concensus_correctness_reward_func/std": 0.0, "rewards/consensus_reward_func/mean": 0.0, "rewards/consensus_reward_func/std": 0.0, "rewards/cumulative_reward_2/mean": 0.0, "rewards/cumulative_reward_2/std": 0.0, "rewards/final_correctness_reward_func/mean": 0.0, "rewards/final_correctness_reward_func/std": 0.0, "rewards/question_recreation_reward_func/mean": 0.0575033500790596, "rewards/question_recreation_reward_func/std": 0.04737204685807228, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "rewards/strict_format_reward_func/mean": 0.0, "rewards/strict_format_reward_func/std": 0.0, "rewards/xmlcount_reward_func/mean": 0.0625, "rewards/xmlcount_reward_func/std": 0.07216878235340118, "step": 4 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 98.0, "completions/max_terminated_length": 98.0, "completions/mean_length": 62.25, "completions/mean_terminated_length": 62.25, "completions/min_length": 42.0, "completions/min_terminated_length": 42.0, "epoch": 0.20833333333333334, "grad_norm": 27.737390518188477, "kl": 0.0020544964354485273, "learning_rate": 7.5e-07, "loss": 0.1576, "num_tokens": 3620.0, "reward": 0.22436219453811646, "reward_std": 0.2421010583639145, "rewards/concensus_correctness_reward_func/mean": 0.0, "rewards/concensus_correctness_reward_func/std": 0.0, "rewards/consensus_reward_func/mean": 0.0, "rewards/consensus_reward_func/std": 0.0, "rewards/cumulative_reward_2/mean": 0.0, "rewards/cumulative_reward_2/std": 0.0, "rewards/final_correctness_reward_func/mean": 0.0, "rewards/final_correctness_reward_func/std": 0.0, "rewards/question_recreation_reward_func/mean": 0.042862214148044586, "rewards/question_recreation_reward_func/std": 0.01811356097459793, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "rewards/strict_format_reward_func/mean": 0.0, "rewards/strict_format_reward_func/std": 0.0, "rewards/xmlcount_reward_func/mean": 0.18150000274181366, "rewards/xmlcount_reward_func/std": 0.2375619113445282, "step": 5 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 66.0, "completions/max_terminated_length": 66.0, "completions/mean_length": 53.75, "completions/mean_terminated_length": 53.75, "completions/min_length": 38.0, "completions/min_terminated_length": 38.0, "epoch": 0.25, "grad_norm": 30.05788230895996, "kl": 0.11974160745739937, "learning_rate": 5.868240888334652e-07, "loss": -0.1373, "num_tokens": 4347.0, "reward": 0.06295251846313477, "reward_std": 0.04794733226299286, "rewards/concensus_correctness_reward_func/mean": 0.0, "rewards/concensus_correctness_reward_func/std": 0.0, "rewards/consensus_reward_func/mean": 0.0, "rewards/consensus_reward_func/std": 0.0, "rewards/cumulative_reward_2/mean": 0.0, "rewards/cumulative_reward_2/std": 0.0, "rewards/final_correctness_reward_func/mean": 0.0, "rewards/final_correctness_reward_func/std": 0.0, "rewards/question_recreation_reward_func/mean": 0.031702518463134766, "rewards/question_recreation_reward_func/std": 0.010227867402136326, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "rewards/strict_format_reward_func/mean": 0.0, "rewards/strict_format_reward_func/std": 0.0, "rewards/xmlcount_reward_func/mean": 0.03125, "rewards/xmlcount_reward_func/std": 0.0625, "step": 6 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.25, "completions/max_length": 448.0, "completions/max_terminated_length": 435.0, "completions/mean_length": 243.5, "completions/mean_terminated_length": 175.3333282470703, "completions/min_length": 17.0, "completions/min_terminated_length": 17.0, "epoch": 0.2916666666666667, "grad_norm": 6.3190836906433105, "kl": 0.013644359540194273, "learning_rate": 4.131759111665348e-07, "loss": 0.5802, "num_tokens": 5833.0, "reward": 0.1428598016500473, "reward_std": 0.15640608966350555, "rewards/concensus_correctness_reward_func/mean": 0.0, "rewards/concensus_correctness_reward_func/std": 0.0, "rewards/consensus_reward_func/mean": 0.0, "rewards/consensus_reward_func/std": 0.0, "rewards/cumulative_reward_2/mean": 0.0, "rewards/cumulative_reward_2/std": 0.0, "rewards/final_correctness_reward_func/mean": 0.0, "rewards/final_correctness_reward_func/std": 0.0, "rewards/question_recreation_reward_func/mean": 0.0803598091006279, "rewards/question_recreation_reward_func/std": 0.06639377772808075, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "rewards/strict_format_reward_func/mean": 0.0, "rewards/strict_format_reward_func/std": 0.0, "rewards/xmlcount_reward_func/mean": 0.0625, "rewards/xmlcount_reward_func/std": 0.125, "step": 7 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 72.0, "completions/max_terminated_length": 72.0, "completions/mean_length": 31.75, "completions/mean_terminated_length": 31.75, "completions/min_length": 6.0, "completions/min_terminated_length": 6.0, "epoch": 0.3333333333333333, "grad_norm": 69.37403106689453, "kl": 0.660507733002305, "learning_rate": 2.500000000000001e-07, "loss": -0.0009, "num_tokens": 6472.0, "reward": 0.08257974684238434, "reward_std": 0.10520116984844208, "rewards/concensus_correctness_reward_func/mean": 0.0, "rewards/concensus_correctness_reward_func/std": 0.0, "rewards/consensus_reward_func/mean": 0.0, "rewards/consensus_reward_func/std": 0.0, "rewards/cumulative_reward_2/mean": 0.0, "rewards/cumulative_reward_2/std": 0.0, "rewards/final_correctness_reward_func/mean": 0.0, "rewards/final_correctness_reward_func/std": 0.0, "rewards/question_recreation_reward_func/mean": 0.024079740047454834, "rewards/question_recreation_reward_func/std": 0.0149986008182168, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "rewards/strict_format_reward_func/mean": 0.0, "rewards/strict_format_reward_func/std": 0.0, "rewards/xmlcount_reward_func/mean": 0.05849999934434891, "rewards/xmlcount_reward_func/std": 0.13300000131130219, "step": 8 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.25, "completions/max_length": 448.0, "completions/max_terminated_length": 345.0, "completions/mean_length": 230.5, "completions/mean_terminated_length": 158.0, "completions/min_length": 56.0, "completions/min_terminated_length": 56.0, "epoch": 0.375, "grad_norm": 8.065352439880371, "kl": 0.008895490551367402, "learning_rate": 1.1697777844051104e-07, "loss": 0.5052, "num_tokens": 7906.0, "reward": -0.4270660877227783, "reward_std": 0.9292497038841248, "rewards/concensus_correctness_reward_func/mean": 0.0, "rewards/concensus_correctness_reward_func/std": 0.0, "rewards/consensus_reward_func/mean": 0.0, "rewards/consensus_reward_func/std": 0.0, "rewards/cumulative_reward_2/mean": 0.0, "rewards/cumulative_reward_2/std": 0.0, "rewards/final_correctness_reward_func/mean": 0.0, "rewards/final_correctness_reward_func/std": 0.0, "rewards/question_recreation_reward_func/mean": 0.16618388891220093, "rewards/question_recreation_reward_func/std": 0.13774648308753967, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "rewards/strict_format_reward_func/mean": 0.0, "rewards/strict_format_reward_func/std": 0.0, "rewards/xmlcount_reward_func/mean": -0.5932499766349792, "rewards/xmlcount_reward_func/std": 1.2711997032165527, "step": 9 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 84.0, "completions/max_terminated_length": 84.0, "completions/mean_length": 37.0, "completions/mean_terminated_length": 37.0, "completions/min_length": 5.0, "completions/min_terminated_length": 5.0, "epoch": 0.4166666666666667, "grad_norm": 71.09834289550781, "kl": 0.057335725985467434, "learning_rate": 3.015368960704584e-08, "loss": 0.0504, "num_tokens": 8566.0, "reward": 0.14473699033260345, "reward_std": 0.09234187006950378, "rewards/concensus_correctness_reward_func/mean": 0.0, "rewards/concensus_correctness_reward_func/std": 0.0, "rewards/consensus_reward_func/mean": 0.0, "rewards/consensus_reward_func/std": 0.0, "rewards/cumulative_reward_2/mean": 0.0, "rewards/cumulative_reward_2/std": 0.0, "rewards/final_correctness_reward_func/mean": 0.0, "rewards/final_correctness_reward_func/std": 0.0, "rewards/question_recreation_reward_func/mean": 0.019736986607313156, "rewards/question_recreation_reward_func/std": 0.008162936195731163, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "rewards/strict_format_reward_func/mean": 0.0, "rewards/strict_format_reward_func/std": 0.0, "rewards/xmlcount_reward_func/mean": 0.125, "rewards/xmlcount_reward_func/std": 0.10206207633018494, "step": 10 }, { "epoch": 0.4166666666666667, "step": 10, "total_flos": 0.0, "train_loss": 0.12070619501173496, "train_runtime": 3637.1703, "train_samples_per_second": 0.011, "train_steps_per_second": 0.003 } ], "logging_steps": 1, "max_steps": 10, "num_input_tokens_seen": 8566, "num_train_epochs": 1, "save_steps": 25, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 0.0, "train_batch_size": 2, "trial_name": null, "trial_params": null }