{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.7843137254901961, "eval_steps": 500, "global_step": 20, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0625, "completions/max_length": 667.5, "completions/max_terminated_length": 452.0, "completions/mean_length": 222.4375, "completions/mean_terminated_length": 172.5089340209961, "completions/min_length": 15.5, "completions/min_terminated_length": 15.5, "epoch": 0.0784313725490196, "frac_reward_zero_std": 0.0, "grad_norm": 10.582316398620605, "kl": -4.784070639640703e-09, "learning_rate": 5e-07, "loss": -0.118, "num_tokens": 7655.0, "reward": 0.08023529499769211, "reward_std": 0.023692099610343575, "rewards/concensus_correctness_reward_func/mean": 0.0, "rewards/concensus_correctness_reward_func/std": 0.0, "rewards/consensus_reward_func/mean": 0.0, "rewards/consensus_reward_func/std": 0.0, "rewards/cumulative_reward_2/mean": 0.0, "rewards/cumulative_reward_2/std": 0.0, "rewards/final_correctness_reward_func/mean": 0.0, "rewards/final_correctness_reward_func/std": 0.0, "rewards/question_recreation_reward_func/mean": 0.08023529499769211, "rewards/question_recreation_reward_func/std": 0.024613698944449425, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "rewards/strict_format_reward_func/mean": 0.0, "rewards/strict_format_reward_func/std": 0.0, "rewards/xmlcount_reward_func/mean": 0.0, "rewards/xmlcount_reward_func/std": 0.0, "step": 2 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.125, "completions/max_length": 984.5, "completions/max_terminated_length": 886.5, "completions/mean_length": 432.9375, "completions/mean_terminated_length": 351.4375, "completions/min_length": 74.5, "completions/min_terminated_length": 74.5, "epoch": 0.1568627450980392, "frac_reward_zero_std": 0.0, "grad_norm": 6.236111164093018, "kl": 0.00019753339893213706, "learning_rate": 4.864543104251586e-07, "loss": -0.137, "num_tokens": 18678.0, "reward": -0.0831574909389019, "reward_std": 0.14662296720780432, "rewards/concensus_correctness_reward_func/mean": 0.0, "rewards/concensus_correctness_reward_func/std": 0.0, "rewards/consensus_reward_func/mean": 0.0, "rewards/consensus_reward_func/std": 0.0, "rewards/cumulative_reward_2/mean": 0.0, "rewards/cumulative_reward_2/std": 0.0, "rewards/final_correctness_reward_func/mean": 0.0, "rewards/final_correctness_reward_func/std": 0.0, "rewards/question_recreation_reward_func/mean": 0.016717517748475075, "rewards/question_recreation_reward_func/std": 0.008825697470456362, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "rewards/strict_format_reward_func/mean": 0.0, "rewards/strict_format_reward_func/std": 0.0, "rewards/xmlcount_reward_func/mean": -0.09987500309944153, "rewards/xmlcount_reward_func/std": 0.28248918056488037, "step": 4 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0625, "completions/max_length": 862.5, "completions/max_terminated_length": 620.5, "completions/mean_length": 274.75, "completions/mean_terminated_length": 224.85714721679688, "completions/min_length": 32.5, "completions/min_terminated_length": 32.5, "epoch": 0.23529411764705882, "frac_reward_zero_std": 0.0, "grad_norm": 8.984740257263184, "kl": 0.0007774862242513336, "learning_rate": 4.472851273490984e-07, "loss": -0.0403, "num_tokens": 27170.0, "reward": 0.10502731800079346, "reward_std": 0.03363147936761379, "rewards/concensus_correctness_reward_func/mean": 0.0, "rewards/concensus_correctness_reward_func/std": 0.0, "rewards/consensus_reward_func/mean": 0.0, "rewards/consensus_reward_func/std": 0.0, "rewards/cumulative_reward_2/mean": 0.0, "rewards/cumulative_reward_2/std": 0.0, "rewards/final_correctness_reward_func/mean": 0.0, "rewards/final_correctness_reward_func/std": 0.0, "rewards/question_recreation_reward_func/mean": 0.10502731800079346, "rewards/question_recreation_reward_func/std": 0.05110013298690319, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "rewards/strict_format_reward_func/mean": 0.0, "rewards/strict_format_reward_func/std": 0.0, "rewards/xmlcount_reward_func/mean": 0.0, "rewards/xmlcount_reward_func/std": 0.0, "step": 6 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.125, "completions/max_length": 1024.0, "completions/max_terminated_length": 631.0, "completions/mean_length": 316.5, "completions/mean_terminated_length": 215.4285888671875, "completions/min_length": 24.5, "completions/min_terminated_length": 24.5, "epoch": 0.3137254901960784, "frac_reward_zero_std": 0.125, "grad_norm": 20.830415725708008, "kl": 0.001665158382820664, "learning_rate": 3.867370395306068e-07, "loss": 0.1506, "num_tokens": 36330.0, "reward": 0.3101906329393387, "reward_std": 0.030688787577673793, "rewards/concensus_correctness_reward_func/mean": 0.0, "rewards/concensus_correctness_reward_func/std": 0.0, "rewards/consensus_reward_func/mean": 0.25, "rewards/consensus_reward_func/std": 0.4629100561141968, "rewards/cumulative_reward_2/mean": 0.0, "rewards/cumulative_reward_2/std": 0.0, "rewards/final_correctness_reward_func/mean": 0.0, "rewards/final_correctness_reward_func/std": 0.0, "rewards/question_recreation_reward_func/mean": 0.0601906543597579, "rewards/question_recreation_reward_func/std": 0.03427481045946479, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "rewards/strict_format_reward_func/mean": 0.0, "rewards/strict_format_reward_func/std": 0.0, "rewards/xmlcount_reward_func/mean": 0.0, "rewards/xmlcount_reward_func/std": 0.0, "step": 8 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 883.0, "completions/max_terminated_length": 883.0, "completions/mean_length": 373.75, "completions/mean_terminated_length": 373.75, "completions/min_length": 42.0, "completions/min_terminated_length": 42.0, "epoch": 0.39215686274509803, "frac_reward_zero_std": 0.0, "grad_norm": 4.482949733734131, "kl": 0.001862530603830237, "learning_rate": 3.1137137178519977e-07, "loss": 0.0358, "num_tokens": 46406.0, "reward": 0.04348368709906936, "reward_std": 0.021108464570716023, "rewards/concensus_correctness_reward_func/mean": 0.0, "rewards/concensus_correctness_reward_func/std": 0.0, "rewards/consensus_reward_func/mean": 0.0, "rewards/consensus_reward_func/std": 0.0, "rewards/cumulative_reward_2/mean": 0.0, "rewards/cumulative_reward_2/std": 0.0, "rewards/final_correctness_reward_func/mean": 0.0, "rewards/final_correctness_reward_func/std": 0.0, "rewards/question_recreation_reward_func/mean": 0.04348368709906936, "rewards/question_recreation_reward_func/std": 0.03131787059828639, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "rewards/strict_format_reward_func/mean": 0.0, "rewards/strict_format_reward_func/std": 0.0, "rewards/xmlcount_reward_func/mean": 0.0, "rewards/xmlcount_reward_func/std": 0.0, "step": 10 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.1875, "completions/max_length": 1024.0, "completions/max_terminated_length": 640.0, "completions/mean_length": 482.625, "completions/mean_terminated_length": 374.16668701171875, "completions/min_length": 82.5, "completions/min_terminated_length": 82.5, "epoch": 0.47058823529411764, "frac_reward_zero_std": 0.0, "grad_norm": 8.272782325744629, "kl": 0.0026207715563941747, "learning_rate": 2.2935516363191693e-07, "loss": 0.0546, "num_tokens": 58224.0, "reward": 0.05969332344830036, "reward_std": 0.03567563369870186, "rewards/concensus_correctness_reward_func/mean": 0.0, "rewards/concensus_correctness_reward_func/std": 0.0, "rewards/consensus_reward_func/mean": 0.0, "rewards/consensus_reward_func/std": 0.0, "rewards/cumulative_reward_2/mean": 0.0, "rewards/cumulative_reward_2/std": 0.0, "rewards/final_correctness_reward_func/mean": 0.0, "rewards/final_correctness_reward_func/std": 0.0, "rewards/question_recreation_reward_func/mean": 0.04563082382082939, "rewards/question_recreation_reward_func/std": 0.03295238898135722, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "rewards/strict_format_reward_func/mean": 0.0, "rewards/strict_format_reward_func/std": 0.0, "rewards/xmlcount_reward_func/mean": 0.014062500093132257, "rewards/xmlcount_reward_func/std": 0.039774756878614426, "step": 12 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.1875, "completions/max_length": 677.0, "completions/max_terminated_length": 376.0, "completions/mean_length": 308.0, "completions/mean_terminated_length": 156.76250457763672, "completions/min_length": 64.0, "completions/min_terminated_length": 64.0, "epoch": 0.5490196078431373, "frac_reward_zero_std": 0.0, "grad_norm": 14.544376373291016, "kl": 0.0033570137748029083, "learning_rate": 1.4957614383675767e-07, "loss": 0.009, "num_tokens": 67248.0, "reward": 0.01620261650532484, "reward_std": 0.0063501952681690454, "rewards/concensus_correctness_reward_func/mean": 0.0, "rewards/concensus_correctness_reward_func/std": 0.0, "rewards/consensus_reward_func/mean": 0.0, "rewards/consensus_reward_func/std": 0.0, "rewards/cumulative_reward_2/mean": 0.0, "rewards/cumulative_reward_2/std": 0.0, "rewards/final_correctness_reward_func/mean": 0.0, "rewards/final_correctness_reward_func/std": 0.0, "rewards/question_recreation_reward_func/mean": 0.01620261650532484, "rewards/question_recreation_reward_func/std": 0.007352772634476423, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "rewards/strict_format_reward_func/mean": 0.0, "rewards/strict_format_reward_func/std": 0.0, "rewards/xmlcount_reward_func/mean": 0.0, "rewards/xmlcount_reward_func/std": 0.0, "step": 14 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0625, "completions/max_length": 931.0, "completions/max_terminated_length": 800.5, "completions/mean_length": 343.6875, "completions/mean_terminated_length": 290.5982208251953, "completions/min_length": 30.5, "completions/min_terminated_length": 30.5, "epoch": 0.6274509803921569, "frac_reward_zero_std": 0.0, "grad_norm": 8.895730018615723, "kl": 0.0031596484768670052, "learning_rate": 8.067960709356478e-08, "loss": -0.0141, "num_tokens": 76843.0, "reward": 0.07652556523680687, "reward_std": 0.02881058305501938, "rewards/concensus_correctness_reward_func/mean": 0.0, "rewards/concensus_correctness_reward_func/std": 0.0, "rewards/consensus_reward_func/mean": 0.0, "rewards/consensus_reward_func/std": 0.0, "rewards/cumulative_reward_2/mean": 0.0, "rewards/cumulative_reward_2/std": 0.0, "rewards/final_correctness_reward_func/mean": 0.0, "rewards/final_correctness_reward_func/std": 0.0, "rewards/question_recreation_reward_func/mean": 0.07652556523680687, "rewards/question_recreation_reward_func/std": 0.05606217496097088, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "rewards/strict_format_reward_func/mean": 0.0, "rewards/strict_format_reward_func/std": 0.0, "rewards/xmlcount_reward_func/mean": 0.0, "rewards/xmlcount_reward_func/std": 0.0, "step": 16 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.125, "completions/max_length": 942.0, "completions/max_terminated_length": 656.5, "completions/mean_length": 427.3125, "completions/mean_terminated_length": 314.9791679382324, "completions/min_length": 89.0, "completions/min_terminated_length": 89.0, "epoch": 0.7058823529411765, "frac_reward_zero_std": 0.0, "grad_norm": 4.773468494415283, "kl": 0.004317194048780948, "learning_rate": 3.013156219837776e-08, "loss": 0.1024, "num_tokens": 87776.0, "reward": 0.06278230529278517, "reward_std": 0.014868666417896748, "rewards/concensus_correctness_reward_func/mean": 0.0, "rewards/concensus_correctness_reward_func/std": 0.0, "rewards/consensus_reward_func/mean": 0.0, "rewards/consensus_reward_func/std": 0.0, "rewards/cumulative_reward_2/mean": 0.0, "rewards/cumulative_reward_2/std": 0.0, "rewards/final_correctness_reward_func/mean": 0.0, "rewards/final_correctness_reward_func/std": 0.0, "rewards/question_recreation_reward_func/mean": 0.06278230529278517, "rewards/question_recreation_reward_func/std": 0.038148720283061266, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "rewards/strict_format_reward_func/mean": 0.0, "rewards/strict_format_reward_func/std": 0.0, "rewards/xmlcount_reward_func/mean": 0.0, "rewards/xmlcount_reward_func/std": 0.0, "step": 18 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 574.5, "completions/max_terminated_length": 574.5, "completions/mean_length": 288.0625, "completions/mean_terminated_length": 288.0625, "completions/min_length": 45.5, "completions/min_terminated_length": 45.5, "epoch": 0.7843137254901961, "frac_reward_zero_std": 0.0, "grad_norm": 6.394106864929199, "kl": 0.002251003446872346, "learning_rate": 3.4096741493194193e-09, "loss": 0.1453, "num_tokens": 96481.0, "reward": 0.08274493180215359, "reward_std": 0.06434697424992919, "rewards/concensus_correctness_reward_func/mean": 0.0, "rewards/concensus_correctness_reward_func/std": 0.0, "rewards/consensus_reward_func/mean": 0.0, "rewards/consensus_reward_func/std": 0.0, "rewards/cumulative_reward_2/mean": 0.0, "rewards/cumulative_reward_2/std": 0.0, "rewards/final_correctness_reward_func/mean": 0.0, "rewards/final_correctness_reward_func/std": 0.0, "rewards/question_recreation_reward_func/mean": 0.07486993633210659, "rewards/question_recreation_reward_func/std": 0.05120457522571087, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "rewards/strict_format_reward_func/mean": 0.0, "rewards/strict_format_reward_func/std": 0.0, "rewards/xmlcount_reward_func/mean": 0.00787500012665987, "rewards/xmlcount_reward_func/std": 0.022273864597082138, "step": 20 }, { "epoch": 0.7843137254901961, "step": 20, "total_flos": 0.0, "train_loss": 0.018828855734318493, "train_runtime": 1548.9658, "train_samples_per_second": 0.103, "train_steps_per_second": 0.013 } ], "logging_steps": 2, "max_steps": 20, "num_input_tokens_seen": 96481, "num_train_epochs": 1, "save_steps": 25, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 0.0, "train_batch_size": 2, "trial_name": null, "trial_params": null }