{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 1.0, "eval_steps": 500, "global_step": 20, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "completion_length": 257.4375, "epoch": 0.1, "grad_norm": 42.85694885253906, "kl": 0.0, "learning_rate": 4.965903258506806e-07, "loss": -0.0, "reward": 3.9454924832098186, "reward_std": 0.42792381439357996, "rewards/concensus_correctness_reward_func": 1.140250001102686, "rewards/consensus_reward_func": 1.0625, "rewards/cumulative_reward_2": 0.0, "rewards/final_correctness_reward_func": 0.125, "rewards/question_recreation_reward_func": 0.6025862665846944, "rewards/soft_format_reward_func": 0.0, "rewards/strict_format_reward_func": 0.234375, "rewards/xmlcount_reward_func": 0.7807812502142042, "step": 2 }, { "completion_length": 128.9375, "epoch": 0.2, "grad_norm": 29.040935516357422, "kl": 0.5335751844104379, "learning_rate": 4.698684378016222e-07, "loss": 0.0005, "reward": 6.755986243486404, "reward_std": 0.613882417572313, "rewards/concensus_correctness_reward_func": 2.0146249905228615, "rewards/consensus_reward_func": 1.8125, "rewards/cumulative_reward_2": 0.0, "rewards/final_correctness_reward_func": 0.3125, "rewards/question_recreation_reward_func": 0.9619550406932831, "rewards/soft_format_reward_func": 0.0, "rewards/strict_format_reward_func": 0.4375, "rewards/xmlcount_reward_func": 1.2169062495231628, "step": 4 }, { "completion_length": 158.21875, "epoch": 0.3, "grad_norm": 106.23600006103516, "kl": 5.85334307141602, "learning_rate": 4.193203929064353e-07, "loss": 0.0059, "reward": 6.254412055015564, "reward_std": 0.22973583391285501, "rewards/concensus_correctness_reward_func": 1.7211249731481075, "rewards/consensus_reward_func": 1.875, "rewards/cumulative_reward_2": 0.0, "rewards/final_correctness_reward_func": 0.125, "rewards/question_recreation_reward_func": 0.9672870673239231, "rewards/soft_format_reward_func": 0.0, "rewards/strict_format_reward_func": 0.359375, "rewards/xmlcount_reward_func": 1.2066249996423721, "step": 6 }, { "completion_length": 132.40625, "epoch": 0.4, "grad_norm": 908.352294921875, "kl": 31.59648933983408, "learning_rate": 3.5042385616324236e-07, "loss": 0.0316, "reward": 6.495247453451157, "reward_std": 0.32210062145168195, "rewards/concensus_correctness_reward_func": 1.9354375074617565, "rewards/consensus_reward_func": 1.8125, "rewards/cumulative_reward_2": 0.0, "rewards/final_correctness_reward_func": 0.25, "rewards/question_recreation_reward_func": 0.9586224667727947, "rewards/soft_format_reward_func": 0.0, "rewards/strict_format_reward_func": 0.390625, "rewards/xmlcount_reward_func": 1.148062501102686, "step": 8 }, { "completion_length": 127.25, "epoch": 0.5, "grad_norm": 28.126314163208008, "kl": 7.050176987890154, "learning_rate": 2.706448363680831e-07, "loss": 0.007, "reward": 7.01416951417923, "reward_std": 0.1968466019607149, "rewards/concensus_correctness_reward_func": 2.168624997138977, "rewards/consensus_reward_func": 2.0, "rewards/cumulative_reward_2": 0.0, "rewards/final_correctness_reward_func": 0.25, "rewards/question_recreation_reward_func": 0.9477632120251656, "rewards/soft_format_reward_func": 0.0, "rewards/strict_format_reward_func": 0.4375, "rewards/xmlcount_reward_func": 1.2102812454104424, "step": 10 }, { "completion_length": 133.96875, "epoch": 0.6, "grad_norm": 36.5333366394043, "kl": 4.253114338440355, "learning_rate": 1.886286282148002e-07, "loss": 0.0043, "reward": 5.7655471712350845, "reward_std": 0.4229842454078607, "rewards/concensus_correctness_reward_func": 1.6347499825060368, "rewards/consensus_reward_func": 1.75, "rewards/cumulative_reward_2": 0.0, "rewards/final_correctness_reward_func": 0.0, "rewards/question_recreation_reward_func": 0.8757346980273724, "rewards/soft_format_reward_func": 0.0, "rewards/strict_format_reward_func": 0.359375, "rewards/xmlcount_reward_func": 1.145687498152256, "step": 12 }, { "completion_length": 140.5, "epoch": 0.7, "grad_norm": 21.523326873779297, "kl": 6.09225378325209, "learning_rate": 1.1326296046939333e-07, "loss": 0.0061, "reward": 6.578316897153854, "reward_std": 0.8162273239577189, "rewards/concensus_correctness_reward_func": 1.9833124913275242, "rewards/consensus_reward_func": 1.8125, "rewards/cumulative_reward_2": 0.0, "rewards/final_correctness_reward_func": 0.25, "rewards/question_recreation_reward_func": 0.9454732052981853, "rewards/soft_format_reward_func": 0.0, "rewards/strict_format_reward_func": 0.421875, "rewards/xmlcount_reward_func": 1.1651562489569187, "step": 14 }, { "completion_length": 132.71875, "epoch": 0.8, "grad_norm": 209618192.0, "kl": 11914987.063571038, "learning_rate": 5.271487265090163e-08, "loss": 11914.9883, "reward": 6.235501676797867, "reward_std": 0.6787745207548141, "rewards/concensus_correctness_reward_func": 1.7827499955892563, "rewards/consensus_reward_func": 1.875, "rewards/cumulative_reward_2": 0.0, "rewards/final_correctness_reward_func": 0.0625, "rewards/question_recreation_reward_func": 0.9308142438530922, "rewards/soft_format_reward_func": 0.0, "rewards/strict_format_reward_func": 0.390625, "rewards/xmlcount_reward_func": 1.1938124969601631, "step": 16 }, { "completion_length": 137.46875, "epoch": 0.9, "grad_norm": 56.26324462890625, "kl": 8.98876704229042, "learning_rate": 1.3545689574841341e-08, "loss": 0.009, "reward": 5.684117838740349, "reward_std": 0.903291186405113, "rewards/concensus_correctness_reward_func": 1.6847499907016754, "rewards/consensus_reward_func": 1.5625, "rewards/cumulative_reward_2": 0.0, "rewards/final_correctness_reward_func": 0.0625, "rewards/question_recreation_reward_func": 0.9103366248309612, "rewards/soft_format_reward_func": 0.0, "rewards/strict_format_reward_func": 0.328125, "rewards/xmlcount_reward_func": 1.1359062530100346, "step": 18 }, { "completion_length": 130.0, "epoch": 1.0, "grad_norm": 21.837852478027344, "kl": 30.217751567950472, "learning_rate": 0.0, "loss": 0.0302, "reward": 6.407116562128067, "reward_std": 0.8622763247403782, "rewards/concensus_correctness_reward_func": 1.8597499802708626, "rewards/consensus_reward_func": 1.875, "rewards/cumulative_reward_2": 0.0, "rewards/final_correctness_reward_func": 0.125, "rewards/question_recreation_reward_func": 0.926741586998105, "rewards/soft_format_reward_func": 0.0, "rewards/strict_format_reward_func": 0.421875, "rewards/xmlcount_reward_func": 1.1987500004470348, "step": 20 }, { "epoch": 1.0, "step": 20, "total_flos": 0.0, "train_loss": 1191.5082876126398, "train_runtime": 82.3672, "train_samples_per_second": 3.885, "train_steps_per_second": 0.243 } ], "logging_steps": 2, "max_steps": 20, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 25, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 0.0, "train_batch_size": 2, "trial_name": null, "trial_params": null }