{ "best_metric": null, "best_model_checkpoint": null, "epoch": 0.49919376007799904, "eval_steps": 50, "global_step": 208, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.02065972222222221, "completions/max_length": 4047.0, "completions/max_terminated_length": 4047.0, "completions/mean_length": 495.66493530273436, "completions/mean_terminated_length": 506.1021301269531, "completions/min_length": 0.0, "completions/min_terminated_length": 2.4, "epoch": 0.011999850001874977, "grad_norm": 0.47694680094718933, "learning_rate": 2.2727272727272728e-06, "loss": 0.0099, "num_tokens": 7626188.0, "reward": 0.4157118022441864, "reward_std": 0.35606788396835326, "rewards/accuracy_reward": 0.25520833134651183, "rewards/brier_reward": 0.0, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.5762152791023254, "rewards/mean_confidence_reward": 0.0, "step": 5 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01171875, "completions/max_length": 3730.2, "completions/max_terminated_length": 3730.2, "completions/mean_length": 371.2526123046875, "completions/mean_terminated_length": 375.78693237304685, "completions/min_length": 0.0, "completions/min_terminated_length": 19.4, "epoch": 0.023999700003749954, "grad_norm": 0.0010379819432273507, "learning_rate": 4.5454545454545455e-06, "loss": -0.0026, "num_tokens": 13787658.0, "reward": 0.6760850787162781, "reward_std": 0.2362564116716385, "rewards/accuracy_reward": 0.4039930462837219, "rewards/brier_reward": 0.0, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9481770873069764, "rewards/mean_confidence_reward": 0.0, "step": 10 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.013975694444444442, "completions/max_length": 4018.4, "completions/max_terminated_length": 4018.4, "completions/mean_length": 464.33099365234375, "completions/mean_terminated_length": 471.20233764648435, "completions/min_length": 0.0, "completions/min_terminated_length": 54.6, "epoch": 0.03599955000562493, "grad_norm": 0.0006205081008374691, "learning_rate": 4.898477157360406e-06, "loss": -0.0066, "num_tokens": 21040655.0, "reward": 0.7481770992279053, "reward_std": 0.18966231644153594, "rewards/accuracy_reward": 0.5131944417953491, "rewards/brier_reward": 0.0, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9831597328186035, "rewards/mean_confidence_reward": 0.0, "step": 15 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01649305555555556, "completions/max_length": 3962.2, "completions/max_terminated_length": 3962.2, "completions/mean_length": 579.791845703125, "completions/mean_terminated_length": 589.5614501953125, "completions/min_length": 0.0, "completions/min_terminated_length": 119.6, "epoch": 0.04799940000749991, "grad_norm": 0.00045936586684547365, "learning_rate": 4.771573604060914e-06, "loss": -0.0088, "num_tokens": 29635473.0, "reward": 0.7965711951255798, "reward_std": 0.1594875305891037, "rewards/accuracy_reward": 0.6106770873069763, "rewards/brier_reward": 0.0, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9824652791023254, "rewards/mean_confidence_reward": 0.0, "step": 20 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.012673611111111094, "completions/max_length": 3394.8, "completions/max_terminated_length": 3394.8, "completions/mean_length": 605.4309936523438, "completions/mean_terminated_length": 613.314404296875, "completions/min_length": 0.0, "completions/min_terminated_length": 129.6, "epoch": 0.05999925000937488, "grad_norm": 0.0004269441997166723, "learning_rate": 4.644670050761422e-06, "loss": -0.0069, "num_tokens": 38536406.0, "reward": 0.8223090291023254, "reward_std": 0.13588928282260895, "rewards/accuracy_reward": 0.6580729246139526, "rewards/brier_reward": 0.0, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9865451455116272, "rewards/mean_confidence_reward": 0.0, "step": 25 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.017361111111111115, "completions/max_length": 3280.8, "completions/max_terminated_length": 3280.8, "completions/mean_length": 605.2468017578125, "completions/mean_terminated_length": 616.0807861328125, "completions/min_length": 0.0, "completions/min_terminated_length": 123.0, "epoch": 0.07199910001124986, "grad_norm": 0.000590955838561058, "learning_rate": 4.5177664974619295e-06, "loss": -0.0102, "num_tokens": 47420689.0, "reward": 0.8153645873069764, "reward_std": 0.14741556644439696, "rewards/accuracy_reward": 0.6482638835906982, "rewards/brier_reward": 0.0, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9824652791023254, "rewards/mean_confidence_reward": 0.0, "step": 30 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.02178819444444442, "completions/max_length": 3437.4, "completions/max_terminated_length": 3437.4, "completions/mean_length": 595.20625, "completions/mean_terminated_length": 608.612451171875, "completions/min_length": 0.0, "completions/min_terminated_length": 141.2, "epoch": 0.08399895001312484, "grad_norm": 0.0004463954537641257, "learning_rate": 4.390862944162436e-06, "loss": -0.013, "num_tokens": 56156825.0, "reward": 0.8129774451255798, "reward_std": 0.13939182609319686, "rewards/accuracy_reward": 0.6477430462837219, "rewards/brier_reward": 0.0, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9782117962837219, "rewards/mean_confidence_reward": 0.0, "step": 35 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.025954861111111116, "completions/max_length": 3589.0, "completions/max_terminated_length": 3589.0, "completions/mean_length": 608.2237060546875, "completions/mean_terminated_length": 624.4381469726562, "completions/min_length": 0.0, "completions/min_terminated_length": 144.4, "epoch": 0.09599880001499982, "grad_norm": 0.0005039877141825855, "learning_rate": 4.263959390862945e-06, "loss": -0.0181, "num_tokens": 65085002.0, "reward": 0.8188802123069763, "reward_std": 0.13610992431640626, "rewards/accuracy_reward": 0.6638020873069763, "rewards/brier_reward": 0.0, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9739583253860473, "rewards/mean_confidence_reward": 0.0, "step": 40 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.024826388888888884, "completions/max_length": 3807.0, "completions/max_terminated_length": 3807.0, "completions/mean_length": 640.9053955078125, "completions/mean_terminated_length": 657.2029418945312, "completions/min_length": 0.0, "completions/min_terminated_length": 145.4, "epoch": 0.1079986500168748, "grad_norm": 0.00040095733129419386, "learning_rate": 4.137055837563453e-06, "loss": -0.0146, "num_tokens": 74405416.0, "reward": 0.8217013955116272, "reward_std": 0.13904002010822297, "rewards/accuracy_reward": 0.6684895753860474, "rewards/brier_reward": 0.0, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9749131917953491, "rewards/mean_confidence_reward": 0.0, "step": 45 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.02352430555555556, "completions/max_length": 3562.0, "completions/max_terminated_length": 3562.0, "completions/mean_length": 639.3743896484375, "completions/mean_terminated_length": 654.712939453125, "completions/min_length": 0.0, "completions/min_terminated_length": 162.4, "epoch": 0.11999850001874976, "grad_norm": 0.0005420144880190492, "learning_rate": 4.0101522842639595e-06, "loss": -0.0162, "num_tokens": 83670529.0, "reward": 0.8127604246139526, "reward_std": 0.13803613781929017, "rewards/accuracy_reward": 0.6490451335906983, "rewards/brier_reward": 0.0, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9764756798744202, "rewards/mean_confidence_reward": 0.0, "step": 50 }, { "epoch": 0.11999850001874976, "eval_completions/clipped_ratio": 0.025868055555555547, "eval_completions/max_length": 2410.0, "eval_completions/max_terminated_length": 2410.0, "eval_completions/mean_length": 618.3784891764323, "eval_completions/mean_terminated_length": 634.7286783854166, "eval_completions/min_length": 0.0, "eval_completions/min_terminated_length": 202.16666666666666, "eval_loss": 0.0, "eval_num_tokens": 83670529.0, "eval_reward": 0.816406269868215, "eval_reward_std": 0.2650855928659439, "eval_rewards/accuracy_reward": 0.6588541666666666, "eval_rewards/brier_reward": 0.0, "eval_rewards/confidence_one_or_zero": 0.0, "eval_rewards/format_reward": 0.9739583233992258, "eval_rewards/mean_confidence_reward": 0.0, "eval_runtime": 317.036, "eval_samples_per_second": 3.154, "eval_steps_per_second": 0.019, "step": 50 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0265625, "completions/max_length": 3296.0, "completions/max_terminated_length": 3296.0, "completions/mean_length": 634.9600708007813, "completions/mean_terminated_length": 652.637939453125, "completions/min_length": 0.0, "completions/min_terminated_length": 145.6, "epoch": 0.13199835002062474, "grad_norm": 0.0007147942669689655, "learning_rate": 3.883248730964467e-06, "loss": -0.0147, "num_tokens": 92867765.0, "reward": 0.8098524332046508, "reward_std": 0.13919124156236648, "rewards/accuracy_reward": 0.6467013835906983, "rewards/brier_reward": 0.0, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9730034708976746, "rewards/mean_confidence_reward": 0.0, "step": 55 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.020486111111111115, "completions/max_length": 3785.2, "completions/max_terminated_length": 3785.2, "completions/mean_length": 638.7587768554688, "completions/mean_terminated_length": 652.251123046875, "completions/min_length": 0.0, "completions/min_terminated_length": 149.0, "epoch": 0.14399820002249972, "grad_norm": 0.0006786566809751093, "learning_rate": 3.756345177664975e-06, "loss": -0.0139, "num_tokens": 102124762.0, "reward": 0.8063802123069763, "reward_std": 0.13464951664209365, "rewards/accuracy_reward": 0.63359375, "rewards/brier_reward": 0.0, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9791666626930237, "rewards/mean_confidence_reward": 0.0, "step": 60 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.015364583333333326, "completions/max_length": 3440.2, "completions/max_terminated_length": 3440.2, "completions/mean_length": 628.39228515625, "completions/mean_terminated_length": 638.17490234375, "completions/min_length": 0.0, "completions/min_terminated_length": 141.6, "epoch": 0.1559980500243747, "grad_norm": 0.0004710310895461589, "learning_rate": 3.629441624365482e-06, "loss": -0.0085, "num_tokens": 111259809.0, "reward": 0.8261718869209289, "reward_std": 0.11869495064020157, "rewards/accuracy_reward": 0.6677951335906982, "rewards/brier_reward": 0.0, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9845486164093018, "rewards/mean_confidence_reward": 0.0, "step": 65 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.02109375, "completions/max_length": 3541.8, "completions/max_terminated_length": 3541.8, "completions/mean_length": 620.9056396484375, "completions/mean_terminated_length": 634.306201171875, "completions/min_length": 0.0, "completions/min_terminated_length": 114.4, "epoch": 0.16799790002624967, "grad_norm": 0.0005915550282225013, "learning_rate": 3.5025380710659903e-06, "loss": -0.0141, "num_tokens": 120292706.0, "reward": 0.8110677123069763, "reward_std": 0.12359137833118439, "rewards/accuracy_reward": 0.6433159708976746, "rewards/brier_reward": 0.0, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9788194417953491, "rewards/mean_confidence_reward": 0.0, "step": 70 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.013368055555555558, "completions/max_length": 2899.0, "completions/max_terminated_length": 2899.0, "completions/mean_length": 608.4648559570312, "completions/mean_terminated_length": 616.763671875, "completions/min_length": 0.0, "completions/min_terminated_length": 150.4, "epoch": 0.17999775002812465, "grad_norm": 0.00045338328345678747, "learning_rate": 3.375634517766498e-06, "loss": -0.008, "num_tokens": 129169037.0, "reward": 0.8407552123069764, "reward_std": 0.11922919005155563, "rewards/accuracy_reward": 0.6949652910232544, "rewards/brier_reward": 0.0, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9865451335906983, "rewards/mean_confidence_reward": 0.0, "step": 75 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.023177083333333327, "completions/max_length": 3817.4, "completions/max_terminated_length": 3817.4, "completions/mean_length": 648.0177368164062, "completions/mean_terminated_length": 663.47724609375, "completions/min_length": 0.0, "completions/min_terminated_length": 127.4, "epoch": 0.19199760002999963, "grad_norm": 0.00041271100053563714, "learning_rate": 3.2487309644670053e-06, "loss": -0.0138, "num_tokens": 138489401.0, "reward": 0.8135850667953491, "reward_std": 0.12409738302230836, "rewards/accuracy_reward": 0.6503472208976746, "rewards/brier_reward": 0.0, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9768229126930237, "rewards/mean_confidence_reward": 0.0, "step": 80 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.025868055555555537, "completions/max_length": 3501.2, "completions/max_terminated_length": 3501.2, "completions/mean_length": 654.8557373046875, "completions/mean_terminated_length": 672.3203979492188, "completions/min_length": 0.0, "completions/min_terminated_length": 166.8, "epoch": 0.2039974500318746, "grad_norm": 0.00039561674930155277, "learning_rate": 3.121827411167513e-06, "loss": -0.0162, "num_tokens": 147922459.0, "reward": 0.8282986283302307, "reward_std": 0.13599332869052888, "rewards/accuracy_reward": 0.6832465171813965, "rewards/brier_reward": 0.0, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9733506917953492, "rewards/mean_confidence_reward": 0.0, "step": 85 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.02430555555555558, "completions/max_length": 3750.8, "completions/max_terminated_length": 3750.8, "completions/mean_length": 626.2822875976562, "completions/mean_terminated_length": 641.9483764648437, "completions/min_length": 0.0, "completions/min_terminated_length": 136.6, "epoch": 0.2159973000337496, "grad_norm": 0.00046881154412403703, "learning_rate": 2.9949238578680207e-06, "loss": -0.0153, "num_tokens": 157007823.0, "reward": 0.8209635376930237, "reward_std": 0.13299919813871383, "rewards/accuracy_reward": 0.6667534708976746, "rewards/brier_reward": 0.0, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9751736164093018, "rewards/mean_confidence_reward": 0.0, "step": 90 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.018923611111111092, "completions/max_length": 3614.2, "completions/max_terminated_length": 3614.2, "completions/mean_length": 643.94228515625, "completions/mean_terminated_length": 656.3934814453125, "completions/min_length": 0.0, "completions/min_terminated_length": 131.2, "epoch": 0.22799715003562457, "grad_norm": 0.0003850593639072031, "learning_rate": 2.8680203045685284e-06, "loss": -0.0103, "num_tokens": 166319638.0, "reward": 0.8210069537162781, "reward_std": 0.11787589490413666, "rewards/accuracy_reward": 0.6611979007720947, "rewards/brier_reward": 0.0, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9808159828186035, "rewards/mean_confidence_reward": 0.0, "step": 95 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.025347222222222233, "completions/max_length": 3307.0, "completions/max_terminated_length": 3307.0, "completions/mean_length": 667.9455932617187, "completions/mean_terminated_length": 685.2820556640625, "completions/min_length": 0.0, "completions/min_terminated_length": 149.2, "epoch": 0.23999700003749952, "grad_norm": 0.000390661385608837, "learning_rate": 2.7411167512690357e-06, "loss": -0.0161, "num_tokens": 175915363.0, "reward": 0.8228298664093018, "reward_std": 0.127268485724926, "rewards/accuracy_reward": 0.6711805582046508, "rewards/brier_reward": 0.0, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9744791626930237, "rewards/mean_confidence_reward": 0.0, "step": 100 }, { "epoch": 0.23999700003749952, "eval_completions/clipped_ratio": 0.018923611111111127, "eval_completions/max_length": 2499.1666666666665, "eval_completions/max_terminated_length": 2499.1666666666665, "eval_completions/mean_length": 652.9295349121094, "eval_completions/mean_terminated_length": 665.5544128417969, "eval_completions/min_length": 0.0, "eval_completions/min_terminated_length": 209.0, "eval_loss": 0.0, "eval_num_tokens": 175915363.0, "eval_reward": 0.8289930721124014, "eval_reward_std": 0.2512400249640147, "eval_rewards/accuracy_reward": 0.6744791666666666, "eval_rewards/brier_reward": 0.0, "eval_rewards/confidence_one_or_zero": 0.0, "eval_rewards/format_reward": 0.9835069477558136, "eval_rewards/mean_confidence_reward": 0.0, "eval_runtime": 315.8521, "eval_samples_per_second": 3.166, "eval_steps_per_second": 0.019, "step": 100 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.021267361111111115, "completions/max_length": 3450.8, "completions/max_terminated_length": 3450.8, "completions/mean_length": 657.2955810546875, "completions/mean_terminated_length": 671.5618774414063, "completions/min_length": 0.0, "completions/min_terminated_length": 130.6, "epoch": 0.2519968500393745, "grad_norm": 0.0004644222208298743, "learning_rate": 2.6142131979695434e-06, "loss": -0.0128, "num_tokens": 185366192.0, "reward": 0.8306857705116272, "reward_std": 0.11819785684347153, "rewards/accuracy_reward": 0.6831597328186035, "rewards/brier_reward": 0.0, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9782118082046509, "rewards/mean_confidence_reward": 0.0, "step": 105 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01675347222222221, "completions/max_length": 3521.8, "completions/max_terminated_length": 3521.8, "completions/mean_length": 664.1182495117188, "completions/mean_terminated_length": 675.5516235351563, "completions/min_length": 0.0, "completions/min_terminated_length": 157.8, "epoch": 0.2639967000412495, "grad_norm": 0.0004074091266375035, "learning_rate": 2.487309644670051e-06, "loss": -0.0095, "num_tokens": 194927202.0, "reward": 0.8493489623069763, "reward_std": 0.11185714602470398, "rewards/accuracy_reward": 0.7157986283302307, "rewards/brier_reward": 0.0, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9828993082046509, "rewards/mean_confidence_reward": 0.0, "step": 110 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.019010416666666675, "completions/max_length": 3542.0, "completions/max_terminated_length": 3542.0, "completions/mean_length": 662.1376831054688, "completions/mean_terminated_length": 675.0173706054687, "completions/min_length": 0.0, "completions/min_terminated_length": 163.2, "epoch": 0.27599655004312446, "grad_norm": 0.0004749298677779734, "learning_rate": 2.3604060913705588e-06, "loss": -0.0124, "num_tokens": 204436148.0, "reward": 0.831163203716278, "reward_std": 0.11646707653999329, "rewards/accuracy_reward": 0.6817708373069763, "rewards/brier_reward": 0.0, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9805555701255798, "rewards/mean_confidence_reward": 0.0, "step": 115 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.014322916666666652, "completions/max_length": 3572.0, "completions/max_terminated_length": 3572.0, "completions/mean_length": 650.0963623046875, "completions/mean_terminated_length": 659.4545166015625, "completions/min_length": 0.0, "completions/min_terminated_length": 141.6, "epoch": 0.28799640004499943, "grad_norm": 0.0003820126294158399, "learning_rate": 2.233502538071066e-06, "loss": -0.0093, "num_tokens": 213809034.0, "reward": 0.8375434041023254, "reward_std": 0.11465604901313782, "rewards/accuracy_reward": 0.68984375, "rewards/brier_reward": 0.0, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.985243046283722, "rewards/mean_confidence_reward": 0.0, "step": 120 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.013107638888888884, "completions/max_length": 3326.0, "completions/max_terminated_length": 3326.0, "completions/mean_length": 648.654345703125, "completions/mean_terminated_length": 657.3896240234375, "completions/min_length": 0.0, "completions/min_terminated_length": 160.8, "epoch": 0.2999962500468744, "grad_norm": 0.0004972605383954942, "learning_rate": 2.1065989847715737e-06, "loss": -0.0084, "num_tokens": 223201116.0, "reward": 0.8411892294883728, "reward_std": 0.11022633463144302, "rewards/accuracy_reward": 0.6955729126930237, "rewards/brier_reward": 0.0, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9868055701255798, "rewards/mean_confidence_reward": 0.0, "step": 125 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.017447916666666653, "completions/max_length": 3507.8, "completions/max_terminated_length": 3507.8, "completions/mean_length": 680.4585205078125, "completions/mean_terminated_length": 692.4925903320312, "completions/min_length": 0.0, "completions/min_terminated_length": 150.8, "epoch": 0.3119961000487494, "grad_norm": 0.0004750330117531121, "learning_rate": 1.9796954314720814e-06, "loss": -0.0107, "num_tokens": 232966718.0, "reward": 0.8265190958976746, "reward_std": 0.12254964411258698, "rewards/accuracy_reward": 0.6706597208976746, "rewards/brier_reward": 0.0, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9823784708976746, "rewards/mean_confidence_reward": 0.0, "step": 130 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01128472222222221, "completions/max_length": 3688.2, "completions/max_terminated_length": 3688.2, "completions/mean_length": 672.9379272460938, "completions/mean_terminated_length": 680.5967041015625, "completions/min_length": 0.0, "completions/min_terminated_length": 150.8, "epoch": 0.32399595005062437, "grad_norm": 0.0005158277926966548, "learning_rate": 1.852791878172589e-06, "loss": -0.006, "num_tokens": 242613907.0, "reward": 0.8388889074325562, "reward_std": 0.11086668223142623, "rewards/accuracy_reward": 0.6890625, "rewards/brier_reward": 0.0, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9887152671813965, "rewards/mean_confidence_reward": 0.0, "step": 135 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.012847222222222232, "completions/max_length": 3413.0, "completions/max_terminated_length": 3413.0, "completions/mean_length": 675.3115478515625, "completions/mean_terminated_length": 684.0101196289063, "completions/min_length": 0.0, "completions/min_terminated_length": 173.6, "epoch": 0.33599580005249935, "grad_norm": 0.00046416957047767937, "learning_rate": 1.7258883248730964e-06, "loss": -0.0076, "num_tokens": 252299640.0, "reward": 0.8318142294883728, "reward_std": 0.11125441938638687, "rewards/accuracy_reward": 0.6766493082046509, "rewards/brier_reward": 0.0, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9869791626930237, "rewards/mean_confidence_reward": 0.0, "step": 140 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01015625, "completions/max_length": 3253.2, "completions/max_terminated_length": 3253.2, "completions/mean_length": 660.1990600585938, "completions/mean_terminated_length": 667.0159423828125, "completions/min_length": 0.0, "completions/min_terminated_length": 176.2, "epoch": 0.34799565005437433, "grad_norm": 0.00041169917676597834, "learning_rate": 1.5989847715736043e-06, "loss": -0.0057, "num_tokens": 261771661.0, "reward": 0.8521701455116272, "reward_std": 0.10130168348550797, "rewards/accuracy_reward": 0.7144965410232544, "rewards/brier_reward": 0.0, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9898437619209289, "rewards/mean_confidence_reward": 0.0, "step": 145 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01050347222222221, "completions/max_length": 3546.8, "completions/max_terminated_length": 3546.8, "completions/mean_length": 725.4683227539062, "completions/mean_terminated_length": 733.1369995117187, "completions/min_length": 0.0, "completions/min_terminated_length": 173.0, "epoch": 0.3599955000562493, "grad_norm": 0.0005442510009743273, "learning_rate": 1.4720812182741118e-06, "loss": -0.0055, "num_tokens": 272041312.0, "reward": 0.8391059041023254, "reward_std": 0.11063261181116105, "rewards/accuracy_reward": 0.6887152671813965, "rewards/brier_reward": 0.0, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9894965291023254, "rewards/mean_confidence_reward": 0.0, "step": 150 }, { "epoch": 0.3599955000562493, "eval_completions/clipped_ratio": 0.009548611111111105, "eval_completions/max_length": 2648.6666666666665, "eval_completions/max_terminated_length": 2648.6666666666665, "eval_completions/mean_length": 697.2899576822916, "eval_completions/mean_terminated_length": 704.1798807779948, "eval_completions/min_length": 77.83333333333333, "eval_completions/min_terminated_length": 218.5, "eval_loss": 0.0, "eval_num_tokens": 272041312.0, "eval_reward": 0.8424479365348816, "eval_reward_std": 0.24290807793537775, "eval_rewards/accuracy_reward": 0.6953125, "eval_rewards/brier_reward": 0.0, "eval_rewards/confidence_one_or_zero": 0.0, "eval_rewards/format_reward": 0.9895833333333334, "eval_rewards/mean_confidence_reward": 0.0, "eval_runtime": 335.7366, "eval_samples_per_second": 2.979, "eval_steps_per_second": 0.018, "step": 150 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.008246527777777768, "completions/max_length": 3176.0, "completions/max_terminated_length": 3176.0, "completions/mean_length": 681.7713500976563, "completions/mean_terminated_length": 687.5726318359375, "completions/min_length": 0.0, "completions/min_terminated_length": 186.8, "epoch": 0.3719953500581243, "grad_norm": 0.0005200021550990641, "learning_rate": 1.3451776649746193e-06, "loss": -0.0046, "num_tokens": 281804950.0, "reward": 0.8654947876930237, "reward_std": 0.10751536339521409, "rewards/accuracy_reward": 0.7392361164093018, "rewards/brier_reward": 0.0, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9917534828186035, "rewards/mean_confidence_reward": 0.0, "step": 155 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.013975694444444419, "completions/max_length": 3486.4, "completions/max_terminated_length": 3486.4, "completions/mean_length": 683.7095581054688, "completions/mean_terminated_length": 693.3710571289063, "completions/min_length": 0.0, "completions/min_terminated_length": 169.2, "epoch": 0.38399520005999926, "grad_norm": 0.00048736194730736315, "learning_rate": 1.218274111675127e-06, "loss": -0.0093, "num_tokens": 291570500.0, "reward": 0.8379774451255798, "reward_std": 0.1071748360991478, "rewards/accuracy_reward": 0.689930546283722, "rewards/brier_reward": 0.0, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9860242962837219, "rewards/mean_confidence_reward": 0.0, "step": 160 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.014670138888888884, "completions/max_length": 3638.8, "completions/max_terminated_length": 3638.8, "completions/mean_length": 728.8395751953125, "completions/mean_terminated_length": 739.8839111328125, "completions/min_length": 0.0, "completions/min_terminated_length": 187.0, "epoch": 0.39599505006187424, "grad_norm": 0.0005984375602565706, "learning_rate": 1.0913705583756345e-06, "loss": -0.0069, "num_tokens": 301907724.0, "reward": 0.8228298664093018, "reward_std": 0.10787203758955002, "rewards/accuracy_reward": 0.6605902791023255, "rewards/brier_reward": 0.0, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9850694537162781, "rewards/mean_confidence_reward": 0.0, "step": 165 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.011111111111111094, "completions/max_length": 3545.2, "completions/max_terminated_length": 3545.2, "completions/mean_length": 690.5397583007813, "completions/mean_terminated_length": 698.257373046875, "completions/min_length": 0.0, "completions/min_terminated_length": 167.2, "epoch": 0.4079949000637492, "grad_norm": 0.0004480788193177432, "learning_rate": 9.644670050761422e-07, "loss": -0.0055, "num_tokens": 311753846.0, "reward": 0.8578559160232544, "reward_std": 0.10318245440721512, "rewards/accuracy_reward": 0.7269097208976746, "rewards/brier_reward": 0.0, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9888020753860474, "rewards/mean_confidence_reward": 0.0, "step": 170 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.010243055555555557, "completions/max_length": 3369.0, "completions/max_terminated_length": 3369.0, "completions/mean_length": 729.870068359375, "completions/mean_terminated_length": 737.4661865234375, "completions/min_length": 0.0, "completions/min_terminated_length": 162.2, "epoch": 0.4199947500656242, "grad_norm": 0.00047758789150975645, "learning_rate": 8.375634517766498e-07, "loss": -0.0068, "num_tokens": 322071837.0, "reward": 0.8517795085906983, "reward_std": 0.11207419633865356, "rewards/accuracy_reward": 0.7139756917953491, "rewards/brier_reward": 0.0, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9895833253860473, "rewards/mean_confidence_reward": 0.0, "step": 175 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.011111111111111094, "completions/max_length": 3660.4, "completions/max_terminated_length": 3660.4, "completions/mean_length": 702.6620727539063, "completions/mean_terminated_length": 710.5470703125, "completions/min_length": 0.0, "completions/min_terminated_length": 178.4, "epoch": 0.4319946000674992, "grad_norm": 0.0006071230163797736, "learning_rate": 7.106598984771574e-07, "loss": -0.0065, "num_tokens": 332068392.0, "reward": 0.8521267414093018, "reward_std": 0.10839989632368088, "rewards/accuracy_reward": 0.7157986164093018, "rewards/brier_reward": 0.0, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9884548544883728, "rewards/mean_confidence_reward": 0.0, "step": 180 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.014149305555555557, "completions/max_length": 3151.4, "completions/max_terminated_length": 3151.4, "completions/mean_length": 697.1512329101563, "completions/mean_terminated_length": 707.2808837890625, "completions/min_length": 0.0, "completions/min_terminated_length": 163.8, "epoch": 0.44399445006937416, "grad_norm": 0.000985562102869153, "learning_rate": 5.83756345177665e-07, "loss": -0.0069, "num_tokens": 341991542.0, "reward": 0.8358941197395324, "reward_std": 0.11062836647033691, "rewards/accuracy_reward": 0.6860243082046509, "rewards/brier_reward": 0.0, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9857638835906982, "rewards/mean_confidence_reward": 0.0, "step": 185 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.010763888888888884, "completions/max_length": 3502.8, "completions/max_terminated_length": 3502.8, "completions/mean_length": 693.5631103515625, "completions/mean_terminated_length": 701.1261474609375, "completions/min_length": 0.0, "completions/min_terminated_length": 167.0, "epoch": 0.45599430007124914, "grad_norm": 0.00046821607975289226, "learning_rate": 4.568527918781726e-07, "loss": -0.0062, "num_tokens": 351866253.0, "reward": 0.8616753458976746, "reward_std": 0.11032991707324982, "rewards/accuracy_reward": 0.7342013955116272, "rewards/brier_reward": 0.0, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9891493201255799, "rewards/mean_confidence_reward": 0.0, "step": 190 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.015017361111111117, "completions/max_length": 3624.0, "completions/max_terminated_length": 3624.0, "completions/mean_length": 707.9368286132812, "completions/mean_terminated_length": 718.9172485351562, "completions/min_length": 0.0, "completions/min_terminated_length": 125.0, "epoch": 0.46799415007312406, "grad_norm": 0.0005199919687584043, "learning_rate": 3.2994923857868026e-07, "loss": -0.0096, "num_tokens": 361904469.0, "reward": 0.8315538167953491, "reward_std": 0.10869046747684478, "rewards/accuracy_reward": 0.6782986164093018, "rewards/brier_reward": 0.0, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9848090410232544, "rewards/mean_confidence_reward": 0.0, "step": 195 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.008333333333333326, "completions/max_length": 3104.0, "completions/max_terminated_length": 3104.0, "completions/mean_length": 690.364599609375, "completions/mean_terminated_length": 696.1920288085937, "completions/min_length": 0.0, "completions/min_terminated_length": 176.2, "epoch": 0.47999400007499904, "grad_norm": 0.00045739096822217107, "learning_rate": 2.0304568527918783e-07, "loss": -0.0042, "num_tokens": 371727197.0, "reward": 0.8470920085906982, "reward_std": 0.09732583314180374, "rewards/accuracy_reward": 0.7025173544883728, "rewards/brier_reward": 0.0, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9916666626930237, "rewards/mean_confidence_reward": 0.0, "step": 200 }, { "epoch": 0.47999400007499904, "eval_completions/clipped_ratio": 0.006076388888888877, "eval_completions/max_length": 2123.3333333333335, "eval_completions/max_terminated_length": 2123.3333333333335, "eval_completions/mean_length": 704.721201578776, "eval_completions/mean_terminated_length": 708.9297790527344, "eval_completions/min_length": 100.16666666666667, "eval_completions/min_terminated_length": 211.0, "eval_loss": 0.0, "eval_num_tokens": 371727197.0, "eval_reward": 0.8424479365348816, "eval_reward_std": 0.23790805538495383, "eval_rewards/accuracy_reward": 0.691840281089147, "eval_rewards/brier_reward": 0.0, "eval_rewards/confidence_one_or_zero": 0.0, "eval_rewards/format_reward": 0.9930555522441864, "eval_rewards/mean_confidence_reward": 0.0, "eval_runtime": 336.264, "eval_samples_per_second": 2.974, "eval_steps_per_second": 0.018, "step": 200 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01128472222222221, "completions/max_length": 3577.6, "completions/max_terminated_length": 3577.6, "completions/mean_length": 705.7981811523438, "completions/mean_terminated_length": 713.82548828125, "completions/min_length": 0.0, "completions/min_terminated_length": 167.4, "epoch": 0.491993850076874, "grad_norm": 0.0006899295258335769, "learning_rate": 7.614213197969544e-08, "loss": -0.0061, "num_tokens": 381725864.0, "reward": 0.8680121541023255, "reward_std": 0.10762782245874405, "rewards/accuracy_reward": 0.7473090291023254, "rewards/brier_reward": 0.0, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9887152910232544, "rewards/mean_confidence_reward": 0.0, "step": 205 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00795717592592593, "completions/max_length": 3177.3333333333335, "completions/max_terminated_length": 3177.3333333333335, "completions/mean_length": 710.8990478515625, "completions/mean_terminated_length": 716.7127685546875, "completions/min_length": 0.0, "completions/min_terminated_length": 147.33333333333334, "epoch": 0.49919376007799904, "num_tokens": 387786798.0, "reward": 0.8449074029922485, "reward_std": 0.10756702721118927, "rewards/accuracy_reward": 0.6977719863255819, "rewards/brier_reward": 0.0, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9920428395271301, "rewards/mean_confidence_reward": 0.0, "step": 208, "total_flos": 0.0, "train_loss": -0.00919347727456345, "train_runtime": 75450.0592, "train_samples_per_second": 0.199, "train_steps_per_second": 0.003 } ], "logging_steps": 5, "max_steps": 208, "num_input_tokens_seen": 387786798, "num_train_epochs": 1, "save_steps": 60, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 0.0, "train_batch_size": 6, "trial_name": null, "trial_params": null }