Files
big-math-digits-v2-correctness/trainer_state.json
ModelHub XC f9b658d00a 初始化项目,由ModelHub XC社区提供模型
Model: mehuldamani/big-math-digits-v2-correctness
Source: Original Platform
2026-08-14 04:27:18 +08:00

1262 lines
47 KiB
JSON

{
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.49919376007799904,
"eval_steps": 50,
"global_step": 208,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.02065972222222221,
"completions/max_length": 4047.0,
"completions/max_terminated_length": 4047.0,
"completions/mean_length": 495.66493530273436,
"completions/mean_terminated_length": 506.1021301269531,
"completions/min_length": 0.0,
"completions/min_terminated_length": 2.4,
"epoch": 0.011999850001874977,
"grad_norm": 0.47694680094718933,
"learning_rate": 2.2727272727272728e-06,
"loss": 0.0099,
"num_tokens": 7626188.0,
"reward": 0.4157118022441864,
"reward_std": 0.35606788396835326,
"rewards/accuracy_reward": 0.25520833134651183,
"rewards/brier_reward": 0.0,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.5762152791023254,
"rewards/mean_confidence_reward": 0.0,
"step": 5
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01171875,
"completions/max_length": 3730.2,
"completions/max_terminated_length": 3730.2,
"completions/mean_length": 371.2526123046875,
"completions/mean_terminated_length": 375.78693237304685,
"completions/min_length": 0.0,
"completions/min_terminated_length": 19.4,
"epoch": 0.023999700003749954,
"grad_norm": 0.0010379819432273507,
"learning_rate": 4.5454545454545455e-06,
"loss": -0.0026,
"num_tokens": 13787658.0,
"reward": 0.6760850787162781,
"reward_std": 0.2362564116716385,
"rewards/accuracy_reward": 0.4039930462837219,
"rewards/brier_reward": 0.0,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9481770873069764,
"rewards/mean_confidence_reward": 0.0,
"step": 10
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.013975694444444442,
"completions/max_length": 4018.4,
"completions/max_terminated_length": 4018.4,
"completions/mean_length": 464.33099365234375,
"completions/mean_terminated_length": 471.20233764648435,
"completions/min_length": 0.0,
"completions/min_terminated_length": 54.6,
"epoch": 0.03599955000562493,
"grad_norm": 0.0006205081008374691,
"learning_rate": 4.898477157360406e-06,
"loss": -0.0066,
"num_tokens": 21040655.0,
"reward": 0.7481770992279053,
"reward_std": 0.18966231644153594,
"rewards/accuracy_reward": 0.5131944417953491,
"rewards/brier_reward": 0.0,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9831597328186035,
"rewards/mean_confidence_reward": 0.0,
"step": 15
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01649305555555556,
"completions/max_length": 3962.2,
"completions/max_terminated_length": 3962.2,
"completions/mean_length": 579.791845703125,
"completions/mean_terminated_length": 589.5614501953125,
"completions/min_length": 0.0,
"completions/min_terminated_length": 119.6,
"epoch": 0.04799940000749991,
"grad_norm": 0.00045936586684547365,
"learning_rate": 4.771573604060914e-06,
"loss": -0.0088,
"num_tokens": 29635473.0,
"reward": 0.7965711951255798,
"reward_std": 0.1594875305891037,
"rewards/accuracy_reward": 0.6106770873069763,
"rewards/brier_reward": 0.0,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9824652791023254,
"rewards/mean_confidence_reward": 0.0,
"step": 20
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.012673611111111094,
"completions/max_length": 3394.8,
"completions/max_terminated_length": 3394.8,
"completions/mean_length": 605.4309936523438,
"completions/mean_terminated_length": 613.314404296875,
"completions/min_length": 0.0,
"completions/min_terminated_length": 129.6,
"epoch": 0.05999925000937488,
"grad_norm": 0.0004269441997166723,
"learning_rate": 4.644670050761422e-06,
"loss": -0.0069,
"num_tokens": 38536406.0,
"reward": 0.8223090291023254,
"reward_std": 0.13588928282260895,
"rewards/accuracy_reward": 0.6580729246139526,
"rewards/brier_reward": 0.0,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9865451455116272,
"rewards/mean_confidence_reward": 0.0,
"step": 25
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.017361111111111115,
"completions/max_length": 3280.8,
"completions/max_terminated_length": 3280.8,
"completions/mean_length": 605.2468017578125,
"completions/mean_terminated_length": 616.0807861328125,
"completions/min_length": 0.0,
"completions/min_terminated_length": 123.0,
"epoch": 0.07199910001124986,
"grad_norm": 0.000590955838561058,
"learning_rate": 4.5177664974619295e-06,
"loss": -0.0102,
"num_tokens": 47420689.0,
"reward": 0.8153645873069764,
"reward_std": 0.14741556644439696,
"rewards/accuracy_reward": 0.6482638835906982,
"rewards/brier_reward": 0.0,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9824652791023254,
"rewards/mean_confidence_reward": 0.0,
"step": 30
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.02178819444444442,
"completions/max_length": 3437.4,
"completions/max_terminated_length": 3437.4,
"completions/mean_length": 595.20625,
"completions/mean_terminated_length": 608.612451171875,
"completions/min_length": 0.0,
"completions/min_terminated_length": 141.2,
"epoch": 0.08399895001312484,
"grad_norm": 0.0004463954537641257,
"learning_rate": 4.390862944162436e-06,
"loss": -0.013,
"num_tokens": 56156825.0,
"reward": 0.8129774451255798,
"reward_std": 0.13939182609319686,
"rewards/accuracy_reward": 0.6477430462837219,
"rewards/brier_reward": 0.0,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9782117962837219,
"rewards/mean_confidence_reward": 0.0,
"step": 35
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.025954861111111116,
"completions/max_length": 3589.0,
"completions/max_terminated_length": 3589.0,
"completions/mean_length": 608.2237060546875,
"completions/mean_terminated_length": 624.4381469726562,
"completions/min_length": 0.0,
"completions/min_terminated_length": 144.4,
"epoch": 0.09599880001499982,
"grad_norm": 0.0005039877141825855,
"learning_rate": 4.263959390862945e-06,
"loss": -0.0181,
"num_tokens": 65085002.0,
"reward": 0.8188802123069763,
"reward_std": 0.13610992431640626,
"rewards/accuracy_reward": 0.6638020873069763,
"rewards/brier_reward": 0.0,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9739583253860473,
"rewards/mean_confidence_reward": 0.0,
"step": 40
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.024826388888888884,
"completions/max_length": 3807.0,
"completions/max_terminated_length": 3807.0,
"completions/mean_length": 640.9053955078125,
"completions/mean_terminated_length": 657.2029418945312,
"completions/min_length": 0.0,
"completions/min_terminated_length": 145.4,
"epoch": 0.1079986500168748,
"grad_norm": 0.00040095733129419386,
"learning_rate": 4.137055837563453e-06,
"loss": -0.0146,
"num_tokens": 74405416.0,
"reward": 0.8217013955116272,
"reward_std": 0.13904002010822297,
"rewards/accuracy_reward": 0.6684895753860474,
"rewards/brier_reward": 0.0,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9749131917953491,
"rewards/mean_confidence_reward": 0.0,
"step": 45
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.02352430555555556,
"completions/max_length": 3562.0,
"completions/max_terminated_length": 3562.0,
"completions/mean_length": 639.3743896484375,
"completions/mean_terminated_length": 654.712939453125,
"completions/min_length": 0.0,
"completions/min_terminated_length": 162.4,
"epoch": 0.11999850001874976,
"grad_norm": 0.0005420144880190492,
"learning_rate": 4.0101522842639595e-06,
"loss": -0.0162,
"num_tokens": 83670529.0,
"reward": 0.8127604246139526,
"reward_std": 0.13803613781929017,
"rewards/accuracy_reward": 0.6490451335906983,
"rewards/brier_reward": 0.0,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9764756798744202,
"rewards/mean_confidence_reward": 0.0,
"step": 50
},
{
"epoch": 0.11999850001874976,
"eval_completions/clipped_ratio": 0.025868055555555547,
"eval_completions/max_length": 2410.0,
"eval_completions/max_terminated_length": 2410.0,
"eval_completions/mean_length": 618.3784891764323,
"eval_completions/mean_terminated_length": 634.7286783854166,
"eval_completions/min_length": 0.0,
"eval_completions/min_terminated_length": 202.16666666666666,
"eval_loss": 0.0,
"eval_num_tokens": 83670529.0,
"eval_reward": 0.816406269868215,
"eval_reward_std": 0.2650855928659439,
"eval_rewards/accuracy_reward": 0.6588541666666666,
"eval_rewards/brier_reward": 0.0,
"eval_rewards/confidence_one_or_zero": 0.0,
"eval_rewards/format_reward": 0.9739583233992258,
"eval_rewards/mean_confidence_reward": 0.0,
"eval_runtime": 317.036,
"eval_samples_per_second": 3.154,
"eval_steps_per_second": 0.019,
"step": 50
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0265625,
"completions/max_length": 3296.0,
"completions/max_terminated_length": 3296.0,
"completions/mean_length": 634.9600708007813,
"completions/mean_terminated_length": 652.637939453125,
"completions/min_length": 0.0,
"completions/min_terminated_length": 145.6,
"epoch": 0.13199835002062474,
"grad_norm": 0.0007147942669689655,
"learning_rate": 3.883248730964467e-06,
"loss": -0.0147,
"num_tokens": 92867765.0,
"reward": 0.8098524332046508,
"reward_std": 0.13919124156236648,
"rewards/accuracy_reward": 0.6467013835906983,
"rewards/brier_reward": 0.0,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9730034708976746,
"rewards/mean_confidence_reward": 0.0,
"step": 55
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.020486111111111115,
"completions/max_length": 3785.2,
"completions/max_terminated_length": 3785.2,
"completions/mean_length": 638.7587768554688,
"completions/mean_terminated_length": 652.251123046875,
"completions/min_length": 0.0,
"completions/min_terminated_length": 149.0,
"epoch": 0.14399820002249972,
"grad_norm": 0.0006786566809751093,
"learning_rate": 3.756345177664975e-06,
"loss": -0.0139,
"num_tokens": 102124762.0,
"reward": 0.8063802123069763,
"reward_std": 0.13464951664209365,
"rewards/accuracy_reward": 0.63359375,
"rewards/brier_reward": 0.0,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9791666626930237,
"rewards/mean_confidence_reward": 0.0,
"step": 60
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.015364583333333326,
"completions/max_length": 3440.2,
"completions/max_terminated_length": 3440.2,
"completions/mean_length": 628.39228515625,
"completions/mean_terminated_length": 638.17490234375,
"completions/min_length": 0.0,
"completions/min_terminated_length": 141.6,
"epoch": 0.1559980500243747,
"grad_norm": 0.0004710310895461589,
"learning_rate": 3.629441624365482e-06,
"loss": -0.0085,
"num_tokens": 111259809.0,
"reward": 0.8261718869209289,
"reward_std": 0.11869495064020157,
"rewards/accuracy_reward": 0.6677951335906982,
"rewards/brier_reward": 0.0,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9845486164093018,
"rewards/mean_confidence_reward": 0.0,
"step": 65
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.02109375,
"completions/max_length": 3541.8,
"completions/max_terminated_length": 3541.8,
"completions/mean_length": 620.9056396484375,
"completions/mean_terminated_length": 634.306201171875,
"completions/min_length": 0.0,
"completions/min_terminated_length": 114.4,
"epoch": 0.16799790002624967,
"grad_norm": 0.0005915550282225013,
"learning_rate": 3.5025380710659903e-06,
"loss": -0.0141,
"num_tokens": 120292706.0,
"reward": 0.8110677123069763,
"reward_std": 0.12359137833118439,
"rewards/accuracy_reward": 0.6433159708976746,
"rewards/brier_reward": 0.0,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9788194417953491,
"rewards/mean_confidence_reward": 0.0,
"step": 70
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.013368055555555558,
"completions/max_length": 2899.0,
"completions/max_terminated_length": 2899.0,
"completions/mean_length": 608.4648559570312,
"completions/mean_terminated_length": 616.763671875,
"completions/min_length": 0.0,
"completions/min_terminated_length": 150.4,
"epoch": 0.17999775002812465,
"grad_norm": 0.00045338328345678747,
"learning_rate": 3.375634517766498e-06,
"loss": -0.008,
"num_tokens": 129169037.0,
"reward": 0.8407552123069764,
"reward_std": 0.11922919005155563,
"rewards/accuracy_reward": 0.6949652910232544,
"rewards/brier_reward": 0.0,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9865451335906983,
"rewards/mean_confidence_reward": 0.0,
"step": 75
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.023177083333333327,
"completions/max_length": 3817.4,
"completions/max_terminated_length": 3817.4,
"completions/mean_length": 648.0177368164062,
"completions/mean_terminated_length": 663.47724609375,
"completions/min_length": 0.0,
"completions/min_terminated_length": 127.4,
"epoch": 0.19199760002999963,
"grad_norm": 0.00041271100053563714,
"learning_rate": 3.2487309644670053e-06,
"loss": -0.0138,
"num_tokens": 138489401.0,
"reward": 0.8135850667953491,
"reward_std": 0.12409738302230836,
"rewards/accuracy_reward": 0.6503472208976746,
"rewards/brier_reward": 0.0,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9768229126930237,
"rewards/mean_confidence_reward": 0.0,
"step": 80
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.025868055555555537,
"completions/max_length": 3501.2,
"completions/max_terminated_length": 3501.2,
"completions/mean_length": 654.8557373046875,
"completions/mean_terminated_length": 672.3203979492188,
"completions/min_length": 0.0,
"completions/min_terminated_length": 166.8,
"epoch": 0.2039974500318746,
"grad_norm": 0.00039561674930155277,
"learning_rate": 3.121827411167513e-06,
"loss": -0.0162,
"num_tokens": 147922459.0,
"reward": 0.8282986283302307,
"reward_std": 0.13599332869052888,
"rewards/accuracy_reward": 0.6832465171813965,
"rewards/brier_reward": 0.0,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9733506917953492,
"rewards/mean_confidence_reward": 0.0,
"step": 85
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.02430555555555558,
"completions/max_length": 3750.8,
"completions/max_terminated_length": 3750.8,
"completions/mean_length": 626.2822875976562,
"completions/mean_terminated_length": 641.9483764648437,
"completions/min_length": 0.0,
"completions/min_terminated_length": 136.6,
"epoch": 0.2159973000337496,
"grad_norm": 0.00046881154412403703,
"learning_rate": 2.9949238578680207e-06,
"loss": -0.0153,
"num_tokens": 157007823.0,
"reward": 0.8209635376930237,
"reward_std": 0.13299919813871383,
"rewards/accuracy_reward": 0.6667534708976746,
"rewards/brier_reward": 0.0,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9751736164093018,
"rewards/mean_confidence_reward": 0.0,
"step": 90
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.018923611111111092,
"completions/max_length": 3614.2,
"completions/max_terminated_length": 3614.2,
"completions/mean_length": 643.94228515625,
"completions/mean_terminated_length": 656.3934814453125,
"completions/min_length": 0.0,
"completions/min_terminated_length": 131.2,
"epoch": 0.22799715003562457,
"grad_norm": 0.0003850593639072031,
"learning_rate": 2.8680203045685284e-06,
"loss": -0.0103,
"num_tokens": 166319638.0,
"reward": 0.8210069537162781,
"reward_std": 0.11787589490413666,
"rewards/accuracy_reward": 0.6611979007720947,
"rewards/brier_reward": 0.0,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9808159828186035,
"rewards/mean_confidence_reward": 0.0,
"step": 95
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.025347222222222233,
"completions/max_length": 3307.0,
"completions/max_terminated_length": 3307.0,
"completions/mean_length": 667.9455932617187,
"completions/mean_terminated_length": 685.2820556640625,
"completions/min_length": 0.0,
"completions/min_terminated_length": 149.2,
"epoch": 0.23999700003749952,
"grad_norm": 0.000390661385608837,
"learning_rate": 2.7411167512690357e-06,
"loss": -0.0161,
"num_tokens": 175915363.0,
"reward": 0.8228298664093018,
"reward_std": 0.127268485724926,
"rewards/accuracy_reward": 0.6711805582046508,
"rewards/brier_reward": 0.0,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9744791626930237,
"rewards/mean_confidence_reward": 0.0,
"step": 100
},
{
"epoch": 0.23999700003749952,
"eval_completions/clipped_ratio": 0.018923611111111127,
"eval_completions/max_length": 2499.1666666666665,
"eval_completions/max_terminated_length": 2499.1666666666665,
"eval_completions/mean_length": 652.9295349121094,
"eval_completions/mean_terminated_length": 665.5544128417969,
"eval_completions/min_length": 0.0,
"eval_completions/min_terminated_length": 209.0,
"eval_loss": 0.0,
"eval_num_tokens": 175915363.0,
"eval_reward": 0.8289930721124014,
"eval_reward_std": 0.2512400249640147,
"eval_rewards/accuracy_reward": 0.6744791666666666,
"eval_rewards/brier_reward": 0.0,
"eval_rewards/confidence_one_or_zero": 0.0,
"eval_rewards/format_reward": 0.9835069477558136,
"eval_rewards/mean_confidence_reward": 0.0,
"eval_runtime": 315.8521,
"eval_samples_per_second": 3.166,
"eval_steps_per_second": 0.019,
"step": 100
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.021267361111111115,
"completions/max_length": 3450.8,
"completions/max_terminated_length": 3450.8,
"completions/mean_length": 657.2955810546875,
"completions/mean_terminated_length": 671.5618774414063,
"completions/min_length": 0.0,
"completions/min_terminated_length": 130.6,
"epoch": 0.2519968500393745,
"grad_norm": 0.0004644222208298743,
"learning_rate": 2.6142131979695434e-06,
"loss": -0.0128,
"num_tokens": 185366192.0,
"reward": 0.8306857705116272,
"reward_std": 0.11819785684347153,
"rewards/accuracy_reward": 0.6831597328186035,
"rewards/brier_reward": 0.0,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9782118082046509,
"rewards/mean_confidence_reward": 0.0,
"step": 105
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01675347222222221,
"completions/max_length": 3521.8,
"completions/max_terminated_length": 3521.8,
"completions/mean_length": 664.1182495117188,
"completions/mean_terminated_length": 675.5516235351563,
"completions/min_length": 0.0,
"completions/min_terminated_length": 157.8,
"epoch": 0.2639967000412495,
"grad_norm": 0.0004074091266375035,
"learning_rate": 2.487309644670051e-06,
"loss": -0.0095,
"num_tokens": 194927202.0,
"reward": 0.8493489623069763,
"reward_std": 0.11185714602470398,
"rewards/accuracy_reward": 0.7157986283302307,
"rewards/brier_reward": 0.0,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9828993082046509,
"rewards/mean_confidence_reward": 0.0,
"step": 110
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.019010416666666675,
"completions/max_length": 3542.0,
"completions/max_terminated_length": 3542.0,
"completions/mean_length": 662.1376831054688,
"completions/mean_terminated_length": 675.0173706054687,
"completions/min_length": 0.0,
"completions/min_terminated_length": 163.2,
"epoch": 0.27599655004312446,
"grad_norm": 0.0004749298677779734,
"learning_rate": 2.3604060913705588e-06,
"loss": -0.0124,
"num_tokens": 204436148.0,
"reward": 0.831163203716278,
"reward_std": 0.11646707653999329,
"rewards/accuracy_reward": 0.6817708373069763,
"rewards/brier_reward": 0.0,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9805555701255798,
"rewards/mean_confidence_reward": 0.0,
"step": 115
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.014322916666666652,
"completions/max_length": 3572.0,
"completions/max_terminated_length": 3572.0,
"completions/mean_length": 650.0963623046875,
"completions/mean_terminated_length": 659.4545166015625,
"completions/min_length": 0.0,
"completions/min_terminated_length": 141.6,
"epoch": 0.28799640004499943,
"grad_norm": 0.0003820126294158399,
"learning_rate": 2.233502538071066e-06,
"loss": -0.0093,
"num_tokens": 213809034.0,
"reward": 0.8375434041023254,
"reward_std": 0.11465604901313782,
"rewards/accuracy_reward": 0.68984375,
"rewards/brier_reward": 0.0,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.985243046283722,
"rewards/mean_confidence_reward": 0.0,
"step": 120
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.013107638888888884,
"completions/max_length": 3326.0,
"completions/max_terminated_length": 3326.0,
"completions/mean_length": 648.654345703125,
"completions/mean_terminated_length": 657.3896240234375,
"completions/min_length": 0.0,
"completions/min_terminated_length": 160.8,
"epoch": 0.2999962500468744,
"grad_norm": 0.0004972605383954942,
"learning_rate": 2.1065989847715737e-06,
"loss": -0.0084,
"num_tokens": 223201116.0,
"reward": 0.8411892294883728,
"reward_std": 0.11022633463144302,
"rewards/accuracy_reward": 0.6955729126930237,
"rewards/brier_reward": 0.0,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9868055701255798,
"rewards/mean_confidence_reward": 0.0,
"step": 125
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.017447916666666653,
"completions/max_length": 3507.8,
"completions/max_terminated_length": 3507.8,
"completions/mean_length": 680.4585205078125,
"completions/mean_terminated_length": 692.4925903320312,
"completions/min_length": 0.0,
"completions/min_terminated_length": 150.8,
"epoch": 0.3119961000487494,
"grad_norm": 0.0004750330117531121,
"learning_rate": 1.9796954314720814e-06,
"loss": -0.0107,
"num_tokens": 232966718.0,
"reward": 0.8265190958976746,
"reward_std": 0.12254964411258698,
"rewards/accuracy_reward": 0.6706597208976746,
"rewards/brier_reward": 0.0,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9823784708976746,
"rewards/mean_confidence_reward": 0.0,
"step": 130
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01128472222222221,
"completions/max_length": 3688.2,
"completions/max_terminated_length": 3688.2,
"completions/mean_length": 672.9379272460938,
"completions/mean_terminated_length": 680.5967041015625,
"completions/min_length": 0.0,
"completions/min_terminated_length": 150.8,
"epoch": 0.32399595005062437,
"grad_norm": 0.0005158277926966548,
"learning_rate": 1.852791878172589e-06,
"loss": -0.006,
"num_tokens": 242613907.0,
"reward": 0.8388889074325562,
"reward_std": 0.11086668223142623,
"rewards/accuracy_reward": 0.6890625,
"rewards/brier_reward": 0.0,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9887152671813965,
"rewards/mean_confidence_reward": 0.0,
"step": 135
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.012847222222222232,
"completions/max_length": 3413.0,
"completions/max_terminated_length": 3413.0,
"completions/mean_length": 675.3115478515625,
"completions/mean_terminated_length": 684.0101196289063,
"completions/min_length": 0.0,
"completions/min_terminated_length": 173.6,
"epoch": 0.33599580005249935,
"grad_norm": 0.00046416957047767937,
"learning_rate": 1.7258883248730964e-06,
"loss": -0.0076,
"num_tokens": 252299640.0,
"reward": 0.8318142294883728,
"reward_std": 0.11125441938638687,
"rewards/accuracy_reward": 0.6766493082046509,
"rewards/brier_reward": 0.0,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9869791626930237,
"rewards/mean_confidence_reward": 0.0,
"step": 140
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01015625,
"completions/max_length": 3253.2,
"completions/max_terminated_length": 3253.2,
"completions/mean_length": 660.1990600585938,
"completions/mean_terminated_length": 667.0159423828125,
"completions/min_length": 0.0,
"completions/min_terminated_length": 176.2,
"epoch": 0.34799565005437433,
"grad_norm": 0.00041169917676597834,
"learning_rate": 1.5989847715736043e-06,
"loss": -0.0057,
"num_tokens": 261771661.0,
"reward": 0.8521701455116272,
"reward_std": 0.10130168348550797,
"rewards/accuracy_reward": 0.7144965410232544,
"rewards/brier_reward": 0.0,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9898437619209289,
"rewards/mean_confidence_reward": 0.0,
"step": 145
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01050347222222221,
"completions/max_length": 3546.8,
"completions/max_terminated_length": 3546.8,
"completions/mean_length": 725.4683227539062,
"completions/mean_terminated_length": 733.1369995117187,
"completions/min_length": 0.0,
"completions/min_terminated_length": 173.0,
"epoch": 0.3599955000562493,
"grad_norm": 0.0005442510009743273,
"learning_rate": 1.4720812182741118e-06,
"loss": -0.0055,
"num_tokens": 272041312.0,
"reward": 0.8391059041023254,
"reward_std": 0.11063261181116105,
"rewards/accuracy_reward": 0.6887152671813965,
"rewards/brier_reward": 0.0,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9894965291023254,
"rewards/mean_confidence_reward": 0.0,
"step": 150
},
{
"epoch": 0.3599955000562493,
"eval_completions/clipped_ratio": 0.009548611111111105,
"eval_completions/max_length": 2648.6666666666665,
"eval_completions/max_terminated_length": 2648.6666666666665,
"eval_completions/mean_length": 697.2899576822916,
"eval_completions/mean_terminated_length": 704.1798807779948,
"eval_completions/min_length": 77.83333333333333,
"eval_completions/min_terminated_length": 218.5,
"eval_loss": 0.0,
"eval_num_tokens": 272041312.0,
"eval_reward": 0.8424479365348816,
"eval_reward_std": 0.24290807793537775,
"eval_rewards/accuracy_reward": 0.6953125,
"eval_rewards/brier_reward": 0.0,
"eval_rewards/confidence_one_or_zero": 0.0,
"eval_rewards/format_reward": 0.9895833333333334,
"eval_rewards/mean_confidence_reward": 0.0,
"eval_runtime": 335.7366,
"eval_samples_per_second": 2.979,
"eval_steps_per_second": 0.018,
"step": 150
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.008246527777777768,
"completions/max_length": 3176.0,
"completions/max_terminated_length": 3176.0,
"completions/mean_length": 681.7713500976563,
"completions/mean_terminated_length": 687.5726318359375,
"completions/min_length": 0.0,
"completions/min_terminated_length": 186.8,
"epoch": 0.3719953500581243,
"grad_norm": 0.0005200021550990641,
"learning_rate": 1.3451776649746193e-06,
"loss": -0.0046,
"num_tokens": 281804950.0,
"reward": 0.8654947876930237,
"reward_std": 0.10751536339521409,
"rewards/accuracy_reward": 0.7392361164093018,
"rewards/brier_reward": 0.0,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9917534828186035,
"rewards/mean_confidence_reward": 0.0,
"step": 155
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.013975694444444419,
"completions/max_length": 3486.4,
"completions/max_terminated_length": 3486.4,
"completions/mean_length": 683.7095581054688,
"completions/mean_terminated_length": 693.3710571289063,
"completions/min_length": 0.0,
"completions/min_terminated_length": 169.2,
"epoch": 0.38399520005999926,
"grad_norm": 0.00048736194730736315,
"learning_rate": 1.218274111675127e-06,
"loss": -0.0093,
"num_tokens": 291570500.0,
"reward": 0.8379774451255798,
"reward_std": 0.1071748360991478,
"rewards/accuracy_reward": 0.689930546283722,
"rewards/brier_reward": 0.0,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9860242962837219,
"rewards/mean_confidence_reward": 0.0,
"step": 160
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.014670138888888884,
"completions/max_length": 3638.8,
"completions/max_terminated_length": 3638.8,
"completions/mean_length": 728.8395751953125,
"completions/mean_terminated_length": 739.8839111328125,
"completions/min_length": 0.0,
"completions/min_terminated_length": 187.0,
"epoch": 0.39599505006187424,
"grad_norm": 0.0005984375602565706,
"learning_rate": 1.0913705583756345e-06,
"loss": -0.0069,
"num_tokens": 301907724.0,
"reward": 0.8228298664093018,
"reward_std": 0.10787203758955002,
"rewards/accuracy_reward": 0.6605902791023255,
"rewards/brier_reward": 0.0,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9850694537162781,
"rewards/mean_confidence_reward": 0.0,
"step": 165
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.011111111111111094,
"completions/max_length": 3545.2,
"completions/max_terminated_length": 3545.2,
"completions/mean_length": 690.5397583007813,
"completions/mean_terminated_length": 698.257373046875,
"completions/min_length": 0.0,
"completions/min_terminated_length": 167.2,
"epoch": 0.4079949000637492,
"grad_norm": 0.0004480788193177432,
"learning_rate": 9.644670050761422e-07,
"loss": -0.0055,
"num_tokens": 311753846.0,
"reward": 0.8578559160232544,
"reward_std": 0.10318245440721512,
"rewards/accuracy_reward": 0.7269097208976746,
"rewards/brier_reward": 0.0,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9888020753860474,
"rewards/mean_confidence_reward": 0.0,
"step": 170
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.010243055555555557,
"completions/max_length": 3369.0,
"completions/max_terminated_length": 3369.0,
"completions/mean_length": 729.870068359375,
"completions/mean_terminated_length": 737.4661865234375,
"completions/min_length": 0.0,
"completions/min_terminated_length": 162.2,
"epoch": 0.4199947500656242,
"grad_norm": 0.00047758789150975645,
"learning_rate": 8.375634517766498e-07,
"loss": -0.0068,
"num_tokens": 322071837.0,
"reward": 0.8517795085906983,
"reward_std": 0.11207419633865356,
"rewards/accuracy_reward": 0.7139756917953491,
"rewards/brier_reward": 0.0,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9895833253860473,
"rewards/mean_confidence_reward": 0.0,
"step": 175
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.011111111111111094,
"completions/max_length": 3660.4,
"completions/max_terminated_length": 3660.4,
"completions/mean_length": 702.6620727539063,
"completions/mean_terminated_length": 710.5470703125,
"completions/min_length": 0.0,
"completions/min_terminated_length": 178.4,
"epoch": 0.4319946000674992,
"grad_norm": 0.0006071230163797736,
"learning_rate": 7.106598984771574e-07,
"loss": -0.0065,
"num_tokens": 332068392.0,
"reward": 0.8521267414093018,
"reward_std": 0.10839989632368088,
"rewards/accuracy_reward": 0.7157986164093018,
"rewards/brier_reward": 0.0,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9884548544883728,
"rewards/mean_confidence_reward": 0.0,
"step": 180
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.014149305555555557,
"completions/max_length": 3151.4,
"completions/max_terminated_length": 3151.4,
"completions/mean_length": 697.1512329101563,
"completions/mean_terminated_length": 707.2808837890625,
"completions/min_length": 0.0,
"completions/min_terminated_length": 163.8,
"epoch": 0.44399445006937416,
"grad_norm": 0.000985562102869153,
"learning_rate": 5.83756345177665e-07,
"loss": -0.0069,
"num_tokens": 341991542.0,
"reward": 0.8358941197395324,
"reward_std": 0.11062836647033691,
"rewards/accuracy_reward": 0.6860243082046509,
"rewards/brier_reward": 0.0,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9857638835906982,
"rewards/mean_confidence_reward": 0.0,
"step": 185
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.010763888888888884,
"completions/max_length": 3502.8,
"completions/max_terminated_length": 3502.8,
"completions/mean_length": 693.5631103515625,
"completions/mean_terminated_length": 701.1261474609375,
"completions/min_length": 0.0,
"completions/min_terminated_length": 167.0,
"epoch": 0.45599430007124914,
"grad_norm": 0.00046821607975289226,
"learning_rate": 4.568527918781726e-07,
"loss": -0.0062,
"num_tokens": 351866253.0,
"reward": 0.8616753458976746,
"reward_std": 0.11032991707324982,
"rewards/accuracy_reward": 0.7342013955116272,
"rewards/brier_reward": 0.0,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9891493201255799,
"rewards/mean_confidence_reward": 0.0,
"step": 190
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.015017361111111117,
"completions/max_length": 3624.0,
"completions/max_terminated_length": 3624.0,
"completions/mean_length": 707.9368286132812,
"completions/mean_terminated_length": 718.9172485351562,
"completions/min_length": 0.0,
"completions/min_terminated_length": 125.0,
"epoch": 0.46799415007312406,
"grad_norm": 0.0005199919687584043,
"learning_rate": 3.2994923857868026e-07,
"loss": -0.0096,
"num_tokens": 361904469.0,
"reward": 0.8315538167953491,
"reward_std": 0.10869046747684478,
"rewards/accuracy_reward": 0.6782986164093018,
"rewards/brier_reward": 0.0,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9848090410232544,
"rewards/mean_confidence_reward": 0.0,
"step": 195
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.008333333333333326,
"completions/max_length": 3104.0,
"completions/max_terminated_length": 3104.0,
"completions/mean_length": 690.364599609375,
"completions/mean_terminated_length": 696.1920288085937,
"completions/min_length": 0.0,
"completions/min_terminated_length": 176.2,
"epoch": 0.47999400007499904,
"grad_norm": 0.00045739096822217107,
"learning_rate": 2.0304568527918783e-07,
"loss": -0.0042,
"num_tokens": 371727197.0,
"reward": 0.8470920085906982,
"reward_std": 0.09732583314180374,
"rewards/accuracy_reward": 0.7025173544883728,
"rewards/brier_reward": 0.0,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9916666626930237,
"rewards/mean_confidence_reward": 0.0,
"step": 200
},
{
"epoch": 0.47999400007499904,
"eval_completions/clipped_ratio": 0.006076388888888877,
"eval_completions/max_length": 2123.3333333333335,
"eval_completions/max_terminated_length": 2123.3333333333335,
"eval_completions/mean_length": 704.721201578776,
"eval_completions/mean_terminated_length": 708.9297790527344,
"eval_completions/min_length": 100.16666666666667,
"eval_completions/min_terminated_length": 211.0,
"eval_loss": 0.0,
"eval_num_tokens": 371727197.0,
"eval_reward": 0.8424479365348816,
"eval_reward_std": 0.23790805538495383,
"eval_rewards/accuracy_reward": 0.691840281089147,
"eval_rewards/brier_reward": 0.0,
"eval_rewards/confidence_one_or_zero": 0.0,
"eval_rewards/format_reward": 0.9930555522441864,
"eval_rewards/mean_confidence_reward": 0.0,
"eval_runtime": 336.264,
"eval_samples_per_second": 2.974,
"eval_steps_per_second": 0.018,
"step": 200
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01128472222222221,
"completions/max_length": 3577.6,
"completions/max_terminated_length": 3577.6,
"completions/mean_length": 705.7981811523438,
"completions/mean_terminated_length": 713.82548828125,
"completions/min_length": 0.0,
"completions/min_terminated_length": 167.4,
"epoch": 0.491993850076874,
"grad_norm": 0.0006899295258335769,
"learning_rate": 7.614213197969544e-08,
"loss": -0.0061,
"num_tokens": 381725864.0,
"reward": 0.8680121541023255,
"reward_std": 0.10762782245874405,
"rewards/accuracy_reward": 0.7473090291023254,
"rewards/brier_reward": 0.0,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9887152910232544,
"rewards/mean_confidence_reward": 0.0,
"step": 205
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00795717592592593,
"completions/max_length": 3177.3333333333335,
"completions/max_terminated_length": 3177.3333333333335,
"completions/mean_length": 710.8990478515625,
"completions/mean_terminated_length": 716.7127685546875,
"completions/min_length": 0.0,
"completions/min_terminated_length": 147.33333333333334,
"epoch": 0.49919376007799904,
"num_tokens": 387786798.0,
"reward": 0.8449074029922485,
"reward_std": 0.10756702721118927,
"rewards/accuracy_reward": 0.6977719863255819,
"rewards/brier_reward": 0.0,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9920428395271301,
"rewards/mean_confidence_reward": 0.0,
"step": 208,
"total_flos": 0.0,
"train_loss": -0.00919347727456345,
"train_runtime": 75450.0592,
"train_samples_per_second": 0.199,
"train_steps_per_second": 0.003
}
],
"logging_steps": 5,
"max_steps": 208,
"num_input_tokens_seen": 387786798,
"num_train_epochs": 1,
"save_steps": 60,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 0.0,
"train_batch_size": 6,
"trial_name": null,
"trial_params": null
}