{ "best_metric": null, "best_model_checkpoint": null, "epoch": 0.4992, "eval_steps": 15, "global_step": 78, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.02018229166666663, "completions/max_length": 4096.0, "completions/max_terminated_length": 3811.0, "completions/mean_length": 628.982421875, "completions/mean_terminated_length": 557.5687255859375, "completions/min_length": 2.0, "completions/min_terminated_length": 2.0, "epoch": 0.0064, "grad_norm": 0.003783364314585924, "learning_rate": 3.125e-07, "loss": 0.0013, "num_tokens": 1493533.0, "reward": 0.5249200463294983, "reward_std": 0.5007209777832031, "rewards/accuracy_reward": 0.2421875, "rewards/brier_reward": 0.22494499385356903, "rewards/confidence_one_or_zero": 0.484375, "rewards/format_reward": 0.5826823115348816, "rewards/mean_confidence_reward": 0.7791340947151184, "step": 1 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.02278645833333337, "completions/max_length": 4096.0, "completions/max_terminated_length": 3898.0, "completions/mean_length": 652.9889526367188, "completions/mean_terminated_length": 572.70556640625, "completions/min_length": 2.0, "completions/min_terminated_length": 2.0, "epoch": 0.0128, "grad_norm": 0.003983162809163332, "learning_rate": 6.25e-07, "loss": 0.0049, "num_tokens": 3025932.0, "reward": 0.5511161088943481, "reward_std": 0.5218957662582397, "rewards/accuracy_reward": 0.26171875, "rewards/brier_reward": 0.243483304977417, "rewards/confidence_one_or_zero": 0.462890625, "rewards/format_reward": 0.5970051884651184, "rewards/mean_confidence_reward": 0.7861537337303162, "step": 2 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01888020833333337, "completions/max_length": 4096.0, "completions/max_terminated_length": 3793.0, "completions/mean_length": 645.0703125, "completions/mean_terminated_length": 578.6622314453125, "completions/min_length": 4.0, "completions/min_terminated_length": 4.0, "epoch": 0.0192, "grad_norm": 0.003661321708932519, "learning_rate": 9.375000000000001e-07, "loss": -0.0062, "num_tokens": 4550208.0, "reward": 0.5277880430221558, "reward_std": 0.5125378966331482, "rewards/accuracy_reward": 0.2415364533662796, "rewards/brier_reward": 0.22221779823303223, "rewards/confidence_one_or_zero": 0.4557291567325592, "rewards/format_reward": 0.591796875, "rewards/mean_confidence_reward": 0.7892962098121643, "step": 3 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.02278645833333337, "completions/max_length": 4096.0, "completions/max_terminated_length": 4046.0, "completions/mean_length": 584.3079833984375, "completions/mean_terminated_length": 502.4230651855469, "completions/min_length": 4.0, "completions/min_terminated_length": 4.0, "epoch": 0.0256, "grad_norm": 0.002781560877338052, "learning_rate": 1.25e-06, "loss": 0.0091, "num_tokens": 5963041.0, "reward": 0.5828301906585693, "reward_std": 0.5177066326141357, "rewards/accuracy_reward": 0.267578125, "rewards/brier_reward": 0.2450609803199768, "rewards/confidence_one_or_zero": 0.484375, "rewards/format_reward": 0.6529948115348816, "rewards/mean_confidence_reward": 0.8394980430603027, "step": 4 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.02408854166666663, "completions/max_length": 4096.0, "completions/max_terminated_length": 4080.0, "completions/mean_length": 625.9225463867188, "completions/mean_terminated_length": 540.2702026367188, "completions/min_length": 2.0, "completions/min_terminated_length": 2.0, "epoch": 0.032, "grad_norm": 0.003664789954200387, "learning_rate": 1.5625e-06, "loss": -0.0097, "num_tokens": 7451674.0, "reward": 0.5913209915161133, "reward_std": 0.5131308436393738, "rewards/accuracy_reward": 0.2740885317325592, "rewards/brier_reward": 0.25227776169776917, "rewards/confidence_one_or_zero": 0.474609375, "rewards/format_reward": 0.65625, "rewards/mean_confidence_reward": 0.8091971278190613, "step": 5 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.02994791666666663, "completions/max_length": 4096.0, "completions/max_terminated_length": 4049.0, "completions/mean_length": 633.5247802734375, "completions/mean_terminated_length": 526.6295776367188, "completions/min_length": 2.0, "completions/min_terminated_length": 2.0, "epoch": 0.0384, "grad_norm": 0.010333490557968616, "learning_rate": 1.8750000000000003e-06, "loss": 0.0123, "num_tokens": 8953816.0, "reward": 0.6082988977432251, "reward_std": 0.46747028827667236, "rewards/accuracy_reward": 0.2630208432674408, "rewards/brier_reward": 0.23415106534957886, "rewards/confidence_one_or_zero": 0.4348958432674408, "rewards/format_reward": 0.7194010615348816, "rewards/mean_confidence_reward": 0.8058521747589111, "step": 6 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.02083333333333337, "completions/max_length": 4096.0, "completions/max_terminated_length": 3932.0, "completions/mean_length": 570.5657958984375, "completions/mean_terminated_length": 495.5564880371094, "completions/min_length": 12.0, "completions/min_terminated_length": 12.0, "epoch": 0.0448, "grad_norm": 0.007485097274184227, "learning_rate": 2.1875000000000002e-06, "loss": 0.0131, "num_tokens": 10361133.0, "reward": 0.68055260181427, "reward_std": 0.4591377377510071, "rewards/accuracy_reward": 0.2903645932674408, "rewards/brier_reward": 0.258865088224411, "rewards/confidence_one_or_zero": 0.4733072817325592, "rewards/format_reward": 0.8118489384651184, "rewards/mean_confidence_reward": 0.8565878868103027, "step": 7 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.02799479166666663, "completions/max_length": 4096.0, "completions/max_terminated_length": 4053.0, "completions/mean_length": 573.7142333984375, "completions/mean_terminated_length": 472.2685852050781, "completions/min_length": 61.0, "completions/min_terminated_length": 61.0, "epoch": 0.0512, "grad_norm": 0.002246174495667219, "learning_rate": 2.5e-06, "loss": 0.0107, "num_tokens": 11765862.0, "reward": 0.70420902967453, "reward_std": 0.4425145089626312, "rewards/accuracy_reward": 0.287109375, "rewards/brier_reward": 0.2586513161659241, "rewards/confidence_one_or_zero": 0.4811197817325592, "rewards/format_reward": 0.8626301884651184, "rewards/mean_confidence_reward": 0.8782031536102295, "step": 8 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.03645833333333337, "completions/max_length": 4096.0, "completions/max_terminated_length": 3941.0, "completions/mean_length": 591.3802490234375, "completions/mean_terminated_length": 458.7729797363281, "completions/min_length": 71.0, "completions/min_terminated_length": 71.0, "epoch": 0.0576, "grad_norm": 0.0037308428436517715, "learning_rate": 2.8125e-06, "loss": 0.0278, "num_tokens": 13205902.0, "reward": 0.7984961271286011, "reward_std": 0.4640999734401703, "rewards/accuracy_reward": 0.3626302182674408, "rewards/brier_reward": 0.3365488052368164, "rewards/confidence_one_or_zero": 0.4524739682674408, "rewards/format_reward": 0.8977864384651184, "rewards/mean_confidence_reward": 0.8799348473548889, "step": 9 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.06315104166666663, "completions/max_length": 4096.0, "completions/max_terminated_length": 3962.0, "completions/mean_length": 664.7389526367188, "completions/mean_terminated_length": 433.44476318359375, "completions/min_length": 40.0, "completions/min_terminated_length": 40.0, "epoch": 0.064, "grad_norm": 0.016755374148488045, "learning_rate": 3.125e-06, "loss": 0.0434, "num_tokens": 14762301.0, "reward": 0.7937191724777222, "reward_std": 0.42769724130630493, "rewards/accuracy_reward": 0.3509114682674408, "rewards/brier_reward": 0.33025145530700684, "rewards/confidence_one_or_zero": 0.416015625, "rewards/format_reward": 0.90625, "rewards/mean_confidence_reward": 0.8513795733451843, "step": 10 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.11588541666666663, "completions/max_length": 4096.0, "completions/max_terminated_length": 4054.0, "completions/mean_length": 879.6061401367188, "completions/mean_terminated_length": 458.0169372558594, "completions/min_length": 88.0, "completions/min_terminated_length": 88.0, "epoch": 0.0704, "grad_norm": 0.0010431965347379446, "learning_rate": 3.4375e-06, "loss": 0.0802, "num_tokens": 16640792.0, "reward": 0.782174825668335, "reward_std": 0.4354153573513031, "rewards/accuracy_reward": 0.3541666567325592, "rewards/brier_reward": 0.35273900628089905, "rewards/confidence_one_or_zero": 0.322265625, "rewards/format_reward": 0.857421875, "rewards/mean_confidence_reward": 0.7872786521911621, "step": 11 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.07552083333333337, "completions/max_length": 4096.0, "completions/max_terminated_length": 3912.0, "completions/mean_length": 722.7220458984375, "completions/mean_terminated_length": 447.158447265625, "completions/min_length": 95.0, "completions/min_terminated_length": 95.0, "epoch": 0.0768, "grad_norm": 0.000985628110356629, "learning_rate": 3.7500000000000005e-06, "loss": 0.0533, "num_tokens": 18272773.0, "reward": 0.8280217051506042, "reward_std": 0.4171297252178192, "rewards/accuracy_reward": 0.369140625, "rewards/brier_reward": 0.37216663360595703, "rewards/confidence_one_or_zero": 0.2942708432674408, "rewards/format_reward": 0.9147135615348816, "rewards/mean_confidence_reward": 0.8345110416412354, "step": 12 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01171875, "completions/max_length": 4096.0, "completions/max_terminated_length": 4092.0, "completions/mean_length": 461.41082763671875, "completions/mean_terminated_length": 418.31292724609375, "completions/min_length": 89.0, "completions/min_terminated_length": 89.0, "epoch": 0.0832, "grad_norm": 0.0010528744896873832, "learning_rate": 4.0625000000000005e-06, "loss": 0.0026, "num_tokens": 19505436.0, "reward": 0.9720399379730225, "reward_std": 0.365999311208725, "rewards/accuracy_reward": 0.4674479067325592, "rewards/brier_reward": 0.4902818202972412, "rewards/confidence_one_or_zero": 0.2278645783662796, "rewards/format_reward": 0.986328125, "rewards/mean_confidence_reward": 0.8771093487739563, "step": 13 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.009765625, "completions/max_length": 4096.0, "completions/max_terminated_length": 3807.0, "completions/mean_length": 485.35418701171875, "completions/mean_terminated_length": 449.7462463378906, "completions/min_length": 59.0, "completions/min_terminated_length": 59.0, "epoch": 0.0896, "grad_norm": 0.0009289804729633033, "learning_rate": 4.3750000000000005e-06, "loss": 0.0064, "num_tokens": 20776940.0, "reward": 1.0008982419967651, "reward_std": 0.3568176031112671, "rewards/accuracy_reward": 0.4915364682674408, "rewards/brier_reward": 0.5245621800422668, "rewards/confidence_one_or_zero": 0.1627604216337204, "rewards/format_reward": 0.9856770634651184, "rewards/mean_confidence_reward": 0.8677083849906921, "step": 14 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01041666666666663, "completions/max_length": 4096.0, "completions/max_terminated_length": 4080.0, "completions/mean_length": 513.53125, "completions/mean_terminated_length": 475.8210754394531, "completions/min_length": 108.0, "completions/min_terminated_length": 108.0, "epoch": 0.096, "grad_norm": 0.0008963477448560297, "learning_rate": 4.6875000000000004e-06, "loss": 0.0092, "num_tokens": 22099092.0, "reward": 1.0160329341888428, "reward_std": 0.34443187713623047, "rewards/accuracy_reward": 0.5032551884651184, "rewards/brier_reward": 0.5424637198448181, "rewards/confidence_one_or_zero": 0.0794270858168602, "rewards/format_reward": 0.986328125, "rewards/mean_confidence_reward": 0.8531444668769836, "step": 15 }, { "epoch": 0.096, "eval_completions/clipped_ratio": 0.0068359375, "eval_completions/max_length": 3274.125, "eval_completions/max_terminated_length": 1965.375, "eval_completions/mean_length": 504.253231048584, "eval_completions/mean_terminated_length": 479.5936050415039, "eval_completions/min_length": 142.625, "eval_completions/min_terminated_length": 142.625, "eval_loss": 0.0, "eval_num_tokens": 22099092.0, "eval_reward": 1.0268284529447556, "eval_reward_std": 0.47461608797311783, "eval_rewards/accuracy_reward": 0.5078125, "eval_rewards/brier_reward": 0.5585219040513039, "eval_rewards/confidence_one_or_zero": 0.0390625, "eval_rewards/format_reward": 0.9873046875, "eval_rewards/mean_confidence_reward": 0.8512206822633743, "eval_runtime": 212.2086, "eval_samples_per_second": 4.712, "eval_steps_per_second": 0.038, "step": 15 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 4096.0, "completions/max_terminated_length": 3472.0, "completions/mean_length": 484.94207763671875, "completions/mean_terminated_length": 470.78106689453125, "completions/min_length": 107.0, "completions/min_terminated_length": 107.0, "epoch": 0.1024, "grad_norm": 0.020831571891903877, "learning_rate": 5e-06, "loss": 0.0049, "num_tokens": 23377275.0, "reward": 1.0567774772644043, "reward_std": 0.3312305808067322, "rewards/accuracy_reward": 0.53515625, "rewards/brier_reward": 0.5855425000190735, "rewards/confidence_one_or_zero": 0.0325520820915699, "rewards/format_reward": 0.9928385615348816, "rewards/mean_confidence_reward": 0.8496484756469727, "step": 16 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00651041666666663, "completions/max_length": 4096.0, "completions/max_terminated_length": 3704.0, "completions/mean_length": 540.3619995117188, "completions/mean_terminated_length": 517.0616455078125, "completions/min_length": 101.0, "completions/min_terminated_length": 101.0, "epoch": 0.1088, "grad_norm": 0.0006857101107016206, "learning_rate": 4.919354838709678e-06, "loss": 0.0044, "num_tokens": 24737903.0, "reward": 1.0274884700775146, "reward_std": 0.30353817343711853, "rewards/accuracy_reward": 0.4973958432674408, "rewards/brier_reward": 0.5673298239707947, "rewards/confidence_one_or_zero": 0.010416666977107525, "rewards/format_reward": 0.990234375, "rewards/mean_confidence_reward": 0.8231706023216248, "step": 17 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005859375, "completions/max_length": 4096.0, "completions/max_terminated_length": 4006.0, "completions/mean_length": 572.384765625, "completions/mean_terminated_length": 551.6168823242188, "completions/min_length": 141.0, "completions/min_terminated_length": 141.0, "epoch": 0.1152, "grad_norm": 0.0006863800226710737, "learning_rate": 4.838709677419355e-06, "loss": 0.0081, "num_tokens": 26138990.0, "reward": 1.0704162120819092, "reward_std": 0.3025241196155548, "rewards/accuracy_reward": 0.5436198115348816, "rewards/brier_reward": 0.6050085425376892, "rewards/confidence_one_or_zero": 0.009114583022892475, "rewards/format_reward": 0.9921875, "rewards/mean_confidence_reward": 0.8188378810882568, "step": 18 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00911458333333337, "completions/max_length": 4096.0, "completions/max_terminated_length": 3942.0, "completions/mean_length": 584.9290771484375, "completions/mean_terminated_length": 552.6326904296875, "completions/min_length": 134.0, "completions/min_terminated_length": 134.0, "epoch": 0.1216, "grad_norm": 0.0005891257897019386, "learning_rate": 4.758064516129033e-06, "loss": 0.012, "num_tokens": 27564993.0, "reward": 1.0699093341827393, "reward_std": 0.2565997242927551, "rewards/accuracy_reward": 0.537109375, "rewards/brier_reward": 0.6163650751113892, "rewards/confidence_one_or_zero": 0.001953125, "rewards/format_reward": 0.986328125, "rewards/mean_confidence_reward": 0.7921354174613953, "step": 19 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.009765625, "completions/max_length": 4096.0, "completions/max_terminated_length": 3975.0, "completions/mean_length": 598.4486083984375, "completions/mean_terminated_length": 563.9559936523438, "completions/min_length": 158.0, "completions/min_terminated_length": 158.0, "epoch": 0.128, "grad_norm": 0.0007340199663303792, "learning_rate": 4.67741935483871e-06, "loss": 0.0099, "num_tokens": 29008834.0, "reward": 1.106736183166504, "reward_std": 0.2745085656642914, "rewards/accuracy_reward": 0.5729166865348816, "rewards/brier_reward": 0.6529099941253662, "rewards/confidence_one_or_zero": 0.0006510416860692203, "rewards/format_reward": 0.9876301884651184, "rewards/mean_confidence_reward": 0.7702994346618652, "step": 20 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01041666666666663, "completions/max_length": 4096.0, "completions/max_terminated_length": 4006.0, "completions/mean_length": 649.8717651367188, "completions/mean_terminated_length": 613.5967407226562, "completions/min_length": 164.0, "completions/min_terminated_length": 164.0, "epoch": 0.1344, "grad_norm": 0.000504179741255939, "learning_rate": 4.596774193548387e-06, "loss": 0.0119, "num_tokens": 30534293.0, "reward": 1.1364049911499023, "reward_std": 0.25532644987106323, "rewards/accuracy_reward": 0.603515625, "rewards/brier_reward": 0.6816490292549133, "rewards/confidence_one_or_zero": 0.0006510416860692203, "rewards/format_reward": 0.9876301884651184, "rewards/mean_confidence_reward": 0.7451822757720947, "step": 21 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00846354166666663, "completions/max_length": 4096.0, "completions/max_terminated_length": 4091.0, "completions/mean_length": 609.1048583984375, "completions/mean_terminated_length": 579.3414306640625, "completions/min_length": 157.0, "completions/min_terminated_length": 157.0, "epoch": 0.1408, "grad_norm": 0.000508100027218461, "learning_rate": 4.516129032258065e-06, "loss": 0.0099, "num_tokens": 31992166.0, "reward": 1.1315546035766602, "reward_std": 0.21986931562423706, "rewards/accuracy_reward": 0.5833333134651184, "rewards/brier_reward": 0.6895273327827454, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.990234375, "rewards/mean_confidence_reward": 0.704296886920929, "step": 22 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01171875, "completions/max_length": 4096.0, "completions/max_terminated_length": 3986.0, "completions/mean_length": 680.365234375, "completions/mean_terminated_length": 639.8636474609375, "completions/min_length": 173.0, "completions/min_terminated_length": 173.0, "epoch": 0.1472, "grad_norm": 0.00047725101467221975, "learning_rate": 4.435483870967742e-06, "loss": 0.0172, "num_tokens": 33570671.0, "reward": 1.1263470649719238, "reward_std": 0.22403830289840698, "rewards/accuracy_reward": 0.576171875, "rewards/brier_reward": 0.6921337246894836, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.984375, "rewards/mean_confidence_reward": 0.662109375, "step": 23 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00455729166666663, "completions/max_length": 4096.0, "completions/max_terminated_length": 3908.0, "completions/mean_length": 631.7643432617188, "completions/mean_terminated_length": 615.9044799804688, "completions/min_length": 162.0, "completions/min_terminated_length": 162.0, "epoch": 0.1536, "grad_norm": 0.0004088205751031637, "learning_rate": 4.35483870967742e-06, "loss": 0.0074, "num_tokens": 35065373.0, "reward": 1.1861932277679443, "reward_std": 0.19178341329097748, "rewards/accuracy_reward": 0.6432291865348816, "rewards/brier_reward": 0.7343525886535645, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9947916865348816, "rewards/mean_confidence_reward": 0.646484375, "step": 24 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.013671875, "completions/max_length": 4096.0, "completions/max_terminated_length": 4093.0, "completions/mean_length": 656.4909057617188, "completions/mean_terminated_length": 608.8145141601562, "completions/min_length": 142.0, "completions/min_terminated_length": 142.0, "epoch": 0.16, "grad_norm": 0.0004432302084751427, "learning_rate": 4.274193548387097e-06, "loss": 0.0131, "num_tokens": 36594351.0, "reward": 1.1493972539901733, "reward_std": 0.19187478721141815, "rewards/accuracy_reward": 0.59765625, "rewards/brier_reward": 0.7167506217956543, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.984375, "rewards/mean_confidence_reward": 0.6246419548988342, "step": 25 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00911458333333337, "completions/max_length": 4096.0, "completions/max_terminated_length": 3799.0, "completions/mean_length": 640.9525146484375, "completions/mean_terminated_length": 609.1714477539062, "completions/min_length": 212.0, "completions/min_terminated_length": 212.0, "epoch": 0.1664, "grad_norm": 0.0004940686631016433, "learning_rate": 4.193548387096774e-06, "loss": 0.0124, "num_tokens": 38107486.0, "reward": 1.1369479894638062, "reward_std": 0.18988990783691406, "rewards/accuracy_reward": 0.576171875, "rewards/brier_reward": 0.7094306945800781, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.98828125, "rewards/mean_confidence_reward": 0.6073241829872131, "step": 26 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00846354166666663, "completions/max_length": 4096.0, "completions/max_terminated_length": 4041.0, "completions/mean_length": 615.7877807617188, "completions/mean_terminated_length": 586.0814208984375, "completions/min_length": 188.0, "completions/min_terminated_length": 188.0, "epoch": 0.1728, "grad_norm": 0.00038638385012745857, "learning_rate": 4.112903225806452e-06, "loss": 0.0139, "num_tokens": 39572472.0, "reward": 1.2076165676116943, "reward_std": 0.18824410438537598, "rewards/accuracy_reward": 0.6809895634651184, "rewards/brier_reward": 0.7466012835502625, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9876301884651184, "rewards/mean_confidence_reward": 0.5919271111488342, "step": 27 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00716145833333337, "completions/max_length": 4096.0, "completions/max_terminated_length": 3511.0, "completions/mean_length": 662.2565307617188, "completions/mean_terminated_length": 637.488525390625, "completions/min_length": 221.0, "completions/min_terminated_length": 221.0, "epoch": 0.1792, "grad_norm": 0.00037064749631099403, "learning_rate": 4.032258064516129e-06, "loss": 0.0122, "num_tokens": 41115186.0, "reward": 1.1956737041473389, "reward_std": 0.16790974140167236, "rewards/accuracy_reward": 0.66015625, "rewards/brier_reward": 0.7396429181098938, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9915364384651184, "rewards/mean_confidence_reward": 0.5894531607627869, "step": 28 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0078125, "completions/max_length": 4096.0, "completions/max_terminated_length": 4092.0, "completions/mean_length": 660.4296875, "completions/mean_terminated_length": 633.3779296875, "completions/min_length": 173.0, "completions/min_terminated_length": 173.0, "epoch": 0.1856, "grad_norm": 0.0003664132673293352, "learning_rate": 3.951612903225807e-06, "loss": 0.0107, "num_tokens": 42648062.0, "reward": 1.179136872291565, "reward_std": 0.1672275960445404, "rewards/accuracy_reward": 0.63671875, "rewards/brier_reward": 0.7326110005378723, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9889323115348816, "rewards/mean_confidence_reward": 0.5756185054779053, "step": 29 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.009765625, "completions/max_length": 4096.0, "completions/max_terminated_length": 4067.0, "completions/mean_length": 679.2083740234375, "completions/mean_terminated_length": 645.51220703125, "completions/min_length": 152.0, "completions/min_terminated_length": 152.0, "epoch": 0.192, "grad_norm": 0.00031230493914335966, "learning_rate": 3.870967741935484e-06, "loss": 0.0118, "num_tokens": 44213718.0, "reward": 1.1655101776123047, "reward_std": 0.16719786822795868, "rewards/accuracy_reward": 0.61328125, "rewards/brier_reward": 0.7287955284118652, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9889323115348816, "rewards/mean_confidence_reward": 0.5680338740348816, "step": 30 }, { "epoch": 0.192, "eval_completions/clipped_ratio": 0.0078125, "eval_completions/max_length": 2955.75, "eval_completions/max_terminated_length": 2243.25, "eval_completions/mean_length": 651.0071411132812, "eval_completions/mean_terminated_length": 623.9535980224609, "eval_completions/min_length": 251.375, "eval_completions/min_terminated_length": 251.375, "eval_loss": 0.0, "eval_num_tokens": 44213718.0, "eval_reward": 1.1754617244005203, "eval_reward_std": 0.30160870030522346, "eval_rewards/accuracy_reward": 0.6259765625, "eval_rewards/brier_reward": 0.7337246015667915, "eval_rewards/confidence_one_or_zero": 0.0, "eval_rewards/format_reward": 0.9912109375, "eval_rewards/mean_confidence_reward": 0.5698242411017418, "eval_runtime": 195.9078, "eval_samples_per_second": 5.104, "eval_steps_per_second": 0.041, "step": 30 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005859375, "completions/max_length": 4096.0, "completions/max_terminated_length": 3856.0, "completions/mean_length": 640.2109375, "completions/mean_terminated_length": 619.8428344726562, "completions/min_length": 209.0, "completions/min_terminated_length": 209.0, "epoch": 0.1984, "grad_norm": 0.0004228002217132598, "learning_rate": 3.7903225806451614e-06, "loss": 0.0082, "num_tokens": 45725906.0, "reward": 1.197919249534607, "reward_std": 0.1658228039741516, "rewards/accuracy_reward": 0.66015625, "rewards/brier_reward": 0.7421810030937195, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9934895634651184, "rewards/mean_confidence_reward": 0.5704427361488342, "step": 31 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0078125, "completions/max_length": 4096.0, "completions/max_terminated_length": 3999.0, "completions/mean_length": 690.330078125, "completions/mean_terminated_length": 663.5137939453125, "completions/min_length": 202.0, "completions/min_terminated_length": 202.0, "epoch": 0.2048, "grad_norm": 0.0003048316575586796, "learning_rate": 3.7096774193548392e-06, "loss": 0.0073, "num_tokens": 47306869.0, "reward": 1.1933344602584839, "reward_std": 0.16178151965141296, "rewards/accuracy_reward": 0.65625, "rewards/brier_reward": 0.7395221590995789, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9908854365348816, "rewards/mean_confidence_reward": 0.5611328482627869, "step": 32 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0078125, "completions/max_length": 4096.0, "completions/max_terminated_length": 3514.0, "completions/mean_length": 638.478515625, "completions/mean_terminated_length": 611.25390625, "completions/min_length": 190.0, "completions/min_terminated_length": 190.0, "epoch": 0.2112, "grad_norm": 0.00036333707976154983, "learning_rate": 3.6290322580645166e-06, "loss": 0.01, "num_tokens": 48810676.0, "reward": 1.1860263347625732, "reward_std": 0.16334088146686554, "rewards/accuracy_reward": 0.6432291865348816, "rewards/brier_reward": 0.7379267811775208, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9908854365348816, "rewards/mean_confidence_reward": 0.5622721314430237, "step": 33 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00716145833333337, "completions/max_length": 4096.0, "completions/max_terminated_length": 3967.0, "completions/mean_length": 668.5677490234375, "completions/mean_terminated_length": 643.8452758789062, "completions/min_length": 181.0, "completions/min_terminated_length": 181.0, "epoch": 0.2176, "grad_norm": 0.00028770716744475067, "learning_rate": 3.548387096774194e-06, "loss": 0.0078, "num_tokens": 50361020.0, "reward": 1.1859478950500488, "reward_std": 0.14475996792316437, "rewards/accuracy_reward": 0.6451823115348816, "rewards/brier_reward": 0.7351656556129456, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9915364384651184, "rewards/mean_confidence_reward": 0.5598958134651184, "step": 34 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00520833333333337, "completions/max_length": 4096.0, "completions/max_terminated_length": 3349.0, "completions/mean_length": 648.2298583984375, "completions/mean_terminated_length": 630.1786499023438, "completions/min_length": 170.0, "completions/min_terminated_length": 170.0, "epoch": 0.224, "grad_norm": 0.00032582733547315, "learning_rate": 3.4677419354838714e-06, "loss": 0.0093, "num_tokens": 51882877.0, "reward": 1.1905927658081055, "reward_std": 0.15323978662490845, "rewards/accuracy_reward": 0.6471354365348816, "rewards/brier_reward": 0.7398984432220459, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.994140625, "rewards/mean_confidence_reward": 0.5593099594116211, "step": 35 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00520833333333337, "completions/max_length": 4096.0, "completions/max_terminated_length": 3963.0, "completions/mean_length": 665.482421875, "completions/mean_terminated_length": 647.5216064453125, "completions/min_length": 186.0, "completions/min_terminated_length": 186.0, "epoch": 0.2304, "grad_norm": 0.0003053806722164154, "learning_rate": 3.3870967741935484e-06, "loss": 0.0041, "num_tokens": 53433066.0, "reward": 1.2014939785003662, "reward_std": 0.13854166865348816, "rewards/accuracy_reward": 0.666015625, "rewards/brier_reward": 0.7428202629089355, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.994140625, "rewards/mean_confidence_reward": 0.5591146349906921, "step": 36 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01106770833333337, "completions/max_length": 4096.0, "completions/max_terminated_length": 3605.0, "completions/mean_length": 698.8529052734375, "completions/mean_terminated_length": 660.8334350585938, "completions/min_length": 206.0, "completions/min_terminated_length": 206.0, "epoch": 0.2368, "grad_norm": 0.00029780014301650226, "learning_rate": 3.306451612903226e-06, "loss": 0.0082, "num_tokens": 55030752.0, "reward": 1.1871861219406128, "reward_std": 0.15389445424079895, "rewards/accuracy_reward": 0.6510416865348816, "rewards/brier_reward": 0.7350380420684814, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.98828125, "rewards/mean_confidence_reward": 0.555859386920929, "step": 37 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00651041666666663, "completions/max_length": 4096.0, "completions/max_terminated_length": 4090.0, "completions/mean_length": 676.228515625, "completions/mean_terminated_length": 653.8184814453125, "completions/min_length": 224.0, "completions/min_terminated_length": 224.0, "epoch": 0.2432, "grad_norm": 0.00036757506313733757, "learning_rate": 3.225806451612903e-06, "loss": 0.0101, "num_tokens": 56595671.0, "reward": 1.2020938396453857, "reward_std": 0.1413881927728653, "rewards/accuracy_reward": 0.6692708134651184, "rewards/brier_reward": 0.7466244101524353, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.98828125, "rewards/mean_confidence_reward": 0.5543294548988342, "step": 38 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00846354166666663, "completions/max_length": 4096.0, "completions/max_terminated_length": 3921.0, "completions/mean_length": 707.0534057617188, "completions/mean_terminated_length": 678.1260986328125, "completions/min_length": 199.0, "completions/min_terminated_length": 199.0, "epoch": 0.2496, "grad_norm": 0.0003286061983089894, "learning_rate": 3.145161290322581e-06, "loss": 0.0077, "num_tokens": 58204649.0, "reward": 1.1853474378585815, "reward_std": 0.1483502984046936, "rewards/accuracy_reward": 0.6380208134651184, "rewards/brier_reward": 0.741777241230011, "rewards/confidence_one_or_zero": 0.0006510416860692203, "rewards/format_reward": 0.9908854365348816, "rewards/mean_confidence_reward": 0.558789074420929, "step": 39 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0032552083333333703, "completions/max_length": 4096.0, "completions/max_terminated_length": 4091.0, "completions/mean_length": 698.166015625, "completions/mean_terminated_length": 687.0692138671875, "completions/min_length": 198.0, "completions/min_terminated_length": 198.0, "epoch": 0.256, "grad_norm": 0.000307776645058766, "learning_rate": 3.0645161290322584e-06, "loss": 0.0053, "num_tokens": 59804984.0, "reward": 1.1797587871551514, "reward_std": 0.14499151706695557, "rewards/accuracy_reward": 0.6302083134651184, "rewards/brier_reward": 0.7358081936836243, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9934895634651184, "rewards/mean_confidence_reward": 0.562207043170929, "step": 40 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00846354166666663, "completions/max_length": 4096.0, "completions/max_terminated_length": 2705.0, "completions/mean_length": 697.6452026367188, "completions/mean_terminated_length": 668.6375732421875, "completions/min_length": 236.0, "completions/min_terminated_length": 236.0, "epoch": 0.2624, "grad_norm": 0.0002886159345507622, "learning_rate": 2.983870967741936e-06, "loss": 0.009, "num_tokens": 61401759.0, "reward": 1.212717890739441, "reward_std": 0.14435109496116638, "rewards/accuracy_reward": 0.6829426884651184, "rewards/brier_reward": 0.7509452700614929, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9915364384651184, "rewards/mean_confidence_reward": 0.5624349117279053, "step": 41 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01106770833333337, "completions/max_length": 4096.0, "completions/max_terminated_length": 3976.0, "completions/mean_length": 690.05078125, "completions/mean_terminated_length": 651.932861328125, "completions/min_length": 200.0, "completions/min_terminated_length": 200.0, "epoch": 0.2688, "grad_norm": 0.00031737395329400897, "learning_rate": 2.903225806451613e-06, "loss": 0.0093, "num_tokens": 62986533.0, "reward": 1.1887677907943726, "reward_std": 0.14489293098449707, "rewards/accuracy_reward": 0.6529948115348816, "rewards/brier_reward": 0.7375500798225403, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9869791865348816, "rewards/mean_confidence_reward": 0.5674805045127869, "step": 42 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00716145833333337, "completions/max_length": 4096.0, "completions/max_terminated_length": 3648.0, "completions/mean_length": 714.978515625, "completions/mean_terminated_length": 690.5908203125, "completions/min_length": 242.0, "completions/min_terminated_length": 242.0, "epoch": 0.2752, "grad_norm": 0.0003274915798101574, "learning_rate": 2.822580645161291e-06, "loss": 0.0056, "num_tokens": 64611508.0, "reward": 1.1908820867538452, "reward_std": 0.15602055191993713, "rewards/accuracy_reward": 0.646484375, "rewards/brier_reward": 0.7430807948112488, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9921875, "rewards/mean_confidence_reward": 0.5716796517372131, "step": 43 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00455729166666663, "completions/max_length": 4096.0, "completions/max_terminated_length": 3378.0, "completions/mean_length": 668.1412963867188, "completions/mean_terminated_length": 652.447998046875, "completions/min_length": 205.0, "completions/min_terminated_length": 205.0, "epoch": 0.2816, "grad_norm": 0.00034042284823954105, "learning_rate": 2.7419354838709676e-06, "loss": 0.0043, "num_tokens": 66163893.0, "reward": 1.2087671756744385, "reward_std": 0.15592199563980103, "rewards/accuracy_reward": 0.6751301884651184, "rewards/brier_reward": 0.7489029765129089, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9934895634651184, "rewards/mean_confidence_reward": 0.5762044787406921, "step": 44 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 4096.0, "completions/max_terminated_length": 4066.0, "completions/mean_length": 702.845703125, "completions/mean_terminated_length": 689.5392456054688, "completions/min_length": 282.0, "completions/min_terminated_length": 282.0, "epoch": 0.288, "grad_norm": 0.0002904966240748763, "learning_rate": 2.6612903225806454e-06, "loss": 0.0076, "num_tokens": 67767208.0, "reward": 1.1831653118133545, "reward_std": 0.135649636387825, "rewards/accuracy_reward": 0.6315104365348816, "rewards/brier_reward": 0.7432721257209778, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9915364384651184, "rewards/mean_confidence_reward": 0.5733073353767395, "step": 45 }, { "epoch": 0.288, "eval_completions/clipped_ratio": 0.006084735576923073, "eval_completions/max_length": 3151.125, "eval_completions/max_terminated_length": 1663.875, "eval_completions/mean_length": 685.4481735229492, "eval_completions/mean_terminated_length": 664.5987167358398, "eval_completions/min_length": 277.0, "eval_completions/min_terminated_length": 277.0, "eval_loss": 0.0, "eval_num_tokens": 67767208.0, "eval_reward": 1.1941805630922318, "eval_reward_std": 0.3026689551770687, "eval_rewards/accuracy_reward": 0.6494140625, "eval_rewards/brier_reward": 0.7447949051856995, "eval_rewards/confidence_one_or_zero": 0.0, "eval_rewards/format_reward": 0.994140625, "eval_rewards/mean_confidence_reward": 0.5772461071610451, "eval_runtime": 206.3461, "eval_samples_per_second": 4.846, "eval_steps_per_second": 0.039, "step": 45 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00455729166666663, "completions/max_length": 4096.0, "completions/max_terminated_length": 4076.0, "completions/mean_length": 662.3568115234375, "completions/mean_terminated_length": 646.636962890625, "completions/min_length": 212.0, "completions/min_terminated_length": 212.0, "epoch": 0.2944, "grad_norm": 0.00032452234881930053, "learning_rate": 2.580645161290323e-06, "loss": 0.0078, "num_tokens": 69315700.0, "reward": 1.1911271810531616, "reward_std": 0.1421237289905548, "rewards/accuracy_reward": 0.646484375, "rewards/brier_reward": 0.7416178584098816, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.994140625, "rewards/mean_confidence_reward": 0.58154296875, "step": 46 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.009765625, "completions/max_length": 4096.0, "completions/max_terminated_length": 3704.0, "completions/mean_length": 722.6530151367188, "completions/mean_terminated_length": 689.3853149414062, "completions/min_length": 265.0, "completions/min_terminated_length": 265.0, "epoch": 0.3008, "grad_norm": 0.0003498312726151198, "learning_rate": 2.5e-06, "loss": 0.0063, "num_tokens": 70953055.0, "reward": 1.1994168758392334, "reward_std": 0.1521904170513153, "rewards/accuracy_reward": 0.6640625, "rewards/brier_reward": 0.7458271384239197, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9889323115348816, "rewards/mean_confidence_reward": 0.5755208134651184, "step": 47 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00520833333333337, "completions/max_length": 4096.0, "completions/max_terminated_length": 3991.0, "completions/mean_length": 731.9296875, "completions/mean_terminated_length": 714.3167724609375, "completions/min_length": 209.0, "completions/min_terminated_length": 209.0, "epoch": 0.3072, "grad_norm": 0.0003517513978295028, "learning_rate": 2.4193548387096776e-06, "loss": 0.0075, "num_tokens": 72609827.0, "reward": 1.179626703262329, "reward_std": 0.17823223769664764, "rewards/accuracy_reward": 0.6295573115348816, "rewards/brier_reward": 0.7381477355957031, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9915364384651184, "rewards/mean_confidence_reward": 0.58251953125, "step": 48 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0013020833333333703, "completions/max_length": 4096.0, "completions/max_terminated_length": 3982.0, "completions/mean_length": 671.9798583984375, "completions/mean_terminated_length": 667.515625, "completions/min_length": 222.0, "completions/min_terminated_length": 222.0, "epoch": 0.3136, "grad_norm": 0.00028376278351061046, "learning_rate": 2.338709677419355e-06, "loss": 0.0015, "num_tokens": 74171436.0, "reward": 1.207430362701416, "reward_std": 0.13102313876152039, "rewards/accuracy_reward": 0.6673176884651184, "rewards/brier_reward": 0.7501354217529297, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9973958134651184, "rewards/mean_confidence_reward": 0.5880208611488342, "step": 49 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 4096.0, "completions/max_terminated_length": 3469.0, "completions/mean_length": 672.4915771484375, "completions/mean_terminated_length": 659.0660400390625, "completions/min_length": 227.0, "completions/min_terminated_length": 227.0, "epoch": 0.32, "grad_norm": 0.00033841372351162136, "learning_rate": 2.2580645161290324e-06, "loss": 0.0059, "num_tokens": 75729159.0, "reward": 1.2066926956176758, "reward_std": 0.13676881790161133, "rewards/accuracy_reward": 0.6673176884651184, "rewards/brier_reward": 0.7506132125854492, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9954426884651184, "rewards/mean_confidence_reward": 0.586132824420929, "step": 50 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0032552083333333703, "completions/max_length": 4096.0, "completions/max_terminated_length": 3465.0, "completions/mean_length": 668.6673583984375, "completions/mean_terminated_length": 657.4741821289062, "completions/min_length": 226.0, "completions/min_terminated_length": 226.0, "epoch": 0.3264, "grad_norm": 0.0003204546810593456, "learning_rate": 2.17741935483871e-06, "loss": 0.0045, "num_tokens": 77279088.0, "reward": 1.194650411605835, "reward_std": 0.14517521858215332, "rewards/accuracy_reward": 0.6471354365348816, "rewards/brier_reward": 0.7454085350036621, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9967448115348816, "rewards/mean_confidence_reward": 0.5876953601837158, "step": 51 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005859375, "completions/max_length": 4096.0, "completions/max_terminated_length": 4063.0, "completions/mean_length": 662.62109375, "completions/mean_terminated_length": 642.3850708007812, "completions/min_length": 233.0, "completions/min_terminated_length": 233.0, "epoch": 0.3328, "grad_norm": 0.0003081200993619859, "learning_rate": 2.096774193548387e-06, "loss": 0.0062, "num_tokens": 78826938.0, "reward": 1.1930209398269653, "reward_std": 0.12649165093898773, "rewards/accuracy_reward": 0.650390625, "rewards/brier_reward": 0.7421497702598572, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9934895634651184, "rewards/mean_confidence_reward": 0.5915364623069763, "step": 52 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0032552083333333703, "completions/max_length": 4096.0, "completions/max_terminated_length": 2943.0, "completions/mean_length": 682.712890625, "completions/mean_terminated_length": 671.5656127929688, "completions/min_length": 239.0, "completions/min_terminated_length": 239.0, "epoch": 0.3392, "grad_norm": 0.0003420892171561718, "learning_rate": 2.0161290322580646e-06, "loss": 0.0049, "num_tokens": 80397729.0, "reward": 1.2036316394805908, "reward_std": 0.13504670560359955, "rewards/accuracy_reward": 0.6627604365348816, "rewards/brier_reward": 0.7477460503578186, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9967448115348816, "rewards/mean_confidence_reward": 0.5904297232627869, "step": 53 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 4096.0, "completions/max_terminated_length": 3952.0, "completions/mean_length": 678.2526245117188, "completions/mean_terminated_length": 664.8496704101562, "completions/min_length": 228.0, "completions/min_terminated_length": 228.0, "epoch": 0.3456, "grad_norm": 0.000295772566460073, "learning_rate": 1.935483870967742e-06, "loss": 0.0055, "num_tokens": 81963925.0, "reward": 1.2102819681167603, "reward_std": 0.12340329587459564, "rewards/accuracy_reward": 0.6744791865348816, "rewards/brier_reward": 0.751281201839447, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9947916865348816, "rewards/mean_confidence_reward": 0.5891276001930237, "step": 54 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0032552083333333703, "completions/max_length": 4096.0, "completions/max_terminated_length": 3310.0, "completions/mean_length": 693.1536865234375, "completions/mean_terminated_length": 682.0404663085938, "completions/min_length": 214.0, "completions/min_terminated_length": 214.0, "epoch": 0.352, "grad_norm": 0.00035071276943199337, "learning_rate": 1.8548387096774196e-06, "loss": 0.0042, "num_tokens": 83556465.0, "reward": 1.2013576030731201, "reward_std": 0.11804833263158798, "rewards/accuracy_reward": 0.658203125, "rewards/brier_reward": 0.7484062314033508, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.99609375, "rewards/mean_confidence_reward": 0.5944010615348816, "step": 55 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0026041666666666297, "completions/max_length": 4096.0, "completions/max_terminated_length": 3637.0, "completions/mean_length": 731.8359375, "completions/mean_terminated_length": 723.05224609375, "completions/min_length": 242.0, "completions/min_terminated_length": 242.0, "epoch": 0.3584, "grad_norm": 0.0003235254262108356, "learning_rate": 1.774193548387097e-06, "loss": 0.0041, "num_tokens": 85208813.0, "reward": 1.216925024986267, "reward_std": 0.14454582333564758, "rewards/accuracy_reward": 0.6822916865348816, "rewards/brier_reward": 0.7554528117179871, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.99609375, "rewards/mean_confidence_reward": 0.5896158814430237, "step": 56 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 4096.0, "completions/max_terminated_length": 2212.0, "completions/mean_length": 663.8737182617188, "completions/mean_terminated_length": 650.4144287109375, "completions/min_length": 210.0, "completions/min_terminated_length": 210.0, "epoch": 0.3648, "grad_norm": 0.00034046408836729825, "learning_rate": 1.6935483870967742e-06, "loss": 0.0063, "num_tokens": 86754851.0, "reward": 1.2455027103424072, "reward_std": 0.14017263054847717, "rewards/accuracy_reward": 0.7291666865348816, "rewards/brier_reward": 0.7657330632209778, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.99609375, "rewards/mean_confidence_reward": 0.5921224355697632, "step": 57 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0032552083333333703, "completions/max_length": 4096.0, "completions/max_terminated_length": 2393.0, "completions/mean_length": 698.7897338867188, "completions/mean_terminated_length": 687.6949462890625, "completions/min_length": 270.0, "completions/min_terminated_length": 270.0, "epoch": 0.3712, "grad_norm": 0.00033182092010974884, "learning_rate": 1.6129032258064516e-06, "loss": 0.0048, "num_tokens": 88357480.0, "reward": 1.2445855140686035, "reward_std": 0.13970522582530975, "rewards/accuracy_reward": 0.7265625, "rewards/brier_reward": 0.7658515572547913, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9967448115348816, "rewards/mean_confidence_reward": 0.5940755009651184, "step": 58 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0026041666666666297, "completions/max_length": 4096.0, "completions/max_terminated_length": 3767.0, "completions/mean_length": 684.9967651367188, "completions/mean_terminated_length": 676.0907592773438, "completions/min_length": 226.0, "completions/min_terminated_length": 226.0, "epoch": 0.3776, "grad_norm": 0.0003278127405792475, "learning_rate": 1.5322580645161292e-06, "loss": 0.0045, "num_tokens": 89933691.0, "reward": 1.2042417526245117, "reward_std": 0.12414063513278961, "rewards/accuracy_reward": 0.6647135615348816, "rewards/brier_reward": 0.7476640343666077, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.99609375, "rewards/mean_confidence_reward": 0.5949869751930237, "step": 59 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 4096.0, "completions/max_terminated_length": 3523.0, "completions/mean_length": 691.3046875, "completions/mean_terminated_length": 677.9529418945312, "completions/min_length": 251.0, "completions/min_terminated_length": 251.0, "epoch": 0.384, "grad_norm": 0.0003617078182287514, "learning_rate": 1.4516129032258066e-06, "loss": 0.0072, "num_tokens": 91522447.0, "reward": 1.19664466381073, "reward_std": 0.13888517022132874, "rewards/accuracy_reward": 0.650390625, "rewards/brier_reward": 0.7474439740180969, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9954426884651184, "rewards/mean_confidence_reward": 0.5925130248069763, "step": 60 }, { "epoch": 0.384, "eval_completions/clipped_ratio": 0.00390625, "eval_completions/max_length": 2750.5, "eval_completions/max_terminated_length": 2110.25, "eval_completions/mean_length": 694.6929092407227, "eval_completions/mean_terminated_length": 681.4098587036133, "eval_completions/min_length": 282.25, "eval_completions/min_terminated_length": 282.25, "eval_loss": 0.0, "eval_num_tokens": 91522447.0, "eval_reward": 1.2001934349536896, "eval_reward_std": 0.2988221123814583, "eval_rewards/accuracy_reward": 0.65625, "eval_rewards/brier_reward": 0.7480312362313271, "eval_rewards/confidence_one_or_zero": 0.0, "eval_rewards/format_reward": 0.99609375, "eval_rewards/mean_confidence_reward": 0.5917969048023224, "eval_runtime": 180.5361, "eval_samples_per_second": 5.539, "eval_steps_per_second": 0.044, "step": 60 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0032552083333333703, "completions/max_length": 4096.0, "completions/max_terminated_length": 3369.0, "completions/mean_length": 717.5091552734375, "completions/mean_terminated_length": 706.4754638671875, "completions/min_length": 227.0, "completions/min_terminated_length": 227.0, "epoch": 0.3904, "grad_norm": 0.0002951840579044074, "learning_rate": 1.3709677419354838e-06, "loss": 0.0048, "num_tokens": 93160469.0, "reward": 1.1742024421691895, "reward_std": 0.1309945285320282, "rewards/accuracy_reward": 0.6171875, "rewards/brier_reward": 0.7351120114326477, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.99609375, "rewards/mean_confidence_reward": 0.5895833969116211, "step": 61 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0013020833333333703, "completions/max_length": 4096.0, "completions/max_terminated_length": 3920.0, "completions/mean_length": 696.4987182617188, "completions/mean_terminated_length": 692.0664672851562, "completions/min_length": 247.0, "completions/min_terminated_length": 247.0, "epoch": 0.3968, "grad_norm": 0.00034755203523673117, "learning_rate": 1.2903225806451614e-06, "loss": 0.0043, "num_tokens": 94757995.0, "reward": 1.207226276397705, "reward_std": 0.14550277590751648, "rewards/accuracy_reward": 0.666015625, "rewards/brier_reward": 0.7503781914710999, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.998046875, "rewards/mean_confidence_reward": 0.5946289300918579, "step": 62 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0006510416666666297, "completions/max_length": 4096.0, "completions/max_terminated_length": 3209.0, "completions/mean_length": 665.5703125, "completions/mean_terminated_length": 663.3355102539062, "completions/min_length": 208.0, "completions/min_terminated_length": 208.0, "epoch": 0.4032, "grad_norm": 0.0003047801728826016, "learning_rate": 1.2096774193548388e-06, "loss": 0.0038, "num_tokens": 96305975.0, "reward": 1.2266261577606201, "reward_std": 0.12364225089550018, "rewards/accuracy_reward": 0.6959635615348816, "rewards/brier_reward": 0.7585787773132324, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9986979365348816, "rewards/mean_confidence_reward": 0.5923177599906921, "step": 63 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 4096.0, "completions/max_terminated_length": 3825.0, "completions/mean_length": 714.24609375, "completions/mean_terminated_length": 700.9843139648438, "completions/min_length": 250.0, "completions/min_terminated_length": 250.0, "epoch": 0.4096, "grad_norm": 0.0003700917004607618, "learning_rate": 1.1290322580645162e-06, "loss": 0.0061, "num_tokens": 97927537.0, "reward": 1.2228282690048218, "reward_std": 0.14666973054409027, "rewards/accuracy_reward": 0.6920573115348816, "rewards/brier_reward": 0.7574934959411621, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.99609375, "rewards/mean_confidence_reward": 0.5906250476837158, "step": 64 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001953125, "completions/max_length": 4096.0, "completions/max_terminated_length": 2592.0, "completions/mean_length": 692.2435302734375, "completions/mean_terminated_length": 685.58251953125, "completions/min_length": 222.0, "completions/min_terminated_length": 222.0, "epoch": 0.416, "grad_norm": 0.0003462318563833833, "learning_rate": 1.0483870967741936e-06, "loss": 0.0045, "num_tokens": 99521967.0, "reward": 1.2195795774459839, "reward_std": 0.12639373540878296, "rewards/accuracy_reward": 0.6848958134651184, "rewards/brier_reward": 0.7562044262886047, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.998046875, "rewards/mean_confidence_reward": 0.5926432609558105, "step": 65 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0026041666666666297, "completions/max_length": 4096.0, "completions/max_terminated_length": 3007.0, "completions/mean_length": 699.4251708984375, "completions/mean_terminated_length": 690.5568237304688, "completions/min_length": 268.0, "completions/min_terminated_length": 268.0, "epoch": 0.4224, "grad_norm": 0.00033353836624883115, "learning_rate": 9.67741935483871e-07, "loss": 0.0032, "num_tokens": 101121940.0, "reward": 1.22261381149292, "reward_std": 0.13449697196483612, "rewards/accuracy_reward": 0.693359375, "rewards/brier_reward": 0.7544605731964111, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9973958134651184, "rewards/mean_confidence_reward": 0.5918294787406921, "step": 66 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0032552083333333703, "completions/max_length": 4096.0, "completions/max_terminated_length": 3895.0, "completions/mean_length": 707.8529052734375, "completions/mean_terminated_length": 696.7877197265625, "completions/min_length": 264.0, "completions/min_terminated_length": 264.0, "epoch": 0.4288, "grad_norm": 0.00033317628549411893, "learning_rate": 8.870967741935485e-07, "loss": 0.0048, "num_tokens": 102732866.0, "reward": 1.2167930603027344, "reward_std": 0.14756852388381958, "rewards/accuracy_reward": 0.685546875, "rewards/brier_reward": 0.7538866996765137, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.994140625, "rewards/mean_confidence_reward": 0.5919271111488342, "step": 67 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0013020833333333703, "completions/max_length": 4096.0, "completions/max_terminated_length": 3975.0, "completions/mean_length": 679.1966552734375, "completions/mean_terminated_length": 674.7418212890625, "completions/min_length": 282.0, "completions/min_terminated_length": 282.0, "epoch": 0.4352, "grad_norm": 0.0003327982558403164, "learning_rate": 8.064516129032258e-07, "loss": 0.0035, "num_tokens": 104304616.0, "reward": 1.219343662261963, "reward_std": 0.14099721610546112, "rewards/accuracy_reward": 0.685546875, "rewards/brier_reward": 0.7550816535949707, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.998046875, "rewards/mean_confidence_reward": 0.5933919548988342, "step": 68 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00651041666666663, "completions/max_length": 4096.0, "completions/max_terminated_length": 4057.0, "completions/mean_length": 707.6243896484375, "completions/mean_terminated_length": 685.4201049804688, "completions/min_length": 211.0, "completions/min_terminated_length": 211.0, "epoch": 0.4416, "grad_norm": 0.00039123473106883466, "learning_rate": 7.258064516129033e-07, "loss": 0.0085, "num_tokens": 105919295.0, "reward": 1.1870570182800293, "reward_std": 0.1436096727848053, "rewards/accuracy_reward": 0.64453125, "rewards/brier_reward": 0.7386855483055115, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9908854365348816, "rewards/mean_confidence_reward": 0.5858398675918579, "step": 69 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0026041666666666297, "completions/max_length": 4096.0, "completions/max_terminated_length": 3348.0, "completions/mean_length": 702.8671875, "completions/mean_terminated_length": 694.0078735351562, "completions/min_length": 258.0, "completions/min_terminated_length": 258.0, "epoch": 0.448, "grad_norm": 0.0003377721586730331, "learning_rate": 6.451612903225807e-07, "loss": 0.0031, "num_tokens": 107526899.0, "reward": 1.2125215530395508, "reward_std": 0.14915111660957336, "rewards/accuracy_reward": 0.6751301884651184, "rewards/brier_reward": 0.7531562447547913, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9967448115348816, "rewards/mean_confidence_reward": 0.5910807251930237, "step": 70 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0026041666666666297, "completions/max_length": 4096.0, "completions/max_terminated_length": 3629.0, "completions/mean_length": 685.8678588867188, "completions/mean_terminated_length": 676.964111328125, "completions/min_length": 266.0, "completions/min_terminated_length": 266.0, "epoch": 0.4544, "grad_norm": 0.00031751353526487947, "learning_rate": 5.645161290322581e-07, "loss": 0.0051, "num_tokens": 109102600.0, "reward": 1.2455437183380127, "reward_std": 0.1256546825170517, "rewards/accuracy_reward": 0.728515625, "rewards/brier_reward": 0.7658147811889648, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9967448115348816, "rewards/mean_confidence_reward": 0.5949544310569763, "step": 71 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00455729166666663, "completions/max_length": 4096.0, "completions/max_terminated_length": 3601.0, "completions/mean_length": 708.2962646484375, "completions/mean_terminated_length": 692.7867431640625, "completions/min_length": 259.0, "completions/min_terminated_length": 259.0, "epoch": 0.4608, "grad_norm": 0.0003313023771625012, "learning_rate": 4.838709677419355e-07, "loss": 0.0067, "num_tokens": 110719119.0, "reward": 1.193752408027649, "reward_std": 0.14569219946861267, "rewards/accuracy_reward": 0.6484375, "rewards/brier_reward": 0.7442636489868164, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9947916865348816, "rewards/mean_confidence_reward": 0.5896809697151184, "step": 72 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 4096.0, "completions/max_terminated_length": 4002.0, "completions/mean_length": 701.8294677734375, "completions/mean_terminated_length": 688.5189819335938, "completions/min_length": 206.0, "completions/min_terminated_length": 206.0, "epoch": 0.4672, "grad_norm": 0.0002959003031719476, "learning_rate": 4.032258064516129e-07, "loss": 0.0064, "num_tokens": 112316233.0, "reward": 1.2044414281845093, "reward_std": 0.13446907699108124, "rewards/accuracy_reward": 0.6653645634651184, "rewards/brier_reward": 0.7487148642539978, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9947916865348816, "rewards/mean_confidence_reward": 0.5902343392372131, "step": 73 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0026041666666666297, "completions/max_length": 4096.0, "completions/max_terminated_length": 4061.0, "completions/mean_length": 676.0768432617188, "completions/mean_terminated_length": 667.1475219726562, "completions/min_length": 226.0, "completions/min_terminated_length": 226.0, "epoch": 0.4736, "grad_norm": 0.00029477832140401006, "learning_rate": 3.2258064516129035e-07, "loss": 0.0061, "num_tokens": 113878231.0, "reward": 1.2263811826705933, "reward_std": 0.11916504800319672, "rewards/accuracy_reward": 0.6998698115348816, "rewards/brier_reward": 0.7567868232727051, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.99609375, "rewards/mean_confidence_reward": 0.5970052480697632, "step": 74 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00520833333333337, "completions/max_length": 4096.0, "completions/max_terminated_length": 4064.0, "completions/mean_length": 715.3502807617188, "completions/mean_terminated_length": 697.6505126953125, "completions/min_length": 250.0, "completions/min_terminated_length": 250.0, "epoch": 0.48, "grad_norm": 0.00032259986619465053, "learning_rate": 2.4193548387096775e-07, "loss": 0.0052, "num_tokens": 115499489.0, "reward": 1.2046186923980713, "reward_std": 0.1424405723810196, "rewards/accuracy_reward": 0.6647135615348816, "rewards/brier_reward": 0.7497200965881348, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9947916865348816, "rewards/mean_confidence_reward": 0.5918620228767395, "step": 75 }, { "epoch": 0.48, "eval_completions/clipped_ratio": 0.0021784855769230727, "eval_completions/max_length": 2731.5, "eval_completions/max_terminated_length": 2188.25, "eval_completions/mean_length": 698.0206604003906, "eval_completions/mean_terminated_length": 690.5886993408203, "eval_completions/min_length": 273.625, "eval_completions/min_terminated_length": 273.625, "eval_loss": 0.0, "eval_num_tokens": 115499489.0, "eval_reward": 1.2047217637300491, "eval_reward_std": 0.2950289249420166, "eval_rewards/accuracy_reward": 0.6611328125, "eval_rewards/brier_reward": 0.7502519488334656, "eval_rewards/confidence_one_or_zero": 0.0, "eval_rewards/format_reward": 0.998046875, "eval_rewards/mean_confidence_reward": 0.5946289300918579, "eval_runtime": 182.4904, "eval_samples_per_second": 5.48, "eval_steps_per_second": 0.044, "step": 75 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0006510416666666297, "completions/max_length": 4096.0, "completions/max_terminated_length": 2605.0, "completions/mean_length": 687.99609375, "completions/mean_terminated_length": 685.77587890625, "completions/min_length": 238.0, "completions/min_terminated_length": 238.0, "epoch": 0.4864, "grad_norm": 0.0003024231409654021, "learning_rate": 1.6129032258064518e-07, "loss": 0.0025, "num_tokens": 117078467.0, "reward": 1.2596244812011719, "reward_std": 0.13364391028881073, "rewards/accuracy_reward": 0.74609375, "rewards/brier_reward": 0.7737943530082703, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9993489384651184, "rewards/mean_confidence_reward": 0.5975260734558105, "step": 76 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0026041666666666297, "completions/max_length": 4096.0, "completions/max_terminated_length": 2174.0, "completions/mean_length": 692.5631713867188, "completions/mean_terminated_length": 683.6768798828125, "completions/min_length": 208.0, "completions/min_terminated_length": 208.0, "epoch": 0.4928, "grad_norm": 0.00031940749613568187, "learning_rate": 8.064516129032259e-08, "loss": 0.0037, "num_tokens": 118665580.0, "reward": 1.239206314086914, "reward_std": 0.12442197650671005, "rewards/accuracy_reward": 0.716796875, "rewards/brier_reward": 0.7642080187797546, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9973958134651184, "rewards/mean_confidence_reward": 0.5926106572151184, "step": 77 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001953125, "completions/max_length": 4096.0, "completions/max_terminated_length": 3732.0, "completions/mean_length": 699.201171875, "completions/mean_terminated_length": 692.5538330078125, "completions/min_length": 248.0, "completions/min_terminated_length": 248.0, "epoch": 0.4992, "grad_norm": 0.0003164388763252646, "learning_rate": 0.0, "loss": 0.0045, "num_tokens": 120267993.0, "reward": 1.2062182426452637, "reward_std": 0.1399303674697876, "rewards/accuracy_reward": 0.6673176884651184, "rewards/brier_reward": 0.7477109432220459, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9973958134651184, "rewards/mean_confidence_reward": 0.5910807251930237, "step": 78 }, { "epoch": 0.4992, "step": 78, "total_flos": 0.0, "train_loss": 0.008966646576598764, "train_runtime": 16350.0741, "train_samples_per_second": 0.917, "train_steps_per_second": 0.005 } ], "logging_steps": 1, "max_steps": 78, "num_input_tokens_seen": 120267993, "num_train_epochs": 1, "save_steps": 60, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 0.0, "train_batch_size": 3, "trial_name": null, "trial_params": null }