Files
qwen2.5-7B-rlar_g8_b384_mat…/trainer_state.json
ModelHub XC 19650420ad 初始化项目,由ModelHub XC社区提供模型
Model: gguk2on/qwen2.5-7B-rlar_g8_b384_math_0.20.2
Source: Original Platform
2026-08-17 17:54:16 +08:00

2264 lines
85 KiB
JSON

{
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.4992,
"eval_steps": 15,
"global_step": 78,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.02018229166666663,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3811.0,
"completions/mean_length": 628.982421875,
"completions/mean_terminated_length": 557.5687255859375,
"completions/min_length": 2.0,
"completions/min_terminated_length": 2.0,
"epoch": 0.0064,
"grad_norm": 0.003783364314585924,
"learning_rate": 3.125e-07,
"loss": 0.0013,
"num_tokens": 1493533.0,
"reward": 0.5249200463294983,
"reward_std": 0.5007209777832031,
"rewards/accuracy_reward": 0.2421875,
"rewards/brier_reward": 0.22494499385356903,
"rewards/confidence_one_or_zero": 0.484375,
"rewards/format_reward": 0.5826823115348816,
"rewards/mean_confidence_reward": 0.7791340947151184,
"step": 1
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.02278645833333337,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3898.0,
"completions/mean_length": 652.9889526367188,
"completions/mean_terminated_length": 572.70556640625,
"completions/min_length": 2.0,
"completions/min_terminated_length": 2.0,
"epoch": 0.0128,
"grad_norm": 0.003983162809163332,
"learning_rate": 6.25e-07,
"loss": 0.0049,
"num_tokens": 3025932.0,
"reward": 0.5511161088943481,
"reward_std": 0.5218957662582397,
"rewards/accuracy_reward": 0.26171875,
"rewards/brier_reward": 0.243483304977417,
"rewards/confidence_one_or_zero": 0.462890625,
"rewards/format_reward": 0.5970051884651184,
"rewards/mean_confidence_reward": 0.7861537337303162,
"step": 2
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01888020833333337,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3793.0,
"completions/mean_length": 645.0703125,
"completions/mean_terminated_length": 578.6622314453125,
"completions/min_length": 4.0,
"completions/min_terminated_length": 4.0,
"epoch": 0.0192,
"grad_norm": 0.003661321708932519,
"learning_rate": 9.375000000000001e-07,
"loss": -0.0062,
"num_tokens": 4550208.0,
"reward": 0.5277880430221558,
"reward_std": 0.5125378966331482,
"rewards/accuracy_reward": 0.2415364533662796,
"rewards/brier_reward": 0.22221779823303223,
"rewards/confidence_one_or_zero": 0.4557291567325592,
"rewards/format_reward": 0.591796875,
"rewards/mean_confidence_reward": 0.7892962098121643,
"step": 3
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.02278645833333337,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 4046.0,
"completions/mean_length": 584.3079833984375,
"completions/mean_terminated_length": 502.4230651855469,
"completions/min_length": 4.0,
"completions/min_terminated_length": 4.0,
"epoch": 0.0256,
"grad_norm": 0.002781560877338052,
"learning_rate": 1.25e-06,
"loss": 0.0091,
"num_tokens": 5963041.0,
"reward": 0.5828301906585693,
"reward_std": 0.5177066326141357,
"rewards/accuracy_reward": 0.267578125,
"rewards/brier_reward": 0.2450609803199768,
"rewards/confidence_one_or_zero": 0.484375,
"rewards/format_reward": 0.6529948115348816,
"rewards/mean_confidence_reward": 0.8394980430603027,
"step": 4
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.02408854166666663,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 4080.0,
"completions/mean_length": 625.9225463867188,
"completions/mean_terminated_length": 540.2702026367188,
"completions/min_length": 2.0,
"completions/min_terminated_length": 2.0,
"epoch": 0.032,
"grad_norm": 0.003664789954200387,
"learning_rate": 1.5625e-06,
"loss": -0.0097,
"num_tokens": 7451674.0,
"reward": 0.5913209915161133,
"reward_std": 0.5131308436393738,
"rewards/accuracy_reward": 0.2740885317325592,
"rewards/brier_reward": 0.25227776169776917,
"rewards/confidence_one_or_zero": 0.474609375,
"rewards/format_reward": 0.65625,
"rewards/mean_confidence_reward": 0.8091971278190613,
"step": 5
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.02994791666666663,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 4049.0,
"completions/mean_length": 633.5247802734375,
"completions/mean_terminated_length": 526.6295776367188,
"completions/min_length": 2.0,
"completions/min_terminated_length": 2.0,
"epoch": 0.0384,
"grad_norm": 0.010333490557968616,
"learning_rate": 1.8750000000000003e-06,
"loss": 0.0123,
"num_tokens": 8953816.0,
"reward": 0.6082988977432251,
"reward_std": 0.46747028827667236,
"rewards/accuracy_reward": 0.2630208432674408,
"rewards/brier_reward": 0.23415106534957886,
"rewards/confidence_one_or_zero": 0.4348958432674408,
"rewards/format_reward": 0.7194010615348816,
"rewards/mean_confidence_reward": 0.8058521747589111,
"step": 6
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.02083333333333337,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3932.0,
"completions/mean_length": 570.5657958984375,
"completions/mean_terminated_length": 495.5564880371094,
"completions/min_length": 12.0,
"completions/min_terminated_length": 12.0,
"epoch": 0.0448,
"grad_norm": 0.007485097274184227,
"learning_rate": 2.1875000000000002e-06,
"loss": 0.0131,
"num_tokens": 10361133.0,
"reward": 0.68055260181427,
"reward_std": 0.4591377377510071,
"rewards/accuracy_reward": 0.2903645932674408,
"rewards/brier_reward": 0.258865088224411,
"rewards/confidence_one_or_zero": 0.4733072817325592,
"rewards/format_reward": 0.8118489384651184,
"rewards/mean_confidence_reward": 0.8565878868103027,
"step": 7
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.02799479166666663,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 4053.0,
"completions/mean_length": 573.7142333984375,
"completions/mean_terminated_length": 472.2685852050781,
"completions/min_length": 61.0,
"completions/min_terminated_length": 61.0,
"epoch": 0.0512,
"grad_norm": 0.002246174495667219,
"learning_rate": 2.5e-06,
"loss": 0.0107,
"num_tokens": 11765862.0,
"reward": 0.70420902967453,
"reward_std": 0.4425145089626312,
"rewards/accuracy_reward": 0.287109375,
"rewards/brier_reward": 0.2586513161659241,
"rewards/confidence_one_or_zero": 0.4811197817325592,
"rewards/format_reward": 0.8626301884651184,
"rewards/mean_confidence_reward": 0.8782031536102295,
"step": 8
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.03645833333333337,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3941.0,
"completions/mean_length": 591.3802490234375,
"completions/mean_terminated_length": 458.7729797363281,
"completions/min_length": 71.0,
"completions/min_terminated_length": 71.0,
"epoch": 0.0576,
"grad_norm": 0.0037308428436517715,
"learning_rate": 2.8125e-06,
"loss": 0.0278,
"num_tokens": 13205902.0,
"reward": 0.7984961271286011,
"reward_std": 0.4640999734401703,
"rewards/accuracy_reward": 0.3626302182674408,
"rewards/brier_reward": 0.3365488052368164,
"rewards/confidence_one_or_zero": 0.4524739682674408,
"rewards/format_reward": 0.8977864384651184,
"rewards/mean_confidence_reward": 0.8799348473548889,
"step": 9
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.06315104166666663,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3962.0,
"completions/mean_length": 664.7389526367188,
"completions/mean_terminated_length": 433.44476318359375,
"completions/min_length": 40.0,
"completions/min_terminated_length": 40.0,
"epoch": 0.064,
"grad_norm": 0.016755374148488045,
"learning_rate": 3.125e-06,
"loss": 0.0434,
"num_tokens": 14762301.0,
"reward": 0.7937191724777222,
"reward_std": 0.42769724130630493,
"rewards/accuracy_reward": 0.3509114682674408,
"rewards/brier_reward": 0.33025145530700684,
"rewards/confidence_one_or_zero": 0.416015625,
"rewards/format_reward": 0.90625,
"rewards/mean_confidence_reward": 0.8513795733451843,
"step": 10
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.11588541666666663,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 4054.0,
"completions/mean_length": 879.6061401367188,
"completions/mean_terminated_length": 458.0169372558594,
"completions/min_length": 88.0,
"completions/min_terminated_length": 88.0,
"epoch": 0.0704,
"grad_norm": 0.0010431965347379446,
"learning_rate": 3.4375e-06,
"loss": 0.0802,
"num_tokens": 16640792.0,
"reward": 0.782174825668335,
"reward_std": 0.4354153573513031,
"rewards/accuracy_reward": 0.3541666567325592,
"rewards/brier_reward": 0.35273900628089905,
"rewards/confidence_one_or_zero": 0.322265625,
"rewards/format_reward": 0.857421875,
"rewards/mean_confidence_reward": 0.7872786521911621,
"step": 11
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.07552083333333337,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3912.0,
"completions/mean_length": 722.7220458984375,
"completions/mean_terminated_length": 447.158447265625,
"completions/min_length": 95.0,
"completions/min_terminated_length": 95.0,
"epoch": 0.0768,
"grad_norm": 0.000985628110356629,
"learning_rate": 3.7500000000000005e-06,
"loss": 0.0533,
"num_tokens": 18272773.0,
"reward": 0.8280217051506042,
"reward_std": 0.4171297252178192,
"rewards/accuracy_reward": 0.369140625,
"rewards/brier_reward": 0.37216663360595703,
"rewards/confidence_one_or_zero": 0.2942708432674408,
"rewards/format_reward": 0.9147135615348816,
"rewards/mean_confidence_reward": 0.8345110416412354,
"step": 12
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01171875,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 4092.0,
"completions/mean_length": 461.41082763671875,
"completions/mean_terminated_length": 418.31292724609375,
"completions/min_length": 89.0,
"completions/min_terminated_length": 89.0,
"epoch": 0.0832,
"grad_norm": 0.0010528744896873832,
"learning_rate": 4.0625000000000005e-06,
"loss": 0.0026,
"num_tokens": 19505436.0,
"reward": 0.9720399379730225,
"reward_std": 0.365999311208725,
"rewards/accuracy_reward": 0.4674479067325592,
"rewards/brier_reward": 0.4902818202972412,
"rewards/confidence_one_or_zero": 0.2278645783662796,
"rewards/format_reward": 0.986328125,
"rewards/mean_confidence_reward": 0.8771093487739563,
"step": 13
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.009765625,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3807.0,
"completions/mean_length": 485.35418701171875,
"completions/mean_terminated_length": 449.7462463378906,
"completions/min_length": 59.0,
"completions/min_terminated_length": 59.0,
"epoch": 0.0896,
"grad_norm": 0.0009289804729633033,
"learning_rate": 4.3750000000000005e-06,
"loss": 0.0064,
"num_tokens": 20776940.0,
"reward": 1.0008982419967651,
"reward_std": 0.3568176031112671,
"rewards/accuracy_reward": 0.4915364682674408,
"rewards/brier_reward": 0.5245621800422668,
"rewards/confidence_one_or_zero": 0.1627604216337204,
"rewards/format_reward": 0.9856770634651184,
"rewards/mean_confidence_reward": 0.8677083849906921,
"step": 14
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01041666666666663,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 4080.0,
"completions/mean_length": 513.53125,
"completions/mean_terminated_length": 475.8210754394531,
"completions/min_length": 108.0,
"completions/min_terminated_length": 108.0,
"epoch": 0.096,
"grad_norm": 0.0008963477448560297,
"learning_rate": 4.6875000000000004e-06,
"loss": 0.0092,
"num_tokens": 22099092.0,
"reward": 1.0160329341888428,
"reward_std": 0.34443187713623047,
"rewards/accuracy_reward": 0.5032551884651184,
"rewards/brier_reward": 0.5424637198448181,
"rewards/confidence_one_or_zero": 0.0794270858168602,
"rewards/format_reward": 0.986328125,
"rewards/mean_confidence_reward": 0.8531444668769836,
"step": 15
},
{
"epoch": 0.096,
"eval_completions/clipped_ratio": 0.0068359375,
"eval_completions/max_length": 3274.125,
"eval_completions/max_terminated_length": 1965.375,
"eval_completions/mean_length": 504.253231048584,
"eval_completions/mean_terminated_length": 479.5936050415039,
"eval_completions/min_length": 142.625,
"eval_completions/min_terminated_length": 142.625,
"eval_loss": 0.0,
"eval_num_tokens": 22099092.0,
"eval_reward": 1.0268284529447556,
"eval_reward_std": 0.47461608797311783,
"eval_rewards/accuracy_reward": 0.5078125,
"eval_rewards/brier_reward": 0.5585219040513039,
"eval_rewards/confidence_one_or_zero": 0.0390625,
"eval_rewards/format_reward": 0.9873046875,
"eval_rewards/mean_confidence_reward": 0.8512206822633743,
"eval_runtime": 212.2086,
"eval_samples_per_second": 4.712,
"eval_steps_per_second": 0.038,
"step": 15
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3472.0,
"completions/mean_length": 484.94207763671875,
"completions/mean_terminated_length": 470.78106689453125,
"completions/min_length": 107.0,
"completions/min_terminated_length": 107.0,
"epoch": 0.1024,
"grad_norm": 0.020831571891903877,
"learning_rate": 5e-06,
"loss": 0.0049,
"num_tokens": 23377275.0,
"reward": 1.0567774772644043,
"reward_std": 0.3312305808067322,
"rewards/accuracy_reward": 0.53515625,
"rewards/brier_reward": 0.5855425000190735,
"rewards/confidence_one_or_zero": 0.0325520820915699,
"rewards/format_reward": 0.9928385615348816,
"rewards/mean_confidence_reward": 0.8496484756469727,
"step": 16
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00651041666666663,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3704.0,
"completions/mean_length": 540.3619995117188,
"completions/mean_terminated_length": 517.0616455078125,
"completions/min_length": 101.0,
"completions/min_terminated_length": 101.0,
"epoch": 0.1088,
"grad_norm": 0.0006857101107016206,
"learning_rate": 4.919354838709678e-06,
"loss": 0.0044,
"num_tokens": 24737903.0,
"reward": 1.0274884700775146,
"reward_std": 0.30353817343711853,
"rewards/accuracy_reward": 0.4973958432674408,
"rewards/brier_reward": 0.5673298239707947,
"rewards/confidence_one_or_zero": 0.010416666977107525,
"rewards/format_reward": 0.990234375,
"rewards/mean_confidence_reward": 0.8231706023216248,
"step": 17
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005859375,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 4006.0,
"completions/mean_length": 572.384765625,
"completions/mean_terminated_length": 551.6168823242188,
"completions/min_length": 141.0,
"completions/min_terminated_length": 141.0,
"epoch": 0.1152,
"grad_norm": 0.0006863800226710737,
"learning_rate": 4.838709677419355e-06,
"loss": 0.0081,
"num_tokens": 26138990.0,
"reward": 1.0704162120819092,
"reward_std": 0.3025241196155548,
"rewards/accuracy_reward": 0.5436198115348816,
"rewards/brier_reward": 0.6050085425376892,
"rewards/confidence_one_or_zero": 0.009114583022892475,
"rewards/format_reward": 0.9921875,
"rewards/mean_confidence_reward": 0.8188378810882568,
"step": 18
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00911458333333337,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3942.0,
"completions/mean_length": 584.9290771484375,
"completions/mean_terminated_length": 552.6326904296875,
"completions/min_length": 134.0,
"completions/min_terminated_length": 134.0,
"epoch": 0.1216,
"grad_norm": 0.0005891257897019386,
"learning_rate": 4.758064516129033e-06,
"loss": 0.012,
"num_tokens": 27564993.0,
"reward": 1.0699093341827393,
"reward_std": 0.2565997242927551,
"rewards/accuracy_reward": 0.537109375,
"rewards/brier_reward": 0.6163650751113892,
"rewards/confidence_one_or_zero": 0.001953125,
"rewards/format_reward": 0.986328125,
"rewards/mean_confidence_reward": 0.7921354174613953,
"step": 19
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.009765625,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3975.0,
"completions/mean_length": 598.4486083984375,
"completions/mean_terminated_length": 563.9559936523438,
"completions/min_length": 158.0,
"completions/min_terminated_length": 158.0,
"epoch": 0.128,
"grad_norm": 0.0007340199663303792,
"learning_rate": 4.67741935483871e-06,
"loss": 0.0099,
"num_tokens": 29008834.0,
"reward": 1.106736183166504,
"reward_std": 0.2745085656642914,
"rewards/accuracy_reward": 0.5729166865348816,
"rewards/brier_reward": 0.6529099941253662,
"rewards/confidence_one_or_zero": 0.0006510416860692203,
"rewards/format_reward": 0.9876301884651184,
"rewards/mean_confidence_reward": 0.7702994346618652,
"step": 20
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01041666666666663,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 4006.0,
"completions/mean_length": 649.8717651367188,
"completions/mean_terminated_length": 613.5967407226562,
"completions/min_length": 164.0,
"completions/min_terminated_length": 164.0,
"epoch": 0.1344,
"grad_norm": 0.000504179741255939,
"learning_rate": 4.596774193548387e-06,
"loss": 0.0119,
"num_tokens": 30534293.0,
"reward": 1.1364049911499023,
"reward_std": 0.25532644987106323,
"rewards/accuracy_reward": 0.603515625,
"rewards/brier_reward": 0.6816490292549133,
"rewards/confidence_one_or_zero": 0.0006510416860692203,
"rewards/format_reward": 0.9876301884651184,
"rewards/mean_confidence_reward": 0.7451822757720947,
"step": 21
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00846354166666663,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 4091.0,
"completions/mean_length": 609.1048583984375,
"completions/mean_terminated_length": 579.3414306640625,
"completions/min_length": 157.0,
"completions/min_terminated_length": 157.0,
"epoch": 0.1408,
"grad_norm": 0.000508100027218461,
"learning_rate": 4.516129032258065e-06,
"loss": 0.0099,
"num_tokens": 31992166.0,
"reward": 1.1315546035766602,
"reward_std": 0.21986931562423706,
"rewards/accuracy_reward": 0.5833333134651184,
"rewards/brier_reward": 0.6895273327827454,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.990234375,
"rewards/mean_confidence_reward": 0.704296886920929,
"step": 22
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01171875,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3986.0,
"completions/mean_length": 680.365234375,
"completions/mean_terminated_length": 639.8636474609375,
"completions/min_length": 173.0,
"completions/min_terminated_length": 173.0,
"epoch": 0.1472,
"grad_norm": 0.00047725101467221975,
"learning_rate": 4.435483870967742e-06,
"loss": 0.0172,
"num_tokens": 33570671.0,
"reward": 1.1263470649719238,
"reward_std": 0.22403830289840698,
"rewards/accuracy_reward": 0.576171875,
"rewards/brier_reward": 0.6921337246894836,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.984375,
"rewards/mean_confidence_reward": 0.662109375,
"step": 23
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00455729166666663,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3908.0,
"completions/mean_length": 631.7643432617188,
"completions/mean_terminated_length": 615.9044799804688,
"completions/min_length": 162.0,
"completions/min_terminated_length": 162.0,
"epoch": 0.1536,
"grad_norm": 0.0004088205751031637,
"learning_rate": 4.35483870967742e-06,
"loss": 0.0074,
"num_tokens": 35065373.0,
"reward": 1.1861932277679443,
"reward_std": 0.19178341329097748,
"rewards/accuracy_reward": 0.6432291865348816,
"rewards/brier_reward": 0.7343525886535645,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9947916865348816,
"rewards/mean_confidence_reward": 0.646484375,
"step": 24
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.013671875,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 4093.0,
"completions/mean_length": 656.4909057617188,
"completions/mean_terminated_length": 608.8145141601562,
"completions/min_length": 142.0,
"completions/min_terminated_length": 142.0,
"epoch": 0.16,
"grad_norm": 0.0004432302084751427,
"learning_rate": 4.274193548387097e-06,
"loss": 0.0131,
"num_tokens": 36594351.0,
"reward": 1.1493972539901733,
"reward_std": 0.19187478721141815,
"rewards/accuracy_reward": 0.59765625,
"rewards/brier_reward": 0.7167506217956543,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.984375,
"rewards/mean_confidence_reward": 0.6246419548988342,
"step": 25
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00911458333333337,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3799.0,
"completions/mean_length": 640.9525146484375,
"completions/mean_terminated_length": 609.1714477539062,
"completions/min_length": 212.0,
"completions/min_terminated_length": 212.0,
"epoch": 0.1664,
"grad_norm": 0.0004940686631016433,
"learning_rate": 4.193548387096774e-06,
"loss": 0.0124,
"num_tokens": 38107486.0,
"reward": 1.1369479894638062,
"reward_std": 0.18988990783691406,
"rewards/accuracy_reward": 0.576171875,
"rewards/brier_reward": 0.7094306945800781,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.98828125,
"rewards/mean_confidence_reward": 0.6073241829872131,
"step": 26
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00846354166666663,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 4041.0,
"completions/mean_length": 615.7877807617188,
"completions/mean_terminated_length": 586.0814208984375,
"completions/min_length": 188.0,
"completions/min_terminated_length": 188.0,
"epoch": 0.1728,
"grad_norm": 0.00038638385012745857,
"learning_rate": 4.112903225806452e-06,
"loss": 0.0139,
"num_tokens": 39572472.0,
"reward": 1.2076165676116943,
"reward_std": 0.18824410438537598,
"rewards/accuracy_reward": 0.6809895634651184,
"rewards/brier_reward": 0.7466012835502625,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9876301884651184,
"rewards/mean_confidence_reward": 0.5919271111488342,
"step": 27
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00716145833333337,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3511.0,
"completions/mean_length": 662.2565307617188,
"completions/mean_terminated_length": 637.488525390625,
"completions/min_length": 221.0,
"completions/min_terminated_length": 221.0,
"epoch": 0.1792,
"grad_norm": 0.00037064749631099403,
"learning_rate": 4.032258064516129e-06,
"loss": 0.0122,
"num_tokens": 41115186.0,
"reward": 1.1956737041473389,
"reward_std": 0.16790974140167236,
"rewards/accuracy_reward": 0.66015625,
"rewards/brier_reward": 0.7396429181098938,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9915364384651184,
"rewards/mean_confidence_reward": 0.5894531607627869,
"step": 28
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 4092.0,
"completions/mean_length": 660.4296875,
"completions/mean_terminated_length": 633.3779296875,
"completions/min_length": 173.0,
"completions/min_terminated_length": 173.0,
"epoch": 0.1856,
"grad_norm": 0.0003664132673293352,
"learning_rate": 3.951612903225807e-06,
"loss": 0.0107,
"num_tokens": 42648062.0,
"reward": 1.179136872291565,
"reward_std": 0.1672275960445404,
"rewards/accuracy_reward": 0.63671875,
"rewards/brier_reward": 0.7326110005378723,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9889323115348816,
"rewards/mean_confidence_reward": 0.5756185054779053,
"step": 29
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.009765625,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 4067.0,
"completions/mean_length": 679.2083740234375,
"completions/mean_terminated_length": 645.51220703125,
"completions/min_length": 152.0,
"completions/min_terminated_length": 152.0,
"epoch": 0.192,
"grad_norm": 0.00031230493914335966,
"learning_rate": 3.870967741935484e-06,
"loss": 0.0118,
"num_tokens": 44213718.0,
"reward": 1.1655101776123047,
"reward_std": 0.16719786822795868,
"rewards/accuracy_reward": 0.61328125,
"rewards/brier_reward": 0.7287955284118652,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9889323115348816,
"rewards/mean_confidence_reward": 0.5680338740348816,
"step": 30
},
{
"epoch": 0.192,
"eval_completions/clipped_ratio": 0.0078125,
"eval_completions/max_length": 2955.75,
"eval_completions/max_terminated_length": 2243.25,
"eval_completions/mean_length": 651.0071411132812,
"eval_completions/mean_terminated_length": 623.9535980224609,
"eval_completions/min_length": 251.375,
"eval_completions/min_terminated_length": 251.375,
"eval_loss": 0.0,
"eval_num_tokens": 44213718.0,
"eval_reward": 1.1754617244005203,
"eval_reward_std": 0.30160870030522346,
"eval_rewards/accuracy_reward": 0.6259765625,
"eval_rewards/brier_reward": 0.7337246015667915,
"eval_rewards/confidence_one_or_zero": 0.0,
"eval_rewards/format_reward": 0.9912109375,
"eval_rewards/mean_confidence_reward": 0.5698242411017418,
"eval_runtime": 195.9078,
"eval_samples_per_second": 5.104,
"eval_steps_per_second": 0.041,
"step": 30
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005859375,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3856.0,
"completions/mean_length": 640.2109375,
"completions/mean_terminated_length": 619.8428344726562,
"completions/min_length": 209.0,
"completions/min_terminated_length": 209.0,
"epoch": 0.1984,
"grad_norm": 0.0004228002217132598,
"learning_rate": 3.7903225806451614e-06,
"loss": 0.0082,
"num_tokens": 45725906.0,
"reward": 1.197919249534607,
"reward_std": 0.1658228039741516,
"rewards/accuracy_reward": 0.66015625,
"rewards/brier_reward": 0.7421810030937195,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9934895634651184,
"rewards/mean_confidence_reward": 0.5704427361488342,
"step": 31
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3999.0,
"completions/mean_length": 690.330078125,
"completions/mean_terminated_length": 663.5137939453125,
"completions/min_length": 202.0,
"completions/min_terminated_length": 202.0,
"epoch": 0.2048,
"grad_norm": 0.0003048316575586796,
"learning_rate": 3.7096774193548392e-06,
"loss": 0.0073,
"num_tokens": 47306869.0,
"reward": 1.1933344602584839,
"reward_std": 0.16178151965141296,
"rewards/accuracy_reward": 0.65625,
"rewards/brier_reward": 0.7395221590995789,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9908854365348816,
"rewards/mean_confidence_reward": 0.5611328482627869,
"step": 32
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3514.0,
"completions/mean_length": 638.478515625,
"completions/mean_terminated_length": 611.25390625,
"completions/min_length": 190.0,
"completions/min_terminated_length": 190.0,
"epoch": 0.2112,
"grad_norm": 0.00036333707976154983,
"learning_rate": 3.6290322580645166e-06,
"loss": 0.01,
"num_tokens": 48810676.0,
"reward": 1.1860263347625732,
"reward_std": 0.16334088146686554,
"rewards/accuracy_reward": 0.6432291865348816,
"rewards/brier_reward": 0.7379267811775208,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9908854365348816,
"rewards/mean_confidence_reward": 0.5622721314430237,
"step": 33
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00716145833333337,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3967.0,
"completions/mean_length": 668.5677490234375,
"completions/mean_terminated_length": 643.8452758789062,
"completions/min_length": 181.0,
"completions/min_terminated_length": 181.0,
"epoch": 0.2176,
"grad_norm": 0.00028770716744475067,
"learning_rate": 3.548387096774194e-06,
"loss": 0.0078,
"num_tokens": 50361020.0,
"reward": 1.1859478950500488,
"reward_std": 0.14475996792316437,
"rewards/accuracy_reward": 0.6451823115348816,
"rewards/brier_reward": 0.7351656556129456,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9915364384651184,
"rewards/mean_confidence_reward": 0.5598958134651184,
"step": 34
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00520833333333337,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3349.0,
"completions/mean_length": 648.2298583984375,
"completions/mean_terminated_length": 630.1786499023438,
"completions/min_length": 170.0,
"completions/min_terminated_length": 170.0,
"epoch": 0.224,
"grad_norm": 0.00032582733547315,
"learning_rate": 3.4677419354838714e-06,
"loss": 0.0093,
"num_tokens": 51882877.0,
"reward": 1.1905927658081055,
"reward_std": 0.15323978662490845,
"rewards/accuracy_reward": 0.6471354365348816,
"rewards/brier_reward": 0.7398984432220459,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.994140625,
"rewards/mean_confidence_reward": 0.5593099594116211,
"step": 35
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00520833333333337,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3963.0,
"completions/mean_length": 665.482421875,
"completions/mean_terminated_length": 647.5216064453125,
"completions/min_length": 186.0,
"completions/min_terminated_length": 186.0,
"epoch": 0.2304,
"grad_norm": 0.0003053806722164154,
"learning_rate": 3.3870967741935484e-06,
"loss": 0.0041,
"num_tokens": 53433066.0,
"reward": 1.2014939785003662,
"reward_std": 0.13854166865348816,
"rewards/accuracy_reward": 0.666015625,
"rewards/brier_reward": 0.7428202629089355,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.994140625,
"rewards/mean_confidence_reward": 0.5591146349906921,
"step": 36
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01106770833333337,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3605.0,
"completions/mean_length": 698.8529052734375,
"completions/mean_terminated_length": 660.8334350585938,
"completions/min_length": 206.0,
"completions/min_terminated_length": 206.0,
"epoch": 0.2368,
"grad_norm": 0.00029780014301650226,
"learning_rate": 3.306451612903226e-06,
"loss": 0.0082,
"num_tokens": 55030752.0,
"reward": 1.1871861219406128,
"reward_std": 0.15389445424079895,
"rewards/accuracy_reward": 0.6510416865348816,
"rewards/brier_reward": 0.7350380420684814,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.98828125,
"rewards/mean_confidence_reward": 0.555859386920929,
"step": 37
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00651041666666663,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 4090.0,
"completions/mean_length": 676.228515625,
"completions/mean_terminated_length": 653.8184814453125,
"completions/min_length": 224.0,
"completions/min_terminated_length": 224.0,
"epoch": 0.2432,
"grad_norm": 0.00036757506313733757,
"learning_rate": 3.225806451612903e-06,
"loss": 0.0101,
"num_tokens": 56595671.0,
"reward": 1.2020938396453857,
"reward_std": 0.1413881927728653,
"rewards/accuracy_reward": 0.6692708134651184,
"rewards/brier_reward": 0.7466244101524353,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.98828125,
"rewards/mean_confidence_reward": 0.5543294548988342,
"step": 38
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00846354166666663,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3921.0,
"completions/mean_length": 707.0534057617188,
"completions/mean_terminated_length": 678.1260986328125,
"completions/min_length": 199.0,
"completions/min_terminated_length": 199.0,
"epoch": 0.2496,
"grad_norm": 0.0003286061983089894,
"learning_rate": 3.145161290322581e-06,
"loss": 0.0077,
"num_tokens": 58204649.0,
"reward": 1.1853474378585815,
"reward_std": 0.1483502984046936,
"rewards/accuracy_reward": 0.6380208134651184,
"rewards/brier_reward": 0.741777241230011,
"rewards/confidence_one_or_zero": 0.0006510416860692203,
"rewards/format_reward": 0.9908854365348816,
"rewards/mean_confidence_reward": 0.558789074420929,
"step": 39
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0032552083333333703,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 4091.0,
"completions/mean_length": 698.166015625,
"completions/mean_terminated_length": 687.0692138671875,
"completions/min_length": 198.0,
"completions/min_terminated_length": 198.0,
"epoch": 0.256,
"grad_norm": 0.000307776645058766,
"learning_rate": 3.0645161290322584e-06,
"loss": 0.0053,
"num_tokens": 59804984.0,
"reward": 1.1797587871551514,
"reward_std": 0.14499151706695557,
"rewards/accuracy_reward": 0.6302083134651184,
"rewards/brier_reward": 0.7358081936836243,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9934895634651184,
"rewards/mean_confidence_reward": 0.562207043170929,
"step": 40
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00846354166666663,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 2705.0,
"completions/mean_length": 697.6452026367188,
"completions/mean_terminated_length": 668.6375732421875,
"completions/min_length": 236.0,
"completions/min_terminated_length": 236.0,
"epoch": 0.2624,
"grad_norm": 0.0002886159345507622,
"learning_rate": 2.983870967741936e-06,
"loss": 0.009,
"num_tokens": 61401759.0,
"reward": 1.212717890739441,
"reward_std": 0.14435109496116638,
"rewards/accuracy_reward": 0.6829426884651184,
"rewards/brier_reward": 0.7509452700614929,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9915364384651184,
"rewards/mean_confidence_reward": 0.5624349117279053,
"step": 41
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01106770833333337,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3976.0,
"completions/mean_length": 690.05078125,
"completions/mean_terminated_length": 651.932861328125,
"completions/min_length": 200.0,
"completions/min_terminated_length": 200.0,
"epoch": 0.2688,
"grad_norm": 0.00031737395329400897,
"learning_rate": 2.903225806451613e-06,
"loss": 0.0093,
"num_tokens": 62986533.0,
"reward": 1.1887677907943726,
"reward_std": 0.14489293098449707,
"rewards/accuracy_reward": 0.6529948115348816,
"rewards/brier_reward": 0.7375500798225403,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9869791865348816,
"rewards/mean_confidence_reward": 0.5674805045127869,
"step": 42
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00716145833333337,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3648.0,
"completions/mean_length": 714.978515625,
"completions/mean_terminated_length": 690.5908203125,
"completions/min_length": 242.0,
"completions/min_terminated_length": 242.0,
"epoch": 0.2752,
"grad_norm": 0.0003274915798101574,
"learning_rate": 2.822580645161291e-06,
"loss": 0.0056,
"num_tokens": 64611508.0,
"reward": 1.1908820867538452,
"reward_std": 0.15602055191993713,
"rewards/accuracy_reward": 0.646484375,
"rewards/brier_reward": 0.7430807948112488,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9921875,
"rewards/mean_confidence_reward": 0.5716796517372131,
"step": 43
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00455729166666663,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3378.0,
"completions/mean_length": 668.1412963867188,
"completions/mean_terminated_length": 652.447998046875,
"completions/min_length": 205.0,
"completions/min_terminated_length": 205.0,
"epoch": 0.2816,
"grad_norm": 0.00034042284823954105,
"learning_rate": 2.7419354838709676e-06,
"loss": 0.0043,
"num_tokens": 66163893.0,
"reward": 1.2087671756744385,
"reward_std": 0.15592199563980103,
"rewards/accuracy_reward": 0.6751301884651184,
"rewards/brier_reward": 0.7489029765129089,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9934895634651184,
"rewards/mean_confidence_reward": 0.5762044787406921,
"step": 44
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 4066.0,
"completions/mean_length": 702.845703125,
"completions/mean_terminated_length": 689.5392456054688,
"completions/min_length": 282.0,
"completions/min_terminated_length": 282.0,
"epoch": 0.288,
"grad_norm": 0.0002904966240748763,
"learning_rate": 2.6612903225806454e-06,
"loss": 0.0076,
"num_tokens": 67767208.0,
"reward": 1.1831653118133545,
"reward_std": 0.135649636387825,
"rewards/accuracy_reward": 0.6315104365348816,
"rewards/brier_reward": 0.7432721257209778,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9915364384651184,
"rewards/mean_confidence_reward": 0.5733073353767395,
"step": 45
},
{
"epoch": 0.288,
"eval_completions/clipped_ratio": 0.006084735576923073,
"eval_completions/max_length": 3151.125,
"eval_completions/max_terminated_length": 1663.875,
"eval_completions/mean_length": 685.4481735229492,
"eval_completions/mean_terminated_length": 664.5987167358398,
"eval_completions/min_length": 277.0,
"eval_completions/min_terminated_length": 277.0,
"eval_loss": 0.0,
"eval_num_tokens": 67767208.0,
"eval_reward": 1.1941805630922318,
"eval_reward_std": 0.3026689551770687,
"eval_rewards/accuracy_reward": 0.6494140625,
"eval_rewards/brier_reward": 0.7447949051856995,
"eval_rewards/confidence_one_or_zero": 0.0,
"eval_rewards/format_reward": 0.994140625,
"eval_rewards/mean_confidence_reward": 0.5772461071610451,
"eval_runtime": 206.3461,
"eval_samples_per_second": 4.846,
"eval_steps_per_second": 0.039,
"step": 45
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00455729166666663,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 4076.0,
"completions/mean_length": 662.3568115234375,
"completions/mean_terminated_length": 646.636962890625,
"completions/min_length": 212.0,
"completions/min_terminated_length": 212.0,
"epoch": 0.2944,
"grad_norm": 0.00032452234881930053,
"learning_rate": 2.580645161290323e-06,
"loss": 0.0078,
"num_tokens": 69315700.0,
"reward": 1.1911271810531616,
"reward_std": 0.1421237289905548,
"rewards/accuracy_reward": 0.646484375,
"rewards/brier_reward": 0.7416178584098816,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.994140625,
"rewards/mean_confidence_reward": 0.58154296875,
"step": 46
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.009765625,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3704.0,
"completions/mean_length": 722.6530151367188,
"completions/mean_terminated_length": 689.3853149414062,
"completions/min_length": 265.0,
"completions/min_terminated_length": 265.0,
"epoch": 0.3008,
"grad_norm": 0.0003498312726151198,
"learning_rate": 2.5e-06,
"loss": 0.0063,
"num_tokens": 70953055.0,
"reward": 1.1994168758392334,
"reward_std": 0.1521904170513153,
"rewards/accuracy_reward": 0.6640625,
"rewards/brier_reward": 0.7458271384239197,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9889323115348816,
"rewards/mean_confidence_reward": 0.5755208134651184,
"step": 47
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00520833333333337,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3991.0,
"completions/mean_length": 731.9296875,
"completions/mean_terminated_length": 714.3167724609375,
"completions/min_length": 209.0,
"completions/min_terminated_length": 209.0,
"epoch": 0.3072,
"grad_norm": 0.0003517513978295028,
"learning_rate": 2.4193548387096776e-06,
"loss": 0.0075,
"num_tokens": 72609827.0,
"reward": 1.179626703262329,
"reward_std": 0.17823223769664764,
"rewards/accuracy_reward": 0.6295573115348816,
"rewards/brier_reward": 0.7381477355957031,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9915364384651184,
"rewards/mean_confidence_reward": 0.58251953125,
"step": 48
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0013020833333333703,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3982.0,
"completions/mean_length": 671.9798583984375,
"completions/mean_terminated_length": 667.515625,
"completions/min_length": 222.0,
"completions/min_terminated_length": 222.0,
"epoch": 0.3136,
"grad_norm": 0.00028376278351061046,
"learning_rate": 2.338709677419355e-06,
"loss": 0.0015,
"num_tokens": 74171436.0,
"reward": 1.207430362701416,
"reward_std": 0.13102313876152039,
"rewards/accuracy_reward": 0.6673176884651184,
"rewards/brier_reward": 0.7501354217529297,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9973958134651184,
"rewards/mean_confidence_reward": 0.5880208611488342,
"step": 49
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3469.0,
"completions/mean_length": 672.4915771484375,
"completions/mean_terminated_length": 659.0660400390625,
"completions/min_length": 227.0,
"completions/min_terminated_length": 227.0,
"epoch": 0.32,
"grad_norm": 0.00033841372351162136,
"learning_rate": 2.2580645161290324e-06,
"loss": 0.0059,
"num_tokens": 75729159.0,
"reward": 1.2066926956176758,
"reward_std": 0.13676881790161133,
"rewards/accuracy_reward": 0.6673176884651184,
"rewards/brier_reward": 0.7506132125854492,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9954426884651184,
"rewards/mean_confidence_reward": 0.586132824420929,
"step": 50
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0032552083333333703,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3465.0,
"completions/mean_length": 668.6673583984375,
"completions/mean_terminated_length": 657.4741821289062,
"completions/min_length": 226.0,
"completions/min_terminated_length": 226.0,
"epoch": 0.3264,
"grad_norm": 0.0003204546810593456,
"learning_rate": 2.17741935483871e-06,
"loss": 0.0045,
"num_tokens": 77279088.0,
"reward": 1.194650411605835,
"reward_std": 0.14517521858215332,
"rewards/accuracy_reward": 0.6471354365348816,
"rewards/brier_reward": 0.7454085350036621,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9967448115348816,
"rewards/mean_confidence_reward": 0.5876953601837158,
"step": 51
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005859375,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 4063.0,
"completions/mean_length": 662.62109375,
"completions/mean_terminated_length": 642.3850708007812,
"completions/min_length": 233.0,
"completions/min_terminated_length": 233.0,
"epoch": 0.3328,
"grad_norm": 0.0003081200993619859,
"learning_rate": 2.096774193548387e-06,
"loss": 0.0062,
"num_tokens": 78826938.0,
"reward": 1.1930209398269653,
"reward_std": 0.12649165093898773,
"rewards/accuracy_reward": 0.650390625,
"rewards/brier_reward": 0.7421497702598572,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9934895634651184,
"rewards/mean_confidence_reward": 0.5915364623069763,
"step": 52
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0032552083333333703,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 2943.0,
"completions/mean_length": 682.712890625,
"completions/mean_terminated_length": 671.5656127929688,
"completions/min_length": 239.0,
"completions/min_terminated_length": 239.0,
"epoch": 0.3392,
"grad_norm": 0.0003420892171561718,
"learning_rate": 2.0161290322580646e-06,
"loss": 0.0049,
"num_tokens": 80397729.0,
"reward": 1.2036316394805908,
"reward_std": 0.13504670560359955,
"rewards/accuracy_reward": 0.6627604365348816,
"rewards/brier_reward": 0.7477460503578186,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9967448115348816,
"rewards/mean_confidence_reward": 0.5904297232627869,
"step": 53
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3952.0,
"completions/mean_length": 678.2526245117188,
"completions/mean_terminated_length": 664.8496704101562,
"completions/min_length": 228.0,
"completions/min_terminated_length": 228.0,
"epoch": 0.3456,
"grad_norm": 0.000295772566460073,
"learning_rate": 1.935483870967742e-06,
"loss": 0.0055,
"num_tokens": 81963925.0,
"reward": 1.2102819681167603,
"reward_std": 0.12340329587459564,
"rewards/accuracy_reward": 0.6744791865348816,
"rewards/brier_reward": 0.751281201839447,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9947916865348816,
"rewards/mean_confidence_reward": 0.5891276001930237,
"step": 54
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0032552083333333703,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3310.0,
"completions/mean_length": 693.1536865234375,
"completions/mean_terminated_length": 682.0404663085938,
"completions/min_length": 214.0,
"completions/min_terminated_length": 214.0,
"epoch": 0.352,
"grad_norm": 0.00035071276943199337,
"learning_rate": 1.8548387096774196e-06,
"loss": 0.0042,
"num_tokens": 83556465.0,
"reward": 1.2013576030731201,
"reward_std": 0.11804833263158798,
"rewards/accuracy_reward": 0.658203125,
"rewards/brier_reward": 0.7484062314033508,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.99609375,
"rewards/mean_confidence_reward": 0.5944010615348816,
"step": 55
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0026041666666666297,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3637.0,
"completions/mean_length": 731.8359375,
"completions/mean_terminated_length": 723.05224609375,
"completions/min_length": 242.0,
"completions/min_terminated_length": 242.0,
"epoch": 0.3584,
"grad_norm": 0.0003235254262108356,
"learning_rate": 1.774193548387097e-06,
"loss": 0.0041,
"num_tokens": 85208813.0,
"reward": 1.216925024986267,
"reward_std": 0.14454582333564758,
"rewards/accuracy_reward": 0.6822916865348816,
"rewards/brier_reward": 0.7554528117179871,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.99609375,
"rewards/mean_confidence_reward": 0.5896158814430237,
"step": 56
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 2212.0,
"completions/mean_length": 663.8737182617188,
"completions/mean_terminated_length": 650.4144287109375,
"completions/min_length": 210.0,
"completions/min_terminated_length": 210.0,
"epoch": 0.3648,
"grad_norm": 0.00034046408836729825,
"learning_rate": 1.6935483870967742e-06,
"loss": 0.0063,
"num_tokens": 86754851.0,
"reward": 1.2455027103424072,
"reward_std": 0.14017263054847717,
"rewards/accuracy_reward": 0.7291666865348816,
"rewards/brier_reward": 0.7657330632209778,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.99609375,
"rewards/mean_confidence_reward": 0.5921224355697632,
"step": 57
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0032552083333333703,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 2393.0,
"completions/mean_length": 698.7897338867188,
"completions/mean_terminated_length": 687.6949462890625,
"completions/min_length": 270.0,
"completions/min_terminated_length": 270.0,
"epoch": 0.3712,
"grad_norm": 0.00033182092010974884,
"learning_rate": 1.6129032258064516e-06,
"loss": 0.0048,
"num_tokens": 88357480.0,
"reward": 1.2445855140686035,
"reward_std": 0.13970522582530975,
"rewards/accuracy_reward": 0.7265625,
"rewards/brier_reward": 0.7658515572547913,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9967448115348816,
"rewards/mean_confidence_reward": 0.5940755009651184,
"step": 58
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0026041666666666297,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3767.0,
"completions/mean_length": 684.9967651367188,
"completions/mean_terminated_length": 676.0907592773438,
"completions/min_length": 226.0,
"completions/min_terminated_length": 226.0,
"epoch": 0.3776,
"grad_norm": 0.0003278127405792475,
"learning_rate": 1.5322580645161292e-06,
"loss": 0.0045,
"num_tokens": 89933691.0,
"reward": 1.2042417526245117,
"reward_std": 0.12414063513278961,
"rewards/accuracy_reward": 0.6647135615348816,
"rewards/brier_reward": 0.7476640343666077,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.99609375,
"rewards/mean_confidence_reward": 0.5949869751930237,
"step": 59
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3523.0,
"completions/mean_length": 691.3046875,
"completions/mean_terminated_length": 677.9529418945312,
"completions/min_length": 251.0,
"completions/min_terminated_length": 251.0,
"epoch": 0.384,
"grad_norm": 0.0003617078182287514,
"learning_rate": 1.4516129032258066e-06,
"loss": 0.0072,
"num_tokens": 91522447.0,
"reward": 1.19664466381073,
"reward_std": 0.13888517022132874,
"rewards/accuracy_reward": 0.650390625,
"rewards/brier_reward": 0.7474439740180969,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9954426884651184,
"rewards/mean_confidence_reward": 0.5925130248069763,
"step": 60
},
{
"epoch": 0.384,
"eval_completions/clipped_ratio": 0.00390625,
"eval_completions/max_length": 2750.5,
"eval_completions/max_terminated_length": 2110.25,
"eval_completions/mean_length": 694.6929092407227,
"eval_completions/mean_terminated_length": 681.4098587036133,
"eval_completions/min_length": 282.25,
"eval_completions/min_terminated_length": 282.25,
"eval_loss": 0.0,
"eval_num_tokens": 91522447.0,
"eval_reward": 1.2001934349536896,
"eval_reward_std": 0.2988221123814583,
"eval_rewards/accuracy_reward": 0.65625,
"eval_rewards/brier_reward": 0.7480312362313271,
"eval_rewards/confidence_one_or_zero": 0.0,
"eval_rewards/format_reward": 0.99609375,
"eval_rewards/mean_confidence_reward": 0.5917969048023224,
"eval_runtime": 180.5361,
"eval_samples_per_second": 5.539,
"eval_steps_per_second": 0.044,
"step": 60
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0032552083333333703,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3369.0,
"completions/mean_length": 717.5091552734375,
"completions/mean_terminated_length": 706.4754638671875,
"completions/min_length": 227.0,
"completions/min_terminated_length": 227.0,
"epoch": 0.3904,
"grad_norm": 0.0002951840579044074,
"learning_rate": 1.3709677419354838e-06,
"loss": 0.0048,
"num_tokens": 93160469.0,
"reward": 1.1742024421691895,
"reward_std": 0.1309945285320282,
"rewards/accuracy_reward": 0.6171875,
"rewards/brier_reward": 0.7351120114326477,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.99609375,
"rewards/mean_confidence_reward": 0.5895833969116211,
"step": 61
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0013020833333333703,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3920.0,
"completions/mean_length": 696.4987182617188,
"completions/mean_terminated_length": 692.0664672851562,
"completions/min_length": 247.0,
"completions/min_terminated_length": 247.0,
"epoch": 0.3968,
"grad_norm": 0.00034755203523673117,
"learning_rate": 1.2903225806451614e-06,
"loss": 0.0043,
"num_tokens": 94757995.0,
"reward": 1.207226276397705,
"reward_std": 0.14550277590751648,
"rewards/accuracy_reward": 0.666015625,
"rewards/brier_reward": 0.7503781914710999,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.998046875,
"rewards/mean_confidence_reward": 0.5946289300918579,
"step": 62
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0006510416666666297,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3209.0,
"completions/mean_length": 665.5703125,
"completions/mean_terminated_length": 663.3355102539062,
"completions/min_length": 208.0,
"completions/min_terminated_length": 208.0,
"epoch": 0.4032,
"grad_norm": 0.0003047801728826016,
"learning_rate": 1.2096774193548388e-06,
"loss": 0.0038,
"num_tokens": 96305975.0,
"reward": 1.2266261577606201,
"reward_std": 0.12364225089550018,
"rewards/accuracy_reward": 0.6959635615348816,
"rewards/brier_reward": 0.7585787773132324,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9986979365348816,
"rewards/mean_confidence_reward": 0.5923177599906921,
"step": 63
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3825.0,
"completions/mean_length": 714.24609375,
"completions/mean_terminated_length": 700.9843139648438,
"completions/min_length": 250.0,
"completions/min_terminated_length": 250.0,
"epoch": 0.4096,
"grad_norm": 0.0003700917004607618,
"learning_rate": 1.1290322580645162e-06,
"loss": 0.0061,
"num_tokens": 97927537.0,
"reward": 1.2228282690048218,
"reward_std": 0.14666973054409027,
"rewards/accuracy_reward": 0.6920573115348816,
"rewards/brier_reward": 0.7574934959411621,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.99609375,
"rewards/mean_confidence_reward": 0.5906250476837158,
"step": 64
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001953125,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 2592.0,
"completions/mean_length": 692.2435302734375,
"completions/mean_terminated_length": 685.58251953125,
"completions/min_length": 222.0,
"completions/min_terminated_length": 222.0,
"epoch": 0.416,
"grad_norm": 0.0003462318563833833,
"learning_rate": 1.0483870967741936e-06,
"loss": 0.0045,
"num_tokens": 99521967.0,
"reward": 1.2195795774459839,
"reward_std": 0.12639373540878296,
"rewards/accuracy_reward": 0.6848958134651184,
"rewards/brier_reward": 0.7562044262886047,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.998046875,
"rewards/mean_confidence_reward": 0.5926432609558105,
"step": 65
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0026041666666666297,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3007.0,
"completions/mean_length": 699.4251708984375,
"completions/mean_terminated_length": 690.5568237304688,
"completions/min_length": 268.0,
"completions/min_terminated_length": 268.0,
"epoch": 0.4224,
"grad_norm": 0.00033353836624883115,
"learning_rate": 9.67741935483871e-07,
"loss": 0.0032,
"num_tokens": 101121940.0,
"reward": 1.22261381149292,
"reward_std": 0.13449697196483612,
"rewards/accuracy_reward": 0.693359375,
"rewards/brier_reward": 0.7544605731964111,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9973958134651184,
"rewards/mean_confidence_reward": 0.5918294787406921,
"step": 66
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0032552083333333703,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3895.0,
"completions/mean_length": 707.8529052734375,
"completions/mean_terminated_length": 696.7877197265625,
"completions/min_length": 264.0,
"completions/min_terminated_length": 264.0,
"epoch": 0.4288,
"grad_norm": 0.00033317628549411893,
"learning_rate": 8.870967741935485e-07,
"loss": 0.0048,
"num_tokens": 102732866.0,
"reward": 1.2167930603027344,
"reward_std": 0.14756852388381958,
"rewards/accuracy_reward": 0.685546875,
"rewards/brier_reward": 0.7538866996765137,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.994140625,
"rewards/mean_confidence_reward": 0.5919271111488342,
"step": 67
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0013020833333333703,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3975.0,
"completions/mean_length": 679.1966552734375,
"completions/mean_terminated_length": 674.7418212890625,
"completions/min_length": 282.0,
"completions/min_terminated_length": 282.0,
"epoch": 0.4352,
"grad_norm": 0.0003327982558403164,
"learning_rate": 8.064516129032258e-07,
"loss": 0.0035,
"num_tokens": 104304616.0,
"reward": 1.219343662261963,
"reward_std": 0.14099721610546112,
"rewards/accuracy_reward": 0.685546875,
"rewards/brier_reward": 0.7550816535949707,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.998046875,
"rewards/mean_confidence_reward": 0.5933919548988342,
"step": 68
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00651041666666663,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 4057.0,
"completions/mean_length": 707.6243896484375,
"completions/mean_terminated_length": 685.4201049804688,
"completions/min_length": 211.0,
"completions/min_terminated_length": 211.0,
"epoch": 0.4416,
"grad_norm": 0.00039123473106883466,
"learning_rate": 7.258064516129033e-07,
"loss": 0.0085,
"num_tokens": 105919295.0,
"reward": 1.1870570182800293,
"reward_std": 0.1436096727848053,
"rewards/accuracy_reward": 0.64453125,
"rewards/brier_reward": 0.7386855483055115,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9908854365348816,
"rewards/mean_confidence_reward": 0.5858398675918579,
"step": 69
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0026041666666666297,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3348.0,
"completions/mean_length": 702.8671875,
"completions/mean_terminated_length": 694.0078735351562,
"completions/min_length": 258.0,
"completions/min_terminated_length": 258.0,
"epoch": 0.448,
"grad_norm": 0.0003377721586730331,
"learning_rate": 6.451612903225807e-07,
"loss": 0.0031,
"num_tokens": 107526899.0,
"reward": 1.2125215530395508,
"reward_std": 0.14915111660957336,
"rewards/accuracy_reward": 0.6751301884651184,
"rewards/brier_reward": 0.7531562447547913,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9967448115348816,
"rewards/mean_confidence_reward": 0.5910807251930237,
"step": 70
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0026041666666666297,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3629.0,
"completions/mean_length": 685.8678588867188,
"completions/mean_terminated_length": 676.964111328125,
"completions/min_length": 266.0,
"completions/min_terminated_length": 266.0,
"epoch": 0.4544,
"grad_norm": 0.00031751353526487947,
"learning_rate": 5.645161290322581e-07,
"loss": 0.0051,
"num_tokens": 109102600.0,
"reward": 1.2455437183380127,
"reward_std": 0.1256546825170517,
"rewards/accuracy_reward": 0.728515625,
"rewards/brier_reward": 0.7658147811889648,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9967448115348816,
"rewards/mean_confidence_reward": 0.5949544310569763,
"step": 71
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00455729166666663,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3601.0,
"completions/mean_length": 708.2962646484375,
"completions/mean_terminated_length": 692.7867431640625,
"completions/min_length": 259.0,
"completions/min_terminated_length": 259.0,
"epoch": 0.4608,
"grad_norm": 0.0003313023771625012,
"learning_rate": 4.838709677419355e-07,
"loss": 0.0067,
"num_tokens": 110719119.0,
"reward": 1.193752408027649,
"reward_std": 0.14569219946861267,
"rewards/accuracy_reward": 0.6484375,
"rewards/brier_reward": 0.7442636489868164,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9947916865348816,
"rewards/mean_confidence_reward": 0.5896809697151184,
"step": 72
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 4002.0,
"completions/mean_length": 701.8294677734375,
"completions/mean_terminated_length": 688.5189819335938,
"completions/min_length": 206.0,
"completions/min_terminated_length": 206.0,
"epoch": 0.4672,
"grad_norm": 0.0002959003031719476,
"learning_rate": 4.032258064516129e-07,
"loss": 0.0064,
"num_tokens": 112316233.0,
"reward": 1.2044414281845093,
"reward_std": 0.13446907699108124,
"rewards/accuracy_reward": 0.6653645634651184,
"rewards/brier_reward": 0.7487148642539978,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9947916865348816,
"rewards/mean_confidence_reward": 0.5902343392372131,
"step": 73
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0026041666666666297,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 4061.0,
"completions/mean_length": 676.0768432617188,
"completions/mean_terminated_length": 667.1475219726562,
"completions/min_length": 226.0,
"completions/min_terminated_length": 226.0,
"epoch": 0.4736,
"grad_norm": 0.00029477832140401006,
"learning_rate": 3.2258064516129035e-07,
"loss": 0.0061,
"num_tokens": 113878231.0,
"reward": 1.2263811826705933,
"reward_std": 0.11916504800319672,
"rewards/accuracy_reward": 0.6998698115348816,
"rewards/brier_reward": 0.7567868232727051,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.99609375,
"rewards/mean_confidence_reward": 0.5970052480697632,
"step": 74
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00520833333333337,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 4064.0,
"completions/mean_length": 715.3502807617188,
"completions/mean_terminated_length": 697.6505126953125,
"completions/min_length": 250.0,
"completions/min_terminated_length": 250.0,
"epoch": 0.48,
"grad_norm": 0.00032259986619465053,
"learning_rate": 2.4193548387096775e-07,
"loss": 0.0052,
"num_tokens": 115499489.0,
"reward": 1.2046186923980713,
"reward_std": 0.1424405723810196,
"rewards/accuracy_reward": 0.6647135615348816,
"rewards/brier_reward": 0.7497200965881348,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9947916865348816,
"rewards/mean_confidence_reward": 0.5918620228767395,
"step": 75
},
{
"epoch": 0.48,
"eval_completions/clipped_ratio": 0.0021784855769230727,
"eval_completions/max_length": 2731.5,
"eval_completions/max_terminated_length": 2188.25,
"eval_completions/mean_length": 698.0206604003906,
"eval_completions/mean_terminated_length": 690.5886993408203,
"eval_completions/min_length": 273.625,
"eval_completions/min_terminated_length": 273.625,
"eval_loss": 0.0,
"eval_num_tokens": 115499489.0,
"eval_reward": 1.2047217637300491,
"eval_reward_std": 0.2950289249420166,
"eval_rewards/accuracy_reward": 0.6611328125,
"eval_rewards/brier_reward": 0.7502519488334656,
"eval_rewards/confidence_one_or_zero": 0.0,
"eval_rewards/format_reward": 0.998046875,
"eval_rewards/mean_confidence_reward": 0.5946289300918579,
"eval_runtime": 182.4904,
"eval_samples_per_second": 5.48,
"eval_steps_per_second": 0.044,
"step": 75
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0006510416666666297,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 2605.0,
"completions/mean_length": 687.99609375,
"completions/mean_terminated_length": 685.77587890625,
"completions/min_length": 238.0,
"completions/min_terminated_length": 238.0,
"epoch": 0.4864,
"grad_norm": 0.0003024231409654021,
"learning_rate": 1.6129032258064518e-07,
"loss": 0.0025,
"num_tokens": 117078467.0,
"reward": 1.2596244812011719,
"reward_std": 0.13364391028881073,
"rewards/accuracy_reward": 0.74609375,
"rewards/brier_reward": 0.7737943530082703,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9993489384651184,
"rewards/mean_confidence_reward": 0.5975260734558105,
"step": 76
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0026041666666666297,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 2174.0,
"completions/mean_length": 692.5631713867188,
"completions/mean_terminated_length": 683.6768798828125,
"completions/min_length": 208.0,
"completions/min_terminated_length": 208.0,
"epoch": 0.4928,
"grad_norm": 0.00031940749613568187,
"learning_rate": 8.064516129032259e-08,
"loss": 0.0037,
"num_tokens": 118665580.0,
"reward": 1.239206314086914,
"reward_std": 0.12442197650671005,
"rewards/accuracy_reward": 0.716796875,
"rewards/brier_reward": 0.7642080187797546,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9973958134651184,
"rewards/mean_confidence_reward": 0.5926106572151184,
"step": 77
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001953125,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3732.0,
"completions/mean_length": 699.201171875,
"completions/mean_terminated_length": 692.5538330078125,
"completions/min_length": 248.0,
"completions/min_terminated_length": 248.0,
"epoch": 0.4992,
"grad_norm": 0.0003164388763252646,
"learning_rate": 0.0,
"loss": 0.0045,
"num_tokens": 120267993.0,
"reward": 1.2062182426452637,
"reward_std": 0.1399303674697876,
"rewards/accuracy_reward": 0.6673176884651184,
"rewards/brier_reward": 0.7477109432220459,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9973958134651184,
"rewards/mean_confidence_reward": 0.5910807251930237,
"step": 78
},
{
"epoch": 0.4992,
"step": 78,
"total_flos": 0.0,
"train_loss": 0.008966646576598764,
"train_runtime": 16350.0741,
"train_samples_per_second": 0.917,
"train_steps_per_second": 0.005
}
],
"logging_steps": 1,
"max_steps": 78,
"num_input_tokens_seen": 120267993,
"num_train_epochs": 1,
"save_steps": 60,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 0.0,
"train_batch_size": 3,
"trial_name": null,
"trial_params": null
}