Files
qwen2.5-7B-rlar_g8_b384_mat…/trainer_state.json
ModelHub XC 164d3b400e 初始化项目,由ModelHub XC社区提供模型
Model: gguk2on/qwen2.5-7B-rlar_g8_b384_math_0.60.08
Source: Original Platform
2026-08-12 19:21:19 +08:00

2264 lines
86 KiB
JSON

{
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.4992,
"eval_steps": 15,
"global_step": 78,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.02018229166666663,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3811.0,
"completions/mean_length": 628.982421875,
"completions/mean_terminated_length": 557.5687255859375,
"completions/min_length": 2.0,
"completions/min_terminated_length": 2.0,
"epoch": 0.0064,
"grad_norm": 0.0038886398542672396,
"learning_rate": 3.125e-07,
"loss": 0.0018,
"num_tokens": 1493533.0,
"reward": 0.5428099632263184,
"reward_std": 0.5042912364006042,
"rewards/accuracy_reward": 0.2421875,
"rewards/brier_reward": 0.26072490215301514,
"rewards/confidence_one_or_zero": 0.484375,
"rewards/format_reward": 0.5826823115348816,
"rewards/mean_confidence_reward": 0.7791340947151184,
"step": 1
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.02278645833333337,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3898.0,
"completions/mean_length": 652.9889526367188,
"completions/mean_terminated_length": 572.70556640625,
"completions/min_length": 2.0,
"completions/min_terminated_length": 2.0,
"epoch": 0.0128,
"grad_norm": 0.0040999785996973515,
"learning_rate": 6.25e-07,
"loss": 0.0057,
"num_tokens": 3025932.0,
"reward": 0.5687162280082703,
"reward_std": 0.5238062739372253,
"rewards/accuracy_reward": 0.26171875,
"rewards/brier_reward": 0.27868345379829407,
"rewards/confidence_one_or_zero": 0.462890625,
"rewards/format_reward": 0.5970051884651184,
"rewards/mean_confidence_reward": 0.7861537337303162,
"step": 2
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.02734375,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 4025.0,
"completions/mean_length": 669.513671875,
"completions/mean_terminated_length": 573.186767578125,
"completions/min_length": 4.0,
"completions/min_terminated_length": 4.0,
"epoch": 0.0192,
"grad_norm": 0.0031686064321547747,
"learning_rate": 9.375000000000001e-07,
"loss": 0.0057,
"num_tokens": 4587753.0,
"reward": 0.5346394181251526,
"reward_std": 0.5223636627197266,
"rewards/accuracy_reward": 0.2356770783662796,
"rewards/brier_reward": 0.2515455484390259,
"rewards/confidence_one_or_zero": 0.46484375,
"rewards/format_reward": 0.58203125,
"rewards/mean_confidence_reward": 0.7804492115974426,
"step": 3
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.02018229166666663,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3710.0,
"completions/mean_length": 577.6556396484375,
"completions/mean_terminated_length": 505.1846923828125,
"completions/min_length": 2.0,
"completions/min_terminated_length": 2.0,
"epoch": 0.0256,
"grad_norm": 0.004336833488196135,
"learning_rate": 1.25e-06,
"loss": 0.0067,
"num_tokens": 5990368.0,
"reward": 0.6042205095291138,
"reward_std": 0.5315096378326416,
"rewards/accuracy_reward": 0.26953125,
"rewards/brier_reward": 0.28914394974708557,
"rewards/confidence_one_or_zero": 0.4720052182674408,
"rewards/format_reward": 0.6497395634651184,
"rewards/mean_confidence_reward": 0.8320702910423279,
"step": 4
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.02734375,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 4044.0,
"completions/mean_length": 626.986328125,
"completions/mean_terminated_length": 529.4638671875,
"completions/min_length": 2.0,
"completions/min_terminated_length": 2.0,
"epoch": 0.032,
"grad_norm": 0.0029928558506071568,
"learning_rate": 1.5625e-06,
"loss": 0.0152,
"num_tokens": 7480635.0,
"reward": 0.5699490308761597,
"reward_std": 0.4995768070220947,
"rewards/accuracy_reward": 0.2473958283662796,
"rewards/brier_reward": 0.2661750018596649,
"rewards/confidence_one_or_zero": 0.4622395932674408,
"rewards/format_reward": 0.6263020634651184,
"rewards/mean_confidence_reward": 0.7925998568534851,
"step": 5
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.02864583333333337,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 4090.0,
"completions/mean_length": 620.4850463867188,
"completions/mean_terminated_length": 517.989990234375,
"completions/min_length": 6.0,
"completions/min_terminated_length": 6.0,
"epoch": 0.0384,
"grad_norm": 0.0024268238339573145,
"learning_rate": 1.8750000000000003e-06,
"loss": 0.0111,
"num_tokens": 8962748.0,
"reward": 0.6401253938674927,
"reward_std": 0.47264236211776733,
"rewards/accuracy_reward": 0.2584635317325592,
"rewards/brier_reward": 0.291294127702713,
"rewards/confidence_one_or_zero": 0.412109375,
"rewards/format_reward": 0.73046875,
"rewards/mean_confidence_reward": 0.8003639578819275,
"step": 6
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.03776041666666663,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 4056.0,
"completions/mean_length": 631.2454833984375,
"completions/mean_terminated_length": 495.28076171875,
"completions/min_length": 2.0,
"completions/min_terminated_length": 2.0,
"epoch": 0.0448,
"grad_norm": 0.0012339478125795722,
"learning_rate": 2.1875000000000002e-06,
"loss": 0.0245,
"num_tokens": 10463269.0,
"reward": 0.7111533880233765,
"reward_std": 0.4298191964626312,
"rewards/accuracy_reward": 0.2981770932674408,
"rewards/brier_reward": 0.3239741623401642,
"rewards/confidence_one_or_zero": 0.4348958432674408,
"rewards/format_reward": 0.8001301884651184,
"rewards/mean_confidence_reward": 0.8242577910423279,
"step": 7
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.03776041666666663,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 4065.0,
"completions/mean_length": 611.55859375,
"completions/mean_terminated_length": 474.82135009765625,
"completions/min_length": 74.0,
"completions/min_terminated_length": 74.0,
"epoch": 0.0512,
"grad_norm": 0.0042218598537147045,
"learning_rate": 2.5e-06,
"loss": 0.0232,
"num_tokens": 11926127.0,
"reward": 0.7340978384017944,
"reward_std": 0.4097265899181366,
"rewards/accuracy_reward": 0.2819010317325592,
"rewards/brier_reward": 0.31322193145751953,
"rewards/confidence_one_or_zero": 0.4231770932674408,
"rewards/format_reward": 0.873046875,
"rewards/mean_confidence_reward": 0.8644980788230896,
"step": 8
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.021484375,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3906.0,
"completions/mean_length": 540.412109375,
"completions/mean_terminated_length": 462.3453063964844,
"completions/min_length": 76.0,
"completions/min_terminated_length": 76.0,
"epoch": 0.0576,
"grad_norm": 0.0011289231479167938,
"learning_rate": 2.8125e-06,
"loss": 0.0141,
"num_tokens": 13287880.0,
"reward": 0.8242492079734802,
"reward_std": 0.44039151072502136,
"rewards/accuracy_reward": 0.35546875,
"rewards/brier_reward": 0.38935914635658264,
"rewards/confidence_one_or_zero": 0.34375,
"rewards/format_reward": 0.9036458134651184,
"rewards/mean_confidence_reward": 0.8846094012260437,
"step": 9
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.05078125,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 4091.0,
"completions/mean_length": 632.6569213867188,
"completions/mean_terminated_length": 447.37518310546875,
"completions/min_length": 83.0,
"completions/min_terminated_length": 83.0,
"epoch": 0.064,
"grad_norm": 0.001107793883420527,
"learning_rate": 3.125e-06,
"loss": 0.041,
"num_tokens": 14795001.0,
"reward": 0.7957136034965515,
"reward_std": 0.41083693504333496,
"rewards/accuracy_reward": 0.322265625,
"rewards/brier_reward": 0.3674457371234894,
"rewards/confidence_one_or_zero": 0.3001302182674408,
"rewards/format_reward": 0.9016926884651184,
"rewards/mean_confidence_reward": 0.8539149165153503,
"step": 10
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.064453125,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 4028.0,
"completions/mean_length": 673.1575927734375,
"completions/mean_terminated_length": 437.3458557128906,
"completions/min_length": 92.0,
"completions/min_terminated_length": 92.0,
"epoch": 0.0704,
"grad_norm": 0.0021554373670369387,
"learning_rate": 3.4375e-06,
"loss": 0.0489,
"num_tokens": 16356387.0,
"reward": 0.8237268328666687,
"reward_std": 0.38636907935142517,
"rewards/accuracy_reward": 0.3391927182674408,
"rewards/brier_reward": 0.398082971572876,
"rewards/confidence_one_or_zero": 0.2447916716337204,
"rewards/format_reward": 0.91015625,
"rewards/mean_confidence_reward": 0.8387824892997742,
"step": 11
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.06901041666666663,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3987.0,
"completions/mean_length": 717.953125,
"completions/mean_terminated_length": 467.5524597167969,
"completions/min_length": 66.0,
"completions/min_terminated_length": 66.0,
"epoch": 0.0768,
"grad_norm": 0.000843795423861593,
"learning_rate": 3.7500000000000005e-06,
"loss": 0.0607,
"num_tokens": 17981043.0,
"reward": 0.8221524953842163,
"reward_std": 0.39118266105651855,
"rewards/accuracy_reward": 0.3385416567325592,
"rewards/brier_reward": 0.3962376117706299,
"rewards/confidence_one_or_zero": 0.1875,
"rewards/format_reward": 0.9095051884651184,
"rewards/mean_confidence_reward": 0.8306503891944885,
"step": 12
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.04296875,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 4043.0,
"completions/mean_length": 598.2396240234375,
"completions/mean_terminated_length": 441.1972961425781,
"completions/min_length": 92.0,
"completions/min_terminated_length": 92.0,
"epoch": 0.0832,
"grad_norm": 0.0009227065020240843,
"learning_rate": 4.0625000000000005e-06,
"loss": 0.032,
"num_tokens": 19423875.0,
"reward": 0.9058957099914551,
"reward_std": 0.3866400718688965,
"rewards/accuracy_reward": 0.4010416567325592,
"rewards/brier_reward": 0.46476590633392334,
"rewards/confidence_one_or_zero": 0.1666666716337204,
"rewards/format_reward": 0.9459635615348816,
"rewards/mean_confidence_reward": 0.8527408242225647,
"step": 13
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01953125,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 4013.0,
"completions/mean_length": 517.3671875,
"completions/mean_terminated_length": 446.0796813964844,
"completions/min_length": 85.0,
"completions/min_terminated_length": 85.0,
"epoch": 0.0896,
"grad_norm": 0.0012902182061225176,
"learning_rate": 4.3750000000000005e-06,
"loss": 0.0167,
"num_tokens": 20744551.0,
"reward": 0.998481273651123,
"reward_std": 0.3551454246044159,
"rewards/accuracy_reward": 0.4713541567325592,
"rewards/brier_reward": 0.5503284931182861,
"rewards/confidence_one_or_zero": 0.1106770858168602,
"rewards/format_reward": 0.9752604365348816,
"rewards/mean_confidence_reward": 0.8616471290588379,
"step": 14
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01106770833333337,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3922.0,
"completions/mean_length": 513.7825927734375,
"completions/mean_terminated_length": 473.69189453125,
"completions/min_length": 115.0,
"completions/min_terminated_length": 115.0,
"epoch": 0.096,
"grad_norm": 0.001505257561802864,
"learning_rate": 4.6875000000000004e-06,
"loss": 0.0147,
"num_tokens": 22067089.0,
"reward": 1.0049607753753662,
"reward_std": 0.3260785639286041,
"rewards/accuracy_reward": 0.4654947817325592,
"rewards/brier_reward": 0.5593823194503784,
"rewards/confidence_one_or_zero": 0.060546875,
"rewards/format_reward": 0.9850260615348816,
"rewards/mean_confidence_reward": 0.8561978340148926,
"step": 15
},
{
"epoch": 0.096,
"eval_completions/clipped_ratio": 0.01021634615384616,
"eval_completions/max_length": 4096.0,
"eval_completions/max_terminated_length": 2151.375,
"eval_completions/mean_length": 530.8136291503906,
"eval_completions/mean_terminated_length": 493.9981918334961,
"eval_completions/min_length": 145.125,
"eval_completions/min_terminated_length": 145.125,
"eval_loss": 0.0,
"eval_num_tokens": 22067089.0,
"eval_reward": 1.0130146145820618,
"eval_reward_std": 0.45545171946287155,
"eval_rewards/accuracy_reward": 0.4677734375,
"eval_rewards/brier_reward": 0.5719102919101715,
"eval_rewards/confidence_one_or_zero": 0.0302734375,
"eval_rewards/format_reward": 0.986328125,
"eval_rewards/mean_confidence_reward": 0.8396484181284904,
"eval_runtime": 267.3219,
"eval_samples_per_second": 3.741,
"eval_steps_per_second": 0.03,
"step": 15
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005859375,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3982.0,
"completions/mean_length": 502.87109375,
"completions/mean_terminated_length": 481.6935119628906,
"completions/min_length": 112.0,
"completions/min_terminated_length": 112.0,
"epoch": 0.1024,
"grad_norm": 0.0018715404439717531,
"learning_rate": 5e-06,
"loss": 0.0032,
"num_tokens": 23372811.0,
"reward": 1.067986249923706,
"reward_std": 0.3171144723892212,
"rewards/accuracy_reward": 0.5260416865348816,
"rewards/brier_reward": 0.6183767914772034,
"rewards/confidence_one_or_zero": 0.029296875,
"rewards/format_reward": 0.9915364384651184,
"rewards/mean_confidence_reward": 0.8487825393676758,
"step": 16
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 4042.0,
"completions/mean_length": 542.2838745117188,
"completions/mean_terminated_length": 514.3018188476562,
"completions/min_length": 115.0,
"completions/min_terminated_length": 115.0,
"epoch": 0.1088,
"grad_norm": 0.000804521725513041,
"learning_rate": 4.919354838709678e-06,
"loss": 0.0099,
"num_tokens": 24736391.0,
"reward": 1.0146701335906982,
"reward_std": 0.2993273138999939,
"rewards/accuracy_reward": 0.4596354067325592,
"rewards/brier_reward": 0.5794537663459778,
"rewards/confidence_one_or_zero": 0.012369791977107525,
"rewards/format_reward": 0.990234375,
"rewards/mean_confidence_reward": 0.8174610137939453,
"step": 17
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00911458333333337,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 4072.0,
"completions/mean_length": 573.2369995117188,
"completions/mean_terminated_length": 540.8331298828125,
"completions/min_length": 147.0,
"completions/min_terminated_length": 147.0,
"epoch": 0.1152,
"grad_norm": 0.0046823653392493725,
"learning_rate": 4.838709677419355e-06,
"loss": 0.011,
"num_tokens": 26138787.0,
"reward": 1.0647892951965332,
"reward_std": 0.2827242612838745,
"rewards/accuracy_reward": 0.5130208134651184,
"rewards/brier_reward": 0.6282604336738586,
"rewards/confidence_one_or_zero": 0.0032552082557231188,
"rewards/format_reward": 0.98828125,
"rewards/mean_confidence_reward": 0.8041470646858215,
"step": 18
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00846354166666663,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 4086.0,
"completions/mean_length": 565.6256713867188,
"completions/mean_terminated_length": 535.4911499023438,
"completions/min_length": 155.0,
"completions/min_terminated_length": 155.0,
"epoch": 0.1216,
"grad_norm": 0.0006344782887026668,
"learning_rate": 4.758064516129033e-06,
"loss": 0.0114,
"num_tokens": 27535140.0,
"reward": 1.060068130493164,
"reward_std": 0.26595863699913025,
"rewards/accuracy_reward": 0.49609375,
"rewards/brier_reward": 0.6344431638717651,
"rewards/confidence_one_or_zero": 0.005859375,
"rewards/format_reward": 0.9895833134651184,
"rewards/mean_confidence_reward": 0.7843945026397705,
"step": 19
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00846354166666663,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3894.0,
"completions/mean_length": 588.1354370117188,
"completions/mean_terminated_length": 558.1930541992188,
"completions/min_length": 112.0,
"completions/min_terminated_length": 112.0,
"epoch": 0.128,
"grad_norm": 0.0005923378048464656,
"learning_rate": 4.67741935483871e-06,
"loss": 0.0096,
"num_tokens": 28963140.0,
"reward": 1.1038968563079834,
"reward_std": 0.25995469093322754,
"rewards/accuracy_reward": 0.54296875,
"rewards/brier_reward": 0.6745752692222595,
"rewards/confidence_one_or_zero": 0.0013020833721384406,
"rewards/format_reward": 0.990234375,
"rewards/mean_confidence_reward": 0.7578775882720947,
"step": 20
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01106770833333337,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 4069.0,
"completions/mean_length": 655.8561401367188,
"completions/mean_terminated_length": 617.35546875,
"completions/min_length": 193.0,
"completions/min_terminated_length": 193.0,
"epoch": 0.1344,
"grad_norm": 0.0005457309307530522,
"learning_rate": 4.596774193548387e-06,
"loss": 0.0119,
"num_tokens": 30497791.0,
"reward": 1.1018186807632446,
"reward_std": 0.26623260974884033,
"rewards/accuracy_reward": 0.5384114384651184,
"rewards/brier_reward": 0.6788830161094666,
"rewards/confidence_one_or_zero": 0.0013020833721384406,
"rewards/format_reward": 0.986328125,
"rewards/mean_confidence_reward": 0.7308397889137268,
"step": 21
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.009765625,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 4039.0,
"completions/mean_length": 623.337890625,
"completions/mean_terminated_length": 589.0907592773438,
"completions/min_length": 188.0,
"completions/min_terminated_length": 188.0,
"epoch": 0.1408,
"grad_norm": 0.0004921160289086401,
"learning_rate": 4.516129032258065e-06,
"loss": 0.0089,
"num_tokens": 31977526.0,
"reward": 1.1192352771759033,
"reward_std": 0.24459850788116455,
"rewards/accuracy_reward": 0.548828125,
"rewards/brier_reward": 0.7006959915161133,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9889323115348816,
"rewards/mean_confidence_reward": 0.7082682251930237,
"step": 22
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.021484375,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3659.0,
"completions/mean_length": 730.2272338867188,
"completions/mean_terminated_length": 656.3280029296875,
"completions/min_length": 146.0,
"completions/min_terminated_length": 146.0,
"epoch": 0.1472,
"grad_norm": 0.00045825468259863555,
"learning_rate": 4.435483870967742e-06,
"loss": 0.0265,
"num_tokens": 33632619.0,
"reward": 1.099420428276062,
"reward_std": 0.2596912682056427,
"rewards/accuracy_reward": 0.5286458134651184,
"rewards/brier_reward": 0.6923167705535889,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9778645634651184,
"rewards/mean_confidence_reward": 0.6766145825386047,
"step": 23
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00651041666666663,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 4045.0,
"completions/mean_length": 672.66796875,
"completions/mean_terminated_length": 650.234619140625,
"completions/min_length": 128.0,
"completions/min_terminated_length": 128.0,
"epoch": 0.1536,
"grad_norm": 0.00042477657552808523,
"learning_rate": 4.35483870967742e-06,
"loss": 0.012,
"num_tokens": 35190149.0,
"reward": 1.1733596324920654,
"reward_std": 0.20008432865142822,
"rewards/accuracy_reward": 0.6145833134651184,
"rewards/brier_reward": 0.7399346828460693,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9921875,
"rewards/mean_confidence_reward": 0.6804882884025574,
"step": 24
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.013671875,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3768.0,
"completions/mean_length": 694.091796875,
"completions/mean_terminated_length": 646.9366455078125,
"completions/min_length": 178.0,
"completions/min_terminated_length": 178.0,
"epoch": 0.16,
"grad_norm": 0.0006669931462965906,
"learning_rate": 4.274193548387097e-06,
"loss": 0.0134,
"num_tokens": 36776882.0,
"reward": 1.1462349891662598,
"reward_std": 0.21996283531188965,
"rewards/accuracy_reward": 0.583984375,
"rewards/brier_reward": 0.7240970730781555,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.984375,
"rewards/mean_confidence_reward": 0.6663411259651184,
"step": 25
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01171875,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 4039.0,
"completions/mean_length": 717.0736083984375,
"completions/mean_terminated_length": 677.0072631835938,
"completions/min_length": 216.0,
"completions/min_terminated_length": 216.0,
"epoch": 0.1664,
"grad_norm": 0.0005606704507954419,
"learning_rate": 4.193548387096774e-06,
"loss": 0.014,
"num_tokens": 38406939.0,
"reward": 1.1402171850204468,
"reward_std": 0.2176455706357956,
"rewards/accuracy_reward": 0.5696614384651184,
"rewards/brier_reward": 0.7237804532051086,
"rewards/confidence_one_or_zero": 0.0006510416860692203,
"rewards/format_reward": 0.9869791865348816,
"rewards/mean_confidence_reward": 0.6502603888511658,
"step": 26
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01041666666666663,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3556.0,
"completions/mean_length": 687.1803588867188,
"completions/mean_terminated_length": 651.2980346679688,
"completions/min_length": 202.0,
"completions/min_terminated_length": 202.0,
"epoch": 0.1728,
"grad_norm": 0.0006814564112573862,
"learning_rate": 4.112903225806452e-06,
"loss": 0.0147,
"num_tokens": 39981584.0,
"reward": 1.1993398666381836,
"reward_std": 0.2010936439037323,
"rewards/accuracy_reward": 0.6516926884651184,
"rewards/brier_reward": 0.7580418586730957,
"rewards/confidence_one_or_zero": 0.0006510416860692203,
"rewards/format_reward": 0.9889323115348816,
"rewards/mean_confidence_reward": 0.64892578125,
"step": 27
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01432291666666663,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3948.0,
"completions/mean_length": 771.43359375,
"completions/mean_terminated_length": 723.1242065429688,
"completions/min_length": 222.0,
"completions/min_terminated_length": 222.0,
"epoch": 0.1792,
"grad_norm": 0.00036876313970424235,
"learning_rate": 4.032258064516129e-06,
"loss": 0.0179,
"num_tokens": 41691994.0,
"reward": 1.1750237941741943,
"reward_std": 0.20402050018310547,
"rewards/accuracy_reward": 0.6276041865348816,
"rewards/brier_reward": 0.740008533000946,
"rewards/confidence_one_or_zero": 0.0006510416860692203,
"rewards/format_reward": 0.982421875,
"rewards/mean_confidence_reward": 0.6476757526397705,
"step": 28
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.015625,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 4068.0,
"completions/mean_length": 777.306640625,
"completions/mean_terminated_length": 724.6289672851562,
"completions/min_length": 213.0,
"completions/min_terminated_length": 213.0,
"epoch": 0.1856,
"grad_norm": 0.0007213709177449346,
"learning_rate": 3.951612903225807e-06,
"loss": 0.0156,
"num_tokens": 43404393.0,
"reward": 1.155902624130249,
"reward_std": 0.2094547003507614,
"rewards/accuracy_reward": 0.6041666865348816,
"rewards/brier_reward": 0.725203812122345,
"rewards/confidence_one_or_zero": 0.0006510416860692203,
"rewards/format_reward": 0.982421875,
"rewards/mean_confidence_reward": 0.6395507454872131,
"step": 29
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01627604166666663,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 4005.0,
"completions/mean_length": 816.4284057617188,
"completions/mean_terminated_length": 762.166748046875,
"completions/min_length": 254.0,
"completions/min_terminated_length": 254.0,
"epoch": 0.192,
"grad_norm": 0.00035084618139080703,
"learning_rate": 3.870967741935484e-06,
"loss": 0.0175,
"num_tokens": 45180819.0,
"reward": 1.140360713005066,
"reward_std": 0.20701651275157928,
"rewards/accuracy_reward": 0.5807291865348816,
"rewards/brier_reward": 0.721463680267334,
"rewards/confidence_one_or_zero": 0.0006510416860692203,
"rewards/format_reward": 0.978515625,
"rewards/mean_confidence_reward": 0.6374218463897705,
"step": 30
},
{
"epoch": 0.192,
"eval_completions/clipped_ratio": 0.01171875,
"eval_completions/max_length": 3679.75,
"eval_completions/max_terminated_length": 2834.875,
"eval_completions/mean_length": 781.9544067382812,
"eval_completions/mean_terminated_length": 742.5631256103516,
"eval_completions/min_length": 303.25,
"eval_completions/min_terminated_length": 303.25,
"eval_loss": 0.0,
"eval_num_tokens": 45180819.0,
"eval_reward": 1.1743015497922897,
"eval_reward_std": 0.3388789966702461,
"eval_rewards/accuracy_reward": 0.625,
"eval_rewards/brier_reward": 0.7382386177778244,
"eval_rewards/confidence_one_or_zero": 0.0,
"eval_rewards/format_reward": 0.9853515625,
"eval_rewards/mean_confidence_reward": 0.642939455807209,
"eval_runtime": 248.0105,
"eval_samples_per_second": 4.032,
"eval_steps_per_second": 0.032,
"step": 30
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.017578125,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 4059.0,
"completions/mean_length": 795.9453125,
"completions/mean_terminated_length": 736.8986206054688,
"completions/min_length": 232.0,
"completions/min_terminated_length": 232.0,
"epoch": 0.1984,
"grad_norm": 0.0005465546273626387,
"learning_rate": 3.7903225806451614e-06,
"loss": 0.0198,
"num_tokens": 46932215.0,
"reward": 1.1878879070281982,
"reward_std": 0.21719825267791748,
"rewards/accuracy_reward": 0.6516926884651184,
"rewards/brier_reward": 0.7455544471740723,
"rewards/confidence_one_or_zero": 0.0006510416860692203,
"rewards/format_reward": 0.978515625,
"rewards/mean_confidence_reward": 0.6385090947151184,
"step": 31
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00911458333333337,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3902.0,
"completions/mean_length": 796.5013427734375,
"completions/mean_terminated_length": 766.151123046875,
"completions/min_length": 229.0,
"completions/min_terminated_length": 229.0,
"epoch": 0.2048,
"grad_norm": 0.0005273290444165468,
"learning_rate": 3.7096774193548392e-06,
"loss": 0.0112,
"num_tokens": 48676257.0,
"reward": 1.186940312385559,
"reward_std": 0.1851150393486023,
"rewards/accuracy_reward": 0.642578125,
"rewards/brier_reward": 0.742357075214386,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9889323115348816,
"rewards/mean_confidence_reward": 0.6397786736488342,
"step": 32
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01236979166666663,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3944.0,
"completions/mean_length": 772.8294677734375,
"completions/mean_terminated_length": 731.2076416015625,
"completions/min_length": 275.0,
"completions/min_terminated_length": 275.0,
"epoch": 0.2112,
"grad_norm": 0.00044452358270063996,
"learning_rate": 3.6290322580645166e-06,
"loss": 0.0139,
"num_tokens": 50386427.0,
"reward": 1.1843657493591309,
"reward_std": 0.19693529605865479,
"rewards/accuracy_reward": 0.6380208134651184,
"rewards/brier_reward": 0.7456715703010559,
"rewards/confidence_one_or_zero": 0.0013020833721384406,
"rewards/format_reward": 0.9850260615348816,
"rewards/mean_confidence_reward": 0.6357421875,
"step": 33
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01041666666666663,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3952.0,
"completions/mean_length": 801.5182495117188,
"completions/mean_terminated_length": 766.8394775390625,
"completions/min_length": 258.0,
"completions/min_terminated_length": 258.0,
"epoch": 0.2176,
"grad_norm": 0.0004962030798196793,
"learning_rate": 3.548387096774194e-06,
"loss": 0.0116,
"num_tokens": 52140983.0,
"reward": 1.180006980895996,
"reward_std": 0.19812732934951782,
"rewards/accuracy_reward": 0.6295573115348816,
"rewards/brier_reward": 0.743464469909668,
"rewards/confidence_one_or_zero": 0.0013020833721384406,
"rewards/format_reward": 0.9869791865348816,
"rewards/mean_confidence_reward": 0.6410807371139526,
"step": 34
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00716145833333337,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 2277.0,
"completions/mean_length": 777.1784057617188,
"completions/mean_terminated_length": 753.2393188476562,
"completions/min_length": 252.0,
"completions/min_terminated_length": 252.0,
"epoch": 0.224,
"grad_norm": 0.0003708812582772225,
"learning_rate": 3.4677419354838714e-06,
"loss": 0.0078,
"num_tokens": 53860905.0,
"reward": 1.191227674484253,
"reward_std": 0.18852798640727997,
"rewards/accuracy_reward": 0.6399739384651184,
"rewards/brier_reward": 0.750281035900116,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9921875,
"rewards/mean_confidence_reward": 0.63818359375,
"step": 35
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 2998.0,
"completions/mean_length": 809.6686401367188,
"completions/mean_terminated_length": 783.7919921875,
"completions/min_length": 236.0,
"completions/min_terminated_length": 236.0,
"epoch": 0.2304,
"grad_norm": 0.0003325633006170392,
"learning_rate": 3.3870967741935484e-06,
"loss": 0.0088,
"num_tokens": 55632564.0,
"reward": 1.1893303394317627,
"reward_std": 0.1812477558851242,
"rewards/accuracy_reward": 0.6438801884651184,
"rewards/brier_reward": 0.7438822388648987,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9908854365348816,
"rewards/mean_confidence_reward": 0.6352213025093079,
"step": 36
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01302083333333337,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 4057.0,
"completions/mean_length": 855.9251708984375,
"completions/mean_terminated_length": 813.1801147460938,
"completions/min_length": 264.0,
"completions/min_terminated_length": 264.0,
"epoch": 0.2368,
"grad_norm": 0.00032984872814267874,
"learning_rate": 3.306451612903226e-06,
"loss": 0.0158,
"num_tokens": 57471513.0,
"reward": 1.1870574951171875,
"reward_std": 0.19853496551513672,
"rewards/accuracy_reward": 0.6451823115348816,
"rewards/brier_reward": 0.747800350189209,
"rewards/confidence_one_or_zero": 0.0006510416860692203,
"rewards/format_reward": 0.9811198115348816,
"rewards/mean_confidence_reward": 0.6229491829872131,
"step": 37
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.009765625,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 4065.0,
"completions/mean_length": 823.9069213867188,
"completions/mean_terminated_length": 791.6377563476562,
"completions/min_length": 276.0,
"completions/min_terminated_length": 276.0,
"epoch": 0.2432,
"grad_norm": 0.00029764173086732626,
"learning_rate": 3.225806451612903e-06,
"loss": 0.0111,
"num_tokens": 59263266.0,
"reward": 1.2023420333862305,
"reward_std": 0.1630508005619049,
"rewards/accuracy_reward": 0.66015625,
"rewards/brier_reward": 0.7594890594482422,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9850260615348816,
"rewards/mean_confidence_reward": 0.6298502683639526,
"step": 38
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01432291666666663,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 4075.0,
"completions/mean_length": 865.1868896484375,
"completions/mean_terminated_length": 818.2398071289062,
"completions/min_length": 291.0,
"completions/min_terminated_length": 291.0,
"epoch": 0.2496,
"grad_norm": 0.00041590689215809107,
"learning_rate": 3.145161290322581e-06,
"loss": 0.0155,
"num_tokens": 61115137.0,
"reward": 1.1921846866607666,
"reward_std": 0.18370437622070312,
"rewards/accuracy_reward": 0.650390625,
"rewards/brier_reward": 0.7521950602531433,
"rewards/confidence_one_or_zero": 0.0006510416860692203,
"rewards/format_reward": 0.9817708134651184,
"rewards/mean_confidence_reward": 0.6317383050918579,
"step": 39
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00846354166666663,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 4067.0,
"completions/mean_length": 838.1901245117188,
"completions/mean_terminated_length": 810.3821411132812,
"completions/min_length": 286.0,
"completions/min_terminated_length": 286.0,
"epoch": 0.256,
"grad_norm": 0.0003017229901161045,
"learning_rate": 3.0645161290322584e-06,
"loss": 0.0109,
"num_tokens": 62930549.0,
"reward": 1.1816656589508057,
"reward_std": 0.1861250400543213,
"rewards/accuracy_reward": 0.6243489384651184,
"rewards/brier_reward": 0.7506882548332214,
"rewards/confidence_one_or_zero": 0.0013020833721384406,
"rewards/format_reward": 0.98828125,
"rewards/mean_confidence_reward": 0.6327799558639526,
"step": 40
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00846354166666663,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 4035.0,
"completions/mean_length": 849.77734375,
"completions/mean_terminated_length": 822.0682983398438,
"completions/min_length": 289.0,
"completions/min_terminated_length": 289.0,
"epoch": 0.2624,
"grad_norm": 0.00037381798028945923,
"learning_rate": 2.983870967741936e-06,
"loss": 0.0122,
"num_tokens": 64760999.0,
"reward": 1.205183506011963,
"reward_std": 0.1829705685377121,
"rewards/accuracy_reward": 0.6614583134651184,
"rewards/brier_reward": 0.7619168162345886,
"rewards/confidence_one_or_zero": 0.0006510416860692203,
"rewards/format_reward": 0.9869791865348816,
"rewards/mean_confidence_reward": 0.6296223998069763,
"step": 41
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01171875,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 4058.0,
"completions/mean_length": 820.4525146484375,
"completions/mean_terminated_length": 781.6119995117188,
"completions/min_length": 242.0,
"completions/min_terminated_length": 242.0,
"epoch": 0.2688,
"grad_norm": 0.000351252150721848,
"learning_rate": 2.903225806451613e-06,
"loss": 0.0138,
"num_tokens": 66546070.0,
"reward": 1.1862726211547852,
"reward_std": 0.18043045699596405,
"rewards/accuracy_reward": 0.6432291865348816,
"rewards/brier_reward": 0.7462306022644043,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9830729365348816,
"rewards/mean_confidence_reward": 0.6241536736488342,
"step": 42
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01432291666666663,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 4084.0,
"completions/mean_length": 852.4114990234375,
"completions/mean_terminated_length": 805.2787475585938,
"completions/min_length": 291.0,
"completions/min_terminated_length": 291.0,
"epoch": 0.2752,
"grad_norm": 0.0002898203383665532,
"learning_rate": 2.822580645161291e-06,
"loss": 0.0145,
"num_tokens": 68382142.0,
"reward": 1.1817338466644287,
"reward_std": 0.18965117633342743,
"rewards/accuracy_reward": 0.6341145634651184,
"rewards/brier_reward": 0.7475696206092834,
"rewards/confidence_one_or_zero": 0.0013020833721384406,
"rewards/format_reward": 0.9817708134651184,
"rewards/mean_confidence_reward": 0.622851550579071,
"step": 43
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.009765625,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 4000.0,
"completions/mean_length": 818.6666870117188,
"completions/mean_terminated_length": 786.3458862304688,
"completions/min_length": 259.0,
"completions/min_terminated_length": 259.0,
"epoch": 0.2816,
"grad_norm": 0.00029774583526887,
"learning_rate": 2.7419354838709676e-06,
"loss": 0.0113,
"num_tokens": 70165734.0,
"reward": 1.2131271362304688,
"reward_std": 0.17065833508968353,
"rewards/accuracy_reward": 0.6796875,
"rewards/brier_reward": 0.7608771324157715,
"rewards/confidence_one_or_zero": 0.0006510416860692203,
"rewards/format_reward": 0.9856770634651184,
"rewards/mean_confidence_reward": 0.619225263595581,
"step": 44
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00520833333333337,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 4035.0,
"completions/mean_length": 831.4752807617188,
"completions/mean_terminated_length": 814.383544921875,
"completions/min_length": 336.0,
"completions/min_terminated_length": 336.0,
"epoch": 0.288,
"grad_norm": 0.0002880664251279086,
"learning_rate": 2.6612903225806454e-06,
"loss": 0.0058,
"num_tokens": 71966624.0,
"reward": 1.1846349239349365,
"reward_std": 0.16476775705814362,
"rewards/accuracy_reward": 0.6223958134651184,
"rewards/brier_reward": 0.7553251385688782,
"rewards/confidence_one_or_zero": 0.0006510416860692203,
"rewards/format_reward": 0.9915364384651184,
"rewards/mean_confidence_reward": 0.6171224117279053,
"step": 45
},
{
"epoch": 0.288,
"eval_completions/clipped_ratio": 0.0068359375,
"eval_completions/max_length": 3547.5,
"eval_completions/max_terminated_length": 2789.25,
"eval_completions/mean_length": 832.5685119628906,
"eval_completions/mean_terminated_length": 810.0671997070312,
"eval_completions/min_length": 336.0,
"eval_completions/min_terminated_length": 336.0,
"eval_loss": 0.0,
"eval_num_tokens": 71966624.0,
"eval_reward": 1.182741940021515,
"eval_reward_std": 0.32168078422546387,
"eval_rewards/accuracy_reward": 0.6259765625,
"eval_rewards/brier_reward": 0.7512137740850449,
"eval_rewards/confidence_one_or_zero": 0.0,
"eval_rewards/format_reward": 0.98828125,
"eval_rewards/mean_confidence_reward": 0.6131835877895355,
"eval_runtime": 240.5116,
"eval_samples_per_second": 4.158,
"eval_steps_per_second": 0.033,
"step": 45
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005859375,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3875.0,
"completions/mean_length": 800.7396240234375,
"completions/mean_terminated_length": 781.317626953125,
"completions/min_length": 298.0,
"completions/min_terminated_length": 298.0,
"epoch": 0.2944,
"grad_norm": 0.0004724331956822425,
"learning_rate": 2.580645161290323e-06,
"loss": 0.0057,
"num_tokens": 73727672.0,
"reward": 1.1991007328033447,
"reward_std": 0.1694556474685669,
"rewards/accuracy_reward": 0.6555989384651184,
"rewards/brier_reward": 0.751053512096405,
"rewards/confidence_one_or_zero": 0.0006510416860692203,
"rewards/format_reward": 0.9915364384651184,
"rewards/mean_confidence_reward": 0.61962890625,
"step": 46
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.013671875,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3972.0,
"completions/mean_length": 870.7916870117188,
"completions/mean_terminated_length": 826.0858154296875,
"completions/min_length": 352.0,
"completions/min_terminated_length": 352.0,
"epoch": 0.3008,
"grad_norm": 0.00036135048139840364,
"learning_rate": 2.5e-06,
"loss": 0.013,
"num_tokens": 75592568.0,
"reward": 1.196855068206787,
"reward_std": 0.17891928553581238,
"rewards/accuracy_reward": 0.658203125,
"rewards/brier_reward": 0.7524215579032898,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9830729365348816,
"rewards/mean_confidence_reward": 0.612597644329071,
"step": 47
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01302083333333337,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3988.0,
"completions/mean_length": 891.2838745117188,
"completions/mean_terminated_length": 849.0053100585938,
"completions/min_length": 295.0,
"completions/min_terminated_length": 295.0,
"epoch": 0.3072,
"grad_norm": 0.0003015667898580432,
"learning_rate": 2.4193548387096776e-06,
"loss": 0.0081,
"num_tokens": 77494108.0,
"reward": 1.1583726406097412,
"reward_std": 0.1833227127790451,
"rewards/accuracy_reward": 0.599609375,
"rewards/brier_reward": 0.7366549372673035,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.98046875,
"rewards/mean_confidence_reward": 0.6122069954872131,
"step": 48
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 4058.0,
"completions/mean_length": 815.2884521484375,
"completions/mean_terminated_length": 802.4229125976562,
"completions/min_length": 269.0,
"completions/min_terminated_length": 269.0,
"epoch": 0.3136,
"grad_norm": 0.0004926570109091699,
"learning_rate": 2.338709677419355e-06,
"loss": 0.0089,
"num_tokens": 79275839.0,
"reward": 1.216859221458435,
"reward_std": 0.17143714427947998,
"rewards/accuracy_reward": 0.6796875,
"rewards/brier_reward": 0.7611801028251648,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9928385615348816,
"rewards/mean_confidence_reward": 0.6132161617279053,
"step": 49
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01171875,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3921.0,
"completions/mean_length": 844.986328125,
"completions/mean_terminated_length": 806.436767578125,
"completions/min_length": 245.0,
"completions/min_terminated_length": 245.0,
"epoch": 0.32,
"grad_norm": 0.00035185401793569326,
"learning_rate": 2.2580645161290324e-06,
"loss": 0.012,
"num_tokens": 81098514.0,
"reward": 1.1971240043640137,
"reward_std": 0.16831284761428833,
"rewards/accuracy_reward": 0.6484375,
"rewards/brier_reward": 0.7581682205200195,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9876301884651184,
"rewards/mean_confidence_reward": 0.6088216304779053,
"step": 50
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01171875,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 4029.0,
"completions/mean_length": 822.7623901367188,
"completions/mean_terminated_length": 783.9492797851562,
"completions/min_length": 297.0,
"completions/min_terminated_length": 297.0,
"epoch": 0.3264,
"grad_norm": 0.00039248185930773616,
"learning_rate": 2.17741935483871e-06,
"loss": 0.0135,
"num_tokens": 82885133.0,
"reward": 1.1891329288482666,
"reward_std": 0.17978250980377197,
"rewards/accuracy_reward": 0.642578125,
"rewards/brier_reward": 0.7493473887443542,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.986328125,
"rewards/mean_confidence_reward": 0.6084310412406921,
"step": 51
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00520833333333337,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 4008.0,
"completions/mean_length": 797.7025146484375,
"completions/mean_terminated_length": 780.4338989257812,
"completions/min_length": 264.0,
"completions/min_terminated_length": 264.0,
"epoch": 0.3328,
"grad_norm": 0.00032785398070700467,
"learning_rate": 2.096774193548387e-06,
"loss": 0.0063,
"num_tokens": 84640468.0,
"reward": 1.2012954950332642,
"reward_std": 0.15448780357837677,
"rewards/accuracy_reward": 0.65234375,
"rewards/brier_reward": 0.7567451596260071,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9934895634651184,
"rewards/mean_confidence_reward": 0.6180012822151184,
"step": 52
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00520833333333337,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3643.0,
"completions/mean_length": 829.0931396484375,
"completions/mean_terminated_length": 811.9888916015625,
"completions/min_length": 316.0,
"completions/min_terminated_length": 316.0,
"epoch": 0.3392,
"grad_norm": 0.000282296008663252,
"learning_rate": 2.0161290322580646e-06,
"loss": 0.0085,
"num_tokens": 86436099.0,
"reward": 1.2123968601226807,
"reward_std": 0.1636490523815155,
"rewards/accuracy_reward": 0.6712239384651184,
"rewards/brier_reward": 0.7594165802001953,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.994140625,
"rewards/mean_confidence_reward": 0.614550769329071,
"step": 53
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00716145833333337,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3653.0,
"completions/mean_length": 808.6530151367188,
"completions/mean_terminated_length": 784.9409790039062,
"completions/min_length": 301.0,
"completions/min_terminated_length": 301.0,
"epoch": 0.3456,
"grad_norm": 0.00033349485602229834,
"learning_rate": 1.935483870967742e-06,
"loss": 0.0093,
"num_tokens": 88202590.0,
"reward": 1.2161355018615723,
"reward_std": 0.1536397933959961,
"rewards/accuracy_reward": 0.6796875,
"rewards/brier_reward": 0.7610347867012024,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9915364384651184,
"rewards/mean_confidence_reward": 0.6111653447151184,
"step": 54
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00846354166666663,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 4063.0,
"completions/mean_length": 842.3548583984375,
"completions/mean_terminated_length": 814.5823974609375,
"completions/min_length": 339.0,
"completions/min_terminated_length": 339.0,
"epoch": 0.352,
"grad_norm": 0.0003919745213352144,
"learning_rate": 1.8548387096774196e-06,
"loss": 0.0085,
"num_tokens": 90024303.0,
"reward": 1.196488857269287,
"reward_std": 0.13503897190093994,
"rewards/accuracy_reward": 0.6458333134651184,
"rewards/brier_reward": 0.7568976283073425,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.990234375,
"rewards/mean_confidence_reward": 0.6165690422058105,
"step": 55
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.009765625,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3808.0,
"completions/mean_length": 905.5045776367188,
"completions/mean_terminated_length": 874.0401611328125,
"completions/min_length": 354.0,
"completions/min_terminated_length": 354.0,
"epoch": 0.3584,
"grad_norm": 0.00026986602460965514,
"learning_rate": 1.774193548387097e-06,
"loss": 0.0129,
"num_tokens": 91943406.0,
"reward": 1.2119539976119995,
"reward_std": 0.16923794150352478,
"rewards/accuracy_reward": 0.6725260615348816,
"rewards/brier_reward": 0.7630882263183594,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.98828125,
"rewards/mean_confidence_reward": 0.6124023795127869,
"step": 56
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 2897.0,
"completions/mean_length": 800.419921875,
"completions/mean_terminated_length": 787.49609375,
"completions/min_length": 233.0,
"completions/min_terminated_length": 233.0,
"epoch": 0.3648,
"grad_norm": 0.00032948493026196957,
"learning_rate": 1.6935483870967742e-06,
"loss": 0.0066,
"num_tokens": 93699179.0,
"reward": 1.2440311908721924,
"reward_std": 0.15248718857765198,
"rewards/accuracy_reward": 0.7135416865348816,
"rewards/brier_reward": 0.7790654301643372,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9954426884651184,
"rewards/mean_confidence_reward": 0.6213216185569763,
"step": 57
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00911458333333337,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 2625.0,
"completions/mean_length": 836.7357177734375,
"completions/mean_terminated_length": 806.7555541992188,
"completions/min_length": 325.0,
"completions/min_terminated_length": 325.0,
"epoch": 0.3712,
"grad_norm": 0.0003947715158574283,
"learning_rate": 1.6129032258064516e-06,
"loss": 0.0079,
"num_tokens": 95513693.0,
"reward": 1.222391128540039,
"reward_std": 0.17155036330223083,
"rewards/accuracy_reward": 0.689453125,
"rewards/brier_reward": 0.7650823593139648,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.990234375,
"rewards/mean_confidence_reward": 0.6200846433639526,
"step": 58
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 4043.0,
"completions/mean_length": 822.5768432617188,
"completions/mean_terminated_length": 796.8018188476562,
"completions/min_length": 318.0,
"completions/min_terminated_length": 318.0,
"epoch": 0.3776,
"grad_norm": 0.00048284404329024255,
"learning_rate": 1.5322580645161292e-06,
"loss": 0.0079,
"num_tokens": 97301227.0,
"reward": 1.1993268728256226,
"reward_std": 0.16091161966323853,
"rewards/accuracy_reward": 0.6484375,
"rewards/brier_reward": 0.7586672902107239,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9915364384651184,
"rewards/mean_confidence_reward": 0.6285482048988342,
"step": 59
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00651041666666663,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 4065.0,
"completions/mean_length": 824.0065307617188,
"completions/mean_terminated_length": 802.5648803710938,
"completions/min_length": 286.0,
"completions/min_terminated_length": 286.0,
"epoch": 0.384,
"grad_norm": 0.0003106553922407329,
"learning_rate": 1.4516129032258066e-06,
"loss": 0.0073,
"num_tokens": 99093813.0,
"reward": 1.191345453262329,
"reward_std": 0.16578087210655212,
"rewards/accuracy_reward": 0.6354166865348816,
"rewards/brier_reward": 0.7544229626655579,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9928385615348816,
"rewards/mean_confidence_reward": 0.6301106810569763,
"step": 60
},
{
"epoch": 0.384,
"eval_completions/clipped_ratio": 0.00923978365384616,
"eval_completions/max_length": 3989.375,
"eval_completions/max_terminated_length": 2687.625,
"eval_completions/mean_length": 851.3605804443359,
"eval_completions/mean_terminated_length": 821.00244140625,
"eval_completions/min_length": 356.875,
"eval_completions/min_terminated_length": 356.875,
"eval_loss": 0.0,
"eval_num_tokens": 99093813.0,
"eval_reward": 1.1956555992364883,
"eval_reward_std": 0.3222951777279377,
"eval_rewards/accuracy_reward": 0.6474609375,
"eval_rewards/brier_reward": 0.754579670727253,
"eval_rewards/confidence_one_or_zero": 0.0009765625,
"eval_rewards/format_reward": 0.9892578125,
"eval_rewards/mean_confidence_reward": 0.6375000327825546,
"eval_runtime": 268.1899,
"eval_samples_per_second": 3.729,
"eval_steps_per_second": 0.03,
"step": 60
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00651041666666663,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 4058.0,
"completions/mean_length": 868.3984375,
"completions/mean_terminated_length": 847.2477416992188,
"completions/min_length": 268.0,
"completions/min_terminated_length": 268.0,
"epoch": 0.3904,
"grad_norm": 0.0004904476809315383,
"learning_rate": 1.3709677419354838e-06,
"loss": 0.006,
"num_tokens": 100963601.0,
"reward": 1.16738760471344,
"reward_std": 0.15795522928237915,
"rewards/accuracy_reward": 0.59765625,
"rewards/brier_reward": 0.7455698847770691,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9915364384651184,
"rewards/mean_confidence_reward": 0.6270182132720947,
"step": 61
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005859375,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3785.0,
"completions/mean_length": 848.6139526367188,
"completions/mean_terminated_length": 829.47412109375,
"completions/min_length": 269.0,
"completions/min_terminated_length": 269.0,
"epoch": 0.3968,
"grad_norm": 0.00028476607985794544,
"learning_rate": 1.2903225806451614e-06,
"loss": 0.0107,
"num_tokens": 102794776.0,
"reward": 1.2071278095245361,
"reward_std": 0.1802365481853485,
"rewards/accuracy_reward": 0.6627604365348816,
"rewards/brier_reward": 0.7592945694923401,
"rewards/confidence_one_or_zero": 0.0006510416860692203,
"rewards/format_reward": 0.9921875,
"rewards/mean_confidence_reward": 0.644335925579071,
"step": 62
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00520833333333337,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3474.0,
"completions/mean_length": 817.5775146484375,
"completions/mean_terminated_length": 800.4129638671875,
"completions/min_length": 295.0,
"completions/min_terminated_length": 295.0,
"epoch": 0.4032,
"grad_norm": 0.0003588373656384647,
"learning_rate": 1.2096774193548388e-06,
"loss": 0.0048,
"num_tokens": 104576239.0,
"reward": 1.2228258848190308,
"reward_std": 0.15534567832946777,
"rewards/accuracy_reward": 0.6822916865348816,
"rewards/brier_reward": 0.7685551643371582,
"rewards/confidence_one_or_zero": 0.0006510416860692203,
"rewards/format_reward": 0.9947916865348816,
"rewards/mean_confidence_reward": 0.6515950560569763,
"step": 63
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0032552083333333703,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 4018.0,
"completions/mean_length": 847.7890625,
"completions/mean_terminated_length": 837.180908203125,
"completions/min_length": 300.0,
"completions/min_terminated_length": 300.0,
"epoch": 0.4096,
"grad_norm": 0.0002948266628663987,
"learning_rate": 1.1290322580645162e-06,
"loss": 0.0072,
"num_tokens": 106402923.0,
"reward": 1.2223950624465942,
"reward_std": 0.1734146773815155,
"rewards/accuracy_reward": 0.6790364384651184,
"rewards/brier_reward": 0.7715999484062195,
"rewards/confidence_one_or_zero": 0.0006510416860692203,
"rewards/format_reward": 0.994140625,
"rewards/mean_confidence_reward": 0.650585949420929,
"step": 64
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005859375,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 4043.0,
"completions/mean_length": 842.3639526367188,
"completions/mean_terminated_length": 823.1873168945312,
"completions/min_length": 266.0,
"completions/min_terminated_length": 266.0,
"epoch": 0.416,
"grad_norm": 0.00033330428414046764,
"learning_rate": 1.0483870967741936e-06,
"loss": 0.0057,
"num_tokens": 108227938.0,
"reward": 1.229150652885437,
"reward_std": 0.1722082495689392,
"rewards/accuracy_reward": 0.69140625,
"rewards/brier_reward": 0.7746941447257996,
"rewards/confidence_one_or_zero": 0.0006510416860692203,
"rewards/format_reward": 0.9921875,
"rewards/mean_confidence_reward": 0.6650065183639526,
"step": 65
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00911458333333337,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3889.0,
"completions/mean_length": 864.37109375,
"completions/mean_terminated_length": 834.6452026367188,
"completions/min_length": 313.0,
"completions/min_terminated_length": 313.0,
"epoch": 0.4224,
"grad_norm": 0.0002921877894550562,
"learning_rate": 9.67741935483871e-07,
"loss": 0.0121,
"num_tokens": 110081268.0,
"reward": 1.2018119096755981,
"reward_std": 0.18655282258987427,
"rewards/accuracy_reward": 0.6614583134651184,
"rewards/brier_reward": 0.754521906375885,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9876301884651184,
"rewards/mean_confidence_reward": 0.6583333015441895,
"step": 66
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 4092.0,
"completions/mean_length": 847.9525146484375,
"completions/mean_terminated_length": 822.3773193359375,
"completions/min_length": 340.0,
"completions/min_terminated_length": 340.0,
"epoch": 0.4288,
"grad_norm": 0.0003183463413733989,
"learning_rate": 8.870967741935485e-07,
"loss": 0.0099,
"num_tokens": 111907387.0,
"reward": 1.220888614654541,
"reward_std": 0.17330679297447205,
"rewards/accuracy_reward": 0.6829426884651184,
"rewards/brier_reward": 0.7698888778686523,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9889323115348816,
"rewards/mean_confidence_reward": 0.66845703125,
"step": 67
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.005859375,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3947.0,
"completions/mean_length": 811.447265625,
"completions/mean_terminated_length": 792.0884399414062,
"completions/min_length": 301.0,
"completions/min_terminated_length": 301.0,
"epoch": 0.4352,
"grad_norm": 0.0003066919161938131,
"learning_rate": 8.064516129032258e-07,
"loss": 0.0113,
"num_tokens": 113682274.0,
"reward": 1.2066129446029663,
"reward_std": 0.17153900861740112,
"rewards/accuracy_reward": 0.6595051884651184,
"rewards/brier_reward": 0.7628219127655029,
"rewards/confidence_one_or_zero": 0.0006510416860692203,
"rewards/format_reward": 0.9908854365348816,
"rewards/mean_confidence_reward": 0.6674153804779053,
"step": 68
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00846354166666663,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 4090.0,
"completions/mean_length": 842.0716552734375,
"completions/mean_terminated_length": 814.2968139648438,
"completions/min_length": 243.0,
"completions/min_terminated_length": 243.0,
"epoch": 0.4416,
"grad_norm": 0.00030422816053032875,
"learning_rate": 7.258064516129033e-07,
"loss": 0.0107,
"num_tokens": 115503464.0,
"reward": 1.1876566410064697,
"reward_std": 0.18401162326335907,
"rewards/accuracy_reward": 0.6399739384651184,
"rewards/brier_reward": 0.7496488690376282,
"rewards/confidence_one_or_zero": 0.0006510416860692203,
"rewards/format_reward": 0.9856770634651184,
"rewards/mean_confidence_reward": 0.6674153804779053,
"step": 69
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00651041666666663,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3748.0,
"completions/mean_length": 841.5787963867188,
"completions/mean_terminated_length": 820.2523193359375,
"completions/min_length": 267.0,
"completions/min_terminated_length": 267.0,
"epoch": 0.448,
"grad_norm": 0.000367781613022089,
"learning_rate": 6.451612903225807e-07,
"loss": 0.0075,
"num_tokens": 117324129.0,
"reward": 1.2296011447906494,
"reward_std": 0.18445131182670593,
"rewards/accuracy_reward": 0.6920573115348816,
"rewards/brier_reward": 0.7742926478385925,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9928385615348816,
"rewards/mean_confidence_reward": 0.6756184697151184,
"step": 70
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3907.0,
"completions/mean_length": 838.1243896484375,
"completions/mean_terminated_length": 812.4718017578125,
"completions/min_length": 315.0,
"completions/min_terminated_length": 315.0,
"epoch": 0.4544,
"grad_norm": 0.00028708679019473493,
"learning_rate": 5.645161290322581e-07,
"loss": 0.009,
"num_tokens": 119133696.0,
"reward": 1.2450575828552246,
"reward_std": 0.16368097066879272,
"rewards/accuracy_reward": 0.7161458134651184,
"rewards/brier_reward": 0.7837212681770325,
"rewards/confidence_one_or_zero": 0.0006510416860692203,
"rewards/format_reward": 0.990234375,
"rewards/mean_confidence_reward": 0.6800456047058105,
"step": 71
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00455729166666663,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3896.0,
"completions/mean_length": 818.3978271484375,
"completions/mean_terminated_length": 803.3923950195312,
"completions/min_length": 315.0,
"completions/min_terminated_length": 315.0,
"epoch": 0.4608,
"grad_norm": 0.00031864107586443424,
"learning_rate": 4.838709677419355e-07,
"loss": 0.0054,
"num_tokens": 120919331.0,
"reward": 1.1747868061065674,
"reward_std": 0.18735384941101074,
"rewards/accuracy_reward": 0.61328125,
"rewards/brier_reward": 0.7434401512145996,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9928385615348816,
"rewards/mean_confidence_reward": 0.673046886920929,
"step": 72
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 4067.0,
"completions/mean_length": 844.669921875,
"completions/mean_terminated_length": 819.0689086914062,
"completions/min_length": 270.0,
"completions/min_terminated_length": 270.0,
"epoch": 0.4672,
"grad_norm": 0.00035896478220820427,
"learning_rate": 4.032258064516129e-07,
"loss": 0.0087,
"num_tokens": 122735848.0,
"reward": 1.204715609550476,
"reward_std": 0.16531410813331604,
"rewards/accuracy_reward": 0.6608073115348816,
"rewards/brier_reward": 0.759026825428009,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9895833134651184,
"rewards/mean_confidence_reward": 0.6822916865348816,
"step": 73
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001953125,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 4015.0,
"completions/mean_length": 792.2806396484375,
"completions/mean_terminated_length": 785.8154296875,
"completions/min_length": 260.0,
"completions/min_terminated_length": 260.0,
"epoch": 0.4736,
"grad_norm": 0.0002979944401886314,
"learning_rate": 3.2258064516129035e-07,
"loss": 0.0069,
"num_tokens": 124476335.0,
"reward": 1.2245442867279053,
"reward_std": 0.15666741132736206,
"rewards/accuracy_reward": 0.6842448115348816,
"rewards/brier_reward": 0.7693870067596436,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9954426884651184,
"rewards/mean_confidence_reward": 0.6906575560569763,
"step": 74
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00846354166666663,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 4029.0,
"completions/mean_length": 839.03515625,
"completions/mean_terminated_length": 811.2344360351562,
"completions/min_length": 300.0,
"completions/min_terminated_length": 300.0,
"epoch": 0.48,
"grad_norm": 0.0003798941324930638,
"learning_rate": 2.4193548387096775e-07,
"loss": 0.0081,
"num_tokens": 126287573.0,
"reward": 1.1904067993164062,
"reward_std": 0.1817515790462494,
"rewards/accuracy_reward": 0.6380208134651184,
"rewards/brier_reward": 0.752544641494751,
"rewards/confidence_one_or_zero": 0.0006510416860692203,
"rewards/format_reward": 0.990234375,
"rewards/mean_confidence_reward": 0.6768555045127869,
"step": 75
},
{
"epoch": 0.48,
"eval_completions/clipped_ratio": 0.0078125,
"eval_completions/max_length": 3553.25,
"eval_completions/max_terminated_length": 2050.125,
"eval_completions/mean_length": 821.1019439697266,
"eval_completions/mean_terminated_length": 795.3644561767578,
"eval_completions/min_length": 353.0,
"eval_completions/min_terminated_length": 353.0,
"eval_loss": 0.0,
"eval_num_tokens": 126287573.0,
"eval_reward": 1.2085177600383759,
"eval_reward_std": 0.3346817120909691,
"eval_rewards/accuracy_reward": 0.6630859375,
"eval_rewards/brier_reward": 0.7627248838543892,
"eval_rewards/confidence_one_or_zero": 0.0,
"eval_rewards/format_reward": 0.9912109375,
"eval_rewards/mean_confidence_reward": 0.6843261867761612,
"eval_runtime": 256.583,
"eval_samples_per_second": 3.897,
"eval_steps_per_second": 0.031,
"step": 75
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0032552083333333703,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 4076.0,
"completions/mean_length": 809.9642333984375,
"completions/mean_terminated_length": 799.2324829101562,
"completions/min_length": 260.0,
"completions/min_terminated_length": 260.0,
"epoch": 0.4864,
"grad_norm": 0.00029650668147951365,
"learning_rate": 1.6129032258064518e-07,
"loss": 0.0061,
"num_tokens": 128053894.0,
"reward": 1.2499312162399292,
"reward_std": 0.1748509407043457,
"rewards/accuracy_reward": 0.71875,
"rewards/brier_reward": 0.7869578003883362,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.994140625,
"rewards/mean_confidence_reward": 0.6907551884651184,
"step": 76
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3931.0,
"completions/mean_length": 817.1484375,
"completions/mean_terminated_length": 791.3306884765625,
"completions/min_length": 268.0,
"completions/min_terminated_length": 268.0,
"epoch": 0.4928,
"grad_norm": 0.0005250805406831205,
"learning_rate": 8.064516129032259e-08,
"loss": 0.0072,
"num_tokens": 129832370.0,
"reward": 1.238200068473816,
"reward_std": 0.16415183246135712,
"rewards/accuracy_reward": 0.7037760615348816,
"rewards/brier_reward": 0.7836779952049255,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9889323115348816,
"rewards/mean_confidence_reward": 0.681835949420929,
"step": 77
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0032552083333333703,
"completions/max_length": 4096.0,
"completions/max_terminated_length": 3949.0,
"completions/mean_length": 827.0423583984375,
"completions/mean_terminated_length": 816.3663940429688,
"completions/min_length": 282.0,
"completions/min_terminated_length": 282.0,
"epoch": 0.4992,
"grad_norm": 0.0002979112323373556,
"learning_rate": 0.0,
"loss": 0.0047,
"num_tokens": 131631147.0,
"reward": 1.1954009532928467,
"reward_std": 0.17390400171279907,
"rewards/accuracy_reward": 0.6438801884651184,
"rewards/brier_reward": 0.7527675032615662,
"rewards/confidence_one_or_zero": 0.0006510416860692203,
"rewards/format_reward": 0.994140625,
"rewards/mean_confidence_reward": 0.673828125,
"step": 78
},
{
"epoch": 0.4992,
"step": 78,
"total_flos": 0.0,
"train_loss": 0.01258836815563532,
"train_runtime": 18117.4389,
"train_samples_per_second": 0.828,
"train_steps_per_second": 0.004
}
],
"logging_steps": 1,
"max_steps": 78,
"num_input_tokens_seen": 131631147,
"num_train_epochs": 1,
"save_steps": 60,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 0.0,
"train_batch_size": 3,
"trial_name": null,
"trial_params": null
}