{ "best_metric": null, "best_model_checkpoint": null, "epoch": 0.4992, "eval_steps": 15, "global_step": 78, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.02018229166666663, "completions/max_length": 4096.0, "completions/max_terminated_length": 3811.0, "completions/mean_length": 628.982421875, "completions/mean_terminated_length": 557.5687255859375, "completions/min_length": 2.0, "completions/min_terminated_length": 2.0, "epoch": 0.0064, "grad_norm": 0.0038886398542672396, "learning_rate": 3.125e-07, "loss": 0.0018, "num_tokens": 1493533.0, "reward": 0.5428099632263184, "reward_std": 0.5042912364006042, "rewards/accuracy_reward": 0.2421875, "rewards/brier_reward": 0.26072490215301514, "rewards/confidence_one_or_zero": 0.484375, "rewards/format_reward": 0.5826823115348816, "rewards/mean_confidence_reward": 0.7791340947151184, "step": 1 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.02278645833333337, "completions/max_length": 4096.0, "completions/max_terminated_length": 3898.0, "completions/mean_length": 652.9889526367188, "completions/mean_terminated_length": 572.70556640625, "completions/min_length": 2.0, "completions/min_terminated_length": 2.0, "epoch": 0.0128, "grad_norm": 0.0040999785996973515, "learning_rate": 6.25e-07, "loss": 0.0057, "num_tokens": 3025932.0, "reward": 0.5687162280082703, "reward_std": 0.5238062739372253, "rewards/accuracy_reward": 0.26171875, "rewards/brier_reward": 0.27868345379829407, "rewards/confidence_one_or_zero": 0.462890625, "rewards/format_reward": 0.5970051884651184, "rewards/mean_confidence_reward": 0.7861537337303162, "step": 2 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.02734375, "completions/max_length": 4096.0, "completions/max_terminated_length": 4025.0, "completions/mean_length": 669.513671875, "completions/mean_terminated_length": 573.186767578125, "completions/min_length": 4.0, "completions/min_terminated_length": 4.0, "epoch": 0.0192, "grad_norm": 0.0031686064321547747, "learning_rate": 9.375000000000001e-07, "loss": 0.0057, "num_tokens": 4587753.0, "reward": 0.5346394181251526, "reward_std": 0.5223636627197266, "rewards/accuracy_reward": 0.2356770783662796, "rewards/brier_reward": 0.2515455484390259, "rewards/confidence_one_or_zero": 0.46484375, "rewards/format_reward": 0.58203125, "rewards/mean_confidence_reward": 0.7804492115974426, "step": 3 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.02018229166666663, "completions/max_length": 4096.0, "completions/max_terminated_length": 3710.0, "completions/mean_length": 577.6556396484375, "completions/mean_terminated_length": 505.1846923828125, "completions/min_length": 2.0, "completions/min_terminated_length": 2.0, "epoch": 0.0256, "grad_norm": 0.004336833488196135, "learning_rate": 1.25e-06, "loss": 0.0067, "num_tokens": 5990368.0, "reward": 0.6042205095291138, "reward_std": 0.5315096378326416, "rewards/accuracy_reward": 0.26953125, "rewards/brier_reward": 0.28914394974708557, "rewards/confidence_one_or_zero": 0.4720052182674408, "rewards/format_reward": 0.6497395634651184, "rewards/mean_confidence_reward": 0.8320702910423279, "step": 4 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.02734375, "completions/max_length": 4096.0, "completions/max_terminated_length": 4044.0, "completions/mean_length": 626.986328125, "completions/mean_terminated_length": 529.4638671875, "completions/min_length": 2.0, "completions/min_terminated_length": 2.0, "epoch": 0.032, "grad_norm": 0.0029928558506071568, "learning_rate": 1.5625e-06, "loss": 0.0152, "num_tokens": 7480635.0, "reward": 0.5699490308761597, "reward_std": 0.4995768070220947, "rewards/accuracy_reward": 0.2473958283662796, "rewards/brier_reward": 0.2661750018596649, "rewards/confidence_one_or_zero": 0.4622395932674408, "rewards/format_reward": 0.6263020634651184, "rewards/mean_confidence_reward": 0.7925998568534851, "step": 5 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.02864583333333337, "completions/max_length": 4096.0, "completions/max_terminated_length": 4090.0, "completions/mean_length": 620.4850463867188, "completions/mean_terminated_length": 517.989990234375, "completions/min_length": 6.0, "completions/min_terminated_length": 6.0, "epoch": 0.0384, "grad_norm": 0.0024268238339573145, "learning_rate": 1.8750000000000003e-06, "loss": 0.0111, "num_tokens": 8962748.0, "reward": 0.6401253938674927, "reward_std": 0.47264236211776733, "rewards/accuracy_reward": 0.2584635317325592, "rewards/brier_reward": 0.291294127702713, "rewards/confidence_one_or_zero": 0.412109375, "rewards/format_reward": 0.73046875, "rewards/mean_confidence_reward": 0.8003639578819275, "step": 6 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.03776041666666663, "completions/max_length": 4096.0, "completions/max_terminated_length": 4056.0, "completions/mean_length": 631.2454833984375, "completions/mean_terminated_length": 495.28076171875, "completions/min_length": 2.0, "completions/min_terminated_length": 2.0, "epoch": 0.0448, "grad_norm": 0.0012339478125795722, "learning_rate": 2.1875000000000002e-06, "loss": 0.0245, "num_tokens": 10463269.0, "reward": 0.7111533880233765, "reward_std": 0.4298191964626312, "rewards/accuracy_reward": 0.2981770932674408, "rewards/brier_reward": 0.3239741623401642, "rewards/confidence_one_or_zero": 0.4348958432674408, "rewards/format_reward": 0.8001301884651184, "rewards/mean_confidence_reward": 0.8242577910423279, "step": 7 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.03776041666666663, "completions/max_length": 4096.0, "completions/max_terminated_length": 4065.0, "completions/mean_length": 611.55859375, "completions/mean_terminated_length": 474.82135009765625, "completions/min_length": 74.0, "completions/min_terminated_length": 74.0, "epoch": 0.0512, "grad_norm": 0.0042218598537147045, "learning_rate": 2.5e-06, "loss": 0.0232, "num_tokens": 11926127.0, "reward": 0.7340978384017944, "reward_std": 0.4097265899181366, "rewards/accuracy_reward": 0.2819010317325592, "rewards/brier_reward": 0.31322193145751953, "rewards/confidence_one_or_zero": 0.4231770932674408, "rewards/format_reward": 0.873046875, "rewards/mean_confidence_reward": 0.8644980788230896, "step": 8 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.021484375, "completions/max_length": 4096.0, "completions/max_terminated_length": 3906.0, "completions/mean_length": 540.412109375, "completions/mean_terminated_length": 462.3453063964844, "completions/min_length": 76.0, "completions/min_terminated_length": 76.0, "epoch": 0.0576, "grad_norm": 0.0011289231479167938, "learning_rate": 2.8125e-06, "loss": 0.0141, "num_tokens": 13287880.0, "reward": 0.8242492079734802, "reward_std": 0.44039151072502136, "rewards/accuracy_reward": 0.35546875, "rewards/brier_reward": 0.38935914635658264, "rewards/confidence_one_or_zero": 0.34375, "rewards/format_reward": 0.9036458134651184, "rewards/mean_confidence_reward": 0.8846094012260437, "step": 9 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.05078125, "completions/max_length": 4096.0, "completions/max_terminated_length": 4091.0, "completions/mean_length": 632.6569213867188, "completions/mean_terminated_length": 447.37518310546875, "completions/min_length": 83.0, "completions/min_terminated_length": 83.0, "epoch": 0.064, "grad_norm": 0.001107793883420527, "learning_rate": 3.125e-06, "loss": 0.041, "num_tokens": 14795001.0, "reward": 0.7957136034965515, "reward_std": 0.41083693504333496, "rewards/accuracy_reward": 0.322265625, "rewards/brier_reward": 0.3674457371234894, "rewards/confidence_one_or_zero": 0.3001302182674408, "rewards/format_reward": 0.9016926884651184, "rewards/mean_confidence_reward": 0.8539149165153503, "step": 10 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.064453125, "completions/max_length": 4096.0, "completions/max_terminated_length": 4028.0, "completions/mean_length": 673.1575927734375, "completions/mean_terminated_length": 437.3458557128906, "completions/min_length": 92.0, "completions/min_terminated_length": 92.0, "epoch": 0.0704, "grad_norm": 0.0021554373670369387, "learning_rate": 3.4375e-06, "loss": 0.0489, "num_tokens": 16356387.0, "reward": 0.8237268328666687, "reward_std": 0.38636907935142517, "rewards/accuracy_reward": 0.3391927182674408, "rewards/brier_reward": 0.398082971572876, "rewards/confidence_one_or_zero": 0.2447916716337204, "rewards/format_reward": 0.91015625, "rewards/mean_confidence_reward": 0.8387824892997742, "step": 11 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.06901041666666663, "completions/max_length": 4096.0, "completions/max_terminated_length": 3987.0, "completions/mean_length": 717.953125, "completions/mean_terminated_length": 467.5524597167969, "completions/min_length": 66.0, "completions/min_terminated_length": 66.0, "epoch": 0.0768, "grad_norm": 0.000843795423861593, "learning_rate": 3.7500000000000005e-06, "loss": 0.0607, "num_tokens": 17981043.0, "reward": 0.8221524953842163, "reward_std": 0.39118266105651855, "rewards/accuracy_reward": 0.3385416567325592, "rewards/brier_reward": 0.3962376117706299, "rewards/confidence_one_or_zero": 0.1875, "rewards/format_reward": 0.9095051884651184, "rewards/mean_confidence_reward": 0.8306503891944885, "step": 12 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.04296875, "completions/max_length": 4096.0, "completions/max_terminated_length": 4043.0, "completions/mean_length": 598.2396240234375, "completions/mean_terminated_length": 441.1972961425781, "completions/min_length": 92.0, "completions/min_terminated_length": 92.0, "epoch": 0.0832, "grad_norm": 0.0009227065020240843, "learning_rate": 4.0625000000000005e-06, "loss": 0.032, "num_tokens": 19423875.0, "reward": 0.9058957099914551, "reward_std": 0.3866400718688965, "rewards/accuracy_reward": 0.4010416567325592, "rewards/brier_reward": 0.46476590633392334, "rewards/confidence_one_or_zero": 0.1666666716337204, "rewards/format_reward": 0.9459635615348816, "rewards/mean_confidence_reward": 0.8527408242225647, "step": 13 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01953125, "completions/max_length": 4096.0, "completions/max_terminated_length": 4013.0, "completions/mean_length": 517.3671875, "completions/mean_terminated_length": 446.0796813964844, "completions/min_length": 85.0, "completions/min_terminated_length": 85.0, "epoch": 0.0896, "grad_norm": 0.0012902182061225176, "learning_rate": 4.3750000000000005e-06, "loss": 0.0167, "num_tokens": 20744551.0, "reward": 0.998481273651123, "reward_std": 0.3551454246044159, "rewards/accuracy_reward": 0.4713541567325592, "rewards/brier_reward": 0.5503284931182861, "rewards/confidence_one_or_zero": 0.1106770858168602, "rewards/format_reward": 0.9752604365348816, "rewards/mean_confidence_reward": 0.8616471290588379, "step": 14 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01106770833333337, "completions/max_length": 4096.0, "completions/max_terminated_length": 3922.0, "completions/mean_length": 513.7825927734375, "completions/mean_terminated_length": 473.69189453125, "completions/min_length": 115.0, "completions/min_terminated_length": 115.0, "epoch": 0.096, "grad_norm": 0.001505257561802864, "learning_rate": 4.6875000000000004e-06, "loss": 0.0147, "num_tokens": 22067089.0, "reward": 1.0049607753753662, "reward_std": 0.3260785639286041, "rewards/accuracy_reward": 0.4654947817325592, "rewards/brier_reward": 0.5593823194503784, "rewards/confidence_one_or_zero": 0.060546875, "rewards/format_reward": 0.9850260615348816, "rewards/mean_confidence_reward": 0.8561978340148926, "step": 15 }, { "epoch": 0.096, "eval_completions/clipped_ratio": 0.01021634615384616, "eval_completions/max_length": 4096.0, "eval_completions/max_terminated_length": 2151.375, "eval_completions/mean_length": 530.8136291503906, "eval_completions/mean_terminated_length": 493.9981918334961, "eval_completions/min_length": 145.125, "eval_completions/min_terminated_length": 145.125, "eval_loss": 0.0, "eval_num_tokens": 22067089.0, "eval_reward": 1.0130146145820618, "eval_reward_std": 0.45545171946287155, "eval_rewards/accuracy_reward": 0.4677734375, "eval_rewards/brier_reward": 0.5719102919101715, "eval_rewards/confidence_one_or_zero": 0.0302734375, "eval_rewards/format_reward": 0.986328125, "eval_rewards/mean_confidence_reward": 0.8396484181284904, "eval_runtime": 267.3219, "eval_samples_per_second": 3.741, "eval_steps_per_second": 0.03, "step": 15 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005859375, "completions/max_length": 4096.0, "completions/max_terminated_length": 3982.0, "completions/mean_length": 502.87109375, "completions/mean_terminated_length": 481.6935119628906, "completions/min_length": 112.0, "completions/min_terminated_length": 112.0, "epoch": 0.1024, "grad_norm": 0.0018715404439717531, "learning_rate": 5e-06, "loss": 0.0032, "num_tokens": 23372811.0, "reward": 1.067986249923706, "reward_std": 0.3171144723892212, "rewards/accuracy_reward": 0.5260416865348816, "rewards/brier_reward": 0.6183767914772034, "rewards/confidence_one_or_zero": 0.029296875, "rewards/format_reward": 0.9915364384651184, "rewards/mean_confidence_reward": 0.8487825393676758, "step": 16 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0078125, "completions/max_length": 4096.0, "completions/max_terminated_length": 4042.0, "completions/mean_length": 542.2838745117188, "completions/mean_terminated_length": 514.3018188476562, "completions/min_length": 115.0, "completions/min_terminated_length": 115.0, "epoch": 0.1088, "grad_norm": 0.000804521725513041, "learning_rate": 4.919354838709678e-06, "loss": 0.0099, "num_tokens": 24736391.0, "reward": 1.0146701335906982, "reward_std": 0.2993273138999939, "rewards/accuracy_reward": 0.4596354067325592, "rewards/brier_reward": 0.5794537663459778, "rewards/confidence_one_or_zero": 0.012369791977107525, "rewards/format_reward": 0.990234375, "rewards/mean_confidence_reward": 0.8174610137939453, "step": 17 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00911458333333337, "completions/max_length": 4096.0, "completions/max_terminated_length": 4072.0, "completions/mean_length": 573.2369995117188, "completions/mean_terminated_length": 540.8331298828125, "completions/min_length": 147.0, "completions/min_terminated_length": 147.0, "epoch": 0.1152, "grad_norm": 0.0046823653392493725, "learning_rate": 4.838709677419355e-06, "loss": 0.011, "num_tokens": 26138787.0, "reward": 1.0647892951965332, "reward_std": 0.2827242612838745, "rewards/accuracy_reward": 0.5130208134651184, "rewards/brier_reward": 0.6282604336738586, "rewards/confidence_one_or_zero": 0.0032552082557231188, "rewards/format_reward": 0.98828125, "rewards/mean_confidence_reward": 0.8041470646858215, "step": 18 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00846354166666663, "completions/max_length": 4096.0, "completions/max_terminated_length": 4086.0, "completions/mean_length": 565.6256713867188, "completions/mean_terminated_length": 535.4911499023438, "completions/min_length": 155.0, "completions/min_terminated_length": 155.0, "epoch": 0.1216, "grad_norm": 0.0006344782887026668, "learning_rate": 4.758064516129033e-06, "loss": 0.0114, "num_tokens": 27535140.0, "reward": 1.060068130493164, "reward_std": 0.26595863699913025, "rewards/accuracy_reward": 0.49609375, "rewards/brier_reward": 0.6344431638717651, "rewards/confidence_one_or_zero": 0.005859375, "rewards/format_reward": 0.9895833134651184, "rewards/mean_confidence_reward": 0.7843945026397705, "step": 19 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00846354166666663, "completions/max_length": 4096.0, "completions/max_terminated_length": 3894.0, "completions/mean_length": 588.1354370117188, "completions/mean_terminated_length": 558.1930541992188, "completions/min_length": 112.0, "completions/min_terminated_length": 112.0, "epoch": 0.128, "grad_norm": 0.0005923378048464656, "learning_rate": 4.67741935483871e-06, "loss": 0.0096, "num_tokens": 28963140.0, "reward": 1.1038968563079834, "reward_std": 0.25995469093322754, "rewards/accuracy_reward": 0.54296875, "rewards/brier_reward": 0.6745752692222595, "rewards/confidence_one_or_zero": 0.0013020833721384406, "rewards/format_reward": 0.990234375, "rewards/mean_confidence_reward": 0.7578775882720947, "step": 20 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01106770833333337, "completions/max_length": 4096.0, "completions/max_terminated_length": 4069.0, "completions/mean_length": 655.8561401367188, "completions/mean_terminated_length": 617.35546875, "completions/min_length": 193.0, "completions/min_terminated_length": 193.0, "epoch": 0.1344, "grad_norm": 0.0005457309307530522, "learning_rate": 4.596774193548387e-06, "loss": 0.0119, "num_tokens": 30497791.0, "reward": 1.1018186807632446, "reward_std": 0.26623260974884033, "rewards/accuracy_reward": 0.5384114384651184, "rewards/brier_reward": 0.6788830161094666, "rewards/confidence_one_or_zero": 0.0013020833721384406, "rewards/format_reward": 0.986328125, "rewards/mean_confidence_reward": 0.7308397889137268, "step": 21 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.009765625, "completions/max_length": 4096.0, "completions/max_terminated_length": 4039.0, "completions/mean_length": 623.337890625, "completions/mean_terminated_length": 589.0907592773438, "completions/min_length": 188.0, "completions/min_terminated_length": 188.0, "epoch": 0.1408, "grad_norm": 0.0004921160289086401, "learning_rate": 4.516129032258065e-06, "loss": 0.0089, "num_tokens": 31977526.0, "reward": 1.1192352771759033, "reward_std": 0.24459850788116455, "rewards/accuracy_reward": 0.548828125, "rewards/brier_reward": 0.7006959915161133, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9889323115348816, "rewards/mean_confidence_reward": 0.7082682251930237, "step": 22 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.021484375, "completions/max_length": 4096.0, "completions/max_terminated_length": 3659.0, "completions/mean_length": 730.2272338867188, "completions/mean_terminated_length": 656.3280029296875, "completions/min_length": 146.0, "completions/min_terminated_length": 146.0, "epoch": 0.1472, "grad_norm": 0.00045825468259863555, "learning_rate": 4.435483870967742e-06, "loss": 0.0265, "num_tokens": 33632619.0, "reward": 1.099420428276062, "reward_std": 0.2596912682056427, "rewards/accuracy_reward": 0.5286458134651184, "rewards/brier_reward": 0.6923167705535889, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9778645634651184, "rewards/mean_confidence_reward": 0.6766145825386047, "step": 23 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00651041666666663, "completions/max_length": 4096.0, "completions/max_terminated_length": 4045.0, "completions/mean_length": 672.66796875, "completions/mean_terminated_length": 650.234619140625, "completions/min_length": 128.0, "completions/min_terminated_length": 128.0, "epoch": 0.1536, "grad_norm": 0.00042477657552808523, "learning_rate": 4.35483870967742e-06, "loss": 0.012, "num_tokens": 35190149.0, "reward": 1.1733596324920654, "reward_std": 0.20008432865142822, "rewards/accuracy_reward": 0.6145833134651184, "rewards/brier_reward": 0.7399346828460693, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9921875, "rewards/mean_confidence_reward": 0.6804882884025574, "step": 24 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.013671875, "completions/max_length": 4096.0, "completions/max_terminated_length": 3768.0, "completions/mean_length": 694.091796875, "completions/mean_terminated_length": 646.9366455078125, "completions/min_length": 178.0, "completions/min_terminated_length": 178.0, "epoch": 0.16, "grad_norm": 0.0006669931462965906, "learning_rate": 4.274193548387097e-06, "loss": 0.0134, "num_tokens": 36776882.0, "reward": 1.1462349891662598, "reward_std": 0.21996283531188965, "rewards/accuracy_reward": 0.583984375, "rewards/brier_reward": 0.7240970730781555, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.984375, "rewards/mean_confidence_reward": 0.6663411259651184, "step": 25 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01171875, "completions/max_length": 4096.0, "completions/max_terminated_length": 4039.0, "completions/mean_length": 717.0736083984375, "completions/mean_terminated_length": 677.0072631835938, "completions/min_length": 216.0, "completions/min_terminated_length": 216.0, "epoch": 0.1664, "grad_norm": 0.0005606704507954419, "learning_rate": 4.193548387096774e-06, "loss": 0.014, "num_tokens": 38406939.0, "reward": 1.1402171850204468, "reward_std": 0.2176455706357956, "rewards/accuracy_reward": 0.5696614384651184, "rewards/brier_reward": 0.7237804532051086, "rewards/confidence_one_or_zero": 0.0006510416860692203, "rewards/format_reward": 0.9869791865348816, "rewards/mean_confidence_reward": 0.6502603888511658, "step": 26 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01041666666666663, "completions/max_length": 4096.0, "completions/max_terminated_length": 3556.0, "completions/mean_length": 687.1803588867188, "completions/mean_terminated_length": 651.2980346679688, "completions/min_length": 202.0, "completions/min_terminated_length": 202.0, "epoch": 0.1728, "grad_norm": 0.0006814564112573862, "learning_rate": 4.112903225806452e-06, "loss": 0.0147, "num_tokens": 39981584.0, "reward": 1.1993398666381836, "reward_std": 0.2010936439037323, "rewards/accuracy_reward": 0.6516926884651184, "rewards/brier_reward": 0.7580418586730957, "rewards/confidence_one_or_zero": 0.0006510416860692203, "rewards/format_reward": 0.9889323115348816, "rewards/mean_confidence_reward": 0.64892578125, "step": 27 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01432291666666663, "completions/max_length": 4096.0, "completions/max_terminated_length": 3948.0, "completions/mean_length": 771.43359375, "completions/mean_terminated_length": 723.1242065429688, "completions/min_length": 222.0, "completions/min_terminated_length": 222.0, "epoch": 0.1792, "grad_norm": 0.00036876313970424235, "learning_rate": 4.032258064516129e-06, "loss": 0.0179, "num_tokens": 41691994.0, "reward": 1.1750237941741943, "reward_std": 0.20402050018310547, "rewards/accuracy_reward": 0.6276041865348816, "rewards/brier_reward": 0.740008533000946, "rewards/confidence_one_or_zero": 0.0006510416860692203, "rewards/format_reward": 0.982421875, "rewards/mean_confidence_reward": 0.6476757526397705, "step": 28 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.015625, "completions/max_length": 4096.0, "completions/max_terminated_length": 4068.0, "completions/mean_length": 777.306640625, "completions/mean_terminated_length": 724.6289672851562, "completions/min_length": 213.0, "completions/min_terminated_length": 213.0, "epoch": 0.1856, "grad_norm": 0.0007213709177449346, "learning_rate": 3.951612903225807e-06, "loss": 0.0156, "num_tokens": 43404393.0, "reward": 1.155902624130249, "reward_std": 0.2094547003507614, "rewards/accuracy_reward": 0.6041666865348816, "rewards/brier_reward": 0.725203812122345, "rewards/confidence_one_or_zero": 0.0006510416860692203, "rewards/format_reward": 0.982421875, "rewards/mean_confidence_reward": 0.6395507454872131, "step": 29 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01627604166666663, "completions/max_length": 4096.0, "completions/max_terminated_length": 4005.0, "completions/mean_length": 816.4284057617188, "completions/mean_terminated_length": 762.166748046875, "completions/min_length": 254.0, "completions/min_terminated_length": 254.0, "epoch": 0.192, "grad_norm": 0.00035084618139080703, "learning_rate": 3.870967741935484e-06, "loss": 0.0175, "num_tokens": 45180819.0, "reward": 1.140360713005066, "reward_std": 0.20701651275157928, "rewards/accuracy_reward": 0.5807291865348816, "rewards/brier_reward": 0.721463680267334, "rewards/confidence_one_or_zero": 0.0006510416860692203, "rewards/format_reward": 0.978515625, "rewards/mean_confidence_reward": 0.6374218463897705, "step": 30 }, { "epoch": 0.192, "eval_completions/clipped_ratio": 0.01171875, "eval_completions/max_length": 3679.75, "eval_completions/max_terminated_length": 2834.875, "eval_completions/mean_length": 781.9544067382812, "eval_completions/mean_terminated_length": 742.5631256103516, "eval_completions/min_length": 303.25, "eval_completions/min_terminated_length": 303.25, "eval_loss": 0.0, "eval_num_tokens": 45180819.0, "eval_reward": 1.1743015497922897, "eval_reward_std": 0.3388789966702461, "eval_rewards/accuracy_reward": 0.625, "eval_rewards/brier_reward": 0.7382386177778244, "eval_rewards/confidence_one_or_zero": 0.0, "eval_rewards/format_reward": 0.9853515625, "eval_rewards/mean_confidence_reward": 0.642939455807209, "eval_runtime": 248.0105, "eval_samples_per_second": 4.032, "eval_steps_per_second": 0.032, "step": 30 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.017578125, "completions/max_length": 4096.0, "completions/max_terminated_length": 4059.0, "completions/mean_length": 795.9453125, "completions/mean_terminated_length": 736.8986206054688, "completions/min_length": 232.0, "completions/min_terminated_length": 232.0, "epoch": 0.1984, "grad_norm": 0.0005465546273626387, "learning_rate": 3.7903225806451614e-06, "loss": 0.0198, "num_tokens": 46932215.0, "reward": 1.1878879070281982, "reward_std": 0.21719825267791748, "rewards/accuracy_reward": 0.6516926884651184, "rewards/brier_reward": 0.7455544471740723, "rewards/confidence_one_or_zero": 0.0006510416860692203, "rewards/format_reward": 0.978515625, "rewards/mean_confidence_reward": 0.6385090947151184, "step": 31 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00911458333333337, "completions/max_length": 4096.0, "completions/max_terminated_length": 3902.0, "completions/mean_length": 796.5013427734375, "completions/mean_terminated_length": 766.151123046875, "completions/min_length": 229.0, "completions/min_terminated_length": 229.0, "epoch": 0.2048, "grad_norm": 0.0005273290444165468, "learning_rate": 3.7096774193548392e-06, "loss": 0.0112, "num_tokens": 48676257.0, "reward": 1.186940312385559, "reward_std": 0.1851150393486023, "rewards/accuracy_reward": 0.642578125, "rewards/brier_reward": 0.742357075214386, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9889323115348816, "rewards/mean_confidence_reward": 0.6397786736488342, "step": 32 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01236979166666663, "completions/max_length": 4096.0, "completions/max_terminated_length": 3944.0, "completions/mean_length": 772.8294677734375, "completions/mean_terminated_length": 731.2076416015625, "completions/min_length": 275.0, "completions/min_terminated_length": 275.0, "epoch": 0.2112, "grad_norm": 0.00044452358270063996, "learning_rate": 3.6290322580645166e-06, "loss": 0.0139, "num_tokens": 50386427.0, "reward": 1.1843657493591309, "reward_std": 0.19693529605865479, "rewards/accuracy_reward": 0.6380208134651184, "rewards/brier_reward": 0.7456715703010559, "rewards/confidence_one_or_zero": 0.0013020833721384406, "rewards/format_reward": 0.9850260615348816, "rewards/mean_confidence_reward": 0.6357421875, "step": 33 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01041666666666663, "completions/max_length": 4096.0, "completions/max_terminated_length": 3952.0, "completions/mean_length": 801.5182495117188, "completions/mean_terminated_length": 766.8394775390625, "completions/min_length": 258.0, "completions/min_terminated_length": 258.0, "epoch": 0.2176, "grad_norm": 0.0004962030798196793, "learning_rate": 3.548387096774194e-06, "loss": 0.0116, "num_tokens": 52140983.0, "reward": 1.180006980895996, "reward_std": 0.19812732934951782, "rewards/accuracy_reward": 0.6295573115348816, "rewards/brier_reward": 0.743464469909668, "rewards/confidence_one_or_zero": 0.0013020833721384406, "rewards/format_reward": 0.9869791865348816, "rewards/mean_confidence_reward": 0.6410807371139526, "step": 34 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00716145833333337, "completions/max_length": 4096.0, "completions/max_terminated_length": 2277.0, "completions/mean_length": 777.1784057617188, "completions/mean_terminated_length": 753.2393188476562, "completions/min_length": 252.0, "completions/min_terminated_length": 252.0, "epoch": 0.224, "grad_norm": 0.0003708812582772225, "learning_rate": 3.4677419354838714e-06, "loss": 0.0078, "num_tokens": 53860905.0, "reward": 1.191227674484253, "reward_std": 0.18852798640727997, "rewards/accuracy_reward": 0.6399739384651184, "rewards/brier_reward": 0.750281035900116, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9921875, "rewards/mean_confidence_reward": 0.63818359375, "step": 35 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0078125, "completions/max_length": 4096.0, "completions/max_terminated_length": 2998.0, "completions/mean_length": 809.6686401367188, "completions/mean_terminated_length": 783.7919921875, "completions/min_length": 236.0, "completions/min_terminated_length": 236.0, "epoch": 0.2304, "grad_norm": 0.0003325633006170392, "learning_rate": 3.3870967741935484e-06, "loss": 0.0088, "num_tokens": 55632564.0, "reward": 1.1893303394317627, "reward_std": 0.1812477558851242, "rewards/accuracy_reward": 0.6438801884651184, "rewards/brier_reward": 0.7438822388648987, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9908854365348816, "rewards/mean_confidence_reward": 0.6352213025093079, "step": 36 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01302083333333337, "completions/max_length": 4096.0, "completions/max_terminated_length": 4057.0, "completions/mean_length": 855.9251708984375, "completions/mean_terminated_length": 813.1801147460938, "completions/min_length": 264.0, "completions/min_terminated_length": 264.0, "epoch": 0.2368, "grad_norm": 0.00032984872814267874, "learning_rate": 3.306451612903226e-06, "loss": 0.0158, "num_tokens": 57471513.0, "reward": 1.1870574951171875, "reward_std": 0.19853496551513672, "rewards/accuracy_reward": 0.6451823115348816, "rewards/brier_reward": 0.747800350189209, "rewards/confidence_one_or_zero": 0.0006510416860692203, "rewards/format_reward": 0.9811198115348816, "rewards/mean_confidence_reward": 0.6229491829872131, "step": 37 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.009765625, "completions/max_length": 4096.0, "completions/max_terminated_length": 4065.0, "completions/mean_length": 823.9069213867188, "completions/mean_terminated_length": 791.6377563476562, "completions/min_length": 276.0, "completions/min_terminated_length": 276.0, "epoch": 0.2432, "grad_norm": 0.00029764173086732626, "learning_rate": 3.225806451612903e-06, "loss": 0.0111, "num_tokens": 59263266.0, "reward": 1.2023420333862305, "reward_std": 0.1630508005619049, "rewards/accuracy_reward": 0.66015625, "rewards/brier_reward": 0.7594890594482422, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9850260615348816, "rewards/mean_confidence_reward": 0.6298502683639526, "step": 38 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01432291666666663, "completions/max_length": 4096.0, "completions/max_terminated_length": 4075.0, "completions/mean_length": 865.1868896484375, "completions/mean_terminated_length": 818.2398071289062, "completions/min_length": 291.0, "completions/min_terminated_length": 291.0, "epoch": 0.2496, "grad_norm": 0.00041590689215809107, "learning_rate": 3.145161290322581e-06, "loss": 0.0155, "num_tokens": 61115137.0, "reward": 1.1921846866607666, "reward_std": 0.18370437622070312, "rewards/accuracy_reward": 0.650390625, "rewards/brier_reward": 0.7521950602531433, "rewards/confidence_one_or_zero": 0.0006510416860692203, "rewards/format_reward": 0.9817708134651184, "rewards/mean_confidence_reward": 0.6317383050918579, "step": 39 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00846354166666663, "completions/max_length": 4096.0, "completions/max_terminated_length": 4067.0, "completions/mean_length": 838.1901245117188, "completions/mean_terminated_length": 810.3821411132812, "completions/min_length": 286.0, "completions/min_terminated_length": 286.0, "epoch": 0.256, "grad_norm": 0.0003017229901161045, "learning_rate": 3.0645161290322584e-06, "loss": 0.0109, "num_tokens": 62930549.0, "reward": 1.1816656589508057, "reward_std": 0.1861250400543213, "rewards/accuracy_reward": 0.6243489384651184, "rewards/brier_reward": 0.7506882548332214, "rewards/confidence_one_or_zero": 0.0013020833721384406, "rewards/format_reward": 0.98828125, "rewards/mean_confidence_reward": 0.6327799558639526, "step": 40 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00846354166666663, "completions/max_length": 4096.0, "completions/max_terminated_length": 4035.0, "completions/mean_length": 849.77734375, "completions/mean_terminated_length": 822.0682983398438, "completions/min_length": 289.0, "completions/min_terminated_length": 289.0, "epoch": 0.2624, "grad_norm": 0.00037381798028945923, "learning_rate": 2.983870967741936e-06, "loss": 0.0122, "num_tokens": 64760999.0, "reward": 1.205183506011963, "reward_std": 0.1829705685377121, "rewards/accuracy_reward": 0.6614583134651184, "rewards/brier_reward": 0.7619168162345886, "rewards/confidence_one_or_zero": 0.0006510416860692203, "rewards/format_reward": 0.9869791865348816, "rewards/mean_confidence_reward": 0.6296223998069763, "step": 41 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01171875, "completions/max_length": 4096.0, "completions/max_terminated_length": 4058.0, "completions/mean_length": 820.4525146484375, "completions/mean_terminated_length": 781.6119995117188, "completions/min_length": 242.0, "completions/min_terminated_length": 242.0, "epoch": 0.2688, "grad_norm": 0.000351252150721848, "learning_rate": 2.903225806451613e-06, "loss": 0.0138, "num_tokens": 66546070.0, "reward": 1.1862726211547852, "reward_std": 0.18043045699596405, "rewards/accuracy_reward": 0.6432291865348816, "rewards/brier_reward": 0.7462306022644043, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9830729365348816, "rewards/mean_confidence_reward": 0.6241536736488342, "step": 42 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01432291666666663, "completions/max_length": 4096.0, "completions/max_terminated_length": 4084.0, "completions/mean_length": 852.4114990234375, "completions/mean_terminated_length": 805.2787475585938, "completions/min_length": 291.0, "completions/min_terminated_length": 291.0, "epoch": 0.2752, "grad_norm": 0.0002898203383665532, "learning_rate": 2.822580645161291e-06, "loss": 0.0145, "num_tokens": 68382142.0, "reward": 1.1817338466644287, "reward_std": 0.18965117633342743, "rewards/accuracy_reward": 0.6341145634651184, "rewards/brier_reward": 0.7475696206092834, "rewards/confidence_one_or_zero": 0.0013020833721384406, "rewards/format_reward": 0.9817708134651184, "rewards/mean_confidence_reward": 0.622851550579071, "step": 43 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.009765625, "completions/max_length": 4096.0, "completions/max_terminated_length": 4000.0, "completions/mean_length": 818.6666870117188, "completions/mean_terminated_length": 786.3458862304688, "completions/min_length": 259.0, "completions/min_terminated_length": 259.0, "epoch": 0.2816, "grad_norm": 0.00029774583526887, "learning_rate": 2.7419354838709676e-06, "loss": 0.0113, "num_tokens": 70165734.0, "reward": 1.2131271362304688, "reward_std": 0.17065833508968353, "rewards/accuracy_reward": 0.6796875, "rewards/brier_reward": 0.7608771324157715, "rewards/confidence_one_or_zero": 0.0006510416860692203, "rewards/format_reward": 0.9856770634651184, "rewards/mean_confidence_reward": 0.619225263595581, "step": 44 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00520833333333337, "completions/max_length": 4096.0, "completions/max_terminated_length": 4035.0, "completions/mean_length": 831.4752807617188, "completions/mean_terminated_length": 814.383544921875, "completions/min_length": 336.0, "completions/min_terminated_length": 336.0, "epoch": 0.288, "grad_norm": 0.0002880664251279086, "learning_rate": 2.6612903225806454e-06, "loss": 0.0058, "num_tokens": 71966624.0, "reward": 1.1846349239349365, "reward_std": 0.16476775705814362, "rewards/accuracy_reward": 0.6223958134651184, "rewards/brier_reward": 0.7553251385688782, "rewards/confidence_one_or_zero": 0.0006510416860692203, "rewards/format_reward": 0.9915364384651184, "rewards/mean_confidence_reward": 0.6171224117279053, "step": 45 }, { "epoch": 0.288, "eval_completions/clipped_ratio": 0.0068359375, "eval_completions/max_length": 3547.5, "eval_completions/max_terminated_length": 2789.25, "eval_completions/mean_length": 832.5685119628906, "eval_completions/mean_terminated_length": 810.0671997070312, "eval_completions/min_length": 336.0, "eval_completions/min_terminated_length": 336.0, "eval_loss": 0.0, "eval_num_tokens": 71966624.0, "eval_reward": 1.182741940021515, "eval_reward_std": 0.32168078422546387, "eval_rewards/accuracy_reward": 0.6259765625, "eval_rewards/brier_reward": 0.7512137740850449, "eval_rewards/confidence_one_or_zero": 0.0, "eval_rewards/format_reward": 0.98828125, "eval_rewards/mean_confidence_reward": 0.6131835877895355, "eval_runtime": 240.5116, "eval_samples_per_second": 4.158, "eval_steps_per_second": 0.033, "step": 45 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005859375, "completions/max_length": 4096.0, "completions/max_terminated_length": 3875.0, "completions/mean_length": 800.7396240234375, "completions/mean_terminated_length": 781.317626953125, "completions/min_length": 298.0, "completions/min_terminated_length": 298.0, "epoch": 0.2944, "grad_norm": 0.0004724331956822425, "learning_rate": 2.580645161290323e-06, "loss": 0.0057, "num_tokens": 73727672.0, "reward": 1.1991007328033447, "reward_std": 0.1694556474685669, "rewards/accuracy_reward": 0.6555989384651184, "rewards/brier_reward": 0.751053512096405, "rewards/confidence_one_or_zero": 0.0006510416860692203, "rewards/format_reward": 0.9915364384651184, "rewards/mean_confidence_reward": 0.61962890625, "step": 46 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.013671875, "completions/max_length": 4096.0, "completions/max_terminated_length": 3972.0, "completions/mean_length": 870.7916870117188, "completions/mean_terminated_length": 826.0858154296875, "completions/min_length": 352.0, "completions/min_terminated_length": 352.0, "epoch": 0.3008, "grad_norm": 0.00036135048139840364, "learning_rate": 2.5e-06, "loss": 0.013, "num_tokens": 75592568.0, "reward": 1.196855068206787, "reward_std": 0.17891928553581238, "rewards/accuracy_reward": 0.658203125, "rewards/brier_reward": 0.7524215579032898, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9830729365348816, "rewards/mean_confidence_reward": 0.612597644329071, "step": 47 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01302083333333337, "completions/max_length": 4096.0, "completions/max_terminated_length": 3988.0, "completions/mean_length": 891.2838745117188, "completions/mean_terminated_length": 849.0053100585938, "completions/min_length": 295.0, "completions/min_terminated_length": 295.0, "epoch": 0.3072, "grad_norm": 0.0003015667898580432, "learning_rate": 2.4193548387096776e-06, "loss": 0.0081, "num_tokens": 77494108.0, "reward": 1.1583726406097412, "reward_std": 0.1833227127790451, "rewards/accuracy_reward": 0.599609375, "rewards/brier_reward": 0.7366549372673035, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.98046875, "rewards/mean_confidence_reward": 0.6122069954872131, "step": 48 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 4096.0, "completions/max_terminated_length": 4058.0, "completions/mean_length": 815.2884521484375, "completions/mean_terminated_length": 802.4229125976562, "completions/min_length": 269.0, "completions/min_terminated_length": 269.0, "epoch": 0.3136, "grad_norm": 0.0004926570109091699, "learning_rate": 2.338709677419355e-06, "loss": 0.0089, "num_tokens": 79275839.0, "reward": 1.216859221458435, "reward_std": 0.17143714427947998, "rewards/accuracy_reward": 0.6796875, "rewards/brier_reward": 0.7611801028251648, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9928385615348816, "rewards/mean_confidence_reward": 0.6132161617279053, "step": 49 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01171875, "completions/max_length": 4096.0, "completions/max_terminated_length": 3921.0, "completions/mean_length": 844.986328125, "completions/mean_terminated_length": 806.436767578125, "completions/min_length": 245.0, "completions/min_terminated_length": 245.0, "epoch": 0.32, "grad_norm": 0.00035185401793569326, "learning_rate": 2.2580645161290324e-06, "loss": 0.012, "num_tokens": 81098514.0, "reward": 1.1971240043640137, "reward_std": 0.16831284761428833, "rewards/accuracy_reward": 0.6484375, "rewards/brier_reward": 0.7581682205200195, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9876301884651184, "rewards/mean_confidence_reward": 0.6088216304779053, "step": 50 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01171875, "completions/max_length": 4096.0, "completions/max_terminated_length": 4029.0, "completions/mean_length": 822.7623901367188, "completions/mean_terminated_length": 783.9492797851562, "completions/min_length": 297.0, "completions/min_terminated_length": 297.0, "epoch": 0.3264, "grad_norm": 0.00039248185930773616, "learning_rate": 2.17741935483871e-06, "loss": 0.0135, "num_tokens": 82885133.0, "reward": 1.1891329288482666, "reward_std": 0.17978250980377197, "rewards/accuracy_reward": 0.642578125, "rewards/brier_reward": 0.7493473887443542, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.986328125, "rewards/mean_confidence_reward": 0.6084310412406921, "step": 51 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00520833333333337, "completions/max_length": 4096.0, "completions/max_terminated_length": 4008.0, "completions/mean_length": 797.7025146484375, "completions/mean_terminated_length": 780.4338989257812, "completions/min_length": 264.0, "completions/min_terminated_length": 264.0, "epoch": 0.3328, "grad_norm": 0.00032785398070700467, "learning_rate": 2.096774193548387e-06, "loss": 0.0063, "num_tokens": 84640468.0, "reward": 1.2012954950332642, "reward_std": 0.15448780357837677, "rewards/accuracy_reward": 0.65234375, "rewards/brier_reward": 0.7567451596260071, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9934895634651184, "rewards/mean_confidence_reward": 0.6180012822151184, "step": 52 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00520833333333337, "completions/max_length": 4096.0, "completions/max_terminated_length": 3643.0, "completions/mean_length": 829.0931396484375, "completions/mean_terminated_length": 811.9888916015625, "completions/min_length": 316.0, "completions/min_terminated_length": 316.0, "epoch": 0.3392, "grad_norm": 0.000282296008663252, "learning_rate": 2.0161290322580646e-06, "loss": 0.0085, "num_tokens": 86436099.0, "reward": 1.2123968601226807, "reward_std": 0.1636490523815155, "rewards/accuracy_reward": 0.6712239384651184, "rewards/brier_reward": 0.7594165802001953, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.994140625, "rewards/mean_confidence_reward": 0.614550769329071, "step": 53 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00716145833333337, "completions/max_length": 4096.0, "completions/max_terminated_length": 3653.0, "completions/mean_length": 808.6530151367188, "completions/mean_terminated_length": 784.9409790039062, "completions/min_length": 301.0, "completions/min_terminated_length": 301.0, "epoch": 0.3456, "grad_norm": 0.00033349485602229834, "learning_rate": 1.935483870967742e-06, "loss": 0.0093, "num_tokens": 88202590.0, "reward": 1.2161355018615723, "reward_std": 0.1536397933959961, "rewards/accuracy_reward": 0.6796875, "rewards/brier_reward": 0.7610347867012024, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9915364384651184, "rewards/mean_confidence_reward": 0.6111653447151184, "step": 54 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00846354166666663, "completions/max_length": 4096.0, "completions/max_terminated_length": 4063.0, "completions/mean_length": 842.3548583984375, "completions/mean_terminated_length": 814.5823974609375, "completions/min_length": 339.0, "completions/min_terminated_length": 339.0, "epoch": 0.352, "grad_norm": 0.0003919745213352144, "learning_rate": 1.8548387096774196e-06, "loss": 0.0085, "num_tokens": 90024303.0, "reward": 1.196488857269287, "reward_std": 0.13503897190093994, "rewards/accuracy_reward": 0.6458333134651184, "rewards/brier_reward": 0.7568976283073425, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.990234375, "rewards/mean_confidence_reward": 0.6165690422058105, "step": 55 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.009765625, "completions/max_length": 4096.0, "completions/max_terminated_length": 3808.0, "completions/mean_length": 905.5045776367188, "completions/mean_terminated_length": 874.0401611328125, "completions/min_length": 354.0, "completions/min_terminated_length": 354.0, "epoch": 0.3584, "grad_norm": 0.00026986602460965514, "learning_rate": 1.774193548387097e-06, "loss": 0.0129, "num_tokens": 91943406.0, "reward": 1.2119539976119995, "reward_std": 0.16923794150352478, "rewards/accuracy_reward": 0.6725260615348816, "rewards/brier_reward": 0.7630882263183594, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.98828125, "rewards/mean_confidence_reward": 0.6124023795127869, "step": 56 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 4096.0, "completions/max_terminated_length": 2897.0, "completions/mean_length": 800.419921875, "completions/mean_terminated_length": 787.49609375, "completions/min_length": 233.0, "completions/min_terminated_length": 233.0, "epoch": 0.3648, "grad_norm": 0.00032948493026196957, "learning_rate": 1.6935483870967742e-06, "loss": 0.0066, "num_tokens": 93699179.0, "reward": 1.2440311908721924, "reward_std": 0.15248718857765198, "rewards/accuracy_reward": 0.7135416865348816, "rewards/brier_reward": 0.7790654301643372, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9954426884651184, "rewards/mean_confidence_reward": 0.6213216185569763, "step": 57 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00911458333333337, "completions/max_length": 4096.0, "completions/max_terminated_length": 2625.0, "completions/mean_length": 836.7357177734375, "completions/mean_terminated_length": 806.7555541992188, "completions/min_length": 325.0, "completions/min_terminated_length": 325.0, "epoch": 0.3712, "grad_norm": 0.0003947715158574283, "learning_rate": 1.6129032258064516e-06, "loss": 0.0079, "num_tokens": 95513693.0, "reward": 1.222391128540039, "reward_std": 0.17155036330223083, "rewards/accuracy_reward": 0.689453125, "rewards/brier_reward": 0.7650823593139648, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.990234375, "rewards/mean_confidence_reward": 0.6200846433639526, "step": 58 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0078125, "completions/max_length": 4096.0, "completions/max_terminated_length": 4043.0, "completions/mean_length": 822.5768432617188, "completions/mean_terminated_length": 796.8018188476562, "completions/min_length": 318.0, "completions/min_terminated_length": 318.0, "epoch": 0.3776, "grad_norm": 0.00048284404329024255, "learning_rate": 1.5322580645161292e-06, "loss": 0.0079, "num_tokens": 97301227.0, "reward": 1.1993268728256226, "reward_std": 0.16091161966323853, "rewards/accuracy_reward": 0.6484375, "rewards/brier_reward": 0.7586672902107239, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9915364384651184, "rewards/mean_confidence_reward": 0.6285482048988342, "step": 59 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00651041666666663, "completions/max_length": 4096.0, "completions/max_terminated_length": 4065.0, "completions/mean_length": 824.0065307617188, "completions/mean_terminated_length": 802.5648803710938, "completions/min_length": 286.0, "completions/min_terminated_length": 286.0, "epoch": 0.384, "grad_norm": 0.0003106553922407329, "learning_rate": 1.4516129032258066e-06, "loss": 0.0073, "num_tokens": 99093813.0, "reward": 1.191345453262329, "reward_std": 0.16578087210655212, "rewards/accuracy_reward": 0.6354166865348816, "rewards/brier_reward": 0.7544229626655579, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9928385615348816, "rewards/mean_confidence_reward": 0.6301106810569763, "step": 60 }, { "epoch": 0.384, "eval_completions/clipped_ratio": 0.00923978365384616, "eval_completions/max_length": 3989.375, "eval_completions/max_terminated_length": 2687.625, "eval_completions/mean_length": 851.3605804443359, "eval_completions/mean_terminated_length": 821.00244140625, "eval_completions/min_length": 356.875, "eval_completions/min_terminated_length": 356.875, "eval_loss": 0.0, "eval_num_tokens": 99093813.0, "eval_reward": 1.1956555992364883, "eval_reward_std": 0.3222951777279377, "eval_rewards/accuracy_reward": 0.6474609375, "eval_rewards/brier_reward": 0.754579670727253, "eval_rewards/confidence_one_or_zero": 0.0009765625, "eval_rewards/format_reward": 0.9892578125, "eval_rewards/mean_confidence_reward": 0.6375000327825546, "eval_runtime": 268.1899, "eval_samples_per_second": 3.729, "eval_steps_per_second": 0.03, "step": 60 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00651041666666663, "completions/max_length": 4096.0, "completions/max_terminated_length": 4058.0, "completions/mean_length": 868.3984375, "completions/mean_terminated_length": 847.2477416992188, "completions/min_length": 268.0, "completions/min_terminated_length": 268.0, "epoch": 0.3904, "grad_norm": 0.0004904476809315383, "learning_rate": 1.3709677419354838e-06, "loss": 0.006, "num_tokens": 100963601.0, "reward": 1.16738760471344, "reward_std": 0.15795522928237915, "rewards/accuracy_reward": 0.59765625, "rewards/brier_reward": 0.7455698847770691, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9915364384651184, "rewards/mean_confidence_reward": 0.6270182132720947, "step": 61 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005859375, "completions/max_length": 4096.0, "completions/max_terminated_length": 3785.0, "completions/mean_length": 848.6139526367188, "completions/mean_terminated_length": 829.47412109375, "completions/min_length": 269.0, "completions/min_terminated_length": 269.0, "epoch": 0.3968, "grad_norm": 0.00028476607985794544, "learning_rate": 1.2903225806451614e-06, "loss": 0.0107, "num_tokens": 102794776.0, "reward": 1.2071278095245361, "reward_std": 0.1802365481853485, "rewards/accuracy_reward": 0.6627604365348816, "rewards/brier_reward": 0.7592945694923401, "rewards/confidence_one_or_zero": 0.0006510416860692203, "rewards/format_reward": 0.9921875, "rewards/mean_confidence_reward": 0.644335925579071, "step": 62 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00520833333333337, "completions/max_length": 4096.0, "completions/max_terminated_length": 3474.0, "completions/mean_length": 817.5775146484375, "completions/mean_terminated_length": 800.4129638671875, "completions/min_length": 295.0, "completions/min_terminated_length": 295.0, "epoch": 0.4032, "grad_norm": 0.0003588373656384647, "learning_rate": 1.2096774193548388e-06, "loss": 0.0048, "num_tokens": 104576239.0, "reward": 1.2228258848190308, "reward_std": 0.15534567832946777, "rewards/accuracy_reward": 0.6822916865348816, "rewards/brier_reward": 0.7685551643371582, "rewards/confidence_one_or_zero": 0.0006510416860692203, "rewards/format_reward": 0.9947916865348816, "rewards/mean_confidence_reward": 0.6515950560569763, "step": 63 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0032552083333333703, "completions/max_length": 4096.0, "completions/max_terminated_length": 4018.0, "completions/mean_length": 847.7890625, "completions/mean_terminated_length": 837.180908203125, "completions/min_length": 300.0, "completions/min_terminated_length": 300.0, "epoch": 0.4096, "grad_norm": 0.0002948266628663987, "learning_rate": 1.1290322580645162e-06, "loss": 0.0072, "num_tokens": 106402923.0, "reward": 1.2223950624465942, "reward_std": 0.1734146773815155, "rewards/accuracy_reward": 0.6790364384651184, "rewards/brier_reward": 0.7715999484062195, "rewards/confidence_one_or_zero": 0.0006510416860692203, "rewards/format_reward": 0.994140625, "rewards/mean_confidence_reward": 0.650585949420929, "step": 64 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005859375, "completions/max_length": 4096.0, "completions/max_terminated_length": 4043.0, "completions/mean_length": 842.3639526367188, "completions/mean_terminated_length": 823.1873168945312, "completions/min_length": 266.0, "completions/min_terminated_length": 266.0, "epoch": 0.416, "grad_norm": 0.00033330428414046764, "learning_rate": 1.0483870967741936e-06, "loss": 0.0057, "num_tokens": 108227938.0, "reward": 1.229150652885437, "reward_std": 0.1722082495689392, "rewards/accuracy_reward": 0.69140625, "rewards/brier_reward": 0.7746941447257996, "rewards/confidence_one_or_zero": 0.0006510416860692203, "rewards/format_reward": 0.9921875, "rewards/mean_confidence_reward": 0.6650065183639526, "step": 65 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00911458333333337, "completions/max_length": 4096.0, "completions/max_terminated_length": 3889.0, "completions/mean_length": 864.37109375, "completions/mean_terminated_length": 834.6452026367188, "completions/min_length": 313.0, "completions/min_terminated_length": 313.0, "epoch": 0.4224, "grad_norm": 0.0002921877894550562, "learning_rate": 9.67741935483871e-07, "loss": 0.0121, "num_tokens": 110081268.0, "reward": 1.2018119096755981, "reward_std": 0.18655282258987427, "rewards/accuracy_reward": 0.6614583134651184, "rewards/brier_reward": 0.754521906375885, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9876301884651184, "rewards/mean_confidence_reward": 0.6583333015441895, "step": 66 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0078125, "completions/max_length": 4096.0, "completions/max_terminated_length": 4092.0, "completions/mean_length": 847.9525146484375, "completions/mean_terminated_length": 822.3773193359375, "completions/min_length": 340.0, "completions/min_terminated_length": 340.0, "epoch": 0.4288, "grad_norm": 0.0003183463413733989, "learning_rate": 8.870967741935485e-07, "loss": 0.0099, "num_tokens": 111907387.0, "reward": 1.220888614654541, "reward_std": 0.17330679297447205, "rewards/accuracy_reward": 0.6829426884651184, "rewards/brier_reward": 0.7698888778686523, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9889323115348816, "rewards/mean_confidence_reward": 0.66845703125, "step": 67 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005859375, "completions/max_length": 4096.0, "completions/max_terminated_length": 3947.0, "completions/mean_length": 811.447265625, "completions/mean_terminated_length": 792.0884399414062, "completions/min_length": 301.0, "completions/min_terminated_length": 301.0, "epoch": 0.4352, "grad_norm": 0.0003066919161938131, "learning_rate": 8.064516129032258e-07, "loss": 0.0113, "num_tokens": 113682274.0, "reward": 1.2066129446029663, "reward_std": 0.17153900861740112, "rewards/accuracy_reward": 0.6595051884651184, "rewards/brier_reward": 0.7628219127655029, "rewards/confidence_one_or_zero": 0.0006510416860692203, "rewards/format_reward": 0.9908854365348816, "rewards/mean_confidence_reward": 0.6674153804779053, "step": 68 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00846354166666663, "completions/max_length": 4096.0, "completions/max_terminated_length": 4090.0, "completions/mean_length": 842.0716552734375, "completions/mean_terminated_length": 814.2968139648438, "completions/min_length": 243.0, "completions/min_terminated_length": 243.0, "epoch": 0.4416, "grad_norm": 0.00030422816053032875, "learning_rate": 7.258064516129033e-07, "loss": 0.0107, "num_tokens": 115503464.0, "reward": 1.1876566410064697, "reward_std": 0.18401162326335907, "rewards/accuracy_reward": 0.6399739384651184, "rewards/brier_reward": 0.7496488690376282, "rewards/confidence_one_or_zero": 0.0006510416860692203, "rewards/format_reward": 0.9856770634651184, "rewards/mean_confidence_reward": 0.6674153804779053, "step": 69 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00651041666666663, "completions/max_length": 4096.0, "completions/max_terminated_length": 3748.0, "completions/mean_length": 841.5787963867188, "completions/mean_terminated_length": 820.2523193359375, "completions/min_length": 267.0, "completions/min_terminated_length": 267.0, "epoch": 0.448, "grad_norm": 0.000367781613022089, "learning_rate": 6.451612903225807e-07, "loss": 0.0075, "num_tokens": 117324129.0, "reward": 1.2296011447906494, "reward_std": 0.18445131182670593, "rewards/accuracy_reward": 0.6920573115348816, "rewards/brier_reward": 0.7742926478385925, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9928385615348816, "rewards/mean_confidence_reward": 0.6756184697151184, "step": 70 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0078125, "completions/max_length": 4096.0, "completions/max_terminated_length": 3907.0, "completions/mean_length": 838.1243896484375, "completions/mean_terminated_length": 812.4718017578125, "completions/min_length": 315.0, "completions/min_terminated_length": 315.0, "epoch": 0.4544, "grad_norm": 0.00028708679019473493, "learning_rate": 5.645161290322581e-07, "loss": 0.009, "num_tokens": 119133696.0, "reward": 1.2450575828552246, "reward_std": 0.16368097066879272, "rewards/accuracy_reward": 0.7161458134651184, "rewards/brier_reward": 0.7837212681770325, "rewards/confidence_one_or_zero": 0.0006510416860692203, "rewards/format_reward": 0.990234375, "rewards/mean_confidence_reward": 0.6800456047058105, "step": 71 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00455729166666663, "completions/max_length": 4096.0, "completions/max_terminated_length": 3896.0, "completions/mean_length": 818.3978271484375, "completions/mean_terminated_length": 803.3923950195312, "completions/min_length": 315.0, "completions/min_terminated_length": 315.0, "epoch": 0.4608, "grad_norm": 0.00031864107586443424, "learning_rate": 4.838709677419355e-07, "loss": 0.0054, "num_tokens": 120919331.0, "reward": 1.1747868061065674, "reward_std": 0.18735384941101074, "rewards/accuracy_reward": 0.61328125, "rewards/brier_reward": 0.7434401512145996, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9928385615348816, "rewards/mean_confidence_reward": 0.673046886920929, "step": 72 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0078125, "completions/max_length": 4096.0, "completions/max_terminated_length": 4067.0, "completions/mean_length": 844.669921875, "completions/mean_terminated_length": 819.0689086914062, "completions/min_length": 270.0, "completions/min_terminated_length": 270.0, "epoch": 0.4672, "grad_norm": 0.00035896478220820427, "learning_rate": 4.032258064516129e-07, "loss": 0.0087, "num_tokens": 122735848.0, "reward": 1.204715609550476, "reward_std": 0.16531410813331604, "rewards/accuracy_reward": 0.6608073115348816, "rewards/brier_reward": 0.759026825428009, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9895833134651184, "rewards/mean_confidence_reward": 0.6822916865348816, "step": 73 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001953125, "completions/max_length": 4096.0, "completions/max_terminated_length": 4015.0, "completions/mean_length": 792.2806396484375, "completions/mean_terminated_length": 785.8154296875, "completions/min_length": 260.0, "completions/min_terminated_length": 260.0, "epoch": 0.4736, "grad_norm": 0.0002979944401886314, "learning_rate": 3.2258064516129035e-07, "loss": 0.0069, "num_tokens": 124476335.0, "reward": 1.2245442867279053, "reward_std": 0.15666741132736206, "rewards/accuracy_reward": 0.6842448115348816, "rewards/brier_reward": 0.7693870067596436, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9954426884651184, "rewards/mean_confidence_reward": 0.6906575560569763, "step": 74 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00846354166666663, "completions/max_length": 4096.0, "completions/max_terminated_length": 4029.0, "completions/mean_length": 839.03515625, "completions/mean_terminated_length": 811.2344360351562, "completions/min_length": 300.0, "completions/min_terminated_length": 300.0, "epoch": 0.48, "grad_norm": 0.0003798941324930638, "learning_rate": 2.4193548387096775e-07, "loss": 0.0081, "num_tokens": 126287573.0, "reward": 1.1904067993164062, "reward_std": 0.1817515790462494, "rewards/accuracy_reward": 0.6380208134651184, "rewards/brier_reward": 0.752544641494751, "rewards/confidence_one_or_zero": 0.0006510416860692203, "rewards/format_reward": 0.990234375, "rewards/mean_confidence_reward": 0.6768555045127869, "step": 75 }, { "epoch": 0.48, "eval_completions/clipped_ratio": 0.0078125, "eval_completions/max_length": 3553.25, "eval_completions/max_terminated_length": 2050.125, "eval_completions/mean_length": 821.1019439697266, "eval_completions/mean_terminated_length": 795.3644561767578, "eval_completions/min_length": 353.0, "eval_completions/min_terminated_length": 353.0, "eval_loss": 0.0, "eval_num_tokens": 126287573.0, "eval_reward": 1.2085177600383759, "eval_reward_std": 0.3346817120909691, "eval_rewards/accuracy_reward": 0.6630859375, "eval_rewards/brier_reward": 0.7627248838543892, "eval_rewards/confidence_one_or_zero": 0.0, "eval_rewards/format_reward": 0.9912109375, "eval_rewards/mean_confidence_reward": 0.6843261867761612, "eval_runtime": 256.583, "eval_samples_per_second": 3.897, "eval_steps_per_second": 0.031, "step": 75 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0032552083333333703, "completions/max_length": 4096.0, "completions/max_terminated_length": 4076.0, "completions/mean_length": 809.9642333984375, "completions/mean_terminated_length": 799.2324829101562, "completions/min_length": 260.0, "completions/min_terminated_length": 260.0, "epoch": 0.4864, "grad_norm": 0.00029650668147951365, "learning_rate": 1.6129032258064518e-07, "loss": 0.0061, "num_tokens": 128053894.0, "reward": 1.2499312162399292, "reward_std": 0.1748509407043457, "rewards/accuracy_reward": 0.71875, "rewards/brier_reward": 0.7869578003883362, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.994140625, "rewards/mean_confidence_reward": 0.6907551884651184, "step": 76 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0078125, "completions/max_length": 4096.0, "completions/max_terminated_length": 3931.0, "completions/mean_length": 817.1484375, "completions/mean_terminated_length": 791.3306884765625, "completions/min_length": 268.0, "completions/min_terminated_length": 268.0, "epoch": 0.4928, "grad_norm": 0.0005250805406831205, "learning_rate": 8.064516129032259e-08, "loss": 0.0072, "num_tokens": 129832370.0, "reward": 1.238200068473816, "reward_std": 0.16415183246135712, "rewards/accuracy_reward": 0.7037760615348816, "rewards/brier_reward": 0.7836779952049255, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9889323115348816, "rewards/mean_confidence_reward": 0.681835949420929, "step": 77 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0032552083333333703, "completions/max_length": 4096.0, "completions/max_terminated_length": 3949.0, "completions/mean_length": 827.0423583984375, "completions/mean_terminated_length": 816.3663940429688, "completions/min_length": 282.0, "completions/min_terminated_length": 282.0, "epoch": 0.4992, "grad_norm": 0.0002979112323373556, "learning_rate": 0.0, "loss": 0.0047, "num_tokens": 131631147.0, "reward": 1.1954009532928467, "reward_std": 0.17390400171279907, "rewards/accuracy_reward": 0.6438801884651184, "rewards/brier_reward": 0.7527675032615662, "rewards/confidence_one_or_zero": 0.0006510416860692203, "rewards/format_reward": 0.994140625, "rewards/mean_confidence_reward": 0.673828125, "step": 78 }, { "epoch": 0.4992, "step": 78, "total_flos": 0.0, "train_loss": 0.01258836815563532, "train_runtime": 18117.4389, "train_samples_per_second": 0.828, "train_steps_per_second": 0.004 } ], "logging_steps": 1, "max_steps": 78, "num_input_tokens_seen": 131631147, "num_train_epochs": 1, "save_steps": 60, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 0.0, "train_batch_size": 3, "trial_name": null, "trial_params": null }