Files
Qwen2.5-3B-ha_grpo/trainer_state.json
ModelHub XC b195a48a88 初始化项目,由ModelHub XC社区提供模型
Model: lhkhiem28/Qwen2.5-3B-ha_grpo
Source: Original Platform
2026-07-23 18:57:20 +08:00

6128 lines
226 KiB
JSON

{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.998666311016271,
"eval_steps": 2000000,
"global_step": 234,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1610.0,
"completions/mean_length": 690.1796875,
"completions/mean_terminated_length": 684.8549194335938,
"completions/min_length": 178.0,
"completions/min_terminated_length": 178.0,
"epoch": 0.004267804747932782,
"grad_norm": 0.44456309488189716,
"learning_rate": 0.0,
"loss": 0.0086,
"num_tokens": 214606.0,
"reward": 0.5625,
"reward_std": 0.3574240803718567,
"rewards/accuracy_reward/mean": 0.44921875,
"rewards/accuracy_reward/std": 0.49838894605636597,
"rewards/format_reward/mean": 0.2265625,
"rewards/format_reward/std": 0.41942715644836426,
"step": 1
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1571.0,
"completions/max_terminated_length": 1571.0,
"completions/mean_length": 648.296875,
"completions/mean_terminated_length": 648.296875,
"completions/min_length": 217.0,
"completions/min_terminated_length": 217.0,
"epoch": 0.008535609495865563,
"grad_norm": 0.3673715573619009,
"learning_rate": 4.166666666666666e-08,
"loss": -0.0042,
"num_tokens": 431586.0,
"reward": 0.5390625,
"reward_std": 0.3619725704193115,
"rewards/accuracy_reward/mean": 0.45703125,
"rewards/accuracy_reward/std": 0.4991260766983032,
"rewards/format_reward/mean": 0.1640625,
"rewards/format_reward/std": 0.3710577189922333,
"step": 2
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1984.0,
"completions/mean_length": 673.1328125,
"completions/mean_terminated_length": 667.7412109375,
"completions/min_length": 194.0,
"completions/min_terminated_length": 194.0,
"epoch": 0.012803414243798347,
"grad_norm": 0.47914003773403996,
"learning_rate": 8.333333333333333e-08,
"loss": 0.0205,
"num_tokens": 646268.0,
"reward": 0.662109375,
"reward_std": 0.37592965364456177,
"rewards/accuracy_reward/mean": 0.5859375,
"rewards/accuracy_reward/std": 0.4935242533683777,
"rewards/format_reward/mean": 0.15234375,
"rewards/format_reward/std": 0.3600577116012573,
"step": 3
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1969.0,
"completions/max_terminated_length": 1969.0,
"completions/mean_length": 655.13671875,
"completions/mean_terminated_length": 655.13671875,
"completions/min_length": 250.0,
"completions/min_terminated_length": 250.0,
"epoch": 0.017071218991731127,
"grad_norm": 0.39898427022729166,
"learning_rate": 1.25e-07,
"loss": 0.0238,
"num_tokens": 849495.0,
"reward": 0.642578125,
"reward_std": 0.3759385347366333,
"rewards/accuracy_reward/mean": 0.578125,
"rewards/accuracy_reward/std": 0.49482619762420654,
"rewards/format_reward/mean": 0.12890625,
"rewards/format_reward/std": 0.33575257658958435,
"step": 4
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1776.0,
"completions/max_terminated_length": 1776.0,
"completions/mean_length": 704.90234375,
"completions/mean_terminated_length": 704.90234375,
"completions/min_length": 234.0,
"completions/min_terminated_length": 234.0,
"epoch": 0.021339023739663912,
"grad_norm": 0.49975182401817253,
"learning_rate": 1.6666666666666665e-07,
"loss": 0.0083,
"num_tokens": 1080622.0,
"reward": 0.541015625,
"reward_std": 0.3382297158241272,
"rewards/accuracy_reward/mean": 0.4354838728904724,
"rewards/accuracy_reward/std": 0.49682286381721497,
"rewards/format_reward/mean": 0.23828125,
"rewards/format_reward/std": 0.4268665909767151,
"step": 5
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1897.0,
"completions/max_terminated_length": 1897.0,
"completions/mean_length": 621.4296875,
"completions/mean_terminated_length": 621.4296875,
"completions/min_length": 186.0,
"completions/min_terminated_length": 186.0,
"epoch": 0.025606828487596694,
"grad_norm": 0.5501302274168166,
"learning_rate": 2.0833333333333333e-07,
"loss": -0.0264,
"num_tokens": 1282596.0,
"reward": 0.58984375,
"reward_std": 0.4271993041038513,
"rewards/accuracy_reward/mean": 0.46484375,
"rewards/accuracy_reward/std": 0.49973952770233154,
"rewards/format_reward/mean": 0.25,
"rewards/format_reward/std": 0.4338609278202057,
"step": 6
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1433.0,
"completions/max_terminated_length": 1433.0,
"completions/mean_length": 511.03515625,
"completions/mean_terminated_length": 511.03515625,
"completions/min_length": 169.0,
"completions/min_terminated_length": 169.0,
"epoch": 0.029874633235529476,
"grad_norm": 0.6353483674834972,
"learning_rate": 2.5e-07,
"loss": 0.0043,
"num_tokens": 1457949.0,
"reward": 0.60546875,
"reward_std": 0.4078904390335083,
"rewards/accuracy_reward/mean": 0.5078125,
"rewards/accuracy_reward/std": 0.5009182691574097,
"rewards/format_reward/mean": 0.1953125,
"rewards/format_reward/std": 0.39721766114234924,
"step": 7
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1948.0,
"completions/max_terminated_length": 1948.0,
"completions/mean_length": 728.21484375,
"completions/mean_terminated_length": 728.21484375,
"completions/min_length": 260.0,
"completions/min_terminated_length": 260.0,
"epoch": 0.034142437983462254,
"grad_norm": 0.39823868913622557,
"learning_rate": 2.916666666666667e-07,
"loss": 0.0153,
"num_tokens": 1697916.0,
"reward": 0.5078125,
"reward_std": 0.405484139919281,
"rewards/accuracy_reward/mean": 0.375,
"rewards/accuracy_reward/std": 0.4850712716579437,
"rewards/format_reward/mean": 0.265625,
"rewards/format_reward/std": 0.4425306022167206,
"step": 8
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1591.0,
"completions/max_terminated_length": 1591.0,
"completions/mean_length": 627.8515625,
"completions/mean_terminated_length": 627.8515625,
"completions/min_length": 221.0,
"completions/min_terminated_length": 221.0,
"epoch": 0.03841024273139504,
"grad_norm": 0.46677623067823,
"learning_rate": 3.333333333333333e-07,
"loss": 0.0431,
"num_tokens": 1895094.0,
"reward": 0.673828125,
"reward_std": 0.36997175216674805,
"rewards/accuracy_reward/mean": 0.60546875,
"rewards/accuracy_reward/std": 0.48970720171928406,
"rewards/format_reward/mean": 0.13671875,
"rewards/format_reward/std": 0.34422317147254944,
"step": 9
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1840.0,
"completions/mean_length": 651.33984375,
"completions/mean_terminated_length": 645.86279296875,
"completions/min_length": 152.0,
"completions/min_terminated_length": 152.0,
"epoch": 0.042678047479327824,
"grad_norm": 0.4778207599619871,
"learning_rate": 3.75e-07,
"loss": 0.0057,
"num_tokens": 2101709.0,
"reward": 0.658203125,
"reward_std": 0.37365204095840454,
"rewards/accuracy_reward/mean": 0.546875,
"rewards/accuracy_reward/std": 0.4987730085849762,
"rewards/format_reward/mean": 0.22265625,
"rewards/format_reward/std": 0.41684433817863464,
"step": 10
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1917.0,
"completions/max_terminated_length": 1917.0,
"completions/mean_length": 678.25,
"completions/mean_terminated_length": 678.25,
"completions/min_length": 207.0,
"completions/min_terminated_length": 207.0,
"epoch": 0.0469458522272606,
"grad_norm": 0.4166247946344727,
"learning_rate": 4.1666666666666667e-07,
"loss": -0.0112,
"num_tokens": 2324349.0,
"reward": 0.552734375,
"reward_std": 0.377584308385849,
"rewards/accuracy_reward/mean": 0.40234375,
"rewards/accuracy_reward/std": 0.4913311004638672,
"rewards/format_reward/mean": 0.30078125,
"rewards/format_reward/std": 0.45949608087539673,
"step": 11
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1640.0,
"completions/mean_length": 652.2265625,
"completions/mean_terminated_length": 646.7529907226562,
"completions/min_length": 144.0,
"completions/min_terminated_length": 144.0,
"epoch": 0.05121365697519339,
"grad_norm": 0.3997247081112813,
"learning_rate": 4.5833333333333327e-07,
"loss": 0.0185,
"num_tokens": 2535335.0,
"reward": 0.59375,
"reward_std": 0.325034499168396,
"rewards/accuracy_reward/mean": 0.453125,
"rewards/accuracy_reward/std": 0.4987730085849762,
"rewards/format_reward/mean": 0.28125,
"rewards/format_reward/std": 0.45048993825912476,
"step": 12
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1608.0,
"completions/mean_length": 675.28515625,
"completions/mean_terminated_length": 664.4763793945312,
"completions/min_length": 142.0,
"completions/min_terminated_length": 142.0,
"epoch": 0.055481461723126166,
"grad_norm": 0.5066486239850558,
"learning_rate": 5e-07,
"loss": -0.007,
"num_tokens": 2757160.0,
"reward": 0.5078125,
"reward_std": 0.4239785075187683,
"rewards/accuracy_reward/mean": 0.37890625,
"rewards/accuracy_reward/std": 0.4860650300979614,
"rewards/format_reward/mean": 0.2578125,
"rewards/format_reward/std": 0.4382871091365814,
"step": 13
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1631.0,
"completions/max_terminated_length": 1631.0,
"completions/mean_length": 662.3515625,
"completions/mean_terminated_length": 662.3515625,
"completions/min_length": 184.0,
"completions/min_terminated_length": 184.0,
"epoch": 0.05974926647105895,
"grad_norm": 0.39348449056373397,
"learning_rate": 5.416666666666666e-07,
"loss": -0.0035,
"num_tokens": 2973122.0,
"reward": 0.611328125,
"reward_std": 0.3449006974697113,
"rewards/accuracy_reward/mean": 0.49609375,
"rewards/accuracy_reward/std": 0.5009641647338867,
"rewards/format_reward/mean": 0.23046875,
"rewards/format_reward/std": 0.4219578504562378,
"step": 14
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1820.0,
"completions/max_terminated_length": 1820.0,
"completions/mean_length": 681.25,
"completions/mean_terminated_length": 681.25,
"completions/min_length": 212.0,
"completions/min_terminated_length": 212.0,
"epoch": 0.06401707121899174,
"grad_norm": 0.41492832402325586,
"learning_rate": 5.833333333333334e-07,
"loss": -0.009,
"num_tokens": 3229306.0,
"reward": 0.609375,
"reward_std": 0.34621620178222656,
"rewards/accuracy_reward/mean": 0.4921875,
"rewards/accuracy_reward/std": 0.5009182691574097,
"rewards/format_reward/mean": 0.234375,
"rewards/format_reward/std": 0.42443734407424927,
"step": 15
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1793.0,
"completions/max_terminated_length": 1793.0,
"completions/mean_length": 666.60546875,
"completions/mean_terminated_length": 666.60546875,
"completions/min_length": 168.0,
"completions/min_terminated_length": 168.0,
"epoch": 0.06828487596692451,
"grad_norm": 0.40098576404854996,
"learning_rate": 6.249999999999999e-07,
"loss": 0.0075,
"num_tokens": 3443381.0,
"reward": 0.671875,
"reward_std": 0.33268827199935913,
"rewards/accuracy_reward/mean": 0.58984375,
"rewards/accuracy_reward/std": 0.49282538890838623,
"rewards/format_reward/mean": 0.1640625,
"rewards/format_reward/std": 0.3710577189922333,
"step": 16
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1676.0,
"completions/mean_length": 611.16015625,
"completions/mean_terminated_length": 605.5255126953125,
"completions/min_length": 210.0,
"completions/min_terminated_length": 210.0,
"epoch": 0.07255268071485729,
"grad_norm": 0.3886586858826799,
"learning_rate": 6.666666666666666e-07,
"loss": 0.023,
"num_tokens": 3642062.0,
"reward": 0.587890625,
"reward_std": 0.3731262683868408,
"rewards/accuracy_reward/mean": 0.48828125,
"rewards/accuracy_reward/std": 0.5008418560028076,
"rewards/format_reward/mean": 0.19921875,
"rewards/format_reward/std": 0.40019527077674866,
"step": 17
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1535.0,
"completions/mean_length": 705.734375,
"completions/mean_terminated_length": 700.4706420898438,
"completions/min_length": 232.0,
"completions/min_terminated_length": 232.0,
"epoch": 0.07682048546279008,
"grad_norm": 0.35956519728845016,
"learning_rate": 7.083333333333334e-07,
"loss": 0.0068,
"num_tokens": 3880354.0,
"reward": 0.587890625,
"reward_std": 0.37114569544792175,
"rewards/accuracy_reward/mean": 0.49609375,
"rewards/accuracy_reward/std": 0.5009641647338867,
"rewards/format_reward/mean": 0.18359375,
"rewards/format_reward/std": 0.387910932302475,
"step": 18
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1725.0,
"completions/mean_length": 672.8359375,
"completions/mean_terminated_length": 667.4431762695312,
"completions/min_length": 241.0,
"completions/min_terminated_length": 241.0,
"epoch": 0.08108829021072286,
"grad_norm": 0.3590129453560068,
"learning_rate": 7.5e-07,
"loss": 0.013,
"num_tokens": 4118376.0,
"reward": 0.634765625,
"reward_std": 0.3457132577896118,
"rewards/accuracy_reward/mean": 0.5234375,
"rewards/accuracy_reward/std": 0.5004287362098694,
"rewards/format_reward/mean": 0.22265625,
"rewards/format_reward/std": 0.41684433817863464,
"step": 19
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1835.0,
"completions/mean_length": 638.82421875,
"completions/mean_terminated_length": 633.298095703125,
"completions/min_length": 131.0,
"completions/min_terminated_length": 131.0,
"epoch": 0.08535609495865565,
"grad_norm": 0.3036016367909782,
"learning_rate": 7.916666666666666e-07,
"loss": 0.0126,
"num_tokens": 4323323.0,
"reward": 0.740234375,
"reward_std": 0.28531497716903687,
"rewards/accuracy_reward/mean": 0.69140625,
"rewards/accuracy_reward/std": 0.46281787753105164,
"rewards/format_reward/mean": 0.09765625,
"rewards/format_reward/std": 0.29743078351020813,
"step": 20
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1707.0,
"completions/mean_length": 670.2265625,
"completions/mean_terminated_length": 659.3779296875,
"completions/min_length": 154.0,
"completions/min_terminated_length": 154.0,
"epoch": 0.08962389970658842,
"grad_norm": 0.35875421960721965,
"learning_rate": 8.333333333333333e-07,
"loss": 0.034,
"num_tokens": 4555797.0,
"reward": 0.6875,
"reward_std": 0.29541870951652527,
"rewards/accuracy_reward/mean": 0.58984375,
"rewards/accuracy_reward/std": 0.49282538890838623,
"rewards/format_reward/mean": 0.1953125,
"rewards/format_reward/std": 0.39721766114234924,
"step": 21
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1795.0,
"completions/mean_length": 721.03515625,
"completions/mean_terminated_length": 710.5866088867188,
"completions/min_length": 187.0,
"completions/min_terminated_length": 187.0,
"epoch": 0.0938917044545212,
"grad_norm": 0.30117312587157463,
"learning_rate": 8.75e-07,
"loss": 0.0105,
"num_tokens": 4801006.0,
"reward": 0.7109375,
"reward_std": 0.3334755599498749,
"rewards/accuracy_reward/mean": 0.6484375,
"rewards/accuracy_reward/std": 0.47839346528053284,
"rewards/format_reward/mean": 0.125,
"rewards/format_reward/std": 0.33136674761772156,
"step": 22
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1842.0,
"completions/mean_length": 702.84765625,
"completions/mean_terminated_length": 697.5725708007812,
"completions/min_length": 165.0,
"completions/min_terminated_length": 165.0,
"epoch": 0.09815950920245399,
"grad_norm": 0.27855119216738156,
"learning_rate": 9.166666666666665e-07,
"loss": 0.0144,
"num_tokens": 5032247.0,
"reward": 0.595703125,
"reward_std": 0.30231860280036926,
"rewards/accuracy_reward/mean": 0.52734375,
"rewards/accuracy_reward/std": 0.5002297759056091,
"rewards/format_reward/mean": 0.13671875,
"rewards/format_reward/std": 0.34422317147254944,
"step": 23
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1642.0,
"completions/max_terminated_length": 1642.0,
"completions/mean_length": 615.91015625,
"completions/mean_terminated_length": 615.91015625,
"completions/min_length": 216.0,
"completions/min_terminated_length": 216.0,
"epoch": 0.10242731395038678,
"grad_norm": 0.28757747870815736,
"learning_rate": 9.583333333333334e-07,
"loss": 0.0065,
"num_tokens": 5236352.0,
"reward": 0.740234375,
"reward_std": 0.2903454303741455,
"rewards/accuracy_reward/mean": 0.6875,
"rewards/accuracy_reward/std": 0.4644203782081604,
"rewards/format_reward/mean": 0.10546875,
"rewards/format_reward/std": 0.3077581524848938,
"step": 24
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1850.0,
"completions/mean_length": 694.859375,
"completions/mean_terminated_length": 689.552978515625,
"completions/min_length": 206.0,
"completions/min_terminated_length": 206.0,
"epoch": 0.10669511869831955,
"grad_norm": 0.2734393609428565,
"learning_rate": 1e-06,
"loss": 0.0128,
"num_tokens": 5459508.0,
"reward": 0.6484375,
"reward_std": 0.32806265354156494,
"rewards/accuracy_reward/mean": 0.609375,
"rewards/accuracy_reward/std": 0.48884621262550354,
"rewards/format_reward/mean": 0.078125,
"rewards/format_reward/std": 0.26889389753341675,
"step": 25
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1909.0,
"completions/max_terminated_length": 1909.0,
"completions/mean_length": 688.046875,
"completions/mean_terminated_length": 688.046875,
"completions/min_length": 234.0,
"completions/min_terminated_length": 234.0,
"epoch": 0.11096292344625233,
"grad_norm": 0.2074440704695248,
"learning_rate": 9.99944579961847e-07,
"loss": -0.0055,
"num_tokens": 5678048.0,
"reward": 0.7109375,
"reward_std": 0.2539610266685486,
"rewards/accuracy_reward/mean": 0.68359375,
"rewards/accuracy_reward/std": 0.4659844934940338,
"rewards/format_reward/mean": 0.0546875,
"rewards/format_reward/std": 0.22781464457511902,
"step": 26
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1695.0,
"completions/max_terminated_length": 1695.0,
"completions/mean_length": 631.57421875,
"completions/mean_terminated_length": 631.57421875,
"completions/min_length": 176.0,
"completions/min_terminated_length": 176.0,
"epoch": 0.11523072819418512,
"grad_norm": 0.24553777090920487,
"learning_rate": 9.997783321329102e-07,
"loss": 0.025,
"num_tokens": 5875587.0,
"reward": 0.716796875,
"reward_std": 0.3220256567001343,
"rewards/accuracy_reward/mean": 0.70703125,
"rewards/accuracy_reward/std": 0.45601576566696167,
"rewards/format_reward/mean": 0.01953125,
"rewards/format_reward/std": 0.13865381479263306,
"step": 27
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.015625,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1857.0,
"completions/mean_length": 664.78125,
"completions/mean_terminated_length": 642.825439453125,
"completions/min_length": 177.0,
"completions/min_terminated_length": 177.0,
"epoch": 0.1194985329421179,
"grad_norm": 0.23732647855594297,
"learning_rate": 9.995012933670338e-07,
"loss": 0.0232,
"num_tokens": 6089579.0,
"reward": 0.73828125,
"reward_std": 0.22687013447284698,
"rewards/accuracy_reward/mean": 0.703125,
"rewards/accuracy_reward/std": 0.45777595043182373,
"rewards/format_reward/mean": 0.0703125,
"rewards/format_reward/std": 0.2561737895011902,
"step": 28
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1852.0,
"completions/mean_length": 636.71484375,
"completions/mean_terminated_length": 625.6023559570312,
"completions/min_length": 118.0,
"completions/min_terminated_length": 118.0,
"epoch": 0.12376633769005067,
"grad_norm": 0.21710833352295233,
"learning_rate": 9.99113525078214e-07,
"loss": 0.0299,
"num_tokens": 6290170.0,
"reward": 0.7421875,
"reward_std": 0.23235777020454407,
"rewards/accuracy_reward/mean": 0.73828125,
"rewards/accuracy_reward/std": 0.4404313564300537,
"rewards/format_reward/mean": 0.0078125,
"rewards/format_reward/std": 0.08821486681699753,
"step": 29
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1948.0,
"completions/max_terminated_length": 1948.0,
"completions/mean_length": 700.12890625,
"completions/mean_terminated_length": 700.12890625,
"completions/min_length": 216.0,
"completions/min_terminated_length": 216.0,
"epoch": 0.12803414243798347,
"grad_norm": 0.255577231546662,
"learning_rate": 9.98615113226984e-07,
"loss": 0.0039,
"num_tokens": 6508667.0,
"reward": 0.669921875,
"reward_std": 0.30817121267318726,
"rewards/accuracy_reward/mean": 0.6171875,
"rewards/accuracy_reward/std": 0.48702529072761536,
"rewards/format_reward/mean": 0.10546875,
"rewards/format_reward/std": 0.3077581524848938,
"step": 30
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1779.0,
"completions/max_terminated_length": 1779.0,
"completions/mean_length": 687.99609375,
"completions/mean_terminated_length": 687.99609375,
"completions/min_length": 182.0,
"completions/min_terminated_length": 182.0,
"epoch": 0.13230194718591626,
"grad_norm": 0.26162435398779615,
"learning_rate": 9.980061683013592e-07,
"loss": 0.0094,
"num_tokens": 6725066.0,
"reward": 0.689453125,
"reward_std": 0.2880241870880127,
"rewards/accuracy_reward/mean": 0.62890625,
"rewards/accuracy_reward/std": 0.48404383659362793,
"rewards/format_reward/mean": 0.12109375,
"rewards/format_reward/std": 0.3268752694129944,
"step": 31
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1525.0,
"completions/mean_length": 701.85546875,
"completions/mean_terminated_length": 696.5765380859375,
"completions/min_length": 199.0,
"completions/min_terminated_length": 199.0,
"epoch": 0.13656975193384902,
"grad_norm": 0.2031469974867505,
"learning_rate": 9.972868252923432e-07,
"loss": 0.0196,
"num_tokens": 6953621.0,
"reward": 0.66796875,
"reward_std": 0.20259632170200348,
"rewards/accuracy_reward/mean": 0.609375,
"rewards/accuracy_reward/std": 0.48884621262550354,
"rewards/format_reward/mean": 0.1171875,
"rewards/format_reward/std": 0.3222736418247223,
"step": 32
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1830.0,
"completions/mean_length": 703.5859375,
"completions/mean_terminated_length": 693.0,
"completions/min_length": 149.0,
"completions/min_terminated_length": 149.0,
"epoch": 0.1408375566817818,
"grad_norm": 0.22024758680154216,
"learning_rate": 9.964572436640045e-07,
"loss": 0.0146,
"num_tokens": 7183283.0,
"reward": 0.693359375,
"reward_std": 0.21583208441734314,
"rewards/accuracy_reward/mean": 0.671875,
"rewards/accuracy_reward/std": 0.47045037150382996,
"rewards/format_reward/mean": 0.04296875,
"rewards/format_reward/std": 0.20318391919136047,
"step": 33
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1529.0,
"completions/mean_length": 724.53515625,
"completions/mean_terminated_length": 714.1141967773438,
"completions/min_length": 179.0,
"completions/min_terminated_length": 179.0,
"epoch": 0.14510536142971459,
"grad_norm": 0.23527280972558814,
"learning_rate": 9.955176073181249e-07,
"loss": 0.0042,
"num_tokens": 7425828.0,
"reward": 0.6484375,
"reward_std": 0.20720398426055908,
"rewards/accuracy_reward/mean": 0.56640625,
"rewards/accuracy_reward/std": 0.4965413510799408,
"rewards/format_reward/mean": 0.1640625,
"rewards/format_reward/std": 0.3710577189922333,
"step": 34
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1844.0,
"completions/max_terminated_length": 1844.0,
"completions/mean_length": 646.3671875,
"completions/mean_terminated_length": 646.3671875,
"completions/min_length": 210.0,
"completions/min_terminated_length": 210.0,
"epoch": 0.14937316617764737,
"grad_norm": 0.30371213349912707,
"learning_rate": 9.944681245534329e-07,
"loss": 0.0172,
"num_tokens": 7652842.0,
"reward": 0.65234375,
"reward_std": 0.2866480350494385,
"rewards/accuracy_reward/mean": 0.6171875,
"rewards/accuracy_reward/std": 0.48702529072761536,
"rewards/format_reward/mean": 0.0703125,
"rewards/format_reward/std": 0.2561737895011902,
"step": 35
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 2041.0,
"completions/max_terminated_length": 2041.0,
"completions/mean_length": 647.6875,
"completions/mean_terminated_length": 647.6875,
"completions/min_length": 157.0,
"completions/min_terminated_length": 157.0,
"epoch": 0.15364097092558016,
"grad_norm": 0.2356101324079271,
"learning_rate": 9.933090280194278e-07,
"loss": 0.0138,
"num_tokens": 7859442.0,
"reward": 0.71875,
"reward_std": 0.26503604650497437,
"rewards/accuracy_reward/mean": 0.65625,
"rewards/accuracy_reward/std": 0.47588926553726196,
"rewards/format_reward/mean": 0.125,
"rewards/format_reward/std": 0.33136674761772156,
"step": 36
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1796.0,
"completions/max_terminated_length": 1796.0,
"completions/mean_length": 677.33203125,
"completions/mean_terminated_length": 677.33203125,
"completions/min_length": 182.0,
"completions/min_terminated_length": 182.0,
"epoch": 0.15790877567351294,
"grad_norm": 0.22378526166689447,
"learning_rate": 9.920405746648065e-07,
"loss": 0.0115,
"num_tokens": 8072199.0,
"reward": 0.671875,
"reward_std": 0.25537729263305664,
"rewards/accuracy_reward/mean": 0.63671875,
"rewards/accuracy_reward/std": 0.48188701272010803,
"rewards/format_reward/mean": 0.0703125,
"rewards/format_reward/std": 0.2561737895011902,
"step": 37
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1993.0,
"completions/mean_length": 686.2734375,
"completions/mean_terminated_length": 680.933349609375,
"completions/min_length": 199.0,
"completions/min_terminated_length": 199.0,
"epoch": 0.16217658042144573,
"grad_norm": 0.17084203600010728,
"learning_rate": 9.906630456805022e-07,
"loss": 0.0198,
"num_tokens": 8285565.0,
"reward": 0.814453125,
"reward_std": 0.17492994666099548,
"rewards/accuracy_reward/mean": 0.7734375,
"rewards/accuracy_reward/std": 0.41942715644836426,
"rewards/format_reward/mean": 0.08203125,
"rewards/format_reward/std": 0.2749498784542084,
"step": 38
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1823.0,
"completions/max_terminated_length": 1823.0,
"completions/mean_length": 597.94140625,
"completions/mean_terminated_length": 597.94140625,
"completions/min_length": 183.0,
"completions/min_terminated_length": 183.0,
"epoch": 0.1664443851693785,
"grad_norm": 0.24963008842933648,
"learning_rate": 9.891767464373501e-07,
"loss": 0.0058,
"num_tokens": 8477414.0,
"reward": 0.79296875,
"reward_std": 0.26521071791648865,
"rewards/accuracy_reward/mean": 0.73828125,
"rewards/accuracy_reward/std": 0.4404313564300537,
"rewards/format_reward/mean": 0.109375,
"rewards/format_reward/std": 0.31272050738334656,
"step": 39
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1651.0,
"completions/mean_length": 649.14453125,
"completions/mean_terminated_length": 643.6588745117188,
"completions/min_length": 212.0,
"completions/min_terminated_length": 212.0,
"epoch": 0.1707121899173113,
"grad_norm": 0.2987302168287354,
"learning_rate": 9.875820064183934e-07,
"loss": 0.0083,
"num_tokens": 8689635.0,
"reward": 0.73828125,
"reward_std": 0.26423725485801697,
"rewards/accuracy_reward/mean": 0.6875,
"rewards/accuracy_reward/std": 0.4644203782081604,
"rewards/format_reward/mean": 0.1015625,
"rewards/format_reward/std": 0.3026638329029083,
"step": 40
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1856.0,
"completions/mean_length": 683.875,
"completions/mean_terminated_length": 678.5255126953125,
"completions/min_length": 218.0,
"completions/min_terminated_length": 218.0,
"epoch": 0.17497999466524405,
"grad_norm": 0.22032566508097262,
"learning_rate": 9.85879179145843e-07,
"loss": 0.015,
"num_tokens": 8907163.0,
"reward": 0.7578125,
"reward_std": 0.20137226581573486,
"rewards/accuracy_reward/mean": 0.6640625,
"rewards/accuracy_reward/std": 0.4732423722743988,
"rewards/format_reward/mean": 0.1875,
"rewards/format_reward/std": 0.3910769522190094,
"step": 41
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1545.0,
"completions/max_terminated_length": 1545.0,
"completions/mean_length": 607.7109375,
"completions/mean_terminated_length": 607.7109375,
"completions/min_length": 179.0,
"completions/min_terminated_length": 179.0,
"epoch": 0.17924779941317684,
"grad_norm": 0.2342639223973614,
"learning_rate": 9.840686421027082e-07,
"loss": 0.0187,
"num_tokens": 9122681.0,
"reward": 0.6953125,
"reward_std": 0.2190343141555786,
"rewards/accuracy_reward/mean": 0.625,
"rewards/accuracy_reward/std": 0.4850712716579437,
"rewards/format_reward/mean": 0.140625,
"rewards/format_reward/std": 0.3483152687549591,
"step": 42
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01171875,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1982.0,
"completions/mean_length": 693.39453125,
"completions/mean_terminated_length": 677.33203125,
"completions/min_length": 178.0,
"completions/min_terminated_length": 178.0,
"epoch": 0.18351560416110962,
"grad_norm": 0.21886481594628424,
"learning_rate": 9.821507966491177e-07,
"loss": 0.0055,
"num_tokens": 9343838.0,
"reward": 0.6640625,
"reward_std": 0.22423462569713593,
"rewards/accuracy_reward/mean": 0.59375,
"rewards/accuracy_reward/std": 0.49209436774253845,
"rewards/format_reward/mean": 0.140625,
"rewards/format_reward/std": 0.3483152687549591,
"step": 43
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1591.0,
"completions/max_terminated_length": 1591.0,
"completions/mean_length": 628.17578125,
"completions/mean_terminated_length": 628.17578125,
"completions/min_length": 233.0,
"completions/min_terminated_length": 233.0,
"epoch": 0.1877834089090424,
"grad_norm": 0.22548182919178103,
"learning_rate": 9.801260679333434e-07,
"loss": 0.0072,
"num_tokens": 9540523.0,
"reward": 0.783203125,
"reward_std": 0.24792197346687317,
"rewards/accuracy_reward/mean": 0.7421875,
"rewards/accuracy_reward/std": 0.4382871091365814,
"rewards/format_reward/mean": 0.08203125,
"rewards/format_reward/std": 0.2749498784542084,
"step": 44
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1920.0,
"completions/mean_length": 629.16796875,
"completions/mean_terminated_length": 617.9960327148438,
"completions/min_length": 219.0,
"completions/min_terminated_length": 219.0,
"epoch": 0.1920512136569752,
"grad_norm": 0.3321555096230215,
"learning_rate": 9.779949047975568e-07,
"loss": 0.0185,
"num_tokens": 9749422.0,
"reward": 0.740234375,
"reward_std": 0.24637371301651,
"rewards/accuracy_reward/mean": 0.6796875,
"rewards/accuracy_reward/std": 0.4675106406211853,
"rewards/format_reward/mean": 0.12109375,
"rewards/format_reward/std": 0.3268752694129944,
"step": 45
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1974.0,
"completions/mean_length": 606.62109375,
"completions/mean_terminated_length": 595.2716674804688,
"completions/min_length": 221.0,
"completions/min_terminated_length": 221.0,
"epoch": 0.19631901840490798,
"grad_norm": 0.24958863727963904,
"learning_rate": 9.757577796783265e-07,
"loss": 0.0095,
"num_tokens": 9945989.0,
"reward": 0.77734375,
"reward_std": 0.22648513317108154,
"rewards/accuracy_reward/mean": 0.69921875,
"rewards/accuracy_reward/std": 0.45949608087539673,
"rewards/format_reward/mean": 0.15625,
"rewards/format_reward/std": 0.3638034462928772,
"step": 46
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1791.0,
"completions/mean_length": 737.87890625,
"completions/mean_terminated_length": 727.56298828125,
"completions/min_length": 204.0,
"completions/min_terminated_length": 204.0,
"epoch": 0.20058682315284077,
"grad_norm": 0.190159113155924,
"learning_rate": 9.73415188501891e-07,
"loss": -0.0074,
"num_tokens": 10182566.0,
"reward": 0.787109375,
"reward_std": 0.20080013573169708,
"rewards/accuracy_reward/mean": 0.71484375,
"rewards/accuracy_reward/std": 0.4523732364177704,
"rewards/format_reward/mean": 0.14453125,
"rewards/format_reward/std": 0.35231640934944153,
"step": 47
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1747.0,
"completions/mean_length": 647.38671875,
"completions/mean_terminated_length": 641.8941650390625,
"completions/min_length": 177.0,
"completions/min_terminated_length": 177.0,
"epoch": 0.20485462790077355,
"grad_norm": 0.268454809136645,
"learning_rate": 9.709676505742192e-07,
"loss": -0.0002,
"num_tokens": 10392113.0,
"reward": 0.734375,
"reward_std": 0.23577763140201569,
"rewards/accuracy_reward/mean": 0.66015625,
"rewards/accuracy_reward/std": 0.47458380460739136,
"rewards/format_reward/mean": 0.1484375,
"rewards/format_reward/std": 0.3562295734882355,
"step": 48
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1888.0,
"completions/mean_length": 661.5078125,
"completions/mean_terminated_length": 650.590576171875,
"completions/min_length": 214.0,
"completions/min_terminated_length": 214.0,
"epoch": 0.2091224326487063,
"grad_norm": 0.21630956883123373,
"learning_rate": 9.684157084658926e-07,
"loss": 0.0086,
"num_tokens": 10605363.0,
"reward": 0.853515625,
"reward_std": 0.21964912116527557,
"rewards/accuracy_reward/mean": 0.81640625,
"rewards/accuracy_reward/std": 0.387910932302475,
"rewards/format_reward/mean": 0.07421875,
"rewards/format_reward/std": 0.2626400291919708,
"step": 49
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01953125,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1914.0,
"completions/mean_length": 766.078125,
"completions/mean_terminated_length": 740.5418701171875,
"completions/min_length": 234.0,
"completions/min_terminated_length": 234.0,
"epoch": 0.2133902373966391,
"grad_norm": 0.22688368686702495,
"learning_rate": 9.657599278918276e-07,
"loss": 0.0257,
"num_tokens": 10847487.0,
"reward": 0.7421875,
"reward_std": 0.2671869993209839,
"rewards/accuracy_reward/mean": 0.671875,
"rewards/accuracy_reward/std": 0.47045037150382996,
"rewards/format_reward/mean": 0.140625,
"rewards/format_reward/std": 0.3483152687549591,
"step": 50
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1936.0,
"completions/max_terminated_length": 1936.0,
"completions/mean_length": 641.4765625,
"completions/mean_terminated_length": 641.4765625,
"completions/min_length": 225.0,
"completions/min_terminated_length": 225.0,
"epoch": 0.21765804214457188,
"grad_norm": 0.2846024559524484,
"learning_rate": 9.630008975858665e-07,
"loss": 0.0014,
"num_tokens": 11052521.0,
"reward": 0.73046875,
"reward_std": 0.26468726992607117,
"rewards/accuracy_reward/mean": 0.65234375,
"rewards/accuracy_reward/std": 0.4771590530872345,
"rewards/format_reward/mean": 0.15625,
"rewards/format_reward/std": 0.3638034462928772,
"step": 51
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1815.0,
"completions/max_terminated_length": 1815.0,
"completions/mean_length": 772.2265625,
"completions/mean_terminated_length": 772.2265625,
"completions/min_length": 250.0,
"completions/min_terminated_length": 250.0,
"epoch": 0.22192584689250466,
"grad_norm": 0.20216823285321933,
"learning_rate": 9.601392291702693e-07,
"loss": 0.0001,
"num_tokens": 11297443.0,
"reward": 0.75,
"reward_std": 0.23809123039245605,
"rewards/accuracy_reward/mean": 0.67578125,
"rewards/accuracy_reward/std": 0.46899911761283875,
"rewards/format_reward/mean": 0.1484375,
"rewards/format_reward/std": 0.3562295734882355,
"step": 52
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1827.0,
"completions/max_terminated_length": 1827.0,
"completions/mean_length": 600.21484375,
"completions/mean_terminated_length": 600.21484375,
"completions/min_length": 158.0,
"completions/min_terminated_length": 158.0,
"epoch": 0.22619365164043745,
"grad_norm": 0.2726804626120724,
"learning_rate": 9.571755570201264e-07,
"loss": 0.012,
"num_tokens": 11486002.0,
"reward": 0.861328125,
"reward_std": 0.2225569188594818,
"rewards/accuracy_reward/mean": 0.8046875,
"rewards/accuracy_reward/std": 0.39721766114234924,
"rewards/format_reward/mean": 0.11328125,
"rewards/format_reward/std": 0.31755712628364563,
"step": 53
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1649.0,
"completions/mean_length": 617.546875,
"completions/mean_terminated_length": 611.9373168945312,
"completions/min_length": 216.0,
"completions/min_terminated_length": 216.0,
"epoch": 0.23046145638837023,
"grad_norm": 0.24894008585958025,
"learning_rate": 9.54110538122733e-07,
"loss": 0.0161,
"num_tokens": 11683894.0,
"reward": 0.83984375,
"reward_std": 0.2143787145614624,
"rewards/accuracy_reward/mean": 0.70703125,
"rewards/accuracy_reward/std": 0.45601576566696167,
"rewards/format_reward/mean": 0.265625,
"rewards/format_reward/std": 0.4425306022167206,
"step": 54
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01171875,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1745.0,
"completions/mean_length": 714.12109375,
"completions/mean_terminated_length": 698.3043823242188,
"completions/min_length": 205.0,
"completions/min_terminated_length": 205.0,
"epoch": 0.23472926113630302,
"grad_norm": 0.2732357959245951,
"learning_rate": 9.509448519319454e-07,
"loss": 0.0154,
"num_tokens": 11913069.0,
"reward": 0.658203125,
"reward_std": 0.26149094104766846,
"rewards/accuracy_reward/mean": 0.546875,
"rewards/accuracy_reward/std": 0.4987730085849762,
"rewards/format_reward/mean": 0.22265625,
"rewards/format_reward/std": 0.41684433817863464,
"step": 55
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1636.0,
"completions/mean_length": 685.7890625,
"completions/mean_terminated_length": 680.4470825195312,
"completions/min_length": 168.0,
"completions/min_terminated_length": 168.0,
"epoch": 0.2389970658842358,
"grad_norm": 0.2286495814498294,
"learning_rate": 9.47679200217562e-07,
"loss": -0.0007,
"num_tokens": 12144967.0,
"reward": 0.693359375,
"reward_std": 0.2447323501110077,
"rewards/accuracy_reward/mean": 0.6015625,
"rewards/accuracy_reward/std": 0.4905354380607605,
"rewards/format_reward/mean": 0.18359375,
"rewards/format_reward/std": 0.387910932302475,
"step": 56
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1769.0,
"completions/mean_length": 723.875,
"completions/mean_terminated_length": 713.4487915039062,
"completions/min_length": 232.0,
"completions/min_terminated_length": 232.0,
"epoch": 0.2432648706321686,
"grad_norm": 0.24594802255709164,
"learning_rate": 9.44314306909753e-07,
"loss": 0.0105,
"num_tokens": 12389999.0,
"reward": 0.705078125,
"reward_std": 0.27474117279052734,
"rewards/accuracy_reward/mean": 0.61328125,
"rewards/accuracy_reward/std": 0.4879522919654846,
"rewards/format_reward/mean": 0.18359375,
"rewards/format_reward/std": 0.387910932302475,
"step": 57
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1701.0,
"completions/mean_length": 694.6796875,
"completions/mean_terminated_length": 684.0236206054688,
"completions/min_length": 178.0,
"completions/min_terminated_length": 178.0,
"epoch": 0.24753267538010135,
"grad_norm": 0.25619434925454265,
"learning_rate": 9.408509179385804e-07,
"loss": 0.0166,
"num_tokens": 12613853.0,
"reward": 0.796875,
"reward_std": 0.22640833258628845,
"rewards/accuracy_reward/mean": 0.71875,
"rewards/accuracy_reward/std": 0.45048993825912476,
"rewards/format_reward/mean": 0.15625,
"rewards/format_reward/std": 0.3638034462928772,
"step": 58
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1899.0,
"completions/mean_length": 692.82421875,
"completions/mean_terminated_length": 682.153564453125,
"completions/min_length": 231.0,
"completions/min_terminated_length": 231.0,
"epoch": 0.25180048012803413,
"grad_norm": 0.2225686619157928,
"learning_rate": 9.3728980106864e-07,
"loss": 0.0037,
"num_tokens": 12839184.0,
"reward": 0.796875,
"reward_std": 0.23136967420578003,
"rewards/accuracy_reward/mean": 0.7109375,
"rewards/accuracy_reward/std": 0.45421501994132996,
"rewards/format_reward/mean": 0.171875,
"rewards/format_reward/std": 0.3780108094215393,
"step": 59
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1876.0,
"completions/mean_length": 703.921875,
"completions/mean_terminated_length": 693.3385620117188,
"completions/min_length": 216.0,
"completions/min_terminated_length": 216.0,
"epoch": 0.25606828487596694,
"grad_norm": 0.3592689197114455,
"learning_rate": 9.336317457288629e-07,
"loss": 0.0113,
"num_tokens": 13077748.0,
"reward": 0.708984375,
"reward_std": 0.31907516717910767,
"rewards/accuracy_reward/mean": 0.61328125,
"rewards/accuracy_reward/std": 0.4879522919654846,
"rewards/format_reward/mean": 0.19140625,
"rewards/format_reward/std": 0.39417871832847595,
"step": 60
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0234375,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1709.0,
"completions/mean_length": 745.40234375,
"completions/mean_terminated_length": 714.1400146484375,
"completions/min_length": 200.0,
"completions/min_terminated_length": 200.0,
"epoch": 0.2603360896238997,
"grad_norm": 0.23607664790636312,
"learning_rate": 9.29877562837515e-07,
"loss": 0.029,
"num_tokens": 13308051.0,
"reward": 0.720703125,
"reward_std": 0.27129217982292175,
"rewards/accuracy_reward/mean": 0.62109375,
"rewards/accuracy_reward/std": 0.4860650300979614,
"rewards/format_reward/mean": 0.19921875,
"rewards/format_reward/std": 0.40019527077674866,
"step": 61
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1934.0,
"completions/max_terminated_length": 1934.0,
"completions/mean_length": 653.22265625,
"completions/mean_terminated_length": 653.22265625,
"completions/min_length": 185.0,
"completions/min_terminated_length": 185.0,
"epoch": 0.2646038943718325,
"grad_norm": 0.2742367554221537,
"learning_rate": 9.260280846224327e-07,
"loss": -0.0131,
"num_tokens": 13521412.0,
"reward": 0.794921875,
"reward_std": 0.2132212221622467,
"rewards/accuracy_reward/mean": 0.70703125,
"rewards/accuracy_reward/std": 0.45601576566696167,
"rewards/format_reward/mean": 0.17578125,
"rewards/format_reward/std": 0.3813795745372772,
"step": 62
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01171875,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1939.0,
"completions/mean_length": 698.3046875,
"completions/mean_terminated_length": 682.3004150390625,
"completions/min_length": 213.0,
"completions/min_terminated_length": 213.0,
"epoch": 0.2688716991197653,
"grad_norm": 0.29476738926195406,
"learning_rate": 9.220841644365343e-07,
"loss": 0.0034,
"num_tokens": 13747098.0,
"reward": 0.84765625,
"reward_std": 0.26552915573120117,
"rewards/accuracy_reward/mean": 0.703125,
"rewards/accuracy_reward/std": 0.45777595043182373,
"rewards/format_reward/mean": 0.2890625,
"rewards/format_reward/std": 0.45421501994132996,
"step": 63
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.015625,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1989.0,
"completions/mean_length": 669.875,
"completions/mean_terminated_length": 648.0000610351562,
"completions/min_length": 179.0,
"completions/min_terminated_length": 179.0,
"epoch": 0.27313950386769803,
"grad_norm": 0.4326215315246476,
"learning_rate": 9.180466765686483e-07,
"loss": 0.0113,
"num_tokens": 13958250.0,
"reward": 0.91015625,
"reward_std": 0.2968641519546509,
"rewards/accuracy_reward/mean": 0.6875,
"rewards/accuracy_reward/std": 0.4644203782081604,
"rewards/format_reward/mean": 0.4453125,
"rewards/format_reward/std": 0.49797385931015015,
"step": 64
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1911.0,
"completions/mean_length": 679.34765625,
"completions/mean_terminated_length": 673.9804077148438,
"completions/min_length": 228.0,
"completions/min_terminated_length": 228.0,
"epoch": 0.27740730861563084,
"grad_norm": 0.7511483951516248,
"learning_rate": 9.139165160497016e-07,
"loss": 0.0075,
"num_tokens": 14173243.0,
"reward": 0.90234375,
"reward_std": 0.3380991220474243,
"rewards/accuracy_reward/mean": 0.6640625,
"rewards/accuracy_reward/std": 0.4732423722743988,
"rewards/format_reward/mean": 0.4765625,
"rewards/format_reward/std": 0.5004287362098694,
"step": 65
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01171875,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1978.0,
"completions/mean_length": 721.9453125,
"completions/mean_terminated_length": 706.2213745117188,
"completions/min_length": 258.0,
"completions/min_terminated_length": 258.0,
"epoch": 0.2816751133635636,
"grad_norm": 0.6085854387213407,
"learning_rate": 9.096945984543081e-07,
"loss": 0.0048,
"num_tokens": 14395845.0,
"reward": 1.123046875,
"reward_std": 0.3382420539855957,
"rewards/accuracy_reward/mean": 0.6953125,
"rewards/accuracy_reward/std": 0.4611765742301941,
"rewards/format_reward/mean": 0.85546875,
"rewards/format_reward/std": 0.35231640934944153,
"step": 66
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1676.0,
"completions/mean_length": 749.703125,
"completions/mean_terminated_length": 744.61181640625,
"completions/min_length": 249.0,
"completions/min_terminated_length": 249.0,
"epoch": 0.2859429181114964,
"grad_norm": 0.2571068732895392,
"learning_rate": 9.053818596978049e-07,
"loss": 0.0109,
"num_tokens": 14628033.0,
"reward": 1.126953125,
"reward_std": 0.2895796000957489,
"rewards/accuracy_reward/mean": 0.64453125,
"rewards/accuracy_reward/std": 0.4795927405357361,
"rewards/format_reward/mean": 0.96484375,
"rewards/format_reward/std": 0.18453538417816162,
"step": 67
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1841.0,
"completions/max_terminated_length": 1841.0,
"completions/mean_length": 719.26953125,
"completions/mean_terminated_length": 719.26953125,
"completions/min_length": 272.0,
"completions/min_terminated_length": 272.0,
"epoch": 0.29021072285942917,
"grad_norm": 0.28818591567522955,
"learning_rate": 9.009792558287776e-07,
"loss": -0.0131,
"num_tokens": 14861670.0,
"reward": 1.16015625,
"reward_std": 0.20511436462402344,
"rewards/accuracy_reward/mean": 0.6796875,
"rewards/accuracy_reward/std": 0.4675106406211853,
"rewards/format_reward/mean": 0.9609375,
"rewards/format_reward/std": 0.19412322342395782,
"step": 68
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01171875,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1978.0,
"completions/mean_length": 796.40234375,
"completions/mean_terminated_length": 781.561279296875,
"completions/min_length": 215.0,
"completions/min_terminated_length": 215.0,
"epoch": 0.294478527607362,
"grad_norm": 0.29612312731557583,
"learning_rate": 8.964877628171239e-07,
"loss": 0.0256,
"num_tokens": 15104197.0,
"reward": 1.12890625,
"reward_std": 0.3324652314186096,
"rewards/accuracy_reward/mean": 0.65234375,
"rewards/accuracy_reward/std": 0.4771590530872345,
"rewards/format_reward/mean": 0.953125,
"rewards/format_reward/std": 0.21178513765335083,
"step": 69
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1908.0,
"completions/mean_length": 663.68359375,
"completions/mean_terminated_length": 652.783447265625,
"completions/min_length": 189.0,
"completions/min_terminated_length": 189.0,
"epoch": 0.29874633235529474,
"grad_norm": 0.3246940201717547,
"learning_rate": 8.919083763377e-07,
"loss": 0.0066,
"num_tokens": 15316380.0,
"reward": 1.24609375,
"reward_std": 0.2827882468700409,
"rewards/accuracy_reward/mean": 0.765625,
"rewards/accuracy_reward/std": 0.42443734407424927,
"rewards/format_reward/mean": 0.9609375,
"rewards/format_reward/std": 0.19412322342395782,
"step": 70
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1951.0,
"completions/max_terminated_length": 1951.0,
"completions/mean_length": 758.421875,
"completions/mean_terminated_length": 758.421875,
"completions/min_length": 280.0,
"completions/min_terminated_length": 280.0,
"epoch": 0.30301413710322755,
"grad_norm": 0.3371914282568013,
"learning_rate": 8.872421115495995e-07,
"loss": 0.0105,
"num_tokens": 15555160.0,
"reward": 1.087890625,
"reward_std": 0.28879427909851074,
"rewards/accuracy_reward/mean": 0.60546875,
"rewards/accuracy_reward/std": 0.48970720171928406,
"rewards/format_reward/mean": 0.96484375,
"rewards/format_reward/std": 0.18453538417816162,
"step": 71
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1713.0,
"completions/max_terminated_length": 1713.0,
"completions/mean_length": 723.99609375,
"completions/mean_terminated_length": 723.99609375,
"completions/min_length": 254.0,
"completions/min_terminated_length": 254.0,
"epoch": 0.3072819418511603,
"grad_norm": 0.261972313519586,
"learning_rate": 8.824900028711128e-07,
"loss": -0.0052,
"num_tokens": 15782895.0,
"reward": 1.224609375,
"reward_std": 0.3060935139656067,
"rewards/accuracy_reward/mean": 0.734375,
"rewards/accuracy_reward/std": 0.4425306022167206,
"rewards/format_reward/mean": 0.98046875,
"rewards/format_reward/std": 0.13865381479263306,
"step": 72
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1737.0,
"completions/max_terminated_length": 1737.0,
"completions/mean_length": 690.74609375,
"completions/mean_terminated_length": 690.74609375,
"completions/min_length": 235.0,
"completions/min_terminated_length": 235.0,
"epoch": 0.31154974659909307,
"grad_norm": 0.30539712628741345,
"learning_rate": 8.776531037504169e-07,
"loss": 0.0203,
"num_tokens": 16002830.0,
"reward": 1.17578125,
"reward_std": 0.25357601046562195,
"rewards/accuracy_reward/mean": 0.6875,
"rewards/accuracy_reward/std": 0.4644203782081604,
"rewards/format_reward/mean": 0.9765625,
"rewards/format_reward/std": 0.15158477425575256,
"step": 73
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01171875,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1731.0,
"completions/mean_length": 835.28125,
"completions/mean_terminated_length": 820.9012451171875,
"completions/min_length": 241.0,
"completions/min_terminated_length": 241.0,
"epoch": 0.3158175513470259,
"grad_norm": 0.24036500137818684,
"learning_rate": 8.727324864320471e-07,
"loss": 0.0047,
"num_tokens": 16262718.0,
"reward": 1.134765625,
"reward_std": 0.2882940173149109,
"rewards/accuracy_reward/mean": 0.65234375,
"rewards/accuracy_reward/std": 0.4771590530872345,
"rewards/format_reward/mean": 0.96484375,
"rewards/format_reward/std": 0.18453538417816162,
"step": 74
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01171875,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 2021.0,
"completions/mean_length": 829.76953125,
"completions/mean_terminated_length": 815.3241577148438,
"completions/min_length": 253.0,
"completions/min_terminated_length": 253.0,
"epoch": 0.32008535609495864,
"grad_norm": 0.23573518101404708,
"learning_rate": 8.677292417192016e-07,
"loss": 0.0198,
"num_tokens": 16517427.0,
"reward": 1.115234375,
"reward_std": 0.2808934450149536,
"rewards/accuracy_reward/mean": 0.63671875,
"rewards/accuracy_reward/std": 0.48188701272010803,
"rewards/format_reward/mean": 0.95703125,
"rewards/format_reward/std": 0.20318391919136047,
"step": 75
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1830.0,
"completions/mean_length": 641.53125,
"completions/mean_terminated_length": 630.4566650390625,
"completions/min_length": 148.0,
"completions/min_terminated_length": 148.0,
"epoch": 0.32435316084289145,
"grad_norm": 0.2668783476917137,
"learning_rate": 8.626444787319317e-07,
"loss": 0.003,
"num_tokens": 16723107.0,
"reward": 1.26953125,
"reward_std": 0.20704886317253113,
"rewards/accuracy_reward/mean": 0.78125,
"rewards/accuracy_reward/std": 0.41420844197273254,
"rewards/format_reward/mean": 0.9765625,
"rewards/format_reward/std": 0.15158477425575256,
"step": 76
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.015625,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 2046.0,
"completions/mean_length": 813.3359375,
"completions/mean_terminated_length": 793.7381591796875,
"completions/min_length": 223.0,
"completions/min_terminated_length": 223.0,
"epoch": 0.3286209655908242,
"grad_norm": 0.26681177348017476,
"learning_rate": 8.574793246612726e-07,
"loss": -0.0007,
"num_tokens": 16984777.0,
"reward": 1.091796875,
"reward_std": 0.28809982538223267,
"rewards/accuracy_reward/mean": 0.61328125,
"rewards/accuracy_reward/std": 0.4879522919654846,
"rewards/format_reward/mean": 0.95703125,
"rewards/format_reward/std": 0.20318391919136047,
"step": 77
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1877.0,
"completions/mean_length": 795.22265625,
"completions/mean_terminated_length": 790.3098754882812,
"completions/min_length": 197.0,
"completions/min_terminated_length": 197.0,
"epoch": 0.332888770338757,
"grad_norm": 0.320363477006708,
"learning_rate": 8.52234924519367e-07,
"loss": -0.0152,
"num_tokens": 17224858.0,
"reward": 1.21484375,
"reward_std": 0.29282277822494507,
"rewards/accuracy_reward/mean": 0.7265625,
"rewards/accuracy_reward/std": 0.446596622467041,
"rewards/format_reward/mean": 0.9765625,
"rewards/format_reward/std": 0.15158477425575256,
"step": 78
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 2020.0,
"completions/mean_length": 818.08984375,
"completions/mean_terminated_length": 808.405517578125,
"completions/min_length": 208.0,
"completions/min_terminated_length": 208.0,
"epoch": 0.3371565750866898,
"grad_norm": 0.25337879357735843,
"learning_rate": 8.469124408856383e-07,
"loss": -0.0028,
"num_tokens": 17489809.0,
"reward": 1.142578125,
"reward_std": 0.2314775288105011,
"rewards/accuracy_reward/mean": 0.65234375,
"rewards/accuracy_reward/std": 0.4771590530872345,
"rewards/format_reward/mean": 0.98046875,
"rewards/format_reward/std": 0.13865381479263306,
"step": 79
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1954.0,
"completions/mean_length": 706.01953125,
"completions/mean_terminated_length": 695.4527587890625,
"completions/min_length": 212.0,
"completions/min_terminated_length": 212.0,
"epoch": 0.3414243798346226,
"grad_norm": 0.21535987693263495,
"learning_rate": 8.41513053649071e-07,
"loss": 0.0194,
"num_tokens": 17722414.0,
"reward": 1.2109375,
"reward_std": 0.213466078042984,
"rewards/accuracy_reward/mean": 0.71875,
"rewards/accuracy_reward/std": 0.45048993825912476,
"rewards/format_reward/mean": 0.984375,
"rewards/format_reward/std": 0.12426253408193588,
"step": 80
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0234375,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1874.0,
"completions/mean_length": 769.6640625,
"completions/mean_terminated_length": 738.9840087890625,
"completions/min_length": 219.0,
"completions/min_terminated_length": 219.0,
"epoch": 0.34569218458255535,
"grad_norm": 0.1982703781690444,
"learning_rate": 8.360379597466518e-07,
"loss": 0.0348,
"num_tokens": 17962208.0,
"reward": 1.224609375,
"reward_std": 0.21272222697734833,
"rewards/accuracy_reward/mean": 0.73828125,
"rewards/accuracy_reward/std": 0.4404313564300537,
"rewards/format_reward/mean": 0.97265625,
"rewards/format_reward/std": 0.1634024828672409,
"step": 81
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.02734375,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1749.0,
"completions/mean_length": 785.15234375,
"completions/mean_terminated_length": 749.6505737304688,
"completions/min_length": 165.0,
"completions/min_terminated_length": 165.0,
"epoch": 0.3499599893304881,
"grad_norm": 0.2700320029798219,
"learning_rate": 8.304883728980323e-07,
"loss": 0.0217,
"num_tokens": 18210879.0,
"reward": 1.23046875,
"reward_std": 0.21052110195159912,
"rewards/accuracy_reward/mean": 0.74609375,
"rewards/accuracy_reward/std": 0.4360972046852112,
"rewards/format_reward/mean": 0.96875,
"rewards/format_reward/std": 0.17433346807956696,
"step": 82
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.015625,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 2035.0,
"completions/mean_length": 855.36328125,
"completions/mean_terminated_length": 836.4326171875,
"completions/min_length": 270.0,
"completions/min_terminated_length": 270.0,
"epoch": 0.3542277940784209,
"grad_norm": 0.2259472559883516,
"learning_rate": 8.248655233364723e-07,
"loss": 0.0316,
"num_tokens": 18466476.0,
"reward": 1.185546875,
"reward_std": 0.2992502450942993,
"rewards/accuracy_reward/mean": 0.6953125,
"rewards/accuracy_reward/std": 0.4611765742301941,
"rewards/format_reward/mean": 0.98046875,
"rewards/format_reward/std": 0.13865381479263306,
"step": 83
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 2017.0,
"completions/mean_length": 743.55859375,
"completions/mean_terminated_length": 738.4431762695312,
"completions/min_length": 216.0,
"completions/min_terminated_length": 216.0,
"epoch": 0.3584955988263537,
"grad_norm": 0.20179872361001377,
"learning_rate": 8.191706575361207e-07,
"loss": -0.009,
"num_tokens": 18703619.0,
"reward": 1.212890625,
"reward_std": 0.22027891874313354,
"rewards/accuracy_reward/mean": 0.71875,
"rewards/accuracy_reward/std": 0.45048993825912476,
"rewards/format_reward/mean": 0.98828125,
"rewards/format_reward/std": 0.1078278198838234,
"step": 84
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1655.0,
"completions/max_terminated_length": 1655.0,
"completions/mean_length": 659.94140625,
"completions/mean_terminated_length": 659.94140625,
"completions/min_length": 251.0,
"completions/min_terminated_length": 251.0,
"epoch": 0.3627634035742865,
"grad_norm": 0.22687581014820055,
"learning_rate": 8.134050379356969e-07,
"loss": 0.0134,
"num_tokens": 18910716.0,
"reward": 1.212890625,
"reward_std": 0.2215677797794342,
"rewards/accuracy_reward/mean": 0.71484375,
"rewards/accuracy_reward/std": 0.4523732364177704,
"rewards/format_reward/mean": 0.99609375,
"rewards/format_reward/std": 0.0625,
"step": 85
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01171875,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1999.0,
"completions/mean_length": 771.36328125,
"completions/mean_terminated_length": 756.225341796875,
"completions/min_length": 267.0,
"completions/min_terminated_length": 267.0,
"epoch": 0.36703120832221925,
"grad_norm": 0.24227320994201745,
"learning_rate": 8.075699426586343e-07,
"loss": 0.0024,
"num_tokens": 19145401.0,
"reward": 1.212890625,
"reward_std": 0.23671406507492065,
"rewards/accuracy_reward/mean": 0.71875,
"rewards/accuracy_reward/std": 0.45048993825912476,
"rewards/format_reward/mean": 0.98828125,
"rewards/format_reward/std": 0.1078278198838234,
"step": 86
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01171875,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1977.0,
"completions/mean_length": 803.4375,
"completions/mean_terminated_length": 788.6798706054688,
"completions/min_length": 200.0,
"completions/min_terminated_length": 200.0,
"epoch": 0.37129901307015206,
"grad_norm": 0.20483623411688262,
"learning_rate": 8.016666652297441e-07,
"loss": 0.0157,
"num_tokens": 19398921.0,
"reward": 1.2265625,
"reward_std": 0.21405605971813202,
"rewards/accuracy_reward/mean": 0.734375,
"rewards/accuracy_reward/std": 0.4425306022167206,
"rewards/format_reward/mean": 0.984375,
"rewards/format_reward/std": 0.12426253408193588,
"step": 87
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1937.0,
"completions/max_terminated_length": 1937.0,
"completions/mean_length": 741.87109375,
"completions/mean_terminated_length": 741.87109375,
"completions/min_length": 270.0,
"completions/min_terminated_length": 270.0,
"epoch": 0.3755668178180848,
"grad_norm": 0.19112816030034602,
"learning_rate": 7.956965142884678e-07,
"loss": 0.0039,
"num_tokens": 19625720.0,
"reward": 1.220703125,
"reward_std": 0.20308047533035278,
"rewards/accuracy_reward/mean": 0.72265625,
"rewards/accuracy_reward/std": 0.4485645890235901,
"rewards/format_reward/mean": 0.99609375,
"rewards/format_reward/std": 0.0625,
"step": 88
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1953.0,
"completions/mean_length": 781.33984375,
"completions/mean_terminated_length": 776.3726196289062,
"completions/min_length": 255.0,
"completions/min_terminated_length": 255.0,
"epoch": 0.37983462256601763,
"grad_norm": 0.25350243536863626,
"learning_rate": 7.896608132987769e-07,
"loss": 0.0414,
"num_tokens": 19868151.0,
"reward": 1.177734375,
"reward_std": 0.28659552335739136,
"rewards/accuracy_reward/mean": 0.6796875,
"rewards/accuracy_reward/std": 0.4675106406211853,
"rewards/format_reward/mean": 0.99609375,
"rewards/format_reward/std": 0.0625,
"step": 89
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1993.0,
"completions/mean_length": 766.66015625,
"completions/mean_terminated_length": 756.5708618164062,
"completions/min_length": 212.0,
"completions/min_terminated_length": 212.0,
"epoch": 0.3841024273139504,
"grad_norm": 0.22695022996042657,
"learning_rate": 7.835609002557882e-07,
"loss": 0.0083,
"num_tokens": 20119208.0,
"reward": 1.22265625,
"reward_std": 0.2322777509689331,
"rewards/accuracy_reward/mean": 0.7265625,
"rewards/accuracy_reward/std": 0.446596622467041,
"rewards/format_reward/mean": 0.9921875,
"rewards/format_reward/std": 0.08821486681699753,
"step": 90
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1969.0,
"completions/mean_length": 861.4453125,
"completions/mean_terminated_length": 852.1023559570312,
"completions/min_length": 281.0,
"completions/min_terminated_length": 281.0,
"epoch": 0.38837023206188315,
"grad_norm": 0.2316928626966252,
"learning_rate": 7.773981273891561e-07,
"loss": 0.0146,
"num_tokens": 20386306.0,
"reward": 1.13671875,
"reward_std": 0.31841927766799927,
"rewards/accuracy_reward/mean": 0.640625,
"rewards/accuracy_reward/std": 0.4807571768760681,
"rewards/format_reward/mean": 0.9921875,
"rewards/format_reward/std": 0.08821486681699753,
"step": 91
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1847.0,
"completions/mean_length": 809.14453125,
"completions/mean_terminated_length": 799.3897705078125,
"completions/min_length": 184.0,
"completions/min_terminated_length": 184.0,
"epoch": 0.39263803680981596,
"grad_norm": 0.23178482415510882,
"learning_rate": 7.711738608633098e-07,
"loss": 0.0211,
"num_tokens": 20635847.0,
"reward": 1.169921875,
"reward_std": 0.23685963451862335,
"rewards/accuracy_reward/mean": 0.67578125,
"rewards/accuracy_reward/std": 0.46899911761283875,
"rewards/format_reward/mean": 0.98828125,
"rewards/format_reward/std": 0.1078278198838234,
"step": 92
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.015625,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 2034.0,
"completions/mean_length": 806.921875,
"completions/mean_terminated_length": 787.2222900390625,
"completions/min_length": 177.0,
"completions/min_terminated_length": 177.0,
"epoch": 0.3969058415577487,
"grad_norm": 0.18633447879484324,
"learning_rate": 7.64889480474603e-07,
"loss": 0.0313,
"num_tokens": 20888427.0,
"reward": 1.205078125,
"reward_std": 0.24055463075637817,
"rewards/accuracy_reward/mean": 0.7109375,
"rewards/accuracy_reward/std": 0.45421501994132996,
"rewards/format_reward/mean": 0.98828125,
"rewards/format_reward/std": 0.1078278198838234,
"step": 93
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1987.0,
"completions/mean_length": 713.9296875,
"completions/mean_terminated_length": 708.6980590820312,
"completions/min_length": 190.0,
"completions/min_terminated_length": 190.0,
"epoch": 0.40117364630568153,
"grad_norm": 0.1956249704499026,
"learning_rate": 7.585463793454392e-07,
"loss": 0.0154,
"num_tokens": 21105705.0,
"reward": 1.255859375,
"reward_std": 0.23011668026447296,
"rewards/accuracy_reward/mean": 0.76171875,
"rewards/accuracy_reward/std": 0.4268665909767151,
"rewards/format_reward/mean": 0.98828125,
"rewards/format_reward/std": 0.1078278198838234,
"step": 94
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01171875,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1842.0,
"completions/mean_length": 793.56640625,
"completions/mean_terminated_length": 778.6917114257812,
"completions/min_length": 264.0,
"completions/min_terminated_length": 264.0,
"epoch": 0.4054414510536143,
"grad_norm": 0.2472639941684933,
"learning_rate": 7.521459636154447e-07,
"loss": 0.0125,
"num_tokens": 21353970.0,
"reward": 1.125,
"reward_std": 0.26645293831825256,
"rewards/accuracy_reward/mean": 0.6328125,
"rewards/accuracy_reward/std": 0.48298248648643494,
"rewards/format_reward/mean": 0.984375,
"rewards/format_reward/std": 0.12426253408193588,
"step": 95
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.015625,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1900.0,
"completions/mean_length": 762.27734375,
"completions/mean_terminated_length": 741.8690795898438,
"completions/min_length": 237.0,
"completions/min_terminated_length": 237.0,
"epoch": 0.4097092558015471,
"grad_norm": 0.22719700972415768,
"learning_rate": 7.456896521297553e-07,
"loss": 0.0161,
"num_tokens": 21604073.0,
"reward": 1.0703125,
"reward_std": 0.2951740622520447,
"rewards/accuracy_reward/mean": 0.59375,
"rewards/accuracy_reward/std": 0.49209436774253845,
"rewards/format_reward/mean": 0.953125,
"rewards/format_reward/std": 0.21178513765335083,
"step": 96
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1830.0,
"completions/max_terminated_length": 1830.0,
"completions/mean_length": 624.3671875,
"completions/mean_terminated_length": 624.3671875,
"completions/min_length": 182.0,
"completions/min_terminated_length": 182.0,
"epoch": 0.41397706054947986,
"grad_norm": 0.2616176892409917,
"learning_rate": 7.391788761244866e-07,
"loss": 0.0264,
"num_tokens": 21809239.0,
"reward": 1.27734375,
"reward_std": 0.2219943106174469,
"rewards/accuracy_reward/mean": 0.77734375,
"rewards/accuracy_reward/std": 0.41684433817863464,
"rewards/format_reward/mean": 1.0,
"rewards/format_reward/std": 0.0,
"step": 97
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01171875,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1893.0,
"completions/mean_length": 701.390625,
"completions/mean_terminated_length": 685.4229736328125,
"completions/min_length": 283.0,
"completions/min_terminated_length": 283.0,
"epoch": 0.4182448652974126,
"grad_norm": 0.23086995406492392,
"learning_rate": 7.32615078909457e-07,
"loss": 0.0076,
"num_tokens": 22052003.0,
"reward": 1.15234375,
"reward_std": 0.2105971872806549,
"rewards/accuracy_reward/mean": 0.66015625,
"rewards/accuracy_reward/std": 0.47458380460739136,
"rewards/format_reward/mean": 0.984375,
"rewards/format_reward/std": 0.12426253408193588,
"step": 98
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1810.0,
"completions/mean_length": 812.75,
"completions/mean_terminated_length": 803.0236206054688,
"completions/min_length": 247.0,
"completions/min_terminated_length": 247.0,
"epoch": 0.42251267004534543,
"grad_norm": 0.21999405421331852,
"learning_rate": 7.259997155482348e-07,
"loss": 0.0092,
"num_tokens": 22303875.0,
"reward": 1.130859375,
"reward_std": 0.2763032913208008,
"rewards/accuracy_reward/mean": 0.6328125,
"rewards/accuracy_reward/std": 0.48298248648643494,
"rewards/format_reward/mean": 0.99609375,
"rewards/format_reward/std": 0.0625,
"step": 99
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1983.0,
"completions/mean_length": 714.99609375,
"completions/mean_terminated_length": 709.7686767578125,
"completions/min_length": 191.0,
"completions/min_terminated_length": 191.0,
"epoch": 0.4267804747932782,
"grad_norm": 0.2606420374536633,
"learning_rate": 7.193342525355796e-07,
"loss": 0.0123,
"num_tokens": 22529954.0,
"reward": 1.25,
"reward_std": 0.21099039912223816,
"rewards/accuracy_reward/mean": 0.7578125,
"rewards/accuracy_reward/std": 0.4292463958263397,
"rewards/format_reward/mean": 0.984375,
"rewards/format_reward/std": 0.12426253408193588,
"step": 100
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1920.0,
"completions/max_terminated_length": 1920.0,
"completions/mean_length": 679.96484375,
"completions/mean_terminated_length": 679.96484375,
"completions/min_length": 246.0,
"completions/min_terminated_length": 246.0,
"epoch": 0.431048279541211,
"grad_norm": 0.2241123206565703,
"learning_rate": 7.126201674723493e-07,
"loss": 0.0073,
"num_tokens": 22755121.0,
"reward": 1.09765625,
"reward_std": 0.20401999354362488,
"rewards/accuracy_reward/mean": 0.6015625,
"rewards/accuracy_reward/std": 0.4905354380607605,
"rewards/format_reward/mean": 0.9921875,
"rewards/format_reward/std": 0.08821486681699753,
"step": 101
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1878.0,
"completions/mean_length": 767.33984375,
"completions/mean_terminated_length": 757.2559204101562,
"completions/min_length": 224.0,
"completions/min_terminated_length": 224.0,
"epoch": 0.43531608428914376,
"grad_norm": 0.2948110164125488,
"learning_rate": 7.058589487379451e-07,
"loss": 0.0145,
"num_tokens": 23004744.0,
"reward": 1.06640625,
"reward_std": 0.32329171895980835,
"rewards/accuracy_reward/mean": 0.5703125,
"rewards/accuracy_reward/std": 0.4960011839866638,
"rewards/format_reward/mean": 0.9921875,
"rewards/format_reward/std": 0.08821486681699753,
"step": 102
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1864.0,
"completions/mean_length": 697.5546875,
"completions/mean_terminated_length": 692.2588500976562,
"completions/min_length": 197.0,
"completions/min_terminated_length": 197.0,
"epoch": 0.43958388903707657,
"grad_norm": 0.2056246102808426,
"learning_rate": 6.990520951603681e-07,
"loss": -0.0033,
"num_tokens": 23219126.0,
"reward": 1.26171875,
"reward_std": 0.21836179494857788,
"rewards/accuracy_reward/mean": 0.765625,
"rewards/accuracy_reward/std": 0.42443734407424927,
"rewards/format_reward/mean": 0.9921875,
"rewards/format_reward/std": 0.08821486681699753,
"step": 103
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.015625,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1992.0,
"completions/mean_length": 835.7578125,
"completions/mean_terminated_length": 816.5159301757812,
"completions/min_length": 199.0,
"completions/min_terminated_length": 199.0,
"epoch": 0.4438516937850093,
"grad_norm": 0.2484672882749487,
"learning_rate": 6.922011156839582e-07,
"loss": 0.0061,
"num_tokens": 23473824.0,
"reward": 1.068359375,
"reward_std": 0.3270253837108612,
"rewards/accuracy_reward/mean": 0.58203125,
"rewards/accuracy_reward/std": 0.49419113993644714,
"rewards/format_reward/mean": 0.97265625,
"rewards/format_reward/std": 0.1634024828672409,
"step": 104
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 2001.0,
"completions/max_terminated_length": 2001.0,
"completions/mean_length": 710.80078125,
"completions/mean_terminated_length": 710.80078125,
"completions/min_length": 223.0,
"completions/min_terminated_length": 223.0,
"epoch": 0.44811949853294214,
"grad_norm": 0.25105305066117434,
"learning_rate": 6.853075290348912e-07,
"loss": 0.0161,
"num_tokens": 23701237.0,
"reward": 1.201171875,
"reward_std": 0.24620795249938965,
"rewards/accuracy_reward/mean": 0.703125,
"rewards/accuracy_reward/std": 0.45777595043182373,
"rewards/format_reward/mean": 0.99609375,
"rewards/format_reward/std": 0.0625,
"step": 105
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01171875,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 2000.0,
"completions/mean_length": 788.74609375,
"completions/mean_terminated_length": 773.8142700195312,
"completions/min_length": 234.0,
"completions/min_terminated_length": 234.0,
"epoch": 0.4523873032808749,
"grad_norm": 0.22406871720408272,
"learning_rate": 6.783728633845075e-07,
"loss": 0.0137,
"num_tokens": 23961140.0,
"reward": 1.09375,
"reward_std": 0.2317473292350769,
"rewards/accuracy_reward/mean": 0.59765625,
"rewards/accuracy_reward/std": 0.4913311004638672,
"rewards/format_reward/mean": 0.9921875,
"rewards/format_reward/std": 0.08821486681699753,
"step": 106
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1640.0,
"completions/max_terminated_length": 1640.0,
"completions/mean_length": 604.0703125,
"completions/mean_terminated_length": 604.0703125,
"completions/min_length": 253.0,
"completions/min_terminated_length": 253.0,
"epoch": 0.45665510802880765,
"grad_norm": 0.18886855604249347,
"learning_rate": 6.713986560105469e-07,
"loss": 0.0047,
"num_tokens": 24149734.0,
"reward": 1.30078125,
"reward_std": 0.13861849904060364,
"rewards/accuracy_reward/mean": 0.80078125,
"rewards/accuracy_reward/std": 0.40019527077674866,
"rewards/format_reward/mean": 1.0,
"rewards/format_reward/std": 0.0,
"step": 107
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1914.0,
"completions/max_terminated_length": 1914.0,
"completions/mean_length": 727.4453125,
"completions/mean_terminated_length": 727.4453125,
"completions/min_length": 207.0,
"completions/min_terminated_length": 207.0,
"epoch": 0.46092291277674047,
"grad_norm": 0.23245578072918718,
"learning_rate": 6.643864529563643e-07,
"loss": 0.0159,
"num_tokens": 24404440.0,
"reward": 1.115234375,
"reward_std": 0.18096782267093658,
"rewards/accuracy_reward/mean": 0.6171875,
"rewards/accuracy_reward/std": 0.48702529072761536,
"rewards/format_reward/mean": 0.99609375,
"rewards/format_reward/std": 0.0625,
"step": 108
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 2031.0,
"completions/mean_length": 722.7890625,
"completions/mean_terminated_length": 712.3543090820312,
"completions/min_length": 210.0,
"completions/min_terminated_length": 210.0,
"epoch": 0.4651907175246732,
"grad_norm": 0.2627076644105312,
"learning_rate": 6.57337808688203e-07,
"loss": 0.0089,
"num_tokens": 24633570.0,
"reward": 1.158203125,
"reward_std": 0.21788835525512695,
"rewards/accuracy_reward/mean": 0.66796875,
"rewards/accuracy_reward/std": 0.4718646705150604,
"rewards/format_reward/mean": 0.98046875,
"rewards/format_reward/std": 0.13865381479263306,
"step": 109
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01171875,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1735.0,
"completions/mean_length": 699.6796875,
"completions/mean_terminated_length": 683.6917114257812,
"completions/min_length": 188.0,
"completions/min_terminated_length": 188.0,
"epoch": 0.46945852227260604,
"grad_norm": 0.2639954977102041,
"learning_rate": 6.502542857506001e-07,
"loss": 0.0212,
"num_tokens": 24861544.0,
"reward": 1.166015625,
"reward_std": 0.25418299436569214,
"rewards/accuracy_reward/mean": 0.671875,
"rewards/accuracy_reward/std": 0.47045037150382996,
"rewards/format_reward/mean": 0.98828125,
"rewards/format_reward/std": 0.1078278198838234,
"step": 110
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1894.0,
"completions/mean_length": 753.1328125,
"completions/mean_terminated_length": 742.93701171875,
"completions/min_length": 205.0,
"completions/min_terminated_length": 205.0,
"epoch": 0.4737263270205388,
"grad_norm": 0.24252034558209698,
"learning_rate": 6.431374544200012e-07,
"loss": 0.0368,
"num_tokens": 25097114.0,
"reward": 1.171875,
"reward_std": 0.2441094070672989,
"rewards/accuracy_reward/mean": 0.67578125,
"rewards/accuracy_reward/std": 0.46899911761283875,
"rewards/format_reward/mean": 0.9921875,
"rewards/format_reward/std": 0.08821486681699753,
"step": 111
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1862.0,
"completions/max_terminated_length": 1862.0,
"completions/mean_length": 679.69140625,
"completions/mean_terminated_length": 679.69140625,
"completions/min_length": 235.0,
"completions/min_terminated_length": 235.0,
"epoch": 0.4779941317684716,
"grad_norm": 0.20218258381065954,
"learning_rate": 6.359888923566619e-07,
"loss": 0.0071,
"num_tokens": 25303539.0,
"reward": 1.234375,
"reward_std": 0.21318364143371582,
"rewards/accuracy_reward/mean": 0.734375,
"rewards/accuracy_reward/std": 0.4425306022167206,
"rewards/format_reward/mean": 1.0,
"rewards/format_reward/std": 0.0,
"step": 112
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 2027.0,
"completions/mean_length": 854.05859375,
"completions/mean_terminated_length": 849.3765258789062,
"completions/min_length": 291.0,
"completions/min_terminated_length": 291.0,
"epoch": 0.48226193651640437,
"grad_norm": 0.2097790119833359,
"learning_rate": 6.288101842549116e-07,
"loss": 0.0004,
"num_tokens": 25577530.0,
"reward": 1.107421875,
"reward_std": 0.2663267254829407,
"rewards/accuracy_reward/mean": 0.609375,
"rewards/accuracy_reward/std": 0.48884621262550354,
"rewards/format_reward/mean": 0.99609375,
"rewards/format_reward/std": 0.0625,
"step": 113
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 2035.0,
"completions/mean_length": 742.39453125,
"completions/mean_terminated_length": 732.1141967773438,
"completions/min_length": 173.0,
"completions/min_terminated_length": 173.0,
"epoch": 0.4865297412643372,
"grad_norm": 0.1970783645539932,
"learning_rate": 6.216029214918575e-07,
"loss": 0.024,
"num_tokens": 25800399.0,
"reward": 1.23828125,
"reward_std": 0.24581098556518555,
"rewards/accuracy_reward/mean": 0.7421875,
"rewards/accuracy_reward/std": 0.4382871091365814,
"rewards/format_reward/mean": 0.9921875,
"rewards/format_reward/std": 0.08821486681699753,
"step": 114
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.015625,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1980.0,
"completions/mean_length": 715.43359375,
"completions/mean_terminated_length": 694.2817993164062,
"completions/min_length": 263.0,
"completions/min_terminated_length": 263.0,
"epoch": 0.49079754601226994,
"grad_norm": 0.24226570112030466,
"learning_rate": 6.14368701774609e-07,
"loss": -0.001,
"num_tokens": 26037006.0,
"reward": 1.130859375,
"reward_std": 0.2230701446533203,
"rewards/accuracy_reward/mean": 0.63671875,
"rewards/accuracy_reward/std": 0.48188701272010803,
"rewards/format_reward/mean": 0.98828125,
"rewards/format_reward/std": 0.1078278198838234,
"step": 115
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1896.0,
"completions/mean_length": 646.16796875,
"completions/mean_terminated_length": 635.1299438476562,
"completions/min_length": 190.0,
"completions/min_terminated_length": 190.0,
"epoch": 0.4950653507602027,
"grad_norm": 0.2454095306081673,
"learning_rate": 6.071091287860972e-07,
"loss": 0.0196,
"num_tokens": 26236641.0,
"reward": 1.216796875,
"reward_std": 0.21910855174064636,
"rewards/accuracy_reward/mean": 0.72265625,
"rewards/accuracy_reward/std": 0.4485645890235901,
"rewards/format_reward/mean": 0.98828125,
"rewards/format_reward/std": 0.1078278198838234,
"step": 116
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01953125,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 2012.0,
"completions/mean_length": 798.85546875,
"completions/mean_terminated_length": 773.9721069335938,
"completions/min_length": 239.0,
"completions/min_terminated_length": 239.0,
"epoch": 0.4993331555081355,
"grad_norm": 0.19024644683224612,
"learning_rate": 5.998258118295698e-07,
"loss": 0.0298,
"num_tokens": 26487340.0,
"reward": 1.1875,
"reward_std": 0.2350744605064392,
"rewards/accuracy_reward/mean": 0.6953125,
"rewards/accuracy_reward/std": 0.4611765742301941,
"rewards/format_reward/mean": 0.984375,
"rewards/format_reward/std": 0.12426253408193588,
"step": 117
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1870.0,
"completions/max_terminated_length": 1870.0,
"completions/mean_length": 716.54296875,
"completions/mean_terminated_length": 716.54296875,
"completions/min_length": 226.0,
"completions/min_terminated_length": 226.0,
"epoch": 0.5036009602560683,
"grad_norm": 0.21715577102819492,
"learning_rate": 5.925203654718415e-07,
"loss": 0.0079,
"num_tokens": 26717367.0,
"reward": 1.298828125,
"reward_std": 0.21700043976306915,
"rewards/accuracy_reward/mean": 0.80078125,
"rewards/accuracy_reward/std": 0.40019527077674866,
"rewards/format_reward/mean": 0.99609375,
"rewards/format_reward/std": 0.0625,
"step": 118
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1935.0,
"completions/max_terminated_length": 1935.0,
"completions/mean_length": 626.43359375,
"completions/mean_terminated_length": 626.43359375,
"completions/min_length": 168.0,
"completions/min_terminated_length": 168.0,
"epoch": 0.507868765004001,
"grad_norm": 0.19850204104488864,
"learning_rate": 5.851944091853756e-07,
"loss": 0.0035,
"num_tokens": 26916910.0,
"reward": 1.28125,
"reward_std": 0.1830746978521347,
"rewards/accuracy_reward/mean": 0.78125,
"rewards/accuracy_reward/std": 0.41420844197273254,
"rewards/format_reward/mean": 1.0,
"rewards/format_reward/std": 0.0,
"step": 119
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01171875,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1808.0,
"completions/mean_length": 745.625,
"completions/mean_terminated_length": 730.1818237304688,
"completions/min_length": 218.0,
"completions/min_terminated_length": 218.0,
"epoch": 0.5121365697519339,
"grad_norm": 0.2375090481981112,
"learning_rate": 5.778495669892797e-07,
"loss": 0.0221,
"num_tokens": 27149782.0,
"reward": 1.15625,
"reward_std": 0.24575507640838623,
"rewards/accuracy_reward/mean": 0.6640625,
"rewards/accuracy_reward/std": 0.4732423722743988,
"rewards/format_reward/mean": 0.984375,
"rewards/format_reward/std": 0.12426253408193588,
"step": 120
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.015625,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1913.0,
"completions/mean_length": 802.01171875,
"completions/mean_terminated_length": 782.2341918945312,
"completions/min_length": 276.0,
"completions/min_terminated_length": 276.0,
"epoch": 0.5164043744998666,
"grad_norm": 0.19689353647026808,
"learning_rate": 5.704874670892929e-07,
"loss": 0.038,
"num_tokens": 27398409.0,
"reward": 1.228515625,
"reward_std": 0.20076565444469452,
"rewards/accuracy_reward/mean": 0.73828125,
"rewards/accuracy_reward/std": 0.4404313564300537,
"rewards/format_reward/mean": 0.98046875,
"rewards/format_reward/std": 0.13865381479263306,
"step": 121
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1955.0,
"completions/mean_length": 693.53515625,
"completions/mean_terminated_length": 688.2235717773438,
"completions/min_length": 201.0,
"completions/min_terminated_length": 201.0,
"epoch": 0.5206721792477994,
"grad_norm": 0.2033008899736732,
"learning_rate": 5.631097415168443e-07,
"loss": 0.0045,
"num_tokens": 27626138.0,
"reward": 1.197265625,
"reward_std": 0.1862606555223465,
"rewards/accuracy_reward/mean": 0.703125,
"rewards/accuracy_reward/std": 0.45777595043182373,
"rewards/format_reward/mean": 0.98828125,
"rewards/format_reward/std": 0.1078278198838234,
"step": 122
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.015625,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1953.0,
"completions/mean_length": 817.59765625,
"completions/mean_terminated_length": 798.0675048828125,
"completions/min_length": 274.0,
"completions/min_terminated_length": 274.0,
"epoch": 0.5249399839957322,
"grad_norm": 0.20552340304747965,
"learning_rate": 5.55718025767265e-07,
"loss": -0.0026,
"num_tokens": 27878179.0,
"reward": 1.197265625,
"reward_std": 0.20395947992801666,
"rewards/accuracy_reward/mean": 0.703125,
"rewards/accuracy_reward/std": 0.45777595043182373,
"rewards/format_reward/mean": 0.98828125,
"rewards/format_reward/std": 0.1078278198838234,
"step": 123
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1896.0,
"completions/mean_length": 701.33203125,
"completions/mean_terminated_length": 696.051025390625,
"completions/min_length": 272.0,
"completions/min_terminated_length": 272.0,
"epoch": 0.529207788743665,
"grad_norm": 0.159787586419649,
"learning_rate": 5.483139584372305e-07,
"loss": 0.0029,
"num_tokens": 28100536.0,
"reward": 1.357421875,
"reward_std": 0.12257610261440277,
"rewards/accuracy_reward/mean": 0.859375,
"rewards/accuracy_reward/std": 0.3483152687549591,
"rewards/format_reward/mean": 0.99609375,
"rewards/format_reward/std": 0.0625,
"step": 124
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.015625,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1985.0,
"completions/mean_length": 817.38671875,
"completions/mean_terminated_length": 797.8532104492188,
"completions/min_length": 260.0,
"completions/min_terminated_length": 260.0,
"epoch": 0.5334755934915978,
"grad_norm": 0.23485603603178068,
"learning_rate": 5.408991808615162e-07,
"loss": 0.0302,
"num_tokens": 28350091.0,
"reward": 1.162109375,
"reward_std": 0.2614896297454834,
"rewards/accuracy_reward/mean": 0.67578125,
"rewards/accuracy_reward/std": 0.46899911761283875,
"rewards/format_reward/mean": 0.97265625,
"rewards/format_reward/std": 0.1634024828672409,
"step": 125
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.015625,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1911.0,
"completions/mean_length": 814.80078125,
"completions/mean_terminated_length": 795.2262573242188,
"completions/min_length": 287.0,
"completions/min_terminated_length": 287.0,
"epoch": 0.5377433982395305,
"grad_norm": 0.18280518625665157,
"learning_rate": 5.334753367491469e-07,
"loss": 0.0035,
"num_tokens": 28604280.0,
"reward": 1.20703125,
"reward_std": 0.20177264511585236,
"rewards/accuracy_reward/mean": 0.7109375,
"rewards/accuracy_reward/std": 0.45421501994132996,
"rewards/format_reward/mean": 0.9921875,
"rewards/format_reward/std": 0.08821486681699753,
"step": 126
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.015625,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1932.0,
"completions/mean_length": 873.109375,
"completions/mean_terminated_length": 854.4603881835938,
"completions/min_length": 233.0,
"completions/min_terminated_length": 233.0,
"epoch": 0.5420112029874633,
"grad_norm": 0.20876948268936796,
"learning_rate": 5.260440718190182e-07,
"loss": 0.0193,
"num_tokens": 28882892.0,
"reward": 1.181640625,
"reward_std": 0.20936928689479828,
"rewards/accuracy_reward/mean": 0.6875,
"rewards/accuracy_reward/std": 0.4644203782081604,
"rewards/format_reward/mean": 0.98828125,
"rewards/format_reward/std": 0.1078278198838234,
"step": 127
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 2015.0,
"completions/mean_length": 770.859375,
"completions/mean_terminated_length": 765.8510131835938,
"completions/min_length": 166.0,
"completions/min_terminated_length": 166.0,
"epoch": 0.5462790077353961,
"grad_norm": 0.2287966990717932,
"learning_rate": 5.18607033435074e-07,
"loss": 0.0043,
"num_tokens": 29129960.0,
"reward": 1.177734375,
"reward_std": 0.1967882513999939,
"rewards/accuracy_reward/mean": 0.6796875,
"rewards/accuracy_reward/std": 0.4675106406211853,
"rewards/format_reward/mean": 0.99609375,
"rewards/format_reward/std": 0.0625,
"step": 128
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 2039.0,
"completions/mean_length": 777.8046875,
"completions/mean_terminated_length": 767.8031616210938,
"completions/min_length": 265.0,
"completions/min_terminated_length": 265.0,
"epoch": 0.5505468124833289,
"grad_norm": 0.17468173807926676,
"learning_rate": 5.111658702411185e-07,
"loss": 0.0242,
"num_tokens": 29374182.0,
"reward": 1.19921875,
"reward_std": 0.15064984560012817,
"rewards/accuracy_reward/mean": 0.703125,
"rewards/accuracy_reward/std": 0.45777595043182373,
"rewards/format_reward/mean": 0.9921875,
"rewards/format_reward/std": 0.08821486681699753,
"step": 129
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.02734375,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 2043.0,
"completions/mean_length": 858.6015625,
"completions/mean_terminated_length": 825.1646118164062,
"completions/min_length": 251.0,
"completions/min_terminated_length": 251.0,
"epoch": 0.5548146172312617,
"grad_norm": 0.19183660855342868,
"learning_rate": 5.037222317953437e-07,
"loss": 0.0309,
"num_tokens": 29627600.0,
"reward": 1.2421875,
"reward_std": 0.21605664491653442,
"rewards/accuracy_reward/mean": 0.75,
"rewards/accuracy_reward/std": 0.4338609278202057,
"rewards/format_reward/mean": 0.984375,
"rewards/format_reward/std": 0.12426253408193588,
"step": 130
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01953125,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1934.0,
"completions/mean_length": 839.3359375,
"completions/mean_terminated_length": 815.2589721679688,
"completions/min_length": 166.0,
"completions/min_terminated_length": 166.0,
"epoch": 0.5590824219791944,
"grad_norm": 0.20880284453431763,
"learning_rate": 4.962777682046564e-07,
"loss": 0.027,
"num_tokens": 29885590.0,
"reward": 1.1953125,
"reward_std": 0.2067817598581314,
"rewards/accuracy_reward/mean": 0.69921875,
"rewards/accuracy_reward/std": 0.45949608087539673,
"rewards/format_reward/mean": 0.9921875,
"rewards/format_reward/std": 0.08821486681699753,
"step": 131
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0234375,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1895.0,
"completions/mean_length": 817.75,
"completions/mean_terminated_length": 788.2240600585938,
"completions/min_length": 230.0,
"completions/min_terminated_length": 230.0,
"epoch": 0.5633502267271272,
"grad_norm": 0.17992074151340046,
"learning_rate": 4.888341297588815e-07,
"loss": 0.0173,
"num_tokens": 30140878.0,
"reward": 1.224609375,
"reward_std": 0.15265792608261108,
"rewards/accuracy_reward/mean": 0.73046875,
"rewards/accuracy_reward/std": 0.44458550214767456,
"rewards/format_reward/mean": 0.98828125,
"rewards/format_reward/std": 0.1078278198838234,
"step": 132
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.03125,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 2026.0,
"completions/mean_length": 940.35546875,
"completions/mean_terminated_length": 904.625,
"completions/min_length": 266.0,
"completions/min_terminated_length": 266.0,
"epoch": 0.5676180314750601,
"grad_norm": 0.2124255943089338,
"learning_rate": 4.81392966564926e-07,
"loss": 0.0342,
"num_tokens": 30435841.0,
"reward": 1.18359375,
"reward_std": 0.234188050031662,
"rewards/accuracy_reward/mean": 0.69140625,
"rewards/accuracy_reward/std": 0.46281787753105164,
"rewards/format_reward/mean": 0.984375,
"rewards/format_reward/std": 0.12426253408193588,
"step": 133
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0234375,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1952.0,
"completions/mean_length": 832.671875,
"completions/mean_terminated_length": 803.5040283203125,
"completions/min_length": 233.0,
"completions/min_terminated_length": 233.0,
"epoch": 0.5718858362229928,
"grad_norm": 0.2651489009687611,
"learning_rate": 4.739559281809818e-07,
"loss": 0.0484,
"num_tokens": 30691381.0,
"reward": 1.130859375,
"reward_std": 0.295681357383728,
"rewards/accuracy_reward/mean": 0.63671875,
"rewards/accuracy_reward/std": 0.48188701272010803,
"rewards/format_reward/mean": 0.98828125,
"rewards/format_reward/std": 0.1078278198838234,
"step": 134
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01171875,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1833.0,
"completions/mean_length": 805.25,
"completions/mean_terminated_length": 790.5138549804688,
"completions/min_length": 244.0,
"completions/min_terminated_length": 244.0,
"epoch": 0.5761536409709256,
"grad_norm": 0.25198708621058297,
"learning_rate": 4.6652466325085304e-07,
"loss": 0.0256,
"num_tokens": 30953917.0,
"reward": 1.150390625,
"reward_std": 0.24556541442871094,
"rewards/accuracy_reward/mean": 0.65625,
"rewards/accuracy_reward/std": 0.47588926553726196,
"rewards/format_reward/mean": 0.98828125,
"rewards/format_reward/std": 0.1078278198838234,
"step": 135
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.015625,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 2033.0,
"completions/mean_length": 784.2734375,
"completions/mean_terminated_length": 764.21435546875,
"completions/min_length": 205.0,
"completions/min_terminated_length": 205.0,
"epoch": 0.5804214457188583,
"grad_norm": 0.1791641896615987,
"learning_rate": 4.5910081913848383e-07,
"loss": 0.0097,
"num_tokens": 31198555.0,
"reward": 1.205078125,
"reward_std": 0.19860470294952393,
"rewards/accuracy_reward/mean": 0.7109375,
"rewards/accuracy_reward/std": 0.45421501994132996,
"rewards/format_reward/mean": 0.98828125,
"rewards/format_reward/std": 0.1078278198838234,
"step": 136
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1978.0,
"completions/mean_length": 795.88671875,
"completions/mean_terminated_length": 790.9765014648438,
"completions/min_length": 191.0,
"completions/min_terminated_length": 191.0,
"epoch": 0.5846892504667911,
"grad_norm": 0.19423899478412457,
"learning_rate": 4.5168604156276946e-07,
"loss": 0.0125,
"num_tokens": 31456294.0,
"reward": 1.166015625,
"reward_std": 0.18426677584648132,
"rewards/accuracy_reward/mean": 0.66796875,
"rewards/accuracy_reward/std": 0.4718646705150604,
"rewards/format_reward/mean": 0.99609375,
"rewards/format_reward/std": 0.0625,
"step": 137
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.02734375,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1988.0,
"completions/mean_length": 870.5703125,
"completions/mean_terminated_length": 837.4698486328125,
"completions/min_length": 186.0,
"completions/min_terminated_length": 186.0,
"epoch": 0.588957055214724,
"grad_norm": 0.16598601982765251,
"learning_rate": 4.4428197423273503e-07,
"loss": 0.0053,
"num_tokens": 31725112.0,
"reward": 1.18359375,
"reward_std": 0.20883791148662567,
"rewards/accuracy_reward/mean": 0.69140625,
"rewards/accuracy_reward/std": 0.46281787753105164,
"rewards/format_reward/mean": 0.984375,
"rewards/format_reward/std": 0.12426253408193588,
"step": 138
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01171875,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1956.0,
"completions/mean_length": 768.2109375,
"completions/mean_terminated_length": 753.0355834960938,
"completions/min_length": 308.0,
"completions/min_terminated_length": 308.0,
"epoch": 0.5932248599626567,
"grad_norm": 0.18486919036033073,
"learning_rate": 4.368902584831556e-07,
"loss": 0.0226,
"num_tokens": 31959926.0,
"reward": 1.328125,
"reward_std": 0.1646866798400879,
"rewards/accuracy_reward/mean": 0.83203125,
"rewards/accuracy_reward/std": 0.3745708465576172,
"rewards/format_reward/mean": 0.9921875,
"rewards/format_reward/std": 0.08821486681699753,
"step": 139
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 2002.0,
"completions/mean_length": 710.671875,
"completions/mean_terminated_length": 705.427490234375,
"completions/min_length": 284.0,
"completions/min_terminated_length": 284.0,
"epoch": 0.5974926647105895,
"grad_norm": 0.20585348694241182,
"learning_rate": 4.2951253291070734e-07,
"loss": 0.0202,
"num_tokens": 32188058.0,
"reward": 1.244140625,
"reward_std": 0.17531254887580872,
"rewards/accuracy_reward/mean": 0.74609375,
"rewards/accuracy_reward/std": 0.4360972046852112,
"rewards/format_reward/mean": 0.99609375,
"rewards/format_reward/std": 0.0625,
"step": 140
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1880.0,
"completions/mean_length": 706.65234375,
"completions/mean_terminated_length": 696.090576171875,
"completions/min_length": 186.0,
"completions/min_terminated_length": 186.0,
"epoch": 0.6017604694585222,
"grad_norm": 0.21385988435871872,
"learning_rate": 4.2215043301072035e-07,
"loss": 0.0164,
"num_tokens": 32409817.0,
"reward": 1.19921875,
"reward_std": 0.14311033487319946,
"rewards/accuracy_reward/mean": 0.703125,
"rewards/accuracy_reward/std": 0.45777595043182373,
"rewards/format_reward/mean": 0.9921875,
"rewards/format_reward/std": 0.08821486681699753,
"step": 141
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 2015.0,
"completions/mean_length": 809.47265625,
"completions/mean_terminated_length": 804.61572265625,
"completions/min_length": 245.0,
"completions/min_terminated_length": 245.0,
"epoch": 0.6060282742064551,
"grad_norm": 0.24365631155359826,
"learning_rate": 4.148055908146246e-07,
"loss": 0.0007,
"num_tokens": 32662114.0,
"reward": 1.216796875,
"reward_std": 0.2204178422689438,
"rewards/accuracy_reward/mean": 0.71875,
"rewards/accuracy_reward/std": 0.45048993825912476,
"rewards/format_reward/mean": 0.99609375,
"rewards/format_reward/std": 0.0625,
"step": 142
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1946.0,
"completions/mean_length": 831.41796875,
"completions/mean_terminated_length": 821.8385620117188,
"completions/min_length": 245.0,
"completions/min_terminated_length": 245.0,
"epoch": 0.6102960789543879,
"grad_norm": 0.19351401084003758,
"learning_rate": 4.0747963452815854e-07,
"loss": 0.0273,
"num_tokens": 32926957.0,
"reward": 1.1484375,
"reward_std": 0.23818327486515045,
"rewards/accuracy_reward/mean": 0.65234375,
"rewards/accuracy_reward/std": 0.4771590530872345,
"rewards/format_reward/mean": 0.9921875,
"rewards/format_reward/std": 0.08821486681699753,
"step": 143
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01953125,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1951.0,
"completions/mean_length": 892.1796875,
"completions/mean_terminated_length": 869.1553955078125,
"completions/min_length": 250.0,
"completions/min_terminated_length": 250.0,
"epoch": 0.6145638837023206,
"grad_norm": 0.1798525236879384,
"learning_rate": 4.0017418817043014e-07,
"loss": -0.005,
"num_tokens": 33202363.0,
"reward": 1.23046875,
"reward_std": 0.2581729292869568,
"rewards/accuracy_reward/mean": 0.73828125,
"rewards/accuracy_reward/std": 0.4404313564300537,
"rewards/format_reward/mean": 0.984375,
"rewards/format_reward/std": 0.12426253408193588,
"step": 144
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.015625,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 2014.0,
"completions/mean_length": 809.87109375,
"completions/mean_terminated_length": 790.2183227539062,
"completions/min_length": 209.0,
"completions/min_terminated_length": 209.0,
"epoch": 0.6188316884502534,
"grad_norm": 0.24304578874333163,
"learning_rate": 3.928908712139027e-07,
"loss": 0.0158,
"num_tokens": 33449994.0,
"reward": 1.134765625,
"reward_std": 0.2518559992313385,
"rewards/accuracy_reward/mean": 0.63671875,
"rewards/accuracy_reward/std": 0.48188701272010803,
"rewards/format_reward/mean": 0.99609375,
"rewards/format_reward/std": 0.0625,
"step": 145
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.015625,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1945.0,
"completions/mean_length": 805.1015625,
"completions/mean_terminated_length": 785.373046875,
"completions/min_length": 253.0,
"completions/min_terminated_length": 253.0,
"epoch": 0.6230994931981861,
"grad_norm": 0.20039673660163457,
"learning_rate": 3.8563129822539085e-07,
"loss": 0.0216,
"num_tokens": 33709188.0,
"reward": 1.201171875,
"reward_std": 0.23587623238563538,
"rewards/accuracy_reward/mean": 0.7109375,
"rewards/accuracy_reward/std": 0.45421501994132996,
"rewards/format_reward/mean": 0.98046875,
"rewards/format_reward/std": 0.13865381479263306,
"step": 146
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 2003.0,
"completions/mean_length": 767.03125,
"completions/mean_terminated_length": 762.0078735351562,
"completions/min_length": 240.0,
"completions/min_terminated_length": 240.0,
"epoch": 0.627367297946119,
"grad_norm": 0.24327134406193435,
"learning_rate": 3.783970785081424e-07,
"loss": 0.0237,
"num_tokens": 33945492.0,
"reward": 1.236328125,
"reward_std": 0.2406889945268631,
"rewards/accuracy_reward/mean": 0.73828125,
"rewards/accuracy_reward/std": 0.4404313564300537,
"rewards/format_reward/mean": 0.99609375,
"rewards/format_reward/std": 0.0625,
"step": 147
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0234375,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 2024.0,
"completions/mean_length": 821.36328125,
"completions/mean_terminated_length": 791.9240112304688,
"completions/min_length": 274.0,
"completions/min_terminated_length": 274.0,
"epoch": 0.6316351026940518,
"grad_norm": 0.18877147259257004,
"learning_rate": 3.711898157450884e-07,
"loss": 0.0348,
"num_tokens": 34211913.0,
"reward": 1.185546875,
"reward_std": 0.1964080035686493,
"rewards/accuracy_reward/mean": 0.6953125,
"rewards/accuracy_reward/std": 0.4611765742301941,
"rewards/format_reward/mean": 0.98046875,
"rewards/format_reward/std": 0.13865381479263306,
"step": 148
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1991.0,
"completions/mean_length": 843.96875,
"completions/mean_terminated_length": 834.4881591796875,
"completions/min_length": 254.0,
"completions/min_terminated_length": 254.0,
"epoch": 0.6359029074419845,
"grad_norm": 0.21906587909194902,
"learning_rate": 3.6401110764333797e-07,
"loss": 0.0279,
"num_tokens": 34478233.0,
"reward": 1.18359375,
"reward_std": 0.2350439578294754,
"rewards/accuracy_reward/mean": 0.6875,
"rewards/accuracy_reward/std": 0.4644203782081604,
"rewards/format_reward/mean": 0.9921875,
"rewards/format_reward/std": 0.08821486681699753,
"step": 149
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1897.0,
"completions/mean_length": 808.73046875,
"completions/mean_terminated_length": 798.972412109375,
"completions/min_length": 271.0,
"completions/min_terminated_length": 271.0,
"epoch": 0.6401707121899173,
"grad_norm": 0.21316669249549014,
"learning_rate": 3.568625455799988e-07,
"loss": 0.0234,
"num_tokens": 34734652.0,
"reward": 1.158203125,
"reward_std": 0.24461621046066284,
"rewards/accuracy_reward/mean": 0.6640625,
"rewards/accuracy_reward/std": 0.4732423722743988,
"rewards/format_reward/mean": 0.98828125,
"rewards/format_reward/std": 0.1078278198838234,
"step": 150
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0234375,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1911.0,
"completions/mean_length": 812.1640625,
"completions/mean_terminated_length": 782.5040283203125,
"completions/min_length": 287.0,
"completions/min_terminated_length": 287.0,
"epoch": 0.6444385169378501,
"grad_norm": 0.25333424618788813,
"learning_rate": 3.4974571424940005e-07,
"loss": 0.0441,
"num_tokens": 34978830.0,
"reward": 1.1953125,
"reward_std": 0.25995934009552,
"rewards/accuracy_reward/mean": 0.70703125,
"rewards/accuracy_reward/std": 0.45601576566696167,
"rewards/format_reward/mean": 0.9765625,
"rewards/format_reward/std": 0.15158477425575256,
"step": 151
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.03515625,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1992.0,
"completions/mean_length": 866.4765625,
"completions/mean_terminated_length": 823.4251098632812,
"completions/min_length": 250.0,
"completions/min_terminated_length": 250.0,
"epoch": 0.6487063216857829,
"grad_norm": 0.23558326481442027,
"learning_rate": 3.42662191311797e-07,
"loss": 0.0172,
"num_tokens": 35243120.0,
"reward": 1.1171875,
"reward_std": 0.26837483048439026,
"rewards/accuracy_reward/mean": 0.6328125,
"rewards/accuracy_reward/std": 0.48298248648643494,
"rewards/format_reward/mean": 0.96875,
"rewards/format_reward/std": 0.17433346807956696,
"step": 152
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0234375,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1928.0,
"completions/mean_length": 760.59765625,
"completions/mean_terminated_length": 729.7000122070312,
"completions/min_length": 217.0,
"completions/min_terminated_length": 217.0,
"epoch": 0.6529741264337157,
"grad_norm": 0.24179457794505643,
"learning_rate": 3.356135470436356e-07,
"loss": 0.0015,
"num_tokens": 35477777.0,
"reward": 1.177734375,
"reward_std": 0.23884272575378418,
"rewards/accuracy_reward/mean": 0.6796875,
"rewards/accuracy_reward/std": 0.4675106406211853,
"rewards/format_reward/mean": 0.99609375,
"rewards/format_reward/std": 0.0625,
"step": 153
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0234375,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1873.0,
"completions/mean_length": 761.8828125,
"completions/mean_terminated_length": 731.0160522460938,
"completions/min_length": 211.0,
"completions/min_terminated_length": 211.0,
"epoch": 0.6572419311816484,
"grad_norm": 0.17249965874777415,
"learning_rate": 3.2860134398945314e-07,
"loss": 0.0256,
"num_tokens": 35721483.0,
"reward": 1.3359375,
"reward_std": 0.14085884392261505,
"rewards/accuracy_reward/mean": 0.83984375,
"rewards/accuracy_reward/std": 0.36746934056282043,
"rewards/format_reward/mean": 0.9921875,
"rewards/format_reward/std": 0.08821486681699753,
"step": 154
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01171875,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1655.0,
"completions/mean_length": 804.50390625,
"completions/mean_terminated_length": 789.7589111328125,
"completions/min_length": 320.0,
"completions/min_terminated_length": 320.0,
"epoch": 0.6615097359295812,
"grad_norm": 0.24718886410542337,
"learning_rate": 3.2162713661549246e-07,
"loss": 0.0134,
"num_tokens": 35980188.0,
"reward": 1.11328125,
"reward_std": 0.2335888147354126,
"rewards/accuracy_reward/mean": 0.6171875,
"rewards/accuracy_reward/std": 0.48702529072761536,
"rewards/format_reward/mean": 0.9921875,
"rewards/format_reward/std": 0.08821486681699753,
"step": 155
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 2027.0,
"completions/mean_length": 778.87890625,
"completions/mean_terminated_length": 768.8858032226562,
"completions/min_length": 274.0,
"completions/min_terminated_length": 274.0,
"epoch": 0.665777540677514,
"grad_norm": 0.21849135445763052,
"learning_rate": 3.1469247096510884e-07,
"loss": 0.0225,
"num_tokens": 36222085.0,
"reward": 1.2265625,
"reward_std": 0.18990948796272278,
"rewards/accuracy_reward/mean": 0.7265625,
"rewards/accuracy_reward/std": 0.446596622467041,
"rewards/format_reward/mean": 1.0,
"rewards/format_reward/std": 0.0,
"step": 156
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 2039.0,
"completions/mean_length": 825.87890625,
"completions/mean_terminated_length": 816.2559204101562,
"completions/min_length": 220.0,
"completions/min_terminated_length": 220.0,
"epoch": 0.6700453454254468,
"grad_norm": 0.17820499147214844,
"learning_rate": 3.0779888431604183e-07,
"loss": 0.0015,
"num_tokens": 36490046.0,
"reward": 1.08203125,
"reward_std": 0.17124584317207336,
"rewards/accuracy_reward/mean": 0.5859375,
"rewards/accuracy_reward/std": 0.4935242533683777,
"rewards/format_reward/mean": 0.9921875,
"rewards/format_reward/std": 0.08821486681699753,
"step": 157
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01171875,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 2019.0,
"completions/mean_length": 782.7734375,
"completions/mean_terminated_length": 767.770751953125,
"completions/min_length": 309.0,
"completions/min_terminated_length": 309.0,
"epoch": 0.6743131501733796,
"grad_norm": 0.22920030819428183,
"learning_rate": 3.009479048396321e-07,
"loss": 0.0019,
"num_tokens": 36737892.0,
"reward": 1.19921875,
"reward_std": 0.2472132444381714,
"rewards/accuracy_reward/mean": 0.70703125,
"rewards/accuracy_reward/std": 0.45601576566696167,
"rewards/format_reward/mean": 0.984375,
"rewards/format_reward/std": 0.12426253408193588,
"step": 158
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 2044.0,
"completions/mean_length": 810.66796875,
"completions/mean_terminated_length": 800.9251708984375,
"completions/min_length": 261.0,
"completions/min_terminated_length": 261.0,
"epoch": 0.6785809549213123,
"grad_norm": 0.17979724625215016,
"learning_rate": 2.9414105126205496e-07,
"loss": -0.0011,
"num_tokens": 37002743.0,
"reward": 1.19921875,
"reward_std": 0.15735149383544922,
"rewards/accuracy_reward/mean": 0.703125,
"rewards/accuracy_reward/std": 0.45777595043182373,
"rewards/format_reward/mean": 0.9921875,
"rewards/format_reward/std": 0.08821486681699753,
"step": 159
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01953125,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1830.0,
"completions/mean_length": 690.765625,
"completions/mean_terminated_length": 663.7291259765625,
"completions/min_length": 221.0,
"completions/min_terminated_length": 221.0,
"epoch": 0.6828487596692452,
"grad_norm": 0.25451540718263654,
"learning_rate": 2.8737983252765096e-07,
"loss": 0.0231,
"num_tokens": 37211339.0,
"reward": 1.3359375,
"reward_std": 0.14891915023326874,
"rewards/accuracy_reward/mean": 0.84375,
"rewards/accuracy_reward/std": 0.3638034462928772,
"rewards/format_reward/mean": 0.984375,
"rewards/format_reward/std": 0.12426253408193588,
"step": 160
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1903.0,
"completions/max_terminated_length": 1903.0,
"completions/mean_length": 761.828125,
"completions/mean_terminated_length": 761.828125,
"completions/min_length": 193.0,
"completions/min_terminated_length": 193.0,
"epoch": 0.6871165644171779,
"grad_norm": 0.25934243345485913,
"learning_rate": 2.806657474644204e-07,
"loss": 0.021,
"num_tokens": 37457007.0,
"reward": 1.220703125,
"reward_std": 0.20780271291732788,
"rewards/accuracy_reward/mean": 0.72265625,
"rewards/accuracy_reward/std": 0.4485645890235901,
"rewards/format_reward/mean": 0.99609375,
"rewards/format_reward/std": 0.0625,
"step": 161
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01171875,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1908.0,
"completions/mean_length": 641.29296875,
"completions/mean_terminated_length": 624.6126708984375,
"completions/min_length": 227.0,
"completions/min_terminated_length": 227.0,
"epoch": 0.6913843691651107,
"grad_norm": 0.22997977115231086,
"learning_rate": 2.740002844517651e-07,
"loss": 0.0165,
"num_tokens": 37665402.0,
"reward": 1.263671875,
"reward_std": 0.16853389143943787,
"rewards/accuracy_reward/mean": 0.76953125,
"rewards/accuracy_reward/std": 0.4219578504562378,
"rewards/format_reward/mean": 0.98828125,
"rewards/format_reward/std": 0.1078278198838234,
"step": 162
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0234375,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1874.0,
"completions/mean_length": 864.5,
"completions/mean_terminated_length": 836.0960693359375,
"completions/min_length": 333.0,
"completions/min_terminated_length": 333.0,
"epoch": 0.6956521739130435,
"grad_norm": 0.2742073203394405,
"learning_rate": 2.67384921090543e-07,
"loss": 0.0147,
"num_tokens": 37924946.0,
"reward": 1.08984375,
"reward_std": 0.2961747944355011,
"rewards/accuracy_reward/mean": 0.59765625,
"rewards/accuracy_reward/std": 0.4913311004638672,
"rewards/format_reward/mean": 0.984375,
"rewards/format_reward/std": 0.12426253408193588,
"step": 163
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01171875,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1851.0,
"completions/mean_length": 733.51953125,
"completions/mean_terminated_length": 717.932861328125,
"completions/min_length": 263.0,
"completions/min_terminated_length": 263.0,
"epoch": 0.6999199786609762,
"grad_norm": 0.2515677683917249,
"learning_rate": 2.608211238755133e-07,
"loss": 0.0247,
"num_tokens": 38157503.0,
"reward": 1.162109375,
"reward_std": 0.2645115852355957,
"rewards/accuracy_reward/mean": 0.671875,
"rewards/accuracy_reward/std": 0.47045037150382996,
"rewards/format_reward/mean": 0.98046875,
"rewards/format_reward/std": 0.13865381479263306,
"step": 164
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1510.0,
"completions/mean_length": 689.62109375,
"completions/mean_terminated_length": 684.2941284179688,
"completions/min_length": 239.0,
"completions/min_terminated_length": 239.0,
"epoch": 0.7041877834089091,
"grad_norm": 0.23855075868187942,
"learning_rate": 2.5431034787024477e-07,
"loss": 0.0198,
"num_tokens": 38386350.0,
"reward": 1.212890625,
"reward_std": 0.23240876197814941,
"rewards/accuracy_reward/mean": 0.71484375,
"rewards/accuracy_reward/std": 0.4523732364177704,
"rewards/format_reward/mean": 0.99609375,
"rewards/format_reward/std": 0.0625,
"step": 165
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1965.0,
"completions/mean_length": 710.17578125,
"completions/mean_terminated_length": 704.929443359375,
"completions/min_length": 233.0,
"completions/min_terminated_length": 233.0,
"epoch": 0.7084555881568418,
"grad_norm": 0.2281278506113162,
"learning_rate": 2.478540363845553e-07,
"loss": 0.05,
"num_tokens": 38612579.0,
"reward": 1.119140625,
"reward_std": 0.2689380645751953,
"rewards/accuracy_reward/mean": 0.62109375,
"rewards/accuracy_reward/std": 0.4860650300979614,
"rewards/format_reward/mean": 0.99609375,
"rewards/format_reward/std": 0.0625,
"step": 166
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1507.0,
"completions/mean_length": 585.37109375,
"completions/mean_terminated_length": 579.6353149414062,
"completions/min_length": 184.0,
"completions/min_terminated_length": 184.0,
"epoch": 0.7127233929047746,
"grad_norm": 0.1861117236343109,
"learning_rate": 2.4145362065456095e-07,
"loss": 0.0203,
"num_tokens": 38796074.0,
"reward": 1.330078125,
"reward_std": 0.13901790976524353,
"rewards/accuracy_reward/mean": 0.83203125,
"rewards/accuracy_reward/std": 0.3745708465576172,
"rewards/format_reward/mean": 0.99609375,
"rewards/format_reward/std": 0.0625,
"step": 167
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01171875,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1794.0,
"completions/mean_length": 660.84765625,
"completions/mean_terminated_length": 644.3992309570312,
"completions/min_length": 157.0,
"completions/min_terminated_length": 157.0,
"epoch": 0.7169911976527074,
"grad_norm": 0.23510684264419476,
"learning_rate": 2.35110519525397e-07,
"loss": 0.0144,
"num_tokens": 39004963.0,
"reward": 1.267578125,
"reward_std": 0.18846672773361206,
"rewards/accuracy_reward/mean": 0.7734375,
"rewards/accuracy_reward/std": 0.41942715644836426,
"rewards/format_reward/mean": 0.98828125,
"rewards/format_reward/std": 0.1078278198838234,
"step": 168
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.015625,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1732.0,
"completions/mean_length": 673.8828125,
"completions/mean_terminated_length": 652.0714721679688,
"completions/min_length": 181.0,
"completions/min_terminated_length": 181.0,
"epoch": 0.7212590024006402,
"grad_norm": 0.26341920008046044,
"learning_rate": 2.288261391366901e-07,
"loss": 0.0221,
"num_tokens": 39215957.0,
"reward": 1.17578125,
"reward_std": 0.24632926285266876,
"rewards/accuracy_reward/mean": 0.68359375,
"rewards/accuracy_reward/std": 0.4659844934940338,
"rewards/format_reward/mean": 0.984375,
"rewards/format_reward/std": 0.12426253408193588,
"step": 169
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01953125,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1826.0,
"completions/mean_length": 692.4921875,
"completions/mean_terminated_length": 665.4900512695312,
"completions/min_length": 245.0,
"completions/min_terminated_length": 245.0,
"epoch": 0.725526807148573,
"grad_norm": 0.25964991834724266,
"learning_rate": 2.2260187261084396e-07,
"loss": 0.0326,
"num_tokens": 39435587.0,
"reward": 1.119140625,
"reward_std": 0.24559925496578217,
"rewards/accuracy_reward/mean": 0.62890625,
"rewards/accuracy_reward/std": 0.48404383659362793,
"rewards/format_reward/mean": 0.98046875,
"rewards/format_reward/std": 0.13865381479263306,
"step": 170
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1971.0,
"completions/max_terminated_length": 1971.0,
"completions/mean_length": 674.37890625,
"completions/mean_terminated_length": 674.37890625,
"completions/min_length": 248.0,
"completions/min_terminated_length": 248.0,
"epoch": 0.7297946118965057,
"grad_norm": 0.1967378330355962,
"learning_rate": 2.1643909974421166e-07,
"loss": 0.0489,
"num_tokens": 39639420.0,
"reward": 1.29296875,
"reward_std": 0.19450394809246063,
"rewards/accuracy_reward/mean": 0.79296875,
"rewards/accuracy_reward/std": 0.40597182512283325,
"rewards/format_reward/mean": 1.0,
"rewards/format_reward/std": 0.0,
"step": 171
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1943.0,
"completions/mean_length": 720.75,
"completions/mean_terminated_length": 715.545166015625,
"completions/min_length": 236.0,
"completions/min_terminated_length": 236.0,
"epoch": 0.7340624166444385,
"grad_norm": 0.272350047210853,
"learning_rate": 2.1033918670122314e-07,
"loss": 0.0254,
"num_tokens": 39869844.0,
"reward": 1.138671875,
"reward_std": 0.2613224983215332,
"rewards/accuracy_reward/mean": 0.640625,
"rewards/accuracy_reward/std": 0.4807571768760681,
"rewards/format_reward/mean": 0.99609375,
"rewards/format_reward/std": 0.0625,
"step": 172
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1949.0,
"completions/mean_length": 615.6796875,
"completions/mean_terminated_length": 610.0628051757812,
"completions/min_length": 167.0,
"completions/min_terminated_length": 167.0,
"epoch": 0.7383302213923713,
"grad_norm": 0.14074122823817808,
"learning_rate": 2.0430348571153228e-07,
"loss": 0.014,
"num_tokens": 40070442.0,
"reward": 1.244140625,
"reward_std": 0.11127522587776184,
"rewards/accuracy_reward/mean": 0.74609375,
"rewards/accuracy_reward/std": 0.4360972046852112,
"rewards/format_reward/mean": 0.99609375,
"rewards/format_reward/std": 0.0625,
"step": 173
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1602.0,
"completions/max_terminated_length": 1602.0,
"completions/mean_length": 701.4921875,
"completions/mean_terminated_length": 701.4921875,
"completions/min_length": 189.0,
"completions/min_terminated_length": 189.0,
"epoch": 0.7425980261403041,
"grad_norm": 0.23365958383086116,
"learning_rate": 1.98333334770256e-07,
"loss": -0.0056,
"num_tokens": 40290120.0,
"reward": 1.19140625,
"reward_std": 0.24606087803840637,
"rewards/accuracy_reward/mean": 0.69140625,
"rewards/accuracy_reward/std": 0.46281787753105164,
"rewards/format_reward/mean": 1.0,
"rewards/format_reward/std": 0.0,
"step": 174
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.015625,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1993.0,
"completions/mean_length": 739.7109375,
"completions/mean_terminated_length": 718.9444580078125,
"completions/min_length": 174.0,
"completions/min_terminated_length": 174.0,
"epoch": 0.7468658308882369,
"grad_norm": 0.2730265665931513,
"learning_rate": 1.924300573413657e-07,
"loss": 0.0139,
"num_tokens": 40522926.0,
"reward": 1.0859375,
"reward_std": 0.345478355884552,
"rewards/accuracy_reward/mean": 0.59375,
"rewards/accuracy_reward/std": 0.49209436774253845,
"rewards/format_reward/mean": 0.984375,
"rewards/format_reward/std": 0.12426253408193588,
"step": 175
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1824.0,
"completions/mean_length": 628.6484375,
"completions/mean_terminated_length": 623.0823974609375,
"completions/min_length": 275.0,
"completions/min_terminated_length": 275.0,
"epoch": 0.7511336356361696,
"grad_norm": 0.2458090832723111,
"learning_rate": 1.8659496206430304e-07,
"loss": 0.0089,
"num_tokens": 40717980.0,
"reward": 1.2734375,
"reward_std": 0.20974822342395782,
"rewards/accuracy_reward/mean": 0.77734375,
"rewards/accuracy_reward/std": 0.41684433817863464,
"rewards/format_reward/mean": 0.9921875,
"rewards/format_reward/std": 0.08821486681699753,
"step": 176
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1689.0,
"completions/mean_length": 621.12109375,
"completions/mean_terminated_length": 615.5255126953125,
"completions/min_length": 247.0,
"completions/min_terminated_length": 247.0,
"epoch": 0.7554014403841024,
"grad_norm": 0.16053655630184,
"learning_rate": 1.8082934246387932e-07,
"loss": 0.0279,
"num_tokens": 40910899.0,
"reward": 1.298828125,
"reward_std": 0.15808796882629395,
"rewards/accuracy_reward/mean": 0.80078125,
"rewards/accuracy_reward/std": 0.40019527077674866,
"rewards/format_reward/mean": 0.99609375,
"rewards/format_reward/std": 0.0625,
"step": 177
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1830.0,
"completions/mean_length": 646.44921875,
"completions/mean_terminated_length": 635.4133911132812,
"completions/min_length": 218.0,
"completions/min_terminated_length": 218.0,
"epoch": 0.7596692451320353,
"grad_norm": 0.22473592565946962,
"learning_rate": 1.7513447666352749e-07,
"loss": 0.006,
"num_tokens": 41115382.0,
"reward": 1.28125,
"reward_std": 0.19608408212661743,
"rewards/accuracy_reward/mean": 0.78515625,
"rewards/accuracy_reward/std": 0.4115184545516968,
"rewards/format_reward/mean": 0.9921875,
"rewards/format_reward/std": 0.08821486681699753,
"step": 178
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1983.0,
"completions/mean_length": 706.55859375,
"completions/mean_terminated_length": 701.298095703125,
"completions/min_length": 262.0,
"completions/min_terminated_length": 262.0,
"epoch": 0.763937049879968,
"grad_norm": 0.2805754371057208,
"learning_rate": 1.6951162710196759e-07,
"loss": 0.0084,
"num_tokens": 41340949.0,
"reward": 1.111328125,
"reward_std": 0.24608224630355835,
"rewards/accuracy_reward/mean": 0.61328125,
"rewards/accuracy_reward/std": 0.4879522919654846,
"rewards/format_reward/mean": 0.99609375,
"rewards/format_reward/std": 0.0625,
"step": 179
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1858.0,
"completions/max_terminated_length": 1858.0,
"completions/mean_length": 622.3125,
"completions/mean_terminated_length": 622.3125,
"completions/min_length": 215.0,
"completions/min_terminated_length": 215.0,
"epoch": 0.7682048546279008,
"grad_norm": 0.24853618996469473,
"learning_rate": 1.6396204025334815e-07,
"loss": -0.0125,
"num_tokens": 41553749.0,
"reward": 1.16796875,
"reward_std": 0.211207777261734,
"rewards/accuracy_reward/mean": 0.66796875,
"rewards/accuracy_reward/std": 0.4718646705150604,
"rewards/format_reward/mean": 1.0,
"rewards/format_reward/std": 0.0,
"step": 180
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01953125,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1933.0,
"completions/mean_length": 735.20703125,
"completions/mean_terminated_length": 709.0557861328125,
"completions/min_length": 209.0,
"completions/min_terminated_length": 209.0,
"epoch": 0.7724726593758335,
"grad_norm": 0.27283404095282965,
"learning_rate": 1.5848694635092895e-07,
"loss": 0.0196,
"num_tokens": 41793130.0,
"reward": 1.056640625,
"reward_std": 0.2488909661769867,
"rewards/accuracy_reward/mean": 0.56640625,
"rewards/accuracy_reward/std": 0.4965413510799408,
"rewards/format_reward/mean": 0.98046875,
"rewards/format_reward/std": 0.13865381479263306,
"step": 181
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.015625,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1564.0,
"completions/mean_length": 639.625,
"completions/mean_terminated_length": 617.2698974609375,
"completions/min_length": 230.0,
"completions/min_terminated_length": 230.0,
"epoch": 0.7767404641237663,
"grad_norm": 0.23464273569735436,
"learning_rate": 1.5308755911436167e-07,
"loss": 0.0275,
"num_tokens": 42000770.0,
"reward": 1.2109375,
"reward_std": 0.23508310317993164,
"rewards/accuracy_reward/mean": 0.71875,
"rewards/accuracy_reward/std": 0.45048993825912476,
"rewards/format_reward/mean": 0.984375,
"rewards/format_reward/std": 0.12426253408193588,
"step": 182
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1848.0,
"completions/mean_length": 703.01171875,
"completions/mean_terminated_length": 692.4212646484375,
"completions/min_length": 290.0,
"completions/min_terminated_length": 290.0,
"epoch": 0.7810082688716992,
"grad_norm": 0.2041185919449283,
"learning_rate": 1.4776507548063316e-07,
"loss": 0.0161,
"num_tokens": 42228821.0,
"reward": 1.23046875,
"reward_std": 0.2236538529396057,
"rewards/accuracy_reward/mean": 0.734375,
"rewards/accuracy_reward/std": 0.4425306022167206,
"rewards/format_reward/mean": 0.9921875,
"rewards/format_reward/std": 0.08821486681699753,
"step": 183
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1660.0,
"completions/mean_length": 606.125,
"completions/mean_terminated_length": 594.7716674804688,
"completions/min_length": 196.0,
"completions/min_terminated_length": 196.0,
"epoch": 0.7852760736196319,
"grad_norm": 0.2367142527446861,
"learning_rate": 1.425206753387273e-07,
"loss": 0.0076,
"num_tokens": 42418005.0,
"reward": 1.318359375,
"reward_std": 0.19608040153980255,
"rewards/accuracy_reward/mean": 0.8203125,
"rewards/accuracy_reward/std": 0.38467901945114136,
"rewards/format_reward/mean": 0.99609375,
"rewards/format_reward/std": 0.0625,
"step": 184
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1590.0,
"completions/max_terminated_length": 1590.0,
"completions/mean_length": 754.609375,
"completions/mean_terminated_length": 754.609375,
"completions/min_length": 226.0,
"completions/min_terminated_length": 226.0,
"epoch": 0.7895438783675647,
"grad_norm": 0.24647201095880691,
"learning_rate": 1.373555212680682e-07,
"loss": 0.0138,
"num_tokens": 42655745.0,
"reward": 1.087890625,
"reward_std": 0.27658724784851074,
"rewards/accuracy_reward/mean": 0.58984375,
"rewards/accuracy_reward/std": 0.49282538890838623,
"rewards/format_reward/mean": 0.99609375,
"rewards/format_reward/std": 0.0625,
"step": 185
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1822.0,
"completions/mean_length": 675.3359375,
"completions/mean_terminated_length": 669.9530029296875,
"completions/min_length": 252.0,
"completions/min_terminated_length": 252.0,
"epoch": 0.7938116831154974,
"grad_norm": 0.2878456538615157,
"learning_rate": 1.322707582807983e-07,
"loss": 0.0142,
"num_tokens": 42871183.0,
"reward": 1.13671875,
"reward_std": 0.2777612805366516,
"rewards/accuracy_reward/mean": 0.640625,
"rewards/accuracy_reward/std": 0.4807571768760681,
"rewards/format_reward/mean": 0.9921875,
"rewards/format_reward/std": 0.08821486681699753,
"step": 186
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1666.0,
"completions/max_terminated_length": 1666.0,
"completions/mean_length": 702.12109375,
"completions/mean_terminated_length": 702.12109375,
"completions/min_length": 246.0,
"completions/min_terminated_length": 246.0,
"epoch": 0.7980794878634303,
"grad_norm": 0.3142792999763781,
"learning_rate": 1.2726751356795272e-07,
"loss": -0.0068,
"num_tokens": 43094206.0,
"reward": 1.130859375,
"reward_std": 0.25356346368789673,
"rewards/accuracy_reward/mean": 0.6328125,
"rewards/accuracy_reward/std": 0.48298248648643494,
"rewards/format_reward/mean": 0.99609375,
"rewards/format_reward/std": 0.0625,
"step": 187
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1752.0,
"completions/mean_length": 722.0390625,
"completions/mean_terminated_length": 716.8392333984375,
"completions/min_length": 230.0,
"completions/min_terminated_length": 230.0,
"epoch": 0.8023472926113631,
"grad_norm": 0.24325103754397956,
"learning_rate": 1.2234689624958305e-07,
"loss": 0.0094,
"num_tokens": 43325744.0,
"reward": 1.201171875,
"reward_std": 0.2448870688676834,
"rewards/accuracy_reward/mean": 0.703125,
"rewards/accuracy_reward/std": 0.45777595043182373,
"rewards/format_reward/mean": 0.99609375,
"rewards/format_reward/std": 0.0625,
"step": 188
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 2029.0,
"completions/max_terminated_length": 2029.0,
"completions/mean_length": 647.21875,
"completions/mean_terminated_length": 647.21875,
"completions/min_length": 210.0,
"completions/min_terminated_length": 210.0,
"epoch": 0.8066150973592958,
"grad_norm": 0.2552808763290216,
"learning_rate": 1.1750999712888715e-07,
"loss": 0.0174,
"num_tokens": 43534368.0,
"reward": 1.1875,
"reward_std": 0.22160722315311432,
"rewards/accuracy_reward/mean": 0.6875,
"rewards/accuracy_reward/std": 0.4644203782081604,
"rewards/format_reward/mean": 1.0,
"rewards/format_reward/std": 0.0,
"step": 189
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1947.0,
"completions/mean_length": 715.77734375,
"completions/mean_terminated_length": 705.2874145507812,
"completions/min_length": 246.0,
"completions/min_terminated_length": 246.0,
"epoch": 0.8108829021072286,
"grad_norm": 0.2705325300275321,
"learning_rate": 1.1275788845040052e-07,
"loss": 0.0098,
"num_tokens": 43767823.0,
"reward": 1.12109375,
"reward_std": 0.2508101761341095,
"rewards/accuracy_reward/mean": 0.625,
"rewards/accuracy_reward/std": 0.4850712716579437,
"rewards/format_reward/mean": 0.9921875,
"rewards/format_reward/std": 0.08821486681699753,
"step": 190
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01171875,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1982.0,
"completions/mean_length": 777.20703125,
"completions/mean_terminated_length": 762.1383666992188,
"completions/min_length": 245.0,
"completions/min_terminated_length": 245.0,
"epoch": 0.8151507068551613,
"grad_norm": 0.23869227957510453,
"learning_rate": 1.0809162366229995e-07,
"loss": 0.0046,
"num_tokens": 44007172.0,
"reward": 1.177734375,
"reward_std": 0.2786230444908142,
"rewards/accuracy_reward/mean": 0.68359375,
"rewards/accuracy_reward/std": 0.4659844934940338,
"rewards/format_reward/mean": 0.98828125,
"rewards/format_reward/std": 0.1078278198838234,
"step": 191
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1935.0,
"completions/mean_length": 703.2265625,
"completions/mean_terminated_length": 697.9530029296875,
"completions/min_length": 235.0,
"completions/min_terminated_length": 235.0,
"epoch": 0.8194185116030942,
"grad_norm": 0.24454625111448922,
"learning_rate": 1.035122371828761e-07,
"loss": 0.0293,
"num_tokens": 44231798.0,
"reward": 1.18359375,
"reward_std": 0.23304039239883423,
"rewards/accuracy_reward/mean": 0.6875,
"rewards/accuracy_reward/std": 0.4644203782081604,
"rewards/format_reward/mean": 0.9921875,
"rewards/format_reward/std": 0.08821486681699753,
"step": 192
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1547.0,
"completions/mean_length": 707.6796875,
"completions/mean_terminated_length": 697.1259765625,
"completions/min_length": 198.0,
"completions/min_terminated_length": 198.0,
"epoch": 0.823686316351027,
"grad_norm": 0.2315774767151496,
"learning_rate": 9.90207441712223e-08,
"loss": 0.007,
"num_tokens": 44454276.0,
"reward": 1.19921875,
"reward_std": 0.22252225875854492,
"rewards/accuracy_reward/mean": 0.703125,
"rewards/accuracy_reward/std": 0.45777595043182373,
"rewards/format_reward/mean": 0.9921875,
"rewards/format_reward/std": 0.08821486681699753,
"step": 193
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1918.0,
"completions/mean_length": 679.92578125,
"completions/mean_terminated_length": 674.5608520507812,
"completions/min_length": 219.0,
"completions/min_terminated_length": 219.0,
"epoch": 0.8279541210989597,
"grad_norm": 0.23688003693135284,
"learning_rate": 9.461814030219518e-08,
"loss": 0.0172,
"num_tokens": 44667385.0,
"reward": 1.15234375,
"reward_std": 0.24171680212020874,
"rewards/accuracy_reward/mean": 0.65625,
"rewards/accuracy_reward/std": 0.47588926553726196,
"rewards/format_reward/mean": 0.9921875,
"rewards/format_reward/std": 0.08821486681699753,
"step": 194
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1926.0,
"completions/max_terminated_length": 1926.0,
"completions/mean_length": 771.4375,
"completions/mean_terminated_length": 771.4375,
"completions/min_length": 242.0,
"completions/min_terminated_length": 242.0,
"epoch": 0.8322219258468925,
"grad_norm": 0.3010266544431418,
"learning_rate": 9.030540154569188e-08,
"loss": 0.0219,
"num_tokens": 44921481.0,
"reward": 1.013671875,
"reward_std": 0.31984591484069824,
"rewards/accuracy_reward/mean": 0.515625,
"rewards/accuracy_reward/std": 0.5007347464561462,
"rewards/format_reward/mean": 0.99609375,
"rewards/format_reward/std": 0.0625,
"step": 195
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.02734375,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1855.0,
"completions/mean_length": 665.66015625,
"completions/mean_terminated_length": 626.7991943359375,
"completions/min_length": 221.0,
"completions/min_terminated_length": 221.0,
"epoch": 0.8364897305948252,
"grad_norm": 0.21211516268188596,
"learning_rate": 8.608348395029857e-08,
"loss": 0.0269,
"num_tokens": 45133986.0,
"reward": 1.23828125,
"reward_std": 0.16909292340278625,
"rewards/accuracy_reward/mean": 0.75390625,
"rewards/accuracy_reward/std": 0.43157756328582764,
"rewards/format_reward/mean": 0.96875,
"rewards/format_reward/std": 0.17433346807956696,
"step": 196
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1771.0,
"completions/mean_length": 734.71484375,
"completions/mean_terminated_length": 729.5647583007812,
"completions/min_length": 233.0,
"completions/min_terminated_length": 233.0,
"epoch": 0.8407575353427581,
"grad_norm": 0.23169910087976608,
"learning_rate": 8.19533234313517e-08,
"loss": 0.0228,
"num_tokens": 45388521.0,
"reward": 1.033203125,
"reward_std": 0.2498776912689209,
"rewards/accuracy_reward/mean": 0.53515625,
"rewards/accuracy_reward/std": 0.49973952770233154,
"rewards/format_reward/mean": 0.99609375,
"rewards/format_reward/std": 0.0625,
"step": 197
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 2043.0,
"completions/mean_length": 689.30859375,
"completions/mean_terminated_length": 683.9804077148438,
"completions/min_length": 194.0,
"completions/min_terminated_length": 194.0,
"epoch": 0.8450253400906909,
"grad_norm": 0.20332752603627063,
"learning_rate": 7.791583556346576e-08,
"loss": 0.0095,
"num_tokens": 45603184.0,
"reward": 1.244140625,
"reward_std": 0.18624509871006012,
"rewards/accuracy_reward/mean": 0.74609375,
"rewards/accuracy_reward/std": 0.4360972046852112,
"rewards/format_reward/mean": 0.99609375,
"rewards/format_reward/std": 0.0625,
"step": 198
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1829.0,
"completions/mean_length": 683.8671875,
"completions/mean_terminated_length": 673.1259765625,
"completions/min_length": 183.0,
"completions/min_terminated_length": 183.0,
"epoch": 0.8492931448386236,
"grad_norm": 0.18282763433189994,
"learning_rate": 7.397191537756726e-08,
"loss": 0.0214,
"num_tokens": 45819222.0,
"reward": 1.2421875,
"reward_std": 0.18612128496170044,
"rewards/accuracy_reward/mean": 0.74609375,
"rewards/accuracy_reward/std": 0.4360972046852112,
"rewards/format_reward/mean": 0.9921875,
"rewards/format_reward/std": 0.08821486681699753,
"step": 199
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1906.0,
"completions/mean_length": 716.453125,
"completions/mean_terminated_length": 711.2313842773438,
"completions/min_length": 218.0,
"completions/min_terminated_length": 218.0,
"epoch": 0.8535609495865564,
"grad_norm": 0.2287235759390508,
"learning_rate": 7.012243716248505e-08,
"loss": 0.0194,
"num_tokens": 46043546.0,
"reward": 1.212890625,
"reward_std": 0.26291176676750183,
"rewards/accuracy_reward/mean": 0.71484375,
"rewards/accuracy_reward/std": 0.4523732364177704,
"rewards/format_reward/mean": 0.99609375,
"rewards/format_reward/std": 0.0625,
"step": 200
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1944.0,
"completions/mean_length": 668.796875,
"completions/mean_terminated_length": 663.3882446289062,
"completions/min_length": 245.0,
"completions/min_terminated_length": 245.0,
"epoch": 0.8578287543344892,
"grad_norm": 0.28136414759791406,
"learning_rate": 6.636825427113718e-08,
"loss": 0.0213,
"num_tokens": 46263078.0,
"reward": 1.12890625,
"reward_std": 0.22791796922683716,
"rewards/accuracy_reward/mean": 0.6328125,
"rewards/accuracy_reward/std": 0.48298248648643494,
"rewards/format_reward/mean": 0.9921875,
"rewards/format_reward/std": 0.08821486681699753,
"step": 201
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 2032.0,
"completions/mean_length": 775.09765625,
"completions/mean_terminated_length": 765.0748291015625,
"completions/min_length": 213.0,
"completions/min_terminated_length": 213.0,
"epoch": 0.862096559082422,
"grad_norm": 0.2614766475394663,
"learning_rate": 6.271019893136004e-08,
"loss": 0.0138,
"num_tokens": 46513359.0,
"reward": 1.119140625,
"reward_std": 0.2732589542865753,
"rewards/accuracy_reward/mean": 0.625,
"rewards/accuracy_reward/std": 0.4850712716579437,
"rewards/format_reward/mean": 0.98828125,
"rewards/format_reward/std": 0.1078278198838234,
"step": 202
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1656.0,
"completions/max_terminated_length": 1656.0,
"completions/mean_length": 655.359375,
"completions/mean_terminated_length": 655.359375,
"completions/min_length": 277.0,
"completions/min_terminated_length": 277.0,
"epoch": 0.8663643638303548,
"grad_norm": 0.22048232818659222,
"learning_rate": 5.914908206141955e-08,
"loss": 0.0188,
"num_tokens": 46716907.0,
"reward": 1.2265625,
"reward_std": 0.21489354968070984,
"rewards/accuracy_reward/mean": 0.7265625,
"rewards/accuracy_reward/std": 0.446596622467041,
"rewards/format_reward/mean": 1.0,
"rewards/format_reward/std": 0.0,
"step": 203
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01171875,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1983.0,
"completions/mean_length": 694.74609375,
"completions/mean_terminated_length": 678.6996459960938,
"completions/min_length": 211.0,
"completions/min_terminated_length": 211.0,
"epoch": 0.8706321685782875,
"grad_norm": 0.23641341776500133,
"learning_rate": 5.568569309024701e-08,
"loss": 0.0352,
"num_tokens": 46927186.0,
"reward": 1.17578125,
"reward_std": 0.2842491865158081,
"rewards/accuracy_reward/mean": 0.68359375,
"rewards/accuracy_reward/std": 0.4659844934940338,
"rewards/format_reward/mean": 0.984375,
"rewards/format_reward/std": 0.12426253408193588,
"step": 204
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1738.0,
"completions/max_terminated_length": 1738.0,
"completions/mean_length": 662.88671875,
"completions/mean_terminated_length": 662.88671875,
"completions/min_length": 222.0,
"completions/min_terminated_length": 222.0,
"epoch": 0.8748999733262203,
"grad_norm": 0.20672110512380382,
"learning_rate": 5.232079978243797e-08,
"loss": 0.0094,
"num_tokens": 47140685.0,
"reward": 1.24609375,
"reward_std": 0.15873727202415466,
"rewards/accuracy_reward/mean": 0.74609375,
"rewards/accuracy_reward/std": 0.4360972046852112,
"rewards/format_reward/mean": 1.0,
"rewards/format_reward/std": 0.0,
"step": 205
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.015625,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1654.0,
"completions/mean_length": 660.390625,
"completions/mean_terminated_length": 638.3651123046875,
"completions/min_length": 228.0,
"completions/min_terminated_length": 228.0,
"epoch": 0.8791677780741531,
"grad_norm": 0.22184411809292953,
"learning_rate": 4.905514806805455e-08,
"loss": 0.0283,
"num_tokens": 47348249.0,
"reward": 1.26953125,
"reward_std": 0.18794672191143036,
"rewards/accuracy_reward/mean": 0.77734375,
"rewards/accuracy_reward/std": 0.41684433817863464,
"rewards/format_reward/mean": 0.984375,
"rewards/format_reward/std": 0.12426253408193588,
"step": 206
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 2041.0,
"completions/mean_length": 641.34375,
"completions/mean_terminated_length": 635.8275146484375,
"completions/min_length": 180.0,
"completions/min_terminated_length": 180.0,
"epoch": 0.8834355828220859,
"grad_norm": 0.2927027602654784,
"learning_rate": 4.5889461877267053e-08,
"loss": 0.0141,
"num_tokens": 47556417.0,
"reward": 1.203125,
"reward_std": 0.28396546840667725,
"rewards/accuracy_reward/mean": 0.70703125,
"rewards/accuracy_reward/std": 0.45601576566696167,
"rewards/format_reward/mean": 0.9921875,
"rewards/format_reward/std": 0.08821486681699753,
"step": 207
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1699.0,
"completions/mean_length": 729.8671875,
"completions/mean_terminated_length": 724.6980590820312,
"completions/min_length": 241.0,
"completions/min_terminated_length": 241.0,
"epoch": 0.8877033875700187,
"grad_norm": 0.2461243992470562,
"learning_rate": 4.282444297987359e-08,
"loss": 0.0055,
"num_tokens": 47788295.0,
"reward": 1.138671875,
"reward_std": 0.24752356112003326,
"rewards/accuracy_reward/mean": 0.640625,
"rewards/accuracy_reward/std": 0.4807571768760681,
"rewards/format_reward/mean": 0.99609375,
"rewards/format_reward/std": 0.0625,
"step": 208
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01171875,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1672.0,
"completions/mean_length": 744.02734375,
"completions/mean_terminated_length": 728.5652465820312,
"completions/min_length": 292.0,
"completions/min_terminated_length": 292.0,
"epoch": 0.8919711923179514,
"grad_norm": 0.26361481821432853,
"learning_rate": 3.986077082973077e-08,
"loss": 0.0257,
"num_tokens": 48024238.0,
"reward": 1.115234375,
"reward_std": 0.2896057367324829,
"rewards/accuracy_reward/mean": 0.62109375,
"rewards/accuracy_reward/std": 0.4860650300979614,
"rewards/format_reward/mean": 0.98828125,
"rewards/format_reward/std": 0.1078278198838234,
"step": 209
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1740.0,
"completions/mean_length": 750.125,
"completions/mean_terminated_length": 739.905517578125,
"completions/min_length": 268.0,
"completions/min_terminated_length": 268.0,
"epoch": 0.8962389970658843,
"grad_norm": 0.20759266108832738,
"learning_rate": 3.699910241413345e-08,
"loss": 0.0204,
"num_tokens": 48251030.0,
"reward": 1.2890625,
"reward_std": 0.23673829436302185,
"rewards/accuracy_reward/mean": 0.79296875,
"rewards/accuracy_reward/std": 0.40597182512283325,
"rewards/format_reward/mean": 0.9921875,
"rewards/format_reward/std": 0.08821486681699753,
"step": 210
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1839.0,
"completions/mean_length": 803.78515625,
"completions/mean_terminated_length": 798.9059448242188,
"completions/min_length": 315.0,
"completions/min_terminated_length": 315.0,
"epoch": 0.900506801813817,
"grad_norm": 0.22768602565232743,
"learning_rate": 3.424007210817248e-08,
"loss": 0.0344,
"num_tokens": 48502023.0,
"reward": 1.142578125,
"reward_std": 0.2660510838031769,
"rewards/accuracy_reward/mean": 0.64453125,
"rewards/accuracy_reward/std": 0.4795927405357361,
"rewards/format_reward/mean": 0.99609375,
"rewards/format_reward/std": 0.0625,
"step": 211
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1957.0,
"completions/mean_length": 676.2734375,
"completions/mean_terminated_length": 670.8941650390625,
"completions/min_length": 293.0,
"completions/min_terminated_length": 293.0,
"epoch": 0.9047746065617498,
"grad_norm": 0.2470482043698145,
"learning_rate": 3.158429153410724e-08,
"loss": 0.0141,
"num_tokens": 48722021.0,
"reward": 1.154296875,
"reward_std": 0.21529296040534973,
"rewards/accuracy_reward/mean": 0.65625,
"rewards/accuracy_reward/std": 0.47588926553726196,
"rewards/format_reward/mean": 0.99609375,
"rewards/format_reward/std": 0.0625,
"step": 212
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1621.0,
"completions/mean_length": 649.66796875,
"completions/mean_terminated_length": 644.184326171875,
"completions/min_length": 187.0,
"completions/min_terminated_length": 187.0,
"epoch": 0.9090424113096826,
"grad_norm": 0.23578300688769538,
"learning_rate": 2.903234942578081e-08,
"loss": 0.0184,
"num_tokens": 48932016.0,
"reward": 1.259765625,
"reward_std": 0.22608917951583862,
"rewards/accuracy_reward/mean": 0.76171875,
"rewards/accuracy_reward/std": 0.4268665909767151,
"rewards/format_reward/mean": 0.99609375,
"rewards/format_reward/std": 0.0625,
"step": 213
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1825.0,
"completions/mean_length": 700.1875,
"completions/mean_terminated_length": 694.9019775390625,
"completions/min_length": 270.0,
"completions/min_terminated_length": 270.0,
"epoch": 0.9133102160576153,
"grad_norm": 0.22219455215166378,
"learning_rate": 2.658481149810904e-08,
"loss": 0.0122,
"num_tokens": 49164808.0,
"reward": 1.1875,
"reward_std": 0.24884523451328278,
"rewards/accuracy_reward/mean": 0.69140625,
"rewards/accuracy_reward/std": 0.46281787753105164,
"rewards/format_reward/mean": 0.9921875,
"rewards/format_reward/std": 0.08821486681699753,
"step": 214
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1619.0,
"completions/mean_length": 597.33984375,
"completions/mean_terminated_length": 591.6510009765625,
"completions/min_length": 200.0,
"completions/min_terminated_length": 200.0,
"epoch": 0.9175780208055482,
"grad_norm": 0.21753622718375415,
"learning_rate": 2.424222032167339e-08,
"loss": 0.0094,
"num_tokens": 49359399.0,
"reward": 1.302734375,
"reward_std": 0.1821448802947998,
"rewards/accuracy_reward/mean": 0.8046875,
"rewards/accuracy_reward/std": 0.39721766114234924,
"rewards/format_reward/mean": 0.99609375,
"rewards/format_reward/std": 0.0625,
"step": 215
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01953125,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 2046.0,
"completions/mean_length": 726.96484375,
"completions/mean_terminated_length": 700.6494140625,
"completions/min_length": 210.0,
"completions/min_terminated_length": 210.0,
"epoch": 0.9218458255534809,
"grad_norm": 0.23224872325943707,
"learning_rate": 2.2005095202443258e-08,
"loss": 0.0031,
"num_tokens": 49586014.0,
"reward": 1.162109375,
"reward_std": 0.22143831849098206,
"rewards/accuracy_reward/mean": 0.671875,
"rewards/accuracy_reward/std": 0.47045037150382996,
"rewards/format_reward/mean": 0.98046875,
"rewards/format_reward/std": 0.13865381479263306,
"step": 216
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1740.0,
"completions/max_terminated_length": 1740.0,
"completions/mean_length": 645.16015625,
"completions/mean_terminated_length": 645.16015625,
"completions/min_length": 242.0,
"completions/min_terminated_length": 242.0,
"epoch": 0.9261136303014137,
"grad_norm": 0.23652223616186321,
"learning_rate": 1.987393206665655e-08,
"loss": 0.0121,
"num_tokens": 49810207.0,
"reward": 1.1875,
"reward_std": 0.21462517976760864,
"rewards/accuracy_reward/mean": 0.6875,
"rewards/accuracy_reward/std": 0.4644203782081604,
"rewards/format_reward/mean": 1.0,
"rewards/format_reward/std": 0.0,
"step": 217
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1661.0,
"completions/mean_length": 700.3203125,
"completions/mean_terminated_length": 695.0353393554688,
"completions/min_length": 182.0,
"completions/min_terminated_length": 182.0,
"epoch": 0.9303814350493465,
"grad_norm": 0.1814779175974177,
"learning_rate": 1.7849203350882414e-08,
"loss": 0.0093,
"num_tokens": 50039041.0,
"reward": 1.203125,
"reward_std": 0.19989967346191406,
"rewards/accuracy_reward/mean": 0.703125,
"rewards/accuracy_reward/std": 0.45777595043182373,
"rewards/format_reward/mean": 1.0,
"rewards/format_reward/std": 0.0,
"step": 218
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.015625,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1913.0,
"completions/mean_length": 767.1171875,
"completions/mean_terminated_length": 746.7857666015625,
"completions/min_length": 241.0,
"completions/min_terminated_length": 241.0,
"epoch": 0.9346492397972793,
"grad_norm": 0.2125528933160923,
"learning_rate": 1.5931357897291664e-08,
"loss": 0.0109,
"num_tokens": 50291055.0,
"reward": 1.1796875,
"reward_std": 0.22115148603916168,
"rewards/accuracy_reward/mean": 0.6875,
"rewards/accuracy_reward/std": 0.4644203782081604,
"rewards/format_reward/mean": 0.984375,
"rewards/format_reward/std": 0.12426253408193588,
"step": 219
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1901.0,
"completions/mean_length": 599.9140625,
"completions/mean_terminated_length": 588.5117797851562,
"completions/min_length": 227.0,
"completions/min_terminated_length": 227.0,
"epoch": 0.9389170445452121,
"grad_norm": 0.3032930830422189,
"learning_rate": 1.4120820854156944e-08,
"loss": 0.0187,
"num_tokens": 50488953.0,
"reward": 1.251953125,
"reward_std": 0.1863902509212494,
"rewards/accuracy_reward/mean": 0.7578125,
"rewards/accuracy_reward/std": 0.4292463958263397,
"rewards/format_reward/mean": 0.98828125,
"rewards/format_reward/std": 0.1078278198838234,
"step": 220
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1779.0,
"completions/mean_length": 686.68359375,
"completions/mean_terminated_length": 675.9645385742188,
"completions/min_length": 228.0,
"completions/min_terminated_length": 228.0,
"epoch": 0.9431848492931448,
"grad_norm": 0.25781283708150377,
"learning_rate": 1.2417993581606445e-08,
"loss": 0.0071,
"num_tokens": 50709304.0,
"reward": 1.19140625,
"reward_std": 0.24818523228168488,
"rewards/accuracy_reward/mean": 0.7177419066429138,
"rewards/accuracy_reward/std": 0.45100846886634827,
"rewards/format_reward/mean": 0.9921875,
"rewards/format_reward/std": 0.08821486681699753,
"step": 221
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1947.0,
"completions/mean_length": 659.75,
"completions/mean_terminated_length": 654.305908203125,
"completions/min_length": 234.0,
"completions/min_terminated_length": 234.0,
"epoch": 0.9474526540410776,
"grad_norm": 0.2094544272829385,
"learning_rate": 1.0823253562649793e-08,
"loss": 0.0241,
"num_tokens": 50914848.0,
"reward": 1.248046875,
"reward_std": 0.204259991645813,
"rewards/accuracy_reward/mean": 0.75,
"rewards/accuracy_reward/std": 0.4338609278202057,
"rewards/format_reward/mean": 0.99609375,
"rewards/format_reward/std": 0.0625,
"step": 222
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1646.0,
"completions/mean_length": 617.921875,
"completions/mean_terminated_length": 606.6614379882812,
"completions/min_length": 215.0,
"completions/min_terminated_length": 215.0,
"epoch": 0.9517204587890103,
"grad_norm": 0.23605866212584778,
"learning_rate": 9.336954319497714e-09,
"loss": 0.0084,
"num_tokens": 51110076.0,
"reward": 1.23046875,
"reward_std": 0.21031491458415985,
"rewards/accuracy_reward/mean": 0.734375,
"rewards/accuracy_reward/std": 0.4425306022167206,
"rewards/format_reward/mean": 0.9921875,
"rewards/format_reward/std": 0.08821486681699753,
"step": 223
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1742.0,
"completions/max_terminated_length": 1742.0,
"completions/mean_length": 616.18359375,
"completions/mean_terminated_length": 616.18359375,
"completions/min_length": 191.0,
"completions/min_terminated_length": 191.0,
"epoch": 0.9559882635369432,
"grad_norm": 0.2333984997933526,
"learning_rate": 7.959425335193337e-09,
"loss": 0.0159,
"num_tokens": 51300787.0,
"reward": 1.2265625,
"reward_std": 0.2001592218875885,
"rewards/accuracy_reward/mean": 0.7265625,
"rewards/accuracy_reward/std": 0.446596622467041,
"rewards/format_reward/mean": 1.0,
"rewards/format_reward/std": 0.0,
"step": 224
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1726.0,
"completions/mean_length": 648.83203125,
"completions/mean_terminated_length": 643.3451538085938,
"completions/min_length": 219.0,
"completions/min_terminated_length": 219.0,
"epoch": 0.960256068284876,
"grad_norm": 0.2089681584399415,
"learning_rate": 6.690971980572058e-09,
"loss": 0.0072,
"num_tokens": 51517768.0,
"reward": 1.248046875,
"reward_std": 0.16782496869564056,
"rewards/accuracy_reward/mean": 0.75,
"rewards/accuracy_reward/std": 0.4338609278202057,
"rewards/format_reward/mean": 0.99609375,
"rewards/format_reward/std": 0.0625,
"step": 225
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.00390625,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1936.0,
"completions/mean_length": 698.08203125,
"completions/mean_terminated_length": 692.7882690429688,
"completions/min_length": 280.0,
"completions/min_terminated_length": 280.0,
"epoch": 0.9645238730328087,
"grad_norm": 0.21994732007609208,
"learning_rate": 5.5318754465671354e-09,
"loss": 0.0187,
"num_tokens": 51749093.0,
"reward": 1.193359375,
"reward_std": 0.20029661059379578,
"rewards/accuracy_reward/mean": 0.6953125,
"rewards/accuracy_reward/std": 0.4611765742301941,
"rewards/format_reward/mean": 0.99609375,
"rewards/format_reward/std": 0.0625,
"step": 226
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01171875,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1865.0,
"completions/mean_length": 655.94140625,
"completions/mean_terminated_length": 639.434814453125,
"completions/min_length": 199.0,
"completions/min_terminated_length": 199.0,
"epoch": 0.9687916777807415,
"grad_norm": 0.2298210544751593,
"learning_rate": 4.482392681875113e-09,
"loss": 0.0099,
"num_tokens": 51967454.0,
"reward": 1.125,
"reward_std": 0.19949902594089508,
"rewards/accuracy_reward/mean": 0.6328125,
"rewards/accuracy_reward/std": 0.48298248648643494,
"rewards/format_reward/mean": 0.984375,
"rewards/format_reward/std": 0.12426253408193588,
"step": 227
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1592.0,
"completions/max_terminated_length": 1592.0,
"completions/mean_length": 649.30859375,
"completions/mean_terminated_length": 649.30859375,
"completions/min_length": 219.0,
"completions/min_terminated_length": 219.0,
"epoch": 0.9730594825286744,
"grad_norm": 0.20543081839485053,
"learning_rate": 3.5427563359954893e-09,
"loss": 0.0033,
"num_tokens": 52171869.0,
"reward": 1.31640625,
"reward_std": 0.19701021909713745,
"rewards/accuracy_reward/mean": 0.81640625,
"rewards/accuracy_reward/std": 0.387910932302475,
"rewards/format_reward/mean": 1.0,
"rewards/format_reward/std": 0.0,
"step": 228
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.01171875,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1831.0,
"completions/mean_length": 727.8828125,
"completions/mean_terminated_length": 712.229248046875,
"completions/min_length": 189.0,
"completions/min_terminated_length": 189.0,
"epoch": 0.9773272872766071,
"grad_norm": 0.19067844855692329,
"learning_rate": 2.7131747076567513e-09,
"loss": -0.0003,
"num_tokens": 52406391.0,
"reward": 1.166015625,
"reward_std": 0.1843988299369812,
"rewards/accuracy_reward/mean": 0.671875,
"rewards/accuracy_reward/std": 0.47045037150382996,
"rewards/format_reward/mean": 0.98828125,
"rewards/format_reward/std": 0.1078278198838234,
"step": 229
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1474.0,
"completions/max_terminated_length": 1474.0,
"completions/mean_length": 601.140625,
"completions/mean_terminated_length": 601.140625,
"completions/min_length": 202.0,
"completions/min_terminated_length": 202.0,
"epoch": 0.9815950920245399,
"grad_norm": 0.24250811846913806,
"learning_rate": 1.9938316986408133e-09,
"loss": 0.0099,
"num_tokens": 52608931.0,
"reward": 1.26171875,
"reward_std": 0.18543127179145813,
"rewards/accuracy_reward/mean": 0.76171875,
"rewards/accuracy_reward/std": 0.4268665909767151,
"rewards/format_reward/mean": 1.0,
"rewards/format_reward/std": 0.0,
"step": 230
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 2024.0,
"completions/mean_length": 728.25390625,
"completions/mean_terminated_length": 717.8621826171875,
"completions/min_length": 289.0,
"completions/min_terminated_length": 289.0,
"epoch": 0.9858628967724726,
"grad_norm": 0.22481444911050422,
"learning_rate": 1.3848867730158476e-09,
"loss": 0.0083,
"num_tokens": 52841356.0,
"reward": 1.21875,
"reward_std": 0.2513718605041504,
"rewards/accuracy_reward/mean": 0.72265625,
"rewards/accuracy_reward/std": 0.4485645890235901,
"rewards/format_reward/mean": 0.9921875,
"rewards/format_reward/std": 0.08821486681699753,
"step": 231
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1706.0,
"completions/max_terminated_length": 1706.0,
"completions/mean_length": 657.55078125,
"completions/mean_terminated_length": 657.55078125,
"completions/min_length": 232.0,
"completions/min_terminated_length": 232.0,
"epoch": 0.9901307015204054,
"grad_norm": 0.20647039509253484,
"learning_rate": 8.864749217858403e-10,
"loss": 0.0043,
"num_tokens": 53054881.0,
"reward": 1.234375,
"reward_std": 0.20133629441261292,
"rewards/accuracy_reward/mean": 0.734375,
"rewards/accuracy_reward/std": 0.4425306022167206,
"rewards/format_reward/mean": 1.0,
"rewards/format_reward/std": 0.0,
"step": 232
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0078125,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1566.0,
"completions/mean_length": 627.51953125,
"completions/mean_terminated_length": 616.3346557617188,
"completions/min_length": 273.0,
"completions/min_terminated_length": 273.0,
"epoch": 0.9943985062683383,
"grad_norm": 0.2389236571076748,
"learning_rate": 4.987066329659728e-10,
"loss": 0.0226,
"num_tokens": 53258350.0,
"reward": 1.1796875,
"reward_std": 0.20136789977550507,
"rewards/accuracy_reward/mean": 0.68359375,
"rewards/accuracy_reward/std": 0.4659844934940338,
"rewards/format_reward/mean": 0.9921875,
"rewards/format_reward/std": 0.08821486681699753,
"step": 233
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1544.0,
"completions/max_terminated_length": 1544.0,
"completions/mean_length": 571.0,
"completions/mean_terminated_length": 571.0,
"completions/min_length": 258.0,
"completions/min_terminated_length": 258.0,
"epoch": 0.998666311016271,
"grad_norm": 0.2569771171353061,
"learning_rate": 2.2166786708976981e-10,
"loss": 0.0188,
"num_tokens": 53474542.0,
"reward": 1.20703125,
"reward_std": 0.2004251778125763,
"rewards/accuracy_reward/mean": 0.70703125,
"rewards/accuracy_reward/std": 0.45601576566696167,
"rewards/format_reward/mean": 1.0,
"rewards/format_reward/std": 0.0,
"step": 234
},
{
"epoch": 0.998666311016271,
"step": 234,
"total_flos": 0.0,
"train_loss": 0.013747031251953628,
"train_runtime": 124161.3091,
"train_samples_per_second": 0.06,
"train_steps_per_second": 0.002
}
],
"logging_steps": 1,
"max_steps": 235,
"num_input_tokens_seen": 53474542,
"num_train_epochs": 1,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 0.0,
"train_batch_size": 4,
"trial_name": null,
"trial_params": null
}