{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.998666311016271, "eval_steps": 2000000, "global_step": 234, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 2048.0, "completions/max_terminated_length": 1610.0, "completions/mean_length": 690.1796875, "completions/mean_terminated_length": 684.8549194335938, "completions/min_length": 178.0, "completions/min_terminated_length": 178.0, "epoch": 0.004267804747932782, "grad_norm": 0.44456309488189716, "learning_rate": 0.0, "loss": 0.0086, "num_tokens": 214606.0, "reward": 0.5625, "reward_std": 0.3574240803718567, "rewards/accuracy_reward/mean": 0.44921875, "rewards/accuracy_reward/std": 0.49838894605636597, "rewards/format_reward/mean": 0.2265625, "rewards/format_reward/std": 0.41942715644836426, "step": 1 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 1571.0, "completions/max_terminated_length": 1571.0, "completions/mean_length": 648.296875, "completions/mean_terminated_length": 648.296875, "completions/min_length": 217.0, "completions/min_terminated_length": 217.0, "epoch": 0.008535609495865563, "grad_norm": 0.3673715573619009, "learning_rate": 4.166666666666666e-08, "loss": -0.0042, "num_tokens": 431586.0, "reward": 0.5390625, "reward_std": 0.3619725704193115, "rewards/accuracy_reward/mean": 0.45703125, "rewards/accuracy_reward/std": 0.4991260766983032, "rewards/format_reward/mean": 0.1640625, "rewards/format_reward/std": 0.3710577189922333, "step": 2 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 2048.0, "completions/max_terminated_length": 1984.0, "completions/mean_length": 673.1328125, "completions/mean_terminated_length": 667.7412109375, "completions/min_length": 194.0, "completions/min_terminated_length": 194.0, "epoch": 0.012803414243798347, "grad_norm": 0.47914003773403996, "learning_rate": 8.333333333333333e-08, "loss": 0.0205, "num_tokens": 646268.0, "reward": 0.662109375, "reward_std": 0.37592965364456177, "rewards/accuracy_reward/mean": 0.5859375, "rewards/accuracy_reward/std": 0.4935242533683777, "rewards/format_reward/mean": 0.15234375, "rewards/format_reward/std": 0.3600577116012573, "step": 3 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 1969.0, "completions/max_terminated_length": 1969.0, "completions/mean_length": 655.13671875, "completions/mean_terminated_length": 655.13671875, "completions/min_length": 250.0, "completions/min_terminated_length": 250.0, "epoch": 0.017071218991731127, "grad_norm": 0.39898427022729166, "learning_rate": 1.25e-07, "loss": 0.0238, "num_tokens": 849495.0, "reward": 0.642578125, "reward_std": 0.3759385347366333, "rewards/accuracy_reward/mean": 0.578125, "rewards/accuracy_reward/std": 0.49482619762420654, "rewards/format_reward/mean": 0.12890625, "rewards/format_reward/std": 0.33575257658958435, "step": 4 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 1776.0, "completions/max_terminated_length": 1776.0, "completions/mean_length": 704.90234375, "completions/mean_terminated_length": 704.90234375, "completions/min_length": 234.0, "completions/min_terminated_length": 234.0, "epoch": 0.021339023739663912, "grad_norm": 0.49975182401817253, "learning_rate": 1.6666666666666665e-07, "loss": 0.0083, "num_tokens": 1080622.0, "reward": 0.541015625, "reward_std": 0.3382297158241272, "rewards/accuracy_reward/mean": 0.4354838728904724, "rewards/accuracy_reward/std": 0.49682286381721497, "rewards/format_reward/mean": 0.23828125, "rewards/format_reward/std": 0.4268665909767151, "step": 5 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 1897.0, "completions/max_terminated_length": 1897.0, "completions/mean_length": 621.4296875, "completions/mean_terminated_length": 621.4296875, "completions/min_length": 186.0, "completions/min_terminated_length": 186.0, "epoch": 0.025606828487596694, "grad_norm": 0.5501302274168166, "learning_rate": 2.0833333333333333e-07, "loss": -0.0264, "num_tokens": 1282596.0, "reward": 0.58984375, "reward_std": 0.4271993041038513, "rewards/accuracy_reward/mean": 0.46484375, "rewards/accuracy_reward/std": 0.49973952770233154, "rewards/format_reward/mean": 0.25, "rewards/format_reward/std": 0.4338609278202057, "step": 6 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 1433.0, "completions/max_terminated_length": 1433.0, "completions/mean_length": 511.03515625, "completions/mean_terminated_length": 511.03515625, "completions/min_length": 169.0, "completions/min_terminated_length": 169.0, "epoch": 0.029874633235529476, "grad_norm": 0.6353483674834972, "learning_rate": 2.5e-07, "loss": 0.0043, "num_tokens": 1457949.0, "reward": 0.60546875, "reward_std": 0.4078904390335083, "rewards/accuracy_reward/mean": 0.5078125, "rewards/accuracy_reward/std": 0.5009182691574097, "rewards/format_reward/mean": 0.1953125, "rewards/format_reward/std": 0.39721766114234924, "step": 7 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 1948.0, "completions/max_terminated_length": 1948.0, "completions/mean_length": 728.21484375, "completions/mean_terminated_length": 728.21484375, "completions/min_length": 260.0, "completions/min_terminated_length": 260.0, "epoch": 0.034142437983462254, "grad_norm": 0.39823868913622557, "learning_rate": 2.916666666666667e-07, "loss": 0.0153, "num_tokens": 1697916.0, "reward": 0.5078125, "reward_std": 0.405484139919281, "rewards/accuracy_reward/mean": 0.375, "rewards/accuracy_reward/std": 0.4850712716579437, "rewards/format_reward/mean": 0.265625, "rewards/format_reward/std": 0.4425306022167206, "step": 8 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 1591.0, "completions/max_terminated_length": 1591.0, "completions/mean_length": 627.8515625, "completions/mean_terminated_length": 627.8515625, "completions/min_length": 221.0, "completions/min_terminated_length": 221.0, "epoch": 0.03841024273139504, "grad_norm": 0.46677623067823, "learning_rate": 3.333333333333333e-07, "loss": 0.0431, "num_tokens": 1895094.0, "reward": 0.673828125, "reward_std": 0.36997175216674805, "rewards/accuracy_reward/mean": 0.60546875, "rewards/accuracy_reward/std": 0.48970720171928406, "rewards/format_reward/mean": 0.13671875, "rewards/format_reward/std": 0.34422317147254944, "step": 9 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 2048.0, "completions/max_terminated_length": 1840.0, "completions/mean_length": 651.33984375, "completions/mean_terminated_length": 645.86279296875, "completions/min_length": 152.0, "completions/min_terminated_length": 152.0, "epoch": 0.042678047479327824, "grad_norm": 0.4778207599619871, "learning_rate": 3.75e-07, "loss": 0.0057, "num_tokens": 2101709.0, "reward": 0.658203125, "reward_std": 0.37365204095840454, "rewards/accuracy_reward/mean": 0.546875, "rewards/accuracy_reward/std": 0.4987730085849762, "rewards/format_reward/mean": 0.22265625, "rewards/format_reward/std": 0.41684433817863464, "step": 10 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 1917.0, "completions/max_terminated_length": 1917.0, "completions/mean_length": 678.25, "completions/mean_terminated_length": 678.25, "completions/min_length": 207.0, "completions/min_terminated_length": 207.0, "epoch": 0.0469458522272606, "grad_norm": 0.4166247946344727, "learning_rate": 4.1666666666666667e-07, "loss": -0.0112, "num_tokens": 2324349.0, "reward": 0.552734375, "reward_std": 0.377584308385849, "rewards/accuracy_reward/mean": 0.40234375, "rewards/accuracy_reward/std": 0.4913311004638672, "rewards/format_reward/mean": 0.30078125, "rewards/format_reward/std": 0.45949608087539673, "step": 11 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 2048.0, "completions/max_terminated_length": 1640.0, "completions/mean_length": 652.2265625, "completions/mean_terminated_length": 646.7529907226562, "completions/min_length": 144.0, "completions/min_terminated_length": 144.0, "epoch": 0.05121365697519339, "grad_norm": 0.3997247081112813, "learning_rate": 4.5833333333333327e-07, "loss": 0.0185, "num_tokens": 2535335.0, "reward": 0.59375, "reward_std": 0.325034499168396, "rewards/accuracy_reward/mean": 0.453125, "rewards/accuracy_reward/std": 0.4987730085849762, "rewards/format_reward/mean": 0.28125, "rewards/format_reward/std": 0.45048993825912476, "step": 12 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0078125, "completions/max_length": 2048.0, "completions/max_terminated_length": 1608.0, "completions/mean_length": 675.28515625, "completions/mean_terminated_length": 664.4763793945312, "completions/min_length": 142.0, "completions/min_terminated_length": 142.0, "epoch": 0.055481461723126166, "grad_norm": 0.5066486239850558, "learning_rate": 5e-07, "loss": -0.007, "num_tokens": 2757160.0, "reward": 0.5078125, "reward_std": 0.4239785075187683, "rewards/accuracy_reward/mean": 0.37890625, "rewards/accuracy_reward/std": 0.4860650300979614, "rewards/format_reward/mean": 0.2578125, "rewards/format_reward/std": 0.4382871091365814, "step": 13 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 1631.0, "completions/max_terminated_length": 1631.0, "completions/mean_length": 662.3515625, "completions/mean_terminated_length": 662.3515625, "completions/min_length": 184.0, "completions/min_terminated_length": 184.0, "epoch": 0.05974926647105895, "grad_norm": 0.39348449056373397, "learning_rate": 5.416666666666666e-07, "loss": -0.0035, "num_tokens": 2973122.0, "reward": 0.611328125, "reward_std": 0.3449006974697113, "rewards/accuracy_reward/mean": 0.49609375, "rewards/accuracy_reward/std": 0.5009641647338867, "rewards/format_reward/mean": 0.23046875, "rewards/format_reward/std": 0.4219578504562378, "step": 14 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 1820.0, "completions/max_terminated_length": 1820.0, "completions/mean_length": 681.25, "completions/mean_terminated_length": 681.25, "completions/min_length": 212.0, "completions/min_terminated_length": 212.0, "epoch": 0.06401707121899174, "grad_norm": 0.41492832402325586, "learning_rate": 5.833333333333334e-07, "loss": -0.009, "num_tokens": 3229306.0, "reward": 0.609375, "reward_std": 0.34621620178222656, "rewards/accuracy_reward/mean": 0.4921875, "rewards/accuracy_reward/std": 0.5009182691574097, "rewards/format_reward/mean": 0.234375, "rewards/format_reward/std": 0.42443734407424927, "step": 15 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 1793.0, "completions/max_terminated_length": 1793.0, "completions/mean_length": 666.60546875, "completions/mean_terminated_length": 666.60546875, "completions/min_length": 168.0, "completions/min_terminated_length": 168.0, "epoch": 0.06828487596692451, "grad_norm": 0.40098576404854996, "learning_rate": 6.249999999999999e-07, "loss": 0.0075, "num_tokens": 3443381.0, "reward": 0.671875, "reward_std": 0.33268827199935913, "rewards/accuracy_reward/mean": 0.58984375, "rewards/accuracy_reward/std": 0.49282538890838623, "rewards/format_reward/mean": 0.1640625, "rewards/format_reward/std": 0.3710577189922333, "step": 16 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 2048.0, "completions/max_terminated_length": 1676.0, "completions/mean_length": 611.16015625, "completions/mean_terminated_length": 605.5255126953125, "completions/min_length": 210.0, "completions/min_terminated_length": 210.0, "epoch": 0.07255268071485729, "grad_norm": 0.3886586858826799, "learning_rate": 6.666666666666666e-07, "loss": 0.023, "num_tokens": 3642062.0, "reward": 0.587890625, "reward_std": 0.3731262683868408, "rewards/accuracy_reward/mean": 0.48828125, "rewards/accuracy_reward/std": 0.5008418560028076, "rewards/format_reward/mean": 0.19921875, "rewards/format_reward/std": 0.40019527077674866, "step": 17 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 2048.0, "completions/max_terminated_length": 1535.0, "completions/mean_length": 705.734375, "completions/mean_terminated_length": 700.4706420898438, "completions/min_length": 232.0, "completions/min_terminated_length": 232.0, "epoch": 0.07682048546279008, "grad_norm": 0.35956519728845016, "learning_rate": 7.083333333333334e-07, "loss": 0.0068, "num_tokens": 3880354.0, "reward": 0.587890625, "reward_std": 0.37114569544792175, "rewards/accuracy_reward/mean": 0.49609375, "rewards/accuracy_reward/std": 0.5009641647338867, "rewards/format_reward/mean": 0.18359375, "rewards/format_reward/std": 0.387910932302475, "step": 18 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 2048.0, "completions/max_terminated_length": 1725.0, "completions/mean_length": 672.8359375, "completions/mean_terminated_length": 667.4431762695312, "completions/min_length": 241.0, "completions/min_terminated_length": 241.0, "epoch": 0.08108829021072286, "grad_norm": 0.3590129453560068, "learning_rate": 7.5e-07, "loss": 0.013, "num_tokens": 4118376.0, "reward": 0.634765625, "reward_std": 0.3457132577896118, "rewards/accuracy_reward/mean": 0.5234375, "rewards/accuracy_reward/std": 0.5004287362098694, "rewards/format_reward/mean": 0.22265625, "rewards/format_reward/std": 0.41684433817863464, "step": 19 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 2048.0, "completions/max_terminated_length": 1835.0, "completions/mean_length": 638.82421875, "completions/mean_terminated_length": 633.298095703125, "completions/min_length": 131.0, "completions/min_terminated_length": 131.0, "epoch": 0.08535609495865565, "grad_norm": 0.3036016367909782, "learning_rate": 7.916666666666666e-07, "loss": 0.0126, "num_tokens": 4323323.0, "reward": 0.740234375, "reward_std": 0.28531497716903687, "rewards/accuracy_reward/mean": 0.69140625, "rewards/accuracy_reward/std": 0.46281787753105164, "rewards/format_reward/mean": 0.09765625, "rewards/format_reward/std": 0.29743078351020813, "step": 20 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0078125, "completions/max_length": 2048.0, "completions/max_terminated_length": 1707.0, "completions/mean_length": 670.2265625, "completions/mean_terminated_length": 659.3779296875, "completions/min_length": 154.0, "completions/min_terminated_length": 154.0, "epoch": 0.08962389970658842, "grad_norm": 0.35875421960721965, "learning_rate": 8.333333333333333e-07, "loss": 0.034, "num_tokens": 4555797.0, "reward": 0.6875, "reward_std": 0.29541870951652527, "rewards/accuracy_reward/mean": 0.58984375, "rewards/accuracy_reward/std": 0.49282538890838623, "rewards/format_reward/mean": 0.1953125, "rewards/format_reward/std": 0.39721766114234924, "step": 21 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0078125, "completions/max_length": 2048.0, "completions/max_terminated_length": 1795.0, "completions/mean_length": 721.03515625, "completions/mean_terminated_length": 710.5866088867188, "completions/min_length": 187.0, "completions/min_terminated_length": 187.0, "epoch": 0.0938917044545212, "grad_norm": 0.30117312587157463, "learning_rate": 8.75e-07, "loss": 0.0105, "num_tokens": 4801006.0, "reward": 0.7109375, "reward_std": 0.3334755599498749, "rewards/accuracy_reward/mean": 0.6484375, "rewards/accuracy_reward/std": 0.47839346528053284, "rewards/format_reward/mean": 0.125, "rewards/format_reward/std": 0.33136674761772156, "step": 22 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 2048.0, "completions/max_terminated_length": 1842.0, "completions/mean_length": 702.84765625, "completions/mean_terminated_length": 697.5725708007812, "completions/min_length": 165.0, "completions/min_terminated_length": 165.0, "epoch": 0.09815950920245399, "grad_norm": 0.27855119216738156, "learning_rate": 9.166666666666665e-07, "loss": 0.0144, "num_tokens": 5032247.0, "reward": 0.595703125, "reward_std": 0.30231860280036926, "rewards/accuracy_reward/mean": 0.52734375, "rewards/accuracy_reward/std": 0.5002297759056091, "rewards/format_reward/mean": 0.13671875, "rewards/format_reward/std": 0.34422317147254944, "step": 23 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 1642.0, "completions/max_terminated_length": 1642.0, "completions/mean_length": 615.91015625, "completions/mean_terminated_length": 615.91015625, "completions/min_length": 216.0, "completions/min_terminated_length": 216.0, "epoch": 0.10242731395038678, "grad_norm": 0.28757747870815736, "learning_rate": 9.583333333333334e-07, "loss": 0.0065, "num_tokens": 5236352.0, "reward": 0.740234375, "reward_std": 0.2903454303741455, "rewards/accuracy_reward/mean": 0.6875, "rewards/accuracy_reward/std": 0.4644203782081604, "rewards/format_reward/mean": 0.10546875, "rewards/format_reward/std": 0.3077581524848938, "step": 24 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 2048.0, "completions/max_terminated_length": 1850.0, "completions/mean_length": 694.859375, "completions/mean_terminated_length": 689.552978515625, "completions/min_length": 206.0, "completions/min_terminated_length": 206.0, "epoch": 0.10669511869831955, "grad_norm": 0.2734393609428565, "learning_rate": 1e-06, "loss": 0.0128, "num_tokens": 5459508.0, "reward": 0.6484375, "reward_std": 0.32806265354156494, "rewards/accuracy_reward/mean": 0.609375, "rewards/accuracy_reward/std": 0.48884621262550354, "rewards/format_reward/mean": 0.078125, "rewards/format_reward/std": 0.26889389753341675, "step": 25 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 1909.0, "completions/max_terminated_length": 1909.0, "completions/mean_length": 688.046875, "completions/mean_terminated_length": 688.046875, "completions/min_length": 234.0, "completions/min_terminated_length": 234.0, "epoch": 0.11096292344625233, "grad_norm": 0.2074440704695248, "learning_rate": 9.99944579961847e-07, "loss": -0.0055, "num_tokens": 5678048.0, "reward": 0.7109375, "reward_std": 0.2539610266685486, "rewards/accuracy_reward/mean": 0.68359375, "rewards/accuracy_reward/std": 0.4659844934940338, "rewards/format_reward/mean": 0.0546875, "rewards/format_reward/std": 0.22781464457511902, "step": 26 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 1695.0, "completions/max_terminated_length": 1695.0, "completions/mean_length": 631.57421875, "completions/mean_terminated_length": 631.57421875, "completions/min_length": 176.0, "completions/min_terminated_length": 176.0, "epoch": 0.11523072819418512, "grad_norm": 0.24553777090920487, "learning_rate": 9.997783321329102e-07, "loss": 0.025, "num_tokens": 5875587.0, "reward": 0.716796875, "reward_std": 0.3220256567001343, "rewards/accuracy_reward/mean": 0.70703125, "rewards/accuracy_reward/std": 0.45601576566696167, "rewards/format_reward/mean": 0.01953125, "rewards/format_reward/std": 0.13865381479263306, "step": 27 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.015625, "completions/max_length": 2048.0, "completions/max_terminated_length": 1857.0, "completions/mean_length": 664.78125, "completions/mean_terminated_length": 642.825439453125, "completions/min_length": 177.0, "completions/min_terminated_length": 177.0, "epoch": 0.1194985329421179, "grad_norm": 0.23732647855594297, "learning_rate": 9.995012933670338e-07, "loss": 0.0232, "num_tokens": 6089579.0, "reward": 0.73828125, "reward_std": 0.22687013447284698, "rewards/accuracy_reward/mean": 0.703125, "rewards/accuracy_reward/std": 0.45777595043182373, "rewards/format_reward/mean": 0.0703125, "rewards/format_reward/std": 0.2561737895011902, "step": 28 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0078125, "completions/max_length": 2048.0, "completions/max_terminated_length": 1852.0, "completions/mean_length": 636.71484375, "completions/mean_terminated_length": 625.6023559570312, "completions/min_length": 118.0, "completions/min_terminated_length": 118.0, "epoch": 0.12376633769005067, "grad_norm": 0.21710833352295233, "learning_rate": 9.99113525078214e-07, "loss": 0.0299, "num_tokens": 6290170.0, "reward": 0.7421875, "reward_std": 0.23235777020454407, "rewards/accuracy_reward/mean": 0.73828125, "rewards/accuracy_reward/std": 0.4404313564300537, "rewards/format_reward/mean": 0.0078125, "rewards/format_reward/std": 0.08821486681699753, "step": 29 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 1948.0, "completions/max_terminated_length": 1948.0, "completions/mean_length": 700.12890625, "completions/mean_terminated_length": 700.12890625, "completions/min_length": 216.0, "completions/min_terminated_length": 216.0, "epoch": 0.12803414243798347, "grad_norm": 0.255577231546662, "learning_rate": 9.98615113226984e-07, "loss": 0.0039, "num_tokens": 6508667.0, "reward": 0.669921875, "reward_std": 0.30817121267318726, "rewards/accuracy_reward/mean": 0.6171875, "rewards/accuracy_reward/std": 0.48702529072761536, "rewards/format_reward/mean": 0.10546875, "rewards/format_reward/std": 0.3077581524848938, "step": 30 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 1779.0, "completions/max_terminated_length": 1779.0, "completions/mean_length": 687.99609375, "completions/mean_terminated_length": 687.99609375, "completions/min_length": 182.0, "completions/min_terminated_length": 182.0, "epoch": 0.13230194718591626, "grad_norm": 0.26162435398779615, "learning_rate": 9.980061683013592e-07, "loss": 0.0094, "num_tokens": 6725066.0, "reward": 0.689453125, "reward_std": 0.2880241870880127, "rewards/accuracy_reward/mean": 0.62890625, "rewards/accuracy_reward/std": 0.48404383659362793, "rewards/format_reward/mean": 0.12109375, "rewards/format_reward/std": 0.3268752694129944, "step": 31 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 2048.0, "completions/max_terminated_length": 1525.0, "completions/mean_length": 701.85546875, "completions/mean_terminated_length": 696.5765380859375, "completions/min_length": 199.0, "completions/min_terminated_length": 199.0, "epoch": 0.13656975193384902, "grad_norm": 0.2031469974867505, "learning_rate": 9.972868252923432e-07, "loss": 0.0196, "num_tokens": 6953621.0, "reward": 0.66796875, "reward_std": 0.20259632170200348, "rewards/accuracy_reward/mean": 0.609375, "rewards/accuracy_reward/std": 0.48884621262550354, "rewards/format_reward/mean": 0.1171875, "rewards/format_reward/std": 0.3222736418247223, "step": 32 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0078125, "completions/max_length": 2048.0, "completions/max_terminated_length": 1830.0, "completions/mean_length": 703.5859375, "completions/mean_terminated_length": 693.0, "completions/min_length": 149.0, "completions/min_terminated_length": 149.0, "epoch": 0.1408375566817818, "grad_norm": 0.22024758680154216, "learning_rate": 9.964572436640045e-07, "loss": 0.0146, "num_tokens": 7183283.0, "reward": 0.693359375, "reward_std": 0.21583208441734314, "rewards/accuracy_reward/mean": 0.671875, "rewards/accuracy_reward/std": 0.47045037150382996, "rewards/format_reward/mean": 0.04296875, "rewards/format_reward/std": 0.20318391919136047, "step": 33 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0078125, "completions/max_length": 2048.0, "completions/max_terminated_length": 1529.0, "completions/mean_length": 724.53515625, "completions/mean_terminated_length": 714.1141967773438, "completions/min_length": 179.0, "completions/min_terminated_length": 179.0, "epoch": 0.14510536142971459, "grad_norm": 0.23527280972558814, "learning_rate": 9.955176073181249e-07, "loss": 0.0042, "num_tokens": 7425828.0, "reward": 0.6484375, "reward_std": 0.20720398426055908, "rewards/accuracy_reward/mean": 0.56640625, "rewards/accuracy_reward/std": 0.4965413510799408, "rewards/format_reward/mean": 0.1640625, "rewards/format_reward/std": 0.3710577189922333, "step": 34 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 1844.0, "completions/max_terminated_length": 1844.0, "completions/mean_length": 646.3671875, "completions/mean_terminated_length": 646.3671875, "completions/min_length": 210.0, "completions/min_terminated_length": 210.0, "epoch": 0.14937316617764737, "grad_norm": 0.30371213349912707, "learning_rate": 9.944681245534329e-07, "loss": 0.0172, "num_tokens": 7652842.0, "reward": 0.65234375, "reward_std": 0.2866480350494385, "rewards/accuracy_reward/mean": 0.6171875, "rewards/accuracy_reward/std": 0.48702529072761536, "rewards/format_reward/mean": 0.0703125, "rewards/format_reward/std": 0.2561737895011902, "step": 35 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 2041.0, "completions/max_terminated_length": 2041.0, "completions/mean_length": 647.6875, "completions/mean_terminated_length": 647.6875, "completions/min_length": 157.0, "completions/min_terminated_length": 157.0, "epoch": 0.15364097092558016, "grad_norm": 0.2356101324079271, "learning_rate": 9.933090280194278e-07, "loss": 0.0138, "num_tokens": 7859442.0, "reward": 0.71875, "reward_std": 0.26503604650497437, "rewards/accuracy_reward/mean": 0.65625, "rewards/accuracy_reward/std": 0.47588926553726196, "rewards/format_reward/mean": 0.125, "rewards/format_reward/std": 0.33136674761772156, "step": 36 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 1796.0, "completions/max_terminated_length": 1796.0, "completions/mean_length": 677.33203125, "completions/mean_terminated_length": 677.33203125, "completions/min_length": 182.0, "completions/min_terminated_length": 182.0, "epoch": 0.15790877567351294, "grad_norm": 0.22378526166689447, "learning_rate": 9.920405746648065e-07, "loss": 0.0115, "num_tokens": 8072199.0, "reward": 0.671875, "reward_std": 0.25537729263305664, "rewards/accuracy_reward/mean": 0.63671875, "rewards/accuracy_reward/std": 0.48188701272010803, "rewards/format_reward/mean": 0.0703125, "rewards/format_reward/std": 0.2561737895011902, "step": 37 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 2048.0, "completions/max_terminated_length": 1993.0, "completions/mean_length": 686.2734375, "completions/mean_terminated_length": 680.933349609375, "completions/min_length": 199.0, "completions/min_terminated_length": 199.0, "epoch": 0.16217658042144573, "grad_norm": 0.17084203600010728, "learning_rate": 9.906630456805022e-07, "loss": 0.0198, "num_tokens": 8285565.0, "reward": 0.814453125, "reward_std": 0.17492994666099548, "rewards/accuracy_reward/mean": 0.7734375, "rewards/accuracy_reward/std": 0.41942715644836426, "rewards/format_reward/mean": 0.08203125, "rewards/format_reward/std": 0.2749498784542084, "step": 38 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 1823.0, "completions/max_terminated_length": 1823.0, "completions/mean_length": 597.94140625, "completions/mean_terminated_length": 597.94140625, "completions/min_length": 183.0, "completions/min_terminated_length": 183.0, "epoch": 0.1664443851693785, "grad_norm": 0.24963008842933648, "learning_rate": 9.891767464373501e-07, "loss": 0.0058, "num_tokens": 8477414.0, "reward": 0.79296875, "reward_std": 0.26521071791648865, "rewards/accuracy_reward/mean": 0.73828125, "rewards/accuracy_reward/std": 0.4404313564300537, "rewards/format_reward/mean": 0.109375, "rewards/format_reward/std": 0.31272050738334656, "step": 39 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 2048.0, "completions/max_terminated_length": 1651.0, "completions/mean_length": 649.14453125, "completions/mean_terminated_length": 643.6588745117188, "completions/min_length": 212.0, "completions/min_terminated_length": 212.0, "epoch": 0.1707121899173113, "grad_norm": 0.2987302168287354, "learning_rate": 9.875820064183934e-07, "loss": 0.0083, "num_tokens": 8689635.0, "reward": 0.73828125, "reward_std": 0.26423725485801697, "rewards/accuracy_reward/mean": 0.6875, "rewards/accuracy_reward/std": 0.4644203782081604, "rewards/format_reward/mean": 0.1015625, "rewards/format_reward/std": 0.3026638329029083, "step": 40 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 2048.0, "completions/max_terminated_length": 1856.0, "completions/mean_length": 683.875, "completions/mean_terminated_length": 678.5255126953125, "completions/min_length": 218.0, "completions/min_terminated_length": 218.0, "epoch": 0.17497999466524405, "grad_norm": 0.22032566508097262, "learning_rate": 9.85879179145843e-07, "loss": 0.015, "num_tokens": 8907163.0, "reward": 0.7578125, "reward_std": 0.20137226581573486, "rewards/accuracy_reward/mean": 0.6640625, "rewards/accuracy_reward/std": 0.4732423722743988, "rewards/format_reward/mean": 0.1875, "rewards/format_reward/std": 0.3910769522190094, "step": 41 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 1545.0, "completions/max_terminated_length": 1545.0, "completions/mean_length": 607.7109375, "completions/mean_terminated_length": 607.7109375, "completions/min_length": 179.0, "completions/min_terminated_length": 179.0, "epoch": 0.17924779941317684, "grad_norm": 0.2342639223973614, "learning_rate": 9.840686421027082e-07, "loss": 0.0187, "num_tokens": 9122681.0, "reward": 0.6953125, "reward_std": 0.2190343141555786, "rewards/accuracy_reward/mean": 0.625, "rewards/accuracy_reward/std": 0.4850712716579437, "rewards/format_reward/mean": 0.140625, "rewards/format_reward/std": 0.3483152687549591, "step": 42 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01171875, "completions/max_length": 2048.0, "completions/max_terminated_length": 1982.0, "completions/mean_length": 693.39453125, "completions/mean_terminated_length": 677.33203125, "completions/min_length": 178.0, "completions/min_terminated_length": 178.0, "epoch": 0.18351560416110962, "grad_norm": 0.21886481594628424, "learning_rate": 9.821507966491177e-07, "loss": 0.0055, "num_tokens": 9343838.0, "reward": 0.6640625, "reward_std": 0.22423462569713593, "rewards/accuracy_reward/mean": 0.59375, "rewards/accuracy_reward/std": 0.49209436774253845, "rewards/format_reward/mean": 0.140625, "rewards/format_reward/std": 0.3483152687549591, "step": 43 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 1591.0, "completions/max_terminated_length": 1591.0, "completions/mean_length": 628.17578125, "completions/mean_terminated_length": 628.17578125, "completions/min_length": 233.0, "completions/min_terminated_length": 233.0, "epoch": 0.1877834089090424, "grad_norm": 0.22548182919178103, "learning_rate": 9.801260679333434e-07, "loss": 0.0072, "num_tokens": 9540523.0, "reward": 0.783203125, "reward_std": 0.24792197346687317, "rewards/accuracy_reward/mean": 0.7421875, "rewards/accuracy_reward/std": 0.4382871091365814, "rewards/format_reward/mean": 0.08203125, "rewards/format_reward/std": 0.2749498784542084, "step": 44 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0078125, "completions/max_length": 2048.0, "completions/max_terminated_length": 1920.0, "completions/mean_length": 629.16796875, "completions/mean_terminated_length": 617.9960327148438, "completions/min_length": 219.0, "completions/min_terminated_length": 219.0, "epoch": 0.1920512136569752, "grad_norm": 0.3321555096230215, "learning_rate": 9.779949047975568e-07, "loss": 0.0185, "num_tokens": 9749422.0, "reward": 0.740234375, "reward_std": 0.24637371301651, "rewards/accuracy_reward/mean": 0.6796875, "rewards/accuracy_reward/std": 0.4675106406211853, "rewards/format_reward/mean": 0.12109375, "rewards/format_reward/std": 0.3268752694129944, "step": 45 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0078125, "completions/max_length": 2048.0, "completions/max_terminated_length": 1974.0, "completions/mean_length": 606.62109375, "completions/mean_terminated_length": 595.2716674804688, "completions/min_length": 221.0, "completions/min_terminated_length": 221.0, "epoch": 0.19631901840490798, "grad_norm": 0.24958863727963904, "learning_rate": 9.757577796783265e-07, "loss": 0.0095, "num_tokens": 9945989.0, "reward": 0.77734375, "reward_std": 0.22648513317108154, "rewards/accuracy_reward/mean": 0.69921875, "rewards/accuracy_reward/std": 0.45949608087539673, "rewards/format_reward/mean": 0.15625, "rewards/format_reward/std": 0.3638034462928772, "step": 46 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0078125, "completions/max_length": 2048.0, "completions/max_terminated_length": 1791.0, "completions/mean_length": 737.87890625, "completions/mean_terminated_length": 727.56298828125, "completions/min_length": 204.0, "completions/min_terminated_length": 204.0, "epoch": 0.20058682315284077, "grad_norm": 0.190159113155924, "learning_rate": 9.73415188501891e-07, "loss": -0.0074, "num_tokens": 10182566.0, "reward": 0.787109375, "reward_std": 0.20080013573169708, "rewards/accuracy_reward/mean": 0.71484375, "rewards/accuracy_reward/std": 0.4523732364177704, "rewards/format_reward/mean": 0.14453125, "rewards/format_reward/std": 0.35231640934944153, "step": 47 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 2048.0, "completions/max_terminated_length": 1747.0, "completions/mean_length": 647.38671875, "completions/mean_terminated_length": 641.8941650390625, "completions/min_length": 177.0, "completions/min_terminated_length": 177.0, "epoch": 0.20485462790077355, "grad_norm": 0.268454809136645, "learning_rate": 9.709676505742192e-07, "loss": -0.0002, "num_tokens": 10392113.0, "reward": 0.734375, "reward_std": 0.23577763140201569, "rewards/accuracy_reward/mean": 0.66015625, "rewards/accuracy_reward/std": 0.47458380460739136, "rewards/format_reward/mean": 0.1484375, "rewards/format_reward/std": 0.3562295734882355, "step": 48 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0078125, "completions/max_length": 2048.0, "completions/max_terminated_length": 1888.0, "completions/mean_length": 661.5078125, "completions/mean_terminated_length": 650.590576171875, "completions/min_length": 214.0, "completions/min_terminated_length": 214.0, "epoch": 0.2091224326487063, "grad_norm": 0.21630956883123373, "learning_rate": 9.684157084658926e-07, "loss": 0.0086, "num_tokens": 10605363.0, "reward": 0.853515625, "reward_std": 0.21964912116527557, "rewards/accuracy_reward/mean": 0.81640625, "rewards/accuracy_reward/std": 0.387910932302475, "rewards/format_reward/mean": 0.07421875, "rewards/format_reward/std": 0.2626400291919708, "step": 49 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01953125, "completions/max_length": 2048.0, "completions/max_terminated_length": 1914.0, "completions/mean_length": 766.078125, "completions/mean_terminated_length": 740.5418701171875, "completions/min_length": 234.0, "completions/min_terminated_length": 234.0, "epoch": 0.2133902373966391, "grad_norm": 0.22688368686702495, "learning_rate": 9.657599278918276e-07, "loss": 0.0257, "num_tokens": 10847487.0, "reward": 0.7421875, "reward_std": 0.2671869993209839, "rewards/accuracy_reward/mean": 0.671875, "rewards/accuracy_reward/std": 0.47045037150382996, "rewards/format_reward/mean": 0.140625, "rewards/format_reward/std": 0.3483152687549591, "step": 50 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 1936.0, "completions/max_terminated_length": 1936.0, "completions/mean_length": 641.4765625, "completions/mean_terminated_length": 641.4765625, "completions/min_length": 225.0, "completions/min_terminated_length": 225.0, "epoch": 0.21765804214457188, "grad_norm": 0.2846024559524484, "learning_rate": 9.630008975858665e-07, "loss": 0.0014, "num_tokens": 11052521.0, "reward": 0.73046875, "reward_std": 0.26468726992607117, "rewards/accuracy_reward/mean": 0.65234375, "rewards/accuracy_reward/std": 0.4771590530872345, "rewards/format_reward/mean": 0.15625, "rewards/format_reward/std": 0.3638034462928772, "step": 51 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 1815.0, "completions/max_terminated_length": 1815.0, "completions/mean_length": 772.2265625, "completions/mean_terminated_length": 772.2265625, "completions/min_length": 250.0, "completions/min_terminated_length": 250.0, "epoch": 0.22192584689250466, "grad_norm": 0.20216823285321933, "learning_rate": 9.601392291702693e-07, "loss": 0.0001, "num_tokens": 11297443.0, "reward": 0.75, "reward_std": 0.23809123039245605, "rewards/accuracy_reward/mean": 0.67578125, "rewards/accuracy_reward/std": 0.46899911761283875, "rewards/format_reward/mean": 0.1484375, "rewards/format_reward/std": 0.3562295734882355, "step": 52 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 1827.0, "completions/max_terminated_length": 1827.0, "completions/mean_length": 600.21484375, "completions/mean_terminated_length": 600.21484375, "completions/min_length": 158.0, "completions/min_terminated_length": 158.0, "epoch": 0.22619365164043745, "grad_norm": 0.2726804626120724, "learning_rate": 9.571755570201264e-07, "loss": 0.012, "num_tokens": 11486002.0, "reward": 0.861328125, "reward_std": 0.2225569188594818, "rewards/accuracy_reward/mean": 0.8046875, "rewards/accuracy_reward/std": 0.39721766114234924, "rewards/format_reward/mean": 0.11328125, "rewards/format_reward/std": 0.31755712628364563, "step": 53 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 2048.0, "completions/max_terminated_length": 1649.0, "completions/mean_length": 617.546875, "completions/mean_terminated_length": 611.9373168945312, "completions/min_length": 216.0, "completions/min_terminated_length": 216.0, "epoch": 0.23046145638837023, "grad_norm": 0.24894008585958025, "learning_rate": 9.54110538122733e-07, "loss": 0.0161, "num_tokens": 11683894.0, "reward": 0.83984375, "reward_std": 0.2143787145614624, "rewards/accuracy_reward/mean": 0.70703125, "rewards/accuracy_reward/std": 0.45601576566696167, "rewards/format_reward/mean": 0.265625, "rewards/format_reward/std": 0.4425306022167206, "step": 54 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01171875, "completions/max_length": 2048.0, "completions/max_terminated_length": 1745.0, "completions/mean_length": 714.12109375, "completions/mean_terminated_length": 698.3043823242188, "completions/min_length": 205.0, "completions/min_terminated_length": 205.0, "epoch": 0.23472926113630302, "grad_norm": 0.2732357959245951, "learning_rate": 9.509448519319454e-07, "loss": 0.0154, "num_tokens": 11913069.0, "reward": 0.658203125, "reward_std": 0.26149094104766846, "rewards/accuracy_reward/mean": 0.546875, "rewards/accuracy_reward/std": 0.4987730085849762, "rewards/format_reward/mean": 0.22265625, "rewards/format_reward/std": 0.41684433817863464, "step": 55 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 2048.0, "completions/max_terminated_length": 1636.0, "completions/mean_length": 685.7890625, "completions/mean_terminated_length": 680.4470825195312, "completions/min_length": 168.0, "completions/min_terminated_length": 168.0, "epoch": 0.2389970658842358, "grad_norm": 0.2286495814498294, "learning_rate": 9.47679200217562e-07, "loss": -0.0007, "num_tokens": 12144967.0, "reward": 0.693359375, "reward_std": 0.2447323501110077, "rewards/accuracy_reward/mean": 0.6015625, "rewards/accuracy_reward/std": 0.4905354380607605, "rewards/format_reward/mean": 0.18359375, "rewards/format_reward/std": 0.387910932302475, "step": 56 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0078125, "completions/max_length": 2048.0, "completions/max_terminated_length": 1769.0, "completions/mean_length": 723.875, "completions/mean_terminated_length": 713.4487915039062, "completions/min_length": 232.0, "completions/min_terminated_length": 232.0, "epoch": 0.2432648706321686, "grad_norm": 0.24594802255709164, "learning_rate": 9.44314306909753e-07, "loss": 0.0105, "num_tokens": 12389999.0, "reward": 0.705078125, "reward_std": 0.27474117279052734, "rewards/accuracy_reward/mean": 0.61328125, "rewards/accuracy_reward/std": 0.4879522919654846, "rewards/format_reward/mean": 0.18359375, "rewards/format_reward/std": 0.387910932302475, "step": 57 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0078125, "completions/max_length": 2048.0, "completions/max_terminated_length": 1701.0, "completions/mean_length": 694.6796875, "completions/mean_terminated_length": 684.0236206054688, "completions/min_length": 178.0, "completions/min_terminated_length": 178.0, "epoch": 0.24753267538010135, "grad_norm": 0.25619434925454265, "learning_rate": 9.408509179385804e-07, "loss": 0.0166, "num_tokens": 12613853.0, "reward": 0.796875, "reward_std": 0.22640833258628845, "rewards/accuracy_reward/mean": 0.71875, "rewards/accuracy_reward/std": 0.45048993825912476, "rewards/format_reward/mean": 0.15625, "rewards/format_reward/std": 0.3638034462928772, "step": 58 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0078125, "completions/max_length": 2048.0, "completions/max_terminated_length": 1899.0, "completions/mean_length": 692.82421875, "completions/mean_terminated_length": 682.153564453125, "completions/min_length": 231.0, "completions/min_terminated_length": 231.0, "epoch": 0.25180048012803413, "grad_norm": 0.2225686619157928, "learning_rate": 9.3728980106864e-07, "loss": 0.0037, "num_tokens": 12839184.0, "reward": 0.796875, "reward_std": 0.23136967420578003, "rewards/accuracy_reward/mean": 0.7109375, "rewards/accuracy_reward/std": 0.45421501994132996, "rewards/format_reward/mean": 0.171875, "rewards/format_reward/std": 0.3780108094215393, "step": 59 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0078125, "completions/max_length": 2048.0, "completions/max_terminated_length": 1876.0, "completions/mean_length": 703.921875, "completions/mean_terminated_length": 693.3385620117188, "completions/min_length": 216.0, "completions/min_terminated_length": 216.0, "epoch": 0.25606828487596694, "grad_norm": 0.3592689197114455, "learning_rate": 9.336317457288629e-07, "loss": 0.0113, "num_tokens": 13077748.0, "reward": 0.708984375, "reward_std": 0.31907516717910767, "rewards/accuracy_reward/mean": 0.61328125, "rewards/accuracy_reward/std": 0.4879522919654846, "rewards/format_reward/mean": 0.19140625, "rewards/format_reward/std": 0.39417871832847595, "step": 60 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0234375, "completions/max_length": 2048.0, "completions/max_terminated_length": 1709.0, "completions/mean_length": 745.40234375, "completions/mean_terminated_length": 714.1400146484375, "completions/min_length": 200.0, "completions/min_terminated_length": 200.0, "epoch": 0.2603360896238997, "grad_norm": 0.23607664790636312, "learning_rate": 9.29877562837515e-07, "loss": 0.029, "num_tokens": 13308051.0, "reward": 0.720703125, "reward_std": 0.27129217982292175, "rewards/accuracy_reward/mean": 0.62109375, "rewards/accuracy_reward/std": 0.4860650300979614, "rewards/format_reward/mean": 0.19921875, "rewards/format_reward/std": 0.40019527077674866, "step": 61 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 1934.0, "completions/max_terminated_length": 1934.0, "completions/mean_length": 653.22265625, "completions/mean_terminated_length": 653.22265625, "completions/min_length": 185.0, "completions/min_terminated_length": 185.0, "epoch": 0.2646038943718325, "grad_norm": 0.2742367554221537, "learning_rate": 9.260280846224327e-07, "loss": -0.0131, "num_tokens": 13521412.0, "reward": 0.794921875, "reward_std": 0.2132212221622467, "rewards/accuracy_reward/mean": 0.70703125, "rewards/accuracy_reward/std": 0.45601576566696167, "rewards/format_reward/mean": 0.17578125, "rewards/format_reward/std": 0.3813795745372772, "step": 62 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01171875, "completions/max_length": 2048.0, "completions/max_terminated_length": 1939.0, "completions/mean_length": 698.3046875, "completions/mean_terminated_length": 682.3004150390625, "completions/min_length": 213.0, "completions/min_terminated_length": 213.0, "epoch": 0.2688716991197653, "grad_norm": 0.29476738926195406, "learning_rate": 9.220841644365343e-07, "loss": 0.0034, "num_tokens": 13747098.0, "reward": 0.84765625, "reward_std": 0.26552915573120117, "rewards/accuracy_reward/mean": 0.703125, "rewards/accuracy_reward/std": 0.45777595043182373, "rewards/format_reward/mean": 0.2890625, "rewards/format_reward/std": 0.45421501994132996, "step": 63 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.015625, "completions/max_length": 2048.0, "completions/max_terminated_length": 1989.0, "completions/mean_length": 669.875, "completions/mean_terminated_length": 648.0000610351562, "completions/min_length": 179.0, "completions/min_terminated_length": 179.0, "epoch": 0.27313950386769803, "grad_norm": 0.4326215315246476, "learning_rate": 9.180466765686483e-07, "loss": 0.0113, "num_tokens": 13958250.0, "reward": 0.91015625, "reward_std": 0.2968641519546509, "rewards/accuracy_reward/mean": 0.6875, "rewards/accuracy_reward/std": 0.4644203782081604, "rewards/format_reward/mean": 0.4453125, "rewards/format_reward/std": 0.49797385931015015, "step": 64 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 2048.0, "completions/max_terminated_length": 1911.0, "completions/mean_length": 679.34765625, "completions/mean_terminated_length": 673.9804077148438, "completions/min_length": 228.0, "completions/min_terminated_length": 228.0, "epoch": 0.27740730861563084, "grad_norm": 0.7511483951516248, "learning_rate": 9.139165160497016e-07, "loss": 0.0075, "num_tokens": 14173243.0, "reward": 0.90234375, "reward_std": 0.3380991220474243, "rewards/accuracy_reward/mean": 0.6640625, "rewards/accuracy_reward/std": 0.4732423722743988, "rewards/format_reward/mean": 0.4765625, "rewards/format_reward/std": 0.5004287362098694, "step": 65 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01171875, "completions/max_length": 2048.0, "completions/max_terminated_length": 1978.0, "completions/mean_length": 721.9453125, "completions/mean_terminated_length": 706.2213745117188, "completions/min_length": 258.0, "completions/min_terminated_length": 258.0, "epoch": 0.2816751133635636, "grad_norm": 0.6085854387213407, "learning_rate": 9.096945984543081e-07, "loss": 0.0048, "num_tokens": 14395845.0, "reward": 1.123046875, "reward_std": 0.3382420539855957, "rewards/accuracy_reward/mean": 0.6953125, "rewards/accuracy_reward/std": 0.4611765742301941, "rewards/format_reward/mean": 0.85546875, "rewards/format_reward/std": 0.35231640934944153, "step": 66 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 2048.0, "completions/max_terminated_length": 1676.0, "completions/mean_length": 749.703125, "completions/mean_terminated_length": 744.61181640625, "completions/min_length": 249.0, "completions/min_terminated_length": 249.0, "epoch": 0.2859429181114964, "grad_norm": 0.2571068732895392, "learning_rate": 9.053818596978049e-07, "loss": 0.0109, "num_tokens": 14628033.0, "reward": 1.126953125, "reward_std": 0.2895796000957489, "rewards/accuracy_reward/mean": 0.64453125, "rewards/accuracy_reward/std": 0.4795927405357361, "rewards/format_reward/mean": 0.96484375, "rewards/format_reward/std": 0.18453538417816162, "step": 67 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 1841.0, "completions/max_terminated_length": 1841.0, "completions/mean_length": 719.26953125, "completions/mean_terminated_length": 719.26953125, "completions/min_length": 272.0, "completions/min_terminated_length": 272.0, "epoch": 0.29021072285942917, "grad_norm": 0.28818591567522955, "learning_rate": 9.009792558287776e-07, "loss": -0.0131, "num_tokens": 14861670.0, "reward": 1.16015625, "reward_std": 0.20511436462402344, "rewards/accuracy_reward/mean": 0.6796875, "rewards/accuracy_reward/std": 0.4675106406211853, "rewards/format_reward/mean": 0.9609375, "rewards/format_reward/std": 0.19412322342395782, "step": 68 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01171875, "completions/max_length": 2048.0, "completions/max_terminated_length": 1978.0, "completions/mean_length": 796.40234375, "completions/mean_terminated_length": 781.561279296875, "completions/min_length": 215.0, "completions/min_terminated_length": 215.0, "epoch": 0.294478527607362, "grad_norm": 0.29612312731557583, "learning_rate": 8.964877628171239e-07, "loss": 0.0256, "num_tokens": 15104197.0, "reward": 1.12890625, "reward_std": 0.3324652314186096, "rewards/accuracy_reward/mean": 0.65234375, "rewards/accuracy_reward/std": 0.4771590530872345, "rewards/format_reward/mean": 0.953125, "rewards/format_reward/std": 0.21178513765335083, "step": 69 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0078125, "completions/max_length": 2048.0, "completions/max_terminated_length": 1908.0, "completions/mean_length": 663.68359375, "completions/mean_terminated_length": 652.783447265625, "completions/min_length": 189.0, "completions/min_terminated_length": 189.0, "epoch": 0.29874633235529474, "grad_norm": 0.3246940201717547, "learning_rate": 8.919083763377e-07, "loss": 0.0066, "num_tokens": 15316380.0, "reward": 1.24609375, "reward_std": 0.2827882468700409, "rewards/accuracy_reward/mean": 0.765625, "rewards/accuracy_reward/std": 0.42443734407424927, "rewards/format_reward/mean": 0.9609375, "rewards/format_reward/std": 0.19412322342395782, "step": 70 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 1951.0, "completions/max_terminated_length": 1951.0, "completions/mean_length": 758.421875, "completions/mean_terminated_length": 758.421875, "completions/min_length": 280.0, "completions/min_terminated_length": 280.0, "epoch": 0.30301413710322755, "grad_norm": 0.3371914282568013, "learning_rate": 8.872421115495995e-07, "loss": 0.0105, "num_tokens": 15555160.0, "reward": 1.087890625, "reward_std": 0.28879427909851074, "rewards/accuracy_reward/mean": 0.60546875, "rewards/accuracy_reward/std": 0.48970720171928406, "rewards/format_reward/mean": 0.96484375, "rewards/format_reward/std": 0.18453538417816162, "step": 71 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 1713.0, "completions/max_terminated_length": 1713.0, "completions/mean_length": 723.99609375, "completions/mean_terminated_length": 723.99609375, "completions/min_length": 254.0, "completions/min_terminated_length": 254.0, "epoch": 0.3072819418511603, "grad_norm": 0.261972313519586, "learning_rate": 8.824900028711128e-07, "loss": -0.0052, "num_tokens": 15782895.0, "reward": 1.224609375, "reward_std": 0.3060935139656067, "rewards/accuracy_reward/mean": 0.734375, "rewards/accuracy_reward/std": 0.4425306022167206, "rewards/format_reward/mean": 0.98046875, "rewards/format_reward/std": 0.13865381479263306, "step": 72 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 1737.0, "completions/max_terminated_length": 1737.0, "completions/mean_length": 690.74609375, "completions/mean_terminated_length": 690.74609375, "completions/min_length": 235.0, "completions/min_terminated_length": 235.0, "epoch": 0.31154974659909307, "grad_norm": 0.30539712628741345, "learning_rate": 8.776531037504169e-07, "loss": 0.0203, "num_tokens": 16002830.0, "reward": 1.17578125, "reward_std": 0.25357601046562195, "rewards/accuracy_reward/mean": 0.6875, "rewards/accuracy_reward/std": 0.4644203782081604, "rewards/format_reward/mean": 0.9765625, "rewards/format_reward/std": 0.15158477425575256, "step": 73 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01171875, "completions/max_length": 2048.0, "completions/max_terminated_length": 1731.0, "completions/mean_length": 835.28125, "completions/mean_terminated_length": 820.9012451171875, "completions/min_length": 241.0, "completions/min_terminated_length": 241.0, "epoch": 0.3158175513470259, "grad_norm": 0.24036500137818684, "learning_rate": 8.727324864320471e-07, "loss": 0.0047, "num_tokens": 16262718.0, "reward": 1.134765625, "reward_std": 0.2882940173149109, "rewards/accuracy_reward/mean": 0.65234375, "rewards/accuracy_reward/std": 0.4771590530872345, "rewards/format_reward/mean": 0.96484375, "rewards/format_reward/std": 0.18453538417816162, "step": 74 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01171875, "completions/max_length": 2048.0, "completions/max_terminated_length": 2021.0, "completions/mean_length": 829.76953125, "completions/mean_terminated_length": 815.3241577148438, "completions/min_length": 253.0, "completions/min_terminated_length": 253.0, "epoch": 0.32008535609495864, "grad_norm": 0.23573518101404708, "learning_rate": 8.677292417192016e-07, "loss": 0.0198, "num_tokens": 16517427.0, "reward": 1.115234375, "reward_std": 0.2808934450149536, "rewards/accuracy_reward/mean": 0.63671875, "rewards/accuracy_reward/std": 0.48188701272010803, "rewards/format_reward/mean": 0.95703125, "rewards/format_reward/std": 0.20318391919136047, "step": 75 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0078125, "completions/max_length": 2048.0, "completions/max_terminated_length": 1830.0, "completions/mean_length": 641.53125, "completions/mean_terminated_length": 630.4566650390625, "completions/min_length": 148.0, "completions/min_terminated_length": 148.0, "epoch": 0.32435316084289145, "grad_norm": 0.2668783476917137, "learning_rate": 8.626444787319317e-07, "loss": 0.003, "num_tokens": 16723107.0, "reward": 1.26953125, "reward_std": 0.20704886317253113, "rewards/accuracy_reward/mean": 0.78125, "rewards/accuracy_reward/std": 0.41420844197273254, "rewards/format_reward/mean": 0.9765625, "rewards/format_reward/std": 0.15158477425575256, "step": 76 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.015625, "completions/max_length": 2048.0, "completions/max_terminated_length": 2046.0, "completions/mean_length": 813.3359375, "completions/mean_terminated_length": 793.7381591796875, "completions/min_length": 223.0, "completions/min_terminated_length": 223.0, "epoch": 0.3286209655908242, "grad_norm": 0.26681177348017476, "learning_rate": 8.574793246612726e-07, "loss": -0.0007, "num_tokens": 16984777.0, "reward": 1.091796875, "reward_std": 0.28809982538223267, "rewards/accuracy_reward/mean": 0.61328125, "rewards/accuracy_reward/std": 0.4879522919654846, "rewards/format_reward/mean": 0.95703125, "rewards/format_reward/std": 0.20318391919136047, "step": 77 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 2048.0, "completions/max_terminated_length": 1877.0, "completions/mean_length": 795.22265625, "completions/mean_terminated_length": 790.3098754882812, "completions/min_length": 197.0, "completions/min_terminated_length": 197.0, "epoch": 0.332888770338757, "grad_norm": 0.320363477006708, "learning_rate": 8.52234924519367e-07, "loss": -0.0152, "num_tokens": 17224858.0, "reward": 1.21484375, "reward_std": 0.29282277822494507, "rewards/accuracy_reward/mean": 0.7265625, "rewards/accuracy_reward/std": 0.446596622467041, "rewards/format_reward/mean": 0.9765625, "rewards/format_reward/std": 0.15158477425575256, "step": 78 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0078125, "completions/max_length": 2048.0, "completions/max_terminated_length": 2020.0, "completions/mean_length": 818.08984375, "completions/mean_terminated_length": 808.405517578125, "completions/min_length": 208.0, "completions/min_terminated_length": 208.0, "epoch": 0.3371565750866898, "grad_norm": 0.25337879357735843, "learning_rate": 8.469124408856383e-07, "loss": -0.0028, "num_tokens": 17489809.0, "reward": 1.142578125, "reward_std": 0.2314775288105011, "rewards/accuracy_reward/mean": 0.65234375, "rewards/accuracy_reward/std": 0.4771590530872345, "rewards/format_reward/mean": 0.98046875, "rewards/format_reward/std": 0.13865381479263306, "step": 79 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0078125, "completions/max_length": 2048.0, "completions/max_terminated_length": 1954.0, "completions/mean_length": 706.01953125, "completions/mean_terminated_length": 695.4527587890625, "completions/min_length": 212.0, "completions/min_terminated_length": 212.0, "epoch": 0.3414243798346226, "grad_norm": 0.21535987693263495, "learning_rate": 8.41513053649071e-07, "loss": 0.0194, "num_tokens": 17722414.0, "reward": 1.2109375, "reward_std": 0.213466078042984, "rewards/accuracy_reward/mean": 0.71875, "rewards/accuracy_reward/std": 0.45048993825912476, "rewards/format_reward/mean": 0.984375, "rewards/format_reward/std": 0.12426253408193588, "step": 80 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0234375, "completions/max_length": 2048.0, "completions/max_terminated_length": 1874.0, "completions/mean_length": 769.6640625, "completions/mean_terminated_length": 738.9840087890625, "completions/min_length": 219.0, "completions/min_terminated_length": 219.0, "epoch": 0.34569218458255535, "grad_norm": 0.1982703781690444, "learning_rate": 8.360379597466518e-07, "loss": 0.0348, "num_tokens": 17962208.0, "reward": 1.224609375, "reward_std": 0.21272222697734833, "rewards/accuracy_reward/mean": 0.73828125, "rewards/accuracy_reward/std": 0.4404313564300537, "rewards/format_reward/mean": 0.97265625, "rewards/format_reward/std": 0.1634024828672409, "step": 81 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.02734375, "completions/max_length": 2048.0, "completions/max_terminated_length": 1749.0, "completions/mean_length": 785.15234375, "completions/mean_terminated_length": 749.6505737304688, "completions/min_length": 165.0, "completions/min_terminated_length": 165.0, "epoch": 0.3499599893304881, "grad_norm": 0.2700320029798219, "learning_rate": 8.304883728980323e-07, "loss": 0.0217, "num_tokens": 18210879.0, "reward": 1.23046875, "reward_std": 0.21052110195159912, "rewards/accuracy_reward/mean": 0.74609375, "rewards/accuracy_reward/std": 0.4360972046852112, "rewards/format_reward/mean": 0.96875, "rewards/format_reward/std": 0.17433346807956696, "step": 82 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.015625, "completions/max_length": 2048.0, "completions/max_terminated_length": 2035.0, "completions/mean_length": 855.36328125, "completions/mean_terminated_length": 836.4326171875, "completions/min_length": 270.0, "completions/min_terminated_length": 270.0, "epoch": 0.3542277940784209, "grad_norm": 0.2259472559883516, "learning_rate": 8.248655233364723e-07, "loss": 0.0316, "num_tokens": 18466476.0, "reward": 1.185546875, "reward_std": 0.2992502450942993, "rewards/accuracy_reward/mean": 0.6953125, "rewards/accuracy_reward/std": 0.4611765742301941, "rewards/format_reward/mean": 0.98046875, "rewards/format_reward/std": 0.13865381479263306, "step": 83 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 2048.0, "completions/max_terminated_length": 2017.0, "completions/mean_length": 743.55859375, "completions/mean_terminated_length": 738.4431762695312, "completions/min_length": 216.0, "completions/min_terminated_length": 216.0, "epoch": 0.3584955988263537, "grad_norm": 0.20179872361001377, "learning_rate": 8.191706575361207e-07, "loss": -0.009, "num_tokens": 18703619.0, "reward": 1.212890625, "reward_std": 0.22027891874313354, "rewards/accuracy_reward/mean": 0.71875, "rewards/accuracy_reward/std": 0.45048993825912476, "rewards/format_reward/mean": 0.98828125, "rewards/format_reward/std": 0.1078278198838234, "step": 84 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 1655.0, "completions/max_terminated_length": 1655.0, "completions/mean_length": 659.94140625, "completions/mean_terminated_length": 659.94140625, "completions/min_length": 251.0, "completions/min_terminated_length": 251.0, "epoch": 0.3627634035742865, "grad_norm": 0.22687581014820055, "learning_rate": 8.134050379356969e-07, "loss": 0.0134, "num_tokens": 18910716.0, "reward": 1.212890625, "reward_std": 0.2215677797794342, "rewards/accuracy_reward/mean": 0.71484375, "rewards/accuracy_reward/std": 0.4523732364177704, "rewards/format_reward/mean": 0.99609375, "rewards/format_reward/std": 0.0625, "step": 85 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01171875, "completions/max_length": 2048.0, "completions/max_terminated_length": 1999.0, "completions/mean_length": 771.36328125, "completions/mean_terminated_length": 756.225341796875, "completions/min_length": 267.0, "completions/min_terminated_length": 267.0, "epoch": 0.36703120832221925, "grad_norm": 0.24227320994201745, "learning_rate": 8.075699426586343e-07, "loss": 0.0024, "num_tokens": 19145401.0, "reward": 1.212890625, "reward_std": 0.23671406507492065, "rewards/accuracy_reward/mean": 0.71875, "rewards/accuracy_reward/std": 0.45048993825912476, "rewards/format_reward/mean": 0.98828125, "rewards/format_reward/std": 0.1078278198838234, "step": 86 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01171875, "completions/max_length": 2048.0, "completions/max_terminated_length": 1977.0, "completions/mean_length": 803.4375, "completions/mean_terminated_length": 788.6798706054688, "completions/min_length": 200.0, "completions/min_terminated_length": 200.0, "epoch": 0.37129901307015206, "grad_norm": 0.20483623411688262, "learning_rate": 8.016666652297441e-07, "loss": 0.0157, "num_tokens": 19398921.0, "reward": 1.2265625, "reward_std": 0.21405605971813202, "rewards/accuracy_reward/mean": 0.734375, "rewards/accuracy_reward/std": 0.4425306022167206, "rewards/format_reward/mean": 0.984375, "rewards/format_reward/std": 0.12426253408193588, "step": 87 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 1937.0, "completions/max_terminated_length": 1937.0, "completions/mean_length": 741.87109375, "completions/mean_terminated_length": 741.87109375, "completions/min_length": 270.0, "completions/min_terminated_length": 270.0, "epoch": 0.3755668178180848, "grad_norm": 0.19112816030034602, "learning_rate": 7.956965142884678e-07, "loss": 0.0039, "num_tokens": 19625720.0, "reward": 1.220703125, "reward_std": 0.20308047533035278, "rewards/accuracy_reward/mean": 0.72265625, "rewards/accuracy_reward/std": 0.4485645890235901, "rewards/format_reward/mean": 0.99609375, "rewards/format_reward/std": 0.0625, "step": 88 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 2048.0, "completions/max_terminated_length": 1953.0, "completions/mean_length": 781.33984375, "completions/mean_terminated_length": 776.3726196289062, "completions/min_length": 255.0, "completions/min_terminated_length": 255.0, "epoch": 0.37983462256601763, "grad_norm": 0.25350243536863626, "learning_rate": 7.896608132987769e-07, "loss": 0.0414, "num_tokens": 19868151.0, "reward": 1.177734375, "reward_std": 0.28659552335739136, "rewards/accuracy_reward/mean": 0.6796875, "rewards/accuracy_reward/std": 0.4675106406211853, "rewards/format_reward/mean": 0.99609375, "rewards/format_reward/std": 0.0625, "step": 89 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0078125, "completions/max_length": 2048.0, "completions/max_terminated_length": 1993.0, "completions/mean_length": 766.66015625, "completions/mean_terminated_length": 756.5708618164062, "completions/min_length": 212.0, "completions/min_terminated_length": 212.0, "epoch": 0.3841024273139504, "grad_norm": 0.22695022996042657, "learning_rate": 7.835609002557882e-07, "loss": 0.0083, "num_tokens": 20119208.0, "reward": 1.22265625, "reward_std": 0.2322777509689331, "rewards/accuracy_reward/mean": 0.7265625, "rewards/accuracy_reward/std": 0.446596622467041, "rewards/format_reward/mean": 0.9921875, "rewards/format_reward/std": 0.08821486681699753, "step": 90 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0078125, "completions/max_length": 2048.0, "completions/max_terminated_length": 1969.0, "completions/mean_length": 861.4453125, "completions/mean_terminated_length": 852.1023559570312, "completions/min_length": 281.0, "completions/min_terminated_length": 281.0, "epoch": 0.38837023206188315, "grad_norm": 0.2316928626966252, "learning_rate": 7.773981273891561e-07, "loss": 0.0146, "num_tokens": 20386306.0, "reward": 1.13671875, "reward_std": 0.31841927766799927, "rewards/accuracy_reward/mean": 0.640625, "rewards/accuracy_reward/std": 0.4807571768760681, "rewards/format_reward/mean": 0.9921875, "rewards/format_reward/std": 0.08821486681699753, "step": 91 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0078125, "completions/max_length": 2048.0, "completions/max_terminated_length": 1847.0, "completions/mean_length": 809.14453125, "completions/mean_terminated_length": 799.3897705078125, "completions/min_length": 184.0, "completions/min_terminated_length": 184.0, "epoch": 0.39263803680981596, "grad_norm": 0.23178482415510882, "learning_rate": 7.711738608633098e-07, "loss": 0.0211, "num_tokens": 20635847.0, "reward": 1.169921875, "reward_std": 0.23685963451862335, "rewards/accuracy_reward/mean": 0.67578125, "rewards/accuracy_reward/std": 0.46899911761283875, "rewards/format_reward/mean": 0.98828125, "rewards/format_reward/std": 0.1078278198838234, "step": 92 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.015625, "completions/max_length": 2048.0, "completions/max_terminated_length": 2034.0, "completions/mean_length": 806.921875, "completions/mean_terminated_length": 787.2222900390625, "completions/min_length": 177.0, "completions/min_terminated_length": 177.0, "epoch": 0.3969058415577487, "grad_norm": 0.18633447879484324, "learning_rate": 7.64889480474603e-07, "loss": 0.0313, "num_tokens": 20888427.0, "reward": 1.205078125, "reward_std": 0.24055463075637817, "rewards/accuracy_reward/mean": 0.7109375, "rewards/accuracy_reward/std": 0.45421501994132996, "rewards/format_reward/mean": 0.98828125, "rewards/format_reward/std": 0.1078278198838234, "step": 93 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 2048.0, "completions/max_terminated_length": 1987.0, "completions/mean_length": 713.9296875, "completions/mean_terminated_length": 708.6980590820312, "completions/min_length": 190.0, "completions/min_terminated_length": 190.0, "epoch": 0.40117364630568153, "grad_norm": 0.1956249704499026, "learning_rate": 7.585463793454392e-07, "loss": 0.0154, "num_tokens": 21105705.0, "reward": 1.255859375, "reward_std": 0.23011668026447296, "rewards/accuracy_reward/mean": 0.76171875, "rewards/accuracy_reward/std": 0.4268665909767151, "rewards/format_reward/mean": 0.98828125, "rewards/format_reward/std": 0.1078278198838234, "step": 94 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01171875, "completions/max_length": 2048.0, "completions/max_terminated_length": 1842.0, "completions/mean_length": 793.56640625, "completions/mean_terminated_length": 778.6917114257812, "completions/min_length": 264.0, "completions/min_terminated_length": 264.0, "epoch": 0.4054414510536143, "grad_norm": 0.2472639941684933, "learning_rate": 7.521459636154447e-07, "loss": 0.0125, "num_tokens": 21353970.0, "reward": 1.125, "reward_std": 0.26645293831825256, "rewards/accuracy_reward/mean": 0.6328125, "rewards/accuracy_reward/std": 0.48298248648643494, "rewards/format_reward/mean": 0.984375, "rewards/format_reward/std": 0.12426253408193588, "step": 95 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.015625, "completions/max_length": 2048.0, "completions/max_terminated_length": 1900.0, "completions/mean_length": 762.27734375, "completions/mean_terminated_length": 741.8690795898438, "completions/min_length": 237.0, "completions/min_terminated_length": 237.0, "epoch": 0.4097092558015471, "grad_norm": 0.22719700972415768, "learning_rate": 7.456896521297553e-07, "loss": 0.0161, "num_tokens": 21604073.0, "reward": 1.0703125, "reward_std": 0.2951740622520447, "rewards/accuracy_reward/mean": 0.59375, "rewards/accuracy_reward/std": 0.49209436774253845, "rewards/format_reward/mean": 0.953125, "rewards/format_reward/std": 0.21178513765335083, "step": 96 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 1830.0, "completions/max_terminated_length": 1830.0, "completions/mean_length": 624.3671875, "completions/mean_terminated_length": 624.3671875, "completions/min_length": 182.0, "completions/min_terminated_length": 182.0, "epoch": 0.41397706054947986, "grad_norm": 0.2616176892409917, "learning_rate": 7.391788761244866e-07, "loss": 0.0264, "num_tokens": 21809239.0, "reward": 1.27734375, "reward_std": 0.2219943106174469, "rewards/accuracy_reward/mean": 0.77734375, "rewards/accuracy_reward/std": 0.41684433817863464, "rewards/format_reward/mean": 1.0, "rewards/format_reward/std": 0.0, "step": 97 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01171875, "completions/max_length": 2048.0, "completions/max_terminated_length": 1893.0, "completions/mean_length": 701.390625, "completions/mean_terminated_length": 685.4229736328125, "completions/min_length": 283.0, "completions/min_terminated_length": 283.0, "epoch": 0.4182448652974126, "grad_norm": 0.23086995406492392, "learning_rate": 7.32615078909457e-07, "loss": 0.0076, "num_tokens": 22052003.0, "reward": 1.15234375, "reward_std": 0.2105971872806549, "rewards/accuracy_reward/mean": 0.66015625, "rewards/accuracy_reward/std": 0.47458380460739136, "rewards/format_reward/mean": 0.984375, "rewards/format_reward/std": 0.12426253408193588, "step": 98 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0078125, "completions/max_length": 2048.0, "completions/max_terminated_length": 1810.0, "completions/mean_length": 812.75, "completions/mean_terminated_length": 803.0236206054688, "completions/min_length": 247.0, "completions/min_terminated_length": 247.0, "epoch": 0.42251267004534543, "grad_norm": 0.21999405421331852, "learning_rate": 7.259997155482348e-07, "loss": 0.0092, "num_tokens": 22303875.0, "reward": 1.130859375, "reward_std": 0.2763032913208008, "rewards/accuracy_reward/mean": 0.6328125, "rewards/accuracy_reward/std": 0.48298248648643494, "rewards/format_reward/mean": 0.99609375, "rewards/format_reward/std": 0.0625, "step": 99 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 2048.0, "completions/max_terminated_length": 1983.0, "completions/mean_length": 714.99609375, "completions/mean_terminated_length": 709.7686767578125, "completions/min_length": 191.0, "completions/min_terminated_length": 191.0, "epoch": 0.4267804747932782, "grad_norm": 0.2606420374536633, "learning_rate": 7.193342525355796e-07, "loss": 0.0123, "num_tokens": 22529954.0, "reward": 1.25, "reward_std": 0.21099039912223816, "rewards/accuracy_reward/mean": 0.7578125, "rewards/accuracy_reward/std": 0.4292463958263397, "rewards/format_reward/mean": 0.984375, "rewards/format_reward/std": 0.12426253408193588, "step": 100 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 1920.0, "completions/max_terminated_length": 1920.0, "completions/mean_length": 679.96484375, "completions/mean_terminated_length": 679.96484375, "completions/min_length": 246.0, "completions/min_terminated_length": 246.0, "epoch": 0.431048279541211, "grad_norm": 0.2241123206565703, "learning_rate": 7.126201674723493e-07, "loss": 0.0073, "num_tokens": 22755121.0, "reward": 1.09765625, "reward_std": 0.20401999354362488, "rewards/accuracy_reward/mean": 0.6015625, "rewards/accuracy_reward/std": 0.4905354380607605, "rewards/format_reward/mean": 0.9921875, "rewards/format_reward/std": 0.08821486681699753, "step": 101 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0078125, "completions/max_length": 2048.0, "completions/max_terminated_length": 1878.0, "completions/mean_length": 767.33984375, "completions/mean_terminated_length": 757.2559204101562, "completions/min_length": 224.0, "completions/min_terminated_length": 224.0, "epoch": 0.43531608428914376, "grad_norm": 0.2948110164125488, "learning_rate": 7.058589487379451e-07, "loss": 0.0145, "num_tokens": 23004744.0, "reward": 1.06640625, "reward_std": 0.32329171895980835, "rewards/accuracy_reward/mean": 0.5703125, "rewards/accuracy_reward/std": 0.4960011839866638, "rewards/format_reward/mean": 0.9921875, "rewards/format_reward/std": 0.08821486681699753, "step": 102 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 2048.0, "completions/max_terminated_length": 1864.0, "completions/mean_length": 697.5546875, "completions/mean_terminated_length": 692.2588500976562, "completions/min_length": 197.0, "completions/min_terminated_length": 197.0, "epoch": 0.43958388903707657, "grad_norm": 0.2056246102808426, "learning_rate": 6.990520951603681e-07, "loss": -0.0033, "num_tokens": 23219126.0, "reward": 1.26171875, "reward_std": 0.21836179494857788, "rewards/accuracy_reward/mean": 0.765625, "rewards/accuracy_reward/std": 0.42443734407424927, "rewards/format_reward/mean": 0.9921875, "rewards/format_reward/std": 0.08821486681699753, "step": 103 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.015625, "completions/max_length": 2048.0, "completions/max_terminated_length": 1992.0, "completions/mean_length": 835.7578125, "completions/mean_terminated_length": 816.5159301757812, "completions/min_length": 199.0, "completions/min_terminated_length": 199.0, "epoch": 0.4438516937850093, "grad_norm": 0.2484672882749487, "learning_rate": 6.922011156839582e-07, "loss": 0.0061, "num_tokens": 23473824.0, "reward": 1.068359375, "reward_std": 0.3270253837108612, "rewards/accuracy_reward/mean": 0.58203125, "rewards/accuracy_reward/std": 0.49419113993644714, "rewards/format_reward/mean": 0.97265625, "rewards/format_reward/std": 0.1634024828672409, "step": 104 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 2001.0, "completions/max_terminated_length": 2001.0, "completions/mean_length": 710.80078125, "completions/mean_terminated_length": 710.80078125, "completions/min_length": 223.0, "completions/min_terminated_length": 223.0, "epoch": 0.44811949853294214, "grad_norm": 0.25105305066117434, "learning_rate": 6.853075290348912e-07, "loss": 0.0161, "num_tokens": 23701237.0, "reward": 1.201171875, "reward_std": 0.24620795249938965, "rewards/accuracy_reward/mean": 0.703125, "rewards/accuracy_reward/std": 0.45777595043182373, "rewards/format_reward/mean": 0.99609375, "rewards/format_reward/std": 0.0625, "step": 105 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01171875, "completions/max_length": 2048.0, "completions/max_terminated_length": 2000.0, "completions/mean_length": 788.74609375, "completions/mean_terminated_length": 773.8142700195312, "completions/min_length": 234.0, "completions/min_terminated_length": 234.0, "epoch": 0.4523873032808749, "grad_norm": 0.22406871720408272, "learning_rate": 6.783728633845075e-07, "loss": 0.0137, "num_tokens": 23961140.0, "reward": 1.09375, "reward_std": 0.2317473292350769, "rewards/accuracy_reward/mean": 0.59765625, "rewards/accuracy_reward/std": 0.4913311004638672, "rewards/format_reward/mean": 0.9921875, "rewards/format_reward/std": 0.08821486681699753, "step": 106 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 1640.0, "completions/max_terminated_length": 1640.0, "completions/mean_length": 604.0703125, "completions/mean_terminated_length": 604.0703125, "completions/min_length": 253.0, "completions/min_terminated_length": 253.0, "epoch": 0.45665510802880765, "grad_norm": 0.18886855604249347, "learning_rate": 6.713986560105469e-07, "loss": 0.0047, "num_tokens": 24149734.0, "reward": 1.30078125, "reward_std": 0.13861849904060364, "rewards/accuracy_reward/mean": 0.80078125, "rewards/accuracy_reward/std": 0.40019527077674866, "rewards/format_reward/mean": 1.0, "rewards/format_reward/std": 0.0, "step": 107 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 1914.0, "completions/max_terminated_length": 1914.0, "completions/mean_length": 727.4453125, "completions/mean_terminated_length": 727.4453125, "completions/min_length": 207.0, "completions/min_terminated_length": 207.0, "epoch": 0.46092291277674047, "grad_norm": 0.23245578072918718, "learning_rate": 6.643864529563643e-07, "loss": 0.0159, "num_tokens": 24404440.0, "reward": 1.115234375, "reward_std": 0.18096782267093658, "rewards/accuracy_reward/mean": 0.6171875, "rewards/accuracy_reward/std": 0.48702529072761536, "rewards/format_reward/mean": 0.99609375, "rewards/format_reward/std": 0.0625, "step": 108 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0078125, "completions/max_length": 2048.0, "completions/max_terminated_length": 2031.0, "completions/mean_length": 722.7890625, "completions/mean_terminated_length": 712.3543090820312, "completions/min_length": 210.0, "completions/min_terminated_length": 210.0, "epoch": 0.4651907175246732, "grad_norm": 0.2627076644105312, "learning_rate": 6.57337808688203e-07, "loss": 0.0089, "num_tokens": 24633570.0, "reward": 1.158203125, "reward_std": 0.21788835525512695, "rewards/accuracy_reward/mean": 0.66796875, "rewards/accuracy_reward/std": 0.4718646705150604, "rewards/format_reward/mean": 0.98046875, "rewards/format_reward/std": 0.13865381479263306, "step": 109 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01171875, "completions/max_length": 2048.0, "completions/max_terminated_length": 1735.0, "completions/mean_length": 699.6796875, "completions/mean_terminated_length": 683.6917114257812, "completions/min_length": 188.0, "completions/min_terminated_length": 188.0, "epoch": 0.46945852227260604, "grad_norm": 0.2639954977102041, "learning_rate": 6.502542857506001e-07, "loss": 0.0212, "num_tokens": 24861544.0, "reward": 1.166015625, "reward_std": 0.25418299436569214, "rewards/accuracy_reward/mean": 0.671875, "rewards/accuracy_reward/std": 0.47045037150382996, "rewards/format_reward/mean": 0.98828125, "rewards/format_reward/std": 0.1078278198838234, "step": 110 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0078125, "completions/max_length": 2048.0, "completions/max_terminated_length": 1894.0, "completions/mean_length": 753.1328125, "completions/mean_terminated_length": 742.93701171875, "completions/min_length": 205.0, "completions/min_terminated_length": 205.0, "epoch": 0.4737263270205388, "grad_norm": 0.24252034558209698, "learning_rate": 6.431374544200012e-07, "loss": 0.0368, "num_tokens": 25097114.0, "reward": 1.171875, "reward_std": 0.2441094070672989, "rewards/accuracy_reward/mean": 0.67578125, "rewards/accuracy_reward/std": 0.46899911761283875, "rewards/format_reward/mean": 0.9921875, "rewards/format_reward/std": 0.08821486681699753, "step": 111 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 1862.0, "completions/max_terminated_length": 1862.0, "completions/mean_length": 679.69140625, "completions/mean_terminated_length": 679.69140625, "completions/min_length": 235.0, "completions/min_terminated_length": 235.0, "epoch": 0.4779941317684716, "grad_norm": 0.20218258381065954, "learning_rate": 6.359888923566619e-07, "loss": 0.0071, "num_tokens": 25303539.0, "reward": 1.234375, "reward_std": 0.21318364143371582, "rewards/accuracy_reward/mean": 0.734375, "rewards/accuracy_reward/std": 0.4425306022167206, "rewards/format_reward/mean": 1.0, "rewards/format_reward/std": 0.0, "step": 112 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 2048.0, "completions/max_terminated_length": 2027.0, "completions/mean_length": 854.05859375, "completions/mean_terminated_length": 849.3765258789062, "completions/min_length": 291.0, "completions/min_terminated_length": 291.0, "epoch": 0.48226193651640437, "grad_norm": 0.2097790119833359, "learning_rate": 6.288101842549116e-07, "loss": 0.0004, "num_tokens": 25577530.0, "reward": 1.107421875, "reward_std": 0.2663267254829407, "rewards/accuracy_reward/mean": 0.609375, "rewards/accuracy_reward/std": 0.48884621262550354, "rewards/format_reward/mean": 0.99609375, "rewards/format_reward/std": 0.0625, "step": 113 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0078125, "completions/max_length": 2048.0, "completions/max_terminated_length": 2035.0, "completions/mean_length": 742.39453125, "completions/mean_terminated_length": 732.1141967773438, "completions/min_length": 173.0, "completions/min_terminated_length": 173.0, "epoch": 0.4865297412643372, "grad_norm": 0.1970783645539932, "learning_rate": 6.216029214918575e-07, "loss": 0.024, "num_tokens": 25800399.0, "reward": 1.23828125, "reward_std": 0.24581098556518555, "rewards/accuracy_reward/mean": 0.7421875, "rewards/accuracy_reward/std": 0.4382871091365814, "rewards/format_reward/mean": 0.9921875, "rewards/format_reward/std": 0.08821486681699753, "step": 114 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.015625, "completions/max_length": 2048.0, "completions/max_terminated_length": 1980.0, "completions/mean_length": 715.43359375, "completions/mean_terminated_length": 694.2817993164062, "completions/min_length": 263.0, "completions/min_terminated_length": 263.0, "epoch": 0.49079754601226994, "grad_norm": 0.24226570112030466, "learning_rate": 6.14368701774609e-07, "loss": -0.001, "num_tokens": 26037006.0, "reward": 1.130859375, "reward_std": 0.2230701446533203, "rewards/accuracy_reward/mean": 0.63671875, "rewards/accuracy_reward/std": 0.48188701272010803, "rewards/format_reward/mean": 0.98828125, "rewards/format_reward/std": 0.1078278198838234, "step": 115 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0078125, "completions/max_length": 2048.0, "completions/max_terminated_length": 1896.0, "completions/mean_length": 646.16796875, "completions/mean_terminated_length": 635.1299438476562, "completions/min_length": 190.0, "completions/min_terminated_length": 190.0, "epoch": 0.4950653507602027, "grad_norm": 0.2454095306081673, "learning_rate": 6.071091287860972e-07, "loss": 0.0196, "num_tokens": 26236641.0, "reward": 1.216796875, "reward_std": 0.21910855174064636, "rewards/accuracy_reward/mean": 0.72265625, "rewards/accuracy_reward/std": 0.4485645890235901, "rewards/format_reward/mean": 0.98828125, "rewards/format_reward/std": 0.1078278198838234, "step": 116 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01953125, "completions/max_length": 2048.0, "completions/max_terminated_length": 2012.0, "completions/mean_length": 798.85546875, "completions/mean_terminated_length": 773.9721069335938, "completions/min_length": 239.0, "completions/min_terminated_length": 239.0, "epoch": 0.4993331555081355, "grad_norm": 0.19024644683224612, "learning_rate": 5.998258118295698e-07, "loss": 0.0298, "num_tokens": 26487340.0, "reward": 1.1875, "reward_std": 0.2350744605064392, "rewards/accuracy_reward/mean": 0.6953125, "rewards/accuracy_reward/std": 0.4611765742301941, "rewards/format_reward/mean": 0.984375, "rewards/format_reward/std": 0.12426253408193588, "step": 117 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 1870.0, "completions/max_terminated_length": 1870.0, "completions/mean_length": 716.54296875, "completions/mean_terminated_length": 716.54296875, "completions/min_length": 226.0, "completions/min_terminated_length": 226.0, "epoch": 0.5036009602560683, "grad_norm": 0.21715577102819492, "learning_rate": 5.925203654718415e-07, "loss": 0.0079, "num_tokens": 26717367.0, "reward": 1.298828125, "reward_std": 0.21700043976306915, "rewards/accuracy_reward/mean": 0.80078125, "rewards/accuracy_reward/std": 0.40019527077674866, "rewards/format_reward/mean": 0.99609375, "rewards/format_reward/std": 0.0625, "step": 118 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 1935.0, "completions/max_terminated_length": 1935.0, "completions/mean_length": 626.43359375, "completions/mean_terminated_length": 626.43359375, "completions/min_length": 168.0, "completions/min_terminated_length": 168.0, "epoch": 0.507868765004001, "grad_norm": 0.19850204104488864, "learning_rate": 5.851944091853756e-07, "loss": 0.0035, "num_tokens": 26916910.0, "reward": 1.28125, "reward_std": 0.1830746978521347, "rewards/accuracy_reward/mean": 0.78125, "rewards/accuracy_reward/std": 0.41420844197273254, "rewards/format_reward/mean": 1.0, "rewards/format_reward/std": 0.0, "step": 119 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01171875, "completions/max_length": 2048.0, "completions/max_terminated_length": 1808.0, "completions/mean_length": 745.625, "completions/mean_terminated_length": 730.1818237304688, "completions/min_length": 218.0, "completions/min_terminated_length": 218.0, "epoch": 0.5121365697519339, "grad_norm": 0.2375090481981112, "learning_rate": 5.778495669892797e-07, "loss": 0.0221, "num_tokens": 27149782.0, "reward": 1.15625, "reward_std": 0.24575507640838623, "rewards/accuracy_reward/mean": 0.6640625, "rewards/accuracy_reward/std": 0.4732423722743988, "rewards/format_reward/mean": 0.984375, "rewards/format_reward/std": 0.12426253408193588, "step": 120 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.015625, "completions/max_length": 2048.0, "completions/max_terminated_length": 1913.0, "completions/mean_length": 802.01171875, "completions/mean_terminated_length": 782.2341918945312, "completions/min_length": 276.0, "completions/min_terminated_length": 276.0, "epoch": 0.5164043744998666, "grad_norm": 0.19689353647026808, "learning_rate": 5.704874670892929e-07, "loss": 0.038, "num_tokens": 27398409.0, "reward": 1.228515625, "reward_std": 0.20076565444469452, "rewards/accuracy_reward/mean": 0.73828125, "rewards/accuracy_reward/std": 0.4404313564300537, "rewards/format_reward/mean": 0.98046875, "rewards/format_reward/std": 0.13865381479263306, "step": 121 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 2048.0, "completions/max_terminated_length": 1955.0, "completions/mean_length": 693.53515625, "completions/mean_terminated_length": 688.2235717773438, "completions/min_length": 201.0, "completions/min_terminated_length": 201.0, "epoch": 0.5206721792477994, "grad_norm": 0.2033008899736732, "learning_rate": 5.631097415168443e-07, "loss": 0.0045, "num_tokens": 27626138.0, "reward": 1.197265625, "reward_std": 0.1862606555223465, "rewards/accuracy_reward/mean": 0.703125, "rewards/accuracy_reward/std": 0.45777595043182373, "rewards/format_reward/mean": 0.98828125, "rewards/format_reward/std": 0.1078278198838234, "step": 122 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.015625, "completions/max_length": 2048.0, "completions/max_terminated_length": 1953.0, "completions/mean_length": 817.59765625, "completions/mean_terminated_length": 798.0675048828125, "completions/min_length": 274.0, "completions/min_terminated_length": 274.0, "epoch": 0.5249399839957322, "grad_norm": 0.20552340304747965, "learning_rate": 5.55718025767265e-07, "loss": -0.0026, "num_tokens": 27878179.0, "reward": 1.197265625, "reward_std": 0.20395947992801666, "rewards/accuracy_reward/mean": 0.703125, "rewards/accuracy_reward/std": 0.45777595043182373, "rewards/format_reward/mean": 0.98828125, "rewards/format_reward/std": 0.1078278198838234, "step": 123 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 2048.0, "completions/max_terminated_length": 1896.0, "completions/mean_length": 701.33203125, "completions/mean_terminated_length": 696.051025390625, "completions/min_length": 272.0, "completions/min_terminated_length": 272.0, "epoch": 0.529207788743665, "grad_norm": 0.159787586419649, "learning_rate": 5.483139584372305e-07, "loss": 0.0029, "num_tokens": 28100536.0, "reward": 1.357421875, "reward_std": 0.12257610261440277, "rewards/accuracy_reward/mean": 0.859375, "rewards/accuracy_reward/std": 0.3483152687549591, "rewards/format_reward/mean": 0.99609375, "rewards/format_reward/std": 0.0625, "step": 124 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.015625, "completions/max_length": 2048.0, "completions/max_terminated_length": 1985.0, "completions/mean_length": 817.38671875, "completions/mean_terminated_length": 797.8532104492188, "completions/min_length": 260.0, "completions/min_terminated_length": 260.0, "epoch": 0.5334755934915978, "grad_norm": 0.23485603603178068, "learning_rate": 5.408991808615162e-07, "loss": 0.0302, "num_tokens": 28350091.0, "reward": 1.162109375, "reward_std": 0.2614896297454834, "rewards/accuracy_reward/mean": 0.67578125, "rewards/accuracy_reward/std": 0.46899911761283875, "rewards/format_reward/mean": 0.97265625, "rewards/format_reward/std": 0.1634024828672409, "step": 125 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.015625, "completions/max_length": 2048.0, "completions/max_terminated_length": 1911.0, "completions/mean_length": 814.80078125, "completions/mean_terminated_length": 795.2262573242188, "completions/min_length": 287.0, "completions/min_terminated_length": 287.0, "epoch": 0.5377433982395305, "grad_norm": 0.18280518625665157, "learning_rate": 5.334753367491469e-07, "loss": 0.0035, "num_tokens": 28604280.0, "reward": 1.20703125, "reward_std": 0.20177264511585236, "rewards/accuracy_reward/mean": 0.7109375, "rewards/accuracy_reward/std": 0.45421501994132996, "rewards/format_reward/mean": 0.9921875, "rewards/format_reward/std": 0.08821486681699753, "step": 126 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.015625, "completions/max_length": 2048.0, "completions/max_terminated_length": 1932.0, "completions/mean_length": 873.109375, "completions/mean_terminated_length": 854.4603881835938, "completions/min_length": 233.0, "completions/min_terminated_length": 233.0, "epoch": 0.5420112029874633, "grad_norm": 0.20876948268936796, "learning_rate": 5.260440718190182e-07, "loss": 0.0193, "num_tokens": 28882892.0, "reward": 1.181640625, "reward_std": 0.20936928689479828, "rewards/accuracy_reward/mean": 0.6875, "rewards/accuracy_reward/std": 0.4644203782081604, "rewards/format_reward/mean": 0.98828125, "rewards/format_reward/std": 0.1078278198838234, "step": 127 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 2048.0, "completions/max_terminated_length": 2015.0, "completions/mean_length": 770.859375, "completions/mean_terminated_length": 765.8510131835938, "completions/min_length": 166.0, "completions/min_terminated_length": 166.0, "epoch": 0.5462790077353961, "grad_norm": 0.2287966990717932, "learning_rate": 5.18607033435074e-07, "loss": 0.0043, "num_tokens": 29129960.0, "reward": 1.177734375, "reward_std": 0.1967882513999939, "rewards/accuracy_reward/mean": 0.6796875, "rewards/accuracy_reward/std": 0.4675106406211853, "rewards/format_reward/mean": 0.99609375, "rewards/format_reward/std": 0.0625, "step": 128 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0078125, "completions/max_length": 2048.0, "completions/max_terminated_length": 2039.0, "completions/mean_length": 777.8046875, "completions/mean_terminated_length": 767.8031616210938, "completions/min_length": 265.0, "completions/min_terminated_length": 265.0, "epoch": 0.5505468124833289, "grad_norm": 0.17468173807926676, "learning_rate": 5.111658702411185e-07, "loss": 0.0242, "num_tokens": 29374182.0, "reward": 1.19921875, "reward_std": 0.15064984560012817, "rewards/accuracy_reward/mean": 0.703125, "rewards/accuracy_reward/std": 0.45777595043182373, "rewards/format_reward/mean": 0.9921875, "rewards/format_reward/std": 0.08821486681699753, "step": 129 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.02734375, "completions/max_length": 2048.0, "completions/max_terminated_length": 2043.0, "completions/mean_length": 858.6015625, "completions/mean_terminated_length": 825.1646118164062, "completions/min_length": 251.0, "completions/min_terminated_length": 251.0, "epoch": 0.5548146172312617, "grad_norm": 0.19183660855342868, "learning_rate": 5.037222317953437e-07, "loss": 0.0309, "num_tokens": 29627600.0, "reward": 1.2421875, "reward_std": 0.21605664491653442, "rewards/accuracy_reward/mean": 0.75, "rewards/accuracy_reward/std": 0.4338609278202057, "rewards/format_reward/mean": 0.984375, "rewards/format_reward/std": 0.12426253408193588, "step": 130 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01953125, "completions/max_length": 2048.0, "completions/max_terminated_length": 1934.0, "completions/mean_length": 839.3359375, "completions/mean_terminated_length": 815.2589721679688, "completions/min_length": 166.0, "completions/min_terminated_length": 166.0, "epoch": 0.5590824219791944, "grad_norm": 0.20880284453431763, "learning_rate": 4.962777682046564e-07, "loss": 0.027, "num_tokens": 29885590.0, "reward": 1.1953125, "reward_std": 0.2067817598581314, "rewards/accuracy_reward/mean": 0.69921875, "rewards/accuracy_reward/std": 0.45949608087539673, "rewards/format_reward/mean": 0.9921875, "rewards/format_reward/std": 0.08821486681699753, "step": 131 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0234375, "completions/max_length": 2048.0, "completions/max_terminated_length": 1895.0, "completions/mean_length": 817.75, "completions/mean_terminated_length": 788.2240600585938, "completions/min_length": 230.0, "completions/min_terminated_length": 230.0, "epoch": 0.5633502267271272, "grad_norm": 0.17992074151340046, "learning_rate": 4.888341297588815e-07, "loss": 0.0173, "num_tokens": 30140878.0, "reward": 1.224609375, "reward_std": 0.15265792608261108, "rewards/accuracy_reward/mean": 0.73046875, "rewards/accuracy_reward/std": 0.44458550214767456, "rewards/format_reward/mean": 0.98828125, "rewards/format_reward/std": 0.1078278198838234, "step": 132 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.03125, "completions/max_length": 2048.0, "completions/max_terminated_length": 2026.0, "completions/mean_length": 940.35546875, "completions/mean_terminated_length": 904.625, "completions/min_length": 266.0, "completions/min_terminated_length": 266.0, "epoch": 0.5676180314750601, "grad_norm": 0.2124255943089338, "learning_rate": 4.81392966564926e-07, "loss": 0.0342, "num_tokens": 30435841.0, "reward": 1.18359375, "reward_std": 0.234188050031662, "rewards/accuracy_reward/mean": 0.69140625, "rewards/accuracy_reward/std": 0.46281787753105164, "rewards/format_reward/mean": 0.984375, "rewards/format_reward/std": 0.12426253408193588, "step": 133 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0234375, "completions/max_length": 2048.0, "completions/max_terminated_length": 1952.0, "completions/mean_length": 832.671875, "completions/mean_terminated_length": 803.5040283203125, "completions/min_length": 233.0, "completions/min_terminated_length": 233.0, "epoch": 0.5718858362229928, "grad_norm": 0.2651489009687611, "learning_rate": 4.739559281809818e-07, "loss": 0.0484, "num_tokens": 30691381.0, "reward": 1.130859375, "reward_std": 0.295681357383728, "rewards/accuracy_reward/mean": 0.63671875, "rewards/accuracy_reward/std": 0.48188701272010803, "rewards/format_reward/mean": 0.98828125, "rewards/format_reward/std": 0.1078278198838234, "step": 134 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01171875, "completions/max_length": 2048.0, "completions/max_terminated_length": 1833.0, "completions/mean_length": 805.25, "completions/mean_terminated_length": 790.5138549804688, "completions/min_length": 244.0, "completions/min_terminated_length": 244.0, "epoch": 0.5761536409709256, "grad_norm": 0.25198708621058297, "learning_rate": 4.6652466325085304e-07, "loss": 0.0256, "num_tokens": 30953917.0, "reward": 1.150390625, "reward_std": 0.24556541442871094, "rewards/accuracy_reward/mean": 0.65625, "rewards/accuracy_reward/std": 0.47588926553726196, "rewards/format_reward/mean": 0.98828125, "rewards/format_reward/std": 0.1078278198838234, "step": 135 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.015625, "completions/max_length": 2048.0, "completions/max_terminated_length": 2033.0, "completions/mean_length": 784.2734375, "completions/mean_terminated_length": 764.21435546875, "completions/min_length": 205.0, "completions/min_terminated_length": 205.0, "epoch": 0.5804214457188583, "grad_norm": 0.1791641896615987, "learning_rate": 4.5910081913848383e-07, "loss": 0.0097, "num_tokens": 31198555.0, "reward": 1.205078125, "reward_std": 0.19860470294952393, "rewards/accuracy_reward/mean": 0.7109375, "rewards/accuracy_reward/std": 0.45421501994132996, "rewards/format_reward/mean": 0.98828125, "rewards/format_reward/std": 0.1078278198838234, "step": 136 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 2048.0, "completions/max_terminated_length": 1978.0, "completions/mean_length": 795.88671875, "completions/mean_terminated_length": 790.9765014648438, "completions/min_length": 191.0, "completions/min_terminated_length": 191.0, "epoch": 0.5846892504667911, "grad_norm": 0.19423899478412457, "learning_rate": 4.5168604156276946e-07, "loss": 0.0125, "num_tokens": 31456294.0, "reward": 1.166015625, "reward_std": 0.18426677584648132, "rewards/accuracy_reward/mean": 0.66796875, "rewards/accuracy_reward/std": 0.4718646705150604, "rewards/format_reward/mean": 0.99609375, "rewards/format_reward/std": 0.0625, "step": 137 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.02734375, "completions/max_length": 2048.0, "completions/max_terminated_length": 1988.0, "completions/mean_length": 870.5703125, "completions/mean_terminated_length": 837.4698486328125, "completions/min_length": 186.0, "completions/min_terminated_length": 186.0, "epoch": 0.588957055214724, "grad_norm": 0.16598601982765251, "learning_rate": 4.4428197423273503e-07, "loss": 0.0053, "num_tokens": 31725112.0, "reward": 1.18359375, "reward_std": 0.20883791148662567, "rewards/accuracy_reward/mean": 0.69140625, "rewards/accuracy_reward/std": 0.46281787753105164, "rewards/format_reward/mean": 0.984375, "rewards/format_reward/std": 0.12426253408193588, "step": 138 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01171875, "completions/max_length": 2048.0, "completions/max_terminated_length": 1956.0, "completions/mean_length": 768.2109375, "completions/mean_terminated_length": 753.0355834960938, "completions/min_length": 308.0, "completions/min_terminated_length": 308.0, "epoch": 0.5932248599626567, "grad_norm": 0.18486919036033073, "learning_rate": 4.368902584831556e-07, "loss": 0.0226, "num_tokens": 31959926.0, "reward": 1.328125, "reward_std": 0.1646866798400879, "rewards/accuracy_reward/mean": 0.83203125, "rewards/accuracy_reward/std": 0.3745708465576172, "rewards/format_reward/mean": 0.9921875, "rewards/format_reward/std": 0.08821486681699753, "step": 139 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 2048.0, "completions/max_terminated_length": 2002.0, "completions/mean_length": 710.671875, "completions/mean_terminated_length": 705.427490234375, "completions/min_length": 284.0, "completions/min_terminated_length": 284.0, "epoch": 0.5974926647105895, "grad_norm": 0.20585348694241182, "learning_rate": 4.2951253291070734e-07, "loss": 0.0202, "num_tokens": 32188058.0, "reward": 1.244140625, "reward_std": 0.17531254887580872, "rewards/accuracy_reward/mean": 0.74609375, "rewards/accuracy_reward/std": 0.4360972046852112, "rewards/format_reward/mean": 0.99609375, "rewards/format_reward/std": 0.0625, "step": 140 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0078125, "completions/max_length": 2048.0, "completions/max_terminated_length": 1880.0, "completions/mean_length": 706.65234375, "completions/mean_terminated_length": 696.090576171875, "completions/min_length": 186.0, "completions/min_terminated_length": 186.0, "epoch": 0.6017604694585222, "grad_norm": 0.21385988435871872, "learning_rate": 4.2215043301072035e-07, "loss": 0.0164, "num_tokens": 32409817.0, "reward": 1.19921875, "reward_std": 0.14311033487319946, "rewards/accuracy_reward/mean": 0.703125, "rewards/accuracy_reward/std": 0.45777595043182373, "rewards/format_reward/mean": 0.9921875, "rewards/format_reward/std": 0.08821486681699753, "step": 141 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 2048.0, "completions/max_terminated_length": 2015.0, "completions/mean_length": 809.47265625, "completions/mean_terminated_length": 804.61572265625, "completions/min_length": 245.0, "completions/min_terminated_length": 245.0, "epoch": 0.6060282742064551, "grad_norm": 0.24365631155359826, "learning_rate": 4.148055908146246e-07, "loss": 0.0007, "num_tokens": 32662114.0, "reward": 1.216796875, "reward_std": 0.2204178422689438, "rewards/accuracy_reward/mean": 0.71875, "rewards/accuracy_reward/std": 0.45048993825912476, "rewards/format_reward/mean": 0.99609375, "rewards/format_reward/std": 0.0625, "step": 142 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0078125, "completions/max_length": 2048.0, "completions/max_terminated_length": 1946.0, "completions/mean_length": 831.41796875, "completions/mean_terminated_length": 821.8385620117188, "completions/min_length": 245.0, "completions/min_terminated_length": 245.0, "epoch": 0.6102960789543879, "grad_norm": 0.19351401084003758, "learning_rate": 4.0747963452815854e-07, "loss": 0.0273, "num_tokens": 32926957.0, "reward": 1.1484375, "reward_std": 0.23818327486515045, "rewards/accuracy_reward/mean": 0.65234375, "rewards/accuracy_reward/std": 0.4771590530872345, "rewards/format_reward/mean": 0.9921875, "rewards/format_reward/std": 0.08821486681699753, "step": 143 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01953125, "completions/max_length": 2048.0, "completions/max_terminated_length": 1951.0, "completions/mean_length": 892.1796875, "completions/mean_terminated_length": 869.1553955078125, "completions/min_length": 250.0, "completions/min_terminated_length": 250.0, "epoch": 0.6145638837023206, "grad_norm": 0.1798525236879384, "learning_rate": 4.0017418817043014e-07, "loss": -0.005, "num_tokens": 33202363.0, "reward": 1.23046875, "reward_std": 0.2581729292869568, "rewards/accuracy_reward/mean": 0.73828125, "rewards/accuracy_reward/std": 0.4404313564300537, "rewards/format_reward/mean": 0.984375, "rewards/format_reward/std": 0.12426253408193588, "step": 144 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.015625, "completions/max_length": 2048.0, "completions/max_terminated_length": 2014.0, "completions/mean_length": 809.87109375, "completions/mean_terminated_length": 790.2183227539062, "completions/min_length": 209.0, "completions/min_terminated_length": 209.0, "epoch": 0.6188316884502534, "grad_norm": 0.24304578874333163, "learning_rate": 3.928908712139027e-07, "loss": 0.0158, "num_tokens": 33449994.0, "reward": 1.134765625, "reward_std": 0.2518559992313385, "rewards/accuracy_reward/mean": 0.63671875, "rewards/accuracy_reward/std": 0.48188701272010803, "rewards/format_reward/mean": 0.99609375, "rewards/format_reward/std": 0.0625, "step": 145 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.015625, "completions/max_length": 2048.0, "completions/max_terminated_length": 1945.0, "completions/mean_length": 805.1015625, "completions/mean_terminated_length": 785.373046875, "completions/min_length": 253.0, "completions/min_terminated_length": 253.0, "epoch": 0.6230994931981861, "grad_norm": 0.20039673660163457, "learning_rate": 3.8563129822539085e-07, "loss": 0.0216, "num_tokens": 33709188.0, "reward": 1.201171875, "reward_std": 0.23587623238563538, "rewards/accuracy_reward/mean": 0.7109375, "rewards/accuracy_reward/std": 0.45421501994132996, "rewards/format_reward/mean": 0.98046875, "rewards/format_reward/std": 0.13865381479263306, "step": 146 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 2048.0, "completions/max_terminated_length": 2003.0, "completions/mean_length": 767.03125, "completions/mean_terminated_length": 762.0078735351562, "completions/min_length": 240.0, "completions/min_terminated_length": 240.0, "epoch": 0.627367297946119, "grad_norm": 0.24327134406193435, "learning_rate": 3.783970785081424e-07, "loss": 0.0237, "num_tokens": 33945492.0, "reward": 1.236328125, "reward_std": 0.2406889945268631, "rewards/accuracy_reward/mean": 0.73828125, "rewards/accuracy_reward/std": 0.4404313564300537, "rewards/format_reward/mean": 0.99609375, "rewards/format_reward/std": 0.0625, "step": 147 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0234375, "completions/max_length": 2048.0, "completions/max_terminated_length": 2024.0, "completions/mean_length": 821.36328125, "completions/mean_terminated_length": 791.9240112304688, "completions/min_length": 274.0, "completions/min_terminated_length": 274.0, "epoch": 0.6316351026940518, "grad_norm": 0.18877147259257004, "learning_rate": 3.711898157450884e-07, "loss": 0.0348, "num_tokens": 34211913.0, "reward": 1.185546875, "reward_std": 0.1964080035686493, "rewards/accuracy_reward/mean": 0.6953125, "rewards/accuracy_reward/std": 0.4611765742301941, "rewards/format_reward/mean": 0.98046875, "rewards/format_reward/std": 0.13865381479263306, "step": 148 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0078125, "completions/max_length": 2048.0, "completions/max_terminated_length": 1991.0, "completions/mean_length": 843.96875, "completions/mean_terminated_length": 834.4881591796875, "completions/min_length": 254.0, "completions/min_terminated_length": 254.0, "epoch": 0.6359029074419845, "grad_norm": 0.21906587909194902, "learning_rate": 3.6401110764333797e-07, "loss": 0.0279, "num_tokens": 34478233.0, "reward": 1.18359375, "reward_std": 0.2350439578294754, "rewards/accuracy_reward/mean": 0.6875, "rewards/accuracy_reward/std": 0.4644203782081604, "rewards/format_reward/mean": 0.9921875, "rewards/format_reward/std": 0.08821486681699753, "step": 149 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0078125, "completions/max_length": 2048.0, "completions/max_terminated_length": 1897.0, "completions/mean_length": 808.73046875, "completions/mean_terminated_length": 798.972412109375, "completions/min_length": 271.0, "completions/min_terminated_length": 271.0, "epoch": 0.6401707121899173, "grad_norm": 0.21316669249549014, "learning_rate": 3.568625455799988e-07, "loss": 0.0234, "num_tokens": 34734652.0, "reward": 1.158203125, "reward_std": 0.24461621046066284, "rewards/accuracy_reward/mean": 0.6640625, "rewards/accuracy_reward/std": 0.4732423722743988, "rewards/format_reward/mean": 0.98828125, "rewards/format_reward/std": 0.1078278198838234, "step": 150 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0234375, "completions/max_length": 2048.0, "completions/max_terminated_length": 1911.0, "completions/mean_length": 812.1640625, "completions/mean_terminated_length": 782.5040283203125, "completions/min_length": 287.0, "completions/min_terminated_length": 287.0, "epoch": 0.6444385169378501, "grad_norm": 0.25333424618788813, "learning_rate": 3.4974571424940005e-07, "loss": 0.0441, "num_tokens": 34978830.0, "reward": 1.1953125, "reward_std": 0.25995934009552, "rewards/accuracy_reward/mean": 0.70703125, "rewards/accuracy_reward/std": 0.45601576566696167, "rewards/format_reward/mean": 0.9765625, "rewards/format_reward/std": 0.15158477425575256, "step": 151 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.03515625, "completions/max_length": 2048.0, "completions/max_terminated_length": 1992.0, "completions/mean_length": 866.4765625, "completions/mean_terminated_length": 823.4251098632812, "completions/min_length": 250.0, "completions/min_terminated_length": 250.0, "epoch": 0.6487063216857829, "grad_norm": 0.23558326481442027, "learning_rate": 3.42662191311797e-07, "loss": 0.0172, "num_tokens": 35243120.0, "reward": 1.1171875, "reward_std": 0.26837483048439026, "rewards/accuracy_reward/mean": 0.6328125, "rewards/accuracy_reward/std": 0.48298248648643494, "rewards/format_reward/mean": 0.96875, "rewards/format_reward/std": 0.17433346807956696, "step": 152 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0234375, "completions/max_length": 2048.0, "completions/max_terminated_length": 1928.0, "completions/mean_length": 760.59765625, "completions/mean_terminated_length": 729.7000122070312, "completions/min_length": 217.0, "completions/min_terminated_length": 217.0, "epoch": 0.6529741264337157, "grad_norm": 0.24179457794505643, "learning_rate": 3.356135470436356e-07, "loss": 0.0015, "num_tokens": 35477777.0, "reward": 1.177734375, "reward_std": 0.23884272575378418, "rewards/accuracy_reward/mean": 0.6796875, "rewards/accuracy_reward/std": 0.4675106406211853, "rewards/format_reward/mean": 0.99609375, "rewards/format_reward/std": 0.0625, "step": 153 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0234375, "completions/max_length": 2048.0, "completions/max_terminated_length": 1873.0, "completions/mean_length": 761.8828125, "completions/mean_terminated_length": 731.0160522460938, "completions/min_length": 211.0, "completions/min_terminated_length": 211.0, "epoch": 0.6572419311816484, "grad_norm": 0.17249965874777415, "learning_rate": 3.2860134398945314e-07, "loss": 0.0256, "num_tokens": 35721483.0, "reward": 1.3359375, "reward_std": 0.14085884392261505, "rewards/accuracy_reward/mean": 0.83984375, "rewards/accuracy_reward/std": 0.36746934056282043, "rewards/format_reward/mean": 0.9921875, "rewards/format_reward/std": 0.08821486681699753, "step": 154 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01171875, "completions/max_length": 2048.0, "completions/max_terminated_length": 1655.0, "completions/mean_length": 804.50390625, "completions/mean_terminated_length": 789.7589111328125, "completions/min_length": 320.0, "completions/min_terminated_length": 320.0, "epoch": 0.6615097359295812, "grad_norm": 0.24718886410542337, "learning_rate": 3.2162713661549246e-07, "loss": 0.0134, "num_tokens": 35980188.0, "reward": 1.11328125, "reward_std": 0.2335888147354126, "rewards/accuracy_reward/mean": 0.6171875, "rewards/accuracy_reward/std": 0.48702529072761536, "rewards/format_reward/mean": 0.9921875, "rewards/format_reward/std": 0.08821486681699753, "step": 155 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0078125, "completions/max_length": 2048.0, "completions/max_terminated_length": 2027.0, "completions/mean_length": 778.87890625, "completions/mean_terminated_length": 768.8858032226562, "completions/min_length": 274.0, "completions/min_terminated_length": 274.0, "epoch": 0.665777540677514, "grad_norm": 0.21849135445763052, "learning_rate": 3.1469247096510884e-07, "loss": 0.0225, "num_tokens": 36222085.0, "reward": 1.2265625, "reward_std": 0.18990948796272278, "rewards/accuracy_reward/mean": 0.7265625, "rewards/accuracy_reward/std": 0.446596622467041, "rewards/format_reward/mean": 1.0, "rewards/format_reward/std": 0.0, "step": 156 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0078125, "completions/max_length": 2048.0, "completions/max_terminated_length": 2039.0, "completions/mean_length": 825.87890625, "completions/mean_terminated_length": 816.2559204101562, "completions/min_length": 220.0, "completions/min_terminated_length": 220.0, "epoch": 0.6700453454254468, "grad_norm": 0.17820499147214844, "learning_rate": 3.0779888431604183e-07, "loss": 0.0015, "num_tokens": 36490046.0, "reward": 1.08203125, "reward_std": 0.17124584317207336, "rewards/accuracy_reward/mean": 0.5859375, "rewards/accuracy_reward/std": 0.4935242533683777, "rewards/format_reward/mean": 0.9921875, "rewards/format_reward/std": 0.08821486681699753, "step": 157 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01171875, "completions/max_length": 2048.0, "completions/max_terminated_length": 2019.0, "completions/mean_length": 782.7734375, "completions/mean_terminated_length": 767.770751953125, "completions/min_length": 309.0, "completions/min_terminated_length": 309.0, "epoch": 0.6743131501733796, "grad_norm": 0.22920030819428183, "learning_rate": 3.009479048396321e-07, "loss": 0.0019, "num_tokens": 36737892.0, "reward": 1.19921875, "reward_std": 0.2472132444381714, "rewards/accuracy_reward/mean": 0.70703125, "rewards/accuracy_reward/std": 0.45601576566696167, "rewards/format_reward/mean": 0.984375, "rewards/format_reward/std": 0.12426253408193588, "step": 158 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0078125, "completions/max_length": 2048.0, "completions/max_terminated_length": 2044.0, "completions/mean_length": 810.66796875, "completions/mean_terminated_length": 800.9251708984375, "completions/min_length": 261.0, "completions/min_terminated_length": 261.0, "epoch": 0.6785809549213123, "grad_norm": 0.17979724625215016, "learning_rate": 2.9414105126205496e-07, "loss": -0.0011, "num_tokens": 37002743.0, "reward": 1.19921875, "reward_std": 0.15735149383544922, "rewards/accuracy_reward/mean": 0.703125, "rewards/accuracy_reward/std": 0.45777595043182373, "rewards/format_reward/mean": 0.9921875, "rewards/format_reward/std": 0.08821486681699753, "step": 159 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01953125, "completions/max_length": 2048.0, "completions/max_terminated_length": 1830.0, "completions/mean_length": 690.765625, "completions/mean_terminated_length": 663.7291259765625, "completions/min_length": 221.0, "completions/min_terminated_length": 221.0, "epoch": 0.6828487596692452, "grad_norm": 0.25451540718263654, "learning_rate": 2.8737983252765096e-07, "loss": 0.0231, "num_tokens": 37211339.0, "reward": 1.3359375, "reward_std": 0.14891915023326874, "rewards/accuracy_reward/mean": 0.84375, "rewards/accuracy_reward/std": 0.3638034462928772, "rewards/format_reward/mean": 0.984375, "rewards/format_reward/std": 0.12426253408193588, "step": 160 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 1903.0, "completions/max_terminated_length": 1903.0, "completions/mean_length": 761.828125, "completions/mean_terminated_length": 761.828125, "completions/min_length": 193.0, "completions/min_terminated_length": 193.0, "epoch": 0.6871165644171779, "grad_norm": 0.25934243345485913, "learning_rate": 2.806657474644204e-07, "loss": 0.021, "num_tokens": 37457007.0, "reward": 1.220703125, "reward_std": 0.20780271291732788, "rewards/accuracy_reward/mean": 0.72265625, "rewards/accuracy_reward/std": 0.4485645890235901, "rewards/format_reward/mean": 0.99609375, "rewards/format_reward/std": 0.0625, "step": 161 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01171875, "completions/max_length": 2048.0, "completions/max_terminated_length": 1908.0, "completions/mean_length": 641.29296875, "completions/mean_terminated_length": 624.6126708984375, "completions/min_length": 227.0, "completions/min_terminated_length": 227.0, "epoch": 0.6913843691651107, "grad_norm": 0.22997977115231086, "learning_rate": 2.740002844517651e-07, "loss": 0.0165, "num_tokens": 37665402.0, "reward": 1.263671875, "reward_std": 0.16853389143943787, "rewards/accuracy_reward/mean": 0.76953125, "rewards/accuracy_reward/std": 0.4219578504562378, "rewards/format_reward/mean": 0.98828125, "rewards/format_reward/std": 0.1078278198838234, "step": 162 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0234375, "completions/max_length": 2048.0, "completions/max_terminated_length": 1874.0, "completions/mean_length": 864.5, "completions/mean_terminated_length": 836.0960693359375, "completions/min_length": 333.0, "completions/min_terminated_length": 333.0, "epoch": 0.6956521739130435, "grad_norm": 0.2742073203394405, "learning_rate": 2.67384921090543e-07, "loss": 0.0147, "num_tokens": 37924946.0, "reward": 1.08984375, "reward_std": 0.2961747944355011, "rewards/accuracy_reward/mean": 0.59765625, "rewards/accuracy_reward/std": 0.4913311004638672, "rewards/format_reward/mean": 0.984375, "rewards/format_reward/std": 0.12426253408193588, "step": 163 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01171875, "completions/max_length": 2048.0, "completions/max_terminated_length": 1851.0, "completions/mean_length": 733.51953125, "completions/mean_terminated_length": 717.932861328125, "completions/min_length": 263.0, "completions/min_terminated_length": 263.0, "epoch": 0.6999199786609762, "grad_norm": 0.2515677683917249, "learning_rate": 2.608211238755133e-07, "loss": 0.0247, "num_tokens": 38157503.0, "reward": 1.162109375, "reward_std": 0.2645115852355957, "rewards/accuracy_reward/mean": 0.671875, "rewards/accuracy_reward/std": 0.47045037150382996, "rewards/format_reward/mean": 0.98046875, "rewards/format_reward/std": 0.13865381479263306, "step": 164 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 2048.0, "completions/max_terminated_length": 1510.0, "completions/mean_length": 689.62109375, "completions/mean_terminated_length": 684.2941284179688, "completions/min_length": 239.0, "completions/min_terminated_length": 239.0, "epoch": 0.7041877834089091, "grad_norm": 0.23855075868187942, "learning_rate": 2.5431034787024477e-07, "loss": 0.0198, "num_tokens": 38386350.0, "reward": 1.212890625, "reward_std": 0.23240876197814941, "rewards/accuracy_reward/mean": 0.71484375, "rewards/accuracy_reward/std": 0.4523732364177704, "rewards/format_reward/mean": 0.99609375, "rewards/format_reward/std": 0.0625, "step": 165 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 2048.0, "completions/max_terminated_length": 1965.0, "completions/mean_length": 710.17578125, "completions/mean_terminated_length": 704.929443359375, "completions/min_length": 233.0, "completions/min_terminated_length": 233.0, "epoch": 0.7084555881568418, "grad_norm": 0.2281278506113162, "learning_rate": 2.478540363845553e-07, "loss": 0.05, "num_tokens": 38612579.0, "reward": 1.119140625, "reward_std": 0.2689380645751953, "rewards/accuracy_reward/mean": 0.62109375, "rewards/accuracy_reward/std": 0.4860650300979614, "rewards/format_reward/mean": 0.99609375, "rewards/format_reward/std": 0.0625, "step": 166 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 2048.0, "completions/max_terminated_length": 1507.0, "completions/mean_length": 585.37109375, "completions/mean_terminated_length": 579.6353149414062, "completions/min_length": 184.0, "completions/min_terminated_length": 184.0, "epoch": 0.7127233929047746, "grad_norm": 0.1861117236343109, "learning_rate": 2.4145362065456095e-07, "loss": 0.0203, "num_tokens": 38796074.0, "reward": 1.330078125, "reward_std": 0.13901790976524353, "rewards/accuracy_reward/mean": 0.83203125, "rewards/accuracy_reward/std": 0.3745708465576172, "rewards/format_reward/mean": 0.99609375, "rewards/format_reward/std": 0.0625, "step": 167 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01171875, "completions/max_length": 2048.0, "completions/max_terminated_length": 1794.0, "completions/mean_length": 660.84765625, "completions/mean_terminated_length": 644.3992309570312, "completions/min_length": 157.0, "completions/min_terminated_length": 157.0, "epoch": 0.7169911976527074, "grad_norm": 0.23510684264419476, "learning_rate": 2.35110519525397e-07, "loss": 0.0144, "num_tokens": 39004963.0, "reward": 1.267578125, "reward_std": 0.18846672773361206, "rewards/accuracy_reward/mean": 0.7734375, "rewards/accuracy_reward/std": 0.41942715644836426, "rewards/format_reward/mean": 0.98828125, "rewards/format_reward/std": 0.1078278198838234, "step": 168 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.015625, "completions/max_length": 2048.0, "completions/max_terminated_length": 1732.0, "completions/mean_length": 673.8828125, "completions/mean_terminated_length": 652.0714721679688, "completions/min_length": 181.0, "completions/min_terminated_length": 181.0, "epoch": 0.7212590024006402, "grad_norm": 0.26341920008046044, "learning_rate": 2.288261391366901e-07, "loss": 0.0221, "num_tokens": 39215957.0, "reward": 1.17578125, "reward_std": 0.24632926285266876, "rewards/accuracy_reward/mean": 0.68359375, "rewards/accuracy_reward/std": 0.4659844934940338, "rewards/format_reward/mean": 0.984375, "rewards/format_reward/std": 0.12426253408193588, "step": 169 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01953125, "completions/max_length": 2048.0, "completions/max_terminated_length": 1826.0, "completions/mean_length": 692.4921875, "completions/mean_terminated_length": 665.4900512695312, "completions/min_length": 245.0, "completions/min_terminated_length": 245.0, "epoch": 0.725526807148573, "grad_norm": 0.25964991834724266, "learning_rate": 2.2260187261084396e-07, "loss": 0.0326, "num_tokens": 39435587.0, "reward": 1.119140625, "reward_std": 0.24559925496578217, "rewards/accuracy_reward/mean": 0.62890625, "rewards/accuracy_reward/std": 0.48404383659362793, "rewards/format_reward/mean": 0.98046875, "rewards/format_reward/std": 0.13865381479263306, "step": 170 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 1971.0, "completions/max_terminated_length": 1971.0, "completions/mean_length": 674.37890625, "completions/mean_terminated_length": 674.37890625, "completions/min_length": 248.0, "completions/min_terminated_length": 248.0, "epoch": 0.7297946118965057, "grad_norm": 0.1967378330355962, "learning_rate": 2.1643909974421166e-07, "loss": 0.0489, "num_tokens": 39639420.0, "reward": 1.29296875, "reward_std": 0.19450394809246063, "rewards/accuracy_reward/mean": 0.79296875, "rewards/accuracy_reward/std": 0.40597182512283325, "rewards/format_reward/mean": 1.0, "rewards/format_reward/std": 0.0, "step": 171 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 2048.0, "completions/max_terminated_length": 1943.0, "completions/mean_length": 720.75, "completions/mean_terminated_length": 715.545166015625, "completions/min_length": 236.0, "completions/min_terminated_length": 236.0, "epoch": 0.7340624166444385, "grad_norm": 0.272350047210853, "learning_rate": 2.1033918670122314e-07, "loss": 0.0254, "num_tokens": 39869844.0, "reward": 1.138671875, "reward_std": 0.2613224983215332, "rewards/accuracy_reward/mean": 0.640625, "rewards/accuracy_reward/std": 0.4807571768760681, "rewards/format_reward/mean": 0.99609375, "rewards/format_reward/std": 0.0625, "step": 172 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 2048.0, "completions/max_terminated_length": 1949.0, "completions/mean_length": 615.6796875, "completions/mean_terminated_length": 610.0628051757812, "completions/min_length": 167.0, "completions/min_terminated_length": 167.0, "epoch": 0.7383302213923713, "grad_norm": 0.14074122823817808, "learning_rate": 2.0430348571153228e-07, "loss": 0.014, "num_tokens": 40070442.0, "reward": 1.244140625, "reward_std": 0.11127522587776184, "rewards/accuracy_reward/mean": 0.74609375, "rewards/accuracy_reward/std": 0.4360972046852112, "rewards/format_reward/mean": 0.99609375, "rewards/format_reward/std": 0.0625, "step": 173 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 1602.0, "completions/max_terminated_length": 1602.0, "completions/mean_length": 701.4921875, "completions/mean_terminated_length": 701.4921875, "completions/min_length": 189.0, "completions/min_terminated_length": 189.0, "epoch": 0.7425980261403041, "grad_norm": 0.23365958383086116, "learning_rate": 1.98333334770256e-07, "loss": -0.0056, "num_tokens": 40290120.0, "reward": 1.19140625, "reward_std": 0.24606087803840637, "rewards/accuracy_reward/mean": 0.69140625, "rewards/accuracy_reward/std": 0.46281787753105164, "rewards/format_reward/mean": 1.0, "rewards/format_reward/std": 0.0, "step": 174 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.015625, "completions/max_length": 2048.0, "completions/max_terminated_length": 1993.0, "completions/mean_length": 739.7109375, "completions/mean_terminated_length": 718.9444580078125, "completions/min_length": 174.0, "completions/min_terminated_length": 174.0, "epoch": 0.7468658308882369, "grad_norm": 0.2730265665931513, "learning_rate": 1.924300573413657e-07, "loss": 0.0139, "num_tokens": 40522926.0, "reward": 1.0859375, "reward_std": 0.345478355884552, "rewards/accuracy_reward/mean": 0.59375, "rewards/accuracy_reward/std": 0.49209436774253845, "rewards/format_reward/mean": 0.984375, "rewards/format_reward/std": 0.12426253408193588, "step": 175 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 2048.0, "completions/max_terminated_length": 1824.0, "completions/mean_length": 628.6484375, "completions/mean_terminated_length": 623.0823974609375, "completions/min_length": 275.0, "completions/min_terminated_length": 275.0, "epoch": 0.7511336356361696, "grad_norm": 0.2458090832723111, "learning_rate": 1.8659496206430304e-07, "loss": 0.0089, "num_tokens": 40717980.0, "reward": 1.2734375, "reward_std": 0.20974822342395782, "rewards/accuracy_reward/mean": 0.77734375, "rewards/accuracy_reward/std": 0.41684433817863464, "rewards/format_reward/mean": 0.9921875, "rewards/format_reward/std": 0.08821486681699753, "step": 176 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 2048.0, "completions/max_terminated_length": 1689.0, "completions/mean_length": 621.12109375, "completions/mean_terminated_length": 615.5255126953125, "completions/min_length": 247.0, "completions/min_terminated_length": 247.0, "epoch": 0.7554014403841024, "grad_norm": 0.16053655630184, "learning_rate": 1.8082934246387932e-07, "loss": 0.0279, "num_tokens": 40910899.0, "reward": 1.298828125, "reward_std": 0.15808796882629395, "rewards/accuracy_reward/mean": 0.80078125, "rewards/accuracy_reward/std": 0.40019527077674866, "rewards/format_reward/mean": 0.99609375, "rewards/format_reward/std": 0.0625, "step": 177 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0078125, "completions/max_length": 2048.0, "completions/max_terminated_length": 1830.0, "completions/mean_length": 646.44921875, "completions/mean_terminated_length": 635.4133911132812, "completions/min_length": 218.0, "completions/min_terminated_length": 218.0, "epoch": 0.7596692451320353, "grad_norm": 0.22473592565946962, "learning_rate": 1.7513447666352749e-07, "loss": 0.006, "num_tokens": 41115382.0, "reward": 1.28125, "reward_std": 0.19608408212661743, "rewards/accuracy_reward/mean": 0.78515625, "rewards/accuracy_reward/std": 0.4115184545516968, "rewards/format_reward/mean": 0.9921875, "rewards/format_reward/std": 0.08821486681699753, "step": 178 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 2048.0, "completions/max_terminated_length": 1983.0, "completions/mean_length": 706.55859375, "completions/mean_terminated_length": 701.298095703125, "completions/min_length": 262.0, "completions/min_terminated_length": 262.0, "epoch": 0.763937049879968, "grad_norm": 0.2805754371057208, "learning_rate": 1.6951162710196759e-07, "loss": 0.0084, "num_tokens": 41340949.0, "reward": 1.111328125, "reward_std": 0.24608224630355835, "rewards/accuracy_reward/mean": 0.61328125, "rewards/accuracy_reward/std": 0.4879522919654846, "rewards/format_reward/mean": 0.99609375, "rewards/format_reward/std": 0.0625, "step": 179 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 1858.0, "completions/max_terminated_length": 1858.0, "completions/mean_length": 622.3125, "completions/mean_terminated_length": 622.3125, "completions/min_length": 215.0, "completions/min_terminated_length": 215.0, "epoch": 0.7682048546279008, "grad_norm": 0.24853618996469473, "learning_rate": 1.6396204025334815e-07, "loss": -0.0125, "num_tokens": 41553749.0, "reward": 1.16796875, "reward_std": 0.211207777261734, "rewards/accuracy_reward/mean": 0.66796875, "rewards/accuracy_reward/std": 0.4718646705150604, "rewards/format_reward/mean": 1.0, "rewards/format_reward/std": 0.0, "step": 180 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01953125, "completions/max_length": 2048.0, "completions/max_terminated_length": 1933.0, "completions/mean_length": 735.20703125, "completions/mean_terminated_length": 709.0557861328125, "completions/min_length": 209.0, "completions/min_terminated_length": 209.0, "epoch": 0.7724726593758335, "grad_norm": 0.27283404095282965, "learning_rate": 1.5848694635092895e-07, "loss": 0.0196, "num_tokens": 41793130.0, "reward": 1.056640625, "reward_std": 0.2488909661769867, "rewards/accuracy_reward/mean": 0.56640625, "rewards/accuracy_reward/std": 0.4965413510799408, "rewards/format_reward/mean": 0.98046875, "rewards/format_reward/std": 0.13865381479263306, "step": 181 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.015625, "completions/max_length": 2048.0, "completions/max_terminated_length": 1564.0, "completions/mean_length": 639.625, "completions/mean_terminated_length": 617.2698974609375, "completions/min_length": 230.0, "completions/min_terminated_length": 230.0, "epoch": 0.7767404641237663, "grad_norm": 0.23464273569735436, "learning_rate": 1.5308755911436167e-07, "loss": 0.0275, "num_tokens": 42000770.0, "reward": 1.2109375, "reward_std": 0.23508310317993164, "rewards/accuracy_reward/mean": 0.71875, "rewards/accuracy_reward/std": 0.45048993825912476, "rewards/format_reward/mean": 0.984375, "rewards/format_reward/std": 0.12426253408193588, "step": 182 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0078125, "completions/max_length": 2048.0, "completions/max_terminated_length": 1848.0, "completions/mean_length": 703.01171875, "completions/mean_terminated_length": 692.4212646484375, "completions/min_length": 290.0, "completions/min_terminated_length": 290.0, "epoch": 0.7810082688716992, "grad_norm": 0.2041185919449283, "learning_rate": 1.4776507548063316e-07, "loss": 0.0161, "num_tokens": 42228821.0, "reward": 1.23046875, "reward_std": 0.2236538529396057, "rewards/accuracy_reward/mean": 0.734375, "rewards/accuracy_reward/std": 0.4425306022167206, "rewards/format_reward/mean": 0.9921875, "rewards/format_reward/std": 0.08821486681699753, "step": 183 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0078125, "completions/max_length": 2048.0, "completions/max_terminated_length": 1660.0, "completions/mean_length": 606.125, "completions/mean_terminated_length": 594.7716674804688, "completions/min_length": 196.0, "completions/min_terminated_length": 196.0, "epoch": 0.7852760736196319, "grad_norm": 0.2367142527446861, "learning_rate": 1.425206753387273e-07, "loss": 0.0076, "num_tokens": 42418005.0, "reward": 1.318359375, "reward_std": 0.19608040153980255, "rewards/accuracy_reward/mean": 0.8203125, "rewards/accuracy_reward/std": 0.38467901945114136, "rewards/format_reward/mean": 0.99609375, "rewards/format_reward/std": 0.0625, "step": 184 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 1590.0, "completions/max_terminated_length": 1590.0, "completions/mean_length": 754.609375, "completions/mean_terminated_length": 754.609375, "completions/min_length": 226.0, "completions/min_terminated_length": 226.0, "epoch": 0.7895438783675647, "grad_norm": 0.24647201095880691, "learning_rate": 1.373555212680682e-07, "loss": 0.0138, "num_tokens": 42655745.0, "reward": 1.087890625, "reward_std": 0.27658724784851074, "rewards/accuracy_reward/mean": 0.58984375, "rewards/accuracy_reward/std": 0.49282538890838623, "rewards/format_reward/mean": 0.99609375, "rewards/format_reward/std": 0.0625, "step": 185 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 2048.0, "completions/max_terminated_length": 1822.0, "completions/mean_length": 675.3359375, "completions/mean_terminated_length": 669.9530029296875, "completions/min_length": 252.0, "completions/min_terminated_length": 252.0, "epoch": 0.7938116831154974, "grad_norm": 0.2878456538615157, "learning_rate": 1.322707582807983e-07, "loss": 0.0142, "num_tokens": 42871183.0, "reward": 1.13671875, "reward_std": 0.2777612805366516, "rewards/accuracy_reward/mean": 0.640625, "rewards/accuracy_reward/std": 0.4807571768760681, "rewards/format_reward/mean": 0.9921875, "rewards/format_reward/std": 0.08821486681699753, "step": 186 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 1666.0, "completions/max_terminated_length": 1666.0, "completions/mean_length": 702.12109375, "completions/mean_terminated_length": 702.12109375, "completions/min_length": 246.0, "completions/min_terminated_length": 246.0, "epoch": 0.7980794878634303, "grad_norm": 0.3142792999763781, "learning_rate": 1.2726751356795272e-07, "loss": -0.0068, "num_tokens": 43094206.0, "reward": 1.130859375, "reward_std": 0.25356346368789673, "rewards/accuracy_reward/mean": 0.6328125, "rewards/accuracy_reward/std": 0.48298248648643494, "rewards/format_reward/mean": 0.99609375, "rewards/format_reward/std": 0.0625, "step": 187 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 2048.0, "completions/max_terminated_length": 1752.0, "completions/mean_length": 722.0390625, "completions/mean_terminated_length": 716.8392333984375, "completions/min_length": 230.0, "completions/min_terminated_length": 230.0, "epoch": 0.8023472926113631, "grad_norm": 0.24325103754397956, "learning_rate": 1.2234689624958305e-07, "loss": 0.0094, "num_tokens": 43325744.0, "reward": 1.201171875, "reward_std": 0.2448870688676834, "rewards/accuracy_reward/mean": 0.703125, "rewards/accuracy_reward/std": 0.45777595043182373, "rewards/format_reward/mean": 0.99609375, "rewards/format_reward/std": 0.0625, "step": 188 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 2029.0, "completions/max_terminated_length": 2029.0, "completions/mean_length": 647.21875, "completions/mean_terminated_length": 647.21875, "completions/min_length": 210.0, "completions/min_terminated_length": 210.0, "epoch": 0.8066150973592958, "grad_norm": 0.2552808763290216, "learning_rate": 1.1750999712888715e-07, "loss": 0.0174, "num_tokens": 43534368.0, "reward": 1.1875, "reward_std": 0.22160722315311432, "rewards/accuracy_reward/mean": 0.6875, "rewards/accuracy_reward/std": 0.4644203782081604, "rewards/format_reward/mean": 1.0, "rewards/format_reward/std": 0.0, "step": 189 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0078125, "completions/max_length": 2048.0, "completions/max_terminated_length": 1947.0, "completions/mean_length": 715.77734375, "completions/mean_terminated_length": 705.2874145507812, "completions/min_length": 246.0, "completions/min_terminated_length": 246.0, "epoch": 0.8108829021072286, "grad_norm": 0.2705325300275321, "learning_rate": 1.1275788845040052e-07, "loss": 0.0098, "num_tokens": 43767823.0, "reward": 1.12109375, "reward_std": 0.2508101761341095, "rewards/accuracy_reward/mean": 0.625, "rewards/accuracy_reward/std": 0.4850712716579437, "rewards/format_reward/mean": 0.9921875, "rewards/format_reward/std": 0.08821486681699753, "step": 190 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01171875, "completions/max_length": 2048.0, "completions/max_terminated_length": 1982.0, "completions/mean_length": 777.20703125, "completions/mean_terminated_length": 762.1383666992188, "completions/min_length": 245.0, "completions/min_terminated_length": 245.0, "epoch": 0.8151507068551613, "grad_norm": 0.23869227957510453, "learning_rate": 1.0809162366229995e-07, "loss": 0.0046, "num_tokens": 44007172.0, "reward": 1.177734375, "reward_std": 0.2786230444908142, "rewards/accuracy_reward/mean": 0.68359375, "rewards/accuracy_reward/std": 0.4659844934940338, "rewards/format_reward/mean": 0.98828125, "rewards/format_reward/std": 0.1078278198838234, "step": 191 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 2048.0, "completions/max_terminated_length": 1935.0, "completions/mean_length": 703.2265625, "completions/mean_terminated_length": 697.9530029296875, "completions/min_length": 235.0, "completions/min_terminated_length": 235.0, "epoch": 0.8194185116030942, "grad_norm": 0.24454625111448922, "learning_rate": 1.035122371828761e-07, "loss": 0.0293, "num_tokens": 44231798.0, "reward": 1.18359375, "reward_std": 0.23304039239883423, "rewards/accuracy_reward/mean": 0.6875, "rewards/accuracy_reward/std": 0.4644203782081604, "rewards/format_reward/mean": 0.9921875, "rewards/format_reward/std": 0.08821486681699753, "step": 192 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0078125, "completions/max_length": 2048.0, "completions/max_terminated_length": 1547.0, "completions/mean_length": 707.6796875, "completions/mean_terminated_length": 697.1259765625, "completions/min_length": 198.0, "completions/min_terminated_length": 198.0, "epoch": 0.823686316351027, "grad_norm": 0.2315774767151496, "learning_rate": 9.90207441712223e-08, "loss": 0.007, "num_tokens": 44454276.0, "reward": 1.19921875, "reward_std": 0.22252225875854492, "rewards/accuracy_reward/mean": 0.703125, "rewards/accuracy_reward/std": 0.45777595043182373, "rewards/format_reward/mean": 0.9921875, "rewards/format_reward/std": 0.08821486681699753, "step": 193 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 2048.0, "completions/max_terminated_length": 1918.0, "completions/mean_length": 679.92578125, "completions/mean_terminated_length": 674.5608520507812, "completions/min_length": 219.0, "completions/min_terminated_length": 219.0, "epoch": 0.8279541210989597, "grad_norm": 0.23688003693135284, "learning_rate": 9.461814030219518e-08, "loss": 0.0172, "num_tokens": 44667385.0, "reward": 1.15234375, "reward_std": 0.24171680212020874, "rewards/accuracy_reward/mean": 0.65625, "rewards/accuracy_reward/std": 0.47588926553726196, "rewards/format_reward/mean": 0.9921875, "rewards/format_reward/std": 0.08821486681699753, "step": 194 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 1926.0, "completions/max_terminated_length": 1926.0, "completions/mean_length": 771.4375, "completions/mean_terminated_length": 771.4375, "completions/min_length": 242.0, "completions/min_terminated_length": 242.0, "epoch": 0.8322219258468925, "grad_norm": 0.3010266544431418, "learning_rate": 9.030540154569188e-08, "loss": 0.0219, "num_tokens": 44921481.0, "reward": 1.013671875, "reward_std": 0.31984591484069824, "rewards/accuracy_reward/mean": 0.515625, "rewards/accuracy_reward/std": 0.5007347464561462, "rewards/format_reward/mean": 0.99609375, "rewards/format_reward/std": 0.0625, "step": 195 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.02734375, "completions/max_length": 2048.0, "completions/max_terminated_length": 1855.0, "completions/mean_length": 665.66015625, "completions/mean_terminated_length": 626.7991943359375, "completions/min_length": 221.0, "completions/min_terminated_length": 221.0, "epoch": 0.8364897305948252, "grad_norm": 0.21211516268188596, "learning_rate": 8.608348395029857e-08, "loss": 0.0269, "num_tokens": 45133986.0, "reward": 1.23828125, "reward_std": 0.16909292340278625, "rewards/accuracy_reward/mean": 0.75390625, "rewards/accuracy_reward/std": 0.43157756328582764, "rewards/format_reward/mean": 0.96875, "rewards/format_reward/std": 0.17433346807956696, "step": 196 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 2048.0, "completions/max_terminated_length": 1771.0, "completions/mean_length": 734.71484375, "completions/mean_terminated_length": 729.5647583007812, "completions/min_length": 233.0, "completions/min_terminated_length": 233.0, "epoch": 0.8407575353427581, "grad_norm": 0.23169910087976608, "learning_rate": 8.19533234313517e-08, "loss": 0.0228, "num_tokens": 45388521.0, "reward": 1.033203125, "reward_std": 0.2498776912689209, "rewards/accuracy_reward/mean": 0.53515625, "rewards/accuracy_reward/std": 0.49973952770233154, "rewards/format_reward/mean": 0.99609375, "rewards/format_reward/std": 0.0625, "step": 197 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 2048.0, "completions/max_terminated_length": 2043.0, "completions/mean_length": 689.30859375, "completions/mean_terminated_length": 683.9804077148438, "completions/min_length": 194.0, "completions/min_terminated_length": 194.0, "epoch": 0.8450253400906909, "grad_norm": 0.20332752603627063, "learning_rate": 7.791583556346576e-08, "loss": 0.0095, "num_tokens": 45603184.0, "reward": 1.244140625, "reward_std": 0.18624509871006012, "rewards/accuracy_reward/mean": 0.74609375, "rewards/accuracy_reward/std": 0.4360972046852112, "rewards/format_reward/mean": 0.99609375, "rewards/format_reward/std": 0.0625, "step": 198 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0078125, "completions/max_length": 2048.0, "completions/max_terminated_length": 1829.0, "completions/mean_length": 683.8671875, "completions/mean_terminated_length": 673.1259765625, "completions/min_length": 183.0, "completions/min_terminated_length": 183.0, "epoch": 0.8492931448386236, "grad_norm": 0.18282763433189994, "learning_rate": 7.397191537756726e-08, "loss": 0.0214, "num_tokens": 45819222.0, "reward": 1.2421875, "reward_std": 0.18612128496170044, "rewards/accuracy_reward/mean": 0.74609375, "rewards/accuracy_reward/std": 0.4360972046852112, "rewards/format_reward/mean": 0.9921875, "rewards/format_reward/std": 0.08821486681699753, "step": 199 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 2048.0, "completions/max_terminated_length": 1906.0, "completions/mean_length": 716.453125, "completions/mean_terminated_length": 711.2313842773438, "completions/min_length": 218.0, "completions/min_terminated_length": 218.0, "epoch": 0.8535609495865564, "grad_norm": 0.2287235759390508, "learning_rate": 7.012243716248505e-08, "loss": 0.0194, "num_tokens": 46043546.0, "reward": 1.212890625, "reward_std": 0.26291176676750183, "rewards/accuracy_reward/mean": 0.71484375, "rewards/accuracy_reward/std": 0.4523732364177704, "rewards/format_reward/mean": 0.99609375, "rewards/format_reward/std": 0.0625, "step": 200 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 2048.0, "completions/max_terminated_length": 1944.0, "completions/mean_length": 668.796875, "completions/mean_terminated_length": 663.3882446289062, "completions/min_length": 245.0, "completions/min_terminated_length": 245.0, "epoch": 0.8578287543344892, "grad_norm": 0.28136414759791406, "learning_rate": 6.636825427113718e-08, "loss": 0.0213, "num_tokens": 46263078.0, "reward": 1.12890625, "reward_std": 0.22791796922683716, "rewards/accuracy_reward/mean": 0.6328125, "rewards/accuracy_reward/std": 0.48298248648643494, "rewards/format_reward/mean": 0.9921875, "rewards/format_reward/std": 0.08821486681699753, "step": 201 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0078125, "completions/max_length": 2048.0, "completions/max_terminated_length": 2032.0, "completions/mean_length": 775.09765625, "completions/mean_terminated_length": 765.0748291015625, "completions/min_length": 213.0, "completions/min_terminated_length": 213.0, "epoch": 0.862096559082422, "grad_norm": 0.2614766475394663, "learning_rate": 6.271019893136004e-08, "loss": 0.0138, "num_tokens": 46513359.0, "reward": 1.119140625, "reward_std": 0.2732589542865753, "rewards/accuracy_reward/mean": 0.625, "rewards/accuracy_reward/std": 0.4850712716579437, "rewards/format_reward/mean": 0.98828125, "rewards/format_reward/std": 0.1078278198838234, "step": 202 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 1656.0, "completions/max_terminated_length": 1656.0, "completions/mean_length": 655.359375, "completions/mean_terminated_length": 655.359375, "completions/min_length": 277.0, "completions/min_terminated_length": 277.0, "epoch": 0.8663643638303548, "grad_norm": 0.22048232818659222, "learning_rate": 5.914908206141955e-08, "loss": 0.0188, "num_tokens": 46716907.0, "reward": 1.2265625, "reward_std": 0.21489354968070984, "rewards/accuracy_reward/mean": 0.7265625, "rewards/accuracy_reward/std": 0.446596622467041, "rewards/format_reward/mean": 1.0, "rewards/format_reward/std": 0.0, "step": 203 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01171875, "completions/max_length": 2048.0, "completions/max_terminated_length": 1983.0, "completions/mean_length": 694.74609375, "completions/mean_terminated_length": 678.6996459960938, "completions/min_length": 211.0, "completions/min_terminated_length": 211.0, "epoch": 0.8706321685782875, "grad_norm": 0.23641341776500133, "learning_rate": 5.568569309024701e-08, "loss": 0.0352, "num_tokens": 46927186.0, "reward": 1.17578125, "reward_std": 0.2842491865158081, "rewards/accuracy_reward/mean": 0.68359375, "rewards/accuracy_reward/std": 0.4659844934940338, "rewards/format_reward/mean": 0.984375, "rewards/format_reward/std": 0.12426253408193588, "step": 204 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 1738.0, "completions/max_terminated_length": 1738.0, "completions/mean_length": 662.88671875, "completions/mean_terminated_length": 662.88671875, "completions/min_length": 222.0, "completions/min_terminated_length": 222.0, "epoch": 0.8748999733262203, "grad_norm": 0.20672110512380382, "learning_rate": 5.232079978243797e-08, "loss": 0.0094, "num_tokens": 47140685.0, "reward": 1.24609375, "reward_std": 0.15873727202415466, "rewards/accuracy_reward/mean": 0.74609375, "rewards/accuracy_reward/std": 0.4360972046852112, "rewards/format_reward/mean": 1.0, "rewards/format_reward/std": 0.0, "step": 205 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.015625, "completions/max_length": 2048.0, "completions/max_terminated_length": 1654.0, "completions/mean_length": 660.390625, "completions/mean_terminated_length": 638.3651123046875, "completions/min_length": 228.0, "completions/min_terminated_length": 228.0, "epoch": 0.8791677780741531, "grad_norm": 0.22184411809292953, "learning_rate": 4.905514806805455e-08, "loss": 0.0283, "num_tokens": 47348249.0, "reward": 1.26953125, "reward_std": 0.18794672191143036, "rewards/accuracy_reward/mean": 0.77734375, "rewards/accuracy_reward/std": 0.41684433817863464, "rewards/format_reward/mean": 0.984375, "rewards/format_reward/std": 0.12426253408193588, "step": 206 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 2048.0, "completions/max_terminated_length": 2041.0, "completions/mean_length": 641.34375, "completions/mean_terminated_length": 635.8275146484375, "completions/min_length": 180.0, "completions/min_terminated_length": 180.0, "epoch": 0.8834355828220859, "grad_norm": 0.2927027602654784, "learning_rate": 4.5889461877267053e-08, "loss": 0.0141, "num_tokens": 47556417.0, "reward": 1.203125, "reward_std": 0.28396546840667725, "rewards/accuracy_reward/mean": 0.70703125, "rewards/accuracy_reward/std": 0.45601576566696167, "rewards/format_reward/mean": 0.9921875, "rewards/format_reward/std": 0.08821486681699753, "step": 207 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 2048.0, "completions/max_terminated_length": 1699.0, "completions/mean_length": 729.8671875, "completions/mean_terminated_length": 724.6980590820312, "completions/min_length": 241.0, "completions/min_terminated_length": 241.0, "epoch": 0.8877033875700187, "grad_norm": 0.2461243992470562, "learning_rate": 4.282444297987359e-08, "loss": 0.0055, "num_tokens": 47788295.0, "reward": 1.138671875, "reward_std": 0.24752356112003326, "rewards/accuracy_reward/mean": 0.640625, "rewards/accuracy_reward/std": 0.4807571768760681, "rewards/format_reward/mean": 0.99609375, "rewards/format_reward/std": 0.0625, "step": 208 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01171875, "completions/max_length": 2048.0, "completions/max_terminated_length": 1672.0, "completions/mean_length": 744.02734375, "completions/mean_terminated_length": 728.5652465820312, "completions/min_length": 292.0, "completions/min_terminated_length": 292.0, "epoch": 0.8919711923179514, "grad_norm": 0.26361481821432853, "learning_rate": 3.986077082973077e-08, "loss": 0.0257, "num_tokens": 48024238.0, "reward": 1.115234375, "reward_std": 0.2896057367324829, "rewards/accuracy_reward/mean": 0.62109375, "rewards/accuracy_reward/std": 0.4860650300979614, "rewards/format_reward/mean": 0.98828125, "rewards/format_reward/std": 0.1078278198838234, "step": 209 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0078125, "completions/max_length": 2048.0, "completions/max_terminated_length": 1740.0, "completions/mean_length": 750.125, "completions/mean_terminated_length": 739.905517578125, "completions/min_length": 268.0, "completions/min_terminated_length": 268.0, "epoch": 0.8962389970658843, "grad_norm": 0.20759266108832738, "learning_rate": 3.699910241413345e-08, "loss": 0.0204, "num_tokens": 48251030.0, "reward": 1.2890625, "reward_std": 0.23673829436302185, "rewards/accuracy_reward/mean": 0.79296875, "rewards/accuracy_reward/std": 0.40597182512283325, "rewards/format_reward/mean": 0.9921875, "rewards/format_reward/std": 0.08821486681699753, "step": 210 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 2048.0, "completions/max_terminated_length": 1839.0, "completions/mean_length": 803.78515625, "completions/mean_terminated_length": 798.9059448242188, "completions/min_length": 315.0, "completions/min_terminated_length": 315.0, "epoch": 0.900506801813817, "grad_norm": 0.22768602565232743, "learning_rate": 3.424007210817248e-08, "loss": 0.0344, "num_tokens": 48502023.0, "reward": 1.142578125, "reward_std": 0.2660510838031769, "rewards/accuracy_reward/mean": 0.64453125, "rewards/accuracy_reward/std": 0.4795927405357361, "rewards/format_reward/mean": 0.99609375, "rewards/format_reward/std": 0.0625, "step": 211 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 2048.0, "completions/max_terminated_length": 1957.0, "completions/mean_length": 676.2734375, "completions/mean_terminated_length": 670.8941650390625, "completions/min_length": 293.0, "completions/min_terminated_length": 293.0, "epoch": 0.9047746065617498, "grad_norm": 0.2470482043698145, "learning_rate": 3.158429153410724e-08, "loss": 0.0141, "num_tokens": 48722021.0, "reward": 1.154296875, "reward_std": 0.21529296040534973, "rewards/accuracy_reward/mean": 0.65625, "rewards/accuracy_reward/std": 0.47588926553726196, "rewards/format_reward/mean": 0.99609375, "rewards/format_reward/std": 0.0625, "step": 212 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 2048.0, "completions/max_terminated_length": 1621.0, "completions/mean_length": 649.66796875, "completions/mean_terminated_length": 644.184326171875, "completions/min_length": 187.0, "completions/min_terminated_length": 187.0, "epoch": 0.9090424113096826, "grad_norm": 0.23578300688769538, "learning_rate": 2.903234942578081e-08, "loss": 0.0184, "num_tokens": 48932016.0, "reward": 1.259765625, "reward_std": 0.22608917951583862, "rewards/accuracy_reward/mean": 0.76171875, "rewards/accuracy_reward/std": 0.4268665909767151, "rewards/format_reward/mean": 0.99609375, "rewards/format_reward/std": 0.0625, "step": 213 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 2048.0, "completions/max_terminated_length": 1825.0, "completions/mean_length": 700.1875, "completions/mean_terminated_length": 694.9019775390625, "completions/min_length": 270.0, "completions/min_terminated_length": 270.0, "epoch": 0.9133102160576153, "grad_norm": 0.22219455215166378, "learning_rate": 2.658481149810904e-08, "loss": 0.0122, "num_tokens": 49164808.0, "reward": 1.1875, "reward_std": 0.24884523451328278, "rewards/accuracy_reward/mean": 0.69140625, "rewards/accuracy_reward/std": 0.46281787753105164, "rewards/format_reward/mean": 0.9921875, "rewards/format_reward/std": 0.08821486681699753, "step": 214 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 2048.0, "completions/max_terminated_length": 1619.0, "completions/mean_length": 597.33984375, "completions/mean_terminated_length": 591.6510009765625, "completions/min_length": 200.0, "completions/min_terminated_length": 200.0, "epoch": 0.9175780208055482, "grad_norm": 0.21753622718375415, "learning_rate": 2.424222032167339e-08, "loss": 0.0094, "num_tokens": 49359399.0, "reward": 1.302734375, "reward_std": 0.1821448802947998, "rewards/accuracy_reward/mean": 0.8046875, "rewards/accuracy_reward/std": 0.39721766114234924, "rewards/format_reward/mean": 0.99609375, "rewards/format_reward/std": 0.0625, "step": 215 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01953125, "completions/max_length": 2048.0, "completions/max_terminated_length": 2046.0, "completions/mean_length": 726.96484375, "completions/mean_terminated_length": 700.6494140625, "completions/min_length": 210.0, "completions/min_terminated_length": 210.0, "epoch": 0.9218458255534809, "grad_norm": 0.23224872325943707, "learning_rate": 2.2005095202443258e-08, "loss": 0.0031, "num_tokens": 49586014.0, "reward": 1.162109375, "reward_std": 0.22143831849098206, "rewards/accuracy_reward/mean": 0.671875, "rewards/accuracy_reward/std": 0.47045037150382996, "rewards/format_reward/mean": 0.98046875, "rewards/format_reward/std": 0.13865381479263306, "step": 216 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 1740.0, "completions/max_terminated_length": 1740.0, "completions/mean_length": 645.16015625, "completions/mean_terminated_length": 645.16015625, "completions/min_length": 242.0, "completions/min_terminated_length": 242.0, "epoch": 0.9261136303014137, "grad_norm": 0.23652223616186321, "learning_rate": 1.987393206665655e-08, "loss": 0.0121, "num_tokens": 49810207.0, "reward": 1.1875, "reward_std": 0.21462517976760864, "rewards/accuracy_reward/mean": 0.6875, "rewards/accuracy_reward/std": 0.4644203782081604, "rewards/format_reward/mean": 1.0, "rewards/format_reward/std": 0.0, "step": 217 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 2048.0, "completions/max_terminated_length": 1661.0, "completions/mean_length": 700.3203125, "completions/mean_terminated_length": 695.0353393554688, "completions/min_length": 182.0, "completions/min_terminated_length": 182.0, "epoch": 0.9303814350493465, "grad_norm": 0.1814779175974177, "learning_rate": 1.7849203350882414e-08, "loss": 0.0093, "num_tokens": 50039041.0, "reward": 1.203125, "reward_std": 0.19989967346191406, "rewards/accuracy_reward/mean": 0.703125, "rewards/accuracy_reward/std": 0.45777595043182373, "rewards/format_reward/mean": 1.0, "rewards/format_reward/std": 0.0, "step": 218 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.015625, "completions/max_length": 2048.0, "completions/max_terminated_length": 1913.0, "completions/mean_length": 767.1171875, "completions/mean_terminated_length": 746.7857666015625, "completions/min_length": 241.0, "completions/min_terminated_length": 241.0, "epoch": 0.9346492397972793, "grad_norm": 0.2125528933160923, "learning_rate": 1.5931357897291664e-08, "loss": 0.0109, "num_tokens": 50291055.0, "reward": 1.1796875, "reward_std": 0.22115148603916168, "rewards/accuracy_reward/mean": 0.6875, "rewards/accuracy_reward/std": 0.4644203782081604, "rewards/format_reward/mean": 0.984375, "rewards/format_reward/std": 0.12426253408193588, "step": 219 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0078125, "completions/max_length": 2048.0, "completions/max_terminated_length": 1901.0, "completions/mean_length": 599.9140625, "completions/mean_terminated_length": 588.5117797851562, "completions/min_length": 227.0, "completions/min_terminated_length": 227.0, "epoch": 0.9389170445452121, "grad_norm": 0.3032930830422189, "learning_rate": 1.4120820854156944e-08, "loss": 0.0187, "num_tokens": 50488953.0, "reward": 1.251953125, "reward_std": 0.1863902509212494, "rewards/accuracy_reward/mean": 0.7578125, "rewards/accuracy_reward/std": 0.4292463958263397, "rewards/format_reward/mean": 0.98828125, "rewards/format_reward/std": 0.1078278198838234, "step": 220 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0078125, "completions/max_length": 2048.0, "completions/max_terminated_length": 1779.0, "completions/mean_length": 686.68359375, "completions/mean_terminated_length": 675.9645385742188, "completions/min_length": 228.0, "completions/min_terminated_length": 228.0, "epoch": 0.9431848492931448, "grad_norm": 0.25781283708150377, "learning_rate": 1.2417993581606445e-08, "loss": 0.0071, "num_tokens": 50709304.0, "reward": 1.19140625, "reward_std": 0.24818523228168488, "rewards/accuracy_reward/mean": 0.7177419066429138, "rewards/accuracy_reward/std": 0.45100846886634827, "rewards/format_reward/mean": 0.9921875, "rewards/format_reward/std": 0.08821486681699753, "step": 221 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 2048.0, "completions/max_terminated_length": 1947.0, "completions/mean_length": 659.75, "completions/mean_terminated_length": 654.305908203125, "completions/min_length": 234.0, "completions/min_terminated_length": 234.0, "epoch": 0.9474526540410776, "grad_norm": 0.2094544272829385, "learning_rate": 1.0823253562649793e-08, "loss": 0.0241, "num_tokens": 50914848.0, "reward": 1.248046875, "reward_std": 0.204259991645813, "rewards/accuracy_reward/mean": 0.75, "rewards/accuracy_reward/std": 0.4338609278202057, "rewards/format_reward/mean": 0.99609375, "rewards/format_reward/std": 0.0625, "step": 222 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0078125, "completions/max_length": 2048.0, "completions/max_terminated_length": 1646.0, "completions/mean_length": 617.921875, "completions/mean_terminated_length": 606.6614379882812, "completions/min_length": 215.0, "completions/min_terminated_length": 215.0, "epoch": 0.9517204587890103, "grad_norm": 0.23605866212584778, "learning_rate": 9.336954319497714e-09, "loss": 0.0084, "num_tokens": 51110076.0, "reward": 1.23046875, "reward_std": 0.21031491458415985, "rewards/accuracy_reward/mean": 0.734375, "rewards/accuracy_reward/std": 0.4425306022167206, "rewards/format_reward/mean": 0.9921875, "rewards/format_reward/std": 0.08821486681699753, "step": 223 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 1742.0, "completions/max_terminated_length": 1742.0, "completions/mean_length": 616.18359375, "completions/mean_terminated_length": 616.18359375, "completions/min_length": 191.0, "completions/min_terminated_length": 191.0, "epoch": 0.9559882635369432, "grad_norm": 0.2333984997933526, "learning_rate": 7.959425335193337e-09, "loss": 0.0159, "num_tokens": 51300787.0, "reward": 1.2265625, "reward_std": 0.2001592218875885, "rewards/accuracy_reward/mean": 0.7265625, "rewards/accuracy_reward/std": 0.446596622467041, "rewards/format_reward/mean": 1.0, "rewards/format_reward/std": 0.0, "step": 224 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 2048.0, "completions/max_terminated_length": 1726.0, "completions/mean_length": 648.83203125, "completions/mean_terminated_length": 643.3451538085938, "completions/min_length": 219.0, "completions/min_terminated_length": 219.0, "epoch": 0.960256068284876, "grad_norm": 0.2089681584399415, "learning_rate": 6.690971980572058e-09, "loss": 0.0072, "num_tokens": 51517768.0, "reward": 1.248046875, "reward_std": 0.16782496869564056, "rewards/accuracy_reward/mean": 0.75, "rewards/accuracy_reward/std": 0.4338609278202057, "rewards/format_reward/mean": 0.99609375, "rewards/format_reward/std": 0.0625, "step": 225 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 2048.0, "completions/max_terminated_length": 1936.0, "completions/mean_length": 698.08203125, "completions/mean_terminated_length": 692.7882690429688, "completions/min_length": 280.0, "completions/min_terminated_length": 280.0, "epoch": 0.9645238730328087, "grad_norm": 0.21994732007609208, "learning_rate": 5.5318754465671354e-09, "loss": 0.0187, "num_tokens": 51749093.0, "reward": 1.193359375, "reward_std": 0.20029661059379578, "rewards/accuracy_reward/mean": 0.6953125, "rewards/accuracy_reward/std": 0.4611765742301941, "rewards/format_reward/mean": 0.99609375, "rewards/format_reward/std": 0.0625, "step": 226 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01171875, "completions/max_length": 2048.0, "completions/max_terminated_length": 1865.0, "completions/mean_length": 655.94140625, "completions/mean_terminated_length": 639.434814453125, "completions/min_length": 199.0, "completions/min_terminated_length": 199.0, "epoch": 0.9687916777807415, "grad_norm": 0.2298210544751593, "learning_rate": 4.482392681875113e-09, "loss": 0.0099, "num_tokens": 51967454.0, "reward": 1.125, "reward_std": 0.19949902594089508, "rewards/accuracy_reward/mean": 0.6328125, "rewards/accuracy_reward/std": 0.48298248648643494, "rewards/format_reward/mean": 0.984375, "rewards/format_reward/std": 0.12426253408193588, "step": 227 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 1592.0, "completions/max_terminated_length": 1592.0, "completions/mean_length": 649.30859375, "completions/mean_terminated_length": 649.30859375, "completions/min_length": 219.0, "completions/min_terminated_length": 219.0, "epoch": 0.9730594825286744, "grad_norm": 0.20543081839485053, "learning_rate": 3.5427563359954893e-09, "loss": 0.0033, "num_tokens": 52171869.0, "reward": 1.31640625, "reward_std": 0.19701021909713745, "rewards/accuracy_reward/mean": 0.81640625, "rewards/accuracy_reward/std": 0.387910932302475, "rewards/format_reward/mean": 1.0, "rewards/format_reward/std": 0.0, "step": 228 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01171875, "completions/max_length": 2048.0, "completions/max_terminated_length": 1831.0, "completions/mean_length": 727.8828125, "completions/mean_terminated_length": 712.229248046875, "completions/min_length": 189.0, "completions/min_terminated_length": 189.0, "epoch": 0.9773272872766071, "grad_norm": 0.19067844855692329, "learning_rate": 2.7131747076567513e-09, "loss": -0.0003, "num_tokens": 52406391.0, "reward": 1.166015625, "reward_std": 0.1843988299369812, "rewards/accuracy_reward/mean": 0.671875, "rewards/accuracy_reward/std": 0.47045037150382996, "rewards/format_reward/mean": 0.98828125, "rewards/format_reward/std": 0.1078278198838234, "step": 229 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 1474.0, "completions/max_terminated_length": 1474.0, "completions/mean_length": 601.140625, "completions/mean_terminated_length": 601.140625, "completions/min_length": 202.0, "completions/min_terminated_length": 202.0, "epoch": 0.9815950920245399, "grad_norm": 0.24250811846913806, "learning_rate": 1.9938316986408133e-09, "loss": 0.0099, "num_tokens": 52608931.0, "reward": 1.26171875, "reward_std": 0.18543127179145813, "rewards/accuracy_reward/mean": 0.76171875, "rewards/accuracy_reward/std": 0.4268665909767151, "rewards/format_reward/mean": 1.0, "rewards/format_reward/std": 0.0, "step": 230 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0078125, "completions/max_length": 2048.0, "completions/max_terminated_length": 2024.0, "completions/mean_length": 728.25390625, "completions/mean_terminated_length": 717.8621826171875, "completions/min_length": 289.0, "completions/min_terminated_length": 289.0, "epoch": 0.9858628967724726, "grad_norm": 0.22481444911050422, "learning_rate": 1.3848867730158476e-09, "loss": 0.0083, "num_tokens": 52841356.0, "reward": 1.21875, "reward_std": 0.2513718605041504, "rewards/accuracy_reward/mean": 0.72265625, "rewards/accuracy_reward/std": 0.4485645890235901, "rewards/format_reward/mean": 0.9921875, "rewards/format_reward/std": 0.08821486681699753, "step": 231 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 1706.0, "completions/max_terminated_length": 1706.0, "completions/mean_length": 657.55078125, "completions/mean_terminated_length": 657.55078125, "completions/min_length": 232.0, "completions/min_terminated_length": 232.0, "epoch": 0.9901307015204054, "grad_norm": 0.20647039509253484, "learning_rate": 8.864749217858403e-10, "loss": 0.0043, "num_tokens": 53054881.0, "reward": 1.234375, "reward_std": 0.20133629441261292, "rewards/accuracy_reward/mean": 0.734375, "rewards/accuracy_reward/std": 0.4425306022167206, "rewards/format_reward/mean": 1.0, "rewards/format_reward/std": 0.0, "step": 232 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0078125, "completions/max_length": 2048.0, "completions/max_terminated_length": 1566.0, "completions/mean_length": 627.51953125, "completions/mean_terminated_length": 616.3346557617188, "completions/min_length": 273.0, "completions/min_terminated_length": 273.0, "epoch": 0.9943985062683383, "grad_norm": 0.2389236571076748, "learning_rate": 4.987066329659728e-10, "loss": 0.0226, "num_tokens": 53258350.0, "reward": 1.1796875, "reward_std": 0.20136789977550507, "rewards/accuracy_reward/mean": 0.68359375, "rewards/accuracy_reward/std": 0.4659844934940338, "rewards/format_reward/mean": 0.9921875, "rewards/format_reward/std": 0.08821486681699753, "step": 233 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 1544.0, "completions/max_terminated_length": 1544.0, "completions/mean_length": 571.0, "completions/mean_terminated_length": 571.0, "completions/min_length": 258.0, "completions/min_terminated_length": 258.0, "epoch": 0.998666311016271, "grad_norm": 0.2569771171353061, "learning_rate": 2.2166786708976981e-10, "loss": 0.0188, "num_tokens": 53474542.0, "reward": 1.20703125, "reward_std": 0.2004251778125763, "rewards/accuracy_reward/mean": 0.70703125, "rewards/accuracy_reward/std": 0.45601576566696167, "rewards/format_reward/mean": 1.0, "rewards/format_reward/std": 0.0, "step": 234 }, { "epoch": 0.998666311016271, "step": 234, "total_flos": 0.0, "train_loss": 0.013747031251953628, "train_runtime": 124161.3091, "train_samples_per_second": 0.06, "train_steps_per_second": 0.002 } ], "logging_steps": 1, "max_steps": 235, "num_input_tokens_seen": 53474542, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 0.0, "train_batch_size": 4, "trial_name": null, "trial_params": null }