{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.5056, "eval_steps": 15, "global_step": 79, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001953125, "completions/max_length": 3072.0, "completions/max_terminated_length": 2416.0, "completions/mean_length": 513.2552490234375, "completions/mean_terminated_length": 508.2478942871094, "completions/min_length": 115.0, "completions/min_terminated_length": 115.0, "epoch": 0.0064, "grad_norm": 0.12344984710216522, "learning_rate": 0.0, "loss": 0.01, "num_tokens": 1317808.0, "reward": 0.15714871883392334, "reward_std": 0.22725586593151093, "rewards/accuracy_reward": 0.0423177070915699, "rewards/brier_reward": 0.046699244529008865, "rewards/confidence_one_or_zero": 0.1634114533662796, "rewards/format_reward": 0.2252604216337204, "rewards/mean_confidence_reward": 0.8383918404579163, "step": 1 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0006510416666666297, "completions/max_length": 3072.0, "completions/max_terminated_length": 2762.0, "completions/mean_length": 510.173828125, "completions/mean_terminated_length": 508.5048828125, "completions/min_length": 110.0, "completions/min_terminated_length": 110.0, "epoch": 0.0128, "grad_norm": 0.12667720019817352, "learning_rate": 3.125e-07, "loss": 0.0179, "num_tokens": 2632603.0, "reward": 0.18118327856063843, "reward_std": 0.24819880723953247, "rewards/accuracy_reward": 0.0559895820915699, "rewards/brier_reward": 0.06026346608996391, "rewards/confidence_one_or_zero": 0.158203125, "rewards/format_reward": 0.24609375, "rewards/mean_confidence_reward": 0.8297531008720398, "step": 2 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0006510416666666297, "completions/max_length": 3072.0, "completions/max_terminated_length": 2454.0, "completions/mean_length": 522.6185302734375, "completions/mean_terminated_length": 520.9576416015625, "completions/min_length": 102.0, "completions/min_terminated_length": 102.0, "epoch": 0.0192, "grad_norm": 0.10833960026502609, "learning_rate": 6.25e-07, "loss": 0.0179, "num_tokens": 3969457.0, "reward": 0.16414031386375427, "reward_std": 0.2279990166425705, "rewards/accuracy_reward": 0.048828125, "rewards/brier_reward": 0.052869994193315506, "rewards/confidence_one_or_zero": 0.1653645783662796, "rewards/format_reward": 0.2265625, "rewards/mean_confidence_reward": 0.833968460559845, "step": 3 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0006510416666666297, "completions/max_length": 3072.0, "completions/max_terminated_length": 2090.0, "completions/mean_length": 467.40887451171875, "completions/mean_terminated_length": 465.7120361328125, "completions/min_length": 125.0, "completions/min_terminated_length": 125.0, "epoch": 0.0256, "grad_norm": 0.12152963131666183, "learning_rate": 9.375000000000001e-07, "loss": 0.0165, "num_tokens": 5204789.0, "reward": 0.20207886397838593, "reward_std": 0.26488131284713745, "rewards/accuracy_reward": 0.0598958320915699, "rewards/brier_reward": 0.06494495272636414, "rewards/confidence_one_or_zero": 0.1595052033662796, "rewards/format_reward": 0.279296875, "rewards/mean_confidence_reward": 0.8443619608879089, "step": 4 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0013020833333333703, "completions/max_length": 3072.0, "completions/max_terminated_length": 2473.0, "completions/mean_length": 485.52215576171875, "completions/mean_terminated_length": 482.1499328613281, "completions/min_length": 117.0, "completions/min_terminated_length": 117.0, "epoch": 0.032, "grad_norm": 0.12661050260066986, "learning_rate": 1.25e-06, "loss": 0.0176, "num_tokens": 6478951.0, "reward": 0.19431988894939423, "reward_std": 0.25675591826438904, "rewards/accuracy_reward": 0.0358072929084301, "rewards/brier_reward": 0.04421881213784218, "rewards/confidence_one_or_zero": 0.1458333283662796, "rewards/format_reward": 0.30859375, "rewards/mean_confidence_reward": 0.8485057950019836, "step": 5 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001953125, "completions/max_length": 3072.0, "completions/max_terminated_length": 2745.0, "completions/mean_length": 464.67254638671875, "completions/mean_terminated_length": 459.57012939453125, "completions/min_length": 128.0, "completions/min_terminated_length": 128.0, "epoch": 0.0384, "grad_norm": 0.13682091236114502, "learning_rate": 1.5625e-06, "loss": 0.0277, "num_tokens": 7722968.0, "reward": 0.35016554594039917, "reward_std": 0.32608699798583984, "rewards/accuracy_reward": 0.095703125, "rewards/brier_reward": 0.10200395435094833, "rewards/confidence_one_or_zero": 0.1067708358168602, "rewards/format_reward": 0.5026041865348816, "rewards/mean_confidence_reward": 0.8821424841880798, "step": 6 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0013020833333333703, "completions/max_length": 3072.0, "completions/max_terminated_length": 2730.0, "completions/mean_length": 396.37762451171875, "completions/mean_terminated_length": 392.88916015625, "completions/min_length": 119.0, "completions/min_terminated_length": 119.0, "epoch": 0.0448, "grad_norm": 0.10670524835586548, "learning_rate": 1.8750000000000003e-06, "loss": 0.0209, "num_tokens": 8863532.0, "reward": 0.5172501802444458, "reward_std": 0.3278539180755615, "rewards/accuracy_reward": 0.1360677033662796, "rewards/brier_reward": 0.1536215990781784, "rewards/confidence_one_or_zero": 0.0514322929084301, "rewards/format_reward": 0.7447916865348816, "rewards/mean_confidence_reward": 0.9148001670837402, "step": 7 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0006510416666666297, "completions/max_length": 3072.0, "completions/max_terminated_length": 2176.0, "completions/mean_length": 356.41864013671875, "completions/mean_terminated_length": 354.6495056152344, "completions/min_length": 102.0, "completions/min_terminated_length": 102.0, "epoch": 0.0512, "grad_norm": 0.09465499222278595, "learning_rate": 2.1875000000000002e-06, "loss": 0.0149, "num_tokens": 9935503.0, "reward": 0.5450800061225891, "reward_std": 0.26621514558792114, "rewards/accuracy_reward": 0.1204427108168602, "rewards/brier_reward": 0.13245756924152374, "rewards/confidence_one_or_zero": 0.0690104141831398, "rewards/format_reward": 0.8372395634651184, "rewards/mean_confidence_reward": 0.9360446333885193, "step": 8 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 1098.0, "completions/max_terminated_length": 1098.0, "completions/mean_length": 295.6829528808594, "completions/mean_terminated_length": 295.6829528808594, "completions/min_length": 106.0, "completions/min_terminated_length": 106.0, "epoch": 0.0576, "grad_norm": 0.09623412042856216, "learning_rate": 2.5e-06, "loss": 0.0043, "num_tokens": 10922848.0, "reward": 0.6380816698074341, "reward_std": 0.25275611877441406, "rewards/accuracy_reward": 0.15234375, "rewards/brier_reward": 0.17132478952407837, "rewards/confidence_one_or_zero": 0.0924479141831398, "rewards/format_reward": 0.9524739384651184, "rewards/mean_confidence_reward": 0.9462093710899353, "step": 9 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 1492.0, "completions/max_terminated_length": 1492.0, "completions/mean_length": 263.1224060058594, "completions/mean_terminated_length": 263.1224060058594, "completions/min_length": 100.0, "completions/min_terminated_length": 100.0, "epoch": 0.064, "grad_norm": 0.12087129801511765, "learning_rate": 2.8125e-06, "loss": 0.002, "num_tokens": 11863412.0, "reward": 0.6714729070663452, "reward_std": 0.25721341371536255, "rewards/accuracy_reward": 0.1783854216337204, "rewards/brier_reward": 0.20229984819889069, "rewards/confidence_one_or_zero": 0.1041666641831398, "rewards/format_reward": 0.9622395634651184, "rewards/mean_confidence_reward": 0.9416966438293457, "step": 10 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0006510416666666297, "completions/max_length": 3072.0, "completions/max_terminated_length": 1570.0, "completions/mean_length": 244.3033905029297, "completions/mean_terminated_length": 242.4612274169922, "completions/min_length": 88.0, "completions/min_terminated_length": 88.0, "epoch": 0.0704, "grad_norm": 0.10842401534318924, "learning_rate": 3.125e-06, "loss": 0.0018, "num_tokens": 12766990.0, "reward": 0.6708444356918335, "reward_std": 0.22578249871730804, "rewards/accuracy_reward": 0.150390625, "rewards/brier_reward": 0.21341417729854584, "rewards/confidence_one_or_zero": 0.0481770820915699, "rewards/format_reward": 0.9778645634651184, "rewards/mean_confidence_reward": 0.9204818606376648, "step": 11 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 985.0, "completions/max_terminated_length": 985.0, "completions/mean_length": 220.8854217529297, "completions/mean_terminated_length": 220.8854217529297, "completions/min_length": 92.0, "completions/min_terminated_length": 92.0, "epoch": 0.0768, "grad_norm": 0.10331228375434875, "learning_rate": 3.4375e-06, "loss": -0.0007, "num_tokens": 13629054.0, "reward": 0.6898407340049744, "reward_std": 0.19564443826675415, "rewards/accuracy_reward": 0.1263020783662796, "rewards/brier_reward": 0.2585696280002594, "rewards/confidence_one_or_zero": 0.01627604104578495, "rewards/format_reward": 0.9947916865348816, "rewards/mean_confidence_reward": 0.8836035132408142, "step": 12 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 816.0, "completions/max_terminated_length": 816.0, "completions/mean_length": 187.1217498779297, "completions/mean_terminated_length": 187.1217498779297, "completions/min_length": 70.0, "completions/min_terminated_length": 70.0, "epoch": 0.0832, "grad_norm": 0.10918660461902618, "learning_rate": 3.7500000000000005e-06, "loss": -0.0008, "num_tokens": 14442001.0, "reward": 0.7865655422210693, "reward_std": 0.20179037749767303, "rewards/accuracy_reward": 0.1595052033662796, "rewards/brier_reward": 0.4233756959438324, "rewards/confidence_one_or_zero": 0.001953125, "rewards/format_reward": 0.990234375, "rewards/mean_confidence_reward": 0.7851627469062805, "step": 13 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 1251.0, "completions/max_terminated_length": 1251.0, "completions/mean_length": 168.841796875, "completions/mean_terminated_length": 168.841796875, "completions/min_length": 72.0, "completions/min_terminated_length": 72.0, "epoch": 0.0896, "grad_norm": 0.09542427211999893, "learning_rate": 4.0625000000000005e-06, "loss": 0.0011, "num_tokens": 15228654.0, "reward": 0.8784071803092957, "reward_std": 0.18350529670715332, "rewards/accuracy_reward": 0.201171875, "rewards/brier_reward": 0.556279718875885, "rewards/confidence_one_or_zero": 0.0013020833721384406, "rewards/format_reward": 0.9993489384651184, "rewards/mean_confidence_reward": 0.6912760734558105, "step": 14 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 634.0, "completions/max_terminated_length": 634.0, "completions/mean_length": 163.0299530029297, "completions/mean_terminated_length": 163.0299530029297, "completions/min_length": 71.0, "completions/min_terminated_length": 71.0, "epoch": 0.096, "grad_norm": 0.07958308607339859, "learning_rate": 4.3750000000000005e-06, "loss": -0.0005, "num_tokens": 16013868.0, "reward": 0.8841292858123779, "reward_std": 0.1378345489501953, "rewards/accuracy_reward": 0.154296875, "rewards/brier_reward": 0.6139492988586426, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 1.0, "rewards/mean_confidence_reward": 0.619335949420929, "step": 15 }, { "epoch": 0.096, "eval_completions/clipped_ratio": 0.0, "eval_completions/max_length": 384.125, "eval_completions/max_terminated_length": 384.125, "eval_completions/mean_length": 155.9650707244873, "eval_completions/mean_terminated_length": 155.9650707244873, "eval_completions/min_length": 74.625, "eval_completions/min_terminated_length": 74.625, "eval_loss": 0.0, "eval_num_tokens": 16013868.0, "eval_reward": 0.9124990850687027, "eval_reward_std": 0.19061542302370071, "eval_rewards/accuracy_reward": 0.1572265625, "eval_rewards/brier_reward": 0.6687369048595428, "eval_rewards/confidence_one_or_zero": 0.0, "eval_rewards/format_reward": 0.9990234375, "eval_rewards/mean_confidence_reward": 0.5639648586511612, "eval_runtime": 38.1652, "eval_samples_per_second": 26.202, "eval_steps_per_second": 0.21, "step": 15 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 1351.0, "completions/max_terminated_length": 1351.0, "completions/mean_length": 160.1822967529297, "completions/mean_terminated_length": 160.1822967529297, "completions/min_length": 69.0, "completions/min_terminated_length": 69.0, "epoch": 0.1024, "grad_norm": 0.08845788240432739, "learning_rate": 4.6875000000000004e-06, "loss": 0.0004, "num_tokens": 16794684.0, "reward": 0.9343183040618896, "reward_std": 0.15499888360500336, "rewards/accuracy_reward": 0.1940104216337204, "rewards/brier_reward": 0.6746149063110352, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 1.0, "rewards/mean_confidence_reward": 0.5623372197151184, "step": 16 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0006510416666666297, "completions/max_length": 3072.0, "completions/max_terminated_length": 1057.0, "completions/mean_length": 159.93685913085938, "completions/mean_terminated_length": 158.03973388671875, "completions/min_length": 68.0, "completions/min_terminated_length": 68.0, "epoch": 0.1088, "grad_norm": 0.0767010897397995, "learning_rate": 5e-06, "loss": 0.001, "num_tokens": 17572547.0, "reward": 0.9644677042961121, "reward_std": 0.12373493611812592, "rewards/accuracy_reward": 0.1634114533662796, "rewards/brier_reward": 0.7668177485466003, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9986979365348816, "rewards/mean_confidence_reward": 0.4108072817325592, "step": 17 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 1150.0, "completions/max_terminated_length": 1150.0, "completions/mean_length": 151.41146850585938, "completions/mean_terminated_length": 151.41146850585938, "completions/min_length": 68.0, "completions/min_terminated_length": 68.0, "epoch": 0.1152, "grad_norm": 0.03405171260237694, "learning_rate": 4.920634920634921e-06, "loss": 0.0002, "num_tokens": 18328587.0, "reward": 0.9970012903213501, "reward_std": 0.053423922508955, "rewards/accuracy_reward": 0.1302083283662796, "rewards/brier_reward": 0.8637895584106445, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 1.0, "rewards/mean_confidence_reward": 0.23268230259418488, "step": 18 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0006510416666666297, "completions/max_length": 3072.0, "completions/max_terminated_length": 841.0, "completions/mean_length": 145.88607788085938, "completions/mean_terminated_length": 143.97979736328125, "completions/min_length": 67.0, "completions/min_terminated_length": 67.0, "epoch": 0.1216, "grad_norm": 0.08672156929969788, "learning_rate": 4.841269841269842e-06, "loss": 0.0013, "num_tokens": 19081420.0, "reward": 0.9989738464355469, "reward_std": 0.05453099310398102, "rewards/accuracy_reward": 0.15625, "rewards/brier_reward": 0.8501570224761963, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9915364384651184, "rewards/mean_confidence_reward": 0.20839844644069672, "step": 19 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 1103.0, "completions/max_terminated_length": 1103.0, "completions/mean_length": 145.33920288085938, "completions/mean_terminated_length": 145.33920288085938, "completions/min_length": 69.0, "completions/min_terminated_length": 69.0, "epoch": 0.128, "grad_norm": 0.034685149788856506, "learning_rate": 4.761904761904762e-06, "loss": -0.0005, "num_tokens": 19830421.0, "reward": 1.0009196996688843, "reward_std": 0.05048990249633789, "rewards/accuracy_reward": 0.142578125, "rewards/brier_reward": 0.8605591654777527, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9986979365348816, "rewards/mean_confidence_reward": 0.20696616172790527, "step": 20 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 1499.0, "completions/max_terminated_length": 1499.0, "completions/mean_length": 144.0006561279297, "completions/mean_terminated_length": 144.0006561279297, "completions/min_length": 68.0, "completions/min_terminated_length": 68.0, "epoch": 0.1344, "grad_norm": 0.042840614914894104, "learning_rate": 4.682539682539683e-06, "loss": 0.001, "num_tokens": 20580302.0, "reward": 0.998023271560669, "reward_std": 0.04786913841962814, "rewards/accuracy_reward": 0.12890625, "rewards/brier_reward": 0.8690893054008484, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.998046875, "rewards/mean_confidence_reward": 0.20286458730697632, "step": 21 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0006510416666666297, "completions/max_length": 3072.0, "completions/max_terminated_length": 3034.0, "completions/mean_length": 135.8444061279297, "completions/mean_terminated_length": 133.9315948486328, "completions/min_length": 63.0, "completions/min_terminated_length": 63.0, "epoch": 0.1408, "grad_norm": 0.022160449996590614, "learning_rate": 4.603174603174604e-06, "loss": 0.0023, "num_tokens": 21312767.0, "reward": 1.0035309791564941, "reward_std": 0.02395722270011902, "rewards/accuracy_reward": 0.1263020783662796, "rewards/brier_reward": 0.8820595741271973, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9986979365348816, "rewards/mean_confidence_reward": 0.11113282293081284, "step": 22 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0006510416666666297, "completions/max_length": 3072.0, "completions/max_terminated_length": 1028.0, "completions/mean_length": 132.736328125, "completions/mean_terminated_length": 130.82150268554688, "completions/min_length": 62.0, "completions/min_terminated_length": 62.0, "epoch": 0.1472, "grad_norm": 0.022671813145279884, "learning_rate": 4.523809523809524e-06, "loss": 0.0007, "num_tokens": 22051386.0, "reward": 1.0043648481369019, "reward_std": 0.023137887939810753, "rewards/accuracy_reward": 0.125, "rewards/brier_reward": 0.8850294947624207, "rewards/confidence_one_or_zero": 0.0013020833721384406, "rewards/format_reward": 0.9986979365348816, "rewards/mean_confidence_reward": 0.10445964336395264, "step": 23 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0006510416666666297, "completions/max_length": 3072.0, "completions/max_terminated_length": 509.0, "completions/mean_length": 123.994140625, "completions/mean_terminated_length": 122.07361602783203, "completions/min_length": 60.0, "completions/min_terminated_length": 60.0, "epoch": 0.1536, "grad_norm": 0.017817093059420586, "learning_rate": 4.444444444444444e-06, "loss": 0.001, "num_tokens": 22767641.0, "reward": 1.0062859058380127, "reward_std": 0.02213597297668457, "rewards/accuracy_reward": 0.134765625, "rewards/brier_reward": 0.8784549832344055, "rewards/confidence_one_or_zero": 0.0078125, "rewards/format_reward": 0.9993489384651184, "rewards/mean_confidence_reward": 0.09915366023778915, "step": 24 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0006510416666666297, "completions/max_length": 3072.0, "completions/max_terminated_length": 2469.0, "completions/mean_length": 124.962890625, "completions/mean_terminated_length": 123.0429916381836, "completions/min_length": 58.0, "completions/min_terminated_length": 58.0, "epoch": 0.16, "grad_norm": 0.028992217034101486, "learning_rate": 4.365079365079366e-06, "loss": 0.0021, "num_tokens": 23481328.0, "reward": 1.0054970979690552, "reward_std": 0.024515468627214432, "rewards/accuracy_reward": 0.1510416716337204, "rewards/brier_reward": 0.8625543713569641, "rewards/confidence_one_or_zero": 0.02213541604578495, "rewards/format_reward": 0.9973958134651184, "rewards/mean_confidence_reward": 0.08613282442092896, "step": 25 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 537.0, "completions/max_terminated_length": 537.0, "completions/mean_length": 114.57096862792969, "completions/mean_terminated_length": 114.57096862792969, "completions/min_length": 64.0, "completions/min_terminated_length": 64.0, "epoch": 0.1664, "grad_norm": 0.01552383042871952, "learning_rate": 4.2857142857142855e-06, "loss": 0.0001, "num_tokens": 24187461.0, "reward": 1.0057644844055176, "reward_std": 0.015629516914486885, "rewards/accuracy_reward": 0.125, "rewards/brier_reward": 0.8865270614624023, "rewards/confidence_one_or_zero": 0.012369791977107525, "rewards/format_reward": 1.0, "rewards/mean_confidence_reward": 0.0858854278922081, "step": 26 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 647.0, "completions/max_terminated_length": 647.0, "completions/mean_length": 109.59700775146484, "completions/mean_terminated_length": 109.59700775146484, "completions/min_length": 61.0, "completions/min_terminated_length": 61.0, "epoch": 0.1728, "grad_norm": 0.014046880416572094, "learning_rate": 4.206349206349207e-06, "loss": 0.0, "num_tokens": 24876258.0, "reward": 1.0062367916107178, "reward_std": 0.015971940010786057, "rewards/accuracy_reward": 0.1302083283662796, "rewards/brier_reward": 0.8822630047798157, "rewards/confidence_one_or_zero": 0.009114583022892475, "rewards/format_reward": 1.0, "rewards/mean_confidence_reward": 0.09052734822034836, "step": 27 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 364.0, "completions/max_terminated_length": 364.0, "completions/mean_length": 110.931640625, "completions/mean_terminated_length": 110.931640625, "completions/min_length": 55.0, "completions/min_terminated_length": 55.0, "epoch": 0.1792, "grad_norm": 0.015721678733825684, "learning_rate": 4.126984126984127e-06, "loss": 0.0001, "num_tokens": 25573121.0, "reward": 1.0073223114013672, "reward_std": 0.016928067430853844, "rewards/accuracy_reward": 0.1412760466337204, "rewards/brier_reward": 0.8733661770820618, "rewards/confidence_one_or_zero": 0.011067708022892475, "rewards/format_reward": 1.0, "rewards/mean_confidence_reward": 0.09393229335546494, "step": 28 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 448.0, "completions/max_terminated_length": 448.0, "completions/mean_length": 105.548828125, "completions/mean_terminated_length": 105.548828125, "completions/min_length": 56.0, "completions/min_terminated_length": 56.0, "epoch": 0.1856, "grad_norm": 0.015512680634856224, "learning_rate": 4.047619047619048e-06, "loss": 0.0002, "num_tokens": 26255276.0, "reward": 1.0070064067840576, "reward_std": 0.015547393821179867, "rewards/accuracy_reward": 0.1380208283662796, "rewards/brier_reward": 0.8759898543357849, "rewards/confidence_one_or_zero": 0.013671875, "rewards/format_reward": 1.0, "rewards/mean_confidence_reward": 0.09619140625, "step": 29 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0006510416666666297, "completions/max_length": 3072.0, "completions/max_terminated_length": 642.0, "completions/mean_length": 106.47982025146484, "completions/mean_terminated_length": 104.54788208007812, "completions/min_length": 55.0, "completions/min_terminated_length": 55.0, "epoch": 0.192, "grad_norm": 0.016842655837535858, "learning_rate": 3.968253968253968e-06, "loss": 0.001, "num_tokens": 26942069.0, "reward": 1.0057001113891602, "reward_std": 0.017063049599528313, "rewards/accuracy_reward": 0.130859375, "rewards/brier_reward": 0.8811895251274109, "rewards/confidence_one_or_zero": 0.009765625, "rewards/format_reward": 0.9993489384651184, "rewards/mean_confidence_reward": 0.09785156697034836, "step": 30 }, { "epoch": 0.192, "eval_completions/clipped_ratio": 0.0, "eval_completions/max_length": 245.25, "eval_completions/max_terminated_length": 245.25, "eval_completions/mean_length": 103.35231399536133, "eval_completions/mean_terminated_length": 103.35231399536133, "eval_completions/min_length": 61.625, "eval_completions/min_terminated_length": 61.625, "eval_loss": 0.0, "eval_num_tokens": 26942069.0, "eval_reward": 1.0069686025381088, "eval_reward_std": 0.028366195736452937, "eval_rewards/accuracy_reward": 0.1376953125, "eval_rewards/brier_reward": 0.8762396723031998, "eval_rewards/confidence_one_or_zero": 0.005859375, "eval_rewards/format_reward": 1.0, "eval_rewards/mean_confidence_reward": 0.09887695498764515, "eval_runtime": 25.7359, "eval_samples_per_second": 38.856, "eval_steps_per_second": 0.311, "step": 30 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 317.0, "completions/max_terminated_length": 317.0, "completions/mean_length": 104.23112487792969, "completions/mean_terminated_length": 104.23112487792969, "completions/min_length": 57.0, "completions/min_terminated_length": 57.0, "epoch": 0.1984, "grad_norm": 0.014870710670948029, "learning_rate": 3.88888888888889e-06, "loss": 0.0, "num_tokens": 27632456.0, "reward": 1.0063118934631348, "reward_std": 0.014838973991572857, "rewards/accuracy_reward": 0.1302083283662796, "rewards/brier_reward": 0.8824132084846497, "rewards/confidence_one_or_zero": 0.01171875, "rewards/format_reward": 1.0, "rewards/mean_confidence_reward": 0.09840494394302368, "step": 31 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 541.0, "completions/max_terminated_length": 541.0, "completions/mean_length": 100.26432800292969, "completions/mean_terminated_length": 100.26432800292969, "completions/min_length": 56.0, "completions/min_terminated_length": 56.0, "epoch": 0.2048, "grad_norm": 0.01399635523557663, "learning_rate": 3.80952380952381e-06, "loss": 0.0001, "num_tokens": 28308662.0, "reward": 1.0071120262145996, "reward_std": 0.015049047768115997, "rewards/accuracy_reward": 0.1380208283662796, "rewards/brier_reward": 0.8762008547782898, "rewards/confidence_one_or_zero": 0.0065104165114462376, "rewards/format_reward": 1.0, "rewards/mean_confidence_reward": 0.09908854961395264, "step": 32 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 408.0, "completions/max_terminated_length": 408.0, "completions/mean_length": 99.68229675292969, "completions/mean_terminated_length": 99.68229675292969, "completions/min_length": 58.0, "completions/min_terminated_length": 58.0, "epoch": 0.2112, "grad_norm": 0.01481532584875822, "learning_rate": 3.7301587301587305e-06, "loss": -0.0003, "num_tokens": 28986438.0, "reward": 1.0082613229751587, "reward_std": 0.016647430136799812, "rewards/accuracy_reward": 0.1484375, "rewards/brier_reward": 0.8680830001831055, "rewards/confidence_one_or_zero": 0.0013020833721384406, "rewards/format_reward": 1.0, "rewards/mean_confidence_reward": 0.0994466170668602, "step": 33 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 509.0, "completions/max_terminated_length": 509.0, "completions/mean_length": 101.26692962646484, "completions/mean_terminated_length": 101.26692962646484, "completions/min_length": 53.0, "completions/min_terminated_length": 53.0, "epoch": 0.2176, "grad_norm": 0.015680309385061264, "learning_rate": 3.6507936507936507e-06, "loss": 0.0001, "num_tokens": 29666136.0, "reward": 1.0082824230194092, "reward_std": 0.016683388501405716, "rewards/accuracy_reward": 0.1484375, "rewards/brier_reward": 0.8681252598762512, "rewards/confidence_one_or_zero": 0.0013020833721384406, "rewards/format_reward": 1.0, "rewards/mean_confidence_reward": 0.099609375, "step": 34 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 787.0, "completions/max_terminated_length": 787.0, "completions/mean_length": 101.74609375, "completions/mean_terminated_length": 101.74609375, "completions/min_length": 53.0, "completions/min_terminated_length": 53.0, "epoch": 0.224, "grad_norm": 0.013283529318869114, "learning_rate": 3.5714285714285718e-06, "loss": -0.0001, "num_tokens": 30350298.0, "reward": 1.008887529373169, "reward_std": 0.015015891753137112, "rewards/accuracy_reward": 0.1549479216337204, "rewards/brier_reward": 0.8628246784210205, "rewards/confidence_one_or_zero": 0.00390625, "rewards/format_reward": 1.0, "rewards/mean_confidence_reward": 0.09957683086395264, "step": 35 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 379.0, "completions/max_terminated_length": 379.0, "completions/mean_length": 106.22982025146484, "completions/mean_terminated_length": 106.22982025146484, "completions/min_length": 60.0, "completions/min_terminated_length": 60.0, "epoch": 0.2304, "grad_norm": 0.01649440824985504, "learning_rate": 3.492063492063492e-06, "loss": 0.0002, "num_tokens": 31042851.0, "reward": 1.0087370872497559, "reward_std": 0.017726846039295197, "rewards/accuracy_reward": 0.1536458283662796, "rewards/brier_reward": 0.8638262748718262, "rewards/confidence_one_or_zero": 0.0026041667442768812, "rewards/format_reward": 1.0, "rewards/mean_confidence_reward": 0.09967448562383652, "step": 36 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 353.0, "completions/max_terminated_length": 353.0, "completions/mean_length": 103.544921875, "completions/mean_terminated_length": 103.544921875, "completions/min_length": 56.0, "completions/min_terminated_length": 56.0, "epoch": 0.2368, "grad_norm": 0.013323284685611725, "learning_rate": 3.412698412698413e-06, "loss": -0.0002, "num_tokens": 31727320.0, "reward": 1.0050444602966309, "reward_std": 0.014493642374873161, "rewards/accuracy_reward": 0.1165364608168602, "rewards/brier_reward": 0.8935502171516418, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 1.0, "rewards/mean_confidence_reward": 0.09986979514360428, "step": 37 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 373.0, "completions/max_terminated_length": 373.0, "completions/mean_length": 104.083984375, "completions/mean_terminated_length": 104.083984375, "completions/min_length": 58.0, "completions/min_terminated_length": 58.0, "epoch": 0.2432, "grad_norm": 0.013464462012052536, "learning_rate": 3.3333333333333333e-06, "loss": 0.0, "num_tokens": 32414529.0, "reward": 1.007368564605713, "reward_std": 0.015527362935245037, "rewards/accuracy_reward": 0.1399739533662796, "rewards/brier_reward": 0.8747609257698059, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 1.0, "rewards/mean_confidence_reward": 0.10000000149011612, "step": 38 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 382.0, "completions/max_terminated_length": 382.0, "completions/mean_length": 105.11067962646484, "completions/mean_terminated_length": 105.11067962646484, "completions/min_length": 60.0, "completions/min_terminated_length": 60.0, "epoch": 0.2496, "grad_norm": 0.013883170671761036, "learning_rate": 3.2539682539682544e-06, "loss": -0.0001, "num_tokens": 33100043.0, "reward": 1.0090630054473877, "reward_std": 0.01718251407146454, "rewards/accuracy_reward": 0.1569010466337204, "rewards/brier_reward": 0.8612225651741028, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 1.0, "rewards/mean_confidence_reward": 0.09996744990348816, "step": 39 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0006510416666666297, "completions/max_length": 3072.0, "completions/max_terminated_length": 283.0, "completions/mean_length": 109.57878112792969, "completions/mean_terminated_length": 107.64885711669922, "completions/min_length": 54.0, "completions/min_terminated_length": 54.0, "epoch": 0.256, "grad_norm": 0.015643145889043808, "learning_rate": 3.1746031746031746e-06, "loss": 0.001, "num_tokens": 33797732.0, "reward": 1.0077626705169678, "reward_std": 0.01909930817782879, "rewards/accuracy_reward": 0.150390625, "rewards/brier_reward": 0.8657833933830261, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9993489384651184, "rewards/mean_confidence_reward": 0.0999348983168602, "step": 40 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 298.0, "completions/max_terminated_length": 298.0, "completions/mean_length": 109.97721862792969, "completions/mean_terminated_length": 109.97721862792969, "completions/min_length": 58.0, "completions/min_terminated_length": 58.0, "epoch": 0.2624, "grad_norm": 0.013753971084952354, "learning_rate": 3.0952380952380957e-06, "loss": -0.0001, "num_tokens": 34492753.0, "reward": 1.0086588859558105, "reward_std": 0.017423056066036224, "rewards/accuracy_reward": 0.1529947966337204, "rewards/brier_reward": 0.8643207550048828, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 1.0, "rewards/mean_confidence_reward": 0.09996744990348816, "step": 41 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 309.0, "completions/max_terminated_length": 309.0, "completions/mean_length": 113.9140625, "completions/mean_terminated_length": 113.9140625, "completions/min_length": 61.0, "completions/min_terminated_length": 61.0, "epoch": 0.2688, "grad_norm": 0.015711113810539246, "learning_rate": 3.015873015873016e-06, "loss": 0.0001, "num_tokens": 35194653.0, "reward": 1.007615566253662, "reward_std": 0.01719771698117256, "rewards/accuracy_reward": 0.1490885466337204, "rewards/brier_reward": 0.8667915463447571, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9993489384651184, "rewards/mean_confidence_reward": 0.09996744990348816, "step": 42 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 321.0, "completions/max_terminated_length": 321.0, "completions/mean_length": 113.828125, "completions/mean_terminated_length": 113.828125, "completions/min_length": 61.0, "completions/min_terminated_length": 61.0, "epoch": 0.2752, "grad_norm": 0.013382576406002045, "learning_rate": 2.936507936507937e-06, "loss": -0.0001, "num_tokens": 35896901.0, "reward": 1.0079677104949951, "reward_std": 0.01691964827477932, "rewards/accuracy_reward": 0.1458333283662796, "rewards/brier_reward": 0.8700999617576599, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 1.0, "rewards/mean_confidence_reward": 0.09996744990348816, "step": 43 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 1730.0, "completions/max_terminated_length": 1730.0, "completions/mean_length": 116.564453125, "completions/mean_terminated_length": 116.564453125, "completions/min_length": 61.0, "completions/min_terminated_length": 61.0, "epoch": 0.2816, "grad_norm": 0.013394894078373909, "learning_rate": 2.8571428571428573e-06, "loss": -0.0001, "num_tokens": 36602840.0, "reward": 1.0099449157714844, "reward_std": 0.017746133729815483, "rewards/accuracy_reward": 0.1653645783662796, "rewards/brier_reward": 0.8545230031013489, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 1.0, "rewards/mean_confidence_reward": 0.0999348983168602, "step": 44 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 637.0, "completions/max_terminated_length": 637.0, "completions/mean_length": 116.49739837646484, "completions/mean_terminated_length": 116.49739837646484, "completions/min_length": 65.0, "completions/min_terminated_length": 65.0, "epoch": 0.288, "grad_norm": 0.013630064204335213, "learning_rate": 2.7777777777777783e-06, "loss": -0.0001, "num_tokens": 37307116.0, "reward": 1.0092854499816895, "reward_std": 0.015556964091956615, "rewards/accuracy_reward": 0.1588541716337204, "rewards/brier_reward": 0.8597145080566406, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 1.0, "rewards/mean_confidence_reward": 0.09996744990348816, "step": 45 }, { "epoch": 0.288, "eval_completions/clipped_ratio": 0.0, "eval_completions/max_length": 286.625, "eval_completions/max_terminated_length": 286.625, "eval_completions/mean_length": 117.99481678009033, "eval_completions/mean_terminated_length": 117.99481678009033, "eval_completions/min_length": 67.875, "eval_completions/min_terminated_length": 67.875, "eval_loss": 0.0, "eval_num_tokens": 37307116.0, "eval_reward": 1.009708896279335, "eval_reward_std": 0.031475587747991085, "eval_rewards/accuracy_reward": 0.1630859375, "eval_rewards/brier_reward": 0.8563297092914581, "eval_rewards/confidence_one_or_zero": 0.0, "eval_rewards/format_reward": 1.0, "eval_rewards/mean_confidence_reward": 0.10000000149011612, "eval_runtime": 29.1609, "eval_samples_per_second": 34.292, "eval_steps_per_second": 0.274, "step": 45 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 610.0, "completions/max_terminated_length": 610.0, "completions/mean_length": 124.873046875, "completions/mean_terminated_length": 124.873046875, "completions/min_length": 59.0, "completions/min_terminated_length": 59.0, "epoch": 0.2944, "grad_norm": 0.012923919595777988, "learning_rate": 2.6984126984126986e-06, "loss": 0.0001, "num_tokens": 38030889.0, "reward": 1.0079009532928467, "reward_std": 0.016820697113871574, "rewards/accuracy_reward": 0.1451822966337204, "rewards/brier_reward": 0.8706175684928894, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 1.0, "rewards/mean_confidence_reward": 0.10000000149011612, "step": 46 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 390.0, "completions/max_terminated_length": 390.0, "completions/mean_length": 121.28841400146484, "completions/mean_terminated_length": 121.28841400146484, "completions/min_length": 65.0, "completions/min_terminated_length": 65.0, "epoch": 0.3008, "grad_norm": 0.013293150812387466, "learning_rate": 2.6190476190476192e-06, "loss": -0.0002, "num_tokens": 38745516.0, "reward": 1.0075379610061646, "reward_std": 0.01851985976099968, "rewards/accuracy_reward": 0.1412760466337204, "rewards/brier_reward": 0.8737977147102356, "rewards/confidence_one_or_zero": 0.0006510416860692203, "rewards/format_reward": 1.0, "rewards/mean_confidence_reward": 0.0999348983168602, "step": 47 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 386.0, "completions/max_terminated_length": 386.0, "completions/mean_length": 123.53190612792969, "completions/mean_terminated_length": 123.53190612792969, "completions/min_length": 62.0, "completions/min_terminated_length": 62.0, "epoch": 0.3072, "grad_norm": 0.013963259756565094, "learning_rate": 2.53968253968254e-06, "loss": -0.0003, "num_tokens": 39469541.0, "reward": 1.0120104551315308, "reward_std": 0.017670420929789543, "rewards/accuracy_reward": 0.185546875, "rewards/brier_reward": 0.8384718894958496, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 1.0, "rewards/mean_confidence_reward": 0.10000000149011612, "step": 48 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 489.0, "completions/max_terminated_length": 489.0, "completions/mean_length": 130.68359375, "completions/mean_terminated_length": 130.68359375, "completions/min_length": 65.0, "completions/min_terminated_length": 65.0, "epoch": 0.3136, "grad_norm": 0.012982644140720367, "learning_rate": 2.4603174603174605e-06, "loss": -0.0002, "num_tokens": 40200887.0, "reward": 1.0091040134429932, "reward_std": 0.01862485706806183, "rewards/accuracy_reward": 0.1569010466337204, "rewards/brier_reward": 0.861304759979248, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 1.0, "rewards/mean_confidence_reward": 0.10000000149011612, "step": 49 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 549.0, "completions/max_terminated_length": 549.0, "completions/mean_length": 135.779296875, "completions/mean_terminated_length": 135.779296875, "completions/min_length": 65.0, "completions/min_terminated_length": 65.0, "epoch": 0.32, "grad_norm": 0.013592319563031197, "learning_rate": 2.380952380952381e-06, "loss": 0.0001, "num_tokens": 40935556.0, "reward": 1.0103710889816284, "reward_std": 0.01916532590985298, "rewards/accuracy_reward": 0.1692708283662796, "rewards/brier_reward": 0.8514692187309265, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 1.0, "rewards/mean_confidence_reward": 0.09996744990348816, "step": 50 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 384.0, "completions/max_terminated_length": 384.0, "completions/mean_length": 132.740234375, "completions/mean_terminated_length": 132.740234375, "completions/min_length": 64.0, "completions/min_terminated_length": 64.0, "epoch": 0.3264, "grad_norm": 0.014143792912364006, "learning_rate": 2.301587301587302e-06, "loss": 0.0, "num_tokens": 41663701.0, "reward": 1.0106953382492065, "reward_std": 0.018670808523893356, "rewards/accuracy_reward": 0.1725260466337204, "rewards/brier_reward": 0.8488624691963196, "rewards/confidence_one_or_zero": 0.0006510416860692203, "rewards/format_reward": 1.0, "rewards/mean_confidence_reward": 0.0999348983168602, "step": 51 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001953125, "completions/max_length": 3072.0, "completions/max_terminated_length": 407.0, "completions/mean_length": 140.9537811279297, "completions/mean_terminated_length": 135.21788024902344, "completions/min_length": 70.0, "completions/min_terminated_length": 70.0, "epoch": 0.3328, "grad_norm": 0.0160201545804739, "learning_rate": 2.222222222222222e-06, "loss": 0.0028, "num_tokens": 42411582.0, "reward": 1.0068026781082153, "reward_std": 0.024241184815764427, "rewards/accuracy_reward": 0.1529947966337204, "rewards/brier_reward": 0.8625615239143372, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.998046875, "rewards/mean_confidence_reward": 0.09980469942092896, "step": 52 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 934.0, "completions/max_terminated_length": 934.0, "completions/mean_length": 141.6334686279297, "completions/mean_terminated_length": 141.6334686279297, "completions/min_length": 71.0, "completions/min_terminated_length": 71.0, "epoch": 0.3392, "grad_norm": 0.013781928457319736, "learning_rate": 2.1428571428571427e-06, "loss": -0.0002, "num_tokens": 43152443.0, "reward": 1.0088703632354736, "reward_std": 0.019479775801301003, "rewards/accuracy_reward": 0.1549479216337204, "rewards/brier_reward": 0.8627905249595642, "rewards/confidence_one_or_zero": 0.0006510416860692203, "rewards/format_reward": 1.0, "rewards/mean_confidence_reward": 0.09986979514360428, "step": 53 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0006510416666666297, "completions/max_length": 3072.0, "completions/max_terminated_length": 925.0, "completions/mean_length": 143.2701873779297, "completions/mean_terminated_length": 141.36221313476562, "completions/min_length": 64.0, "completions/min_terminated_length": 64.0, "epoch": 0.3456, "grad_norm": 0.013352119363844395, "learning_rate": 2.0634920634920634e-06, "loss": 0.0011, "num_tokens": 43897954.0, "reward": 1.0110552310943604, "reward_std": 0.019325759261846542, "rewards/accuracy_reward": 0.1822916716337204, "rewards/brier_reward": 0.8404674530029297, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9993489384651184, "rewards/mean_confidence_reward": 0.0999348983168602, "step": 54 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 600.0, "completions/max_terminated_length": 600.0, "completions/mean_length": 147.375, "completions/mean_terminated_length": 147.375, "completions/min_length": 66.0, "completions/min_terminated_length": 66.0, "epoch": 0.352, "grad_norm": 0.012938371859490871, "learning_rate": 1.984126984126984e-06, "loss": -0.0002, "num_tokens": 44652898.0, "reward": 1.00691556930542, "reward_std": 0.016605772078037262, "rewards/accuracy_reward": 0.134765625, "rewards/brier_reward": 0.8790633082389832, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 1.0, "rewards/mean_confidence_reward": 0.10000000149011612, "step": 55 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 438.0, "completions/max_terminated_length": 438.0, "completions/mean_length": 151.08334350585938, "completions/mean_terminated_length": 151.08334350585938, "completions/min_length": 68.0, "completions/min_terminated_length": 68.0, "epoch": 0.3584, "grad_norm": 0.011130226776003838, "learning_rate": 1.904761904761905e-06, "loss": 0.0001, "num_tokens": 45414554.0, "reward": 1.0055440664291382, "reward_std": 0.01602439023554325, "rewards/accuracy_reward": 0.12109375, "rewards/brier_reward": 0.8899922370910645, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 1.0, "rewards/mean_confidence_reward": 0.10000000149011612, "step": 56 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 1290.0, "completions/max_terminated_length": 1290.0, "completions/mean_length": 151.34115600585938, "completions/mean_terminated_length": 151.34115600585938, "completions/min_length": 70.0, "completions/min_terminated_length": 70.0, "epoch": 0.3648, "grad_norm": 0.013030236586928368, "learning_rate": 1.8253968253968254e-06, "loss": -0.0001, "num_tokens": 46174918.0, "reward": 1.0155634880065918, "reward_std": 0.02115296944975853, "rewards/accuracy_reward": 0.220703125, "rewards/brier_reward": 0.8104216456413269, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 1.0, "rewards/mean_confidence_reward": 0.10000000149011612, "step": 57 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0006510416666666297, "completions/max_length": 3072.0, "completions/max_terminated_length": 445.0, "completions/mean_length": 154.76171875, "completions/mean_terminated_length": 152.86123657226562, "completions/min_length": 67.0, "completions/min_terminated_length": 67.0, "epoch": 0.3712, "grad_norm": 0.01376650296151638, "learning_rate": 1.746031746031746e-06, "loss": 0.001, "num_tokens": 46942840.0, "reward": 1.00923752784729, "reward_std": 0.021036747843027115, "rewards/accuracy_reward": 0.1640625, "rewards/brier_reward": 0.8550614714622498, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9993489384651184, "rewards/mean_confidence_reward": 0.09990235418081284, "step": 58 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 2615.0, "completions/max_terminated_length": 2615.0, "completions/mean_length": 157.0234375, "completions/mean_terminated_length": 157.0234375, "completions/min_length": 69.0, "completions/min_terminated_length": 69.0, "epoch": 0.3776, "grad_norm": 0.01250605471432209, "learning_rate": 1.6666666666666667e-06, "loss": 0.0002, "num_tokens": 47709508.0, "reward": 1.0067418813705444, "reward_std": 0.018108900636434555, "rewards/accuracy_reward": 0.1328125, "rewards/brier_reward": 0.880669116973877, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 1.0, "rewards/mean_confidence_reward": 0.10000000149011612, "step": 59 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0006510416666666297, "completions/max_length": 3072.0, "completions/max_terminated_length": 428.0, "completions/mean_length": 152.8737030029297, "completions/mean_terminated_length": 150.97198486328125, "completions/min_length": 72.0, "completions/min_terminated_length": 72.0, "epoch": 0.384, "grad_norm": 0.014088746160268784, "learning_rate": 1.5873015873015873e-06, "loss": 0.0011, "num_tokens": 48472442.0, "reward": 1.0127146244049072, "reward_std": 0.025917943567037582, "rewards/accuracy_reward": 0.1985677033662796, "rewards/brier_reward": 0.8275103569030762, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9993489384651184, "rewards/mean_confidence_reward": 0.09990235418081284, "step": 60 }, { "epoch": 0.384, "eval_completions/clipped_ratio": 0.0, "eval_completions/max_length": 421.25, "eval_completions/max_terminated_length": 421.25, "eval_completions/mean_length": 154.28478050231934, "eval_completions/mean_terminated_length": 154.28478050231934, "eval_completions/min_length": 79.75, "eval_completions/min_terminated_length": 79.75, "eval_loss": 0.0, "eval_num_tokens": 48472442.0, "eval_reward": 1.00930355489254, "eval_reward_std": 0.03157597640529275, "eval_rewards/accuracy_reward": 0.158203125, "eval_rewards/brier_reward": 0.8604019656777382, "eval_rewards/confidence_one_or_zero": 0.0, "eval_rewards/format_reward": 1.0, "eval_rewards/mean_confidence_reward": 0.10000000149011612, "eval_runtime": 41.1087, "eval_samples_per_second": 24.326, "eval_steps_per_second": 0.195, "step": 60 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 540.0, "completions/max_terminated_length": 540.0, "completions/mean_length": 156.4440155029297, "completions/mean_terminated_length": 156.4440155029297, "completions/min_length": 67.0, "completions/min_terminated_length": 67.0, "epoch": 0.3904, "grad_norm": 0.012505581602454185, "learning_rate": 1.507936507936508e-06, "loss": -0.0002, "num_tokens": 49249908.0, "reward": 1.0121111869812012, "reward_std": 0.019174562767148018, "rewards/accuracy_reward": 0.1861979216337204, "rewards/brier_reward": 0.8380222320556641, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 1.0, "rewards/mean_confidence_reward": 0.10000000149011612, "step": 61 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0013020833333333703, "completions/max_length": 3072.0, "completions/max_terminated_length": 494.0, "completions/mean_length": 161.8828125, "completions/mean_terminated_length": 158.08865356445312, "completions/min_length": 70.0, "completions/min_terminated_length": 70.0, "epoch": 0.3968, "grad_norm": 0.014075500890612602, "learning_rate": 1.4285714285714286e-06, "loss": 0.0017, "num_tokens": 50027744.0, "reward": 1.0073561668395996, "reward_std": 0.01984023116528988, "rewards/accuracy_reward": 0.1516927033662796, "rewards/brier_reward": 0.8643195033073425, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9986979365348816, "rewards/mean_confidence_reward": 0.09983724355697632, "step": 62 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0006510416666666297, "completions/max_length": 3072.0, "completions/max_terminated_length": 579.0, "completions/mean_length": 159.0494842529297, "completions/mean_terminated_length": 157.15179443359375, "completions/min_length": 71.0, "completions/min_terminated_length": 71.0, "epoch": 0.4032, "grad_norm": 0.013167272321879864, "learning_rate": 1.3492063492063493e-06, "loss": 0.0012, "num_tokens": 50799116.0, "reward": 1.0104891061782837, "reward_std": 0.022380638867616653, "rewards/accuracy_reward": 0.1764322966337204, "rewards/brier_reward": 0.8451948165893555, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9993489384651184, "rewards/mean_confidence_reward": 0.0999348983168602, "step": 63 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 2272.0, "completions/max_terminated_length": 2272.0, "completions/mean_length": 161.9244842529297, "completions/mean_terminated_length": 161.9244842529297, "completions/min_length": 69.0, "completions/min_terminated_length": 69.0, "epoch": 0.4096, "grad_norm": 0.010981855913996696, "learning_rate": 1.26984126984127e-06, "loss": 0.0001, "num_tokens": 51574216.0, "reward": 1.0111626386642456, "reward_std": 0.015849454328417778, "rewards/accuracy_reward": 0.1770833283662796, "rewards/brier_reward": 0.8452398180961609, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 1.0, "rewards/mean_confidence_reward": 0.09996744990348816, "step": 64 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 611.0, "completions/max_terminated_length": 611.0, "completions/mean_length": 156.36849975585938, "completions/mean_terminated_length": 156.36849975585938, "completions/min_length": 72.0, "completions/min_terminated_length": 72.0, "epoch": 0.416, "grad_norm": 0.01139452401548624, "learning_rate": 1.1904761904761906e-06, "loss": 0.0001, "num_tokens": 52346614.0, "reward": 1.010941982269287, "reward_std": 0.01662794128060341, "rewards/accuracy_reward": 0.1744791716337204, "rewards/brier_reward": 0.8474025726318359, "rewards/confidence_one_or_zero": 0.0006510416860692203, "rewards/format_reward": 1.0, "rewards/mean_confidence_reward": 0.0999348983168602, "step": 65 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0006510416666666297, "completions/max_length": 3072.0, "completions/max_terminated_length": 676.0, "completions/mean_length": 162.34310913085938, "completions/mean_terminated_length": 160.4475555419922, "completions/min_length": 73.0, "completions/min_terminated_length": 73.0, "epoch": 0.4224, "grad_norm": 0.012299340218305588, "learning_rate": 1.111111111111111e-06, "loss": 0.001, "num_tokens": 53123021.0, "reward": 1.0089854001998901, "reward_std": 0.0196043960750103, "rewards/accuracy_reward": 0.1614583283662796, "rewards/brier_reward": 0.8571612238883972, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9993489384651184, "rewards/mean_confidence_reward": 0.0999348983168602, "step": 66 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 2176.0, "completions/max_terminated_length": 2176.0, "completions/mean_length": 160.7890625, "completions/mean_terminated_length": 160.7890625, "completions/min_length": 77.0, "completions/min_terminated_length": 77.0, "epoch": 0.4288, "grad_norm": 0.012904134579002857, "learning_rate": 1.0317460317460317e-06, "loss": 0.0001, "num_tokens": 53894897.0, "reward": 1.008981704711914, "reward_std": 0.020699508488178253, "rewards/accuracy_reward": 0.1549479216337204, "rewards/brier_reward": 0.8630132675170898, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 1.0, "rewards/mean_confidence_reward": 0.10000000149011612, "step": 67 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 1007.0, "completions/max_terminated_length": 1007.0, "completions/mean_length": 160.4987030029297, "completions/mean_terminated_length": 160.4987030029297, "completions/min_length": 71.0, "completions/min_terminated_length": 71.0, "epoch": 0.4352, "grad_norm": 0.012299139983952045, "learning_rate": 9.523809523809525e-07, "loss": 0.0002, "num_tokens": 54670711.0, "reward": 1.0109989643096924, "reward_std": 0.018699724227190018, "rewards/accuracy_reward": 0.1751302033662796, "rewards/brier_reward": 0.8468656539916992, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 1.0, "rewards/mean_confidence_reward": 0.10000000149011612, "step": 68 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0013020833333333703, "completions/max_length": 3072.0, "completions/max_terminated_length": 489.0, "completions/mean_length": 166.4908905029297, "completions/mean_terminated_length": 162.70272827148438, "completions/min_length": 75.0, "completions/min_terminated_length": 75.0, "epoch": 0.4416, "grad_norm": 0.015022012405097485, "learning_rate": 8.73015873015873e-07, "loss": 0.002, "num_tokens": 55455457.0, "reward": 1.0069606304168701, "reward_std": 0.020755643025040627, "rewards/accuracy_reward": 0.1477864533662796, "rewards/brier_reward": 0.8674346804618835, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9986979365348816, "rewards/mean_confidence_reward": 0.09986979514360428, "step": 69 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 1779.0, "completions/max_terminated_length": 1779.0, "completions/mean_length": 164.69921875, "completions/mean_terminated_length": 164.69921875, "completions/min_length": 65.0, "completions/min_terminated_length": 65.0, "epoch": 0.448, "grad_norm": 0.012088743038475513, "learning_rate": 7.936507936507937e-07, "loss": 0.0001, "num_tokens": 56237739.0, "reward": 1.0078566074371338, "reward_std": 0.019154582172632217, "rewards/accuracy_reward": 0.1438802033662796, "rewards/brier_reward": 0.8718307614326477, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 1.0, "rewards/mean_confidence_reward": 0.10000000149011612, "step": 70 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 1182.0, "completions/max_terminated_length": 1182.0, "completions/mean_length": 164.3671875, "completions/mean_terminated_length": 164.3671875, "completions/min_length": 76.0, "completions/min_terminated_length": 76.0, "epoch": 0.4544, "grad_norm": 0.011220496147871017, "learning_rate": 7.142857142857143e-07, "loss": -0.0002, "num_tokens": 57013647.0, "reward": 1.0098857879638672, "reward_std": 0.018337352201342583, "rewards/accuracy_reward": 0.1640625, "rewards/brier_reward": 0.8557068705558777, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 1.0, "rewards/mean_confidence_reward": 0.10000000149011612, "step": 71 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 782.0, "completions/max_terminated_length": 782.0, "completions/mean_length": 160.58984375, "completions/mean_terminated_length": 160.58984375, "completions/min_length": 68.0, "completions/min_terminated_length": 68.0, "epoch": 0.4608, "grad_norm": 0.016769254580140114, "learning_rate": 6.34920634920635e-07, "loss": 0.0003, "num_tokens": 57789705.0, "reward": 1.0117367506027222, "reward_std": 0.021181315183639526, "rewards/accuracy_reward": 0.1888020783662796, "rewards/brier_reward": 0.8353202939033508, "rewards/confidence_one_or_zero": 0.0006510416860692203, "rewards/format_reward": 0.9993489384651184, "rewards/mean_confidence_reward": 0.0999348983168602, "step": 72 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0006510416666666297, "completions/max_length": 3072.0, "completions/max_terminated_length": 1463.0, "completions/mean_length": 162.6256561279297, "completions/mean_terminated_length": 160.73028564453125, "completions/min_length": 63.0, "completions/min_terminated_length": 63.0, "epoch": 0.4672, "grad_norm": 0.022856062278151512, "learning_rate": 5.555555555555555e-07, "loss": 0.001, "num_tokens": 58560242.0, "reward": 1.01325261592865, "reward_std": 0.024643372744321823, "rewards/accuracy_reward": 0.2102864533662796, "rewards/brier_reward": 0.8175187110900879, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9986979365348816, "rewards/mean_confidence_reward": 0.09986979514360428, "step": 73 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 1547.0, "completions/max_terminated_length": 1547.0, "completions/mean_length": 159.818359375, "completions/mean_terminated_length": 159.818359375, "completions/min_length": 67.0, "completions/min_terminated_length": 67.0, "epoch": 0.4736, "grad_norm": 0.012563678435981274, "learning_rate": 4.7619047619047623e-07, "loss": 0.0001, "num_tokens": 59330187.0, "reward": 1.0141491889953613, "reward_std": 0.020794115960597992, "rewards/accuracy_reward": 0.2063802033662796, "rewards/brier_reward": 0.8219161629676819, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 1.0, "rewards/mean_confidence_reward": 0.10000000149011612, "step": 74 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 1005.0, "completions/max_terminated_length": 1005.0, "completions/mean_length": 156.5859375, "completions/mean_terminated_length": 156.5859375, "completions/min_length": 68.0, "completions/min_terminated_length": 68.0, "epoch": 0.48, "grad_norm": 0.01223311573266983, "learning_rate": 3.9682539682539683e-07, "loss": -0.0002, "num_tokens": 60094703.0, "reward": 1.0077365636825562, "reward_std": 0.017658300697803497, "rewards/accuracy_reward": 0.142578125, "rewards/brier_reward": 0.8728930354118347, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 1.0, "rewards/mean_confidence_reward": 0.10000000149011612, "step": 75 }, { "epoch": 0.48, "eval_completions/clipped_ratio": 0.0, "eval_completions/max_length": 387.375, "eval_completions/max_terminated_length": 387.375, "eval_completions/mean_length": 160.92337799072266, "eval_completions/mean_terminated_length": 160.92337799072266, "eval_completions/min_length": 80.875, "eval_completions/min_terminated_length": 80.875, "eval_loss": 0.0, "eval_num_tokens": 60094703.0, "eval_reward": 1.0091994851827621, "eval_reward_std": 0.03179385047405958, "eval_rewards/accuracy_reward": 0.1572265625, "eval_rewards/brier_reward": 0.8611703291535378, "eval_rewards/confidence_one_or_zero": 0.0, "eval_rewards/format_reward": 1.0, "eval_rewards/mean_confidence_reward": 0.10000000149011612, "eval_runtime": 38.6187, "eval_samples_per_second": 25.894, "eval_steps_per_second": 0.207, "step": 75 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 626.0, "completions/max_terminated_length": 626.0, "completions/mean_length": 166.603515625, "completions/mean_terminated_length": 166.603515625, "completions/min_length": 72.0, "completions/min_terminated_length": 72.0, "epoch": 0.4864, "grad_norm": 0.016534509137272835, "learning_rate": 3.174603174603175e-07, "loss": 0.0003, "num_tokens": 60874350.0, "reward": 1.009969711303711, "reward_std": 0.01956816576421261, "rewards/accuracy_reward": 0.1712239533662796, "rewards/brier_reward": 0.8493643403053284, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9993489384651184, "rewards/mean_confidence_reward": 0.0999348983168602, "step": 76 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0013020833333333703, "completions/max_length": 3072.0, "completions/max_terminated_length": 2768.0, "completions/mean_length": 172.41537475585938, "completions/mean_terminated_length": 168.6349334716797, "completions/min_length": 72.0, "completions/min_terminated_length": 72.0, "epoch": 0.4928, "grad_norm": 0.017454594373703003, "learning_rate": 2.3809523809523811e-07, "loss": 0.0017, "num_tokens": 61664052.0, "reward": 1.0110359191894531, "reward_std": 0.025640008971095085, "rewards/accuracy_reward": 0.1946614533662796, "rewards/brier_reward": 0.8293614983558655, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.998046875, "rewards/mean_confidence_reward": 0.09980469197034836, "step": 77 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 865.0, "completions/max_terminated_length": 865.0, "completions/mean_length": 160.576171875, "completions/mean_terminated_length": 160.576171875, "completions/min_length": 79.0, "completions/min_terminated_length": 79.0, "epoch": 0.4992, "grad_norm": 0.012094290927052498, "learning_rate": 1.5873015873015874e-07, "loss": 0.0001, "num_tokens": 62439993.0, "reward": 1.0102208852767944, "reward_std": 0.01821950264275074, "rewards/accuracy_reward": 0.1673177033662796, "rewards/brier_reward": 0.8531219363212585, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 1.0, "rewards/mean_confidence_reward": 0.10000000149011612, "step": 78 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 1279.0, "completions/max_terminated_length": 1279.0, "completions/mean_length": 166.828125, "completions/mean_terminated_length": 166.828125, "completions/min_length": 75.0, "completions/min_terminated_length": 75.0, "epoch": 0.5056, "grad_norm": 0.012527219019830227, "learning_rate": 7.936507936507937e-08, "loss": 0.0001, "num_tokens": 63224585.0, "reward": 1.0118589401245117, "reward_std": 0.020548149943351746, "rewards/accuracy_reward": 0.18359375, "rewards/brier_reward": 0.8401217460632324, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 1.0, "rewards/mean_confidence_reward": 0.0999348983168602, "step": 79 }, { "epoch": 0.5056, "step": 79, "total_flos": 0.0, "train_loss": 0.0022363197340497737, "train_runtime": 10851.1654, "train_samples_per_second": 1.382, "train_steps_per_second": 0.007 } ], "logging_steps": 1, "max_steps": 79, "num_input_tokens_seen": 63224585, "num_train_epochs": 1, "save_steps": 60, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 0.0, "train_batch_size": 3, "trial_name": null, "trial_params": null }