Files
olmo2-7b-rlar_g8_b384_math_…/trainer_state.json
ModelHub XC 420363f0b0 初始化项目,由ModelHub XC社区提供模型
Model: gguk2on/olmo2-7b-rlar_g8_b384_math_0.20.08
Source: Original Platform
2026-07-24 20:04:14 +08:00

2292 lines
85 KiB
JSON

{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.5056,
"eval_steps": 15,
"global_step": 79,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001953125,
"completions/max_length": 3072.0,
"completions/max_terminated_length": 2416.0,
"completions/mean_length": 513.2552490234375,
"completions/mean_terminated_length": 508.2478942871094,
"completions/min_length": 115.0,
"completions/min_terminated_length": 115.0,
"epoch": 0.0064,
"grad_norm": 0.12344984710216522,
"learning_rate": 0.0,
"loss": 0.01,
"num_tokens": 1317808.0,
"reward": 0.15714871883392334,
"reward_std": 0.22725586593151093,
"rewards/accuracy_reward": 0.0423177070915699,
"rewards/brier_reward": 0.046699244529008865,
"rewards/confidence_one_or_zero": 0.1634114533662796,
"rewards/format_reward": 0.2252604216337204,
"rewards/mean_confidence_reward": 0.8383918404579163,
"step": 1
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0006510416666666297,
"completions/max_length": 3072.0,
"completions/max_terminated_length": 2762.0,
"completions/mean_length": 510.173828125,
"completions/mean_terminated_length": 508.5048828125,
"completions/min_length": 110.0,
"completions/min_terminated_length": 110.0,
"epoch": 0.0128,
"grad_norm": 0.12667720019817352,
"learning_rate": 3.125e-07,
"loss": 0.0179,
"num_tokens": 2632603.0,
"reward": 0.18118327856063843,
"reward_std": 0.24819880723953247,
"rewards/accuracy_reward": 0.0559895820915699,
"rewards/brier_reward": 0.06026346608996391,
"rewards/confidence_one_or_zero": 0.158203125,
"rewards/format_reward": 0.24609375,
"rewards/mean_confidence_reward": 0.8297531008720398,
"step": 2
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0006510416666666297,
"completions/max_length": 3072.0,
"completions/max_terminated_length": 2454.0,
"completions/mean_length": 522.6185302734375,
"completions/mean_terminated_length": 520.9576416015625,
"completions/min_length": 102.0,
"completions/min_terminated_length": 102.0,
"epoch": 0.0192,
"grad_norm": 0.10833960026502609,
"learning_rate": 6.25e-07,
"loss": 0.0179,
"num_tokens": 3969457.0,
"reward": 0.16414031386375427,
"reward_std": 0.2279990166425705,
"rewards/accuracy_reward": 0.048828125,
"rewards/brier_reward": 0.052869994193315506,
"rewards/confidence_one_or_zero": 0.1653645783662796,
"rewards/format_reward": 0.2265625,
"rewards/mean_confidence_reward": 0.833968460559845,
"step": 3
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0006510416666666297,
"completions/max_length": 3072.0,
"completions/max_terminated_length": 2090.0,
"completions/mean_length": 467.40887451171875,
"completions/mean_terminated_length": 465.7120361328125,
"completions/min_length": 125.0,
"completions/min_terminated_length": 125.0,
"epoch": 0.0256,
"grad_norm": 0.12152963131666183,
"learning_rate": 9.375000000000001e-07,
"loss": 0.0165,
"num_tokens": 5204789.0,
"reward": 0.20207886397838593,
"reward_std": 0.26488131284713745,
"rewards/accuracy_reward": 0.0598958320915699,
"rewards/brier_reward": 0.06494495272636414,
"rewards/confidence_one_or_zero": 0.1595052033662796,
"rewards/format_reward": 0.279296875,
"rewards/mean_confidence_reward": 0.8443619608879089,
"step": 4
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0013020833333333703,
"completions/max_length": 3072.0,
"completions/max_terminated_length": 2473.0,
"completions/mean_length": 485.52215576171875,
"completions/mean_terminated_length": 482.1499328613281,
"completions/min_length": 117.0,
"completions/min_terminated_length": 117.0,
"epoch": 0.032,
"grad_norm": 0.12661050260066986,
"learning_rate": 1.25e-06,
"loss": 0.0176,
"num_tokens": 6478951.0,
"reward": 0.19431988894939423,
"reward_std": 0.25675591826438904,
"rewards/accuracy_reward": 0.0358072929084301,
"rewards/brier_reward": 0.04421881213784218,
"rewards/confidence_one_or_zero": 0.1458333283662796,
"rewards/format_reward": 0.30859375,
"rewards/mean_confidence_reward": 0.8485057950019836,
"step": 5
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001953125,
"completions/max_length": 3072.0,
"completions/max_terminated_length": 2745.0,
"completions/mean_length": 464.67254638671875,
"completions/mean_terminated_length": 459.57012939453125,
"completions/min_length": 128.0,
"completions/min_terminated_length": 128.0,
"epoch": 0.0384,
"grad_norm": 0.13682091236114502,
"learning_rate": 1.5625e-06,
"loss": 0.0277,
"num_tokens": 7722968.0,
"reward": 0.35016554594039917,
"reward_std": 0.32608699798583984,
"rewards/accuracy_reward": 0.095703125,
"rewards/brier_reward": 0.10200395435094833,
"rewards/confidence_one_or_zero": 0.1067708358168602,
"rewards/format_reward": 0.5026041865348816,
"rewards/mean_confidence_reward": 0.8821424841880798,
"step": 6
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0013020833333333703,
"completions/max_length": 3072.0,
"completions/max_terminated_length": 2730.0,
"completions/mean_length": 396.37762451171875,
"completions/mean_terminated_length": 392.88916015625,
"completions/min_length": 119.0,
"completions/min_terminated_length": 119.0,
"epoch": 0.0448,
"grad_norm": 0.10670524835586548,
"learning_rate": 1.8750000000000003e-06,
"loss": 0.0209,
"num_tokens": 8863532.0,
"reward": 0.5172501802444458,
"reward_std": 0.3278539180755615,
"rewards/accuracy_reward": 0.1360677033662796,
"rewards/brier_reward": 0.1536215990781784,
"rewards/confidence_one_or_zero": 0.0514322929084301,
"rewards/format_reward": 0.7447916865348816,
"rewards/mean_confidence_reward": 0.9148001670837402,
"step": 7
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0006510416666666297,
"completions/max_length": 3072.0,
"completions/max_terminated_length": 2176.0,
"completions/mean_length": 356.41864013671875,
"completions/mean_terminated_length": 354.6495056152344,
"completions/min_length": 102.0,
"completions/min_terminated_length": 102.0,
"epoch": 0.0512,
"grad_norm": 0.09465499222278595,
"learning_rate": 2.1875000000000002e-06,
"loss": 0.0149,
"num_tokens": 9935503.0,
"reward": 0.5450800061225891,
"reward_std": 0.26621514558792114,
"rewards/accuracy_reward": 0.1204427108168602,
"rewards/brier_reward": 0.13245756924152374,
"rewards/confidence_one_or_zero": 0.0690104141831398,
"rewards/format_reward": 0.8372395634651184,
"rewards/mean_confidence_reward": 0.9360446333885193,
"step": 8
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1098.0,
"completions/max_terminated_length": 1098.0,
"completions/mean_length": 295.6829528808594,
"completions/mean_terminated_length": 295.6829528808594,
"completions/min_length": 106.0,
"completions/min_terminated_length": 106.0,
"epoch": 0.0576,
"grad_norm": 0.09623412042856216,
"learning_rate": 2.5e-06,
"loss": 0.0043,
"num_tokens": 10922848.0,
"reward": 0.6380816698074341,
"reward_std": 0.25275611877441406,
"rewards/accuracy_reward": 0.15234375,
"rewards/brier_reward": 0.17132478952407837,
"rewards/confidence_one_or_zero": 0.0924479141831398,
"rewards/format_reward": 0.9524739384651184,
"rewards/mean_confidence_reward": 0.9462093710899353,
"step": 9
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1492.0,
"completions/max_terminated_length": 1492.0,
"completions/mean_length": 263.1224060058594,
"completions/mean_terminated_length": 263.1224060058594,
"completions/min_length": 100.0,
"completions/min_terminated_length": 100.0,
"epoch": 0.064,
"grad_norm": 0.12087129801511765,
"learning_rate": 2.8125e-06,
"loss": 0.002,
"num_tokens": 11863412.0,
"reward": 0.6714729070663452,
"reward_std": 0.25721341371536255,
"rewards/accuracy_reward": 0.1783854216337204,
"rewards/brier_reward": 0.20229984819889069,
"rewards/confidence_one_or_zero": 0.1041666641831398,
"rewards/format_reward": 0.9622395634651184,
"rewards/mean_confidence_reward": 0.9416966438293457,
"step": 10
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0006510416666666297,
"completions/max_length": 3072.0,
"completions/max_terminated_length": 1570.0,
"completions/mean_length": 244.3033905029297,
"completions/mean_terminated_length": 242.4612274169922,
"completions/min_length": 88.0,
"completions/min_terminated_length": 88.0,
"epoch": 0.0704,
"grad_norm": 0.10842401534318924,
"learning_rate": 3.125e-06,
"loss": 0.0018,
"num_tokens": 12766990.0,
"reward": 0.6708444356918335,
"reward_std": 0.22578249871730804,
"rewards/accuracy_reward": 0.150390625,
"rewards/brier_reward": 0.21341417729854584,
"rewards/confidence_one_or_zero": 0.0481770820915699,
"rewards/format_reward": 0.9778645634651184,
"rewards/mean_confidence_reward": 0.9204818606376648,
"step": 11
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 985.0,
"completions/max_terminated_length": 985.0,
"completions/mean_length": 220.8854217529297,
"completions/mean_terminated_length": 220.8854217529297,
"completions/min_length": 92.0,
"completions/min_terminated_length": 92.0,
"epoch": 0.0768,
"grad_norm": 0.10331228375434875,
"learning_rate": 3.4375e-06,
"loss": -0.0007,
"num_tokens": 13629054.0,
"reward": 0.6898407340049744,
"reward_std": 0.19564443826675415,
"rewards/accuracy_reward": 0.1263020783662796,
"rewards/brier_reward": 0.2585696280002594,
"rewards/confidence_one_or_zero": 0.01627604104578495,
"rewards/format_reward": 0.9947916865348816,
"rewards/mean_confidence_reward": 0.8836035132408142,
"step": 12
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 816.0,
"completions/max_terminated_length": 816.0,
"completions/mean_length": 187.1217498779297,
"completions/mean_terminated_length": 187.1217498779297,
"completions/min_length": 70.0,
"completions/min_terminated_length": 70.0,
"epoch": 0.0832,
"grad_norm": 0.10918660461902618,
"learning_rate": 3.7500000000000005e-06,
"loss": -0.0008,
"num_tokens": 14442001.0,
"reward": 0.7865655422210693,
"reward_std": 0.20179037749767303,
"rewards/accuracy_reward": 0.1595052033662796,
"rewards/brier_reward": 0.4233756959438324,
"rewards/confidence_one_or_zero": 0.001953125,
"rewards/format_reward": 0.990234375,
"rewards/mean_confidence_reward": 0.7851627469062805,
"step": 13
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1251.0,
"completions/max_terminated_length": 1251.0,
"completions/mean_length": 168.841796875,
"completions/mean_terminated_length": 168.841796875,
"completions/min_length": 72.0,
"completions/min_terminated_length": 72.0,
"epoch": 0.0896,
"grad_norm": 0.09542427211999893,
"learning_rate": 4.0625000000000005e-06,
"loss": 0.0011,
"num_tokens": 15228654.0,
"reward": 0.8784071803092957,
"reward_std": 0.18350529670715332,
"rewards/accuracy_reward": 0.201171875,
"rewards/brier_reward": 0.556279718875885,
"rewards/confidence_one_or_zero": 0.0013020833721384406,
"rewards/format_reward": 0.9993489384651184,
"rewards/mean_confidence_reward": 0.6912760734558105,
"step": 14
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 634.0,
"completions/max_terminated_length": 634.0,
"completions/mean_length": 163.0299530029297,
"completions/mean_terminated_length": 163.0299530029297,
"completions/min_length": 71.0,
"completions/min_terminated_length": 71.0,
"epoch": 0.096,
"grad_norm": 0.07958308607339859,
"learning_rate": 4.3750000000000005e-06,
"loss": -0.0005,
"num_tokens": 16013868.0,
"reward": 0.8841292858123779,
"reward_std": 0.1378345489501953,
"rewards/accuracy_reward": 0.154296875,
"rewards/brier_reward": 0.6139492988586426,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 1.0,
"rewards/mean_confidence_reward": 0.619335949420929,
"step": 15
},
{
"epoch": 0.096,
"eval_completions/clipped_ratio": 0.0,
"eval_completions/max_length": 384.125,
"eval_completions/max_terminated_length": 384.125,
"eval_completions/mean_length": 155.9650707244873,
"eval_completions/mean_terminated_length": 155.9650707244873,
"eval_completions/min_length": 74.625,
"eval_completions/min_terminated_length": 74.625,
"eval_loss": 0.0,
"eval_num_tokens": 16013868.0,
"eval_reward": 0.9124990850687027,
"eval_reward_std": 0.19061542302370071,
"eval_rewards/accuracy_reward": 0.1572265625,
"eval_rewards/brier_reward": 0.6687369048595428,
"eval_rewards/confidence_one_or_zero": 0.0,
"eval_rewards/format_reward": 0.9990234375,
"eval_rewards/mean_confidence_reward": 0.5639648586511612,
"eval_runtime": 38.1652,
"eval_samples_per_second": 26.202,
"eval_steps_per_second": 0.21,
"step": 15
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1351.0,
"completions/max_terminated_length": 1351.0,
"completions/mean_length": 160.1822967529297,
"completions/mean_terminated_length": 160.1822967529297,
"completions/min_length": 69.0,
"completions/min_terminated_length": 69.0,
"epoch": 0.1024,
"grad_norm": 0.08845788240432739,
"learning_rate": 4.6875000000000004e-06,
"loss": 0.0004,
"num_tokens": 16794684.0,
"reward": 0.9343183040618896,
"reward_std": 0.15499888360500336,
"rewards/accuracy_reward": 0.1940104216337204,
"rewards/brier_reward": 0.6746149063110352,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 1.0,
"rewards/mean_confidence_reward": 0.5623372197151184,
"step": 16
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0006510416666666297,
"completions/max_length": 3072.0,
"completions/max_terminated_length": 1057.0,
"completions/mean_length": 159.93685913085938,
"completions/mean_terminated_length": 158.03973388671875,
"completions/min_length": 68.0,
"completions/min_terminated_length": 68.0,
"epoch": 0.1088,
"grad_norm": 0.0767010897397995,
"learning_rate": 5e-06,
"loss": 0.001,
"num_tokens": 17572547.0,
"reward": 0.9644677042961121,
"reward_std": 0.12373493611812592,
"rewards/accuracy_reward": 0.1634114533662796,
"rewards/brier_reward": 0.7668177485466003,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9986979365348816,
"rewards/mean_confidence_reward": 0.4108072817325592,
"step": 17
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1150.0,
"completions/max_terminated_length": 1150.0,
"completions/mean_length": 151.41146850585938,
"completions/mean_terminated_length": 151.41146850585938,
"completions/min_length": 68.0,
"completions/min_terminated_length": 68.0,
"epoch": 0.1152,
"grad_norm": 0.03405171260237694,
"learning_rate": 4.920634920634921e-06,
"loss": 0.0002,
"num_tokens": 18328587.0,
"reward": 0.9970012903213501,
"reward_std": 0.053423922508955,
"rewards/accuracy_reward": 0.1302083283662796,
"rewards/brier_reward": 0.8637895584106445,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 1.0,
"rewards/mean_confidence_reward": 0.23268230259418488,
"step": 18
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0006510416666666297,
"completions/max_length": 3072.0,
"completions/max_terminated_length": 841.0,
"completions/mean_length": 145.88607788085938,
"completions/mean_terminated_length": 143.97979736328125,
"completions/min_length": 67.0,
"completions/min_terminated_length": 67.0,
"epoch": 0.1216,
"grad_norm": 0.08672156929969788,
"learning_rate": 4.841269841269842e-06,
"loss": 0.0013,
"num_tokens": 19081420.0,
"reward": 0.9989738464355469,
"reward_std": 0.05453099310398102,
"rewards/accuracy_reward": 0.15625,
"rewards/brier_reward": 0.8501570224761963,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9915364384651184,
"rewards/mean_confidence_reward": 0.20839844644069672,
"step": 19
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1103.0,
"completions/max_terminated_length": 1103.0,
"completions/mean_length": 145.33920288085938,
"completions/mean_terminated_length": 145.33920288085938,
"completions/min_length": 69.0,
"completions/min_terminated_length": 69.0,
"epoch": 0.128,
"grad_norm": 0.034685149788856506,
"learning_rate": 4.761904761904762e-06,
"loss": -0.0005,
"num_tokens": 19830421.0,
"reward": 1.0009196996688843,
"reward_std": 0.05048990249633789,
"rewards/accuracy_reward": 0.142578125,
"rewards/brier_reward": 0.8605591654777527,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9986979365348816,
"rewards/mean_confidence_reward": 0.20696616172790527,
"step": 20
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1499.0,
"completions/max_terminated_length": 1499.0,
"completions/mean_length": 144.0006561279297,
"completions/mean_terminated_length": 144.0006561279297,
"completions/min_length": 68.0,
"completions/min_terminated_length": 68.0,
"epoch": 0.1344,
"grad_norm": 0.042840614914894104,
"learning_rate": 4.682539682539683e-06,
"loss": 0.001,
"num_tokens": 20580302.0,
"reward": 0.998023271560669,
"reward_std": 0.04786913841962814,
"rewards/accuracy_reward": 0.12890625,
"rewards/brier_reward": 0.8690893054008484,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.998046875,
"rewards/mean_confidence_reward": 0.20286458730697632,
"step": 21
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0006510416666666297,
"completions/max_length": 3072.0,
"completions/max_terminated_length": 3034.0,
"completions/mean_length": 135.8444061279297,
"completions/mean_terminated_length": 133.9315948486328,
"completions/min_length": 63.0,
"completions/min_terminated_length": 63.0,
"epoch": 0.1408,
"grad_norm": 0.022160449996590614,
"learning_rate": 4.603174603174604e-06,
"loss": 0.0023,
"num_tokens": 21312767.0,
"reward": 1.0035309791564941,
"reward_std": 0.02395722270011902,
"rewards/accuracy_reward": 0.1263020783662796,
"rewards/brier_reward": 0.8820595741271973,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9986979365348816,
"rewards/mean_confidence_reward": 0.11113282293081284,
"step": 22
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0006510416666666297,
"completions/max_length": 3072.0,
"completions/max_terminated_length": 1028.0,
"completions/mean_length": 132.736328125,
"completions/mean_terminated_length": 130.82150268554688,
"completions/min_length": 62.0,
"completions/min_terminated_length": 62.0,
"epoch": 0.1472,
"grad_norm": 0.022671813145279884,
"learning_rate": 4.523809523809524e-06,
"loss": 0.0007,
"num_tokens": 22051386.0,
"reward": 1.0043648481369019,
"reward_std": 0.023137887939810753,
"rewards/accuracy_reward": 0.125,
"rewards/brier_reward": 0.8850294947624207,
"rewards/confidence_one_or_zero": 0.0013020833721384406,
"rewards/format_reward": 0.9986979365348816,
"rewards/mean_confidence_reward": 0.10445964336395264,
"step": 23
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0006510416666666297,
"completions/max_length": 3072.0,
"completions/max_terminated_length": 509.0,
"completions/mean_length": 123.994140625,
"completions/mean_terminated_length": 122.07361602783203,
"completions/min_length": 60.0,
"completions/min_terminated_length": 60.0,
"epoch": 0.1536,
"grad_norm": 0.017817093059420586,
"learning_rate": 4.444444444444444e-06,
"loss": 0.001,
"num_tokens": 22767641.0,
"reward": 1.0062859058380127,
"reward_std": 0.02213597297668457,
"rewards/accuracy_reward": 0.134765625,
"rewards/brier_reward": 0.8784549832344055,
"rewards/confidence_one_or_zero": 0.0078125,
"rewards/format_reward": 0.9993489384651184,
"rewards/mean_confidence_reward": 0.09915366023778915,
"step": 24
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0006510416666666297,
"completions/max_length": 3072.0,
"completions/max_terminated_length": 2469.0,
"completions/mean_length": 124.962890625,
"completions/mean_terminated_length": 123.0429916381836,
"completions/min_length": 58.0,
"completions/min_terminated_length": 58.0,
"epoch": 0.16,
"grad_norm": 0.028992217034101486,
"learning_rate": 4.365079365079366e-06,
"loss": 0.0021,
"num_tokens": 23481328.0,
"reward": 1.0054970979690552,
"reward_std": 0.024515468627214432,
"rewards/accuracy_reward": 0.1510416716337204,
"rewards/brier_reward": 0.8625543713569641,
"rewards/confidence_one_or_zero": 0.02213541604578495,
"rewards/format_reward": 0.9973958134651184,
"rewards/mean_confidence_reward": 0.08613282442092896,
"step": 25
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 537.0,
"completions/max_terminated_length": 537.0,
"completions/mean_length": 114.57096862792969,
"completions/mean_terminated_length": 114.57096862792969,
"completions/min_length": 64.0,
"completions/min_terminated_length": 64.0,
"epoch": 0.1664,
"grad_norm": 0.01552383042871952,
"learning_rate": 4.2857142857142855e-06,
"loss": 0.0001,
"num_tokens": 24187461.0,
"reward": 1.0057644844055176,
"reward_std": 0.015629516914486885,
"rewards/accuracy_reward": 0.125,
"rewards/brier_reward": 0.8865270614624023,
"rewards/confidence_one_or_zero": 0.012369791977107525,
"rewards/format_reward": 1.0,
"rewards/mean_confidence_reward": 0.0858854278922081,
"step": 26
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 647.0,
"completions/max_terminated_length": 647.0,
"completions/mean_length": 109.59700775146484,
"completions/mean_terminated_length": 109.59700775146484,
"completions/min_length": 61.0,
"completions/min_terminated_length": 61.0,
"epoch": 0.1728,
"grad_norm": 0.014046880416572094,
"learning_rate": 4.206349206349207e-06,
"loss": 0.0,
"num_tokens": 24876258.0,
"reward": 1.0062367916107178,
"reward_std": 0.015971940010786057,
"rewards/accuracy_reward": 0.1302083283662796,
"rewards/brier_reward": 0.8822630047798157,
"rewards/confidence_one_or_zero": 0.009114583022892475,
"rewards/format_reward": 1.0,
"rewards/mean_confidence_reward": 0.09052734822034836,
"step": 27
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 364.0,
"completions/max_terminated_length": 364.0,
"completions/mean_length": 110.931640625,
"completions/mean_terminated_length": 110.931640625,
"completions/min_length": 55.0,
"completions/min_terminated_length": 55.0,
"epoch": 0.1792,
"grad_norm": 0.015721678733825684,
"learning_rate": 4.126984126984127e-06,
"loss": 0.0001,
"num_tokens": 25573121.0,
"reward": 1.0073223114013672,
"reward_std": 0.016928067430853844,
"rewards/accuracy_reward": 0.1412760466337204,
"rewards/brier_reward": 0.8733661770820618,
"rewards/confidence_one_or_zero": 0.011067708022892475,
"rewards/format_reward": 1.0,
"rewards/mean_confidence_reward": 0.09393229335546494,
"step": 28
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 448.0,
"completions/max_terminated_length": 448.0,
"completions/mean_length": 105.548828125,
"completions/mean_terminated_length": 105.548828125,
"completions/min_length": 56.0,
"completions/min_terminated_length": 56.0,
"epoch": 0.1856,
"grad_norm": 0.015512680634856224,
"learning_rate": 4.047619047619048e-06,
"loss": 0.0002,
"num_tokens": 26255276.0,
"reward": 1.0070064067840576,
"reward_std": 0.015547393821179867,
"rewards/accuracy_reward": 0.1380208283662796,
"rewards/brier_reward": 0.8759898543357849,
"rewards/confidence_one_or_zero": 0.013671875,
"rewards/format_reward": 1.0,
"rewards/mean_confidence_reward": 0.09619140625,
"step": 29
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0006510416666666297,
"completions/max_length": 3072.0,
"completions/max_terminated_length": 642.0,
"completions/mean_length": 106.47982025146484,
"completions/mean_terminated_length": 104.54788208007812,
"completions/min_length": 55.0,
"completions/min_terminated_length": 55.0,
"epoch": 0.192,
"grad_norm": 0.016842655837535858,
"learning_rate": 3.968253968253968e-06,
"loss": 0.001,
"num_tokens": 26942069.0,
"reward": 1.0057001113891602,
"reward_std": 0.017063049599528313,
"rewards/accuracy_reward": 0.130859375,
"rewards/brier_reward": 0.8811895251274109,
"rewards/confidence_one_or_zero": 0.009765625,
"rewards/format_reward": 0.9993489384651184,
"rewards/mean_confidence_reward": 0.09785156697034836,
"step": 30
},
{
"epoch": 0.192,
"eval_completions/clipped_ratio": 0.0,
"eval_completions/max_length": 245.25,
"eval_completions/max_terminated_length": 245.25,
"eval_completions/mean_length": 103.35231399536133,
"eval_completions/mean_terminated_length": 103.35231399536133,
"eval_completions/min_length": 61.625,
"eval_completions/min_terminated_length": 61.625,
"eval_loss": 0.0,
"eval_num_tokens": 26942069.0,
"eval_reward": 1.0069686025381088,
"eval_reward_std": 0.028366195736452937,
"eval_rewards/accuracy_reward": 0.1376953125,
"eval_rewards/brier_reward": 0.8762396723031998,
"eval_rewards/confidence_one_or_zero": 0.005859375,
"eval_rewards/format_reward": 1.0,
"eval_rewards/mean_confidence_reward": 0.09887695498764515,
"eval_runtime": 25.7359,
"eval_samples_per_second": 38.856,
"eval_steps_per_second": 0.311,
"step": 30
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 317.0,
"completions/max_terminated_length": 317.0,
"completions/mean_length": 104.23112487792969,
"completions/mean_terminated_length": 104.23112487792969,
"completions/min_length": 57.0,
"completions/min_terminated_length": 57.0,
"epoch": 0.1984,
"grad_norm": 0.014870710670948029,
"learning_rate": 3.88888888888889e-06,
"loss": 0.0,
"num_tokens": 27632456.0,
"reward": 1.0063118934631348,
"reward_std": 0.014838973991572857,
"rewards/accuracy_reward": 0.1302083283662796,
"rewards/brier_reward": 0.8824132084846497,
"rewards/confidence_one_or_zero": 0.01171875,
"rewards/format_reward": 1.0,
"rewards/mean_confidence_reward": 0.09840494394302368,
"step": 31
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 541.0,
"completions/max_terminated_length": 541.0,
"completions/mean_length": 100.26432800292969,
"completions/mean_terminated_length": 100.26432800292969,
"completions/min_length": 56.0,
"completions/min_terminated_length": 56.0,
"epoch": 0.2048,
"grad_norm": 0.01399635523557663,
"learning_rate": 3.80952380952381e-06,
"loss": 0.0001,
"num_tokens": 28308662.0,
"reward": 1.0071120262145996,
"reward_std": 0.015049047768115997,
"rewards/accuracy_reward": 0.1380208283662796,
"rewards/brier_reward": 0.8762008547782898,
"rewards/confidence_one_or_zero": 0.0065104165114462376,
"rewards/format_reward": 1.0,
"rewards/mean_confidence_reward": 0.09908854961395264,
"step": 32
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 408.0,
"completions/max_terminated_length": 408.0,
"completions/mean_length": 99.68229675292969,
"completions/mean_terminated_length": 99.68229675292969,
"completions/min_length": 58.0,
"completions/min_terminated_length": 58.0,
"epoch": 0.2112,
"grad_norm": 0.01481532584875822,
"learning_rate": 3.7301587301587305e-06,
"loss": -0.0003,
"num_tokens": 28986438.0,
"reward": 1.0082613229751587,
"reward_std": 0.016647430136799812,
"rewards/accuracy_reward": 0.1484375,
"rewards/brier_reward": 0.8680830001831055,
"rewards/confidence_one_or_zero": 0.0013020833721384406,
"rewards/format_reward": 1.0,
"rewards/mean_confidence_reward": 0.0994466170668602,
"step": 33
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 509.0,
"completions/max_terminated_length": 509.0,
"completions/mean_length": 101.26692962646484,
"completions/mean_terminated_length": 101.26692962646484,
"completions/min_length": 53.0,
"completions/min_terminated_length": 53.0,
"epoch": 0.2176,
"grad_norm": 0.015680309385061264,
"learning_rate": 3.6507936507936507e-06,
"loss": 0.0001,
"num_tokens": 29666136.0,
"reward": 1.0082824230194092,
"reward_std": 0.016683388501405716,
"rewards/accuracy_reward": 0.1484375,
"rewards/brier_reward": 0.8681252598762512,
"rewards/confidence_one_or_zero": 0.0013020833721384406,
"rewards/format_reward": 1.0,
"rewards/mean_confidence_reward": 0.099609375,
"step": 34
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 787.0,
"completions/max_terminated_length": 787.0,
"completions/mean_length": 101.74609375,
"completions/mean_terminated_length": 101.74609375,
"completions/min_length": 53.0,
"completions/min_terminated_length": 53.0,
"epoch": 0.224,
"grad_norm": 0.013283529318869114,
"learning_rate": 3.5714285714285718e-06,
"loss": -0.0001,
"num_tokens": 30350298.0,
"reward": 1.008887529373169,
"reward_std": 0.015015891753137112,
"rewards/accuracy_reward": 0.1549479216337204,
"rewards/brier_reward": 0.8628246784210205,
"rewards/confidence_one_or_zero": 0.00390625,
"rewards/format_reward": 1.0,
"rewards/mean_confidence_reward": 0.09957683086395264,
"step": 35
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 379.0,
"completions/max_terminated_length": 379.0,
"completions/mean_length": 106.22982025146484,
"completions/mean_terminated_length": 106.22982025146484,
"completions/min_length": 60.0,
"completions/min_terminated_length": 60.0,
"epoch": 0.2304,
"grad_norm": 0.01649440824985504,
"learning_rate": 3.492063492063492e-06,
"loss": 0.0002,
"num_tokens": 31042851.0,
"reward": 1.0087370872497559,
"reward_std": 0.017726846039295197,
"rewards/accuracy_reward": 0.1536458283662796,
"rewards/brier_reward": 0.8638262748718262,
"rewards/confidence_one_or_zero": 0.0026041667442768812,
"rewards/format_reward": 1.0,
"rewards/mean_confidence_reward": 0.09967448562383652,
"step": 36
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 353.0,
"completions/max_terminated_length": 353.0,
"completions/mean_length": 103.544921875,
"completions/mean_terminated_length": 103.544921875,
"completions/min_length": 56.0,
"completions/min_terminated_length": 56.0,
"epoch": 0.2368,
"grad_norm": 0.013323284685611725,
"learning_rate": 3.412698412698413e-06,
"loss": -0.0002,
"num_tokens": 31727320.0,
"reward": 1.0050444602966309,
"reward_std": 0.014493642374873161,
"rewards/accuracy_reward": 0.1165364608168602,
"rewards/brier_reward": 0.8935502171516418,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 1.0,
"rewards/mean_confidence_reward": 0.09986979514360428,
"step": 37
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 373.0,
"completions/max_terminated_length": 373.0,
"completions/mean_length": 104.083984375,
"completions/mean_terminated_length": 104.083984375,
"completions/min_length": 58.0,
"completions/min_terminated_length": 58.0,
"epoch": 0.2432,
"grad_norm": 0.013464462012052536,
"learning_rate": 3.3333333333333333e-06,
"loss": 0.0,
"num_tokens": 32414529.0,
"reward": 1.007368564605713,
"reward_std": 0.015527362935245037,
"rewards/accuracy_reward": 0.1399739533662796,
"rewards/brier_reward": 0.8747609257698059,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 1.0,
"rewards/mean_confidence_reward": 0.10000000149011612,
"step": 38
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 382.0,
"completions/max_terminated_length": 382.0,
"completions/mean_length": 105.11067962646484,
"completions/mean_terminated_length": 105.11067962646484,
"completions/min_length": 60.0,
"completions/min_terminated_length": 60.0,
"epoch": 0.2496,
"grad_norm": 0.013883170671761036,
"learning_rate": 3.2539682539682544e-06,
"loss": -0.0001,
"num_tokens": 33100043.0,
"reward": 1.0090630054473877,
"reward_std": 0.01718251407146454,
"rewards/accuracy_reward": 0.1569010466337204,
"rewards/brier_reward": 0.8612225651741028,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 1.0,
"rewards/mean_confidence_reward": 0.09996744990348816,
"step": 39
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0006510416666666297,
"completions/max_length": 3072.0,
"completions/max_terminated_length": 283.0,
"completions/mean_length": 109.57878112792969,
"completions/mean_terminated_length": 107.64885711669922,
"completions/min_length": 54.0,
"completions/min_terminated_length": 54.0,
"epoch": 0.256,
"grad_norm": 0.015643145889043808,
"learning_rate": 3.1746031746031746e-06,
"loss": 0.001,
"num_tokens": 33797732.0,
"reward": 1.0077626705169678,
"reward_std": 0.01909930817782879,
"rewards/accuracy_reward": 0.150390625,
"rewards/brier_reward": 0.8657833933830261,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9993489384651184,
"rewards/mean_confidence_reward": 0.0999348983168602,
"step": 40
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 298.0,
"completions/max_terminated_length": 298.0,
"completions/mean_length": 109.97721862792969,
"completions/mean_terminated_length": 109.97721862792969,
"completions/min_length": 58.0,
"completions/min_terminated_length": 58.0,
"epoch": 0.2624,
"grad_norm": 0.013753971084952354,
"learning_rate": 3.0952380952380957e-06,
"loss": -0.0001,
"num_tokens": 34492753.0,
"reward": 1.0086588859558105,
"reward_std": 0.017423056066036224,
"rewards/accuracy_reward": 0.1529947966337204,
"rewards/brier_reward": 0.8643207550048828,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 1.0,
"rewards/mean_confidence_reward": 0.09996744990348816,
"step": 41
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 309.0,
"completions/max_terminated_length": 309.0,
"completions/mean_length": 113.9140625,
"completions/mean_terminated_length": 113.9140625,
"completions/min_length": 61.0,
"completions/min_terminated_length": 61.0,
"epoch": 0.2688,
"grad_norm": 0.015711113810539246,
"learning_rate": 3.015873015873016e-06,
"loss": 0.0001,
"num_tokens": 35194653.0,
"reward": 1.007615566253662,
"reward_std": 0.01719771698117256,
"rewards/accuracy_reward": 0.1490885466337204,
"rewards/brier_reward": 0.8667915463447571,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9993489384651184,
"rewards/mean_confidence_reward": 0.09996744990348816,
"step": 42
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 321.0,
"completions/max_terminated_length": 321.0,
"completions/mean_length": 113.828125,
"completions/mean_terminated_length": 113.828125,
"completions/min_length": 61.0,
"completions/min_terminated_length": 61.0,
"epoch": 0.2752,
"grad_norm": 0.013382576406002045,
"learning_rate": 2.936507936507937e-06,
"loss": -0.0001,
"num_tokens": 35896901.0,
"reward": 1.0079677104949951,
"reward_std": 0.01691964827477932,
"rewards/accuracy_reward": 0.1458333283662796,
"rewards/brier_reward": 0.8700999617576599,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 1.0,
"rewards/mean_confidence_reward": 0.09996744990348816,
"step": 43
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1730.0,
"completions/max_terminated_length": 1730.0,
"completions/mean_length": 116.564453125,
"completions/mean_terminated_length": 116.564453125,
"completions/min_length": 61.0,
"completions/min_terminated_length": 61.0,
"epoch": 0.2816,
"grad_norm": 0.013394894078373909,
"learning_rate": 2.8571428571428573e-06,
"loss": -0.0001,
"num_tokens": 36602840.0,
"reward": 1.0099449157714844,
"reward_std": 0.017746133729815483,
"rewards/accuracy_reward": 0.1653645783662796,
"rewards/brier_reward": 0.8545230031013489,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 1.0,
"rewards/mean_confidence_reward": 0.0999348983168602,
"step": 44
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 637.0,
"completions/max_terminated_length": 637.0,
"completions/mean_length": 116.49739837646484,
"completions/mean_terminated_length": 116.49739837646484,
"completions/min_length": 65.0,
"completions/min_terminated_length": 65.0,
"epoch": 0.288,
"grad_norm": 0.013630064204335213,
"learning_rate": 2.7777777777777783e-06,
"loss": -0.0001,
"num_tokens": 37307116.0,
"reward": 1.0092854499816895,
"reward_std": 0.015556964091956615,
"rewards/accuracy_reward": 0.1588541716337204,
"rewards/brier_reward": 0.8597145080566406,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 1.0,
"rewards/mean_confidence_reward": 0.09996744990348816,
"step": 45
},
{
"epoch": 0.288,
"eval_completions/clipped_ratio": 0.0,
"eval_completions/max_length": 286.625,
"eval_completions/max_terminated_length": 286.625,
"eval_completions/mean_length": 117.99481678009033,
"eval_completions/mean_terminated_length": 117.99481678009033,
"eval_completions/min_length": 67.875,
"eval_completions/min_terminated_length": 67.875,
"eval_loss": 0.0,
"eval_num_tokens": 37307116.0,
"eval_reward": 1.009708896279335,
"eval_reward_std": 0.031475587747991085,
"eval_rewards/accuracy_reward": 0.1630859375,
"eval_rewards/brier_reward": 0.8563297092914581,
"eval_rewards/confidence_one_or_zero": 0.0,
"eval_rewards/format_reward": 1.0,
"eval_rewards/mean_confidence_reward": 0.10000000149011612,
"eval_runtime": 29.1609,
"eval_samples_per_second": 34.292,
"eval_steps_per_second": 0.274,
"step": 45
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 610.0,
"completions/max_terminated_length": 610.0,
"completions/mean_length": 124.873046875,
"completions/mean_terminated_length": 124.873046875,
"completions/min_length": 59.0,
"completions/min_terminated_length": 59.0,
"epoch": 0.2944,
"grad_norm": 0.012923919595777988,
"learning_rate": 2.6984126984126986e-06,
"loss": 0.0001,
"num_tokens": 38030889.0,
"reward": 1.0079009532928467,
"reward_std": 0.016820697113871574,
"rewards/accuracy_reward": 0.1451822966337204,
"rewards/brier_reward": 0.8706175684928894,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 1.0,
"rewards/mean_confidence_reward": 0.10000000149011612,
"step": 46
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 390.0,
"completions/max_terminated_length": 390.0,
"completions/mean_length": 121.28841400146484,
"completions/mean_terminated_length": 121.28841400146484,
"completions/min_length": 65.0,
"completions/min_terminated_length": 65.0,
"epoch": 0.3008,
"grad_norm": 0.013293150812387466,
"learning_rate": 2.6190476190476192e-06,
"loss": -0.0002,
"num_tokens": 38745516.0,
"reward": 1.0075379610061646,
"reward_std": 0.01851985976099968,
"rewards/accuracy_reward": 0.1412760466337204,
"rewards/brier_reward": 0.8737977147102356,
"rewards/confidence_one_or_zero": 0.0006510416860692203,
"rewards/format_reward": 1.0,
"rewards/mean_confidence_reward": 0.0999348983168602,
"step": 47
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 386.0,
"completions/max_terminated_length": 386.0,
"completions/mean_length": 123.53190612792969,
"completions/mean_terminated_length": 123.53190612792969,
"completions/min_length": 62.0,
"completions/min_terminated_length": 62.0,
"epoch": 0.3072,
"grad_norm": 0.013963259756565094,
"learning_rate": 2.53968253968254e-06,
"loss": -0.0003,
"num_tokens": 39469541.0,
"reward": 1.0120104551315308,
"reward_std": 0.017670420929789543,
"rewards/accuracy_reward": 0.185546875,
"rewards/brier_reward": 0.8384718894958496,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 1.0,
"rewards/mean_confidence_reward": 0.10000000149011612,
"step": 48
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 489.0,
"completions/max_terminated_length": 489.0,
"completions/mean_length": 130.68359375,
"completions/mean_terminated_length": 130.68359375,
"completions/min_length": 65.0,
"completions/min_terminated_length": 65.0,
"epoch": 0.3136,
"grad_norm": 0.012982644140720367,
"learning_rate": 2.4603174603174605e-06,
"loss": -0.0002,
"num_tokens": 40200887.0,
"reward": 1.0091040134429932,
"reward_std": 0.01862485706806183,
"rewards/accuracy_reward": 0.1569010466337204,
"rewards/brier_reward": 0.861304759979248,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 1.0,
"rewards/mean_confidence_reward": 0.10000000149011612,
"step": 49
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 549.0,
"completions/max_terminated_length": 549.0,
"completions/mean_length": 135.779296875,
"completions/mean_terminated_length": 135.779296875,
"completions/min_length": 65.0,
"completions/min_terminated_length": 65.0,
"epoch": 0.32,
"grad_norm": 0.013592319563031197,
"learning_rate": 2.380952380952381e-06,
"loss": 0.0001,
"num_tokens": 40935556.0,
"reward": 1.0103710889816284,
"reward_std": 0.01916532590985298,
"rewards/accuracy_reward": 0.1692708283662796,
"rewards/brier_reward": 0.8514692187309265,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 1.0,
"rewards/mean_confidence_reward": 0.09996744990348816,
"step": 50
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 384.0,
"completions/max_terminated_length": 384.0,
"completions/mean_length": 132.740234375,
"completions/mean_terminated_length": 132.740234375,
"completions/min_length": 64.0,
"completions/min_terminated_length": 64.0,
"epoch": 0.3264,
"grad_norm": 0.014143792912364006,
"learning_rate": 2.301587301587302e-06,
"loss": 0.0,
"num_tokens": 41663701.0,
"reward": 1.0106953382492065,
"reward_std": 0.018670808523893356,
"rewards/accuracy_reward": 0.1725260466337204,
"rewards/brier_reward": 0.8488624691963196,
"rewards/confidence_one_or_zero": 0.0006510416860692203,
"rewards/format_reward": 1.0,
"rewards/mean_confidence_reward": 0.0999348983168602,
"step": 51
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.001953125,
"completions/max_length": 3072.0,
"completions/max_terminated_length": 407.0,
"completions/mean_length": 140.9537811279297,
"completions/mean_terminated_length": 135.21788024902344,
"completions/min_length": 70.0,
"completions/min_terminated_length": 70.0,
"epoch": 0.3328,
"grad_norm": 0.0160201545804739,
"learning_rate": 2.222222222222222e-06,
"loss": 0.0028,
"num_tokens": 42411582.0,
"reward": 1.0068026781082153,
"reward_std": 0.024241184815764427,
"rewards/accuracy_reward": 0.1529947966337204,
"rewards/brier_reward": 0.8625615239143372,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.998046875,
"rewards/mean_confidence_reward": 0.09980469942092896,
"step": 52
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 934.0,
"completions/max_terminated_length": 934.0,
"completions/mean_length": 141.6334686279297,
"completions/mean_terminated_length": 141.6334686279297,
"completions/min_length": 71.0,
"completions/min_terminated_length": 71.0,
"epoch": 0.3392,
"grad_norm": 0.013781928457319736,
"learning_rate": 2.1428571428571427e-06,
"loss": -0.0002,
"num_tokens": 43152443.0,
"reward": 1.0088703632354736,
"reward_std": 0.019479775801301003,
"rewards/accuracy_reward": 0.1549479216337204,
"rewards/brier_reward": 0.8627905249595642,
"rewards/confidence_one_or_zero": 0.0006510416860692203,
"rewards/format_reward": 1.0,
"rewards/mean_confidence_reward": 0.09986979514360428,
"step": 53
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0006510416666666297,
"completions/max_length": 3072.0,
"completions/max_terminated_length": 925.0,
"completions/mean_length": 143.2701873779297,
"completions/mean_terminated_length": 141.36221313476562,
"completions/min_length": 64.0,
"completions/min_terminated_length": 64.0,
"epoch": 0.3456,
"grad_norm": 0.013352119363844395,
"learning_rate": 2.0634920634920634e-06,
"loss": 0.0011,
"num_tokens": 43897954.0,
"reward": 1.0110552310943604,
"reward_std": 0.019325759261846542,
"rewards/accuracy_reward": 0.1822916716337204,
"rewards/brier_reward": 0.8404674530029297,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9993489384651184,
"rewards/mean_confidence_reward": 0.0999348983168602,
"step": 54
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 600.0,
"completions/max_terminated_length": 600.0,
"completions/mean_length": 147.375,
"completions/mean_terminated_length": 147.375,
"completions/min_length": 66.0,
"completions/min_terminated_length": 66.0,
"epoch": 0.352,
"grad_norm": 0.012938371859490871,
"learning_rate": 1.984126984126984e-06,
"loss": -0.0002,
"num_tokens": 44652898.0,
"reward": 1.00691556930542,
"reward_std": 0.016605772078037262,
"rewards/accuracy_reward": 0.134765625,
"rewards/brier_reward": 0.8790633082389832,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 1.0,
"rewards/mean_confidence_reward": 0.10000000149011612,
"step": 55
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 438.0,
"completions/max_terminated_length": 438.0,
"completions/mean_length": 151.08334350585938,
"completions/mean_terminated_length": 151.08334350585938,
"completions/min_length": 68.0,
"completions/min_terminated_length": 68.0,
"epoch": 0.3584,
"grad_norm": 0.011130226776003838,
"learning_rate": 1.904761904761905e-06,
"loss": 0.0001,
"num_tokens": 45414554.0,
"reward": 1.0055440664291382,
"reward_std": 0.01602439023554325,
"rewards/accuracy_reward": 0.12109375,
"rewards/brier_reward": 0.8899922370910645,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 1.0,
"rewards/mean_confidence_reward": 0.10000000149011612,
"step": 56
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1290.0,
"completions/max_terminated_length": 1290.0,
"completions/mean_length": 151.34115600585938,
"completions/mean_terminated_length": 151.34115600585938,
"completions/min_length": 70.0,
"completions/min_terminated_length": 70.0,
"epoch": 0.3648,
"grad_norm": 0.013030236586928368,
"learning_rate": 1.8253968253968254e-06,
"loss": -0.0001,
"num_tokens": 46174918.0,
"reward": 1.0155634880065918,
"reward_std": 0.02115296944975853,
"rewards/accuracy_reward": 0.220703125,
"rewards/brier_reward": 0.8104216456413269,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 1.0,
"rewards/mean_confidence_reward": 0.10000000149011612,
"step": 57
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0006510416666666297,
"completions/max_length": 3072.0,
"completions/max_terminated_length": 445.0,
"completions/mean_length": 154.76171875,
"completions/mean_terminated_length": 152.86123657226562,
"completions/min_length": 67.0,
"completions/min_terminated_length": 67.0,
"epoch": 0.3712,
"grad_norm": 0.01376650296151638,
"learning_rate": 1.746031746031746e-06,
"loss": 0.001,
"num_tokens": 46942840.0,
"reward": 1.00923752784729,
"reward_std": 0.021036747843027115,
"rewards/accuracy_reward": 0.1640625,
"rewards/brier_reward": 0.8550614714622498,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9993489384651184,
"rewards/mean_confidence_reward": 0.09990235418081284,
"step": 58
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 2615.0,
"completions/max_terminated_length": 2615.0,
"completions/mean_length": 157.0234375,
"completions/mean_terminated_length": 157.0234375,
"completions/min_length": 69.0,
"completions/min_terminated_length": 69.0,
"epoch": 0.3776,
"grad_norm": 0.01250605471432209,
"learning_rate": 1.6666666666666667e-06,
"loss": 0.0002,
"num_tokens": 47709508.0,
"reward": 1.0067418813705444,
"reward_std": 0.018108900636434555,
"rewards/accuracy_reward": 0.1328125,
"rewards/brier_reward": 0.880669116973877,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 1.0,
"rewards/mean_confidence_reward": 0.10000000149011612,
"step": 59
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0006510416666666297,
"completions/max_length": 3072.0,
"completions/max_terminated_length": 428.0,
"completions/mean_length": 152.8737030029297,
"completions/mean_terminated_length": 150.97198486328125,
"completions/min_length": 72.0,
"completions/min_terminated_length": 72.0,
"epoch": 0.384,
"grad_norm": 0.014088746160268784,
"learning_rate": 1.5873015873015873e-06,
"loss": 0.0011,
"num_tokens": 48472442.0,
"reward": 1.0127146244049072,
"reward_std": 0.025917943567037582,
"rewards/accuracy_reward": 0.1985677033662796,
"rewards/brier_reward": 0.8275103569030762,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9993489384651184,
"rewards/mean_confidence_reward": 0.09990235418081284,
"step": 60
},
{
"epoch": 0.384,
"eval_completions/clipped_ratio": 0.0,
"eval_completions/max_length": 421.25,
"eval_completions/max_terminated_length": 421.25,
"eval_completions/mean_length": 154.28478050231934,
"eval_completions/mean_terminated_length": 154.28478050231934,
"eval_completions/min_length": 79.75,
"eval_completions/min_terminated_length": 79.75,
"eval_loss": 0.0,
"eval_num_tokens": 48472442.0,
"eval_reward": 1.00930355489254,
"eval_reward_std": 0.03157597640529275,
"eval_rewards/accuracy_reward": 0.158203125,
"eval_rewards/brier_reward": 0.8604019656777382,
"eval_rewards/confidence_one_or_zero": 0.0,
"eval_rewards/format_reward": 1.0,
"eval_rewards/mean_confidence_reward": 0.10000000149011612,
"eval_runtime": 41.1087,
"eval_samples_per_second": 24.326,
"eval_steps_per_second": 0.195,
"step": 60
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 540.0,
"completions/max_terminated_length": 540.0,
"completions/mean_length": 156.4440155029297,
"completions/mean_terminated_length": 156.4440155029297,
"completions/min_length": 67.0,
"completions/min_terminated_length": 67.0,
"epoch": 0.3904,
"grad_norm": 0.012505581602454185,
"learning_rate": 1.507936507936508e-06,
"loss": -0.0002,
"num_tokens": 49249908.0,
"reward": 1.0121111869812012,
"reward_std": 0.019174562767148018,
"rewards/accuracy_reward": 0.1861979216337204,
"rewards/brier_reward": 0.8380222320556641,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 1.0,
"rewards/mean_confidence_reward": 0.10000000149011612,
"step": 61
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0013020833333333703,
"completions/max_length": 3072.0,
"completions/max_terminated_length": 494.0,
"completions/mean_length": 161.8828125,
"completions/mean_terminated_length": 158.08865356445312,
"completions/min_length": 70.0,
"completions/min_terminated_length": 70.0,
"epoch": 0.3968,
"grad_norm": 0.014075500890612602,
"learning_rate": 1.4285714285714286e-06,
"loss": 0.0017,
"num_tokens": 50027744.0,
"reward": 1.0073561668395996,
"reward_std": 0.01984023116528988,
"rewards/accuracy_reward": 0.1516927033662796,
"rewards/brier_reward": 0.8643195033073425,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9986979365348816,
"rewards/mean_confidence_reward": 0.09983724355697632,
"step": 62
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0006510416666666297,
"completions/max_length": 3072.0,
"completions/max_terminated_length": 579.0,
"completions/mean_length": 159.0494842529297,
"completions/mean_terminated_length": 157.15179443359375,
"completions/min_length": 71.0,
"completions/min_terminated_length": 71.0,
"epoch": 0.4032,
"grad_norm": 0.013167272321879864,
"learning_rate": 1.3492063492063493e-06,
"loss": 0.0012,
"num_tokens": 50799116.0,
"reward": 1.0104891061782837,
"reward_std": 0.022380638867616653,
"rewards/accuracy_reward": 0.1764322966337204,
"rewards/brier_reward": 0.8451948165893555,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9993489384651184,
"rewards/mean_confidence_reward": 0.0999348983168602,
"step": 63
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 2272.0,
"completions/max_terminated_length": 2272.0,
"completions/mean_length": 161.9244842529297,
"completions/mean_terminated_length": 161.9244842529297,
"completions/min_length": 69.0,
"completions/min_terminated_length": 69.0,
"epoch": 0.4096,
"grad_norm": 0.010981855913996696,
"learning_rate": 1.26984126984127e-06,
"loss": 0.0001,
"num_tokens": 51574216.0,
"reward": 1.0111626386642456,
"reward_std": 0.015849454328417778,
"rewards/accuracy_reward": 0.1770833283662796,
"rewards/brier_reward": 0.8452398180961609,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 1.0,
"rewards/mean_confidence_reward": 0.09996744990348816,
"step": 64
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 611.0,
"completions/max_terminated_length": 611.0,
"completions/mean_length": 156.36849975585938,
"completions/mean_terminated_length": 156.36849975585938,
"completions/min_length": 72.0,
"completions/min_terminated_length": 72.0,
"epoch": 0.416,
"grad_norm": 0.01139452401548624,
"learning_rate": 1.1904761904761906e-06,
"loss": 0.0001,
"num_tokens": 52346614.0,
"reward": 1.010941982269287,
"reward_std": 0.01662794128060341,
"rewards/accuracy_reward": 0.1744791716337204,
"rewards/brier_reward": 0.8474025726318359,
"rewards/confidence_one_or_zero": 0.0006510416860692203,
"rewards/format_reward": 1.0,
"rewards/mean_confidence_reward": 0.0999348983168602,
"step": 65
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0006510416666666297,
"completions/max_length": 3072.0,
"completions/max_terminated_length": 676.0,
"completions/mean_length": 162.34310913085938,
"completions/mean_terminated_length": 160.4475555419922,
"completions/min_length": 73.0,
"completions/min_terminated_length": 73.0,
"epoch": 0.4224,
"grad_norm": 0.012299340218305588,
"learning_rate": 1.111111111111111e-06,
"loss": 0.001,
"num_tokens": 53123021.0,
"reward": 1.0089854001998901,
"reward_std": 0.0196043960750103,
"rewards/accuracy_reward": 0.1614583283662796,
"rewards/brier_reward": 0.8571612238883972,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9993489384651184,
"rewards/mean_confidence_reward": 0.0999348983168602,
"step": 66
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 2176.0,
"completions/max_terminated_length": 2176.0,
"completions/mean_length": 160.7890625,
"completions/mean_terminated_length": 160.7890625,
"completions/min_length": 77.0,
"completions/min_terminated_length": 77.0,
"epoch": 0.4288,
"grad_norm": 0.012904134579002857,
"learning_rate": 1.0317460317460317e-06,
"loss": 0.0001,
"num_tokens": 53894897.0,
"reward": 1.008981704711914,
"reward_std": 0.020699508488178253,
"rewards/accuracy_reward": 0.1549479216337204,
"rewards/brier_reward": 0.8630132675170898,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 1.0,
"rewards/mean_confidence_reward": 0.10000000149011612,
"step": 67
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1007.0,
"completions/max_terminated_length": 1007.0,
"completions/mean_length": 160.4987030029297,
"completions/mean_terminated_length": 160.4987030029297,
"completions/min_length": 71.0,
"completions/min_terminated_length": 71.0,
"epoch": 0.4352,
"grad_norm": 0.012299139983952045,
"learning_rate": 9.523809523809525e-07,
"loss": 0.0002,
"num_tokens": 54670711.0,
"reward": 1.0109989643096924,
"reward_std": 0.018699724227190018,
"rewards/accuracy_reward": 0.1751302033662796,
"rewards/brier_reward": 0.8468656539916992,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 1.0,
"rewards/mean_confidence_reward": 0.10000000149011612,
"step": 68
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0013020833333333703,
"completions/max_length": 3072.0,
"completions/max_terminated_length": 489.0,
"completions/mean_length": 166.4908905029297,
"completions/mean_terminated_length": 162.70272827148438,
"completions/min_length": 75.0,
"completions/min_terminated_length": 75.0,
"epoch": 0.4416,
"grad_norm": 0.015022012405097485,
"learning_rate": 8.73015873015873e-07,
"loss": 0.002,
"num_tokens": 55455457.0,
"reward": 1.0069606304168701,
"reward_std": 0.020755643025040627,
"rewards/accuracy_reward": 0.1477864533662796,
"rewards/brier_reward": 0.8674346804618835,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9986979365348816,
"rewards/mean_confidence_reward": 0.09986979514360428,
"step": 69
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1779.0,
"completions/max_terminated_length": 1779.0,
"completions/mean_length": 164.69921875,
"completions/mean_terminated_length": 164.69921875,
"completions/min_length": 65.0,
"completions/min_terminated_length": 65.0,
"epoch": 0.448,
"grad_norm": 0.012088743038475513,
"learning_rate": 7.936507936507937e-07,
"loss": 0.0001,
"num_tokens": 56237739.0,
"reward": 1.0078566074371338,
"reward_std": 0.019154582172632217,
"rewards/accuracy_reward": 0.1438802033662796,
"rewards/brier_reward": 0.8718307614326477,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 1.0,
"rewards/mean_confidence_reward": 0.10000000149011612,
"step": 70
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1182.0,
"completions/max_terminated_length": 1182.0,
"completions/mean_length": 164.3671875,
"completions/mean_terminated_length": 164.3671875,
"completions/min_length": 76.0,
"completions/min_terminated_length": 76.0,
"epoch": 0.4544,
"grad_norm": 0.011220496147871017,
"learning_rate": 7.142857142857143e-07,
"loss": -0.0002,
"num_tokens": 57013647.0,
"reward": 1.0098857879638672,
"reward_std": 0.018337352201342583,
"rewards/accuracy_reward": 0.1640625,
"rewards/brier_reward": 0.8557068705558777,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 1.0,
"rewards/mean_confidence_reward": 0.10000000149011612,
"step": 71
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 782.0,
"completions/max_terminated_length": 782.0,
"completions/mean_length": 160.58984375,
"completions/mean_terminated_length": 160.58984375,
"completions/min_length": 68.0,
"completions/min_terminated_length": 68.0,
"epoch": 0.4608,
"grad_norm": 0.016769254580140114,
"learning_rate": 6.34920634920635e-07,
"loss": 0.0003,
"num_tokens": 57789705.0,
"reward": 1.0117367506027222,
"reward_std": 0.021181315183639526,
"rewards/accuracy_reward": 0.1888020783662796,
"rewards/brier_reward": 0.8353202939033508,
"rewards/confidence_one_or_zero": 0.0006510416860692203,
"rewards/format_reward": 0.9993489384651184,
"rewards/mean_confidence_reward": 0.0999348983168602,
"step": 72
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0006510416666666297,
"completions/max_length": 3072.0,
"completions/max_terminated_length": 1463.0,
"completions/mean_length": 162.6256561279297,
"completions/mean_terminated_length": 160.73028564453125,
"completions/min_length": 63.0,
"completions/min_terminated_length": 63.0,
"epoch": 0.4672,
"grad_norm": 0.022856062278151512,
"learning_rate": 5.555555555555555e-07,
"loss": 0.001,
"num_tokens": 58560242.0,
"reward": 1.01325261592865,
"reward_std": 0.024643372744321823,
"rewards/accuracy_reward": 0.2102864533662796,
"rewards/brier_reward": 0.8175187110900879,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9986979365348816,
"rewards/mean_confidence_reward": 0.09986979514360428,
"step": 73
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1547.0,
"completions/max_terminated_length": 1547.0,
"completions/mean_length": 159.818359375,
"completions/mean_terminated_length": 159.818359375,
"completions/min_length": 67.0,
"completions/min_terminated_length": 67.0,
"epoch": 0.4736,
"grad_norm": 0.012563678435981274,
"learning_rate": 4.7619047619047623e-07,
"loss": 0.0001,
"num_tokens": 59330187.0,
"reward": 1.0141491889953613,
"reward_std": 0.020794115960597992,
"rewards/accuracy_reward": 0.2063802033662796,
"rewards/brier_reward": 0.8219161629676819,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 1.0,
"rewards/mean_confidence_reward": 0.10000000149011612,
"step": 74
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1005.0,
"completions/max_terminated_length": 1005.0,
"completions/mean_length": 156.5859375,
"completions/mean_terminated_length": 156.5859375,
"completions/min_length": 68.0,
"completions/min_terminated_length": 68.0,
"epoch": 0.48,
"grad_norm": 0.01223311573266983,
"learning_rate": 3.9682539682539683e-07,
"loss": -0.0002,
"num_tokens": 60094703.0,
"reward": 1.0077365636825562,
"reward_std": 0.017658300697803497,
"rewards/accuracy_reward": 0.142578125,
"rewards/brier_reward": 0.8728930354118347,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 1.0,
"rewards/mean_confidence_reward": 0.10000000149011612,
"step": 75
},
{
"epoch": 0.48,
"eval_completions/clipped_ratio": 0.0,
"eval_completions/max_length": 387.375,
"eval_completions/max_terminated_length": 387.375,
"eval_completions/mean_length": 160.92337799072266,
"eval_completions/mean_terminated_length": 160.92337799072266,
"eval_completions/min_length": 80.875,
"eval_completions/min_terminated_length": 80.875,
"eval_loss": 0.0,
"eval_num_tokens": 60094703.0,
"eval_reward": 1.0091994851827621,
"eval_reward_std": 0.03179385047405958,
"eval_rewards/accuracy_reward": 0.1572265625,
"eval_rewards/brier_reward": 0.8611703291535378,
"eval_rewards/confidence_one_or_zero": 0.0,
"eval_rewards/format_reward": 1.0,
"eval_rewards/mean_confidence_reward": 0.10000000149011612,
"eval_runtime": 38.6187,
"eval_samples_per_second": 25.894,
"eval_steps_per_second": 0.207,
"step": 75
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 626.0,
"completions/max_terminated_length": 626.0,
"completions/mean_length": 166.603515625,
"completions/mean_terminated_length": 166.603515625,
"completions/min_length": 72.0,
"completions/min_terminated_length": 72.0,
"epoch": 0.4864,
"grad_norm": 0.016534509137272835,
"learning_rate": 3.174603174603175e-07,
"loss": 0.0003,
"num_tokens": 60874350.0,
"reward": 1.009969711303711,
"reward_std": 0.01956816576421261,
"rewards/accuracy_reward": 0.1712239533662796,
"rewards/brier_reward": 0.8493643403053284,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.9993489384651184,
"rewards/mean_confidence_reward": 0.0999348983168602,
"step": 76
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0013020833333333703,
"completions/max_length": 3072.0,
"completions/max_terminated_length": 2768.0,
"completions/mean_length": 172.41537475585938,
"completions/mean_terminated_length": 168.6349334716797,
"completions/min_length": 72.0,
"completions/min_terminated_length": 72.0,
"epoch": 0.4928,
"grad_norm": 0.017454594373703003,
"learning_rate": 2.3809523809523811e-07,
"loss": 0.0017,
"num_tokens": 61664052.0,
"reward": 1.0110359191894531,
"reward_std": 0.025640008971095085,
"rewards/accuracy_reward": 0.1946614533662796,
"rewards/brier_reward": 0.8293614983558655,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 0.998046875,
"rewards/mean_confidence_reward": 0.09980469197034836,
"step": 77
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 865.0,
"completions/max_terminated_length": 865.0,
"completions/mean_length": 160.576171875,
"completions/mean_terminated_length": 160.576171875,
"completions/min_length": 79.0,
"completions/min_terminated_length": 79.0,
"epoch": 0.4992,
"grad_norm": 0.012094290927052498,
"learning_rate": 1.5873015873015874e-07,
"loss": 0.0001,
"num_tokens": 62439993.0,
"reward": 1.0102208852767944,
"reward_std": 0.01821950264275074,
"rewards/accuracy_reward": 0.1673177033662796,
"rewards/brier_reward": 0.8531219363212585,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 1.0,
"rewards/mean_confidence_reward": 0.10000000149011612,
"step": 78
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1279.0,
"completions/max_terminated_length": 1279.0,
"completions/mean_length": 166.828125,
"completions/mean_terminated_length": 166.828125,
"completions/min_length": 75.0,
"completions/min_terminated_length": 75.0,
"epoch": 0.5056,
"grad_norm": 0.012527219019830227,
"learning_rate": 7.936507936507937e-08,
"loss": 0.0001,
"num_tokens": 63224585.0,
"reward": 1.0118589401245117,
"reward_std": 0.020548149943351746,
"rewards/accuracy_reward": 0.18359375,
"rewards/brier_reward": 0.8401217460632324,
"rewards/confidence_one_or_zero": 0.0,
"rewards/format_reward": 1.0,
"rewards/mean_confidence_reward": 0.0999348983168602,
"step": 79
},
{
"epoch": 0.5056,
"step": 79,
"total_flos": 0.0,
"train_loss": 0.0022363197340497737,
"train_runtime": 10851.1654,
"train_samples_per_second": 1.382,
"train_steps_per_second": 0.007
}
],
"logging_steps": 1,
"max_steps": 79,
"num_input_tokens_seen": 63224585,
"num_train_epochs": 1,
"save_steps": 60,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 0.0,
"train_batch_size": 3,
"trial_name": null,
"trial_params": null
}