{ "best_metric": null, "best_model_checkpoint": null, "epoch": 0.49919376007799904, "eval_steps": 50, "global_step": 208, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.04618055555555556, "completions/max_length": 4000.2, "completions/max_terminated_length": 4000.2, "completions/mean_length": 995.653466796875, "completions/mean_terminated_length": 1043.9063598632813, "completions/min_length": 0.0, "completions/min_terminated_length": 223.4, "epoch": 0.011999850001874977, "grad_norm": 0.001468590460717678, "learning_rate": 2.2727272727272728e-06, "loss": -0.0262, "num_tokens": 14584136.0, "reward": 0.8028841495513916, "reward_std": 0.5060957491397857, "rewards/accuracy_reward": 0.35407986044883727, "rewards/brier_reward": 0.5074836075305938, "rewards/confidence_one_or_zero": 0.4384548604488373, "rewards/format_reward": 0.7441840171813965, "rewards/mean_confidence_reward": 0.6029745936393738, "step": 5 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.03776041666666665, "completions/max_length": 3788.0, "completions/max_terminated_length": 3788.0, "completions/mean_length": 952.0879516601562, "completions/mean_terminated_length": 989.9261596679687, "completions/min_length": 0.0, "completions/min_terminated_length": 233.0, "epoch": 0.023999700003749954, "grad_norm": 0.000640683458186686, "learning_rate": 4.5454545454545455e-06, "loss": -0.0367, "num_tokens": 28634909.0, "reward": 1.0157596111297607, "reward_std": 0.3558866620063782, "rewards/accuracy_reward": 0.4484375, "rewards/brier_reward": 0.6547639966011047, "rewards/confidence_one_or_zero": 0.42048611044883727, "rewards/format_reward": 0.9282986044883728, "rewards/mean_confidence_reward": 0.5301635503768921, "step": 10 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.030295138888888885, "completions/max_length": 3773.6, "completions/max_terminated_length": 3773.6, "completions/mean_length": 968.6600708007812, "completions/mean_terminated_length": 999.1074096679688, "completions/min_length": 0.0, "completions/min_terminated_length": 320.6, "epoch": 0.03599955000562493, "grad_norm": 0.0007433110731653869, "learning_rate": 4.898477157360406e-06, "loss": -0.033, "num_tokens": 42895857.0, "reward": 1.0568380117416383, "reward_std": 0.24810748398303986, "rewards/accuracy_reward": 0.4456597208976746, "rewards/brier_reward": 0.7031617760658264, "rewards/confidence_one_or_zero": 0.1889756962656975, "rewards/format_reward": 0.9648437380790711, "rewards/mean_confidence_reward": 0.34892988204956055, "step": 15 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.030642361111111092, "completions/max_length": 3860.2, "completions/max_terminated_length": 3860.2, "completions/mean_length": 888.786279296875, "completions/mean_terminated_length": 917.262744140625, "completions/min_length": 0.0, "completions/min_terminated_length": 294.2, "epoch": 0.04799940000749991, "grad_norm": 0.0007100884104147553, "learning_rate": 4.771573604060914e-06, "loss": -0.0317, "num_tokens": 56248371.0, "reward": 1.1035695791244506, "reward_std": 0.2411518782377243, "rewards/accuracy_reward": 0.4994791686534882, "rewards/brier_reward": 0.7392470240592957, "rewards/confidence_one_or_zero": 0.004427083267364651, "rewards/format_reward": 0.9684027791023254, "rewards/mean_confidence_reward": 0.5068701922893524, "step": 20 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.027517361111111117, "completions/max_length": 3753.2, "completions/max_terminated_length": 3753.2, "completions/mean_length": 845.354345703125, "completions/mean_terminated_length": 869.4375122070312, "completions/min_length": 0.0, "completions/min_terminated_length": 275.0, "epoch": 0.05999925000937488, "grad_norm": 0.0007387480000033975, "learning_rate": 4.644670050761422e-06, "loss": -0.0278, "num_tokens": 69111301.0, "reward": 1.1421298265457154, "reward_std": 0.24627233445644378, "rewards/accuracy_reward": 0.5638888835906982, "rewards/brier_reward": 0.7484833002090454, "rewards/confidence_one_or_zero": 0.0007812500058207661, "rewards/format_reward": 0.971875, "rewards/mean_confidence_reward": 0.6265876889228821, "step": 25 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.03671875, "completions/max_length": 3877.8, "completions/max_terminated_length": 3877.8, "completions/mean_length": 911.8454223632813, "completions/mean_terminated_length": 946.828125, "completions/min_length": 0.0, "completions/min_terminated_length": 215.6, "epoch": 0.07199910001124986, "grad_norm": 0.0017544181318953633, "learning_rate": 4.5177664974619295e-06, "loss": -0.0379, "num_tokens": 82725680.0, "reward": 1.1499913215637207, "reward_std": 0.24166221618652345, "rewards/accuracy_reward": 0.5868923664093018, "rewards/brier_reward": 0.7504922270774841, "rewards/confidence_one_or_zero": 8.680555620230735e-05, "rewards/format_reward": 0.9625868082046509, "rewards/mean_confidence_reward": 0.5598831534385681, "step": 30 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.034895833333333307, "completions/max_length": 3889.6, "completions/max_terminated_length": 3889.6, "completions/mean_length": 903.557470703125, "completions/mean_terminated_length": 936.7724609375, "completions/min_length": 0.0, "completions/min_terminated_length": 288.8, "epoch": 0.08399895001312484, "grad_norm": 0.0007147829746827483, "learning_rate": 4.390862944162436e-06, "loss": -0.034, "num_tokens": 96212102.0, "reward": 1.1824100971221925, "reward_std": 0.2268961787223816, "rewards/accuracy_reward": 0.6289930462837219, "rewards/brier_reward": 0.7714917182922363, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9643229246139526, "rewards/mean_confidence_reward": 0.6222647666931153, "step": 35 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.03116319444444444, "completions/max_length": 3932.8, "completions/max_terminated_length": 3932.8, "completions/mean_length": 823.3291748046875, "completions/mean_terminated_length": 849.9028564453125, "completions/min_length": 0.0, "completions/min_terminated_length": 282.8, "epoch": 0.09599880001499982, "grad_norm": 0.0005586285842582583, "learning_rate": 4.263959390862945e-06, "loss": -0.0364, "num_tokens": 108816374.0, "reward": 1.1980676889419555, "reward_std": 0.22116016447544098, "rewards/accuracy_reward": 0.6493055582046509, "rewards/brier_reward": 0.7783258199691773, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9684895873069763, "rewards/mean_confidence_reward": 0.7160234451293945, "step": 40 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.024565972222222232, "completions/max_length": 3847.6, "completions/max_terminated_length": 3847.6, "completions/mean_length": 782.091845703125, "completions/mean_terminated_length": 801.8463256835937, "completions/min_length": 0.0, "completions/min_terminated_length": 259.0, "epoch": 0.1079986500168748, "grad_norm": 0.0006557401502504945, "learning_rate": 4.137055837563453e-06, "loss": -0.0253, "num_tokens": 120961336.0, "reward": 1.200283408164978, "reward_std": 0.2178070664405823, "rewards/accuracy_reward": 0.6548611164093018, "rewards/brier_reward": 0.7712975144386292, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9743923664093017, "rewards/mean_confidence_reward": 0.7877369880676269, "step": 45 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.02421875, "completions/max_length": 3791.8, "completions/max_terminated_length": 3791.8, "completions/mean_length": 786.1929809570313, "completions/mean_terminated_length": 805.8355224609375, "completions/min_length": 0.0, "completions/min_terminated_length": 240.6, "epoch": 0.11999850001874976, "grad_norm": 0.0006151842535473406, "learning_rate": 4.0101522842639595e-06, "loss": -0.0249, "num_tokens": 133115879.0, "reward": 1.2045230865478516, "reward_std": 0.20249704420566558, "rewards/accuracy_reward": 0.6519965291023254, "rewards/brier_reward": 0.7813406109809875, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9756944417953491, "rewards/mean_confidence_reward": 0.72891925573349, "step": 50 }, { "epoch": 0.11999850001874976, "eval_completions/clipped_ratio": 0.022569444444444458, "eval_completions/max_length": 2390.1666666666665, "eval_completions/max_terminated_length": 2390.1666666666665, "eval_completions/mean_length": 807.0597432454427, "eval_completions/mean_terminated_length": 825.7537841796875, "eval_completions/min_length": 77.83333333333333, "eval_completions/min_terminated_length": 333.6666666666667, "eval_loss": 0.0, "eval_num_tokens": 133115879.0, "eval_reward": 1.2035881280899048, "eval_reward_std": 0.3418561766544978, "eval_rewards/accuracy_reward": 0.6475694378217062, "eval_rewards/brier_reward": 0.7847678065299988, "eval_rewards/confidence_one_or_zero": 0.0, "eval_rewards/format_reward": 0.9748263955116272, "eval_rewards/mean_confidence_reward": 0.623480906089147, "eval_runtime": 325.6138, "eval_samples_per_second": 3.071, "eval_steps_per_second": 0.018, "step": 50 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.029861111111111095, "completions/max_length": 3624.8, "completions/max_terminated_length": 3624.8, "completions/mean_length": 839.8423828125, "completions/mean_terminated_length": 866.0277465820312, "completions/min_length": 0.0, "completions/min_terminated_length": 262.4, "epoch": 0.13199835002062474, "grad_norm": 0.0006012032390572131, "learning_rate": 3.883248730964467e-06, "loss": -0.0267, "num_tokens": 145871439.0, "reward": 1.1937550544738769, "reward_std": 0.18426936566829683, "rewards/accuracy_reward": 0.647656238079071, "rewards/brier_reward": 0.7702242016792298, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9696180582046509, "rewards/mean_confidence_reward": 0.5814600586891174, "step": 55 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.023611111111111093, "completions/max_length": 3906.2, "completions/max_terminated_length": 3906.2, "completions/mean_length": 821.8163940429688, "completions/mean_terminated_length": 841.79453125, "completions/min_length": 0.0, "completions/min_terminated_length": 273.2, "epoch": 0.14399820002249972, "grad_norm": 0.0006839183042757213, "learning_rate": 3.756345177664975e-06, "loss": -0.0259, "num_tokens": 158435340.0, "reward": 1.1945719718933105, "reward_std": 0.1913407564163208, "rewards/accuracy_reward": 0.6302083373069763, "rewards/brier_reward": 0.7827078938484192, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9762152791023254, "rewards/mean_confidence_reward": 0.619076383113861, "step": 60 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.019357638888888907, "completions/max_length": 3618.6, "completions/max_terminated_length": 3618.6, "completions/mean_length": 749.66796875, "completions/mean_terminated_length": 764.5959350585938, "completions/min_length": 0.0, "completions/min_terminated_length": 192.4, "epoch": 0.1559980500243747, "grad_norm": 0.0007240342674776912, "learning_rate": 3.629441624365482e-06, "loss": -0.0186, "num_tokens": 170165563.0, "reward": 1.2224555015563965, "reward_std": 0.18082822263240814, "rewards/accuracy_reward": 0.6611111164093018, "rewards/brier_reward": 0.8033169031143188, "rewards/confidence_one_or_zero": 0.0006076388992369175, "rewards/format_reward": 0.9804687619209289, "rewards/mean_confidence_reward": 0.7073316097259521, "step": 65 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.024392361111111115, "completions/max_length": 3395.4, "completions/max_terminated_length": 3395.4, "completions/mean_length": 733.86416015625, "completions/mean_terminated_length": 752.2443115234375, "completions/min_length": 0.0, "completions/min_terminated_length": 192.8, "epoch": 0.16799790002624967, "grad_norm": 0.0005545295425690711, "learning_rate": 3.5025380710659903e-06, "loss": -0.0235, "num_tokens": 181697822.0, "reward": 1.2054958105087281, "reward_std": 0.18330176770687104, "rewards/accuracy_reward": 0.6433159589767456, "rewards/brier_reward": 0.7922271609306335, "rewards/confidence_one_or_zero": 0.007031250232830644, "rewards/format_reward": 0.9754340291023255, "rewards/mean_confidence_reward": 0.7130208492279053, "step": 70 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.018055555555555537, "completions/max_length": 3356.2, "completions/max_terminated_length": 3356.2, "completions/mean_length": 770.8174438476562, "completions/mean_terminated_length": 785.1328491210937, "completions/min_length": 0.0, "completions/min_terminated_length": 255.8, "epoch": 0.17999775002812465, "grad_norm": 0.00040936042205430567, "learning_rate": 3.375634517766498e-06, "loss": -0.0181, "num_tokens": 193642535.0, "reward": 1.244530153274536, "reward_std": 0.1650351107120514, "rewards/accuracy_reward": 0.7009548544883728, "rewards/brier_reward": 0.8063218355178833, "rewards/confidence_one_or_zero": 0.011805555410683155, "rewards/format_reward": 0.9817708373069763, "rewards/mean_confidence_reward": 0.6228342056274414, "step": 75 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01788194444444442, "completions/max_length": 3750.2, "completions/max_terminated_length": 3750.2, "completions/mean_length": 820.3263061523437, "completions/mean_terminated_length": 835.380224609375, "completions/min_length": 0.0, "completions/min_terminated_length": 227.0, "epoch": 0.19199760002999963, "grad_norm": 0.0005090378108434379, "learning_rate": 3.2487309644670053e-06, "loss": -0.0183, "num_tokens": 206145974.0, "reward": 1.2273483753204346, "reward_std": 0.17248319387435912, "rewards/accuracy_reward": 0.6702256798744202, "rewards/brier_reward": 0.8026000380516052, "rewards/confidence_one_or_zero": 0.04418402835726738, "rewards/format_reward": 0.9818576455116272, "rewards/mean_confidence_reward": 0.6209765553474427, "step": 80 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.019357638888888862, "completions/max_length": 3891.0, "completions/max_terminated_length": 3891.0, "completions/mean_length": 804.060595703125, "completions/mean_terminated_length": 820.0193115234375, "completions/min_length": 0.0, "completions/min_terminated_length": 287.4, "epoch": 0.2039974500318746, "grad_norm": 0.0005799650680273771, "learning_rate": 3.121827411167513e-06, "loss": -0.0182, "num_tokens": 218495952.0, "reward": 1.2420600414276124, "reward_std": 0.1854027807712555, "rewards/accuracy_reward": 0.6829861044883728, "rewards/brier_reward": 0.8210820078849792, "rewards/confidence_one_or_zero": 0.1517361119389534, "rewards/format_reward": 0.9800347328186035, "rewards/mean_confidence_reward": 0.7053038239479065, "step": 85 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.02152777777777779, "completions/max_length": 3442.0, "completions/max_terminated_length": 3442.0, "completions/mean_length": 785.1589477539062, "completions/mean_terminated_length": 802.4694091796875, "completions/min_length": 0.0, "completions/min_terminated_length": 251.8, "epoch": 0.2159973000337496, "grad_norm": 0.0006302814581431448, "learning_rate": 2.9949238578680207e-06, "loss": -0.0238, "num_tokens": 230609655.0, "reward": 1.239054799079895, "reward_std": 0.1893111288547516, "rewards/accuracy_reward": 0.6869791626930237, "rewards/brier_reward": 0.812728750705719, "rewards/confidence_one_or_zero": 0.07578125055879355, "rewards/format_reward": 0.9783854126930237, "rewards/mean_confidence_reward": 0.7320529341697692, "step": 90 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01640625, "completions/max_length": 3389.6, "completions/max_terminated_length": 3389.6, "completions/mean_length": 803.64306640625, "completions/mean_terminated_length": 817.1105712890625, "completions/min_length": 0.0, "completions/min_terminated_length": 249.6, "epoch": 0.22799715003562457, "grad_norm": 0.0005609573563560843, "learning_rate": 2.8680203045685284e-06, "loss": -0.0168, "num_tokens": 242959303.0, "reward": 1.235309100151062, "reward_std": 0.17818428277969361, "rewards/accuracy_reward": 0.6747395753860473, "rewards/brier_reward": 0.812617826461792, "rewards/confidence_one_or_zero": 0.003298611124046147, "rewards/format_reward": 0.9832465291023255, "rewards/mean_confidence_reward": 0.7121918439865113, "step": 95 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01901041666666665, "completions/max_length": 3287.0, "completions/max_terminated_length": 3287.0, "completions/mean_length": 840.3250122070312, "completions/mean_terminated_length": 856.58330078125, "completions/min_length": 0.0, "completions/min_terminated_length": 301.4, "epoch": 0.23999700003749952, "grad_norm": 0.0004377439618110657, "learning_rate": 2.7411167512690357e-06, "loss": -0.0176, "num_tokens": 255738919.0, "reward": 1.248662257194519, "reward_std": 0.1747280478477478, "rewards/accuracy_reward": 0.6919270873069763, "rewards/brier_reward": 0.8243943214416504, "rewards/confidence_one_or_zero": 8.680555620230735e-05, "rewards/format_reward": 0.9809895873069763, "rewards/mean_confidence_reward": 0.6675564289093018, "step": 100 }, { "epoch": 0.23999700003749952, "eval_completions/clipped_ratio": 0.014756944444444456, "eval_completions/max_length": 2268.0, "eval_completions/max_terminated_length": 2268.0, "eval_completions/mean_length": 831.62744140625, "eval_completions/mean_terminated_length": 844.1648966471354, "eval_completions/min_length": 63.833333333333336, "eval_completions/min_terminated_length": 332.5, "eval_loss": 0.0, "eval_num_tokens": 255738919.0, "eval_reward": 1.2433301011721294, "eval_reward_std": 0.3282207002242406, "eval_rewards/accuracy_reward": 0.6788194378217062, "eval_rewards/brier_reward": 0.8243207434813181, "eval_rewards/confidence_one_or_zero": 0.0, "eval_rewards/format_reward": 0.9835069477558136, "eval_rewards/mean_confidence_reward": 0.649522582689921, "eval_runtime": 322.2356, "eval_samples_per_second": 3.103, "eval_steps_per_second": 0.019, "step": 100 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01571180555555558, "completions/max_length": 3524.2, "completions/max_terminated_length": 3524.2, "completions/mean_length": 841.7855102539063, "completions/mean_terminated_length": 855.2962036132812, "completions/min_length": 0.0, "completions/min_terminated_length": 271.2, "epoch": 0.2519968500393745, "grad_norm": 0.0004888804396614432, "learning_rate": 2.6142131979695434e-06, "loss": -0.0165, "num_tokens": 268513152.0, "reward": 1.240246868133545, "reward_std": 0.1666222870349884, "rewards/accuracy_reward": 0.678819453716278, "rewards/brier_reward": 0.817373263835907, "rewards/confidence_one_or_zero": 0.0003472222248092294, "rewards/format_reward": 0.9842881917953491, "rewards/mean_confidence_reward": 0.6420749306678772, "step": 105 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.011371527777777812, "completions/max_length": 3665.8, "completions/max_terminated_length": 3665.8, "completions/mean_length": 875.26884765625, "completions/mean_terminated_length": 885.443701171875, "completions/min_length": 0.0, "completions/min_terminated_length": 288.8, "epoch": 0.2639967000412495, "grad_norm": 0.00047984463162720203, "learning_rate": 2.487309644670051e-06, "loss": -0.0108, "num_tokens": 281704697.0, "reward": 1.263697338104248, "reward_std": 0.14904940724372864, "rewards/accuracy_reward": 0.7070312619209289, "rewards/brier_reward": 0.831721568107605, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9886284708976746, "rewards/mean_confidence_reward": 0.6679644227027893, "step": 110 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.012413194444444442, "completions/max_length": 3634.6, "completions/max_terminated_length": 3634.6, "completions/mean_length": 873.7130249023437, "completions/mean_terminated_length": 884.7570068359375, "completions/min_length": 0.0, "completions/min_terminated_length": 301.0, "epoch": 0.27599655004312446, "grad_norm": 0.00046908314106985927, "learning_rate": 2.3604060913705588e-06, "loss": -0.0118, "num_tokens": 294849071.0, "reward": 1.2401302576065063, "reward_std": 0.16665265560150147, "rewards/accuracy_reward": 0.6732638955116272, "rewards/brier_reward": 0.8193958520889282, "rewards/confidence_one_or_zero": 8.680555620230735e-05, "rewards/format_reward": 0.9875868082046508, "rewards/mean_confidence_reward": 0.6962688088417053, "step": 115 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.008593750000000022, "completions/max_length": 3546.4, "completions/max_terminated_length": 3546.4, "completions/mean_length": 859.1952270507812, "completions/mean_terminated_length": 866.6294067382812, "completions/min_length": 0.0, "completions/min_terminated_length": 295.2, "epoch": 0.28799640004499943, "grad_norm": 0.00041610386688262224, "learning_rate": 2.233502538071066e-06, "loss": -0.0088, "num_tokens": 307828856.0, "reward": 1.2503829956054688, "reward_std": 0.16349477469921112, "rewards/accuracy_reward": 0.6833333373069763, "rewards/brier_reward": 0.8260988116264343, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9913194417953491, "rewards/mean_confidence_reward": 0.7186678171157836, "step": 120 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.010243055555555537, "completions/max_length": 3428.6, "completions/max_terminated_length": 3428.6, "completions/mean_length": 866.3007080078125, "completions/mean_terminated_length": 875.3722900390625, "completions/min_length": 0.0, "completions/min_terminated_length": 299.4, "epoch": 0.2999962500468744, "grad_norm": 0.0005037845694459975, "learning_rate": 2.1065989847715737e-06, "loss": -0.0094, "num_tokens": 320926304.0, "reward": 1.2674844026565553, "reward_std": 0.16409001648426055, "rewards/accuracy_reward": 0.7037326455116272, "rewards/brier_reward": 0.8417252659797668, "rewards/confidence_one_or_zero": 8.680555620230735e-05, "rewards/format_reward": 0.9894965410232544, "rewards/mean_confidence_reward": 0.7170399188995361, "step": 125 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.013107638888888907, "completions/max_length": 3691.0, "completions/max_terminated_length": 3691.0, "completions/mean_length": 922.182470703125, "completions/mean_terminated_length": 934.426708984375, "completions/min_length": 0.0, "completions/min_terminated_length": 310.6, "epoch": 0.3119961000487494, "grad_norm": 0.0004879495536442846, "learning_rate": 1.9796954314720814e-06, "loss": -0.0133, "num_tokens": 334674646.0, "reward": 1.2395371913909912, "reward_std": 0.16301891803741456, "rewards/accuracy_reward": 0.6685763955116272, "rewards/brier_reward": 0.8237658858299255, "rewards/confidence_one_or_zero": 8.680555620230735e-05, "rewards/format_reward": 0.98671875, "rewards/mean_confidence_reward": 0.6686067819595337, "step": 130 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.013888888888888862, "completions/max_length": 3607.0, "completions/max_terminated_length": 3607.0, "completions/mean_length": 936.2807250976563, "completions/mean_terminated_length": 949.4107055664062, "completions/min_length": 0.0, "completions/min_terminated_length": 306.4, "epoch": 0.32399595005062437, "grad_norm": 0.0004939971258863807, "learning_rate": 1.852791878172589e-06, "loss": -0.0143, "num_tokens": 348553624.0, "reward": 1.2485416412353516, "reward_std": 0.16000640988349915, "rewards/accuracy_reward": 0.68359375, "rewards/brier_reward": 0.8275392770767211, "rewards/confidence_one_or_zero": 8.680555620230735e-05, "rewards/format_reward": 0.985937488079071, "rewards/mean_confidence_reward": 0.6367925047874451, "step": 135 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.013715277777777767, "completions/max_length": 3831.0, "completions/max_terminated_length": 3831.0, "completions/mean_length": 958.5888061523438, "completions/mean_terminated_length": 971.8986938476562, "completions/min_length": 0.0, "completions/min_terminated_length": 361.8, "epoch": 0.33599580005249935, "grad_norm": 0.000400395569158718, "learning_rate": 1.7258883248730964e-06, "loss": -0.014, "num_tokens": 362700791.0, "reward": 1.2510334968566894, "reward_std": 0.15658156871795653, "rewards/accuracy_reward": 0.6869791746139526, "rewards/brier_reward": 0.8289637804031372, "rewards/confidence_one_or_zero": 0.000260416668606922, "rewards/format_reward": 0.9861111164093017, "rewards/mean_confidence_reward": 0.6465494871139527, "step": 140 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.010763888888888906, "completions/max_length": 3563.0, "completions/max_terminated_length": 3563.0, "completions/mean_length": 965.1240600585937, "completions/mean_terminated_length": 975.6915283203125, "completions/min_length": 0.0, "completions/min_terminated_length": 363.2, "epoch": 0.34799565005437433, "grad_norm": 0.00037705147406086326, "learning_rate": 1.5989847715736043e-06, "loss": -0.0103, "num_tokens": 376883628.0, "reward": 1.277334499359131, "reward_std": 0.1482344537973404, "rewards/accuracy_reward": 0.7192708253860474, "rewards/brier_reward": 0.8463218331336975, "rewards/confidence_one_or_zero": 0.0001736111124046147, "rewards/format_reward": 0.9890625, "rewards/mean_confidence_reward": 0.6897005200386047, "step": 145 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.011458333333333326, "completions/max_length": 3604.0, "completions/max_terminated_length": 3604.0, "completions/mean_length": 1037.48076171875, "completions/mean_terminated_length": 1049.4971313476562, "completions/min_length": 0.0, "completions/min_terminated_length": 386.6, "epoch": 0.3599955000562493, "grad_norm": 0.00044691620860248804, "learning_rate": 1.4720812182741118e-06, "loss": -0.0112, "num_tokens": 391945742.0, "reward": 1.265284013748169, "reward_std": 0.16107824742794036, "rewards/accuracy_reward": 0.7019097208976746, "rewards/brier_reward": 0.8401894569396973, "rewards/confidence_one_or_zero": 0.0, "rewards/format_reward": 0.9884548783302307, "rewards/mean_confidence_reward": 0.7001345157623291, "step": 150 }, { "epoch": 0.3599955000562493, "eval_completions/clipped_ratio": 0.018923611111111127, "eval_completions/max_length": 2578.1666666666665, "eval_completions/max_terminated_length": 2578.1666666666665, "eval_completions/mean_length": 1002.6307474772135, "eval_completions/mean_terminated_length": 1022.0964050292969, "eval_completions/min_length": 0.0, "eval_completions/min_terminated_length": 426.5, "eval_loss": 0.0, "eval_num_tokens": 391945742.0, "eval_reward": 1.2544946670532227, "eval_reward_std": 0.3295811116695404, "eval_rewards/accuracy_reward": 0.6901041766007742, "eval_rewards/brier_reward": 0.8353646099567413, "eval_rewards/confidence_one_or_zero": 0.0008680555814256271, "eval_rewards/format_reward": 0.9835069477558136, "eval_rewards/mean_confidence_reward": 0.6782117982705435, "eval_runtime": 329.0215, "eval_samples_per_second": 3.039, "eval_steps_per_second": 0.018, "step": 150 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.018489583333333302, "completions/max_length": 3506.6, "completions/max_terminated_length": 3506.6, "completions/mean_length": 990.0326416015625, "completions/mean_terminated_length": 1008.8268432617188, "completions/min_length": 0.0, "completions/min_terminated_length": 392.2, "epoch": 0.3719953500581243, "grad_norm": 0.0004651858762372285, "learning_rate": 1.3451776649746193e-06, "loss": -0.0192, "num_tokens": 406458630.0, "reward": 1.2769456386566163, "reward_std": 0.17086925506591796, "rewards/accuracy_reward": 0.7310763835906983, "rewards/brier_reward": 0.8413774013519287, "rewards/confidence_one_or_zero": 8.680555620230735e-05, "rewards/format_reward": 0.9814236044883728, "rewards/mean_confidence_reward": 0.690551221370697, "step": 155 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.016666666666666673, "completions/max_length": 3474.8, "completions/max_terminated_length": 3474.8, "completions/mean_length": 1012.5202270507813, "completions/mean_terminated_length": 1029.66376953125, "completions/min_length": 0.0, "completions/min_terminated_length": 388.0, "epoch": 0.38399520005999926, "grad_norm": 0.0003789855109062046, "learning_rate": 1.218274111675127e-06, "loss": -0.0163, "num_tokens": 421210159.0, "reward": 1.2442054748535156, "reward_std": 0.1634654939174652, "rewards/accuracy_reward": 0.6777777791023254, "rewards/brier_reward": 0.8272862553596496, "rewards/confidence_one_or_zero": 0.0001736111124046147, "rewards/format_reward": 0.9833333373069764, "rewards/mean_confidence_reward": 0.6832248091697692, "step": 160 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.017013888888888884, "completions/max_length": 3455.6, "completions/max_terminated_length": 3455.6, "completions/mean_length": 1036.8546020507813, "completions/mean_terminated_length": 1054.9498901367188, "completions/min_length": 0.0, "completions/min_terminated_length": 389.8, "epoch": 0.39599505006187424, "grad_norm": 0.0010382012696936727, "learning_rate": 1.0913705583756345e-06, "loss": -0.0158, "num_tokens": 436293796.0, "reward": 1.2380517244338989, "reward_std": 0.15648340582847595, "rewards/accuracy_reward": 0.6625868082046509, "rewards/brier_reward": 0.8305176854133606, "rewards/confidence_one_or_zero": 8.680555620230735e-05, "rewards/format_reward": 0.9829861164093018, "rewards/mean_confidence_reward": 0.6423246383666992, "step": 165 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.013107638888888861, "completions/max_length": 3402.2, "completions/max_terminated_length": 3402.2, "completions/mean_length": 995.6934814453125, "completions/mean_terminated_length": 1008.8341430664062, "completions/min_length": 0.0, "completions/min_terminated_length": 362.2, "epoch": 0.4079949000637492, "grad_norm": 0.0004276257532183081, "learning_rate": 9.644670050761422e-07, "loss": -0.0126, "num_tokens": 450853369.0, "reward": 1.2728031158447266, "reward_std": 0.15210382044315338, "rewards/accuracy_reward": 0.7168402671813965, "rewards/brier_reward": 0.8419468402862549, "rewards/confidence_one_or_zero": 8.680555620230735e-05, "rewards/format_reward": 0.986805546283722, "rewards/mean_confidence_reward": 0.6786675453186035, "step": 170 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01284722222222221, "completions/max_length": 3748.0, "completions/max_terminated_length": 3748.0, "completions/mean_length": 1020.3355224609375, "completions/mean_terminated_length": 1033.6660888671875, "completions/min_length": 0.0, "completions/min_terminated_length": 369.6, "epoch": 0.4199947500656242, "grad_norm": 0.0005423967377282679, "learning_rate": 8.375634517766498e-07, "loss": -0.0116, "num_tokens": 465715602.0, "reward": 1.2671451807022094, "reward_std": 0.16106505692005157, "rewards/accuracy_reward": 0.7060763835906982, "rewards/brier_reward": 0.8413081169128418, "rewards/confidence_one_or_zero": 8.680555620230735e-05, "rewards/format_reward": 0.9868923544883728, "rewards/mean_confidence_reward": 0.6738255381584167, "step": 175 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.015451388888888907, "completions/max_length": 3535.4, "completions/max_terminated_length": 3535.4, "completions/mean_length": 983.2767578125, "completions/mean_terminated_length": 998.7015869140625, "completions/min_length": 0.0, "completions/min_terminated_length": 373.0, "epoch": 0.4319946000674992, "grad_norm": 0.0004915730678476393, "learning_rate": 7.106598984771574e-07, "loss": -0.0148, "num_tokens": 480142918.0, "reward": 1.2670525074005128, "reward_std": 0.15874242782592773, "rewards/accuracy_reward": 0.7168402791023254, "rewards/brier_reward": 0.8327020764350891, "rewards/confidence_one_or_zero": 0.000260416668606922, "rewards/format_reward": 0.9845486044883728, "rewards/mean_confidence_reward": 0.7012196183204651, "step": 180 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.012586805555555558, "completions/max_length": 3636.2, "completions/max_terminated_length": 3636.2, "completions/mean_length": 998.0439208984375, "completions/mean_terminated_length": 1010.7783203125, "completions/min_length": 0.0, "completions/min_terminated_length": 346.6, "epoch": 0.44399445006937416, "grad_norm": 0.0005585678154602647, "learning_rate": 5.83756345177665e-07, "loss": -0.012, "num_tokens": 494730432.0, "reward": 1.2518677711486816, "reward_std": 0.16244393587112427, "rewards/accuracy_reward": 0.6817708253860474, "rewards/brier_reward": 0.8345379948616027, "rewards/confidence_one_or_zero": 8.680555620230735e-05, "rewards/format_reward": 0.987413203716278, "rewards/mean_confidence_reward": 0.6762803792953491, "step": 185 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.010156249999999978, "completions/max_length": 3530.2, "completions/max_terminated_length": 3530.2, "completions/mean_length": 979.3949829101563, "completions/mean_terminated_length": 989.3971069335937, "completions/min_length": 0.0, "completions/min_terminated_length": 395.0, "epoch": 0.45599430007124914, "grad_norm": 0.0004858736938331276, "learning_rate": 4.568527918781726e-07, "loss": -0.0101, "num_tokens": 509096006.0, "reward": 1.276425051689148, "reward_std": 0.152652707695961, "rewards/accuracy_reward": 0.7210069417953491, "rewards/brier_reward": 0.8419852733612061, "rewards/confidence_one_or_zero": 0.0001736111124046147, "rewards/format_reward": 0.989843738079071, "rewards/mean_confidence_reward": 0.7043576240539551, "step": 190 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.012934027777777768, "completions/max_length": 3613.8, "completions/max_terminated_length": 3613.8, "completions/mean_length": 1004.6217895507813, "completions/mean_terminated_length": 1017.9731323242188, "completions/min_length": 0.0, "completions/min_terminated_length": 351.8, "epoch": 0.46799415007312406, "grad_norm": 0.00045332699664868414, "learning_rate": 3.2994923857868026e-07, "loss": -0.0123, "num_tokens": 523750113.0, "reward": 1.2433192253112793, "reward_std": 0.16497401297092437, "rewards/accuracy_reward": 0.6746527791023255, "rewards/brier_reward": 0.8250796437263489, "rewards/confidence_one_or_zero": 0.000260416668606922, "rewards/format_reward": 0.9868923783302307, "rewards/mean_confidence_reward": 0.6832942724227905, "step": 195 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.010503472222222232, "completions/max_length": 3605.0, "completions/max_terminated_length": 3605.0, "completions/mean_length": 991.7037475585937, "completions/mean_terminated_length": 1002.2833374023437, "completions/min_length": 0.0, "completions/min_terminated_length": 385.8, "epoch": 0.47999400007499904, "grad_norm": 0.000445247016614303, "learning_rate": 2.0304568527918783e-07, "loss": -0.01, "num_tokens": 538242348.0, "reward": 1.2666230201721191, "reward_std": 0.1489817589521408, "rewards/accuracy_reward": 0.7033854246139526, "rewards/brier_reward": 0.840523874759674, "rewards/confidence_one_or_zero": 0.0001736111124046147, "rewards/format_reward": 0.9893229126930236, "rewards/mean_confidence_reward": 0.6932456612586975, "step": 200 }, { "epoch": 0.47999400007499904, "eval_completions/clipped_ratio": 0.013020833333333334, "eval_completions/max_length": 2447.0, "eval_completions/max_terminated_length": 2447.0, "eval_completions/mean_length": 982.8340454101562, "eval_completions/mean_terminated_length": 995.8915710449219, "eval_completions/min_length": 85.33333333333333, "eval_completions/min_terminated_length": 435.5, "eval_loss": 0.0, "eval_num_tokens": 538242348.0, "eval_reward": 1.2601836721102397, "eval_reward_std": 0.32464847962061566, "eval_rewards/accuracy_reward": 0.7057291666666666, "eval_rewards/brier_reward": 0.829381505648295, "eval_rewards/confidence_one_or_zero": 0.0008680555814256271, "eval_rewards/format_reward": 0.9852430522441864, "eval_rewards/mean_confidence_reward": 0.6809461911519369, "eval_runtime": 325.5733, "eval_samples_per_second": 3.072, "eval_steps_per_second": 0.018, "step": 200 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01371527777777779, "completions/max_length": 3609.8, "completions/max_terminated_length": 3609.8, "completions/mean_length": 1008.6137329101563, "completions/mean_terminated_length": 1022.6266235351562, "completions/min_length": 0.0, "completions/min_terminated_length": 371.6, "epoch": 0.491993850076874, "grad_norm": 0.0003949266974814236, "learning_rate": 7.614213197969544e-08, "loss": -0.0132, "num_tokens": 552927530.0, "reward": 1.291322445869446, "reward_std": 0.1527684062719345, "rewards/accuracy_reward": 0.7461805582046509, "rewards/brier_reward": 0.8501658320426941, "rewards/confidence_one_or_zero": 8.680555620230735e-05, "rewards/format_reward": 0.9862847328186035, "rewards/mean_confidence_reward": 0.6899566054344177, "step": 205 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.008101851851851824, "completions/max_length": 3854.6666666666665, "completions/max_terminated_length": 3854.6666666666665, "completions/mean_length": 1010.2601725260416, "completions/mean_terminated_length": 1018.6278889973959, "completions/min_length": 0.0, "completions/min_terminated_length": 327.3333333333333, "epoch": 0.49919376007799904, "num_tokens": 561776496.0, "reward": 1.2661747137705486, "reward_std": 0.1512370283404986, "rewards/accuracy_reward": 0.7044270833333334, "rewards/brier_reward": 0.8360105156898499, "rewards/confidence_one_or_zero": 0.00028935185400769114, "rewards/format_reward": 0.9918981393178304, "rewards/mean_confidence_reward": 0.6803168257077535, "step": 208, "total_flos": 0.0, "train_loss": -0.019072025002410207, "train_runtime": 90469.3907, "train_samples_per_second": 0.166, "train_steps_per_second": 0.002 } ], "logging_steps": 5, "max_steps": 208, "num_input_tokens_seen": 561776496, "num_train_epochs": 1, "save_steps": 60, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 0.0, "train_batch_size": 6, "trial_name": null, "trial_params": null }