{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 37.687366167023555, "eval_steps": 500, "global_step": 17600, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00859375, "completions/max_length": 1689.8, "completions/max_terminated_length": 1556.2, "completions/mean_length": 301.266015625, "completions/mean_terminated_length": 286.6748352050781, "completions/min_length": 83.2, "completions/min_terminated_length": 83.2, "entropy": 0.16503800442442298, "epoch": 0.021413276231263382, "frac_reward_zero_std": 0.4625, "grad_norm": 0.80859375, "learning_rate": 9.9991e-06, "loss": -0.0075, "num_tokens": 1285065.0, "reward": 0.8945312798023224, "reward_std": 0.40281289219856264, "rewards/reward_accuracy/mean": 0.796875, "rewards/reward_accuracy/std": 0.39885675609111787, "rewards/reward_format/mean": 0.09765625074505806, "rewards/reward_format/std": 0.01003280533477664, "sampling/importance_sampling_ratio/max": 2.653296637535095, "sampling/importance_sampling_ratio/mean": 0.9684413790702819, "sampling/importance_sampling_ratio/min": 0.050389365293085575, "sampling/sampling_logp_difference/max": 0.7311303198337555, "sampling/sampling_logp_difference/mean": 0.006581059983000159, "step": 10, "step_time": 8.399543140083551 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.008984375, "completions/max_length": 1737.8, "completions/max_terminated_length": 1330.4, "completions/mean_length": 209.42109375, "completions/mean_terminated_length": 192.85375061035157, "completions/min_length": 61.3, "completions/min_terminated_length": 61.3, "entropy": 0.14292012955993413, "epoch": 0.042826552462526764, "frac_reward_zero_std": 0.51875, "grad_norm": 0.96875, "learning_rate": 9.9981e-06, "loss": -0.0043, "num_tokens": 2334239.0, "reward": 0.9225000083446503, "reward_std": 0.3690616458654404, "rewards/reward_accuracy/mean": 0.8234375, "rewards/reward_accuracy/std": 0.3671683520078659, "rewards/reward_format/mean": 0.09906250089406968, "rewards/reward_format/std": 0.00684666836168617, "sampling/importance_sampling_ratio/max": 2.4786211490631103, "sampling/importance_sampling_ratio/mean": 0.9833113610744476, "sampling/importance_sampling_ratio/min": 0.10598709061741829, "sampling/sampling_logp_difference/max": 0.7969226837158203, "sampling/sampling_logp_difference/mean": 0.006202959734946489, "step": 20, "step_time": 8.040335622103886 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.009375, "completions/max_length": 2023.5, "completions/max_terminated_length": 1551.0, "completions/mean_length": 192.905859375, "completions/mean_terminated_length": 175.60045013427734, "completions/min_length": 60.3, "completions/min_terminated_length": 60.3, "entropy": 0.14606270296499133, "epoch": 0.06423982869379015, "frac_reward_zero_std": 0.5375, "grad_norm": 0.5625, "learning_rate": 9.997100000000001e-06, "loss": -0.0126, "num_tokens": 3352638.0, "reward": 0.8824218928813934, "reward_std": 0.4055416703224182, "rewards/reward_accuracy/mean": 0.78359375, "rewards/reward_accuracy/std": 0.40373427867889405, "rewards/reward_format/mean": 0.09882812649011612, "rewards/reward_format/std": 0.00843207745347172, "sampling/importance_sampling_ratio/max": 2.366842305660248, "sampling/importance_sampling_ratio/mean": 0.9809095025062561, "sampling/importance_sampling_ratio/min": 0.0751559054479003, "sampling/sampling_logp_difference/max": 0.6763100028038025, "sampling/sampling_logp_difference/mean": 0.006534823961555958, "step": 30, "step_time": 9.298474689899013 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01640625, "completions/max_length": 1986.7, "completions/max_terminated_length": 1649.1, "completions/mean_length": 191.569921875, "completions/mean_terminated_length": 160.91250228881836, "completions/min_length": 55.3, "completions/min_terminated_length": 55.3, "entropy": 0.1544516202993691, "epoch": 0.08565310492505353, "frac_reward_zero_std": 0.5125, "grad_norm": 0.7578125, "learning_rate": 9.9961e-06, "loss": -0.0001, "num_tokens": 4361217.0, "reward": 0.8939843893051147, "reward_std": 0.3848870426416397, "rewards/reward_accuracy/mean": 0.79609375, "rewards/reward_accuracy/std": 0.3815509468317032, "rewards/reward_format/mean": 0.09789062589406967, "rewards/reward_format/std": 0.010723389545455575, "sampling/importance_sampling_ratio/max": 2.5818888306617738, "sampling/importance_sampling_ratio/mean": 0.9841027140617371, "sampling/importance_sampling_ratio/min": 0.06816275753080844, "sampling/sampling_logp_difference/max": 0.7672812283039093, "sampling/sampling_logp_difference/mean": 0.00684510488063097, "step": 40, "step_time": 9.489320026012138 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.012109375, "completions/max_length": 1874.6, "completions/max_terminated_length": 1380.1, "completions/mean_length": 164.1984375, "completions/mean_terminated_length": 141.18161239624024, "completions/min_length": 52.8, "completions/min_terminated_length": 52.8, "entropy": 0.12915842616930603, "epoch": 0.10706638115631692, "frac_reward_zero_std": 0.625, "grad_norm": 0.63671875, "learning_rate": 9.9951e-06, "loss": -0.015, "num_tokens": 5291293.0, "reward": 0.949277377128601, "reward_std": 0.35188271999359133, "rewards/reward_accuracy/mean": 0.850390625, "rewards/reward_accuracy/std": 0.3496407389640808, "rewards/reward_format/mean": 0.09888672083616257, "rewards/reward_format/std": 0.008100975141860544, "sampling/importance_sampling_ratio/max": 2.500232982635498, "sampling/importance_sampling_ratio/mean": 0.9857312381267548, "sampling/importance_sampling_ratio/min": 0.10393701773136854, "sampling/sampling_logp_difference/max": 0.6623611927032471, "sampling/sampling_logp_difference/mean": 0.006075166864320636, "step": 50, "step_time": 8.814586300775408 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.010546875, "completions/max_length": 1941.2, "completions/max_terminated_length": 1565.2, "completions/mean_length": 190.837109375, "completions/mean_terminated_length": 171.06454467773438, "completions/min_length": 62.6, "completions/min_terminated_length": 62.6, "entropy": 0.1349178078584373, "epoch": 0.1284796573875803, "frac_reward_zero_std": 0.5875, "grad_norm": 0.62109375, "learning_rate": 9.994100000000001e-06, "loss": -0.0064, "num_tokens": 6295292.0, "reward": 0.9257617294788361, "reward_std": 0.37068587690591814, "rewards/reward_accuracy/mean": 0.826953125, "rewards/reward_accuracy/std": 0.3682569429278374, "rewards/reward_format/mean": 0.09880859628319741, "rewards/reward_format/std": 0.008020428405143321, "sampling/importance_sampling_ratio/max": 2.349709224700928, "sampling/importance_sampling_ratio/mean": 0.9771098732948303, "sampling/importance_sampling_ratio/min": 0.07556971702724695, "sampling/sampling_logp_difference/max": 0.6079421877861023, "sampling/sampling_logp_difference/mean": 0.006160016497597098, "step": 60, "step_time": 8.95055399471894 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0078125, "completions/max_length": 2026.5, "completions/max_terminated_length": 1744.8, "completions/mean_length": 202.791015625, "completions/mean_terminated_length": 188.33590698242188, "completions/min_length": 64.4, "completions/min_terminated_length": 64.4, "entropy": 0.13444796577095985, "epoch": 0.14989293361884368, "frac_reward_zero_std": 0.51875, "grad_norm": 0.77734375, "learning_rate": 9.993100000000001e-06, "loss": -0.0113, "num_tokens": 7335893.0, "reward": 0.9230859637260437, "reward_std": 0.369539213180542, "rewards/reward_accuracy/mean": 0.82421875, "rewards/reward_accuracy/std": 0.3678038567304611, "rewards/reward_format/mean": 0.09886718988418579, "rewards/reward_format/std": 0.007401704415678978, "sampling/importance_sampling_ratio/max": 2.3724364757537844, "sampling/importance_sampling_ratio/mean": 0.9747531473636627, "sampling/importance_sampling_ratio/min": 0.10912456419318914, "sampling/sampling_logp_difference/max": 0.9142043769359589, "sampling/sampling_logp_difference/mean": 0.006175457779318094, "step": 70, "step_time": 9.45166023769416 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 5.509520633495412e-07, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 5.509520633495412e-07, "completions/clipped_ratio": 0.01875, "completions/max_length": 1881.4, "completions/max_terminated_length": 1772.7, "completions/mean_length": 218.408203125, "completions/mean_terminated_length": 183.69740600585936, "completions/min_length": 62.6, "completions/min_terminated_length": 62.6, "entropy": 0.14230290604755283, "epoch": 0.17130620985010706, "frac_reward_zero_std": 0.575, "grad_norm": 0.63671875, "learning_rate": 9.9921e-06, "loss": -0.003, "num_tokens": 8410026.0, "reward": 0.9368945598602295, "reward_std": 0.3652557998895645, "rewards/reward_accuracy/mean": 0.839453125, "rewards/reward_accuracy/std": 0.3602900058031082, "rewards/reward_format/mean": 0.09744140729308129, "rewards/reward_format/std": 0.012345249718055128, "sampling/importance_sampling_ratio/max": 2.555394434928894, "sampling/importance_sampling_ratio/mean": 0.9792158007621765, "sampling/importance_sampling_ratio/min": 0.10281872539781034, "sampling/sampling_logp_difference/max": 0.6688772141933441, "sampling/sampling_logp_difference/mean": 0.006499164598062634, "step": 80, "step_time": 9.13198133064434 }, { "clip_ratio/high_max": 2.0738915372930934e-05, "clip_ratio/high_mean": 2.5923644216163668e-06, "clip_ratio/low_mean": 3.5518250115273985e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 6.144189433143765e-06, "completions/clipped_ratio": 0.01875, "completions/max_length": 1871.3, "completions/max_terminated_length": 1660.3, "completions/mean_length": 213.669921875, "completions/mean_terminated_length": 178.95696258544922, "completions/min_length": 60.0, "completions/min_terminated_length": 60.0, "entropy": 0.13997770538553594, "epoch": 0.19271948608137046, "frac_reward_zero_std": 0.51875, "grad_norm": 0.63671875, "learning_rate": 9.991100000000002e-06, "loss": -0.0145, "num_tokens": 9473597.0, "reward": 0.8984375298023224, "reward_std": 0.3928565099835396, "rewards/reward_accuracy/mean": 0.800390625, "rewards/reward_accuracy/std": 0.389233261346817, "rewards/reward_format/mean": 0.09804687798023223, "rewards/reward_format/std": 0.01062250193208456, "sampling/importance_sampling_ratio/max": 2.4450597524642945, "sampling/importance_sampling_ratio/mean": 0.9830299019813538, "sampling/importance_sampling_ratio/min": 0.07355060745030642, "sampling/sampling_logp_difference/max": 0.6408210933208466, "sampling/sampling_logp_difference/mean": 0.006349706137552857, "step": 90, "step_time": 9.172977677034215 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.006640625, "completions/max_length": 1722.3, "completions/max_terminated_length": 1207.8, "completions/mean_length": 182.6265625, "completions/mean_terminated_length": 170.19158172607422, "completions/min_length": 57.5, "completions/min_terminated_length": 57.5, "entropy": 0.12242600778117776, "epoch": 0.21413276231263384, "frac_reward_zero_std": 0.5875, "grad_norm": 0.70703125, "learning_rate": 9.990100000000001e-06, "loss": -0.0052, "num_tokens": 10460849.0, "reward": 0.9282226741313935, "reward_std": 0.3655781000852585, "rewards/reward_accuracy/mean": 0.82890625, "rewards/reward_accuracy/std": 0.36442719399929047, "rewards/reward_format/mean": 0.09931640699505806, "rewards/reward_format/std": 0.006197937461547553, "sampling/importance_sampling_ratio/max": 2.411752772331238, "sampling/importance_sampling_ratio/mean": 0.9998455286026001, "sampling/importance_sampling_ratio/min": 0.09601361863315105, "sampling/sampling_logp_difference/max": 0.5277146697044373, "sampling/sampling_logp_difference/mean": 0.005582967167720198, "step": 100, "step_time": 8.010274563264101 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.007421875, "completions/max_length": 1610.9, "completions/max_terminated_length": 1369.9, "completions/mean_length": 171.590625, "completions/mean_terminated_length": 157.6996063232422, "completions/min_length": 58.1, "completions/min_terminated_length": 58.1, "entropy": 0.1263415009714663, "epoch": 0.23554603854389722, "frac_reward_zero_std": 0.5875, "grad_norm": 0.87109375, "learning_rate": 9.9891e-06, "loss": -0.0097, "num_tokens": 11418377.0, "reward": 0.9300781488418579, "reward_std": 0.3668376863002777, "rewards/reward_accuracy/mean": 0.830859375, "rewards/reward_accuracy/std": 0.3651041090488434, "rewards/reward_format/mean": 0.09921875149011612, "rewards/reward_format/std": 0.005866051721386612, "sampling/importance_sampling_ratio/max": 2.404644513130188, "sampling/importance_sampling_ratio/mean": 0.9715279757976532, "sampling/importance_sampling_ratio/min": 0.08773027174174786, "sampling/sampling_logp_difference/max": 0.6986365556716919, "sampling/sampling_logp_difference/mean": 0.005826171347871422, "step": 110, "step_time": 7.741869163373485 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.013671875, "completions/max_length": 1916.2, "completions/max_terminated_length": 1366.8, "completions/mean_length": 176.946484375, "completions/mean_terminated_length": 151.20050811767578, "completions/min_length": 60.0, "completions/min_terminated_length": 60.0, "entropy": 0.13139069378376006, "epoch": 0.2569593147751606, "frac_reward_zero_std": 0.60625, "grad_norm": 0.8203125, "learning_rate": 9.9881e-06, "loss": -0.0014, "num_tokens": 12392960.0, "reward": 0.8821875214576721, "reward_std": 0.40001245141029357, "rewards/reward_accuracy/mean": 0.78359375, "rewards/reward_accuracy/std": 0.3974467471241951, "rewards/reward_format/mean": 0.09859374985098839, "rewards/reward_format/std": 0.009218690707348287, "sampling/importance_sampling_ratio/max": 2.3937487244606017, "sampling/importance_sampling_ratio/mean": 0.979498291015625, "sampling/importance_sampling_ratio/min": 0.05801301626488566, "sampling/sampling_logp_difference/max": 0.7055964231491089, "sampling/sampling_logp_difference/mean": 0.005767674976959824, "step": 120, "step_time": 9.02613644534722 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.012109375, "completions/max_length": 2045.8, "completions/max_terminated_length": 1569.4, "completions/mean_length": 177.850390625, "completions/mean_terminated_length": 155.0331573486328, "completions/min_length": 51.8, "completions/min_terminated_length": 51.8, "entropy": 0.13719871155917646, "epoch": 0.278372591006424, "frac_reward_zero_std": 0.58125, "grad_norm": 0.77734375, "learning_rate": 9.987100000000001e-06, "loss": -0.0151, "num_tokens": 13362273.0, "reward": 0.9264453470706939, "reward_std": 0.36956382989883424, "rewards/reward_accuracy/mean": 0.827734375, "rewards/reward_accuracy/std": 0.36676925122737886, "rewards/reward_format/mean": 0.09871093779802323, "rewards/reward_format/std": 0.009152110037393867, "sampling/importance_sampling_ratio/max": 2.455416131019592, "sampling/importance_sampling_ratio/mean": 0.9859054565429688, "sampling/importance_sampling_ratio/min": 0.04564662054181099, "sampling/sampling_logp_difference/max": 0.7309700608253479, "sampling/sampling_logp_difference/mean": 0.006187488324940205, "step": 130, "step_time": 9.445366340549663 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0265625, "completions/max_length": 1900.1, "completions/max_terminated_length": 1227.7, "completions/mean_length": 211.42890625, "completions/mean_terminated_length": 162.0924850463867, "completions/min_length": 59.5, "completions/min_terminated_length": 59.5, "entropy": 0.154626948479563, "epoch": 0.29978586723768735, "frac_reward_zero_std": 0.46875, "grad_norm": 0.90625, "learning_rate": 9.9861e-06, "loss": -0.0125, "num_tokens": 14423771.0, "reward": 0.8552344024181366, "reward_std": 0.42746672332286834, "rewards/reward_accuracy/mean": 0.7578125, "rewards/reward_accuracy/std": 0.42302260398864744, "rewards/reward_format/mean": 0.09742187708616257, "rewards/reward_format/std": 0.012623216118663549, "sampling/importance_sampling_ratio/max": 2.3324547290802, "sampling/importance_sampling_ratio/mean": 0.9725462436676026, "sampling/importance_sampling_ratio/min": 0.07414196860045194, "sampling/sampling_logp_difference/max": 0.7267895817756653, "sampling/sampling_logp_difference/mean": 0.0067431832198053595, "step": 140, "step_time": 9.081448095850646 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.022265625, "completions/max_length": 2048.0, "completions/max_terminated_length": 1566.1, "completions/mean_length": 209.867578125, "completions/mean_terminated_length": 168.2657440185547, "completions/min_length": 56.4, "completions/min_terminated_length": 56.4, "entropy": 0.14393569538369774, "epoch": 0.32119914346895073, "frac_reward_zero_std": 0.50625, "grad_norm": 1.0546875, "learning_rate": 9.9851e-06, "loss": -0.0081, "num_tokens": 15478600.0, "reward": 0.8943359434604645, "reward_std": 0.40177545249462127, "rewards/reward_accuracy/mean": 0.796484375, "rewards/reward_accuracy/std": 0.3973024427890778, "rewards/reward_format/mean": 0.09785156324505806, "rewards/reward_format/std": 0.012780764722265303, "sampling/importance_sampling_ratio/max": 2.6029918670654295, "sampling/importance_sampling_ratio/mean": 0.9915633022785186, "sampling/importance_sampling_ratio/min": 0.02743674712255597, "sampling/sampling_logp_difference/max": 0.855018037557602, "sampling/sampling_logp_difference/mean": 0.006300653191283345, "step": 150, "step_time": 9.74286238285713 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0125, "completions/max_length": 1869.0, "completions/max_terminated_length": 1381.2, "completions/mean_length": 181.31796875, "completions/mean_terminated_length": 157.84009323120117, "completions/min_length": 54.5, "completions/min_terminated_length": 54.5, "entropy": 0.13950672606006265, "epoch": 0.3426124197002141, "frac_reward_zero_std": 0.54375, "grad_norm": 0.9296875, "learning_rate": 9.984100000000002e-06, "loss": -0.0023, "num_tokens": 16459046.0, "reward": 0.8854101896286011, "reward_std": 0.39791751503944395, "rewards/reward_accuracy/mean": 0.78671875, "rewards/reward_accuracy/std": 0.39541620314121245, "rewards/reward_format/mean": 0.0986914061009884, "rewards/reward_format/std": 0.009678102401085197, "sampling/importance_sampling_ratio/max": 2.4542437553405763, "sampling/importance_sampling_ratio/mean": 0.9903126358985901, "sampling/importance_sampling_ratio/min": 0.11864679716527463, "sampling/sampling_logp_difference/max": 0.7811646819114685, "sampling/sampling_logp_difference/mean": 0.0061691795010119675, "step": 160, "step_time": 8.705859960569068 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 7.18225692253327e-07, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 7.18225692253327e-07, "completions/clipped_ratio": 0.030078125, "completions/max_length": 2048.0, "completions/max_terminated_length": 1762.3, "completions/mean_length": 241.995703125, "completions/mean_terminated_length": 186.23339233398437, "completions/min_length": 62.9, "completions/min_terminated_length": 62.9, "entropy": 0.15126340091228485, "epoch": 0.3640256959314775, "frac_reward_zero_std": 0.55625, "grad_norm": 0.408203125, "learning_rate": 9.983100000000001e-06, "loss": -0.0059, "num_tokens": 17601643.0, "reward": 0.9007617413997651, "reward_std": 0.3949627667665482, "rewards/reward_accuracy/mean": 0.80390625, "rewards/reward_accuracy/std": 0.3878025025129318, "rewards/reward_format/mean": 0.09685547128319741, "rewards/reward_format/std": 0.015166912414133548, "sampling/importance_sampling_ratio/max": 2.5566648721694945, "sampling/importance_sampling_ratio/mean": 0.9823035657405853, "sampling/importance_sampling_ratio/min": 0.01948281191289425, "sampling/sampling_logp_difference/max": 0.9330565929412842, "sampling/sampling_logp_difference/mean": 0.006233416916802526, "step": 170, "step_time": 10.111618541320786 }, { "clip_ratio/high_max": 9.72459965851158e-06, "clip_ratio/high_mean": 1.2155749573139474e-06, "clip_ratio/low_mean": 3.0589271773351354e-07, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 1.5214676750474609e-06, "completions/clipped_ratio": 0.019140625, "completions/max_length": 1986.7, "completions/max_terminated_length": 1719.3, "completions/mean_length": 237.691796875, "completions/mean_terminated_length": 202.68127899169923, "completions/min_length": 67.0, "completions/min_terminated_length": 67.0, "entropy": 0.1569390209391713, "epoch": 0.3854389721627409, "frac_reward_zero_std": 0.51875, "grad_norm": 0.64453125, "learning_rate": 9.9821e-06, "loss": -0.0126, "num_tokens": 18732406.0, "reward": 0.8579492390155792, "reward_std": 0.4229008972644806, "rewards/reward_accuracy/mean": 0.759765625, "rewards/reward_accuracy/std": 0.4198786973953247, "rewards/reward_format/mean": 0.09818359464406967, "rewards/reward_format/std": 0.010203328751958906, "sampling/importance_sampling_ratio/max": 2.5067942261695864, "sampling/importance_sampling_ratio/mean": 0.9829773962497711, "sampling/importance_sampling_ratio/min": 0.07496326249092818, "sampling/sampling_logp_difference/max": 0.6532892286777496, "sampling/sampling_logp_difference/mean": 0.006633048364892602, "step": 180, "step_time": 9.768640909157693 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01953125, "completions/max_length": 2048.0, "completions/max_terminated_length": 1703.7, "completions/mean_length": 266.333203125, "completions/mean_terminated_length": 231.14380340576173, "completions/min_length": 72.3, "completions/min_terminated_length": 72.3, "entropy": 0.1748073108494282, "epoch": 0.4068522483940043, "frac_reward_zero_std": 0.4875, "grad_norm": 0.55859375, "learning_rate": 9.981100000000002e-06, "loss": -0.0168, "num_tokens": 19938123.0, "reward": 0.9196484684944153, "reward_std": 0.3713774815201759, "rewards/reward_accuracy/mean": 0.821875, "rewards/reward_accuracy/std": 0.36746798604726794, "rewards/reward_format/mean": 0.09777343943715096, "rewards/reward_format/std": 0.01182347172871232, "sampling/importance_sampling_ratio/max": 2.5152854442596437, "sampling/importance_sampling_ratio/mean": 0.9553942918777466, "sampling/importance_sampling_ratio/min": 0.02115938547067344, "sampling/sampling_logp_difference/max": 1.0791487336158752, "sampling/sampling_logp_difference/mean": 0.00703223878517747, "step": 190, "step_time": 9.950964004453272 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.02109375, "completions/max_length": 1980.0, "completions/max_terminated_length": 1745.3, "completions/mean_length": 284.98125, "completions/mean_terminated_length": 247.54713439941406, "completions/min_length": 72.0, "completions/min_terminated_length": 72.0, "entropy": 0.17252881079912186, "epoch": 0.4282655246252677, "frac_reward_zero_std": 0.5125, "grad_norm": 0.59765625, "learning_rate": 9.9801e-06, "loss": -0.0212, "num_tokens": 21187435.0, "reward": 0.9011523604393006, "reward_std": 0.3890772670507431, "rewards/reward_accuracy/mean": 0.803515625, "rewards/reward_accuracy/std": 0.38509434163570405, "rewards/reward_format/mean": 0.09763671979308128, "rewards/reward_format/std": 0.011838894966058434, "sampling/importance_sampling_ratio/max": 2.5474149346351624, "sampling/importance_sampling_ratio/mean": 0.9766521573066711, "sampling/importance_sampling_ratio/min": 0.015180078893899917, "sampling/sampling_logp_difference/max": 0.6660357922315597, "sampling/sampling_logp_difference/mean": 0.006749289808794856, "step": 200, "step_time": 9.603486723592505 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.012890625, "completions/max_length": 2006.2, "completions/max_terminated_length": 1702.2, "completions/mean_length": 236.538671875, "completions/mean_terminated_length": 212.97097625732422, "completions/min_length": 74.3, "completions/min_terminated_length": 74.3, "entropy": 0.15436679925769567, "epoch": 0.44967880085653106, "frac_reward_zero_std": 0.5875, "grad_norm": 0.65234375, "learning_rate": 9.9791e-06, "loss": -0.0107, "num_tokens": 22307918.0, "reward": 0.968046897649765, "reward_std": 0.3281402811408043, "rewards/reward_accuracy/mean": 0.86953125, "rewards/reward_accuracy/std": 0.3247923329472542, "rewards/reward_format/mean": 0.09851562529802323, "rewards/reward_format/std": 0.00954692114610225, "sampling/importance_sampling_ratio/max": 2.3249094605445864, "sampling/importance_sampling_ratio/mean": 0.9743193805217742, "sampling/importance_sampling_ratio/min": 0.048329275101423264, "sampling/sampling_logp_difference/max": 1.1993927955627441, "sampling/sampling_logp_difference/mean": 0.006329587940126657, "step": 210, "step_time": 9.420172037975863 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01328125, "completions/max_length": 1949.8, "completions/max_terminated_length": 1708.5, "completions/mean_length": 252.3484375, "completions/mean_terminated_length": 228.26724700927736, "completions/min_length": 75.5, "completions/min_terminated_length": 75.5, "entropy": 0.15897367959842085, "epoch": 0.47109207708779444, "frac_reward_zero_std": 0.54375, "grad_norm": 0.67578125, "learning_rate": 9.9781e-06, "loss": -0.019, "num_tokens": 23473578.0, "reward": 0.9489453256130218, "reward_std": 0.34329227432608606, "rewards/reward_accuracy/mean": 0.850390625, "rewards/reward_accuracy/std": 0.34029669389128686, "rewards/reward_format/mean": 0.0985546886920929, "rewards/reward_format/std": 0.009705392783507705, "sampling/importance_sampling_ratio/max": 2.3432349443435667, "sampling/importance_sampling_ratio/mean": 0.968984580039978, "sampling/importance_sampling_ratio/min": 0.03236568383872509, "sampling/sampling_logp_difference/max": 0.6265906810760498, "sampling/sampling_logp_difference/mean": 0.006590941734611988, "step": 220, "step_time": 9.200759962759912 }, { "clip_ratio/high_max": 1.0617965745041148e-05, "clip_ratio/high_mean": 1.3272457181301434e-06, "clip_ratio/low_mean": 2.6002662707469425e-07, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 1.5872723452048375e-06, "completions/clipped_ratio": 0.02578125, "completions/max_length": 2048.0, "completions/max_terminated_length": 1811.4, "completions/mean_length": 295.088671875, "completions/mean_terminated_length": 248.85442810058595, "completions/min_length": 73.2, "completions/min_terminated_length": 73.2, "entropy": 0.1703632994554937, "epoch": 0.4925053533190578, "frac_reward_zero_std": 0.45, "grad_norm": 0.76171875, "learning_rate": 9.977100000000001e-06, "loss": -0.0121, "num_tokens": 24749645.0, "reward": 0.8889843940734863, "reward_std": 0.4046052634716034, "rewards/reward_accuracy/mean": 0.79140625, "rewards/reward_accuracy/std": 0.40005778074264525, "rewards/reward_format/mean": 0.09757812544703484, "rewards/reward_format/std": 0.013030602596700191, "sampling/importance_sampling_ratio/max": 2.6804869890213014, "sampling/importance_sampling_ratio/mean": 0.9650364279747009, "sampling/importance_sampling_ratio/min": 0.017811396159231663, "sampling/sampling_logp_difference/max": 0.7515988826751709, "sampling/sampling_logp_difference/mean": 0.006866492377594113, "step": 230, "step_time": 10.003458055853844 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.019140625, "completions/max_length": 1980.0, "completions/max_terminated_length": 1747.5, "completions/mean_length": 252.9515625, "completions/mean_terminated_length": 217.93970947265626, "completions/min_length": 66.9, "completions/min_terminated_length": 66.9, "entropy": 0.16131126508116722, "epoch": 0.5139186295503212, "frac_reward_zero_std": 0.525, "grad_norm": 0.5546875, "learning_rate": 9.976100000000001e-06, "loss": -0.0172, "num_tokens": 25928129.0, "reward": 0.9422070503234863, "reward_std": 0.35469307750463486, "rewards/reward_accuracy/mean": 0.844140625, "rewards/reward_accuracy/std": 0.3506337657570839, "rewards/reward_format/mean": 0.09806640669703484, "rewards/reward_format/std": 0.011627811496146024, "sampling/importance_sampling_ratio/max": 2.3747957944869995, "sampling/importance_sampling_ratio/mean": 0.9665410101413727, "sampling/importance_sampling_ratio/min": 0.027348649501800538, "sampling/sampling_logp_difference/max": 0.833703088760376, "sampling/sampling_logp_difference/mean": 0.006626122677698731, "step": 240, "step_time": 9.535299448482693 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.017578125, "completions/max_length": 1887.6, "completions/max_terminated_length": 1473.5, "completions/mean_length": 242.821484375, "completions/mean_terminated_length": 211.0764892578125, "completions/min_length": 69.1, "completions/min_terminated_length": 69.1, "entropy": 0.15672999983653427, "epoch": 0.5353319057815846, "frac_reward_zero_std": 0.5875, "grad_norm": 0.66015625, "learning_rate": 9.9751e-06, "loss": -0.0142, "num_tokens": 27065800.0, "reward": 0.9000390827655792, "reward_std": 0.38530259132385253, "rewards/reward_accuracy/mean": 0.801953125, "rewards/reward_accuracy/std": 0.3817975491285324, "rewards/reward_format/mean": 0.09808593988418579, "rewards/reward_format/std": 0.010538362385705113, "sampling/importance_sampling_ratio/max": 2.530345582962036, "sampling/importance_sampling_ratio/mean": 0.982217276096344, "sampling/importance_sampling_ratio/min": 0.05016824994236231, "sampling/sampling_logp_difference/max": 0.6506958127021789, "sampling/sampling_logp_difference/mean": 0.006455441843718291, "step": 250, "step_time": 9.08839970054105 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0359375, "completions/max_length": 1878.9, "completions/max_terminated_length": 1667.0, "completions/mean_length": 277.873828125, "completions/mean_terminated_length": 212.26934814453125, "completions/min_length": 67.6, "completions/min_terminated_length": 67.6, "entropy": 0.17280294466763735, "epoch": 0.556745182012848, "frac_reward_zero_std": 0.5, "grad_norm": 0.5625, "learning_rate": 9.974100000000002e-06, "loss": -0.0132, "num_tokens": 28297797.0, "reward": 0.9247265815734863, "reward_std": 0.3772251486778259, "rewards/reward_accuracy/mean": 0.82734375, "rewards/reward_accuracy/std": 0.3718470513820648, "rewards/reward_format/mean": 0.09738281294703484, "rewards/reward_format/std": 0.01317462269216776, "sampling/importance_sampling_ratio/max": 2.4532822370529175, "sampling/importance_sampling_ratio/mean": 0.9770439505577088, "sampling/importance_sampling_ratio/min": 0.0343831330537796, "sampling/sampling_logp_difference/max": 0.9563548326492309, "sampling/sampling_logp_difference/mean": 0.006806593574583531, "step": 260, "step_time": 9.531171284848824 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.025, "completions/max_length": 2048.0, "completions/max_terminated_length": 1717.2, "completions/mean_length": 241.68828125, "completions/mean_terminated_length": 195.51385192871095, "completions/min_length": 62.3, "completions/min_terminated_length": 62.3, "entropy": 0.1635963972657919, "epoch": 0.5781584582441114, "frac_reward_zero_std": 0.49375, "grad_norm": 0.466796875, "learning_rate": 9.973100000000001e-06, "loss": -0.0153, "num_tokens": 29429735.0, "reward": 0.8947461068630218, "reward_std": 0.39585974514484407, "rewards/reward_accuracy/mean": 0.796875, "rewards/reward_accuracy/std": 0.39193362891674044, "rewards/reward_format/mean": 0.09787109419703484, "rewards/reward_format/std": 0.012965353857725858, "sampling/importance_sampling_ratio/max": 2.389664626121521, "sampling/importance_sampling_ratio/mean": 0.9690044820308685, "sampling/importance_sampling_ratio/min": 0.008558434061706066, "sampling/sampling_logp_difference/max": 0.6382080137729644, "sampling/sampling_logp_difference/mean": 0.006901593692600727, "step": 270, "step_time": 9.79771754979156 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.02578125, "completions/max_length": 2048.0, "completions/max_terminated_length": 1753.4, "completions/mean_length": 230.67734375, "completions/mean_terminated_length": 183.1858688354492, "completions/min_length": 57.3, "completions/min_terminated_length": 57.3, "entropy": 0.15891095688566564, "epoch": 0.5995717344753747, "frac_reward_zero_std": 0.49375, "grad_norm": 0.6796875, "learning_rate": 9.9721e-06, "loss": -0.0081, "num_tokens": 30534765.0, "reward": 0.8939648628234863, "reward_std": 0.378990963101387, "rewards/reward_accuracy/mean": 0.796484375, "rewards/reward_accuracy/std": 0.3743096858263016, "rewards/reward_format/mean": 0.09748047068715096, "rewards/reward_format/std": 0.01297167136799544, "sampling/importance_sampling_ratio/max": 2.56362464427948, "sampling/importance_sampling_ratio/mean": 0.9868412375450134, "sampling/importance_sampling_ratio/min": 0.03003610800951719, "sampling/sampling_logp_difference/max": 0.7611776053905487, "sampling/sampling_logp_difference/mean": 0.006613596482202411, "step": 280, "step_time": 9.803738680807873 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.03203125, "completions/max_length": 2048.0, "completions/max_terminated_length": 1688.4, "completions/mean_length": 241.26953125, "completions/mean_terminated_length": 181.87459869384764, "completions/min_length": 60.4, "completions/min_terminated_length": 60.4, "entropy": 0.1700191461481154, "epoch": 0.6209850107066381, "frac_reward_zero_std": 0.59375, "grad_norm": 0.96484375, "learning_rate": 9.971100000000002e-06, "loss": -0.021, "num_tokens": 31674719.0, "reward": 0.9080469012260437, "reward_std": 0.3793750494718552, "rewards/reward_accuracy/mean": 0.8109375, "rewards/reward_accuracy/std": 0.3737005114555359, "rewards/reward_format/mean": 0.0971093751490116, "rewards/reward_format/std": 0.014068746450357139, "sampling/importance_sampling_ratio/max": 2.3827908635139465, "sampling/importance_sampling_ratio/mean": 0.9718930125236511, "sampling/importance_sampling_ratio/min": 0.025338194519281387, "sampling/sampling_logp_difference/max": 0.6687077581882477, "sampling/sampling_logp_difference/mean": 0.006832589814439416, "step": 290, "step_time": 10.044561673887074 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.03046875, "completions/max_length": 1865.6, "completions/max_terminated_length": 1546.9, "completions/mean_length": 222.88515625, "completions/mean_terminated_length": 166.32235946655274, "completions/min_length": 58.4, "completions/min_terminated_length": 58.4, "entropy": 0.16172117525711655, "epoch": 0.6423982869379015, "frac_reward_zero_std": 0.53125, "grad_norm": 0.80859375, "learning_rate": 9.9701e-06, "loss": -0.0137, "num_tokens": 32757929.0, "reward": 0.8890625298023224, "reward_std": 0.3926051750779152, "rewards/reward_accuracy/mean": 0.791796875, "rewards/reward_accuracy/std": 0.3882806658744812, "rewards/reward_format/mean": 0.09726562649011612, "rewards/reward_format/std": 0.012594443932175636, "sampling/importance_sampling_ratio/max": 2.391991472244263, "sampling/importance_sampling_ratio/mean": 0.9688705980777741, "sampling/importance_sampling_ratio/min": 0.09966090116649866, "sampling/sampling_logp_difference/max": 0.7618421196937561, "sampling/sampling_logp_difference/mean": 0.0067974757868796585, "step": 300, "step_time": 9.044813453406096 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 1.3995944755151867e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 1.3995944755151867e-06, "completions/clipped_ratio": 0.0359375, "completions/max_length": 2047.2, "completions/max_terminated_length": 1873.8, "completions/mean_length": 255.838671875, "completions/mean_terminated_length": 189.53061218261718, "completions/min_length": 53.9, "completions/min_terminated_length": 53.9, "entropy": 0.1894565925002098, "epoch": 0.6638115631691649, "frac_reward_zero_std": 0.53125, "grad_norm": 0.6953125, "learning_rate": 9.9691e-06, "loss": -0.0134, "num_tokens": 33930668.0, "reward": 0.9082617580890655, "reward_std": 0.3862216055393219, "rewards/reward_accuracy/mean": 0.81171875, "rewards/reward_accuracy/std": 0.3800092667341232, "rewards/reward_format/mean": 0.09654297158122063, "rewards/reward_format/std": 0.014839219022542238, "sampling/importance_sampling_ratio/max": 2.6181864023208616, "sampling/importance_sampling_ratio/mean": 0.969225960969925, "sampling/importance_sampling_ratio/min": 0.029908512905240058, "sampling/sampling_logp_difference/max": 0.7967680513858795, "sampling/sampling_logp_difference/mean": 0.007359995786100626, "step": 310, "step_time": 10.448391663143411 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.030859375, "completions/max_length": 1927.8, "completions/max_terminated_length": 1774.6, "completions/mean_length": 243.758984375, "completions/mean_terminated_length": 187.3535903930664, "completions/min_length": 56.2, "completions/min_terminated_length": 56.2, "entropy": 0.1740737314336002, "epoch": 0.6852248394004282, "frac_reward_zero_std": 0.5375, "grad_norm": 0.64453125, "learning_rate": 9.9681e-06, "loss": -0.0205, "num_tokens": 35065587.0, "reward": 0.9232031464576721, "reward_std": 0.37546863555908205, "rewards/reward_accuracy/mean": 0.82578125, "rewards/reward_accuracy/std": 0.3709150403738022, "rewards/reward_format/mean": 0.09742187485098838, "rewards/reward_format/std": 0.012454511737450958, "sampling/importance_sampling_ratio/max": 2.53350989818573, "sampling/importance_sampling_ratio/mean": 0.973149162530899, "sampling/importance_sampling_ratio/min": 0.019597774744033812, "sampling/sampling_logp_difference/max": 0.7022489726543426, "sampling/sampling_logp_difference/mean": 0.0070005951449275015, "step": 320, "step_time": 9.585384701751172 }, { "clip_ratio/high_max": 1.1748520046239719e-05, "clip_ratio/high_mean": 1.4685650057799649e-06, "clip_ratio/low_mean": 2.43531803789665e-07, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 1.71209680956963e-06, "completions/clipped_ratio": 0.034375, "completions/max_length": 2048.0, "completions/max_terminated_length": 1883.2, "completions/mean_length": 264.35, "completions/mean_terminated_length": 201.17511291503905, "completions/min_length": 59.2, "completions/min_terminated_length": 59.2, "entropy": 0.17365004699677228, "epoch": 0.7066381156316917, "frac_reward_zero_std": 0.55, "grad_norm": 0.93359375, "learning_rate": 9.9671e-06, "loss": -0.0177, "num_tokens": 36257187.0, "reward": 0.9108984649181366, "reward_std": 0.37933125495910647, "rewards/reward_accuracy/mean": 0.8140625, "rewards/reward_accuracy/std": 0.373566797375679, "rewards/reward_format/mean": 0.09683593809604644, "rewards/reward_format/std": 0.01464303294196725, "sampling/importance_sampling_ratio/max": 2.486626124382019, "sampling/importance_sampling_ratio/mean": 0.9737859606742859, "sampling/importance_sampling_ratio/min": 0.008127313852310181, "sampling/sampling_logp_difference/max": 0.5564516663551331, "sampling/sampling_logp_difference/mean": 0.007042309362441301, "step": 330, "step_time": 10.344654870778323 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.02734375, "completions/max_length": 2004.2, "completions/max_terminated_length": 1669.7, "completions/mean_length": 240.04609375, "completions/mean_terminated_length": 189.60863800048827, "completions/min_length": 58.4, "completions/min_terminated_length": 58.4, "entropy": 0.1593780721537769, "epoch": 0.728051391862955, "frac_reward_zero_std": 0.65, "grad_norm": 0.6484375, "learning_rate": 9.966100000000001e-06, "loss": -0.0086, "num_tokens": 37388457.0, "reward": 0.946191418170929, "reward_std": 0.3363088212907314, "rewards/reward_accuracy/mean": 0.848828125, "rewards/reward_accuracy/std": 0.33088704720139506, "rewards/reward_format/mean": 0.09736328348517417, "rewards/reward_format/std": 0.01318122362717986, "sampling/importance_sampling_ratio/max": 2.484243428707123, "sampling/importance_sampling_ratio/mean": 0.9750512480735779, "sampling/importance_sampling_ratio/min": 0.06507635908201337, "sampling/sampling_logp_difference/max": 1.0773602604866028, "sampling/sampling_logp_difference/mean": 0.0066701351199299095, "step": 340, "step_time": 9.722053058492019 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 4.0657213276062976e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 4.0657213276062976e-06, "completions/clipped_ratio": 0.02578125, "completions/max_length": 1986.1, "completions/max_terminated_length": 1758.9, "completions/mean_length": 243.049609375, "completions/mean_terminated_length": 196.4989273071289, "completions/min_length": 59.0, "completions/min_terminated_length": 59.0, "entropy": 0.156508687697351, "epoch": 0.7494646680942184, "frac_reward_zero_std": 0.56875, "grad_norm": 0.443359375, "learning_rate": 9.9651e-06, "loss": -0.0255, "num_tokens": 38525160.0, "reward": 0.9014062762260437, "reward_std": 0.3857307225465775, "rewards/reward_accuracy/mean": 0.80390625, "rewards/reward_accuracy/std": 0.38176355361938474, "rewards/reward_format/mean": 0.09750000163912773, "rewards/reward_format/std": 0.011372792162001133, "sampling/importance_sampling_ratio/max": 2.3971022725105287, "sampling/importance_sampling_ratio/mean": 0.9723467946052551, "sampling/importance_sampling_ratio/min": 0.024745873548090457, "sampling/sampling_logp_difference/max": 0.8578663825988769, "sampling/sampling_logp_difference/mean": 0.006737873097881675, "step": 350, "step_time": 9.591641079029069 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.026171875, "completions/max_length": 2048.0, "completions/max_terminated_length": 1856.6, "completions/mean_length": 249.4359375, "completions/mean_terminated_length": 201.11819305419922, "completions/min_length": 60.6, "completions/min_terminated_length": 60.6, "entropy": 0.1731101487763226, "epoch": 0.7708779443254818, "frac_reward_zero_std": 0.56875, "grad_norm": 0.515625, "learning_rate": 9.964100000000002e-06, "loss": -0.0183, "num_tokens": 39680164.0, "reward": 0.913945347070694, "reward_std": 0.38735567331314086, "rewards/reward_accuracy/mean": 0.81640625, "rewards/reward_accuracy/std": 0.3824517846107483, "rewards/reward_format/mean": 0.09753906354308128, "rewards/reward_format/std": 0.012624129373580217, "sampling/importance_sampling_ratio/max": 2.374484491348267, "sampling/importance_sampling_ratio/mean": 0.959593939781189, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 0.8827651739120483, "sampling/sampling_logp_difference/mean": 0.007277814205735922, "step": 360, "step_time": 10.163435412803665 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.032421875, "completions/max_length": 2048.0, "completions/max_terminated_length": 1840.2, "completions/mean_length": 280.035546875, "completions/mean_terminated_length": 221.68175201416017, "completions/min_length": 69.5, "completions/min_terminated_length": 69.5, "entropy": 0.1854695539921522, "epoch": 0.7922912205567452, "frac_reward_zero_std": 0.55625, "grad_norm": 0.490234375, "learning_rate": 9.963100000000001e-06, "loss": -0.0137, "num_tokens": 40921935.0, "reward": 0.9070703446865082, "reward_std": 0.3847604036331177, "rewards/reward_accuracy/mean": 0.809765625, "rewards/reward_accuracy/std": 0.38051430881023407, "rewards/reward_format/mean": 0.09730469062924385, "rewards/reward_format/std": 0.013218967290595175, "sampling/importance_sampling_ratio/max": 2.6249274253845214, "sampling/importance_sampling_ratio/mean": 0.971048891544342, "sampling/importance_sampling_ratio/min": 0.028328332304954528, "sampling/sampling_logp_difference/max": 0.739021098613739, "sampling/sampling_logp_difference/mean": 0.00765662482008338, "step": 370, "step_time": 10.352117173140869 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01953125, "completions/max_length": 2048.0, "completions/max_terminated_length": 1734.7, "completions/mean_length": 257.50390625, "completions/mean_terminated_length": 222.2868682861328, "completions/min_length": 71.3, "completions/min_terminated_length": 71.3, "entropy": 0.17140506599098443, "epoch": 0.8137044967880086, "frac_reward_zero_std": 0.5625, "grad_norm": 0.392578125, "learning_rate": 9.9621e-06, "loss": -0.01, "num_tokens": 42102777.0, "reward": 0.9027929961681366, "reward_std": 0.39035768806934357, "rewards/reward_accuracy/mean": 0.805078125, "rewards/reward_accuracy/std": 0.3870938867330551, "rewards/reward_format/mean": 0.09771484583616256, "rewards/reward_format/std": 0.011916212178766728, "sampling/importance_sampling_ratio/max": 2.500334119796753, "sampling/importance_sampling_ratio/mean": 0.9583327412605286, "sampling/importance_sampling_ratio/min": 0.028504961729049684, "sampling/sampling_logp_difference/max": 0.8735279023647309, "sampling/sampling_logp_difference/mean": 0.007211259100586176, "step": 380, "step_time": 9.588018673239276 }, { "clip_ratio/high_max": 4.5843571570003405e-06, "clip_ratio/high_mean": 5.730446446250426e-07, "clip_ratio/low_mean": 2.916371659011929e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 3.4894163036369717e-06, "completions/clipped_ratio": 0.0515625, "completions/max_length": 2048.0, "completions/max_terminated_length": 1902.1, "completions/mean_length": 347.1296875, "completions/mean_terminated_length": 255.3552017211914, "completions/min_length": 69.6, "completions/min_terminated_length": 69.6, "entropy": 0.20872693238779902, "epoch": 0.8351177730192719, "frac_reward_zero_std": 0.53125, "grad_norm": 0.7890625, "learning_rate": 9.961100000000002e-06, "loss": -0.0178, "num_tokens": 43512853.0, "reward": 0.8889843940734863, "reward_std": 0.3965169578790665, "rewards/reward_accuracy/mean": 0.79375, "rewards/reward_accuracy/std": 0.3892934888601303, "rewards/reward_format/mean": 0.09523437544703484, "rewards/reward_format/std": 0.017362049035727977, "sampling/importance_sampling_ratio/max": 2.548991823196411, "sampling/importance_sampling_ratio/mean": 0.9541543066501618, "sampling/importance_sampling_ratio/min": 0.003933326341211796, "sampling/sampling_logp_difference/max": 1.1129199504852294, "sampling/sampling_logp_difference/mean": 0.007965518347918987, "step": 390, "step_time": 10.551881514443085 }, { "clip_ratio/high_max": 3.838818520307541e-05, "clip_ratio/high_mean": 4.798523150384426e-06, "clip_ratio/low_mean": 1.3575270259025274e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 6.1560501762869535e-06, "completions/clipped_ratio": 0.034765625, "completions/max_length": 2027.3, "completions/max_terminated_length": 1800.1, "completions/mean_length": 305.10234375, "completions/mean_terminated_length": 242.8255615234375, "completions/min_length": 69.3, "completions/min_terminated_length": 69.3, "entropy": 0.18811013512313365, "epoch": 0.8565310492505354, "frac_reward_zero_std": 0.4875, "grad_norm": 0.56640625, "learning_rate": 9.9601e-06, "loss": -0.0279, "num_tokens": 44813483.0, "reward": 0.9067383170127868, "reward_std": 0.3815540254116058, "rewards/reward_accuracy/mean": 0.81015625, "rewards/reward_accuracy/std": 0.37652423679828645, "rewards/reward_format/mean": 0.09658203199505806, "rewards/reward_format/std": 0.014022546214982867, "sampling/importance_sampling_ratio/max": 2.5536146640777586, "sampling/importance_sampling_ratio/mean": 0.9643799722194671, "sampling/importance_sampling_ratio/min": 0.04218380991369486, "sampling/sampling_logp_difference/max": 0.8127229809761047, "sampling/sampling_logp_difference/mean": 0.007687526987865567, "step": 400, "step_time": 10.01983220828697 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.038671875, "completions/max_length": 2048.0, "completions/max_terminated_length": 1909.1, "completions/mean_length": 325.069140625, "completions/mean_terminated_length": 257.21341705322266, "completions/min_length": 70.0, "completions/min_terminated_length": 70.0, "entropy": 0.1918898713774979, "epoch": 0.8779443254817987, "frac_reward_zero_std": 0.5, "grad_norm": 0.67578125, "learning_rate": 9.959100000000001e-06, "loss": -0.0244, "num_tokens": 46161708.0, "reward": 0.9185351669788361, "reward_std": 0.3770617499947548, "rewards/reward_accuracy/mean": 0.823046875, "rewards/reward_accuracy/std": 0.36939083486795427, "rewards/reward_format/mean": 0.09548828303813935, "rewards/reward_format/std": 0.01631742054596543, "sampling/importance_sampling_ratio/max": 2.6512885093688965, "sampling/importance_sampling_ratio/mean": 0.9551392495632172, "sampling/importance_sampling_ratio/min": 0.0007175346370786428, "sampling/sampling_logp_difference/max": 0.9529674530029297, "sampling/sampling_logp_difference/mean": 0.007559870183467865, "step": 410, "step_time": 10.051076735369861 }, { "clip_ratio/high_max": 8.81730520632118e-06, "clip_ratio/high_mean": 1.1021631507901474e-06, "clip_ratio/low_mean": 4.944620286551071e-07, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 1.5966251794452546e-06, "completions/clipped_ratio": 0.04140625, "completions/max_length": 2048.0, "completions/max_terminated_length": 1977.0, "completions/mean_length": 325.872265625, "completions/mean_terminated_length": 252.52786865234376, "completions/min_length": 72.4, "completions/min_terminated_length": 72.4, "entropy": 0.187678805552423, "epoch": 0.8993576017130621, "frac_reward_zero_std": 0.53125, "grad_norm": 0.400390625, "learning_rate": 9.9581e-06, "loss": -0.0174, "num_tokens": 47508197.0, "reward": 0.9377343714237213, "reward_std": 0.36066080033779147, "rewards/reward_accuracy/mean": 0.841796875, "rewards/reward_accuracy/std": 0.3541706711053848, "rewards/reward_format/mean": 0.09593750014901162, "rewards/reward_format/std": 0.015351274725981056, "sampling/importance_sampling_ratio/max": 2.430267000198364, "sampling/importance_sampling_ratio/mean": 0.9507900536060333, "sampling/importance_sampling_ratio/min": 0.004503031075000763, "sampling/sampling_logp_difference/max": 0.9439579486846924, "sampling/sampling_logp_difference/mean": 0.0074990865308791396, "step": 420, "step_time": 10.541121458448469 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.032421875, "completions/max_length": 2048.0, "completions/max_terminated_length": 1747.4, "completions/mean_length": 277.1703125, "completions/mean_terminated_length": 218.22617950439454, "completions/min_length": 67.4, "completions/min_terminated_length": 67.4, "entropy": 0.1714092081412673, "epoch": 0.9207708779443254, "frac_reward_zero_std": 0.525, "grad_norm": 0.52734375, "learning_rate": 9.9571e-06, "loss": -0.0192, "num_tokens": 48731257.0, "reward": 0.9036133170127869, "reward_std": 0.3916765213012695, "rewards/reward_accuracy/mean": 0.806640625, "rewards/reward_accuracy/std": 0.387202051281929, "rewards/reward_format/mean": 0.0969726599752903, "rewards/reward_format/std": 0.014364734757691622, "sampling/importance_sampling_ratio/max": 2.596026027202606, "sampling/importance_sampling_ratio/mean": 0.9620015501976014, "sampling/importance_sampling_ratio/min": 0.0063359834253788, "sampling/sampling_logp_difference/max": 1.0208206593990325, "sampling/sampling_logp_difference/mean": 0.007242908468469977, "step": 430, "step_time": 9.786764906905592 }, { "clip_ratio/high_max": 2.01439735974418e-05, "clip_ratio/high_mean": 2.517996699680225e-06, "clip_ratio/low_mean": 9.739903816807782e-07, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 3.4919871040983706e-06, "completions/clipped_ratio": 0.0359375, "completions/max_length": 2037.0, "completions/max_terminated_length": 1688.6, "completions/mean_length": 255.098828125, "completions/mean_terminated_length": 189.12000274658203, "completions/min_length": 65.5, "completions/min_terminated_length": 65.5, "entropy": 0.15656299758702516, "epoch": 0.9421841541755889, "frac_reward_zero_std": 0.6125, "grad_norm": 0.60546875, "learning_rate": 9.956100000000001e-06, "loss": -0.018, "num_tokens": 49899350.0, "reward": 0.9350195586681366, "reward_std": 0.355120287835598, "rewards/reward_accuracy/mean": 0.83828125, "rewards/reward_accuracy/std": 0.3485265925526619, "rewards/reward_format/mean": 0.09673828333616256, "rewards/reward_format/std": 0.014138400694355369, "sampling/importance_sampling_ratio/max": 2.481461238861084, "sampling/importance_sampling_ratio/mean": 0.9668399870395661, "sampling/importance_sampling_ratio/min": 0.01682160682976246, "sampling/sampling_logp_difference/max": 0.9277780771255493, "sampling/sampling_logp_difference/mean": 0.006879035336896777, "step": 440, "step_time": 10.007247812207789 }, { "clip_ratio/high_max": 1.0415567885502242e-05, "clip_ratio/high_mean": 1.3019459856877802e-06, "clip_ratio/low_mean": 3.6564422316587297e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 4.95838821734651e-06, "completions/clipped_ratio": 0.0453125, "completions/max_length": 2048.0, "completions/max_terminated_length": 1920.9, "completions/mean_length": 312.41484375, "completions/mean_terminated_length": 230.57459869384766, "completions/min_length": 68.8, "completions/min_terminated_length": 68.8, "entropy": 0.17350522577762603, "epoch": 0.9635974304068522, "frac_reward_zero_std": 0.5125, "grad_norm": 0.453125, "learning_rate": 9.9551e-06, "loss": -0.0174, "num_tokens": 51222972.0, "reward": 0.8985351860523224, "reward_std": 0.3932229146361351, "rewards/reward_accuracy/mean": 0.803125, "rewards/reward_accuracy/std": 0.38510433584451675, "rewards/reward_format/mean": 0.09541015923023224, "rewards/reward_format/std": 0.01737673571333289, "sampling/importance_sampling_ratio/max": 2.64971067905426, "sampling/importance_sampling_ratio/mean": 0.9680018961429596, "sampling/importance_sampling_ratio/min": 0.028821493685245513, "sampling/sampling_logp_difference/max": 0.9253865599632263, "sampling/sampling_logp_difference/mean": 0.007327090157195926, "step": 450, "step_time": 10.35472412025556 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.02890625, "completions/max_length": 2048.0, "completions/max_terminated_length": 1748.4, "completions/mean_length": 260.33203125, "completions/mean_terminated_length": 207.88331909179686, "completions/min_length": 70.2, "completions/min_terminated_length": 70.2, "entropy": 0.1579513200558722, "epoch": 0.9850107066381156, "frac_reward_zero_std": 0.53125, "grad_norm": 0.58984375, "learning_rate": 9.954100000000002e-06, "loss": -0.0209, "num_tokens": 52406174.0, "reward": 0.9207422256469726, "reward_std": 0.36950855404138566, "rewards/reward_accuracy/mean": 0.823828125, "rewards/reward_accuracy/std": 0.3641737073659897, "rewards/reward_format/mean": 0.09691406562924385, "rewards/reward_format/std": 0.01354732143227011, "sampling/importance_sampling_ratio/max": 2.526651310920715, "sampling/importance_sampling_ratio/mean": 0.9677818238735199, "sampling/importance_sampling_ratio/min": 0.0559950752183795, "sampling/sampling_logp_difference/max": 0.7780696809291839, "sampling/sampling_logp_difference/mean": 0.0068999271839857105, "step": 460, "step_time": 9.815864898869767 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.021484375, "completions/max_length": 1990.7, "completions/max_terminated_length": 1844.0, "completions/mean_length": 247.717578125, "completions/mean_terminated_length": 208.5499008178711, "completions/min_length": 71.5, "completions/min_terminated_length": 71.5, "entropy": 0.15766270095482468, "epoch": 1.006423982869379, "frac_reward_zero_std": 0.575, "grad_norm": 0.4453125, "learning_rate": 9.953100000000001e-06, "loss": -0.0189, "num_tokens": 53554299.0, "reward": 0.943457055091858, "reward_std": 0.35581323206424714, "rewards/reward_accuracy/mean": 0.84609375, "rewards/reward_accuracy/std": 0.3515170902013779, "rewards/reward_format/mean": 0.09736328199505806, "rewards/reward_format/std": 0.01258778024930507, "sampling/importance_sampling_ratio/max": 2.5598071098327635, "sampling/importance_sampling_ratio/mean": 0.9684597015380859, "sampling/importance_sampling_ratio/min": 0.005463468376547098, "sampling/sampling_logp_difference/max": 0.7644032418727875, "sampling/sampling_logp_difference/mean": 0.0068299718201160434, "step": 470, "step_time": 9.484886160073803 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.035546875, "completions/max_length": 2048.0, "completions/max_terminated_length": 1783.1, "completions/mean_length": 282.96796875, "completions/mean_terminated_length": 218.73411254882814, "completions/min_length": 75.3, "completions/min_terminated_length": 75.3, "entropy": 0.17674043383449317, "epoch": 1.0278372591006424, "frac_reward_zero_std": 0.55, "grad_norm": 0.90625, "learning_rate": 9.9521e-06, "loss": -0.0186, "num_tokens": 54799017.0, "reward": 0.9402929782867432, "reward_std": 0.3594707578420639, "rewards/reward_accuracy/mean": 0.844140625, "rewards/reward_accuracy/std": 0.3525505632162094, "rewards/reward_format/mean": 0.09615234509110451, "rewards/reward_format/std": 0.01583651443943381, "sampling/importance_sampling_ratio/max": 2.4566887855529784, "sampling/importance_sampling_ratio/mean": 0.9579463243484497, "sampling/importance_sampling_ratio/min": 0.004989023040980101, "sampling/sampling_logp_difference/max": 0.6944355010986328, "sampling/sampling_logp_difference/mean": 0.007241506455466151, "step": 480, "step_time": 10.14735255483538 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 3.049388305953471e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 3.049388305953471e-06, "completions/clipped_ratio": 0.034375, "completions/max_length": 2007.8, "completions/max_terminated_length": 1811.7, "completions/mean_length": 253.495703125, "completions/mean_terminated_length": 189.98597869873046, "completions/min_length": 66.4, "completions/min_terminated_length": 66.4, "entropy": 0.16617674194276333, "epoch": 1.0492505353319057, "frac_reward_zero_std": 0.56875, "grad_norm": 0.69921875, "learning_rate": 9.951100000000002e-06, "loss": -0.0094, "num_tokens": 55965678.0, "reward": 0.9102344214916229, "reward_std": 0.3847487300634384, "rewards/reward_accuracy/mean": 0.813671875, "rewards/reward_accuracy/std": 0.378129655122757, "rewards/reward_format/mean": 0.09656250104308128, "rewards/reward_format/std": 0.015593840973451734, "sampling/importance_sampling_ratio/max": 2.498990845680237, "sampling/importance_sampling_ratio/mean": 0.9665201961994171, "sampling/importance_sampling_ratio/min": 0.007892926782369613, "sampling/sampling_logp_difference/max": 0.7775724828243256, "sampling/sampling_logp_difference/mean": 0.007170763006433845, "step": 490, "step_time": 9.943986208271236 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 2.4390127464357647e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 2.4390127464357647e-06, "completions/clipped_ratio": 0.02265625, "completions/max_length": 2045.2, "completions/max_terminated_length": 1822.0, "completions/mean_length": 232.826171875, "completions/mean_terminated_length": 191.10270233154296, "completions/min_length": 69.5, "completions/min_terminated_length": 69.5, "entropy": 0.15125867817550898, "epoch": 1.0706638115631693, "frac_reward_zero_std": 0.58125, "grad_norm": 0.7265625, "learning_rate": 9.9501e-06, "loss": -0.026, "num_tokens": 57079697.0, "reward": 0.939238303899765, "reward_std": 0.34797793328762056, "rewards/reward_accuracy/mean": 0.841796875, "rewards/reward_accuracy/std": 0.34288529753685, "rewards/reward_format/mean": 0.09744140803813935, "rewards/reward_format/std": 0.012741397391073406, "sampling/importance_sampling_ratio/max": 2.255339705944061, "sampling/importance_sampling_ratio/mean": 0.9672765374183655, "sampling/importance_sampling_ratio/min": 0.06362132839858532, "sampling/sampling_logp_difference/max": 0.7051827192306519, "sampling/sampling_logp_difference/mean": 0.006754382792860269, "step": 500, "step_time": 9.722729661036283 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.012890625, "completions/max_length": 1836.0, "completions/max_terminated_length": 1516.0, "completions/mean_length": 202.510546875, "completions/mean_terminated_length": 178.56044006347656, "completions/min_length": 70.6, "completions/min_terminated_length": 70.6, "entropy": 0.13655630815774203, "epoch": 1.0920770877944326, "frac_reward_zero_std": 0.6, "grad_norm": 0.8359375, "learning_rate": 9.949100000000001e-06, "loss": -0.0061, "num_tokens": 58122620.0, "reward": 0.9682226717472077, "reward_std": 0.333330275118351, "rewards/reward_accuracy/mean": 0.86953125, "rewards/reward_accuracy/std": 0.33052612394094466, "rewards/reward_format/mean": 0.09869140908122062, "rewards/reward_format/std": 0.009017979027703404, "sampling/importance_sampling_ratio/max": 2.6004796743392946, "sampling/importance_sampling_ratio/mean": 0.9905089139938354, "sampling/importance_sampling_ratio/min": 0.12283982932567597, "sampling/sampling_logp_difference/max": 0.7029530525207519, "sampling/sampling_logp_difference/mean": 0.006430687848478556, "step": 510, "step_time": 8.651938113430514 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01953125, "completions/max_length": 2048.0, "completions/max_terminated_length": 1789.1, "completions/mean_length": 234.337109375, "completions/mean_terminated_length": 198.20711822509764, "completions/min_length": 70.9, "completions/min_terminated_length": 70.9, "entropy": 0.15276043806225062, "epoch": 1.113490364025696, "frac_reward_zero_std": 0.6125, "grad_norm": 0.69921875, "learning_rate": 9.9481e-06, "loss": -0.0184, "num_tokens": 59239675.0, "reward": 0.9490429937839509, "reward_std": 0.3499227106571198, "rewards/reward_accuracy/mean": 0.851171875, "rewards/reward_accuracy/std": 0.3454223096370697, "rewards/reward_format/mean": 0.0978710949420929, "rewards/reward_format/std": 0.011833475576713682, "sampling/importance_sampling_ratio/max": 2.3916098356246946, "sampling/importance_sampling_ratio/mean": 0.9649648070335388, "sampling/importance_sampling_ratio/min": 0.030473802238702774, "sampling/sampling_logp_difference/max": 0.6736026883125306, "sampling/sampling_logp_difference/mean": 0.006766516668722034, "step": 520, "step_time": 9.737047488987447 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.019140625, "completions/max_length": 1877.8, "completions/max_terminated_length": 1586.6, "completions/mean_length": 244.138671875, "completions/mean_terminated_length": 209.54840393066405, "completions/min_length": 74.5, "completions/min_terminated_length": 74.5, "entropy": 0.14895990611985327, "epoch": 1.1349036402569592, "frac_reward_zero_std": 0.625, "grad_norm": 0.64453125, "learning_rate": 9.9471e-06, "loss": -0.0068, "num_tokens": 60385726.0, "reward": 0.9239844083786011, "reward_std": 0.3754288852214813, "rewards/reward_accuracy/mean": 0.82578125, "rewards/reward_accuracy/std": 0.37216812670230864, "rewards/reward_format/mean": 0.0982031248509884, "rewards/reward_format/std": 0.010030061751604081, "sampling/importance_sampling_ratio/max": 2.5723390102386476, "sampling/importance_sampling_ratio/mean": 0.9725699186325073, "sampling/importance_sampling_ratio/min": 0.048116151988506314, "sampling/sampling_logp_difference/max": 0.6766499698162078, "sampling/sampling_logp_difference/mean": 0.006519828783348202, "step": 530, "step_time": 9.075996103417129 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.020703125, "completions/max_length": 2038.5, "completions/max_terminated_length": 1890.6, "completions/mean_length": 255.322265625, "completions/mean_terminated_length": 218.3919464111328, "completions/min_length": 73.9, "completions/min_terminated_length": 73.9, "entropy": 0.1585966265760362, "epoch": 1.1563169164882228, "frac_reward_zero_std": 0.59375, "grad_norm": 0.70703125, "learning_rate": 9.946100000000001e-06, "loss": -0.0213, "num_tokens": 61555591.0, "reward": 0.9469140768051147, "reward_std": 0.3444708287715912, "rewards/reward_accuracy/mean": 0.84921875, "rewards/reward_accuracy/std": 0.3408248633146286, "rewards/reward_format/mean": 0.09769531339406967, "rewards/reward_format/std": 0.011227904516272248, "sampling/importance_sampling_ratio/max": 2.6657587051391602, "sampling/importance_sampling_ratio/mean": 0.9695823192596436, "sampling/importance_sampling_ratio/min": 0.026576372142881156, "sampling/sampling_logp_difference/max": 0.7909226059913635, "sampling/sampling_logp_difference/mean": 0.006891067046672106, "step": 540, "step_time": 9.791422115033493 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 2.736554642979172e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 2.736554642979172e-06, "completions/clipped_ratio": 0.03046875, "completions/max_length": 2048.0, "completions/max_terminated_length": 1733.8, "completions/mean_length": 266.4078125, "completions/mean_terminated_length": 210.98098754882812, "completions/min_length": 75.7, "completions/min_terminated_length": 75.7, "entropy": 0.1736724109388888, "epoch": 1.177730192719486, "frac_reward_zero_std": 0.575, "grad_norm": 0.75, "learning_rate": 9.9451e-06, "loss": -0.0225, "num_tokens": 62753067.0, "reward": 0.9583398640155792, "reward_std": 0.3437022387981415, "rewards/reward_accuracy/mean": 0.8609375, "rewards/reward_accuracy/std": 0.3383584558963776, "rewards/reward_format/mean": 0.09740234613418579, "rewards/reward_format/std": 0.012713893176987767, "sampling/importance_sampling_ratio/max": 2.535644018650055, "sampling/importance_sampling_ratio/mean": 0.9694399416446686, "sampling/importance_sampling_ratio/min": 0.0279288150370121, "sampling/sampling_logp_difference/max": 1.079693728685379, "sampling/sampling_logp_difference/mean": 0.0071603016462177035, "step": 550, "step_time": 9.984118106076494 }, { "clip_ratio/high_max": 8.11161589808762e-06, "clip_ratio/high_mean": 1.0139519872609526e-06, "clip_ratio/low_mean": 3.5927798762713793e-07, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 1.3732299748880905e-06, "completions/clipped_ratio": 0.012109375, "completions/max_length": 1985.6, "completions/max_terminated_length": 1619.3, "completions/mean_length": 190.095703125, "completions/mean_terminated_length": 167.40203704833985, "completions/min_length": 64.0, "completions/min_terminated_length": 64.0, "entropy": 0.12261172058060765, "epoch": 1.1991434689507494, "frac_reward_zero_std": 0.68125, "grad_norm": 0.54296875, "learning_rate": 9.9441e-06, "loss": -0.0086, "num_tokens": 63751072.0, "reward": 0.9855273425579071, "reward_std": 0.31273077577352526, "rewards/reward_accuracy/mean": 0.88671875, "rewards/reward_accuracy/std": 0.30950316935777666, "rewards/reward_format/mean": 0.09880859479308128, "rewards/reward_format/std": 0.008623425848782063, "sampling/importance_sampling_ratio/max": 2.364128589630127, "sampling/importance_sampling_ratio/mean": 0.9759804785251618, "sampling/importance_sampling_ratio/min": 0.0711412861943245, "sampling/sampling_logp_difference/max": 0.7094807982444763, "sampling/sampling_logp_difference/mean": 0.0057958280202001335, "step": 560, "step_time": 9.401468964433297 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.023828125, "completions/max_length": 2002.1, "completions/max_terminated_length": 1700.1, "completions/mean_length": 246.259765625, "completions/mean_terminated_length": 202.88703308105468, "completions/min_length": 71.3, "completions/min_terminated_length": 71.3, "entropy": 0.15033167283982038, "epoch": 1.2205567451820127, "frac_reward_zero_std": 0.6125, "grad_norm": 0.69140625, "learning_rate": 9.943100000000001e-06, "loss": -0.0275, "num_tokens": 64903225.0, "reward": 0.9204687893390655, "reward_std": 0.3749256819486618, "rewards/reward_accuracy/mean": 0.82265625, "rewards/reward_accuracy/std": 0.3708346337080002, "rewards/reward_format/mean": 0.09781250283122063, "rewards/reward_format/std": 0.011215825006365776, "sampling/importance_sampling_ratio/max": 2.493147075176239, "sampling/importance_sampling_ratio/mean": 0.9698342263698578, "sampling/importance_sampling_ratio/min": 0.01973040485754609, "sampling/sampling_logp_difference/max": 0.6820814609527588, "sampling/sampling_logp_difference/mean": 0.006548658199608326, "step": 570, "step_time": 9.721093765785918 }, { "clip_ratio/high_max": 2.588718562037684e-05, "clip_ratio/high_mean": 3.235898202547105e-06, "clip_ratio/low_mean": 1.8103213733411393e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 5.046219575888244e-06, "completions/clipped_ratio": 0.026171875, "completions/max_length": 2008.8, "completions/max_terminated_length": 1821.4, "completions/mean_length": 241.70859375, "completions/mean_terminated_length": 193.46966094970702, "completions/min_length": 60.5, "completions/min_terminated_length": 60.5, "entropy": 0.15281236721202732, "epoch": 1.2419700214132763, "frac_reward_zero_std": 0.575, "grad_norm": 0.5390625, "learning_rate": 9.942100000000001e-06, "loss": -0.02, "num_tokens": 66034719.0, "reward": 0.9504297137260437, "reward_std": 0.34881015717983244, "rewards/reward_accuracy/mean": 0.852734375, "rewards/reward_accuracy/std": 0.3446532905101776, "rewards/reward_format/mean": 0.09769531339406967, "rewards/reward_format/std": 0.01135781672783196, "sampling/importance_sampling_ratio/max": 2.261395752429962, "sampling/importance_sampling_ratio/mean": 0.9655756533145905, "sampling/importance_sampling_ratio/min": 0.029139625281095503, "sampling/sampling_logp_difference/max": 0.6548515439033509, "sampling/sampling_logp_difference/mean": 0.00650896318256855, "step": 580, "step_time": 10.07621797202155 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.027734375, "completions/max_length": 2033.9, "completions/max_terminated_length": 1799.5, "completions/mean_length": 236.78671875, "completions/mean_terminated_length": 185.28022003173828, "completions/min_length": 64.0, "completions/min_terminated_length": 64.0, "entropy": 0.1513898684643209, "epoch": 1.2633832976445396, "frac_reward_zero_std": 0.6625, "grad_norm": 0.337890625, "learning_rate": 9.941100000000002e-06, "loss": -0.0209, "num_tokens": 67153693.0, "reward": 0.9791406512260437, "reward_std": 0.3156343370676041, "rewards/reward_accuracy/mean": 0.88125, "rewards/reward_accuracy/std": 0.3117549866437912, "rewards/reward_format/mean": 0.09789062514901162, "rewards/reward_format/std": 0.010850324272178113, "sampling/importance_sampling_ratio/max": 2.593677306175232, "sampling/importance_sampling_ratio/mean": 0.9713839232921601, "sampling/importance_sampling_ratio/min": 0.022237093560397624, "sampling/sampling_logp_difference/max": 0.6016359806060791, "sampling/sampling_logp_difference/mean": 0.006623369408771396, "step": 590, "step_time": 10.035956812649966 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01953125, "completions/max_length": 1973.6, "completions/max_terminated_length": 1831.1, "completions/mean_length": 220.371875, "completions/mean_terminated_length": 184.33446350097657, "completions/min_length": 70.6, "completions/min_terminated_length": 70.6, "entropy": 0.14282382102683186, "epoch": 1.284796573875803, "frac_reward_zero_std": 0.625, "grad_norm": 0.625, "learning_rate": 9.9401e-06, "loss": -0.0127, "num_tokens": 68223349.0, "reward": 0.9734765887260437, "reward_std": 0.32734766900539397, "rewards/reward_accuracy/mean": 0.87578125, "rewards/reward_accuracy/std": 0.32240096032619475, "rewards/reward_format/mean": 0.09769531488418579, "rewards/reward_format/std": 0.011307045398280025, "sampling/importance_sampling_ratio/max": 2.5867155313491823, "sampling/importance_sampling_ratio/mean": 0.9762231826782226, "sampling/importance_sampling_ratio/min": 0.056274252105504276, "sampling/sampling_logp_difference/max": 0.7129928708076477, "sampling/sampling_logp_difference/mean": 0.006264035031199456, "step": 600, "step_time": 9.602599639073015 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.021875, "completions/max_length": 1990.9, "completions/max_terminated_length": 1825.0, "completions/mean_length": 233.9765625, "completions/mean_terminated_length": 193.8284149169922, "completions/min_length": 71.4, "completions/min_terminated_length": 71.4, "entropy": 0.13670694502070546, "epoch": 1.3062098501070665, "frac_reward_zero_std": 0.6125, "grad_norm": 0.58203125, "learning_rate": 9.939100000000001e-06, "loss": -0.0174, "num_tokens": 69340713.0, "reward": 0.9569922089576721, "reward_std": 0.34578508138656616, "rewards/reward_accuracy/mean": 0.859375, "rewards/reward_accuracy/std": 0.3406145006418228, "rewards/reward_format/mean": 0.09761718809604644, "rewards/reward_format/std": 0.0111768061760813, "sampling/importance_sampling_ratio/max": 2.4745423913002016, "sampling/importance_sampling_ratio/mean": 0.9789625883102417, "sampling/importance_sampling_ratio/min": 0.03890752345323563, "sampling/sampling_logp_difference/max": 0.8054025352001191, "sampling/sampling_logp_difference/mean": 0.006173065025359392, "step": 610, "step_time": 9.595619960594922 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.019140625, "completions/max_length": 2043.4, "completions/max_terminated_length": 1826.8, "completions/mean_length": 223.5265625, "completions/mean_terminated_length": 188.2144790649414, "completions/min_length": 70.3, "completions/min_terminated_length": 70.3, "entropy": 0.13695236938074232, "epoch": 1.3276231263383298, "frac_reward_zero_std": 0.6125, "grad_norm": 0.63671875, "learning_rate": 9.9381e-06, "loss": -0.0084, "num_tokens": 70425197.0, "reward": 0.9467578232288361, "reward_std": 0.35667126476764677, "rewards/reward_accuracy/mean": 0.848828125, "rewards/reward_accuracy/std": 0.3527708947658539, "rewards/reward_format/mean": 0.09792968928813935, "rewards/reward_format/std": 0.01060937091242522, "sampling/importance_sampling_ratio/max": 2.4067316889762878, "sampling/importance_sampling_ratio/mean": 0.9851578593254089, "sampling/importance_sampling_ratio/min": 0.0465527355670929, "sampling/sampling_logp_difference/max": 0.7730030059814453, "sampling/sampling_logp_difference/mean": 0.006319962162524462, "step": 620, "step_time": 9.777248504851013 }, { "clip_ratio/high_max": 2.545488314353861e-05, "clip_ratio/high_mean": 3.181860392942326e-06, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 3.181860392942326e-06, "completions/clipped_ratio": 0.03125, "completions/max_length": 1891.0, "completions/max_terminated_length": 1609.1, "completions/mean_length": 273.0171875, "completions/mean_terminated_length": 216.49644775390624, "completions/min_length": 66.9, "completions/min_terminated_length": 66.9, "entropy": 0.15398789923638107, "epoch": 1.3490364025695931, "frac_reward_zero_std": 0.59375, "grad_norm": 0.7109375, "learning_rate": 9.9371e-06, "loss": -0.0101, "num_tokens": 71642201.0, "reward": 0.9106640756130219, "reward_std": 0.3642830580472946, "rewards/reward_accuracy/mean": 0.813671875, "rewards/reward_accuracy/std": 0.35935564115643504, "rewards/reward_format/mean": 0.09699218794703483, "rewards/reward_format/std": 0.013189932238310576, "sampling/importance_sampling_ratio/max": 2.5063803434371947, "sampling/importance_sampling_ratio/mean": 0.9609185636043549, "sampling/importance_sampling_ratio/min": 0.038018787279725075, "sampling/sampling_logp_difference/max": 0.8188849091529846, "sampling/sampling_logp_difference/mean": 0.006627660803496837, "step": 630, "step_time": 9.675742756854742 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0171875, "completions/max_length": 2046.6, "completions/max_terminated_length": 1712.3, "completions/mean_length": 233.844921875, "completions/mean_terminated_length": 202.36591339111328, "completions/min_length": 66.8, "completions/min_terminated_length": 66.8, "entropy": 0.1377914204262197, "epoch": 1.3704496788008567, "frac_reward_zero_std": 0.65625, "grad_norm": 0.447265625, "learning_rate": 9.936100000000001e-06, "loss": -0.0102, "num_tokens": 72760060.0, "reward": 0.9477539420127868, "reward_std": 0.3499771744012833, "rewards/reward_accuracy/mean": 0.849609375, "rewards/reward_accuracy/std": 0.34618692100048065, "rewards/reward_format/mean": 0.09814453274011611, "rewards/reward_format/std": 0.009887455636635423, "sampling/importance_sampling_ratio/max": 2.5645956993103027, "sampling/importance_sampling_ratio/mean": 0.9841652810573578, "sampling/importance_sampling_ratio/min": 0.03556144703179598, "sampling/sampling_logp_difference/max": 0.6438291549682618, "sampling/sampling_logp_difference/mean": 0.0062292659189552065, "step": 640, "step_time": 9.657860070979222 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0140625, "completions/max_length": 2048.0, "completions/max_terminated_length": 1795.9, "completions/mean_length": 230.2125, "completions/mean_terminated_length": 204.4558563232422, "completions/min_length": 69.1, "completions/min_terminated_length": 69.1, "entropy": 0.14571338426321745, "epoch": 1.39186295503212, "frac_reward_zero_std": 0.575, "grad_norm": 0.54296875, "learning_rate": 9.9351e-06, "loss": -0.0211, "num_tokens": 73869308.0, "reward": 0.931914097070694, "reward_std": 0.3535457715392113, "rewards/reward_accuracy/mean": 0.83359375, "rewards/reward_accuracy/std": 0.35077162384986876, "rewards/reward_format/mean": 0.09832031354308128, "rewards/reward_format/std": 0.009559615980833769, "sampling/importance_sampling_ratio/max": 2.514175844192505, "sampling/importance_sampling_ratio/mean": 0.9772779464721679, "sampling/importance_sampling_ratio/min": 0.04472700320184231, "sampling/sampling_logp_difference/max": 0.908085036277771, "sampling/sampling_logp_difference/mean": 0.006749674072489142, "step": 650, "step_time": 9.650849735969677 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00546875, "completions/max_length": 1691.0, "completions/max_terminated_length": 1369.5, "completions/mean_length": 176.23046875, "completions/mean_terminated_length": 166.0182846069336, "completions/min_length": 64.8, "completions/min_terminated_length": 64.8, "entropy": 0.10370169095695018, "epoch": 1.4132762312633833, "frac_reward_zero_std": 0.6, "grad_norm": 0.9296875, "learning_rate": 9.9341e-06, "loss": -0.0131, "num_tokens": 74833018.0, "reward": 0.9841015875339508, "reward_std": 0.30473026558756827, "rewards/reward_accuracy/mean": 0.884765625, "rewards/reward_accuracy/std": 0.3034436784684658, "rewards/reward_format/mean": 0.0993359386920929, "rewards/reward_format/std": 0.005197879136539995, "sampling/importance_sampling_ratio/max": 2.4016508936882017, "sampling/importance_sampling_ratio/mean": 0.9813492953777313, "sampling/importance_sampling_ratio/min": 0.06504318906227127, "sampling/sampling_logp_difference/max": 0.7964857578277588, "sampling/sampling_logp_difference/mean": 0.005476095108315348, "step": 660, "step_time": 8.012326097209007 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0171875, "completions/max_length": 2045.7, "completions/max_terminated_length": 1836.7, "completions/mean_length": 247.865625, "completions/mean_terminated_length": 216.75238800048828, "completions/min_length": 79.7, "completions/min_terminated_length": 79.7, "entropy": 0.1431811224669218, "epoch": 1.4346895074946466, "frac_reward_zero_std": 0.5375, "grad_norm": 0.578125, "learning_rate": 9.933100000000002e-06, "loss": -0.0182, "num_tokens": 75987810.0, "reward": 0.9188086271286011, "reward_std": 0.3797665983438492, "rewards/reward_accuracy/mean": 0.820703125, "rewards/reward_accuracy/std": 0.376504048705101, "rewards/reward_format/mean": 0.09810546934604644, "rewards/reward_format/std": 0.010662907687947153, "sampling/importance_sampling_ratio/max": 2.491010880470276, "sampling/importance_sampling_ratio/mean": 0.9624502241611481, "sampling/importance_sampling_ratio/min": 0.019045909866690636, "sampling/sampling_logp_difference/max": 1.0775641560554505, "sampling/sampling_logp_difference/mean": 0.006694463174790144, "step": 670, "step_time": 9.739212415413931 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0265625, "completions/max_length": 2022.2, "completions/max_terminated_length": 1767.7, "completions/mean_length": 267.8890625, "completions/mean_terminated_length": 219.78734436035157, "completions/min_length": 77.9, "completions/min_terminated_length": 77.9, "entropy": 0.13868142189458013, "epoch": 1.45610278372591, "frac_reward_zero_std": 0.59375, "grad_norm": 0.5546875, "learning_rate": 9.932100000000001e-06, "loss": -0.0187, "num_tokens": 77196742.0, "reward": 0.8865039229393006, "reward_std": 0.4072133004665375, "rewards/reward_accuracy/mean": 0.788671875, "rewards/reward_accuracy/std": 0.4035623610019684, "rewards/reward_format/mean": 0.09783203229308128, "rewards/reward_format/std": 0.011461964668706059, "sampling/importance_sampling_ratio/max": 2.729620122909546, "sampling/importance_sampling_ratio/mean": 0.9661240994930267, "sampling/importance_sampling_ratio/min": 0.034035885240882635, "sampling/sampling_logp_difference/max": 0.7037467956542969, "sampling/sampling_logp_difference/mean": 0.0065780739765614275, "step": 680, "step_time": 9.795271350443363 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.026953125, "completions/max_length": 2048.0, "completions/max_terminated_length": 1675.4, "completions/mean_length": 285.02109375, "completions/mean_terminated_length": 237.00460052490234, "completions/min_length": 74.1, "completions/min_terminated_length": 74.1, "entropy": 0.15429682563990355, "epoch": 1.4775160599571735, "frac_reward_zero_std": 0.5875, "grad_norm": 0.99609375, "learning_rate": 9.9311e-06, "loss": -0.0133, "num_tokens": 78442332.0, "reward": 0.9418945610523224, "reward_std": 0.35663125813007357, "rewards/reward_accuracy/mean": 0.84453125, "rewards/reward_accuracy/std": 0.35166865587234497, "rewards/reward_format/mean": 0.09736328199505806, "rewards/reward_format/std": 0.013331192033365368, "sampling/importance_sampling_ratio/max": 2.44986355304718, "sampling/importance_sampling_ratio/mean": 0.9779297828674316, "sampling/importance_sampling_ratio/min": 0.02454649955034256, "sampling/sampling_logp_difference/max": 0.7294579923152924, "sampling/sampling_logp_difference/mean": 0.006937016034498811, "step": 690, "step_time": 10.016294634807855 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.025, "completions/max_length": 2048.0, "completions/max_terminated_length": 1769.2, "completions/mean_length": 253.318359375, "completions/mean_terminated_length": 207.69876403808593, "completions/min_length": 75.4, "completions/min_terminated_length": 75.4, "entropy": 0.14746147403493523, "epoch": 1.4989293361884368, "frac_reward_zero_std": 0.5625, "grad_norm": 1.03125, "learning_rate": 9.9301e-06, "loss": -0.0124, "num_tokens": 79603563.0, "reward": 0.9756836116313934, "reward_std": 0.32087922394275664, "rewards/reward_accuracy/mean": 0.877734375, "rewards/reward_accuracy/std": 0.3165073648095131, "rewards/reward_format/mean": 0.09794921800494194, "rewards/reward_format/std": 0.010957276029512287, "sampling/importance_sampling_ratio/max": 2.619251751899719, "sampling/importance_sampling_ratio/mean": 0.962170022726059, "sampling/importance_sampling_ratio/min": 0.0029962314292788506, "sampling/sampling_logp_difference/max": 0.7355899095535279, "sampling/sampling_logp_difference/mean": 0.0069349154364317656, "step": 700, "step_time": 9.907826334238052 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0265625, "completions/max_length": 2048.0, "completions/max_terminated_length": 1939.5, "completions/mean_length": 270.900390625, "completions/mean_terminated_length": 222.5992218017578, "completions/min_length": 78.5, "completions/min_terminated_length": 78.5, "entropy": 0.1445523993112147, "epoch": 1.5203426124197001, "frac_reward_zero_std": 0.59375, "grad_norm": 0.69921875, "learning_rate": 9.929100000000001e-06, "loss": -0.0173, "num_tokens": 80820844.0, "reward": 0.9514648795127869, "reward_std": 0.3500185519456863, "rewards/reward_accuracy/mean": 0.85390625, "rewards/reward_accuracy/std": 0.3444949328899384, "rewards/reward_format/mean": 0.09755859449505806, "rewards/reward_format/std": 0.013312468491494655, "sampling/importance_sampling_ratio/max": 2.4151892185211183, "sampling/importance_sampling_ratio/mean": 0.9611580729484558, "sampling/importance_sampling_ratio/min": 0.0062289898283779625, "sampling/sampling_logp_difference/max": 0.9092877089977265, "sampling/sampling_logp_difference/mean": 0.006728888396173716, "step": 710, "step_time": 10.154783984972164 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 1.3490224091583513e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 1.3490224091583513e-06, "completions/clipped_ratio": 0.039453125, "completions/max_length": 2048.0, "completions/max_terminated_length": 1902.7, "completions/mean_length": 316.194921875, "completions/mean_terminated_length": 245.35125579833985, "completions/min_length": 74.5, "completions/min_terminated_length": 74.5, "entropy": 0.1705155328847468, "epoch": 1.5417558886509637, "frac_reward_zero_std": 0.575, "grad_norm": 0.33203125, "learning_rate": 9.9281e-06, "loss": -0.0181, "num_tokens": 82149023.0, "reward": 0.9240625202655792, "reward_std": 0.3773770064115524, "rewards/reward_accuracy/mean": 0.827734375, "rewards/reward_accuracy/std": 0.3702928006649017, "rewards/reward_format/mean": 0.09632812514901161, "rewards/reward_format/std": 0.016026155557483435, "sampling/importance_sampling_ratio/max": 2.5802762508392334, "sampling/importance_sampling_ratio/mean": 0.9627854526042938, "sampling/importance_sampling_ratio/min": 0.0058822366409003735, "sampling/sampling_logp_difference/max": 0.8497748136520386, "sampling/sampling_logp_difference/mean": 0.007133919233456254, "step": 720, "step_time": 10.588756273407489 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 2.4714056053198876e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 2.4714056053198876e-06, "completions/clipped_ratio": 0.038671875, "completions/max_length": 2048.0, "completions/max_terminated_length": 1919.0, "completions/mean_length": 302.79140625, "completions/mean_terminated_length": 232.5045166015625, "completions/min_length": 72.6, "completions/min_terminated_length": 72.6, "entropy": 0.1628550361841917, "epoch": 1.563169164882227, "frac_reward_zero_std": 0.5875, "grad_norm": 0.828125, "learning_rate": 9.9271e-06, "loss": -0.0234, "num_tokens": 83456409.0, "reward": 0.9477734744548798, "reward_std": 0.3556057929992676, "rewards/reward_accuracy/mean": 0.851171875, "rewards/reward_accuracy/std": 0.3483373522758484, "rewards/reward_format/mean": 0.0966015636920929, "rewards/reward_format/std": 0.01595138506963849, "sampling/importance_sampling_ratio/max": 2.6308526277542112, "sampling/importance_sampling_ratio/mean": 0.9608778595924378, "sampling/importance_sampling_ratio/min": 0.021300735976547004, "sampling/sampling_logp_difference/max": 0.9817075669765473, "sampling/sampling_logp_difference/mean": 0.0069509056396782395, "step": 730, "step_time": 10.55201198188588 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.023828125, "completions/max_length": 2048.0, "completions/max_terminated_length": 1773.1, "completions/mean_length": 246.20703125, "completions/mean_terminated_length": 202.32059173583986, "completions/min_length": 70.9, "completions/min_terminated_length": 70.9, "entropy": 0.14194792918860913, "epoch": 1.5845824411134903, "frac_reward_zero_std": 0.68125, "grad_norm": 0.68359375, "learning_rate": 9.926100000000001e-06, "loss": 0.0018, "num_tokens": 84598843.0, "reward": 0.9639062702655792, "reward_std": 0.3331055447459221, "rewards/reward_accuracy/mean": 0.866015625, "rewards/reward_accuracy/std": 0.3279029086232185, "rewards/reward_format/mean": 0.09789062663912773, "rewards/reward_format/std": 0.011608744971454144, "sampling/importance_sampling_ratio/max": 2.6042314529418946, "sampling/importance_sampling_ratio/mean": 0.9882521092891693, "sampling/importance_sampling_ratio/min": 0.045009415270760654, "sampling/sampling_logp_difference/max": 0.9613821625709533, "sampling/sampling_logp_difference/mean": 0.006303771398961544, "step": 740, "step_time": 9.92973174736835 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.016015625, "completions/max_length": 1724.5, "completions/max_terminated_length": 1226.1, "completions/mean_length": 211.36953125, "completions/mean_terminated_length": 181.9163024902344, "completions/min_length": 68.6, "completions/min_terminated_length": 68.6, "entropy": 0.12029059575870633, "epoch": 1.6059957173447539, "frac_reward_zero_std": 0.64375, "grad_norm": 0.71484375, "learning_rate": 9.925100000000001e-06, "loss": -0.014, "num_tokens": 85661373.0, "reward": 0.9430078268051147, "reward_std": 0.34315127581357957, "rewards/reward_accuracy/mean": 0.84453125, "rewards/reward_accuracy/std": 0.3400998875498772, "rewards/reward_format/mean": 0.0984765648841858, "rewards/reward_format/std": 0.00880467644892633, "sampling/importance_sampling_ratio/max": 2.446712839603424, "sampling/importance_sampling_ratio/mean": 0.9789796471595764, "sampling/importance_sampling_ratio/min": 0.09210466668009758, "sampling/sampling_logp_difference/max": 0.7732061445713043, "sampling/sampling_logp_difference/mean": 0.005752146430313587, "step": 750, "step_time": 8.326591362664477 }, { "clip_ratio/high_max": 1.9942833750974388e-05, "clip_ratio/high_mean": 2.4928542188717985e-06, "clip_ratio/low_mean": 6.299133019638248e-07, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 3.1227675208356233e-06, "completions/clipped_ratio": 0.019140625, "completions/max_length": 2048.0, "completions/max_terminated_length": 1889.5, "completions/mean_length": 230.280859375, "completions/mean_terminated_length": 194.9323959350586, "completions/min_length": 70.6, "completions/min_terminated_length": 70.6, "entropy": 0.13298605605959893, "epoch": 1.627408993576017, "frac_reward_zero_std": 0.6, "grad_norm": 0.640625, "learning_rate": 9.9241e-06, "loss": -0.0111, "num_tokens": 86779180.0, "reward": 0.9118554949760437, "reward_std": 0.37968810498714445, "rewards/reward_accuracy/mean": 0.81328125, "rewards/reward_accuracy/std": 0.3764509975910187, "rewards/reward_format/mean": 0.09857422113418579, "rewards/reward_format/std": 0.009390152152627706, "sampling/importance_sampling_ratio/max": 2.4771934270858766, "sampling/importance_sampling_ratio/mean": 0.9737643897533417, "sampling/importance_sampling_ratio/min": 0.07057665693573653, "sampling/sampling_logp_difference/max": 0.7522788643836975, "sampling/sampling_logp_difference/mean": 0.006284898752346635, "step": 760, "step_time": 9.790596451750025 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.011328125, "completions/max_length": 1823.2, "completions/max_terminated_length": 1477.4, "completions/mean_length": 192.0453125, "completions/mean_terminated_length": 170.83847198486328, "completions/min_length": 65.2, "completions/min_terminated_length": 65.2, "entropy": 0.11746228802949191, "epoch": 1.6488222698072805, "frac_reward_zero_std": 0.64375, "grad_norm": 0.51171875, "learning_rate": 9.923100000000002e-06, "loss": -0.0078, "num_tokens": 87788336.0, "reward": 0.9864648878574371, "reward_std": 0.31246960908174515, "rewards/reward_accuracy/mean": 0.8875, "rewards/reward_accuracy/std": 0.3096367135643959, "rewards/reward_format/mean": 0.0989648461341858, "rewards/reward_format/std": 0.007414921722374857, "sampling/importance_sampling_ratio/max": 2.496102452278137, "sampling/importance_sampling_ratio/mean": 0.988155072927475, "sampling/importance_sampling_ratio/min": 0.025276933424174787, "sampling/sampling_logp_difference/max": 0.6404293060302735, "sampling/sampling_logp_difference/mean": 0.005824843421578407, "step": 770, "step_time": 8.47086787414737 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.014453125, "completions/max_length": 1954.4, "completions/max_terminated_length": 1742.1, "completions/mean_length": 225.6328125, "completions/mean_terminated_length": 199.1234924316406, "completions/min_length": 72.3, "completions/min_terminated_length": 72.3, "entropy": 0.12709145238623024, "epoch": 1.6702355460385439, "frac_reward_zero_std": 0.63125, "grad_norm": 0.5078125, "learning_rate": 9.922100000000001e-06, "loss": -0.0156, "num_tokens": 88886916.0, "reward": 0.9320117413997651, "reward_std": 0.36250911056995394, "rewards/reward_accuracy/mean": 0.833203125, "rewards/reward_accuracy/std": 0.3601594939827919, "rewards/reward_format/mean": 0.09880859702825547, "rewards/reward_format/std": 0.008423830987885595, "sampling/importance_sampling_ratio/max": 2.511639654636383, "sampling/importance_sampling_ratio/mean": 0.987099003791809, "sampling/importance_sampling_ratio/min": 0.07659065537154675, "sampling/sampling_logp_difference/max": 0.838177764415741, "sampling/sampling_logp_difference/mean": 0.0061145287938416, "step": 780, "step_time": 9.361104059359059 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 2.2270029376159073e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 2.2270029376159073e-06, "completions/clipped_ratio": 0.0296875, "completions/max_length": 2048.0, "completions/max_terminated_length": 1793.3, "completions/mean_length": 246.694140625, "completions/mean_terminated_length": 191.7202911376953, "completions/min_length": 63.3, "completions/min_terminated_length": 63.3, "entropy": 0.1404787396080792, "epoch": 1.6916488222698072, "frac_reward_zero_std": 0.59375, "grad_norm": 0.54296875, "learning_rate": 9.9211e-06, "loss": -0.0111, "num_tokens": 90032773.0, "reward": 0.9436523616313934, "reward_std": 0.3587296694517136, "rewards/reward_accuracy/mean": 0.845703125, "rewards/reward_accuracy/std": 0.3542390584945679, "rewards/reward_format/mean": 0.09794922024011612, "rewards/reward_format/std": 0.012350461911410093, "sampling/importance_sampling_ratio/max": 2.4336459279060363, "sampling/importance_sampling_ratio/mean": 0.9680092036724091, "sampling/importance_sampling_ratio/min": 0.017829676531255244, "sampling/sampling_logp_difference/max": 0.6669148325920105, "sampling/sampling_logp_difference/mean": 0.006342547759413719, "step": 790, "step_time": 10.23502129581757 }, { "clip_ratio/high_max": 3.493667682050727e-05, "clip_ratio/high_mean": 4.367084602563409e-06, "clip_ratio/low_mean": 1.3563470020017121e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 5.723431695514592e-06, "completions/clipped_ratio": 0.018359375, "completions/max_length": 1903.6, "completions/max_terminated_length": 1181.6, "completions/mean_length": 186.712890625, "completions/mean_terminated_length": 151.90991897583007, "completions/min_length": 61.5, "completions/min_terminated_length": 61.5, "entropy": 0.11077433116734028, "epoch": 1.7130620985010707, "frac_reward_zero_std": 0.70625, "grad_norm": 0.828125, "learning_rate": 9.9201e-06, "loss": -0.0047, "num_tokens": 91023590.0, "reward": 0.9818359613418579, "reward_std": 0.30662353336811066, "rewards/reward_accuracy/mean": 0.883203125, "rewards/reward_accuracy/std": 0.3027037002146244, "rewards/reward_format/mean": 0.09863281399011611, "rewards/reward_format/std": 0.009655901044607163, "sampling/importance_sampling_ratio/max": 2.4400421619415282, "sampling/importance_sampling_ratio/mean": 0.9809924960136414, "sampling/importance_sampling_ratio/min": 0.15896691009402275, "sampling/sampling_logp_difference/max": 0.6998325109481811, "sampling/sampling_logp_difference/mean": 0.0055229177698493, "step": 800, "step_time": 9.051756103523076 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 5.18242131875013e-07, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 5.18242131875013e-07, "completions/clipped_ratio": 0.021484375, "completions/max_length": 1750.7, "completions/max_terminated_length": 1456.5, "completions/mean_length": 195.3734375, "completions/mean_terminated_length": 154.89309844970703, "completions/min_length": 64.5, "completions/min_terminated_length": 64.5, "entropy": 0.11598751414567232, "epoch": 1.734475374732334, "frac_reward_zero_std": 0.75, "grad_norm": 1.09375, "learning_rate": 9.9191e-06, "loss": -0.008, "num_tokens": 92040898.0, "reward": 0.9647070646286011, "reward_std": 0.3352124571800232, "rewards/reward_accuracy/mean": 0.86640625, "rewards/reward_accuracy/std": 0.3309496834874153, "rewards/reward_format/mean": 0.0983007825911045, "rewards/reward_format/std": 0.009958745469339192, "sampling/importance_sampling_ratio/max": 2.5101136803627013, "sampling/importance_sampling_ratio/mean": 0.9888682663440704, "sampling/importance_sampling_ratio/min": 0.1077797707170248, "sampling/sampling_logp_difference/max": 0.9090753197669983, "sampling/sampling_logp_difference/mean": 0.005533263320103288, "step": 810, "step_time": 8.98259420269169 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.023046875, "completions/max_length": 1928.9, "completions/max_terminated_length": 1784.7, "completions/mean_length": 231.076953125, "completions/mean_terminated_length": 188.88939666748047, "completions/min_length": 67.8, "completions/min_terminated_length": 67.8, "entropy": 0.1263550733216107, "epoch": 1.7558886509635974, "frac_reward_zero_std": 0.64375, "grad_norm": 0.5078125, "learning_rate": 9.9181e-06, "loss": -0.01, "num_tokens": 93152215.0, "reward": 0.9408008038997651, "reward_std": 0.3481825068593025, "rewards/reward_accuracy/mean": 0.84296875, "rewards/reward_accuracy/std": 0.34399643689394, "rewards/reward_format/mean": 0.09783203229308128, "rewards/reward_format/std": 0.01143257103394717, "sampling/importance_sampling_ratio/max": 2.396599221229553, "sampling/importance_sampling_ratio/mean": 0.974438613653183, "sampling/importance_sampling_ratio/min": 0.05815908792428672, "sampling/sampling_logp_difference/max": 0.9249692916870117, "sampling/sampling_logp_difference/mean": 0.006070325477048754, "step": 820, "step_time": 9.202831826731563 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.030859375, "completions/max_length": 2048.0, "completions/max_terminated_length": 1816.8, "completions/mean_length": 246.005078125, "completions/mean_terminated_length": 188.80774536132813, "completions/min_length": 64.5, "completions/min_terminated_length": 64.5, "entropy": 0.13789509143680334, "epoch": 1.777301927194861, "frac_reward_zero_std": 0.61875, "grad_norm": 0.74609375, "learning_rate": 9.9171e-06, "loss": -0.0058, "num_tokens": 94299732.0, "reward": 0.9373632967472076, "reward_std": 0.36722460985183714, "rewards/reward_accuracy/mean": 0.839453125, "rewards/reward_accuracy/std": 0.3627901792526245, "rewards/reward_format/mean": 0.09791015833616257, "rewards/reward_format/std": 0.01192841436713934, "sampling/importance_sampling_ratio/max": 2.4829785346984865, "sampling/importance_sampling_ratio/mean": 0.9730366170406342, "sampling/importance_sampling_ratio/min": 0.017973791062831878, "sampling/sampling_logp_difference/max": 0.9754697799682617, "sampling/sampling_logp_difference/mean": 0.006479581166058779, "step": 830, "step_time": 10.199173214053735 }, { "clip_ratio/high_max": 2.231140824733302e-05, "clip_ratio/high_mean": 2.7889260309166276e-06, "clip_ratio/low_mean": 1.8117643776349723e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 4.6006904085515995e-06, "completions/clipped_ratio": 0.05078125, "completions/max_length": 2048.0, "completions/max_terminated_length": 1907.2, "completions/mean_length": 294.341015625, "completions/mean_terminated_length": 201.25667572021484, "completions/min_length": 72.0, "completions/min_terminated_length": 72.0, "entropy": 0.1741301323287189, "epoch": 1.7987152034261242, "frac_reward_zero_std": 0.5875, "grad_norm": 0.57421875, "learning_rate": 9.916100000000002e-06, "loss": -0.0092, "num_tokens": 95572605.0, "reward": 0.9119531393051148, "reward_std": 0.3775117933750153, "rewards/reward_accuracy/mean": 0.815625, "rewards/reward_accuracy/std": 0.3704370856285095, "rewards/reward_format/mean": 0.09632812812924385, "rewards/reward_format/std": 0.016028174199163914, "sampling/importance_sampling_ratio/max": 2.683979308605194, "sampling/importance_sampling_ratio/mean": 0.956336933374405, "sampling/importance_sampling_ratio/min": 0.004366928152740002, "sampling/sampling_logp_difference/max": 0.9365596532821655, "sampling/sampling_logp_difference/mean": 0.00743153365328908, "step": 840, "step_time": 10.40536023993045 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 1.6084392200355069e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 1.6084392200355069e-06, "completions/clipped_ratio": 0.034375, "completions/max_length": 1962.3, "completions/max_terminated_length": 1642.0, "completions/mean_length": 258.133984375, "completions/mean_terminated_length": 195.1166679382324, "completions/min_length": 61.3, "completions/min_terminated_length": 61.3, "entropy": 0.14556633736938238, "epoch": 1.8201284796573876, "frac_reward_zero_std": 0.6375, "grad_norm": 1.0390625, "learning_rate": 9.915100000000001e-06, "loss": -0.0108, "num_tokens": 96753748.0, "reward": 0.9591406166553498, "reward_std": 0.3389202758669853, "rewards/reward_accuracy/mean": 0.862109375, "rewards/reward_accuracy/std": 0.33241159170866014, "rewards/reward_format/mean": 0.09703124836087226, "rewards/reward_format/std": 0.013592235441319645, "sampling/importance_sampling_ratio/max": 2.4554973006248475, "sampling/importance_sampling_ratio/mean": 0.965623390674591, "sampling/importance_sampling_ratio/min": 0.03880217969417572, "sampling/sampling_logp_difference/max": 0.7726036548614502, "sampling/sampling_logp_difference/mean": 0.006421024305745959, "step": 850, "step_time": 9.846614830428734 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.025390625, "completions/max_length": 1976.0, "completions/max_terminated_length": 1732.0, "completions/mean_length": 243.690234375, "completions/mean_terminated_length": 196.8784194946289, "completions/min_length": 68.1, "completions/min_terminated_length": 68.1, "entropy": 0.14925894904881715, "epoch": 1.841541755888651, "frac_reward_zero_std": 0.5875, "grad_norm": 0.55859375, "learning_rate": 9.9141e-06, "loss": -0.024, "num_tokens": 97896251.0, "reward": 0.9528711140155792, "reward_std": 0.34984823167324064, "rewards/reward_accuracy/mean": 0.855078125, "rewards/reward_accuracy/std": 0.34496885240077974, "rewards/reward_format/mean": 0.09779297038912774, "rewards/reward_format/std": 0.011865899991244077, "sampling/importance_sampling_ratio/max": 2.45594242811203, "sampling/importance_sampling_ratio/mean": 0.9743410110473633, "sampling/importance_sampling_ratio/min": 0.01487228237092495, "sampling/sampling_logp_difference/max": 0.7094189167022705, "sampling/sampling_logp_difference/mean": 0.006630892027169466, "step": 860, "step_time": 9.612693790346384 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0421875, "completions/max_length": 2048.0, "completions/max_terminated_length": 1800.7, "completions/mean_length": 286.90703125, "completions/mean_terminated_length": 209.81248474121094, "completions/min_length": 69.7, "completions/min_terminated_length": 69.7, "entropy": 0.16136013818904757, "epoch": 1.8629550321199142, "frac_reward_zero_std": 0.55625, "grad_norm": 0.93359375, "learning_rate": 9.913100000000002e-06, "loss": -0.0225, "num_tokens": 99149725.0, "reward": 0.9054297149181366, "reward_std": 0.3917454361915588, "rewards/reward_accuracy/mean": 0.808984375, "rewards/reward_accuracy/std": 0.3852386325597763, "rewards/reward_format/mean": 0.09644531384110451, "rewards/reward_format/std": 0.0163582275621593, "sampling/importance_sampling_ratio/max": 2.4450995564460754, "sampling/importance_sampling_ratio/mean": 0.9521192193031311, "sampling/importance_sampling_ratio/min": 0.02078673876821995, "sampling/sampling_logp_difference/max": 0.8914358377456665, "sampling/sampling_logp_difference/mean": 0.006933718826621771, "step": 870, "step_time": 10.426300408458337 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 1.7338515590381575e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 1.7338515590381575e-06, "completions/clipped_ratio": 0.030859375, "completions/max_length": 2048.0, "completions/max_terminated_length": 1638.6, "completions/mean_length": 256.44609375, "completions/mean_terminated_length": 200.27135467529297, "completions/min_length": 69.5, "completions/min_terminated_length": 69.5, "entropy": 0.151009270362556, "epoch": 1.8843683083511777, "frac_reward_zero_std": 0.625, "grad_norm": 0.34765625, "learning_rate": 9.912100000000001e-06, "loss": -0.0136, "num_tokens": 100320947.0, "reward": 0.927519553899765, "reward_std": 0.36917308121919634, "rewards/reward_accuracy/mean": 0.830078125, "rewards/reward_accuracy/std": 0.3636032328009605, "rewards/reward_format/mean": 0.09744140803813935, "rewards/reward_format/std": 0.014447587542235851, "sampling/importance_sampling_ratio/max": 2.3376208543777466, "sampling/importance_sampling_ratio/mean": 0.9511006712913513, "sampling/importance_sampling_ratio/min": 0.019792939955368637, "sampling/sampling_logp_difference/max": 0.6955641984939576, "sampling/sampling_logp_difference/mean": 0.006597352540120482, "step": 880, "step_time": 9.911096861446277 }, { "clip_ratio/high_max": 3.44669126207009e-05, "clip_ratio/high_mean": 4.308364077587612e-06, "clip_ratio/low_mean": 1.2744698324240743e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 5.582833910011686e-06, "completions/clipped_ratio": 0.026171875, "completions/max_length": 1854.2, "completions/max_terminated_length": 1515.3, "completions/mean_length": 233.15078125, "completions/mean_terminated_length": 185.92127075195313, "completions/min_length": 69.8, "completions/min_terminated_length": 69.8, "entropy": 0.15007403418421744, "epoch": 1.905781584582441, "frac_reward_zero_std": 0.65625, "grad_norm": 0.7265625, "learning_rate": 9.9111e-06, "loss": -0.0202, "num_tokens": 101430933.0, "reward": 0.948535168170929, "reward_std": 0.323136767745018, "rewards/reward_accuracy/mean": 0.850390625, "rewards/reward_accuracy/std": 0.31987803131341935, "rewards/reward_format/mean": 0.09814453348517418, "rewards/reward_format/std": 0.009425759175792336, "sampling/importance_sampling_ratio/max": 2.3796491861343383, "sampling/importance_sampling_ratio/mean": 0.9678067207336426, "sampling/importance_sampling_ratio/min": 0.06145329617138486, "sampling/sampling_logp_difference/max": 1.082299417257309, "sampling/sampling_logp_difference/mean": 0.006593769462779164, "step": 890, "step_time": 9.031779711786658 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.028515625, "completions/max_length": 2048.0, "completions/max_terminated_length": 1838.8, "completions/mean_length": 232.096484375, "completions/mean_terminated_length": 179.09197998046875, "completions/min_length": 65.6, "completions/min_terminated_length": 65.6, "entropy": 0.1435914199799299, "epoch": 1.9271948608137044, "frac_reward_zero_std": 0.61875, "grad_norm": 0.40625, "learning_rate": 9.9101e-06, "loss": -0.0178, "num_tokens": 102547388.0, "reward": 0.9291601598262786, "reward_std": 0.37347334921360015, "rewards/reward_accuracy/mean": 0.83125, "rewards/reward_accuracy/std": 0.36888945698738096, "rewards/reward_format/mean": 0.09791015759110451, "rewards/reward_format/std": 0.012906018923968077, "sampling/importance_sampling_ratio/max": 2.3964182496070863, "sampling/importance_sampling_ratio/mean": 0.9703002333641052, "sampling/importance_sampling_ratio/min": 0.018152867816388606, "sampling/sampling_logp_difference/max": 0.9208699822425842, "sampling/sampling_logp_difference/mean": 0.006486426293849945, "step": 900, "step_time": 10.148795459978283 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.016796875, "completions/max_length": 1860.2, "completions/max_terminated_length": 1676.2, "completions/mean_length": 203.509375, "completions/mean_terminated_length": 172.17589721679687, "completions/min_length": 63.5, "completions/min_terminated_length": 63.5, "entropy": 0.13228779640048743, "epoch": 1.948608137044968, "frac_reward_zero_std": 0.66875, "grad_norm": 0.73828125, "learning_rate": 9.9091e-06, "loss": -0.0098, "num_tokens": 103584644.0, "reward": 0.9349023759365082, "reward_std": 0.36754566729068755, "rewards/reward_accuracy/mean": 0.836328125, "rewards/reward_accuracy/std": 0.3644263416528702, "rewards/reward_format/mean": 0.09857422038912773, "rewards/reward_format/std": 0.00941769969649613, "sampling/importance_sampling_ratio/max": 2.498454213142395, "sampling/importance_sampling_ratio/mean": 0.9838074266910553, "sampling/importance_sampling_ratio/min": 0.0364431194961071, "sampling/sampling_logp_difference/max": 0.6773843705654145, "sampling/sampling_logp_difference/mean": 0.006243390776216984, "step": 910, "step_time": 8.818617072608323 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 2.868551518986351e-07, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 2.868551518986351e-07, "completions/clipped_ratio": 0.018359375, "completions/max_length": 1851.1, "completions/max_terminated_length": 1577.8, "completions/mean_length": 205.1515625, "completions/mean_terminated_length": 171.00319061279296, "completions/min_length": 60.5, "completions/min_terminated_length": 60.5, "entropy": 0.129123495798558, "epoch": 1.9700214132762313, "frac_reward_zero_std": 0.65, "grad_norm": 0.486328125, "learning_rate": 9.908100000000001e-06, "loss": -0.014, "num_tokens": 104626856.0, "reward": 0.9649805009365082, "reward_std": 0.326061787456274, "rewards/reward_accuracy/mean": 0.866796875, "rewards/reward_accuracy/std": 0.32202618941664696, "rewards/reward_format/mean": 0.09818359613418579, "rewards/reward_format/std": 0.010443945578299463, "sampling/importance_sampling_ratio/max": 2.1866334557533262, "sampling/importance_sampling_ratio/mean": 0.9655367493629455, "sampling/importance_sampling_ratio/min": 0.06379155032336711, "sampling/sampling_logp_difference/max": 0.8827960252761841, "sampling/sampling_logp_difference/mean": 0.006098009552806616, "step": 920, "step_time": 8.902692521503194 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.02578125, "completions/max_length": 2048.0, "completions/max_terminated_length": 1889.4, "completions/mean_length": 250.184765625, "completions/mean_terminated_length": 203.3163330078125, "completions/min_length": 66.6, "completions/min_terminated_length": 66.6, "entropy": 0.14765694150701164, "epoch": 1.9914346895074946, "frac_reward_zero_std": 0.5875, "grad_norm": 1.09375, "learning_rate": 9.9071e-06, "loss": -0.0173, "num_tokens": 105791345.0, "reward": 0.9205664277076722, "reward_std": 0.37347285747528075, "rewards/reward_accuracy/mean": 0.823046875, "rewards/reward_accuracy/std": 0.3688552349805832, "rewards/reward_format/mean": 0.0975195325911045, "rewards/reward_format/std": 0.013043741649016737, "sampling/importance_sampling_ratio/max": 2.4623132228851317, "sampling/importance_sampling_ratio/mean": 0.9742694735527039, "sampling/importance_sampling_ratio/min": 0.107972346059978, "sampling/sampling_logp_difference/max": 0.6812215805053711, "sampling/sampling_logp_difference/mean": 0.006520324340090156, "step": 930, "step_time": 10.203394064679742 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.012890625, "completions/max_length": 1993.4, "completions/max_terminated_length": 1662.2, "completions/mean_length": 197.094921875, "completions/mean_terminated_length": 173.0997344970703, "completions/min_length": 62.6, "completions/min_terminated_length": 62.6, "entropy": 0.12167932614684104, "epoch": 2.012847965738758, "frac_reward_zero_std": 0.70625, "grad_norm": 0.408203125, "learning_rate": 9.9061e-06, "loss": -0.0189, "num_tokens": 106803268.0, "reward": 0.9904492378234864, "reward_std": 0.29305783063173296, "rewards/reward_accuracy/mean": 0.891796875, "rewards/reward_accuracy/std": 0.2895434215664864, "rewards/reward_format/mean": 0.09865234419703484, "rewards/reward_format/std": 0.009380003018304706, "sampling/importance_sampling_ratio/max": 2.3492308497428893, "sampling/importance_sampling_ratio/mean": 0.9921432733535767, "sampling/importance_sampling_ratio/min": 0.0743491357192397, "sampling/sampling_logp_difference/max": 0.9991929113864899, "sampling/sampling_logp_difference/mean": 0.005784861464053393, "step": 940, "step_time": 9.489736239984632 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00859375, "completions/max_length": 1682.0, "completions/max_terminated_length": 1589.9, "completions/mean_length": 199.523046875, "completions/mean_terminated_length": 183.84711608886718, "completions/min_length": 66.8, "completions/min_terminated_length": 66.8, "entropy": 0.11632204605266452, "epoch": 2.0342612419700212, "frac_reward_zero_std": 0.70625, "grad_norm": 0.859375, "learning_rate": 9.905100000000001e-06, "loss": -0.0078, "num_tokens": 107834575.0, "reward": 0.9671094059944153, "reward_std": 0.3248412474989891, "rewards/reward_accuracy/mean": 0.86796875, "rewards/reward_accuracy/std": 0.3228647321462631, "rewards/reward_format/mean": 0.09914062693715095, "rewards/reward_format/std": 0.0064982657320797445, "sampling/importance_sampling_ratio/max": 2.41606582403183, "sampling/importance_sampling_ratio/mean": 0.9726782619953156, "sampling/importance_sampling_ratio/min": 0.04130089245736599, "sampling/sampling_logp_difference/max": 0.7168623566627502, "sampling/sampling_logp_difference/mean": 0.005662383325397968, "step": 950, "step_time": 8.030469681881367 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.015234375, "completions/max_length": 1971.9, "completions/max_terminated_length": 1759.7, "completions/mean_length": 224.001171875, "completions/mean_terminated_length": 195.8615463256836, "completions/min_length": 62.7, "completions/min_terminated_length": 62.7, "entropy": 0.12755659418180584, "epoch": 2.0556745182012848, "frac_reward_zero_std": 0.7, "grad_norm": 0.5859375, "learning_rate": 9.9041e-06, "loss": -0.0091, "num_tokens": 108926034.0, "reward": 0.9459765791893006, "reward_std": 0.34271051585674284, "rewards/reward_accuracy/mean": 0.847265625, "rewards/reward_accuracy/std": 0.33992874771356585, "rewards/reward_format/mean": 0.0987109400331974, "rewards/reward_format/std": 0.008912423229776322, "sampling/importance_sampling_ratio/max": 2.5717740774154665, "sampling/importance_sampling_ratio/mean": 0.9788214683532714, "sampling/importance_sampling_ratio/min": 0.05705595798790455, "sampling/sampling_logp_difference/max": 0.7393279790878295, "sampling/sampling_logp_difference/mean": 0.006034904532134533, "step": 960, "step_time": 9.32920954786241 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01484375, "completions/max_length": 1711.1, "completions/max_terminated_length": 1395.8, "completions/mean_length": 209.419921875, "completions/mean_terminated_length": 182.30191955566406, "completions/min_length": 60.4, "completions/min_terminated_length": 60.4, "entropy": 0.12380664227530361, "epoch": 2.0770877944325483, "frac_reward_zero_std": 0.65, "grad_norm": 0.31640625, "learning_rate": 9.903100000000002e-06, "loss": -0.0117, "num_tokens": 109982725.0, "reward": 0.9878125309944152, "reward_std": 0.3071736603975296, "rewards/reward_accuracy/mean": 0.8890625, "rewards/reward_accuracy/std": 0.30443327128887177, "rewards/reward_format/mean": 0.0987500011920929, "rewards/reward_format/std": 0.007103267405182123, "sampling/importance_sampling_ratio/max": 2.5186639428138733, "sampling/importance_sampling_ratio/mean": 0.9927192151546478, "sampling/importance_sampling_ratio/min": 0.1291866797953844, "sampling/sampling_logp_difference/max": 0.7177225947380066, "sampling/sampling_logp_difference/mean": 0.006064361007884145, "step": 970, "step_time": 8.192460826179012 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.011328125, "completions/max_length": 1888.2, "completions/max_terminated_length": 1716.0, "completions/mean_length": 220.114453125, "completions/mean_terminated_length": 199.4204528808594, "completions/min_length": 65.8, "completions/min_terminated_length": 65.8, "entropy": 0.1248143456876278, "epoch": 2.0985010706638114, "frac_reward_zero_std": 0.73125, "grad_norm": 0.92578125, "learning_rate": 9.902100000000001e-06, "loss": -0.0103, "num_tokens": 111063114.0, "reward": 0.9481836080551147, "reward_std": 0.34800865799188613, "rewards/reward_accuracy/mean": 0.84921875, "rewards/reward_accuracy/std": 0.3457888960838318, "rewards/reward_format/mean": 0.0989648461341858, "rewards/reward_format/std": 0.007306190836243331, "sampling/importance_sampling_ratio/max": 2.4548211336135863, "sampling/importance_sampling_ratio/mean": 0.9745739519596099, "sampling/importance_sampling_ratio/min": 0.050421778485178946, "sampling/sampling_logp_difference/max": 0.7700303494930267, "sampling/sampling_logp_difference/mean": 0.0058918816968798636, "step": 980, "step_time": 9.191250279778615 }, { "clip_ratio/high_max": 2.1219213886070064e-05, "clip_ratio/high_mean": 2.652401735758758e-06, "clip_ratio/low_mean": 2.7698527446773367e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 5.422254480436095e-06, "completions/clipped_ratio": 0.02578125, "completions/max_length": 1936.6, "completions/max_terminated_length": 1634.9, "completions/mean_length": 253.598046875, "completions/mean_terminated_length": 206.3838119506836, "completions/min_length": 60.8, "completions/min_terminated_length": 60.8, "entropy": 0.1312790905125439, "epoch": 2.119914346895075, "frac_reward_zero_std": 0.6, "grad_norm": 0.53125, "learning_rate": 9.9011e-06, "loss": -0.0153, "num_tokens": 112230869.0, "reward": 0.9458007872104645, "reward_std": 0.3503704905509949, "rewards/reward_accuracy/mean": 0.848046875, "rewards/reward_accuracy/std": 0.3457596808671951, "rewards/reward_format/mean": 0.09775390774011612, "rewards/reward_format/std": 0.011316603142768144, "sampling/importance_sampling_ratio/max": 2.300599145889282, "sampling/importance_sampling_ratio/mean": 0.962765496969223, "sampling/importance_sampling_ratio/min": 0.04408282991498709, "sampling/sampling_logp_difference/max": 0.9864498734474182, "sampling/sampling_logp_difference/mean": 0.006157218152657152, "step": 990, "step_time": 9.784059684118256 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01484375, "completions/max_length": 2048.0, "completions/max_terminated_length": 1761.1, "completions/mean_length": 221.127734375, "completions/mean_terminated_length": 193.78389434814454, "completions/min_length": 70.2, "completions/min_terminated_length": 70.2, "entropy": 0.12627201676368713, "epoch": 2.1413276231263385, "frac_reward_zero_std": 0.6375, "grad_norm": 0.37890625, "learning_rate": 9.9001e-06, "loss": -0.0207, "num_tokens": 113315228.0, "reward": 0.9744140863418579, "reward_std": 0.32944023609161377, "rewards/reward_accuracy/mean": 0.87578125, "rewards/reward_accuracy/std": 0.32610152661800385, "rewards/reward_format/mean": 0.09863281399011611, "rewards/reward_format/std": 0.009054604661650955, "sampling/importance_sampling_ratio/max": 2.513620209693909, "sampling/importance_sampling_ratio/mean": 0.9820565819740296, "sampling/importance_sampling_ratio/min": 0.032299659587442874, "sampling/sampling_logp_difference/max": 0.8166385769844056, "sampling/sampling_logp_difference/mean": 0.00624980260618031, "step": 1000, "step_time": 9.662331256689503 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.017578125, "completions/max_length": 1986.5, "completions/max_terminated_length": 1775.3, "completions/mean_length": 237.170703125, "completions/mean_terminated_length": 205.26653900146485, "completions/min_length": 65.8, "completions/min_terminated_length": 65.8, "entropy": 0.1205636235885322, "epoch": 2.1627408993576016, "frac_reward_zero_std": 0.65625, "grad_norm": 0.5, "learning_rate": 9.8991e-06, "loss": -0.0148, "num_tokens": 114443953.0, "reward": 0.9759961128234863, "reward_std": 0.30793729424476624, "rewards/reward_accuracy/mean": 0.877734375, "rewards/reward_accuracy/std": 0.3037992350757122, "rewards/reward_format/mean": 0.09826171919703483, "rewards/reward_format/std": 0.010592820821329951, "sampling/importance_sampling_ratio/max": 2.507185387611389, "sampling/importance_sampling_ratio/mean": 0.9686585545539856, "sampling/importance_sampling_ratio/min": 0.04109625471755862, "sampling/sampling_logp_difference/max": 0.8997818410396576, "sampling/sampling_logp_difference/mean": 0.005891357082873583, "step": 1010, "step_time": 9.4522584927734 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.014453125, "completions/max_length": 1830.3, "completions/max_terminated_length": 1615.2, "completions/mean_length": 224.009375, "completions/mean_terminated_length": 197.65143432617188, "completions/min_length": 69.0, "completions/min_terminated_length": 69.0, "entropy": 0.12155499421060086, "epoch": 2.184154175588865, "frac_reward_zero_std": 0.66875, "grad_norm": 0.71875, "learning_rate": 9.898100000000001e-06, "loss": -0.0177, "num_tokens": 115532937.0, "reward": 0.9747656464576722, "reward_std": 0.30199117213487625, "rewards/reward_accuracy/mean": 0.876171875, "rewards/reward_accuracy/std": 0.299282605946064, "rewards/reward_format/mean": 0.09859374910593033, "rewards/reward_format/std": 0.00904646348208189, "sampling/importance_sampling_ratio/max": 2.4035712122917174, "sampling/importance_sampling_ratio/mean": 0.9765183568000794, "sampling/importance_sampling_ratio/min": 0.060005871951580046, "sampling/sampling_logp_difference/max": 0.8479045391082763, "sampling/sampling_logp_difference/mean": 0.005943241342902183, "step": 1020, "step_time": 8.956811558129266 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.023046875, "completions/max_length": 1993.6, "completions/max_terminated_length": 1647.4, "completions/mean_length": 239.5546875, "completions/mean_terminated_length": 197.78245544433594, "completions/min_length": 66.4, "completions/min_terminated_length": 66.4, "entropy": 0.13255306417122484, "epoch": 2.2055674518201283, "frac_reward_zero_std": 0.61875, "grad_norm": 0.7421875, "learning_rate": 9.8971e-06, "loss": -0.0204, "num_tokens": 116655029.0, "reward": 0.9399414241313935, "reward_std": 0.34093261063098906, "rewards/reward_accuracy/mean": 0.841796875, "rewards/reward_accuracy/std": 0.3370689421892166, "rewards/reward_format/mean": 0.09814453274011611, "rewards/reward_format/std": 0.011449454771354794, "sampling/importance_sampling_ratio/max": 2.486461675167084, "sampling/importance_sampling_ratio/mean": 0.9700662016868591, "sampling/importance_sampling_ratio/min": 0.009044223325327038, "sampling/sampling_logp_difference/max": 0.6451917290687561, "sampling/sampling_logp_difference/mean": 0.006465697987005114, "step": 1030, "step_time": 9.519106068648398 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01484375, "completions/max_length": 1966.5, "completions/max_terminated_length": 1707.3, "completions/mean_length": 218.703515625, "completions/mean_terminated_length": 191.1827865600586, "completions/min_length": 68.0, "completions/min_terminated_length": 68.0, "entropy": 0.12091882657259703, "epoch": 2.226980728051392, "frac_reward_zero_std": 0.675, "grad_norm": 0.59765625, "learning_rate": 9.8961e-06, "loss": -0.0173, "num_tokens": 117730798.0, "reward": 0.9847265899181366, "reward_std": 0.3154772475361824, "rewards/reward_accuracy/mean": 0.8859375, "rewards/reward_accuracy/std": 0.31200191378593445, "rewards/reward_format/mean": 0.09878906458616257, "rewards/reward_format/std": 0.009305128315463661, "sampling/importance_sampling_ratio/max": 2.4802735924720762, "sampling/importance_sampling_ratio/mean": 0.9671303331851959, "sampling/importance_sampling_ratio/min": 0.04748152866959572, "sampling/sampling_logp_difference/max": 0.6354176998138428, "sampling/sampling_logp_difference/mean": 0.006041896250098944, "step": 1040, "step_time": 9.153514892002567 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 1.7045945696736454e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 1.7045945696736454e-06, "completions/clipped_ratio": 0.015625, "completions/max_length": 1896.9, "completions/max_terminated_length": 1664.1, "completions/mean_length": 238.534375, "completions/mean_terminated_length": 210.68414916992188, "completions/min_length": 67.9, "completions/min_terminated_length": 67.9, "entropy": 0.12248198008164764, "epoch": 2.2483940042826553, "frac_reward_zero_std": 0.625, "grad_norm": 0.84765625, "learning_rate": 9.895100000000001e-06, "loss": -0.0047, "num_tokens": 118855702.0, "reward": 0.9943359673023224, "reward_std": 0.3012785717844963, "rewards/reward_accuracy/mean": 0.89609375, "rewards/reward_accuracy/std": 0.2975010871887207, "rewards/reward_format/mean": 0.09824219048023224, "rewards/reward_format/std": 0.009342654282227159, "sampling/importance_sampling_ratio/max": 2.6094794988632204, "sampling/importance_sampling_ratio/mean": 0.9811691761016845, "sampling/importance_sampling_ratio/min": 0.07318041063845157, "sampling/sampling_logp_difference/max": 0.7872648358345031, "sampling/sampling_logp_difference/mean": 0.005984523566439748, "step": 1050, "step_time": 8.997180890105664 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 2.8131776161899325e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 2.8131776161899325e-06, "completions/clipped_ratio": 0.040234375, "completions/max_length": 2048.0, "completions/max_terminated_length": 1895.9, "completions/mean_length": 309.9234375, "completions/mean_terminated_length": 237.65003204345703, "completions/min_length": 72.6, "completions/min_terminated_length": 72.6, "entropy": 0.147100061038509, "epoch": 2.2698072805139184, "frac_reward_zero_std": 0.63125, "grad_norm": 1.140625, "learning_rate": 9.8941e-06, "loss": -0.0183, "num_tokens": 120169138.0, "reward": 0.9496679961681366, "reward_std": 0.3516485095024109, "rewards/reward_accuracy/mean": 0.853125, "rewards/reward_accuracy/std": 0.34416040033102036, "rewards/reward_format/mean": 0.09654297083616256, "rewards/reward_format/std": 0.015939757600426673, "sampling/importance_sampling_ratio/max": 2.608386516571045, "sampling/importance_sampling_ratio/mean": 0.9462941825389862, "sampling/importance_sampling_ratio/min": 0.021119034476578237, "sampling/sampling_logp_difference/max": 0.7626579344272614, "sampling/sampling_logp_difference/mean": 0.00669051269069314, "step": 1060, "step_time": 10.324304767046124 }, { "clip_ratio/high_max": 8.411843737121671e-06, "clip_ratio/high_mean": 1.051480467140209e-06, "clip_ratio/low_mean": 6.567557079506514e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 7.619037569384091e-06, "completions/clipped_ratio": 0.031640625, "completions/max_length": 2048.0, "completions/max_terminated_length": 1892.6, "completions/mean_length": 280.773828125, "completions/mean_terminated_length": 223.28890075683594, "completions/min_length": 65.7, "completions/min_terminated_length": 65.7, "entropy": 0.14687624899670482, "epoch": 2.291220556745182, "frac_reward_zero_std": 0.66875, "grad_norm": 0.4609375, "learning_rate": 9.8931e-06, "loss": -0.0103, "num_tokens": 121402559.0, "reward": 0.9601758182048797, "reward_std": 0.3412570759654045, "rewards/reward_accuracy/mean": 0.86328125, "rewards/reward_accuracy/std": 0.3343312531709671, "rewards/reward_format/mean": 0.09689453393220901, "rewards/reward_format/std": 0.015267401188611984, "sampling/importance_sampling_ratio/max": 2.4585010766983033, "sampling/importance_sampling_ratio/mean": 0.9576635420322418, "sampling/importance_sampling_ratio/min": 0.025234085321426392, "sampling/sampling_logp_difference/max": 0.8232152819633484, "sampling/sampling_logp_difference/mean": 0.006720620673149824, "step": 1070, "step_time": 10.166967736696824 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.026953125, "completions/max_length": 2048.0, "completions/max_terminated_length": 1824.5, "completions/mean_length": 263.104296875, "completions/mean_terminated_length": 214.14144134521484, "completions/min_length": 74.1, "completions/min_terminated_length": 74.1, "entropy": 0.13370681600645185, "epoch": 2.3126338329764455, "frac_reward_zero_std": 0.65, "grad_norm": 1.234375, "learning_rate": 9.892100000000001e-06, "loss": -0.0157, "num_tokens": 122595466.0, "reward": 0.9378320634365082, "reward_std": 0.3525817796587944, "rewards/reward_accuracy/mean": 0.840234375, "rewards/reward_accuracy/std": 0.3474182948470116, "rewards/reward_format/mean": 0.09759765714406968, "rewards/reward_format/std": 0.013238419266417622, "sampling/importance_sampling_ratio/max": 2.680613565444946, "sampling/importance_sampling_ratio/mean": 0.9599035441875458, "sampling/importance_sampling_ratio/min": 0.029577143862843512, "sampling/sampling_logp_difference/max": 0.8147324562072754, "sampling/sampling_logp_difference/mean": 0.006415283959358931, "step": 1080, "step_time": 9.683272144477815 }, { "clip_ratio/high_max": 1.0416666918899864e-05, "clip_ratio/high_mean": 1.302083364862483e-06, "clip_ratio/low_mean": 1.595896742401237e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 2.8979801072637203e-06, "completions/clipped_ratio": 0.022265625, "completions/max_length": 2048.0, "completions/max_terminated_length": 1804.3, "completions/mean_length": 244.9875, "completions/mean_terminated_length": 203.84751739501954, "completions/min_length": 71.5, "completions/min_terminated_length": 71.5, "entropy": 0.12266029668971896, "epoch": 2.3340471092077086, "frac_reward_zero_std": 0.71875, "grad_norm": 0.2294921875, "learning_rate": 9.891100000000001e-06, "loss": -0.0107, "num_tokens": 123737722.0, "reward": 1.0016602158546448, "reward_std": 0.293124695122242, "rewards/reward_accuracy/mean": 0.903515625, "rewards/reward_accuracy/std": 0.288481830060482, "rewards/reward_format/mean": 0.09814453274011611, "rewards/reward_format/std": 0.011180605180561543, "sampling/importance_sampling_ratio/max": 2.513754057884216, "sampling/importance_sampling_ratio/mean": 0.9695345818996429, "sampling/importance_sampling_ratio/min": 0.029576815478503705, "sampling/sampling_logp_difference/max": 0.8481000185012817, "sampling/sampling_logp_difference/mean": 0.005876340437680483, "step": 1090, "step_time": 10.117800503969193 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.036328125, "completions/max_length": 1951.3, "completions/max_terminated_length": 1771.1, "completions/mean_length": 262.37109375, "completions/mean_terminated_length": 195.63728790283204, "completions/min_length": 76.1, "completions/min_terminated_length": 76.1, "entropy": 0.12640515374951064, "epoch": 2.355460385438972, "frac_reward_zero_std": 0.625, "grad_norm": 0.69921875, "learning_rate": 9.8901e-06, "loss": -0.0252, "num_tokens": 124921152.0, "reward": 0.9613086163997651, "reward_std": 0.3352919176220894, "rewards/reward_accuracy/mean": 0.864453125, "rewards/reward_accuracy/std": 0.3288334637880325, "rewards/reward_format/mean": 0.09685546979308128, "rewards/reward_format/std": 0.01449173039291054, "sampling/importance_sampling_ratio/max": 2.570423650741577, "sampling/importance_sampling_ratio/mean": 0.9678205013275146, "sampling/importance_sampling_ratio/min": 0.03777830898761749, "sampling/sampling_logp_difference/max": 0.6866097390651703, "sampling/sampling_logp_difference/mean": 0.00607558167539537, "step": 1100, "step_time": 9.510219195391983 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 2.3601236989634346e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 2.3601236989634346e-06, "completions/clipped_ratio": 0.032421875, "completions/max_length": 2048.0, "completions/max_terminated_length": 1929.7, "completions/mean_length": 285.721875, "completions/mean_terminated_length": 227.0260208129883, "completions/min_length": 76.2, "completions/min_terminated_length": 76.2, "entropy": 0.13211327306926252, "epoch": 2.3768736616702357, "frac_reward_zero_std": 0.66875, "grad_norm": 0.5390625, "learning_rate": 9.8891e-06, "loss": -0.0186, "num_tokens": 126172536.0, "reward": 0.9609179854393005, "reward_std": 0.3383749857544899, "rewards/reward_accuracy/mean": 0.863671875, "rewards/reward_accuracy/std": 0.3321027413010597, "rewards/reward_format/mean": 0.09724609404802323, "rewards/reward_format/std": 0.014321976550854742, "sampling/importance_sampling_ratio/max": 2.5327759265899656, "sampling/importance_sampling_ratio/mean": 0.9528759002685547, "sampling/importance_sampling_ratio/min": 0.03754093796014786, "sampling/sampling_logp_difference/max": 0.7833775043487549, "sampling/sampling_logp_difference/mean": 0.006160255568102002, "step": 1110, "step_time": 10.354878402687609 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 1.43038587339106e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 1.43038587339106e-06, "completions/clipped_ratio": 0.03046875, "completions/max_length": 2048.0, "completions/max_terminated_length": 1730.9, "completions/mean_length": 266.85546875, "completions/mean_terminated_length": 211.3396194458008, "completions/min_length": 72.3, "completions/min_terminated_length": 72.3, "entropy": 0.12343061584979295, "epoch": 2.398286937901499, "frac_reward_zero_std": 0.7, "grad_norm": 0.66796875, "learning_rate": 9.888100000000001e-06, "loss": -0.0103, "num_tokens": 127377334.0, "reward": 0.9668164134025574, "reward_std": 0.33379283994436265, "rewards/reward_accuracy/mean": 0.86953125, "rewards/reward_accuracy/std": 0.32742525190114974, "rewards/reward_format/mean": 0.09728515595197677, "rewards/reward_format/std": 0.014404558949172497, "sampling/importance_sampling_ratio/max": 2.419392716884613, "sampling/importance_sampling_ratio/mean": 0.9670025050640106, "sampling/importance_sampling_ratio/min": 0.05642097443342209, "sampling/sampling_logp_difference/max": 0.8164916872978211, "sampling/sampling_logp_difference/mean": 0.0059681158978492025, "step": 1120, "step_time": 10.269993857340888 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 9.061368700713502e-07, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 9.061368700713502e-07, "completions/clipped_ratio": 0.021484375, "completions/max_length": 1921.2, "completions/max_terminated_length": 1659.0, "completions/mean_length": 235.24921875, "completions/mean_terminated_length": 195.7997802734375, "completions/min_length": 77.2, "completions/min_terminated_length": 77.2, "entropy": 0.11750046471133828, "epoch": 2.4197002141327624, "frac_reward_zero_std": 0.6875, "grad_norm": 0.7109375, "learning_rate": 9.8871e-06, "loss": -0.0163, "num_tokens": 128503588.0, "reward": 0.9483398616313934, "reward_std": 0.35108003169298174, "rewards/reward_accuracy/mean": 0.85, "rewards/reward_accuracy/std": 0.3469109281897545, "rewards/reward_format/mean": 0.09833984375, "rewards/reward_format/std": 0.010394430113956332, "sampling/importance_sampling_ratio/max": 2.410228097438812, "sampling/importance_sampling_ratio/mean": 0.9705608308315277, "sampling/importance_sampling_ratio/min": 0.012885813042521477, "sampling/sampling_logp_difference/max": 0.7898650825023651, "sampling/sampling_logp_difference/mean": 0.0060071276500821115, "step": 1130, "step_time": 9.265017144754529 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 3.086288734266418e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 3.086288734266418e-06, "completions/clipped_ratio": 0.01640625, "completions/max_length": 1779.6, "completions/max_terminated_length": 1499.9, "completions/mean_length": 208.53046875, "completions/mean_terminated_length": 178.2081283569336, "completions/min_length": 71.4, "completions/min_terminated_length": 71.4, "entropy": 0.09634291706606746, "epoch": 2.4411134903640255, "frac_reward_zero_std": 0.7, "grad_norm": 0.515625, "learning_rate": 9.8861e-06, "loss": -0.0195, "num_tokens": 129554674.0, "reward": 0.9709179818630218, "reward_std": 0.30105303823947904, "rewards/reward_accuracy/mean": 0.872265625, "rewards/reward_accuracy/std": 0.29809298515319826, "rewards/reward_format/mean": 0.09865234568715095, "rewards/reward_format/std": 0.007906114892102778, "sampling/importance_sampling_ratio/max": 2.6309684038162233, "sampling/importance_sampling_ratio/mean": 0.9861074686050415, "sampling/importance_sampling_ratio/min": 0.09028481394052505, "sampling/sampling_logp_difference/max": 0.8634990096092224, "sampling/sampling_logp_difference/mean": 0.005428957473486662, "step": 1140, "step_time": 8.799830540595575 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.015625, "completions/max_length": 1726.8, "completions/max_terminated_length": 1590.4, "completions/mean_length": 216.330078125, "completions/mean_terminated_length": 187.59940032958986, "completions/min_length": 71.2, "completions/min_terminated_length": 71.2, "entropy": 0.10101239359937608, "epoch": 2.462526766595289, "frac_reward_zero_std": 0.725, "grad_norm": 0.388671875, "learning_rate": 9.885100000000001e-06, "loss": -0.0144, "num_tokens": 130624511.0, "reward": 0.9794922113418579, "reward_std": 0.28809296593535694, "rewards/reward_accuracy/mean": 0.880859375, "rewards/reward_accuracy/std": 0.28479473367333413, "rewards/reward_format/mean": 0.0986328125, "rewards/reward_format/std": 0.008401826815679669, "sampling/importance_sampling_ratio/max": 2.5038231372833253, "sampling/importance_sampling_ratio/mean": 0.9761457800865173, "sampling/importance_sampling_ratio/min": 0.11141059398651124, "sampling/sampling_logp_difference/max": 0.7283841013908386, "sampling/sampling_logp_difference/mean": 0.005474243592470884, "step": 1150, "step_time": 8.53159620151855 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 4.5992108425707555e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 4.5992108425707555e-06, "completions/clipped_ratio": 0.026953125, "completions/max_length": 2048.0, "completions/max_terminated_length": 1696.6, "completions/mean_length": 265.127734375, "completions/mean_terminated_length": 216.07809295654297, "completions/min_length": 70.1, "completions/min_terminated_length": 70.1, "entropy": 0.11614525141194462, "epoch": 2.4839400428265526, "frac_reward_zero_std": 0.61875, "grad_norm": 0.8203125, "learning_rate": 9.8841e-06, "loss": -0.017, "num_tokens": 131825734.0, "reward": 0.939746105670929, "reward_std": 0.3664032369852066, "rewards/reward_accuracy/mean": 0.8421875, "rewards/reward_accuracy/std": 0.3609219193458557, "rewards/reward_format/mean": 0.09755859449505806, "rewards/reward_format/std": 0.013077843934297562, "sampling/importance_sampling_ratio/max": 2.4015148401260378, "sampling/importance_sampling_ratio/mean": 0.9731174051761627, "sampling/importance_sampling_ratio/min": 0.026527552306652068, "sampling/sampling_logp_difference/max": 0.8383093237876892, "sampling/sampling_logp_difference/mean": 0.0058770699892193076, "step": 1160, "step_time": 9.936668931273744 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01875, "completions/max_length": 1903.7, "completions/max_terminated_length": 1725.8, "completions/mean_length": 246.346875, "completions/mean_terminated_length": 212.08897552490234, "completions/min_length": 79.8, "completions/min_terminated_length": 79.8, "entropy": 0.11083816634491087, "epoch": 2.505353319057816, "frac_reward_zero_std": 0.6875, "grad_norm": 0.72265625, "learning_rate": 9.8831e-06, "loss": -0.0114, "num_tokens": 132973358.0, "reward": 0.9773437857627869, "reward_std": 0.31524987146258354, "rewards/reward_accuracy/mean": 0.87890625, "rewards/reward_accuracy/std": 0.31120840832591057, "rewards/reward_format/mean": 0.09843750149011612, "rewards/reward_format/std": 0.009796102903783322, "sampling/importance_sampling_ratio/max": 2.38149436712265, "sampling/importance_sampling_ratio/mean": 0.968826287984848, "sampling/importance_sampling_ratio/min": 0.013686629431322216, "sampling/sampling_logp_difference/max": 0.7478554666042327, "sampling/sampling_logp_difference/mean": 0.005905471835285425, "step": 1170, "step_time": 9.177805413864553 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.012109375, "completions/max_length": 1970.6, "completions/max_terminated_length": 1723.4, "completions/mean_length": 224.276953125, "completions/mean_terminated_length": 202.0638641357422, "completions/min_length": 76.2, "completions/min_terminated_length": 76.2, "entropy": 0.11099376552738249, "epoch": 2.526766595289079, "frac_reward_zero_std": 0.70625, "grad_norm": 0.74609375, "learning_rate": 9.882100000000001e-06, "loss": -0.0047, "num_tokens": 134062915.0, "reward": 0.9767382860183715, "reward_std": 0.32685485780239104, "rewards/reward_accuracy/mean": 0.877734375, "rewards/reward_accuracy/std": 0.3242702782154083, "rewards/reward_format/mean": 0.09900390654802323, "rewards/reward_format/std": 0.007977549475617707, "sampling/importance_sampling_ratio/max": 2.5268240451812742, "sampling/importance_sampling_ratio/mean": 0.9754394590854645, "sampling/importance_sampling_ratio/min": 0.02971261367201805, "sampling/sampling_logp_difference/max": 0.6882762312889099, "sampling/sampling_logp_difference/mean": 0.005719746043905616, "step": 1180, "step_time": 9.392645579902455 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 3.5509234521668986e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 3.5509234521668986e-06, "completions/clipped_ratio": 0.026953125, "completions/max_length": 1982.0, "completions/max_terminated_length": 1707.0, "completions/mean_length": 278.45, "completions/mean_terminated_length": 230.33758239746095, "completions/min_length": 75.3, "completions/min_terminated_length": 75.3, "entropy": 0.12821501782163977, "epoch": 2.5481798715203428, "frac_reward_zero_std": 0.63125, "grad_norm": 0.46484375, "learning_rate": 9.881100000000001e-06, "loss": -0.0179, "num_tokens": 135300035.0, "reward": 0.9256445527076721, "reward_std": 0.3503075659275055, "rewards/reward_accuracy/mean": 0.827734375, "rewards/reward_accuracy/std": 0.3460334658622742, "rewards/reward_format/mean": 0.09791015684604645, "rewards/reward_format/std": 0.012611499638296664, "sampling/importance_sampling_ratio/max": 2.673357939720154, "sampling/importance_sampling_ratio/mean": 0.9690265715122223, "sampling/importance_sampling_ratio/min": 0.0332604312337935, "sampling/sampling_logp_difference/max": 1.2096776962280273, "sampling/sampling_logp_difference/mean": 0.006227149907499552, "step": 1190, "step_time": 9.643906076671556 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 3.329770879645366e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 3.329770879645366e-06, "completions/clipped_ratio": 0.026171875, "completions/max_length": 1929.4, "completions/max_terminated_length": 1724.5, "completions/mean_length": 255.20390625, "completions/mean_terminated_length": 207.6074966430664, "completions/min_length": 77.8, "completions/min_terminated_length": 77.8, "entropy": 0.12322955592535437, "epoch": 2.569593147751606, "frac_reward_zero_std": 0.6375, "grad_norm": 0.45703125, "learning_rate": 9.880100000000002e-06, "loss": -0.0224, "num_tokens": 136471693.0, "reward": 0.9662891030311584, "reward_std": 0.32554339319467546, "rewards/reward_accuracy/mean": 0.86875, "rewards/reward_accuracy/std": 0.31977187395095824, "rewards/reward_format/mean": 0.09753906354308128, "rewards/reward_format/std": 0.01225655348971486, "sampling/importance_sampling_ratio/max": 2.5436065673828123, "sampling/importance_sampling_ratio/mean": 0.976447606086731, "sampling/importance_sampling_ratio/min": 0.053687041997909545, "sampling/sampling_logp_difference/max": 1.4991020500659942, "sampling/sampling_logp_difference/mean": 0.006122301518917084, "step": 1200, "step_time": 9.446402003895491 }, { "clip_ratio/high_max": 4.926416295347735e-06, "clip_ratio/high_mean": 6.158020369184669e-07, "clip_ratio/low_mean": 2.9090949055898816e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 3.5248969425083486e-06, "completions/clipped_ratio": 0.012890625, "completions/max_length": 1958.5, "completions/max_terminated_length": 1712.1, "completions/mean_length": 237.2234375, "completions/mean_terminated_length": 213.35184020996093, "completions/min_length": 81.0, "completions/min_terminated_length": 81.0, "entropy": 0.10248684603720903, "epoch": 2.5910064239828694, "frac_reward_zero_std": 0.74375, "grad_norm": 1.40625, "learning_rate": 9.8791e-06, "loss": -0.0005, "num_tokens": 137597017.0, "reward": 0.9930664122104644, "reward_std": 0.2985305577516556, "rewards/reward_accuracy/mean": 0.894140625, "rewards/reward_accuracy/std": 0.2958211272954941, "rewards/reward_format/mean": 0.09892578199505805, "rewards/reward_format/std": 0.00706928342115134, "sampling/importance_sampling_ratio/max": 2.606118392944336, "sampling/importance_sampling_ratio/mean": 0.9743223965168, "sampling/importance_sampling_ratio/min": 0.037309590727090836, "sampling/sampling_logp_difference/max": 0.6893625378608703, "sampling/sampling_logp_difference/mean": 0.0055499737150967125, "step": 1210, "step_time": 9.280814257636667 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.016796875, "completions/max_length": 2035.7, "completions/max_terminated_length": 1778.4, "completions/mean_length": 252.879296875, "completions/mean_terminated_length": 222.51177215576172, "completions/min_length": 76.4, "completions/min_terminated_length": 76.4, "entropy": 0.1120216847397387, "epoch": 2.612419700214133, "frac_reward_zero_std": 0.61875, "grad_norm": 0.6953125, "learning_rate": 9.878100000000001e-06, "loss": -0.0136, "num_tokens": 138762180.0, "reward": 0.9666211128234863, "reward_std": 0.33665634095668795, "rewards/reward_accuracy/mean": 0.86796875, "rewards/reward_accuracy/std": 0.33317147493362426, "rewards/reward_format/mean": 0.09865234419703484, "rewards/reward_format/std": 0.009740133932791651, "sampling/importance_sampling_ratio/max": 2.4010931253433228, "sampling/importance_sampling_ratio/mean": 0.9836122334003449, "sampling/importance_sampling_ratio/min": 0.006855695322155952, "sampling/sampling_logp_difference/max": 0.7740574240684509, "sampling/sampling_logp_difference/mean": 0.005772509099915624, "step": 1220, "step_time": 9.878193000052125 }, { "clip_ratio/high_max": 3.522383922245353e-05, "clip_ratio/high_mean": 4.4029799028066915e-06, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 4.4029799028066915e-06, "completions/clipped_ratio": 0.016015625, "completions/max_length": 1700.6, "completions/max_terminated_length": 1379.7, "completions/mean_length": 221.874609375, "completions/mean_terminated_length": 192.6762924194336, "completions/min_length": 73.6, "completions/min_terminated_length": 73.6, "entropy": 0.10544037567451596, "epoch": 2.633832976445396, "frac_reward_zero_std": 0.7125, "grad_norm": 0.375, "learning_rate": 9.8771e-06, "loss": -0.0147, "num_tokens": 139845859.0, "reward": 0.9893750190734864, "reward_std": 0.2851388640701771, "rewards/reward_accuracy/mean": 0.890625, "rewards/reward_accuracy/std": 0.282031462341547, "rewards/reward_format/mean": 0.09875000044703483, "rewards/reward_format/std": 0.008406375162303447, "sampling/importance_sampling_ratio/max": 2.4298395991325377, "sampling/importance_sampling_ratio/mean": 0.9714834153652191, "sampling/importance_sampling_ratio/min": 0.058597370190545915, "sampling/sampling_logp_difference/max": 0.8617385864257813, "sampling/sampling_logp_difference/mean": 0.0056805111002177, "step": 1230, "step_time": 8.271268416242673 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.029296875, "completions/max_length": 2048.0, "completions/max_terminated_length": 1841.6, "completions/mean_length": 257.4375, "completions/mean_terminated_length": 204.04788208007812, "completions/min_length": 73.2, "completions/min_terminated_length": 73.2, "entropy": 0.11693628216162325, "epoch": 2.6552462526766596, "frac_reward_zero_std": 0.65625, "grad_norm": 0.51953125, "learning_rate": 9.8761e-06, "loss": -0.0154, "num_tokens": 141023491.0, "reward": 0.9466797053813935, "reward_std": 0.34259312748909, "rewards/reward_accuracy/mean": 0.848828125, "rewards/reward_accuracy/std": 0.33781424462795256, "rewards/reward_format/mean": 0.09785156399011612, "rewards/reward_format/std": 0.0126682810485363, "sampling/importance_sampling_ratio/max": 2.5998017311096193, "sampling/importance_sampling_ratio/mean": 0.9692283391952514, "sampling/importance_sampling_ratio/min": 0.011178352450951935, "sampling/sampling_logp_difference/max": 0.745108687877655, "sampling/sampling_logp_difference/mean": 0.006247152853757143, "step": 1240, "step_time": 9.961171841062605 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0125, "completions/max_length": 1961.6, "completions/max_terminated_length": 1624.8, "completions/mean_length": 228.712109375, "completions/mean_terminated_length": 205.82545166015626, "completions/min_length": 79.9, "completions/min_terminated_length": 79.9, "entropy": 0.10614782492630184, "epoch": 2.6766595289079227, "frac_reward_zero_std": 0.6125, "grad_norm": 0.7421875, "learning_rate": 9.875100000000001e-06, "loss": -0.0134, "num_tokens": 142130498.0, "reward": 0.9742383062839508, "reward_std": 0.3295032739639282, "rewards/reward_accuracy/mean": 0.875390625, "rewards/reward_accuracy/std": 0.3269165128469467, "rewards/reward_format/mean": 0.0988476574420929, "rewards/reward_format/std": 0.00847327196970582, "sampling/importance_sampling_ratio/max": 2.5346641182899474, "sampling/importance_sampling_ratio/mean": 0.9850917160511017, "sampling/importance_sampling_ratio/min": 0.02366028996184468, "sampling/sampling_logp_difference/max": 0.7780488073825836, "sampling/sampling_logp_difference/mean": 0.005560130765661597, "step": 1250, "step_time": 9.500657796533778 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.028125, "completions/max_length": 1926.7, "completions/max_terminated_length": 1746.6, "completions/mean_length": 261.65234375, "completions/mean_terminated_length": 210.331005859375, "completions/min_length": 80.4, "completions/min_terminated_length": 80.4, "entropy": 0.12959602857008576, "epoch": 2.6980728051391862, "frac_reward_zero_std": 0.63125, "grad_norm": 0.43359375, "learning_rate": 9.874100000000001e-06, "loss": -0.0107, "num_tokens": 143322296.0, "reward": 0.9438281416893005, "reward_std": 0.3512891441583633, "rewards/reward_accuracy/mean": 0.84609375, "rewards/reward_accuracy/std": 0.346310780197382, "rewards/reward_format/mean": 0.0977343775331974, "rewards/reward_format/std": 0.012186393793672323, "sampling/importance_sampling_ratio/max": 2.4046759724617006, "sampling/importance_sampling_ratio/mean": 0.960819661617279, "sampling/importance_sampling_ratio/min": 0.035607528686523435, "sampling/sampling_logp_difference/max": 1.071310806274414, "sampling/sampling_logp_difference/mean": 0.006372118461877107, "step": 1260, "step_time": 9.63373260111548 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.014453125, "completions/max_length": 2016.6, "completions/max_terminated_length": 1728.9, "completions/mean_length": 228.82890625, "completions/mean_terminated_length": 202.31111755371094, "completions/min_length": 77.1, "completions/min_terminated_length": 77.1, "entropy": 0.10872721099294722, "epoch": 2.71948608137045, "frac_reward_zero_std": 0.6125, "grad_norm": 0.671875, "learning_rate": 9.8731e-06, "loss": -0.0205, "num_tokens": 144426130.0, "reward": 0.9678711116313934, "reward_std": 0.31733378022909164, "rewards/reward_accuracy/mean": 0.869140625, "rewards/reward_accuracy/std": 0.3142296507954597, "rewards/reward_format/mean": 0.09873046949505807, "rewards/reward_format/std": 0.009540182771161199, "sampling/importance_sampling_ratio/max": 2.435129129886627, "sampling/importance_sampling_ratio/mean": 0.9794457972049713, "sampling/importance_sampling_ratio/min": 0.013849219679832459, "sampling/sampling_logp_difference/max": 1.0310518503189088, "sampling/sampling_logp_difference/mean": 0.005831611668691039, "step": 1270, "step_time": 9.59111021887511 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.028515625, "completions/max_length": 2048.0, "completions/max_terminated_length": 1791.7, "completions/mean_length": 269.673046875, "completions/mean_terminated_length": 217.65740509033202, "completions/min_length": 74.6, "completions/min_terminated_length": 74.6, "entropy": 0.13079232163727283, "epoch": 2.7408993576017133, "frac_reward_zero_std": 0.65, "grad_norm": 0.75390625, "learning_rate": 9.872100000000002e-06, "loss": -0.0077, "num_tokens": 145639549.0, "reward": 0.968828159570694, "reward_std": 0.33585931956768034, "rewards/reward_accuracy/mean": 0.87109375, "rewards/reward_accuracy/std": 0.3301588326692581, "rewards/reward_format/mean": 0.0977343775331974, "rewards/reward_format/std": 0.013139316393062473, "sampling/importance_sampling_ratio/max": 2.4026608228683473, "sampling/importance_sampling_ratio/mean": 0.9672911167144775, "sampling/importance_sampling_ratio/min": 0.03189416006207466, "sampling/sampling_logp_difference/max": 0.8492157280445098, "sampling/sampling_logp_difference/mean": 0.0065085409674793485, "step": 1280, "step_time": 9.91809090906754 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.018359375, "completions/max_length": 1891.6, "completions/max_terminated_length": 1583.1, "completions/mean_length": 262.328515625, "completions/mean_terminated_length": 229.99191436767578, "completions/min_length": 79.8, "completions/min_terminated_length": 79.8, "entropy": 0.1278539974242449, "epoch": 2.7623126338329764, "frac_reward_zero_std": 0.63125, "grad_norm": 0.6484375, "learning_rate": 9.871100000000001e-06, "loss": -0.0192, "num_tokens": 146835974.0, "reward": 0.9775390982627868, "reward_std": 0.30818301290273664, "rewards/reward_accuracy/mean": 0.879296875, "rewards/reward_accuracy/std": 0.3047086387872696, "rewards/reward_format/mean": 0.09824218899011612, "rewards/reward_format/std": 0.009500205283984542, "sampling/importance_sampling_ratio/max": 2.705585479736328, "sampling/importance_sampling_ratio/mean": 0.9697890758514405, "sampling/importance_sampling_ratio/min": 0.02653864212334156, "sampling/sampling_logp_difference/max": 1.2970592498779296, "sampling/sampling_logp_difference/mean": 0.006262763729318976, "step": 1290, "step_time": 9.217613628599793 }, { "clip_ratio/high_max": 1.292657689191401e-05, "clip_ratio/high_mean": 1.6158221114892512e-06, "clip_ratio/low_mean": 1.7566771475685527e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 3.372499259057804e-06, "completions/clipped_ratio": 0.033984375, "completions/max_length": 1991.8, "completions/max_terminated_length": 1872.9, "completions/mean_length": 278.7984375, "completions/mean_terminated_length": 217.09892730712892, "completions/min_length": 75.7, "completions/min_terminated_length": 75.7, "entropy": 0.1287424558773637, "epoch": 2.78372591006424, "frac_reward_zero_std": 0.65, "grad_norm": 0.294921875, "learning_rate": 9.8701e-06, "loss": -0.0159, "num_tokens": 148071170.0, "reward": 0.943632847070694, "reward_std": 0.3574570745229721, "rewards/reward_accuracy/mean": 0.846484375, "rewards/reward_accuracy/std": 0.350945408642292, "rewards/reward_format/mean": 0.09714843928813935, "rewards/reward_format/std": 0.014267935231328011, "sampling/importance_sampling_ratio/max": 2.6756571173667907, "sampling/importance_sampling_ratio/mean": 0.9618051469326019, "sampling/importance_sampling_ratio/min": 0.03196396008133888, "sampling/sampling_logp_difference/max": 0.8176993787288666, "sampling/sampling_logp_difference/mean": 0.006301799556240439, "step": 1300, "step_time": 10.110669854655862 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01328125, "completions/max_length": 1886.2, "completions/max_terminated_length": 1755.1, "completions/mean_length": 208.4359375, "completions/mean_terminated_length": 183.69110565185548, "completions/min_length": 72.9, "completions/min_terminated_length": 72.9, "entropy": 0.09744282835163176, "epoch": 2.805139186295503, "frac_reward_zero_std": 0.68125, "grad_norm": 0.68359375, "learning_rate": 9.8691e-06, "loss": -0.0101, "num_tokens": 149125486.0, "reward": 1.002324217557907, "reward_std": 0.28990163207054137, "rewards/reward_accuracy/mean": 0.903515625, "rewards/reward_accuracy/std": 0.28665773421525953, "rewards/reward_format/mean": 0.09880859404802322, "rewards/reward_format/std": 0.008398479758761823, "sampling/importance_sampling_ratio/max": 2.3627427935600283, "sampling/importance_sampling_ratio/mean": 0.9728740334510804, "sampling/importance_sampling_ratio/min": 0.06787963543320075, "sampling/sampling_logp_difference/max": 1.1454557836055757, "sampling/sampling_logp_difference/mean": 0.0055387520231306555, "step": 1310, "step_time": 8.949888131720945 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 1.1166080639668508e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 1.1166080639668508e-06, "completions/clipped_ratio": 0.027734375, "completions/max_length": 2048.0, "completions/max_terminated_length": 1895.5, "completions/mean_length": 265.8078125, "completions/mean_terminated_length": 215.25103759765625, "completions/min_length": 72.1, "completions/min_terminated_length": 72.1, "entropy": 0.13212055033072828, "epoch": 2.8265524625267666, "frac_reward_zero_std": 0.68125, "grad_norm": 0.8046875, "learning_rate": 9.868100000000001e-06, "loss": -0.0074, "num_tokens": 150321618.0, "reward": 0.9635742485523224, "reward_std": 0.3318389028310776, "rewards/reward_accuracy/mean": 0.866015625, "rewards/reward_accuracy/std": 0.32621782422065737, "rewards/reward_format/mean": 0.09755859449505806, "rewards/reward_format/std": 0.013055017055012285, "sampling/importance_sampling_ratio/max": 2.520074892044067, "sampling/importance_sampling_ratio/mean": 0.9740135073661804, "sampling/importance_sampling_ratio/min": 0.026898569241166116, "sampling/sampling_logp_difference/max": 0.770736175775528, "sampling/sampling_logp_difference/mean": 0.006190569372847676, "step": 1320, "step_time": 10.324230469809844 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 6.663112799287774e-07, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 6.663112799287774e-07, "completions/clipped_ratio": 0.025390625, "completions/max_length": 2048.0, "completions/max_terminated_length": 1775.2, "completions/mean_length": 241.74765625, "completions/mean_terminated_length": 194.9777359008789, "completions/min_length": 67.7, "completions/min_terminated_length": 67.7, "entropy": 0.11845294418744742, "epoch": 2.84796573875803, "frac_reward_zero_std": 0.7375, "grad_norm": 0.69140625, "learning_rate": 9.8671e-06, "loss": -0.0135, "num_tokens": 151453660.0, "reward": 1.000585961341858, "reward_std": 0.29446490556001664, "rewards/reward_accuracy/mean": 0.902734375, "rewards/reward_accuracy/std": 0.288523930311203, "rewards/reward_format/mean": 0.09785156473517417, "rewards/reward_format/std": 0.012423273362219333, "sampling/importance_sampling_ratio/max": 2.3728586077690124, "sampling/importance_sampling_ratio/mean": 0.9622783422470093, "sampling/importance_sampling_ratio/min": 0.0018273277208209037, "sampling/sampling_logp_difference/max": 0.7746831357479096, "sampling/sampling_logp_difference/mean": 0.00582157033495605, "step": 1330, "step_time": 10.209967277850955 }, { "clip_ratio/high_max": 4.991348396288231e-06, "clip_ratio/high_mean": 6.239185495360288e-07, "clip_ratio/low_mean": 8.930067178880562e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 9.553985682941856e-06, "completions/clipped_ratio": 0.039453125, "completions/max_length": 2048.0, "completions/max_terminated_length": 1810.6, "completions/mean_length": 288.835546875, "completions/mean_terminated_length": 217.15137176513673, "completions/min_length": 65.6, "completions/min_terminated_length": 65.6, "entropy": 0.15344584831036628, "epoch": 2.8693790149892933, "frac_reward_zero_std": 0.6125, "grad_norm": 0.65234375, "learning_rate": 9.8661e-06, "loss": -0.0204, "num_tokens": 152707831.0, "reward": 0.941875022649765, "reward_std": 0.35643901228904723, "rewards/reward_accuracy/mean": 0.844921875, "rewards/reward_accuracy/std": 0.34984373599290847, "rewards/reward_format/mean": 0.09695312455296516, "rewards/reward_format/std": 0.015183501690626145, "sampling/importance_sampling_ratio/max": 2.628102970123291, "sampling/importance_sampling_ratio/mean": 0.9503216683864594, "sampling/importance_sampling_ratio/min": 0.003284785896539688, "sampling/sampling_logp_difference/max": 1.0976083636283875, "sampling/sampling_logp_difference/mean": 0.006922589475288987, "step": 1340, "step_time": 10.6404555327259 }, { "clip_ratio/high_max": 2.0133091311436146e-05, "clip_ratio/high_mean": 2.5166364139295183e-06, "clip_ratio/low_mean": 2.0243971448508093e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 4.541033558780328e-06, "completions/clipped_ratio": 0.0375, "completions/max_length": 2048.0, "completions/max_terminated_length": 1836.6, "completions/mean_length": 299.09296875, "completions/mean_terminated_length": 231.51004028320312, "completions/min_length": 72.4, "completions/min_terminated_length": 72.4, "entropy": 0.14960660738870502, "epoch": 2.890792291220557, "frac_reward_zero_std": 0.63125, "grad_norm": 0.2138671875, "learning_rate": 9.865100000000001e-06, "loss": -0.0269, "num_tokens": 153993157.0, "reward": 0.9589258074760437, "reward_std": 0.3412553042173386, "rewards/reward_accuracy/mean": 0.86171875, "rewards/reward_accuracy/std": 0.3356348142027855, "rewards/reward_format/mean": 0.09720703214406967, "rewards/reward_format/std": 0.014078139141201974, "sampling/importance_sampling_ratio/max": 2.555004930496216, "sampling/importance_sampling_ratio/mean": 0.9512849867343902, "sampling/importance_sampling_ratio/min": 0.0030088335275650024, "sampling/sampling_logp_difference/max": 1.5254368782043457, "sampling/sampling_logp_difference/mean": 0.006909074913710356, "step": 1350, "step_time": 10.67657860480249 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.028125, "completions/max_length": 1900.8, "completions/max_terminated_length": 1795.6, "completions/mean_length": 288.038671875, "completions/mean_terminated_length": 237.45382995605468, "completions/min_length": 76.1, "completions/min_terminated_length": 76.1, "entropy": 0.143941687932238, "epoch": 2.91220556745182, "frac_reward_zero_std": 0.6375, "grad_norm": 0.75390625, "learning_rate": 9.864100000000001e-06, "loss": -0.0209, "num_tokens": 155255064.0, "reward": 0.9686133027076721, "reward_std": 0.32756122648715974, "rewards/reward_accuracy/mean": 0.87109375, "rewards/reward_accuracy/std": 0.32222829312086104, "rewards/reward_format/mean": 0.09751953333616256, "rewards/reward_format/std": 0.012957901414483785, "sampling/importance_sampling_ratio/max": 2.6038841724395754, "sampling/importance_sampling_ratio/mean": 0.9601919770240783, "sampling/importance_sampling_ratio/min": 0.03949383832514286, "sampling/sampling_logp_difference/max": 0.9934428691864013, "sampling/sampling_logp_difference/mean": 0.006732242181897163, "step": 1360, "step_time": 9.494218508386984 }, { "clip_ratio/high_max": 2.635635028127581e-05, "clip_ratio/high_mean": 3.2945437851594763e-06, "clip_ratio/low_mean": 2.210972206739825e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 5.505515991899301e-06, "completions/clipped_ratio": 0.034375, "completions/max_length": 1982.7, "completions/max_terminated_length": 1787.8, "completions/mean_length": 285.52578125, "completions/mean_terminated_length": 223.00097045898437, "completions/min_length": 72.8, "completions/min_terminated_length": 72.8, "entropy": 0.1397873640526086, "epoch": 2.9336188436830835, "frac_reward_zero_std": 0.65, "grad_norm": 0.84375, "learning_rate": 9.8631e-06, "loss": -0.0032, "num_tokens": 156499978.0, "reward": 0.9865820467472076, "reward_std": 0.3123451009392738, "rewards/reward_accuracy/mean": 0.8890625, "rewards/reward_accuracy/std": 0.3060625419020653, "rewards/reward_format/mean": 0.09751953482627869, "rewards/reward_format/std": 0.013042040448635817, "sampling/importance_sampling_ratio/max": 2.5193291306495667, "sampling/importance_sampling_ratio/mean": 0.9671801090240478, "sampling/importance_sampling_ratio/min": 0.005964728444814682, "sampling/sampling_logp_difference/max": 0.9094330310821533, "sampling/sampling_logp_difference/mean": 0.006431865599006414, "step": 1370, "step_time": 9.875170447817073 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 1.4612377071898664e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 1.4612377071898664e-06, "completions/clipped_ratio": 0.02265625, "completions/max_length": 2048.0, "completions/max_terminated_length": 1906.3, "completions/mean_length": 251.055859375, "completions/mean_terminated_length": 209.5852310180664, "completions/min_length": 69.7, "completions/min_terminated_length": 69.7, "entropy": 0.12507415413856507, "epoch": 2.955032119914347, "frac_reward_zero_std": 0.66875, "grad_norm": 0.5546875, "learning_rate": 9.862100000000002e-06, "loss": -0.0179, "num_tokens": 157658489.0, "reward": 0.9856054842472076, "reward_std": 0.30150564163923266, "rewards/reward_accuracy/mean": 0.8875, "rewards/reward_accuracy/std": 0.2964631341397762, "rewards/reward_format/mean": 0.09810546860098839, "rewards/reward_format/std": 0.011590168438851833, "sampling/importance_sampling_ratio/max": 2.397749125957489, "sampling/importance_sampling_ratio/mean": 0.9672664165496826, "sampling/importance_sampling_ratio/min": 0.01951782018877566, "sampling/sampling_logp_difference/max": 0.8342133939266205, "sampling/sampling_logp_difference/mean": 0.006047966657206416, "step": 1380, "step_time": 10.104428648622706 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 2.1982757971272802e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 2.1982757971272802e-06, "completions/clipped_ratio": 0.01640625, "completions/max_length": 1875.4, "completions/max_terminated_length": 1630.8, "completions/mean_length": 221.80859375, "completions/mean_terminated_length": 191.29249725341796, "completions/min_length": 68.3, "completions/min_terminated_length": 68.3, "entropy": 0.11596635873429477, "epoch": 2.9764453961456105, "frac_reward_zero_std": 0.725, "grad_norm": 0.5078125, "learning_rate": 9.861100000000001e-06, "loss": -0.0029, "num_tokens": 158738735.0, "reward": 0.9977734506130218, "reward_std": 0.2801591753959656, "rewards/reward_accuracy/mean": 0.89921875, "rewards/reward_accuracy/std": 0.2758606433868408, "rewards/reward_format/mean": 0.0985546886920929, "rewards/reward_format/std": 0.00975913885049522, "sampling/importance_sampling_ratio/max": 2.377631413936615, "sampling/importance_sampling_ratio/mean": 0.9857850909233093, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 0.7392346024513244, "sampling/sampling_logp_difference/mean": 0.005586580093950033, "step": 1390, "step_time": 9.168195472005754 }, { "clip_ratio/high_max": 2.4549842783017085e-05, "clip_ratio/high_mean": 3.0687303478771357e-06, "clip_ratio/low_mean": 3.586512434594624e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 6.65524278247176e-06, "completions/clipped_ratio": 0.0234375, "completions/max_length": 2048.0, "completions/max_terminated_length": 1822.9, "completions/mean_length": 252.641015625, "completions/mean_terminated_length": 209.3615692138672, "completions/min_length": 72.0, "completions/min_terminated_length": 72.0, "entropy": 0.12869733683764933, "epoch": 2.9978586723768736, "frac_reward_zero_std": 0.675, "grad_norm": 0.6484375, "learning_rate": 9.8601e-06, "loss": -0.0134, "num_tokens": 159901448.0, "reward": 0.9803515791893005, "reward_std": 0.32386000752449035, "rewards/reward_accuracy/mean": 0.882421875, "rewards/reward_accuracy/std": 0.3183260202407837, "rewards/reward_format/mean": 0.09792969077825546, "rewards/reward_format/std": 0.012549743638373911, "sampling/importance_sampling_ratio/max": 2.6030848026275635, "sampling/importance_sampling_ratio/mean": 0.9746620714664459, "sampling/importance_sampling_ratio/min": 0.004979809746146202, "sampling/sampling_logp_difference/max": 0.928394103050232, "sampling/sampling_logp_difference/mean": 0.006141010578721762, "step": 1400, "step_time": 10.237090529641137 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0234375, "completions/max_length": 2003.7, "completions/max_terminated_length": 1929.3, "completions/mean_length": 278.990234375, "completions/mean_terminated_length": 237.19077758789064, "completions/min_length": 70.9, "completions/min_terminated_length": 70.9, "entropy": 0.13723228890448808, "epoch": 3.019271948608137, "frac_reward_zero_std": 0.6875, "grad_norm": 0.234375, "learning_rate": 9.8591e-06, "loss": -0.0137, "num_tokens": 161130815.0, "reward": 0.9694726943969727, "reward_std": 0.3122725859284401, "rewards/reward_accuracy/mean": 0.871875, "rewards/reward_accuracy/std": 0.30731979161500933, "rewards/reward_format/mean": 0.09759765863418579, "rewards/reward_format/std": 0.012566167674958707, "sampling/importance_sampling_ratio/max": 2.433853769302368, "sampling/importance_sampling_ratio/mean": 0.9620497286319732, "sampling/importance_sampling_ratio/min": 0.005554328300058841, "sampling/sampling_logp_difference/max": 1.010851502418518, "sampling/sampling_logp_difference/mean": 0.006218926748260856, "step": 1410, "step_time": 9.85424626157619 }, { "clip_ratio/high_max": 1.7988806939683853e-05, "clip_ratio/high_mean": 2.2486008674604817e-06, "clip_ratio/low_mean": 2.498001549611217e-07, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 2.498401045158971e-06, "completions/clipped_ratio": 0.025390625, "completions/max_length": 2034.3, "completions/max_terminated_length": 1807.4, "completions/mean_length": 249.11875, "completions/mean_terminated_length": 202.41503448486327, "completions/min_length": 66.1, "completions/min_terminated_length": 66.1, "entropy": 0.12095137531869113, "epoch": 3.0406852248394003, "frac_reward_zero_std": 0.68125, "grad_norm": 0.265625, "learning_rate": 9.8581e-06, "loss": -0.0247, "num_tokens": 162286927.0, "reward": 0.9686133027076721, "reward_std": 0.33186696469783783, "rewards/reward_accuracy/mean": 0.870703125, "rewards/reward_accuracy/std": 0.3270107865333557, "rewards/reward_format/mean": 0.09791015759110451, "rewards/reward_format/std": 0.011695434665307402, "sampling/importance_sampling_ratio/max": 2.566501998901367, "sampling/importance_sampling_ratio/mean": 0.9749084770679474, "sampling/importance_sampling_ratio/min": 0.0803227648139, "sampling/sampling_logp_difference/max": 0.8581221640110016, "sampling/sampling_logp_difference/mean": 0.006047851219773292, "step": 1420, "step_time": 9.977447223011405 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.027734375, "completions/max_length": 1990.0, "completions/max_terminated_length": 1761.9, "completions/mean_length": 253.055859375, "completions/mean_terminated_length": 202.3875717163086, "completions/min_length": 71.0, "completions/min_terminated_length": 71.0, "entropy": 0.11509081302210689, "epoch": 3.062098501070664, "frac_reward_zero_std": 0.65625, "grad_norm": 0.609375, "learning_rate": 9.857100000000001e-06, "loss": -0.0139, "num_tokens": 163452014.0, "reward": 1.0019336283206939, "reward_std": 0.29161686897277833, "rewards/reward_accuracy/mean": 0.904296875, "rewards/reward_accuracy/std": 0.2856085702776909, "rewards/reward_format/mean": 0.09763671904802322, "rewards/reward_format/std": 0.013012240128591656, "sampling/importance_sampling_ratio/max": 2.3530020475387574, "sampling/importance_sampling_ratio/mean": 0.9724257826805115, "sampling/importance_sampling_ratio/min": 0.015552429109811782, "sampling/sampling_logp_difference/max": 0.956920462846756, "sampling/sampling_logp_difference/mean": 0.005738818645477295, "step": 1430, "step_time": 9.866882085939869 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.022265625, "completions/max_length": 1930.8, "completions/max_terminated_length": 1824.3, "completions/mean_length": 238.0984375, "completions/mean_terminated_length": 197.4676971435547, "completions/min_length": 64.3, "completions/min_terminated_length": 64.3, "entropy": 0.1252144178841263, "epoch": 3.0835117773019274, "frac_reward_zero_std": 0.7, "grad_norm": 0.78125, "learning_rate": 9.8561e-06, "loss": -0.0126, "num_tokens": 164576826.0, "reward": 0.9647656500339508, "reward_std": 0.3372309297323227, "rewards/reward_accuracy/mean": 0.866796875, "rewards/reward_accuracy/std": 0.3327026396989822, "rewards/reward_format/mean": 0.09796875193715096, "rewards/reward_format/std": 0.010998245584778488, "sampling/importance_sampling_ratio/max": 2.5164348125457763, "sampling/importance_sampling_ratio/mean": 0.9726768434047699, "sampling/importance_sampling_ratio/min": 0.01041568573564291, "sampling/sampling_logp_difference/max": 1.1080944299697877, "sampling/sampling_logp_difference/mean": 0.0062936225440353155, "step": 1440, "step_time": 9.412317692255602 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 1.3757784245171933e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 1.3757784245171933e-06, "completions/clipped_ratio": 0.025, "completions/max_length": 1949.1, "completions/max_terminated_length": 1610.0, "completions/mean_length": 243.452734375, "completions/mean_terminated_length": 197.92351989746095, "completions/min_length": 65.5, "completions/min_terminated_length": 65.5, "entropy": 0.11817612624727189, "epoch": 3.1049250535331905, "frac_reward_zero_std": 0.6875, "grad_norm": 0.875, "learning_rate": 9.855100000000002e-06, "loss": -0.0026, "num_tokens": 165712161.0, "reward": 0.975488293170929, "reward_std": 0.3212460920214653, "rewards/reward_accuracy/mean": 0.877734375, "rewards/reward_accuracy/std": 0.3161662548780441, "rewards/reward_format/mean": 0.09775390625, "rewards/reward_format/std": 0.01206508711911738, "sampling/importance_sampling_ratio/max": 2.638550853729248, "sampling/importance_sampling_ratio/mean": 0.9678310573101043, "sampling/importance_sampling_ratio/min": 0.07146952655166387, "sampling/sampling_logp_difference/max": 0.8822963893413543, "sampling/sampling_logp_difference/mean": 0.005902142636477948, "step": 1450, "step_time": 9.733207228221 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.02109375, "completions/max_length": 1837.7, "completions/max_terminated_length": 1598.1, "completions/mean_length": 238.8578125, "completions/mean_terminated_length": 200.35666046142578, "completions/min_length": 66.6, "completions/min_terminated_length": 66.6, "entropy": 0.10323442900553345, "epoch": 3.126338329764454, "frac_reward_zero_std": 0.725, "grad_norm": 0.58984375, "learning_rate": 9.854100000000001e-06, "loss": -0.004, "num_tokens": 166837541.0, "reward": 0.9797656536102295, "reward_std": 0.3173313230276108, "rewards/reward_accuracy/mean": 0.881640625, "rewards/reward_accuracy/std": 0.3126935824751854, "rewards/reward_format/mean": 0.09812500178813935, "rewards/reward_format/std": 0.01072554155252874, "sampling/importance_sampling_ratio/max": 2.5114275574684144, "sampling/importance_sampling_ratio/mean": 0.9727673649787902, "sampling/importance_sampling_ratio/min": 0.08591321557760238, "sampling/sampling_logp_difference/max": 0.8079095959663392, "sampling/sampling_logp_difference/mean": 0.00534597304649651, "step": 1460, "step_time": 9.268999901600182 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.014453125, "completions/max_length": 1841.5, "completions/max_terminated_length": 1475.6, "completions/mean_length": 195.7140625, "completions/mean_terminated_length": 168.81556243896483, "completions/min_length": 60.0, "completions/min_terminated_length": 60.0, "entropy": 0.08325513992458582, "epoch": 3.147751605995717, "frac_reward_zero_std": 0.7625, "grad_norm": 0.58984375, "learning_rate": 9.8531e-06, "loss": -0.0113, "num_tokens": 167847753.0, "reward": 1.0167773604393004, "reward_std": 0.2673481568694115, "rewards/reward_accuracy/mean": 0.91796875, "rewards/reward_accuracy/std": 0.2637575134634972, "rewards/reward_format/mean": 0.09880859404802322, "rewards/reward_format/std": 0.008614166686311365, "sampling/importance_sampling_ratio/max": 2.4897693157196046, "sampling/importance_sampling_ratio/mean": 0.993402773141861, "sampling/importance_sampling_ratio/min": 0.08831279370933771, "sampling/sampling_logp_difference/max": 0.6990828573703766, "sampling/sampling_logp_difference/mean": 0.004966791812330484, "step": 1470, "step_time": 9.222663557855412 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01484375, "completions/max_length": 1968.7, "completions/max_terminated_length": 1637.0, "completions/mean_length": 214.640625, "completions/mean_terminated_length": 187.1670883178711, "completions/min_length": 67.0, "completions/min_terminated_length": 67.0, "entropy": 0.10344052617438138, "epoch": 3.1691648822269807, "frac_reward_zero_std": 0.68125, "grad_norm": 0.435546875, "learning_rate": 9.852100000000002e-06, "loss": -0.0066, "num_tokens": 168914545.0, "reward": 0.9913672089576722, "reward_std": 0.29082458913326265, "rewards/reward_accuracy/mean": 0.892578125, "rewards/reward_accuracy/std": 0.2873623199760914, "rewards/reward_format/mean": 0.0987890638411045, "rewards/reward_format/std": 0.008891093893907964, "sampling/importance_sampling_ratio/max": 2.550092577934265, "sampling/importance_sampling_ratio/mean": 0.9754530787467957, "sampling/importance_sampling_ratio/min": 0.017640766501426697, "sampling/sampling_logp_difference/max": 0.8832846045494079, "sampling/sampling_logp_difference/mean": 0.0054925293661653996, "step": 1480, "step_time": 9.442868809076026 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.019140625, "completions/max_length": 2027.7, "completions/max_terminated_length": 1767.8, "completions/mean_length": 252.796484375, "completions/mean_terminated_length": 218.5821319580078, "completions/min_length": 69.0, "completions/min_terminated_length": 69.0, "entropy": 0.1094044059049338, "epoch": 3.190578158458244, "frac_reward_zero_std": 0.65625, "grad_norm": 0.81640625, "learning_rate": 9.851100000000001e-06, "loss": -0.0177, "num_tokens": 170085240.0, "reward": 0.9426172256469727, "reward_std": 0.33308871239423754, "rewards/reward_accuracy/mean": 0.844140625, "rewards/reward_accuracy/std": 0.3293738439679146, "rewards/reward_format/mean": 0.09847656413912773, "rewards/reward_format/std": 0.01100408979691565, "sampling/importance_sampling_ratio/max": 2.428274416923523, "sampling/importance_sampling_ratio/mean": 0.9697591602802277, "sampling/importance_sampling_ratio/min": 0.0492352195084095, "sampling/sampling_logp_difference/max": 0.7653342425823212, "sampling/sampling_logp_difference/mean": 0.005660760030150413, "step": 1490, "step_time": 9.919875398231671 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0234375, "completions/max_length": 2048.0, "completions/max_terminated_length": 1798.4, "completions/mean_length": 247.023828125, "completions/mean_terminated_length": 204.11618194580078, "completions/min_length": 71.3, "completions/min_terminated_length": 71.3, "entropy": 0.10743768666870893, "epoch": 3.2119914346895073, "frac_reward_zero_std": 0.73125, "grad_norm": 0.45703125, "learning_rate": 9.8501e-06, "loss": -0.0089, "num_tokens": 171232725.0, "reward": 1.0013672232627868, "reward_std": 0.29078521728515627, "rewards/reward_accuracy/mean": 0.903125, "rewards/reward_accuracy/std": 0.28583550453186035, "rewards/reward_format/mean": 0.09824219122529029, "rewards/reward_format/std": 0.011509055038914084, "sampling/importance_sampling_ratio/max": 2.3975042581558226, "sampling/importance_sampling_ratio/mean": 0.9662628412246704, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 0.9585851073265076, "sampling/sampling_logp_difference/mean": 0.005507629457861185, "step": 1500, "step_time": 10.07339425184764 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.021875, "completions/max_length": 1988.4, "completions/max_terminated_length": 1854.4, "completions/mean_length": 251.553515625, "completions/mean_terminated_length": 212.00378875732423, "completions/min_length": 73.2, "completions/min_terminated_length": 73.2, "entropy": 0.1175171316601336, "epoch": 3.233404710920771, "frac_reward_zero_std": 0.68125, "grad_norm": 0.1103515625, "learning_rate": 9.8491e-06, "loss": -0.0142, "num_tokens": 172398062.0, "reward": 0.9636133074760437, "reward_std": 0.322995688021183, "rewards/reward_accuracy/mean": 0.865234375, "rewards/reward_accuracy/std": 0.31946829706430435, "rewards/reward_format/mean": 0.09837890714406967, "rewards/reward_format/std": 0.010151281487196684, "sampling/importance_sampling_ratio/max": 2.3881723642349244, "sampling/importance_sampling_ratio/mean": 0.9565789520740509, "sampling/importance_sampling_ratio/min": 0.04415746591985226, "sampling/sampling_logp_difference/max": 0.8253163397312164, "sampling/sampling_logp_difference/mean": 0.006040327297523618, "step": 1510, "step_time": 9.837803109781817 }, { "clip_ratio/high_max": 2.0112631318625064e-06, "clip_ratio/high_mean": 2.514078914828133e-07, "clip_ratio/low_mean": 2.0195676370349248e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 2.270975528517738e-06, "completions/clipped_ratio": 0.02265625, "completions/max_length": 1906.1, "completions/max_terminated_length": 1748.8, "completions/mean_length": 230.130078125, "completions/mean_terminated_length": 188.74163055419922, "completions/min_length": 69.7, "completions/min_terminated_length": 69.7, "entropy": 0.10287722870707512, "epoch": 3.2548179871520344, "frac_reward_zero_std": 0.75625, "grad_norm": 0.4453125, "learning_rate": 9.8481e-06, "loss": -0.0058, "num_tokens": 173504395.0, "reward": 0.9755273699760437, "reward_std": 0.325254288315773, "rewards/reward_accuracy/mean": 0.87734375, "rewards/reward_accuracy/std": 0.3208487004041672, "rewards/reward_format/mean": 0.09818359538912773, "rewards/reward_format/std": 0.011022813338786363, "sampling/importance_sampling_ratio/max": 2.688767433166504, "sampling/importance_sampling_ratio/mean": 0.9754761040210724, "sampling/importance_sampling_ratio/min": 0.04700644984841347, "sampling/sampling_logp_difference/max": 0.6892714321613311, "sampling/sampling_logp_difference/mean": 0.0055665292777121065, "step": 1520, "step_time": 9.480419942410663 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01171875, "completions/max_length": 1801.7, "completions/max_terminated_length": 1567.3, "completions/mean_length": 214.331640625, "completions/mean_terminated_length": 193.00943756103516, "completions/min_length": 65.9, "completions/min_terminated_length": 65.9, "entropy": 0.09125048737041652, "epoch": 3.2762312633832975, "frac_reward_zero_std": 0.75, "grad_norm": 0.6171875, "learning_rate": 9.847100000000001e-06, "loss": -0.0078, "num_tokens": 174570684.0, "reward": 0.9969335973262787, "reward_std": 0.2909061387181282, "rewards/reward_accuracy/mean": 0.898046875, "rewards/reward_accuracy/std": 0.28805461525917053, "rewards/reward_format/mean": 0.09888671934604645, "rewards/reward_format/std": 0.007716428674757481, "sampling/importance_sampling_ratio/max": 2.5195098876953126, "sampling/importance_sampling_ratio/mean": 0.9786329984664917, "sampling/importance_sampling_ratio/min": 0.13934081960469485, "sampling/sampling_logp_difference/max": 0.6875298023223877, "sampling/sampling_logp_difference/mean": 0.005134655721485614, "step": 1530, "step_time": 8.833215132448823 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 3.814697265625e-07, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 3.814697265625e-07, "completions/clipped_ratio": 0.023046875, "completions/max_length": 1863.7, "completions/max_terminated_length": 1499.1, "completions/mean_length": 236.780859375, "completions/mean_terminated_length": 194.81019744873046, "completions/min_length": 67.8, "completions/min_terminated_length": 67.8, "entropy": 0.10944453040137887, "epoch": 3.297644539614561, "frac_reward_zero_std": 0.725, "grad_norm": 0.59375, "learning_rate": 9.8461e-06, "loss": -0.0081, "num_tokens": 175705611.0, "reward": 0.9695898711681366, "reward_std": 0.3202429562807083, "rewards/reward_accuracy/mean": 0.871484375, "rewards/reward_accuracy/std": 0.3156054921448231, "rewards/reward_format/mean": 0.09810546860098839, "rewards/reward_format/std": 0.011071567120961846, "sampling/importance_sampling_ratio/max": 2.437493693828583, "sampling/importance_sampling_ratio/mean": 0.9736605882644653, "sampling/importance_sampling_ratio/min": 0.04200255274772644, "sampling/sampling_logp_difference/max": 0.9007036030292511, "sampling/sampling_logp_difference/mean": 0.0058080647373571995, "step": 1540, "step_time": 9.295246765529736 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0109375, "completions/max_length": 1955.8, "completions/max_terminated_length": 1795.3, "completions/mean_length": 217.137109375, "completions/mean_terminated_length": 196.95730285644532, "completions/min_length": 65.7, "completions/min_terminated_length": 65.7, "entropy": 0.10079648671671748, "epoch": 3.3190578158458246, "frac_reward_zero_std": 0.7, "grad_norm": 0.43359375, "learning_rate": 9.8451e-06, "loss": -0.0106, "num_tokens": 176782842.0, "reward": 1.0094531536102296, "reward_std": 0.2836147084832191, "rewards/reward_accuracy/mean": 0.910546875, "rewards/reward_accuracy/std": 0.28076811879873276, "rewards/reward_format/mean": 0.09890625104308129, "rewards/reward_format/std": 0.00827403082512319, "sampling/importance_sampling_ratio/max": 2.4991987705230714, "sampling/importance_sampling_ratio/mean": 0.9758339107036591, "sampling/importance_sampling_ratio/min": 0.06347680613398551, "sampling/sampling_logp_difference/max": 1.3269277930259704, "sampling/sampling_logp_difference/mean": 0.005482628429308534, "step": 1550, "step_time": 9.376380105037242 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.007421875, "completions/max_length": 1708.2, "completions/max_terminated_length": 1499.3, "completions/mean_length": 212.085546875, "completions/mean_terminated_length": 198.5985321044922, "completions/min_length": 65.4, "completions/min_terminated_length": 65.4, "entropy": 0.09452715474180877, "epoch": 3.3404710920770877, "frac_reward_zero_std": 0.6625, "grad_norm": 0.70703125, "learning_rate": 9.844100000000001e-06, "loss": -0.0122, "num_tokens": 177846261.0, "reward": 0.9764648616313935, "reward_std": 0.30377777814865115, "rewards/reward_accuracy/mean": 0.87734375, "rewards/reward_accuracy/std": 0.30150182396173475, "rewards/reward_format/mean": 0.09912109524011611, "rewards/reward_format/std": 0.0066042895894497635, "sampling/importance_sampling_ratio/max": 2.5027692794799803, "sampling/importance_sampling_ratio/mean": 0.9836281895637512, "sampling/importance_sampling_ratio/min": 0.1032183650881052, "sampling/sampling_logp_difference/max": 0.7078694939613343, "sampling/sampling_logp_difference/mean": 0.00528716454282403, "step": 1560, "step_time": 8.054320692783222 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.015625, "completions/max_length": 1802.8, "completions/max_terminated_length": 1488.7, "completions/mean_length": 214.573046875, "completions/mean_terminated_length": 185.71929626464845, "completions/min_length": 64.1, "completions/min_terminated_length": 64.1, "entropy": 0.09765789494849741, "epoch": 3.3618843683083512, "frac_reward_zero_std": 0.74375, "grad_norm": 1.6328125, "learning_rate": 9.8431e-06, "loss": -0.008, "num_tokens": 178914960.0, "reward": 0.9943945467472076, "reward_std": 0.28839647620916364, "rewards/reward_accuracy/mean": 0.895703125, "rewards/reward_accuracy/std": 0.28460960686206815, "rewards/reward_format/mean": 0.09869140833616256, "rewards/reward_format/std": 0.008625720767304302, "sampling/importance_sampling_ratio/max": 2.5256597280502318, "sampling/importance_sampling_ratio/mean": 0.9805302441120147, "sampling/importance_sampling_ratio/min": 0.056228873692452906, "sampling/sampling_logp_difference/max": 1.3031443059444427, "sampling/sampling_logp_difference/mean": 0.0052451096707955, "step": 1570, "step_time": 8.856824438786134 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.009375, "completions/max_length": 1794.9, "completions/max_terminated_length": 1689.5, "completions/mean_length": 215.741796875, "completions/mean_terminated_length": 198.81375885009766, "completions/min_length": 71.7, "completions/min_terminated_length": 71.7, "entropy": 0.10482313577085733, "epoch": 3.3832976445396143, "frac_reward_zero_std": 0.7125, "grad_norm": 0.6875, "learning_rate": 9.842100000000002e-06, "loss": -0.0098, "num_tokens": 179985243.0, "reward": 1.0030664324760437, "reward_std": 0.27728412449359896, "rewards/reward_accuracy/mean": 0.90390625, "rewards/reward_accuracy/std": 0.2752255484461784, "rewards/reward_format/mean": 0.09916015714406967, "rewards/reward_format/std": 0.005877672834321857, "sampling/importance_sampling_ratio/max": 2.546773409843445, "sampling/importance_sampling_ratio/mean": 0.9776469528675079, "sampling/importance_sampling_ratio/min": 0.05178725719451904, "sampling/sampling_logp_difference/max": 0.7995202422142029, "sampling/sampling_logp_difference/mean": 0.005538750346750021, "step": 1580, "step_time": 8.664407610148192 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.012890625, "completions/max_length": 1773.6, "completions/max_terminated_length": 1518.1, "completions/mean_length": 233.84296875, "completions/mean_terminated_length": 210.51532287597655, "completions/min_length": 65.5, "completions/min_terminated_length": 65.5, "entropy": 0.10804593018256128, "epoch": 3.404710920770878, "frac_reward_zero_std": 0.6625, "grad_norm": 0.69140625, "learning_rate": 9.841100000000001e-06, "loss": -0.0145, "num_tokens": 181105001.0, "reward": 0.9642187774181366, "reward_std": 0.336383818089962, "rewards/reward_accuracy/mean": 0.865234375, "rewards/reward_accuracy/std": 0.33429116755723953, "rewards/reward_format/mean": 0.0989843763411045, "rewards/reward_format/std": 0.006461745174601674, "sampling/importance_sampling_ratio/max": 2.6101008892059325, "sampling/importance_sampling_ratio/mean": 0.9739734888076782, "sampling/importance_sampling_ratio/min": 0.062481099367141725, "sampling/sampling_logp_difference/max": 1.2041119575500487, "sampling/sampling_logp_difference/mean": 0.005752623546868563, "step": 1590, "step_time": 8.411912427516654 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0203125, "completions/max_length": 1893.8, "completions/max_terminated_length": 1761.6, "completions/mean_length": 257.691015625, "completions/mean_terminated_length": 220.87854766845703, "completions/min_length": 67.2, "completions/min_terminated_length": 67.2, "entropy": 0.11991393552161753, "epoch": 3.4261241970021414, "frac_reward_zero_std": 0.66875, "grad_norm": 0.71875, "learning_rate": 9.840100000000001e-06, "loss": -0.0189, "num_tokens": 182280386.0, "reward": 0.9609570562839508, "reward_std": 0.33747961819171907, "rewards/reward_accuracy/mean": 0.862890625, "rewards/reward_accuracy/std": 0.33302130103111266, "rewards/reward_format/mean": 0.09806640893220901, "rewards/reward_format/std": 0.011156254401430487, "sampling/importance_sampling_ratio/max": 2.5625220775604247, "sampling/importance_sampling_ratio/mean": 0.9592302560806274, "sampling/importance_sampling_ratio/min": 0.04947969317436218, "sampling/sampling_logp_difference/max": 0.7355604290962219, "sampling/sampling_logp_difference/mean": 0.005925694527104497, "step": 1600, "step_time": 9.166617392422632 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 1.5751032833577483e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 1.5751032833577483e-06, "completions/clipped_ratio": 0.0171875, "completions/max_length": 1674.3, "completions/max_terminated_length": 1501.0, "completions/mean_length": 209.580078125, "completions/mean_terminated_length": 177.81344757080078, "completions/min_length": 62.3, "completions/min_terminated_length": 62.3, "entropy": 0.0979027939029038, "epoch": 3.4475374732334045, "frac_reward_zero_std": 0.76875, "grad_norm": 0.3515625, "learning_rate": 9.8391e-06, "loss": -0.0213, "num_tokens": 183329631.0, "reward": 1.0320508122444152, "reward_std": 0.22886947467923163, "rewards/reward_accuracy/mean": 0.93359375, "rewards/reward_accuracy/std": 0.22405001148581505, "rewards/reward_format/mean": 0.09845703318715096, "rewards/reward_format/std": 0.009517570538446308, "sampling/importance_sampling_ratio/max": 2.2076767683029175, "sampling/importance_sampling_ratio/mean": 0.9682565569877625, "sampling/importance_sampling_ratio/min": 0.10232938155531883, "sampling/sampling_logp_difference/max": 1.0734796166419982, "sampling/sampling_logp_difference/mean": 0.005225560092367232, "step": 1610, "step_time": 8.40665746848099 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.020703125, "completions/max_length": 1904.1, "completions/max_terminated_length": 1836.8, "completions/mean_length": 247.462109375, "completions/mean_terminated_length": 209.68619384765626, "completions/min_length": 71.5, "completions/min_terminated_length": 71.5, "entropy": 0.12288668649271131, "epoch": 3.468950749464668, "frac_reward_zero_std": 0.71875, "grad_norm": 0.7109375, "learning_rate": 9.8381e-06, "loss": -0.0264, "num_tokens": 184481502.0, "reward": 1.0083789348602294, "reward_std": 0.2701792851090431, "rewards/reward_accuracy/mean": 0.91015625, "rewards/reward_accuracy/std": 0.2654023960232735, "rewards/reward_format/mean": 0.09822265803813934, "rewards/reward_format/std": 0.01067848310340196, "sampling/importance_sampling_ratio/max": 2.47910498380661, "sampling/importance_sampling_ratio/mean": 0.9638559877872467, "sampling/importance_sampling_ratio/min": 0.07256823033094406, "sampling/sampling_logp_difference/max": 1.200941550731659, "sampling/sampling_logp_difference/mean": 0.006082874815911054, "step": 1620, "step_time": 9.52988305259496 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.023046875, "completions/max_length": 2048.0, "completions/max_terminated_length": 1788.1, "completions/mean_length": 262.738671875, "completions/mean_terminated_length": 220.87830810546876, "completions/min_length": 69.7, "completions/min_terminated_length": 69.7, "entropy": 0.11522620865143836, "epoch": 3.4903640256959316, "frac_reward_zero_std": 0.69375, "grad_norm": 0.62890625, "learning_rate": 9.837100000000001e-06, "loss": -0.0142, "num_tokens": 185674657.0, "reward": 0.9814258098602295, "reward_std": 0.3122294768691063, "rewards/reward_accuracy/mean": 0.88359375, "rewards/reward_accuracy/std": 0.3068507194519043, "rewards/reward_format/mean": 0.09783203303813934, "rewards/reward_format/std": 0.01296319612301886, "sampling/importance_sampling_ratio/max": 2.493324565887451, "sampling/importance_sampling_ratio/mean": 0.9618468225002289, "sampling/importance_sampling_ratio/min": 0.04118923675268889, "sampling/sampling_logp_difference/max": 1.0024495482444764, "sampling/sampling_logp_difference/mean": 0.005847154883667827, "step": 1630, "step_time": 10.290614356845618 }, { "clip_ratio/high_max": 1.772575851646252e-05, "clip_ratio/high_mean": 2.215719814557815e-06, "clip_ratio/low_mean": 2.1433470465126447e-07, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 2.4300546101585495e-06, "completions/clipped_ratio": 0.020703125, "completions/max_length": 1994.6, "completions/max_terminated_length": 1857.4, "completions/mean_length": 238.71796875, "completions/mean_terminated_length": 200.68575592041014, "completions/min_length": 62.7, "completions/min_terminated_length": 62.7, "entropy": 0.10860983827151358, "epoch": 3.5117773019271947, "frac_reward_zero_std": 0.71875, "grad_norm": 0.40234375, "learning_rate": 9.8361e-06, "loss": -0.0099, "num_tokens": 186819455.0, "reward": 0.9915234625339509, "reward_std": 0.3036754630506039, "rewards/reward_accuracy/mean": 0.893359375, "rewards/reward_accuracy/std": 0.2991088829934597, "rewards/reward_format/mean": 0.09816406220197678, "rewards/reward_format/std": 0.011167981196194887, "sampling/importance_sampling_ratio/max": 2.520857095718384, "sampling/importance_sampling_ratio/mean": 0.9821114957332611, "sampling/importance_sampling_ratio/min": 0.051760608702898024, "sampling/sampling_logp_difference/max": 1.2780590415000916, "sampling/sampling_logp_difference/mean": 0.005809213407337666, "step": 1640, "step_time": 9.982548136357218 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.020703125, "completions/max_length": 1949.6, "completions/max_terminated_length": 1662.7, "completions/mean_length": 211.445703125, "completions/mean_terminated_length": 172.9366424560547, "completions/min_length": 66.8, "completions/min_terminated_length": 66.8, "entropy": 0.10030085560865701, "epoch": 3.5331905781584583, "frac_reward_zero_std": 0.7375, "grad_norm": 0.283203125, "learning_rate": 9.8351e-06, "loss": -0.0105, "num_tokens": 187873844.0, "reward": 0.9687500357627868, "reward_std": 0.3284193605184555, "rewards/reward_accuracy/mean": 0.8703125, "rewards/reward_accuracy/std": 0.32416985034942625, "rewards/reward_format/mean": 0.09843750149011612, "rewards/reward_format/std": 0.009891503863036633, "sampling/importance_sampling_ratio/max": 2.253275918960571, "sampling/importance_sampling_ratio/mean": 0.9664777278900146, "sampling/importance_sampling_ratio/min": 0.07668975191190838, "sampling/sampling_logp_difference/max": 0.9255901575088501, "sampling/sampling_logp_difference/mean": 0.005400490202009678, "step": 1650, "step_time": 9.473287948127837 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.015625, "completions/max_length": 1877.7, "completions/max_terminated_length": 1757.8, "completions/mean_length": 226.249609375, "completions/mean_terminated_length": 197.42579040527343, "completions/min_length": 66.8, "completions/min_terminated_length": 66.8, "entropy": 0.10110052381642162, "epoch": 3.554603854389722, "frac_reward_zero_std": 0.7375, "grad_norm": 0.72265625, "learning_rate": 9.834100000000001e-06, "loss": -0.0212, "num_tokens": 188974899.0, "reward": 0.9907812893390655, "reward_std": 0.2877808451652527, "rewards/reward_accuracy/mean": 0.8921875, "rewards/reward_accuracy/std": 0.2838792473077774, "rewards/reward_format/mean": 0.09859375357627868, "rewards/reward_format/std": 0.008432799251750112, "sampling/importance_sampling_ratio/max": 2.47471569776535, "sampling/importance_sampling_ratio/mean": 0.9611785471439361, "sampling/importance_sampling_ratio/min": 0.06101883947849274, "sampling/sampling_logp_difference/max": 0.8893118739128113, "sampling/sampling_logp_difference/mean": 0.0053564908914268015, "step": 1660, "step_time": 9.426614956045523 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0140625, "completions/max_length": 2046.4, "completions/max_terminated_length": 1834.2, "completions/mean_length": 220.980859375, "completions/mean_terminated_length": 195.13493957519532, "completions/min_length": 65.4, "completions/min_terminated_length": 65.4, "entropy": 0.1080634981393814, "epoch": 3.576017130620985, "frac_reward_zero_std": 0.6625, "grad_norm": 0.8203125, "learning_rate": 9.8331e-06, "loss": -0.0116, "num_tokens": 190055938.0, "reward": 0.9839257776737214, "reward_std": 0.3154565304517746, "rewards/reward_accuracy/mean": 0.88515625, "rewards/reward_accuracy/std": 0.31254030764102936, "rewards/reward_format/mean": 0.09876953139901161, "rewards/reward_format/std": 0.008811962092295289, "sampling/importance_sampling_ratio/max": 2.696511244773865, "sampling/importance_sampling_ratio/mean": 0.9784788846969604, "sampling/importance_sampling_ratio/min": 0.008884686976671219, "sampling/sampling_logp_difference/max": 0.9039331793785095, "sampling/sampling_logp_difference/mean": 0.0058371934574097395, "step": 1670, "step_time": 9.733733983943239 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.014453125, "completions/max_length": 1852.2, "completions/max_terminated_length": 1732.8, "completions/mean_length": 231.48046875, "completions/mean_terminated_length": 205.1640411376953, "completions/min_length": 66.7, "completions/min_terminated_length": 66.7, "entropy": 0.10511073009110987, "epoch": 3.5974304068522485, "frac_reward_zero_std": 0.6875, "grad_norm": 0.455078125, "learning_rate": 9.8321e-06, "loss": -0.0182, "num_tokens": 191162576.0, "reward": 0.9875976860523223, "reward_std": 0.2910879023373127, "rewards/reward_accuracy/mean": 0.8890625, "rewards/reward_accuracy/std": 0.2874550513923168, "rewards/reward_format/mean": 0.09853515923023223, "rewards/reward_format/std": 0.00960803241468966, "sampling/importance_sampling_ratio/max": 2.5216283917427065, "sampling/importance_sampling_ratio/mean": 0.9725351929664612, "sampling/importance_sampling_ratio/min": 0.07817720714956522, "sampling/sampling_logp_difference/max": 0.8510629057884216, "sampling/sampling_logp_difference/mean": 0.005632062116637826, "step": 1680, "step_time": 9.001830588281155 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01328125, "completions/max_length": 1968.7, "completions/max_terminated_length": 1864.4, "completions/mean_length": 232.5203125, "completions/mean_terminated_length": 208.28863983154298, "completions/min_length": 74.6, "completions/min_terminated_length": 74.6, "entropy": 0.1004971879068762, "epoch": 3.6188436830835116, "frac_reward_zero_std": 0.73125, "grad_norm": 0.1865234375, "learning_rate": 9.831100000000001e-06, "loss": -0.0053, "num_tokens": 192276404.0, "reward": 0.995898449420929, "reward_std": 0.28882277458906175, "rewards/reward_accuracy/mean": 0.897265625, "rewards/reward_accuracy/std": 0.2851711705327034, "rewards/reward_format/mean": 0.09863281324505806, "rewards/reward_format/std": 0.009759594686329365, "sampling/importance_sampling_ratio/max": 2.478766071796417, "sampling/importance_sampling_ratio/mean": 0.9721204996109009, "sampling/importance_sampling_ratio/min": 0.046304930746555326, "sampling/sampling_logp_difference/max": 0.7829855442047119, "sampling/sampling_logp_difference/mean": 0.005477319285273552, "step": 1690, "step_time": 9.678444933658465 }, { "clip_ratio/high_max": 1.1622501187957823e-05, "clip_ratio/high_mean": 1.4528126484947278e-06, "clip_ratio/low_mean": 2.567497381278372e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 4.0203100297731e-06, "completions/clipped_ratio": 0.02265625, "completions/max_length": 2048.0, "completions/max_terminated_length": 1741.0, "completions/mean_length": 254.1328125, "completions/mean_terminated_length": 213.17286682128906, "completions/min_length": 78.5, "completions/min_terminated_length": 78.5, "entropy": 0.11597089217975735, "epoch": 3.640256959314775, "frac_reward_zero_std": 0.625, "grad_norm": 0.5859375, "learning_rate": 9.830100000000001e-06, "loss": -0.0336, "num_tokens": 193443384.0, "reward": 0.9827734589576721, "reward_std": 0.301401948928833, "rewards/reward_accuracy/mean": 0.884765625, "rewards/reward_accuracy/std": 0.29640525206923485, "rewards/reward_format/mean": 0.09800781533122063, "rewards/reward_format/std": 0.011734544625505805, "sampling/importance_sampling_ratio/max": 2.4630356550216677, "sampling/importance_sampling_ratio/mean": 0.9690758228302002, "sampling/importance_sampling_ratio/min": 0.01673992071300745, "sampling/sampling_logp_difference/max": 0.8763700604438782, "sampling/sampling_logp_difference/mean": 0.006175266671925783, "step": 1700, "step_time": 9.952579493401572 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0125, "completions/max_length": 1791.3, "completions/max_terminated_length": 1686.0, "completions/mean_length": 222.2078125, "completions/mean_terminated_length": 199.4939926147461, "completions/min_length": 75.8, "completions/min_terminated_length": 75.8, "entropy": 0.09845844791270793, "epoch": 3.6616702355460387, "frac_reward_zero_std": 0.7125, "grad_norm": 0.51171875, "learning_rate": 9.8291e-06, "loss": -0.0089, "num_tokens": 194529004.0, "reward": 1.0011328220367433, "reward_std": 0.28615949898958204, "rewards/reward_accuracy/mean": 0.901953125, "rewards/reward_accuracy/std": 0.2844673037528992, "rewards/reward_format/mean": 0.09917968809604645, "rewards/reward_format/std": 0.00550910416059196, "sampling/importance_sampling_ratio/max": 2.569299745559692, "sampling/importance_sampling_ratio/mean": 0.9772696554660797, "sampling/importance_sampling_ratio/min": 0.013084034807980061, "sampling/sampling_logp_difference/max": 0.8750756025314331, "sampling/sampling_logp_difference/mean": 0.005480764340609312, "step": 1710, "step_time": 8.808970416699594 }, { "clip_ratio/high_max": 5.549389607040212e-06, "clip_ratio/high_mean": 6.936737008800265e-07, "clip_ratio/low_mean": 4.437659754330525e-07, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 1.1374396763130789e-06, "completions/clipped_ratio": 0.020703125, "completions/max_length": 2006.0, "completions/max_terminated_length": 1871.8, "completions/mean_length": 264.737109375, "completions/mean_terminated_length": 227.76506652832032, "completions/min_length": 73.1, "completions/min_terminated_length": 73.1, "entropy": 0.1192632815334946, "epoch": 3.683083511777302, "frac_reward_zero_std": 0.68125, "grad_norm": 0.546875, "learning_rate": 9.8281e-06, "loss": -0.022, "num_tokens": 195718987.0, "reward": 0.9873437702655792, "reward_std": 0.29586231112480166, "rewards/reward_accuracy/mean": 0.8890625, "rewards/reward_accuracy/std": 0.2919920742511749, "rewards/reward_format/mean": 0.09828124940395355, "rewards/reward_format/std": 0.00995842816773802, "sampling/importance_sampling_ratio/max": 2.5475821614265444, "sampling/importance_sampling_ratio/mean": 0.9584749400615692, "sampling/importance_sampling_ratio/min": 0.028304804116487503, "sampling/sampling_logp_difference/max": 0.7644051730632782, "sampling/sampling_logp_difference/mean": 0.006133856019005179, "step": 1720, "step_time": 9.838129657799437 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0140625, "completions/max_length": 1963.6, "completions/max_terminated_length": 1710.7, "completions/mean_length": 249.2, "completions/mean_terminated_length": 223.82755584716796, "completions/min_length": 72.9, "completions/min_terminated_length": 72.9, "entropy": 0.11386121767573058, "epoch": 3.7044967880085653, "frac_reward_zero_std": 0.66875, "grad_norm": 1.03125, "learning_rate": 9.827100000000001e-06, "loss": -0.0235, "num_tokens": 196869691.0, "reward": 0.9810937583446503, "reward_std": 0.30289358645677567, "rewards/reward_accuracy/mean": 0.882421875, "rewards/reward_accuracy/std": 0.29957753568887713, "rewards/reward_format/mean": 0.09867187514901161, "rewards/reward_format/std": 0.009341790899634361, "sampling/importance_sampling_ratio/max": 2.559754419326782, "sampling/importance_sampling_ratio/mean": 0.9674811124801636, "sampling/importance_sampling_ratio/min": 0.022860520984977484, "sampling/sampling_logp_difference/max": 0.7482152163982392, "sampling/sampling_logp_difference/mean": 0.006012728437781334, "step": 1730, "step_time": 9.455139746090572 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.025, "completions/max_length": 1867.9, "completions/max_terminated_length": 1666.1, "completions/mean_length": 265.394921875, "completions/mean_terminated_length": 220.2523193359375, "completions/min_length": 70.9, "completions/min_terminated_length": 70.9, "entropy": 0.11293153925798834, "epoch": 3.725910064239829, "frac_reward_zero_std": 0.73125, "grad_norm": 0.859375, "learning_rate": 9.8261e-06, "loss": -0.0143, "num_tokens": 198068446.0, "reward": 0.9995508193969727, "reward_std": 0.27206835299730303, "rewards/reward_accuracy/mean": 0.9015625, "rewards/reward_accuracy/std": 0.266640505194664, "rewards/reward_format/mean": 0.09798828288912773, "rewards/reward_format/std": 0.011093414761126042, "sampling/importance_sampling_ratio/max": 2.4889082312583923, "sampling/importance_sampling_ratio/mean": 0.9592509806156159, "sampling/importance_sampling_ratio/min": 0.036384567618370056, "sampling/sampling_logp_difference/max": 1.0202884018421172, "sampling/sampling_logp_difference/mean": 0.005841715983115137, "step": 1740, "step_time": 9.38538291318837 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.030078125, "completions/max_length": 1967.5, "completions/max_terminated_length": 1864.5, "completions/mean_length": 301.887890625, "completions/mean_terminated_length": 249.04328002929688, "completions/min_length": 74.5, "completions/min_terminated_length": 74.5, "entropy": 0.12448770119808614, "epoch": 3.747323340471092, "frac_reward_zero_std": 0.6875, "grad_norm": 0.7734375, "learning_rate": 9.8251e-06, "loss": -0.008, "num_tokens": 199354575.0, "reward": 0.9471289217472076, "reward_std": 0.3447194129228592, "rewards/reward_accuracy/mean": 0.85, "rewards/reward_accuracy/std": 0.33896690756082537, "rewards/reward_format/mean": 0.09712890833616257, "rewards/reward_format/std": 0.012860493338666856, "sampling/importance_sampling_ratio/max": 2.5905746459960937, "sampling/importance_sampling_ratio/mean": 0.9642947614192963, "sampling/importance_sampling_ratio/min": 0.03375800382345915, "sampling/sampling_logp_difference/max": 0.7228492796421051, "sampling/sampling_logp_difference/mean": 0.006165919033810497, "step": 1750, "step_time": 9.808216288602853 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01328125, "completions/max_length": 1862.1, "completions/max_terminated_length": 1709.5, "completions/mean_length": 252.04765625, "completions/mean_terminated_length": 228.34712677001954, "completions/min_length": 73.5, "completions/min_terminated_length": 73.5, "entropy": 0.11447537722997367, "epoch": 3.7687366167023555, "frac_reward_zero_std": 0.66875, "grad_norm": 0.5546875, "learning_rate": 9.824100000000001e-06, "loss": -0.0199, "num_tokens": 200516633.0, "reward": 0.9760937809944152, "reward_std": 0.3248265966773033, "rewards/reward_accuracy/mean": 0.87734375, "rewards/reward_accuracy/std": 0.32196573317050936, "rewards/reward_format/mean": 0.09875000193715096, "rewards/reward_format/std": 0.008399902563542127, "sampling/importance_sampling_ratio/max": 2.4378129720687864, "sampling/importance_sampling_ratio/mean": 0.9605781078338623, "sampling/importance_sampling_ratio/min": 0.008784640580415726, "sampling/sampling_logp_difference/max": 0.8614825785160065, "sampling/sampling_logp_difference/mean": 0.005908358190208673, "step": 1760, "step_time": 9.034472907304007 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.015234375, "completions/max_length": 1906.2, "completions/max_terminated_length": 1692.9, "completions/mean_length": 245.54296875, "completions/mean_terminated_length": 218.06744689941405, "completions/min_length": 75.1, "completions/min_terminated_length": 75.1, "entropy": 0.11025548554025591, "epoch": 3.790149892933619, "frac_reward_zero_std": 0.6375, "grad_norm": 0.58203125, "learning_rate": 9.823100000000001e-06, "loss": -0.0173, "num_tokens": 201667991.0, "reward": 0.9788476824760437, "reward_std": 0.3138418808579445, "rewards/reward_accuracy/mean": 0.880078125, "rewards/reward_accuracy/std": 0.310952752828598, "rewards/reward_format/mean": 0.09876953288912774, "rewards/reward_format/std": 0.007607561489567161, "sampling/importance_sampling_ratio/max": 2.65124888420105, "sampling/importance_sampling_ratio/mean": 0.9717750489711762, "sampling/importance_sampling_ratio/min": 0.03252590596675873, "sampling/sampling_logp_difference/max": 0.9282626986503602, "sampling/sampling_logp_difference/mean": 0.00601572822779417, "step": 1770, "step_time": 9.32412418590393 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01171875, "completions/max_length": 1639.6, "completions/max_terminated_length": 1541.3, "completions/mean_length": 238.39453125, "completions/mean_terminated_length": 217.2953842163086, "completions/min_length": 82.3, "completions/min_terminated_length": 82.3, "entropy": 0.11045554294250906, "epoch": 3.811563169164882, "frac_reward_zero_std": 0.725, "grad_norm": 0.546875, "learning_rate": 9.8221e-06, "loss": -0.0066, "num_tokens": 202800457.0, "reward": 0.9771093904972077, "reward_std": 0.3061934158205986, "rewards/reward_accuracy/mean": 0.878125, "rewards/reward_accuracy/std": 0.30397213697433473, "rewards/reward_format/mean": 0.0989843763411045, "rewards/reward_format/std": 0.006647321698255837, "sampling/importance_sampling_ratio/max": 2.322800540924072, "sampling/importance_sampling_ratio/mean": 0.9712456941604615, "sampling/importance_sampling_ratio/min": 0.03877677023410797, "sampling/sampling_logp_difference/max": 0.8283046305179596, "sampling/sampling_logp_difference/mean": 0.005930081801488995, "step": 1780, "step_time": 7.867096417295397 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.012890625, "completions/max_length": 1866.0, "completions/max_terminated_length": 1733.8, "completions/mean_length": 244.66640625, "completions/mean_terminated_length": 221.41945037841796, "completions/min_length": 74.4, "completions/min_terminated_length": 74.4, "entropy": 0.10171096110716463, "epoch": 3.8329764453961457, "frac_reward_zero_std": 0.74375, "grad_norm": 0.6953125, "learning_rate": 9.821100000000002e-06, "loss": -0.0164, "num_tokens": 203947891.0, "reward": 0.9703515708446503, "reward_std": 0.32166723236441613, "rewards/reward_accuracy/mean": 0.871484375, "rewards/reward_accuracy/std": 0.3188847117125988, "rewards/reward_format/mean": 0.09886718615889549, "rewards/reward_format/std": 0.007744115893729031, "sampling/importance_sampling_ratio/max": 2.4952943682670594, "sampling/importance_sampling_ratio/mean": 0.9810825884342194, "sampling/importance_sampling_ratio/min": 0.00613432489335537, "sampling/sampling_logp_difference/max": 0.860816490650177, "sampling/sampling_logp_difference/mean": 0.00535674411803484, "step": 1790, "step_time": 9.080039828596636 }, { "clip_ratio/high_max": 8.538251131540165e-06, "clip_ratio/high_mean": 1.0672813914425206e-06, "clip_ratio/low_mean": 1.6258911273325793e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 2.6931725187751e-06, "completions/clipped_ratio": 0.01328125, "completions/max_length": 1968.8, "completions/max_terminated_length": 1717.1, "completions/mean_length": 247.351171875, "completions/mean_terminated_length": 223.46299438476564, "completions/min_length": 73.0, "completions/min_terminated_length": 73.0, "entropy": 0.11017707744613289, "epoch": 3.854389721627409, "frac_reward_zero_std": 0.7125, "grad_norm": 0.6015625, "learning_rate": 9.820100000000001e-06, "loss": -0.0105, "num_tokens": 205104006.0, "reward": 0.979589867591858, "reward_std": 0.29133337214589117, "rewards/reward_accuracy/mean": 0.880859375, "rewards/reward_accuracy/std": 0.2886448673903942, "rewards/reward_format/mean": 0.09873047098517418, "rewards/reward_format/std": 0.008285083319060504, "sampling/importance_sampling_ratio/max": 2.5239701509475707, "sampling/importance_sampling_ratio/mean": 0.9769951224327087, "sampling/importance_sampling_ratio/min": 0.03258771002292633, "sampling/sampling_logp_difference/max": 1.09389631152153, "sampling/sampling_logp_difference/mean": 0.005795456771738827, "step": 1800, "step_time": 9.605937331699533 }, { "clip_ratio/high_max": 1.5936254931148143e-05, "clip_ratio/high_mean": 1.992031866393518e-06, "clip_ratio/low_mean": 8.232349500758574e-07, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 2.815266816469375e-06, "completions/clipped_ratio": 0.01875, "completions/max_length": 2048.0, "completions/max_terminated_length": 1775.6, "completions/mean_length": 271.60625, "completions/mean_terminated_length": 237.91127166748046, "completions/min_length": 76.8, "completions/min_terminated_length": 76.8, "entropy": 0.11645387229509652, "epoch": 3.8758029978586723, "frac_reward_zero_std": 0.675, "grad_norm": 0.41015625, "learning_rate": 9.8191e-06, "loss": -0.0073, "num_tokens": 206311414.0, "reward": 0.9786132991313934, "reward_std": 0.31219071000814436, "rewards/reward_accuracy/mean": 0.88046875, "rewards/reward_accuracy/std": 0.30729184225201606, "rewards/reward_format/mean": 0.09814453199505806, "rewards/reward_format/std": 0.011364398919977248, "sampling/importance_sampling_ratio/max": 2.5752052545547484, "sampling/importance_sampling_ratio/mean": 0.9654738962650299, "sampling/importance_sampling_ratio/min": 0.009438053891062736, "sampling/sampling_logp_difference/max": 1.0431099653244018, "sampling/sampling_logp_difference/mean": 0.005761270644143224, "step": 1810, "step_time": 10.163690623601724 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.014453125, "completions/max_length": 1890.2, "completions/max_terminated_length": 1649.3, "completions/mean_length": 251.666796875, "completions/mean_terminated_length": 225.85834350585938, "completions/min_length": 81.1, "completions/min_terminated_length": 81.1, "entropy": 0.11131578809581696, "epoch": 3.897216274089936, "frac_reward_zero_std": 0.7125, "grad_norm": 0.60546875, "learning_rate": 9.8181e-06, "loss": -0.0163, "num_tokens": 207470353.0, "reward": 0.9910742580890656, "reward_std": 0.28269105702638625, "rewards/reward_accuracy/mean": 0.892578125, "rewards/reward_accuracy/std": 0.2787009343504906, "rewards/reward_format/mean": 0.09849609583616256, "rewards/reward_format/std": 0.009461269760504366, "sampling/importance_sampling_ratio/max": 2.4869394183158873, "sampling/importance_sampling_ratio/mean": 0.9642408311367034, "sampling/importance_sampling_ratio/min": 0.02942931729485281, "sampling/sampling_logp_difference/max": 1.1633307695388795, "sampling/sampling_logp_difference/mean": 0.005645580496639014, "step": 1820, "step_time": 9.523036262800451 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.008984375, "completions/max_length": 1975.8, "completions/max_terminated_length": 1720.4, "completions/mean_length": 230.91640625, "completions/mean_terminated_length": 214.46705780029296, "completions/min_length": 73.5, "completions/min_terminated_length": 73.5, "entropy": 0.10626117531210184, "epoch": 3.9186295503211994, "frac_reward_zero_std": 0.71875, "grad_norm": 0.50390625, "learning_rate": 9.817100000000001e-06, "loss": -0.0249, "num_tokens": 208577307.0, "reward": 0.9772851824760437, "reward_std": 0.3229082882404327, "rewards/reward_accuracy/mean": 0.878125, "rewards/reward_accuracy/std": 0.3208357244729996, "rewards/reward_format/mean": 0.09916015863418579, "rewards/reward_format/std": 0.006904154294170439, "sampling/importance_sampling_ratio/max": 2.5039249420166017, "sampling/importance_sampling_ratio/mean": 0.9700947165489197, "sampling/importance_sampling_ratio/min": 0.05878835800103843, "sampling/sampling_logp_difference/max": 0.7347710490226745, "sampling/sampling_logp_difference/mean": 0.005494658090174198, "step": 1830, "step_time": 9.511407239902473 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 5.773138582298998e-07, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 5.773138582298998e-07, "completions/clipped_ratio": 0.01953125, "completions/max_length": 1815.9, "completions/max_terminated_length": 1565.1, "completions/mean_length": 235.851953125, "completions/mean_terminated_length": 200.36127014160155, "completions/min_length": 73.4, "completions/min_terminated_length": 73.4, "entropy": 0.09902307828888297, "epoch": 3.9400428265524625, "frac_reward_zero_std": 0.7375, "grad_norm": 0.44921875, "learning_rate": 9.8161e-06, "loss": -0.018, "num_tokens": 209695744.0, "reward": 0.9996289432048797, "reward_std": 0.2805600747466087, "rewards/reward_accuracy/mean": 0.901171875, "rewards/reward_accuracy/std": 0.27641231939196587, "rewards/reward_format/mean": 0.09845703318715096, "rewards/reward_format/std": 0.009629160887561739, "sampling/importance_sampling_ratio/max": 2.5333241701126097, "sampling/importance_sampling_ratio/mean": 0.9753164827823639, "sampling/importance_sampling_ratio/min": 0.026690761744976043, "sampling/sampling_logp_difference/max": 0.7702405095100403, "sampling/sampling_logp_difference/mean": 0.0054461341351270676, "step": 1840, "step_time": 8.965677818401309 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.025390625, "completions/max_length": 1935.9, "completions/max_terminated_length": 1762.7, "completions/mean_length": 293.9609375, "completions/mean_terminated_length": 248.87220001220703, "completions/min_length": 72.3, "completions/min_terminated_length": 72.3, "entropy": 0.12396332090720534, "epoch": 3.961456102783726, "frac_reward_zero_std": 0.625, "grad_norm": 0.302734375, "learning_rate": 9.8151e-06, "loss": -0.0167, "num_tokens": 210969356.0, "reward": 0.9753125309944153, "reward_std": 0.3194266900420189, "rewards/reward_accuracy/mean": 0.877734375, "rewards/reward_accuracy/std": 0.31349882781505584, "rewards/reward_format/mean": 0.09757812768220901, "rewards/reward_format/std": 0.011822100728750229, "sampling/importance_sampling_ratio/max": 2.5180176734924316, "sampling/importance_sampling_ratio/mean": 0.955813217163086, "sampling/importance_sampling_ratio/min": 0.008985464088618755, "sampling/sampling_logp_difference/max": 1.2890136003494264, "sampling/sampling_logp_difference/mean": 0.006074676895514131, "step": 1850, "step_time": 10.045911873890145 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0140625, "completions/max_length": 2048.0, "completions/max_terminated_length": 1723.6, "completions/mean_length": 252.4609375, "completions/mean_terminated_length": 226.94437408447266, "completions/min_length": 77.5, "completions/min_terminated_length": 77.5, "entropy": 0.11219770573079586, "epoch": 3.982869379014989, "frac_reward_zero_std": 0.65625, "grad_norm": 0.33203125, "learning_rate": 9.814100000000001e-06, "loss": -0.0174, "num_tokens": 212133784.0, "reward": 0.9757031381130219, "reward_std": 0.32375199198722837, "rewards/reward_accuracy/mean": 0.876953125, "rewards/reward_accuracy/std": 0.3206891596317291, "rewards/reward_format/mean": 0.09875000044703483, "rewards/reward_format/std": 0.008781819907017051, "sampling/importance_sampling_ratio/max": 2.5389029741287232, "sampling/importance_sampling_ratio/mean": 0.9652904570102692, "sampling/importance_sampling_ratio/min": 0.014686112711206078, "sampling/sampling_logp_difference/max": 0.7811557173728942, "sampling/sampling_logp_difference/mean": 0.005962699931114912, "step": 1860, "step_time": 10.19707946030394 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0078125, "completions/max_length": 1747.7, "completions/max_terminated_length": 1661.1, "completions/mean_length": 219.98671875, "completions/mean_terminated_length": 205.8608184814453, "completions/min_length": 73.4, "completions/min_terminated_length": 73.4, "entropy": 0.09815784357488155, "epoch": 4.004282655246253, "frac_reward_zero_std": 0.79375, "grad_norm": 0.33984375, "learning_rate": 9.813100000000001e-06, "loss": -0.0078, "num_tokens": 213209942.0, "reward": 1.0116796910762786, "reward_std": 0.26402966156601904, "rewards/reward_accuracy/mean": 0.9125, "rewards/reward_accuracy/std": 0.26204313039779664, "rewards/reward_format/mean": 0.09917968809604645, "rewards/reward_format/std": 0.006832579686306417, "sampling/importance_sampling_ratio/max": 2.496462082862854, "sampling/importance_sampling_ratio/mean": 0.9874454438686371, "sampling/importance_sampling_ratio/min": 0.10873651299625635, "sampling/sampling_logp_difference/max": 0.6832794487476349, "sampling/sampling_logp_difference/mean": 0.00513655215036124, "step": 1870, "step_time": 8.520473426789977 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.009375, "completions/max_length": 1719.4, "completions/max_terminated_length": 1557.9, "completions/mean_length": 232.39296875, "completions/mean_terminated_length": 215.67175903320313, "completions/min_length": 78.9, "completions/min_terminated_length": 78.9, "entropy": 0.10906876525841654, "epoch": 4.025695931477516, "frac_reward_zero_std": 0.74375, "grad_norm": 0.59375, "learning_rate": 9.8121e-06, "loss": -0.0152, "num_tokens": 214323716.0, "reward": 1.0147265672683716, "reward_std": 0.25953788459300997, "rewards/reward_accuracy/mean": 0.915625, "rewards/reward_accuracy/std": 0.25727768540382384, "rewards/reward_format/mean": 0.09910156428813935, "rewards/reward_format/std": 0.006137685454450548, "sampling/importance_sampling_ratio/max": 2.489317762851715, "sampling/importance_sampling_ratio/mean": 0.9758122146129609, "sampling/importance_sampling_ratio/min": 0.040069063752889635, "sampling/sampling_logp_difference/max": 0.9777339220046997, "sampling/sampling_logp_difference/mean": 0.005648333160206675, "step": 1880, "step_time": 8.415918162200251 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01171875, "completions/max_length": 1887.1, "completions/max_terminated_length": 1672.1, "completions/mean_length": 222.43515625, "completions/mean_terminated_length": 201.05305023193358, "completions/min_length": 67.3, "completions/min_terminated_length": 67.3, "entropy": 0.10548757310025395, "epoch": 4.04710920770878, "frac_reward_zero_std": 0.73125, "grad_norm": 0.91796875, "learning_rate": 9.811100000000002e-06, "loss": -0.0046, "num_tokens": 215411662.0, "reward": 0.9950000286102295, "reward_std": 0.30058709979057313, "rewards/reward_accuracy/mean": 0.89609375, "rewards/reward_accuracy/std": 0.2976105585694313, "rewards/reward_format/mean": 0.09890625104308129, "rewards/reward_format/std": 0.008095170860178769, "sampling/importance_sampling_ratio/max": 2.5164835691452025, "sampling/importance_sampling_ratio/mean": 0.9656373500823975, "sampling/importance_sampling_ratio/min": 0.043292487412691115, "sampling/sampling_logp_difference/max": 0.8752450823783875, "sampling/sampling_logp_difference/mean": 0.005420983489602804, "step": 1890, "step_time": 9.123994514197694 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 2.3032134777167812e-07, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 2.3032134777167812e-07, "completions/clipped_ratio": 0.02109375, "completions/max_length": 1898.7, "completions/max_terminated_length": 1729.5, "completions/mean_length": 237.16953125, "completions/mean_terminated_length": 198.5504608154297, "completions/min_length": 70.0, "completions/min_terminated_length": 70.0, "entropy": 0.10724446275271475, "epoch": 4.0685224839400425, "frac_reward_zero_std": 0.725, "grad_norm": 0.64453125, "learning_rate": 9.810100000000001e-06, "loss": -0.0083, "num_tokens": 216536064.0, "reward": 0.9913086116313934, "reward_std": 0.2889810040593147, "rewards/reward_accuracy/mean": 0.893359375, "rewards/reward_accuracy/std": 0.28374333679676056, "rewards/reward_format/mean": 0.09794922098517418, "rewards/reward_format/std": 0.011340980930253864, "sampling/importance_sampling_ratio/max": 2.389233577251434, "sampling/importance_sampling_ratio/mean": 0.96959188580513, "sampling/importance_sampling_ratio/min": 0.02555187903344631, "sampling/sampling_logp_difference/max": 0.9271704316139221, "sampling/sampling_logp_difference/mean": 0.0057214830536395315, "step": 1900, "step_time": 9.417412229807814 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005078125, "completions/max_length": 1782.8, "completions/max_terminated_length": 1576.2, "completions/mean_length": 197.21875, "completions/mean_terminated_length": 187.84966278076172, "completions/min_length": 71.1, "completions/min_terminated_length": 71.1, "entropy": 0.08476681234315038, "epoch": 4.089935760171306, "frac_reward_zero_std": 0.76875, "grad_norm": 0.205078125, "learning_rate": 9.8091e-06, "loss": -0.0159, "num_tokens": 217566080.0, "reward": 1.0196875154972076, "reward_std": 0.2644562005996704, "rewards/reward_accuracy/mean": 0.9203125, "rewards/reward_accuracy/std": 0.2622656233608723, "rewards/reward_format/mean": 0.09937499985098838, "rewards/reward_format/std": 0.005482074641622603, "sampling/importance_sampling_ratio/max": 2.3811018466949463, "sampling/importance_sampling_ratio/mean": 0.9870140850543976, "sampling/importance_sampling_ratio/min": 0.045569803565740585, "sampling/sampling_logp_difference/max": 0.8002467274665832, "sampling/sampling_logp_difference/mean": 0.005051636975258589, "step": 1910, "step_time": 8.620807183200668 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01953125, "completions/max_length": 1922.7, "completions/max_terminated_length": 1728.1, "completions/mean_length": 244.520703125, "completions/mean_terminated_length": 209.23623046875, "completions/min_length": 71.7, "completions/min_terminated_length": 71.7, "entropy": 0.11389463995583356, "epoch": 4.1113490364025695, "frac_reward_zero_std": 0.7, "grad_norm": 0.451171875, "learning_rate": 9.8081e-06, "loss": -0.0109, "num_tokens": 218710197.0, "reward": 0.9798828303813935, "reward_std": 0.30734221637248993, "rewards/reward_accuracy/mean": 0.881640625, "rewards/reward_accuracy/std": 0.302875517308712, "rewards/reward_format/mean": 0.09824218824505807, "rewards/reward_format/std": 0.009994025947526098, "sampling/importance_sampling_ratio/max": 2.3742379903793336, "sampling/importance_sampling_ratio/mean": 0.9657935559749603, "sampling/importance_sampling_ratio/min": 0.01778179034590721, "sampling/sampling_logp_difference/max": 0.9001268565654754, "sampling/sampling_logp_difference/mean": 0.005742790456861257, "step": 1920, "step_time": 9.559222627400596 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01640625, "completions/max_length": 1822.4, "completions/max_terminated_length": 1631.3, "completions/mean_length": 226.91484375, "completions/mean_terminated_length": 196.63839874267578, "completions/min_length": 69.7, "completions/min_terminated_length": 69.7, "entropy": 0.10549103859812022, "epoch": 4.132762312633833, "frac_reward_zero_std": 0.7375, "grad_norm": 1.0078125, "learning_rate": 9.8071e-06, "loss": -0.009, "num_tokens": 219811723.0, "reward": 0.977929699420929, "reward_std": 0.3237276762723923, "rewards/reward_accuracy/mean": 0.87890625, "rewards/reward_accuracy/std": 0.3208704799413681, "rewards/reward_format/mean": 0.0990234375, "rewards/reward_format/std": 0.00765816664788872, "sampling/importance_sampling_ratio/max": 2.618200182914734, "sampling/importance_sampling_ratio/mean": 0.9718908846378327, "sampling/importance_sampling_ratio/min": 0.06410768628120422, "sampling/sampling_logp_difference/max": 0.7361603021621704, "sampling/sampling_logp_difference/mean": 0.005618560872972011, "step": 1930, "step_time": 8.861281216896895 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01328125, "completions/max_length": 1768.8, "completions/max_terminated_length": 1520.5, "completions/mean_length": 205.689453125, "completions/mean_terminated_length": 181.49798736572265, "completions/min_length": 67.0, "completions/min_terminated_length": 67.0, "entropy": 0.09384390139020979, "epoch": 4.154175588865097, "frac_reward_zero_std": 0.7625, "grad_norm": 0.91015625, "learning_rate": 9.806100000000001e-06, "loss": -0.0055, "num_tokens": 220855056.0, "reward": 0.9977734625339508, "reward_std": 0.29088087379932404, "rewards/reward_accuracy/mean": 0.898828125, "rewards/reward_accuracy/std": 0.2881721451878548, "rewards/reward_format/mean": 0.09894531369209289, "rewards/reward_format/std": 0.007076422707177699, "sampling/importance_sampling_ratio/max": 2.5909575700759886, "sampling/importance_sampling_ratio/mean": 0.9767070412635803, "sampling/importance_sampling_ratio/min": 0.03262447947636247, "sampling/sampling_logp_difference/max": 0.8086506962776184, "sampling/sampling_logp_difference/mean": 0.005275146383792162, "step": 1940, "step_time": 8.556375121601741 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0171875, "completions/max_length": 1944.4, "completions/max_terminated_length": 1872.6, "completions/mean_length": 225.863671875, "completions/mean_terminated_length": 194.26087188720703, "completions/min_length": 62.6, "completions/min_terminated_length": 62.6, "entropy": 0.10960233323276043, "epoch": 4.17558886509636, "frac_reward_zero_std": 0.70625, "grad_norm": 0.40625, "learning_rate": 9.8051e-06, "loss": -0.0162, "num_tokens": 221948595.0, "reward": 0.986308616399765, "reward_std": 0.3119990587234497, "rewards/reward_accuracy/mean": 0.8875, "rewards/reward_accuracy/std": 0.30899005830287934, "rewards/reward_format/mean": 0.09880859553813934, "rewards/reward_format/std": 0.0077432987047359346, "sampling/importance_sampling_ratio/max": 2.4949870824813845, "sampling/importance_sampling_ratio/mean": 0.9676478505134583, "sampling/importance_sampling_ratio/min": 0.03665950985159725, "sampling/sampling_logp_difference/max": 0.9254366636276246, "sampling/sampling_logp_difference/mean": 0.0056891322135925295, "step": 1950, "step_time": 9.668975406796381 }, { "clip_ratio/high_max": 2.8964230477868113e-05, "clip_ratio/high_mean": 3.620528809733514e-06, "clip_ratio/low_mean": 1.3219513448348152e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 4.942480131830962e-06, "completions/clipped_ratio": 0.012109375, "completions/max_length": 1556.6, "completions/max_terminated_length": 1303.7, "completions/mean_length": 178.872265625, "completions/mean_terminated_length": 156.11085510253906, "completions/min_length": 60.6, "completions/min_terminated_length": 60.6, "entropy": 0.08013722794130444, "epoch": 4.197002141327623, "frac_reward_zero_std": 0.775, "grad_norm": 0.53125, "learning_rate": 9.804100000000002e-06, "loss": -0.0103, "num_tokens": 222916204.0, "reward": 1.028085958957672, "reward_std": 0.24472709968686104, "rewards/reward_accuracy/mean": 0.92890625, "rewards/reward_accuracy/std": 0.24200901314616202, "rewards/reward_format/mean": 0.09917968958616256, "rewards/reward_format/std": 0.0055103011196479205, "sampling/importance_sampling_ratio/max": 2.2688790798187255, "sampling/importance_sampling_ratio/mean": 0.9798744440078735, "sampling/importance_sampling_ratio/min": 0.1344377689063549, "sampling/sampling_logp_difference/max": 0.8225985288619995, "sampling/sampling_logp_difference/mean": 0.004894759715534746, "step": 1960, "step_time": 7.603751037498296 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0109375, "completions/max_length": 1997.0, "completions/max_terminated_length": 1857.9, "completions/mean_length": 210.555859375, "completions/mean_terminated_length": 190.4349136352539, "completions/min_length": 66.8, "completions/min_terminated_length": 66.8, "entropy": 0.09448540029115975, "epoch": 4.218415417558886, "frac_reward_zero_std": 0.75, "grad_norm": 0.439453125, "learning_rate": 9.803100000000001e-06, "loss": -0.0142, "num_tokens": 223977595.0, "reward": 0.9851172029972076, "reward_std": 0.3124650329351425, "rewards/reward_accuracy/mean": 0.8859375, "rewards/reward_accuracy/std": 0.3100178509950638, "rewards/reward_format/mean": 0.09917968884110451, "rewards/reward_format/std": 0.006565603078342974, "sampling/importance_sampling_ratio/max": 2.5055965900421144, "sampling/importance_sampling_ratio/mean": 0.972119402885437, "sampling/importance_sampling_ratio/min": 0.0070977487281197685, "sampling/sampling_logp_difference/max": 1.1890580654144287, "sampling/sampling_logp_difference/mean": 0.005356045067310333, "step": 1970, "step_time": 9.638867503202345 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01171875, "completions/max_length": 1930.3, "completions/max_terminated_length": 1678.7, "completions/mean_length": 206.833203125, "completions/mean_terminated_length": 185.1562530517578, "completions/min_length": 61.3, "completions/min_terminated_length": 61.3, "entropy": 0.09267262499779463, "epoch": 4.23982869379015, "frac_reward_zero_std": 0.75625, "grad_norm": 0.38671875, "learning_rate": 9.8021e-06, "loss": -0.0043, "num_tokens": 225019840.0, "reward": 0.9973633110523223, "reward_std": 0.29604803323745726, "rewards/reward_accuracy/mean": 0.8984375, "rewards/reward_accuracy/std": 0.293308761715889, "rewards/reward_format/mean": 0.09892578348517418, "rewards/reward_format/std": 0.007151664351113141, "sampling/importance_sampling_ratio/max": 2.249405574798584, "sampling/importance_sampling_ratio/mean": 0.9714468598365784, "sampling/importance_sampling_ratio/min": 0.05552814975380897, "sampling/sampling_logp_difference/max": 0.7853524565696717, "sampling/sampling_logp_difference/mean": 0.005239231511950493, "step": 1980, "step_time": 9.492953270900761 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00546875, "completions/max_length": 1855.8, "completions/max_terminated_length": 1657.0, "completions/mean_length": 185.832421875, "completions/mean_terminated_length": 175.5293228149414, "completions/min_length": 60.7, "completions/min_terminated_length": 60.7, "entropy": 0.08750719763338566, "epoch": 4.2612419700214135, "frac_reward_zero_std": 0.7, "grad_norm": 0.97265625, "learning_rate": 9.801100000000002e-06, "loss": -0.0066, "num_tokens": 226011395.0, "reward": 1.010800802707672, "reward_std": 0.2689823418855667, "rewards/reward_accuracy/mean": 0.911328125, "rewards/reward_accuracy/std": 0.2676533430814743, "rewards/reward_format/mean": 0.0994726575911045, "rewards/reward_format/std": 0.004226360376924277, "sampling/importance_sampling_ratio/max": 2.5161445140838623, "sampling/importance_sampling_ratio/mean": 0.9723219513893128, "sampling/importance_sampling_ratio/min": 0.07100898921489715, "sampling/sampling_logp_difference/max": 0.8597656786441803, "sampling/sampling_logp_difference/mean": 0.005206472682766616, "step": 1990, "step_time": 8.722707128996262 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00703125, "completions/max_length": 1850.5, "completions/max_terminated_length": 1613.9, "completions/mean_length": 175.6859375, "completions/mean_terminated_length": 162.59783859252929, "completions/min_length": 60.6, "completions/min_terminated_length": 60.6, "entropy": 0.08052646685391665, "epoch": 4.282655246252677, "frac_reward_zero_std": 0.83125, "grad_norm": 0.65625, "learning_rate": 9.800100000000001e-06, "loss": -0.0102, "num_tokens": 226964655.0, "reward": 1.0203906536102294, "reward_std": 0.2591245949268341, "rewards/reward_accuracy/mean": 0.92109375, "rewards/reward_accuracy/std": 0.2567377336323261, "rewards/reward_format/mean": 0.09929687678813934, "rewards/reward_format/std": 0.005810616537928581, "sampling/importance_sampling_ratio/max": 2.5547988653182983, "sampling/importance_sampling_ratio/mean": 0.9852603375911713, "sampling/importance_sampling_ratio/min": 0.03428105730563402, "sampling/sampling_logp_difference/max": 1.3333760261535645, "sampling/sampling_logp_difference/mean": 0.005025947839021683, "step": 2000, "step_time": 8.903154159188853 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.012109375, "completions/max_length": 1687.4, "completions/max_terminated_length": 1525.7, "completions/mean_length": 209.242578125, "completions/mean_terminated_length": 187.08142700195313, "completions/min_length": 66.9, "completions/min_terminated_length": 66.9, "entropy": 0.09399332064203918, "epoch": 4.30406852248394, "frac_reward_zero_std": 0.69375, "grad_norm": 0.296875, "learning_rate": 9.7991e-06, "loss": -0.0196, "num_tokens": 228020668.0, "reward": 0.967070335149765, "reward_std": 0.332244785130024, "rewards/reward_accuracy/mean": 0.86796875, "rewards/reward_accuracy/std": 0.33008057326078416, "rewards/reward_format/mean": 0.09910156354308128, "rewards/reward_format/std": 0.006800719466991722, "sampling/importance_sampling_ratio/max": 2.4063852429389954, "sampling/importance_sampling_ratio/mean": 0.9778293013572693, "sampling/importance_sampling_ratio/min": 0.08326948881149292, "sampling/sampling_logp_difference/max": 1.2640114843845367, "sampling/sampling_logp_difference/mean": 0.005437909765169025, "step": 2010, "step_time": 8.459733507601777 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.008984375, "completions/max_length": 1835.9, "completions/max_terminated_length": 1631.0, "completions/mean_length": 197.99453125, "completions/mean_terminated_length": 181.3332260131836, "completions/min_length": 63.3, "completions/min_terminated_length": 63.3, "entropy": 0.09036683803424239, "epoch": 4.325481798715203, "frac_reward_zero_std": 0.725, "grad_norm": 0.94921875, "learning_rate": 9.7981e-06, "loss": -0.0137, "num_tokens": 229040830.0, "reward": 1.0002148568630218, "reward_std": 0.2921817272901535, "rewards/reward_accuracy/mean": 0.901171875, "rewards/reward_accuracy/std": 0.2890390917658806, "rewards/reward_format/mean": 0.09904297068715096, "rewards/reward_format/std": 0.007983049564063548, "sampling/importance_sampling_ratio/max": 2.3476433873176576, "sampling/importance_sampling_ratio/mean": 0.9750633597373962, "sampling/importance_sampling_ratio/min": 0.051548021472990514, "sampling/sampling_logp_difference/max": 0.7461958885192871, "sampling/sampling_logp_difference/mean": 0.005363814067095518, "step": 2020, "step_time": 8.786099350302539 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.015234375, "completions/max_length": 2017.1, "completions/max_terminated_length": 1751.4, "completions/mean_length": 218.8046875, "completions/mean_terminated_length": 190.57720794677735, "completions/min_length": 66.1, "completions/min_terminated_length": 66.1, "entropy": 0.1022476602345705, "epoch": 4.346895074946467, "frac_reward_zero_std": 0.71875, "grad_norm": 0.384765625, "learning_rate": 9.7971e-06, "loss": -0.0131, "num_tokens": 230122282.0, "reward": 0.9668554902076721, "reward_std": 0.3360069617629051, "rewards/reward_accuracy/mean": 0.86796875, "rewards/reward_accuracy/std": 0.33305981308221816, "rewards/reward_format/mean": 0.09888672232627868, "rewards/reward_format/std": 0.00838587167672813, "sampling/importance_sampling_ratio/max": 2.5454454898834227, "sampling/importance_sampling_ratio/mean": 0.9800317168235779, "sampling/importance_sampling_ratio/min": 0.04382980114314705, "sampling/sampling_logp_difference/max": 0.8039904952049255, "sampling/sampling_logp_difference/mean": 0.005709635838866234, "step": 2030, "step_time": 9.936319773294963 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0109375, "completions/max_length": 1911.1, "completions/max_terminated_length": 1686.6, "completions/mean_length": 201.569921875, "completions/mean_terminated_length": 181.32967834472657, "completions/min_length": 63.9, "completions/min_terminated_length": 63.9, "entropy": 0.08554767444729805, "epoch": 4.36830835117773, "frac_reward_zero_std": 0.73125, "grad_norm": 0.388671875, "learning_rate": 9.796100000000001e-06, "loss": -0.011, "num_tokens": 231159757.0, "reward": 0.9846289336681366, "reward_std": 0.30987718403339387, "rewards/reward_accuracy/mean": 0.885546875, "rewards/reward_accuracy/std": 0.30737688541412356, "rewards/reward_format/mean": 0.09908203557133674, "rewards/reward_format/std": 0.00754120263736695, "sampling/importance_sampling_ratio/max": 2.5291023731231688, "sampling/importance_sampling_ratio/mean": 0.9788542211055755, "sampling/importance_sampling_ratio/min": 0.02789664827287197, "sampling/sampling_logp_difference/max": 1.0577860951423645, "sampling/sampling_logp_difference/mean": 0.005004906468093396, "step": 2040, "step_time": 9.488443369492597 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00625, "completions/max_length": 1611.2, "completions/max_terminated_length": 1379.7, "completions/mean_length": 185.3671875, "completions/mean_terminated_length": 173.96497497558593, "completions/min_length": 60.1, "completions/min_terminated_length": 60.1, "entropy": 0.0841828775126487, "epoch": 4.389721627408994, "frac_reward_zero_std": 0.7, "grad_norm": 1.03125, "learning_rate": 9.7951e-06, "loss": -0.0055, "num_tokens": 232159161.0, "reward": 0.9576758086681366, "reward_std": 0.33522614687681196, "rewards/reward_accuracy/mean": 0.858203125, "rewards/reward_accuracy/std": 0.334013032913208, "rewards/reward_format/mean": 0.0994726575911045, "rewards/reward_format/std": 0.0045425040181726216, "sampling/importance_sampling_ratio/max": 2.530995774269104, "sampling/importance_sampling_ratio/mean": 0.9801888585090637, "sampling/importance_sampling_ratio/min": 0.13382704854011535, "sampling/sampling_logp_difference/max": 0.7100008487701416, "sampling/sampling_logp_difference/mean": 0.00543126342818141, "step": 2050, "step_time": 7.591099826997379 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.009765625, "completions/max_length": 1647.5, "completions/max_terminated_length": 1509.3, "completions/mean_length": 195.51484375, "completions/mean_terminated_length": 177.44683074951172, "completions/min_length": 58.1, "completions/min_terminated_length": 58.1, "entropy": 0.09488111911341549, "epoch": 4.4111349036402565, "frac_reward_zero_std": 0.725, "grad_norm": 0.6171875, "learning_rate": 9.794100000000002e-06, "loss": -0.0135, "num_tokens": 233182687.0, "reward": 0.9827343940734863, "reward_std": 0.31327798664569856, "rewards/reward_accuracy/mean": 0.88359375, "rewards/reward_accuracy/std": 0.31096345782279966, "rewards/reward_format/mean": 0.09914062768220902, "rewards/reward_format/std": 0.006493909750133753, "sampling/importance_sampling_ratio/max": 2.4778871893882752, "sampling/importance_sampling_ratio/mean": 0.9793868839740754, "sampling/importance_sampling_ratio/min": 0.06390379788354039, "sampling/sampling_logp_difference/max": 0.8441758394241333, "sampling/sampling_logp_difference/mean": 0.00530198854394257, "step": 2060, "step_time": 8.44795082360506 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.008984375, "completions/max_length": 1560.2, "completions/max_terminated_length": 1474.7, "completions/mean_length": 191.8890625, "completions/mean_terminated_length": 175.44595336914062, "completions/min_length": 58.4, "completions/min_terminated_length": 58.4, "entropy": 0.09051755731925368, "epoch": 4.43254817987152, "frac_reward_zero_std": 0.75625, "grad_norm": 1.0, "learning_rate": 9.793100000000001e-06, "loss": -0.0017, "num_tokens": 234191811.0, "reward": 0.9850781619548797, "reward_std": 0.2987526074051857, "rewards/reward_accuracy/mean": 0.8859375, "rewards/reward_accuracy/std": 0.2965510383248329, "rewards/reward_format/mean": 0.09914062693715095, "rewards/reward_format/std": 0.005960265081375838, "sampling/importance_sampling_ratio/max": 2.435715126991272, "sampling/importance_sampling_ratio/mean": 0.9867534160614013, "sampling/importance_sampling_ratio/min": 0.10179056823253632, "sampling/sampling_logp_difference/max": 1.3606013298034667, "sampling/sampling_logp_difference/mean": 0.0051634463015943766, "step": 2070, "step_time": 7.8618158503100855 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0078125, "completions/max_length": 1666.1, "completions/max_terminated_length": 1519.6, "completions/mean_length": 159.31328125, "completions/mean_terminated_length": 144.54681472778321, "completions/min_length": 62.6, "completions/min_terminated_length": 62.6, "entropy": 0.07079208106733859, "epoch": 4.453961456102784, "frac_reward_zero_std": 0.78125, "grad_norm": 0.5703125, "learning_rate": 9.7921e-06, "loss": -0.0054, "num_tokens": 235113509.0, "reward": 1.0273828148841857, "reward_std": 0.2523354530334473, "rewards/reward_accuracy/mean": 0.928125, "rewards/reward_accuracy/std": 0.24980832934379577, "rewards/reward_format/mean": 0.09925781339406967, "rewards/reward_format/std": 0.005916051496751606, "sampling/importance_sampling_ratio/max": 2.408108675479889, "sampling/importance_sampling_ratio/mean": 0.9871065139770507, "sampling/importance_sampling_ratio/min": 0.1144093245267868, "sampling/sampling_logp_difference/max": 0.714095163345337, "sampling/sampling_logp_difference/mean": 0.004558845772407949, "step": 2080, "step_time": 8.06028911939793 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.004296875, "completions/max_length": 1722.2, "completions/max_terminated_length": 1422.9, "completions/mean_length": 159.81953125, "completions/mean_terminated_length": 151.70249710083007, "completions/min_length": 67.2, "completions/min_terminated_length": 67.2, "entropy": 0.06418220684863626, "epoch": 4.475374732334047, "frac_reward_zero_std": 0.7875, "grad_norm": 0.78515625, "learning_rate": 9.791100000000002e-06, "loss": -0.0112, "num_tokens": 236044407.0, "reward": 1.0241601645946503, "reward_std": 0.25501007586717606, "rewards/reward_accuracy/mean": 0.924609375, "rewards/reward_accuracy/std": 0.2533506594598293, "rewards/reward_format/mean": 0.09955078214406968, "rewards/reward_format/std": 0.00438030413351953, "sampling/importance_sampling_ratio/max": 2.4996392726898193, "sampling/importance_sampling_ratio/mean": 0.988101577758789, "sampling/importance_sampling_ratio/min": 0.08764938879758119, "sampling/sampling_logp_difference/max": 0.9312692880630493, "sampling/sampling_logp_difference/mean": 0.0044564057374373075, "step": 2090, "step_time": 8.024358670900984 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.009765625, "completions/max_length": 1839.7, "completions/max_terminated_length": 1648.9, "completions/mean_length": 199.826171875, "completions/mean_terminated_length": 181.7624496459961, "completions/min_length": 67.0, "completions/min_terminated_length": 67.0, "entropy": 0.08696371647529304, "epoch": 4.496788008565311, "frac_reward_zero_std": 0.70625, "grad_norm": 0.55078125, "learning_rate": 9.790100000000001e-06, "loss": -0.0143, "num_tokens": 237077642.0, "reward": 0.99595707654953, "reward_std": 0.2828642189502716, "rewards/reward_accuracy/mean": 0.896875, "rewards/reward_accuracy/std": 0.2801231279969215, "rewards/reward_format/mean": 0.09908203408122063, "rewards/reward_format/std": 0.006850743247196078, "sampling/importance_sampling_ratio/max": 2.5123090744018555, "sampling/importance_sampling_ratio/mean": 0.9794782221317291, "sampling/importance_sampling_ratio/min": 0.08114426881074906, "sampling/sampling_logp_difference/max": 0.794606339931488, "sampling/sampling_logp_difference/mean": 0.005333045125007629, "step": 2100, "step_time": 8.97705702000385 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005859375, "completions/max_length": 1637.3, "completions/max_terminated_length": 1582.1, "completions/mean_length": 169.9796875, "completions/mean_terminated_length": 159.01034545898438, "completions/min_length": 62.6, "completions/min_terminated_length": 62.6, "entropy": 0.07645585457794368, "epoch": 4.518201284796574, "frac_reward_zero_std": 0.76875, "grad_norm": 0.8046875, "learning_rate": 9.789100000000001e-06, "loss": -0.0142, "num_tokens": 238040070.0, "reward": 1.0177929818630218, "reward_std": 0.25959050059318545, "rewards/reward_accuracy/mean": 0.918359375, "rewards/reward_accuracy/std": 0.2581544242799282, "rewards/reward_format/mean": 0.09943359494209289, "rewards/reward_format/std": 0.0037379376590251923, "sampling/importance_sampling_ratio/max": 2.216869223117828, "sampling/importance_sampling_ratio/mean": 0.9745715498924256, "sampling/importance_sampling_ratio/min": 0.08360667377710343, "sampling/sampling_logp_difference/max": 0.8369795441627502, "sampling/sampling_logp_difference/mean": 0.0049792623845860366, "step": 2110, "step_time": 7.821563000703463 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.008203125, "completions/max_length": 1475.3, "completions/max_terminated_length": 1386.7, "completions/mean_length": 181.330859375, "completions/mean_terminated_length": 166.1758544921875, "completions/min_length": 65.3, "completions/min_terminated_length": 65.3, "entropy": 0.07535161459818482, "epoch": 4.539614561027837, "frac_reward_zero_std": 0.775, "grad_norm": 0.6640625, "learning_rate": 9.7881e-06, "loss": 0.0046, "num_tokens": 239019301.0, "reward": 0.9715625166893005, "reward_std": 0.3155876360833645, "rewards/reward_accuracy/mean": 0.872265625, "rewards/reward_accuracy/std": 0.3137762926518917, "rewards/reward_format/mean": 0.09929687604308128, "rewards/reward_format/std": 0.005393980420194566, "sampling/importance_sampling_ratio/max": 2.5851032018661497, "sampling/importance_sampling_ratio/mean": 0.9937897861003876, "sampling/importance_sampling_ratio/min": 0.1833063170313835, "sampling/sampling_logp_difference/max": 0.7035237789154053, "sampling/sampling_logp_difference/mean": 0.00464664117898792, "step": 2120, "step_time": 7.30794589719153 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 2.3404663807014003e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 2.3404663807014003e-06, "completions/clipped_ratio": 0.00859375, "completions/max_length": 1610.8, "completions/max_terminated_length": 1332.2, "completions/mean_length": 181.216796875, "completions/mean_terminated_length": 165.10993499755858, "completions/min_length": 67.0, "completions/min_terminated_length": 67.0, "entropy": 0.07091707922518253, "epoch": 4.5610278372591, "frac_reward_zero_std": 0.775, "grad_norm": 0.8515625, "learning_rate": 9.7871e-06, "loss": -0.0077, "num_tokens": 240005600.0, "reward": 1.004941427707672, "reward_std": 0.269658263027668, "rewards/reward_accuracy/mean": 0.90546875, "rewards/reward_accuracy/std": 0.2676686063408852, "rewards/reward_format/mean": 0.0994726575911045, "rewards/reward_format/std": 0.004322139755822718, "sampling/importance_sampling_ratio/max": 2.589378321170807, "sampling/importance_sampling_ratio/mean": 0.9867459952831268, "sampling/importance_sampling_ratio/min": 0.1000741496682167, "sampling/sampling_logp_difference/max": 0.8688886880874633, "sampling/sampling_logp_difference/mean": 0.00457688351161778, "step": 2130, "step_time": 7.864862138699391 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00546875, "completions/max_length": 1803.8, "completions/max_terminated_length": 1408.8, "completions/mean_length": 176.346484375, "completions/mean_terminated_length": 166.10452880859376, "completions/min_length": 62.9, "completions/min_terminated_length": 62.9, "entropy": 0.07794082672335208, "epoch": 4.582441113490364, "frac_reward_zero_std": 0.7125, "grad_norm": 0.78515625, "learning_rate": 9.786100000000001e-06, "loss": -0.0025, "num_tokens": 240970279.0, "reward": 0.9908398687839508, "reward_std": 0.2986170083284378, "rewards/reward_accuracy/mean": 0.89140625, "rewards/reward_accuracy/std": 0.29710409343242644, "rewards/reward_format/mean": 0.09943359494209289, "rewards/reward_format/std": 0.005302870529703796, "sampling/importance_sampling_ratio/max": 2.3203123927116396, "sampling/importance_sampling_ratio/mean": 0.9915559589862823, "sampling/importance_sampling_ratio/min": 0.0888116448186338, "sampling/sampling_logp_difference/max": 0.8253662824630738, "sampling/sampling_logp_difference/mean": 0.0052910540252923965, "step": 2140, "step_time": 8.524868061397864 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 1.2089592246411486e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 1.2089592246411486e-06, "completions/clipped_ratio": 0.0171875, "completions/max_length": 1709.3, "completions/max_terminated_length": 1615.9, "completions/mean_length": 209.283984375, "completions/mean_terminated_length": 177.42144012451172, "completions/min_length": 63.4, "completions/min_terminated_length": 63.4, "entropy": 0.08825421063229441, "epoch": 4.6038543897216275, "frac_reward_zero_std": 0.70625, "grad_norm": 1.8828125, "learning_rate": 9.7851e-06, "loss": -0.0138, "num_tokens": 242019790.0, "reward": 0.9694140911102295, "reward_std": 0.31108973547816277, "rewards/reward_accuracy/mean": 0.870703125, "rewards/reward_accuracy/std": 0.3080101229250431, "rewards/reward_format/mean": 0.09871093928813934, "rewards/reward_format/std": 0.008570267655886709, "sampling/importance_sampling_ratio/max": 2.280792200565338, "sampling/importance_sampling_ratio/mean": 0.9886388897895813, "sampling/importance_sampling_ratio/min": 0.1037389699369669, "sampling/sampling_logp_difference/max": 0.7944270491600036, "sampling/sampling_logp_difference/mean": 0.005283630220219493, "step": 2150, "step_time": 8.38908263599733 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 5.7220458984375e-07, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 5.7220458984375e-07, "completions/clipped_ratio": 0.01015625, "completions/max_length": 1861.4, "completions/max_terminated_length": 1609.8, "completions/mean_length": 196.66484375, "completions/mean_terminated_length": 178.1639846801758, "completions/min_length": 71.4, "completions/min_terminated_length": 71.4, "entropy": 0.08580228919163346, "epoch": 4.625267665952891, "frac_reward_zero_std": 0.7, "grad_norm": 1.5703125, "learning_rate": 9.7841e-06, "loss": -0.0094, "num_tokens": 243045988.0, "reward": 0.9642773687839508, "reward_std": 0.32801089733839034, "rewards/reward_accuracy/mean": 0.865234375, "rewards/reward_accuracy/std": 0.3259991258382797, "rewards/reward_format/mean": 0.09904296919703484, "rewards/reward_format/std": 0.006392091745510697, "sampling/importance_sampling_ratio/max": 2.4289372324943543, "sampling/importance_sampling_ratio/mean": 0.9706053137779236, "sampling/importance_sampling_ratio/min": 0.025435397028923036, "sampling/sampling_logp_difference/max": 0.9564635992050171, "sampling/sampling_logp_difference/mean": 0.005238713696599007, "step": 2160, "step_time": 8.966212662504404 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00703125, "completions/max_length": 1559.7, "completions/max_terminated_length": 1428.9, "completions/mean_length": 171.7265625, "completions/mean_terminated_length": 158.6864471435547, "completions/min_length": 68.8, "completions/min_terminated_length": 68.8, "entropy": 0.06829877183772623, "epoch": 4.646680942184155, "frac_reward_zero_std": 0.74375, "grad_norm": 1.109375, "learning_rate": 9.783100000000001e-06, "loss": -0.0041, "num_tokens": 244000872.0, "reward": 1.0152929902076722, "reward_std": 0.2500875130295753, "rewards/reward_accuracy/mean": 0.916015625, "rewards/reward_accuracy/std": 0.2484466627240181, "rewards/reward_format/mean": 0.0992773450911045, "rewards/reward_format/std": 0.005242691724561155, "sampling/importance_sampling_ratio/max": 2.3250232219696043, "sampling/importance_sampling_ratio/mean": 0.9786055505275726, "sampling/importance_sampling_ratio/min": 0.07453126609325408, "sampling/sampling_logp_difference/max": 1.0933011054992676, "sampling/sampling_logp_difference/mean": 0.004774229438044131, "step": 2170, "step_time": 7.585577700800786 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 9.370725138069247e-07, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 9.370725138069247e-07, "completions/clipped_ratio": 0.01171875, "completions/max_length": 1622.1, "completions/max_terminated_length": 1428.6, "completions/mean_length": 188.590234375, "completions/mean_terminated_length": 166.7021057128906, "completions/min_length": 61.4, "completions/min_terminated_length": 61.4, "entropy": 0.0849621957167983, "epoch": 4.668094218415417, "frac_reward_zero_std": 0.775, "grad_norm": 0.57421875, "learning_rate": 9.7821e-06, "loss": 0.0015, "num_tokens": 244999215.0, "reward": 1.0197265923023224, "reward_std": 0.2503895789384842, "rewards/reward_accuracy/mean": 0.920703125, "rewards/reward_accuracy/std": 0.24756357073783875, "rewards/reward_format/mean": 0.09902343824505806, "rewards/reward_format/std": 0.005879755993373692, "sampling/importance_sampling_ratio/max": 2.469088554382324, "sampling/importance_sampling_ratio/mean": 0.979578572511673, "sampling/importance_sampling_ratio/min": 0.11522134207189083, "sampling/sampling_logp_difference/max": 0.7691325426101685, "sampling/sampling_logp_difference/mean": 0.005316501692868769, "step": 2180, "step_time": 7.949738726801297 }, { "clip_ratio/high_max": 1.992031866393518e-06, "clip_ratio/high_mean": 2.4900398329918973e-07, "clip_ratio/low_mean": 1.521369563306507e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 1.7703735693430644e-06, "completions/clipped_ratio": 0.0125, "completions/max_length": 1802.1, "completions/max_terminated_length": 1514.6, "completions/mean_length": 195.33203125, "completions/mean_terminated_length": 172.23922119140624, "completions/min_length": 63.3, "completions/min_terminated_length": 63.3, "entropy": 0.08400442185811699, "epoch": 4.689507494646681, "frac_reward_zero_std": 0.7375, "grad_norm": 0.671875, "learning_rate": 9.781100000000002e-06, "loss": -0.0099, "num_tokens": 246008369.0, "reward": 0.9962500274181366, "reward_std": 0.29630859941244125, "rewards/reward_accuracy/mean": 0.897265625, "rewards/reward_accuracy/std": 0.29331949204206464, "rewards/reward_format/mean": 0.0989843763411045, "rewards/reward_format/std": 0.0078062117798253896, "sampling/importance_sampling_ratio/max": 2.5167356967926025, "sampling/importance_sampling_ratio/mean": 0.9783742666244507, "sampling/importance_sampling_ratio/min": 0.07505913749337197, "sampling/sampling_logp_difference/max": 0.8785338521003723, "sampling/sampling_logp_difference/mean": 0.005175079079344868, "step": 2190, "step_time": 8.66743052550446 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01171875, "completions/max_length": 1690.0, "completions/max_terminated_length": 1621.3, "completions/mean_length": 212.880859375, "completions/mean_terminated_length": 191.45450134277343, "completions/min_length": 64.6, "completions/min_terminated_length": 64.6, "entropy": 0.09540253672748804, "epoch": 4.710920770877944, "frac_reward_zero_std": 0.70625, "grad_norm": 0.3828125, "learning_rate": 9.780100000000001e-06, "loss": -0.0066, "num_tokens": 247072800.0, "reward": 0.9864453256130219, "reward_std": 0.2926752604544163, "rewards/reward_accuracy/mean": 0.8875, "rewards/reward_accuracy/std": 0.2902793921530247, "rewards/reward_format/mean": 0.09894531369209289, "rewards/reward_format/std": 0.007230436359532177, "sampling/importance_sampling_ratio/max": 2.5507349967956543, "sampling/importance_sampling_ratio/mean": 0.9820370733737945, "sampling/importance_sampling_ratio/min": 0.08231296204030514, "sampling/sampling_logp_difference/max": 0.8357828259468079, "sampling/sampling_logp_difference/mean": 0.005763309448957444, "step": 2200, "step_time": 8.275506640794628 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 3.248705115765915e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 3.248705115765915e-06, "completions/clipped_ratio": 0.023828125, "completions/max_length": 1873.4, "completions/max_terminated_length": 1523.8, "completions/mean_length": 229.976171875, "completions/mean_terminated_length": 186.45760040283204, "completions/min_length": 59.3, "completions/min_terminated_length": 59.3, "entropy": 0.09123739684000612, "epoch": 4.732334047109208, "frac_reward_zero_std": 0.79375, "grad_norm": 0.396484375, "learning_rate": 9.779100000000001e-06, "loss": -0.0091, "num_tokens": 248174339.0, "reward": 0.994511729478836, "reward_std": 0.2701865181326866, "rewards/reward_accuracy/mean": 0.896484375, "rewards/reward_accuracy/std": 0.26520081162452697, "rewards/reward_format/mean": 0.09802734404802323, "rewards/reward_format/std": 0.010915013542398811, "sampling/importance_sampling_ratio/max": 2.347126340866089, "sampling/importance_sampling_ratio/mean": 0.9640675842761993, "sampling/importance_sampling_ratio/min": 0.058619886497035624, "sampling/sampling_logp_difference/max": 1.0788860738277435, "sampling/sampling_logp_difference/mean": 0.005326095875352621, "step": 2210, "step_time": 9.421573199500562 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.017578125, "completions/max_length": 1975.2, "completions/max_terminated_length": 1784.4, "completions/mean_length": 226.7453125, "completions/mean_terminated_length": 194.62357635498046, "completions/min_length": 65.3, "completions/min_terminated_length": 65.3, "entropy": 0.09808328119106591, "epoch": 4.7537473233404715, "frac_reward_zero_std": 0.725, "grad_norm": 0.375, "learning_rate": 9.7781e-06, "loss": -0.0222, "num_tokens": 249271671.0, "reward": 0.9534570515155792, "reward_std": 0.3409714996814728, "rewards/reward_accuracy/mean": 0.8546875, "rewards/reward_accuracy/std": 0.3386022850871086, "rewards/reward_format/mean": 0.09876953139901161, "rewards/reward_format/std": 0.0077095223823562264, "sampling/importance_sampling_ratio/max": 2.5454773187637327, "sampling/importance_sampling_ratio/mean": 0.9711083889007568, "sampling/importance_sampling_ratio/min": 0.033962635695934294, "sampling/sampling_logp_difference/max": 0.949769115447998, "sampling/sampling_logp_difference/mean": 0.005811973474919796, "step": 2220, "step_time": 9.669196539497353 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.013671875, "completions/max_length": 1833.2, "completions/max_terminated_length": 1620.6, "completions/mean_length": 212.1921875, "completions/mean_terminated_length": 187.11306915283203, "completions/min_length": 65.4, "completions/min_terminated_length": 65.4, "entropy": 0.08953576134517789, "epoch": 4.775160599571734, "frac_reward_zero_std": 0.725, "grad_norm": 0.72265625, "learning_rate": 9.7771e-06, "loss": -0.008, "num_tokens": 250332851.0, "reward": 0.991992199420929, "reward_std": 0.3011354684829712, "rewards/reward_accuracy/mean": 0.893359375, "rewards/reward_accuracy/std": 0.29779814183712006, "rewards/reward_format/mean": 0.0986328125, "rewards/reward_format/std": 0.007914522453211248, "sampling/importance_sampling_ratio/max": 2.4657883644104004, "sampling/importance_sampling_ratio/mean": 0.9748385787010193, "sampling/importance_sampling_ratio/min": 0.045927174761891364, "sampling/sampling_logp_difference/max": 0.9461305618286133, "sampling/sampling_logp_difference/mean": 0.005509271938353777, "step": 2230, "step_time": 8.944138980685967 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 1.3468326187648927e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 1.3468326187648927e-06, "completions/clipped_ratio": 0.0078125, "completions/max_length": 1817.1, "completions/max_terminated_length": 1685.6, "completions/mean_length": 193.576953125, "completions/mean_terminated_length": 179.0530548095703, "completions/min_length": 64.8, "completions/min_terminated_length": 64.8, "entropy": 0.08151403218507766, "epoch": 4.796573875802998, "frac_reward_zero_std": 0.7375, "grad_norm": 0.37890625, "learning_rate": 9.776100000000001e-06, "loss": -0.0114, "num_tokens": 251351096.0, "reward": 1.0052344083786011, "reward_std": 0.28796522617340087, "rewards/reward_accuracy/mean": 0.905859375, "rewards/reward_accuracy/std": 0.28608872890472414, "rewards/reward_format/mean": 0.09937500134110451, "rewards/reward_format/std": 0.005896919290535152, "sampling/importance_sampling_ratio/max": 2.54252712726593, "sampling/importance_sampling_ratio/mean": 0.9708419442176819, "sampling/importance_sampling_ratio/min": 0.04748087078332901, "sampling/sampling_logp_difference/max": 0.8803086280822754, "sampling/sampling_logp_difference/mean": 0.0054293053690344095, "step": 2240, "step_time": 8.908298324605857 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 3.222971076866088e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 3.222971076866088e-06, "completions/clipped_ratio": 0.021484375, "completions/max_length": 1796.1, "completions/max_terminated_length": 1595.0, "completions/mean_length": 223.38046875, "completions/mean_terminated_length": 183.85076293945312, "completions/min_length": 68.4, "completions/min_terminated_length": 68.4, "entropy": 0.09370366488583386, "epoch": 4.817987152034261, "frac_reward_zero_std": 0.76875, "grad_norm": 0.75, "learning_rate": 9.7751e-06, "loss": -0.0208, "num_tokens": 252445814.0, "reward": 0.9686718940734863, "reward_std": 0.31389373987913133, "rewards/reward_accuracy/mean": 0.8703125, "rewards/reward_accuracy/std": 0.31046067997813226, "rewards/reward_format/mean": 0.09835937470197678, "rewards/reward_format/std": 0.008930181409232319, "sampling/importance_sampling_ratio/max": 2.570297908782959, "sampling/importance_sampling_ratio/mean": 0.9833467185497284, "sampling/importance_sampling_ratio/min": 0.016333626210689546, "sampling/sampling_logp_difference/max": 0.8726479947566986, "sampling/sampling_logp_difference/mean": 0.005547507666051388, "step": 2250, "step_time": 8.809942481594044 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 2.8564946205733575e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 2.8564946205733575e-06, "completions/clipped_ratio": 0.02890625, "completions/max_length": 1962.0, "completions/max_terminated_length": 1746.8, "completions/mean_length": 262.2890625, "completions/mean_terminated_length": 209.58065643310547, "completions/min_length": 66.2, "completions/min_terminated_length": 66.2, "entropy": 0.11199936117045581, "epoch": 4.839400428265525, "frac_reward_zero_std": 0.725, "grad_norm": 0.71484375, "learning_rate": 9.7741e-06, "loss": -0.0146, "num_tokens": 253638298.0, "reward": 0.9427148699760437, "reward_std": 0.3403990387916565, "rewards/reward_accuracy/mean": 0.844921875, "rewards/reward_accuracy/std": 0.33587906807661055, "rewards/reward_format/mean": 0.09779297336935996, "rewards/reward_format/std": 0.011930074635893106, "sampling/importance_sampling_ratio/max": 2.595848727226257, "sampling/importance_sampling_ratio/mean": 0.9563285887241364, "sampling/importance_sampling_ratio/min": 0.04551267977803945, "sampling/sampling_logp_difference/max": 0.8743456780910492, "sampling/sampling_logp_difference/mean": 0.006298250332474708, "step": 2260, "step_time": 9.936624127805407 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01328125, "completions/max_length": 1792.1, "completions/max_terminated_length": 1666.1, "completions/mean_length": 202.0859375, "completions/mean_terminated_length": 177.6548110961914, "completions/min_length": 68.5, "completions/min_terminated_length": 68.5, "entropy": 0.08866131356917321, "epoch": 4.860813704496788, "frac_reward_zero_std": 0.725, "grad_norm": 0.53515625, "learning_rate": 9.773100000000001e-06, "loss": -0.0053, "num_tokens": 254673094.0, "reward": 1.0216211140155793, "reward_std": 0.24170828908681868, "rewards/reward_accuracy/mean": 0.92265625, "rewards/reward_accuracy/std": 0.23907576501369476, "rewards/reward_format/mean": 0.09896484464406967, "rewards/reward_format/std": 0.007286950154229999, "sampling/importance_sampling_ratio/max": 2.427917718887329, "sampling/importance_sampling_ratio/mean": 0.9815936505794525, "sampling/importance_sampling_ratio/min": 0.08036115914583206, "sampling/sampling_logp_difference/max": 0.9833181619644165, "sampling/sampling_logp_difference/mean": 0.005642562196590007, "step": 2270, "step_time": 8.683277568596532 }, { "clip_ratio/high_max": 6.429175555240363e-05, "clip_ratio/high_mean": 8.036469444050453e-06, "clip_ratio/low_mean": 2.0722062117783937e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 1.0108675655828848e-05, "completions/clipped_ratio": 0.02890625, "completions/max_length": 2011.8, "completions/max_terminated_length": 1801.5, "completions/mean_length": 244.678515625, "completions/mean_terminated_length": 191.76283264160156, "completions/min_length": 66.1, "completions/min_terminated_length": 66.1, "entropy": 0.11101097697392107, "epoch": 4.882226980728051, "frac_reward_zero_std": 0.75, "grad_norm": 0.51953125, "learning_rate": 9.772100000000001e-06, "loss": -0.0263, "num_tokens": 255815631.0, "reward": 0.9891406416893005, "reward_std": 0.30459093749523164, "rewards/reward_accuracy/mean": 0.891015625, "rewards/reward_accuracy/std": 0.2995521530508995, "rewards/reward_format/mean": 0.09812500178813935, "rewards/reward_format/std": 0.011402385728433728, "sampling/importance_sampling_ratio/max": 2.47555273771286, "sampling/importance_sampling_ratio/mean": 0.9687107086181641, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 0.9624327540397644, "sampling/sampling_logp_difference/mean": 0.0060417496133595705, "step": 2280, "step_time": 9.844116887998826 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.009375, "completions/max_length": 1979.2, "completions/max_terminated_length": 1797.8, "completions/mean_length": 193.8609375, "completions/mean_terminated_length": 176.480419921875, "completions/min_length": 63.1, "completions/min_terminated_length": 63.1, "entropy": 0.0783037640620023, "epoch": 4.9036402569593145, "frac_reward_zero_std": 0.75, "grad_norm": 0.73828125, "learning_rate": 9.7711e-06, "loss": -0.0061, "num_tokens": 256826939.0, "reward": 1.003027367591858, "reward_std": 0.27844581082463266, "rewards/reward_accuracy/mean": 0.90390625, "rewards/reward_accuracy/std": 0.27574645057320596, "rewards/reward_format/mean": 0.09912109449505806, "rewards/reward_format/std": 0.007335902634076774, "sampling/importance_sampling_ratio/max": 2.516179418563843, "sampling/importance_sampling_ratio/mean": 0.9768676638603211, "sampling/importance_sampling_ratio/min": 0.0430468525737524, "sampling/sampling_logp_difference/max": 1.0739474058151246, "sampling/sampling_logp_difference/mean": 0.005295001761987805, "step": 2290, "step_time": 9.541525884396105 }, { "clip_ratio/high_max": 2.5974860909627752e-05, "clip_ratio/high_mean": 3.246857613703469e-06, "clip_ratio/low_mean": 3.547928986336046e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 6.794786509090045e-06, "completions/clipped_ratio": 0.0171875, "completions/max_length": 1973.3, "completions/max_terminated_length": 1786.1, "completions/mean_length": 230.69296875, "completions/mean_terminated_length": 199.18791656494142, "completions/min_length": 66.7, "completions/min_terminated_length": 66.7, "entropy": 0.09776845169253648, "epoch": 4.925053533190578, "frac_reward_zero_std": 0.71875, "grad_norm": 0.333984375, "learning_rate": 9.770100000000002e-06, "loss": -0.0097, "num_tokens": 257925465.0, "reward": 1.0038867533206939, "reward_std": 0.29047847390174864, "rewards/reward_accuracy/mean": 0.90546875, "rewards/reward_accuracy/std": 0.28581098318099973, "rewards/reward_format/mean": 0.0984179712831974, "rewards/reward_format/std": 0.009709775634109973, "sampling/importance_sampling_ratio/max": 2.6093069314956665, "sampling/importance_sampling_ratio/mean": 0.9602207124233246, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 0.9501909017562866, "sampling/sampling_logp_difference/mean": 0.005854196520522237, "step": 2300, "step_time": 9.395679875994393 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 3.734363167495758e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 3.734363167495758e-06, "completions/clipped_ratio": 0.03671875, "completions/max_length": 1806.6, "completions/max_terminated_length": 1658.3, "completions/mean_length": 281.35390625, "completions/mean_terminated_length": 215.01718444824218, "completions/min_length": 69.0, "completions/min_terminated_length": 69.0, "entropy": 0.10897608175873756, "epoch": 4.946466809421842, "frac_reward_zero_std": 0.70625, "grad_norm": 0.50390625, "learning_rate": 9.769100000000001e-06, "loss": -0.0206, "num_tokens": 259168211.0, "reward": 0.9879883229732513, "reward_std": 0.2995134241878986, "rewards/reward_accuracy/mean": 0.891015625, "rewards/reward_accuracy/std": 0.29208410158753395, "rewards/reward_format/mean": 0.09697265848517418, "rewards/reward_format/std": 0.013821890950202942, "sampling/importance_sampling_ratio/max": 2.6028293132781983, "sampling/importance_sampling_ratio/mean": 0.9686287939548492, "sampling/importance_sampling_ratio/min": 0.0898590438067913, "sampling/sampling_logp_difference/max": 0.8076077222824096, "sampling/sampling_logp_difference/mean": 0.005959991738200188, "step": 2310, "step_time": 9.415581606992054 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 1.1699475180648732e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 1.1699475180648732e-06, "completions/clipped_ratio": 0.030859375, "completions/max_length": 2048.0, "completions/max_terminated_length": 1959.6, "completions/mean_length": 298.7734375, "completions/mean_terminated_length": 243.15517883300782, "completions/min_length": 71.5, "completions/min_terminated_length": 71.5, "entropy": 0.13118589436635375, "epoch": 4.967880085653105, "frac_reward_zero_std": 0.6625, "grad_norm": 0.259765625, "learning_rate": 9.7681e-06, "loss": -0.0212, "num_tokens": 260452623.0, "reward": 0.9819726765155792, "reward_std": 0.3216537445783615, "rewards/reward_accuracy/mean": 0.884375, "rewards/reward_accuracy/std": 0.3153507113456726, "rewards/reward_format/mean": 0.09759765863418579, "rewards/reward_format/std": 0.013551969872787594, "sampling/importance_sampling_ratio/max": 2.688900685310364, "sampling/importance_sampling_ratio/mean": 0.9521142482757569, "sampling/importance_sampling_ratio/min": 0.001366019924171269, "sampling/sampling_logp_difference/max": 0.9410638332366943, "sampling/sampling_logp_difference/mean": 0.006703994330018758, "step": 2320, "step_time": 10.579705131592345 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01484375, "completions/max_length": 2044.0, "completions/max_terminated_length": 1808.2, "completions/mean_length": 238.441015625, "completions/mean_terminated_length": 211.04193267822265, "completions/min_length": 73.5, "completions/min_terminated_length": 73.5, "entropy": 0.10004255888052285, "epoch": 4.989293361884369, "frac_reward_zero_std": 0.70625, "grad_norm": 1.1015625, "learning_rate": 9.7671e-06, "loss": -0.0109, "num_tokens": 261580680.0, "reward": 1.0002734661102295, "reward_std": 0.2849088445305824, "rewards/reward_accuracy/mean": 0.9015625, "rewards/reward_accuracy/std": 0.2809669919312, "rewards/reward_format/mean": 0.09871093928813934, "rewards/reward_format/std": 0.009617776866070927, "sampling/importance_sampling_ratio/max": 2.6115639209747314, "sampling/importance_sampling_ratio/mean": 0.983322536945343, "sampling/importance_sampling_ratio/min": 0.009596103802323341, "sampling/sampling_logp_difference/max": 0.8751127183437347, "sampling/sampling_logp_difference/mean": 0.005895709851756692, "step": 2330, "step_time": 10.08629838218767 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.008984375, "completions/max_length": 1812.2, "completions/max_terminated_length": 1709.1, "completions/mean_length": 229.435546875, "completions/mean_terminated_length": 213.2009063720703, "completions/min_length": 72.3, "completions/min_terminated_length": 72.3, "entropy": 0.09568726033903659, "epoch": 5.010706638115631, "frac_reward_zero_std": 0.75625, "grad_norm": 0.75, "learning_rate": 9.766100000000001e-06, "loss": -0.0147, "num_tokens": 262683795.0, "reward": 1.0123437643051147, "reward_std": 0.2675609141588211, "rewards/reward_accuracy/mean": 0.91328125, "rewards/reward_accuracy/std": 0.26485550254583357, "rewards/reward_format/mean": 0.09906249940395355, "rewards/reward_format/std": 0.007397540635429323, "sampling/importance_sampling_ratio/max": 2.5975226163864136, "sampling/importance_sampling_ratio/mean": 0.978242027759552, "sampling/importance_sampling_ratio/min": 0.0870393119752407, "sampling/sampling_logp_difference/max": 1.2491745114326478, "sampling/sampling_logp_difference/mean": 0.005445632431656122, "step": 2340, "step_time": 8.716531403400586 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01328125, "completions/max_length": 1922.9, "completions/max_terminated_length": 1692.3, "completions/mean_length": 222.668359375, "completions/mean_terminated_length": 198.46761779785157, "completions/min_length": 72.1, "completions/min_terminated_length": 72.1, "entropy": 0.09606688623316587, "epoch": 5.032119914346895, "frac_reward_zero_std": 0.725, "grad_norm": 0.69921875, "learning_rate": 9.7651e-06, "loss": -0.0114, "num_tokens": 263772610.0, "reward": 1.0120898604393005, "reward_std": 0.2458895482122898, "rewards/reward_accuracy/mean": 0.91328125, "rewards/reward_accuracy/std": 0.24242851212620736, "rewards/reward_format/mean": 0.09880859479308128, "rewards/reward_format/std": 0.008377623744308949, "sampling/importance_sampling_ratio/max": 2.57693190574646, "sampling/importance_sampling_ratio/mean": 0.9830444872379303, "sampling/importance_sampling_ratio/min": 0.08874360397458077, "sampling/sampling_logp_difference/max": 0.7989751875400544, "sampling/sampling_logp_difference/mean": 0.0058446109760552645, "step": 2350, "step_time": 9.206956293196708 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 1.734217039484065e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 1.734217039484065e-06, "completions/clipped_ratio": 0.0234375, "completions/max_length": 2048.0, "completions/max_terminated_length": 1707.3, "completions/mean_length": 237.8328125, "completions/mean_terminated_length": 194.77003784179686, "completions/min_length": 67.1, "completions/min_terminated_length": 67.1, "entropy": 0.10490963151678442, "epoch": 5.053533190578158, "frac_reward_zero_std": 0.75, "grad_norm": 0.2041015625, "learning_rate": 9.7641e-06, "loss": -0.0095, "num_tokens": 264894742.0, "reward": 0.9882812738418579, "reward_std": 0.30687628537416456, "rewards/reward_accuracy/mean": 0.890234375, "rewards/reward_accuracy/std": 0.30194777250289917, "rewards/reward_format/mean": 0.09804687649011612, "rewards/reward_format/std": 0.01186409555375576, "sampling/importance_sampling_ratio/max": 2.5093424797058104, "sampling/importance_sampling_ratio/mean": 0.9654182076454163, "sampling/importance_sampling_ratio/min": 0.025465759634971618, "sampling/sampling_logp_difference/max": 0.829421991109848, "sampling/sampling_logp_difference/mean": 0.005817542830482125, "step": 2360, "step_time": 9.975346906096092 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00859375, "completions/max_length": 1674.1, "completions/max_terminated_length": 1391.8, "completions/mean_length": 186.836328125, "completions/mean_terminated_length": 170.8824249267578, "completions/min_length": 68.5, "completions/min_terminated_length": 68.5, "entropy": 0.07341498509049416, "epoch": 5.074946466809422, "frac_reward_zero_std": 0.76875, "grad_norm": 0.8046875, "learning_rate": 9.763100000000001e-06, "loss": -0.0076, "num_tokens": 265897139.0, "reward": 1.0218164324760437, "reward_std": 0.2472201593220234, "rewards/reward_accuracy/mean": 0.92265625, "rewards/reward_accuracy/std": 0.24448850527405738, "rewards/reward_format/mean": 0.09916015863418579, "rewards/reward_format/std": 0.006549968058243394, "sampling/importance_sampling_ratio/max": 2.5292384147644045, "sampling/importance_sampling_ratio/mean": 0.9850484192371368, "sampling/importance_sampling_ratio/min": 0.13628658279776573, "sampling/sampling_logp_difference/max": 0.8645964980125427, "sampling/sampling_logp_difference/mean": 0.0049667911604046825, "step": 2370, "step_time": 8.252097694305121 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01171875, "completions/max_length": 1812.5, "completions/max_terminated_length": 1566.4, "completions/mean_length": 203.037890625, "completions/mean_terminated_length": 181.4959716796875, "completions/min_length": 68.4, "completions/min_terminated_length": 68.4, "entropy": 0.08049446353688836, "epoch": 5.0963597430406855, "frac_reward_zero_std": 0.78125, "grad_norm": 0.66015625, "learning_rate": 9.762100000000001e-06, "loss": -0.0068, "num_tokens": 266939556.0, "reward": 1.0097461104393006, "reward_std": 0.2701022580265999, "rewards/reward_accuracy/mean": 0.9109375, "rewards/reward_accuracy/std": 0.26634401082992554, "rewards/reward_format/mean": 0.09880859553813934, "rewards/reward_format/std": 0.008632312202826143, "sampling/importance_sampling_ratio/max": 2.4711153745651244, "sampling/importance_sampling_ratio/mean": 0.9794492781162262, "sampling/importance_sampling_ratio/min": 0.12542862631380558, "sampling/sampling_logp_difference/max": 1.0802495360374451, "sampling/sampling_logp_difference/mean": 0.005158733995631337, "step": 2380, "step_time": 8.870209813604015 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01171875, "completions/max_length": 1738.4, "completions/max_terminated_length": 1560.5, "completions/mean_length": 178.856640625, "completions/mean_terminated_length": 156.98442687988282, "completions/min_length": 65.0, "completions/min_terminated_length": 65.0, "entropy": 0.07556660398840905, "epoch": 5.117773019271949, "frac_reward_zero_std": 0.8125, "grad_norm": 0.72265625, "learning_rate": 9.7611e-06, "loss": -0.0034, "num_tokens": 267912485.0, "reward": 1.0250976800918579, "reward_std": 0.25202338993549345, "rewards/reward_accuracy/mean": 0.926171875, "rewards/reward_accuracy/std": 0.24872156977653503, "rewards/reward_format/mean": 0.09892578274011612, "rewards/reward_format/std": 0.0074863382149487736, "sampling/importance_sampling_ratio/max": 2.3229947090148926, "sampling/importance_sampling_ratio/mean": 0.9754414737224579, "sampling/importance_sampling_ratio/min": 0.08283874886110425, "sampling/sampling_logp_difference/max": 0.7435326516628266, "sampling/sampling_logp_difference/mean": 0.004891591868363321, "step": 2390, "step_time": 8.489010535994021 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0171875, "completions/max_length": 1854.9, "completions/max_terminated_length": 1604.2, "completions/mean_length": 218.796875, "completions/mean_terminated_length": 186.81197967529297, "completions/min_length": 73.1, "completions/min_terminated_length": 73.1, "entropy": 0.08994116135872901, "epoch": 5.139186295503212, "frac_reward_zero_std": 0.79375, "grad_norm": 0.69921875, "learning_rate": 9.760100000000002e-06, "loss": -0.0116, "num_tokens": 268994829.0, "reward": 0.9801172196865082, "reward_std": 0.31888658851385115, "rewards/reward_accuracy/mean": 0.881640625, "rewards/reward_accuracy/std": 0.3147380486130714, "rewards/reward_format/mean": 0.0984765648841858, "rewards/reward_format/std": 0.009579169959761203, "sampling/importance_sampling_ratio/max": 2.5444372653961183, "sampling/importance_sampling_ratio/mean": 0.9715263545513153, "sampling/importance_sampling_ratio/min": 0.034004293754696845, "sampling/sampling_logp_difference/max": 1.0891247034072875, "sampling/sampling_logp_difference/mean": 0.005226369202136994, "step": 2400, "step_time": 9.252903271499964 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01015625, "completions/max_length": 1661.9, "completions/max_terminated_length": 1378.8, "completions/mean_length": 189.33671875, "completions/mean_terminated_length": 170.64180221557618, "completions/min_length": 62.0, "completions/min_terminated_length": 62.0, "entropy": 0.07746629258617758, "epoch": 5.160599571734475, "frac_reward_zero_std": 0.775, "grad_norm": 0.67578125, "learning_rate": 9.759100000000001e-06, "loss": -0.0037, "num_tokens": 269994459.0, "reward": 1.036718761920929, "reward_std": 0.23912015706300735, "rewards/reward_accuracy/mean": 0.9375, "rewards/reward_accuracy/std": 0.2362138643860817, "rewards/reward_format/mean": 0.09921875149011612, "rewards/reward_format/std": 0.006156962853856385, "sampling/importance_sampling_ratio/max": 2.5651718378067017, "sampling/importance_sampling_ratio/mean": 0.9939302027225494, "sampling/importance_sampling_ratio/min": 0.059226608276367186, "sampling/sampling_logp_difference/max": 1.1034000098705292, "sampling/sampling_logp_difference/mean": 0.005150850210338831, "step": 2410, "step_time": 7.962631172503461 }, { "clip_ratio/high_max": 1.8124237431038637e-05, "clip_ratio/high_mean": 2.2655296788798297e-06, "clip_ratio/low_mean": 5.489421027959906e-07, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 2.8144717816758204e-06, "completions/clipped_ratio": 0.016796875, "completions/max_length": 2025.6, "completions/max_terminated_length": 1788.4, "completions/mean_length": 221.306640625, "completions/mean_terminated_length": 190.14471435546875, "completions/min_length": 66.1, "completions/min_terminated_length": 66.1, "entropy": 0.10178385940380394, "epoch": 5.182012847965739, "frac_reward_zero_std": 0.76875, "grad_norm": 0.33984375, "learning_rate": 9.7581e-06, "loss": -0.0157, "num_tokens": 271075580.0, "reward": 1.024589878320694, "reward_std": 0.25371187180280685, "rewards/reward_accuracy/mean": 0.926171875, "rewards/reward_accuracy/std": 0.24866309612989426, "rewards/reward_format/mean": 0.09841796979308129, "rewards/reward_format/std": 0.010078394832089544, "sampling/importance_sampling_ratio/max": 2.4059510469436645, "sampling/importance_sampling_ratio/mean": 0.9712713599205017, "sampling/importance_sampling_ratio/min": 0.016119415685534478, "sampling/sampling_logp_difference/max": 0.890647292137146, "sampling/sampling_logp_difference/mean": 0.005788197694346309, "step": 2420, "step_time": 10.001629790496372 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.009765625, "completions/max_length": 2019.8, "completions/max_terminated_length": 1664.2, "completions/mean_length": 203.0859375, "completions/mean_terminated_length": 185.02481842041016, "completions/min_length": 66.6, "completions/min_terminated_length": 66.6, "entropy": 0.08731190357357263, "epoch": 5.203426124197002, "frac_reward_zero_std": 0.7625, "grad_norm": 0.6015625, "learning_rate": 9.7571e-06, "loss": -0.0112, "num_tokens": 272111144.0, "reward": 1.0081250309944152, "reward_std": 0.281161405146122, "rewards/reward_accuracy/mean": 0.908984375, "rewards/reward_accuracy/std": 0.2782194584608078, "rewards/reward_format/mean": 0.09914062693715095, "rewards/reward_format/std": 0.006859813584014773, "sampling/importance_sampling_ratio/max": 2.562558650970459, "sampling/importance_sampling_ratio/mean": 0.9836407423019409, "sampling/importance_sampling_ratio/min": 0.031214351300150156, "sampling/sampling_logp_difference/max": 1.0334914565086364, "sampling/sampling_logp_difference/mean": 0.005232515605166554, "step": 2430, "step_time": 9.716919935515033 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.009765625, "completions/max_length": 1831.9, "completions/max_terminated_length": 1717.9, "completions/mean_length": 220.789453125, "completions/mean_terminated_length": 202.84822692871094, "completions/min_length": 67.6, "completions/min_terminated_length": 67.6, "entropy": 0.09161239392124117, "epoch": 5.224839400428266, "frac_reward_zero_std": 0.7375, "grad_norm": 0.36328125, "learning_rate": 9.756100000000001e-06, "loss": -0.0135, "num_tokens": 273193037.0, "reward": 0.9982031583786011, "reward_std": 0.29956541657447816, "rewards/reward_accuracy/mean": 0.89921875, "rewards/reward_accuracy/std": 0.29642422050237655, "rewards/reward_format/mean": 0.09898437708616256, "rewards/reward_format/std": 0.007902015093713998, "sampling/importance_sampling_ratio/max": 2.586853194236755, "sampling/importance_sampling_ratio/mean": 0.9729622006416321, "sampling/importance_sampling_ratio/min": 0.007696037739515304, "sampling/sampling_logp_difference/max": 0.6684958934783936, "sampling/sampling_logp_difference/mean": 0.005379791185259819, "step": 2440, "step_time": 9.038645101593284 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.019140625, "completions/max_length": 1929.3, "completions/max_terminated_length": 1809.6, "completions/mean_length": 235.753125, "completions/mean_terminated_length": 200.70538482666015, "completions/min_length": 60.9, "completions/min_terminated_length": 60.9, "entropy": 0.10268869888968765, "epoch": 5.2462526766595285, "frac_reward_zero_std": 0.7125, "grad_norm": 0.78125, "learning_rate": 9.7551e-06, "loss": -0.0214, "num_tokens": 274310101.0, "reward": 1.0176562666893005, "reward_std": 0.26576522141695025, "rewards/reward_accuracy/mean": 0.919140625, "rewards/reward_accuracy/std": 0.26149433106184006, "rewards/reward_format/mean": 0.09851562678813934, "rewards/reward_format/std": 0.009383460832759738, "sampling/importance_sampling_ratio/max": 2.696877181529999, "sampling/importance_sampling_ratio/mean": 0.9661023557186127, "sampling/importance_sampling_ratio/min": 0.04928179057314992, "sampling/sampling_logp_difference/max": 0.784824275970459, "sampling/sampling_logp_difference/mean": 0.005760889407247305, "step": 2450, "step_time": 9.757179019608884 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00703125, "completions/max_length": 1861.0, "completions/max_terminated_length": 1535.5, "completions/mean_length": 193.831640625, "completions/mean_terminated_length": 180.72005615234374, "completions/min_length": 63.8, "completions/min_terminated_length": 63.8, "entropy": 0.08586626178584993, "epoch": 5.267665952890792, "frac_reward_zero_std": 0.76875, "grad_norm": 0.8671875, "learning_rate": 9.7541e-06, "loss": -0.0006, "num_tokens": 275319142.0, "reward": 1.0215429782867431, "reward_std": 0.2600876346230507, "rewards/reward_accuracy/mean": 0.922265625, "rewards/reward_accuracy/std": 0.25781902521848676, "rewards/reward_format/mean": 0.0992773450911045, "rewards/reward_format/std": 0.006203658482991159, "sampling/importance_sampling_ratio/max": 2.628754186630249, "sampling/importance_sampling_ratio/mean": 0.977933156490326, "sampling/importance_sampling_ratio/min": 0.08611526265740395, "sampling/sampling_logp_difference/max": 0.7860185861587524, "sampling/sampling_logp_difference/mean": 0.005368784628808498, "step": 2460, "step_time": 8.843037704403105 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01640625, "completions/max_length": 1997.3, "completions/max_terminated_length": 1779.1, "completions/mean_length": 217.213671875, "completions/mean_terminated_length": 186.9976593017578, "completions/min_length": 68.6, "completions/min_terminated_length": 68.6, "entropy": 0.09083101893775165, "epoch": 5.289079229122056, "frac_reward_zero_std": 0.83125, "grad_norm": 0.3203125, "learning_rate": 9.753100000000002e-06, "loss": -0.0153, "num_tokens": 276382057.0, "reward": 1.025859385728836, "reward_std": 0.24636052548885345, "rewards/reward_accuracy/mean": 0.926953125, "rewards/reward_accuracy/std": 0.2429162457585335, "rewards/reward_format/mean": 0.09890625104308129, "rewards/reward_format/std": 0.007459221687167883, "sampling/importance_sampling_ratio/max": 2.4516578674316407, "sampling/importance_sampling_ratio/mean": 0.9716264307498932, "sampling/importance_sampling_ratio/min": 0.012272215075790882, "sampling/sampling_logp_difference/max": 1.0119676351547242, "sampling/sampling_logp_difference/mean": 0.005539378104731441, "step": 2470, "step_time": 9.71444490950089 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.017578125, "completions/max_length": 1900.3, "completions/max_terminated_length": 1678.3, "completions/mean_length": 232.312890625, "completions/mean_terminated_length": 199.92132110595702, "completions/min_length": 70.3, "completions/min_terminated_length": 70.3, "entropy": 0.0939020378049463, "epoch": 5.310492505353319, "frac_reward_zero_std": 0.70625, "grad_norm": 0.451171875, "learning_rate": 9.752100000000001e-06, "loss": -0.0141, "num_tokens": 277494714.0, "reward": 0.9915429770946502, "reward_std": 0.30746877044439314, "rewards/reward_accuracy/mean": 0.89296875, "rewards/reward_accuracy/std": 0.303583887219429, "rewards/reward_format/mean": 0.09857422187924385, "rewards/reward_format/std": 0.009549545357003808, "sampling/importance_sampling_ratio/max": 2.482248401641846, "sampling/importance_sampling_ratio/mean": 0.9851887583732605, "sampling/importance_sampling_ratio/min": 0.07260797461494803, "sampling/sampling_logp_difference/max": 0.8355430841445923, "sampling/sampling_logp_difference/mean": 0.005591252399608493, "step": 2480, "step_time": 9.207445373198425 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01015625, "completions/max_length": 1743.3, "completions/max_terminated_length": 1477.2, "completions/mean_length": 199.64140625, "completions/mean_terminated_length": 181.0130355834961, "completions/min_length": 63.4, "completions/min_terminated_length": 63.4, "entropy": 0.08241818873211741, "epoch": 5.331905781584583, "frac_reward_zero_std": 0.74375, "grad_norm": 0.93359375, "learning_rate": 9.7511e-06, "loss": -0.006, "num_tokens": 278519876.0, "reward": 1.0007421910762786, "reward_std": 0.27682340443134307, "rewards/reward_accuracy/mean": 0.9015625, "rewards/reward_accuracy/std": 0.2748535841703415, "rewards/reward_format/mean": 0.09917968958616256, "rewards/reward_format/std": 0.007045076694339514, "sampling/importance_sampling_ratio/max": 2.4420810103416444, "sampling/importance_sampling_ratio/mean": 0.9791848838329316, "sampling/importance_sampling_ratio/min": 0.08354321867227554, "sampling/sampling_logp_difference/max": 0.9599939584732056, "sampling/sampling_logp_difference/mean": 0.0053884989582002165, "step": 2490, "step_time": 8.539123188298253 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01875, "completions/max_length": 1789.6, "completions/max_terminated_length": 1651.2, "completions/mean_length": 234.3390625, "completions/mean_terminated_length": 200.1589096069336, "completions/min_length": 59.4, "completions/min_terminated_length": 59.4, "entropy": 0.10061342716217041, "epoch": 5.353319057815845, "frac_reward_zero_std": 0.7625, "grad_norm": 0.373046875, "learning_rate": 9.750100000000002e-06, "loss": -0.0028, "num_tokens": 279636760.0, "reward": 0.9637109875679016, "reward_std": 0.32122389078140257, "rewards/reward_accuracy/mean": 0.865625, "rewards/reward_accuracy/std": 0.3167167313396931, "rewards/reward_format/mean": 0.09808593988418579, "rewards/reward_format/std": 0.010564989317208529, "sampling/importance_sampling_ratio/max": 2.6712836742401125, "sampling/importance_sampling_ratio/mean": 0.9708147585391999, "sampling/importance_sampling_ratio/min": 0.046273660846054554, "sampling/sampling_logp_difference/max": 0.967151939868927, "sampling/sampling_logp_difference/mean": 0.0057549459859728815, "step": 2500, "step_time": 9.220528620909317 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00859375, "completions/max_length": 1842.8, "completions/max_terminated_length": 1625.2, "completions/mean_length": 194.065234375, "completions/mean_terminated_length": 178.38196868896483, "completions/min_length": 63.3, "completions/min_terminated_length": 63.3, "entropy": 0.08608636278659106, "epoch": 5.374732334047109, "frac_reward_zero_std": 0.76875, "grad_norm": 1.2109375, "learning_rate": 9.749100000000001e-06, "loss": -0.0079, "num_tokens": 280658111.0, "reward": 0.9937890827655792, "reward_std": 0.2948853522539139, "rewards/reward_accuracy/mean": 0.89453125, "rewards/reward_accuracy/std": 0.2929905757308006, "rewards/reward_format/mean": 0.09925781339406967, "rewards/reward_format/std": 0.005207822169177234, "sampling/importance_sampling_ratio/max": 2.5301826357841493, "sampling/importance_sampling_ratio/mean": 0.9795863926410675, "sampling/importance_sampling_ratio/min": 0.027811899781227112, "sampling/sampling_logp_difference/max": 0.8700558423995972, "sampling/sampling_logp_difference/mean": 0.005337479989975691, "step": 2510, "step_time": 8.902564639008778 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.009375, "completions/max_length": 1799.1, "completions/max_terminated_length": 1679.8, "completions/mean_length": 205.376171875, "completions/mean_terminated_length": 188.1674011230469, "completions/min_length": 66.2, "completions/min_terminated_length": 66.2, "entropy": 0.09191538309678435, "epoch": 5.3961456102783725, "frac_reward_zero_std": 0.75, "grad_norm": 0.4140625, "learning_rate": 9.7481e-06, "loss": -0.0119, "num_tokens": 281698178.0, "reward": 0.9920117497444153, "reward_std": 0.27080377042293546, "rewards/reward_accuracy/mean": 0.89296875, "rewards/reward_accuracy/std": 0.26855465918779375, "rewards/reward_format/mean": 0.09904297292232514, "rewards/reward_format/std": 0.006599341426044703, "sampling/importance_sampling_ratio/max": 2.5970534086227417, "sampling/importance_sampling_ratio/mean": 0.9854391098022461, "sampling/importance_sampling_ratio/min": 0.007531091384589672, "sampling/sampling_logp_difference/max": 0.834945660829544, "sampling/sampling_logp_difference/mean": 0.005591524625197053, "step": 2520, "step_time": 8.595116329092708 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00703125, "completions/max_length": 1735.9, "completions/max_terminated_length": 1637.9, "completions/mean_length": 187.39140625, "completions/mean_terminated_length": 174.3029022216797, "completions/min_length": 68.9, "completions/min_terminated_length": 68.9, "entropy": 0.0772474714089185, "epoch": 5.417558886509636, "frac_reward_zero_std": 0.79375, "grad_norm": 0.61328125, "learning_rate": 9.7471e-06, "loss": -0.0161, "num_tokens": 282694876.0, "reward": 1.0240429759025573, "reward_std": 0.251837544888258, "rewards/reward_accuracy/mean": 0.924609375, "rewards/reward_accuracy/std": 0.25009947791695597, "rewards/reward_format/mean": 0.09943359568715096, "rewards/reward_format/std": 0.00541020801756531, "sampling/importance_sampling_ratio/max": 2.475125956535339, "sampling/importance_sampling_ratio/mean": 0.9813670516014099, "sampling/importance_sampling_ratio/min": 0.054774162173271176, "sampling/sampling_logp_difference/max": 0.9002179741859436, "sampling/sampling_logp_difference/mean": 0.005192521540448069, "step": 2530, "step_time": 8.426920094103844 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00703125, "completions/max_length": 1651.1, "completions/max_terminated_length": 1570.6, "completions/mean_length": 230.132421875, "completions/mean_terminated_length": 217.63737030029296, "completions/min_length": 64.0, "completions/min_terminated_length": 64.0, "entropy": 0.10376953086815774, "epoch": 5.4389721627409, "frac_reward_zero_std": 0.70625, "grad_norm": 0.57421875, "learning_rate": 9.7461e-06, "loss": -0.0172, "num_tokens": 283801711.0, "reward": 0.9813867449760437, "reward_std": 0.301180063188076, "rewards/reward_accuracy/mean": 0.88203125, "rewards/reward_accuracy/std": 0.29986003786325455, "rewards/reward_format/mean": 0.09935546964406967, "rewards/reward_format/std": 0.0049929341301321985, "sampling/importance_sampling_ratio/max": 2.4947921514511107, "sampling/importance_sampling_ratio/mean": 0.9611072242259979, "sampling/importance_sampling_ratio/min": 0.018612132966518403, "sampling/sampling_logp_difference/max": 1.2309057414531708, "sampling/sampling_logp_difference/mean": 0.005937679437920451, "step": 2540, "step_time": 8.104182049307564 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.017578125, "completions/max_length": 2038.5, "completions/max_terminated_length": 1672.4, "completions/mean_length": 234.178515625, "completions/mean_terminated_length": 202.1281478881836, "completions/min_length": 64.5, "completions/min_terminated_length": 64.5, "entropy": 0.10917196283116937, "epoch": 5.460385438972163, "frac_reward_zero_std": 0.6875, "grad_norm": 0.87109375, "learning_rate": 9.745100000000001e-06, "loss": -0.0079, "num_tokens": 284924200.0, "reward": 0.9614257991313935, "reward_std": 0.33641075938940046, "rewards/reward_accuracy/mean": 0.862890625, "rewards/reward_accuracy/std": 0.33284653425216676, "rewards/reward_format/mean": 0.09853515774011612, "rewards/reward_format/std": 0.00988441458903253, "sampling/importance_sampling_ratio/max": 2.538672590255737, "sampling/importance_sampling_ratio/mean": 0.9728983044624329, "sampling/importance_sampling_ratio/min": 0.011781583679839969, "sampling/sampling_logp_difference/max": 0.810519564151764, "sampling/sampling_logp_difference/mean": 0.006139705702662468, "step": 2550, "step_time": 10.073733042093227 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0125, "completions/max_length": 1742.8, "completions/max_terminated_length": 1627.9, "completions/mean_length": 198.883203125, "completions/mean_terminated_length": 175.80145263671875, "completions/min_length": 63.0, "completions/min_terminated_length": 63.0, "entropy": 0.08599213841371238, "epoch": 5.481798715203426, "frac_reward_zero_std": 0.78125, "grad_norm": 0.7265625, "learning_rate": 9.7441e-06, "loss": -0.0072, "num_tokens": 285948461.0, "reward": 1.0166015684604646, "reward_std": 0.2464704230427742, "rewards/reward_accuracy/mean": 0.917578125, "rewards/reward_accuracy/std": 0.24380334466695786, "rewards/reward_format/mean": 0.0990234375, "rewards/reward_format/std": 0.006978190480731427, "sampling/importance_sampling_ratio/max": 2.541829991340637, "sampling/importance_sampling_ratio/mean": 0.9823161542415619, "sampling/importance_sampling_ratio/min": 0.13005999280139804, "sampling/sampling_logp_difference/max": 0.9425640225410461, "sampling/sampling_logp_difference/mean": 0.005421636952087283, "step": 2560, "step_time": 8.459235480193456 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.010546875, "completions/max_length": 1786.5, "completions/max_terminated_length": 1401.2, "completions/mean_length": 178.33984375, "completions/mean_terminated_length": 158.5232276916504, "completions/min_length": 65.2, "completions/min_terminated_length": 65.2, "entropy": 0.08022891581058503, "epoch": 5.503211991434689, "frac_reward_zero_std": 0.825, "grad_norm": 0.46875, "learning_rate": 9.743100000000002e-06, "loss": -0.0131, "num_tokens": 286920467.0, "reward": 1.0317578554153441, "reward_std": 0.2322593189775944, "rewards/reward_accuracy/mean": 0.9328125, "rewards/reward_accuracy/std": 0.22773384675383568, "rewards/reward_format/mean": 0.09894531369209289, "rewards/reward_format/std": 0.008071540668606759, "sampling/importance_sampling_ratio/max": 2.481596660614014, "sampling/importance_sampling_ratio/mean": 0.9842998325824738, "sampling/importance_sampling_ratio/min": 0.0459027617238462, "sampling/sampling_logp_difference/max": 0.9357318758964539, "sampling/sampling_logp_difference/mean": 0.00537831773981452, "step": 2570, "step_time": 8.46746215049934 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.012890625, "completions/max_length": 1957.7, "completions/max_terminated_length": 1653.3, "completions/mean_length": 216.055859375, "completions/mean_terminated_length": 192.2252990722656, "completions/min_length": 66.8, "completions/min_terminated_length": 66.8, "entropy": 0.09719385197386146, "epoch": 5.524625267665953, "frac_reward_zero_std": 0.725, "grad_norm": 0.51171875, "learning_rate": 9.742100000000001e-06, "loss": -0.0202, "num_tokens": 287995890.0, "reward": 0.9928125202655792, "reward_std": 0.3024392515420914, "rewards/reward_accuracy/mean": 0.89375, "rewards/reward_accuracy/std": 0.2997848495841026, "rewards/reward_format/mean": 0.09906250238418579, "rewards/reward_format/std": 0.007458717399276793, "sampling/importance_sampling_ratio/max": 2.536896014213562, "sampling/importance_sampling_ratio/mean": 0.9808107197284699, "sampling/importance_sampling_ratio/min": 0.025978675112128258, "sampling/sampling_logp_difference/max": 0.9401902914047241, "sampling/sampling_logp_difference/mean": 0.0058117176871746775, "step": 2580, "step_time": 9.604288336297031 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.009765625, "completions/max_length": 1812.6, "completions/max_terminated_length": 1656.2, "completions/mean_length": 203.5859375, "completions/mean_terminated_length": 185.5386505126953, "completions/min_length": 62.2, "completions/min_terminated_length": 62.2, "entropy": 0.0970848260447383, "epoch": 5.546038543897216, "frac_reward_zero_std": 0.725, "grad_norm": 1.484375, "learning_rate": 9.7411e-06, "loss": -0.0178, "num_tokens": 289037166.0, "reward": 0.9865234792232513, "reward_std": 0.3147984743118286, "rewards/reward_accuracy/mean": 0.8875, "rewards/reward_accuracy/std": 0.31200769543647766, "rewards/reward_format/mean": 0.09902343824505806, "rewards/reward_format/std": 0.0073063039453700185, "sampling/importance_sampling_ratio/max": 2.331999945640564, "sampling/importance_sampling_ratio/mean": 0.9674416601657867, "sampling/importance_sampling_ratio/min": 0.06343612056225538, "sampling/sampling_logp_difference/max": 0.7621833324432373, "sampling/sampling_logp_difference/mean": 0.005738088767975569, "step": 2590, "step_time": 8.791197411001486 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01640625, "completions/max_length": 2040.6, "completions/max_terminated_length": 1786.7, "completions/mean_length": 222.503125, "completions/mean_terminated_length": 192.2262390136719, "completions/min_length": 59.9, "completions/min_terminated_length": 59.9, "entropy": 0.09692373019643127, "epoch": 5.56745182012848, "frac_reward_zero_std": 0.69375, "grad_norm": 0.396484375, "learning_rate": 9.740100000000002e-06, "loss": -0.0128, "num_tokens": 290136438.0, "reward": 0.9710937798023224, "reward_std": 0.32278500497341156, "rewards/reward_accuracy/mean": 0.87265625, "rewards/reward_accuracy/std": 0.3186033122241497, "rewards/reward_format/mean": 0.0984375, "rewards/reward_format/std": 0.009687871881760656, "sampling/importance_sampling_ratio/max": 2.5795541048049926, "sampling/importance_sampling_ratio/mean": 0.9700413227081299, "sampling/importance_sampling_ratio/min": 0.03474186845123768, "sampling/sampling_logp_difference/max": 1.2038312673568725, "sampling/sampling_logp_difference/mean": 0.005521287745796144, "step": 2600, "step_time": 10.160681416199077 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.008984375, "completions/max_length": 1827.7, "completions/max_terminated_length": 1695.7, "completions/mean_length": 195.54453125, "completions/mean_terminated_length": 178.90796661376953, "completions/min_length": 65.9, "completions/min_terminated_length": 65.9, "entropy": 0.08741520689800382, "epoch": 5.5888650963597435, "frac_reward_zero_std": 0.775, "grad_norm": 0.70703125, "learning_rate": 9.739100000000001e-06, "loss": -0.0061, "num_tokens": 291153256.0, "reward": 1.0175781190395354, "reward_std": 0.26622320115566256, "rewards/reward_accuracy/mean": 0.918359375, "rewards/reward_accuracy/std": 0.2637049689888954, "rewards/reward_format/mean": 0.09921874925494194, "rewards/reward_format/std": 0.0058366016484797, "sampling/importance_sampling_ratio/max": 2.3926997900009157, "sampling/importance_sampling_ratio/mean": 0.9848893523216248, "sampling/importance_sampling_ratio/min": 0.03639995865523815, "sampling/sampling_logp_difference/max": 0.9070591747760772, "sampling/sampling_logp_difference/mean": 0.005209387792274356, "step": 2610, "step_time": 8.954066406497441 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0078125, "completions/max_length": 1853.8, "completions/max_terminated_length": 1588.2, "completions/mean_length": 187.43359375, "completions/mean_terminated_length": 172.84810485839844, "completions/min_length": 62.4, "completions/min_terminated_length": 62.4, "entropy": 0.08009823095053434, "epoch": 5.610278372591006, "frac_reward_zero_std": 0.76875, "grad_norm": 0.396484375, "learning_rate": 9.7381e-06, "loss": -0.0054, "num_tokens": 292151630.0, "reward": 0.9963086128234864, "reward_std": 0.26927749067544937, "rewards/reward_accuracy/mean": 0.896875, "rewards/reward_accuracy/std": 0.2675220414996147, "rewards/reward_format/mean": 0.09943359419703483, "rewards/reward_format/std": 0.005424888757988811, "sampling/importance_sampling_ratio/max": 2.4646893739700317, "sampling/importance_sampling_ratio/mean": 0.9980157017707825, "sampling/importance_sampling_ratio/min": 0.03820842653512955, "sampling/sampling_logp_difference/max": 1.2514472365379334, "sampling/sampling_logp_difference/mean": 0.004921606439165771, "step": 2620, "step_time": 9.07707772279682 }, { "clip_ratio/high_max": 1.8879036360885948e-05, "clip_ratio/high_mean": 2.3598795451107435e-06, "clip_ratio/low_mean": 9.786012924450915e-07, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 3.338480837555835e-06, "completions/clipped_ratio": 0.00625, "completions/max_length": 1823.9, "completions/max_terminated_length": 1741.0, "completions/mean_length": 216.0703125, "completions/mean_terminated_length": 204.51573791503907, "completions/min_length": 69.0, "completions/min_terminated_length": 69.0, "entropy": 0.0952657591085881, "epoch": 5.63169164882227, "frac_reward_zero_std": 0.70625, "grad_norm": 0.78125, "learning_rate": 9.7371e-06, "loss": -0.0139, "num_tokens": 293234562.0, "reward": 0.9615820586681366, "reward_std": 0.33059417456388474, "rewards/reward_accuracy/mean": 0.862109375, "rewards/reward_accuracy/std": 0.32923930436372756, "rewards/reward_format/mean": 0.0994726575911045, "rewards/reward_format/std": 0.004763867682777345, "sampling/importance_sampling_ratio/max": 2.6706831216812135, "sampling/importance_sampling_ratio/mean": 0.9762564897537231, "sampling/importance_sampling_ratio/min": 0.022373689617961646, "sampling/sampling_logp_difference/max": 0.9054080367088317, "sampling/sampling_logp_difference/mean": 0.005518699856474995, "step": 2630, "step_time": 8.82820610140043 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003515625, "completions/max_length": 1849.8, "completions/max_terminated_length": 1617.7, "completions/mean_length": 184.731640625, "completions/mean_terminated_length": 178.20914459228516, "completions/min_length": 58.5, "completions/min_terminated_length": 58.5, "entropy": 0.08519844254478812, "epoch": 5.653104925053533, "frac_reward_zero_std": 0.73125, "grad_norm": 0.89453125, "learning_rate": 9.7361e-06, "loss": -0.005, "num_tokens": 294225539.0, "reward": 1.0011132895946502, "reward_std": 0.2899130553007126, "rewards/reward_accuracy/mean": 0.9015625, "rewards/reward_accuracy/std": 0.2889107473194599, "rewards/reward_format/mean": 0.09955078288912773, "rewards/reward_format/std": 0.00413353533949703, "sampling/importance_sampling_ratio/max": 2.5385457992553713, "sampling/importance_sampling_ratio/mean": 0.9848312973976135, "sampling/importance_sampling_ratio/min": 0.09583455622196198, "sampling/sampling_logp_difference/max": 0.8406406939029694, "sampling/sampling_logp_difference/mean": 0.005368578666821122, "step": 2640, "step_time": 8.72892038791033 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.007421875, "completions/max_length": 1895.4, "completions/max_terminated_length": 1720.8, "completions/mean_length": 213.431640625, "completions/mean_terminated_length": 199.83561096191406, "completions/min_length": 68.6, "completions/min_terminated_length": 68.6, "entropy": 0.09950822219252586, "epoch": 5.674518201284797, "frac_reward_zero_std": 0.74375, "grad_norm": 0.4453125, "learning_rate": 9.735100000000001e-06, "loss": -0.0158, "num_tokens": 295290868.0, "reward": 1.008847677707672, "reward_std": 0.27433363199234007, "rewards/reward_accuracy/mean": 0.909765625, "rewards/reward_accuracy/std": 0.2721190631389618, "rewards/reward_format/mean": 0.09908203184604644, "rewards/reward_format/std": 0.006449411879293621, "sampling/importance_sampling_ratio/max": 2.4895023822784426, "sampling/importance_sampling_ratio/mean": 0.9796148240566254, "sampling/importance_sampling_ratio/min": 0.07677715606987476, "sampling/sampling_logp_difference/max": 0.9414615988731384, "sampling/sampling_logp_difference/mean": 0.005770316999405623, "step": 2650, "step_time": 9.045770299504511 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.009375, "completions/max_length": 1800.2, "completions/max_terminated_length": 1520.4, "completions/mean_length": 203.009375, "completions/mean_terminated_length": 185.83713073730468, "completions/min_length": 63.4, "completions/min_terminated_length": 63.4, "entropy": 0.09497263934463263, "epoch": 5.69593147751606, "frac_reward_zero_std": 0.7375, "grad_norm": 0.7734375, "learning_rate": 9.7341e-06, "loss": -0.0086, "num_tokens": 296320604.0, "reward": 1.0032422065734863, "reward_std": 0.28134241998195647, "rewards/reward_accuracy/mean": 0.90390625, "rewards/reward_accuracy/std": 0.2799342915415764, "rewards/reward_format/mean": 0.09933593943715095, "rewards/reward_format/std": 0.004984128312207759, "sampling/importance_sampling_ratio/max": 2.487820625305176, "sampling/importance_sampling_ratio/mean": 0.986012476682663, "sampling/importance_sampling_ratio/min": 0.0534177303314209, "sampling/sampling_logp_difference/max": 0.7051383316516876, "sampling/sampling_logp_difference/mean": 0.005373080633580685, "step": 2660, "step_time": 8.665925271392917 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0078125, "completions/max_length": 1866.5, "completions/max_terminated_length": 1603.4, "completions/mean_length": 190.236328125, "completions/mean_terminated_length": 175.64409332275392, "completions/min_length": 61.6, "completions/min_terminated_length": 61.6, "entropy": 0.08649002499878407, "epoch": 5.717344753747323, "frac_reward_zero_std": 0.76875, "grad_norm": 0.123046875, "learning_rate": 9.7331e-06, "loss": -0.0074, "num_tokens": 297323689.0, "reward": 1.0013281404972076, "reward_std": 0.2919479012489319, "rewards/reward_accuracy/mean": 0.901953125, "rewards/reward_accuracy/std": 0.2900006607174873, "rewards/reward_format/mean": 0.09937500134110451, "rewards/reward_format/std": 0.006024126685224474, "sampling/importance_sampling_ratio/max": 2.402226674556732, "sampling/importance_sampling_ratio/mean": 0.9743847072124481, "sampling/importance_sampling_ratio/min": 0.053485245816409586, "sampling/sampling_logp_difference/max": 1.3002052307128906, "sampling/sampling_logp_difference/mean": 0.005210312874987721, "step": 2670, "step_time": 8.995565101402462 }, { "clip_ratio/high_max": 4.4307541247690094e-05, "clip_ratio/high_mean": 5.538442655961262e-06, "clip_ratio/low_mean": 1.9073486328125e-07, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 5.729177519242512e-06, "completions/clipped_ratio": 0.0125, "completions/max_length": 1669.0, "completions/max_terminated_length": 1545.6, "completions/mean_length": 187.403515625, "completions/mean_terminated_length": 163.9881607055664, "completions/min_length": 63.7, "completions/min_terminated_length": 63.7, "entropy": 0.08572275168262422, "epoch": 5.7387580299785865, "frac_reward_zero_std": 0.79375, "grad_norm": 0.72265625, "learning_rate": 9.732100000000001e-06, "loss": -0.0059, "num_tokens": 298320706.0, "reward": 1.007207053899765, "reward_std": 0.27186974659562113, "rewards/reward_accuracy/mean": 0.908203125, "rewards/reward_accuracy/std": 0.26894130632281305, "rewards/reward_format/mean": 0.09900390654802323, "rewards/reward_format/std": 0.0076935971854254605, "sampling/importance_sampling_ratio/max": 2.6095290303230287, "sampling/importance_sampling_ratio/mean": 0.9823377013206482, "sampling/importance_sampling_ratio/min": 0.0978566437959671, "sampling/sampling_logp_difference/max": 0.9193890929222107, "sampling/sampling_logp_difference/mean": 0.0053225263021886345, "step": 2680, "step_time": 8.323083648098692 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01328125, "completions/max_length": 1952.6, "completions/max_terminated_length": 1756.3, "completions/mean_length": 219.91953125, "completions/mean_terminated_length": 195.5892364501953, "completions/min_length": 64.3, "completions/min_terminated_length": 64.3, "entropy": 0.10326898656785488, "epoch": 5.76017130620985, "frac_reward_zero_std": 0.73125, "grad_norm": 0.71484375, "learning_rate": 9.7311e-06, "loss": -0.01, "num_tokens": 299402900.0, "reward": 1.002207064628601, "reward_std": 0.2819762319326401, "rewards/reward_accuracy/mean": 0.903125, "rewards/reward_accuracy/std": 0.2792808972299099, "rewards/reward_format/mean": 0.09908203333616257, "rewards/reward_format/std": 0.007749258819967508, "sampling/importance_sampling_ratio/max": 2.406766891479492, "sampling/importance_sampling_ratio/mean": 0.9658811807632446, "sampling/importance_sampling_ratio/min": 0.015211740881204605, "sampling/sampling_logp_difference/max": 1.0349429905414582, "sampling/sampling_logp_difference/mean": 0.0058912438806146385, "step": 2690, "step_time": 9.630869079503464 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.009765625, "completions/max_length": 2016.1, "completions/max_terminated_length": 1741.7, "completions/mean_length": 215.04609375, "completions/mean_terminated_length": 197.0232955932617, "completions/min_length": 65.8, "completions/min_terminated_length": 65.8, "entropy": 0.10113042816519738, "epoch": 5.781584582441114, "frac_reward_zero_std": 0.7, "grad_norm": 0.71875, "learning_rate": 9.730100000000002e-06, "loss": -0.0137, "num_tokens": 300474906.0, "reward": 0.9857812762260437, "reward_std": 0.3068300724029541, "rewards/reward_accuracy/mean": 0.88671875, "rewards/reward_accuracy/std": 0.30419197082519533, "rewards/reward_format/mean": 0.09906250238418579, "rewards/reward_format/std": 0.007088403753004968, "sampling/importance_sampling_ratio/max": 2.531329846382141, "sampling/importance_sampling_ratio/mean": 0.9763480663299561, "sampling/importance_sampling_ratio/min": 0.06635606586933136, "sampling/sampling_logp_difference/max": 1.2299103140830994, "sampling/sampling_logp_difference/mean": 0.00579431070946157, "step": 2700, "step_time": 9.672197978314944 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 1.03170643797057e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 1.03170643797057e-06, "completions/clipped_ratio": 0.023046875, "completions/max_length": 1867.7, "completions/max_terminated_length": 1716.2, "completions/mean_length": 251.282421875, "completions/mean_terminated_length": 209.52586059570314, "completions/min_length": 65.8, "completions/min_terminated_length": 65.8, "entropy": 0.12002571318298579, "epoch": 5.802997858672377, "frac_reward_zero_std": 0.70625, "grad_norm": 0.7109375, "learning_rate": 9.729100000000001e-06, "loss": -0.0129, "num_tokens": 301636045.0, "reward": 0.9997265815734864, "reward_std": 0.28617083206772803, "rewards/reward_accuracy/mean": 0.9015625, "rewards/reward_accuracy/std": 0.2814148776233196, "rewards/reward_format/mean": 0.09816406518220902, "rewards/reward_format/std": 0.010173438489437104, "sampling/importance_sampling_ratio/max": 2.570566785335541, "sampling/importance_sampling_ratio/mean": 0.9685573756694794, "sampling/importance_sampling_ratio/min": 0.04660218954086304, "sampling/sampling_logp_difference/max": 1.058223044872284, "sampling/sampling_logp_difference/mean": 0.006257775123231113, "step": 2710, "step_time": 9.417109500998048 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 7.837616749384324e-07, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 7.837616749384324e-07, "completions/clipped_ratio": 0.019140625, "completions/max_length": 1812.9, "completions/max_terminated_length": 1788.1, "completions/mean_length": 240.292578125, "completions/mean_terminated_length": 205.55127563476563, "completions/min_length": 64.0, "completions/min_terminated_length": 64.0, "entropy": 0.10262494324706495, "epoch": 5.82441113490364, "frac_reward_zero_std": 0.7, "grad_norm": 0.43359375, "learning_rate": 9.728100000000001e-06, "loss": -0.024, "num_tokens": 302773402.0, "reward": 0.9881445527076721, "reward_std": 0.2955147482454777, "rewards/reward_accuracy/mean": 0.88984375, "rewards/reward_accuracy/std": 0.29142174795269965, "rewards/reward_format/mean": 0.0983007825911045, "rewards/reward_format/std": 0.009617170714773238, "sampling/importance_sampling_ratio/max": 2.3676090359687807, "sampling/importance_sampling_ratio/mean": 0.9669629454612731, "sampling/importance_sampling_ratio/min": 0.10330686569213868, "sampling/sampling_logp_difference/max": 1.0386144638061523, "sampling/sampling_logp_difference/mean": 0.005520481616258621, "step": 2720, "step_time": 9.353399847786932 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.006640625, "completions/max_length": 1908.3, "completions/max_terminated_length": 1668.9, "completions/mean_length": 194.985546875, "completions/mean_terminated_length": 182.74673461914062, "completions/min_length": 68.3, "completions/min_terminated_length": 68.3, "entropy": 0.08835489409975708, "epoch": 5.845824411134903, "frac_reward_zero_std": 0.75, "grad_norm": 0.68359375, "learning_rate": 9.7271e-06, "loss": -0.0016, "num_tokens": 303786709.0, "reward": 1.015703147649765, "reward_std": 0.259984889626503, "rewards/reward_accuracy/mean": 0.91640625, "rewards/reward_accuracy/std": 0.257868666946888, "rewards/reward_format/mean": 0.09929687604308128, "rewards/reward_format/std": 0.006227575219236314, "sampling/importance_sampling_ratio/max": 2.476009893417358, "sampling/importance_sampling_ratio/mean": 0.9803802669048309, "sampling/importance_sampling_ratio/min": 0.07707422468811273, "sampling/sampling_logp_difference/max": 0.9398271322250367, "sampling/sampling_logp_difference/mean": 0.005508575914427638, "step": 2730, "step_time": 9.026170331594766 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0125, "completions/max_length": 1727.2, "completions/max_terminated_length": 1570.0, "completions/mean_length": 218.164453125, "completions/mean_terminated_length": 195.6148880004883, "completions/min_length": 68.8, "completions/min_terminated_length": 68.8, "entropy": 0.08793371603824199, "epoch": 5.867237687366167, "frac_reward_zero_std": 0.7375, "grad_norm": 0.392578125, "learning_rate": 9.7261e-06, "loss": -0.0093, "num_tokens": 304865866.0, "reward": 0.9598633110523224, "reward_std": 0.3291732981801033, "rewards/reward_accuracy/mean": 0.8609375, "rewards/reward_accuracy/std": 0.3268049731850624, "rewards/reward_format/mean": 0.09892578274011612, "rewards/reward_format/std": 0.00729636000469327, "sampling/importance_sampling_ratio/max": 2.414112186431885, "sampling/importance_sampling_ratio/mean": 0.9755020320415497, "sampling/importance_sampling_ratio/min": 0.04084041332826018, "sampling/sampling_logp_difference/max": 0.8150185763835907, "sampling/sampling_logp_difference/mean": 0.005145572056062519, "step": 2740, "step_time": 8.501146585401148 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.008984375, "completions/max_length": 1703.5, "completions/max_terminated_length": 1552.7, "completions/mean_length": 195.409765625, "completions/mean_terminated_length": 178.952294921875, "completions/min_length": 64.8, "completions/min_terminated_length": 64.8, "entropy": 0.09043916640803218, "epoch": 5.8886509635974305, "frac_reward_zero_std": 0.7625, "grad_norm": 0.73046875, "learning_rate": 9.725100000000001e-06, "loss": -0.0068, "num_tokens": 305882851.0, "reward": 0.9727930128574371, "reward_std": 0.32007398158311845, "rewards/reward_accuracy/mean": 0.8734375, "rewards/reward_accuracy/std": 0.31838304102420806, "rewards/reward_format/mean": 0.09935547187924385, "rewards/reward_format/std": 0.005791616556234658, "sampling/importance_sampling_ratio/max": 2.4234368205070496, "sampling/importance_sampling_ratio/mean": 0.9769808411598205, "sampling/importance_sampling_ratio/min": 0.04629259556531906, "sampling/sampling_logp_difference/max": 0.9090433537960052, "sampling/sampling_logp_difference/mean": 0.0054946182761341335, "step": 2750, "step_time": 8.218995348390308 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003515625, "completions/max_length": 1359.0, "completions/max_terminated_length": 1044.5, "completions/mean_length": 157.68671875, "completions/mean_terminated_length": 151.06021270751953, "completions/min_length": 62.9, "completions/min_terminated_length": 62.9, "entropy": 0.06947674732655287, "epoch": 5.910064239828694, "frac_reward_zero_std": 0.81875, "grad_norm": 0.54296875, "learning_rate": 9.7241e-06, "loss": -0.0051, "num_tokens": 306795281.0, "reward": 1.0434570550918578, "reward_std": 0.20571643263101577, "rewards/reward_accuracy/mean": 0.94375, "rewards/reward_accuracy/std": 0.20445231422781945, "rewards/reward_format/mean": 0.09970703348517418, "rewards/reward_format/std": 0.0032039214624091984, "sampling/importance_sampling_ratio/max": 2.3015694499015806, "sampling/importance_sampling_ratio/mean": 0.9865372478961945, "sampling/importance_sampling_ratio/min": 0.1537468396127224, "sampling/sampling_logp_difference/max": 0.7713847041130066, "sampling/sampling_logp_difference/mean": 0.0049192477250471715, "step": 2760, "step_time": 6.571827376188594 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.009765625, "completions/max_length": 1866.6, "completions/max_terminated_length": 1579.6, "completions/mean_length": 209.9953125, "completions/mean_terminated_length": 191.96138763427734, "completions/min_length": 70.2, "completions/min_terminated_length": 70.2, "entropy": 0.08696014727465809, "epoch": 5.9314775160599575, "frac_reward_zero_std": 0.75625, "grad_norm": 0.609375, "learning_rate": 9.7231e-06, "loss": -0.011, "num_tokens": 307855045.0, "reward": 0.9837109565734863, "reward_std": 0.31193709671497344, "rewards/reward_accuracy/mean": 0.884765625, "rewards/reward_accuracy/std": 0.3091201469302177, "rewards/reward_format/mean": 0.09894531443715096, "rewards/reward_format/std": 0.00809910970274359, "sampling/importance_sampling_ratio/max": 2.5305423974990844, "sampling/importance_sampling_ratio/mean": 0.9768745005130768, "sampling/importance_sampling_ratio/min": 0.04695873968303203, "sampling/sampling_logp_difference/max": 0.8456750392913819, "sampling/sampling_logp_difference/mean": 0.005190486274659634, "step": 2770, "step_time": 9.275050118802756 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005078125, "completions/max_length": 1745.2, "completions/max_terminated_length": 1555.1, "completions/mean_length": 183.61953125, "completions/mean_terminated_length": 174.16790771484375, "completions/min_length": 63.9, "completions/min_terminated_length": 63.9, "entropy": 0.08099756077863277, "epoch": 5.95289079229122, "frac_reward_zero_std": 0.7875, "grad_norm": 0.37890625, "learning_rate": 9.722100000000001e-06, "loss": -0.012, "num_tokens": 308844311.0, "reward": 1.016992199420929, "reward_std": 0.25884916484355924, "rewards/reward_accuracy/mean": 0.917578125, "rewards/reward_accuracy/std": 0.25712950974702836, "rewards/reward_format/mean": 0.09941406399011612, "rewards/reward_format/std": 0.005844208225607872, "sampling/importance_sampling_ratio/max": 2.4151711106300353, "sampling/importance_sampling_ratio/mean": 0.9781522989273072, "sampling/importance_sampling_ratio/min": 0.06056961491703987, "sampling/sampling_logp_difference/max": 0.8325577259063721, "sampling/sampling_logp_difference/mean": 0.005159343779087067, "step": 2780, "step_time": 8.222840421898582 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0125, "completions/max_length": 1798.2, "completions/max_terminated_length": 1686.0, "completions/mean_length": 192.316796875, "completions/mean_terminated_length": 169.30235443115234, "completions/min_length": 62.6, "completions/min_terminated_length": 62.6, "entropy": 0.08877780083566904, "epoch": 5.974304068522484, "frac_reward_zero_std": 0.80625, "grad_norm": 0.7890625, "learning_rate": 9.7211e-06, "loss": -0.0144, "num_tokens": 309856498.0, "reward": 1.0087500274181367, "reward_std": 0.2585681900382042, "rewards/reward_accuracy/mean": 0.91015625, "rewards/reward_accuracy/std": 0.25492620915174485, "rewards/reward_format/mean": 0.09859374985098839, "rewards/reward_format/std": 0.007549750967882574, "sampling/importance_sampling_ratio/max": 2.4500788927078245, "sampling/importance_sampling_ratio/mean": 0.9811334669589996, "sampling/importance_sampling_ratio/min": 0.06761603087652475, "sampling/sampling_logp_difference/max": 1.2189803659915923, "sampling/sampling_logp_difference/mean": 0.005356675689108669, "step": 2790, "step_time": 8.811681783587847 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.009765625, "completions/max_length": 1663.3, "completions/max_terminated_length": 1564.5, "completions/mean_length": 192.715234375, "completions/mean_terminated_length": 174.90528869628906, "completions/min_length": 65.5, "completions/min_terminated_length": 65.5, "entropy": 0.08434950122609734, "epoch": 5.995717344753747, "frac_reward_zero_std": 0.7625, "grad_norm": 0.87109375, "learning_rate": 9.720100000000002e-06, "loss": -0.0107, "num_tokens": 310870073.0, "reward": 0.9884765684604645, "reward_std": 0.2944615542888641, "rewards/reward_accuracy/mean": 0.889453125, "rewards/reward_accuracy/std": 0.29229392409324645, "rewards/reward_format/mean": 0.09902343824505806, "rewards/reward_format/std": 0.006411656108684838, "sampling/importance_sampling_ratio/max": 2.519631505012512, "sampling/importance_sampling_ratio/mean": 0.9803213715553284, "sampling/importance_sampling_ratio/min": 0.07371208891272545, "sampling/sampling_logp_difference/max": 0.8021101295948029, "sampling/sampling_logp_difference/mean": 0.004965496808290481, "step": 2800, "step_time": 8.106259362892889 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00703125, "completions/max_length": 1834.8, "completions/max_terminated_length": 1687.3, "completions/mean_length": 193.93515625, "completions/mean_terminated_length": 180.9973937988281, "completions/min_length": 62.6, "completions/min_terminated_length": 62.6, "entropy": 0.08469535945914686, "epoch": 6.017130620985011, "frac_reward_zero_std": 0.75625, "grad_norm": 0.70703125, "learning_rate": 9.719100000000002e-06, "loss": -0.0029, "num_tokens": 311873075.0, "reward": 1.0174219012260437, "reward_std": 0.24946171492338182, "rewards/reward_accuracy/mean": 0.918359375, "rewards/reward_accuracy/std": 0.2466511346399784, "rewards/reward_format/mean": 0.09906250163912773, "rewards/reward_format/std": 0.007257556752301752, "sampling/importance_sampling_ratio/max": 2.4026358366012572, "sampling/importance_sampling_ratio/mean": 0.9755026876926423, "sampling/importance_sampling_ratio/min": 0.07956723347306252, "sampling/sampling_logp_difference/max": 0.7643571257591247, "sampling/sampling_logp_difference/mean": 0.0051665655337274075, "step": 2810, "step_time": 8.877127829896926 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00625, "completions/max_length": 1808.6, "completions/max_terminated_length": 1735.3, "completions/mean_length": 181.459765625, "completions/mean_terminated_length": 169.8672866821289, "completions/min_length": 61.2, "completions/min_terminated_length": 61.2, "entropy": 0.08132383790798485, "epoch": 6.038543897216274, "frac_reward_zero_std": 0.775, "grad_norm": 0.06787109375, "learning_rate": 9.718100000000001e-06, "loss": -0.008, "num_tokens": 312859148.0, "reward": 1.0190039277076721, "reward_std": 0.2510433577001095, "rewards/reward_accuracy/mean": 0.91953125, "rewards/reward_accuracy/std": 0.2495570458471775, "rewards/reward_format/mean": 0.0994726575911045, "rewards/reward_format/std": 0.00453657484613359, "sampling/importance_sampling_ratio/max": 2.4402728915214538, "sampling/importance_sampling_ratio/mean": 0.9837861478328704, "sampling/importance_sampling_ratio/min": 0.04190096118254587, "sampling/sampling_logp_difference/max": 0.8958397626876831, "sampling/sampling_logp_difference/mean": 0.005144820176064968, "step": 2820, "step_time": 8.582439180402435 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.007421875, "completions/max_length": 1641.9, "completions/max_terminated_length": 1557.4, "completions/mean_length": 213.02421875, "completions/mean_terminated_length": 199.55803985595702, "completions/min_length": 61.5, "completions/min_terminated_length": 61.5, "entropy": 0.09837138229049742, "epoch": 6.059957173447537, "frac_reward_zero_std": 0.76875, "grad_norm": 0.47265625, "learning_rate": 9.7171e-06, "loss": -0.0078, "num_tokens": 313923338.0, "reward": 0.9683789193630219, "reward_std": 0.32717630118131635, "rewards/reward_accuracy/mean": 0.869140625, "rewards/reward_accuracy/std": 0.3253849372267723, "rewards/reward_format/mean": 0.0992382824420929, "rewards/reward_format/std": 0.0062909832457080485, "sampling/importance_sampling_ratio/max": 2.5425549745559692, "sampling/importance_sampling_ratio/mean": 0.9610412538051605, "sampling/importance_sampling_ratio/min": 0.11924933649133891, "sampling/sampling_logp_difference/max": 1.4009202480316163, "sampling/sampling_logp_difference/mean": 0.00554663366638124, "step": 2830, "step_time": 8.173756646901893 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.006640625, "completions/max_length": 1633.6, "completions/max_terminated_length": 1390.8, "completions/mean_length": 177.324609375, "completions/mean_terminated_length": 165.00167846679688, "completions/min_length": 65.5, "completions/min_terminated_length": 65.5, "entropy": 0.08392819142900407, "epoch": 6.081370449678801, "frac_reward_zero_std": 0.775, "grad_norm": 0.55078125, "learning_rate": 9.7161e-06, "loss": -0.0111, "num_tokens": 314898073.0, "reward": 1.0330273509025574, "reward_std": 0.2332446202635765, "rewards/reward_accuracy/mean": 0.93359375, "rewards/reward_accuracy/std": 0.2316140852868557, "rewards/reward_format/mean": 0.09943359494209289, "rewards/reward_format/std": 0.005274359998293221, "sampling/importance_sampling_ratio/max": 2.3659435749053954, "sampling/importance_sampling_ratio/mean": 0.98558389544487, "sampling/importance_sampling_ratio/min": 0.10866836793720722, "sampling/sampling_logp_difference/max": 0.844302749633789, "sampling/sampling_logp_difference/mean": 0.005217300402000547, "step": 2840, "step_time": 7.812624462896201 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00546875, "completions/max_length": 1748.1, "completions/max_terminated_length": 1522.7, "completions/mean_length": 204.7, "completions/mean_terminated_length": 194.7762222290039, "completions/min_length": 57.3, "completions/min_terminated_length": 57.3, "entropy": 0.09565845178440213, "epoch": 6.102783725910064, "frac_reward_zero_std": 0.74375, "grad_norm": 1.1796875, "learning_rate": 9.715100000000001e-06, "loss": -0.0083, "num_tokens": 315939609.0, "reward": 0.9803320407867432, "reward_std": 0.3016253627836704, "rewards/reward_accuracy/mean": 0.880859375, "rewards/reward_accuracy/std": 0.30036829635500906, "rewards/reward_format/mean": 0.09947265833616256, "rewards/reward_format/std": 0.004322804836556315, "sampling/importance_sampling_ratio/max": 2.5534946441650392, "sampling/importance_sampling_ratio/mean": 0.9864677965641022, "sampling/importance_sampling_ratio/min": 0.04280326273292303, "sampling/sampling_logp_difference/max": 0.9367522120475769, "sampling/sampling_logp_difference/mean": 0.005777119705453515, "step": 2850, "step_time": 8.316417366095994 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.008984375, "completions/max_length": 1944.2, "completions/max_terminated_length": 1673.7, "completions/mean_length": 187.924609375, "completions/mean_terminated_length": 171.13390045166017, "completions/min_length": 60.4, "completions/min_terminated_length": 60.4, "entropy": 0.07917395369149745, "epoch": 6.124197002141328, "frac_reward_zero_std": 0.7875, "grad_norm": 0.462890625, "learning_rate": 9.7141e-06, "loss": -0.0022, "num_tokens": 316939160.0, "reward": 1.001015657186508, "reward_std": 0.2793421074748039, "rewards/reward_accuracy/mean": 0.901953125, "rewards/reward_accuracy/std": 0.2762113086879253, "rewards/reward_format/mean": 0.09906250238418579, "rewards/reward_format/std": 0.00790701995138079, "sampling/importance_sampling_ratio/max": 2.375487267971039, "sampling/importance_sampling_ratio/mean": 0.9812010228633881, "sampling/importance_sampling_ratio/min": 0.03912873230874538, "sampling/sampling_logp_difference/max": 0.9409559965133667, "sampling/sampling_logp_difference/mean": 0.005175716662779451, "step": 2860, "step_time": 9.544180748506914 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.006640625, "completions/max_length": 1604.0, "completions/max_terminated_length": 1401.4, "completions/mean_length": 182.90546875, "completions/mean_terminated_length": 170.67046051025392, "completions/min_length": 67.0, "completions/min_terminated_length": 67.0, "entropy": 0.07293032291345299, "epoch": 6.145610278372591, "frac_reward_zero_std": 0.79375, "grad_norm": 0.81640625, "learning_rate": 9.7131e-06, "loss": -0.0148, "num_tokens": 317926134.0, "reward": 1.0264258086681366, "reward_std": 0.24464576467871665, "rewards/reward_accuracy/mean": 0.926953125, "rewards/reward_accuracy/std": 0.2431375078856945, "rewards/reward_format/mean": 0.09947265684604645, "rewards/reward_format/std": 0.00447225826792419, "sampling/importance_sampling_ratio/max": 2.5396528601646424, "sampling/importance_sampling_ratio/mean": 0.9869556546211242, "sampling/importance_sampling_ratio/min": 0.08076556604355574, "sampling/sampling_logp_difference/max": 0.9132850289344787, "sampling/sampling_logp_difference/mean": 0.004976247111335397, "step": 2870, "step_time": 7.741150473000016 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01328125, "completions/max_length": 1739.0, "completions/max_terminated_length": 1472.1, "completions/mean_length": 209.85625, "completions/mean_terminated_length": 185.4837173461914, "completions/min_length": 64.6, "completions/min_terminated_length": 64.6, "entropy": 0.08566556633450091, "epoch": 6.167023554603855, "frac_reward_zero_std": 0.75, "grad_norm": 0.54296875, "learning_rate": 9.712100000000001e-06, "loss": -0.0099, "num_tokens": 318979862.0, "reward": 1.0006054937839508, "reward_std": 0.28439008742570876, "rewards/reward_accuracy/mean": 0.901953125, "rewards/reward_accuracy/std": 0.28094432428479194, "rewards/reward_format/mean": 0.09865234568715095, "rewards/reward_format/std": 0.008550265408121049, "sampling/importance_sampling_ratio/max": 2.4533551692962647, "sampling/importance_sampling_ratio/mean": 0.9640462517738342, "sampling/importance_sampling_ratio/min": 0.07870101481676102, "sampling/sampling_logp_difference/max": 0.7765165030956268, "sampling/sampling_logp_difference/mean": 0.005422390857711434, "step": 2880, "step_time": 8.611016338219633 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0078125, "completions/max_length": 1597.2, "completions/max_terminated_length": 1446.7, "completions/mean_length": 189.14453125, "completions/mean_terminated_length": 174.87323303222655, "completions/min_length": 66.7, "completions/min_terminated_length": 66.7, "entropy": 0.08006200878880917, "epoch": 6.188436830835117, "frac_reward_zero_std": 0.78125, "grad_norm": 0.890625, "learning_rate": 9.711100000000001e-06, "loss": -0.0048, "num_tokens": 319981080.0, "reward": 1.0042187690734863, "reward_std": 0.25231693089008334, "rewards/reward_accuracy/mean": 0.905078125, "rewards/reward_accuracy/std": 0.24947656393051149, "rewards/reward_format/mean": 0.09914062693715095, "rewards/reward_format/std": 0.006457022577524185, "sampling/importance_sampling_ratio/max": 2.6148224592208864, "sampling/importance_sampling_ratio/mean": 0.9867306351661682, "sampling/importance_sampling_ratio/min": 0.13530258983373641, "sampling/sampling_logp_difference/max": 0.8425407409667969, "sampling/sampling_logp_difference/mean": 0.005149518372491002, "step": 2890, "step_time": 7.907115257205442 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00625, "completions/max_length": 1373.1, "completions/max_terminated_length": 1004.6, "completions/mean_length": 152.514453125, "completions/mean_terminated_length": 140.68526611328124, "completions/min_length": 55.2, "completions/min_terminated_length": 55.2, "entropy": 0.06390191437676548, "epoch": 6.209850107066381, "frac_reward_zero_std": 0.825, "grad_norm": 0.5234375, "learning_rate": 9.7101e-06, "loss": -0.0127, "num_tokens": 320880957.0, "reward": 1.0264648795127869, "reward_std": 0.23420288786292076, "rewards/reward_accuracy/mean": 0.926953125, "rewards/reward_accuracy/std": 0.23207721412181853, "rewards/reward_format/mean": 0.09951172173023223, "rewards/reward_format/std": 0.00462527978233993, "sampling/importance_sampling_ratio/max": 2.2833163380622863, "sampling/importance_sampling_ratio/mean": 0.9863367676734924, "sampling/importance_sampling_ratio/min": 0.14230578243732453, "sampling/sampling_logp_difference/max": 0.8183417081832886, "sampling/sampling_logp_difference/mean": 0.004521972872316838, "step": 2900, "step_time": 6.507547196708037 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0015625, "completions/max_length": 1479.8, "completions/max_terminated_length": 1272.3, "completions/mean_length": 155.79296875, "completions/mean_terminated_length": 152.84945373535157, "completions/min_length": 65.7, "completions/min_terminated_length": 65.7, "entropy": 0.05815265798009932, "epoch": 6.2312633832976445, "frac_reward_zero_std": 0.8625, "grad_norm": 0.0, "learning_rate": 9.709100000000002e-06, "loss": -0.0045, "num_tokens": 321794699.0, "reward": 1.0247851729393005, "reward_std": 0.24337691366672515, "rewards/reward_accuracy/mean": 0.925, "rewards/reward_accuracy/std": 0.24256463199853898, "rewards/reward_format/mean": 0.09978515729308128, "rewards/reward_format/std": 0.0029578487621620296, "sampling/importance_sampling_ratio/max": 2.4710018396377564, "sampling/importance_sampling_ratio/mean": 0.9838850796222687, "sampling/importance_sampling_ratio/min": 0.15216172039508818, "sampling/sampling_logp_difference/max": 0.7596921563148499, "sampling/sampling_logp_difference/mean": 0.004359424510039389, "step": 2910, "step_time": 6.802091320615728 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00625, "completions/max_length": 1844.0, "completions/max_terminated_length": 1532.5, "completions/mean_length": 180.869140625, "completions/mean_terminated_length": 169.2870216369629, "completions/min_length": 63.6, "completions/min_terminated_length": 63.6, "entropy": 0.07443553642369807, "epoch": 6.252676659528908, "frac_reward_zero_std": 0.74375, "grad_norm": 0.7890625, "learning_rate": 9.708100000000001e-06, "loss": -0.0133, "num_tokens": 322774588.0, "reward": 1.0275586128234864, "reward_std": 0.24266312494874, "rewards/reward_accuracy/mean": 0.928125, "rewards/reward_accuracy/std": 0.24101745262742041, "rewards/reward_format/mean": 0.09943359494209289, "rewards/reward_format/std": 0.005463109281845391, "sampling/importance_sampling_ratio/max": 2.4061485886573792, "sampling/importance_sampling_ratio/mean": 0.9812325358390808, "sampling/importance_sampling_ratio/min": 0.09277808256447315, "sampling/sampling_logp_difference/max": 1.0490819275379182, "sampling/sampling_logp_difference/mean": 0.005190055258572102, "step": 2920, "step_time": 8.71310290740512 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.008984375, "completions/max_length": 1803.4, "completions/max_terminated_length": 1599.4, "completions/mean_length": 187.85859375, "completions/mean_terminated_length": 171.11573333740233, "completions/min_length": 67.7, "completions/min_terminated_length": 67.7, "entropy": 0.0742429334204644, "epoch": 6.274089935760172, "frac_reward_zero_std": 0.75625, "grad_norm": 1.5234375, "learning_rate": 9.7071e-06, "loss": -0.0018, "num_tokens": 323773858.0, "reward": 1.0065820693969727, "reward_std": 0.27818734645843507, "rewards/reward_accuracy/mean": 0.907421875, "rewards/reward_accuracy/std": 0.27565071284770964, "rewards/reward_format/mean": 0.09916015863418579, "rewards/reward_format/std": 0.007220290461555123, "sampling/importance_sampling_ratio/max": 2.4064992547035216, "sampling/importance_sampling_ratio/mean": 0.980472457408905, "sampling/importance_sampling_ratio/min": 0.054949017614126204, "sampling/sampling_logp_difference/max": 0.9583322882652283, "sampling/sampling_logp_difference/mean": 0.005061580706387759, "step": 2930, "step_time": 8.79097437429009 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003515625, "completions/max_length": 1701.4, "completions/max_terminated_length": 1560.3, "completions/mean_length": 163.431640625, "completions/mean_terminated_length": 156.84091491699218, "completions/min_length": 59.9, "completions/min_terminated_length": 59.9, "entropy": 0.0680591200478375, "epoch": 6.295503211991434, "frac_reward_zero_std": 0.76875, "grad_norm": 0.890625, "learning_rate": 9.7061e-06, "loss": -0.0101, "num_tokens": 324708019.0, "reward": 0.990703147649765, "reward_std": 0.2950423561036587, "rewards/reward_accuracy/mean": 0.891015625, "rewards/reward_accuracy/std": 0.29423649683594705, "rewards/reward_format/mean": 0.09968750104308129, "rewards/reward_format/std": 0.0032330699265003203, "sampling/importance_sampling_ratio/max": 2.635078287124634, "sampling/importance_sampling_ratio/mean": 0.9879704535007476, "sampling/importance_sampling_ratio/min": 0.026023026555776596, "sampling/sampling_logp_difference/max": 1.0884467720985413, "sampling/sampling_logp_difference/mean": 0.004854377172887325, "step": 2940, "step_time": 7.966005238998332 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 1555.4, "completions/max_terminated_length": 1441.6, "completions/mean_length": 165.410546875, "completions/mean_terminated_length": 158.0642883300781, "completions/min_length": 65.0, "completions/min_terminated_length": 65.0, "entropy": 0.07013265891000628, "epoch": 6.316916488222698, "frac_reward_zero_std": 0.79375, "grad_norm": 0.75, "learning_rate": 9.705100000000001e-06, "loss": -0.0062, "num_tokens": 325652686.0, "reward": 0.9859570384025573, "reward_std": 0.28762586787343025, "rewards/reward_accuracy/mean": 0.886328125, "rewards/reward_accuracy/std": 0.28666806742548945, "rewards/reward_format/mean": 0.09962890669703484, "rewards/reward_format/std": 0.0034726751036942005, "sampling/importance_sampling_ratio/max": 2.3087040185928345, "sampling/importance_sampling_ratio/mean": 0.9747376322746277, "sampling/importance_sampling_ratio/min": 0.09114499660208822, "sampling/sampling_logp_difference/max": 0.8506425559520722, "sampling/sampling_logp_difference/mean": 0.004774629254825413, "step": 2950, "step_time": 7.421245013811858 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00234375, "completions/max_length": 1554.0, "completions/max_terminated_length": 1414.7, "completions/mean_length": 148.88984375, "completions/mean_terminated_length": 144.52186737060546, "completions/min_length": 60.5, "completions/min_terminated_length": 60.5, "entropy": 0.05822511436417699, "epoch": 6.338329764453961, "frac_reward_zero_std": 0.83125, "grad_norm": 0.466796875, "learning_rate": 9.7041e-06, "loss": 0.0015, "num_tokens": 326544660.0, "reward": 1.0426172077655793, "reward_std": 0.2144518956542015, "rewards/reward_accuracy/mean": 0.94296875, "rewards/reward_accuracy/std": 0.2133030079305172, "rewards/reward_format/mean": 0.09964843839406967, "rewards/reward_format/std": 0.003822240373119712, "sampling/importance_sampling_ratio/max": 2.303489649295807, "sampling/importance_sampling_ratio/mean": 0.9875134408473969, "sampling/importance_sampling_ratio/min": 0.14711330011487006, "sampling/sampling_logp_difference/max": 0.8540403485298157, "sampling/sampling_logp_difference/mean": 0.004248792352154851, "step": 2960, "step_time": 7.485026683611795 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 1.9793239971477306e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 1.9793239971477306e-06, "completions/clipped_ratio": 0.01484375, "completions/max_length": 1838.0, "completions/max_terminated_length": 1650.8, "completions/mean_length": 196.85, "completions/mean_terminated_length": 169.31371307373047, "completions/min_length": 65.2, "completions/min_terminated_length": 65.2, "entropy": 0.07458760528825223, "epoch": 6.359743040685225, "frac_reward_zero_std": 0.7875, "grad_norm": 0.6875, "learning_rate": 9.7031e-06, "loss": -0.0137, "num_tokens": 327564388.0, "reward": 1.0200976490974427, "reward_std": 0.25111438408493997, "rewards/reward_accuracy/mean": 0.921484375, "rewards/reward_accuracy/std": 0.24667379781603813, "rewards/reward_format/mean": 0.09861328154802322, "rewards/reward_format/std": 0.008897851081565022, "sampling/importance_sampling_ratio/max": 2.490711498260498, "sampling/importance_sampling_ratio/mean": 0.9751293063163757, "sampling/importance_sampling_ratio/min": 0.04483420643955469, "sampling/sampling_logp_difference/max": 0.9607542872428894, "sampling/sampling_logp_difference/mean": 0.004911428806371987, "step": 2970, "step_time": 8.968189283492393 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.010546875, "completions/max_length": 1960.7, "completions/max_terminated_length": 1848.4, "completions/mean_length": 197.5734375, "completions/mean_terminated_length": 178.0616683959961, "completions/min_length": 62.9, "completions/min_terminated_length": 62.9, "entropy": 0.08403340424410999, "epoch": 6.381156316916488, "frac_reward_zero_std": 0.725, "grad_norm": 1.84375, "learning_rate": 9.702100000000002e-06, "loss": -0.0115, "num_tokens": 328583584.0, "reward": 1.0063281416893006, "reward_std": 0.286511567234993, "rewards/reward_accuracy/mean": 0.907421875, "rewards/reward_accuracy/std": 0.2834507778286934, "rewards/reward_format/mean": 0.09890625029802322, "rewards/reward_format/std": 0.008147276123054326, "sampling/importance_sampling_ratio/max": 2.4569594144821165, "sampling/importance_sampling_ratio/mean": 0.9629213154315949, "sampling/importance_sampling_ratio/min": 0.03459551110863686, "sampling/sampling_logp_difference/max": 0.9969267010688782, "sampling/sampling_logp_difference/mean": 0.005302185844630003, "step": 2980, "step_time": 9.39562290631584 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01796875, "completions/max_length": 1995.5, "completions/max_terminated_length": 1882.4, "completions/mean_length": 239.340625, "completions/mean_terminated_length": 206.79752502441406, "completions/min_length": 67.0, "completions/min_terminated_length": 67.0, "entropy": 0.10217743702232837, "epoch": 6.402569593147752, "frac_reward_zero_std": 0.75, "grad_norm": 0.478515625, "learning_rate": 9.701100000000001e-06, "loss": -0.0164, "num_tokens": 329722888.0, "reward": 0.994218772649765, "reward_std": 0.298141747713089, "rewards/reward_accuracy/mean": 0.895703125, "rewards/reward_accuracy/std": 0.2941926643252373, "rewards/reward_format/mean": 0.09851562678813934, "rewards/reward_format/std": 0.00954983641859144, "sampling/importance_sampling_ratio/max": 2.5234766483306883, "sampling/importance_sampling_ratio/mean": 0.9720681130886077, "sampling/importance_sampling_ratio/min": 0.022490698099136352, "sampling/sampling_logp_difference/max": 0.8730542182922363, "sampling/sampling_logp_difference/mean": 0.005790887866169214, "step": 2990, "step_time": 9.970470889186254 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.004296875, "completions/max_length": 1504.2, "completions/max_terminated_length": 1445.2, "completions/mean_length": 196.75859375, "completions/mean_terminated_length": 188.97215576171874, "completions/min_length": 68.4, "completions/min_terminated_length": 68.4, "entropy": 0.09050248186104, "epoch": 6.423982869379015, "frac_reward_zero_std": 0.71875, "grad_norm": 0.578125, "learning_rate": 9.7001e-06, "loss": -0.0224, "num_tokens": 330753470.0, "reward": 0.9678320527076721, "reward_std": 0.32038550525903703, "rewards/reward_accuracy/mean": 0.868359375, "rewards/reward_accuracy/std": 0.31878711432218554, "rewards/reward_format/mean": 0.09947265610098839, "rewards/reward_format/std": 0.00418031383305788, "sampling/importance_sampling_ratio/max": 2.596120834350586, "sampling/importance_sampling_ratio/mean": 0.9887279629707336, "sampling/importance_sampling_ratio/min": 0.060295954905450345, "sampling/sampling_logp_difference/max": 0.8850611329078675, "sampling/sampling_logp_difference/mean": 0.005638339137658477, "step": 3000, "step_time": 7.265991330219549 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0140625, "completions/max_length": 1736.2, "completions/max_terminated_length": 1460.2, "completions/mean_length": 192.71484375, "completions/mean_terminated_length": 166.4945281982422, "completions/min_length": 60.7, "completions/min_terminated_length": 60.7, "entropy": 0.07343888743780554, "epoch": 6.445396145610278, "frac_reward_zero_std": 0.81875, "grad_norm": 0.21875, "learning_rate": 9.699100000000002e-06, "loss": -0.0109, "num_tokens": 331759156.0, "reward": 1.0109961032867432, "reward_std": 0.2530812010169029, "rewards/reward_accuracy/mean": 0.9125, "rewards/reward_accuracy/std": 0.24813972562551498, "rewards/reward_format/mean": 0.09849609434604645, "rewards/reward_format/std": 0.008494574017822743, "sampling/importance_sampling_ratio/max": 2.445754110813141, "sampling/importance_sampling_ratio/mean": 0.9739968419075012, "sampling/importance_sampling_ratio/min": 0.09460986964404583, "sampling/sampling_logp_difference/max": 0.9294371247291565, "sampling/sampling_logp_difference/mean": 0.004835169878788292, "step": 3010, "step_time": 8.698457111275639 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.010546875, "completions/max_length": 1914.1, "completions/max_terminated_length": 1642.4, "completions/mean_length": 194.325, "completions/mean_terminated_length": 174.83358154296874, "completions/min_length": 61.4, "completions/min_terminated_length": 61.4, "entropy": 0.0837082595564425, "epoch": 6.466809421841542, "frac_reward_zero_std": 0.7625, "grad_norm": 0.173828125, "learning_rate": 9.6981e-06, "loss": -0.0201, "num_tokens": 332773396.0, "reward": 0.9994726777076721, "reward_std": 0.28643409088253974, "rewards/reward_accuracy/mean": 0.900390625, "rewards/reward_accuracy/std": 0.2839830331504345, "rewards/reward_format/mean": 0.09908203333616257, "rewards/reward_format/std": 0.007544842944480479, "sampling/importance_sampling_ratio/max": 2.4898292422294617, "sampling/importance_sampling_ratio/mean": 0.9775644421577454, "sampling/importance_sampling_ratio/min": 0.02321482765255496, "sampling/sampling_logp_difference/max": 0.8514321446418762, "sampling/sampling_logp_difference/mean": 0.0053217492531985044, "step": 3020, "step_time": 9.349783220994869 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.009375, "completions/max_length": 1861.7, "completions/max_terminated_length": 1694.7, "completions/mean_length": 210.097265625, "completions/mean_terminated_length": 192.8225830078125, "completions/min_length": 64.8, "completions/min_terminated_length": 64.8, "entropy": 0.0899203833192587, "epoch": 6.488222698072805, "frac_reward_zero_std": 0.7375, "grad_norm": 0.466796875, "learning_rate": 9.6971e-06, "loss": -0.0254, "num_tokens": 333836381.0, "reward": 1.0033398568630219, "reward_std": 0.2838347464799881, "rewards/reward_accuracy/mean": 0.904296875, "rewards/reward_accuracy/std": 0.2810639962553978, "rewards/reward_format/mean": 0.09904296919703484, "rewards/reward_format/std": 0.006924034608528018, "sampling/importance_sampling_ratio/max": 2.5449090719223024, "sampling/importance_sampling_ratio/mean": 0.9663503706455231, "sampling/importance_sampling_ratio/min": 0.02115823272615671, "sampling/sampling_logp_difference/max": 0.9759299516677856, "sampling/sampling_logp_difference/mean": 0.005464952532202005, "step": 3030, "step_time": 9.20126622171665 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.009375, "completions/max_length": 1666.7, "completions/max_terminated_length": 1589.1, "completions/mean_length": 196.3015625, "completions/mean_terminated_length": 179.06285400390624, "completions/min_length": 65.4, "completions/min_terminated_length": 65.4, "entropy": 0.0845637183636427, "epoch": 6.509635974304069, "frac_reward_zero_std": 0.8, "grad_norm": 0.59375, "learning_rate": 9.6961e-06, "loss": -0.0052, "num_tokens": 334853377.0, "reward": 1.0176758229732514, "reward_std": 0.2387262724339962, "rewards/reward_accuracy/mean": 0.91875, "rewards/reward_accuracy/std": 0.23579344376921654, "rewards/reward_format/mean": 0.09892578274011612, "rewards/reward_format/std": 0.00727554049808532, "sampling/importance_sampling_ratio/max": 2.5389524936676025, "sampling/importance_sampling_ratio/mean": 0.9629929542541504, "sampling/importance_sampling_ratio/min": 0.07783268066123128, "sampling/sampling_logp_difference/max": 1.0376195311546326, "sampling/sampling_logp_difference/mean": 0.005270836455747485, "step": 3040, "step_time": 8.215206360092271 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.006640625, "completions/max_length": 1903.6, "completions/max_terminated_length": 1525.9, "completions/mean_length": 177.35625, "completions/mean_terminated_length": 164.9183609008789, "completions/min_length": 64.4, "completions/min_terminated_length": 64.4, "entropy": 0.07430883492343128, "epoch": 6.531049250535332, "frac_reward_zero_std": 0.8125, "grad_norm": 0.625, "learning_rate": 9.695100000000001e-06, "loss": -0.014, "num_tokens": 335823057.0, "reward": 1.028593760728836, "reward_std": 0.24920837283134462, "rewards/reward_accuracy/mean": 0.929296875, "rewards/reward_accuracy/std": 0.24652970507740973, "rewards/reward_format/mean": 0.09929687604308128, "rewards/reward_format/std": 0.0056333439890295265, "sampling/importance_sampling_ratio/max": 2.3939044952392576, "sampling/importance_sampling_ratio/mean": 0.9909621417522431, "sampling/importance_sampling_ratio/min": 0.029322638548910616, "sampling/sampling_logp_difference/max": 1.1125945806503297, "sampling/sampling_logp_difference/mean": 0.004900855151936412, "step": 3050, "step_time": 9.146705343795475 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0125, "completions/max_length": 1744.5, "completions/max_terminated_length": 1575.6, "completions/mean_length": 214.625390625, "completions/mean_terminated_length": 191.92086944580078, "completions/min_length": 64.3, "completions/min_terminated_length": 64.3, "entropy": 0.0965283839032054, "epoch": 6.552462526766595, "frac_reward_zero_std": 0.68125, "grad_norm": 0.6953125, "learning_rate": 9.694100000000001e-06, "loss": -0.0125, "num_tokens": 336896274.0, "reward": 0.9862695634365082, "reward_std": 0.28935054689645767, "rewards/reward_accuracy/mean": 0.8875, "rewards/reward_accuracy/std": 0.28692646250128745, "rewards/reward_format/mean": 0.0987695336341858, "rewards/reward_format/std": 0.007593031064607203, "sampling/importance_sampling_ratio/max": 2.4673148512840273, "sampling/importance_sampling_ratio/mean": 0.9739773869514465, "sampling/importance_sampling_ratio/min": 0.06612161658704281, "sampling/sampling_logp_difference/max": 1.0947420001029968, "sampling/sampling_logp_difference/mean": 0.005626443470828235, "step": 3060, "step_time": 8.452995163507875 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.011328125, "completions/max_length": 1555.7, "completions/max_terminated_length": 1503.4, "completions/mean_length": 192.270703125, "completions/mean_terminated_length": 171.61328887939453, "completions/min_length": 65.6, "completions/min_terminated_length": 65.6, "entropy": 0.08418824425898493, "epoch": 6.573875802997859, "frac_reward_zero_std": 0.7625, "grad_norm": 0.55078125, "learning_rate": 9.6931e-06, "loss": -0.0071, "num_tokens": 337907591.0, "reward": 1.0104492545127868, "reward_std": 0.265137492865324, "rewards/reward_accuracy/mean": 0.91171875, "rewards/reward_accuracy/std": 0.26161878928542137, "rewards/reward_format/mean": 0.09873047173023224, "rewards/reward_format/std": 0.007836781302466988, "sampling/importance_sampling_ratio/max": 2.3062177658081056, "sampling/importance_sampling_ratio/mean": 0.9724278032779694, "sampling/importance_sampling_ratio/min": 0.07595136165618896, "sampling/sampling_logp_difference/max": 0.879375672340393, "sampling/sampling_logp_difference/mean": 0.005287173320539296, "step": 3070, "step_time": 7.843675848506973 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00859375, "completions/max_length": 1702.3, "completions/max_terminated_length": 1411.9, "completions/mean_length": 187.85390625, "completions/mean_terminated_length": 171.94145812988282, "completions/min_length": 63.4, "completions/min_terminated_length": 63.4, "entropy": 0.06840049885213376, "epoch": 6.595289079229122, "frac_reward_zero_std": 0.8, "grad_norm": 0.66015625, "learning_rate": 9.692100000000002e-06, "loss": -0.006, "num_tokens": 338911937.0, "reward": 1.0117383122444152, "reward_std": 0.27227554842829704, "rewards/reward_accuracy/mean": 0.9125, "rewards/reward_accuracy/std": 0.2698555923998356, "rewards/reward_format/mean": 0.09923828318715096, "rewards/reward_format/std": 0.00659488330129534, "sampling/importance_sampling_ratio/max": 2.4358619332313536, "sampling/importance_sampling_ratio/mean": 0.9799278974533081, "sampling/importance_sampling_ratio/min": 0.07607167027890682, "sampling/sampling_logp_difference/max": 0.8617503583431244, "sampling/sampling_logp_difference/mean": 0.004591421689838171, "step": 3080, "step_time": 8.327591932498034 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 1.8419856132823043e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 1.8419856132823043e-06, "completions/clipped_ratio": 0.010546875, "completions/max_length": 1867.8, "completions/max_terminated_length": 1779.4, "completions/mean_length": 195.053515625, "completions/mean_terminated_length": 175.39825134277345, "completions/min_length": 62.5, "completions/min_terminated_length": 62.5, "entropy": 0.0725121476687491, "epoch": 6.616702355460386, "frac_reward_zero_std": 0.81875, "grad_norm": 0.546875, "learning_rate": 9.691100000000001e-06, "loss": -0.0088, "num_tokens": 339923386.0, "reward": 0.9976953506469727, "reward_std": 0.29510593265295026, "rewards/reward_accuracy/mean": 0.898828125, "rewards/reward_accuracy/std": 0.29205906093120576, "rewards/reward_format/mean": 0.09886718839406967, "rewards/reward_format/std": 0.0076739810872823, "sampling/importance_sampling_ratio/max": 2.3887830495834352, "sampling/importance_sampling_ratio/mean": 0.9840235769748688, "sampling/importance_sampling_ratio/min": 0.03201517798006535, "sampling/sampling_logp_difference/max": 0.8567222535610199, "sampling/sampling_logp_difference/mean": 0.0048153501003980635, "step": 3090, "step_time": 9.082589940889738 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.006640625, "completions/max_length": 1392.3, "completions/max_terminated_length": 1249.3, "completions/mean_length": 170.374609375, "completions/mean_terminated_length": 158.13645935058594, "completions/min_length": 59.5, "completions/min_terminated_length": 59.5, "entropy": 0.06676638838835061, "epoch": 6.638115631691649, "frac_reward_zero_std": 0.78125, "grad_norm": 0.52734375, "learning_rate": 9.6901e-06, "loss": -0.009, "num_tokens": 340874649.0, "reward": 1.0266015946865081, "reward_std": 0.23598900511860849, "rewards/reward_accuracy/mean": 0.92734375, "rewards/reward_accuracy/std": 0.23421600833535194, "rewards/reward_format/mean": 0.0992578148841858, "rewards/reward_format/std": 0.004198160208761692, "sampling/importance_sampling_ratio/max": 2.5560555696487426, "sampling/importance_sampling_ratio/mean": 0.9814868092536926, "sampling/importance_sampling_ratio/min": 0.05901361405849457, "sampling/sampling_logp_difference/max": 1.030622124671936, "sampling/sampling_logp_difference/mean": 0.004814331443049014, "step": 3100, "step_time": 6.865743125119479 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.011328125, "completions/max_length": 1936.1, "completions/max_terminated_length": 1634.7, "completions/mean_length": 210.06328125, "completions/mean_terminated_length": 189.50412139892578, "completions/min_length": 60.8, "completions/min_terminated_length": 60.8, "entropy": 0.08512787935324014, "epoch": 6.659528907922912, "frac_reward_zero_std": 0.79375, "grad_norm": 0.21484375, "learning_rate": 9.689100000000002e-06, "loss": -0.0141, "num_tokens": 341931771.0, "reward": 1.0007226645946503, "reward_std": 0.27505653649568557, "rewards/reward_accuracy/mean": 0.901953125, "rewards/reward_accuracy/std": 0.2715723693370819, "rewards/reward_format/mean": 0.09876953288912774, "rewards/reward_format/std": 0.008036889974027872, "sampling/importance_sampling_ratio/max": 2.576607918739319, "sampling/importance_sampling_ratio/mean": 0.969846922159195, "sampling/importance_sampling_ratio/min": 0.04674061853438616, "sampling/sampling_logp_difference/max": 0.9003856003284454, "sampling/sampling_logp_difference/mean": 0.005375309567898512, "step": 3110, "step_time": 9.39897228050977 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005078125, "completions/max_length": 1900.3, "completions/max_terminated_length": 1628.1, "completions/mean_length": 186.723046875, "completions/mean_terminated_length": 177.1954574584961, "completions/min_length": 65.2, "completions/min_terminated_length": 65.2, "entropy": 0.0734944629482925, "epoch": 6.680942184154175, "frac_reward_zero_std": 0.78125, "grad_norm": 0.6796875, "learning_rate": 9.6881e-06, "loss": -0.0115, "num_tokens": 342930470.0, "reward": 1.0180078327655793, "reward_std": 0.26384436190128324, "rewards/reward_accuracy/mean": 0.918359375, "rewards/reward_accuracy/std": 0.26262165829539297, "rewards/reward_format/mean": 0.09964843839406967, "rewards/reward_format/std": 0.0038856583181768657, "sampling/importance_sampling_ratio/max": 2.440822112560272, "sampling/importance_sampling_ratio/mean": 0.9913064360618591, "sampling/importance_sampling_ratio/min": 0.030800138413906098, "sampling/sampling_logp_difference/max": 1.0040360331535338, "sampling/sampling_logp_difference/mean": 0.004879950126633048, "step": 3120, "step_time": 9.064372623714736 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.008984375, "completions/max_length": 1538.6, "completions/max_terminated_length": 1415.7, "completions/mean_length": 197.34453125, "completions/mean_terminated_length": 181.11161041259766, "completions/min_length": 69.9, "completions/min_terminated_length": 69.9, "entropy": 0.08034354464616626, "epoch": 6.702355460385439, "frac_reward_zero_std": 0.775, "grad_norm": 0.55078125, "learning_rate": 9.6871e-06, "loss": -0.0117, "num_tokens": 343961592.0, "reward": 1.007792991399765, "reward_std": 0.2632139325141907, "rewards/reward_accuracy/mean": 0.90859375, "rewards/reward_accuracy/std": 0.26117912381887437, "rewards/reward_format/mean": 0.09919921979308129, "rewards/reward_format/std": 0.005555746983736754, "sampling/importance_sampling_ratio/max": 2.417115807533264, "sampling/importance_sampling_ratio/mean": 0.9821153461933136, "sampling/importance_sampling_ratio/min": 0.09809531792998313, "sampling/sampling_logp_difference/max": 0.9546016812324524, "sampling/sampling_logp_difference/mean": 0.004945261660031975, "step": 3130, "step_time": 7.999522521501058 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.008203125, "completions/max_length": 1530.1, "completions/max_terminated_length": 1253.4, "completions/mean_length": 175.23203125, "completions/mean_terminated_length": 159.92337188720703, "completions/min_length": 62.7, "completions/min_terminated_length": 62.7, "entropy": 0.06808792836964131, "epoch": 6.7237687366167025, "frac_reward_zero_std": 0.775, "grad_norm": 0.451171875, "learning_rate": 9.6861e-06, "loss": -0.0042, "num_tokens": 344924954.0, "reward": 1.0273633122444152, "reward_std": 0.23288238048553467, "rewards/reward_accuracy/mean": 0.928125, "rewards/reward_accuracy/std": 0.23074544966220856, "rewards/reward_format/mean": 0.09923828318715096, "rewards/reward_format/std": 0.005538069223985076, "sampling/importance_sampling_ratio/max": 2.503889489173889, "sampling/importance_sampling_ratio/mean": 0.9847843885421753, "sampling/importance_sampling_ratio/min": 0.08802944421768188, "sampling/sampling_logp_difference/max": 0.9752469062805176, "sampling/sampling_logp_difference/mean": 0.004769455105997622, "step": 3140, "step_time": 7.38770708341035 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.007421875, "completions/max_length": 1724.8, "completions/max_terminated_length": 1605.1, "completions/mean_length": 194.559765625, "completions/mean_terminated_length": 180.99614410400392, "completions/min_length": 68.6, "completions/min_terminated_length": 68.6, "entropy": 0.08309762529097497, "epoch": 6.745182012847966, "frac_reward_zero_std": 0.7125, "grad_norm": 0.734375, "learning_rate": 9.6851e-06, "loss": -0.0176, "num_tokens": 345948931.0, "reward": 1.0191601753234862, "reward_std": 0.25425848588347433, "rewards/reward_accuracy/mean": 0.919921875, "rewards/reward_accuracy/std": 0.2523136638104916, "rewards/reward_format/mean": 0.0992382824420929, "rewards/reward_format/std": 0.005646029766649008, "sampling/importance_sampling_ratio/max": 2.5714856147766114, "sampling/importance_sampling_ratio/mean": 0.9900700807571411, "sampling/importance_sampling_ratio/min": 0.04904551925137639, "sampling/sampling_logp_difference/max": 0.9542569696903229, "sampling/sampling_logp_difference/mean": 0.005537397786974907, "step": 3150, "step_time": 8.323390145492159 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.009765625, "completions/max_length": 1729.6, "completions/max_terminated_length": 1454.4, "completions/mean_length": 197.57109375, "completions/mean_terminated_length": 179.5511459350586, "completions/min_length": 68.9, "completions/min_terminated_length": 68.9, "entropy": 0.07925007911399007, "epoch": 6.766595289079229, "frac_reward_zero_std": 0.73125, "grad_norm": 0.56640625, "learning_rate": 9.684100000000001e-06, "loss": -0.0154, "num_tokens": 346977849.0, "reward": 1.0222851872444152, "reward_std": 0.2537584722042084, "rewards/reward_accuracy/mean": 0.923046875, "rewards/reward_accuracy/std": 0.25141742527484895, "rewards/reward_format/mean": 0.09923828169703483, "rewards/reward_format/std": 0.0068889164831489325, "sampling/importance_sampling_ratio/max": 2.4887802362442017, "sampling/importance_sampling_ratio/mean": 0.9796376824378967, "sampling/importance_sampling_ratio/min": 0.04363864436745644, "sampling/sampling_logp_difference/max": 0.8932682693004608, "sampling/sampling_logp_difference/mean": 0.005099051119759679, "step": 3160, "step_time": 8.422175743328989 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01484375, "completions/max_length": 1722.6, "completions/max_terminated_length": 1604.0, "completions/mean_length": 202.683984375, "completions/mean_terminated_length": 175.11143341064454, "completions/min_length": 69.6, "completions/min_terminated_length": 69.6, "entropy": 0.08153457879088818, "epoch": 6.788008565310492, "frac_reward_zero_std": 0.78125, "grad_norm": 0.6796875, "learning_rate": 9.6831e-06, "loss": -0.001, "num_tokens": 348017920.0, "reward": 1.0219336032867432, "reward_std": 0.25741136223077776, "rewards/reward_accuracy/mean": 0.923046875, "rewards/reward_accuracy/std": 0.2536558821797371, "rewards/reward_format/mean": 0.09888671785593033, "rewards/reward_format/std": 0.008255041181109845, "sampling/importance_sampling_ratio/max": 2.5870125532150268, "sampling/importance_sampling_ratio/mean": 0.978356021642685, "sampling/importance_sampling_ratio/min": 0.05897313877940178, "sampling/sampling_logp_difference/max": 1.1501452267169952, "sampling/sampling_logp_difference/mean": 0.005052779288962484, "step": 3170, "step_time": 8.724453201002325 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.006640625, "completions/max_length": 1705.4, "completions/max_terminated_length": 1339.7, "completions/mean_length": 173.9359375, "completions/mean_terminated_length": 161.5240036010742, "completions/min_length": 65.9, "completions/min_terminated_length": 65.9, "entropy": 0.07094151354394854, "epoch": 6.809421841541756, "frac_reward_zero_std": 0.79375, "grad_norm": 0.59765625, "learning_rate": 9.682100000000002e-06, "loss": -0.006, "num_tokens": 348981836.0, "reward": 1.03974609375, "reward_std": 0.2224700443446636, "rewards/reward_accuracy/mean": 0.940234375, "rewards/reward_accuracy/std": 0.22094230428338052, "rewards/reward_format/mean": 0.09951171875, "rewards/reward_format/std": 0.003627279307693243, "sampling/importance_sampling_ratio/max": 2.4146538972854614, "sampling/importance_sampling_ratio/mean": 0.9853837490081787, "sampling/importance_sampling_ratio/min": 0.08318276405334472, "sampling/sampling_logp_difference/max": 0.7840139687061309, "sampling/sampling_logp_difference/mean": 0.004928378481417894, "step": 3180, "step_time": 8.146054637079942 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005078125, "completions/max_length": 1498.1, "completions/max_terminated_length": 1232.3, "completions/mean_length": 171.34609375, "completions/mean_terminated_length": 161.88218841552734, "completions/min_length": 64.7, "completions/min_terminated_length": 64.7, "entropy": 0.07043540207669138, "epoch": 6.830835117773019, "frac_reward_zero_std": 0.8, "grad_norm": 0.328125, "learning_rate": 9.681100000000001e-06, "loss": -0.0072, "num_tokens": 349934994.0, "reward": 1.0371484637260437, "reward_std": 0.2201055809855461, "rewards/reward_accuracy/mean": 0.9375, "rewards/reward_accuracy/std": 0.21890879943966865, "rewards/reward_format/mean": 0.09964843913912773, "rewards/reward_format/std": 0.002729590842500329, "sampling/importance_sampling_ratio/max": 2.4107971668243406, "sampling/importance_sampling_ratio/mean": 0.9750582277774811, "sampling/importance_sampling_ratio/min": 0.15507455207407475, "sampling/sampling_logp_difference/max": 0.6914917290210724, "sampling/sampling_logp_difference/mean": 0.0048900325782597065, "step": 3190, "step_time": 7.318204835196957 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.014453125, "completions/max_length": 2048.0, "completions/max_terminated_length": 1701.8, "completions/mean_length": 207.467578125, "completions/mean_terminated_length": 180.49846801757812, "completions/min_length": 61.8, "completions/min_terminated_length": 61.8, "entropy": 0.09661217690445482, "epoch": 6.852248394004283, "frac_reward_zero_std": 0.76875, "grad_norm": 0.77734375, "learning_rate": 9.6801e-06, "loss": -0.0224, "num_tokens": 350982751.0, "reward": 1.0229687929153441, "reward_std": 0.25074737668037417, "rewards/reward_accuracy/mean": 0.92421875, "rewards/reward_accuracy/std": 0.2462354026734829, "rewards/reward_format/mean": 0.09875000342726707, "rewards/reward_format/std": 0.009043427184224129, "sampling/importance_sampling_ratio/max": 2.540443241596222, "sampling/importance_sampling_ratio/mean": 0.9767551839351654, "sampling/importance_sampling_ratio/min": 0.05512746125459671, "sampling/sampling_logp_difference/max": 0.9935081779956818, "sampling/sampling_logp_difference/mean": 0.005468818871304393, "step": 3200, "step_time": 9.867727168992861 }, { "clip_ratio/high_max": 6.004803799442015e-06, "clip_ratio/high_mean": 7.506004749302519e-07, "clip_ratio/low_mean": 1.5012009498605038e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 2.2518013793160206e-06, "completions/clipped_ratio": 0.02109375, "completions/max_length": 2048.0, "completions/max_terminated_length": 1726.8, "completions/mean_length": 240.5828125, "completions/mean_terminated_length": 201.8744674682617, "completions/min_length": 63.9, "completions/min_terminated_length": 63.9, "entropy": 0.11334613142535091, "epoch": 6.873661670235546, "frac_reward_zero_std": 0.7125, "grad_norm": 0.91796875, "learning_rate": 9.679100000000002e-06, "loss": -0.0258, "num_tokens": 352114755.0, "reward": 0.9923828423023224, "reward_std": 0.2985704094171524, "rewards/reward_accuracy/mean": 0.894140625, "rewards/reward_accuracy/std": 0.293807090818882, "rewards/reward_format/mean": 0.09824218973517418, "rewards/reward_format/std": 0.010551774688065053, "sampling/importance_sampling_ratio/max": 2.4976241111755373, "sampling/importance_sampling_ratio/mean": 0.9679814875125885, "sampling/importance_sampling_ratio/min": 0.04250013269484043, "sampling/sampling_logp_difference/max": 0.9063303232192993, "sampling/sampling_logp_difference/mean": 0.006165813328698278, "step": 3210, "step_time": 10.3526334607217 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.008984375, "completions/max_length": 1865.5, "completions/max_terminated_length": 1677.5, "completions/mean_length": 207.13515625, "completions/mean_terminated_length": 190.44385986328126, "completions/min_length": 63.4, "completions/min_terminated_length": 63.4, "entropy": 0.08544249585829675, "epoch": 6.895074946466809, "frac_reward_zero_std": 0.7625, "grad_norm": 0.89453125, "learning_rate": 9.6781e-06, "loss": -0.0096, "num_tokens": 353167085.0, "reward": 1.0187890887260438, "reward_std": 0.2639410488307476, "rewards/reward_accuracy/mean": 0.91953125, "rewards/reward_accuracy/std": 0.2616474486887455, "rewards/reward_format/mean": 0.09925781413912774, "rewards/reward_format/std": 0.006774271395988763, "sampling/importance_sampling_ratio/max": 2.3331639409065246, "sampling/importance_sampling_ratio/mean": 0.9870075166225434, "sampling/importance_sampling_ratio/min": 0.013468180596828461, "sampling/sampling_logp_difference/max": 0.7717556953430176, "sampling/sampling_logp_difference/mean": 0.0052268861560150984, "step": 3220, "step_time": 9.078370269484003 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.016796875, "completions/max_length": 1905.2, "completions/max_terminated_length": 1690.8, "completions/mean_length": 225.058203125, "completions/mean_terminated_length": 194.27782135009767, "completions/min_length": 65.2, "completions/min_terminated_length": 65.2, "entropy": 0.09935637773014605, "epoch": 6.916488222698073, "frac_reward_zero_std": 0.7625, "grad_norm": 1.65625, "learning_rate": 9.677100000000001e-06, "loss": -0.009, "num_tokens": 354264386.0, "reward": 1.0000781536102294, "reward_std": 0.2957387208938599, "rewards/reward_accuracy/mean": 0.9015625, "rewards/reward_accuracy/std": 0.2915824130177498, "rewards/reward_format/mean": 0.09851562604308128, "rewards/reward_format/std": 0.00977958389557898, "sampling/importance_sampling_ratio/max": 2.370232117176056, "sampling/importance_sampling_ratio/mean": 0.9602834641933441, "sampling/importance_sampling_ratio/min": 0.03656978039070964, "sampling/sampling_logp_difference/max": 1.0187317669391631, "sampling/sampling_logp_difference/mean": 0.005729530961252749, "step": 3230, "step_time": 9.301596983213676 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0078125, "completions/max_length": 1682.4, "completions/max_terminated_length": 1564.8, "completions/mean_length": 196.41484375, "completions/mean_terminated_length": 182.12061309814453, "completions/min_length": 64.1, "completions/min_terminated_length": 64.1, "entropy": 0.07915492272004485, "epoch": 6.937901498929336, "frac_reward_zero_std": 0.825, "grad_norm": 0.68359375, "learning_rate": 9.6761e-06, "loss": -0.0039, "num_tokens": 355278280.0, "reward": 1.0439062714576721, "reward_std": 0.1977351985871792, "rewards/reward_accuracy/mean": 0.94453125, "rewards/reward_accuracy/std": 0.19541723057627677, "rewards/reward_format/mean": 0.09937500134110451, "rewards/reward_format/std": 0.005936383665539324, "sampling/importance_sampling_ratio/max": 2.3692996740341186, "sampling/importance_sampling_ratio/mean": 0.9775839447975159, "sampling/importance_sampling_ratio/min": 0.08451364785432816, "sampling/sampling_logp_difference/max": 0.8793768048286438, "sampling/sampling_logp_difference/mean": 0.004919932084158063, "step": 3240, "step_time": 8.153547262298526 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 2.5427237915209844e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 2.5427237915209844e-06, "completions/clipped_ratio": 0.013671875, "completions/max_length": 1915.1, "completions/max_terminated_length": 1629.7, "completions/mean_length": 200.5984375, "completions/mean_terminated_length": 174.94669036865236, "completions/min_length": 64.3, "completions/min_terminated_length": 64.3, "entropy": 0.08342789760790766, "epoch": 6.9593147751606, "frac_reward_zero_std": 0.75, "grad_norm": 0.30078125, "learning_rate": 9.6751e-06, "loss": -0.0121, "num_tokens": 356308788.0, "reward": 1.0022070467472077, "reward_std": 0.28227358460426333, "rewards/reward_accuracy/mean": 0.903515625, "rewards/reward_accuracy/std": 0.2789628326892853, "rewards/reward_format/mean": 0.09869140833616256, "rewards/reward_format/std": 0.00784617851022631, "sampling/importance_sampling_ratio/max": 2.5853209495544434, "sampling/importance_sampling_ratio/mean": 0.9784247398376464, "sampling/importance_sampling_ratio/min": 0.07843666500411928, "sampling/sampling_logp_difference/max": 0.7621192336082458, "sampling/sampling_logp_difference/mean": 0.005025321384891868, "step": 3250, "step_time": 9.310047466401011 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.002734375, "completions/max_length": 1818.5, "completions/max_terminated_length": 1578.9, "completions/mean_length": 191.06015625, "completions/mean_terminated_length": 186.0020294189453, "completions/min_length": 70.4, "completions/min_terminated_length": 70.4, "entropy": 0.0825933723244816, "epoch": 6.980728051391863, "frac_reward_zero_std": 0.80625, "grad_norm": 0.54296875, "learning_rate": 9.674100000000001e-06, "loss": -0.0081, "num_tokens": 357312910.0, "reward": 1.0390429973602295, "reward_std": 0.2192363016307354, "rewards/reward_accuracy/mean": 0.939453125, "rewards/reward_accuracy/std": 0.218021147698164, "rewards/reward_format/mean": 0.09958984479308128, "rewards/reward_format/std": 0.0045264797983691095, "sampling/importance_sampling_ratio/max": 2.639177751541138, "sampling/importance_sampling_ratio/mean": 0.9902694702148438, "sampling/importance_sampling_ratio/min": 0.10253455117344856, "sampling/sampling_logp_difference/max": 0.7699207305908203, "sampling/sampling_logp_difference/mean": 0.004949147161096334, "step": 3260, "step_time": 8.794259991997388 }, { "clip_ratio/high_max": 8.840169903123751e-06, "clip_ratio/high_mean": 1.1050212378904689e-06, "clip_ratio/low_mean": 2.852655507012969e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 3.9576767449034375e-06, "completions/clipped_ratio": 0.0171875, "completions/max_length": 1915.6, "completions/max_terminated_length": 1785.3, "completions/mean_length": 237.708984375, "completions/mean_terminated_length": 206.16864318847655, "completions/min_length": 67.4, "completions/min_terminated_length": 67.4, "entropy": 0.09841024954803287, "epoch": 7.002141327623126, "frac_reward_zero_std": 0.775, "grad_norm": 0.796875, "learning_rate": 9.6731e-06, "loss": -0.0119, "num_tokens": 358433221.0, "reward": 1.0258203148841858, "reward_std": 0.2550796501338482, "rewards/reward_accuracy/mean": 0.92734375, "rewards/reward_accuracy/std": 0.24989931657910347, "rewards/reward_format/mean": 0.09847656190395356, "rewards/reward_format/std": 0.010017540538683534, "sampling/importance_sampling_ratio/max": 2.6744590282440184, "sampling/importance_sampling_ratio/mean": 0.9622101962566376, "sampling/importance_sampling_ratio/min": 0.006365488562732935, "sampling/sampling_logp_difference/max": 0.8852793335914612, "sampling/sampling_logp_difference/mean": 0.005616572545841336, "step": 3270, "step_time": 9.525282035511918 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.009375, "completions/max_length": 1784.5, "completions/max_terminated_length": 1623.0, "completions/mean_length": 225.19375, "completions/mean_terminated_length": 208.30361938476562, "completions/min_length": 69.4, "completions/min_terminated_length": 69.4, "entropy": 0.09066635593771935, "epoch": 7.0235546038543895, "frac_reward_zero_std": 0.78125, "grad_norm": 0.30859375, "learning_rate": 9.6721e-06, "loss": -0.0134, "num_tokens": 359525685.0, "reward": 1.0186719000339508, "reward_std": 0.23618333637714387, "rewards/reward_accuracy/mean": 0.91953125, "rewards/reward_accuracy/std": 0.23308473378419875, "rewards/reward_format/mean": 0.09914062619209289, "rewards/reward_format/std": 0.007014462072402239, "sampling/importance_sampling_ratio/max": 2.4903581380844115, "sampling/importance_sampling_ratio/mean": 0.9792442917823792, "sampling/importance_sampling_ratio/min": 0.037619469501078126, "sampling/sampling_logp_difference/max": 0.8622884511947632, "sampling/sampling_logp_difference/mean": 0.0053989389445632694, "step": 3280, "step_time": 8.717433122001239 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.02265625, "completions/max_length": 2045.3, "completions/max_terminated_length": 1955.9, "completions/mean_length": 244.11484375, "completions/mean_terminated_length": 202.3874771118164, "completions/min_length": 70.4, "completions/min_terminated_length": 70.4, "entropy": 0.09157485221512615, "epoch": 7.044967880085653, "frac_reward_zero_std": 0.7625, "grad_norm": 0.263671875, "learning_rate": 9.671100000000001e-06, "loss": -0.0184, "num_tokens": 360670891.0, "reward": 1.0020312786102294, "reward_std": 0.2957475632429123, "rewards/reward_accuracy/mean": 0.90390625, "rewards/reward_accuracy/std": 0.2898521289229393, "rewards/reward_format/mean": 0.0981250025331974, "rewards/reward_format/std": 0.011504734307527542, "sampling/importance_sampling_ratio/max": 2.47665913105011, "sampling/importance_sampling_ratio/mean": 0.9685868442058563, "sampling/importance_sampling_ratio/min": 0.014848452061414719, "sampling/sampling_logp_difference/max": 0.9666304171085358, "sampling/sampling_logp_difference/mean": 0.0053056709934026, "step": 3290, "step_time": 10.352569579199189 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.012109375, "completions/max_length": 1798.6, "completions/max_terminated_length": 1695.0, "completions/mean_length": 214.376953125, "completions/mean_terminated_length": 192.07720794677735, "completions/min_length": 64.5, "completions/min_terminated_length": 64.5, "entropy": 0.0891616933979094, "epoch": 7.0663811563169165, "frac_reward_zero_std": 0.7625, "grad_norm": 0.640625, "learning_rate": 9.6701e-06, "loss": -0.0007, "num_tokens": 361737504.0, "reward": 1.0444140553474426, "reward_std": 0.21247639283537864, "rewards/reward_accuracy/mean": 0.945703125, "rewards/reward_accuracy/std": 0.20815800204873086, "rewards/reward_format/mean": 0.09871093705296516, "rewards/reward_format/std": 0.00844929509330541, "sampling/importance_sampling_ratio/max": 2.4769975066185, "sampling/importance_sampling_ratio/mean": 0.967932653427124, "sampling/importance_sampling_ratio/min": 0.06790498327463865, "sampling/sampling_logp_difference/max": 0.769520765542984, "sampling/sampling_logp_difference/mean": 0.005514096235856414, "step": 3300, "step_time": 8.8045773137972 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.012109375, "completions/max_length": 1890.5, "completions/max_terminated_length": 1685.3, "completions/mean_length": 218.05625, "completions/mean_terminated_length": 196.08210144042968, "completions/min_length": 66.4, "completions/min_terminated_length": 66.4, "entropy": 0.10031103943474591, "epoch": 7.08779443254818, "frac_reward_zero_std": 0.775, "grad_norm": 0.43359375, "learning_rate": 9.669100000000002e-06, "loss": -0.0028, "num_tokens": 362811328.0, "reward": 1.0018945455551147, "reward_std": 0.28761159628629684, "rewards/reward_accuracy/mean": 0.902734375, "rewards/reward_accuracy/std": 0.28538611978292466, "rewards/reward_format/mean": 0.09916015639901161, "rewards/reward_format/std": 0.0067238196497783065, "sampling/importance_sampling_ratio/max": 2.5637635469436644, "sampling/importance_sampling_ratio/mean": 0.9747008323669434, "sampling/importance_sampling_ratio/min": 0.05438514649868011, "sampling/sampling_logp_difference/max": 0.7410892009735107, "sampling/sampling_logp_difference/mean": 0.00574085796251893, "step": 3310, "step_time": 9.288107247807783 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.009765625, "completions/max_length": 1520.7, "completions/max_terminated_length": 1453.2, "completions/mean_length": 184.21171875, "completions/mean_terminated_length": 166.11487274169923, "completions/min_length": 64.8, "completions/min_terminated_length": 64.8, "entropy": 0.07675529276020825, "epoch": 7.109207708779444, "frac_reward_zero_std": 0.79375, "grad_norm": 0.80859375, "learning_rate": 9.6681e-06, "loss": -0.0074, "num_tokens": 363791502.0, "reward": 1.0353515863418579, "reward_std": 0.22756873741745948, "rewards/reward_accuracy/mean": 0.936328125, "rewards/reward_accuracy/std": 0.22490202784538268, "rewards/reward_format/mean": 0.09902343824505806, "rewards/reward_format/std": 0.006103196856565773, "sampling/importance_sampling_ratio/max": 2.308181548118591, "sampling/importance_sampling_ratio/mean": 0.9864411234855652, "sampling/importance_sampling_ratio/min": 0.0686867143958807, "sampling/sampling_logp_difference/max": 0.7878016710281373, "sampling/sampling_logp_difference/mean": 0.004796441690996289, "step": 3320, "step_time": 7.567877351291827 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00859375, "completions/max_length": 1593.2, "completions/max_terminated_length": 1499.8, "completions/mean_length": 184.4203125, "completions/mean_terminated_length": 168.50992279052736, "completions/min_length": 60.9, "completions/min_terminated_length": 60.9, "entropy": 0.070585562242195, "epoch": 7.130620985010706, "frac_reward_zero_std": 0.8, "grad_norm": 0.443359375, "learning_rate": 9.667100000000001e-06, "loss": -0.0076, "num_tokens": 364779538.0, "reward": 1.024179708957672, "reward_std": 0.25484727025032045, "rewards/reward_accuracy/mean": 0.925, "rewards/reward_accuracy/std": 0.2521743305027485, "rewards/reward_format/mean": 0.09917968884110451, "rewards/reward_format/std": 0.005711801699362695, "sampling/importance_sampling_ratio/max": 2.623803496360779, "sampling/importance_sampling_ratio/mean": 0.9855225205421447, "sampling/importance_sampling_ratio/min": 0.05693019926548004, "sampling/sampling_logp_difference/max": 0.9949729800224304, "sampling/sampling_logp_difference/mean": 0.004714632825925946, "step": 3330, "step_time": 7.961959710792871 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00859375, "completions/max_length": 1339.1, "completions/max_terminated_length": 1203.6, "completions/mean_length": 167.9953125, "completions/mean_terminated_length": 151.85559844970703, "completions/min_length": 63.7, "completions/min_terminated_length": 63.7, "entropy": 0.05746339033357799, "epoch": 7.15203426124197, "frac_reward_zero_std": 0.89375, "grad_norm": 0.56640625, "learning_rate": 9.6661e-06, "loss": 0.0024, "num_tokens": 365717510.0, "reward": 1.042988306283951, "reward_std": 0.20563983246684076, "rewards/reward_accuracy/mean": 0.94375, "rewards/reward_accuracy/std": 0.2028396688401699, "rewards/reward_format/mean": 0.09923828318715096, "rewards/reward_format/std": 0.005302754323929548, "sampling/importance_sampling_ratio/max": 2.1378695607185363, "sampling/importance_sampling_ratio/mean": 0.9965870797634124, "sampling/importance_sampling_ratio/min": 0.10889309383928776, "sampling/sampling_logp_difference/max": 0.8405689120292663, "sampling/sampling_logp_difference/mean": 0.003983828029595316, "step": 3340, "step_time": 6.785003222100204 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00859375, "completions/max_length": 1563.1, "completions/max_terminated_length": 1529.3, "completions/mean_length": 196.49140625, "completions/mean_terminated_length": 181.47274017333984, "completions/min_length": 66.0, "completions/min_terminated_length": 66.0, "entropy": 0.08219872526824475, "epoch": 7.173447537473233, "frac_reward_zero_std": 0.78125, "grad_norm": 0.81640625, "learning_rate": 9.6651e-06, "loss": -0.0162, "num_tokens": 366738992.0, "reward": 1.0173632979393006, "reward_std": 0.22869633436203002, "rewards/reward_accuracy/mean": 0.918359375, "rewards/reward_accuracy/std": 0.22653116434812545, "rewards/reward_format/mean": 0.09900390803813934, "rewards/reward_format/std": 0.005462064943276346, "sampling/importance_sampling_ratio/max": 2.559286284446716, "sampling/importance_sampling_ratio/mean": 0.9900839745998382, "sampling/importance_sampling_ratio/min": 0.12801584005355834, "sampling/sampling_logp_difference/max": 0.7365347623825074, "sampling/sampling_logp_difference/mean": 0.005099473614245653, "step": 3350, "step_time": 7.608476221002638 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00703125, "completions/max_length": 1975.7, "completions/max_terminated_length": 1520.8, "completions/mean_length": 200.56328125, "completions/mean_terminated_length": 187.50598602294923, "completions/min_length": 64.0, "completions/min_terminated_length": 64.0, "entropy": 0.08083262722939252, "epoch": 7.194860813704497, "frac_reward_zero_std": 0.78125, "grad_norm": 0.2197265625, "learning_rate": 9.664100000000001e-06, "loss": -0.0049, "num_tokens": 367775826.0, "reward": 1.023300790786743, "reward_std": 0.2523004345595837, "rewards/reward_accuracy/mean": 0.923828125, "rewards/reward_accuracy/std": 0.2509389385581017, "rewards/reward_format/mean": 0.0994726575911045, "rewards/reward_format/std": 0.004993388382717967, "sampling/importance_sampling_ratio/max": 2.633357524871826, "sampling/importance_sampling_ratio/mean": 0.9816145718097686, "sampling/importance_sampling_ratio/min": 0.05312061682343483, "sampling/sampling_logp_difference/max": 0.7568632364273071, "sampling/sampling_logp_difference/mean": 0.005090389586985111, "step": 3360, "step_time": 9.576161346997832 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.004296875, "completions/max_length": 1698.5, "completions/max_terminated_length": 1471.4, "completions/mean_length": 179.533203125, "completions/mean_terminated_length": 171.66168975830078, "completions/min_length": 61.5, "completions/min_terminated_length": 61.5, "entropy": 0.07176343444734812, "epoch": 7.2162740899357605, "frac_reward_zero_std": 0.81875, "grad_norm": 0.388671875, "learning_rate": 9.6631e-06, "loss": 0.0001, "num_tokens": 368749831.0, "reward": 1.0382031440734862, "reward_std": 0.22528216764330863, "rewards/reward_accuracy/mean": 0.938671875, "rewards/reward_accuracy/std": 0.22385090216994286, "rewards/reward_format/mean": 0.0995312511920929, "rewards/reward_format/std": 0.004448432335630059, "sampling/importance_sampling_ratio/max": 2.3991798400878905, "sampling/importance_sampling_ratio/mean": 0.9798927545547486, "sampling/importance_sampling_ratio/min": 0.0806032434105873, "sampling/sampling_logp_difference/max": 1.0265131533145904, "sampling/sampling_logp_difference/mean": 0.004841399472206831, "step": 3370, "step_time": 8.137774265097686 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.007421875, "completions/max_length": 1790.5, "completions/max_terminated_length": 1671.4, "completions/mean_length": 208.026171875, "completions/mean_terminated_length": 194.4228256225586, "completions/min_length": 67.7, "completions/min_terminated_length": 67.7, "entropy": 0.09435573569498956, "epoch": 7.237687366167023, "frac_reward_zero_std": 0.78125, "grad_norm": 0.306640625, "learning_rate": 9.6621e-06, "loss": -0.0217, "num_tokens": 369803754.0, "reward": 1.0087305068969727, "reward_std": 0.26291498988866807, "rewards/reward_accuracy/mean": 0.909765625, "rewards/reward_accuracy/std": 0.2602637678384781, "rewards/reward_format/mean": 0.0989648461341858, "rewards/reward_format/std": 0.007395649282261729, "sampling/importance_sampling_ratio/max": 2.4140501499176024, "sampling/importance_sampling_ratio/mean": 0.9743441939353943, "sampling/importance_sampling_ratio/min": 0.07576013468205929, "sampling/sampling_logp_difference/max": 0.7226411461830139, "sampling/sampling_logp_difference/mean": 0.005598669592291117, "step": 3380, "step_time": 8.66884524608613 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.016015625, "completions/max_length": 1810.7, "completions/max_terminated_length": 1625.6, "completions/mean_length": 210.70546875, "completions/mean_terminated_length": 181.3903564453125, "completions/min_length": 72.4, "completions/min_terminated_length": 72.4, "entropy": 0.08215742972679436, "epoch": 7.259100642398287, "frac_reward_zero_std": 0.8, "grad_norm": 0.30078125, "learning_rate": 9.661100000000001e-06, "loss": -0.0151, "num_tokens": 370864088.0, "reward": 0.9992773771286011, "reward_std": 0.2896846026182175, "rewards/reward_accuracy/mean": 0.90078125, "rewards/reward_accuracy/std": 0.2860997974872589, "rewards/reward_format/mean": 0.09849609583616256, "rewards/reward_format/std": 0.0080746338237077, "sampling/importance_sampling_ratio/max": 2.369885230064392, "sampling/importance_sampling_ratio/mean": 0.977127057313919, "sampling/importance_sampling_ratio/min": 0.05510226914775558, "sampling/sampling_logp_difference/max": 0.9619598269462586, "sampling/sampling_logp_difference/mean": 0.005045811925083399, "step": 3390, "step_time": 8.949462137118099 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.010546875, "completions/max_length": 1725.6, "completions/max_terminated_length": 1469.0, "completions/mean_length": 194.966796875, "completions/mean_terminated_length": 175.6450637817383, "completions/min_length": 65.6, "completions/min_terminated_length": 65.6, "entropy": 0.07500704084523022, "epoch": 7.28051391862955, "frac_reward_zero_std": 0.7875, "grad_norm": 0.51171875, "learning_rate": 9.660100000000001e-06, "loss": -0.0111, "num_tokens": 371880883.0, "reward": 1.021054708957672, "reward_std": 0.24685753136873245, "rewards/reward_accuracy/mean": 0.922265625, "rewards/reward_accuracy/std": 0.24388763830065727, "rewards/reward_format/mean": 0.0987890638411045, "rewards/reward_format/std": 0.007108032330870628, "sampling/importance_sampling_ratio/max": 2.3540061354637145, "sampling/importance_sampling_ratio/mean": 0.9824026048183441, "sampling/importance_sampling_ratio/min": 0.11520192297175527, "sampling/sampling_logp_difference/max": 0.8268107295036315, "sampling/sampling_logp_difference/mean": 0.004963035695254803, "step": 3400, "step_time": 8.47432227540412 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00859375, "completions/max_length": 1732.0, "completions/max_terminated_length": 1570.1, "completions/mean_length": 194.91953125, "completions/mean_terminated_length": 179.0708984375, "completions/min_length": 68.6, "completions/min_terminated_length": 68.6, "entropy": 0.083404062082991, "epoch": 7.301927194860814, "frac_reward_zero_std": 0.78125, "grad_norm": 0.287109375, "learning_rate": 9.659100000000002e-06, "loss": -0.0211, "num_tokens": 372907413.0, "reward": 1.0133008003234862, "reward_std": 0.26836530640721323, "rewards/reward_accuracy/mean": 0.9140625, "rewards/reward_accuracy/std": 0.265990399569273, "rewards/reward_format/mean": 0.09923828318715096, "rewards/reward_format/std": 0.006447123875841498, "sampling/importance_sampling_ratio/max": 2.3255369305610656, "sampling/importance_sampling_ratio/mean": 0.9762274026870728, "sampling/importance_sampling_ratio/min": 0.020890150964260102, "sampling/sampling_logp_difference/max": 0.8718695223331452, "sampling/sampling_logp_difference/mean": 0.00542395084630698, "step": 3410, "step_time": 8.434645749386982 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 1657.4, "completions/max_terminated_length": 1526.7, "completions/mean_length": 172.232421875, "completions/mean_terminated_length": 165.01913604736328, "completions/min_length": 61.2, "completions/min_terminated_length": 61.2, "entropy": 0.0677159072831273, "epoch": 7.323340471092077, "frac_reward_zero_std": 0.8, "grad_norm": 0.59375, "learning_rate": 9.6581e-06, "loss": -0.0075, "num_tokens": 373867624.0, "reward": 1.045097666978836, "reward_std": 0.20988606065511703, "rewards/reward_accuracy/mean": 0.945703125, "rewards/reward_accuracy/std": 0.2077530086040497, "rewards/reward_format/mean": 0.09939453229308129, "rewards/reward_format/std": 0.004928422602824866, "sampling/importance_sampling_ratio/max": 2.455026662349701, "sampling/importance_sampling_ratio/mean": 0.9876531362533569, "sampling/importance_sampling_ratio/min": 0.11230104714632035, "sampling/sampling_logp_difference/max": 0.9560344338417053, "sampling/sampling_logp_difference/mean": 0.004741659434512257, "step": 3420, "step_time": 8.0314018484205 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 1572.8, "completions/max_terminated_length": 1342.0, "completions/mean_length": 165.07890625, "completions/mean_terminated_length": 157.73566513061525, "completions/min_length": 64.0, "completions/min_terminated_length": 64.0, "entropy": 0.06542185610160231, "epoch": 7.344753747323341, "frac_reward_zero_std": 0.81875, "grad_norm": 0.423828125, "learning_rate": 9.657100000000001e-06, "loss": -0.0057, "num_tokens": 374810690.0, "reward": 1.035058605670929, "reward_std": 0.21384989991784095, "rewards/reward_accuracy/mean": 0.935546875, "rewards/reward_accuracy/std": 0.21213285103440285, "rewards/reward_format/mean": 0.09951172024011612, "rewards/reward_format/std": 0.004377176123671234, "sampling/importance_sampling_ratio/max": 2.352167546749115, "sampling/importance_sampling_ratio/mean": 0.9832280516624451, "sampling/importance_sampling_ratio/min": 0.12875920571386815, "sampling/sampling_logp_difference/max": 0.9258468866348266, "sampling/sampling_logp_difference/mean": 0.004711185768246651, "step": 3430, "step_time": 7.4631633680837695 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00859375, "completions/max_length": 1455.5, "completions/max_terminated_length": 1281.5, "completions/mean_length": 185.56484375, "completions/mean_terminated_length": 169.64768981933594, "completions/min_length": 62.1, "completions/min_terminated_length": 62.1, "entropy": 0.07408427484333516, "epoch": 7.3661670235546035, "frac_reward_zero_std": 0.8, "grad_norm": 0.82421875, "learning_rate": 9.6561e-06, "loss": -0.0068, "num_tokens": 375805672.0, "reward": 1.026953148841858, "reward_std": 0.2343786023557186, "rewards/reward_accuracy/mean": 0.927734375, "rewards/reward_accuracy/std": 0.2321012146770954, "rewards/reward_format/mean": 0.09921875, "rewards/reward_format/std": 0.005500388029031455, "sampling/importance_sampling_ratio/max": 2.4101555347442627, "sampling/importance_sampling_ratio/mean": 0.9884947180747986, "sampling/importance_sampling_ratio/min": 0.10133547000586987, "sampling/sampling_logp_difference/max": 0.7599872410297394, "sampling/sampling_logp_difference/mean": 0.004756988282315433, "step": 3440, "step_time": 7.333108228095807 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00625, "completions/max_length": 1453.5, "completions/max_terminated_length": 1283.3, "completions/mean_length": 174.845703125, "completions/mean_terminated_length": 163.28630981445312, "completions/min_length": 65.1, "completions/min_terminated_length": 65.1, "entropy": 0.07016745409928263, "epoch": 7.387580299785867, "frac_reward_zero_std": 0.79375, "grad_norm": 0.67578125, "learning_rate": 9.6551e-06, "loss": -0.0082, "num_tokens": 376773149.0, "reward": 1.0353320717811585, "reward_std": 0.225161661952734, "rewards/reward_accuracy/mean": 0.9359375, "rewards/reward_accuracy/std": 0.22313873693346978, "rewards/reward_format/mean": 0.09939453303813935, "rewards/reward_format/std": 0.004817742272280157, "sampling/importance_sampling_ratio/max": 2.3925696492195128, "sampling/importance_sampling_ratio/mean": 0.980224746465683, "sampling/importance_sampling_ratio/min": 0.16615120097994804, "sampling/sampling_logp_difference/max": 0.8308257579803466, "sampling/sampling_logp_difference/mean": 0.004736596904695034, "step": 3450, "step_time": 7.228971158605418 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003125, "completions/max_length": 1636.5, "completions/max_terminated_length": 1428.7, "completions/mean_length": 174.59609375, "completions/mean_terminated_length": 168.77745971679687, "completions/min_length": 62.2, "completions/min_terminated_length": 62.2, "entropy": 0.07098064827732742, "epoch": 7.408993576017131, "frac_reward_zero_std": 0.83125, "grad_norm": 0.0, "learning_rate": 9.654100000000001e-06, "loss": -0.0064, "num_tokens": 377736899.0, "reward": 1.0195117473602295, "reward_std": 0.24793211817741395, "rewards/reward_accuracy/mean": 0.919921875, "rewards/reward_accuracy/std": 0.2469735935330391, "rewards/reward_format/mean": 0.09958984553813935, "rewards/reward_format/std": 0.0035606355872005225, "sampling/importance_sampling_ratio/max": 2.3893094301223754, "sampling/importance_sampling_ratio/mean": 0.9814814686775207, "sampling/importance_sampling_ratio/min": 0.07128524258732796, "sampling/sampling_logp_difference/max": 1.0437074542045592, "sampling/sampling_logp_difference/mean": 0.0047689436469227076, "step": 3460, "step_time": 7.757307374506491 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.008984375, "completions/max_length": 1742.4, "completions/max_terminated_length": 1467.2, "completions/mean_length": 188.274609375, "completions/mean_terminated_length": 171.57939453125, "completions/min_length": 64.5, "completions/min_terminated_length": 64.5, "entropy": 0.06974120223894716, "epoch": 7.430406852248394, "frac_reward_zero_std": 0.7875, "grad_norm": 0.578125, "learning_rate": 9.6531e-06, "loss": -0.0052, "num_tokens": 378738866.0, "reward": 1.0167187690734862, "reward_std": 0.2724547773599625, "rewards/reward_accuracy/mean": 0.917578125, "rewards/reward_accuracy/std": 0.26961921751499174, "rewards/reward_format/mean": 0.09914062619209289, "rewards/reward_format/std": 0.00695686605758965, "sampling/importance_sampling_ratio/max": 2.331894505023956, "sampling/importance_sampling_ratio/mean": 0.9816995561122894, "sampling/importance_sampling_ratio/min": 0.08396409675478936, "sampling/sampling_logp_difference/max": 0.7950213193893433, "sampling/sampling_logp_difference/mean": 0.0046781815588474275, "step": 3470, "step_time": 8.383170842906111 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.002734375, "completions/max_length": 1769.7, "completions/max_terminated_length": 1589.9, "completions/mean_length": 169.1078125, "completions/mean_terminated_length": 163.99112243652343, "completions/min_length": 68.0, "completions/min_terminated_length": 68.0, "entropy": 0.07172263083048165, "epoch": 7.451820128479658, "frac_reward_zero_std": 0.83125, "grad_norm": 0.494140625, "learning_rate": 9.6521e-06, "loss": -0.0162, "num_tokens": 379681462.0, "reward": 1.0418750166893005, "reward_std": 0.21953056752681732, "rewards/reward_accuracy/mean": 0.9421875, "rewards/reward_accuracy/std": 0.21816140785813332, "rewards/reward_format/mean": 0.09968750178813934, "rewards/reward_format/std": 0.003516834997572005, "sampling/importance_sampling_ratio/max": 2.2060760498046874, "sampling/importance_sampling_ratio/mean": 0.9813469767570495, "sampling/importance_sampling_ratio/min": 0.06298888567835093, "sampling/sampling_logp_difference/max": 0.7237028121948242, "sampling/sampling_logp_difference/mean": 0.004777360800653696, "step": 3480, "step_time": 8.211497805183171 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.009375, "completions/max_length": 1524.2, "completions/max_terminated_length": 1352.4, "completions/mean_length": 193.331640625, "completions/mean_terminated_length": 175.93778228759766, "completions/min_length": 64.1, "completions/min_terminated_length": 64.1, "entropy": 0.07294777273200452, "epoch": 7.473233404710921, "frac_reward_zero_std": 0.84375, "grad_norm": 0.0, "learning_rate": 9.651100000000001e-06, "loss": -0.0112, "num_tokens": 380692919.0, "reward": 1.0205078303813935, "reward_std": 0.23931595981121062, "rewards/reward_accuracy/mean": 0.921484375, "rewards/reward_accuracy/std": 0.23645213544368743, "rewards/reward_format/mean": 0.09902343824505806, "rewards/reward_format/std": 0.006364708347246051, "sampling/importance_sampling_ratio/max": 2.463054084777832, "sampling/importance_sampling_ratio/mean": 0.9897466897964478, "sampling/importance_sampling_ratio/min": 0.15956836370751262, "sampling/sampling_logp_difference/max": 0.8044601678848267, "sampling/sampling_logp_difference/mean": 0.004700424941256642, "step": 3490, "step_time": 7.733619213412749 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0078125, "completions/max_length": 1491.9, "completions/max_terminated_length": 1301.6, "completions/mean_length": 183.9828125, "completions/mean_terminated_length": 169.66688385009766, "completions/min_length": 63.9, "completions/min_terminated_length": 63.9, "entropy": 0.07193335867486894, "epoch": 7.494646680942184, "frac_reward_zero_std": 0.85, "grad_norm": 0.447265625, "learning_rate": 9.650100000000001e-06, "loss": -0.0038, "num_tokens": 381680683.0, "reward": 1.0352734625339508, "reward_std": 0.22542870789766312, "rewards/reward_accuracy/mean": 0.9359375, "rewards/reward_accuracy/std": 0.22362848296761512, "rewards/reward_format/mean": 0.09933593794703484, "rewards/reward_format/std": 0.004681437858380377, "sampling/importance_sampling_ratio/max": 2.579133939743042, "sampling/importance_sampling_ratio/mean": 0.9951997339725495, "sampling/importance_sampling_ratio/min": 0.10664892476052046, "sampling/sampling_logp_difference/max": 0.9161568403244018, "sampling/sampling_logp_difference/mean": 0.004791031149215997, "step": 3500, "step_time": 7.226418416496017 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.014453125, "completions/max_length": 1754.7, "completions/max_terminated_length": 1501.9, "completions/mean_length": 213.523046875, "completions/mean_terminated_length": 186.93712615966797, "completions/min_length": 66.4, "completions/min_terminated_length": 66.4, "entropy": 0.08276629685424268, "epoch": 7.516059957173447, "frac_reward_zero_std": 0.7875, "grad_norm": 0.58984375, "learning_rate": 9.6491e-06, "loss": -0.0192, "num_tokens": 382747030.0, "reward": 1.0307031393051147, "reward_std": 0.20840179056394845, "rewards/reward_accuracy/mean": 0.93203125, "rewards/reward_accuracy/std": 0.20445542484521867, "rewards/reward_format/mean": 0.09867187663912773, "rewards/reward_format/std": 0.008004973968490958, "sampling/importance_sampling_ratio/max": 2.488348937034607, "sampling/importance_sampling_ratio/mean": 0.9904955327510834, "sampling/importance_sampling_ratio/min": 0.07925322242081165, "sampling/sampling_logp_difference/max": 0.9046316027641297, "sampling/sampling_logp_difference/mean": 0.005093022738583386, "step": 3510, "step_time": 9.069562981493073 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00703125, "completions/max_length": 1817.2, "completions/max_terminated_length": 1682.8, "completions/mean_length": 196.301171875, "completions/mean_terminated_length": 183.21285858154297, "completions/min_length": 66.9, "completions/min_terminated_length": 66.9, "entropy": 0.0781431627459824, "epoch": 7.537473233404711, "frac_reward_zero_std": 0.8125, "grad_norm": 0.2138671875, "learning_rate": 9.6481e-06, "loss": -0.0086, "num_tokens": 383768473.0, "reward": 1.0382617354393004, "reward_std": 0.23688462674617766, "rewards/reward_accuracy/mean": 0.9390625, "rewards/reward_accuracy/std": 0.23389212191104888, "rewards/reward_format/mean": 0.0991992212831974, "rewards/reward_format/std": 0.0061727965017780665, "sampling/importance_sampling_ratio/max": 2.515777027606964, "sampling/importance_sampling_ratio/mean": 0.9892849266529083, "sampling/importance_sampling_ratio/min": 0.06451786058023572, "sampling/sampling_logp_difference/max": 0.8503926396369934, "sampling/sampling_logp_difference/mean": 0.005204221839085222, "step": 3520, "step_time": 8.839511836090242 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.008203125, "completions/max_length": 1853.2, "completions/max_terminated_length": 1539.9, "completions/mean_length": 206.81640625, "completions/mean_terminated_length": 191.7426971435547, "completions/min_length": 71.4, "completions/min_terminated_length": 71.4, "entropy": 0.07850905498489738, "epoch": 7.5588865096359745, "frac_reward_zero_std": 0.74375, "grad_norm": 0.1572265625, "learning_rate": 9.647100000000001e-06, "loss": -0.0192, "num_tokens": 384824675.0, "reward": 1.0029101729393006, "reward_std": 0.2915870785713196, "rewards/reward_accuracy/mean": 0.903515625, "rewards/reward_accuracy/std": 0.28989855796098707, "rewards/reward_format/mean": 0.09939453303813935, "rewards/reward_format/std": 0.004416590882465243, "sampling/importance_sampling_ratio/max": 2.3227914571762085, "sampling/importance_sampling_ratio/mean": 0.9731649398803711, "sampling/importance_sampling_ratio/min": 0.05918755829334259, "sampling/sampling_logp_difference/max": 1.1002968966960907, "sampling/sampling_logp_difference/mean": 0.0051331820897758005, "step": 3530, "step_time": 8.962081403494812 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.006640625, "completions/max_length": 1795.3, "completions/max_terminated_length": 1648.1, "completions/mean_length": 206.9046875, "completions/mean_terminated_length": 194.70974884033203, "completions/min_length": 66.2, "completions/min_terminated_length": 66.2, "entropy": 0.0791555711068213, "epoch": 7.580299785867238, "frac_reward_zero_std": 0.7625, "grad_norm": 0.609375, "learning_rate": 9.6461e-06, "loss": -0.0098, "num_tokens": 385875151.0, "reward": 1.032187533378601, "reward_std": 0.2269599534571171, "rewards/reward_accuracy/mean": 0.9328125, "rewards/reward_accuracy/std": 0.22451604753732682, "rewards/reward_format/mean": 0.09937500208616257, "rewards/reward_format/std": 0.0063434979412704704, "sampling/importance_sampling_ratio/max": 2.4235900402069093, "sampling/importance_sampling_ratio/mean": 0.9742930710315705, "sampling/importance_sampling_ratio/min": 0.044096536189317706, "sampling/sampling_logp_difference/max": 0.9425219833850861, "sampling/sampling_logp_difference/mean": 0.005189129477366805, "step": 3540, "step_time": 8.735905734007247 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00703125, "completions/max_length": 1817.4, "completions/max_terminated_length": 1457.0, "completions/mean_length": 189.296875, "completions/mean_terminated_length": 176.27302093505858, "completions/min_length": 68.6, "completions/min_terminated_length": 68.6, "entropy": 0.08457684773020446, "epoch": 7.601713062098501, "frac_reward_zero_std": 0.81875, "grad_norm": 0.65625, "learning_rate": 9.6451e-06, "loss": -0.0084, "num_tokens": 386865943.0, "reward": 1.0298437654972077, "reward_std": 0.23030798956751825, "rewards/reward_accuracy/mean": 0.93046875, "rewards/reward_accuracy/std": 0.22799715101718904, "rewards/reward_format/mean": 0.09937500134110451, "rewards/reward_format/std": 0.0058000365039333705, "sampling/importance_sampling_ratio/max": 2.4601676225662232, "sampling/importance_sampling_ratio/mean": 0.985438346862793, "sampling/importance_sampling_ratio/min": 0.05417675971984863, "sampling/sampling_logp_difference/max": 1.2866152942180633, "sampling/sampling_logp_difference/mean": 0.005278515862300992, "step": 3550, "step_time": 8.724588283686899 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0109375, "completions/max_length": 1924.0, "completions/max_terminated_length": 1833.3, "completions/mean_length": 221.47578125, "completions/mean_terminated_length": 201.39368591308593, "completions/min_length": 64.0, "completions/min_terminated_length": 64.0, "entropy": 0.09304863582365215, "epoch": 7.623126338329764, "frac_reward_zero_std": 0.775, "grad_norm": 0.482421875, "learning_rate": 9.644100000000001e-06, "loss": -0.0149, "num_tokens": 387948073.0, "reward": 1.0230078160762788, "reward_std": 0.24172194972634314, "rewards/reward_accuracy/mean": 0.923828125, "rewards/reward_accuracy/std": 0.23951757848262786, "rewards/reward_format/mean": 0.09917968809604645, "rewards/reward_format/std": 0.006854501576162875, "sampling/importance_sampling_ratio/max": 2.5714925646781923, "sampling/importance_sampling_ratio/mean": 0.9695788264274597, "sampling/importance_sampling_ratio/min": 0.007600085623562336, "sampling/sampling_logp_difference/max": 1.1584279179573058, "sampling/sampling_logp_difference/mean": 0.0053932322189211845, "step": 3560, "step_time": 9.565942136521334 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.02109375, "completions/max_length": 1888.2, "completions/max_terminated_length": 1693.4, "completions/mean_length": 229.6140625, "completions/mean_terminated_length": 192.34349517822267, "completions/min_length": 65.4, "completions/min_terminated_length": 65.4, "entropy": 0.08904545116238297, "epoch": 7.644539614561028, "frac_reward_zero_std": 0.75, "grad_norm": 0.263671875, "learning_rate": 9.643100000000001e-06, "loss": -0.0102, "num_tokens": 389059565.0, "reward": 1.0058203518390656, "reward_std": 0.2585896894335747, "rewards/reward_accuracy/mean": 0.907421875, "rewards/reward_accuracy/std": 0.25480627194046973, "rewards/reward_format/mean": 0.09839844033122062, "rewards/reward_format/std": 0.008473186567425729, "sampling/importance_sampling_ratio/max": 2.564835250377655, "sampling/importance_sampling_ratio/mean": 0.9578584909439087, "sampling/importance_sampling_ratio/min": 0.0394745871424675, "sampling/sampling_logp_difference/max": 1.1935293197631835, "sampling/sampling_logp_difference/mean": 0.005618822993710637, "step": 3570, "step_time": 9.460387960809749 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.007421875, "completions/max_length": 1819.9, "completions/max_terminated_length": 1489.8, "completions/mean_length": 186.5265625, "completions/mean_terminated_length": 172.73394775390625, "completions/min_length": 67.2, "completions/min_terminated_length": 67.2, "entropy": 0.06988995401188731, "epoch": 7.665952890792291, "frac_reward_zero_std": 0.74375, "grad_norm": 0.306640625, "learning_rate": 9.6421e-06, "loss": -0.0028, "num_tokens": 390054241.0, "reward": 1.0274023532867431, "reward_std": 0.24801826775074004, "rewards/reward_accuracy/mean": 0.928125, "rewards/reward_accuracy/std": 0.24562657102942467, "rewards/reward_format/mean": 0.09927734434604644, "rewards/reward_format/std": 0.006919173197820783, "sampling/importance_sampling_ratio/max": 2.477069878578186, "sampling/importance_sampling_ratio/mean": 0.9831757187843323, "sampling/importance_sampling_ratio/min": 0.08418161347508431, "sampling/sampling_logp_difference/max": 0.947005671262741, "sampling/sampling_logp_difference/mean": 0.004719699919223786, "step": 3580, "step_time": 8.90005328807456 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 1862.9, "completions/max_terminated_length": 1581.9, "completions/mean_length": 183.81171875, "completions/mean_terminated_length": 176.5430877685547, "completions/min_length": 64.1, "completions/min_terminated_length": 64.1, "entropy": 0.07487209462560714, "epoch": 7.687366167023555, "frac_reward_zero_std": 0.8375, "grad_norm": 0.6953125, "learning_rate": 9.641100000000002e-06, "loss": -0.0104, "num_tokens": 391040863.0, "reward": 1.0316406309604644, "reward_std": 0.24393230751156808, "rewards/reward_accuracy/mean": 0.93203125, "rewards/reward_accuracy/std": 0.24248645678162575, "rewards/reward_format/mean": 0.099609375, "rewards/reward_format/std": 0.00464201879221946, "sampling/importance_sampling_ratio/max": 2.5126524925231934, "sampling/importance_sampling_ratio/mean": 0.9803758919239044, "sampling/importance_sampling_ratio/min": 0.07837437689304352, "sampling/sampling_logp_difference/max": 0.882181179523468, "sampling/sampling_logp_difference/mean": 0.005024082958698273, "step": 3590, "step_time": 8.84325868258602 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.000390625, "completions/max_length": 1413.3, "completions/max_terminated_length": 1367.7, "completions/mean_length": 153.744140625, "completions/mean_terminated_length": 153.01878204345704, "completions/min_length": 63.7, "completions/min_terminated_length": 63.7, "entropy": 0.06162530113942921, "epoch": 7.708779443254818, "frac_reward_zero_std": 0.8125, "grad_norm": 0.486328125, "learning_rate": 9.640100000000001e-06, "loss": -0.0065, "num_tokens": 391952880.0, "reward": 1.0361523509025574, "reward_std": 0.23276183232665063, "rewards/reward_accuracy/mean": 0.936328125, "rewards/reward_accuracy/std": 0.23221236988902091, "rewards/reward_format/mean": 0.09982421919703484, "rewards/reward_format/std": 0.00199988700915128, "sampling/importance_sampling_ratio/max": 2.4381773471832275, "sampling/importance_sampling_ratio/mean": 0.9946589350700379, "sampling/importance_sampling_ratio/min": 0.07329367585480213, "sampling/sampling_logp_difference/max": 0.9881549894809722, "sampling/sampling_logp_difference/mean": 0.004518144554458559, "step": 3600, "step_time": 6.866538394390955 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.009765625, "completions/max_length": 1541.2, "completions/max_terminated_length": 1313.8, "completions/mean_length": 182.4, "completions/mean_terminated_length": 164.1815383911133, "completions/min_length": 59.4, "completions/min_terminated_length": 59.4, "entropy": 0.07097981446422637, "epoch": 7.730192719486081, "frac_reward_zero_std": 0.8125, "grad_norm": 0.5703125, "learning_rate": 9.6391e-06, "loss": -0.0037, "num_tokens": 392939104.0, "reward": 1.0351367473602295, "reward_std": 0.23881253004074096, "rewards/reward_accuracy/mean": 0.9359375, "rewards/reward_accuracy/std": 0.23561812788248063, "rewards/reward_format/mean": 0.09919922053813934, "rewards/reward_format/std": 0.006413435004651547, "sampling/importance_sampling_ratio/max": 2.6525344610214234, "sampling/importance_sampling_ratio/mean": 0.9833298921585083, "sampling/importance_sampling_ratio/min": 0.05296989688649774, "sampling/sampling_logp_difference/max": 0.9195618748664856, "sampling/sampling_logp_difference/mean": 0.004944087658077479, "step": 3610, "step_time": 7.557211775402538 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00546875, "completions/max_length": 1736.9, "completions/max_terminated_length": 1619.9, "completions/mean_length": 184.566796875, "completions/mean_terminated_length": 174.36035766601563, "completions/min_length": 68.2, "completions/min_terminated_length": 68.2, "entropy": 0.07384573463350534, "epoch": 7.751605995717345, "frac_reward_zero_std": 0.8, "grad_norm": 0.5625, "learning_rate": 9.6381e-06, "loss": -0.0076, "num_tokens": 393937227.0, "reward": 0.993437510728836, "reward_std": 0.29238147512078283, "rewards/reward_accuracy/mean": 0.894140625, "rewards/reward_accuracy/std": 0.29034136310219766, "rewards/reward_format/mean": 0.09929687604308128, "rewards/reward_format/std": 0.005527540226466954, "sampling/importance_sampling_ratio/max": 2.4159623861312864, "sampling/importance_sampling_ratio/mean": 0.9724921345710754, "sampling/importance_sampling_ratio/min": 0.021895610028877854, "sampling/sampling_logp_difference/max": 1.036386638879776, "sampling/sampling_logp_difference/mean": 0.005005701188929379, "step": 3620, "step_time": 8.491100533597637 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01015625, "completions/max_length": 1622.1, "completions/max_terminated_length": 1377.2, "completions/mean_length": 191.89765625, "completions/mean_terminated_length": 173.2733169555664, "completions/min_length": 64.6, "completions/min_terminated_length": 64.6, "entropy": 0.07273952085524797, "epoch": 7.773019271948608, "frac_reward_zero_std": 0.81875, "grad_norm": 0.263671875, "learning_rate": 9.6371e-06, "loss": -0.007, "num_tokens": 394946501.0, "reward": 1.0200586140155792, "reward_std": 0.2624057486653328, "rewards/reward_accuracy/mean": 0.92109375, "rewards/reward_accuracy/std": 0.25927504748106, "rewards/reward_format/mean": 0.09896484389901161, "rewards/reward_format/std": 0.006811006413772702, "sampling/importance_sampling_ratio/max": 2.4956888437271116, "sampling/importance_sampling_ratio/mean": 0.9809256136417389, "sampling/importance_sampling_ratio/min": 0.0752164799720049, "sampling/sampling_logp_difference/max": 0.954933226108551, "sampling/sampling_logp_difference/mean": 0.004880118020810187, "step": 3630, "step_time": 8.053718394509634 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00859375, "completions/max_length": 1883.7, "completions/max_terminated_length": 1488.8, "completions/mean_length": 197.656640625, "completions/mean_terminated_length": 181.68404388427734, "completions/min_length": 71.1, "completions/min_terminated_length": 71.1, "entropy": 0.07658664807677269, "epoch": 7.794432548179872, "frac_reward_zero_std": 0.8, "grad_norm": 0.25, "learning_rate": 9.6361e-06, "loss": -0.0104, "num_tokens": 395977062.0, "reward": 1.0218945562839508, "reward_std": 0.2440083459019661, "rewards/reward_accuracy/mean": 0.92265625, "rewards/reward_accuracy/std": 0.24121633172035217, "rewards/reward_format/mean": 0.09923828318715096, "rewards/reward_format/std": 0.006383325299248099, "sampling/importance_sampling_ratio/max": 2.5979174613952636, "sampling/importance_sampling_ratio/mean": 0.974828165769577, "sampling/importance_sampling_ratio/min": 0.01637764656916261, "sampling/sampling_logp_difference/max": 1.1134831428527832, "sampling/sampling_logp_difference/mean": 0.005246490146964789, "step": 3640, "step_time": 8.961128801983431 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.009375, "completions/max_length": 1902.5, "completions/max_terminated_length": 1825.8, "completions/mean_length": 211.565625, "completions/mean_terminated_length": 194.54564056396484, "completions/min_length": 61.9, "completions/min_terminated_length": 61.9, "entropy": 0.08680205158889294, "epoch": 7.815845824411135, "frac_reward_zero_std": 0.78125, "grad_norm": 0.88671875, "learning_rate": 9.6351e-06, "loss": -0.0127, "num_tokens": 397040318.0, "reward": 0.9910742282867432, "reward_std": 0.303937791287899, "rewards/reward_accuracy/mean": 0.8921875, "rewards/reward_accuracy/std": 0.301007391512394, "rewards/reward_format/mean": 0.09888671934604645, "rewards/reward_format/std": 0.007982184877619147, "sampling/importance_sampling_ratio/max": 2.5114677429199217, "sampling/importance_sampling_ratio/mean": 0.9812928259372711, "sampling/importance_sampling_ratio/min": 0.04791516810655594, "sampling/sampling_logp_difference/max": 0.85448357462883, "sampling/sampling_logp_difference/mean": 0.005207560583949089, "step": 3650, "step_time": 9.59593158919888 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 3.819166113316896e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 3.819166113316896e-06, "completions/clipped_ratio": 0.009375, "completions/max_length": 1321.8, "completions/max_terminated_length": 1175.3, "completions/mean_length": 186.241015625, "completions/mean_terminated_length": 169.10425872802733, "completions/min_length": 65.3, "completions/min_terminated_length": 65.3, "entropy": 0.0710672412533313, "epoch": 7.837259100642398, "frac_reward_zero_std": 0.7875, "grad_norm": 0.65625, "learning_rate": 9.634100000000001e-06, "loss": -0.0074, "num_tokens": 398028759.0, "reward": 0.9987500309944153, "reward_std": 0.27971908673644064, "rewards/reward_accuracy/mean": 0.899609375, "rewards/reward_accuracy/std": 0.27756142392754557, "rewards/reward_format/mean": 0.09914062544703484, "rewards/reward_format/std": 0.005712301400490105, "sampling/importance_sampling_ratio/max": 2.516208219528198, "sampling/importance_sampling_ratio/mean": 0.9828593611717225, "sampling/importance_sampling_ratio/min": 0.1660709038376808, "sampling/sampling_logp_difference/max": 0.8381636142730713, "sampling/sampling_logp_difference/mean": 0.004968195478431881, "step": 3660, "step_time": 6.694674244601629 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.009375, "completions/max_length": 1703.3, "completions/max_terminated_length": 1525.9, "completions/mean_length": 200.278125, "completions/mean_terminated_length": 182.94378356933595, "completions/min_length": 63.7, "completions/min_terminated_length": 63.7, "entropy": 0.07680323896929622, "epoch": 7.8586723768736615, "frac_reward_zero_std": 0.79375, "grad_norm": 0.5703125, "learning_rate": 9.633100000000001e-06, "loss": -0.0019, "num_tokens": 399056143.0, "reward": 1.0061328172683717, "reward_std": 0.25569341629743575, "rewards/reward_accuracy/mean": 0.90703125, "rewards/reward_accuracy/std": 0.25296593010425567, "rewards/reward_format/mean": 0.09910156279802322, "rewards/reward_format/std": 0.006601125723682344, "sampling/importance_sampling_ratio/max": 2.408440613746643, "sampling/importance_sampling_ratio/mean": 0.9852367758750915, "sampling/importance_sampling_ratio/min": 0.08956236690282822, "sampling/sampling_logp_difference/max": 0.8555589020252228, "sampling/sampling_logp_difference/mean": 0.00488103877287358, "step": 3670, "step_time": 8.498199324894813 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005859375, "completions/max_length": 2022.1, "completions/max_terminated_length": 1577.4, "completions/mean_length": 181.386328125, "completions/mean_terminated_length": 170.41501159667968, "completions/min_length": 61.2, "completions/min_terminated_length": 61.2, "entropy": 0.07189276609569788, "epoch": 7.880085653104925, "frac_reward_zero_std": 0.76875, "grad_norm": 0.65625, "learning_rate": 9.6321e-06, "loss": -0.0127, "num_tokens": 400038796.0, "reward": 1.0296094000339509, "reward_std": 0.2437703162431717, "rewards/reward_accuracy/mean": 0.930078125, "rewards/reward_accuracy/std": 0.24181726574897766, "rewards/reward_format/mean": 0.0995312511920929, "rewards/reward_format/std": 0.005712272552773357, "sampling/importance_sampling_ratio/max": 2.4558380603790284, "sampling/importance_sampling_ratio/mean": 0.9910882115364075, "sampling/importance_sampling_ratio/min": 0.03984439447522163, "sampling/sampling_logp_difference/max": 0.9436381161212921, "sampling/sampling_logp_difference/mean": 0.004988160962238908, "step": 3680, "step_time": 9.493378731410484 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003125, "completions/max_length": 1724.5, "completions/max_terminated_length": 1154.7, "completions/mean_length": 171.28125, "completions/mean_terminated_length": 165.44564819335938, "completions/min_length": 69.7, "completions/min_terminated_length": 69.7, "entropy": 0.0719589474145323, "epoch": 7.901498929336189, "frac_reward_zero_std": 0.81875, "grad_norm": 0.75390625, "learning_rate": 9.631100000000002e-06, "loss": -0.0005, "num_tokens": 400996140.0, "reward": 1.012187522649765, "reward_std": 0.25294241309165955, "rewards/reward_accuracy/mean": 0.9125, "rewards/reward_accuracy/std": 0.25202185809612276, "rewards/reward_format/mean": 0.09968750104308129, "rewards/reward_format/std": 0.003634945582598448, "sampling/importance_sampling_ratio/max": 2.2970234632492064, "sampling/importance_sampling_ratio/mean": 0.9807588636875153, "sampling/importance_sampling_ratio/min": 0.13293177597224712, "sampling/sampling_logp_difference/max": 0.8728315591812134, "sampling/sampling_logp_difference/mean": 0.004985981550998986, "step": 3690, "step_time": 7.96694088280492 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005859375, "completions/max_length": 1504.6, "completions/max_terminated_length": 1418.0, "completions/mean_length": 186.7109375, "completions/mean_terminated_length": 175.95427703857422, "completions/min_length": 62.1, "completions/min_terminated_length": 62.1, "entropy": 0.07433808813802897, "epoch": 7.922912205567452, "frac_reward_zero_std": 0.8125, "grad_norm": 0.96484375, "learning_rate": 9.630100000000001e-06, "loss": -0.0089, "num_tokens": 401998536.0, "reward": 1.0114648580551147, "reward_std": 0.2568421721458435, "rewards/reward_accuracy/mean": 0.912109375, "rewards/reward_accuracy/std": 0.2552545391023159, "rewards/reward_format/mean": 0.09935546964406967, "rewards/reward_format/std": 0.004978313413448632, "sampling/importance_sampling_ratio/max": 2.4995922803878785, "sampling/importance_sampling_ratio/mean": 0.9829632818698884, "sampling/importance_sampling_ratio/min": 0.08666891697794199, "sampling/sampling_logp_difference/max": 0.7658428430557251, "sampling/sampling_logp_difference/mean": 0.005094771878793836, "step": 3700, "step_time": 7.329949528616271 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00703125, "completions/max_length": 1762.6, "completions/max_terminated_length": 1571.9, "completions/mean_length": 199.070703125, "completions/mean_terminated_length": 186.23992767333985, "completions/min_length": 61.1, "completions/min_terminated_length": 61.1, "entropy": 0.07969725895673037, "epoch": 7.944325481798716, "frac_reward_zero_std": 0.85, "grad_norm": 0.6953125, "learning_rate": 9.6291e-06, "loss": -0.0033, "num_tokens": 403020429.0, "reward": 1.0263476729393006, "reward_std": 0.24410187900066377, "rewards/reward_accuracy/mean": 0.926953125, "rewards/reward_accuracy/std": 0.2422624871134758, "rewards/reward_format/mean": 0.09939453229308129, "rewards/reward_format/std": 0.004947800538502634, "sampling/importance_sampling_ratio/max": 2.3103965640068056, "sampling/importance_sampling_ratio/mean": 0.9862733900547027, "sampling/importance_sampling_ratio/min": 0.07895481958985329, "sampling/sampling_logp_difference/max": 0.7938117921352387, "sampling/sampling_logp_difference/mean": 0.005103780189529061, "step": 3710, "step_time": 8.465698415998485 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.006640625, "completions/max_length": 1668.6, "completions/max_terminated_length": 1502.2, "completions/mean_length": 183.2171875, "completions/mean_terminated_length": 171.04286193847656, "completions/min_length": 65.0, "completions/min_terminated_length": 65.0, "entropy": 0.07522350461222231, "epoch": 7.965738758029978, "frac_reward_zero_std": 0.79375, "grad_norm": 0.6875, "learning_rate": 9.628100000000002e-06, "loss": -0.0078, "num_tokens": 404006905.0, "reward": 1.0255468666553498, "reward_std": 0.24899236112833023, "rewards/reward_accuracy/mean": 0.926171875, "rewards/reward_accuracy/std": 0.2472747214138508, "rewards/reward_format/mean": 0.09937499985098838, "rewards/reward_format/std": 0.0054496222408488395, "sampling/importance_sampling_ratio/max": 2.4028526544570923, "sampling/importance_sampling_ratio/mean": 0.971779876947403, "sampling/importance_sampling_ratio/min": 0.06447021961212158, "sampling/sampling_logp_difference/max": 1.0346944272518157, "sampling/sampling_logp_difference/mean": 0.005029352009296417, "step": 3720, "step_time": 8.072778747498523 }, { "clip_ratio/high_max": 9.1552734375e-06, "clip_ratio/high_mean": 1.1444091796875e-06, "clip_ratio/low_mean": 4.011108376289485e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 5.155517555976985e-06, "completions/clipped_ratio": 0.0109375, "completions/max_length": 1908.8, "completions/max_terminated_length": 1646.3, "completions/mean_length": 195.17734375, "completions/mean_terminated_length": 174.70513458251952, "completions/min_length": 66.0, "completions/min_terminated_length": 66.0, "entropy": 0.07118748272769153, "epoch": 7.987152034261242, "frac_reward_zero_std": 0.8, "grad_norm": 0.404296875, "learning_rate": 9.6271e-06, "loss": -0.0129, "num_tokens": 405020543.0, "reward": 1.0153711199760438, "reward_std": 0.2749387174844742, "rewards/reward_accuracy/mean": 0.91640625, "rewards/reward_accuracy/std": 0.27147911190986634, "rewards/reward_format/mean": 0.09896484464406967, "rewards/reward_format/std": 0.007013841788284481, "sampling/importance_sampling_ratio/max": 2.3268468499183657, "sampling/importance_sampling_ratio/mean": 0.9711576759815216, "sampling/importance_sampling_ratio/min": 0.02354610301554203, "sampling/sampling_logp_difference/max": 0.8829498171806336, "sampling/sampling_logp_difference/mean": 0.004902356583625078, "step": 3730, "step_time": 9.247705227797269 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.004296875, "completions/max_length": 1585.6, "completions/max_terminated_length": 1469.5, "completions/mean_length": 178.11015625, "completions/mean_terminated_length": 170.1226608276367, "completions/min_length": 69.9, "completions/min_terminated_length": 69.9, "entropy": 0.06943011377006769, "epoch": 8.008565310492505, "frac_reward_zero_std": 0.81875, "grad_norm": 0.66796875, "learning_rate": 9.626100000000001e-06, "loss": -0.0075, "num_tokens": 405997657.0, "reward": 1.0151367366313935, "reward_std": 0.2644330531358719, "rewards/reward_accuracy/mean": 0.915625, "rewards/reward_accuracy/std": 0.2630834482610226, "rewards/reward_format/mean": 0.09951172024011612, "rewards/reward_format/std": 0.004223581124097109, "sampling/importance_sampling_ratio/max": 2.6009578466415406, "sampling/importance_sampling_ratio/mean": 0.9898089349269867, "sampling/importance_sampling_ratio/min": 0.10675678215920925, "sampling/sampling_logp_difference/max": 0.7498188316822052, "sampling/sampling_logp_difference/mean": 0.004846835159696639, "step": 3740, "step_time": 7.76293811298674 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.013671875, "completions/max_length": 1525.4, "completions/max_terminated_length": 1308.7, "completions/mean_length": 196.873046875, "completions/mean_terminated_length": 171.40442962646483, "completions/min_length": 67.0, "completions/min_terminated_length": 67.0, "entropy": 0.07221182179637253, "epoch": 8.029978586723768, "frac_reward_zero_std": 0.825, "grad_norm": 0.1923828125, "learning_rate": 9.6251e-06, "loss": -0.0049, "num_tokens": 407023716.0, "reward": 1.0281054854393006, "reward_std": 0.22869482561945914, "rewards/reward_accuracy/mean": 0.929296875, "rewards/reward_accuracy/std": 0.22519356682896613, "rewards/reward_format/mean": 0.09880859628319741, "rewards/reward_format/std": 0.007678109756670892, "sampling/importance_sampling_ratio/max": 2.6184497833251954, "sampling/importance_sampling_ratio/mean": 0.9955185294151306, "sampling/importance_sampling_ratio/min": 0.056230538664385675, "sampling/sampling_logp_difference/max": 1.3605676174163819, "sampling/sampling_logp_difference/mean": 0.0050271323416382074, "step": 3750, "step_time": 7.80916282319522 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003125, "completions/max_length": 1355.2, "completions/max_terminated_length": 1325.7, "completions/mean_length": 172.155078125, "completions/mean_terminated_length": 166.37023162841797, "completions/min_length": 69.9, "completions/min_terminated_length": 69.9, "entropy": 0.06300332336686551, "epoch": 8.051391862955033, "frac_reward_zero_std": 0.85625, "grad_norm": 0.0, "learning_rate": 9.6241e-06, "loss": -0.0029, "num_tokens": 407984193.0, "reward": 1.0425976812839508, "reward_std": 0.19198148548603058, "rewards/reward_accuracy/mean": 0.94296875, "rewards/reward_accuracy/std": 0.19070358127355574, "rewards/reward_format/mean": 0.09962890669703484, "rewards/reward_format/std": 0.003335496480576694, "sampling/importance_sampling_ratio/max": 2.411038029193878, "sampling/importance_sampling_ratio/mean": 0.9854229629039765, "sampling/importance_sampling_ratio/min": 0.14093984365463258, "sampling/sampling_logp_difference/max": 1.0589303851127625, "sampling/sampling_logp_difference/mean": 0.004798770183697343, "step": 3760, "step_time": 6.636301019290113 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.008984375, "completions/max_length": 1472.7, "completions/max_terminated_length": 1255.5, "completions/mean_length": 188.738671875, "completions/mean_terminated_length": 171.95799407958984, "completions/min_length": 69.0, "completions/min_terminated_length": 69.0, "entropy": 0.07154895877465606, "epoch": 8.072805139186295, "frac_reward_zero_std": 0.8125, "grad_norm": 0.7265625, "learning_rate": 9.623100000000001e-06, "loss": -0.0027, "num_tokens": 408987828.0, "reward": 1.0284570574760437, "reward_std": 0.24332563877105712, "rewards/reward_accuracy/mean": 0.929296875, "rewards/reward_accuracy/std": 0.24028788208961488, "rewards/reward_format/mean": 0.09916015937924386, "rewards/reward_format/std": 0.006636243313550949, "sampling/importance_sampling_ratio/max": 2.4399747133255003, "sampling/importance_sampling_ratio/mean": 0.9925406098365783, "sampling/importance_sampling_ratio/min": 0.06600186359137297, "sampling/sampling_logp_difference/max": 0.9295972764492035, "sampling/sampling_logp_difference/mean": 0.004938566498458386, "step": 3770, "step_time": 7.337033506896114 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00546875, "completions/max_length": 1808.9, "completions/max_terminated_length": 1743.9, "completions/mean_length": 191.507421875, "completions/mean_terminated_length": 181.32374725341796, "completions/min_length": 66.8, "completions/min_terminated_length": 66.8, "entropy": 0.07426097993738949, "epoch": 8.09421841541756, "frac_reward_zero_std": 0.7875, "grad_norm": 0.447265625, "learning_rate": 9.6221e-06, "loss": -0.0083, "num_tokens": 410002199.0, "reward": 1.0403515934944152, "reward_std": 0.23262374550104142, "rewards/reward_accuracy/mean": 0.941015625, "rewards/reward_accuracy/std": 0.23009302020072936, "rewards/reward_format/mean": 0.09933593943715095, "rewards/reward_format/std": 0.005747985513880849, "sampling/importance_sampling_ratio/max": 2.396500062942505, "sampling/importance_sampling_ratio/mean": 0.9819609582424164, "sampling/importance_sampling_ratio/min": 0.08978751078248023, "sampling/sampling_logp_difference/max": 0.8196139693260193, "sampling/sampling_logp_difference/mean": 0.004950267192907631, "step": 3780, "step_time": 8.595623963692924 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.002734375, "completions/max_length": 1439.2, "completions/max_terminated_length": 1206.4, "completions/mean_length": 183.865625, "completions/mean_terminated_length": 178.82349243164063, "completions/min_length": 67.8, "completions/min_terminated_length": 67.8, "entropy": 0.0743003737181425, "epoch": 8.115631691648822, "frac_reward_zero_std": 0.79375, "grad_norm": 0.59765625, "learning_rate": 9.621100000000002e-06, "loss": -0.0072, "num_tokens": 410991167.0, "reward": 1.0492383003234864, "reward_std": 0.1949968434870243, "rewards/reward_accuracy/mean": 0.949609375, "rewards/reward_accuracy/std": 0.19366877749562264, "rewards/reward_format/mean": 0.09962890744209289, "rewards/reward_format/std": 0.0030854525743052364, "sampling/importance_sampling_ratio/max": 2.316741394996643, "sampling/importance_sampling_ratio/mean": 0.9840766787528992, "sampling/importance_sampling_ratio/min": 0.12593643963336945, "sampling/sampling_logp_difference/max": 1.0400145888328551, "sampling/sampling_logp_difference/mean": 0.004929111385717988, "step": 3790, "step_time": 6.94505109868769 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003125, "completions/max_length": 1687.8, "completions/max_terminated_length": 1491.5, "completions/mean_length": 200.145703125, "completions/mean_terminated_length": 194.45872802734374, "completions/min_length": 69.0, "completions/min_terminated_length": 69.0, "entropy": 0.08579575503244996, "epoch": 8.137044967880085, "frac_reward_zero_std": 0.80625, "grad_norm": 0.71484375, "learning_rate": 9.620100000000001e-06, "loss": -0.0104, "num_tokens": 412017892.0, "reward": 1.015898460149765, "reward_std": 0.2665177546441555, "rewards/reward_accuracy/mean": 0.91640625, "rewards/reward_accuracy/std": 0.26460591033101083, "rewards/reward_format/mean": 0.09949218854308128, "rewards/reward_format/std": 0.003872173675335944, "sampling/importance_sampling_ratio/max": 2.498238277435303, "sampling/importance_sampling_ratio/mean": 0.9729526996612549, "sampling/importance_sampling_ratio/min": 0.08811372620984911, "sampling/sampling_logp_difference/max": 0.8661998271942138, "sampling/sampling_logp_difference/mean": 0.005292421439662576, "step": 3800, "step_time": 8.062254661292537 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 1787.2, "completions/max_terminated_length": 1694.4, "completions/mean_length": 179.453125, "completions/mean_terminated_length": 172.2001480102539, "completions/min_length": 69.4, "completions/min_terminated_length": 69.4, "entropy": 0.0699522809125483, "epoch": 8.15845824411135, "frac_reward_zero_std": 0.80625, "grad_norm": 0.431640625, "learning_rate": 9.6191e-06, "loss": -0.0047, "num_tokens": 412997068.0, "reward": 1.0351953268051148, "reward_std": 0.23319539651274682, "rewards/reward_accuracy/mean": 0.935546875, "rewards/reward_accuracy/std": 0.2317265659570694, "rewards/reward_format/mean": 0.09964843839406967, "rewards/reward_format/std": 0.003943874104879797, "sampling/importance_sampling_ratio/max": 2.4632247567176817, "sampling/importance_sampling_ratio/mean": 0.9887737691402435, "sampling/importance_sampling_ratio/min": 0.1253064639866352, "sampling/sampling_logp_difference/max": 0.7952985286712646, "sampling/sampling_logp_difference/mean": 0.005012022657319903, "step": 3810, "step_time": 8.52721339269774 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.008203125, "completions/max_length": 1638.7, "completions/max_terminated_length": 1483.6, "completions/mean_length": 197.644140625, "completions/mean_terminated_length": 182.63299407958985, "completions/min_length": 66.7, "completions/min_terminated_length": 66.7, "entropy": 0.07350199185311794, "epoch": 8.179871520342612, "frac_reward_zero_std": 0.8125, "grad_norm": 0.53125, "learning_rate": 9.618100000000002e-06, "loss": -0.0039, "num_tokens": 414018909.0, "reward": 1.0316601812839508, "reward_std": 0.24444497749209404, "rewards/reward_accuracy/mean": 0.932421875, "rewards/reward_accuracy/std": 0.24194783195853234, "rewards/reward_format/mean": 0.09923828318715096, "rewards/reward_format/std": 0.005442573968321085, "sampling/importance_sampling_ratio/max": 2.4400006532669067, "sampling/importance_sampling_ratio/mean": 0.9712385058403015, "sampling/importance_sampling_ratio/min": 0.0369969367980957, "sampling/sampling_logp_difference/max": 0.8865834474563599, "sampling/sampling_logp_difference/mean": 0.00511595313437283, "step": 3820, "step_time": 7.883831079900847 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 3.695616237564536e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 3.695616237564536e-06, "completions/clipped_ratio": 0.013671875, "completions/max_length": 1828.6, "completions/max_terminated_length": 1542.0, "completions/mean_length": 206.812890625, "completions/mean_terminated_length": 181.43682708740235, "completions/min_length": 66.7, "completions/min_terminated_length": 66.7, "entropy": 0.0773765133228153, "epoch": 8.201284796573876, "frac_reward_zero_std": 0.81875, "grad_norm": 0.44140625, "learning_rate": 9.6171e-06, "loss": -0.0123, "num_tokens": 415057934.0, "reward": 1.0415429830551148, "reward_std": 0.20455780774354934, "rewards/reward_accuracy/mean": 0.94296875, "rewards/reward_accuracy/std": 0.19928285479545593, "rewards/reward_format/mean": 0.09857421964406968, "rewards/reward_format/std": 0.008766607963480055, "sampling/importance_sampling_ratio/max": 2.4892223358154295, "sampling/importance_sampling_ratio/mean": 0.9793963611125946, "sampling/importance_sampling_ratio/min": 0.0759053148329258, "sampling/sampling_logp_difference/max": 0.7881308674812317, "sampling/sampling_logp_difference/mean": 0.005021690088324249, "step": 3830, "step_time": 9.035757993292645 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00625, "completions/max_length": 1829.6, "completions/max_terminated_length": 1544.1, "completions/mean_length": 188.71015625, "completions/mean_terminated_length": 177.15206298828124, "completions/min_length": 72.7, "completions/min_terminated_length": 72.7, "entropy": 0.06760606644675135, "epoch": 8.222698072805139, "frac_reward_zero_std": 0.775, "grad_norm": 0.57421875, "learning_rate": 9.616100000000001e-06, "loss": -0.0084, "num_tokens": 416062168.0, "reward": 1.0221484541893004, "reward_std": 0.24884682297706603, "rewards/reward_accuracy/mean": 0.92265625, "rewards/reward_accuracy/std": 0.24753023833036422, "rewards/reward_format/mean": 0.09949218854308128, "rewards/reward_format/std": 0.004808784811757505, "sampling/importance_sampling_ratio/max": 2.383756721019745, "sampling/importance_sampling_ratio/mean": 0.9838458120822906, "sampling/importance_sampling_ratio/min": 0.08062138017266988, "sampling/sampling_logp_difference/max": 1.0957905769348144, "sampling/sampling_logp_difference/mean": 0.004694525059312582, "step": 3840, "step_time": 8.704144650197122 }, { "clip_ratio/high_max": 5.736576349590905e-06, "clip_ratio/high_mean": 7.170720436988632e-07, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 7.170720436988632e-07, "completions/clipped_ratio": 0.00703125, "completions/max_length": 1645.2, "completions/max_terminated_length": 1470.3, "completions/mean_length": 175.2703125, "completions/mean_terminated_length": 162.42333526611327, "completions/min_length": 65.8, "completions/min_terminated_length": 65.8, "entropy": 0.06982489698566496, "epoch": 8.244111349036402, "frac_reward_zero_std": 0.8875, "grad_norm": 0.2734375, "learning_rate": 9.6151e-06, "loss": -0.0028, "num_tokens": 417010988.0, "reward": 1.0687695145606995, "reward_std": 0.13246805400121958, "rewards/reward_accuracy/mean": 0.96953125, "rewards/reward_accuracy/std": 0.12919119894504547, "rewards/reward_format/mean": 0.09923828020691872, "rewards/reward_format/std": 0.005630645924247802, "sampling/importance_sampling_ratio/max": 2.4604464411735534, "sampling/importance_sampling_ratio/mean": 0.9800289452075959, "sampling/importance_sampling_ratio/min": 0.14102425277233124, "sampling/sampling_logp_difference/max": 0.738605409860611, "sampling/sampling_logp_difference/mean": 0.004553366731852293, "step": 3850, "step_time": 7.88873183959222 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00625, "completions/max_length": 1754.6, "completions/max_terminated_length": 1470.2, "completions/mean_length": 189.356640625, "completions/mean_terminated_length": 177.79940338134764, "completions/min_length": 69.0, "completions/min_terminated_length": 69.0, "entropy": 0.07271721512079239, "epoch": 8.265524625267666, "frac_reward_zero_std": 0.79375, "grad_norm": 0.443359375, "learning_rate": 9.6141e-06, "loss": -0.0108, "num_tokens": 418010205.0, "reward": 1.0448437690734864, "reward_std": 0.2059263564646244, "rewards/reward_accuracy/mean": 0.9453125, "rewards/reward_accuracy/std": 0.20452869310975075, "rewards/reward_format/mean": 0.0995312511920929, "rewards/reward_format/std": 0.004877268802374601, "sampling/importance_sampling_ratio/max": 2.4859877586364747, "sampling/importance_sampling_ratio/mean": 0.9890855073928833, "sampling/importance_sampling_ratio/min": 0.11249641384929418, "sampling/sampling_logp_difference/max": 0.7298532247543335, "sampling/sampling_logp_difference/mean": 0.004915011115372181, "step": 3860, "step_time": 8.44713533669128 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 2.166284502891358e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 2.166284502891358e-06, "completions/clipped_ratio": 0.009375, "completions/max_length": 1407.2, "completions/max_terminated_length": 1200.1, "completions/mean_length": 178.163671875, "completions/mean_terminated_length": 160.8449951171875, "completions/min_length": 63.3, "completions/min_terminated_length": 63.3, "entropy": 0.06384049714542925, "epoch": 8.286937901498929, "frac_reward_zero_std": 0.8375, "grad_norm": 0.35546875, "learning_rate": 9.613100000000001e-06, "loss": -0.0044, "num_tokens": 418983504.0, "reward": 1.0336914300918578, "reward_std": 0.20421729162335395, "rewards/reward_accuracy/mean": 0.934375, "rewards/reward_accuracy/std": 0.20205151587724685, "rewards/reward_format/mean": 0.09931640774011612, "rewards/reward_format/std": 0.005439209146425128, "sampling/importance_sampling_ratio/max": 2.1786391139030457, "sampling/importance_sampling_ratio/mean": 0.9914569735527039, "sampling/importance_sampling_ratio/min": 0.1301325958222151, "sampling/sampling_logp_difference/max": 0.8415071487426757, "sampling/sampling_logp_difference/mean": 0.004722009086981416, "step": 3870, "step_time": 6.93250994119735 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 3.6320316212368196e-07, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 3.6320316212368196e-07, "completions/clipped_ratio": 0.015234375, "completions/max_length": 1923.5, "completions/max_terminated_length": 1572.8, "completions/mean_length": 212.2453125, "completions/mean_terminated_length": 183.70399627685546, "completions/min_length": 68.5, "completions/min_terminated_length": 68.5, "entropy": 0.08596195597201586, "epoch": 8.308351177730193, "frac_reward_zero_std": 0.76875, "grad_norm": 0.6875, "learning_rate": 9.6121e-06, "loss": -0.0175, "num_tokens": 420052132.0, "reward": 1.0248047053813933, "reward_std": 0.2616369813680649, "rewards/reward_accuracy/mean": 0.926171875, "rewards/reward_accuracy/std": 0.2574577063322067, "rewards/reward_format/mean": 0.09863281399011611, "rewards/reward_format/std": 0.009164127707481384, "sampling/importance_sampling_ratio/max": 2.376406955718994, "sampling/importance_sampling_ratio/mean": 0.9800885498523713, "sampling/importance_sampling_ratio/min": 0.034546265564858916, "sampling/sampling_logp_difference/max": 0.8501515507698059, "sampling/sampling_logp_difference/mean": 0.005309962038882077, "step": 3880, "step_time": 9.401333570608404 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0078125, "completions/max_length": 1474.2, "completions/max_terminated_length": 1252.5, "completions/mean_length": 178.528125, "completions/mean_terminated_length": 164.1713897705078, "completions/min_length": 64.9, "completions/min_terminated_length": 64.9, "entropy": 0.06993798855692149, "epoch": 8.329764453961456, "frac_reward_zero_std": 0.84375, "grad_norm": 1.2265625, "learning_rate": 9.6111e-06, "loss": -0.0122, "num_tokens": 421026572.0, "reward": 1.0328515827655793, "reward_std": 0.20451828911900521, "rewards/reward_accuracy/mean": 0.93359375, "rewards/reward_accuracy/std": 0.2021766223013401, "rewards/reward_format/mean": 0.09925781339406967, "rewards/reward_format/std": 0.005332645098678768, "sampling/importance_sampling_ratio/max": 2.4349303126335142, "sampling/importance_sampling_ratio/mean": 0.9814438104629517, "sampling/importance_sampling_ratio/min": 0.10074777472764254, "sampling/sampling_logp_difference/max": 0.8508667349815369, "sampling/sampling_logp_difference/mean": 0.004740464221686125, "step": 3890, "step_time": 7.063987069696305 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0078125, "completions/max_length": 1562.3, "completions/max_terminated_length": 1279.9, "completions/mean_length": 180.460546875, "completions/mean_terminated_length": 166.06637573242188, "completions/min_length": 63.7, "completions/min_terminated_length": 63.7, "entropy": 0.07143675475381314, "epoch": 8.35117773019272, "frac_reward_zero_std": 0.8, "grad_norm": 1.78125, "learning_rate": 9.610100000000001e-06, "loss": -0.0042, "num_tokens": 422005271.0, "reward": 1.0300976634025574, "reward_std": 0.22454202249646188, "rewards/reward_accuracy/mean": 0.930859375, "rewards/reward_accuracy/std": 0.222722440212965, "rewards/reward_format/mean": 0.0992382824420929, "rewards/reward_format/std": 0.005231644888408482, "sampling/importance_sampling_ratio/max": 2.5581493377685547, "sampling/importance_sampling_ratio/mean": 0.9809596836566925, "sampling/importance_sampling_ratio/min": 0.1779646873474121, "sampling/sampling_logp_difference/max": 1.0241119623184205, "sampling/sampling_logp_difference/mean": 0.004843436344526708, "step": 3900, "step_time": 7.664473193811136 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.008984375, "completions/max_length": 1559.8, "completions/max_terminated_length": 1203.2, "completions/mean_length": 181.56875, "completions/mean_terminated_length": 164.90804214477538, "completions/min_length": 68.6, "completions/min_terminated_length": 68.6, "entropy": 0.06390762203373015, "epoch": 8.372591006423983, "frac_reward_zero_std": 0.81875, "grad_norm": 0.494140625, "learning_rate": 9.609100000000001e-06, "loss": -0.0105, "num_tokens": 422994951.0, "reward": 1.0435937762260437, "reward_std": 0.2121858298778534, "rewards/reward_accuracy/mean": 0.944140625, "rewards/reward_accuracy/std": 0.21010563671588897, "rewards/reward_format/mean": 0.09945312663912773, "rewards/reward_format/std": 0.0056636356981471184, "sampling/importance_sampling_ratio/max": 2.365661323070526, "sampling/importance_sampling_ratio/mean": 0.97733393907547, "sampling/importance_sampling_ratio/min": 0.12254998236894607, "sampling/sampling_logp_difference/max": 0.8287970066070557, "sampling/sampling_logp_difference/mean": 0.004476143280044198, "step": 3910, "step_time": 7.708977076187148 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.008203125, "completions/max_length": 1843.0, "completions/max_terminated_length": 1643.1, "completions/mean_length": 194.553515625, "completions/mean_terminated_length": 179.26622314453124, "completions/min_length": 67.9, "completions/min_terminated_length": 67.9, "entropy": 0.07748389644548297, "epoch": 8.394004282655246, "frac_reward_zero_std": 0.76875, "grad_norm": 1.15625, "learning_rate": 9.608100000000002e-06, "loss": -0.0112, "num_tokens": 424015920.0, "reward": 1.0034570574760437, "reward_std": 0.2784928843379021, "rewards/reward_accuracy/mean": 0.904296875, "rewards/reward_accuracy/std": 0.2757194049656391, "rewards/reward_format/mean": 0.09916015714406967, "rewards/reward_format/std": 0.007132244668900967, "sampling/importance_sampling_ratio/max": 2.4623198747634887, "sampling/importance_sampling_ratio/mean": 0.9854971826076507, "sampling/importance_sampling_ratio/min": 0.06901181600987912, "sampling/sampling_logp_difference/max": 1.0886169791221618, "sampling/sampling_logp_difference/mean": 0.005118034733459354, "step": 3920, "step_time": 9.034137371499673 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 1845.3, "completions/max_terminated_length": 1762.4, "completions/mean_length": 190.980078125, "completions/mean_terminated_length": 183.74281463623046, "completions/min_length": 62.3, "completions/min_terminated_length": 62.3, "entropy": 0.07758473251014948, "epoch": 8.41541755888651, "frac_reward_zero_std": 0.75, "grad_norm": 0.8359375, "learning_rate": 9.6071e-06, "loss": -0.0014, "num_tokens": 425027117.0, "reward": 1.0134375274181366, "reward_std": 0.27642889469861986, "rewards/reward_accuracy/mean": 0.9140625, "rewards/reward_accuracy/std": 0.27459491342306136, "rewards/reward_format/mean": 0.09937500134110451, "rewards/reward_format/std": 0.005601800233125687, "sampling/importance_sampling_ratio/max": 2.6070643186569216, "sampling/importance_sampling_ratio/mean": 0.9823592662811279, "sampling/importance_sampling_ratio/min": 0.10000658109784126, "sampling/sampling_logp_difference/max": 1.0834239363670348, "sampling/sampling_logp_difference/mean": 0.005178120918571949, "step": 3930, "step_time": 8.898832417291123 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0125, "completions/max_length": 1959.8, "completions/max_terminated_length": 1591.1, "completions/mean_length": 224.67265625, "completions/mean_terminated_length": 201.98232727050782, "completions/min_length": 67.3, "completions/min_terminated_length": 67.3, "entropy": 0.08397505492903293, "epoch": 8.436830835117773, "frac_reward_zero_std": 0.76875, "grad_norm": 0.12255859375, "learning_rate": 9.606100000000001e-06, "loss": -0.0141, "num_tokens": 426124279.0, "reward": 1.0112695515155792, "reward_std": 0.27639982253313067, "rewards/reward_accuracy/mean": 0.9125, "rewards/reward_accuracy/std": 0.2727187409996986, "rewards/reward_format/mean": 0.09876953214406967, "rewards/reward_format/std": 0.008481117826886476, "sampling/importance_sampling_ratio/max": 2.5127022743225096, "sampling/importance_sampling_ratio/mean": 0.9737383365631104, "sampling/importance_sampling_ratio/min": 0.03192863008007407, "sampling/sampling_logp_difference/max": 1.0657266855239869, "sampling/sampling_logp_difference/mean": 0.005136113776825368, "step": 3940, "step_time": 9.614063376691774 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.004296875, "completions/max_length": 1876.2, "completions/max_terminated_length": 1688.0, "completions/mean_length": 189.3, "completions/mean_terminated_length": 181.42574005126954, "completions/min_length": 65.4, "completions/min_terminated_length": 65.4, "entropy": 0.06967864367179573, "epoch": 8.458244111349037, "frac_reward_zero_std": 0.85, "grad_norm": 1.0859375, "learning_rate": 9.6051e-06, "loss": -0.0074, "num_tokens": 427120199.0, "reward": 1.021386730670929, "reward_std": 0.2594269663095474, "rewards/reward_accuracy/mean": 0.921875, "rewards/reward_accuracy/std": 0.2578837856650352, "rewards/reward_format/mean": 0.09951171949505806, "rewards/reward_format/std": 0.0049661130644381045, "sampling/importance_sampling_ratio/max": 2.455304718017578, "sampling/importance_sampling_ratio/mean": 0.9951301515102386, "sampling/importance_sampling_ratio/min": 0.1357402555644512, "sampling/sampling_logp_difference/max": 0.7106410205364228, "sampling/sampling_logp_difference/mean": 0.004770952160470188, "step": 3950, "step_time": 8.8741878793051 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00625, "completions/max_length": 1952.1, "completions/max_terminated_length": 1644.1, "completions/mean_length": 200.442578125, "completions/mean_terminated_length": 189.04503479003907, "completions/min_length": 66.6, "completions/min_terminated_length": 66.6, "entropy": 0.07980867228470742, "epoch": 8.4796573875803, "frac_reward_zero_std": 0.80625, "grad_norm": 0.5234375, "learning_rate": 9.6041e-06, "loss": -0.0086, "num_tokens": 428150100.0, "reward": 1.0184766113758088, "reward_std": 0.24089953526854516, "rewards/reward_accuracy/mean": 0.919140625, "rewards/reward_accuracy/std": 0.23903272673487663, "rewards/reward_format/mean": 0.09933594018220901, "rewards/reward_format/std": 0.005708382441662252, "sampling/importance_sampling_ratio/max": 2.5080237865447996, "sampling/importance_sampling_ratio/mean": 0.9774595856666565, "sampling/importance_sampling_ratio/min": 0.10878601185977459, "sampling/sampling_logp_difference/max": 0.865550059080124, "sampling/sampling_logp_difference/mean": 0.005046690371818841, "step": 3960, "step_time": 9.416844888884224 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01171875, "completions/max_length": 1515.6, "completions/max_terminated_length": 1343.1, "completions/mean_length": 196.780859375, "completions/mean_terminated_length": 175.0901092529297, "completions/min_length": 65.2, "completions/min_terminated_length": 65.2, "entropy": 0.07728840708732605, "epoch": 8.501070663811563, "frac_reward_zero_std": 0.85, "grad_norm": 0.9453125, "learning_rate": 9.603100000000001e-06, "loss": -0.0055, "num_tokens": 429167651.0, "reward": 1.0254297256469727, "reward_std": 0.25077923238277433, "rewards/reward_accuracy/mean": 0.9265625, "rewards/reward_accuracy/std": 0.24722943007946013, "rewards/reward_format/mean": 0.09886718988418579, "rewards/reward_format/std": 0.0072024350985884665, "sampling/importance_sampling_ratio/max": 2.5038662433624266, "sampling/importance_sampling_ratio/mean": 0.9730736672878265, "sampling/importance_sampling_ratio/min": 0.06485747955739499, "sampling/sampling_logp_difference/max": 0.848358690738678, "sampling/sampling_logp_difference/mean": 0.005031507695093751, "step": 3970, "step_time": 7.686216593967401 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0140625, "completions/max_length": 1890.7, "completions/max_terminated_length": 1728.2, "completions/mean_length": 240.053515625, "completions/mean_terminated_length": 214.4836654663086, "completions/min_length": 72.6, "completions/min_terminated_length": 72.6, "entropy": 0.10050115650519728, "epoch": 8.522483940042827, "frac_reward_zero_std": 0.75625, "grad_norm": 0.61328125, "learning_rate": 9.6021e-06, "loss": -0.0132, "num_tokens": 430300844.0, "reward": 0.9772070527076722, "reward_std": 0.3264451563358307, "rewards/reward_accuracy/mean": 0.878515625, "rewards/reward_accuracy/std": 0.32296623289585114, "rewards/reward_format/mean": 0.0986914061009884, "rewards/reward_format/std": 0.00897473730146885, "sampling/importance_sampling_ratio/max": 2.5546274900436403, "sampling/importance_sampling_ratio/mean": 0.9727532386779785, "sampling/importance_sampling_ratio/min": 0.052880217880010606, "sampling/sampling_logp_difference/max": 0.9698717713356018, "sampling/sampling_logp_difference/mean": 0.0058213748503476385, "step": 3980, "step_time": 9.246698382688919 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 3.313123602310952e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 3.313123602310952e-06, "completions/clipped_ratio": 0.012109375, "completions/max_length": 1648.1, "completions/max_terminated_length": 1426.6, "completions/mean_length": 202.11640625, "completions/mean_terminated_length": 179.9396499633789, "completions/min_length": 63.9, "completions/min_terminated_length": 63.9, "entropy": 0.0814905168954283, "epoch": 8.54389721627409, "frac_reward_zero_std": 0.7875, "grad_norm": 0.38671875, "learning_rate": 9.6011e-06, "loss": -0.0132, "num_tokens": 431341174.0, "reward": 1.0192773818969727, "reward_std": 0.24714337140321732, "rewards/reward_accuracy/mean": 0.9203125, "rewards/reward_accuracy/std": 0.24442936480045319, "rewards/reward_format/mean": 0.09896484687924385, "rewards/reward_format/std": 0.0067655386868864294, "sampling/importance_sampling_ratio/max": 2.3497997522354126, "sampling/importance_sampling_ratio/mean": 0.9792013943195343, "sampling/importance_sampling_ratio/min": 0.10589976459741593, "sampling/sampling_logp_difference/max": 0.8358288645744324, "sampling/sampling_logp_difference/mean": 0.005177208012901247, "step": 3990, "step_time": 8.010733946916298 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.004296875, "completions/max_length": 1546.3, "completions/max_terminated_length": 1340.5, "completions/mean_length": 181.44375, "completions/mean_terminated_length": 173.48560943603516, "completions/min_length": 66.0, "completions/min_terminated_length": 66.0, "entropy": 0.06296032280661165, "epoch": 8.565310492505354, "frac_reward_zero_std": 0.80625, "grad_norm": 0.7265625, "learning_rate": 9.600100000000001e-06, "loss": 0.0033, "num_tokens": 432322054.0, "reward": 1.0268554747104646, "reward_std": 0.22845394164323807, "rewards/reward_accuracy/mean": 0.92734375, "rewards/reward_accuracy/std": 0.2271147698163986, "rewards/reward_format/mean": 0.09951171949505806, "rewards/reward_format/std": 0.004677628423087299, "sampling/importance_sampling_ratio/max": 2.556311082839966, "sampling/importance_sampling_ratio/mean": 0.9950194895267487, "sampling/importance_sampling_ratio/min": 0.14218476838432254, "sampling/sampling_logp_difference/max": 0.8772651851177216, "sampling/sampling_logp_difference/mean": 0.004379116953350604, "step": 4000, "step_time": 7.426540794785251 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.012109375, "completions/max_length": 1729.3, "completions/max_terminated_length": 1464.7, "completions/mean_length": 205.79296875, "completions/mean_terminated_length": 183.3709732055664, "completions/min_length": 63.9, "completions/min_terminated_length": 63.9, "entropy": 0.07609832077287138, "epoch": 8.586723768736617, "frac_reward_zero_std": 0.825, "grad_norm": 0.0888671875, "learning_rate": 9.599100000000001e-06, "loss": -0.0082, "num_tokens": 433363348.0, "reward": 1.0269922137260437, "reward_std": 0.23816928043961524, "rewards/reward_accuracy/mean": 0.928125, "rewards/reward_accuracy/std": 0.23437619879841803, "rewards/reward_format/mean": 0.09886718913912773, "rewards/reward_format/std": 0.008243886311538518, "sampling/importance_sampling_ratio/max": 2.4413416147232057, "sampling/importance_sampling_ratio/mean": 0.9749242007732392, "sampling/importance_sampling_ratio/min": 0.02793920426047407, "sampling/sampling_logp_difference/max": 1.5374835014343262, "sampling/sampling_logp_difference/mean": 0.005088918935507536, "step": 4010, "step_time": 8.61144763280463 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005078125, "completions/max_length": 1530.1, "completions/max_terminated_length": 1384.5, "completions/mean_length": 179.559765625, "completions/mean_terminated_length": 170.25837249755858, "completions/min_length": 63.0, "completions/min_terminated_length": 63.0, "entropy": 0.07398475464433432, "epoch": 8.60813704496788, "frac_reward_zero_std": 0.875, "grad_norm": 0.2060546875, "learning_rate": 9.5981e-06, "loss": -0.0074, "num_tokens": 434329085.0, "reward": 1.0613476634025574, "reward_std": 0.17295578494668007, "rewards/reward_accuracy/mean": 0.96171875, "rewards/reward_accuracy/std": 0.1716498427093029, "rewards/reward_format/mean": 0.09962890669703484, "rewards/reward_format/std": 0.0032693782122805715, "sampling/importance_sampling_ratio/max": 2.373059260845184, "sampling/importance_sampling_ratio/mean": 0.9771109223365784, "sampling/importance_sampling_ratio/min": 0.1393841452896595, "sampling/sampling_logp_difference/max": 0.8418267846107483, "sampling/sampling_logp_difference/mean": 0.0048757056472823026, "step": 4020, "step_time": 7.261464487612829 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0109375, "completions/max_length": 1832.8, "completions/max_terminated_length": 1642.3, "completions/mean_length": 211.766015625, "completions/mean_terminated_length": 191.65030517578126, "completions/min_length": 69.4, "completions/min_terminated_length": 69.4, "entropy": 0.08341751205734908, "epoch": 8.629550321199144, "frac_reward_zero_std": 0.76875, "grad_norm": 0.3984375, "learning_rate": 9.5971e-06, "loss": -0.0155, "num_tokens": 435396550.0, "reward": 1.0284375488758086, "reward_std": 0.24569795578718184, "rewards/reward_accuracy/mean": 0.9296875, "rewards/reward_accuracy/std": 0.2414251372218132, "rewards/reward_format/mean": 0.09875000193715096, "rewards/reward_format/std": 0.008118457533419133, "sampling/importance_sampling_ratio/max": 2.495964288711548, "sampling/importance_sampling_ratio/mean": 0.976284921169281, "sampling/importance_sampling_ratio/min": 0.048086725547909735, "sampling/sampling_logp_difference/max": 0.9342381715774536, "sampling/sampling_logp_difference/mean": 0.005124957719817758, "step": 4030, "step_time": 9.05803453369008 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00546875, "completions/max_length": 1526.0, "completions/max_terminated_length": 1374.8, "completions/mean_length": 184.896484375, "completions/mean_terminated_length": 174.75355682373046, "completions/min_length": 69.2, "completions/min_terminated_length": 69.2, "entropy": 0.06854445631615817, "epoch": 8.650963597430406, "frac_reward_zero_std": 0.8, "grad_norm": 1.78125, "learning_rate": 9.596100000000001e-06, "loss": -0.0058, "num_tokens": 436391037.0, "reward": 1.028320324420929, "reward_std": 0.2425820678472519, "rewards/reward_accuracy/mean": 0.92890625, "rewards/reward_accuracy/std": 0.24015701413154603, "rewards/reward_format/mean": 0.09941406399011612, "rewards/reward_format/std": 0.004634631285443902, "sampling/importance_sampling_ratio/max": 2.5376546025276183, "sampling/importance_sampling_ratio/mean": 0.9847315311431885, "sampling/importance_sampling_ratio/min": 0.09038390293717384, "sampling/sampling_logp_difference/max": 0.9430609822273255, "sampling/sampling_logp_difference/mean": 0.004799716733396053, "step": 4040, "step_time": 7.640843277596287 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.008203125, "completions/max_length": 1630.0, "completions/max_terminated_length": 1348.4, "completions/mean_length": 184.33125, "completions/mean_terminated_length": 169.1823715209961, "completions/min_length": 65.9, "completions/min_terminated_length": 65.9, "entropy": 0.07184867775067687, "epoch": 8.67237687366167, "frac_reward_zero_std": 0.7875, "grad_norm": 0.341796875, "learning_rate": 9.5951e-06, "loss": -0.0081, "num_tokens": 437386605.0, "reward": 1.013671886920929, "reward_std": 0.265979728102684, "rewards/reward_accuracy/mean": 0.914453125, "rewards/reward_accuracy/std": 0.26352960616350174, "rewards/reward_format/mean": 0.09921875223517418, "rewards/reward_format/std": 0.006192534929141402, "sampling/importance_sampling_ratio/max": 2.32292640209198, "sampling/importance_sampling_ratio/mean": 0.9877513289451599, "sampling/importance_sampling_ratio/min": 0.11834248751401902, "sampling/sampling_logp_difference/max": 0.7857591509819031, "sampling/sampling_logp_difference/mean": 0.004978590877726674, "step": 4050, "step_time": 7.808451630306081 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0125, "completions/max_length": 1711.9, "completions/max_terminated_length": 1546.4, "completions/mean_length": 206.062109375, "completions/mean_terminated_length": 183.15335693359376, "completions/min_length": 62.3, "completions/min_terminated_length": 62.3, "entropy": 0.07774507557041943, "epoch": 8.693790149892934, "frac_reward_zero_std": 0.81875, "grad_norm": 0.0, "learning_rate": 9.5941e-06, "loss": -0.0046, "num_tokens": 438429612.0, "reward": 1.02001953125, "reward_std": 0.24380115419626236, "rewards/reward_accuracy/mean": 0.92109375, "rewards/reward_accuracy/std": 0.24089057743549347, "rewards/reward_format/mean": 0.09892578199505805, "rewards/reward_format/std": 0.007524332031607628, "sampling/importance_sampling_ratio/max": 2.323392057418823, "sampling/importance_sampling_ratio/mean": 0.9761070668697357, "sampling/importance_sampling_ratio/min": 0.06003692373633385, "sampling/sampling_logp_difference/max": 1.3186598777770997, "sampling/sampling_logp_difference/mean": 0.004988841922022402, "step": 4060, "step_time": 8.849815206881612 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005078125, "completions/max_length": 1465.0, "completions/max_terminated_length": 1367.2, "completions/mean_length": 173.391015625, "completions/mean_terminated_length": 163.88512420654297, "completions/min_length": 61.6, "completions/min_terminated_length": 61.6, "entropy": 0.065680799074471, "epoch": 8.715203426124196, "frac_reward_zero_std": 0.84375, "grad_norm": 0.9765625, "learning_rate": 9.593100000000001e-06, "loss": -0.0104, "num_tokens": 439391845.0, "reward": 1.0479687750339508, "reward_std": 0.19126022085547448, "rewards/reward_accuracy/mean": 0.9484375, "rewards/reward_accuracy/std": 0.1894942156970501, "rewards/reward_format/mean": 0.0995312511920929, "rewards/reward_format/std": 0.004577804310247302, "sampling/importance_sampling_ratio/max": 2.500663924217224, "sampling/importance_sampling_ratio/mean": 0.9716602683067321, "sampling/importance_sampling_ratio/min": 0.12821342744864522, "sampling/sampling_logp_difference/max": 0.9175853908061982, "sampling/sampling_logp_difference/mean": 0.00478102108463645, "step": 4070, "step_time": 7.0291416218038645 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.009765625, "completions/max_length": 1974.9, "completions/max_terminated_length": 1616.3, "completions/mean_length": 198.715234375, "completions/mean_terminated_length": 180.72380828857422, "completions/min_length": 61.5, "completions/min_terminated_length": 61.5, "entropy": 0.0728057149797678, "epoch": 8.73661670235546, "frac_reward_zero_std": 0.80625, "grad_norm": 0.703125, "learning_rate": 9.592100000000001e-06, "loss": -0.014, "num_tokens": 440410620.0, "reward": 1.0194921851158143, "reward_std": 0.2574471816420555, "rewards/reward_accuracy/mean": 0.9203125, "rewards/reward_accuracy/std": 0.2540778636932373, "rewards/reward_format/mean": 0.0991796873509884, "rewards/reward_format/std": 0.007679479592479765, "sampling/importance_sampling_ratio/max": 2.4311212420463564, "sampling/importance_sampling_ratio/mean": 0.9844939053058624, "sampling/importance_sampling_ratio/min": 0.02399395634420216, "sampling/sampling_logp_difference/max": 0.9080464839935303, "sampling/sampling_logp_difference/mean": 0.004943308117799461, "step": 4080, "step_time": 9.528803988685832 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0125, "completions/max_length": 1785.9, "completions/max_terminated_length": 1578.5, "completions/mean_length": 199.803125, "completions/mean_terminated_length": 176.7684524536133, "completions/min_length": 61.1, "completions/min_terminated_length": 61.1, "entropy": 0.0736522066872567, "epoch": 8.758029978586723, "frac_reward_zero_std": 0.8125, "grad_norm": 0.337890625, "learning_rate": 9.5911e-06, "loss": -0.009, "num_tokens": 441442692.0, "reward": 1.0395898640155792, "reward_std": 0.2044973760843277, "rewards/reward_accuracy/mean": 0.940625, "rewards/reward_accuracy/std": 0.20119093582034112, "rewards/reward_format/mean": 0.09896484687924385, "rewards/reward_format/std": 0.007301438599824905, "sampling/importance_sampling_ratio/max": 2.4852211117744445, "sampling/importance_sampling_ratio/mean": 0.9801795005798339, "sampling/importance_sampling_ratio/min": 0.04223434627056122, "sampling/sampling_logp_difference/max": 1.4710837364196778, "sampling/sampling_logp_difference/mean": 0.004973637918010354, "step": 4090, "step_time": 8.85520198858867 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0234375, "completions/max_length": 2019.4, "completions/max_terminated_length": 1695.3, "completions/mean_length": 253.19921875, "completions/mean_terminated_length": 210.65961151123048, "completions/min_length": 66.6, "completions/min_terminated_length": 66.6, "entropy": 0.09033034853637219, "epoch": 8.779443254817988, "frac_reward_zero_std": 0.725, "grad_norm": 0.51953125, "learning_rate": 9.590100000000002e-06, "loss": -0.0147, "num_tokens": 442613618.0, "reward": 1.001230490207672, "reward_std": 0.27912717014551164, "rewards/reward_accuracy/mean": 0.903515625, "rewards/reward_accuracy/std": 0.27343803495168684, "rewards/reward_format/mean": 0.09771484583616256, "rewards/reward_format/std": 0.012519821478053927, "sampling/importance_sampling_ratio/max": 2.4713290691375733, "sampling/importance_sampling_ratio/mean": 0.9674436211585998, "sampling/importance_sampling_ratio/min": 0.01774874087423086, "sampling/sampling_logp_difference/max": 0.9002786576747894, "sampling/sampling_logp_difference/mean": 0.005108398385345936, "step": 4100, "step_time": 10.424704754081905 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0109375, "completions/max_length": 1604.1, "completions/max_terminated_length": 1481.3, "completions/mean_length": 201.362109375, "completions/mean_terminated_length": 180.95695953369142, "completions/min_length": 66.9, "completions/min_terminated_length": 66.9, "entropy": 0.07696724054403603, "epoch": 8.80085653104925, "frac_reward_zero_std": 0.8375, "grad_norm": 0.640625, "learning_rate": 9.589100000000001e-06, "loss": -0.005, "num_tokens": 443649345.0, "reward": 1.0141406536102295, "reward_std": 0.26240924298763274, "rewards/reward_accuracy/mean": 0.91484375, "rewards/reward_accuracy/std": 0.260262542963028, "rewards/reward_format/mean": 0.09929687678813934, "rewards/reward_format/std": 0.0059063812019303445, "sampling/importance_sampling_ratio/max": 2.6663366317749024, "sampling/importance_sampling_ratio/mean": 0.9897813260555267, "sampling/importance_sampling_ratio/min": 0.08131897486746312, "sampling/sampling_logp_difference/max": 0.909190583229065, "sampling/sampling_logp_difference/mean": 0.005112319486215711, "step": 4110, "step_time": 8.083047407519189 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.008203125, "completions/max_length": 1687.3, "completions/max_terminated_length": 1503.8, "completions/mean_length": 183.565234375, "completions/mean_terminated_length": 168.24746704101562, "completions/min_length": 60.8, "completions/min_terminated_length": 60.8, "entropy": 0.06688511986285448, "epoch": 8.822269807280513, "frac_reward_zero_std": 0.825, "grad_norm": 0.353515625, "learning_rate": 9.5881e-06, "loss": 0.0033, "num_tokens": 444626952.0, "reward": 1.0216211318969726, "reward_std": 0.2403771162033081, "rewards/reward_accuracy/mean": 0.922265625, "rewards/reward_accuracy/std": 0.23827702403068543, "rewards/reward_format/mean": 0.09935547187924385, "rewards/reward_format/std": 0.005992095964029431, "sampling/importance_sampling_ratio/max": 2.3876925706863403, "sampling/importance_sampling_ratio/mean": 0.9742326855659484, "sampling/importance_sampling_ratio/min": 0.10921804439276457, "sampling/sampling_logp_difference/max": 0.9228575944900512, "sampling/sampling_logp_difference/mean": 0.004566996730864048, "step": 4120, "step_time": 8.274038799511619 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0109375, "completions/max_length": 1900.8, "completions/max_terminated_length": 1614.1, "completions/mean_length": 222.321875, "completions/mean_terminated_length": 202.6423599243164, "completions/min_length": 69.4, "completions/min_terminated_length": 69.4, "entropy": 0.08584995651617647, "epoch": 8.843683083511777, "frac_reward_zero_std": 0.75625, "grad_norm": 0.384765625, "learning_rate": 9.5871e-06, "loss": -0.0038, "num_tokens": 445714976.0, "reward": 0.997148460149765, "reward_std": 0.27114875242114067, "rewards/reward_accuracy/mean": 0.898046875, "rewards/reward_accuracy/std": 0.26893767043948175, "rewards/reward_format/mean": 0.09910156354308128, "rewards/reward_format/std": 0.006219938630238175, "sampling/importance_sampling_ratio/max": 2.615603971481323, "sampling/importance_sampling_ratio/mean": 0.9771971940994263, "sampling/importance_sampling_ratio/min": 0.044926229491829874, "sampling/sampling_logp_difference/max": 0.8742292821407318, "sampling/sampling_logp_difference/mean": 0.005526069644838571, "step": 4130, "step_time": 9.20357839250064 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.004296875, "completions/max_length": 1418.2, "completions/max_terminated_length": 1383.2, "completions/mean_length": 191.581640625, "completions/mean_terminated_length": 183.7728240966797, "completions/min_length": 66.9, "completions/min_terminated_length": 66.9, "entropy": 0.07666312428191305, "epoch": 8.86509635974304, "frac_reward_zero_std": 0.8, "grad_norm": 0.3125, "learning_rate": 9.5861e-06, "loss": -0.0047, "num_tokens": 446720321.0, "reward": 1.0359375178813934, "reward_std": 0.21005870178341865, "rewards/reward_accuracy/mean": 0.936328125, "rewards/reward_accuracy/std": 0.20898194313049318, "rewards/reward_format/mean": 0.099609375, "rewards/reward_format/std": 0.0029540014453232287, "sampling/importance_sampling_ratio/max": 2.439884090423584, "sampling/importance_sampling_ratio/mean": 0.9864542126655579, "sampling/importance_sampling_ratio/min": 0.15268897796049713, "sampling/sampling_logp_difference/max": 0.7541396617889404, "sampling/sampling_logp_difference/mean": 0.005160272074863315, "step": 4140, "step_time": 7.1034296500118215 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01484375, "completions/max_length": 1422.3, "completions/max_terminated_length": 1058.8, "completions/mean_length": 193.60390625, "completions/mean_terminated_length": 166.04514770507814, "completions/min_length": 64.6, "completions/min_terminated_length": 64.6, "entropy": 0.0674930130597204, "epoch": 8.886509635974305, "frac_reward_zero_std": 0.8375, "grad_norm": 0.58203125, "learning_rate": 9.5851e-06, "loss": -0.0033, "num_tokens": 447726347.0, "reward": 1.0434180080890656, "reward_std": 0.2049616739153862, "rewards/reward_accuracy/mean": 0.94453125, "rewards/reward_accuracy/std": 0.20151858329772948, "rewards/reward_format/mean": 0.09888672083616257, "rewards/reward_format/std": 0.006401264644227922, "sampling/importance_sampling_ratio/max": 2.4204462289810182, "sampling/importance_sampling_ratio/mean": 0.973732078075409, "sampling/importance_sampling_ratio/min": 0.10520917326211929, "sampling/sampling_logp_difference/max": 1.0631659388542176, "sampling/sampling_logp_difference/mean": 0.004846474388614297, "step": 4150, "step_time": 7.235820112397778 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0078125, "completions/max_length": 1691.2, "completions/max_terminated_length": 1463.6, "completions/mean_length": 194.4796875, "completions/mean_terminated_length": 179.9914108276367, "completions/min_length": 68.5, "completions/min_terminated_length": 68.5, "entropy": 0.07514401767402887, "epoch": 8.907922912205567, "frac_reward_zero_std": 0.8, "grad_norm": 0.86328125, "learning_rate": 9.5841e-06, "loss": -0.0223, "num_tokens": 448742647.0, "reward": 1.0234375, "reward_std": 0.2503847308456898, "rewards/reward_accuracy/mean": 0.92421875, "rewards/reward_accuracy/std": 0.24786878600716591, "rewards/reward_format/mean": 0.09921875149011612, "rewards/reward_format/std": 0.006292355665937066, "sampling/importance_sampling_ratio/max": 2.5087927341461183, "sampling/importance_sampling_ratio/mean": 0.9829802691936493, "sampling/importance_sampling_ratio/min": 0.10184253696352244, "sampling/sampling_logp_difference/max": 1.0045469522476196, "sampling/sampling_logp_difference/mean": 0.0050938359927386045, "step": 4160, "step_time": 8.402294135800911 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0015625, "completions/max_length": 1193.5, "completions/max_terminated_length": 1143.9, "completions/mean_length": 168.161328125, "completions/mean_terminated_length": 165.2590576171875, "completions/min_length": 72.3, "completions/min_terminated_length": 72.3, "entropy": 0.06375126531347633, "epoch": 8.929336188436832, "frac_reward_zero_std": 0.85, "grad_norm": 0.373046875, "learning_rate": 9.583100000000001e-06, "loss": -0.0002, "num_tokens": 449688564.0, "reward": 1.0240234375, "reward_std": 0.23299082666635512, "rewards/reward_accuracy/mean": 0.92421875, "rewards/reward_accuracy/std": 0.23235177174210547, "rewards/reward_format/mean": 0.0998046875, "rewards/reward_format/std": 0.0022331610787659885, "sampling/importance_sampling_ratio/max": 2.44200404882431, "sampling/importance_sampling_ratio/mean": 0.985089236497879, "sampling/importance_sampling_ratio/min": 0.15358789563179015, "sampling/sampling_logp_difference/max": 0.9894370079040528, "sampling/sampling_logp_difference/mean": 0.004818607936613262, "step": 4170, "step_time": 5.825651186978211 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0125, "completions/max_length": 1771.3, "completions/max_terminated_length": 1677.4, "completions/mean_length": 206.755078125, "completions/mean_terminated_length": 183.55651245117187, "completions/min_length": 69.7, "completions/min_terminated_length": 69.7, "entropy": 0.08872145414352417, "epoch": 8.950749464668094, "frac_reward_zero_std": 0.8, "grad_norm": 0.58203125, "learning_rate": 9.582100000000001e-06, "loss": -0.011, "num_tokens": 450731921.0, "reward": 1.0164844155311585, "reward_std": 0.2652391128242016, "rewards/reward_accuracy/mean": 0.917578125, "rewards/reward_accuracy/std": 0.2617250941693783, "rewards/reward_format/mean": 0.0989062525331974, "rewards/reward_format/std": 0.0071072856895625595, "sampling/importance_sampling_ratio/max": 2.5181943655014036, "sampling/importance_sampling_ratio/mean": 0.99248126745224, "sampling/importance_sampling_ratio/min": 0.04991177674382925, "sampling/sampling_logp_difference/max": 0.6847836911678314, "sampling/sampling_logp_difference/mean": 0.005415957141667605, "step": 4180, "step_time": 8.775384242509608 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01015625, "completions/max_length": 1783.7, "completions/max_terminated_length": 1517.1, "completions/mean_length": 203.744140625, "completions/mean_terminated_length": 185.23631439208984, "completions/min_length": 66.1, "completions/min_terminated_length": 66.1, "entropy": 0.0812079954892397, "epoch": 8.972162740899357, "frac_reward_zero_std": 0.7375, "grad_norm": 0.62890625, "learning_rate": 9.5811e-06, "loss": -0.0153, "num_tokens": 451779794.0, "reward": 1.0265820384025575, "reward_std": 0.2419845297932625, "rewards/reward_accuracy/mean": 0.92734375, "rewards/reward_accuracy/std": 0.2395829439163208, "rewards/reward_format/mean": 0.09923828095197677, "rewards/reward_format/std": 0.005663045146502554, "sampling/importance_sampling_ratio/max": 2.5486409187316896, "sampling/importance_sampling_ratio/mean": 0.9742596626281739, "sampling/importance_sampling_ratio/min": 0.033798061311244965, "sampling/sampling_logp_difference/max": 0.9006427168846131, "sampling/sampling_logp_difference/mean": 0.005345596559345722, "step": 4190, "step_time": 8.606992253498174 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.008203125, "completions/max_length": 1532.7, "completions/max_terminated_length": 1412.1, "completions/mean_length": 183.11015625, "completions/mean_terminated_length": 167.85662231445312, "completions/min_length": 68.5, "completions/min_terminated_length": 68.5, "entropy": 0.06734887049533426, "epoch": 8.993576017130621, "frac_reward_zero_std": 0.79375, "grad_norm": 0.298828125, "learning_rate": 9.580100000000002e-06, "loss": -0.008, "num_tokens": 452772252.0, "reward": 1.033203160762787, "reward_std": 0.24019818156957626, "rewards/reward_accuracy/mean": 0.933984375, "rewards/reward_accuracy/std": 0.23779146298766135, "rewards/reward_format/mean": 0.09921875223517418, "rewards/reward_format/std": 0.005174952792003751, "sampling/importance_sampling_ratio/max": 2.4819756150245667, "sampling/importance_sampling_ratio/mean": 0.9777391374111175, "sampling/importance_sampling_ratio/min": 0.06980919614434242, "sampling/sampling_logp_difference/max": 0.8308595716953278, "sampling/sampling_logp_difference/mean": 0.004986388329416514, "step": 4200, "step_time": 7.41061211260967 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.011328125, "completions/max_length": 1603.1, "completions/max_terminated_length": 1513.6, "completions/mean_length": 197.238671875, "completions/mean_terminated_length": 176.27252044677735, "completions/min_length": 68.0, "completions/min_terminated_length": 68.0, "entropy": 0.07113565308973194, "epoch": 9.014989293361884, "frac_reward_zero_std": 0.7875, "grad_norm": 0.0, "learning_rate": 9.579100000000001e-06, "loss": -0.0162, "num_tokens": 453795951.0, "reward": 1.0224218964576721, "reward_std": 0.245162745565176, "rewards/reward_accuracy/mean": 0.9234375, "rewards/reward_accuracy/std": 0.24227680191397666, "rewards/reward_format/mean": 0.0989843763411045, "rewards/reward_format/std": 0.007394557469524443, "sampling/importance_sampling_ratio/max": 2.5241718769073485, "sampling/importance_sampling_ratio/mean": 0.9850675821304321, "sampling/importance_sampling_ratio/min": 0.07101124078035355, "sampling/sampling_logp_difference/max": 0.9364025592803955, "sampling/sampling_logp_difference/mean": 0.004974988382309675, "step": 4210, "step_time": 8.087014250695939 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.009375, "completions/max_length": 1855.6, "completions/max_terminated_length": 1387.8, "completions/mean_length": 187.025390625, "completions/mean_terminated_length": 169.6028045654297, "completions/min_length": 65.0, "completions/min_terminated_length": 65.0, "entropy": 0.06556996488943696, "epoch": 9.036402569593148, "frac_reward_zero_std": 0.80625, "grad_norm": 0.94921875, "learning_rate": 9.5781e-06, "loss": -0.0038, "num_tokens": 454789328.0, "reward": 1.0444531619548798, "reward_std": 0.21489887684583664, "rewards/reward_accuracy/mean": 0.9453125, "rewards/reward_accuracy/std": 0.21123108342289926, "rewards/reward_format/mean": 0.09914062768220902, "rewards/reward_format/std": 0.007097447849810123, "sampling/importance_sampling_ratio/max": 2.4522717237472533, "sampling/importance_sampling_ratio/mean": 0.9819264590740204, "sampling/importance_sampling_ratio/min": 0.09280512817203998, "sampling/sampling_logp_difference/max": 0.8345251679420471, "sampling/sampling_logp_difference/mean": 0.004684854042716324, "step": 4220, "step_time": 8.835572460418916 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003515625, "completions/max_length": 1640.0, "completions/max_terminated_length": 1502.3, "completions/mean_length": 179.45703125, "completions/mean_terminated_length": 172.92357330322267, "completions/min_length": 66.1, "completions/min_terminated_length": 66.1, "entropy": 0.06249024085700512, "epoch": 9.057815845824411, "frac_reward_zero_std": 0.81875, "grad_norm": 0.0, "learning_rate": 9.5771e-06, "loss": -0.0032, "num_tokens": 455761874.0, "reward": 1.0529687762260438, "reward_std": 0.1920694440603256, "rewards/reward_accuracy/mean": 0.953515625, "rewards/reward_accuracy/std": 0.19044821858406066, "rewards/reward_format/mean": 0.09945312663912773, "rewards/reward_format/std": 0.005265423329547048, "sampling/importance_sampling_ratio/max": 2.2460992097854615, "sampling/importance_sampling_ratio/mean": 0.9842089414596558, "sampling/importance_sampling_ratio/min": 0.04639969933778047, "sampling/sampling_logp_difference/max": 0.8186712503433228, "sampling/sampling_logp_difference/mean": 0.0045376317109912636, "step": 4230, "step_time": 8.057494014091208 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.009765625, "completions/max_length": 1637.0, "completions/max_terminated_length": 1161.6, "completions/mean_length": 179.034375, "completions/mean_terminated_length": 160.75839538574218, "completions/min_length": 68.0, "completions/min_terminated_length": 68.0, "entropy": 0.06559291896410287, "epoch": 9.079229122055674, "frac_reward_zero_std": 0.83125, "grad_norm": 0.283203125, "learning_rate": 9.5761e-06, "loss": -0.0033, "num_tokens": 456735994.0, "reward": 1.0473633050918578, "reward_std": 0.21428845822811127, "rewards/reward_accuracy/mean": 0.948046875, "rewards/reward_accuracy/std": 0.21142952367663384, "rewards/reward_format/mean": 0.09931640774011612, "rewards/reward_format/std": 0.00592591124586761, "sampling/importance_sampling_ratio/max": 2.4966970920562743, "sampling/importance_sampling_ratio/mean": 0.9920680463314057, "sampling/importance_sampling_ratio/min": 0.1002632088959217, "sampling/sampling_logp_difference/max": 0.7565010070800782, "sampling/sampling_logp_difference/mean": 0.00467553292401135, "step": 4240, "step_time": 7.897679917892674 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.009765625, "completions/max_length": 1608.7, "completions/max_terminated_length": 1473.5, "completions/mean_length": 190.58046875, "completions/mean_terminated_length": 172.5479507446289, "completions/min_length": 65.4, "completions/min_terminated_length": 65.4, "entropy": 0.06400286178104579, "epoch": 9.100642398286938, "frac_reward_zero_std": 0.78125, "grad_norm": 0.26953125, "learning_rate": 9.575100000000001e-06, "loss": -0.0058, "num_tokens": 457743384.0, "reward": 1.0237304806709289, "reward_std": 0.24830610901117325, "rewards/reward_accuracy/mean": 0.924609375, "rewards/reward_accuracy/std": 0.24561607837677002, "rewards/reward_format/mean": 0.09912109524011611, "rewards/reward_format/std": 0.006450834404677153, "sampling/importance_sampling_ratio/max": 2.459565806388855, "sampling/importance_sampling_ratio/mean": 0.9763280808925628, "sampling/importance_sampling_ratio/min": 0.10000016912817955, "sampling/sampling_logp_difference/max": 0.871113508939743, "sampling/sampling_logp_difference/mean": 0.004656827286817133, "step": 4250, "step_time": 7.875724191599875 }, { "clip_ratio/high_max": 5.805852197227068e-06, "clip_ratio/high_mean": 7.257315246533835e-07, "clip_ratio/low_mean": 1.088765907297784e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 1.8144974319511674e-06, "completions/clipped_ratio": 0.0109375, "completions/max_length": 1612.2, "completions/max_terminated_length": 1297.4, "completions/mean_length": 191.607421875, "completions/mean_terminated_length": 171.239013671875, "completions/min_length": 65.3, "completions/min_terminated_length": 65.3, "entropy": 0.061286263773217796, "epoch": 9.1220556745182, "frac_reward_zero_std": 0.8875, "grad_norm": 0.37109375, "learning_rate": 9.5741e-06, "loss": -0.0008, "num_tokens": 458754507.0, "reward": 1.0026758074760438, "reward_std": 0.25933543816208837, "rewards/reward_accuracy/mean": 0.903515625, "rewards/reward_accuracy/std": 0.256686183065176, "rewards/reward_format/mean": 0.09916015788912773, "rewards/reward_format/std": 0.006677229423075914, "sampling/importance_sampling_ratio/max": 2.3097979068756103, "sampling/importance_sampling_ratio/mean": 0.981951767206192, "sampling/importance_sampling_ratio/min": 0.13796920850872993, "sampling/sampling_logp_difference/max": 0.8227352499961853, "sampling/sampling_logp_difference/mean": 0.0043256452539935705, "step": 4260, "step_time": 7.852588194209966 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01015625, "completions/max_length": 1775.9, "completions/max_terminated_length": 1716.5, "completions/mean_length": 203.18828125, "completions/mean_terminated_length": 184.5071243286133, "completions/min_length": 67.9, "completions/min_terminated_length": 67.9, "entropy": 0.0717295145848766, "epoch": 9.143468950749465, "frac_reward_zero_std": 0.8, "grad_norm": 0.87109375, "learning_rate": 9.573100000000002e-06, "loss": -0.007, "num_tokens": 459802061.0, "reward": 1.011894565820694, "reward_std": 0.26872083693742754, "rewards/reward_accuracy/mean": 0.912890625, "rewards/reward_accuracy/std": 0.2658799603581429, "rewards/reward_format/mean": 0.0990039087831974, "rewards/reward_format/std": 0.006549866031855344, "sampling/importance_sampling_ratio/max": 2.295648658275604, "sampling/importance_sampling_ratio/mean": 0.9718441307544708, "sampling/importance_sampling_ratio/min": 0.004501693695783615, "sampling/sampling_logp_difference/max": 0.846879506111145, "sampling/sampling_logp_difference/mean": 0.004800763307139277, "step": 4270, "step_time": 9.069937308097725 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.002734375, "completions/max_length": 1621.4, "completions/max_terminated_length": 1393.5, "completions/mean_length": 185.140234375, "completions/mean_terminated_length": 180.07694396972656, "completions/min_length": 63.4, "completions/min_terminated_length": 63.4, "entropy": 0.06542770015075802, "epoch": 9.164882226980728, "frac_reward_zero_std": 0.775, "grad_norm": 0.95703125, "learning_rate": 9.572100000000001e-06, "loss": -0.0147, "num_tokens": 460796740.0, "reward": 1.025703138113022, "reward_std": 0.23445182740688325, "rewards/reward_accuracy/mean": 0.926171875, "rewards/reward_accuracy/std": 0.23306241184473037, "rewards/reward_format/mean": 0.09953125193715096, "rewards/reward_format/std": 0.004565370851196349, "sampling/importance_sampling_ratio/max": 2.491687369346619, "sampling/importance_sampling_ratio/mean": 0.9831057071685791, "sampling/importance_sampling_ratio/min": 0.07944684475660324, "sampling/sampling_logp_difference/max": 1.025398278236389, "sampling/sampling_logp_difference/mean": 0.004826760082505643, "step": 4280, "step_time": 7.591042720389669 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.004296875, "completions/max_length": 1680.2, "completions/max_terminated_length": 1513.6, "completions/mean_length": 188.204296875, "completions/mean_terminated_length": 180.1913833618164, "completions/min_length": 64.3, "completions/min_terminated_length": 64.3, "entropy": 0.068529881676659, "epoch": 9.18629550321199, "frac_reward_zero_std": 0.775, "grad_norm": 0.1728515625, "learning_rate": 9.5711e-06, "loss": -0.0106, "num_tokens": 461799407.0, "reward": 1.021445345878601, "reward_std": 0.24568369686603547, "rewards/reward_accuracy/mean": 0.921875, "rewards/reward_accuracy/std": 0.24375516995787622, "rewards/reward_format/mean": 0.09957031458616257, "rewards/reward_format/std": 0.004246706981211901, "sampling/importance_sampling_ratio/max": 2.510874080657959, "sampling/importance_sampling_ratio/mean": 0.9822835087776184, "sampling/importance_sampling_ratio/min": 0.06078822426497936, "sampling/sampling_logp_difference/max": 0.809979897737503, "sampling/sampling_logp_difference/mean": 0.0048592002131044865, "step": 4290, "step_time": 8.073327824298758 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003515625, "completions/max_length": 1771.1, "completions/max_terminated_length": 1376.4, "completions/mean_length": 188.257421875, "completions/mean_terminated_length": 181.73468322753905, "completions/min_length": 63.4, "completions/min_terminated_length": 63.4, "entropy": 0.07184608271345497, "epoch": 9.207708779443255, "frac_reward_zero_std": 0.78125, "grad_norm": 0.32421875, "learning_rate": 9.570100000000002e-06, "loss": -0.0043, "num_tokens": 462795970.0, "reward": 1.0249609410762788, "reward_std": 0.25161722749471666, "rewards/reward_accuracy/mean": 0.925390625, "rewards/reward_accuracy/std": 0.250398313999176, "rewards/reward_format/mean": 0.09957031384110451, "rewards/reward_format/std": 0.004808470350690186, "sampling/importance_sampling_ratio/max": 2.581635093688965, "sampling/importance_sampling_ratio/mean": 0.9830692172050476, "sampling/importance_sampling_ratio/min": 0.11820435635745526, "sampling/sampling_logp_difference/max": 0.7528284668922425, "sampling/sampling_logp_difference/mean": 0.004937404487282038, "step": 4300, "step_time": 8.365885337916552 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.004296875, "completions/max_length": 1655.0, "completions/max_terminated_length": 1358.1, "completions/mean_length": 173.15625, "completions/mean_terminated_length": 165.10169219970703, "completions/min_length": 69.1, "completions/min_terminated_length": 69.1, "entropy": 0.06470482423901558, "epoch": 9.229122055674518, "frac_reward_zero_std": 0.80625, "grad_norm": 1.5703125, "learning_rate": 9.569100000000001e-06, "loss": 0.0028, "num_tokens": 463757666.0, "reward": 1.0566211104393006, "reward_std": 0.18374029621481897, "rewards/reward_accuracy/mean": 0.95703125, "rewards/reward_accuracy/std": 0.1819690689444542, "rewards/reward_format/mean": 0.09958984479308128, "rewards/reward_format/std": 0.004616237222217023, "sampling/importance_sampling_ratio/max": 2.667706644535065, "sampling/importance_sampling_ratio/mean": 0.9932306408882141, "sampling/importance_sampling_ratio/min": 0.13551494404673575, "sampling/sampling_logp_difference/max": 0.871059513092041, "sampling/sampling_logp_difference/mean": 0.004776544030755758, "step": 4310, "step_time": 7.663702180306427 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00625, "completions/max_length": 1544.1, "completions/max_terminated_length": 1385.2, "completions/mean_length": 186.439453125, "completions/mean_terminated_length": 174.78260650634766, "completions/min_length": 61.9, "completions/min_terminated_length": 61.9, "entropy": 0.0649915898218751, "epoch": 9.250535331905782, "frac_reward_zero_std": 0.81875, "grad_norm": 0.625, "learning_rate": 9.5681e-06, "loss": -0.0039, "num_tokens": 464750951.0, "reward": 1.039609396457672, "reward_std": 0.22247500121593475, "rewards/reward_accuracy/mean": 0.940234375, "rewards/reward_accuracy/std": 0.22011818885803222, "rewards/reward_format/mean": 0.09937500208616257, "rewards/reward_format/std": 0.005099985655397177, "sampling/importance_sampling_ratio/max": 2.520794463157654, "sampling/importance_sampling_ratio/mean": 0.9812482059001922, "sampling/importance_sampling_ratio/min": 0.03798263035714626, "sampling/sampling_logp_difference/max": 0.8889323353767395, "sampling/sampling_logp_difference/mean": 0.0046604825649410484, "step": 4320, "step_time": 7.5691167728014985 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.015234375, "completions/max_length": 1726.1, "completions/max_terminated_length": 1539.9, "completions/mean_length": 206.80078125, "completions/mean_terminated_length": 178.7330810546875, "completions/min_length": 66.2, "completions/min_terminated_length": 66.2, "entropy": 0.06688033207319677, "epoch": 9.271948608137045, "frac_reward_zero_std": 0.8, "grad_norm": 0.78515625, "learning_rate": 9.5671e-06, "loss": -0.002, "num_tokens": 465795513.0, "reward": 1.020312523841858, "reward_std": 0.2626108840107918, "rewards/reward_accuracy/mean": 0.921875, "rewards/reward_accuracy/std": 0.2578453578054905, "rewards/reward_format/mean": 0.09843750149011612, "rewards/reward_format/std": 0.00852061677724123, "sampling/importance_sampling_ratio/max": 2.5560715079307554, "sampling/importance_sampling_ratio/mean": 0.9683886945247651, "sampling/importance_sampling_ratio/min": 0.07049601599574089, "sampling/sampling_logp_difference/max": 0.9678425669670105, "sampling/sampling_logp_difference/mean": 0.004722708882763982, "step": 4330, "step_time": 8.684549869698822 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0078125, "completions/max_length": 2048.0, "completions/max_terminated_length": 1349.8, "completions/mean_length": 192.255078125, "completions/mean_terminated_length": 177.66022033691405, "completions/min_length": 62.4, "completions/min_terminated_length": 62.4, "entropy": 0.06652838652953505, "epoch": 9.29336188436831, "frac_reward_zero_std": 0.8125, "grad_norm": 1.7265625, "learning_rate": 9.5661e-06, "loss": -0.0044, "num_tokens": 466803158.0, "reward": 1.0109375238418579, "reward_std": 0.26207209601998327, "rewards/reward_accuracy/mean": 0.91171875, "rewards/reward_accuracy/std": 0.25973157212138176, "rewards/reward_format/mean": 0.09921875074505807, "rewards/reward_format/std": 0.007130344398319721, "sampling/importance_sampling_ratio/max": 2.4281032562255858, "sampling/importance_sampling_ratio/mean": 0.9797600686550141, "sampling/importance_sampling_ratio/min": 0.09487551897764206, "sampling/sampling_logp_difference/max": 1.0455473840236664, "sampling/sampling_logp_difference/mean": 0.004806653340347111, "step": 4340, "step_time": 9.72000040000712 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00703125, "completions/max_length": 1725.0, "completions/max_terminated_length": 1556.8, "completions/mean_length": 174.0109375, "completions/mean_terminated_length": 160.91539001464844, "completions/min_length": 65.9, "completions/min_terminated_length": 65.9, "entropy": 0.05903993044048548, "epoch": 9.314775160599572, "frac_reward_zero_std": 0.79375, "grad_norm": 0.5859375, "learning_rate": 9.565100000000001e-06, "loss": -0.0116, "num_tokens": 467771842.0, "reward": 1.032031273841858, "reward_std": 0.22780647426843642, "rewards/reward_accuracy/mean": 0.9328125, "rewards/reward_accuracy/std": 0.22554035484790802, "rewards/reward_format/mean": 0.09921875, "rewards/reward_format/std": 0.006534937978722155, "sampling/importance_sampling_ratio/max": 2.5860852718353273, "sampling/importance_sampling_ratio/mean": 0.9985010504722596, "sampling/importance_sampling_ratio/min": 0.0742593110539019, "sampling/sampling_logp_difference/max": 0.8558264315128327, "sampling/sampling_logp_difference/mean": 0.0044866729294881225, "step": 4350, "step_time": 8.237614817699068 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00703125, "completions/max_length": 1577.1, "completions/max_terminated_length": 1463.5, "completions/mean_length": 182.22109375, "completions/mean_terminated_length": 169.13054809570312, "completions/min_length": 66.6, "completions/min_terminated_length": 66.6, "entropy": 0.0672688112128526, "epoch": 9.336188436830835, "frac_reward_zero_std": 0.81875, "grad_norm": 0.859375, "learning_rate": 9.5641e-06, "loss": 0.0027, "num_tokens": 468757912.0, "reward": 1.0479687452316284, "reward_std": 0.21162447333335876, "rewards/reward_accuracy/mean": 0.948828125, "rewards/reward_accuracy/std": 0.20880995765328408, "rewards/reward_format/mean": 0.09914062470197678, "rewards/reward_format/std": 0.005950991157442331, "sampling/importance_sampling_ratio/max": 2.5589951992034914, "sampling/importance_sampling_ratio/mean": 0.9948416829109192, "sampling/importance_sampling_ratio/min": 0.12206325381994247, "sampling/sampling_logp_difference/max": 0.9030602455139161, "sampling/sampling_logp_difference/mean": 0.0049245086498558525, "step": 4360, "step_time": 7.8668963635980615 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01484375, "completions/max_length": 1706.0, "completions/max_terminated_length": 1347.1, "completions/mean_length": 199.35703125, "completions/mean_terminated_length": 171.83860778808594, "completions/min_length": 69.0, "completions/min_terminated_length": 69.0, "entropy": 0.0716796092223376, "epoch": 9.357601713062099, "frac_reward_zero_std": 0.78125, "grad_norm": 0.0, "learning_rate": 9.5631e-06, "loss": -0.0102, "num_tokens": 469776442.0, "reward": 1.016699230670929, "reward_std": 0.24354493767023086, "rewards/reward_accuracy/mean": 0.91796875, "rewards/reward_accuracy/std": 0.2396906465291977, "rewards/reward_format/mean": 0.09873046949505807, "rewards/reward_format/std": 0.00900216018781066, "sampling/importance_sampling_ratio/max": 2.478578042984009, "sampling/importance_sampling_ratio/mean": 0.9921741962432862, "sampling/importance_sampling_ratio/min": 0.11129120327532291, "sampling/sampling_logp_difference/max": 0.7442629218101502, "sampling/sampling_logp_difference/mean": 0.004942310182377696, "step": 4370, "step_time": 8.541805119498168 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005859375, "completions/max_length": 1824.9, "completions/max_terminated_length": 1600.5, "completions/mean_length": 184.46953125, "completions/mean_terminated_length": 173.53758544921874, "completions/min_length": 66.6, "completions/min_terminated_length": 66.6, "entropy": 0.06576711686793715, "epoch": 9.379014989293362, "frac_reward_zero_std": 0.80625, "grad_norm": 0.357421875, "learning_rate": 9.562100000000001e-06, "loss": 0.0027, "num_tokens": 470765756.0, "reward": 1.0172851800918579, "reward_std": 0.24542029649019242, "rewards/reward_accuracy/mean": 0.91796875, "rewards/reward_accuracy/std": 0.2435908667743206, "rewards/reward_format/mean": 0.09931640848517417, "rewards/reward_format/std": 0.005417245859280229, "sampling/importance_sampling_ratio/max": 2.543210816383362, "sampling/importance_sampling_ratio/mean": 0.9856241583824158, "sampling/importance_sampling_ratio/min": 0.05767898559570313, "sampling/sampling_logp_difference/max": 0.7985962152481079, "sampling/sampling_logp_difference/mean": 0.0047040089499205354, "step": 4380, "step_time": 8.731325372104767 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0125, "completions/max_length": 1636.6, "completions/max_terminated_length": 1486.1, "completions/mean_length": 202.72265625, "completions/mean_terminated_length": 179.35181274414063, "completions/min_length": 65.9, "completions/min_terminated_length": 65.9, "entropy": 0.07099624550901354, "epoch": 9.400428265524626, "frac_reward_zero_std": 0.80625, "grad_norm": 0.5, "learning_rate": 9.5611e-06, "loss": -0.0116, "num_tokens": 471805718.0, "reward": 1.0393554806709289, "reward_std": 0.21470517441630363, "rewards/reward_accuracy/mean": 0.940625, "rewards/reward_accuracy/std": 0.21067939400672914, "rewards/reward_format/mean": 0.09873047024011612, "rewards/reward_format/std": 0.007009822688996792, "sampling/importance_sampling_ratio/max": 2.5783260345458983, "sampling/importance_sampling_ratio/mean": 0.9870540916919708, "sampling/importance_sampling_ratio/min": 0.08108970501925797, "sampling/sampling_logp_difference/max": 0.8799246668815612, "sampling/sampling_logp_difference/mean": 0.004771760036237538, "step": 4390, "step_time": 8.233026880506078 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.006640625, "completions/max_length": 1599.7, "completions/max_terminated_length": 1414.1, "completions/mean_length": 175.53203125, "completions/mean_terminated_length": 163.15062866210937, "completions/min_length": 65.1, "completions/min_terminated_length": 65.1, "entropy": 0.06446836795657873, "epoch": 9.421841541755889, "frac_reward_zero_std": 0.83125, "grad_norm": 0.38671875, "learning_rate": 9.560100000000002e-06, "loss": -0.0081, "num_tokens": 472772040.0, "reward": 1.053769552707672, "reward_std": 0.19931133836507797, "rewards/reward_accuracy/mean": 0.954296875, "rewards/reward_accuracy/std": 0.19738897532224656, "rewards/reward_format/mean": 0.09947265684604645, "rewards/reward_format/std": 0.004134091641753912, "sampling/importance_sampling_ratio/max": 2.4874395370483398, "sampling/importance_sampling_ratio/mean": 0.982071453332901, "sampling/importance_sampling_ratio/min": 0.04745384864509106, "sampling/sampling_logp_difference/max": 1.2734108746051789, "sampling/sampling_logp_difference/mean": 0.004855910525657236, "step": 4400, "step_time": 7.643441689797328 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0046875, "completions/max_length": 1650.4, "completions/max_terminated_length": 1481.8, "completions/mean_length": 175.55234375, "completions/mean_terminated_length": 166.78504333496093, "completions/min_length": 62.7, "completions/min_terminated_length": 62.7, "entropy": 0.06128122473601252, "epoch": 9.443254817987151, "frac_reward_zero_std": 0.84375, "grad_norm": 0.049072265625, "learning_rate": 9.559100000000001e-06, "loss": 0.0017, "num_tokens": 473735246.0, "reward": 1.057324230670929, "reward_std": 0.16801278546918183, "rewards/reward_accuracy/mean": 0.9578125, "rewards/reward_accuracy/std": 0.16543366611003876, "rewards/reward_format/mean": 0.09951171875, "rewards/reward_format/std": 0.004723456338979304, "sampling/importance_sampling_ratio/max": 2.4580600023269654, "sampling/importance_sampling_ratio/mean": 0.9903775513172149, "sampling/importance_sampling_ratio/min": 0.1721593517344445, "sampling/sampling_logp_difference/max": 0.79919353723526, "sampling/sampling_logp_difference/mean": 0.004441940411925316, "step": 4410, "step_time": 7.8702811216935515 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01171875, "completions/max_length": 1755.2, "completions/max_terminated_length": 1562.6, "completions/mean_length": 189.63984375, "completions/mean_terminated_length": 167.79573516845704, "completions/min_length": 68.7, "completions/min_terminated_length": 68.7, "entropy": 0.0686734376475215, "epoch": 9.464668094218416, "frac_reward_zero_std": 0.85, "grad_norm": 0.734375, "learning_rate": 9.558100000000001e-06, "loss": -0.009, "num_tokens": 474733732.0, "reward": 1.019648450613022, "reward_std": 0.24684321880340576, "rewards/reward_accuracy/mean": 0.920703125, "rewards/reward_accuracy/std": 0.24349657222628593, "rewards/reward_format/mean": 0.09894531369209289, "rewards/reward_format/std": 0.007075710245408118, "sampling/importance_sampling_ratio/max": 2.2642454147338866, "sampling/importance_sampling_ratio/mean": 0.9932459235191345, "sampling/importance_sampling_ratio/min": 0.044277400430291894, "sampling/sampling_logp_difference/max": 0.8217674911022186, "sampling/sampling_logp_difference/mean": 0.004675857443362475, "step": 4420, "step_time": 8.8776290750131 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.002734375, "completions/max_length": 1578.4, "completions/max_terminated_length": 1367.5, "completions/mean_length": 162.68515625, "completions/mean_terminated_length": 157.54578552246093, "completions/min_length": 64.1, "completions/min_terminated_length": 64.1, "entropy": 0.06268081087619067, "epoch": 9.486081370449678, "frac_reward_zero_std": 0.83125, "grad_norm": 0.0, "learning_rate": 9.5571e-06, "loss": -0.0181, "num_tokens": 475673294.0, "reward": 1.0504883050918579, "reward_std": 0.1760025516152382, "rewards/reward_accuracy/mean": 0.95078125, "rewards/reward_accuracy/std": 0.174680595099926, "rewards/reward_format/mean": 0.09970703274011612, "rewards/reward_format/std": 0.0029735487652942537, "sampling/importance_sampling_ratio/max": 2.380132484436035, "sampling/importance_sampling_ratio/mean": 0.9896663188934326, "sampling/importance_sampling_ratio/min": 0.034796826727688315, "sampling/sampling_logp_difference/max": 0.8769776701927186, "sampling/sampling_logp_difference/mean": 0.004718778515234589, "step": 4430, "step_time": 7.492926518197055 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00703125, "completions/max_length": 1672.9, "completions/max_terminated_length": 1374.2, "completions/mean_length": 181.27890625, "completions/mean_terminated_length": 168.11006927490234, "completions/min_length": 64.2, "completions/min_terminated_length": 64.2, "entropy": 0.06455726455897093, "epoch": 9.507494646680943, "frac_reward_zero_std": 0.8625, "grad_norm": 0.365234375, "learning_rate": 9.5561e-06, "loss": -0.0157, "num_tokens": 476657496.0, "reward": 1.0605273604393006, "reward_std": 0.16927805319428443, "rewards/reward_accuracy/mean": 0.961328125, "rewards/reward_accuracy/std": 0.1658659353852272, "rewards/reward_format/mean": 0.09919921904802323, "rewards/reward_format/std": 0.0065894994186237454, "sampling/importance_sampling_ratio/max": 2.3545122504234315, "sampling/importance_sampling_ratio/mean": 0.9779762148857116, "sampling/importance_sampling_ratio/min": 0.05696086809039116, "sampling/sampling_logp_difference/max": 0.9655421733856201, "sampling/sampling_logp_difference/mean": 0.004566542524844408, "step": 4440, "step_time": 8.079634706521755 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.008203125, "completions/max_length": 1605.7, "completions/max_terminated_length": 1451.6, "completions/mean_length": 184.709375, "completions/mean_terminated_length": 169.61580810546874, "completions/min_length": 66.0, "completions/min_terminated_length": 66.0, "entropy": 0.07341660978272557, "epoch": 9.528907922912206, "frac_reward_zero_std": 0.8125, "grad_norm": 0.0, "learning_rate": 9.555100000000001e-06, "loss": -0.0101, "num_tokens": 477645840.0, "reward": 1.0446679890155792, "reward_std": 0.2037160314619541, "rewards/reward_accuracy/mean": 0.9453125, "rewards/reward_accuracy/std": 0.20144574120640754, "rewards/reward_format/mean": 0.09935546964406967, "rewards/reward_format/std": 0.005727204866707325, "sampling/importance_sampling_ratio/max": 2.394430100917816, "sampling/importance_sampling_ratio/mean": 0.9754915177822113, "sampling/importance_sampling_ratio/min": 0.09303736705332995, "sampling/sampling_logp_difference/max": 0.7740956366062164, "sampling/sampling_logp_difference/mean": 0.005077766999602318, "step": 4450, "step_time": 7.871897396381246 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 1.6889900052774464e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 1.6889900052774464e-06, "completions/clipped_ratio": 0.0125, "completions/max_length": 1758.0, "completions/max_terminated_length": 1594.2, "completions/mean_length": 207.796875, "completions/mean_terminated_length": 184.83839721679686, "completions/min_length": 68.1, "completions/min_terminated_length": 68.1, "entropy": 0.0676295671146363, "epoch": 9.550321199143468, "frac_reward_zero_std": 0.79375, "grad_norm": 0.328125, "learning_rate": 9.5541e-06, "loss": -0.009, "num_tokens": 478694600.0, "reward": 1.042167991399765, "reward_std": 0.2066587306559086, "rewards/reward_accuracy/mean": 0.943359375, "rewards/reward_accuracy/std": 0.20336295515298844, "rewards/reward_format/mean": 0.09880859553813934, "rewards/reward_format/std": 0.0065515269059687855, "sampling/importance_sampling_ratio/max": 2.561271548271179, "sampling/importance_sampling_ratio/mean": 0.969097375869751, "sampling/importance_sampling_ratio/min": 0.05691698044538498, "sampling/sampling_logp_difference/max": 0.9503329515457153, "sampling/sampling_logp_difference/mean": 0.004491203418001533, "step": 4460, "step_time": 8.599835031517433 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0046875, "completions/max_length": 1580.6, "completions/max_terminated_length": 1461.6, "completions/mean_length": 169.99921875, "completions/mean_terminated_length": 161.24249572753905, "completions/min_length": 68.1, "completions/min_terminated_length": 68.1, "entropy": 0.06418886468745769, "epoch": 9.571734475374733, "frac_reward_zero_std": 0.8375, "grad_norm": 0.625, "learning_rate": 9.5531e-06, "loss": -0.0054, "num_tokens": 479649542.0, "reward": 1.0370703339576721, "reward_std": 0.21632306426763534, "rewards/reward_accuracy/mean": 0.9375, "rewards/reward_accuracy/std": 0.21453142166137695, "rewards/reward_format/mean": 0.09957031384110451, "rewards/reward_format/std": 0.004507384612224996, "sampling/importance_sampling_ratio/max": 2.4228013515472413, "sampling/importance_sampling_ratio/mean": 0.9802545011043549, "sampling/importance_sampling_ratio/min": 0.13631801009178163, "sampling/sampling_logp_difference/max": 0.8852425873279571, "sampling/sampling_logp_difference/mean": 0.004775017919018865, "step": 4470, "step_time": 7.457075692483341 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01328125, "completions/max_length": 1642.5, "completions/max_terminated_length": 1485.6, "completions/mean_length": 205.515625, "completions/mean_terminated_length": 180.86492309570312, "completions/min_length": 69.8, "completions/min_terminated_length": 69.8, "entropy": 0.0745356248691678, "epoch": 9.593147751605995, "frac_reward_zero_std": 0.81875, "grad_norm": 0.73046875, "learning_rate": 9.552100000000001e-06, "loss": -0.0128, "num_tokens": 480700478.0, "reward": 1.022050815820694, "reward_std": 0.26660343557596206, "rewards/reward_accuracy/mean": 0.923046875, "rewards/reward_accuracy/std": 0.26320427358150483, "rewards/reward_format/mean": 0.09900390654802323, "rewards/reward_format/std": 0.006793073401786387, "sampling/importance_sampling_ratio/max": 2.384682261943817, "sampling/importance_sampling_ratio/mean": 0.9727111339569092, "sampling/importance_sampling_ratio/min": 0.09923578351736069, "sampling/sampling_logp_difference/max": 0.7957505941390991, "sampling/sampling_logp_difference/mean": 0.004994449764490127, "step": 4480, "step_time": 8.117693231601152 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00234375, "completions/max_length": 1366.4, "completions/max_terminated_length": 1231.3, "completions/mean_length": 170.166015625, "completions/mean_terminated_length": 165.81835021972657, "completions/min_length": 62.2, "completions/min_terminated_length": 62.2, "entropy": 0.05542967626824975, "epoch": 9.61456102783726, "frac_reward_zero_std": 0.875, "grad_norm": 0.58984375, "learning_rate": 9.5511e-06, "loss": -0.0044, "num_tokens": 481643591.0, "reward": 1.0504687666893004, "reward_std": 0.18444409295916558, "rewards/reward_accuracy/mean": 0.95078125, "rewards/reward_accuracy/std": 0.18356447890400887, "rewards/reward_format/mean": 0.09968750104308129, "rewards/reward_format/std": 0.0038199495291337373, "sampling/importance_sampling_ratio/max": 2.443958878517151, "sampling/importance_sampling_ratio/mean": 0.9813065469264984, "sampling/importance_sampling_ratio/min": 0.13236462250351905, "sampling/sampling_logp_difference/max": 0.862000024318695, "sampling/sampling_logp_difference/mean": 0.004212787770666182, "step": 4490, "step_time": 6.738587602195912 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005859375, "completions/max_length": 1308.4, "completions/max_terminated_length": 1224.7, "completions/mean_length": 174.981640625, "completions/mean_terminated_length": 164.3553039550781, "completions/min_length": 61.1, "completions/min_terminated_length": 61.1, "entropy": 0.05995004908181727, "epoch": 9.635974304068522, "frac_reward_zero_std": 0.825, "grad_norm": 0.24609375, "learning_rate": 9.5501e-06, "loss": -0.0098, "num_tokens": 482607336.0, "reward": 1.0544531285762786, "reward_std": 0.185345159471035, "rewards/reward_accuracy/mean": 0.955078125, "rewards/reward_accuracy/std": 0.18369442820549012, "rewards/reward_format/mean": 0.09937499910593033, "rewards/reward_format/std": 0.003909741784445942, "sampling/importance_sampling_ratio/max": 2.390349006652832, "sampling/importance_sampling_ratio/mean": 0.990923672914505, "sampling/importance_sampling_ratio/min": 0.08934946656227112, "sampling/sampling_logp_difference/max": 0.8589655339717865, "sampling/sampling_logp_difference/mean": 0.004498122539371252, "step": 4500, "step_time": 6.472322314011398 }, { "clip_ratio/high_max": 2.57127067015972e-05, "clip_ratio/high_mean": 3.21408833769965e-06, "clip_ratio/low_mean": 3.4622019029484363e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 6.676290217910718e-06, "completions/clipped_ratio": 0.01171875, "completions/max_length": 1612.9, "completions/max_terminated_length": 1245.8, "completions/mean_length": 184.523828125, "completions/mean_terminated_length": 162.2779983520508, "completions/min_length": 63.2, "completions/min_terminated_length": 63.2, "entropy": 0.061006424762308595, "epoch": 9.657387580299785, "frac_reward_zero_std": 0.80625, "grad_norm": 0.88671875, "learning_rate": 9.549100000000001e-06, "loss": -0.0041, "num_tokens": 483600853.0, "reward": 1.035996103286743, "reward_std": 0.2211511179804802, "rewards/reward_accuracy/mean": 0.937109375, "rewards/reward_accuracy/std": 0.2171064794063568, "rewards/reward_format/mean": 0.09888671934604645, "rewards/reward_format/std": 0.006889175507239997, "sampling/importance_sampling_ratio/max": 2.4588751673698424, "sampling/importance_sampling_ratio/mean": 0.9891256749629974, "sampling/importance_sampling_ratio/min": 0.11688677249476313, "sampling/sampling_logp_difference/max": 0.9345655798912048, "sampling/sampling_logp_difference/mean": 0.00438638364430517, "step": 4510, "step_time": 7.93719335879432 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003515625, "completions/max_length": 1485.6, "completions/max_terminated_length": 1107.4, "completions/mean_length": 166.38828125, "completions/mean_terminated_length": 159.94239654541016, "completions/min_length": 69.6, "completions/min_terminated_length": 69.6, "entropy": 0.05691851954907179, "epoch": 9.67880085653105, "frac_reward_zero_std": 0.85, "grad_norm": 0.154296875, "learning_rate": 9.548100000000001e-06, "loss": -0.0019, "num_tokens": 484543847.0, "reward": 1.0531640946865082, "reward_std": 0.16968794986605645, "rewards/reward_accuracy/mean": 0.953515625, "rewards/reward_accuracy/std": 0.16814736574888228, "rewards/reward_format/mean": 0.09964843988418579, "rewards/reward_format/std": 0.0032007530331611632, "sampling/importance_sampling_ratio/max": 2.4984234809875487, "sampling/importance_sampling_ratio/mean": 0.9907629787921906, "sampling/importance_sampling_ratio/min": 0.08774418979883195, "sampling/sampling_logp_difference/max": 0.9244373977184296, "sampling/sampling_logp_difference/mean": 0.004406162491068244, "step": 4520, "step_time": 7.131714124820428 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 1.3182873317418853e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 1.3182873317418853e-06, "completions/clipped_ratio": 0.00703125, "completions/max_length": 1326.0, "completions/max_terminated_length": 1137.3, "completions/mean_length": 164.93515625, "completions/mean_terminated_length": 151.83497924804686, "completions/min_length": 65.0, "completions/min_terminated_length": 65.0, "entropy": 0.05531797371804714, "epoch": 9.700214132762312, "frac_reward_zero_std": 0.8875, "grad_norm": 0.4921875, "learning_rate": 9.5471e-06, "loss": -0.0068, "num_tokens": 485480305.0, "reward": 1.0520898580551148, "reward_std": 0.18664565831422805, "rewards/reward_accuracy/mean": 0.952734375, "rewards/reward_accuracy/std": 0.1842656247317791, "rewards/reward_format/mean": 0.09935546964406967, "rewards/reward_format/std": 0.005046476423740387, "sampling/importance_sampling_ratio/max": 2.286334490776062, "sampling/importance_sampling_ratio/mean": 0.9868440508842469, "sampling/importance_sampling_ratio/min": 0.14201218262314796, "sampling/sampling_logp_difference/max": 0.8547847032546997, "sampling/sampling_logp_difference/mean": 0.004271036735735834, "step": 4530, "step_time": 6.441755916189868 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0125, "completions/max_length": 1783.4, "completions/max_terminated_length": 1627.7, "completions/mean_length": 195.555078125, "completions/mean_terminated_length": 172.6228515625, "completions/min_length": 64.7, "completions/min_terminated_length": 64.7, "entropy": 0.07116033071652055, "epoch": 9.721627408993577, "frac_reward_zero_std": 0.81875, "grad_norm": 0.73046875, "learning_rate": 9.5461e-06, "loss": -0.0093, "num_tokens": 486502238.0, "reward": 1.0175976753234863, "reward_std": 0.2378186911344528, "rewards/reward_accuracy/mean": 0.918359375, "rewards/reward_accuracy/std": 0.2357243061065674, "rewards/reward_format/mean": 0.0992382824420929, "rewards/reward_format/std": 0.005488302651792764, "sampling/importance_sampling_ratio/max": 2.608646535873413, "sampling/importance_sampling_ratio/mean": 0.9679303169250488, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 0.9133510589599609, "sampling/sampling_logp_difference/mean": 0.004949691891670227, "step": 4540, "step_time": 8.697833370711304 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00546875, "completions/max_length": 1716.4, "completions/max_terminated_length": 1590.7, "completions/mean_length": 186.908984375, "completions/mean_terminated_length": 176.9185012817383, "completions/min_length": 61.9, "completions/min_terminated_length": 61.9, "entropy": 0.06773204165510834, "epoch": 9.74304068522484, "frac_reward_zero_std": 0.79375, "grad_norm": 0.73046875, "learning_rate": 9.545100000000001e-06, "loss": -0.0106, "num_tokens": 487498037.0, "reward": 1.032695323228836, "reward_std": 0.23750925436615944, "rewards/reward_accuracy/mean": 0.933203125, "rewards/reward_accuracy/std": 0.235887710750103, "rewards/reward_format/mean": 0.09949218854308128, "rewards/reward_format/std": 0.005055475584231317, "sampling/importance_sampling_ratio/max": 2.49283572435379, "sampling/importance_sampling_ratio/mean": 0.986643624305725, "sampling/importance_sampling_ratio/min": 0.10966926738619805, "sampling/sampling_logp_difference/max": 0.9840800344944001, "sampling/sampling_logp_difference/mean": 0.005033767921850086, "step": 4550, "step_time": 8.2680405380117 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00703125, "completions/max_length": 1764.6, "completions/max_terminated_length": 1593.5, "completions/mean_length": 171.569921875, "completions/mean_terminated_length": 158.52721710205077, "completions/min_length": 56.1, "completions/min_terminated_length": 56.1, "entropy": 0.059660279145464304, "epoch": 9.764453961456102, "frac_reward_zero_std": 0.8625, "grad_norm": 0.443359375, "learning_rate": 9.5441e-06, "loss": 0.0039, "num_tokens": 488453080.0, "reward": 1.037695336341858, "reward_std": 0.2224169120192528, "rewards/reward_accuracy/mean": 0.93828125, "rewards/reward_accuracy/std": 0.2205433279275894, "rewards/reward_format/mean": 0.09941406399011612, "rewards/reward_format/std": 0.005348098673857748, "sampling/importance_sampling_ratio/max": 2.4715290546417235, "sampling/importance_sampling_ratio/mean": 0.9906910359859467, "sampling/importance_sampling_ratio/min": 0.07961583929136395, "sampling/sampling_logp_difference/max": 0.7815635442733765, "sampling/sampling_logp_difference/mean": 0.004459577472880482, "step": 4560, "step_time": 8.505619942804334 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 3.0822124017504393e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 3.0822124017504393e-06, "completions/clipped_ratio": 0.01015625, "completions/max_length": 1706.3, "completions/max_terminated_length": 1603.8, "completions/mean_length": 180.62109375, "completions/mean_terminated_length": 161.53917846679687, "completions/min_length": 65.5, "completions/min_terminated_length": 65.5, "entropy": 0.06901807188987732, "epoch": 9.785867237687366, "frac_reward_zero_std": 0.8, "grad_norm": 0.703125, "learning_rate": 9.5431e-06, "loss": -0.0103, "num_tokens": 489433150.0, "reward": 1.0238086104393005, "reward_std": 0.25063580423593523, "rewards/reward_accuracy/mean": 0.924609375, "rewards/reward_accuracy/std": 0.24830459356307982, "rewards/reward_format/mean": 0.09919922053813934, "rewards/reward_format/std": 0.005881550186313689, "sampling/importance_sampling_ratio/max": 2.520624279975891, "sampling/importance_sampling_ratio/mean": 0.9962082803249359, "sampling/importance_sampling_ratio/min": 0.08497162032872438, "sampling/sampling_logp_difference/max": 0.8319107532501221, "sampling/sampling_logp_difference/mean": 0.004735717969015241, "step": 4570, "step_time": 8.392134373306181 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 1501.8, "completions/max_terminated_length": 1250.3, "completions/mean_length": 162.976171875, "completions/mean_terminated_length": 155.63510437011718, "completions/min_length": 64.4, "completions/min_terminated_length": 64.4, "entropy": 0.05986858382821083, "epoch": 9.807280513918629, "frac_reward_zero_std": 0.83125, "grad_norm": 0.53125, "learning_rate": 9.542100000000001e-06, "loss": -0.0068, "num_tokens": 490368225.0, "reward": 1.0597265779972076, "reward_std": 0.18204839080572127, "rewards/reward_accuracy/mean": 0.96015625, "rewards/reward_accuracy/std": 0.17988041639328003, "rewards/reward_format/mean": 0.09957031384110451, "rewards/reward_format/std": 0.0038833118975162505, "sampling/importance_sampling_ratio/max": 2.413654100894928, "sampling/importance_sampling_ratio/mean": 0.9925789594650268, "sampling/importance_sampling_ratio/min": 0.13196225743740797, "sampling/sampling_logp_difference/max": 0.796013230085373, "sampling/sampling_logp_difference/mean": 0.004629714810289442, "step": 4580, "step_time": 7.159743593994063 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.008984375, "completions/max_length": 1647.4, "completions/max_terminated_length": 1487.4, "completions/mean_length": 178.601953125, "completions/mean_terminated_length": 161.8654815673828, "completions/min_length": 61.9, "completions/min_terminated_length": 61.9, "entropy": 0.06628262377344071, "epoch": 9.828693790149893, "frac_reward_zero_std": 0.78125, "grad_norm": 0.73046875, "learning_rate": 9.541100000000001e-06, "loss": -0.0069, "num_tokens": 491339926.0, "reward": 1.0269922256469726, "reward_std": 0.251862733066082, "rewards/reward_accuracy/mean": 0.927734375, "rewards/reward_accuracy/std": 0.24938036873936653, "rewards/reward_format/mean": 0.09925781413912774, "rewards/reward_format/std": 0.006323321955278516, "sampling/importance_sampling_ratio/max": 2.486555314064026, "sampling/importance_sampling_ratio/mean": 0.9726633787155151, "sampling/importance_sampling_ratio/min": 0.108472665771842, "sampling/sampling_logp_difference/max": 0.8040017247200012, "sampling/sampling_logp_difference/mean": 0.004856206104159355, "step": 4590, "step_time": 8.088956012914423 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.008984375, "completions/max_length": 1891.3, "completions/max_terminated_length": 1526.8, "completions/mean_length": 178.721484375, "completions/mean_terminated_length": 161.84876403808593, "completions/min_length": 61.3, "completions/min_terminated_length": 61.3, "entropy": 0.06509755046572537, "epoch": 9.850107066381156, "frac_reward_zero_std": 0.81875, "grad_norm": 1.265625, "learning_rate": 9.5401e-06, "loss": -0.0037, "num_tokens": 492318653.0, "reward": 1.0129297018051147, "reward_std": 0.27349558025598525, "rewards/reward_accuracy/mean": 0.913671875, "rewards/reward_accuracy/std": 0.27083732932806015, "rewards/reward_format/mean": 0.09925781339406967, "rewards/reward_format/std": 0.006845196196809411, "sampling/importance_sampling_ratio/max": 2.406098258495331, "sampling/importance_sampling_ratio/mean": 0.9857916593551636, "sampling/importance_sampling_ratio/min": 0.03242781683802605, "sampling/sampling_logp_difference/max": 0.8238243341445923, "sampling/sampling_logp_difference/mean": 0.004675760865211487, "step": 4600, "step_time": 9.205698450299678 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.011328125, "completions/max_length": 1710.6, "completions/max_terminated_length": 1409.2, "completions/mean_length": 182.049609375, "completions/mean_terminated_length": 160.84967041015625, "completions/min_length": 64.6, "completions/min_terminated_length": 64.6, "entropy": 0.060299227200448516, "epoch": 9.87152034261242, "frac_reward_zero_std": 0.825, "grad_norm": 0.62109375, "learning_rate": 9.539100000000002e-06, "loss": -0.0055, "num_tokens": 493307772.0, "reward": 1.0219335973262786, "reward_std": 0.24752654507756233, "rewards/reward_accuracy/mean": 0.923046875, "rewards/reward_accuracy/std": 0.24337337017059327, "rewards/reward_format/mean": 0.09888671785593033, "rewards/reward_format/std": 0.007974892528727651, "sampling/importance_sampling_ratio/max": 2.4677175164222716, "sampling/importance_sampling_ratio/mean": 0.9788722157478332, "sampling/importance_sampling_ratio/min": 0.09889643359929323, "sampling/sampling_logp_difference/max": 1.092416000366211, "sampling/sampling_logp_difference/mean": 0.004543773178011179, "step": 4610, "step_time": 8.099804440591834 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005078125, "completions/max_length": 1437.5, "completions/max_terminated_length": 1222.1, "completions/mean_length": 150.1828125, "completions/mean_terminated_length": 140.53572845458984, "completions/min_length": 61.9, "completions/min_terminated_length": 61.9, "entropy": 0.05626896710600704, "epoch": 9.892933618843683, "frac_reward_zero_std": 0.85, "grad_norm": 0.2060546875, "learning_rate": 9.538100000000001e-06, "loss": -0.0035, "num_tokens": 494212000.0, "reward": 1.0249023675918578, "reward_std": 0.2509645760059357, "rewards/reward_accuracy/mean": 0.925390625, "rewards/reward_accuracy/std": 0.24944152757525445, "rewards/reward_format/mean": 0.09951171949505806, "rewards/reward_format/std": 0.004428820172324777, "sampling/importance_sampling_ratio/max": 2.5628363490104675, "sampling/importance_sampling_ratio/mean": 0.9854185879230499, "sampling/importance_sampling_ratio/min": 0.1182455386966467, "sampling/sampling_logp_difference/max": 0.8058889091014863, "sampling/sampling_logp_difference/mean": 0.004434937797486782, "step": 4620, "step_time": 6.957148669296293 }, { "clip_ratio/high_max": 1.2590027836267836e-05, "clip_ratio/high_mean": 1.5737534795334795e-06, "clip_ratio/low_mean": 8.205546782846795e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 9.779300353329744e-06, "completions/clipped_ratio": 0.013671875, "completions/max_length": 1767.5, "completions/max_terminated_length": 1560.8, "completions/mean_length": 192.45390625, "completions/mean_terminated_length": 166.8750244140625, "completions/min_length": 66.1, "completions/min_terminated_length": 66.1, "entropy": 0.06687218085862696, "epoch": 9.914346895074946, "frac_reward_zero_std": 0.825, "grad_norm": 0.1884765625, "learning_rate": 9.5371e-06, "loss": -0.0056, "num_tokens": 495226058.0, "reward": 1.0253125250339508, "reward_std": 0.25344937294721603, "rewards/reward_accuracy/mean": 0.9265625, "rewards/reward_accuracy/std": 0.24933107569813728, "rewards/reward_format/mean": 0.09875000193715096, "rewards/reward_format/std": 0.0070200205314904455, "sampling/importance_sampling_ratio/max": 2.5021052837371824, "sampling/importance_sampling_ratio/mean": 0.9817708969116211, "sampling/importance_sampling_ratio/min": 0.07996816746890545, "sampling/sampling_logp_difference/max": 0.9307345509529114, "sampling/sampling_logp_difference/mean": 0.004679089644923806, "step": 4630, "step_time": 8.6813833822147 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.009765625, "completions/max_length": 1780.0, "completions/max_terminated_length": 1647.4, "completions/mean_length": 201.84296875, "completions/mean_terminated_length": 183.96093139648437, "completions/min_length": 67.2, "completions/min_terminated_length": 67.2, "entropy": 0.06814839667640626, "epoch": 9.93576017130621, "frac_reward_zero_std": 0.825, "grad_norm": 0.171875, "learning_rate": 9.5361e-06, "loss": -0.007, "num_tokens": 496261912.0, "reward": 1.0204687774181367, "reward_std": 0.24497573524713517, "rewards/reward_accuracy/mean": 0.921484375, "rewards/reward_accuracy/std": 0.24184768348932267, "rewards/reward_format/mean": 0.0989843763411045, "rewards/reward_format/std": 0.007863890496082604, "sampling/importance_sampling_ratio/max": 2.4455806493759153, "sampling/importance_sampling_ratio/mean": 0.9807735204696655, "sampling/importance_sampling_ratio/min": 0.09633135758340358, "sampling/sampling_logp_difference/max": 1.082131028175354, "sampling/sampling_logp_difference/mean": 0.004603962879627943, "step": 4640, "step_time": 8.878456921389443 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0046875, "completions/max_length": 1529.0, "completions/max_terminated_length": 1106.4, "completions/mean_length": 159.657421875, "completions/mean_terminated_length": 150.8436752319336, "completions/min_length": 64.7, "completions/min_terminated_length": 64.7, "entropy": 0.0569696560036391, "epoch": 9.957173447537473, "frac_reward_zero_std": 0.85625, "grad_norm": 0.80078125, "learning_rate": 9.535100000000001e-06, "loss": -0.0084, "num_tokens": 497187803.0, "reward": 1.0296094000339509, "reward_std": 0.2422708563506603, "rewards/reward_accuracy/mean": 0.930078125, "rewards/reward_accuracy/std": 0.24068141728639603, "rewards/reward_format/mean": 0.0995312511920929, "rewards/reward_format/std": 0.004436398460529745, "sampling/importance_sampling_ratio/max": 2.3403586387634276, "sampling/importance_sampling_ratio/mean": 0.9843671917915344, "sampling/importance_sampling_ratio/min": 0.060144102200865746, "sampling/sampling_logp_difference/max": 1.0288600683212281, "sampling/sampling_logp_difference/mean": 0.004498667968437076, "step": 4650, "step_time": 7.245305071392795 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.008203125, "completions/max_length": 1672.5, "completions/max_terminated_length": 1336.7, "completions/mean_length": 184.137109375, "completions/mean_terminated_length": 168.96661376953125, "completions/min_length": 61.8, "completions/min_terminated_length": 61.8, "entropy": 0.06492012199014426, "epoch": 9.978586723768737, "frac_reward_zero_std": 0.825, "grad_norm": 0.58203125, "learning_rate": 9.5341e-06, "loss": -0.0066, "num_tokens": 498180906.0, "reward": 1.0069726705551147, "reward_std": 0.26464433670043946, "rewards/reward_accuracy/mean": 0.9078125, "rewards/reward_accuracy/std": 0.2624760016798973, "rewards/reward_format/mean": 0.09916015565395356, "rewards/reward_format/std": 0.00609325550030917, "sampling/importance_sampling_ratio/max": 2.4993377685546876, "sampling/importance_sampling_ratio/mean": 0.9859911143779755, "sampling/importance_sampling_ratio/min": 0.08112027458846569, "sampling/sampling_logp_difference/max": 0.7634958267211914, "sampling/sampling_logp_difference/mean": 0.004719214467331767, "step": 4660, "step_time": 8.155220012229984 }, { "clip_ratio/high_max": 4.145838465774432e-05, "clip_ratio/high_mean": 5.18229808221804e-06, "clip_ratio/low_mean": 3.9637238842260557e-07, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 5.578670470640645e-06, "completions/clipped_ratio": 0.008984375, "completions/max_length": 1583.4, "completions/max_terminated_length": 1338.9, "completions/mean_length": 179.44921875, "completions/mean_terminated_length": 162.9051513671875, "completions/min_length": 67.5, "completions/min_terminated_length": 67.5, "entropy": 0.0680500041693449, "epoch": 10.0, "frac_reward_zero_std": 0.81875, "grad_norm": 0.82421875, "learning_rate": 9.5331e-06, "loss": -0.0075, "num_tokens": 499157032.0, "reward": 1.0245703101158141, "reward_std": 0.24218075945973397, "rewards/reward_accuracy/mean": 0.925390625, "rewards/reward_accuracy/std": 0.23948295712471007, "rewards/reward_format/mean": 0.09917968660593032, "rewards/reward_format/std": 0.006347464257851243, "sampling/importance_sampling_ratio/max": 2.3952232360839845, "sampling/importance_sampling_ratio/mean": 0.983648556470871, "sampling/importance_sampling_ratio/min": 0.14207094460725783, "sampling/sampling_logp_difference/max": 0.7520514488220215, "sampling/sampling_logp_difference/mean": 0.004897421645000577, "step": 4670, "step_time": 7.882719579903641 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00625, "completions/max_length": 1700.4, "completions/max_terminated_length": 1486.7, "completions/mean_length": 183.508984375, "completions/mean_terminated_length": 171.87130279541014, "completions/min_length": 65.8, "completions/min_terminated_length": 65.8, "entropy": 0.06401038118638099, "epoch": 10.021413276231263, "frac_reward_zero_std": 0.79375, "grad_norm": 0.5703125, "learning_rate": 9.532100000000001e-06, "loss": -0.0134, "num_tokens": 500143871.0, "reward": 1.0349609851837158, "reward_std": 0.23652325794100762, "rewards/reward_accuracy/mean": 0.935546875, "rewards/reward_accuracy/std": 0.23443732932209968, "rewards/reward_format/mean": 0.09941406473517418, "rewards/reward_format/std": 0.0058149552904069425, "sampling/importance_sampling_ratio/max": 2.4824804306030273, "sampling/importance_sampling_ratio/mean": 0.9793519079685211, "sampling/importance_sampling_ratio/min": 0.007209146767854691, "sampling/sampling_logp_difference/max": 0.8908413171768188, "sampling/sampling_logp_difference/mean": 0.004679564922116697, "step": 4680, "step_time": 8.200568524489062 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.010546875, "completions/max_length": 1583.8, "completions/max_terminated_length": 1300.2, "completions/mean_length": 176.614453125, "completions/mean_terminated_length": 156.8802848815918, "completions/min_length": 63.1, "completions/min_terminated_length": 63.1, "entropy": 0.06568360319361091, "epoch": 10.042826552462527, "frac_reward_zero_std": 0.85625, "grad_norm": 0.349609375, "learning_rate": 9.531100000000001e-06, "loss": -0.0031, "num_tokens": 501115124.0, "reward": 1.013242208957672, "reward_std": 0.23335094526410102, "rewards/reward_accuracy/mean": 0.9140625, "rewards/reward_accuracy/std": 0.2305763341486454, "rewards/reward_format/mean": 0.0991796873509884, "rewards/reward_format/std": 0.006242572469636798, "sampling/importance_sampling_ratio/max": 2.5319902896881104, "sampling/importance_sampling_ratio/mean": 0.9834266543388367, "sampling/importance_sampling_ratio/min": 0.12470246888697148, "sampling/sampling_logp_difference/max": 0.9546233654022217, "sampling/sampling_logp_difference/mean": 0.004813213716261089, "step": 4690, "step_time": 7.702898796781665 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 1.9710767446667886e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 1.9710767446667886e-06, "completions/clipped_ratio": 0.01015625, "completions/max_length": 1421.8, "completions/max_terminated_length": 1235.9, "completions/mean_length": 165.30625, "completions/mean_terminated_length": 146.19444122314454, "completions/min_length": 63.5, "completions/min_terminated_length": 63.5, "entropy": 0.04887988062109798, "epoch": 10.06423982869379, "frac_reward_zero_std": 0.8375, "grad_norm": 0.37890625, "learning_rate": 9.5301e-06, "loss": -0.0104, "num_tokens": 502053748.0, "reward": 1.018632835149765, "reward_std": 0.26105369329452516, "rewards/reward_accuracy/mean": 0.91953125, "rewards/reward_accuracy/std": 0.2581039220094681, "rewards/reward_format/mean": 0.09910156354308128, "rewards/reward_format/std": 0.005346291325986385, "sampling/importance_sampling_ratio/max": 2.439615249633789, "sampling/importance_sampling_ratio/mean": 0.9883929491043091, "sampling/importance_sampling_ratio/min": 0.14723904244601727, "sampling/sampling_logp_difference/max": 0.7908167600631714, "sampling/sampling_logp_difference/mean": 0.004059883882291615, "step": 4700, "step_time": 7.214248881602543 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 1549.3, "completions/max_terminated_length": 1240.0, "completions/mean_length": 159.0359375, "completions/mean_terminated_length": 151.64660415649413, "completions/min_length": 68.5, "completions/min_terminated_length": 68.5, "entropy": 0.05572506014723331, "epoch": 10.085653104925054, "frac_reward_zero_std": 0.875, "grad_norm": 0.302734375, "learning_rate": 9.529100000000002e-06, "loss": -0.0054, "num_tokens": 502977856.0, "reward": 1.042167991399765, "reward_std": 0.20888747796416282, "rewards/reward_accuracy/mean": 0.942578125, "rewards/reward_accuracy/std": 0.2073250137269497, "rewards/reward_format/mean": 0.09958984479308128, "rewards/reward_format/std": 0.003935943846590817, "sampling/importance_sampling_ratio/max": 2.3481542825698853, "sampling/importance_sampling_ratio/mean": 0.9908926844596863, "sampling/importance_sampling_ratio/min": 0.11660761777311564, "sampling/sampling_logp_difference/max": 0.8368308186531067, "sampling/sampling_logp_difference/mean": 0.004387181042693556, "step": 4710, "step_time": 7.495495401567314 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00546875, "completions/max_length": 1407.4, "completions/max_terminated_length": 1256.9, "completions/mean_length": 159.316015625, "completions/mean_terminated_length": 149.13192749023438, "completions/min_length": 61.3, "completions/min_terminated_length": 61.3, "entropy": 0.05402598327491433, "epoch": 10.107066381156317, "frac_reward_zero_std": 0.8625, "grad_norm": 0.341796875, "learning_rate": 9.528100000000001e-06, "loss": -0.0066, "num_tokens": 503901097.0, "reward": 1.0530273497104645, "reward_std": 0.19916786551475524, "rewards/reward_accuracy/mean": 0.953515625, "rewards/reward_accuracy/std": 0.1973455399274826, "rewards/reward_format/mean": 0.09951171875, "rewards/reward_format/std": 0.004182660300284624, "sampling/importance_sampling_ratio/max": 2.478246879577637, "sampling/importance_sampling_ratio/mean": 0.9915070950984954, "sampling/importance_sampling_ratio/min": 0.163948343321681, "sampling/sampling_logp_difference/max": 0.8108892440795898, "sampling/sampling_logp_difference/mean": 0.004345384589396417, "step": 4720, "step_time": 6.810153344005812 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00546875, "completions/max_length": 1325.5, "completions/max_terminated_length": 1062.4, "completions/mean_length": 160.971875, "completions/mean_terminated_length": 150.75925903320314, "completions/min_length": 65.3, "completions/min_terminated_length": 65.3, "entropy": 0.055510355555452404, "epoch": 10.12847965738758, "frac_reward_zero_std": 0.85625, "grad_norm": 0.3828125, "learning_rate": 9.5271e-06, "loss": -0.0018, "num_tokens": 504829905.0, "reward": 1.0277148842811585, "reward_std": 0.2311268039047718, "rewards/reward_accuracy/mean": 0.928125, "rewards/reward_accuracy/std": 0.229570522159338, "rewards/reward_format/mean": 0.0995898462831974, "rewards/reward_format/std": 0.0036178498528897764, "sampling/importance_sampling_ratio/max": 2.3006074905395506, "sampling/importance_sampling_ratio/mean": 0.993562376499176, "sampling/importance_sampling_ratio/min": 0.17180512547492982, "sampling/sampling_logp_difference/max": 0.84302898645401, "sampling/sampling_logp_difference/mean": 0.00442996525671333, "step": 4730, "step_time": 6.586040171704371 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005859375, "completions/max_length": 1501.6, "completions/max_terminated_length": 1255.2, "completions/mean_length": 180.47578125, "completions/mean_terminated_length": 169.57427368164062, "completions/min_length": 66.6, "completions/min_terminated_length": 66.6, "entropy": 0.061221639858558774, "epoch": 10.149892933618844, "frac_reward_zero_std": 0.78125, "grad_norm": 0.75390625, "learning_rate": 9.5261e-06, "loss": -0.0113, "num_tokens": 505816755.0, "reward": 1.0259961187839508, "reward_std": 0.23059847727417945, "rewards/reward_accuracy/mean": 0.9265625, "rewards/reward_accuracy/std": 0.22877169400453568, "rewards/reward_format/mean": 0.09943359643220902, "rewards/reward_format/std": 0.004968299949541688, "sampling/importance_sampling_ratio/max": 2.4251923322677613, "sampling/importance_sampling_ratio/mean": 0.9854008078575134, "sampling/importance_sampling_ratio/min": 0.11076391004025936, "sampling/sampling_logp_difference/max": 0.863700783252716, "sampling/sampling_logp_difference/mean": 0.0045782451052218676, "step": 4740, "step_time": 7.2587615998083495 }, { "clip_ratio/high_max": 8.630609954707325e-06, "clip_ratio/high_mean": 1.0788262443384156e-06, "clip_ratio/low_mean": 1.6553380419281894e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 2.7341642862666047e-06, "completions/clipped_ratio": 0.01171875, "completions/max_length": 1529.6, "completions/max_terminated_length": 1247.3, "completions/mean_length": 188.034375, "completions/mean_terminated_length": 166.43729400634766, "completions/min_length": 64.8, "completions/min_terminated_length": 64.8, "entropy": 0.058233331446535884, "epoch": 10.171306209850107, "frac_reward_zero_std": 0.875, "grad_norm": 0.0, "learning_rate": 9.5251e-06, "loss": -0.0091, "num_tokens": 506818043.0, "reward": 1.0294140934944154, "reward_std": 0.20186097249388696, "rewards/reward_accuracy/mean": 0.93046875, "rewards/reward_accuracy/std": 0.19880061745643615, "rewards/reward_format/mean": 0.09894531369209289, "rewards/reward_format/std": 0.0070452122949063774, "sampling/importance_sampling_ratio/max": 2.5156790614128113, "sampling/importance_sampling_ratio/mean": 0.9822251498699188, "sampling/importance_sampling_ratio/min": 0.1074827689677477, "sampling/sampling_logp_difference/max": 1.094046139717102, "sampling/sampling_logp_difference/mean": 0.004310228512622416, "step": 4750, "step_time": 7.640354133295477 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.009375, "completions/max_length": 1730.3, "completions/max_terminated_length": 1638.2, "completions/mean_length": 187.036328125, "completions/mean_terminated_length": 169.59925079345703, "completions/min_length": 62.2, "completions/min_terminated_length": 62.2, "entropy": 0.0637752067297697, "epoch": 10.192719486081371, "frac_reward_zero_std": 0.8375, "grad_norm": 0.28125, "learning_rate": 9.524100000000001e-06, "loss": 0.0003, "num_tokens": 507817384.0, "reward": 1.022851574420929, "reward_std": 0.2416798822581768, "rewards/reward_accuracy/mean": 0.9234375, "rewards/reward_accuracy/std": 0.23970472291111947, "rewards/reward_format/mean": 0.09941406324505805, "rewards/reward_format/std": 0.004501550481654704, "sampling/importance_sampling_ratio/max": 2.417951261997223, "sampling/importance_sampling_ratio/mean": 0.9614442825317383, "sampling/importance_sampling_ratio/min": 0.0709114545956254, "sampling/sampling_logp_difference/max": 0.7886774897575378, "sampling/sampling_logp_difference/mean": 0.004624262917786837, "step": 4760, "step_time": 8.629712877390556 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 1.8019359004028957e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 1.8019359004028957e-06, "completions/clipped_ratio": 0.008203125, "completions/max_length": 1640.2, "completions/max_terminated_length": 1434.9, "completions/mean_length": 170.98828125, "completions/mean_terminated_length": 155.6591064453125, "completions/min_length": 62.8, "completions/min_terminated_length": 62.8, "entropy": 0.06614671815186739, "epoch": 10.214132762312634, "frac_reward_zero_std": 0.825, "grad_norm": 0.84765625, "learning_rate": 9.5231e-06, "loss": -0.012, "num_tokens": 508769834.0, "reward": 1.0341406464576721, "reward_std": 0.23185068890452384, "rewards/reward_accuracy/mean": 0.934765625, "rewards/reward_accuracy/std": 0.2300224594771862, "rewards/reward_format/mean": 0.09937500134110451, "rewards/reward_format/std": 0.00468291942961514, "sampling/importance_sampling_ratio/max": 2.3970874190330504, "sampling/importance_sampling_ratio/mean": 0.9731112778186798, "sampling/importance_sampling_ratio/min": 0.08102073594927788, "sampling/sampling_logp_difference/max": 1.4270949900150298, "sampling/sampling_logp_difference/mean": 0.004857416357845068, "step": 4770, "step_time": 7.946768122905633 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01328125, "completions/max_length": 1665.5, "completions/max_terminated_length": 1309.2, "completions/mean_length": 201.6921875, "completions/mean_terminated_length": 177.18009719848632, "completions/min_length": 65.5, "completions/min_terminated_length": 65.5, "entropy": 0.06439845678396523, "epoch": 10.235546038543898, "frac_reward_zero_std": 0.81875, "grad_norm": 0.6875, "learning_rate": 9.522100000000002e-06, "loss": -0.0048, "num_tokens": 509808550.0, "reward": 1.0194921910762786, "reward_std": 0.24058351144194604, "rewards/reward_accuracy/mean": 0.920703125, "rewards/reward_accuracy/std": 0.2367585062980652, "rewards/reward_format/mean": 0.09878906309604644, "rewards/reward_format/std": 0.00804218566045165, "sampling/importance_sampling_ratio/max": 2.4193350076675415, "sampling/importance_sampling_ratio/mean": 0.9816176116466522, "sampling/importance_sampling_ratio/min": 0.12780227214097978, "sampling/sampling_logp_difference/max": 1.0167337298393249, "sampling/sampling_logp_difference/mean": 0.00474659891333431, "step": 4780, "step_time": 8.285175189297297 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.004296875, "completions/max_length": 1631.8, "completions/max_terminated_length": 1393.3, "completions/mean_length": 168.420703125, "completions/mean_terminated_length": 160.3967712402344, "completions/min_length": 60.7, "completions/min_terminated_length": 60.7, "entropy": 0.05787048148922622, "epoch": 10.25695931477516, "frac_reward_zero_std": 0.8375, "grad_norm": 0.34375, "learning_rate": 9.521100000000001e-06, "loss": -0.0092, "num_tokens": 510765451.0, "reward": 1.0382226705551147, "reward_std": 0.21986900866031647, "rewards/reward_accuracy/mean": 0.938671875, "rewards/reward_accuracy/std": 0.21822658851742743, "rewards/reward_format/mean": 0.0995507813990116, "rewards/reward_format/std": 0.004924914822913707, "sampling/importance_sampling_ratio/max": 2.4012659788131714, "sampling/importance_sampling_ratio/mean": 0.9833254992961884, "sampling/importance_sampling_ratio/min": 0.13488417491316795, "sampling/sampling_logp_difference/max": 0.8806165933609009, "sampling/sampling_logp_difference/mean": 0.004511522315442562, "step": 4790, "step_time": 7.795725439387025 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005078125, "completions/max_length": 1287.1, "completions/max_terminated_length": 1092.7, "completions/mean_length": 157.4640625, "completions/mean_terminated_length": 147.88981094360352, "completions/min_length": 61.2, "completions/min_terminated_length": 61.2, "entropy": 0.05190957682207227, "epoch": 10.278372591006423, "frac_reward_zero_std": 0.8375, "grad_norm": 1.140625, "learning_rate": 9.5201e-06, "loss": -0.0036, "num_tokens": 511688927.0, "reward": 1.0475976824760438, "reward_std": 0.19250998198986052, "rewards/reward_accuracy/mean": 0.948046875, "rewards/reward_accuracy/std": 0.19086178690195083, "rewards/reward_format/mean": 0.0995507813990116, "rewards/reward_format/std": 0.0038563163951039316, "sampling/importance_sampling_ratio/max": 2.300386071205139, "sampling/importance_sampling_ratio/mean": 0.9845667541027069, "sampling/importance_sampling_ratio/min": 0.13317147516645492, "sampling/sampling_logp_difference/max": 1.20478093624115, "sampling/sampling_logp_difference/mean": 0.004008870734833181, "step": 4800, "step_time": 6.474248615291435 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0109375, "completions/max_length": 1707.3, "completions/max_terminated_length": 1521.6, "completions/mean_length": 188.6109375, "completions/mean_terminated_length": 168.157421875, "completions/min_length": 68.0, "completions/min_terminated_length": 68.0, "entropy": 0.0667593811172992, "epoch": 10.299785867237688, "frac_reward_zero_std": 0.8125, "grad_norm": 0.330078125, "learning_rate": 9.519100000000002e-06, "loss": -0.0202, "num_tokens": 512692939.0, "reward": 1.0451757907867432, "reward_std": 0.21652201414108277, "rewards/reward_accuracy/mean": 0.94609375, "rewards/reward_accuracy/std": 0.2130692146718502, "rewards/reward_format/mean": 0.09908203184604644, "rewards/reward_format/std": 0.007159696845337749, "sampling/importance_sampling_ratio/max": 2.568993401527405, "sampling/importance_sampling_ratio/mean": 0.9806936919689179, "sampling/importance_sampling_ratio/min": 0.06751054003834725, "sampling/sampling_logp_difference/max": 0.965716826915741, "sampling/sampling_logp_difference/mean": 0.004942614398896694, "step": 4810, "step_time": 8.501069509304944 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0046875, "completions/max_length": 1607.8, "completions/max_terminated_length": 1478.6, "completions/mean_length": 176.783984375, "completions/mean_terminated_length": 168.04881439208984, "completions/min_length": 65.1, "completions/min_terminated_length": 65.1, "entropy": 0.06027210045140237, "epoch": 10.32119914346895, "frac_reward_zero_std": 0.83125, "grad_norm": 0.1005859375, "learning_rate": 9.518100000000001e-06, "loss": -0.0045, "num_tokens": 513666594.0, "reward": 1.0474804878234862, "reward_std": 0.19985100626945496, "rewards/reward_accuracy/mean": 0.948046875, "rewards/reward_accuracy/std": 0.19742033034563064, "rewards/reward_format/mean": 0.09943359494209289, "rewards/reward_format/std": 0.005258726142346859, "sampling/importance_sampling_ratio/max": 2.3125514507293703, "sampling/importance_sampling_ratio/mean": 0.9734965562820435, "sampling/importance_sampling_ratio/min": 0.11263624653220176, "sampling/sampling_logp_difference/max": 0.9144737303256989, "sampling/sampling_logp_difference/mean": 0.004489839519374072, "step": 4820, "step_time": 7.633797021885402 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.007421875, "completions/max_length": 1721.2, "completions/max_terminated_length": 1452.7, "completions/mean_length": 189.158203125, "completions/mean_terminated_length": 175.531640625, "completions/min_length": 63.6, "completions/min_terminated_length": 63.6, "entropy": 0.06439017960801721, "epoch": 10.342612419700215, "frac_reward_zero_std": 0.8125, "grad_norm": 0.080078125, "learning_rate": 9.5171e-06, "loss": -0.0079, "num_tokens": 514668199.0, "reward": 1.017128938436508, "reward_std": 0.25230552181601523, "rewards/reward_accuracy/mean": 0.91796875, "rewards/reward_accuracy/std": 0.24981200695037842, "rewards/reward_format/mean": 0.09916015788912773, "rewards/reward_format/std": 0.006714272918179632, "sampling/importance_sampling_ratio/max": 2.6190020561218263, "sampling/importance_sampling_ratio/mean": 0.9816635012626648, "sampling/importance_sampling_ratio/min": 0.061282921419478956, "sampling/sampling_logp_difference/max": 0.8060807943344116, "sampling/sampling_logp_difference/mean": 0.004747221758589148, "step": 4830, "step_time": 8.192182301488355 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.006640625, "completions/max_length": 1326.2, "completions/max_terminated_length": 1215.1, "completions/mean_length": 185.003125, "completions/mean_terminated_length": 172.852587890625, "completions/min_length": 70.4, "completions/min_terminated_length": 70.4, "entropy": 0.060232422221451996, "epoch": 10.364025695931478, "frac_reward_zero_std": 0.85625, "grad_norm": 1.515625, "learning_rate": 9.5161e-06, "loss": 0.0025, "num_tokens": 515665167.0, "reward": 1.0563085973262787, "reward_std": 0.1730630673468113, "rewards/reward_accuracy/mean": 0.95703125, "rewards/reward_accuracy/std": 0.1708984263241291, "rewards/reward_format/mean": 0.09927734434604644, "rewards/reward_format/std": 0.0048108239425346255, "sampling/importance_sampling_ratio/max": 2.4321522235870363, "sampling/importance_sampling_ratio/mean": 0.9857188820838928, "sampling/importance_sampling_ratio/min": 0.1627669781446457, "sampling/sampling_logp_difference/max": 0.9031266927719116, "sampling/sampling_logp_difference/mean": 0.004445074358955026, "step": 4840, "step_time": 6.552906964186695 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 1.497350172030565e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 1.497350172030565e-06, "completions/clipped_ratio": 0.01015625, "completions/max_length": 1738.7, "completions/max_terminated_length": 1664.6, "completions/mean_length": 198.104296875, "completions/mean_terminated_length": 179.36346740722655, "completions/min_length": 62.3, "completions/min_terminated_length": 62.3, "entropy": 0.066652019508183, "epoch": 10.38543897216274, "frac_reward_zero_std": 0.84375, "grad_norm": 0.73828125, "learning_rate": 9.5151e-06, "loss": -0.0091, "num_tokens": 516691786.0, "reward": 1.0421289205551147, "reward_std": 0.20791791006922722, "rewards/reward_accuracy/mean": 0.94296875, "rewards/reward_accuracy/std": 0.20529475137591363, "rewards/reward_format/mean": 0.09916015714406967, "rewards/reward_format/std": 0.00616649508010596, "sampling/importance_sampling_ratio/max": 2.532863903045654, "sampling/importance_sampling_ratio/mean": 0.9797092854976654, "sampling/importance_sampling_ratio/min": 0.04193511158227921, "sampling/sampling_logp_difference/max": 0.8018358051776886, "sampling/sampling_logp_difference/mean": 0.004547723289579153, "step": 4850, "step_time": 8.891044192691334 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005859375, "completions/max_length": 1790.6, "completions/max_terminated_length": 1713.3, "completions/mean_length": 189.273828125, "completions/mean_terminated_length": 178.59388122558593, "completions/min_length": 65.0, "completions/min_terminated_length": 65.0, "entropy": 0.06715535661205649, "epoch": 10.406852248394005, "frac_reward_zero_std": 0.85625, "grad_norm": 0.1572265625, "learning_rate": 9.514100000000001e-06, "loss": -0.0076, "num_tokens": 517695559.0, "reward": 1.03720703125, "reward_std": 0.2265087731182575, "rewards/reward_accuracy/mean": 0.937890625, "rewards/reward_accuracy/std": 0.22407255470752716, "rewards/reward_format/mean": 0.09931640550494195, "rewards/reward_format/std": 0.004834939050488174, "sampling/importance_sampling_ratio/max": 2.4905220746994017, "sampling/importance_sampling_ratio/mean": 0.978179144859314, "sampling/importance_sampling_ratio/min": 0.07820064034312964, "sampling/sampling_logp_difference/max": 0.9956794381141663, "sampling/sampling_logp_difference/mean": 0.004828765080310405, "step": 4860, "step_time": 8.719576727011008 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.006640625, "completions/max_length": 1607.1, "completions/max_terminated_length": 1255.2, "completions/mean_length": 168.34140625, "completions/mean_terminated_length": 155.7905715942383, "completions/min_length": 62.7, "completions/min_terminated_length": 62.7, "entropy": 0.05395435653626919, "epoch": 10.428265524625267, "frac_reward_zero_std": 0.85, "grad_norm": 0.453125, "learning_rate": 9.5131e-06, "loss": -0.0068, "num_tokens": 518644289.0, "reward": 1.0585156321525573, "reward_std": 0.17474367767572402, "rewards/reward_accuracy/mean": 0.958984375, "rewards/reward_accuracy/std": 0.17259304970502853, "rewards/reward_format/mean": 0.09953125044703484, "rewards/reward_format/std": 0.004842096497304738, "sampling/importance_sampling_ratio/max": 2.5250635147094727, "sampling/importance_sampling_ratio/mean": 0.9895753800868988, "sampling/importance_sampling_ratio/min": 0.11430955780670046, "sampling/sampling_logp_difference/max": 0.9589114427566529, "sampling/sampling_logp_difference/mean": 0.00436220255214721, "step": 4870, "step_time": 7.902452426901436 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00546875, "completions/max_length": 1850.7, "completions/max_terminated_length": 1522.0, "completions/mean_length": 167.548046875, "completions/mean_terminated_length": 157.2882293701172, "completions/min_length": 65.4, "completions/min_terminated_length": 65.4, "entropy": 0.05894123134203255, "epoch": 10.449678800856532, "frac_reward_zero_std": 0.83125, "grad_norm": 1.046875, "learning_rate": 9.5121e-06, "loss": -0.0095, "num_tokens": 519581884.0, "reward": 1.044003927707672, "reward_std": 0.21100990623235702, "rewards/reward_accuracy/mean": 0.94453125, "rewards/reward_accuracy/std": 0.20875885114073753, "rewards/reward_format/mean": 0.0994726575911045, "rewards/reward_format/std": 0.005417788284830749, "sampling/importance_sampling_ratio/max": 2.57973575592041, "sampling/importance_sampling_ratio/mean": 1.007142961025238, "sampling/importance_sampling_ratio/min": 0.12266335990279913, "sampling/sampling_logp_difference/max": 0.8252570629119873, "sampling/sampling_logp_difference/mean": 0.004540077340789139, "step": 4880, "step_time": 8.703042882308363 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0109375, "completions/max_length": 1758.0, "completions/max_terminated_length": 1343.9, "completions/mean_length": 191.475390625, "completions/mean_terminated_length": 171.30794525146484, "completions/min_length": 64.3, "completions/min_terminated_length": 64.3, "entropy": 0.06640867036767303, "epoch": 10.471092077087794, "frac_reward_zero_std": 0.81875, "grad_norm": 0.37890625, "learning_rate": 9.511100000000001e-06, "loss": -0.0118, "num_tokens": 520588541.0, "reward": 0.9967969119548797, "reward_std": 0.2797850653529167, "rewards/reward_accuracy/mean": 0.89765625, "rewards/reward_accuracy/std": 0.2776327133178711, "rewards/reward_format/mean": 0.09914062619209289, "rewards/reward_format/std": 0.006297014886513352, "sampling/importance_sampling_ratio/max": 2.5109572410583496, "sampling/importance_sampling_ratio/mean": 0.9774706065654755, "sampling/importance_sampling_ratio/min": 0.0920160211622715, "sampling/sampling_logp_difference/max": 0.9101097106933593, "sampling/sampling_logp_difference/mean": 0.004767156671732664, "step": 4890, "step_time": 8.247095049102791 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01015625, "completions/max_length": 1675.8, "completions/max_terminated_length": 1228.7, "completions/mean_length": 192.349609375, "completions/mean_terminated_length": 173.69316864013672, "completions/min_length": 70.3, "completions/min_terminated_length": 70.3, "entropy": 0.05977050682995468, "epoch": 10.492505353319057, "frac_reward_zero_std": 0.8125, "grad_norm": 0.64453125, "learning_rate": 9.5101e-06, "loss": -0.0069, "num_tokens": 521604780.0, "reward": 1.0299023509025573, "reward_std": 0.22975466251373292, "rewards/reward_accuracy/mean": 0.930859375, "rewards/reward_accuracy/std": 0.22696456387639047, "rewards/reward_format/mean": 0.09904296919703484, "rewards/reward_format/std": 0.0061457390431314705, "sampling/importance_sampling_ratio/max": 2.5601959228515625, "sampling/importance_sampling_ratio/mean": 0.9767778754234314, "sampling/importance_sampling_ratio/min": 0.12419143058359623, "sampling/sampling_logp_difference/max": 0.940182375907898, "sampling/sampling_logp_difference/mean": 0.00461801050696522, "step": 4900, "step_time": 8.11044835978537 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005078125, "completions/max_length": 1338.1, "completions/max_terminated_length": 1241.4, "completions/mean_length": 161.245703125, "completions/mean_terminated_length": 151.65987396240234, "completions/min_length": 68.5, "completions/min_terminated_length": 68.5, "entropy": 0.054667959664948286, "epoch": 10.513918629550322, "frac_reward_zero_std": 0.84375, "grad_norm": 0.578125, "learning_rate": 9.509100000000002e-06, "loss": -0.0111, "num_tokens": 522535745.0, "reward": 1.0404882907867432, "reward_std": 0.2296967625617981, "rewards/reward_accuracy/mean": 0.941015625, "rewards/reward_accuracy/std": 0.22757843211293222, "rewards/reward_format/mean": 0.09947265684604645, "rewards/reward_format/std": 0.004312735446728766, "sampling/importance_sampling_ratio/max": 2.3191928386688234, "sampling/importance_sampling_ratio/mean": 0.985667246580124, "sampling/importance_sampling_ratio/min": 0.15007615637732669, "sampling/sampling_logp_difference/max": 1.1841680228710174, "sampling/sampling_logp_difference/mean": 0.004358755517750978, "step": 4910, "step_time": 6.577624199195998 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0125, "completions/max_length": 1694.3, "completions/max_terminated_length": 1605.2, "completions/mean_length": 201.530859375, "completions/mean_terminated_length": 178.30618286132812, "completions/min_length": 67.4, "completions/min_terminated_length": 67.4, "entropy": 0.07921906840056181, "epoch": 10.535331905781584, "frac_reward_zero_std": 0.79375, "grad_norm": 0.48046875, "learning_rate": 9.508100000000001e-06, "loss": -0.0131, "num_tokens": 523570960.0, "reward": 1.0405273735523224, "reward_std": 0.2073608286678791, "rewards/reward_accuracy/mean": 0.94140625, "rewards/reward_accuracy/std": 0.20449340716004372, "rewards/reward_format/mean": 0.09912109300494194, "rewards/reward_format/std": 0.006805268581956625, "sampling/importance_sampling_ratio/max": 2.647536587715149, "sampling/importance_sampling_ratio/mean": 0.9840967714786529, "sampling/importance_sampling_ratio/min": 0.09064562804996967, "sampling/sampling_logp_difference/max": 1.0020837903022766, "sampling/sampling_logp_difference/mean": 0.0053715439513325695, "step": 4920, "step_time": 8.303140740393427 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00703125, "completions/max_length": 1541.1, "completions/max_terminated_length": 1130.4, "completions/mean_length": 165.16484375, "completions/mean_terminated_length": 151.87400817871094, "completions/min_length": 66.4, "completions/min_terminated_length": 66.4, "entropy": 0.056129126669839026, "epoch": 10.556745182012849, "frac_reward_zero_std": 0.825, "grad_norm": 0.80859375, "learning_rate": 9.5071e-06, "loss": -0.0101, "num_tokens": 524511510.0, "reward": 1.0544336199760438, "reward_std": 0.17801789045333863, "rewards/reward_accuracy/mean": 0.955078125, "rewards/reward_accuracy/std": 0.17561742439866065, "rewards/reward_format/mean": 0.09935546964406967, "rewards/reward_format/std": 0.005762723460793495, "sampling/importance_sampling_ratio/max": 2.5803240537643433, "sampling/importance_sampling_ratio/mean": 0.9889614999294281, "sampling/importance_sampling_ratio/min": 0.12470354400575161, "sampling/sampling_logp_difference/max": 0.8519905924797058, "sampling/sampling_logp_difference/mean": 0.004304653685539961, "step": 4930, "step_time": 7.419522124898504 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 1737.1, "completions/max_terminated_length": 1428.4, "completions/mean_length": 168.779296875, "completions/mean_terminated_length": 161.42705993652345, "completions/min_length": 66.7, "completions/min_terminated_length": 66.7, "entropy": 0.06257218103855848, "epoch": 10.578158458244111, "frac_reward_zero_std": 0.825, "grad_norm": 0.1875, "learning_rate": 9.5061e-06, "loss": -0.009, "num_tokens": 525462833.0, "reward": 1.050292980670929, "reward_std": 0.20444991290569306, "rewards/reward_accuracy/mean": 0.95078125, "rewards/reward_accuracy/std": 0.20212208330631257, "rewards/reward_format/mean": 0.09951171949505806, "rewards/reward_format/std": 0.004507700470276177, "sampling/importance_sampling_ratio/max": 2.499669003486633, "sampling/importance_sampling_ratio/mean": 0.9877623021602631, "sampling/importance_sampling_ratio/min": 0.06321159228682519, "sampling/sampling_logp_difference/max": 0.9507557034492493, "sampling/sampling_logp_difference/mean": 0.004662231239490211, "step": 4940, "step_time": 8.259411361205276 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0078125, "completions/max_length": 1765.8, "completions/max_terminated_length": 1633.9, "completions/mean_length": 173.028125, "completions/mean_terminated_length": 158.29537963867188, "completions/min_length": 60.1, "completions/min_terminated_length": 60.1, "entropy": 0.06058974452316761, "epoch": 10.599571734475374, "frac_reward_zero_std": 0.86875, "grad_norm": 0.62109375, "learning_rate": 9.5051e-06, "loss": -0.0097, "num_tokens": 526426441.0, "reward": 1.0500585973262786, "reward_std": 0.19576002210378646, "rewards/reward_accuracy/mean": 0.95078125, "rewards/reward_accuracy/std": 0.19334555566310882, "rewards/reward_format/mean": 0.09927734434604644, "rewards/reward_format/std": 0.005874263332225382, "sampling/importance_sampling_ratio/max": 2.518196773529053, "sampling/importance_sampling_ratio/mean": 0.9842970311641693, "sampling/importance_sampling_ratio/min": 0.05216323435306549, "sampling/sampling_logp_difference/max": 0.9797549843788147, "sampling/sampling_logp_difference/mean": 0.004816990555264055, "step": 4950, "step_time": 8.563594775792444 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.006640625, "completions/max_length": 1376.0, "completions/max_terminated_length": 1348.2, "completions/mean_length": 188.064453125, "completions/mean_terminated_length": 176.33844451904298, "completions/min_length": 65.7, "completions/min_terminated_length": 65.7, "entropy": 0.06498868255876004, "epoch": 10.620985010706638, "frac_reward_zero_std": 0.81875, "grad_norm": 0.396484375, "learning_rate": 9.504100000000001e-06, "loss": -0.0027, "num_tokens": 527428510.0, "reward": 1.0467968821525573, "reward_std": 0.17765992358326912, "rewards/reward_accuracy/mean": 0.947265625, "rewards/reward_accuracy/std": 0.17652232125401496, "rewards/reward_format/mean": 0.09953125044703484, "rewards/reward_format/std": 0.0038446391467005015, "sampling/importance_sampling_ratio/max": 2.5173779249191286, "sampling/importance_sampling_ratio/mean": 0.9779905200004577, "sampling/importance_sampling_ratio/min": 0.05153975230641663, "sampling/sampling_logp_difference/max": 1.2321288108825683, "sampling/sampling_logp_difference/mean": 0.004597343038767576, "step": 4960, "step_time": 7.0261391758103855 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005078125, "completions/max_length": 1783.8, "completions/max_terminated_length": 1548.7, "completions/mean_length": 178.753125, "completions/mean_terminated_length": 169.1849136352539, "completions/min_length": 65.7, "completions/min_terminated_length": 65.7, "entropy": 0.061328459344804284, "epoch": 10.642398286937901, "frac_reward_zero_std": 0.85, "grad_norm": 1.6328125, "learning_rate": 9.5031e-06, "loss": 0.0007, "num_tokens": 528395510.0, "reward": 1.0425000131130218, "reward_std": 0.21011030524969102, "rewards/reward_accuracy/mean": 0.94296875, "rewards/reward_accuracy/std": 0.20801644995808602, "rewards/reward_format/mean": 0.09953125044703484, "rewards/reward_format/std": 0.0050258355680853125, "sampling/importance_sampling_ratio/max": 2.380945920944214, "sampling/importance_sampling_ratio/mean": 0.9772957384586334, "sampling/importance_sampling_ratio/min": 0.0770795164629817, "sampling/sampling_logp_difference/max": 0.9506788969039917, "sampling/sampling_logp_difference/mean": 0.004587779147550463, "step": 4970, "step_time": 8.527854624408064 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00546875, "completions/max_length": 1791.4, "completions/max_terminated_length": 1468.7, "completions/mean_length": 180.658203125, "completions/mean_terminated_length": 170.4064514160156, "completions/min_length": 66.0, "completions/min_terminated_length": 66.0, "entropy": 0.06532882642932236, "epoch": 10.663811563169165, "frac_reward_zero_std": 0.81875, "grad_norm": 0.50390625, "learning_rate": 9.5021e-06, "loss": -0.0053, "num_tokens": 529372555.0, "reward": 1.0521093606948853, "reward_std": 0.19298113584518434, "rewards/reward_accuracy/mean": 0.952734375, "rewards/reward_accuracy/std": 0.1907479867339134, "rewards/reward_format/mean": 0.09937499910593033, "rewards/reward_format/std": 0.0063424535328522325, "sampling/importance_sampling_ratio/max": 2.3844524025917053, "sampling/importance_sampling_ratio/mean": 0.9835715889930725, "sampling/importance_sampling_ratio/min": 0.10743230357766151, "sampling/sampling_logp_difference/max": 0.9131993293762207, "sampling/sampling_logp_difference/mean": 0.005010870844125747, "step": 4980, "step_time": 8.620281743415399 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0125, "completions/max_length": 1913.6, "completions/max_terminated_length": 1302.2, "completions/mean_length": 193.49296875, "completions/mean_terminated_length": 170.3731658935547, "completions/min_length": 63.8, "completions/min_terminated_length": 63.8, "entropy": 0.06376608614809812, "epoch": 10.685224839400428, "frac_reward_zero_std": 0.79375, "grad_norm": 0.259765625, "learning_rate": 9.501100000000001e-06, "loss": -0.0051, "num_tokens": 530383609.0, "reward": 1.0389453530311585, "reward_std": 0.2234359435737133, "rewards/reward_accuracy/mean": 0.940234375, "rewards/reward_accuracy/std": 0.21905080378055572, "rewards/reward_format/mean": 0.0987109400331974, "rewards/reward_format/std": 0.009178919834084809, "sampling/importance_sampling_ratio/max": 2.5072694182395936, "sampling/importance_sampling_ratio/mean": 0.9788387715816498, "sampling/importance_sampling_ratio/min": 0.041509222239255905, "sampling/sampling_logp_difference/max": 0.8639187395572663, "sampling/sampling_logp_difference/mean": 0.004684256832115352, "step": 4990, "step_time": 9.267114484400372 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00625, "completions/max_length": 1655.9, "completions/max_terminated_length": 1544.3, "completions/mean_length": 176.002734375, "completions/mean_terminated_length": 164.3274658203125, "completions/min_length": 61.9, "completions/min_terminated_length": 61.9, "entropy": 0.061247565876692535, "epoch": 10.70663811563169, "frac_reward_zero_std": 0.85, "grad_norm": 0.26953125, "learning_rate": 9.5001e-06, "loss": -0.0122, "num_tokens": 531352544.0, "reward": 1.0539844036102295, "reward_std": 0.19136462435126306, "rewards/reward_accuracy/mean": 0.9546875, "rewards/reward_accuracy/std": 0.18862492814660073, "rewards/reward_format/mean": 0.09929687678813934, "rewards/reward_format/std": 0.006007603881880641, "sampling/importance_sampling_ratio/max": 2.5179120540618896, "sampling/importance_sampling_ratio/mean": 0.9842640697956085, "sampling/importance_sampling_ratio/min": 0.06646091612055897, "sampling/sampling_logp_difference/max": 1.0100312232971191, "sampling/sampling_logp_difference/mean": 0.004716954194009304, "step": 5000, "step_time": 8.026638979997369 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00546875, "completions/max_length": 1413.8, "completions/max_terminated_length": 1273.6, "completions/mean_length": 179.3625, "completions/mean_terminated_length": 169.26962890625, "completions/min_length": 57.8, "completions/min_terminated_length": 57.8, "entropy": 0.060890561412088574, "epoch": 10.728051391862955, "frac_reward_zero_std": 0.86875, "grad_norm": 0.7734375, "learning_rate": 9.499100000000002e-06, "loss": -0.011, "num_tokens": 532331664.0, "reward": 1.0354101657867432, "reward_std": 0.19689735993742943, "rewards/reward_accuracy/mean": 0.9359375, "rewards/reward_accuracy/std": 0.1956394322216511, "rewards/reward_format/mean": 0.09947265684604645, "rewards/reward_format/std": 0.003999705868773162, "sampling/importance_sampling_ratio/max": 2.4473586797714235, "sampling/importance_sampling_ratio/mean": 0.9744105696678161, "sampling/importance_sampling_ratio/min": 0.11089488314464688, "sampling/sampling_logp_difference/max": 0.9454531967639923, "sampling/sampling_logp_difference/mean": 0.004448169562965632, "step": 5010, "step_time": 7.0631611654884185 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.010546875, "completions/max_length": 1601.1, "completions/max_terminated_length": 1375.0, "completions/mean_length": 191.6484375, "completions/mean_terminated_length": 172.32168273925782, "completions/min_length": 67.5, "completions/min_terminated_length": 67.5, "entropy": 0.07100865344982595, "epoch": 10.749464668094218, "frac_reward_zero_std": 0.78125, "grad_norm": 0.578125, "learning_rate": 9.498100000000001e-06, "loss": -0.0121, "num_tokens": 533340636.0, "reward": 1.0216992557048798, "reward_std": 0.25049697384238245, "rewards/reward_accuracy/mean": 0.92265625, "rewards/reward_accuracy/std": 0.24796755388379096, "rewards/reward_format/mean": 0.09904297068715096, "rewards/reward_format/std": 0.0062851033639162775, "sampling/importance_sampling_ratio/max": 2.4017580151557922, "sampling/importance_sampling_ratio/mean": 0.9834074199199676, "sampling/importance_sampling_ratio/min": 0.06948208697140217, "sampling/sampling_logp_difference/max": 0.8319382190704345, "sampling/sampling_logp_difference/mean": 0.005170321022160351, "step": 5020, "step_time": 7.9651552862895185 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.010546875, "completions/max_length": 1752.7, "completions/max_terminated_length": 1254.0, "completions/mean_length": 179.16875, "completions/mean_terminated_length": 159.47989654541016, "completions/min_length": 67.7, "completions/min_terminated_length": 67.7, "entropy": 0.05798200184945017, "epoch": 10.770877944325482, "frac_reward_zero_std": 0.825, "grad_norm": 0.126953125, "learning_rate": 9.497100000000001e-06, "loss": -0.0054, "num_tokens": 534315340.0, "reward": 1.0346875190734863, "reward_std": 0.21014132499694824, "rewards/reward_accuracy/mean": 0.935546875, "rewards/reward_accuracy/std": 0.2071576789021492, "rewards/reward_format/mean": 0.09914062619209289, "rewards/reward_format/std": 0.00630557129625231, "sampling/importance_sampling_ratio/max": 2.5219523906707764, "sampling/importance_sampling_ratio/mean": 0.9709899425506592, "sampling/importance_sampling_ratio/min": 0.1402948744595051, "sampling/sampling_logp_difference/max": 0.9116101145744324, "sampling/sampling_logp_difference/mean": 0.004645608388818801, "step": 5030, "step_time": 8.364578777897986 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0015625, "completions/max_length": 1330.3, "completions/max_terminated_length": 1257.0, "completions/mean_length": 159.0546875, "completions/mean_terminated_length": 156.1301467895508, "completions/min_length": 59.0, "completions/min_terminated_length": 59.0, "entropy": 0.05206541200168431, "epoch": 10.792291220556745, "frac_reward_zero_std": 0.8375, "grad_norm": 0.625, "learning_rate": 9.4961e-06, "loss": -0.0061, "num_tokens": 535235128.0, "reward": 1.040019553899765, "reward_std": 0.22289666011929513, "rewards/reward_accuracy/mean": 0.940234375, "rewards/reward_accuracy/std": 0.22215330451726914, "rewards/reward_format/mean": 0.09978515803813934, "rewards/reward_format/std": 0.0023850613739341497, "sampling/importance_sampling_ratio/max": 2.5849648237228395, "sampling/importance_sampling_ratio/mean": 0.9916244208812713, "sampling/importance_sampling_ratio/min": 0.05618860200047493, "sampling/sampling_logp_difference/max": 0.8660517692565918, "sampling/sampling_logp_difference/mean": 0.0043643776327371596, "step": 5040, "step_time": 6.473774758016225 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.011328125, "completions/max_length": 1625.2, "completions/max_terminated_length": 1503.2, "completions/mean_length": 199.3984375, "completions/mean_terminated_length": 178.50812072753905, "completions/min_length": 62.4, "completions/min_terminated_length": 62.4, "entropy": 0.06933032716624439, "epoch": 10.81370449678801, "frac_reward_zero_std": 0.80625, "grad_norm": 0.53125, "learning_rate": 9.4951e-06, "loss": -0.0009, "num_tokens": 536268260.0, "reward": 1.0321679830551147, "reward_std": 0.2390662208199501, "rewards/reward_accuracy/mean": 0.933203125, "rewards/reward_accuracy/std": 0.235712169110775, "rewards/reward_format/mean": 0.09896484464406967, "rewards/reward_format/std": 0.007749768299981951, "sampling/importance_sampling_ratio/max": 2.5219187498092652, "sampling/importance_sampling_ratio/mean": 0.9732260823249816, "sampling/importance_sampling_ratio/min": 0.06438156310468912, "sampling/sampling_logp_difference/max": 1.0320395827293396, "sampling/sampling_logp_difference/mean": 0.0049195786006748675, "step": 5050, "step_time": 8.297622074306128 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0078125, "completions/max_length": 1933.3, "completions/max_terminated_length": 1768.3, "completions/mean_length": 189.14765625, "completions/mean_terminated_length": 174.5191749572754, "completions/min_length": 65.0, "completions/min_terminated_length": 65.0, "entropy": 0.06888531586155296, "epoch": 10.835117773019272, "frac_reward_zero_std": 0.8125, "grad_norm": 0.5859375, "learning_rate": 9.494100000000001e-06, "loss": -0.0043, "num_tokens": 537276206.0, "reward": 1.0333203077316284, "reward_std": 0.23198368400335312, "rewards/reward_accuracy/mean": 0.933984375, "rewards/reward_accuracy/std": 0.2294367402791977, "rewards/reward_format/mean": 0.09933593720197678, "rewards/reward_format/std": 0.005560057540424168, "sampling/importance_sampling_ratio/max": 2.433537447452545, "sampling/importance_sampling_ratio/mean": 0.9699625074863434, "sampling/importance_sampling_ratio/min": 0.06549030318856239, "sampling/sampling_logp_difference/max": 0.960605263710022, "sampling/sampling_logp_difference/mean": 0.0051647849613800645, "step": 5060, "step_time": 9.201832664391258 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003125, "completions/max_length": 1463.1, "completions/max_terminated_length": 1302.5, "completions/mean_length": 157.896484375, "completions/mean_terminated_length": 152.0487075805664, "completions/min_length": 61.0, "completions/min_terminated_length": 61.0, "entropy": 0.049600338703021406, "epoch": 10.856531049250535, "frac_reward_zero_std": 0.89375, "grad_norm": 0.0947265625, "learning_rate": 9.4931e-06, "loss": -0.0065, "num_tokens": 538195045.0, "reward": 1.0644726753234863, "reward_std": 0.14768303856253623, "rewards/reward_accuracy/mean": 0.96484375, "rewards/reward_accuracy/std": 0.14619908556342126, "rewards/reward_format/mean": 0.09962890669703484, "rewards/reward_format/std": 0.002842136239632964, "sampling/importance_sampling_ratio/max": 2.5179192066192626, "sampling/importance_sampling_ratio/mean": 0.978805524110794, "sampling/importance_sampling_ratio/min": 0.14073102306574584, "sampling/sampling_logp_difference/max": 0.9670579254627227, "sampling/sampling_logp_difference/mean": 0.00420946788508445, "step": 5070, "step_time": 7.062053836981067 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.012109375, "completions/max_length": 1852.0, "completions/max_terminated_length": 1684.6, "completions/mean_length": 187.401953125, "completions/mean_terminated_length": 164.96627502441407, "completions/min_length": 66.6, "completions/min_terminated_length": 66.6, "entropy": 0.06113778813742101, "epoch": 10.8779443254818, "frac_reward_zero_std": 0.81875, "grad_norm": 0.359375, "learning_rate": 9.4921e-06, "loss": 0.0005, "num_tokens": 539188090.0, "reward": 1.0340625166893005, "reward_std": 0.23531625047326088, "rewards/reward_accuracy/mean": 0.93515625, "rewards/reward_accuracy/std": 0.2317979760468006, "rewards/reward_format/mean": 0.09890625104308129, "rewards/reward_format/std": 0.0074017565231770275, "sampling/importance_sampling_ratio/max": 2.6104918003082274, "sampling/importance_sampling_ratio/mean": 0.9885890483856201, "sampling/importance_sampling_ratio/min": 0.014094465970993042, "sampling/sampling_logp_difference/max": 1.0490563631057739, "sampling/sampling_logp_difference/mean": 0.004772179154679179, "step": 5080, "step_time": 8.920507014595206 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00859375, "completions/max_length": 1440.0, "completions/max_terminated_length": 1231.7, "completions/mean_length": 181.905859375, "completions/mean_terminated_length": 165.98207092285156, "completions/min_length": 68.0, "completions/min_terminated_length": 68.0, "entropy": 0.05985152896028012, "epoch": 10.899357601713062, "frac_reward_zero_std": 0.81875, "grad_norm": 0.73828125, "learning_rate": 9.491100000000001e-06, "loss": -0.0082, "num_tokens": 540168409.0, "reward": 1.0539843916893006, "reward_std": 0.183576500415802, "rewards/reward_accuracy/mean": 0.9546875, "rewards/reward_accuracy/std": 0.18087779283523558, "rewards/reward_format/mean": 0.09929687604308128, "rewards/reward_format/std": 0.00620755588170141, "sampling/importance_sampling_ratio/max": 2.3989652752876283, "sampling/importance_sampling_ratio/mean": 0.9863479197025299, "sampling/importance_sampling_ratio/min": 0.12438343837857246, "sampling/sampling_logp_difference/max": 0.8749351501464844, "sampling/sampling_logp_difference/mean": 0.004483142727985978, "step": 5090, "step_time": 7.210674205698888 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0046875, "completions/max_length": 1831.8, "completions/max_terminated_length": 1385.9, "completions/mean_length": 168.615234375, "completions/mean_terminated_length": 159.80175323486327, "completions/min_length": 63.8, "completions/min_terminated_length": 63.8, "entropy": 0.058358646417036655, "epoch": 10.920770877944326, "frac_reward_zero_std": 0.8625, "grad_norm": 0.6015625, "learning_rate": 9.4901e-06, "loss": -0.0059, "num_tokens": 541108432.0, "reward": 1.0663671970367432, "reward_std": 0.1602984830737114, "rewards/reward_accuracy/mean": 0.966796875, "rewards/reward_accuracy/std": 0.15798837915062905, "rewards/reward_format/mean": 0.09957031309604644, "rewards/reward_format/std": 0.00445222130510956, "sampling/importance_sampling_ratio/max": 2.410630702972412, "sampling/importance_sampling_ratio/mean": 0.976587963104248, "sampling/importance_sampling_ratio/min": 0.07771367169916629, "sampling/sampling_logp_difference/max": 1.0072986602783203, "sampling/sampling_logp_difference/mean": 0.004539587465114891, "step": 5100, "step_time": 8.771330959603073 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0109375, "completions/max_length": 1898.9, "completions/max_terminated_length": 1608.3, "completions/mean_length": 191.1734375, "completions/mean_terminated_length": 170.7742721557617, "completions/min_length": 63.9, "completions/min_terminated_length": 63.9, "entropy": 0.07122287238016725, "epoch": 10.942184154175589, "frac_reward_zero_std": 0.79375, "grad_norm": 0.296875, "learning_rate": 9.4891e-06, "loss": -0.0195, "num_tokens": 542114844.0, "reward": 1.0357617557048797, "reward_std": 0.22245092913508416, "rewards/reward_accuracy/mean": 0.93671875, "rewards/reward_accuracy/std": 0.2189699426293373, "rewards/reward_format/mean": 0.0990429699420929, "rewards/reward_format/std": 0.007217798964120448, "sampling/importance_sampling_ratio/max": 2.5026329278945925, "sampling/importance_sampling_ratio/mean": 0.9850968062877655, "sampling/importance_sampling_ratio/min": 0.04861032385379076, "sampling/sampling_logp_difference/max": 0.9381913900375366, "sampling/sampling_logp_difference/mean": 0.005056398455053568, "step": 5110, "step_time": 9.140805790093145 }, { "clip_ratio/high_max": 2.1055586694274096e-05, "clip_ratio/high_mean": 2.631948336784262e-06, "clip_ratio/low_mean": 8.954698387242388e-07, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 3.527418175508501e-06, "completions/clipped_ratio": 0.00859375, "completions/max_length": 1648.9, "completions/max_terminated_length": 1485.1, "completions/mean_length": 179.505078125, "completions/mean_terminated_length": 163.45447998046876, "completions/min_length": 68.0, "completions/min_terminated_length": 68.0, "entropy": 0.056818334432318804, "epoch": 10.963597430406852, "frac_reward_zero_std": 0.8375, "grad_norm": 0.28515625, "learning_rate": 9.488100000000002e-06, "loss": -0.0091, "num_tokens": 543092073.0, "reward": 1.0456445574760438, "reward_std": 0.2060455046594143, "rewards/reward_accuracy/mean": 0.946484375, "rewards/reward_accuracy/std": 0.2031620606780052, "rewards/reward_format/mean": 0.09916015788912773, "rewards/reward_format/std": 0.006747024273499847, "sampling/importance_sampling_ratio/max": 2.2676021814346314, "sampling/importance_sampling_ratio/mean": 0.9805663049221038, "sampling/importance_sampling_ratio/min": 0.03328915387392044, "sampling/sampling_logp_difference/max": 0.9310858607292175, "sampling/sampling_logp_difference/mean": 0.004668764700181782, "step": 5120, "step_time": 7.9051237400795795 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00546875, "completions/max_length": 1429.9, "completions/max_terminated_length": 1365.2, "completions/mean_length": 176.266015625, "completions/mean_terminated_length": 166.1843475341797, "completions/min_length": 61.6, "completions/min_terminated_length": 61.6, "entropy": 0.06284216749481857, "epoch": 10.985010706638116, "frac_reward_zero_std": 0.83125, "grad_norm": 0.0, "learning_rate": 9.487100000000001e-06, "loss": -0.0051, "num_tokens": 544057490.0, "reward": 1.0408593952655791, "reward_std": 0.1936935055302456, "rewards/reward_accuracy/mean": 0.94140625, "rewards/reward_accuracy/std": 0.19186536148190497, "rewards/reward_format/mean": 0.09945312589406967, "rewards/reward_format/std": 0.004640272026881576, "sampling/importance_sampling_ratio/max": 2.413148880004883, "sampling/importance_sampling_ratio/mean": 0.9690215468406678, "sampling/importance_sampling_ratio/min": 0.09565825276076793, "sampling/sampling_logp_difference/max": 1.0108483910560608, "sampling/sampling_logp_difference/mean": 0.004685469577088952, "step": 5130, "step_time": 7.007721991513972 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.009765625, "completions/max_length": 1824.1, "completions/max_terminated_length": 1398.0, "completions/mean_length": 177.50234375, "completions/mean_terminated_length": 159.00880279541016, "completions/min_length": 63.3, "completions/min_terminated_length": 63.3, "entropy": 0.05938283989671618, "epoch": 11.006423982869379, "frac_reward_zero_std": 0.875, "grad_norm": 0.1416015625, "learning_rate": 9.4861e-06, "loss": -0.0, "num_tokens": 545026168.0, "reward": 1.0545117259025574, "reward_std": 0.19561451375484468, "rewards/reward_accuracy/mean": 0.95546875, "rewards/reward_accuracy/std": 0.19164123386144638, "rewards/reward_format/mean": 0.09904296919703484, "rewards/reward_format/std": 0.0077475224621593956, "sampling/importance_sampling_ratio/max": 2.2997281074523928, "sampling/importance_sampling_ratio/mean": 0.9795707166194916, "sampling/importance_sampling_ratio/min": 0.06044499799609184, "sampling/sampling_logp_difference/max": 0.8376618027687073, "sampling/sampling_logp_difference/mean": 0.004466478573158383, "step": 5140, "step_time": 8.98516305439407 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.007421875, "completions/max_length": 1434.2, "completions/max_terminated_length": 1033.6, "completions/mean_length": 168.68359375, "completions/mean_terminated_length": 154.84099655151368, "completions/min_length": 68.0, "completions/min_terminated_length": 68.0, "entropy": 0.0475707232253626, "epoch": 11.027837259100643, "frac_reward_zero_std": 0.84375, "grad_norm": 0.333984375, "learning_rate": 9.4851e-06, "loss": -0.0033, "num_tokens": 545979534.0, "reward": 1.061777365207672, "reward_std": 0.15608885511755943, "rewards/reward_accuracy/mean": 0.9625, "rewards/reward_accuracy/std": 0.15319904088973998, "rewards/reward_format/mean": 0.0992773450911045, "rewards/reward_format/std": 0.005373452324420214, "sampling/importance_sampling_ratio/max": 2.341280722618103, "sampling/importance_sampling_ratio/mean": 0.9899633347988128, "sampling/importance_sampling_ratio/min": 0.15202223733067513, "sampling/sampling_logp_difference/max": 1.1137134194374085, "sampling/sampling_logp_difference/mean": 0.004106190265156328, "step": 5150, "step_time": 6.993594323590514 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 1398.2, "completions/max_terminated_length": 1151.1, "completions/mean_length": 161.59453125, "completions/mean_terminated_length": 154.21946411132814, "completions/min_length": 66.2, "completions/min_terminated_length": 66.2, "entropy": 0.04957383314613253, "epoch": 11.049250535331906, "frac_reward_zero_std": 0.91875, "grad_norm": 0.0, "learning_rate": 9.484100000000001e-06, "loss": 0.0019, "num_tokens": 546911264.0, "reward": 1.037890648841858, "reward_std": 0.21197003945708276, "rewards/reward_accuracy/mean": 0.93828125, "rewards/reward_accuracy/std": 0.21021132543683052, "rewards/reward_format/mean": 0.09960937649011611, "rewards/reward_format/std": 0.00374532591085881, "sampling/importance_sampling_ratio/max": 2.4210492968559265, "sampling/importance_sampling_ratio/mean": 0.9840665876865387, "sampling/importance_sampling_ratio/min": 0.07314805015921592, "sampling/sampling_logp_difference/max": 0.9438265085220336, "sampling/sampling_logp_difference/mean": 0.004263187060132623, "step": 5160, "step_time": 6.910571356603759 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.008203125, "completions/max_length": 1576.9, "completions/max_terminated_length": 1199.2, "completions/mean_length": 176.08359375, "completions/mean_terminated_length": 160.7809310913086, "completions/min_length": 64.2, "completions/min_terminated_length": 64.2, "entropy": 0.05516621144488454, "epoch": 11.070663811563168, "frac_reward_zero_std": 0.85625, "grad_norm": 0.333984375, "learning_rate": 9.4831e-06, "loss": -0.0094, "num_tokens": 547881750.0, "reward": 1.044609397649765, "reward_std": 0.1996776893734932, "rewards/reward_accuracy/mean": 0.9453125, "rewards/reward_accuracy/std": 0.196830864995718, "rewards/reward_format/mean": 0.09929687678813934, "rewards/reward_format/std": 0.006117203924804926, "sampling/importance_sampling_ratio/max": 2.558711659908295, "sampling/importance_sampling_ratio/mean": 0.9802055299282074, "sampling/importance_sampling_ratio/min": 0.12744237165898084, "sampling/sampling_logp_difference/max": 0.8421024084091187, "sampling/sampling_logp_difference/mean": 0.0042657186742872, "step": 5170, "step_time": 7.8284899654885525 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.004296875, "completions/max_length": 1409.6, "completions/max_terminated_length": 994.9, "completions/mean_length": 159.89140625, "completions/mean_terminated_length": 151.82794799804688, "completions/min_length": 59.5, "completions/min_terminated_length": 59.5, "entropy": 0.051300633884966376, "epoch": 11.092077087794433, "frac_reward_zero_std": 0.9125, "grad_norm": 0.0, "learning_rate": 9.4821e-06, "loss": -0.0016, "num_tokens": 548801424.0, "reward": 1.055566418170929, "reward_std": 0.1968259960412979, "rewards/reward_accuracy/mean": 0.955859375, "rewards/reward_accuracy/std": 0.1955209568142891, "rewards/reward_format/mean": 0.09970703199505807, "rewards/reward_format/std": 0.003348551061935723, "sampling/importance_sampling_ratio/max": 2.298784005641937, "sampling/importance_sampling_ratio/mean": 0.9908873558044433, "sampling/importance_sampling_ratio/min": 0.14213005900382997, "sampling/sampling_logp_difference/max": 0.9381953835487366, "sampling/sampling_logp_difference/mean": 0.004465310578234493, "step": 5180, "step_time": 6.861818974019843 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00859375, "completions/max_length": 1531.1, "completions/max_terminated_length": 1304.0, "completions/mean_length": 183.21875, "completions/mean_terminated_length": 167.37647399902343, "completions/min_length": 67.3, "completions/min_terminated_length": 67.3, "entropy": 0.05839127979706973, "epoch": 11.113490364025695, "frac_reward_zero_std": 0.84375, "grad_norm": 0.62890625, "learning_rate": 9.481100000000001e-06, "loss": 0.0013, "num_tokens": 549787184.0, "reward": 1.0334961235523223, "reward_std": 0.22554379552602768, "rewards/reward_accuracy/mean": 0.934375, "rewards/reward_accuracy/std": 0.22297546789050102, "rewards/reward_format/mean": 0.09912109449505806, "rewards/reward_format/std": 0.006672433484345675, "sampling/importance_sampling_ratio/max": 2.568999409675598, "sampling/importance_sampling_ratio/mean": 0.9755833625793457, "sampling/importance_sampling_ratio/min": 0.08931943904608489, "sampling/sampling_logp_difference/max": 0.8387944579124451, "sampling/sampling_logp_difference/mean": 0.004511095304042101, "step": 5190, "step_time": 7.638182469207095 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.008203125, "completions/max_length": 1973.6, "completions/max_terminated_length": 1627.9, "completions/mean_length": 190.738671875, "completions/mean_terminated_length": 175.45734100341798, "completions/min_length": 67.3, "completions/min_terminated_length": 67.3, "entropy": 0.061087565426714716, "epoch": 11.13490364025696, "frac_reward_zero_std": 0.86875, "grad_norm": 0.28515625, "learning_rate": 9.480100000000001e-06, "loss": -0.0091, "num_tokens": 550796723.0, "reward": 1.0261719048023223, "reward_std": 0.23681776970624924, "rewards/reward_accuracy/mean": 0.926953125, "rewards/reward_accuracy/std": 0.23395804837346076, "rewards/reward_format/mean": 0.09921875298023224, "rewards/reward_format/std": 0.0073929945006966594, "sampling/importance_sampling_ratio/max": 2.455276274681091, "sampling/importance_sampling_ratio/mean": 0.980702155828476, "sampling/importance_sampling_ratio/min": 0.04144332595169544, "sampling/sampling_logp_difference/max": 0.9862715840339661, "sampling/sampling_logp_difference/mean": 0.004531967430375516, "step": 5200, "step_time": 9.552436894716811 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 1.695696664683055e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 1.695696664683055e-06, "completions/clipped_ratio": 0.01171875, "completions/max_length": 1660.8, "completions/max_terminated_length": 1396.3, "completions/mean_length": 206.140234375, "completions/mean_terminated_length": 185.93787994384766, "completions/min_length": 65.0, "completions/min_terminated_length": 65.0, "entropy": 0.06175266755744815, "epoch": 11.156316916488223, "frac_reward_zero_std": 0.8375, "grad_norm": 0.0, "learning_rate": 9.4791e-06, "loss": -0.0081, "num_tokens": 551839914.0, "reward": 1.0245507836341858, "reward_std": 0.21261753290891647, "rewards/reward_accuracy/mean": 0.92578125, "rewards/reward_accuracy/std": 0.2098153568804264, "rewards/reward_format/mean": 0.09876953065395355, "rewards/reward_format/std": 0.006349330232478678, "sampling/importance_sampling_ratio/max": 2.637651062011719, "sampling/importance_sampling_ratio/mean": 0.9880752623081207, "sampling/importance_sampling_ratio/min": 0.10464849919080735, "sampling/sampling_logp_difference/max": 1.1852705359458924, "sampling/sampling_logp_difference/mean": 0.0045935926027596, "step": 5210, "step_time": 7.987527731800219 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01328125, "completions/max_length": 1487.3, "completions/max_terminated_length": 1325.8, "completions/mean_length": 189.3609375, "completions/mean_terminated_length": 164.66039123535157, "completions/min_length": 64.5, "completions/min_terminated_length": 64.5, "entropy": 0.06005175532773137, "epoch": 11.177730192719487, "frac_reward_zero_std": 0.8625, "grad_norm": 0.26953125, "learning_rate": 9.478100000000002e-06, "loss": -0.0084, "num_tokens": 552847718.0, "reward": 1.0456836342811584, "reward_std": 0.17861257195472718, "rewards/reward_accuracy/mean": 0.946875, "rewards/reward_accuracy/std": 0.17459421679377557, "rewards/reward_format/mean": 0.09880859628319741, "rewards/reward_format/std": 0.0066472083330154415, "sampling/importance_sampling_ratio/max": 2.623581290245056, "sampling/importance_sampling_ratio/mean": 0.9898178517818451, "sampling/importance_sampling_ratio/min": 0.09866492673754693, "sampling/sampling_logp_difference/max": 0.9350365281105042, "sampling/sampling_logp_difference/mean": 0.004486333788372576, "step": 5220, "step_time": 7.661558428985882 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003125, "completions/max_length": 1539.0, "completions/max_terminated_length": 783.0, "completions/mean_length": 156.89765625, "completions/mean_terminated_length": 150.94947204589843, "completions/min_length": 68.6, "completions/min_terminated_length": 68.6, "entropy": 0.045308487163856624, "epoch": 11.19914346895075, "frac_reward_zero_std": 0.8375, "grad_norm": 1.4453125, "learning_rate": 9.477100000000001e-06, "loss": -0.0066, "num_tokens": 553770400.0, "reward": 1.061582052707672, "reward_std": 0.17013634592294694, "rewards/reward_accuracy/mean": 0.96171875, "rewards/reward_accuracy/std": 0.16914646103978156, "rewards/reward_format/mean": 0.09986328184604645, "rewards/reward_format/std": 0.002187500172294676, "sampling/importance_sampling_ratio/max": 2.5146281003952025, "sampling/importance_sampling_ratio/mean": 0.9889275133609772, "sampling/importance_sampling_ratio/min": 0.09889956787228585, "sampling/sampling_logp_difference/max": 0.9780591130256653, "sampling/sampling_logp_difference/mean": 0.004238821822218597, "step": 5230, "step_time": 7.068658238404896 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00234375, "completions/max_length": 1297.3, "completions/max_terminated_length": 1236.2, "completions/mean_length": 161.213671875, "completions/mean_terminated_length": 156.83724060058594, "completions/min_length": 63.0, "completions/min_terminated_length": 63.0, "entropy": 0.050814986764453354, "epoch": 11.220556745182012, "frac_reward_zero_std": 0.9, "grad_norm": 0.24609375, "learning_rate": 9.4761e-06, "loss": -0.0057, "num_tokens": 554699779.0, "reward": 1.070117223262787, "reward_std": 0.13633254319429397, "rewards/reward_accuracy/mean": 0.9703125, "rewards/reward_accuracy/std": 0.1352703295648098, "rewards/reward_format/mean": 0.09980468973517417, "rewards/reward_format/std": 0.0021583085414022206, "sampling/importance_sampling_ratio/max": 2.414444899559021, "sampling/importance_sampling_ratio/mean": 0.9922867059707642, "sampling/importance_sampling_ratio/min": 0.13193062394857408, "sampling/sampling_logp_difference/max": 0.8927584230899811, "sampling/sampling_logp_difference/mean": 0.004148345207795501, "step": 5240, "step_time": 6.284514284081524 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0171875, "completions/max_length": 1866.2, "completions/max_terminated_length": 1755.4, "completions/mean_length": 204.7484375, "completions/mean_terminated_length": 172.70781555175782, "completions/min_length": 66.5, "completions/min_terminated_length": 66.5, "entropy": 0.06793655371293425, "epoch": 11.241970021413277, "frac_reward_zero_std": 0.79375, "grad_norm": 0.435546875, "learning_rate": 9.4751e-06, "loss": -0.0098, "num_tokens": 555748159.0, "reward": 1.0145117402076722, "reward_std": 0.2693760097026825, "rewards/reward_accuracy/mean": 0.916015625, "rewards/reward_accuracy/std": 0.26506926864385605, "rewards/reward_format/mean": 0.0984960950911045, "rewards/reward_format/std": 0.008183709648437797, "sampling/importance_sampling_ratio/max": 2.5453163623809814, "sampling/importance_sampling_ratio/mean": 0.9786543309688568, "sampling/importance_sampling_ratio/min": 0.059549680631607774, "sampling/sampling_logp_difference/max": 1.2894904136657714, "sampling/sampling_logp_difference/mean": 0.004793948400765658, "step": 5250, "step_time": 9.591153694005333 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 1490.0, "completions/max_terminated_length": 1188.4, "completions/mean_length": 169.62109375, "completions/mean_terminated_length": 162.37631378173828, "completions/min_length": 65.6, "completions/min_terminated_length": 65.6, "entropy": 0.05480950819328427, "epoch": 11.26338329764454, "frac_reward_zero_std": 0.85, "grad_norm": 0.60546875, "learning_rate": 9.474100000000001e-06, "loss": -0.0023, "num_tokens": 556701957.0, "reward": 1.033593773841858, "reward_std": 0.22479747906327247, "rewards/reward_accuracy/mean": 0.933984375, "rewards/reward_accuracy/std": 0.22363412156701087, "rewards/reward_format/mean": 0.09960937574505806, "rewards/reward_format/std": 0.0035222926177084445, "sampling/importance_sampling_ratio/max": 2.3838871359825133, "sampling/importance_sampling_ratio/mean": 0.9767265677452087, "sampling/importance_sampling_ratio/min": 0.08907354865223169, "sampling/sampling_logp_difference/max": 0.8409095525741577, "sampling/sampling_logp_difference/mean": 0.0043980484129861, "step": 5260, "step_time": 7.172265021890053 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001953125, "completions/max_length": 959.7, "completions/max_terminated_length": 882.9, "completions/mean_length": 142.198046875, "completions/mean_terminated_length": 138.49600219726562, "completions/min_length": 61.9, "completions/min_terminated_length": 61.9, "entropy": 0.04358038746286184, "epoch": 11.284796573875804, "frac_reward_zero_std": 0.875, "grad_norm": 0.0, "learning_rate": 9.4731e-06, "loss": -0.002, "num_tokens": 557571200.0, "reward": 1.0600390911102295, "reward_std": 0.1708349585533142, "rewards/reward_accuracy/mean": 0.96015625, "rewards/reward_accuracy/std": 0.17023815661668779, "rewards/reward_format/mean": 0.09988281428813935, "rewards/reward_format/std": 0.0015071487054228784, "sampling/importance_sampling_ratio/max": 2.409239721298218, "sampling/importance_sampling_ratio/mean": 0.9890744745731354, "sampling/importance_sampling_ratio/min": 0.15358943343162537, "sampling/sampling_logp_difference/max": 0.9679065704345703, "sampling/sampling_logp_difference/mean": 0.004021324543282389, "step": 5270, "step_time": 4.6887014757929135 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.004296875, "completions/max_length": 1918.2, "completions/max_terminated_length": 1621.1, "completions/mean_length": 184.696484375, "completions/mean_terminated_length": 176.7286018371582, "completions/min_length": 63.5, "completions/min_terminated_length": 63.5, "entropy": 0.054545385646633804, "epoch": 11.306209850107066, "frac_reward_zero_std": 0.8375, "grad_norm": 0.138671875, "learning_rate": 9.4721e-06, "loss": -0.0137, "num_tokens": 558560071.0, "reward": 1.0589453399181366, "reward_std": 0.17827944383025168, "rewards/reward_accuracy/mean": 0.959375, "rewards/reward_accuracy/std": 0.17610670775175094, "rewards/reward_format/mean": 0.09957031458616257, "rewards/reward_format/std": 0.004832571931183338, "sampling/importance_sampling_ratio/max": 2.53144166469574, "sampling/importance_sampling_ratio/mean": 0.9925166547298432, "sampling/importance_sampling_ratio/min": 0.10496765188872814, "sampling/sampling_logp_difference/max": 0.9597858786582947, "sampling/sampling_logp_difference/mean": 0.004316252027638257, "step": 5280, "step_time": 9.219464356204844 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.010546875, "completions/max_length": 1438.9, "completions/max_terminated_length": 1258.4, "completions/mean_length": 185.259765625, "completions/mean_terminated_length": 166.1289306640625, "completions/min_length": 66.3, "completions/min_terminated_length": 66.3, "entropy": 0.060544363665394486, "epoch": 11.32762312633833, "frac_reward_zero_std": 0.88125, "grad_norm": 0.0, "learning_rate": 9.471100000000002e-06, "loss": -0.0079, "num_tokens": 559543728.0, "reward": 1.0557226896286012, "reward_std": 0.17660998329520225, "rewards/reward_accuracy/mean": 0.956640625, "rewards/reward_accuracy/std": 0.17310890406370164, "rewards/reward_format/mean": 0.09908203333616257, "rewards/reward_format/std": 0.0055952159687876705, "sampling/importance_sampling_ratio/max": 2.4276714086532594, "sampling/importance_sampling_ratio/mean": 0.9746297836303711, "sampling/importance_sampling_ratio/min": 0.1343322854489088, "sampling/sampling_logp_difference/max": 0.9084904432296753, "sampling/sampling_logp_difference/mean": 0.004703112761490047, "step": 5290, "step_time": 7.32782853828976 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.008203125, "completions/max_length": 1544.5, "completions/max_terminated_length": 1314.8, "completions/mean_length": 176.209375, "completions/mean_terminated_length": 160.96661987304688, "completions/min_length": 68.2, "completions/min_terminated_length": 68.2, "entropy": 0.05729189794510603, "epoch": 11.349036402569594, "frac_reward_zero_std": 0.85, "grad_norm": 0.236328125, "learning_rate": 9.470100000000001e-06, "loss": -0.0028, "num_tokens": 560510568.0, "reward": 1.0421679973602296, "reward_std": 0.19404015839099883, "rewards/reward_accuracy/mean": 0.94296875, "rewards/reward_accuracy/std": 0.19084297195076944, "rewards/reward_format/mean": 0.09919921979308129, "rewards/reward_format/std": 0.006549647054634988, "sampling/importance_sampling_ratio/max": 2.563789355754852, "sampling/importance_sampling_ratio/mean": 0.9803912997245788, "sampling/importance_sampling_ratio/min": 0.11369948908686638, "sampling/sampling_logp_difference/max": 1.1233096539974212, "sampling/sampling_logp_difference/mean": 0.004607840511016548, "step": 5300, "step_time": 7.425988752691774 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0109375, "completions/max_length": 1750.5, "completions/max_terminated_length": 1691.3, "completions/mean_length": 213.352734375, "completions/mean_terminated_length": 193.38842163085937, "completions/min_length": 72.1, "completions/min_terminated_length": 72.1, "entropy": 0.07226661224849522, "epoch": 11.370449678800856, "frac_reward_zero_std": 0.79375, "grad_norm": 0.78125, "learning_rate": 9.4691e-06, "loss": -0.0055, "num_tokens": 561580463.0, "reward": 1.032324242591858, "reward_std": 0.2308337815105915, "rewards/reward_accuracy/mean": 0.933203125, "rewards/reward_accuracy/std": 0.22816708758473397, "rewards/reward_format/mean": 0.09912109524011611, "rewards/reward_format/std": 0.006275810836814344, "sampling/importance_sampling_ratio/max": 2.4734912872314454, "sampling/importance_sampling_ratio/mean": 0.9717226922512054, "sampling/importance_sampling_ratio/min": 0.03771335864439607, "sampling/sampling_logp_difference/max": 0.8082320094108582, "sampling/sampling_logp_difference/mean": 0.005098061310127378, "step": 5310, "step_time": 8.677178171192645 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.004296875, "completions/max_length": 1641.5, "completions/max_terminated_length": 1264.6, "completions/mean_length": 171.42421875, "completions/mean_terminated_length": 163.41295776367187, "completions/min_length": 64.2, "completions/min_terminated_length": 64.2, "entropy": 0.05415123070124537, "epoch": 11.39186295503212, "frac_reward_zero_std": 0.88125, "grad_norm": 0.80859375, "learning_rate": 9.468100000000002e-06, "loss": -0.0049, "num_tokens": 562529469.0, "reward": 1.0577343940734862, "reward_std": 0.15350728780031203, "rewards/reward_accuracy/mean": 0.958203125, "rewards/reward_accuracy/std": 0.1510814607143402, "rewards/reward_format/mean": 0.0995312511920929, "rewards/reward_format/std": 0.0052109131356701255, "sampling/importance_sampling_ratio/max": 2.4866978406906126, "sampling/importance_sampling_ratio/mean": 0.9834004044532776, "sampling/importance_sampling_ratio/min": 0.08746480718255042, "sampling/sampling_logp_difference/max": 0.8656875312328338, "sampling/sampling_logp_difference/mean": 0.004360417718999088, "step": 5320, "step_time": 8.037146555099753 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0046875, "completions/max_length": 1522.0, "completions/max_terminated_length": 1310.3, "completions/mean_length": 171.736328125, "completions/mean_terminated_length": 162.94429931640624, "completions/min_length": 67.8, "completions/min_terminated_length": 67.8, "entropy": 0.054042431083507834, "epoch": 11.413276231263383, "frac_reward_zero_std": 0.83125, "grad_norm": 0.42578125, "learning_rate": 9.467100000000001e-06, "loss": -0.0106, "num_tokens": 563484234.0, "reward": 1.052246105670929, "reward_std": 0.1972512759268284, "rewards/reward_accuracy/mean": 0.952734375, "rewards/reward_accuracy/std": 0.19574617519974707, "rewards/reward_format/mean": 0.09951171949505806, "rewards/reward_format/std": 0.004323652293533087, "sampling/importance_sampling_ratio/max": 2.5100038766860964, "sampling/importance_sampling_ratio/mean": 0.9745616257190705, "sampling/importance_sampling_ratio/min": 0.05476651638746262, "sampling/sampling_logp_difference/max": 0.9220221638679504, "sampling/sampling_logp_difference/mean": 0.00448452727869153, "step": 5330, "step_time": 7.361234192593838 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00703125, "completions/max_length": 1812.8, "completions/max_terminated_length": 1720.8, "completions/mean_length": 184.16953125, "completions/mean_terminated_length": 171.2229019165039, "completions/min_length": 63.0, "completions/min_terminated_length": 63.0, "entropy": 0.059212718065828084, "epoch": 11.434689507494646, "frac_reward_zero_std": 0.85, "grad_norm": 0.5, "learning_rate": 9.4661e-06, "loss": -0.0061, "num_tokens": 564473532.0, "reward": 1.0337500154972077, "reward_std": 0.2317127503454685, "rewards/reward_accuracy/mean": 0.934375, "rewards/reward_accuracy/std": 0.2297601468861103, "rewards/reward_format/mean": 0.09937500134110451, "rewards/reward_format/std": 0.004934750241227448, "sampling/importance_sampling_ratio/max": 2.352387571334839, "sampling/importance_sampling_ratio/mean": 0.9762946128845215, "sampling/importance_sampling_ratio/min": 0.10552137382328511, "sampling/sampling_logp_difference/max": 0.8731565952301026, "sampling/sampling_logp_difference/mean": 0.004669048334471881, "step": 5340, "step_time": 8.798201813400373 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.007421875, "completions/max_length": 1631.3, "completions/max_terminated_length": 1425.9, "completions/mean_length": 169.453515625, "completions/mean_terminated_length": 155.50780639648437, "completions/min_length": 62.0, "completions/min_terminated_length": 62.0, "entropy": 0.05299694295972586, "epoch": 11.45610278372591, "frac_reward_zero_std": 0.85625, "grad_norm": 1.234375, "learning_rate": 9.4651e-06, "loss": -0.0053, "num_tokens": 565422581.0, "reward": 1.0605859518051148, "reward_std": 0.19059524759650232, "rewards/reward_accuracy/mean": 0.961328125, "rewards/reward_accuracy/std": 0.18705111294984816, "rewards/reward_format/mean": 0.09925781339406967, "rewards/reward_format/std": 0.005742412526160479, "sampling/importance_sampling_ratio/max": 2.5340433597564695, "sampling/importance_sampling_ratio/mean": 0.9949930608272552, "sampling/importance_sampling_ratio/min": 0.10530232526361942, "sampling/sampling_logp_difference/max": 1.172405469417572, "sampling/sampling_logp_difference/mean": 0.0043753654230386015, "step": 5350, "step_time": 8.013957288308301 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 1.494976913818391e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 1.494976913818391e-06, "completions/clipped_ratio": 0.0078125, "completions/max_length": 1729.0, "completions/max_terminated_length": 1494.8, "completions/mean_length": 175.932421875, "completions/mean_terminated_length": 161.3014694213867, "completions/min_length": 64.5, "completions/min_terminated_length": 64.5, "entropy": 0.05889112739823758, "epoch": 11.477516059957173, "frac_reward_zero_std": 0.8375, "grad_norm": 0.0, "learning_rate": 9.4641e-06, "loss": -0.0053, "num_tokens": 566388440.0, "reward": 1.047050791978836, "reward_std": 0.18893018439412118, "rewards/reward_accuracy/mean": 0.94765625, "rewards/reward_accuracy/std": 0.18705590665340424, "rewards/reward_format/mean": 0.09939453229308129, "rewards/reward_format/std": 0.0055356772616505625, "sampling/importance_sampling_ratio/max": 2.5055844306945803, "sampling/importance_sampling_ratio/mean": 0.9924162447452545, "sampling/importance_sampling_ratio/min": 0.1401386771351099, "sampling/sampling_logp_difference/max": 0.9062417864799499, "sampling/sampling_logp_difference/mean": 0.004647717205807566, "step": 5360, "step_time": 8.155308975104708 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00546875, "completions/max_length": 1420.2, "completions/max_terminated_length": 1225.8, "completions/mean_length": 168.21015625, "completions/mean_terminated_length": 157.966748046875, "completions/min_length": 61.0, "completions/min_terminated_length": 61.0, "entropy": 0.05220930436626077, "epoch": 11.498929336188437, "frac_reward_zero_std": 0.8875, "grad_norm": 0.9375, "learning_rate": 9.463100000000001e-06, "loss": 0.0014, "num_tokens": 567332226.0, "reward": 1.032500022649765, "reward_std": 0.22379263639450073, "rewards/reward_accuracy/mean": 0.9328125, "rewards/reward_accuracy/std": 0.22272489964962006, "rewards/reward_format/mean": 0.09968750178813934, "rewards/reward_format/std": 0.003524223598651588, "sampling/importance_sampling_ratio/max": 2.3726468086242676, "sampling/importance_sampling_ratio/mean": 0.9701983749866485, "sampling/importance_sampling_ratio/min": 0.09939235523343086, "sampling/sampling_logp_difference/max": 1.062865948677063, "sampling/sampling_logp_difference/mean": 0.0043634033994749185, "step": 5370, "step_time": 7.109382184009883 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00234375, "completions/max_length": 1774.1, "completions/max_terminated_length": 1480.7, "completions/mean_length": 180.8359375, "completions/mean_terminated_length": 176.46194152832032, "completions/min_length": 66.1, "completions/min_terminated_length": 66.1, "entropy": 0.06287550271954387, "epoch": 11.5203426124197, "frac_reward_zero_std": 0.85, "grad_norm": 0.1826171875, "learning_rate": 9.4621e-06, "loss": -0.0154, "num_tokens": 568317534.0, "reward": 1.0458398520946504, "reward_std": 0.19698601216077805, "rewards/reward_accuracy/mean": 0.94609375, "rewards/reward_accuracy/std": 0.19574195742607117, "rewards/reward_format/mean": 0.09974609389901161, "rewards/reward_format/std": 0.003480213647708297, "sampling/importance_sampling_ratio/max": 2.57554669380188, "sampling/importance_sampling_ratio/mean": 0.9857352077960968, "sampling/importance_sampling_ratio/min": 0.10488540530204774, "sampling/sampling_logp_difference/max": 1.037378764152527, "sampling/sampling_logp_difference/mean": 0.004797182139009237, "step": 5380, "step_time": 8.47470591858728 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005078125, "completions/max_length": 1570.0, "completions/max_terminated_length": 1246.8, "completions/mean_length": 177.21796875, "completions/mean_terminated_length": 167.78542938232422, "completions/min_length": 74.0, "completions/min_terminated_length": 74.0, "entropy": 0.05995953436940908, "epoch": 11.541755888650963, "frac_reward_zero_std": 0.86875, "grad_norm": 0.34765625, "learning_rate": 9.461100000000002e-06, "loss": -0.0074, "num_tokens": 569287964.0, "reward": 1.0371093988418578, "reward_std": 0.21677694842219353, "rewards/reward_accuracy/mean": 0.9375, "rewards/reward_accuracy/std": 0.21538259088993073, "rewards/reward_format/mean": 0.09960937723517418, "rewards/reward_format/std": 0.004598386911675334, "sampling/importance_sampling_ratio/max": 2.480675482749939, "sampling/importance_sampling_ratio/mean": 0.9769798636436462, "sampling/importance_sampling_ratio/min": 0.09574082642793655, "sampling/sampling_logp_difference/max": 1.0349814355373383, "sampling/sampling_logp_difference/mean": 0.004789444757625461, "step": 5390, "step_time": 7.6199145523074545 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 1.1444091796875e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 1.1444091796875e-06, "completions/clipped_ratio": 0.019140625, "completions/max_length": 1988.5, "completions/max_terminated_length": 1691.7, "completions/mean_length": 224.709375, "completions/mean_terminated_length": 189.79188842773436, "completions/min_length": 66.8, "completions/min_terminated_length": 66.8, "entropy": 0.07739067380316556, "epoch": 11.563169164882227, "frac_reward_zero_std": 0.875, "grad_norm": 0.28515625, "learning_rate": 9.460100000000001e-06, "loss": 0.0011, "num_tokens": 570383588.0, "reward": 1.030839866399765, "reward_std": 0.22420699894428253, "rewards/reward_accuracy/mean": 0.932421875, "rewards/reward_accuracy/std": 0.2192845053970814, "rewards/reward_format/mean": 0.09841797053813935, "rewards/reward_format/std": 0.008944371365942061, "sampling/importance_sampling_ratio/max": 2.6182291984558104, "sampling/importance_sampling_ratio/mean": 0.9697023510932923, "sampling/importance_sampling_ratio/min": 0.003215079545043409, "sampling/sampling_logp_difference/max": 1.031662654876709, "sampling/sampling_logp_difference/mean": 0.0051609529880806805, "step": 5400, "step_time": 10.15187937351293 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.009375, "completions/max_length": 1626.3, "completions/max_terminated_length": 1394.4, "completions/mean_length": 190.216015625, "completions/mean_terminated_length": 172.82107543945312, "completions/min_length": 65.4, "completions/min_terminated_length": 65.4, "entropy": 0.06093245351221412, "epoch": 11.58458244111349, "frac_reward_zero_std": 0.86875, "grad_norm": 0.67578125, "learning_rate": 9.4591e-06, "loss": -0.0087, "num_tokens": 571388653.0, "reward": 1.047460961341858, "reward_std": 0.2081266723573208, "rewards/reward_accuracy/mean": 0.9484375, "rewards/reward_accuracy/std": 0.20465268045663834, "rewards/reward_format/mean": 0.09902343899011612, "rewards/reward_format/std": 0.006702065002173185, "sampling/importance_sampling_ratio/max": 2.4319849729537966, "sampling/importance_sampling_ratio/mean": 0.9813357055187225, "sampling/importance_sampling_ratio/min": 0.1023970540612936, "sampling/sampling_logp_difference/max": 1.1461209177970886, "sampling/sampling_logp_difference/mean": 0.004550757887773216, "step": 5410, "step_time": 8.007879570417572 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01171875, "completions/max_length": 1999.1, "completions/max_terminated_length": 1623.5, "completions/mean_length": 190.173046875, "completions/mean_terminated_length": 168.26591033935546, "completions/min_length": 66.2, "completions/min_terminated_length": 66.2, "entropy": 0.07052513151429593, "epoch": 11.605995717344754, "frac_reward_zero_std": 0.825, "grad_norm": 0.291015625, "learning_rate": 9.458100000000002e-06, "loss": -0.0097, "num_tokens": 572390712.0, "reward": 1.0466797053813934, "reward_std": 0.209648285061121, "rewards/reward_accuracy/mean": 0.94765625, "rewards/reward_accuracy/std": 0.2055061213672161, "rewards/reward_format/mean": 0.09902343824505806, "rewards/reward_format/std": 0.007761914562433958, "sampling/importance_sampling_ratio/max": 2.4941864967346192, "sampling/importance_sampling_ratio/mean": 0.9648529529571533, "sampling/importance_sampling_ratio/min": 0.047953236103057864, "sampling/sampling_logp_difference/max": 0.9334433555603028, "sampling/sampling_logp_difference/mean": 0.004996118624694646, "step": 5420, "step_time": 9.511264996393583 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.008984375, "completions/max_length": 1655.1, "completions/max_terminated_length": 1416.9, "completions/mean_length": 182.2421875, "completions/mean_terminated_length": 165.62183532714843, "completions/min_length": 69.5, "completions/min_terminated_length": 69.5, "entropy": 0.057917721755802634, "epoch": 11.627408993576017, "frac_reward_zero_std": 0.83125, "grad_norm": 1.0703125, "learning_rate": 9.457100000000001e-06, "loss": -0.0017, "num_tokens": 573376276.0, "reward": 1.0381640911102294, "reward_std": 0.21446372494101523, "rewards/reward_accuracy/mean": 0.9390625, "rewards/reward_accuracy/std": 0.2116647854447365, "rewards/reward_format/mean": 0.09910156428813935, "rewards/reward_format/std": 0.0056836498901247975, "sampling/importance_sampling_ratio/max": 2.509683918952942, "sampling/importance_sampling_ratio/mean": 0.9843315005302429, "sampling/importance_sampling_ratio/min": 0.06937746722251177, "sampling/sampling_logp_difference/max": 0.79686079621315, "sampling/sampling_logp_difference/mean": 0.004715158930048346, "step": 5430, "step_time": 8.01404344929033 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.004296875, "completions/max_length": 1808.8, "completions/max_terminated_length": 1544.8, "completions/mean_length": 184.6234375, "completions/mean_terminated_length": 176.62430725097656, "completions/min_length": 63.7, "completions/min_terminated_length": 63.7, "entropy": 0.06536171636544168, "epoch": 11.64882226980728, "frac_reward_zero_std": 0.8125, "grad_norm": 0.9140625, "learning_rate": 9.4561e-06, "loss": -0.0033, "num_tokens": 574370400.0, "reward": 1.0351172268390656, "reward_std": 0.22902742624282837, "rewards/reward_accuracy/mean": 0.935546875, "rewards/reward_accuracy/std": 0.22756540030241013, "rewards/reward_format/mean": 0.09957031533122063, "rewards/reward_format/std": 0.004639781382866204, "sampling/importance_sampling_ratio/max": 2.703585910797119, "sampling/importance_sampling_ratio/mean": 0.9853502154350281, "sampling/importance_sampling_ratio/min": 0.02280167117714882, "sampling/sampling_logp_difference/max": 1.152755182981491, "sampling/sampling_logp_difference/mean": 0.005119440401904285, "step": 5440, "step_time": 8.398188020422822 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00703125, "completions/max_length": 1563.7, "completions/max_terminated_length": 1330.6, "completions/mean_length": 186.773828125, "completions/mean_terminated_length": 173.90175170898436, "completions/min_length": 67.4, "completions/min_terminated_length": 67.4, "entropy": 0.06404700328130275, "epoch": 11.670235546038544, "frac_reward_zero_std": 0.8375, "grad_norm": 1.0390625, "learning_rate": 9.4551e-06, "loss": -0.0059, "num_tokens": 575363949.0, "reward": 1.0672070384025574, "reward_std": 0.14380362033843994, "rewards/reward_accuracy/mean": 0.96796875, "rewards/reward_accuracy/std": 0.14081485643982888, "rewards/reward_format/mean": 0.09923828318715096, "rewards/reward_format/std": 0.005747591052204371, "sampling/importance_sampling_ratio/max": 2.385467195510864, "sampling/importance_sampling_ratio/mean": 0.9764528632164001, "sampling/importance_sampling_ratio/min": 0.1276267245411873, "sampling/sampling_logp_difference/max": 1.0859193742275237, "sampling/sampling_logp_difference/mean": 0.004878942295908928, "step": 5450, "step_time": 7.683173120487481 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01171875, "completions/max_length": 1664.3, "completions/max_terminated_length": 1495.1, "completions/mean_length": 213.473046875, "completions/mean_terminated_length": 192.06815643310546, "completions/min_length": 64.5, "completions/min_terminated_length": 64.5, "entropy": 0.07292865007184446, "epoch": 11.691648822269807, "frac_reward_zero_std": 0.8125, "grad_norm": 0.58984375, "learning_rate": 9.4541e-06, "loss": -0.0243, "num_tokens": 576434872.0, "reward": 1.0319336116313935, "reward_std": 0.22814005613327026, "rewards/reward_accuracy/mean": 0.9328125, "rewards/reward_accuracy/std": 0.22537462860345842, "rewards/reward_format/mean": 0.09912109449505806, "rewards/reward_format/std": 0.006894739111885428, "sampling/importance_sampling_ratio/max": 2.5744168639183043, "sampling/importance_sampling_ratio/mean": 0.9789920389652252, "sampling/importance_sampling_ratio/min": 0.07137143090367318, "sampling/sampling_logp_difference/max": 0.9534370183944703, "sampling/sampling_logp_difference/mean": 0.005040205735713244, "step": 5460, "step_time": 8.35780284528737 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01171875, "completions/max_length": 1985.5, "completions/max_terminated_length": 1849.3, "completions/mean_length": 197.044140625, "completions/mean_terminated_length": 175.23011932373046, "completions/min_length": 64.8, "completions/min_terminated_length": 64.8, "entropy": 0.07087927646934986, "epoch": 11.713062098501071, "frac_reward_zero_std": 0.81875, "grad_norm": 0.2265625, "learning_rate": 9.453100000000001e-06, "loss": -0.0174, "num_tokens": 577458617.0, "reward": 1.0328906416893004, "reward_std": 0.24208325892686844, "rewards/reward_accuracy/mean": 0.933984375, "rewards/reward_accuracy/std": 0.2376169130206108, "rewards/reward_format/mean": 0.09890625178813935, "rewards/reward_format/std": 0.008191753481514751, "sampling/importance_sampling_ratio/max": 2.4512992978096007, "sampling/importance_sampling_ratio/mean": 0.9793515622615814, "sampling/importance_sampling_ratio/min": 0.03216953934170306, "sampling/sampling_logp_difference/max": 0.8732777953147888, "sampling/sampling_logp_difference/mean": 0.005114543065428734, "step": 5470, "step_time": 9.427058506591129 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01328125, "completions/max_length": 1933.1, "completions/max_terminated_length": 1690.3, "completions/mean_length": 189.66796875, "completions/mean_terminated_length": 164.73313751220704, "completions/min_length": 62.9, "completions/min_terminated_length": 62.9, "entropy": 0.06849601750727743, "epoch": 11.734475374732334, "frac_reward_zero_std": 0.81875, "grad_norm": 1.5625, "learning_rate": 9.4521e-06, "loss": -0.012, "num_tokens": 578462919.0, "reward": 1.0467968940734864, "reward_std": 0.20838939473032952, "rewards/reward_accuracy/mean": 0.94765625, "rewards/reward_accuracy/std": 0.20493818297982216, "rewards/reward_format/mean": 0.09914062619209289, "rewards/reward_format/std": 0.00750048547051847, "sampling/importance_sampling_ratio/max": 2.5063945055007935, "sampling/importance_sampling_ratio/mean": 0.9852425396442414, "sampling/importance_sampling_ratio/min": 0.012690242659300566, "sampling/sampling_logp_difference/max": 0.8750132203102112, "sampling/sampling_logp_difference/mean": 0.005100026493892074, "step": 5480, "step_time": 9.23580350188422 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 9.969150141841964e-07, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 9.969150141841964e-07, "completions/clipped_ratio": 0.012890625, "completions/max_length": 1623.4, "completions/max_terminated_length": 1441.1, "completions/mean_length": 194.415625, "completions/mean_terminated_length": 170.5663619995117, "completions/min_length": 70.3, "completions/min_terminated_length": 70.3, "entropy": 0.05967251220718026, "epoch": 11.755888650963598, "frac_reward_zero_std": 0.81875, "grad_norm": 2.71875, "learning_rate": 9.4511e-06, "loss": -0.006, "num_tokens": 579479071.0, "reward": 1.0310742557048798, "reward_std": 0.21503591984510423, "rewards/reward_accuracy/mean": 0.932421875, "rewards/reward_accuracy/std": 0.210786372423172, "rewards/reward_format/mean": 0.09865234494209289, "rewards/reward_format/std": 0.008206942304968833, "sampling/importance_sampling_ratio/max": 2.585648465156555, "sampling/importance_sampling_ratio/mean": 0.9784492969512939, "sampling/importance_sampling_ratio/min": 0.11250863205641508, "sampling/sampling_logp_difference/max": 1.0512039065361023, "sampling/sampling_logp_difference/mean": 0.004563816520385444, "step": 5490, "step_time": 8.073261754808481 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01015625, "completions/max_length": 1651.0, "completions/max_terminated_length": 1480.1, "completions/mean_length": 190.634765625, "completions/mean_terminated_length": 171.83755950927736, "completions/min_length": 66.8, "completions/min_terminated_length": 66.8, "entropy": 0.060199832124635574, "epoch": 11.777301927194861, "frac_reward_zero_std": 0.85625, "grad_norm": 0.0, "learning_rate": 9.450100000000001e-06, "loss": 0.0007, "num_tokens": 580483320.0, "reward": 1.0545703291893005, "reward_std": 0.1615181103348732, "rewards/reward_accuracy/mean": 0.95546875, "rewards/reward_accuracy/std": 0.15816218852996827, "rewards/reward_format/mean": 0.09910156354308128, "rewards/reward_format/std": 0.006745753576979041, "sampling/importance_sampling_ratio/max": 2.5767147302627564, "sampling/importance_sampling_ratio/mean": 0.9825194656848908, "sampling/importance_sampling_ratio/min": 0.11496560331434011, "sampling/sampling_logp_difference/max": 1.2277524828910829, "sampling/sampling_logp_difference/mean": 0.004694106103852391, "step": 5500, "step_time": 7.9552341286762385 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.008203125, "completions/max_length": 1840.7, "completions/max_terminated_length": 1554.2, "completions/mean_length": 189.735546875, "completions/mean_terminated_length": 174.47580261230468, "completions/min_length": 59.7, "completions/min_terminated_length": 59.7, "entropy": 0.07010595770552755, "epoch": 11.798715203426124, "frac_reward_zero_std": 0.83125, "grad_norm": 0.50390625, "learning_rate": 9.4491e-06, "loss": -0.0119, "num_tokens": 581490899.0, "reward": 1.042089867591858, "reward_std": 0.20363333746790885, "rewards/reward_accuracy/mean": 0.942578125, "rewards/reward_accuracy/std": 0.20191937312483788, "rewards/reward_format/mean": 0.09951172098517418, "rewards/reward_format/std": 0.004633177001960575, "sampling/importance_sampling_ratio/max": 2.5247421503067016, "sampling/importance_sampling_ratio/mean": 0.9764230847358704, "sampling/importance_sampling_ratio/min": 0.08448497094213962, "sampling/sampling_logp_difference/max": 1.0069595217704772, "sampling/sampling_logp_difference/mean": 0.005051067983731628, "step": 5510, "step_time": 8.818693970004096 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0046875, "completions/max_length": 1401.7, "completions/max_terminated_length": 1262.7, "completions/mean_length": 160.196875, "completions/mean_terminated_length": 151.42781524658204, "completions/min_length": 63.7, "completions/min_terminated_length": 63.7, "entropy": 0.054643613868393004, "epoch": 11.820128479657388, "frac_reward_zero_std": 0.84375, "grad_norm": 0.0, "learning_rate": 9.448100000000002e-06, "loss": -0.0045, "num_tokens": 582412859.0, "reward": 1.0494336009025573, "reward_std": 0.18813522458076476, "rewards/reward_accuracy/mean": 0.95, "rewards/reward_accuracy/std": 0.18643821999430657, "rewards/reward_format/mean": 0.09943359419703483, "rewards/reward_format/std": 0.005220264568924904, "sampling/importance_sampling_ratio/max": 2.4412820816040037, "sampling/importance_sampling_ratio/mean": 0.9870848834514618, "sampling/importance_sampling_ratio/min": 0.09356680512428284, "sampling/sampling_logp_difference/max": 0.9398293673992157, "sampling/sampling_logp_difference/mean": 0.004727907944470644, "step": 5520, "step_time": 6.71868340759247 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.009765625, "completions/max_length": 1682.9, "completions/max_terminated_length": 1501.1, "completions/mean_length": 193.509765625, "completions/mean_terminated_length": 175.24764251708984, "completions/min_length": 63.0, "completions/min_terminated_length": 63.0, "entropy": 0.056438761902973054, "epoch": 11.84154175588865, "frac_reward_zero_std": 0.8375, "grad_norm": 0.640625, "learning_rate": 9.447100000000001e-06, "loss": -0.0049, "num_tokens": 583431780.0, "reward": 1.0483984708786012, "reward_std": 0.19721727147698404, "rewards/reward_accuracy/mean": 0.94921875, "rewards/reward_accuracy/std": 0.19439878836274146, "rewards/reward_format/mean": 0.09917968958616256, "rewards/reward_format/std": 0.005512544303201139, "sampling/importance_sampling_ratio/max": 2.664142942428589, "sampling/importance_sampling_ratio/mean": 0.9873600959777832, "sampling/importance_sampling_ratio/min": 0.16994923651218413, "sampling/sampling_logp_difference/max": 0.8929296135902405, "sampling/sampling_logp_difference/mean": 0.004304657666943967, "step": 5530, "step_time": 8.205905658414121 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0109375, "completions/max_length": 1783.4, "completions/max_terminated_length": 1536.2, "completions/mean_length": 200.3, "completions/mean_terminated_length": 180.31382598876954, "completions/min_length": 63.6, "completions/min_terminated_length": 63.6, "entropy": 0.06443554039578885, "epoch": 11.862955032119915, "frac_reward_zero_std": 0.84375, "grad_norm": 0.0, "learning_rate": 9.446100000000001e-06, "loss": -0.0138, "num_tokens": 584460372.0, "reward": 1.0354296922683717, "reward_std": 0.21718773245811462, "rewards/reward_accuracy/mean": 0.936328125, "rewards/reward_accuracy/std": 0.21423292085528373, "rewards/reward_format/mean": 0.09910156354308128, "rewards/reward_format/std": 0.007341027329675853, "sampling/importance_sampling_ratio/max": 2.5866408705711366, "sampling/importance_sampling_ratio/mean": 0.9852359652519226, "sampling/importance_sampling_ratio/min": 0.032890576869249344, "sampling/sampling_logp_difference/max": 0.8974310040473938, "sampling/sampling_logp_difference/mean": 0.004658846370875836, "step": 5540, "step_time": 8.8195088175009 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 1.33514404296875e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 1.33514404296875e-06, "completions/clipped_ratio": 0.01875, "completions/max_length": 1879.8, "completions/max_terminated_length": 1665.0, "completions/mean_length": 216.955859375, "completions/mean_terminated_length": 182.02007598876952, "completions/min_length": 67.0, "completions/min_terminated_length": 67.0, "entropy": 0.06396469618193805, "epoch": 11.884368308351178, "frac_reward_zero_std": 0.825, "grad_norm": 0.388671875, "learning_rate": 9.4451e-06, "loss": -0.0116, "num_tokens": 585536275.0, "reward": 1.0248437821865082, "reward_std": 0.26135039180517194, "rewards/reward_accuracy/mean": 0.9265625, "rewards/reward_accuracy/std": 0.2554875031113625, "rewards/reward_format/mean": 0.09828125089406967, "rewards/reward_format/std": 0.009174523083493114, "sampling/importance_sampling_ratio/max": 2.572258174419403, "sampling/importance_sampling_ratio/mean": 0.9775561273097992, "sampling/importance_sampling_ratio/min": 0.06312136929482222, "sampling/sampling_logp_difference/max": 1.1480861067771913, "sampling/sampling_logp_difference/mean": 0.004573788749985397, "step": 5550, "step_time": 9.387863489595475 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 9.193335927193402e-07, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 9.193335927193402e-07, "completions/clipped_ratio": 0.015234375, "completions/max_length": 1932.7, "completions/max_terminated_length": 1660.9, "completions/mean_length": 223.676171875, "completions/mean_terminated_length": 195.53716430664062, "completions/min_length": 69.4, "completions/min_terminated_length": 69.4, "entropy": 0.06958718081004918, "epoch": 11.90578158458244, "frac_reward_zero_std": 0.775, "grad_norm": 0.546875, "learning_rate": 9.4441e-06, "loss": -0.0084, "num_tokens": 586633686.0, "reward": 1.013574230670929, "reward_std": 0.276006868481636, "rewards/reward_accuracy/mean": 0.91484375, "rewards/reward_accuracy/std": 0.2718340829014778, "rewards/reward_format/mean": 0.09873046949505807, "rewards/reward_format/std": 0.009248075680807233, "sampling/importance_sampling_ratio/max": 2.600999140739441, "sampling/importance_sampling_ratio/mean": 0.9809641599655151, "sampling/importance_sampling_ratio/min": 0.037411945313215254, "sampling/sampling_logp_difference/max": 1.140676534175873, "sampling/sampling_logp_difference/mean": 0.004869699850678444, "step": 5560, "step_time": 9.552658818211057 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.008203125, "completions/max_length": 1556.3, "completions/max_terminated_length": 1419.6, "completions/mean_length": 190.95078125, "completions/mean_terminated_length": 176.1225784301758, "completions/min_length": 64.7, "completions/min_terminated_length": 64.7, "entropy": 0.060074614570476116, "epoch": 11.927194860813705, "frac_reward_zero_std": 0.85, "grad_norm": 0.314453125, "learning_rate": 9.443100000000001e-06, "loss": -0.0065, "num_tokens": 587644648.0, "reward": 1.0466992497444152, "reward_std": 0.19442919120192528, "rewards/reward_accuracy/mean": 0.947265625, "rewards/reward_accuracy/std": 0.19249635711312293, "rewards/reward_format/mean": 0.09943359568715096, "rewards/reward_format/std": 0.0046183614060282705, "sampling/importance_sampling_ratio/max": 2.4774898171424864, "sampling/importance_sampling_ratio/mean": 0.9757066607475281, "sampling/importance_sampling_ratio/min": 0.09586697854101658, "sampling/sampling_logp_difference/max": 1.0411533057689666, "sampling/sampling_logp_difference/mean": 0.004515099595300854, "step": 5570, "step_time": 7.624538310506614 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 2.369597541473922e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 2.369597541473922e-06, "completions/clipped_ratio": 0.0140625, "completions/max_length": 1812.9, "completions/max_terminated_length": 1715.0, "completions/mean_length": 197.086328125, "completions/mean_terminated_length": 170.90281982421874, "completions/min_length": 70.5, "completions/min_terminated_length": 70.5, "entropy": 0.06811431653331965, "epoch": 11.948608137044967, "frac_reward_zero_std": 0.83125, "grad_norm": 0.263671875, "learning_rate": 9.4421e-06, "loss": -0.0067, "num_tokens": 588662853.0, "reward": 1.0453711211681367, "reward_std": 0.20973512530326843, "rewards/reward_accuracy/mean": 0.946484375, "rewards/reward_accuracy/std": 0.20587852969765663, "rewards/reward_format/mean": 0.09888672083616257, "rewards/reward_format/std": 0.006947586126625538, "sampling/importance_sampling_ratio/max": 2.574594259262085, "sampling/importance_sampling_ratio/mean": 0.9769493043422699, "sampling/importance_sampling_ratio/min": 0.01482144445180893, "sampling/sampling_logp_difference/max": 1.0263651490211487, "sampling/sampling_logp_difference/mean": 0.004857980320230127, "step": 5580, "step_time": 9.02198686519696 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00234375, "completions/max_length": 1457.8, "completions/max_terminated_length": 1209.0, "completions/mean_length": 158.019921875, "completions/mean_terminated_length": 153.5994674682617, "completions/min_length": 65.6, "completions/min_terminated_length": 65.6, "entropy": 0.0521119543351233, "epoch": 11.970021413276232, "frac_reward_zero_std": 0.875, "grad_norm": 0.0, "learning_rate": 9.4411e-06, "loss": -0.0058, "num_tokens": 589583976.0, "reward": 1.0580273628234864, "reward_std": 0.17496758475899696, "rewards/reward_accuracy/mean": 0.958203125, "rewards/reward_accuracy/std": 0.17440778464078904, "rewards/reward_format/mean": 0.0998242199420929, "rewards/reward_format/std": 0.0021842264104634523, "sampling/importance_sampling_ratio/max": 2.451307773590088, "sampling/importance_sampling_ratio/mean": 0.9871212244033813, "sampling/importance_sampling_ratio/min": 0.0695611771196127, "sampling/sampling_logp_difference/max": 0.8206144630908966, "sampling/sampling_logp_difference/mean": 0.004489977820776403, "step": 5590, "step_time": 6.867607473497628 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.006640625, "completions/max_length": 1624.2, "completions/max_terminated_length": 1405.2, "completions/mean_length": 180.646875, "completions/mean_terminated_length": 168.21638031005858, "completions/min_length": 68.8, "completions/min_terminated_length": 68.8, "entropy": 0.057681117486208675, "epoch": 11.991434689507495, "frac_reward_zero_std": 0.825, "grad_norm": 0.494140625, "learning_rate": 9.440100000000001e-06, "loss": -0.0049, "num_tokens": 590568000.0, "reward": 1.0497851967811584, "reward_std": 0.20037014335393905, "rewards/reward_accuracy/mean": 0.950390625, "rewards/reward_accuracy/std": 0.197579575330019, "rewards/reward_format/mean": 0.09939453303813935, "rewards/reward_format/std": 0.00568446209654212, "sampling/importance_sampling_ratio/max": 2.6621317863464355, "sampling/importance_sampling_ratio/mean": 0.9825070977210999, "sampling/importance_sampling_ratio/min": 0.057515504956245425, "sampling/sampling_logp_difference/max": 0.7536380648612976, "sampling/sampling_logp_difference/mean": 0.004566601430997253, "step": 5600, "step_time": 7.999715754616773 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.012109375, "completions/max_length": 1845.6, "completions/max_terminated_length": 1674.0, "completions/mean_length": 205.550390625, "completions/mean_terminated_length": 183.20128631591797, "completions/min_length": 69.4, "completions/min_terminated_length": 69.4, "entropy": 0.07237428333610296, "epoch": 12.012847965738757, "frac_reward_zero_std": 0.84375, "grad_norm": 0.55859375, "learning_rate": 9.4391e-06, "loss": -0.0061, "num_tokens": 591621137.0, "reward": 1.0325781464576722, "reward_std": 0.2117878518998623, "rewards/reward_accuracy/mean": 0.93359375, "rewards/reward_accuracy/std": 0.2087746173143387, "rewards/reward_format/mean": 0.09898437410593033, "rewards/reward_format/std": 0.007553870789706707, "sampling/importance_sampling_ratio/max": 2.4956231832504274, "sampling/importance_sampling_ratio/mean": 0.987310266494751, "sampling/importance_sampling_ratio/min": 0.06509240493178367, "sampling/sampling_logp_difference/max": 1.1853888988494874, "sampling/sampling_logp_difference/mean": 0.005210683168843389, "step": 5610, "step_time": 9.124832445997162 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001953125, "completions/max_length": 1517.1, "completions/max_terminated_length": 1395.9, "completions/mean_length": 172.725, "completions/mean_terminated_length": 169.115966796875, "completions/min_length": 68.1, "completions/min_terminated_length": 68.1, "entropy": 0.054359806678257884, "epoch": 12.034261241970022, "frac_reward_zero_std": 0.84375, "grad_norm": 0.67578125, "learning_rate": 9.4381e-06, "loss": -0.0041, "num_tokens": 592581633.0, "reward": 1.0408203244209289, "reward_std": 0.18909812271595, "rewards/reward_accuracy/mean": 0.941015625, "rewards/reward_accuracy/std": 0.18825225606560708, "rewards/reward_format/mean": 0.09980468824505806, "rewards/reward_format/std": 0.002233161125332117, "sampling/importance_sampling_ratio/max": 2.551731300354004, "sampling/importance_sampling_ratio/mean": 0.9960304498672485, "sampling/importance_sampling_ratio/min": 0.17471383437514304, "sampling/sampling_logp_difference/max": 0.9732666134834289, "sampling/sampling_logp_difference/mean": 0.00433277131523937, "step": 5620, "step_time": 7.143491389410338 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01796875, "completions/max_length": 1715.1, "completions/max_terminated_length": 1500.9, "completions/mean_length": 201.341796875, "completions/mean_terminated_length": 167.5024627685547, "completions/min_length": 65.0, "completions/min_terminated_length": 65.0, "entropy": 0.06937180263921619, "epoch": 12.055674518201284, "frac_reward_zero_std": 0.88125, "grad_norm": 0.75, "learning_rate": 9.437100000000002e-06, "loss": -0.0014, "num_tokens": 593610508.0, "reward": 1.0298437893390655, "reward_std": 0.23462080210447311, "rewards/reward_accuracy/mean": 0.93125, "rewards/reward_accuracy/std": 0.23057931140065194, "rewards/reward_format/mean": 0.09859375208616257, "rewards/reward_format/std": 0.008073431183584034, "sampling/importance_sampling_ratio/max": 2.7600570917129517, "sampling/importance_sampling_ratio/mean": 0.980850201845169, "sampling/importance_sampling_ratio/min": 0.054947030683979395, "sampling/sampling_logp_difference/max": 0.9557391285896302, "sampling/sampling_logp_difference/mean": 0.004939295072108507, "step": 5630, "step_time": 8.616616642003645 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.007421875, "completions/max_length": 1433.6, "completions/max_terminated_length": 1286.4, "completions/mean_length": 178.218359375, "completions/mean_terminated_length": 164.55789947509766, "completions/min_length": 64.6, "completions/min_terminated_length": 64.6, "entropy": 0.05529326309915632, "epoch": 12.077087794432549, "frac_reward_zero_std": 0.8625, "grad_norm": 0.51171875, "learning_rate": 9.436100000000001e-06, "loss": -0.0114, "num_tokens": 594582523.0, "reward": 1.0617578506469727, "reward_std": 0.163472331315279, "rewards/reward_accuracy/mean": 0.9625, "rewards/reward_accuracy/std": 0.16072739735245706, "rewards/reward_format/mean": 0.0992578148841858, "rewards/reward_format/std": 0.005607722676359117, "sampling/importance_sampling_ratio/max": 2.3886855840682983, "sampling/importance_sampling_ratio/mean": 0.9817407727241516, "sampling/importance_sampling_ratio/min": 0.07721269894391299, "sampling/sampling_logp_difference/max": 0.9809959888458252, "sampling/sampling_logp_difference/mean": 0.004320384305901826, "step": 5640, "step_time": 7.046387976489496 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003515625, "completions/max_length": 1661.4, "completions/max_terminated_length": 1251.3, "completions/mean_length": 157.877734375, "completions/mean_terminated_length": 151.24595947265624, "completions/min_length": 64.6, "completions/min_terminated_length": 64.6, "entropy": 0.05254761867690831, "epoch": 12.098501070663811, "frac_reward_zero_std": 0.88125, "grad_norm": 0.2021484375, "learning_rate": 9.4351e-06, "loss": -0.0119, "num_tokens": 595499234.0, "reward": 1.0688281416893006, "reward_std": 0.14899665743578225, "rewards/reward_accuracy/mean": 0.969140625, "rewards/reward_accuracy/std": 0.14757920429110527, "rewards/reward_format/mean": 0.09968750104308129, "rewards/reward_format/std": 0.003397646243683994, "sampling/importance_sampling_ratio/max": 2.475061559677124, "sampling/importance_sampling_ratio/mean": 0.9879122734069824, "sampling/importance_sampling_ratio/min": 0.10055223107337952, "sampling/sampling_logp_difference/max": 1.0355564475059509, "sampling/sampling_logp_difference/mean": 0.004193893820047379, "step": 5650, "step_time": 7.935750897691468 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.012890625, "completions/max_length": 1662.9, "completions/max_terminated_length": 1588.7, "completions/mean_length": 208.476953125, "completions/mean_terminated_length": 184.90139465332032, "completions/min_length": 64.7, "completions/min_terminated_length": 64.7, "entropy": 0.07150015807710589, "epoch": 12.119914346895074, "frac_reward_zero_std": 0.8375, "grad_norm": 0.310546875, "learning_rate": 9.4341e-06, "loss": -0.0084, "num_tokens": 596555143.0, "reward": 1.0190625131130218, "reward_std": 0.22929256930947303, "rewards/reward_accuracy/mean": 0.9203125, "rewards/reward_accuracy/std": 0.22539855688810348, "rewards/reward_format/mean": 0.09875000044703483, "rewards/reward_format/std": 0.008670703554525972, "sampling/importance_sampling_ratio/max": 2.4657121300697327, "sampling/importance_sampling_ratio/mean": 0.9778323292732238, "sampling/importance_sampling_ratio/min": 0.022364795207977295, "sampling/sampling_logp_difference/max": 0.9056103467941284, "sampling/sampling_logp_difference/mean": 0.00485207459423691, "step": 5660, "step_time": 8.3900178310927 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.009765625, "completions/max_length": 1761.7, "completions/max_terminated_length": 1516.5, "completions/mean_length": 184.953125, "completions/mean_terminated_length": 166.76575927734376, "completions/min_length": 68.6, "completions/min_terminated_length": 68.6, "entropy": 0.06047582719475031, "epoch": 12.141327623126339, "frac_reward_zero_std": 0.85, "grad_norm": 0.37109375, "learning_rate": 9.433100000000001e-06, "loss": -0.0125, "num_tokens": 597545599.0, "reward": 1.0530664324760437, "reward_std": 0.199005676060915, "rewards/reward_accuracy/mean": 0.95390625, "rewards/reward_accuracy/std": 0.19515995532274247, "rewards/reward_format/mean": 0.09916015788912773, "rewards/reward_format/std": 0.006643663439899683, "sampling/importance_sampling_ratio/max": 2.6189441204071047, "sampling/importance_sampling_ratio/mean": 0.994664216041565, "sampling/importance_sampling_ratio/min": 0.1188847066834569, "sampling/sampling_logp_difference/max": 1.1123096585273742, "sampling/sampling_logp_difference/mean": 0.004598545515909791, "step": 5670, "step_time": 8.434017101294012 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 1243.9, "completions/max_terminated_length": 1148.0, "completions/mean_length": 165.703515625, "completions/mean_terminated_length": 158.4668991088867, "completions/min_length": 58.2, "completions/min_terminated_length": 58.2, "entropy": 0.04618902746587992, "epoch": 12.162740899357601, "frac_reward_zero_std": 0.90625, "grad_norm": 0.1474609375, "learning_rate": 9.4321e-06, "loss": -0.0071, "num_tokens": 598484952.0, "reward": 1.033261740207672, "reward_std": 0.20581008046865462, "rewards/reward_accuracy/mean": 0.93359375, "rewards/reward_accuracy/std": 0.2047041416168213, "rewards/reward_format/mean": 0.09966797009110451, "rewards/reward_format/std": 0.003261603508144617, "sampling/importance_sampling_ratio/max": 2.5863545894622804, "sampling/importance_sampling_ratio/mean": 1.0039424061775208, "sampling/importance_sampling_ratio/min": 0.12322017066180706, "sampling/sampling_logp_difference/max": 0.8898200154304504, "sampling/sampling_logp_difference/mean": 0.003794911759905517, "step": 5680, "step_time": 6.337311634622165 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0140625, "completions/max_length": 1946.3, "completions/max_terminated_length": 1791.7, "completions/mean_length": 210.61015625, "completions/mean_terminated_length": 184.59593658447267, "completions/min_length": 66.1, "completions/min_terminated_length": 66.1, "entropy": 0.06912515249568969, "epoch": 12.184154175588866, "frac_reward_zero_std": 0.81875, "grad_norm": 0.166015625, "learning_rate": 9.4311e-06, "loss": -0.0099, "num_tokens": 599540978.0, "reward": 1.0251953601837158, "reward_std": 0.2517545759677887, "rewards/reward_accuracy/mean": 0.9265625, "rewards/reward_accuracy/std": 0.24716842770576478, "rewards/reward_format/mean": 0.09863281473517418, "rewards/reward_format/std": 0.009184903232380748, "sampling/importance_sampling_ratio/max": 2.5603103637695312, "sampling/importance_sampling_ratio/mean": 0.9819427251815795, "sampling/importance_sampling_ratio/min": 0.05940756399650127, "sampling/sampling_logp_difference/max": 0.9781868696212769, "sampling/sampling_logp_difference/mean": 0.0047187290620058775, "step": 5690, "step_time": 9.660626240095008 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0171875, "completions/max_length": 1841.3, "completions/max_terminated_length": 1670.1, "completions/mean_length": 218.353125, "completions/mean_terminated_length": 186.69541931152344, "completions/min_length": 65.7, "completions/min_terminated_length": 65.7, "entropy": 0.07686212863773108, "epoch": 12.205567451820128, "frac_reward_zero_std": 0.80625, "grad_norm": 0.51171875, "learning_rate": 9.430100000000001e-06, "loss": -0.014, "num_tokens": 600620746.0, "reward": 1.0204883098602295, "reward_std": 0.25524313300848006, "rewards/reward_accuracy/mean": 0.921875, "rewards/reward_accuracy/std": 0.25135541930794714, "rewards/reward_format/mean": 0.09861328229308128, "rewards/reward_format/std": 0.009614724526181817, "sampling/importance_sampling_ratio/max": 2.545870041847229, "sampling/importance_sampling_ratio/mean": 0.980703866481781, "sampling/importance_sampling_ratio/min": 0.014662414230224385, "sampling/sampling_logp_difference/max": 1.8682458043098449, "sampling/sampling_logp_difference/mean": 0.005277374130673707, "step": 5700, "step_time": 9.32679294469708 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.009765625, "completions/max_length": 1789.2, "completions/max_terminated_length": 1443.9, "completions/mean_length": 192.10546875, "completions/mean_terminated_length": 173.91767120361328, "completions/min_length": 70.5, "completions/min_terminated_length": 70.5, "entropy": 0.0640344767831266, "epoch": 12.226980728051393, "frac_reward_zero_std": 0.83125, "grad_norm": 0.423828125, "learning_rate": 9.429100000000001e-06, "loss": -0.0082, "num_tokens": 601636808.0, "reward": 1.0245508074760437, "reward_std": 0.2614011406898499, "rewards/reward_accuracy/mean": 0.925390625, "rewards/reward_accuracy/std": 0.2584611564874649, "rewards/reward_format/mean": 0.09916015863418579, "rewards/reward_format/std": 0.00722371581941843, "sampling/importance_sampling_ratio/max": 2.4015860080718996, "sampling/importance_sampling_ratio/mean": 0.9803305923938751, "sampling/importance_sampling_ratio/min": 0.06268724463880063, "sampling/sampling_logp_difference/max": 0.877691251039505, "sampling/sampling_logp_difference/mean": 0.004685067990794778, "step": 5710, "step_time": 8.845224593699095 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 4.604773289429432e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 4.604773289429432e-06, "completions/clipped_ratio": 0.015625, "completions/max_length": 1386.0, "completions/max_terminated_length": 1262.3, "completions/mean_length": 176.00078125, "completions/mean_terminated_length": 146.68090362548827, "completions/min_length": 62.6, "completions/min_terminated_length": 62.6, "entropy": 0.05506518688052893, "epoch": 12.248394004282655, "frac_reward_zero_std": 0.85625, "grad_norm": 0.2060546875, "learning_rate": 9.4281e-06, "loss": -0.0033, "num_tokens": 602605802.0, "reward": 1.0418359816074372, "reward_std": 0.21052028089761735, "rewards/reward_accuracy/mean": 0.94296875, "rewards/reward_accuracy/std": 0.20697149634361267, "rewards/reward_format/mean": 0.09886718988418579, "rewards/reward_format/std": 0.006083906348794699, "sampling/importance_sampling_ratio/max": 2.3649575233459474, "sampling/importance_sampling_ratio/mean": 0.987731397151947, "sampling/importance_sampling_ratio/min": 0.1660172201693058, "sampling/sampling_logp_difference/max": 0.9420099139213562, "sampling/sampling_logp_difference/mean": 0.004358037794008851, "step": 5720, "step_time": 7.1173465007916095 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00546875, "completions/max_length": 1358.6, "completions/max_terminated_length": 1224.1, "completions/mean_length": 164.63125, "completions/mean_terminated_length": 154.5560287475586, "completions/min_length": 69.0, "completions/min_terminated_length": 69.0, "entropy": 0.05160525953397155, "epoch": 12.269807280513918, "frac_reward_zero_std": 0.89375, "grad_norm": 0.1572265625, "learning_rate": 9.427100000000002e-06, "loss": -0.0007, "num_tokens": 603550218.0, "reward": 1.0530664443969726, "reward_std": 0.18220202773809432, "rewards/reward_accuracy/mean": 0.953515625, "rewards/reward_accuracy/std": 0.1807079903781414, "rewards/reward_format/mean": 0.09955078288912773, "rewards/reward_format/std": 0.0035304907942190766, "sampling/importance_sampling_ratio/max": 2.443203628063202, "sampling/importance_sampling_ratio/mean": 1.0007363736629487, "sampling/importance_sampling_ratio/min": 0.11013120019051711, "sampling/sampling_logp_difference/max": 1.5034352004528047, "sampling/sampling_logp_difference/mean": 0.004271593480370939, "step": 5730, "step_time": 6.629654391622171 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.008203125, "completions/max_length": 1560.0, "completions/max_terminated_length": 1353.7, "completions/mean_length": 181.118359375, "completions/mean_terminated_length": 165.9037307739258, "completions/min_length": 67.7, "completions/min_terminated_length": 67.7, "entropy": 0.05868940055370331, "epoch": 12.291220556745182, "frac_reward_zero_std": 0.825, "grad_norm": 0.51953125, "learning_rate": 9.4261e-06, "loss": -0.009, "num_tokens": 604534617.0, "reward": 1.0559961259365083, "reward_std": 0.17403743043541908, "rewards/reward_accuracy/mean": 0.956640625, "rewards/reward_accuracy/std": 0.17139192745089532, "rewards/reward_format/mean": 0.09935546964406967, "rewards/reward_format/std": 0.00497817147988826, "sampling/importance_sampling_ratio/max": 2.4144595742225645, "sampling/importance_sampling_ratio/mean": 0.992537921667099, "sampling/importance_sampling_ratio/min": 0.12210455536842346, "sampling/sampling_logp_difference/max": 0.9615453958511353, "sampling/sampling_logp_difference/mean": 0.004649388929829001, "step": 5740, "step_time": 7.521450498193735 }, { "clip_ratio/high_max": 1.591005566297099e-05, "clip_ratio/high_mean": 1.9887569578713737e-06, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 1.9887569578713737e-06, "completions/clipped_ratio": 0.01640625, "completions/max_length": 1554.1, "completions/max_terminated_length": 1360.0, "completions/mean_length": 203.479296875, "completions/mean_terminated_length": 173.20055694580077, "completions/min_length": 62.9, "completions/min_terminated_length": 62.9, "entropy": 0.061948522948659955, "epoch": 12.312633832976445, "frac_reward_zero_std": 0.86875, "grad_norm": 0.427734375, "learning_rate": 9.4251e-06, "loss": -0.0057, "num_tokens": 605574916.0, "reward": 1.0310156345367432, "reward_std": 0.20718577653169631, "rewards/reward_accuracy/mean": 0.932421875, "rewards/reward_accuracy/std": 0.20325429886579513, "rewards/reward_format/mean": 0.09859375059604644, "rewards/reward_format/std": 0.007858843635767698, "sampling/importance_sampling_ratio/max": 2.4098456621170046, "sampling/importance_sampling_ratio/mean": 0.9752326905727386, "sampling/importance_sampling_ratio/min": 0.08386756852269173, "sampling/sampling_logp_difference/max": 0.8620923280715942, "sampling/sampling_logp_difference/mean": 0.00460295001976192, "step": 5750, "step_time": 7.959503859901451 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.008984375, "completions/max_length": 1647.0, "completions/max_terminated_length": 1487.5, "completions/mean_length": 182.0859375, "completions/mean_terminated_length": 165.43701782226563, "completions/min_length": 70.4, "completions/min_terminated_length": 70.4, "entropy": 0.05938649966847152, "epoch": 12.33404710920771, "frac_reward_zero_std": 0.8375, "grad_norm": 0.51953125, "learning_rate": 9.4241e-06, "loss": -0.0069, "num_tokens": 606563696.0, "reward": 1.0443359553813933, "reward_std": 0.19529686793684958, "rewards/reward_accuracy/mean": 0.944921875, "rewards/reward_accuracy/std": 0.19283239766955376, "rewards/reward_format/mean": 0.09941406399011612, "rewards/reward_format/std": 0.00492607057094574, "sampling/importance_sampling_ratio/max": 2.493114674091339, "sampling/importance_sampling_ratio/mean": 0.9898308992385865, "sampling/importance_sampling_ratio/min": 0.140733902156353, "sampling/sampling_logp_difference/max": 0.9629264950752259, "sampling/sampling_logp_difference/mean": 0.004522768314927816, "step": 5760, "step_time": 7.9934567380900265 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 4.042834598294576e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 4.042834598294576e-06, "completions/clipped_ratio": 0.012109375, "completions/max_length": 1782.0, "completions/max_terminated_length": 1608.9, "completions/mean_length": 211.095703125, "completions/mean_terminated_length": 188.89693603515624, "completions/min_length": 68.0, "completions/min_terminated_length": 68.0, "entropy": 0.0658338325098157, "epoch": 12.355460385438972, "frac_reward_zero_std": 0.83125, "grad_norm": 0.1103515625, "learning_rate": 9.423100000000001e-06, "loss": -0.0106, "num_tokens": 607618725.0, "reward": 1.0369726955890655, "reward_std": 0.22573984861373902, "rewards/reward_accuracy/mean": 0.93828125, "rewards/reward_accuracy/std": 0.22133282497525214, "rewards/reward_format/mean": 0.09869140908122062, "rewards/reward_format/std": 0.007726262928918004, "sampling/importance_sampling_ratio/max": 2.4390093207359316, "sampling/importance_sampling_ratio/mean": 0.9769530355930328, "sampling/importance_sampling_ratio/min": 0.08206974528729916, "sampling/sampling_logp_difference/max": 0.8987937092781066, "sampling/sampling_logp_difference/mean": 0.004638170404359698, "step": 5770, "step_time": 8.682963506184752 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.004296875, "completions/max_length": 1564.2, "completions/max_terminated_length": 1174.6, "completions/mean_length": 162.935546875, "completions/mean_terminated_length": 154.85811309814454, "completions/min_length": 65.3, "completions/min_terminated_length": 65.3, "entropy": 0.055407361779361966, "epoch": 12.376873661670235, "frac_reward_zero_std": 0.9, "grad_norm": 0.322265625, "learning_rate": 9.4221e-06, "loss": -0.0088, "num_tokens": 608549168.0, "reward": 1.0417187809944153, "reward_std": 0.21444325447082518, "rewards/reward_accuracy/mean": 0.9421875, "rewards/reward_accuracy/std": 0.21217553243041037, "rewards/reward_format/mean": 0.09953125193715096, "rewards/reward_format/std": 0.004637691820971668, "sampling/importance_sampling_ratio/max": 2.3178704738616944, "sampling/importance_sampling_ratio/mean": 0.98563631772995, "sampling/importance_sampling_ratio/min": 0.14530458617955447, "sampling/sampling_logp_difference/max": 0.9821771740913391, "sampling/sampling_logp_difference/mean": 0.004420421342365444, "step": 5780, "step_time": 7.483580653497484 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 8.936643780543818e-07, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 8.936643780543818e-07, "completions/clipped_ratio": 0.008203125, "completions/max_length": 1278.2, "completions/max_terminated_length": 1190.1, "completions/mean_length": 175.678515625, "completions/mean_terminated_length": 160.5712448120117, "completions/min_length": 65.5, "completions/min_terminated_length": 65.5, "entropy": 0.05746119660325348, "epoch": 12.3982869379015, "frac_reward_zero_std": 0.875, "grad_norm": 0.337890625, "learning_rate": 9.4211e-06, "loss": 0.0006, "num_tokens": 609516265.0, "reward": 1.0462500333786011, "reward_std": 0.2015225447714329, "rewards/reward_accuracy/mean": 0.946875, "rewards/reward_accuracy/std": 0.19972300603985788, "rewards/reward_format/mean": 0.09937500208616257, "rewards/reward_format/std": 0.003770436905324459, "sampling/importance_sampling_ratio/max": 2.63529314994812, "sampling/importance_sampling_ratio/mean": 0.9824238955974579, "sampling/importance_sampling_ratio/min": 0.21048328429460525, "sampling/sampling_logp_difference/max": 0.8710582971572876, "sampling/sampling_logp_difference/mean": 0.004574610409326852, "step": 5790, "step_time": 6.467768852089648 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003125, "completions/max_length": 1716.9, "completions/max_terminated_length": 1501.2, "completions/mean_length": 169.4234375, "completions/mean_terminated_length": 163.52413787841797, "completions/min_length": 61.3, "completions/min_terminated_length": 61.3, "entropy": 0.05811231834813953, "epoch": 12.419700214132762, "frac_reward_zero_std": 0.81875, "grad_norm": 0.62890625, "learning_rate": 9.420100000000002e-06, "loss": -0.0064, "num_tokens": 610466629.0, "reward": 1.050195336341858, "reward_std": 0.20072563365101814, "rewards/reward_accuracy/mean": 0.950390625, "rewards/reward_accuracy/std": 0.19967967867851258, "rewards/reward_format/mean": 0.09980468824505806, "rewards/reward_format/std": 0.0027571488637477158, "sampling/importance_sampling_ratio/max": 2.4309249401092528, "sampling/importance_sampling_ratio/mean": 0.9926356434822082, "sampling/importance_sampling_ratio/min": 0.09058816134929656, "sampling/sampling_logp_difference/max": 1.0085999965667725, "sampling/sampling_logp_difference/mean": 0.004817616357468068, "step": 5800, "step_time": 8.087330745783401 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0078125, "completions/max_length": 1766.6, "completions/max_terminated_length": 1503.7, "completions/mean_length": 178.65234375, "completions/mean_terminated_length": 163.9544250488281, "completions/min_length": 64.2, "completions/min_terminated_length": 64.2, "entropy": 0.057167707360349596, "epoch": 12.441113490364026, "frac_reward_zero_std": 0.85625, "grad_norm": 0.796875, "learning_rate": 9.419100000000001e-06, "loss": -0.009, "num_tokens": 611442571.0, "reward": 1.041875022649765, "reward_std": 0.207525072991848, "rewards/reward_accuracy/mean": 0.942578125, "rewards/reward_accuracy/std": 0.205111500620842, "rewards/reward_format/mean": 0.09929687604308128, "rewards/reward_format/std": 0.006091401493176818, "sampling/importance_sampling_ratio/max": 2.5633439302444456, "sampling/importance_sampling_ratio/mean": 0.9880888760089874, "sampling/importance_sampling_ratio/min": 0.0922349214553833, "sampling/sampling_logp_difference/max": 0.927307766675949, "sampling/sampling_logp_difference/mean": 0.004534795205108822, "step": 5810, "step_time": 8.664851936188644 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0078125, "completions/max_length": 1510.6, "completions/max_terminated_length": 1399.6, "completions/mean_length": 183.615234375, "completions/mean_terminated_length": 169.0244369506836, "completions/min_length": 64.5, "completions/min_terminated_length": 64.5, "entropy": 0.05506007431540638, "epoch": 12.462526766595289, "frac_reward_zero_std": 0.8625, "grad_norm": 0.97265625, "learning_rate": 9.4181e-06, "loss": -0.0064, "num_tokens": 612430226.0, "reward": 1.0448242485523225, "reward_std": 0.18353955447673798, "rewards/reward_accuracy/mean": 0.945703125, "rewards/reward_accuracy/std": 0.1805703669786453, "rewards/reward_format/mean": 0.09912109598517418, "rewards/reward_format/std": 0.006065029208548367, "sampling/importance_sampling_ratio/max": 2.3578765630722045, "sampling/importance_sampling_ratio/mean": 0.9799237728118897, "sampling/importance_sampling_ratio/min": 0.08135946940165013, "sampling/sampling_logp_difference/max": 1.0549340009689332, "sampling/sampling_logp_difference/mean": 0.0044380910461768504, "step": 5820, "step_time": 7.5758502312877685 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0125, "completions/max_length": 1606.3, "completions/max_terminated_length": 1168.0, "completions/mean_length": 188.396484375, "completions/mean_terminated_length": 164.89136352539063, "completions/min_length": 62.5, "completions/min_terminated_length": 62.5, "entropy": 0.056072632945142684, "epoch": 12.483940042826552, "frac_reward_zero_std": 0.825, "grad_norm": 0.0, "learning_rate": 9.417100000000002e-06, "loss": -0.0079, "num_tokens": 613429497.0, "reward": 1.034355491399765, "reward_std": 0.2217944532632828, "rewards/reward_accuracy/mean": 0.935546875, "rewards/reward_accuracy/std": 0.2180061273276806, "rewards/reward_format/mean": 0.09880859479308128, "rewards/reward_format/std": 0.00723792240023613, "sampling/importance_sampling_ratio/max": 2.5908449411392214, "sampling/importance_sampling_ratio/mean": 0.9759587228298188, "sampling/importance_sampling_ratio/min": 0.09747508466243744, "sampling/sampling_logp_difference/max": 0.895580404996872, "sampling/sampling_logp_difference/mean": 0.004660764615982771, "step": 5830, "step_time": 7.807548166194465 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0046875, "completions/max_length": 1272.9, "completions/max_terminated_length": 1224.6, "completions/mean_length": 165.5203125, "completions/mean_terminated_length": 156.80058898925782, "completions/min_length": 67.6, "completions/min_terminated_length": 67.6, "entropy": 0.05077431092504412, "epoch": 12.505353319057816, "frac_reward_zero_std": 0.8875, "grad_norm": 0.55078125, "learning_rate": 9.4161e-06, "loss": -0.0087, "num_tokens": 614366253.0, "reward": 1.0659375369548798, "reward_std": 0.16032854467630386, "rewards/reward_accuracy/mean": 0.96640625, "rewards/reward_accuracy/std": 0.15837989300489425, "rewards/reward_format/mean": 0.09953125193715096, "rewards/reward_format/std": 0.0032553856261074545, "sampling/importance_sampling_ratio/max": 2.39215202331543, "sampling/importance_sampling_ratio/mean": 0.9838303864002228, "sampling/importance_sampling_ratio/min": 0.13125016260892153, "sampling/sampling_logp_difference/max": 0.9038776278495788, "sampling/sampling_logp_difference/mean": 0.004254805576056242, "step": 5840, "step_time": 6.127946030595922 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.002734375, "completions/max_length": 1488.1, "completions/max_terminated_length": 1447.4, "completions/mean_length": 184.23671875, "completions/mean_terminated_length": 179.19318389892578, "completions/min_length": 60.3, "completions/min_terminated_length": 60.3, "entropy": 0.05549403633922338, "epoch": 12.526766595289079, "frac_reward_zero_std": 0.8875, "grad_norm": 0.50390625, "learning_rate": 9.4151e-06, "loss": -0.003, "num_tokens": 615359275.0, "reward": 1.0583593904972077, "reward_std": 0.1760672241449356, "rewards/reward_accuracy/mean": 0.95859375, "rewards/reward_accuracy/std": 0.17522433772683144, "rewards/reward_format/mean": 0.09976562559604644, "rewards/reward_format/std": 0.002697975002229214, "sampling/importance_sampling_ratio/max": 2.6156704425811768, "sampling/importance_sampling_ratio/mean": 0.9858634114265442, "sampling/importance_sampling_ratio/min": 0.10775102451443672, "sampling/sampling_logp_difference/max": 0.8621436953544617, "sampling/sampling_logp_difference/mean": 0.004336340352892876, "step": 5850, "step_time": 7.369927681708941 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 5.5699265885778e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 5.5699265885778e-06, "completions/clipped_ratio": 0.009375, "completions/max_length": 1596.6, "completions/max_terminated_length": 1198.1, "completions/mean_length": 165.174609375, "completions/mean_terminated_length": 147.21485061645507, "completions/min_length": 66.4, "completions/min_terminated_length": 66.4, "entropy": 0.05274285734631121, "epoch": 12.548179871520343, "frac_reward_zero_std": 0.8375, "grad_norm": 0.85546875, "learning_rate": 9.4141e-06, "loss": -0.0073, "num_tokens": 616289386.0, "reward": 1.0534765720367432, "reward_std": 0.1999692715704441, "rewards/reward_accuracy/mean": 0.954296875, "rewards/reward_accuracy/std": 0.19653414636850358, "rewards/reward_format/mean": 0.09917968884110451, "rewards/reward_format/std": 0.0052910294150933625, "sampling/importance_sampling_ratio/max": 2.371214270591736, "sampling/importance_sampling_ratio/mean": 0.9801515400409698, "sampling/importance_sampling_ratio/min": 0.10088480152189731, "sampling/sampling_logp_difference/max": 0.9351091921329499, "sampling/sampling_logp_difference/mean": 0.0043000547448173165, "step": 5860, "step_time": 7.714587473499705 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.016015625, "completions/max_length": 1722.7, "completions/max_terminated_length": 1265.7, "completions/mean_length": 205.810546875, "completions/mean_terminated_length": 176.2184036254883, "completions/min_length": 70.8, "completions/min_terminated_length": 70.8, "entropy": 0.056846949039027095, "epoch": 12.569593147751606, "frac_reward_zero_std": 0.85625, "grad_norm": 0.11669921875, "learning_rate": 9.413100000000001e-06, "loss": -0.007, "num_tokens": 617329669.0, "reward": 1.04833984375, "reward_std": 0.19782272428274156, "rewards/reward_accuracy/mean": 0.949609375, "rewards/reward_accuracy/std": 0.1930472768843174, "rewards/reward_format/mean": 0.09873046875, "rewards/reward_format/std": 0.008280689734965563, "sampling/importance_sampling_ratio/max": 2.6153465270996095, "sampling/importance_sampling_ratio/mean": 0.9741026043891907, "sampling/importance_sampling_ratio/min": 0.06851990893483162, "sampling/sampling_logp_difference/max": 0.9510323345661164, "sampling/sampling_logp_difference/mean": 0.00432861850131303, "step": 5870, "step_time": 8.462949119714903 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003125, "completions/max_length": 1314.5, "completions/max_terminated_length": 1164.5, "completions/mean_length": 170.938671875, "completions/mean_terminated_length": 165.17025299072264, "completions/min_length": 64.0, "completions/min_terminated_length": 64.0, "entropy": 0.054320077691227195, "epoch": 12.591006423982869, "frac_reward_zero_std": 0.86875, "grad_norm": 0.142578125, "learning_rate": 9.412100000000001e-06, "loss": -0.0041, "num_tokens": 618285128.0, "reward": 1.0692773580551147, "reward_std": 0.1518319860100746, "rewards/reward_accuracy/mean": 0.96953125, "rewards/reward_accuracy/std": 0.1503058135509491, "rewards/reward_format/mean": 0.09974609464406967, "rewards/reward_format/std": 0.0028824493288993835, "sampling/importance_sampling_ratio/max": 2.502248668670654, "sampling/importance_sampling_ratio/mean": 0.9824384987354279, "sampling/importance_sampling_ratio/min": 0.10430672466754913, "sampling/sampling_logp_difference/max": 1.201592755317688, "sampling/sampling_logp_difference/mean": 0.004546273127198219, "step": 5880, "step_time": 6.37821057420224 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00859375, "completions/max_length": 1383.4, "completions/max_terminated_length": 977.7, "completions/mean_length": 177.239453125, "completions/mean_terminated_length": 161.19956665039064, "completions/min_length": 65.5, "completions/min_terminated_length": 65.5, "entropy": 0.05153019952122122, "epoch": 12.612419700214133, "frac_reward_zero_std": 0.875, "grad_norm": 0.0, "learning_rate": 9.4111e-06, "loss": -0.0085, "num_tokens": 619259613.0, "reward": 1.0595117211341858, "reward_std": 0.1627249948680401, "rewards/reward_accuracy/mean": 0.96015625, "rewards/reward_accuracy/std": 0.16023046299815177, "rewards/reward_format/mean": 0.09935547038912773, "rewards/reward_format/std": 0.005462542409077287, "sampling/importance_sampling_ratio/max": 2.2735352993011473, "sampling/importance_sampling_ratio/mean": 0.9822841942310333, "sampling/importance_sampling_ratio/min": 0.12615805566310884, "sampling/sampling_logp_difference/max": 1.0899032950401306, "sampling/sampling_logp_difference/mean": 0.004184899223037064, "step": 5890, "step_time": 6.871973862597952 }, { "clip_ratio/high_max": 2.656183496583253e-05, "clip_ratio/high_mean": 3.3202293707290663e-06, "clip_ratio/low_mean": 1.855288883234607e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 5.1755182539636735e-06, "completions/clipped_ratio": 0.00859375, "completions/max_length": 1574.3, "completions/max_terminated_length": 1465.6, "completions/mean_length": 188.973046875, "completions/mean_terminated_length": 173.07948303222656, "completions/min_length": 67.8, "completions/min_terminated_length": 67.8, "entropy": 0.05212015118449927, "epoch": 12.633832976445396, "frac_reward_zero_std": 0.85, "grad_norm": 0.359375, "learning_rate": 9.410100000000002e-06, "loss": -0.0093, "num_tokens": 620267192.0, "reward": 1.0505468845367432, "reward_std": 0.19410961121320724, "rewards/reward_accuracy/mean": 0.951171875, "rewards/reward_accuracy/std": 0.19176578447222709, "rewards/reward_format/mean": 0.09937499985098838, "rewards/reward_format/std": 0.0059676160337403415, "sampling/importance_sampling_ratio/max": 2.4621610283851623, "sampling/importance_sampling_ratio/mean": 0.9848306477069855, "sampling/importance_sampling_ratio/min": 0.11080920631065964, "sampling/sampling_logp_difference/max": 0.9166821002960205, "sampling/sampling_logp_difference/mean": 0.003960398258641362, "step": 5900, "step_time": 7.76403964991332 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.007421875, "completions/max_length": 1642.4, "completions/max_terminated_length": 1449.4, "completions/mean_length": 173.755859375, "completions/mean_terminated_length": 159.85626983642578, "completions/min_length": 67.1, "completions/min_terminated_length": 67.1, "entropy": 0.05798751870170236, "epoch": 12.65524625267666, "frac_reward_zero_std": 0.85625, "grad_norm": 0.0, "learning_rate": 9.409100000000001e-06, "loss": -0.0052, "num_tokens": 621231847.0, "reward": 1.0348828375339507, "reward_std": 0.21437770128250122, "rewards/reward_accuracy/mean": 0.935546875, "rewards/reward_accuracy/std": 0.21238058656454087, "rewards/reward_format/mean": 0.09933593943715095, "rewards/reward_format/std": 0.004747638013213873, "sampling/importance_sampling_ratio/max": 2.5113915681838987, "sampling/importance_sampling_ratio/mean": 0.9812805831432343, "sampling/importance_sampling_ratio/min": 0.06494654072448611, "sampling/sampling_logp_difference/max": 0.881912100315094, "sampling/sampling_logp_difference/mean": 0.004564055544324219, "step": 5910, "step_time": 7.925966143596452 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.004296875, "completions/max_length": 1342.1, "completions/max_terminated_length": 1135.9, "completions/mean_length": 164.21796875, "completions/mean_terminated_length": 156.19948654174806, "completions/min_length": 65.9, "completions/min_terminated_length": 65.9, "entropy": 0.05135643749963492, "epoch": 12.676659528907923, "frac_reward_zero_std": 0.8875, "grad_norm": 0.400390625, "learning_rate": 9.4081e-06, "loss": -0.0014, "num_tokens": 622173045.0, "reward": 1.0725976586341859, "reward_std": 0.148566185683012, "rewards/reward_accuracy/mean": 0.973046875, "rewards/reward_accuracy/std": 0.14675628766417503, "rewards/reward_format/mean": 0.09955078065395355, "rewards/reward_format/std": 0.004142312495969236, "sampling/importance_sampling_ratio/max": 2.5702274084091186, "sampling/importance_sampling_ratio/mean": 0.9916348040103913, "sampling/importance_sampling_ratio/min": 0.14274731324985623, "sampling/sampling_logp_difference/max": 0.7974817276000976, "sampling/sampling_logp_difference/mean": 0.004343670862726867, "step": 5920, "step_time": 6.718525363205117 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00546875, "completions/max_length": 1530.3, "completions/max_terminated_length": 1427.9, "completions/mean_length": 173.57578125, "completions/mean_terminated_length": 163.48045654296874, "completions/min_length": 62.7, "completions/min_terminated_length": 62.7, "entropy": 0.05514837384689599, "epoch": 12.698072805139187, "frac_reward_zero_std": 0.86875, "grad_norm": 0.1708984375, "learning_rate": 9.407100000000002e-06, "loss": -0.0056, "num_tokens": 623134071.0, "reward": 1.0568359673023224, "reward_std": 0.1578554704785347, "rewards/reward_accuracy/mean": 0.957421875, "rewards/reward_accuracy/std": 0.1560499280691147, "rewards/reward_format/mean": 0.09941406399011612, "rewards/reward_format/std": 0.004469142202287913, "sampling/importance_sampling_ratio/max": 2.572905707359314, "sampling/importance_sampling_ratio/mean": 0.9851295471191406, "sampling/importance_sampling_ratio/min": 0.07678755074739456, "sampling/sampling_logp_difference/max": 1.0913874626159668, "sampling/sampling_logp_difference/mean": 0.004460847843438387, "step": 5930, "step_time": 7.425587435709895 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0046875, "completions/max_length": 1451.4, "completions/max_terminated_length": 1202.1, "completions/mean_length": 169.2265625, "completions/mean_terminated_length": 160.45603942871094, "completions/min_length": 65.0, "completions/min_terminated_length": 65.0, "entropy": 0.05241917388048023, "epoch": 12.71948608137045, "frac_reward_zero_std": 0.86875, "grad_norm": 0.330078125, "learning_rate": 9.4061e-06, "loss": -0.0119, "num_tokens": 624083147.0, "reward": 1.060898447036743, "reward_std": 0.16876025423407554, "rewards/reward_accuracy/mean": 0.961328125, "rewards/reward_accuracy/std": 0.1663830943405628, "rewards/reward_format/mean": 0.09957031309604644, "rewards/reward_format/std": 0.004485960793681442, "sampling/importance_sampling_ratio/max": 2.5108105421066282, "sampling/importance_sampling_ratio/mean": 0.9842618405818939, "sampling/importance_sampling_ratio/min": 0.11450974904000759, "sampling/sampling_logp_difference/max": 0.9349122524261475, "sampling/sampling_logp_difference/mean": 0.004347665538080037, "step": 5940, "step_time": 7.0733569423988225 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.008203125, "completions/max_length": 1764.1, "completions/max_terminated_length": 1538.1, "completions/mean_length": 194.255859375, "completions/mean_terminated_length": 179.10360412597657, "completions/min_length": 68.7, "completions/min_terminated_length": 68.7, "entropy": 0.060647203726693986, "epoch": 12.740899357601712, "frac_reward_zero_std": 0.8375, "grad_norm": 0.265625, "learning_rate": 9.4051e-06, "loss": -0.0115, "num_tokens": 625102842.0, "reward": 1.0544336080551147, "reward_std": 0.19346853643655776, "rewards/reward_accuracy/mean": 0.955078125, "rewards/reward_accuracy/std": 0.19107425957918167, "rewards/reward_format/mean": 0.09935546964406967, "rewards/reward_format/std": 0.005640114448033274, "sampling/importance_sampling_ratio/max": 2.4650951862335204, "sampling/importance_sampling_ratio/mean": 0.9759150624275208, "sampling/importance_sampling_ratio/min": 0.13547723963856698, "sampling/sampling_logp_difference/max": 1.0470375776290894, "sampling/sampling_logp_difference/mean": 0.004716541897505522, "step": 5950, "step_time": 8.605131533794339 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005859375, "completions/max_length": 1718.4, "completions/max_terminated_length": 1441.0, "completions/mean_length": 172.572265625, "completions/mean_terminated_length": 161.66785583496093, "completions/min_length": 62.4, "completions/min_terminated_length": 62.4, "entropy": 0.055740235443226996, "epoch": 12.762312633832977, "frac_reward_zero_std": 0.86875, "grad_norm": 0.55859375, "learning_rate": 9.4041e-06, "loss": -0.0069, "num_tokens": 626069555.0, "reward": 1.0674609541893005, "reward_std": 0.16577619239687919, "rewards/reward_accuracy/mean": 0.96796875, "rewards/reward_accuracy/std": 0.16324804425239564, "rewards/reward_format/mean": 0.09949218854308128, "rewards/reward_format/std": 0.0044956437544897195, "sampling/importance_sampling_ratio/max": 2.335846173763275, "sampling/importance_sampling_ratio/mean": 0.980562025308609, "sampling/importance_sampling_ratio/min": 0.12886929009109735, "sampling/sampling_logp_difference/max": 0.9938358843326569, "sampling/sampling_logp_difference/mean": 0.004362940997816622, "step": 5960, "step_time": 8.522638974295115 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003125, "completions/max_length": 1625.7, "completions/max_terminated_length": 1450.9, "completions/mean_length": 170.116015625, "completions/mean_terminated_length": 164.26802520751954, "completions/min_length": 63.1, "completions/min_terminated_length": 63.1, "entropy": 0.05669937040656805, "epoch": 12.78372591006424, "frac_reward_zero_std": 0.86875, "grad_norm": 0.361328125, "learning_rate": 9.4031e-06, "loss": -0.0116, "num_tokens": 627018444.0, "reward": 1.050488293170929, "reward_std": 0.17083199054468423, "rewards/reward_accuracy/mean": 0.95078125, "rewards/reward_accuracy/std": 0.16952364519238472, "rewards/reward_format/mean": 0.09970703199505807, "rewards/reward_format/std": 0.0032527489122003315, "sampling/importance_sampling_ratio/max": 2.5882572174072265, "sampling/importance_sampling_ratio/mean": 0.9946341037750244, "sampling/importance_sampling_ratio/min": 0.1355404920876026, "sampling/sampling_logp_difference/max": 0.835493004322052, "sampling/sampling_logp_difference/mean": 0.0043933948036283255, "step": 5970, "step_time": 7.752477190786157 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.012109375, "completions/max_length": 1796.4, "completions/max_terminated_length": 1367.7, "completions/mean_length": 180.942578125, "completions/mean_terminated_length": 158.2283836364746, "completions/min_length": 63.3, "completions/min_terminated_length": 63.3, "entropy": 0.05923593894112855, "epoch": 12.805139186295504, "frac_reward_zero_std": 0.83125, "grad_norm": 0.265625, "learning_rate": 9.402100000000001e-06, "loss": -0.0098, "num_tokens": 627996617.0, "reward": 1.0529687523841857, "reward_std": 0.19359346777200698, "rewards/reward_accuracy/mean": 0.95390625, "rewards/reward_accuracy/std": 0.1898133136332035, "rewards/reward_format/mean": 0.0990625001490116, "rewards/reward_format/std": 0.007041826448403299, "sampling/importance_sampling_ratio/max": 2.3281317591667174, "sampling/importance_sampling_ratio/mean": 0.9693376839160919, "sampling/importance_sampling_ratio/min": 0.10218312768265606, "sampling/sampling_logp_difference/max": 1.0121137619018554, "sampling/sampling_logp_difference/mean": 0.004598124139010906, "step": 5980, "step_time": 8.932799732897546 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005078125, "completions/max_length": 1477.6, "completions/max_terminated_length": 1401.6, "completions/mean_length": 182.944921875, "completions/mean_terminated_length": 173.58944396972657, "completions/min_length": 69.7, "completions/min_terminated_length": 69.7, "entropy": 0.05703109372407198, "epoch": 12.826552462526767, "frac_reward_zero_std": 0.875, "grad_norm": 0.0, "learning_rate": 9.4011e-06, "loss": -0.0069, "num_tokens": 628982268.0, "reward": 1.0492578327655793, "reward_std": 0.17598951756954193, "rewards/reward_accuracy/mean": 0.949609375, "rewards/reward_accuracy/std": 0.17474506944417953, "rewards/reward_format/mean": 0.09964843913912773, "rewards/reward_format/std": 0.002967934194020927, "sampling/importance_sampling_ratio/max": 2.4445730090141295, "sampling/importance_sampling_ratio/mean": 0.987162607908249, "sampling/importance_sampling_ratio/min": 0.10924431586172431, "sampling/sampling_logp_difference/max": 0.8727828741073609, "sampling/sampling_logp_difference/mean": 0.004288099566474557, "step": 5990, "step_time": 7.29701276740816 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.008203125, "completions/max_length": 1591.0, "completions/max_terminated_length": 1289.3, "completions/mean_length": 180.655078125, "completions/mean_terminated_length": 165.2904281616211, "completions/min_length": 65.1, "completions/min_terminated_length": 65.1, "entropy": 0.05078198262490332, "epoch": 12.84796573875803, "frac_reward_zero_std": 0.89375, "grad_norm": 0.0, "learning_rate": 9.400100000000002e-06, "loss": -0.0077, "num_tokens": 629962777.0, "reward": 1.0617578387260438, "reward_std": 0.1715967334806919, "rewards/reward_accuracy/mean": 0.9625, "rewards/reward_accuracy/std": 0.1685960814356804, "rewards/reward_format/mean": 0.09925781413912774, "rewards/reward_format/std": 0.005604508705437184, "sampling/importance_sampling_ratio/max": 2.4126978397369383, "sampling/importance_sampling_ratio/mean": 0.975329440832138, "sampling/importance_sampling_ratio/min": 0.11152004301548005, "sampling/sampling_logp_difference/max": 0.8385968565940857, "sampling/sampling_logp_difference/mean": 0.004216598463244736, "step": 6000, "step_time": 7.623216894982034 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.006640625, "completions/max_length": 1442.7, "completions/max_terminated_length": 1347.6, "completions/mean_length": 192.183984375, "completions/mean_terminated_length": 180.15021209716798, "completions/min_length": 60.7, "completions/min_terminated_length": 60.7, "entropy": 0.06168053704313934, "epoch": 12.869379014989294, "frac_reward_zero_std": 0.8, "grad_norm": 0.578125, "learning_rate": 9.399100000000001e-06, "loss": -0.0074, "num_tokens": 630975712.0, "reward": 1.0192383170127868, "reward_std": 0.2422593466937542, "rewards/reward_accuracy/mean": 0.919921875, "rewards/reward_accuracy/std": 0.24065417423844337, "rewards/reward_format/mean": 0.09931640774011612, "rewards/reward_format/std": 0.004842828353866934, "sampling/importance_sampling_ratio/max": 2.425437796115875, "sampling/importance_sampling_ratio/mean": 0.9790128648281098, "sampling/importance_sampling_ratio/min": 0.058642173558473586, "sampling/sampling_logp_difference/max": 1.254132330417633, "sampling/sampling_logp_difference/mean": 0.004664051462896168, "step": 6010, "step_time": 6.898478095183964 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.009765625, "completions/max_length": 1433.9, "completions/max_terminated_length": 1160.5, "completions/mean_length": 180.538671875, "completions/mean_terminated_length": 162.47164916992188, "completions/min_length": 64.2, "completions/min_terminated_length": 64.2, "entropy": 0.055693474737927316, "epoch": 12.890792291220556, "frac_reward_zero_std": 0.86875, "grad_norm": 0.478515625, "learning_rate": 9.3981e-06, "loss": 0.0003, "num_tokens": 631952579.0, "reward": 1.0545508027076722, "reward_std": 0.16926752477884294, "rewards/reward_accuracy/mean": 0.95546875, "rewards/reward_accuracy/std": 0.16640738546848297, "rewards/reward_format/mean": 0.09908203259110451, "rewards/reward_format/std": 0.005956802237778902, "sampling/importance_sampling_ratio/max": 2.579963755607605, "sampling/importance_sampling_ratio/mean": 0.9909344911575317, "sampling/importance_sampling_ratio/min": 0.1494994841516018, "sampling/sampling_logp_difference/max": 1.0741992831230163, "sampling/sampling_logp_difference/mean": 0.004446077765896917, "step": 6020, "step_time": 7.17602092770976 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01015625, "completions/max_length": 1691.8, "completions/max_terminated_length": 1340.9, "completions/mean_length": 192.399609375, "completions/mean_terminated_length": 173.56800537109376, "completions/min_length": 63.3, "completions/min_terminated_length": 63.3, "entropy": 0.06407618816010655, "epoch": 12.91220556745182, "frac_reward_zero_std": 0.8, "grad_norm": 0.5703125, "learning_rate": 9.397100000000002e-06, "loss": -0.015, "num_tokens": 632965810.0, "reward": 1.0378320574760438, "reward_std": 0.2307739943265915, "rewards/reward_accuracy/mean": 0.938671875, "rewards/reward_accuracy/std": 0.2278188206255436, "rewards/reward_format/mean": 0.09916015863418579, "rewards/reward_format/std": 0.006536392634734512, "sampling/importance_sampling_ratio/max": 2.7554094314575197, "sampling/importance_sampling_ratio/mean": 0.9758197844028473, "sampling/importance_sampling_ratio/min": 0.0, "sampling/sampling_logp_difference/max": 1.2738166570663452, "sampling/sampling_logp_difference/mean": 0.004936163779348135, "step": 6030, "step_time": 8.108353263681057 }, { "clip_ratio/high_max": 3.130912518827245e-05, "clip_ratio/high_mean": 3.913640648534056e-06, "clip_ratio/low_mean": 7.172366167651489e-07, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 4.630877265299205e-06, "completions/clipped_ratio": 0.008984375, "completions/max_length": 1660.7, "completions/max_terminated_length": 1388.7, "completions/mean_length": 186.262109375, "completions/mean_terminated_length": 169.4689910888672, "completions/min_length": 67.3, "completions/min_terminated_length": 67.3, "entropy": 0.056713683251291516, "epoch": 12.933618843683083, "frac_reward_zero_std": 0.85, "grad_norm": 0.47265625, "learning_rate": 9.3961e-06, "loss": -0.0055, "num_tokens": 633963681.0, "reward": 1.0582422137260437, "reward_std": 0.1886320613324642, "rewards/reward_accuracy/mean": 0.958984375, "rewards/reward_accuracy/std": 0.1857464961707592, "rewards/reward_format/mean": 0.09925781413912774, "rewards/reward_format/std": 0.004721511108800769, "sampling/importance_sampling_ratio/max": 2.3958523750305174, "sampling/importance_sampling_ratio/mean": 0.9857098042964936, "sampling/importance_sampling_ratio/min": 0.06021330785006285, "sampling/sampling_logp_difference/max": 0.9977130830287934, "sampling/sampling_logp_difference/mean": 0.0043292698916047815, "step": 6040, "step_time": 8.129855518415571 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00625, "completions/max_length": 1655.2, "completions/max_terminated_length": 1382.9, "completions/mean_length": 172.95546875, "completions/mean_terminated_length": 161.28251953125, "completions/min_length": 65.1, "completions/min_terminated_length": 65.1, "entropy": 0.0551082206889987, "epoch": 12.955032119914346, "frac_reward_zero_std": 0.875, "grad_norm": 0.322265625, "learning_rate": 9.395100000000001e-06, "loss": -0.0095, "num_tokens": 634929631.0, "reward": 1.0603710889816285, "reward_std": 0.16488902568817138, "rewards/reward_accuracy/mean": 0.9609375, "rewards/reward_accuracy/std": 0.16311126500368117, "rewards/reward_format/mean": 0.09943359419703483, "rewards/reward_format/std": 0.003848617500625551, "sampling/importance_sampling_ratio/max": 2.3903836011886597, "sampling/importance_sampling_ratio/mean": 0.9886093854904174, "sampling/importance_sampling_ratio/min": 0.12995092142373324, "sampling/sampling_logp_difference/max": 0.9351162314414978, "sampling/sampling_logp_difference/mean": 0.0044555180240422486, "step": 6050, "step_time": 7.778435358617571 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 987.4, "completions/max_terminated_length": 792.5, "completions/mean_length": 154.644921875, "completions/mean_terminated_length": 147.2973419189453, "completions/min_length": 67.3, "completions/min_terminated_length": 67.3, "entropy": 0.04592779432423413, "epoch": 12.97644539614561, "frac_reward_zero_std": 0.8625, "grad_norm": 0.439453125, "learning_rate": 9.3941e-06, "loss": -0.0009, "num_tokens": 635836322.0, "reward": 1.0594140887260437, "reward_std": 0.16630799546837807, "rewards/reward_accuracy/mean": 0.959765625, "rewards/reward_accuracy/std": 0.16493587270379068, "rewards/reward_format/mean": 0.09964843913912773, "rewards/reward_format/std": 0.0030286762863397597, "sampling/importance_sampling_ratio/max": 2.3281902551651, "sampling/importance_sampling_ratio/mean": 0.9934281945228577, "sampling/importance_sampling_ratio/min": 0.2002181213349104, "sampling/sampling_logp_difference/max": 0.9107805728912354, "sampling/sampling_logp_difference/mean": 0.0041461685905233026, "step": 6060, "step_time": 4.8984811954112955 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00625, "completions/max_length": 1301.0, "completions/max_terminated_length": 1185.4, "completions/mean_length": 167.426953125, "completions/mean_terminated_length": 155.68895416259767, "completions/min_length": 65.0, "completions/min_terminated_length": 65.0, "entropy": 0.05482222340069711, "epoch": 12.997858672376873, "frac_reward_zero_std": 0.9, "grad_norm": 0.0576171875, "learning_rate": 9.3931e-06, "loss": -0.009, "num_tokens": 636778775.0, "reward": 1.0447851777076722, "reward_std": 0.17821203768253327, "rewards/reward_accuracy/mean": 0.9453125, "rewards/reward_accuracy/std": 0.1760790839791298, "rewards/reward_format/mean": 0.0994726575911045, "rewards/reward_format/std": 0.004727668082341552, "sampling/importance_sampling_ratio/max": 2.328642737865448, "sampling/importance_sampling_ratio/mean": 0.9815492451190948, "sampling/importance_sampling_ratio/min": 0.14246718175709247, "sampling/sampling_logp_difference/max": 1.072512835264206, "sampling/sampling_logp_difference/mean": 0.0044312406796962025, "step": 6070, "step_time": 6.462067803103127 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.014453125, "completions/max_length": 1731.8, "completions/max_terminated_length": 1416.8, "completions/mean_length": 196.290234375, "completions/mean_terminated_length": 169.6153579711914, "completions/min_length": 63.0, "completions/min_terminated_length": 63.0, "entropy": 0.05354819120839238, "epoch": 13.019271948608138, "frac_reward_zero_std": 0.8875, "grad_norm": 0.1748046875, "learning_rate": 9.392100000000001e-06, "loss": -0.0018, "num_tokens": 637795774.0, "reward": 1.0425390720367431, "reward_std": 0.1956378124654293, "rewards/reward_accuracy/mean": 0.94375, "rewards/reward_accuracy/std": 0.19183124899864196, "rewards/reward_format/mean": 0.09878906235098839, "rewards/reward_format/std": 0.007593415328301489, "sampling/importance_sampling_ratio/max": 2.4580241203308106, "sampling/importance_sampling_ratio/mean": 0.9800806820392609, "sampling/importance_sampling_ratio/min": 0.09643867569975555, "sampling/sampling_logp_difference/max": 1.0183793306350708, "sampling/sampling_logp_difference/mean": 0.004204807127825916, "step": 6080, "step_time": 8.618552715505938 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00703125, "completions/max_length": 1442.7, "completions/max_terminated_length": 1271.0, "completions/mean_length": 165.6953125, "completions/mean_terminated_length": 152.54904022216797, "completions/min_length": 69.5, "completions/min_terminated_length": 69.5, "entropy": 0.0527168083935976, "epoch": 13.0406852248394, "frac_reward_zero_std": 0.85625, "grad_norm": 0.875, "learning_rate": 9.3911e-06, "loss": -0.005, "num_tokens": 638737026.0, "reward": 1.0372656404972076, "reward_std": 0.20753099098801614, "rewards/reward_accuracy/mean": 0.937890625, "rewards/reward_accuracy/std": 0.2056211404502392, "rewards/reward_format/mean": 0.09937500059604645, "rewards/reward_format/std": 0.004834346729330719, "sampling/importance_sampling_ratio/max": 2.3592133045196535, "sampling/importance_sampling_ratio/mean": 0.9825824916362762, "sampling/importance_sampling_ratio/min": 0.1231397833675146, "sampling/sampling_logp_difference/max": 1.0914680242538453, "sampling/sampling_logp_difference/mean": 0.004312032088637352, "step": 6090, "step_time": 6.9403699737013085 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.007421875, "completions/max_length": 1662.7, "completions/max_terminated_length": 1213.9, "completions/mean_length": 174.43359375, "completions/mean_terminated_length": 160.4332534790039, "completions/min_length": 57.4, "completions/min_terminated_length": 57.4, "entropy": 0.0526927248807624, "epoch": 13.062098501070663, "frac_reward_zero_std": 0.90625, "grad_norm": 0.18359375, "learning_rate": 9.3901e-06, "loss": -0.0051, "num_tokens": 639702024.0, "reward": 1.0545312583446502, "reward_std": 0.18511463701725006, "rewards/reward_accuracy/mean": 0.955078125, "rewards/reward_accuracy/std": 0.18289346247911453, "rewards/reward_format/mean": 0.09945312589406967, "rewards/reward_format/std": 0.005376762943342328, "sampling/importance_sampling_ratio/max": 2.4554270267486573, "sampling/importance_sampling_ratio/mean": 0.9866922318935394, "sampling/importance_sampling_ratio/min": 0.0804338950663805, "sampling/sampling_logp_difference/max": 0.8107982575893402, "sampling/sampling_logp_difference/mean": 0.004309717123396695, "step": 6100, "step_time": 8.014343668689254 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.012890625, "completions/max_length": 1853.3, "completions/max_terminated_length": 1454.8, "completions/mean_length": 190.354296875, "completions/mean_terminated_length": 166.3135955810547, "completions/min_length": 65.6, "completions/min_terminated_length": 65.6, "entropy": 0.05961533989757299, "epoch": 13.083511777301927, "frac_reward_zero_std": 0.8625, "grad_norm": 0.640625, "learning_rate": 9.389100000000001e-06, "loss": -0.0082, "num_tokens": 640708211.0, "reward": 1.05142582654953, "reward_std": 0.19505105614662172, "rewards/reward_accuracy/mean": 0.952734375, "rewards/reward_accuracy/std": 0.18924605026841163, "rewards/reward_format/mean": 0.09869140759110451, "rewards/reward_format/std": 0.009581877663731576, "sampling/importance_sampling_ratio/max": 2.523568868637085, "sampling/importance_sampling_ratio/mean": 0.9845498621463775, "sampling/importance_sampling_ratio/min": 0.06633601393550634, "sampling/sampling_logp_difference/max": 1.0529868483543396, "sampling/sampling_logp_difference/mean": 0.004642502753995359, "step": 6110, "step_time": 9.070673936713138 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00859375, "completions/max_length": 1542.9, "completions/max_terminated_length": 1093.3, "completions/mean_length": 165.92578125, "completions/mean_terminated_length": 149.67919464111327, "completions/min_length": 66.1, "completions/min_terminated_length": 66.1, "entropy": 0.046920690592378377, "epoch": 13.10492505353319, "frac_reward_zero_std": 0.8875, "grad_norm": 0.1513671875, "learning_rate": 9.3881e-06, "loss": -0.0008, "num_tokens": 641644629.0, "reward": 1.0677539229393005, "reward_std": 0.16553752794861792, "rewards/reward_accuracy/mean": 0.968359375, "rewards/reward_accuracy/std": 0.16266190707683564, "rewards/reward_format/mean": 0.09939453229308129, "rewards/reward_format/std": 0.00519488409627229, "sampling/importance_sampling_ratio/max": 2.3763097763061523, "sampling/importance_sampling_ratio/mean": 0.9842799007892609, "sampling/importance_sampling_ratio/min": 0.11030016418080776, "sampling/sampling_logp_difference/max": 0.9675220310688019, "sampling/sampling_logp_difference/mean": 0.00403113653883338, "step": 6120, "step_time": 7.6589465860190105 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001953125, "completions/max_length": 1312.9, "completions/max_terminated_length": 909.7, "completions/mean_length": 150.758984375, "completions/mean_terminated_length": 147.04126586914063, "completions/min_length": 67.1, "completions/min_terminated_length": 67.1, "entropy": 0.04539246587082744, "epoch": 13.126338329764454, "frac_reward_zero_std": 0.875, "grad_norm": 0.470703125, "learning_rate": 9.387100000000002e-06, "loss": -0.0024, "num_tokens": 642545724.0, "reward": 1.0658398687839508, "reward_std": 0.14839113801717757, "rewards/reward_accuracy/mean": 0.966015625, "rewards/reward_accuracy/std": 0.14735026955604552, "rewards/reward_format/mean": 0.09982421919703484, "rewards/reward_format/std": 0.0023887486662715674, "sampling/importance_sampling_ratio/max": 2.304029476642609, "sampling/importance_sampling_ratio/mean": 0.9867392718791962, "sampling/importance_sampling_ratio/min": 0.18247597590088843, "sampling/sampling_logp_difference/max": 0.8496163606643676, "sampling/sampling_logp_difference/mean": 0.0040761147858574985, "step": 6130, "step_time": 6.286192221299279 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00703125, "completions/max_length": 1636.4, "completions/max_terminated_length": 1269.1, "completions/mean_length": 175.7640625, "completions/mean_terminated_length": 162.67023162841798, "completions/min_length": 64.6, "completions/min_terminated_length": 64.6, "entropy": 0.0506550899008289, "epoch": 13.147751605995717, "frac_reward_zero_std": 0.86875, "grad_norm": 0.103515625, "learning_rate": 9.386100000000001e-06, "loss": -0.0078, "num_tokens": 643514752.0, "reward": 1.0618554949760437, "reward_std": 0.16929182559251785, "rewards/reward_accuracy/mean": 0.9625, "rewards/reward_accuracy/std": 0.16594904139637948, "rewards/reward_format/mean": 0.09935547038912773, "rewards/reward_format/std": 0.005657023610547185, "sampling/importance_sampling_ratio/max": 2.481941246986389, "sampling/importance_sampling_ratio/mean": 0.9921857953071594, "sampling/importance_sampling_ratio/min": 0.1178208976984024, "sampling/sampling_logp_difference/max": 0.8457397818565369, "sampling/sampling_logp_difference/mean": 0.004324799822643399, "step": 6140, "step_time": 7.839533890614985 }, { "clip_ratio/high_max": 3.995525185018778e-06, "clip_ratio/high_mean": 4.994406481273473e-07, "clip_ratio/low_mean": 3.6076512969884787e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 4.107091899641091e-06, "completions/clipped_ratio": 0.011328125, "completions/max_length": 1506.7, "completions/max_terminated_length": 1341.3, "completions/mean_length": 181.3140625, "completions/mean_terminated_length": 160.18463439941405, "completions/min_length": 68.0, "completions/min_terminated_length": 68.0, "entropy": 0.05687512399163097, "epoch": 13.169164882226982, "frac_reward_zero_std": 0.8375, "grad_norm": 0.640625, "learning_rate": 9.385100000000001e-06, "loss": -0.006, "num_tokens": 644493780.0, "reward": 1.064062523841858, "reward_std": 0.1523667760193348, "rewards/reward_accuracy/mean": 0.965234375, "rewards/reward_accuracy/std": 0.14929295852780342, "rewards/reward_format/mean": 0.09882812723517417, "rewards/reward_format/std": 0.00639767711982131, "sampling/importance_sampling_ratio/max": 2.6169324636459352, "sampling/importance_sampling_ratio/mean": 0.9788672447204589, "sampling/importance_sampling_ratio/min": 0.10362686812877656, "sampling/sampling_logp_difference/max": 0.8679514765739441, "sampling/sampling_logp_difference/mean": 0.0044792864704504606, "step": 6150, "step_time": 7.544859561213525 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.008984375, "completions/max_length": 1660.2, "completions/max_terminated_length": 1345.9, "completions/mean_length": 177.75546875, "completions/mean_terminated_length": 161.23848876953124, "completions/min_length": 67.9, "completions/min_terminated_length": 67.9, "entropy": 0.05308321446646005, "epoch": 13.190578158458244, "frac_reward_zero_std": 0.8875, "grad_norm": 0.0, "learning_rate": 9.3841e-06, "loss": 0.0007, "num_tokens": 645467010.0, "reward": 1.057011741399765, "reward_std": 0.17173558995127677, "rewards/reward_accuracy/mean": 0.9578125, "rewards/reward_accuracy/std": 0.1687103718519211, "rewards/reward_format/mean": 0.09919922053813934, "rewards/reward_format/std": 0.0060235628392547366, "sampling/importance_sampling_ratio/max": 2.4899617195129395, "sampling/importance_sampling_ratio/mean": 0.9850107908248902, "sampling/importance_sampling_ratio/min": 0.07209797389805317, "sampling/sampling_logp_difference/max": 0.8189459979534149, "sampling/sampling_logp_difference/mean": 0.004106798209249973, "step": 6160, "step_time": 8.202825566619868 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003125, "completions/max_length": 1368.8, "completions/max_terminated_length": 1010.1, "completions/mean_length": 156.600390625, "completions/mean_terminated_length": 150.71942596435548, "completions/min_length": 62.4, "completions/min_terminated_length": 62.4, "entropy": 0.044482608302496375, "epoch": 13.211991434689507, "frac_reward_zero_std": 0.91875, "grad_norm": 0.275390625, "learning_rate": 9.3831e-06, "loss": -0.001, "num_tokens": 646388419.0, "reward": 1.058710950613022, "reward_std": 0.15875827744603158, "rewards/reward_accuracy/mean": 0.958984375, "rewards/reward_accuracy/std": 0.1573751114308834, "rewards/reward_format/mean": 0.09972656294703483, "rewards/reward_format/std": 0.003210427099838853, "sampling/importance_sampling_ratio/max": 2.4059749007225038, "sampling/importance_sampling_ratio/mean": 0.9909905910491943, "sampling/importance_sampling_ratio/min": 0.18203657045960425, "sampling/sampling_logp_difference/max": 0.8293358564376831, "sampling/sampling_logp_difference/mean": 0.004037781455554068, "step": 6170, "step_time": 6.531653304988867 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01015625, "completions/max_length": 1554.1, "completions/max_terminated_length": 1469.5, "completions/mean_length": 174.594921875, "completions/mean_terminated_length": 155.53646392822264, "completions/min_length": 64.0, "completions/min_terminated_length": 64.0, "entropy": 0.053623323794454336, "epoch": 13.233404710920771, "frac_reward_zero_std": 0.8875, "grad_norm": 0.333984375, "learning_rate": 9.382100000000001e-06, "loss": -0.0133, "num_tokens": 647352422.0, "reward": 1.0386133193969727, "reward_std": 0.2033396601676941, "rewards/reward_accuracy/mean": 0.939453125, "rewards/reward_accuracy/std": 0.20079511180520057, "rewards/reward_format/mean": 0.09916015714406967, "rewards/reward_format/std": 0.006422635354101658, "sampling/importance_sampling_ratio/max": 2.426839530467987, "sampling/importance_sampling_ratio/mean": 0.9810839474201203, "sampling/importance_sampling_ratio/min": 0.09947643727064133, "sampling/sampling_logp_difference/max": 0.9303552806377411, "sampling/sampling_logp_difference/mean": 0.004248660639859736, "step": 6180, "step_time": 7.989747166418238 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 1475.3, "completions/max_terminated_length": 1270.0, "completions/mean_length": 161.8984375, "completions/mean_terminated_length": 154.5923645019531, "completions/min_length": 69.5, "completions/min_terminated_length": 69.5, "entropy": 0.05150273919571191, "epoch": 13.254817987152034, "frac_reward_zero_std": 0.875, "grad_norm": 0.44140625, "learning_rate": 9.3811e-06, "loss": -0.0068, "num_tokens": 648288978.0, "reward": 1.0343750238418579, "reward_std": 0.2107362225651741, "rewards/reward_accuracy/mean": 0.934765625, "rewards/reward_accuracy/std": 0.20953764617443085, "rewards/reward_format/mean": 0.09960937574505806, "rewards/reward_format/std": 0.0034033402102068067, "sampling/importance_sampling_ratio/max": 2.4593056201934815, "sampling/importance_sampling_ratio/mean": 0.9862347543239594, "sampling/importance_sampling_ratio/min": 0.08708562254905701, "sampling/sampling_logp_difference/max": 1.193685418367386, "sampling/sampling_logp_difference/mean": 0.004307596804574132, "step": 6190, "step_time": 7.1619310342910465 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 1448.7, "completions/max_terminated_length": 1014.0, "completions/mean_length": 151.9984375, "completions/mean_terminated_length": 144.63111419677733, "completions/min_length": 59.7, "completions/min_terminated_length": 59.7, "entropy": 0.04700648854486644, "epoch": 13.276231263383298, "frac_reward_zero_std": 0.86875, "grad_norm": 0.078125, "learning_rate": 9.3801e-06, "loss": -0.0012, "num_tokens": 649190766.0, "reward": 1.0551757991313935, "reward_std": 0.18080826848745346, "rewards/reward_accuracy/mean": 0.95546875, "rewards/reward_accuracy/std": 0.179557666182518, "rewards/reward_format/mean": 0.09970703274011612, "rewards/reward_format/std": 0.0031539242714643478, "sampling/importance_sampling_ratio/max": 2.5170165419578554, "sampling/importance_sampling_ratio/mean": 0.9806864142417908, "sampling/importance_sampling_ratio/min": 0.102097762003541, "sampling/sampling_logp_difference/max": 0.7850510895252227, "sampling/sampling_logp_difference/mean": 0.00432643115054816, "step": 6200, "step_time": 6.793728359293891 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.004296875, "completions/max_length": 1372.0, "completions/max_terminated_length": 1211.0, "completions/mean_length": 159.058984375, "completions/mean_terminated_length": 150.88267517089844, "completions/min_length": 63.2, "completions/min_terminated_length": 63.2, "entropy": 0.04709309870377183, "epoch": 13.297644539614561, "frac_reward_zero_std": 0.8375, "grad_norm": 0.48828125, "learning_rate": 9.379100000000001e-06, "loss": -0.0033, "num_tokens": 650117477.0, "reward": 1.0499218940734862, "reward_std": 0.20451412349939346, "rewards/reward_accuracy/mean": 0.950390625, "rewards/reward_accuracy/std": 0.2024371162056923, "rewards/reward_format/mean": 0.0995312511920929, "rewards/reward_format/std": 0.0035723690409213303, "sampling/importance_sampling_ratio/max": 2.50242360830307, "sampling/importance_sampling_ratio/mean": 0.9812949776649476, "sampling/importance_sampling_ratio/min": 0.12066646181046962, "sampling/sampling_logp_difference/max": 0.8992680013179779, "sampling/sampling_logp_difference/mean": 0.004225170845165849, "step": 6210, "step_time": 6.621665466195554 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.002734375, "completions/max_length": 1544.9, "completions/max_terminated_length": 1257.4, "completions/mean_length": 166.8953125, "completions/mean_terminated_length": 161.7897705078125, "completions/min_length": 67.6, "completions/min_terminated_length": 67.6, "entropy": 0.04926920540165156, "epoch": 13.319057815845824, "frac_reward_zero_std": 0.86875, "grad_norm": 0.6953125, "learning_rate": 9.378100000000001e-06, "loss": -0.0035, "num_tokens": 651063337.0, "reward": 1.0493554770946503, "reward_std": 0.18624677285552024, "rewards/reward_accuracy/mean": 0.949609375, "rewards/reward_accuracy/std": 0.18495556116104125, "rewards/reward_format/mean": 0.09974609389901161, "rewards/reward_format/std": 0.003510723193176091, "sampling/importance_sampling_ratio/max": 2.333652746677399, "sampling/importance_sampling_ratio/mean": 0.9839352488517761, "sampling/importance_sampling_ratio/min": 0.0699782244861126, "sampling/sampling_logp_difference/max": 0.9019779682159423, "sampling/sampling_logp_difference/mean": 0.004043826484121382, "step": 6220, "step_time": 7.412295103803626 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003515625, "completions/max_length": 1346.6, "completions/max_terminated_length": 1212.8, "completions/mean_length": 162.800390625, "completions/mean_terminated_length": 156.2483642578125, "completions/min_length": 63.8, "completions/min_terminated_length": 63.8, "entropy": 0.0502274707891047, "epoch": 13.340471092077088, "frac_reward_zero_std": 0.875, "grad_norm": 0.765625, "learning_rate": 9.3771e-06, "loss": -0.002, "num_tokens": 651996666.0, "reward": 1.0489257872104645, "reward_std": 0.19876805543899537, "rewards/reward_accuracy/mean": 0.94921875, "rewards/reward_accuracy/std": 0.19787064269185067, "rewards/reward_format/mean": 0.09970703125, "rewards/reward_format/std": 0.0029989392729476093, "sampling/importance_sampling_ratio/max": 2.3997358679771423, "sampling/importance_sampling_ratio/mean": 0.9911199629306793, "sampling/importance_sampling_ratio/min": 0.12096350640058517, "sampling/sampling_logp_difference/max": 0.8652910470962525, "sampling/sampling_logp_difference/mean": 0.004207203490659594, "step": 6230, "step_time": 6.562757357614464 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01328125, "completions/max_length": 1651.5, "completions/max_terminated_length": 1495.3, "completions/mean_length": 189.8734375, "completions/mean_terminated_length": 165.0720703125, "completions/min_length": 64.4, "completions/min_terminated_length": 64.4, "entropy": 0.06312634195201099, "epoch": 13.36188436830835, "frac_reward_zero_std": 0.8375, "grad_norm": 0.1162109375, "learning_rate": 9.376100000000002e-06, "loss": -0.0032, "num_tokens": 653001782.0, "reward": 1.0376953125, "reward_std": 0.2120852667139843, "rewards/reward_accuracy/mean": 0.938671875, "rewards/reward_accuracy/std": 0.2086745947599411, "rewards/reward_format/mean": 0.0990234375, "rewards/reward_format/std": 0.006770444591529668, "sampling/importance_sampling_ratio/max": 2.6526535749435425, "sampling/importance_sampling_ratio/mean": 0.9912574887275696, "sampling/importance_sampling_ratio/min": 0.07685638321563601, "sampling/sampling_logp_difference/max": 0.9565173506736755, "sampling/sampling_logp_difference/mean": 0.004643832962028682, "step": 6240, "step_time": 8.206016044007265 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.008203125, "completions/max_length": 1775.7, "completions/max_terminated_length": 1336.8, "completions/mean_length": 174.509375, "completions/mean_terminated_length": 159.2458923339844, "completions/min_length": 63.2, "completions/min_terminated_length": 63.2, "entropy": 0.05349827143363654, "epoch": 13.383297644539615, "frac_reward_zero_std": 0.8625, "grad_norm": 0.2490234375, "learning_rate": 9.375100000000001e-06, "loss": -0.0045, "num_tokens": 653975150.0, "reward": 1.0485742330551147, "reward_std": 0.19780000671744347, "rewards/reward_accuracy/mean": 0.94921875, "rewards/reward_accuracy/std": 0.19479114264249803, "rewards/reward_format/mean": 0.09935546964406967, "rewards/reward_format/std": 0.005494481977075338, "sampling/importance_sampling_ratio/max": 2.57766877412796, "sampling/importance_sampling_ratio/mean": 0.9752013266086579, "sampling/importance_sampling_ratio/min": 0.09145144950598479, "sampling/sampling_logp_difference/max": 1.0289781928062438, "sampling/sampling_logp_difference/mean": 0.0043914201203733684, "step": 6250, "step_time": 8.549217757285806 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00546875, "completions/max_length": 1912.1, "completions/max_terminated_length": 1591.2, "completions/mean_length": 166.64921875, "completions/mean_terminated_length": 156.41741638183595, "completions/min_length": 63.7, "completions/min_terminated_length": 63.7, "entropy": 0.053987509780563415, "epoch": 13.404710920770878, "frac_reward_zero_std": 0.8125, "grad_norm": 1.2265625, "learning_rate": 9.3741e-06, "loss": -0.013, "num_tokens": 654924540.0, "reward": 1.0443554759025573, "reward_std": 0.2042455866932869, "rewards/reward_accuracy/mean": 0.944921875, "rewards/reward_accuracy/std": 0.20178447291254997, "rewards/reward_format/mean": 0.09943359494209289, "rewards/reward_format/std": 0.005940066976472735, "sampling/importance_sampling_ratio/max": 2.388659381866455, "sampling/importance_sampling_ratio/mean": 0.9784941494464874, "sampling/importance_sampling_ratio/min": 0.11579880490899086, "sampling/sampling_logp_difference/max": 0.908187985420227, "sampling/sampling_logp_difference/mean": 0.004428096511401236, "step": 6260, "step_time": 9.190583177297958 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01015625, "completions/max_length": 1661.4, "completions/max_terminated_length": 1552.0, "completions/mean_length": 195.93203125, "completions/mean_terminated_length": 177.6032684326172, "completions/min_length": 63.6, "completions/min_terminated_length": 63.6, "entropy": 0.06532864493783563, "epoch": 13.42612419700214, "frac_reward_zero_std": 0.84375, "grad_norm": 1.7265625, "learning_rate": 9.3731e-06, "loss": -0.0116, "num_tokens": 655947886.0, "reward": 1.0314843893051147, "reward_std": 0.20597516521811485, "rewards/reward_accuracy/mean": 0.932421875, "rewards/reward_accuracy/std": 0.20364234447479249, "rewards/reward_format/mean": 0.0990625001490116, "rewards/reward_format/std": 0.006530065508559346, "sampling/importance_sampling_ratio/max": 2.632793402671814, "sampling/importance_sampling_ratio/mean": 0.983275294303894, "sampling/importance_sampling_ratio/min": 0.15376686975359916, "sampling/sampling_logp_difference/max": 0.8940564632415772, "sampling/sampling_logp_difference/mean": 0.004766634060069918, "step": 6270, "step_time": 8.237649959992268 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00703125, "completions/max_length": 1509.6, "completions/max_terminated_length": 1258.5, "completions/mean_length": 158.97265625, "completions/mean_terminated_length": 145.91651458740233, "completions/min_length": 63.8, "completions/min_terminated_length": 63.8, "entropy": 0.047490815981291234, "epoch": 13.447537473233405, "frac_reward_zero_std": 0.88125, "grad_norm": 0.287109375, "learning_rate": 9.372100000000001e-06, "loss": -0.0038, "num_tokens": 656867576.0, "reward": 1.0794726729393005, "reward_std": 0.12454302972182632, "rewards/reward_accuracy/mean": 0.980078125, "rewards/reward_accuracy/std": 0.12167773619294167, "rewards/reward_format/mean": 0.09939453229308129, "rewards/reward_format/std": 0.00405458458699286, "sampling/importance_sampling_ratio/max": 2.37939076423645, "sampling/importance_sampling_ratio/mean": 0.9865086138248443, "sampling/importance_sampling_ratio/min": 0.15731547102332116, "sampling/sampling_logp_difference/max": 0.9720810055732727, "sampling/sampling_logp_difference/mean": 0.0041483440436422825, "step": 6280, "step_time": 7.148666684696218 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00234375, "completions/max_length": 1189.8, "completions/max_terminated_length": 882.1, "completions/mean_length": 144.72734375, "completions/mean_terminated_length": 140.27078857421876, "completions/min_length": 68.9, "completions/min_terminated_length": 68.9, "entropy": 0.04092986376490444, "epoch": 13.468950749464668, "frac_reward_zero_std": 0.9125, "grad_norm": 0.0, "learning_rate": 9.3711e-06, "loss": -0.0025, "num_tokens": 657756446.0, "reward": 1.0770703315734864, "reward_std": 0.12274166867136956, "rewards/reward_accuracy/mean": 0.97734375, "rewards/reward_accuracy/std": 0.12117109224200248, "rewards/reward_format/mean": 0.0997265636920929, "rewards/reward_format/std": 0.0029336997773498296, "sampling/importance_sampling_ratio/max": 2.6196802616119386, "sampling/importance_sampling_ratio/mean": 0.9921919822692871, "sampling/importance_sampling_ratio/min": 0.21765816509723662, "sampling/sampling_logp_difference/max": 0.9087395310401917, "sampling/sampling_logp_difference/mean": 0.003894891473464668, "step": 6290, "step_time": 5.839204334211535 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.012109375, "completions/max_length": 1752.6, "completions/max_terminated_length": 1399.9, "completions/mean_length": 194.877734375, "completions/mean_terminated_length": 172.31782989501954, "completions/min_length": 67.6, "completions/min_terminated_length": 67.6, "entropy": 0.059170945663936436, "epoch": 13.490364025695932, "frac_reward_zero_std": 0.86875, "grad_norm": 0.337890625, "learning_rate": 9.3701e-06, "loss": -0.013, "num_tokens": 658775877.0, "reward": 1.0466992676258087, "reward_std": 0.20129312872886657, "rewards/reward_accuracy/mean": 0.94765625, "rewards/reward_accuracy/std": 0.1975736916065216, "rewards/reward_format/mean": 0.09904297068715096, "rewards/reward_format/std": 0.007779728737659752, "sampling/importance_sampling_ratio/max": 2.425941562652588, "sampling/importance_sampling_ratio/mean": 0.973828649520874, "sampling/importance_sampling_ratio/min": 0.1136238157749176, "sampling/sampling_logp_difference/max": 1.1405448377132417, "sampling/sampling_logp_difference/mean": 0.004498518421314657, "step": 6300, "step_time": 8.593856640098966 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 1337.3, "completions/max_terminated_length": 1138.6, "completions/mean_length": 171.33515625, "completions/mean_terminated_length": 164.07163848876954, "completions/min_length": 63.2, "completions/min_terminated_length": 63.2, "entropy": 0.048986665229313074, "epoch": 13.511777301927195, "frac_reward_zero_std": 0.8875, "grad_norm": 0.40234375, "learning_rate": 9.369100000000001e-06, "loss": -0.0065, "num_tokens": 659748175.0, "reward": 1.0594922065734864, "reward_std": 0.16336871534585953, "rewards/reward_accuracy/mean": 0.959765625, "rewards/reward_accuracy/std": 0.1623434379696846, "rewards/reward_format/mean": 0.0997265636920929, "rewards/reward_format/std": 0.0023660849314182998, "sampling/importance_sampling_ratio/max": 2.283779573440552, "sampling/importance_sampling_ratio/mean": 0.983277440071106, "sampling/importance_sampling_ratio/min": 0.1474586371332407, "sampling/sampling_logp_difference/max": 0.9239279687404632, "sampling/sampling_logp_difference/mean": 0.003922212193720043, "step": 6310, "step_time": 6.761331573108327 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00859375, "completions/max_length": 1533.4, "completions/max_terminated_length": 1401.9, "completions/mean_length": 171.104296875, "completions/mean_terminated_length": 154.9777099609375, "completions/min_length": 65.6, "completions/min_terminated_length": 65.6, "entropy": 0.05001626529265195, "epoch": 13.533190578158457, "frac_reward_zero_std": 0.8625, "grad_norm": 0.365234375, "learning_rate": 9.368100000000001e-06, "loss": -0.0059, "num_tokens": 660699290.0, "reward": 1.0362890779972076, "reward_std": 0.22339280620217322, "rewards/reward_accuracy/mean": 0.937109375, "rewards/reward_accuracy/std": 0.22100840285420417, "rewards/reward_format/mean": 0.09917968809604645, "rewards/reward_format/std": 0.004626548825763166, "sampling/importance_sampling_ratio/max": 2.408915627002716, "sampling/importance_sampling_ratio/mean": 0.9918237566947937, "sampling/importance_sampling_ratio/min": 0.0969219908118248, "sampling/sampling_logp_difference/max": 0.96937575340271, "sampling/sampling_logp_difference/mean": 0.004318993585184216, "step": 6320, "step_time": 7.372093826596393 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003515625, "completions/max_length": 1768.3, "completions/max_terminated_length": 1468.7, "completions/mean_length": 178.487890625, "completions/mean_terminated_length": 171.91040496826173, "completions/min_length": 66.6, "completions/min_terminated_length": 66.6, "entropy": 0.05229062018916011, "epoch": 13.554603854389722, "frac_reward_zero_std": 0.875, "grad_norm": 0.400390625, "learning_rate": 9.3671e-06, "loss": -0.0075, "num_tokens": 661678075.0, "reward": 1.0461914122104645, "reward_std": 0.19444930478930472, "rewards/reward_accuracy/mean": 0.946484375, "rewards/reward_accuracy/std": 0.192823476344347, "rewards/reward_format/mean": 0.09970703125, "rewards/reward_format/std": 0.003921288019046188, "sampling/importance_sampling_ratio/max": 2.501658391952515, "sampling/importance_sampling_ratio/mean": 0.9748984396457672, "sampling/importance_sampling_ratio/min": 0.014323137700557709, "sampling/sampling_logp_difference/max": 0.9498490512371063, "sampling/sampling_logp_difference/mean": 0.004328481969423592, "step": 6330, "step_time": 8.48923535879003 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00546875, "completions/max_length": 1948.1, "completions/max_terminated_length": 1402.4, "completions/mean_length": 175.096484375, "completions/mean_terminated_length": 164.88754577636718, "completions/min_length": 64.8, "completions/min_terminated_length": 64.8, "entropy": 0.056190560571849346, "epoch": 13.576017130620984, "frac_reward_zero_std": 0.84375, "grad_norm": 0.69921875, "learning_rate": 9.366100000000002e-06, "loss": -0.0076, "num_tokens": 662641650.0, "reward": 1.051523458957672, "reward_std": 0.200423164665699, "rewards/reward_accuracy/mean": 0.951953125, "rewards/reward_accuracy/std": 0.1980856753885746, "rewards/reward_format/mean": 0.09957031384110451, "rewards/reward_format/std": 0.004894468956626952, "sampling/importance_sampling_ratio/max": 2.4903852701187135, "sampling/importance_sampling_ratio/mean": 0.9898917615413666, "sampling/importance_sampling_ratio/min": 0.13982707485556603, "sampling/sampling_logp_difference/max": 0.8962759673595428, "sampling/sampling_logp_difference/mean": 0.004361913772299886, "step": 6340, "step_time": 9.071250657117343 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00859375, "completions/max_length": 1575.8, "completions/max_terminated_length": 1445.4, "completions/mean_length": 188.05390625, "completions/mean_terminated_length": 172.00685272216796, "completions/min_length": 65.3, "completions/min_terminated_length": 65.3, "entropy": 0.05808103133458644, "epoch": 13.597430406852249, "frac_reward_zero_std": 0.8625, "grad_norm": 0.0, "learning_rate": 9.3651e-06, "loss": -0.0059, "num_tokens": 663637116.0, "reward": 1.0401562571525573, "reward_std": 0.21028706282377244, "rewards/reward_accuracy/mean": 0.941015625, "rewards/reward_accuracy/std": 0.2072344519197941, "rewards/reward_format/mean": 0.09914062544703484, "rewards/reward_format/std": 0.006320220045745372, "sampling/importance_sampling_ratio/max": 2.4663337230682374, "sampling/importance_sampling_ratio/mean": 0.975096333026886, "sampling/importance_sampling_ratio/min": 0.011826204508543015, "sampling/sampling_logp_difference/max": 0.867270702123642, "sampling/sampling_logp_difference/mean": 0.00425783961545676, "step": 6350, "step_time": 7.779164433004917 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00546875, "completions/max_length": 1728.7, "completions/max_terminated_length": 1289.4, "completions/mean_length": 173.390625, "completions/mean_terminated_length": 163.14202728271485, "completions/min_length": 69.0, "completions/min_terminated_length": 69.0, "entropy": 0.05282252836041153, "epoch": 13.618843683083512, "frac_reward_zero_std": 0.8625, "grad_norm": 0.55078125, "learning_rate": 9.3641e-06, "loss": -0.0091, "num_tokens": 664599572.0, "reward": 1.0491601705551148, "reward_std": 0.19206472784280776, "rewards/reward_accuracy/mean": 0.949609375, "rewards/reward_accuracy/std": 0.19020407125353814, "rewards/reward_format/mean": 0.09955078214406968, "rewards/reward_format/std": 0.005171245150268078, "sampling/importance_sampling_ratio/max": 2.2965982437133787, "sampling/importance_sampling_ratio/mean": 0.9766180992126465, "sampling/importance_sampling_ratio/min": 0.08504310101270676, "sampling/sampling_logp_difference/max": 0.8386000633239746, "sampling/sampling_logp_difference/mean": 0.00439816564321518, "step": 6360, "step_time": 8.379212443108553 }, { "clip_ratio/high_max": 1.6212710761465132e-05, "clip_ratio/high_mean": 2.0265888451831415e-06, "clip_ratio/low_mean": 2.463387727402733e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 4.489976572585874e-06, "completions/clipped_ratio": 0.009765625, "completions/max_length": 1294.2, "completions/max_terminated_length": 1200.0, "completions/mean_length": 177.99765625, "completions/mean_terminated_length": 159.8431869506836, "completions/min_length": 73.2, "completions/min_terminated_length": 73.2, "entropy": 0.05078420748468489, "epoch": 13.640256959314776, "frac_reward_zero_std": 0.8875, "grad_norm": 0.0, "learning_rate": 9.3631e-06, "loss": -0.007, "num_tokens": 665571646.0, "reward": 1.0443554997444153, "reward_std": 0.17260719314217568, "rewards/reward_accuracy/mean": 0.9453125, "rewards/reward_accuracy/std": 0.16977075561881066, "rewards/reward_format/mean": 0.09904297143220901, "rewards/reward_format/std": 0.006035491591319442, "sampling/importance_sampling_ratio/max": 2.525562286376953, "sampling/importance_sampling_ratio/mean": 0.9889052212238312, "sampling/importance_sampling_ratio/min": 0.12683362737298012, "sampling/sampling_logp_difference/max": 0.9006058275699615, "sampling/sampling_logp_difference/mean": 0.00438386460300535, "step": 6370, "step_time": 6.685426272719633 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00546875, "completions/max_length": 1727.0, "completions/max_terminated_length": 1292.9, "completions/mean_length": 163.116015625, "completions/mean_terminated_length": 152.79910278320312, "completions/min_length": 67.0, "completions/min_terminated_length": 67.0, "entropy": 0.04915265969466418, "epoch": 13.661670235546039, "frac_reward_zero_std": 0.89375, "grad_norm": 0.177734375, "learning_rate": 9.362100000000001e-06, "loss": -0.0013, "num_tokens": 666505991.0, "reward": 1.0596093893051148, "reward_std": 0.15919213742017746, "rewards/reward_accuracy/mean": 0.96015625, "rewards/reward_accuracy/std": 0.15645537823438643, "rewards/reward_format/mean": 0.09945312589406967, "rewards/reward_format/std": 0.005168350809253752, "sampling/importance_sampling_ratio/max": 2.4315099120140076, "sampling/importance_sampling_ratio/mean": 0.9872767210006714, "sampling/importance_sampling_ratio/min": 0.09565360508859158, "sampling/sampling_logp_difference/max": 1.1391736626625062, "sampling/sampling_logp_difference/mean": 0.004337183060124516, "step": 6380, "step_time": 8.264577217475743 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.006640625, "completions/max_length": 1393.9, "completions/max_terminated_length": 1312.5, "completions/mean_length": 178.583203125, "completions/mean_terminated_length": 166.18683166503905, "completions/min_length": 65.6, "completions/min_terminated_length": 65.6, "entropy": 0.054893383546732365, "epoch": 13.683083511777301, "frac_reward_zero_std": 0.89375, "grad_norm": 0.0, "learning_rate": 9.361100000000001e-06, "loss": -0.0094, "num_tokens": 667475420.0, "reward": 1.0573437690734864, "reward_std": 0.16412511169910432, "rewards/reward_accuracy/mean": 0.9578125, "rewards/reward_accuracy/std": 0.1626168668270111, "rewards/reward_format/mean": 0.0995312511920929, "rewards/reward_format/std": 0.003531407471746206, "sampling/importance_sampling_ratio/max": 2.419576358795166, "sampling/importance_sampling_ratio/mean": 0.9837849736213684, "sampling/importance_sampling_ratio/min": 0.06855249628424645, "sampling/sampling_logp_difference/max": 0.8102612614631652, "sampling/sampling_logp_difference/mean": 0.004396245907992124, "step": 6390, "step_time": 6.747032490104902 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.007421875, "completions/max_length": 1535.1, "completions/max_terminated_length": 1235.3, "completions/mean_length": 175.04140625, "completions/mean_terminated_length": 161.07993240356444, "completions/min_length": 62.5, "completions/min_terminated_length": 62.5, "entropy": 0.053780654165893796, "epoch": 13.704496788008566, "frac_reward_zero_std": 0.84375, "grad_norm": 1.609375, "learning_rate": 9.3601e-06, "loss": -0.0011, "num_tokens": 668436278.0, "reward": 1.0500781536102295, "reward_std": 0.1883752927184105, "rewards/reward_accuracy/mean": 0.95078125, "rewards/reward_accuracy/std": 0.18552988395094872, "rewards/reward_format/mean": 0.09929687753319741, "rewards/reward_format/std": 0.0057085281237959865, "sampling/importance_sampling_ratio/max": 2.3837275743484496, "sampling/importance_sampling_ratio/mean": 0.9863021194934845, "sampling/importance_sampling_ratio/min": 0.12872835695743562, "sampling/sampling_logp_difference/max": 0.9833871722221375, "sampling/sampling_logp_difference/mean": 0.00434352804441005, "step": 6400, "step_time": 7.51356084648287 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.010546875, "completions/max_length": 1594.3, "completions/max_terminated_length": 1484.0, "completions/mean_length": 194.8875, "completions/mean_terminated_length": 175.264501953125, "completions/min_length": 65.0, "completions/min_terminated_length": 65.0, "entropy": 0.05940292275045067, "epoch": 13.725910064239828, "frac_reward_zero_std": 0.86875, "grad_norm": 0.279296875, "learning_rate": 9.359100000000002e-06, "loss": -0.0186, "num_tokens": 669454534.0, "reward": 1.0566015839576721, "reward_std": 0.16762102991342545, "rewards/reward_accuracy/mean": 0.957421875, "rewards/reward_accuracy/std": 0.16458993703126906, "rewards/reward_format/mean": 0.09917968884110451, "rewards/reward_format/std": 0.006255228398367762, "sampling/importance_sampling_ratio/max": 2.5067240953445435, "sampling/importance_sampling_ratio/mean": 0.9686943829059601, "sampling/importance_sampling_ratio/min": 0.05146309845149517, "sampling/sampling_logp_difference/max": 0.8527966856956481, "sampling/sampling_logp_difference/mean": 0.004527035425417126, "step": 6410, "step_time": 7.914399105412303 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 8.550990514777368e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 8.550990514777368e-06, "completions/clipped_ratio": 0.01484375, "completions/max_length": 1457.7, "completions/max_terminated_length": 1260.9, "completions/mean_length": 199.71328125, "completions/mean_terminated_length": 172.31343994140624, "completions/min_length": 63.9, "completions/min_terminated_length": 63.9, "entropy": 0.058974133571609855, "epoch": 13.747323340471093, "frac_reward_zero_std": 0.86875, "grad_norm": 0.216796875, "learning_rate": 9.358100000000001e-06, "loss": -0.0016, "num_tokens": 670479096.0, "reward": 1.0413867294788361, "reward_std": 0.2167115181684494, "rewards/reward_accuracy/mean": 0.942578125, "rewards/reward_accuracy/std": 0.2129724770784378, "rewards/reward_format/mean": 0.09880859479308128, "rewards/reward_format/std": 0.0069346214877441525, "sampling/importance_sampling_ratio/max": 2.6044188022613524, "sampling/importance_sampling_ratio/mean": 0.9787875056266785, "sampling/importance_sampling_ratio/min": 0.12233782596886159, "sampling/sampling_logp_difference/max": 0.9433415293693542, "sampling/sampling_logp_difference/mean": 0.004565335367806256, "step": 6420, "step_time": 7.32171960240521 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.006640625, "completions/max_length": 1680.6, "completions/max_terminated_length": 1567.5, "completions/mean_length": 181.161328125, "completions/mean_terminated_length": 168.81618957519532, "completions/min_length": 64.8, "completions/min_terminated_length": 64.8, "entropy": 0.0541982895694673, "epoch": 13.768736616702355, "frac_reward_zero_std": 0.83125, "grad_norm": 0.0, "learning_rate": 9.3571e-06, "loss": -0.0028, "num_tokens": 671459685.0, "reward": 1.0474218904972077, "reward_std": 0.19890257641673087, "rewards/reward_accuracy/mean": 0.948046875, "rewards/reward_accuracy/std": 0.1967453770339489, "rewards/reward_format/mean": 0.09937500134110451, "rewards/reward_format/std": 0.005086789769120514, "sampling/importance_sampling_ratio/max": 2.447837543487549, "sampling/importance_sampling_ratio/mean": 0.9932205438613891, "sampling/importance_sampling_ratio/min": 0.16477308459579945, "sampling/sampling_logp_difference/max": 0.8984160661697388, "sampling/sampling_logp_difference/mean": 0.004485658765770495, "step": 6430, "step_time": 8.12364383180975 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.008984375, "completions/max_length": 1480.7, "completions/max_terminated_length": 1344.7, "completions/mean_length": 172.6078125, "completions/mean_terminated_length": 155.8318664550781, "completions/min_length": 65.3, "completions/min_terminated_length": 65.3, "entropy": 0.04904697588644922, "epoch": 13.790149892933618, "frac_reward_zero_std": 0.86875, "grad_norm": 0.2216796875, "learning_rate": 9.356100000000002e-06, "loss": -0.0095, "num_tokens": 672424329.0, "reward": 1.0561718821525574, "reward_std": 0.18017418906092644, "rewards/reward_accuracy/mean": 0.95703125, "rewards/reward_accuracy/std": 0.17720405086874963, "rewards/reward_format/mean": 0.09914062544703484, "rewards/reward_format/std": 0.005081167654134333, "sampling/importance_sampling_ratio/max": 2.4214083671569826, "sampling/importance_sampling_ratio/mean": 0.9967582762241364, "sampling/importance_sampling_ratio/min": 0.10222169533371925, "sampling/sampling_logp_difference/max": 1.090004599094391, "sampling/sampling_logp_difference/mean": 0.004130501113831997, "step": 6440, "step_time": 7.236673405498732 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003125, "completions/max_length": 1576.4, "completions/max_terminated_length": 1417.9, "completions/mean_length": 178.16796875, "completions/mean_terminated_length": 172.337646484375, "completions/min_length": 68.2, "completions/min_terminated_length": 68.2, "entropy": 0.05557680504862219, "epoch": 13.811563169164883, "frac_reward_zero_std": 0.88125, "grad_norm": 0.8671875, "learning_rate": 9.3551e-06, "loss": -0.0027, "num_tokens": 673402615.0, "reward": 1.0298242449760437, "reward_std": 0.22192211523652078, "rewards/reward_accuracy/mean": 0.930078125, "rewards/reward_accuracy/std": 0.2212800092995167, "rewards/reward_format/mean": 0.09974609389901161, "rewards/reward_format/std": 0.0028674173634499313, "sampling/importance_sampling_ratio/max": 2.4718090653419496, "sampling/importance_sampling_ratio/mean": 0.991068857908249, "sampling/importance_sampling_ratio/min": 0.0714785099029541, "sampling/sampling_logp_difference/max": 0.9727436542510987, "sampling/sampling_logp_difference/mean": 0.004292149026878178, "step": 6450, "step_time": 7.610002672381233 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 1376.1, "completions/max_terminated_length": 1227.5, "completions/mean_length": 178.05, "completions/mean_terminated_length": 170.82252655029296, "completions/min_length": 65.3, "completions/min_terminated_length": 65.3, "entropy": 0.05068503618240357, "epoch": 13.832976445396145, "frac_reward_zero_std": 0.86875, "grad_norm": 0.07275390625, "learning_rate": 9.3541e-06, "loss": -0.0017, "num_tokens": 674379511.0, "reward": 1.028183603286743, "reward_std": 0.23838501274585724, "rewards/reward_accuracy/mean": 0.928515625, "rewards/reward_accuracy/std": 0.23735610246658326, "rewards/reward_format/mean": 0.09966796934604645, "rewards/reward_format/std": 0.00376594876870513, "sampling/importance_sampling_ratio/max": 2.4470887660980223, "sampling/importance_sampling_ratio/mean": 0.9802656531333923, "sampling/importance_sampling_ratio/min": 0.052815625071525575, "sampling/sampling_logp_difference/max": 0.9030134618282318, "sampling/sampling_logp_difference/mean": 0.004254769394174218, "step": 6460, "step_time": 6.6551671382185305 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00546875, "completions/max_length": 1522.9, "completions/max_terminated_length": 1274.1, "completions/mean_length": 178.80234375, "completions/mean_terminated_length": 168.67185821533204, "completions/min_length": 66.6, "completions/min_terminated_length": 66.6, "entropy": 0.05275619283784181, "epoch": 13.85438972162741, "frac_reward_zero_std": 0.85625, "grad_norm": 0.625, "learning_rate": 9.3531e-06, "loss": -0.0094, "num_tokens": 675360141.0, "reward": 1.0491406619548798, "reward_std": 0.17815189361572265, "rewards/reward_accuracy/mean": 0.949609375, "rewards/reward_accuracy/std": 0.176560989767313, "rewards/reward_format/mean": 0.0995312511920929, "rewards/reward_format/std": 0.00390942795202136, "sampling/importance_sampling_ratio/max": 2.3251043558120728, "sampling/importance_sampling_ratio/mean": 0.9858851194381714, "sampling/importance_sampling_ratio/min": 0.10143937543034554, "sampling/sampling_logp_difference/max": 1.1948384463787078, "sampling/sampling_logp_difference/mean": 0.0043153334874659775, "step": 6470, "step_time": 7.439664340412127 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00859375, "completions/max_length": 1529.6, "completions/max_terminated_length": 1314.8, "completions/mean_length": 179.149609375, "completions/mean_terminated_length": 163.13965301513673, "completions/min_length": 68.1, "completions/min_terminated_length": 68.1, "entropy": 0.05469238145742565, "epoch": 13.875802997858672, "frac_reward_zero_std": 0.85, "grad_norm": 0.482421875, "learning_rate": 9.3521e-06, "loss": 0.0002, "num_tokens": 676330860.0, "reward": 1.0553711175918579, "reward_std": 0.17498880103230477, "rewards/reward_accuracy/mean": 0.955859375, "rewards/reward_accuracy/std": 0.17301395460963248, "rewards/reward_format/mean": 0.09951172024011612, "rewards/reward_format/std": 0.00494760051369667, "sampling/importance_sampling_ratio/max": 2.589608335494995, "sampling/importance_sampling_ratio/mean": 0.9908037722110749, "sampling/importance_sampling_ratio/min": 0.142070831079036, "sampling/sampling_logp_difference/max": 0.913347202539444, "sampling/sampling_logp_difference/mean": 0.00424297337885946, "step": 6480, "step_time": 7.496113002896891 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.007421875, "completions/max_length": 1720.3, "completions/max_terminated_length": 1413.4, "completions/mean_length": 192.75078125, "completions/mean_terminated_length": 179.1056671142578, "completions/min_length": 69.0, "completions/min_terminated_length": 69.0, "entropy": 0.06374608390033246, "epoch": 13.897216274089935, "frac_reward_zero_std": 0.85625, "grad_norm": 0.84375, "learning_rate": 9.351100000000001e-06, "loss": -0.0027, "num_tokens": 677338974.0, "reward": 1.0492773413658143, "reward_std": 0.19369202405214309, "rewards/reward_accuracy/mean": 0.95, "rewards/reward_accuracy/std": 0.19129842668771743, "rewards/reward_format/mean": 0.09927734434604644, "rewards/reward_format/std": 0.005600328813306988, "sampling/importance_sampling_ratio/max": 2.621599578857422, "sampling/importance_sampling_ratio/mean": 0.9799755096435547, "sampling/importance_sampling_ratio/min": 0.07058737874031067, "sampling/sampling_logp_difference/max": 1.0697132468223571, "sampling/sampling_logp_difference/mean": 0.004686587234027683, "step": 6490, "step_time": 8.42997310210485 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005078125, "completions/max_length": 1528.4, "completions/max_terminated_length": 1235.3, "completions/mean_length": 162.56484375, "completions/mean_terminated_length": 153.01941680908203, "completions/min_length": 63.9, "completions/min_terminated_length": 63.9, "entropy": 0.046833317214623096, "epoch": 13.9186295503212, "frac_reward_zero_std": 0.9, "grad_norm": 0.1572265625, "learning_rate": 9.3501e-06, "loss": -0.0025, "num_tokens": 678270948.0, "reward": 1.0581250190734863, "reward_std": 0.16899387389421464, "rewards/reward_accuracy/mean": 0.95859375, "rewards/reward_accuracy/std": 0.1666727140545845, "rewards/reward_format/mean": 0.09953125044703484, "rewards/reward_format/std": 0.00445364851038903, "sampling/importance_sampling_ratio/max": 2.4631121158599854, "sampling/importance_sampling_ratio/mean": 0.9960642158985138, "sampling/importance_sampling_ratio/min": 0.10934389429166913, "sampling/sampling_logp_difference/max": 0.8482481718063355, "sampling/sampling_logp_difference/mean": 0.004143555136397481, "step": 6500, "step_time": 7.3537006883212594 }, { "clip_ratio/high_max": 4.0070524846669285e-06, "clip_ratio/high_mean": 5.008815605833661e-07, "clip_ratio/low_mean": 2.329606400053308e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 2.830487960636674e-06, "completions/clipped_ratio": 0.017578125, "completions/max_length": 1623.0, "completions/max_terminated_length": 1524.5, "completions/mean_length": 192.96328125, "completions/mean_terminated_length": 160.03733825683594, "completions/min_length": 65.2, "completions/min_terminated_length": 65.2, "entropy": 0.058418584917671976, "epoch": 13.940042826552462, "frac_reward_zero_std": 0.86875, "grad_norm": 0.8203125, "learning_rate": 9.349100000000002e-06, "loss": -0.0017, "num_tokens": 679279590.0, "reward": 1.0406836032867433, "reward_std": 0.21589941114652902, "rewards/reward_accuracy/mean": 0.9421875, "rewards/reward_accuracy/std": 0.2104765847325325, "rewards/reward_format/mean": 0.09849609360098839, "rewards/reward_format/std": 0.008288303506560624, "sampling/importance_sampling_ratio/max": 2.5564252376556396, "sampling/importance_sampling_ratio/mean": 0.9864274978637695, "sampling/importance_sampling_ratio/min": 0.127387635409832, "sampling/sampling_logp_difference/max": 0.8682243227958679, "sampling/sampling_logp_difference/mean": 0.004394911811687052, "step": 6510, "step_time": 8.140909293302684 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 4.651506333175348e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 4.651506333175348e-06, "completions/clipped_ratio": 0.015625, "completions/max_length": 1637.1, "completions/max_terminated_length": 1409.1, "completions/mean_length": 208.045703125, "completions/mean_terminated_length": 179.31230926513672, "completions/min_length": 66.9, "completions/min_terminated_length": 66.9, "entropy": 0.06501091322861612, "epoch": 13.961456102783727, "frac_reward_zero_std": 0.88125, "grad_norm": 0.1435546875, "learning_rate": 9.348100000000001e-06, "loss": -0.0052, "num_tokens": 680333259.0, "reward": 1.0525781333446502, "reward_std": 0.180988173186779, "rewards/reward_accuracy/mean": 0.95390625, "rewards/reward_accuracy/std": 0.17608614563941954, "rewards/reward_format/mean": 0.09867187365889549, "rewards/reward_format/std": 0.008468122384510935, "sampling/importance_sampling_ratio/max": 2.5396952390670777, "sampling/importance_sampling_ratio/mean": 0.9685321629047394, "sampling/importance_sampling_ratio/min": 0.07756424397230148, "sampling/sampling_logp_difference/max": 1.1460471510887147, "sampling/sampling_logp_difference/mean": 0.0047784664435312155, "step": 6520, "step_time": 8.084335012198427 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0109375, "completions/max_length": 2026.7, "completions/max_terminated_length": 1746.8, "completions/mean_length": 196.55703125, "completions/mean_terminated_length": 176.06941680908204, "completions/min_length": 68.7, "completions/min_terminated_length": 68.7, "entropy": 0.061905246274545786, "epoch": 13.98286937901499, "frac_reward_zero_std": 0.86875, "grad_norm": 0.484375, "learning_rate": 9.3471e-06, "loss": -0.0092, "num_tokens": 681354573.0, "reward": 1.0462499976158142, "reward_std": 0.22375444918870926, "rewards/reward_accuracy/mean": 0.947265625, "rewards/reward_accuracy/std": 0.21958387345075608, "rewards/reward_format/mean": 0.09898437559604645, "rewards/reward_format/std": 0.008234837185591459, "sampling/importance_sampling_ratio/max": 2.4826428651809693, "sampling/importance_sampling_ratio/mean": 0.9852231562137603, "sampling/importance_sampling_ratio/min": 0.03441601330414414, "sampling/sampling_logp_difference/max": 1.0374878644943237, "sampling/sampling_logp_difference/mean": 0.004871854372322559, "step": 6530, "step_time": 9.91945659769117 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 1261.5, "completions/max_terminated_length": 1111.6, "completions/mean_length": 162.83828125, "completions/mean_terminated_length": 155.6015640258789, "completions/min_length": 66.8, "completions/min_terminated_length": 66.8, "entropy": 0.04525313396006823, "epoch": 14.004282655246252, "frac_reward_zero_std": 0.90625, "grad_norm": 0.0, "learning_rate": 9.346100000000002e-06, "loss": -0.0035, "num_tokens": 682284431.0, "reward": 1.0738086104393005, "reward_std": 0.13020229563117028, "rewards/reward_accuracy/mean": 0.97421875, "rewards/reward_accuracy/std": 0.1282813549041748, "rewards/reward_format/mean": 0.09958984479308128, "rewards/reward_format/std": 0.0034624657826498153, "sampling/importance_sampling_ratio/max": 2.3287700176239015, "sampling/importance_sampling_ratio/mean": 0.9817049920558929, "sampling/importance_sampling_ratio/min": 0.15568179190158843, "sampling/sampling_logp_difference/max": 0.7273159742355346, "sampling/sampling_logp_difference/mean": 0.0040362444007769225, "step": 6540, "step_time": 6.128118082709261 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005078125, "completions/max_length": 1478.6, "completions/max_terminated_length": 1273.5, "completions/mean_length": 172.19765625, "completions/mean_terminated_length": 162.7085220336914, "completions/min_length": 71.6, "completions/min_terminated_length": 71.6, "entropy": 0.05320281337480992, "epoch": 14.025695931477516, "frac_reward_zero_std": 0.8875, "grad_norm": 0.376953125, "learning_rate": 9.3451e-06, "loss": -0.0105, "num_tokens": 683244105.0, "reward": 1.0701953411102294, "reward_std": 0.1470729537308216, "rewards/reward_accuracy/mean": 0.970703125, "rewards/reward_accuracy/std": 0.14472470209002494, "rewards/reward_format/mean": 0.09949218928813934, "rewards/reward_format/std": 0.0049479128792881966, "sampling/importance_sampling_ratio/max": 2.625271797180176, "sampling/importance_sampling_ratio/mean": 0.9862457513809204, "sampling/importance_sampling_ratio/min": 0.08548164842650294, "sampling/sampling_logp_difference/max": 0.82243732213974, "sampling/sampling_logp_difference/mean": 0.004398560780100524, "step": 6550, "step_time": 7.156919193195063 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.006640625, "completions/max_length": 1555.1, "completions/max_terminated_length": 1503.3, "completions/mean_length": 172.170703125, "completions/mean_terminated_length": 159.79448699951172, "completions/min_length": 63.7, "completions/min_terminated_length": 63.7, "entropy": 0.054497059620916846, "epoch": 14.047109207708779, "frac_reward_zero_std": 0.875, "grad_norm": 0.0791015625, "learning_rate": 9.344100000000001e-06, "loss": -0.008, "num_tokens": 684203374.0, "reward": 1.0552148699760437, "reward_std": 0.17712319493293763, "rewards/reward_accuracy/mean": 0.955859375, "rewards/reward_accuracy/std": 0.17513345777988434, "rewards/reward_format/mean": 0.09935546964406967, "rewards/reward_format/std": 0.004490146203897894, "sampling/importance_sampling_ratio/max": 2.4009502053260805, "sampling/importance_sampling_ratio/mean": 0.9819452047348023, "sampling/importance_sampling_ratio/min": 0.08036962747573853, "sampling/sampling_logp_difference/max": 0.9524768590927124, "sampling/sampling_logp_difference/mean": 0.0043369633378461, "step": 6560, "step_time": 7.426552295102738 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 2.705258248170139e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 2.705258248170139e-06, "completions/clipped_ratio": 0.008984375, "completions/max_length": 1471.2, "completions/max_terminated_length": 1286.8, "completions/mean_length": 187.6296875, "completions/mean_terminated_length": 170.97235107421875, "completions/min_length": 67.4, "completions/min_terminated_length": 67.4, "entropy": 0.0581747829914093, "epoch": 14.068522483940043, "frac_reward_zero_std": 0.89375, "grad_norm": 0.25390625, "learning_rate": 9.3431e-06, "loss": -0.0076, "num_tokens": 685200954.0, "reward": 1.0410742223262788, "reward_std": 0.19469581544399261, "rewards/reward_accuracy/mean": 0.9421875, "rewards/reward_accuracy/std": 0.19107264429330825, "rewards/reward_format/mean": 0.09888672009110451, "rewards/reward_format/std": 0.007666760496795178, "sampling/importance_sampling_ratio/max": 2.4462778091430666, "sampling/importance_sampling_ratio/mean": 0.967339938879013, "sampling/importance_sampling_ratio/min": 0.04349747784435749, "sampling/sampling_logp_difference/max": 1.0478240847587585, "sampling/sampling_logp_difference/mean": 0.004439125186763704, "step": 6570, "step_time": 7.30057878329535 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.004296875, "completions/max_length": 1676.4, "completions/max_terminated_length": 1478.9, "completions/mean_length": 166.458984375, "completions/mean_terminated_length": 158.37252960205078, "completions/min_length": 67.3, "completions/min_terminated_length": 67.3, "entropy": 0.049819502211175856, "epoch": 14.089935760171306, "frac_reward_zero_std": 0.90625, "grad_norm": 0.1962890625, "learning_rate": 9.3421e-06, "loss": -0.0017, "num_tokens": 686152225.0, "reward": 1.0680273592472076, "reward_std": 0.14581480771303176, "rewards/reward_accuracy/mean": 0.968359375, "rewards/reward_accuracy/std": 0.1441290371119976, "rewards/reward_format/mean": 0.09966796934604645, "rewards/reward_format/std": 0.003964001382701099, "sampling/importance_sampling_ratio/max": 2.4678235173225405, "sampling/importance_sampling_ratio/mean": 0.9922048032283783, "sampling/importance_sampling_ratio/min": 0.10737561457790434, "sampling/sampling_logp_difference/max": 0.8638099730014801, "sampling/sampling_logp_difference/mean": 0.004244438023306429, "step": 6580, "step_time": 7.978030888197827 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.016015625, "completions/max_length": 1727.4, "completions/max_terminated_length": 1496.7, "completions/mean_length": 198.687109375, "completions/mean_terminated_length": 168.88742370605468, "completions/min_length": 70.1, "completions/min_terminated_length": 70.1, "entropy": 0.05983603680506348, "epoch": 14.11134903640257, "frac_reward_zero_std": 0.8625, "grad_norm": 0.255859375, "learning_rate": 9.341100000000001e-06, "loss": -0.0108, "num_tokens": 687179008.0, "reward": 1.0506055057048798, "reward_std": 0.18442369103431702, "rewards/reward_accuracy/mean": 0.951953125, "rewards/reward_accuracy/std": 0.17893272265791893, "rewards/reward_format/mean": 0.09865234494209289, "rewards/reward_format/std": 0.008971795625984668, "sampling/importance_sampling_ratio/max": 2.4546991348266602, "sampling/importance_sampling_ratio/mean": 0.9766439020633697, "sampling/importance_sampling_ratio/min": 0.08517252262681722, "sampling/sampling_logp_difference/max": 0.9840207457542419, "sampling/sampling_logp_difference/mean": 0.00444970962125808, "step": 6590, "step_time": 8.679046403401298 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.006640625, "completions/max_length": 1709.1, "completions/max_terminated_length": 1596.2, "completions/mean_length": 186.28515625, "completions/mean_terminated_length": 173.92142028808593, "completions/min_length": 69.0, "completions/min_terminated_length": 69.0, "entropy": 0.05730391782708466, "epoch": 14.132762312633833, "frac_reward_zero_std": 0.8625, "grad_norm": 0.8203125, "learning_rate": 9.3401e-06, "loss": -0.0099, "num_tokens": 688176522.0, "reward": 1.0333984673023224, "reward_std": 0.22489501312375068, "rewards/reward_accuracy/mean": 0.933984375, "rewards/reward_accuracy/std": 0.22281435057520865, "rewards/reward_format/mean": 0.09941406399011612, "rewards/reward_format/std": 0.005158440233208239, "sampling/importance_sampling_ratio/max": 2.384672391414642, "sampling/importance_sampling_ratio/mean": 0.9854220688343048, "sampling/importance_sampling_ratio/min": 0.03437364138662815, "sampling/sampling_logp_difference/max": 1.0959331274032593, "sampling/sampling_logp_difference/mean": 0.004498854535631836, "step": 6600, "step_time": 8.324384697599452 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.004296875, "completions/max_length": 1461.5, "completions/max_terminated_length": 1301.8, "completions/mean_length": 164.54921875, "completions/mean_terminated_length": 156.47599334716796, "completions/min_length": 67.2, "completions/min_terminated_length": 67.2, "entropy": 0.047510938416235146, "epoch": 14.154175588865096, "frac_reward_zero_std": 0.9, "grad_norm": 0.8359375, "learning_rate": 9.339100000000002e-06, "loss": -0.0112, "num_tokens": 689114536.0, "reward": 1.0675976753234864, "reward_std": 0.14747019931674005, "rewards/reward_accuracy/mean": 0.96796875, "rewards/reward_accuracy/std": 0.14529308378696443, "rewards/reward_format/mean": 0.09962890669703484, "rewards/reward_format/std": 0.004033045051619411, "sampling/importance_sampling_ratio/max": 2.4341891288757322, "sampling/importance_sampling_ratio/mean": 0.9876119315624237, "sampling/importance_sampling_ratio/min": 0.21452969536185265, "sampling/sampling_logp_difference/max": 0.9052593111991882, "sampling/sampling_logp_difference/mean": 0.004137600306421518, "step": 6610, "step_time": 6.826080052595353 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00859375, "completions/max_length": 1906.0, "completions/max_terminated_length": 1640.6, "completions/mean_length": 183.509375, "completions/mean_terminated_length": 167.44212036132814, "completions/min_length": 63.0, "completions/min_terminated_length": 63.0, "entropy": 0.06267745953518897, "epoch": 14.17558886509636, "frac_reward_zero_std": 0.8375, "grad_norm": 0.2578125, "learning_rate": 9.338100000000001e-06, "loss": -0.0119, "num_tokens": 690099648.0, "reward": 1.0603906631469726, "reward_std": 0.18434830084443093, "rewards/reward_accuracy/mean": 0.9609375, "rewards/reward_accuracy/std": 0.18193155899643898, "rewards/reward_format/mean": 0.0994531273841858, "rewards/reward_format/std": 0.004963712766766548, "sampling/importance_sampling_ratio/max": 2.549701285362244, "sampling/importance_sampling_ratio/mean": 0.9855315923690796, "sampling/importance_sampling_ratio/min": 0.03956093140877783, "sampling/sampling_logp_difference/max": 1.064697015285492, "sampling/sampling_logp_difference/mean": 0.004918659338727593, "step": 6620, "step_time": 8.989886014495278 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 1.3368385907597257e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 1.3368385907597257e-06, "completions/clipped_ratio": 0.0078125, "completions/max_length": 1606.2, "completions/max_terminated_length": 1185.8, "completions/mean_length": 159.43359375, "completions/mean_terminated_length": 144.67359466552733, "completions/min_length": 61.2, "completions/min_terminated_length": 61.2, "entropy": 0.04457120527513325, "epoch": 14.197002141327623, "frac_reward_zero_std": 0.90625, "grad_norm": 0.36328125, "learning_rate": 9.3371e-06, "loss": -0.0022, "num_tokens": 691017494.0, "reward": 1.069140625, "reward_std": 0.13983886644709856, "rewards/reward_accuracy/mean": 0.969921875, "rewards/reward_accuracy/std": 0.1361324705183506, "rewards/reward_format/mean": 0.09921875, "rewards/reward_format/std": 0.005793217686004937, "sampling/importance_sampling_ratio/max": 2.3669481754302977, "sampling/importance_sampling_ratio/mean": 0.9911776721477509, "sampling/importance_sampling_ratio/min": 0.1088035311549902, "sampling/sampling_logp_difference/max": 0.9319216549396515, "sampling/sampling_logp_difference/mean": 0.003832959872670472, "step": 6630, "step_time": 7.75838805870153 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.009765625, "completions/max_length": 1708.1, "completions/max_terminated_length": 1504.6, "completions/mean_length": 188.258984375, "completions/mean_terminated_length": 169.95396423339844, "completions/min_length": 67.5, "completions/min_terminated_length": 67.5, "entropy": 0.053495716163888575, "epoch": 14.218415417558887, "frac_reward_zero_std": 0.85625, "grad_norm": 0.9765625, "learning_rate": 9.336100000000002e-06, "loss": -0.0058, "num_tokens": 692021805.0, "reward": 1.0348047137260437, "reward_std": 0.23186768889427184, "rewards/reward_accuracy/mean": 0.935546875, "rewards/reward_accuracy/std": 0.2291102647781372, "rewards/reward_format/mean": 0.09925781413912774, "rewards/reward_format/std": 0.0061144459992647174, "sampling/importance_sampling_ratio/max": 2.304242491722107, "sampling/importance_sampling_ratio/mean": 0.9688826382160187, "sampling/importance_sampling_ratio/min": 0.07745564319193363, "sampling/sampling_logp_difference/max": 0.9057948470115662, "sampling/sampling_logp_difference/mean": 0.0043924636207520965, "step": 6640, "step_time": 8.461487661101273 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 1.8393905065750005e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 1.8393905065750005e-06, "completions/clipped_ratio": 0.012109375, "completions/max_length": 1516.6, "completions/max_terminated_length": 1333.3, "completions/mean_length": 188.6015625, "completions/mean_terminated_length": 165.9040084838867, "completions/min_length": 61.3, "completions/min_terminated_length": 61.3, "entropy": 0.05644304535817355, "epoch": 14.23982869379015, "frac_reward_zero_std": 0.85, "grad_norm": 0.275390625, "learning_rate": 9.3351e-06, "loss": -0.0068, "num_tokens": 693017377.0, "reward": 1.0520703196525574, "reward_std": 0.1938098356127739, "rewards/reward_accuracy/mean": 0.953125, "rewards/reward_accuracy/std": 0.1900540053844452, "rewards/reward_format/mean": 0.09894531220197678, "rewards/reward_format/std": 0.007366008241660893, "sampling/importance_sampling_ratio/max": 2.5217186212539673, "sampling/importance_sampling_ratio/mean": 0.9721066534519196, "sampling/importance_sampling_ratio/min": 0.04515217989683151, "sampling/sampling_logp_difference/max": 0.843786096572876, "sampling/sampling_logp_difference/mean": 0.004363892902620137, "step": 6650, "step_time": 7.695823124004528 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01015625, "completions/max_length": 1781.2, "completions/max_terminated_length": 1276.6, "completions/mean_length": 171.481640625, "completions/mean_terminated_length": 152.24789733886718, "completions/min_length": 61.5, "completions/min_terminated_length": 61.5, "entropy": 0.057220308925025165, "epoch": 14.261241970021413, "frac_reward_zero_std": 0.8875, "grad_norm": 0.3359375, "learning_rate": 9.334100000000001e-06, "loss": -0.014, "num_tokens": 693972194.0, "reward": 1.063281273841858, "reward_std": 0.16724992990493776, "rewards/reward_accuracy/mean": 0.9640625, "rewards/reward_accuracy/std": 0.16307274550199508, "rewards/reward_format/mean": 0.09921875149011612, "rewards/reward_format/std": 0.006254864414222539, "sampling/importance_sampling_ratio/max": 2.298472726345062, "sampling/importance_sampling_ratio/mean": 0.9774664998054504, "sampling/importance_sampling_ratio/min": 0.07936245575547218, "sampling/sampling_logp_difference/max": 0.9456567943096161, "sampling/sampling_logp_difference/mean": 0.004676505597308278, "step": 6660, "step_time": 8.44840384349518 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00859375, "completions/max_length": 1426.7, "completions/max_terminated_length": 1104.3, "completions/mean_length": 162.74140625, "completions/mean_terminated_length": 146.59091491699218, "completions/min_length": 63.7, "completions/min_terminated_length": 63.7, "entropy": 0.05032870206050575, "epoch": 14.282655246252677, "frac_reward_zero_std": 0.9125, "grad_norm": 0.0, "learning_rate": 9.3331e-06, "loss": -0.0012, "num_tokens": 694892316.0, "reward": 1.0559375286102295, "reward_std": 0.16750391721725463, "rewards/reward_accuracy/mean": 0.956640625, "rewards/reward_accuracy/std": 0.1646884486079216, "rewards/reward_format/mean": 0.09929687678813934, "rewards/reward_format/std": 0.005572062311694026, "sampling/importance_sampling_ratio/max": 2.3420160889625548, "sampling/importance_sampling_ratio/mean": 0.9848093569278717, "sampling/importance_sampling_ratio/min": 0.12420450653880835, "sampling/sampling_logp_difference/max": 0.900719964504242, "sampling/sampling_logp_difference/mean": 0.004278201120905578, "step": 6670, "step_time": 7.172061135800322 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.008984375, "completions/max_length": 1912.5, "completions/max_terminated_length": 1399.5, "completions/mean_length": 168.807421875, "completions/mean_terminated_length": 151.82654037475587, "completions/min_length": 66.8, "completions/min_terminated_length": 66.8, "entropy": 0.04863782261963934, "epoch": 14.30406852248394, "frac_reward_zero_std": 0.86875, "grad_norm": 0.984375, "learning_rate": 9.3321e-06, "loss": -0.0122, "num_tokens": 695840975.0, "reward": 1.0673046946525573, "reward_std": 0.1618990756571293, "rewards/reward_accuracy/mean": 0.96796875, "rewards/reward_accuracy/std": 0.15804306119680406, "rewards/reward_format/mean": 0.09933593794703484, "rewards/reward_format/std": 0.0065110417315736415, "sampling/importance_sampling_ratio/max": 2.369576406478882, "sampling/importance_sampling_ratio/mean": 0.9891004264354706, "sampling/importance_sampling_ratio/min": 0.0764289392158389, "sampling/sampling_logp_difference/max": 0.8522028863430023, "sampling/sampling_logp_difference/mean": 0.00422125852201134, "step": 6680, "step_time": 9.215180896772655 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.006640625, "completions/max_length": 1553.1, "completions/max_terminated_length": 1108.9, "completions/mean_length": 163.422265625, "completions/mean_terminated_length": 151.03235626220703, "completions/min_length": 64.4, "completions/min_terminated_length": 64.4, "entropy": 0.04513478884473443, "epoch": 14.325481798715204, "frac_reward_zero_std": 0.88125, "grad_norm": 0.3828125, "learning_rate": 9.331100000000001e-06, "loss": -0.0035, "num_tokens": 696774408.0, "reward": 1.058398461341858, "reward_std": 0.1728514935122803, "rewards/reward_accuracy/mean": 0.958984375, "rewards/reward_accuracy/std": 0.17024307250976561, "rewards/reward_format/mean": 0.09941406399011612, "rewards/reward_format/std": 0.004824168211780488, "sampling/importance_sampling_ratio/max": 2.4532196044921877, "sampling/importance_sampling_ratio/mean": 0.9819654762744904, "sampling/importance_sampling_ratio/min": 0.184867337718606, "sampling/sampling_logp_difference/max": 0.7969536542892456, "sampling/sampling_logp_difference/mean": 0.0039507665671408175, "step": 6690, "step_time": 7.541578272392508 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01484375, "completions/max_length": 1625.1, "completions/max_terminated_length": 1276.5, "completions/mean_length": 196.406640625, "completions/mean_terminated_length": 169.17852401733398, "completions/min_length": 60.5, "completions/min_terminated_length": 60.5, "entropy": 0.057901989202946424, "epoch": 14.346895074946467, "frac_reward_zero_std": 0.89375, "grad_norm": 0.48828125, "learning_rate": 9.3301e-06, "loss": -0.0042, "num_tokens": 697793193.0, "reward": 1.032617199420929, "reward_std": 0.2080725833773613, "rewards/reward_accuracy/mean": 0.933984375, "rewards/reward_accuracy/std": 0.20319642424583434, "rewards/reward_format/mean": 0.0986328125, "rewards/reward_format/std": 0.008245149278081954, "sampling/importance_sampling_ratio/max": 2.4925456285476684, "sampling/importance_sampling_ratio/mean": 0.9675654768943787, "sampling/importance_sampling_ratio/min": 0.11639697067439556, "sampling/sampling_logp_difference/max": 0.8762841582298279, "sampling/sampling_logp_difference/mean": 0.004275626549497247, "step": 6700, "step_time": 8.35934489229694 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.002734375, "completions/max_length": 1415.9, "completions/max_terminated_length": 1171.0, "completions/mean_length": 161.071484375, "completions/mean_terminated_length": 155.94279937744142, "completions/min_length": 62.9, "completions/min_terminated_length": 62.9, "entropy": 0.048202042421326044, "epoch": 14.36830835117773, "frac_reward_zero_std": 0.89375, "grad_norm": 0.306640625, "learning_rate": 9.3291e-06, "loss": -0.0102, "num_tokens": 698725488.0, "reward": 1.0610742449760437, "reward_std": 0.1704031601548195, "rewards/reward_accuracy/mean": 0.961328125, "rewards/reward_accuracy/std": 0.1689431369304657, "rewards/reward_format/mean": 0.09974609538912774, "rewards/reward_format/std": 0.002825417881831527, "sampling/importance_sampling_ratio/max": 2.4895697951316835, "sampling/importance_sampling_ratio/mean": 0.9870150864124299, "sampling/importance_sampling_ratio/min": 0.06559212021529674, "sampling/sampling_logp_difference/max": 0.9583218574523926, "sampling/sampling_logp_difference/mean": 0.004141437355428934, "step": 6710, "step_time": 6.901700388704194 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001953125, "completions/max_length": 1065.3, "completions/max_terminated_length": 1035.4, "completions/mean_length": 159.498046875, "completions/mean_terminated_length": 155.843701171875, "completions/min_length": 65.8, "completions/min_terminated_length": 65.8, "entropy": 0.05064763673581183, "epoch": 14.389721627408994, "frac_reward_zero_std": 0.8875, "grad_norm": 0.7109375, "learning_rate": 9.328100000000001e-06, "loss": -0.0053, "num_tokens": 699654747.0, "reward": 1.0407812595367432, "reward_std": 0.18175090178847314, "rewards/reward_accuracy/mean": 0.941015625, "rewards/reward_accuracy/std": 0.18129537850618363, "rewards/reward_format/mean": 0.0997656263411045, "rewards/reward_format/std": 0.0020544127793982623, "sampling/importance_sampling_ratio/max": 2.3893194437026977, "sampling/importance_sampling_ratio/mean": 0.9882461786270141, "sampling/importance_sampling_ratio/min": 0.15750557705760002, "sampling/sampling_logp_difference/max": 0.9246626257896423, "sampling/sampling_logp_difference/mean": 0.004254972329363227, "step": 6720, "step_time": 5.431653641909361 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00234375, "completions/max_length": 1131.2, "completions/max_terminated_length": 722.4, "completions/mean_length": 140.2515625, "completions/mean_terminated_length": 135.77849578857422, "completions/min_length": 59.3, "completions/min_terminated_length": 59.3, "entropy": 0.03995428506750613, "epoch": 14.411134903640257, "frac_reward_zero_std": 0.91875, "grad_norm": 0.162109375, "learning_rate": 9.327100000000001e-06, "loss": -0.0113, "num_tokens": 700525263.0, "reward": 1.0806054949760437, "reward_std": 0.10497433468699455, "rewards/reward_accuracy/mean": 0.980859375, "rewards/reward_accuracy/std": 0.10345708876848221, "rewards/reward_format/mean": 0.09974609464406967, "rewards/reward_format/std": 0.002746909763664007, "sampling/importance_sampling_ratio/max": 2.577738046646118, "sampling/importance_sampling_ratio/mean": 0.9999139666557312, "sampling/importance_sampling_ratio/min": 0.1265269175171852, "sampling/sampling_logp_difference/max": 1.128899371623993, "sampling/sampling_logp_difference/mean": 0.0038805833086371423, "step": 6730, "step_time": 5.388003648995072 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003515625, "completions/max_length": 1401.7, "completions/max_terminated_length": 1353.4, "completions/mean_length": 172.315625, "completions/mean_terminated_length": 165.94374389648436, "completions/min_length": 67.9, "completions/min_terminated_length": 67.9, "entropy": 0.054124855995178224, "epoch": 14.432548179871521, "frac_reward_zero_std": 0.8875, "grad_norm": 0.8984375, "learning_rate": 9.326100000000002e-06, "loss": -0.0047, "num_tokens": 701486951.0, "reward": 1.0477343797683716, "reward_std": 0.20155228897929192, "rewards/reward_accuracy/mean": 0.948046875, "rewards/reward_accuracy/std": 0.20051689371466636, "rewards/reward_format/mean": 0.09968750029802323, "rewards/reward_format/std": 0.0024822521721944214, "sampling/importance_sampling_ratio/max": 2.50081090927124, "sampling/importance_sampling_ratio/mean": 0.9862849771976471, "sampling/importance_sampling_ratio/min": 0.09653355330228805, "sampling/sampling_logp_difference/max": 0.796488082408905, "sampling/sampling_logp_difference/mean": 0.004377066041342914, "step": 6740, "step_time": 6.638394704091479 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005859375, "completions/max_length": 1396.7, "completions/max_terminated_length": 1159.7, "completions/mean_length": 173.31484375, "completions/mean_terminated_length": 162.43994140625, "completions/min_length": 62.8, "completions/min_terminated_length": 62.8, "entropy": 0.04788156980648637, "epoch": 14.453961456102784, "frac_reward_zero_std": 0.8625, "grad_norm": 0.66796875, "learning_rate": 9.3251e-06, "loss": -0.0065, "num_tokens": 702453437.0, "reward": 1.0347461223602294, "reward_std": 0.2289656274020672, "rewards/reward_accuracy/mean": 0.93515625, "rewards/reward_accuracy/std": 0.2275612436234951, "rewards/reward_format/mean": 0.09958984553813935, "rewards/reward_format/std": 0.0033990426920354365, "sampling/importance_sampling_ratio/max": 2.6567326545715333, "sampling/importance_sampling_ratio/mean": 0.9815601229667663, "sampling/importance_sampling_ratio/min": 0.12276570070534945, "sampling/sampling_logp_difference/max": 0.8919889509677887, "sampling/sampling_logp_difference/mean": 0.0044519302900880575, "step": 6750, "step_time": 6.875123873192933 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.008203125, "completions/max_length": 1625.2, "completions/max_terminated_length": 1526.3, "completions/mean_length": 193.3015625, "completions/mean_terminated_length": 178.3720733642578, "completions/min_length": 67.9, "completions/min_terminated_length": 67.9, "entropy": 0.059805792127735916, "epoch": 14.475374732334046, "frac_reward_zero_std": 0.875, "grad_norm": 0.271484375, "learning_rate": 9.324100000000001e-06, "loss": -0.0053, "num_tokens": 703464593.0, "reward": 1.053906261920929, "reward_std": 0.1815737672150135, "rewards/reward_accuracy/mean": 0.9546875, "rewards/reward_accuracy/std": 0.17850805595517158, "rewards/reward_format/mean": 0.09921875, "rewards/reward_format/std": 0.006415222631767392, "sampling/importance_sampling_ratio/max": 2.3999356269836425, "sampling/importance_sampling_ratio/mean": 0.9843855261802673, "sampling/importance_sampling_ratio/min": 0.05708858743309975, "sampling/sampling_logp_difference/max": 0.9850981652736663, "sampling/sampling_logp_difference/mean": 0.00464180582202971, "step": 6760, "step_time": 7.977081260996056 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005859375, "completions/max_length": 1380.9, "completions/max_terminated_length": 1217.1, "completions/mean_length": 159.5421875, "completions/mean_terminated_length": 148.5271453857422, "completions/min_length": 68.9, "completions/min_terminated_length": 68.9, "entropy": 0.047534760530106725, "epoch": 14.49678800856531, "frac_reward_zero_std": 0.90625, "grad_norm": 0.42578125, "learning_rate": 9.3231e-06, "loss": -0.0095, "num_tokens": 704386733.0, "reward": 1.067753928899765, "reward_std": 0.12874576076865196, "rewards/reward_accuracy/mean": 0.968359375, "rewards/reward_accuracy/std": 0.12679504454135895, "rewards/reward_format/mean": 0.09939453154802322, "rewards/reward_format/std": 0.004106677742674947, "sampling/importance_sampling_ratio/max": 2.3815476417541506, "sampling/importance_sampling_ratio/mean": 0.9846082985401153, "sampling/importance_sampling_ratio/min": 0.12139429487287998, "sampling/sampling_logp_difference/max": 0.8017633557319641, "sampling/sampling_logp_difference/mean": 0.004203147417865693, "step": 6770, "step_time": 6.713376305581187 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.008984375, "completions/max_length": 1855.1, "completions/max_terminated_length": 1438.4, "completions/mean_length": 177.2484375, "completions/mean_terminated_length": 160.3581985473633, "completions/min_length": 70.7, "completions/min_terminated_length": 70.7, "entropy": 0.05137588568031788, "epoch": 14.518201284796573, "frac_reward_zero_std": 0.89375, "grad_norm": 0.10009765625, "learning_rate": 9.3221e-06, "loss": -0.0074, "num_tokens": 705361641.0, "reward": 1.0621484637260437, "reward_std": 0.1778969146311283, "rewards/reward_accuracy/mean": 0.962890625, "rewards/reward_accuracy/std": 0.1733149029314518, "rewards/reward_format/mean": 0.09925781339406967, "rewards/reward_format/std": 0.007206189073622226, "sampling/importance_sampling_ratio/max": 2.5341822624206545, "sampling/importance_sampling_ratio/mean": 0.9883440256118774, "sampling/importance_sampling_ratio/min": 0.03989191800355911, "sampling/sampling_logp_difference/max": 0.9524598002433777, "sampling/sampling_logp_difference/mean": 0.0041695707477629185, "step": 6780, "step_time": 8.998124456687947 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005078125, "completions/max_length": 1804.8, "completions/max_terminated_length": 1500.0, "completions/mean_length": 183.256640625, "completions/mean_terminated_length": 173.78659210205078, "completions/min_length": 67.1, "completions/min_terminated_length": 67.1, "entropy": 0.052130692871287465, "epoch": 14.539614561027838, "frac_reward_zero_std": 0.86875, "grad_norm": 0.0, "learning_rate": 9.321100000000001e-06, "loss": -0.0026, "num_tokens": 706350218.0, "reward": 1.0562304735183716, "reward_std": 0.1830668143928051, "rewards/reward_accuracy/mean": 0.956640625, "rewards/reward_accuracy/std": 0.18135236576199532, "rewards/reward_format/mean": 0.09958984479308128, "rewards/reward_format/std": 0.004562927829101682, "sampling/importance_sampling_ratio/max": 2.623989129066467, "sampling/importance_sampling_ratio/mean": 0.9823902010917663, "sampling/importance_sampling_ratio/min": 0.05765081662684679, "sampling/sampling_logp_difference/max": 1.0112012684345246, "sampling/sampling_logp_difference/mean": 0.004439583886414767, "step": 6790, "step_time": 8.824140011510462 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01015625, "completions/max_length": 1928.5, "completions/max_terminated_length": 1556.5, "completions/mean_length": 198.819921875, "completions/mean_terminated_length": 179.8333541870117, "completions/min_length": 64.1, "completions/min_terminated_length": 64.1, "entropy": 0.06357498457655311, "epoch": 14.5610278372591, "frac_reward_zero_std": 0.83125, "grad_norm": 0.212890625, "learning_rate": 9.3201e-06, "loss": -0.018, "num_tokens": 707388253.0, "reward": 1.0345898628234864, "reward_std": 0.23613991886377333, "rewards/reward_accuracy/mean": 0.935546875, "rewards/reward_accuracy/std": 0.2324522003531456, "rewards/reward_format/mean": 0.09904296919703484, "rewards/reward_format/std": 0.008377116546034813, "sampling/importance_sampling_ratio/max": 2.38506395816803, "sampling/importance_sampling_ratio/mean": 0.9799875617027283, "sampling/importance_sampling_ratio/min": 0.04198810569941998, "sampling/sampling_logp_difference/max": 0.8920201539993287, "sampling/sampling_logp_difference/mean": 0.004787348513491452, "step": 6800, "step_time": 9.37613146189542 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.009765625, "completions/max_length": 1752.7, "completions/max_terminated_length": 1701.9, "completions/mean_length": 191.073828125, "completions/mean_terminated_length": 172.89031524658202, "completions/min_length": 66.0, "completions/min_terminated_length": 66.0, "entropy": 0.058648336585611104, "epoch": 14.582441113490365, "frac_reward_zero_std": 0.875, "grad_norm": 0.8828125, "learning_rate": 9.3191e-06, "loss": 0.0042, "num_tokens": 708393018.0, "reward": 1.0425390958786012, "reward_std": 0.2117415636777878, "rewards/reward_accuracy/mean": 0.943359375, "rewards/reward_accuracy/std": 0.20881196558475495, "rewards/reward_format/mean": 0.09917968884110451, "rewards/reward_format/std": 0.0053989689098671075, "sampling/importance_sampling_ratio/max": 2.425023281574249, "sampling/importance_sampling_ratio/mean": 0.9836126267910004, "sampling/importance_sampling_ratio/min": 0.05785171533934772, "sampling/sampling_logp_difference/max": 1.0890108942985535, "sampling/sampling_logp_difference/mean": 0.004569166200235486, "step": 6810, "step_time": 8.708844897005473 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005078125, "completions/max_length": 1328.9, "completions/max_terminated_length": 1096.9, "completions/mean_length": 161.963671875, "completions/mean_terminated_length": 152.43516998291017, "completions/min_length": 67.5, "completions/min_terminated_length": 67.5, "entropy": 0.04694010503590107, "epoch": 14.603854389721628, "frac_reward_zero_std": 0.875, "grad_norm": 0.19140625, "learning_rate": 9.318100000000001e-06, "loss": -0.0075, "num_tokens": 709329581.0, "reward": 1.0520703315734863, "reward_std": 0.18057689294219018, "rewards/reward_accuracy/mean": 0.95234375, "rewards/reward_accuracy/std": 0.17945568785071372, "rewards/reward_format/mean": 0.0997265636920929, "rewards/reward_format/std": 0.0030682745389640333, "sampling/importance_sampling_ratio/max": 2.4275245547294615, "sampling/importance_sampling_ratio/mean": 0.9935319781303406, "sampling/importance_sampling_ratio/min": 0.19546640887856484, "sampling/sampling_logp_difference/max": 0.9341620683670044, "sampling/sampling_logp_difference/mean": 0.004085478186607361, "step": 6820, "step_time": 6.40264006999787 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005859375, "completions/max_length": 1515.7, "completions/max_terminated_length": 1285.2, "completions/mean_length": 176.334765625, "completions/mean_terminated_length": 165.41882781982423, "completions/min_length": 68.4, "completions/min_terminated_length": 68.4, "entropy": 0.04765942755620926, "epoch": 14.62526766595289, "frac_reward_zero_std": 0.86875, "grad_norm": 0.271484375, "learning_rate": 9.317100000000001e-06, "loss": -0.0027, "num_tokens": 710307462.0, "reward": 1.0533789277076722, "reward_std": 0.18152436271775513, "rewards/reward_accuracy/mean": 0.95390625, "rewards/reward_accuracy/std": 0.17930537238717079, "rewards/reward_format/mean": 0.09947265684604645, "rewards/reward_format/std": 0.004613026650622487, "sampling/importance_sampling_ratio/max": 2.410773825645447, "sampling/importance_sampling_ratio/mean": 0.9851631462574005, "sampling/importance_sampling_ratio/min": 0.10066772848367692, "sampling/sampling_logp_difference/max": 0.9407067060470581, "sampling/sampling_logp_difference/mean": 0.004134602076373994, "step": 6830, "step_time": 7.387078507195111 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003125, "completions/max_length": 1508.1, "completions/max_terminated_length": 1361.4, "completions/mean_length": 155.3140625, "completions/mean_terminated_length": 149.4014144897461, "completions/min_length": 60.1, "completions/min_terminated_length": 60.1, "entropy": 0.046409597457386556, "epoch": 14.646680942184155, "frac_reward_zero_std": 0.8875, "grad_norm": 0.2197265625, "learning_rate": 9.3161e-06, "loss": -0.0054, "num_tokens": 711225002.0, "reward": 1.0521679818630219, "reward_std": 0.1828407861292362, "rewards/reward_accuracy/mean": 0.95234375, "rewards/reward_accuracy/std": 0.1821254163980484, "rewards/reward_format/mean": 0.09982421919703484, "rewards/reward_format/std": 0.0023328486597165464, "sampling/importance_sampling_ratio/max": 2.542582702636719, "sampling/importance_sampling_ratio/mean": 0.9904893100261688, "sampling/importance_sampling_ratio/min": 0.17083930112421514, "sampling/sampling_logp_difference/max": 1.0114613056182862, "sampling/sampling_logp_difference/mean": 0.004324109549634159, "step": 6840, "step_time": 7.135511041100836 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0015625, "completions/max_length": 1637.1, "completions/max_terminated_length": 1513.2, "completions/mean_length": 174.569140625, "completions/mean_terminated_length": 171.65736541748046, "completions/min_length": 66.6, "completions/min_terminated_length": 66.6, "entropy": 0.05468369123991579, "epoch": 14.668094218415417, "frac_reward_zero_std": 0.86875, "grad_norm": 0.6796875, "learning_rate": 9.3151e-06, "loss": -0.0046, "num_tokens": 712192379.0, "reward": 1.0552734375, "reward_std": 0.18204848682507874, "rewards/reward_accuracy/mean": 0.95546875, "rewards/reward_accuracy/std": 0.18094336837530137, "rewards/reward_format/mean": 0.0998046875, "rewards/reward_format/std": 0.0025173229863867165, "sampling/importance_sampling_ratio/max": 2.57432861328125, "sampling/importance_sampling_ratio/mean": 0.991272646188736, "sampling/importance_sampling_ratio/min": 0.06532978974282741, "sampling/sampling_logp_difference/max": 1.016486918926239, "sampling/sampling_logp_difference/mean": 0.004380824347026646, "step": 6850, "step_time": 7.772263872998883 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.002734375, "completions/max_length": 1540.6, "completions/max_terminated_length": 1498.4, "completions/mean_length": 160.26015625, "completions/mean_terminated_length": 155.16331329345704, "completions/min_length": 62.9, "completions/min_terminated_length": 62.9, "entropy": 0.049659232539124784, "epoch": 14.689507494646682, "frac_reward_zero_std": 0.8375, "grad_norm": 0.12158203125, "learning_rate": 9.314100000000001e-06, "loss": -0.0084, "num_tokens": 713118965.0, "reward": 1.057480478286743, "reward_std": 0.18724769726395607, "rewards/reward_accuracy/mean": 0.9578125, "rewards/reward_accuracy/std": 0.1856343537569046, "rewards/reward_format/mean": 0.09966797009110451, "rewards/reward_format/std": 0.0032466852571815252, "sampling/importance_sampling_ratio/max": 2.4764386892318724, "sampling/importance_sampling_ratio/mean": 0.9902539730072022, "sampling/importance_sampling_ratio/min": 0.1311547640711069, "sampling/sampling_logp_difference/max": 0.8617129027843475, "sampling/sampling_logp_difference/mean": 0.004276928049512208, "step": 6860, "step_time": 7.266769448510604 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003515625, "completions/max_length": 1335.2, "completions/max_terminated_length": 778.3, "completions/mean_length": 144.21640625, "completions/mean_terminated_length": 137.51972579956055, "completions/min_length": 62.7, "completions/min_terminated_length": 62.7, "entropy": 0.04132047772873193, "epoch": 14.710920770877944, "frac_reward_zero_std": 0.90625, "grad_norm": 0.2080078125, "learning_rate": 9.3131e-06, "loss": -0.0, "num_tokens": 713999151.0, "reward": 1.071093773841858, "reward_std": 0.15160216987133027, "rewards/reward_accuracy/mean": 0.971484375, "rewards/reward_accuracy/std": 0.14938208609819412, "rewards/reward_format/mean": 0.09960937649011611, "rewards/reward_format/std": 0.004186975210905075, "sampling/importance_sampling_ratio/max": 2.419086515903473, "sampling/importance_sampling_ratio/mean": 0.9906135618686676, "sampling/importance_sampling_ratio/min": 0.12863239720463754, "sampling/sampling_logp_difference/max": 0.844602370262146, "sampling/sampling_logp_difference/mean": 0.0038484664866700767, "step": 6870, "step_time": 6.438652803108562 }, { "clip_ratio/high_max": 4.581474931910634e-05, "clip_ratio/high_mean": 5.726843664888293e-06, "clip_ratio/low_mean": 2.3057895532474502e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 8.032633218135743e-06, "completions/clipped_ratio": 0.009375, "completions/max_length": 1329.5, "completions/max_terminated_length": 1098.0, "completions/mean_length": 154.596484375, "completions/mean_terminated_length": 136.7020263671875, "completions/min_length": 64.5, "completions/min_terminated_length": 64.5, "entropy": 0.04567404547706246, "epoch": 14.732334047109207, "frac_reward_zero_std": 0.91875, "grad_norm": 0.390625, "learning_rate": 9.3121e-06, "loss": -0.0064, "num_tokens": 714912134.0, "reward": 1.0499218940734862, "reward_std": 0.1872471198439598, "rewards/reward_accuracy/mean": 0.95078125, "rewards/reward_accuracy/std": 0.1842402160167694, "rewards/reward_format/mean": 0.09914062693715095, "rewards/reward_format/std": 0.0051398361567407845, "sampling/importance_sampling_ratio/max": 2.5863495588302614, "sampling/importance_sampling_ratio/mean": 0.9920466840267181, "sampling/importance_sampling_ratio/min": 0.1332883623894304, "sampling/sampling_logp_difference/max": 0.8809935688972473, "sampling/sampling_logp_difference/mean": 0.004025020892731846, "step": 6880, "step_time": 6.81902347971045 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.008203125, "completions/max_length": 1434.3, "completions/max_terminated_length": 1267.5, "completions/mean_length": 175.79453125, "completions/mean_terminated_length": 160.5271469116211, "completions/min_length": 66.9, "completions/min_terminated_length": 66.9, "entropy": 0.05293139966670424, "epoch": 14.753747323340471, "frac_reward_zero_std": 0.85625, "grad_norm": 0.46875, "learning_rate": 9.311100000000001e-06, "loss": -0.0028, "num_tokens": 715883992.0, "reward": 1.0375976860523224, "reward_std": 0.1968364879488945, "rewards/reward_accuracy/mean": 0.93828125, "rewards/reward_accuracy/std": 0.19473396241664886, "rewards/reward_format/mean": 0.09931640774011612, "rewards/reward_format/std": 0.005867378716357052, "sampling/importance_sampling_ratio/max": 2.527586054801941, "sampling/importance_sampling_ratio/mean": 0.9760892212390899, "sampling/importance_sampling_ratio/min": 0.08030531257390976, "sampling/sampling_logp_difference/max": 0.9022899329662323, "sampling/sampling_logp_difference/mean": 0.004367918148636818, "step": 6890, "step_time": 7.089630370089435 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0046875, "completions/max_length": 1569.3, "completions/max_terminated_length": 1201.9, "completions/mean_length": 153.66875, "completions/mean_terminated_length": 144.7492462158203, "completions/min_length": 64.9, "completions/min_terminated_length": 64.9, "entropy": 0.045841248147189616, "epoch": 14.775160599571734, "frac_reward_zero_std": 0.90625, "grad_norm": 0.337890625, "learning_rate": 9.310100000000001e-06, "loss": -0.0061, "num_tokens": 716792936.0, "reward": 1.0758008122444154, "reward_std": 0.12053357511758804, "rewards/reward_accuracy/mean": 0.976171875, "rewards/reward_accuracy/std": 0.11822620779275894, "rewards/reward_format/mean": 0.09962890744209289, "rewards/reward_format/std": 0.0043895982671529055, "sampling/importance_sampling_ratio/max": 2.3242186546325683, "sampling/importance_sampling_ratio/mean": 0.9872884154319763, "sampling/importance_sampling_ratio/min": 0.07168888701125979, "sampling/sampling_logp_difference/max": 0.8753412663936615, "sampling/sampling_logp_difference/mean": 0.004187392280437052, "step": 6900, "step_time": 7.4654080808919385 }, { "clip_ratio/high_max": 6.008652417222038e-06, "clip_ratio/high_mean": 7.510815521527548e-07, "clip_ratio/low_mean": 1.0030098565039225e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 1.7540914086566771e-06, "completions/clipped_ratio": 0.0078125, "completions/max_length": 1573.3, "completions/max_terminated_length": 1245.5, "completions/mean_length": 166.3265625, "completions/mean_terminated_length": 151.68939819335938, "completions/min_length": 68.2, "completions/min_terminated_length": 68.2, "entropy": 0.04777605349663645, "epoch": 14.796573875802999, "frac_reward_zero_std": 0.8625, "grad_norm": 0.16015625, "learning_rate": 9.3091e-06, "loss": -0.0089, "num_tokens": 717737148.0, "reward": 1.0595312535762786, "reward_std": 0.15864457711577415, "rewards/reward_accuracy/mean": 0.96015625, "rewards/reward_accuracy/std": 0.1561991810798645, "rewards/reward_format/mean": 0.09937500059604645, "rewards/reward_format/std": 0.0045710423495620486, "sampling/importance_sampling_ratio/max": 2.582355499267578, "sampling/importance_sampling_ratio/mean": 0.9829286515712738, "sampling/importance_sampling_ratio/min": 0.06416480354964733, "sampling/sampling_logp_difference/max": 1.0201361656188965, "sampling/sampling_logp_difference/mean": 0.0042577971471473575, "step": 6910, "step_time": 7.499621879585902 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 4.218713229420246e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 4.218713229420246e-06, "completions/clipped_ratio": 0.01328125, "completions/max_length": 1752.5, "completions/max_terminated_length": 1594.3, "completions/mean_length": 198.680859375, "completions/mean_terminated_length": 173.93779602050782, "completions/min_length": 61.4, "completions/min_terminated_length": 61.4, "entropy": 0.05856590850744396, "epoch": 14.817987152034261, "frac_reward_zero_std": 0.85, "grad_norm": 0.283203125, "learning_rate": 9.308100000000002e-06, "loss": -0.0095, "num_tokens": 718767659.0, "reward": 1.0412695467472077, "reward_std": 0.21267313584685327, "rewards/reward_accuracy/mean": 0.9421875, "rewards/reward_accuracy/std": 0.20965168699622155, "rewards/reward_format/mean": 0.09908203184604644, "rewards/reward_format/std": 0.006734621408395469, "sampling/importance_sampling_ratio/max": 2.337042820453644, "sampling/importance_sampling_ratio/mean": 0.9630387306213379, "sampling/importance_sampling_ratio/min": 0.07172191813588143, "sampling/sampling_logp_difference/max": 1.482088303565979, "sampling/sampling_logp_difference/mean": 0.004217699752189219, "step": 6920, "step_time": 8.662817791194538 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.002734375, "completions/max_length": 1150.1, "completions/max_terminated_length": 1049.5, "completions/mean_length": 164.715625, "completions/mean_terminated_length": 159.65038452148437, "completions/min_length": 68.2, "completions/min_terminated_length": 68.2, "entropy": 0.047930567129515114, "epoch": 14.839400428265524, "frac_reward_zero_std": 0.89375, "grad_norm": 0.0, "learning_rate": 9.307100000000001e-06, "loss": -0.0089, "num_tokens": 719707251.0, "reward": 1.063730502128601, "reward_std": 0.14432359337806702, "rewards/reward_accuracy/mean": 0.9640625, "rewards/reward_accuracy/std": 0.14294391945004464, "rewards/reward_format/mean": 0.09966797009110451, "rewards/reward_format/std": 0.003089072764851153, "sampling/importance_sampling_ratio/max": 2.4416210412979127, "sampling/importance_sampling_ratio/mean": 0.9772298991680145, "sampling/importance_sampling_ratio/min": 0.10648121535778046, "sampling/sampling_logp_difference/max": 0.8414790272712708, "sampling/sampling_logp_difference/mean": 0.004202272836118936, "step": 6930, "step_time": 5.662771793900174 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.010546875, "completions/max_length": 1348.8, "completions/max_terminated_length": 1256.2, "completions/mean_length": 184.986328125, "completions/mean_terminated_length": 165.51337890625, "completions/min_length": 66.6, "completions/min_terminated_length": 66.6, "entropy": 0.049998812912963334, "epoch": 14.860813704496788, "frac_reward_zero_std": 0.86875, "grad_norm": 0.6328125, "learning_rate": 9.3061e-06, "loss": -0.0031, "num_tokens": 720698896.0, "reward": 1.0401562809944154, "reward_std": 0.1960241176187992, "rewards/reward_accuracy/mean": 0.941015625, "rewards/reward_accuracy/std": 0.19418873265385628, "rewards/reward_format/mean": 0.09914062693715095, "rewards/reward_format/std": 0.005257561942562461, "sampling/importance_sampling_ratio/max": 2.523267221450806, "sampling/importance_sampling_ratio/mean": 0.9836653709411621, "sampling/importance_sampling_ratio/min": 0.16600602567195893, "sampling/sampling_logp_difference/max": 0.9210699498653412, "sampling/sampling_logp_difference/mean": 0.003837446542456746, "step": 6940, "step_time": 6.834408964891918 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005078125, "completions/max_length": 1254.8, "completions/max_terminated_length": 1180.1, "completions/mean_length": 164.115625, "completions/mean_terminated_length": 154.6317352294922, "completions/min_length": 66.4, "completions/min_terminated_length": 66.4, "entropy": 0.049765473767183724, "epoch": 14.882226980728051, "frac_reward_zero_std": 0.875, "grad_norm": 0.2041015625, "learning_rate": 9.3051e-06, "loss": -0.0069, "num_tokens": 721632264.0, "reward": 1.0456445574760438, "reward_std": 0.20791090577840804, "rewards/reward_accuracy/mean": 0.94609375, "rewards/reward_accuracy/std": 0.20636386722326278, "rewards/reward_format/mean": 0.09955078214406968, "rewards/reward_format/std": 0.003733869385905564, "sampling/importance_sampling_ratio/max": 2.5162373304367067, "sampling/importance_sampling_ratio/mean": 0.9866890072822571, "sampling/importance_sampling_ratio/min": 0.19599893614649772, "sampling/sampling_logp_difference/max": 0.8081388592720031, "sampling/sampling_logp_difference/mean": 0.00412679030559957, "step": 6950, "step_time": 6.018181031901622 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005859375, "completions/max_length": 1302.0, "completions/max_terminated_length": 1135.4, "completions/mean_length": 167.32890625, "completions/mean_terminated_length": 156.3629409790039, "completions/min_length": 67.4, "completions/min_terminated_length": 67.4, "entropy": 0.052457149513065814, "epoch": 14.903640256959315, "frac_reward_zero_std": 0.90625, "grad_norm": 0.2451171875, "learning_rate": 9.3041e-06, "loss": -0.0047, "num_tokens": 722576322.0, "reward": 1.0509765803813935, "reward_std": 0.1524946168065071, "rewards/reward_accuracy/mean": 0.9515625, "rewards/reward_accuracy/std": 0.15025750994682313, "rewards/reward_format/mean": 0.09941406399011612, "rewards/reward_format/std": 0.005224736337549984, "sampling/importance_sampling_ratio/max": 2.469403862953186, "sampling/importance_sampling_ratio/mean": 0.9733265995979309, "sampling/importance_sampling_ratio/min": 0.17779694721102715, "sampling/sampling_logp_difference/max": 0.995378029346466, "sampling/sampling_logp_difference/mean": 0.004421074618585407, "step": 6960, "step_time": 6.406590378595865 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.011328125, "completions/max_length": 1694.6, "completions/max_terminated_length": 1372.1, "completions/mean_length": 184.8109375, "completions/mean_terminated_length": 163.73745040893556, "completions/min_length": 69.6, "completions/min_terminated_length": 69.6, "entropy": 0.05184603310190141, "epoch": 14.925053533190578, "frac_reward_zero_std": 0.86875, "grad_norm": 0.154296875, "learning_rate": 9.3031e-06, "loss": -0.0009, "num_tokens": 723571998.0, "reward": 1.0423047125339509, "reward_std": 0.20992266461253167, "rewards/reward_accuracy/mean": 0.943359375, "rewards/reward_accuracy/std": 0.20608996450901032, "rewards/reward_format/mean": 0.09894531294703483, "rewards/reward_format/std": 0.007921843277290463, "sampling/importance_sampling_ratio/max": 2.4508008480072023, "sampling/importance_sampling_ratio/mean": 0.9726531744003296, "sampling/importance_sampling_ratio/min": 0.06938181854784489, "sampling/sampling_logp_difference/max": 0.9340942025184631, "sampling/sampling_logp_difference/mean": 0.004172221221961081, "step": 6970, "step_time": 8.46364116849145 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005078125, "completions/max_length": 1560.3, "completions/max_terminated_length": 1060.6, "completions/mean_length": 169.25859375, "completions/mean_terminated_length": 159.80970916748046, "completions/min_length": 67.7, "completions/min_terminated_length": 67.7, "entropy": 0.050724564422853294, "epoch": 14.946466809421842, "frac_reward_zero_std": 0.875, "grad_norm": 0.2578125, "learning_rate": 9.3021e-06, "loss": -0.0049, "num_tokens": 724521892.0, "reward": 1.0468359589576721, "reward_std": 0.19379420801997185, "rewards/reward_accuracy/mean": 0.947265625, "rewards/reward_accuracy/std": 0.19200569912791252, "rewards/reward_format/mean": 0.09957031309604644, "rewards/reward_format/std": 0.00472977957688272, "sampling/importance_sampling_ratio/max": 2.4263622999191283, "sampling/importance_sampling_ratio/mean": 0.9787682950496673, "sampling/importance_sampling_ratio/min": 0.14150940403342246, "sampling/sampling_logp_difference/max": 0.8894036054611206, "sampling/sampling_logp_difference/mean": 0.004207684099674225, "step": 6980, "step_time": 7.456690014290507 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.012109375, "completions/max_length": 1259.3, "completions/max_terminated_length": 1136.7, "completions/mean_length": 172.162109375, "completions/mean_terminated_length": 149.67171325683594, "completions/min_length": 62.8, "completions/min_terminated_length": 62.8, "entropy": 0.05063201270531863, "epoch": 14.967880085653105, "frac_reward_zero_std": 0.89375, "grad_norm": 0.130859375, "learning_rate": 9.301100000000001e-06, "loss": -0.0126, "num_tokens": 725479651.0, "reward": 1.061796885728836, "reward_std": 0.14739519730210304, "rewards/reward_accuracy/mean": 0.962890625, "rewards/reward_accuracy/std": 0.1440330721437931, "rewards/reward_format/mean": 0.09890625029802322, "rewards/reward_format/std": 0.004262604913674295, "sampling/importance_sampling_ratio/max": 2.4646072506904604, "sampling/importance_sampling_ratio/mean": 0.9782161056995392, "sampling/importance_sampling_ratio/min": 0.09269896261394024, "sampling/sampling_logp_difference/max": 0.8845544695854187, "sampling/sampling_logp_difference/mean": 0.004151504789479077, "step": 6990, "step_time": 6.406637724285247 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.008984375, "completions/max_length": 1422.7, "completions/max_terminated_length": 1162.5, "completions/mean_length": 175.2484375, "completions/mean_terminated_length": 158.4126754760742, "completions/min_length": 65.5, "completions/min_terminated_length": 65.5, "entropy": 0.05517679611220956, "epoch": 14.989293361884368, "frac_reward_zero_std": 0.875, "grad_norm": 0.267578125, "learning_rate": 9.300100000000001e-06, "loss": -0.0187, "num_tokens": 726448735.0, "reward": 1.0540625333786011, "reward_std": 0.17826180458068847, "rewards/reward_accuracy/mean": 0.9546875, "rewards/reward_accuracy/std": 0.17551805153489114, "rewards/reward_format/mean": 0.09937500208616257, "rewards/reward_format/std": 0.0050549020525068045, "sampling/importance_sampling_ratio/max": 2.6001256823539736, "sampling/importance_sampling_ratio/mean": 0.9950046300888061, "sampling/importance_sampling_ratio/min": 0.10333430608734488, "sampling/sampling_logp_difference/max": 0.9480283737182618, "sampling/sampling_logp_difference/mean": 0.004263513907790184, "step": 7000, "step_time": 6.947675809694919 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00234375, "completions/max_length": 1479.3, "completions/max_terminated_length": 1385.5, "completions/mean_length": 152.048046875, "completions/mean_terminated_length": 147.67642517089843, "completions/min_length": 64.1, "completions/min_terminated_length": 64.1, "entropy": 0.04377060746774077, "epoch": 15.010706638115632, "frac_reward_zero_std": 0.8875, "grad_norm": 0.298828125, "learning_rate": 9.2991e-06, "loss": -0.0122, "num_tokens": 727351098.0, "reward": 1.068847692012787, "reward_std": 0.13495956510305404, "rewards/reward_accuracy/mean": 0.969140625, "rewards/reward_accuracy/std": 0.1338830128312111, "rewards/reward_format/mean": 0.09970703348517418, "rewards/reward_format/std": 0.002646519849076867, "sampling/importance_sampling_ratio/max": 2.3728976011276246, "sampling/importance_sampling_ratio/mean": 0.9925214767456054, "sampling/importance_sampling_ratio/min": 0.15332801546901464, "sampling/sampling_logp_difference/max": 0.978899359703064, "sampling/sampling_logp_difference/mean": 0.00390852652490139, "step": 7010, "step_time": 7.069137014690204 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 1187.0, "completions/max_terminated_length": 1042.5, "completions/mean_length": 158.3203125, "completions/mean_terminated_length": 151.09336700439454, "completions/min_length": 66.2, "completions/min_terminated_length": 66.2, "entropy": 0.04392353205475956, "epoch": 15.032119914346895, "frac_reward_zero_std": 0.90625, "grad_norm": 0.10595703125, "learning_rate": 9.298100000000002e-06, "loss": -0.0034, "num_tokens": 728273902.0, "reward": 1.060898447036743, "reward_std": 0.13938554227352143, "rewards/reward_accuracy/mean": 0.961328125, "rewards/reward_accuracy/std": 0.13785515651106833, "rewards/reward_format/mean": 0.09957031384110451, "rewards/reward_format/std": 0.0034344091545790434, "sampling/importance_sampling_ratio/max": 2.609756660461426, "sampling/importance_sampling_ratio/mean": 0.9871224820613861, "sampling/importance_sampling_ratio/min": 0.21139651760458947, "sampling/sampling_logp_difference/max": 0.9376499235630036, "sampling/sampling_logp_difference/mean": 0.003827275149524212, "step": 7020, "step_time": 5.893394995000563 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.002734375, "completions/max_length": 1275.0, "completions/max_terminated_length": 1134.0, "completions/mean_length": 164.88984375, "completions/mean_terminated_length": 159.8415496826172, "completions/min_length": 64.0, "completions/min_terminated_length": 64.0, "entropy": 0.04841146576218307, "epoch": 15.05353319057816, "frac_reward_zero_std": 0.88125, "grad_norm": 0.0, "learning_rate": 9.297100000000001e-06, "loss": -0.0118, "num_tokens": 729214308.0, "reward": 1.0384570598602294, "reward_std": 0.19093629121780395, "rewards/reward_accuracy/mean": 0.938671875, "rewards/reward_accuracy/std": 0.19029095619916916, "rewards/reward_format/mean": 0.09978515729308128, "rewards/reward_format/std": 0.0023854749975726008, "sampling/importance_sampling_ratio/max": 2.5343018531799317, "sampling/importance_sampling_ratio/mean": 0.9798329591751098, "sampling/importance_sampling_ratio/min": 0.11001985780894756, "sampling/sampling_logp_difference/max": 0.9716536283493042, "sampling/sampling_logp_difference/mean": 0.004281904618255794, "step": 7030, "step_time": 6.216698204504792 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00625, "completions/max_length": 1636.2, "completions/max_terminated_length": 1288.7, "completions/mean_length": 174.783984375, "completions/mean_terminated_length": 163.11656341552734, "completions/min_length": 62.5, "completions/min_terminated_length": 62.5, "entropy": 0.05513442165683955, "epoch": 15.074946466809422, "frac_reward_zero_std": 0.85625, "grad_norm": 0.5390625, "learning_rate": 9.2961e-06, "loss": -0.0058, "num_tokens": 730184251.0, "reward": 1.060410165786743, "reward_std": 0.17317760214209557, "rewards/reward_accuracy/mean": 0.9609375, "rewards/reward_accuracy/std": 0.17056833133101462, "rewards/reward_format/mean": 0.09947265610098839, "rewards/reward_format/std": 0.005417351028881967, "sampling/importance_sampling_ratio/max": 2.6028765439987183, "sampling/importance_sampling_ratio/mean": 0.9830532193183898, "sampling/importance_sampling_ratio/min": 0.1183671735227108, "sampling/sampling_logp_difference/max": 0.9968079447746276, "sampling/sampling_logp_difference/mean": 0.0045206229202449325, "step": 7040, "step_time": 7.878791802196065 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003125, "completions/max_length": 1280.1, "completions/max_terminated_length": 1215.6, "completions/mean_length": 160.591796875, "completions/mean_terminated_length": 154.8308868408203, "completions/min_length": 65.5, "completions/min_terminated_length": 65.5, "entropy": 0.0474294290645048, "epoch": 15.096359743040685, "frac_reward_zero_std": 0.9, "grad_norm": 0.498046875, "learning_rate": 9.2951e-06, "loss": -0.0055, "num_tokens": 731107430.0, "reward": 1.0504101753234862, "reward_std": 0.1587141551077366, "rewards/reward_accuracy/mean": 0.95078125, "rewards/reward_accuracy/std": 0.1576414167881012, "rewards/reward_format/mean": 0.09962890669703484, "rewards/reward_format/std": 0.003290347219444811, "sampling/importance_sampling_ratio/max": 2.381807041168213, "sampling/importance_sampling_ratio/mean": 0.9935790538787842, "sampling/importance_sampling_ratio/min": 0.18346887044608592, "sampling/sampling_logp_difference/max": 0.8020280063152313, "sampling/sampling_logp_difference/mean": 0.004237801721319556, "step": 7050, "step_time": 6.343988282603095 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005859375, "completions/max_length": 1661.9, "completions/max_terminated_length": 1467.0, "completions/mean_length": 180.41640625, "completions/mean_terminated_length": 169.48878021240233, "completions/min_length": 59.0, "completions/min_terminated_length": 59.0, "entropy": 0.05385971521027386, "epoch": 15.117773019271949, "frac_reward_zero_std": 0.8875, "grad_norm": 0.18359375, "learning_rate": 9.2941e-06, "loss": -0.0064, "num_tokens": 732091904.0, "reward": 1.0300000131130218, "reward_std": 0.21643896996974946, "rewards/reward_accuracy/mean": 0.93046875, "rewards/reward_accuracy/std": 0.21463593393564223, "rewards/reward_format/mean": 0.09953125044703484, "rewards/reward_format/std": 0.004288564575836063, "sampling/importance_sampling_ratio/max": 2.507221531867981, "sampling/importance_sampling_ratio/mean": 0.9931994140148163, "sampling/importance_sampling_ratio/min": 0.09779414632357657, "sampling/sampling_logp_difference/max": 1.0071120381355285, "sampling/sampling_logp_difference/mean": 0.00430749305523932, "step": 7060, "step_time": 8.159795534599107 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005078125, "completions/max_length": 1890.5, "completions/max_terminated_length": 1609.5, "completions/mean_length": 167.444140625, "completions/mean_terminated_length": 157.86988067626953, "completions/min_length": 67.9, "completions/min_terminated_length": 67.9, "entropy": 0.04781922153197229, "epoch": 15.139186295503212, "frac_reward_zero_std": 0.85, "grad_norm": 0.486328125, "learning_rate": 9.293100000000001e-06, "loss": -0.0093, "num_tokens": 733037521.0, "reward": 1.0669921934604645, "reward_std": 0.15988533347845077, "rewards/reward_accuracy/mean": 0.967578125, "rewards/reward_accuracy/std": 0.15655581429600715, "rewards/reward_format/mean": 0.09941406399011612, "rewards/reward_format/std": 0.00637006398756057, "sampling/importance_sampling_ratio/max": 2.685281205177307, "sampling/importance_sampling_ratio/mean": 0.9929550945758819, "sampling/importance_sampling_ratio/min": 0.08799112662672996, "sampling/sampling_logp_difference/max": 0.9770249545574188, "sampling/sampling_logp_difference/mean": 0.004301597457379102, "step": 7070, "step_time": 8.887216113394242 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005078125, "completions/max_length": 1752.7, "completions/max_terminated_length": 1379.6, "completions/mean_length": 174.14375, "completions/mean_terminated_length": 164.65306243896484, "completions/min_length": 61.9, "completions/min_terminated_length": 61.9, "entropy": 0.052217196812853216, "epoch": 15.160599571734476, "frac_reward_zero_std": 0.85625, "grad_norm": 0.47265625, "learning_rate": 9.2921e-06, "loss": -0.0092, "num_tokens": 734005985.0, "reward": 1.050664085149765, "reward_std": 0.18426819145679474, "rewards/reward_accuracy/mean": 0.951171875, "rewards/reward_accuracy/std": 0.18196085169911386, "rewards/reward_format/mean": 0.0994921900331974, "rewards/reward_format/std": 0.005565527617000044, "sampling/importance_sampling_ratio/max": 2.4482095718383787, "sampling/importance_sampling_ratio/mean": 0.9863419651985168, "sampling/importance_sampling_ratio/min": 0.0424001894891262, "sampling/sampling_logp_difference/max": 0.9047368764877319, "sampling/sampling_logp_difference/mean": 0.004326129984110594, "step": 7080, "step_time": 8.235323837515898 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 1379.4, "completions/max_terminated_length": 1190.7, "completions/mean_length": 161.51953125, "completions/mean_terminated_length": 154.16651458740233, "completions/min_length": 65.6, "completions/min_terminated_length": 65.6, "entropy": 0.045991945639252664, "epoch": 15.182012847965739, "frac_reward_zero_std": 0.89375, "grad_norm": 0.5234375, "learning_rate": 9.2911e-06, "loss": -0.004, "num_tokens": 734934739.0, "reward": 1.058613306283951, "reward_std": 0.15692218393087387, "rewards/reward_accuracy/mean": 0.958984375, "rewards/reward_accuracy/std": 0.15548494309186936, "rewards/reward_format/mean": 0.09962890818715095, "rewards/reward_format/std": 0.0039509717840701345, "sampling/importance_sampling_ratio/max": 2.4033055543899535, "sampling/importance_sampling_ratio/mean": 0.9886721014976502, "sampling/importance_sampling_ratio/min": 0.14339804518967866, "sampling/sampling_logp_difference/max": 1.1173086047172547, "sampling/sampling_logp_difference/mean": 0.0040568567113950845, "step": 7090, "step_time": 6.759345568303251 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 1321.1, "completions/max_terminated_length": 929.8, "completions/mean_length": 156.040625, "completions/mean_terminated_length": 148.69303283691406, "completions/min_length": 63.0, "completions/min_terminated_length": 63.0, "entropy": 0.04601462753489614, "epoch": 15.203426124197001, "frac_reward_zero_std": 0.89375, "grad_norm": 0.0, "learning_rate": 9.290100000000001e-06, "loss": -0.0035, "num_tokens": 735843627.0, "reward": 1.0434570550918578, "reward_std": 0.18292034193873405, "rewards/reward_accuracy/mean": 0.94375, "rewards/reward_accuracy/std": 0.18124310448765754, "rewards/reward_format/mean": 0.09970703274011612, "rewards/reward_format/std": 0.0033390013268217444, "sampling/importance_sampling_ratio/max": 2.4161807894706726, "sampling/importance_sampling_ratio/mean": 0.990520441532135, "sampling/importance_sampling_ratio/min": 0.08764507174491883, "sampling/sampling_logp_difference/max": 0.949564266204834, "sampling/sampling_logp_difference/mean": 0.004205293790437281, "step": 7100, "step_time": 6.326194966211915 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001953125, "completions/max_length": 1385.6, "completions/max_terminated_length": 1025.8, "completions/mean_length": 149.7140625, "completions/mean_terminated_length": 146.0130630493164, "completions/min_length": 63.7, "completions/min_terminated_length": 63.7, "entropy": 0.04210801017470658, "epoch": 15.224839400428266, "frac_reward_zero_std": 0.9375, "grad_norm": 0.158203125, "learning_rate": 9.2891e-06, "loss": -0.0009, "num_tokens": 736741583.0, "reward": 1.063476574420929, "reward_std": 0.1515470723854378, "rewards/reward_accuracy/mean": 0.963671875, "rewards/reward_accuracy/std": 0.15024069249629973, "rewards/reward_format/mean": 0.0998046875, "rewards/reward_format/std": 0.0023282783571630717, "sampling/importance_sampling_ratio/max": 2.4754985928535462, "sampling/importance_sampling_ratio/mean": 0.9936016082763672, "sampling/importance_sampling_ratio/min": 0.18255412993021308, "sampling/sampling_logp_difference/max": 0.8553207576274872, "sampling/sampling_logp_difference/mean": 0.003890295117162168, "step": 7110, "step_time": 6.517715397902066 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 1225.3, "completions/max_terminated_length": 1063.4, "completions/mean_length": 151.100390625, "completions/mean_terminated_length": 143.7102249145508, "completions/min_length": 63.6, "completions/min_terminated_length": 63.6, "entropy": 0.04442235855385661, "epoch": 15.246252676659529, "frac_reward_zero_std": 0.88125, "grad_norm": 0.1455078125, "learning_rate": 9.288100000000002e-06, "loss": 0.0006, "num_tokens": 737643792.0, "reward": 1.0774218797683717, "reward_std": 0.12939444705843925, "rewards/reward_accuracy/mean": 0.977734375, "rewards/reward_accuracy/std": 0.12736781910061837, "rewards/reward_format/mean": 0.09968750029802323, "rewards/reward_format/std": 0.003136378456838429, "sampling/importance_sampling_ratio/max": 2.270175075531006, "sampling/importance_sampling_ratio/mean": 0.9810038566589355, "sampling/importance_sampling_ratio/min": 0.1359750010073185, "sampling/sampling_logp_difference/max": 1.1350075721740722, "sampling/sampling_logp_difference/mean": 0.004018250922672451, "step": 7120, "step_time": 6.144538417304284 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00859375, "completions/max_length": 1740.2, "completions/max_terminated_length": 1542.2, "completions/mean_length": 187.9078125, "completions/mean_terminated_length": 171.87345275878906, "completions/min_length": 67.8, "completions/min_terminated_length": 67.8, "entropy": 0.0553223718656227, "epoch": 15.267665952890793, "frac_reward_zero_std": 0.875, "grad_norm": 0.1494140625, "learning_rate": 9.287100000000001e-06, "loss": -0.0093, "num_tokens": 738644596.0, "reward": 1.0465820550918579, "reward_std": 0.20307109355926514, "rewards/reward_accuracy/mean": 0.947265625, "rewards/reward_accuracy/std": 0.2005542039871216, "rewards/reward_format/mean": 0.09931640848517417, "rewards/reward_format/std": 0.005809655506163835, "sampling/importance_sampling_ratio/max": 2.4885475754737856, "sampling/importance_sampling_ratio/mean": 0.9805585384368897, "sampling/importance_sampling_ratio/min": 0.06283389553427696, "sampling/sampling_logp_difference/max": 0.8790978908538818, "sampling/sampling_logp_difference/mean": 0.004365371074527502, "step": 7130, "step_time": 8.349189929696148 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.006640625, "completions/max_length": 1672.4, "completions/max_terminated_length": 1571.7, "completions/mean_length": 171.075390625, "completions/mean_terminated_length": 158.59072723388672, "completions/min_length": 63.3, "completions/min_terminated_length": 63.3, "entropy": 0.05066291000694036, "epoch": 15.289079229122056, "frac_reward_zero_std": 0.875, "grad_norm": 0.0732421875, "learning_rate": 9.2861e-06, "loss": -0.0088, "num_tokens": 739597493.0, "reward": 1.0411133170127869, "reward_std": 0.21928545087575912, "rewards/reward_accuracy/mean": 0.941796875, "rewards/reward_accuracy/std": 0.21701414063572882, "rewards/reward_format/mean": 0.09931640848517417, "rewards/reward_format/std": 0.005614688131026923, "sampling/importance_sampling_ratio/max": 2.3813472986221313, "sampling/importance_sampling_ratio/mean": 0.9923224091529846, "sampling/importance_sampling_ratio/min": 0.07906158193945885, "sampling/sampling_logp_difference/max": 0.9743347644805909, "sampling/sampling_logp_difference/mean": 0.00431519178673625, "step": 7140, "step_time": 8.117679375308217 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 816.7, "completions/max_terminated_length": 816.7, "completions/mean_length": 148.15, "completions/mean_terminated_length": 148.15, "completions/min_length": 68.1, "completions/min_terminated_length": 68.1, "entropy": 0.04116584658622742, "epoch": 15.310492505353318, "frac_reward_zero_std": 0.9, "grad_norm": 0.0, "learning_rate": 9.2851e-06, "loss": -0.0028, "num_tokens": 740495429.0, "reward": 1.053886741399765, "reward_std": 0.15682606920599937, "rewards/reward_accuracy/mean": 0.95390625, "rewards/reward_accuracy/std": 0.15678301379084586, "rewards/reward_format/mean": 0.09998046979308128, "rewards/reward_format/std": 0.0003125000046566129, "sampling/importance_sampling_ratio/max": 2.4022382736206054, "sampling/importance_sampling_ratio/mean": 0.9966201543807983, "sampling/importance_sampling_ratio/min": 0.22219525277614594, "sampling/sampling_logp_difference/max": 0.831229853630066, "sampling/sampling_logp_difference/mean": 0.0039053149288520218, "step": 7150, "step_time": 4.165067574122804 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00546875, "completions/max_length": 1440.3, "completions/max_terminated_length": 1212.6, "completions/mean_length": 158.1046875, "completions/mean_terminated_length": 147.8651565551758, "completions/min_length": 62.8, "completions/min_terminated_length": 62.8, "entropy": 0.04496923265978694, "epoch": 15.331905781584583, "frac_reward_zero_std": 0.9, "grad_norm": 0.0, "learning_rate": 9.2841e-06, "loss": -0.0023, "num_tokens": 741416241.0, "reward": 1.063554698228836, "reward_std": 0.13689906373620034, "rewards/reward_accuracy/mean": 0.9640625, "rewards/reward_accuracy/std": 0.1342928372323513, "rewards/reward_format/mean": 0.09949218854308128, "rewards/reward_format/std": 0.004393647401593625, "sampling/importance_sampling_ratio/max": 2.3695493221282957, "sampling/importance_sampling_ratio/mean": 0.993875014781952, "sampling/importance_sampling_ratio/min": 0.16959349098615348, "sampling/sampling_logp_difference/max": 0.8064995765686035, "sampling/sampling_logp_difference/mean": 0.003776929946616292, "step": 7160, "step_time": 7.117355005998979 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.008203125, "completions/max_length": 1327.1, "completions/max_terminated_length": 1158.7, "completions/mean_length": 167.53984375, "completions/mean_terminated_length": 152.1641067504883, "completions/min_length": 66.3, "completions/min_terminated_length": 66.3, "entropy": 0.048627977073192594, "epoch": 15.353319057815845, "frac_reward_zero_std": 0.9125, "grad_norm": 0.0, "learning_rate": 9.283100000000001e-06, "loss": -0.0042, "num_tokens": 742353735.0, "reward": 1.0587304890155793, "reward_std": 0.15393975302577018, "rewards/reward_accuracy/mean": 0.959375, "rewards/reward_accuracy/std": 0.15123281702399255, "rewards/reward_format/mean": 0.09935547113418579, "rewards/reward_format/std": 0.005542309954762459, "sampling/importance_sampling_ratio/max": 2.5531511306762695, "sampling/importance_sampling_ratio/mean": 0.973378711938858, "sampling/importance_sampling_ratio/min": 0.11491879522800445, "sampling/sampling_logp_difference/max": 1.0520840644836427, "sampling/sampling_logp_difference/mean": 0.004118624213151634, "step": 7170, "step_time": 6.774140313599491 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 3.374415791768115e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 3.374415791768115e-06, "completions/clipped_ratio": 0.0078125, "completions/max_length": 1644.0, "completions/max_terminated_length": 1488.6, "completions/mean_length": 172.978515625, "completions/mean_terminated_length": 158.37812347412108, "completions/min_length": 67.5, "completions/min_terminated_length": 67.5, "entropy": 0.05405530002899468, "epoch": 15.37473233404711, "frac_reward_zero_std": 0.8625, "grad_norm": 0.318359375, "learning_rate": 9.2821e-06, "loss": -0.0115, "num_tokens": 743317760.0, "reward": 1.060937511920929, "reward_std": 0.17899244502186776, "rewards/reward_accuracy/mean": 0.96171875, "rewards/reward_accuracy/std": 0.1757420100271702, "rewards/reward_format/mean": 0.09921875074505807, "rewards/reward_format/std": 0.005246018106117844, "sampling/importance_sampling_ratio/max": 2.374092531204224, "sampling/importance_sampling_ratio/mean": 0.983341532945633, "sampling/importance_sampling_ratio/min": 0.0426672600209713, "sampling/sampling_logp_difference/max": 1.023732453584671, "sampling/sampling_logp_difference/mean": 0.004382954374887049, "step": 7180, "step_time": 7.976757635499235 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005859375, "completions/max_length": 1746.2, "completions/max_terminated_length": 1650.5, "completions/mean_length": 172.156640625, "completions/mean_terminated_length": 161.22746887207032, "completions/min_length": 65.4, "completions/min_terminated_length": 65.4, "entropy": 0.05257654085289687, "epoch": 15.396145610278372, "frac_reward_zero_std": 0.875, "grad_norm": 0.306640625, "learning_rate": 9.2811e-06, "loss": -0.0121, "num_tokens": 744281377.0, "reward": 1.0529102027416228, "reward_std": 0.1947343997657299, "rewards/reward_accuracy/mean": 0.953515625, "rewards/reward_accuracy/std": 0.19262249991297722, "rewards/reward_format/mean": 0.09939453303813935, "rewards/reward_format/std": 0.005345711065456271, "sampling/importance_sampling_ratio/max": 2.3413537621498106, "sampling/importance_sampling_ratio/mean": 0.9703140020370483, "sampling/importance_sampling_ratio/min": 0.08746642097830773, "sampling/sampling_logp_difference/max": 1.0109641671180725, "sampling/sampling_logp_difference/mean": 0.004156707227230072, "step": 7190, "step_time": 8.291111761608045 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003125, "completions/max_length": 1667.6, "completions/max_terminated_length": 1430.5, "completions/mean_length": 169.57109375, "completions/mean_terminated_length": 163.6954605102539, "completions/min_length": 66.4, "completions/min_terminated_length": 66.4, "entropy": 0.04977785828523338, "epoch": 15.417558886509635, "frac_reward_zero_std": 0.85625, "grad_norm": 0.65625, "learning_rate": 9.280100000000001e-06, "loss": -0.0023, "num_tokens": 745235959.0, "reward": 1.0516992568969727, "reward_std": 0.18766923248767853, "rewards/reward_accuracy/mean": 0.951953125, "rewards/reward_accuracy/std": 0.1860370934009552, "rewards/reward_format/mean": 0.0997460961341858, "rewards/reward_format/std": 0.002958945953287184, "sampling/importance_sampling_ratio/max": 2.5951329588890077, "sampling/importance_sampling_ratio/mean": 0.995012491941452, "sampling/importance_sampling_ratio/min": 0.10028434917330742, "sampling/sampling_logp_difference/max": 0.9405996084213257, "sampling/sampling_logp_difference/mean": 0.004281873209401965, "step": 7200, "step_time": 7.854155952698784 }, { "clip_ratio/high_max": 8.745335799176246e-06, "clip_ratio/high_mean": 1.0931669748970308e-06, "clip_ratio/low_mean": 1.997686831600731e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 3.090853806497762e-06, "completions/clipped_ratio": 0.009765625, "completions/max_length": 1405.5, "completions/max_terminated_length": 1284.6, "completions/mean_length": 186.208203125, "completions/mean_terminated_length": 168.1266662597656, "completions/min_length": 63.6, "completions/min_terminated_length": 63.6, "entropy": 0.056118366145528856, "epoch": 15.4389721627409, "frac_reward_zero_std": 0.84375, "grad_norm": 0.341796875, "learning_rate": 9.2791e-06, "loss": -0.011, "num_tokens": 746230284.0, "reward": 1.0449414372444152, "reward_std": 0.19201430380344392, "rewards/reward_accuracy/mean": 0.945703125, "rewards/reward_accuracy/std": 0.18951964974403382, "rewards/reward_format/mean": 0.0992382824420929, "rewards/reward_format/std": 0.004761925409547984, "sampling/importance_sampling_ratio/max": 2.438070523738861, "sampling/importance_sampling_ratio/mean": 0.9825598895549774, "sampling/importance_sampling_ratio/min": 0.1317385310307145, "sampling/sampling_logp_difference/max": 0.9088634729385376, "sampling/sampling_logp_difference/mean": 0.0043797560036182405, "step": 7210, "step_time": 7.200625032989774 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 1361.4, "completions/max_terminated_length": 1190.0, "completions/mean_length": 157.655859375, "completions/mean_terminated_length": 150.2948028564453, "completions/min_length": 64.8, "completions/min_terminated_length": 64.8, "entropy": 0.047929273056797686, "epoch": 15.460385438972162, "frac_reward_zero_std": 0.90625, "grad_norm": 1.3203125, "learning_rate": 9.2781e-06, "loss": 0.003, "num_tokens": 747151387.0, "reward": 1.0620703220367431, "reward_std": 0.14231131374835967, "rewards/reward_accuracy/mean": 0.9625, "rewards/reward_accuracy/std": 0.14060111194849015, "rewards/reward_format/mean": 0.09957031309604644, "rewards/reward_format/std": 0.004069638275541365, "sampling/importance_sampling_ratio/max": 2.647476243972778, "sampling/importance_sampling_ratio/mean": 0.9884066998958587, "sampling/importance_sampling_ratio/min": 0.082749018445611, "sampling/sampling_logp_difference/max": 1.0341296911239624, "sampling/sampling_logp_difference/mean": 0.004404998989775777, "step": 7220, "step_time": 6.809988783512381 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00625, "completions/max_length": 1600.2, "completions/max_terminated_length": 1150.7, "completions/mean_length": 175.2265625, "completions/mean_terminated_length": 163.53193359375, "completions/min_length": 64.6, "completions/min_terminated_length": 64.6, "entropy": 0.05002381606027484, "epoch": 15.481798715203427, "frac_reward_zero_std": 0.9, "grad_norm": 0.443359375, "learning_rate": 9.277100000000001e-06, "loss": -0.0039, "num_tokens": 748121647.0, "reward": 1.0622851848602295, "reward_std": 0.16346621364355088, "rewards/reward_accuracy/mean": 0.962890625, "rewards/reward_accuracy/std": 0.16027154698967933, "rewards/reward_format/mean": 0.09939453303813935, "rewards/reward_format/std": 0.00502528939396143, "sampling/importance_sampling_ratio/max": 2.412003147602081, "sampling/importance_sampling_ratio/mean": 0.9843259990215302, "sampling/importance_sampling_ratio/min": 0.08627275638282299, "sampling/sampling_logp_difference/max": 0.9702064275741578, "sampling/sampling_logp_difference/mean": 0.004116731369867921, "step": 7230, "step_time": 7.6888663478079255 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.008203125, "completions/max_length": 1572.1, "completions/max_terminated_length": 1195.7, "completions/mean_length": 174.78984375, "completions/mean_terminated_length": 159.41939239501954, "completions/min_length": 66.1, "completions/min_terminated_length": 66.1, "entropy": 0.05504837026819587, "epoch": 15.50321199143469, "frac_reward_zero_std": 0.8875, "grad_norm": 0.2236328125, "learning_rate": 9.276100000000001e-06, "loss": -0.0131, "num_tokens": 749088005.0, "reward": 1.0562500476837158, "reward_std": 0.16944995298981666, "rewards/reward_accuracy/mean": 0.95703125, "rewards/reward_accuracy/std": 0.16618905290961267, "rewards/reward_format/mean": 0.09921875149011612, "rewards/reward_format/std": 0.005859295115806162, "sampling/importance_sampling_ratio/max": 2.3586599946022035, "sampling/importance_sampling_ratio/mean": 0.972951990365982, "sampling/importance_sampling_ratio/min": 0.09580017775297164, "sampling/sampling_logp_difference/max": 1.0596708476543426, "sampling/sampling_logp_difference/mean": 0.004440417443402111, "step": 7240, "step_time": 7.662646519596455 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001171875, "completions/max_length": 1295.6, "completions/max_terminated_length": 1026.7, "completions/mean_length": 147.518359375, "completions/mean_terminated_length": 145.29415740966797, "completions/min_length": 68.5, "completions/min_terminated_length": 68.5, "entropy": 0.04318873505108058, "epoch": 15.524625267665954, "frac_reward_zero_std": 0.93125, "grad_norm": 0.0908203125, "learning_rate": 9.2751e-06, "loss": -0.003, "num_tokens": 749979956.0, "reward": 1.079199230670929, "reward_std": 0.1209317035973072, "rewards/reward_accuracy/mean": 0.979296875, "rewards/reward_accuracy/std": 0.12016067951917649, "rewards/reward_format/mean": 0.09990234449505805, "rewards/reward_format/std": 0.001562500116415322, "sampling/importance_sampling_ratio/max": 2.4705662727355957, "sampling/importance_sampling_ratio/mean": 0.9823544263839722, "sampling/importance_sampling_ratio/min": 0.1446947030723095, "sampling/sampling_logp_difference/max": 1.329058861732483, "sampling/sampling_logp_difference/mean": 0.003963357582688331, "step": 7250, "step_time": 6.272284038088401 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.006640625, "completions/max_length": 1435.5, "completions/max_terminated_length": 1121.2, "completions/mean_length": 172.802734375, "completions/mean_terminated_length": 160.38688049316406, "completions/min_length": 66.0, "completions/min_terminated_length": 66.0, "entropy": 0.05012706976849586, "epoch": 15.546038543897216, "frac_reward_zero_std": 0.8625, "grad_norm": 0.25, "learning_rate": 9.2741e-06, "loss": -0.0068, "num_tokens": 750945355.0, "reward": 1.0530468940734863, "reward_std": 0.1761208787560463, "rewards/reward_accuracy/mean": 0.953515625, "rewards/reward_accuracy/std": 0.17386947572231293, "rewards/reward_format/mean": 0.0995312511920929, "rewards/reward_format/std": 0.004662298248149455, "sampling/importance_sampling_ratio/max": 2.501370596885681, "sampling/importance_sampling_ratio/mean": 0.9947784841060638, "sampling/importance_sampling_ratio/min": 0.18348529767245053, "sampling/sampling_logp_difference/max": 0.8495087623596191, "sampling/sampling_logp_difference/mean": 0.00430142164696008, "step": 7260, "step_time": 7.014399127499201 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 1.4505368199024816e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 1.4505368199024816e-06, "completions/clipped_ratio": 0.00625, "completions/max_length": 1324.7, "completions/max_terminated_length": 1025.7, "completions/mean_length": 164.978515625, "completions/mean_terminated_length": 153.41284637451173, "completions/min_length": 63.3, "completions/min_terminated_length": 63.3, "entropy": 0.052918220730498435, "epoch": 15.567451820128479, "frac_reward_zero_std": 0.88125, "grad_norm": 0.283203125, "learning_rate": 9.273100000000001e-06, "loss": -0.0047, "num_tokens": 751887620.0, "reward": 1.0506250321865083, "reward_std": 0.17252187207341194, "rewards/reward_accuracy/mean": 0.951171875, "rewards/reward_accuracy/std": 0.17011184468865395, "rewards/reward_format/mean": 0.09945312589406967, "rewards/reward_format/std": 0.004875409998930991, "sampling/importance_sampling_ratio/max": 2.4037542581558227, "sampling/importance_sampling_ratio/mean": 0.9920016407966614, "sampling/importance_sampling_ratio/min": 0.18870468772947788, "sampling/sampling_logp_difference/max": 1.0364430904388429, "sampling/sampling_logp_difference/mean": 0.004301556199789047, "step": 7270, "step_time": 6.503339134625276 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 1625.4, "completions/max_terminated_length": 1487.7, "completions/mean_length": 160.966015625, "completions/mean_terminated_length": 153.63013458251953, "completions/min_length": 66.8, "completions/min_terminated_length": 66.8, "entropy": 0.048980147438123824, "epoch": 15.588865096359743, "frac_reward_zero_std": 0.9, "grad_norm": 0.1416015625, "learning_rate": 9.2721e-06, "loss": -0.0082, "num_tokens": 752817245.0, "reward": 1.0450390696525573, "reward_std": 0.20467463210225106, "rewards/reward_accuracy/mean": 0.9453125, "rewards/reward_accuracy/std": 0.20361437425017356, "rewards/reward_format/mean": 0.09972656294703483, "rewards/reward_format/std": 0.002877799631096423, "sampling/importance_sampling_ratio/max": 2.382560110092163, "sampling/importance_sampling_ratio/mean": 0.9875393271446228, "sampling/importance_sampling_ratio/min": 0.1976780690252781, "sampling/sampling_logp_difference/max": 0.9786213755607605, "sampling/sampling_logp_difference/mean": 0.004234943236224353, "step": 7280, "step_time": 7.760058836609824 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.008203125, "completions/max_length": 1840.1, "completions/max_terminated_length": 1452.7, "completions/mean_length": 180.07734375, "completions/mean_terminated_length": 164.75896759033202, "completions/min_length": 64.3, "completions/min_terminated_length": 64.3, "entropy": 0.05303023040760309, "epoch": 15.610278372591006, "frac_reward_zero_std": 0.89375, "grad_norm": 0.078125, "learning_rate": 9.2711e-06, "loss": -0.0125, "num_tokens": 753797091.0, "reward": 1.0504687666893004, "reward_std": 0.19500854462385178, "rewards/reward_accuracy/mean": 0.951171875, "rewards/reward_accuracy/std": 0.1919720560312271, "rewards/reward_format/mean": 0.09929687678813934, "rewards/reward_format/std": 0.006277910876087844, "sampling/importance_sampling_ratio/max": 2.5350603342056273, "sampling/importance_sampling_ratio/mean": 0.9812662303447723, "sampling/importance_sampling_ratio/min": 0.12728011943399906, "sampling/sampling_logp_difference/max": 0.9052463412284851, "sampling/sampling_logp_difference/mean": 0.004289478273130953, "step": 7290, "step_time": 8.729826466203667 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.004296875, "completions/max_length": 1279.4, "completions/max_terminated_length": 959.1, "completions/mean_length": 157.8453125, "completions/mean_terminated_length": 149.83285064697264, "completions/min_length": 62.0, "completions/min_terminated_length": 62.0, "entropy": 0.04895356763154268, "epoch": 15.63169164882227, "frac_reward_zero_std": 0.8875, "grad_norm": 0.0, "learning_rate": 9.270100000000001e-06, "loss": -0.0004, "num_tokens": 754715815.0, "reward": 1.0458984613418578, "reward_std": 0.1804988756775856, "rewards/reward_accuracy/mean": 0.94609375, "rewards/reward_accuracy/std": 0.17942741885781288, "rewards/reward_format/mean": 0.09980468899011612, "rewards/reward_format/std": 0.0024868135806173086, "sampling/importance_sampling_ratio/max": 2.3851242899894713, "sampling/importance_sampling_ratio/mean": 0.9787418007850647, "sampling/importance_sampling_ratio/min": 0.1544072486460209, "sampling/sampling_logp_difference/max": 0.7701907992362976, "sampling/sampling_logp_difference/mean": 0.004176755528897047, "step": 7300, "step_time": 6.247145386898774 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00625, "completions/max_length": 1784.5, "completions/max_terminated_length": 1572.9, "completions/mean_length": 179.412109375, "completions/mean_terminated_length": 167.83583374023436, "completions/min_length": 60.9, "completions/min_terminated_length": 60.9, "entropy": 0.057583738747052846, "epoch": 15.653104925053533, "frac_reward_zero_std": 0.84375, "grad_norm": 0.404296875, "learning_rate": 9.2691e-06, "loss": -0.0145, "num_tokens": 755693318.0, "reward": 1.0369922041893005, "reward_std": 0.21723022907972336, "rewards/reward_accuracy/mean": 0.9375, "rewards/reward_accuracy/std": 0.2149900861084461, "rewards/reward_format/mean": 0.09949218779802323, "rewards/reward_format/std": 0.005285822134464979, "sampling/importance_sampling_ratio/max": 2.548732006549835, "sampling/importance_sampling_ratio/mean": 0.9871122419834137, "sampling/importance_sampling_ratio/min": 0.060354103613644836, "sampling/sampling_logp_difference/max": 1.0017538785934448, "sampling/sampling_logp_difference/mean": 0.004709430364891886, "step": 7310, "step_time": 8.455897053898662 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0078125, "completions/max_length": 1477.9, "completions/max_terminated_length": 1380.2, "completions/mean_length": 194.72421875, "completions/mean_terminated_length": 180.57219848632812, "completions/min_length": 66.8, "completions/min_terminated_length": 66.8, "entropy": 0.05504522793926299, "epoch": 15.674518201284796, "frac_reward_zero_std": 0.8875, "grad_norm": 0.439453125, "learning_rate": 9.2681e-06, "loss": -0.0053, "num_tokens": 756713700.0, "reward": 1.0622265696525575, "reward_std": 0.17378995269536973, "rewards/reward_accuracy/mean": 0.962890625, "rewards/reward_accuracy/std": 0.171462781727314, "rewards/reward_format/mean": 0.0993359386920929, "rewards/reward_format/std": 0.0045016798423603175, "sampling/importance_sampling_ratio/max": 2.4595836400985718, "sampling/importance_sampling_ratio/mean": 0.9896947562694549, "sampling/importance_sampling_ratio/min": 0.12447053864598275, "sampling/sampling_logp_difference/max": 0.9323425769805909, "sampling/sampling_logp_difference/mean": 0.004179598693735897, "step": 7320, "step_time": 7.416681460686959 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.008984375, "completions/max_length": 1506.1, "completions/max_terminated_length": 1341.9, "completions/mean_length": 181.344140625, "completions/mean_terminated_length": 164.69799041748047, "completions/min_length": 68.8, "completions/min_terminated_length": 68.8, "entropy": 0.0563886137213558, "epoch": 15.69593147751606, "frac_reward_zero_std": 0.8875, "grad_norm": 0.0, "learning_rate": 9.267100000000001e-06, "loss": -0.0104, "num_tokens": 757701957.0, "reward": 1.0609375357627868, "reward_std": 0.17294201403856277, "rewards/reward_accuracy/mean": 0.96171875, "rewards/reward_accuracy/std": 0.16988052502274514, "rewards/reward_format/mean": 0.09921875223517418, "rewards/reward_format/std": 0.005146918911486864, "sampling/importance_sampling_ratio/max": 2.400870203971863, "sampling/importance_sampling_ratio/mean": 0.9871320962905884, "sampling/importance_sampling_ratio/min": 0.11139190793037415, "sampling/sampling_logp_difference/max": 1.0247216939926147, "sampling/sampling_logp_difference/mean": 0.004380368557758629, "step": 7330, "step_time": 7.508020689393743 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005859375, "completions/max_length": 1727.8, "completions/max_terminated_length": 1379.5, "completions/mean_length": 164.379296875, "completions/mean_terminated_length": 153.39752349853515, "completions/min_length": 66.1, "completions/min_terminated_length": 66.1, "entropy": 0.048242447129450736, "epoch": 15.717344753747323, "frac_reward_zero_std": 0.875, "grad_norm": 0.1806640625, "learning_rate": 9.266100000000001e-06, "loss": -0.0105, "num_tokens": 758639856.0, "reward": 1.0666406333446503, "reward_std": 0.15610856637358667, "rewards/reward_accuracy/mean": 0.9671875, "rewards/reward_accuracy/std": 0.15333698838949203, "rewards/reward_format/mean": 0.09945312589406967, "rewards/reward_format/std": 0.004781407583504915, "sampling/importance_sampling_ratio/max": 2.5371954917907713, "sampling/importance_sampling_ratio/mean": 0.9838827788829804, "sampling/importance_sampling_ratio/min": 0.05228218324482441, "sampling/sampling_logp_difference/max": 1.0979979038238525, "sampling/sampling_logp_difference/mean": 0.0041676952969282866, "step": 7340, "step_time": 8.053445617985563 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003515625, "completions/max_length": 1258.6, "completions/max_terminated_length": 975.3, "completions/mean_length": 161.751171875, "completions/mean_terminated_length": 155.16514434814454, "completions/min_length": 62.7, "completions/min_terminated_length": 62.7, "entropy": 0.046681685652583835, "epoch": 15.738758029978587, "frac_reward_zero_std": 0.86875, "grad_norm": 0.0, "learning_rate": 9.2651e-06, "loss": -0.0073, "num_tokens": 759572339.0, "reward": 1.0673437774181367, "reward_std": 0.147407615929842, "rewards/reward_accuracy/mean": 0.967578125, "rewards/reward_accuracy/std": 0.14612978249788283, "rewards/reward_format/mean": 0.09976562708616257, "rewards/reward_format/std": 0.003014297503978014, "sampling/importance_sampling_ratio/max": 2.3487537145614623, "sampling/importance_sampling_ratio/mean": 0.995146781206131, "sampling/importance_sampling_ratio/min": 0.09163826368749142, "sampling/sampling_logp_difference/max": 1.02916179895401, "sampling/sampling_logp_difference/mean": 0.004048635205253959, "step": 7350, "step_time": 6.110323378999601 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.002734375, "completions/max_length": 1321.8, "completions/max_terminated_length": 928.3, "completions/mean_length": 165.188671875, "completions/mean_terminated_length": 160.08337860107423, "completions/min_length": 71.1, "completions/min_terminated_length": 71.1, "entropy": 0.04954493457917124, "epoch": 15.76017130620985, "frac_reward_zero_std": 0.8875, "grad_norm": 0.44140625, "learning_rate": 9.2641e-06, "loss": -0.0031, "num_tokens": 760522086.0, "reward": 1.076230490207672, "reward_std": 0.12541281282901764, "rewards/reward_accuracy/mean": 0.9765625, "rewards/reward_accuracy/std": 0.12367122620344162, "rewards/reward_format/mean": 0.09966797009110451, "rewards/reward_format/std": 0.003710146341472864, "sampling/importance_sampling_ratio/max": 2.5150890588760375, "sampling/importance_sampling_ratio/mean": 0.9849582254886627, "sampling/importance_sampling_ratio/min": 0.12283427491784096, "sampling/sampling_logp_difference/max": 0.930587911605835, "sampling/sampling_logp_difference/mean": 0.004190472909249366, "step": 7360, "step_time": 6.498671458184253 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01015625, "completions/max_length": 1835.8, "completions/max_terminated_length": 1489.0, "completions/mean_length": 182.462109375, "completions/mean_terminated_length": 163.4350212097168, "completions/min_length": 69.8, "completions/min_terminated_length": 69.8, "entropy": 0.0526542134815827, "epoch": 15.781584582441113, "frac_reward_zero_std": 0.85625, "grad_norm": 0.5625, "learning_rate": 9.263100000000001e-06, "loss": -0.0076, "num_tokens": 761514613.0, "reward": 1.040214866399765, "reward_std": 0.22741349712014197, "rewards/reward_accuracy/mean": 0.941015625, "rewards/reward_accuracy/std": 0.2238510586321354, "rewards/reward_format/mean": 0.09919921979308129, "rewards/reward_format/std": 0.007575070136226714, "sampling/importance_sampling_ratio/max": 2.4173116087913513, "sampling/importance_sampling_ratio/mean": 0.9858577847480774, "sampling/importance_sampling_ratio/min": 0.043523166328668594, "sampling/sampling_logp_difference/max": 0.9800334274768829, "sampling/sampling_logp_difference/mean": 0.0043530965922400355, "step": 7370, "step_time": 8.791602441295982 }, { "clip_ratio/high_max": 8.263552444986999e-06, "clip_ratio/high_mean": 1.0329440556233749e-06, "clip_ratio/low_mean": 2.0862024257439772e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 3.119146481367352e-06, "completions/clipped_ratio": 0.005859375, "completions/max_length": 1402.8, "completions/max_terminated_length": 1110.0, "completions/mean_length": 158.46640625, "completions/mean_terminated_length": 147.3747589111328, "completions/min_length": 68.2, "completions/min_terminated_length": 68.2, "entropy": 0.04591957794036716, "epoch": 15.802997858672377, "frac_reward_zero_std": 0.9, "grad_norm": 0.150390625, "learning_rate": 9.2621e-06, "loss": 0.0013, "num_tokens": 762439343.0, "reward": 1.0783984661102295, "reward_std": 0.12236752957105637, "rewards/reward_accuracy/mean": 0.97890625, "rewards/reward_accuracy/std": 0.12006175220012665, "rewards/reward_format/mean": 0.09949218928813934, "rewards/reward_format/std": 0.003631688980385661, "sampling/importance_sampling_ratio/max": 2.472250282764435, "sampling/importance_sampling_ratio/mean": 0.995585960149765, "sampling/importance_sampling_ratio/min": 0.16178351547569036, "sampling/sampling_logp_difference/max": 0.8116357445716857, "sampling/sampling_logp_difference/mean": 0.004083652887493372, "step": 7380, "step_time": 6.856907191404025 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005078125, "completions/max_length": 1243.4, "completions/max_terminated_length": 1181.5, "completions/mean_length": 168.2953125, "completions/mean_terminated_length": 158.87424011230468, "completions/min_length": 66.2, "completions/min_terminated_length": 66.2, "entropy": 0.05008279194589704, "epoch": 15.82441113490364, "frac_reward_zero_std": 0.8625, "grad_norm": 0.2421875, "learning_rate": 9.2611e-06, "loss": -0.0095, "num_tokens": 763385939.0, "reward": 1.053515648841858, "reward_std": 0.17563808783888818, "rewards/reward_accuracy/mean": 0.95390625, "rewards/reward_accuracy/std": 0.17462463453412055, "rewards/reward_format/mean": 0.09960937649011611, "rewards/reward_format/std": 0.003153076791204512, "sampling/importance_sampling_ratio/max": 2.583732557296753, "sampling/importance_sampling_ratio/mean": 0.9832672834396362, "sampling/importance_sampling_ratio/min": 0.17304082065820695, "sampling/sampling_logp_difference/max": 0.8502934813499451, "sampling/sampling_logp_difference/mean": 0.004105702671222389, "step": 7390, "step_time": 6.401839357192512 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.009375, "completions/max_length": 1589.2, "completions/max_terminated_length": 1282.2, "completions/mean_length": 166.7609375, "completions/mean_terminated_length": 149.0612045288086, "completions/min_length": 60.7, "completions/min_terminated_length": 60.7, "entropy": 0.051198167237453164, "epoch": 15.845824411134904, "frac_reward_zero_std": 0.875, "grad_norm": 0.30859375, "learning_rate": 9.260100000000001e-06, "loss": -0.0083, "num_tokens": 764327183.0, "reward": 1.0633008003234863, "reward_std": 0.1610859252512455, "rewards/reward_accuracy/mean": 0.9640625, "rewards/reward_accuracy/std": 0.15735794231295586, "rewards/reward_format/mean": 0.0992382824420929, "rewards/reward_format/std": 0.006124604842625558, "sampling/importance_sampling_ratio/max": 2.587886595726013, "sampling/importance_sampling_ratio/mean": 0.9940712571144104, "sampling/importance_sampling_ratio/min": 0.08026873879134655, "sampling/sampling_logp_difference/max": 0.9524994730949402, "sampling/sampling_logp_difference/mean": 0.004300723318010569, "step": 7400, "step_time": 7.499492890518741 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00703125, "completions/max_length": 1626.8, "completions/max_terminated_length": 1480.4, "completions/mean_length": 181.815234375, "completions/mean_terminated_length": 168.73580780029297, "completions/min_length": 63.4, "completions/min_terminated_length": 63.4, "entropy": 0.06327865575440228, "epoch": 15.867237687366167, "frac_reward_zero_std": 0.84375, "grad_norm": 0.0595703125, "learning_rate": 9.259100000000001e-06, "loss": -0.0062, "num_tokens": 765306598.0, "reward": 1.0622656226158143, "reward_std": 0.16165482476353646, "rewards/reward_accuracy/mean": 0.962890625, "rewards/reward_accuracy/std": 0.15915471762418748, "rewards/reward_format/mean": 0.09937499985098838, "rewards/reward_format/std": 0.00478698976803571, "sampling/importance_sampling_ratio/max": 2.502791738510132, "sampling/importance_sampling_ratio/mean": 0.9951833367347718, "sampling/importance_sampling_ratio/min": 0.10305047379806638, "sampling/sampling_logp_difference/max": 0.8406207740306855, "sampling/sampling_logp_difference/mean": 0.0046466160099953415, "step": 7410, "step_time": 7.966698476721649 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.007421875, "completions/max_length": 1909.8, "completions/max_terminated_length": 1760.8, "completions/mean_length": 187.52421875, "completions/mean_terminated_length": 173.8340087890625, "completions/min_length": 64.4, "completions/min_terminated_length": 64.4, "entropy": 0.05872277743183076, "epoch": 15.888650963597431, "frac_reward_zero_std": 0.85, "grad_norm": 0.10986328125, "learning_rate": 9.2581e-06, "loss": 0.0013, "num_tokens": 766305620.0, "reward": 1.0431250095367433, "reward_std": 0.2114048719406128, "rewards/reward_accuracy/mean": 0.94375, "rewards/reward_accuracy/std": 0.20945394709706305, "rewards/reward_format/mean": 0.09937499985098838, "rewards/reward_format/std": 0.005236491980031133, "sampling/importance_sampling_ratio/max": 2.4600640892982484, "sampling/importance_sampling_ratio/mean": 0.9891933679580689, "sampling/importance_sampling_ratio/min": 0.08572614938020706, "sampling/sampling_logp_difference/max": 0.8218006491661072, "sampling/sampling_logp_difference/mean": 0.004449196788482368, "step": 7420, "step_time": 9.396801085793413 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.010546875, "completions/max_length": 1618.8, "completions/max_terminated_length": 1385.3, "completions/mean_length": 191.5578125, "completions/mean_terminated_length": 171.98495025634764, "completions/min_length": 66.5, "completions/min_terminated_length": 66.5, "entropy": 0.056943182437680664, "epoch": 15.910064239828694, "frac_reward_zero_std": 0.86875, "grad_norm": 0.271484375, "learning_rate": 9.257100000000002e-06, "loss": -0.0058, "num_tokens": 767319448.0, "reward": 1.0506445586681366, "reward_std": 0.18098186552524567, "rewards/reward_accuracy/mean": 0.9515625, "rewards/reward_accuracy/std": 0.1780993312597275, "rewards/reward_format/mean": 0.09908203259110451, "rewards/reward_format/std": 0.005972184706479311, "sampling/importance_sampling_ratio/max": 2.563217115402222, "sampling/importance_sampling_ratio/mean": 0.9909120857715606, "sampling/importance_sampling_ratio/min": 0.06259623914957047, "sampling/sampling_logp_difference/max": 0.9620221793651581, "sampling/sampling_logp_difference/mean": 0.00447903429158032, "step": 7430, "step_time": 7.7941959843941735 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 1.7698987221592689e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 1.7698987221592689e-06, "completions/clipped_ratio": 0.008203125, "completions/max_length": 1490.1, "completions/max_terminated_length": 1100.4, "completions/mean_length": 170.518359375, "completions/mean_terminated_length": 155.06661529541014, "completions/min_length": 63.8, "completions/min_terminated_length": 63.8, "entropy": 0.04709431999363005, "epoch": 15.931477516059957, "frac_reward_zero_std": 0.88125, "grad_norm": 0.279296875, "learning_rate": 9.256100000000001e-06, "loss": -0.0006, "num_tokens": 768272983.0, "reward": 1.0676367282867432, "reward_std": 0.15943209901452066, "rewards/reward_accuracy/mean": 0.968359375, "rewards/reward_accuracy/std": 0.15570439398288727, "rewards/reward_format/mean": 0.09927734434604644, "rewards/reward_format/std": 0.005679406528361142, "sampling/importance_sampling_ratio/max": 2.486377000808716, "sampling/importance_sampling_ratio/mean": 0.9915073871612549, "sampling/importance_sampling_ratio/min": 0.1411423236131668, "sampling/sampling_logp_difference/max": 0.8282851099967956, "sampling/sampling_logp_difference/mean": 0.004278757050633431, "step": 7440, "step_time": 7.263933133799583 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.008984375, "completions/max_length": 1380.4, "completions/max_terminated_length": 1126.5, "completions/mean_length": 175.905078125, "completions/mean_terminated_length": 158.95009155273436, "completions/min_length": 64.8, "completions/min_terminated_length": 64.8, "entropy": 0.04751935868989676, "epoch": 15.952890792291221, "frac_reward_zero_std": 0.88125, "grad_norm": 0.0, "learning_rate": 9.2551e-06, "loss": -0.0081, "num_tokens": 769236692.0, "reward": 1.0552929759025573, "reward_std": 0.17346298694610596, "rewards/reward_accuracy/mean": 0.95625, "rewards/reward_accuracy/std": 0.17020985707640648, "rewards/reward_format/mean": 0.0990429699420929, "rewards/reward_format/std": 0.005760164908133447, "sampling/importance_sampling_ratio/max": 2.3760067343711855, "sampling/importance_sampling_ratio/mean": 0.9794980049133301, "sampling/importance_sampling_ratio/min": 0.12560493126511574, "sampling/sampling_logp_difference/max": 0.8790980160236359, "sampling/sampling_logp_difference/mean": 0.003991183917969465, "step": 7450, "step_time": 6.909343643797911 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005078125, "completions/max_length": 1262.0, "completions/max_terminated_length": 993.2, "completions/mean_length": 156.930078125, "completions/mean_terminated_length": 147.31487426757812, "completions/min_length": 64.6, "completions/min_terminated_length": 64.6, "entropy": 0.043808518908917904, "epoch": 15.974304068522484, "frac_reward_zero_std": 0.91875, "grad_norm": 0.28515625, "learning_rate": 9.2541e-06, "loss": -0.003, "num_tokens": 770151825.0, "reward": 1.077011728286743, "reward_std": 0.11716569289565086, "rewards/reward_accuracy/mean": 0.97734375, "rewards/reward_accuracy/std": 0.11516818180680274, "rewards/reward_format/mean": 0.09966796934604645, "rewards/reward_format/std": 0.0035057181725278498, "sampling/importance_sampling_ratio/max": 2.378123605251312, "sampling/importance_sampling_ratio/mean": 0.9865248918533325, "sampling/importance_sampling_ratio/min": 0.14279377982020378, "sampling/sampling_logp_difference/max": 0.918242585659027, "sampling/sampling_logp_difference/mean": 0.0037846090272068977, "step": 7460, "step_time": 6.054634008815628 }, { "clip_ratio/high_max": 4.982140089850873e-05, "clip_ratio/high_mean": 6.227675112313591e-06, "clip_ratio/low_mean": 4.278336746210698e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 1.0506011676625349e-05, "completions/clipped_ratio": 0.010546875, "completions/max_length": 1457.5, "completions/max_terminated_length": 1304.8, "completions/mean_length": 176.266796875, "completions/mean_terminated_length": 156.27637176513673, "completions/min_length": 67.1, "completions/min_terminated_length": 67.1, "entropy": 0.0524467988172546, "epoch": 15.995717344753746, "frac_reward_zero_std": 0.90625, "grad_norm": 0.0, "learning_rate": 9.253100000000001e-06, "loss": -0.0068, "num_tokens": 771120108.0, "reward": 1.0624609470367432, "reward_std": 0.16595850735902787, "rewards/reward_accuracy/mean": 0.96328125, "rewards/reward_accuracy/std": 0.16222340539097785, "rewards/reward_format/mean": 0.09917968809604645, "rewards/reward_format/std": 0.005845137080177665, "sampling/importance_sampling_ratio/max": 2.511593687534332, "sampling/importance_sampling_ratio/mean": 0.9895595788955689, "sampling/importance_sampling_ratio/min": 0.0943706750869751, "sampling/sampling_logp_difference/max": 1.030219304561615, "sampling/sampling_logp_difference/mean": 0.0043052863096818324, "step": 7470, "step_time": 7.213760881006602 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01015625, "completions/max_length": 1845.3, "completions/max_terminated_length": 1597.6, "completions/mean_length": 190.14453125, "completions/mean_terminated_length": 171.2102478027344, "completions/min_length": 65.4, "completions/min_terminated_length": 65.4, "entropy": 0.05759809457231313, "epoch": 16.01713062098501, "frac_reward_zero_std": 0.86875, "grad_norm": 0.1943359375, "learning_rate": 9.2521e-06, "loss": -0.0123, "num_tokens": 772118622.0, "reward": 1.0379296958446502, "reward_std": 0.21699898242950438, "rewards/reward_accuracy/mean": 0.938671875, "rewards/reward_accuracy/std": 0.21391298323869706, "rewards/reward_format/mean": 0.09925781413912774, "rewards/reward_format/std": 0.006568579142913223, "sampling/importance_sampling_ratio/max": 2.3930506229400637, "sampling/importance_sampling_ratio/mean": 0.9692868530750275, "sampling/importance_sampling_ratio/min": 0.10342595875263214, "sampling/sampling_logp_difference/max": 1.506835389137268, "sampling/sampling_logp_difference/mean": 0.004451815411448479, "step": 7480, "step_time": 8.91149079160823 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003125, "completions/max_length": 1520.6, "completions/max_terminated_length": 1318.5, "completions/mean_length": 161.258984375, "completions/mean_terminated_length": 155.37012329101563, "completions/min_length": 63.4, "completions/min_terminated_length": 63.4, "entropy": 0.044545961706899104, "epoch": 16.038543897216275, "frac_reward_zero_std": 0.88125, "grad_norm": 0.349609375, "learning_rate": 9.2511e-06, "loss": -0.0041, "num_tokens": 773049397.0, "reward": 1.0348047018051147, "reward_std": 0.21688670217990874, "rewards/reward_accuracy/mean": 0.93515625, "rewards/reward_accuracy/std": 0.21565750986337662, "rewards/reward_format/mean": 0.09964843839406967, "rewards/reward_format/std": 0.003941558417864144, "sampling/importance_sampling_ratio/max": 2.51152925491333, "sampling/importance_sampling_ratio/mean": 0.9991677582263947, "sampling/importance_sampling_ratio/min": 0.1307633062824607, "sampling/sampling_logp_difference/max": 1.0547487795352937, "sampling/sampling_logp_difference/mean": 0.00425048943143338, "step": 7490, "step_time": 7.216543937302776 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00625, "completions/max_length": 1567.2, "completions/max_terminated_length": 1450.4, "completions/mean_length": 177.590625, "completions/mean_terminated_length": 166.0336898803711, "completions/min_length": 68.2, "completions/min_terminated_length": 68.2, "entropy": 0.04887575029861182, "epoch": 16.059957173447536, "frac_reward_zero_std": 0.8625, "grad_norm": 0.408203125, "learning_rate": 9.250100000000001e-06, "loss": -0.0024, "num_tokens": 774024653.0, "reward": 1.0643164396286011, "reward_std": 0.16549836993217468, "rewards/reward_accuracy/mean": 0.96484375, "rewards/reward_accuracy/std": 0.16345215439796448, "rewards/reward_format/mean": 0.0994726575911045, "rewards/reward_format/std": 0.004842052469030023, "sampling/importance_sampling_ratio/max": 2.512472367286682, "sampling/importance_sampling_ratio/mean": 0.9861550688743591, "sampling/importance_sampling_ratio/min": 0.11974570155143738, "sampling/sampling_logp_difference/max": 1.1895613074302673, "sampling/sampling_logp_difference/mean": 0.003974211122840643, "step": 7500, "step_time": 7.617511435915366 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00703125, "completions/max_length": 1338.4, "completions/max_terminated_length": 1198.8, "completions/mean_length": 170.492578125, "completions/mean_terminated_length": 157.3934356689453, "completions/min_length": 63.4, "completions/min_terminated_length": 63.4, "entropy": 0.050892702862620355, "epoch": 16.0813704496788, "frac_reward_zero_std": 0.85, "grad_norm": 0.474609375, "learning_rate": 9.249100000000001e-06, "loss": -0.0049, "num_tokens": 774976234.0, "reward": 1.0475390672683715, "reward_std": 0.19675918519496918, "rewards/reward_accuracy/mean": 0.948046875, "rewards/reward_accuracy/std": 0.1951913096010685, "rewards/reward_format/mean": 0.09949218779802323, "rewards/reward_format/std": 0.003920315811410546, "sampling/importance_sampling_ratio/max": 2.4574202060699464, "sampling/importance_sampling_ratio/mean": 0.9992922782897949, "sampling/importance_sampling_ratio/min": 0.12658161371946336, "sampling/sampling_logp_difference/max": 1.043505895137787, "sampling/sampling_logp_difference/mean": 0.0043189430609345434, "step": 7510, "step_time": 6.783111018591444 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00703125, "completions/max_length": 1515.9, "completions/max_terminated_length": 1317.9, "completions/mean_length": 170.589453125, "completions/mean_terminated_length": 157.46135864257812, "completions/min_length": 65.9, "completions/min_terminated_length": 65.9, "entropy": 0.05594647685065866, "epoch": 16.102783725910065, "frac_reward_zero_std": 0.8625, "grad_norm": 0.388671875, "learning_rate": 9.2481e-06, "loss": -0.0089, "num_tokens": 775924511.0, "reward": 1.0634961009025574, "reward_std": 0.16605668216943742, "rewards/reward_accuracy/mean": 0.9640625, "rewards/reward_accuracy/std": 0.16380197778344155, "rewards/reward_format/mean": 0.09943359419703483, "rewards/reward_format/std": 0.0056073881918564435, "sampling/importance_sampling_ratio/max": 2.5513537883758546, "sampling/importance_sampling_ratio/mean": 0.9813665568828582, "sampling/importance_sampling_ratio/min": 0.1272606797516346, "sampling/sampling_logp_difference/max": 0.851073157787323, "sampling/sampling_logp_difference/mean": 0.0044221748830750585, "step": 7520, "step_time": 7.410155645405757 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00859375, "completions/max_length": 1657.1, "completions/max_terminated_length": 1538.6, "completions/mean_length": 176.751171875, "completions/mean_terminated_length": 160.73704223632814, "completions/min_length": 61.9, "completions/min_terminated_length": 61.9, "entropy": 0.04543398518580943, "epoch": 16.124197002141326, "frac_reward_zero_std": 0.88125, "grad_norm": 0.78125, "learning_rate": 9.247100000000002e-06, "loss": -0.0089, "num_tokens": 776892994.0, "reward": 1.0581445455551148, "reward_std": 0.18210460469126702, "rewards/reward_accuracy/mean": 0.958984375, "rewards/reward_accuracy/std": 0.17887890189886094, "rewards/reward_format/mean": 0.09916015788912773, "rewards/reward_format/std": 0.0051536925137043, "sampling/importance_sampling_ratio/max": 2.4916744470596313, "sampling/importance_sampling_ratio/mean": 0.9836355686187744, "sampling/importance_sampling_ratio/min": 0.0206426277756691, "sampling/sampling_logp_difference/max": 1.1121335089206696, "sampling/sampling_logp_difference/mean": 0.0040432780515402555, "step": 7530, "step_time": 8.069660441836458 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 955.8, "completions/max_terminated_length": 837.9, "completions/mean_length": 143.26171875, "completions/mean_terminated_length": 135.89168701171874, "completions/min_length": 60.7, "completions/min_terminated_length": 60.7, "entropy": 0.036901535792276265, "epoch": 16.14561027837259, "frac_reward_zero_std": 0.9625, "grad_norm": 0.0, "learning_rate": 9.246100000000001e-06, "loss": 0.0024, "num_tokens": 777767632.0, "reward": 1.0704101920127869, "reward_std": 0.1214959517121315, "rewards/reward_accuracy/mean": 0.970703125, "rewards/reward_accuracy/std": 0.12033451646566391, "rewards/reward_format/mean": 0.09970703348517418, "rewards/reward_format/std": 0.002822448266670108, "sampling/importance_sampling_ratio/max": 2.129604470729828, "sampling/importance_sampling_ratio/mean": 0.9820225536823273, "sampling/importance_sampling_ratio/min": 0.17182854088023305, "sampling/sampling_logp_difference/max": 1.0559695839881897, "sampling/sampling_logp_difference/mean": 0.003541051596403122, "step": 7540, "step_time": 5.068485534196952 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00703125, "completions/max_length": 1375.1, "completions/max_terminated_length": 1231.9, "completions/mean_length": 168.176953125, "completions/mean_terminated_length": 154.96715698242187, "completions/min_length": 65.9, "completions/min_terminated_length": 65.9, "entropy": 0.04824209045618773, "epoch": 16.167023554603855, "frac_reward_zero_std": 0.90625, "grad_norm": 0.302734375, "learning_rate": 9.2451e-06, "loss": -0.0056, "num_tokens": 778714725.0, "reward": 1.0622851610183717, "reward_std": 0.1558469869196415, "rewards/reward_accuracy/mean": 0.962890625, "rewards/reward_accuracy/std": 0.15340813174843787, "rewards/reward_format/mean": 0.09939453154802322, "rewards/reward_format/std": 0.004454098083078862, "sampling/importance_sampling_ratio/max": 2.360276222229004, "sampling/importance_sampling_ratio/mean": 0.9861403107643127, "sampling/importance_sampling_ratio/min": 0.12866153568029404, "sampling/sampling_logp_difference/max": 1.167552924156189, "sampling/sampling_logp_difference/mean": 0.004010846582241356, "step": 7550, "step_time": 6.890104783093557 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0015625, "completions/max_length": 1259.2, "completions/max_terminated_length": 1060.5, "completions/mean_length": 169.84140625, "completions/mean_terminated_length": 166.9798355102539, "completions/min_length": 66.8, "completions/min_terminated_length": 66.8, "entropy": 0.04674338719341904, "epoch": 16.18843683083512, "frac_reward_zero_std": 0.8625, "grad_norm": 0.55078125, "learning_rate": 9.2441e-06, "loss": -0.0074, "num_tokens": 779669615.0, "reward": 1.066230481863022, "reward_std": 0.1451662741601467, "rewards/reward_accuracy/mean": 0.96640625, "rewards/reward_accuracy/std": 0.14432501196861267, "rewards/reward_format/mean": 0.0998242199420929, "rewards/reward_format/std": 0.0023254600586369635, "sampling/importance_sampling_ratio/max": 2.4781846046447753, "sampling/importance_sampling_ratio/mean": 0.9777596414089202, "sampling/importance_sampling_ratio/min": 0.10589946806430817, "sampling/sampling_logp_difference/max": 1.1525016903877259, "sampling/sampling_logp_difference/mean": 0.004027322237379849, "step": 7560, "step_time": 6.091077825700632 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.004296875, "completions/max_length": 1534.8, "completions/max_terminated_length": 1423.1, "completions/mean_length": 180.208984375, "completions/mean_terminated_length": 172.3422073364258, "completions/min_length": 64.3, "completions/min_terminated_length": 64.3, "entropy": 0.048767938860692084, "epoch": 16.20985010706638, "frac_reward_zero_std": 0.85, "grad_norm": 0.43359375, "learning_rate": 9.2431e-06, "loss": 0.0002, "num_tokens": 780649974.0, "reward": 1.056621116399765, "reward_std": 0.17865685373544693, "rewards/reward_accuracy/mean": 0.95703125, "rewards/reward_accuracy/std": 0.17723799049854277, "rewards/reward_format/mean": 0.09958984479308128, "rewards/reward_format/std": 0.003935943846590817, "sampling/importance_sampling_ratio/max": 2.5164379358291624, "sampling/importance_sampling_ratio/mean": 0.9811029314994812, "sampling/importance_sampling_ratio/min": 0.05014926940202713, "sampling/sampling_logp_difference/max": 0.9963155686855316, "sampling/sampling_logp_difference/mean": 0.004142227536067367, "step": 7570, "step_time": 7.496756882604677 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.006640625, "completions/max_length": 1533.7, "completions/max_terminated_length": 1432.2, "completions/mean_length": 184.312890625, "completions/mean_terminated_length": 172.24881744384766, "completions/min_length": 65.1, "completions/min_terminated_length": 65.1, "entropy": 0.059445186494849624, "epoch": 16.231263383297645, "frac_reward_zero_std": 0.86875, "grad_norm": 0.1689453125, "learning_rate": 9.2421e-06, "loss": -0.0045, "num_tokens": 781641559.0, "reward": 1.0482617378234864, "reward_std": 0.18036468997597693, "rewards/reward_accuracy/mean": 0.948828125, "rewards/reward_accuracy/std": 0.1791354276239872, "rewards/reward_format/mean": 0.09943359494209289, "rewards/reward_format/std": 0.003223245334811509, "sampling/importance_sampling_ratio/max": 2.5627302289009095, "sampling/importance_sampling_ratio/mean": 0.9729063153266907, "sampling/importance_sampling_ratio/min": 0.12622721195220948, "sampling/sampling_logp_difference/max": 0.9489181518554688, "sampling/sampling_logp_difference/mean": 0.004606791539117694, "step": 7580, "step_time": 7.5197388113010675 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0125, "completions/max_length": 1859.7, "completions/max_terminated_length": 1559.5, "completions/mean_length": 192.3453125, "completions/mean_terminated_length": 169.30025329589844, "completions/min_length": 65.4, "completions/min_terminated_length": 65.4, "entropy": 0.05911666764877736, "epoch": 16.25267665952891, "frac_reward_zero_std": 0.85, "grad_norm": 0.55859375, "learning_rate": 9.2411e-06, "loss": -0.0129, "num_tokens": 782652747.0, "reward": 1.0407812595367432, "reward_std": 0.2180221512913704, "rewards/reward_accuracy/mean": 0.941796875, "rewards/reward_accuracy/std": 0.21496710255742074, "rewards/reward_format/mean": 0.09898437708616256, "rewards/reward_format/std": 0.007263506855815649, "sampling/importance_sampling_ratio/max": 2.4927805185317995, "sampling/importance_sampling_ratio/mean": 0.9739419400691987, "sampling/importance_sampling_ratio/min": 0.02291399594396353, "sampling/sampling_logp_difference/max": 0.8216204106807709, "sampling/sampling_logp_difference/mean": 0.004711908800527453, "step": 7590, "step_time": 8.995428224912029 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 3.0683374461659698e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 3.0683374461659698e-06, "completions/clipped_ratio": 0.011328125, "completions/max_length": 1449.3, "completions/max_terminated_length": 1176.9, "completions/mean_length": 184.8859375, "completions/mean_terminated_length": 164.10084228515626, "completions/min_length": 69.4, "completions/min_terminated_length": 69.4, "entropy": 0.05352129249367863, "epoch": 16.27408993576017, "frac_reward_zero_std": 0.875, "grad_norm": 0.369140625, "learning_rate": 9.240100000000002e-06, "loss": -0.0086, "num_tokens": 783642455.0, "reward": 1.0380859613418578, "reward_std": 0.20728197395801545, "rewards/reward_accuracy/mean": 0.9390625, "rewards/reward_accuracy/std": 0.20456125512719153, "rewards/reward_format/mean": 0.09902343899011612, "rewards/reward_format/std": 0.006093620299361646, "sampling/importance_sampling_ratio/max": 2.3876322984695433, "sampling/importance_sampling_ratio/mean": 0.981217336654663, "sampling/importance_sampling_ratio/min": 0.1588934175670147, "sampling/sampling_logp_difference/max": 0.964260995388031, "sampling/sampling_logp_difference/mean": 0.004306959128007293, "step": 7600, "step_time": 7.249025062093279 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 5.590339696937008e-07, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 5.590339696937008e-07, "completions/clipped_ratio": 0.00546875, "completions/max_length": 1498.2, "completions/max_terminated_length": 1155.3, "completions/mean_length": 170.191015625, "completions/mean_terminated_length": 160.04469604492186, "completions/min_length": 67.6, "completions/min_terminated_length": 67.6, "entropy": 0.04924966762773693, "epoch": 16.295503211991434, "frac_reward_zero_std": 0.8875, "grad_norm": 0.15625, "learning_rate": 9.239100000000001e-06, "loss": -0.0054, "num_tokens": 784602832.0, "reward": 1.0633593857288361, "reward_std": 0.15717458501458167, "rewards/reward_accuracy/mean": 0.963671875, "rewards/reward_accuracy/std": 0.15570423379540443, "rewards/reward_format/mean": 0.09968750104308129, "rewards/reward_format/std": 0.0032824984518811107, "sampling/importance_sampling_ratio/max": 2.334762215614319, "sampling/importance_sampling_ratio/mean": 0.9954739689826966, "sampling/importance_sampling_ratio/min": 0.12818059455603362, "sampling/sampling_logp_difference/max": 0.8631705939769745, "sampling/sampling_logp_difference/mean": 0.004174013645388186, "step": 7610, "step_time": 7.3299509002798 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005078125, "completions/max_length": 1703.7, "completions/max_terminated_length": 1307.1, "completions/mean_length": 172.357421875, "completions/mean_terminated_length": 162.76832733154296, "completions/min_length": 67.5, "completions/min_terminated_length": 67.5, "entropy": 0.05531854196451604, "epoch": 16.3169164882227, "frac_reward_zero_std": 0.86875, "grad_norm": 0.5234375, "learning_rate": 9.2381e-06, "loss": -0.0046, "num_tokens": 785571939.0, "reward": 1.065292978286743, "reward_std": 0.14945287883747368, "rewards/reward_accuracy/mean": 0.965625, "rewards/reward_accuracy/std": 0.14725296646356584, "rewards/reward_format/mean": 0.09966796934604645, "rewards/reward_format/std": 0.0035795941716060043, "sampling/importance_sampling_ratio/max": 2.616814112663269, "sampling/importance_sampling_ratio/mean": 0.9839324295520783, "sampling/importance_sampling_ratio/min": 0.1239270786754787, "sampling/sampling_logp_difference/max": 1.0493920564651489, "sampling/sampling_logp_difference/mean": 0.004632820677943528, "step": 7620, "step_time": 7.9969353492895605 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0015625, "completions/max_length": 1269.8, "completions/max_terminated_length": 1128.0, "completions/mean_length": 153.058984375, "completions/mean_terminated_length": 150.1091735839844, "completions/min_length": 63.3, "completions/min_terminated_length": 63.3, "entropy": 0.04154078084975481, "epoch": 16.338329764453963, "frac_reward_zero_std": 0.8625, "grad_norm": 0.8515625, "learning_rate": 9.237100000000002e-06, "loss": -0.0052, "num_tokens": 786478394.0, "reward": 1.0720898509025574, "reward_std": 0.14333806037902833, "rewards/reward_accuracy/mean": 0.972265625, "rewards/reward_accuracy/std": 0.14233369156718254, "rewards/reward_format/mean": 0.09982421919703484, "rewards/reward_format/std": 0.00257267439737916, "sampling/importance_sampling_ratio/max": 2.3864935398101808, "sampling/importance_sampling_ratio/mean": 0.9807554721832276, "sampling/importance_sampling_ratio/min": 0.13502856194972992, "sampling/sampling_logp_difference/max": 0.7638950228691102, "sampling/sampling_logp_difference/mean": 0.003957644826732576, "step": 7630, "step_time": 5.995953610501601 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01015625, "completions/max_length": 1340.5, "completions/max_terminated_length": 1228.0, "completions/mean_length": 182.675, "completions/mean_terminated_length": 163.88452911376953, "completions/min_length": 63.7, "completions/min_terminated_length": 63.7, "entropy": 0.05099497903138399, "epoch": 16.359743040685224, "frac_reward_zero_std": 0.8875, "grad_norm": 0.3984375, "learning_rate": 9.236100000000001e-06, "loss": -0.009, "num_tokens": 787467834.0, "reward": 1.0584179878234863, "reward_std": 0.1526952601969242, "rewards/reward_accuracy/mean": 0.959375, "rewards/reward_accuracy/std": 0.14928207248449327, "rewards/reward_format/mean": 0.09904296919703484, "rewards/reward_format/std": 0.006092970189638436, "sampling/importance_sampling_ratio/max": 2.373087000846863, "sampling/importance_sampling_ratio/mean": 0.975908488035202, "sampling/importance_sampling_ratio/min": 0.1168867040425539, "sampling/sampling_logp_difference/max": 1.0705070972442627, "sampling/sampling_logp_difference/mean": 0.004221283481456339, "step": 7640, "step_time": 6.835608499500085 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0046875, "completions/max_length": 1414.7, "completions/max_terminated_length": 1181.2, "completions/mean_length": 169.374609375, "completions/mean_terminated_length": 160.6475860595703, "completions/min_length": 64.8, "completions/min_terminated_length": 64.8, "entropy": 0.05177610446698964, "epoch": 16.38115631691649, "frac_reward_zero_std": 0.89375, "grad_norm": 0.3046875, "learning_rate": 9.2351e-06, "loss": -0.0075, "num_tokens": 788420425.0, "reward": 1.0700586318969727, "reward_std": 0.13926267251372337, "rewards/reward_accuracy/mean": 0.9703125, "rewards/reward_accuracy/std": 0.13807793483138084, "rewards/reward_format/mean": 0.09974609464406967, "rewards/reward_format/std": 0.002443795278668404, "sampling/importance_sampling_ratio/max": 2.3778449654579163, "sampling/importance_sampling_ratio/mean": 0.9877699494361878, "sampling/importance_sampling_ratio/min": 0.13400082159787416, "sampling/sampling_logp_difference/max": 1.0405210554599762, "sampling/sampling_logp_difference/mean": 0.004238462797366083, "step": 7650, "step_time": 6.899082937513595 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003125, "completions/max_length": 1554.7, "completions/max_terminated_length": 1261.0, "completions/mean_length": 168.283203125, "completions/mean_terminated_length": 162.45049133300782, "completions/min_length": 64.2, "completions/min_terminated_length": 64.2, "entropy": 0.04644826084841043, "epoch": 16.402569593147753, "frac_reward_zero_std": 0.8625, "grad_norm": 0.357421875, "learning_rate": 9.2341e-06, "loss": -0.01, "num_tokens": 789372430.0, "reward": 1.0603906512260437, "reward_std": 0.18892464116215707, "rewards/reward_accuracy/mean": 0.960546875, "rewards/reward_accuracy/std": 0.1880067139863968, "rewards/reward_format/mean": 0.09984375163912773, "rewards/reward_format/std": 0.0019482230301946402, "sampling/importance_sampling_ratio/max": 2.544890522956848, "sampling/importance_sampling_ratio/mean": 0.9915287435054779, "sampling/importance_sampling_ratio/min": 0.04895990882068872, "sampling/sampling_logp_difference/max": 0.9616687536239624, "sampling/sampling_logp_difference/mean": 0.004124602722004056, "step": 7660, "step_time": 7.299361201183638 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005859375, "completions/max_length": 1510.8, "completions/max_terminated_length": 1229.3, "completions/mean_length": 164.6, "completions/mean_terminated_length": 153.60628814697264, "completions/min_length": 62.9, "completions/min_terminated_length": 62.9, "entropy": 0.0490699180169031, "epoch": 16.423982869379014, "frac_reward_zero_std": 0.9, "grad_norm": 0.1767578125, "learning_rate": 9.2331e-06, "loss": -0.0099, "num_tokens": 790309038.0, "reward": 1.0584765672683716, "reward_std": 0.17143115103244783, "rewards/reward_accuracy/mean": 0.958984375, "rewards/reward_accuracy/std": 0.1691612996160984, "rewards/reward_format/mean": 0.09949218779802323, "rewards/reward_format/std": 0.004522916418500245, "sampling/importance_sampling_ratio/max": 2.257109534740448, "sampling/importance_sampling_ratio/mean": 0.984152489900589, "sampling/importance_sampling_ratio/min": 0.0974786639213562, "sampling/sampling_logp_difference/max": 0.9881892681121827, "sampling/sampling_logp_difference/mean": 0.004481027275323868, "step": 7670, "step_time": 7.129984531603986 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005078125, "completions/max_length": 1316.5, "completions/max_terminated_length": 1138.5, "completions/mean_length": 169.596875, "completions/mean_terminated_length": 160.16558685302735, "completions/min_length": 69.3, "completions/min_terminated_length": 69.3, "entropy": 0.05022773398086429, "epoch": 16.445396145610278, "frac_reward_zero_std": 0.90625, "grad_norm": 0.36328125, "learning_rate": 9.232100000000001e-06, "loss": -0.0018, "num_tokens": 791259590.0, "reward": 1.0602539241313935, "reward_std": 0.15934453681111335, "rewards/reward_accuracy/mean": 0.960546875, "rewards/reward_accuracy/std": 0.15829715132713318, "rewards/reward_format/mean": 0.09970703274011612, "rewards/reward_format/std": 0.0032527489587664605, "sampling/importance_sampling_ratio/max": 2.4553956985473633, "sampling/importance_sampling_ratio/mean": 0.9941927433013916, "sampling/importance_sampling_ratio/min": 0.10739152580499649, "sampling/sampling_logp_difference/max": 0.8538977980613709, "sampling/sampling_logp_difference/mean": 0.004091818793676793, "step": 7680, "step_time": 6.425901420903392 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.004296875, "completions/max_length": 1519.9, "completions/max_terminated_length": 1412.3, "completions/mean_length": 166.165234375, "completions/mean_terminated_length": 158.08096618652343, "completions/min_length": 62.3, "completions/min_terminated_length": 62.3, "entropy": 0.04452686025761068, "epoch": 16.466809421841543, "frac_reward_zero_std": 0.925, "grad_norm": 0.0, "learning_rate": 9.2311e-06, "loss": -0.0097, "num_tokens": 792200765.0, "reward": 1.0371679961681366, "reward_std": 0.22112304344773293, "rewards/reward_accuracy/mean": 0.9375, "rewards/reward_accuracy/std": 0.21990354135632514, "rewards/reward_format/mean": 0.09966796934604645, "rewards/reward_format/std": 0.003605699702166021, "sampling/importance_sampling_ratio/max": 2.496422255039215, "sampling/importance_sampling_ratio/mean": 0.9955473244190216, "sampling/importance_sampling_ratio/min": 0.10737686157226563, "sampling/sampling_logp_difference/max": 0.8879212141036987, "sampling/sampling_logp_difference/mean": 0.0037791854003444312, "step": 7690, "step_time": 7.404301803291309 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003125, "completions/max_length": 1437.1, "completions/max_terminated_length": 1057.9, "completions/mean_length": 155.59765625, "completions/mean_terminated_length": 149.72595825195313, "completions/min_length": 59.6, "completions/min_terminated_length": 59.6, "entropy": 0.04531383083667606, "epoch": 16.488222698072803, "frac_reward_zero_std": 0.9375, "grad_norm": 0.0, "learning_rate": 9.2301e-06, "loss": -0.0047, "num_tokens": 793111367.0, "reward": 1.0650195240974427, "reward_std": 0.14569900035858155, "rewards/reward_accuracy/mean": 0.965234375, "rewards/reward_accuracy/std": 0.14457572847604752, "rewards/reward_format/mean": 0.09978515580296517, "rewards/reward_format/std": 0.0026407783618196843, "sampling/importance_sampling_ratio/max": 2.327920925617218, "sampling/importance_sampling_ratio/mean": 0.9955122828483581, "sampling/importance_sampling_ratio/min": 0.1303410694003105, "sampling/sampling_logp_difference/max": 1.03319993019104, "sampling/sampling_logp_difference/mean": 0.003970151534304023, "step": 7700, "step_time": 6.816153975701309 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 9.5367431640625e-07, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 9.5367431640625e-07, "completions/clipped_ratio": 0.013671875, "completions/max_length": 1535.2, "completions/max_terminated_length": 1095.2, "completions/mean_length": 179.491015625, "completions/mean_terminated_length": 153.8226760864258, "completions/min_length": 65.5, "completions/min_terminated_length": 65.5, "entropy": 0.05156427307520062, "epoch": 16.509635974304068, "frac_reward_zero_std": 0.89375, "grad_norm": 0.384765625, "learning_rate": 9.229100000000001e-06, "loss": -0.0041, "num_tokens": 794090464.0, "reward": 1.063281273841858, "reward_std": 0.14494952335953712, "rewards/reward_accuracy/mean": 0.964453125, "rewards/reward_accuracy/std": 0.14091715216636658, "rewards/reward_format/mean": 0.09882812574505806, "rewards/reward_format/std": 0.006808904302306473, "sampling/importance_sampling_ratio/max": 2.5002842783927917, "sampling/importance_sampling_ratio/mean": 0.9845469772815705, "sampling/importance_sampling_ratio/min": 0.1530655580572784, "sampling/sampling_logp_difference/max": 0.9460946798324585, "sampling/sampling_logp_difference/mean": 0.00435259654186666, "step": 7710, "step_time": 7.550421977887163 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01015625, "completions/max_length": 1647.1, "completions/max_terminated_length": 1461.3, "completions/mean_length": 191.225, "completions/mean_terminated_length": 172.44109954833985, "completions/min_length": 69.2, "completions/min_terminated_length": 69.2, "entropy": 0.050309161515906455, "epoch": 16.531049250535332, "frac_reward_zero_std": 0.90625, "grad_norm": 0.0, "learning_rate": 9.2281e-06, "loss": -0.0033, "num_tokens": 795098016.0, "reward": 1.0714453101158141, "reward_std": 0.14180126413702965, "rewards/reward_accuracy/mean": 0.972265625, "rewards/reward_accuracy/std": 0.1381421059370041, "rewards/reward_format/mean": 0.0991796873509884, "rewards/reward_format/std": 0.006191711546853185, "sampling/importance_sampling_ratio/max": 2.449115180969238, "sampling/importance_sampling_ratio/mean": 0.9880630433559418, "sampling/importance_sampling_ratio/min": 0.07445607092231513, "sampling/sampling_logp_difference/max": 0.8514467597007751, "sampling/sampling_logp_difference/mean": 0.004171410016715527, "step": 7720, "step_time": 8.201009599788813 }, { "clip_ratio/high_max": 1.1742602509912103e-05, "clip_ratio/high_mean": 1.467825313739013e-06, "clip_ratio/low_mean": 6.865114301035647e-07, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 2.1543367438425774e-06, "completions/clipped_ratio": 0.008984375, "completions/max_length": 1248.8, "completions/max_terminated_length": 1087.3, "completions/mean_length": 173.484765625, "completions/mean_terminated_length": 156.65321502685546, "completions/min_length": 65.8, "completions/min_terminated_length": 65.8, "entropy": 0.04721232985612005, "epoch": 16.552462526766597, "frac_reward_zero_std": 0.84375, "grad_norm": 0.474609375, "learning_rate": 9.227100000000002e-06, "loss": -0.0055, "num_tokens": 796070233.0, "reward": 1.0535937666893005, "reward_std": 0.19303804337978364, "rewards/reward_accuracy/mean": 0.954296875, "rewards/reward_accuracy/std": 0.19049790725111962, "rewards/reward_format/mean": 0.09929687604308128, "rewards/reward_format/std": 0.004528086353093386, "sampling/importance_sampling_ratio/max": 2.3360175609588625, "sampling/importance_sampling_ratio/mean": 0.9925041139125824, "sampling/importance_sampling_ratio/min": 0.11616698205471039, "sampling/sampling_logp_difference/max": 1.0219195425510406, "sampling/sampling_logp_difference/mean": 0.004211497073993087, "step": 7730, "step_time": 6.378574513708008 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.008984375, "completions/max_length": 1824.6, "completions/max_terminated_length": 1574.6, "completions/mean_length": 181.920703125, "completions/mean_terminated_length": 165.1183853149414, "completions/min_length": 65.7, "completions/min_terminated_length": 65.7, "entropy": 0.0513056218624115, "epoch": 16.573875802997858, "frac_reward_zero_std": 0.8625, "grad_norm": 0.59765625, "learning_rate": 9.226100000000001e-06, "loss": -0.0071, "num_tokens": 797054878.0, "reward": 1.0558789134025575, "reward_std": 0.18936727792024613, "rewards/reward_accuracy/mean": 0.956640625, "rewards/reward_accuracy/std": 0.18604489415884018, "rewards/reward_format/mean": 0.09923828169703483, "rewards/reward_format/std": 0.006994776544161141, "sampling/importance_sampling_ratio/max": 2.5296329855918884, "sampling/importance_sampling_ratio/mean": 0.9826992750167847, "sampling/importance_sampling_ratio/min": 0.03513277173042297, "sampling/sampling_logp_difference/max": 0.945905065536499, "sampling/sampling_logp_difference/mean": 0.004355744412168861, "step": 7740, "step_time": 8.994800150583615 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0015625, "completions/max_length": 1099.5, "completions/max_terminated_length": 884.1, "completions/mean_length": 151.4828125, "completions/mean_terminated_length": 148.56255645751952, "completions/min_length": 62.1, "completions/min_terminated_length": 62.1, "entropy": 0.03964817326050252, "epoch": 16.595289079229122, "frac_reward_zero_std": 0.90625, "grad_norm": 0.5234375, "learning_rate": 9.2251e-06, "loss": 0.0017, "num_tokens": 797955410.0, "reward": 1.0768359661102296, "reward_std": 0.11830514296889305, "rewards/reward_accuracy/mean": 0.976953125, "rewards/reward_accuracy/std": 0.11771604567766189, "rewards/reward_format/mean": 0.09988281428813935, "rewards/reward_format/std": 0.001323223067447543, "sampling/importance_sampling_ratio/max": 2.3012039065361023, "sampling/importance_sampling_ratio/mean": 0.996568912267685, "sampling/importance_sampling_ratio/min": 0.2034597411751747, "sampling/sampling_logp_difference/max": 1.00937317609787, "sampling/sampling_logp_difference/mean": 0.0037071465281769632, "step": 7750, "step_time": 5.377568695822265 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003515625, "completions/max_length": 1536.9, "completions/max_terminated_length": 1450.1, "completions/mean_length": 170.814453125, "completions/mean_terminated_length": 164.22948303222657, "completions/min_length": 64.2, "completions/min_terminated_length": 64.2, "entropy": 0.051387568633072075, "epoch": 16.616702355460387, "frac_reward_zero_std": 0.84375, "grad_norm": 0.2060546875, "learning_rate": 9.2241e-06, "loss": -0.0091, "num_tokens": 798901735.0, "reward": 1.0661328315734864, "reward_std": 0.14783263802528382, "rewards/reward_accuracy/mean": 0.96640625, "rewards/reward_accuracy/std": 0.1465184636414051, "rewards/reward_format/mean": 0.09972656294703483, "rewards/reward_format/std": 0.00299612102098763, "sampling/importance_sampling_ratio/max": 2.563726031780243, "sampling/importance_sampling_ratio/mean": 0.9753252685070037, "sampling/importance_sampling_ratio/min": 0.12071237601339817, "sampling/sampling_logp_difference/max": 0.8235949575901031, "sampling/sampling_logp_difference/mean": 0.004235922615043819, "step": 7760, "step_time": 7.485675041918876 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.016796875, "completions/max_length": 1656.3, "completions/max_terminated_length": 1493.5, "completions/mean_length": 209.28515625, "completions/mean_terminated_length": 180.4291030883789, "completions/min_length": 66.6, "completions/min_terminated_length": 66.6, "entropy": 0.056952106021344664, "epoch": 16.638115631691647, "frac_reward_zero_std": 0.85625, "grad_norm": 0.52734375, "learning_rate": 9.2231e-06, "loss": -0.0089, "num_tokens": 799960129.0, "reward": 1.0343554854393004, "reward_std": 0.19792354255914688, "rewards/reward_accuracy/mean": 0.9359375, "rewards/reward_accuracy/std": 0.19391807690262794, "rewards/reward_format/mean": 0.09841796979308129, "rewards/reward_format/std": 0.00651839436031878, "sampling/importance_sampling_ratio/max": 2.535571241378784, "sampling/importance_sampling_ratio/mean": 0.9709712982177734, "sampling/importance_sampling_ratio/min": 0.05337768867611885, "sampling/sampling_logp_difference/max": 1.1966431975364684, "sampling/sampling_logp_difference/mean": 0.004524283809587359, "step": 7770, "step_time": 8.126159263201407 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00859375, "completions/max_length": 1453.1, "completions/max_terminated_length": 1126.4, "completions/mean_length": 175.510546875, "completions/mean_terminated_length": 159.41243438720704, "completions/min_length": 67.6, "completions/min_terminated_length": 67.6, "entropy": 0.04718698477372527, "epoch": 16.659528907922912, "frac_reward_zero_std": 0.89375, "grad_norm": 0.404296875, "learning_rate": 9.222100000000001e-06, "loss": -0.002, "num_tokens": 800930604.0, "reward": 1.071582055091858, "reward_std": 0.1455278627574444, "rewards/reward_accuracy/mean": 0.972265625, "rewards/reward_accuracy/std": 0.14231296256184578, "rewards/reward_format/mean": 0.09931640699505806, "rewards/reward_format/std": 0.004727099556475878, "sampling/importance_sampling_ratio/max": 2.5430553555488586, "sampling/importance_sampling_ratio/mean": 0.9843396961688995, "sampling/importance_sampling_ratio/min": 0.122025528550148, "sampling/sampling_logp_difference/max": 0.8583072304725647, "sampling/sampling_logp_difference/mean": 0.004209183575585485, "step": 7780, "step_time": 7.1859231060079765 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 1328.2, "completions/max_terminated_length": 1103.0, "completions/mean_length": 156.35703125, "completions/mean_terminated_length": 149.10735168457032, "completions/min_length": 65.5, "completions/min_terminated_length": 65.5, "entropy": 0.042606739862822, "epoch": 16.680942184154176, "frac_reward_zero_std": 0.925, "grad_norm": 0.265625, "learning_rate": 9.2211e-06, "loss": -0.0021, "num_tokens": 801849406.0, "reward": 1.0766601800918578, "reward_std": 0.12851392328739167, "rewards/reward_accuracy/mean": 0.976953125, "rewards/reward_accuracy/std": 0.12701146379113198, "rewards/reward_format/mean": 0.09970703274011612, "rewards/reward_format/std": 0.002431714185513556, "sampling/importance_sampling_ratio/max": 2.47778434753418, "sampling/importance_sampling_ratio/mean": 0.997530484199524, "sampling/importance_sampling_ratio/min": 0.13741500955075026, "sampling/sampling_logp_difference/max": 1.057798719406128, "sampling/sampling_logp_difference/mean": 0.004012746992520988, "step": 7790, "step_time": 6.560001490192372 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.004296875, "completions/max_length": 1405.1, "completions/max_terminated_length": 1231.3, "completions/mean_length": 159.006640625, "completions/mean_terminated_length": 150.84038391113282, "completions/min_length": 66.7, "completions/min_terminated_length": 66.7, "entropy": 0.046332542807795106, "epoch": 16.70235546038544, "frac_reward_zero_std": 0.91875, "grad_norm": 0.90234375, "learning_rate": 9.2201e-06, "loss": 0.0016, "num_tokens": 802772575.0, "reward": 1.062460970878601, "reward_std": 0.16013382407836615, "rewards/reward_accuracy/mean": 0.962890625, "rewards/reward_accuracy/std": 0.15820884853601455, "rewards/reward_format/mean": 0.09957031533122063, "rewards/reward_format/std": 0.003950121020898223, "sampling/importance_sampling_ratio/max": 2.2630041003227235, "sampling/importance_sampling_ratio/mean": 0.9781794428825379, "sampling/importance_sampling_ratio/min": 0.11480211019515991, "sampling/sampling_logp_difference/max": 0.9216413736343384, "sampling/sampling_logp_difference/mean": 0.00394847805146128, "step": 7800, "step_time": 6.911890725800186 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001953125, "completions/max_length": 1025.4, "completions/max_terminated_length": 996.9, "completions/mean_length": 150.25390625, "completions/mean_terminated_length": 146.58380737304688, "completions/min_length": 60.1, "completions/min_terminated_length": 60.1, "entropy": 0.0456536918412894, "epoch": 16.7237687366167, "frac_reward_zero_std": 0.91875, "grad_norm": 0.396484375, "learning_rate": 9.219100000000001e-06, "loss": -0.0018, "num_tokens": 803669433.0, "reward": 1.0674023747444152, "reward_std": 0.15069975778460504, "rewards/reward_accuracy/mean": 0.967578125, "rewards/reward_accuracy/std": 0.14958580061793328, "rewards/reward_format/mean": 0.09982422068715095, "rewards/reward_format/std": 0.0017759525682777167, "sampling/importance_sampling_ratio/max": 2.512754464149475, "sampling/importance_sampling_ratio/mean": 0.998466145992279, "sampling/importance_sampling_ratio/min": 0.12625685408711435, "sampling/sampling_logp_difference/max": 0.8312036693096161, "sampling/sampling_logp_difference/mean": 0.004134365939535201, "step": 7810, "step_time": 4.971902744504041 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.002734375, "completions/max_length": 1403.2, "completions/max_terminated_length": 968.3, "completions/mean_length": 158.720703125, "completions/mean_terminated_length": 153.60763092041014, "completions/min_length": 69.2, "completions/min_terminated_length": 69.2, "entropy": 0.04434063301887363, "epoch": 16.745182012847966, "frac_reward_zero_std": 0.86875, "grad_norm": 0.0, "learning_rate": 9.2181e-06, "loss": -0.0027, "num_tokens": 804604494.0, "reward": 1.0661328196525575, "reward_std": 0.15368699431419372, "rewards/reward_accuracy/mean": 0.96640625, "rewards/reward_accuracy/std": 0.1519726999104023, "rewards/reward_format/mean": 0.09972656294703483, "rewards/reward_format/std": 0.003483161237090826, "sampling/importance_sampling_ratio/max": 2.4614560127258303, "sampling/importance_sampling_ratio/mean": 0.9900545418262482, "sampling/importance_sampling_ratio/min": 0.1255536837503314, "sampling/sampling_logp_difference/max": 1.4378287553787232, "sampling/sampling_logp_difference/mean": 0.004353168071247637, "step": 7820, "step_time": 6.579145183684886 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005859375, "completions/max_length": 1606.5, "completions/max_terminated_length": 1428.8, "completions/mean_length": 172.39921875, "completions/mean_terminated_length": 161.42025909423828, "completions/min_length": 67.7, "completions/min_terminated_length": 67.7, "entropy": 0.050095995678566395, "epoch": 16.76659528907923, "frac_reward_zero_std": 0.9125, "grad_norm": 0.0, "learning_rate": 9.2171e-06, "loss": -0.0059, "num_tokens": 805565548.0, "reward": 1.0632031321525575, "reward_std": 0.1591066375374794, "rewards/reward_accuracy/mean": 0.963671875, "rewards/reward_accuracy/std": 0.15679568126797677, "rewards/reward_format/mean": 0.0995312511920929, "rewards/reward_format/std": 0.004287804500199855, "sampling/importance_sampling_ratio/max": 2.5324663639068605, "sampling/importance_sampling_ratio/mean": 0.982275378704071, "sampling/importance_sampling_ratio/min": 0.09124839901924134, "sampling/sampling_logp_difference/max": 0.9770475625991821, "sampling/sampling_logp_difference/mean": 0.004294572421349585, "step": 7830, "step_time": 7.903159433606197 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005859375, "completions/max_length": 1894.9, "completions/max_terminated_length": 1611.0, "completions/mean_length": 187.95703125, "completions/mean_terminated_length": 177.0829605102539, "completions/min_length": 70.0, "completions/min_terminated_length": 70.0, "entropy": 0.05079558119177818, "epoch": 16.78800856531049, "frac_reward_zero_std": 0.825, "grad_norm": 0.5, "learning_rate": 9.216100000000001e-06, "loss": -0.0091, "num_tokens": 806572606.0, "reward": 1.0513867557048797, "reward_std": 0.20299932807683946, "rewards/reward_accuracy/mean": 0.951953125, "rewards/reward_accuracy/std": 0.20061067268252372, "rewards/reward_format/mean": 0.09943359643220902, "rewards/reward_format/std": 0.005329398345202208, "sampling/importance_sampling_ratio/max": 2.6396435499191284, "sampling/importance_sampling_ratio/mean": 0.9926622807979584, "sampling/importance_sampling_ratio/min": 0.11464942563325167, "sampling/sampling_logp_difference/max": 0.990067183971405, "sampling/sampling_logp_difference/mean": 0.00419128944631666, "step": 7840, "step_time": 8.954967654502251 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 1.060693330146023e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 1.060693330146023e-06, "completions/clipped_ratio": 0.019921875, "completions/max_length": 2048.0, "completions/max_terminated_length": 1643.3, "completions/mean_length": 211.148046875, "completions/mean_terminated_length": 173.8470657348633, "completions/min_length": 68.5, "completions/min_terminated_length": 68.5, "entropy": 0.0661642503226176, "epoch": 16.809421841541756, "frac_reward_zero_std": 0.875, "grad_norm": 0.06689453125, "learning_rate": 9.215100000000001e-06, "loss": -0.0088, "num_tokens": 807634265.0, "reward": 1.0313476920127869, "reward_std": 0.2388788156211376, "rewards/reward_accuracy/mean": 0.9328125, "rewards/reward_accuracy/std": 0.23295548632740976, "rewards/reward_format/mean": 0.0985351599752903, "rewards/reward_format/std": 0.010887856548652052, "sampling/importance_sampling_ratio/max": 2.439284348487854, "sampling/importance_sampling_ratio/mean": 0.9685746312141419, "sampling/importance_sampling_ratio/min": 0.010910131270065904, "sampling/sampling_logp_difference/max": 1.0593733429908752, "sampling/sampling_logp_difference/mean": 0.004693446471355856, "step": 7850, "step_time": 10.37301104129583 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00703125, "completions/max_length": 1298.7, "completions/max_terminated_length": 1231.1, "completions/mean_length": 168.576171875, "completions/mean_terminated_length": 155.38970947265625, "completions/min_length": 67.9, "completions/min_terminated_length": 67.9, "entropy": 0.0520853090332821, "epoch": 16.83083511777302, "frac_reward_zero_std": 0.90625, "grad_norm": 0.0, "learning_rate": 9.2141e-06, "loss": -0.0059, "num_tokens": 808579276.0, "reward": 1.0369336247444152, "reward_std": 0.21079855188727378, "rewards/reward_accuracy/mean": 0.9375, "rewards/reward_accuracy/std": 0.208419618755579, "rewards/reward_format/mean": 0.09943359568715096, "rewards/reward_format/std": 0.004434091318398714, "sampling/importance_sampling_ratio/max": 2.4801127433776857, "sampling/importance_sampling_ratio/mean": 0.9865872621536255, "sampling/importance_sampling_ratio/min": 0.1934816412627697, "sampling/sampling_logp_difference/max": 0.920253586769104, "sampling/sampling_logp_difference/mean": 0.004261549282819033, "step": 7860, "step_time": 6.434256394812837 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 2.670781123015331e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 2.670781123015331e-06, "completions/clipped_ratio": 0.008984375, "completions/max_length": 1546.7, "completions/max_terminated_length": 1279.3, "completions/mean_length": 184.190625, "completions/mean_terminated_length": 167.60396881103514, "completions/min_length": 63.7, "completions/min_terminated_length": 63.7, "entropy": 0.054577568615786734, "epoch": 16.85224839400428, "frac_reward_zero_std": 0.88125, "grad_norm": 0.197265625, "learning_rate": 9.2131e-06, "loss": -0.0069, "num_tokens": 809563332.0, "reward": 1.0346875071525574, "reward_std": 0.21321952044963838, "rewards/reward_accuracy/mean": 0.935546875, "rewards/reward_accuracy/std": 0.21048423573374747, "rewards/reward_format/mean": 0.09914062544703484, "rewards/reward_format/std": 0.005468779825605452, "sampling/importance_sampling_ratio/max": 2.4845311403274537, "sampling/importance_sampling_ratio/mean": 0.9815246641635895, "sampling/importance_sampling_ratio/min": 0.0818779714871198, "sampling/sampling_logp_difference/max": 0.9205900669097901, "sampling/sampling_logp_difference/mean": 0.004278291272930801, "step": 7870, "step_time": 7.7146914764132815 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0046875, "completions/max_length": 1694.3, "completions/max_terminated_length": 1119.8, "completions/mean_length": 160.0203125, "completions/mean_terminated_length": 151.16456909179686, "completions/min_length": 64.2, "completions/min_terminated_length": 64.2, "entropy": 0.04444997753016651, "epoch": 16.873661670235546, "frac_reward_zero_std": 0.875, "grad_norm": 0.3046875, "learning_rate": 9.212100000000001e-06, "loss": -0.0014, "num_tokens": 810493800.0, "reward": 1.0691601634025574, "reward_std": 0.1456493191421032, "rewards/reward_accuracy/mean": 0.96953125, "rewards/reward_accuracy/std": 0.1436914436519146, "rewards/reward_format/mean": 0.09962890669703484, "rewards/reward_format/std": 0.004088753298856318, "sampling/importance_sampling_ratio/max": 2.4229501128196715, "sampling/importance_sampling_ratio/mean": 0.9884009003639221, "sampling/importance_sampling_ratio/min": 0.11865779757499695, "sampling/sampling_logp_difference/max": 0.9414014637470245, "sampling/sampling_logp_difference/mean": 0.004059745161794126, "step": 7880, "step_time": 7.8519132131012155 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003125, "completions/max_length": 1272.1, "completions/max_terminated_length": 1050.7, "completions/mean_length": 164.132421875, "completions/mean_terminated_length": 158.4006362915039, "completions/min_length": 65.4, "completions/min_terminated_length": 65.4, "entropy": 0.052544075553305446, "epoch": 16.89507494646681, "frac_reward_zero_std": 0.88125, "grad_norm": 0.0, "learning_rate": 9.2111e-06, "loss": -0.0097, "num_tokens": 811431051.0, "reward": 1.0637109518051147, "reward_std": 0.15563071221113206, "rewards/reward_accuracy/mean": 0.9640625, "rewards/reward_accuracy/std": 0.15434372648596764, "rewards/reward_format/mean": 0.09964843913912773, "rewards/reward_format/std": 0.0033515871502459047, "sampling/importance_sampling_ratio/max": 2.5649507522583006, "sampling/importance_sampling_ratio/mean": 0.9779794991016388, "sampling/importance_sampling_ratio/min": 0.15262180827558042, "sampling/sampling_logp_difference/max": 1.103963178396225, "sampling/sampling_logp_difference/mean": 0.0045566009124740955, "step": 7890, "step_time": 6.163933215700672 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.004296875, "completions/max_length": 1509.5, "completions/max_terminated_length": 1248.2, "completions/mean_length": 164.26484375, "completions/mean_terminated_length": 156.22708587646486, "completions/min_length": 63.2, "completions/min_terminated_length": 63.2, "entropy": 0.05159259357023984, "epoch": 16.916488222698074, "frac_reward_zero_std": 0.90625, "grad_norm": 0.50390625, "learning_rate": 9.2101e-06, "loss": -0.0008, "num_tokens": 812373585.0, "reward": 1.0507226705551147, "reward_std": 0.207310052216053, "rewards/reward_accuracy/mean": 0.951171875, "rewards/reward_accuracy/std": 0.20540243983268738, "rewards/reward_format/mean": 0.09955078214406968, "rewards/reward_format/std": 0.004364579729735851, "sampling/importance_sampling_ratio/max": 2.67408447265625, "sampling/importance_sampling_ratio/mean": 0.9874327719211579, "sampling/importance_sampling_ratio/min": 0.07246538326144218, "sampling/sampling_logp_difference/max": 1.087788814306259, "sampling/sampling_logp_difference/mean": 0.004623599885962904, "step": 7900, "step_time": 7.237487175303977 }, { "clip_ratio/high_max": 1.4321722846943886e-05, "clip_ratio/high_mean": 1.7902153558679857e-06, "clip_ratio/low_mean": 5.201325029702275e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 6.991540476519731e-06, "completions/clipped_ratio": 0.006640625, "completions/max_length": 1481.6, "completions/max_terminated_length": 1007.5, "completions/mean_length": 157.823828125, "completions/mean_terminated_length": 145.2296340942383, "completions/min_length": 63.4, "completions/min_terminated_length": 63.4, "entropy": 0.04617567043751478, "epoch": 16.937901498929335, "frac_reward_zero_std": 0.85625, "grad_norm": 0.0, "learning_rate": 9.209100000000001e-06, "loss": -0.0093, "num_tokens": 813293022.0, "reward": 1.050488293170929, "reward_std": 0.1860833279788494, "rewards/reward_accuracy/mean": 0.951171875, "rewards/reward_accuracy/std": 0.1832117460668087, "rewards/reward_format/mean": 0.09931640699505806, "rewards/reward_format/std": 0.005324616725556552, "sampling/importance_sampling_ratio/max": 2.542310643196106, "sampling/importance_sampling_ratio/mean": 0.9819382846355438, "sampling/importance_sampling_ratio/min": 0.15245852544903754, "sampling/sampling_logp_difference/max": 0.8428882718086242, "sampling/sampling_logp_difference/mean": 0.004435072559863329, "step": 7910, "step_time": 7.167223082206329 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.004296875, "completions/max_length": 1559.2, "completions/max_terminated_length": 1273.7, "completions/mean_length": 155.5296875, "completions/mean_terminated_length": 147.4967025756836, "completions/min_length": 66.2, "completions/min_terminated_length": 66.2, "entropy": 0.044794931169599296, "epoch": 16.9593147751606, "frac_reward_zero_std": 0.88125, "grad_norm": 0.46484375, "learning_rate": 9.2081e-06, "loss": -0.0088, "num_tokens": 814204074.0, "reward": 1.0657812714576722, "reward_std": 0.15105870068073274, "rewards/reward_accuracy/mean": 0.966015625, "rewards/reward_accuracy/std": 0.1500009149312973, "rewards/reward_format/mean": 0.0997656263411045, "rewards/reward_format/std": 0.002492625452578068, "sampling/importance_sampling_ratio/max": 2.4844964861869814, "sampling/importance_sampling_ratio/mean": 0.9900657832622528, "sampling/importance_sampling_ratio/min": 0.10017420575022698, "sampling/sampling_logp_difference/max": 0.9110117316246032, "sampling/sampling_logp_difference/mean": 0.004133661114610732, "step": 7920, "step_time": 7.317238017416093 }, { "clip_ratio/high_max": 6.980444013606756e-05, "clip_ratio/high_mean": 8.725555017008445e-06, "clip_ratio/low_mean": 7.477683539036661e-07, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 9.473323370912112e-06, "completions/clipped_ratio": 0.01328125, "completions/max_length": 1472.7, "completions/max_terminated_length": 1213.5, "completions/mean_length": 175.2140625, "completions/mean_terminated_length": 150.09844055175782, "completions/min_length": 63.5, "completions/min_terminated_length": 63.5, "entropy": 0.04913273158017546, "epoch": 16.980728051391864, "frac_reward_zero_std": 0.86875, "grad_norm": 0.028564453125, "learning_rate": 9.2071e-06, "loss": 0.0029, "num_tokens": 815170270.0, "reward": 1.0486914038658142, "reward_std": 0.19494396820664406, "rewards/reward_accuracy/mean": 0.949609375, "rewards/reward_accuracy/std": 0.1916939251124859, "rewards/reward_format/mean": 0.09908203184604644, "rewards/reward_format/std": 0.005961838387884199, "sampling/importance_sampling_ratio/max": 2.5625113964080812, "sampling/importance_sampling_ratio/mean": 0.9907922148704529, "sampling/importance_sampling_ratio/min": 0.15967635922133921, "sampling/sampling_logp_difference/max": 0.9309791684150696, "sampling/sampling_logp_difference/mean": 0.004130323929712176, "step": 7930, "step_time": 7.560866497407551 }, { "clip_ratio/high_max": 0.0001038600574247539, "clip_ratio/high_mean": 1.2982507178094238e-05, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 1.2982507178094238e-05, "completions/clipped_ratio": 0.003515625, "completions/max_length": 1580.3, "completions/max_terminated_length": 1272.1, "completions/mean_length": 150.480859375, "completions/mean_terminated_length": 143.80609512329102, "completions/min_length": 67.2, "completions/min_terminated_length": 67.2, "entropy": 0.04085923647508025, "epoch": 17.002141327623125, "frac_reward_zero_std": 0.89375, "grad_norm": 0.423828125, "learning_rate": 9.206100000000002e-06, "loss": -0.0079, "num_tokens": 816072445.0, "reward": 1.053671908378601, "reward_std": 0.1871044233441353, "rewards/reward_accuracy/mean": 0.95390625, "rewards/reward_accuracy/std": 0.18586539700627328, "rewards/reward_format/mean": 0.0997656263411045, "rewards/reward_format/std": 0.0024736269377171995, "sampling/importance_sampling_ratio/max": 2.5696367025375366, "sampling/importance_sampling_ratio/mean": 0.9886203289031983, "sampling/importance_sampling_ratio/min": 0.08471763841807842, "sampling/sampling_logp_difference/max": 0.9872049689292908, "sampling/sampling_logp_difference/mean": 0.003960961941629648, "step": 7940, "step_time": 7.367305375190336 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00546875, "completions/max_length": 1731.7, "completions/max_terminated_length": 1384.3, "completions/mean_length": 166.268359375, "completions/mean_terminated_length": 155.9521484375, "completions/min_length": 65.5, "completions/min_terminated_length": 65.5, "entropy": 0.046828650124371055, "epoch": 17.02355460385439, "frac_reward_zero_std": 0.85, "grad_norm": 0.46875, "learning_rate": 9.205100000000001e-06, "loss": -0.0111, "num_tokens": 817024604.0, "reward": 1.0562304735183716, "reward_std": 0.18308002278208732, "rewards/reward_accuracy/mean": 0.956640625, "rewards/reward_accuracy/std": 0.18140590488910674, "rewards/reward_format/mean": 0.09958984404802322, "rewards/reward_format/std": 0.004021363588981331, "sampling/importance_sampling_ratio/max": 2.3097330212593077, "sampling/importance_sampling_ratio/mean": 0.984870332479477, "sampling/importance_sampling_ratio/min": 0.10082997754216194, "sampling/sampling_logp_difference/max": 1.1282589197158814, "sampling/sampling_logp_difference/mean": 0.004153356025926769, "step": 7950, "step_time": 8.074162628484192 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0109375, "completions/max_length": 1618.6, "completions/max_terminated_length": 1554.1, "completions/mean_length": 189.009375, "completions/mean_terminated_length": 168.7215606689453, "completions/min_length": 72.8, "completions/min_terminated_length": 72.8, "entropy": 0.05142954755574465, "epoch": 17.044967880085654, "frac_reward_zero_std": 0.8875, "grad_norm": 0.267578125, "learning_rate": 9.2041e-06, "loss": 0.0004, "num_tokens": 818028884.0, "reward": 1.0421875357627868, "reward_std": 0.20422518849372864, "rewards/reward_accuracy/mean": 0.94296875, "rewards/reward_accuracy/std": 0.2015540987253189, "rewards/reward_format/mean": 0.09921875223517418, "rewards/reward_format/std": 0.005188230704516172, "sampling/importance_sampling_ratio/max": 2.5283949613571166, "sampling/importance_sampling_ratio/mean": 0.9811752736568451, "sampling/importance_sampling_ratio/min": 0.08870219103991986, "sampling/sampling_logp_difference/max": 1.080541741847992, "sampling/sampling_logp_difference/mean": 0.00421747756190598, "step": 7960, "step_time": 8.140294003803865 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001953125, "completions/max_length": 1312.0, "completions/max_terminated_length": 885.9, "completions/mean_length": 149.602734375, "completions/mean_terminated_length": 145.8874366760254, "completions/min_length": 63.7, "completions/min_terminated_length": 63.7, "entropy": 0.04356088605709374, "epoch": 17.066381156316915, "frac_reward_zero_std": 0.9, "grad_norm": 0.875, "learning_rate": 9.2031e-06, "loss": -0.0035, "num_tokens": 818926395.0, "reward": 1.0639062762260436, "reward_std": 0.1527715802192688, "rewards/reward_accuracy/mean": 0.9640625, "rewards/reward_accuracy/std": 0.15149355307221413, "rewards/reward_format/mean": 0.09984375163912773, "rewards/reward_format/std": 0.0021321487613022326, "sampling/importance_sampling_ratio/max": 2.35757462978363, "sampling/importance_sampling_ratio/mean": 0.9836565732955933, "sampling/importance_sampling_ratio/min": 0.15019432380795478, "sampling/sampling_logp_difference/max": 0.774815022945404, "sampling/sampling_logp_difference/mean": 0.004023663070984185, "step": 7970, "step_time": 6.279906190003385 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0078125, "completions/max_length": 1709.4, "completions/max_terminated_length": 1513.2, "completions/mean_length": 173.560546875, "completions/mean_terminated_length": 158.8384216308594, "completions/min_length": 64.9, "completions/min_terminated_length": 64.9, "entropy": 0.05431927829049528, "epoch": 17.08779443254818, "frac_reward_zero_std": 0.88125, "grad_norm": 0.251953125, "learning_rate": 9.202100000000001e-06, "loss": -0.009, "num_tokens": 819898086.0, "reward": 1.0622070550918579, "reward_std": 0.17893914729356766, "rewards/reward_accuracy/mean": 0.962890625, "rewards/reward_accuracy/std": 0.17551999017596245, "rewards/reward_format/mean": 0.09931640774011612, "rewards/reward_format/std": 0.005934580159373581, "sampling/importance_sampling_ratio/max": 2.374729299545288, "sampling/importance_sampling_ratio/mean": 0.9698988676071167, "sampling/importance_sampling_ratio/min": 0.08764871843159198, "sampling/sampling_logp_difference/max": 0.934401524066925, "sampling/sampling_logp_difference/mean": 0.0044356407830491665, "step": 7980, "step_time": 8.086257524800022 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003125, "completions/max_length": 1213.7, "completions/max_terminated_length": 987.5, "completions/mean_length": 156.43203125, "completions/mean_terminated_length": 150.5750762939453, "completions/min_length": 66.8, "completions/min_terminated_length": 66.8, "entropy": 0.04311148843262345, "epoch": 17.109207708779444, "frac_reward_zero_std": 0.94375, "grad_norm": 0.0, "learning_rate": 9.2011e-06, "loss": -0.0067, "num_tokens": 820817208.0, "reward": 1.0868359565734864, "reward_std": 0.07326010316610336, "rewards/reward_accuracy/mean": 0.987109375, "rewards/reward_accuracy/std": 0.07122102156281471, "rewards/reward_format/mean": 0.0997265636920929, "rewards/reward_format/std": 0.0031184528023004534, "sampling/importance_sampling_ratio/max": 2.3598856806755064, "sampling/importance_sampling_ratio/mean": 0.9913330137729645, "sampling/importance_sampling_ratio/min": 0.15553861558437349, "sampling/sampling_logp_difference/max": 0.9304038405418396, "sampling/sampling_logp_difference/mean": 0.003903127904050052, "step": 7990, "step_time": 5.909126733604353 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.004296875, "completions/max_length": 1521.6, "completions/max_terminated_length": 1144.3, "completions/mean_length": 158.815625, "completions/mean_terminated_length": 150.73645629882813, "completions/min_length": 67.0, "completions/min_terminated_length": 67.0, "entropy": 0.044104913552291694, "epoch": 17.130620985010708, "frac_reward_zero_std": 0.90625, "grad_norm": 0.640625, "learning_rate": 9.2001e-06, "loss": -0.008, "num_tokens": 821737840.0, "reward": 1.054785168170929, "reward_std": 0.17136799171566963, "rewards/reward_accuracy/mean": 0.955078125, "rewards/reward_accuracy/std": 0.1695178508758545, "rewards/reward_format/mean": 0.09970703199505807, "rewards/reward_format/std": 0.0034111268585547807, "sampling/importance_sampling_ratio/max": 2.3898055076599123, "sampling/importance_sampling_ratio/mean": 0.9928334772586822, "sampling/importance_sampling_ratio/min": 0.1106077965348959, "sampling/sampling_logp_difference/max": 0.8412916123867035, "sampling/sampling_logp_difference/mean": 0.004080133489333093, "step": 8000, "step_time": 7.222813133327873 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00625, "completions/max_length": 1525.3, "completions/max_terminated_length": 1170.0, "completions/mean_length": 167.216796875, "completions/mean_terminated_length": 155.45998764038086, "completions/min_length": 63.6, "completions/min_terminated_length": 63.6, "entropy": 0.04964595704805106, "epoch": 17.15203426124197, "frac_reward_zero_std": 0.875, "grad_norm": 0.0, "learning_rate": 9.199100000000001e-06, "loss": -0.0088, "num_tokens": 822684683.0, "reward": 1.0537500023841857, "reward_std": 0.19027013778686525, "rewards/reward_accuracy/mean": 0.954296875, "rewards/reward_accuracy/std": 0.1875868022441864, "rewards/reward_format/mean": 0.09945312589406967, "rewards/reward_format/std": 0.004815586167387665, "sampling/importance_sampling_ratio/max": 2.465027356147766, "sampling/importance_sampling_ratio/mean": 0.9932780802249909, "sampling/importance_sampling_ratio/min": 0.0766778826713562, "sampling/sampling_logp_difference/max": 0.8728473544120788, "sampling/sampling_logp_difference/mean": 0.004328899155370891, "step": 8010, "step_time": 7.266196236776887 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0015625, "completions/max_length": 1377.8, "completions/max_terminated_length": 1135.1, "completions/mean_length": 153.5546875, "completions/mean_terminated_length": 150.6128890991211, "completions/min_length": 68.1, "completions/min_terminated_length": 68.1, "entropy": 0.04408352908212691, "epoch": 17.173447537473233, "frac_reward_zero_std": 0.875, "grad_norm": 0.38671875, "learning_rate": 9.198100000000001e-06, "loss": 0.0002, "num_tokens": 823598279.0, "reward": 1.0722070455551147, "reward_std": 0.14976460859179497, "rewards/reward_accuracy/mean": 0.972265625, "rewards/reward_accuracy/std": 0.14912991896271705, "rewards/reward_format/mean": 0.09994140714406967, "rewards/reward_format/std": 0.0009375000605359674, "sampling/importance_sampling_ratio/max": 2.5915315628051756, "sampling/importance_sampling_ratio/mean": 0.9916715264320374, "sampling/importance_sampling_ratio/min": 0.10200010389089584, "sampling/sampling_logp_difference/max": 0.774946790933609, "sampling/sampling_logp_difference/mean": 0.00414877466391772, "step": 8020, "step_time": 6.398435724916635 }, { "clip_ratio/high_max": 1.4514630311168731e-05, "clip_ratio/high_mean": 1.8143287888960914e-06, "clip_ratio/low_mean": 4.222608004056383e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 6.036936792952474e-06, "completions/clipped_ratio": 0.013671875, "completions/max_length": 1604.1, "completions/max_terminated_length": 1132.6, "completions/mean_length": 180.948828125, "completions/mean_terminated_length": 155.14728546142578, "completions/min_length": 67.6, "completions/min_terminated_length": 67.6, "entropy": 0.050092419935390355, "epoch": 17.194860813704498, "frac_reward_zero_std": 0.8875, "grad_norm": 0.1962890625, "learning_rate": 9.1971e-06, "loss": -0.0025, "num_tokens": 824573140.0, "reward": 1.0660547137260437, "reward_std": 0.15692453682422638, "rewards/reward_accuracy/mean": 0.9671875, "rewards/reward_accuracy/std": 0.15192557871341705, "rewards/reward_format/mean": 0.09886718913912773, "rewards/reward_format/std": 0.007547743059694767, "sampling/importance_sampling_ratio/max": 2.5463247299194336, "sampling/importance_sampling_ratio/mean": 0.9881521940231324, "sampling/importance_sampling_ratio/min": 0.09340537302196025, "sampling/sampling_logp_difference/max": 1.4276350498199464, "sampling/sampling_logp_difference/mean": 0.004309175512753427, "step": 8030, "step_time": 8.047182117105695 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005078125, "completions/max_length": 1662.9, "completions/max_terminated_length": 1482.0, "completions/mean_length": 168.873828125, "completions/mean_terminated_length": 159.34021911621093, "completions/min_length": 65.8, "completions/min_terminated_length": 65.8, "entropy": 0.04604514669626951, "epoch": 17.21627408993576, "frac_reward_zero_std": 0.875, "grad_norm": 0.875, "learning_rate": 9.196100000000002e-06, "loss": -0.0061, "num_tokens": 825520481.0, "reward": 1.0331640779972076, "reward_std": 0.2270587593317032, "rewards/reward_accuracy/mean": 0.93359375, "rewards/reward_accuracy/std": 0.22586587816476822, "rewards/reward_format/mean": 0.09957031384110451, "rewards/reward_format/std": 0.00435292455367744, "sampling/importance_sampling_ratio/max": 2.4621651649475096, "sampling/importance_sampling_ratio/mean": 0.9847799837589264, "sampling/importance_sampling_ratio/min": 0.0707425655797124, "sampling/sampling_logp_difference/max": 0.9635183990001679, "sampling/sampling_logp_difference/mean": 0.004119280469603836, "step": 8040, "step_time": 7.837344812692026 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.002734375, "completions/max_length": 1109.0, "completions/max_terminated_length": 802.7, "completions/mean_length": 138.488671875, "completions/mean_terminated_length": 133.35906982421875, "completions/min_length": 65.5, "completions/min_terminated_length": 65.5, "entropy": 0.04009682624600828, "epoch": 17.237687366167023, "frac_reward_zero_std": 0.95625, "grad_norm": 0.0, "learning_rate": 9.195100000000001e-06, "loss": -0.0008, "num_tokens": 826381668.0, "reward": 1.0826171934604645, "reward_std": 0.07561039552092552, "rewards/reward_accuracy/mean": 0.9828125, "rewards/reward_accuracy/std": 0.0744997963309288, "rewards/reward_format/mean": 0.0998046875, "rewards/reward_format/std": 0.0023282783571630717, "sampling/importance_sampling_ratio/max": 2.4957231163978575, "sampling/importance_sampling_ratio/mean": 0.9950333416461945, "sampling/importance_sampling_ratio/min": 0.12558613903820515, "sampling/sampling_logp_difference/max": 0.9294018745422363, "sampling/sampling_logp_difference/mean": 0.0037480346392840145, "step": 8050, "step_time": 5.466290654306067 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.002734375, "completions/max_length": 1201.0, "completions/max_terminated_length": 978.6, "completions/mean_length": 148.087109375, "completions/mean_terminated_length": 142.89873809814452, "completions/min_length": 70.7, "completions/min_terminated_length": 70.7, "entropy": 0.03861781565938145, "epoch": 17.259100642398288, "frac_reward_zero_std": 0.925, "grad_norm": 0.0, "learning_rate": 9.1941e-06, "loss": -0.0031, "num_tokens": 827274291.0, "reward": 1.0849804878234863, "reward_std": 0.07657976299524308, "rewards/reward_accuracy/mean": 0.98515625, "rewards/reward_accuracy/std": 0.07531862705945969, "rewards/reward_format/mean": 0.0998242199420929, "rewards/reward_format/std": 0.0025726744905114176, "sampling/importance_sampling_ratio/max": 2.2983739495277407, "sampling/importance_sampling_ratio/mean": 1.0012471735477448, "sampling/importance_sampling_ratio/min": 0.19418838173151015, "sampling/sampling_logp_difference/max": 0.918752646446228, "sampling/sampling_logp_difference/mean": 0.0037654986139386893, "step": 8060, "step_time": 5.768169420785853 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00234375, "completions/max_length": 1120.9, "completions/max_terminated_length": 1073.9, "completions/mean_length": 145.09375, "completions/mean_terminated_length": 140.712646484375, "completions/min_length": 62.0, "completions/min_terminated_length": 62.0, "entropy": 0.04081552072893828, "epoch": 17.280513918629552, "frac_reward_zero_std": 0.9125, "grad_norm": 0.2412109375, "learning_rate": 9.1931e-06, "loss": -0.0055, "num_tokens": 828159235.0, "reward": 1.0810351848602295, "reward_std": 0.10267976447939872, "rewards/reward_accuracy/mean": 0.98125, "rewards/reward_accuracy/std": 0.10175533667206764, "rewards/reward_format/mean": 0.09978515729308128, "rewards/reward_format/std": 0.0022729270393028857, "sampling/importance_sampling_ratio/max": 2.3744969010353087, "sampling/importance_sampling_ratio/mean": 0.9927258193492889, "sampling/importance_sampling_ratio/min": 0.050418103300035, "sampling/sampling_logp_difference/max": 1.0043106555938721, "sampling/sampling_logp_difference/mean": 0.003969394695013761, "step": 8070, "step_time": 5.43159151490836 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 3.0067595616856125e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 3.0067595616856125e-06, "completions/clipped_ratio": 0.01328125, "completions/max_length": 1460.0, "completions/max_terminated_length": 1228.5, "completions/mean_length": 188.065625, "completions/mean_terminated_length": 163.1705307006836, "completions/min_length": 66.9, "completions/min_terminated_length": 66.9, "entropy": 0.053507500281557444, "epoch": 17.301927194860813, "frac_reward_zero_std": 0.89375, "grad_norm": 0.37890625, "learning_rate": 9.1921e-06, "loss": -0.0025, "num_tokens": 829165531.0, "reward": 1.038398450613022, "reward_std": 0.19378407448530197, "rewards/reward_accuracy/mean": 0.939453125, "rewards/reward_accuracy/std": 0.19033357501029968, "rewards/reward_format/mean": 0.09894531369209289, "rewards/reward_format/std": 0.006215920322574675, "sampling/importance_sampling_ratio/max": 2.6088112592697144, "sampling/importance_sampling_ratio/mean": 0.9813559710979461, "sampling/importance_sampling_ratio/min": 0.09953399449586868, "sampling/sampling_logp_difference/max": 0.9627541899681091, "sampling/sampling_logp_difference/mean": 0.0041549039306119084, "step": 8080, "step_time": 7.461515807692194 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 1302.7, "completions/max_terminated_length": 1249.9, "completions/mean_length": 159.618359375, "completions/mean_terminated_length": 152.36002349853516, "completions/min_length": 65.5, "completions/min_terminated_length": 65.5, "entropy": 0.0471513032913208, "epoch": 17.323340471092077, "frac_reward_zero_std": 0.91875, "grad_norm": 0.0, "learning_rate": 9.1911e-06, "loss": -0.0025, "num_tokens": 830090698.0, "reward": 1.0667969048023225, "reward_std": 0.1536639377474785, "rewards/reward_accuracy/mean": 0.9671875, "rewards/reward_accuracy/std": 0.15230460539460183, "rewards/reward_format/mean": 0.09960937723517418, "rewards/reward_format/std": 0.0029608421958982945, "sampling/importance_sampling_ratio/max": 2.3962667107582094, "sampling/importance_sampling_ratio/mean": 0.9852268040180207, "sampling/importance_sampling_ratio/min": 0.1136434618383646, "sampling/sampling_logp_difference/max": 0.9822579860687256, "sampling/sampling_logp_difference/mean": 0.004079094924964011, "step": 8090, "step_time": 6.325762546784245 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005859375, "completions/max_length": 1393.3, "completions/max_terminated_length": 1174.1, "completions/mean_length": 170.8875, "completions/mean_terminated_length": 159.98683319091796, "completions/min_length": 64.5, "completions/min_terminated_length": 64.5, "entropy": 0.04905639525968582, "epoch": 17.34475374732334, "frac_reward_zero_std": 0.89375, "grad_norm": 0.4765625, "learning_rate": 9.1901e-06, "loss": -0.0043, "num_tokens": 831048122.0, "reward": 1.065917980670929, "reward_std": 0.12970841750502587, "rewards/reward_accuracy/mean": 0.96640625, "rewards/reward_accuracy/std": 0.12783292159438134, "rewards/reward_format/mean": 0.09951172024011612, "rewards/reward_format/std": 0.00401425720192492, "sampling/importance_sampling_ratio/max": 2.5780307769775392, "sampling/importance_sampling_ratio/mean": 0.9799639523029328, "sampling/importance_sampling_ratio/min": 0.10376871079206466, "sampling/sampling_logp_difference/max": 0.922963535785675, "sampling/sampling_logp_difference/mean": 0.004214664199389517, "step": 8100, "step_time": 6.948960478487424 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.007421875, "completions/max_length": 1520.4, "completions/max_terminated_length": 1336.9, "completions/mean_length": 168.691796875, "completions/mean_terminated_length": 154.8833038330078, "completions/min_length": 65.2, "completions/min_terminated_length": 65.2, "entropy": 0.046236279606819156, "epoch": 17.366167023554603, "frac_reward_zero_std": 0.91875, "grad_norm": 0.498046875, "learning_rate": 9.189100000000002e-06, "loss": -0.0023, "num_tokens": 832000725.0, "reward": 1.0650976777076722, "reward_std": 0.14499300792813302, "rewards/reward_accuracy/mean": 0.965625, "rewards/reward_accuracy/std": 0.143001838773489, "rewards/reward_format/mean": 0.0994726575911045, "rewards/reward_format/std": 0.004446694138459861, "sampling/importance_sampling_ratio/max": 2.5690616607666015, "sampling/importance_sampling_ratio/mean": 0.9918439447879791, "sampling/importance_sampling_ratio/min": 0.11133526428602636, "sampling/sampling_logp_difference/max": 1.363012933731079, "sampling/sampling_logp_difference/mean": 0.004074672353453934, "step": 8110, "step_time": 7.456481829303084 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005078125, "completions/max_length": 1389.9, "completions/max_terminated_length": 1084.0, "completions/mean_length": 156.21640625, "completions/mean_terminated_length": 146.6111618041992, "completions/min_length": 67.4, "completions/min_terminated_length": 67.4, "entropy": 0.04201012558769435, "epoch": 17.387580299785867, "frac_reward_zero_std": 0.875, "grad_norm": 0.1728515625, "learning_rate": 9.188100000000001e-06, "loss": -0.0073, "num_tokens": 832923055.0, "reward": 1.0614453315734864, "reward_std": 0.17362353429198266, "rewards/reward_accuracy/mean": 0.96171875, "rewards/reward_accuracy/std": 0.17186207249760627, "rewards/reward_format/mean": 0.0997265636920929, "rewards/reward_format/std": 0.0037368136923760175, "sampling/importance_sampling_ratio/max": 2.434686779975891, "sampling/importance_sampling_ratio/mean": 0.9849812150001526, "sampling/importance_sampling_ratio/min": 0.12121579218655824, "sampling/sampling_logp_difference/max": 1.072529911994934, "sampling/sampling_logp_difference/mean": 0.003926744102500379, "step": 8120, "step_time": 6.852109160510008 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0078125, "completions/max_length": 1895.2, "completions/max_terminated_length": 1533.3, "completions/mean_length": 172.1984375, "completions/mean_terminated_length": 157.45965042114258, "completions/min_length": 60.2, "completions/min_terminated_length": 60.2, "entropy": 0.0491838191403076, "epoch": 17.40899357601713, "frac_reward_zero_std": 0.86875, "grad_norm": 0.0, "learning_rate": 9.1871e-06, "loss": -0.0042, "num_tokens": 833889051.0, "reward": 1.0564453125, "reward_std": 0.17756492719054223, "rewards/reward_accuracy/mean": 0.95703125, "rewards/reward_accuracy/std": 0.17488315775990487, "rewards/reward_format/mean": 0.0994140625, "rewards/reward_format/std": 0.004677861742675304, "sampling/importance_sampling_ratio/max": 2.5776376724243164, "sampling/importance_sampling_ratio/mean": 0.9925845742225647, "sampling/importance_sampling_ratio/min": 0.09387719742953778, "sampling/sampling_logp_difference/max": 0.9087488949298859, "sampling/sampling_logp_difference/mean": 0.00406003266107291, "step": 8130, "step_time": 9.030567594489549 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005078125, "completions/max_length": 1968.6, "completions/max_terminated_length": 1628.2, "completions/mean_length": 193.301953125, "completions/mean_terminated_length": 183.8826934814453, "completions/min_length": 65.7, "completions/min_terminated_length": 65.7, "entropy": 0.05839116906281561, "epoch": 17.430406852248392, "frac_reward_zero_std": 0.8625, "grad_norm": 0.75390625, "learning_rate": 9.186100000000002e-06, "loss": -0.004, "num_tokens": 834909392.0, "reward": 1.046113282442093, "reward_std": 0.2054090015590191, "rewards/reward_accuracy/mean": 0.946484375, "rewards/reward_accuracy/std": 0.2033394120633602, "rewards/reward_format/mean": 0.09962890669703484, "rewards/reward_format/std": 0.004229986807331443, "sampling/importance_sampling_ratio/max": 2.6494335412979124, "sampling/importance_sampling_ratio/mean": 0.9820327818393707, "sampling/importance_sampling_ratio/min": 0.0250747911632061, "sampling/sampling_logp_difference/max": 1.2187644422054291, "sampling/sampling_logp_difference/mean": 0.004577512270770967, "step": 8140, "step_time": 9.443231767500402 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00546875, "completions/max_length": 1602.8, "completions/max_terminated_length": 1443.5, "completions/mean_length": 171.064453125, "completions/mean_terminated_length": 160.94688568115234, "completions/min_length": 64.4, "completions/min_terminated_length": 64.4, "entropy": 0.048230223124846816, "epoch": 17.451820128479657, "frac_reward_zero_std": 0.89375, "grad_norm": 0.640625, "learning_rate": 9.185100000000001e-06, "loss": -0.01, "num_tokens": 835860757.0, "reward": 1.0611132860183716, "reward_std": 0.16790748685598372, "rewards/reward_accuracy/mean": 0.96171875, "rewards/reward_accuracy/std": 0.16558668985962868, "rewards/reward_format/mean": 0.09939453080296516, "rewards/reward_format/std": 0.004780217190273106, "sampling/importance_sampling_ratio/max": 2.3358971238136292, "sampling/importance_sampling_ratio/mean": 0.9728877365589141, "sampling/importance_sampling_ratio/min": 0.07094925949349999, "sampling/sampling_logp_difference/max": 0.8971877217292785, "sampling/sampling_logp_difference/mean": 0.004038160387426615, "step": 8150, "step_time": 7.756438562995754 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003125, "completions/max_length": 1475.4, "completions/max_terminated_length": 1217.3, "completions/mean_length": 148.515625, "completions/mean_terminated_length": 142.59803009033203, "completions/min_length": 64.5, "completions/min_terminated_length": 64.5, "entropy": 0.039872558298520745, "epoch": 17.47323340471092, "frac_reward_zero_std": 0.90625, "grad_norm": 0.3828125, "learning_rate": 9.1841e-06, "loss": 0.0029, "num_tokens": 836749229.0, "reward": 1.0712109684944153, "reward_std": 0.14039576649665833, "rewards/reward_accuracy/mean": 0.971484375, "rewards/reward_accuracy/std": 0.1388804756104946, "rewards/reward_format/mean": 0.0997265636920929, "rewards/reward_format/std": 0.0033788751112297176, "sampling/importance_sampling_ratio/max": 2.3292322874069216, "sampling/importance_sampling_ratio/mean": 0.9788650929927826, "sampling/importance_sampling_ratio/min": 0.10226080808788537, "sampling/sampling_logp_difference/max": 0.8657418727874756, "sampling/sampling_logp_difference/mean": 0.003872860292904079, "step": 8160, "step_time": 7.058806186995935 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0046875, "completions/max_length": 1334.1, "completions/max_terminated_length": 1295.5, "completions/mean_length": 177.1140625, "completions/mean_terminated_length": 168.4720657348633, "completions/min_length": 64.2, "completions/min_terminated_length": 64.2, "entropy": 0.05198611572850496, "epoch": 17.494646680942186, "frac_reward_zero_std": 0.89375, "grad_norm": 0.0, "learning_rate": 9.1831e-06, "loss": -0.0086, "num_tokens": 837723329.0, "reward": 1.0369726896286011, "reward_std": 0.20896882712841033, "rewards/reward_accuracy/mean": 0.9375, "rewards/reward_accuracy/std": 0.20730026960372924, "rewards/reward_format/mean": 0.09947265908122063, "rewards/reward_format/std": 0.004880250385031104, "sampling/importance_sampling_ratio/max": 2.4738518953323365, "sampling/importance_sampling_ratio/mean": 0.9810921847820282, "sampling/importance_sampling_ratio/min": 0.08166157156229019, "sampling/sampling_logp_difference/max": 1.065821099281311, "sampling/sampling_logp_difference/mean": 0.004520977195352316, "step": 8170, "step_time": 6.742382194608217 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00234375, "completions/max_length": 1436.1, "completions/max_terminated_length": 1334.6, "completions/mean_length": 165.350390625, "completions/mean_terminated_length": 160.96797943115234, "completions/min_length": 66.6, "completions/min_terminated_length": 66.6, "entropy": 0.04382397264707834, "epoch": 17.516059957173447, "frac_reward_zero_std": 0.85625, "grad_norm": 1.046875, "learning_rate": 9.1821e-06, "loss": -0.0077, "num_tokens": 838662418.0, "reward": 1.044648438692093, "reward_std": 0.21346878707408906, "rewards/reward_accuracy/mean": 0.944921875, "rewards/reward_accuracy/std": 0.21237364113330842, "rewards/reward_format/mean": 0.09972656294703483, "rewards/reward_format/std": 0.0033384527312591674, "sampling/importance_sampling_ratio/max": 2.451289987564087, "sampling/importance_sampling_ratio/mean": 0.9904144883155823, "sampling/importance_sampling_ratio/min": 0.11785658597946166, "sampling/sampling_logp_difference/max": 0.9244058966636658, "sampling/sampling_logp_difference/mean": 0.003974161855876446, "step": 8180, "step_time": 6.969666801192216 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.002734375, "completions/max_length": 1266.2, "completions/max_terminated_length": 1160.7, "completions/mean_length": 158.7984375, "completions/mean_terminated_length": 153.70599212646485, "completions/min_length": 66.3, "completions/min_terminated_length": 66.3, "entropy": 0.04589918227866292, "epoch": 17.53747323340471, "frac_reward_zero_std": 0.875, "grad_norm": 0.41015625, "learning_rate": 9.181100000000001e-06, "loss": -0.0119, "num_tokens": 839587694.0, "reward": 1.0686328291893006, "reward_std": 0.14098459035158156, "rewards/reward_accuracy/mean": 0.96875, "rewards/reward_accuracy/std": 0.14047638773918153, "rewards/reward_format/mean": 0.09988281354308129, "rewards/reward_format/std": 0.0014512486523017287, "sampling/importance_sampling_ratio/max": 2.3540929198265075, "sampling/importance_sampling_ratio/mean": 0.977182000875473, "sampling/importance_sampling_ratio/min": 0.05231004357337952, "sampling/sampling_logp_difference/max": 1.1751423001289367, "sampling/sampling_logp_difference/mean": 0.00411627977155149, "step": 8190, "step_time": 6.1910551680979555 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.004296875, "completions/max_length": 1409.8, "completions/max_terminated_length": 1098.6, "completions/mean_length": 163.6875, "completions/mean_terminated_length": 155.64179534912108, "completions/min_length": 64.7, "completions/min_terminated_length": 64.7, "entropy": 0.041514119249768555, "epoch": 17.558886509635975, "frac_reward_zero_std": 0.9, "grad_norm": 0.466796875, "learning_rate": 9.1801e-06, "loss": -0.0007, "num_tokens": 840527006.0, "reward": 1.0563476741313935, "reward_std": 0.16237833499908447, "rewards/reward_accuracy/mean": 0.956640625, "rewards/reward_accuracy/std": 0.16107039153575897, "rewards/reward_format/mean": 0.09970703274011612, "rewards/reward_format/std": 0.003450417937710881, "sampling/importance_sampling_ratio/max": 2.5172585129737852, "sampling/importance_sampling_ratio/mean": 0.9840880632400513, "sampling/importance_sampling_ratio/min": 0.11205626134760678, "sampling/sampling_logp_difference/max": 0.8469281196594238, "sampling/sampling_logp_difference/mean": 0.003842562437057495, "step": 8200, "step_time": 6.755654303909978 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 2.014738629441126e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 2.014738629441126e-06, "completions/clipped_ratio": 0.01015625, "completions/max_length": 1441.3, "completions/max_terminated_length": 1332.1, "completions/mean_length": 183.81875, "completions/mean_terminated_length": 164.83226623535157, "completions/min_length": 65.9, "completions/min_terminated_length": 65.9, "entropy": 0.05078675611875951, "epoch": 17.580299785867236, "frac_reward_zero_std": 0.9, "grad_norm": 0.061767578125, "learning_rate": 9.179100000000002e-06, "loss": -0.006, "num_tokens": 841511454.0, "reward": 1.0486914277076722, "reward_std": 0.20336907356977463, "rewards/reward_accuracy/mean": 0.949609375, "rewards/reward_accuracy/std": 0.19995293989777566, "rewards/reward_format/mean": 0.09908203184604644, "rewards/reward_format/std": 0.0059956970624625685, "sampling/importance_sampling_ratio/max": 2.506076288223267, "sampling/importance_sampling_ratio/mean": 0.9790755093097687, "sampling/importance_sampling_ratio/min": 0.08928759135305882, "sampling/sampling_logp_difference/max": 1.0718903481960296, "sampling/sampling_logp_difference/mean": 0.004155035177245736, "step": 8210, "step_time": 7.318360588492942 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0046875, "completions/max_length": 1604.6, "completions/max_terminated_length": 1420.1, "completions/mean_length": 168.44453125, "completions/mean_terminated_length": 159.68732452392578, "completions/min_length": 63.9, "completions/min_terminated_length": 63.9, "entropy": 0.047775210719555615, "epoch": 17.6017130620985, "frac_reward_zero_std": 0.89375, "grad_norm": 0.359375, "learning_rate": 9.178100000000001e-06, "loss": -0.0036, "num_tokens": 842453040.0, "reward": 1.0597070455551147, "reward_std": 0.16970512941479682, "rewards/reward_accuracy/mean": 0.96015625, "rewards/reward_accuracy/std": 0.16800438910722731, "rewards/reward_format/mean": 0.09955078214406968, "rewards/reward_format/std": 0.0038216831162571907, "sampling/importance_sampling_ratio/max": 2.535776901245117, "sampling/importance_sampling_ratio/mean": 0.9895294904708862, "sampling/importance_sampling_ratio/min": 0.09251640178263187, "sampling/sampling_logp_difference/max": 1.2158201694488526, "sampling/sampling_logp_difference/mean": 0.0042806789977476, "step": 8220, "step_time": 7.582698244106723 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003125, "completions/max_length": 1347.9, "completions/max_terminated_length": 973.8, "completions/mean_length": 152.101953125, "completions/mean_terminated_length": 146.20602111816407, "completions/min_length": 67.6, "completions/min_terminated_length": 67.6, "entropy": 0.04346271688118577, "epoch": 17.623126338329765, "frac_reward_zero_std": 0.9125, "grad_norm": 0.46484375, "learning_rate": 9.1771e-06, "loss": 0.001, "num_tokens": 843359301.0, "reward": 1.0614843964576721, "reward_std": 0.14244792610406876, "rewards/reward_accuracy/mean": 0.96171875, "rewards/reward_accuracy/std": 0.1411731630563736, "rewards/reward_format/mean": 0.0997656263411045, "rewards/reward_format/std": 0.0031982232350856064, "sampling/importance_sampling_ratio/max": 2.4833980202674866, "sampling/importance_sampling_ratio/mean": 0.9903745949268341, "sampling/importance_sampling_ratio/min": 0.1354645427316427, "sampling/sampling_logp_difference/max": 0.9688260674476623, "sampling/sampling_logp_difference/mean": 0.003999817022122443, "step": 8230, "step_time": 6.549545863815001 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.007421875, "completions/max_length": 1849.4, "completions/max_terminated_length": 1328.9, "completions/mean_length": 166.415234375, "completions/mean_terminated_length": 152.44002685546874, "completions/min_length": 71.2, "completions/min_terminated_length": 71.2, "entropy": 0.046314814640209076, "epoch": 17.644539614561026, "frac_reward_zero_std": 0.8875, "grad_norm": 0.2890625, "learning_rate": 9.176100000000002e-06, "loss": -0.0127, "num_tokens": 844310380.0, "reward": 1.065917980670929, "reward_std": 0.15051930651534348, "rewards/reward_accuracy/mean": 0.96640625, "rewards/reward_accuracy/std": 0.1474744535982609, "rewards/reward_format/mean": 0.09951172024011612, "rewards/reward_format/std": 0.005035247141495347, "sampling/importance_sampling_ratio/max": 2.416418027877808, "sampling/importance_sampling_ratio/mean": 0.9901250302791595, "sampling/importance_sampling_ratio/min": 0.1198412261903286, "sampling/sampling_logp_difference/max": 1.1021100401878356, "sampling/sampling_logp_difference/mean": 0.004017347423359752, "step": 8240, "step_time": 8.653973220611807 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.004296875, "completions/max_length": 1165.8, "completions/max_terminated_length": 985.2, "completions/mean_length": 163.79765625, "completions/mean_terminated_length": 155.84788360595704, "completions/min_length": 68.1, "completions/min_terminated_length": 68.1, "entropy": 0.042624638648703694, "epoch": 17.66595289079229, "frac_reward_zero_std": 0.9, "grad_norm": 0.60546875, "learning_rate": 9.175100000000001e-06, "loss": -0.0017, "num_tokens": 845253910.0, "reward": 1.049609398841858, "reward_std": 0.16161189079284669, "rewards/reward_accuracy/mean": 0.95, "rewards/reward_accuracy/std": 0.16041086465120316, "rewards/reward_format/mean": 0.09960937649011611, "rewards/reward_format/std": 0.003377661248669028, "sampling/importance_sampling_ratio/max": 2.484706926345825, "sampling/importance_sampling_ratio/mean": 0.9974665939807892, "sampling/importance_sampling_ratio/min": 0.09628750607371331, "sampling/sampling_logp_difference/max": 0.9164491057395935, "sampling/sampling_logp_difference/mean": 0.004076571995392441, "step": 8250, "step_time": 5.945845928197377 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00546875, "completions/max_length": 1460.8, "completions/max_terminated_length": 1260.1, "completions/mean_length": 162.611328125, "completions/mean_terminated_length": 152.47344512939452, "completions/min_length": 63.9, "completions/min_terminated_length": 63.9, "entropy": 0.04725247547030449, "epoch": 17.687366167023555, "frac_reward_zero_std": 0.8625, "grad_norm": 0.22265625, "learning_rate": 9.1741e-06, "loss": -0.0092, "num_tokens": 846187699.0, "reward": 1.0502929866313935, "reward_std": 0.19904604852199553, "rewards/reward_accuracy/mean": 0.95078125, "rewards/reward_accuracy/std": 0.19728218764066696, "rewards/reward_format/mean": 0.09951171949505806, "rewards/reward_format/std": 0.004509858973324299, "sampling/importance_sampling_ratio/max": 2.4633562207221984, "sampling/importance_sampling_ratio/mean": 0.986544406414032, "sampling/importance_sampling_ratio/min": 0.1480050291866064, "sampling/sampling_logp_difference/max": 0.9593998610973358, "sampling/sampling_logp_difference/mean": 0.004211529553867876, "step": 8260, "step_time": 7.21387554378598 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00234375, "completions/max_length": 1124.0, "completions/max_terminated_length": 936.9, "completions/mean_length": 145.98984375, "completions/mean_terminated_length": 141.55275115966796, "completions/min_length": 60.1, "completions/min_terminated_length": 60.1, "entropy": 0.03997024167329073, "epoch": 17.70877944325482, "frac_reward_zero_std": 0.90625, "grad_norm": 0.2490234375, "learning_rate": 9.1731e-06, "loss": -0.0038, "num_tokens": 847077529.0, "reward": 1.081406259536743, "reward_std": 0.10859995037317276, "rewards/reward_accuracy/mean": 0.981640625, "rewards/reward_accuracy/std": 0.10751550942659378, "rewards/reward_format/mean": 0.09976562559604644, "rewards/reward_format/std": 0.0026831001276150348, "sampling/importance_sampling_ratio/max": 2.5217877626419067, "sampling/importance_sampling_ratio/mean": 0.9951166331768035, "sampling/importance_sampling_ratio/min": 0.12926680594682693, "sampling/sampling_logp_difference/max": 1.0052352666854858, "sampling/sampling_logp_difference/mean": 0.0038479633862152697, "step": 8270, "step_time": 5.5895788537076445 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00234375, "completions/max_length": 1545.6, "completions/max_terminated_length": 1179.2, "completions/mean_length": 151.87734375, "completions/mean_terminated_length": 147.4501708984375, "completions/min_length": 63.1, "completions/min_terminated_length": 63.1, "entropy": 0.03860866376198828, "epoch": 17.73019271948608, "frac_reward_zero_std": 0.9125, "grad_norm": 0.302734375, "learning_rate": 9.1721e-06, "loss": -0.0073, "num_tokens": 847975551.0, "reward": 1.0596289157867431, "reward_std": 0.16422342509031296, "rewards/reward_accuracy/mean": 0.959765625, "rewards/reward_accuracy/std": 0.1632730945944786, "rewards/reward_format/mean": 0.09986328184604645, "rewards/reward_format/std": 0.002187500172294676, "sampling/importance_sampling_ratio/max": 2.43781920671463, "sampling/importance_sampling_ratio/mean": 0.9880088448524476, "sampling/importance_sampling_ratio/min": 0.16354676689952613, "sampling/sampling_logp_difference/max": 0.9417940855026246, "sampling/sampling_logp_difference/mean": 0.0037146177142858504, "step": 8280, "step_time": 7.24372002131131 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.006640625, "completions/max_length": 1250.0, "completions/max_terminated_length": 1178.4, "completions/mean_length": 168.7046875, "completions/mean_terminated_length": 156.42251281738282, "completions/min_length": 60.0, "completions/min_terminated_length": 60.0, "entropy": 0.04477310441434383, "epoch": 17.751605995717345, "frac_reward_zero_std": 0.90625, "grad_norm": 0.5390625, "learning_rate": 9.171100000000001e-06, "loss": -0.0038, "num_tokens": 848927435.0, "reward": 1.0643555045127868, "reward_std": 0.13730233162641525, "rewards/reward_accuracy/mean": 0.96484375, "rewards/reward_accuracy/std": 0.13536398485302925, "rewards/reward_format/mean": 0.09951172098517418, "rewards/reward_format/std": 0.004053422063589096, "sampling/importance_sampling_ratio/max": 2.606103944778442, "sampling/importance_sampling_ratio/mean": 0.98892160654068, "sampling/importance_sampling_ratio/min": 0.16752475686371326, "sampling/sampling_logp_difference/max": 0.9576844453811646, "sampling/sampling_logp_difference/mean": 0.004023877484723925, "step": 8290, "step_time": 6.30361013970105 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01171875, "completions/max_length": 1691.7, "completions/max_terminated_length": 1496.7, "completions/mean_length": 198.300390625, "completions/mean_terminated_length": 176.55086364746094, "completions/min_length": 64.4, "completions/min_terminated_length": 64.4, "entropy": 0.0544270928716287, "epoch": 17.77301927194861, "frac_reward_zero_std": 0.9, "grad_norm": 0.228515625, "learning_rate": 9.1701e-06, "loss": -0.0099, "num_tokens": 849957548.0, "reward": 1.0442578673362732, "reward_std": 0.1997273236513138, "rewards/reward_accuracy/mean": 0.9453125, "rewards/reward_accuracy/std": 0.19600295796990394, "rewards/reward_format/mean": 0.09894531592726707, "rewards/reward_format/std": 0.007567788381129504, "sampling/importance_sampling_ratio/max": 2.3480772495269777, "sampling/importance_sampling_ratio/mean": 0.9694286227226258, "sampling/importance_sampling_ratio/min": 0.06911256992025301, "sampling/sampling_logp_difference/max": 1.0555625200271606, "sampling/sampling_logp_difference/mean": 0.004147405037656426, "step": 8300, "step_time": 8.605465210197144 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.002734375, "completions/max_length": 1226.7, "completions/max_terminated_length": 1118.6, "completions/mean_length": 161.8828125, "completions/mean_terminated_length": 156.84258728027345, "completions/min_length": 62.8, "completions/min_terminated_length": 62.8, "entropy": 0.04458531693089753, "epoch": 17.79443254817987, "frac_reward_zero_std": 0.9375, "grad_norm": 0.31640625, "learning_rate": 9.1691e-06, "loss": -0.006, "num_tokens": 850893952.0, "reward": 1.0586523473262788, "reward_std": 0.14783504009246826, "rewards/reward_accuracy/mean": 0.958984375, "rewards/reward_accuracy/std": 0.14664415195584296, "rewards/reward_format/mean": 0.0996679686009884, "rewards/reward_format/std": 0.0028983533149585126, "sampling/importance_sampling_ratio/max": 2.5086684465408324, "sampling/importance_sampling_ratio/mean": 0.9976350128650665, "sampling/importance_sampling_ratio/min": 0.16495320554822684, "sampling/sampling_logp_difference/max": 0.8072502911090851, "sampling/sampling_logp_difference/mean": 0.004002649849280715, "step": 8310, "step_time": 6.078960943419952 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0109375, "completions/max_length": 1720.0, "completions/max_terminated_length": 1431.1, "completions/mean_length": 168.651171875, "completions/mean_terminated_length": 147.94911499023436, "completions/min_length": 60.1, "completions/min_terminated_length": 60.1, "entropy": 0.0485750189749524, "epoch": 17.815845824411134, "frac_reward_zero_std": 0.8625, "grad_norm": 0.478515625, "learning_rate": 9.168100000000001e-06, "loss": -0.0106, "num_tokens": 851834995.0, "reward": 1.048320335149765, "reward_std": 0.1952370025217533, "rewards/reward_accuracy/mean": 0.94921875, "rewards/reward_accuracy/std": 0.19115806147456169, "rewards/reward_format/mean": 0.0991015650331974, "rewards/reward_format/std": 0.007846996793523431, "sampling/importance_sampling_ratio/max": 2.484836995601654, "sampling/importance_sampling_ratio/mean": 0.9817761301994323, "sampling/importance_sampling_ratio/min": 0.07548203985206783, "sampling/sampling_logp_difference/max": 0.8360128164291382, "sampling/sampling_logp_difference/mean": 0.004231687495484948, "step": 8320, "step_time": 8.439120065697352 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00546875, "completions/max_length": 1634.0, "completions/max_terminated_length": 1331.1, "completions/mean_length": 176.741015625, "completions/mean_terminated_length": 166.5425033569336, "completions/min_length": 67.0, "completions/min_terminated_length": 67.0, "entropy": 0.04706415443215519, "epoch": 17.8372591006424, "frac_reward_zero_std": 0.88125, "grad_norm": 0.2255859375, "learning_rate": 9.1671e-06, "loss": -0.0106, "num_tokens": 852806556.0, "reward": 1.0540234625339509, "reward_std": 0.17763087898492813, "rewards/reward_accuracy/mean": 0.9546875, "rewards/reward_accuracy/std": 0.17531865164637567, "rewards/reward_format/mean": 0.09933593794703484, "rewards/reward_format/std": 0.0054783116094768046, "sampling/importance_sampling_ratio/max": 2.3855207204818725, "sampling/importance_sampling_ratio/mean": 0.974895590543747, "sampling/importance_sampling_ratio/min": 0.10503290295600891, "sampling/sampling_logp_difference/max": 0.8621065139770507, "sampling/sampling_logp_difference/mean": 0.004141583712771535, "step": 8330, "step_time": 7.954761585308006 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00703125, "completions/max_length": 1795.2, "completions/max_terminated_length": 1501.6, "completions/mean_length": 182.470703125, "completions/mean_terminated_length": 169.54893188476564, "completions/min_length": 65.1, "completions/min_terminated_length": 65.1, "entropy": 0.056943308422341944, "epoch": 17.858672376873663, "frac_reward_zero_std": 0.8875, "grad_norm": 0.34765625, "learning_rate": 9.166100000000002e-06, "loss": -0.0105, "num_tokens": 853790481.0, "reward": 1.0435547232627869, "reward_std": 0.1763870820403099, "rewards/reward_accuracy/mean": 0.944140625, "rewards/reward_accuracy/std": 0.17425091564655304, "rewards/reward_format/mean": 0.09941406473517418, "rewards/reward_format/std": 0.004621501825749874, "sampling/importance_sampling_ratio/max": 2.45790057182312, "sampling/importance_sampling_ratio/mean": 0.9843412101268768, "sampling/importance_sampling_ratio/min": 0.15898739472031592, "sampling/sampling_logp_difference/max": 0.9259390115737915, "sampling/sampling_logp_difference/mean": 0.004748213430866599, "step": 8340, "step_time": 8.541898735900759 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 2.713299136303249e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 2.713299136303249e-06, "completions/clipped_ratio": 0.009375, "completions/max_length": 1397.7, "completions/max_terminated_length": 1218.2, "completions/mean_length": 167.815625, "completions/mean_terminated_length": 150.4179473876953, "completions/min_length": 62.5, "completions/min_terminated_length": 62.5, "entropy": 0.04569507855921984, "epoch": 17.880085653104924, "frac_reward_zero_std": 0.90625, "grad_norm": 0.37109375, "learning_rate": 9.165100000000001e-06, "loss": -0.0042, "num_tokens": 854726041.0, "reward": 1.066464865207672, "reward_std": 0.14693954288959504, "rewards/reward_accuracy/mean": 0.9671875, "rewards/reward_accuracy/std": 0.14435612335801123, "rewards/reward_format/mean": 0.0992773450911045, "rewards/reward_format/std": 0.004629110544919967, "sampling/importance_sampling_ratio/max": 2.568280816078186, "sampling/importance_sampling_ratio/mean": 0.9893718779087066, "sampling/importance_sampling_ratio/min": 0.08189501017332076, "sampling/sampling_logp_difference/max": 1.147831630706787, "sampling/sampling_logp_difference/mean": 0.004230017052032053, "step": 8350, "step_time": 6.957513730117353 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0046875, "completions/max_length": 1485.8, "completions/max_terminated_length": 959.8, "completions/mean_length": 154.16484375, "completions/mean_terminated_length": 145.40194396972657, "completions/min_length": 61.7, "completions/min_terminated_length": 61.7, "entropy": 0.04410214265808463, "epoch": 17.90149892933619, "frac_reward_zero_std": 0.8875, "grad_norm": 0.24609375, "learning_rate": 9.164100000000001e-06, "loss": -0.0103, "num_tokens": 855639487.0, "reward": 1.059335970878601, "reward_std": 0.17857150733470917, "rewards/reward_accuracy/mean": 0.959765625, "rewards/reward_accuracy/std": 0.17657126784324645, "rewards/reward_format/mean": 0.09957031309604644, "rewards/reward_format/std": 0.004549821373075247, "sampling/importance_sampling_ratio/max": 2.25142103433609, "sampling/importance_sampling_ratio/mean": 0.983077073097229, "sampling/importance_sampling_ratio/min": 0.09560363888740539, "sampling/sampling_logp_difference/max": 0.8792935729026794, "sampling/sampling_logp_difference/mean": 0.004171370388939976, "step": 8360, "step_time": 7.133393535399227 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0015625, "completions/max_length": 1479.3, "completions/max_terminated_length": 1232.9, "completions/mean_length": 150.8296875, "completions/mean_terminated_length": 147.8700408935547, "completions/min_length": 70.7, "completions/min_terminated_length": 70.7, "entropy": 0.04139857625123113, "epoch": 17.922912205567453, "frac_reward_zero_std": 0.91875, "grad_norm": 0.26171875, "learning_rate": 9.1631e-06, "loss": -0.002, "num_tokens": 856544171.0, "reward": 1.0593164205551147, "reward_std": 0.1525036233710125, "rewards/reward_accuracy/mean": 0.959375, "rewards/reward_accuracy/std": 0.15202652513980866, "rewards/reward_format/mean": 0.09994140714406967, "rewards/reward_format/std": 0.0009375000605359674, "sampling/importance_sampling_ratio/max": 2.418799579143524, "sampling/importance_sampling_ratio/mean": 0.9861987709999085, "sampling/importance_sampling_ratio/min": 0.12147632464766503, "sampling/sampling_logp_difference/max": 0.9672939538955688, "sampling/sampling_logp_difference/mean": 0.004212145740166306, "step": 8370, "step_time": 7.0183396212029034 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 4.71318389827502e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 4.71318389827502e-06, "completions/clipped_ratio": 0.008984375, "completions/max_length": 1665.2, "completions/max_terminated_length": 1315.1, "completions/mean_length": 169.032421875, "completions/mean_terminated_length": 152.12120361328124, "completions/min_length": 67.1, "completions/min_terminated_length": 67.1, "entropy": 0.05248430648352951, "epoch": 17.944325481798714, "frac_reward_zero_std": 0.90625, "grad_norm": 0.0, "learning_rate": 9.1621e-06, "loss": -0.0024, "num_tokens": 857489454.0, "reward": 1.0454101860523224, "reward_std": 0.19547022581100465, "rewards/reward_accuracy/mean": 0.94609375, "rewards/reward_accuracy/std": 0.19271953403949738, "rewards/reward_format/mean": 0.09931640774011612, "rewards/reward_format/std": 0.005737062031403184, "sampling/importance_sampling_ratio/max": 2.4733829140663146, "sampling/importance_sampling_ratio/mean": 0.9763400256633759, "sampling/importance_sampling_ratio/min": 0.13519520182162523, "sampling/sampling_logp_difference/max": 0.8551467180252075, "sampling/sampling_logp_difference/mean": 0.004326293803751468, "step": 8380, "step_time": 8.09949419858749 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00703125, "completions/max_length": 1620.2, "completions/max_terminated_length": 1420.2, "completions/mean_length": 181.05078125, "completions/mean_terminated_length": 167.94381256103514, "completions/min_length": 63.9, "completions/min_terminated_length": 63.9, "entropy": 0.05943263911176473, "epoch": 17.96573875802998, "frac_reward_zero_std": 0.88125, "grad_norm": 0.59765625, "learning_rate": 9.161100000000001e-06, "loss": -0.0066, "num_tokens": 858476336.0, "reward": 1.0638086080551148, "reward_std": 0.15637133941054343, "rewards/reward_accuracy/mean": 0.964453125, "rewards/reward_accuracy/std": 0.15383390039205552, "rewards/reward_format/mean": 0.09935546964406967, "rewards/reward_format/std": 0.005785896838642657, "sampling/importance_sampling_ratio/max": 2.5741005897521974, "sampling/importance_sampling_ratio/mean": 0.9832662403583526, "sampling/importance_sampling_ratio/min": 0.07790184915065765, "sampling/sampling_logp_difference/max": 1.1753110826015472, "sampling/sampling_logp_difference/mean": 0.0046984185464680195, "step": 8390, "step_time": 7.989136365993181 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.002734375, "completions/max_length": 1542.0, "completions/max_terminated_length": 1399.8, "completions/mean_length": 159.673828125, "completions/mean_terminated_length": 154.54903411865234, "completions/min_length": 64.6, "completions/min_terminated_length": 64.6, "entropy": 0.04844827032648027, "epoch": 17.987152034261243, "frac_reward_zero_std": 0.875, "grad_norm": 0.75, "learning_rate": 9.1601e-06, "loss": -0.006, "num_tokens": 859407789.0, "reward": 1.0692773461341858, "reward_std": 0.14208532378543168, "rewards/reward_accuracy/mean": 0.96953125, "rewards/reward_accuracy/std": 0.14065084978938103, "rewards/reward_format/mean": 0.09974609389901161, "rewards/reward_format/std": 0.0023240380687639117, "sampling/importance_sampling_ratio/max": 2.4725154042243958, "sampling/importance_sampling_ratio/mean": 0.9846623480319977, "sampling/importance_sampling_ratio/min": 0.0801173135638237, "sampling/sampling_logp_difference/max": 1.0163818836212157, "sampling/sampling_logp_difference/mean": 0.004249382973648607, "step": 8400, "step_time": 7.275318749505095 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00546875, "completions/max_length": 1670.1, "completions/max_terminated_length": 1388.5, "completions/mean_length": 167.784765625, "completions/mean_terminated_length": 157.54922790527343, "completions/min_length": 70.1, "completions/min_terminated_length": 70.1, "entropy": 0.045404623704962434, "epoch": 18.008565310492504, "frac_reward_zero_std": 0.88125, "grad_norm": 0.50390625, "learning_rate": 9.1591e-06, "loss": -0.0121, "num_tokens": 860355734.0, "reward": 1.0558984518051147, "reward_std": 0.1844407543540001, "rewards/reward_accuracy/mean": 0.95625, "rewards/reward_accuracy/std": 0.18285638988018035, "rewards/reward_format/mean": 0.09964843913912773, "rewards/reward_format/std": 0.0037112545222043993, "sampling/importance_sampling_ratio/max": 2.6140115737915037, "sampling/importance_sampling_ratio/mean": 0.9959035515785217, "sampling/importance_sampling_ratio/min": 0.07228115182369947, "sampling/sampling_logp_difference/max": 0.9848323941230774, "sampling/sampling_logp_difference/mean": 0.004173437575809657, "step": 8410, "step_time": 7.967428772296989 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.010546875, "completions/max_length": 1690.2, "completions/max_terminated_length": 1232.1, "completions/mean_length": 177.93984375, "completions/mean_terminated_length": 158.21025543212892, "completions/min_length": 65.0, "completions/min_terminated_length": 65.0, "entropy": 0.05244099779520184, "epoch": 18.029978586723768, "frac_reward_zero_std": 0.8625, "grad_norm": 0.1904296875, "learning_rate": 9.158100000000001e-06, "loss": -0.0095, "num_tokens": 861329628.0, "reward": 1.0677148580551148, "reward_std": 0.14995749220252036, "rewards/reward_accuracy/mean": 0.968359375, "rewards/reward_accuracy/std": 0.14673361629247667, "rewards/reward_format/mean": 0.09935546964406967, "rewards/reward_format/std": 0.006172568630427122, "sampling/importance_sampling_ratio/max": 2.4172771692276003, "sampling/importance_sampling_ratio/mean": 0.9897995233535767, "sampling/importance_sampling_ratio/min": 0.15345925148576497, "sampling/sampling_logp_difference/max": 0.9060311555862427, "sampling/sampling_logp_difference/mean": 0.004403009847737849, "step": 8420, "step_time": 8.169427076607827 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001953125, "completions/max_length": 1094.0, "completions/max_terminated_length": 872.9, "completions/mean_length": 149.305078125, "completions/mean_terminated_length": 145.61585235595703, "completions/min_length": 65.1, "completions/min_terminated_length": 65.1, "entropy": 0.03948886764701456, "epoch": 18.051391862955033, "frac_reward_zero_std": 0.90625, "grad_norm": 0.2373046875, "learning_rate": 9.1571e-06, "loss": -0.0027, "num_tokens": 862226553.0, "reward": 1.0827148675918579, "reward_std": 0.10124944597482681, "rewards/reward_accuracy/mean": 0.9828125, "rewards/reward_accuracy/std": 0.10068337619304657, "rewards/reward_format/mean": 0.09990234524011612, "rewards/reward_format/std": 0.0010754599468782544, "sampling/importance_sampling_ratio/max": 2.507240343093872, "sampling/importance_sampling_ratio/mean": 0.9829702854156495, "sampling/importance_sampling_ratio/min": 0.13182338923215867, "sampling/sampling_logp_difference/max": 1.0012905597686768, "sampling/sampling_logp_difference/mean": 0.0040485898964107035, "step": 8430, "step_time": 5.394941871680203 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 1215.3, "completions/max_terminated_length": 1109.0, "completions/mean_length": 155.6078125, "completions/mean_terminated_length": 148.29960174560546, "completions/min_length": 64.2, "completions/min_terminated_length": 64.2, "entropy": 0.04485269191209227, "epoch": 18.072805139186297, "frac_reward_zero_std": 0.9375, "grad_norm": 0.203125, "learning_rate": 9.1561e-06, "loss": -0.0045, "num_tokens": 863140541.0, "reward": 1.0816211342811584, "reward_std": 0.11796165406703948, "rewards/reward_accuracy/mean": 0.98203125, "rewards/reward_accuracy/std": 0.11637364998459816, "rewards/reward_format/mean": 0.09958984553813935, "rewards/reward_format/std": 0.0034587712259963157, "sampling/importance_sampling_ratio/max": 2.397448706626892, "sampling/importance_sampling_ratio/mean": 0.9966842651367187, "sampling/importance_sampling_ratio/min": 0.15866509452462196, "sampling/sampling_logp_difference/max": 1.0440070867538451, "sampling/sampling_logp_difference/mean": 0.004156065476126969, "step": 8440, "step_time": 6.13217083849886 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.007421875, "completions/max_length": 1423.9, "completions/max_terminated_length": 1331.7, "completions/mean_length": 178.771484375, "completions/mean_terminated_length": 165.0561950683594, "completions/min_length": 64.2, "completions/min_terminated_length": 64.2, "entropy": 0.0489035181934014, "epoch": 18.094218415417558, "frac_reward_zero_std": 0.875, "grad_norm": 0.283203125, "learning_rate": 9.155100000000002e-06, "loss": -0.0043, "num_tokens": 864118836.0, "reward": 1.0497461080551147, "reward_std": 0.20255809500813485, "rewards/reward_accuracy/mean": 0.950390625, "rewards/reward_accuracy/std": 0.20002903789281845, "rewards/reward_format/mean": 0.09935546964406967, "rewards/reward_format/std": 0.004749238467775285, "sampling/importance_sampling_ratio/max": 2.4780894994735716, "sampling/importance_sampling_ratio/mean": 0.9727890491485596, "sampling/importance_sampling_ratio/min": 0.12801228426396846, "sampling/sampling_logp_difference/max": 0.887476772069931, "sampling/sampling_logp_difference/mean": 0.004292128072120249, "step": 8450, "step_time": 7.232624618109549 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00234375, "completions/max_length": 1640.5, "completions/max_terminated_length": 1259.6, "completions/mean_length": 159.080078125, "completions/mean_terminated_length": 154.64983367919922, "completions/min_length": 65.1, "completions/min_terminated_length": 65.1, "entropy": 0.04324261446017772, "epoch": 18.115631691648822, "frac_reward_zero_std": 0.89375, "grad_norm": 0.2470703125, "learning_rate": 9.154100000000001e-06, "loss": -0.0076, "num_tokens": 865045697.0, "reward": 1.0106836140155793, "reward_std": 0.24634804651141168, "rewards/reward_accuracy/mean": 0.9109375, "rewards/reward_accuracy/std": 0.24534667581319808, "rewards/reward_format/mean": 0.09974609538912774, "rewards/reward_format/std": 0.0034548231400549413, "sampling/importance_sampling_ratio/max": 2.4453017950057983, "sampling/importance_sampling_ratio/mean": 0.9952467024326325, "sampling/importance_sampling_ratio/min": 0.1551963571459055, "sampling/sampling_logp_difference/max": 1.009485137462616, "sampling/sampling_logp_difference/mean": 0.004133505700156093, "step": 8460, "step_time": 7.862117032791138 }, { "clip_ratio/high_max": 1.4053967606741936e-05, "clip_ratio/high_mean": 1.756745950842742e-06, "clip_ratio/low_mean": 2.1114306946401485e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 3.8681766454828905e-06, "completions/clipped_ratio": 0.0078125, "completions/max_length": 1410.9, "completions/max_terminated_length": 1170.2, "completions/mean_length": 158.7484375, "completions/mean_terminated_length": 144.01522064208984, "completions/min_length": 62.1, "completions/min_terminated_length": 62.1, "entropy": 0.04309529417660087, "epoch": 18.137044967880087, "frac_reward_zero_std": 0.9125, "grad_norm": 0.46484375, "learning_rate": 9.1531e-06, "loss": -0.0037, "num_tokens": 865968333.0, "reward": 1.0629687666893006, "reward_std": 0.15187642946839333, "rewards/reward_accuracy/mean": 0.963671875, "rewards/reward_accuracy/std": 0.14867664501070976, "rewards/reward_format/mean": 0.09929687604308128, "rewards/reward_format/std": 0.004409412038512528, "sampling/importance_sampling_ratio/max": 2.194634568691254, "sampling/importance_sampling_ratio/mean": 0.9682331383228302, "sampling/importance_sampling_ratio/min": 0.1169423595070839, "sampling/sampling_logp_difference/max": 0.9323523044586182, "sampling/sampling_logp_difference/mean": 0.0037279321579262613, "step": 8470, "step_time": 6.860853795500589 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005078125, "completions/max_length": 1567.4, "completions/max_terminated_length": 1426.6, "completions/mean_length": 184.30703125, "completions/mean_terminated_length": 175.0118606567383, "completions/min_length": 63.2, "completions/min_terminated_length": 63.2, "entropy": 0.05197924245148897, "epoch": 18.158458244111348, "frac_reward_zero_std": 0.875, "grad_norm": 0.4375, "learning_rate": 9.1521e-06, "loss": -0.0057, "num_tokens": 866967055.0, "reward": 1.0429296970367432, "reward_std": 0.2063838168978691, "rewards/reward_accuracy/mean": 0.943359375, "rewards/reward_accuracy/std": 0.20487484559416771, "rewards/reward_format/mean": 0.09957031309604644, "rewards/reward_format/std": 0.004249469796195626, "sampling/importance_sampling_ratio/max": 2.494518458843231, "sampling/importance_sampling_ratio/mean": 0.9778971612453461, "sampling/importance_sampling_ratio/min": 0.06931855082511902, "sampling/sampling_logp_difference/max": 1.2850203275680543, "sampling/sampling_logp_difference/mean": 0.004400036227889359, "step": 8480, "step_time": 7.949689297311124 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 1423.6, "completions/max_terminated_length": 1364.7, "completions/mean_length": 175.20859375, "completions/mean_terminated_length": 167.95795745849608, "completions/min_length": 65.4, "completions/min_terminated_length": 65.4, "entropy": 0.04807736191432923, "epoch": 18.179871520342612, "frac_reward_zero_std": 0.8625, "grad_norm": 0.275390625, "learning_rate": 9.151100000000001e-06, "loss": -0.0052, "num_tokens": 867940645.0, "reward": 1.0487890601158143, "reward_std": 0.20246227756142615, "rewards/reward_accuracy/mean": 0.94921875, "rewards/reward_accuracy/std": 0.2007620617747307, "rewards/reward_format/mean": 0.09957031160593033, "rewards/reward_format/std": 0.0037796362536028027, "sampling/importance_sampling_ratio/max": 2.4190810084342957, "sampling/importance_sampling_ratio/mean": 0.9824954330921173, "sampling/importance_sampling_ratio/min": 0.08894992023706436, "sampling/sampling_logp_difference/max": 0.9808427572250367, "sampling/sampling_logp_difference/mean": 0.00420389783103019, "step": 8490, "step_time": 7.054876831773436 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003515625, "completions/max_length": 1690.6, "completions/max_terminated_length": 1369.4, "completions/mean_length": 171.243359375, "completions/mean_terminated_length": 164.65916137695314, "completions/min_length": 64.3, "completions/min_terminated_length": 64.3, "entropy": 0.051826923107728365, "epoch": 18.201284796573876, "frac_reward_zero_std": 0.86875, "grad_norm": 0.09326171875, "learning_rate": 9.1501e-06, "loss": -0.0061, "num_tokens": 868892644.0, "reward": 1.0648632943630219, "reward_std": 0.1561727873980999, "rewards/reward_accuracy/mean": 0.965234375, "rewards/reward_accuracy/std": 0.15437662303447724, "rewards/reward_format/mean": 0.09962890744209289, "rewards/reward_format/std": 0.003653077222406864, "sampling/importance_sampling_ratio/max": 2.6353787660598753, "sampling/importance_sampling_ratio/mean": 0.9812964498996735, "sampling/importance_sampling_ratio/min": 0.06284817159175873, "sampling/sampling_logp_difference/max": 0.931235384941101, "sampling/sampling_logp_difference/mean": 0.00430159221868962, "step": 8500, "step_time": 7.930065969304996 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0015625, "completions/max_length": 1286.7, "completions/max_terminated_length": 1074.4, "completions/mean_length": 149.97890625, "completions/mean_terminated_length": 147.0322265625, "completions/min_length": 69.1, "completions/min_terminated_length": 69.1, "entropy": 0.04296927077230066, "epoch": 18.22269807280514, "frac_reward_zero_std": 0.9375, "grad_norm": 0.11767578125, "learning_rate": 9.1491e-06, "loss": -0.006, "num_tokens": 869796174.0, "reward": 1.0647070467472077, "reward_std": 0.13903171867132186, "rewards/reward_accuracy/mean": 0.96484375, "rewards/reward_accuracy/std": 0.13804719224572182, "rewards/reward_format/mean": 0.09986328259110451, "rewards/reward_format/std": 0.0017004600027576088, "sampling/importance_sampling_ratio/max": 2.5176496863365174, "sampling/importance_sampling_ratio/mean": 0.9885579168796539, "sampling/importance_sampling_ratio/min": 0.13337359372526408, "sampling/sampling_logp_difference/max": 0.8752417802810669, "sampling/sampling_logp_difference/mean": 0.004053684999234974, "step": 8510, "step_time": 6.165357400491485 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0015625, "completions/max_length": 1217.5, "completions/max_terminated_length": 1047.2, "completions/mean_length": 148.681640625, "completions/mean_terminated_length": 145.7134796142578, "completions/min_length": 62.1, "completions/min_terminated_length": 62.1, "entropy": 0.041143091348931196, "epoch": 18.2441113490364, "frac_reward_zero_std": 0.90625, "grad_norm": 0.68359375, "learning_rate": 9.148100000000001e-06, "loss": -0.0019, "num_tokens": 870689343.0, "reward": 1.0877344012260437, "reward_std": 0.09937636107206345, "rewards/reward_accuracy/mean": 0.987890625, "rewards/reward_accuracy/std": 0.09856762513518333, "rewards/reward_format/mean": 0.09984375163912773, "rewards/reward_format/std": 0.0017731342697516084, "sampling/importance_sampling_ratio/max": 2.5103798866271974, "sampling/importance_sampling_ratio/mean": 0.9862752497196198, "sampling/importance_sampling_ratio/min": 0.1218482255935669, "sampling/sampling_logp_difference/max": 0.8529219388961792, "sampling/sampling_logp_difference/mean": 0.004052158631384373, "step": 8520, "step_time": 5.820051057008095 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0046875, "completions/max_length": 1636.3, "completions/max_terminated_length": 1084.0, "completions/mean_length": 159.198828125, "completions/mean_terminated_length": 150.35723114013672, "completions/min_length": 63.2, "completions/min_terminated_length": 63.2, "entropy": 0.04152822191826999, "epoch": 18.265524625267666, "frac_reward_zero_std": 0.89375, "grad_norm": 0.208984375, "learning_rate": 9.147100000000001e-06, "loss": -0.009, "num_tokens": 871616764.0, "reward": 1.0535351753234863, "reward_std": 0.18972219303250312, "rewards/reward_accuracy/mean": 0.95390625, "rewards/reward_accuracy/std": 0.1877732366323471, "rewards/reward_format/mean": 0.09962890744209289, "rewards/reward_format/std": 0.0033354965271428227, "sampling/importance_sampling_ratio/max": 2.572454881668091, "sampling/importance_sampling_ratio/mean": 0.9845075666904449, "sampling/importance_sampling_ratio/min": 0.12856173776090146, "sampling/sampling_logp_difference/max": 1.0396783471107482, "sampling/sampling_logp_difference/mean": 0.004218765161931514, "step": 8530, "step_time": 7.664251924798009 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005078125, "completions/max_length": 1577.0, "completions/max_terminated_length": 1267.6, "completions/mean_length": 166.8125, "completions/mean_terminated_length": 157.26136169433593, "completions/min_length": 63.8, "completions/min_terminated_length": 63.8, "entropy": 0.043240712932311, "epoch": 18.28693790149893, "frac_reward_zero_std": 0.8875, "grad_norm": 0.796875, "learning_rate": 9.1461e-06, "loss": -0.0011, "num_tokens": 872557532.0, "reward": 1.043222677707672, "reward_std": 0.19183254688978196, "rewards/reward_accuracy/mean": 0.94375, "rewards/reward_accuracy/std": 0.18960458934307098, "rewards/reward_format/mean": 0.0994726575911045, "rewards/reward_format/std": 0.004853535257279873, "sampling/importance_sampling_ratio/max": 2.537194323539734, "sampling/importance_sampling_ratio/mean": 0.9957084774971008, "sampling/importance_sampling_ratio/min": 0.185854035615921, "sampling/sampling_logp_difference/max": 0.9228651046752929, "sampling/sampling_logp_difference/mean": 0.0038768432335928083, "step": 8540, "step_time": 7.671096479397965 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003125, "completions/max_length": 1589.1, "completions/max_terminated_length": 1467.9, "completions/mean_length": 168.206640625, "completions/mean_terminated_length": 162.4131317138672, "completions/min_length": 66.6, "completions/min_terminated_length": 66.6, "entropy": 0.04576845755800605, "epoch": 18.30835117773019, "frac_reward_zero_std": 0.89375, "grad_norm": 0.11962890625, "learning_rate": 9.145100000000002e-06, "loss": 0.0049, "num_tokens": 873511421.0, "reward": 1.0547461032867431, "reward_std": 0.16764646202791483, "rewards/reward_accuracy/mean": 0.955078125, "rewards/reward_accuracy/std": 0.16596630662679673, "rewards/reward_format/mean": 0.09966796934604645, "rewards/reward_format/std": 0.0037306495709344746, "sampling/importance_sampling_ratio/max": 2.4058130264282225, "sampling/importance_sampling_ratio/mean": 1.000846928358078, "sampling/importance_sampling_ratio/min": 0.11171788945794106, "sampling/sampling_logp_difference/max": 0.9704546093940735, "sampling/sampling_logp_difference/mean": 0.004158370057120919, "step": 8550, "step_time": 7.655849063716596 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00625, "completions/max_length": 1121.7, "completions/max_terminated_length": 1075.3, "completions/mean_length": 163.496484375, "completions/mean_terminated_length": 151.9055160522461, "completions/min_length": 66.9, "completions/min_terminated_length": 66.9, "entropy": 0.04444409145507962, "epoch": 18.329764453961456, "frac_reward_zero_std": 0.9125, "grad_norm": 0.412109375, "learning_rate": 9.1441e-06, "loss": -0.0042, "num_tokens": 874446436.0, "reward": 1.0598437666893006, "reward_std": 0.1578107587993145, "rewards/reward_accuracy/mean": 0.96015625, "rewards/reward_accuracy/std": 0.15704872757196425, "rewards/reward_format/mean": 0.09968750104308129, "rewards/reward_format/std": 0.002388068032450974, "sampling/importance_sampling_ratio/max": 2.562074613571167, "sampling/importance_sampling_ratio/mean": 0.9858137309551239, "sampling/importance_sampling_ratio/min": 0.08412972837686539, "sampling/sampling_logp_difference/max": 1.150586450099945, "sampling/sampling_logp_difference/mean": 0.00413800363894552, "step": 8560, "step_time": 5.61086009380233 }, { "clip_ratio/high_max": 2.3170796339400113e-05, "clip_ratio/high_mean": 2.896349542425014e-06, "clip_ratio/low_mean": 3.44390559803287e-07, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 3.240740102228301e-06, "completions/clipped_ratio": 0.0109375, "completions/max_length": 1560.3, "completions/max_terminated_length": 1409.7, "completions/mean_length": 175.027734375, "completions/mean_terminated_length": 154.50375366210938, "completions/min_length": 65.1, "completions/min_terminated_length": 65.1, "entropy": 0.04786982461810112, "epoch": 18.35117773019272, "frac_reward_zero_std": 0.85625, "grad_norm": 0.388671875, "learning_rate": 9.1431e-06, "loss": -0.006, "num_tokens": 875405819.0, "reward": 1.044121128320694, "reward_std": 0.19861215278506278, "rewards/reward_accuracy/mean": 0.944921875, "rewards/reward_accuracy/std": 0.1955738201737404, "rewards/reward_format/mean": 0.09919922053813934, "rewards/reward_format/std": 0.005896784598007798, "sampling/importance_sampling_ratio/max": 2.6213974952697754, "sampling/importance_sampling_ratio/mean": 0.976845920085907, "sampling/importance_sampling_ratio/min": 0.1035877994261682, "sampling/sampling_logp_difference/max": 1.1010785460472108, "sampling/sampling_logp_difference/mean": 0.004242875799536705, "step": 8570, "step_time": 7.713991008276935 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005078125, "completions/max_length": 1339.9, "completions/max_terminated_length": 1143.1, "completions/mean_length": 166.657421875, "completions/mean_terminated_length": 157.18639068603517, "completions/min_length": 68.0, "completions/min_terminated_length": 68.0, "entropy": 0.046134067908860744, "epoch": 18.37259100642398, "frac_reward_zero_std": 0.9125, "grad_norm": 0.40625, "learning_rate": 9.1421e-06, "loss": -0.0035, "num_tokens": 876349214.0, "reward": 1.0686914265155791, "reward_std": 0.12155143469572068, "rewards/reward_accuracy/mean": 0.969140625, "rewards/reward_accuracy/std": 0.11989398896694184, "rewards/reward_format/mean": 0.0995507813990116, "rewards/reward_format/std": 0.004080882505513727, "sampling/importance_sampling_ratio/max": 2.4071941018104552, "sampling/importance_sampling_ratio/mean": 0.9828149557113648, "sampling/importance_sampling_ratio/min": 0.051990370452404025, "sampling/sampling_logp_difference/max": 1.1543290555477141, "sampling/sampling_logp_difference/mean": 0.004263247363269329, "step": 8580, "step_time": 6.629249561508186 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003125, "completions/max_length": 1508.0, "completions/max_terminated_length": 961.4, "completions/mean_length": 160.819921875, "completions/mean_terminated_length": 154.89410400390625, "completions/min_length": 68.0, "completions/min_terminated_length": 68.0, "entropy": 0.03990651173517108, "epoch": 18.394004282655246, "frac_reward_zero_std": 0.8875, "grad_norm": 0.55859375, "learning_rate": 9.141100000000001e-06, "loss": -0.0032, "num_tokens": 877281473.0, "reward": 1.0575976610183715, "reward_std": 0.1685032308101654, "rewards/reward_accuracy/mean": 0.9578125, "rewards/reward_accuracy/std": 0.16749053820967674, "rewards/reward_format/mean": 0.09978515654802322, "rewards/reward_format/std": 0.0030696488218382003, "sampling/importance_sampling_ratio/max": 2.376018702983856, "sampling/importance_sampling_ratio/mean": 0.9854066491127014, "sampling/importance_sampling_ratio/min": 0.10967017933726311, "sampling/sampling_logp_difference/max": 1.0564433097839356, "sampling/sampling_logp_difference/mean": 0.003676741127856076, "step": 8590, "step_time": 7.10733306898328 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.002734375, "completions/max_length": 1210.3, "completions/max_terminated_length": 1123.4, "completions/mean_length": 157.7171875, "completions/mean_terminated_length": 152.54615936279296, "completions/min_length": 64.2, "completions/min_terminated_length": 64.2, "entropy": 0.04217505711130798, "epoch": 18.41541755888651, "frac_reward_zero_std": 0.93125, "grad_norm": 0.2197265625, "learning_rate": 9.1401e-06, "loss": -0.0048, "num_tokens": 878198045.0, "reward": 1.0743359565734862, "reward_std": 0.11905328631401062, "rewards/reward_accuracy/mean": 0.974609375, "rewards/reward_accuracy/std": 0.11790348589420319, "rewards/reward_format/mean": 0.09972656294703483, "rewards/reward_format/std": 0.00239671238232404, "sampling/importance_sampling_ratio/max": 2.384293723106384, "sampling/importance_sampling_ratio/mean": 0.9835129082202911, "sampling/importance_sampling_ratio/min": 0.02905181683599949, "sampling/sampling_logp_difference/max": 0.9519108533859253, "sampling/sampling_logp_difference/mean": 0.004050532262772322, "step": 8600, "step_time": 6.052885682313354 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0046875, "completions/max_length": 1503.0, "completions/max_terminated_length": 1108.8, "completions/mean_length": 159.962109375, "completions/mean_terminated_length": 151.14485626220704, "completions/min_length": 67.9, "completions/min_terminated_length": 67.9, "entropy": 0.040847976529039445, "epoch": 18.436830835117775, "frac_reward_zero_std": 0.9, "grad_norm": 0.111328125, "learning_rate": 9.1391e-06, "loss": -0.0061, "num_tokens": 879128796.0, "reward": 1.066503930091858, "reward_std": 0.15986426025629044, "rewards/reward_accuracy/mean": 0.966796875, "rewards/reward_accuracy/std": 0.15825553387403488, "rewards/reward_format/mean": 0.09970703199505807, "rewards/reward_format/std": 0.0029101309133693575, "sampling/importance_sampling_ratio/max": 2.5423968553543093, "sampling/importance_sampling_ratio/mean": 0.9952575087547302, "sampling/importance_sampling_ratio/min": 0.07426697887185582, "sampling/sampling_logp_difference/max": 1.699391508102417, "sampling/sampling_logp_difference/mean": 0.00415060946252197, "step": 8610, "step_time": 7.251291197809041 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005859375, "completions/max_length": 1340.7, "completions/max_terminated_length": 969.2, "completions/mean_length": 166.471484375, "completions/mean_terminated_length": 155.58936614990233, "completions/min_length": 64.4, "completions/min_terminated_length": 64.4, "entropy": 0.044167897361330685, "epoch": 18.458244111349035, "frac_reward_zero_std": 0.93125, "grad_norm": 0.1005859375, "learning_rate": 9.138100000000001e-06, "loss": -0.0062, "num_tokens": 880066547.0, "reward": 1.0674609661102294, "reward_std": 0.13675285279750823, "rewards/reward_accuracy/mean": 0.96796875, "rewards/reward_accuracy/std": 0.13418496549129486, "rewards/reward_format/mean": 0.0994921900331974, "rewards/reward_format/std": 0.004411076474934816, "sampling/importance_sampling_ratio/max": 2.4380250096321108, "sampling/importance_sampling_ratio/mean": 0.9903872609138489, "sampling/importance_sampling_ratio/min": 0.12321604192256927, "sampling/sampling_logp_difference/max": 0.8484362721443176, "sampling/sampling_logp_difference/mean": 0.0038369611371308564, "step": 8620, "step_time": 6.883035951096099 }, { "clip_ratio/high_max": 1.5227082622004673e-05, "clip_ratio/high_mean": 1.9033853277505842e-06, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 1.9033853277505842e-06, "completions/clipped_ratio": 0.004296875, "completions/max_length": 808.3, "completions/max_terminated_length": 725.9, "completions/mean_length": 147.3578125, "completions/mean_terminated_length": 139.2431213378906, "completions/min_length": 63.8, "completions/min_terminated_length": 63.8, "entropy": 0.04090734755154699, "epoch": 18.4796573875803, "frac_reward_zero_std": 0.9375, "grad_norm": 0.251953125, "learning_rate": 9.137100000000001e-06, "loss": -0.0015, "num_tokens": 880963783.0, "reward": 1.058359396457672, "reward_std": 0.12359218746423721, "rewards/reward_accuracy/mean": 0.95859375, "rewards/reward_accuracy/std": 0.12293190211057663, "rewards/reward_format/mean": 0.0997656263411045, "rewards/reward_format/std": 0.001852018851786852, "sampling/importance_sampling_ratio/max": 2.574910020828247, "sampling/importance_sampling_ratio/mean": 0.9848734676837921, "sampling/importance_sampling_ratio/min": 0.14049247382208704, "sampling/sampling_logp_difference/max": 0.8857405364513398, "sampling/sampling_logp_difference/mean": 0.004174930672161281, "step": 8630, "step_time": 4.400264114094898 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 1448.2, "completions/max_terminated_length": 1045.3, "completions/mean_length": 156.02109375, "completions/mean_terminated_length": 148.65486679077148, "completions/min_length": 66.3, "completions/min_terminated_length": 66.3, "entropy": 0.0404561256757006, "epoch": 18.501070663811564, "frac_reward_zero_std": 0.91875, "grad_norm": 0.70703125, "learning_rate": 9.1361e-06, "loss": -0.0073, "num_tokens": 881882925.0, "reward": 1.07861328125, "reward_std": 0.11133167401421815, "rewards/reward_accuracy/mean": 0.97890625, "rewards/reward_accuracy/std": 0.1094370238482952, "rewards/reward_format/mean": 0.09970703125, "rewards/reward_format/std": 0.0034037382109090688, "sampling/importance_sampling_ratio/max": 2.4551737785339354, "sampling/importance_sampling_ratio/mean": 0.9963717699050904, "sampling/importance_sampling_ratio/min": 0.1130001574754715, "sampling/sampling_logp_difference/max": 1.0132632851600647, "sampling/sampling_logp_difference/mean": 0.003932455112226308, "step": 8640, "step_time": 6.835694029417937 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003515625, "completions/max_length": 1308.3, "completions/max_terminated_length": 1251.3, "completions/mean_length": 151.330078125, "completions/mean_terminated_length": 144.69277648925782, "completions/min_length": 66.2, "completions/min_terminated_length": 66.2, "entropy": 0.04259004567284137, "epoch": 18.522483940042825, "frac_reward_zero_std": 0.94375, "grad_norm": 0.0, "learning_rate": 9.135100000000002e-06, "loss": -0.0008, "num_tokens": 882785690.0, "reward": 1.0791211128234863, "reward_std": 0.09905615895986557, "rewards/reward_accuracy/mean": 0.979296875, "rewards/reward_accuracy/std": 0.09792580530047416, "rewards/reward_format/mean": 0.0998242199420929, "rewards/reward_format/std": 0.0015754709485918284, "sampling/importance_sampling_ratio/max": 2.4045244216918946, "sampling/importance_sampling_ratio/mean": 0.9886280119419097, "sampling/importance_sampling_ratio/min": 0.09932979568839073, "sampling/sampling_logp_difference/max": 0.9599446177482605, "sampling/sampling_logp_difference/mean": 0.004387426911853254, "step": 8650, "step_time": 6.356723203699221 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 2.616223628137959e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 2.616223628137959e-06, "completions/clipped_ratio": 0.015625, "completions/max_length": 1447.7, "completions/max_terminated_length": 1292.3, "completions/mean_length": 191.150390625, "completions/mean_terminated_length": 162.03348541259766, "completions/min_length": 66.0, "completions/min_terminated_length": 66.0, "entropy": 0.04893013313412666, "epoch": 18.54389721627409, "frac_reward_zero_std": 0.9, "grad_norm": 0.279296875, "learning_rate": 9.134100000000001e-06, "loss": -0.0035, "num_tokens": 883791291.0, "reward": 1.0540625154972076, "reward_std": 0.15334973216522485, "rewards/reward_accuracy/mean": 0.95546875, "rewards/reward_accuracy/std": 0.14849773049354553, "rewards/reward_format/mean": 0.09859375134110451, "rewards/reward_format/std": 0.007381148962303996, "sampling/importance_sampling_ratio/max": 2.5085996627807616, "sampling/importance_sampling_ratio/mean": 0.9848408937454224, "sampling/importance_sampling_ratio/min": 0.10884870886802674, "sampling/sampling_logp_difference/max": 0.967182868719101, "sampling/sampling_logp_difference/mean": 0.004076297814026475, "step": 8660, "step_time": 7.511807772595785 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.004296875, "completions/max_length": 1241.0, "completions/max_terminated_length": 1126.8, "completions/mean_length": 164.298046875, "completions/mean_terminated_length": 156.26779022216797, "completions/min_length": 65.2, "completions/min_terminated_length": 65.2, "entropy": 0.047662134491838516, "epoch": 18.565310492505354, "frac_reward_zero_std": 0.8875, "grad_norm": 0.0, "learning_rate": 9.1331e-06, "loss": -0.0079, "num_tokens": 884728774.0, "reward": 1.0622070491313935, "reward_std": 0.14775382950901986, "rewards/reward_accuracy/mean": 0.9625, "rewards/reward_accuracy/std": 0.14660028591752053, "rewards/reward_format/mean": 0.09970703199505807, "rewards/reward_format/std": 0.003252748865634203, "sampling/importance_sampling_ratio/max": 2.658415675163269, "sampling/importance_sampling_ratio/mean": 1.0017923414707184, "sampling/importance_sampling_ratio/min": 0.21202876791357994, "sampling/sampling_logp_difference/max": 1.003309726715088, "sampling/sampling_logp_difference/mean": 0.004321845015510917, "step": 8670, "step_time": 6.112202731100842 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.006640625, "completions/max_length": 1905.3, "completions/max_terminated_length": 1271.6, "completions/mean_length": 182.49609375, "completions/mean_terminated_length": 170.08214111328124, "completions/min_length": 70.5, "completions/min_terminated_length": 70.5, "entropy": 0.049701267620548606, "epoch": 18.58672376873662, "frac_reward_zero_std": 0.875, "grad_norm": 0.166015625, "learning_rate": 9.1321e-06, "loss": -0.0042, "num_tokens": 885722508.0, "reward": 1.0522070407867432, "reward_std": 0.18709155097603797, "rewards/reward_accuracy/mean": 0.952734375, "rewards/reward_accuracy/std": 0.18499492704868317, "rewards/reward_format/mean": 0.0994726575911045, "rewards/reward_format/std": 0.004201127146370709, "sampling/importance_sampling_ratio/max": 2.3362228512763976, "sampling/importance_sampling_ratio/mean": 0.9857252776622772, "sampling/importance_sampling_ratio/min": 0.06558009525761008, "sampling/sampling_logp_difference/max": 1.280612337589264, "sampling/sampling_logp_difference/mean": 0.004220749577507376, "step": 8680, "step_time": 9.024743852496613 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00234375, "completions/max_length": 1386.5, "completions/max_terminated_length": 1111.1, "completions/mean_length": 154.387109375, "completions/mean_terminated_length": 149.97672424316406, "completions/min_length": 63.3, "completions/min_terminated_length": 63.3, "entropy": 0.04180880025960505, "epoch": 18.60813704496788, "frac_reward_zero_std": 0.925, "grad_norm": 0.3046875, "learning_rate": 9.1311e-06, "loss": -0.0067, "num_tokens": 886633691.0, "reward": 1.069238293170929, "reward_std": 0.1423884943127632, "rewards/reward_accuracy/mean": 0.96953125, "rewards/reward_accuracy/std": 0.14058632850646974, "rewards/reward_format/mean": 0.09970703125, "rewards/reward_format/std": 0.003890778520144522, "sampling/importance_sampling_ratio/max": 2.498514175415039, "sampling/importance_sampling_ratio/mean": 0.9778927564620972, "sampling/importance_sampling_ratio/min": 0.03938644677400589, "sampling/sampling_logp_difference/max": 1.2177836418151855, "sampling/sampling_logp_difference/mean": 0.003969055390916765, "step": 8690, "step_time": 6.631099032890051 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.002734375, "completions/max_length": 1089.1, "completions/max_terminated_length": 781.8, "completions/mean_length": 149.696875, "completions/mean_terminated_length": 144.5385284423828, "completions/min_length": 64.9, "completions/min_terminated_length": 64.9, "entropy": 0.041011302988044916, "epoch": 18.629550321199144, "frac_reward_zero_std": 0.91875, "grad_norm": 0.0, "learning_rate": 9.130100000000001e-06, "loss": -0.0018, "num_tokens": 887526515.0, "reward": 1.082187533378601, "reward_std": 0.09522264078259468, "rewards/reward_accuracy/mean": 0.982421875, "rewards/reward_accuracy/std": 0.0937635876238346, "rewards/reward_format/mean": 0.09976562708616257, "rewards/reward_format/std": 0.0025140494108200073, "sampling/importance_sampling_ratio/max": 2.4721116065979003, "sampling/importance_sampling_ratio/mean": 0.9914973497390747, "sampling/importance_sampling_ratio/min": 0.17050465643405915, "sampling/sampling_logp_difference/max": 0.9500296950340271, "sampling/sampling_logp_difference/mean": 0.003960172017104924, "step": 8700, "step_time": 5.4406852170068305 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005078125, "completions/max_length": 1336.0, "completions/max_terminated_length": 1038.5, "completions/mean_length": 163.541015625, "completions/mean_terminated_length": 153.95977630615235, "completions/min_length": 65.0, "completions/min_terminated_length": 65.0, "entropy": 0.04287818595767021, "epoch": 18.650963597430408, "frac_reward_zero_std": 0.9, "grad_norm": 0.0869140625, "learning_rate": 9.1291e-06, "loss": -0.0073, "num_tokens": 888466380.0, "reward": 1.072226595878601, "reward_std": 0.1356072448194027, "rewards/reward_accuracy/mean": 0.97265625, "rewards/reward_accuracy/std": 0.1331235311925411, "rewards/reward_format/mean": 0.09957031458616257, "rewards/reward_format/std": 0.003905145265161991, "sampling/importance_sampling_ratio/max": 2.2513145208358765, "sampling/importance_sampling_ratio/mean": 0.9915796041488647, "sampling/importance_sampling_ratio/min": 0.09864196181297302, "sampling/sampling_logp_difference/max": 0.9241582751274109, "sampling/sampling_logp_difference/mean": 0.003949113050475716, "step": 8710, "step_time": 6.516004089493071 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 1404.9, "completions/max_terminated_length": 858.1, "completions/mean_length": 160.350390625, "completions/mean_terminated_length": 152.96230392456056, "completions/min_length": 66.7, "completions/min_terminated_length": 66.7, "entropy": 0.04089411471504718, "epoch": 18.67237687366167, "frac_reward_zero_std": 0.91875, "grad_norm": 0.1474609375, "learning_rate": 9.128100000000002e-06, "loss": -0.0057, "num_tokens": 889395325.0, "reward": 1.0716211080551148, "reward_std": 0.13884064704179763, "rewards/reward_accuracy/mean": 0.971875, "rewards/reward_accuracy/std": 0.13653998747467994, "rewards/reward_format/mean": 0.09974609464406967, "rewards/reward_format/std": 0.0027140011778101327, "sampling/importance_sampling_ratio/max": 2.4920124769210816, "sampling/importance_sampling_ratio/mean": 0.9905592918395996, "sampling/importance_sampling_ratio/min": 0.12522636279463767, "sampling/sampling_logp_difference/max": 1.0339375972747802, "sampling/sampling_logp_difference/mean": 0.003972335834987462, "step": 8720, "step_time": 6.7700647299090635 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005859375, "completions/max_length": 1201.0, "completions/max_terminated_length": 904.0, "completions/mean_length": 153.256640625, "completions/mean_terminated_length": 142.25006103515625, "completions/min_length": 64.2, "completions/min_terminated_length": 64.2, "entropy": 0.037436686805449426, "epoch": 18.693790149892934, "frac_reward_zero_std": 0.90625, "grad_norm": 0.34375, "learning_rate": 9.127100000000001e-06, "loss": -0.0034, "num_tokens": 890300302.0, "reward": 1.0658398747444153, "reward_std": 0.13231036067008972, "rewards/reward_accuracy/mean": 0.96640625, "rewards/reward_accuracy/std": 0.1302319161593914, "rewards/reward_format/mean": 0.09943359568715096, "rewards/reward_format/std": 0.0042722588405013084, "sampling/importance_sampling_ratio/max": 2.4907397270202636, "sampling/importance_sampling_ratio/mean": 0.9921734571456909, "sampling/importance_sampling_ratio/min": 0.08761086165905, "sampling/sampling_logp_difference/max": 1.0846805572509766, "sampling/sampling_logp_difference/mean": 0.0037072953302413223, "step": 8730, "step_time": 5.978781973102014 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00625, "completions/max_length": 1502.7, "completions/max_terminated_length": 1153.8, "completions/mean_length": 166.975390625, "completions/mean_terminated_length": 155.34710998535155, "completions/min_length": 64.9, "completions/min_terminated_length": 64.9, "entropy": 0.04686242416501045, "epoch": 18.715203426124198, "frac_reward_zero_std": 0.875, "grad_norm": 0.24609375, "learning_rate": 9.1261e-06, "loss": -0.011, "num_tokens": 891249919.0, "reward": 1.0600195527076721, "reward_std": 0.16591929867863656, "rewards/reward_accuracy/mean": 0.960546875, "rewards/reward_accuracy/std": 0.1641511343419552, "rewards/reward_format/mean": 0.0994726575911045, "rewards/reward_format/std": 0.004328975477255881, "sampling/importance_sampling_ratio/max": 2.3338439106941222, "sampling/importance_sampling_ratio/mean": 0.979765784740448, "sampling/importance_sampling_ratio/min": 0.11135517656803132, "sampling/sampling_logp_difference/max": 0.9557677745819092, "sampling/sampling_logp_difference/mean": 0.00426657609641552, "step": 8740, "step_time": 7.26250603471126 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.004296875, "completions/max_length": 1391.7, "completions/max_terminated_length": 1232.3, "completions/mean_length": 172.420703125, "completions/mean_terminated_length": 164.51128540039062, "completions/min_length": 64.1, "completions/min_terminated_length": 64.1, "entropy": 0.04698663067538291, "epoch": 18.73661670235546, "frac_reward_zero_std": 0.8875, "grad_norm": 0.0, "learning_rate": 9.125100000000002e-06, "loss": -0.0068, "num_tokens": 892210868.0, "reward": 1.0531836092472076, "reward_std": 0.17547309920191764, "rewards/reward_accuracy/mean": 0.953515625, "rewards/reward_accuracy/std": 0.17423024028539658, "rewards/reward_format/mean": 0.09966797009110451, "rewards/reward_format/std": 0.0032918840181082485, "sampling/importance_sampling_ratio/max": 2.4605786085128782, "sampling/importance_sampling_ratio/mean": 0.9814718842506409, "sampling/importance_sampling_ratio/min": 0.1358148753643036, "sampling/sampling_logp_difference/max": 1.0722109794616699, "sampling/sampling_logp_difference/mean": 0.004365383996628225, "step": 8750, "step_time": 6.699193251872202 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0046875, "completions/max_length": 1345.6, "completions/max_terminated_length": 1001.2, "completions/mean_length": 152.348828125, "completions/mean_terminated_length": 143.48479232788085, "completions/min_length": 61.9, "completions/min_terminated_length": 61.9, "entropy": 0.03991281243506819, "epoch": 18.758029978586723, "frac_reward_zero_std": 0.925, "grad_norm": 0.443359375, "learning_rate": 9.124100000000001e-06, "loss": -0.0041, "num_tokens": 893114817.0, "reward": 1.067929708957672, "reward_std": 0.13865133598446847, "rewards/reward_accuracy/mean": 0.968359375, "rewards/reward_accuracy/std": 0.13666071742773056, "rewards/reward_format/mean": 0.09957031384110451, "rewards/reward_format/std": 0.0044530523009598255, "sampling/importance_sampling_ratio/max": 2.44599848985672, "sampling/importance_sampling_ratio/mean": 0.9875916957855224, "sampling/importance_sampling_ratio/min": 0.15441621616482734, "sampling/sampling_logp_difference/max": 0.9445678651332855, "sampling/sampling_logp_difference/mean": 0.004008785868063569, "step": 8760, "step_time": 6.596600792300888 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.004296875, "completions/max_length": 1613.5, "completions/max_terminated_length": 1448.0, "completions/mean_length": 153.862890625, "completions/mean_terminated_length": 145.6830581665039, "completions/min_length": 63.6, "completions/min_terminated_length": 63.6, "entropy": 0.04200834957882762, "epoch": 18.779443254817988, "frac_reward_zero_std": 0.9125, "grad_norm": 0.1171875, "learning_rate": 9.1231e-06, "loss": -0.011, "num_tokens": 894024226.0, "reward": 1.0776953220367431, "reward_std": 0.13383573219180106, "rewards/reward_accuracy/mean": 0.978125, "rewards/reward_accuracy/std": 0.1315659649670124, "rewards/reward_format/mean": 0.09957031309604644, "rewards/reward_format/std": 0.003573947888799012, "sampling/importance_sampling_ratio/max": 2.53936288356781, "sampling/importance_sampling_ratio/mean": 0.9882951974868774, "sampling/importance_sampling_ratio/min": 0.13987094312906265, "sampling/sampling_logp_difference/max": 1.1786380052566527, "sampling/sampling_logp_difference/mean": 0.004030270059593022, "step": 8770, "step_time": 7.722741360784857 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003125, "completions/max_length": 845.8, "completions/max_terminated_length": 823.0, "completions/mean_length": 159.998828125, "completions/mean_terminated_length": 154.19696044921875, "completions/min_length": 67.9, "completions/min_terminated_length": 67.9, "entropy": 0.04234646097756922, "epoch": 18.800856531049252, "frac_reward_zero_std": 0.9, "grad_norm": 0.0, "learning_rate": 9.1221e-06, "loss": -0.0073, "num_tokens": 894953487.0, "reward": 1.0739257991313935, "reward_std": 0.1045950286090374, "rewards/reward_accuracy/mean": 0.97421875, "rewards/reward_accuracy/std": 0.10336325019598007, "rewards/reward_format/mean": 0.09970703274011612, "rewards/reward_format/std": 0.002262084931135178, "sampling/importance_sampling_ratio/max": 2.3516990184783935, "sampling/importance_sampling_ratio/mean": 0.9816068172454834, "sampling/importance_sampling_ratio/min": 0.20281865820288658, "sampling/sampling_logp_difference/max": 0.9887495040893555, "sampling/sampling_logp_difference/mean": 0.003976118261925876, "step": 8780, "step_time": 4.431175550018088 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00078125, "completions/max_length": 1322.8, "completions/max_terminated_length": 1127.5, "completions/mean_length": 148.6921875, "completions/mean_terminated_length": 147.20387268066406, "completions/min_length": 65.3, "completions/min_terminated_length": 65.3, "entropy": 0.04277651521842927, "epoch": 18.822269807280513, "frac_reward_zero_std": 0.875, "grad_norm": 0.07373046875, "learning_rate": 9.1211e-06, "loss": -0.0043, "num_tokens": 895851339.0, "reward": 1.0835156321525574, "reward_std": 0.1150617890059948, "rewards/reward_accuracy/mean": 0.98359375, "rewards/reward_accuracy/std": 0.11450174674391747, "rewards/reward_format/mean": 0.09992187544703483, "rewards/reward_format/std": 0.0012500000651925803, "sampling/importance_sampling_ratio/max": 2.2957559704780577, "sampling/importance_sampling_ratio/mean": 0.9893794894218445, "sampling/importance_sampling_ratio/min": 0.19688963927328587, "sampling/sampling_logp_difference/max": 0.9163195013999939, "sampling/sampling_logp_difference/mean": 0.003939542546868324, "step": 8790, "step_time": 6.262025274184998 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.004296875, "completions/max_length": 1522.3, "completions/max_terminated_length": 1436.3, "completions/mean_length": 173.088671875, "completions/mean_terminated_length": 165.05245819091797, "completions/min_length": 64.3, "completions/min_terminated_length": 64.3, "entropy": 0.047683061962015924, "epoch": 18.843683083511777, "frac_reward_zero_std": 0.89375, "grad_norm": 0.318359375, "learning_rate": 9.120100000000001e-06, "loss": -0.009, "num_tokens": 896814430.0, "reward": 1.0507812559604646, "reward_std": 0.1847189910709858, "rewards/reward_accuracy/mean": 0.951171875, "rewards/reward_accuracy/std": 0.18295823112130166, "rewards/reward_format/mean": 0.09960937574505806, "rewards/reward_format/std": 0.003899338305927813, "sampling/importance_sampling_ratio/max": 2.4815653443336485, "sampling/importance_sampling_ratio/mean": 0.97511927485466, "sampling/importance_sampling_ratio/min": 0.0693464394658804, "sampling/sampling_logp_difference/max": 0.9532556533813477, "sampling/sampling_logp_difference/mean": 0.004153065057471395, "step": 8800, "step_time": 7.608273927081609 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0046875, "completions/max_length": 1444.7, "completions/max_terminated_length": 1170.7, "completions/mean_length": 169.35234375, "completions/mean_terminated_length": 160.7246971130371, "completions/min_length": 65.0, "completions/min_terminated_length": 65.0, "entropy": 0.044793715537525716, "epoch": 18.865096359743042, "frac_reward_zero_std": 0.9, "grad_norm": 0.212890625, "learning_rate": 9.1191e-06, "loss": -0.0031, "num_tokens": 897766692.0, "reward": 1.0628711223602294, "reward_std": 0.1508186012506485, "rewards/reward_accuracy/mean": 0.96328125, "rewards/reward_accuracy/std": 0.14852382242679596, "rewards/reward_format/mean": 0.09958984553813935, "rewards/reward_format/std": 0.003871976584196091, "sampling/importance_sampling_ratio/max": 2.5512237310409547, "sampling/importance_sampling_ratio/mean": 0.9923527061939239, "sampling/importance_sampling_ratio/min": 0.1581953912973404, "sampling/sampling_logp_difference/max": 0.9111201524734497, "sampling/sampling_logp_difference/mean": 0.003959611430764199, "step": 8810, "step_time": 6.780620105980779 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00078125, "completions/max_length": 1192.0, "completions/max_terminated_length": 1017.9, "completions/mean_length": 143.73515625, "completions/mean_terminated_length": 142.2555725097656, "completions/min_length": 63.5, "completions/min_terminated_length": 63.5, "entropy": 0.038904798892326654, "epoch": 18.886509635974303, "frac_reward_zero_std": 0.925, "grad_norm": 0.453125, "learning_rate": 9.1181e-06, "loss": -0.0033, "num_tokens": 898657742.0, "reward": 1.0636132955551147, "reward_std": 0.15745854601264, "rewards/reward_accuracy/mean": 0.963671875, "rewards/reward_accuracy/std": 0.15713395848870276, "rewards/reward_format/mean": 0.09994140714406967, "rewards/reward_format/std": 0.0009375000605359674, "sampling/importance_sampling_ratio/max": 2.4830235481262206, "sampling/importance_sampling_ratio/mean": 1.0011702358722687, "sampling/importance_sampling_ratio/min": 0.21615881137549878, "sampling/sampling_logp_difference/max": 0.7998057126998901, "sampling/sampling_logp_difference/mean": 0.0036559398286044598, "step": 8820, "step_time": 5.7111719324049774 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.015234375, "completions/max_length": 1566.9, "completions/max_terminated_length": 1319.3, "completions/mean_length": 195.86171875, "completions/mean_terminated_length": 167.4388214111328, "completions/min_length": 68.1, "completions/min_terminated_length": 68.1, "entropy": 0.05504367693793029, "epoch": 18.907922912205567, "frac_reward_zero_std": 0.89375, "grad_norm": 0.2138671875, "learning_rate": 9.117100000000001e-06, "loss": -0.0024, "num_tokens": 899680908.0, "reward": 1.0232617437839509, "reward_std": 0.2627103254199028, "rewards/reward_accuracy/mean": 0.924609375, "rewards/reward_accuracy/std": 0.25843053460121157, "rewards/reward_format/mean": 0.09865234494209289, "rewards/reward_format/std": 0.007323176995851099, "sampling/importance_sampling_ratio/max": 2.6613732099533083, "sampling/importance_sampling_ratio/mean": 0.9844253420829773, "sampling/importance_sampling_ratio/min": 0.07841789871454238, "sampling/sampling_logp_difference/max": 1.175289273262024, "sampling/sampling_logp_difference/mean": 0.004265462956391275, "step": 8830, "step_time": 7.830403436993947 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00546875, "completions/max_length": 1432.1, "completions/max_terminated_length": 1363.2, "completions/mean_length": 181.621484375, "completions/mean_terminated_length": 171.73119659423827, "completions/min_length": 69.5, "completions/min_terminated_length": 69.5, "entropy": 0.04945667127612978, "epoch": 18.92933618843683, "frac_reward_zero_std": 0.88125, "grad_norm": 0.55078125, "learning_rate": 9.1161e-06, "loss": -0.0077, "num_tokens": 900667155.0, "reward": 1.0533984541893004, "reward_std": 0.1786373123526573, "rewards/reward_accuracy/mean": 0.95390625, "rewards/reward_accuracy/std": 0.1771399885416031, "rewards/reward_format/mean": 0.09949218779802323, "rewards/reward_format/std": 0.0031739657977595927, "sampling/importance_sampling_ratio/max": 2.446089482307434, "sampling/importance_sampling_ratio/mean": 0.970781409740448, "sampling/importance_sampling_ratio/min": 0.10176858138293028, "sampling/sampling_logp_difference/max": 1.2614002227783203, "sampling/sampling_logp_difference/mean": 0.004176443256437778, "step": 8840, "step_time": 7.052500664503896 }, { "clip_ratio/high_max": 1.6164788394235075e-05, "clip_ratio/high_mean": 2.0205985492793844e-06, "clip_ratio/low_mean": 1.134206286224071e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 3.15480479002872e-06, "completions/clipped_ratio": 0.007421875, "completions/max_length": 1728.7, "completions/max_terminated_length": 1295.6, "completions/mean_length": 174.925390625, "completions/mean_terminated_length": 160.90143432617188, "completions/min_length": 65.0, "completions/min_terminated_length": 65.0, "entropy": 0.04822886758483946, "epoch": 18.950749464668093, "frac_reward_zero_std": 0.9, "grad_norm": 0.408203125, "learning_rate": 9.115100000000002e-06, "loss": -0.0028, "num_tokens": 901631140.0, "reward": 1.0497461318969727, "reward_std": 0.19387315437197686, "rewards/reward_accuracy/mean": 0.950390625, "rewards/reward_accuracy/std": 0.1914452336728573, "rewards/reward_format/mean": 0.09935547113418579, "rewards/reward_format/std": 0.00598320048302412, "sampling/importance_sampling_ratio/max": 2.336688530445099, "sampling/importance_sampling_ratio/mean": 0.97986119389534, "sampling/importance_sampling_ratio/min": 0.11514662876725197, "sampling/sampling_logp_difference/max": 0.9252523362636567, "sampling/sampling_logp_difference/mean": 0.004131598072126508, "step": 8850, "step_time": 8.216890418782715 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00703125, "completions/max_length": 1513.0, "completions/max_terminated_length": 1269.2, "completions/mean_length": 164.562109375, "completions/mean_terminated_length": 151.3040344238281, "completions/min_length": 60.2, "completions/min_terminated_length": 60.2, "entropy": 0.04521771401632577, "epoch": 18.972162740899357, "frac_reward_zero_std": 0.9125, "grad_norm": 0.13671875, "learning_rate": 9.114100000000001e-06, "loss": -0.0068, "num_tokens": 902573331.0, "reward": 1.0624414145946504, "reward_std": 0.1601423889398575, "rewards/reward_accuracy/mean": 0.962890625, "rewards/reward_accuracy/std": 0.15832012221217157, "rewards/reward_format/mean": 0.0995507813990116, "rewards/reward_format/std": 0.004036956024356187, "sampling/importance_sampling_ratio/max": 2.2748740792274473, "sampling/importance_sampling_ratio/mean": 0.9888275146484375, "sampling/importance_sampling_ratio/min": 0.1455095828510821, "sampling/sampling_logp_difference/max": 0.8934823095798492, "sampling/sampling_logp_difference/mean": 0.004105035145767033, "step": 8860, "step_time": 7.474874223925871 }, { "clip_ratio/high_max": 3.940731403417885e-06, "clip_ratio/high_mean": 4.925914254272357e-07, "clip_ratio/low_mean": 2.012497679970693e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 2.5050891053979286e-06, "completions/clipped_ratio": 0.0109375, "completions/max_length": 1573.5, "completions/max_terminated_length": 1439.5, "completions/mean_length": 193.993359375, "completions/mean_terminated_length": 173.92760620117187, "completions/min_length": 69.6, "completions/min_terminated_length": 69.6, "entropy": 0.056690949876792726, "epoch": 18.99357601713062, "frac_reward_zero_std": 0.875, "grad_norm": 0.2412109375, "learning_rate": 9.113100000000001e-06, "loss": -0.01, "num_tokens": 903584466.0, "reward": 1.0438672304153442, "reward_std": 0.19322730749845504, "rewards/reward_accuracy/mean": 0.94453125, "rewards/reward_accuracy/std": 0.19092829525470734, "rewards/reward_format/mean": 0.09933593943715095, "rewards/reward_format/std": 0.005261460202746093, "sampling/importance_sampling_ratio/max": 2.6452703714370727, "sampling/importance_sampling_ratio/mean": 0.9871454477310181, "sampling/importance_sampling_ratio/min": 0.14121552258729936, "sampling/sampling_logp_difference/max": 0.9183063268661499, "sampling/sampling_logp_difference/mean": 0.00452033847104758, "step": 8870, "step_time": 7.528314584371401 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00703125, "completions/max_length": 1636.2, "completions/max_terminated_length": 1289.9, "completions/mean_length": 173.97578125, "completions/mean_terminated_length": 160.81491241455078, "completions/min_length": 66.9, "completions/min_terminated_length": 66.9, "entropy": 0.052287173364311455, "epoch": 19.014989293361886, "frac_reward_zero_std": 0.88125, "grad_norm": 0.392578125, "learning_rate": 9.1121e-06, "loss": -0.0087, "num_tokens": 904546436.0, "reward": 1.0679101943969727, "reward_std": 0.15796584635972977, "rewards/reward_accuracy/mean": 0.968359375, "rewards/reward_accuracy/std": 0.15526243522763253, "rewards/reward_format/mean": 0.09955078288912773, "rewards/reward_format/std": 0.005026802234351635, "sampling/importance_sampling_ratio/max": 2.4295794129371644, "sampling/importance_sampling_ratio/mean": 0.9867786645889283, "sampling/importance_sampling_ratio/min": 0.13332206904888153, "sampling/sampling_logp_difference/max": 1.0020817577838899, "sampling/sampling_logp_difference/mean": 0.004271209938451648, "step": 8880, "step_time": 7.930833600505139 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005078125, "completions/max_length": 1243.9, "completions/max_terminated_length": 1112.6, "completions/mean_length": 166.021875, "completions/mean_terminated_length": 156.50658416748047, "completions/min_length": 67.8, "completions/min_terminated_length": 67.8, "entropy": 0.04780408081132918, "epoch": 19.036402569593147, "frac_reward_zero_std": 0.8625, "grad_norm": 0.39453125, "learning_rate": 9.1111e-06, "loss": -0.0062, "num_tokens": 905492940.0, "reward": 1.0366797149181366, "reward_std": 0.18530816361308097, "rewards/reward_accuracy/mean": 0.937109375, "rewards/reward_accuracy/std": 0.18424833044409752, "rewards/reward_format/mean": 0.09957031458616257, "rewards/reward_format/std": 0.0034375346498563887, "sampling/importance_sampling_ratio/max": 2.7050370454788206, "sampling/importance_sampling_ratio/mean": 0.9874306678771972, "sampling/importance_sampling_ratio/min": 0.045328122656792404, "sampling/sampling_logp_difference/max": 0.8893057107925415, "sampling/sampling_logp_difference/mean": 0.0044152555521577595, "step": 8890, "step_time": 6.074370008212282 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00546875, "completions/max_length": 1075.6, "completions/max_terminated_length": 1017.8, "completions/mean_length": 163.89296875, "completions/mean_terminated_length": 153.77596130371094, "completions/min_length": 65.5, "completions/min_terminated_length": 65.5, "entropy": 0.041960479505360124, "epoch": 19.05781584582441, "frac_reward_zero_std": 0.90625, "grad_norm": 0.484375, "learning_rate": 9.110100000000001e-06, "loss": -0.0007, "num_tokens": 906430954.0, "reward": 1.0490820586681366, "reward_std": 0.18053021058440208, "rewards/reward_accuracy/mean": 0.949609375, "rewards/reward_accuracy/std": 0.17856702581048012, "rewards/reward_format/mean": 0.0994726575911045, "rewards/reward_format/std": 0.003806931711733341, "sampling/importance_sampling_ratio/max": 2.4334341526031493, "sampling/importance_sampling_ratio/mean": 0.9943706631660462, "sampling/importance_sampling_ratio/min": 0.16125569641590118, "sampling/sampling_logp_difference/max": 0.8449162840843201, "sampling/sampling_logp_difference/mean": 0.004114087275229395, "step": 8900, "step_time": 5.452935524901841 }, { "clip_ratio/high_max": 2.854532976925839e-06, "clip_ratio/high_mean": 3.5681662211572986e-07, "clip_ratio/low_mean": 1.9633879674074705e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 2.3202045895232002e-06, "completions/clipped_ratio": 0.009765625, "completions/max_length": 1481.4, "completions/max_terminated_length": 1237.7, "completions/mean_length": 167.775, "completions/mean_terminated_length": 149.3366683959961, "completions/min_length": 69.0, "completions/min_terminated_length": 69.0, "entropy": 0.03912908544298262, "epoch": 19.079229122055676, "frac_reward_zero_std": 0.925, "grad_norm": 0.2197265625, "learning_rate": 9.1091e-06, "loss": -0.0033, "num_tokens": 907373690.0, "reward": 1.0491015791893006, "reward_std": 0.1719110243022442, "rewards/reward_accuracy/mean": 0.95, "rewards/reward_accuracy/std": 0.1683637149631977, "rewards/reward_format/mean": 0.09910156279802322, "rewards/reward_format/std": 0.005975830112583935, "sampling/importance_sampling_ratio/max": 2.377292287349701, "sampling/importance_sampling_ratio/mean": 0.9857052564620972, "sampling/importance_sampling_ratio/min": 0.1615949898958206, "sampling/sampling_logp_difference/max": 0.8699005603790283, "sampling/sampling_logp_difference/mean": 0.003680521622300148, "step": 8910, "step_time": 7.259433790607727 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001171875, "completions/max_length": 1355.7, "completions/max_terminated_length": 1128.4, "completions/mean_length": 150.56953125, "completions/mean_terminated_length": 148.3381576538086, "completions/min_length": 66.5, "completions/min_terminated_length": 66.5, "entropy": 0.040584154822863636, "epoch": 19.100642398286936, "frac_reward_zero_std": 0.925, "grad_norm": 0.1435546875, "learning_rate": 9.1081e-06, "loss": -0.0019, "num_tokens": 908273308.0, "reward": 1.0846484541893004, "reward_std": 0.09556948721874506, "rewards/reward_accuracy/mean": 0.984765625, "rewards/reward_accuracy/std": 0.09455022066831589, "rewards/reward_format/mean": 0.09988281354308129, "rewards/reward_format/std": 0.0015071486588567496, "sampling/importance_sampling_ratio/max": 2.3009019255638123, "sampling/importance_sampling_ratio/mean": 0.9887462496757508, "sampling/importance_sampling_ratio/min": 0.11690510474145413, "sampling/sampling_logp_difference/max": 0.9396689176559448, "sampling/sampling_logp_difference/mean": 0.004002215317450463, "step": 8920, "step_time": 6.470840089800186 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00234375, "completions/max_length": 935.7, "completions/max_terminated_length": 843.6, "completions/mean_length": 152.892578125, "completions/mean_terminated_length": 148.55570526123046, "completions/min_length": 65.0, "completions/min_terminated_length": 65.0, "entropy": 0.038009654148481786, "epoch": 19.1220556745182, "frac_reward_zero_std": 0.9125, "grad_norm": 0.8515625, "learning_rate": 9.107100000000001e-06, "loss": 0.001, "num_tokens": 909182937.0, "reward": 1.0443164229393005, "reward_std": 0.1876315087080002, "rewards/reward_accuracy/mean": 0.94453125, "rewards/reward_accuracy/std": 0.1866455964744091, "rewards/reward_format/mean": 0.09978515729308128, "rewards/reward_format/std": 0.0023706002160906793, "sampling/importance_sampling_ratio/max": 2.680069637298584, "sampling/importance_sampling_ratio/mean": 0.9896520793437957, "sampling/importance_sampling_ratio/min": 0.18095069602131844, "sampling/sampling_logp_difference/max": 1.0252466320991516, "sampling/sampling_logp_difference/mean": 0.0038561235880479215, "step": 8930, "step_time": 4.845793478607083 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.002734375, "completions/max_length": 1280.5, "completions/max_terminated_length": 854.3, "completions/mean_length": 154.896875, "completions/mean_terminated_length": 149.7188293457031, "completions/min_length": 67.6, "completions/min_terminated_length": 67.6, "entropy": 0.038124445173889396, "epoch": 19.143468950749465, "frac_reward_zero_std": 0.89375, "grad_norm": 0.34765625, "learning_rate": 9.1061e-06, "loss": -0.0032, "num_tokens": 910102337.0, "reward": 1.085703146457672, "reward_std": 0.10287698060274124, "rewards/reward_accuracy/mean": 0.9859375, "rewards/reward_accuracy/std": 0.10126774236559868, "rewards/reward_format/mean": 0.0997656263411045, "rewards/reward_format/std": 0.0025854269973933698, "sampling/importance_sampling_ratio/max": 2.5273266077041625, "sampling/importance_sampling_ratio/mean": 0.9905018150806427, "sampling/importance_sampling_ratio/min": 0.08943483680486679, "sampling/sampling_logp_difference/max": 0.9332442164421082, "sampling/sampling_logp_difference/mean": 0.003796239849179983, "step": 8940, "step_time": 6.150222820113413 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 6.219105671334546e-07, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 6.219105671334546e-07, "completions/clipped_ratio": 0.009765625, "completions/max_length": 1487.4, "completions/max_terminated_length": 1177.3, "completions/mean_length": 178.9421875, "completions/mean_terminated_length": 160.55400390625, "completions/min_length": 66.6, "completions/min_terminated_length": 66.6, "entropy": 0.04527610051445663, "epoch": 19.16488222698073, "frac_reward_zero_std": 0.9, "grad_norm": 0.0, "learning_rate": 9.105100000000002e-06, "loss": -0.005, "num_tokens": 911076717.0, "reward": 1.0412695407867432, "reward_std": 0.1892039254307747, "rewards/reward_accuracy/mean": 0.9421875, "rewards/reward_accuracy/std": 0.1861333131790161, "rewards/reward_format/mean": 0.09908203110098839, "rewards/reward_format/std": 0.0052246110746636985, "sampling/importance_sampling_ratio/max": 2.5064181327819823, "sampling/importance_sampling_ratio/mean": 0.9853618681430817, "sampling/importance_sampling_ratio/min": 0.09727071821689606, "sampling/sampling_logp_difference/max": 0.9031975388526916, "sampling/sampling_logp_difference/mean": 0.0039537092437967655, "step": 8950, "step_time": 7.371974029301782 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00859375, "completions/max_length": 1550.9, "completions/max_terminated_length": 1096.7, "completions/mean_length": 179.44140625, "completions/mean_terminated_length": 163.4389678955078, "completions/min_length": 66.2, "completions/min_terminated_length": 66.2, "entropy": 0.05023156348615885, "epoch": 19.18629550321199, "frac_reward_zero_std": 0.86875, "grad_norm": 0.68359375, "learning_rate": 9.104100000000001e-06, "loss": -0.0129, "num_tokens": 912059143.0, "reward": 1.0215625166893005, "reward_std": 0.2159823954105377, "rewards/reward_accuracy/mean": 0.922265625, "rewards/reward_accuracy/std": 0.21377946436405182, "rewards/reward_format/mean": 0.09929687604308128, "rewards/reward_format/std": 0.006066297856159508, "sampling/importance_sampling_ratio/max": 2.50685875415802, "sampling/importance_sampling_ratio/mean": 0.9871061384677887, "sampling/importance_sampling_ratio/min": 0.10962343923747539, "sampling/sampling_logp_difference/max": 0.8912870049476623, "sampling/sampling_logp_difference/mean": 0.00427790314424783, "step": 8960, "step_time": 7.615973992503132 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0046875, "completions/max_length": 1561.5, "completions/max_terminated_length": 1316.7, "completions/mean_length": 153.91875, "completions/mean_terminated_length": 145.06923217773436, "completions/min_length": 62.8, "completions/min_terminated_length": 62.8, "entropy": 0.043986070435494184, "epoch": 19.207708779443255, "frac_reward_zero_std": 0.90625, "grad_norm": 0.0, "learning_rate": 9.103100000000001e-06, "loss": -0.0033, "num_tokens": 912973271.0, "reward": 1.0560156464576722, "reward_std": 0.16589410603046417, "rewards/reward_accuracy/mean": 0.95625, "rewards/reward_accuracy/std": 0.16449629440903663, "rewards/reward_format/mean": 0.0997656263411045, "rewards/reward_format/std": 0.0027702924329787494, "sampling/importance_sampling_ratio/max": 2.527033734321594, "sampling/importance_sampling_ratio/mean": 0.9809755921363831, "sampling/importance_sampling_ratio/min": 0.09634014954790474, "sampling/sampling_logp_difference/max": 1.026539784669876, "sampling/sampling_logp_difference/mean": 0.0042065625544637445, "step": 8970, "step_time": 7.393489702590159 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005859375, "completions/max_length": 917.8, "completions/max_terminated_length": 858.4, "completions/mean_length": 161.348046875, "completions/mean_terminated_length": 150.44712677001954, "completions/min_length": 67.4, "completions/min_terminated_length": 67.4, "entropy": 0.04141873684711754, "epoch": 19.22912205567452, "frac_reward_zero_std": 0.95, "grad_norm": 0.0, "learning_rate": 9.1021e-06, "loss": -0.0043, "num_tokens": 913905314.0, "reward": 1.067480492591858, "reward_std": 0.11459275484085082, "rewards/reward_accuracy/mean": 0.96796875, "rewards/reward_accuracy/std": 0.11278990209102631, "rewards/reward_format/mean": 0.09951172098517418, "rewards/reward_format/std": 0.003581091109663248, "sampling/importance_sampling_ratio/max": 2.5542323112487795, "sampling/importance_sampling_ratio/mean": 0.9926739871501923, "sampling/importance_sampling_ratio/min": 0.11059153750538826, "sampling/sampling_logp_difference/max": 1.2100009679794312, "sampling/sampling_logp_difference/mean": 0.003986446699127555, "step": 8980, "step_time": 5.012093775707763 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 1403.1, "completions/max_terminated_length": 1179.2, "completions/mean_length": 171.927734375, "completions/mean_terminated_length": 164.69374389648436, "completions/min_length": 64.1, "completions/min_terminated_length": 64.1, "entropy": 0.04114390758331865, "epoch": 19.25053533190578, "frac_reward_zero_std": 0.875, "grad_norm": 0.330078125, "learning_rate": 9.1011e-06, "loss": -0.0104, "num_tokens": 914870073.0, "reward": 1.0562890887260437, "reward_std": 0.18315192610025405, "rewards/reward_accuracy/mean": 0.956640625, "rewards/reward_accuracy/std": 0.18117154091596605, "rewards/reward_format/mean": 0.09964843913912773, "rewards/reward_format/std": 0.003172542783431709, "sampling/importance_sampling_ratio/max": 2.585428333282471, "sampling/importance_sampling_ratio/mean": 0.9943221807479858, "sampling/importance_sampling_ratio/min": 0.16024016961455345, "sampling/sampling_logp_difference/max": 1.0366257786750794, "sampling/sampling_logp_difference/mean": 0.003938715043477714, "step": 8990, "step_time": 6.732246951115667 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005859375, "completions/max_length": 1524.0, "completions/max_terminated_length": 1158.0, "completions/mean_length": 165.077734375, "completions/mean_terminated_length": 154.11977996826172, "completions/min_length": 63.5, "completions/min_terminated_length": 63.5, "entropy": 0.044104625540785494, "epoch": 19.271948608137045, "frac_reward_zero_std": 0.88125, "grad_norm": 0.322265625, "learning_rate": 9.100100000000001e-06, "loss": -0.0132, "num_tokens": 915814992.0, "reward": 1.0702343821525573, "reward_std": 0.14357689693570136, "rewards/reward_accuracy/mean": 0.970703125, "rewards/reward_accuracy/std": 0.14132425263524057, "rewards/reward_format/mean": 0.09953124970197677, "rewards/reward_format/std": 0.004622029257006943, "sampling/importance_sampling_ratio/max": 2.5735597133636476, "sampling/importance_sampling_ratio/mean": 0.9960297048091888, "sampling/importance_sampling_ratio/min": 0.1938415549695492, "sampling/sampling_logp_difference/max": 0.9466841995716095, "sampling/sampling_logp_difference/mean": 0.004130793712101876, "step": 9000, "step_time": 7.507013888386427 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.004296875, "completions/max_length": 1368.0, "completions/max_terminated_length": 1277.4, "completions/mean_length": 161.849609375, "completions/mean_terminated_length": 153.80353698730468, "completions/min_length": 66.8, "completions/min_terminated_length": 66.8, "entropy": 0.04460274586454034, "epoch": 19.29336188436831, "frac_reward_zero_std": 0.875, "grad_norm": 0.255859375, "learning_rate": 9.0991e-06, "loss": -0.006, "num_tokens": 916750303.0, "reward": 1.0746484518051147, "reward_std": 0.1390233352780342, "rewards/reward_accuracy/mean": 0.975, "rewards/reward_accuracy/std": 0.1372666083276272, "rewards/reward_format/mean": 0.09964843839406967, "rewards/reward_format/std": 0.0031594250351190565, "sampling/importance_sampling_ratio/max": 2.3888298511505126, "sampling/importance_sampling_ratio/mean": 0.9826911926269531, "sampling/importance_sampling_ratio/min": 0.09854875365272164, "sampling/sampling_logp_difference/max": 0.8942802786827088, "sampling/sampling_logp_difference/mean": 0.004037417168729007, "step": 9010, "step_time": 6.626548458894831 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003125, "completions/max_length": 1259.2, "completions/max_terminated_length": 982.3, "completions/mean_length": 160.118359375, "completions/mean_terminated_length": 154.20431213378907, "completions/min_length": 66.8, "completions/min_terminated_length": 66.8, "entropy": 0.039300378412008286, "epoch": 19.31477516059957, "frac_reward_zero_std": 0.9, "grad_norm": 0.2021484375, "learning_rate": 9.0981e-06, "loss": -0.0065, "num_tokens": 917680526.0, "reward": 1.0810156345367432, "reward_std": 0.10862610265612602, "rewards/reward_accuracy/mean": 0.98125, "rewards/reward_accuracy/std": 0.10742983967065811, "rewards/reward_format/mean": 0.09976562559604644, "rewards/reward_format/std": 0.0025854268576949837, "sampling/importance_sampling_ratio/max": 2.4304882287979126, "sampling/importance_sampling_ratio/mean": 0.9842626571655273, "sampling/importance_sampling_ratio/min": 0.1485433302819729, "sampling/sampling_logp_difference/max": 0.9653706073760986, "sampling/sampling_logp_difference/mean": 0.0037817393662407995, "step": 9020, "step_time": 6.09609685667674 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005078125, "completions/max_length": 1303.7, "completions/max_terminated_length": 1121.0, "completions/mean_length": 167.45859375, "completions/mean_terminated_length": 158.265283203125, "completions/min_length": 66.4, "completions/min_terminated_length": 66.4, "entropy": 0.046081725717522205, "epoch": 19.336188436830835, "frac_reward_zero_std": 0.9, "grad_norm": 0.0, "learning_rate": 9.097100000000001e-06, "loss": -0.0053, "num_tokens": 918627076.0, "reward": 1.048203134536743, "reward_std": 0.17319639325141906, "rewards/reward_accuracy/mean": 0.948828125, "rewards/reward_accuracy/std": 0.1708996832370758, "rewards/reward_format/mean": 0.09937500059604645, "rewards/reward_format/std": 0.005020407401025296, "sampling/importance_sampling_ratio/max": 2.313520622253418, "sampling/importance_sampling_ratio/mean": 0.9787529170513153, "sampling/importance_sampling_ratio/min": 0.17576206475496292, "sampling/sampling_logp_difference/max": 0.9151412129402161, "sampling/sampling_logp_difference/mean": 0.003927671303972602, "step": 9030, "step_time": 6.544187750690616 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00703125, "completions/max_length": 1550.3, "completions/max_terminated_length": 1347.8, "completions/mean_length": 175.021484375, "completions/mean_terminated_length": 161.96079711914064, "completions/min_length": 68.3, "completions/min_terminated_length": 68.3, "entropy": 0.04554574289359152, "epoch": 19.3576017130621, "frac_reward_zero_std": 0.9, "grad_norm": 0.08837890625, "learning_rate": 9.096100000000001e-06, "loss": -0.0028, "num_tokens": 919597851.0, "reward": 1.0560937643051147, "reward_std": 0.17668451368808746, "rewards/reward_accuracy/mean": 0.956640625, "rewards/reward_accuracy/std": 0.1745455116033554, "rewards/reward_format/mean": 0.09945312589406967, "rewards/reward_format/std": 0.00429825212340802, "sampling/importance_sampling_ratio/max": 2.5012707471847535, "sampling/importance_sampling_ratio/mean": 0.9883077681064606, "sampling/importance_sampling_ratio/min": 0.10551765151321887, "sampling/sampling_logp_difference/max": 0.9143837809562683, "sampling/sampling_logp_difference/mean": 0.004029789008200169, "step": 9040, "step_time": 7.455769571097335 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005078125, "completions/max_length": 1262.5, "completions/max_terminated_length": 1157.7, "completions/mean_length": 162.56328125, "completions/mean_terminated_length": 153.1019500732422, "completions/min_length": 65.2, "completions/min_terminated_length": 65.2, "entropy": 0.04198769889771938, "epoch": 19.379014989293363, "frac_reward_zero_std": 0.9125, "grad_norm": 0.462890625, "learning_rate": 9.0951e-06, "loss": -0.0028, "num_tokens": 920533901.0, "reward": 1.0808007955551147, "reward_std": 0.10556618794798851, "rewards/reward_accuracy/mean": 0.98125, "rewards/reward_accuracy/std": 0.10335618853569031, "rewards/reward_format/mean": 0.09955078214406968, "rewards/reward_format/std": 0.004045002884231508, "sampling/importance_sampling_ratio/max": 2.3895641922950746, "sampling/importance_sampling_ratio/mean": 0.9868336141109466, "sampling/importance_sampling_ratio/min": 0.14454817920923232, "sampling/sampling_logp_difference/max": 0.8851216435432434, "sampling/sampling_logp_difference/mean": 0.004023644188418984, "step": 9050, "step_time": 6.260596655213158 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 1.0607175909171928e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 1.0607175909171928e-06, "completions/clipped_ratio": 0.012890625, "completions/max_length": 1555.7, "completions/max_terminated_length": 1362.5, "completions/mean_length": 187.04921875, "completions/mean_terminated_length": 163.13358154296876, "completions/min_length": 65.0, "completions/min_terminated_length": 65.0, "entropy": 0.05630589392967522, "epoch": 19.400428265524624, "frac_reward_zero_std": 0.89375, "grad_norm": 0.0, "learning_rate": 9.094100000000002e-06, "loss": -0.0009, "num_tokens": 921530475.0, "reward": 1.0347656548023223, "reward_std": 0.21476473808288574, "rewards/reward_accuracy/mean": 0.935546875, "rewards/reward_accuracy/std": 0.21202049553394317, "rewards/reward_format/mean": 0.09921875149011612, "rewards/reward_format/std": 0.005950827174820006, "sampling/importance_sampling_ratio/max": 2.6018747806549074, "sampling/importance_sampling_ratio/mean": 0.9846381902694702, "sampling/importance_sampling_ratio/min": 0.034876085445284845, "sampling/sampling_logp_difference/max": 1.1526156902313232, "sampling/sampling_logp_difference/mean": 0.004556133062578738, "step": 9060, "step_time": 8.017604624896194 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.006640625, "completions/max_length": 1479.1, "completions/max_terminated_length": 1273.7, "completions/mean_length": 164.63359375, "completions/mean_terminated_length": 152.13829040527344, "completions/min_length": 63.3, "completions/min_terminated_length": 63.3, "entropy": 0.04406016489956528, "epoch": 19.42184154175589, "frac_reward_zero_std": 0.9375, "grad_norm": 0.46484375, "learning_rate": 9.093100000000001e-06, "loss": -0.0026, "num_tokens": 922468817.0, "reward": 1.072363293170929, "reward_std": 0.1253970354795456, "rewards/reward_accuracy/mean": 0.973046875, "rewards/reward_accuracy/std": 0.12188762649893761, "rewards/reward_format/mean": 0.09931640699505806, "rewards/reward_format/std": 0.005931702582165599, "sampling/importance_sampling_ratio/max": 2.3584154844284058, "sampling/importance_sampling_ratio/mean": 0.9878209054470062, "sampling/importance_sampling_ratio/min": 0.0951646775007248, "sampling/sampling_logp_difference/max": 1.2138105750083923, "sampling/sampling_logp_difference/mean": 0.004100367845967412, "step": 9070, "step_time": 7.17604964140628 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.000390625, "completions/max_length": 987.1, "completions/max_terminated_length": 808.8, "completions/mean_length": 138.9296875, "completions/mean_terminated_length": 138.17735061645507, "completions/min_length": 66.0, "completions/min_terminated_length": 66.0, "entropy": 0.03259525031317025, "epoch": 19.443254817987153, "frac_reward_zero_std": 0.94375, "grad_norm": 0.10595703125, "learning_rate": 9.0921e-06, "loss": -0.0003, "num_tokens": 923338445.0, "reward": 1.0878515839576721, "reward_std": 0.08517486974596977, "rewards/reward_accuracy/mean": 0.987890625, "rewards/reward_accuracy/std": 0.0845498725771904, "rewards/reward_format/mean": 0.0999609388411045, "rewards/reward_format/std": 0.0006250000558793544, "sampling/importance_sampling_ratio/max": 2.2434217810630797, "sampling/importance_sampling_ratio/mean": 0.9890681982040406, "sampling/importance_sampling_ratio/min": 0.0942460473626852, "sampling/sampling_logp_difference/max": 0.9122747778892517, "sampling/sampling_logp_difference/mean": 0.0033510549226775767, "step": 9080, "step_time": 4.97146678819845 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 2.324529168618028e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 2.324529168618028e-06, "completions/clipped_ratio": 0.00625, "completions/max_length": 1302.3, "completions/max_terminated_length": 1179.8, "completions/mean_length": 163.815234375, "completions/mean_terminated_length": 152.14934844970702, "completions/min_length": 61.6, "completions/min_terminated_length": 61.6, "entropy": 0.04507605247199535, "epoch": 19.464668094218414, "frac_reward_zero_std": 0.88125, "grad_norm": 0.2197265625, "learning_rate": 9.0911e-06, "loss": -0.0077, "num_tokens": 924273508.0, "reward": 1.0345898628234864, "reward_std": 0.20652173459529877, "rewards/reward_accuracy/mean": 0.93515625, "rewards/reward_accuracy/std": 0.20440104454755784, "rewards/reward_format/mean": 0.09943359494209289, "rewards/reward_format/std": 0.004717904236167669, "sampling/importance_sampling_ratio/max": 2.3643917083740233, "sampling/importance_sampling_ratio/mean": 0.9827301621437072, "sampling/importance_sampling_ratio/min": 0.09913333132863045, "sampling/sampling_logp_difference/max": 0.9764537930488586, "sampling/sampling_logp_difference/mean": 0.0042185493977740405, "step": 9090, "step_time": 6.245351968507748 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00546875, "completions/max_length": 1310.6, "completions/max_terminated_length": 1063.8, "completions/mean_length": 161.569140625, "completions/mean_terminated_length": 151.28403015136718, "completions/min_length": 66.0, "completions/min_terminated_length": 66.0, "entropy": 0.0436047408496961, "epoch": 19.48608137044968, "frac_reward_zero_std": 0.89375, "grad_norm": 0.69140625, "learning_rate": 9.090100000000001e-06, "loss": -0.0001, "num_tokens": 925202645.0, "reward": 1.0635937571525573, "reward_std": 0.1378342740237713, "rewards/reward_accuracy/mean": 0.9640625, "rewards/reward_accuracy/std": 0.13611601218581199, "rewards/reward_format/mean": 0.0995312511920929, "rewards/reward_format/std": 0.004076853720471263, "sampling/importance_sampling_ratio/max": 2.5059841156005858, "sampling/importance_sampling_ratio/mean": 0.992784321308136, "sampling/importance_sampling_ratio/min": 0.12614892572164535, "sampling/sampling_logp_difference/max": 0.9879934072494507, "sampling/sampling_logp_difference/mean": 0.004017754970118403, "step": 9100, "step_time": 6.5754276179912265 }, { "clip_ratio/high_max": 1.7482518160250038e-05, "clip_ratio/high_mean": 2.1853147700312547e-06, "clip_ratio/low_mean": 5.5466728099418106e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 7.731987579973065e-06, "completions/clipped_ratio": 0.0125, "completions/max_length": 1191.7, "completions/max_terminated_length": 1151.5, "completions/mean_length": 179.404296875, "completions/mean_terminated_length": 156.10360107421874, "completions/min_length": 73.8, "completions/min_terminated_length": 73.8, "entropy": 0.04221254352014512, "epoch": 19.507494646680943, "frac_reward_zero_std": 0.93125, "grad_norm": 0.08740234375, "learning_rate": 9.0891e-06, "loss": -0.007, "num_tokens": 926187824.0, "reward": 1.0487695574760436, "reward_std": 0.18227342888712883, "rewards/reward_accuracy/mean": 0.95, "rewards/reward_accuracy/std": 0.17867215871810913, "rewards/reward_format/mean": 0.09876953288912774, "rewards/reward_format/std": 0.005567053495906293, "sampling/importance_sampling_ratio/max": 2.351033639907837, "sampling/importance_sampling_ratio/mean": 0.9873854994773865, "sampling/importance_sampling_ratio/min": 0.15005322126671672, "sampling/sampling_logp_difference/max": 1.0683269560337068, "sampling/sampling_logp_difference/mean": 0.0038984086830168964, "step": 9110, "step_time": 6.274187220301246 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005859375, "completions/max_length": 1376.1, "completions/max_terminated_length": 1144.9, "completions/mean_length": 164.29375, "completions/mean_terminated_length": 153.3367141723633, "completions/min_length": 66.9, "completions/min_terminated_length": 66.9, "entropy": 0.05010971059091389, "epoch": 19.528907922912204, "frac_reward_zero_std": 0.9, "grad_norm": 0.1962890625, "learning_rate": 9.0881e-06, "loss": -0.0157, "num_tokens": 927125392.0, "reward": 1.0714453220367433, "reward_std": 0.12865128219127656, "rewards/reward_accuracy/mean": 0.971875, "rewards/reward_accuracy/std": 0.1271209627389908, "rewards/reward_format/mean": 0.09957031384110451, "rewards/reward_format/std": 0.004181885835714638, "sampling/importance_sampling_ratio/max": 2.494255232810974, "sampling/importance_sampling_ratio/mean": 0.9902954280376435, "sampling/importance_sampling_ratio/min": 0.10009279791265727, "sampling/sampling_logp_difference/max": 1.0103832721710204, "sampling/sampling_logp_difference/mean": 0.004509749100543558, "step": 9120, "step_time": 6.677860826315009 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001953125, "completions/max_length": 1353.9, "completions/max_terminated_length": 1057.0, "completions/mean_length": 154.260546875, "completions/mean_terminated_length": 150.55845794677734, "completions/min_length": 71.2, "completions/min_terminated_length": 71.2, "entropy": 0.04203747319988906, "epoch": 19.550321199143468, "frac_reward_zero_std": 0.89375, "grad_norm": 0.6328125, "learning_rate": 9.087100000000001e-06, "loss": -0.0043, "num_tokens": 928038747.0, "reward": 1.0642773687839509, "reward_std": 0.13004899471998216, "rewards/reward_accuracy/mean": 0.964453125, "rewards/reward_accuracy/std": 0.12889797016978263, "rewards/reward_format/mean": 0.0998242199420929, "rewards/reward_format/std": 0.0024446487659588456, "sampling/importance_sampling_ratio/max": 2.4393879890441896, "sampling/importance_sampling_ratio/mean": 0.9921684443950654, "sampling/importance_sampling_ratio/min": 0.17049942910671234, "sampling/sampling_logp_difference/max": 0.9856062769889832, "sampling/sampling_logp_difference/mean": 0.003959052101708949, "step": 9130, "step_time": 6.452508281494374 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003125, "completions/max_length": 1262.9, "completions/max_terminated_length": 928.1, "completions/mean_length": 155.860546875, "completions/mean_terminated_length": 149.97579040527344, "completions/min_length": 66.9, "completions/min_terminated_length": 66.9, "entropy": 0.040516328741796316, "epoch": 19.571734475374733, "frac_reward_zero_std": 0.91875, "grad_norm": 0.0, "learning_rate": 9.086100000000001e-06, "loss": -0.003, "num_tokens": 928960102.0, "reward": 1.0708398699760437, "reward_std": 0.13475089892745018, "rewards/reward_accuracy/mean": 0.97109375, "rewards/reward_accuracy/std": 0.13331862762570382, "rewards/reward_format/mean": 0.09974609538912774, "rewards/reward_format/std": 0.0026277488097548483, "sampling/importance_sampling_ratio/max": 2.510994243621826, "sampling/importance_sampling_ratio/mean": 0.9963276743888855, "sampling/importance_sampling_ratio/min": 0.13851780518889428, "sampling/sampling_logp_difference/max": 0.9902512550354003, "sampling/sampling_logp_difference/mean": 0.004013765230774879, "step": 9140, "step_time": 6.204349333001301 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001953125, "completions/max_length": 1376.8, "completions/max_terminated_length": 903.4, "completions/mean_length": 140.123828125, "completions/mean_terminated_length": 136.41134796142578, "completions/min_length": 59.9, "completions/min_terminated_length": 59.9, "entropy": 0.0404211513698101, "epoch": 19.593147751605997, "frac_reward_zero_std": 0.94375, "grad_norm": 0.259765625, "learning_rate": 9.0851e-06, "loss": -0.0029, "num_tokens": 929837027.0, "reward": 1.0834961175918578, "reward_std": 0.09541865289211274, "rewards/reward_accuracy/mean": 0.98359375, "rewards/reward_accuracy/std": 0.0949003130197525, "rewards/reward_format/mean": 0.09990234524011612, "rewards/reward_format/std": 0.0006932690273970365, "sampling/importance_sampling_ratio/max": 2.483359956741333, "sampling/importance_sampling_ratio/mean": 0.9949602782726288, "sampling/importance_sampling_ratio/min": 0.16228471249341964, "sampling/sampling_logp_difference/max": 0.9493756413459777, "sampling/sampling_logp_difference/mean": 0.003922982979565859, "step": 9150, "step_time": 6.6150822643016 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005859375, "completions/max_length": 1597.1, "completions/max_terminated_length": 1244.3, "completions/mean_length": 161.07265625, "completions/mean_terminated_length": 149.96783294677735, "completions/min_length": 58.6, "completions/min_terminated_length": 58.6, "entropy": 0.044920145790092646, "epoch": 19.614561027837258, "frac_reward_zero_std": 0.90625, "grad_norm": 0.33984375, "learning_rate": 9.084100000000002e-06, "loss": -0.0046, "num_tokens": 930765101.0, "reward": 1.0639844059944152, "reward_std": 0.15105264410376548, "rewards/reward_accuracy/mean": 0.964453125, "rewards/reward_accuracy/std": 0.14956799969077111, "rewards/reward_format/mean": 0.0995312511920929, "rewards/reward_format/std": 0.003296602494083345, "sampling/importance_sampling_ratio/max": 2.3591320753097533, "sampling/importance_sampling_ratio/mean": 0.9820233762264252, "sampling/importance_sampling_ratio/min": 0.06922904029488564, "sampling/sampling_logp_difference/max": 1.0019013315439225, "sampling/sampling_logp_difference/mean": 0.004096976364962757, "step": 9160, "step_time": 7.627668145505595 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00546875, "completions/max_length": 1406.2, "completions/max_terminated_length": 1272.9, "completions/mean_length": 169.28515625, "completions/mean_terminated_length": 159.29183807373047, "completions/min_length": 69.6, "completions/min_terminated_length": 69.6, "entropy": 0.04872166495770216, "epoch": 19.635974304068522, "frac_reward_zero_std": 0.9125, "grad_norm": 0.0908203125, "learning_rate": 9.0831e-06, "loss": -0.0084, "num_tokens": 931714727.0, "reward": 1.057792979478836, "reward_std": 0.14397084519732745, "rewards/reward_accuracy/mean": 0.958203125, "rewards/reward_accuracy/std": 0.1424979127943516, "rewards/reward_format/mean": 0.09958984479308128, "rewards/reward_format/std": 0.0038965378189459443, "sampling/importance_sampling_ratio/max": 2.4524385213851927, "sampling/importance_sampling_ratio/mean": 0.9944411635398864, "sampling/importance_sampling_ratio/min": 0.07726041674613952, "sampling/sampling_logp_difference/max": 0.8750919342041016, "sampling/sampling_logp_difference/mean": 0.004225002136081457, "step": 9170, "step_time": 7.0734316982125165 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 1520.6, "completions/max_terminated_length": 1401.3, "completions/mean_length": 162.48125, "completions/mean_terminated_length": 155.14838104248048, "completions/min_length": 66.9, "completions/min_terminated_length": 66.9, "entropy": 0.04568749950267374, "epoch": 19.657387580299787, "frac_reward_zero_std": 0.875, "grad_norm": 0.65234375, "learning_rate": 9.0821e-06, "loss": -0.0103, "num_tokens": 932644215.0, "reward": 1.0730859637260437, "reward_std": 0.14519534409046173, "rewards/reward_accuracy/mean": 0.9734375, "rewards/reward_accuracy/std": 0.14355655238032342, "rewards/reward_format/mean": 0.09964843913912773, "rewards/reward_format/std": 0.003859223937615752, "sampling/importance_sampling_ratio/max": 2.364811027050018, "sampling/importance_sampling_ratio/mean": 0.9837496995925903, "sampling/importance_sampling_ratio/min": 0.13184744622558356, "sampling/sampling_logp_difference/max": 0.8959391713142395, "sampling/sampling_logp_difference/mean": 0.004344884119927883, "step": 9180, "step_time": 7.2060617718030695 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.006640625, "completions/max_length": 1276.7, "completions/max_terminated_length": 1115.4, "completions/mean_length": 166.728515625, "completions/mean_terminated_length": 154.56076049804688, "completions/min_length": 64.4, "completions/min_terminated_length": 64.4, "entropy": 0.042027830402366816, "epoch": 19.678800856531048, "frac_reward_zero_std": 0.88125, "grad_norm": 0.3125, "learning_rate": 9.0811e-06, "loss": -0.0098, "num_tokens": 933587328.0, "reward": 1.0778906643390656, "reward_std": 0.12136476784944535, "rewards/reward_accuracy/mean": 0.978515625, "rewards/reward_accuracy/std": 0.11815777570009231, "rewards/reward_format/mean": 0.09937500283122062, "rewards/reward_format/std": 0.005091836443170905, "sampling/importance_sampling_ratio/max": 2.641832447052002, "sampling/importance_sampling_ratio/mean": 0.9863425850868225, "sampling/importance_sampling_ratio/min": 0.058438942581415174, "sampling/sampling_logp_difference/max": 1.042513370513916, "sampling/sampling_logp_difference/mean": 0.004008881514891982, "step": 9190, "step_time": 6.443508336693048 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 1506.8, "completions/max_terminated_length": 1280.9, "completions/mean_length": 156.292578125, "completions/mean_terminated_length": 148.92269134521484, "completions/min_length": 62.4, "completions/min_terminated_length": 62.4, "entropy": 0.03892897937912494, "epoch": 19.700214132762312, "frac_reward_zero_std": 0.91875, "grad_norm": 0.1875, "learning_rate": 9.080100000000001e-06, "loss": -0.0048, "num_tokens": 934505213.0, "reward": 1.0733789205551147, "reward_std": 0.1390247829258442, "rewards/reward_accuracy/mean": 0.973828125, "rewards/reward_accuracy/std": 0.13664163202047347, "rewards/reward_format/mean": 0.09955078214406968, "rewards/reward_format/std": 0.00482239224947989, "sampling/importance_sampling_ratio/max": 2.366521680355072, "sampling/importance_sampling_ratio/mean": 0.9891993939876557, "sampling/importance_sampling_ratio/min": 0.15461856946349145, "sampling/sampling_logp_difference/max": 0.8966122627258301, "sampling/sampling_logp_difference/mean": 0.0036756233079358936, "step": 9200, "step_time": 7.354741018085042 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 1174.9, "completions/max_terminated_length": 1155.3, "completions/mean_length": 161.548828125, "completions/mean_terminated_length": 154.36127014160155, "completions/min_length": 59.8, "completions/min_terminated_length": 59.8, "entropy": 0.04335235476028174, "epoch": 19.721627408993577, "frac_reward_zero_std": 0.91875, "grad_norm": 0.59765625, "learning_rate": 9.079100000000001e-06, "loss": -0.0037, "num_tokens": 935437210.0, "reward": 1.0484570562839508, "reward_std": 0.16211699396371843, "rewards/reward_accuracy/mean": 0.948828125, "rewards/reward_accuracy/std": 0.16106317192316055, "rewards/reward_format/mean": 0.09962890744209289, "rewards/reward_format/std": 0.0026997233973816035, "sampling/importance_sampling_ratio/max": 2.5133602738380434, "sampling/importance_sampling_ratio/mean": 0.9905565202236175, "sampling/importance_sampling_ratio/min": 0.15421737655997275, "sampling/sampling_logp_difference/max": 0.9683779597282409, "sampling/sampling_logp_difference/mean": 0.003938327357172966, "step": 9210, "step_time": 5.9624404192931255 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.000390625, "completions/max_length": 1123.3, "completions/max_terminated_length": 1116.2, "completions/mean_length": 141.4328125, "completions/mean_terminated_length": 140.69379119873048, "completions/min_length": 62.6, "completions/min_terminated_length": 62.6, "entropy": 0.03904386968351901, "epoch": 19.74304068522484, "frac_reward_zero_std": 0.925, "grad_norm": 0.0, "learning_rate": 9.0781e-06, "loss": -0.0021, "num_tokens": 936314142.0, "reward": 1.0694140791893005, "reward_std": 0.13977839648723603, "rewards/reward_accuracy/mean": 0.96953125, "rewards/reward_accuracy/std": 0.13943707793951035, "rewards/reward_format/mean": 0.09988281354308129, "rewards/reward_format/std": 0.0012463126797229052, "sampling/importance_sampling_ratio/max": 2.3731379985809324, "sampling/importance_sampling_ratio/mean": 0.991752427816391, "sampling/importance_sampling_ratio/min": 0.18334167152643205, "sampling/sampling_logp_difference/max": 0.8368129968643189, "sampling/sampling_logp_difference/mean": 0.003842264274135232, "step": 9220, "step_time": 5.531950381206116 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00625, "completions/max_length": 1533.3, "completions/max_terminated_length": 1317.3, "completions/mean_length": 172.378515625, "completions/mean_terminated_length": 160.7502227783203, "completions/min_length": 65.9, "completions/min_terminated_length": 65.9, "entropy": 0.046241272171027956, "epoch": 19.764453961456102, "frac_reward_zero_std": 0.8875, "grad_norm": 0.94921875, "learning_rate": 9.077100000000002e-06, "loss": -0.0002, "num_tokens": 937278407.0, "reward": 1.044335961341858, "reward_std": 0.18842110857367517, "rewards/reward_accuracy/mean": 0.944921875, "rewards/reward_accuracy/std": 0.18610547706484795, "rewards/reward_format/mean": 0.09941406399011612, "rewards/reward_format/std": 0.004714712197892368, "sampling/importance_sampling_ratio/max": 2.5000436305999756, "sampling/importance_sampling_ratio/mean": 0.9808768093585968, "sampling/importance_sampling_ratio/min": 0.134797865152359, "sampling/sampling_logp_difference/max": 0.8992875576019287, "sampling/sampling_logp_difference/mean": 0.004206507070921362, "step": 9230, "step_time": 7.500069306709338 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00234375, "completions/max_length": 892.7, "completions/max_terminated_length": 878.4, "completions/mean_length": 150.60234375, "completions/mean_terminated_length": 146.21039123535155, "completions/min_length": 62.0, "completions/min_terminated_length": 62.0, "entropy": 0.04056527968496084, "epoch": 19.785867237687366, "frac_reward_zero_std": 0.90625, "grad_norm": 0.0, "learning_rate": 9.076100000000001e-06, "loss": 0.0011, "num_tokens": 938171485.0, "reward": 1.056445336341858, "reward_std": 0.17333496361970901, "rewards/reward_accuracy/mean": 0.956640625, "rewards/reward_accuracy/std": 0.17275590747594832, "rewards/reward_format/mean": 0.09980468899011612, "rewards/reward_format/std": 0.0014187667053192853, "sampling/importance_sampling_ratio/max": 2.47431960105896, "sampling/importance_sampling_ratio/mean": 0.9967647671699524, "sampling/importance_sampling_ratio/min": 0.17677096873521805, "sampling/sampling_logp_difference/max": 1.0543083131313324, "sampling/sampling_logp_difference/mean": 0.0039816384203732015, "step": 9240, "step_time": 4.758709389789146 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0046875, "completions/max_length": 1359.5, "completions/max_terminated_length": 1248.0, "completions/mean_length": 164.598046875, "completions/mean_terminated_length": 155.85336608886718, "completions/min_length": 62.3, "completions/min_terminated_length": 62.3, "entropy": 0.044497970049269496, "epoch": 19.80728051391863, "frac_reward_zero_std": 0.89375, "grad_norm": 0.28125, "learning_rate": 9.0751e-06, "loss": -0.0022, "num_tokens": 939114200.0, "reward": 1.070312511920929, "reward_std": 0.150006752461195, "rewards/reward_accuracy/mean": 0.970703125, "rewards/reward_accuracy/std": 0.14816323220729827, "rewards/reward_format/mean": 0.09960937574505806, "rewards/reward_format/std": 0.004018527013249696, "sampling/importance_sampling_ratio/max": 2.307345652580261, "sampling/importance_sampling_ratio/mean": 0.9720366656780243, "sampling/importance_sampling_ratio/min": 0.0670137882232666, "sampling/sampling_logp_difference/max": 1.149421513080597, "sampling/sampling_logp_difference/mean": 0.0042013704078271985, "step": 9250, "step_time": 6.658384925799328 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.006640625, "completions/max_length": 1678.4, "completions/max_terminated_length": 1314.6, "completions/mean_length": 174.54140625, "completions/mean_terminated_length": 162.15361328125, "completions/min_length": 66.2, "completions/min_terminated_length": 66.2, "entropy": 0.04973840469028801, "epoch": 19.82869379014989, "frac_reward_zero_std": 0.90625, "grad_norm": 0.1953125, "learning_rate": 9.074100000000002e-06, "loss": -0.005, "num_tokens": 940085954.0, "reward": 1.0541601717472076, "reward_std": 0.1872320644557476, "rewards/reward_accuracy/mean": 0.9546875, "rewards/reward_accuracy/std": 0.18513632714748382, "rewards/reward_format/mean": 0.09947265684604645, "rewards/reward_format/std": 0.004184468556195498, "sampling/importance_sampling_ratio/max": 2.4736761331558226, "sampling/importance_sampling_ratio/mean": 0.9811668157577514, "sampling/importance_sampling_ratio/min": 0.09651762992143631, "sampling/sampling_logp_difference/max": 0.8692919731140136, "sampling/sampling_logp_difference/mean": 0.004352953261695802, "step": 9260, "step_time": 8.195330532212392 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0046875, "completions/max_length": 1311.4, "completions/max_terminated_length": 1180.8, "completions/mean_length": 159.14296875, "completions/mean_terminated_length": 150.3482925415039, "completions/min_length": 64.0, "completions/min_terminated_length": 64.0, "entropy": 0.04325949216727167, "epoch": 19.850107066381156, "frac_reward_zero_std": 0.9, "grad_norm": 0.0, "learning_rate": 9.0731e-06, "loss": -0.0062, "num_tokens": 941010304.0, "reward": 1.0671875178813934, "reward_std": 0.14459482058882714, "rewards/reward_accuracy/mean": 0.967578125, "rewards/reward_accuracy/std": 0.1426117166876793, "rewards/reward_format/mean": 0.09960937649011611, "rewards/reward_format/std": 0.00395376228261739, "sampling/importance_sampling_ratio/max": 2.6098911285400392, "sampling/importance_sampling_ratio/mean": 0.9898800611495971, "sampling/importance_sampling_ratio/min": 0.1241134449839592, "sampling/sampling_logp_difference/max": 1.1428808331489564, "sampling/sampling_logp_difference/mean": 0.0040014975005760785, "step": 9270, "step_time": 6.4126573625952 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.008203125, "completions/max_length": 1247.6, "completions/max_terminated_length": 1137.1, "completions/mean_length": 160.658984375, "completions/mean_terminated_length": 145.20404663085938, "completions/min_length": 67.4, "completions/min_terminated_length": 67.4, "entropy": 0.043734584399498996, "epoch": 19.87152034261242, "frac_reward_zero_std": 0.9375, "grad_norm": 0.0, "learning_rate": 9.0721e-06, "loss": -0.0078, "num_tokens": 941933735.0, "reward": 1.0729687690734864, "reward_std": 0.12262352928519249, "rewards/reward_accuracy/mean": 0.9734375, "rewards/reward_accuracy/std": 0.12066189721226692, "rewards/reward_format/mean": 0.0995312511920929, "rewards/reward_format/std": 0.0031400540843605994, "sampling/importance_sampling_ratio/max": 2.4998611330986025, "sampling/importance_sampling_ratio/mean": 0.9940631508827209, "sampling/importance_sampling_ratio/min": 0.1610862985253334, "sampling/sampling_logp_difference/max": 0.8307618975639344, "sampling/sampling_logp_difference/mean": 0.004068402107805014, "step": 9280, "step_time": 6.302560503710993 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00859375, "completions/max_length": 1476.2, "completions/max_terminated_length": 1379.4, "completions/mean_length": 174.78125, "completions/mean_terminated_length": 158.6860794067383, "completions/min_length": 68.8, "completions/min_terminated_length": 68.8, "entropy": 0.048618609388358894, "epoch": 19.89293361884368, "frac_reward_zero_std": 0.89375, "grad_norm": 0.28125, "learning_rate": 9.0711e-06, "loss": -0.0113, "num_tokens": 942898247.0, "reward": 1.0581054925918578, "reward_std": 0.17270331755280494, "rewards/reward_accuracy/mean": 0.958984375, "rewards/reward_accuracy/std": 0.16894653365015982, "rewards/reward_format/mean": 0.09912109449505806, "rewards/reward_format/std": 0.006646971893496811, "sampling/importance_sampling_ratio/max": 2.478123140335083, "sampling/importance_sampling_ratio/mean": 0.9844117999076843, "sampling/importance_sampling_ratio/min": 0.02847989946603775, "sampling/sampling_logp_difference/max": 0.8517537713050842, "sampling/sampling_logp_difference/mean": 0.00415471731685102, "step": 9290, "step_time": 7.436109899519943 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003515625, "completions/max_length": 1355.7, "completions/max_terminated_length": 979.0, "completions/mean_length": 147.36640625, "completions/mean_terminated_length": 140.6606872558594, "completions/min_length": 65.3, "completions/min_terminated_length": 65.3, "entropy": 0.04262354166712612, "epoch": 19.914346895074946, "frac_reward_zero_std": 0.91875, "grad_norm": 0.365234375, "learning_rate": 9.0701e-06, "loss": -0.0027, "num_tokens": 943784209.0, "reward": 1.077148449420929, "reward_std": 0.1313104398548603, "rewards/reward_accuracy/mean": 0.97734375, "rewards/reward_accuracy/std": 0.1300644427537918, "rewards/reward_format/mean": 0.09980468824505806, "rewards/reward_format/std": 0.0027571488637477158, "sampling/importance_sampling_ratio/max": 2.5119298458099366, "sampling/importance_sampling_ratio/mean": 0.9903336584568023, "sampling/importance_sampling_ratio/min": 0.15579649237915874, "sampling/sampling_logp_difference/max": 0.943257337808609, "sampling/sampling_logp_difference/mean": 0.004033864499069751, "step": 9300, "step_time": 6.673793797008694 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003515625, "completions/max_length": 1511.6, "completions/max_terminated_length": 1083.3, "completions/mean_length": 153.125, "completions/mean_terminated_length": 146.4762176513672, "completions/min_length": 64.7, "completions/min_terminated_length": 64.7, "entropy": 0.04344698949716985, "epoch": 19.93576017130621, "frac_reward_zero_std": 0.9125, "grad_norm": 0.2158203125, "learning_rate": 9.069100000000001e-06, "loss": -0.0096, "num_tokens": 944689169.0, "reward": 1.0783789157867432, "reward_std": 0.09440934881567956, "rewards/reward_accuracy/mean": 0.978515625, "rewards/reward_accuracy/std": 0.09340007379651069, "rewards/reward_format/mean": 0.09986328184604645, "rewards/reward_format/std": 0.00181964875664562, "sampling/importance_sampling_ratio/max": 2.4019203186035156, "sampling/importance_sampling_ratio/mean": 0.9875817120075225, "sampling/importance_sampling_ratio/min": 0.12948328237980605, "sampling/sampling_logp_difference/max": 0.9341304004192352, "sampling/sampling_logp_difference/mean": 0.004089133883826435, "step": 9310, "step_time": 7.068998748090235 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005859375, "completions/max_length": 1634.7, "completions/max_terminated_length": 1073.1, "completions/mean_length": 171.680859375, "completions/mean_terminated_length": 160.80465393066407, "completions/min_length": 71.4, "completions/min_terminated_length": 71.4, "entropy": 0.04394675050862133, "epoch": 19.957173447537475, "frac_reward_zero_std": 0.88125, "grad_norm": 0.08349609375, "learning_rate": 9.0681e-06, "loss": -0.0077, "num_tokens": 945645840.0, "reward": 1.0556445479393006, "reward_std": 0.18649304136633874, "rewards/reward_accuracy/mean": 0.95625, "rewards/reward_accuracy/std": 0.18409454599022865, "rewards/reward_format/mean": 0.09939453229308129, "rewards/reward_format/std": 0.005257716891355813, "sampling/importance_sampling_ratio/max": 2.53534734249115, "sampling/importance_sampling_ratio/mean": 0.9750232875347138, "sampling/importance_sampling_ratio/min": 0.09706297293305396, "sampling/sampling_logp_difference/max": 1.0518281519412995, "sampling/sampling_logp_difference/mean": 0.003971110144630074, "step": 9320, "step_time": 7.888220002214075 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00546875, "completions/max_length": 1333.0, "completions/max_terminated_length": 1074.9, "completions/mean_length": 167.803515625, "completions/mean_terminated_length": 157.61992492675782, "completions/min_length": 63.5, "completions/min_terminated_length": 63.5, "entropy": 0.04739452642388642, "epoch": 19.978586723768736, "frac_reward_zero_std": 0.9, "grad_norm": 0.2314453125, "learning_rate": 9.067100000000002e-06, "loss": 0.0004, "num_tokens": 946595785.0, "reward": 1.0702734470367432, "reward_std": 0.13588074073195458, "rewards/reward_accuracy/mean": 0.970703125, "rewards/reward_accuracy/std": 0.13390416651964188, "rewards/reward_format/mean": 0.09957031309604644, "rewards/reward_format/std": 0.004308584006503224, "sampling/importance_sampling_ratio/max": 2.4303313493728638, "sampling/importance_sampling_ratio/mean": 0.9859449565410614, "sampling/importance_sampling_ratio/min": 0.11252655480057001, "sampling/sampling_logp_difference/max": 1.232719326019287, "sampling/sampling_logp_difference/mean": 0.0040267204167321324, "step": 9330, "step_time": 6.792306689103134 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00234375, "completions/max_length": 1421.1, "completions/max_terminated_length": 1027.7, "completions/mean_length": 144.893359375, "completions/mean_terminated_length": 140.45290908813476, "completions/min_length": 61.9, "completions/min_terminated_length": 61.9, "entropy": 0.04007145266514271, "epoch": 20.0, "frac_reward_zero_std": 0.94375, "grad_norm": 0.0, "learning_rate": 9.066100000000001e-06, "loss": -0.0042, "num_tokens": 947480728.0, "reward": 1.0801953434944154, "reward_std": 0.10916821435093879, "rewards/reward_accuracy/mean": 0.98046875, "rewards/reward_accuracy/std": 0.10698845535516739, "rewards/reward_format/mean": 0.09972656443715096, "rewards/reward_format/std": 0.0032802829751744866, "sampling/importance_sampling_ratio/max": 2.3716767191886903, "sampling/importance_sampling_ratio/mean": 0.99602370262146, "sampling/importance_sampling_ratio/min": 0.1327689364552498, "sampling/sampling_logp_difference/max": 1.0532543540000916, "sampling/sampling_logp_difference/mean": 0.0038920431630685925, "step": 9340, "step_time": 6.723236110794824 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003515625, "completions/max_length": 1345.2, "completions/max_terminated_length": 1175.7, "completions/mean_length": 162.058203125, "completions/mean_terminated_length": 155.41929931640624, "completions/min_length": 67.2, "completions/min_terminated_length": 67.2, "entropy": 0.04044292059261352, "epoch": 20.021413276231264, "frac_reward_zero_std": 0.9125, "grad_norm": 0.0, "learning_rate": 9.0651e-06, "loss": -0.0009, "num_tokens": 948414173.0, "reward": 1.0742773532867431, "reward_std": 0.11580076217651367, "rewards/reward_accuracy/mean": 0.974609375, "rewards/reward_accuracy/std": 0.1140778049826622, "rewards/reward_format/mean": 0.09966796934604645, "rewards/reward_format/std": 0.003703578980639577, "sampling/importance_sampling_ratio/max": 2.3296339988708494, "sampling/importance_sampling_ratio/mean": 0.9858010351657868, "sampling/importance_sampling_ratio/min": 0.11381863132119178, "sampling/sampling_logp_difference/max": 0.9196881651878357, "sampling/sampling_logp_difference/mean": 0.00370923129376024, "step": 9350, "step_time": 6.672289056898444 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 1361.5, "completions/max_terminated_length": 1023.2, "completions/mean_length": 155.12265625, "completions/mean_terminated_length": 147.73615112304688, "completions/min_length": 65.8, "completions/min_terminated_length": 65.8, "entropy": 0.039720779610797764, "epoch": 20.042826552462525, "frac_reward_zero_std": 0.90625, "grad_norm": 0.337890625, "learning_rate": 9.064100000000002e-06, "loss": -0.0075, "num_tokens": 949328759.0, "reward": 1.069589865207672, "reward_std": 0.14615373760461808, "rewards/reward_accuracy/mean": 0.969921875, "rewards/reward_accuracy/std": 0.14443112909793854, "rewards/reward_format/mean": 0.09966797009110451, "rewards/reward_format/std": 0.002704807138070464, "sampling/importance_sampling_ratio/max": 2.3106245517730715, "sampling/importance_sampling_ratio/mean": 0.9913569092750549, "sampling/importance_sampling_ratio/min": 0.0618774875998497, "sampling/sampling_logp_difference/max": 1.048514986038208, "sampling/sampling_logp_difference/mean": 0.0037586273159831763, "step": 9360, "step_time": 6.789473616005853 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00546875, "completions/max_length": 1345.2, "completions/max_terminated_length": 1122.8, "completions/mean_length": 159.399609375, "completions/mean_terminated_length": 149.05558013916016, "completions/min_length": 65.1, "completions/min_terminated_length": 65.1, "entropy": 0.04735657901037484, "epoch": 20.06423982869379, "frac_reward_zero_std": 0.8875, "grad_norm": 0.15234375, "learning_rate": 9.0631e-06, "loss": -0.0053, "num_tokens": 950255286.0, "reward": 1.0525000154972077, "reward_std": 0.18012357503175735, "rewards/reward_accuracy/mean": 0.952734375, "rewards/reward_accuracy/std": 0.17928635105490684, "rewards/reward_format/mean": 0.09976562559604644, "rewards/reward_format/std": 0.00286459915805608, "sampling/importance_sampling_ratio/max": 2.3825217843055726, "sampling/importance_sampling_ratio/mean": 0.9727106511592865, "sampling/importance_sampling_ratio/min": 0.0938889380544424, "sampling/sampling_logp_difference/max": 0.8326278388500213, "sampling/sampling_logp_difference/mean": 0.004262265050783753, "step": 9370, "step_time": 6.564493247389327 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005859375, "completions/max_length": 1311.8, "completions/max_terminated_length": 1146.2, "completions/mean_length": 163.644140625, "completions/mean_terminated_length": 152.6379852294922, "completions/min_length": 60.1, "completions/min_terminated_length": 60.1, "entropy": 0.045527439564466476, "epoch": 20.085653104925054, "frac_reward_zero_std": 0.89375, "grad_norm": 0.2373046875, "learning_rate": 9.062100000000001e-06, "loss": -0.0048, "num_tokens": 951190087.0, "reward": 1.0533203482627869, "reward_std": 0.18657502830028533, "rewards/reward_accuracy/mean": 0.95390625, "rewards/reward_accuracy/std": 0.1842903919517994, "rewards/reward_format/mean": 0.09941406324505805, "rewards/reward_format/std": 0.005070122145116329, "sampling/importance_sampling_ratio/max": 2.4318507432937624, "sampling/importance_sampling_ratio/mean": 0.9817586898803711, "sampling/importance_sampling_ratio/min": 0.07356930300593376, "sampling/sampling_logp_difference/max": 1.01357399225235, "sampling/sampling_logp_difference/mean": 0.004130539135076106, "step": 9380, "step_time": 6.496129494291381 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00625, "completions/max_length": 1491.1, "completions/max_terminated_length": 1379.6, "completions/mean_length": 161.451171875, "completions/mean_terminated_length": 149.88872375488282, "completions/min_length": 66.9, "completions/min_terminated_length": 66.9, "entropy": 0.04665433941408992, "epoch": 20.10706638115632, "frac_reward_zero_std": 0.89375, "grad_norm": 0.07861328125, "learning_rate": 9.0611e-06, "loss": -0.0017, "num_tokens": 952117210.0, "reward": 1.0583984673023223, "reward_std": 0.17875355258584022, "rewards/reward_accuracy/mean": 0.958984375, "rewards/reward_accuracy/std": 0.17626309245824814, "rewards/reward_format/mean": 0.09941406473517418, "rewards/reward_format/std": 0.004754358367063105, "sampling/importance_sampling_ratio/max": 2.434252715110779, "sampling/importance_sampling_ratio/mean": 0.9875102400779724, "sampling/importance_sampling_ratio/min": 0.15254462426528334, "sampling/sampling_logp_difference/max": 0.8677175343036652, "sampling/sampling_logp_difference/mean": 0.004187268717214465, "step": 9390, "step_time": 7.321105971807265 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00625, "completions/max_length": 1610.9, "completions/max_terminated_length": 1392.8, "completions/mean_length": 181.35625, "completions/mean_terminated_length": 169.75983581542968, "completions/min_length": 62.2, "completions/min_terminated_length": 62.2, "entropy": 0.053832035162486136, "epoch": 20.12847965738758, "frac_reward_zero_std": 0.89375, "grad_norm": 0.2890625, "learning_rate": 9.0601e-06, "loss": -0.0068, "num_tokens": 953101018.0, "reward": 1.0545898795127868, "reward_std": 0.17904602140188217, "rewards/reward_accuracy/mean": 0.955078125, "rewards/reward_accuracy/std": 0.177571789175272, "rewards/reward_format/mean": 0.09951172098517418, "rewards/reward_format/std": 0.004116833722218871, "sampling/importance_sampling_ratio/max": 2.5676842212677, "sampling/importance_sampling_ratio/mean": 0.9819579243659973, "sampling/importance_sampling_ratio/min": 0.0942208107560873, "sampling/sampling_logp_difference/max": 0.9608686864376068, "sampling/sampling_logp_difference/mean": 0.0043137150816619394, "step": 9400, "step_time": 7.835155371887959 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.008203125, "completions/max_length": 1493.7, "completions/max_terminated_length": 1322.2, "completions/mean_length": 194.458984375, "completions/mean_terminated_length": 180.0866256713867, "completions/min_length": 68.9, "completions/min_terminated_length": 68.9, "entropy": 0.05034385204780847, "epoch": 20.149892933618844, "frac_reward_zero_std": 0.86875, "grad_norm": 0.54296875, "learning_rate": 9.059100000000001e-06, "loss": -0.0163, "num_tokens": 954116401.0, "reward": 1.0409570455551147, "reward_std": 0.18526218757033347, "rewards/reward_accuracy/mean": 0.941796875, "rewards/reward_accuracy/std": 0.18317311778664588, "rewards/reward_format/mean": 0.09916015714406967, "rewards/reward_format/std": 0.005122917634434998, "sampling/importance_sampling_ratio/max": 2.54710738658905, "sampling/importance_sampling_ratio/mean": 0.9915246546268464, "sampling/importance_sampling_ratio/min": 0.1006782367825508, "sampling/sampling_logp_difference/max": 1.0424758732318877, "sampling/sampling_logp_difference/mean": 0.004023418808355927, "step": 9410, "step_time": 7.249125418195035 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.008984375, "completions/max_length": 1071.1, "completions/max_terminated_length": 816.8, "completions/mean_length": 164.32265625, "completions/mean_terminated_length": 147.33380432128905, "completions/min_length": 64.8, "completions/min_terminated_length": 64.8, "entropy": 0.04602664897684008, "epoch": 20.17130620985011, "frac_reward_zero_std": 0.90625, "grad_norm": 0.53125, "learning_rate": 9.0581e-06, "loss": -0.0029, "num_tokens": 955056507.0, "reward": 1.0590429902076721, "reward_std": 0.1384725958108902, "rewards/reward_accuracy/mean": 0.959765625, "rewards/reward_accuracy/std": 0.13546039164066315, "rewards/reward_format/mean": 0.09927734434604644, "rewards/reward_format/std": 0.004545686021447182, "sampling/importance_sampling_ratio/max": 2.468275046348572, "sampling/importance_sampling_ratio/mean": 0.9870678782463074, "sampling/importance_sampling_ratio/min": 0.08944500647485257, "sampling/sampling_logp_difference/max": 0.992816036939621, "sampling/sampling_logp_difference/mean": 0.0041549933375790715, "step": 9420, "step_time": 5.5071119681902925 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0015625, "completions/max_length": 1325.0, "completions/max_terminated_length": 1203.9, "completions/mean_length": 156.590625, "completions/mean_terminated_length": 153.66856536865234, "completions/min_length": 64.6, "completions/min_terminated_length": 64.6, "entropy": 0.03629914382472634, "epoch": 20.19271948608137, "frac_reward_zero_std": 0.875, "grad_norm": 0.64453125, "learning_rate": 9.0571e-06, "loss": -0.0042, "num_tokens": 955982179.0, "reward": 1.0741015791893005, "reward_std": 0.13046502843499183, "rewards/reward_accuracy/mean": 0.97421875, "rewards/reward_accuracy/std": 0.12984965443611146, "rewards/reward_format/mean": 0.09988281428813935, "rewards/reward_format/std": 0.001387959998100996, "sampling/importance_sampling_ratio/max": 2.3332061886787416, "sampling/importance_sampling_ratio/mean": 0.9905461966991425, "sampling/importance_sampling_ratio/min": 0.13019719943404198, "sampling/sampling_logp_difference/max": 0.7900533437728882, "sampling/sampling_logp_difference/mean": 0.0036035147961229084, "step": 9430, "step_time": 6.407836585197947 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 877.0, "completions/max_terminated_length": 877.0, "completions/mean_length": 138.398046875, "completions/mean_terminated_length": 138.398046875, "completions/min_length": 63.8, "completions/min_terminated_length": 63.8, "entropy": 0.034330667741596696, "epoch": 20.214132762312634, "frac_reward_zero_std": 0.94375, "grad_norm": 0.0, "learning_rate": 9.056100000000001e-06, "loss": -0.0007, "num_tokens": 956850286.0, "reward": 1.0753515720367433, "reward_std": 0.11119671985507011, "rewards/reward_accuracy/mean": 0.975390625, "rewards/reward_accuracy/std": 0.1107427716255188, "rewards/reward_format/mean": 0.09996093809604645, "rewards/reward_format/std": 0.0006250000093132258, "sampling/importance_sampling_ratio/max": 2.3766231417655943, "sampling/importance_sampling_ratio/mean": 0.9998860478401184, "sampling/importance_sampling_ratio/min": 0.09883081316947936, "sampling/sampling_logp_difference/max": 0.9398551166057587, "sampling/sampling_logp_difference/mean": 0.0035083564696833493, "step": 9440, "step_time": 4.37504940989893 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01015625, "completions/max_length": 1624.9, "completions/max_terminated_length": 1570.3, "completions/mean_length": 180.540625, "completions/mean_terminated_length": 161.5354248046875, "completions/min_length": 64.6, "completions/min_terminated_length": 64.6, "entropy": 0.04973271593917161, "epoch": 20.235546038543898, "frac_reward_zero_std": 0.91875, "grad_norm": 0.060302734375, "learning_rate": 9.0551e-06, "loss": -0.0021, "num_tokens": 957835718.0, "reward": 1.051757848262787, "reward_std": 0.18331062123179437, "rewards/reward_accuracy/mean": 0.95234375, "rewards/reward_accuracy/std": 0.1812161035835743, "rewards/reward_format/mean": 0.09941406473517418, "rewards/reward_format/std": 0.004721870832145214, "sampling/importance_sampling_ratio/max": 2.5286498785018923, "sampling/importance_sampling_ratio/mean": 0.9814455568790436, "sampling/importance_sampling_ratio/min": 0.11587035749107599, "sampling/sampling_logp_difference/max": 1.029928332567215, "sampling/sampling_logp_difference/mean": 0.004098524688743055, "step": 9450, "step_time": 8.1751138036052 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005859375, "completions/max_length": 1433.3, "completions/max_terminated_length": 1305.1, "completions/mean_length": 166.280078125, "completions/mean_terminated_length": 155.3249755859375, "completions/min_length": 63.5, "completions/min_terminated_length": 63.5, "entropy": 0.051701027411036195, "epoch": 20.25695931477516, "frac_reward_zero_std": 0.9, "grad_norm": 0.455078125, "learning_rate": 9.054100000000002e-06, "loss": -0.0079, "num_tokens": 958781331.0, "reward": 1.0390234589576721, "reward_std": 0.20734305754303933, "rewards/reward_accuracy/mean": 0.939453125, "rewards/reward_accuracy/std": 0.20588796064257622, "rewards/reward_format/mean": 0.09957031384110451, "rewards/reward_format/std": 0.0036582039436325433, "sampling/importance_sampling_ratio/max": 2.645045590400696, "sampling/importance_sampling_ratio/mean": 1.0013889849185944, "sampling/importance_sampling_ratio/min": 0.13209223989397287, "sampling/sampling_logp_difference/max": 0.9785064697265625, "sampling/sampling_logp_difference/mean": 0.004608100303448737, "step": 9460, "step_time": 7.190017719799653 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001171875, "completions/max_length": 1001.4, "completions/max_terminated_length": 853.4, "completions/mean_length": 141.34609375, "completions/mean_terminated_length": 139.13148498535156, "completions/min_length": 63.7, "completions/min_terminated_length": 63.7, "entropy": 0.03639424422290176, "epoch": 20.278372591006423, "frac_reward_zero_std": 0.93125, "grad_norm": 0.2216796875, "learning_rate": 9.0531e-06, "loss": -0.0056, "num_tokens": 959655209.0, "reward": 1.0753125250339508, "reward_std": 0.10329387784004211, "rewards/reward_accuracy/mean": 0.975390625, "rewards/reward_accuracy/std": 0.10295080244541169, "rewards/reward_format/mean": 0.09992187619209289, "rewards/reward_format/std": 0.0012500001117587089, "sampling/importance_sampling_ratio/max": 2.4860294818878175, "sampling/importance_sampling_ratio/mean": 0.9978863000869751, "sampling/importance_sampling_ratio/min": 0.21435419134795666, "sampling/sampling_logp_difference/max": 1.099455440044403, "sampling/sampling_logp_difference/mean": 0.003741220152005553, "step": 9470, "step_time": 4.914625552020152 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0015625, "completions/max_length": 1193.2, "completions/max_terminated_length": 870.3, "completions/mean_length": 153.487890625, "completions/mean_terminated_length": 150.54672088623047, "completions/min_length": 64.6, "completions/min_terminated_length": 64.6, "entropy": 0.03890302076470107, "epoch": 20.299785867237688, "frac_reward_zero_std": 0.94375, "grad_norm": 0.0, "learning_rate": 9.052100000000001e-06, "loss": -0.0038, "num_tokens": 960560298.0, "reward": 1.0818359494209289, "reward_std": 0.0849307008087635, "rewards/reward_accuracy/mean": 0.98203125, "rewards/reward_accuracy/std": 0.08383304327726364, "rewards/reward_format/mean": 0.09980468899011612, "rewards/reward_format/std": 0.002496312838047743, "sampling/importance_sampling_ratio/max": 2.5117289781570435, "sampling/importance_sampling_ratio/mean": 0.9870851933956146, "sampling/importance_sampling_ratio/min": 0.07547296583652496, "sampling/sampling_logp_difference/max": 1.0106294393539428, "sampling/sampling_logp_difference/mean": 0.003670630045235157, "step": 9480, "step_time": 5.826437371419161 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003125, "completions/max_length": 1209.9, "completions/max_terminated_length": 1090.8, "completions/mean_length": 168.891796875, "completions/mean_terminated_length": 163.20494537353517, "completions/min_length": 65.1, "completions/min_terminated_length": 65.1, "entropy": 0.05045470481272787, "epoch": 20.321199143468952, "frac_reward_zero_std": 0.91875, "grad_norm": 0.251953125, "learning_rate": 9.0511e-06, "loss": -0.0038, "num_tokens": 961505589.0, "reward": 1.066503930091858, "reward_std": 0.1360071673989296, "rewards/reward_accuracy/mean": 0.966796875, "rewards/reward_accuracy/std": 0.13479650765657425, "rewards/reward_format/mean": 0.09970703274011612, "rewards/reward_format/std": 0.003108725417405367, "sampling/importance_sampling_ratio/max": 2.4765459537506103, "sampling/importance_sampling_ratio/mean": 0.9811253249645233, "sampling/importance_sampling_ratio/min": 0.11703294068574906, "sampling/sampling_logp_difference/max": 0.9275227963924408, "sampling/sampling_logp_difference/mean": 0.004330472322180867, "step": 9490, "step_time": 5.993466671285569 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.007421875, "completions/max_length": 1382.9, "completions/max_terminated_length": 911.3, "completions/mean_length": 160.083203125, "completions/mean_terminated_length": 146.19298706054687, "completions/min_length": 66.0, "completions/min_terminated_length": 66.0, "entropy": 0.04240153757855296, "epoch": 20.342612419700213, "frac_reward_zero_std": 0.91875, "grad_norm": 0.10595703125, "learning_rate": 9.0501e-06, "loss": -0.0002, "num_tokens": 962427658.0, "reward": 1.067441427707672, "reward_std": 0.13378586918115615, "rewards/reward_accuracy/mean": 0.96796875, "rewards/reward_accuracy/std": 0.1305855117738247, "rewards/reward_format/mean": 0.0994726575911045, "rewards/reward_format/std": 0.005166800413280726, "sampling/importance_sampling_ratio/max": 2.3976157546043395, "sampling/importance_sampling_ratio/mean": 0.9750724494457245, "sampling/importance_sampling_ratio/min": 0.11908239275217056, "sampling/sampling_logp_difference/max": 1.1896399140357972, "sampling/sampling_logp_difference/mean": 0.004200600483454764, "step": 9500, "step_time": 6.901236307108775 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00625, "completions/max_length": 1236.8, "completions/max_terminated_length": 1128.2, "completions/mean_length": 165.68828125, "completions/mean_terminated_length": 153.9628936767578, "completions/min_length": 67.8, "completions/min_terminated_length": 67.8, "entropy": 0.04450862009543925, "epoch": 20.364025695931478, "frac_reward_zero_std": 0.8875, "grad_norm": 0.44140625, "learning_rate": 9.049100000000001e-06, "loss": -0.0054, "num_tokens": 963371580.0, "reward": 1.0546289205551147, "reward_std": 0.17597879394888877, "rewards/reward_accuracy/mean": 0.955078125, "rewards/reward_accuracy/std": 0.17418815568089485, "rewards/reward_format/mean": 0.09955078214406968, "rewards/reward_format/std": 0.003407853958196938, "sampling/importance_sampling_ratio/max": 2.471558403968811, "sampling/importance_sampling_ratio/mean": 0.985941344499588, "sampling/importance_sampling_ratio/min": 0.09461317569948732, "sampling/sampling_logp_difference/max": 1.2015014350414277, "sampling/sampling_logp_difference/mean": 0.004069261578842997, "step": 9510, "step_time": 6.335228195402306 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003515625, "completions/max_length": 1289.2, "completions/max_terminated_length": 1071.2, "completions/mean_length": 162.18359375, "completions/mean_terminated_length": 155.54507141113282, "completions/min_length": 66.0, "completions/min_terminated_length": 66.0, "entropy": 0.04350784970447421, "epoch": 20.385438972162742, "frac_reward_zero_std": 0.90625, "grad_norm": 0.2275390625, "learning_rate": 9.0481e-06, "loss": -0.0069, "num_tokens": 964302770.0, "reward": 1.0719726741313935, "reward_std": 0.11955861747264862, "rewards/reward_accuracy/mean": 0.972265625, "rewards/reward_accuracy/std": 0.11762885004281998, "rewards/reward_format/mean": 0.09970703274011612, "rewards/reward_format/std": 0.003592783026397228, "sampling/importance_sampling_ratio/max": 2.3742625951766967, "sampling/importance_sampling_ratio/mean": 0.9810491383075715, "sampling/importance_sampling_ratio/min": 0.14034995287656785, "sampling/sampling_logp_difference/max": 0.9687917709350586, "sampling/sampling_logp_difference/mean": 0.004168678098358214, "step": 9520, "step_time": 6.307379948717426 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.002734375, "completions/max_length": 897.2, "completions/max_terminated_length": 773.0, "completions/mean_length": 143.0296875, "completions/mean_terminated_length": 137.85130310058594, "completions/min_length": 66.7, "completions/min_terminated_length": 66.7, "entropy": 0.03579169916920364, "epoch": 20.406852248394003, "frac_reward_zero_std": 0.9, "grad_norm": 0.34765625, "learning_rate": 9.0471e-06, "loss": -0.0034, "num_tokens": 965181118.0, "reward": 1.082578146457672, "reward_std": 0.10529829487204552, "rewards/reward_accuracy/mean": 0.9828125, "rewards/reward_accuracy/std": 0.10414503142237663, "rewards/reward_format/mean": 0.09976562559604644, "rewards/reward_format/std": 0.0021565564908087253, "sampling/importance_sampling_ratio/max": 2.560510015487671, "sampling/importance_sampling_ratio/mean": 0.9929108798503876, "sampling/importance_sampling_ratio/min": 0.20360058844089507, "sampling/sampling_logp_difference/max": 0.8361933827400208, "sampling/sampling_logp_difference/mean": 0.003481644671410322, "step": 9530, "step_time": 4.572268179102684 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.002734375, "completions/max_length": 1445.1, "completions/max_terminated_length": 1208.4, "completions/mean_length": 157.023828125, "completions/mean_terminated_length": 151.8783386230469, "completions/min_length": 64.8, "completions/min_terminated_length": 64.8, "entropy": 0.044685054174624386, "epoch": 20.428265524625267, "frac_reward_zero_std": 0.88125, "grad_norm": 0.279296875, "learning_rate": 9.046100000000001e-06, "loss": -0.0002, "num_tokens": 966100811.0, "reward": 1.039160180091858, "reward_std": 0.22344380393624305, "rewards/reward_accuracy/mean": 0.939453125, "rewards/reward_accuracy/std": 0.22244866639375688, "rewards/reward_format/mean": 0.09970703199505807, "rewards/reward_format/std": 0.0033807744970545174, "sampling/importance_sampling_ratio/max": 2.683739113807678, "sampling/importance_sampling_ratio/mean": 0.9903630375862121, "sampling/importance_sampling_ratio/min": 0.12350250780582428, "sampling/sampling_logp_difference/max": 0.9140732049942016, "sampling/sampling_logp_difference/mean": 0.004286891780793667, "step": 9540, "step_time": 7.01554952749575 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001953125, "completions/max_length": 1255.6, "completions/max_terminated_length": 830.8, "completions/mean_length": 141.741015625, "completions/mean_terminated_length": 138.02126083374023, "completions/min_length": 62.7, "completions/min_terminated_length": 62.7, "entropy": 0.033445628848858176, "epoch": 20.449678800856532, "frac_reward_zero_std": 0.925, "grad_norm": 0.345703125, "learning_rate": 9.045100000000001e-06, "loss": 0.0004, "num_tokens": 966978004.0, "reward": 1.0838672161102294, "reward_std": 0.10716498345136642, "rewards/reward_accuracy/mean": 0.983984375, "rewards/reward_accuracy/std": 0.10619137287139893, "rewards/reward_format/mean": 0.09988281428813935, "rewards/reward_format/std": 0.0015071487054228784, "sampling/importance_sampling_ratio/max": 2.4760379076004027, "sampling/importance_sampling_ratio/mean": 0.991464227437973, "sampling/importance_sampling_ratio/min": 0.1796190358698368, "sampling/sampling_logp_difference/max": 0.9984344959259033, "sampling/sampling_logp_difference/mean": 0.003547860705293715, "step": 9550, "step_time": 6.049143508501584 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 1526.9, "completions/max_terminated_length": 1006.2, "completions/mean_length": 150.159765625, "completions/mean_terminated_length": 142.75415496826173, "completions/min_length": 63.6, "completions/min_terminated_length": 63.6, "entropy": 0.04088811215478927, "epoch": 20.471092077087796, "frac_reward_zero_std": 0.91875, "grad_norm": 0.052001953125, "learning_rate": 9.044100000000002e-06, "loss": -0.0019, "num_tokens": 967881469.0, "reward": 1.0805273652076721, "reward_std": 0.11727106422185898, "rewards/reward_accuracy/mean": 0.980859375, "rewards/reward_accuracy/std": 0.11472610384225845, "rewards/reward_format/mean": 0.09966797009110451, "rewards/reward_format/std": 0.004013260779902339, "sampling/importance_sampling_ratio/max": 2.3052733182907104, "sampling/importance_sampling_ratio/mean": 0.9919667899608612, "sampling/importance_sampling_ratio/min": 0.13297515213489533, "sampling/sampling_logp_difference/max": 0.8991382598876954, "sampling/sampling_logp_difference/mean": 0.003966639423742891, "step": 9560, "step_time": 7.2316174821928145 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.004296875, "completions/max_length": 1120.3, "completions/max_terminated_length": 814.9, "completions/mean_length": 144.45390625, "completions/mean_terminated_length": 136.28828887939454, "completions/min_length": 60.2, "completions/min_terminated_length": 60.2, "entropy": 0.03560461034066975, "epoch": 20.492505353319057, "frac_reward_zero_std": 0.9375, "grad_norm": 0.0, "learning_rate": 9.0431e-06, "loss": -0.0049, "num_tokens": 968761287.0, "reward": 1.0464843928813934, "reward_std": 0.17021019905805587, "rewards/reward_accuracy/mean": 0.946875, "rewards/reward_accuracy/std": 0.1689096987247467, "rewards/reward_format/mean": 0.09960937649011611, "rewards/reward_format/std": 0.003647996485233307, "sampling/importance_sampling_ratio/max": 2.424926590919495, "sampling/importance_sampling_ratio/mean": 1.002774167060852, "sampling/importance_sampling_ratio/min": 0.13166978284716607, "sampling/sampling_logp_difference/max": 0.9319976568222046, "sampling/sampling_logp_difference/mean": 0.0036593012977391482, "step": 9570, "step_time": 5.484637943896814 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0015625, "completions/max_length": 1162.2, "completions/max_terminated_length": 987.6, "completions/mean_length": 150.594140625, "completions/mean_terminated_length": 147.63726806640625, "completions/min_length": 63.8, "completions/min_terminated_length": 63.8, "entropy": 0.038895694306120276, "epoch": 20.51391862955032, "frac_reward_zero_std": 0.93125, "grad_norm": 0.1953125, "learning_rate": 9.042100000000001e-06, "loss": -0.0035, "num_tokens": 969668376.0, "reward": 1.0607812762260438, "reward_std": 0.17169202417135238, "rewards/reward_accuracy/mean": 0.9609375, "rewards/reward_accuracy/std": 0.1709093615412712, "rewards/reward_format/mean": 0.09984375163912773, "rewards/reward_format/std": 0.0021321487613022326, "sampling/importance_sampling_ratio/max": 2.414518451690674, "sampling/importance_sampling_ratio/mean": 0.9797936797142028, "sampling/importance_sampling_ratio/min": 0.11580306440591812, "sampling/sampling_logp_difference/max": 1.0255807101726533, "sampling/sampling_logp_difference/mean": 0.003857136028818786, "step": 9580, "step_time": 5.66196625471639 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00078125, "completions/max_length": 1039.5, "completions/max_terminated_length": 883.3, "completions/mean_length": 145.096875, "completions/mean_terminated_length": 143.61675872802735, "completions/min_length": 70.8, "completions/min_terminated_length": 70.8, "entropy": 0.0377669254085049, "epoch": 20.535331905781586, "frac_reward_zero_std": 0.91875, "grad_norm": 0.77734375, "learning_rate": 9.0411e-06, "loss": -0.0019, "num_tokens": 970558560.0, "reward": 1.0678711175918578, "reward_std": 0.1361901968717575, "rewards/reward_accuracy/mean": 0.96796875, "rewards/reward_accuracy/std": 0.13592282608151435, "rewards/reward_format/mean": 0.09990234524011612, "rewards/reward_format/std": 0.0013226743321865797, "sampling/importance_sampling_ratio/max": 2.664250707626343, "sampling/importance_sampling_ratio/mean": 0.987525737285614, "sampling/importance_sampling_ratio/min": 0.14369155764579772, "sampling/sampling_logp_difference/max": 0.9430588483810425, "sampling/sampling_logp_difference/mean": 0.004035376431420446, "step": 9590, "step_time": 5.129275070794392 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.006640625, "completions/max_length": 1809.9, "completions/max_terminated_length": 1666.5, "completions/mean_length": 182.725390625, "completions/mean_terminated_length": 170.40856475830077, "completions/min_length": 70.7, "completions/min_terminated_length": 70.7, "entropy": 0.053642172808758916, "epoch": 20.556745182012847, "frac_reward_zero_std": 0.89375, "grad_norm": 0.4453125, "learning_rate": 9.0401e-06, "loss": -0.0043, "num_tokens": 971548161.0, "reward": 1.0553320467472076, "reward_std": 0.18020469099283218, "rewards/reward_accuracy/mean": 0.955859375, "rewards/reward_accuracy/std": 0.17768767476081848, "rewards/reward_format/mean": 0.09947265684604645, "rewards/reward_format/std": 0.005646963207982481, "sampling/importance_sampling_ratio/max": 2.5940897941589354, "sampling/importance_sampling_ratio/mean": 0.9909974813461304, "sampling/importance_sampling_ratio/min": 0.06359823122620582, "sampling/sampling_logp_difference/max": 1.0154323756694794, "sampling/sampling_logp_difference/mean": 0.0043914541602134705, "step": 9600, "step_time": 8.894105171004776 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00625, "completions/max_length": 1375.3, "completions/max_terminated_length": 1183.1, "completions/mean_length": 162.6890625, "completions/mean_terminated_length": 150.90655212402345, "completions/min_length": 62.4, "completions/min_terminated_length": 62.4, "entropy": 0.04833602337166667, "epoch": 20.57815845824411, "frac_reward_zero_std": 0.925, "grad_norm": 0.265625, "learning_rate": 9.039100000000001e-06, "loss": -0.0022, "num_tokens": 972481589.0, "reward": 1.0616015791893005, "reward_std": 0.17988139986991883, "rewards/reward_accuracy/mean": 0.962109375, "rewards/reward_accuracy/std": 0.17765865176916124, "rewards/reward_format/mean": 0.09949218854308128, "rewards/reward_format/std": 0.004105528281070292, "sampling/importance_sampling_ratio/max": 2.3189747810363768, "sampling/importance_sampling_ratio/mean": 0.9875748634338379, "sampling/importance_sampling_ratio/min": 0.10970372408628463, "sampling/sampling_logp_difference/max": 1.0241555273532867, "sampling/sampling_logp_difference/mean": 0.004224461130797863, "step": 9610, "step_time": 6.5861921827861805 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0046875, "completions/max_length": 1572.9, "completions/max_terminated_length": 1044.6, "completions/mean_length": 152.906640625, "completions/mean_terminated_length": 143.9917739868164, "completions/min_length": 65.2, "completions/min_terminated_length": 65.2, "entropy": 0.04302301805000752, "epoch": 20.599571734475376, "frac_reward_zero_std": 0.90625, "grad_norm": 0.349609375, "learning_rate": 9.0381e-06, "loss": -0.0025, "num_tokens": 973388790.0, "reward": 1.0804101705551148, "reward_std": 0.11797500848770141, "rewards/reward_accuracy/mean": 0.980859375, "rewards/reward_accuracy/std": 0.11523856520652771, "rewards/reward_format/mean": 0.09955078214406968, "rewards/reward_format/std": 0.004707336518913507, "sampling/importance_sampling_ratio/max": 2.506846570968628, "sampling/importance_sampling_ratio/mean": 0.9925802171230316, "sampling/importance_sampling_ratio/min": 0.1756427839398384, "sampling/sampling_logp_difference/max": 0.9028515815734863, "sampling/sampling_logp_difference/mean": 0.0036673703929409386, "step": 9620, "step_time": 7.540604859325685 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00078125, "completions/max_length": 1117.1, "completions/max_terminated_length": 1098.9, "completions/mean_length": 149.988671875, "completions/mean_terminated_length": 148.51215667724608, "completions/min_length": 67.5, "completions/min_terminated_length": 67.5, "entropy": 0.04244908476248384, "epoch": 20.620985010706637, "frac_reward_zero_std": 0.9125, "grad_norm": 0.5078125, "learning_rate": 9.0371e-06, "loss": -0.0107, "num_tokens": 974288921.0, "reward": 1.0643164217472076, "reward_std": 0.15300461798906326, "rewards/reward_accuracy/mean": 0.964453125, "rewards/reward_accuracy/std": 0.1519756942987442, "rewards/reward_format/mean": 0.09986328184604645, "rewards/reward_format/std": 0.0017637486103922128, "sampling/importance_sampling_ratio/max": 2.528737246990204, "sampling/importance_sampling_ratio/mean": 0.9969575226306915, "sampling/importance_sampling_ratio/min": 0.15285894125699998, "sampling/sampling_logp_difference/max": 0.9588941931724548, "sampling/sampling_logp_difference/mean": 0.0038899104576557873, "step": 9630, "step_time": 5.495048817808856 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.007421875, "completions/max_length": 1599.3, "completions/max_terminated_length": 1175.9, "completions/mean_length": 162.471875, "completions/mean_terminated_length": 148.4839660644531, "completions/min_length": 63.6, "completions/min_terminated_length": 63.6, "entropy": 0.04316717623732984, "epoch": 20.6423982869379, "frac_reward_zero_std": 0.8875, "grad_norm": 0.6171875, "learning_rate": 9.036100000000001e-06, "loss": -0.0068, "num_tokens": 975225105.0, "reward": 1.0365625202655793, "reward_std": 0.22556758150458336, "rewards/reward_accuracy/mean": 0.937109375, "rewards/reward_accuracy/std": 0.22396075800061227, "rewards/reward_format/mean": 0.09945312663912773, "rewards/reward_format/std": 0.0033678514882922173, "sampling/importance_sampling_ratio/max": 2.445440649986267, "sampling/importance_sampling_ratio/mean": 0.9849195420742035, "sampling/importance_sampling_ratio/min": 0.059182215947657824, "sampling/sampling_logp_difference/max": 0.9232854008674621, "sampling/sampling_logp_difference/mean": 0.004047739575617016, "step": 9640, "step_time": 7.531236869218992 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.002734375, "completions/max_length": 1033.5, "completions/max_terminated_length": 1008.3, "completions/mean_length": 155.96328125, "completions/mean_terminated_length": 150.83581085205077, "completions/min_length": 64.8, "completions/min_terminated_length": 64.8, "entropy": 0.0430231248261407, "epoch": 20.663811563169165, "frac_reward_zero_std": 0.90625, "grad_norm": 0.380859375, "learning_rate": 9.035100000000001e-06, "loss": -0.0083, "num_tokens": 976139811.0, "reward": 1.0767773628234862, "reward_std": 0.12199952378869057, "rewards/reward_accuracy/mean": 0.976953125, "rewards/reward_accuracy/std": 0.1211847223341465, "rewards/reward_format/mean": 0.0998242199420929, "rewards/reward_format/std": 0.001561674429103732, "sampling/importance_sampling_ratio/max": 2.590941572189331, "sampling/importance_sampling_ratio/mean": 0.9813974022865295, "sampling/importance_sampling_ratio/min": 0.14192537926137447, "sampling/sampling_logp_difference/max": 1.032774603366852, "sampling/sampling_logp_difference/mean": 0.0042243595235049725, "step": 9650, "step_time": 5.356963308583363 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.004296875, "completions/max_length": 1584.2, "completions/max_terminated_length": 1284.8, "completions/mean_length": 159.35546875, "completions/mean_terminated_length": 151.33111572265625, "completions/min_length": 66.2, "completions/min_terminated_length": 66.2, "entropy": 0.044019264774397014, "epoch": 20.68522483940043, "frac_reward_zero_std": 0.90625, "grad_norm": 0.3046875, "learning_rate": 9.0341e-06, "loss": -0.0053, "num_tokens": 977074657.0, "reward": 1.0841211080551147, "reward_std": 0.10273950323462486, "rewards/reward_accuracy/mean": 0.984375, "rewards/reward_accuracy/std": 0.10152760595083236, "rewards/reward_format/mean": 0.09974609389901161, "rewards/reward_format/std": 0.0023240381153300403, "sampling/importance_sampling_ratio/max": 2.499576950073242, "sampling/importance_sampling_ratio/mean": 0.97985959649086, "sampling/importance_sampling_ratio/min": 0.15460203476250173, "sampling/sampling_logp_difference/max": 0.9114595890045166, "sampling/sampling_logp_difference/mean": 0.004188334150239825, "step": 9660, "step_time": 7.479745704794186 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005078125, "completions/max_length": 1285.6, "completions/max_terminated_length": 1209.7, "completions/mean_length": 164.491796875, "completions/mean_terminated_length": 154.96204376220703, "completions/min_length": 68.4, "completions/min_terminated_length": 68.4, "entropy": 0.04392874310724437, "epoch": 20.70663811563169, "frac_reward_zero_std": 0.8875, "grad_norm": 0.142578125, "learning_rate": 9.0331e-06, "loss": -0.0064, "num_tokens": 978015084.0, "reward": 1.0679296970367431, "reward_std": 0.14715766832232474, "rewards/reward_accuracy/mean": 0.968359375, "rewards/reward_accuracy/std": 0.14547782018780708, "rewards/reward_format/mean": 0.09957031309604644, "rewards/reward_format/std": 0.004024181980639696, "sampling/importance_sampling_ratio/max": 2.5143630027771, "sampling/importance_sampling_ratio/mean": 0.9914460420608521, "sampling/importance_sampling_ratio/min": 0.1520752776414156, "sampling/sampling_logp_difference/max": 0.8152877390384674, "sampling/sampling_logp_difference/mean": 0.0038756511174142362, "step": 9670, "step_time": 6.446495631281868 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 1566.1, "completions/max_terminated_length": 1256.9, "completions/mean_length": 160.874609375, "completions/mean_terminated_length": 153.54659576416014, "completions/min_length": 61.6, "completions/min_terminated_length": 61.6, "entropy": 0.04650077945552766, "epoch": 20.728051391862955, "frac_reward_zero_std": 0.86875, "grad_norm": 0.2578125, "learning_rate": 9.032100000000001e-06, "loss": -0.0089, "num_tokens": 978945499.0, "reward": 1.0586719036102294, "reward_std": 0.18684569224715233, "rewards/reward_accuracy/mean": 0.958984375, "rewards/reward_accuracy/std": 0.18510170057415962, "rewards/reward_format/mean": 0.09968750178813934, "rewards/reward_format/std": 0.0036580686923116446, "sampling/importance_sampling_ratio/max": 2.491647815704346, "sampling/importance_sampling_ratio/mean": 0.9952693581581116, "sampling/importance_sampling_ratio/min": 0.15194832682609558, "sampling/sampling_logp_difference/max": 0.943127453327179, "sampling/sampling_logp_difference/mean": 0.004126214678399265, "step": 9680, "step_time": 7.410320304695051 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0046875, "completions/max_length": 1592.9, "completions/max_terminated_length": 1503.2, "completions/mean_length": 162.18125, "completions/mean_terminated_length": 153.35069427490234, "completions/min_length": 69.8, "completions/min_terminated_length": 69.8, "entropy": 0.044413124793209136, "epoch": 20.74946466809422, "frac_reward_zero_std": 0.89375, "grad_norm": 0.138671875, "learning_rate": 9.0311e-06, "loss": -0.0062, "num_tokens": 979877819.0, "reward": 1.0625390887260437, "reward_std": 0.14572153612971306, "rewards/reward_accuracy/mean": 0.962890625, "rewards/reward_accuracy/std": 0.14404306709766387, "rewards/reward_format/mean": 0.09964843913912773, "rewards/reward_format/std": 0.0035619751550257208, "sampling/importance_sampling_ratio/max": 2.5800753593444825, "sampling/importance_sampling_ratio/mean": 0.9806273400783538, "sampling/importance_sampling_ratio/min": 0.08983311057090759, "sampling/sampling_logp_difference/max": 1.1474958062171936, "sampling/sampling_logp_difference/mean": 0.0041600283002480865, "step": 9690, "step_time": 7.412665121484315 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.002734375, "completions/max_length": 1044.6, "completions/max_terminated_length": 835.6, "completions/mean_length": 155.457421875, "completions/mean_terminated_length": 150.31749114990234, "completions/min_length": 70.1, "completions/min_terminated_length": 70.1, "entropy": 0.039094252581708136, "epoch": 20.77087794432548, "frac_reward_zero_std": 0.9125, "grad_norm": 0.380859375, "learning_rate": 9.0301e-06, "loss": -0.0044, "num_tokens": 980793902.0, "reward": 1.0701953291893005, "reward_std": 0.12001206129789352, "rewards/reward_accuracy/mean": 0.9703125, "rewards/reward_accuracy/std": 0.11952262967824936, "rewards/reward_format/mean": 0.09988281354308129, "rewards/reward_format/std": 0.0016351743834093213, "sampling/importance_sampling_ratio/max": 2.4467029929161073, "sampling/importance_sampling_ratio/mean": 0.9916735470294953, "sampling/importance_sampling_ratio/min": 0.1720254361629486, "sampling/sampling_logp_difference/max": 1.0808980941772461, "sampling/sampling_logp_difference/mean": 0.003963481797836721, "step": 9700, "step_time": 5.322770311488421 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.002734375, "completions/max_length": 1288.1, "completions/max_terminated_length": 1023.0, "completions/mean_length": 157.914453125, "completions/mean_terminated_length": 152.7582244873047, "completions/min_length": 62.2, "completions/min_terminated_length": 62.2, "entropy": 0.04323129947297275, "epoch": 20.792291220556745, "frac_reward_zero_std": 0.85, "grad_norm": 0.51953125, "learning_rate": 9.029100000000001e-06, "loss": 0.0015, "num_tokens": 981722931.0, "reward": 1.062968772649765, "reward_std": 0.13316667079925537, "rewards/reward_accuracy/mean": 0.96328125, "rewards/reward_accuracy/std": 0.13129849433898927, "rewards/reward_format/mean": 0.09968750178813934, "rewards/reward_format/std": 0.0033178773475810884, "sampling/importance_sampling_ratio/max": 2.5903496503829957, "sampling/importance_sampling_ratio/mean": 0.9893921434879303, "sampling/importance_sampling_ratio/min": 0.09304811730980873, "sampling/sampling_logp_difference/max": 1.1986364603042603, "sampling/sampling_logp_difference/mean": 0.004243611195124686, "step": 9710, "step_time": 6.205364897189429 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00234375, "completions/max_length": 1263.3, "completions/max_terminated_length": 940.6, "completions/mean_length": 142.426171875, "completions/mean_terminated_length": 138.01132583618164, "completions/min_length": 62.7, "completions/min_terminated_length": 62.7, "entropy": 0.03808842154685408, "epoch": 20.81370449678801, "frac_reward_zero_std": 0.93125, "grad_norm": 0.412109375, "learning_rate": 9.028100000000001e-06, "loss": -0.0058, "num_tokens": 982596214.0, "reward": 1.0813086032867432, "reward_std": 0.09150040224194526, "rewards/reward_accuracy/mean": 0.981640625, "rewards/reward_accuracy/std": 0.08916686773300171, "rewards/reward_format/mean": 0.09966796934604645, "rewards/reward_format/std": 0.0035525617422536016, "sampling/importance_sampling_ratio/max": 2.333670771121979, "sampling/importance_sampling_ratio/mean": 0.9830051362514496, "sampling/importance_sampling_ratio/min": 0.14152817614376545, "sampling/sampling_logp_difference/max": 0.9653074264526367, "sampling/sampling_logp_difference/mean": 0.003815475688315928, "step": 9720, "step_time": 6.050054537600954 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001953125, "completions/max_length": 1294.9, "completions/max_terminated_length": 1007.3, "completions/mean_length": 144.51484375, "completions/mean_terminated_length": 140.78505783081056, "completions/min_length": 61.1, "completions/min_terminated_length": 61.1, "entropy": 0.035224367235787216, "epoch": 20.83511777301927, "frac_reward_zero_std": 0.9375, "grad_norm": 0.12255859375, "learning_rate": 9.0271e-06, "loss": -0.0087, "num_tokens": 983485420.0, "reward": 1.0748633027076722, "reward_std": 0.12583040595054626, "rewards/reward_accuracy/mean": 0.975, "rewards/reward_accuracy/std": 0.12447099462151527, "rewards/reward_format/mean": 0.09986328259110451, "rewards/reward_format/std": 0.0019476743880659341, "sampling/importance_sampling_ratio/max": 2.5276031494140625, "sampling/importance_sampling_ratio/mean": 0.9935354888439178, "sampling/importance_sampling_ratio/min": 0.2223975643515587, "sampling/sampling_logp_difference/max": 0.9208126544952393, "sampling/sampling_logp_difference/mean": 0.003818971640430391, "step": 9730, "step_time": 6.12570981439203 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 1383.9, "completions/max_terminated_length": 1314.4, "completions/mean_length": 176.13515625, "completions/mean_terminated_length": 168.96027069091798, "completions/min_length": 65.4, "completions/min_terminated_length": 65.4, "entropy": 0.04436691864393651, "epoch": 20.856531049250535, "frac_reward_zero_std": 0.89375, "grad_norm": 0.251953125, "learning_rate": 9.026100000000002e-06, "loss": -0.0046, "num_tokens": 984459078.0, "reward": 1.0519336104393004, "reward_std": 0.17122509479522705, "rewards/reward_accuracy/mean": 0.95234375, "rewards/reward_accuracy/std": 0.1693316951394081, "rewards/reward_format/mean": 0.09958984479308128, "rewards/reward_format/std": 0.00390720043797046, "sampling/importance_sampling_ratio/max": 2.323023092746735, "sampling/importance_sampling_ratio/mean": 0.9793604016304016, "sampling/importance_sampling_ratio/min": 0.15131007358431817, "sampling/sampling_logp_difference/max": 1.0446141839027405, "sampling/sampling_logp_difference/mean": 0.003908500191755593, "step": 9740, "step_time": 6.889585492914193 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 1.7478150766692124e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 1.7478150766692124e-06, "completions/clipped_ratio": 0.01015625, "completions/max_length": 1369.1, "completions/max_terminated_length": 1226.5, "completions/mean_length": 176.953515625, "completions/mean_terminated_length": 157.72741088867187, "completions/min_length": 66.6, "completions/min_terminated_length": 66.6, "entropy": 0.04859364067669958, "epoch": 20.8779443254818, "frac_reward_zero_std": 0.925, "grad_norm": 0.328125, "learning_rate": 9.025100000000001e-06, "loss": 0.0005, "num_tokens": 985429807.0, "reward": 1.0569726705551148, "reward_std": 0.17324335724115372, "rewards/reward_accuracy/mean": 0.9578125, "rewards/reward_accuracy/std": 0.1700064495205879, "rewards/reward_format/mean": 0.09916015639901161, "rewards/reward_format/std": 0.005222068983130157, "sampling/importance_sampling_ratio/max": 2.617575454711914, "sampling/importance_sampling_ratio/mean": 0.9962279379367829, "sampling/importance_sampling_ratio/min": 0.002961219847202301, "sampling/sampling_logp_difference/max": 1.1075387716293335, "sampling/sampling_logp_difference/mean": 0.004247820563614368, "step": 9750, "step_time": 6.9591904614120725 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.012109375, "completions/max_length": 1959.2, "completions/max_terminated_length": 1793.6, "completions/mean_length": 205.8, "completions/mean_terminated_length": 183.41503295898437, "completions/min_length": 65.9, "completions/min_terminated_length": 65.9, "entropy": 0.05511588896624744, "epoch": 20.899357601713064, "frac_reward_zero_std": 0.85, "grad_norm": 0.384765625, "learning_rate": 9.0241e-06, "loss": -0.0177, "num_tokens": 986478911.0, "reward": 1.0416211187839508, "reward_std": 0.22274344637989998, "rewards/reward_accuracy/mean": 0.942578125, "rewards/reward_accuracy/std": 0.21956978738307953, "rewards/reward_format/mean": 0.09904297068715096, "rewards/reward_format/std": 0.00648826512042433, "sampling/importance_sampling_ratio/max": 2.7059046745300295, "sampling/importance_sampling_ratio/mean": 0.983485347032547, "sampling/importance_sampling_ratio/min": 0.08402718212455511, "sampling/sampling_logp_difference/max": 1.0544158697128296, "sampling/sampling_logp_difference/mean": 0.004393012565560639, "step": 9760, "step_time": 9.659973237593658 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00703125, "completions/max_length": 1354.8, "completions/max_terminated_length": 948.5, "completions/mean_length": 174.3578125, "completions/mean_terminated_length": 161.46367950439452, "completions/min_length": 67.0, "completions/min_terminated_length": 67.0, "entropy": 0.04631093223579228, "epoch": 20.920770877944324, "frac_reward_zero_std": 0.9, "grad_norm": 0.546875, "learning_rate": 9.0231e-06, "loss": -0.0019, "num_tokens": 987448083.0, "reward": 1.0490625202655792, "reward_std": 0.16510942578315735, "rewards/reward_accuracy/mean": 0.949609375, "rewards/reward_accuracy/std": 0.16344898864626883, "rewards/reward_format/mean": 0.09945312514901161, "rewards/reward_format/std": 0.004331236216239631, "sampling/importance_sampling_ratio/max": 2.5576298236846924, "sampling/importance_sampling_ratio/mean": 0.9851946413516999, "sampling/importance_sampling_ratio/min": 0.10638822317123413, "sampling/sampling_logp_difference/max": 1.0302805185317994, "sampling/sampling_logp_difference/mean": 0.004025372769683599, "step": 9770, "step_time": 6.8756098900834335 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.006640625, "completions/max_length": 1147.4, "completions/max_terminated_length": 1063.5, "completions/mean_length": 166.91171875, "completions/mean_terminated_length": 154.4723159790039, "completions/min_length": 66.5, "completions/min_terminated_length": 66.5, "entropy": 0.04943813912104815, "epoch": 20.94218415417559, "frac_reward_zero_std": 0.90625, "grad_norm": 0.53125, "learning_rate": 9.0221e-06, "loss": -0.0027, "num_tokens": 988393857.0, "reward": 1.0729883074760438, "reward_std": 0.13370950445532798, "rewards/reward_accuracy/mean": 0.9734375, "rewards/reward_accuracy/std": 0.13195253610610963, "rewards/reward_format/mean": 0.09955078363418579, "rewards/reward_format/std": 0.0034094065660610793, "sampling/importance_sampling_ratio/max": 2.579384684562683, "sampling/importance_sampling_ratio/mean": 0.9793617725372314, "sampling/importance_sampling_ratio/min": 0.13200344685465099, "sampling/sampling_logp_difference/max": 1.0394632935523986, "sampling/sampling_logp_difference/mean": 0.004341482813470065, "step": 9780, "step_time": 5.9173060599947345 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0046875, "completions/max_length": 1184.1, "completions/max_terminated_length": 885.6, "completions/mean_length": 154.364453125, "completions/mean_terminated_length": 145.62998046875, "completions/min_length": 66.5, "completions/min_terminated_length": 66.5, "entropy": 0.038829141203314065, "epoch": 20.963597430406853, "frac_reward_zero_std": 0.93125, "grad_norm": 0.0, "learning_rate": 9.0211e-06, "loss": 0.0004, "num_tokens": 989304054.0, "reward": 1.0706250071525574, "reward_std": 0.13846353441476822, "rewards/reward_accuracy/mean": 0.97109375, "rewards/reward_accuracy/std": 0.1364782728254795, "rewards/reward_format/mean": 0.09953125044703484, "rewards/reward_format/std": 0.0031400542240589855, "sampling/importance_sampling_ratio/max": 2.5277611017227173, "sampling/importance_sampling_ratio/mean": 0.9899797677993775, "sampling/importance_sampling_ratio/min": 0.14544751197099687, "sampling/sampling_logp_difference/max": 0.9243818759918213, "sampling/sampling_logp_difference/mean": 0.003741826210170984, "step": 9790, "step_time": 5.843484438513405 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001171875, "completions/max_length": 869.4, "completions/max_terminated_length": 837.8, "completions/mean_length": 148.33046875, "completions/mean_terminated_length": 146.1214385986328, "completions/min_length": 66.2, "completions/min_terminated_length": 66.2, "entropy": 0.03749716617166996, "epoch": 20.985010706638114, "frac_reward_zero_std": 0.94375, "grad_norm": 0.25390625, "learning_rate": 9.0201e-06, "loss": -0.0029, "num_tokens": 990202980.0, "reward": 1.0752930045127869, "reward_std": 0.09974350333213806, "rewards/reward_accuracy/mean": 0.975390625, "rewards/reward_accuracy/std": 0.09918476343154907, "rewards/reward_format/mean": 0.09990234524011612, "rewards/reward_format/std": 0.001194648747332394, "sampling/importance_sampling_ratio/max": 2.3343748927116392, "sampling/importance_sampling_ratio/mean": 0.9873350858688354, "sampling/importance_sampling_ratio/min": 0.15818992629647255, "sampling/sampling_logp_difference/max": 1.127863609790802, "sampling/sampling_logp_difference/mean": 0.003941187867894769, "step": 9800, "step_time": 4.404747171964845 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.008203125, "completions/max_length": 1738.7, "completions/max_terminated_length": 1478.1, "completions/mean_length": 174.4625, "completions/mean_terminated_length": 159.0642532348633, "completions/min_length": 71.1, "completions/min_terminated_length": 71.1, "entropy": 0.05055987681262195, "epoch": 21.00642398286938, "frac_reward_zero_std": 0.91875, "grad_norm": 0.43359375, "learning_rate": 9.019100000000001e-06, "loss": -0.0026, "num_tokens": 991174372.0, "reward": 1.0567187547683716, "reward_std": 0.16663419753313063, "rewards/reward_accuracy/mean": 0.957421875, "rewards/reward_accuracy/std": 0.16302213817834854, "rewards/reward_format/mean": 0.09929687678813934, "rewards/reward_format/std": 0.006453974009491503, "sampling/importance_sampling_ratio/max": 2.4396588802337646, "sampling/importance_sampling_ratio/mean": 0.982292652130127, "sampling/importance_sampling_ratio/min": 0.08522241860628128, "sampling/sampling_logp_difference/max": 1.0414207458496094, "sampling/sampling_logp_difference/mean": 0.004380066459998488, "step": 9810, "step_time": 8.513658161790227 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00234375, "completions/max_length": 1373.1, "completions/max_terminated_length": 1136.0, "completions/mean_length": 164.276171875, "completions/mean_terminated_length": 159.9107650756836, "completions/min_length": 67.8, "completions/min_terminated_length": 67.8, "entropy": 0.04701744669582695, "epoch": 21.027837259100643, "frac_reward_zero_std": 0.9, "grad_norm": 0.228515625, "learning_rate": 9.018100000000001e-06, "loss": -0.0028, "num_tokens": 992113335.0, "reward": 1.056835949420929, "reward_std": 0.15349877402186393, "rewards/reward_accuracy/mean": 0.95703125, "rewards/reward_accuracy/std": 0.1522693566977978, "rewards/reward_format/mean": 0.09980468824505806, "rewards/reward_format/std": 0.0019669008674100042, "sampling/importance_sampling_ratio/max": 2.426257538795471, "sampling/importance_sampling_ratio/mean": 0.9850066304206848, "sampling/importance_sampling_ratio/min": 0.1758318692445755, "sampling/sampling_logp_difference/max": 1.0736373662948608, "sampling/sampling_logp_difference/mean": 0.004229947179555893, "step": 9820, "step_time": 6.463741266704164 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 2.1338955320970855e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 2.1338955320970855e-06, "completions/clipped_ratio": 0.005859375, "completions/max_length": 1530.4, "completions/max_terminated_length": 1207.6, "completions/mean_length": 168.70234375, "completions/mean_terminated_length": 157.64132385253907, "completions/min_length": 64.5, "completions/min_terminated_length": 64.5, "entropy": 0.047793525364249946, "epoch": 21.049250535331907, "frac_reward_zero_std": 0.89375, "grad_norm": 0.203125, "learning_rate": 9.0171e-06, "loss": -0.0073, "num_tokens": 993065533.0, "reward": 1.0570508003234864, "reward_std": 0.1868712492287159, "rewards/reward_accuracy/mean": 0.957421875, "rewards/reward_accuracy/std": 0.18532659634947776, "rewards/reward_format/mean": 0.09962890744209289, "rewards/reward_format/std": 0.0033411763841286303, "sampling/importance_sampling_ratio/max": 2.5320512294769286, "sampling/importance_sampling_ratio/mean": 0.9763972282409668, "sampling/importance_sampling_ratio/min": 0.08112120442092419, "sampling/sampling_logp_difference/max": 0.9587885856628418, "sampling/sampling_logp_difference/mean": 0.00420237104408443, "step": 9830, "step_time": 7.455792502785334 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00703125, "completions/max_length": 1735.1, "completions/max_terminated_length": 1261.3, "completions/mean_length": 168.84296875, "completions/mean_terminated_length": 155.5660888671875, "completions/min_length": 65.7, "completions/min_terminated_length": 65.7, "entropy": 0.04778232031967491, "epoch": 21.07066381156317, "frac_reward_zero_std": 0.88125, "grad_norm": 0.09765625, "learning_rate": 9.016100000000002e-06, "loss": -0.0068, "num_tokens": 994010491.0, "reward": 1.0589453339576722, "reward_std": 0.18525472581386565, "rewards/reward_accuracy/mean": 0.959375, "rewards/reward_accuracy/std": 0.1834478944540024, "rewards/reward_format/mean": 0.09957031384110451, "rewards/reward_format/std": 0.004357935208827257, "sampling/importance_sampling_ratio/max": 2.507946801185608, "sampling/importance_sampling_ratio/mean": 0.9885113537311554, "sampling/importance_sampling_ratio/min": 0.055226237140595914, "sampling/sampling_logp_difference/max": 1.0246582865715026, "sampling/sampling_logp_difference/mean": 0.004288655007258058, "step": 9840, "step_time": 8.212953078382998 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00078125, "completions/max_length": 995.3, "completions/max_terminated_length": 762.2, "completions/mean_length": 140.1390625, "completions/mean_terminated_length": 138.6549514770508, "completions/min_length": 66.7, "completions/min_terminated_length": 66.7, "entropy": 0.03344025085680187, "epoch": 21.092077087794433, "frac_reward_zero_std": 0.9375, "grad_norm": 0.087890625, "learning_rate": 9.015100000000001e-06, "loss": -0.0077, "num_tokens": 994884783.0, "reward": 1.0807812690734864, "reward_std": 0.0992945484817028, "rewards/reward_accuracy/mean": 0.980859375, "rewards/reward_accuracy/std": 0.0988312192261219, "rewards/reward_format/mean": 0.09992187619209289, "rewards/reward_format/std": 0.0010101743275299669, "sampling/importance_sampling_ratio/max": 2.4188273549079895, "sampling/importance_sampling_ratio/mean": 0.9916119813919068, "sampling/importance_sampling_ratio/min": 0.14228396601974963, "sampling/sampling_logp_difference/max": 1.1028384685516357, "sampling/sampling_logp_difference/mean": 0.0036935355281457307, "step": 9850, "step_time": 5.071327233882039 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0046875, "completions/max_length": 1380.0, "completions/max_terminated_length": 1150.8, "completions/mean_length": 155.47421875, "completions/mean_terminated_length": 146.76767807006837, "completions/min_length": 62.3, "completions/min_terminated_length": 62.3, "entropy": 0.04623365541920066, "epoch": 21.113490364025697, "frac_reward_zero_std": 0.9, "grad_norm": 0.0, "learning_rate": 9.0141e-06, "loss": -0.0083, "num_tokens": 995797981.0, "reward": 1.0589844048023225, "reward_std": 0.15166812688112258, "rewards/reward_accuracy/mean": 0.959375, "rewards/reward_accuracy/std": 0.1504116714000702, "rewards/reward_format/mean": 0.09960937649011611, "rewards/reward_format/std": 0.0032080565812066197, "sampling/importance_sampling_ratio/max": 2.3939496278762817, "sampling/importance_sampling_ratio/mean": 0.991208279132843, "sampling/importance_sampling_ratio/min": 0.13315336406230927, "sampling/sampling_logp_difference/max": 0.772571223974228, "sampling/sampling_logp_difference/mean": 0.004302897374145687, "step": 9860, "step_time": 6.632901624988881 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003125, "completions/max_length": 1243.3, "completions/max_terminated_length": 799.4, "completions/mean_length": 160.13046875, "completions/mean_terminated_length": 154.28158569335938, "completions/min_length": 64.9, "completions/min_terminated_length": 64.9, "entropy": 0.03973154686391354, "epoch": 21.134903640256958, "frac_reward_zero_std": 0.8875, "grad_norm": 1.328125, "learning_rate": 9.0131e-06, "loss": -0.0052, "num_tokens": 996727979.0, "reward": 1.0587500154972076, "reward_std": 0.15466317534446716, "rewards/reward_accuracy/mean": 0.958984375, "rewards/reward_accuracy/std": 0.1538652017712593, "rewards/reward_format/mean": 0.09976562559604644, "rewards/reward_format/std": 0.002858161088079214, "sampling/importance_sampling_ratio/max": 2.471537709236145, "sampling/importance_sampling_ratio/mean": 0.9863010823726654, "sampling/importance_sampling_ratio/min": 0.1068119615316391, "sampling/sampling_logp_difference/max": 1.0063478827476502, "sampling/sampling_logp_difference/mean": 0.003801104868762195, "step": 9870, "step_time": 6.021991904987954 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0015625, "completions/max_length": 1186.1, "completions/max_terminated_length": 1039.1, "completions/mean_length": 146.589453125, "completions/mean_terminated_length": 143.61740264892578, "completions/min_length": 62.7, "completions/min_terminated_length": 62.7, "entropy": 0.03597496948204935, "epoch": 21.156316916488223, "frac_reward_zero_std": 0.94375, "grad_norm": 0.36328125, "learning_rate": 9.0121e-06, "loss": -0.0067, "num_tokens": 997618320.0, "reward": 1.037285166978836, "reward_std": 0.20050647780299186, "rewards/reward_accuracy/mean": 0.9375, "rewards/reward_accuracy/std": 0.19957445859909057, "rewards/reward_format/mean": 0.09978515729308128, "rewards/reward_format/std": 0.002272926946170628, "sampling/importance_sampling_ratio/max": 2.502523934841156, "sampling/importance_sampling_ratio/mean": 0.9890759706497192, "sampling/importance_sampling_ratio/min": 0.15407259687781333, "sampling/sampling_logp_difference/max": 0.9549125671386719, "sampling/sampling_logp_difference/mean": 0.003713409369811416, "step": 9880, "step_time": 5.739336844006902 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0078125, "completions/max_length": 1662.9, "completions/max_terminated_length": 1492.9, "completions/mean_length": 180.923046875, "completions/mean_terminated_length": 166.3808624267578, "completions/min_length": 62.5, "completions/min_terminated_length": 62.5, "entropy": 0.04822738380171358, "epoch": 21.177730192719487, "frac_reward_zero_std": 0.8875, "grad_norm": 0.5625, "learning_rate": 9.011100000000001e-06, "loss": -0.01, "num_tokens": 998598907.0, "reward": 1.0524609684944153, "reward_std": 0.1763737380504608, "rewards/reward_accuracy/mean": 0.953125, "rewards/reward_accuracy/std": 0.17385634332895278, "rewards/reward_format/mean": 0.09933593943715095, "rewards/reward_format/std": 0.005638665845617652, "sampling/importance_sampling_ratio/max": 2.516432690620422, "sampling/importance_sampling_ratio/mean": 0.9787394344806671, "sampling/importance_sampling_ratio/min": 0.06392785832285881, "sampling/sampling_logp_difference/max": 1.0114442706108093, "sampling/sampling_logp_difference/mean": 0.004064181866124272, "step": 9890, "step_time": 8.35769558349275 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.007421875, "completions/max_length": 1677.1, "completions/max_terminated_length": 1529.2, "completions/mean_length": 179.371875, "completions/mean_terminated_length": 165.5760726928711, "completions/min_length": 68.0, "completions/min_terminated_length": 68.0, "entropy": 0.05197636920493096, "epoch": 21.199143468950748, "frac_reward_zero_std": 0.86875, "grad_norm": 0.66796875, "learning_rate": 9.0101e-06, "loss": -0.0088, "num_tokens": 999579507.0, "reward": 1.0348047077655793, "reward_std": 0.21327415853738785, "rewards/reward_accuracy/mean": 0.935546875, "rewards/reward_accuracy/std": 0.21095686927437782, "rewards/reward_format/mean": 0.09925781339406967, "rewards/reward_format/std": 0.006166829774156213, "sampling/importance_sampling_ratio/max": 2.471295785903931, "sampling/importance_sampling_ratio/mean": 0.9879802584648132, "sampling/importance_sampling_ratio/min": 0.08058868078514933, "sampling/sampling_logp_difference/max": 1.3380119442939757, "sampling/sampling_logp_difference/mean": 0.00432176252361387, "step": 9900, "step_time": 8.099537566909566 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003515625, "completions/max_length": 1228.4, "completions/max_terminated_length": 995.6, "completions/mean_length": 155.709765625, "completions/mean_terminated_length": 149.12539978027343, "completions/min_length": 66.5, "completions/min_terminated_length": 66.5, "entropy": 0.04210319020785391, "epoch": 21.220556745182012, "frac_reward_zero_std": 0.95, "grad_norm": 0.6171875, "learning_rate": 9.0091e-06, "loss": -0.0053, "num_tokens": 1000498988.0, "reward": 1.0507226943969727, "reward_std": 0.20771346762776374, "rewards/reward_accuracy/mean": 0.951171875, "rewards/reward_accuracy/std": 0.20545937791466712, "rewards/reward_format/mean": 0.09955078363418579, "rewards/reward_format/std": 0.0037833184003829958, "sampling/importance_sampling_ratio/max": 2.4921345949172973, "sampling/importance_sampling_ratio/mean": 0.9917483925819397, "sampling/importance_sampling_ratio/min": 0.12389444932341576, "sampling/sampling_logp_difference/max": 0.897965955734253, "sampling/sampling_logp_difference/mean": 0.004052263800986111, "step": 9910, "step_time": 6.100807530997554 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001953125, "completions/max_length": 1303.2, "completions/max_terminated_length": 1054.0, "completions/mean_length": 148.67109375, "completions/mean_terminated_length": 144.9616226196289, "completions/min_length": 63.3, "completions/min_terminated_length": 63.3, "entropy": 0.04059880857821554, "epoch": 21.241970021413277, "frac_reward_zero_std": 0.9375, "grad_norm": 0.0, "learning_rate": 9.008100000000001e-06, "loss": -0.0082, "num_tokens": 1001399906.0, "reward": 1.064355492591858, "reward_std": 0.15653302147984505, "rewards/reward_accuracy/mean": 0.964453125, "rewards/reward_accuracy/std": 0.1561000183224678, "rewards/reward_format/mean": 0.09990234449505805, "rewards/reward_format/std": 0.0013226743321865797, "sampling/importance_sampling_ratio/max": 2.2642093777656553, "sampling/importance_sampling_ratio/mean": 0.9824270665645599, "sampling/importance_sampling_ratio/min": 0.03765727318823338, "sampling/sampling_logp_difference/max": 1.2589550018310547, "sampling/sampling_logp_difference/mean": 0.0040136478841304776, "step": 9920, "step_time": 6.33332619270077 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 2.971203502966091e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 2.971203502966091e-06, "completions/clipped_ratio": 0.008984375, "completions/max_length": 1304.9, "completions/max_terminated_length": 1016.9, "completions/mean_length": 155.3234375, "completions/mean_terminated_length": 138.41300048828126, "completions/min_length": 67.5, "completions/min_terminated_length": 67.5, "entropy": 0.04280289961025119, "epoch": 21.26338329764454, "frac_reward_zero_std": 0.93125, "grad_norm": 0.0, "learning_rate": 9.0071e-06, "loss": -0.004, "num_tokens": 1002316814.0, "reward": 1.059921884536743, "reward_std": 0.14825449362397194, "rewards/reward_accuracy/mean": 0.960546875, "rewards/reward_accuracy/std": 0.14626799002289773, "rewards/reward_format/mean": 0.09937500059604645, "rewards/reward_format/std": 0.0034846975933760403, "sampling/importance_sampling_ratio/max": 2.4018102169036863, "sampling/importance_sampling_ratio/mean": 0.9836527466773987, "sampling/importance_sampling_ratio/min": 0.19114010632038117, "sampling/sampling_logp_difference/max": 0.8694240570068359, "sampling/sampling_logp_difference/mean": 0.003975698933936655, "step": 9930, "step_time": 6.477250498501235 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005859375, "completions/max_length": 1253.2, "completions/max_terminated_length": 923.5, "completions/mean_length": 161.8640625, "completions/mean_terminated_length": 150.92530670166016, "completions/min_length": 66.4, "completions/min_terminated_length": 66.4, "entropy": 0.040501720388419926, "epoch": 21.284796573875802, "frac_reward_zero_std": 0.91875, "grad_norm": 0.06591796875, "learning_rate": 9.006100000000002e-06, "loss": -0.0007, "num_tokens": 1003258562.0, "reward": 1.0722851753234863, "reward_std": 0.1332975685596466, "rewards/reward_accuracy/mean": 0.97265625, "rewards/reward_accuracy/std": 0.13163162916898727, "rewards/reward_format/mean": 0.09962890744209289, "rewards/reward_format/std": 0.0033049869351089002, "sampling/importance_sampling_ratio/max": 2.679917502403259, "sampling/importance_sampling_ratio/mean": 1.0021744787693023, "sampling/importance_sampling_ratio/min": 0.15510211382061243, "sampling/sampling_logp_difference/max": 0.9826542139053345, "sampling/sampling_logp_difference/mean": 0.003993232944048941, "step": 9940, "step_time": 6.371324648492736 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00546875, "completions/max_length": 1311.9, "completions/max_terminated_length": 1033.6, "completions/mean_length": 157.547265625, "completions/mean_terminated_length": 147.2760986328125, "completions/min_length": 61.4, "completions/min_terminated_length": 61.4, "entropy": 0.04185357003007084, "epoch": 21.306209850107066, "frac_reward_zero_std": 0.91875, "grad_norm": 0.384765625, "learning_rate": 9.005100000000001e-06, "loss": -0.0103, "num_tokens": 1004178027.0, "reward": 1.057793003320694, "reward_std": 0.1503703661262989, "rewards/reward_accuracy/mean": 0.958203125, "rewards/reward_accuracy/std": 0.14844134077429771, "rewards/reward_format/mean": 0.0995898462831974, "rewards/reward_format/std": 0.00421040840446949, "sampling/importance_sampling_ratio/max": 2.486556053161621, "sampling/importance_sampling_ratio/mean": 0.9912855148315429, "sampling/importance_sampling_ratio/min": 0.1216137208044529, "sampling/sampling_logp_difference/max": 1.0011513769626617, "sampling/sampling_logp_difference/mean": 0.0038218531524762513, "step": 9950, "step_time": 6.506721781595843 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00625, "completions/max_length": 1272.9, "completions/max_terminated_length": 1081.0, "completions/mean_length": 155.859765625, "completions/mean_terminated_length": 144.071337890625, "completions/min_length": 65.5, "completions/min_terminated_length": 65.5, "entropy": 0.036458822642453016, "epoch": 21.32762312633833, "frac_reward_zero_std": 0.9125, "grad_norm": 0.0, "learning_rate": 9.0041e-06, "loss": 0.0001, "num_tokens": 1005101860.0, "reward": 1.0524219036102296, "reward_std": 0.17540586814284326, "rewards/reward_accuracy/mean": 0.952734375, "rewards/reward_accuracy/std": 0.17419228330254555, "rewards/reward_format/mean": 0.09968750178813934, "rewards/reward_format/std": 0.0028210777789354326, "sampling/importance_sampling_ratio/max": 2.258096992969513, "sampling/importance_sampling_ratio/mean": 0.9873687922954559, "sampling/importance_sampling_ratio/min": 0.15279301311820745, "sampling/sampling_logp_difference/max": 0.9336569786071778, "sampling/sampling_logp_difference/mean": 0.0035317132715135813, "step": 9960, "step_time": 6.391207308403682 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005078125, "completions/max_length": 1504.3, "completions/max_terminated_length": 1086.9, "completions/mean_length": 161.708984375, "completions/mean_terminated_length": 152.11532440185547, "completions/min_length": 67.8, "completions/min_terminated_length": 67.8, "entropy": 0.04174451141152531, "epoch": 21.349036402569592, "frac_reward_zero_std": 0.9, "grad_norm": 0.11083984375, "learning_rate": 9.003100000000002e-06, "loss": -0.0108, "num_tokens": 1006032043.0, "reward": 1.0655859589576722, "reward_std": 0.15160858482122422, "rewards/reward_accuracy/mean": 0.966015625, "rewards/reward_accuracy/std": 0.14966910406947137, "rewards/reward_format/mean": 0.09957031384110451, "rewards/reward_format/std": 0.003876163228414953, "sampling/importance_sampling_ratio/max": 2.4254624962806703, "sampling/importance_sampling_ratio/mean": 0.9894883394241333, "sampling/importance_sampling_ratio/min": 0.09305057376623153, "sampling/sampling_logp_difference/max": 0.8771265983581543, "sampling/sampling_logp_difference/mean": 0.0038809570483863353, "step": 9970, "step_time": 7.144446702607093 }, { "clip_ratio/high_max": 7.94281149865128e-06, "clip_ratio/high_mean": 9.9285143733141e-07, "clip_ratio/low_mean": 1.4286960094977985e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 2.421547446829209e-06, "completions/clipped_ratio": 0.00625, "completions/max_length": 1225.3, "completions/max_terminated_length": 961.7, "completions/mean_length": 154.637109375, "completions/mean_terminated_length": 143.13592987060548, "completions/min_length": 68.1, "completions/min_terminated_length": 68.1, "entropy": 0.042068583494983616, "epoch": 21.370449678800856, "frac_reward_zero_std": 0.9375, "grad_norm": 0.35546875, "learning_rate": 9.0021e-06, "loss": 0.0017, "num_tokens": 1006938730.0, "reward": 1.0400000214576721, "reward_std": 0.21244187355041505, "rewards/reward_accuracy/mean": 0.940625, "rewards/reward_accuracy/std": 0.2104586586356163, "rewards/reward_format/mean": 0.09937500134110451, "rewards/reward_format/std": 0.0028933755122125147, "sampling/importance_sampling_ratio/max": 2.4726927518844604, "sampling/importance_sampling_ratio/mean": 0.9852031111717224, "sampling/importance_sampling_ratio/min": 0.12995110228657722, "sampling/sampling_logp_difference/max": 1.16436408162117, "sampling/sampling_logp_difference/mean": 0.004008164303377271, "step": 9980, "step_time": 6.125669053592719 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003515625, "completions/max_length": 1021.3, "completions/max_terminated_length": 976.5, "completions/mean_length": 151.30390625, "completions/mean_terminated_length": 144.69977264404298, "completions/min_length": 65.2, "completions/min_terminated_length": 65.2, "entropy": 0.042168897669762374, "epoch": 21.39186295503212, "frac_reward_zero_std": 0.9375, "grad_norm": 0.0, "learning_rate": 9.001100000000001e-06, "loss": -0.006, "num_tokens": 1007843124.0, "reward": 1.0691992521286011, "reward_std": 0.14202533587813376, "rewards/reward_accuracy/mean": 0.96953125, "rewards/reward_accuracy/std": 0.14063290730118752, "rewards/reward_format/mean": 0.09966797009110451, "rewards/reward_format/std": 0.002725073788315058, "sampling/importance_sampling_ratio/max": 2.4579633474349976, "sampling/importance_sampling_ratio/mean": 0.9882322251796722, "sampling/importance_sampling_ratio/min": 0.1216510720551014, "sampling/sampling_logp_difference/max": 1.0314219117164611, "sampling/sampling_logp_difference/mean": 0.004154024086892605, "step": 9990, "step_time": 5.213499960108311 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00625, "completions/max_length": 1137.5, "completions/max_terminated_length": 999.8, "completions/mean_length": 155.21015625, "completions/mean_terminated_length": 143.65365295410157, "completions/min_length": 60.3, "completions/min_terminated_length": 60.3, "entropy": 0.044048744603060186, "epoch": 21.41327623126338, "frac_reward_zero_std": 0.93125, "grad_norm": 0.384765625, "learning_rate": 9.0001e-06, "loss": -0.0025, "num_tokens": 1008755598.0, "reward": 1.0592773675918579, "reward_std": 0.15503362119197844, "rewards/reward_accuracy/mean": 0.959765625, "rewards/reward_accuracy/std": 0.15342760980129241, "rewards/reward_format/mean": 0.09951172024011612, "rewards/reward_format/std": 0.0031292189145460726, "sampling/importance_sampling_ratio/max": 2.503136658668518, "sampling/importance_sampling_ratio/mean": 0.9787138402462006, "sampling/importance_sampling_ratio/min": 0.15929175093770026, "sampling/sampling_logp_difference/max": 1.061443269252777, "sampling/sampling_logp_difference/mean": 0.004121890105307102, "step": 10000, "step_time": 5.902121822998742 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00546875, "completions/max_length": 1791.1, "completions/max_terminated_length": 1001.5, "completions/mean_length": 155.22890625, "completions/mean_terminated_length": 144.8460433959961, "completions/min_length": 65.0, "completions/min_terminated_length": 65.0, "entropy": 0.041333383927121756, "epoch": 21.434689507494646, "frac_reward_zero_std": 0.8875, "grad_norm": 0.75, "learning_rate": 8.9991e-06, "loss": -0.0077, "num_tokens": 1009669768.0, "reward": 1.0571289241313935, "reward_std": 0.18579963520169257, "rewards/reward_accuracy/mean": 0.957421875, "rewards/reward_accuracy/std": 0.18405614346265792, "rewards/reward_format/mean": 0.09970703274011612, "rewards/reward_format/std": 0.0037134200101718307, "sampling/importance_sampling_ratio/max": 2.3626285195350647, "sampling/importance_sampling_ratio/mean": 0.9859773337841033, "sampling/importance_sampling_ratio/min": 0.1213980883359909, "sampling/sampling_logp_difference/max": 0.9180263340473175, "sampling/sampling_logp_difference/mean": 0.003957601590082049, "step": 10010, "step_time": 8.234654484994826 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005078125, "completions/max_length": 1469.4, "completions/max_terminated_length": 1282.3, "completions/mean_length": 167.567578125, "completions/mean_terminated_length": 157.99429626464843, "completions/min_length": 65.7, "completions/min_terminated_length": 65.7, "entropy": 0.04337228809017688, "epoch": 21.45610278372591, "frac_reward_zero_std": 0.9, "grad_norm": 0.294921875, "learning_rate": 8.998100000000001e-06, "loss": -0.0078, "num_tokens": 1010617397.0, "reward": 1.0651171922683715, "reward_std": 0.13552899316418915, "rewards/reward_accuracy/mean": 0.965625, "rewards/reward_accuracy/std": 0.13325711563229561, "rewards/reward_format/mean": 0.09949218779802323, "rewards/reward_format/std": 0.004316557850688696, "sampling/importance_sampling_ratio/max": 2.4513794064521788, "sampling/importance_sampling_ratio/mean": 0.9794568419456482, "sampling/importance_sampling_ratio/min": 0.043712659180164336, "sampling/sampling_logp_difference/max": 1.0406408667564393, "sampling/sampling_logp_difference/mean": 0.0040049860952422025, "step": 10020, "step_time": 7.20081194518134 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00859375, "completions/max_length": 1254.8, "completions/max_terminated_length": 1037.9, "completions/mean_length": 165.83203125, "completions/mean_terminated_length": 149.6276611328125, "completions/min_length": 59.9, "completions/min_terminated_length": 59.9, "entropy": 0.04308660053648054, "epoch": 21.477516059957175, "frac_reward_zero_std": 0.89375, "grad_norm": 0.7109375, "learning_rate": 8.9971e-06, "loss": -0.0062, "num_tokens": 1011559879.0, "reward": 1.0609179854393005, "reward_std": 0.15986548364162445, "rewards/reward_accuracy/mean": 0.96171875, "rewards/reward_accuracy/std": 0.1568314924836159, "rewards/reward_format/mean": 0.09919921979308129, "rewards/reward_format/std": 0.004170956276357174, "sampling/importance_sampling_ratio/max": 2.547334098815918, "sampling/importance_sampling_ratio/mean": 0.9781998693943024, "sampling/importance_sampling_ratio/min": 0.14051836226135492, "sampling/sampling_logp_difference/max": 0.8557088375091553, "sampling/sampling_logp_difference/mean": 0.004009787668474018, "step": 10030, "step_time": 6.169823154006735 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001171875, "completions/max_length": 1285.7, "completions/max_terminated_length": 1276.8, "completions/mean_length": 151.43984375, "completions/mean_terminated_length": 149.23805389404296, "completions/min_length": 65.5, "completions/min_terminated_length": 65.5, "entropy": 0.03768339185044169, "epoch": 21.498929336188436, "frac_reward_zero_std": 0.9125, "grad_norm": 0.0, "learning_rate": 8.9961e-06, "loss": -0.0054, "num_tokens": 1012462397.0, "reward": 1.0764257788658143, "reward_std": 0.12901996702421456, "rewards/reward_accuracy/mean": 0.9765625, "rewards/reward_accuracy/std": 0.1280085913836956, "rewards/reward_format/mean": 0.09986328110098838, "rewards/reward_format/std": 0.0019476743414998054, "sampling/importance_sampling_ratio/max": 2.5242197036743166, "sampling/importance_sampling_ratio/mean": 0.9817956984043121, "sampling/importance_sampling_ratio/min": 0.0890330221503973, "sampling/sampling_logp_difference/max": 0.9874495148658753, "sampling/sampling_logp_difference/mean": 0.003681789757683873, "step": 10040, "step_time": 6.191938539102557 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 3.783293141168542e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 3.783293141168542e-06, "completions/clipped_ratio": 0.0015625, "completions/max_length": 1019.5, "completions/max_terminated_length": 697.8, "completions/mean_length": 143.72890625, "completions/mean_terminated_length": 140.78467864990233, "completions/min_length": 63.1, "completions/min_terminated_length": 63.1, "entropy": 0.03513142671436072, "epoch": 21.5203426124197, "frac_reward_zero_std": 0.91875, "grad_norm": 0.0, "learning_rate": 8.995100000000001e-06, "loss": -0.0033, "num_tokens": 1013348471.0, "reward": 1.0857812643051148, "reward_std": 0.08222082927823067, "rewards/reward_accuracy/mean": 0.9859375, "rewards/reward_accuracy/std": 0.0813312478363514, "rewards/reward_format/mean": 0.09984375089406967, "rewards/reward_format/std": 0.0018717264058068395, "sampling/importance_sampling_ratio/max": 2.5509865045547486, "sampling/importance_sampling_ratio/mean": 0.98524711728096, "sampling/importance_sampling_ratio/min": 0.1849169809371233, "sampling/sampling_logp_difference/max": 0.9524425089359283, "sampling/sampling_logp_difference/mean": 0.003714151564054191, "step": 10050, "step_time": 4.93670785970171 }, { "clip_ratio/high_max": 2.711986089707352e-05, "clip_ratio/high_mean": 3.38998261213419e-06, "clip_ratio/low_mean": 9.282450491809868e-07, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 4.3182276613151774e-06, "completions/clipped_ratio": 0.00703125, "completions/max_length": 1261.4, "completions/max_terminated_length": 1012.6, "completions/mean_length": 157.142578125, "completions/mean_terminated_length": 143.6817481994629, "completions/min_length": 64.6, "completions/min_terminated_length": 64.6, "entropy": 0.04224957309197634, "epoch": 21.541755888650965, "frac_reward_zero_std": 0.93125, "grad_norm": 0.0, "learning_rate": 8.9941e-06, "loss": 0.0023, "num_tokens": 1014263492.0, "reward": 1.0612109422683715, "reward_std": 0.16772859618067743, "rewards/reward_accuracy/mean": 0.96171875, "rewards/reward_accuracy/std": 0.16595625057816504, "rewards/reward_format/mean": 0.09949218779802323, "rewards/reward_format/std": 0.0030979134142398836, "sampling/importance_sampling_ratio/max": 2.4310709834098816, "sampling/importance_sampling_ratio/mean": 0.9852040112018585, "sampling/importance_sampling_ratio/min": 0.12419422259554266, "sampling/sampling_logp_difference/max": 1.0125086545944213, "sampling/sampling_logp_difference/mean": 0.003889014571905136, "step": 10060, "step_time": 6.438402519701048 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005078125, "completions/max_length": 1502.3, "completions/max_terminated_length": 1046.9, "completions/mean_length": 162.0859375, "completions/mean_terminated_length": 152.56519622802733, "completions/min_length": 68.7, "completions/min_terminated_length": 68.7, "entropy": 0.04040030920878053, "epoch": 21.563169164882225, "frac_reward_zero_std": 0.89375, "grad_norm": 0.5859375, "learning_rate": 8.993100000000002e-06, "loss": -0.0143, "num_tokens": 1015190304.0, "reward": 1.071484386920929, "reward_std": 0.13377708941698074, "rewards/reward_accuracy/mean": 0.971875, "rewards/reward_accuracy/std": 0.13225097507238387, "rewards/reward_format/mean": 0.09960937574505806, "rewards/reward_format/std": 0.003647996531799436, "sampling/importance_sampling_ratio/max": 2.4993433952331543, "sampling/importance_sampling_ratio/mean": 0.9915861546993255, "sampling/importance_sampling_ratio/min": 0.08933223895728588, "sampling/sampling_logp_difference/max": 1.0642663478851317, "sampling/sampling_logp_difference/mean": 0.0039754330413416025, "step": 10070, "step_time": 7.119071475011879 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003515625, "completions/max_length": 1128.6, "completions/max_terminated_length": 938.2, "completions/mean_length": 159.85078125, "completions/mean_terminated_length": 153.26780395507814, "completions/min_length": 65.8, "completions/min_terminated_length": 65.8, "entropy": 0.04471788306254894, "epoch": 21.58458244111349, "frac_reward_zero_std": 0.9125, "grad_norm": 0.5390625, "learning_rate": 8.9921e-06, "loss": -0.0071, "num_tokens": 1016118226.0, "reward": 1.0824023723602294, "reward_std": 0.10512687414884567, "rewards/reward_accuracy/mean": 0.9828125, "rewards/reward_accuracy/std": 0.10282080173492432, "rewards/reward_format/mean": 0.09958984553813935, "rewards/reward_format/std": 0.0035066165030002592, "sampling/importance_sampling_ratio/max": 2.511189806461334, "sampling/importance_sampling_ratio/mean": 0.9909968674182892, "sampling/importance_sampling_ratio/min": 0.13322984278202057, "sampling/sampling_logp_difference/max": 0.9516285598278046, "sampling/sampling_logp_difference/mean": 0.004244732297956943, "step": 10080, "step_time": 5.73660954630468 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00078125, "completions/max_length": 937.1, "completions/max_terminated_length": 756.8, "completions/mean_length": 146.773828125, "completions/mean_terminated_length": 145.2721206665039, "completions/min_length": 63.1, "completions/min_terminated_length": 63.1, "entropy": 0.03517711136955768, "epoch": 21.605995717344754, "frac_reward_zero_std": 0.91875, "grad_norm": 0.2470703125, "learning_rate": 8.991100000000001e-06, "loss": -0.0074, "num_tokens": 1017013023.0, "reward": 1.0756445527076721, "reward_std": 0.118829046189785, "rewards/reward_accuracy/mean": 0.97578125, "rewards/reward_accuracy/std": 0.11821696981787681, "rewards/reward_format/mean": 0.09986328259110451, "rewards/reward_format/std": 0.001635723072104156, "sampling/importance_sampling_ratio/max": 2.4854249954223633, "sampling/importance_sampling_ratio/mean": 0.9871014714241028, "sampling/importance_sampling_ratio/min": 0.14303154051303862, "sampling/sampling_logp_difference/max": 1.0085016131401061, "sampling/sampling_logp_difference/mean": 0.0037257127230986955, "step": 10090, "step_time": 4.755542461996083 }, { "clip_ratio/high_max": 1.90781443961896e-05, "clip_ratio/high_mean": 2.3847680495237e-06, "clip_ratio/low_mean": 2.444552501401631e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 4.829320550925331e-06, "completions/clipped_ratio": 0.00703125, "completions/max_length": 1514.6, "completions/max_terminated_length": 1163.9, "completions/mean_length": 165.441015625, "completions/mean_terminated_length": 152.14153900146485, "completions/min_length": 67.2, "completions/min_terminated_length": 67.2, "entropy": 0.04346627099439502, "epoch": 21.62740899357602, "frac_reward_zero_std": 0.91875, "grad_norm": 0.283203125, "learning_rate": 8.9901e-06, "loss": -0.0028, "num_tokens": 1017957192.0, "reward": 1.0783984541893006, "reward_std": 0.10657487958669662, "rewards/reward_accuracy/mean": 0.97890625, "rewards/reward_accuracy/std": 0.10388406291604042, "rewards/reward_format/mean": 0.09949218854308128, "rewards/reward_format/std": 0.004105528281070292, "sampling/importance_sampling_ratio/max": 2.5568832993507384, "sampling/importance_sampling_ratio/mean": 0.9876145601272583, "sampling/importance_sampling_ratio/min": 0.1765353510156274, "sampling/sampling_logp_difference/max": 1.0933292269706727, "sampling/sampling_logp_difference/mean": 0.003987031523138285, "step": 10100, "step_time": 7.184395595715614 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.008203125, "completions/max_length": 1617.0, "completions/max_terminated_length": 1307.3, "completions/mean_length": 167.8890625, "completions/mean_terminated_length": 152.44870834350587, "completions/min_length": 68.7, "completions/min_terminated_length": 68.7, "entropy": 0.04599333731457591, "epoch": 21.64882226980728, "frac_reward_zero_std": 0.875, "grad_norm": 0.09423828125, "learning_rate": 8.9891e-06, "loss": -0.0056, "num_tokens": 1018908572.0, "reward": 1.0524609565734864, "reward_std": 0.19995204284787177, "rewards/reward_accuracy/mean": 0.953125, "rewards/reward_accuracy/std": 0.19665814712643623, "rewards/reward_format/mean": 0.09933593943715095, "rewards/reward_format/std": 0.00548338950611651, "sampling/importance_sampling_ratio/max": 2.5703131198883056, "sampling/importance_sampling_ratio/mean": 0.9841715812683105, "sampling/importance_sampling_ratio/min": 0.09153402652591466, "sampling/sampling_logp_difference/max": 1.0819766759872436, "sampling/sampling_logp_difference/mean": 0.004137911391444505, "step": 10110, "step_time": 7.854305541914073 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0015625, "completions/max_length": 1326.0, "completions/max_terminated_length": 1195.5, "completions/mean_length": 151.86953125, "completions/mean_terminated_length": 148.93558197021486, "completions/min_length": 66.1, "completions/min_terminated_length": 66.1, "entropy": 0.043875165306963025, "epoch": 21.670235546038544, "frac_reward_zero_std": 0.925, "grad_norm": 0.423828125, "learning_rate": 8.988100000000001e-06, "loss": -0.0063, "num_tokens": 1019820478.0, "reward": 1.0675000190734862, "reward_std": 0.14229700416326524, "rewards/reward_accuracy/mean": 0.967578125, "rewards/reward_accuracy/std": 0.14197241738438607, "rewards/reward_format/mean": 0.09992187619209289, "rewards/reward_format/std": 0.0010101743275299669, "sampling/importance_sampling_ratio/max": 2.463259482383728, "sampling/importance_sampling_ratio/mean": 0.9865207076072693, "sampling/importance_sampling_ratio/min": 0.12145134340971708, "sampling/sampling_logp_difference/max": 0.8726588487625122, "sampling/sampling_logp_difference/mean": 0.00409919077064842, "step": 10120, "step_time": 6.459229998491355 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00078125, "completions/max_length": 1079.9, "completions/max_terminated_length": 858.4, "completions/mean_length": 141.99296875, "completions/mean_terminated_length": 140.51310119628906, "completions/min_length": 63.4, "completions/min_terminated_length": 63.4, "entropy": 0.037907908926717936, "epoch": 21.69164882226981, "frac_reward_zero_std": 0.91875, "grad_norm": 0.70703125, "learning_rate": 8.9871e-06, "loss": -0.0046, "num_tokens": 1020701356.0, "reward": 1.0823632955551148, "reward_std": 0.10173318043816834, "rewards/reward_accuracy/mean": 0.982421875, "rewards/reward_accuracy/std": 0.10096903294324874, "rewards/reward_format/mean": 0.09994140714406967, "rewards/reward_format/std": 0.0009375000605359674, "sampling/importance_sampling_ratio/max": 2.5372581005096437, "sampling/importance_sampling_ratio/mean": 0.9885545194149017, "sampling/importance_sampling_ratio/min": 0.12996770441532135, "sampling/sampling_logp_difference/max": 0.8302749872207642, "sampling/sampling_logp_difference/mean": 0.003836960927583277, "step": 10130, "step_time": 5.196458905789768 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003125, "completions/max_length": 1290.0, "completions/max_terminated_length": 1158.6, "completions/mean_length": 160.105078125, "completions/mean_terminated_length": 154.3149444580078, "completions/min_length": 63.3, "completions/min_terminated_length": 63.3, "entropy": 0.044635672401636836, "epoch": 21.71306209850107, "frac_reward_zero_std": 0.925, "grad_norm": 0.091796875, "learning_rate": 8.9861e-06, "loss": -0.0032, "num_tokens": 1021624377.0, "reward": 1.0598242342472077, "reward_std": 0.13361041024327278, "rewards/reward_accuracy/mean": 0.96015625, "rewards/reward_accuracy/std": 0.13181475922465324, "rewards/reward_format/mean": 0.09966797009110451, "rewards/reward_format/std": 0.003411072725430131, "sampling/importance_sampling_ratio/max": 2.5790364027023314, "sampling/importance_sampling_ratio/mean": 0.9801924228668213, "sampling/importance_sampling_ratio/min": 0.1547185257077217, "sampling/sampling_logp_difference/max": 1.0113398790359498, "sampling/sampling_logp_difference/mean": 0.004318035510368645, "step": 10140, "step_time": 6.371183307599859 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.004296875, "completions/max_length": 1314.2, "completions/max_terminated_length": 1183.1, "completions/mean_length": 170.875, "completions/mean_terminated_length": 162.84579620361328, "completions/min_length": 69.1, "completions/min_terminated_length": 69.1, "entropy": 0.04455638634972274, "epoch": 21.734475374732334, "frac_reward_zero_std": 0.875, "grad_norm": 0.494140625, "learning_rate": 8.985100000000001e-06, "loss": 0.0012, "num_tokens": 1022586265.0, "reward": 1.0702734351158143, "reward_std": 0.13938558027148246, "rewards/reward_accuracy/mean": 0.970703125, "rewards/reward_accuracy/std": 0.13768252059817315, "rewards/reward_format/mean": 0.09957031235098839, "rewards/reward_format/std": 0.0038992925081402065, "sampling/importance_sampling_ratio/max": 2.4974366188049317, "sampling/importance_sampling_ratio/mean": 0.9750323176383973, "sampling/importance_sampling_ratio/min": 0.027366238087415694, "sampling/sampling_logp_difference/max": 1.2622469305992126, "sampling/sampling_logp_difference/mean": 0.0041418279288336635, "step": 10150, "step_time": 6.565924244295457 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003125, "completions/max_length": 1269.7, "completions/max_terminated_length": 1145.6, "completions/mean_length": 155.763671875, "completions/mean_terminated_length": 149.95037689208985, "completions/min_length": 64.4, "completions/min_terminated_length": 64.4, "entropy": 0.04331202975008637, "epoch": 21.7558886509636, "frac_reward_zero_std": 0.9, "grad_norm": 0.45703125, "learning_rate": 8.984100000000001e-06, "loss": -0.002, "num_tokens": 1023503772.0, "reward": 1.0676953315734863, "reward_std": 0.14924731031060218, "rewards/reward_accuracy/mean": 0.96796875, "rewards/reward_accuracy/std": 0.14810579344630243, "rewards/reward_format/mean": 0.09972656294703483, "rewards/reward_format/std": 0.0023031399119645356, "sampling/importance_sampling_ratio/max": 2.4065336346626283, "sampling/importance_sampling_ratio/mean": 0.9810685515403748, "sampling/importance_sampling_ratio/min": 0.053105014562606814, "sampling/sampling_logp_difference/max": 1.100105392932892, "sampling/sampling_logp_difference/mean": 0.0042511434759944676, "step": 10160, "step_time": 6.321838602222852 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.002734375, "completions/max_length": 1404.6, "completions/max_terminated_length": 1281.1, "completions/mean_length": 155.846484375, "completions/mean_terminated_length": 150.7228744506836, "completions/min_length": 58.4, "completions/min_terminated_length": 58.4, "entropy": 0.04667678370606154, "epoch": 21.77730192719486, "frac_reward_zero_std": 0.91875, "grad_norm": 0.53515625, "learning_rate": 8.9831e-06, "loss": -0.0074, "num_tokens": 1024422531.0, "reward": 1.0649804949760437, "reward_std": 0.15686415871605278, "rewards/reward_accuracy/mean": 0.965234375, "rewards/reward_accuracy/std": 0.1551368698477745, "rewards/reward_format/mean": 0.0997460961341858, "rewards/reward_format/std": 0.0027708411682397125, "sampling/importance_sampling_ratio/max": 2.3961092710494993, "sampling/importance_sampling_ratio/mean": 0.9848257601261139, "sampling/importance_sampling_ratio/min": 0.10174353569746017, "sampling/sampling_logp_difference/max": 1.1846657872200013, "sampling/sampling_logp_difference/mean": 0.004218118218705058, "step": 10170, "step_time": 6.74434007089585 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0078125, "completions/max_length": 1777.5, "completions/max_terminated_length": 1315.5, "completions/mean_length": 162.740234375, "completions/mean_terminated_length": 147.9527145385742, "completions/min_length": 63.1, "completions/min_terminated_length": 63.1, "entropy": 0.04891718947328627, "epoch": 21.798715203426124, "frac_reward_zero_std": 0.89375, "grad_norm": 0.302734375, "learning_rate": 8.9821e-06, "loss": -0.0134, "num_tokens": 1025351738.0, "reward": 1.0677148699760437, "reward_std": 0.1547832079231739, "rewards/reward_accuracy/mean": 0.968359375, "rewards/reward_accuracy/std": 0.15151948779821395, "rewards/reward_format/mean": 0.09935547038912773, "rewards/reward_format/std": 0.005845897807739675, "sampling/importance_sampling_ratio/max": 2.502026653289795, "sampling/importance_sampling_ratio/mean": 0.9883608639240264, "sampling/importance_sampling_ratio/min": 0.13242033012211324, "sampling/sampling_logp_difference/max": 1.1450449228286743, "sampling/sampling_logp_difference/mean": 0.003956435900181532, "step": 10180, "step_time": 8.435266339365626 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00703125, "completions/max_length": 1749.2, "completions/max_terminated_length": 1360.9, "completions/mean_length": 176.480078125, "completions/mean_terminated_length": 163.2969825744629, "completions/min_length": 69.9, "completions/min_terminated_length": 69.9, "entropy": 0.05171437179669738, "epoch": 21.820128479657388, "frac_reward_zero_std": 0.90625, "grad_norm": 0.220703125, "learning_rate": 8.981100000000001e-06, "loss": -0.0066, "num_tokens": 1026327143.0, "reward": 1.0593164205551147, "reward_std": 0.16410770565271376, "rewards/reward_accuracy/mean": 0.959765625, "rewards/reward_accuracy/std": 0.16192117109894752, "rewards/reward_format/mean": 0.0995507813990116, "rewards/reward_format/std": 0.004468390787951648, "sampling/importance_sampling_ratio/max": 2.3464462518692017, "sampling/importance_sampling_ratio/mean": 0.9814011633396149, "sampling/importance_sampling_ratio/min": 0.05507134636864066, "sampling/sampling_logp_difference/max": 1.1050967812538146, "sampling/sampling_logp_difference/mean": 0.004614736023359001, "step": 10190, "step_time": 8.40208401979471 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0046875, "completions/max_length": 1144.7, "completions/max_terminated_length": 856.1, "completions/mean_length": 158.303125, "completions/mean_terminated_length": 149.4576675415039, "completions/min_length": 64.6, "completions/min_terminated_length": 64.6, "entropy": 0.03830897784791887, "epoch": 21.841541755888652, "frac_reward_zero_std": 0.91875, "grad_norm": 0.09521484375, "learning_rate": 8.9801e-06, "loss": 0.0, "num_tokens": 1027246639.0, "reward": 1.0765039443969726, "reward_std": 0.11042684242129326, "rewards/reward_accuracy/mean": 0.976953125, "rewards/reward_accuracy/std": 0.10859133154153824, "rewards/reward_format/mean": 0.09955078363418579, "rewards/reward_format/std": 0.003680312680080533, "sampling/importance_sampling_ratio/max": 2.559686207771301, "sampling/importance_sampling_ratio/mean": 0.9812040328979492, "sampling/importance_sampling_ratio/min": 0.1527220904827118, "sampling/sampling_logp_difference/max": 0.8410094559192658, "sampling/sampling_logp_difference/mean": 0.003616907703690231, "step": 10200, "step_time": 5.747005846889806 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.008984375, "completions/max_length": 1283.9, "completions/max_terminated_length": 1045.9, "completions/mean_length": 179.8765625, "completions/mean_terminated_length": 163.5159484863281, "completions/min_length": 62.1, "completions/min_terminated_length": 62.1, "entropy": 0.049794056359678505, "epoch": 21.862955032119913, "frac_reward_zero_std": 0.875, "grad_norm": 0.0, "learning_rate": 8.9791e-06, "loss": -0.0082, "num_tokens": 1028225363.0, "reward": 1.0465625166893004, "reward_std": 0.17529404386878014, "rewards/reward_accuracy/mean": 0.947265625, "rewards/reward_accuracy/std": 0.17332593351602554, "rewards/reward_format/mean": 0.09929687678813934, "rewards/reward_format/std": 0.004599639400839806, "sampling/importance_sampling_ratio/max": 2.4797157764434816, "sampling/importance_sampling_ratio/mean": 0.9932537198066711, "sampling/importance_sampling_ratio/min": 0.09857828095555306, "sampling/sampling_logp_difference/max": 1.1977557778358459, "sampling/sampling_logp_difference/mean": 0.004167436296120286, "step": 10210, "step_time": 6.435524170685676 }, { "clip_ratio/high_max": 1.1742602509912103e-05, "clip_ratio/high_mean": 1.467825313739013e-06, "clip_ratio/low_mean": 2.81478455690376e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 4.2826098706427725e-06, "completions/clipped_ratio": 0.008984375, "completions/max_length": 1453.1, "completions/max_terminated_length": 1324.5, "completions/mean_length": 166.989453125, "completions/mean_terminated_length": 150.08236694335938, "completions/min_length": 61.2, "completions/min_terminated_length": 61.2, "entropy": 0.045601386297494176, "epoch": 21.884368308351178, "frac_reward_zero_std": 0.91875, "grad_norm": 0.0771484375, "learning_rate": 8.978100000000001e-06, "loss": -0.009, "num_tokens": 1029172968.0, "reward": 1.050273448228836, "reward_std": 0.17381225675344467, "rewards/reward_accuracy/mean": 0.951171875, "rewards/reward_accuracy/std": 0.17132497131824492, "rewards/reward_format/mean": 0.09910156279802322, "rewards/reward_format/std": 0.0049659507116302844, "sampling/importance_sampling_ratio/max": 2.593815302848816, "sampling/importance_sampling_ratio/mean": 0.9795648455619812, "sampling/importance_sampling_ratio/min": 0.10344833955168724, "sampling/sampling_logp_difference/max": 1.0012267887592317, "sampling/sampling_logp_difference/mean": 0.004212839133106172, "step": 10220, "step_time": 7.070969536708435 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.006640625, "completions/max_length": 1594.8, "completions/max_terminated_length": 1455.2, "completions/mean_length": 175.112109375, "completions/mean_terminated_length": 162.63087768554686, "completions/min_length": 65.6, "completions/min_terminated_length": 65.6, "entropy": 0.05005024285055697, "epoch": 21.905781584582442, "frac_reward_zero_std": 0.89375, "grad_norm": 0.515625, "learning_rate": 8.9771e-06, "loss": -0.0049, "num_tokens": 1030135255.0, "reward": 1.0686718940734863, "reward_std": 0.14458301961421965, "rewards/reward_accuracy/mean": 0.969140625, "rewards/reward_accuracy/std": 0.14269593209028245, "rewards/reward_format/mean": 0.0995312511920929, "rewards/reward_format/std": 0.004670966975390911, "sampling/importance_sampling_ratio/max": 2.606619954109192, "sampling/importance_sampling_ratio/mean": 0.9760836064815521, "sampling/importance_sampling_ratio/min": 0.04209691844880581, "sampling/sampling_logp_difference/max": 1.0984333992004394, "sampling/sampling_logp_difference/mean": 0.004641410987824201, "step": 10230, "step_time": 7.767159132123925 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.006640625, "completions/max_length": 1666.3, "completions/max_terminated_length": 1409.9, "completions/mean_length": 173.576171875, "completions/mean_terminated_length": 161.1583221435547, "completions/min_length": 65.0, "completions/min_terminated_length": 65.0, "entropy": 0.04347955118864775, "epoch": 21.927194860813703, "frac_reward_zero_std": 0.9125, "grad_norm": 0.150390625, "learning_rate": 8.9761e-06, "loss": 0.001, "num_tokens": 1031104106.0, "reward": 1.079257845878601, "reward_std": 0.12296846881508827, "rewards/reward_accuracy/mean": 0.9796875, "rewards/reward_accuracy/std": 0.1200037233531475, "rewards/reward_format/mean": 0.09957031458616257, "rewards/reward_format/std": 0.004654643265530467, "sampling/importance_sampling_ratio/max": 2.430980622768402, "sampling/importance_sampling_ratio/mean": 0.9884303212165833, "sampling/importance_sampling_ratio/min": 0.15033550634980203, "sampling/sampling_logp_difference/max": 0.9343992471694946, "sampling/sampling_logp_difference/mean": 0.0041069448692724105, "step": 10240, "step_time": 8.197222730499925 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003125, "completions/max_length": 1375.2, "completions/max_terminated_length": 935.0, "completions/mean_length": 149.85625, "completions/mean_terminated_length": 143.9370346069336, "completions/min_length": 62.6, "completions/min_terminated_length": 62.6, "entropy": 0.03853293848223984, "epoch": 21.948608137044967, "frac_reward_zero_std": 0.9125, "grad_norm": 0.0, "learning_rate": 8.975100000000002e-06, "loss": -0.002, "num_tokens": 1032008394.0, "reward": 1.0785937786102295, "reward_std": 0.12018885910511017, "rewards/reward_accuracy/mean": 0.97890625, "rewards/reward_accuracy/std": 0.11776105761528015, "rewards/reward_format/mean": 0.09968750178813934, "rewards/reward_format/std": 0.0035244155908003448, "sampling/importance_sampling_ratio/max": 2.416616177558899, "sampling/importance_sampling_ratio/mean": 0.9832953751087189, "sampling/importance_sampling_ratio/min": 0.17931273132562636, "sampling/sampling_logp_difference/max": 1.0581430494785309, "sampling/sampling_logp_difference/mean": 0.003848026623018086, "step": 10250, "step_time": 6.473482608591439 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00546875, "completions/max_length": 1499.5, "completions/max_terminated_length": 1207.9, "completions/mean_length": 166.01484375, "completions/mean_terminated_length": 155.82455444335938, "completions/min_length": 64.4, "completions/min_terminated_length": 64.4, "entropy": 0.047260865475982426, "epoch": 21.970021413276232, "frac_reward_zero_std": 0.86875, "grad_norm": 0.345703125, "learning_rate": 8.974100000000001e-06, "loss": -0.0042, "num_tokens": 1032948064.0, "reward": 1.0616601824760437, "reward_std": 0.17636330500245095, "rewards/reward_accuracy/mean": 0.962109375, "rewards/reward_accuracy/std": 0.1743452176451683, "rewards/reward_format/mean": 0.09955078214406968, "rewards/reward_format/std": 0.004134347150102258, "sampling/importance_sampling_ratio/max": 2.5674745559692385, "sampling/importance_sampling_ratio/mean": 0.9862704157829285, "sampling/importance_sampling_ratio/min": 0.04556631133891642, "sampling/sampling_logp_difference/max": 1.0334250211715699, "sampling/sampling_logp_difference/mean": 0.00434551602229476, "step": 10260, "step_time": 7.153084889610182 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.002734375, "completions/max_length": 1246.1, "completions/max_terminated_length": 1085.8, "completions/mean_length": 147.66484375, "completions/mean_terminated_length": 142.47111053466796, "completions/min_length": 66.2, "completions/min_terminated_length": 66.2, "entropy": 0.03861658887472004, "epoch": 21.991434689507496, "frac_reward_zero_std": 0.94375, "grad_norm": 0.08544921875, "learning_rate": 8.9731e-06, "loss": -0.0026, "num_tokens": 1033839222.0, "reward": 1.0712695360183715, "reward_std": 0.12553115040063859, "rewards/reward_accuracy/mean": 0.971484375, "rewards/reward_accuracy/std": 0.12418005764484405, "rewards/reward_format/mean": 0.09978515654802322, "rewards/reward_format/std": 0.0026407783152535558, "sampling/importance_sampling_ratio/max": 2.5409610509872436, "sampling/importance_sampling_ratio/mean": 0.9859081745147705, "sampling/importance_sampling_ratio/min": 0.12182356417179108, "sampling/sampling_logp_difference/max": 1.1217045307159423, "sampling/sampling_logp_difference/mean": 0.004143342119641602, "step": 10270, "step_time": 6.0645936975866785 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.006640625, "completions/max_length": 1208.9, "completions/max_terminated_length": 1017.0, "completions/mean_length": 160.626953125, "completions/mean_terminated_length": 148.1184555053711, "completions/min_length": 64.8, "completions/min_terminated_length": 64.8, "entropy": 0.04291476882062852, "epoch": 22.012847965738757, "frac_reward_zero_std": 0.925, "grad_norm": 0.0, "learning_rate": 8.9721e-06, "loss": -0.0064, "num_tokens": 1034761899.0, "reward": 1.044492208957672, "reward_std": 0.16587355360388756, "rewards/reward_accuracy/mean": 0.944921875, "rewards/reward_accuracy/std": 0.16453572735190392, "rewards/reward_format/mean": 0.09957031384110451, "rewards/reward_format/std": 0.0034213694743812084, "sampling/importance_sampling_ratio/max": 2.4665167212486265, "sampling/importance_sampling_ratio/mean": 0.9909249901771545, "sampling/importance_sampling_ratio/min": 0.14430411141365768, "sampling/sampling_logp_difference/max": 0.9303108334541321, "sampling/sampling_logp_difference/mean": 0.004075661231763661, "step": 10280, "step_time": 5.963559139697463 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.004296875, "completions/max_length": 1533.2, "completions/max_terminated_length": 1456.4, "completions/mean_length": 168.856640625, "completions/mean_terminated_length": 160.84713897705078, "completions/min_length": 65.4, "completions/min_terminated_length": 65.4, "entropy": 0.04806088849436492, "epoch": 22.03426124197002, "frac_reward_zero_std": 0.8875, "grad_norm": 0.7265625, "learning_rate": 8.9711e-06, "loss": -0.0113, "num_tokens": 1035712876.0, "reward": 1.0665625154972076, "reward_std": 0.14451129958033562, "rewards/reward_accuracy/mean": 0.966796875, "rewards/reward_accuracy/std": 0.1436442144215107, "rewards/reward_format/mean": 0.0997656263411045, "rewards/reward_format/std": 0.0021960600512102245, "sampling/importance_sampling_ratio/max": 2.49831622838974, "sampling/importance_sampling_ratio/mean": 0.9899373948574066, "sampling/importance_sampling_ratio/min": 0.1279186189174652, "sampling/sampling_logp_difference/max": 0.9956238150596619, "sampling/sampling_logp_difference/mean": 0.004388277628459036, "step": 10290, "step_time": 7.352581561400439 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001171875, "completions/max_length": 1272.3, "completions/max_terminated_length": 1207.1, "completions/mean_length": 158.916796875, "completions/mean_terminated_length": 156.73951873779296, "completions/min_length": 60.7, "completions/min_terminated_length": 60.7, "entropy": 0.04471008435357362, "epoch": 22.055674518201286, "frac_reward_zero_std": 0.90625, "grad_norm": 0.75390625, "learning_rate": 8.9701e-06, "loss": -0.0017, "num_tokens": 1036636039.0, "reward": 1.0752148568630218, "reward_std": 0.1206319659948349, "rewards/reward_accuracy/mean": 0.975390625, "rewards/reward_accuracy/std": 0.12002793103456497, "rewards/reward_format/mean": 0.0998242199420929, "rewards/reward_format/std": 0.0020767973037436604, "sampling/importance_sampling_ratio/max": 2.399261248111725, "sampling/importance_sampling_ratio/mean": 0.9795794725418091, "sampling/importance_sampling_ratio/min": 0.10940364338457584, "sampling/sampling_logp_difference/max": 1.0862724304199218, "sampling/sampling_logp_difference/mean": 0.004109886521473527, "step": 10300, "step_time": 6.231853342810064 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.002734375, "completions/max_length": 1298.4, "completions/max_terminated_length": 1227.9, "completions/mean_length": 158.354296875, "completions/mean_terminated_length": 153.20387115478516, "completions/min_length": 61.4, "completions/min_terminated_length": 61.4, "entropy": 0.04343030992895365, "epoch": 22.077087794432547, "frac_reward_zero_std": 0.88125, "grad_norm": 0.15234375, "learning_rate": 8.9691e-06, "loss": -0.005, "num_tokens": 1037554802.0, "reward": 1.0548046946525573, "reward_std": 0.18579302430152894, "rewards/reward_accuracy/mean": 0.955078125, "rewards/reward_accuracy/std": 0.18437879011034966, "rewards/reward_format/mean": 0.09972656294703483, "rewards/reward_format/std": 0.0026798263657838105, "sampling/importance_sampling_ratio/max": 2.336378538608551, "sampling/importance_sampling_ratio/mean": 0.983100539445877, "sampling/importance_sampling_ratio/min": 0.17697094306349753, "sampling/sampling_logp_difference/max": 0.9616771042346954, "sampling/sampling_logp_difference/mean": 0.00394122910220176, "step": 10310, "step_time": 6.357477696085698 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003125, "completions/max_length": 1421.3, "completions/max_terminated_length": 936.7, "completions/mean_length": 153.538671875, "completions/mean_terminated_length": 147.59242401123046, "completions/min_length": 67.4, "completions/min_terminated_length": 67.4, "entropy": 0.04102408867329359, "epoch": 22.09850107066381, "frac_reward_zero_std": 0.925, "grad_norm": 0.45703125, "learning_rate": 8.968100000000001e-06, "loss": 0.0012, "num_tokens": 1038466405.0, "reward": 1.065000021457672, "reward_std": 0.12960509359836578, "rewards/reward_accuracy/mean": 0.965234375, "rewards/reward_accuracy/std": 0.12864028811454772, "rewards/reward_format/mean": 0.0997656263411045, "rewards/reward_format/std": 0.003142323181964457, "sampling/importance_sampling_ratio/max": 2.609473133087158, "sampling/importance_sampling_ratio/mean": 0.9926814556121826, "sampling/importance_sampling_ratio/min": 0.19389764592051506, "sampling/sampling_logp_difference/max": 1.4160896301269532, "sampling/sampling_logp_difference/mean": 0.003976694238372147, "step": 10320, "step_time": 6.666028933413327 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.006640625, "completions/max_length": 1453.0, "completions/max_terminated_length": 1197.4, "completions/mean_length": 165.34375, "completions/mean_terminated_length": 152.897509765625, "completions/min_length": 70.7, "completions/min_terminated_length": 70.7, "entropy": 0.0484831724781543, "epoch": 22.119914346895076, "frac_reward_zero_std": 0.9125, "grad_norm": 0.34765625, "learning_rate": 8.967100000000001e-06, "loss": -0.0058, "num_tokens": 1039411845.0, "reward": 1.0706640958786011, "reward_std": 0.13310189545154572, "rewards/reward_accuracy/mean": 0.97109375, "rewards/reward_accuracy/std": 0.13123570680618285, "rewards/reward_format/mean": 0.09957031458616257, "rewards/reward_format/std": 0.003521105321124196, "sampling/importance_sampling_ratio/max": 2.4028846979141236, "sampling/importance_sampling_ratio/mean": 0.9775763511657715, "sampling/importance_sampling_ratio/min": 0.10945716500282288, "sampling/sampling_logp_difference/max": 0.914342737197876, "sampling/sampling_logp_difference/mean": 0.00431482729036361, "step": 10330, "step_time": 7.201531531402725 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.006640625, "completions/max_length": 1724.7, "completions/max_terminated_length": 1297.2, "completions/mean_length": 166.872265625, "completions/mean_terminated_length": 154.3629608154297, "completions/min_length": 65.9, "completions/min_terminated_length": 65.9, "entropy": 0.04293321764562279, "epoch": 22.141327623126337, "frac_reward_zero_std": 0.89375, "grad_norm": 0.1025390625, "learning_rate": 8.9661e-06, "loss": -0.0011, "num_tokens": 1040361582.0, "reward": 1.0529492437839507, "reward_std": 0.19394872486591339, "rewards/reward_accuracy/mean": 0.953515625, "rewards/reward_accuracy/std": 0.19153387770056723, "rewards/reward_format/mean": 0.09943359568715096, "rewards/reward_format/std": 0.005324986320920289, "sampling/importance_sampling_ratio/max": 2.529900860786438, "sampling/importance_sampling_ratio/mean": 0.9777911961078644, "sampling/importance_sampling_ratio/min": 0.12722740937024354, "sampling/sampling_logp_difference/max": 0.9986561954021453, "sampling/sampling_logp_difference/mean": 0.004284406057558953, "step": 10340, "step_time": 8.185292090996517 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00234375, "completions/max_length": 1578.8, "completions/max_terminated_length": 1407.1, "completions/mean_length": 161.4265625, "completions/mean_terminated_length": 157.02226867675782, "completions/min_length": 68.0, "completions/min_terminated_length": 68.0, "entropy": 0.04089033124037087, "epoch": 22.1627408993576, "frac_reward_zero_std": 0.90625, "grad_norm": 0.2294921875, "learning_rate": 8.965100000000002e-06, "loss": -0.0093, "num_tokens": 1041292018.0, "reward": 1.068125021457672, "reward_std": 0.1432836391031742, "rewards/reward_accuracy/mean": 0.968359375, "rewards/reward_accuracy/std": 0.1416305996477604, "rewards/reward_format/mean": 0.0997656263411045, "rewards/reward_format/std": 0.0028951086569577456, "sampling/importance_sampling_ratio/max": 2.385604405403137, "sampling/importance_sampling_ratio/mean": 0.9818327009677887, "sampling/importance_sampling_ratio/min": 0.03833083398640156, "sampling/sampling_logp_difference/max": 0.8652629137039185, "sampling/sampling_logp_difference/mean": 0.003719772747717798, "step": 10350, "step_time": 7.49710702309967 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 1.2415081982908304e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 1.2415081982908304e-06, "completions/clipped_ratio": 0.006640625, "completions/max_length": 1438.4, "completions/max_terminated_length": 870.8, "completions/mean_length": 164.68359375, "completions/mean_terminated_length": 152.23700790405275, "completions/min_length": 69.9, "completions/min_terminated_length": 69.9, "entropy": 0.04223510657902807, "epoch": 22.184154175588866, "frac_reward_zero_std": 0.93125, "grad_norm": 0.2216796875, "learning_rate": 8.964100000000001e-06, "loss": -0.002, "num_tokens": 1042225976.0, "reward": 1.0664062798023224, "reward_std": 0.14665701538324355, "rewards/reward_accuracy/mean": 0.966796875, "rewards/reward_accuracy/std": 0.14399684220552444, "rewards/reward_format/mean": 0.09960937723517418, "rewards/reward_format/std": 0.0037758355028927326, "sampling/importance_sampling_ratio/max": 2.5903748989105226, "sampling/importance_sampling_ratio/mean": 0.9944024026393891, "sampling/importance_sampling_ratio/min": 0.14924866929650307, "sampling/sampling_logp_difference/max": 0.8964144706726074, "sampling/sampling_logp_difference/mean": 0.003878481430001557, "step": 10360, "step_time": 7.0047861702012595 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.000390625, "completions/max_length": 1144.3, "completions/max_terminated_length": 979.1, "completions/mean_length": 141.146484375, "completions/mean_terminated_length": 140.4046417236328, "completions/min_length": 63.3, "completions/min_terminated_length": 63.3, "entropy": 0.03614263567142188, "epoch": 22.20556745182013, "frac_reward_zero_std": 0.93125, "grad_norm": 0.7109375, "learning_rate": 8.9631e-06, "loss": -0.0021, "num_tokens": 1043098863.0, "reward": 1.0819531440734864, "reward_std": 0.09992626309394836, "rewards/reward_accuracy/mean": 0.98203125, "rewards/reward_accuracy/std": 0.09938446953892707, "rewards/reward_format/mean": 0.09992187619209289, "rewards/reward_format/std": 0.0008516391506418585, "sampling/importance_sampling_ratio/max": 2.43747820854187, "sampling/importance_sampling_ratio/mean": 0.9866033852100372, "sampling/importance_sampling_ratio/min": 0.1211180955171585, "sampling/sampling_logp_difference/max": 0.9159818172454834, "sampling/sampling_logp_difference/mean": 0.0036426482954993846, "step": 10370, "step_time": 5.407733112783172 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00859375, "completions/max_length": 896.2, "completions/max_terminated_length": 839.9, "completions/mean_length": 164.894140625, "completions/mean_terminated_length": 148.67166137695312, "completions/min_length": 69.1, "completions/min_terminated_length": 69.1, "entropy": 0.0392669941065833, "epoch": 22.22698072805139, "frac_reward_zero_std": 0.9375, "grad_norm": 0.255859375, "learning_rate": 8.9621e-06, "loss": -0.0022, "num_tokens": 1044044816.0, "reward": 1.0622265815734864, "reward_std": 0.15884629115462304, "rewards/reward_accuracy/mean": 0.962890625, "rewards/reward_accuracy/std": 0.15612626895308496, "rewards/reward_format/mean": 0.0993359386920929, "rewards/reward_format/std": 0.0038317086175084112, "sampling/importance_sampling_ratio/max": 2.4328485488891602, "sampling/importance_sampling_ratio/mean": 0.9944740533828735, "sampling/importance_sampling_ratio/min": 0.22926225513219833, "sampling/sampling_logp_difference/max": 0.9781107783317566, "sampling/sampling_logp_difference/mean": 0.003721110289916396, "step": 10380, "step_time": 5.107092531910166 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00234375, "completions/max_length": 1186.3, "completions/max_terminated_length": 930.0, "completions/mean_length": 157.6515625, "completions/mean_terminated_length": 153.32328033447266, "completions/min_length": 65.2, "completions/min_terminated_length": 65.2, "entropy": 0.0424015452619642, "epoch": 22.248394004282655, "frac_reward_zero_std": 0.89375, "grad_norm": 0.265625, "learning_rate": 8.9611e-06, "loss": -0.0031, "num_tokens": 1044964164.0, "reward": 1.068457043170929, "reward_std": 0.13333532437682152, "rewards/reward_accuracy/mean": 0.96875, "rewards/reward_accuracy/std": 0.1325280860066414, "rewards/reward_format/mean": 0.09970703199505807, "rewards/reward_format/std": 0.0027995655545964837, "sampling/importance_sampling_ratio/max": 2.308517026901245, "sampling/importance_sampling_ratio/mean": 0.9933332324028015, "sampling/importance_sampling_ratio/min": 0.17322768978774547, "sampling/sampling_logp_difference/max": 0.9124200880527497, "sampling/sampling_logp_difference/mean": 0.004097060021013022, "step": 10390, "step_time": 5.9183423071895955 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0109375, "completions/max_length": 1845.1, "completions/max_terminated_length": 1776.8, "completions/mean_length": 209.0421875, "completions/mean_terminated_length": 189.01521911621094, "completions/min_length": 64.5, "completions/min_terminated_length": 64.5, "entropy": 0.059105402790009975, "epoch": 22.26980728051392, "frac_reward_zero_std": 0.85625, "grad_norm": 0.390625, "learning_rate": 8.9601e-06, "loss": -0.0062, "num_tokens": 1046018544.0, "reward": 1.0353320717811585, "reward_std": 0.21273796260356903, "rewards/reward_accuracy/mean": 0.936328125, "rewards/reward_accuracy/std": 0.21033623516559602, "rewards/reward_format/mean": 0.09900390803813934, "rewards/reward_format/std": 0.0069975091610103846, "sampling/importance_sampling_ratio/max": 2.5257225036621094, "sampling/importance_sampling_ratio/mean": 0.9765821397304535, "sampling/importance_sampling_ratio/min": 0.06999089196324348, "sampling/sampling_logp_difference/max": 0.855638462305069, "sampling/sampling_logp_difference/mean": 0.004608244588598609, "step": 10400, "step_time": 9.263199436801369 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0078125, "completions/max_length": 1848.5, "completions/max_terminated_length": 1367.8, "completions/mean_length": 170.15703125, "completions/mean_terminated_length": 155.43119735717772, "completions/min_length": 65.4, "completions/min_terminated_length": 65.4, "entropy": 0.04795139369089156, "epoch": 22.29122055674518, "frac_reward_zero_std": 0.86875, "grad_norm": 0.1171875, "learning_rate": 8.9591e-06, "loss": -0.0017, "num_tokens": 1046970674.0, "reward": 1.047949230670929, "reward_std": 0.1947140820324421, "rewards/reward_accuracy/mean": 0.9484375, "rewards/reward_accuracy/std": 0.1922920525074005, "rewards/reward_format/mean": 0.09951171949505806, "rewards/reward_format/std": 0.005190184200182557, "sampling/importance_sampling_ratio/max": 2.3900524377822876, "sampling/importance_sampling_ratio/mean": 0.9693203747272492, "sampling/importance_sampling_ratio/min": 0.028258028719574214, "sampling/sampling_logp_difference/max": 0.9879268765449524, "sampling/sampling_logp_difference/mean": 0.004285033023916185, "step": 10410, "step_time": 8.873591078518075 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0046875, "completions/max_length": 1294.3, "completions/max_terminated_length": 960.8, "completions/mean_length": 151.222265625, "completions/mean_terminated_length": 142.33348236083984, "completions/min_length": 65.9, "completions/min_terminated_length": 65.9, "entropy": 0.03995493757538497, "epoch": 22.312633832976445, "frac_reward_zero_std": 0.9125, "grad_norm": 0.447265625, "learning_rate": 8.958100000000002e-06, "loss": -0.0012, "num_tokens": 1047868123.0, "reward": 1.0832226753234864, "reward_std": 0.1106949046254158, "rewards/reward_accuracy/mean": 0.98359375, "rewards/reward_accuracy/std": 0.10861576721072197, "rewards/reward_format/mean": 0.09962890669703484, "rewards/reward_format/std": 0.0031624906696379185, "sampling/importance_sampling_ratio/max": 2.4485907435417174, "sampling/importance_sampling_ratio/mean": 0.984165471792221, "sampling/importance_sampling_ratio/min": 0.10531915202736855, "sampling/sampling_logp_difference/max": 0.9771452188491822, "sampling/sampling_logp_difference/mean": 0.004003972187638283, "step": 10420, "step_time": 6.1709231038024885 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.000390625, "completions/max_length": 1014.2, "completions/max_terminated_length": 995.0, "completions/mean_length": 152.81796875, "completions/mean_terminated_length": 152.09298858642578, "completions/min_length": 68.0, "completions/min_terminated_length": 68.0, "entropy": 0.03580146508757025, "epoch": 22.33404710920771, "frac_reward_zero_std": 0.93125, "grad_norm": 0.62890625, "learning_rate": 8.957100000000001e-06, "loss": -0.0005, "num_tokens": 1048782137.0, "reward": 1.0655664265155793, "reward_std": 0.1393769472837448, "rewards/reward_accuracy/mean": 0.965625, "rewards/reward_accuracy/std": 0.13905395194888115, "rewards/reward_format/mean": 0.09994140714406967, "rewards/reward_format/std": 0.0009375000605359674, "sampling/importance_sampling_ratio/max": 2.581614637374878, "sampling/importance_sampling_ratio/mean": 0.999406224489212, "sampling/importance_sampling_ratio/min": 0.12028852701187134, "sampling/sampling_logp_difference/max": 1.0027145981788634, "sampling/sampling_logp_difference/mean": 0.0035768750123679636, "step": 10430, "step_time": 5.014489173394395 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0015625, "completions/max_length": 1263.9, "completions/max_terminated_length": 1045.3, "completions/mean_length": 148.513671875, "completions/mean_terminated_length": 145.56387023925782, "completions/min_length": 69.4, "completions/min_terminated_length": 69.4, "entropy": 0.03947074864991009, "epoch": 22.355460385438974, "frac_reward_zero_std": 0.93125, "grad_norm": 0.7109375, "learning_rate": 8.9561e-06, "loss": -0.0004, "num_tokens": 1049677116.0, "reward": 1.0569531440734863, "reward_std": 0.14899953901767732, "rewards/reward_accuracy/mean": 0.95703125, "rewards/reward_accuracy/std": 0.14805234968662262, "rewards/reward_format/mean": 0.09992187619209289, "rewards/reward_format/std": 0.0012500001117587089, "sampling/importance_sampling_ratio/max": 2.398005425930023, "sampling/importance_sampling_ratio/mean": 0.985773766040802, "sampling/importance_sampling_ratio/min": 0.08634203895926476, "sampling/sampling_logp_difference/max": 1.036128830909729, "sampling/sampling_logp_difference/mean": 0.004001086624339223, "step": 10440, "step_time": 6.009397427586373 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 4.939890254718194e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 4.939890254718194e-06, "completions/clipped_ratio": 0.00625, "completions/max_length": 1047.1, "completions/max_terminated_length": 787.8, "completions/mean_length": 146.978515625, "completions/mean_terminated_length": 135.06402740478515, "completions/min_length": 62.8, "completions/min_terminated_length": 62.8, "entropy": 0.04074815874919295, "epoch": 22.376873661670235, "frac_reward_zero_std": 0.95625, "grad_norm": 0.51953125, "learning_rate": 8.955100000000002e-06, "loss": -0.002, "num_tokens": 1050565877.0, "reward": 1.046386754512787, "reward_std": 0.19923774823546408, "rewards/reward_accuracy/mean": 0.946875, "rewards/reward_accuracy/std": 0.19677697345614434, "rewards/reward_format/mean": 0.09951172098517418, "rewards/reward_format/std": 0.0033750889822840692, "sampling/importance_sampling_ratio/max": 2.4093422889709473, "sampling/importance_sampling_ratio/mean": 0.9975963950157165, "sampling/importance_sampling_ratio/min": 0.1860888690687716, "sampling/sampling_logp_difference/max": 0.9041197180747986, "sampling/sampling_logp_difference/mean": 0.004029153031297028, "step": 10450, "step_time": 5.310935328909546 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005859375, "completions/max_length": 1554.5, "completions/max_terminated_length": 1191.7, "completions/mean_length": 169.234765625, "completions/mean_terminated_length": 158.2037139892578, "completions/min_length": 65.3, "completions/min_terminated_length": 65.3, "entropy": 0.04593511971179396, "epoch": 22.3982869379015, "frac_reward_zero_std": 0.9125, "grad_norm": 0.0, "learning_rate": 8.954100000000001e-06, "loss": -0.0074, "num_tokens": 1051513438.0, "reward": 1.0523242473602294, "reward_std": 0.19776245951652527, "rewards/reward_accuracy/mean": 0.952734375, "rewards/reward_accuracy/std": 0.19595204666256905, "rewards/reward_format/mean": 0.09958984553813935, "rewards/reward_format/std": 0.004385497118346393, "sampling/importance_sampling_ratio/max": 2.336388278007507, "sampling/importance_sampling_ratio/mean": 0.9881064891815186, "sampling/importance_sampling_ratio/min": 0.11627790592610836, "sampling/sampling_logp_difference/max": 1.1558636128902435, "sampling/sampling_logp_difference/mean": 0.004212285368703305, "step": 10460, "step_time": 7.4501801454083765 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005078125, "completions/max_length": 1311.4, "completions/max_terminated_length": 1105.1, "completions/mean_length": 161.155078125, "completions/mean_terminated_length": 151.70977172851562, "completions/min_length": 63.8, "completions/min_terminated_length": 63.8, "entropy": 0.04569548745639622, "epoch": 22.419700214132764, "frac_reward_zero_std": 0.88125, "grad_norm": 0.232421875, "learning_rate": 8.9531e-06, "loss": -0.0049, "num_tokens": 1052442315.0, "reward": 1.0644336104393006, "reward_std": 0.15789547115564345, "rewards/reward_accuracy/mean": 0.96484375, "rewards/reward_accuracy/std": 0.1560504652559757, "rewards/reward_format/mean": 0.09958984479308128, "rewards/reward_format/std": 0.004011838836595416, "sampling/importance_sampling_ratio/max": 2.632699155807495, "sampling/importance_sampling_ratio/mean": 0.9911126255989074, "sampling/importance_sampling_ratio/min": 0.13308805311098695, "sampling/sampling_logp_difference/max": 0.9740715324878693, "sampling/sampling_logp_difference/mean": 0.004228121507912875, "step": 10470, "step_time": 6.528449485599412 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003125, "completions/max_length": 1343.4, "completions/max_terminated_length": 1020.3, "completions/mean_length": 165.344921875, "completions/mean_terminated_length": 159.48271789550782, "completions/min_length": 66.3, "completions/min_terminated_length": 66.3, "entropy": 0.041809912235476074, "epoch": 22.441113490364025, "frac_reward_zero_std": 0.925, "grad_norm": 0.412109375, "learning_rate": 8.9521e-06, "loss": -0.0008, "num_tokens": 1053386542.0, "reward": 1.0798046946525575, "reward_std": 0.1040661494480446, "rewards/reward_accuracy/mean": 0.980078125, "rewards/reward_accuracy/std": 0.10238381400704384, "rewards/reward_format/mean": 0.09972656294703483, "rewards/reward_format/std": 0.0030180982546880843, "sampling/importance_sampling_ratio/max": 2.3865711212158205, "sampling/importance_sampling_ratio/mean": 0.989032655954361, "sampling/importance_sampling_ratio/min": 0.1360705778002739, "sampling/sampling_logp_difference/max": 1.0297012090682984, "sampling/sampling_logp_difference/mean": 0.0037123041693121195, "step": 10480, "step_time": 6.543625073498697 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0015625, "completions/max_length": 1106.2, "completions/max_terminated_length": 786.3, "completions/mean_length": 142.121875, "completions/mean_terminated_length": 139.14723205566406, "completions/min_length": 61.5, "completions/min_terminated_length": 61.5, "entropy": 0.03471760663669556, "epoch": 22.46252676659529, "frac_reward_zero_std": 0.95, "grad_norm": 0.45703125, "learning_rate": 8.9511e-06, "loss": -0.0048, "num_tokens": 1054272166.0, "reward": 1.0881640791893006, "reward_std": 0.06835267990827561, "rewards/reward_accuracy/mean": 0.98828125, "rewards/reward_accuracy/std": 0.067298324406147, "rewards/reward_format/mean": 0.09988281354308129, "rewards/reward_format/std": 0.001507148751989007, "sampling/importance_sampling_ratio/max": 2.5733180046081543, "sampling/importance_sampling_ratio/mean": 0.9967054486274719, "sampling/importance_sampling_ratio/min": 0.24070340842008592, "sampling/sampling_logp_difference/max": 0.7770016670227051, "sampling/sampling_logp_difference/mean": 0.0035342250717803835, "step": 10490, "step_time": 5.426523691602052 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 1489.5, "completions/max_terminated_length": 1284.9, "completions/mean_length": 151.066015625, "completions/mean_terminated_length": 143.73876342773437, "completions/min_length": 65.2, "completions/min_terminated_length": 65.2, "entropy": 0.042631473229266706, "epoch": 22.483940042826553, "frac_reward_zero_std": 0.9125, "grad_norm": 0.15625, "learning_rate": 8.950100000000001e-06, "loss": -0.0034, "num_tokens": 1055171935.0, "reward": 1.0641601800918579, "reward_std": 0.17064929828047753, "rewards/reward_accuracy/mean": 0.964453125, "rewards/reward_accuracy/std": 0.1689760409295559, "rewards/reward_format/mean": 0.09970703199505807, "rewards/reward_format/std": 0.002786072716116905, "sampling/importance_sampling_ratio/max": 2.4373642086982725, "sampling/importance_sampling_ratio/mean": 0.9998380303382873, "sampling/importance_sampling_ratio/min": 0.09524808079004288, "sampling/sampling_logp_difference/max": 0.9328644394874572, "sampling/sampling_logp_difference/mean": 0.004258635290898383, "step": 10500, "step_time": 6.967206240486121 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005859375, "completions/max_length": 1472.9, "completions/max_terminated_length": 1153.6, "completions/mean_length": 168.634375, "completions/mean_terminated_length": 157.7908203125, "completions/min_length": 68.5, "completions/min_terminated_length": 68.5, "entropy": 0.04535581734962761, "epoch": 22.505353319057814, "frac_reward_zero_std": 0.88125, "grad_norm": 0.53515625, "learning_rate": 8.9491e-06, "loss": -0.0046, "num_tokens": 1056133047.0, "reward": 1.0817187786102296, "reward_std": 0.10667988359928131, "rewards/reward_accuracy/mean": 0.98203125, "rewards/reward_accuracy/std": 0.10503793880343437, "rewards/reward_format/mean": 0.09968750178813934, "rewards/reward_format/std": 0.0029076686827465893, "sampling/importance_sampling_ratio/max": 2.410214161872864, "sampling/importance_sampling_ratio/mean": 0.9833658337593079, "sampling/importance_sampling_ratio/min": 0.1035507284104824, "sampling/sampling_logp_difference/max": 0.7753914535045624, "sampling/sampling_logp_difference/mean": 0.004012914327904582, "step": 10510, "step_time": 7.1358127672981935 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 1258.2, "completions/max_terminated_length": 1079.9, "completions/mean_length": 156.8578125, "completions/mean_terminated_length": 149.5406967163086, "completions/min_length": 67.7, "completions/min_terminated_length": 67.7, "entropy": 0.04009689837694168, "epoch": 22.52676659528908, "frac_reward_zero_std": 0.9, "grad_norm": 0.1572265625, "learning_rate": 8.9481e-06, "loss": -0.0105, "num_tokens": 1057049211.0, "reward": 1.0806054890155792, "reward_std": 0.10351783260703087, "rewards/reward_accuracy/mean": 0.980859375, "rewards/reward_accuracy/std": 0.1023735262453556, "rewards/reward_format/mean": 0.09974609464406967, "rewards/reward_format/std": 0.002772300271317363, "sampling/importance_sampling_ratio/max": 2.2340165615081786, "sampling/importance_sampling_ratio/mean": 0.9784435927867889, "sampling/importance_sampling_ratio/min": 0.11061042579822242, "sampling/sampling_logp_difference/max": 1.0771741271018982, "sampling/sampling_logp_difference/mean": 0.004023193521425128, "step": 10520, "step_time": 6.181916871198337 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005078125, "completions/max_length": 1280.3, "completions/max_terminated_length": 890.8, "completions/mean_length": 154.84921875, "completions/mean_terminated_length": 145.28346557617186, "completions/min_length": 63.2, "completions/min_terminated_length": 63.2, "entropy": 0.03698408573400229, "epoch": 22.548179871520343, "frac_reward_zero_std": 0.9125, "grad_norm": 0.25, "learning_rate": 8.947100000000001e-06, "loss": -0.003, "num_tokens": 1057964393.0, "reward": 1.077793002128601, "reward_std": 0.12142918929457665, "rewards/reward_accuracy/mean": 0.978125, "rewards/reward_accuracy/std": 0.11948045790195465, "rewards/reward_format/mean": 0.09966797083616256, "rewards/reward_format/std": 0.003509897645562887, "sampling/importance_sampling_ratio/max": 2.413894546031952, "sampling/importance_sampling_ratio/mean": 0.9881499350070954, "sampling/importance_sampling_ratio/min": 0.1418574083596468, "sampling/sampling_logp_difference/max": 0.93661128282547, "sampling/sampling_logp_difference/mean": 0.003656682185828686, "step": 10530, "step_time": 6.3699348010064565 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00625, "completions/max_length": 1522.5, "completions/max_terminated_length": 1361.4, "completions/mean_length": 185.362890625, "completions/mean_terminated_length": 173.79906616210937, "completions/min_length": 67.3, "completions/min_terminated_length": 67.3, "entropy": 0.05068251236807555, "epoch": 22.569593147751608, "frac_reward_zero_std": 0.8625, "grad_norm": 0.359375, "learning_rate": 8.9461e-06, "loss": -0.014, "num_tokens": 1058965322.0, "reward": 1.0491211116313934, "reward_std": 0.1762927182018757, "rewards/reward_accuracy/mean": 0.949609375, "rewards/reward_accuracy/std": 0.1740542955696583, "rewards/reward_format/mean": 0.09951172024011612, "rewards/reward_format/std": 0.004919611196964979, "sampling/importance_sampling_ratio/max": 2.4636523723602295, "sampling/importance_sampling_ratio/mean": 0.9861987888813019, "sampling/importance_sampling_ratio/min": 0.08920553885400295, "sampling/sampling_logp_difference/max": 1.1655906438827515, "sampling/sampling_logp_difference/mean": 0.004139188514091075, "step": 10540, "step_time": 7.600504328610259 }, { "clip_ratio/high_max": 4.792767995240865e-05, "clip_ratio/high_mean": 5.9909599940510814e-06, "clip_ratio/low_mean": 1.9023440245291567e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 7.893304018580239e-06, "completions/clipped_ratio": 0.0171875, "completions/max_length": 1701.9, "completions/max_terminated_length": 1463.9, "completions/mean_length": 182.2703125, "completions/mean_terminated_length": 149.64044494628905, "completions/min_length": 60.6, "completions/min_terminated_length": 60.6, "entropy": 0.04620401442516595, "epoch": 22.59100642398287, "frac_reward_zero_std": 0.875, "grad_norm": 0.765625, "learning_rate": 8.945100000000002e-06, "loss": -0.0065, "num_tokens": 1059946238.0, "reward": 1.0450976729393004, "reward_std": 0.2081979736685753, "rewards/reward_accuracy/mean": 0.946484375, "rewards/reward_accuracy/std": 0.20305677205324174, "rewards/reward_format/mean": 0.09861328229308128, "rewards/reward_format/std": 0.008839333173818886, "sampling/importance_sampling_ratio/max": 2.356709384918213, "sampling/importance_sampling_ratio/mean": 0.9853046059608459, "sampling/importance_sampling_ratio/min": 0.08069416992366314, "sampling/sampling_logp_difference/max": 1.0965719938278198, "sampling/sampling_logp_difference/mean": 0.003812933061271906, "step": 10550, "step_time": 8.687383654125734 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.004296875, "completions/max_length": 1685.8, "completions/max_terminated_length": 1358.9, "completions/mean_length": 155.23671875, "completions/mean_terminated_length": 147.09493103027344, "completions/min_length": 70.7, "completions/min_terminated_length": 70.7, "entropy": 0.04380267837550491, "epoch": 22.612419700214133, "frac_reward_zero_std": 0.89375, "grad_norm": 0.4296875, "learning_rate": 8.944100000000001e-06, "loss": -0.0056, "num_tokens": 1060860172.0, "reward": 1.0635156273841857, "reward_std": 0.16671029925346376, "rewards/reward_accuracy/mean": 0.963671875, "rewards/reward_accuracy/std": 0.16595307365059853, "rewards/reward_format/mean": 0.09984375014901162, "rewards/reward_format/std": 0.002260174392722547, "sampling/importance_sampling_ratio/max": 2.6155025959014893, "sampling/importance_sampling_ratio/mean": 0.9880247712135315, "sampling/importance_sampling_ratio/min": 0.11860226448625326, "sampling/sampling_logp_difference/max": 1.1143758177757264, "sampling/sampling_logp_difference/mean": 0.004220760217867792, "step": 10560, "step_time": 7.8509823931875875 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00546875, "completions/max_length": 1448.4, "completions/max_terminated_length": 1153.4, "completions/mean_length": 164.976953125, "completions/mean_terminated_length": 154.76771697998046, "completions/min_length": 67.2, "completions/min_terminated_length": 67.2, "entropy": 0.052213155361823735, "epoch": 22.633832976445397, "frac_reward_zero_std": 0.89375, "grad_norm": 0.439453125, "learning_rate": 8.9431e-06, "loss": -0.0066, "num_tokens": 1061795169.0, "reward": 1.0807226777076722, "reward_std": 0.11457213088870048, "rewards/reward_accuracy/mean": 0.98125, "rewards/reward_accuracy/std": 0.11192523166537285, "rewards/reward_format/mean": 0.0994726575911045, "rewards/reward_format/std": 0.004624573048204184, "sampling/importance_sampling_ratio/max": 2.2993577003479, "sampling/importance_sampling_ratio/mean": 0.9751666784286499, "sampling/importance_sampling_ratio/min": 0.11765687242150306, "sampling/sampling_logp_difference/max": 0.9333246231079102, "sampling/sampling_logp_difference/mean": 0.004433158226311207, "step": 10570, "step_time": 7.115168621015618 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0015625, "completions/max_length": 1234.8, "completions/max_terminated_length": 1048.2, "completions/mean_length": 152.040625, "completions/mean_terminated_length": 149.11402740478516, "completions/min_length": 72.2, "completions/min_terminated_length": 72.2, "entropy": 0.04503780177328735, "epoch": 22.65524625267666, "frac_reward_zero_std": 0.9, "grad_norm": 0.365234375, "learning_rate": 8.9421e-06, "loss": -0.0105, "num_tokens": 1062700409.0, "reward": 1.0662304878234863, "reward_std": 0.1472019411623478, "rewards/reward_accuracy/mean": 0.96640625, "rewards/reward_accuracy/std": 0.14650856480002403, "rewards/reward_format/mean": 0.09982421919703484, "rewards/reward_format/std": 0.0021842264104634523, "sampling/importance_sampling_ratio/max": 2.4223269701004027, "sampling/importance_sampling_ratio/mean": 0.9863190174102783, "sampling/importance_sampling_ratio/min": 0.06986672468483449, "sampling/sampling_logp_difference/max": 1.214803647994995, "sampling/sampling_logp_difference/mean": 0.0040404332336038355, "step": 10580, "step_time": 5.933554852608358 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 1067.4, "completions/max_terminated_length": 924.5, "completions/mean_length": 164.413671875, "completions/mean_terminated_length": 157.19663848876954, "completions/min_length": 61.0, "completions/min_terminated_length": 61.0, "entropy": 0.0424272790318355, "epoch": 22.676659528907923, "frac_reward_zero_std": 0.89375, "grad_norm": 0.427734375, "learning_rate": 8.9411e-06, "loss": -0.003, "num_tokens": 1063638764.0, "reward": 1.0606640815734862, "reward_std": 0.1599855341017246, "rewards/reward_accuracy/mean": 0.9609375, "rewards/reward_accuracy/std": 0.15911196991801263, "rewards/reward_format/mean": 0.0997265636920929, "rewards/reward_format/std": 0.0024893516907468437, "sampling/importance_sampling_ratio/max": 2.437709426879883, "sampling/importance_sampling_ratio/mean": 0.9860654652118683, "sampling/importance_sampling_ratio/min": 0.14708497524261474, "sampling/sampling_logp_difference/max": 0.9004934668540955, "sampling/sampling_logp_difference/mean": 0.0038363582221791147, "step": 10590, "step_time": 5.430878627195488 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005859375, "completions/max_length": 1578.2, "completions/max_terminated_length": 1084.7, "completions/mean_length": 163.326171875, "completions/mean_terminated_length": 152.30887145996093, "completions/min_length": 66.0, "completions/min_terminated_length": 66.0, "entropy": 0.04384330930188298, "epoch": 22.698072805139187, "frac_reward_zero_std": 0.88125, "grad_norm": 0.3515625, "learning_rate": 8.940100000000001e-06, "loss": -0.0005, "num_tokens": 1064570511.0, "reward": 1.0815429925918578, "reward_std": 0.11501546204090118, "rewards/reward_accuracy/mean": 0.98203125, "rewards/reward_accuracy/std": 0.11190463975071907, "rewards/reward_format/mean": 0.09951172024011612, "rewards/reward_format/std": 0.0046477736439555885, "sampling/importance_sampling_ratio/max": 2.5321133136749268, "sampling/importance_sampling_ratio/mean": 0.9795280992984772, "sampling/importance_sampling_ratio/min": 0.15638548508286476, "sampling/sampling_logp_difference/max": 1.134131634235382, "sampling/sampling_logp_difference/mean": 0.004389725858345628, "step": 10600, "step_time": 7.477206595588359 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0015625, "completions/max_length": 1272.0, "completions/max_terminated_length": 1068.9, "completions/mean_length": 153.1859375, "completions/mean_terminated_length": 150.21504745483398, "completions/min_length": 62.4, "completions/min_terminated_length": 62.4, "entropy": 0.04231904742773622, "epoch": 22.719486081370448, "frac_reward_zero_std": 0.91875, "grad_norm": 0.419921875, "learning_rate": 8.9391e-06, "loss": -0.0042, "num_tokens": 1065482939.0, "reward": 1.0596093893051148, "reward_std": 0.15416546941269188, "rewards/reward_accuracy/mean": 0.959765625, "rewards/reward_accuracy/std": 0.1529403656721115, "rewards/reward_format/mean": 0.09984375089406967, "rewards/reward_format/std": 0.0018923229305073618, "sampling/importance_sampling_ratio/max": 2.4520410299301147, "sampling/importance_sampling_ratio/mean": 0.9988929986953735, "sampling/importance_sampling_ratio/min": 0.06440422534942628, "sampling/sampling_logp_difference/max": 0.8976291537284851, "sampling/sampling_logp_difference/mean": 0.004191004438325763, "step": 10610, "step_time": 6.096271226505633 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.000390625, "completions/max_length": 907.5, "completions/max_terminated_length": 822.5, "completions/mean_length": 136.16875, "completions/mean_terminated_length": 135.42128295898436, "completions/min_length": 66.2, "completions/min_terminated_length": 66.2, "entropy": 0.03533289032056928, "epoch": 22.740899357601712, "frac_reward_zero_std": 0.94375, "grad_norm": 0.15625, "learning_rate": 8.9381e-06, "loss": -0.0032, "num_tokens": 1066342779.0, "reward": 1.0753515839576722, "reward_std": 0.12869777381420136, "rewards/reward_accuracy/mean": 0.975390625, "rewards/reward_accuracy/std": 0.12824612781405448, "rewards/reward_format/mean": 0.0999609388411045, "rewards/reward_format/std": 0.0006250000558793544, "sampling/importance_sampling_ratio/max": 2.4577083826065063, "sampling/importance_sampling_ratio/mean": 0.9999989151954651, "sampling/importance_sampling_ratio/min": 0.24122582674026488, "sampling/sampling_logp_difference/max": 0.9629599094390869, "sampling/sampling_logp_difference/mean": 0.0038358719320967793, "step": 10620, "step_time": 4.557758763901075 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001953125, "completions/max_length": 1113.9, "completions/max_terminated_length": 1044.4, "completions/mean_length": 155.64296875, "completions/mean_terminated_length": 151.94654846191406, "completions/min_length": 71.4, "completions/min_terminated_length": 71.4, "entropy": 0.039301906968466936, "epoch": 22.762312633832977, "frac_reward_zero_std": 0.9125, "grad_norm": 0.126953125, "learning_rate": 8.937100000000001e-06, "loss": -0.0066, "num_tokens": 1067263881.0, "reward": 1.077207052707672, "reward_std": 0.11667254865169525, "rewards/reward_accuracy/mean": 0.97734375, "rewards/reward_accuracy/std": 0.11590976566076279, "rewards/reward_format/mean": 0.09986328259110451, "rewards/reward_format/std": 0.0015493134735152126, "sampling/importance_sampling_ratio/max": 2.5786189317703245, "sampling/importance_sampling_ratio/mean": 0.9939113676548004, "sampling/importance_sampling_ratio/min": 0.14166908860206603, "sampling/sampling_logp_difference/max": 1.0521565437316895, "sampling/sampling_logp_difference/mean": 0.003972064913250506, "step": 10630, "step_time": 5.554653104598401 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00078125, "completions/max_length": 1124.8, "completions/max_terminated_length": 945.1, "completions/mean_length": 142.441015625, "completions/mean_terminated_length": 140.95846862792968, "completions/min_length": 66.4, "completions/min_terminated_length": 66.4, "entropy": 0.03655128336977213, "epoch": 22.78372591006424, "frac_reward_zero_std": 0.93125, "grad_norm": 0.337890625, "learning_rate": 8.9361e-06, "loss": 0.0044, "num_tokens": 1068147570.0, "reward": 1.0917578220367432, "reward_std": 0.06517385095357894, "rewards/reward_accuracy/mean": 0.991796875, "rewards/reward_accuracy/std": 0.06485476717352867, "rewards/reward_format/mean": 0.09996093809604645, "rewards/reward_format/std": 0.0006250000093132258, "sampling/importance_sampling_ratio/max": 2.4242687940597536, "sampling/importance_sampling_ratio/mean": 0.9943747162818909, "sampling/importance_sampling_ratio/min": 0.17646422684192659, "sampling/sampling_logp_difference/max": 0.8620517730712891, "sampling/sampling_logp_difference/mean": 0.0038437532028183343, "step": 10640, "step_time": 5.470700686521013 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.008984375, "completions/max_length": 1455.1, "completions/max_terminated_length": 1089.7, "completions/mean_length": 176.36171875, "completions/mean_terminated_length": 159.5897232055664, "completions/min_length": 67.1, "completions/min_terminated_length": 67.1, "entropy": 0.04654333468060941, "epoch": 22.805139186295502, "frac_reward_zero_std": 0.8875, "grad_norm": 0.87890625, "learning_rate": 8.9351e-06, "loss": -0.0112, "num_tokens": 1069117680.0, "reward": 1.0519141018390656, "reward_std": 0.18334302082657813, "rewards/reward_accuracy/mean": 0.952734375, "rewards/reward_accuracy/std": 0.17993892803788186, "rewards/reward_format/mean": 0.09917968958616256, "rewards/reward_format/std": 0.006331449141725898, "sampling/importance_sampling_ratio/max": 2.4785815238952638, "sampling/importance_sampling_ratio/mean": 0.9857713580131531, "sampling/importance_sampling_ratio/min": 0.1243865977972746, "sampling/sampling_logp_difference/max": 1.0328370392322541, "sampling/sampling_logp_difference/mean": 0.00412209655623883, "step": 10650, "step_time": 7.32826694061514 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.008984375, "completions/max_length": 1138.8, "completions/max_terminated_length": 1011.3, "completions/mean_length": 162.075390625, "completions/mean_terminated_length": 145.04583892822265, "completions/min_length": 60.1, "completions/min_terminated_length": 60.1, "entropy": 0.039844889240339396, "epoch": 22.826552462526767, "frac_reward_zero_std": 0.9125, "grad_norm": 0.3828125, "learning_rate": 8.934100000000001e-06, "loss": -0.007, "num_tokens": 1070052641.0, "reward": 1.0718554973602294, "reward_std": 0.13381857499480249, "rewards/reward_accuracy/mean": 0.97265625, "rewards/reward_accuracy/std": 0.1307935245335102, "rewards/reward_format/mean": 0.09919922053813934, "rewards/reward_format/std": 0.0036830145865678785, "sampling/importance_sampling_ratio/max": 2.546419358253479, "sampling/importance_sampling_ratio/mean": 0.9895320236682892, "sampling/importance_sampling_ratio/min": 0.08594542369246483, "sampling/sampling_logp_difference/max": 1.0984715104103089, "sampling/sampling_logp_difference/mean": 0.003935588127933443, "step": 10660, "step_time": 5.8025105264096055 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0046875, "completions/max_length": 1383.4, "completions/max_terminated_length": 1063.8, "completions/mean_length": 162.492578125, "completions/mean_terminated_length": 153.72493438720704, "completions/min_length": 64.2, "completions/min_terminated_length": 64.2, "entropy": 0.043362705316394565, "epoch": 22.84796573875803, "frac_reward_zero_std": 0.925, "grad_norm": 0.0, "learning_rate": 8.933100000000001e-06, "loss": -0.0079, "num_tokens": 1070988126.0, "reward": 1.0538476705551147, "reward_std": 0.1750231258571148, "rewards/reward_accuracy/mean": 0.954296875, "rewards/reward_accuracy/std": 0.17296316251158714, "rewards/reward_format/mean": 0.09955078214406968, "rewards/reward_format/std": 0.004525230592116713, "sampling/importance_sampling_ratio/max": 2.5234028577804564, "sampling/importance_sampling_ratio/mean": 0.9908046066761017, "sampling/importance_sampling_ratio/min": 0.09372127279639245, "sampling/sampling_logp_difference/max": 1.0998252034187317, "sampling/sampling_logp_difference/mean": 0.003974506794475019, "step": 10670, "step_time": 6.900852679199306 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.002734375, "completions/max_length": 950.5, "completions/max_terminated_length": 713.6, "completions/mean_length": 148.514453125, "completions/mean_terminated_length": 143.4026321411133, "completions/min_length": 66.6, "completions/min_terminated_length": 66.6, "entropy": 0.03707460700534284, "epoch": 22.869379014989292, "frac_reward_zero_std": 0.95625, "grad_norm": 0.0, "learning_rate": 8.9321e-06, "loss": 0.0008, "num_tokens": 1071888755.0, "reward": 1.0556054949760436, "reward_std": 0.13176431655883789, "rewards/reward_accuracy/mean": 0.955859375, "rewards/reward_accuracy/std": 0.13050920739769936, "rewards/reward_format/mean": 0.09974609538912774, "rewards/reward_format/std": 0.0025652997195720673, "sampling/importance_sampling_ratio/max": 2.4223843455314635, "sampling/importance_sampling_ratio/mean": 0.982615303993225, "sampling/importance_sampling_ratio/min": 0.11160962618887424, "sampling/sampling_logp_difference/max": 1.0317458987236023, "sampling/sampling_logp_difference/mean": 0.003734084218740463, "step": 10680, "step_time": 4.8809747330000395 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00703125, "completions/max_length": 1831.3, "completions/max_terminated_length": 1551.6, "completions/mean_length": 175.358203125, "completions/mean_terminated_length": 162.13380737304686, "completions/min_length": 71.4, "completions/min_terminated_length": 71.4, "entropy": 0.04677093895152211, "epoch": 22.890792291220556, "frac_reward_zero_std": 0.89375, "grad_norm": 0.388671875, "learning_rate": 8.9311e-06, "loss": -0.0095, "num_tokens": 1072865224.0, "reward": 1.0696679949760437, "reward_std": 0.15558312013745307, "rewards/reward_accuracy/mean": 0.9703125, "rewards/reward_accuracy/std": 0.1524782732129097, "rewards/reward_format/mean": 0.09935547113418579, "rewards/reward_format/std": 0.006051847734488547, "sampling/importance_sampling_ratio/max": 2.430281627178192, "sampling/importance_sampling_ratio/mean": 0.9889843106269837, "sampling/importance_sampling_ratio/min": 0.09648353084921837, "sampling/sampling_logp_difference/max": 0.888342022895813, "sampling/sampling_logp_difference/mean": 0.004009679309092462, "step": 10690, "step_time": 8.730766126405797 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.002734375, "completions/max_length": 966.4, "completions/max_terminated_length": 829.5, "completions/mean_length": 148.235546875, "completions/mean_terminated_length": 143.06665954589843, "completions/min_length": 65.3, "completions/min_terminated_length": 65.3, "entropy": 0.037599802808836104, "epoch": 22.91220556745182, "frac_reward_zero_std": 0.94375, "grad_norm": 0.462890625, "learning_rate": 8.930100000000001e-06, "loss": -0.0028, "num_tokens": 1073765907.0, "reward": 1.065878939628601, "reward_std": 0.16323170065879822, "rewards/reward_accuracy/mean": 0.966015625, "rewards/reward_accuracy/std": 0.1626071184873581, "rewards/reward_format/mean": 0.09986328333616257, "rewards/reward_format/std": 0.0014606342650949956, "sampling/importance_sampling_ratio/max": 2.4791799783706665, "sampling/importance_sampling_ratio/mean": 0.9857929944992065, "sampling/importance_sampling_ratio/min": 0.1836682677268982, "sampling/sampling_logp_difference/max": 0.8821262001991272, "sampling/sampling_logp_difference/mean": 0.003786496492102742, "step": 10700, "step_time": 4.912866774894065 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.008203125, "completions/max_length": 1239.8, "completions/max_terminated_length": 1015.1, "completions/mean_length": 163.96640625, "completions/mean_terminated_length": 148.6121337890625, "completions/min_length": 64.2, "completions/min_terminated_length": 64.2, "entropy": 0.04425995934288949, "epoch": 22.933618843683085, "frac_reward_zero_std": 0.9375, "grad_norm": 0.0, "learning_rate": 8.9291e-06, "loss": -0.0013, "num_tokens": 1074705181.0, "reward": 1.0592578291893004, "reward_std": 0.15588981434702873, "rewards/reward_accuracy/mean": 0.959765625, "rewards/reward_accuracy/std": 0.1534558765590191, "rewards/reward_format/mean": 0.09949218854308128, "rewards/reward_format/std": 0.004400196392089129, "sampling/importance_sampling_ratio/max": 2.448260474205017, "sampling/importance_sampling_ratio/mean": 1.0086495101451873, "sampling/importance_sampling_ratio/min": 0.17240044772624968, "sampling/sampling_logp_difference/max": 0.9306323051452636, "sampling/sampling_logp_difference/mean": 0.00400047660805285, "step": 10710, "step_time": 6.539861790410941 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00234375, "completions/max_length": 1466.7, "completions/max_terminated_length": 1152.7, "completions/mean_length": 151.998828125, "completions/mean_terminated_length": 147.58528594970704, "completions/min_length": 66.5, "completions/min_terminated_length": 66.5, "entropy": 0.04090048619545996, "epoch": 22.955032119914346, "frac_reward_zero_std": 0.90625, "grad_norm": 0.1396484375, "learning_rate": 8.9281e-06, "loss": -0.0038, "num_tokens": 1075614282.0, "reward": 1.0521093785762787, "reward_std": 0.17059227600693702, "rewards/reward_accuracy/mean": 0.95234375, "rewards/reward_accuracy/std": 0.16975196227431297, "rewards/reward_format/mean": 0.09976562485098839, "rewards/reward_format/std": 0.002618335303850472, "sampling/importance_sampling_ratio/max": 2.476633644104004, "sampling/importance_sampling_ratio/mean": 0.9913712918758393, "sampling/importance_sampling_ratio/min": 0.1221240708604455, "sampling/sampling_logp_difference/max": 1.0656168580055236, "sampling/sampling_logp_difference/mean": 0.003797488287091255, "step": 10720, "step_time": 7.092312386611593 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0046875, "completions/max_length": 1197.5, "completions/max_terminated_length": 966.3, "completions/mean_length": 148.234375, "completions/mean_terminated_length": 139.4390869140625, "completions/min_length": 64.9, "completions/min_terminated_length": 64.9, "entropy": 0.04095057614613325, "epoch": 22.97644539614561, "frac_reward_zero_std": 0.93125, "grad_norm": 0.0, "learning_rate": 8.927100000000001e-06, "loss": -0.0032, "num_tokens": 1076509378.0, "reward": 1.0559375166893006, "reward_std": 0.13586502522230148, "rewards/reward_accuracy/mean": 0.95625, "rewards/reward_accuracy/std": 0.13442325517535209, "rewards/reward_format/mean": 0.09968750104308129, "rewards/reward_format/std": 0.0035027997801080346, "sampling/importance_sampling_ratio/max": 2.4003563284873963, "sampling/importance_sampling_ratio/mean": 1.0003639340400696, "sampling/importance_sampling_ratio/min": 0.14885502844117582, "sampling/sampling_logp_difference/max": 0.823220407962799, "sampling/sampling_logp_difference/mean": 0.0038819076726213098, "step": 10730, "step_time": 6.055394358499325 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 1088.3, "completions/max_terminated_length": 875.5, "completions/mean_length": 158.551953125, "completions/mean_terminated_length": 151.15872344970703, "completions/min_length": 64.2, "completions/min_terminated_length": 64.2, "entropy": 0.040850417432375254, "epoch": 22.997858672376875, "frac_reward_zero_std": 0.925, "grad_norm": 0.51953125, "learning_rate": 8.9261e-06, "loss": -0.0007, "num_tokens": 1077431127.0, "reward": 1.0716406464576722, "reward_std": 0.12731495425105094, "rewards/reward_accuracy/mean": 0.971875, "rewards/reward_accuracy/std": 0.12644631117582322, "rewards/reward_format/mean": 0.0997656263411045, "rewards/reward_format/std": 0.002252799575217068, "sampling/importance_sampling_ratio/max": 2.529621148109436, "sampling/importance_sampling_ratio/mean": 0.9946456015110016, "sampling/importance_sampling_ratio/min": 0.10758968703448772, "sampling/sampling_logp_difference/max": 1.111505663394928, "sampling/sampling_logp_difference/mean": 0.003850431554019451, "step": 10740, "step_time": 5.58665448500542 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003515625, "completions/max_length": 1070.0, "completions/max_terminated_length": 863.5, "completions/mean_length": 156.3984375, "completions/mean_terminated_length": 149.8407745361328, "completions/min_length": 61.6, "completions/min_terminated_length": 61.6, "entropy": 0.03840343689080328, "epoch": 23.019271948608136, "frac_reward_zero_std": 0.925, "grad_norm": 0.390625, "learning_rate": 8.9251e-06, "loss": -0.0042, "num_tokens": 1078353347.0, "reward": 1.0872460961341859, "reward_std": 0.06646900058258325, "rewards/reward_accuracy/mean": 0.9875, "rewards/reward_accuracy/std": 0.06552586033940315, "rewards/reward_format/mean": 0.09974609389901161, "rewards/reward_format/std": 0.002251429087482393, "sampling/importance_sampling_ratio/max": 2.3816129088401796, "sampling/importance_sampling_ratio/mean": 0.9832936286926269, "sampling/importance_sampling_ratio/min": 0.12299885898828507, "sampling/sampling_logp_difference/max": 0.9239485263824463, "sampling/sampling_logp_difference/mean": 0.0038286619121208785, "step": 10750, "step_time": 5.347299147205194 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 1311.1, "completions/max_terminated_length": 1069.8, "completions/mean_length": 154.944921875, "completions/mean_terminated_length": 147.5486618041992, "completions/min_length": 63.5, "completions/min_terminated_length": 63.5, "entropy": 0.03858965369872749, "epoch": 23.0406852248394, "frac_reward_zero_std": 0.93125, "grad_norm": 0.08056640625, "learning_rate": 8.924100000000002e-06, "loss": -0.002, "num_tokens": 1079262886.0, "reward": 1.0649023711681367, "reward_std": 0.12780620902776718, "rewards/reward_accuracy/mean": 0.965234375, "rewards/reward_accuracy/std": 0.1262848362326622, "rewards/reward_format/mean": 0.09966797083616256, "rewards/reward_format/std": 0.003788912668824196, "sampling/importance_sampling_ratio/max": 2.3632460594177247, "sampling/importance_sampling_ratio/mean": 0.9876944899559021, "sampling/importance_sampling_ratio/min": 0.14211977422237396, "sampling/sampling_logp_difference/max": 1.0563117027282716, "sampling/sampling_logp_difference/mean": 0.003632570221088827, "step": 10760, "step_time": 6.425511035593809 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.004296875, "completions/max_length": 1569.3, "completions/max_terminated_length": 1362.1, "completions/mean_length": 159.93828125, "completions/mean_terminated_length": 151.7944190979004, "completions/min_length": 66.6, "completions/min_terminated_length": 66.6, "entropy": 0.03978703054599464, "epoch": 23.062098501070665, "frac_reward_zero_std": 0.9375, "grad_norm": 0.072265625, "learning_rate": 8.923100000000001e-06, "loss": -0.0034, "num_tokens": 1080187800.0, "reward": 1.079785168170929, "reward_std": 0.10813510522712022, "rewards/reward_accuracy/mean": 0.980078125, "rewards/reward_accuracy/std": 0.10616957992315293, "rewards/reward_format/mean": 0.09970703199505807, "rewards/reward_format/std": 0.0031409486662596466, "sampling/importance_sampling_ratio/max": 2.3175467610359193, "sampling/importance_sampling_ratio/mean": 0.9908424377441406, "sampling/importance_sampling_ratio/min": 0.06944947633892298, "sampling/sampling_logp_difference/max": 1.1005295515060425, "sampling/sampling_logp_difference/mean": 0.0038515626452863216, "step": 10770, "step_time": 7.45757361878932 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005078125, "completions/max_length": 1387.7, "completions/max_terminated_length": 1332.5, "completions/mean_length": 157.13515625, "completions/mean_terminated_length": 147.55436248779296, "completions/min_length": 64.9, "completions/min_terminated_length": 64.9, "entropy": 0.043551987339742484, "epoch": 23.083511777301926, "frac_reward_zero_std": 0.91875, "grad_norm": 0.0, "learning_rate": 8.9221e-06, "loss": -0.01, "num_tokens": 1081103906.0, "reward": 1.0777929782867433, "reward_std": 0.12423092126846313, "rewards/reward_accuracy/mean": 0.978125, "rewards/reward_accuracy/std": 0.1226457990705967, "rewards/reward_format/mean": 0.09966796934604645, "rewards/reward_format/std": 0.0029035751475021245, "sampling/importance_sampling_ratio/max": 2.2845808267593384, "sampling/importance_sampling_ratio/mean": 0.9881495714187623, "sampling/importance_sampling_ratio/min": 0.10911577306687832, "sampling/sampling_logp_difference/max": 0.9499104022979736, "sampling/sampling_logp_difference/mean": 0.004066437552683056, "step": 10780, "step_time": 6.90393098119821 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.004296875, "completions/max_length": 976.2, "completions/max_terminated_length": 907.8, "completions/mean_length": 152.848828125, "completions/mean_terminated_length": 144.83525390625, "completions/min_length": 66.9, "completions/min_terminated_length": 66.9, "entropy": 0.038922880915924905, "epoch": 23.10492505353319, "frac_reward_zero_std": 0.95, "grad_norm": 0.2333984375, "learning_rate": 8.9211e-06, "loss": -0.0027, "num_tokens": 1082016415.0, "reward": 1.074804711341858, "reward_std": 0.11794127821922303, "rewards/reward_accuracy/mean": 0.975, "rewards/reward_accuracy/std": 0.11696624606847764, "rewards/reward_format/mean": 0.09980468899011612, "rewards/reward_format/std": 0.0018412381410598754, "sampling/importance_sampling_ratio/max": 2.5297925233840943, "sampling/importance_sampling_ratio/mean": 0.9819395363330841, "sampling/importance_sampling_ratio/min": 0.18938303347676994, "sampling/sampling_logp_difference/max": 0.926686143875122, "sampling/sampling_logp_difference/mean": 0.003976716613397002, "step": 10790, "step_time": 5.079423634009435 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00625, "completions/max_length": 1601.9, "completions/max_terminated_length": 1200.1, "completions/mean_length": 170.074609375, "completions/mean_terminated_length": 158.28963470458984, "completions/min_length": 67.6, "completions/min_terminated_length": 67.6, "entropy": 0.04574004437308758, "epoch": 23.126338329764454, "frac_reward_zero_std": 0.89375, "grad_norm": 0.40234375, "learning_rate": 8.920100000000001e-06, "loss": -0.0062, "num_tokens": 1082967646.0, "reward": 1.0624023735523225, "reward_std": 0.14170069128740578, "rewards/reward_accuracy/mean": 0.962890625, "rewards/reward_accuracy/std": 0.13918514028191567, "rewards/reward_format/mean": 0.09951172098517418, "rewards/reward_format/std": 0.004944381304085255, "sampling/importance_sampling_ratio/max": 2.4776118755340577, "sampling/importance_sampling_ratio/mean": 0.9835100173950195, "sampling/importance_sampling_ratio/min": 0.07198480237275362, "sampling/sampling_logp_difference/max": 1.115980863571167, "sampling/sampling_logp_difference/mean": 0.004087671055458486, "step": 10800, "step_time": 7.695896506018471 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00078125, "completions/max_length": 1085.4, "completions/max_terminated_length": 956.4, "completions/mean_length": 150.569140625, "completions/mean_terminated_length": 149.0955047607422, "completions/min_length": 68.0, "completions/min_terminated_length": 68.0, "entropy": 0.038257134472951294, "epoch": 23.14775160599572, "frac_reward_zero_std": 0.91875, "grad_norm": 0.0, "learning_rate": 8.9191e-06, "loss": -0.004, "num_tokens": 1083864799.0, "reward": 1.0725976824760437, "reward_std": 0.11462055221199989, "rewards/reward_accuracy/mean": 0.97265625, "rewards/reward_accuracy/std": 0.11423055678606034, "rewards/reward_format/mean": 0.09994140788912773, "rewards/reward_format/std": 0.0006976742763072253, "sampling/importance_sampling_ratio/max": 2.365223431587219, "sampling/importance_sampling_ratio/mean": 0.9788910567760467, "sampling/importance_sampling_ratio/min": 0.15448665618896484, "sampling/sampling_logp_difference/max": 0.9571831226348877, "sampling/sampling_logp_difference/mean": 0.0038404559018090367, "step": 10810, "step_time": 5.204239920701366 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00234375, "completions/max_length": 887.6, "completions/max_terminated_length": 694.0, "completions/mean_length": 144.94296875, "completions/mean_terminated_length": 140.51983184814452, "completions/min_length": 64.2, "completions/min_terminated_length": 64.2, "entropy": 0.03942033876664937, "epoch": 23.16916488222698, "frac_reward_zero_std": 0.9375, "grad_norm": 0.357421875, "learning_rate": 8.9181e-06, "loss": -0.0006, "num_tokens": 1084756797.0, "reward": 1.086132824420929, "reward_std": 0.09124622493982315, "rewards/reward_accuracy/mean": 0.986328125, "rewards/reward_accuracy/std": 0.09043559432029724, "rewards/reward_format/mean": 0.09980468824505806, "rewards/reward_format/std": 0.0020581001648679377, "sampling/importance_sampling_ratio/max": 2.3013423681259155, "sampling/importance_sampling_ratio/mean": 0.9712607026100158, "sampling/importance_sampling_ratio/min": 0.08778598755598069, "sampling/sampling_logp_difference/max": 1.2404415011405945, "sampling/sampling_logp_difference/mean": 0.0039729527197778225, "step": 10820, "step_time": 4.96229062389757 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00625, "completions/max_length": 1629.1, "completions/max_terminated_length": 1403.1, "completions/mean_length": 179.711328125, "completions/mean_terminated_length": 168.13966598510743, "completions/min_length": 63.3, "completions/min_terminated_length": 63.3, "entropy": 0.05048826588317752, "epoch": 23.190578158458244, "frac_reward_zero_std": 0.86875, "grad_norm": 0.451171875, "learning_rate": 8.917100000000001e-06, "loss": -0.0086, "num_tokens": 1085738906.0, "reward": 1.0615429759025574, "reward_std": 0.16554950773715973, "rewards/reward_accuracy/mean": 0.962109375, "rewards/reward_accuracy/std": 0.16352660953998566, "rewards/reward_format/mean": 0.09943359494209289, "rewards/reward_format/std": 0.004648353136144578, "sampling/importance_sampling_ratio/max": 2.3900372982025146, "sampling/importance_sampling_ratio/mean": 0.9782253324985504, "sampling/importance_sampling_ratio/min": 0.034391114860773085, "sampling/sampling_logp_difference/max": 0.991605281829834, "sampling/sampling_logp_difference/mean": 0.004209560551680624, "step": 10830, "step_time": 7.824285765117383 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001953125, "completions/max_length": 1266.8, "completions/max_terminated_length": 817.4, "completions/mean_length": 144.589453125, "completions/mean_terminated_length": 140.8711181640625, "completions/min_length": 63.8, "completions/min_terminated_length": 63.8, "entropy": 0.036543356417678294, "epoch": 23.21199143468951, "frac_reward_zero_std": 0.94375, "grad_norm": 0.1630859375, "learning_rate": 8.916100000000001e-06, "loss": -0.0089, "num_tokens": 1086625375.0, "reward": 1.086679708957672, "reward_std": 0.08470564633607865, "rewards/reward_accuracy/mean": 0.98671875, "rewards/reward_accuracy/std": 0.08408064916729927, "rewards/reward_format/mean": 0.0999609388411045, "rewards/reward_format/std": 0.0006250000558793544, "sampling/importance_sampling_ratio/max": 2.4147802591323853, "sampling/importance_sampling_ratio/mean": 0.9928894877433777, "sampling/importance_sampling_ratio/min": 0.09999929443001747, "sampling/sampling_logp_difference/max": 1.0244981288909911, "sampling/sampling_logp_difference/mean": 0.0038720491575077176, "step": 10840, "step_time": 6.02175260767981 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00234375, "completions/max_length": 1332.3, "completions/max_terminated_length": 1059.5, "completions/mean_length": 152.240625, "completions/mean_terminated_length": 147.8413070678711, "completions/min_length": 63.1, "completions/min_terminated_length": 63.1, "entropy": 0.03919440086465329, "epoch": 23.23340471092077, "frac_reward_zero_std": 0.925, "grad_norm": 0.2470703125, "learning_rate": 8.9151e-06, "loss": -0.0062, "num_tokens": 1087527335.0, "reward": 1.0603320479393006, "reward_std": 0.16855397447943687, "rewards/reward_accuracy/mean": 0.960546875, "rewards/reward_accuracy/std": 0.16740190610289574, "rewards/reward_format/mean": 0.09978515729308128, "rewards/reward_format/std": 0.0029578487621620296, "sampling/importance_sampling_ratio/max": 2.616542935371399, "sampling/importance_sampling_ratio/mean": 0.9761627972126007, "sampling/importance_sampling_ratio/min": 0.15474732145667075, "sampling/sampling_logp_difference/max": 0.9681435286998749, "sampling/sampling_logp_difference/mean": 0.0038269149838015435, "step": 10850, "step_time": 6.417382313217968 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00546875, "completions/max_length": 1601.0, "completions/max_terminated_length": 1466.0, "completions/mean_length": 174.72890625, "completions/mean_terminated_length": 164.52031555175782, "completions/min_length": 66.3, "completions/min_terminated_length": 66.3, "entropy": 0.043208601395599545, "epoch": 23.254817987152034, "frac_reward_zero_std": 0.9125, "grad_norm": 0.228515625, "learning_rate": 8.914100000000002e-06, "loss": -0.0108, "num_tokens": 1088500817.0, "reward": 1.056914085149765, "reward_std": 0.1728774130344391, "rewards/reward_accuracy/mean": 0.957421875, "rewards/reward_accuracy/std": 0.17047596275806426, "rewards/reward_format/mean": 0.0994921900331974, "rewards/reward_format/std": 0.004620881378650665, "sampling/importance_sampling_ratio/max": 2.492960739135742, "sampling/importance_sampling_ratio/mean": 0.9805504262447358, "sampling/importance_sampling_ratio/min": 0.07485727332532406, "sampling/sampling_logp_difference/max": 0.8482987403869628, "sampling/sampling_logp_difference/mean": 0.0038854712154716255, "step": 10860, "step_time": 7.583331999718212 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.002734375, "completions/max_length": 1209.6, "completions/max_terminated_length": 1178.7, "completions/mean_length": 153.9125, "completions/mean_terminated_length": 148.80459747314453, "completions/min_length": 63.2, "completions/min_terminated_length": 63.2, "entropy": 0.03893164261244238, "epoch": 23.2762312633833, "frac_reward_zero_std": 0.9, "grad_norm": 0.41796875, "learning_rate": 8.913100000000001e-06, "loss": -0.0099, "num_tokens": 1089406977.0, "reward": 1.0704883098602296, "reward_std": 0.13532194569706918, "rewards/reward_accuracy/mean": 0.970703125, "rewards/reward_accuracy/std": 0.13434977754950522, "rewards/reward_format/mean": 0.09978515729308128, "rewards/reward_format/std": 0.002153738238848746, "sampling/importance_sampling_ratio/max": 2.376233148574829, "sampling/importance_sampling_ratio/mean": 0.9884368479251862, "sampling/importance_sampling_ratio/min": 0.19336889870464802, "sampling/sampling_logp_difference/max": 0.8524165868759155, "sampling/sampling_logp_difference/mean": 0.0037359279114753006, "step": 10870, "step_time": 5.798978788405657 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00703125, "completions/max_length": 1583.7, "completions/max_terminated_length": 1188.3, "completions/mean_length": 180.220703125, "completions/mean_terminated_length": 167.35823974609374, "completions/min_length": 63.9, "completions/min_terminated_length": 63.9, "entropy": 0.05016585034318268, "epoch": 23.29764453961456, "frac_reward_zero_std": 0.925, "grad_norm": 0.08056640625, "learning_rate": 8.9121e-06, "loss": -0.0053, "num_tokens": 1090383958.0, "reward": 1.0646093964576722, "reward_std": 0.13988770619034768, "rewards/reward_accuracy/mean": 0.965234375, "rewards/reward_accuracy/std": 0.13745709508657455, "rewards/reward_format/mean": 0.09937500134110451, "rewards/reward_format/std": 0.004620500607416034, "sampling/importance_sampling_ratio/max": 2.4291008949279784, "sampling/importance_sampling_ratio/mean": 0.979663610458374, "sampling/importance_sampling_ratio/min": 0.1186062466353178, "sampling/sampling_logp_difference/max": 1.06727414727211, "sampling/sampling_logp_difference/mean": 0.004154702695086598, "step": 10880, "step_time": 7.887443607489695 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00703125, "completions/max_length": 1414.9, "completions/max_terminated_length": 1213.2, "completions/mean_length": 164.414453125, "completions/mean_terminated_length": 151.13365325927734, "completions/min_length": 65.0, "completions/min_terminated_length": 65.0, "entropy": 0.04822918646968901, "epoch": 23.319057815845824, "frac_reward_zero_std": 0.91875, "grad_norm": 0.0, "learning_rate": 8.9111e-06, "loss": -0.0023, "num_tokens": 1091322779.0, "reward": 1.0667773604393005, "reward_std": 0.13362879827618598, "rewards/reward_accuracy/mean": 0.9671875, "rewards/reward_accuracy/std": 0.13190170451998712, "rewards/reward_format/mean": 0.09958984479308128, "rewards/reward_format/std": 0.004175769677385688, "sampling/importance_sampling_ratio/max": 2.3532623052597046, "sampling/importance_sampling_ratio/mean": 0.9907898306846619, "sampling/importance_sampling_ratio/min": 0.1480512298643589, "sampling/sampling_logp_difference/max": 0.999416708946228, "sampling/sampling_logp_difference/mean": 0.004075677576474845, "step": 10890, "step_time": 7.021890271391021 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001171875, "completions/max_length": 1121.2, "completions/max_terminated_length": 1097.4, "completions/mean_length": 148.54140625, "completions/mean_terminated_length": 146.33791961669922, "completions/min_length": 69.6, "completions/min_terminated_length": 69.6, "entropy": 0.03818531152792275, "epoch": 23.340471092077088, "frac_reward_zero_std": 0.9375, "grad_norm": 0.12890625, "learning_rate": 8.9101e-06, "loss": 0.0029, "num_tokens": 1092221941.0, "reward": 1.0623437821865083, "reward_std": 0.14776523932814598, "rewards/reward_accuracy/mean": 0.9625, "rewards/reward_accuracy/std": 0.1471736826002598, "rewards/reward_format/mean": 0.09984375163912773, "rewards/reward_format/std": 0.0017731342697516084, "sampling/importance_sampling_ratio/max": 2.4038988828659056, "sampling/importance_sampling_ratio/mean": 0.985241687297821, "sampling/importance_sampling_ratio/min": 0.10154645517468452, "sampling/sampling_logp_difference/max": 1.0211077988147736, "sampling/sampling_logp_difference/mean": 0.003983186627738178, "step": 10900, "step_time": 5.529207691192278 }, { "clip_ratio/high_max": 2.0495162971201353e-06, "clip_ratio/high_mean": 2.561895371400169e-07, "clip_ratio/low_mean": 2.561895371400169e-07, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 5.123790742800338e-07, "completions/clipped_ratio": 0.00703125, "completions/max_length": 1430.9, "completions/max_terminated_length": 1363.4, "completions/mean_length": 166.530859375, "completions/mean_terminated_length": 153.43600463867188, "completions/min_length": 59.4, "completions/min_terminated_length": 59.4, "entropy": 0.04823767566122115, "epoch": 23.361884368308353, "frac_reward_zero_std": 0.9, "grad_norm": 0.0, "learning_rate": 8.9091e-06, "loss": -0.0025, "num_tokens": 1093162484.0, "reward": 1.0553906381130218, "reward_std": 0.17975931614637375, "rewards/reward_accuracy/mean": 0.955859375, "rewards/reward_accuracy/std": 0.17790045887231826, "rewards/reward_format/mean": 0.09953124970197677, "rewards/reward_format/std": 0.0038511776132509113, "sampling/importance_sampling_ratio/max": 2.4673697471618654, "sampling/importance_sampling_ratio/mean": 0.9813957214355469, "sampling/importance_sampling_ratio/min": 0.09981561396270991, "sampling/sampling_logp_difference/max": 0.892678290605545, "sampling/sampling_logp_difference/mean": 0.00421724917832762, "step": 10910, "step_time": 7.118615771594341 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.007421875, "completions/max_length": 1772.5, "completions/max_terminated_length": 1583.3, "completions/mean_length": 183.406640625, "completions/mean_terminated_length": 169.52445373535156, "completions/min_length": 67.6, "completions/min_terminated_length": 67.6, "entropy": 0.047796660521999004, "epoch": 23.383297644539613, "frac_reward_zero_std": 0.9, "grad_norm": 0.376953125, "learning_rate": 8.9081e-06, "loss": -0.0054, "num_tokens": 1094153397.0, "reward": 1.0391992449760437, "reward_std": 0.22241268008947374, "rewards/reward_accuracy/mean": 0.93984375, "rewards/reward_accuracy/std": 0.2200958698987961, "rewards/reward_format/mean": 0.09935547038912773, "rewards/reward_format/std": 0.005097488965839147, "sampling/importance_sampling_ratio/max": 2.473501992225647, "sampling/importance_sampling_ratio/mean": 0.9846067428588867, "sampling/importance_sampling_ratio/min": 0.06851065363734961, "sampling/sampling_logp_difference/max": 0.9137670040130615, "sampling/sampling_logp_difference/mean": 0.004217420145869255, "step": 10920, "step_time": 8.734964791793027 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0015625, "completions/max_length": 1570.8, "completions/max_terminated_length": 1220.4, "completions/mean_length": 151.357421875, "completions/mean_terminated_length": 148.39171142578124, "completions/min_length": 62.2, "completions/min_terminated_length": 62.2, "entropy": 0.039173580170609054, "epoch": 23.404710920770878, "frac_reward_zero_std": 0.94375, "grad_norm": 0.0, "learning_rate": 8.907100000000002e-06, "loss": -0.0071, "num_tokens": 1095058440.0, "reward": 1.0752734541893005, "reward_std": 0.11650098711252213, "rewards/reward_accuracy/mean": 0.975390625, "rewards/reward_accuracy/std": 0.11580890119075775, "rewards/reward_format/mean": 0.09988281354308129, "rewards/reward_format/std": 0.0014512486523017287, "sampling/importance_sampling_ratio/max": 2.447936475276947, "sampling/importance_sampling_ratio/mean": 0.986094731092453, "sampling/importance_sampling_ratio/min": 0.09639663547277451, "sampling/sampling_logp_difference/max": 0.9480867505073547, "sampling/sampling_logp_difference/mean": 0.003910442511551082, "step": 10930, "step_time": 7.296908667602111 }, { "clip_ratio/high_max": 1.604878780199215e-05, "clip_ratio/high_mean": 2.0060984752490186e-06, "clip_ratio/low_mean": 2.695865555324417e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 4.701964144260273e-06, "completions/clipped_ratio": 0.00546875, "completions/max_length": 1147.7, "completions/max_terminated_length": 1133.2, "completions/mean_length": 158.15078125, "completions/mean_terminated_length": 147.79278411865235, "completions/min_length": 67.6, "completions/min_terminated_length": 67.6, "entropy": 0.0404604691779241, "epoch": 23.426124197002142, "frac_reward_zero_std": 0.93125, "grad_norm": 0.345703125, "learning_rate": 8.906100000000001e-06, "loss": -0.0062, "num_tokens": 1095987466.0, "reward": 1.0765039324760437, "reward_std": 0.11481446549296379, "rewards/reward_accuracy/mean": 0.976953125, "rewards/reward_accuracy/std": 0.1130295068025589, "rewards/reward_format/mean": 0.09955078288912773, "rewards/reward_format/std": 0.0025877282954752446, "sampling/importance_sampling_ratio/max": 2.526186490058899, "sampling/importance_sampling_ratio/mean": 0.983789575099945, "sampling/importance_sampling_ratio/min": 0.14546271711587905, "sampling/sampling_logp_difference/max": 0.9572840452194213, "sampling/sampling_logp_difference/mean": 0.00388468261808157, "step": 10940, "step_time": 5.888989588193363 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00234375, "completions/max_length": 1075.1, "completions/max_terminated_length": 979.1, "completions/mean_length": 160.60078125, "completions/mean_terminated_length": 156.2339599609375, "completions/min_length": 61.5, "completions/min_terminated_length": 61.5, "entropy": 0.0464666236191988, "epoch": 23.447537473233403, "frac_reward_zero_std": 0.9, "grad_norm": 0.0, "learning_rate": 8.9051e-06, "loss": -0.0019, "num_tokens": 1096912812.0, "reward": 1.070878928899765, "reward_std": 0.1293273739516735, "rewards/reward_accuracy/mean": 0.97109375, "rewards/reward_accuracy/std": 0.12787596136331558, "rewards/reward_format/mean": 0.09978515654802322, "rewards/reward_format/std": 0.002809226466342807, "sampling/importance_sampling_ratio/max": 2.5104976892471313, "sampling/importance_sampling_ratio/mean": 0.9785624563694, "sampling/importance_sampling_ratio/min": 0.10366839617490768, "sampling/sampling_logp_difference/max": 1.0844203233718872, "sampling/sampling_logp_difference/mean": 0.00421791214030236, "step": 10950, "step_time": 5.52448411580699 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003125, "completions/max_length": 1345.5, "completions/max_terminated_length": 1050.5, "completions/mean_length": 153.190234375, "completions/mean_terminated_length": 147.288134765625, "completions/min_length": 67.4, "completions/min_terminated_length": 67.4, "entropy": 0.039204456261359155, "epoch": 23.468950749464668, "frac_reward_zero_std": 0.90625, "grad_norm": 0.439453125, "learning_rate": 8.904100000000002e-06, "loss": 0.004, "num_tokens": 1097828883.0, "reward": 1.059082043170929, "reward_std": 0.1676092892885208, "rewards/reward_accuracy/mean": 0.959375, "rewards/reward_accuracy/std": 0.1659950003027916, "rewards/reward_format/mean": 0.09970703199505807, "rewards/reward_format/std": 0.0029011272126808763, "sampling/importance_sampling_ratio/max": 2.4927356004714967, "sampling/importance_sampling_ratio/mean": 0.9915771603584289, "sampling/importance_sampling_ratio/min": 0.22791349459439517, "sampling/sampling_logp_difference/max": 0.9134122252464294, "sampling/sampling_logp_difference/mean": 0.0038418916519731283, "step": 10960, "step_time": 6.377705751403118 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003515625, "completions/max_length": 1366.9, "completions/max_terminated_length": 1160.3, "completions/mean_length": 161.371484375, "completions/mean_terminated_length": 154.7718276977539, "completions/min_length": 68.9, "completions/min_terminated_length": 68.9, "entropy": 0.037138220435008404, "epoch": 23.490364025695932, "frac_reward_zero_std": 0.9, "grad_norm": 0.74609375, "learning_rate": 8.903100000000001e-06, "loss": 0.0007, "num_tokens": 1098767322.0, "reward": 1.0673242330551147, "reward_std": 0.14155592098832132, "rewards/reward_accuracy/mean": 0.967578125, "rewards/reward_accuracy/std": 0.14008449614048005, "rewards/reward_format/mean": 0.09974609464406967, "rewards/reward_format/std": 0.0025289240293204784, "sampling/importance_sampling_ratio/max": 2.406995344161987, "sampling/importance_sampling_ratio/mean": 0.9956981658935546, "sampling/importance_sampling_ratio/min": 0.1746007665991783, "sampling/sampling_logp_difference/max": 1.0382378458976746, "sampling/sampling_logp_difference/mean": 0.003798506478779018, "step": 10970, "step_time": 6.6131220785871845 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 996.4, "completions/max_terminated_length": 894.7, "completions/mean_length": 150.741796875, "completions/mean_terminated_length": 143.37058868408204, "completions/min_length": 64.0, "completions/min_terminated_length": 64.0, "entropy": 0.038746650354005395, "epoch": 23.511777301927197, "frac_reward_zero_std": 0.91875, "grad_norm": 0.5625, "learning_rate": 8.9021e-06, "loss": 0.0009, "num_tokens": 1099668341.0, "reward": 1.0719726800918579, "reward_std": 0.13068555146455765, "rewards/reward_accuracy/mean": 0.972265625, "rewards/reward_accuracy/std": 0.1295544534921646, "rewards/reward_format/mean": 0.09970703274011612, "rewards/reward_format/std": 0.0025811867089942098, "sampling/importance_sampling_ratio/max": 2.489152228832245, "sampling/importance_sampling_ratio/mean": 0.99608074426651, "sampling/importance_sampling_ratio/min": 0.08760997373610735, "sampling/sampling_logp_difference/max": 0.9916985273361206, "sampling/sampling_logp_difference/mean": 0.0039536817464977505, "step": 10980, "step_time": 5.107928385314881 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005078125, "completions/max_length": 1506.3, "completions/max_terminated_length": 1037.8, "completions/mean_length": 160.94765625, "completions/mean_terminated_length": 151.3661087036133, "completions/min_length": 69.7, "completions/min_terminated_length": 69.7, "entropy": 0.040650186361745, "epoch": 23.533190578158457, "frac_reward_zero_std": 0.925, "grad_norm": 0.0, "learning_rate": 8.9011e-06, "loss": -0.009, "num_tokens": 1100601231.0, "reward": 1.0680078148841858, "reward_std": 0.15167272314429284, "rewards/reward_accuracy/mean": 0.968359375, "rewards/reward_accuracy/std": 0.14980393052101135, "rewards/reward_format/mean": 0.09964843764901161, "rewards/reward_format/std": 0.0033994980156421663, "sampling/importance_sampling_ratio/max": 2.3403989911079406, "sampling/importance_sampling_ratio/mean": 0.9767226636409759, "sampling/importance_sampling_ratio/min": 0.11855874918401241, "sampling/sampling_logp_difference/max": 1.2521864473819733, "sampling/sampling_logp_difference/mean": 0.003899585409089923, "step": 10990, "step_time": 7.181057873484678 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.008984375, "completions/max_length": 1779.4, "completions/max_terminated_length": 1399.8, "completions/mean_length": 175.63984375, "completions/mean_terminated_length": 158.75332412719726, "completions/min_length": 65.8, "completions/min_terminated_length": 65.8, "entropy": 0.0530326524283737, "epoch": 23.554603854389722, "frac_reward_zero_std": 0.91875, "grad_norm": 0.2158203125, "learning_rate": 8.9001e-06, "loss": 0.0043, "num_tokens": 1101569429.0, "reward": 1.0543555080890656, "reward_std": 0.18259108811616898, "rewards/reward_accuracy/mean": 0.955078125, "rewards/reward_accuracy/std": 0.17899423092603683, "rewards/reward_format/mean": 0.09927734732627869, "rewards/reward_format/std": 0.0071779279038310054, "sampling/importance_sampling_ratio/max": 2.6021832704544066, "sampling/importance_sampling_ratio/mean": 0.9844517111778259, "sampling/importance_sampling_ratio/min": 0.020998120587319136, "sampling/sampling_logp_difference/max": 1.2735938429832458, "sampling/sampling_logp_difference/mean": 0.004221199988387525, "step": 11000, "step_time": 8.869265718193493 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003515625, "completions/max_length": 1363.3, "completions/max_terminated_length": 1223.2, "completions/mean_length": 162.16015625, "completions/mean_terminated_length": 155.47667694091797, "completions/min_length": 68.3, "completions/min_terminated_length": 68.3, "entropy": 0.03942415353376418, "epoch": 23.576017130620986, "frac_reward_zero_std": 0.925, "grad_norm": 0.54296875, "learning_rate": 8.899100000000001e-06, "loss": -0.0036, "num_tokens": 1102505407.0, "reward": 1.0554882884025574, "reward_std": 0.17089750990271568, "rewards/reward_accuracy/mean": 0.955859375, "rewards/reward_accuracy/std": 0.16943742707371712, "rewards/reward_format/mean": 0.09962890669703484, "rewards/reward_format/std": 0.0037033478962257504, "sampling/importance_sampling_ratio/max": 2.5082205057144167, "sampling/importance_sampling_ratio/mean": 0.9943172812461853, "sampling/importance_sampling_ratio/min": 0.12451257216744124, "sampling/sampling_logp_difference/max": 1.1028799533843994, "sampling/sampling_logp_difference/mean": 0.0037123991642147303, "step": 11010, "step_time": 6.705440358901979 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0078125, "completions/max_length": 1352.0, "completions/max_terminated_length": 1135.3, "completions/mean_length": 164.19140625, "completions/mean_terminated_length": 149.58389282226562, "completions/min_length": 64.2, "completions/min_terminated_length": 64.2, "entropy": 0.04184976443648338, "epoch": 23.597430406852247, "frac_reward_zero_std": 0.925, "grad_norm": 0.111328125, "learning_rate": 8.8981e-06, "loss": -0.0086, "num_tokens": 1103442025.0, "reward": 1.054960948228836, "reward_std": 0.15164162919390947, "rewards/reward_accuracy/mean": 0.95546875, "rewards/reward_accuracy/std": 0.14957888051867485, "rewards/reward_format/mean": 0.09949218854308128, "rewards/reward_format/std": 0.004117446066811681, "sampling/importance_sampling_ratio/max": 2.398791825771332, "sampling/importance_sampling_ratio/mean": 0.9853086113929749, "sampling/importance_sampling_ratio/min": 0.2199038863182068, "sampling/sampling_logp_difference/max": 0.9183895885944366, "sampling/sampling_logp_difference/mean": 0.003972168872132897, "step": 11020, "step_time": 6.641738192707999 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 5.183371877137688e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 5.183371877137688e-06, "completions/clipped_ratio": 0.01015625, "completions/max_length": 1239.6, "completions/max_terminated_length": 1122.8, "completions/mean_length": 180.38984375, "completions/mean_terminated_length": 161.45996704101563, "completions/min_length": 64.8, "completions/min_terminated_length": 64.8, "entropy": 0.05257895449176431, "epoch": 23.61884368308351, "frac_reward_zero_std": 0.9125, "grad_norm": 0.244140625, "learning_rate": 8.8971e-06, "loss": -0.0018, "num_tokens": 1104422719.0, "reward": 1.0466797053813934, "reward_std": 0.19722233191132546, "rewards/reward_accuracy/mean": 0.94765625, "rewards/reward_accuracy/std": 0.1935410089790821, "rewards/reward_format/mean": 0.09902343824505806, "rewards/reward_format/std": 0.005744448467157781, "sampling/importance_sampling_ratio/max": 2.5008029103279115, "sampling/importance_sampling_ratio/mean": 0.9732604503631592, "sampling/importance_sampling_ratio/min": 0.14618988558650017, "sampling/sampling_logp_difference/max": 1.0077753961086273, "sampling/sampling_logp_difference/mean": 0.004200595780275762, "step": 11030, "step_time": 6.476664922892814 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005078125, "completions/max_length": 1603.2, "completions/max_terminated_length": 1171.0, "completions/mean_length": 168.986328125, "completions/mean_terminated_length": 159.4491973876953, "completions/min_length": 63.9, "completions/min_terminated_length": 63.9, "entropy": 0.046191906463354825, "epoch": 23.640256959314776, "frac_reward_zero_std": 0.91875, "grad_norm": 0.3359375, "learning_rate": 8.896100000000001e-06, "loss": -0.0073, "num_tokens": 1105377564.0, "reward": 1.0625781416893005, "reward_std": 0.17440852224826814, "rewards/reward_accuracy/mean": 0.962890625, "rewards/reward_accuracy/std": 0.17263455763459207, "rewards/reward_format/mean": 0.09968750104308129, "rewards/reward_format/std": 0.003743039187975228, "sampling/importance_sampling_ratio/max": 2.443726933002472, "sampling/importance_sampling_ratio/mean": 0.9870038270950318, "sampling/importance_sampling_ratio/min": 0.07340096213156358, "sampling/sampling_logp_difference/max": 1.0454235434532166, "sampling/sampling_logp_difference/mean": 0.00408145512919873, "step": 11040, "step_time": 7.6994130138045875 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00234375, "completions/max_length": 1316.5, "completions/max_terminated_length": 1024.7, "completions/mean_length": 146.4828125, "completions/mean_terminated_length": 142.0119873046875, "completions/min_length": 63.6, "completions/min_terminated_length": 63.6, "entropy": 0.04196287484373897, "epoch": 23.661670235546037, "frac_reward_zero_std": 0.9375, "grad_norm": 0.0, "learning_rate": 8.8951e-06, "loss": -0.0058, "num_tokens": 1106269296.0, "reward": 1.0704687595367433, "reward_std": 0.12753385743126272, "rewards/reward_accuracy/mean": 0.970703125, "rewards/reward_accuracy/std": 0.12562455385923385, "rewards/reward_format/mean": 0.09976562559604644, "rewards/reward_format/std": 0.002769352635368705, "sampling/importance_sampling_ratio/max": 2.4445254802703857, "sampling/importance_sampling_ratio/mean": 0.9925706028938294, "sampling/importance_sampling_ratio/min": 0.13774718046188356, "sampling/sampling_logp_difference/max": 0.9800547897815705, "sampling/sampling_logp_difference/mean": 0.0041548464680090545, "step": 11050, "step_time": 6.124498857671279 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 1.617565112610464e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 1.617565112610464e-06, "completions/clipped_ratio": 0.008203125, "completions/max_length": 1099.3, "completions/max_terminated_length": 667.5, "completions/mean_length": 156.09921875, "completions/mean_terminated_length": 140.55545654296876, "completions/min_length": 63.2, "completions/min_terminated_length": 63.2, "entropy": 0.03794092582538724, "epoch": 23.6830835117773, "frac_reward_zero_std": 0.95, "grad_norm": 0.52734375, "learning_rate": 8.894100000000002e-06, "loss": -0.0009, "num_tokens": 1107184414.0, "reward": 1.0543945550918579, "reward_std": 0.15666490867733956, "rewards/reward_accuracy/mean": 0.955078125, "rewards/reward_accuracy/std": 0.15472969487309457, "rewards/reward_format/mean": 0.09931640774011612, "rewards/reward_format/std": 0.0036534470040351153, "sampling/importance_sampling_ratio/max": 2.431917703151703, "sampling/importance_sampling_ratio/mean": 0.9858829736709595, "sampling/importance_sampling_ratio/min": 0.07626010701060296, "sampling/sampling_logp_difference/max": 0.9283371269702911, "sampling/sampling_logp_difference/mean": 0.0038408170687034724, "step": 11060, "step_time": 5.714390689597349 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.002734375, "completions/max_length": 1440.2, "completions/max_terminated_length": 1285.5, "completions/mean_length": 155.4984375, "completions/mean_terminated_length": 150.32837371826173, "completions/min_length": 66.5, "completions/min_terminated_length": 66.5, "entropy": 0.04177339777816087, "epoch": 23.704496788008566, "frac_reward_zero_std": 0.9, "grad_norm": 0.5078125, "learning_rate": 8.893100000000001e-06, "loss": 0.0013, "num_tokens": 1108102138.0, "reward": 1.0695703506469727, "reward_std": 0.14342869222164153, "rewards/reward_accuracy/mean": 0.969921875, "rewards/reward_accuracy/std": 0.14177748337388038, "rewards/reward_format/mean": 0.09964843988418579, "rewards/reward_format/std": 0.003718083677813411, "sampling/importance_sampling_ratio/max": 2.5824814796447755, "sampling/importance_sampling_ratio/mean": 0.9848661005496979, "sampling/importance_sampling_ratio/min": 0.06376438941806555, "sampling/sampling_logp_difference/max": 0.9110740065574646, "sampling/sampling_logp_difference/mean": 0.003804513462819159, "step": 11070, "step_time": 7.004010394585203 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 1623.6, "completions/max_terminated_length": 1170.9, "completions/mean_length": 157.52578125, "completions/mean_terminated_length": 150.13490600585936, "completions/min_length": 66.8, "completions/min_terminated_length": 66.8, "entropy": 0.041903810622170565, "epoch": 23.72591006423983, "frac_reward_zero_std": 0.8875, "grad_norm": 0.0, "learning_rate": 8.8921e-06, "loss": -0.0076, "num_tokens": 1109023452.0, "reward": 1.0590429902076721, "reward_std": 0.16219698637723923, "rewards/reward_accuracy/mean": 0.959375, "rewards/reward_accuracy/std": 0.1605878584086895, "rewards/reward_format/mean": 0.09966797009110451, "rewards/reward_format/std": 0.003948523802682758, "sampling/importance_sampling_ratio/max": 2.5127769470214845, "sampling/importance_sampling_ratio/mean": 0.9874406814575195, "sampling/importance_sampling_ratio/min": 0.0813139977864921, "sampling/sampling_logp_difference/max": 1.0436568856239319, "sampling/sampling_logp_difference/mean": 0.004000248573720455, "step": 11080, "step_time": 7.533294048914104 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00234375, "completions/max_length": 1318.4, "completions/max_terminated_length": 1163.7, "completions/mean_length": 146.9640625, "completions/mean_terminated_length": 142.52278900146484, "completions/min_length": 63.5, "completions/min_terminated_length": 63.5, "entropy": 0.03813634992111474, "epoch": 23.74732334047109, "frac_reward_zero_std": 0.91875, "grad_norm": 0.33203125, "learning_rate": 8.8911e-06, "loss": -0.0034, "num_tokens": 1109914816.0, "reward": 1.0837304830551147, "reward_std": 0.09407670348882675, "rewards/reward_accuracy/mean": 0.983984375, "rewards/reward_accuracy/std": 0.09244493693113327, "rewards/reward_format/mean": 0.09974609464406967, "rewards/reward_format/std": 0.0027787382015958427, "sampling/importance_sampling_ratio/max": 2.463629412651062, "sampling/importance_sampling_ratio/mean": 0.9878502368927002, "sampling/importance_sampling_ratio/min": 0.14623553305864334, "sampling/sampling_logp_difference/max": 0.9443942546844483, "sampling/sampling_logp_difference/mean": 0.003998776478692889, "step": 11090, "step_time": 6.4309308143885575 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00546875, "completions/max_length": 1349.9, "completions/max_terminated_length": 1222.3, "completions/mean_length": 179.826171875, "completions/mean_terminated_length": 169.67220916748047, "completions/min_length": 65.2, "completions/min_terminated_length": 65.2, "entropy": 0.050054719136096534, "epoch": 23.768736616702355, "frac_reward_zero_std": 0.9125, "grad_norm": 0.0, "learning_rate": 8.8901e-06, "loss": -0.0067, "num_tokens": 1110896227.0, "reward": 1.0502539217472076, "reward_std": 0.17934509366750717, "rewards/reward_accuracy/mean": 0.95078125, "rewards/reward_accuracy/std": 0.17742043286561965, "rewards/reward_format/mean": 0.09947265684604645, "rewards/reward_format/std": 0.004709987225942314, "sampling/importance_sampling_ratio/max": 2.4439247012138368, "sampling/importance_sampling_ratio/mean": 0.9787640392780304, "sampling/importance_sampling_ratio/min": 0.05009023388847709, "sampling/sampling_logp_difference/max": 1.0435368299484253, "sampling/sampling_logp_difference/mean": 0.00413527365308255, "step": 11100, "step_time": 6.903354714126908 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 782.2, "completions/max_terminated_length": 782.2, "completions/mean_length": 138.392578125, "completions/mean_terminated_length": 138.392578125, "completions/min_length": 69.0, "completions/min_terminated_length": 69.0, "entropy": 0.03173546439502388, "epoch": 23.79014989293362, "frac_reward_zero_std": 0.95625, "grad_norm": 0.0, "learning_rate": 8.889100000000001e-06, "loss": -0.0016, "num_tokens": 1111766864.0, "reward": 1.090234398841858, "reward_std": 0.06089061126112938, "rewards/reward_accuracy/mean": 0.990234375, "rewards/reward_accuracy/std": 0.06089061424136162, "rewards/reward_format/mean": 0.10000000149011612, "rewards/reward_format/std": 0.0, "sampling/importance_sampling_ratio/max": 2.325499784946442, "sampling/importance_sampling_ratio/mean": 1.002909243106842, "sampling/importance_sampling_ratio/min": 0.17281338274478913, "sampling/sampling_logp_difference/max": 1.044821947813034, "sampling/sampling_logp_difference/mean": 0.003530609677545726, "step": 11110, "step_time": 3.944817894499283 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.000390625, "completions/max_length": 986.7, "completions/max_terminated_length": 915.0, "completions/mean_length": 144.553515625, "completions/mean_terminated_length": 143.8144058227539, "completions/min_length": 69.2, "completions/min_terminated_length": 69.2, "entropy": 0.036741185444407166, "epoch": 23.81156316916488, "frac_reward_zero_std": 0.93125, "grad_norm": 0.193359375, "learning_rate": 8.8881e-06, "loss": -0.0038, "num_tokens": 1112650505.0, "reward": 1.0737109661102295, "reward_std": 0.12624624148011207, "rewards/reward_accuracy/mean": 0.973828125, "rewards/reward_accuracy/std": 0.125871242582798, "rewards/reward_format/mean": 0.09988281428813935, "rewards/reward_format/std": 0.0012040342669934034, "sampling/importance_sampling_ratio/max": 2.3627851963043214, "sampling/importance_sampling_ratio/mean": 0.9817626535892486, "sampling/importance_sampling_ratio/min": 0.2103845365345478, "sampling/sampling_logp_difference/max": 1.0793030083179473, "sampling/sampling_logp_difference/mean": 0.0037275390699505807, "step": 11120, "step_time": 4.907733045591158 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00078125, "completions/max_length": 1227.6, "completions/max_terminated_length": 1048.3, "completions/mean_length": 142.83671875, "completions/mean_terminated_length": 141.34096984863282, "completions/min_length": 64.5, "completions/min_terminated_length": 64.5, "entropy": 0.03857232332229614, "epoch": 23.832976445396145, "frac_reward_zero_std": 0.9375, "grad_norm": 0.142578125, "learning_rate": 8.8871e-06, "loss": -0.0076, "num_tokens": 1113525319.0, "reward": 1.079101574420929, "reward_std": 0.09802653552033007, "rewards/reward_accuracy/mean": 0.979296875, "rewards/reward_accuracy/std": 0.0966266855597496, "rewards/reward_format/mean": 0.09980468824505806, "rewards/reward_format/std": 0.002517323032952845, "sampling/importance_sampling_ratio/max": 2.234272599220276, "sampling/importance_sampling_ratio/mean": 0.9834360003471374, "sampling/importance_sampling_ratio/min": 0.159623421728611, "sampling/sampling_logp_difference/max": 0.9522471129894257, "sampling/sampling_logp_difference/mean": 0.0038424851838499306, "step": 11130, "step_time": 5.945481015904806 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003125, "completions/max_length": 1563.8, "completions/max_terminated_length": 1357.5, "completions/mean_length": 154.815625, "completions/mean_terminated_length": 148.90126419067383, "completions/min_length": 64.5, "completions/min_terminated_length": 64.5, "entropy": 0.041172755882143974, "epoch": 23.85438972162741, "frac_reward_zero_std": 0.89375, "grad_norm": 0.306640625, "learning_rate": 8.886100000000001e-06, "loss": -0.0078, "num_tokens": 1114446111.0, "reward": 1.0662304759025574, "reward_std": 0.1590818464756012, "rewards/reward_accuracy/mean": 0.96640625, "rewards/reward_accuracy/std": 0.15822510719299315, "rewards/reward_format/mean": 0.09982421919703484, "rewards/reward_format/std": 0.002015778259374201, "sampling/importance_sampling_ratio/max": 2.4685360312461855, "sampling/importance_sampling_ratio/mean": 0.9800400674343109, "sampling/importance_sampling_ratio/min": 0.14294949658215045, "sampling/sampling_logp_difference/max": 1.1478582859039306, "sampling/sampling_logp_difference/mean": 0.00417276204098016, "step": 11140, "step_time": 7.247734551512986 }, { "clip_ratio/high_max": 7.62939453125e-06, "clip_ratio/high_mean": 9.5367431640625e-07, "clip_ratio/low_mean": 3.814697265625e-07, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 1.33514404296875e-06, "completions/clipped_ratio": 0.009375, "completions/max_length": 1391.1, "completions/max_terminated_length": 1350.4, "completions/mean_length": 165.958984375, "completions/mean_terminated_length": 148.464306640625, "completions/min_length": 68.7, "completions/min_terminated_length": 68.7, "entropy": 0.04879053947515786, "epoch": 23.87580299785867, "frac_reward_zero_std": 0.93125, "grad_norm": 0.171875, "learning_rate": 8.8851e-06, "loss": -0.0038, "num_tokens": 1115392406.0, "reward": 1.057519543170929, "reward_std": 0.15970769822597503, "rewards/reward_accuracy/mean": 0.958203125, "rewards/reward_accuracy/std": 0.15746156722307206, "rewards/reward_format/mean": 0.09931640699505806, "rewards/reward_format/std": 0.004003279306925833, "sampling/importance_sampling_ratio/max": 2.4986698627471924, "sampling/importance_sampling_ratio/mean": 0.9923582136631012, "sampling/importance_sampling_ratio/min": 0.08487304151058198, "sampling/sampling_logp_difference/max": 1.1141491413116456, "sampling/sampling_logp_difference/mean": 0.004422889230772853, "step": 11150, "step_time": 6.902352834900375 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00234375, "completions/max_length": 1293.3, "completions/max_terminated_length": 1109.1, "completions/mean_length": 148.9828125, "completions/mean_terminated_length": 144.55226440429686, "completions/min_length": 63.1, "completions/min_terminated_length": 63.1, "entropy": 0.03939378864597529, "epoch": 23.897216274089935, "frac_reward_zero_std": 0.9125, "grad_norm": 0.51171875, "learning_rate": 8.884100000000002e-06, "loss": -0.0041, "num_tokens": 1116287162.0, "reward": 1.0790625035762786, "reward_std": 0.11052702888846397, "rewards/reward_accuracy/mean": 0.979296875, "rewards/reward_accuracy/std": 0.10936770513653755, "rewards/reward_format/mean": 0.0997656263411045, "rewards/reward_format/std": 0.0025854269508272408, "sampling/importance_sampling_ratio/max": 2.5072956681251526, "sampling/importance_sampling_ratio/mean": 0.9900150895118713, "sampling/importance_sampling_ratio/min": 0.11248030923306943, "sampling/sampling_logp_difference/max": 1.0090086579322814, "sampling/sampling_logp_difference/mean": 0.004034120030701161, "step": 11160, "step_time": 6.176008862012532 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.010546875, "completions/max_length": 1290.3, "completions/max_terminated_length": 1007.3, "completions/mean_length": 184.080859375, "completions/mean_terminated_length": 164.6131233215332, "completions/min_length": 62.7, "completions/min_terminated_length": 62.7, "entropy": 0.048549994663335386, "epoch": 23.9186295503212, "frac_reward_zero_std": 0.91875, "grad_norm": 0.09619140625, "learning_rate": 8.883100000000001e-06, "loss": -0.0002, "num_tokens": 1117275577.0, "reward": 1.0503906428813934, "reward_std": 0.17456183284521104, "rewards/reward_accuracy/mean": 0.951171875, "rewards/reward_accuracy/std": 0.17192681282758712, "rewards/reward_format/mean": 0.09921875149011612, "rewards/reward_format/std": 0.005085866758599877, "sampling/importance_sampling_ratio/max": 2.508208441734314, "sampling/importance_sampling_ratio/mean": 0.9767674565315246, "sampling/importance_sampling_ratio/min": 0.11537059992551804, "sampling/sampling_logp_difference/max": 0.9350176632404328, "sampling/sampling_logp_difference/mean": 0.004001120803877711, "step": 11170, "step_time": 6.59816316178767 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003515625, "completions/max_length": 1359.1, "completions/max_terminated_length": 964.5, "completions/mean_length": 148.005859375, "completions/mean_terminated_length": 141.36044311523438, "completions/min_length": 61.7, "completions/min_terminated_length": 61.7, "entropy": 0.04223037511110306, "epoch": 23.940042826552464, "frac_reward_zero_std": 0.94375, "grad_norm": 0.255859375, "learning_rate": 8.882100000000001e-06, "loss": 0.0035, "num_tokens": 1118164712.0, "reward": 1.0786328315734863, "reward_std": 0.102219720184803, "rewards/reward_accuracy/mean": 0.97890625, "rewards/reward_accuracy/std": 0.10063624382019043, "rewards/reward_format/mean": 0.0997265636920929, "rewards/reward_format/std": 0.003210427053272724, "sampling/importance_sampling_ratio/max": 2.552950048446655, "sampling/importance_sampling_ratio/mean": 0.9818095922470093, "sampling/importance_sampling_ratio/min": 0.20733647122979165, "sampling/sampling_logp_difference/max": 0.9639122247695923, "sampling/sampling_logp_difference/mean": 0.004070730810053646, "step": 11180, "step_time": 6.666036998602794 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00859375, "completions/max_length": 1470.7, "completions/max_terminated_length": 1327.3, "completions/mean_length": 166.584375, "completions/mean_terminated_length": 150.4854934692383, "completions/min_length": 65.5, "completions/min_terminated_length": 65.5, "entropy": 0.04431672901846469, "epoch": 23.961456102783725, "frac_reward_zero_std": 0.925, "grad_norm": 0.0, "learning_rate": 8.8811e-06, "loss": -0.0025, "num_tokens": 1119106416.0, "reward": 1.0477734625339508, "reward_std": 0.17933609932661057, "rewards/reward_accuracy/mean": 0.9484375, "rewards/reward_accuracy/std": 0.17692701667547225, "rewards/reward_format/mean": 0.0993359386920929, "rewards/reward_format/std": 0.004545474913902581, "sampling/importance_sampling_ratio/max": 2.3778921961784363, "sampling/importance_sampling_ratio/mean": 0.9898649036884308, "sampling/importance_sampling_ratio/min": 0.09477044369559735, "sampling/sampling_logp_difference/max": 0.9656681299209595, "sampling/sampling_logp_difference/mean": 0.004163624625653029, "step": 11190, "step_time": 7.265265255694976 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005078125, "completions/max_length": 1610.9, "completions/max_terminated_length": 1130.9, "completions/mean_length": 164.656640625, "completions/mean_terminated_length": 155.1536102294922, "completions/min_length": 63.0, "completions/min_terminated_length": 63.0, "entropy": 0.042583665787242354, "epoch": 23.98286937901499, "frac_reward_zero_std": 0.9, "grad_norm": 0.2470703125, "learning_rate": 8.8801e-06, "loss": -0.0037, "num_tokens": 1120045713.0, "reward": 1.0777148842811584, "reward_std": 0.12464412748813629, "rewards/reward_accuracy/mean": 0.978125, "rewards/reward_accuracy/std": 0.12253900617361069, "rewards/reward_format/mean": 0.09958984553813935, "rewards/reward_format/std": 0.004293221514672041, "sampling/importance_sampling_ratio/max": 2.5059411406517027, "sampling/importance_sampling_ratio/mean": 0.9858020365238189, "sampling/importance_sampling_ratio/min": 0.13678931463509797, "sampling/sampling_logp_difference/max": 0.8702320337295533, "sampling/sampling_logp_difference/mean": 0.00422939972486347, "step": 11200, "step_time": 7.652190715601319 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 2.3836340460547945e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 2.3836340460547945e-06, "completions/clipped_ratio": 0.009765625, "completions/max_length": 1437.0, "completions/max_terminated_length": 1381.9, "completions/mean_length": 174.031640625, "completions/mean_terminated_length": 155.86766662597657, "completions/min_length": 64.7, "completions/min_terminated_length": 64.7, "entropy": 0.047041116072796284, "epoch": 24.004282655246254, "frac_reward_zero_std": 0.88125, "grad_norm": 0.1904296875, "learning_rate": 8.879100000000001e-06, "loss": -0.0098, "num_tokens": 1121023266.0, "reward": 1.0577343940734862, "reward_std": 0.170895803719759, "rewards/reward_accuracy/mean": 0.95859375, "rewards/reward_accuracy/std": 0.16767879575490952, "rewards/reward_format/mean": 0.09914062619209289, "rewards/reward_format/std": 0.005854570795781911, "sampling/importance_sampling_ratio/max": 2.586548638343811, "sampling/importance_sampling_ratio/mean": 0.9834637582302094, "sampling/importance_sampling_ratio/min": 0.03872371180914343, "sampling/sampling_logp_difference/max": 1.030207920074463, "sampling/sampling_logp_difference/mean": 0.004248480685055256, "step": 11210, "step_time": 7.457519799182774 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005078125, "completions/max_length": 1495.1, "completions/max_terminated_length": 1237.8, "completions/mean_length": 159.40390625, "completions/mean_terminated_length": 149.74846496582032, "completions/min_length": 67.8, "completions/min_terminated_length": 67.8, "entropy": 0.043850741372443734, "epoch": 24.025695931477514, "frac_reward_zero_std": 0.93125, "grad_norm": 0.057373046875, "learning_rate": 8.8781e-06, "loss": -0.0054, "num_tokens": 1121947436.0, "reward": 1.0789257884025574, "reward_std": 0.09665778279304504, "rewards/reward_accuracy/mean": 0.979296875, "rewards/reward_accuracy/std": 0.09441059231758117, "rewards/reward_format/mean": 0.09962890669703484, "rewards/reward_format/std": 0.003959212452173233, "sampling/importance_sampling_ratio/max": 2.3573970556259156, "sampling/importance_sampling_ratio/mean": 0.9892006158828736, "sampling/importance_sampling_ratio/min": 0.061054366454482076, "sampling/sampling_logp_difference/max": 0.8471563458442688, "sampling/sampling_logp_difference/mean": 0.004097235109657049, "step": 11220, "step_time": 7.162904961113236 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0015625, "completions/max_length": 1512.6, "completions/max_terminated_length": 1252.5, "completions/mean_length": 154.504296875, "completions/mean_terminated_length": 151.55391693115234, "completions/min_length": 64.4, "completions/min_terminated_length": 64.4, "entropy": 0.04455705943983048, "epoch": 24.04710920770878, "frac_reward_zero_std": 0.93125, "grad_norm": 0.0, "learning_rate": 8.8771e-06, "loss": -0.0015, "num_tokens": 1122859031.0, "reward": 1.0565624952316284, "reward_std": 0.18371452689170836, "rewards/reward_accuracy/mean": 0.956640625, "rewards/reward_accuracy/std": 0.18355250209569932, "rewards/reward_format/mean": 0.09992187470197678, "rewards/reward_format/std": 0.0012500000186264515, "sampling/importance_sampling_ratio/max": 2.5235920906066895, "sampling/importance_sampling_ratio/mean": 0.9860525250434875, "sampling/importance_sampling_ratio/min": 0.14331450462341308, "sampling/sampling_logp_difference/max": 0.9227908194065094, "sampling/sampling_logp_difference/mean": 0.004219663701951504, "step": 11230, "step_time": 7.3107676549989264 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00234375, "completions/max_length": 1360.6, "completions/max_terminated_length": 1247.4, "completions/mean_length": 150.311328125, "completions/mean_terminated_length": 145.94015579223634, "completions/min_length": 64.6, "completions/min_terminated_length": 64.6, "entropy": 0.03721710245590657, "epoch": 24.068522483940043, "frac_reward_zero_std": 0.93125, "grad_norm": 0.451171875, "learning_rate": 8.876100000000001e-06, "loss": -0.0034, "num_tokens": 1123761556.0, "reward": 1.0829492330551147, "reward_std": 0.08793287500739097, "rewards/reward_accuracy/mean": 0.983203125, "rewards/reward_accuracy/std": 0.08695978224277497, "rewards/reward_format/mean": 0.09974609464406967, "rewards/reward_format/std": 0.0024806494591757657, "sampling/importance_sampling_ratio/max": 2.451358771324158, "sampling/importance_sampling_ratio/mean": 0.9804857611656189, "sampling/importance_sampling_ratio/min": 0.11001214757561684, "sampling/sampling_logp_difference/max": 0.9100097060203552, "sampling/sampling_logp_difference/mean": 0.0036036816658452154, "step": 11240, "step_time": 6.644301971493405 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005078125, "completions/max_length": 1359.9, "completions/max_terminated_length": 1182.2, "completions/mean_length": 159.83359375, "completions/mean_terminated_length": 150.32230224609376, "completions/min_length": 61.3, "completions/min_terminated_length": 61.3, "entropy": 0.04503620641771704, "epoch": 24.089935760171308, "frac_reward_zero_std": 0.95, "grad_norm": 0.0, "learning_rate": 8.8751e-06, "loss": 0.0017, "num_tokens": 1124684538.0, "reward": 1.0672265887260437, "reward_std": 0.14864370077848435, "rewards/reward_accuracy/mean": 0.967578125, "rewards/reward_accuracy/std": 0.14695805236697196, "rewards/reward_format/mean": 0.09964843839406967, "rewards/reward_format/std": 0.003013067995198071, "sampling/importance_sampling_ratio/max": 2.5980422258377076, "sampling/importance_sampling_ratio/mean": 0.9915215015411377, "sampling/importance_sampling_ratio/min": 0.16659798808395862, "sampling/sampling_logp_difference/max": 1.067195439338684, "sampling/sampling_logp_difference/mean": 0.004121610126458108, "step": 11250, "step_time": 6.685319401300513 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.002734375, "completions/max_length": 1466.6, "completions/max_terminated_length": 1233.3, "completions/mean_length": 161.57265625, "completions/mean_terminated_length": 156.4506103515625, "completions/min_length": 66.1, "completions/min_terminated_length": 66.1, "entropy": 0.04742241476196796, "epoch": 24.11134903640257, "frac_reward_zero_std": 0.91875, "grad_norm": 0.0576171875, "learning_rate": 8.8741e-06, "loss": -0.0054, "num_tokens": 1125615172.0, "reward": 1.064453136920929, "reward_std": 0.15274179577827454, "rewards/reward_accuracy/mean": 0.96484375, "rewards/reward_accuracy/std": 0.15025445744395255, "rewards/reward_format/mean": 0.09960937574505806, "rewards/reward_format/std": 0.0035739872371777894, "sampling/importance_sampling_ratio/max": 2.5137549519538878, "sampling/importance_sampling_ratio/mean": 1.0018266677856444, "sampling/importance_sampling_ratio/min": 0.05381937548518181, "sampling/sampling_logp_difference/max": 1.1690970361232758, "sampling/sampling_logp_difference/mean": 0.004173097806051374, "step": 11260, "step_time": 7.093306594592287 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 1016.4, "completions/max_terminated_length": 938.4, "completions/mean_length": 158.897265625, "completions/mean_terminated_length": 151.57401580810546, "completions/min_length": 65.9, "completions/min_terminated_length": 65.9, "entropy": 0.03667430775240064, "epoch": 24.132762312633833, "frac_reward_zero_std": 0.90625, "grad_norm": 0.302734375, "learning_rate": 8.873100000000001e-06, "loss": -0.007, "num_tokens": 1126545245.0, "reward": 1.0598632931709289, "reward_std": 0.17501015737652778, "rewards/reward_accuracy/mean": 0.96015625, "rewards/reward_accuracy/std": 0.17353033795952796, "rewards/reward_format/mean": 0.09970703199505807, "rewards/reward_format/std": 0.002456712001003325, "sampling/importance_sampling_ratio/max": 2.3034071207046507, "sampling/importance_sampling_ratio/mean": 0.9699432134628296, "sampling/importance_sampling_ratio/min": 0.12411474715918303, "sampling/sampling_logp_difference/max": 1.3517356097698212, "sampling/sampling_logp_difference/mean": 0.003768257098272443, "step": 11270, "step_time": 5.341649062206852 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005078125, "completions/max_length": 1240.1, "completions/max_terminated_length": 978.8, "completions/mean_length": 160.05390625, "completions/mean_terminated_length": 150.5116424560547, "completions/min_length": 63.0, "completions/min_terminated_length": 63.0, "entropy": 0.04413228172343224, "epoch": 24.154175588865098, "frac_reward_zero_std": 0.9, "grad_norm": 0.0, "learning_rate": 8.872100000000001e-06, "loss": -0.0099, "num_tokens": 1127470519.0, "reward": 1.0660742402076722, "reward_std": 0.157289270311594, "rewards/reward_accuracy/mean": 0.96640625, "rewards/reward_accuracy/std": 0.1555299885571003, "rewards/reward_format/mean": 0.09966796934604645, "rewards/reward_format/std": 0.003259230894036591, "sampling/importance_sampling_ratio/max": 2.487817716598511, "sampling/importance_sampling_ratio/mean": 0.9870866656303405, "sampling/importance_sampling_ratio/min": 0.1466987870633602, "sampling/sampling_logp_difference/max": 1.1003339290618896, "sampling/sampling_logp_difference/mean": 0.003948561614379287, "step": 11280, "step_time": 6.18819140829437 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01171875, "completions/max_length": 1649.3, "completions/max_terminated_length": 1439.5, "completions/mean_length": 183.2984375, "completions/mean_terminated_length": 161.6865249633789, "completions/min_length": 69.0, "completions/min_terminated_length": 69.0, "entropy": 0.049460954428650436, "epoch": 24.17558886509636, "frac_reward_zero_std": 0.89375, "grad_norm": 0.23828125, "learning_rate": 8.8711e-06, "loss": -0.006, "num_tokens": 1128461651.0, "reward": 1.0480859518051147, "reward_std": 0.1834425561130047, "rewards/reward_accuracy/mean": 0.94921875, "rewards/reward_accuracy/std": 0.1801126070320606, "rewards/reward_format/mean": 0.09886718690395355, "rewards/reward_format/std": 0.007458450389094651, "sampling/importance_sampling_ratio/max": 2.5265305995941163, "sampling/importance_sampling_ratio/mean": 0.9735988736152649, "sampling/importance_sampling_ratio/min": 0.06479968652129173, "sampling/sampling_logp_difference/max": 1.476983404159546, "sampling/sampling_logp_difference/mean": 0.004262510919943452, "step": 11290, "step_time": 8.080988564083237 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01171875, "completions/max_length": 1401.4, "completions/max_terminated_length": 1268.2, "completions/mean_length": 173.533984375, "completions/mean_terminated_length": 151.5237808227539, "completions/min_length": 66.2, "completions/min_terminated_length": 66.2, "entropy": 0.045092773204669354, "epoch": 24.197002141327623, "frac_reward_zero_std": 0.9125, "grad_norm": 0.3359375, "learning_rate": 8.8701e-06, "loss": -0.0075, "num_tokens": 1129421770.0, "reward": 1.0593359649181366, "reward_std": 0.14787585958838462, "rewards/reward_accuracy/mean": 0.96015625, "rewards/reward_accuracy/std": 0.144665115326643, "rewards/reward_format/mean": 0.09917968884110451, "rewards/reward_format/std": 0.0058933463878929615, "sampling/importance_sampling_ratio/max": 2.4996002912521362, "sampling/importance_sampling_ratio/mean": 0.9737937450408936, "sampling/importance_sampling_ratio/min": 0.0822089347988367, "sampling/sampling_logp_difference/max": 1.6859662711620331, "sampling/sampling_logp_difference/mean": 0.004071234283037484, "step": 11300, "step_time": 6.9138110715925 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0015625, "completions/max_length": 1039.2, "completions/max_terminated_length": 900.2, "completions/mean_length": 151.159765625, "completions/mean_terminated_length": 148.21360931396484, "completions/min_length": 70.3, "completions/min_terminated_length": 70.3, "entropy": 0.037229006015695634, "epoch": 24.218415417558887, "frac_reward_zero_std": 0.93125, "grad_norm": 0.0, "learning_rate": 8.869100000000001e-06, "loss": -0.0053, "num_tokens": 1130331363.0, "reward": 1.046367210149765, "reward_std": 0.16001750528812408, "rewards/reward_accuracy/mean": 0.946484375, "rewards/reward_accuracy/std": 0.15956772044301032, "rewards/reward_format/mean": 0.09988281354308129, "rewards/reward_format/std": 0.001476639206521213, "sampling/importance_sampling_ratio/max": 2.41105717420578, "sampling/importance_sampling_ratio/mean": 0.9968326449394226, "sampling/importance_sampling_ratio/min": 0.058649804443120956, "sampling/sampling_logp_difference/max": 1.1402732312679291, "sampling/sampling_logp_difference/mean": 0.0037118569016456604, "step": 11310, "step_time": 5.345810765284114 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.002734375, "completions/max_length": 1256.6, "completions/max_terminated_length": 1118.2, "completions/mean_length": 156.36796875, "completions/mean_terminated_length": 151.24252014160157, "completions/min_length": 67.2, "completions/min_terminated_length": 67.2, "entropy": 0.03905292795971036, "epoch": 24.239828693790148, "frac_reward_zero_std": 0.9, "grad_norm": 0.0, "learning_rate": 8.8681e-06, "loss": -0.0085, "num_tokens": 1131250129.0, "reward": 1.074316418170929, "reward_std": 0.1285008780658245, "rewards/reward_accuracy/mean": 0.974609375, "rewards/reward_accuracy/std": 0.12737578973174096, "rewards/reward_format/mean": 0.09970703199505807, "rewards/reward_format/std": 0.002270259871147573, "sampling/importance_sampling_ratio/max": 2.5893158197402952, "sampling/importance_sampling_ratio/mean": 0.9861358821392059, "sampling/importance_sampling_ratio/min": 0.13645622874610125, "sampling/sampling_logp_difference/max": 0.9953464090824127, "sampling/sampling_logp_difference/mean": 0.0037953846622258425, "step": 11320, "step_time": 6.091311311401659 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 1284.2, "completions/max_terminated_length": 1027.3, "completions/mean_length": 149.8765625, "completions/mean_terminated_length": 142.53687744140626, "completions/min_length": 65.9, "completions/min_terminated_length": 65.9, "entropy": 0.03912699436768889, "epoch": 24.261241970021413, "frac_reward_zero_std": 0.925, "grad_norm": 0.341796875, "learning_rate": 8.8671e-06, "loss": -0.0043, "num_tokens": 1132151813.0, "reward": 1.0700195670127868, "reward_std": 0.1236156016588211, "rewards/reward_accuracy/mean": 0.9703125, "rewards/reward_accuracy/std": 0.12235691845417022, "rewards/reward_format/mean": 0.09970703348517418, "rewards/reward_format/std": 0.003323523700237274, "sampling/importance_sampling_ratio/max": 2.384758973121643, "sampling/importance_sampling_ratio/mean": 0.9900562584400177, "sampling/importance_sampling_ratio/min": 0.17584608867764473, "sampling/sampling_logp_difference/max": 1.047877848148346, "sampling/sampling_logp_difference/mean": 0.004113761172629893, "step": 11330, "step_time": 6.303347544310964 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0015625, "completions/max_length": 1035.0, "completions/max_terminated_length": 993.5, "completions/mean_length": 161.148828125, "completions/mean_terminated_length": 158.20103759765624, "completions/min_length": 67.4, "completions/min_terminated_length": 67.4, "entropy": 0.038834403781220314, "epoch": 24.282655246252677, "frac_reward_zero_std": 0.90625, "grad_norm": 0.2197265625, "learning_rate": 8.866100000000001e-06, "loss": -0.0008, "num_tokens": 1133084210.0, "reward": 1.0481836140155791, "reward_std": 0.17314860075712205, "rewards/reward_accuracy/mean": 0.9484375, "rewards/reward_accuracy/std": 0.17210859134793283, "rewards/reward_format/mean": 0.09974609464406967, "rewards/reward_format/std": 0.002755774348042905, "sampling/importance_sampling_ratio/max": 2.4803681492805483, "sampling/importance_sampling_ratio/mean": 0.9996186137199402, "sampling/importance_sampling_ratio/min": 0.16266994923353195, "sampling/sampling_logp_difference/max": 0.9546588122844696, "sampling/sampling_logp_difference/mean": 0.0037512956652790306, "step": 11340, "step_time": 5.199755921988981 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 1.0800709560498944e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 1.0800709560498944e-06, "completions/clipped_ratio": 0.0078125, "completions/max_length": 1364.9, "completions/max_terminated_length": 1085.9, "completions/mean_length": 161.601953125, "completions/mean_terminated_length": 146.76844482421876, "completions/min_length": 66.8, "completions/min_terminated_length": 66.8, "entropy": 0.04281568368896842, "epoch": 24.30406852248394, "frac_reward_zero_std": 0.9125, "grad_norm": 0.302734375, "learning_rate": 8.865100000000001e-06, "loss": -0.0069, "num_tokens": 1134016119.0, "reward": 1.0800195336341858, "reward_std": 0.11807377189397812, "rewards/reward_accuracy/mean": 0.98046875, "rewards/reward_accuracy/std": 0.11608680114150047, "rewards/reward_format/mean": 0.0995507813990116, "rewards/reward_format/std": 0.0035629834746941924, "sampling/importance_sampling_ratio/max": 2.386510944366455, "sampling/importance_sampling_ratio/mean": 0.979901123046875, "sampling/importance_sampling_ratio/min": 0.11294109271839262, "sampling/sampling_logp_difference/max": 0.8750439763069153, "sampling/sampling_logp_difference/mean": 0.004006294230930507, "step": 11350, "step_time": 6.668037988207653 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003125, "completions/max_length": 1282.7, "completions/max_terminated_length": 1189.6, "completions/mean_length": 158.241796875, "completions/mean_terminated_length": 152.37358551025392, "completions/min_length": 64.1, "completions/min_terminated_length": 64.1, "entropy": 0.04340752603020519, "epoch": 24.325481798715202, "frac_reward_zero_std": 0.91875, "grad_norm": 0.0, "learning_rate": 8.8641e-06, "loss": -0.0064, "num_tokens": 1134942482.0, "reward": 1.065722692012787, "reward_std": 0.15205697119235992, "rewards/reward_accuracy/mean": 0.966015625, "rewards/reward_accuracy/std": 0.15085126236081123, "rewards/reward_format/mean": 0.09970703348517418, "rewards/reward_format/std": 0.002706968877464533, "sampling/importance_sampling_ratio/max": 2.363619792461395, "sampling/importance_sampling_ratio/mean": 0.9926375150680542, "sampling/importance_sampling_ratio/min": 0.1334843583405018, "sampling/sampling_logp_difference/max": 0.9427437901496887, "sampling/sampling_logp_difference/mean": 0.004120607837103307, "step": 11360, "step_time": 6.421077870790032 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00234375, "completions/max_length": 1327.3, "completions/max_terminated_length": 1148.2, "completions/mean_length": 152.353125, "completions/mean_terminated_length": 147.92412109375, "completions/min_length": 64.4, "completions/min_terminated_length": 64.4, "entropy": 0.04256524010561406, "epoch": 24.346895074946467, "frac_reward_zero_std": 0.925, "grad_norm": 0.07421875, "learning_rate": 8.863100000000002e-06, "loss": -0.006, "num_tokens": 1135849738.0, "reward": 1.0720703244209289, "reward_std": 0.13395633772015572, "rewards/reward_accuracy/mean": 0.972265625, "rewards/reward_accuracy/std": 0.13294653743505477, "rewards/reward_format/mean": 0.09980468824505806, "rewards/reward_format/std": 0.002255769143812358, "sampling/importance_sampling_ratio/max": 2.5542791366577147, "sampling/importance_sampling_ratio/mean": 0.9920238435268403, "sampling/importance_sampling_ratio/min": 0.10739230066537857, "sampling/sampling_logp_difference/max": 0.9737458884716034, "sampling/sampling_logp_difference/mean": 0.004130429262295366, "step": 11370, "step_time": 6.518625969186542 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.004296875, "completions/max_length": 1478.2, "completions/max_terminated_length": 1279.2, "completions/mean_length": 169.4703125, "completions/mean_terminated_length": 161.5144775390625, "completions/min_length": 62.4, "completions/min_terminated_length": 62.4, "entropy": 0.0452578985830769, "epoch": 24.36830835117773, "frac_reward_zero_std": 0.9, "grad_norm": 0.51171875, "learning_rate": 8.862100000000001e-06, "loss": -0.0041, "num_tokens": 1136805998.0, "reward": 1.0625390887260437, "reward_std": 0.1601884499192238, "rewards/reward_accuracy/mean": 0.962890625, "rewards/reward_accuracy/std": 0.15836857110261918, "rewards/reward_format/mean": 0.09964843913912773, "rewards/reward_format/std": 0.003859223937615752, "sampling/importance_sampling_ratio/max": 2.4385568857192994, "sampling/importance_sampling_ratio/mean": 0.9945581376552581, "sampling/importance_sampling_ratio/min": 0.1721921253949404, "sampling/sampling_logp_difference/max": 0.8813803315162658, "sampling/sampling_logp_difference/mean": 0.00407269683200866, "step": 11380, "step_time": 7.178502290215692 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00234375, "completions/max_length": 701.1, "completions/max_terminated_length": 695.6, "completions/mean_length": 144.564453125, "completions/mean_terminated_length": 140.1809295654297, "completions/min_length": 63.6, "completions/min_terminated_length": 63.6, "entropy": 0.03848972299601883, "epoch": 24.389721627408992, "frac_reward_zero_std": 0.96875, "grad_norm": 0.5, "learning_rate": 8.8611e-06, "loss": 0.0011, "num_tokens": 1137689171.0, "reward": 1.0811328291893005, "reward_std": 0.08967520296573639, "rewards/reward_accuracy/mean": 0.98125, "rewards/reward_accuracy/std": 0.08912994116544723, "rewards/reward_format/mean": 0.09988281354308129, "rewards/reward_format/std": 0.0009831610135734082, "sampling/importance_sampling_ratio/max": 2.385697436332703, "sampling/importance_sampling_ratio/mean": 0.9890816450119019, "sampling/importance_sampling_ratio/min": 0.22300620898604392, "sampling/sampling_logp_difference/max": 0.9219032526016235, "sampling/sampling_logp_difference/mean": 0.003769061784259975, "step": 11390, "step_time": 3.9188174475013513 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001171875, "completions/max_length": 963.5, "completions/max_terminated_length": 898.5, "completions/mean_length": 147.196484375, "completions/mean_terminated_length": 145.00835418701172, "completions/min_length": 65.1, "completions/min_terminated_length": 65.1, "entropy": 0.03609990812838078, "epoch": 24.411134903640257, "frac_reward_zero_std": 0.93125, "grad_norm": 0.33984375, "learning_rate": 8.8601e-06, "loss": -0.0027, "num_tokens": 1138582746.0, "reward": 1.0807422161102296, "reward_std": 0.11001671701669694, "rewards/reward_accuracy/mean": 0.980859375, "rewards/reward_accuracy/std": 0.10910149067640304, "rewards/reward_format/mean": 0.09988281428813935, "rewards/reward_format/std": 0.0013232229743152858, "sampling/importance_sampling_ratio/max": 2.482818531990051, "sampling/importance_sampling_ratio/mean": 0.992947107553482, "sampling/importance_sampling_ratio/min": 0.1123675525188446, "sampling/sampling_logp_difference/max": 0.98158118724823, "sampling/sampling_logp_difference/mean": 0.003677702369168401, "step": 11400, "step_time": 4.8423357605846835 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00078125, "completions/max_length": 1053.5, "completions/max_terminated_length": 897.5, "completions/mean_length": 152.1453125, "completions/mean_terminated_length": 150.66837463378906, "completions/min_length": 64.7, "completions/min_terminated_length": 64.7, "entropy": 0.0362132816342637, "epoch": 24.43254817987152, "frac_reward_zero_std": 0.95625, "grad_norm": 0.1435546875, "learning_rate": 8.859100000000001e-06, "loss": -0.0024, "num_tokens": 1139486270.0, "reward": 1.0718164205551148, "reward_std": 0.11685862839221954, "rewards/reward_accuracy/mean": 0.971875, "rewards/reward_accuracy/std": 0.11668286249041557, "rewards/reward_format/mean": 0.09994140639901161, "rewards/reward_format/std": 0.0009375000139698386, "sampling/importance_sampling_ratio/max": 2.367941689491272, "sampling/importance_sampling_ratio/mean": 0.9896826982498169, "sampling/importance_sampling_ratio/min": 0.1806713730096817, "sampling/sampling_logp_difference/max": 0.9182133615016937, "sampling/sampling_logp_difference/mean": 0.003704636846669018, "step": 11410, "step_time": 5.094782758012298 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00859375, "completions/max_length": 1752.2, "completions/max_terminated_length": 1368.4, "completions/mean_length": 185.2640625, "completions/mean_terminated_length": 169.1673599243164, "completions/min_length": 67.6, "completions/min_terminated_length": 67.6, "entropy": 0.05177674910519272, "epoch": 24.453961456102785, "frac_reward_zero_std": 0.85, "grad_norm": 0.7265625, "learning_rate": 8.8581e-06, "loss": -0.0027, "num_tokens": 1140481138.0, "reward": 1.0547266006469727, "reward_std": 0.18395565450191498, "rewards/reward_accuracy/mean": 0.95546875, "rewards/reward_accuracy/std": 0.18100138753652573, "rewards/reward_format/mean": 0.0992578148841858, "rewards/reward_format/std": 0.005668863817118108, "sampling/importance_sampling_ratio/max": 2.4326607465744017, "sampling/importance_sampling_ratio/mean": 0.9609059154987335, "sampling/importance_sampling_ratio/min": 0.05753031224012375, "sampling/sampling_logp_difference/max": 1.234291660785675, "sampling/sampling_logp_difference/mean": 0.0044543516589328645, "step": 11420, "step_time": 8.36930659020436 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003125, "completions/max_length": 1367.4, "completions/max_terminated_length": 1052.5, "completions/mean_length": 167.21171875, "completions/mean_terminated_length": 161.36723937988282, "completions/min_length": 68.7, "completions/min_terminated_length": 68.7, "entropy": 0.04101451146416366, "epoch": 24.475374732334046, "frac_reward_zero_std": 0.91875, "grad_norm": 0.2578125, "learning_rate": 8.8571e-06, "loss": 0.0015, "num_tokens": 1141426848.0, "reward": 1.0658007979393005, "reward_std": 0.14964647293090821, "rewards/reward_accuracy/mean": 0.966015625, "rewards/reward_accuracy/std": 0.14811307787895203, "rewards/reward_format/mean": 0.09978515729308128, "rewards/reward_format/std": 0.002513692481443286, "sampling/importance_sampling_ratio/max": 2.6341578483581545, "sampling/importance_sampling_ratio/mean": 0.98805011510849, "sampling/importance_sampling_ratio/min": 0.08310610055923462, "sampling/sampling_logp_difference/max": 1.2378358602523805, "sampling/sampling_logp_difference/mean": 0.004071460268460214, "step": 11430, "step_time": 6.740105595393106 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 1419.1, "completions/max_terminated_length": 1287.7, "completions/mean_length": 162.181640625, "completions/mean_terminated_length": 154.91649169921874, "completions/min_length": 64.6, "completions/min_terminated_length": 64.6, "entropy": 0.04477128516882658, "epoch": 24.49678800856531, "frac_reward_zero_std": 0.88125, "grad_norm": 0.828125, "learning_rate": 8.856100000000001e-06, "loss": -0.0098, "num_tokens": 1142361761.0, "reward": 1.0512109577655793, "reward_std": 0.1846929520368576, "rewards/reward_accuracy/mean": 0.9515625, "rewards/reward_accuracy/std": 0.18319982290267944, "rewards/reward_format/mean": 0.09964843839406967, "rewards/reward_format/std": 0.0033935268642380834, "sampling/importance_sampling_ratio/max": 2.451378881931305, "sampling/importance_sampling_ratio/mean": 0.9899642884731292, "sampling/importance_sampling_ratio/min": 0.08100753296166659, "sampling/sampling_logp_difference/max": 1.066279363632202, "sampling/sampling_logp_difference/mean": 0.004303198028355837, "step": 11440, "step_time": 6.884404271296807 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 2.8102901069360086e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 2.8102901069360086e-06, "completions/clipped_ratio": 0.00703125, "completions/max_length": 1426.8, "completions/max_terminated_length": 1307.0, "completions/mean_length": 178.9515625, "completions/mean_terminated_length": 165.8474151611328, "completions/min_length": 66.1, "completions/min_terminated_length": 66.1, "entropy": 0.04987931028008461, "epoch": 24.518201284796575, "frac_reward_zero_std": 0.93125, "grad_norm": 0.060546875, "learning_rate": 8.855100000000001e-06, "loss": -0.0055, "num_tokens": 1143335589.0, "reward": 1.0576757907867431, "reward_std": 0.16300193667411805, "rewards/reward_accuracy/mean": 0.958203125, "rewards/reward_accuracy/std": 0.16099151894450187, "rewards/reward_format/mean": 0.09947265684604645, "rewards/reward_format/std": 0.004372774832881987, "sampling/importance_sampling_ratio/max": 2.569707655906677, "sampling/importance_sampling_ratio/mean": 0.9893218338489532, "sampling/importance_sampling_ratio/min": 0.03417431898415089, "sampling/sampling_logp_difference/max": 1.0278971433639525, "sampling/sampling_logp_difference/mean": 0.004209159524179995, "step": 11450, "step_time": 7.045075673612883 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.011328125, "completions/max_length": 1921.0, "completions/max_terminated_length": 1655.8, "completions/mean_length": 181.724609375, "completions/mean_terminated_length": 160.4189697265625, "completions/min_length": 69.1, "completions/min_terminated_length": 69.1, "entropy": 0.05249150732997805, "epoch": 24.539614561027836, "frac_reward_zero_std": 0.89375, "grad_norm": 0.328125, "learning_rate": 8.8541e-06, "loss": -0.0051, "num_tokens": 1144323844.0, "reward": 1.0468164324760436, "reward_std": 0.19154097735881806, "rewards/reward_accuracy/mean": 0.94765625, "rewards/reward_accuracy/std": 0.1882249854505062, "rewards/reward_format/mean": 0.09916015788912773, "rewards/reward_format/std": 0.006704498990438878, "sampling/importance_sampling_ratio/max": 2.4572949171066285, "sampling/importance_sampling_ratio/mean": 0.9987372577190399, "sampling/importance_sampling_ratio/min": 0.07948899269104004, "sampling/sampling_logp_difference/max": 1.018250012397766, "sampling/sampling_logp_difference/mean": 0.004507559351623058, "step": 11460, "step_time": 9.219569683796726 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00234375, "completions/max_length": 1380.4, "completions/max_terminated_length": 1156.3, "completions/mean_length": 158.962890625, "completions/mean_terminated_length": 154.60076751708985, "completions/min_length": 68.0, "completions/min_terminated_length": 68.0, "entropy": 0.0415050431387499, "epoch": 24.5610278372591, "frac_reward_zero_std": 0.925, "grad_norm": 0.5703125, "learning_rate": 8.853100000000002e-06, "loss": -0.0002, "num_tokens": 1145245701.0, "reward": 1.0622851729393006, "reward_std": 0.1658460848033428, "rewards/reward_accuracy/mean": 0.9625, "rewards/reward_accuracy/std": 0.16465722247958184, "rewards/reward_format/mean": 0.09978515729308128, "rewards/reward_format/std": 0.0023221862968057392, "sampling/importance_sampling_ratio/max": 2.4512537837028505, "sampling/importance_sampling_ratio/mean": 0.9899469077587127, "sampling/importance_sampling_ratio/min": 0.1291986234486103, "sampling/sampling_logp_difference/max": 1.113043224811554, "sampling/sampling_logp_difference/mean": 0.003818103391677141, "step": 11470, "step_time": 6.523674901595223 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00078125, "completions/max_length": 1171.3, "completions/max_terminated_length": 935.5, "completions/mean_length": 144.759765625, "completions/mean_terminated_length": 143.26134719848633, "completions/min_length": 67.2, "completions/min_terminated_length": 67.2, "entropy": 0.03921297781635076, "epoch": 24.582441113490365, "frac_reward_zero_std": 0.925, "grad_norm": 0.1015625, "learning_rate": 8.852100000000001e-06, "loss": -0.0053, "num_tokens": 1146135422.0, "reward": 1.0826953291893004, "reward_std": 0.09115807637572289, "rewards/reward_accuracy/mean": 0.9828125, "rewards/reward_accuracy/std": 0.09044206589460373, "rewards/reward_format/mean": 0.09988281354308129, "rewards/reward_format/std": 0.0016351743368431925, "sampling/importance_sampling_ratio/max": 2.410450041294098, "sampling/importance_sampling_ratio/mean": 0.9926283776760101, "sampling/importance_sampling_ratio/min": 0.12632172852754592, "sampling/sampling_logp_difference/max": 1.0280497670173645, "sampling/sampling_logp_difference/mean": 0.0041117801098153, "step": 11480, "step_time": 5.635658663883805 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.007421875, "completions/max_length": 1300.7, "completions/max_terminated_length": 1127.3, "completions/mean_length": 159.901953125, "completions/mean_terminated_length": 145.8620864868164, "completions/min_length": 64.0, "completions/min_terminated_length": 64.0, "entropy": 0.045784329646267, "epoch": 24.603854389721626, "frac_reward_zero_std": 0.91875, "grad_norm": 0.0, "learning_rate": 8.8511e-06, "loss": -0.0039, "num_tokens": 1147059667.0, "reward": 1.0694336235523223, "reward_std": 0.13790928795933724, "rewards/reward_accuracy/mean": 0.969921875, "rewards/reward_accuracy/std": 0.13545964062213897, "rewards/reward_format/mean": 0.09951172098517418, "rewards/reward_format/std": 0.004494223464280367, "sampling/importance_sampling_ratio/max": 2.420927357673645, "sampling/importance_sampling_ratio/mean": 0.9892075538635254, "sampling/importance_sampling_ratio/min": 0.11134791821241379, "sampling/sampling_logp_difference/max": 0.8713419377803803, "sampling/sampling_logp_difference/mean": 0.004220950696617365, "step": 11490, "step_time": 6.445384803894558 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0015625, "completions/max_length": 1295.6, "completions/max_terminated_length": 942.8, "completions/mean_length": 143.333203125, "completions/mean_terminated_length": 140.35352630615233, "completions/min_length": 66.3, "completions/min_terminated_length": 66.3, "entropy": 0.03696079475339502, "epoch": 24.62526766595289, "frac_reward_zero_std": 0.93125, "grad_norm": 0.0, "learning_rate": 8.8501e-06, "loss": 0.0005, "num_tokens": 1147944808.0, "reward": 1.0826757907867433, "reward_std": 0.09347372800111771, "rewards/reward_accuracy/mean": 0.9828125, "rewards/reward_accuracy/std": 0.09246495440602302, "rewards/reward_format/mean": 0.09986328184604645, "rewards/reward_format/std": 0.0019476743880659341, "sampling/importance_sampling_ratio/max": 2.5079275131225587, "sampling/importance_sampling_ratio/mean": 0.9874938786029815, "sampling/importance_sampling_ratio/min": 0.19421122670173646, "sampling/sampling_logp_difference/max": 1.0366042017936707, "sampling/sampling_logp_difference/mean": 0.0038452080218121408, "step": 11500, "step_time": 6.092486617201939 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003125, "completions/max_length": 932.1, "completions/max_terminated_length": 839.8, "completions/mean_length": 139.587109375, "completions/mean_terminated_length": 133.71231842041016, "completions/min_length": 57.5, "completions/min_terminated_length": 57.5, "entropy": 0.03758861490059644, "epoch": 24.646680942184155, "frac_reward_zero_std": 0.94375, "grad_norm": 0.2197265625, "learning_rate": 8.8491e-06, "loss": -0.0042, "num_tokens": 1148811527.0, "reward": 1.0650586128234862, "reward_std": 0.14299491941928863, "rewards/reward_accuracy/mean": 0.965234375, "rewards/reward_accuracy/std": 0.14210830852389336, "rewards/reward_format/mean": 0.0998242199420929, "rewards/reward_format/std": 0.002184226457029581, "sampling/importance_sampling_ratio/max": 2.249864709377289, "sampling/importance_sampling_ratio/mean": 0.9926517009735107, "sampling/importance_sampling_ratio/min": 0.18908779621124266, "sampling/sampling_logp_difference/max": 0.9120428085327148, "sampling/sampling_logp_difference/mean": 0.003727308753877878, "step": 11510, "step_time": 4.822533711008146 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003125, "completions/max_length": 1193.6, "completions/max_terminated_length": 1118.8, "completions/mean_length": 160.71796875, "completions/mean_terminated_length": 154.82896423339844, "completions/min_length": 67.3, "completions/min_terminated_length": 67.3, "entropy": 0.040314287901856004, "epoch": 24.66809421841542, "frac_reward_zero_std": 0.89375, "grad_norm": 0.0, "learning_rate": 8.848100000000001e-06, "loss": -0.0074, "num_tokens": 1149741669.0, "reward": 1.0716406583786011, "reward_std": 0.1297914169728756, "rewards/reward_accuracy/mean": 0.971875, "rewards/reward_accuracy/std": 0.12895720675587655, "rewards/reward_format/mean": 0.09976562708616257, "rewards/reward_format/std": 0.0026552829192951323, "sampling/importance_sampling_ratio/max": 2.379506552219391, "sampling/importance_sampling_ratio/mean": 0.9757439613342285, "sampling/importance_sampling_ratio/min": 0.13265141956508159, "sampling/sampling_logp_difference/max": 0.9841375231742859, "sampling/sampling_logp_difference/mean": 0.0040490796323865656, "step": 11520, "step_time": 5.946366826404119 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00234375, "completions/max_length": 1627.0, "completions/max_terminated_length": 1488.1, "completions/mean_length": 151.3234375, "completions/mean_terminated_length": 146.87671508789063, "completions/min_length": 65.4, "completions/min_terminated_length": 65.4, "entropy": 0.04188539159949869, "epoch": 24.68950749464668, "frac_reward_zero_std": 0.9125, "grad_norm": 0.2431640625, "learning_rate": 8.8471e-06, "loss": -0.0111, "num_tokens": 1150640817.0, "reward": 1.084179699420929, "reward_std": 0.11729680821299553, "rewards/reward_accuracy/mean": 0.984375, "rewards/reward_accuracy/std": 0.11596417054533958, "rewards/reward_format/mean": 0.09980468824505806, "rewards/reward_format/std": 0.0027571487706154587, "sampling/importance_sampling_ratio/max": 2.309400427341461, "sampling/importance_sampling_ratio/mean": 0.9883949041366578, "sampling/importance_sampling_ratio/min": 0.06424383074045181, "sampling/sampling_logp_difference/max": 0.9250307083129883, "sampling/sampling_logp_difference/mean": 0.0040994359413161876, "step": 11530, "step_time": 7.561608352002804 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003125, "completions/max_length": 1299.7, "completions/max_terminated_length": 1073.3, "completions/mean_length": 160.19921875, "completions/mean_terminated_length": 154.34137878417968, "completions/min_length": 62.6, "completions/min_terminated_length": 62.6, "entropy": 0.04335546467918903, "epoch": 24.710920770877944, "frac_reward_zero_std": 0.90625, "grad_norm": 0.224609375, "learning_rate": 8.846100000000002e-06, "loss": -0.0054, "num_tokens": 1151572063.0, "reward": 1.0502148747444153, "reward_std": 0.17701527699828148, "rewards/reward_accuracy/mean": 0.950390625, "rewards/reward_accuracy/std": 0.17631329447031022, "rewards/reward_format/mean": 0.09982422068715095, "rewards/reward_format/std": 0.0022048230282962324, "sampling/importance_sampling_ratio/max": 2.5933863639831545, "sampling/importance_sampling_ratio/mean": 0.994813758134842, "sampling/importance_sampling_ratio/min": 0.11766025573015212, "sampling/sampling_logp_difference/max": 0.9863908171653748, "sampling/sampling_logp_difference/mean": 0.004102376475930214, "step": 11540, "step_time": 6.317032860807376 }, { "clip_ratio/high_max": 2.3992321803234518e-05, "clip_ratio/high_mean": 2.9990402254043148e-06, "clip_ratio/low_mean": 8.839056590659311e-07, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 3.882945884470246e-06, "completions/clipped_ratio": 0.007421875, "completions/max_length": 1589.5, "completions/max_terminated_length": 1306.7, "completions/mean_length": 173.275390625, "completions/mean_terminated_length": 159.44882507324218, "completions/min_length": 69.6, "completions/min_terminated_length": 69.6, "entropy": 0.05174017285462469, "epoch": 24.73233404710921, "frac_reward_zero_std": 0.8875, "grad_norm": 0.103515625, "learning_rate": 8.845100000000001e-06, "loss": -0.0077, "num_tokens": 1152534304.0, "reward": 1.038828146457672, "reward_std": 0.21548354253172874, "rewards/reward_accuracy/mean": 0.939453125, "rewards/reward_accuracy/std": 0.21308973878622056, "rewards/reward_format/mean": 0.09937500059604645, "rewards/reward_format/std": 0.005266284290701151, "sampling/importance_sampling_ratio/max": 2.7031415700912476, "sampling/importance_sampling_ratio/mean": 0.9799237966537475, "sampling/importance_sampling_ratio/min": 0.10528819411993026, "sampling/sampling_logp_difference/max": 1.012935221195221, "sampling/sampling_logp_difference/mean": 0.004526874609291553, "step": 11550, "step_time": 7.829685478491593 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005859375, "completions/max_length": 1362.6, "completions/max_terminated_length": 1097.0, "completions/mean_length": 165.143359375, "completions/mean_terminated_length": 154.068994140625, "completions/min_length": 66.5, "completions/min_terminated_length": 66.5, "entropy": 0.03925480709876865, "epoch": 24.75374732334047, "frac_reward_zero_std": 0.9, "grad_norm": 0.1572265625, "learning_rate": 8.8441e-06, "loss": -0.0, "num_tokens": 1153472751.0, "reward": 1.0578320622444153, "reward_std": 0.15901368260383605, "rewards/reward_accuracy/mean": 0.958203125, "rewards/reward_accuracy/std": 0.1571851849555969, "rewards/reward_format/mean": 0.09962890818715095, "rewards/reward_format/std": 0.003825234086252749, "sampling/importance_sampling_ratio/max": 2.658196806907654, "sampling/importance_sampling_ratio/mean": 0.9937107264995575, "sampling/importance_sampling_ratio/min": 0.09877435863018036, "sampling/sampling_logp_difference/max": 1.0746466517448425, "sampling/sampling_logp_difference/mean": 0.003791561885736883, "step": 11560, "step_time": 6.749646380788181 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001171875, "completions/max_length": 1264.6, "completions/max_terminated_length": 1185.8, "completions/mean_length": 143.499609375, "completions/mean_terminated_length": 141.30639190673827, "completions/min_length": 66.1, "completions/min_terminated_length": 66.1, "entropy": 0.03889824373181909, "epoch": 24.775160599571734, "frac_reward_zero_std": 0.8875, "grad_norm": 0.83203125, "learning_rate": 8.843100000000002e-06, "loss": -0.004, "num_tokens": 1154358158.0, "reward": 1.0803125023841857, "reward_std": 0.09712216258049011, "rewards/reward_accuracy/mean": 0.98046875, "rewards/reward_accuracy/std": 0.09616324603557587, "rewards/reward_format/mean": 0.09984375014901162, "rewards/reward_format/std": 0.0021321487613022326, "sampling/importance_sampling_ratio/max": 2.366607892513275, "sampling/importance_sampling_ratio/mean": 0.9921908736228943, "sampling/importance_sampling_ratio/min": 0.1572517231106758, "sampling/sampling_logp_difference/max": 0.8286054968833924, "sampling/sampling_logp_difference/mean": 0.0038996870163828133, "step": 11570, "step_time": 5.949800437796512 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.008203125, "completions/max_length": 1597.3, "completions/max_terminated_length": 1068.4, "completions/mean_length": 180.34921875, "completions/mean_terminated_length": 165.31766357421876, "completions/min_length": 65.8, "completions/min_terminated_length": 65.8, "entropy": 0.05124708346556872, "epoch": 24.796573875803, "frac_reward_zero_std": 0.90625, "grad_norm": 0.06494140625, "learning_rate": 8.842100000000001e-06, "loss": -0.0092, "num_tokens": 1155340700.0, "reward": 1.0716211199760437, "reward_std": 0.12380107194185257, "rewards/reward_accuracy/mean": 0.972265625, "rewards/reward_accuracy/std": 0.12037106081843377, "rewards/reward_format/mean": 0.09935547038912773, "rewards/reward_format/std": 0.005775287887081504, "sampling/importance_sampling_ratio/max": 2.352944755554199, "sampling/importance_sampling_ratio/mean": 0.9774632334709168, "sampling/importance_sampling_ratio/min": 0.14741878751665355, "sampling/sampling_logp_difference/max": 1.0195234775543214, "sampling/sampling_logp_difference/mean": 0.004190104315057397, "step": 11580, "step_time": 7.896657764105475 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001171875, "completions/max_length": 743.1, "completions/max_terminated_length": 578.6, "completions/mean_length": 137.631640625, "completions/mean_terminated_length": 135.37060775756837, "completions/min_length": 69.1, "completions/min_terminated_length": 69.1, "entropy": 0.03538150938693434, "epoch": 24.817987152034263, "frac_reward_zero_std": 0.9625, "grad_norm": 0.0, "learning_rate": 8.8411e-06, "loss": 0.003, "num_tokens": 1156208973.0, "reward": 1.0869922161102294, "reward_std": 0.07904013991355896, "rewards/reward_accuracy/mean": 0.987109375, "rewards/reward_accuracy/std": 0.07820367589592933, "rewards/reward_format/mean": 0.09988281428813935, "rewards/reward_format/std": 0.001323223067447543, "sampling/importance_sampling_ratio/max": 2.398220980167389, "sampling/importance_sampling_ratio/mean": 0.9995456457138061, "sampling/importance_sampling_ratio/min": 0.2407411053776741, "sampling/sampling_logp_difference/max": 0.8976225256919861, "sampling/sampling_logp_difference/mean": 0.0037757280515506864, "step": 11590, "step_time": 3.9459968934970675 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001171875, "completions/max_length": 1097.1, "completions/max_terminated_length": 992.9, "completions/mean_length": 156.420703125, "completions/mean_terminated_length": 154.22191925048827, "completions/min_length": 61.5, "completions/min_terminated_length": 61.5, "entropy": 0.03933241048362106, "epoch": 24.839400428265524, "frac_reward_zero_std": 0.93125, "grad_norm": 0.0, "learning_rate": 8.8401e-06, "loss": -0.0062, "num_tokens": 1157138322.0, "reward": 1.0732617497444152, "reward_std": 0.10534188523888588, "rewards/reward_accuracy/mean": 0.9734375, "rewards/reward_accuracy/std": 0.10480054095387459, "rewards/reward_format/mean": 0.09982422068715095, "rewards/reward_format/std": 0.0014439307153224946, "sampling/importance_sampling_ratio/max": 2.4240442633628847, "sampling/importance_sampling_ratio/mean": 0.9846010446548462, "sampling/importance_sampling_ratio/min": 0.13089885264635087, "sampling/sampling_logp_difference/max": 1.0958173036575318, "sampling/sampling_logp_difference/mean": 0.003776249778456986, "step": 11600, "step_time": 5.480934574300773 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.007421875, "completions/max_length": 1440.3, "completions/max_terminated_length": 1350.0, "completions/mean_length": 168.93046875, "completions/mean_terminated_length": 155.14053192138672, "completions/min_length": 64.1, "completions/min_terminated_length": 64.1, "entropy": 0.04702919747214764, "epoch": 24.86081370449679, "frac_reward_zero_std": 0.89375, "grad_norm": 0.578125, "learning_rate": 8.8391e-06, "loss": -0.002, "num_tokens": 1158093120.0, "reward": 1.072812521457672, "reward_std": 0.13204583302140235, "rewards/reward_accuracy/mean": 0.9734375, "rewards/reward_accuracy/std": 0.130546697974205, "rewards/reward_format/mean": 0.09937500059604645, "rewards/reward_format/std": 0.0037783582927659156, "sampling/importance_sampling_ratio/max": 2.497168278694153, "sampling/importance_sampling_ratio/mean": 0.9866295754909515, "sampling/importance_sampling_ratio/min": 0.15930032283067702, "sampling/sampling_logp_difference/max": 0.8909991323947907, "sampling/sampling_logp_difference/mean": 0.004193868418224156, "step": 11610, "step_time": 7.115064460792928 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005859375, "completions/max_length": 1230.8, "completions/max_terminated_length": 1024.9, "completions/mean_length": 165.118359375, "completions/mean_terminated_length": 154.11683197021483, "completions/min_length": 69.1, "completions/min_terminated_length": 69.1, "entropy": 0.041004395857453343, "epoch": 24.882226980728053, "frac_reward_zero_std": 0.925, "grad_norm": 0.0, "learning_rate": 8.838100000000001e-06, "loss": -0.0026, "num_tokens": 1159036111.0, "reward": 1.064746117591858, "reward_std": 0.14719562083482743, "rewards/reward_accuracy/mean": 0.965234375, "rewards/reward_accuracy/std": 0.14493229985237122, "rewards/reward_format/mean": 0.09951172024011612, "rewards/reward_format/std": 0.003816214483231306, "sampling/importance_sampling_ratio/max": 2.3247634530067445, "sampling/importance_sampling_ratio/mean": 0.9809003949165345, "sampling/importance_sampling_ratio/min": 0.14737108945846558, "sampling/sampling_logp_difference/max": 1.048286497592926, "sampling/sampling_logp_difference/mean": 0.003942421823740006, "step": 11620, "step_time": 6.449934729078086 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00703125, "completions/max_length": 1393.7, "completions/max_terminated_length": 1263.8, "completions/mean_length": 167.6546875, "completions/mean_terminated_length": 154.51653137207032, "completions/min_length": 66.8, "completions/min_terminated_length": 66.8, "entropy": 0.04341005722526461, "epoch": 24.903640256959314, "frac_reward_zero_std": 0.86875, "grad_norm": 0.201171875, "learning_rate": 8.8371e-06, "loss": -0.0021, "num_tokens": 1159986539.0, "reward": 1.050195336341858, "reward_std": 0.18638237118721007, "rewards/reward_accuracy/mean": 0.95078125, "rewards/reward_accuracy/std": 0.18467846810817717, "rewards/reward_format/mean": 0.09941406399011612, "rewards/reward_format/std": 0.004106687498278916, "sampling/importance_sampling_ratio/max": 2.5846595048904417, "sampling/importance_sampling_ratio/mean": 0.9851103246212005, "sampling/importance_sampling_ratio/min": 0.11403252370655537, "sampling/sampling_logp_difference/max": 1.07488956451416, "sampling/sampling_logp_difference/mean": 0.0038216853979974987, "step": 11630, "step_time": 6.78461997990089 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00078125, "completions/max_length": 656.0, "completions/max_terminated_length": 579.7, "completions/mean_length": 133.59765625, "completions/mean_terminated_length": 132.11268157958983, "completions/min_length": 59.7, "completions/min_terminated_length": 59.7, "entropy": 0.03204650692641735, "epoch": 24.925053533190578, "frac_reward_zero_std": 0.95625, "grad_norm": 0.06640625, "learning_rate": 8.8361e-06, "loss": -0.0009, "num_tokens": 1160845109.0, "reward": 1.079648458957672, "reward_std": 0.09690443426370621, "rewards/reward_accuracy/mean": 0.9796875, "rewards/reward_accuracy/std": 0.09674532264471054, "rewards/reward_format/mean": 0.0999609388411045, "rewards/reward_format/std": 0.0006250000558793544, "sampling/importance_sampling_ratio/max": 2.5285298109054564, "sampling/importance_sampling_ratio/mean": 0.9996402621269226, "sampling/importance_sampling_ratio/min": 0.19453845918178558, "sampling/sampling_logp_difference/max": 1.2302896201610565, "sampling/sampling_logp_difference/mean": 0.0036977163748815657, "step": 11640, "step_time": 3.4975309082947206 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005078125, "completions/max_length": 1299.0, "completions/max_terminated_length": 938.1, "completions/mean_length": 163.11015625, "completions/mean_terminated_length": 153.65223236083983, "completions/min_length": 70.1, "completions/min_terminated_length": 70.1, "entropy": 0.0430661903694272, "epoch": 24.946466809421842, "frac_reward_zero_std": 0.90625, "grad_norm": 0.0, "learning_rate": 8.835100000000001e-06, "loss": 0.0034, "num_tokens": 1161773039.0, "reward": 1.0783398628234864, "reward_std": 0.10861445888876915, "rewards/reward_accuracy/mean": 0.97890625, "rewards/reward_accuracy/std": 0.10595177933573723, "rewards/reward_format/mean": 0.09943359419703483, "rewards/reward_format/std": 0.004390925215557217, "sampling/importance_sampling_ratio/max": 2.3853073835372927, "sampling/importance_sampling_ratio/mean": 0.990993994474411, "sampling/importance_sampling_ratio/min": 0.13993528187274934, "sampling/sampling_logp_difference/max": 0.9645407199859619, "sampling/sampling_logp_difference/mean": 0.0039678989443928, "step": 11650, "step_time": 6.5280851492017975 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001953125, "completions/max_length": 1346.4, "completions/max_terminated_length": 1258.1, "completions/mean_length": 151.483203125, "completions/mean_terminated_length": 147.8320114135742, "completions/min_length": 60.4, "completions/min_terminated_length": 60.4, "entropy": 0.04319322386290878, "epoch": 24.967880085653103, "frac_reward_zero_std": 0.90625, "grad_norm": 0.0, "learning_rate": 8.8341e-06, "loss": 0.0014, "num_tokens": 1162675428.0, "reward": 1.0689062654972077, "reward_std": 0.11991382017731667, "rewards/reward_accuracy/mean": 0.969140625, "rewards/reward_accuracy/std": 0.11927450820803642, "rewards/reward_format/mean": 0.09976562485098839, "rewards/reward_format/std": 0.002953278413042426, "sampling/importance_sampling_ratio/max": 2.3345097064971925, "sampling/importance_sampling_ratio/mean": 0.988205224275589, "sampling/importance_sampling_ratio/min": 0.10267329998314381, "sampling/sampling_logp_difference/max": 0.9835515737533569, "sampling/sampling_logp_difference/mean": 0.0042690388858318325, "step": 11660, "step_time": 6.265104782595881 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 3.9706595543975706e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 3.9706595543975706e-06, "completions/clipped_ratio": 0.009765625, "completions/max_length": 1331.0, "completions/max_terminated_length": 1060.5, "completions/mean_length": 166.38984375, "completions/mean_terminated_length": 147.92832794189454, "completions/min_length": 62.7, "completions/min_terminated_length": 62.7, "entropy": 0.04110856696497649, "epoch": 24.989293361884368, "frac_reward_zero_std": 0.9125, "grad_norm": 0.490234375, "learning_rate": 8.833100000000002e-06, "loss": -0.0027, "num_tokens": 1163618218.0, "reward": 1.0525586009025574, "reward_std": 0.16967344358563424, "rewards/reward_accuracy/mean": 0.953515625, "rewards/reward_accuracy/std": 0.1661395438015461, "rewards/reward_format/mean": 0.09904296919703484, "rewards/reward_format/std": 0.005833205860108137, "sampling/importance_sampling_ratio/max": 2.5621554613113404, "sampling/importance_sampling_ratio/mean": 0.9896980345249176, "sampling/importance_sampling_ratio/min": 0.08940293490886689, "sampling/sampling_logp_difference/max": 1.0729960203170776, "sampling/sampling_logp_difference/mean": 0.0037609555525705217, "step": 11670, "step_time": 6.889724023305462 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005859375, "completions/max_length": 1446.8, "completions/max_terminated_length": 1151.9, "completions/mean_length": 155.0359375, "completions/mean_terminated_length": 143.91909790039062, "completions/min_length": 66.7, "completions/min_terminated_length": 66.7, "entropy": 0.040591302700340746, "epoch": 25.010706638115632, "frac_reward_zero_std": 0.9125, "grad_norm": 0.10595703125, "learning_rate": 8.832100000000001e-06, "loss": -0.0116, "num_tokens": 1164531974.0, "reward": 1.0801757991313934, "reward_std": 0.09989474595058709, "rewards/reward_accuracy/mean": 0.98046875, "rewards/reward_accuracy/std": 0.09806107506155967, "rewards/reward_format/mean": 0.09970703274011612, "rewards/reward_format/std": 0.0030193310929462315, "sampling/importance_sampling_ratio/max": 2.5384386777877808, "sampling/importance_sampling_ratio/mean": 0.9890837848186493, "sampling/importance_sampling_ratio/min": 0.034183576330542566, "sampling/sampling_logp_difference/max": 1.0634939789772033, "sampling/sampling_logp_difference/mean": 0.0041737109888345, "step": 11680, "step_time": 6.815765389511943 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003125, "completions/max_length": 1077.3, "completions/max_terminated_length": 918.0, "completions/mean_length": 147.726953125, "completions/mean_terminated_length": 141.8236099243164, "completions/min_length": 67.3, "completions/min_terminated_length": 67.3, "entropy": 0.036078854999504986, "epoch": 25.032119914346897, "frac_reward_zero_std": 0.9125, "grad_norm": 0.29296875, "learning_rate": 8.831100000000001e-06, "loss": -0.0038, "num_tokens": 1165428299.0, "reward": 1.0677148699760437, "reward_std": 0.13663432002067566, "rewards/reward_accuracy/mean": 0.96796875, "rewards/reward_accuracy/std": 0.13574677482247352, "rewards/reward_format/mean": 0.09974609538912774, "rewards/reward_format/std": 0.0023959687910974025, "sampling/importance_sampling_ratio/max": 2.420542597770691, "sampling/importance_sampling_ratio/mean": 0.9959983408451081, "sampling/importance_sampling_ratio/min": 0.16519849747419357, "sampling/sampling_logp_difference/max": 0.9878079175949097, "sampling/sampling_logp_difference/mean": 0.003753657778725028, "step": 11690, "step_time": 5.363844746598625 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0015625, "completions/max_length": 979.3, "completions/max_terminated_length": 577.6, "completions/mean_length": 143.98359375, "completions/mean_terminated_length": 141.0315704345703, "completions/min_length": 59.9, "completions/min_terminated_length": 59.9, "entropy": 0.035307901841588316, "epoch": 25.053533190578158, "frac_reward_zero_std": 0.95, "grad_norm": 0.208984375, "learning_rate": 8.8301e-06, "loss": 0.0009, "num_tokens": 1166317409.0, "reward": 1.0784765839576722, "reward_std": 0.09941446185111999, "rewards/reward_accuracy/mean": 0.978515625, "rewards/reward_accuracy/std": 0.09912607222795486, "rewards/reward_format/mean": 0.0999609388411045, "rewards/reward_format/std": 0.0006250000558793544, "sampling/importance_sampling_ratio/max": 2.447040283679962, "sampling/importance_sampling_ratio/mean": 0.9919553101062775, "sampling/importance_sampling_ratio/min": 0.13482314571738244, "sampling/sampling_logp_difference/max": 0.9930066108703614, "sampling/sampling_logp_difference/mean": 0.003762523317709565, "step": 11700, "step_time": 4.816365924794809 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 2.5022890895343155e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 2.5022890895343155e-06, "completions/clipped_ratio": 0.008984375, "completions/max_length": 1339.1, "completions/max_terminated_length": 1188.0, "completions/mean_length": 168.430859375, "completions/mean_terminated_length": 151.62194213867187, "completions/min_length": 66.8, "completions/min_terminated_length": 66.8, "entropy": 0.04620353525970131, "epoch": 25.074946466809422, "frac_reward_zero_std": 0.9125, "grad_norm": 0.330078125, "learning_rate": 8.8291e-06, "loss": -0.008, "num_tokens": 1167268480.0, "reward": 1.062265646457672, "reward_std": 0.15694005712866782, "rewards/reward_accuracy/mean": 0.962890625, "rewards/reward_accuracy/std": 0.15426238030195236, "rewards/reward_format/mean": 0.09937500134110451, "rewards/reward_format/std": 0.005006308760493993, "sampling/importance_sampling_ratio/max": 2.520407557487488, "sampling/importance_sampling_ratio/mean": 0.9860046327114105, "sampling/importance_sampling_ratio/min": 0.06468951627612114, "sampling/sampling_logp_difference/max": 0.9298304319381714, "sampling/sampling_logp_difference/mean": 0.004236089950427413, "step": 11710, "step_time": 6.614795396014233 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0046875, "completions/max_length": 1518.8, "completions/max_terminated_length": 1179.7, "completions/mean_length": 156.046875, "completions/mean_terminated_length": 147.20402297973632, "completions/min_length": 62.1, "completions/min_terminated_length": 62.1, "entropy": 0.04650615768041462, "epoch": 25.096359743040686, "frac_reward_zero_std": 0.90625, "grad_norm": 0.0, "learning_rate": 8.828100000000001e-06, "loss": -0.0079, "num_tokens": 1168184568.0, "reward": 1.0715625405311584, "reward_std": 0.12740758955478668, "rewards/reward_accuracy/mean": 0.971875, "rewards/reward_accuracy/std": 0.1256304793059826, "rewards/reward_format/mean": 0.0996875025331974, "rewards/reward_format/std": 0.0034980851924046874, "sampling/importance_sampling_ratio/max": 2.326052558422089, "sampling/importance_sampling_ratio/mean": 0.983920568227768, "sampling/importance_sampling_ratio/min": 0.06883149892091751, "sampling/sampling_logp_difference/max": 0.9687305986881256, "sampling/sampling_logp_difference/mean": 0.004082873254083097, "step": 11720, "step_time": 7.411906878411537 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001171875, "completions/max_length": 1068.5, "completions/max_terminated_length": 1024.3, "completions/mean_length": 157.50390625, "completions/mean_terminated_length": 155.2931884765625, "completions/min_length": 69.9, "completions/min_terminated_length": 69.9, "entropy": 0.04176198339555413, "epoch": 25.117773019271947, "frac_reward_zero_std": 0.95, "grad_norm": 0.25, "learning_rate": 8.8271e-06, "loss": -0.0051, "num_tokens": 1169112754.0, "reward": 1.0627148628234864, "reward_std": 0.1308155559003353, "rewards/reward_accuracy/mean": 0.962890625, "rewards/reward_accuracy/std": 0.13050552681088448, "rewards/reward_format/mean": 0.0998242199420929, "rewards/reward_format/std": 0.001544908178038895, "sampling/importance_sampling_ratio/max": 2.3634698390960693, "sampling/importance_sampling_ratio/mean": 0.986687821149826, "sampling/importance_sampling_ratio/min": 0.1103975385427475, "sampling/sampling_logp_difference/max": 0.9080157041549682, "sampling/sampling_logp_difference/mean": 0.003961260593496263, "step": 11730, "step_time": 5.399184458187665 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0078125, "completions/max_length": 1620.8, "completions/max_terminated_length": 1364.5, "completions/mean_length": 161.604296875, "completions/mean_terminated_length": 146.84166870117187, "completions/min_length": 64.8, "completions/min_terminated_length": 64.8, "entropy": 0.04128730827942491, "epoch": 25.13918629550321, "frac_reward_zero_std": 0.91875, "grad_norm": 0.279296875, "learning_rate": 8.8261e-06, "loss": -0.0065, "num_tokens": 1170039549.0, "reward": 1.0685547232627868, "reward_std": 0.13831521496176719, "rewards/reward_accuracy/mean": 0.969140625, "rewards/reward_accuracy/std": 0.13573938310146333, "rewards/reward_format/mean": 0.09941406473517418, "rewards/reward_format/std": 0.005008798930794001, "sampling/importance_sampling_ratio/max": 2.434616434574127, "sampling/importance_sampling_ratio/mean": 0.9761597692966462, "sampling/importance_sampling_ratio/min": 0.15574621325358748, "sampling/sampling_logp_difference/max": 1.0427399396896362, "sampling/sampling_logp_difference/mean": 0.004120216704905033, "step": 11740, "step_time": 7.836080552591011 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.002734375, "completions/max_length": 1379.0, "completions/max_terminated_length": 964.4, "completions/mean_length": 147.533984375, "completions/mean_terminated_length": 142.36864013671874, "completions/min_length": 66.6, "completions/min_terminated_length": 66.6, "entropy": 0.0367814481491223, "epoch": 25.160599571734476, "frac_reward_zero_std": 0.95, "grad_norm": 0.0, "learning_rate": 8.825100000000001e-06, "loss": -0.0047, "num_tokens": 1170939844.0, "reward": 1.0755664229393005, "reward_std": 0.11806240677833557, "rewards/reward_accuracy/mean": 0.97578125, "rewards/reward_accuracy/std": 0.11677940785884858, "rewards/reward_format/mean": 0.09978515803813934, "rewards/reward_format/std": 0.002147300215438008, "sampling/importance_sampling_ratio/max": 2.5570509672164916, "sampling/importance_sampling_ratio/mean": 0.997406804561615, "sampling/importance_sampling_ratio/min": 0.1294231027364731, "sampling/sampling_logp_difference/max": 0.9700933575630188, "sampling/sampling_logp_difference/mean": 0.0038160794880241155, "step": 11750, "step_time": 6.542373317896272 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.006640625, "completions/max_length": 1328.8, "completions/max_terminated_length": 1138.9, "completions/mean_length": 171.7421875, "completions/mean_terminated_length": 159.5953628540039, "completions/min_length": 70.1, "completions/min_terminated_length": 70.1, "entropy": 0.04441801675129682, "epoch": 25.182012847965737, "frac_reward_zero_std": 0.9, "grad_norm": 0.056396484375, "learning_rate": 8.8241e-06, "loss": -0.0107, "num_tokens": 1171900672.0, "reward": 1.058203136920929, "reward_std": 0.16885271444916725, "rewards/reward_accuracy/mean": 0.95859375, "rewards/reward_accuracy/std": 0.16754491105675698, "rewards/reward_format/mean": 0.09960937574505806, "rewards/reward_format/std": 0.0026487976545467974, "sampling/importance_sampling_ratio/max": 2.44380499124527, "sampling/importance_sampling_ratio/mean": 0.9867900133132934, "sampling/importance_sampling_ratio/min": 0.14569816794246435, "sampling/sampling_logp_difference/max": 0.8336219549179077, "sampling/sampling_logp_difference/mean": 0.004068160010501742, "step": 11760, "step_time": 6.452340313783497 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00234375, "completions/max_length": 1083.3, "completions/max_terminated_length": 743.2, "completions/mean_length": 151.8203125, "completions/mean_terminated_length": 147.41795196533204, "completions/min_length": 65.6, "completions/min_terminated_length": 65.6, "entropy": 0.03558928295969963, "epoch": 25.203426124197, "frac_reward_zero_std": 0.91875, "grad_norm": 0.330078125, "learning_rate": 8.8231e-06, "loss": 0.0003, "num_tokens": 1172809428.0, "reward": 1.0759375274181366, "reward_std": 0.11766184195876121, "rewards/reward_accuracy/mean": 0.976171875, "rewards/reward_accuracy/std": 0.11607105433940887, "rewards/reward_format/mean": 0.0997656263411045, "rewards/reward_format/std": 0.0024903098121285437, "sampling/importance_sampling_ratio/max": 2.5566115856170653, "sampling/importance_sampling_ratio/mean": 0.9887578547000885, "sampling/importance_sampling_ratio/min": 0.14180979132652283, "sampling/sampling_logp_difference/max": 0.919329297542572, "sampling/sampling_logp_difference/mean": 0.0036144728306680917, "step": 11770, "step_time": 5.3436689309193754 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003125, "completions/max_length": 1286.6, "completions/max_terminated_length": 984.7, "completions/mean_length": 154.629296875, "completions/mean_terminated_length": 148.74538803100586, "completions/min_length": 64.9, "completions/min_terminated_length": 64.9, "entropy": 0.03473868323490024, "epoch": 25.224839400428266, "frac_reward_zero_std": 0.94375, "grad_norm": 0.0, "learning_rate": 8.822100000000001e-06, "loss": -0.0044, "num_tokens": 1173724223.0, "reward": 1.0649609565734863, "reward_std": 0.1467112921178341, "rewards/reward_accuracy/mean": 0.965234375, "rewards/reward_accuracy/std": 0.1451020561158657, "rewards/reward_format/mean": 0.0997265636920929, "rewards/reward_format/std": 0.00287779972422868, "sampling/importance_sampling_ratio/max": 2.426754415035248, "sampling/importance_sampling_ratio/mean": 0.9870110750198364, "sampling/importance_sampling_ratio/min": 0.14204904288053513, "sampling/sampling_logp_difference/max": 1.0216006457805633, "sampling/sampling_logp_difference/mean": 0.0035395718878135085, "step": 11780, "step_time": 6.3110700825112875 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003515625, "completions/max_length": 1183.3, "completions/max_terminated_length": 1169.7, "completions/mean_length": 157.576171875, "completions/mean_terminated_length": 151.05646209716798, "completions/min_length": 62.4, "completions/min_terminated_length": 62.4, "entropy": 0.03882357107941061, "epoch": 25.24625267665953, "frac_reward_zero_std": 0.91875, "grad_norm": 0.390625, "learning_rate": 8.821100000000001e-06, "loss": -0.0047, "num_tokens": 1174647666.0, "reward": 1.070410180091858, "reward_std": 0.11960920616984368, "rewards/reward_accuracy/mean": 0.970703125, "rewards/reward_accuracy/std": 0.11836637333035469, "rewards/reward_format/mean": 0.09970703274011612, "rewards/reward_format/std": 0.00279677405487746, "sampling/importance_sampling_ratio/max": 2.5353647232055665, "sampling/importance_sampling_ratio/mean": 0.9867514133453369, "sampling/importance_sampling_ratio/min": 0.1615223990753293, "sampling/sampling_logp_difference/max": 0.9273634076118469, "sampling/sampling_logp_difference/mean": 0.003860479546710849, "step": 11790, "step_time": 5.755739016502048 }, { "clip_ratio/high_max": 1.66917045135051e-05, "clip_ratio/high_mean": 2.0864630641881376e-06, "clip_ratio/low_mean": 3.8618386497546455e-07, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 2.472646929163602e-06, "completions/clipped_ratio": 0.009765625, "completions/max_length": 1481.0, "completions/max_terminated_length": 1169.7, "completions/mean_length": 177.7171875, "completions/mean_terminated_length": 159.68216934204102, "completions/min_length": 67.5, "completions/min_terminated_length": 67.5, "entropy": 0.05036316788755357, "epoch": 25.26766595289079, "frac_reward_zero_std": 0.91875, "grad_norm": 0.134765625, "learning_rate": 8.8201e-06, "loss": -0.0058, "num_tokens": 1175632894.0, "reward": 1.0573046922683715, "reward_std": 0.13658633306622506, "rewards/reward_accuracy/mean": 0.9578125, "rewards/reward_accuracy/std": 0.13458233550190926, "rewards/reward_format/mean": 0.09949218705296517, "rewards/reward_format/std": 0.004087644279934466, "sampling/importance_sampling_ratio/max": 2.5561742782592773, "sampling/importance_sampling_ratio/mean": 0.9906927466392517, "sampling/importance_sampling_ratio/min": 0.073750451952219, "sampling/sampling_logp_difference/max": 1.1589884757995605, "sampling/sampling_logp_difference/mean": 0.004245465574786067, "step": 11800, "step_time": 7.391666824495769 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 1344.3, "completions/max_terminated_length": 1256.4, "completions/mean_length": 185.33125, "completions/mean_terminated_length": 178.0671188354492, "completions/min_length": 64.0, "completions/min_terminated_length": 64.0, "entropy": 0.049547436111606655, "epoch": 25.289079229122056, "frac_reward_zero_std": 0.925, "grad_norm": 0.2578125, "learning_rate": 8.8191e-06, "loss": -0.0086, "num_tokens": 1176630414.0, "reward": 1.0613476872444152, "reward_std": 0.14130059331655503, "rewards/reward_accuracy/mean": 0.96171875, "rewards/reward_accuracy/std": 0.13952610343694688, "rewards/reward_format/mean": 0.09962890893220902, "rewards/reward_format/std": 0.003720488352701068, "sampling/importance_sampling_ratio/max": 2.4948147773742675, "sampling/importance_sampling_ratio/mean": 0.9821997702121734, "sampling/importance_sampling_ratio/min": 0.08458269909024238, "sampling/sampling_logp_difference/max": 0.9189260065555572, "sampling/sampling_logp_difference/mean": 0.004214448062703014, "step": 11810, "step_time": 6.836644690320827 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00546875, "completions/max_length": 1523.9, "completions/max_terminated_length": 1352.9, "completions/mean_length": 161.015625, "completions/mean_terminated_length": 150.64349212646485, "completions/min_length": 65.7, "completions/min_terminated_length": 65.7, "entropy": 0.045230041607283056, "epoch": 25.31049250535332, "frac_reward_zero_std": 0.89375, "grad_norm": 0.0, "learning_rate": 8.818100000000001e-06, "loss": -0.0042, "num_tokens": 1177556598.0, "reward": 1.0714062690734862, "reward_std": 0.13925908207893373, "rewards/reward_accuracy/mean": 0.971875, "rewards/reward_accuracy/std": 0.13716317638754844, "rewards/reward_format/mean": 0.0995312511920929, "rewards/reward_format/std": 0.003902346082031727, "sampling/importance_sampling_ratio/max": 2.5539433479309084, "sampling/importance_sampling_ratio/mean": 0.9914376139640808, "sampling/importance_sampling_ratio/min": 0.060658641159534454, "sampling/sampling_logp_difference/max": 1.0273974418640137, "sampling/sampling_logp_difference/mean": 0.004290882148779929, "step": 11820, "step_time": 7.25341065050161 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 1271.2, "completions/max_terminated_length": 1241.9, "completions/mean_length": 161.7890625, "completions/mean_terminated_length": 154.37800140380858, "completions/min_length": 65.5, "completions/min_terminated_length": 65.5, "entropy": 0.0441022815881297, "epoch": 25.33190578158458, "frac_reward_zero_std": 0.925, "grad_norm": 0.2470703125, "learning_rate": 8.8171e-06, "loss": -0.0039, "num_tokens": 1178490410.0, "reward": 1.0477929770946504, "reward_std": 0.15210459530353546, "rewards/reward_accuracy/mean": 0.948046875, "rewards/reward_accuracy/std": 0.15122396424412726, "rewards/reward_format/mean": 0.09974609464406967, "rewards/reward_format/std": 0.0030663751531392336, "sampling/importance_sampling_ratio/max": 2.53404324054718, "sampling/importance_sampling_ratio/mean": 0.9917299687862396, "sampling/importance_sampling_ratio/min": 0.10408545956015587, "sampling/sampling_logp_difference/max": 0.9722975611686706, "sampling/sampling_logp_difference/mean": 0.0041565669933333995, "step": 11830, "step_time": 6.283727008593269 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0046875, "completions/max_length": 1395.3, "completions/max_terminated_length": 1188.1, "completions/mean_length": 154.3375, "completions/mean_terminated_length": 145.59228973388673, "completions/min_length": 62.4, "completions/min_terminated_length": 62.4, "entropy": 0.0405486473813653, "epoch": 25.353319057815845, "frac_reward_zero_std": 0.9125, "grad_norm": 0.451171875, "learning_rate": 8.8161e-06, "loss": -0.0071, "num_tokens": 1179395594.0, "reward": 1.0672656536102294, "reward_std": 0.15203482583165168, "rewards/reward_accuracy/mean": 0.967578125, "rewards/reward_accuracy/std": 0.1502921961247921, "rewards/reward_format/mean": 0.09968750178813934, "rewards/reward_format/std": 0.003483801265247166, "sampling/importance_sampling_ratio/max": 2.3675787448883057, "sampling/importance_sampling_ratio/mean": 0.9899256646633148, "sampling/importance_sampling_ratio/min": 0.11071269363164901, "sampling/sampling_logp_difference/max": 1.0320440471172332, "sampling/sampling_logp_difference/mean": 0.003950852225534618, "step": 11840, "step_time": 6.718835869888426 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.004296875, "completions/max_length": 1310.5, "completions/max_terminated_length": 1206.3, "completions/mean_length": 153.28203125, "completions/mean_terminated_length": 145.1484573364258, "completions/min_length": 64.5, "completions/min_terminated_length": 64.5, "entropy": 0.037813770258799194, "epoch": 25.37473233404711, "frac_reward_zero_std": 0.95, "grad_norm": 0.2392578125, "learning_rate": 8.815100000000001e-06, "loss": -0.0012, "num_tokens": 1180305916.0, "reward": 1.0684961080551147, "reward_std": 0.14972420036792755, "rewards/reward_accuracy/mean": 0.96875, "rewards/reward_accuracy/std": 0.14839933067560196, "rewards/reward_format/mean": 0.09974609389901161, "rewards/reward_format/std": 0.0023739393102005122, "sampling/importance_sampling_ratio/max": 2.450427508354187, "sampling/importance_sampling_ratio/mean": 0.9861262619495392, "sampling/importance_sampling_ratio/min": 0.1130578049167525, "sampling/sampling_logp_difference/max": 0.9610527753829956, "sampling/sampling_logp_difference/mean": 0.003870393196120858, "step": 11850, "step_time": 6.309454314090544 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.002734375, "completions/max_length": 1195.8, "completions/max_terminated_length": 1119.6, "completions/mean_length": 155.59140625, "completions/mean_terminated_length": 150.45433044433594, "completions/min_length": 64.0, "completions/min_terminated_length": 64.0, "entropy": 0.041029513953253625, "epoch": 25.396145610278374, "frac_reward_zero_std": 0.9375, "grad_norm": 0.2578125, "learning_rate": 8.814100000000001e-06, "loss": -0.0015, "num_tokens": 1181223014.0, "reward": 1.0673437714576721, "reward_std": 0.12696166038513185, "rewards/reward_accuracy/mean": 0.967578125, "rewards/reward_accuracy/std": 0.12598090395331382, "rewards/reward_format/mean": 0.0997656263411045, "rewards/reward_format/std": 0.001963627152144909, "sampling/importance_sampling_ratio/max": 2.4527623295783996, "sampling/importance_sampling_ratio/mean": 0.9843600451946258, "sampling/importance_sampling_ratio/min": 0.13035919852554798, "sampling/sampling_logp_difference/max": 1.0165546178817748, "sampling/sampling_logp_difference/mean": 0.004008096852339804, "step": 11860, "step_time": 5.963260158995399 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.002734375, "completions/max_length": 1481.1, "completions/max_terminated_length": 856.8, "completions/mean_length": 140.816015625, "completions/mean_terminated_length": 135.6081558227539, "completions/min_length": 62.8, "completions/min_terminated_length": 62.8, "entropy": 0.03537583530414849, "epoch": 25.417558886509635, "frac_reward_zero_std": 0.925, "grad_norm": 0.30078125, "learning_rate": 8.8131e-06, "loss": -0.0078, "num_tokens": 1182101407.0, "reward": 1.0748828411102296, "reward_std": 0.12756555825471877, "rewards/reward_accuracy/mean": 0.975, "rewards/reward_accuracy/std": 0.12712220400571822, "rewards/reward_format/mean": 0.09988281428813935, "rewards/reward_format/std": 0.0015071487054228784, "sampling/importance_sampling_ratio/max": 2.357948386669159, "sampling/importance_sampling_ratio/mean": 0.9985323369503021, "sampling/importance_sampling_ratio/min": 0.14200379252433776, "sampling/sampling_logp_difference/max": 0.9147125005722045, "sampling/sampling_logp_difference/mean": 0.00355046393815428, "step": 11870, "step_time": 6.982885360217187 }, { "clip_ratio/high_max": 1.657835891819559e-05, "clip_ratio/high_mean": 2.0722948647744486e-06, "clip_ratio/low_mean": 3.5820723951474067e-07, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 2.4305021042891896e-06, "completions/clipped_ratio": 0.013671875, "completions/max_length": 1445.9, "completions/max_terminated_length": 1200.7, "completions/mean_length": 176.878515625, "completions/mean_terminated_length": 151.31011047363282, "completions/min_length": 65.7, "completions/min_terminated_length": 65.7, "entropy": 0.04915819857269525, "epoch": 25.4389721627409, "frac_reward_zero_std": 0.91875, "grad_norm": 0.271484375, "learning_rate": 8.812100000000002e-06, "loss": -0.0057, "num_tokens": 1183067448.0, "reward": 1.0656836092472077, "reward_std": 0.1416800282895565, "rewards/reward_accuracy/mean": 0.966796875, "rewards/reward_accuracy/std": 0.13829569444060325, "rewards/reward_format/mean": 0.09888671934604645, "rewards/reward_format/std": 0.00515456038992852, "sampling/importance_sampling_ratio/max": 2.701939344406128, "sampling/importance_sampling_ratio/mean": 0.9946448266506195, "sampling/importance_sampling_ratio/min": 0.12320302911102772, "sampling/sampling_logp_difference/max": 0.9673017501831055, "sampling/sampling_logp_difference/mean": 0.0043388258432969454, "step": 11880, "step_time": 7.193997881593532 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005078125, "completions/max_length": 1238.6, "completions/max_terminated_length": 1160.1, "completions/mean_length": 158.3640625, "completions/mean_terminated_length": 148.79217834472655, "completions/min_length": 67.8, "completions/min_terminated_length": 67.8, "entropy": 0.04238548080902547, "epoch": 25.460385438972164, "frac_reward_zero_std": 0.93125, "grad_norm": 0.404296875, "learning_rate": 8.8111e-06, "loss": -0.0068, "num_tokens": 1183991148.0, "reward": 1.0562890708446502, "reward_std": 0.16018104404211045, "rewards/reward_accuracy/mean": 0.956640625, "rewards/reward_accuracy/std": 0.15896804332733155, "rewards/reward_format/mean": 0.09964843839406967, "rewards/reward_format/std": 0.003496131976135075, "sampling/importance_sampling_ratio/max": 2.4603914976119996, "sampling/importance_sampling_ratio/mean": 0.9775571286678314, "sampling/importance_sampling_ratio/min": 0.13462534844875335, "sampling/sampling_logp_difference/max": 1.3377642989158631, "sampling/sampling_logp_difference/mean": 0.0040517274755984545, "step": 11890, "step_time": 6.374461749196053 }, { "clip_ratio/high_max": 1.891074061859399e-05, "clip_ratio/high_mean": 2.3638425773242488e-06, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 2.3638425773242488e-06, "completions/clipped_ratio": 0.005859375, "completions/max_length": 1234.4, "completions/max_terminated_length": 1171.9, "completions/mean_length": 174.16328125, "completions/mean_terminated_length": 163.29283599853517, "completions/min_length": 66.2, "completions/min_terminated_length": 66.2, "entropy": 0.04546874447260052, "epoch": 25.481798715203425, "frac_reward_zero_std": 0.875, "grad_norm": 0.1923828125, "learning_rate": 8.8101e-06, "loss": -0.0055, "num_tokens": 1184956894.0, "reward": 1.0588086128234864, "reward_std": 0.1531827323138714, "rewards/reward_accuracy/mean": 0.959375, "rewards/reward_accuracy/std": 0.1516093872487545, "rewards/reward_format/mean": 0.09943359494209289, "rewards/reward_format/std": 0.004315547179430723, "sampling/importance_sampling_ratio/max": 2.5288573026657106, "sampling/importance_sampling_ratio/mean": 0.9872206091880799, "sampling/importance_sampling_ratio/min": 0.09961127638816833, "sampling/sampling_logp_difference/max": 1.2087453722953796, "sampling/sampling_logp_difference/mean": 0.004113558423705399, "step": 11900, "step_time": 6.452995392802404 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.002734375, "completions/max_length": 1625.7, "completions/max_terminated_length": 1435.2, "completions/mean_length": 156.61328125, "completions/mean_terminated_length": 151.47765045166017, "completions/min_length": 66.5, "completions/min_terminated_length": 66.5, "entropy": 0.04371105674654245, "epoch": 25.50321199143469, "frac_reward_zero_std": 0.9375, "grad_norm": 0.0, "learning_rate": 8.8091e-06, "loss": -0.0028, "num_tokens": 1185873696.0, "reward": 1.0684961080551147, "reward_std": 0.14874159768223763, "rewards/reward_accuracy/mean": 0.96875, "rewards/reward_accuracy/std": 0.14743277803063393, "rewards/reward_format/mean": 0.09974609538912774, "rewards/reward_format/std": 0.0030236831167712807, "sampling/importance_sampling_ratio/max": 2.470234763622284, "sampling/importance_sampling_ratio/mean": 0.9912668764591217, "sampling/importance_sampling_ratio/min": 0.12727488875389098, "sampling/sampling_logp_difference/max": 0.8812731504440308, "sampling/sampling_logp_difference/mean": 0.004066002205945551, "step": 11910, "step_time": 7.8491199426091045 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.007421875, "completions/max_length": 1685.0, "completions/max_terminated_length": 1354.6, "completions/mean_length": 178.99375, "completions/mean_terminated_length": 165.09283294677735, "completions/min_length": 62.1, "completions/min_terminated_length": 62.1, "entropy": 0.05234497853089124, "epoch": 25.524625267665954, "frac_reward_zero_std": 0.86875, "grad_norm": 0.0, "learning_rate": 8.808100000000001e-06, "loss": -0.0113, "num_tokens": 1186852384.0, "reward": 1.0564453303813934, "reward_std": 0.17451434582471848, "rewards/reward_accuracy/mean": 0.95703125, "rewards/reward_accuracy/std": 0.17270073741674424, "rewards/reward_format/mean": 0.09941406399011612, "rewards/reward_format/std": 0.0047294009709730744, "sampling/importance_sampling_ratio/max": 2.4535470008850098, "sampling/importance_sampling_ratio/mean": 0.9741080939769745, "sampling/importance_sampling_ratio/min": 0.08784287869930267, "sampling/sampling_logp_difference/max": 0.9952268838882447, "sampling/sampling_logp_difference/mean": 0.004427506471984088, "step": 11920, "step_time": 8.207388823392103 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003515625, "completions/max_length": 1421.6, "completions/max_terminated_length": 1232.2, "completions/mean_length": 156.866796875, "completions/mean_terminated_length": 150.2494659423828, "completions/min_length": 64.9, "completions/min_terminated_length": 64.9, "entropy": 0.042646641517058013, "epoch": 25.546038543897215, "frac_reward_zero_std": 0.9125, "grad_norm": 0.0, "learning_rate": 8.8071e-06, "loss": -0.0035, "num_tokens": 1187761467.0, "reward": 1.0630469024181366, "reward_std": 0.14363521561026574, "rewards/reward_accuracy/mean": 0.96328125, "rewards/reward_accuracy/std": 0.14290751293301582, "rewards/reward_format/mean": 0.0997656263411045, "rewards/reward_format/std": 0.0025854269973933698, "sampling/importance_sampling_ratio/max": 2.4231753826141356, "sampling/importance_sampling_ratio/mean": 0.9987332403659821, "sampling/importance_sampling_ratio/min": 0.12928350046277046, "sampling/sampling_logp_difference/max": 1.0355938911437987, "sampling/sampling_logp_difference/mean": 0.003983883000910282, "step": 11930, "step_time": 6.833438922415371 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.009375, "completions/max_length": 1664.6, "completions/max_terminated_length": 1327.1, "completions/mean_length": 170.18984375, "completions/mean_terminated_length": 152.4022994995117, "completions/min_length": 61.9, "completions/min_terminated_length": 61.9, "entropy": 0.048393191979266705, "epoch": 25.56745182012848, "frac_reward_zero_std": 0.90625, "grad_norm": 0.0, "learning_rate": 8.8061e-06, "loss": -0.0034, "num_tokens": 1188713873.0, "reward": 1.0570703268051147, "reward_std": 0.175110549479723, "rewards/reward_accuracy/mean": 0.9578125, "rewards/reward_accuracy/std": 0.17226947844028473, "rewards/reward_format/mean": 0.09925781339406967, "rewards/reward_format/std": 0.0050678560743108395, "sampling/importance_sampling_ratio/max": 2.501609373092651, "sampling/importance_sampling_ratio/mean": 0.9766466438770294, "sampling/importance_sampling_ratio/min": 0.12479749470949172, "sampling/sampling_logp_difference/max": 0.9157585203647614, "sampling/sampling_logp_difference/mean": 0.004031814122572541, "step": 11940, "step_time": 8.163058222507242 }, { "clip_ratio/high_max": 2.0800869242521004e-05, "clip_ratio/high_mean": 2.6001086553151255e-06, "clip_ratio/low_mean": 1.124809386965353e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 3.7249180422804786e-06, "completions/clipped_ratio": 0.00703125, "completions/max_length": 1413.9, "completions/max_terminated_length": 1184.5, "completions/mean_length": 152.354296875, "completions/mean_terminated_length": 138.86227951049804, "completions/min_length": 63.9, "completions/min_terminated_length": 63.9, "entropy": 0.04108220350462943, "epoch": 25.588865096359743, "frac_reward_zero_std": 0.925, "grad_norm": 0.0, "learning_rate": 8.805100000000001e-06, "loss": -0.0066, "num_tokens": 1189614044.0, "reward": 1.0721875190734864, "reward_std": 0.13151646330952643, "rewards/reward_accuracy/mean": 0.97265625, "rewards/reward_accuracy/std": 0.12941799685359, "rewards/reward_format/mean": 0.09953125044703484, "rewards/reward_format/std": 0.0036006900016218426, "sampling/importance_sampling_ratio/max": 2.3444603204727175, "sampling/importance_sampling_ratio/mean": 0.9877211213111877, "sampling/importance_sampling_ratio/min": 0.15644134487956762, "sampling/sampling_logp_difference/max": 0.9262092113494873, "sampling/sampling_logp_difference/mean": 0.0039395801024511455, "step": 11950, "step_time": 6.766417934899801 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00546875, "completions/max_length": 1845.9, "completions/max_terminated_length": 1581.0, "completions/mean_length": 175.413671875, "completions/mean_terminated_length": 165.15636138916017, "completions/min_length": 64.5, "completions/min_terminated_length": 64.5, "entropy": 0.04888267226051539, "epoch": 25.610278372591008, "frac_reward_zero_std": 0.90625, "grad_norm": 0.2255859375, "learning_rate": 8.804100000000001e-06, "loss": -0.0024, "num_tokens": 1190578367.0, "reward": 1.0602538943290711, "reward_std": 0.18086153790354728, "rewards/reward_accuracy/mean": 0.960546875, "rewards/reward_accuracy/std": 0.17943628653883933, "rewards/reward_format/mean": 0.09970703050494194, "rewards/reward_format/std": 0.003706852742470801, "sampling/importance_sampling_ratio/max": 2.5306654453277586, "sampling/importance_sampling_ratio/mean": 0.9886077225208283, "sampling/importance_sampling_ratio/min": 0.1102839132770896, "sampling/sampling_logp_difference/max": 1.067867934703827, "sampling/sampling_logp_difference/mean": 0.004097729665227234, "step": 11960, "step_time": 8.77679996039078 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003125, "completions/max_length": 1226.6, "completions/max_terminated_length": 1040.5, "completions/mean_length": 147.995703125, "completions/mean_terminated_length": 142.08329010009766, "completions/min_length": 63.8, "completions/min_terminated_length": 63.8, "entropy": 0.03690419178456068, "epoch": 25.63169164882227, "frac_reward_zero_std": 0.90625, "grad_norm": 0.96484375, "learning_rate": 8.8031e-06, "loss": -0.0047, "num_tokens": 1191471508.0, "reward": 1.0778710961341857, "reward_std": 0.11419631466269493, "rewards/reward_accuracy/mean": 0.978125, "rewards/reward_accuracy/std": 0.11314087584614754, "rewards/reward_format/mean": 0.09974609389901161, "rewards/reward_format/std": 0.0028042942751199005, "sampling/importance_sampling_ratio/max": 2.433126389980316, "sampling/importance_sampling_ratio/mean": 1.0017034232616424, "sampling/importance_sampling_ratio/min": 0.1366765271872282, "sampling/sampling_logp_difference/max": 0.9622121095657349, "sampling/sampling_logp_difference/mean": 0.00379067724570632, "step": 11970, "step_time": 6.091338791590533 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00625, "completions/max_length": 1664.4, "completions/max_terminated_length": 1368.8, "completions/mean_length": 156.8625, "completions/mean_terminated_length": 145.14593505859375, "completions/min_length": 68.8, "completions/min_terminated_length": 68.8, "entropy": 0.04440182629041374, "epoch": 25.653104925053533, "frac_reward_zero_std": 0.9, "grad_norm": 0.130859375, "learning_rate": 8.802100000000002e-06, "loss": -0.0122, "num_tokens": 1192385572.0, "reward": 1.0665625154972076, "reward_std": 0.13579215214122087, "rewards/reward_accuracy/mean": 0.9671875, "rewards/reward_accuracy/std": 0.13220440745353698, "rewards/reward_format/mean": 0.09937500059604645, "rewards/reward_format/std": 0.005710632377304137, "sampling/importance_sampling_ratio/max": 2.4449862480163573, "sampling/importance_sampling_ratio/mean": 0.9889313042163849, "sampling/importance_sampling_ratio/min": 0.06811432689428329, "sampling/sampling_logp_difference/max": 0.9783634066581726, "sampling/sampling_logp_difference/mean": 0.004095690255053341, "step": 11980, "step_time": 7.858888763689902 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0015625, "completions/max_length": 1359.2, "completions/max_terminated_length": 1120.9, "completions/mean_length": 147.62109375, "completions/mean_terminated_length": 144.64150848388672, "completions/min_length": 66.2, "completions/min_terminated_length": 66.2, "entropy": 0.03496620522346348, "epoch": 25.674518201284798, "frac_reward_zero_std": 0.9375, "grad_norm": 0.263671875, "learning_rate": 8.8011e-06, "loss": 0.001, "num_tokens": 1193283226.0, "reward": 1.0736914277076721, "reward_std": 0.11978372707962989, "rewards/reward_accuracy/mean": 0.973828125, "rewards/reward_accuracy/std": 0.11821793019771576, "rewards/reward_format/mean": 0.09986328259110451, "rewards/reward_format/std": 0.0018196488032117485, "sampling/importance_sampling_ratio/max": 2.516742634773254, "sampling/importance_sampling_ratio/mean": 0.9877300262451172, "sampling/importance_sampling_ratio/min": 0.161397884786129, "sampling/sampling_logp_difference/max": 1.1675845563411713, "sampling/sampling_logp_difference/mean": 0.003724909317679703, "step": 11990, "step_time": 6.369626894593239 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001171875, "completions/max_length": 1010.6, "completions/max_terminated_length": 801.2, "completions/mean_length": 141.83671875, "completions/mean_terminated_length": 139.63023834228517, "completions/min_length": 67.2, "completions/min_terminated_length": 67.2, "entropy": 0.0335579170845449, "epoch": 25.69593147751606, "frac_reward_zero_std": 0.95, "grad_norm": 0.31640625, "learning_rate": 8.8001e-06, "loss": -0.0009, "num_tokens": 1194158440.0, "reward": 1.0819922089576721, "reward_std": 0.10269244238734246, "rewards/reward_accuracy/mean": 0.98203125, "rewards/reward_accuracy/std": 0.10237024873495101, "rewards/reward_format/mean": 0.0999609388411045, "rewards/reward_format/std": 0.0006250000558793544, "sampling/importance_sampling_ratio/max": 2.3503405809402467, "sampling/importance_sampling_ratio/mean": 0.9905621469020843, "sampling/importance_sampling_ratio/min": 0.2263780415058136, "sampling/sampling_logp_difference/max": 0.8523714482784271, "sampling/sampling_logp_difference/mean": 0.003583825146779418, "step": 12000, "step_time": 4.9750819042878 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.002734375, "completions/max_length": 1046.6, "completions/max_terminated_length": 947.7, "completions/mean_length": 147.6328125, "completions/mean_terminated_length": 142.4634796142578, "completions/min_length": 61.2, "completions/min_terminated_length": 61.2, "entropy": 0.03837477604392916, "epoch": 25.717344753747323, "frac_reward_zero_std": 0.95625, "grad_norm": 0.1875, "learning_rate": 8.7991e-06, "loss": -0.0007, "num_tokens": 1195060508.0, "reward": 1.0599414229393005, "reward_std": 0.13943179100751876, "rewards/reward_accuracy/mean": 0.96015625, "rewards/reward_accuracy/std": 0.1384761229157448, "rewards/reward_format/mean": 0.09978515729308128, "rewards/reward_format/std": 0.0014186207205057143, "sampling/importance_sampling_ratio/max": 2.42741060256958, "sampling/importance_sampling_ratio/mean": 0.986524510383606, "sampling/importance_sampling_ratio/min": 0.14477928653359412, "sampling/sampling_logp_difference/max": 1.0668604731559754, "sampling/sampling_logp_difference/mean": 0.003951733303256333, "step": 12010, "step_time": 5.056460269584204 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.004296875, "completions/max_length": 1244.4, "completions/max_terminated_length": 1052.3, "completions/mean_length": 167.08671875, "completions/mean_terminated_length": 159.10772399902345, "completions/min_length": 66.8, "completions/min_terminated_length": 66.8, "entropy": 0.04290738708805293, "epoch": 25.738758029978587, "frac_reward_zero_std": 0.9125, "grad_norm": 0.333984375, "learning_rate": 8.798100000000001e-06, "loss": -0.0104, "num_tokens": 1196009242.0, "reward": 1.0597460985183715, "reward_std": 0.17107566371560096, "rewards/reward_accuracy/mean": 0.96015625, "rewards/reward_accuracy/std": 0.16940135583281518, "rewards/reward_format/mean": 0.09958984404802322, "rewards/reward_format/std": 0.00288080929312855, "sampling/importance_sampling_ratio/max": 2.5696949005126952, "sampling/importance_sampling_ratio/mean": 0.9947549998760223, "sampling/importance_sampling_ratio/min": 0.159319781139493, "sampling/sampling_logp_difference/max": 0.9964356184005737, "sampling/sampling_logp_difference/mean": 0.004127348819747567, "step": 12020, "step_time": 6.288090410205768 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 3.648249708021467e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 3.648249708021467e-06, "completions/clipped_ratio": 0.005859375, "completions/max_length": 1644.1, "completions/max_terminated_length": 1507.7, "completions/mean_length": 158.511328125, "completions/mean_terminated_length": 147.43877868652345, "completions/min_length": 66.6, "completions/min_terminated_length": 66.6, "entropy": 0.03817352701444179, "epoch": 25.76017130620985, "frac_reward_zero_std": 0.90625, "grad_norm": 0.0, "learning_rate": 8.797100000000001e-06, "loss": -0.0061, "num_tokens": 1196928695.0, "reward": 1.078808605670929, "reward_std": 0.12311058640480041, "rewards/reward_accuracy/mean": 0.979296875, "rewards/reward_accuracy/std": 0.121086236089468, "rewards/reward_format/mean": 0.09951171949505806, "rewards/reward_format/std": 0.0033198067685589194, "sampling/importance_sampling_ratio/max": 2.3924288868904116, "sampling/importance_sampling_ratio/mean": 0.9892319798469543, "sampling/importance_sampling_ratio/min": 0.13505812138319015, "sampling/sampling_logp_difference/max": 0.9176177382469177, "sampling/sampling_logp_difference/mean": 0.003692264575511217, "step": 12030, "step_time": 7.755071468892856 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.004296875, "completions/max_length": 1056.6, "completions/max_terminated_length": 921.1, "completions/mean_length": 153.629296875, "completions/mean_terminated_length": 145.74804458618163, "completions/min_length": 63.6, "completions/min_terminated_length": 63.6, "entropy": 0.03979471505153924, "epoch": 25.781584582441113, "frac_reward_zero_std": 0.9125, "grad_norm": 0.0, "learning_rate": 8.7961e-06, "loss": -0.0018, "num_tokens": 1197836242.0, "reward": 1.0696093916893006, "reward_std": 0.11609085798263549, "rewards/reward_accuracy/mean": 0.969921875, "rewards/reward_accuracy/std": 0.11465587168931961, "rewards/reward_format/mean": 0.09968750104308129, "rewards/reward_format/std": 0.002866200264543295, "sampling/importance_sampling_ratio/max": 2.393877649307251, "sampling/importance_sampling_ratio/mean": 0.9773817598819733, "sampling/importance_sampling_ratio/min": 0.1715881746262312, "sampling/sampling_logp_difference/max": 1.236874806880951, "sampling/sampling_logp_difference/mean": 0.003869947651401162, "step": 12040, "step_time": 5.324553306092275 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00234375, "completions/max_length": 974.9, "completions/max_terminated_length": 822.4, "completions/mean_length": 145.410546875, "completions/mean_terminated_length": 141.0195541381836, "completions/min_length": 64.1, "completions/min_terminated_length": 64.1, "entropy": 0.0396014214027673, "epoch": 25.802997858672377, "frac_reward_zero_std": 0.9375, "grad_norm": 0.384765625, "learning_rate": 8.795100000000002e-06, "loss": 0.0008, "num_tokens": 1198724125.0, "reward": 1.072070336341858, "reward_std": 0.12390252128243447, "rewards/reward_accuracy/mean": 0.972265625, "rewards/reward_accuracy/std": 0.12323028594255447, "rewards/reward_format/mean": 0.09980468899011612, "rewards/reward_format/std": 0.0016836996655911207, "sampling/importance_sampling_ratio/max": 2.444932234287262, "sampling/importance_sampling_ratio/mean": 0.9903107702732086, "sampling/importance_sampling_ratio/min": 0.1372809436172247, "sampling/sampling_logp_difference/max": 0.9341431617736816, "sampling/sampling_logp_difference/mean": 0.0038865472888574004, "step": 12050, "step_time": 4.928957121088752 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005078125, "completions/max_length": 1283.6, "completions/max_terminated_length": 1056.8, "completions/mean_length": 162.83125, "completions/mean_terminated_length": 153.50847930908202, "completions/min_length": 60.9, "completions/min_terminated_length": 60.9, "entropy": 0.040470474818721416, "epoch": 25.82441113490364, "frac_reward_zero_std": 0.9375, "grad_norm": 0.1884765625, "learning_rate": 8.794100000000001e-06, "loss": -0.0084, "num_tokens": 1199658525.0, "reward": 1.0761328339576721, "reward_std": 0.09646622687578202, "rewards/reward_accuracy/mean": 0.9765625, "rewards/reward_accuracy/std": 0.0947372056543827, "rewards/reward_format/mean": 0.09957031309604644, "rewards/reward_format/std": 0.0033640272449702024, "sampling/importance_sampling_ratio/max": 2.302818942070007, "sampling/importance_sampling_ratio/mean": 0.9861056268215179, "sampling/importance_sampling_ratio/min": 0.0858628686517477, "sampling/sampling_logp_difference/max": 0.9312217354774475, "sampling/sampling_logp_difference/mean": 0.0038111221976578234, "step": 12060, "step_time": 6.268025873898296 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005859375, "completions/max_length": 1530.6, "completions/max_terminated_length": 1299.3, "completions/mean_length": 161.849609375, "completions/mean_terminated_length": 150.7718933105469, "completions/min_length": 66.7, "completions/min_terminated_length": 66.7, "entropy": 0.04360262274276465, "epoch": 25.845824411134902, "frac_reward_zero_std": 0.8875, "grad_norm": 0.0, "learning_rate": 8.7931e-06, "loss": -0.0023, "num_tokens": 1200592060.0, "reward": 1.065976583957672, "reward_std": 0.15373454838991166, "rewards/reward_accuracy/mean": 0.96640625, "rewards/reward_accuracy/std": 0.151717422157526, "rewards/reward_format/mean": 0.09957031309604644, "rewards/reward_format/std": 0.004801905108615756, "sampling/importance_sampling_ratio/max": 2.4695406913757325, "sampling/importance_sampling_ratio/mean": 0.9855437397956848, "sampling/importance_sampling_ratio/min": 0.07161101922392846, "sampling/sampling_logp_difference/max": 1.0114525079727172, "sampling/sampling_logp_difference/mean": 0.004087984724901616, "step": 12070, "step_time": 7.392637722499785 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00234375, "completions/max_length": 1434.9, "completions/max_terminated_length": 1340.6, "completions/mean_length": 155.4125, "completions/mean_terminated_length": 151.09607849121093, "completions/min_length": 60.8, "completions/min_terminated_length": 60.8, "entropy": 0.04077710388228297, "epoch": 25.867237687366167, "frac_reward_zero_std": 0.91875, "grad_norm": 0.09716796875, "learning_rate": 8.792100000000002e-06, "loss": -0.007, "num_tokens": 1201508492.0, "reward": 1.038867211341858, "reward_std": 0.1960688576102257, "rewards/reward_accuracy/mean": 0.9390625, "rewards/reward_accuracy/std": 0.19560063779354095, "rewards/reward_format/mean": 0.09980468899011612, "rewards/reward_format/std": 0.0016597391571849585, "sampling/importance_sampling_ratio/max": 2.3424597501754763, "sampling/importance_sampling_ratio/mean": 0.9899987637996673, "sampling/importance_sampling_ratio/min": 0.06840385273098945, "sampling/sampling_logp_difference/max": 0.9878079891204834, "sampling/sampling_logp_difference/mean": 0.0038538005901500583, "step": 12080, "step_time": 6.798673671801225 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003125, "completions/max_length": 1303.4, "completions/max_terminated_length": 1098.0, "completions/mean_length": 151.298828125, "completions/mean_terminated_length": 145.40431365966796, "completions/min_length": 63.1, "completions/min_terminated_length": 63.1, "entropy": 0.04255258690100163, "epoch": 25.88865096359743, "frac_reward_zero_std": 0.9, "grad_norm": 0.26171875, "learning_rate": 8.7911e-06, "loss": -0.0013, "num_tokens": 1202413385.0, "reward": 1.0693164229393006, "reward_std": 0.14001603573560714, "rewards/reward_accuracy/mean": 0.96953125, "rewards/reward_accuracy/std": 0.13941269293427466, "rewards/reward_format/mean": 0.09978515729308128, "rewards/reward_format/std": 0.002081228978931904, "sampling/importance_sampling_ratio/max": 2.6461405515670777, "sampling/importance_sampling_ratio/mean": 0.9989572465419769, "sampling/importance_sampling_ratio/min": 0.15476193241775035, "sampling/sampling_logp_difference/max": 1.0165331363677979, "sampling/sampling_logp_difference/mean": 0.00396552374586463, "step": 12090, "step_time": 6.5264382835943255 }, { "clip_ratio/high_max": 1.4599392306990921e-05, "clip_ratio/high_mean": 1.8249240383738651e-06, "clip_ratio/low_mean": 2.749428176684887e-07, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 2.099866856042354e-06, "completions/clipped_ratio": 0.00859375, "completions/max_length": 1427.3, "completions/max_terminated_length": 1140.8, "completions/mean_length": 167.848828125, "completions/mean_terminated_length": 151.6149658203125, "completions/min_length": 61.5, "completions/min_terminated_length": 61.5, "entropy": 0.04633849901147187, "epoch": 25.910064239828692, "frac_reward_zero_std": 0.925, "grad_norm": 0.1796875, "learning_rate": 8.7901e-06, "loss": -0.0058, "num_tokens": 1203368454.0, "reward": 1.0642382979393006, "reward_std": 0.14629666209220887, "rewards/reward_accuracy/mean": 0.96484375, "rewards/reward_accuracy/std": 0.14369165450334548, "rewards/reward_format/mean": 0.09939453229308129, "rewards/reward_format/std": 0.004912569141015411, "sampling/importance_sampling_ratio/max": 2.4639790534973143, "sampling/importance_sampling_ratio/mean": 0.9846993625164032, "sampling/importance_sampling_ratio/min": 0.11872156895697117, "sampling/sampling_logp_difference/max": 0.8629647612571716, "sampling/sampling_logp_difference/mean": 0.003908737283200026, "step": 12100, "step_time": 7.317310862898012 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00234375, "completions/max_length": 1525.7, "completions/max_terminated_length": 1260.5, "completions/mean_length": 159.67734375, "completions/mean_terminated_length": 155.3030776977539, "completions/min_length": 64.8, "completions/min_terminated_length": 64.8, "entropy": 0.04506859644316137, "epoch": 25.931477516059957, "frac_reward_zero_std": 0.9125, "grad_norm": 0.2890625, "learning_rate": 8.7891e-06, "loss": -0.0055, "num_tokens": 1204294972.0, "reward": 1.073632836341858, "reward_std": 0.11591406837105751, "rewards/reward_accuracy/mean": 0.973828125, "rewards/reward_accuracy/std": 0.11491752043366432, "rewards/reward_format/mean": 0.09980468899011612, "rewards/reward_format/std": 0.002389297354966402, "sampling/importance_sampling_ratio/max": 2.513824164867401, "sampling/importance_sampling_ratio/mean": 0.9786620140075684, "sampling/importance_sampling_ratio/min": 0.16000738963484765, "sampling/sampling_logp_difference/max": 0.8941989302635193, "sampling/sampling_logp_difference/mean": 0.003995547699742019, "step": 12110, "step_time": 7.107020466087851 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.002734375, "completions/max_length": 967.3, "completions/max_terminated_length": 823.5, "completions/mean_length": 138.780078125, "completions/mean_terminated_length": 133.61672821044922, "completions/min_length": 64.8, "completions/min_terminated_length": 64.8, "entropy": 0.03362059383653104, "epoch": 25.95289079229122, "frac_reward_zero_std": 0.9625, "grad_norm": 0.0, "learning_rate": 8.7881e-06, "loss": -0.0021, "num_tokens": 1205165129.0, "reward": 1.0770898580551147, "reward_std": 0.10713275969028473, "rewards/reward_accuracy/mean": 0.97734375, "rewards/reward_accuracy/std": 0.10587414279580117, "rewards/reward_format/mean": 0.09974609464406967, "rewards/reward_format/std": 0.0025652996730059384, "sampling/importance_sampling_ratio/max": 2.486418902873993, "sampling/importance_sampling_ratio/mean": 1.005395531654358, "sampling/importance_sampling_ratio/min": 0.1044683262705803, "sampling/sampling_logp_difference/max": 0.9438427746295929, "sampling/sampling_logp_difference/mean": 0.0036120002856478094, "step": 12120, "step_time": 5.086235707686865 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 1207.2, "completions/max_terminated_length": 1043.3, "completions/mean_length": 158.400390625, "completions/mean_terminated_length": 151.06122894287108, "completions/min_length": 68.3, "completions/min_terminated_length": 68.3, "entropy": 0.041377343237400055, "epoch": 25.974304068522486, "frac_reward_zero_std": 0.91875, "grad_norm": 0.44921875, "learning_rate": 8.787100000000001e-06, "loss": -0.0061, "num_tokens": 1206088698.0, "reward": 1.0783008098602296, "reward_std": 0.10193045735359192, "rewards/reward_accuracy/mean": 0.978515625, "rewards/reward_accuracy/std": 0.10101899951696396, "rewards/reward_format/mean": 0.09978515729308128, "rewards/reward_format/std": 0.002305835345759988, "sampling/importance_sampling_ratio/max": 2.379220151901245, "sampling/importance_sampling_ratio/mean": 1.0016928255558013, "sampling/importance_sampling_ratio/min": 0.1668718598783016, "sampling/sampling_logp_difference/max": 1.1187575459480286, "sampling/sampling_logp_difference/mean": 0.00399944712407887, "step": 12130, "step_time": 5.8274943326920035 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.000390625, "completions/max_length": 825.2, "completions/max_terminated_length": 718.7, "completions/mean_length": 147.95, "completions/mean_terminated_length": 147.2075668334961, "completions/min_length": 64.9, "completions/min_terminated_length": 64.9, "entropy": 0.03595429342240095, "epoch": 25.995717344753746, "frac_reward_zero_std": 0.95, "grad_norm": 0.0, "learning_rate": 8.7861e-06, "loss": -0.0023, "num_tokens": 1206987130.0, "reward": 1.0823437690734863, "reward_std": 0.07584989592432975, "rewards/reward_accuracy/mean": 0.982421875, "rewards/reward_accuracy/std": 0.07570586428046226, "rewards/reward_format/mean": 0.09992187619209289, "rewards/reward_format/std": 0.001010174280963838, "sampling/importance_sampling_ratio/max": 2.4063655495643617, "sampling/importance_sampling_ratio/mean": 0.9891961872577667, "sampling/importance_sampling_ratio/min": 0.19960190020501614, "sampling/sampling_logp_difference/max": 1.0777456045150757, "sampling/sampling_logp_difference/mean": 0.0037226927699521182, "step": 12140, "step_time": 4.16195828380296 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001953125, "completions/max_length": 934.0, "completions/max_terminated_length": 837.3, "completions/mean_length": 146.806640625, "completions/mean_terminated_length": 143.12844543457032, "completions/min_length": 62.6, "completions/min_terminated_length": 62.6, "entropy": 0.03529857504181564, "epoch": 26.01713062098501, "frac_reward_zero_std": 0.93125, "grad_norm": 0.78515625, "learning_rate": 8.785100000000002e-06, "loss": -0.0024, "num_tokens": 1207882779.0, "reward": 1.078710949420929, "reward_std": 0.11301024332642555, "rewards/reward_accuracy/mean": 0.97890625, "rewards/reward_accuracy/std": 0.11185815557837486, "rewards/reward_format/mean": 0.09980468824505806, "rewards/reward_format/std": 0.0023282784037292003, "sampling/importance_sampling_ratio/max": 2.314428114891052, "sampling/importance_sampling_ratio/mean": 0.9878997802734375, "sampling/importance_sampling_ratio/min": 0.1572486382909119, "sampling/sampling_logp_difference/max": 1.0029527008533479, "sampling/sampling_logp_difference/mean": 0.003574055409990251, "step": 12150, "step_time": 4.806936278997455 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003125, "completions/max_length": 1350.1, "completions/max_terminated_length": 1090.2, "completions/mean_length": 152.18046875, "completions/mean_terminated_length": 146.2762878417969, "completions/min_length": 66.8, "completions/min_terminated_length": 66.8, "entropy": 0.043838734901510176, "epoch": 26.038543897216275, "frac_reward_zero_std": 0.93125, "grad_norm": 0.0, "learning_rate": 8.784100000000001e-06, "loss": -0.0021, "num_tokens": 1208795129.0, "reward": 1.0572265803813934, "reward_std": 0.16438425034284593, "rewards/reward_accuracy/mean": 0.957421875, "rewards/reward_accuracy/std": 0.1632570005953312, "rewards/reward_format/mean": 0.0998046875, "rewards/reward_format/std": 0.0028851744020357726, "sampling/importance_sampling_ratio/max": 2.4233500838279722, "sampling/importance_sampling_ratio/mean": 0.98941969871521, "sampling/importance_sampling_ratio/min": 0.10446951985359192, "sampling/sampling_logp_difference/max": 0.8797805964946747, "sampling/sampling_logp_difference/mean": 0.004076159116812051, "step": 12160, "step_time": 6.4978434732940515 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00234375, "completions/max_length": 1436.1, "completions/max_terminated_length": 1205.5, "completions/mean_length": 153.563671875, "completions/mean_terminated_length": 149.15679168701172, "completions/min_length": 60.3, "completions/min_terminated_length": 60.3, "entropy": 0.039204225223511455, "epoch": 26.059957173447536, "frac_reward_zero_std": 0.9375, "grad_norm": 0.427734375, "learning_rate": 8.7831e-06, "loss": -0.0052, "num_tokens": 1209702492.0, "reward": 1.051738303899765, "reward_std": 0.1651543602347374, "rewards/reward_accuracy/mean": 0.951953125, "rewards/reward_accuracy/std": 0.16445131748914718, "rewards/reward_format/mean": 0.09978515803813934, "rewards/reward_format/std": 0.0028298231307417156, "sampling/importance_sampling_ratio/max": 2.503934907913208, "sampling/importance_sampling_ratio/mean": 0.9893038153648377, "sampling/importance_sampling_ratio/min": 0.1082925109192729, "sampling/sampling_logp_difference/max": 1.4378623485565185, "sampling/sampling_logp_difference/mean": 0.003809291892684996, "step": 12170, "step_time": 6.705026675097178 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003515625, "completions/max_length": 1524.8, "completions/max_terminated_length": 1379.9, "completions/mean_length": 167.35234375, "completions/mean_terminated_length": 160.6967514038086, "completions/min_length": 66.1, "completions/min_terminated_length": 66.1, "entropy": 0.04715702433604747, "epoch": 26.0813704496788, "frac_reward_zero_std": 0.88125, "grad_norm": 0.2412109375, "learning_rate": 8.782100000000002e-06, "loss": -0.0071, "num_tokens": 1210652482.0, "reward": 1.0676562786102295, "reward_std": 0.1581950344145298, "rewards/reward_accuracy/mean": 0.96796875, "rewards/reward_accuracy/std": 0.15676586031913758, "rewards/reward_format/mean": 0.09968750178813934, "rewards/reward_format/std": 0.0036820110166445375, "sampling/importance_sampling_ratio/max": 2.537967848777771, "sampling/importance_sampling_ratio/mean": 0.9816321790218353, "sampling/importance_sampling_ratio/min": 0.038333737751236184, "sampling/sampling_logp_difference/max": 1.0155826568603517, "sampling/sampling_logp_difference/mean": 0.004049308644607663, "step": 12180, "step_time": 7.3279034621024035 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003515625, "completions/max_length": 884.3, "completions/max_terminated_length": 698.2, "completions/mean_length": 144.766796875, "completions/mean_terminated_length": 138.18765869140626, "completions/min_length": 65.0, "completions/min_terminated_length": 65.0, "entropy": 0.0349934283643961, "epoch": 26.102783725910065, "frac_reward_zero_std": 0.975, "grad_norm": 0.1826171875, "learning_rate": 8.7811e-06, "loss": 0.0001, "num_tokens": 1211533725.0, "reward": 1.0786328315734863, "reward_std": 0.08549897968769074, "rewards/reward_accuracy/mean": 0.97890625, "rewards/reward_accuracy/std": 0.0842180036008358, "rewards/reward_format/mean": 0.0997265636920929, "rewards/reward_format/std": 0.0020054482854902746, "sampling/importance_sampling_ratio/max": 2.393486213684082, "sampling/importance_sampling_ratio/mean": 0.9941416800022125, "sampling/importance_sampling_ratio/min": 0.08767211735248566, "sampling/sampling_logp_difference/max": 1.044194495677948, "sampling/sampling_logp_difference/mean": 0.003682044753804803, "step": 12190, "step_time": 4.460474273213185 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00234375, "completions/max_length": 1065.3, "completions/max_terminated_length": 1043.2, "completions/mean_length": 154.24296875, "completions/mean_terminated_length": 149.83607635498046, "completions/min_length": 60.1, "completions/min_terminated_length": 60.1, "entropy": 0.038621153123676775, "epoch": 26.124197002141326, "frac_reward_zero_std": 0.9375, "grad_norm": 0.392578125, "learning_rate": 8.780100000000001e-06, "loss": -0.0074, "num_tokens": 1212445787.0, "reward": 1.0649805068969727, "reward_std": 0.1386956512928009, "rewards/reward_accuracy/mean": 0.965234375, "rewards/reward_accuracy/std": 0.13778523355722427, "rewards/reward_format/mean": 0.0997460961341858, "rewards/reward_format/std": 0.002839757245965302, "sampling/importance_sampling_ratio/max": 2.41389878988266, "sampling/importance_sampling_ratio/mean": 0.9833581924438477, "sampling/importance_sampling_ratio/min": 0.08204820528626441, "sampling/sampling_logp_difference/max": 0.9503655195236206, "sampling/sampling_logp_difference/mean": 0.0038269800134003162, "step": 12200, "step_time": 5.402214202401228 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 4.091838445674512e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 4.091838445674512e-06, "completions/clipped_ratio": 0.00703125, "completions/max_length": 1087.1, "completions/max_terminated_length": 994.0, "completions/mean_length": 170.42421875, "completions/mean_terminated_length": 157.22565612792968, "completions/min_length": 69.7, "completions/min_terminated_length": 69.7, "entropy": 0.042590493033640084, "epoch": 26.14561027837259, "frac_reward_zero_std": 0.925, "grad_norm": 0.88671875, "learning_rate": 8.7791e-06, "loss": 0.0025, "num_tokens": 1213398265.0, "reward": 1.0546093940734864, "reward_std": 0.15635328292846679, "rewards/reward_accuracy/mean": 0.955078125, "rewards/reward_accuracy/std": 0.15490224659442903, "rewards/reward_format/mean": 0.0995312511920929, "rewards/reward_format/std": 0.003945704828947782, "sampling/importance_sampling_ratio/max": 2.5921928882598877, "sampling/importance_sampling_ratio/mean": 0.9889472961425781, "sampling/importance_sampling_ratio/min": 0.15684679858386516, "sampling/sampling_logp_difference/max": 0.9400660991668701, "sampling/sampling_logp_difference/mean": 0.003934007743373514, "step": 12210, "step_time": 5.867537042996264 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005859375, "completions/max_length": 1371.2, "completions/max_terminated_length": 1283.2, "completions/mean_length": 165.860546875, "completions/mean_terminated_length": 154.84337310791017, "completions/min_length": 66.1, "completions/min_terminated_length": 66.1, "entropy": 0.04371531689539552, "epoch": 26.167023554603855, "frac_reward_zero_std": 0.9125, "grad_norm": 0.375, "learning_rate": 8.7781e-06, "loss": -0.0098, "num_tokens": 1214343812.0, "reward": 1.0781054854393006, "reward_std": 0.10630985975731164, "rewards/reward_accuracy/mean": 0.978515625, "rewards/reward_accuracy/std": 0.10433763042092323, "rewards/reward_format/mean": 0.09958984479308128, "rewards/reward_format/std": 0.003804926644079387, "sampling/importance_sampling_ratio/max": 2.5389504432678223, "sampling/importance_sampling_ratio/mean": 0.9885791838169098, "sampling/importance_sampling_ratio/min": 0.08598119094967842, "sampling/sampling_logp_difference/max": 1.150672471523285, "sampling/sampling_logp_difference/mean": 0.004095316701568663, "step": 12220, "step_time": 6.608685268601403 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001171875, "completions/max_length": 1046.7, "completions/max_terminated_length": 865.3, "completions/mean_length": 140.716796875, "completions/mean_terminated_length": 138.51365814208984, "completions/min_length": 63.8, "completions/min_terminated_length": 63.8, "entropy": 0.032907421025447546, "epoch": 26.18843683083512, "frac_reward_zero_std": 0.9375, "grad_norm": 0.341796875, "learning_rate": 8.777100000000001e-06, "loss": -0.002, "num_tokens": 1215222399.0, "reward": 1.0714453279972076, "reward_std": 0.10492733344435692, "rewards/reward_accuracy/mean": 0.971484375, "rewards/reward_accuracy/std": 0.10471491515636444, "rewards/reward_format/mean": 0.09996093809604645, "rewards/reward_format/std": 0.0006250000093132258, "sampling/importance_sampling_ratio/max": 2.3573646068573, "sampling/importance_sampling_ratio/mean": 0.988016563653946, "sampling/importance_sampling_ratio/min": 0.1939452588558197, "sampling/sampling_logp_difference/max": 1.0267325520515442, "sampling/sampling_logp_difference/mean": 0.0034798224922269584, "step": 12230, "step_time": 5.09276962998847 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 986.4, "completions/max_terminated_length": 847.3, "completions/mean_length": 153.49140625, "completions/mean_terminated_length": 146.1175323486328, "completions/min_length": 67.4, "completions/min_terminated_length": 67.4, "entropy": 0.03652338783722371, "epoch": 26.20985010706638, "frac_reward_zero_std": 0.93125, "grad_norm": 0.6328125, "learning_rate": 8.7761e-06, "loss": -0.0052, "num_tokens": 1216135369.0, "reward": 1.0729101836681365, "reward_std": 0.11730492636561393, "rewards/reward_accuracy/mean": 0.973046875, "rewards/reward_accuracy/std": 0.11677989438176155, "rewards/reward_format/mean": 0.09986328333616257, "rewards/reward_format/std": 0.001160451816394925, "sampling/importance_sampling_ratio/max": 2.4979592084884645, "sampling/importance_sampling_ratio/mean": 0.9855316817760468, "sampling/importance_sampling_ratio/min": 0.20774319767951965, "sampling/sampling_logp_difference/max": 1.0204104959964753, "sampling/sampling_logp_difference/mean": 0.003531388915143907, "step": 12240, "step_time": 5.1979655420029305 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.007421875, "completions/max_length": 1360.5, "completions/max_terminated_length": 971.9, "completions/mean_length": 166.665625, "completions/mean_terminated_length": 152.79630966186522, "completions/min_length": 66.7, "completions/min_terminated_length": 66.7, "entropy": 0.04045761455781758, "epoch": 26.231263383297645, "frac_reward_zero_std": 0.9, "grad_norm": 0.326171875, "learning_rate": 8.7751e-06, "loss": -0.0066, "num_tokens": 1217081089.0, "reward": 1.049101573228836, "reward_std": 0.18279007747769355, "rewards/reward_accuracy/mean": 0.949609375, "rewards/reward_accuracy/std": 0.18089283630251884, "rewards/reward_format/mean": 0.09949218705296517, "rewards/reward_format/std": 0.004152385843917727, "sampling/importance_sampling_ratio/max": 2.49436901807785, "sampling/importance_sampling_ratio/mean": 0.9950692653656006, "sampling/importance_sampling_ratio/min": 0.13291847109794616, "sampling/sampling_logp_difference/max": 0.9670830249786377, "sampling/sampling_logp_difference/mean": 0.0038822263712063433, "step": 12250, "step_time": 6.7696867876074975 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003125, "completions/max_length": 1170.0, "completions/max_terminated_length": 919.0, "completions/mean_length": 156.180078125, "completions/mean_terminated_length": 150.29322967529296, "completions/min_length": 67.6, "completions/min_terminated_length": 67.6, "entropy": 0.03870732388459146, "epoch": 26.25267665952891, "frac_reward_zero_std": 0.93125, "grad_norm": 0.1435546875, "learning_rate": 8.774100000000001e-06, "loss": -0.0058, "num_tokens": 1217998734.0, "reward": 1.0721093893051148, "reward_std": 0.12832644656300546, "rewards/reward_accuracy/mean": 0.972265625, "rewards/reward_accuracy/std": 0.12765310257673262, "rewards/reward_format/mean": 0.09984375089406967, "rewards/reward_format/std": 0.0018717264058068395, "sampling/importance_sampling_ratio/max": 2.5277549982070924, "sampling/importance_sampling_ratio/mean": 0.9791035950183868, "sampling/importance_sampling_ratio/min": 0.05124288587830961, "sampling/sampling_logp_difference/max": 0.9946103811264038, "sampling/sampling_logp_difference/mean": 0.00392341308761388, "step": 12260, "step_time": 5.786616774398135 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.002734375, "completions/max_length": 1221.5, "completions/max_terminated_length": 1052.3, "completions/mean_length": 165.276953125, "completions/mean_terminated_length": 160.23460998535157, "completions/min_length": 64.9, "completions/min_terminated_length": 64.9, "entropy": 0.046976796281524, "epoch": 26.27408993576017, "frac_reward_zero_std": 0.9, "grad_norm": 0.85546875, "learning_rate": 8.7731e-06, "loss": -0.0017, "num_tokens": 1218939459.0, "reward": 1.06181640625, "reward_std": 0.15274574384093284, "rewards/reward_accuracy/mean": 0.962109375, "rewards/reward_accuracy/std": 0.15179651379585266, "rewards/reward_format/mean": 0.09970703125, "rewards/reward_format/std": 0.0032461997354403136, "sampling/importance_sampling_ratio/max": 2.47417151927948, "sampling/importance_sampling_ratio/mean": 0.9908146023750305, "sampling/importance_sampling_ratio/min": 0.11189937628805638, "sampling/sampling_logp_difference/max": 1.0169397115707397, "sampling/sampling_logp_difference/mean": 0.004128515487536788, "step": 12270, "step_time": 5.969527482413104 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003515625, "completions/max_length": 1105.3, "completions/max_terminated_length": 1013.8, "completions/mean_length": 160.396875, "completions/mean_terminated_length": 153.79608001708985, "completions/min_length": 67.9, "completions/min_terminated_length": 67.9, "entropy": 0.0444668655982241, "epoch": 26.295503211991434, "frac_reward_zero_std": 0.91875, "grad_norm": 0.39453125, "learning_rate": 8.772100000000002e-06, "loss": -0.0015, "num_tokens": 1219877179.0, "reward": 1.0524219036102296, "reward_std": 0.15550099089741706, "rewards/reward_accuracy/mean": 0.952734375, "rewards/reward_accuracy/std": 0.1542256958782673, "rewards/reward_format/mean": 0.09968750178813934, "rewards/reward_format/std": 0.0023995240218937395, "sampling/importance_sampling_ratio/max": 2.5485652685165405, "sampling/importance_sampling_ratio/mean": 0.9948742747306824, "sampling/importance_sampling_ratio/min": 0.15772012211382389, "sampling/sampling_logp_difference/max": 0.9441527009010315, "sampling/sampling_logp_difference/mean": 0.0044183837017044425, "step": 12280, "step_time": 5.551159683891456 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0140625, "completions/max_length": 1348.0, "completions/max_terminated_length": 1216.9, "completions/mean_length": 172.219140625, "completions/mean_terminated_length": 145.63107147216797, "completions/min_length": 62.5, "completions/min_terminated_length": 62.5, "entropy": 0.04493699714075774, "epoch": 26.3169164882227, "frac_reward_zero_std": 0.91875, "grad_norm": 0.095703125, "learning_rate": 8.7711e-06, "loss": -0.0111, "num_tokens": 1220833436.0, "reward": 1.066699206829071, "reward_std": 0.14140581265091895, "rewards/reward_accuracy/mean": 0.96796875, "rewards/reward_accuracy/std": 0.1370720736682415, "rewards/reward_format/mean": 0.09873046875, "rewards/reward_format/std": 0.006663049734197557, "sampling/importance_sampling_ratio/max": 2.6518245697021485, "sampling/importance_sampling_ratio/mean": 0.9868613660335541, "sampling/importance_sampling_ratio/min": 0.0855546984821558, "sampling/sampling_logp_difference/max": 0.9734989881515503, "sampling/sampling_logp_difference/mean": 0.0040317477192729715, "step": 12290, "step_time": 7.064980581088458 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00234375, "completions/max_length": 1002.0, "completions/max_terminated_length": 963.0, "completions/mean_length": 151.039453125, "completions/mean_terminated_length": 146.5934600830078, "completions/min_length": 61.2, "completions/min_terminated_length": 61.2, "entropy": 0.03686216827481985, "epoch": 26.338329764453963, "frac_reward_zero_std": 0.9125, "grad_norm": 0.63671875, "learning_rate": 8.770100000000001e-06, "loss": -0.006, "num_tokens": 1221741265.0, "reward": 1.0799609541893005, "reward_std": 0.10325764641165733, "rewards/reward_accuracy/mean": 0.980078125, "rewards/reward_accuracy/std": 0.10271594002842903, "rewards/reward_format/mean": 0.09988281354308129, "rewards/reward_format/std": 0.0014512486523017287, "sampling/importance_sampling_ratio/max": 2.5033171653747557, "sampling/importance_sampling_ratio/mean": 0.9908162295818329, "sampling/importance_sampling_ratio/min": 0.1818249755539, "sampling/sampling_logp_difference/max": 1.269659161567688, "sampling/sampling_logp_difference/mean": 0.0037687526317313315, "step": 12300, "step_time": 5.199348248090246 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001953125, "completions/max_length": 1255.5, "completions/max_terminated_length": 1218.5, "completions/mean_length": 158.552734375, "completions/mean_terminated_length": 154.9083679199219, "completions/min_length": 65.0, "completions/min_terminated_length": 65.0, "entropy": 0.04197882283478975, "epoch": 26.359743040685224, "frac_reward_zero_std": 0.90625, "grad_norm": 0.4296875, "learning_rate": 8.7691e-06, "loss": -0.0023, "num_tokens": 1222668872.0, "reward": 1.0731640696525573, "reward_std": 0.12011473700404167, "rewards/reward_accuracy/mean": 0.9734375, "rewards/reward_accuracy/std": 0.1191465549170971, "rewards/reward_format/mean": 0.09972656294703483, "rewards/reward_format/std": 0.0031545268604531882, "sampling/importance_sampling_ratio/max": 2.3462109208106994, "sampling/importance_sampling_ratio/mean": 0.9881298065185546, "sampling/importance_sampling_ratio/min": 0.09586685448884964, "sampling/sampling_logp_difference/max": 0.9291199088096619, "sampling/sampling_logp_difference/mean": 0.003808252140879631, "step": 12310, "step_time": 6.505314668198116 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 1053.9, "completions/max_terminated_length": 826.9, "completions/mean_length": 156.1171875, "completions/mean_terminated_length": 148.79876556396485, "completions/min_length": 61.3, "completions/min_terminated_length": 61.3, "entropy": 0.04025881108827889, "epoch": 26.38115631691649, "frac_reward_zero_std": 0.93125, "grad_norm": 0.294921875, "learning_rate": 8.7681e-06, "loss": -0.0027, "num_tokens": 1223584980.0, "reward": 1.0782617568969726, "reward_std": 0.10669357404112816, "rewards/reward_accuracy/mean": 0.978515625, "rewards/reward_accuracy/std": 0.10499731600284576, "rewards/reward_format/mean": 0.0997460961341858, "rewards/reward_format/std": 0.002967783063650131, "sampling/importance_sampling_ratio/max": 2.2552119374275206, "sampling/importance_sampling_ratio/mean": 0.9670266032218933, "sampling/importance_sampling_ratio/min": 0.0756349615752697, "sampling/sampling_logp_difference/max": 1.2123970448970796, "sampling/sampling_logp_difference/mean": 0.003868602099828422, "step": 12320, "step_time": 5.373678523412673 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001953125, "completions/max_length": 1007.8, "completions/max_terminated_length": 1007.8, "completions/mean_length": 150.640234375, "completions/mean_terminated_length": 147.01289978027344, "completions/min_length": 64.2, "completions/min_terminated_length": 64.2, "entropy": 0.036407649819739166, "epoch": 26.402569593147753, "frac_reward_zero_std": 0.93125, "grad_norm": 0.0, "learning_rate": 8.767100000000001e-06, "loss": -0.0056, "num_tokens": 1224489371.0, "reward": 1.072851586341858, "reward_std": 0.10787632241845131, "rewards/reward_accuracy/mean": 0.973046875, "rewards/reward_accuracy/std": 0.10733399763703347, "rewards/reward_format/mean": 0.09980468824505806, "rewards/reward_format/std": 0.001386538054794073, "sampling/importance_sampling_ratio/max": 2.4954495191574098, "sampling/importance_sampling_ratio/mean": 0.9969067573547363, "sampling/importance_sampling_ratio/min": 0.09298726096749306, "sampling/sampling_logp_difference/max": 1.123026955127716, "sampling/sampling_logp_difference/mean": 0.0036216030828654768, "step": 12330, "step_time": 5.070852906213259 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00234375, "completions/max_length": 1098.9, "completions/max_terminated_length": 990.2, "completions/mean_length": 154.1890625, "completions/mean_terminated_length": 149.75619812011718, "completions/min_length": 62.0, "completions/min_terminated_length": 62.0, "entropy": 0.042044031573459505, "epoch": 26.423982869379014, "frac_reward_zero_std": 0.925, "grad_norm": 0.08984375, "learning_rate": 8.7661e-06, "loss": 0.0011, "num_tokens": 1225398431.0, "reward": 1.0607812762260438, "reward_std": 0.14071731641888618, "rewards/reward_accuracy/mean": 0.9609375, "rewards/reward_accuracy/std": 0.14026115238666534, "rewards/reward_format/mean": 0.09984375238418579, "rewards/reward_format/std": 0.0016451086848974228, "sampling/importance_sampling_ratio/max": 2.4224223732948302, "sampling/importance_sampling_ratio/mean": 1.000346940755844, "sampling/importance_sampling_ratio/min": 0.2372343759983778, "sampling/sampling_logp_difference/max": 0.8810962915420533, "sampling/sampling_logp_difference/mean": 0.003859837702475488, "step": 12340, "step_time": 5.5041486566944515 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003515625, "completions/max_length": 1066.0, "completions/max_terminated_length": 943.5, "completions/mean_length": 153.286328125, "completions/mean_terminated_length": 146.68606872558593, "completions/min_length": 64.8, "completions/min_terminated_length": 64.8, "entropy": 0.039775332692079245, "epoch": 26.445396145610278, "frac_reward_zero_std": 0.91875, "grad_norm": 0.75, "learning_rate": 8.7651e-06, "loss": -0.0082, "num_tokens": 1226312108.0, "reward": 1.0638476729393005, "reward_std": 0.16381946429610253, "rewards/reward_accuracy/mean": 0.9640625, "rewards/reward_accuracy/std": 0.16274105608463288, "rewards/reward_format/mean": 0.09978515729308128, "rewards/reward_format/std": 0.0020693443948403, "sampling/importance_sampling_ratio/max": 2.4367723941802977, "sampling/importance_sampling_ratio/mean": 0.9895189881324769, "sampling/importance_sampling_ratio/min": 0.20397286750376226, "sampling/sampling_logp_difference/max": 0.9768446862697602, "sampling/sampling_logp_difference/mean": 0.0038900688057765366, "step": 12350, "step_time": 5.530660236210679 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.002734375, "completions/max_length": 1007.5, "completions/max_terminated_length": 900.4, "completions/mean_length": 145.12265625, "completions/mean_terminated_length": 139.99685821533203, "completions/min_length": 64.0, "completions/min_terminated_length": 64.0, "entropy": 0.036715060379356144, "epoch": 26.466809421841543, "frac_reward_zero_std": 0.94375, "grad_norm": 0.6015625, "learning_rate": 8.764100000000001e-06, "loss": -0.0041, "num_tokens": 1227201862.0, "reward": 1.0802148580551147, "reward_std": 0.08781383410096169, "rewards/reward_accuracy/mean": 0.98046875, "rewards/reward_accuracy/std": 0.08681524321436881, "rewards/reward_format/mean": 0.09974609389901161, "rewards/reward_format/std": 0.0023240381153300403, "sampling/importance_sampling_ratio/max": 2.413503646850586, "sampling/importance_sampling_ratio/mean": 0.9965579092502594, "sampling/importance_sampling_ratio/min": 0.2627452680841088, "sampling/sampling_logp_difference/max": 0.8534047722816467, "sampling/sampling_logp_difference/mean": 0.0036680999444797637, "step": 12360, "step_time": 5.245371717083617 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0015625, "completions/max_length": 1138.1, "completions/max_terminated_length": 1013.5, "completions/mean_length": 149.16640625, "completions/mean_terminated_length": 146.21238403320314, "completions/min_length": 66.8, "completions/min_terminated_length": 66.8, "entropy": 0.038320995634421706, "epoch": 26.488222698072803, "frac_reward_zero_std": 0.89375, "grad_norm": 0.1650390625, "learning_rate": 8.763100000000001e-06, "loss": -0.0129, "num_tokens": 1228106816.0, "reward": 1.0795312643051147, "reward_std": 0.12253917157649993, "rewards/reward_accuracy/mean": 0.9796875, "rewards/reward_accuracy/std": 0.12165729925036431, "rewards/reward_format/mean": 0.09984375089406967, "rewards/reward_format/std": 0.001433100108988583, "sampling/importance_sampling_ratio/max": 2.2065266132354737, "sampling/importance_sampling_ratio/mean": 0.9893871903419494, "sampling/importance_sampling_ratio/min": 0.1299258515238762, "sampling/sampling_logp_difference/max": 0.9474000334739685, "sampling/sampling_logp_difference/mean": 0.0038745679659768937, "step": 12370, "step_time": 5.455263001695857 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 3.7463984654095837e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 3.7463984654095837e-06, "completions/clipped_ratio": 0.00625, "completions/max_length": 954.4, "completions/max_terminated_length": 905.2, "completions/mean_length": 155.859765625, "completions/mean_terminated_length": 144.20159454345702, "completions/min_length": 64.1, "completions/min_terminated_length": 64.1, "entropy": 0.03945601866580546, "epoch": 26.509635974304068, "frac_reward_zero_std": 0.93125, "grad_norm": 0.443359375, "learning_rate": 8.7621e-06, "loss": -0.0038, "num_tokens": 1229029545.0, "reward": 1.053300803899765, "reward_std": 0.1633882276713848, "rewards/reward_accuracy/mean": 0.95390625, "rewards/reward_accuracy/std": 0.16181822791695594, "rewards/reward_format/mean": 0.09939453229308129, "rewards/reward_format/std": 0.003522482328116894, "sampling/importance_sampling_ratio/max": 2.5729261875152587, "sampling/importance_sampling_ratio/mean": 0.988648283481598, "sampling/importance_sampling_ratio/min": 0.1430075654760003, "sampling/sampling_logp_difference/max": 1.2842639327049254, "sampling/sampling_logp_difference/mean": 0.003994761104695499, "step": 12380, "step_time": 5.273472530808067 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005859375, "completions/max_length": 1466.0, "completions/max_terminated_length": 971.4, "completions/mean_length": 162.184765625, "completions/mean_terminated_length": 151.2773094177246, "completions/min_length": 61.5, "completions/min_terminated_length": 61.5, "entropy": 0.04293962914962322, "epoch": 26.531049250535332, "frac_reward_zero_std": 0.925, "grad_norm": 0.0, "learning_rate": 8.761100000000002e-06, "loss": -0.0021, "num_tokens": 1229957522.0, "reward": 1.071289074420929, "reward_std": 0.12242392897605896, "rewards/reward_accuracy/mean": 0.971875, "rewards/reward_accuracy/std": 0.11918618530035019, "rewards/reward_format/mean": 0.09941406324505805, "rewards/reward_format/std": 0.004192538745701313, "sampling/importance_sampling_ratio/max": 2.2534302711486816, "sampling/importance_sampling_ratio/mean": 0.9841293811798095, "sampling/importance_sampling_ratio/min": 0.14863759875297547, "sampling/sampling_logp_difference/max": 0.9403617203235626, "sampling/sampling_logp_difference/mean": 0.003936977335251867, "step": 12390, "step_time": 7.262316273487523 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00078125, "completions/max_length": 715.8, "completions/max_terminated_length": 524.7, "completions/mean_length": 130.616015625, "completions/mean_terminated_length": 129.12578125, "completions/min_length": 65.8, "completions/min_terminated_length": 65.8, "entropy": 0.032162893051281574, "epoch": 26.552462526766597, "frac_reward_zero_std": 0.95625, "grad_norm": 0.0, "learning_rate": 8.760100000000001e-06, "loss": -0.0043, "num_tokens": 1230807835.0, "reward": 1.0885937690734864, "reward_std": 0.06408443525433541, "rewards/reward_accuracy/mean": 0.988671875, "rewards/reward_accuracy/std": 0.06370269730687142, "rewards/reward_format/mean": 0.09992187619209289, "rewards/reward_format/std": 0.0012500001117587089, "sampling/importance_sampling_ratio/max": 2.349313259124756, "sampling/importance_sampling_ratio/mean": 0.9954762876033783, "sampling/importance_sampling_ratio/min": 0.2044969793409109, "sampling/sampling_logp_difference/max": 0.8222860872745514, "sampling/sampling_logp_difference/mean": 0.003473619627766311, "step": 12400, "step_time": 3.851185482388246 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00078125, "completions/max_length": 874.0, "completions/max_terminated_length": 691.2, "completions/mean_length": 142.622265625, "completions/mean_terminated_length": 141.14975280761718, "completions/min_length": 63.9, "completions/min_terminated_length": 63.9, "entropy": 0.03437666515819728, "epoch": 26.573875802997858, "frac_reward_zero_std": 0.91875, "grad_norm": 0.0, "learning_rate": 8.7591e-06, "loss": -0.0062, "num_tokens": 1231688180.0, "reward": 1.0585156440734864, "reward_std": 0.15503219068050383, "rewards/reward_accuracy/mean": 0.95859375, "rewards/reward_accuracy/std": 0.1547996684908867, "rewards/reward_format/mean": 0.09992187619209289, "rewards/reward_format/std": 0.0010660743806511163, "sampling/importance_sampling_ratio/max": 2.3614357590675352, "sampling/importance_sampling_ratio/mean": 0.9885070443153381, "sampling/importance_sampling_ratio/min": 0.19192293286323547, "sampling/sampling_logp_difference/max": 1.0203614830970764, "sampling/sampling_logp_difference/mean": 0.003620158135890961, "step": 12410, "step_time": 4.541580902007991 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00703125, "completions/max_length": 1093.6, "completions/max_terminated_length": 878.1, "completions/mean_length": 159.172265625, "completions/mean_terminated_length": 145.9892150878906, "completions/min_length": 64.1, "completions/min_terminated_length": 64.1, "entropy": 0.038824328244663774, "epoch": 26.595289079229122, "frac_reward_zero_std": 0.93125, "grad_norm": 0.60546875, "learning_rate": 8.7581e-06, "loss": -0.0024, "num_tokens": 1232610797.0, "reward": 1.0626172065734862, "reward_std": 0.14756816774606704, "rewards/reward_accuracy/mean": 0.96328125, "rewards/reward_accuracy/std": 0.14500498101115228, "rewards/reward_format/mean": 0.0993359386920929, "rewards/reward_format/std": 0.0037766341120004654, "sampling/importance_sampling_ratio/max": 2.5134023666381835, "sampling/importance_sampling_ratio/mean": 0.9935387015342713, "sampling/importance_sampling_ratio/min": 0.15108220875263215, "sampling/sampling_logp_difference/max": 0.8867518663406372, "sampling/sampling_logp_difference/mean": 0.003786539426073432, "step": 12420, "step_time": 5.447569780884078 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.002734375, "completions/max_length": 1373.7, "completions/max_terminated_length": 1033.4, "completions/mean_length": 152.51015625, "completions/mean_terminated_length": 147.35665435791014, "completions/min_length": 64.0, "completions/min_terminated_length": 64.0, "entropy": 0.03607139973901212, "epoch": 26.616702355460387, "frac_reward_zero_std": 0.9125, "grad_norm": 0.39453125, "learning_rate": 8.757100000000001e-06, "loss": -0.0016, "num_tokens": 1233520295.0, "reward": 1.0795312643051147, "reward_std": 0.11025769710540771, "rewards/reward_accuracy/mean": 0.9796875, "rewards/reward_accuracy/std": 0.1088766686618328, "rewards/reward_format/mean": 0.09984375089406967, "rewards/reward_format/std": 0.0025000002235174177, "sampling/importance_sampling_ratio/max": 2.394242024421692, "sampling/importance_sampling_ratio/mean": 0.9964451014995575, "sampling/importance_sampling_ratio/min": 0.16418154388666154, "sampling/sampling_logp_difference/max": 0.9119309663772583, "sampling/sampling_logp_difference/mean": 0.0036114776507019998, "step": 12430, "step_time": 6.710873871197691 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.002734375, "completions/max_length": 976.9, "completions/max_terminated_length": 971.7, "completions/mean_length": 154.055078125, "completions/mean_terminated_length": 149.01740264892578, "completions/min_length": 68.1, "completions/min_terminated_length": 68.1, "entropy": 0.03592993763741106, "epoch": 26.638115631691647, "frac_reward_zero_std": 0.91875, "grad_norm": 0.6171875, "learning_rate": 8.7561e-06, "loss": -0.0047, "num_tokens": 1234437028.0, "reward": 1.0524804949760438, "reward_std": 0.15732893720269203, "rewards/reward_accuracy/mean": 0.952734375, "rewards/reward_accuracy/std": 0.1566301740705967, "rewards/reward_format/mean": 0.09974609538912774, "rewards/reward_format/std": 0.0014799259603023528, "sampling/importance_sampling_ratio/max": 2.398430609703064, "sampling/importance_sampling_ratio/mean": 0.9946850657463073, "sampling/importance_sampling_ratio/min": 0.060870404541492465, "sampling/sampling_logp_difference/max": 0.9430308043956757, "sampling/sampling_logp_difference/mean": 0.0036812452832236885, "step": 12440, "step_time": 5.037132385504083 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0015625, "completions/max_length": 1199.5, "completions/max_terminated_length": 1128.5, "completions/mean_length": 157.94375, "completions/mean_terminated_length": 155.05777282714843, "completions/min_length": 66.7, "completions/min_terminated_length": 66.7, "entropy": 0.03448065186385065, "epoch": 26.659528907922912, "frac_reward_zero_std": 0.90625, "grad_norm": 0.1953125, "learning_rate": 8.7551e-06, "loss": -0.0003, "num_tokens": 1235360484.0, "reward": 1.0685937702655792, "reward_std": 0.1300741344690323, "rewards/reward_accuracy/mean": 0.96875, "rewards/reward_accuracy/std": 0.12961409538984298, "rewards/reward_format/mean": 0.09984375089406967, "rewards/reward_format/std": 0.0017032783478498458, "sampling/importance_sampling_ratio/max": 2.5228188276290893, "sampling/importance_sampling_ratio/mean": 0.992971134185791, "sampling/importance_sampling_ratio/min": 0.12482931688427926, "sampling/sampling_logp_difference/max": 1.0106429576873779, "sampling/sampling_logp_difference/mean": 0.0035012348322197794, "step": 12450, "step_time": 5.766961950281984 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0078125, "completions/max_length": 1535.6, "completions/max_terminated_length": 1276.3, "completions/mean_length": 163.809375, "completions/mean_terminated_length": 149.05001373291014, "completions/min_length": 59.3, "completions/min_terminated_length": 59.3, "entropy": 0.04547620269004256, "epoch": 26.680942184154176, "frac_reward_zero_std": 0.9125, "grad_norm": 0.15625, "learning_rate": 8.754100000000001e-06, "loss": -0.0039, "num_tokens": 1236293980.0, "reward": 1.0416211128234862, "reward_std": 0.18832831531763078, "rewards/reward_accuracy/mean": 0.9421875, "rewards/reward_accuracy/std": 0.18657757192850113, "rewards/reward_format/mean": 0.09943359568715096, "rewards/reward_format/std": 0.0050520160468295215, "sampling/importance_sampling_ratio/max": 2.5924160957336424, "sampling/importance_sampling_ratio/mean": 0.9800851881504059, "sampling/importance_sampling_ratio/min": 0.04723439327790402, "sampling/sampling_logp_difference/max": 1.6306010723114013, "sampling/sampling_logp_difference/mean": 0.0040724987629801035, "step": 12460, "step_time": 7.504733093088726 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.002734375, "completions/max_length": 896.8, "completions/max_terminated_length": 743.3, "completions/mean_length": 141.13984375, "completions/mean_terminated_length": 136.0074249267578, "completions/min_length": 63.8, "completions/min_terminated_length": 63.8, "entropy": 0.03395155109465122, "epoch": 26.70235546038544, "frac_reward_zero_std": 0.9375, "grad_norm": 0.353515625, "learning_rate": 8.753100000000001e-06, "loss": -0.0042, "num_tokens": 1237168434.0, "reward": 1.0623046994209289, "reward_std": 0.1493423268198967, "rewards/reward_accuracy/mean": 0.9625, "rewards/reward_accuracy/std": 0.14849163666367532, "rewards/reward_format/mean": 0.09980468824505806, "rewards/reward_format/std": 0.0020581001648679377, "sampling/importance_sampling_ratio/max": 2.3524025321006774, "sampling/importance_sampling_ratio/mean": 0.9887143731117248, "sampling/importance_sampling_ratio/min": 0.12985782697796822, "sampling/sampling_logp_difference/max": 1.062021827697754, "sampling/sampling_logp_difference/mean": 0.0037421176210045816, "step": 12470, "step_time": 4.610083013924305 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 1460.9, "completions/max_terminated_length": 1228.6, "completions/mean_length": 154.451953125, "completions/mean_terminated_length": 147.12101211547852, "completions/min_length": 63.0, "completions/min_terminated_length": 63.0, "entropy": 0.04216480951290578, "epoch": 26.7237687366167, "frac_reward_zero_std": 0.9, "grad_norm": 0.28125, "learning_rate": 8.7521e-06, "loss": -0.0054, "num_tokens": 1238084679.0, "reward": 1.0589258074760437, "reward_std": 0.15367091596126556, "rewards/reward_accuracy/mean": 0.959375, "rewards/reward_accuracy/std": 0.1521575190126896, "rewards/reward_format/mean": 0.09955078363418579, "rewards/reward_format/std": 0.004506619577296078, "sampling/importance_sampling_ratio/max": 2.2722039580345155, "sampling/importance_sampling_ratio/mean": 0.9774537265300751, "sampling/importance_sampling_ratio/min": 0.09351519979536534, "sampling/sampling_logp_difference/max": 1.1750441670417786, "sampling/sampling_logp_difference/mean": 0.0041163360700011255, "step": 12480, "step_time": 7.022788007889176 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0046875, "completions/max_length": 1709.9, "completions/max_terminated_length": 1108.0, "completions/mean_length": 156.63828125, "completions/mean_terminated_length": 147.826570892334, "completions/min_length": 65.4, "completions/min_terminated_length": 65.4, "entropy": 0.04441691676620394, "epoch": 26.745182012847966, "frac_reward_zero_std": 0.875, "grad_norm": 0.0732421875, "learning_rate": 8.751100000000002e-06, "loss": -0.005, "num_tokens": 1239003097.0, "reward": 1.0742968797683716, "reward_std": 0.1430821366608143, "rewards/reward_accuracy/mean": 0.974609375, "rewards/reward_accuracy/std": 0.14167148917913436, "rewards/reward_format/mean": 0.09968750029802323, "rewards/reward_format/std": 0.0032109312480315564, "sampling/importance_sampling_ratio/max": 2.221213436126709, "sampling/importance_sampling_ratio/mean": 0.9863013625144958, "sampling/importance_sampling_ratio/min": 0.09998914487659931, "sampling/sampling_logp_difference/max": 1.0491844952106475, "sampling/sampling_logp_difference/mean": 0.004147821827791632, "step": 12490, "step_time": 7.977676786581287 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 1198.8, "completions/max_terminated_length": 865.8, "completions/mean_length": 157.05625, "completions/mean_terminated_length": 149.69935455322266, "completions/min_length": 63.1, "completions/min_terminated_length": 63.1, "entropy": 0.036611161986365916, "epoch": 26.76659528907923, "frac_reward_zero_std": 0.90625, "grad_norm": 0.166015625, "learning_rate": 8.7501e-06, "loss": -0.0016, "num_tokens": 1239911929.0, "reward": 1.0543554902076722, "reward_std": 0.16683889031410218, "rewards/reward_accuracy/mean": 0.9546875, "rewards/reward_accuracy/std": 0.16516389399766923, "rewards/reward_format/mean": 0.09966797009110451, "rewards/reward_format/std": 0.0036379231372848154, "sampling/importance_sampling_ratio/max": 2.47730633020401, "sampling/importance_sampling_ratio/mean": 0.9908472895622253, "sampling/importance_sampling_ratio/min": 0.10780540108680725, "sampling/sampling_logp_difference/max": 1.0801722168922425, "sampling/sampling_logp_difference/mean": 0.0037483282620087268, "step": 12500, "step_time": 5.9421808173123285 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.007421875, "completions/max_length": 1751.5, "completions/max_terminated_length": 1233.7, "completions/mean_length": 161.50703125, "completions/mean_terminated_length": 147.53360595703126, "completions/min_length": 63.8, "completions/min_terminated_length": 63.8, "entropy": 0.040897570643574, "epoch": 26.78800856531049, "frac_reward_zero_std": 0.9375, "grad_norm": 0.0, "learning_rate": 8.7491e-06, "loss": -0.0095, "num_tokens": 1240841275.0, "reward": 1.068457043170929, "reward_std": 0.14408271461725236, "rewards/reward_accuracy/mean": 0.969140625, "rewards/reward_accuracy/std": 0.14020903035998344, "rewards/reward_format/mean": 0.09931640699505806, "rewards/reward_format/std": 0.005671476386487484, "sampling/importance_sampling_ratio/max": 2.3774197697639465, "sampling/importance_sampling_ratio/mean": 0.979960823059082, "sampling/importance_sampling_ratio/min": 0.06089931428432464, "sampling/sampling_logp_difference/max": 0.9012146592140198, "sampling/sampling_logp_difference/mean": 0.0038418506272137167, "step": 12510, "step_time": 8.23584835640213 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003515625, "completions/max_length": 1212.0, "completions/max_terminated_length": 1085.7, "completions/mean_length": 151.11171875, "completions/mean_terminated_length": 144.46448516845703, "completions/min_length": 69.9, "completions/min_terminated_length": 69.9, "entropy": 0.03824645222630352, "epoch": 26.809421841541756, "frac_reward_zero_std": 0.93125, "grad_norm": 0.154296875, "learning_rate": 8.7481e-06, "loss": -0.0045, "num_tokens": 1241741161.0, "reward": 1.0719140648841858, "reward_std": 0.12033685550559312, "rewards/reward_accuracy/mean": 0.972265625, "rewards/reward_accuracy/std": 0.11855541691184043, "rewards/reward_format/mean": 0.09964843764901161, "rewards/reward_format/std": 0.003571730898693204, "sampling/importance_sampling_ratio/max": 2.3988327622413634, "sampling/importance_sampling_ratio/mean": 0.9876061916351319, "sampling/importance_sampling_ratio/min": 0.18179123066365718, "sampling/sampling_logp_difference/max": 0.8713419616222382, "sampling/sampling_logp_difference/mean": 0.00386557353194803, "step": 12520, "step_time": 5.933028789696982 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00234375, "completions/max_length": 1230.8, "completions/max_terminated_length": 997.2, "completions/mean_length": 165.785546875, "completions/mean_terminated_length": 161.41994018554686, "completions/min_length": 70.2, "completions/min_terminated_length": 70.2, "entropy": 0.04431989637669176, "epoch": 26.83083511777302, "frac_reward_zero_std": 0.89375, "grad_norm": 0.74609375, "learning_rate": 8.747100000000001e-06, "loss": -0.0066, "num_tokens": 1242691524.0, "reward": 1.059199231863022, "reward_std": 0.14951584488153458, "rewards/reward_accuracy/mean": 0.959375, "rewards/reward_accuracy/std": 0.14852575808763505, "rewards/reward_format/mean": 0.0998242199420929, "rewards/reward_format/std": 0.002444648859091103, "sampling/importance_sampling_ratio/max": 2.395486283302307, "sampling/importance_sampling_ratio/mean": 0.9768068134784699, "sampling/importance_sampling_ratio/min": 0.15542591996490956, "sampling/sampling_logp_difference/max": 0.9531604051589966, "sampling/sampling_logp_difference/mean": 0.003986434871330857, "step": 12530, "step_time": 6.237728268303909 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005078125, "completions/max_length": 1200.2, "completions/max_terminated_length": 1059.9, "completions/mean_length": 167.57421875, "completions/mean_terminated_length": 158.16651000976563, "completions/min_length": 66.4, "completions/min_terminated_length": 66.4, "entropy": 0.04235132755711675, "epoch": 26.85224839400428, "frac_reward_zero_std": 0.90625, "grad_norm": 0.072265625, "learning_rate": 8.7461e-06, "loss": -0.0088, "num_tokens": 1243642002.0, "reward": 1.0687304854393005, "reward_std": 0.1254809595644474, "rewards/reward_accuracy/mean": 0.969140625, "rewards/reward_accuracy/std": 0.12331953719258308, "rewards/reward_format/mean": 0.09958984404802322, "rewards/reward_format/std": 0.003828571387566626, "sampling/importance_sampling_ratio/max": 2.3722012400627137, "sampling/importance_sampling_ratio/mean": 0.9811906278133392, "sampling/importance_sampling_ratio/min": 0.12491670325398445, "sampling/sampling_logp_difference/max": 1.0072677969932555, "sampling/sampling_logp_difference/mean": 0.003897653496824205, "step": 12540, "step_time": 6.350971611309797 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00078125, "completions/max_length": 908.7, "completions/max_terminated_length": 872.5, "completions/mean_length": 139.47265625, "completions/mean_terminated_length": 137.98615264892578, "completions/min_length": 65.0, "completions/min_terminated_length": 65.0, "entropy": 0.03596659882459789, "epoch": 26.873661670235546, "frac_reward_zero_std": 0.94375, "grad_norm": 0.220703125, "learning_rate": 8.7451e-06, "loss": -0.0045, "num_tokens": 1244517356.0, "reward": 1.0929296970367433, "reward_std": 0.05886864543426782, "rewards/reward_accuracy/mean": 0.99296875, "rewards/reward_accuracy/std": 0.0584512785077095, "rewards/reward_format/mean": 0.09996093809604645, "rewards/reward_format/std": 0.0006250000093132258, "sampling/importance_sampling_ratio/max": 2.2622291803359986, "sampling/importance_sampling_ratio/mean": 0.995643424987793, "sampling/importance_sampling_ratio/min": 0.12222468256950378, "sampling/sampling_logp_difference/max": 1.1259133398532868, "sampling/sampling_logp_difference/mean": 0.0037219708086922766, "step": 12550, "step_time": 4.648831791122211 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0015625, "completions/max_length": 1036.8, "completions/max_terminated_length": 1009.8, "completions/mean_length": 148.539453125, "completions/mean_terminated_length": 145.5690719604492, "completions/min_length": 61.6, "completions/min_terminated_length": 61.6, "entropy": 0.036352154426276685, "epoch": 26.89507494646681, "frac_reward_zero_std": 0.9375, "grad_norm": 0.0, "learning_rate": 8.744100000000002e-06, "loss": -0.0006, "num_tokens": 1245417905.0, "reward": 1.0748242378234862, "reward_std": 0.11272718459367752, "rewards/reward_accuracy/mean": 0.975, "rewards/reward_accuracy/std": 0.11176888942718506, "rewards/reward_format/mean": 0.0998242199420929, "rewards/reward_format/std": 0.001944400672800839, "sampling/importance_sampling_ratio/max": 2.5015812158584594, "sampling/importance_sampling_ratio/mean": 0.9950766026973724, "sampling/importance_sampling_ratio/min": 0.15715850740671158, "sampling/sampling_logp_difference/max": 0.900447428226471, "sampling/sampling_logp_difference/mean": 0.0037660690024495123, "step": 12560, "step_time": 5.176354477807763 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003515625, "completions/max_length": 893.5, "completions/max_terminated_length": 742.3, "completions/mean_length": 145.93515625, "completions/mean_terminated_length": 139.3190887451172, "completions/min_length": 65.7, "completions/min_terminated_length": 65.7, "entropy": 0.03750852071680129, "epoch": 26.916488222698074, "frac_reward_zero_std": 0.925, "grad_norm": 0.2431640625, "learning_rate": 8.743100000000001e-06, "loss": -0.0049, "num_tokens": 1246305531.0, "reward": 1.0815234541893006, "reward_std": 0.10220926105976105, "rewards/reward_accuracy/mean": 0.981640625, "rewards/reward_accuracy/std": 0.1017054483294487, "rewards/reward_format/mean": 0.09988281354308129, "rewards/reward_format/std": 0.0009831610135734082, "sampling/importance_sampling_ratio/max": 2.400411868095398, "sampling/importance_sampling_ratio/mean": 0.9903962135314941, "sampling/importance_sampling_ratio/min": 0.14868990909308194, "sampling/sampling_logp_difference/max": 1.03043475151062, "sampling/sampling_logp_difference/mean": 0.003823703504167497, "step": 12570, "step_time": 4.737543996423483 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00234375, "completions/max_length": 1496.5, "completions/max_terminated_length": 1351.5, "completions/mean_length": 153.1390625, "completions/mean_terminated_length": 148.70567016601564, "completions/min_length": 62.8, "completions/min_terminated_length": 62.8, "entropy": 0.039669132535345854, "epoch": 26.937901498929335, "frac_reward_zero_std": 0.93125, "grad_norm": 0.0, "learning_rate": 8.7421e-06, "loss": -0.0008, "num_tokens": 1247216031.0, "reward": 1.067734384536743, "reward_std": 0.14608059376478194, "rewards/reward_accuracy/mean": 0.96796875, "rewards/reward_accuracy/std": 0.14510635957121848, "rewards/reward_format/mean": 0.09976562559604644, "rewards/reward_format/std": 0.002492625406011939, "sampling/importance_sampling_ratio/max": 2.4313813209533692, "sampling/importance_sampling_ratio/mean": 0.978470242023468, "sampling/importance_sampling_ratio/min": 0.12788924174383282, "sampling/sampling_logp_difference/max": 0.892998218536377, "sampling/sampling_logp_difference/mean": 0.003796715522184968, "step": 12580, "step_time": 7.154904514417285 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 4.2955325625371187e-07, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 4.2955325625371187e-07, "completions/clipped_ratio": 0.0046875, "completions/max_length": 1053.3, "completions/max_terminated_length": 862.2, "completions/mean_length": 156.812890625, "completions/mean_terminated_length": 148.1324462890625, "completions/min_length": 65.7, "completions/min_terminated_length": 65.7, "entropy": 0.03871748391538858, "epoch": 26.9593147751606, "frac_reward_zero_std": 0.91875, "grad_norm": 0.1416015625, "learning_rate": 8.741100000000002e-06, "loss": -0.0047, "num_tokens": 1248136048.0, "reward": 1.0672265827655791, "reward_std": 0.132164104282856, "rewards/reward_accuracy/mean": 0.967578125, "rewards/reward_accuracy/std": 0.13090885505080224, "rewards/reward_format/mean": 0.09964843839406967, "rewards/reward_format/std": 0.0029746270971372723, "sampling/importance_sampling_ratio/max": 2.448600733280182, "sampling/importance_sampling_ratio/mean": 1.0037270367145539, "sampling/importance_sampling_ratio/min": 0.13781668581068515, "sampling/sampling_logp_difference/max": 0.9139571905136108, "sampling/sampling_logp_difference/mean": 0.003892198484390974, "step": 12590, "step_time": 5.175322593990131 }, { "clip_ratio/high_max": 1.1665889178402723e-05, "clip_ratio/high_mean": 1.4582361473003403e-06, "clip_ratio/low_mean": 1.0936771104752551e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 2.5519132577755952e-06, "completions/clipped_ratio": 0.008984375, "completions/max_length": 1567.1, "completions/max_terminated_length": 1443.8, "completions/mean_length": 169.248046875, "completions/mean_terminated_length": 152.23634490966796, "completions/min_length": 66.2, "completions/min_terminated_length": 66.2, "entropy": 0.04537316833157092, "epoch": 26.980728051391864, "frac_reward_zero_std": 0.93125, "grad_norm": 0.203125, "learning_rate": 8.7401e-06, "loss": -0.0043, "num_tokens": 1249079851.0, "reward": 1.0683593928813935, "reward_std": 0.13314120694994927, "rewards/reward_accuracy/mean": 0.969140625, "rewards/reward_accuracy/std": 0.1296163745224476, "rewards/reward_format/mean": 0.09921875074505807, "rewards/reward_format/std": 0.005329701700247824, "sampling/importance_sampling_ratio/max": 2.594748067855835, "sampling/importance_sampling_ratio/mean": 0.9878929853439331, "sampling/importance_sampling_ratio/min": 0.0634825199842453, "sampling/sampling_logp_difference/max": 0.999093770980835, "sampling/sampling_logp_difference/mean": 0.004022311372682452, "step": 12600, "step_time": 7.832228617699002 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.000390625, "completions/max_length": 756.7, "completions/max_terminated_length": 585.4, "completions/mean_length": 141.49375, "completions/mean_terminated_length": 140.7431610107422, "completions/min_length": 63.4, "completions/min_terminated_length": 63.4, "entropy": 0.033015654026530686, "epoch": 27.002141327623125, "frac_reward_zero_std": 0.95625, "grad_norm": 0.380859375, "learning_rate": 8.7391e-06, "loss": 0.001, "num_tokens": 1249959931.0, "reward": 1.0835351705551148, "reward_std": 0.09276851743925363, "rewards/reward_accuracy/mean": 0.98359375, "rewards/reward_accuracy/std": 0.09200436919927597, "rewards/reward_format/mean": 0.09994140714406967, "rewards/reward_format/std": 0.0009375000605359674, "sampling/importance_sampling_ratio/max": 2.1254823923110964, "sampling/importance_sampling_ratio/mean": 0.9795442938804626, "sampling/importance_sampling_ratio/min": 0.20092845857143402, "sampling/sampling_logp_difference/max": 0.9932573318481446, "sampling/sampling_logp_difference/mean": 0.0036618191516026855, "step": 12610, "step_time": 3.895666364187491 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.002734375, "completions/max_length": 1222.4, "completions/max_terminated_length": 1036.7, "completions/mean_length": 152.915625, "completions/mean_terminated_length": 147.8524528503418, "completions/min_length": 64.9, "completions/min_terminated_length": 64.9, "entropy": 0.03741874429397285, "epoch": 27.02355460385439, "frac_reward_zero_std": 0.93125, "grad_norm": 0.0, "learning_rate": 8.7381e-06, "loss": -0.0028, "num_tokens": 1250866131.0, "reward": 1.0855273604393005, "reward_std": 0.08079418689012527, "rewards/reward_accuracy/mean": 0.9859375, "rewards/reward_accuracy/std": 0.07865023091435433, "rewards/reward_format/mean": 0.09958984479308128, "rewards/reward_format/std": 0.0030176589265465737, "sampling/importance_sampling_ratio/max": 2.3872847676277162, "sampling/importance_sampling_ratio/mean": 0.9911778807640076, "sampling/importance_sampling_ratio/min": 0.18369950577616692, "sampling/sampling_logp_difference/max": 0.9442965090274811, "sampling/sampling_logp_difference/mean": 0.003740156185813248, "step": 12620, "step_time": 5.969954165580566 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00078125, "completions/max_length": 1252.8, "completions/max_terminated_length": 1150.9, "completions/mean_length": 151.401953125, "completions/mean_terminated_length": 149.91536407470704, "completions/min_length": 69.0, "completions/min_terminated_length": 69.0, "entropy": 0.038987696263939144, "epoch": 27.044967880085654, "frac_reward_zero_std": 0.90625, "grad_norm": 0.0, "learning_rate": 8.7371e-06, "loss": -0.0012, "num_tokens": 1251767032.0, "reward": 1.0846289277076722, "reward_std": 0.09437214061617852, "rewards/reward_accuracy/mean": 0.984765625, "rewards/reward_accuracy/std": 0.09354534074664116, "rewards/reward_format/mean": 0.09986328259110451, "rewards/reward_format/std": 0.0017004600027576088, "sampling/importance_sampling_ratio/max": 2.616628861427307, "sampling/importance_sampling_ratio/mean": 0.9908076643943786, "sampling/importance_sampling_ratio/min": 0.10434326641261578, "sampling/sampling_logp_difference/max": 1.4801496982574462, "sampling/sampling_logp_difference/mean": 0.003930504014715552, "step": 12630, "step_time": 6.027730936591979 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00234375, "completions/max_length": 1170.5, "completions/max_terminated_length": 935.8, "completions/mean_length": 149.39609375, "completions/mean_terminated_length": 145.0401397705078, "completions/min_length": 62.3, "completions/min_terminated_length": 62.3, "entropy": 0.03784103207290172, "epoch": 27.066381156316915, "frac_reward_zero_std": 0.9375, "grad_norm": 0.0, "learning_rate": 8.736100000000001e-06, "loss": -0.0002, "num_tokens": 1252658878.0, "reward": 1.07470703125, "reward_std": 0.09832794740796089, "rewards/reward_accuracy/mean": 0.975, "rewards/reward_accuracy/std": 0.09716628417372704, "rewards/reward_format/mean": 0.09970703125, "rewards/reward_format/std": 0.002443419257178903, "sampling/importance_sampling_ratio/max": 2.343415987491608, "sampling/importance_sampling_ratio/mean": 0.9966915249824524, "sampling/importance_sampling_ratio/min": 0.22118260860443115, "sampling/sampling_logp_difference/max": 0.8338399887084961, "sampling/sampling_logp_difference/mean": 0.003574965172447264, "step": 12640, "step_time": 5.800673530809581 }, { "clip_ratio/high_max": 2.152079323423095e-05, "clip_ratio/high_mean": 2.6900991542788686e-06, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 2.6900991542788686e-06, "completions/clipped_ratio": 0.005859375, "completions/max_length": 1297.2, "completions/max_terminated_length": 1155.8, "completions/mean_length": 162.199609375, "completions/mean_terminated_length": 151.38792724609374, "completions/min_length": 65.3, "completions/min_terminated_length": 65.3, "entropy": 0.04313916501123458, "epoch": 27.08779443254818, "frac_reward_zero_std": 0.925, "grad_norm": 0.484375, "learning_rate": 8.7351e-06, "loss": -0.0052, "num_tokens": 1253596397.0, "reward": 1.0558203220367433, "reward_std": 0.177667810767889, "rewards/reward_accuracy/mean": 0.95625, "rewards/reward_accuracy/std": 0.176446433365345, "rewards/reward_format/mean": 0.09957031309604644, "rewards/reward_format/std": 0.0033186885761097074, "sampling/importance_sampling_ratio/max": 2.5675207495689394, "sampling/importance_sampling_ratio/mean": 0.9884207427501679, "sampling/importance_sampling_ratio/min": 0.14339400604367256, "sampling/sampling_logp_difference/max": 0.9342005848884583, "sampling/sampling_logp_difference/mean": 0.003933656751178205, "step": 12650, "step_time": 6.556514323106967 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00703125, "completions/max_length": 1281.4, "completions/max_terminated_length": 1105.2, "completions/mean_length": 168.37734375, "completions/mean_terminated_length": 155.25613708496093, "completions/min_length": 63.4, "completions/min_terminated_length": 63.4, "entropy": 0.042566988174803554, "epoch": 27.109207708779444, "frac_reward_zero_std": 0.9, "grad_norm": 0.11767578125, "learning_rate": 8.734100000000002e-06, "loss": -0.0124, "num_tokens": 1254547299.0, "reward": 1.0725781321525574, "reward_std": 0.1404448129236698, "rewards/reward_accuracy/mean": 0.973046875, "rewards/reward_accuracy/std": 0.13832568973302842, "rewards/reward_format/mean": 0.0995312511920929, "rewards/reward_format/std": 0.003294321708381176, "sampling/importance_sampling_ratio/max": 2.4121355533599855, "sampling/importance_sampling_ratio/mean": 0.9827308773994445, "sampling/importance_sampling_ratio/min": 0.0970441535115242, "sampling/sampling_logp_difference/max": 0.9467766046524048, "sampling/sampling_logp_difference/mean": 0.003840688127093017, "step": 12660, "step_time": 6.582177033997141 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005859375, "completions/max_length": 1628.2, "completions/max_terminated_length": 1273.0, "completions/mean_length": 161.863671875, "completions/mean_terminated_length": 150.8149200439453, "completions/min_length": 66.1, "completions/min_terminated_length": 66.1, "entropy": 0.04377062781713903, "epoch": 27.130620985010708, "frac_reward_zero_std": 0.91875, "grad_norm": 0.08447265625, "learning_rate": 8.733100000000001e-06, "loss": -0.0068, "num_tokens": 1255482230.0, "reward": 1.0737890720367431, "reward_std": 0.1324259139597416, "rewards/reward_accuracy/mean": 0.97421875, "rewards/reward_accuracy/std": 0.12973487228155137, "rewards/reward_format/mean": 0.09957031309604644, "rewards/reward_format/std": 0.004555970896035433, "sampling/importance_sampling_ratio/max": 2.379637575149536, "sampling/importance_sampling_ratio/mean": 0.989645802974701, "sampling/importance_sampling_ratio/min": 0.07791546862572432, "sampling/sampling_logp_difference/max": 1.3067884564399719, "sampling/sampling_logp_difference/mean": 0.0041132632875815036, "step": 12670, "step_time": 7.835086093205609 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003125, "completions/max_length": 1256.6, "completions/max_terminated_length": 1199.4, "completions/mean_length": 153.048046875, "completions/mean_terminated_length": 147.20110778808595, "completions/min_length": 66.1, "completions/min_terminated_length": 66.1, "entropy": 0.040592874656431376, "epoch": 27.15203426124197, "frac_reward_zero_std": 0.90625, "grad_norm": 0.06689453125, "learning_rate": 8.7321e-06, "loss": -0.0095, "num_tokens": 1256390001.0, "reward": 1.0751172184944153, "reward_std": 0.11913535073399543, "rewards/reward_accuracy/mean": 0.975390625, "rewards/reward_accuracy/std": 0.11809398084878922, "rewards/reward_format/mean": 0.09972656518220901, "rewards/reward_format/std": 0.0025229052640497684, "sampling/importance_sampling_ratio/max": 2.5709001302719114, "sampling/importance_sampling_ratio/mean": 0.9744259059429169, "sampling/importance_sampling_ratio/min": 0.14029985219240187, "sampling/sampling_logp_difference/max": 0.9188993215560913, "sampling/sampling_logp_difference/mean": 0.003984051733277738, "step": 12680, "step_time": 6.150481138189207 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00234375, "completions/max_length": 1039.2, "completions/max_terminated_length": 986.9, "completions/mean_length": 146.940625, "completions/mean_terminated_length": 142.52227935791015, "completions/min_length": 65.7, "completions/min_terminated_length": 65.7, "entropy": 0.03531296192668378, "epoch": 27.173447537473233, "frac_reward_zero_std": 0.96875, "grad_norm": 0.0, "learning_rate": 8.731100000000002e-06, "loss": 0.0004, "num_tokens": 1257285065.0, "reward": 1.0657617449760437, "reward_std": 0.12681491822004318, "rewards/reward_accuracy/mean": 0.966015625, "rewards/reward_accuracy/std": 0.12570650205016137, "rewards/reward_format/mean": 0.09974609464406967, "rewards/reward_format/std": 0.002084212377667427, "sampling/importance_sampling_ratio/max": 2.4101922869682313, "sampling/importance_sampling_ratio/mean": 0.9943255007266998, "sampling/importance_sampling_ratio/min": 0.11139898300170899, "sampling/sampling_logp_difference/max": 1.064814466238022, "sampling/sampling_logp_difference/mean": 0.003666867036372423, "step": 12690, "step_time": 5.182913194075809 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 1134.9, "completions/max_terminated_length": 938.9, "completions/mean_length": 146.337890625, "completions/mean_terminated_length": 138.94182891845702, "completions/min_length": 63.8, "completions/min_terminated_length": 63.8, "entropy": 0.03877810484264046, "epoch": 27.194860813704498, "frac_reward_zero_std": 0.9375, "grad_norm": 0.38671875, "learning_rate": 8.7301e-06, "loss": -0.0041, "num_tokens": 1258170538.0, "reward": 1.088085949420929, "reward_std": 0.07675795704126358, "rewards/reward_accuracy/mean": 0.98828125, "rewards/reward_accuracy/std": 0.07569829672574997, "rewards/reward_format/mean": 0.09980468824505806, "rewards/reward_format/std": 0.0023282783105969427, "sampling/importance_sampling_ratio/max": 2.3432676553726197, "sampling/importance_sampling_ratio/mean": 0.9823654472827912, "sampling/importance_sampling_ratio/min": 0.17276358529925345, "sampling/sampling_logp_difference/max": 0.9855234384536743, "sampling/sampling_logp_difference/mean": 0.003789245360530913, "step": 12700, "step_time": 5.645123153802706 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003515625, "completions/max_length": 1098.3, "completions/max_terminated_length": 1044.1, "completions/mean_length": 164.57109375, "completions/mean_terminated_length": 158.16814575195312, "completions/min_length": 63.8, "completions/min_terminated_length": 63.8, "entropy": 0.04517072003800422, "epoch": 27.21627408993576, "frac_reward_zero_std": 0.9375, "grad_norm": 0.0, "learning_rate": 8.7291e-06, "loss": -0.0007, "num_tokens": 1259110800.0, "reward": 1.0648633003234864, "reward_std": 0.11799062117934227, "rewards/reward_accuracy/mean": 0.965234375, "rewards/reward_accuracy/std": 0.11677624061703681, "rewards/reward_format/mean": 0.09962890669703484, "rewards/reward_format/std": 0.002955902274698019, "sampling/importance_sampling_ratio/max": 2.5384440422058105, "sampling/importance_sampling_ratio/mean": 0.9750185191631318, "sampling/importance_sampling_ratio/min": 0.1156343549489975, "sampling/sampling_logp_difference/max": 1.1596896827220917, "sampling/sampling_logp_difference/mean": 0.004214121052064002, "step": 12710, "step_time": 5.548443765129195 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0015625, "completions/max_length": 1519.7, "completions/max_terminated_length": 1215.4, "completions/mean_length": 144.851953125, "completions/mean_terminated_length": 141.8869758605957, "completions/min_length": 66.6, "completions/min_terminated_length": 66.6, "entropy": 0.03902824022807181, "epoch": 27.237687366167023, "frac_reward_zero_std": 0.93125, "grad_norm": 0.07470703125, "learning_rate": 8.7281e-06, "loss": -0.0049, "num_tokens": 1259993173.0, "reward": 1.0701171875, "reward_std": 0.13645949095953255, "rewards/reward_accuracy/mean": 0.9703125, "rewards/reward_accuracy/std": 0.13478140532970428, "rewards/reward_format/mean": 0.0998046875, "rewards/reward_format/std": 0.0028851744486019016, "sampling/importance_sampling_ratio/max": 2.4020063638687135, "sampling/importance_sampling_ratio/mean": 0.9766020715236664, "sampling/importance_sampling_ratio/min": 0.08764459751546383, "sampling/sampling_logp_difference/max": 1.15885751247406, "sampling/sampling_logp_difference/mean": 0.004108287859708071, "step": 12720, "step_time": 7.046374456712511 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00078125, "completions/max_length": 1154.2, "completions/max_terminated_length": 1027.8, "completions/mean_length": 147.90078125, "completions/mean_terminated_length": 146.42324981689453, "completions/min_length": 68.1, "completions/min_terminated_length": 68.1, "entropy": 0.03492811780888587, "epoch": 27.259100642398288, "frac_reward_zero_std": 0.91875, "grad_norm": 0.1875, "learning_rate": 8.7271e-06, "loss": -0.0051, "num_tokens": 1260884615.0, "reward": 1.0886523604393006, "reward_std": 0.08693512305617332, "rewards/reward_accuracy/mean": 0.988671875, "rewards/reward_accuracy/std": 0.08675243258476258, "rewards/reward_format/mean": 0.09998046979308128, "rewards/reward_format/std": 0.0003125000046566129, "sampling/importance_sampling_ratio/max": 2.538546252250671, "sampling/importance_sampling_ratio/mean": 0.9995150744915009, "sampling/importance_sampling_ratio/min": 0.152553915604949, "sampling/sampling_logp_difference/max": 1.0667690873146056, "sampling/sampling_logp_difference/mean": 0.003553827665746212, "step": 12730, "step_time": 5.596068940477562 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 1273.1, "completions/max_terminated_length": 1025.1, "completions/mean_length": 168.466015625, "completions/mean_terminated_length": 161.09353637695312, "completions/min_length": 66.6, "completions/min_terminated_length": 66.6, "entropy": 0.0445972881745547, "epoch": 27.280513918629552, "frac_reward_zero_std": 0.90625, "grad_norm": 0.259765625, "learning_rate": 8.726100000000001e-06, "loss": -0.0044, "num_tokens": 1261838288.0, "reward": 1.060156273841858, "reward_std": 0.17145940959453582, "rewards/reward_accuracy/mean": 0.960546875, "rewards/reward_accuracy/std": 0.1699141502380371, "rewards/reward_format/mean": 0.099609375, "rewards/reward_format/std": 0.003291428554803133, "sampling/importance_sampling_ratio/max": 2.470018243789673, "sampling/importance_sampling_ratio/mean": 0.9739997088909149, "sampling/importance_sampling_ratio/min": 0.08972264947369694, "sampling/sampling_logp_difference/max": 1.138592493534088, "sampling/sampling_logp_difference/mean": 0.004157774965278804, "step": 12740, "step_time": 6.297122117783874 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003125, "completions/max_length": 1542.9, "completions/max_terminated_length": 1183.1, "completions/mean_length": 160.730078125, "completions/mean_terminated_length": 154.87540130615236, "completions/min_length": 64.2, "completions/min_terminated_length": 64.2, "entropy": 0.038804725464433434, "epoch": 27.301927194860813, "frac_reward_zero_std": 0.9125, "grad_norm": 0.42578125, "learning_rate": 8.7251e-06, "loss": -0.0064, "num_tokens": 1262770013.0, "reward": 1.0618750035762787, "reward_std": 0.1540781132876873, "rewards/reward_accuracy/mean": 0.962109375, "rewards/reward_accuracy/std": 0.15283758714795112, "rewards/reward_format/mean": 0.09976562559604644, "rewards/reward_format/std": 0.003382148826494813, "sampling/importance_sampling_ratio/max": 2.600006127357483, "sampling/importance_sampling_ratio/mean": 0.992150217294693, "sampling/importance_sampling_ratio/min": 0.13363812416791915, "sampling/sampling_logp_difference/max": 0.9493774116039276, "sampling/sampling_logp_difference/mean": 0.00381937799975276, "step": 12750, "step_time": 7.376244885701453 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0078125, "completions/max_length": 999.6, "completions/max_terminated_length": 653.7, "completions/mean_length": 163.5375, "completions/mean_terminated_length": 148.45287857055663, "completions/min_length": 62.5, "completions/min_terminated_length": 62.5, "entropy": 0.04118309880141169, "epoch": 27.323340471092077, "frac_reward_zero_std": 0.91875, "grad_norm": 0.0, "learning_rate": 8.724100000000002e-06, "loss": 0.0027, "num_tokens": 1263708429.0, "reward": 1.0656054973602296, "reward_std": 0.14155273884534836, "rewards/reward_accuracy/mean": 0.96640625, "rewards/reward_accuracy/std": 0.13851695507764816, "rewards/reward_format/mean": 0.09919922053813934, "rewards/reward_format/std": 0.004369343211874366, "sampling/importance_sampling_ratio/max": 2.6202195644378663, "sampling/importance_sampling_ratio/mean": 0.9919298887252808, "sampling/importance_sampling_ratio/min": 0.13869542367756366, "sampling/sampling_logp_difference/max": 0.9790866255760193, "sampling/sampling_logp_difference/mean": 0.003965315618552267, "step": 12760, "step_time": 5.426574337319471 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 4.118699234822998e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 4.118699234822998e-06, "completions/clipped_ratio": 0.016796875, "completions/max_length": 1744.9, "completions/max_terminated_length": 1400.2, "completions/mean_length": 196.7828125, "completions/mean_terminated_length": 165.45030670166017, "completions/min_length": 65.7, "completions/min_terminated_length": 65.7, "entropy": 0.05540991288144141, "epoch": 27.34475374732334, "frac_reward_zero_std": 0.88125, "grad_norm": 0.2412109375, "learning_rate": 8.723100000000001e-06, "loss": -0.009, "num_tokens": 1264733137.0, "reward": 1.0476367354393006, "reward_std": 0.2017641119658947, "rewards/reward_accuracy/mean": 0.948828125, "rewards/reward_accuracy/std": 0.1968064233660698, "rewards/reward_format/mean": 0.09880859479308128, "rewards/reward_format/std": 0.008334906143136322, "sampling/importance_sampling_ratio/max": 2.606825041770935, "sampling/importance_sampling_ratio/mean": 0.982547914981842, "sampling/importance_sampling_ratio/min": 0.07794667892158032, "sampling/sampling_logp_difference/max": 1.0564493417739869, "sampling/sampling_logp_difference/mean": 0.004149502888321876, "step": 12770, "step_time": 8.765828663867433 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 1083.1, "completions/max_terminated_length": 810.4, "completions/mean_length": 162.18671875, "completions/mean_terminated_length": 154.93186264038087, "completions/min_length": 69.1, "completions/min_terminated_length": 69.1, "entropy": 0.034416544274426995, "epoch": 27.366167023554603, "frac_reward_zero_std": 0.94375, "grad_norm": 0.173828125, "learning_rate": 8.7221e-06, "loss": -0.0013, "num_tokens": 1265668943.0, "reward": 1.0711328387260437, "reward_std": 0.10339382290840149, "rewards/reward_accuracy/mean": 0.971484375, "rewards/reward_accuracy/std": 0.10216421782970428, "rewards/reward_format/mean": 0.09964843764901161, "rewards/reward_format/std": 0.0025979126105085014, "sampling/importance_sampling_ratio/max": 2.463323736190796, "sampling/importance_sampling_ratio/mean": 0.9980034530162811, "sampling/importance_sampling_ratio/min": 0.17565926313400268, "sampling/sampling_logp_difference/max": 1.1034145474433898, "sampling/sampling_logp_difference/mean": 0.0035987000679597258, "step": 12780, "step_time": 5.53087471431063 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003515625, "completions/max_length": 1268.3, "completions/max_terminated_length": 997.9, "completions/mean_length": 157.555078125, "completions/mean_terminated_length": 151.0261001586914, "completions/min_length": 69.6, "completions/min_terminated_length": 69.6, "entropy": 0.03917536155786365, "epoch": 27.387580299785867, "frac_reward_zero_std": 0.95, "grad_norm": 0.091796875, "learning_rate": 8.721100000000002e-06, "loss": -0.0007, "num_tokens": 1266592636.0, "reward": 1.0755273640155791, "reward_std": 0.10647519454360008, "rewards/reward_accuracy/mean": 0.97578125, "rewards/reward_accuracy/std": 0.10524587109684944, "rewards/reward_format/mean": 0.09974609464406967, "rewards/reward_format/std": 0.002930835448205471, "sampling/importance_sampling_ratio/max": 2.4980194568634033, "sampling/importance_sampling_ratio/mean": 0.998951119184494, "sampling/importance_sampling_ratio/min": 0.16540272091515362, "sampling/sampling_logp_difference/max": 0.9176171898841858, "sampling/sampling_logp_difference/mean": 0.0039039979921653865, "step": 12790, "step_time": 6.087584705484915 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003515625, "completions/max_length": 1163.4, "completions/max_terminated_length": 1047.0, "completions/mean_length": 149.30625, "completions/mean_terminated_length": 142.6831787109375, "completions/min_length": 64.7, "completions/min_terminated_length": 64.7, "entropy": 0.03573997465427965, "epoch": 27.40899357601713, "frac_reward_zero_std": 0.93125, "grad_norm": 0.0, "learning_rate": 8.7201e-06, "loss": -0.0046, "num_tokens": 1267495116.0, "reward": 1.0665234684944154, "reward_std": 0.13323281928896905, "rewards/reward_accuracy/mean": 0.966796875, "rewards/reward_accuracy/std": 0.13218051791191102, "rewards/reward_format/mean": 0.09972656443715096, "rewards/reward_format/std": 0.002630585338920355, "sampling/importance_sampling_ratio/max": 2.5397798657417296, "sampling/importance_sampling_ratio/mean": 0.9863304972648621, "sampling/importance_sampling_ratio/min": 0.13576938733458518, "sampling/sampling_logp_difference/max": 1.1261970162391663, "sampling/sampling_logp_difference/mean": 0.0036212291568517687, "step": 12800, "step_time": 5.718709624497569 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.007421875, "completions/max_length": 1208.0, "completions/max_terminated_length": 1022.6, "completions/mean_length": 158.78359375, "completions/mean_terminated_length": 144.76617279052735, "completions/min_length": 64.4, "completions/min_terminated_length": 64.4, "entropy": 0.04100178647786379, "epoch": 27.430406852248392, "frac_reward_zero_std": 0.95, "grad_norm": 0.08740234375, "learning_rate": 8.719100000000001e-06, "loss": -0.0015, "num_tokens": 1268414658.0, "reward": 1.0680859565734864, "reward_std": 0.13716922253370284, "rewards/reward_accuracy/mean": 0.96875, "rewards/reward_accuracy/std": 0.13394855782389642, "rewards/reward_format/mean": 0.09933593720197678, "rewards/reward_format/std": 0.004946434707380831, "sampling/importance_sampling_ratio/max": 2.4093140840530394, "sampling/importance_sampling_ratio/mean": 0.9813326060771942, "sampling/importance_sampling_ratio/min": 0.1118293896317482, "sampling/sampling_logp_difference/max": 1.1312953352928161, "sampling/sampling_logp_difference/mean": 0.003896066313609481, "step": 12810, "step_time": 6.251067082109512 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005078125, "completions/max_length": 1922.9, "completions/max_terminated_length": 1261.6, "completions/mean_length": 163.297265625, "completions/mean_terminated_length": 153.70449600219726, "completions/min_length": 64.1, "completions/min_terminated_length": 64.1, "entropy": 0.04482683974783867, "epoch": 27.451820128479657, "frac_reward_zero_std": 0.90625, "grad_norm": 0.095703125, "learning_rate": 8.7181e-06, "loss": -0.0026, "num_tokens": 1269350267.0, "reward": 1.0539453148841857, "reward_std": 0.19547195360064507, "rewards/reward_accuracy/mean": 0.954296875, "rewards/reward_accuracy/std": 0.1933488205075264, "rewards/reward_format/mean": 0.09964843764901161, "rewards/reward_format/std": 0.004572975169867277, "sampling/importance_sampling_ratio/max": 2.543981337547302, "sampling/importance_sampling_ratio/mean": 0.9973530054092408, "sampling/importance_sampling_ratio/min": 0.10848766937851906, "sampling/sampling_logp_difference/max": 1.2333608865737915, "sampling/sampling_logp_difference/mean": 0.004053532774560153, "step": 12820, "step_time": 8.956218868106953 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003125, "completions/max_length": 1171.0, "completions/max_terminated_length": 1059.5, "completions/mean_length": 160.027734375, "completions/mean_terminated_length": 154.17039184570314, "completions/min_length": 68.5, "completions/min_terminated_length": 68.5, "entropy": 0.04126852778717875, "epoch": 27.47323340471092, "frac_reward_zero_std": 0.90625, "grad_norm": 0.4140625, "learning_rate": 8.7171e-06, "loss": -0.0042, "num_tokens": 1270271490.0, "reward": 1.0665429770946502, "reward_std": 0.14162331819534302, "rewards/reward_accuracy/mean": 0.966796875, "rewards/reward_accuracy/std": 0.1407642848789692, "rewards/reward_format/mean": 0.09974609389901161, "rewards/reward_format/std": 0.0030259526334702968, "sampling/importance_sampling_ratio/max": 2.4630632519721987, "sampling/importance_sampling_ratio/mean": 0.9851805746555329, "sampling/importance_sampling_ratio/min": 0.11835673600435256, "sampling/sampling_logp_difference/max": 1.033133625984192, "sampling/sampling_logp_difference/mean": 0.004085207590833306, "step": 12830, "step_time": 5.779428286699113 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.002734375, "completions/max_length": 1047.9, "completions/max_terminated_length": 838.4, "completions/mean_length": 143.458984375, "completions/mean_terminated_length": 138.27017059326172, "completions/min_length": 62.9, "completions/min_terminated_length": 62.9, "entropy": 0.03547010645270347, "epoch": 27.494646680942186, "frac_reward_zero_std": 0.9375, "grad_norm": 0.0, "learning_rate": 8.716100000000001e-06, "loss": -0.002, "num_tokens": 1271154569.0, "reward": 1.075585949420929, "reward_std": 0.11997815147042275, "rewards/reward_accuracy/mean": 0.97578125, "rewards/reward_accuracy/std": 0.1188519462943077, "rewards/reward_format/mean": 0.09980468824505806, "rewards/reward_format/std": 0.00205810007173568, "sampling/importance_sampling_ratio/max": 2.354155921936035, "sampling/importance_sampling_ratio/mean": 0.9941743850708008, "sampling/importance_sampling_ratio/min": 0.16513223927468063, "sampling/sampling_logp_difference/max": 0.9113045036792755, "sampling/sampling_logp_difference/mean": 0.003784834989346564, "step": 12840, "step_time": 5.143843644985464 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005078125, "completions/max_length": 1154.8, "completions/max_terminated_length": 897.6, "completions/mean_length": 151.213671875, "completions/mean_terminated_length": 141.65199127197266, "completions/min_length": 62.1, "completions/min_terminated_length": 62.1, "entropy": 0.03573659360408783, "epoch": 27.516059957173447, "frac_reward_zero_std": 0.94375, "grad_norm": 0.0, "learning_rate": 8.7151e-06, "loss": -0.0027, "num_tokens": 1272059996.0, "reward": 1.0671875178813934, "reward_std": 0.13072458207607268, "rewards/reward_accuracy/mean": 0.967578125, "rewards/reward_accuracy/std": 0.1288308709859848, "rewards/reward_format/mean": 0.09960937649011611, "rewards/reward_format/std": 0.0038280523382127284, "sampling/importance_sampling_ratio/max": 2.468545126914978, "sampling/importance_sampling_ratio/mean": 0.9904430270195007, "sampling/importance_sampling_ratio/min": 0.19300438836216927, "sampling/sampling_logp_difference/max": 1.027925395965576, "sampling/sampling_logp_difference/mean": 0.0036386790685355662, "step": 12850, "step_time": 5.983752140504658 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0015625, "completions/max_length": 1459.3, "completions/max_terminated_length": 1099.1, "completions/mean_length": 152.64453125, "completions/mean_terminated_length": 149.6804977416992, "completions/min_length": 60.7, "completions/min_terminated_length": 60.7, "entropy": 0.03858807133510709, "epoch": 27.53747323340471, "frac_reward_zero_std": 0.93125, "grad_norm": 0.0, "learning_rate": 8.7141e-06, "loss": -0.0042, "num_tokens": 1272964894.0, "reward": 1.0796093821525574, "reward_std": 0.09766365140676499, "rewards/reward_accuracy/mean": 0.9796875, "rewards/reward_accuracy/std": 0.09718603640794754, "rewards/reward_format/mean": 0.09992187544703483, "rewards/reward_format/std": 0.0012500000651925803, "sampling/importance_sampling_ratio/max": 2.38662052154541, "sampling/importance_sampling_ratio/mean": 0.9819619953632355, "sampling/importance_sampling_ratio/min": 0.09884328246116639, "sampling/sampling_logp_difference/max": 0.8948911309242249, "sampling/sampling_logp_difference/mean": 0.003828906361013651, "step": 12860, "step_time": 6.927028169485856 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.002734375, "completions/max_length": 1486.5, "completions/max_terminated_length": 1332.7, "completions/mean_length": 159.763671875, "completions/mean_terminated_length": 154.61017303466798, "completions/min_length": 65.5, "completions/min_terminated_length": 65.5, "entropy": 0.04426037590019405, "epoch": 27.558886509635975, "frac_reward_zero_std": 0.9, "grad_norm": 0.15625, "learning_rate": 8.713100000000001e-06, "loss": -0.0045, "num_tokens": 1273891409.0, "reward": 1.0692578315734864, "reward_std": 0.14084397703409196, "rewards/reward_accuracy/mean": 0.96953125, "rewards/reward_accuracy/std": 0.1391481101512909, "rewards/reward_format/mean": 0.0997265636920929, "rewards/reward_format/std": 0.003655523038469255, "sampling/importance_sampling_ratio/max": 2.365788757801056, "sampling/importance_sampling_ratio/mean": 0.98888099193573, "sampling/importance_sampling_ratio/min": 0.06380282938480378, "sampling/sampling_logp_difference/max": 1.058088195323944, "sampling/sampling_logp_difference/mean": 0.00412999875843525, "step": 12870, "step_time": 7.139274032990215 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003515625, "completions/max_length": 1397.1, "completions/max_terminated_length": 1278.7, "completions/mean_length": 162.419921875, "completions/mean_terminated_length": 155.8061981201172, "completions/min_length": 65.8, "completions/min_terminated_length": 65.8, "entropy": 0.040362578933127224, "epoch": 27.580299785867236, "frac_reward_zero_std": 0.93125, "grad_norm": 0.28515625, "learning_rate": 8.7121e-06, "loss": -0.0038, "num_tokens": 1274827908.0, "reward": 1.049863302707672, "reward_std": 0.18408206701278687, "rewards/reward_accuracy/mean": 0.95, "rewards/reward_accuracy/std": 0.1831890694797039, "rewards/reward_format/mean": 0.09986328259110451, "rewards/reward_format/std": 0.0018196488032117485, "sampling/importance_sampling_ratio/max": 2.4672887563705443, "sampling/importance_sampling_ratio/mean": 0.986926144361496, "sampling/importance_sampling_ratio/min": 0.11467427611351014, "sampling/sampling_logp_difference/max": 0.9358158826828002, "sampling/sampling_logp_difference/mean": 0.00407578619197011, "step": 12880, "step_time": 6.736001097195549 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001171875, "completions/max_length": 1259.2, "completions/max_terminated_length": 1177.8, "completions/mean_length": 148.690625, "completions/mean_terminated_length": 146.4906768798828, "completions/min_length": 65.2, "completions/min_terminated_length": 65.2, "entropy": 0.03986632216256112, "epoch": 27.6017130620985, "frac_reward_zero_std": 0.95, "grad_norm": 0.0810546875, "learning_rate": 8.711100000000002e-06, "loss": -0.0044, "num_tokens": 1275720300.0, "reward": 1.0690625190734864, "reward_std": 0.12622449919581413, "rewards/reward_accuracy/mean": 0.969140625, "rewards/reward_accuracy/std": 0.12562571763992308, "rewards/reward_format/mean": 0.09992187619209289, "rewards/reward_format/std": 0.0012500001117587089, "sampling/importance_sampling_ratio/max": 2.3979310035705566, "sampling/importance_sampling_ratio/mean": 0.9910275340080261, "sampling/importance_sampling_ratio/min": 0.09978687502443791, "sampling/sampling_logp_difference/max": 0.8540083408355713, "sampling/sampling_logp_difference/mean": 0.0038633770309388638, "step": 12890, "step_time": 6.161130088107893 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005078125, "completions/max_length": 1492.9, "completions/max_terminated_length": 1262.6, "completions/mean_length": 170.398828125, "completions/mean_terminated_length": 160.9187973022461, "completions/min_length": 62.8, "completions/min_terminated_length": 62.8, "entropy": 0.0441057852236554, "epoch": 27.623126338329765, "frac_reward_zero_std": 0.9125, "grad_norm": 0.1484375, "learning_rate": 8.7101e-06, "loss": -0.0089, "num_tokens": 1276677305.0, "reward": 1.0581250190734863, "reward_std": 0.17828277498483658, "rewards/reward_accuracy/mean": 0.95859375, "rewards/reward_accuracy/std": 0.17597878351807594, "rewards/reward_format/mean": 0.0995312511920929, "rewards/reward_format/std": 0.004046314326114952, "sampling/importance_sampling_ratio/max": 2.515130567550659, "sampling/importance_sampling_ratio/mean": 0.9944221794605255, "sampling/importance_sampling_ratio/min": 0.17301706969738007, "sampling/sampling_logp_difference/max": 0.9775100469589233, "sampling/sampling_logp_difference/mean": 0.004149215715005994, "step": 12900, "step_time": 7.2081859673082365 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003125, "completions/max_length": 1068.1, "completions/max_terminated_length": 920.5, "completions/mean_length": 152.630078125, "completions/mean_terminated_length": 146.7806838989258, "completions/min_length": 64.8, "completions/min_terminated_length": 64.8, "entropy": 0.03842903433833271, "epoch": 27.644539614561026, "frac_reward_zero_std": 0.93125, "grad_norm": 1.1953125, "learning_rate": 8.709100000000001e-06, "loss": 0.0012, "num_tokens": 1277586518.0, "reward": 1.0705273687839507, "reward_std": 0.10538522452116013, "rewards/reward_accuracy/mean": 0.970703125, "rewards/reward_accuracy/std": 0.1043634757399559, "rewards/reward_format/mean": 0.09982422068715095, "rewards/reward_format/std": 0.00208563432097435, "sampling/importance_sampling_ratio/max": 2.3018619894981383, "sampling/importance_sampling_ratio/mean": 0.9831875443458558, "sampling/importance_sampling_ratio/min": 0.15567876324057578, "sampling/sampling_logp_difference/max": 1.025701916217804, "sampling/sampling_logp_difference/mean": 0.0035845516016706825, "step": 12910, "step_time": 5.506761588499648 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 691.4, "completions/max_terminated_length": 691.4, "completions/mean_length": 139.575390625, "completions/mean_terminated_length": 139.575390625, "completions/min_length": 67.9, "completions/min_terminated_length": 67.9, "entropy": 0.03462006852496415, "epoch": 27.66595289079229, "frac_reward_zero_std": 0.94375, "grad_norm": 0.2236328125, "learning_rate": 8.7081e-06, "loss": -0.0016, "num_tokens": 1278460919.0, "reward": 1.0871093988418579, "reward_std": 0.0834203913807869, "rewards/reward_accuracy/mean": 0.987109375, "rewards/reward_accuracy/std": 0.08342039585113525, "rewards/reward_format/mean": 0.10000000149011612, "rewards/reward_format/std": 0.0, "sampling/importance_sampling_ratio/max": 2.389651656150818, "sampling/importance_sampling_ratio/mean": 0.9903437614440918, "sampling/importance_sampling_ratio/min": 0.14704681038856507, "sampling/sampling_logp_difference/max": 0.9873035073280334, "sampling/sampling_logp_difference/mean": 0.0037934630643576385, "step": 12920, "step_time": 3.6354902309161843 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001953125, "completions/max_length": 1358.4, "completions/max_terminated_length": 1087.1, "completions/mean_length": 151.61875, "completions/mean_terminated_length": 147.93353118896485, "completions/min_length": 68.8, "completions/min_terminated_length": 68.8, "entropy": 0.03966882138047367, "epoch": 27.687366167023555, "frac_reward_zero_std": 0.90625, "grad_norm": 0.1298828125, "learning_rate": 8.7071e-06, "loss": -0.001, "num_tokens": 1279371831.0, "reward": 1.0771289348602295, "reward_std": 0.12040040716528892, "rewards/reward_accuracy/mean": 0.97734375, "rewards/reward_accuracy/std": 0.11921647787094117, "rewards/reward_format/mean": 0.09978515803813934, "rewards/reward_format/std": 0.0023297667503356934, "sampling/importance_sampling_ratio/max": 2.388772225379944, "sampling/importance_sampling_ratio/mean": 0.9892407536506653, "sampling/importance_sampling_ratio/min": 0.1412813164293766, "sampling/sampling_logp_difference/max": 0.9797701597213745, "sampling/sampling_logp_difference/mean": 0.003858886379748583, "step": 12930, "step_time": 6.495079586404609 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003125, "completions/max_length": 1203.6, "completions/max_terminated_length": 979.9, "completions/mean_length": 156.610546875, "completions/mean_terminated_length": 150.78177337646486, "completions/min_length": 62.1, "completions/min_terminated_length": 62.1, "entropy": 0.047826943430118264, "epoch": 27.70877944325482, "frac_reward_zero_std": 0.91875, "grad_norm": 0.310546875, "learning_rate": 8.706100000000001e-06, "loss": -0.0037, "num_tokens": 1280294834.0, "reward": 1.0560156464576722, "reward_std": 0.15666093230247496, "rewards/reward_accuracy/mean": 0.95625, "rewards/reward_accuracy/std": 0.15590065717697144, "rewards/reward_format/mean": 0.0997656263411045, "rewards/reward_format/std": 0.0024903097189962866, "sampling/importance_sampling_ratio/max": 2.4155816435813904, "sampling/importance_sampling_ratio/mean": 0.9882307827472687, "sampling/importance_sampling_ratio/min": 0.07385055869817733, "sampling/sampling_logp_difference/max": 0.9412063896656037, "sampling/sampling_logp_difference/mean": 0.004315629904158414, "step": 12940, "step_time": 6.064140359126031 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001953125, "completions/max_length": 1154.9, "completions/max_terminated_length": 836.5, "completions/mean_length": 144.43828125, "completions/mean_terminated_length": 140.74942779541016, "completions/min_length": 60.8, "completions/min_terminated_length": 60.8, "entropy": 0.036141910799779, "epoch": 27.73019271948608, "frac_reward_zero_std": 0.94375, "grad_norm": 0.31640625, "learning_rate": 8.7051e-06, "loss": -0.001, "num_tokens": 1281180980.0, "reward": 1.0720507979393006, "reward_std": 0.1304897241294384, "rewards/reward_accuracy/mean": 0.972265625, "rewards/reward_accuracy/std": 0.12909154444932938, "rewards/reward_format/mean": 0.09978515729308128, "rewards/reward_format/std": 0.002410865551792085, "sampling/importance_sampling_ratio/max": 2.470582830905914, "sampling/importance_sampling_ratio/mean": 0.9940130710601807, "sampling/importance_sampling_ratio/min": 0.22162851095199584, "sampling/sampling_logp_difference/max": 1.0078018665313722, "sampling/sampling_logp_difference/mean": 0.0036880628671497107, "step": 12950, "step_time": 5.67103615688975 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 1203.8, "completions/max_terminated_length": 1124.8, "completions/mean_length": 165.593359375, "completions/mean_terminated_length": 158.26859130859376, "completions/min_length": 66.0, "completions/min_terminated_length": 66.0, "entropy": 0.04139455712866038, "epoch": 27.751605995717345, "frac_reward_zero_std": 0.925, "grad_norm": 0.6953125, "learning_rate": 8.7041e-06, "loss": 0.0015, "num_tokens": 1282121379.0, "reward": 1.0778711080551147, "reward_std": 0.11258351504802704, "rewards/reward_accuracy/mean": 0.978125, "rewards/reward_accuracy/std": 0.11113853901624679, "rewards/reward_format/mean": 0.09974609464406967, "rewards/reward_format/std": 0.0027235510060563684, "sampling/importance_sampling_ratio/max": 2.5468506693840025, "sampling/importance_sampling_ratio/mean": 0.9942931890487671, "sampling/importance_sampling_ratio/min": 0.09157894372474402, "sampling/sampling_logp_difference/max": 1.1023525595664978, "sampling/sampling_logp_difference/mean": 0.0038919676560908558, "step": 12960, "step_time": 5.90251281640667 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00546875, "completions/max_length": 1417.5, "completions/max_terminated_length": 1077.2, "completions/mean_length": 160.714453125, "completions/mean_terminated_length": 150.44672393798828, "completions/min_length": 68.2, "completions/min_terminated_length": 68.2, "entropy": 0.04080183405894786, "epoch": 27.77301927194861, "frac_reward_zero_std": 0.9125, "grad_norm": 0.0791015625, "learning_rate": 8.703100000000001e-06, "loss": -0.0029, "num_tokens": 1283054712.0, "reward": 1.056640636920929, "reward_std": 0.1652522638440132, "rewards/reward_accuracy/mean": 0.95703125, "rewards/reward_accuracy/std": 0.16279858201742173, "rewards/reward_format/mean": 0.09960937574505806, "rewards/reward_format/std": 0.004015847947448492, "sampling/importance_sampling_ratio/max": 2.5608871221542358, "sampling/importance_sampling_ratio/mean": 0.98423131108284, "sampling/importance_sampling_ratio/min": 0.1098213056102395, "sampling/sampling_logp_difference/max": 1.2456038355827332, "sampling/sampling_logp_difference/mean": 0.004164350172504783, "step": 12970, "step_time": 6.904706092711422 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 2.2589281797991133e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 2.2589281797991133e-06, "completions/clipped_ratio": 0.009765625, "completions/max_length": 1616.6, "completions/max_terminated_length": 1245.4, "completions/mean_length": 165.707421875, "completions/mean_terminated_length": 147.1475456237793, "completions/min_length": 64.1, "completions/min_terminated_length": 64.1, "entropy": 0.0420915192225948, "epoch": 27.79443254817987, "frac_reward_zero_std": 0.925, "grad_norm": 0.0, "learning_rate": 8.702100000000001e-06, "loss": -0.0081, "num_tokens": 1283994987.0, "reward": 1.0570898652076721, "reward_std": 0.17122104912996292, "rewards/reward_accuracy/mean": 0.9578125, "rewards/reward_accuracy/std": 0.16771951243281363, "rewards/reward_format/mean": 0.09927734583616257, "rewards/reward_format/std": 0.005648614186793566, "sampling/importance_sampling_ratio/max": 2.401214826107025, "sampling/importance_sampling_ratio/mean": 0.985903549194336, "sampling/importance_sampling_ratio/min": 0.04439444839954376, "sampling/sampling_logp_difference/max": 0.8360164523124695, "sampling/sampling_logp_difference/mean": 0.0037709024036303163, "step": 12980, "step_time": 7.752742811103235 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.004296875, "completions/max_length": 1328.9, "completions/max_terminated_length": 800.8, "completions/mean_length": 159.06796875, "completions/mean_terminated_length": 150.95804824829102, "completions/min_length": 65.4, "completions/min_terminated_length": 65.4, "entropy": 0.039370284578762946, "epoch": 27.815845824411134, "frac_reward_zero_std": 0.9125, "grad_norm": 0.08544921875, "learning_rate": 8.7011e-06, "loss": -0.0029, "num_tokens": 1284928601.0, "reward": 1.0793164372444153, "reward_std": 0.10433221235871315, "rewards/reward_accuracy/mean": 0.9796875, "rewards/reward_accuracy/std": 0.10177754312753677, "rewards/reward_format/mean": 0.09962890818715095, "rewards/reward_format/std": 0.003485042788088322, "sampling/importance_sampling_ratio/max": 2.54992299079895, "sampling/importance_sampling_ratio/mean": 0.9875097393989563, "sampling/importance_sampling_ratio/min": 0.09740905947983265, "sampling/sampling_logp_difference/max": 1.0582430005073546, "sampling/sampling_logp_difference/mean": 0.0039867309387773275, "step": 12990, "step_time": 6.424410207915935 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.002734375, "completions/max_length": 1194.0, "completions/max_terminated_length": 995.7, "completions/mean_length": 157.204296875, "completions/mean_terminated_length": 152.1134246826172, "completions/min_length": 66.9, "completions/min_terminated_length": 66.9, "entropy": 0.04157782101538032, "epoch": 27.8372591006424, "frac_reward_zero_std": 0.9125, "grad_norm": 0.408203125, "learning_rate": 8.7001e-06, "loss": -0.0073, "num_tokens": 1285848708.0, "reward": 1.054765647649765, "reward_std": 0.176116418838501, "rewards/reward_accuracy/mean": 0.955078125, "rewards/reward_accuracy/std": 0.17470904514193536, "rewards/reward_format/mean": 0.09968750104308129, "rewards/reward_format/std": 0.003098572860471904, "sampling/importance_sampling_ratio/max": 2.3740325212478637, "sampling/importance_sampling_ratio/mean": 0.9838525414466858, "sampling/importance_sampling_ratio/min": 0.10982273202389478, "sampling/sampling_logp_difference/max": 0.9930864572525024, "sampling/sampling_logp_difference/mean": 0.004033823870122433, "step": 13000, "step_time": 5.684522345502046 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005078125, "completions/max_length": 1289.5, "completions/max_terminated_length": 1239.2, "completions/mean_length": 166.225, "completions/mean_terminated_length": 156.67950744628905, "completions/min_length": 69.0, "completions/min_terminated_length": 69.0, "entropy": 0.044304001005366446, "epoch": 27.858672376873663, "frac_reward_zero_std": 0.91875, "grad_norm": 0.6953125, "learning_rate": 8.699100000000001e-06, "loss": 0.0002, "num_tokens": 1286791716.0, "reward": 1.0734375238418579, "reward_std": 0.12147349119186401, "rewards/reward_accuracy/mean": 0.973828125, "rewards/reward_accuracy/std": 0.11982047855854035, "rewards/reward_format/mean": 0.09960937574505806, "rewards/reward_format/std": 0.003080030856654048, "sampling/importance_sampling_ratio/max": 2.4854866743087767, "sampling/importance_sampling_ratio/mean": 0.9860330581665039, "sampling/importance_sampling_ratio/min": 0.17226167321205138, "sampling/sampling_logp_difference/max": 0.9266397953033447, "sampling/sampling_logp_difference/mean": 0.0039402395486831665, "step": 13010, "step_time": 6.680274589403416 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.007421875, "completions/max_length": 1529.0, "completions/max_terminated_length": 1462.9, "completions/mean_length": 174.7328125, "completions/mean_terminated_length": 160.76648025512696, "completions/min_length": 66.7, "completions/min_terminated_length": 66.7, "entropy": 0.04863137691281736, "epoch": 27.880085653104924, "frac_reward_zero_std": 0.93125, "grad_norm": 0.0, "learning_rate": 8.6981e-06, "loss": -0.0061, "num_tokens": 1287758584.0, "reward": 1.0515039324760438, "reward_std": 0.15669994726777076, "rewards/reward_accuracy/mean": 0.951953125, "rewards/reward_accuracy/std": 0.15451934486627578, "rewards/reward_format/mean": 0.09955078288912773, "rewards/reward_format/std": 0.004349798150360584, "sampling/importance_sampling_ratio/max": 2.450083088874817, "sampling/importance_sampling_ratio/mean": 0.9837409675121307, "sampling/importance_sampling_ratio/min": 0.11391355842351913, "sampling/sampling_logp_difference/max": 1.1849013030529023, "sampling/sampling_logp_difference/mean": 0.004325952753424645, "step": 13020, "step_time": 7.6205776705173776 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0078125, "completions/max_length": 1371.8, "completions/max_terminated_length": 1310.0, "completions/mean_length": 171.544921875, "completions/mean_terminated_length": 156.70249938964844, "completions/min_length": 66.7, "completions/min_terminated_length": 66.7, "entropy": 0.04137302504386753, "epoch": 27.90149892933619, "frac_reward_zero_std": 0.91875, "grad_norm": 0.0595703125, "learning_rate": 8.6971e-06, "loss": -0.0035, "num_tokens": 1288728283.0, "reward": 1.060644555091858, "reward_std": 0.17258162200450897, "rewards/reward_accuracy/mean": 0.961328125, "rewards/reward_accuracy/std": 0.16972539573907852, "rewards/reward_format/mean": 0.09931640774011612, "rewards/reward_format/std": 0.003884907253086567, "sampling/importance_sampling_ratio/max": 2.511427903175354, "sampling/importance_sampling_ratio/mean": 0.9861873745918274, "sampling/importance_sampling_ratio/min": 0.0622662141919136, "sampling/sampling_logp_difference/max": 1.130926650762558, "sampling/sampling_logp_difference/mean": 0.004002170078456402, "step": 13030, "step_time": 6.947361674794228 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001953125, "completions/max_length": 1595.6, "completions/max_terminated_length": 1432.4, "completions/mean_length": 159.8265625, "completions/mean_terminated_length": 156.15553436279296, "completions/min_length": 67.1, "completions/min_terminated_length": 67.1, "entropy": 0.04409140534698963, "epoch": 27.922912205567453, "frac_reward_zero_std": 0.86875, "grad_norm": 0.53515625, "learning_rate": 8.696100000000001e-06, "loss": -0.0123, "num_tokens": 1289652303.0, "reward": 1.0599414110183716, "reward_std": 0.16889599114656448, "rewards/reward_accuracy/mean": 0.96015625, "rewards/reward_accuracy/std": 0.16799963116645814, "rewards/reward_format/mean": 0.09978515654802322, "rewards/reward_format/std": 0.0030696488218382003, "sampling/importance_sampling_ratio/max": 2.5394317865371705, "sampling/importance_sampling_ratio/mean": 0.9819258153438568, "sampling/importance_sampling_ratio/min": 0.050520863942801954, "sampling/sampling_logp_difference/max": 1.310968816280365, "sampling/sampling_logp_difference/mean": 0.00419839695096016, "step": 13040, "step_time": 7.61758183488273 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001953125, "completions/max_length": 1238.3, "completions/max_terminated_length": 1020.0, "completions/mean_length": 145.40390625, "completions/mean_terminated_length": 141.7096939086914, "completions/min_length": 63.1, "completions/min_terminated_length": 63.1, "entropy": 0.041063860338181254, "epoch": 27.944325481798714, "frac_reward_zero_std": 0.93125, "grad_norm": 0.53515625, "learning_rate": 8.6951e-06, "loss": -0.0032, "num_tokens": 1290534825.0, "reward": 1.0830078363418578, "reward_std": 0.08934693187475204, "rewards/reward_accuracy/mean": 0.983203125, "rewards/reward_accuracy/std": 0.0881997987627983, "rewards/reward_format/mean": 0.09980468899011612, "rewards/reward_format/std": 0.002398134325630963, "sampling/importance_sampling_ratio/max": 2.3657471895217896, "sampling/importance_sampling_ratio/mean": 0.9812738597393036, "sampling/importance_sampling_ratio/min": 0.1101413231343031, "sampling/sampling_logp_difference/max": 0.969576609134674, "sampling/sampling_logp_difference/mean": 0.00396260148845613, "step": 13050, "step_time": 6.075851808005245 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 1367.5, "completions/max_terminated_length": 992.1, "completions/mean_length": 147.587890625, "completions/mean_terminated_length": 140.1568618774414, "completions/min_length": 61.0, "completions/min_terminated_length": 61.0, "entropy": 0.04172294177114964, "epoch": 27.96573875802998, "frac_reward_zero_std": 0.9125, "grad_norm": 0.7578125, "learning_rate": 8.6941e-06, "loss": -0.0041, "num_tokens": 1291432938.0, "reward": 1.062871116399765, "reward_std": 0.13347192630171775, "rewards/reward_accuracy/mean": 0.96328125, "rewards/reward_accuracy/std": 0.13203653544187546, "rewards/reward_format/mean": 0.09958984479308128, "rewards/reward_format/std": 0.004202844342216849, "sampling/importance_sampling_ratio/max": 2.2988307952880858, "sampling/importance_sampling_ratio/mean": 0.9917350828647613, "sampling/importance_sampling_ratio/min": 0.1323698103427887, "sampling/sampling_logp_difference/max": 0.8860871493816376, "sampling/sampling_logp_difference/mean": 0.004202518961392343, "step": 13060, "step_time": 6.563918544910848 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 1356.0, "completions/max_terminated_length": 968.3, "completions/mean_length": 156.505859375, "completions/mean_terminated_length": 149.10959091186524, "completions/min_length": 62.2, "completions/min_terminated_length": 62.2, "entropy": 0.0347032772609964, "epoch": 27.987152034261243, "frac_reward_zero_std": 0.925, "grad_norm": 0.734375, "learning_rate": 8.693100000000002e-06, "loss": -0.0052, "num_tokens": 1292351497.0, "reward": 1.0634570300579071, "reward_std": 0.16018104031682015, "rewards/reward_accuracy/mean": 0.963671875, "rewards/reward_accuracy/std": 0.15924937427043914, "rewards/reward_format/mean": 0.09978515580296517, "rewards/reward_format/std": 0.002545661083422601, "sampling/importance_sampling_ratio/max": 2.4761953234672545, "sampling/importance_sampling_ratio/mean": 0.9931523084640503, "sampling/importance_sampling_ratio/min": 0.13602372258901596, "sampling/sampling_logp_difference/max": 1.0491658091545104, "sampling/sampling_logp_difference/mean": 0.003629885381087661, "step": 13070, "step_time": 6.468491938806255 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00703125, "completions/max_length": 1426.5, "completions/max_terminated_length": 914.8, "completions/mean_length": 164.51328125, "completions/mean_terminated_length": 151.29577178955077, "completions/min_length": 65.4, "completions/min_terminated_length": 65.4, "entropy": 0.040872831176966426, "epoch": 28.008565310492504, "frac_reward_zero_std": 0.90625, "grad_norm": 0.1328125, "learning_rate": 8.692100000000001e-06, "loss": -0.0051, "num_tokens": 1293289915.0, "reward": 1.0655078411102294, "reward_std": 0.15703522115945817, "rewards/reward_accuracy/mean": 0.966015625, "rewards/reward_accuracy/std": 0.15401292443275452, "rewards/reward_format/mean": 0.09949218928813934, "rewards/reward_format/std": 0.0044851107755675915, "sampling/importance_sampling_ratio/max": 2.339126193523407, "sampling/importance_sampling_ratio/mean": 0.9877094924449921, "sampling/importance_sampling_ratio/min": 0.09851740449666976, "sampling/sampling_logp_difference/max": 1.050800633430481, "sampling/sampling_logp_difference/mean": 0.003826240380294621, "step": 13080, "step_time": 7.085253784587257 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005859375, "completions/max_length": 1365.4, "completions/max_terminated_length": 954.2, "completions/mean_length": 159.068359375, "completions/mean_terminated_length": 148.0522003173828, "completions/min_length": 61.6, "completions/min_terminated_length": 61.6, "entropy": 0.04005875908769667, "epoch": 28.029978586723768, "frac_reward_zero_std": 0.925, "grad_norm": 0.0, "learning_rate": 8.6911e-06, "loss": -0.0042, "num_tokens": 1294221050.0, "reward": 1.052734386920929, "reward_std": 0.20051467567682266, "rewards/reward_accuracy/mean": 0.953125, "rewards/reward_accuracy/std": 0.1982578307390213, "rewards/reward_format/mean": 0.09960937574505806, "rewards/reward_format/std": 0.004114329349249601, "sampling/importance_sampling_ratio/max": 2.285173785686493, "sampling/importance_sampling_ratio/mean": 0.9792404651641846, "sampling/importance_sampling_ratio/min": 0.1036287598311901, "sampling/sampling_logp_difference/max": 1.2234504878520966, "sampling/sampling_logp_difference/mean": 0.003838155069388449, "step": 13090, "step_time": 6.578756675808108 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0015625, "completions/max_length": 960.7, "completions/max_terminated_length": 841.4, "completions/mean_length": 147.748046875, "completions/mean_terminated_length": 144.79315795898438, "completions/min_length": 60.5, "completions/min_terminated_length": 60.5, "entropy": 0.03343406671192497, "epoch": 28.051391862955033, "frac_reward_zero_std": 0.9375, "grad_norm": 0.40625, "learning_rate": 8.6901e-06, "loss": -0.0041, "num_tokens": 1295120229.0, "reward": 1.0725390911102295, "reward_std": 0.11561534702777862, "rewards/reward_accuracy/mean": 0.97265625, "rewards/reward_accuracy/std": 0.11468309089541436, "rewards/reward_format/mean": 0.09988281428813935, "rewards/reward_format/std": 0.001395348599180579, "sampling/importance_sampling_ratio/max": 2.3816556096076966, "sampling/importance_sampling_ratio/mean": 0.9841433584690094, "sampling/importance_sampling_ratio/min": 0.09289405047893524, "sampling/sampling_logp_difference/max": 1.033457136154175, "sampling/sampling_logp_difference/mean": 0.003625553590245545, "step": 13100, "step_time": 4.927355523096049 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.006640625, "completions/max_length": 1395.9, "completions/max_terminated_length": 1285.8, "completions/mean_length": 168.685546875, "completions/mean_terminated_length": 156.30270690917968, "completions/min_length": 63.7, "completions/min_terminated_length": 63.7, "entropy": 0.045071494113653895, "epoch": 28.072805139186297, "frac_reward_zero_std": 0.925, "grad_norm": 0.23828125, "learning_rate": 8.6891e-06, "loss": -0.0049, "num_tokens": 1296068672.0, "reward": 1.0767382860183716, "reward_std": 0.11382238492369652, "rewards/reward_accuracy/mean": 0.97734375, "rewards/reward_accuracy/std": 0.11175906211137772, "rewards/reward_format/mean": 0.09939453154802322, "rewards/reward_format/std": 0.004075078875757754, "sampling/importance_sampling_ratio/max": 2.4182161569595335, "sampling/importance_sampling_ratio/mean": 0.9855726599693299, "sampling/importance_sampling_ratio/min": 0.08099140338599682, "sampling/sampling_logp_difference/max": 0.9449471712112427, "sampling/sampling_logp_difference/mean": 0.004078069305978716, "step": 13110, "step_time": 6.8982612537889505 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.004296875, "completions/max_length": 1587.9, "completions/max_terminated_length": 1227.8, "completions/mean_length": 155.21484375, "completions/mean_terminated_length": 147.11439514160156, "completions/min_length": 60.6, "completions/min_terminated_length": 60.6, "entropy": 0.04204842522740364, "epoch": 28.094218415417558, "frac_reward_zero_std": 0.9125, "grad_norm": 0.205078125, "learning_rate": 8.6881e-06, "loss": -0.0014, "num_tokens": 1296982150.0, "reward": 1.078515648841858, "reward_std": 0.11887594163417817, "rewards/reward_accuracy/mean": 0.97890625, "rewards/reward_accuracy/std": 0.11630061790347099, "rewards/reward_format/mean": 0.09960937649011611, "rewards/reward_format/std": 0.0042156175477430224, "sampling/importance_sampling_ratio/max": 2.474896454811096, "sampling/importance_sampling_ratio/mean": 0.988919997215271, "sampling/importance_sampling_ratio/min": 0.11022526361048221, "sampling/sampling_logp_difference/max": 1.1501720666885376, "sampling/sampling_logp_difference/mean": 0.003963170619681477, "step": 13120, "step_time": 7.543619872012641 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0046875, "completions/max_length": 1354.1, "completions/max_terminated_length": 1145.8, "completions/mean_length": 154.48125, "completions/mean_terminated_length": 145.71922912597657, "completions/min_length": 69.7, "completions/min_terminated_length": 69.7, "entropy": 0.037356184679083526, "epoch": 28.115631691648822, "frac_reward_zero_std": 0.94375, "grad_norm": 0.0, "learning_rate": 8.6871e-06, "loss": -0.0047, "num_tokens": 1297901030.0, "reward": 1.0539453268051147, "reward_std": 0.15052537769079208, "rewards/reward_accuracy/mean": 0.954296875, "rewards/reward_accuracy/std": 0.1492033287882805, "rewards/reward_format/mean": 0.09964843839406967, "rewards/reward_format/std": 0.0032621520571410657, "sampling/importance_sampling_ratio/max": 2.3893508672714234, "sampling/importance_sampling_ratio/mean": 0.9848679840564728, "sampling/importance_sampling_ratio/min": 0.17922019809484482, "sampling/sampling_logp_difference/max": 0.9682132005691528, "sampling/sampling_logp_difference/mean": 0.0037002493860200047, "step": 13130, "step_time": 6.589438192118541 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.006640625, "completions/max_length": 1121.2, "completions/max_terminated_length": 1061.4, "completions/mean_length": 166.77578125, "completions/mean_terminated_length": 154.3911575317383, "completions/min_length": 63.5, "completions/min_terminated_length": 63.5, "entropy": 0.04224056063685566, "epoch": 28.137044967880087, "frac_reward_zero_std": 0.925, "grad_norm": 0.20703125, "learning_rate": 8.686100000000001e-06, "loss": -0.0029, "num_tokens": 1298842456.0, "reward": 1.047441416978836, "reward_std": 0.19771077781915664, "rewards/reward_accuracy/mean": 0.948046875, "rewards/reward_accuracy/std": 0.19566955044865608, "rewards/reward_format/mean": 0.09939453154802322, "rewards/reward_format/std": 0.004069690825417638, "sampling/importance_sampling_ratio/max": 2.4345272064208983, "sampling/importance_sampling_ratio/mean": 0.9866859078407287, "sampling/importance_sampling_ratio/min": 0.1817621173337102, "sampling/sampling_logp_difference/max": 0.8996259570121765, "sampling/sampling_logp_difference/mean": 0.0037364744348451495, "step": 13140, "step_time": 5.7847677013051 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00625, "completions/max_length": 1241.3, "completions/max_terminated_length": 1038.6, "completions/mean_length": 155.73828125, "completions/mean_terminated_length": 143.78388061523438, "completions/min_length": 64.3, "completions/min_terminated_length": 64.3, "entropy": 0.03774581342004239, "epoch": 28.158458244111348, "frac_reward_zero_std": 0.93125, "grad_norm": 0.0, "learning_rate": 8.685100000000001e-06, "loss": -0.0012, "num_tokens": 1299759434.0, "reward": 1.0788281440734864, "reward_std": 0.11014433577656746, "rewards/reward_accuracy/mean": 0.979296875, "rewards/reward_accuracy/std": 0.10833183377981186, "rewards/reward_format/mean": 0.0995312511920929, "rewards/reward_format/std": 0.002364127826876938, "sampling/importance_sampling_ratio/max": 2.3637945890426635, "sampling/importance_sampling_ratio/mean": 0.9910788893699646, "sampling/importance_sampling_ratio/min": 0.14918339140713216, "sampling/sampling_logp_difference/max": 0.9509690403938293, "sampling/sampling_logp_difference/mean": 0.003791692922823131, "step": 13150, "step_time": 6.128373180495691 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.000390625, "completions/max_length": 1268.2, "completions/max_terminated_length": 1137.0, "completions/mean_length": 147.04296875, "completions/mean_terminated_length": 146.29796447753907, "completions/min_length": 66.1, "completions/min_terminated_length": 66.1, "entropy": 0.0365668342448771, "epoch": 28.179871520342612, "frac_reward_zero_std": 0.95, "grad_norm": 0.0, "learning_rate": 8.6841e-06, "loss": -0.0052, "num_tokens": 1300650072.0, "reward": 1.081152367591858, "reward_std": 0.0999692864716053, "rewards/reward_accuracy/mean": 0.98125, "rewards/reward_accuracy/std": 0.09953442513942719, "rewards/reward_format/mean": 0.09990234524011612, "rewards/reward_format/std": 0.0009338126750662923, "sampling/importance_sampling_ratio/max": 2.5430352687835693, "sampling/importance_sampling_ratio/mean": 0.9977124691009521, "sampling/importance_sampling_ratio/min": 0.14858595253899692, "sampling/sampling_logp_difference/max": 0.9521323800086975, "sampling/sampling_logp_difference/mean": 0.003788057342171669, "step": 13160, "step_time": 6.002635276090587 }, { "clip_ratio/high_max": 2.12856539292261e-05, "clip_ratio/high_mean": 2.6607067411532626e-06, "clip_ratio/low_mean": 9.426780616195174e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 1.2087487357348437e-05, "completions/clipped_ratio": 0.00859375, "completions/max_length": 798.1, "completions/max_terminated_length": 785.9, "completions/mean_length": 157.475, "completions/mean_terminated_length": 141.15987701416014, "completions/min_length": 66.3, "completions/min_terminated_length": 66.3, "entropy": 0.03957183929160237, "epoch": 28.201284796573876, "frac_reward_zero_std": 0.9375, "grad_norm": 0.1572265625, "learning_rate": 8.683100000000002e-06, "loss": -0.0036, "num_tokens": 1301571944.0, "reward": 1.0826367378234862, "reward_std": 0.08205190822482109, "rewards/reward_accuracy/mean": 0.983203125, "rewards/reward_accuracy/std": 0.08001433834433555, "rewards/reward_format/mean": 0.09943359494209289, "rewards/reward_format/std": 0.003123376052826643, "sampling/importance_sampling_ratio/max": 2.5123523235321046, "sampling/importance_sampling_ratio/mean": 0.9886368811130524, "sampling/importance_sampling_ratio/min": 0.12415965124964715, "sampling/sampling_logp_difference/max": 1.1202200949192047, "sampling/sampling_logp_difference/mean": 0.0036936955293640494, "step": 13170, "step_time": 4.578537934401538 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003125, "completions/max_length": 1186.7, "completions/max_terminated_length": 1138.2, "completions/mean_length": 154.834765625, "completions/mean_terminated_length": 148.98252716064454, "completions/min_length": 65.1, "completions/min_terminated_length": 65.1, "entropy": 0.039190560858696696, "epoch": 28.22269807280514, "frac_reward_zero_std": 0.925, "grad_norm": 0.26953125, "learning_rate": 8.682100000000001e-06, "loss": -0.0057, "num_tokens": 1302490513.0, "reward": 1.0653711080551147, "reward_std": 0.1409989081323147, "rewards/reward_accuracy/mean": 0.965625, "rewards/reward_accuracy/std": 0.1397644691169262, "rewards/reward_format/mean": 0.09974609464406967, "rewards/reward_format/std": 0.002528924075886607, "sampling/importance_sampling_ratio/max": 2.477232563495636, "sampling/importance_sampling_ratio/mean": 0.9955600380897522, "sampling/importance_sampling_ratio/min": 0.09745872393250465, "sampling/sampling_logp_difference/max": 1.1382517695426941, "sampling/sampling_logp_difference/mean": 0.0037554631009697912, "step": 13180, "step_time": 5.966435531689785 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001953125, "completions/max_length": 987.7, "completions/max_terminated_length": 796.3, "completions/mean_length": 151.510546875, "completions/mean_terminated_length": 147.84449462890626, "completions/min_length": 67.3, "completions/min_terminated_length": 67.3, "entropy": 0.036700312583707276, "epoch": 28.2441113490364, "frac_reward_zero_std": 0.925, "grad_norm": 0.091796875, "learning_rate": 8.6811e-06, "loss": -0.0048, "num_tokens": 1303401788.0, "reward": 1.0717773675918578, "reward_std": 0.1347835525870323, "rewards/reward_accuracy/mean": 0.971875, "rewards/reward_accuracy/std": 0.1342431388795376, "rewards/reward_format/mean": 0.09990234524011612, "rewards/reward_format/std": 0.0011641392018646001, "sampling/importance_sampling_ratio/max": 2.368663477897644, "sampling/importance_sampling_ratio/mean": 0.9919331789016723, "sampling/importance_sampling_ratio/min": 0.1539143890142441, "sampling/sampling_logp_difference/max": 1.1675331234931945, "sampling/sampling_logp_difference/mean": 0.003688230714760721, "step": 13190, "step_time": 5.004616538085974 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.002734375, "completions/max_length": 981.8, "completions/max_terminated_length": 788.6, "completions/mean_length": 148.429296875, "completions/mean_terminated_length": 143.3167282104492, "completions/min_length": 64.6, "completions/min_terminated_length": 64.6, "entropy": 0.040079256519675255, "epoch": 28.265524625267666, "frac_reward_zero_std": 0.94375, "grad_norm": 0.0, "learning_rate": 8.6801e-06, "loss": -0.0099, "num_tokens": 1304298775.0, "reward": 1.0877734661102294, "reward_std": 0.06931608840823174, "rewards/reward_accuracy/mean": 0.987890625, "rewards/reward_accuracy/std": 0.0687858521938324, "rewards/reward_format/mean": 0.09988281354308129, "rewards/reward_format/std": 0.0012040342204272746, "sampling/importance_sampling_ratio/max": 2.6376989841461183, "sampling/importance_sampling_ratio/mean": 0.9868534624576568, "sampling/importance_sampling_ratio/min": 0.1636597231030464, "sampling/sampling_logp_difference/max": 0.9766019821166992, "sampling/sampling_logp_difference/mean": 0.003914097999222576, "step": 13200, "step_time": 5.020963629803736 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 644.0, "completions/max_terminated_length": 644.0, "completions/mean_length": 134.474609375, "completions/mean_terminated_length": 134.474609375, "completions/min_length": 62.1, "completions/min_terminated_length": 62.1, "entropy": 0.029775189398787916, "epoch": 28.28693790149893, "frac_reward_zero_std": 0.9875, "grad_norm": 0.0, "learning_rate": 8.6791e-06, "loss": 0.0002, "num_tokens": 1305160294.0, "reward": 1.079687523841858, "reward_std": 0.08294598683714867, "rewards/reward_accuracy/mean": 0.9796875, "rewards/reward_accuracy/std": 0.08294599279761314, "rewards/reward_format/mean": 0.10000000149011612, "rewards/reward_format/std": 0.0, "sampling/importance_sampling_ratio/max": 2.256991815567017, "sampling/importance_sampling_ratio/mean": 0.9982369601726532, "sampling/importance_sampling_ratio/min": 0.28383579552173616, "sampling/sampling_logp_difference/max": 0.9041154384613037, "sampling/sampling_logp_difference/mean": 0.003383147087879479, "step": 13210, "step_time": 3.381884812109638 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 5.9106909475303835e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 5.9106909475303835e-06, "completions/clipped_ratio": 0.007421875, "completions/max_length": 891.3, "completions/max_terminated_length": 691.9, "completions/mean_length": 157.075, "completions/mean_terminated_length": 143.1296173095703, "completions/min_length": 64.9, "completions/min_terminated_length": 64.9, "entropy": 0.039024024782702324, "epoch": 28.30835117773019, "frac_reward_zero_std": 0.9375, "grad_norm": 0.404296875, "learning_rate": 8.6781e-06, "loss": -0.0028, "num_tokens": 1306080886.0, "reward": 1.0567187666893005, "reward_std": 0.15957941189408303, "rewards/reward_accuracy/mean": 0.957421875, "rewards/reward_accuracy/std": 0.1573205791413784, "rewards/reward_format/mean": 0.09929687678813934, "rewards/reward_format/std": 0.0035999549785628916, "sampling/importance_sampling_ratio/max": 2.4541730999946596, "sampling/importance_sampling_ratio/mean": 0.9881868362426758, "sampling/importance_sampling_ratio/min": 0.15834179036319257, "sampling/sampling_logp_difference/max": 1.1001577734947205, "sampling/sampling_logp_difference/mean": 0.0038982074707746505, "step": 13220, "step_time": 4.754230588299106 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0015625, "completions/max_length": 1044.3, "completions/max_terminated_length": 953.6, "completions/mean_length": 141.870703125, "completions/mean_terminated_length": 138.91278076171875, "completions/min_length": 66.6, "completions/min_terminated_length": 66.6, "entropy": 0.03684261301532388, "epoch": 28.329764453961456, "frac_reward_zero_std": 0.9375, "grad_norm": 0.359375, "learning_rate": 8.6771e-06, "loss": -0.0031, "num_tokens": 1306957739.0, "reward": 1.0620117425918578, "reward_std": 0.12674197629094125, "rewards/reward_accuracy/mean": 0.962109375, "rewards/reward_accuracy/std": 0.12642287835478783, "rewards/reward_format/mean": 0.09990234449505805, "rewards/reward_format/std": 0.001562500116415322, "sampling/importance_sampling_ratio/max": 2.440330219268799, "sampling/importance_sampling_ratio/mean": 0.9994155526161194, "sampling/importance_sampling_ratio/min": 0.08345298804342746, "sampling/sampling_logp_difference/max": 1.190379399061203, "sampling/sampling_logp_difference/mean": 0.003926268615759909, "step": 13230, "step_time": 5.0638667971041285 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.002734375, "completions/max_length": 1398.4, "completions/max_terminated_length": 1049.1, "completions/mean_length": 154.3765625, "completions/mean_terminated_length": 149.1631004333496, "completions/min_length": 66.4, "completions/min_terminated_length": 66.4, "entropy": 0.039886864949949086, "epoch": 28.35117773019272, "frac_reward_zero_std": 0.91875, "grad_norm": 0.361328125, "learning_rate": 8.6761e-06, "loss": -0.0044, "num_tokens": 1307870143.0, "reward": 1.064628928899765, "reward_std": 0.1517029359936714, "rewards/reward_accuracy/mean": 0.96484375, "rewards/reward_accuracy/std": 0.1509046271443367, "rewards/reward_format/mean": 0.09978515803813934, "rewards/reward_format/std": 0.00258260874543339, "sampling/importance_sampling_ratio/max": 2.57426381111145, "sampling/importance_sampling_ratio/mean": 0.9988402605056763, "sampling/importance_sampling_ratio/min": 0.16199791841208935, "sampling/sampling_logp_difference/max": 0.8822623252868652, "sampling/sampling_logp_difference/mean": 0.003927463339641691, "step": 13240, "step_time": 6.629899485898204 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00234375, "completions/max_length": 951.9, "completions/max_terminated_length": 875.9, "completions/mean_length": 152.73203125, "completions/mean_terminated_length": 148.42599487304688, "completions/min_length": 67.7, "completions/min_terminated_length": 67.7, "entropy": 0.037383620347827676, "epoch": 28.37259100642398, "frac_reward_zero_std": 0.925, "grad_norm": 0.388671875, "learning_rate": 8.675100000000001e-06, "loss": -0.0078, "num_tokens": 1308781521.0, "reward": 1.071660178899765, "reward_std": 0.11499057710170746, "rewards/reward_accuracy/mean": 0.971875, "rewards/reward_accuracy/std": 0.11388269290328026, "rewards/reward_format/mean": 0.09978515729308128, "rewards/reward_format/std": 0.0024009525775909426, "sampling/importance_sampling_ratio/max": 2.464556932449341, "sampling/importance_sampling_ratio/mean": 0.9851748168468475, "sampling/importance_sampling_ratio/min": 0.10715697854757308, "sampling/sampling_logp_difference/max": 0.9896301746368408, "sampling/sampling_logp_difference/mean": 0.00381640309933573, "step": 13250, "step_time": 4.931158381298883 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001171875, "completions/max_length": 1003.1, "completions/max_terminated_length": 880.5, "completions/mean_length": 141.0484375, "completions/mean_terminated_length": 138.82608642578126, "completions/min_length": 65.8, "completions/min_terminated_length": 65.8, "entropy": 0.034027334023267033, "epoch": 28.394004282655246, "frac_reward_zero_std": 0.925, "grad_norm": 0.48046875, "learning_rate": 8.6741e-06, "loss": -0.0016, "num_tokens": 1309652941.0, "reward": 1.0831250309944154, "reward_std": 0.09936796426773072, "rewards/reward_accuracy/mean": 0.983203125, "rewards/reward_accuracy/std": 0.09879705011844635, "rewards/reward_format/mean": 0.09992187693715096, "rewards/reward_format/std": 0.0008821486495435238, "sampling/importance_sampling_ratio/max": 2.35096914768219, "sampling/importance_sampling_ratio/mean": 0.9999150633811951, "sampling/importance_sampling_ratio/min": 0.2144268261268735, "sampling/sampling_logp_difference/max": 0.9508111834526062, "sampling/sampling_logp_difference/mean": 0.0035654126666486265, "step": 13260, "step_time": 4.910030857496895 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.006640625, "completions/max_length": 1296.4, "completions/max_terminated_length": 1192.4, "completions/mean_length": 159.003125, "completions/mean_terminated_length": 146.5129150390625, "completions/min_length": 63.5, "completions/min_terminated_length": 63.5, "entropy": 0.03833015677519143, "epoch": 28.41541755888651, "frac_reward_zero_std": 0.91875, "grad_norm": 0.0, "learning_rate": 8.673100000000002e-06, "loss": -0.0077, "num_tokens": 1310574613.0, "reward": 1.0565234422683716, "reward_std": 0.16720762923359872, "rewards/reward_accuracy/mean": 0.95703125, "rewards/reward_accuracy/std": 0.16518926247954369, "rewards/reward_format/mean": 0.09949218779802323, "rewards/reward_format/std": 0.0038014347897842526, "sampling/importance_sampling_ratio/max": 2.446727991104126, "sampling/importance_sampling_ratio/mean": 0.9874198257923126, "sampling/importance_sampling_ratio/min": 0.12725390046834945, "sampling/sampling_logp_difference/max": 0.9734459638595581, "sampling/sampling_logp_difference/mean": 0.003915201989002526, "step": 13270, "step_time": 6.679052775111631 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00234375, "completions/max_length": 1117.9, "completions/max_terminated_length": 728.2, "completions/mean_length": 143.390234375, "completions/mean_terminated_length": 138.92577209472657, "completions/min_length": 64.7, "completions/min_terminated_length": 64.7, "entropy": 0.035419428278692065, "epoch": 28.436830835117775, "frac_reward_zero_std": 0.95, "grad_norm": 0.0, "learning_rate": 8.672100000000001e-06, "loss": -0.0063, "num_tokens": 1311455004.0, "reward": 1.080332052707672, "reward_std": 0.10194839984178543, "rewards/reward_accuracy/mean": 0.98046875, "rewards/reward_accuracy/std": 0.10071304962038993, "rewards/reward_format/mean": 0.09986328259110451, "rewards/reward_format/std": 0.0017891392577439546, "sampling/importance_sampling_ratio/max": 2.5102380990982054, "sampling/importance_sampling_ratio/mean": 0.9902099251747132, "sampling/importance_sampling_ratio/min": 0.10716822855174542, "sampling/sampling_logp_difference/max": 0.9401945829391479, "sampling/sampling_logp_difference/mean": 0.0037712538614869118, "step": 13280, "step_time": 5.463537433417514 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00625, "completions/max_length": 1279.8, "completions/max_terminated_length": 990.2, "completions/mean_length": 168.272265625, "completions/mean_terminated_length": 156.62783508300782, "completions/min_length": 67.4, "completions/min_terminated_length": 67.4, "entropy": 0.04031190925743431, "epoch": 28.458244111349035, "frac_reward_zero_std": 0.94375, "grad_norm": 0.0, "learning_rate": 8.6711e-06, "loss": -0.0025, "num_tokens": 1312404149.0, "reward": 1.062011754512787, "reward_std": 0.14760885238647461, "rewards/reward_accuracy/mean": 0.9625, "rewards/reward_accuracy/std": 0.14543348997831346, "rewards/reward_format/mean": 0.09951172024011612, "rewards/reward_format/std": 0.004282740037888288, "sampling/importance_sampling_ratio/max": 2.3663593530654907, "sampling/importance_sampling_ratio/mean": 0.9935288310050965, "sampling/importance_sampling_ratio/min": 0.1373595990240574, "sampling/sampling_logp_difference/max": 0.9840340256690979, "sampling/sampling_logp_difference/mean": 0.003845824277959764, "step": 13290, "step_time": 6.428619346107007 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00078125, "completions/max_length": 940.6, "completions/max_terminated_length": 585.2, "completions/mean_length": 134.323828125, "completions/mean_terminated_length": 132.82625885009764, "completions/min_length": 63.2, "completions/min_terminated_length": 63.2, "entropy": 0.03025934856850654, "epoch": 28.4796573875803, "frac_reward_zero_std": 0.95625, "grad_norm": 0.0, "learning_rate": 8.6701e-06, "loss": -0.0047, "num_tokens": 1313262930.0, "reward": 1.0858984589576721, "reward_std": 0.08161140605807304, "rewards/reward_accuracy/mean": 0.9859375, "rewards/reward_accuracy/std": 0.08115975707769393, "rewards/reward_format/mean": 0.0999609388411045, "rewards/reward_format/std": 0.0006250000558793544, "sampling/importance_sampling_ratio/max": 2.3458269357681276, "sampling/importance_sampling_ratio/mean": 0.9951291561126709, "sampling/importance_sampling_ratio/min": 0.20336373150348663, "sampling/sampling_logp_difference/max": 0.9372460246086121, "sampling/sampling_logp_difference/mean": 0.003423348511569202, "step": 13300, "step_time": 4.701388344811858 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.002734375, "completions/max_length": 783.3, "completions/max_terminated_length": 740.8, "completions/mean_length": 150.21328125, "completions/mean_terminated_length": 145.11900177001954, "completions/min_length": 66.0, "completions/min_terminated_length": 66.0, "entropy": 0.03447058578021824, "epoch": 28.501070663811564, "frac_reward_zero_std": 0.95625, "grad_norm": 0.0, "learning_rate": 8.6691e-06, "loss": -0.0014, "num_tokens": 1314167668.0, "reward": 1.0755664348602294, "reward_std": 0.10431410223245621, "rewards/reward_accuracy/mean": 0.97578125, "rewards/reward_accuracy/std": 0.10338561162352562, "rewards/reward_format/mean": 0.09978515803813934, "rewards/reward_format/std": 0.0019402996171265841, "sampling/importance_sampling_ratio/max": 2.389009928703308, "sampling/importance_sampling_ratio/mean": 0.991859358549118, "sampling/importance_sampling_ratio/min": 0.16579312994144857, "sampling/sampling_logp_difference/max": 0.8082674980163574, "sampling/sampling_logp_difference/mean": 0.0036613501142710447, "step": 13310, "step_time": 4.225108503914089 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001953125, "completions/max_length": 1233.2, "completions/max_terminated_length": 1027.2, "completions/mean_length": 151.4984375, "completions/mean_terminated_length": 147.8886947631836, "completions/min_length": 63.9, "completions/min_terminated_length": 63.9, "entropy": 0.03912614146247506, "epoch": 28.522483940042825, "frac_reward_zero_std": 0.925, "grad_norm": 0.0, "learning_rate": 8.668100000000001e-06, "loss": -0.0055, "num_tokens": 1315074144.0, "reward": 1.0697070360183716, "reward_std": 0.1212303213775158, "rewards/reward_accuracy/mean": 0.969921875, "rewards/reward_accuracy/std": 0.1200523965060711, "rewards/reward_format/mean": 0.09978515654802322, "rewards/reward_format/std": 0.0024568526772782207, "sampling/importance_sampling_ratio/max": 2.627813529968262, "sampling/importance_sampling_ratio/mean": 1.0060109674930573, "sampling/importance_sampling_ratio/min": 0.1959863193333149, "sampling/sampling_logp_difference/max": 0.9128129363059998, "sampling/sampling_logp_difference/mean": 0.0040327091701328754, "step": 13320, "step_time": 5.820440816110931 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001953125, "completions/max_length": 1230.0, "completions/max_terminated_length": 986.0, "completions/mean_length": 152.201953125, "completions/mean_terminated_length": 148.5635787963867, "completions/min_length": 65.8, "completions/min_terminated_length": 65.8, "entropy": 0.037868288927711546, "epoch": 28.54389721627409, "frac_reward_zero_std": 0.9125, "grad_norm": 0.357421875, "learning_rate": 8.6671e-06, "loss": 0.0047, "num_tokens": 1315982053.0, "reward": 1.075683605670929, "reward_std": 0.12033465951681137, "rewards/reward_accuracy/mean": 0.97578125, "rewards/reward_accuracy/std": 0.11988399028778077, "rewards/reward_format/mean": 0.09990234449505805, "rewards/reward_format/std": 0.0013226743321865797, "sampling/importance_sampling_ratio/max": 2.37308064699173, "sampling/importance_sampling_ratio/mean": 0.9958141028881073, "sampling/importance_sampling_ratio/min": 0.1331418737769127, "sampling/sampling_logp_difference/max": 0.9927969813346863, "sampling/sampling_logp_difference/mean": 0.0038069526432082056, "step": 13330, "step_time": 6.217719292204128 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00234375, "completions/max_length": 1633.8, "completions/max_terminated_length": 1306.4, "completions/mean_length": 158.4609375, "completions/mean_terminated_length": 154.0292999267578, "completions/min_length": 64.2, "completions/min_terminated_length": 64.2, "entropy": 0.039899183972738686, "epoch": 28.565310492505354, "frac_reward_zero_std": 0.9, "grad_norm": 0.341796875, "learning_rate": 8.6661e-06, "loss": -0.0052, "num_tokens": 1316908721.0, "reward": 1.0697656393051147, "reward_std": 0.14395514577627183, "rewards/reward_accuracy/mean": 0.969921875, "rewards/reward_accuracy/std": 0.14311813190579414, "rewards/reward_format/mean": 0.09984375089406967, "rewards/reward_format/std": 0.002316074492409825, "sampling/importance_sampling_ratio/max": 2.4327999353408813, "sampling/importance_sampling_ratio/mean": 0.9842562079429626, "sampling/importance_sampling_ratio/min": 0.08977850526571274, "sampling/sampling_logp_difference/max": 1.1761682391166688, "sampling/sampling_logp_difference/mean": 0.004057513596490025, "step": 13340, "step_time": 7.568273578002118 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.007421875, "completions/max_length": 1366.2, "completions/max_terminated_length": 1291.5, "completions/mean_length": 170.71640625, "completions/mean_terminated_length": 156.89545440673828, "completions/min_length": 67.5, "completions/min_terminated_length": 67.5, "entropy": 0.045563413738273086, "epoch": 28.58672376873662, "frac_reward_zero_std": 0.90625, "grad_norm": 0.0830078125, "learning_rate": 8.665100000000001e-06, "loss": -0.0098, "num_tokens": 1317861979.0, "reward": 1.050585961341858, "reward_std": 0.18439449816942216, "rewards/reward_accuracy/mean": 0.951171875, "rewards/reward_accuracy/std": 0.18156112134456634, "rewards/reward_format/mean": 0.09941406399011612, "rewards/reward_format/std": 0.00466399472206831, "sampling/importance_sampling_ratio/max": 2.3432225823402404, "sampling/importance_sampling_ratio/mean": 0.9811681091785431, "sampling/importance_sampling_ratio/min": 0.15090913688763977, "sampling/sampling_logp_difference/max": 0.9385969161987304, "sampling/sampling_logp_difference/mean": 0.004195587104186415, "step": 13350, "step_time": 6.799440058492474 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.002734375, "completions/max_length": 1250.9, "completions/max_terminated_length": 1009.4, "completions/mean_length": 152.709375, "completions/mean_terminated_length": 147.5947593688965, "completions/min_length": 69.1, "completions/min_terminated_length": 69.1, "entropy": 0.04146161309909076, "epoch": 28.60813704496788, "frac_reward_zero_std": 0.94375, "grad_norm": 0.55078125, "learning_rate": 8.6641e-06, "loss": -0.0044, "num_tokens": 1318772659.0, "reward": 1.065039086341858, "reward_std": 0.13128614649176598, "rewards/reward_accuracy/mean": 0.965234375, "rewards/reward_accuracy/std": 0.1303621746599674, "rewards/reward_format/mean": 0.09980468899011612, "rewards/reward_format/std": 0.002405522926710546, "sampling/importance_sampling_ratio/max": 2.59365553855896, "sampling/importance_sampling_ratio/mean": 0.9919663906097412, "sampling/importance_sampling_ratio/min": 0.14915448427200317, "sampling/sampling_logp_difference/max": 1.1858470916748047, "sampling/sampling_logp_difference/mean": 0.004201316041871905, "step": 13360, "step_time": 6.11829530367977 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005078125, "completions/max_length": 1496.5, "completions/max_terminated_length": 1213.6, "completions/mean_length": 166.951171875, "completions/mean_terminated_length": 157.35094146728517, "completions/min_length": 67.3, "completions/min_terminated_length": 67.3, "entropy": 0.04176438362337649, "epoch": 28.629550321199144, "frac_reward_zero_std": 0.93125, "grad_norm": 0.0, "learning_rate": 8.6631e-06, "loss": -0.0083, "num_tokens": 1319716998.0, "reward": 1.0794336080551148, "reward_std": 0.11118754595518113, "rewards/reward_accuracy/mean": 0.9796875, "rewards/reward_accuracy/std": 0.10928247421979904, "rewards/reward_format/mean": 0.09974609464406967, "rewards/reward_format/std": 0.0033267974620684983, "sampling/importance_sampling_ratio/max": 2.5813031911849977, "sampling/importance_sampling_ratio/mean": 0.988639235496521, "sampling/importance_sampling_ratio/min": 0.06881621181964874, "sampling/sampling_logp_difference/max": 0.9771697402000428, "sampling/sampling_logp_difference/mean": 0.0038716162089258432, "step": 13370, "step_time": 7.305911051217118 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.002734375, "completions/max_length": 1761.8, "completions/max_terminated_length": 1360.2, "completions/mean_length": 154.25859375, "completions/mean_terminated_length": 149.11319580078126, "completions/min_length": 62.9, "completions/min_terminated_length": 62.9, "entropy": 0.04288517297245562, "epoch": 28.650963597430408, "frac_reward_zero_std": 0.9375, "grad_norm": 0.058349609375, "learning_rate": 8.662100000000001e-06, "loss": 0.001, "num_tokens": 1320632204.0, "reward": 1.0806054830551148, "reward_std": 0.10765632316470146, "rewards/reward_accuracy/mean": 0.980859375, "rewards/reward_accuracy/std": 0.10579677298665047, "rewards/reward_format/mean": 0.09974609464406967, "rewards/reward_format/std": 0.0031386925373226406, "sampling/importance_sampling_ratio/max": 2.4391295194625853, "sampling/importance_sampling_ratio/mean": 0.9908048808574677, "sampling/importance_sampling_ratio/min": 0.0888790287077427, "sampling/sampling_logp_difference/max": 0.9390874862670898, "sampling/sampling_logp_difference/mean": 0.0041700749890878795, "step": 13380, "step_time": 8.373503751406679 }, { "clip_ratio/high_max": 4.57763671875e-06, "clip_ratio/high_mean": 5.7220458984375e-07, "clip_ratio/low_mean": 5.7220458984375e-07, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 1.1444091796875e-06, "completions/clipped_ratio": 0.00625, "completions/max_length": 837.1, "completions/max_terminated_length": 779.6, "completions/mean_length": 155.517578125, "completions/mean_terminated_length": 143.76878814697267, "completions/min_length": 63.5, "completions/min_terminated_length": 63.5, "entropy": 0.03866934289690107, "epoch": 28.67237687366167, "frac_reward_zero_std": 0.95, "grad_norm": 0.0, "learning_rate": 8.6611e-06, "loss": -0.0052, "num_tokens": 1321545177.0, "reward": 1.0655078291893005, "reward_std": 0.11501811295747758, "rewards/reward_accuracy/mean": 0.966015625, "rewards/reward_accuracy/std": 0.11320163309574127, "rewards/reward_format/mean": 0.09949218779802323, "rewards/reward_format/std": 0.00350017910823226, "sampling/importance_sampling_ratio/max": 2.4583097815513613, "sampling/importance_sampling_ratio/mean": 0.9932758808135986, "sampling/importance_sampling_ratio/min": 0.15996073000133038, "sampling/sampling_logp_difference/max": 0.9682861924171448, "sampling/sampling_logp_difference/mean": 0.003738221013918519, "step": 13390, "step_time": 4.715537398413289 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.006640625, "completions/max_length": 1616.9, "completions/max_terminated_length": 1481.7, "completions/mean_length": 183.290625, "completions/mean_terminated_length": 171.10153350830078, "completions/min_length": 67.9, "completions/min_terminated_length": 67.9, "entropy": 0.04948350496124476, "epoch": 28.693790149892934, "frac_reward_zero_std": 0.90625, "grad_norm": 0.0, "learning_rate": 8.6601e-06, "loss": -0.0055, "num_tokens": 1322538385.0, "reward": 1.063652354478836, "reward_std": 0.1443592156516388, "rewards/reward_accuracy/mean": 0.9640625, "rewards/reward_accuracy/std": 0.1424756646156311, "rewards/reward_format/mean": 0.09958984479308128, "rewards/reward_format/std": 0.004751032846979797, "sampling/importance_sampling_ratio/max": 2.698265814781189, "sampling/importance_sampling_ratio/mean": 0.9927025735378265, "sampling/importance_sampling_ratio/min": 0.1164263792335987, "sampling/sampling_logp_difference/max": 1.0405507683753967, "sampling/sampling_logp_difference/mean": 0.004273313330486417, "step": 13400, "step_time": 7.8978851174062585 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00234375, "completions/max_length": 1448.1, "completions/max_terminated_length": 1102.1, "completions/mean_length": 158.5296875, "completions/mean_terminated_length": 154.10269012451172, "completions/min_length": 66.1, "completions/min_terminated_length": 66.1, "entropy": 0.03955487695056945, "epoch": 28.715203426124198, "frac_reward_zero_std": 0.90625, "grad_norm": 0.3203125, "learning_rate": 8.6591e-06, "loss": -0.0022, "num_tokens": 1323462077.0, "reward": 1.0670507907867433, "reward_std": 0.13701381757855416, "rewards/reward_accuracy/mean": 0.9671875, "rewards/reward_accuracy/std": 0.1354655534029007, "rewards/reward_format/mean": 0.09986328184604645, "rewards/reward_format/std": 0.002187500172294676, "sampling/importance_sampling_ratio/max": 2.5315353631973267, "sampling/importance_sampling_ratio/mean": 0.9944559752941131, "sampling/importance_sampling_ratio/min": 0.09612968415021897, "sampling/sampling_logp_difference/max": 0.9020715892314911, "sampling/sampling_logp_difference/mean": 0.004013176262378693, "step": 13410, "step_time": 6.966815597293317 }, { "clip_ratio/high_max": 7.955449837027117e-06, "clip_ratio/high_mean": 9.944312296283897e-07, "clip_ratio/low_mean": 1.6980944110400742e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 2.692525640668464e-06, "completions/clipped_ratio": 0.00625, "completions/max_length": 1234.3, "completions/max_terminated_length": 1024.2, "completions/mean_length": 156.99921875, "completions/mean_terminated_length": 145.13629608154298, "completions/min_length": 66.0, "completions/min_terminated_length": 66.0, "entropy": 0.0393114332575351, "epoch": 28.73661670235546, "frac_reward_zero_std": 0.93125, "grad_norm": 0.0, "learning_rate": 8.658100000000001e-06, "loss": -0.0052, "num_tokens": 1324376571.0, "reward": 1.0533007979393005, "reward_std": 0.16355677023530008, "rewards/reward_accuracy/mean": 0.95390625, "rewards/reward_accuracy/std": 0.16111503690481185, "rewards/reward_format/mean": 0.09939453229308129, "rewards/reward_format/std": 0.00404761761892587, "sampling/importance_sampling_ratio/max": 2.373323106765747, "sampling/importance_sampling_ratio/mean": 0.9826006114482879, "sampling/importance_sampling_ratio/min": 0.11650096140801906, "sampling/sampling_logp_difference/max": 1.1712202250957489, "sampling/sampling_logp_difference/mean": 0.0037349846679717302, "step": 13420, "step_time": 6.2111296516057335 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00703125, "completions/max_length": 1758.4, "completions/max_terminated_length": 1435.9, "completions/mean_length": 173.5546875, "completions/mean_terminated_length": 160.49061889648436, "completions/min_length": 66.8, "completions/min_terminated_length": 66.8, "entropy": 0.05214781563263386, "epoch": 28.758029978586723, "frac_reward_zero_std": 0.8625, "grad_norm": 0.0, "learning_rate": 8.6571e-06, "loss": -0.007, "num_tokens": 1325337687.0, "reward": 1.0545117259025574, "reward_std": 0.1811974488198757, "rewards/reward_accuracy/mean": 0.955078125, "rewards/reward_accuracy/std": 0.17908794954419135, "rewards/reward_format/mean": 0.09943359419703483, "rewards/reward_format/std": 0.004711332963779569, "sampling/importance_sampling_ratio/max": 2.5997239112854005, "sampling/importance_sampling_ratio/mean": 0.9861128568649292, "sampling/importance_sampling_ratio/min": 0.06088433526456356, "sampling/sampling_logp_difference/max": 1.1384652376174926, "sampling/sampling_logp_difference/mean": 0.004528118809685111, "step": 13430, "step_time": 8.449056662103976 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.006640625, "completions/max_length": 1422.5, "completions/max_terminated_length": 1177.5, "completions/mean_length": 167.223046875, "completions/mean_terminated_length": 154.79195251464844, "completions/min_length": 62.0, "completions/min_terminated_length": 62.0, "entropy": 0.0458754010964185, "epoch": 28.779443254817988, "frac_reward_zero_std": 0.9375, "grad_norm": 0.119140625, "learning_rate": 8.6561e-06, "loss": -0.003, "num_tokens": 1326281810.0, "reward": 1.052011752128601, "reward_std": 0.17828180864453316, "rewards/reward_accuracy/mean": 0.952734375, "rewards/reward_accuracy/std": 0.17481152936816216, "rewards/reward_format/mean": 0.09927734583616257, "rewards/reward_format/std": 0.005726777762174606, "sampling/importance_sampling_ratio/max": 2.434889316558838, "sampling/importance_sampling_ratio/mean": 0.9861263453960418, "sampling/importance_sampling_ratio/min": 0.1285208761692047, "sampling/sampling_logp_difference/max": 0.9156582832336426, "sampling/sampling_logp_difference/mean": 0.003946286486461758, "step": 13440, "step_time": 7.066261666608625 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00234375, "completions/max_length": 1423.6, "completions/max_terminated_length": 1138.1, "completions/mean_length": 147.368359375, "completions/mean_terminated_length": 142.95601806640624, "completions/min_length": 64.7, "completions/min_terminated_length": 64.7, "entropy": 0.03765752038452774, "epoch": 28.800856531049252, "frac_reward_zero_std": 0.9125, "grad_norm": 0.0, "learning_rate": 8.655100000000001e-06, "loss": -0.0051, "num_tokens": 1327178881.0, "reward": 1.0646093845367433, "reward_std": 0.13803747147321702, "rewards/reward_accuracy/mean": 0.96484375, "rewards/reward_accuracy/std": 0.13701671585440636, "rewards/reward_format/mean": 0.09976562559604644, "rewards/reward_format/std": 0.0031217265175655486, "sampling/importance_sampling_ratio/max": 2.4503806948661806, "sampling/importance_sampling_ratio/mean": 0.986520254611969, "sampling/importance_sampling_ratio/min": 0.1571245739236474, "sampling/sampling_logp_difference/max": 1.074075663089752, "sampling/sampling_logp_difference/mean": 0.003795016510412097, "step": 13450, "step_time": 6.821210692703607 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 1288.0, "completions/max_terminated_length": 723.4, "completions/mean_length": 150.0890625, "completions/mean_terminated_length": 142.7114288330078, "completions/min_length": 64.6, "completions/min_terminated_length": 64.6, "entropy": 0.037257665977813305, "epoch": 28.822269807280513, "frac_reward_zero_std": 0.93125, "grad_norm": 0.2412109375, "learning_rate": 8.6541e-06, "loss": -0.0068, "num_tokens": 1328081013.0, "reward": 1.0696680009365083, "reward_std": 0.13542125150561332, "rewards/reward_accuracy/mean": 0.969921875, "rewards/reward_accuracy/std": 0.1338084101676941, "rewards/reward_format/mean": 0.09974609538912774, "rewards/reward_format/std": 0.0033267974155023693, "sampling/importance_sampling_ratio/max": 2.4226679682731627, "sampling/importance_sampling_ratio/mean": 0.9863111853599549, "sampling/importance_sampling_ratio/min": 0.14435375705361367, "sampling/sampling_logp_difference/max": 0.8924683690071106, "sampling/sampling_logp_difference/mean": 0.0038299089530482886, "step": 13460, "step_time": 6.296936679404462 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.006640625, "completions/max_length": 1501.7, "completions/max_terminated_length": 1296.9, "completions/mean_length": 178.88671875, "completions/mean_terminated_length": 166.60497131347657, "completions/min_length": 64.8, "completions/min_terminated_length": 64.8, "entropy": 0.04920613078866154, "epoch": 28.843683083511777, "frac_reward_zero_std": 0.875, "grad_norm": 0.19140625, "learning_rate": 8.6531e-06, "loss": -0.0095, "num_tokens": 1329058227.0, "reward": 1.0561328411102295, "reward_std": 0.1810038447380066, "rewards/reward_accuracy/mean": 0.956640625, "rewards/reward_accuracy/std": 0.17869466096162795, "rewards/reward_format/mean": 0.09949218928813934, "rewards/reward_format/std": 0.004912897851318121, "sampling/importance_sampling_ratio/max": 2.442817759513855, "sampling/importance_sampling_ratio/mean": 0.9793630838394165, "sampling/importance_sampling_ratio/min": 0.06591777633875609, "sampling/sampling_logp_difference/max": 1.1863192200660706, "sampling/sampling_logp_difference/mean": 0.004079101048409939, "step": 13470, "step_time": 7.4995839783019616 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0015625, "completions/max_length": 1089.5, "completions/max_terminated_length": 905.4, "completions/mean_length": 153.290234375, "completions/mean_terminated_length": 150.32003326416014, "completions/min_length": 60.7, "completions/min_terminated_length": 60.7, "entropy": 0.03321656873449683, "epoch": 28.865096359743042, "frac_reward_zero_std": 0.9625, "grad_norm": 0.0, "learning_rate": 8.652100000000001e-06, "loss": -0.0036, "num_tokens": 1329965690.0, "reward": 1.0834375143051147, "reward_std": 0.09193960726261138, "rewards/reward_accuracy/mean": 0.98359375, "rewards/reward_accuracy/std": 0.0904661625623703, "rewards/reward_format/mean": 0.09984375089406967, "rewards/reward_format/std": 0.002316074492409825, "sampling/importance_sampling_ratio/max": 2.5098204374313355, "sampling/importance_sampling_ratio/mean": 0.9873760938644409, "sampling/importance_sampling_ratio/min": 0.11335547119379044, "sampling/sampling_logp_difference/max": 0.9262832045555115, "sampling/sampling_logp_difference/mean": 0.0033665085211396217, "step": 13480, "step_time": 5.4918837642937435 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003125, "completions/max_length": 1559.9, "completions/max_terminated_length": 1388.5, "completions/mean_length": 153.85859375, "completions/mean_terminated_length": 148.04632568359375, "completions/min_length": 63.3, "completions/min_terminated_length": 63.3, "entropy": 0.041949850996024905, "epoch": 28.886509635974303, "frac_reward_zero_std": 0.9125, "grad_norm": 1.6796875, "learning_rate": 8.651100000000001e-06, "loss": -0.0032, "num_tokens": 1330877456.0, "reward": 1.0516796946525573, "reward_std": 0.1824403665959835, "rewards/reward_accuracy/mean": 0.951953125, "rewards/reward_accuracy/std": 0.18121974691748619, "rewards/reward_format/mean": 0.09972656294703483, "rewards/reward_format/std": 0.0030360511038452385, "sampling/importance_sampling_ratio/max": 2.551219606399536, "sampling/importance_sampling_ratio/mean": 0.9893717348575592, "sampling/importance_sampling_ratio/min": 0.09202650599181653, "sampling/sampling_logp_difference/max": 0.9553692698478699, "sampling/sampling_logp_difference/mean": 0.0040679161436855795, "step": 13490, "step_time": 7.3668166288232895 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003125, "completions/max_length": 1362.1, "completions/max_terminated_length": 1190.1, "completions/mean_length": 155.832421875, "completions/mean_terminated_length": 149.90319366455077, "completions/min_length": 66.8, "completions/min_terminated_length": 66.8, "entropy": 0.04148658756166697, "epoch": 28.907922912205567, "frac_reward_zero_std": 0.8875, "grad_norm": 0.0, "learning_rate": 8.6501e-06, "loss": -0.01, "num_tokens": 1331790419.0, "reward": 1.0755273699760437, "reward_std": 0.13362534269690513, "rewards/reward_accuracy/mean": 0.97578125, "rewards/reward_accuracy/std": 0.131872970610857, "rewards/reward_format/mean": 0.09974609538912774, "rewards/reward_format/std": 0.00256529962643981, "sampling/importance_sampling_ratio/max": 2.5164340019226072, "sampling/importance_sampling_ratio/mean": 0.9836475372314453, "sampling/importance_sampling_ratio/min": 0.0876692071557045, "sampling/sampling_logp_difference/max": 0.9985694766044617, "sampling/sampling_logp_difference/mean": 0.004004422784782946, "step": 13500, "step_time": 6.552800070599187 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00234375, "completions/max_length": 1031.3, "completions/max_terminated_length": 893.0, "completions/mean_length": 152.961328125, "completions/mean_terminated_length": 148.61420288085938, "completions/min_length": 69.6, "completions/min_terminated_length": 69.6, "entropy": 0.03719801197294146, "epoch": 28.92933618843683, "frac_reward_zero_std": 0.94375, "grad_norm": 0.455078125, "learning_rate": 8.6491e-06, "loss": -0.0016, "num_tokens": 1332707168.0, "reward": 1.0831250071525573, "reward_std": 0.09021495282649994, "rewards/reward_accuracy/mean": 0.983203125, "rewards/reward_accuracy/std": 0.08952970281243325, "rewards/reward_format/mean": 0.09992187544703483, "rewards/reward_format/std": 0.0012500000651925803, "sampling/importance_sampling_ratio/max": 2.273599052429199, "sampling/importance_sampling_ratio/mean": 0.9841268420219421, "sampling/importance_sampling_ratio/min": 0.1387216579169035, "sampling/sampling_logp_difference/max": 1.0105581402778625, "sampling/sampling_logp_difference/mean": 0.0035530549474060537, "step": 13510, "step_time": 5.229161040604231 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 1678.8, "completions/max_terminated_length": 1185.8, "completions/mean_length": 164.8546875, "completions/mean_terminated_length": 157.48190612792968, "completions/min_length": 63.9, "completions/min_terminated_length": 63.9, "entropy": 0.039031516294926405, "epoch": 28.950749464668093, "frac_reward_zero_std": 0.89375, "grad_norm": 0.453125, "learning_rate": 8.648100000000001e-06, "loss": -0.0065, "num_tokens": 1333648860.0, "reward": 1.0755273461341859, "reward_std": 0.1395636223256588, "rewards/reward_accuracy/mean": 0.97578125, "rewards/reward_accuracy/std": 0.13720996379852296, "rewards/reward_format/mean": 0.09974609389901161, "rewards/reward_format/std": 0.0032657783711329104, "sampling/importance_sampling_ratio/max": 2.4700446844100954, "sampling/importance_sampling_ratio/mean": 0.9912012219429016, "sampling/importance_sampling_ratio/min": 0.05253768637776375, "sampling/sampling_logp_difference/max": 1.0886497020721435, "sampling/sampling_logp_difference/mean": 0.003876595664769411, "step": 13520, "step_time": 7.805397896899376 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0015625, "completions/max_length": 1351.1, "completions/max_terminated_length": 1126.0, "completions/mean_length": 147.240625, "completions/mean_terminated_length": 144.28390502929688, "completions/min_length": 62.6, "completions/min_terminated_length": 62.6, "entropy": 0.038092373148538174, "epoch": 28.972162740899357, "frac_reward_zero_std": 0.925, "grad_norm": 0.0, "learning_rate": 8.6471e-06, "loss": -0.0032, "num_tokens": 1334548340.0, "reward": 1.0800000071525573, "reward_std": 0.11371592804789543, "rewards/reward_accuracy/mean": 0.980078125, "rewards/reward_accuracy/std": 0.11321953684091568, "rewards/reward_format/mean": 0.09992187544703483, "rewards/reward_format/std": 0.0012500000651925803, "sampling/importance_sampling_ratio/max": 2.503906559944153, "sampling/importance_sampling_ratio/mean": 0.984281599521637, "sampling/importance_sampling_ratio/min": 0.12279928661882877, "sampling/sampling_logp_difference/max": 1.3292750239372253, "sampling/sampling_logp_difference/mean": 0.0040652174036949875, "step": 13530, "step_time": 6.546325036993949 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 1.9131871340505313e-07, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 1.9131871340505313e-07, "completions/clipped_ratio": 0.0140625, "completions/max_length": 1453.6, "completions/max_terminated_length": 1380.5, "completions/mean_length": 189.26484375, "completions/mean_terminated_length": 162.9552764892578, "completions/min_length": 66.2, "completions/min_terminated_length": 66.2, "entropy": 0.04698131708428264, "epoch": 28.99357601713062, "frac_reward_zero_std": 0.925, "grad_norm": 0.34765625, "learning_rate": 8.6461e-06, "loss": -0.0025, "num_tokens": 1335553002.0, "reward": 1.0608203411102295, "reward_std": 0.1509523242712021, "rewards/reward_accuracy/mean": 0.962109375, "rewards/reward_accuracy/std": 0.14617098569869996, "rewards/reward_format/mean": 0.09871093928813934, "rewards/reward_format/std": 0.007566915359348059, "sampling/importance_sampling_ratio/max": 2.527243196964264, "sampling/importance_sampling_ratio/mean": 0.9825223088264465, "sampling/importance_sampling_ratio/min": 0.08888352513313294, "sampling/sampling_logp_difference/max": 1.1124743223190308, "sampling/sampling_logp_difference/mean": 0.00415046364068985, "step": 13540, "step_time": 7.693340657098451 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 2.6382921078038636e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 2.6382921078038636e-06, "completions/clipped_ratio": 0.005859375, "completions/max_length": 1236.7, "completions/max_terminated_length": 1207.9, "completions/mean_length": 162.184765625, "completions/mean_terminated_length": 151.12730865478517, "completions/min_length": 61.7, "completions/min_terminated_length": 61.7, "entropy": 0.04213880251627415, "epoch": 29.014989293361886, "frac_reward_zero_std": 0.95, "grad_norm": 0.0, "learning_rate": 8.645100000000001e-06, "loss": -0.0032, "num_tokens": 1336483811.0, "reward": 1.0587109565734862, "reward_std": 0.15439641177654267, "rewards/reward_accuracy/mean": 0.959375, "rewards/reward_accuracy/std": 0.15251443088054656, "rewards/reward_format/mean": 0.09933594092726708, "rewards/reward_format/std": 0.003841251786798239, "sampling/importance_sampling_ratio/max": 2.2951364755630492, "sampling/importance_sampling_ratio/mean": 0.9907105147838593, "sampling/importance_sampling_ratio/min": 0.18587019965052604, "sampling/sampling_logp_difference/max": 0.9516998529434204, "sampling/sampling_logp_difference/mean": 0.003785359254106879, "step": 13550, "step_time": 6.1580931700096695 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.002734375, "completions/max_length": 1038.4, "completions/max_terminated_length": 979.4, "completions/mean_length": 150.321484375, "completions/mean_terminated_length": 145.1655487060547, "completions/min_length": 62.0, "completions/min_terminated_length": 62.0, "entropy": 0.03630042679142207, "epoch": 29.036402569593147, "frac_reward_zero_std": 0.9375, "grad_norm": 0.2490234375, "learning_rate": 8.6441e-06, "loss": -0.0018, "num_tokens": 1337390426.0, "reward": 1.0751562714576721, "reward_std": 0.1200946256518364, "rewards/reward_accuracy/mean": 0.975390625, "rewards/reward_accuracy/std": 0.11875532642006874, "rewards/reward_format/mean": 0.0997656263411045, "rewards/reward_format/std": 0.0023152486653998496, "sampling/importance_sampling_ratio/max": 2.4397063970565798, "sampling/importance_sampling_ratio/mean": 0.9857013881206512, "sampling/importance_sampling_ratio/min": 0.21692558266222478, "sampling/sampling_logp_difference/max": 1.1942522346973419, "sampling/sampling_logp_difference/mean": 0.003916901675984264, "step": 13560, "step_time": 5.227530273594311 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.002734375, "completions/max_length": 1329.3, "completions/max_terminated_length": 1244.9, "completions/mean_length": 156.8625, "completions/mean_terminated_length": 151.7614517211914, "completions/min_length": 61.6, "completions/min_terminated_length": 61.6, "entropy": 0.04182935089338571, "epoch": 29.05781584582441, "frac_reward_zero_std": 0.91875, "grad_norm": 0.328125, "learning_rate": 8.6431e-06, "loss": -0.0079, "num_tokens": 1338308490.0, "reward": 1.0391601920127869, "reward_std": 0.1909019887447357, "rewards/reward_accuracy/mean": 0.939453125, "rewards/reward_accuracy/std": 0.1893765665590763, "rewards/reward_format/mean": 0.09970703274011612, "rewards/reward_format/std": 0.0028018517419695853, "sampling/importance_sampling_ratio/max": 2.395717537403107, "sampling/importance_sampling_ratio/mean": 0.9800125300884247, "sampling/importance_sampling_ratio/min": 0.06919333785772323, "sampling/sampling_logp_difference/max": 1.3953155517578124, "sampling/sampling_logp_difference/mean": 0.0040928831091150645, "step": 13570, "step_time": 6.502246773699881 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 1090.6, "completions/max_terminated_length": 850.0, "completions/mean_length": 141.64296875, "completions/mean_terminated_length": 134.26597442626954, "completions/min_length": 65.1, "completions/min_terminated_length": 65.1, "entropy": 0.03721581562422216, "epoch": 29.079229122055676, "frac_reward_zero_std": 0.93125, "grad_norm": 0.27734375, "learning_rate": 8.642100000000002e-06, "loss": -0.0101, "num_tokens": 1339184568.0, "reward": 1.0868750214576721, "reward_std": 0.08448060527443886, "rewards/reward_accuracy/mean": 0.987109375, "rewards/reward_accuracy/std": 0.08299339190125465, "rewards/reward_format/mean": 0.0997656263411045, "rewards/reward_format/std": 0.0022276924923062325, "sampling/importance_sampling_ratio/max": 2.180188512802124, "sampling/importance_sampling_ratio/mean": 0.9791259765625, "sampling/importance_sampling_ratio/min": 0.14747859723865986, "sampling/sampling_logp_difference/max": 1.0103541791439057, "sampling/sampling_logp_difference/mean": 0.0037449106806889177, "step": 13580, "step_time": 5.448605976090766 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005859375, "completions/max_length": 1299.3, "completions/max_terminated_length": 1139.5, "completions/mean_length": 162.891796875, "completions/mean_terminated_length": 151.91781768798828, "completions/min_length": 63.6, "completions/min_terminated_length": 63.6, "entropy": 0.04007688304409385, "epoch": 29.100642398286936, "frac_reward_zero_std": 0.9, "grad_norm": 0.1796875, "learning_rate": 8.641100000000001e-06, "loss": -0.0042, "num_tokens": 1340118403.0, "reward": 1.079980492591858, "reward_std": 0.11099637150764466, "rewards/reward_accuracy/mean": 0.98046875, "rewards/reward_accuracy/std": 0.10885573029518128, "rewards/reward_format/mean": 0.09951171949505806, "rewards/reward_format/std": 0.0034621131606400015, "sampling/importance_sampling_ratio/max": 2.4946915745735168, "sampling/importance_sampling_ratio/mean": 0.9932330906391144, "sampling/importance_sampling_ratio/min": 0.1626177234807983, "sampling/sampling_logp_difference/max": 1.004151451587677, "sampling/sampling_logp_difference/mean": 0.0038350450107827783, "step": 13590, "step_time": 6.335449942207196 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001953125, "completions/max_length": 1109.6, "completions/max_terminated_length": 804.0, "completions/mean_length": 139.187109375, "completions/mean_terminated_length": 135.48175811767578, "completions/min_length": 60.9, "completions/min_terminated_length": 60.9, "entropy": 0.03487482939381152, "epoch": 29.1220556745182, "frac_reward_zero_std": 0.93125, "grad_norm": 0.447265625, "learning_rate": 8.6401e-06, "loss": -0.0061, "num_tokens": 1340986514.0, "reward": 1.0780468821525573, "reward_std": 0.10102800354361534, "rewards/reward_accuracy/mean": 0.978125, "rewards/reward_accuracy/std": 0.10048832148313522, "rewards/reward_format/mean": 0.09992187544703483, "rewards/reward_format/std": 0.0012500000651925803, "sampling/importance_sampling_ratio/max": 2.3710538029670714, "sampling/importance_sampling_ratio/mean": 0.9863971412181854, "sampling/importance_sampling_ratio/min": 0.19466867465525867, "sampling/sampling_logp_difference/max": 1.0476129531860352, "sampling/sampling_logp_difference/mean": 0.0037735250080004334, "step": 13600, "step_time": 5.434207229290041 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00234375, "completions/max_length": 1053.5, "completions/max_terminated_length": 884.7, "completions/mean_length": 157.26484375, "completions/mean_terminated_length": 152.87651519775392, "completions/min_length": 63.5, "completions/min_terminated_length": 63.5, "entropy": 0.03759959067683667, "epoch": 29.143468950749465, "frac_reward_zero_std": 0.91875, "grad_norm": 0.0, "learning_rate": 8.6391e-06, "loss": -0.0049, "num_tokens": 1341906904.0, "reward": 1.0748242497444154, "reward_std": 0.11951940879225731, "rewards/reward_accuracy/mean": 0.975, "rewards/reward_accuracy/std": 0.11857614740729332, "rewards/reward_format/mean": 0.09982422068715095, "rewards/reward_format/std": 0.0022048230282962324, "sampling/importance_sampling_ratio/max": 2.5243688821792603, "sampling/importance_sampling_ratio/mean": 0.9872109174728394, "sampling/importance_sampling_ratio/min": 0.11046669334173202, "sampling/sampling_logp_difference/max": 1.6186587810516357, "sampling/sampling_logp_difference/mean": 0.003748582350090146, "step": 13610, "step_time": 5.298325256691896 }, { "clip_ratio/high_max": 7.307725463761017e-05, "clip_ratio/high_mean": 9.134656829701271e-06, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 9.134656829701271e-06, "completions/clipped_ratio": 0.002734375, "completions/max_length": 1168.3, "completions/max_terminated_length": 1154.3, "completions/mean_length": 150.530859375, "completions/mean_terminated_length": 145.49354400634766, "completions/min_length": 64.6, "completions/min_terminated_length": 64.6, "entropy": 0.036862900969572364, "epoch": 29.16488222698073, "frac_reward_zero_std": 0.94375, "grad_norm": 0.287109375, "learning_rate": 8.638100000000001e-06, "loss": -0.0036, "num_tokens": 1342807431.0, "reward": 1.0685156345367433, "reward_std": 0.11967021003365516, "rewards/reward_accuracy/mean": 0.96875, "rewards/reward_accuracy/std": 0.1191460758447647, "rewards/reward_format/mean": 0.0997656263411045, "rewards/reward_format/std": 0.001860177074559033, "sampling/importance_sampling_ratio/max": 2.4014355421066282, "sampling/importance_sampling_ratio/mean": 0.9973724901676178, "sampling/importance_sampling_ratio/min": 0.15047264881432057, "sampling/sampling_logp_difference/max": 1.1021100878715515, "sampling/sampling_logp_difference/mean": 0.0037436498329043387, "step": 13620, "step_time": 5.679382462590001 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00546875, "completions/max_length": 1221.0, "completions/max_terminated_length": 1141.6, "completions/mean_length": 160.840234375, "completions/mean_terminated_length": 150.70293884277345, "completions/min_length": 70.6, "completions/min_terminated_length": 70.6, "entropy": 0.04135324556846172, "epoch": 29.18629550321199, "frac_reward_zero_std": 0.9375, "grad_norm": 1.34375, "learning_rate": 8.6371e-06, "loss": -0.0062, "num_tokens": 1343739790.0, "reward": 1.0437695562839509, "reward_std": 0.1912529982626438, "rewards/reward_accuracy/mean": 0.944140625, "rewards/reward_accuracy/std": 0.18986762017011644, "rewards/reward_format/mean": 0.09962890744209289, "rewards/reward_format/std": 0.002789715398102999, "sampling/importance_sampling_ratio/max": 2.6401543855667113, "sampling/importance_sampling_ratio/mean": 0.9962681531906128, "sampling/importance_sampling_ratio/min": 0.11507549583911895, "sampling/sampling_logp_difference/max": 1.1823377013206482, "sampling/sampling_logp_difference/mean": 0.003998251934535802, "step": 13630, "step_time": 6.238324255897896 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.004296875, "completions/max_length": 1040.2, "completions/max_terminated_length": 747.1, "completions/mean_length": 148.98984375, "completions/mean_terminated_length": 141.03026657104493, "completions/min_length": 66.1, "completions/min_terminated_length": 66.1, "entropy": 0.040850954689085485, "epoch": 29.207708779443255, "frac_reward_zero_std": 0.94375, "grad_norm": 0.04736328125, "learning_rate": 8.6361e-06, "loss": -0.0042, "num_tokens": 1344641092.0, "reward": 1.0676562666893006, "reward_std": 0.11371914818882942, "rewards/reward_accuracy/mean": 0.96796875, "rewards/reward_accuracy/std": 0.11240407004952431, "rewards/reward_format/mean": 0.09968750104308129, "rewards/reward_format/std": 0.002765847835689783, "sampling/importance_sampling_ratio/max": 2.437216019630432, "sampling/importance_sampling_ratio/mean": 0.9913498282432556, "sampling/importance_sampling_ratio/min": 0.08896363526582718, "sampling/sampling_logp_difference/max": 1.0880030751228333, "sampling/sampling_logp_difference/mean": 0.003991693002171814, "step": 13640, "step_time": 5.079485483808094 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00625, "completions/max_length": 1610.6, "completions/max_terminated_length": 1286.0, "completions/mean_length": 169.073828125, "completions/mean_terminated_length": 157.33460388183593, "completions/min_length": 64.3, "completions/min_terminated_length": 64.3, "entropy": 0.045748764812014994, "epoch": 29.22912205567452, "frac_reward_zero_std": 0.8875, "grad_norm": 0.1357421875, "learning_rate": 8.635100000000001e-06, "loss": 0.0003, "num_tokens": 1345593825.0, "reward": 1.0512304842472076, "reward_std": 0.1945239059627056, "rewards/reward_accuracy/mean": 0.9515625, "rewards/reward_accuracy/std": 0.19293890073895453, "rewards/reward_format/mean": 0.09966796934604645, "rewards/reward_format/std": 0.003814995544962585, "sampling/importance_sampling_ratio/max": 2.6675896644592285, "sampling/importance_sampling_ratio/mean": 0.9896510601043701, "sampling/importance_sampling_ratio/min": 0.11905708014965058, "sampling/sampling_logp_difference/max": 1.0359567999839783, "sampling/sampling_logp_difference/mean": 0.004016051697544753, "step": 13650, "step_time": 7.826839788490906 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003515625, "completions/max_length": 1462.7, "completions/max_terminated_length": 781.9, "completions/mean_length": 146.0, "completions/mean_terminated_length": 139.33913040161133, "completions/min_length": 61.8, "completions/min_terminated_length": 61.8, "entropy": 0.03616319135762751, "epoch": 29.25053533190578, "frac_reward_zero_std": 0.925, "grad_norm": 0.068359375, "learning_rate": 8.634100000000001e-06, "loss": -0.0052, "num_tokens": 1346487249.0, "reward": 1.0763086020946502, "reward_std": 0.10791454464197159, "rewards/reward_accuracy/mean": 0.9765625, "rewards/reward_accuracy/std": 0.10588111653923989, "rewards/reward_format/mean": 0.09974609389901161, "rewards/reward_format/std": 0.0032657784642651675, "sampling/importance_sampling_ratio/max": 2.418879044055939, "sampling/importance_sampling_ratio/mean": 0.982968008518219, "sampling/importance_sampling_ratio/min": 0.11994508653879166, "sampling/sampling_logp_difference/max": 0.8427931725978851, "sampling/sampling_logp_difference/mean": 0.0039028091123327613, "step": 13660, "step_time": 6.817197072718409 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003125, "completions/max_length": 978.9, "completions/max_terminated_length": 949.2, "completions/mean_length": 152.13828125, "completions/mean_terminated_length": 146.26058807373047, "completions/min_length": 68.1, "completions/min_terminated_length": 68.1, "entropy": 0.03664393939543516, "epoch": 29.271948608137045, "frac_reward_zero_std": 0.9625, "grad_norm": 0.0, "learning_rate": 8.6331e-06, "loss": -0.0012, "num_tokens": 1347392259.0, "reward": 1.0914648652076722, "reward_std": 0.051034900546073916, "rewards/reward_accuracy/mean": 0.991796875, "rewards/reward_accuracy/std": 0.04914684593677521, "rewards/reward_format/mean": 0.09966797009110451, "rewards/reward_format/std": 0.002710496471263468, "sampling/importance_sampling_ratio/max": 2.520780110359192, "sampling/importance_sampling_ratio/mean": 0.9927552580833435, "sampling/importance_sampling_ratio/min": 0.16941798180341722, "sampling/sampling_logp_difference/max": 0.9244238376617432, "sampling/sampling_logp_difference/mean": 0.003676420054398477, "step": 13670, "step_time": 5.041417353705038 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001171875, "completions/max_length": 1162.0, "completions/max_terminated_length": 1079.7, "completions/mean_length": 149.032421875, "completions/mean_terminated_length": 146.83265838623046, "completions/min_length": 65.8, "completions/min_terminated_length": 65.8, "entropy": 0.04349637015257031, "epoch": 29.29336188436831, "frac_reward_zero_std": 0.93125, "grad_norm": 1.0234375, "learning_rate": 8.632100000000002e-06, "loss": -0.0015, "num_tokens": 1348294822.0, "reward": 1.0783203482627868, "reward_std": 0.11152797043323517, "rewards/reward_accuracy/mean": 0.978515625, "rewards/reward_accuracy/std": 0.11047788262367249, "rewards/reward_format/mean": 0.09980468973517417, "rewards/reward_format/std": 0.0021509199403226377, "sampling/importance_sampling_ratio/max": 2.3423485279083254, "sampling/importance_sampling_ratio/mean": 0.9883217096328736, "sampling/importance_sampling_ratio/min": 0.10632854998111725, "sampling/sampling_logp_difference/max": 0.8690650284290313, "sampling/sampling_logp_difference/mean": 0.0041899200528860096, "step": 13680, "step_time": 5.739411623199703 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00703125, "completions/max_length": 1485.3, "completions/max_terminated_length": 1291.3, "completions/mean_length": 166.012890625, "completions/mean_terminated_length": 152.69354248046875, "completions/min_length": 65.9, "completions/min_terminated_length": 65.9, "entropy": 0.04647454905789346, "epoch": 29.31477516059957, "frac_reward_zero_std": 0.91875, "grad_norm": 0.369140625, "learning_rate": 8.631100000000001e-06, "loss": 0.0009, "num_tokens": 1349235623.0, "reward": 1.0460742354393004, "reward_std": 0.1942950375378132, "rewards/reward_accuracy/mean": 0.946484375, "rewards/reward_accuracy/std": 0.19290805160999297, "rewards/reward_format/mean": 0.09958984479308128, "rewards/reward_format/std": 0.0033737865276634695, "sampling/importance_sampling_ratio/max": 2.4406192779541014, "sampling/importance_sampling_ratio/mean": 0.9880822658538818, "sampling/importance_sampling_ratio/min": 0.12448663637042046, "sampling/sampling_logp_difference/max": 0.9286876797676087, "sampling/sampling_logp_difference/mean": 0.0040729440515860915, "step": 13690, "step_time": 7.352715861296747 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00546875, "completions/max_length": 1192.2, "completions/max_terminated_length": 1078.8, "completions/mean_length": 164.502734375, "completions/mean_terminated_length": 154.32403106689452, "completions/min_length": 62.6, "completions/min_terminated_length": 62.6, "entropy": 0.044647011626511815, "epoch": 29.336188436830835, "frac_reward_zero_std": 0.9, "grad_norm": 0.6015625, "learning_rate": 8.6301e-06, "loss": -0.0042, "num_tokens": 1350178702.0, "reward": 1.0667187750339509, "reward_std": 0.13100393414497374, "rewards/reward_accuracy/mean": 0.9671875, "rewards/reward_accuracy/std": 0.1288149729371071, "rewards/reward_format/mean": 0.09953125193715096, "rewards/reward_format/std": 0.004341198061592877, "sampling/importance_sampling_ratio/max": 2.4915338516235352, "sampling/importance_sampling_ratio/mean": 0.9810860335826874, "sampling/importance_sampling_ratio/min": 0.09841836504638195, "sampling/sampling_logp_difference/max": 1.069758415222168, "sampling/sampling_logp_difference/mean": 0.003952334797941148, "step": 13700, "step_time": 6.074481271204422 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.006640625, "completions/max_length": 844.2, "completions/max_terminated_length": 498.6, "completions/mean_length": 145.2453125, "completions/mean_terminated_length": 132.5427261352539, "completions/min_length": 64.1, "completions/min_terminated_length": 64.1, "entropy": 0.032264454010874036, "epoch": 29.3576017130621, "frac_reward_zero_std": 0.94375, "grad_norm": 0.0, "learning_rate": 8.6291e-06, "loss": -0.0004, "num_tokens": 1351064850.0, "reward": 1.0770312786102294, "reward_std": 0.10944025442004204, "rewards/reward_accuracy/mean": 0.97734375, "rewards/reward_accuracy/std": 0.10789703130722046, "rewards/reward_format/mean": 0.09968750178813934, "rewards/reward_format/std": 0.0022590248845517635, "sampling/importance_sampling_ratio/max": 2.3856955647468565, "sampling/importance_sampling_ratio/mean": 0.9913168847560883, "sampling/importance_sampling_ratio/min": 0.16729176826775075, "sampling/sampling_logp_difference/max": 1.1136422753334045, "sampling/sampling_logp_difference/mean": 0.0034798945765942336, "step": 13710, "step_time": 4.573629293194972 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001953125, "completions/max_length": 828.1, "completions/max_terminated_length": 771.4, "completions/mean_length": 147.209765625, "completions/mean_terminated_length": 143.53934783935546, "completions/min_length": 67.3, "completions/min_terminated_length": 67.3, "entropy": 0.0362128886859864, "epoch": 29.379014989293363, "frac_reward_zero_std": 0.9375, "grad_norm": 0.60546875, "learning_rate": 8.6281e-06, "loss": -0.0047, "num_tokens": 1351959083.0, "reward": 1.0694922029972076, "reward_std": 0.10757013261318207, "rewards/reward_accuracy/mean": 0.96953125, "rewards/reward_accuracy/std": 0.10740733370184899, "rewards/reward_format/mean": 0.09996093809604645, "rewards/reward_format/std": 0.0006250000093132258, "sampling/importance_sampling_ratio/max": 2.282587444782257, "sampling/importance_sampling_ratio/mean": 0.9770413517951966, "sampling/importance_sampling_ratio/min": 0.15456002652645112, "sampling/sampling_logp_difference/max": 1.0187265396118164, "sampling/sampling_logp_difference/mean": 0.0037863557459786533, "step": 13720, "step_time": 4.32753188040806 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.000390625, "completions/max_length": 1091.2, "completions/max_terminated_length": 1080.1, "completions/mean_length": 147.49765625, "completions/mean_terminated_length": 146.76453247070313, "completions/min_length": 67.3, "completions/min_terminated_length": 67.3, "entropy": 0.03498233645223081, "epoch": 29.400428265524624, "frac_reward_zero_std": 0.91875, "grad_norm": 0.59375, "learning_rate": 8.6271e-06, "loss": -0.0062, "num_tokens": 1352858133.0, "reward": 1.0772656321525573, "reward_std": 0.12074816972017288, "rewards/reward_accuracy/mean": 0.97734375, "rewards/reward_accuracy/std": 0.12004447728395462, "rewards/reward_format/mean": 0.09992187544703483, "rewards/reward_format/std": 0.0012500000651925803, "sampling/importance_sampling_ratio/max": 2.5221081733703614, "sampling/importance_sampling_ratio/mean": 0.9980254888534545, "sampling/importance_sampling_ratio/min": 0.1798636794090271, "sampling/sampling_logp_difference/max": 1.2348207354545593, "sampling/sampling_logp_difference/mean": 0.003821559273637831, "step": 13730, "step_time": 5.280300243495731 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.004296875, "completions/max_length": 1051.1, "completions/max_terminated_length": 833.1, "completions/mean_length": 147.895703125, "completions/mean_terminated_length": 139.83871154785157, "completions/min_length": 64.3, "completions/min_terminated_length": 64.3, "entropy": 0.03779628148768097, "epoch": 29.42184154175589, "frac_reward_zero_std": 0.94375, "grad_norm": 0.0, "learning_rate": 8.6261e-06, "loss": -0.0066, "num_tokens": 1353747386.0, "reward": 1.0816601753234862, "reward_std": 0.0877189353108406, "rewards/reward_accuracy/mean": 0.98203125, "rewards/reward_accuracy/std": 0.0859318196773529, "rewards/reward_format/mean": 0.09962890744209289, "rewards/reward_format/std": 0.002910412847995758, "sampling/importance_sampling_ratio/max": 2.3402597308158875, "sampling/importance_sampling_ratio/mean": 0.9882694959640503, "sampling/importance_sampling_ratio/min": 0.09566642045974731, "sampling/sampling_logp_difference/max": 1.0394580602645873, "sampling/sampling_logp_difference/mean": 0.003863449627533555, "step": 13740, "step_time": 5.324290402693441 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0046875, "completions/max_length": 1261.8, "completions/max_terminated_length": 1195.9, "completions/mean_length": 174.626953125, "completions/mean_terminated_length": 166.10047454833983, "completions/min_length": 64.0, "completions/min_terminated_length": 64.0, "entropy": 0.04393854176159948, "epoch": 29.443254817987153, "frac_reward_zero_std": 0.91875, "grad_norm": 0.1923828125, "learning_rate": 8.625100000000001e-06, "loss": -0.006, "num_tokens": 1354711247.0, "reward": 1.048144555091858, "reward_std": 0.20053589567542077, "rewards/reward_accuracy/mean": 0.9484375, "rewards/reward_accuracy/std": 0.19945642799139024, "rewards/reward_format/mean": 0.09970703274011612, "rewards/reward_format/std": 0.0030622741440311076, "sampling/importance_sampling_ratio/max": 2.4850844502449037, "sampling/importance_sampling_ratio/mean": 0.9799624919891358, "sampling/importance_sampling_ratio/min": 0.10701570846140385, "sampling/sampling_logp_difference/max": 1.311176335811615, "sampling/sampling_logp_difference/mean": 0.003893253579735756, "step": 13750, "step_time": 6.389590147091075 }, { "clip_ratio/high_max": 1.6184721607714893e-05, "clip_ratio/high_mean": 2.0230902009643616e-06, "clip_ratio/low_mean": 1.1173365237482358e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 3.1404267247125974e-06, "completions/clipped_ratio": 0.0125, "completions/max_length": 1398.3, "completions/max_terminated_length": 1157.8, "completions/mean_length": 163.921875, "completions/mean_terminated_length": 140.05044250488282, "completions/min_length": 61.3, "completions/min_terminated_length": 61.3, "entropy": 0.03960950365290046, "epoch": 29.464668094218414, "frac_reward_zero_std": 0.9375, "grad_norm": 0.1650390625, "learning_rate": 8.624100000000001e-06, "loss": 0.0003, "num_tokens": 1355648871.0, "reward": 1.0497656345367432, "reward_std": 0.19434819519519805, "rewards/reward_accuracy/mean": 0.95078125, "rewards/reward_accuracy/std": 0.19010309875011444, "rewards/reward_format/mean": 0.09898437559604645, "rewards/reward_format/std": 0.005805279896594584, "sampling/importance_sampling_ratio/max": 2.3301886081695558, "sampling/importance_sampling_ratio/mean": 0.9882704377174377, "sampling/importance_sampling_ratio/min": 0.08545472957193852, "sampling/sampling_logp_difference/max": 1.2566008687019348, "sampling/sampling_logp_difference/mean": 0.0038900844985619186, "step": 13760, "step_time": 6.968357450113399 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.006640625, "completions/max_length": 1391.9, "completions/max_terminated_length": 984.9, "completions/mean_length": 170.607421875, "completions/mean_terminated_length": 158.27959747314452, "completions/min_length": 66.5, "completions/min_terminated_length": 66.5, "entropy": 0.043717027688398954, "epoch": 29.48608137044968, "frac_reward_zero_std": 0.925, "grad_norm": 0.1630859375, "learning_rate": 8.6231e-06, "loss": -0.0088, "num_tokens": 1356597738.0, "reward": 1.0604492604732514, "reward_std": 0.14159248620271683, "rewards/reward_accuracy/mean": 0.9609375, "rewards/reward_accuracy/std": 0.1394769713282585, "rewards/reward_format/mean": 0.09951172173023223, "rewards/reward_format/std": 0.004675122117623687, "sampling/importance_sampling_ratio/max": 2.48150954246521, "sampling/importance_sampling_ratio/mean": 0.9958257913589478, "sampling/importance_sampling_ratio/min": 0.10883653312921523, "sampling/sampling_logp_difference/max": 1.0503277897834777, "sampling/sampling_logp_difference/mean": 0.0040012982208281755, "step": 13770, "step_time": 7.1043839435064005 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00546875, "completions/max_length": 1318.4, "completions/max_terminated_length": 1093.6, "completions/mean_length": 157.195703125, "completions/mean_terminated_length": 146.85506744384764, "completions/min_length": 65.0, "completions/min_terminated_length": 65.0, "entropy": 0.04279208320658654, "epoch": 29.507494646680943, "frac_reward_zero_std": 0.9125, "grad_norm": 0.0, "learning_rate": 8.622100000000002e-06, "loss": -0.0091, "num_tokens": 1357516335.0, "reward": 1.0798047304153442, "reward_std": 0.11617471575737, "rewards/reward_accuracy/mean": 0.980078125, "rewards/reward_accuracy/std": 0.1145168460905552, "rewards/reward_format/mean": 0.09972656518220901, "rewards/reward_format/std": 0.003159645991399884, "sampling/importance_sampling_ratio/max": 2.4852007150650026, "sampling/importance_sampling_ratio/mean": 0.9934064626693726, "sampling/importance_sampling_ratio/min": 0.13888925006613134, "sampling/sampling_logp_difference/max": 0.99086434841156, "sampling/sampling_logp_difference/mean": 0.004128200584091246, "step": 13780, "step_time": 6.4625271887955025 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001171875, "completions/max_length": 866.0, "completions/max_terminated_length": 735.9, "completions/mean_length": 140.208984375, "completions/mean_terminated_length": 137.9822570800781, "completions/min_length": 59.9, "completions/min_terminated_length": 59.9, "entropy": 0.035849928134121, "epoch": 29.528907922912204, "frac_reward_zero_std": 0.93125, "grad_norm": 0.0, "learning_rate": 8.621100000000001e-06, "loss": -0.0008, "num_tokens": 1358394774.0, "reward": 1.0854882955551148, "reward_std": 0.07901150435209274, "rewards/reward_accuracy/mean": 0.985546875, "rewards/reward_accuracy/std": 0.07868166863918305, "rewards/reward_format/mean": 0.09994140714406967, "rewards/reward_format/std": 0.0007535743294283748, "sampling/importance_sampling_ratio/max": 2.3908814907073976, "sampling/importance_sampling_ratio/mean": 0.985910701751709, "sampling/importance_sampling_ratio/min": 0.2024474985897541, "sampling/sampling_logp_difference/max": 0.9884357213973999, "sampling/sampling_logp_difference/mean": 0.003706321399658918, "step": 13790, "step_time": 4.530505881007412 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00234375, "completions/max_length": 1440.8, "completions/max_terminated_length": 1197.4, "completions/mean_length": 155.06484375, "completions/mean_terminated_length": 150.6185333251953, "completions/min_length": 58.2, "completions/min_terminated_length": 58.2, "entropy": 0.03908729809336364, "epoch": 29.550321199143468, "frac_reward_zero_std": 0.9125, "grad_norm": 0.365234375, "learning_rate": 8.6201e-06, "loss": -0.007, "num_tokens": 1359312236.0, "reward": 1.052597665786743, "reward_std": 0.18439482674002647, "rewards/reward_accuracy/mean": 0.952734375, "rewards/reward_accuracy/std": 0.18374130725860596, "rewards/reward_format/mean": 0.09986328184604645, "rewards/reward_format/std": 0.002187500172294676, "sampling/importance_sampling_ratio/max": 2.692543888092041, "sampling/importance_sampling_ratio/mean": 0.9816253960132599, "sampling/importance_sampling_ratio/min": 0.11410400867462159, "sampling/sampling_logp_difference/max": 1.1926552653312683, "sampling/sampling_logp_difference/mean": 0.004015550622716546, "step": 13800, "step_time": 6.826038651997806 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001171875, "completions/max_length": 1289.4, "completions/max_terminated_length": 899.0, "completions/mean_length": 153.497265625, "completions/mean_terminated_length": 151.27672729492187, "completions/min_length": 69.2, "completions/min_terminated_length": 69.2, "entropy": 0.03654041574336588, "epoch": 29.571734475374733, "frac_reward_zero_std": 0.9375, "grad_norm": 0.06689453125, "learning_rate": 8.6191e-06, "loss": -0.006, "num_tokens": 1360226021.0, "reward": 1.0679101705551148, "reward_std": 0.14660519137978553, "rewards/reward_accuracy/mean": 0.96796875, "rewards/reward_accuracy/std": 0.14584104269742965, "rewards/reward_format/mean": 0.09994140714406967, "rewards/reward_format/std": 0.0009375000605359674, "sampling/importance_sampling_ratio/max": 2.5020914316177367, "sampling/importance_sampling_ratio/mean": 0.9920023560523987, "sampling/importance_sampling_ratio/min": 0.06675520390272141, "sampling/sampling_logp_difference/max": 1.1212517201900483, "sampling/sampling_logp_difference/mean": 0.0037572893081232904, "step": 13810, "step_time": 6.108770495987846 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.007421875, "completions/max_length": 1451.3, "completions/max_terminated_length": 1092.6, "completions/mean_length": 165.469921875, "completions/mean_terminated_length": 151.54563903808594, "completions/min_length": 72.9, "completions/min_terminated_length": 72.9, "entropy": 0.04503370292950422, "epoch": 29.593147751605997, "frac_reward_zero_std": 0.9375, "grad_norm": 0.0, "learning_rate": 8.6181e-06, "loss": -0.0057, "num_tokens": 1361170744.0, "reward": 1.0751758098602295, "reward_std": 0.11372172981500625, "rewards/reward_accuracy/mean": 0.97578125, "rewards/reward_accuracy/std": 0.11091147214174271, "rewards/reward_format/mean": 0.09939453303813935, "rewards/reward_format/std": 0.004565783077850938, "sampling/importance_sampling_ratio/max": 2.4393272280693052, "sampling/importance_sampling_ratio/mean": 0.974408745765686, "sampling/importance_sampling_ratio/min": 0.029926900565624238, "sampling/sampling_logp_difference/max": 1.061786061525345, "sampling/sampling_logp_difference/mean": 0.004202854307368398, "step": 13820, "step_time": 7.023514174396405 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.002734375, "completions/max_length": 1244.7, "completions/max_terminated_length": 865.7, "completions/mean_length": 156.915234375, "completions/mean_terminated_length": 151.725252532959, "completions/min_length": 65.1, "completions/min_terminated_length": 65.1, "entropy": 0.03553216715808958, "epoch": 29.614561027837258, "frac_reward_zero_std": 0.90625, "grad_norm": 0.6171875, "learning_rate": 8.617100000000001e-06, "loss": -0.0023, "num_tokens": 1362087967.0, "reward": 1.0740429878234863, "reward_std": 0.1188953660428524, "rewards/reward_accuracy/mean": 0.97421875, "rewards/reward_accuracy/std": 0.11828143298625945, "rewards/reward_format/mean": 0.0998242199420929, "rewards/reward_format/std": 0.0022607231279835106, "sampling/importance_sampling_ratio/max": 2.433056390285492, "sampling/importance_sampling_ratio/mean": 0.9734703958034515, "sampling/importance_sampling_ratio/min": 0.11857563368976116, "sampling/sampling_logp_difference/max": 0.9761772394180298, "sampling/sampling_logp_difference/mean": 0.003580527938902378, "step": 13830, "step_time": 5.918509610823821 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001171875, "completions/max_length": 1037.1, "completions/max_terminated_length": 829.5, "completions/mean_length": 140.712890625, "completions/mean_terminated_length": 138.47177200317384, "completions/min_length": 62.9, "completions/min_terminated_length": 62.9, "entropy": 0.037411584565415976, "epoch": 29.635974304068522, "frac_reward_zero_std": 0.94375, "grad_norm": 0.23828125, "learning_rate": 8.6161e-06, "loss": -0.0067, "num_tokens": 1362961536.0, "reward": 1.0826757967472076, "reward_std": 0.07531046301592141, "rewards/reward_accuracy/mean": 0.9828125, "rewards/reward_accuracy/std": 0.07416215538978577, "rewards/reward_format/mean": 0.09986328259110451, "rewards/reward_format/std": 0.0018196488032117485, "sampling/importance_sampling_ratio/max": 2.434635078907013, "sampling/importance_sampling_ratio/mean": 0.9927213013172149, "sampling/importance_sampling_ratio/min": 0.18138984739780425, "sampling/sampling_logp_difference/max": 0.9953630864620209, "sampling/sampling_logp_difference/mean": 0.0039002100937068464, "step": 13840, "step_time": 5.106325158395339 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0015625, "completions/max_length": 814.8, "completions/max_terminated_length": 559.4, "completions/mean_length": 143.81953125, "completions/mean_terminated_length": 140.8477569580078, "completions/min_length": 71.7, "completions/min_terminated_length": 71.7, "entropy": 0.03221951089799404, "epoch": 29.657387580299787, "frac_reward_zero_std": 0.95, "grad_norm": 0.0, "learning_rate": 8.6151e-06, "loss": -0.0009, "num_tokens": 1363845410.0, "reward": 1.0846484661102296, "reward_std": 0.09493613764643669, "rewards/reward_accuracy/mean": 0.984765625, "rewards/reward_accuracy/std": 0.09382762089371681, "rewards/reward_format/mean": 0.09988281428813935, "rewards/reward_format/std": 0.0015071487054228784, "sampling/importance_sampling_ratio/max": 2.320539891719818, "sampling/importance_sampling_ratio/mean": 0.9829268217086792, "sampling/importance_sampling_ratio/min": 0.15675504505634308, "sampling/sampling_logp_difference/max": 0.9643440008163452, "sampling/sampling_logp_difference/mean": 0.0034470703219994904, "step": 13850, "step_time": 4.210993354400853 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0015625, "completions/max_length": 922.6, "completions/max_terminated_length": 835.1, "completions/mean_length": 143.306640625, "completions/mean_terminated_length": 140.34449462890626, "completions/min_length": 66.3, "completions/min_terminated_length": 66.3, "entropy": 0.03469389732927084, "epoch": 29.678800856531048, "frac_reward_zero_std": 0.95625, "grad_norm": 0.1953125, "learning_rate": 8.614100000000001e-06, "loss": -0.0009, "num_tokens": 1364727091.0, "reward": 1.061582052707672, "reward_std": 0.15299849361181259, "rewards/reward_accuracy/mean": 0.96171875, "rewards/reward_accuracy/std": 0.15243870317935942, "rewards/reward_format/mean": 0.09986328259110451, "rewards/reward_format/std": 0.0018196487100794912, "sampling/importance_sampling_ratio/max": 2.548158860206604, "sampling/importance_sampling_ratio/mean": 0.9914948284626007, "sampling/importance_sampling_ratio/min": 0.16924354210495948, "sampling/sampling_logp_difference/max": 0.9998377084732055, "sampling/sampling_logp_difference/mean": 0.003750290279276669, "step": 13860, "step_time": 4.721280092684902 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00703125, "completions/max_length": 1518.5, "completions/max_terminated_length": 1178.2, "completions/mean_length": 163.95859375, "completions/mean_terminated_length": 150.6374038696289, "completions/min_length": 62.4, "completions/min_terminated_length": 62.4, "entropy": 0.04255421543493867, "epoch": 29.700214132762312, "frac_reward_zero_std": 0.9125, "grad_norm": 0.0, "learning_rate": 8.6131e-06, "loss": -0.0044, "num_tokens": 1365665033.0, "reward": 1.0670117437839508, "reward_std": 0.13238815665245057, "rewards/reward_accuracy/mean": 0.967578125, "rewards/reward_accuracy/std": 0.1294404074549675, "rewards/reward_format/mean": 0.09943359568715096, "rewards/reward_format/std": 0.0052816096926108, "sampling/importance_sampling_ratio/max": 2.5598702430725098, "sampling/importance_sampling_ratio/mean": 0.9820736348628998, "sampling/importance_sampling_ratio/min": 0.0502091963775456, "sampling/sampling_logp_difference/max": 1.0061869025230408, "sampling/sampling_logp_difference/mean": 0.004167274129576981, "step": 13870, "step_time": 7.314270482506254 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001171875, "completions/max_length": 836.1, "completions/max_terminated_length": 816.5, "completions/mean_length": 152.337890625, "completions/mean_terminated_length": 150.21431579589844, "completions/min_length": 68.4, "completions/min_terminated_length": 68.4, "entropy": 0.03529180029872805, "epoch": 29.721627408993577, "frac_reward_zero_std": 0.95625, "grad_norm": 0.1875, "learning_rate": 8.612100000000002e-06, "loss": -0.0026, "num_tokens": 1366570186.0, "reward": 1.059648460149765, "reward_std": 0.14474062919616698, "rewards/reward_accuracy/mean": 0.959765625, "rewards/reward_accuracy/std": 0.14448220133781434, "rewards/reward_format/mean": 0.09988281354308129, "rewards/reward_format/std": 0.0010782782919704914, "sampling/importance_sampling_ratio/max": 2.3530782222747804, "sampling/importance_sampling_ratio/mean": 0.9870111525058747, "sampling/importance_sampling_ratio/min": 0.20290366411209107, "sampling/sampling_logp_difference/max": 0.9032480597496033, "sampling/sampling_logp_difference/mean": 0.0037497363984584807, "step": 13880, "step_time": 4.279399681396899 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003125, "completions/max_length": 1362.8, "completions/max_terminated_length": 1005.4, "completions/mean_length": 159.2375, "completions/mean_terminated_length": 153.366162109375, "completions/min_length": 67.9, "completions/min_terminated_length": 67.9, "entropy": 0.040637762588448825, "epoch": 29.74304068522484, "frac_reward_zero_std": 0.9, "grad_norm": 0.0, "learning_rate": 8.611100000000001e-06, "loss": -0.0081, "num_tokens": 1367492906.0, "reward": 1.0591406404972077, "reward_std": 0.15913919880986213, "rewards/reward_accuracy/mean": 0.959375, "rewards/reward_accuracy/std": 0.15759406089782715, "rewards/reward_format/mean": 0.0997656263411045, "rewards/reward_format/std": 0.003142323181964457, "sampling/importance_sampling_ratio/max": 2.4714740753173827, "sampling/importance_sampling_ratio/mean": 0.9847789168357849, "sampling/importance_sampling_ratio/min": 0.15087331235408782, "sampling/sampling_logp_difference/max": 0.9040522098541259, "sampling/sampling_logp_difference/mean": 0.00400087651796639, "step": 13890, "step_time": 6.675752812504652 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001953125, "completions/max_length": 1039.8, "completions/max_terminated_length": 854.9, "completions/mean_length": 144.226953125, "completions/mean_terminated_length": 140.5423156738281, "completions/min_length": 62.3, "completions/min_terminated_length": 62.3, "entropy": 0.03443942710291594, "epoch": 29.764453961456102, "frac_reward_zero_std": 0.9375, "grad_norm": 0.1240234375, "learning_rate": 8.6101e-06, "loss": -0.0089, "num_tokens": 1368378495.0, "reward": 1.0752734541893005, "reward_std": 0.12233409881591797, "rewards/reward_accuracy/mean": 0.975390625, "rewards/reward_accuracy/std": 0.12126294746994973, "rewards/reward_format/mean": 0.09988281354308129, "rewards/reward_format/std": 0.0015071486588567496, "sampling/importance_sampling_ratio/max": 2.3296689867973326, "sampling/importance_sampling_ratio/mean": 0.9885314226150512, "sampling/importance_sampling_ratio/min": 0.08610992282629013, "sampling/sampling_logp_difference/max": 0.942397129535675, "sampling/sampling_logp_difference/mean": 0.0036117164883762596, "step": 13900, "step_time": 5.325863478888641 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00078125, "completions/max_length": 1100.2, "completions/max_terminated_length": 1079.4, "completions/mean_length": 152.4640625, "completions/mean_terminated_length": 151.00467987060546, "completions/min_length": 68.1, "completions/min_terminated_length": 68.1, "entropy": 0.03950352752581239, "epoch": 29.785867237687366, "frac_reward_zero_std": 0.95, "grad_norm": 0.3359375, "learning_rate": 8.6091e-06, "loss": 0.0012, "num_tokens": 1369288099.0, "reward": 1.088964855670929, "reward_std": 0.06977556198835373, "rewards/reward_accuracy/mean": 0.9890625, "rewards/reward_accuracy/std": 0.06940531507134437, "rewards/reward_format/mean": 0.09990234449505805, "rewards/reward_format/std": 0.0013226743321865797, "sampling/importance_sampling_ratio/max": 2.565922474861145, "sampling/importance_sampling_ratio/mean": 0.991613632440567, "sampling/importance_sampling_ratio/min": 0.10025463700294494, "sampling/sampling_logp_difference/max": 1.0150130987167358, "sampling/sampling_logp_difference/mean": 0.003933209157548845, "step": 13910, "step_time": 5.46372547117935 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0109375, "completions/max_length": 1450.7, "completions/max_terminated_length": 1211.3, "completions/mean_length": 182.080859375, "completions/mean_terminated_length": 161.7768127441406, "completions/min_length": 67.0, "completions/min_terminated_length": 67.0, "entropy": 0.04720613935496658, "epoch": 29.80728051391863, "frac_reward_zero_std": 0.93125, "grad_norm": 0.0, "learning_rate": 8.6081e-06, "loss": -0.0055, "num_tokens": 1370279586.0, "reward": 1.0658984541893006, "reward_std": 0.13938942924141884, "rewards/reward_accuracy/mean": 0.966796875, "rewards/reward_accuracy/std": 0.13582222610712053, "rewards/reward_format/mean": 0.09910156279802322, "rewards/reward_format/std": 0.0066646986408159135, "sampling/importance_sampling_ratio/max": 2.4257188200950623, "sampling/importance_sampling_ratio/mean": 0.9854755938053131, "sampling/importance_sampling_ratio/min": 0.06195857785642147, "sampling/sampling_logp_difference/max": 1.0547230541706085, "sampling/sampling_logp_difference/mean": 0.004000648320652544, "step": 13920, "step_time": 7.365357142503489 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.009765625, "completions/max_length": 1747.7, "completions/max_terminated_length": 1327.0, "completions/mean_length": 183.973828125, "completions/mean_terminated_length": 165.77772827148436, "completions/min_length": 64.8, "completions/min_terminated_length": 64.8, "entropy": 0.04807126496452838, "epoch": 29.82869379014989, "frac_reward_zero_std": 0.8875, "grad_norm": 0.412109375, "learning_rate": 8.607100000000001e-06, "loss": -0.005, "num_tokens": 1371273455.0, "reward": 1.043750023841858, "reward_std": 0.19735948741436005, "rewards/reward_accuracy/mean": 0.94453125, "rewards/reward_accuracy/std": 0.19494493156671525, "rewards/reward_format/mean": 0.09921875149011612, "rewards/reward_format/std": 0.0051782091846689585, "sampling/importance_sampling_ratio/max": 2.581442713737488, "sampling/importance_sampling_ratio/mean": 0.9834695518016815, "sampling/importance_sampling_ratio/min": 0.03667011111974716, "sampling/sampling_logp_difference/max": 1.305296528339386, "sampling/sampling_logp_difference/mean": 0.004197004553861916, "step": 13930, "step_time": 8.489862579799956 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003515625, "completions/max_length": 1689.2, "completions/max_terminated_length": 1524.4, "completions/mean_length": 158.8515625, "completions/mean_terminated_length": 152.22531127929688, "completions/min_length": 64.5, "completions/min_terminated_length": 64.5, "entropy": 0.042860653321258727, "epoch": 29.850107066381156, "frac_reward_zero_std": 0.9125, "grad_norm": 0.443359375, "learning_rate": 8.6061e-06, "loss": -0.0099, "num_tokens": 1372194963.0, "reward": 1.0774804830551148, "reward_std": 0.11626238971948624, "rewards/reward_accuracy/mean": 0.977734375, "rewards/reward_accuracy/std": 0.11512843519449234, "rewards/reward_format/mean": 0.09974609464406967, "rewards/reward_format/std": 0.002635794528760016, "sampling/importance_sampling_ratio/max": 2.4503477215766907, "sampling/importance_sampling_ratio/mean": 0.9894273042678833, "sampling/importance_sampling_ratio/min": 0.10578839145600796, "sampling/sampling_logp_difference/max": 0.9848827362060547, "sampling/sampling_logp_difference/mean": 0.0041358743095770475, "step": 13940, "step_time": 7.96898280690948 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.002734375, "completions/max_length": 964.2, "completions/max_terminated_length": 778.7, "completions/mean_length": 151.875390625, "completions/mean_terminated_length": 146.74038696289062, "completions/min_length": 64.8, "completions/min_terminated_length": 64.8, "entropy": 0.03673561993055045, "epoch": 29.87152034261242, "frac_reward_zero_std": 0.93125, "grad_norm": 0.228515625, "learning_rate": 8.6051e-06, "loss": -0.0035, "num_tokens": 1373103396.0, "reward": 1.0752344012260437, "reward_std": 0.11313083842396736, "rewards/reward_accuracy/mean": 0.975390625, "rewards/reward_accuracy/std": 0.112538281083107, "rewards/reward_format/mean": 0.09984375163912773, "rewards/reward_format/std": 0.0012426253408193589, "sampling/importance_sampling_ratio/max": 2.5059892177581786, "sampling/importance_sampling_ratio/mean": 0.9942259967327118, "sampling/importance_sampling_ratio/min": 0.17677710354328155, "sampling/sampling_logp_difference/max": 0.9959556818008423, "sampling/sampling_logp_difference/mean": 0.003855749382637441, "step": 13950, "step_time": 4.9719719339133 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 2.9179875582485693e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 2.9179875582485693e-06, "completions/clipped_ratio": 0.009375, "completions/max_length": 1304.8, "completions/max_terminated_length": 1174.2, "completions/mean_length": 180.8609375, "completions/mean_terminated_length": 163.6429412841797, "completions/min_length": 66.4, "completions/min_terminated_length": 66.4, "entropy": 0.048564502689987424, "epoch": 29.89293361884368, "frac_reward_zero_std": 0.89375, "grad_norm": 0.07763671875, "learning_rate": 8.604100000000001e-06, "loss": 0.001, "num_tokens": 1374086016.0, "reward": 1.0571093916893006, "reward_std": 0.17092895731329918, "rewards/reward_accuracy/mean": 0.9578125, "rewards/reward_accuracy/std": 0.1689176708459854, "rewards/reward_format/mean": 0.09929687604308128, "rewards/reward_format/std": 0.004173422581516206, "sampling/importance_sampling_ratio/max": 2.427391302585602, "sampling/importance_sampling_ratio/mean": 0.9912963271141052, "sampling/importance_sampling_ratio/min": 0.07453354671597481, "sampling/sampling_logp_difference/max": 1.167798388004303, "sampling/sampling_logp_difference/mean": 0.004209204600192607, "step": 13960, "step_time": 6.6350509376876285 }, { "clip_ratio/high_max": 3.357028435857501e-05, "clip_ratio/high_mean": 4.196285544821876e-06, "clip_ratio/low_mean": 5.146197395333729e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 9.342482940155605e-06, "completions/clipped_ratio": 0.00625, "completions/max_length": 982.0, "completions/max_terminated_length": 693.0, "completions/mean_length": 153.7484375, "completions/mean_terminated_length": 141.9353057861328, "completions/min_length": 68.5, "completions/min_terminated_length": 68.5, "entropy": 0.03756462312303484, "epoch": 29.914346895074946, "frac_reward_zero_std": 0.93125, "grad_norm": 0.05908203125, "learning_rate": 8.6031e-06, "loss": -0.0048, "num_tokens": 1374997964.0, "reward": 1.068046897649765, "reward_std": 0.13081349804997444, "rewards/reward_accuracy/mean": 0.968359375, "rewards/reward_accuracy/std": 0.12926168441772462, "rewards/reward_format/mean": 0.09968750104308129, "rewards/reward_format/std": 0.0024822523118928075, "sampling/importance_sampling_ratio/max": 2.487934136390686, "sampling/importance_sampling_ratio/mean": 0.9816307187080383, "sampling/importance_sampling_ratio/min": 0.11752406507730484, "sampling/sampling_logp_difference/max": 0.9825291156768798, "sampling/sampling_logp_difference/mean": 0.003773762448690832, "step": 13970, "step_time": 5.074303537697415 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001953125, "completions/max_length": 1202.3, "completions/max_terminated_length": 988.6, "completions/mean_length": 146.57421875, "completions/mean_terminated_length": 142.87630615234374, "completions/min_length": 61.7, "completions/min_terminated_length": 61.7, "entropy": 0.03802272372413427, "epoch": 29.93576017130621, "frac_reward_zero_std": 0.93125, "grad_norm": 0.80078125, "learning_rate": 8.6021e-06, "loss": 0.0018, "num_tokens": 1375893418.0, "reward": 1.0814844012260436, "reward_std": 0.09730511307716369, "rewards/reward_accuracy/mean": 0.981640625, "rewards/reward_accuracy/std": 0.0965939611196518, "rewards/reward_format/mean": 0.09984375163912773, "rewards/reward_format/std": 0.0019482230301946402, "sampling/importance_sampling_ratio/max": 2.3463871717453, "sampling/importance_sampling_ratio/mean": 1.0017538487911224, "sampling/importance_sampling_ratio/min": 0.12595587968826294, "sampling/sampling_logp_difference/max": 0.9263225078582764, "sampling/sampling_logp_difference/mean": 0.00393057968467474, "step": 13980, "step_time": 5.71723354961141 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 1.0550956403676537e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 1.0550956403676537e-06, "completions/clipped_ratio": 0.007421875, "completions/max_length": 1514.2, "completions/max_terminated_length": 1402.6, "completions/mean_length": 165.369140625, "completions/mean_terminated_length": 151.35939025878906, "completions/min_length": 62.0, "completions/min_terminated_length": 62.0, "entropy": 0.04469506368041039, "epoch": 29.957173447537475, "frac_reward_zero_std": 0.90625, "grad_norm": 0.29296875, "learning_rate": 8.601100000000001e-06, "loss": -0.0104, "num_tokens": 1376839659.0, "reward": 1.080625021457672, "reward_std": 0.11276706010103225, "rewards/reward_accuracy/mean": 0.98125, "rewards/reward_accuracy/std": 0.1096247337758541, "rewards/reward_format/mean": 0.09937500134110451, "rewards/reward_format/std": 0.004388956585898995, "sampling/importance_sampling_ratio/max": 2.680487108230591, "sampling/importance_sampling_ratio/mean": 0.9837688207626343, "sampling/importance_sampling_ratio/min": 0.09483756422996521, "sampling/sampling_logp_difference/max": 1.1869612276554107, "sampling/sampling_logp_difference/mean": 0.004176798393018544, "step": 13990, "step_time": 7.442111324207508 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.006640625, "completions/max_length": 1313.0, "completions/max_terminated_length": 1176.9, "completions/mean_length": 165.566015625, "completions/mean_terminated_length": 153.13983612060548, "completions/min_length": 69.2, "completions/min_terminated_length": 69.2, "entropy": 0.04118067636154592, "epoch": 29.978586723768736, "frac_reward_zero_std": 0.9, "grad_norm": 0.2373046875, "learning_rate": 8.600100000000001e-06, "loss": -0.0063, "num_tokens": 1377786068.0, "reward": 1.072519552707672, "reward_std": 0.13436340987682344, "rewards/reward_accuracy/mean": 0.973046875, "rewards/reward_accuracy/std": 0.1320886418223381, "rewards/reward_format/mean": 0.0994726575911045, "rewards/reward_format/std": 0.004553568991832435, "sampling/importance_sampling_ratio/max": 2.4721694946289063, "sampling/importance_sampling_ratio/mean": 0.9936583817005158, "sampling/importance_sampling_ratio/min": 0.09542231485247613, "sampling/sampling_logp_difference/max": 1.068565058708191, "sampling/sampling_logp_difference/mean": 0.003918576799333095, "step": 14000, "step_time": 6.759984489303315 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00078125, "completions/max_length": 998.3, "completions/max_terminated_length": 704.4, "completions/mean_length": 145.9015625, "completions/mean_terminated_length": 144.40902099609374, "completions/min_length": 63.6, "completions/min_terminated_length": 63.6, "entropy": 0.03674996355548501, "epoch": 30.0, "frac_reward_zero_std": 0.9125, "grad_norm": 0.0, "learning_rate": 8.5991e-06, "loss": -0.0027, "num_tokens": 1378675176.0, "reward": 1.0722070455551147, "reward_std": 0.12313387393951417, "rewards/reward_accuracy/mean": 0.972265625, "rewards/reward_accuracy/std": 0.12256295755505561, "rewards/reward_format/mean": 0.09994140714406967, "rewards/reward_format/std": 0.0009375000605359674, "sampling/importance_sampling_ratio/max": 2.395489513874054, "sampling/importance_sampling_ratio/mean": 0.9945017576217652, "sampling/importance_sampling_ratio/min": 0.1409907028079033, "sampling/sampling_logp_difference/max": 1.3138140916824341, "sampling/sampling_logp_difference/mean": 0.0037602039985358713, "step": 14010, "step_time": 4.85200586328574 }, { "clip_ratio/high_max": 1.4678252045996488e-05, "clip_ratio/high_mean": 1.834781505749561e-06, "clip_ratio/low_mean": 2.6179592168773525e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 4.4527407226269135e-06, "completions/clipped_ratio": 0.008984375, "completions/max_length": 1156.5, "completions/max_terminated_length": 613.2, "completions/mean_length": 154.123828125, "completions/mean_terminated_length": 137.1219253540039, "completions/min_length": 62.6, "completions/min_terminated_length": 62.6, "entropy": 0.03649476072750986, "epoch": 30.021413276231264, "frac_reward_zero_std": 0.93125, "grad_norm": 0.0, "learning_rate": 8.5981e-06, "loss": -0.0029, "num_tokens": 1379590661.0, "reward": 1.0656445503234864, "reward_std": 0.14455204978585243, "rewards/reward_accuracy/mean": 0.96640625, "rewards/reward_accuracy/std": 0.141041848808527, "rewards/reward_format/mean": 0.0992382824420929, "rewards/reward_format/std": 0.004728732071816922, "sampling/importance_sampling_ratio/max": 2.3962196350097655, "sampling/importance_sampling_ratio/mean": 0.9939972579479217, "sampling/importance_sampling_ratio/min": 0.21644495725631713, "sampling/sampling_logp_difference/max": 0.9061021387577057, "sampling/sampling_logp_difference/mean": 0.0037045964039862157, "step": 14020, "step_time": 5.901907270704396 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.004296875, "completions/max_length": 1001.1, "completions/max_terminated_length": 844.0, "completions/mean_length": 147.26640625, "completions/mean_terminated_length": 139.14141235351562, "completions/min_length": 63.4, "completions/min_terminated_length": 63.4, "entropy": 0.03616379899904132, "epoch": 30.042826552462525, "frac_reward_zero_std": 0.9375, "grad_norm": 0.43359375, "learning_rate": 8.597100000000001e-06, "loss": -0.0029, "num_tokens": 1380481631.0, "reward": 1.065195333957672, "reward_std": 0.14904991164803505, "rewards/reward_accuracy/mean": 0.965625, "rewards/reward_accuracy/std": 0.14696751460433005, "rewards/reward_format/mean": 0.09957031384110451, "rewards/reward_format/std": 0.0025662324391305447, "sampling/importance_sampling_ratio/max": 2.335717189311981, "sampling/importance_sampling_ratio/mean": 0.9793357670307159, "sampling/importance_sampling_ratio/min": 0.13418220742605627, "sampling/sampling_logp_difference/max": 1.3550223410129547, "sampling/sampling_logp_difference/mean": 0.003952082362957299, "step": 14030, "step_time": 5.019115884506027 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00234375, "completions/max_length": 1263.2, "completions/max_terminated_length": 1187.4, "completions/mean_length": 159.663671875, "completions/mean_terminated_length": 155.35486755371093, "completions/min_length": 65.5, "completions/min_terminated_length": 65.5, "entropy": 0.04014863681513816, "epoch": 30.06423982869379, "frac_reward_zero_std": 0.9125, "grad_norm": 0.0, "learning_rate": 8.5961e-06, "loss": -0.0005, "num_tokens": 1381416050.0, "reward": 1.0627148389816283, "reward_std": 0.13998157232999803, "rewards/reward_accuracy/mean": 0.962890625, "rewards/reward_accuracy/std": 0.1391410320997238, "rewards/reward_format/mean": 0.09982421845197678, "rewards/reward_format/std": 0.0021842263638973238, "sampling/importance_sampling_ratio/max": 2.4477888703346253, "sampling/importance_sampling_ratio/mean": 0.985552716255188, "sampling/importance_sampling_ratio/min": 0.0701983296778053, "sampling/sampling_logp_difference/max": 1.0176236629486084, "sampling/sampling_logp_difference/mean": 0.003991411393508315, "step": 14040, "step_time": 6.122020601696567 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003125, "completions/max_length": 1294.5, "completions/max_terminated_length": 1133.1, "completions/mean_length": 148.184375, "completions/mean_terminated_length": 142.3123550415039, "completions/min_length": 65.8, "completions/min_terminated_length": 65.8, "entropy": 0.03975590779446066, "epoch": 30.085653104925054, "frac_reward_zero_std": 0.91875, "grad_norm": 0.23046875, "learning_rate": 8.5951e-06, "loss": -0.0056, "num_tokens": 1382312266.0, "reward": 1.0517187714576721, "reward_std": 0.17840798199176788, "rewards/reward_accuracy/mean": 0.951953125, "rewards/reward_accuracy/std": 0.17769744396209716, "rewards/reward_format/mean": 0.0997656263411045, "rewards/reward_format/std": 0.0021712252171710135, "sampling/importance_sampling_ratio/max": 2.5417781829833985, "sampling/importance_sampling_ratio/mean": 0.9955795109272003, "sampling/importance_sampling_ratio/min": 0.1008726954460144, "sampling/sampling_logp_difference/max": 1.1477097630500794, "sampling/sampling_logp_difference/mean": 0.003937347163446248, "step": 14050, "step_time": 6.325891975895502 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0046875, "completions/max_length": 982.5, "completions/max_terminated_length": 862.0, "completions/mean_length": 161.65625, "completions/mean_terminated_length": 152.9273208618164, "completions/min_length": 65.6, "completions/min_terminated_length": 65.6, "entropy": 0.03755353898741305, "epoch": 30.10706638115632, "frac_reward_zero_std": 0.9375, "grad_norm": 0.0, "learning_rate": 8.594100000000001e-06, "loss": -0.0066, "num_tokens": 1383249498.0, "reward": 1.0746484637260436, "reward_std": 0.10707046792376787, "rewards/reward_accuracy/mean": 0.975, "rewards/reward_accuracy/std": 0.10481263026595115, "rewards/reward_format/mean": 0.09964843913912773, "rewards/reward_format/std": 0.0032598919468000533, "sampling/importance_sampling_ratio/max": 2.5738895654678347, "sampling/importance_sampling_ratio/mean": 0.9917259812355042, "sampling/importance_sampling_ratio/min": 0.1264908045530319, "sampling/sampling_logp_difference/max": 1.0110350728034974, "sampling/sampling_logp_difference/mean": 0.003768993401899934, "step": 14060, "step_time": 5.0038396617863325 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00625, "completions/max_length": 1265.8, "completions/max_terminated_length": 812.2, "completions/mean_length": 161.7203125, "completions/mean_terminated_length": 149.99980773925782, "completions/min_length": 65.7, "completions/min_terminated_length": 65.7, "entropy": 0.039790943777188656, "epoch": 30.12847965738758, "frac_reward_zero_std": 0.9375, "grad_norm": 0.0, "learning_rate": 8.5931e-06, "loss": -0.0039, "num_tokens": 1384187998.0, "reward": 1.080468761920929, "reward_std": 0.09731297641992569, "rewards/reward_accuracy/mean": 0.980859375, "rewards/reward_accuracy/std": 0.09462623223662377, "rewards/reward_format/mean": 0.09960937574505806, "rewards/reward_format/std": 0.004018527106381953, "sampling/importance_sampling_ratio/max": 2.486131119728088, "sampling/importance_sampling_ratio/mean": 0.9849616229534149, "sampling/importance_sampling_ratio/min": 0.12668245229870082, "sampling/sampling_logp_difference/max": 1.2733551144599915, "sampling/sampling_logp_difference/mean": 0.0038890611845999955, "step": 14070, "step_time": 6.433577680992312 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00546875, "completions/max_length": 1028.2, "completions/max_terminated_length": 911.6, "completions/mean_length": 157.18671875, "completions/mean_terminated_length": 146.875146484375, "completions/min_length": 66.1, "completions/min_terminated_length": 66.1, "entropy": 0.04023089401889592, "epoch": 30.149892933618844, "frac_reward_zero_std": 0.9375, "grad_norm": 0.1982421875, "learning_rate": 8.5921e-06, "loss": -0.0033, "num_tokens": 1385107148.0, "reward": 1.0839843988418578, "reward_std": 0.08052003756165504, "rewards/reward_accuracy/mean": 0.984375, "rewards/reward_accuracy/std": 0.07895710244774819, "rewards/reward_format/mean": 0.09960937574505806, "rewards/reward_format/std": 0.002983086928725243, "sampling/importance_sampling_ratio/max": 2.431064188480377, "sampling/importance_sampling_ratio/mean": 0.9954243302345276, "sampling/importance_sampling_ratio/min": 0.13557093935087322, "sampling/sampling_logp_difference/max": 0.9201222062110901, "sampling/sampling_logp_difference/mean": 0.0036937000462785364, "step": 14080, "step_time": 5.357477844497771 }, { "clip_ratio/high_max": 1.6979081556200982e-05, "clip_ratio/high_mean": 2.122385194525123e-06, "clip_ratio/low_mean": 3.652407713161665e-07, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 2.487625965841289e-06, "completions/clipped_ratio": 0.00703125, "completions/max_length": 1507.3, "completions/max_terminated_length": 1084.0, "completions/mean_length": 157.34765625, "completions/mean_terminated_length": 144.2251434326172, "completions/min_length": 65.6, "completions/min_terminated_length": 65.6, "entropy": 0.04376526079140604, "epoch": 30.17130620985011, "frac_reward_zero_std": 0.91875, "grad_norm": 0.0478515625, "learning_rate": 8.591100000000001e-06, "loss": -0.0029, "num_tokens": 1386028470.0, "reward": 1.0650000154972077, "reward_std": 0.13704145327210426, "rewards/reward_accuracy/mean": 0.965625, "rewards/reward_accuracy/std": 0.1341216430068016, "rewards/reward_format/mean": 0.09937500134110451, "rewards/reward_format/std": 0.005139377177692949, "sampling/importance_sampling_ratio/max": 2.5779218673706055, "sampling/importance_sampling_ratio/mean": 0.9910317301750183, "sampling/importance_sampling_ratio/min": 0.0852734487503767, "sampling/sampling_logp_difference/max": 1.0184229731559753, "sampling/sampling_logp_difference/mean": 0.004162764083594084, "step": 14090, "step_time": 7.288845029807999 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.002734375, "completions/max_length": 914.1, "completions/max_terminated_length": 807.7, "completions/mean_length": 143.546875, "completions/mean_terminated_length": 138.3842330932617, "completions/min_length": 62.5, "completions/min_terminated_length": 62.5, "entropy": 0.03365111204329878, "epoch": 30.19271948608137, "frac_reward_zero_std": 0.95625, "grad_norm": 0.267578125, "learning_rate": 8.590100000000001e-06, "loss": 0.0004, "num_tokens": 1386906446.0, "reward": 1.0779883146286011, "reward_std": 0.10466228723526001, "rewards/reward_accuracy/mean": 0.978125, "rewards/reward_accuracy/std": 0.10409004241228104, "rewards/reward_format/mean": 0.09986328333616257, "rewards/reward_format/std": 0.0014212878420948982, "sampling/importance_sampling_ratio/max": 2.512523889541626, "sampling/importance_sampling_ratio/mean": 0.9987329959869384, "sampling/importance_sampling_ratio/min": 0.1361880786716938, "sampling/sampling_logp_difference/max": 1.086052918434143, "sampling/sampling_logp_difference/mean": 0.003792333509773016, "step": 14100, "step_time": 4.615956640202785 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.002734375, "completions/max_length": 1211.7, "completions/max_terminated_length": 910.2, "completions/mean_length": 153.987890625, "completions/mean_terminated_length": 148.85083923339843, "completions/min_length": 65.8, "completions/min_terminated_length": 65.8, "entropy": 0.03975742999464273, "epoch": 30.214132762312634, "frac_reward_zero_std": 0.9375, "grad_norm": 0.33203125, "learning_rate": 8.5891e-06, "loss": -0.0039, "num_tokens": 1387812143.0, "reward": 1.078398460149765, "reward_std": 0.1018158607184887, "rewards/reward_accuracy/mean": 0.978515625, "rewards/reward_accuracy/std": 0.10148641094565392, "rewards/reward_format/mean": 0.09988281354308129, "rewards/reward_format/std": 0.0009831610135734082, "sampling/importance_sampling_ratio/max": 2.233919322490692, "sampling/importance_sampling_ratio/mean": 0.9837686598300934, "sampling/importance_sampling_ratio/min": 0.06114758551120758, "sampling/sampling_logp_difference/max": 1.045470905303955, "sampling/sampling_logp_difference/mean": 0.0039591020438820125, "step": 14110, "step_time": 5.947359301292454 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0015625, "completions/max_length": 616.9, "completions/max_terminated_length": 439.7, "completions/mean_length": 133.855078125, "completions/mean_terminated_length": 130.89073638916017, "completions/min_length": 62.3, "completions/min_terminated_length": 62.3, "entropy": 0.03202334854286164, "epoch": 30.235546038543898, "frac_reward_zero_std": 0.9625, "grad_norm": 0.0, "learning_rate": 8.5881e-06, "loss": 0.0038, "num_tokens": 1388672540.0, "reward": 1.0717968940734863, "reward_std": 0.10824903398752213, "rewards/reward_accuracy/mean": 0.971875, "rewards/reward_accuracy/std": 0.10795819610357285, "rewards/reward_format/mean": 0.09992187619209289, "rewards/reward_format/std": 0.0012500001117587089, "sampling/importance_sampling_ratio/max": 2.4080016255378722, "sampling/importance_sampling_ratio/mean": 0.985862010717392, "sampling/importance_sampling_ratio/min": 0.18820060417056084, "sampling/sampling_logp_difference/max": 0.9993961870670318, "sampling/sampling_logp_difference/mean": 0.003588234889321029, "step": 14120, "step_time": 3.40057106911554 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.004296875, "completions/max_length": 1498.7, "completions/max_terminated_length": 1237.3, "completions/mean_length": 160.77109375, "completions/mean_terminated_length": 152.68561706542968, "completions/min_length": 67.2, "completions/min_terminated_length": 67.2, "entropy": 0.04354093507863581, "epoch": 30.25695931477516, "frac_reward_zero_std": 0.91875, "grad_norm": 0.208984375, "learning_rate": 8.587100000000001e-06, "loss": -0.0071, "num_tokens": 1389604962.0, "reward": 1.0567773699760437, "reward_std": 0.17934232726693153, "rewards/reward_accuracy/mean": 0.95703125, "rewards/reward_accuracy/std": 0.17844132259488105, "rewards/reward_format/mean": 0.09974609538912774, "rewards/reward_format/std": 0.0027787382947281, "sampling/importance_sampling_ratio/max": 2.4927259922027587, "sampling/importance_sampling_ratio/mean": 0.9866882145404816, "sampling/importance_sampling_ratio/min": 0.08946277459617705, "sampling/sampling_logp_difference/max": 1.080164861679077, "sampling/sampling_logp_difference/mean": 0.004032064857892692, "step": 14130, "step_time": 7.463042471485096 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00546875, "completions/max_length": 1459.5, "completions/max_terminated_length": 1253.9, "completions/mean_length": 167.185546875, "completions/mean_terminated_length": 156.9773696899414, "completions/min_length": 67.9, "completions/min_terminated_length": 67.9, "entropy": 0.03910287707112729, "epoch": 30.278372591006423, "frac_reward_zero_std": 0.90625, "grad_norm": 0.0, "learning_rate": 8.5861e-06, "loss": -0.0067, "num_tokens": 1390556941.0, "reward": 1.0593359470367432, "reward_std": 0.17576649263501168, "rewards/reward_accuracy/mean": 0.959765625, "rewards/reward_accuracy/std": 0.17410222589969634, "rewards/reward_format/mean": 0.09957031309604644, "rewards/reward_format/std": 0.003938051778823138, "sampling/importance_sampling_ratio/max": 2.4389252066612244, "sampling/importance_sampling_ratio/mean": 0.9879510045051575, "sampling/importance_sampling_ratio/min": 0.12008569613099099, "sampling/sampling_logp_difference/max": 0.9898298263549805, "sampling/sampling_logp_difference/mean": 0.003645697166211903, "step": 14140, "step_time": 7.139663910819218 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003515625, "completions/max_length": 1163.1, "completions/max_terminated_length": 1096.3, "completions/mean_length": 158.545703125, "completions/mean_terminated_length": 151.956494140625, "completions/min_length": 66.6, "completions/min_terminated_length": 66.6, "entropy": 0.040178249962627886, "epoch": 30.299785867237688, "frac_reward_zero_std": 0.91875, "grad_norm": 0.1865234375, "learning_rate": 8.5851e-06, "loss": -0.0044, "num_tokens": 1391475154.0, "reward": 1.0504297077655793, "reward_std": 0.17119412869215012, "rewards/reward_accuracy/mean": 0.95078125, "rewards/reward_accuracy/std": 0.16949974969029427, "rewards/reward_format/mean": 0.09964843764901161, "rewards/reward_format/std": 0.003308165562339127, "sampling/importance_sampling_ratio/max": 2.479168510437012, "sampling/importance_sampling_ratio/mean": 0.9900160431861877, "sampling/importance_sampling_ratio/min": 0.13665448427200316, "sampling/sampling_logp_difference/max": 0.9801332294940949, "sampling/sampling_logp_difference/mean": 0.0038382807048037647, "step": 14150, "step_time": 5.977336377796019 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.004296875, "completions/max_length": 1265.4, "completions/max_terminated_length": 986.2, "completions/mean_length": 158.7890625, "completions/mean_terminated_length": 150.75342254638673, "completions/min_length": 63.6, "completions/min_terminated_length": 63.6, "entropy": 0.041062525333836676, "epoch": 30.321199143468952, "frac_reward_zero_std": 0.91875, "grad_norm": 0.0, "learning_rate": 8.584100000000001e-06, "loss": -0.0049, "num_tokens": 1392401622.0, "reward": 1.0853320360183716, "reward_std": 0.09095664471387863, "rewards/reward_accuracy/mean": 0.985546875, "rewards/reward_accuracy/std": 0.0894832193851471, "rewards/reward_format/mean": 0.09978515803813934, "rewards/reward_format/std": 0.002272926946170628, "sampling/importance_sampling_ratio/max": 2.3569497585296633, "sampling/importance_sampling_ratio/mean": 0.9750773966312408, "sampling/importance_sampling_ratio/min": 0.10637500584125519, "sampling/sampling_logp_difference/max": 1.1215860366821289, "sampling/sampling_logp_difference/mean": 0.00412395759485662, "step": 14160, "step_time": 6.33649731882615 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.004296875, "completions/max_length": 1294.3, "completions/max_terminated_length": 1154.7, "completions/mean_length": 154.822265625, "completions/mean_terminated_length": 146.72684020996093, "completions/min_length": 63.2, "completions/min_terminated_length": 63.2, "entropy": 0.03649824373424053, "epoch": 30.342612419700213, "frac_reward_zero_std": 0.925, "grad_norm": 0.1923828125, "learning_rate": 8.583100000000001e-06, "loss": -0.0066, "num_tokens": 1393321503.0, "reward": 1.0829492330551147, "reward_std": 0.09937904179096221, "rewards/reward_accuracy/mean": 0.983203125, "rewards/reward_accuracy/std": 0.09823757782578468, "rewards/reward_format/mean": 0.09974609464406967, "rewards/reward_format/std": 0.002373939217068255, "sampling/importance_sampling_ratio/max": 2.386985456943512, "sampling/importance_sampling_ratio/mean": 0.9873851120471955, "sampling/importance_sampling_ratio/min": 0.14734703116118908, "sampling/sampling_logp_difference/max": 1.0329522252082826, "sampling/sampling_logp_difference/mean": 0.003707513236440718, "step": 14170, "step_time": 6.398856163091841 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005078125, "completions/max_length": 1527.2, "completions/max_terminated_length": 1125.7, "completions/mean_length": 161.64453125, "completions/mean_terminated_length": 152.03629455566406, "completions/min_length": 64.0, "completions/min_terminated_length": 64.0, "entropy": 0.03915217409376055, "epoch": 30.364025695931478, "frac_reward_zero_std": 0.88125, "grad_norm": 0.0, "learning_rate": 8.5821e-06, "loss": -0.006, "num_tokens": 1394260161.0, "reward": 1.067636740207672, "reward_std": 0.14877479374408722, "rewards/reward_accuracy/mean": 0.96796875, "rewards/reward_accuracy/std": 0.14724834710359574, "rewards/reward_format/mean": 0.09966796934604645, "rewards/reward_format/std": 0.0033841135445982218, "sampling/importance_sampling_ratio/max": 2.294904100894928, "sampling/importance_sampling_ratio/mean": 0.9776871979236603, "sampling/importance_sampling_ratio/min": 0.11920144874602556, "sampling/sampling_logp_difference/max": 0.9993861556053162, "sampling/sampling_logp_difference/mean": 0.0037739319959655404, "step": 14180, "step_time": 7.322312445106218 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005078125, "completions/max_length": 1072.0, "completions/max_terminated_length": 880.8, "completions/mean_length": 153.114453125, "completions/mean_terminated_length": 143.58091583251954, "completions/min_length": 62.1, "completions/min_terminated_length": 62.1, "entropy": 0.03818146868143231, "epoch": 30.385438972162742, "frac_reward_zero_std": 0.94375, "grad_norm": 0.416015625, "learning_rate": 8.581100000000002e-06, "loss": -0.0034, "num_tokens": 1395169174.0, "reward": 1.0863476634025573, "reward_std": 0.08301939442753792, "rewards/reward_accuracy/mean": 0.98671875, "rewards/reward_accuracy/std": 0.08075315952301025, "rewards/reward_format/mean": 0.09962890669703484, "rewards/reward_format/std": 0.002921417448669672, "sampling/importance_sampling_ratio/max": 2.4285526275634766, "sampling/importance_sampling_ratio/mean": 0.9740017712116241, "sampling/importance_sampling_ratio/min": 0.028017663210630418, "sampling/sampling_logp_difference/max": 1.0469399213790893, "sampling/sampling_logp_difference/mean": 0.0038284634705632926, "step": 14190, "step_time": 5.541599258090718 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00078125, "completions/max_length": 942.2, "completions/max_terminated_length": 768.2, "completions/mean_length": 134.424609375, "completions/mean_terminated_length": 132.93560333251952, "completions/min_length": 63.2, "completions/min_terminated_length": 63.2, "entropy": 0.03249409170821309, "epoch": 30.406852248394003, "frac_reward_zero_std": 0.9625, "grad_norm": 0.0, "learning_rate": 8.580100000000001e-06, "loss": 0.0026, "num_tokens": 1396026485.0, "reward": 1.094492208957672, "reward_std": 0.04780395328998566, "rewards/reward_accuracy/mean": 0.99453125, "rewards/reward_accuracy/std": 0.0475763201713562, "rewards/reward_format/mean": 0.0999609388411045, "rewards/reward_format/std": 0.0006250000558793544, "sampling/importance_sampling_ratio/max": 2.546859622001648, "sampling/importance_sampling_ratio/mean": 1.004861092567444, "sampling/importance_sampling_ratio/min": 0.18050796389579774, "sampling/sampling_logp_difference/max": 1.104217517375946, "sampling/sampling_logp_difference/mean": 0.0037343008909374474, "step": 14200, "step_time": 4.712287591994391 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003125, "completions/max_length": 1646.6, "completions/max_terminated_length": 1255.0, "completions/mean_length": 165.807421875, "completions/mean_terminated_length": 159.92628631591796, "completions/min_length": 64.1, "completions/min_terminated_length": 64.1, "entropy": 0.042930258950218556, "epoch": 30.428265524625267, "frac_reward_zero_std": 0.925, "grad_norm": 0.3515625, "learning_rate": 8.5791e-06, "loss": -0.0053, "num_tokens": 1396978104.0, "reward": 1.06533203125, "reward_std": 0.1528247356414795, "rewards/reward_accuracy/mean": 0.965625, "rewards/reward_accuracy/std": 0.15085088536143304, "rewards/reward_format/mean": 0.09970703125, "rewards/reward_format/std": 0.0037956611486151814, "sampling/importance_sampling_ratio/max": 2.657397818565369, "sampling/importance_sampling_ratio/mean": 0.9815398573875427, "sampling/importance_sampling_ratio/min": 0.04849807135760784, "sampling/sampling_logp_difference/max": 1.183780950307846, "sampling/sampling_logp_difference/mean": 0.004295048536732793, "step": 14210, "step_time": 7.878322214490618 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.002734375, "completions/max_length": 1089.1, "completions/max_terminated_length": 1023.3, "completions/mean_length": 147.79453125, "completions/mean_terminated_length": 142.64700622558593, "completions/min_length": 65.1, "completions/min_terminated_length": 65.1, "entropy": 0.035939798085018994, "epoch": 30.449678800856532, "frac_reward_zero_std": 0.9125, "grad_norm": 0.1708984375, "learning_rate": 8.5781e-06, "loss": -0.0106, "num_tokens": 1397872378.0, "reward": 1.0747851848602294, "reward_std": 0.13061626702547074, "rewards/reward_accuracy/mean": 0.975, "rewards/reward_accuracy/std": 0.12950118109583855, "rewards/reward_format/mean": 0.09978515803813934, "rewards/reward_format/std": 0.0019402996636927127, "sampling/importance_sampling_ratio/max": 2.4631505608558655, "sampling/importance_sampling_ratio/mean": 0.9764104366302491, "sampling/importance_sampling_ratio/min": 0.06837615147233009, "sampling/sampling_logp_difference/max": 1.0983691692352295, "sampling/sampling_logp_difference/mean": 0.003983262553811073, "step": 14220, "step_time": 5.363998481995077 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0046875, "completions/max_length": 1495.1, "completions/max_terminated_length": 1115.0, "completions/mean_length": 160.232421875, "completions/mean_terminated_length": 151.42816772460938, "completions/min_length": 63.5, "completions/min_terminated_length": 63.5, "entropy": 0.04150299753528088, "epoch": 30.471092077087796, "frac_reward_zero_std": 0.8625, "grad_norm": 0.341796875, "learning_rate": 8.5771e-06, "loss": 0.0005, "num_tokens": 1398800365.0, "reward": 1.058593785762787, "reward_std": 0.18527790457010268, "rewards/reward_accuracy/mean": 0.958984375, "rewards/reward_accuracy/std": 0.18341542780399323, "rewards/reward_format/mean": 0.09960937723517418, "rewards/reward_format/std": 0.004056159779429436, "sampling/importance_sampling_ratio/max": 2.610993230342865, "sampling/importance_sampling_ratio/mean": 0.9853219866752625, "sampling/importance_sampling_ratio/min": 0.14653439760440962, "sampling/sampling_logp_difference/max": 1.094498097896576, "sampling/sampling_logp_difference/mean": 0.00398638416081667, "step": 14230, "step_time": 7.1935279149154665 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.002734375, "completions/max_length": 1013.5, "completions/max_terminated_length": 824.8, "completions/mean_length": 149.17109375, "completions/mean_terminated_length": 144.04983367919922, "completions/min_length": 64.3, "completions/min_terminated_length": 64.3, "entropy": 0.037010625447146596, "epoch": 30.492505353319057, "frac_reward_zero_std": 0.91875, "grad_norm": 0.0, "learning_rate": 8.5761e-06, "loss": 0.0013, "num_tokens": 1399699987.0, "reward": 1.0760547161102294, "reward_std": 0.10043881312012673, "rewards/reward_accuracy/mean": 0.976171875, "rewards/reward_accuracy/std": 0.09999415278434753, "rewards/reward_format/mean": 0.09988281428813935, "rewards/reward_format/std": 0.001387959998100996, "sampling/importance_sampling_ratio/max": 2.4788502931594847, "sampling/importance_sampling_ratio/mean": 0.9960502743721008, "sampling/importance_sampling_ratio/min": 0.1959217306226492, "sampling/sampling_logp_difference/max": 0.8386998534202575, "sampling/sampling_logp_difference/mean": 0.003682662220671773, "step": 14240, "step_time": 5.155205286297132 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005859375, "completions/max_length": 1465.0, "completions/max_terminated_length": 954.7, "completions/mean_length": 162.141796875, "completions/mean_terminated_length": 151.17756881713868, "completions/min_length": 69.1, "completions/min_terminated_length": 69.1, "entropy": 0.041263471450656654, "epoch": 30.51391862955032, "frac_reward_zero_std": 0.90625, "grad_norm": 0.0, "learning_rate": 8.5751e-06, "loss": -0.011, "num_tokens": 1400628750.0, "reward": 1.0585156679153442, "reward_std": 0.1682581566274166, "rewards/reward_accuracy/mean": 0.958984375, "rewards/reward_accuracy/std": 0.16582681536674498, "rewards/reward_format/mean": 0.09953125268220901, "rewards/reward_format/std": 0.0045461839530616995, "sampling/importance_sampling_ratio/max": 2.463644099235535, "sampling/importance_sampling_ratio/mean": 0.9933397769927979, "sampling/importance_sampling_ratio/min": 0.10353264696896076, "sampling/sampling_logp_difference/max": 1.1023980617523192, "sampling/sampling_logp_difference/mean": 0.003874020138755441, "step": 14250, "step_time": 7.052864912096993 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00546875, "completions/max_length": 1565.6, "completions/max_terminated_length": 1268.6, "completions/mean_length": 166.919921875, "completions/mean_terminated_length": 156.63842239379883, "completions/min_length": 64.9, "completions/min_terminated_length": 64.9, "entropy": 0.04317458705045283, "epoch": 30.535331905781586, "frac_reward_zero_std": 0.89375, "grad_norm": 0.2119140625, "learning_rate": 8.574100000000001e-06, "loss": -0.0081, "num_tokens": 1401573505.0, "reward": 1.0608789324760437, "reward_std": 0.17056412994861603, "rewards/reward_accuracy/mean": 0.961328125, "rewards/reward_accuracy/std": 0.16837015897035598, "rewards/reward_format/mean": 0.09955078288912773, "rewards/reward_format/std": 0.0040519454050809145, "sampling/importance_sampling_ratio/max": 2.4875369310379027, "sampling/importance_sampling_ratio/mean": 0.9937393307685852, "sampling/importance_sampling_ratio/min": 0.10828536138869822, "sampling/sampling_logp_difference/max": 1.199936068058014, "sampling/sampling_logp_difference/mean": 0.003959000110626221, "step": 14260, "step_time": 7.736222918806016 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00546875, "completions/max_length": 1101.3, "completions/max_terminated_length": 1020.1, "completions/mean_length": 151.394140625, "completions/mean_terminated_length": 141.13148040771483, "completions/min_length": 62.2, "completions/min_terminated_length": 62.2, "entropy": 0.038793611852452156, "epoch": 30.556745182012847, "frac_reward_zero_std": 0.9, "grad_norm": 0.74609375, "learning_rate": 8.573100000000001e-06, "loss": -0.0079, "num_tokens": 1402472418.0, "reward": 1.0725000262260438, "reward_std": 0.11855997070670128, "rewards/reward_accuracy/mean": 0.973046875, "rewards/reward_accuracy/std": 0.11607677713036538, "rewards/reward_format/mean": 0.09945312663912773, "rewards/reward_format/std": 0.00400675015989691, "sampling/importance_sampling_ratio/max": 2.5806321144104003, "sampling/importance_sampling_ratio/mean": 0.9863331258296967, "sampling/importance_sampling_ratio/min": 0.14389998987317085, "sampling/sampling_logp_difference/max": 0.8870960950851441, "sampling/sampling_logp_difference/mean": 0.003954344941303134, "step": 14270, "step_time": 5.427170843110071 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005859375, "completions/max_length": 1378.8, "completions/max_terminated_length": 1295.7, "completions/mean_length": 162.7796875, "completions/mean_terminated_length": 151.99131622314454, "completions/min_length": 64.3, "completions/min_terminated_length": 64.3, "entropy": 0.043924996675923464, "epoch": 30.57815845824411, "frac_reward_zero_std": 0.91875, "grad_norm": 0.318359375, "learning_rate": 8.5721e-06, "loss": -0.0081, "num_tokens": 1403403742.0, "reward": 1.072167992591858, "reward_std": 0.12352021709084511, "rewards/reward_accuracy/mean": 0.97265625, "rewards/reward_accuracy/std": 0.122162826359272, "rewards/reward_format/mean": 0.09951172024011612, "rewards/reward_format/std": 0.0034799887100234626, "sampling/importance_sampling_ratio/max": 2.534990441799164, "sampling/importance_sampling_ratio/mean": 0.9858240902423858, "sampling/importance_sampling_ratio/min": 0.08464020490646362, "sampling/sampling_logp_difference/max": 0.9043517589569092, "sampling/sampling_logp_difference/mean": 0.004053571540862322, "step": 14280, "step_time": 6.7693991981825095 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.000390625, "completions/max_length": 1055.2, "completions/max_terminated_length": 953.2, "completions/mean_length": 139.5890625, "completions/mean_terminated_length": 138.8489532470703, "completions/min_length": 65.1, "completions/min_terminated_length": 65.1, "entropy": 0.03414423915091902, "epoch": 30.599571734475376, "frac_reward_zero_std": 0.95, "grad_norm": 0.44140625, "learning_rate": 8.571100000000002e-06, "loss": -0.0032, "num_tokens": 1404272354.0, "reward": 1.0652148604393006, "reward_std": 0.15155241638422012, "rewards/reward_accuracy/mean": 0.965234375, "rewards/reward_accuracy/std": 0.15139417499303817, "rewards/reward_format/mean": 0.09998046979308128, "rewards/reward_format/std": 0.0003125000046566129, "sampling/importance_sampling_ratio/max": 2.4114781975746156, "sampling/importance_sampling_ratio/mean": 0.9899874329566956, "sampling/importance_sampling_ratio/min": 0.08881126530468464, "sampling/sampling_logp_difference/max": 1.12848904132843, "sampling/sampling_logp_difference/mean": 0.003668561391532421, "step": 14290, "step_time": 5.045809256884968 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001953125, "completions/max_length": 1249.8, "completions/max_terminated_length": 952.3, "completions/mean_length": 156.88671875, "completions/mean_terminated_length": 153.1944107055664, "completions/min_length": 68.4, "completions/min_terminated_length": 68.4, "entropy": 0.03681958529632538, "epoch": 30.620985010706637, "frac_reward_zero_std": 0.9125, "grad_norm": 0.0, "learning_rate": 8.570100000000001e-06, "loss": 0.0004, "num_tokens": 1405204272.0, "reward": 1.06904296875, "reward_std": 0.13290656581521035, "rewards/reward_accuracy/mean": 0.969140625, "rewards/reward_accuracy/std": 0.1324336640536785, "rewards/reward_format/mean": 0.09990234375, "rewards/reward_format/std": 0.0015625000698491931, "sampling/importance_sampling_ratio/max": 2.5105420351028442, "sampling/importance_sampling_ratio/mean": 0.9857699990272522, "sampling/importance_sampling_ratio/min": 0.16162517443299293, "sampling/sampling_logp_difference/max": 1.0264492630958557, "sampling/sampling_logp_difference/mean": 0.0038624198641628027, "step": 14300, "step_time": 5.938490140889189 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0015625, "completions/max_length": 1632.6, "completions/max_terminated_length": 1251.4, "completions/mean_length": 163.465625, "completions/mean_terminated_length": 160.52722625732423, "completions/min_length": 65.5, "completions/min_terminated_length": 65.5, "entropy": 0.041853742813691495, "epoch": 30.6423982869379, "frac_reward_zero_std": 0.89375, "grad_norm": 0.08642578125, "learning_rate": 8.5691e-06, "loss": -0.0063, "num_tokens": 1406138728.0, "reward": 1.0396093845367431, "reward_std": 0.20360189601778983, "rewards/reward_accuracy/mean": 0.93984375, "rewards/reward_accuracy/std": 0.2023242861032486, "rewards/reward_format/mean": 0.09976562559604644, "rewards/reward_format/std": 0.0035660746041685345, "sampling/importance_sampling_ratio/max": 2.5946651220321657, "sampling/importance_sampling_ratio/mean": 0.9884247601032257, "sampling/importance_sampling_ratio/min": 0.11136341392993927, "sampling/sampling_logp_difference/max": 1.011179769039154, "sampling/sampling_logp_difference/mean": 0.003929578140377999, "step": 14310, "step_time": 7.76850989209197 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005078125, "completions/max_length": 1464.3, "completions/max_terminated_length": 1348.9, "completions/mean_length": 166.7125, "completions/mean_terminated_length": 157.29580078125, "completions/min_length": 66.7, "completions/min_terminated_length": 66.7, "entropy": 0.04176028026267886, "epoch": 30.663811563169165, "frac_reward_zero_std": 0.8875, "grad_norm": 0.291015625, "learning_rate": 8.5681e-06, "loss": -0.0062, "num_tokens": 1407080008.0, "reward": 1.0702148497104644, "reward_std": 0.13771733567118644, "rewards/reward_accuracy/mean": 0.970703125, "rewards/reward_accuracy/std": 0.13590551540255547, "rewards/reward_format/mean": 0.09951172024011612, "rewards/reward_format/std": 0.004068794776685536, "sampling/importance_sampling_ratio/max": 2.5787261486053468, "sampling/importance_sampling_ratio/mean": 0.9762900114059448, "sampling/importance_sampling_ratio/min": 0.010199885815382004, "sampling/sampling_logp_difference/max": 0.9649402260780334, "sampling/sampling_logp_difference/mean": 0.004071128042414785, "step": 14320, "step_time": 7.1753613250999475 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.002734375, "completions/max_length": 1046.9, "completions/max_terminated_length": 982.5, "completions/mean_length": 145.90703125, "completions/mean_terminated_length": 140.75855865478516, "completions/min_length": 66.2, "completions/min_terminated_length": 66.2, "entropy": 0.03728605262003839, "epoch": 30.68522483940043, "frac_reward_zero_std": 0.95625, "grad_norm": 0.75390625, "learning_rate": 8.5671e-06, "loss": 0.0006, "num_tokens": 1407971546.0, "reward": 1.0662304759025574, "reward_std": 0.1285705268383026, "rewards/reward_accuracy/mean": 0.96640625, "rewards/reward_accuracy/std": 0.12786295488476754, "rewards/reward_format/mean": 0.09982421919703484, "rewards/reward_format/std": 0.0020003006793558598, "sampling/importance_sampling_ratio/max": 2.426810359954834, "sampling/importance_sampling_ratio/mean": 0.9953199684619903, "sampling/importance_sampling_ratio/min": 0.18137865364551545, "sampling/sampling_logp_difference/max": 0.9781936764717102, "sampling/sampling_logp_difference/mean": 0.0037084373878315093, "step": 14330, "step_time": 5.203707051899983 }, { "clip_ratio/high_max": 2.6331529807066544e-05, "clip_ratio/high_mean": 3.291441225883318e-06, "clip_ratio/low_mean": 3.2914413168327883e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 6.582882633665577e-06, "completions/clipped_ratio": 0.014453125, "completions/max_length": 1679.9, "completions/max_terminated_length": 1400.8, "completions/mean_length": 183.308984375, "completions/mean_terminated_length": 155.90799255371093, "completions/min_length": 67.7, "completions/min_terminated_length": 67.7, "entropy": 0.05225177314132452, "epoch": 30.70663811563169, "frac_reward_zero_std": 0.8875, "grad_norm": 0.3125, "learning_rate": 8.566100000000001e-06, "loss": -0.0076, "num_tokens": 1408956769.0, "reward": 1.041308629512787, "reward_std": 0.2121715120971203, "rewards/reward_accuracy/mean": 0.9421875, "rewards/reward_accuracy/std": 0.20857203975319863, "rewards/reward_format/mean": 0.09912109598517418, "rewards/reward_format/std": 0.006724751438014209, "sampling/importance_sampling_ratio/max": 2.4085671067237855, "sampling/importance_sampling_ratio/mean": 0.9747908771038055, "sampling/importance_sampling_ratio/min": 0.09055159389972686, "sampling/sampling_logp_difference/max": 1.3738100290298463, "sampling/sampling_logp_difference/mean": 0.004509385977871716, "step": 14340, "step_time": 8.259797080201679 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00234375, "completions/max_length": 1156.9, "completions/max_terminated_length": 946.1, "completions/mean_length": 144.521484375, "completions/mean_terminated_length": 140.07264862060546, "completions/min_length": 64.1, "completions/min_terminated_length": 64.1, "entropy": 0.03585155326873064, "epoch": 30.728051391862955, "frac_reward_zero_std": 0.95625, "grad_norm": 0.0, "learning_rate": 8.5651e-06, "loss": 0.0003, "num_tokens": 1409841896.0, "reward": 1.0795312762260436, "reward_std": 0.11406658217310905, "rewards/reward_accuracy/mean": 0.9796875, "rewards/reward_accuracy/std": 0.1130424827337265, "rewards/reward_format/mean": 0.09984375163912773, "rewards/reward_format/std": 0.0018290343228727578, "sampling/importance_sampling_ratio/max": 2.402958428859711, "sampling/importance_sampling_ratio/mean": 0.9939550697803498, "sampling/importance_sampling_ratio/min": 0.12312608808279038, "sampling/sampling_logp_difference/max": 1.0048543334007263, "sampling/sampling_logp_difference/mean": 0.0036587979178875686, "step": 14350, "step_time": 5.698904352509999 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003515625, "completions/max_length": 1380.9, "completions/max_terminated_length": 1067.5, "completions/mean_length": 145.700390625, "completions/mean_terminated_length": 139.03385314941406, "completions/min_length": 65.3, "completions/min_terminated_length": 65.3, "entropy": 0.04055021551903337, "epoch": 30.74946466809422, "frac_reward_zero_std": 0.925, "grad_norm": 0.0712890625, "learning_rate": 8.564100000000002e-06, "loss": -0.0094, "num_tokens": 1410728393.0, "reward": 1.0794140696525574, "reward_std": 0.11014747396111488, "rewards/reward_accuracy/mean": 0.9796875, "rewards/reward_accuracy/std": 0.10861148983240128, "rewards/reward_format/mean": 0.09972656294703483, "rewards/reward_format/std": 0.003308100183494389, "sampling/importance_sampling_ratio/max": 2.531111168861389, "sampling/importance_sampling_ratio/mean": 0.9836588084697724, "sampling/importance_sampling_ratio/min": 0.14409072063863276, "sampling/sampling_logp_difference/max": 0.9290401339530945, "sampling/sampling_logp_difference/mean": 0.004185613989830017, "step": 14360, "step_time": 6.773121274707956 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001953125, "completions/max_length": 1232.2, "completions/max_terminated_length": 831.3, "completions/mean_length": 148.498046875, "completions/mean_terminated_length": 144.78525390625, "completions/min_length": 65.2, "completions/min_terminated_length": 65.2, "entropy": 0.03407066017389297, "epoch": 30.77087794432548, "frac_reward_zero_std": 0.95, "grad_norm": 0.0, "learning_rate": 8.563100000000001e-06, "loss": -0.0008, "num_tokens": 1411624308.0, "reward": 1.065917980670929, "reward_std": 0.13862984403967857, "rewards/reward_accuracy/mean": 0.966015625, "rewards/reward_accuracy/std": 0.13775658905506133, "rewards/reward_format/mean": 0.09990234449505805, "rewards/reward_format/std": 0.001562500116415322, "sampling/importance_sampling_ratio/max": 2.548479640483856, "sampling/importance_sampling_ratio/mean": 0.9996628522872925, "sampling/importance_sampling_ratio/min": 0.15582848023623228, "sampling/sampling_logp_difference/max": 1.0499410271644591, "sampling/sampling_logp_difference/mean": 0.003715303563512862, "step": 14370, "step_time": 6.053890263609356 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0015625, "completions/max_length": 1015.3, "completions/max_terminated_length": 943.2, "completions/mean_length": 147.973828125, "completions/mean_terminated_length": 145.02740173339845, "completions/min_length": 64.1, "completions/min_terminated_length": 64.1, "entropy": 0.03627975289709866, "epoch": 30.792291220556745, "frac_reward_zero_std": 0.93125, "grad_norm": 0.158203125, "learning_rate": 8.5621e-06, "loss": -0.0047, "num_tokens": 1412523489.0, "reward": 1.0686914205551148, "reward_std": 0.1498661532998085, "rewards/reward_accuracy/mean": 0.96875, "rewards/reward_accuracy/std": 0.14952523857355118, "rewards/reward_format/mean": 0.09994140714406967, "rewards/reward_format/std": 0.0009375000605359674, "sampling/importance_sampling_ratio/max": 2.4605993747711183, "sampling/importance_sampling_ratio/mean": 0.994256192445755, "sampling/importance_sampling_ratio/min": 0.13014851957559587, "sampling/sampling_logp_difference/max": 1.0176939427852632, "sampling/sampling_logp_difference/mean": 0.003979199682362378, "step": 14380, "step_time": 5.0832670070900345 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.004296875, "completions/max_length": 1504.5, "completions/max_terminated_length": 1091.5, "completions/mean_length": 158.75859375, "completions/mean_terminated_length": 150.66063842773437, "completions/min_length": 66.2, "completions/min_terminated_length": 66.2, "entropy": 0.04029250734020025, "epoch": 30.81370449678801, "frac_reward_zero_std": 0.9125, "grad_norm": 0.34375, "learning_rate": 8.561100000000002e-06, "loss": -0.0022, "num_tokens": 1413446247.0, "reward": 1.051933616399765, "reward_std": 0.18547820970416068, "rewards/reward_accuracy/mean": 0.95234375, "rewards/reward_accuracy/std": 0.18398284688591957, "rewards/reward_format/mean": 0.09958984553813935, "rewards/reward_format/std": 0.0044771472457796335, "sampling/importance_sampling_ratio/max": 2.363285684585571, "sampling/importance_sampling_ratio/mean": 0.9802582502365113, "sampling/importance_sampling_ratio/min": 0.08316871076822281, "sampling/sampling_logp_difference/max": 0.8936973690986634, "sampling/sampling_logp_difference/mean": 0.004114682809449733, "step": 14390, "step_time": 7.126537097000982 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005859375, "completions/max_length": 1155.8, "completions/max_terminated_length": 1102.5, "completions/mean_length": 153.77578125, "completions/mean_terminated_length": 142.74726257324218, "completions/min_length": 60.1, "completions/min_terminated_length": 60.1, "entropy": 0.041247070068493485, "epoch": 30.83511777301927, "frac_reward_zero_std": 0.93125, "grad_norm": 0.224609375, "learning_rate": 8.560100000000001e-06, "loss": -0.0033, "num_tokens": 1414354201.0, "reward": 1.0781054854393006, "reward_std": 0.10823895439971239, "rewards/reward_accuracy/mean": 0.978515625, "rewards/reward_accuracy/std": 0.1062380351126194, "rewards/reward_format/mean": 0.09958984479308128, "rewards/reward_format/std": 0.0036120747681707144, "sampling/importance_sampling_ratio/max": 2.4146633744239807, "sampling/importance_sampling_ratio/mean": 0.9905861675739288, "sampling/importance_sampling_ratio/min": 0.09729821532964707, "sampling/sampling_logp_difference/max": 1.2162532925605773, "sampling/sampling_logp_difference/mean": 0.0038579920772463085, "step": 14400, "step_time": 5.91487287869968 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.000390625, "completions/max_length": 862.4, "completions/max_terminated_length": 827.2, "completions/mean_length": 146.048828125, "completions/mean_terminated_length": 145.3212127685547, "completions/min_length": 65.9, "completions/min_terminated_length": 65.9, "entropy": 0.03524592309258878, "epoch": 30.856531049250535, "frac_reward_zero_std": 0.95625, "grad_norm": 0.240234375, "learning_rate": 8.5591e-06, "loss": -0.0024, "num_tokens": 1415245830.0, "reward": 1.0620312690734863, "reward_std": 0.13565654903650284, "rewards/reward_accuracy/mean": 0.962109375, "rewards/reward_accuracy/std": 0.13532839715480804, "rewards/reward_format/mean": 0.09992187619209289, "rewards/reward_format/std": 0.0010101743275299669, "sampling/importance_sampling_ratio/max": 2.204334783554077, "sampling/importance_sampling_ratio/mean": 0.9817698359489441, "sampling/importance_sampling_ratio/min": 0.18607795163989066, "sampling/sampling_logp_difference/max": 1.2188881874084472, "sampling/sampling_logp_difference/mean": 0.0036997309885919093, "step": 14410, "step_time": 4.67348687199119 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00078125, "completions/max_length": 989.9, "completions/max_terminated_length": 868.5, "completions/mean_length": 138.7328125, "completions/mean_terminated_length": 137.25286560058595, "completions/min_length": 65.1, "completions/min_terminated_length": 65.1, "entropy": 0.03338315102737397, "epoch": 30.8779443254818, "frac_reward_zero_std": 0.95, "grad_norm": 0.08251953125, "learning_rate": 8.5581e-06, "loss": -0.0028, "num_tokens": 1416115306.0, "reward": 1.0913476705551148, "reward_std": 0.07162974327802658, "rewards/reward_accuracy/mean": 0.99140625, "rewards/reward_accuracy/std": 0.07094609290361405, "rewards/reward_format/mean": 0.09994140714406967, "rewards/reward_format/std": 0.0009375000605359674, "sampling/importance_sampling_ratio/max": 2.426090967655182, "sampling/importance_sampling_ratio/mean": 0.9948554933071136, "sampling/importance_sampling_ratio/min": 0.1568774774670601, "sampling/sampling_logp_difference/max": 1.0319427251815796, "sampling/sampling_logp_difference/mean": 0.0037034027045592666, "step": 14420, "step_time": 4.869870997784892 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00234375, "completions/max_length": 1250.4, "completions/max_terminated_length": 1006.8, "completions/mean_length": 150.612109375, "completions/mean_terminated_length": 146.18931732177734, "completions/min_length": 59.9, "completions/min_terminated_length": 59.9, "entropy": 0.03938646612223238, "epoch": 30.899357601713064, "frac_reward_zero_std": 0.94375, "grad_norm": 0.0233154296875, "learning_rate": 8.5571e-06, "loss": -0.0085, "num_tokens": 1417018585.0, "reward": 1.075976586341858, "reward_std": 0.1141899935901165, "rewards/reward_accuracy/mean": 0.976171875, "rewards/reward_accuracy/std": 0.11344984099268914, "rewards/reward_format/mean": 0.09980468824505806, "rewards/reward_format/std": 0.002517323079518974, "sampling/importance_sampling_ratio/max": 2.3745346307754516, "sampling/importance_sampling_ratio/mean": 0.9867721378803254, "sampling/importance_sampling_ratio/min": 0.09899849183857441, "sampling/sampling_logp_difference/max": 0.93790003657341, "sampling/sampling_logp_difference/mean": 0.003938192990608514, "step": 14430, "step_time": 6.208960941803525 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003515625, "completions/max_length": 1075.3, "completions/max_terminated_length": 883.5, "completions/mean_length": 150.624609375, "completions/mean_terminated_length": 144.01846618652343, "completions/min_length": 69.6, "completions/min_terminated_length": 69.6, "entropy": 0.03739781738258898, "epoch": 30.920770877944324, "frac_reward_zero_std": 0.95, "grad_norm": 0.2080078125, "learning_rate": 8.556100000000001e-06, "loss": -0.0009, "num_tokens": 1417924616.0, "reward": 1.0583789229393006, "reward_std": 0.14756183549761773, "rewards/reward_accuracy/mean": 0.95859375, "rewards/reward_accuracy/std": 0.14636079221963882, "rewards/reward_format/mean": 0.09978515729308128, "rewards/reward_format/std": 0.0020985509501770137, "sampling/importance_sampling_ratio/max": 2.3711081027984617, "sampling/importance_sampling_ratio/mean": 0.9744745969772339, "sampling/importance_sampling_ratio/min": 0.09236810579895974, "sampling/sampling_logp_difference/max": 1.1367215156555175, "sampling/sampling_logp_difference/mean": 0.0038804339710623026, "step": 14440, "step_time": 5.430977617122698 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003515625, "completions/max_length": 1286.8, "completions/max_terminated_length": 1046.0, "completions/mean_length": 158.687109375, "completions/mean_terminated_length": 152.10176696777344, "completions/min_length": 65.5, "completions/min_terminated_length": 65.5, "entropy": 0.04230254827998579, "epoch": 30.94218415417559, "frac_reward_zero_std": 0.925, "grad_norm": 0.12255859375, "learning_rate": 8.5551e-06, "loss": -0.008, "num_tokens": 1418851415.0, "reward": 1.075097680091858, "reward_std": 0.11461505219340325, "rewards/reward_accuracy/mean": 0.975390625, "rewards/reward_accuracy/std": 0.11341421157121659, "rewards/reward_format/mean": 0.09970703348517418, "rewards/reward_format/std": 0.003395841224119067, "sampling/importance_sampling_ratio/max": 2.6065078020095824, "sampling/importance_sampling_ratio/mean": 0.9841635346412658, "sampling/importance_sampling_ratio/min": 0.11901859417557717, "sampling/sampling_logp_difference/max": 0.9662275671958923, "sampling/sampling_logp_difference/mean": 0.004026299947872758, "step": 14450, "step_time": 6.237514326183009 }, { "clip_ratio/high_max": 3.977091910201125e-06, "clip_ratio/high_mean": 4.971364887751406e-07, "clip_ratio/low_mean": 2.378159501859045e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 2.875296013371553e-06, "completions/clipped_ratio": 0.00703125, "completions/max_length": 1253.1, "completions/max_terminated_length": 992.3, "completions/mean_length": 152.8359375, "completions/mean_terminated_length": 139.41487579345704, "completions/min_length": 62.6, "completions/min_terminated_length": 62.6, "entropy": 0.03670146425720304, "epoch": 30.963597430406853, "frac_reward_zero_std": 0.93125, "grad_norm": 0.0, "learning_rate": 8.5541e-06, "loss": -0.0052, "num_tokens": 1419763907.0, "reward": 1.0813867330551148, "reward_std": 0.09997922098264098, "rewards/reward_accuracy/mean": 0.98203125, "rewards/reward_accuracy/std": 0.09695164412260056, "rewards/reward_format/mean": 0.09935546964406967, "rewards/reward_format/std": 0.003724556416273117, "sampling/importance_sampling_ratio/max": 2.4546119451522825, "sampling/importance_sampling_ratio/mean": 0.9986008942127228, "sampling/importance_sampling_ratio/min": 0.18992761373519898, "sampling/sampling_logp_difference/max": 1.0033657670021057, "sampling/sampling_logp_difference/mean": 0.0036069896072149278, "step": 14460, "step_time": 6.2842462348868136 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0078125, "completions/max_length": 1380.6, "completions/max_terminated_length": 1096.6, "completions/mean_length": 169.492578125, "completions/mean_terminated_length": 154.76743698120117, "completions/min_length": 66.2, "completions/min_terminated_length": 66.2, "entropy": 0.041160128987394275, "epoch": 30.985010706638114, "frac_reward_zero_std": 0.91875, "grad_norm": 0.0, "learning_rate": 8.553100000000001e-06, "loss": -0.0055, "num_tokens": 1420712864.0, "reward": 1.064511740207672, "reward_std": 0.147392565314658, "rewards/reward_accuracy/mean": 0.965234375, "rewards/reward_accuracy/std": 0.14439024776220322, "rewards/reward_format/mean": 0.09927734434604644, "rewards/reward_format/std": 0.005197008303366601, "sampling/importance_sampling_ratio/max": 2.341817581653595, "sampling/importance_sampling_ratio/mean": 0.982728636264801, "sampling/importance_sampling_ratio/min": 0.08299479484558106, "sampling/sampling_logp_difference/max": 1.1524540424346923, "sampling/sampling_logp_difference/mean": 0.0040579738561064005, "step": 14470, "step_time": 6.888948197310674 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0015625, "completions/max_length": 1155.1, "completions/max_terminated_length": 868.7, "completions/mean_length": 143.915234375, "completions/mean_terminated_length": 140.92267532348632, "completions/min_length": 69.9, "completions/min_terminated_length": 69.9, "entropy": 0.0358028766233474, "epoch": 31.00642398286938, "frac_reward_zero_std": 0.9125, "grad_norm": 1.109375, "learning_rate": 8.5521e-06, "loss": 0.0011, "num_tokens": 1421601847.0, "reward": 1.080761730670929, "reward_std": 0.11057721227407455, "rewards/reward_accuracy/mean": 0.980859375, "rewards/reward_accuracy/std": 0.10955706015229225, "rewards/reward_format/mean": 0.09990234449505805, "rewards/reward_format/std": 0.001562500116415322, "sampling/importance_sampling_ratio/max": 2.519132304191589, "sampling/importance_sampling_ratio/mean": 0.9963778853416443, "sampling/importance_sampling_ratio/min": 0.10473545789718627, "sampling/sampling_logp_difference/max": 0.9223577618598938, "sampling/sampling_logp_difference/mean": 0.003852595039643347, "step": 14480, "step_time": 5.46514263760182 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 8.167951136783813e-07, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 8.167951136783813e-07, "completions/clipped_ratio": 0.006640625, "completions/max_length": 1427.6, "completions/max_terminated_length": 1115.5, "completions/mean_length": 161.603125, "completions/mean_terminated_length": 149.03148345947267, "completions/min_length": 64.5, "completions/min_terminated_length": 64.5, "entropy": 0.040440950402989985, "epoch": 31.027837259100643, "frac_reward_zero_std": 0.9375, "grad_norm": 0.0, "learning_rate": 8.551100000000002e-06, "loss": -0.0056, "num_tokens": 1422532319.0, "reward": 1.0686328411102295, "reward_std": 0.11598096638917924, "rewards/reward_accuracy/mean": 0.969140625, "rewards/reward_accuracy/std": 0.11398643255233765, "rewards/reward_format/mean": 0.09949218928813934, "rewards/reward_format/std": 0.003674388164654374, "sampling/importance_sampling_ratio/max": 2.443987214565277, "sampling/importance_sampling_ratio/mean": 0.9817799866199494, "sampling/importance_sampling_ratio/min": 0.05521585643291473, "sampling/sampling_logp_difference/max": 0.9729164183139801, "sampling/sampling_logp_difference/mean": 0.003974406304769218, "step": 14490, "step_time": 6.917939205488073 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005859375, "completions/max_length": 1598.2, "completions/max_terminated_length": 1341.7, "completions/mean_length": 173.58046875, "completions/mean_terminated_length": 162.56033325195312, "completions/min_length": 62.4, "completions/min_terminated_length": 62.4, "entropy": 0.05030863920692354, "epoch": 31.049250535331907, "frac_reward_zero_std": 0.8875, "grad_norm": 0.259765625, "learning_rate": 8.550100000000001e-06, "loss": -0.0043, "num_tokens": 1423498605.0, "reward": 1.0741601824760436, "reward_std": 0.1371159575879574, "rewards/reward_accuracy/mean": 0.974609375, "rewards/reward_accuracy/std": 0.13452068269252776, "rewards/reward_format/mean": 0.09955078214406968, "rewards/reward_format/std": 0.004638466518372297, "sampling/importance_sampling_ratio/max": 2.4483499050140383, "sampling/importance_sampling_ratio/mean": 0.9769177377223969, "sampling/importance_sampling_ratio/min": 0.11850140411406755, "sampling/sampling_logp_difference/max": 1.2815865993499755, "sampling/sampling_logp_difference/mean": 0.0043835427146404985, "step": 14500, "step_time": 7.95112578458793 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001953125, "completions/max_length": 982.0, "completions/max_terminated_length": 735.1, "completions/mean_length": 144.65234375, "completions/mean_terminated_length": 140.95961303710936, "completions/min_length": 65.3, "completions/min_terminated_length": 65.3, "entropy": 0.037748194043524565, "epoch": 31.07066381156317, "frac_reward_zero_std": 0.9375, "grad_norm": 0.0, "learning_rate": 8.549100000000001e-06, "loss": -0.0066, "num_tokens": 1424385475.0, "reward": 1.081054699420929, "reward_std": 0.09746723398566245, "rewards/reward_accuracy/mean": 0.98125, "rewards/reward_accuracy/std": 0.09647932872176171, "rewards/reward_format/mean": 0.09980468824505806, "rewards/reward_format/std": 0.0020492353942245245, "sampling/importance_sampling_ratio/max": 2.316783142089844, "sampling/importance_sampling_ratio/mean": 0.9858493506908417, "sampling/importance_sampling_ratio/min": 0.07153053171932697, "sampling/sampling_logp_difference/max": 1.1074550926685334, "sampling/sampling_logp_difference/mean": 0.004000258352607489, "step": 14510, "step_time": 5.016416681287228 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001171875, "completions/max_length": 477.0, "completions/max_terminated_length": 457.9, "completions/mean_length": 145.0671875, "completions/mean_terminated_length": 142.90910797119142, "completions/min_length": 65.0, "completions/min_terminated_length": 65.0, "entropy": 0.034242298896424474, "epoch": 31.092077087794433, "frac_reward_zero_std": 0.94375, "grad_norm": 0.2734375, "learning_rate": 8.5481e-06, "loss": -0.0023, "num_tokens": 1425278815.0, "reward": 1.0748828291893004, "reward_std": 0.10175931602716445, "rewards/reward_accuracy/mean": 0.975, "rewards/reward_accuracy/std": 0.10149640589952469, "rewards/reward_format/mean": 0.09988281354308129, "rewards/reward_format/std": 0.0008777966722846031, "sampling/importance_sampling_ratio/max": 2.405622363090515, "sampling/importance_sampling_ratio/mean": 0.9848839581012726, "sampling/importance_sampling_ratio/min": 0.18490227907896042, "sampling/sampling_logp_difference/max": 1.0541200637817383, "sampling/sampling_logp_difference/mean": 0.0036096410127356648, "step": 14520, "step_time": 3.062874496585573 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003125, "completions/max_length": 1460.0, "completions/max_terminated_length": 1163.6, "completions/mean_length": 160.441015625, "completions/mean_terminated_length": 154.5368194580078, "completions/min_length": 65.0, "completions/min_terminated_length": 65.0, "entropy": 0.03973812868352979, "epoch": 31.113490364025697, "frac_reward_zero_std": 0.90625, "grad_norm": 0.0, "learning_rate": 8.5471e-06, "loss": -0.0079, "num_tokens": 1426217768.0, "reward": 1.0587890803813935, "reward_std": 0.15636249110102654, "rewards/reward_accuracy/mean": 0.958984375, "rewards/reward_accuracy/std": 0.1554957829415798, "rewards/reward_format/mean": 0.09980468824505806, "rewards/reward_format/std": 0.002233161125332117, "sampling/importance_sampling_ratio/max": 2.473085713386536, "sampling/importance_sampling_ratio/mean": 0.9906524181365967, "sampling/importance_sampling_ratio/min": 0.12865481786429883, "sampling/sampling_logp_difference/max": 0.8516607284545898, "sampling/sampling_logp_difference/mean": 0.003823996591381729, "step": 14530, "step_time": 7.043616248687613 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 1075.1, "completions/max_terminated_length": 766.0, "completions/mean_length": 155.6140625, "completions/mean_terminated_length": 148.2851364135742, "completions/min_length": 64.6, "completions/min_terminated_length": 64.6, "entropy": 0.04110186689067632, "epoch": 31.134903640256958, "frac_reward_zero_std": 0.9125, "grad_norm": 0.32421875, "learning_rate": 8.546100000000001e-06, "loss": -0.0026, "num_tokens": 1427137036.0, "reward": 1.0575586140155793, "reward_std": 0.15572775676846504, "rewards/reward_accuracy/mean": 0.9578125, "rewards/reward_accuracy/std": 0.15449313297867776, "rewards/reward_format/mean": 0.09974609538912774, "rewards/reward_format/std": 0.002637504693120718, "sampling/importance_sampling_ratio/max": 2.364823508262634, "sampling/importance_sampling_ratio/mean": 0.9873289048671723, "sampling/importance_sampling_ratio/min": 0.15695872530341148, "sampling/sampling_logp_difference/max": 1.096609628200531, "sampling/sampling_logp_difference/mean": 0.004041032423265279, "step": 14540, "step_time": 5.680176205883617 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001953125, "completions/max_length": 1417.1, "completions/max_terminated_length": 1215.8, "completions/mean_length": 151.003515625, "completions/mean_terminated_length": 147.3126533508301, "completions/min_length": 67.4, "completions/min_terminated_length": 67.4, "entropy": 0.044286220939829944, "epoch": 31.156316916488223, "frac_reward_zero_std": 0.90625, "grad_norm": 0.0, "learning_rate": 8.5451e-06, "loss": -0.0059, "num_tokens": 1428038629.0, "reward": 1.0639257907867432, "reward_std": 0.14582685753703117, "rewards/reward_accuracy/mean": 0.9640625, "rewards/reward_accuracy/std": 0.14512174651026727, "rewards/reward_format/mean": 0.09986328184604645, "rewards/reward_format/std": 0.0020035744411870835, "sampling/importance_sampling_ratio/max": 2.5705044507980346, "sampling/importance_sampling_ratio/mean": 0.9918880105018616, "sampling/importance_sampling_ratio/min": 0.07857091883197427, "sampling/sampling_logp_difference/max": 1.1138450980186463, "sampling/sampling_logp_difference/mean": 0.0043531152419745926, "step": 14550, "step_time": 6.651401296793483 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.006640625, "completions/max_length": 1198.5, "completions/max_terminated_length": 1168.1, "completions/mean_length": 164.17109375, "completions/mean_terminated_length": 151.76568145751952, "completions/min_length": 64.1, "completions/min_terminated_length": 64.1, "entropy": 0.04458393775857985, "epoch": 31.177730192719487, "frac_reward_zero_std": 0.93125, "grad_norm": 0.1953125, "learning_rate": 8.5441e-06, "loss": -0.0053, "num_tokens": 1428982075.0, "reward": 1.0486914336681366, "reward_std": 0.18360560089349748, "rewards/reward_accuracy/mean": 0.94921875, "rewards/reward_accuracy/std": 0.18174214214086531, "rewards/reward_format/mean": 0.0994726575911045, "rewards/reward_format/std": 0.0038768368074670436, "sampling/importance_sampling_ratio/max": 2.543093180656433, "sampling/importance_sampling_ratio/mean": 0.9804613411426544, "sampling/importance_sampling_ratio/min": 0.11923401653766633, "sampling/sampling_logp_difference/max": 1.0331358909606934, "sampling/sampling_logp_difference/mean": 0.003931734291836619, "step": 14560, "step_time": 6.232573064015014 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.002734375, "completions/max_length": 1283.5, "completions/max_terminated_length": 1066.9, "completions/mean_length": 149.506640625, "completions/mean_terminated_length": 144.4102294921875, "completions/min_length": 70.0, "completions/min_terminated_length": 70.0, "entropy": 0.03823063257150352, "epoch": 31.199143468950748, "frac_reward_zero_std": 0.925, "grad_norm": 0.55078125, "learning_rate": 8.543100000000001e-06, "loss": -0.006, "num_tokens": 1429882172.0, "reward": 1.0900000214576722, "reward_std": 0.07177590057253838, "rewards/reward_accuracy/mean": 0.990234375, "rewards/reward_accuracy/std": 0.07027983516454697, "rewards/reward_format/mean": 0.09976562708616257, "rewards/reward_format/std": 0.0025854270905256273, "sampling/importance_sampling_ratio/max": 2.455686640739441, "sampling/importance_sampling_ratio/mean": 0.9856718599796295, "sampling/importance_sampling_ratio/min": 0.12209761515259743, "sampling/sampling_logp_difference/max": 1.036576509475708, "sampling/sampling_logp_difference/mean": 0.003933058935217559, "step": 14570, "step_time": 6.143730172689539 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001171875, "completions/max_length": 1166.6, "completions/max_terminated_length": 894.2, "completions/mean_length": 151.542578125, "completions/mean_terminated_length": 149.32685317993165, "completions/min_length": 66.2, "completions/min_terminated_length": 66.2, "entropy": 0.03519968858454377, "epoch": 31.220556745182012, "frac_reward_zero_std": 0.925, "grad_norm": 0.400390625, "learning_rate": 8.5421e-06, "loss": -0.0053, "num_tokens": 1430793001.0, "reward": 1.0714257895946502, "reward_std": 0.11747472286224366, "rewards/reward_accuracy/mean": 0.971484375, "rewards/reward_accuracy/std": 0.11702395230531693, "rewards/reward_format/mean": 0.09994140639901161, "rewards/reward_format/std": 0.0009375000139698386, "sampling/importance_sampling_ratio/max": 2.37431560754776, "sampling/importance_sampling_ratio/mean": 0.9996383607387542, "sampling/importance_sampling_ratio/min": 0.0455668106675148, "sampling/sampling_logp_difference/max": 0.9792012095451355, "sampling/sampling_logp_difference/mean": 0.0037037010537460447, "step": 14580, "step_time": 5.560547282415792 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.002734375, "completions/max_length": 1087.6, "completions/max_terminated_length": 1010.1, "completions/mean_length": 155.850390625, "completions/mean_terminated_length": 150.73719177246093, "completions/min_length": 63.2, "completions/min_terminated_length": 63.2, "entropy": 0.039862418291158976, "epoch": 31.241970021413277, "frac_reward_zero_std": 0.9125, "grad_norm": 0.6484375, "learning_rate": 8.5411e-06, "loss": -0.0071, "num_tokens": 1431714474.0, "reward": 1.068125021457672, "reward_std": 0.14384609162807466, "rewards/reward_accuracy/mean": 0.968359375, "rewards/reward_accuracy/std": 0.14281883910298349, "rewards/reward_format/mean": 0.0997656263411045, "rewards/reward_format/std": 0.0022527996217831968, "sampling/importance_sampling_ratio/max": 2.5301161766052247, "sampling/importance_sampling_ratio/mean": 0.9951824247837067, "sampling/importance_sampling_ratio/min": 0.17919893525540828, "sampling/sampling_logp_difference/max": 1.0090657651424408, "sampling/sampling_logp_difference/mean": 0.003961367974989116, "step": 14590, "step_time": 5.477002454208559 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.002734375, "completions/max_length": 1137.9, "completions/max_terminated_length": 905.5, "completions/mean_length": 157.583203125, "completions/mean_terminated_length": 152.40160675048827, "completions/min_length": 65.4, "completions/min_terminated_length": 65.4, "entropy": 0.037905059102922675, "epoch": 31.26338329764454, "frac_reward_zero_std": 0.91875, "grad_norm": 0.478515625, "learning_rate": 8.540100000000001e-06, "loss": -0.0004, "num_tokens": 1432640447.0, "reward": 1.0669140815734863, "reward_std": 0.11155187785625457, "rewards/reward_accuracy/mean": 0.9671875, "rewards/reward_accuracy/std": 0.11030598729848862, "rewards/reward_format/mean": 0.0997265636920929, "rewards/reward_format/std": 0.0024692215491086246, "sampling/importance_sampling_ratio/max": 2.6076314091682433, "sampling/importance_sampling_ratio/mean": 0.9819428205490113, "sampling/importance_sampling_ratio/min": 0.13453273773193358, "sampling/sampling_logp_difference/max": 1.028035616874695, "sampling/sampling_logp_difference/mean": 0.0038265761453658343, "step": 14600, "step_time": 5.80946212040435 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005859375, "completions/max_length": 1317.2, "completions/max_terminated_length": 1149.2, "completions/mean_length": 161.32265625, "completions/mean_terminated_length": 150.4080680847168, "completions/min_length": 66.5, "completions/min_terminated_length": 66.5, "entropy": 0.04355214352253824, "epoch": 31.284796573875802, "frac_reward_zero_std": 0.91875, "grad_norm": 0.640625, "learning_rate": 8.539100000000001e-06, "loss": -0.0077, "num_tokens": 1433572009.0, "reward": 1.069101595878601, "reward_std": 0.12741547897458078, "rewards/reward_accuracy/mean": 0.96953125, "rewards/reward_accuracy/std": 0.12611351981759072, "rewards/reward_format/mean": 0.09957031458616257, "rewards/reward_format/std": 0.0032227923162281512, "sampling/importance_sampling_ratio/max": 2.349758434295654, "sampling/importance_sampling_ratio/mean": 0.9786294877529145, "sampling/importance_sampling_ratio/min": 0.13499519936740398, "sampling/sampling_logp_difference/max": 1.112660014629364, "sampling/sampling_logp_difference/mean": 0.004166055610403419, "step": 14610, "step_time": 6.570866735107847 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 991.7, "completions/max_terminated_length": 752.2, "completions/mean_length": 154.7453125, "completions/mean_terminated_length": 147.51549224853517, "completions/min_length": 63.5, "completions/min_terminated_length": 63.5, "entropy": 0.037801022129133346, "epoch": 31.306209850107066, "frac_reward_zero_std": 0.94375, "grad_norm": 0.0, "learning_rate": 8.5381e-06, "loss": -0.002, "num_tokens": 1434479885.0, "reward": 1.0714843988418579, "reward_std": 0.13210971429944038, "rewards/reward_accuracy/mean": 0.971875, "rewards/reward_accuracy/std": 0.13042339012026788, "rewards/reward_format/mean": 0.09960937649011611, "rewards/reward_format/std": 0.003103564982302487, "sampling/importance_sampling_ratio/max": 2.37160838842392, "sampling/importance_sampling_ratio/mean": 0.9794017374515533, "sampling/importance_sampling_ratio/min": 0.12849444430321455, "sampling/sampling_logp_difference/max": 1.0032468855381012, "sampling/sampling_logp_difference/mean": 0.0038500481750816107, "step": 14620, "step_time": 5.142583189078141 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.006640625, "completions/max_length": 1111.0, "completions/max_terminated_length": 1031.0, "completions/mean_length": 172.474609375, "completions/mean_terminated_length": 160.15606536865235, "completions/min_length": 65.8, "completions/min_terminated_length": 65.8, "entropy": 0.04350771177560091, "epoch": 31.32762312633833, "frac_reward_zero_std": 0.90625, "grad_norm": 0.85546875, "learning_rate": 8.5371e-06, "loss": -0.0031, "num_tokens": 1435442892.0, "reward": 1.0539844036102295, "reward_std": 0.1458825461566448, "rewards/reward_accuracy/mean": 0.9546875, "rewards/reward_accuracy/std": 0.14403965696692467, "rewards/reward_format/mean": 0.09929687604308128, "rewards/reward_format/std": 0.004290223238058388, "sampling/importance_sampling_ratio/max": 2.734179949760437, "sampling/importance_sampling_ratio/mean": 0.9808323621749878, "sampling/importance_sampling_ratio/min": 0.12672538682818413, "sampling/sampling_logp_difference/max": 1.1172697305679322, "sampling/sampling_logp_difference/mean": 0.00412061617244035, "step": 14630, "step_time": 5.674088431187556 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.008984375, "completions/max_length": 1404.0, "completions/max_terminated_length": 1151.9, "completions/mean_length": 172.6203125, "completions/mean_terminated_length": 155.96731567382812, "completions/min_length": 60.8, "completions/min_terminated_length": 60.8, "entropy": 0.046102575049735604, "epoch": 31.349036402569592, "frac_reward_zero_std": 0.90625, "grad_norm": 0.0, "learning_rate": 8.536100000000001e-06, "loss": -0.0093, "num_tokens": 1436401952.0, "reward": 1.0591601729393005, "reward_std": 0.13819165378808976, "rewards/reward_accuracy/mean": 0.959765625, "rewards/reward_accuracy/std": 0.13621186465024948, "rewards/reward_format/mean": 0.09939453303813935, "rewards/reward_format/std": 0.004373216186650097, "sampling/importance_sampling_ratio/max": 2.3703866481781004, "sampling/importance_sampling_ratio/mean": 0.9813894152641296, "sampling/importance_sampling_ratio/min": 0.15363135263323785, "sampling/sampling_logp_difference/max": 1.14021155834198, "sampling/sampling_logp_difference/mean": 0.0041376544628292326, "step": 14640, "step_time": 6.929479660998913 }, { "clip_ratio/high_max": 3.14034718030598e-05, "clip_ratio/high_mean": 3.925433975382475e-06, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 3.925433975382475e-06, "completions/clipped_ratio": 0.006640625, "completions/max_length": 1153.1, "completions/max_terminated_length": 932.9, "completions/mean_length": 158.84453125, "completions/mean_terminated_length": 146.4614028930664, "completions/min_length": 64.3, "completions/min_terminated_length": 64.3, "entropy": 0.047044863691553473, "epoch": 31.370449678800856, "frac_reward_zero_std": 0.9, "grad_norm": 0.142578125, "learning_rate": 8.5351e-06, "loss": -0.0073, "num_tokens": 1437325122.0, "reward": 1.0500195562839507, "reward_std": 0.19523885771632193, "rewards/reward_accuracy/mean": 0.950390625, "rewards/reward_accuracy/std": 0.19371027275919914, "rewards/reward_format/mean": 0.09962890595197678, "rewards/reward_format/std": 0.0032063792925328015, "sampling/importance_sampling_ratio/max": 2.483075714111328, "sampling/importance_sampling_ratio/mean": 0.9867660403251648, "sampling/importance_sampling_ratio/min": 0.10115364342927932, "sampling/sampling_logp_difference/max": 0.9981510937213898, "sampling/sampling_logp_difference/mean": 0.004274189914576709, "step": 14650, "step_time": 5.813602831421304 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0046875, "completions/max_length": 1404.0, "completions/max_terminated_length": 1298.6, "completions/mean_length": 171.06328125, "completions/mean_terminated_length": 162.54627380371093, "completions/min_length": 61.5, "completions/min_terminated_length": 61.5, "entropy": 0.044954994088038804, "epoch": 31.39186295503212, "frac_reward_zero_std": 0.90625, "grad_norm": 0.53515625, "learning_rate": 8.5341e-06, "loss": 0.0014, "num_tokens": 1438276628.0, "reward": 1.0887500166893005, "reward_std": 0.07367768466938288, "rewards/reward_accuracy/mean": 0.9890625, "rewards/reward_accuracy/std": 0.072615697234869, "rewards/reward_format/mean": 0.09968750104308129, "rewards/reward_format/std": 0.0026498047402128575, "sampling/importance_sampling_ratio/max": 2.465327525138855, "sampling/importance_sampling_ratio/mean": 0.9835843682289124, "sampling/importance_sampling_ratio/min": 0.042619810067117216, "sampling/sampling_logp_difference/max": 1.1007575988769531, "sampling/sampling_logp_difference/mean": 0.003972793114371598, "step": 14660, "step_time": 6.827656372514321 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.002734375, "completions/max_length": 1176.8, "completions/max_terminated_length": 554.0, "completions/mean_length": 146.771875, "completions/mean_terminated_length": 141.5548828125, "completions/min_length": 70.4, "completions/min_terminated_length": 70.4, "entropy": 0.03422149382531643, "epoch": 31.41327623126338, "frac_reward_zero_std": 0.925, "grad_norm": 0.40234375, "learning_rate": 8.533100000000001e-06, "loss": -0.0092, "num_tokens": 1439169036.0, "reward": 1.0842578291893006, "reward_std": 0.09865860268473625, "rewards/reward_accuracy/mean": 0.984375, "rewards/reward_accuracy/std": 0.09762610048055649, "rewards/reward_format/mean": 0.09988281354308129, "rewards/reward_format/std": 0.0016351743834093213, "sampling/importance_sampling_ratio/max": 2.542578339576721, "sampling/importance_sampling_ratio/mean": 0.9924372732639313, "sampling/importance_sampling_ratio/min": 0.10022579152137041, "sampling/sampling_logp_difference/max": 1.1575456380844116, "sampling/sampling_logp_difference/mean": 0.00374704715795815, "step": 14670, "step_time": 5.675430140909157 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00078125, "completions/max_length": 914.7, "completions/max_terminated_length": 828.6, "completions/mean_length": 142.1734375, "completions/mean_terminated_length": 140.69459686279296, "completions/min_length": 60.0, "completions/min_terminated_length": 60.0, "entropy": 0.03333376334048808, "epoch": 31.434689507494646, "frac_reward_zero_std": 0.91875, "grad_norm": 0.64453125, "learning_rate": 8.532100000000001e-06, "loss": 0.0021, "num_tokens": 1440043384.0, "reward": 1.087011730670929, "reward_std": 0.08968546763062477, "rewards/reward_accuracy/mean": 0.987109375, "rewards/reward_accuracy/std": 0.08919157013297081, "rewards/reward_format/mean": 0.09990234449505805, "rewards/reward_format/std": 0.0013785743853077293, "sampling/importance_sampling_ratio/max": 2.524800944328308, "sampling/importance_sampling_ratio/mean": 1.0016316950321198, "sampling/importance_sampling_ratio/min": 0.21847807802259922, "sampling/sampling_logp_difference/max": 1.0637360274791718, "sampling/sampling_logp_difference/mean": 0.0033918300876393916, "step": 14680, "step_time": 4.700451494011213 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00703125, "completions/max_length": 1493.2, "completions/max_terminated_length": 1232.2, "completions/mean_length": 164.009765625, "completions/mean_terminated_length": 150.79896392822266, "completions/min_length": 64.9, "completions/min_terminated_length": 64.9, "entropy": 0.04346103726420551, "epoch": 31.45610278372591, "frac_reward_zero_std": 0.925, "grad_norm": 0.228515625, "learning_rate": 8.5311e-06, "loss": -0.0038, "num_tokens": 1440980369.0, "reward": 1.0768750309944153, "reward_std": 0.11281369626522064, "rewards/reward_accuracy/mean": 0.97734375, "rewards/reward_accuracy/std": 0.11060158833861351, "rewards/reward_format/mean": 0.09953125193715096, "rewards/reward_format/std": 0.0031793986912816764, "sampling/importance_sampling_ratio/max": 2.4165570020675657, "sampling/importance_sampling_ratio/mean": 0.9860367953777314, "sampling/importance_sampling_ratio/min": 0.09946273900568485, "sampling/sampling_logp_difference/max": 0.9820831716060638, "sampling/sampling_logp_difference/mean": 0.004006166919134557, "step": 14690, "step_time": 7.2842525303858565 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001171875, "completions/max_length": 945.0, "completions/max_terminated_length": 622.6, "completions/mean_length": 140.812890625, "completions/mean_terminated_length": 138.58562927246095, "completions/min_length": 63.3, "completions/min_terminated_length": 63.3, "entropy": 0.034209212521091104, "epoch": 31.477516059957175, "frac_reward_zero_std": 0.94375, "grad_norm": 0.0, "learning_rate": 8.530100000000002e-06, "loss": -0.0021, "num_tokens": 1441859138.0, "reward": 1.056542980670929, "reward_std": 0.14868807643651963, "rewards/reward_accuracy/mean": 0.956640625, "rewards/reward_accuracy/std": 0.1480366237461567, "rewards/reward_format/mean": 0.09990234449505805, "rewards/reward_format/std": 0.001562500116415322, "sampling/importance_sampling_ratio/max": 2.2747286677360536, "sampling/importance_sampling_ratio/mean": 0.9864168167114258, "sampling/importance_sampling_ratio/min": 0.22203650819137694, "sampling/sampling_logp_difference/max": 1.0409687638282776, "sampling/sampling_logp_difference/mean": 0.0037973446771502493, "step": 14700, "step_time": 4.667397497611819 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00546875, "completions/max_length": 1159.5, "completions/max_terminated_length": 748.9, "completions/mean_length": 152.35234375, "completions/mean_terminated_length": 142.0780937194824, "completions/min_length": 62.5, "completions/min_terminated_length": 62.5, "entropy": 0.03801354253664613, "epoch": 31.498929336188436, "frac_reward_zero_std": 0.9125, "grad_norm": 0.466796875, "learning_rate": 8.5291e-06, "loss": -0.0014, "num_tokens": 1442761928.0, "reward": 1.0805078268051147, "reward_std": 0.1062471441924572, "rewards/reward_accuracy/mean": 0.980859375, "rewards/reward_accuracy/std": 0.10461561903357505, "rewards/reward_format/mean": 0.09964843839406967, "rewards/reward_format/std": 0.0030424260767176747, "sampling/importance_sampling_ratio/max": 2.3774768471717835, "sampling/importance_sampling_ratio/mean": 0.9891697466373444, "sampling/importance_sampling_ratio/min": 0.13950405046343803, "sampling/sampling_logp_difference/max": 0.9350452423095703, "sampling/sampling_logp_difference/mean": 0.0036811229772865774, "step": 14710, "step_time": 5.825686219500494 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 500.0, "completions/max_terminated_length": 500.0, "completions/mean_length": 132.1421875, "completions/mean_terminated_length": 132.1421875, "completions/min_length": 66.2, "completions/min_terminated_length": 66.2, "entropy": 0.03104742388240993, "epoch": 31.5203426124197, "frac_reward_zero_std": 0.96875, "grad_norm": 0.515625, "learning_rate": 8.5281e-06, "loss": -0.0011, "num_tokens": 1443612788.0, "reward": 1.0976562738418578, "reward_std": 0.030142973363399505, "rewards/reward_accuracy/mean": 0.99765625, "rewards/reward_accuracy/std": 0.030142973363399505, "rewards/reward_format/mean": 0.10000000149011612, "rewards/reward_format/std": 0.0, "sampling/importance_sampling_ratio/max": 2.536046051979065, "sampling/importance_sampling_ratio/mean": 0.990113639831543, "sampling/importance_sampling_ratio/min": 0.13111745417118073, "sampling/sampling_logp_difference/max": 0.9107446193695068, "sampling/sampling_logp_difference/mean": 0.0035148402908816933, "step": 14720, "step_time": 2.8792981892096576 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.000390625, "completions/max_length": 845.4, "completions/max_terminated_length": 845.2, "completions/mean_length": 143.39765625, "completions/mean_terminated_length": 142.66234741210937, "completions/min_length": 65.4, "completions/min_terminated_length": 65.4, "entropy": 0.03478803592734039, "epoch": 31.541755888650965, "frac_reward_zero_std": 0.96875, "grad_norm": 0.0, "learning_rate": 8.5271e-06, "loss": -0.001, "num_tokens": 1444503358.0, "reward": 1.0909765720367433, "reward_std": 0.05228704989422113, "rewards/reward_accuracy/mean": 0.991015625, "rewards/reward_accuracy/std": 0.05175130367279053, "rewards/reward_format/mean": 0.09996093809604645, "rewards/reward_format/std": 0.0006250000093132258, "sampling/importance_sampling_ratio/max": 2.397885870933533, "sampling/importance_sampling_ratio/mean": 0.9936851799488068, "sampling/importance_sampling_ratio/min": 0.19677759185433388, "sampling/sampling_logp_difference/max": 0.8713787198066711, "sampling/sampling_logp_difference/mean": 0.003658768814057112, "step": 14730, "step_time": 4.316711634909734 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00546875, "completions/max_length": 1430.4, "completions/max_terminated_length": 1086.1, "completions/mean_length": 159.12890625, "completions/mean_terminated_length": 148.9013687133789, "completions/min_length": 70.0, "completions/min_terminated_length": 70.0, "entropy": 0.03685863849241287, "epoch": 31.563169164882225, "frac_reward_zero_std": 0.925, "grad_norm": 0.2119140625, "learning_rate": 8.526100000000001e-06, "loss": -0.0061, "num_tokens": 1445428456.0, "reward": 1.0683203101158143, "reward_std": 0.1429626889526844, "rewards/reward_accuracy/mean": 0.96875, "rewards/reward_accuracy/std": 0.14110500663518905, "rewards/reward_format/mean": 0.09957031235098839, "rewards/reward_format/std": 0.003530353005044162, "sampling/importance_sampling_ratio/max": 2.4768807888031006, "sampling/importance_sampling_ratio/mean": 0.9835797667503356, "sampling/importance_sampling_ratio/min": 0.1772962160408497, "sampling/sampling_logp_difference/max": 0.9201969027519226, "sampling/sampling_logp_difference/mean": 0.0037706084782257675, "step": 14740, "step_time": 6.840511132610845 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00703125, "completions/max_length": 1415.8, "completions/max_terminated_length": 1227.5, "completions/mean_length": 175.54453125, "completions/mean_terminated_length": 162.4694076538086, "completions/min_length": 66.4, "completions/min_terminated_length": 66.4, "entropy": 0.04813501876778901, "epoch": 31.58458244111349, "frac_reward_zero_std": 0.90625, "grad_norm": 0.5703125, "learning_rate": 8.5251e-06, "loss": -0.0041, "num_tokens": 1446396138.0, "reward": 1.052324229478836, "reward_std": 0.17199645340442657, "rewards/reward_accuracy/mean": 0.952734375, "rewards/reward_accuracy/std": 0.17067642733454705, "rewards/reward_format/mean": 0.09958984479308128, "rewards/reward_format/std": 0.0038181554758921266, "sampling/importance_sampling_ratio/max": 2.4123905658721925, "sampling/importance_sampling_ratio/mean": 0.9883544325828553, "sampling/importance_sampling_ratio/min": 0.11811874564737082, "sampling/sampling_logp_difference/max": 1.055956882238388, "sampling/sampling_logp_difference/mean": 0.004272862989455462, "step": 14750, "step_time": 7.183762314388877 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0046875, "completions/max_length": 1438.8, "completions/max_terminated_length": 1112.8, "completions/mean_length": 161.43046875, "completions/mean_terminated_length": 152.67159576416014, "completions/min_length": 65.3, "completions/min_terminated_length": 65.3, "entropy": 0.04056219214107841, "epoch": 31.605995717344754, "frac_reward_zero_std": 0.91875, "grad_norm": 0.20703125, "learning_rate": 8.5241e-06, "loss": -0.0074, "num_tokens": 1447332264.0, "reward": 1.050878918170929, "reward_std": 0.1839476354420185, "rewards/reward_accuracy/mean": 0.951171875, "rewards/reward_accuracy/std": 0.18267623111605644, "rewards/reward_format/mean": 0.09970703274011612, "rewards/reward_format/std": 0.002943085343576968, "sampling/importance_sampling_ratio/max": 2.2147494077682497, "sampling/importance_sampling_ratio/mean": 0.977659958600998, "sampling/importance_sampling_ratio/min": 0.064616160094738, "sampling/sampling_logp_difference/max": 0.9592396974563598, "sampling/sampling_logp_difference/mean": 0.003975667152553796, "step": 14760, "step_time": 6.795803258207161 }, { "clip_ratio/high_max": 5.091848506708629e-05, "clip_ratio/high_mean": 6.364810633385787e-06, "clip_ratio/low_mean": 2.156746950277011e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 8.521557629137532e-06, "completions/clipped_ratio": 0.00703125, "completions/max_length": 1213.8, "completions/max_terminated_length": 905.5, "completions/mean_length": 163.43125, "completions/mean_terminated_length": 150.22775573730468, "completions/min_length": 70.9, "completions/min_terminated_length": 70.9, "entropy": 0.037467407318763433, "epoch": 31.62740899357602, "frac_reward_zero_std": 0.93125, "grad_norm": 0.0, "learning_rate": 8.523100000000001e-06, "loss": -0.0061, "num_tokens": 1448265032.0, "reward": 1.0561914324760437, "reward_std": 0.14760990738868712, "rewards/reward_accuracy/mean": 0.956640625, "rewards/reward_accuracy/std": 0.14640685245394708, "rewards/reward_format/mean": 0.09955078288912773, "rewards/reward_format/std": 0.0031680282205343246, "sampling/importance_sampling_ratio/max": 2.5216117978096007, "sampling/importance_sampling_ratio/mean": 0.9825325846672058, "sampling/importance_sampling_ratio/min": 0.16252673119306565, "sampling/sampling_logp_difference/max": 1.1148612260818482, "sampling/sampling_logp_difference/mean": 0.0037834556540474297, "step": 14770, "step_time": 5.9730117606144635 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001171875, "completions/max_length": 755.2, "completions/max_terminated_length": 548.2, "completions/mean_length": 135.237890625, "completions/mean_terminated_length": 133.0065475463867, "completions/min_length": 65.5, "completions/min_terminated_length": 65.5, "entropy": 0.031224460015073417, "epoch": 31.64882226980728, "frac_reward_zero_std": 0.9375, "grad_norm": 0.0, "learning_rate": 8.522100000000001e-06, "loss": 0.0005, "num_tokens": 1449130057.0, "reward": 1.0780859589576721, "reward_std": 0.11155148297548294, "rewards/reward_accuracy/mean": 0.978125, "rewards/reward_accuracy/std": 0.11136658638715743, "rewards/reward_format/mean": 0.0999609388411045, "rewards/reward_format/std": 0.0006250000558793544, "sampling/importance_sampling_ratio/max": 2.3851337790489198, "sampling/importance_sampling_ratio/mean": 0.9977000594139099, "sampling/importance_sampling_ratio/min": 0.19313232675194741, "sampling/sampling_logp_difference/max": 1.2368520081043244, "sampling/sampling_logp_difference/mean": 0.003545845905318856, "step": 14780, "step_time": 4.00567868789949 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00078125, "completions/max_length": 688.2, "completions/max_terminated_length": 462.1, "completions/mean_length": 129.938671875, "completions/mean_terminated_length": 128.45176544189454, "completions/min_length": 63.5, "completions/min_terminated_length": 63.5, "entropy": 0.030875736847519875, "epoch": 31.670235546038544, "frac_reward_zero_std": 0.95625, "grad_norm": 0.0, "learning_rate": 8.5211e-06, "loss": -0.0021, "num_tokens": 1449976828.0, "reward": 1.0835742473602294, "reward_std": 0.07509848773479462, "rewards/reward_accuracy/mean": 0.98359375, "rewards/reward_accuracy/std": 0.07503133341670036, "rewards/reward_format/mean": 0.09998046979308128, "rewards/reward_format/std": 0.0003125000046566129, "sampling/importance_sampling_ratio/max": 2.408078503608704, "sampling/importance_sampling_ratio/mean": 0.9966578722000122, "sampling/importance_sampling_ratio/min": 0.1400563722476363, "sampling/sampling_logp_difference/max": 0.8719683051109314, "sampling/sampling_logp_difference/mean": 0.003544735279865563, "step": 14790, "step_time": 3.651573937194189 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 1573.7, "completions/max_terminated_length": 1281.1, "completions/mean_length": 166.340625, "completions/mean_terminated_length": 158.98761901855468, "completions/min_length": 65.0, "completions/min_terminated_length": 65.0, "entropy": 0.041352284816093744, "epoch": 31.69164882226981, "frac_reward_zero_std": 0.925, "grad_norm": 0.0888671875, "learning_rate": 8.520100000000002e-06, "loss": -0.005, "num_tokens": 1450924116.0, "reward": 1.0763672113418579, "reward_std": 0.1306396298110485, "rewards/reward_accuracy/mean": 0.9765625, "rewards/reward_accuracy/std": 0.12914467006921768, "rewards/reward_format/mean": 0.09980468899011612, "rewards/reward_format/std": 0.002398134325630963, "sampling/importance_sampling_ratio/max": 2.439843940734863, "sampling/importance_sampling_ratio/mean": 0.9894351363182068, "sampling/importance_sampling_ratio/min": 0.12367985025048256, "sampling/sampling_logp_difference/max": 1.0297227382659913, "sampling/sampling_logp_difference/mean": 0.003846147353760898, "step": 14800, "step_time": 7.650747406895971 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003125, "completions/max_length": 975.4, "completions/max_terminated_length": 950.0, "completions/mean_length": 150.099609375, "completions/mean_terminated_length": 144.23769836425782, "completions/min_length": 65.1, "completions/min_terminated_length": 65.1, "entropy": 0.03633915723767132, "epoch": 31.71306209850107, "frac_reward_zero_std": 0.9375, "grad_norm": 0.0, "learning_rate": 8.5191e-06, "loss": -0.003, "num_tokens": 1451816291.0, "reward": 1.0677344083786011, "reward_std": 0.1460917167365551, "rewards/reward_accuracy/mean": 0.96796875, "rewards/reward_accuracy/std": 0.1449730671942234, "rewards/reward_format/mean": 0.09976562708616257, "rewards/reward_format/std": 0.0022832523100078106, "sampling/importance_sampling_ratio/max": 2.368962752819061, "sampling/importance_sampling_ratio/mean": 0.9898596823215484, "sampling/importance_sampling_ratio/min": 0.1563183680176735, "sampling/sampling_logp_difference/max": 0.9824113965034484, "sampling/sampling_logp_difference/mean": 0.0038422230631113053, "step": 14810, "step_time": 5.0534887067857195 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005859375, "completions/max_length": 1060.8, "completions/max_terminated_length": 754.4, "completions/mean_length": 152.99140625, "completions/mean_terminated_length": 141.96544952392577, "completions/min_length": 65.5, "completions/min_terminated_length": 65.5, "entropy": 0.037088018865324555, "epoch": 31.734475374732334, "frac_reward_zero_std": 0.94375, "grad_norm": 0.51953125, "learning_rate": 8.5181e-06, "loss": -0.0006, "num_tokens": 1452726317.0, "reward": 1.0753320574760437, "reward_std": 0.10431017652153969, "rewards/reward_accuracy/mean": 0.97578125, "rewards/reward_accuracy/std": 0.10198963657021523, "rewards/reward_format/mean": 0.09955078288912773, "rewards/reward_format/std": 0.003040002495981753, "sampling/importance_sampling_ratio/max": 2.564653491973877, "sampling/importance_sampling_ratio/mean": 0.9912839531898499, "sampling/importance_sampling_ratio/min": 0.1250743694603443, "sampling/sampling_logp_difference/max": 1.258508664369583, "sampling/sampling_logp_difference/mean": 0.0038536913692951203, "step": 14820, "step_time": 5.405504616699181 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003125, "completions/max_length": 1153.8, "completions/max_terminated_length": 824.6, "completions/mean_length": 156.608984375, "completions/mean_terminated_length": 150.71151275634764, "completions/min_length": 70.6, "completions/min_terminated_length": 70.6, "entropy": 0.03746920770499855, "epoch": 31.7558886509636, "frac_reward_zero_std": 0.94375, "grad_norm": 0.0, "learning_rate": 8.5171e-06, "loss": -0.01, "num_tokens": 1453650212.0, "reward": 1.0743554830551147, "reward_std": 0.12251449525356292, "rewards/reward_accuracy/mean": 0.974609375, "rewards/reward_accuracy/std": 0.12074178606271743, "rewards/reward_format/mean": 0.09974609464406967, "rewards/reward_format/std": 0.0030663751531392336, "sampling/importance_sampling_ratio/max": 2.4845930218696592, "sampling/importance_sampling_ratio/mean": 0.9907613396644592, "sampling/importance_sampling_ratio/min": 0.1595868781208992, "sampling/sampling_logp_difference/max": 0.9008425891399383, "sampling/sampling_logp_difference/mean": 0.0036834746599197386, "step": 14830, "step_time": 5.58923991479387 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.000390625, "completions/max_length": 913.2, "completions/max_terminated_length": 734.8, "completions/mean_length": 137.345703125, "completions/mean_terminated_length": 136.60191345214844, "completions/min_length": 65.9, "completions/min_terminated_length": 65.9, "entropy": 0.0328524834709242, "epoch": 31.77730192719486, "frac_reward_zero_std": 0.95, "grad_norm": 1.1015625, "learning_rate": 8.5161e-06, "loss": -0.0011, "num_tokens": 1454517145.0, "reward": 1.0929297089576722, "reward_std": 0.06195746883749962, "rewards/reward_accuracy/mean": 0.99296875, "rewards/reward_accuracy/std": 0.06133247092366219, "rewards/reward_format/mean": 0.0999609388411045, "rewards/reward_format/std": 0.0006250000558793544, "sampling/importance_sampling_ratio/max": 2.3566166520118714, "sampling/importance_sampling_ratio/mean": 0.9938568711280823, "sampling/importance_sampling_ratio/min": 0.11025267653167248, "sampling/sampling_logp_difference/max": 0.8908377707004547, "sampling/sampling_logp_difference/mean": 0.0036982923978939653, "step": 14840, "step_time": 4.6118272091029215 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003515625, "completions/max_length": 1189.1, "completions/max_terminated_length": 941.2, "completions/mean_length": 155.857421875, "completions/mean_terminated_length": 149.22373657226564, "completions/min_length": 65.0, "completions/min_terminated_length": 65.0, "entropy": 0.03434008716139943, "epoch": 31.798715203426124, "frac_reward_zero_std": 0.925, "grad_norm": 0.32421875, "learning_rate": 8.515100000000001e-06, "loss": -0.0075, "num_tokens": 1455425916.0, "reward": 1.0688086152076721, "reward_std": 0.1332020454108715, "rewards/reward_accuracy/mean": 0.969140625, "rewards/reward_accuracy/std": 0.13190364763140677, "rewards/reward_format/mean": 0.09966796934604645, "rewards/reward_format/std": 0.003334212489426136, "sampling/importance_sampling_ratio/max": 2.410148096084595, "sampling/importance_sampling_ratio/mean": 0.9933686256408691, "sampling/importance_sampling_ratio/min": 0.1593768835067749, "sampling/sampling_logp_difference/max": 1.0335906744003296, "sampling/sampling_logp_difference/mean": 0.0035198803758248686, "step": 14850, "step_time": 5.787000390098546 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001953125, "completions/max_length": 1252.4, "completions/max_terminated_length": 998.4, "completions/mean_length": 148.1359375, "completions/mean_terminated_length": 144.42149200439454, "completions/min_length": 65.5, "completions/min_terminated_length": 65.5, "entropy": 0.03711564266122878, "epoch": 31.820128479657388, "frac_reward_zero_std": 0.93125, "grad_norm": 0.333984375, "learning_rate": 8.5141e-06, "loss": -0.0002, "num_tokens": 1456320744.0, "reward": 1.0663476586341858, "reward_std": 0.14201294332742692, "rewards/reward_accuracy/mean": 0.96640625, "rewards/reward_accuracy/std": 0.14178462624549865, "rewards/reward_format/mean": 0.09994140639901161, "rewards/reward_format/std": 0.0009375000139698386, "sampling/importance_sampling_ratio/max": 2.4280987858772276, "sampling/importance_sampling_ratio/mean": 0.9835132718086242, "sampling/importance_sampling_ratio/min": 0.1567633755505085, "sampling/sampling_logp_difference/max": 0.9788933396339417, "sampling/sampling_logp_difference/mean": 0.00385088799521327, "step": 14860, "step_time": 6.154394888208481 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0109375, "completions/max_length": 1671.6, "completions/max_terminated_length": 1009.7, "completions/mean_length": 163.093359375, "completions/mean_terminated_length": 142.32928543090821, "completions/min_length": 64.3, "completions/min_terminated_length": 64.3, "entropy": 0.039823967637494205, "epoch": 31.841541755888652, "frac_reward_zero_std": 0.9375, "grad_norm": 0.15234375, "learning_rate": 8.513100000000002e-06, "loss": -0.0037, "num_tokens": 1457251399.0, "reward": 1.0551953256130218, "reward_std": 0.17518158331513406, "rewards/reward_accuracy/mean": 0.955859375, "rewards/reward_accuracy/std": 0.1717665061354637, "rewards/reward_format/mean": 0.09933593794703484, "rewards/reward_format/std": 0.006166409398429096, "sampling/importance_sampling_ratio/max": 2.659245562553406, "sampling/importance_sampling_ratio/mean": 0.9864839732646942, "sampling/importance_sampling_ratio/min": 0.08218387262895703, "sampling/sampling_logp_difference/max": 1.1007038712501527, "sampling/sampling_logp_difference/mean": 0.003951135417446494, "step": 14870, "step_time": 8.063844294205774 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00234375, "completions/max_length": 1132.7, "completions/max_terminated_length": 915.3, "completions/mean_length": 148.238671875, "completions/mean_terminated_length": 143.8244369506836, "completions/min_length": 65.4, "completions/min_terminated_length": 65.4, "entropy": 0.035486059240065516, "epoch": 31.862955032119913, "frac_reward_zero_std": 0.925, "grad_norm": 0.255859375, "learning_rate": 8.512100000000001e-06, "loss": -0.0061, "num_tokens": 1458150250.0, "reward": 1.0744922161102295, "reward_std": 0.12300103902816772, "rewards/reward_accuracy/mean": 0.974609375, "rewards/reward_accuracy/std": 0.12239512652158738, "rewards/reward_format/mean": 0.09988281428813935, "rewards/reward_format/std": 0.001387959998100996, "sampling/importance_sampling_ratio/max": 2.372790789604187, "sampling/importance_sampling_ratio/mean": 0.9878783106803894, "sampling/importance_sampling_ratio/min": 0.08341474495828152, "sampling/sampling_logp_difference/max": 0.9976695537567138, "sampling/sampling_logp_difference/mean": 0.0037142841378226877, "step": 14880, "step_time": 5.736107476608595 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00625, "completions/max_length": 1142.2, "completions/max_terminated_length": 1135.5, "completions/mean_length": 162.638671875, "completions/mean_terminated_length": 150.95650329589844, "completions/min_length": 61.2, "completions/min_terminated_length": 61.2, "entropy": 0.039856042829342186, "epoch": 31.884368308351178, "frac_reward_zero_std": 0.9625, "grad_norm": 0.0, "learning_rate": 8.5111e-06, "loss": -0.0007, "num_tokens": 1459087165.0, "reward": 1.0557617366313934, "reward_std": 0.16197027743328363, "rewards/reward_accuracy/mean": 0.95625, "rewards/reward_accuracy/std": 0.15993321388959886, "rewards/reward_format/mean": 0.09951172024011612, "rewards/reward_format/std": 0.0035254548070952295, "sampling/importance_sampling_ratio/max": 2.460556423664093, "sampling/importance_sampling_ratio/mean": 0.9890987932682037, "sampling/importance_sampling_ratio/min": 0.09815075248479843, "sampling/sampling_logp_difference/max": 1.0763937950134277, "sampling/sampling_logp_difference/mean": 0.003708662395365536, "step": 14890, "step_time": 5.7678498457011305 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.002734375, "completions/max_length": 876.1, "completions/max_terminated_length": 683.1, "completions/mean_length": 151.74140625, "completions/mean_terminated_length": 146.62962341308594, "completions/min_length": 68.0, "completions/min_terminated_length": 68.0, "entropy": 0.03610718541312963, "epoch": 31.905781584582442, "frac_reward_zero_std": 0.93125, "grad_norm": 0.30859375, "learning_rate": 8.510100000000002e-06, "loss": 0.0027, "num_tokens": 1459996279.0, "reward": 1.077929711341858, "reward_std": 0.09640606939792633, "rewards/reward_accuracy/mean": 0.978125, "rewards/reward_accuracy/std": 0.09574450701475143, "rewards/reward_format/mean": 0.09980468899011612, "rewards/reward_format/std": 0.0016836996655911207, "sampling/importance_sampling_ratio/max": 2.504521894454956, "sampling/importance_sampling_ratio/mean": 0.9968731999397278, "sampling/importance_sampling_ratio/min": 0.17793384790420533, "sampling/sampling_logp_difference/max": 0.8135426282882691, "sampling/sampling_logp_difference/mean": 0.0037046227138489486, "step": 14900, "step_time": 4.5692169579939215 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.007421875, "completions/max_length": 1343.4, "completions/max_terminated_length": 1045.6, "completions/mean_length": 167.1984375, "completions/mean_terminated_length": 153.41667938232422, "completions/min_length": 67.7, "completions/min_terminated_length": 67.7, "entropy": 0.042883167741820216, "epoch": 31.927194860813703, "frac_reward_zero_std": 0.9125, "grad_norm": 0.177734375, "learning_rate": 8.509100000000001e-06, "loss": -0.0028, "num_tokens": 1460944739.0, "reward": 1.0643945395946504, "reward_std": 0.14314212575554847, "rewards/reward_accuracy/mean": 0.96484375, "rewards/reward_accuracy/std": 0.14154978916049005, "rewards/reward_format/mean": 0.09955078214406968, "rewards/reward_format/std": 0.0038428531493991613, "sampling/importance_sampling_ratio/max": 2.5006950974464415, "sampling/importance_sampling_ratio/mean": 0.9852002739906311, "sampling/importance_sampling_ratio/min": 0.12245299313217402, "sampling/sampling_logp_difference/max": 0.905967366695404, "sampling/sampling_logp_difference/mean": 0.003979846695438027, "step": 14910, "step_time": 6.771594164703856 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00234375, "completions/max_length": 993.8, "completions/max_terminated_length": 897.6, "completions/mean_length": 151.421484375, "completions/mean_terminated_length": 147.05479431152344, "completions/min_length": 63.1, "completions/min_terminated_length": 63.1, "entropy": 0.03821591839659959, "epoch": 31.948608137044967, "frac_reward_zero_std": 0.93125, "grad_norm": 0.2333984375, "learning_rate": 8.5081e-06, "loss": -0.0052, "num_tokens": 1461848586.0, "reward": 1.0915429830551147, "reward_std": 0.060783660411834715, "rewards/reward_accuracy/mean": 0.991796875, "rewards/reward_accuracy/std": 0.05946628451347351, "rewards/reward_format/mean": 0.09974609389901161, "rewards/reward_format/std": 0.0023240381153300403, "sampling/importance_sampling_ratio/max": 2.3888060212135316, "sampling/importance_sampling_ratio/mean": 0.9872592985630035, "sampling/importance_sampling_ratio/min": 0.17441023662686347, "sampling/sampling_logp_difference/max": 0.9966249465942383, "sampling/sampling_logp_difference/mean": 0.0036869045346975327, "step": 14920, "step_time": 4.996814598303172 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001171875, "completions/max_length": 1062.4, "completions/max_terminated_length": 1013.7, "completions/mean_length": 146.103515625, "completions/mean_terminated_length": 143.90928955078124, "completions/min_length": 66.9, "completions/min_terminated_length": 66.9, "entropy": 0.03385720159858465, "epoch": 31.970021413276232, "frac_reward_zero_std": 0.94375, "grad_norm": 0.0, "learning_rate": 8.5071e-06, "loss": -0.0063, "num_tokens": 1462737507.0, "reward": 1.0459375023841857, "reward_std": 0.1860494814813137, "rewards/reward_accuracy/mean": 0.94609375, "rewards/reward_accuracy/std": 0.18525404632091522, "rewards/reward_format/mean": 0.09984375089406967, "rewards/reward_format/std": 0.0021321488078683616, "sampling/importance_sampling_ratio/max": 2.3183075308799745, "sampling/importance_sampling_ratio/mean": 0.9862264513969421, "sampling/importance_sampling_ratio/min": 0.1084387719631195, "sampling/sampling_logp_difference/max": 0.7735653936862945, "sampling/sampling_logp_difference/mean": 0.003628298523835838, "step": 14930, "step_time": 5.248820918810088 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.006640625, "completions/max_length": 1585.0, "completions/max_terminated_length": 1161.7, "completions/mean_length": 169.090625, "completions/mean_terminated_length": 156.68988571166992, "completions/min_length": 67.2, "completions/min_terminated_length": 67.2, "entropy": 0.04576894536148757, "epoch": 31.991434689507496, "frac_reward_zero_std": 0.875, "grad_norm": 0.31640625, "learning_rate": 8.5061e-06, "loss": -0.0062, "num_tokens": 1463690923.0, "reward": 1.0587304890155793, "reward_std": 0.16893045604228973, "rewards/reward_accuracy/mean": 0.959375, "rewards/reward_accuracy/std": 0.165758103877306, "rewards/reward_format/mean": 0.09935547038912773, "rewards/reward_format/std": 0.006099873711355031, "sampling/importance_sampling_ratio/max": 2.5018293142318724, "sampling/importance_sampling_ratio/mean": 0.9948447704315185, "sampling/importance_sampling_ratio/min": 0.108500312641263, "sampling/sampling_logp_difference/max": 1.118441289663315, "sampling/sampling_logp_difference/mean": 0.004050096101127565, "step": 14940, "step_time": 7.616310878103832 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005078125, "completions/max_length": 1190.5, "completions/max_terminated_length": 940.5, "completions/mean_length": 154.19609375, "completions/mean_terminated_length": 144.60600738525392, "completions/min_length": 63.0, "completions/min_terminated_length": 63.0, "entropy": 0.03867314555682242, "epoch": 32.01284796573876, "frac_reward_zero_std": 0.9375, "grad_norm": 0.69921875, "learning_rate": 8.505100000000001e-06, "loss": -0.0015, "num_tokens": 1464600817.0, "reward": 1.07066410779953, "reward_std": 0.14021532535552977, "rewards/reward_accuracy/mean": 0.97109375, "rewards/reward_accuracy/std": 0.13835152685642244, "rewards/reward_format/mean": 0.09957031533122063, "rewards/reward_format/std": 0.0033983222208917143, "sampling/importance_sampling_ratio/max": 2.578583288192749, "sampling/importance_sampling_ratio/mean": 0.9893185913562774, "sampling/importance_sampling_ratio/min": 0.078243513032794, "sampling/sampling_logp_difference/max": 1.1785414576530457, "sampling/sampling_logp_difference/mean": 0.004083247412927449, "step": 14950, "step_time": 5.845286836801097 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00703125, "completions/max_length": 1305.0, "completions/max_terminated_length": 1238.9, "completions/mean_length": 170.1, "completions/mean_terminated_length": 156.95433044433594, "completions/min_length": 66.3, "completions/min_terminated_length": 66.3, "entropy": 0.04164734953083098, "epoch": 32.03426124197002, "frac_reward_zero_std": 0.925, "grad_norm": 0.224609375, "learning_rate": 8.5041e-06, "loss": -0.0092, "num_tokens": 1465555713.0, "reward": 1.059628927707672, "reward_std": 0.16119444519281387, "rewards/reward_accuracy/mean": 0.96015625, "rewards/reward_accuracy/std": 0.1591213010251522, "rewards/reward_format/mean": 0.09947265684604645, "rewards/reward_format/std": 0.0038210672326385977, "sampling/importance_sampling_ratio/max": 2.4970685958862306, "sampling/importance_sampling_ratio/mean": 0.9819199979305268, "sampling/importance_sampling_ratio/min": 0.08141536936163903, "sampling/sampling_logp_difference/max": 1.3003840923309327, "sampling/sampling_logp_difference/mean": 0.004159195395186543, "step": 14960, "step_time": 6.606145804506378 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00546875, "completions/max_length": 1030.7, "completions/max_terminated_length": 900.7, "completions/mean_length": 157.049609375, "completions/mean_terminated_length": 146.87604675292968, "completions/min_length": 62.0, "completions/min_terminated_length": 62.0, "entropy": 0.04202926310244948, "epoch": 32.055674518201286, "frac_reward_zero_std": 0.94375, "grad_norm": 0.0, "learning_rate": 8.5031e-06, "loss": -0.006, "num_tokens": 1466476352.0, "reward": 1.074609398841858, "reward_std": 0.10781847313046455, "rewards/reward_accuracy/mean": 0.975, "rewards/reward_accuracy/std": 0.106093118339777, "rewards/reward_format/mean": 0.09960937649011611, "rewards/reward_format/std": 0.003128172550350428, "sampling/importance_sampling_ratio/max": 2.4818204164505007, "sampling/importance_sampling_ratio/mean": 0.9857363760471344, "sampling/importance_sampling_ratio/min": 0.1247762992978096, "sampling/sampling_logp_difference/max": 1.0524136900901795, "sampling/sampling_logp_difference/mean": 0.003895054361782968, "step": 14970, "step_time": 5.442828903099871 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005078125, "completions/max_length": 1451.4, "completions/max_terminated_length": 1403.4, "completions/mean_length": 158.03828125, "completions/mean_terminated_length": 148.5005661010742, "completions/min_length": 67.7, "completions/min_terminated_length": 67.7, "entropy": 0.03709569664206356, "epoch": 32.07708779443255, "frac_reward_zero_std": 0.94375, "grad_norm": 0.0, "learning_rate": 8.502100000000001e-06, "loss": -0.0085, "num_tokens": 1467402082.0, "reward": 1.0734375357627868, "reward_std": 0.12447535172104836, "rewards/reward_accuracy/mean": 0.973828125, "rewards/reward_accuracy/std": 0.12286859676241875, "rewards/reward_format/mean": 0.09960937723517418, "rewards/reward_format/std": 0.003029373474419117, "sampling/importance_sampling_ratio/max": 2.539838719367981, "sampling/importance_sampling_ratio/mean": 0.9801316797733307, "sampling/importance_sampling_ratio/min": 0.05487128049135208, "sampling/sampling_logp_difference/max": 1.1306152164936065, "sampling/sampling_logp_difference/mean": 0.003843037132173777, "step": 14980, "step_time": 7.105406770497211 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00859375, "completions/max_length": 1289.9, "completions/max_terminated_length": 1123.8, "completions/mean_length": 170.93359375, "completions/mean_terminated_length": 154.81078033447267, "completions/min_length": 60.9, "completions/min_terminated_length": 60.9, "entropy": 0.038643663330003616, "epoch": 32.098501070663815, "frac_reward_zero_std": 0.925, "grad_norm": 0.2490234375, "learning_rate": 8.5011e-06, "loss": -0.005, "num_tokens": 1468363736.0, "reward": 1.075292992591858, "reward_std": 0.11339533478021621, "rewards/reward_accuracy/mean": 0.97578125, "rewards/reward_accuracy/std": 0.1110015481710434, "rewards/reward_format/mean": 0.09951172098517418, "rewards/reward_format/std": 0.0036208396777510643, "sampling/importance_sampling_ratio/max": 2.536261558532715, "sampling/importance_sampling_ratio/mean": 0.9816598892211914, "sampling/importance_sampling_ratio/min": 0.12029192745685577, "sampling/sampling_logp_difference/max": 1.0784489572048188, "sampling/sampling_logp_difference/mean": 0.0035862349905073643, "step": 14990, "step_time": 6.4186357164056975 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001953125, "completions/max_length": 1427.6, "completions/max_terminated_length": 1134.1, "completions/mean_length": 163.7171875, "completions/mean_terminated_length": 160.0257141113281, "completions/min_length": 67.5, "completions/min_terminated_length": 67.5, "entropy": 0.04275866146199405, "epoch": 32.11991434689507, "frac_reward_zero_std": 0.93125, "grad_norm": 0.478515625, "learning_rate": 8.500100000000002e-06, "loss": -0.0012, "num_tokens": 1469311700.0, "reward": 1.070507824420929, "reward_std": 0.12528944239020348, "rewards/reward_accuracy/mean": 0.970703125, "rewards/reward_accuracy/std": 0.12447534576058387, "rewards/reward_format/mean": 0.09980468824505806, "rewards/reward_format/std": 0.0020718434127047656, "sampling/importance_sampling_ratio/max": 2.438786232471466, "sampling/importance_sampling_ratio/mean": 0.9859391152858734, "sampling/importance_sampling_ratio/min": 0.05016997903585434, "sampling/sampling_logp_difference/max": 1.020617461204529, "sampling/sampling_logp_difference/mean": 0.003968309657648206, "step": 15000, "step_time": 6.966543590312358 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003125, "completions/max_length": 1360.1, "completions/max_terminated_length": 1141.9, "completions/mean_length": 156.109375, "completions/mean_terminated_length": 150.21336669921874, "completions/min_length": 67.7, "completions/min_terminated_length": 67.7, "entropy": 0.04119085532147437, "epoch": 32.14132762312634, "frac_reward_zero_std": 0.9, "grad_norm": 0.19140625, "learning_rate": 8.499100000000001e-06, "loss": -0.0086, "num_tokens": 1470229548.0, "reward": 1.0697461187839508, "reward_std": 0.1416443757712841, "rewards/reward_accuracy/mean": 0.969921875, "rewards/reward_accuracy/std": 0.14013767167925834, "rewards/reward_format/mean": 0.0998242199420929, "rewards/reward_format/std": 0.0022607231279835106, "sampling/importance_sampling_ratio/max": 2.5695250153541567, "sampling/importance_sampling_ratio/mean": 0.9799460768699646, "sampling/importance_sampling_ratio/min": 0.11666427627205848, "sampling/sampling_logp_difference/max": 1.0334583044052124, "sampling/sampling_logp_difference/mean": 0.004111215099692344, "step": 15010, "step_time": 6.36548008248792 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0046875, "completions/max_length": 1263.5, "completions/max_terminated_length": 1153.9, "completions/mean_length": 162.1109375, "completions/mean_terminated_length": 153.31731109619142, "completions/min_length": 69.0, "completions/min_terminated_length": 69.0, "entropy": 0.036614530626684426, "epoch": 32.1627408993576, "frac_reward_zero_std": 0.89375, "grad_norm": 0.0, "learning_rate": 8.498100000000001e-06, "loss": -0.0041, "num_tokens": 1471168952.0, "reward": 1.0769922018051148, "reward_std": 0.11268405392765998, "rewards/reward_accuracy/mean": 0.97734375, "rewards/reward_accuracy/std": 0.11085866615176201, "rewards/reward_format/mean": 0.09964843839406967, "rewards/reward_format/std": 0.0035709035582840443, "sampling/importance_sampling_ratio/max": 2.43343300819397, "sampling/importance_sampling_ratio/mean": 0.9911847770214081, "sampling/importance_sampling_ratio/min": 0.19121461734175682, "sampling/sampling_logp_difference/max": 1.2458908319473267, "sampling/sampling_logp_difference/mean": 0.003699503280222416, "step": 15020, "step_time": 6.258799441988231 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001171875, "completions/max_length": 943.0, "completions/max_terminated_length": 710.0, "completions/mean_length": 153.060546875, "completions/mean_terminated_length": 150.82333374023438, "completions/min_length": 64.4, "completions/min_terminated_length": 64.4, "entropy": 0.037966274586506185, "epoch": 32.184154175588866, "frac_reward_zero_std": 0.94375, "grad_norm": 0.228515625, "learning_rate": 8.4971e-06, "loss": -0.0054, "num_tokens": 1472088211.0, "reward": 1.0757031321525574, "reward_std": 0.09800993874669076, "rewards/reward_accuracy/mean": 0.97578125, "rewards/reward_accuracy/std": 0.09724199324846268, "rewards/reward_format/mean": 0.09992187544703483, "rewards/reward_format/std": 0.0012500000651925803, "sampling/importance_sampling_ratio/max": 2.4720186471939085, "sampling/importance_sampling_ratio/mean": 0.9913776040077209, "sampling/importance_sampling_ratio/min": 0.11726858913898468, "sampling/sampling_logp_difference/max": 1.1257975578308106, "sampling/sampling_logp_difference/mean": 0.0040051921736449, "step": 15030, "step_time": 4.930224724597065 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005859375, "completions/max_length": 961.9, "completions/max_terminated_length": 938.5, "completions/mean_length": 155.33203125, "completions/mean_terminated_length": 144.3095947265625, "completions/min_length": 68.1, "completions/min_terminated_length": 68.1, "entropy": 0.03819172086659819, "epoch": 32.20556745182013, "frac_reward_zero_std": 0.95625, "grad_norm": 0.2294921875, "learning_rate": 8.4961e-06, "loss": -0.0001, "num_tokens": 1473002341.0, "reward": 1.076425802707672, "reward_std": 0.09884055256843567, "rewards/reward_accuracy/mean": 0.976953125, "rewards/reward_accuracy/std": 0.09685125648975372, "rewards/reward_format/mean": 0.0994726575911045, "rewards/reward_format/std": 0.0029172270558774473, "sampling/importance_sampling_ratio/max": 2.4935776233673095, "sampling/importance_sampling_ratio/mean": 0.9963552534580231, "sampling/importance_sampling_ratio/min": 0.25097215473651885, "sampling/sampling_logp_difference/max": 0.9917688250541687, "sampling/sampling_logp_difference/mean": 0.003926735348068177, "step": 15040, "step_time": 5.049076426000101 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00625, "completions/max_length": 821.7, "completions/max_terminated_length": 744.7, "completions/mean_length": 155.414453125, "completions/mean_terminated_length": 143.87588958740236, "completions/min_length": 62.2, "completions/min_terminated_length": 62.2, "entropy": 0.03550848276354372, "epoch": 32.226980728051394, "frac_reward_zero_std": 0.95, "grad_norm": 0.0, "learning_rate": 8.495100000000001e-06, "loss": -0.0032, "num_tokens": 1473914490.0, "reward": 1.0608789205551148, "reward_std": 0.14445207566022872, "rewards/reward_accuracy/mean": 0.961328125, "rewards/reward_accuracy/std": 0.1430625334382057, "rewards/reward_format/mean": 0.09955078214406968, "rewards/reward_format/std": 0.0028459371067583563, "sampling/importance_sampling_ratio/max": 2.403583037853241, "sampling/importance_sampling_ratio/mean": 0.9899538040161133, "sampling/importance_sampling_ratio/min": 0.21518708746880294, "sampling/sampling_logp_difference/max": 1.0351561427116394, "sampling/sampling_logp_difference/mean": 0.003643289860337973, "step": 15050, "step_time": 4.61134499219479 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00234375, "completions/max_length": 1140.4, "completions/max_terminated_length": 872.2, "completions/mean_length": 153.118359375, "completions/mean_terminated_length": 148.67119445800782, "completions/min_length": 68.3, "completions/min_terminated_length": 68.3, "entropy": 0.03626874811016023, "epoch": 32.24839400428265, "frac_reward_zero_std": 0.9125, "grad_norm": 0.08203125, "learning_rate": 8.4941e-06, "loss": -0.0097, "num_tokens": 1474821881.0, "reward": 1.069394552707672, "reward_std": 0.13973613157868386, "rewards/reward_accuracy/mean": 0.96953125, "rewards/reward_accuracy/std": 0.13916807621717453, "rewards/reward_format/mean": 0.09986328259110451, "rewards/reward_format/std": 0.0018196487100794912, "sampling/importance_sampling_ratio/max": 2.5295819997787476, "sampling/importance_sampling_ratio/mean": 0.9890917301177978, "sampling/importance_sampling_ratio/min": 0.04468413218855858, "sampling/sampling_logp_difference/max": 0.9458189010620117, "sampling/sampling_logp_difference/mean": 0.003789612022228539, "step": 15060, "step_time": 5.520926315587713 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00234375, "completions/max_length": 1333.5, "completions/max_terminated_length": 1029.3, "completions/mean_length": 146.457421875, "completions/mean_terminated_length": 141.98082885742187, "completions/min_length": 64.0, "completions/min_terminated_length": 64.0, "entropy": 0.04107818850316107, "epoch": 32.269807280513916, "frac_reward_zero_std": 0.8875, "grad_norm": 0.1396484375, "learning_rate": 8.4931e-06, "loss": -0.0082, "num_tokens": 1475715580.0, "reward": 1.0725586056709289, "reward_std": 0.13443865180015563, "rewards/reward_accuracy/mean": 0.97265625, "rewards/reward_accuracy/std": 0.13391047790646554, "rewards/reward_format/mean": 0.09990234449505805, "rewards/reward_format/std": 0.0013785743853077293, "sampling/importance_sampling_ratio/max": 2.361822760105133, "sampling/importance_sampling_ratio/mean": 0.9956988394260406, "sampling/importance_sampling_ratio/min": 0.11241634003818035, "sampling/sampling_logp_difference/max": 0.9776203632354736, "sampling/sampling_logp_difference/mean": 0.0040924749337136745, "step": 15070, "step_time": 6.293805586497183 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001953125, "completions/max_length": 1079.7, "completions/max_terminated_length": 956.6, "completions/mean_length": 149.11953125, "completions/mean_terminated_length": 145.43084869384765, "completions/min_length": 62.7, "completions/min_terminated_length": 62.7, "entropy": 0.03457401010673493, "epoch": 32.29122055674518, "frac_reward_zero_std": 0.9625, "grad_norm": 0.0751953125, "learning_rate": 8.492100000000001e-06, "loss": -0.0035, "num_tokens": 1476610302.0, "reward": 1.058496105670929, "reward_std": 0.15605363622307777, "rewards/reward_accuracy/mean": 0.95859375, "rewards/reward_accuracy/std": 0.1553635336458683, "rewards/reward_format/mean": 0.09990234449505805, "rewards/reward_format/std": 0.0013785744318738579, "sampling/importance_sampling_ratio/max": 2.526549768447876, "sampling/importance_sampling_ratio/mean": 0.9989199876785279, "sampling/importance_sampling_ratio/min": 0.1935075655579567, "sampling/sampling_logp_difference/max": 1.022071397304535, "sampling/sampling_logp_difference/mean": 0.0036891983589157464, "step": 15080, "step_time": 5.461002961805207 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.004296875, "completions/max_length": 1013.9, "completions/max_terminated_length": 790.7, "completions/mean_length": 152.789453125, "completions/mean_terminated_length": 144.7552917480469, "completions/min_length": 64.4, "completions/min_terminated_length": 64.4, "entropy": 0.037844337872229517, "epoch": 32.312633832976445, "frac_reward_zero_std": 0.925, "grad_norm": 0.0, "learning_rate": 8.4911e-06, "loss": 0.0013, "num_tokens": 1477515459.0, "reward": 1.0868359565734864, "reward_std": 0.07527909576892852, "rewards/reward_accuracy/mean": 0.987109375, "rewards/reward_accuracy/std": 0.07380942702293396, "rewards/reward_format/mean": 0.09972656294703483, "rewards/reward_format/std": 0.0024859577417373655, "sampling/importance_sampling_ratio/max": 2.389561951160431, "sampling/importance_sampling_ratio/mean": 0.9888874530792237, "sampling/importance_sampling_ratio/min": 0.17517341673374176, "sampling/sampling_logp_difference/max": 0.9232089996337891, "sampling/sampling_logp_difference/mean": 0.003781500784680247, "step": 15090, "step_time": 5.169360955993762 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00546875, "completions/max_length": 1509.2, "completions/max_terminated_length": 1040.7, "completions/mean_length": 152.0609375, "completions/mean_terminated_length": 141.6507766723633, "completions/min_length": 59.7, "completions/min_terminated_length": 59.7, "entropy": 0.041733550489880145, "epoch": 32.33404710920771, "frac_reward_zero_std": 0.925, "grad_norm": 0.0, "learning_rate": 8.490100000000002e-06, "loss": -0.0112, "num_tokens": 1478418895.0, "reward": 1.0687695384025573, "reward_std": 0.13510300666093827, "rewards/reward_accuracy/mean": 0.969140625, "rewards/reward_accuracy/std": 0.133123180270195, "rewards/reward_format/mean": 0.09962890669703484, "rewards/reward_format/std": 0.003336334344930947, "sampling/importance_sampling_ratio/max": 2.5250030755996704, "sampling/importance_sampling_ratio/mean": 0.9935706377029419, "sampling/importance_sampling_ratio/min": 0.06661339402198792, "sampling/sampling_logp_difference/max": 1.0870628952980042, "sampling/sampling_logp_difference/mean": 0.004109868011437356, "step": 15100, "step_time": 7.226348568801768 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00234375, "completions/max_length": 1117.9, "completions/max_terminated_length": 822.9, "completions/mean_length": 149.530078125, "completions/mean_terminated_length": 145.1213394165039, "completions/min_length": 65.3, "completions/min_terminated_length": 65.3, "entropy": 0.033021943154744805, "epoch": 32.355460385438974, "frac_reward_zero_std": 0.94375, "grad_norm": 0.48828125, "learning_rate": 8.489100000000001e-06, "loss": -0.0052, "num_tokens": 1479319228.0, "reward": 1.0713281512260437, "reward_std": 0.13113174736499786, "rewards/reward_accuracy/mean": 0.971484375, "rewards/reward_accuracy/std": 0.12997530102729798, "rewards/reward_format/mean": 0.09984375163912773, "rewards/reward_format/std": 0.00213214885443449, "sampling/importance_sampling_ratio/max": 2.3040297985076905, "sampling/importance_sampling_ratio/mean": 0.9849774599075317, "sampling/importance_sampling_ratio/min": 0.21996488198637962, "sampling/sampling_logp_difference/max": 0.8271182715892792, "sampling/sampling_logp_difference/mean": 0.003544457466341555, "step": 15110, "step_time": 5.604653238606988 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00078125, "completions/max_length": 956.2, "completions/max_terminated_length": 945.8, "completions/mean_length": 139.7359375, "completions/mean_terminated_length": 138.2746551513672, "completions/min_length": 61.2, "completions/min_terminated_length": 61.2, "entropy": 0.03238790475297719, "epoch": 32.37687366167024, "frac_reward_zero_std": 0.94375, "grad_norm": 0.0, "learning_rate": 8.488100000000001e-06, "loss": -0.0024, "num_tokens": 1480191512.0, "reward": 1.0831250190734862, "reward_std": 0.10341196954250335, "rewards/reward_accuracy/mean": 0.983203125, "rewards/reward_accuracy/std": 0.10285507515072823, "rewards/reward_format/mean": 0.09992187619209289, "rewards/reward_format/std": 0.0010101743275299669, "sampling/importance_sampling_ratio/max": 2.448414182662964, "sampling/importance_sampling_ratio/mean": 0.9975358963012695, "sampling/importance_sampling_ratio/min": 0.16872115321457387, "sampling/sampling_logp_difference/max": 0.8446707010269165, "sampling/sampling_logp_difference/mean": 0.0034713474102318286, "step": 15120, "step_time": 4.752273425116437 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00859375, "completions/max_length": 1335.9, "completions/max_terminated_length": 1156.2, "completions/mean_length": 171.228515625, "completions/mean_terminated_length": 155.18346557617187, "completions/min_length": 64.3, "completions/min_terminated_length": 64.3, "entropy": 0.046185734565369785, "epoch": 32.398286937901496, "frac_reward_zero_std": 0.90625, "grad_norm": 0.0, "learning_rate": 8.4871e-06, "loss": -0.0019, "num_tokens": 1481146801.0, "reward": 1.0550586223602294, "reward_std": 0.1585914485156536, "rewards/reward_accuracy/mean": 0.95546875, "rewards/reward_accuracy/std": 0.1568029649555683, "rewards/reward_format/mean": 0.09958984553813935, "rewards/reward_format/std": 0.003702771523967385, "sampling/importance_sampling_ratio/max": 2.4789270520210267, "sampling/importance_sampling_ratio/mean": 0.9833700954914093, "sampling/importance_sampling_ratio/min": 0.1334232408553362, "sampling/sampling_logp_difference/max": 0.859230375289917, "sampling/sampling_logp_difference/mean": 0.004027560725808144, "step": 15130, "step_time": 6.914646513998742 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.006640625, "completions/max_length": 1234.4, "completions/max_terminated_length": 1147.6, "completions/mean_length": 161.73125, "completions/mean_terminated_length": 149.25611877441406, "completions/min_length": 67.4, "completions/min_terminated_length": 67.4, "entropy": 0.044771532015874985, "epoch": 32.41970021413276, "frac_reward_zero_std": 0.91875, "grad_norm": 0.310546875, "learning_rate": 8.4861e-06, "loss": -0.0049, "num_tokens": 1482079281.0, "reward": 1.047675794363022, "reward_std": 0.1727794088423252, "rewards/reward_accuracy/mean": 0.948046875, "rewards/reward_accuracy/std": 0.17136834114789962, "rewards/reward_format/mean": 0.09962890669703484, "rewards/reward_format/std": 0.0034023164073005317, "sampling/importance_sampling_ratio/max": 2.488362991809845, "sampling/importance_sampling_ratio/mean": 0.9820115685462951, "sampling/importance_sampling_ratio/min": 0.11798058673739434, "sampling/sampling_logp_difference/max": 0.9973392844200134, "sampling/sampling_logp_difference/mean": 0.004187963507138193, "step": 15140, "step_time": 6.325403550994816 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00234375, "completions/max_length": 1519.2, "completions/max_terminated_length": 1085.4, "completions/mean_length": 147.46796875, "completions/mean_terminated_length": 143.01487731933594, "completions/min_length": 65.5, "completions/min_terminated_length": 65.5, "entropy": 0.03578829823527485, "epoch": 32.441113490364025, "frac_reward_zero_std": 0.9125, "grad_norm": 0.08154296875, "learning_rate": 8.485100000000001e-06, "loss": -0.0006, "num_tokens": 1482974367.0, "reward": 1.0663281321525573, "reward_std": 0.14564185515046119, "rewards/reward_accuracy/mean": 0.96640625, "rewards/reward_accuracy/std": 0.14510809779167175, "rewards/reward_format/mean": 0.09992187544703483, "rewards/reward_format/std": 0.0012500000651925803, "sampling/importance_sampling_ratio/max": 2.3287765741348267, "sampling/importance_sampling_ratio/mean": 0.9899421036243439, "sampling/importance_sampling_ratio/min": 0.12154159173369408, "sampling/sampling_logp_difference/max": 0.938415265083313, "sampling/sampling_logp_difference/mean": 0.0035825064638629555, "step": 15150, "step_time": 7.040528369203093 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.000390625, "completions/max_length": 709.8, "completions/max_terminated_length": 545.3, "completions/mean_length": 141.872265625, "completions/mean_terminated_length": 141.12591552734375, "completions/min_length": 63.6, "completions/min_terminated_length": 63.6, "entropy": 0.03131904574111104, "epoch": 32.46252676659529, "frac_reward_zero_std": 0.9625, "grad_norm": 0.0, "learning_rate": 8.4841e-06, "loss": -0.0009, "num_tokens": 1483856776.0, "reward": 1.0902148604393005, "reward_std": 0.06343144327402114, "rewards/reward_accuracy/mean": 0.990234375, "rewards/reward_accuracy/std": 0.0631189450621605, "rewards/reward_format/mean": 0.09998046979308128, "rewards/reward_format/std": 0.0003125000046566129, "sampling/importance_sampling_ratio/max": 2.4720770835876467, "sampling/importance_sampling_ratio/mean": 0.992953646183014, "sampling/importance_sampling_ratio/min": 0.13445141389966012, "sampling/sampling_logp_difference/max": 1.0256116151809693, "sampling/sampling_logp_difference/mean": 0.0034864077577367427, "step": 15160, "step_time": 3.840326446402469 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001953125, "completions/max_length": 1350.4, "completions/max_terminated_length": 1185.2, "completions/mean_length": 152.958203125, "completions/mean_terminated_length": 149.2882537841797, "completions/min_length": 63.0, "completions/min_terminated_length": 63.0, "entropy": 0.03690030789002776, "epoch": 32.48394004282655, "frac_reward_zero_std": 0.93125, "grad_norm": 0.1826171875, "learning_rate": 8.4831e-06, "loss": -0.0043, "num_tokens": 1484769181.0, "reward": 1.050976574420929, "reward_std": 0.17420097216963767, "rewards/reward_accuracy/mean": 0.951171875, "rewards/reward_accuracy/std": 0.17339904829859734, "rewards/reward_format/mean": 0.09980468899011612, "rewards/reward_format/std": 0.002270108601078391, "sampling/importance_sampling_ratio/max": 2.4464163303375246, "sampling/importance_sampling_ratio/mean": 0.9879769623279572, "sampling/importance_sampling_ratio/min": 0.13176800757646562, "sampling/sampling_logp_difference/max": 0.9541298031806946, "sampling/sampling_logp_difference/mean": 0.003759062825702131, "step": 15170, "step_time": 6.544317215005867 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0015625, "completions/max_length": 1034.4, "completions/max_terminated_length": 860.1, "completions/mean_length": 139.904296875, "completions/mean_terminated_length": 136.95101470947264, "completions/min_length": 64.0, "completions/min_terminated_length": 64.0, "entropy": 0.03409593699034304, "epoch": 32.50535331905782, "frac_reward_zero_std": 0.9625, "grad_norm": 0.296875, "learning_rate": 8.482100000000001e-06, "loss": -0.0008, "num_tokens": 1485643720.0, "reward": 1.0826562643051147, "reward_std": 0.08597816780675202, "rewards/reward_accuracy/mean": 0.9828125, "rewards/reward_accuracy/std": 0.08505937680602074, "rewards/reward_format/mean": 0.09984375089406967, "rewards/reward_format/std": 0.002132148714736104, "sampling/importance_sampling_ratio/max": 2.501770186424255, "sampling/importance_sampling_ratio/mean": 0.9879711091518402, "sampling/importance_sampling_ratio/min": 0.1265403863042593, "sampling/sampling_logp_difference/max": 0.9681031823158264, "sampling/sampling_logp_difference/mean": 0.003632461396045983, "step": 15180, "step_time": 5.061851918301545 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.002734375, "completions/max_length": 1252.0, "completions/max_terminated_length": 1092.4, "completions/mean_length": 151.254296875, "completions/mean_terminated_length": 146.14284973144532, "completions/min_length": 62.5, "completions/min_terminated_length": 62.5, "entropy": 0.03788953549228609, "epoch": 32.52676659528908, "frac_reward_zero_std": 0.95, "grad_norm": 0.25390625, "learning_rate": 8.4811e-06, "loss": -0.0043, "num_tokens": 1486541363.0, "reward": 1.0735937654972076, "reward_std": 0.11263482868671418, "rewards/reward_accuracy/mean": 0.973828125, "rewards/reward_accuracy/std": 0.1113666608929634, "rewards/reward_format/mean": 0.09976562559604644, "rewards/reward_format/std": 0.0024991744896396993, "sampling/importance_sampling_ratio/max": 2.279097092151642, "sampling/importance_sampling_ratio/mean": 0.981550145149231, "sampling/importance_sampling_ratio/min": 0.1714998658746481, "sampling/sampling_logp_difference/max": 1.1353399097919463, "sampling/sampling_logp_difference/mean": 0.0036806670716032384, "step": 15190, "step_time": 6.142958567201276 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00078125, "completions/max_length": 1178.3, "completions/max_terminated_length": 938.4, "completions/mean_length": 143.900390625, "completions/mean_terminated_length": 142.41666107177736, "completions/min_length": 69.8, "completions/min_terminated_length": 69.8, "entropy": 0.03225263599306345, "epoch": 32.54817987152034, "frac_reward_zero_std": 0.9375, "grad_norm": 0.2041015625, "learning_rate": 8.4801e-06, "loss": -0.0042, "num_tokens": 1487427860.0, "reward": 1.0873632788658143, "reward_std": 0.0765454389154911, "rewards/reward_accuracy/mean": 0.9875, "rewards/reward_accuracy/std": 0.0751818560063839, "rewards/reward_format/mean": 0.09986328110098838, "rewards/reward_format/std": 0.0021875001257285476, "sampling/importance_sampling_ratio/max": 2.406317377090454, "sampling/importance_sampling_ratio/mean": 0.99002525806427, "sampling/importance_sampling_ratio/min": 0.1970585733652115, "sampling/sampling_logp_difference/max": 1.033064639568329, "sampling/sampling_logp_difference/mean": 0.0035815596347674727, "step": 15200, "step_time": 5.62609824288811 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001171875, "completions/max_length": 636.2, "completions/max_terminated_length": 539.6, "completions/mean_length": 144.786328125, "completions/mean_terminated_length": 142.55914611816405, "completions/min_length": 66.7, "completions/min_terminated_length": 66.7, "entropy": 0.032963823154568674, "epoch": 32.569593147751604, "frac_reward_zero_std": 0.96875, "grad_norm": 0.0, "learning_rate": 8.479100000000002e-06, "loss": 0.0016, "num_tokens": 1488313137.0, "reward": 1.0877734541893005, "reward_std": 0.07392919957637786, "rewards/reward_accuracy/mean": 0.987890625, "rewards/reward_accuracy/std": 0.07320919334888458, "rewards/reward_format/mean": 0.09988281354308129, "rewards/reward_format/std": 0.0010782781988382339, "sampling/importance_sampling_ratio/max": 2.463735783100128, "sampling/importance_sampling_ratio/mean": 0.9958021998405456, "sampling/importance_sampling_ratio/min": 0.11144071072340012, "sampling/sampling_logp_difference/max": 1.0770709037780761, "sampling/sampling_logp_difference/mean": 0.003634589002467692, "step": 15210, "step_time": 3.5195595006196525 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.004296875, "completions/max_length": 1299.7, "completions/max_terminated_length": 1013.4, "completions/mean_length": 157.7421875, "completions/mean_terminated_length": 149.67906036376954, "completions/min_length": 63.4, "completions/min_terminated_length": 63.4, "entropy": 0.041077648545615374, "epoch": 32.59100642398287, "frac_reward_zero_std": 0.91875, "grad_norm": 0.361328125, "learning_rate": 8.478100000000001e-06, "loss": -0.0079, "num_tokens": 1489230701.0, "reward": 1.0676953494548798, "reward_std": 0.12724095806479455, "rewards/reward_accuracy/mean": 0.96796875, "rewards/reward_accuracy/std": 0.12632433995604514, "rewards/reward_format/mean": 0.09972656518220901, "rewards/reward_format/std": 0.0026420939713716505, "sampling/importance_sampling_ratio/max": 2.357902455329895, "sampling/importance_sampling_ratio/mean": 0.9798960864543915, "sampling/importance_sampling_ratio/min": 0.05444173337891698, "sampling/sampling_logp_difference/max": 0.9368861973285675, "sampling/sampling_logp_difference/mean": 0.0038275240221992135, "step": 15220, "step_time": 6.317245243297657 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0015625, "completions/max_length": 754.9, "completions/max_terminated_length": 668.3, "completions/mean_length": 141.874609375, "completions/mean_terminated_length": 138.91327209472655, "completions/min_length": 67.5, "completions/min_terminated_length": 67.5, "entropy": 0.03451827752869576, "epoch": 32.61241970021413, "frac_reward_zero_std": 0.93125, "grad_norm": 0.59765625, "learning_rate": 8.4771e-06, "loss": 0.0, "num_tokens": 1490108460.0, "reward": 1.0768554925918579, "reward_std": 0.11546299010515212, "rewards/reward_accuracy/mean": 0.976953125, "rewards/reward_accuracy/std": 0.11507504656910897, "rewards/reward_format/mean": 0.09990234524011612, "rewards/reward_format/std": 0.0013226743787527085, "sampling/importance_sampling_ratio/max": 2.356416177749634, "sampling/importance_sampling_ratio/mean": 0.9935881733894348, "sampling/importance_sampling_ratio/min": 0.1995488665997982, "sampling/sampling_logp_difference/max": 0.9557997465133667, "sampling/sampling_logp_difference/mean": 0.0037625545170158147, "step": 15230, "step_time": 3.88364778640389 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00078125, "completions/max_length": 1099.3, "completions/max_terminated_length": 813.9, "completions/mean_length": 136.149609375, "completions/mean_terminated_length": 134.6524345397949, "completions/min_length": 60.6, "completions/min_terminated_length": 60.6, "entropy": 0.034821746335364875, "epoch": 32.6338329764454, "frac_reward_zero_std": 0.9375, "grad_norm": 0.380859375, "learning_rate": 8.4761e-06, "loss": -0.008, "num_tokens": 1490972587.0, "reward": 1.0830859422683716, "reward_std": 0.09212900176644326, "rewards/reward_accuracy/mean": 0.983203125, "rewards/reward_accuracy/std": 0.09079669788479805, "rewards/reward_format/mean": 0.09988281279802322, "rewards/reward_format/std": 0.0018750001210719347, "sampling/importance_sampling_ratio/max": 2.5342894077301024, "sampling/importance_sampling_ratio/mean": 0.9917110562324524, "sampling/importance_sampling_ratio/min": 0.1339932220056653, "sampling/sampling_logp_difference/max": 0.9502469062805176, "sampling/sampling_logp_difference/mean": 0.0038586076581850646, "step": 15240, "step_time": 5.3123108587024035 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003515625, "completions/max_length": 1327.7, "completions/max_terminated_length": 1058.7, "completions/mean_length": 155.319921875, "completions/mean_terminated_length": 148.63643951416014, "completions/min_length": 63.7, "completions/min_terminated_length": 63.7, "entropy": 0.04060824904590845, "epoch": 32.65524625267666, "frac_reward_zero_std": 0.9125, "grad_norm": 0.546875, "learning_rate": 8.475100000000001e-06, "loss": -0.0046, "num_tokens": 1491883486.0, "reward": 1.0637890577316285, "reward_std": 0.1615943618118763, "rewards/reward_accuracy/mean": 0.9640625, "rewards/reward_accuracy/std": 0.16005595847964288, "rewards/reward_format/mean": 0.09972656220197677, "rewards/reward_format/std": 0.0031241744989529254, "sampling/importance_sampling_ratio/max": 2.2770654916763307, "sampling/importance_sampling_ratio/mean": 0.9747242033481598, "sampling/importance_sampling_ratio/min": 0.12124099731445312, "sampling/sampling_logp_difference/max": 0.9653690099716187, "sampling/sampling_logp_difference/mean": 0.003839743253774941, "step": 15250, "step_time": 6.54621580739622 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 778.7, "completions/max_terminated_length": 778.7, "completions/mean_length": 132.810546875, "completions/mean_terminated_length": 132.810546875, "completions/min_length": 61.5, "completions/min_terminated_length": 61.5, "entropy": 0.03259591686073691, "epoch": 32.676659528907926, "frac_reward_zero_std": 0.96875, "grad_norm": 0.0, "learning_rate": 8.4741e-06, "loss": -0.0039, "num_tokens": 1492737625.0, "reward": 1.0851367354393004, "reward_std": 0.07343996092677116, "rewards/reward_accuracy/mean": 0.98515625, "rewards/reward_accuracy/std": 0.07343338057398796, "rewards/reward_format/mean": 0.09998046979308128, "rewards/reward_format/std": 0.0003125000046566129, "sampling/importance_sampling_ratio/max": 2.3062446475028993, "sampling/importance_sampling_ratio/mean": 0.979681271314621, "sampling/importance_sampling_ratio/min": 0.12919761538505553, "sampling/sampling_logp_difference/max": 0.8721301555633545, "sampling/sampling_logp_difference/mean": 0.0036998790223151446, "step": 15260, "step_time": 3.943156314402586 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00859375, "completions/max_length": 1363.8, "completions/max_terminated_length": 1308.2, "completions/mean_length": 175.837890625, "completions/mean_terminated_length": 159.9460205078125, "completions/min_length": 64.2, "completions/min_terminated_length": 64.2, "entropy": 0.053011538833379744, "epoch": 32.698072805139184, "frac_reward_zero_std": 0.89375, "grad_norm": 0.0, "learning_rate": 8.4731e-06, "loss": -0.0062, "num_tokens": 1493713098.0, "reward": 1.0482422173023225, "reward_std": 0.17019303441047667, "rewards/reward_accuracy/mean": 0.948828125, "rewards/reward_accuracy/std": 0.16823847591876984, "rewards/reward_format/mean": 0.09941406473517418, "rewards/reward_format/std": 0.003787638247013092, "sampling/importance_sampling_ratio/max": 2.6746101140975953, "sampling/importance_sampling_ratio/mean": 0.9842543780803681, "sampling/importance_sampling_ratio/min": 0.13954381830990314, "sampling/sampling_logp_difference/max": 0.959105259180069, "sampling/sampling_logp_difference/mean": 0.0045043233083561065, "step": 15270, "step_time": 6.923523162808851 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00078125, "completions/max_length": 1088.6, "completions/max_terminated_length": 928.3, "completions/mean_length": 140.564453125, "completions/mean_terminated_length": 139.07015686035157, "completions/min_length": 65.5, "completions/min_terminated_length": 65.5, "entropy": 0.03507603243924677, "epoch": 32.71948608137045, "frac_reward_zero_std": 0.9125, "grad_norm": 0.59375, "learning_rate": 8.472100000000001e-06, "loss": -0.0112, "num_tokens": 1494588671.0, "reward": 1.0874804854393005, "reward_std": 0.08541354387998581, "rewards/reward_accuracy/mean": 0.9875, "rewards/reward_accuracy/std": 0.0853301927447319, "rewards/reward_format/mean": 0.09998046979308128, "rewards/reward_format/std": 0.0003125000046566129, "sampling/importance_sampling_ratio/max": 2.4763420939445497, "sampling/importance_sampling_ratio/mean": 0.9947469890117645, "sampling/importance_sampling_ratio/min": 0.14784036949276924, "sampling/sampling_logp_difference/max": 0.8048135876655579, "sampling/sampling_logp_difference/mean": 0.003770662285387516, "step": 15280, "step_time": 5.293759077612776 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001171875, "completions/max_length": 1091.4, "completions/max_terminated_length": 719.6, "completions/mean_length": 145.5640625, "completions/mean_terminated_length": 143.33860397338867, "completions/min_length": 62.2, "completions/min_terminated_length": 62.2, "entropy": 0.03408600322436541, "epoch": 32.74089935760171, "frac_reward_zero_std": 0.95, "grad_norm": 0.0, "learning_rate": 8.471100000000001e-06, "loss": -0.0031, "num_tokens": 1495482035.0, "reward": 1.081933617591858, "reward_std": 0.08968869522213936, "rewards/reward_accuracy/mean": 0.98203125, "rewards/reward_accuracy/std": 0.08858726471662522, "rewards/reward_format/mean": 0.09990234524011612, "rewards/reward_format/std": 0.0013226743787527085, "sampling/importance_sampling_ratio/max": 2.554253840446472, "sampling/importance_sampling_ratio/mean": 0.9947838306427002, "sampling/importance_sampling_ratio/min": 0.16021974049508572, "sampling/sampling_logp_difference/max": 0.996519672870636, "sampling/sampling_logp_difference/mean": 0.003802786162123084, "step": 15290, "step_time": 5.254836613489897 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005078125, "completions/max_length": 1226.0, "completions/max_terminated_length": 1082.6, "completions/mean_length": 157.769921875, "completions/mean_terminated_length": 148.22848358154297, "completions/min_length": 65.4, "completions/min_terminated_length": 65.4, "entropy": 0.04283686513081193, "epoch": 32.76231263383298, "frac_reward_zero_std": 0.925, "grad_norm": 0.5, "learning_rate": 8.4701e-06, "loss": -0.0044, "num_tokens": 1496403926.0, "reward": 1.0563281536102296, "reward_std": 0.14626203179359437, "rewards/reward_accuracy/mean": 0.956640625, "rewards/reward_accuracy/std": 0.1450535424053669, "rewards/reward_format/mean": 0.09968750104308129, "rewards/reward_format/std": 0.0035004840465262532, "sampling/importance_sampling_ratio/max": 2.4937074780464172, "sampling/importance_sampling_ratio/mean": 0.988933652639389, "sampling/importance_sampling_ratio/min": 0.18410306442528962, "sampling/sampling_logp_difference/max": 1.0016834139823914, "sampling/sampling_logp_difference/mean": 0.0041673650266602635, "step": 15300, "step_time": 6.193294532393338 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00234375, "completions/max_length": 1180.0, "completions/max_terminated_length": 1003.7, "completions/mean_length": 162.060546875, "completions/mean_terminated_length": 157.6506591796875, "completions/min_length": 69.8, "completions/min_terminated_length": 69.8, "entropy": 0.03903811348136514, "epoch": 32.78372591006424, "frac_reward_zero_std": 0.91875, "grad_norm": 0.52734375, "learning_rate": 8.469100000000002e-06, "loss": -0.0003, "num_tokens": 1497339217.0, "reward": 1.0498633146286012, "reward_std": 0.18346271365880967, "rewards/reward_accuracy/mean": 0.95, "rewards/reward_accuracy/std": 0.18288106918334962, "rewards/reward_format/mean": 0.09986328333616257, "rewards/reward_format/std": 0.0015798230189830065, "sampling/importance_sampling_ratio/max": 2.5308359146118162, "sampling/importance_sampling_ratio/mean": 0.9952291965484619, "sampling/importance_sampling_ratio/min": 0.12923604440875353, "sampling/sampling_logp_difference/max": 1.021000826358795, "sampling/sampling_logp_difference/mean": 0.0037008550483733416, "step": 15310, "step_time": 5.696496862202184 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.004296875, "completions/max_length": 1234.8, "completions/max_terminated_length": 983.2, "completions/mean_length": 159.606640625, "completions/mean_terminated_length": 151.5628204345703, "completions/min_length": 62.6, "completions/min_terminated_length": 62.6, "entropy": 0.03869003129657358, "epoch": 32.805139186295506, "frac_reward_zero_std": 0.94375, "grad_norm": 0.06591796875, "learning_rate": 8.4681e-06, "loss": -0.0033, "num_tokens": 1498274450.0, "reward": 1.0603711128234863, "reward_std": 0.15709154978394507, "rewards/reward_accuracy/mean": 0.960546875, "rewards/reward_accuracy/std": 0.1560543656349182, "rewards/reward_format/mean": 0.0998242199420929, "rewards/reward_format/std": 0.001815961324609816, "sampling/importance_sampling_ratio/max": 2.4651854157447817, "sampling/importance_sampling_ratio/mean": 0.9826239168643951, "sampling/importance_sampling_ratio/min": 0.10483592748641968, "sampling/sampling_logp_difference/max": 1.192632758617401, "sampling/sampling_logp_difference/mean": 0.003909539245069027, "step": 15320, "step_time": 6.353258966008434 }, { "clip_ratio/high_max": 4.011553392047062e-06, "clip_ratio/high_mean": 5.014441740058828e-07, "clip_ratio/low_mean": 1.7058678395187598e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 2.2073119680499074e-06, "completions/clipped_ratio": 0.005859375, "completions/max_length": 1359.0, "completions/max_terminated_length": 1031.5, "completions/mean_length": 155.399609375, "completions/mean_terminated_length": 144.34418334960938, "completions/min_length": 65.4, "completions/min_terminated_length": 65.4, "entropy": 0.03712874052580446, "epoch": 32.82655246252676, "frac_reward_zero_std": 0.91875, "grad_norm": 0.0, "learning_rate": 8.4671e-06, "loss": -0.0051, "num_tokens": 1499190193.0, "reward": 1.0827734470367432, "reward_std": 0.10325325950980187, "rewards/reward_accuracy/mean": 0.983203125, "rewards/reward_accuracy/std": 0.10141479671001434, "rewards/reward_format/mean": 0.09957031309604644, "rewards/reward_format/std": 0.0025662323925644158, "sampling/importance_sampling_ratio/max": 2.586918807029724, "sampling/importance_sampling_ratio/mean": 0.9825304269790649, "sampling/importance_sampling_ratio/min": 0.174930340051651, "sampling/sampling_logp_difference/max": 1.2188499689102172, "sampling/sampling_logp_difference/mean": 0.003769462322816253, "step": 15330, "step_time": 6.619790949110756 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0015625, "completions/max_length": 1138.6, "completions/max_terminated_length": 804.5, "completions/mean_length": 141.284375, "completions/mean_terminated_length": 138.30420532226563, "completions/min_length": 65.9, "completions/min_terminated_length": 65.9, "entropy": 0.0327490147203207, "epoch": 32.84796573875803, "frac_reward_zero_std": 0.95625, "grad_norm": 0.1416015625, "learning_rate": 8.4661e-06, "loss": -0.003, "num_tokens": 1500073721.0, "reward": 1.0792187690734862, "reward_std": 0.0973492681980133, "rewards/reward_accuracy/mean": 0.979296875, "rewards/reward_accuracy/std": 0.09657016545534133, "rewards/reward_format/mean": 0.09992187619209289, "rewards/reward_format/std": 0.0012500001117587089, "sampling/importance_sampling_ratio/max": 2.286910128593445, "sampling/importance_sampling_ratio/mean": 0.9821549117565155, "sampling/importance_sampling_ratio/min": 0.17387867197394372, "sampling/sampling_logp_difference/max": 0.872059839963913, "sampling/sampling_logp_difference/mean": 0.003572203731164336, "step": 15340, "step_time": 5.4941588776797285 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.004296875, "completions/max_length": 1477.9, "completions/max_terminated_length": 953.8, "completions/mean_length": 160.398828125, "completions/mean_terminated_length": 152.3484085083008, "completions/min_length": 63.4, "completions/min_terminated_length": 63.4, "entropy": 0.03777425684966147, "epoch": 32.86937901498929, "frac_reward_zero_std": 0.90625, "grad_norm": 0.0, "learning_rate": 8.465100000000001e-06, "loss": -0.0095, "num_tokens": 1501001526.0, "reward": 1.0774609565734863, "reward_std": 0.11581789776682853, "rewards/reward_accuracy/mean": 0.977734375, "rewards/reward_accuracy/std": 0.11380420550704003, "rewards/reward_format/mean": 0.0997265636920929, "rewards/reward_format/std": 0.003464208706282079, "sampling/importance_sampling_ratio/max": 2.448553431034088, "sampling/importance_sampling_ratio/mean": 0.9847819685935975, "sampling/importance_sampling_ratio/min": 0.12053140327334404, "sampling/sampling_logp_difference/max": 1.0113587260246277, "sampling/sampling_logp_difference/mean": 0.0037418146152049304, "step": 15350, "step_time": 7.289866737907869 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00234375, "completions/max_length": 1001.5, "completions/max_terminated_length": 794.7, "completions/mean_length": 151.800390625, "completions/mean_terminated_length": 147.3454490661621, "completions/min_length": 64.1, "completions/min_terminated_length": 64.1, "entropy": 0.035703504970297215, "epoch": 32.890792291220556, "frac_reward_zero_std": 0.91875, "grad_norm": 0.0, "learning_rate": 8.4641e-06, "loss": -0.0085, "num_tokens": 1501908711.0, "reward": 1.0720508098602295, "reward_std": 0.14821677953004836, "rewards/reward_accuracy/mean": 0.972265625, "rewards/reward_accuracy/std": 0.1467520147562027, "rewards/reward_format/mean": 0.09978515803813934, "rewards/reward_format/std": 0.001911549549549818, "sampling/importance_sampling_ratio/max": 2.5508246302604674, "sampling/importance_sampling_ratio/mean": 0.9960651338100434, "sampling/importance_sampling_ratio/min": 0.08525996208190918, "sampling/sampling_logp_difference/max": 1.050898253917694, "sampling/sampling_logp_difference/mean": 0.0038138892967253925, "step": 15360, "step_time": 4.925770690091303 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00546875, "completions/max_length": 1333.8, "completions/max_terminated_length": 1170.8, "completions/mean_length": 158.628515625, "completions/mean_terminated_length": 148.36717224121094, "completions/min_length": 60.3, "completions/min_terminated_length": 60.3, "entropy": 0.04410853278823197, "epoch": 32.91220556745182, "frac_reward_zero_std": 0.91875, "grad_norm": 0.0, "learning_rate": 8.4631e-06, "loss": -0.0056, "num_tokens": 1502825904.0, "reward": 1.0737890899181366, "reward_std": 0.11658615320920944, "rewards/reward_accuracy/mean": 0.97421875, "rewards/reward_accuracy/std": 0.11387001052498817, "rewards/reward_format/mean": 0.09957031458616257, "rewards/reward_format/std": 0.004379358980804682, "sampling/importance_sampling_ratio/max": 2.357502806186676, "sampling/importance_sampling_ratio/mean": 0.9884828329086304, "sampling/importance_sampling_ratio/min": 0.11629019007086754, "sampling/sampling_logp_difference/max": 1.1225679516792297, "sampling/sampling_logp_difference/mean": 0.003993779071606696, "step": 15370, "step_time": 6.590466214396292 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00625, "completions/max_length": 985.9, "completions/max_terminated_length": 811.5, "completions/mean_length": 156.427734375, "completions/mean_terminated_length": 144.7499740600586, "completions/min_length": 67.9, "completions/min_terminated_length": 67.9, "entropy": 0.0414296614471823, "epoch": 32.933618843683085, "frac_reward_zero_std": 0.9375, "grad_norm": 0.0, "learning_rate": 8.462100000000002e-06, "loss": -0.0069, "num_tokens": 1503739143.0, "reward": 1.066464865207672, "reward_std": 0.14320606887340545, "rewards/reward_accuracy/mean": 0.966796875, "rewards/reward_accuracy/std": 0.1418164476752281, "rewards/reward_format/mean": 0.09966797009110451, "rewards/reward_format/std": 0.0026208248222246767, "sampling/importance_sampling_ratio/max": 2.350379204750061, "sampling/importance_sampling_ratio/mean": 0.98081334233284, "sampling/importance_sampling_ratio/min": 0.20742679685354232, "sampling/sampling_logp_difference/max": 0.8635475516319275, "sampling/sampling_logp_difference/mean": 0.0037477646954357626, "step": 15380, "step_time": 5.279726973205106 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003125, "completions/max_length": 1222.3, "completions/max_terminated_length": 1028.1, "completions/mean_length": 158.890625, "completions/mean_terminated_length": 153.16859436035156, "completions/min_length": 65.8, "completions/min_terminated_length": 65.8, "entropy": 0.03934099182952196, "epoch": 32.95503211991435, "frac_reward_zero_std": 0.93125, "grad_norm": 0.0, "learning_rate": 8.461100000000001e-06, "loss": 0.0019, "num_tokens": 1504663695.0, "reward": 1.0575586080551147, "reward_std": 0.172669817507267, "rewards/reward_accuracy/mean": 0.9578125, "rewards/reward_accuracy/std": 0.1716109223663807, "rewards/reward_format/mean": 0.09974609464406967, "rewards/reward_format/std": 0.0028051254572346806, "sampling/importance_sampling_ratio/max": 2.532987987995148, "sampling/importance_sampling_ratio/mean": 0.9922164738178253, "sampling/importance_sampling_ratio/min": 0.18476251270622016, "sampling/sampling_logp_difference/max": 1.0059077739715576, "sampling/sampling_logp_difference/mean": 0.003955075005069375, "step": 15390, "step_time": 6.018796309400932 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.002734375, "completions/max_length": 1191.5, "completions/max_terminated_length": 811.7, "completions/mean_length": 152.18046875, "completions/mean_terminated_length": 147.03567504882812, "completions/min_length": 62.0, "completions/min_terminated_length": 62.0, "entropy": 0.038199835503473875, "epoch": 32.97644539614561, "frac_reward_zero_std": 0.93125, "grad_norm": 0.166015625, "learning_rate": 8.4601e-06, "loss": -0.0069, "num_tokens": 1505570541.0, "reward": 1.0532812654972077, "reward_std": 0.16642068773508073, "rewards/reward_accuracy/mean": 0.953515625, "rewards/reward_accuracy/std": 0.1655287489295006, "rewards/reward_format/mean": 0.09976562559604644, "rewards/reward_format/std": 0.002568871108815074, "sampling/importance_sampling_ratio/max": 2.7172763109207154, "sampling/importance_sampling_ratio/mean": 0.9862430214881897, "sampling/importance_sampling_ratio/min": 0.12236514836549758, "sampling/sampling_logp_difference/max": 1.011013925075531, "sampling/sampling_logp_difference/mean": 0.0038334243232384323, "step": 15400, "step_time": 5.943480066896882 }, { "clip_ratio/high_max": 5.973239967715926e-06, "clip_ratio/high_mean": 7.466549959644908e-07, "clip_ratio/low_mean": 1.0157544238609262e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 1.762409374350682e-06, "completions/clipped_ratio": 0.00859375, "completions/max_length": 1277.1, "completions/max_terminated_length": 1166.4, "completions/mean_length": 172.73359375, "completions/mean_terminated_length": 156.57687225341797, "completions/min_length": 70.7, "completions/min_terminated_length": 70.7, "entropy": 0.04725630437023938, "epoch": 32.99785867237687, "frac_reward_zero_std": 0.91875, "grad_norm": 0.115234375, "learning_rate": 8.459100000000002e-06, "loss": 0.0008, "num_tokens": 1506539027.0, "reward": 1.0691211104393006, "reward_std": 0.15075090378522873, "rewards/reward_accuracy/mean": 0.96953125, "rewards/reward_accuracy/std": 0.14912587776780128, "rewards/reward_format/mean": 0.09958984479308128, "rewards/reward_format/std": 0.0030048549408093093, "sampling/importance_sampling_ratio/max": 2.6201306581497192, "sampling/importance_sampling_ratio/mean": 0.9885594844818115, "sampling/importance_sampling_ratio/min": 0.09740961268544197, "sampling/sampling_logp_difference/max": 1.0876730680465698, "sampling/sampling_logp_difference/mean": 0.004269835771992803, "step": 15410, "step_time": 6.626000433287118 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001171875, "completions/max_length": 1202.9, "completions/max_terminated_length": 701.8, "completions/mean_length": 137.68828125, "completions/mean_terminated_length": 135.43324127197266, "completions/min_length": 64.5, "completions/min_terminated_length": 64.5, "entropy": 0.03283301112242043, "epoch": 33.019271948608136, "frac_reward_zero_std": 0.95625, "grad_norm": 0.07568359375, "learning_rate": 8.4581e-06, "loss": -0.0028, "num_tokens": 1507403813.0, "reward": 1.0850781321525573, "reward_std": 0.0761457245098427, "rewards/reward_accuracy/mean": 0.98515625, "rewards/reward_accuracy/std": 0.07489572763442993, "rewards/reward_format/mean": 0.09992187544703483, "rewards/reward_format/std": 0.0012500000651925803, "sampling/importance_sampling_ratio/max": 2.4168882966041565, "sampling/importance_sampling_ratio/mean": 0.985172712802887, "sampling/importance_sampling_ratio/min": 0.16095557138323785, "sampling/sampling_logp_difference/max": 0.8999104857444763, "sampling/sampling_logp_difference/mean": 0.003522937488742173, "step": 15420, "step_time": 5.966917234714492 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0046875, "completions/max_length": 1432.1, "completions/max_terminated_length": 1289.4, "completions/mean_length": 153.926171875, "completions/mean_terminated_length": 145.19007720947266, "completions/min_length": 66.6, "completions/min_terminated_length": 66.6, "entropy": 0.042367413127794865, "epoch": 33.0406852248394, "frac_reward_zero_std": 0.9, "grad_norm": 0.294921875, "learning_rate": 8.4571e-06, "loss": -0.0069, "num_tokens": 1508314696.0, "reward": 1.0535351634025574, "reward_std": 0.1674004778265953, "rewards/reward_accuracy/mean": 0.95390625, "rewards/reward_accuracy/std": 0.1663012385368347, "rewards/reward_format/mean": 0.09962890669703484, "rewards/reward_format/std": 0.0030595290940254928, "sampling/importance_sampling_ratio/max": 2.4917768955230715, "sampling/importance_sampling_ratio/mean": 0.9788728475570678, "sampling/importance_sampling_ratio/min": 0.12854536958038806, "sampling/sampling_logp_difference/max": 1.2337559700012206, "sampling/sampling_logp_difference/mean": 0.004102177126333118, "step": 15430, "step_time": 6.798654434306082 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.006640625, "completions/max_length": 1443.1, "completions/max_terminated_length": 1241.9, "completions/mean_length": 165.970703125, "completions/mean_terminated_length": 153.5862777709961, "completions/min_length": 70.7, "completions/min_terminated_length": 70.7, "entropy": 0.04067769204266369, "epoch": 33.062098501070665, "frac_reward_zero_std": 0.94375, "grad_norm": 0.0, "learning_rate": 8.4561e-06, "loss": -0.0053, "num_tokens": 1509256781.0, "reward": 1.0757617473602294, "reward_std": 0.10113889947533608, "rewards/reward_accuracy/mean": 0.976171875, "rewards/reward_accuracy/std": 0.09913232997059822, "rewards/reward_format/mean": 0.09958984404802322, "rewards/reward_format/std": 0.0035364021314308047, "sampling/importance_sampling_ratio/max": 2.2405527949333193, "sampling/importance_sampling_ratio/mean": 0.9920042634010315, "sampling/importance_sampling_ratio/min": 0.1834438018500805, "sampling/sampling_logp_difference/max": 1.3305721998214721, "sampling/sampling_logp_difference/mean": 0.003808874823153019, "step": 15440, "step_time": 7.259030940692173 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.000390625, "completions/max_length": 929.6, "completions/max_terminated_length": 749.2, "completions/mean_length": 138.12265625, "completions/mean_terminated_length": 137.37444915771485, "completions/min_length": 61.9, "completions/min_terminated_length": 61.9, "entropy": 0.031762042199261487, "epoch": 33.08351177730193, "frac_reward_zero_std": 0.9625, "grad_norm": 0.2373046875, "learning_rate": 8.4551e-06, "loss": -0.002, "num_tokens": 1510122599.0, "reward": 1.072246116399765, "reward_std": 0.10210933685302734, "rewards/reward_accuracy/mean": 0.972265625, "rewards/reward_accuracy/std": 0.10205613151192665, "rewards/reward_format/mean": 0.09998046979308128, "rewards/reward_format/std": 0.0003125000046566129, "sampling/importance_sampling_ratio/max": 2.3094767451286318, "sampling/importance_sampling_ratio/mean": 0.9846013963222504, "sampling/importance_sampling_ratio/min": 0.09310098588466645, "sampling/sampling_logp_difference/max": 1.0752622365951539, "sampling/sampling_logp_difference/mean": 0.0035512261791154744, "step": 15450, "step_time": 4.576242021977668 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001953125, "completions/max_length": 1112.7, "completions/max_terminated_length": 1056.8, "completions/mean_length": 156.60625, "completions/mean_terminated_length": 152.98633728027343, "completions/min_length": 62.9, "completions/min_terminated_length": 62.9, "entropy": 0.041863493528217076, "epoch": 33.104925053533194, "frac_reward_zero_std": 0.9125, "grad_norm": 0.2236328125, "learning_rate": 8.454100000000001e-06, "loss": -0.0034, "num_tokens": 1511039159.0, "reward": 1.0724218845367433, "reward_std": 0.13037858670577407, "rewards/reward_accuracy/mean": 0.97265625, "rewards/reward_accuracy/std": 0.12935589030385017, "rewards/reward_format/mean": 0.09976562559604644, "rewards/reward_format/std": 0.002170510101132095, "sampling/importance_sampling_ratio/max": 2.5836962699890136, "sampling/importance_sampling_ratio/mean": 0.986788946390152, "sampling/importance_sampling_ratio/min": 0.10243121907114983, "sampling/sampling_logp_difference/max": 1.0103331089019776, "sampling/sampling_logp_difference/mean": 0.0038547023432329297, "step": 15460, "step_time": 5.813620976486709 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0078125, "completions/max_length": 1335.5, "completions/max_terminated_length": 1023.6, "completions/mean_length": 163.10703125, "completions/mean_terminated_length": 148.28276977539062, "completions/min_length": 63.7, "completions/min_terminated_length": 63.7, "entropy": 0.04155663033016026, "epoch": 33.12633832976445, "frac_reward_zero_std": 0.93125, "grad_norm": 0.12158203125, "learning_rate": 8.4531e-06, "loss": -0.0015, "num_tokens": 1511976953.0, "reward": 1.0772656321525573, "reward_std": 0.12148883417248726, "rewards/reward_accuracy/mean": 0.977734375, "rewards/reward_accuracy/std": 0.11925085261464119, "rewards/reward_format/mean": 0.09953125044703484, "rewards/reward_format/std": 0.003875483525916934, "sampling/importance_sampling_ratio/max": 2.480108177661896, "sampling/importance_sampling_ratio/mean": 0.9942494571208954, "sampling/importance_sampling_ratio/min": 0.17945871204137803, "sampling/sampling_logp_difference/max": 1.0540142357349396, "sampling/sampling_logp_difference/mean": 0.004105081176385283, "step": 15470, "step_time": 6.729217915603658 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00234375, "completions/max_length": 1147.5, "completions/max_terminated_length": 986.0, "completions/mean_length": 154.832421875, "completions/mean_terminated_length": 150.41895599365233, "completions/min_length": 68.3, "completions/min_terminated_length": 68.3, "entropy": 0.03583867207635194, "epoch": 33.147751605995715, "frac_reward_zero_std": 0.94375, "grad_norm": 0.2890625, "learning_rate": 8.452100000000002e-06, "loss": 0.0037, "num_tokens": 1512894476.0, "reward": 1.0677343964576722, "reward_std": 0.1428995333611965, "rewards/reward_accuracy/mean": 0.96796875, "rewards/reward_accuracy/std": 0.1411496214568615, "rewards/reward_format/mean": 0.0997656263411045, "rewards/reward_format/std": 0.0025854269973933698, "sampling/importance_sampling_ratio/max": 2.4821298122406006, "sampling/importance_sampling_ratio/mean": 0.9869244456291199, "sampling/importance_sampling_ratio/min": 0.12845927327871323, "sampling/sampling_logp_difference/max": 0.9707173228263855, "sampling/sampling_logp_difference/mean": 0.00389259522780776, "step": 15480, "step_time": 5.622376510221511 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001953125, "completions/max_length": 1235.6, "completions/max_terminated_length": 742.3, "completions/mean_length": 143.83359375, "completions/mean_terminated_length": 140.1116912841797, "completions/min_length": 68.3, "completions/min_terminated_length": 68.3, "entropy": 0.03305806396529078, "epoch": 33.16916488222698, "frac_reward_zero_std": 0.95625, "grad_norm": 0.0859375, "learning_rate": 8.451100000000001e-06, "loss": -0.0056, "num_tokens": 1513785186.0, "reward": 1.0955273509025574, "reward_std": 0.04801808595657349, "rewards/reward_accuracy/mean": 0.995703125, "rewards/reward_accuracy/std": 0.04606872871518135, "rewards/reward_format/mean": 0.09982421919703484, "rewards/reward_format/std": 0.0028125002281740308, "sampling/importance_sampling_ratio/max": 2.296148920059204, "sampling/importance_sampling_ratio/mean": 0.9862317740917206, "sampling/importance_sampling_ratio/min": 0.12679516524076462, "sampling/sampling_logp_difference/max": 0.9447376310825348, "sampling/sampling_logp_difference/mean": 0.003795612626709044, "step": 15490, "step_time": 5.918418743411894 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0015625, "completions/max_length": 1238.3, "completions/max_terminated_length": 900.6, "completions/mean_length": 149.509375, "completions/mean_terminated_length": 146.5581527709961, "completions/min_length": 60.0, "completions/min_terminated_length": 60.0, "entropy": 0.03496562498621643, "epoch": 33.190578158458244, "frac_reward_zero_std": 0.925, "grad_norm": 0.0, "learning_rate": 8.4501e-06, "loss": -0.0021, "num_tokens": 1514684858.0, "reward": 1.074121117591858, "reward_std": 0.11420853734016419, "rewards/reward_accuracy/mean": 0.97421875, "rewards/reward_accuracy/std": 0.11348417848348617, "rewards/reward_format/mean": 0.09990234524011612, "rewards/reward_format/std": 0.0013226743787527085, "sampling/importance_sampling_ratio/max": 2.5135201811790466, "sampling/importance_sampling_ratio/mean": 0.9874793648719787, "sampling/importance_sampling_ratio/min": 0.10486233979463577, "sampling/sampling_logp_difference/max": 0.9716208219528198, "sampling/sampling_logp_difference/mean": 0.0037395438412204385, "step": 15500, "step_time": 5.937629948093672 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.002734375, "completions/max_length": 1132.4, "completions/max_terminated_length": 856.8, "completions/mean_length": 152.595703125, "completions/mean_terminated_length": 147.42542114257813, "completions/min_length": 66.4, "completions/min_terminated_length": 66.4, "entropy": 0.036390691390261055, "epoch": 33.21199143468951, "frac_reward_zero_std": 0.9, "grad_norm": 0.1884765625, "learning_rate": 8.449100000000002e-06, "loss": -0.0049, "num_tokens": 1515598175.0, "reward": 1.0874414205551148, "reward_std": 0.09136118963360787, "rewards/reward_accuracy/mean": 0.9875, "rewards/reward_accuracy/std": 0.09087077081203461, "rewards/reward_format/mean": 0.09994140714406967, "rewards/reward_format/std": 0.0009375000605359674, "sampling/importance_sampling_ratio/max": 2.43772234916687, "sampling/importance_sampling_ratio/mean": 0.9991339147090912, "sampling/importance_sampling_ratio/min": 0.1517783708870411, "sampling/sampling_logp_difference/max": 0.8734401345252991, "sampling/sampling_logp_difference/mean": 0.003657688619568944, "step": 15510, "step_time": 5.560090370106627 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003515625, "completions/max_length": 946.4, "completions/max_terminated_length": 870.3, "completions/mean_length": 150.09296875, "completions/mean_terminated_length": 143.50455780029296, "completions/min_length": 67.5, "completions/min_terminated_length": 67.5, "entropy": 0.03537075570784509, "epoch": 33.23340471092077, "frac_reward_zero_std": 0.9375, "grad_norm": 0.0947265625, "learning_rate": 8.4481e-06, "loss": -0.0062, "num_tokens": 1516504429.0, "reward": 1.0531836152076721, "reward_std": 0.14067650064826012, "rewards/reward_accuracy/mean": 0.953515625, "rewards/reward_accuracy/std": 0.13947870954871178, "rewards/reward_format/mean": 0.09966797009110451, "rewards/reward_format/std": 0.0027969195507466793, "sampling/importance_sampling_ratio/max": 2.518282103538513, "sampling/importance_sampling_ratio/mean": 0.9899865865707398, "sampling/importance_sampling_ratio/min": 0.17714760042726993, "sampling/sampling_logp_difference/max": 1.1557979702949523, "sampling/sampling_logp_difference/mean": 0.0037714322097599506, "step": 15520, "step_time": 5.0261116669134935 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.000390625, "completions/max_length": 835.5, "completions/max_terminated_length": 793.4, "completions/mean_length": 139.641015625, "completions/mean_terminated_length": 138.8944351196289, "completions/min_length": 66.5, "completions/min_terminated_length": 66.5, "entropy": 0.03338059156667441, "epoch": 33.25481798715204, "frac_reward_zero_std": 0.93125, "grad_norm": 0.0, "learning_rate": 8.4471e-06, "loss": -0.002, "num_tokens": 1517380342.0, "reward": 1.0902148604393005, "reward_std": 0.06844365522265435, "rewards/reward_accuracy/mean": 0.990234375, "rewards/reward_accuracy/std": 0.06844125986099243, "rewards/reward_format/mean": 0.09998046979308128, "rewards/reward_format/std": 0.0003125000046566129, "sampling/importance_sampling_ratio/max": 2.5732690572738646, "sampling/importance_sampling_ratio/mean": 0.9982119202613831, "sampling/importance_sampling_ratio/min": 0.15068037807941437, "sampling/sampling_logp_difference/max": 1.024285113811493, "sampling/sampling_logp_difference/mean": 0.0037812464870512486, "step": 15530, "step_time": 4.434363437094726 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.002734375, "completions/max_length": 1337.7, "completions/max_terminated_length": 972.0, "completions/mean_length": 156.194140625, "completions/mean_terminated_length": 151.05356140136718, "completions/min_length": 70.8, "completions/min_terminated_length": 70.8, "entropy": 0.03887236888986081, "epoch": 33.276231263383295, "frac_reward_zero_std": 0.91875, "grad_norm": 0.1162109375, "learning_rate": 8.4461e-06, "loss": -0.0033, "num_tokens": 1518304407.0, "reward": 1.0798437476158143, "reward_std": 0.10572100505232811, "rewards/reward_accuracy/mean": 0.980078125, "rewards/reward_accuracy/std": 0.10436694696545601, "rewards/reward_format/mean": 0.09976562410593033, "rewards/reward_format/std": 0.0030101181706413626, "sampling/importance_sampling_ratio/max": 2.4676876187324526, "sampling/importance_sampling_ratio/mean": 0.990932410955429, "sampling/importance_sampling_ratio/min": 0.1723891519010067, "sampling/sampling_logp_difference/max": 1.1893969416618346, "sampling/sampling_logp_difference/mean": 0.003905677213333547, "step": 15540, "step_time": 6.44051847900555 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00546875, "completions/max_length": 1488.2, "completions/max_terminated_length": 1037.6, "completions/mean_length": 157.328125, "completions/mean_terminated_length": 146.9997589111328, "completions/min_length": 69.9, "completions/min_terminated_length": 69.9, "entropy": 0.03838043997529894, "epoch": 33.29764453961456, "frac_reward_zero_std": 0.93125, "grad_norm": 0.0, "learning_rate": 8.4451e-06, "loss": -0.0023, "num_tokens": 1519227919.0, "reward": 1.0686914324760437, "reward_std": 0.1454761005938053, "rewards/reward_accuracy/mean": 0.969140625, "rewards/reward_accuracy/std": 0.1433170072734356, "rewards/reward_format/mean": 0.09955078288912773, "rewards/reward_format/std": 0.004305425239726901, "sampling/importance_sampling_ratio/max": 2.3787041544914245, "sampling/importance_sampling_ratio/mean": 0.9961043655872345, "sampling/importance_sampling_ratio/min": 0.12906542008277028, "sampling/sampling_logp_difference/max": 0.9558722913265228, "sampling/sampling_logp_difference/mean": 0.0037877651397138835, "step": 15550, "step_time": 7.195861307499581 }, { "clip_ratio/high_max": 2.5940707564586775e-05, "clip_ratio/high_mean": 3.242588445573347e-06, "clip_ratio/low_mean": 1.501154542893346e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 4.74374292025459e-06, "completions/clipped_ratio": 0.006640625, "completions/max_length": 1182.9, "completions/max_terminated_length": 1098.3, "completions/mean_length": 158.661328125, "completions/mean_terminated_length": 146.2100357055664, "completions/min_length": 61.6, "completions/min_terminated_length": 61.6, "entropy": 0.04128398154862225, "epoch": 33.319057815845824, "frac_reward_zero_std": 0.91875, "grad_norm": 0.2392578125, "learning_rate": 8.444100000000001e-06, "loss": -0.0049, "num_tokens": 1520153036.0, "reward": 1.0569726824760437, "reward_std": 0.15830625370144844, "rewards/reward_accuracy/mean": 0.957421875, "rewards/reward_accuracy/std": 0.15679396614432334, "rewards/reward_format/mean": 0.09955078288912773, "rewards/reward_format/std": 0.0028781146043911575, "sampling/importance_sampling_ratio/max": 2.5091856718063354, "sampling/importance_sampling_ratio/mean": 0.9839332699775696, "sampling/importance_sampling_ratio/min": 0.0831770971417427, "sampling/sampling_logp_difference/max": 1.0090594649314881, "sampling/sampling_logp_difference/mean": 0.004206916433759034, "step": 15560, "step_time": 6.036506561117131 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00078125, "completions/max_length": 1049.2, "completions/max_terminated_length": 999.6, "completions/mean_length": 136.812890625, "completions/mean_terminated_length": 135.33389587402343, "completions/min_length": 62.7, "completions/min_terminated_length": 62.7, "entropy": 0.03343245207797736, "epoch": 33.34047109207709, "frac_reward_zero_std": 0.95625, "grad_norm": 0.0, "learning_rate": 8.4431e-06, "loss": -0.0028, "num_tokens": 1521025101.0, "reward": 1.0827344059944153, "reward_std": 0.08065074309706688, "rewards/reward_accuracy/mean": 0.9828125, "rewards/reward_accuracy/std": 0.08007982149720191, "rewards/reward_format/mean": 0.09992187693715096, "rewards/reward_format/std": 0.0008821487426757812, "sampling/importance_sampling_ratio/max": 2.2924190521240235, "sampling/importance_sampling_ratio/mean": 0.9939866840839386, "sampling/importance_sampling_ratio/min": 0.20021308660507203, "sampling/sampling_logp_difference/max": 0.984948456287384, "sampling/sampling_logp_difference/mean": 0.003572519798763096, "step": 15570, "step_time": 5.12861153249105 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00625, "completions/max_length": 1668.0, "completions/max_terminated_length": 1277.7, "completions/mean_length": 173.14609375, "completions/mean_terminated_length": 161.451953125, "completions/min_length": 68.6, "completions/min_terminated_length": 68.6, "entropy": 0.046212914679199454, "epoch": 33.36188436830835, "frac_reward_zero_std": 0.88125, "grad_norm": 0.0615234375, "learning_rate": 8.4421e-06, "loss": -0.0089, "num_tokens": 1521989251.0, "reward": 1.0530859649181366, "reward_std": 0.18576266393065452, "rewards/reward_accuracy/mean": 0.953515625, "rewards/reward_accuracy/std": 0.18383951112627983, "rewards/reward_format/mean": 0.09957031458616257, "rewards/reward_format/std": 0.003976369579322636, "sampling/importance_sampling_ratio/max": 2.394400477409363, "sampling/importance_sampling_ratio/mean": 0.9804731607437134, "sampling/importance_sampling_ratio/min": 0.02967557907104492, "sampling/sampling_logp_difference/max": 1.1275634586811065, "sampling/sampling_logp_difference/mean": 0.0041723909555003045, "step": 15580, "step_time": 8.004337526398013 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005859375, "completions/max_length": 1322.4, "completions/max_terminated_length": 1139.5, "completions/mean_length": 159.96640625, "completions/mean_terminated_length": 148.97649841308595, "completions/min_length": 65.2, "completions/min_terminated_length": 65.2, "entropy": 0.04330825740471482, "epoch": 33.38329764453962, "frac_reward_zero_std": 0.90625, "grad_norm": 0.0, "learning_rate": 8.441100000000001e-06, "loss": -0.0021, "num_tokens": 1522922749.0, "reward": 1.069394552707672, "reward_std": 0.13400005623698236, "rewards/reward_accuracy/mean": 0.969921875, "rewards/reward_accuracy/std": 0.13165040761232377, "rewards/reward_format/mean": 0.09947265684604645, "rewards/reward_format/std": 0.004295098898001015, "sampling/importance_sampling_ratio/max": 2.319702923297882, "sampling/importance_sampling_ratio/mean": 0.987775844335556, "sampling/importance_sampling_ratio/min": 0.11209532245993614, "sampling/sampling_logp_difference/max": 1.1443936824798584, "sampling/sampling_logp_difference/mean": 0.004016576730646193, "step": 15590, "step_time": 6.630948163379799 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 3.2005325465434e-07, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 3.2005325465434e-07, "completions/clipped_ratio": 0.00546875, "completions/max_length": 1353.1, "completions/max_terminated_length": 917.2, "completions/mean_length": 146.043359375, "completions/mean_terminated_length": 135.59401779174806, "completions/min_length": 60.4, "completions/min_terminated_length": 60.4, "entropy": 0.03790169672574848, "epoch": 33.40471092077088, "frac_reward_zero_std": 0.9375, "grad_norm": 0.275390625, "learning_rate": 8.4401e-06, "loss": -0.0039, "num_tokens": 1523811884.0, "reward": 1.079199242591858, "reward_std": 0.10992798954248428, "rewards/reward_accuracy/mean": 0.9796875, "rewards/reward_accuracy/std": 0.10797502249479293, "rewards/reward_format/mean": 0.09951172024011612, "rewards/reward_format/std": 0.002430351381190121, "sampling/importance_sampling_ratio/max": 2.5102389812469483, "sampling/importance_sampling_ratio/mean": 0.9816409051418304, "sampling/importance_sampling_ratio/min": 0.07394137382507324, "sampling/sampling_logp_difference/max": 0.9574601888656616, "sampling/sampling_logp_difference/mean": 0.0038733824854716658, "step": 15600, "step_time": 6.594400068293908 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00546875, "completions/max_length": 1369.6, "completions/max_terminated_length": 1181.8, "completions/mean_length": 165.0078125, "completions/mean_terminated_length": 154.6966339111328, "completions/min_length": 64.6, "completions/min_terminated_length": 64.6, "entropy": 0.04202635632827878, "epoch": 33.42612419700214, "frac_reward_zero_std": 0.90625, "grad_norm": 0.396484375, "learning_rate": 8.439100000000002e-06, "loss": -0.0065, "num_tokens": 1524750144.0, "reward": 1.0773047089576722, "reward_std": 0.12952226027846336, "rewards/reward_accuracy/mean": 0.977734375, "rewards/reward_accuracy/std": 0.1274246409535408, "rewards/reward_format/mean": 0.09957031384110451, "rewards/reward_format/std": 0.003783126804046333, "sampling/importance_sampling_ratio/max": 2.453339624404907, "sampling/importance_sampling_ratio/mean": 0.9944136559963226, "sampling/importance_sampling_ratio/min": 0.05161414071917534, "sampling/sampling_logp_difference/max": 1.2440590739250184, "sampling/sampling_logp_difference/mean": 0.003971485374495387, "step": 15610, "step_time": 6.742780422983924 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 1277.0, "completions/max_terminated_length": 741.9, "completions/mean_length": 144.12265625, "completions/mean_terminated_length": 136.71171340942382, "completions/min_length": 63.8, "completions/min_terminated_length": 63.8, "entropy": 0.04016820671968162, "epoch": 33.4475374732334, "frac_reward_zero_std": 0.94375, "grad_norm": 0.076171875, "learning_rate": 8.4381e-06, "loss": -0.0042, "num_tokens": 1525639418.0, "reward": 1.077148449420929, "reward_std": 0.11212341785430908, "rewards/reward_accuracy/mean": 0.97734375, "rewards/reward_accuracy/std": 0.11104121282696724, "rewards/reward_format/mean": 0.09980468824505806, "rewards/reward_format/std": 0.002496726461686194, "sampling/importance_sampling_ratio/max": 2.5587223291397097, "sampling/importance_sampling_ratio/mean": 0.9947729051113129, "sampling/importance_sampling_ratio/min": 0.09116225875914097, "sampling/sampling_logp_difference/max": 1.0362349450588226, "sampling/sampling_logp_difference/mean": 0.0039414710132405165, "step": 15620, "step_time": 6.312194155296311 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001953125, "completions/max_length": 1473.1, "completions/max_terminated_length": 1241.3, "completions/mean_length": 160.653515625, "completions/mean_terminated_length": 157.02576751708983, "completions/min_length": 65.1, "completions/min_terminated_length": 65.1, "entropy": 0.039473096211440864, "epoch": 33.46895074946467, "frac_reward_zero_std": 0.93125, "grad_norm": 0.12255859375, "learning_rate": 8.437100000000001e-06, "loss": -0.0043, "num_tokens": 1526570547.0, "reward": 1.0642773628234863, "reward_std": 0.14897226616740228, "rewards/reward_accuracy/mean": 0.964453125, "rewards/reward_accuracy/std": 0.14857167825102807, "rewards/reward_format/mean": 0.0998242199420929, "rewards/reward_format/std": 0.0018886924255639315, "sampling/importance_sampling_ratio/max": 2.6337870597839355, "sampling/importance_sampling_ratio/mean": 1.0004314541816712, "sampling/importance_sampling_ratio/min": 0.12723351493477822, "sampling/sampling_logp_difference/max": 1.0451322436332702, "sampling/sampling_logp_difference/mean": 0.0038811465492472053, "step": 15630, "step_time": 7.091503059086972 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001171875, "completions/max_length": 715.8, "completions/max_terminated_length": 535.4, "completions/mean_length": 130.91171875, "completions/mean_terminated_length": 128.6991744995117, "completions/min_length": 68.4, "completions/min_terminated_length": 68.4, "entropy": 0.035831874469295144, "epoch": 33.49036402569593, "frac_reward_zero_std": 0.95625, "grad_norm": 0.0, "learning_rate": 8.4361e-06, "loss": 0.0014, "num_tokens": 1527412241.0, "reward": 1.0596875190734862, "reward_std": 0.1733373448252678, "rewards/reward_accuracy/mean": 0.959765625, "rewards/reward_accuracy/std": 0.17301912158727645, "rewards/reward_format/mean": 0.09992187619209289, "rewards/reward_format/std": 0.0012500001117587089, "sampling/importance_sampling_ratio/max": 2.307244372367859, "sampling/importance_sampling_ratio/mean": 0.9905577957630157, "sampling/importance_sampling_ratio/min": 0.1997843489050865, "sampling/sampling_logp_difference/max": 0.923326164484024, "sampling/sampling_logp_difference/mean": 0.0039318704279139634, "step": 15640, "step_time": 3.913804127520416 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001171875, "completions/max_length": 773.4, "completions/max_terminated_length": 772.6, "completions/mean_length": 146.3703125, "completions/mean_terminated_length": 144.1406280517578, "completions/min_length": 61.9, "completions/min_terminated_length": 61.9, "entropy": 0.03315637407358736, "epoch": 33.5117773019272, "frac_reward_zero_std": 0.9375, "grad_norm": 0.0, "learning_rate": 8.4351e-06, "loss": -0.0027, "num_tokens": 1528305733.0, "reward": 1.0815234541893006, "reward_std": 0.09514356330037117, "rewards/reward_accuracy/mean": 0.981640625, "rewards/reward_accuracy/std": 0.09442930147051812, "rewards/reward_format/mean": 0.09988281354308129, "rewards/reward_format/std": 0.0009831609204411507, "sampling/importance_sampling_ratio/max": 2.3051183581352235, "sampling/importance_sampling_ratio/mean": 0.9903060674667359, "sampling/importance_sampling_ratio/min": 0.20344518572092057, "sampling/sampling_logp_difference/max": 0.8901869714260101, "sampling/sampling_logp_difference/mean": 0.0036056693643331528, "step": 15650, "step_time": 4.000262397501501 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.004296875, "completions/max_length": 1181.9, "completions/max_terminated_length": 939.8, "completions/mean_length": 151.057421875, "completions/mean_terminated_length": 142.94207611083985, "completions/min_length": 63.1, "completions/min_terminated_length": 63.1, "entropy": 0.040779984556138515, "epoch": 33.53319057815846, "frac_reward_zero_std": 0.95, "grad_norm": 0.349609375, "learning_rate": 8.434100000000001e-06, "loss": -0.0046, "num_tokens": 1529206328.0, "reward": 1.0756445527076721, "reward_std": 0.10981882363557816, "rewards/reward_accuracy/mean": 0.97578125, "rewards/reward_accuracy/std": 0.10913942381739616, "rewards/reward_format/mean": 0.09986328259110451, "rewards/reward_format/std": 0.0016357229789718986, "sampling/importance_sampling_ratio/max": 2.3180432081222535, "sampling/importance_sampling_ratio/mean": 0.9852278828620911, "sampling/importance_sampling_ratio/min": 0.06474983803927899, "sampling/sampling_logp_difference/max": 0.8843354523181916, "sampling/sampling_logp_difference/mean": 0.003843441465869546, "step": 15660, "step_time": 5.932393831410446 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005859375, "completions/max_length": 1132.3, "completions/max_terminated_length": 1071.7, "completions/mean_length": 163.650390625, "completions/mean_terminated_length": 152.7506576538086, "completions/min_length": 64.0, "completions/min_terminated_length": 64.0, "entropy": 0.042406791099347176, "epoch": 33.55460385438972, "frac_reward_zero_std": 0.93125, "grad_norm": 0.2490234375, "learning_rate": 8.4331e-06, "loss": -0.0037, "num_tokens": 1530142217.0, "reward": 1.0683007955551147, "reward_std": 0.13963167667388915, "rewards/reward_accuracy/mean": 0.96875, "rewards/reward_accuracy/std": 0.1376842088997364, "rewards/reward_format/mean": 0.09955078214406968, "rewards/reward_format/std": 0.0033215015195310117, "sampling/importance_sampling_ratio/max": 2.3479689717292787, "sampling/importance_sampling_ratio/mean": 0.9966677606105805, "sampling/importance_sampling_ratio/min": 0.12793701514601707, "sampling/sampling_logp_difference/max": 0.9127425730228425, "sampling/sampling_logp_difference/mean": 0.003781242948025465, "step": 15670, "step_time": 5.800863980906433 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00078125, "completions/max_length": 1010.4, "completions/max_terminated_length": 946.3, "completions/mean_length": 142.944921875, "completions/mean_terminated_length": 141.47684783935546, "completions/min_length": 63.6, "completions/min_terminated_length": 63.6, "entropy": 0.0353489876491949, "epoch": 33.57601713062098, "frac_reward_zero_std": 0.95625, "grad_norm": 0.1650390625, "learning_rate": 8.4321e-06, "loss": -0.0045, "num_tokens": 1531026812.0, "reward": 1.0608789265155791, "reward_std": 0.14337778985500335, "rewards/reward_accuracy/mean": 0.9609375, "rewards/reward_accuracy/std": 0.14331778064370154, "rewards/reward_format/mean": 0.09994140714406967, "rewards/reward_format/std": 0.0007535743294283748, "sampling/importance_sampling_ratio/max": 2.467592489719391, "sampling/importance_sampling_ratio/mean": 1.005700707435608, "sampling/importance_sampling_ratio/min": 0.17324309330433607, "sampling/sampling_logp_difference/max": 1.1031181573867799, "sampling/sampling_logp_difference/mean": 0.003674219036474824, "step": 15680, "step_time": 5.190362657094374 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.006640625, "completions/max_length": 1573.1, "completions/max_terminated_length": 1369.0, "completions/mean_length": 184.028125, "completions/mean_terminated_length": 171.67553253173827, "completions/min_length": 66.2, "completions/min_terminated_length": 66.2, "entropy": 0.0479984660865739, "epoch": 33.59743040685225, "frac_reward_zero_std": 0.88125, "grad_norm": 0.431640625, "learning_rate": 8.431100000000001e-06, "loss": -0.0024, "num_tokens": 1532024836.0, "reward": 1.052988314628601, "reward_std": 0.16925925835967065, "rewards/reward_accuracy/mean": 0.953515625, "rewards/reward_accuracy/std": 0.16700486913323404, "rewards/reward_format/mean": 0.09947265833616256, "rewards/reward_format/std": 0.005161701282486319, "sampling/importance_sampling_ratio/max": 2.5034685015678404, "sampling/importance_sampling_ratio/mean": 0.9763666272163392, "sampling/importance_sampling_ratio/min": 0.04848799556493759, "sampling/sampling_logp_difference/max": 1.1294761657714845, "sampling/sampling_logp_difference/mean": 0.004109005001373589, "step": 15690, "step_time": 7.78049962669611 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00078125, "completions/max_length": 1081.3, "completions/max_terminated_length": 835.3, "completions/mean_length": 140.141015625, "completions/mean_terminated_length": 138.64953155517577, "completions/min_length": 63.4, "completions/min_terminated_length": 63.4, "entropy": 0.03360716998577118, "epoch": 33.61884368308351, "frac_reward_zero_std": 0.93125, "grad_norm": 0.65234375, "learning_rate": 8.4301e-06, "loss": -0.0015, "num_tokens": 1532897485.0, "reward": 1.0792187571525573, "reward_std": 0.10223338261712342, "rewards/reward_accuracy/mean": 0.979296875, "rewards/reward_accuracy/std": 0.1014670453965664, "rewards/reward_format/mean": 0.09992187544703483, "rewards/reward_format/std": 0.0012500000651925803, "sampling/importance_sampling_ratio/max": 2.3755987644195558, "sampling/importance_sampling_ratio/mean": 0.9970045804977417, "sampling/importance_sampling_ratio/min": 0.21761137396097183, "sampling/sampling_logp_difference/max": 1.0297537684440612, "sampling/sampling_logp_difference/mean": 0.003689264412969351, "step": 15700, "step_time": 5.2692631881975105 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001171875, "completions/max_length": 833.0, "completions/max_terminated_length": 780.3, "completions/mean_length": 133.3171875, "completions/mean_terminated_length": 131.08596649169922, "completions/min_length": 62.3, "completions/min_terminated_length": 62.3, "entropy": 0.03487586413975805, "epoch": 33.640256959314776, "frac_reward_zero_std": 0.94375, "grad_norm": 0.275390625, "learning_rate": 8.4291e-06, "loss": -0.004, "num_tokens": 1533756937.0, "reward": 1.0944336175918579, "reward_std": 0.05669101923704147, "rewards/reward_accuracy/mean": 0.99453125, "rewards/reward_accuracy/std": 0.055923495441675186, "rewards/reward_format/mean": 0.09990234524011612, "rewards/reward_format/std": 0.0011641392018646001, "sampling/importance_sampling_ratio/max": 2.489329159259796, "sampling/importance_sampling_ratio/mean": 0.9974363267421722, "sampling/importance_sampling_ratio/min": 0.22540783029980957, "sampling/sampling_logp_difference/max": 0.9563681483268738, "sampling/sampling_logp_difference/mean": 0.003538421425037086, "step": 15710, "step_time": 4.2460815647937125 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0046875, "completions/max_length": 1607.6, "completions/max_terminated_length": 1167.9, "completions/mean_length": 161.25703125, "completions/mean_terminated_length": 152.37261657714845, "completions/min_length": 64.6, "completions/min_terminated_length": 64.6, "entropy": 0.04146127726417035, "epoch": 33.66167023554604, "frac_reward_zero_std": 0.9125, "grad_norm": 0.203125, "learning_rate": 8.4281e-06, "loss": -0.0051, "num_tokens": 1534693483.0, "reward": 1.0387695550918579, "reward_std": 0.22184593975543976, "rewards/reward_accuracy/mean": 0.9390625, "rewards/reward_accuracy/std": 0.21994568929076194, "rewards/reward_format/mean": 0.09970703274011612, "rewards/reward_format/std": 0.0029110706644132735, "sampling/importance_sampling_ratio/max": 2.536005735397339, "sampling/importance_sampling_ratio/mean": 0.9880561709403992, "sampling/importance_sampling_ratio/min": 0.03123031500726938, "sampling/sampling_logp_difference/max": 1.149131178855896, "sampling/sampling_logp_difference/mean": 0.003949470212683081, "step": 15720, "step_time": 7.815185864112573 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003515625, "completions/max_length": 1186.7, "completions/max_terminated_length": 1049.0, "completions/mean_length": 147.92734375, "completions/mean_terminated_length": 141.34533233642577, "completions/min_length": 62.8, "completions/min_terminated_length": 62.8, "entropy": 0.03565325504168868, "epoch": 33.683083511777305, "frac_reward_zero_std": 0.93125, "grad_norm": 0.125, "learning_rate": 8.427100000000001e-06, "loss": -0.0052, "num_tokens": 1535589441.0, "reward": 1.0770312666893005, "reward_std": 0.1062884122133255, "rewards/reward_accuracy/mean": 0.97734375, "rewards/reward_accuracy/std": 0.10492929890751838, "rewards/reward_format/mean": 0.09968750104308129, "rewards/reward_format/std": 0.0025158039759844543, "sampling/importance_sampling_ratio/max": 2.7220169067382813, "sampling/importance_sampling_ratio/mean": 0.9930950284004212, "sampling/importance_sampling_ratio/min": 0.13217363953590394, "sampling/sampling_logp_difference/max": 1.0508686304092407, "sampling/sampling_logp_difference/mean": 0.0037206053268164395, "step": 15730, "step_time": 5.844828071608208 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 1290.6, "completions/max_terminated_length": 983.7, "completions/mean_length": 164.507421875, "completions/mean_terminated_length": 157.18643646240236, "completions/min_length": 65.7, "completions/min_terminated_length": 65.7, "entropy": 0.040926715522073207, "epoch": 33.70449678800856, "frac_reward_zero_std": 0.9125, "grad_norm": 0.609375, "learning_rate": 8.4261e-06, "loss": -0.0054, "num_tokens": 1536520692.0, "reward": 1.0566797018051148, "reward_std": 0.164938011020422, "rewards/reward_accuracy/mean": 0.95703125, "rewards/reward_accuracy/std": 0.16372816935181617, "rewards/reward_format/mean": 0.09964843839406967, "rewards/reward_format/std": 0.0036277435021474956, "sampling/importance_sampling_ratio/max": 2.457803285121918, "sampling/importance_sampling_ratio/mean": 0.9873347282409668, "sampling/importance_sampling_ratio/min": 0.07313869297504424, "sampling/sampling_logp_difference/max": 1.0750716865062713, "sampling/sampling_logp_difference/mean": 0.003964539314620197, "step": 15740, "step_time": 6.40301420520409 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 729.8, "completions/max_terminated_length": 729.8, "completions/mean_length": 132.283984375, "completions/mean_terminated_length": 132.283984375, "completions/min_length": 61.3, "completions/min_terminated_length": 61.3, "entropy": 0.029558208608068525, "epoch": 33.72591006423983, "frac_reward_zero_std": 0.95625, "grad_norm": 0.2421875, "learning_rate": 8.4251e-06, "loss": 0.0017, "num_tokens": 1537367595.0, "reward": 1.0906054854393006, "reward_std": 0.059112010151147844, "rewards/reward_accuracy/mean": 0.990625, "rewards/reward_accuracy/std": 0.05892931893467903, "rewards/reward_format/mean": 0.09998046979308128, "rewards/reward_format/std": 0.0003125000046566129, "sampling/importance_sampling_ratio/max": 2.512445867061615, "sampling/importance_sampling_ratio/mean": 0.9936835110187531, "sampling/importance_sampling_ratio/min": 0.2599779449403286, "sampling/sampling_logp_difference/max": 0.9116616010665893, "sampling/sampling_logp_difference/mean": 0.003431620821356773, "step": 15750, "step_time": 3.858581613222486 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.007421875, "completions/max_length": 1316.2, "completions/max_terminated_length": 941.1, "completions/mean_length": 155.85703125, "completions/mean_terminated_length": 141.86067657470704, "completions/min_length": 65.9, "completions/min_terminated_length": 65.9, "entropy": 0.037652339111082254, "epoch": 33.74732334047109, "frac_reward_zero_std": 0.93125, "grad_norm": 0.3203125, "learning_rate": 8.424100000000001e-06, "loss": -0.007, "num_tokens": 1538274845.0, "reward": 1.0753906607627868, "reward_std": 0.12365757450461387, "rewards/reward_accuracy/mean": 0.97578125, "rewards/reward_accuracy/std": 0.12166690826416016, "rewards/reward_format/mean": 0.09960937723517418, "rewards/reward_format/std": 0.003005386516451836, "sampling/importance_sampling_ratio/max": 2.6237855911254884, "sampling/importance_sampling_ratio/mean": 1.0001077473163604, "sampling/importance_sampling_ratio/min": 0.12548161894083024, "sampling/sampling_logp_difference/max": 0.9152984738349914, "sampling/sampling_logp_difference/mean": 0.0037597658345475795, "step": 15760, "step_time": 6.500347047418472 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001171875, "completions/max_length": 1084.3, "completions/max_terminated_length": 1076.3, "completions/mean_length": 146.645703125, "completions/mean_terminated_length": 144.41419830322266, "completions/min_length": 66.1, "completions/min_terminated_length": 66.1, "entropy": 0.038387073390185836, "epoch": 33.768736616702355, "frac_reward_zero_std": 0.95625, "grad_norm": 0.302734375, "learning_rate": 8.4231e-06, "loss": -0.0048, "num_tokens": 1539169138.0, "reward": 1.0804101705551148, "reward_std": 0.09601515114773065, "rewards/reward_accuracy/mean": 0.98046875, "rewards/reward_accuracy/std": 0.09547502249479294, "rewards/reward_format/mean": 0.09994140714406967, "rewards/reward_format/std": 0.0009375000605359674, "sampling/importance_sampling_ratio/max": 2.5742848396301268, "sampling/importance_sampling_ratio/mean": 0.9955775499343872, "sampling/importance_sampling_ratio/min": 0.12840893864631653, "sampling/sampling_logp_difference/max": 1.1168839454650878, "sampling/sampling_logp_difference/mean": 0.004086605319753289, "step": 15770, "step_time": 5.290367297903868 }, { "clip_ratio/high_max": 3.032132372027263e-05, "clip_ratio/high_mean": 3.790165465034079e-06, "clip_ratio/low_mean": 1.1892834208993008e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 4.97944888593338e-06, "completions/clipped_ratio": 0.005859375, "completions/max_length": 1273.1, "completions/max_terminated_length": 1187.4, "completions/mean_length": 147.703125, "completions/mean_terminated_length": 136.55470275878906, "completions/min_length": 58.9, "completions/min_terminated_length": 58.9, "entropy": 0.038775274599902335, "epoch": 33.79014989293362, "frac_reward_zero_std": 0.925, "grad_norm": 0.052978515625, "learning_rate": 8.4221e-06, "loss": -0.0067, "num_tokens": 1540061482.0, "reward": 1.0504297018051147, "reward_std": 0.1845210845815018, "rewards/reward_accuracy/mean": 0.95078125, "rewards/reward_accuracy/std": 0.18289679735898973, "rewards/reward_format/mean": 0.09964843839406967, "rewards/reward_format/std": 0.002638956531882286, "sampling/importance_sampling_ratio/max": 2.395116400718689, "sampling/importance_sampling_ratio/mean": 0.998455160856247, "sampling/importance_sampling_ratio/min": 0.1690031338483095, "sampling/sampling_logp_difference/max": 1.0642981052398681, "sampling/sampling_logp_difference/mean": 0.0038199572591111064, "step": 15780, "step_time": 6.369334122605506 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0046875, "completions/max_length": 1538.0, "completions/max_terminated_length": 1153.4, "completions/mean_length": 170.7875, "completions/mean_terminated_length": 161.95120544433593, "completions/min_length": 68.6, "completions/min_terminated_length": 68.6, "entropy": 0.0457858192268759, "epoch": 33.811563169164884, "frac_reward_zero_std": 0.9, "grad_norm": 1.125, "learning_rate": 8.421100000000001e-06, "loss": 0.0078, "num_tokens": 1541019722.0, "reward": 1.0524023592472076, "reward_std": 0.17677870243787766, "rewards/reward_accuracy/mean": 0.952734375, "rewards/reward_accuracy/std": 0.1757963478565216, "rewards/reward_format/mean": 0.09966796785593032, "rewards/reward_format/std": 0.0035196532029658557, "sampling/importance_sampling_ratio/max": 2.324246680736542, "sampling/importance_sampling_ratio/mean": 0.9873859107494354, "sampling/importance_sampling_ratio/min": 0.11139944065362214, "sampling/sampling_logp_difference/max": 1.0974258184432983, "sampling/sampling_logp_difference/mean": 0.004142144112847745, "step": 15790, "step_time": 7.409425829307293 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005078125, "completions/max_length": 1845.2, "completions/max_terminated_length": 1202.5, "completions/mean_length": 156.843359375, "completions/mean_terminated_length": 147.2149856567383, "completions/min_length": 63.3, "completions/min_terminated_length": 63.3, "entropy": 0.04051266785245389, "epoch": 33.83297644539615, "frac_reward_zero_std": 0.91875, "grad_norm": 0.2431640625, "learning_rate": 8.420100000000001e-06, "loss": -0.004, "num_tokens": 1541942857.0, "reward": 1.0652734577655791, "reward_std": 0.14288109987974168, "rewards/reward_accuracy/mean": 0.965625, "rewards/reward_accuracy/std": 0.14083538576960564, "rewards/reward_format/mean": 0.09964843839406967, "rewards/reward_format/std": 0.0036014132434502243, "sampling/importance_sampling_ratio/max": 2.501971185207367, "sampling/importance_sampling_ratio/mean": 0.9841910600662231, "sampling/importance_sampling_ratio/min": 0.0927305968478322, "sampling/sampling_logp_difference/max": 0.9954662919044495, "sampling/sampling_logp_difference/mean": 0.0038634657859802244, "step": 15800, "step_time": 8.518008003087015 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003515625, "completions/max_length": 1129.1, "completions/max_terminated_length": 1053.8, "completions/mean_length": 154.10546875, "completions/mean_terminated_length": 147.57539978027344, "completions/min_length": 62.8, "completions/min_terminated_length": 62.8, "entropy": 0.04146480250637978, "epoch": 33.854389721627406, "frac_reward_zero_std": 0.91875, "grad_norm": 0.28125, "learning_rate": 8.4191e-06, "loss": -0.0066, "num_tokens": 1542854471.0, "reward": 1.0694726586341858, "reward_std": 0.12318191528320313, "rewards/reward_accuracy/mean": 0.969921875, "rewards/reward_accuracy/std": 0.12104755714535713, "rewards/reward_format/mean": 0.0995507813990116, "rewards/reward_format/std": 0.003926109452731907, "sampling/importance_sampling_ratio/max": 2.5743033409118654, "sampling/importance_sampling_ratio/mean": 0.9948233783245086, "sampling/importance_sampling_ratio/min": 0.09485166072845459, "sampling/sampling_logp_difference/max": 1.0433502674102784, "sampling/sampling_logp_difference/mean": 0.004179661651141942, "step": 15810, "step_time": 5.7710079391021285 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005859375, "completions/max_length": 1360.0, "completions/max_terminated_length": 1250.8, "completions/mean_length": 166.838671875, "completions/mean_terminated_length": 155.8644989013672, "completions/min_length": 60.2, "completions/min_terminated_length": 60.2, "entropy": 0.0396261194953695, "epoch": 33.87580299785867, "frac_reward_zero_std": 0.925, "grad_norm": 0.54296875, "learning_rate": 8.4181e-06, "loss": 0.0006, "num_tokens": 1543799306.0, "reward": 1.054941439628601, "reward_std": 0.16484254151582717, "rewards/reward_accuracy/mean": 0.95546875, "rewards/reward_accuracy/std": 0.1628672733902931, "rewards/reward_format/mean": 0.09947265833616256, "rewards/reward_format/std": 0.004569036280736327, "sampling/importance_sampling_ratio/max": 2.3608781814575197, "sampling/importance_sampling_ratio/mean": 0.9864245891571045, "sampling/importance_sampling_ratio/min": 0.0758115865290165, "sampling/sampling_logp_difference/max": 0.9618160486221313, "sampling/sampling_logp_difference/mean": 0.003697440191172063, "step": 15820, "step_time": 6.807810882508056 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00703125, "completions/max_length": 1371.8, "completions/max_terminated_length": 1220.4, "completions/mean_length": 180.1453125, "completions/mean_terminated_length": 167.04597015380858, "completions/min_length": 63.0, "completions/min_terminated_length": 63.0, "entropy": 0.043320285412482916, "epoch": 33.897216274089935, "frac_reward_zero_std": 0.875, "grad_norm": 0.6796875, "learning_rate": 8.417100000000001e-06, "loss": -0.0046, "num_tokens": 1544785822.0, "reward": 1.0658008098602294, "reward_std": 0.1489630676805973, "rewards/reward_accuracy/mean": 0.96640625, "rewards/reward_accuracy/std": 0.14700063019990922, "rewards/reward_format/mean": 0.09939453154802322, "rewards/reward_format/std": 0.004314637230709195, "sampling/importance_sampling_ratio/max": 2.4438926458358763, "sampling/importance_sampling_ratio/mean": 0.9844156801700592, "sampling/importance_sampling_ratio/min": 0.13534865379333497, "sampling/sampling_logp_difference/max": 1.1850386619567872, "sampling/sampling_logp_difference/mean": 0.0039394727209582925, "step": 15830, "step_time": 6.840625097398879 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003515625, "completions/max_length": 1236.8, "completions/max_terminated_length": 1145.2, "completions/mean_length": 147.043359375, "completions/mean_terminated_length": 140.36733474731446, "completions/min_length": 65.0, "completions/min_terminated_length": 65.0, "entropy": 0.03739469952415675, "epoch": 33.9186295503212, "frac_reward_zero_std": 0.95, "grad_norm": 0.0, "learning_rate": 8.4161e-06, "loss": -0.0044, "num_tokens": 1545677709.0, "reward": 1.0704687714576722, "reward_std": 0.13188396990299225, "rewards/reward_accuracy/mean": 0.970703125, "rewards/reward_accuracy/std": 0.13058871403336525, "rewards/reward_format/mean": 0.0997656263411045, "rewards/reward_format/std": 0.0024110510013997553, "sampling/importance_sampling_ratio/max": 2.2385746717453, "sampling/importance_sampling_ratio/mean": 0.9897590219974518, "sampling/importance_sampling_ratio/min": 0.1022606361657381, "sampling/sampling_logp_difference/max": 1.131439447402954, "sampling/sampling_logp_difference/mean": 0.003635389916598797, "step": 15840, "step_time": 6.214495090491255 }, { "clip_ratio/high_max": 0.00014978402177803218, "clip_ratio/high_mean": 1.8723002722254022e-05, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 1.8723002722254022e-05, "completions/clipped_ratio": 0.000390625, "completions/max_length": 911.3, "completions/max_terminated_length": 889.7, "completions/mean_length": 144.1421875, "completions/mean_terminated_length": 143.41554412841796, "completions/min_length": 69.4, "completions/min_terminated_length": 69.4, "entropy": 0.03453121823258698, "epoch": 33.940042826552464, "frac_reward_zero_std": 0.9625, "grad_norm": 0.0, "learning_rate": 8.4151e-06, "loss": -0.002, "num_tokens": 1546572217.0, "reward": 1.0761133074760436, "reward_std": 0.09985153451561928, "rewards/reward_accuracy/mean": 0.976171875, "rewards/reward_accuracy/std": 0.09972807243466378, "rewards/reward_format/mean": 0.09994140788912773, "rewards/reward_format/std": 0.0006976743228733539, "sampling/importance_sampling_ratio/max": 2.3013684272766115, "sampling/importance_sampling_ratio/mean": 0.9925741493701935, "sampling/importance_sampling_ratio/min": 0.13345409631729127, "sampling/sampling_logp_difference/max": 0.8856019973754883, "sampling/sampling_logp_difference/mean": 0.0036997859366238116, "step": 15850, "step_time": 4.598055321004358 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001171875, "completions/max_length": 1057.2, "completions/max_terminated_length": 957.2, "completions/mean_length": 143.7515625, "completions/mean_terminated_length": 141.55484771728516, "completions/min_length": 64.4, "completions/min_terminated_length": 64.4, "entropy": 0.036260483087971807, "epoch": 33.96145610278373, "frac_reward_zero_std": 0.9375, "grad_norm": 0.2578125, "learning_rate": 8.414100000000001e-06, "loss": -0.0041, "num_tokens": 1547451453.0, "reward": 1.0550000190734863, "reward_std": 0.1820862352848053, "rewards/reward_accuracy/mean": 0.955078125, "rewards/reward_accuracy/std": 0.18180495649576187, "rewards/reward_format/mean": 0.09992187619209289, "rewards/reward_format/std": 0.0010660743806511163, "sampling/importance_sampling_ratio/max": 2.5251001477241517, "sampling/importance_sampling_ratio/mean": 0.9989038228988647, "sampling/importance_sampling_ratio/min": 0.14155374094843864, "sampling/sampling_logp_difference/max": 1.104555368423462, "sampling/sampling_logp_difference/mean": 0.00379797478672117, "step": 15860, "step_time": 5.279192802988109 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.000390625, "completions/max_length": 1084.6, "completions/max_terminated_length": 898.8, "completions/mean_length": 144.892578125, "completions/mean_terminated_length": 144.13697509765626, "completions/min_length": 70.7, "completions/min_terminated_length": 70.7, "entropy": 0.03592145766597241, "epoch": 33.98286937901499, "frac_reward_zero_std": 0.9, "grad_norm": 1.1171875, "learning_rate": 8.4131e-06, "loss": -0.0019, "num_tokens": 1548338298.0, "reward": 1.0835351705551148, "reward_std": 0.09530943483114243, "rewards/reward_accuracy/mean": 0.98359375, "rewards/reward_accuracy/std": 0.09462199062108993, "rewards/reward_format/mean": 0.09994140714406967, "rewards/reward_format/std": 0.0009375000605359674, "sampling/importance_sampling_ratio/max": 2.621462869644165, "sampling/importance_sampling_ratio/mean": 1.007897400856018, "sampling/importance_sampling_ratio/min": 0.21660336554050447, "sampling/sampling_logp_difference/max": 1.0186576128005982, "sampling/sampling_logp_difference/mean": 0.0039421940920874475, "step": 15870, "step_time": 5.261191323780804 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005078125, "completions/max_length": 975.3, "completions/max_terminated_length": 900.5, "completions/mean_length": 161.343359375, "completions/mean_terminated_length": 151.99954833984376, "completions/min_length": 62.4, "completions/min_terminated_length": 62.4, "entropy": 0.04361795550212264, "epoch": 34.00428265524625, "frac_reward_zero_std": 0.95625, "grad_norm": 0.314453125, "learning_rate": 8.4121e-06, "loss": -0.0019, "num_tokens": 1549268841.0, "reward": 1.0777734518051147, "reward_std": 0.08910081386566163, "rewards/reward_accuracy/mean": 0.978125, "rewards/reward_accuracy/std": 0.08800128400325775, "rewards/reward_format/mean": 0.09964843839406967, "rewards/reward_format/std": 0.0025979127967730165, "sampling/importance_sampling_ratio/max": 2.3710811257362367, "sampling/importance_sampling_ratio/mean": 0.9834049940109253, "sampling/importance_sampling_ratio/min": 0.06083831340074539, "sampling/sampling_logp_difference/max": 1.0336459159851075, "sampling/sampling_logp_difference/mean": 0.004019369790330529, "step": 15880, "step_time": 5.147004280489637 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00234375, "completions/max_length": 1485.8, "completions/max_terminated_length": 1322.1, "completions/mean_length": 161.16640625, "completions/mean_terminated_length": 156.76715240478515, "completions/min_length": 64.5, "completions/min_terminated_length": 64.5, "entropy": 0.04362169736996293, "epoch": 34.025695931477514, "frac_reward_zero_std": 0.925, "grad_norm": 0.0, "learning_rate": 8.411100000000002e-06, "loss": -0.0027, "num_tokens": 1550212435.0, "reward": 1.08369140625, "reward_std": 0.09740320295095443, "rewards/reward_accuracy/mean": 0.983984375, "rewards/reward_accuracy/std": 0.09527873098850251, "rewards/reward_format/mean": 0.09970703125, "rewards/reward_format/std": 0.0038753008469939233, "sampling/importance_sampling_ratio/max": 2.494776129722595, "sampling/importance_sampling_ratio/mean": 0.988626879453659, "sampling/importance_sampling_ratio/min": 0.1684450825676322, "sampling/sampling_logp_difference/max": 1.0475051879882813, "sampling/sampling_logp_difference/mean": 0.003897975804284215, "step": 15890, "step_time": 7.313551332007046 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.006640625, "completions/max_length": 1677.8, "completions/max_terminated_length": 1344.6, "completions/mean_length": 156.637890625, "completions/mean_terminated_length": 144.02641754150392, "completions/min_length": 63.4, "completions/min_terminated_length": 63.4, "entropy": 0.04232143822591752, "epoch": 34.04710920770878, "frac_reward_zero_std": 0.925, "grad_norm": 0.1689453125, "learning_rate": 8.410100000000001e-06, "loss": -0.0042, "num_tokens": 1551134548.0, "reward": 1.0729687571525575, "reward_std": 0.129569610953331, "rewards/reward_accuracy/mean": 0.9734375, "rewards/reward_accuracy/std": 0.12744625136256219, "rewards/reward_format/mean": 0.09953125044703484, "rewards/reward_format/std": 0.00392670757137239, "sampling/importance_sampling_ratio/max": 2.393895947933197, "sampling/importance_sampling_ratio/mean": 0.9845734298229217, "sampling/importance_sampling_ratio/min": 0.12432486414909363, "sampling/sampling_logp_difference/max": 0.9150558829307556, "sampling/sampling_logp_difference/mean": 0.0037966437404975293, "step": 15900, "step_time": 8.199960121905315 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 1176.7, "completions/max_terminated_length": 1036.4, "completions/mean_length": 148.770703125, "completions/mean_terminated_length": 141.4779067993164, "completions/min_length": 64.9, "completions/min_terminated_length": 64.9, "entropy": 0.03511536319274455, "epoch": 34.06852248394004, "frac_reward_zero_std": 0.95, "grad_norm": 0.0615234375, "learning_rate": 8.4091e-06, "loss": -0.0052, "num_tokens": 1552035849.0, "reward": 1.072812521457672, "reward_std": 0.11764153242111205, "rewards/reward_accuracy/mean": 0.973046875, "rewards/reward_accuracy/std": 0.1164311058819294, "rewards/reward_format/mean": 0.0997656263411045, "rewards/reward_format/std": 0.0027538751484826205, "sampling/importance_sampling_ratio/max": 2.5481075286865233, "sampling/importance_sampling_ratio/mean": 0.9995423018932342, "sampling/importance_sampling_ratio/min": 0.14041961953043938, "sampling/sampling_logp_difference/max": 0.8485879242420197, "sampling/sampling_logp_difference/mean": 0.003766522742807865, "step": 15910, "step_time": 5.939137347901124 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0015625, "completions/max_length": 760.6, "completions/max_terminated_length": 727.2, "completions/mean_length": 139.53671875, "completions/mean_terminated_length": 136.60477600097656, "completions/min_length": 62.1, "completions/min_terminated_length": 62.1, "entropy": 0.032944238488562406, "epoch": 34.08993576017131, "frac_reward_zero_std": 0.95, "grad_norm": 0.1787109375, "learning_rate": 8.4081e-06, "loss": -0.0028, "num_tokens": 1552900295.0, "reward": 1.0767968893051147, "reward_std": 0.08754099488724024, "rewards/reward_accuracy/mean": 0.976953125, "rewards/reward_accuracy/std": 0.08686792105436325, "rewards/reward_format/mean": 0.09984375089406967, "rewards/reward_format/std": 0.0014331000158563257, "sampling/importance_sampling_ratio/max": 2.519249105453491, "sampling/importance_sampling_ratio/mean": 0.9926102578639984, "sampling/importance_sampling_ratio/min": 0.26331781446933744, "sampling/sampling_logp_difference/max": 0.9679141163825988, "sampling/sampling_logp_difference/mean": 0.003724357020109892, "step": 15920, "step_time": 4.043900561399641 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.004296875, "completions/max_length": 1297.8, "completions/max_terminated_length": 1095.3, "completions/mean_length": 161.769140625, "completions/mean_terminated_length": 153.70806274414062, "completions/min_length": 67.5, "completions/min_terminated_length": 67.5, "entropy": 0.04290665129665285, "epoch": 34.11134903640257, "frac_reward_zero_std": 0.94375, "grad_norm": 0.76171875, "learning_rate": 8.4071e-06, "loss": -0.0043, "num_tokens": 1553835736.0, "reward": 1.0445898711681365, "reward_std": 0.18749339878559113, "rewards/reward_accuracy/mean": 0.944921875, "rewards/reward_accuracy/std": 0.18597693964838982, "rewards/reward_format/mean": 0.09966797083616256, "rewards/reward_format/std": 0.004097145958803594, "sampling/importance_sampling_ratio/max": 2.3708810806274414, "sampling/importance_sampling_ratio/mean": 0.9892857611179352, "sampling/importance_sampling_ratio/min": 0.07040365412831306, "sampling/sampling_logp_difference/max": 1.1933933734893798, "sampling/sampling_logp_difference/mean": 0.004004558711312711, "step": 15930, "step_time": 6.396261447688448 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 1165.0, "completions/max_terminated_length": 969.8, "completions/mean_length": 160.6125, "completions/mean_terminated_length": 153.3472137451172, "completions/min_length": 64.8, "completions/min_terminated_length": 64.8, "entropy": 0.04044304918497801, "epoch": 34.13276231263383, "frac_reward_zero_std": 0.89375, "grad_norm": 0.59765625, "learning_rate": 8.4061e-06, "loss": -0.0021, "num_tokens": 1554762536.0, "reward": 1.059824240207672, "reward_std": 0.1671535886824131, "rewards/reward_accuracy/mean": 0.96015625, "rewards/reward_accuracy/std": 0.1655910536646843, "rewards/reward_format/mean": 0.09966796934604645, "rewards/reward_format/std": 0.003209052630700171, "sampling/importance_sampling_ratio/max": 2.4587535858154297, "sampling/importance_sampling_ratio/mean": 0.984615969657898, "sampling/importance_sampling_ratio/min": 0.0975650891661644, "sampling/sampling_logp_difference/max": 0.8387087941169739, "sampling/sampling_logp_difference/mean": 0.003931131074205041, "step": 15940, "step_time": 5.916208765501506 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001171875, "completions/max_length": 988.1, "completions/max_terminated_length": 691.4, "completions/mean_length": 139.962890625, "completions/mean_terminated_length": 137.73201751708984, "completions/min_length": 66.0, "completions/min_terminated_length": 66.0, "entropy": 0.03229325448628515, "epoch": 34.154175588865094, "frac_reward_zero_std": 0.94375, "grad_norm": 0.1494140625, "learning_rate": 8.4051e-06, "loss": -0.0066, "num_tokens": 1555635433.0, "reward": 1.0772656440734862, "reward_std": 0.10769757702946663, "rewards/reward_accuracy/mean": 0.97734375, "rewards/reward_accuracy/std": 0.10692307502031326, "rewards/reward_format/mean": 0.09992187619209289, "rewards/reward_format/std": 0.0012500001117587089, "sampling/importance_sampling_ratio/max": 2.473639738559723, "sampling/importance_sampling_ratio/mean": 1.005414229631424, "sampling/importance_sampling_ratio/min": 0.19479365795850753, "sampling/sampling_logp_difference/max": 0.8436864256858826, "sampling/sampling_logp_difference/mean": 0.003598675737157464, "step": 15950, "step_time": 4.778453679496306 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003515625, "completions/max_length": 1149.3, "completions/max_terminated_length": 995.7, "completions/mean_length": 149.54609375, "completions/mean_terminated_length": 142.8701599121094, "completions/min_length": 61.6, "completions/min_terminated_length": 61.6, "entropy": 0.038888661307282746, "epoch": 34.17558886509636, "frac_reward_zero_std": 0.95, "grad_norm": 1.2734375, "learning_rate": 8.404100000000001e-06, "loss": -0.0045, "num_tokens": 1556532031.0, "reward": 1.085351586341858, "reward_std": 0.08288926631212234, "rewards/reward_accuracy/mean": 0.985546875, "rewards/reward_accuracy/std": 0.08184266164898872, "rewards/reward_format/mean": 0.09980468899011612, "rewards/reward_format/std": 0.0025173231260851026, "sampling/importance_sampling_ratio/max": 2.454957115650177, "sampling/importance_sampling_ratio/mean": 0.9820002496242524, "sampling/importance_sampling_ratio/min": 0.18519899882376195, "sampling/sampling_logp_difference/max": 0.9857999086380005, "sampling/sampling_logp_difference/mean": 0.004000566550530493, "step": 15960, "step_time": 5.792575803401997 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00078125, "completions/max_length": 1273.5, "completions/max_terminated_length": 1024.7, "completions/mean_length": 140.12578125, "completions/mean_terminated_length": 138.6391159057617, "completions/min_length": 62.3, "completions/min_terminated_length": 62.3, "entropy": 0.035579075640998784, "epoch": 34.19700214132762, "frac_reward_zero_std": 0.925, "grad_norm": 0.3203125, "learning_rate": 8.403100000000001e-06, "loss": -0.0027, "num_tokens": 1557405393.0, "reward": 1.0843554854393005, "reward_std": 0.09677987024188042, "rewards/reward_accuracy/mean": 0.984375, "rewards/reward_accuracy/std": 0.09646737277507782, "rewards/reward_format/mean": 0.09998046979308128, "rewards/reward_format/std": 0.0003125000046566129, "sampling/importance_sampling_ratio/max": 2.601102113723755, "sampling/importance_sampling_ratio/mean": 0.9890960037708283, "sampling/importance_sampling_ratio/min": 0.11486774086952209, "sampling/sampling_logp_difference/max": 1.2796175837516786, "sampling/sampling_logp_difference/mean": 0.003919307538308203, "step": 15970, "step_time": 6.035174532706151 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.000390625, "completions/max_length": 874.5, "completions/max_terminated_length": 856.3, "completions/mean_length": 147.179296875, "completions/mean_terminated_length": 146.43978576660157, "completions/min_length": 66.6, "completions/min_terminated_length": 66.6, "entropy": 0.03311580833978951, "epoch": 34.21841541755889, "frac_reward_zero_std": 0.95625, "grad_norm": 0.2333984375, "learning_rate": 8.4021e-06, "loss": 0.0003, "num_tokens": 1558302700.0, "reward": 1.0835156440734863, "reward_std": 0.08064092129934579, "rewards/reward_accuracy/mean": 0.98359375, "rewards/reward_accuracy/std": 0.0800995908677578, "rewards/reward_format/mean": 0.09992187619209289, "rewards/reward_format/std": 0.001010174280963838, "sampling/importance_sampling_ratio/max": 2.3865211963653565, "sampling/importance_sampling_ratio/mean": 0.9990239262580871, "sampling/importance_sampling_ratio/min": 0.23313820958137513, "sampling/sampling_logp_difference/max": 0.9724297821521759, "sampling/sampling_logp_difference/mean": 0.003575699171051383, "step": 15980, "step_time": 4.295019346507615 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005078125, "completions/max_length": 1020.7, "completions/max_terminated_length": 931.6, "completions/mean_length": 155.28515625, "completions/mean_terminated_length": 145.80186767578124, "completions/min_length": 64.5, "completions/min_terminated_length": 64.5, "entropy": 0.03973747291602194, "epoch": 34.23982869379015, "frac_reward_zero_std": 0.95, "grad_norm": 0.0, "learning_rate": 8.401100000000002e-06, "loss": 0.0, "num_tokens": 1559210630.0, "reward": 1.071464866399765, "reward_std": 0.10260616168379784, "rewards/reward_accuracy/mean": 0.971875, "rewards/reward_accuracy/std": 0.10188135877251625, "rewards/reward_format/mean": 0.09958984479308128, "rewards/reward_format/std": 0.002854176051914692, "sampling/importance_sampling_ratio/max": 2.584211754798889, "sampling/importance_sampling_ratio/mean": 0.9876089632511139, "sampling/importance_sampling_ratio/min": 0.18422046676278114, "sampling/sampling_logp_difference/max": 0.9336146175861358, "sampling/sampling_logp_difference/mean": 0.003519516112282872, "step": 15990, "step_time": 5.340041447401745 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001171875, "completions/max_length": 1127.3, "completions/max_terminated_length": 916.9, "completions/mean_length": 150.748828125, "completions/mean_terminated_length": 148.51742553710938, "completions/min_length": 66.1, "completions/min_terminated_length": 66.1, "entropy": 0.036685016192495826, "epoch": 34.261241970021416, "frac_reward_zero_std": 0.9625, "grad_norm": 0.2158203125, "learning_rate": 8.400100000000001e-06, "loss": 0.0011, "num_tokens": 1560112803.0, "reward": 1.067871105670929, "reward_std": 0.13576003566849976, "rewards/reward_accuracy/mean": 0.96796875, "rewards/reward_accuracy/std": 0.1351088725030422, "rewards/reward_format/mean": 0.09990234449505805, "rewards/reward_format/std": 0.001562500116415322, "sampling/importance_sampling_ratio/max": 2.5288784742355346, "sampling/importance_sampling_ratio/mean": 0.9940587878227234, "sampling/importance_sampling_ratio/min": 0.16501252502202987, "sampling/sampling_logp_difference/max": 0.9682760179042816, "sampling/sampling_logp_difference/mean": 0.003753247344866395, "step": 16000, "step_time": 5.467206508887466 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00625, "completions/max_length": 873.8, "completions/max_terminated_length": 754.1, "completions/mean_length": 156.66171875, "completions/mean_terminated_length": 145.09713134765624, "completions/min_length": 63.5, "completions/min_terminated_length": 63.5, "entropy": 0.036085558985359964, "epoch": 34.28265524625267, "frac_reward_zero_std": 0.9375, "grad_norm": 0.0, "learning_rate": 8.3991e-06, "loss": -0.0061, "num_tokens": 1561031905.0, "reward": 1.078906273841858, "reward_std": 0.09470519945025443, "rewards/reward_accuracy/mean": 0.979296875, "rewards/reward_accuracy/std": 0.0933746837079525, "rewards/reward_format/mean": 0.09960937649011611, "rewards/reward_format/std": 0.0023646473884582518, "sampling/importance_sampling_ratio/max": 2.6079225182533263, "sampling/importance_sampling_ratio/mean": 0.9957319617271423, "sampling/importance_sampling_ratio/min": 0.15865231435745955, "sampling/sampling_logp_difference/max": 1.04581139087677, "sampling/sampling_logp_difference/mean": 0.003582767257466912, "step": 16010, "step_time": 4.68082040809386 }, { "clip_ratio/high_max": 1.9380945013836025e-05, "clip_ratio/high_mean": 2.422618126729503e-06, "clip_ratio/low_mean": 9.789408295546309e-07, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 3.401558956284134e-06, "completions/clipped_ratio": 0.00546875, "completions/max_length": 882.6, "completions/max_terminated_length": 844.6, "completions/mean_length": 156.921875, "completions/mean_terminated_length": 146.65208740234374, "completions/min_length": 66.6, "completions/min_terminated_length": 66.6, "entropy": 0.03715559404809028, "epoch": 34.30406852248394, "frac_reward_zero_std": 0.94375, "grad_norm": 0.44921875, "learning_rate": 8.3981e-06, "loss": -0.0018, "num_tokens": 1561955193.0, "reward": 1.0844531416893006, "reward_std": 0.0798710823059082, "rewards/reward_accuracy/mean": 0.984765625, "rewards/reward_accuracy/std": 0.07873420938849449, "rewards/reward_format/mean": 0.09968750104308129, "rewards/reward_format/std": 0.001972912740893662, "sampling/importance_sampling_ratio/max": 2.513861346244812, "sampling/importance_sampling_ratio/mean": 0.9898562729358673, "sampling/importance_sampling_ratio/min": 0.11206884998828173, "sampling/sampling_logp_difference/max": 1.0769752264022827, "sampling/sampling_logp_difference/mean": 0.0037702169734984635, "step": 16020, "step_time": 4.621894121196237 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003125, "completions/max_length": 1256.6, "completions/max_terminated_length": 1061.2, "completions/mean_length": 155.805859375, "completions/mean_terminated_length": 149.95606842041016, "completions/min_length": 66.9, "completions/min_terminated_length": 66.9, "entropy": 0.040249398560263216, "epoch": 34.3254817987152, "frac_reward_zero_std": 0.975, "grad_norm": 0.0, "learning_rate": 8.3971e-06, "loss": -0.0035, "num_tokens": 1562866216.0, "reward": 1.0693359613418578, "reward_std": 0.13678024038672448, "rewards/reward_accuracy/mean": 0.96953125, "rewards/reward_accuracy/std": 0.13569534122943877, "rewards/reward_format/mean": 0.09980468973517417, "rewards/reward_format/std": 0.0020172667922452093, "sampling/importance_sampling_ratio/max": 2.5956163883209227, "sampling/importance_sampling_ratio/mean": 0.9917648077011109, "sampling/importance_sampling_ratio/min": 0.15527553297579288, "sampling/sampling_logp_difference/max": 0.8696638107299804, "sampling/sampling_logp_difference/mean": 0.0038934982847422363, "step": 16030, "step_time": 6.1753648990852525 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.004296875, "completions/max_length": 1257.5, "completions/max_terminated_length": 1165.1, "completions/mean_length": 155.5046875, "completions/mean_terminated_length": 147.41493072509766, "completions/min_length": 67.3, "completions/min_terminated_length": 67.3, "entropy": 0.041977917426265776, "epoch": 34.34689507494647, "frac_reward_zero_std": 0.925, "grad_norm": 0.341796875, "learning_rate": 8.3961e-06, "loss": -0.0005, "num_tokens": 1563780724.0, "reward": 1.0758008003234862, "reward_std": 0.11481327190995216, "rewards/reward_accuracy/mean": 0.976171875, "rewards/reward_accuracy/std": 0.11309932842850685, "rewards/reward_format/mean": 0.09962890818715095, "rewards/reward_format/std": 0.0029796418268233536, "sampling/importance_sampling_ratio/max": 2.610753297805786, "sampling/importance_sampling_ratio/mean": 0.9799531996250153, "sampling/importance_sampling_ratio/min": 0.07281242087483406, "sampling/sampling_logp_difference/max": 1.0590971112251282, "sampling/sampling_logp_difference/mean": 0.0041837411699816585, "step": 16040, "step_time": 6.264466370994342 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005859375, "completions/max_length": 1251.7, "completions/max_terminated_length": 1189.7, "completions/mean_length": 161.5625, "completions/mean_terminated_length": 150.56368408203124, "completions/min_length": 64.9, "completions/min_terminated_length": 64.9, "entropy": 0.04205324549693614, "epoch": 34.36830835117773, "frac_reward_zero_std": 0.95, "grad_norm": 0.0, "learning_rate": 8.3951e-06, "loss": -0.0069, "num_tokens": 1564715940.0, "reward": 1.0788476824760438, "reward_std": 0.1060407280921936, "rewards/reward_accuracy/mean": 0.979296875, "rewards/reward_accuracy/std": 0.10364448726177215, "rewards/reward_format/mean": 0.09955078288912773, "rewards/reward_format/std": 0.004142089700326324, "sampling/importance_sampling_ratio/max": 2.541218137741089, "sampling/importance_sampling_ratio/mean": 0.9952875196933746, "sampling/importance_sampling_ratio/min": 0.11232309881597757, "sampling/sampling_logp_difference/max": 0.9050891935825348, "sampling/sampling_logp_difference/mean": 0.0037826245417818425, "step": 16050, "step_time": 6.2942981557949675 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001171875, "completions/max_length": 973.3, "completions/max_terminated_length": 831.1, "completions/mean_length": 144.5640625, "completions/mean_terminated_length": 142.35389251708983, "completions/min_length": 65.3, "completions/min_terminated_length": 65.3, "entropy": 0.032069319789297876, "epoch": 34.389721627408996, "frac_reward_zero_std": 0.9625, "grad_norm": 0.0, "learning_rate": 8.3941e-06, "loss": -0.0026, "num_tokens": 1565607256.0, "reward": 1.0818945527076722, "reward_std": 0.08662917912006378, "rewards/reward_accuracy/mean": 0.98203125, "rewards/reward_accuracy/std": 0.08565702885389329, "rewards/reward_format/mean": 0.09986328259110451, "rewards/reward_format/std": 0.0018196488032117485, "sampling/importance_sampling_ratio/max": 2.5625462770462035, "sampling/importance_sampling_ratio/mean": 0.9939753949642182, "sampling/importance_sampling_ratio/min": 0.18077744208276272, "sampling/sampling_logp_difference/max": 0.9580687880516052, "sampling/sampling_logp_difference/mean": 0.0035376028157770635, "step": 16060, "step_time": 4.772246252524201 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 1411.8, "completions/max_terminated_length": 1153.1, "completions/mean_length": 164.55078125, "completions/mean_terminated_length": 157.29802703857422, "completions/min_length": 62.7, "completions/min_terminated_length": 62.7, "entropy": 0.043240104941651224, "epoch": 34.41113490364026, "frac_reward_zero_std": 0.91875, "grad_norm": 0.0, "learning_rate": 8.393100000000001e-06, "loss": -0.0079, "num_tokens": 1566547722.0, "reward": 1.0606445372104645, "reward_std": 0.124282945250161, "rewards/reward_accuracy/mean": 0.9609375, "rewards/reward_accuracy/std": 0.1230269841849804, "rewards/reward_format/mean": 0.09970703199505807, "rewards/reward_format/std": 0.003031764458864927, "sampling/importance_sampling_ratio/max": 2.5727585315704347, "sampling/importance_sampling_ratio/mean": 0.985068428516388, "sampling/importance_sampling_ratio/min": 0.14329082071781157, "sampling/sampling_logp_difference/max": 0.8619545757770538, "sampling/sampling_logp_difference/mean": 0.0036948875756934287, "step": 16070, "step_time": 6.9033686443028275 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001171875, "completions/max_length": 1415.9, "completions/max_terminated_length": 959.2, "completions/mean_length": 146.37578125, "completions/mean_terminated_length": 144.12899017333984, "completions/min_length": 67.2, "completions/min_terminated_length": 67.2, "entropy": 0.03519069354515523, "epoch": 34.43254817987152, "frac_reward_zero_std": 0.95, "grad_norm": 0.0, "learning_rate": 8.3921e-06, "loss": -0.0068, "num_tokens": 1567436780.0, "reward": 1.0885546922683715, "reward_std": 0.06523899168241769, "rewards/reward_accuracy/mean": 0.988671875, "rewards/reward_accuracy/std": 0.06386485770344734, "rewards/reward_format/mean": 0.09988281279802322, "rewards/reward_format/std": 0.0018750001210719347, "sampling/importance_sampling_ratio/max": 2.6722617387771606, "sampling/importance_sampling_ratio/mean": 0.9889939785003662, "sampling/importance_sampling_ratio/min": 0.13018002063035966, "sampling/sampling_logp_difference/max": 0.9091616630554199, "sampling/sampling_logp_difference/mean": 0.0035812468035146595, "step": 16080, "step_time": 6.701101708901115 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001953125, "completions/max_length": 1061.8, "completions/max_terminated_length": 883.3, "completions/mean_length": 144.3265625, "completions/mean_terminated_length": 140.64983215332032, "completions/min_length": 59.0, "completions/min_terminated_length": 59.0, "entropy": 0.03461771132424474, "epoch": 34.45396145610278, "frac_reward_zero_std": 0.95, "grad_norm": 0.0, "learning_rate": 8.391100000000002e-06, "loss": -0.005, "num_tokens": 1568321360.0, "reward": 1.077148449420929, "reward_std": 0.10371746569871902, "rewards/reward_accuracy/mean": 0.97734375, "rewards/reward_accuracy/std": 0.10263437032699585, "rewards/reward_format/mean": 0.09980468824505806, "rewards/reward_format/std": 0.0019669008674100042, "sampling/importance_sampling_ratio/max": 2.481511628627777, "sampling/importance_sampling_ratio/mean": 0.9959150433540345, "sampling/importance_sampling_ratio/min": 0.08647757284343242, "sampling/sampling_logp_difference/max": 1.2185229241847992, "sampling/sampling_logp_difference/mean": 0.0036540236324071884, "step": 16090, "step_time": 5.25035409949196 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0015625, "completions/max_length": 1442.1, "completions/max_terminated_length": 1317.4, "completions/mean_length": 154.290625, "completions/mean_terminated_length": 151.35532836914064, "completions/min_length": 65.9, "completions/min_terminated_length": 65.9, "entropy": 0.037683614226989445, "epoch": 34.475374732334046, "frac_reward_zero_std": 0.925, "grad_norm": 0.0, "learning_rate": 8.390100000000001e-06, "loss": -0.0026, "num_tokens": 1569238248.0, "reward": 1.0792382836341858, "reward_std": 0.11071329519618303, "rewards/reward_accuracy/mean": 0.979296875, "rewards/reward_accuracy/std": 0.11026238724589348, "rewards/reward_format/mean": 0.09994140639901161, "rewards/reward_format/std": 0.0009375000139698386, "sampling/importance_sampling_ratio/max": 2.4859166145324707, "sampling/importance_sampling_ratio/mean": 0.9869338631629944, "sampling/importance_sampling_ratio/min": 0.11047020889818668, "sampling/sampling_logp_difference/max": 1.19916689991951, "sampling/sampling_logp_difference/mean": 0.0038034740602597593, "step": 16100, "step_time": 6.899744636201649 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0015625, "completions/max_length": 584.9, "completions/max_terminated_length": 569.9, "completions/mean_length": 140.259765625, "completions/mean_terminated_length": 137.32178955078126, "completions/min_length": 60.8, "completions/min_terminated_length": 60.8, "entropy": 0.030558942607603966, "epoch": 34.49678800856531, "frac_reward_zero_std": 0.975, "grad_norm": 0.0, "learning_rate": 8.3891e-06, "loss": -0.0035, "num_tokens": 1570116161.0, "reward": 1.0736719012260436, "reward_std": 0.1108190357685089, "rewards/reward_accuracy/mean": 0.973828125, "rewards/reward_accuracy/std": 0.11020855456590653, "rewards/reward_format/mean": 0.09984375163912773, "rewards/reward_format/std": 0.0012426253408193589, "sampling/importance_sampling_ratio/max": 2.5435719728469848, "sampling/importance_sampling_ratio/mean": 0.9781721234321594, "sampling/importance_sampling_ratio/min": 0.16193961948156357, "sampling/sampling_logp_difference/max": 1.0179044961929322, "sampling/sampling_logp_difference/mean": 0.003495797934010625, "step": 16110, "step_time": 3.2510236222005915 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003125, "completions/max_length": 1223.3, "completions/max_terminated_length": 905.9, "completions/mean_length": 152.603515625, "completions/mean_terminated_length": 146.7426330566406, "completions/min_length": 68.3, "completions/min_terminated_length": 68.3, "entropy": 0.03903848642949015, "epoch": 34.518201284796575, "frac_reward_zero_std": 0.9375, "grad_norm": 0.0, "learning_rate": 8.3881e-06, "loss": -0.0064, "num_tokens": 1571030154.0, "reward": 1.0709179878234862, "reward_std": 0.11353476271033287, "rewards/reward_accuracy/mean": 0.97109375, "rewards/reward_accuracy/std": 0.1125171072781086, "rewards/reward_format/mean": 0.0998242199420929, "rewards/reward_format/std": 0.0024446487659588456, "sampling/importance_sampling_ratio/max": 2.520795500278473, "sampling/importance_sampling_ratio/mean": 1.001498633623123, "sampling/importance_sampling_ratio/min": 0.11508791008964181, "sampling/sampling_logp_difference/max": 1.0005189776420593, "sampling/sampling_logp_difference/mean": 0.003878114675171673, "step": 16120, "step_time": 6.078479649301153 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001171875, "completions/max_length": 1148.4, "completions/max_terminated_length": 918.2, "completions/mean_length": 144.09375, "completions/mean_terminated_length": 141.8668655395508, "completions/min_length": 61.1, "completions/min_terminated_length": 61.1, "entropy": 0.031353766191750766, "epoch": 34.53961456102784, "frac_reward_zero_std": 0.9375, "grad_norm": 0.32421875, "learning_rate": 8.3871e-06, "loss": 0.0001, "num_tokens": 1571915386.0, "reward": 1.068261730670929, "reward_std": 0.13128048926591873, "rewards/reward_accuracy/mean": 0.968359375, "rewards/reward_accuracy/std": 0.13011004850268365, "rewards/reward_format/mean": 0.09990234449505805, "rewards/reward_format/std": 0.001562500116415322, "sampling/importance_sampling_ratio/max": 2.4427770256996153, "sampling/importance_sampling_ratio/mean": 0.9921477437019348, "sampling/importance_sampling_ratio/min": 0.2079671561717987, "sampling/sampling_logp_difference/max": 0.9780412673950195, "sampling/sampling_logp_difference/mean": 0.0034702308708801865, "step": 16130, "step_time": 5.558735778517439 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.002734375, "completions/max_length": 1689.5, "completions/max_terminated_length": 1329.8, "completions/mean_length": 164.98671875, "completions/mean_terminated_length": 159.81641693115233, "completions/min_length": 70.3, "completions/min_terminated_length": 70.3, "entropy": 0.04147521608974784, "epoch": 34.561027837259104, "frac_reward_zero_std": 0.925, "grad_norm": 0.35546875, "learning_rate": 8.386100000000001e-06, "loss": -0.0061, "num_tokens": 1572858024.0, "reward": 1.0823046922683717, "reward_std": 0.0984107281314209, "rewards/reward_accuracy/mean": 0.982421875, "rewards/reward_accuracy/std": 0.0971443235874176, "rewards/reward_format/mean": 0.09988281279802322, "rewards/reward_format/std": 0.0018750001210719347, "sampling/importance_sampling_ratio/max": 2.4702561855316163, "sampling/importance_sampling_ratio/mean": 0.9917015671730042, "sampling/importance_sampling_ratio/min": 0.094052042812109, "sampling/sampling_logp_difference/max": 0.8886285960674286, "sampling/sampling_logp_difference/mean": 0.004082248732447624, "step": 16140, "step_time": 7.868237209683866 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001171875, "completions/max_length": 828.1, "completions/max_terminated_length": 647.5, "completions/mean_length": 146.1390625, "completions/mean_terminated_length": 143.93939056396485, "completions/min_length": 62.7, "completions/min_terminated_length": 62.7, "entropy": 0.03477447293698788, "epoch": 34.58244111349036, "frac_reward_zero_std": 0.94375, "grad_norm": 0.0, "learning_rate": 8.3851e-06, "loss": -0.0001, "num_tokens": 1573748940.0, "reward": 1.077734398841858, "reward_std": 0.11262267529964447, "rewards/reward_accuracy/mean": 0.977734375, "rewards/reward_accuracy/std": 0.11262268126010895, "rewards/reward_format/mean": 0.10000000149011612, "rewards/reward_format/std": 0.0, "sampling/importance_sampling_ratio/max": 2.436219048500061, "sampling/importance_sampling_ratio/mean": 0.9977411985397339, "sampling/importance_sampling_ratio/min": 0.2152244232594967, "sampling/sampling_logp_difference/max": 1.024137806892395, "sampling/sampling_logp_difference/mean": 0.0038026205962523817, "step": 16150, "step_time": 4.360732601804193 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00703125, "completions/max_length": 1387.5, "completions/max_terminated_length": 1095.6, "completions/mean_length": 160.81953125, "completions/mean_terminated_length": 147.70826568603516, "completions/min_length": 66.3, "completions/min_terminated_length": 66.3, "entropy": 0.039138489542528986, "epoch": 34.603854389721626, "frac_reward_zero_std": 0.94375, "grad_norm": 0.0, "learning_rate": 8.3841e-06, "loss": 0.0034, "num_tokens": 1574675678.0, "reward": 1.059765636920929, "reward_std": 0.13200943246483804, "rewards/reward_accuracy/mean": 0.96015625, "rewards/reward_accuracy/std": 0.13057657033205033, "rewards/reward_format/mean": 0.099609375, "rewards/reward_format/std": 0.003883264516480267, "sampling/importance_sampling_ratio/max": 2.3782747626304626, "sampling/importance_sampling_ratio/mean": 0.9809553802013398, "sampling/importance_sampling_ratio/min": 0.20127590447664262, "sampling/sampling_logp_difference/max": 1.1023305654525757, "sampling/sampling_logp_difference/mean": 0.0039325022837147115, "step": 16160, "step_time": 6.99780238509411 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003125, "completions/max_length": 1435.3, "completions/max_terminated_length": 1103.1, "completions/mean_length": 156.116796875, "completions/mean_terminated_length": 150.24732666015626, "completions/min_length": 65.7, "completions/min_terminated_length": 65.7, "entropy": 0.041363912634551525, "epoch": 34.62526766595289, "frac_reward_zero_std": 0.90625, "grad_norm": 0.055419921875, "learning_rate": 8.383100000000001e-06, "loss": -0.0088, "num_tokens": 1575600473.0, "reward": 1.0646679878234864, "reward_std": 0.13151676387060435, "rewards/reward_accuracy/mean": 0.96484375, "rewards/reward_accuracy/std": 0.1304824061691761, "rewards/reward_format/mean": 0.09982421919703484, "rewards/reward_format/std": 0.0023328486597165464, "sampling/importance_sampling_ratio/max": 2.5352561473846436, "sampling/importance_sampling_ratio/mean": 0.9828745603561402, "sampling/importance_sampling_ratio/min": 0.1053616687655449, "sampling/sampling_logp_difference/max": 1.0266971111297607, "sampling/sampling_logp_difference/mean": 0.004217135114595294, "step": 16170, "step_time": 6.659066395199625 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.000390625, "completions/max_length": 979.4, "completions/max_terminated_length": 947.0, "completions/mean_length": 137.157421875, "completions/mean_terminated_length": 136.41519317626953, "completions/min_length": 60.9, "completions/min_terminated_length": 60.9, "entropy": 0.03135124382097274, "epoch": 34.646680942184155, "frac_reward_zero_std": 0.9625, "grad_norm": 0.0, "learning_rate": 8.3821e-06, "loss": -0.0001, "num_tokens": 1576462828.0, "reward": 1.0882422089576722, "reward_std": 0.0682930514216423, "rewards/reward_accuracy/mean": 0.98828125, "rewards/reward_accuracy/std": 0.0679219052195549, "rewards/reward_format/mean": 0.0999609388411045, "rewards/reward_format/std": 0.0006250000558793544, "sampling/importance_sampling_ratio/max": 2.371667981147766, "sampling/importance_sampling_ratio/mean": 0.9965525805950165, "sampling/importance_sampling_ratio/min": 0.14407505355775357, "sampling/sampling_logp_difference/max": 1.0206782579421998, "sampling/sampling_logp_difference/mean": 0.0034222114831209184, "step": 16180, "step_time": 4.823656827487866 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001171875, "completions/max_length": 971.9, "completions/max_terminated_length": 709.5, "completions/mean_length": 144.813671875, "completions/mean_terminated_length": 142.58446807861327, "completions/min_length": 72.8, "completions/min_terminated_length": 72.8, "entropy": 0.0318797213723883, "epoch": 34.66809421841542, "frac_reward_zero_std": 0.9375, "grad_norm": 0.45703125, "learning_rate": 8.3811e-06, "loss": -0.0072, "num_tokens": 1577361039.0, "reward": 1.0827343940734864, "reward_std": 0.08560404032468796, "rewards/reward_accuracy/mean": 0.9828125, "rewards/reward_accuracy/std": 0.084527388215065, "rewards/reward_format/mean": 0.09992187619209289, "rewards/reward_format/std": 0.0012500001117587089, "sampling/importance_sampling_ratio/max": 2.4891577482223513, "sampling/importance_sampling_ratio/mean": 0.9984724223613739, "sampling/importance_sampling_ratio/min": 0.12112211659550667, "sampling/sampling_logp_difference/max": 1.060994517803192, "sampling/sampling_logp_difference/mean": 0.0035495788557454943, "step": 16190, "step_time": 4.896263291110517 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003515625, "completions/max_length": 1403.0, "completions/max_terminated_length": 1109.2, "completions/mean_length": 153.744921875, "completions/mean_terminated_length": 147.12099914550782, "completions/min_length": 61.4, "completions/min_terminated_length": 61.4, "entropy": 0.03687986861914396, "epoch": 34.68950749464668, "frac_reward_zero_std": 0.94375, "grad_norm": 0.76953125, "learning_rate": 8.380100000000001e-06, "loss": 0.0003, "num_tokens": 1578269394.0, "reward": 1.0618554949760437, "reward_std": 0.16003920659422874, "rewards/reward_accuracy/mean": 0.962109375, "rewards/reward_accuracy/std": 0.15893106088042258, "rewards/reward_format/mean": 0.09974609538912774, "rewards/reward_format/std": 0.003066375106573105, "sampling/importance_sampling_ratio/max": 2.5015659093856812, "sampling/importance_sampling_ratio/mean": 0.990731006860733, "sampling/importance_sampling_ratio/min": 0.0945808332413435, "sampling/sampling_logp_difference/max": 1.0117966830730438, "sampling/sampling_logp_difference/mean": 0.003918366273865104, "step": 16200, "step_time": 6.840679686088697 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0015625, "completions/max_length": 1307.4, "completions/max_terminated_length": 948.2, "completions/mean_length": 148.183203125, "completions/mean_terminated_length": 145.2396469116211, "completions/min_length": 64.5, "completions/min_terminated_length": 64.5, "entropy": 0.03459032629616558, "epoch": 34.71092077087795, "frac_reward_zero_std": 0.9375, "grad_norm": 0.08251953125, "learning_rate": 8.3791e-06, "loss": -0.0049, "num_tokens": 1579167831.0, "reward": 1.0771875143051148, "reward_std": 0.09263129159808159, "rewards/reward_accuracy/mean": 0.97734375, "rewards/reward_accuracy/std": 0.09159038364887237, "rewards/reward_format/mean": 0.09984375089406967, "rewards/reward_format/std": 0.002012960007414222, "sampling/importance_sampling_ratio/max": 2.3897481322288514, "sampling/importance_sampling_ratio/mean": 0.9907686710357666, "sampling/importance_sampling_ratio/min": 0.1186544917523861, "sampling/sampling_logp_difference/max": 0.9341445207595825, "sampling/sampling_logp_difference/mean": 0.003665625746361911, "step": 16210, "step_time": 6.22290601390705 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.002734375, "completions/max_length": 1461.4, "completions/max_terminated_length": 1348.0, "completions/mean_length": 157.4875, "completions/mean_terminated_length": 152.42548217773438, "completions/min_length": 65.0, "completions/min_terminated_length": 65.0, "entropy": 0.044435213203541934, "epoch": 34.732334047109205, "frac_reward_zero_std": 0.9125, "grad_norm": 0.296875, "learning_rate": 8.378100000000002e-06, "loss": -0.0079, "num_tokens": 1580085543.0, "reward": 1.0582422137260437, "reward_std": 0.15208273380994797, "rewards/reward_accuracy/mean": 0.95859375, "rewards/reward_accuracy/std": 0.1507108822464943, "rewards/reward_format/mean": 0.09964843913912773, "rewards/reward_format/std": 0.0032062520505860446, "sampling/importance_sampling_ratio/max": 2.5460832118988037, "sampling/importance_sampling_ratio/mean": 0.98326855301857, "sampling/importance_sampling_ratio/min": 0.08712842762470245, "sampling/sampling_logp_difference/max": 1.035909104347229, "sampling/sampling_logp_difference/mean": 0.004118877137079835, "step": 16220, "step_time": 7.01044895669038 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001953125, "completions/max_length": 1116.4, "completions/max_terminated_length": 911.9, "completions/mean_length": 151.93046875, "completions/mean_terminated_length": 148.29268493652344, "completions/min_length": 66.0, "completions/min_terminated_length": 66.0, "entropy": 0.03581153911072761, "epoch": 34.75374732334047, "frac_reward_zero_std": 0.9375, "grad_norm": 0.1630859375, "learning_rate": 8.3771e-06, "loss": 0.0023, "num_tokens": 1580989077.0, "reward": 1.0872851729393005, "reward_std": 0.0735779769718647, "rewards/reward_accuracy/mean": 0.9875, "rewards/reward_accuracy/std": 0.07235103026032448, "rewards/reward_format/mean": 0.09978515729308128, "rewards/reward_format/std": 0.0023058353923261165, "sampling/importance_sampling_ratio/max": 2.43031964302063, "sampling/importance_sampling_ratio/mean": 0.989349091053009, "sampling/importance_sampling_ratio/min": 0.20534395053982735, "sampling/sampling_logp_difference/max": 1.0602524399757385, "sampling/sampling_logp_difference/mean": 0.0034410898806527257, "step": 16230, "step_time": 5.452480874891625 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001171875, "completions/max_length": 940.8, "completions/max_terminated_length": 887.3, "completions/mean_length": 148.775, "completions/mean_terminated_length": 146.60663299560548, "completions/min_length": 64.0, "completions/min_terminated_length": 64.0, "entropy": 0.03640007800422609, "epoch": 34.775160599571734, "frac_reward_zero_std": 0.93125, "grad_norm": 0.279296875, "learning_rate": 8.376100000000001e-06, "loss": -0.0023, "num_tokens": 1581889685.0, "reward": 1.0693945407867431, "reward_std": 0.14651307314634324, "rewards/reward_accuracy/mean": 0.96953125, "rewards/reward_accuracy/std": 0.14598962515592576, "rewards/reward_format/mean": 0.09986328184604645, "rewards/reward_format/std": 0.001390778203494847, "sampling/importance_sampling_ratio/max": 2.5824660301208495, "sampling/importance_sampling_ratio/mean": 0.9844608545303345, "sampling/importance_sampling_ratio/min": 0.1368772342801094, "sampling/sampling_logp_difference/max": 1.0594785928726196, "sampling/sampling_logp_difference/mean": 0.00377996782772243, "step": 16240, "step_time": 4.791745817489573 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003125, "completions/max_length": 952.7, "completions/max_terminated_length": 815.2, "completions/mean_length": 150.466796875, "completions/mean_terminated_length": 144.56346130371094, "completions/min_length": 67.9, "completions/min_terminated_length": 67.9, "entropy": 0.035223373654298486, "epoch": 34.796573875803, "frac_reward_zero_std": 0.94375, "grad_norm": 0.150390625, "learning_rate": 8.3751e-06, "loss": -0.0058, "num_tokens": 1582793680.0, "reward": 1.0736523509025573, "reward_std": 0.12041371539235116, "rewards/reward_accuracy/mean": 0.973828125, "rewards/reward_accuracy/std": 0.11959226876497268, "rewards/reward_format/mean": 0.09982421919703484, "rewards/reward_format/std": 0.0018318525282666088, "sampling/importance_sampling_ratio/max": 2.524690103530884, "sampling/importance_sampling_ratio/mean": 0.9929101228713989, "sampling/importance_sampling_ratio/min": 0.11289390027523041, "sampling/sampling_logp_difference/max": 0.9943876385688781, "sampling/sampling_logp_difference/mean": 0.0036731277825310825, "step": 16250, "step_time": 4.831072928811773 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003125, "completions/max_length": 1200.8, "completions/max_terminated_length": 896.6, "completions/mean_length": 149.980078125, "completions/mean_terminated_length": 144.06327362060546, "completions/min_length": 64.2, "completions/min_terminated_length": 64.2, "entropy": 0.034982691635377705, "epoch": 34.81798715203426, "frac_reward_zero_std": 0.95, "grad_norm": 0.3671875, "learning_rate": 8.3741e-06, "loss": -0.0022, "num_tokens": 1583696333.0, "reward": 1.0520703196525574, "reward_std": 0.1832004100084305, "rewards/reward_accuracy/mean": 0.95234375, "rewards/reward_accuracy/std": 0.1816438615322113, "rewards/reward_format/mean": 0.09972656294703483, "rewards/reward_format/std": 0.003578278422355652, "sampling/importance_sampling_ratio/max": 2.4579793095588682, "sampling/importance_sampling_ratio/mean": 0.9942555367946625, "sampling/importance_sampling_ratio/min": 0.18828665912151338, "sampling/sampling_logp_difference/max": 1.0847427248954773, "sampling/sampling_logp_difference/mean": 0.003805356053635478, "step": 16260, "step_time": 5.885165042188601 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00859375, "completions/max_length": 1251.3, "completions/max_terminated_length": 1209.3, "completions/mean_length": 170.20234375, "completions/mean_terminated_length": 154.31216125488282, "completions/min_length": 66.9, "completions/min_terminated_length": 66.9, "entropy": 0.045384189765900376, "epoch": 34.83940042826553, "frac_reward_zero_std": 0.9, "grad_norm": 0.435546875, "learning_rate": 8.373100000000001e-06, "loss": -0.0112, "num_tokens": 1584652851.0, "reward": 1.0624804973602295, "reward_std": 0.14353215843439102, "rewards/reward_accuracy/mean": 0.962890625, "rewards/reward_accuracy/std": 0.14229123443365096, "rewards/reward_format/mean": 0.09958984553813935, "rewards/reward_format/std": 0.0036798993358388545, "sampling/importance_sampling_ratio/max": 2.556861925125122, "sampling/importance_sampling_ratio/mean": 0.9886037468910217, "sampling/importance_sampling_ratio/min": 0.15609304010868072, "sampling/sampling_logp_difference/max": 1.02576642036438, "sampling/sampling_logp_difference/mean": 0.0038447306025773285, "step": 16270, "step_time": 6.6337654436094455 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01015625, "completions/max_length": 1603.3, "completions/max_terminated_length": 1463.5, "completions/mean_length": 180.913671875, "completions/mean_terminated_length": 161.971280670166, "completions/min_length": 67.1, "completions/min_terminated_length": 67.1, "entropy": 0.0487758633447811, "epoch": 34.860813704496785, "frac_reward_zero_std": 0.93125, "grad_norm": 0.3203125, "learning_rate": 8.3721e-06, "loss": -0.0073, "num_tokens": 1585626310.0, "reward": 1.0224804878234863, "reward_std": 0.22829827219247817, "rewards/reward_accuracy/mean": 0.9234375, "rewards/reward_accuracy/std": 0.22464136257767678, "rewards/reward_format/mean": 0.09904296919703484, "rewards/reward_format/std": 0.006581835588440299, "sampling/importance_sampling_ratio/max": 2.4334858536720274, "sampling/importance_sampling_ratio/mean": 0.9655642509460449, "sampling/importance_sampling_ratio/min": 0.06329292804002762, "sampling/sampling_logp_difference/max": 1.0451550841331483, "sampling/sampling_logp_difference/mean": 0.004161730082705617, "step": 16280, "step_time": 8.01594822050538 }, { "clip_ratio/high_max": 1.4817448391113431e-05, "clip_ratio/high_mean": 1.8521810488891789e-06, "clip_ratio/low_mean": 3.7026065911049957e-07, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 2.2224417079996783e-06, "completions/clipped_ratio": 0.00703125, "completions/max_length": 1503.8, "completions/max_terminated_length": 1411.7, "completions/mean_length": 185.20859375, "completions/mean_terminated_length": 172.30386199951172, "completions/min_length": 64.0, "completions/min_terminated_length": 64.0, "entropy": 0.0480262111639604, "epoch": 34.88222698072805, "frac_reward_zero_std": 0.9125, "grad_norm": 0.263671875, "learning_rate": 8.3711e-06, "loss": -0.0083, "num_tokens": 1586621436.0, "reward": 1.0579492449760437, "reward_std": 0.1556005895137787, "rewards/reward_accuracy/mean": 0.95859375, "rewards/reward_accuracy/std": 0.15272591263055801, "rewards/reward_format/mean": 0.09935547038912773, "rewards/reward_format/std": 0.005001882649958133, "sampling/importance_sampling_ratio/max": 2.534791946411133, "sampling/importance_sampling_ratio/mean": 0.9748587965965271, "sampling/importance_sampling_ratio/min": 0.054264617571607235, "sampling/sampling_logp_difference/max": 1.4872349977493287, "sampling/sampling_logp_difference/mean": 0.004074881458655, "step": 16290, "step_time": 7.481275591897429 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001171875, "completions/max_length": 1227.0, "completions/max_terminated_length": 1205.1, "completions/mean_length": 140.83125, "completions/mean_terminated_length": 138.6354537963867, "completions/min_length": 61.8, "completions/min_terminated_length": 61.8, "entropy": 0.03589235064573586, "epoch": 34.903640256959314, "frac_reward_zero_std": 0.9375, "grad_norm": 0.0, "learning_rate": 8.370100000000001e-06, "loss": 0.0005, "num_tokens": 1587496812.0, "reward": 1.0783593773841857, "reward_std": 0.11281695142388344, "rewards/reward_accuracy/mean": 0.978515625, "rewards/reward_accuracy/std": 0.11191032454371452, "rewards/reward_format/mean": 0.09984375014901162, "rewards/reward_format/std": 0.001703278301283717, "sampling/importance_sampling_ratio/max": 2.504762887954712, "sampling/importance_sampling_ratio/mean": 0.9997106790542603, "sampling/importance_sampling_ratio/min": 0.15920191034674644, "sampling/sampling_logp_difference/max": 1.2805246710777283, "sampling/sampling_logp_difference/mean": 0.003797920816577971, "step": 16300, "step_time": 5.851558383414522 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00078125, "completions/max_length": 1247.5, "completions/max_terminated_length": 1076.2, "completions/mean_length": 141.742578125, "completions/mean_terminated_length": 140.27479248046876, "completions/min_length": 64.0, "completions/min_terminated_length": 64.0, "entropy": 0.03628264362923801, "epoch": 34.92505353319058, "frac_reward_zero_std": 0.9375, "grad_norm": 0.0, "learning_rate": 8.369100000000001e-06, "loss": -0.0024, "num_tokens": 1588375241.0, "reward": 1.0748828053474426, "reward_std": 0.13340726867318153, "rewards/reward_accuracy/mean": 0.975, "rewards/reward_accuracy/std": 0.13228895291686057, "rewards/reward_format/mean": 0.09988281205296516, "rewards/reward_format/std": 0.001875000074505806, "sampling/importance_sampling_ratio/max": 2.585959529876709, "sampling/importance_sampling_ratio/mean": 0.9938423275947571, "sampling/importance_sampling_ratio/min": 0.051136910915374756, "sampling/sampling_logp_difference/max": 0.9897579431533814, "sampling/sampling_logp_difference/mean": 0.004037484293803573, "step": 16310, "step_time": 6.03739411389397 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.004296875, "completions/max_length": 1317.5, "completions/max_terminated_length": 964.6, "completions/mean_length": 149.70234375, "completions/mean_terminated_length": 141.4780418395996, "completions/min_length": 68.2, "completions/min_terminated_length": 68.2, "entropy": 0.035899090277962384, "epoch": 34.94646680942184, "frac_reward_zero_std": 0.9375, "grad_norm": 0.255859375, "learning_rate": 8.3681e-06, "loss": -0.002, "num_tokens": 1589276287.0, "reward": 1.0868359684944153, "reward_std": 0.08716326504945755, "rewards/reward_accuracy/mean": 0.987109375, "rewards/reward_accuracy/std": 0.08595144897699356, "rewards/reward_format/mean": 0.09972656443715096, "rewards/reward_format/std": 0.001634024828672409, "sampling/importance_sampling_ratio/max": 2.406379425525665, "sampling/importance_sampling_ratio/mean": 0.9952878534793854, "sampling/importance_sampling_ratio/min": 0.21105334744788706, "sampling/sampling_logp_difference/max": 0.8688412427902221, "sampling/sampling_logp_difference/mean": 0.003868978680111468, "step": 16320, "step_time": 6.376809852194856 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003515625, "completions/max_length": 1131.3, "completions/max_terminated_length": 780.1, "completions/mean_length": 151.816796875, "completions/mean_terminated_length": 145.23536682128906, "completions/min_length": 68.5, "completions/min_terminated_length": 68.5, "entropy": 0.03813749635592103, "epoch": 34.96788008565311, "frac_reward_zero_std": 0.925, "grad_norm": 0.0, "learning_rate": 8.3671e-06, "loss": -0.005, "num_tokens": 1590180522.0, "reward": 1.0806640803813934, "reward_std": 0.0895628109574318, "rewards/reward_accuracy/mean": 0.980859375, "rewards/reward_accuracy/std": 0.08895176872611046, "rewards/reward_format/mean": 0.09980468824505806, "rewards/reward_format/std": 0.0019604268483817576, "sampling/importance_sampling_ratio/max": 2.524397373199463, "sampling/importance_sampling_ratio/mean": 0.9954328835010529, "sampling/importance_sampling_ratio/min": 0.09919506199657917, "sampling/sampling_logp_difference/max": 1.159006690979004, "sampling/sampling_logp_difference/mean": 0.0039750771597027775, "step": 16330, "step_time": 5.535777788978885 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001171875, "completions/max_length": 1434.1, "completions/max_terminated_length": 1227.9, "completions/mean_length": 146.57734375, "completions/mean_terminated_length": 144.3603614807129, "completions/min_length": 66.7, "completions/min_terminated_length": 66.7, "entropy": 0.038061954104341565, "epoch": 34.98929336188437, "frac_reward_zero_std": 0.9, "grad_norm": 0.49609375, "learning_rate": 8.366100000000001e-06, "loss": -0.0056, "num_tokens": 1591073424.0, "reward": 1.0564843893051148, "reward_std": 0.16630405113101004, "rewards/reward_accuracy/mean": 0.956640625, "rewards/reward_accuracy/std": 0.16571741178631783, "rewards/reward_format/mean": 0.09984375089406967, "rewards/reward_format/std": 0.002260174439288676, "sampling/importance_sampling_ratio/max": 2.287727880477905, "sampling/importance_sampling_ratio/mean": 0.9941800713539124, "sampling/importance_sampling_ratio/min": 0.18136740960180758, "sampling/sampling_logp_difference/max": 0.9508365035057068, "sampling/sampling_logp_difference/mean": 0.003929645963944494, "step": 16340, "step_time": 6.688410925903009 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.009375, "completions/max_length": 1395.4, "completions/max_terminated_length": 1305.4, "completions/mean_length": 194.9578125, "completions/mean_terminated_length": 177.75242767333984, "completions/min_length": 64.2, "completions/min_terminated_length": 64.2, "entropy": 0.05372921726666391, "epoch": 35.01070663811563, "frac_reward_zero_std": 0.8625, "grad_norm": 0.291015625, "learning_rate": 8.3651e-06, "loss": -0.01, "num_tokens": 1592101988.0, "reward": 1.0589453339576722, "reward_std": 0.15466150417923927, "rewards/reward_accuracy/mean": 0.959375, "rewards/reward_accuracy/std": 0.15310990884900094, "rewards/reward_format/mean": 0.09957031384110451, "rewards/reward_format/std": 0.004183325078338384, "sampling/importance_sampling_ratio/max": 2.542636585235596, "sampling/importance_sampling_ratio/mean": 0.978504192829132, "sampling/importance_sampling_ratio/min": 0.08775998800992965, "sampling/sampling_logp_difference/max": 1.003212809562683, "sampling/sampling_logp_difference/mean": 0.004433482280001044, "step": 16350, "step_time": 7.171096612606197 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00546875, "completions/max_length": 1292.8, "completions/max_terminated_length": 1239.0, "completions/mean_length": 176.526171875, "completions/mean_terminated_length": 166.36797790527345, "completions/min_length": 66.4, "completions/min_terminated_length": 66.4, "entropy": 0.04133268331643194, "epoch": 35.03211991434689, "frac_reward_zero_std": 0.93125, "grad_norm": 0.26171875, "learning_rate": 8.3641e-06, "loss": -0.0002, "num_tokens": 1593079159.0, "reward": 1.0673828125, "reward_std": 0.1439361646771431, "rewards/reward_accuracy/mean": 0.96796875, "rewards/reward_accuracy/std": 0.14150649607181548, "rewards/reward_format/mean": 0.0994140625, "rewards/reward_format/std": 0.00474475531373173, "sampling/importance_sampling_ratio/max": 2.5475902795791625, "sampling/importance_sampling_ratio/mean": 0.9860001921653747, "sampling/importance_sampling_ratio/min": 0.18337934762239455, "sampling/sampling_logp_difference/max": 0.9659007012844085, "sampling/sampling_logp_difference/mean": 0.0037820600904524327, "step": 16360, "step_time": 6.786608235092717 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00546875, "completions/max_length": 1605.1, "completions/max_terminated_length": 1248.7, "completions/mean_length": 166.92734375, "completions/mean_terminated_length": 156.69214782714843, "completions/min_length": 65.0, "completions/min_terminated_length": 65.0, "entropy": 0.040784524637274444, "epoch": 35.05353319057816, "frac_reward_zero_std": 0.91875, "grad_norm": 0.62109375, "learning_rate": 8.363100000000001e-06, "loss": -0.0051, "num_tokens": 1594033661.0, "reward": 1.0535547137260437, "reward_std": 0.17382264211773873, "rewards/reward_accuracy/mean": 0.95390625, "rewards/reward_accuracy/std": 0.17196570858359336, "rewards/reward_format/mean": 0.09964843839406967, "rewards/reward_format/std": 0.003518686816096306, "sampling/importance_sampling_ratio/max": 2.636326026916504, "sampling/importance_sampling_ratio/mean": 0.993579775094986, "sampling/importance_sampling_ratio/min": 0.10119160860776902, "sampling/sampling_logp_difference/max": 1.2465099930763244, "sampling/sampling_logp_difference/mean": 0.004045495297759771, "step": 16370, "step_time": 7.845758598699467 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00546875, "completions/max_length": 1206.3, "completions/max_terminated_length": 1141.8, "completions/mean_length": 162.984765625, "completions/mean_terminated_length": 152.86957702636718, "completions/min_length": 61.3, "completions/min_terminated_length": 61.3, "entropy": 0.04937058144714683, "epoch": 35.07494646680942, "frac_reward_zero_std": 0.91875, "grad_norm": 0.0, "learning_rate": 8.3621e-06, "loss": 0.0, "num_tokens": 1594965494.0, "reward": 1.063281273841858, "reward_std": 0.1480856567621231, "rewards/reward_accuracy/mean": 0.963671875, "rewards/reward_accuracy/std": 0.14671168476343155, "rewards/reward_format/mean": 0.09960937649011611, "rewards/reward_format/std": 0.0029830871149897575, "sampling/importance_sampling_ratio/max": 2.5466134786605834, "sampling/importance_sampling_ratio/mean": 0.988847428560257, "sampling/importance_sampling_ratio/min": 0.048608634946867825, "sampling/sampling_logp_difference/max": 1.0276130199432374, "sampling/sampling_logp_difference/mean": 0.004538927529938519, "step": 16380, "step_time": 5.97760852179781 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0015625, "completions/max_length": 933.2, "completions/max_terminated_length": 726.6, "completions/mean_length": 144.153125, "completions/mean_terminated_length": 141.19934997558593, "completions/min_length": 67.3, "completions/min_terminated_length": 67.3, "entropy": 0.03452780083753169, "epoch": 35.096359743040686, "frac_reward_zero_std": 0.9625, "grad_norm": 0.0, "learning_rate": 8.3611e-06, "loss": -0.0041, "num_tokens": 1595855486.0, "reward": 1.0776562690734863, "reward_std": 0.09627666473388671, "rewards/reward_accuracy/mean": 0.977734375, "rewards/reward_accuracy/std": 0.09551033228635789, "rewards/reward_format/mean": 0.09992187619209289, "rewards/reward_format/std": 0.0012500001117587089, "sampling/importance_sampling_ratio/max": 2.4155043601989745, "sampling/importance_sampling_ratio/mean": 0.9949823439121246, "sampling/importance_sampling_ratio/min": 0.22564642280340194, "sampling/sampling_logp_difference/max": 1.042791873216629, "sampling/sampling_logp_difference/mean": 0.003809555433690548, "step": 16390, "step_time": 4.718263251308235 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.004296875, "completions/max_length": 1492.4, "completions/max_terminated_length": 1194.8, "completions/mean_length": 158.4796875, "completions/mean_terminated_length": 150.42829284667968, "completions/min_length": 65.2, "completions/min_terminated_length": 65.2, "entropy": 0.04119498922955245, "epoch": 35.11777301927195, "frac_reward_zero_std": 0.925, "grad_norm": 0.1875, "learning_rate": 8.360100000000001e-06, "loss": -0.008, "num_tokens": 1596781210.0, "reward": 1.0706445693969726, "reward_std": 0.12649078220129012, "rewards/reward_accuracy/mean": 0.97109375, "rewards/reward_accuracy/std": 0.12421037554740906, "rewards/reward_format/mean": 0.09955078214406968, "rewards/reward_format/std": 0.004098456422798336, "sampling/importance_sampling_ratio/max": 2.35240797996521, "sampling/importance_sampling_ratio/mean": 0.9812588930130005, "sampling/importance_sampling_ratio/min": 0.08623406197875738, "sampling/sampling_logp_difference/max": 1.2497260689735412, "sampling/sampling_logp_difference/mean": 0.004114431119523943, "step": 16400, "step_time": 7.031391149913543 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001171875, "completions/max_length": 861.1, "completions/max_terminated_length": 727.0, "completions/mean_length": 140.9421875, "completions/mean_terminated_length": 138.71842346191406, "completions/min_length": 62.8, "completions/min_terminated_length": 62.8, "entropy": 0.030545475310645998, "epoch": 35.139186295503215, "frac_reward_zero_std": 0.9625, "grad_norm": 0.1513671875, "learning_rate": 8.359100000000001e-06, "loss": 0.0006, "num_tokens": 1597660422.0, "reward": 1.077246117591858, "reward_std": 0.09529143497347832, "rewards/reward_accuracy/mean": 0.97734375, "rewards/reward_accuracy/std": 0.09459400624036789, "rewards/reward_format/mean": 0.09990234524011612, "rewards/reward_format/std": 0.001194648747332394, "sampling/importance_sampling_ratio/max": 2.5917471170425417, "sampling/importance_sampling_ratio/mean": 1.0037765502929688, "sampling/importance_sampling_ratio/min": 0.10889315120875835, "sampling/sampling_logp_difference/max": 1.1477653503417968, "sampling/sampling_logp_difference/mean": 0.003437848319299519, "step": 16410, "step_time": 4.423172673702356 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.004296875, "completions/max_length": 1255.5, "completions/max_terminated_length": 1055.1, "completions/mean_length": 163.31484375, "completions/mean_terminated_length": 155.3362609863281, "completions/min_length": 63.6, "completions/min_terminated_length": 63.6, "entropy": 0.04519235612824559, "epoch": 35.16059957173447, "frac_reward_zero_std": 0.91875, "grad_norm": 0.0, "learning_rate": 8.3581e-06, "loss": -0.0009, "num_tokens": 1598602300.0, "reward": 1.0711914420127868, "reward_std": 0.12187819853425026, "rewards/reward_accuracy/mean": 0.971484375, "rewards/reward_accuracy/std": 0.12086264342069626, "rewards/reward_format/mean": 0.09970703348517418, "rewards/reward_format/std": 0.002624061331152916, "sampling/importance_sampling_ratio/max": 2.4151984333992003, "sampling/importance_sampling_ratio/mean": 0.9822398126125336, "sampling/importance_sampling_ratio/min": 0.1634305713698268, "sampling/sampling_logp_difference/max": 0.901533329486847, "sampling/sampling_logp_difference/mean": 0.004124010377563536, "step": 16420, "step_time": 6.301085587320268 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 1.013923429127317e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 1.013923429127317e-06, "completions/clipped_ratio": 0.00625, "completions/max_length": 1265.2, "completions/max_terminated_length": 1022.9, "completions/mean_length": 160.129296875, "completions/mean_terminated_length": 148.40702209472656, "completions/min_length": 68.4, "completions/min_terminated_length": 68.4, "entropy": 0.04097858094610274, "epoch": 35.18201284796574, "frac_reward_zero_std": 0.9375, "grad_norm": 0.2197265625, "learning_rate": 8.3571e-06, "loss": -0.0103, "num_tokens": 1599529143.0, "reward": 1.0460937678813935, "reward_std": 0.17182331681251525, "rewards/reward_accuracy/mean": 0.946484375, "rewards/reward_accuracy/std": 0.1698422111570835, "rewards/reward_format/mean": 0.09960937574505806, "rewards/reward_format/std": 0.003660792508162558, "sampling/importance_sampling_ratio/max": 2.4876076579093933, "sampling/importance_sampling_ratio/mean": 0.984029746055603, "sampling/importance_sampling_ratio/min": 0.0712982858531177, "sampling/sampling_logp_difference/max": 1.0446358561515807, "sampling/sampling_logp_difference/mean": 0.003901756880804896, "step": 16430, "step_time": 6.319243777220254 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00625, "completions/max_length": 1513.5, "completions/max_terminated_length": 1147.6, "completions/mean_length": 182.81640625, "completions/mean_terminated_length": 171.1333435058594, "completions/min_length": 67.8, "completions/min_terminated_length": 67.8, "entropy": 0.04506555870175362, "epoch": 35.203426124197, "frac_reward_zero_std": 0.9, "grad_norm": 0.1142578125, "learning_rate": 8.3561e-06, "loss": -0.0051, "num_tokens": 1600524417.0, "reward": 1.0559765815734863, "reward_std": 0.18369959592819213, "rewards/reward_accuracy/mean": 0.956640625, "rewards/reward_accuracy/std": 0.18048669323325156, "rewards/reward_format/mean": 0.0993359386920929, "rewards/reward_format/std": 0.006366825569421053, "sampling/importance_sampling_ratio/max": 2.4703575372695923, "sampling/importance_sampling_ratio/mean": 0.986130690574646, "sampling/importance_sampling_ratio/min": 0.11038573309779168, "sampling/sampling_logp_difference/max": 1.0653946459293366, "sampling/sampling_logp_difference/mean": 0.004110041726380587, "step": 16440, "step_time": 7.80973784699745 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003515625, "completions/max_length": 1043.5, "completions/max_terminated_length": 669.8, "completions/mean_length": 141.368359375, "completions/mean_terminated_length": 134.69865951538085, "completions/min_length": 60.1, "completions/min_terminated_length": 60.1, "entropy": 0.032122283219359817, "epoch": 35.224839400428266, "frac_reward_zero_std": 0.96875, "grad_norm": 0.1064453125, "learning_rate": 8.3551e-06, "loss": 0.0012, "num_tokens": 1601404192.0, "reward": 1.0868359684944153, "reward_std": 0.07246346473693847, "rewards/reward_accuracy/mean": 0.987109375, "rewards/reward_accuracy/std": 0.07125164270401001, "rewards/reward_format/mean": 0.09972656443715096, "rewards/reward_format/std": 0.001634024828672409, "sampling/importance_sampling_ratio/max": 2.2471796751022337, "sampling/importance_sampling_ratio/mean": 0.991901558637619, "sampling/importance_sampling_ratio/min": 0.22402238249778747, "sampling/sampling_logp_difference/max": 1.038509601354599, "sampling/sampling_logp_difference/mean": 0.003381925099529326, "step": 16450, "step_time": 5.172751429010532 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00078125, "completions/max_length": 913.3, "completions/max_terminated_length": 710.4, "completions/mean_length": 137.076953125, "completions/mean_terminated_length": 135.58627014160157, "completions/min_length": 70.4, "completions/min_terminated_length": 70.4, "entropy": 0.030743689578957855, "epoch": 35.24625267665953, "frac_reward_zero_std": 0.9625, "grad_norm": 0.09912109375, "learning_rate": 8.3541e-06, "loss": 0.0011, "num_tokens": 1602272853.0, "reward": 1.0839257955551147, "reward_std": 0.08395063802599907, "rewards/reward_accuracy/mean": 0.983984375, "rewards/reward_accuracy/std": 0.08326699137687683, "rewards/reward_format/mean": 0.09994140714406967, "rewards/reward_format/std": 0.0009375000605359674, "sampling/importance_sampling_ratio/max": 2.3787636756896973, "sampling/importance_sampling_ratio/mean": 0.9819418489933014, "sampling/importance_sampling_ratio/min": 0.20682551115751266, "sampling/sampling_logp_difference/max": 1.0382812738418579, "sampling/sampling_logp_difference/mean": 0.0035749432630836965, "step": 16460, "step_time": 4.557439194095787 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00234375, "completions/max_length": 1445.4, "completions/max_terminated_length": 1113.6, "completions/mean_length": 148.9390625, "completions/mean_terminated_length": 144.4818084716797, "completions/min_length": 64.3, "completions/min_terminated_length": 64.3, "entropy": 0.036999257188290356, "epoch": 35.267665952890795, "frac_reward_zero_std": 0.95, "grad_norm": 0.0, "learning_rate": 8.353100000000001e-06, "loss": -0.0033, "num_tokens": 1603170873.0, "reward": 1.070898461341858, "reward_std": 0.11876859068870545, "rewards/reward_accuracy/mean": 0.97109375, "rewards/reward_accuracy/std": 0.11709796637296677, "rewards/reward_format/mean": 0.09980468899011612, "rewards/reward_format/std": 0.002637960109859705, "sampling/importance_sampling_ratio/max": 2.3751661658287047, "sampling/importance_sampling_ratio/mean": 0.9932693719863892, "sampling/importance_sampling_ratio/min": 0.19719114513136446, "sampling/sampling_logp_difference/max": 0.9387115716934205, "sampling/sampling_logp_difference/mean": 0.0037201986648142337, "step": 16470, "step_time": 6.821153709487407 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00078125, "completions/max_length": 1003.8, "completions/max_terminated_length": 948.1, "completions/mean_length": 151.57265625, "completions/mean_terminated_length": 150.13954162597656, "completions/min_length": 64.3, "completions/min_terminated_length": 64.3, "entropy": 0.03393480263184756, "epoch": 35.28907922912206, "frac_reward_zero_std": 0.96875, "grad_norm": 0.0, "learning_rate": 8.352100000000001e-06, "loss": -0.0026, "num_tokens": 1604073075.0, "reward": 1.068613302707672, "reward_std": 0.14204713180661202, "rewards/reward_accuracy/mean": 0.96875, "rewards/reward_accuracy/std": 0.1413528300821781, "rewards/reward_format/mean": 0.09986328259110451, "rewards/reward_format/std": 0.0010294009000062943, "sampling/importance_sampling_ratio/max": 2.3853408217430117, "sampling/importance_sampling_ratio/mean": 0.9774781882762908, "sampling/importance_sampling_ratio/min": 0.1098151035606861, "sampling/sampling_logp_difference/max": 0.9509888172149659, "sampling/sampling_logp_difference/mean": 0.003449137695133686, "step": 16480, "step_time": 4.9734724157926395 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001953125, "completions/max_length": 1062.1, "completions/max_terminated_length": 858.0, "completions/mean_length": 149.566015625, "completions/mean_terminated_length": 145.88533935546874, "completions/min_length": 68.5, "completions/min_terminated_length": 68.5, "entropy": 0.03417244679294527, "epoch": 35.31049250535332, "frac_reward_zero_std": 0.9125, "grad_norm": 0.0, "learning_rate": 8.3511e-06, "loss": -0.0022, "num_tokens": 1604975468.0, "reward": 1.079492199420929, "reward_std": 0.11690697744488716, "rewards/reward_accuracy/mean": 0.9796875, "rewards/reward_accuracy/std": 0.11580003052949905, "rewards/reward_format/mean": 0.09980468824505806, "rewards/reward_format/std": 0.002385118161328137, "sampling/importance_sampling_ratio/max": 2.4412363290786745, "sampling/importance_sampling_ratio/mean": 0.9991845309734344, "sampling/importance_sampling_ratio/min": 0.1150436144322157, "sampling/sampling_logp_difference/max": 0.9291399002075196, "sampling/sampling_logp_difference/mean": 0.003624389786273241, "step": 16490, "step_time": 5.230468075003591 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.002734375, "completions/max_length": 1123.5, "completions/max_terminated_length": 980.7, "completions/mean_length": 143.369140625, "completions/mean_terminated_length": 138.198583984375, "completions/min_length": 66.7, "completions/min_terminated_length": 66.7, "entropy": 0.03540830726269632, "epoch": 35.33190578158458, "frac_reward_zero_std": 0.9125, "grad_norm": 0.74609375, "learning_rate": 8.350100000000002e-06, "loss": -0.0004, "num_tokens": 1605863357.0, "reward": 1.0587500095367433, "reward_std": 0.16537216156721116, "rewards/reward_accuracy/mean": 0.958984375, "rewards/reward_accuracy/std": 0.16434792429208755, "rewards/reward_format/mean": 0.09976562559604644, "rewards/reward_format/std": 0.0026831001276150348, "sampling/importance_sampling_ratio/max": 2.4411667823791503, "sampling/importance_sampling_ratio/mean": 0.9966308832168579, "sampling/importance_sampling_ratio/min": 0.21330296993255615, "sampling/sampling_logp_difference/max": 0.9323745727539062, "sampling/sampling_logp_difference/mean": 0.003745483700186014, "step": 16500, "step_time": 5.6351087067014305 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0015625, "completions/max_length": 1262.8, "completions/max_terminated_length": 1027.7, "completions/mean_length": 146.909375, "completions/mean_terminated_length": 143.93991241455078, "completions/min_length": 69.4, "completions/min_terminated_length": 69.4, "entropy": 0.03572028772905469, "epoch": 35.353319057815845, "frac_reward_zero_std": 0.925, "grad_norm": 0.095703125, "learning_rate": 8.349100000000001e-06, "loss": -0.0058, "num_tokens": 1606763317.0, "reward": 1.0760351777076722, "reward_std": 0.12049658000469207, "rewards/reward_accuracy/mean": 0.976171875, "rewards/reward_accuracy/std": 0.11944534182548523, "rewards/reward_format/mean": 0.09986328259110451, "rewards/reward_format/std": 0.0018196487100794912, "sampling/importance_sampling_ratio/max": 2.4168314814567564, "sampling/importance_sampling_ratio/mean": 0.9826640844345093, "sampling/importance_sampling_ratio/min": 0.15013345554471016, "sampling/sampling_logp_difference/max": 1.0765088319778442, "sampling/sampling_logp_difference/mean": 0.0038414848502725365, "step": 16510, "step_time": 5.954188217318733 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001171875, "completions/max_length": 909.0, "completions/max_terminated_length": 813.5, "completions/mean_length": 145.427734375, "completions/mean_terminated_length": 143.22134704589843, "completions/min_length": 63.2, "completions/min_terminated_length": 63.2, "entropy": 0.03504897418897599, "epoch": 35.37473233404711, "frac_reward_zero_std": 0.96875, "grad_norm": 0.0, "learning_rate": 8.3481e-06, "loss": 0.0005, "num_tokens": 1607655260.0, "reward": 1.0819726824760436, "reward_std": 0.08506778329610824, "rewards/reward_accuracy/mean": 0.98203125, "rewards/reward_accuracy/std": 0.08461260348558426, "rewards/reward_format/mean": 0.09994140788912773, "rewards/reward_format/std": 0.0006976742763072253, "sampling/importance_sampling_ratio/max": 2.462025022506714, "sampling/importance_sampling_ratio/mean": 0.9891530632972717, "sampling/importance_sampling_ratio/min": 0.21832610815763473, "sampling/sampling_logp_difference/max": 0.9006438314914703, "sampling/sampling_logp_difference/mean": 0.0035551294218748807, "step": 16520, "step_time": 4.600197409500834 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.002734375, "completions/max_length": 1197.3, "completions/max_terminated_length": 909.9, "completions/mean_length": 145.999609375, "completions/mean_terminated_length": 140.85174789428712, "completions/min_length": 63.5, "completions/min_terminated_length": 63.5, "entropy": 0.03676970161031932, "epoch": 35.396145610278374, "frac_reward_zero_std": 0.9625, "grad_norm": 0.0390625, "learning_rate": 8.3471e-06, "loss": -0.0023, "num_tokens": 1608536235.0, "reward": 1.0701171994209289, "reward_std": 0.12901999801397324, "rewards/reward_accuracy/mean": 0.9703125, "rewards/reward_accuracy/std": 0.12804489433765412, "rewards/reward_format/mean": 0.09980468824505806, "rewards/reward_format/std": 0.002496726461686194, "sampling/importance_sampling_ratio/max": 2.533514475822449, "sampling/importance_sampling_ratio/mean": 0.994959682226181, "sampling/importance_sampling_ratio/min": 0.07672785595059395, "sampling/sampling_logp_difference/max": 1.1341453313827514, "sampling/sampling_logp_difference/mean": 0.003833824652247131, "step": 16530, "step_time": 5.9897135965904456 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003515625, "completions/max_length": 1341.5, "completions/max_terminated_length": 1089.3, "completions/mean_length": 152.12578125, "completions/mean_terminated_length": 145.54142837524415, "completions/min_length": 68.8, "completions/min_terminated_length": 68.8, "entropy": 0.03653988731093705, "epoch": 35.41755888650964, "frac_reward_zero_std": 0.93125, "grad_norm": 0.0, "learning_rate": 8.3461e-06, "loss": -0.0009, "num_tokens": 1609441085.0, "reward": 1.0696679830551148, "reward_std": 0.11236065179109574, "rewards/reward_accuracy/mean": 0.969921875, "rewards/reward_accuracy/std": 0.11109263598918914, "rewards/reward_format/mean": 0.09974609538912774, "rewards/reward_format/std": 0.003194400784559548, "sampling/importance_sampling_ratio/max": 2.5076547622680665, "sampling/importance_sampling_ratio/mean": 0.988648521900177, "sampling/importance_sampling_ratio/min": 0.08625393882393836, "sampling/sampling_logp_difference/max": 1.18781476020813, "sampling/sampling_logp_difference/mean": 0.003788560046814382, "step": 16540, "step_time": 6.524363787492621 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001953125, "completions/max_length": 1372.5, "completions/max_terminated_length": 1079.4, "completions/mean_length": 157.02578125, "completions/mean_terminated_length": 153.36053390502929, "completions/min_length": 61.9, "completions/min_terminated_length": 61.9, "entropy": 0.04281559584196657, "epoch": 35.438972162740896, "frac_reward_zero_std": 0.925, "grad_norm": 0.0, "learning_rate": 8.3451e-06, "loss": -0.0031, "num_tokens": 1610357279.0, "reward": 1.0728515625, "reward_std": 0.1215345673263073, "rewards/reward_accuracy/mean": 0.973046875, "rewards/reward_accuracy/std": 0.12016557678580284, "rewards/reward_format/mean": 0.0998046875, "rewards/reward_format/std": 0.0024967264151200654, "sampling/importance_sampling_ratio/max": 2.442826247215271, "sampling/importance_sampling_ratio/mean": 0.9867194294929504, "sampling/importance_sampling_ratio/min": 0.11743850186467171, "sampling/sampling_logp_difference/max": 1.0022576928138733, "sampling/sampling_logp_difference/mean": 0.004089093208312989, "step": 16550, "step_time": 6.753300376690459 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0046875, "completions/max_length": 1290.1, "completions/max_terminated_length": 1067.9, "completions/mean_length": 165.748046875, "completions/mean_terminated_length": 157.0276077270508, "completions/min_length": 63.4, "completions/min_terminated_length": 63.4, "entropy": 0.041407301812432705, "epoch": 35.46038543897216, "frac_reward_zero_std": 0.90625, "grad_norm": 0.6171875, "learning_rate": 8.3441e-06, "loss": -0.0017, "num_tokens": 1611300874.0, "reward": 1.0639258027076721, "reward_std": 0.16183795183897018, "rewards/reward_accuracy/mean": 0.964453125, "rewards/reward_accuracy/std": 0.1595488928258419, "rewards/reward_format/mean": 0.09947265684604645, "rewards/reward_format/std": 0.00424602038692683, "sampling/importance_sampling_ratio/max": 2.5576024293899535, "sampling/importance_sampling_ratio/mean": 0.9906827628612518, "sampling/importance_sampling_ratio/min": 0.14517192989587785, "sampling/sampling_logp_difference/max": 1.370765244960785, "sampling/sampling_logp_difference/mean": 0.003911342192441225, "step": 16560, "step_time": 6.658677626596182 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001171875, "completions/max_length": 1031.8, "completions/max_terminated_length": 680.5, "completions/mean_length": 145.8390625, "completions/mean_terminated_length": 143.60008850097657, "completions/min_length": 66.2, "completions/min_terminated_length": 66.2, "entropy": 0.032197213545441625, "epoch": 35.481798715203425, "frac_reward_zero_std": 0.96875, "grad_norm": 0.0, "learning_rate": 8.343100000000001e-06, "loss": -0.0044, "num_tokens": 1612190366.0, "reward": 1.054550790786743, "reward_std": 0.16532655656337739, "rewards/reward_accuracy/mean": 0.9546875, "rewards/reward_accuracy/std": 0.1646145798265934, "rewards/reward_format/mean": 0.09986328184604645, "rewards/reward_format/std": 0.002187500172294676, "sampling/importance_sampling_ratio/max": 2.4372332096099854, "sampling/importance_sampling_ratio/mean": 0.9890428900718689, "sampling/importance_sampling_ratio/min": 0.11845102589577436, "sampling/sampling_logp_difference/max": 0.9999740719795227, "sampling/sampling_logp_difference/mean": 0.0035119397100061176, "step": 16570, "step_time": 4.9284031931078065 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.004296875, "completions/max_length": 1083.7, "completions/max_terminated_length": 847.2, "completions/mean_length": 151.290625, "completions/mean_terminated_length": 143.19916839599608, "completions/min_length": 62.0, "completions/min_terminated_length": 62.0, "entropy": 0.035939648654311894, "epoch": 35.50321199143469, "frac_reward_zero_std": 0.91875, "grad_norm": 0.2109375, "learning_rate": 8.342100000000001e-06, "loss": 0.0016, "num_tokens": 1613093158.0, "reward": 1.0738867282867433, "reward_std": 0.11746819615364075, "rewards/reward_accuracy/mean": 0.97421875, "rewards/reward_accuracy/std": 0.11618792340159416, "rewards/reward_format/mean": 0.09966796934604645, "rewards/reward_format/std": 0.0030783477472141386, "sampling/importance_sampling_ratio/max": 2.385914182662964, "sampling/importance_sampling_ratio/mean": 0.9847397923469543, "sampling/importance_sampling_ratio/min": 0.07037175986915827, "sampling/sampling_logp_difference/max": 1.2038981199264527, "sampling/sampling_logp_difference/mean": 0.003941973857581616, "step": 16580, "step_time": 5.596604048996232 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001171875, "completions/max_length": 790.4, "completions/max_terminated_length": 686.8, "completions/mean_length": 142.887890625, "completions/mean_terminated_length": 140.67857360839844, "completions/min_length": 64.7, "completions/min_terminated_length": 64.7, "entropy": 0.03134152616839856, "epoch": 35.524625267665954, "frac_reward_zero_std": 0.9625, "grad_norm": 0.068359375, "learning_rate": 8.3411e-06, "loss": -0.0062, "num_tokens": 1613971431.0, "reward": 1.0721484661102294, "reward_std": 0.10304519981145858, "rewards/reward_accuracy/mean": 0.972265625, "rewards/reward_accuracy/std": 0.10245348364114762, "rewards/reward_format/mean": 0.09988281428813935, "rewards/reward_format/std": 0.001387959998100996, "sampling/importance_sampling_ratio/max": 2.4199413895606994, "sampling/importance_sampling_ratio/mean": 0.9857752680778503, "sampling/importance_sampling_ratio/min": 0.17312203329056502, "sampling/sampling_logp_difference/max": 0.9709123790264129, "sampling/sampling_logp_difference/mean": 0.003464928641915321, "step": 16590, "step_time": 4.434072761601419 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00859375, "completions/max_length": 1806.9, "completions/max_terminated_length": 1472.4, "completions/mean_length": 177.99765625, "completions/mean_terminated_length": 161.86730346679687, "completions/min_length": 66.1, "completions/min_terminated_length": 66.1, "entropy": 0.049379786988720295, "epoch": 35.54603854389722, "frac_reward_zero_std": 0.8875, "grad_norm": 0.353515625, "learning_rate": 8.340100000000002e-06, "loss": -0.0037, "num_tokens": 1614944657.0, "reward": 1.0615039229393006, "reward_std": 0.16976474672555925, "rewards/reward_accuracy/mean": 0.962109375, "rewards/reward_accuracy/std": 0.16698972135782242, "rewards/reward_format/mean": 0.09939453229308129, "rewards/reward_format/std": 0.005333546851761639, "sampling/importance_sampling_ratio/max": 2.7245090007781982, "sampling/importance_sampling_ratio/mean": 0.9851636052131653, "sampling/importance_sampling_ratio/min": 0.04341860562562942, "sampling/sampling_logp_difference/max": 1.0139782845973968, "sampling/sampling_logp_difference/mean": 0.0044290405232459305, "step": 16600, "step_time": 8.593861541798105 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00859375, "completions/max_length": 1164.9, "completions/max_terminated_length": 1070.3, "completions/mean_length": 169.25078125, "completions/mean_terminated_length": 153.31380310058594, "completions/min_length": 63.3, "completions/min_terminated_length": 63.3, "entropy": 0.047386300889775156, "epoch": 35.56745182012848, "frac_reward_zero_std": 0.93125, "grad_norm": 0.0, "learning_rate": 8.339100000000001e-06, "loss": -0.0038, "num_tokens": 1615891891.0, "reward": 1.0671289205551147, "reward_std": 0.12832499742507936, "rewards/reward_accuracy/mean": 0.967578125, "rewards/reward_accuracy/std": 0.12661421298980713, "rewards/reward_format/mean": 0.09955078214406968, "rewards/reward_format/std": 0.003646313212811947, "sampling/importance_sampling_ratio/max": 2.417126250267029, "sampling/importance_sampling_ratio/mean": 0.9847851872444153, "sampling/importance_sampling_ratio/min": 0.1296336233615875, "sampling/sampling_logp_difference/max": 1.0325814247131349, "sampling/sampling_logp_difference/mean": 0.004105464811436832, "step": 16610, "step_time": 6.0598098928050605 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 4.532291040959535e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 4.532291040959535e-06, "completions/clipped_ratio": 0.0046875, "completions/max_length": 1101.6, "completions/max_terminated_length": 981.0, "completions/mean_length": 157.68203125, "completions/mean_terminated_length": 148.7578155517578, "completions/min_length": 64.1, "completions/min_terminated_length": 64.1, "entropy": 0.040422122459858656, "epoch": 35.58886509635974, "frac_reward_zero_std": 0.9625, "grad_norm": 0.10693359375, "learning_rate": 8.3381e-06, "loss": -0.0007, "num_tokens": 1616821045.0, "reward": 1.075097668170929, "reward_std": 0.11206008940935135, "rewards/reward_accuracy/mean": 0.975390625, "rewards/reward_accuracy/std": 0.11069507747888566, "rewards/reward_format/mean": 0.09970703125, "rewards/reward_format/std": 0.0027651124401018023, "sampling/importance_sampling_ratio/max": 2.3751394391059875, "sampling/importance_sampling_ratio/mean": 0.980875837802887, "sampling/importance_sampling_ratio/min": 0.1552634309977293, "sampling/sampling_logp_difference/max": 0.9206721186637878, "sampling/sampling_logp_difference/mean": 0.003730079042725265, "step": 16620, "step_time": 5.839185034998809 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001171875, "completions/max_length": 1065.3, "completions/max_terminated_length": 916.6, "completions/mean_length": 137.137109375, "completions/mean_terminated_length": 134.9087387084961, "completions/min_length": 67.3, "completions/min_terminated_length": 67.3, "entropy": 0.03294354169629514, "epoch": 35.610278372591004, "frac_reward_zero_std": 0.94375, "grad_norm": 0.087890625, "learning_rate": 8.3371e-06, "loss": -0.0034, "num_tokens": 1617685876.0, "reward": 1.087011742591858, "reward_std": 0.08737870454788207, "rewards/reward_accuracy/mean": 0.987109375, "rewards/reward_accuracy/std": 0.08650011345744132, "rewards/reward_format/mean": 0.09990234524011612, "rewards/reward_format/std": 0.0013226743787527085, "sampling/importance_sampling_ratio/max": 2.522256243228912, "sampling/importance_sampling_ratio/mean": 0.9939361155033112, "sampling/importance_sampling_ratio/min": 0.14619525969028474, "sampling/sampling_logp_difference/max": 1.1038780629634857, "sampling/sampling_logp_difference/mean": 0.003767493087798357, "step": 16630, "step_time": 5.216047416004585 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001953125, "completions/max_length": 1054.4, "completions/max_terminated_length": 833.2, "completions/mean_length": 142.61640625, "completions/mean_terminated_length": 138.92911071777343, "completions/min_length": 67.0, "completions/min_terminated_length": 67.0, "entropy": 0.03563340259715915, "epoch": 35.63169164882227, "frac_reward_zero_std": 0.9375, "grad_norm": 0.0, "learning_rate": 8.3361e-06, "loss": -0.0015, "num_tokens": 1618564606.0, "reward": 1.0701953411102294, "reward_std": 0.12763285338878633, "rewards/reward_accuracy/mean": 0.9703125, "rewards/reward_accuracy/std": 0.12728590667247772, "rewards/reward_format/mean": 0.09988281428813935, "rewards/reward_format/std": 0.0013232229743152858, "sampling/importance_sampling_ratio/max": 2.483181154727936, "sampling/importance_sampling_ratio/mean": 0.9915848255157471, "sampling/importance_sampling_ratio/min": 0.1612671546638012, "sampling/sampling_logp_difference/max": 1.0912561058998107, "sampling/sampling_logp_difference/mean": 0.003898378857411444, "step": 16640, "step_time": 5.097844930001884 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005078125, "completions/max_length": 1364.3, "completions/max_terminated_length": 973.0, "completions/mean_length": 160.830859375, "completions/mean_terminated_length": 151.17170104980468, "completions/min_length": 62.6, "completions/min_terminated_length": 62.6, "entropy": 0.0407886263448745, "epoch": 35.65310492505353, "frac_reward_zero_std": 0.925, "grad_norm": 0.0, "learning_rate": 8.335100000000001e-06, "loss": -0.0069, "num_tokens": 1619494701.0, "reward": 1.0703515887260437, "reward_std": 0.14101036339998246, "rewards/reward_accuracy/mean": 0.970703125, "rewards/reward_accuracy/std": 0.13895541802048683, "rewards/reward_format/mean": 0.09964843913912773, "rewards/reward_format/std": 0.0033994981087744234, "sampling/importance_sampling_ratio/max": 2.483576202392578, "sampling/importance_sampling_ratio/mean": 0.9916764557361603, "sampling/importance_sampling_ratio/min": 0.056211423873901364, "sampling/sampling_logp_difference/max": 0.9557220995426178, "sampling/sampling_logp_difference/mean": 0.004171628458425403, "step": 16650, "step_time": 6.618479701710749 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 549.7, "completions/max_terminated_length": 549.7, "completions/mean_length": 134.111328125, "completions/mean_terminated_length": 134.111328125, "completions/min_length": 63.8, "completions/min_terminated_length": 63.8, "entropy": 0.03152562296018004, "epoch": 35.6745182012848, "frac_reward_zero_std": 0.975, "grad_norm": 0.0, "learning_rate": 8.3341e-06, "loss": -0.0038, "num_tokens": 1620352618.0, "reward": 1.0921679973602294, "reward_std": 0.03819033801555634, "rewards/reward_accuracy/mean": 0.9921875, "rewards/reward_accuracy/std": 0.03811737895011902, "rewards/reward_format/mean": 0.09998046979308128, "rewards/reward_format/std": 0.0003125000046566129, "sampling/importance_sampling_ratio/max": 2.306631886959076, "sampling/importance_sampling_ratio/mean": 0.9799898087978363, "sampling/importance_sampling_ratio/min": 0.22669145241379737, "sampling/sampling_logp_difference/max": 1.0474633574485779, "sampling/sampling_logp_difference/mean": 0.00372707680799067, "step": 16660, "step_time": 2.9879920958192088 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00234375, "completions/max_length": 1278.2, "completions/max_terminated_length": 1216.4, "completions/mean_length": 150.629296875, "completions/mean_terminated_length": 146.24054107666015, "completions/min_length": 64.8, "completions/min_terminated_length": 64.8, "entropy": 0.03781431841198355, "epoch": 35.69593147751606, "frac_reward_zero_std": 0.93125, "grad_norm": 0.28125, "learning_rate": 8.3331e-06, "loss": -0.0005, "num_tokens": 1621246805.0, "reward": 1.0704297184944154, "reward_std": 0.138520797342062, "rewards/reward_accuracy/mean": 0.970703125, "rewards/reward_accuracy/std": 0.13742663860321044, "rewards/reward_format/mean": 0.09972656443715096, "rewards/reward_format/std": 0.002119214180856943, "sampling/importance_sampling_ratio/max": 2.5390802383422852, "sampling/importance_sampling_ratio/mean": 0.9864245176315307, "sampling/importance_sampling_ratio/min": 0.12806181907653807, "sampling/sampling_logp_difference/max": 1.0658544301986694, "sampling/sampling_logp_difference/mean": 0.003810008056461811, "step": 16670, "step_time": 6.183908754997537 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001953125, "completions/max_length": 1651.9, "completions/max_terminated_length": 1208.4, "completions/mean_length": 157.73125, "completions/mean_terminated_length": 154.04099884033204, "completions/min_length": 64.0, "completions/min_terminated_length": 64.0, "entropy": 0.042677097208797934, "epoch": 35.71734475374733, "frac_reward_zero_std": 0.91875, "grad_norm": 0.125, "learning_rate": 8.332100000000001e-06, "loss": -0.0085, "num_tokens": 1622176325.0, "reward": 1.0686328172683717, "reward_std": 0.14750823602080346, "rewards/reward_accuracy/mean": 0.96875, "rewards/reward_accuracy/std": 0.14682100266218184, "rewards/reward_format/mean": 0.09988281279802322, "rewards/reward_format/std": 0.0018750001210719347, "sampling/importance_sampling_ratio/max": 2.4722678899765014, "sampling/importance_sampling_ratio/mean": 0.9902010440826416, "sampling/importance_sampling_ratio/min": 0.11508107203990221, "sampling/sampling_logp_difference/max": 1.0326999068260192, "sampling/sampling_logp_difference/mean": 0.004275981429964304, "step": 16680, "step_time": 7.644900985294953 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.01015625, "completions/max_length": 1284.3, "completions/max_terminated_length": 1107.1, "completions/mean_length": 175.548046875, "completions/mean_terminated_length": 156.3138885498047, "completions/min_length": 66.0, "completions/min_terminated_length": 66.0, "entropy": 0.04377172149252147, "epoch": 35.738758029978584, "frac_reward_zero_std": 0.9, "grad_norm": 0.16015625, "learning_rate": 8.3311e-06, "loss": -0.0036, "num_tokens": 1623151328.0, "reward": 1.0708203554153441, "reward_std": 0.13248682841658593, "rewards/reward_accuracy/mean": 0.971484375, "rewards/reward_accuracy/std": 0.13016479536890985, "rewards/reward_format/mean": 0.0993359386920929, "rewards/reward_format/std": 0.0046938246116042135, "sampling/importance_sampling_ratio/max": 2.5202752351760864, "sampling/importance_sampling_ratio/mean": 0.9879194498062134, "sampling/importance_sampling_ratio/min": 0.15026906616985797, "sampling/sampling_logp_difference/max": 0.9316123723983765, "sampling/sampling_logp_difference/mean": 0.004113228293135762, "step": 16690, "step_time": 6.439703496918082 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003515625, "completions/max_length": 1483.4, "completions/max_terminated_length": 1288.5, "completions/mean_length": 163.787890625, "completions/mean_terminated_length": 157.17032775878906, "completions/min_length": 67.7, "completions/min_terminated_length": 67.7, "entropy": 0.04049685678910464, "epoch": 35.76017130620985, "frac_reward_zero_std": 0.9125, "grad_norm": 0.201171875, "learning_rate": 8.330100000000002e-06, "loss": -0.0006, "num_tokens": 1624081585.0, "reward": 1.059472680091858, "reward_std": 0.18425227627158164, "rewards/reward_accuracy/mean": 0.959765625, "rewards/reward_accuracy/std": 0.182978006452322, "rewards/reward_format/mean": 0.09970703274011612, "rewards/reward_format/std": 0.003059958410449326, "sampling/importance_sampling_ratio/max": 2.5345240592956544, "sampling/importance_sampling_ratio/mean": 0.990755957365036, "sampling/importance_sampling_ratio/min": 0.10735330730676651, "sampling/sampling_logp_difference/max": 0.9147871851921081, "sampling/sampling_logp_difference/mean": 0.003951675374992192, "step": 16700, "step_time": 6.985968753998168 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00078125, "completions/max_length": 960.0, "completions/max_terminated_length": 773.8, "completions/mean_length": 143.097265625, "completions/mean_terminated_length": 141.61247711181642, "completions/min_length": 64.4, "completions/min_terminated_length": 64.4, "entropy": 0.03171767902094871, "epoch": 35.78158458244111, "frac_reward_zero_std": 0.95625, "grad_norm": 0.408203125, "learning_rate": 8.329100000000001e-06, "loss": -0.0049, "num_tokens": 1624965418.0, "reward": 1.0956836104393006, "reward_std": 0.04471321552991867, "rewards/reward_accuracy/mean": 0.995703125, "rewards/reward_accuracy/std": 0.04453052207827568, "rewards/reward_format/mean": 0.09998046979308128, "rewards/reward_format/std": 0.0003125000046566129, "sampling/importance_sampling_ratio/max": 2.3928420662879946, "sampling/importance_sampling_ratio/mean": 0.9920079708099365, "sampling/importance_sampling_ratio/min": 0.2456461325287819, "sampling/sampling_logp_difference/max": 0.9570783793926239, "sampling/sampling_logp_difference/mean": 0.0035018070600926878, "step": 16710, "step_time": 4.776724062598078 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.000390625, "completions/max_length": 791.8, "completions/max_terminated_length": 706.5, "completions/mean_length": 138.71171875, "completions/mean_terminated_length": 137.97545166015624, "completions/min_length": 63.4, "completions/min_terminated_length": 63.4, "entropy": 0.03161973573733121, "epoch": 35.80299785867238, "frac_reward_zero_std": 0.95625, "grad_norm": 0.58203125, "learning_rate": 8.3281e-06, "loss": -0.0031, "num_tokens": 1625834792.0, "reward": 1.084765648841858, "reward_std": 0.0817948892712593, "rewards/reward_accuracy/mean": 0.984765625, "rewards/reward_accuracy/std": 0.08179489225149154, "rewards/reward_format/mean": 0.10000000149011612, "rewards/reward_format/std": 0.0, "sampling/importance_sampling_ratio/max": 2.324520468711853, "sampling/importance_sampling_ratio/mean": 0.9981642246246338, "sampling/importance_sampling_ratio/min": 0.25055031329393385, "sampling/sampling_logp_difference/max": 0.8870496988296509, "sampling/sampling_logp_difference/mean": 0.003444003057666123, "step": 16720, "step_time": 4.137204613900394 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001953125, "completions/max_length": 1415.2, "completions/max_terminated_length": 1020.4, "completions/mean_length": 163.6265625, "completions/mean_terminated_length": 159.92305526733398, "completions/min_length": 67.1, "completions/min_terminated_length": 67.1, "entropy": 0.03968970563728362, "epoch": 35.82441113490364, "frac_reward_zero_std": 0.93125, "grad_norm": 0.3671875, "learning_rate": 8.3271e-06, "loss": -0.0022, "num_tokens": 1626781020.0, "reward": 1.0705859661102295, "reward_std": 0.12766130566596984, "rewards/reward_accuracy/mean": 0.970703125, "rewards/reward_accuracy/std": 0.12715097814798354, "rewards/reward_format/mean": 0.09988281428813935, "rewards/reward_format/std": 0.0015071487054228784, "sampling/importance_sampling_ratio/max": 2.4948187351226805, "sampling/importance_sampling_ratio/mean": 0.9956787645816803, "sampling/importance_sampling_ratio/min": 0.14572490602731705, "sampling/sampling_logp_difference/max": 1.065236258506775, "sampling/sampling_logp_difference/mean": 0.0040798387723043564, "step": 16730, "step_time": 6.70148568652221 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 2.25573057832662e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 2.25573057832662e-06, "completions/clipped_ratio": 0.007421875, "completions/max_length": 1404.4, "completions/max_terminated_length": 1002.8, "completions/mean_length": 163.25390625, "completions/mean_terminated_length": 149.12774047851562, "completions/min_length": 64.6, "completions/min_terminated_length": 64.6, "entropy": 0.04076594174839556, "epoch": 35.845824411134906, "frac_reward_zero_std": 0.90625, "grad_norm": 0.41796875, "learning_rate": 8.3261e-06, "loss": -0.0084, "num_tokens": 1627714502.0, "reward": 1.0696484565734863, "reward_std": 0.13923025876283646, "rewards/reward_accuracy/mean": 0.9703125, "rewards/reward_accuracy/std": 0.13627480641007422, "rewards/reward_format/mean": 0.0993359386920929, "rewards/reward_format/std": 0.004047102737240493, "sampling/importance_sampling_ratio/max": 2.471239674091339, "sampling/importance_sampling_ratio/mean": 0.9884591996669769, "sampling/importance_sampling_ratio/min": 0.14880207795649766, "sampling/sampling_logp_difference/max": 0.9843007087707519, "sampling/sampling_logp_difference/mean": 0.0040628567803651094, "step": 16740, "step_time": 6.7991390533105 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00234375, "completions/max_length": 708.7, "completions/max_terminated_length": 528.8, "completions/mean_length": 149.08515625, "completions/mean_terminated_length": 144.7034469604492, "completions/min_length": 72.4, "completions/min_terminated_length": 72.4, "entropy": 0.033885933458805084, "epoch": 35.86723768736617, "frac_reward_zero_std": 0.95625, "grad_norm": 0.23828125, "learning_rate": 8.325100000000001e-06, "loss": -0.0034, "num_tokens": 1628611632.0, "reward": 1.071679711341858, "reward_std": 0.10856535732746124, "rewards/reward_accuracy/mean": 0.971875, "rewards/reward_accuracy/std": 0.10786949396133423, "rewards/reward_format/mean": 0.09980468899011612, "rewards/reward_format/std": 0.0018676253035664558, "sampling/importance_sampling_ratio/max": 2.5968374490737913, "sampling/importance_sampling_ratio/mean": 0.9834044992923736, "sampling/importance_sampling_ratio/min": 0.16985025703907014, "sampling/sampling_logp_difference/max": 1.0032796204090118, "sampling/sampling_logp_difference/mean": 0.00369625564198941, "step": 16750, "step_time": 3.793537507590372 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00703125, "completions/max_length": 1369.1, "completions/max_terminated_length": 1242.9, "completions/mean_length": 179.812890625, "completions/mean_terminated_length": 167.10973510742187, "completions/min_length": 63.5, "completions/min_terminated_length": 63.5, "entropy": 0.04635952860116958, "epoch": 35.88865096359743, "frac_reward_zero_std": 0.9, "grad_norm": 0.1962890625, "learning_rate": 8.3241e-06, "loss": -0.0079, "num_tokens": 1629596977.0, "reward": 1.049882835149765, "reward_std": 0.17574358955025673, "rewards/reward_accuracy/mean": 0.950390625, "rewards/reward_accuracy/std": 0.17444290295243264, "rewards/reward_format/mean": 0.09949218928813934, "rewards/reward_format/std": 0.0036689060973003505, "sampling/importance_sampling_ratio/max": 2.4660306930541993, "sampling/importance_sampling_ratio/mean": 0.9831955850124359, "sampling/importance_sampling_ratio/min": 0.11112826312892139, "sampling/sampling_logp_difference/max": 1.0495434761047364, "sampling/sampling_logp_difference/mean": 0.004168483056128025, "step": 16760, "step_time": 6.940280692314263 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0015625, "completions/max_length": 846.6, "completions/max_terminated_length": 818.2, "completions/mean_length": 148.312890625, "completions/mean_terminated_length": 145.38022155761718, "completions/min_length": 62.1, "completions/min_terminated_length": 62.1, "entropy": 0.03300017903093248, "epoch": 35.91006423982869, "frac_reward_zero_std": 0.98125, "grad_norm": 0.0, "learning_rate": 8.3231e-06, "loss": -0.0018, "num_tokens": 1630493810.0, "reward": 1.0775976777076721, "reward_std": 0.07903242111206055, "rewards/reward_accuracy/mean": 0.977734375, "rewards/reward_accuracy/std": 0.07852273732423783, "rewards/reward_format/mean": 0.09986328259110451, "rewards/reward_format/std": 0.0013907782966271042, "sampling/importance_sampling_ratio/max": 2.480143368244171, "sampling/importance_sampling_ratio/mean": 0.9892591536045074, "sampling/importance_sampling_ratio/min": 0.2145886480808258, "sampling/sampling_logp_difference/max": 1.1869255781173706, "sampling/sampling_logp_difference/mean": 0.003403732762672007, "step": 16770, "step_time": 4.393707009908394 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00078125, "completions/max_length": 1260.4, "completions/max_terminated_length": 1238.5, "completions/mean_length": 146.25703125, "completions/mean_terminated_length": 144.80577850341797, "completions/min_length": 64.1, "completions/min_terminated_length": 64.1, "entropy": 0.041305858013220134, "epoch": 35.93147751605996, "frac_reward_zero_std": 0.94375, "grad_norm": 0.2119140625, "learning_rate": 8.322100000000001e-06, "loss": -0.0061, "num_tokens": 1631378964.0, "reward": 1.0701562643051148, "reward_std": 0.1293718360364437, "rewards/reward_accuracy/mean": 0.9703125, "rewards/reward_accuracy/std": 0.12865586206316948, "rewards/reward_format/mean": 0.09984375089406967, "rewards/reward_format/std": 0.001630769087933004, "sampling/importance_sampling_ratio/max": 2.4847580671310423, "sampling/importance_sampling_ratio/mean": 0.9923129260540009, "sampling/importance_sampling_ratio/min": 0.13733653500676155, "sampling/sampling_logp_difference/max": 0.9791782379150391, "sampling/sampling_logp_difference/mean": 0.004277592361904681, "step": 16780, "step_time": 6.042454081823235 }, { "clip_ratio/high_max": 8.546034950995818e-06, "clip_ratio/high_mean": 1.0682543688744773e-06, "clip_ratio/low_mean": 1.3270079534777324e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 2.3952623223522095e-06, "completions/clipped_ratio": 0.00546875, "completions/max_length": 1264.7, "completions/max_terminated_length": 1100.3, "completions/mean_length": 159.98046875, "completions/mean_terminated_length": 149.74697875976562, "completions/min_length": 64.2, "completions/min_terminated_length": 64.2, "entropy": 0.04304876627866179, "epoch": 35.95289079229122, "frac_reward_zero_std": 0.9375, "grad_norm": 0.2412109375, "learning_rate": 8.3211e-06, "loss": -0.0061, "num_tokens": 1632311106.0, "reward": 1.087597668170929, "reward_std": 0.09279002398252487, "rewards/reward_accuracy/mean": 0.987890625, "rewards/reward_accuracy/std": 0.09114054888486862, "rewards/reward_format/mean": 0.09970703199505807, "rewards/reward_format/std": 0.002668620832264423, "sampling/importance_sampling_ratio/max": 2.653280258178711, "sampling/importance_sampling_ratio/mean": 0.9898922324180603, "sampling/importance_sampling_ratio/min": 0.09432288743555546, "sampling/sampling_logp_difference/max": 1.049621856212616, "sampling/sampling_logp_difference/mean": 0.004039610642939806, "step": 16790, "step_time": 6.181705083412817 }, { "clip_ratio/high_max": 3.942583207390271e-05, "clip_ratio/high_mean": 4.9282290092378386e-06, "clip_ratio/low_mean": 1.055267875926802e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 5.983496885164641e-06, "completions/clipped_ratio": 0.00546875, "completions/max_length": 999.1, "completions/max_terminated_length": 855.0, "completions/mean_length": 142.06953125, "completions/mean_terminated_length": 131.7631088256836, "completions/min_length": 67.0, "completions/min_terminated_length": 67.0, "entropy": 0.03780613914132118, "epoch": 35.974304068522486, "frac_reward_zero_std": 0.95625, "grad_norm": 0.0, "learning_rate": 8.3201e-06, "loss": 0.0053, "num_tokens": 1633183844.0, "reward": 1.0770117461681366, "reward_std": 0.08988268896937371, "rewards/reward_accuracy/mean": 0.97734375, "rewards/reward_accuracy/std": 0.08831450268626213, "rewards/reward_format/mean": 0.09966797009110451, "rewards/reward_format/std": 0.0029257694259285927, "sampling/importance_sampling_ratio/max": 2.4416415810585024, "sampling/importance_sampling_ratio/mean": 0.9945643186569214, "sampling/importance_sampling_ratio/min": 0.22679751962423325, "sampling/sampling_logp_difference/max": 0.8411231994628906, "sampling/sampling_logp_difference/mean": 0.003820716985501349, "step": 16800, "step_time": 5.093518897681497 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003515625, "completions/max_length": 993.2, "completions/max_terminated_length": 963.5, "completions/mean_length": 153.05234375, "completions/mean_terminated_length": 146.48349304199218, "completions/min_length": 61.7, "completions/min_terminated_length": 61.7, "entropy": 0.04326945198699832, "epoch": 35.99571734475375, "frac_reward_zero_std": 0.94375, "grad_norm": 0.154296875, "learning_rate": 8.319100000000001e-06, "loss": -0.0024, "num_tokens": 1634083546.0, "reward": 1.0826172232627869, "reward_std": 0.09762932807207107, "rewards/reward_accuracy/mean": 0.9828125, "rewards/reward_accuracy/std": 0.09726518765091896, "rewards/reward_format/mean": 0.09980468973517417, "rewards/reward_format/std": 0.0019445357378572226, "sampling/importance_sampling_ratio/max": 2.628986692428589, "sampling/importance_sampling_ratio/mean": 0.9900913119316102, "sampling/importance_sampling_ratio/min": 0.1006898358464241, "sampling/sampling_logp_difference/max": 0.9249450445175171, "sampling/sampling_logp_difference/mean": 0.0040163301397114996, "step": 16810, "step_time": 5.219753842797945 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.004296875, "completions/max_length": 1342.1, "completions/max_terminated_length": 1116.3, "completions/mean_length": 167.442578125, "completions/mean_terminated_length": 159.39326934814454, "completions/min_length": 69.3, "completions/min_terminated_length": 69.3, "entropy": 0.040182948135770856, "epoch": 36.01713062098501, "frac_reward_zero_std": 0.9, "grad_norm": 0.0, "learning_rate": 8.318100000000001e-06, "loss": -0.0107, "num_tokens": 1635031671.0, "reward": 1.072265636920929, "reward_std": 0.12369971722364426, "rewards/reward_accuracy/mean": 0.97265625, "rewards/reward_accuracy/std": 0.12179100662469863, "rewards/reward_format/mean": 0.09960937574505806, "rewards/reward_format/std": 0.003509024949744344, "sampling/importance_sampling_ratio/max": 2.534204888343811, "sampling/importance_sampling_ratio/mean": 0.981930536031723, "sampling/importance_sampling_ratio/min": 0.09714533984661103, "sampling/sampling_logp_difference/max": 1.0335193276405334, "sampling/sampling_logp_difference/mean": 0.004007102176547051, "step": 16820, "step_time": 6.47496976100665 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001171875, "completions/max_length": 674.5, "completions/max_terminated_length": 558.6, "completions/mean_length": 141.78359375, "completions/mean_terminated_length": 139.59192962646483, "completions/min_length": 66.1, "completions/min_terminated_length": 66.1, "entropy": 0.031274677417241034, "epoch": 36.03854389721627, "frac_reward_zero_std": 0.9375, "grad_norm": 0.0, "learning_rate": 8.3171e-06, "loss": -0.0012, "num_tokens": 1635909501.0, "reward": 1.0803125202655792, "reward_std": 0.0866770550608635, "rewards/reward_accuracy/mean": 0.98046875, "rewards/reward_accuracy/std": 0.08586665242910385, "rewards/reward_format/mean": 0.09984375089406967, "rewards/reward_format/std": 0.0017032783478498458, "sampling/importance_sampling_ratio/max": 2.513621520996094, "sampling/importance_sampling_ratio/mean": 0.9864765703678131, "sampling/importance_sampling_ratio/min": 0.15989703370723873, "sampling/sampling_logp_difference/max": 1.1965598583221435, "sampling/sampling_logp_difference/mean": 0.0036608319031074645, "step": 16830, "step_time": 3.686029956798302 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001171875, "completions/max_length": 949.5, "completions/max_terminated_length": 831.0, "completions/mean_length": 145.628125, "completions/mean_terminated_length": 143.4047424316406, "completions/min_length": 63.6, "completions/min_terminated_length": 63.6, "entropy": 0.03508396039251238, "epoch": 36.059957173447536, "frac_reward_zero_std": 0.94375, "grad_norm": 0.0, "learning_rate": 8.3161e-06, "loss": 0.0031, "num_tokens": 1636798517.0, "reward": 1.0678906440734863, "reward_std": 0.13351510614156722, "rewards/reward_accuracy/mean": 0.96796875, "rewards/reward_accuracy/std": 0.13325634300708772, "rewards/reward_format/mean": 0.09992187619209289, "rewards/reward_format/std": 0.0012500001117587089, "sampling/importance_sampling_ratio/max": 2.499228072166443, "sampling/importance_sampling_ratio/mean": 1.000488430261612, "sampling/importance_sampling_ratio/min": 0.2009448952972889, "sampling/sampling_logp_difference/max": 0.8299339771270752, "sampling/sampling_logp_difference/mean": 0.0035814635921269655, "step": 16840, "step_time": 4.819716510208673 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0015625, "completions/max_length": 1033.8, "completions/max_terminated_length": 838.3, "completions/mean_length": 145.261328125, "completions/mean_terminated_length": 142.30104064941406, "completions/min_length": 66.3, "completions/min_terminated_length": 66.3, "entropy": 0.03253389068413526, "epoch": 36.0813704496788, "frac_reward_zero_std": 0.95, "grad_norm": 0.0, "learning_rate": 8.315100000000001e-06, "loss": 0.0014, "num_tokens": 1637691090.0, "reward": 1.0892969012260436, "reward_std": 0.06980726942420006, "rewards/reward_accuracy/mean": 0.989453125, "rewards/reward_accuracy/std": 0.06878408566117286, "rewards/reward_format/mean": 0.09984375163912773, "rewards/reward_format/std": 0.0018923229770734906, "sampling/importance_sampling_ratio/max": 2.3984856843948363, "sampling/importance_sampling_ratio/mean": 0.9879953622817993, "sampling/importance_sampling_ratio/min": 0.18578599002212287, "sampling/sampling_logp_difference/max": 0.9897389709949493, "sampling/sampling_logp_difference/mean": 0.0036446610698476433, "step": 16850, "step_time": 5.072532424188102 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003125, "completions/max_length": 808.1, "completions/max_terminated_length": 794.1, "completions/mean_length": 153.198828125, "completions/mean_terminated_length": 147.38431091308593, "completions/min_length": 68.5, "completions/min_terminated_length": 68.5, "entropy": 0.03659339726436883, "epoch": 36.102783725910065, "frac_reward_zero_std": 0.9625, "grad_norm": 0.3515625, "learning_rate": 8.3141e-06, "loss": -0.0014, "num_tokens": 1638599999.0, "reward": 1.0849023461341858, "reward_std": 0.0756956659257412, "rewards/reward_accuracy/mean": 0.98515625, "rewards/reward_accuracy/std": 0.07460442036390305, "rewards/reward_format/mean": 0.09974609389901161, "rewards/reward_format/std": 0.00204362072981894, "sampling/importance_sampling_ratio/max": 2.427100324630737, "sampling/importance_sampling_ratio/mean": 0.9904575288295746, "sampling/importance_sampling_ratio/min": 0.1430188849568367, "sampling/sampling_logp_difference/max": 1.1514223098754883, "sampling/sampling_logp_difference/mean": 0.003792649647220969, "step": 16860, "step_time": 4.459286060582963 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 1337.8, "completions/max_terminated_length": 1083.9, "completions/mean_length": 154.2484375, "completions/mean_terminated_length": 146.8650100708008, "completions/min_length": 61.9, "completions/min_terminated_length": 61.9, "entropy": 0.038797540194354954, "epoch": 36.12419700214133, "frac_reward_zero_std": 0.925, "grad_norm": 0.1005859375, "learning_rate": 8.3131e-06, "loss": -0.0072, "num_tokens": 1639511995.0, "reward": 1.0734570384025575, "reward_std": 0.1255304317222908, "rewards/reward_accuracy/mean": 0.973828125, "rewards/reward_accuracy/std": 0.12360360100865364, "rewards/reward_format/mean": 0.09962890669703484, "rewards/reward_format/std": 0.004114143806509674, "sampling/importance_sampling_ratio/max": 2.465018057823181, "sampling/importance_sampling_ratio/mean": 0.9834714651107788, "sampling/importance_sampling_ratio/min": 0.08581177480518817, "sampling/sampling_logp_difference/max": 0.9202985644340516, "sampling/sampling_logp_difference/mean": 0.00384854762814939, "step": 16870, "step_time": 6.731278541096254 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003515625, "completions/max_length": 1198.3, "completions/max_terminated_length": 1151.2, "completions/mean_length": 149.6796875, "completions/mean_terminated_length": 143.05670166015625, "completions/min_length": 62.3, "completions/min_terminated_length": 62.3, "entropy": 0.040614526043646036, "epoch": 36.145610278372594, "frac_reward_zero_std": 0.93125, "grad_norm": 0.04736328125, "learning_rate": 8.312100000000001e-06, "loss": -0.0045, "num_tokens": 1640411495.0, "reward": 1.0779296994209289, "reward_std": 0.11099743619561195, "rewards/reward_accuracy/mean": 0.978125, "rewards/reward_accuracy/std": 0.10995067059993743, "rewards/reward_format/mean": 0.09980468899011612, "rewards/reward_format/std": 0.0020492353942245245, "sampling/importance_sampling_ratio/max": 2.3244585752487184, "sampling/importance_sampling_ratio/mean": 0.9830375432968139, "sampling/importance_sampling_ratio/min": 0.09987646192312241, "sampling/sampling_logp_difference/max": 0.9317891597747803, "sampling/sampling_logp_difference/mean": 0.004011388961225748, "step": 16880, "step_time": 6.138927051305655 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001171875, "completions/max_length": 1318.9, "completions/max_terminated_length": 959.9, "completions/mean_length": 154.122265625, "completions/mean_terminated_length": 151.90689926147462, "completions/min_length": 64.6, "completions/min_terminated_length": 64.6, "entropy": 0.04044674562755972, "epoch": 36.16702355460385, "frac_reward_zero_std": 0.94375, "grad_norm": 0.083984375, "learning_rate": 8.3111e-06, "loss": -0.0017, "num_tokens": 1641326656.0, "reward": 1.0658984541893006, "reward_std": 0.1444559197174385, "rewards/reward_accuracy/mean": 0.966015625, "rewards/reward_accuracy/std": 0.14375731721520424, "rewards/reward_format/mean": 0.09988281354308129, "rewards/reward_format/std": 0.0013879599515348672, "sampling/importance_sampling_ratio/max": 2.5924491047859193, "sampling/importance_sampling_ratio/mean": 0.9918780744075775, "sampling/importance_sampling_ratio/min": 0.03715047836303711, "sampling/sampling_logp_difference/max": 1.0405516028404236, "sampling/sampling_logp_difference/mean": 0.004011666495352983, "step": 16890, "step_time": 6.275921866323915 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0015625, "completions/max_length": 1067.2, "completions/max_terminated_length": 1018.5, "completions/mean_length": 145.459375, "completions/mean_terminated_length": 142.53250427246093, "completions/min_length": 67.4, "completions/min_terminated_length": 67.4, "entropy": 0.03674842419568449, "epoch": 36.188436830835116, "frac_reward_zero_std": 0.90625, "grad_norm": 0.361328125, "learning_rate": 8.3101e-06, "loss": -0.0049, "num_tokens": 1642218488.0, "reward": 1.0670508027076722, "reward_std": 0.1375821441411972, "rewards/reward_accuracy/mean": 0.9671875, "rewards/reward_accuracy/std": 0.1371540203690529, "rewards/reward_format/mean": 0.09986328259110451, "rewards/reward_format/std": 0.0018196488032117485, "sampling/importance_sampling_ratio/max": 2.334429621696472, "sampling/importance_sampling_ratio/mean": 0.9854076325893402, "sampling/importance_sampling_ratio/min": 0.08803983926773071, "sampling/sampling_logp_difference/max": 0.9237225830554963, "sampling/sampling_logp_difference/mean": 0.004001390165649354, "step": 16900, "step_time": 5.307824641311891 }, { "clip_ratio/high_max": 2.0547944586724043e-05, "clip_ratio/high_mean": 2.5684930733405054e-06, "clip_ratio/low_mean": 7.518043275922537e-07, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 3.320297400932759e-06, "completions/clipped_ratio": 0.00625, "completions/max_length": 1243.4, "completions/max_terminated_length": 940.4, "completions/mean_length": 164.428125, "completions/mean_terminated_length": 152.6092544555664, "completions/min_length": 69.3, "completions/min_terminated_length": 69.3, "entropy": 0.03967396724037826, "epoch": 36.20985010706638, "frac_reward_zero_std": 0.94375, "grad_norm": 0.1220703125, "learning_rate": 8.309100000000001e-06, "loss": -0.0038, "num_tokens": 1643159200.0, "reward": 1.0750195503234863, "reward_std": 0.12954291179776192, "rewards/reward_accuracy/mean": 0.975390625, "rewards/reward_accuracy/std": 0.1277281418442726, "rewards/reward_format/mean": 0.09962890818715095, "rewards/reward_format/std": 0.0036118451738730074, "sampling/importance_sampling_ratio/max": 2.521997308731079, "sampling/importance_sampling_ratio/mean": 0.9821232736110688, "sampling/importance_sampling_ratio/min": 0.10912741907723103, "sampling/sampling_logp_difference/max": 1.5655581593513488, "sampling/sampling_logp_difference/mean": 0.00392705537378788, "step": 16910, "step_time": 6.173269391784561 }, { "clip_ratio/high_max": 1.4621251466451213e-05, "clip_ratio/high_mean": 1.8276564333064016e-06, "clip_ratio/low_mean": 2.1207039708315277e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 3.948360404137929e-06, "completions/clipped_ratio": 0.009765625, "completions/max_length": 1191.7, "completions/max_terminated_length": 1091.8, "completions/mean_length": 174.058984375, "completions/mean_terminated_length": 155.77727661132812, "completions/min_length": 62.6, "completions/min_terminated_length": 62.6, "entropy": 0.04569540894590318, "epoch": 36.231263383297645, "frac_reward_zero_std": 0.91875, "grad_norm": 0.0, "learning_rate": 8.308100000000001e-06, "loss": -0.0053, "num_tokens": 1644122439.0, "reward": 1.0589453339576722, "reward_std": 0.17132573947310448, "rewards/reward_accuracy/mean": 0.959765625, "rewards/reward_accuracy/std": 0.16801088079810142, "rewards/reward_format/mean": 0.09917968958616256, "rewards/reward_format/std": 0.004934235778637231, "sampling/importance_sampling_ratio/max": 2.529524254798889, "sampling/importance_sampling_ratio/mean": 0.9782518029212952, "sampling/importance_sampling_ratio/min": 0.10802633017301559, "sampling/sampling_logp_difference/max": 1.198913812637329, "sampling/sampling_logp_difference/mean": 0.004129257658496499, "step": 16920, "step_time": 6.249358621687861 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001171875, "completions/max_length": 640.9, "completions/max_terminated_length": 379.7, "completions/mean_length": 135.507421875, "completions/mean_terminated_length": 133.2692672729492, "completions/min_length": 64.4, "completions/min_terminated_length": 64.4, "entropy": 0.029867205838672816, "epoch": 36.25267665952891, "frac_reward_zero_std": 0.975, "grad_norm": 0.5390625, "learning_rate": 8.3071e-06, "loss": 0.0028, "num_tokens": 1644983562.0, "reward": 1.0781250238418578, "reward_std": 0.09609008803963662, "rewards/reward_accuracy/mean": 0.978125, "rewards/reward_accuracy/std": 0.09609009549021721, "rewards/reward_format/mean": 0.10000000149011612, "rewards/reward_format/std": 0.0, "sampling/importance_sampling_ratio/max": 2.3627597808837892, "sampling/importance_sampling_ratio/mean": 0.994727474451065, "sampling/importance_sampling_ratio/min": 0.24681287705898286, "sampling/sampling_logp_difference/max": 1.0587978601455688, "sampling/sampling_logp_difference/mean": 0.0033636394422501326, "step": 16930, "step_time": 3.4287586897116853 }, { "clip_ratio/high_max": 2.812037491821684e-05, "clip_ratio/high_mean": 3.515046864777105e-06, "clip_ratio/low_mean": 3.655825821624603e-07, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 3.880629446939565e-06, "completions/clipped_ratio": 0.011328125, "completions/max_length": 1617.3, "completions/max_terminated_length": 1288.0, "completions/mean_length": 173.137890625, "completions/mean_terminated_length": 151.6918502807617, "completions/min_length": 70.6, "completions/min_terminated_length": 70.6, "entropy": 0.041604144219309094, "epoch": 36.27408993576017, "frac_reward_zero_std": 0.91875, "grad_norm": 0.045654296875, "learning_rate": 8.3061e-06, "loss": -0.0019, "num_tokens": 1645950459.0, "reward": 1.0793750405311584, "reward_std": 0.12157879918813705, "rewards/reward_accuracy/mean": 0.980078125, "rewards/reward_accuracy/std": 0.11824235618114472, "rewards/reward_format/mean": 0.09929687753319741, "rewards/reward_format/std": 0.004631900787353515, "sampling/importance_sampling_ratio/max": 2.524004316329956, "sampling/importance_sampling_ratio/mean": 0.9855282843112946, "sampling/importance_sampling_ratio/min": 0.06364565463736653, "sampling/sampling_logp_difference/max": 0.9785195589065552, "sampling/sampling_logp_difference/mean": 0.0039444284979254, "step": 16940, "step_time": 7.897698314106674 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0046875, "completions/max_length": 1142.9, "completions/max_terminated_length": 902.1, "completions/mean_length": 162.541015625, "completions/mean_terminated_length": 153.78460083007812, "completions/min_length": 67.9, "completions/min_terminated_length": 67.9, "entropy": 0.04243669423740357, "epoch": 36.29550321199144, "frac_reward_zero_std": 0.90625, "grad_norm": 0.275390625, "learning_rate": 8.305100000000001e-06, "loss": -0.003, "num_tokens": 1646885780.0, "reward": 1.066894543170929, "reward_std": 0.14491728246212005, "rewards/reward_accuracy/mean": 0.9671875, "rewards/reward_accuracy/std": 0.1436668261885643, "rewards/reward_format/mean": 0.09970703199505807, "rewards/reward_format/std": 0.0027287610806524753, "sampling/importance_sampling_ratio/max": 2.5595563650131226, "sampling/importance_sampling_ratio/mean": 0.9938982009887696, "sampling/importance_sampling_ratio/min": 0.16485346630215644, "sampling/sampling_logp_difference/max": 0.9741186738014221, "sampling/sampling_logp_difference/mean": 0.004169066157191992, "step": 16950, "step_time": 5.797338799104909 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001953125, "completions/max_length": 1272.1, "completions/max_terminated_length": 1083.6, "completions/mean_length": 151.363671875, "completions/mean_terminated_length": 147.65506134033203, "completions/min_length": 70.1, "completions/min_terminated_length": 70.1, "entropy": 0.03668780352454633, "epoch": 36.316916488222695, "frac_reward_zero_std": 0.95625, "grad_norm": 0.0, "learning_rate": 8.3041e-06, "loss": -0.0014, "num_tokens": 1647785431.0, "reward": 1.0619726777076721, "reward_std": 0.1343804754316807, "rewards/reward_accuracy/mean": 0.962109375, "rewards/reward_accuracy/std": 0.13390858545899392, "rewards/reward_format/mean": 0.09986328259110451, "rewards/reward_format/std": 0.0019476743880659341, "sampling/importance_sampling_ratio/max": 2.4659452557563784, "sampling/importance_sampling_ratio/mean": 0.9935767412185669, "sampling/importance_sampling_ratio/min": 0.15311926156282424, "sampling/sampling_logp_difference/max": 0.9619999170303345, "sampling/sampling_logp_difference/mean": 0.0037771575385704636, "step": 16960, "step_time": 6.056351512105903 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 1047.8, "completions/max_terminated_length": 842.8, "completions/mean_length": 158.883203125, "completions/mean_terminated_length": 151.60555419921874, "completions/min_length": 67.0, "completions/min_terminated_length": 67.0, "entropy": 0.038676865259185435, "epoch": 36.33832976445396, "frac_reward_zero_std": 0.9125, "grad_norm": 0.09619140625, "learning_rate": 8.3031e-06, "loss": -0.0013, "num_tokens": 1648711308.0, "reward": 1.050195324420929, "reward_std": 0.19829256162047387, "rewards/reward_accuracy/mean": 0.950390625, "rewards/reward_accuracy/std": 0.1975794516503811, "rewards/reward_format/mean": 0.09980468899011612, "rewards/reward_format/std": 0.0023282784037292003, "sampling/importance_sampling_ratio/max": 2.3101432800292967, "sampling/importance_sampling_ratio/mean": 0.9821962952613831, "sampling/importance_sampling_ratio/min": 0.07184472874990337, "sampling/sampling_logp_difference/max": 2.6562817454338075, "sampling/sampling_logp_difference/mean": 0.0038169432897120713, "step": 16970, "step_time": 5.454293684981531 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001171875, "completions/max_length": 1342.3, "completions/max_terminated_length": 1181.7, "completions/mean_length": 152.287890625, "completions/mean_terminated_length": 150.05541229248047, "completions/min_length": 64.3, "completions/min_terminated_length": 64.3, "entropy": 0.03673783759586513, "epoch": 36.359743040685224, "frac_reward_zero_std": 0.925, "grad_norm": 0.259765625, "learning_rate": 8.302100000000001e-06, "loss": -0.0056, "num_tokens": 1649616413.0, "reward": 1.0842578172683717, "reward_std": 0.09986273795366288, "rewards/reward_accuracy/mean": 0.984375, "rewards/reward_accuracy/std": 0.09896428138017654, "rewards/reward_format/mean": 0.09988281279802322, "rewards/reward_format/std": 0.0018750001210719347, "sampling/importance_sampling_ratio/max": 2.628732204437256, "sampling/importance_sampling_ratio/mean": 0.9912784397602081, "sampling/importance_sampling_ratio/min": 0.0467779353260994, "sampling/sampling_logp_difference/max": 0.9455727458000183, "sampling/sampling_logp_difference/mean": 0.003792191599495709, "step": 16980, "step_time": 6.403077074408065 }, { "clip_ratio/high_max": 2.3454459733329713e-05, "clip_ratio/high_mean": 2.931807466666214e-06, "clip_ratio/low_mean": 5.3330096761783356e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 8.264817097369814e-06, "completions/clipped_ratio": 0.012890625, "completions/max_length": 1949.6, "completions/max_terminated_length": 1313.7, "completions/mean_length": 180.214453125, "completions/mean_terminated_length": 155.77666931152345, "completions/min_length": 66.4, "completions/min_terminated_length": 66.4, "entropy": 0.05279324166476727, "epoch": 36.38115631691649, "frac_reward_zero_std": 0.83125, "grad_norm": 1.09375, "learning_rate": 8.301100000000001e-06, "loss": -0.0108, "num_tokens": 1650601090.0, "reward": 1.0615820288658142, "reward_std": 0.1805962324142456, "rewards/reward_accuracy/mean": 0.9625, "rewards/reward_accuracy/std": 0.1760316088795662, "rewards/reward_format/mean": 0.09908203110098839, "rewards/reward_format/std": 0.007781862863339484, "sampling/importance_sampling_ratio/max": 2.5755242586135862, "sampling/importance_sampling_ratio/mean": 0.9766068935394288, "sampling/importance_sampling_ratio/min": 0.07973977643996477, "sampling/sampling_logp_difference/max": 1.0598124623298646, "sampling/sampling_logp_difference/mean": 0.00431001796387136, "step": 16990, "step_time": 9.216570341197075 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0046875, "completions/max_length": 1408.3, "completions/max_terminated_length": 1018.9, "completions/mean_length": 151.178515625, "completions/mean_terminated_length": 142.29333267211913, "completions/min_length": 64.0, "completions/min_terminated_length": 64.0, "entropy": 0.03715283463243395, "epoch": 36.40256959314775, "frac_reward_zero_std": 0.925, "grad_norm": 0.0, "learning_rate": 8.3001e-06, "loss": -0.0058, "num_tokens": 1651504091.0, "reward": 1.0687304854393005, "reward_std": 0.1346093848347664, "rewards/reward_accuracy/mean": 0.969140625, "rewards/reward_accuracy/std": 0.13188508078455924, "rewards/reward_format/mean": 0.09958984479308128, "rewards/reward_format/std": 0.003916825470514596, "sampling/importance_sampling_ratio/max": 2.29284987449646, "sampling/importance_sampling_ratio/mean": 0.9928920865058899, "sampling/importance_sampling_ratio/min": 0.119593057455495, "sampling/sampling_logp_difference/max": 1.034817737340927, "sampling/sampling_logp_difference/mean": 0.0036990506574511527, "step": 17000, "step_time": 6.745136571215698 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001953125, "completions/max_length": 1040.8, "completions/max_terminated_length": 816.6, "completions/mean_length": 153.945703125, "completions/mean_terminated_length": 150.26326446533204, "completions/min_length": 62.9, "completions/min_terminated_length": 62.9, "entropy": 0.03334321279544383, "epoch": 36.42398286937902, "frac_reward_zero_std": 0.925, "grad_norm": 0.0, "learning_rate": 8.299100000000002e-06, "loss": 0.0005, "num_tokens": 1652417952.0, "reward": 1.0799219012260437, "reward_std": 0.09810726940631867, "rewards/reward_accuracy/mean": 0.980078125, "rewards/reward_accuracy/std": 0.0976080134510994, "rewards/reward_format/mean": 0.09984375163912773, "rewards/reward_format/std": 0.0017337878001853825, "sampling/importance_sampling_ratio/max": 2.4135416626930235, "sampling/importance_sampling_ratio/mean": 0.9843147456645965, "sampling/importance_sampling_ratio/min": 0.10092815235257149, "sampling/sampling_logp_difference/max": 1.0086387872695923, "sampling/sampling_logp_difference/mean": 0.0035782578634098172, "step": 17010, "step_time": 5.156472689996008 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.002734375, "completions/max_length": 1413.2, "completions/max_terminated_length": 1040.6, "completions/mean_length": 161.84140625, "completions/mean_terminated_length": 156.7293273925781, "completions/min_length": 71.3, "completions/min_terminated_length": 71.3, "entropy": 0.037371314712800086, "epoch": 36.44539614561028, "frac_reward_zero_std": 0.93125, "grad_norm": 0.0, "learning_rate": 8.298100000000001e-06, "loss": -0.0089, "num_tokens": 1653351082.0, "reward": 1.0626562535762787, "reward_std": 0.14666605324018747, "rewards/reward_accuracy/mean": 0.962890625, "rewards/reward_accuracy/std": 0.14542350322008132, "rewards/reward_format/mean": 0.09976562485098839, "rewards/reward_format/std": 0.0026831001741811633, "sampling/importance_sampling_ratio/max": 2.3859476804733277, "sampling/importance_sampling_ratio/mean": 0.9955561637878418, "sampling/importance_sampling_ratio/min": 0.044393789023160934, "sampling/sampling_logp_difference/max": 1.150555384159088, "sampling/sampling_logp_difference/mean": 0.0038356140488758684, "step": 17020, "step_time": 6.6455835089902395 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005078125, "completions/max_length": 1458.0, "completions/max_terminated_length": 1268.4, "completions/mean_length": 158.598828125, "completions/mean_terminated_length": 149.0298309326172, "completions/min_length": 60.4, "completions/min_terminated_length": 60.4, "entropy": 0.039771976554766296, "epoch": 36.46680942184154, "frac_reward_zero_std": 0.9375, "grad_norm": 0.1513671875, "learning_rate": 8.2971e-06, "loss": -0.0041, "num_tokens": 1654271879.0, "reward": 1.061289083957672, "reward_std": 0.15683976858854293, "rewards/reward_accuracy/mean": 0.96171875, "rewards/reward_accuracy/std": 0.15503730177879332, "rewards/reward_format/mean": 0.09957031384110451, "rewards/reward_format/std": 0.004621500452049077, "sampling/importance_sampling_ratio/max": 2.5172146558761597, "sampling/importance_sampling_ratio/mean": 0.9808624982833862, "sampling/importance_sampling_ratio/min": 0.0670075623318553, "sampling/sampling_logp_difference/max": 0.9695408463478088, "sampling/sampling_logp_difference/mean": 0.003790439572185278, "step": 17030, "step_time": 7.246429920205264 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.002734375, "completions/max_length": 1275.5, "completions/max_terminated_length": 1169.1, "completions/mean_length": 146.88125, "completions/mean_terminated_length": 141.74279708862304, "completions/min_length": 64.2, "completions/min_terminated_length": 64.2, "entropy": 0.037290448090061545, "epoch": 36.4882226980728, "frac_reward_zero_std": 0.96875, "grad_norm": 0.0, "learning_rate": 8.2961e-06, "loss": -0.0016, "num_tokens": 1655161415.0, "reward": 1.0665234565734862, "reward_std": 0.14684032872319222, "rewards/reward_accuracy/mean": 0.966796875, "rewards/reward_accuracy/std": 0.145133812725544, "rewards/reward_format/mean": 0.09972656294703483, "rewards/reward_format/std": 0.002487065643072128, "sampling/importance_sampling_ratio/max": 2.4948240756988525, "sampling/importance_sampling_ratio/mean": 0.9907842457294465, "sampling/importance_sampling_ratio/min": 0.18625664785504342, "sampling/sampling_logp_difference/max": 1.202278983592987, "sampling/sampling_logp_difference/mean": 0.00371233238838613, "step": 17040, "step_time": 6.462979807300144 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003515625, "completions/max_length": 1280.9, "completions/max_terminated_length": 1249.0, "completions/mean_length": 149.4265625, "completions/mean_terminated_length": 142.7426986694336, "completions/min_length": 60.4, "completions/min_terminated_length": 60.4, "entropy": 0.03867158922366798, "epoch": 36.50963597430407, "frac_reward_zero_std": 0.90625, "grad_norm": 0.6640625, "learning_rate": 8.2951e-06, "loss": -0.0038, "num_tokens": 1656055211.0, "reward": 1.0629687547683715, "reward_std": 0.13966271982062609, "rewards/reward_accuracy/mean": 0.96328125, "rewards/reward_accuracy/std": 0.13830619677901268, "rewards/reward_format/mean": 0.09968750029802323, "rewards/reward_format/std": 0.0027658477891236545, "sampling/importance_sampling_ratio/max": 2.405160140991211, "sampling/importance_sampling_ratio/mean": 0.9873395264148712, "sampling/importance_sampling_ratio/min": 0.12078722603619099, "sampling/sampling_logp_difference/max": 1.0227676153182983, "sampling/sampling_logp_difference/mean": 0.004029661417007446, "step": 17050, "step_time": 6.081206371702137 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00234375, "completions/max_length": 1090.0, "completions/max_terminated_length": 904.5, "completions/mean_length": 145.88515625, "completions/mean_terminated_length": 141.4325958251953, "completions/min_length": 62.5, "completions/min_terminated_length": 62.5, "entropy": 0.036328899580985306, "epoch": 36.53104925053533, "frac_reward_zero_std": 0.94375, "grad_norm": 0.337890625, "learning_rate": 8.2941e-06, "loss": -0.0012, "num_tokens": 1656946405.0, "reward": 1.083105480670929, "reward_std": 0.0902577817440033, "rewards/reward_accuracy/mean": 0.983203125, "rewards/reward_accuracy/std": 0.08980262279510498, "rewards/reward_format/mean": 0.09990234449505805, "rewards/reward_format/std": 0.0013226743321865797, "sampling/importance_sampling_ratio/max": 2.4461857080459595, "sampling/importance_sampling_ratio/mean": 0.995442795753479, "sampling/importance_sampling_ratio/min": 0.18515627533197404, "sampling/sampling_logp_difference/max": 1.0429230809211731, "sampling/sampling_logp_difference/mean": 0.003748582396656275, "step": 17060, "step_time": 5.4439201353117825 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00234375, "completions/max_length": 1142.9, "completions/max_terminated_length": 1136.1, "completions/mean_length": 159.31484375, "completions/mean_terminated_length": 154.98826293945314, "completions/min_length": 70.0, "completions/min_terminated_length": 70.0, "entropy": 0.03822410139255226, "epoch": 36.5524625267666, "frac_reward_zero_std": 0.94375, "grad_norm": 0.0, "learning_rate": 8.2931e-06, "loss": -0.0072, "num_tokens": 1657884283.0, "reward": 1.0657812714576722, "reward_std": 0.14616535604000092, "rewards/reward_accuracy/mean": 0.966015625, "rewards/reward_accuracy/std": 0.14522664919495581, "rewards/reward_format/mean": 0.0997656263411045, "rewards/reward_format/std": 0.0015158477239310742, "sampling/importance_sampling_ratio/max": 2.4262857675552367, "sampling/importance_sampling_ratio/mean": 0.9994497299194336, "sampling/importance_sampling_ratio/min": 0.17626017332077026, "sampling/sampling_logp_difference/max": 1.1124844551086426, "sampling/sampling_logp_difference/mean": 0.003925882000476122, "step": 17070, "step_time": 5.654008382899337 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00078125, "completions/max_length": 905.0, "completions/max_terminated_length": 752.0, "completions/mean_length": 137.888671875, "completions/mean_terminated_length": 136.40493774414062, "completions/min_length": 64.5, "completions/min_terminated_length": 64.5, "entropy": 0.03556930697523057, "epoch": 36.57387580299786, "frac_reward_zero_std": 0.95, "grad_norm": 0.353515625, "learning_rate": 8.292100000000001e-06, "loss": -0.0006, "num_tokens": 1658756094.0, "reward": 1.069101583957672, "reward_std": 0.13145462945103645, "rewards/reward_accuracy/mean": 0.969140625, "rewards/reward_accuracy/std": 0.13100298643112182, "rewards/reward_format/mean": 0.0999609388411045, "rewards/reward_format/std": 0.0006250000558793544, "sampling/importance_sampling_ratio/max": 2.5155985713005067, "sampling/importance_sampling_ratio/mean": 0.9938471376895904, "sampling/importance_sampling_ratio/min": 0.0985710334032774, "sampling/sampling_logp_difference/max": 0.9992462635040283, "sampling/sampling_logp_difference/mean": 0.0039189182687550785, "step": 17080, "step_time": 4.539075492593111 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00078125, "completions/max_length": 1075.9, "completions/max_terminated_length": 980.6, "completions/mean_length": 145.892578125, "completions/mean_terminated_length": 144.4189453125, "completions/min_length": 64.3, "completions/min_terminated_length": 64.3, "entropy": 0.035543914511799814, "epoch": 36.59528907922912, "frac_reward_zero_std": 0.9375, "grad_norm": 0.0, "learning_rate": 8.291100000000001e-06, "loss": -0.0063, "num_tokens": 1659644347.0, "reward": 1.069824230670929, "reward_std": 0.13817696422338485, "rewards/reward_accuracy/mean": 0.969921875, "rewards/reward_accuracy/std": 0.13734295219182968, "rewards/reward_format/mean": 0.09990234449505805, "rewards/reward_format/std": 0.001562500116415322, "sampling/importance_sampling_ratio/max": 2.390057897567749, "sampling/importance_sampling_ratio/mean": 0.9966626822948456, "sampling/importance_sampling_ratio/min": 0.21511825025081635, "sampling/sampling_logp_difference/max": 0.8777547478675842, "sampling/sampling_logp_difference/mean": 0.0038092795526608824, "step": 17090, "step_time": 5.381065381178632 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001171875, "completions/max_length": 1068.2, "completions/max_terminated_length": 1029.3, "completions/mean_length": 155.273046875, "completions/mean_terminated_length": 153.0869400024414, "completions/min_length": 69.7, "completions/min_terminated_length": 69.7, "entropy": 0.03648603786714375, "epoch": 36.61670235546038, "frac_reward_zero_std": 0.96875, "grad_norm": 0.0, "learning_rate": 8.2901e-06, "loss": 0.001, "num_tokens": 1660559110.0, "reward": 1.0690234661102296, "reward_std": 0.12193958386778832, "rewards/reward_accuracy/mean": 0.969140625, "rewards/reward_accuracy/std": 0.12149148061871529, "rewards/reward_format/mean": 0.09988281428813935, "rewards/reward_format/std": 0.0015071487985551357, "sampling/importance_sampling_ratio/max": 2.672808575630188, "sampling/importance_sampling_ratio/mean": 0.9921915411949158, "sampling/importance_sampling_ratio/min": 0.10950253829360009, "sampling/sampling_logp_difference/max": 1.093976378440857, "sampling/sampling_logp_difference/mean": 0.003894804255105555, "step": 17100, "step_time": 5.303395372102386 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0015625, "completions/max_length": 1281.7, "completions/max_terminated_length": 791.2, "completions/mean_length": 146.93828125, "completions/mean_terminated_length": 143.96123962402345, "completions/min_length": 61.3, "completions/min_terminated_length": 61.3, "entropy": 0.039077860116958615, "epoch": 36.63811563169165, "frac_reward_zero_std": 0.94375, "grad_norm": 0.0908203125, "learning_rate": 8.289100000000002e-06, "loss": 0.0022, "num_tokens": 1661449336.0, "reward": 1.0792382955551147, "reward_std": 0.09695398837793619, "rewards/reward_accuracy/mean": 0.979296875, "rewards/reward_accuracy/std": 0.09601649418473243, "rewards/reward_format/mean": 0.09994140714406967, "rewards/reward_format/std": 0.0009375000605359674, "sampling/importance_sampling_ratio/max": 2.498087453842163, "sampling/importance_sampling_ratio/mean": 0.9905408084392547, "sampling/importance_sampling_ratio/min": 0.14092907086014747, "sampling/sampling_logp_difference/max": 1.0411601662635803, "sampling/sampling_logp_difference/mean": 0.004098052205517888, "step": 17110, "step_time": 6.049562750707264 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001953125, "completions/max_length": 1145.3, "completions/max_terminated_length": 1103.2, "completions/mean_length": 149.99609375, "completions/mean_terminated_length": 146.3893264770508, "completions/min_length": 66.5, "completions/min_terminated_length": 66.5, "entropy": 0.03714279739651829, "epoch": 36.65952890792291, "frac_reward_zero_std": 0.9125, "grad_norm": 0.451171875, "learning_rate": 8.288100000000001e-06, "loss": -0.0043, "num_tokens": 1662348142.0, "reward": 1.0880664229393004, "reward_std": 0.08311840072274208, "rewards/reward_accuracy/mean": 0.98828125, "rewards/reward_accuracy/std": 0.08222481235861778, "rewards/reward_format/mean": 0.09978515729308128, "rewards/reward_format/std": 0.0019039240200072528, "sampling/importance_sampling_ratio/max": 2.302826929092407, "sampling/importance_sampling_ratio/mean": 0.9854251265525817, "sampling/importance_sampling_ratio/min": 0.1326166344806552, "sampling/sampling_logp_difference/max": 0.8530317187309265, "sampling/sampling_logp_difference/mean": 0.003846322768367827, "step": 17120, "step_time": 5.7854515028040625 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.000390625, "completions/max_length": 687.3, "completions/max_terminated_length": 543.6, "completions/mean_length": 140.688671875, "completions/mean_terminated_length": 139.94416046142578, "completions/min_length": 73.7, "completions/min_terminated_length": 73.7, "entropy": 0.030649089650250972, "epoch": 36.680942184154176, "frac_reward_zero_std": 0.96875, "grad_norm": 0.1396484375, "learning_rate": 8.2871e-06, "loss": -0.0021, "num_tokens": 1663229089.0, "reward": 1.0851562738418579, "reward_std": 0.06931523829698563, "rewards/reward_accuracy/mean": 0.98515625, "rewards/reward_accuracy/std": 0.06931524276733399, "rewards/reward_format/mean": 0.10000000149011612, "rewards/reward_format/std": 0.0, "sampling/importance_sampling_ratio/max": 2.54150071144104, "sampling/importance_sampling_ratio/mean": 1.0017311215400695, "sampling/importance_sampling_ratio/min": 0.09499011039733887, "sampling/sampling_logp_difference/max": 1.0073742270469666, "sampling/sampling_logp_difference/mean": 0.003474831744097173, "step": 17130, "step_time": 3.5621364356891716 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 816.8, "completions/max_terminated_length": 816.8, "completions/mean_length": 136.6078125, "completions/mean_terminated_length": 136.6078125, "completions/min_length": 61.6, "completions/min_terminated_length": 61.6, "entropy": 0.03408970923628658, "epoch": 36.70235546038544, "frac_reward_zero_std": 0.9625, "grad_norm": 0.0, "learning_rate": 8.2861e-06, "loss": -0.0053, "num_tokens": 1664095637.0, "reward": 1.0890234589576722, "reward_std": 0.058588650077581406, "rewards/reward_accuracy/mean": 0.9890625, "rewards/reward_accuracy/std": 0.058294524997472764, "rewards/reward_format/mean": 0.09996093809604645, "rewards/reward_format/std": 0.0006250000093132258, "sampling/importance_sampling_ratio/max": 2.390671980381012, "sampling/importance_sampling_ratio/mean": 0.9973479568958282, "sampling/importance_sampling_ratio/min": 0.1768207333981991, "sampling/sampling_logp_difference/max": 1.0908993482589722, "sampling/sampling_logp_difference/mean": 0.003636231366544962, "step": 17140, "step_time": 4.118421878613299 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 1407.1, "completions/max_terminated_length": 1165.9, "completions/mean_length": 162.785546875, "completions/mean_terminated_length": 155.5310920715332, "completions/min_length": 63.4, "completions/min_terminated_length": 63.4, "entropy": 0.04070211336947978, "epoch": 36.723768736616705, "frac_reward_zero_std": 0.925, "grad_norm": 0.062255859375, "learning_rate": 8.2851e-06, "loss": -0.0, "num_tokens": 1665026880.0, "reward": 1.0578125238418579, "reward_std": 0.15249436125159263, "rewards/reward_accuracy/mean": 0.958203125, "rewards/reward_accuracy/std": 0.15101729929447175, "rewards/reward_format/mean": 0.09960937649011611, "rewards/reward_format/std": 0.003647996485233307, "sampling/importance_sampling_ratio/max": 2.3021372318267823, "sampling/importance_sampling_ratio/mean": 0.9845538079738617, "sampling/importance_sampling_ratio/min": 0.1075875809416175, "sampling/sampling_logp_difference/max": 0.9257954061031342, "sampling/sampling_logp_difference/mean": 0.0037276413757354023, "step": 17150, "step_time": 7.0354925299005115 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003515625, "completions/max_length": 1036.3, "completions/max_terminated_length": 911.4, "completions/mean_length": 160.23359375, "completions/mean_terminated_length": 153.60381622314452, "completions/min_length": 66.3, "completions/min_terminated_length": 66.3, "entropy": 0.03635999157559126, "epoch": 36.74518201284796, "frac_reward_zero_std": 0.93125, "grad_norm": 0.431640625, "learning_rate": 8.284100000000001e-06, "loss": -0.0068, "num_tokens": 1665959158.0, "reward": 1.0853125214576722, "reward_std": 0.09340935200452805, "rewards/reward_accuracy/mean": 0.985546875, "rewards/reward_accuracy/std": 0.0920293740928173, "rewards/reward_format/mean": 0.0997656263411045, "rewards/reward_format/std": 0.0020548264496028424, "sampling/importance_sampling_ratio/max": 2.408253288269043, "sampling/importance_sampling_ratio/mean": 0.9886627435684204, "sampling/importance_sampling_ratio/min": 0.09710734933614731, "sampling/sampling_logp_difference/max": 1.1360019326210022, "sampling/sampling_logp_difference/mean": 0.003796965954825282, "step": 17160, "step_time": 5.317850829297095 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001953125, "completions/max_length": 1234.5, "completions/max_terminated_length": 1100.8, "completions/mean_length": 152.606640625, "completions/mean_terminated_length": 148.92791595458985, "completions/min_length": 70.9, "completions/min_terminated_length": 70.9, "entropy": 0.03638518955558538, "epoch": 36.76659528907923, "frac_reward_zero_std": 0.925, "grad_norm": 0.0, "learning_rate": 8.2831e-06, "loss": -0.004, "num_tokens": 1666875175.0, "reward": 1.0822656393051147, "reward_std": 0.1051513247191906, "rewards/reward_accuracy/mean": 0.982421875, "rewards/reward_accuracy/std": 0.10399180352687835, "rewards/reward_format/mean": 0.09984375089406967, "rewards/reward_format/std": 0.0020762487081810834, "sampling/importance_sampling_ratio/max": 2.504425573348999, "sampling/importance_sampling_ratio/mean": 0.9960906565189361, "sampling/importance_sampling_ratio/min": 0.11315562576055527, "sampling/sampling_logp_difference/max": 1.1569079756736755, "sampling/sampling_logp_difference/mean": 0.0036108621396124365, "step": 17170, "step_time": 5.99232812669361 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003515625, "completions/max_length": 1051.4, "completions/max_terminated_length": 890.2, "completions/mean_length": 151.198046875, "completions/mean_terminated_length": 144.56801147460936, "completions/min_length": 58.9, "completions/min_terminated_length": 58.9, "entropy": 0.036883511627092955, "epoch": 36.78800856531049, "frac_reward_zero_std": 0.925, "grad_norm": 0.26171875, "learning_rate": 8.2821e-06, "loss": 0.0019, "num_tokens": 1667780290.0, "reward": 1.069238305091858, "reward_std": 0.1370521105825901, "rewards/reward_accuracy/mean": 0.96953125, "rewards/reward_accuracy/std": 0.13577400296926498, "rewards/reward_format/mean": 0.09970703274011612, "rewards/reward_format/std": 0.002786072762683034, "sampling/importance_sampling_ratio/max": 2.5396765232086183, "sampling/importance_sampling_ratio/mean": 0.9771266996860504, "sampling/importance_sampling_ratio/min": 0.10917413458228112, "sampling/sampling_logp_difference/max": 1.156593918800354, "sampling/sampling_logp_difference/mean": 0.0037082911003381014, "step": 17180, "step_time": 5.166250075984863 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 1666.7, "completions/max_terminated_length": 1254.4, "completions/mean_length": 155.24375, "completions/mean_terminated_length": 147.87504959106445, "completions/min_length": 64.9, "completions/min_terminated_length": 64.9, "entropy": 0.03854782555717975, "epoch": 36.809421841541756, "frac_reward_zero_std": 0.93125, "grad_norm": 0.0, "learning_rate": 8.281100000000001e-06, "loss": -0.0053, "num_tokens": 1668703378.0, "reward": 1.0617578148841857, "reward_std": 0.15766861587762832, "rewards/reward_accuracy/mean": 0.962109375, "rewards/reward_accuracy/std": 0.15634576976299286, "rewards/reward_format/mean": 0.09964843764901161, "rewards/reward_format/std": 0.0033908478450030088, "sampling/importance_sampling_ratio/max": 2.840210485458374, "sampling/importance_sampling_ratio/mean": 0.9858028411865234, "sampling/importance_sampling_ratio/min": 0.1194460573606193, "sampling/sampling_logp_difference/max": 1.0993701815605164, "sampling/sampling_logp_difference/mean": 0.003979932446964085, "step": 17190, "step_time": 7.877680866894662 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001953125, "completions/max_length": 1193.6, "completions/max_terminated_length": 952.3, "completions/mean_length": 151.4046875, "completions/mean_terminated_length": 147.7388900756836, "completions/min_length": 67.0, "completions/min_terminated_length": 67.0, "entropy": 0.03759072639513761, "epoch": 36.83083511777302, "frac_reward_zero_std": 0.94375, "grad_norm": 0.19140625, "learning_rate": 8.2801e-06, "loss": -0.0053, "num_tokens": 1669606446.0, "reward": 1.078808605670929, "reward_std": 0.10807892680168152, "rewards/reward_accuracy/mean": 0.97890625, "rewards/reward_accuracy/std": 0.10729465633630753, "rewards/reward_format/mean": 0.09990234449505805, "rewards/reward_format/std": 0.0013226743321865797, "sampling/importance_sampling_ratio/max": 2.4541747093200685, "sampling/importance_sampling_ratio/mean": 0.9872480928897858, "sampling/importance_sampling_ratio/min": 0.1161721320822835, "sampling/sampling_logp_difference/max": 0.9505824565887451, "sampling/sampling_logp_difference/mean": 0.004012912418693304, "step": 17200, "step_time": 5.85424451699073 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003515625, "completions/max_length": 984.0, "completions/max_terminated_length": 927.0, "completions/mean_length": 156.620703125, "completions/mean_terminated_length": 150.13172912597656, "completions/min_length": 66.5, "completions/min_terminated_length": 66.5, "entropy": 0.0374056106666103, "epoch": 36.852248394004285, "frac_reward_zero_std": 0.93125, "grad_norm": 0.0, "learning_rate": 8.279100000000002e-06, "loss": 0.0028, "num_tokens": 1670526323.0, "reward": 1.061035168170929, "reward_std": 0.1578659877181053, "rewards/reward_accuracy/mean": 0.961328125, "rewards/reward_accuracy/std": 0.15637051910161973, "rewards/reward_format/mean": 0.09970703199505807, "rewards/reward_format/std": 0.0023872296558693053, "sampling/importance_sampling_ratio/max": 2.4646922945976257, "sampling/importance_sampling_ratio/mean": 0.9811775922775269, "sampling/importance_sampling_ratio/min": 0.15516735129058362, "sampling/sampling_logp_difference/max": 0.9793354511260987, "sampling/sampling_logp_difference/mean": 0.003750620409846306, "step": 17210, "step_time": 5.031865964300232 }, { "clip_ratio/high_max": 1.4106271555647254e-05, "clip_ratio/high_mean": 1.7632839444559067e-06, "clip_ratio/low_mean": 2.90873233552702e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 4.672016348195029e-06, "completions/clipped_ratio": 0.0125, "completions/max_length": 1443.4, "completions/max_terminated_length": 1180.5, "completions/mean_length": 180.326953125, "completions/mean_terminated_length": 156.90660400390624, "completions/min_length": 65.4, "completions/min_terminated_length": 65.4, "entropy": 0.047154431627131996, "epoch": 36.87366167023555, "frac_reward_zero_std": 0.90625, "grad_norm": 0.80078125, "learning_rate": 8.278100000000001e-06, "loss": -0.0034, "num_tokens": 1671512920.0, "reward": 1.0478906393051148, "reward_std": 0.19146788716316224, "rewards/reward_accuracy/mean": 0.948828125, "rewards/reward_accuracy/std": 0.18800097852945327, "rewards/reward_format/mean": 0.09906250089406968, "rewards/reward_format/std": 0.006035793689079583, "sampling/importance_sampling_ratio/max": 2.665428614616394, "sampling/importance_sampling_ratio/mean": 0.9828044652938843, "sampling/importance_sampling_ratio/min": 0.10971103087067605, "sampling/sampling_logp_difference/max": 1.2388720631599426, "sampling/sampling_logp_difference/mean": 0.004170396272093058, "step": 17220, "step_time": 7.43489915910759 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0078125, "completions/max_length": 1719.6, "completions/max_terminated_length": 1489.9, "completions/mean_length": 177.556640625, "completions/mean_terminated_length": 163.00500946044923, "completions/min_length": 66.5, "completions/min_terminated_length": 66.5, "entropy": 0.048309897421859205, "epoch": 36.895074946466806, "frac_reward_zero_std": 0.925, "grad_norm": 0.0771484375, "learning_rate": 8.2771e-06, "loss": -0.0036, "num_tokens": 1672482457.0, "reward": 1.0702343821525573, "reward_std": 0.13922830000519754, "rewards/reward_accuracy/mean": 0.970703125, "rewards/reward_accuracy/std": 0.1373604416847229, "rewards/reward_format/mean": 0.09953124970197677, "rewards/reward_format/std": 0.004136061132885516, "sampling/importance_sampling_ratio/max": 2.56700336933136, "sampling/importance_sampling_ratio/mean": 0.977234947681427, "sampling/importance_sampling_ratio/min": 0.07759157493710518, "sampling/sampling_logp_difference/max": 1.3099196016788484, "sampling/sampling_logp_difference/mean": 0.004079878586344421, "step": 17230, "step_time": 8.644456851901486 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003125, "completions/max_length": 1271.4, "completions/max_terminated_length": 1227.8, "completions/mean_length": 158.69140625, "completions/mean_terminated_length": 152.8680389404297, "completions/min_length": 66.8, "completions/min_terminated_length": 66.8, "entropy": 0.040747201163321735, "epoch": 36.91648822269807, "frac_reward_zero_std": 0.94375, "grad_norm": 0.0, "learning_rate": 8.2761e-06, "loss": -0.0011, "num_tokens": 1673404291.0, "reward": 1.0610937595367431, "reward_std": 0.14532053992152213, "rewards/reward_accuracy/mean": 0.961328125, "rewards/reward_accuracy/std": 0.1444932483136654, "rewards/reward_format/mean": 0.09976562559604644, "rewards/reward_format/std": 0.0022298872703686357, "sampling/importance_sampling_ratio/max": 2.4993215918540956, "sampling/importance_sampling_ratio/mean": 0.9836537599563598, "sampling/importance_sampling_ratio/min": 0.11817399710416794, "sampling/sampling_logp_difference/max": 0.9379723846912384, "sampling/sampling_logp_difference/mean": 0.003884970489889383, "step": 17240, "step_time": 6.338061356186517 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.004296875, "completions/max_length": 1418.7, "completions/max_terminated_length": 1095.2, "completions/mean_length": 164.644140625, "completions/mean_terminated_length": 156.64005126953126, "completions/min_length": 65.5, "completions/min_terminated_length": 65.5, "entropy": 0.040637789154425265, "epoch": 36.937901498929335, "frac_reward_zero_std": 0.91875, "grad_norm": 1.0078125, "learning_rate": 8.2751e-06, "loss": -0.0115, "num_tokens": 1674343668.0, "reward": 1.0766992330551148, "reward_std": 0.12311619967222213, "rewards/reward_accuracy/mean": 0.976953125, "rewards/reward_accuracy/std": 0.12183539867401123, "rewards/reward_format/mean": 0.09974609538912774, "rewards/reward_format/std": 0.0022761271568015216, "sampling/importance_sampling_ratio/max": 2.4237672448158265, "sampling/importance_sampling_ratio/mean": 0.980530071258545, "sampling/importance_sampling_ratio/min": 0.05507344603538513, "sampling/sampling_logp_difference/max": 0.9953556776046752, "sampling/sampling_logp_difference/mean": 0.0038464025361463427, "step": 17250, "step_time": 6.902131848593126 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00234375, "completions/max_length": 1119.8, "completions/max_terminated_length": 789.1, "completions/mean_length": 140.31484375, "completions/mean_terminated_length": 135.86816864013673, "completions/min_length": 60.7, "completions/min_terminated_length": 60.7, "entropy": 0.03148098574019968, "epoch": 36.9593147751606, "frac_reward_zero_std": 0.95625, "grad_norm": 0.0, "learning_rate": 8.274100000000001e-06, "loss": -0.0042, "num_tokens": 1675214986.0, "reward": 1.0791406452655792, "reward_std": 0.08320600986480713, "rewards/reward_accuracy/mean": 0.979296875, "rewards/reward_accuracy/std": 0.08258519321680069, "rewards/reward_format/mean": 0.09984375089406967, "rewards/reward_format/std": 0.0017032783478498458, "sampling/importance_sampling_ratio/max": 2.4325836896896362, "sampling/importance_sampling_ratio/mean": 0.9992759466171265, "sampling/importance_sampling_ratio/min": 0.215669996291399, "sampling/sampling_logp_difference/max": 1.0062005281448365, "sampling/sampling_logp_difference/mean": 0.0033112884499132632, "step": 17260, "step_time": 5.571213839593111 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003515625, "completions/max_length": 861.2, "completions/max_terminated_length": 641.3, "completions/mean_length": 141.296484375, "completions/mean_terminated_length": 134.79827423095702, "completions/min_length": 62.7, "completions/min_terminated_length": 62.7, "entropy": 0.03714139463845641, "epoch": 36.980728051391864, "frac_reward_zero_std": 0.9625, "grad_norm": 0.0, "learning_rate": 8.2731e-06, "loss": -0.0032, "num_tokens": 1676089745.0, "reward": 1.0813281416893006, "reward_std": 0.07227774858474731, "rewards/reward_accuracy/mean": 0.981640625, "rewards/reward_accuracy/std": 0.07095524892210961, "rewards/reward_format/mean": 0.09968750104308129, "rewards/reward_format/std": 0.0026304484345018864, "sampling/importance_sampling_ratio/max": 2.4219041228294373, "sampling/importance_sampling_ratio/mean": 0.984196150302887, "sampling/importance_sampling_ratio/min": 0.12312453836202622, "sampling/sampling_logp_difference/max": 1.1365147829055786, "sampling/sampling_logp_difference/mean": 0.003861013241112232, "step": 17270, "step_time": 4.636676445280318 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.000390625, "completions/max_length": 1151.8, "completions/max_terminated_length": 1136.2, "completions/mean_length": 153.9125, "completions/mean_terminated_length": 153.18356018066407, "completions/min_length": 66.3, "completions/min_terminated_length": 66.3, "entropy": 0.03614345300011337, "epoch": 37.00214132762313, "frac_reward_zero_std": 0.95, "grad_norm": 0.0, "learning_rate": 8.2721e-06, "loss": 0.0028, "num_tokens": 1677003377.0, "reward": 1.0651562690734864, "reward_std": 0.13089523762464522, "rewards/reward_accuracy/mean": 0.965234375, "rewards/reward_accuracy/std": 0.13057180047035216, "rewards/reward_format/mean": 0.09992187619209289, "rewards/reward_format/std": 0.001010174280963838, "sampling/importance_sampling_ratio/max": 2.5275142908096315, "sampling/importance_sampling_ratio/mean": 0.9900073766708374, "sampling/importance_sampling_ratio/min": 0.11295253373682498, "sampling/sampling_logp_difference/max": 1.2977279722690582, "sampling/sampling_logp_difference/mean": 0.0036860945634543895, "step": 17280, "step_time": 5.823213632291299 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.000390625, "completions/max_length": 746.2, "completions/max_terminated_length": 636.4, "completions/mean_length": 138.325, "completions/mean_terminated_length": 137.5866912841797, "completions/min_length": 63.6, "completions/min_terminated_length": 63.6, "entropy": 0.030357306986115874, "epoch": 37.02355460385439, "frac_reward_zero_std": 0.95625, "grad_norm": 0.1982421875, "learning_rate": 8.271100000000001e-06, "loss": -0.0052, "num_tokens": 1677877361.0, "reward": 1.097265648841858, "reward_std": 0.03639297336339951, "rewards/reward_accuracy/mean": 0.997265625, "rewards/reward_accuracy/std": 0.03639297336339951, "rewards/reward_format/mean": 0.10000000149011612, "rewards/reward_format/std": 0.0, "sampling/importance_sampling_ratio/max": 2.509897768497467, "sampling/importance_sampling_ratio/mean": 0.996073055267334, "sampling/importance_sampling_ratio/min": 0.22899780459702015, "sampling/sampling_logp_difference/max": 0.9582019150257111, "sampling/sampling_logp_difference/mean": 0.00335601232945919, "step": 17290, "step_time": 3.7673478122800588 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001171875, "completions/max_length": 1014.9, "completions/max_terminated_length": 838.7, "completions/mean_length": 139.997265625, "completions/mean_terminated_length": 137.75748977661132, "completions/min_length": 66.7, "completions/min_terminated_length": 66.7, "entropy": 0.03179299151524902, "epoch": 37.04496788008565, "frac_reward_zero_std": 0.9375, "grad_norm": 0.2236328125, "learning_rate": 8.2701e-06, "loss": 0.0004, "num_tokens": 1678748778.0, "reward": 1.0772265791893005, "reward_std": 0.0981633186340332, "rewards/reward_accuracy/mean": 0.97734375, "rewards/reward_accuracy/std": 0.09687739014625549, "rewards/reward_format/mean": 0.09988281354308129, "rewards/reward_format/std": 0.0016351743834093213, "sampling/importance_sampling_ratio/max": 2.4220149517059326, "sampling/importance_sampling_ratio/mean": 0.9937459766864777, "sampling/importance_sampling_ratio/min": 0.185369835793972, "sampling/sampling_logp_difference/max": 1.0076110303401946, "sampling/sampling_logp_difference/mean": 0.003556184773333371, "step": 17300, "step_time": 5.056093368888833 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00078125, "completions/max_length": 705.3, "completions/max_terminated_length": 670.9, "completions/mean_length": 141.319921875, "completions/mean_terminated_length": 139.87212371826172, "completions/min_length": 62.9, "completions/min_terminated_length": 62.9, "entropy": 0.03514936645515263, "epoch": 37.066381156316915, "frac_reward_zero_std": 0.94375, "grad_norm": 0.7421875, "learning_rate": 8.269100000000002e-06, "loss": 0.0003, "num_tokens": 1679623373.0, "reward": 1.089414083957672, "reward_std": 0.07415991947054863, "rewards/reward_accuracy/mean": 0.989453125, "rewards/reward_accuracy/std": 0.07400080561637878, "rewards/reward_format/mean": 0.0999609388411045, "rewards/reward_format/std": 0.0006250000558793544, "sampling/importance_sampling_ratio/max": 2.5152835488319396, "sampling/importance_sampling_ratio/mean": 0.9841496109962463, "sampling/importance_sampling_ratio/min": 0.12821442484855652, "sampling/sampling_logp_difference/max": 1.414483892917633, "sampling/sampling_logp_difference/mean": 0.003964057238772511, "step": 17310, "step_time": 3.8009893837966957 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001953125, "completions/max_length": 1301.0, "completions/max_terminated_length": 891.7, "completions/mean_length": 140.53203125, "completions/mean_terminated_length": 136.80176391601563, "completions/min_length": 65.9, "completions/min_terminated_length": 65.9, "entropy": 0.03382158984895796, "epoch": 37.08779443254818, "frac_reward_zero_std": 0.9625, "grad_norm": 0.1044921875, "learning_rate": 8.268100000000001e-06, "loss": -0.0015, "num_tokens": 1680502047.0, "reward": 1.0865625262260437, "reward_std": 0.08080676272511482, "rewards/reward_accuracy/mean": 0.98671875, "rewards/reward_accuracy/std": 0.07883507385849953, "rewards/reward_format/mean": 0.09984375163912773, "rewards/reward_format/std": 0.0020129600539803504, "sampling/importance_sampling_ratio/max": 2.5258668422698975, "sampling/importance_sampling_ratio/mean": 0.990731418132782, "sampling/importance_sampling_ratio/min": 0.19932899624109268, "sampling/sampling_logp_difference/max": 0.9734511852264405, "sampling/sampling_logp_difference/mean": 0.0037323614582419396, "step": 17320, "step_time": 6.119291465706192 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005078125, "completions/max_length": 1086.5, "completions/max_terminated_length": 968.2, "completions/mean_length": 149.821484375, "completions/mean_terminated_length": 140.26180419921874, "completions/min_length": 65.7, "completions/min_terminated_length": 65.7, "entropy": 0.03720725756138563, "epoch": 37.109207708779444, "frac_reward_zero_std": 0.94375, "grad_norm": 0.40625, "learning_rate": 8.267100000000001e-06, "loss": -0.0066, "num_tokens": 1681403734.0, "reward": 1.0714258015155793, "reward_std": 0.11854810193181038, "rewards/reward_accuracy/mean": 0.971875, "rewards/reward_accuracy/std": 0.11656470969319344, "rewards/reward_format/mean": 0.0995507813990116, "rewards/reward_format/std": 0.003493543271906674, "sampling/importance_sampling_ratio/max": 2.411083149909973, "sampling/importance_sampling_ratio/mean": 0.9989332795143128, "sampling/importance_sampling_ratio/min": 0.10096452236175538, "sampling/sampling_logp_difference/max": 0.8836498200893402, "sampling/sampling_logp_difference/mean": 0.003796548000536859, "step": 17330, "step_time": 5.608761514499202 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.009375, "completions/max_length": 1430.6, "completions/max_terminated_length": 1093.2, "completions/mean_length": 170.737109375, "completions/mean_terminated_length": 153.1694763183594, "completions/min_length": 64.0, "completions/min_terminated_length": 64.0, "entropy": 0.04225459115114063, "epoch": 37.13062098501071, "frac_reward_zero_std": 0.93125, "grad_norm": 0.2353515625, "learning_rate": 8.2661e-06, "loss": -0.0068, "num_tokens": 1682358901.0, "reward": 1.0575390875339508, "reward_std": 0.17237160727381706, "rewards/reward_accuracy/mean": 0.958203125, "rewards/reward_accuracy/std": 0.16974786669015884, "rewards/reward_format/mean": 0.09933593794703484, "rewards/reward_format/std": 0.004886298021301627, "sampling/importance_sampling_ratio/max": 2.596054196357727, "sampling/importance_sampling_ratio/mean": 0.978290218114853, "sampling/importance_sampling_ratio/min": 0.06933320630341769, "sampling/sampling_logp_difference/max": 1.262159913778305, "sampling/sampling_logp_difference/mean": 0.003913385770283639, "step": 17340, "step_time": 7.194087419201969 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0015625, "completions/max_length": 937.3, "completions/max_terminated_length": 805.3, "completions/mean_length": 147.615625, "completions/mean_terminated_length": 144.6868637084961, "completions/min_length": 62.3, "completions/min_terminated_length": 62.3, "entropy": 0.03330528517253697, "epoch": 37.15203426124197, "frac_reward_zero_std": 0.94375, "grad_norm": 0.1044921875, "learning_rate": 8.2651e-06, "loss": -0.0032, "num_tokens": 1683258973.0, "reward": 1.0827539205551147, "reward_std": 0.0778868566500023, "rewards/reward_accuracy/mean": 0.9828125, "rewards/reward_accuracy/std": 0.07743302211165429, "rewards/reward_format/mean": 0.09994140714406967, "rewards/reward_format/std": 0.0009375000605359674, "sampling/importance_sampling_ratio/max": 2.379735863208771, "sampling/importance_sampling_ratio/mean": 0.9887044966220856, "sampling/importance_sampling_ratio/min": 0.1595401745289564, "sampling/sampling_logp_difference/max": 0.8792152345180512, "sampling/sampling_logp_difference/mean": 0.0034371944377198814, "step": 17350, "step_time": 4.7954618477146145 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001953125, "completions/max_length": 1105.5, "completions/max_terminated_length": 1043.6, "completions/mean_length": 146.717578125, "completions/mean_terminated_length": 143.02025146484374, "completions/min_length": 66.1, "completions/min_terminated_length": 66.1, "entropy": 0.036494726710952816, "epoch": 37.17344753747324, "frac_reward_zero_std": 0.94375, "grad_norm": 0.0, "learning_rate": 8.264100000000001e-06, "loss": -0.0033, "num_tokens": 1684145690.0, "reward": 1.0611718893051147, "reward_std": 0.11920133978128433, "rewards/reward_accuracy/mean": 0.961328125, "rewards/reward_accuracy/std": 0.1188714049756527, "rewards/reward_format/mean": 0.09984375014901162, "rewards/reward_format/std": 0.0018717264058068395, "sampling/importance_sampling_ratio/max": 2.7716023921966553, "sampling/importance_sampling_ratio/mean": 0.9912648856639862, "sampling/importance_sampling_ratio/min": 0.15025479197502137, "sampling/sampling_logp_difference/max": 0.9307545781135559, "sampling/sampling_logp_difference/mean": 0.0039615572663024064, "step": 17360, "step_time": 5.348896937427344 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.006640625, "completions/max_length": 1567.1, "completions/max_terminated_length": 1311.4, "completions/mean_length": 168.471484375, "completions/mean_terminated_length": 156.12876586914064, "completions/min_length": 62.9, "completions/min_terminated_length": 62.9, "entropy": 0.041598477470688525, "epoch": 37.194860813704494, "frac_reward_zero_std": 0.925, "grad_norm": 0.0, "learning_rate": 8.2631e-06, "loss": -0.0091, "num_tokens": 1685096913.0, "reward": 1.0536718845367432, "reward_std": 0.15800219923257827, "rewards/reward_accuracy/mean": 0.954296875, "rewards/reward_accuracy/std": 0.15505429729819298, "rewards/reward_format/mean": 0.09937500059604645, "rewards/reward_format/std": 0.0056624005548655985, "sampling/importance_sampling_ratio/max": 2.4480199813842773, "sampling/importance_sampling_ratio/mean": 0.9819984376430512, "sampling/importance_sampling_ratio/min": 0.07902534604072571, "sampling/sampling_logp_difference/max": 0.9924896240234375, "sampling/sampling_logp_difference/mean": 0.004058981174603104, "step": 17370, "step_time": 7.38133968768525 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 817.8, "completions/max_terminated_length": 817.8, "completions/mean_length": 138.514453125, "completions/mean_terminated_length": 138.514453125, "completions/min_length": 67.0, "completions/min_terminated_length": 67.0, "entropy": 0.030976234935224056, "epoch": 37.21627408993576, "frac_reward_zero_std": 0.98125, "grad_norm": 0.0, "learning_rate": 8.2621e-06, "loss": -0.0023, "num_tokens": 1685966934.0, "reward": 1.0675781488418579, "reward_std": 0.12096884772181511, "rewards/reward_accuracy/mean": 0.967578125, "rewards/reward_accuracy/std": 0.12096885219216347, "rewards/reward_format/mean": 0.10000000149011612, "rewards/reward_format/std": 0.0, "sampling/importance_sampling_ratio/max": 2.433612644672394, "sampling/importance_sampling_ratio/mean": 0.9841935634613037, "sampling/importance_sampling_ratio/min": 0.1833546683192253, "sampling/sampling_logp_difference/max": 1.1916334271430968, "sampling/sampling_logp_difference/mean": 0.003613804467022419, "step": 17380, "step_time": 4.226271302686655 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.009375, "completions/max_length": 1228.4, "completions/max_terminated_length": 802.4, "completions/mean_length": 165.961328125, "completions/mean_terminated_length": 148.51888122558594, "completions/min_length": 65.6, "completions/min_terminated_length": 65.6, "entropy": 0.04037524042651057, "epoch": 37.23768736616702, "frac_reward_zero_std": 0.925, "grad_norm": 0.6171875, "learning_rate": 8.261100000000001e-06, "loss": -0.0018, "num_tokens": 1686917123.0, "reward": 1.064550805091858, "reward_std": 0.11567025035619735, "rewards/reward_accuracy/mean": 0.965234375, "rewards/reward_accuracy/std": 0.11387608796358109, "rewards/reward_format/mean": 0.09931640774011612, "rewards/reward_format/std": 0.0031230305321514606, "sampling/importance_sampling_ratio/max": 2.321583294868469, "sampling/importance_sampling_ratio/mean": 0.9823273241519928, "sampling/importance_sampling_ratio/min": 0.1251470696181059, "sampling/sampling_logp_difference/max": 0.9099372506141663, "sampling/sampling_logp_difference/mean": 0.0038255035178735852, "step": 17390, "step_time": 6.015936276898719 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 1308.9, "completions/max_terminated_length": 1036.0, "completions/mean_length": 154.394140625, "completions/mean_terminated_length": 147.04397583007812, "completions/min_length": 62.0, "completions/min_terminated_length": 62.0, "entropy": 0.03981123950798064, "epoch": 37.25910064239829, "frac_reward_zero_std": 0.90625, "grad_norm": 1.15625, "learning_rate": 8.2601e-06, "loss": -0.0015, "num_tokens": 1687826996.0, "reward": 1.0606445670127869, "reward_std": 0.14741346165537833, "rewards/reward_accuracy/mean": 0.9609375, "rewards/reward_accuracy/std": 0.14632000923156738, "rewards/reward_format/mean": 0.09970703348517418, "rewards/reward_format/std": 0.0025575154460966585, "sampling/importance_sampling_ratio/max": 2.387849545478821, "sampling/importance_sampling_ratio/mean": 0.9930152714252471, "sampling/importance_sampling_ratio/min": 0.12419379390776157, "sampling/sampling_logp_difference/max": 0.9156295776367187, "sampling/sampling_logp_difference/mean": 0.003882711986079812, "step": 17400, "step_time": 6.336218408102286 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.002734375, "completions/max_length": 862.3, "completions/max_terminated_length": 851.2, "completions/mean_length": 147.939453125, "completions/mean_terminated_length": 142.84150238037108, "completions/min_length": 64.3, "completions/min_terminated_length": 64.3, "entropy": 0.03462249604053795, "epoch": 37.28051391862955, "frac_reward_zero_std": 0.925, "grad_norm": 1.140625, "learning_rate": 8.2591e-06, "loss": -0.0052, "num_tokens": 1688723033.0, "reward": 1.0755468964576722, "reward_std": 0.11447896733880043, "rewards/reward_accuracy/mean": 0.97578125, "rewards/reward_accuracy/std": 0.1134743221104145, "rewards/reward_format/mean": 0.0997656263411045, "rewards/reward_format/std": 0.0020614393055438996, "sampling/importance_sampling_ratio/max": 2.5567697286605835, "sampling/importance_sampling_ratio/mean": 0.9814333319664001, "sampling/importance_sampling_ratio/min": 0.20567349940538407, "sampling/sampling_logp_difference/max": 1.003773581981659, "sampling/sampling_logp_difference/mean": 0.0038596568629145622, "step": 17410, "step_time": 4.611153523795656 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001953125, "completions/max_length": 957.0, "completions/max_terminated_length": 889.1, "completions/mean_length": 149.618359375, "completions/mean_terminated_length": 145.9659896850586, "completions/min_length": 63.7, "completions/min_terminated_length": 63.7, "entropy": 0.03954408566933125, "epoch": 37.301927194860816, "frac_reward_zero_std": 0.96875, "grad_norm": 0.0, "learning_rate": 8.258100000000001e-06, "loss": -0.0029, "num_tokens": 1689620728.0, "reward": 1.0775586187839508, "reward_std": 0.08190464451909066, "rewards/reward_accuracy/mean": 0.977734375, "rewards/reward_accuracy/std": 0.08110087737441063, "rewards/reward_format/mean": 0.09982422068715095, "rewards/reward_format/std": 0.00208563432097435, "sampling/importance_sampling_ratio/max": 2.5637996196746826, "sampling/importance_sampling_ratio/mean": 0.9856291949748993, "sampling/importance_sampling_ratio/min": 0.152293062210083, "sampling/sampling_logp_difference/max": 0.9705824851989746, "sampling/sampling_logp_difference/mean": 0.004004375613294542, "step": 17420, "step_time": 4.9714009387942495 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001953125, "completions/max_length": 1350.7, "completions/max_terminated_length": 991.4, "completions/mean_length": 156.005859375, "completions/mean_terminated_length": 152.30741271972656, "completions/min_length": 65.4, "completions/min_terminated_length": 65.4, "entropy": 0.03667991873808205, "epoch": 37.323340471092074, "frac_reward_zero_std": 0.9375, "grad_norm": 0.2470703125, "learning_rate": 8.257100000000001e-06, "loss": -0.0056, "num_tokens": 1690542759.0, "reward": 1.0662695288658142, "reward_std": 0.13849776312708856, "rewards/reward_accuracy/mean": 0.96640625, "rewards/reward_accuracy/std": 0.1376886285841465, "rewards/reward_format/mean": 0.09986328110098838, "rewards/reward_format/std": 0.0021875001257285476, "sampling/importance_sampling_ratio/max": 2.5367436170578004, "sampling/importance_sampling_ratio/mean": 0.9897383630275727, "sampling/importance_sampling_ratio/min": 0.11700916104018688, "sampling/sampling_logp_difference/max": 1.009674859046936, "sampling/sampling_logp_difference/mean": 0.0038382849190384148, "step": 17430, "step_time": 6.29731653239578 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 772.7, "completions/max_terminated_length": 772.7, "completions/mean_length": 133.567578125, "completions/mean_terminated_length": 133.567578125, "completions/min_length": 69.4, "completions/min_terminated_length": 69.4, "entropy": 0.030218291003257035, "epoch": 37.34475374732334, "frac_reward_zero_std": 0.96875, "grad_norm": 0.0, "learning_rate": 8.2561e-06, "loss": 0.0016, "num_tokens": 1691398756.0, "reward": 1.091406273841858, "reward_std": 0.054396535456180575, "rewards/reward_accuracy/mean": 0.99140625, "rewards/reward_accuracy/std": 0.05439653694629669, "rewards/reward_format/mean": 0.10000000149011612, "rewards/reward_format/std": 0.0, "sampling/importance_sampling_ratio/max": 2.456720006465912, "sampling/importance_sampling_ratio/mean": 0.9965405285358429, "sampling/importance_sampling_ratio/min": 0.22018914222717284, "sampling/sampling_logp_difference/max": 0.8601956069469452, "sampling/sampling_logp_difference/mean": 0.003531132242642343, "step": 17440, "step_time": 4.020725980988937 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.003125, "completions/max_length": 1082.4, "completions/max_terminated_length": 1025.4, "completions/mean_length": 160.57734375, "completions/mean_terminated_length": 154.73056335449218, "completions/min_length": 63.3, "completions/min_terminated_length": 63.3, "entropy": 0.043271939759142695, "epoch": 37.3661670235546, "frac_reward_zero_std": 0.95, "grad_norm": 0.265625, "learning_rate": 8.2551e-06, "loss": 0.0001, "num_tokens": 1692327946.0, "reward": 1.073984396457672, "reward_std": 0.11353397518396377, "rewards/reward_accuracy/mean": 0.97421875, "rewards/reward_accuracy/std": 0.1127819374203682, "rewards/reward_format/mean": 0.0997656263411045, "rewards/reward_format/std": 0.002156556583940983, "sampling/importance_sampling_ratio/max": 2.5148208379745483, "sampling/importance_sampling_ratio/mean": 0.9863678038120269, "sampling/importance_sampling_ratio/min": 0.08524537284392864, "sampling/sampling_logp_difference/max": 1.0103930830955505, "sampling/sampling_logp_difference/mean": 0.004005987802520395, "step": 17450, "step_time": 5.583142573508667 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00546875, "completions/max_length": 1140.7, "completions/max_terminated_length": 1096.9, "completions/mean_length": 161.547265625, "completions/mean_terminated_length": 151.30254211425782, "completions/min_length": 64.9, "completions/min_terminated_length": 64.9, "entropy": 0.04085614494979382, "epoch": 37.38758029978587, "frac_reward_zero_std": 0.95625, "grad_norm": 0.0, "learning_rate": 8.254100000000001e-06, "loss": -0.0047, "num_tokens": 1693260371.0, "reward": 1.0750195622444152, "reward_std": 0.11686961352825165, "rewards/reward_accuracy/mean": 0.975390625, "rewards/reward_accuracy/std": 0.11521074995398521, "rewards/reward_format/mean": 0.09962890818715095, "rewards/reward_format/std": 0.003144233766943216, "sampling/importance_sampling_ratio/max": 2.3925825119018556, "sampling/importance_sampling_ratio/mean": 0.9905248939990997, "sampling/importance_sampling_ratio/min": 0.18846278823912144, "sampling/sampling_logp_difference/max": 0.9754943192005158, "sampling/sampling_logp_difference/mean": 0.0038275557104498147, "step": 17460, "step_time": 5.776656303388881 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.006640625, "completions/max_length": 1745.2, "completions/max_terminated_length": 1485.6, "completions/mean_length": 173.705859375, "completions/mean_terminated_length": 161.40840759277344, "completions/min_length": 63.8, "completions/min_terminated_length": 63.8, "entropy": 0.044704304356127975, "epoch": 37.40899357601713, "frac_reward_zero_std": 0.9125, "grad_norm": 0.123046875, "learning_rate": 8.2531e-06, "loss": -0.0043, "num_tokens": 1694226594.0, "reward": 1.048613291978836, "reward_std": 0.1858178623020649, "rewards/reward_accuracy/mean": 0.94921875, "rewards/reward_accuracy/std": 0.1832251287996769, "rewards/reward_format/mean": 0.09939453154802322, "rewards/reward_format/std": 0.004686146159656346, "sampling/importance_sampling_ratio/max": 2.411776542663574, "sampling/importance_sampling_ratio/mean": 0.9825144350528717, "sampling/importance_sampling_ratio/min": 0.08649432472884655, "sampling/sampling_logp_difference/max": 0.9522940516471863, "sampling/sampling_logp_difference/mean": 0.00417980900965631, "step": 17470, "step_time": 8.23940601379727 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0046875, "completions/max_length": 1542.5, "completions/max_terminated_length": 1270.4, "completions/mean_length": 172.70390625, "completions/mean_terminated_length": 163.94646530151368, "completions/min_length": 66.7, "completions/min_terminated_length": 66.7, "entropy": 0.04375751700717956, "epoch": 37.430406852248396, "frac_reward_zero_std": 0.9125, "grad_norm": 0.173828125, "learning_rate": 8.2521e-06, "loss": -0.0062, "num_tokens": 1695188972.0, "reward": 1.0526172041893005, "reward_std": 0.1693673207424581, "rewards/reward_accuracy/mean": 0.953125, "rewards/reward_accuracy/std": 0.16635413765907286, "rewards/reward_format/mean": 0.09949218854308128, "rewards/reward_format/std": 0.0045461358269676564, "sampling/importance_sampling_ratio/max": 2.6265961170196532, "sampling/importance_sampling_ratio/mean": 0.9898793578147889, "sampling/importance_sampling_ratio/min": 0.0781846821308136, "sampling/sampling_logp_difference/max": 1.0049745678901671, "sampling/sampling_logp_difference/mean": 0.004069277993403375, "step": 17480, "step_time": 7.360269370593596 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005078125, "completions/max_length": 1267.6, "completions/max_terminated_length": 1045.8, "completions/mean_length": 155.2640625, "completions/mean_terminated_length": 145.67872161865233, "completions/min_length": 65.9, "completions/min_terminated_length": 65.9, "entropy": 0.03696892904117703, "epoch": 37.45182012847966, "frac_reward_zero_std": 0.925, "grad_norm": 0.0, "learning_rate": 8.251100000000001e-06, "loss": -0.0088, "num_tokens": 1696094416.0, "reward": 1.0741601586341858, "reward_std": 0.11568283960223198, "rewards/reward_accuracy/mean": 0.974609375, "rewards/reward_accuracy/std": 0.113650643825531, "rewards/reward_format/mean": 0.09955078214406968, "rewards/reward_format/std": 0.003731536399573088, "sampling/importance_sampling_ratio/max": 2.389391827583313, "sampling/importance_sampling_ratio/mean": 0.9826786935329437, "sampling/importance_sampling_ratio/min": 0.19807718452066184, "sampling/sampling_logp_difference/max": 0.8988526225090027, "sampling/sampling_logp_difference/mean": 0.003683896572329104, "step": 17490, "step_time": 6.293514880212024 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.004296875, "completions/max_length": 913.1, "completions/max_terminated_length": 774.2, "completions/mean_length": 151.145703125, "completions/mean_terminated_length": 143.0267349243164, "completions/min_length": 70.9, "completions/min_terminated_length": 70.9, "entropy": 0.03303384769242257, "epoch": 37.47323340471092, "frac_reward_zero_std": 0.95625, "grad_norm": 0.28515625, "learning_rate": 8.250100000000001e-06, "loss": -0.0018, "num_tokens": 1696998037.0, "reward": 1.066757822036743, "reward_std": 0.13870265260338782, "rewards/reward_accuracy/mean": 0.9671875, "rewards/reward_accuracy/std": 0.137006626278162, "rewards/reward_format/mean": 0.09957031309604644, "rewards/reward_format/std": 0.0028216129168868063, "sampling/importance_sampling_ratio/max": 2.330753207206726, "sampling/importance_sampling_ratio/mean": 0.9832845330238342, "sampling/importance_sampling_ratio/min": 0.18103825822472572, "sampling/sampling_logp_difference/max": 1.035352236032486, "sampling/sampling_logp_difference/mean": 0.003559652413241565, "step": 17500, "step_time": 4.802231338585261 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00390625, "completions/max_length": 1380.3, "completions/max_terminated_length": 1019.9, "completions/mean_length": 151.68984375, "completions/mean_terminated_length": 144.25616760253905, "completions/min_length": 63.9, "completions/min_terminated_length": 63.9, "entropy": 0.03658014286775142, "epoch": 37.49464668094218, "frac_reward_zero_std": 0.90625, "grad_norm": 0.0, "learning_rate": 8.2491e-06, "loss": -0.0032, "num_tokens": 1697906859.0, "reward": 1.071191418170929, "reward_std": 0.13500199615955352, "rewards/reward_accuracy/mean": 0.971484375, "rewards/reward_accuracy/std": 0.13372941613197326, "rewards/reward_format/mean": 0.09970703199505807, "rewards/reward_format/std": 0.0024846951011568306, "sampling/importance_sampling_ratio/max": 2.360874152183533, "sampling/importance_sampling_ratio/mean": 0.9854281425476075, "sampling/importance_sampling_ratio/min": 0.08581760674715042, "sampling/sampling_logp_difference/max": 1.0961284399032594, "sampling/sampling_logp_difference/mean": 0.0038287627510726454, "step": 17510, "step_time": 6.6807689187931825 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001953125, "completions/max_length": 934.8, "completions/max_terminated_length": 889.2, "completions/mean_length": 150.673046875, "completions/mean_terminated_length": 147.07848052978517, "completions/min_length": 66.8, "completions/min_terminated_length": 66.8, "entropy": 0.03802572509739548, "epoch": 37.51605995717345, "frac_reward_zero_std": 0.91875, "grad_norm": 0.0, "learning_rate": 8.248100000000002e-06, "loss": -0.0033, "num_tokens": 1698813574.0, "reward": 1.0568164229393004, "reward_std": 0.1656462624669075, "rewards/reward_accuracy/mean": 0.95703125, "rewards/reward_accuracy/std": 0.164727533608675, "rewards/reward_format/mean": 0.09978515729308128, "rewards/reward_format/std": 0.0018966724630445242, "sampling/importance_sampling_ratio/max": 2.4545597314834593, "sampling/importance_sampling_ratio/mean": 0.9896303713321686, "sampling/importance_sampling_ratio/min": 0.04679772462695837, "sampling/sampling_logp_difference/max": 1.1055543422698975, "sampling/sampling_logp_difference/mean": 0.00386879553552717, "step": 17520, "step_time": 4.8572828588919945 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005859375, "completions/max_length": 1325.1, "completions/max_terminated_length": 1153.3, "completions/mean_length": 167.9421875, "completions/mean_terminated_length": 156.98287658691407, "completions/min_length": 66.4, "completions/min_terminated_length": 66.4, "entropy": 0.04068209687247872, "epoch": 37.53747323340471, "frac_reward_zero_std": 0.90625, "grad_norm": 0.0, "learning_rate": 8.247100000000001e-06, "loss": -0.0046, "num_tokens": 1699764290.0, "reward": 1.0597461104393004, "reward_std": 0.17782938331365586, "rewards/reward_accuracy/mean": 0.96015625, "rewards/reward_accuracy/std": 0.17635978162288665, "rewards/reward_format/mean": 0.09958984479308128, "rewards/reward_format/std": 0.0031949690310284495, "sampling/importance_sampling_ratio/max": 2.3542831540107727, "sampling/importance_sampling_ratio/mean": 0.9782058119773864, "sampling/importance_sampling_ratio/min": 0.09411680772900581, "sampling/sampling_logp_difference/max": 1.05520042181015, "sampling/sampling_logp_difference/mean": 0.00391911652404815, "step": 17530, "step_time": 6.489827591009089 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.005078125, "completions/max_length": 1625.1, "completions/max_terminated_length": 1273.7, "completions/mean_length": 161.75625, "completions/mean_terminated_length": 152.15740356445312, "completions/min_length": 67.3, "completions/min_terminated_length": 67.3, "entropy": 0.04201799901202321, "epoch": 37.558886509635975, "frac_reward_zero_std": 0.925, "grad_norm": 0.0, "learning_rate": 8.2461e-06, "loss": -0.0085, "num_tokens": 1700699570.0, "reward": 1.0594336152076722, "reward_std": 0.16968340128660203, "rewards/reward_accuracy/mean": 0.959765625, "rewards/reward_accuracy/std": 0.16839173138141633, "rewards/reward_format/mean": 0.09966797009110451, "rewards/reward_format/std": 0.0035196534357964993, "sampling/importance_sampling_ratio/max": 2.5293297171592712, "sampling/importance_sampling_ratio/mean": 0.9793931126594544, "sampling/importance_sampling_ratio/min": 0.02397715747356415, "sampling/sampling_logp_difference/max": 1.0145317256450652, "sampling/sampling_logp_difference/mean": 0.004261690657585859, "step": 17540, "step_time": 8.042706457703025 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.002734375, "completions/max_length": 1265.4, "completions/max_terminated_length": 792.5, "completions/mean_length": 158.54375, "completions/mean_terminated_length": 153.37235794067382, "completions/min_length": 64.8, "completions/min_terminated_length": 64.8, "entropy": 0.038389927614480256, "epoch": 37.58029978586724, "frac_reward_zero_std": 0.925, "grad_norm": 0.0, "learning_rate": 8.2451e-06, "loss": -0.006, "num_tokens": 1701624290.0, "reward": 1.0743359684944154, "reward_std": 0.11632372885942459, "rewards/reward_accuracy/mean": 0.974609375, "rewards/reward_accuracy/std": 0.11417244896292686, "rewards/reward_format/mean": 0.09972656443715096, "rewards/reward_format/std": 0.003639297466725111, "sampling/importance_sampling_ratio/max": 2.6223907709121703, "sampling/importance_sampling_ratio/mean": 0.9890406727790833, "sampling/importance_sampling_ratio/min": 0.11325459443032741, "sampling/sampling_logp_difference/max": 1.0148925185203552, "sampling/sampling_logp_difference/mean": 0.003962356713600457, "step": 17550, "step_time": 6.070903620988247 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001953125, "completions/max_length": 1319.2, "completions/max_terminated_length": 1118.9, "completions/mean_length": 161.4671875, "completions/mean_terminated_length": 157.827490234375, "completions/min_length": 66.5, "completions/min_terminated_length": 66.5, "entropy": 0.03893483632709831, "epoch": 37.601713062098504, "frac_reward_zero_std": 0.89375, "grad_norm": 0.224609375, "learning_rate": 8.244100000000001e-06, "loss": -0.0081, "num_tokens": 1702565838.0, "reward": 1.0740234494209289, "reward_std": 0.12384951785206795, "rewards/reward_accuracy/mean": 0.97421875, "rewards/reward_accuracy/std": 0.12286588475108147, "rewards/reward_format/mean": 0.09980468824505806, "rewards/reward_format/std": 0.002517323032952845, "sampling/importance_sampling_ratio/max": 2.469354033470154, "sampling/importance_sampling_ratio/mean": 0.9738376438617706, "sampling/importance_sampling_ratio/min": 0.06739170104265213, "sampling/sampling_logp_difference/max": 1.0840649127960205, "sampling/sampling_logp_difference/mean": 0.0038587091723456977, "step": 17560, "step_time": 6.451433533296222 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00078125, "completions/max_length": 896.1, "completions/max_terminated_length": 844.4, "completions/mean_length": 140.837890625, "completions/mean_terminated_length": 139.36135864257812, "completions/min_length": 69.0, "completions/min_terminated_length": 69.0, "entropy": 0.03316546860150993, "epoch": 37.62312633832976, "frac_reward_zero_std": 0.975, "grad_norm": 0.0, "learning_rate": 8.2431e-06, "loss": -0.0002, "num_tokens": 1703445807.0, "reward": 1.092089867591858, "reward_std": 0.04188975393772125, "rewards/reward_accuracy/mean": 0.9921875, "rewards/reward_accuracy/std": 0.041286345571279526, "rewards/reward_format/mean": 0.09990234524011612, "rewards/reward_format/std": 0.0011641392018646001, "sampling/importance_sampling_ratio/max": 2.2464167952537535, "sampling/importance_sampling_ratio/mean": 0.9894795656204224, "sampling/importance_sampling_ratio/min": 0.25715187937021255, "sampling/sampling_logp_difference/max": 1.0376676797866822, "sampling/sampling_logp_difference/mean": 0.003511449717916548, "step": 17570, "step_time": 4.461859550283407 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.001171875, "completions/max_length": 1272.0, "completions/max_terminated_length": 1072.6, "completions/mean_length": 148.921875, "completions/mean_terminated_length": 146.72902069091796, "completions/min_length": 66.7, "completions/min_terminated_length": 66.7, "entropy": 0.03494768962264061, "epoch": 37.644539614561026, "frac_reward_zero_std": 0.9375, "grad_norm": 0.0, "learning_rate": 8.2421e-06, "loss": -0.008, "num_tokens": 1704350759.0, "reward": 1.079980492591858, "reward_std": 0.09155199080705642, "rewards/reward_accuracy/mean": 0.980078125, "rewards/reward_accuracy/std": 0.09134184867143631, "rewards/reward_format/mean": 0.09990234449505805, "rewards/reward_format/std": 0.0013785743853077293, "sampling/importance_sampling_ratio/max": 2.512464451789856, "sampling/importance_sampling_ratio/mean": 0.9961632430553437, "sampling/importance_sampling_ratio/min": 0.21888627260923385, "sampling/sampling_logp_difference/max": 0.9454879879951477, "sampling/sampling_logp_difference/mean": 0.003756726742722094, "step": 17580, "step_time": 6.094791550192167 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.00078125, "completions/max_length": 1332.5, "completions/max_terminated_length": 1235.8, "completions/mean_length": 147.626953125, "completions/mean_terminated_length": 146.1437545776367, "completions/min_length": 63.2, "completions/min_terminated_length": 63.2, "entropy": 0.037303766678087415, "epoch": 37.66595289079229, "frac_reward_zero_std": 0.93125, "grad_norm": 0.4765625, "learning_rate": 8.241100000000001e-06, "loss": -0.0062, "num_tokens": 1705247292.0, "reward": 1.0773046970367433, "reward_std": 0.11238493174314498, "rewards/reward_accuracy/mean": 0.97734375, "rewards/reward_accuracy/std": 0.11213328838348388, "rewards/reward_format/mean": 0.09996093809604645, "rewards/reward_format/std": 0.0006250000093132258, "sampling/importance_sampling_ratio/max": 2.4234738111495973, "sampling/importance_sampling_ratio/mean": 0.9964311003684998, "sampling/importance_sampling_ratio/min": 0.208051417209208, "sampling/sampling_logp_difference/max": 1.028080689907074, "sampling/sampling_logp_difference/mean": 0.003887193859554827, "step": 17590, "step_time": 6.206715631714905 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 2.5220654606528113e-06, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 2.5220654606528113e-06, "completions/clipped_ratio": 0.0046875, "completions/max_length": 751.6, "completions/max_terminated_length": 703.5, "completions/mean_length": 142.525390625, "completions/mean_terminated_length": 133.59263916015624, "completions/min_length": 61.5, "completions/min_terminated_length": 61.5, "entropy": 0.03331611452158541, "epoch": 37.687366167023555, "frac_reward_zero_std": 0.9625, "grad_norm": 0.0, "learning_rate": 8.240100000000001e-06, "loss": -0.0037, "num_tokens": 1706128701.0, "reward": 1.0822265863418579, "reward_std": 0.08399968072772027, "rewards/reward_accuracy/mean": 0.982421875, "rewards/reward_accuracy/std": 0.08317572697997093, "rewards/reward_format/mean": 0.09980468899011612, "rewards/reward_format/std": 0.0015914240153506397, "sampling/importance_sampling_ratio/max": 2.4252561211585997, "sampling/importance_sampling_ratio/mean": 0.983253824710846, "sampling/importance_sampling_ratio/min": 0.17534216698259114, "sampling/sampling_logp_difference/max": 0.9268244326114654, "sampling/sampling_logp_difference/mean": 0.0035243292804807425, "step": 17600, "step_time": 4.112977161808521 } ], "logging_steps": 10, "max_steps": 100000, "num_input_tokens_seen": 1706128701, "num_train_epochs": 215, "save_steps": 100, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 0.0, "train_batch_size": 4, "trial_name": null, "trial_params": null }